Preskoči na vsebino
Omejitve in stanje

Omejitve in stanje

Vsak zahtevek se obravnava enako. Brez stopenj hitrosti. Brez ločene kvote API. Tokene ste že plačali – porabljajte jih tako hitro, kot želite.

Ta stran pojasnjuje, iz česa je sestavljeno vaše stanje, kaj en zahtevek rezervira in koliko stane, koliko zahtevkov lahko pošljete in nekaj omejitev, na katere lahko naleti posamezen zahtevek.

vrednost 1M tokenov stanja
$5.00
dnevna kvota se obnovi
00:00 UTC
zaščita pred poplavo, na račun
120 zahtevkov / min

Kako se zahtevki obravnavajo

  • Brez stopenj hitrosti — Eno pravilo omejuje, kako hitro lahko zahtevki prihajajo, in je enako za vsak račun in vsak paket: 120 zahtevkov na minuto. Omejitve tokenov na minuto ni.
  • Brez ločene kvote API — API porablja isto stanje kot klepet. Paket določa velikost današnje dnevne kvote. Ne določa hitrosti zahtevkov.
  • Tako hitro, kot želite — Zahtevki, poslani vzporedno, so sprejeti in čakajo v vrsti. Niso zavrnjeni zaradi vzporednosti.

Vaše stanje

Vaše stanje se šteje v tokenih. 1,000,000 tokenov stanja je vredno $5.00, vsaka cena na strani Models & pricing pa je razmerje do te vrednosti.

V vsakem trenutku je stanje vsota dveh delov.

  • Današnja dnevna kvota paketa — Število tokenov, ki ga določa vaš paket. Obnovi se vsak dan ob 00:00 UTC. Kar ostane ob koncu dneva, se ne prenese.
  • Kupljeni kredit — Tokeni, ki ste jih kupili kot komplet. Kredit ne poteče in deluje v vsakem paketu, tudi v paketu Free.
Paket Tokeni na dan Vredno
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Vrstni red porabe — Vsak zahtevek najprej porabi današnjo dnevno kvoto paketa. Kupljeni kredit se uporabi samo za tisto, kar presega kvoto tega dne.
  • Klepet in API ga delita — Na račun je eno stanje. API ključ porablja iz stanja računa, ki ga ima v lasti, po enakih cenah kot klepet.
  • Kompleti — Kredit se prodaja v kompletih po 1,000,000 ($5.00), 2,000,000 ($10.00) in 5,000,000 ($25.00) tokenov ali kot znesek po vaši izbiri od 1,000,000 do 100,000,000 tokenov po $5.00 za 1,000,000.

Dopolnilo kreditov Spremeni načrt

Kaj zahtevek rezervira in koliko stane

  • Rezervacija — Ko zahtevek prispe, z vašega stanja rezervira svoj izhodni proračun: max_tokens na /v1/chat/completions in /v1/messages, max_output_tokens na /v1/responses. /v1/chat/completions prebere tudi max_completion_tokens. Privzeta vrednost je 4,096, razpon pa od 1 do 65,536.
  • Sprejem — Zahtevek je sprejet samo, če se rezervacija prilega v to, kar je ostalo od vašega stanja. Stanje, ki je nad nič, vendar manjše od izhodnega proračuna, dobi odgovor Quota exceeded. Pošljite manjši max_tokens, da porabite preostanek.
  • Poravnava — Ko je odgovor popoln, se rezervacija nadomesti z dejanskim obračunom. Obračun je lahko nižji ali višji od rezervacije.
  • Vračilo — Zahtevek, ki se konča s statusom napake, svojo rezervacijo vrne v celoti.

Dejanski obračun je odvisen od družine modela.

Modeli Kaj se obračuna
Modeli Shannon usage.total_tokens po ceni modela za 1M. Vhod in izhod imata eno ceno.
Gostovani modeli z odprtimi utežmi Nepredpomnjen vhod po vhodni ceni, predpomnjen vhod po predpomnjeni ceni, izhod po izhodni ceni.

Znesek v USD se z vašega stanja v tokenih odšteje po $5.00 za 1,000,000, zaokrožen na celoten token.

Štetje tokenov s POST /v1/tokenize ali POST /v1/messages/count_tokens je brezplačno in ničesar ne rezervira. Štetje tokenov

Kje videti stanje in porabo

Stran Ključi in poraba prikazuje, kaj lahko porabite zdaj, današnjo dnevno kvoto paketa, kupljeni kredit in porabo API v zadnjih 30 dneh. Pod tem našteva vsak zahtevek, ki ga je naredil vaš ključ: čas, končno točko, model, predpomnjen vhod, obračunane tokene in strošek. Ključi in poraba

Vsak odgovor vsebuje tudi objekt usage s števili tokenov tistega klica.

Končni točka (Endpoint) Polja v usage Dodajo gostovani modeli z odprtimi utežmi
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage vsebuje števila tokenov modela. Znesek, odštet z vašega stanja, ni v odgovoru: je stolpec Billed tokens na seznamu zahtevkov na strani Ključi in poraba.
  • Na /v1/messages z gostovanim modelom z odprtimi utežmi je input_tokens nepredpomnjeni del vhoda, cache_read_input_tokens je predpomnjeni del, cache_creation_input_tokens pa je vedno 0.
  • Tok na /v1/chat/completions nosi usage v zadnjem kosu pred [DONE]. Pretakanje

Ko se stanje izčrpa

Na zahtevek, katerega rezervacija se ne prilega v vaše stanje, se odgovori s statusom 429, tipom rate_limit_error in spodnjim sporočilom. Nič se ne obračuna. Enak odgovor se pošlje, ko je stanje nad nič, vendar manjše od izhodnega proračuna zahtevka.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Na /v1/responses lahko objekt error vsebuje tudi code in param, oba null.

Kaj lahko storite:

  • Počakajte na naslednjo dnevno kvoto paketa ob 00:00 UTC.
  • Dopolnite kredit. Kredit se porabi po dnevni kvoti paketa in ne poteče. Dopolnilo kreditov
  • Preklopite na paket z večjo dnevno kvoto. Spremeni načrt
  • Pošljite manjši max_tokens, če je še ostalo nekaj stanja: rezervacija je potem manjša.

Kvota klicev Shannon Coder

shannon-coder-1 na /v1/chat/completions in /v1/messages se šteje v klicih, ne v tokenih. Vsak paket vključuje določeno število klicev na 4-urno okno. En zahtevek je en klic.

Paket Klici na 4-urno okno
Free 3
Plus 20
Standard 40
Pro 60
  • Okna se začnejo ob 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Klici, ki ostanejo ob koncu okna, se ne prenesejo.
  • Klic se šteje, ko je zahtevek sprejet, preden model odgovori. Zahtevek, ki pozneje odpove, se še vedno šteje kot klic.
  • Ti klici ne rezervirajo tokenov in ne vzamejo ničesar z vašega stanja. Seznam zahtevkov na strani Ključi in poraba prikazuje njihovo število tokenov in vrednost po navedeni ceni.
  • Privzeti max_tokens za shannon-coder-1 na teh dveh končnih točkah je 65,536.
  • Ko klicev ni več, je odgovor status 429, tip rate_limit_error, sporočilo Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Na /v1/responses shannon-coder-1 nima kvote klicev: obračuna se v tokenih z vašega stanja po $8.00 za 1M, kot vsak drug model.

Zaščita pred poplavo

Račun lahko pošlje 120 zahtevkov na minuto. To je edina omejitev hitrosti zahtevkov in je enaka v vsakem paketu. Obstaja zato, da prepreči poplave, ne da bi upočasnila običajno uporabo.

  • Minuta je fiksno okno 60 sekund, ki se odpre z vašim prvim zahtevkom. Ko se konča, se štetje začne znova pri nič.
  • Štetje je na račun, ne na ključ in ne na naslov IP. Zamenjava ključa ne odpre novega okna.
  • Na 121. zahtevek znotraj okna se odgovori s statusom 429, tipom rate_limit_error in sporočilom Too many requests. Retry in <N>s. N je število sekund do konca okna, od 1 do 60.
  • Zaščita pred poplavo se preveri pred stanjem. Zahtevek, ki ga zavrne, ničesar ne rezervira in nič ne stane.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Zahtevek Zaščita pred poplavo
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Šteje se, eden na zahtevek.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Ne šteje se.
shannon-coder-1 na /v1/chat/completions in /v1/messages Namesto tega se šteje s kvoto klicev Shannon Coder.
Zahtevek, na katerega je odgovorjeno z 401 ali s 400 zaradi neznanega model Ne šteje se.
Zahtevek, ki ga je zavrnila zaščita pred poplavo Šteje se v okno. Nič se ne obračuna.

Vzporedni zahtevki

Ni omejitve, koliko zahtevkov ima račun hkrati odprtih, in ni napake za vzporedno pošiljanje zahtevkov. Zahtevki, ki se ne morejo začeti takoj, čakajo v vrsti in so obravnavani po vrsti.

  • Vsak zahtevek se všteje v 120 na minuto, ko prispe, ne glede na to, ali so se prejšnji zahtevki že končali.
  • Vsak zahtevek drži svojo rezervacijo, dokler se ne konča. Dvajset odprtih zahtevkov s privzetim izhodnim proračunom drži 20 × 4,096 = 81,920 tokenov stanja. Če so rezervacije skupaj večje od vašega stanja, naslednji zahtevek dobi odgovor Quota exceeded, čeprav bi končani klici stali manj. Manjši max_tokens drži manj.
  • Zahtevek brez pretakanja ne pošlje ničesar, dokler odgovor ni popoln, zato odjemalcu nastavite časovno omejitev, ki zajame čakanje. Tok med čakanjem ohranja povezavo odprto. Pretakanje

Omejitve posameznega zahtevka

Omejitev Vrednost Velja za Pri omejitvi
Telo zahtevka 32 MiB (33,554,432 bajtov) Vsaka končna točka Status 413, tip invalid_request_error.
Izhodni proračun: max_tokens, max_completion_tokens, max_output_tokens Od 1 do 65,536. Privzeto 4,096; za shannon-coder-1 na /v1/chat/completions in /v1/messages je privzeto 65,536. Vsak model, kot znesek, rezerviran z vašega stanja. Kot omejitev dolžine odgovora: gostovani modeli z odprtimi utežmi, shannon-1.6-lite, shannon-1.6-pro in shannon-coder-1. Vrednost zunaj razpona se premakne na najbližji konec razpona. Brez napake.
Zaporedja za ustavitev: stop, stop_sequences 4 nizi Gostovani modeli z odprtimi utežmi Uporabljeni so prvi 4 neprazni nizi.
Slika ali datoteka, podana kot URL 8 MiB, prebrano v 20 sekundah, največ 5 preusmeritev, javni naslov http ali https Vsaka končna točka, ki sprejema slike ali datoteke Na zahtevek se odgovori brez tistega dela. Brez napake.
Slika ali datoteka, poslana vstavljena (base64) Brez lastne omejitve. Šteje se v 32 MiB telesa zahtevka. Vsaka končna točka, ki sprejema slike ali datoteke Status 413 za celoten zahtevek.
text v POST /v1/tokenize 4,000,000 bajtov /v1/tokenize Status 413, tip invalid_request_error, sporočilo text too long.
messages v POST /v1/tokenize in telo POST /v1/messages/count_tokens Telo zahtevka 32 MiB Obe končni točki za štetje Status 413.
Kontekstno okno Po modelu: context_window v GET /v1/models Vsak model Kaj se zgodi z daljšim pogovorom, je odvisno od modela. Modeli in cene
Spletna iskanja (web_search: true) Na paket in dan: Free 3, Plus 30, Standard 50, Pro 60. Eno iskanje se šteje za zahtevek, pri katerem je iskanje našlo rezultate. Zahtevki, ki nastavijo web_search: true Ko iskanj ni več, se na zahtevek odgovori brez iskanja. Brez napake. Vgrajeno spletno iskanje

Napake

Odgovori s te strani. Na /v1/messages je isti objekt error ovit kot {"type": "error", "error": {…}}.

Stanje Vrsta Sporočilo Kdaj in kaj storiti
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervacija zahtevka se ne prilega v vaše stanje. Počakajte do 00:00 UTC, dopolnite kredit, zamenjajte paket ali pošljite manjši max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Več kot 120 zahtevkov v tekoči minuti. Počakajte N sekund in pošljite znova.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Klici Shannon Coder v trenutnem 4-urnem oknu so porabljeni.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model v tem trenutku ne more sprejeti zahtevka. Po kratkem premoru ga pošljite znova.
503 api_error Could not verify your quota right now. Please retry. Vašega stanja ni bilo mogoče prebrati. Nič se ne obračuna; zahtevek pošljite znova. Na /v1/responses z modelom Shannon je status 500.
413 invalid_request_error Telo zahtevka je večje od 32 MiB. Na končnih točkah v formatu OpenAI objekt error vsebuje code: "request_too_large".
413 invalid_request_error text too long text v POST /v1/tokenize je daljši od 4,000,000 bajtov.