Omejitve in stanje
Vsak zahtevek se obravnava enako. Brez stopenj hitrosti. Brez ločene kvote API. Tokene ste že plačali – porabljajte jih tako hitro, kot želite.
Ta stran pojasnjuje, iz česa je sestavljeno vaše stanje, kaj en zahtevek rezervira in koliko stane, koliko zahtevkov lahko pošljete in nekaj omejitev, na katere lahko naleti posamezen zahtevek.
- vrednost 1M tokenov stanja
- $5.00
- dnevna kvota se obnovi
- 00:00 UTC
- zaščita pred poplavo, na račun
- 120 zahtevkov / min
Kako se zahtevki obravnavajo
- Brez stopenj hitrosti — Eno pravilo omejuje, kako hitro lahko zahtevki prihajajo, in je enako za vsak račun in vsak paket: 120 zahtevkov na minuto. Omejitve tokenov na minuto ni.
- Brez ločene kvote API — API porablja isto stanje kot klepet. Paket določa velikost današnje dnevne kvote. Ne določa hitrosti zahtevkov.
- Tako hitro, kot želite — Zahtevki, poslani vzporedno, so sprejeti in čakajo v vrsti. Niso zavrnjeni zaradi vzporednosti.
Vaše stanje
Vaše stanje se šteje v tokenih. 1,000,000 tokenov stanja je vredno $5.00, vsaka cena na strani Models & pricing pa je razmerje do te vrednosti.
V vsakem trenutku je stanje vsota dveh delov.
- Današnja dnevna kvota paketa — Število tokenov, ki ga določa vaš paket. Obnovi se vsak dan ob 00:00 UTC. Kar ostane ob koncu dneva, se ne prenese.
- Kupljeni kredit — Tokeni, ki ste jih kupili kot komplet. Kredit ne poteče in deluje v vsakem paketu, tudi v paketu Free.
| Paket | Tokeni na dan | Vredno |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Vrstni red porabe — Vsak zahtevek najprej porabi današnjo dnevno kvoto paketa. Kupljeni kredit se uporabi samo za tisto, kar presega kvoto tega dne.
- Klepet in API ga delita — Na račun je eno stanje. API ključ porablja iz stanja računa, ki ga ima v lasti, po enakih cenah kot klepet.
- Kompleti — Kredit se prodaja v kompletih po 1,000,000 ($5.00), 2,000,000 ($10.00) in 5,000,000 ($25.00) tokenov ali kot znesek po vaši izbiri od 1,000,000 do 100,000,000 tokenov po $5.00 za 1,000,000.
Dopolnilo kreditov Spremeni načrt
Kaj zahtevek rezervira in koliko stane
- Rezervacija — Ko zahtevek prispe, z vašega stanja rezervira svoj izhodni proračun:
max_tokensna/v1/chat/completionsin/v1/messages,max_output_tokensna/v1/responses./v1/chat/completionsprebere tudimax_completion_tokens. Privzeta vrednost je 4,096, razpon pa od 1 do 65,536. - Sprejem — Zahtevek je sprejet samo, če se rezervacija prilega v to, kar je ostalo od vašega stanja. Stanje, ki je nad nič, vendar manjše od izhodnega proračuna, dobi odgovor
Quota exceeded. Pošljite manjšimax_tokens, da porabite preostanek. - Poravnava — Ko je odgovor popoln, se rezervacija nadomesti z dejanskim obračunom. Obračun je lahko nižji ali višji od rezervacije.
- Vračilo — Zahtevek, ki se konča s statusom napake, svojo rezervacijo vrne v celoti.
Dejanski obračun je odvisen od družine modela.
| Modeli | Kaj se obračuna |
|---|---|
| Modeli Shannon | usage.total_tokens po ceni modela za 1M. Vhod in izhod imata eno ceno. |
| Gostovani modeli z odprtimi utežmi | Nepredpomnjen vhod po vhodni ceni, predpomnjen vhod po predpomnjeni ceni, izhod po izhodni ceni. |
Znesek v USD se z vašega stanja v tokenih odšteje po $5.00 za 1,000,000, zaokrožen na celoten token.
Štetje tokenov s POST /v1/tokenize ali POST /v1/messages/count_tokens je brezplačno in ničesar ne rezervira. Štetje tokenov
Kje videti stanje in porabo
Stran Ključi in poraba prikazuje, kaj lahko porabite zdaj, današnjo dnevno kvoto paketa, kupljeni kredit in porabo API v zadnjih 30 dneh. Pod tem našteva vsak zahtevek, ki ga je naredil vaš ključ: čas, končno točko, model, predpomnjen vhod, obračunane tokene in strošek. Ključi in poraba
Vsak odgovor vsebuje tudi objekt usage s števili tokenov tistega klica.
| Končni točka (Endpoint) | Polja v usage | Dodajo gostovani modeli z odprtimi utežmi |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagevsebuje števila tokenov modela. Znesek, odštet z vašega stanja, ni v odgovoru: je stolpec Billed tokens na seznamu zahtevkov na strani Ključi in poraba.- Na
/v1/messagesz gostovanim modelom z odprtimi utežmi jeinput_tokensnepredpomnjeni del vhoda,cache_read_input_tokensje predpomnjeni del,cache_creation_input_tokenspa je vedno0. - Tok na
/v1/chat/completionsnosiusagev zadnjem kosu pred[DONE]. Pretakanje
Ko se stanje izčrpa
Na zahtevek, katerega rezervacija se ne prilega v vaše stanje, se odgovori s statusom 429, tipom rate_limit_error in spodnjim sporočilom. Nič se ne obračuna. Enak odgovor se pošlje, ko je stanje nad nič, vendar manjše od izhodnega proračuna zahtevka.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Na /v1/responses lahko objekt error vsebuje tudi code in param, oba null.
Kaj lahko storite:
- Počakajte na naslednjo dnevno kvoto paketa ob 00:00 UTC.
- Dopolnite kredit. Kredit se porabi po dnevni kvoti paketa in ne poteče. Dopolnilo kreditov
- Preklopite na paket z večjo dnevno kvoto. Spremeni načrt
- Pošljite manjši
max_tokens, če je še ostalo nekaj stanja: rezervacija je potem manjša.
Kvota klicev Shannon Coder
shannon-coder-1 na /v1/chat/completions in /v1/messages se šteje v klicih, ne v tokenih. Vsak paket vključuje določeno število klicev na 4-urno okno. En zahtevek je en klic.
| Paket | Klici na 4-urno okno |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Okna se začnejo ob 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Klici, ki ostanejo ob koncu okna, se ne prenesejo.
- Klic se šteje, ko je zahtevek sprejet, preden model odgovori. Zahtevek, ki pozneje odpove, se še vedno šteje kot klic.
- Ti klici ne rezervirajo tokenov in ne vzamejo ničesar z vašega stanja. Seznam zahtevkov na strani Ključi in poraba prikazuje njihovo število tokenov in vrednost po navedeni ceni.
- Privzeti
max_tokenszashannon-coder-1na teh dveh končnih točkah je 65,536. - Ko klicev ni več, je odgovor status
429, tiprate_limit_error, sporočiloShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Na
/v1/responsesshannon-coder-1nima kvote klicev: obračuna se v tokenih z vašega stanja po $8.00 za 1M, kot vsak drug model.
Zaščita pred poplavo
Račun lahko pošlje 120 zahtevkov na minuto. To je edina omejitev hitrosti zahtevkov in je enaka v vsakem paketu. Obstaja zato, da prepreči poplave, ne da bi upočasnila običajno uporabo.
- Minuta je fiksno okno 60 sekund, ki se odpre z vašim prvim zahtevkom. Ko se konča, se štetje začne znova pri nič.
- Štetje je na račun, ne na ključ in ne na naslov IP. Zamenjava ključa ne odpre novega okna.
- Na 121. zahtevek znotraj okna se odgovori s statusom
429, tipomrate_limit_errorin sporočilomToo many requests. Retry in <N>s.Nje število sekund do konca okna, od 1 do 60. - Zaščita pred poplavo se preveri pred stanjem. Zahtevek, ki ga zavrne, ničesar ne rezervira in nič ne stane.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Zahtevek | Zaščita pred poplavo |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Šteje se, eden na zahtevek. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Ne šteje se. |
shannon-coder-1 na /v1/chat/completions in /v1/messages | Namesto tega se šteje s kvoto klicev Shannon Coder. |
Zahtevek, na katerega je odgovorjeno z 401 ali s 400 zaradi neznanega model | Ne šteje se. |
| Zahtevek, ki ga je zavrnila zaščita pred poplavo | Šteje se v okno. Nič se ne obračuna. |
Vzporedni zahtevki
Ni omejitve, koliko zahtevkov ima račun hkrati odprtih, in ni napake za vzporedno pošiljanje zahtevkov. Zahtevki, ki se ne morejo začeti takoj, čakajo v vrsti in so obravnavani po vrsti.
- Vsak zahtevek se všteje v 120 na minuto, ko prispe, ne glede na to, ali so se prejšnji zahtevki že končali.
- Vsak zahtevek drži svojo rezervacijo, dokler se ne konča. Dvajset odprtih zahtevkov s privzetim izhodnim proračunom drži 20 × 4,096 = 81,920 tokenov stanja. Če so rezervacije skupaj večje od vašega stanja, naslednji zahtevek dobi odgovor
Quota exceeded, čeprav bi končani klici stali manj. Manjšimax_tokensdrži manj. - Zahtevek brez pretakanja ne pošlje ničesar, dokler odgovor ni popoln, zato odjemalcu nastavite časovno omejitev, ki zajame čakanje. Tok med čakanjem ohranja povezavo odprto. Pretakanje
Omejitve posameznega zahtevka
| Omejitev | Vrednost | Velja za | Pri omejitvi |
|---|---|---|---|
| Telo zahtevka | 32 MiB (33,554,432 bajtov) | Vsaka končna točka | Status 413, tip invalid_request_error. |
Izhodni proračun: max_tokens, max_completion_tokens, max_output_tokens | Od 1 do 65,536. Privzeto 4,096; za shannon-coder-1 na /v1/chat/completions in /v1/messages je privzeto 65,536. | Vsak model, kot znesek, rezerviran z vašega stanja. Kot omejitev dolžine odgovora: gostovani modeli z odprtimi utežmi, shannon-1.6-lite, shannon-1.6-pro in shannon-coder-1. | Vrednost zunaj razpona se premakne na najbližji konec razpona. Brez napake. |
Zaporedja za ustavitev: stop, stop_sequences | 4 nizi | Gostovani modeli z odprtimi utežmi | Uporabljeni so prvi 4 neprazni nizi. |
| Slika ali datoteka, podana kot URL | 8 MiB, prebrano v 20 sekundah, največ 5 preusmeritev, javni naslov http ali https | Vsaka končna točka, ki sprejema slike ali datoteke | Na zahtevek se odgovori brez tistega dela. Brez napake. |
| Slika ali datoteka, poslana vstavljena (base64) | Brez lastne omejitve. Šteje se v 32 MiB telesa zahtevka. | Vsaka končna točka, ki sprejema slike ali datoteke | Status 413 za celoten zahtevek. |
text v POST /v1/tokenize | 4,000,000 bajtov | /v1/tokenize | Status 413, tip invalid_request_error, sporočilo text too long. |
messages v POST /v1/tokenize in telo POST /v1/messages/count_tokens | Telo zahtevka 32 MiB | Obe končni točki za štetje | Status 413. |
| Kontekstno okno | Po modelu: context_window v GET /v1/models | Vsak model | Kaj se zgodi z daljšim pogovorom, je odvisno od modela. Modeli in cene |
Spletna iskanja (web_search: true) | Na paket in dan: Free 3, Plus 30, Standard 50, Pro 60. Eno iskanje se šteje za zahtevek, pri katerem je iskanje našlo rezultate. | Zahtevki, ki nastavijo web_search: true | Ko iskanj ni več, se na zahtevek odgovori brez iskanja. Brez napake. Vgrajeno spletno iskanje |
Napake
Odgovori s te strani. Na /v1/messages je isti objekt error ovit kot {"type": "error", "error": {…}}.
| Stanje | Vrsta | Sporočilo | Kdaj in kaj storiti |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezervacija zahtevka se ne prilega v vaše stanje. Počakajte do 00:00 UTC, dopolnite kredit, zamenjajte paket ali pošljite manjši max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Več kot 120 zahtevkov v tekoči minuti. Počakajte N sekund in pošljite znova. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Klici Shannon Coder v trenutnem 4-urnem oknu so porabljeni. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model v tem trenutku ne more sprejeti zahtevka. Po kratkem premoru ga pošljite znova. |
503 | api_error | Could not verify your quota right now. Please retry. | Vašega stanja ni bilo mogoče prebrati. Nič se ne obračuna; zahtevek pošljite znova. Na /v1/responses z modelom Shannon je status 500. |
413 | invalid_request_error | Telo zahtevka je večje od 32 MiB. Na končnih točkah v formatu OpenAI objekt error vsebuje code: "request_too_large". | |
413 | invalid_request_error | text too long | text v POST /v1/tokenize je daljši od 4,000,000 bajtov. |