Limity a zostatok
Každý request sa obsluhuje rovnako. Žiadne cenové pásma rýchlosti. Žiadna samostatná kvóta API. Svoje tokeny ste už zaplatili — využite ich tak rýchlo, ako chcete.
Táto stránka vysvetľuje, z čoho sa skladá váš zostatok, čo jeden request rezervuje a koľko stojí, koľko requestov môžete poslať a niekoľko limitov, na ktoré môže naraziť jednotlivý request.
- hodnota 1M tokenov zostatku
- $5.00
- denný limit sa obnovuje
- 00:00 UTC
- ochrana pred zahltením, na účet
- 120 requestov / min
Ako sa requesty obsluhujú
- Žiadne cenové pásma rýchlosti — Jedno pravidlo obmedzuje, ako rýchlo môžu requesty prichádzať, a je rovnaké pre každý účet a každý plán: 120 requestov za minútu. Počet tokenov za minútu nie je obmedzený.
- Žiadna samostatná kvóta API — API míňa ten istý zostatok ako chat. Plán určuje veľkosť dnešného limitu. Neurčuje frekvenciu requestov.
- Tak rýchlo, ako chcete — Requesty poslané paralelne sa prijmú a čakajú v rade. Nie sú odmietnuté len preto, že sú paralelné.
Váš zostatok
Váš zostatok sa počíta v tokenoch. 1,000,000 tokenov zostatku má hodnotu $5.00 a každá cena na stránke Modely a ceny je sadzba voči tejto hodnote.
Zostatok je v každom okamihu súčtom dvoch častí.
- Dnešný limit plánu — Počet tokenov určený vaším plánom. Každý deň o 00:00 UTC sa obnoví. To, čo zostane na konci dňa, sa neprenáša.
- Zakúpené kredity — Tokeny, ktoré ste kúpili ako balík. Kredit neexpiruje a funguje na každom pláne vrátane Free.
| Plán | Tokeny za deň | Hodnota |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Poradie míňania — Každý request míňa najprv dnešný limit plánu. Zakúpený kredit sa použije len na to, čo v ten deň presiahne limit.
- Chat a API ho zdieľajú — Na účet pripadá jeden zostatok. API kľúč míňa zo zostatku účtu, ktorý ho vlastní, za rovnaké ceny ako chat.
- Balíky — Kredit sa predáva v balíkoch po 1,000,000 ($5.00), 2,000,000 ($10.00) a 5,000,000 ($25.00) tokenov alebo ako vami zvolená suma od 1,000,000 do 100,000,000 tokenov za $5.00 na 1,000,000.
Čo request rezervuje a koľko stojí
- Rezervácia — Keď request príde, rezervuje si zo zostatku svoj výstupný rozpočet:
max_tokensna/v1/chat/completionsa/v1/messages,max_output_tokensna/v1/responses./v1/chat/completionsčíta ajmax_completion_tokens. Predvolená hodnota je 4,096 a rozsah je 1 až 65,536. - Prijatie — Request sa prijme, len ak sa rezervácia zmestí do zostatku. Zostatok nad nulou, ale menší než výstupný rozpočet, dostane odpoveď
Quota exceeded. Pošlite menšiemax_tokens, aby ste využili zvyšok. - Vyrovnanie — Keď je odpoveď úplná, rezervácia sa nahradí skutočným poplatkom. Poplatok môže byť nižší aj vyšší než rezervácia.
- Vrátenie — Request, ktorý skončí chybovým statusom, vráti svoju rezerváciu v plnej výške.
Skutočné účtovanie závisí od rodiny modelu.
| Modely | Čo sa účtuje |
|---|---|
| Modely Shannon | usage.total_tokens za cenu modelu na 1M. Vstup a výstup majú jednu sadzbu. |
| Hostované open-weight modely | Necachovaný vstup za sadzbu vstupu, cachovaný vstup za cachovanú sadzbu, výstup za sadzbu výstupu. |
Suma v USD sa odpočíta z vášho zostatku v tokenoch pri $5.00 na 1,000,000, zaokrúhlená na celý token.
Počítanie tokenov cez POST /v1/tokenize alebo POST /v1/messages/count_tokens je zadarmo a nič nerezervuje. Počítanie tokenov
Kde vidieť zostatok a využitie
Stránka Kľúče a využitie ukazuje, koľko môžete minúť práve teraz, dnešný limit plánu, zakúpený kredit a výdavky na API za posledných 30 dní. Pod tým uvádza každý request vášho kľúča: čas, endpoint, model, cachovaný vstup, fakturované tokeny a cenu. Kľúče a využitie
Každá odpoveď nesie aj objekt usage s počtami tokenov daného volania.
| Endpoint | Polia usage | Pridávajú hostované open-weight modely |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageobsahuje počty tokenov modelu. Suma odpočítaná zo zostatku v odpovedi nie je: je v stĺpci Fakturované tokeny v zozname requestov na stránke Kľúče a využitie.- Na
/v1/messagess hostovaným open-weight modelom jeinput_tokensnecachovaná časť vstupu,cache_read_input_tokensje cachovaná časť acache_creation_input_tokensje vždy0. - Stream na
/v1/chat/completionsnesieusagevo svojom poslednom chunku pred[DONE]. Streamovanie
Keď sa zostatok minie
Request, ktorého rezervácia sa nezmestí do zostatku, dostane odpoveď so statusom 429, typom rate_limit_error a správou nižšie. Nič sa neúčtuje. Rovnaká odpoveď sa pošle, keď je zostatok nad nulou, ale menší než výstupný rozpočet requestu.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Na /v1/responses môže objekt error obsahovať aj code a param, obe null.
Čo môžete urobiť:
- Počkajte na ďalší limit plánu o 00:00 UTC.
- Dobite kredit. Kredit sa míňa po limite plánu a neexpiruje. Dobitie kreditov
- Prejdite na plán s vyšším denným limitom. Zmena plánu
- Pošlite menšie
max_tokens, ak ešte nejaký zostatok zostal: rezervácia je potom menšia.
Limit volaní Shannon Coder
shannon-coder-1 na /v1/chat/completions a /v1/messages sa počíta v volaniach, nie v tokenoch. Každý plán zahŕňa určitý počet volaní na 4-hodinové okno. Jeden request je jedno volanie.
| Plán | Volania na 4-hodinové okno |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Okná začínajú o 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Volania, ktoré zostanú na konci okna, sa neprenášajú.
- Volanie sa započíta, keď sa request prijme, ešte pred odpoveďou modelu. Request, ktorý následne zlyhá, sa tiež počíta ako volanie.
- Tieto volania nerezervujú žiadne tokeny a nič neberú zo zostatku. Zoznam requestov na stránke Kľúče a využitie ukazuje ich počet tokenov a hodnotu podľa uvedenej ceny.
- Predvolené
max_tokenspreshannon-coder-1na týchto dvoch endpointoch je 65,536. - Ak nezostanú žiadne volania, odpoveď má status
429, typrate_limit_errora správuShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Na
/v1/responsesnemáshannon-coder-1limit volaní: účtuje sa v tokenoch zo zostatku za $8.00 na 1M, ako každý iný model.
Ochrana pred zahltením
Účet môže poslať 120 requestov za minútu. Je to jediný limit frekvencie requestov a je rovnaký na každom pláne. Slúži na zastavenie zahltenia, nie na spomalenie bežného používania.
- Minúta je pevné okno 60 sekúnd, ktoré sa otvorí vaším prvým requestom. Keď skončí, počet sa začne znova od nuly.
- Počet sa vedie na účet, nie na kľúč ani na IP adresu. Zmena kľúča neotvorí nové okno.
- 121. request v rámci okna dostane odpoveď so statusom
429, typomrate_limit_errora správouToo many requests. Retry in <N>s.Nje počet sekúnd do konca okna, od 1 do 60. - Ochrana pred zahltením sa kontroluje pred zostatkom. Request, ktorý odmietne, nič nerezervuje a nič nestojí.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Request | Ochrana pred zahltením |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Počíta sa, jeden na request. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Nepočíta sa. |
shannon-coder-1 na /v1/chat/completions a /v1/messages | Počíta sa namiesto toho do limitu volaní Shannon Coder. |
Request, na ktorý sa odpovedalo 401, alebo 400 pri neznámom model | Nepočíta sa. |
| Request odmietnutý ochranou pred zahltením | Počíta sa do okna. Nič sa neúčtuje. |
Paralelné requesty
Počet requestov, ktoré má účet súčasne otvorené, nie je obmedzený a za paralelné posielanie requestov nie je žiadna chyba. Requesty, ktoré nemôžu začať hneď, čakajú v rade a vybavujú sa postupne.
- Každý request sa započíta do 120 za minútu v okamihu príchodu, bez ohľadu na to, či predchádzajúce requesty skončili.
- Každý request drží svoju vlastnú rezerváciu, kým neskončí. Dvadsať otvorených requestov s predvoleným výstupným rozpočtom drží 20 × 4,096 = 81,920 tokenov zostatku. Ak sú rezervácie spolu väčšie než váš zostatok, ďalší request dostane odpoveď
Quota exceeded, aj keď by dokončené volania stáli menej. Menšiemax_tokensdrží menej. - Request bez streamovania nepošle nič, kým nie je odpoveď úplná, preto nastavte klientovi timeout, ktorý pokryje čakanie. Stream drží spojenie otvorené počas čakania. Streamovanie
Limity jedného requestu
| Limit | Hodnota | Platí pre | Pri dosiahnutí limitu |
|---|---|---|---|
| Telo requestu | 32 MiB (33,554,432 bajtov) | Každý endpoint | Status 413, typ invalid_request_error. |
Výstupný rozpočet: max_tokens, max_completion_tokens, max_output_tokens | 1 až 65,536. Predvolene 4,096; pre shannon-coder-1 na /v1/chat/completions a /v1/messages je predvolená hodnota 65,536. | Každý model, ako suma rezervovaná zo zostatku. Ako limit dĺžky odpovede: hostované open-weight modely, shannon-1.6-lite, shannon-1.6-pro a shannon-coder-1. | Hodnota mimo rozsahu sa posunie na najbližší okraj rozsahu. Žiadna chyba. |
Stop sekvencie: stop, stop_sequences | 4 reťazce | Hostované open-weight modely | Použijú sa prvé 4 neprázdne reťazce. |
| Obrázok alebo súbor zadaný ako URL | 8 MiB, načítané do 20 sekúnd, najviac 5 presmerovaní, verejná adresa http alebo https | Každý endpoint, ktorý berie obrázky alebo súbory | Request sa vybaví bez tejto časti. Žiadna chyba. |
| Obrázok alebo súbor poslaný inline (base64) | Žiadny vlastný limit. Počíta sa do 32 MiB tela requestu. | Každý endpoint, ktorý berie obrázky alebo súbory | Status 413 pre celý request. |
text v POST /v1/tokenize | 4,000,000 bajtov | /v1/tokenize | Status 413, typ invalid_request_error, správa text too long. |
messages v POST /v1/tokenize a telo POST /v1/messages/count_tokens | Telo requestu 32 MiB | Oba endpointy na počítanie | Status 413. |
| Kontextové okno | Podľa modelu: context_window v GET /v1/models | Každý model | Čo sa stane s dlhšou konverzáciou, závisí od modelu. Modely a ceny |
Webové vyhľadávania (web_search: true) | Podľa plánu a dňa: Free 3, Plus 30, Standard 50, Pro 60. Jedno vyhľadávanie sa započíta pre request, ktorého vyhľadávanie našlo výsledky. | Requesty, ktoré nastavia web_search: true | Keď žiadne nezostanú, request sa vybaví bez vyhľadávania. Žiadna chyba. Vstavané webové vyhľadávanie |
Chyby
Odpovede tejto stránky. Na /v1/messages je rovnaký objekt error zabalený ako {"type": "error", "error": {…}}.
| Stav | Typ | Správa | Kedy a čo robiť |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezervácia requestu sa nezmestí do vášho zostatku. Počkajte do 00:00 UTC, dobite kredit, zmeňte plán alebo pošlite menšie max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Viac než 120 requestov v aktuálnej minúte. Počkajte N sekúnd a pošlite znova. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Volania Shannon Coder v aktuálnom 4-hodinovom okne sú vyčerpané. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model v tejto chvíli nemôže request prijať. Pošlite ho znova po krátkej pauze. |
503 | api_error | Could not verify your quota right now. Please retry. | Váš zostatok sa nepodarilo prečítať. Nič sa neúčtuje; pošlite request znova. Na /v1/responses s modelom Shannon je status 500. |
413 | invalid_request_error | Telo requestu je väčšie než 32 MiB. Na endpointoch vo formáte OpenAI nesie objekt error hodnotu code: "request_too_large". | |
413 | invalid_request_error | text too long | text v POST /v1/tokenize je dlhší než 4,000,000 bajtov. |