Preskočiť na obsah
Limity a zostatok

Limity a zostatok

Každý request sa obsluhuje rovnako. Žiadne cenové pásma rýchlosti. Žiadna samostatná kvóta API. Svoje tokeny ste už zaplatili — využite ich tak rýchlo, ako chcete.

Táto stránka vysvetľuje, z čoho sa skladá váš zostatok, čo jeden request rezervuje a koľko stojí, koľko requestov môžete poslať a niekoľko limitov, na ktoré môže naraziť jednotlivý request.

hodnota 1M tokenov zostatku
$5.00
denný limit sa obnovuje
00:00 UTC
ochrana pred zahltením, na účet
120 requestov / min

Ako sa requesty obsluhujú

  • Žiadne cenové pásma rýchlosti — Jedno pravidlo obmedzuje, ako rýchlo môžu requesty prichádzať, a je rovnaké pre každý účet a každý plán: 120 requestov za minútu. Počet tokenov za minútu nie je obmedzený.
  • Žiadna samostatná kvóta API — API míňa ten istý zostatok ako chat. Plán určuje veľkosť dnešného limitu. Neurčuje frekvenciu requestov.
  • Tak rýchlo, ako chcete — Requesty poslané paralelne sa prijmú a čakajú v rade. Nie sú odmietnuté len preto, že sú paralelné.

Váš zostatok

Váš zostatok sa počíta v tokenoch. 1,000,000 tokenov zostatku má hodnotu $5.00 a každá cena na stránke Modely a ceny je sadzba voči tejto hodnote.

Zostatok je v každom okamihu súčtom dvoch častí.

  • Dnešný limit plánu — Počet tokenov určený vaším plánom. Každý deň o 00:00 UTC sa obnoví. To, čo zostane na konci dňa, sa neprenáša.
  • Zakúpené kredity — Tokeny, ktoré ste kúpili ako balík. Kredit neexpiruje a funguje na každom pláne vrátane Free.
Plán Tokeny za deň Hodnota
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Poradie míňania — Každý request míňa najprv dnešný limit plánu. Zakúpený kredit sa použije len na to, čo v ten deň presiahne limit.
  • Chat a API ho zdieľajú — Na účet pripadá jeden zostatok. API kľúč míňa zo zostatku účtu, ktorý ho vlastní, za rovnaké ceny ako chat.
  • Balíky — Kredit sa predáva v balíkoch po 1,000,000 ($5.00), 2,000,000 ($10.00) a 5,000,000 ($25.00) tokenov alebo ako vami zvolená suma od 1,000,000 do 100,000,000 tokenov za $5.00 na 1,000,000.

Dobitie kreditov Zmena plánu

Čo request rezervuje a koľko stojí

  • Rezervácia — Keď request príde, rezervuje si zo zostatku svoj výstupný rozpočet: max_tokens na /v1/chat/completions a /v1/messages, max_output_tokens na /v1/responses. /v1/chat/completions číta aj max_completion_tokens. Predvolená hodnota je 4,096 a rozsah je 1 až 65,536.
  • Prijatie — Request sa prijme, len ak sa rezervácia zmestí do zostatku. Zostatok nad nulou, ale menší než výstupný rozpočet, dostane odpoveď Quota exceeded. Pošlite menšie max_tokens, aby ste využili zvyšok.
  • Vyrovnanie — Keď je odpoveď úplná, rezervácia sa nahradí skutočným poplatkom. Poplatok môže byť nižší aj vyšší než rezervácia.
  • Vrátenie — Request, ktorý skončí chybovým statusom, vráti svoju rezerváciu v plnej výške.

Skutočné účtovanie závisí od rodiny modelu.

Modely Čo sa účtuje
Modely Shannon usage.total_tokens za cenu modelu na 1M. Vstup a výstup majú jednu sadzbu.
Hostované open-weight modely Necachovaný vstup za sadzbu vstupu, cachovaný vstup za cachovanú sadzbu, výstup za sadzbu výstupu.

Suma v USD sa odpočíta z vášho zostatku v tokenoch pri $5.00 na 1,000,000, zaokrúhlená na celý token.

Počítanie tokenov cez POST /v1/tokenize alebo POST /v1/messages/count_tokens je zadarmo a nič nerezervuje. Počítanie tokenov

Kde vidieť zostatok a využitie

Stránka Kľúče a využitie ukazuje, koľko môžete minúť práve teraz, dnešný limit plánu, zakúpený kredit a výdavky na API za posledných 30 dní. Pod tým uvádza každý request vášho kľúča: čas, endpoint, model, cachovaný vstup, fakturované tokeny a cenu. Kľúče a využitie

Každá odpoveď nesie aj objekt usage s počtami tokenov daného volania.

Endpoint Polia usage Pridávajú hostované open-weight modely
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage obsahuje počty tokenov modelu. Suma odpočítaná zo zostatku v odpovedi nie je: je v stĺpci Fakturované tokeny v zozname requestov na stránke Kľúče a využitie.
  • Na /v1/messages s hostovaným open-weight modelom je input_tokens necachovaná časť vstupu, cache_read_input_tokens je cachovaná časť a cache_creation_input_tokens je vždy 0.
  • Stream na /v1/chat/completions nesie usage vo svojom poslednom chunku pred [DONE]. Streamovanie

Keď sa zostatok minie

Request, ktorého rezervácia sa nezmestí do zostatku, dostane odpoveď so statusom 429, typom rate_limit_error a správou nižšie. Nič sa neúčtuje. Rovnaká odpoveď sa pošle, keď je zostatok nad nulou, ale menší než výstupný rozpočet requestu.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Na /v1/responses môže objekt error obsahovať aj code a param, obe null.

Čo môžete urobiť:

  • Počkajte na ďalší limit plánu o 00:00 UTC.
  • Dobite kredit. Kredit sa míňa po limite plánu a neexpiruje. Dobitie kreditov
  • Prejdite na plán s vyšším denným limitom. Zmena plánu
  • Pošlite menšie max_tokens, ak ešte nejaký zostatok zostal: rezervácia je potom menšia.

Limit volaní Shannon Coder

shannon-coder-1 na /v1/chat/completions a /v1/messages sa počíta v volaniach, nie v tokenoch. Každý plán zahŕňa určitý počet volaní na 4-hodinové okno. Jeden request je jedno volanie.

Plán Volania na 4-hodinové okno
Free 3
Plus 20
Standard 40
Pro 60
  • Okná začínajú o 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Volania, ktoré zostanú na konci okna, sa neprenášajú.
  • Volanie sa započíta, keď sa request prijme, ešte pred odpoveďou modelu. Request, ktorý následne zlyhá, sa tiež počíta ako volanie.
  • Tieto volania nerezervujú žiadne tokeny a nič neberú zo zostatku. Zoznam requestov na stránke Kľúče a využitie ukazuje ich počet tokenov a hodnotu podľa uvedenej ceny.
  • Predvolené max_tokens pre shannon-coder-1 na týchto dvoch endpointoch je 65,536.
  • Ak nezostanú žiadne volania, odpoveď má status 429, typ rate_limit_error a správu Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Na /v1/responses nemá shannon-coder-1 limit volaní: účtuje sa v tokenoch zo zostatku za $8.00 na 1M, ako každý iný model.

Ochrana pred zahltením

Účet môže poslať 120 requestov za minútu. Je to jediný limit frekvencie requestov a je rovnaký na každom pláne. Slúži na zastavenie zahltenia, nie na spomalenie bežného používania.

  • Minúta je pevné okno 60 sekúnd, ktoré sa otvorí vaším prvým requestom. Keď skončí, počet sa začne znova od nuly.
  • Počet sa vedie na účet, nie na kľúč ani na IP adresu. Zmena kľúča neotvorí nové okno.
  • 121. request v rámci okna dostane odpoveď so statusom 429, typom rate_limit_error a správou Too many requests. Retry in <N>s. N je počet sekúnd do konca okna, od 1 do 60.
  • Ochrana pred zahltením sa kontroluje pred zostatkom. Request, ktorý odmietne, nič nerezervuje a nič nestojí.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Request Ochrana pred zahltením
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Počíta sa, jeden na request.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Nepočíta sa.
shannon-coder-1 na /v1/chat/completions a /v1/messages Počíta sa namiesto toho do limitu volaní Shannon Coder.
Request, na ktorý sa odpovedalo 401, alebo 400 pri neznámom model Nepočíta sa.
Request odmietnutý ochranou pred zahltením Počíta sa do okna. Nič sa neúčtuje.

Paralelné requesty

Počet requestov, ktoré má účet súčasne otvorené, nie je obmedzený a za paralelné posielanie requestov nie je žiadna chyba. Requesty, ktoré nemôžu začať hneď, čakajú v rade a vybavujú sa postupne.

  • Každý request sa započíta do 120 za minútu v okamihu príchodu, bez ohľadu na to, či predchádzajúce requesty skončili.
  • Každý request drží svoju vlastnú rezerváciu, kým neskončí. Dvadsať otvorených requestov s predvoleným výstupným rozpočtom drží 20 × 4,096 = 81,920 tokenov zostatku. Ak sú rezervácie spolu väčšie než váš zostatok, ďalší request dostane odpoveď Quota exceeded, aj keď by dokončené volania stáli menej. Menšie max_tokens drží menej.
  • Request bez streamovania nepošle nič, kým nie je odpoveď úplná, preto nastavte klientovi timeout, ktorý pokryje čakanie. Stream drží spojenie otvorené počas čakania. Streamovanie

Limity jedného requestu

Limit Hodnota Platí pre Pri dosiahnutí limitu
Telo requestu 32 MiB (33,554,432 bajtov) Každý endpoint Status 413, typ invalid_request_error.
Výstupný rozpočet: max_tokens, max_completion_tokens, max_output_tokens 1 až 65,536. Predvolene 4,096; pre shannon-coder-1 na /v1/chat/completions a /v1/messages je predvolená hodnota 65,536. Každý model, ako suma rezervovaná zo zostatku. Ako limit dĺžky odpovede: hostované open-weight modely, shannon-1.6-lite, shannon-1.6-pro a shannon-coder-1. Hodnota mimo rozsahu sa posunie na najbližší okraj rozsahu. Žiadna chyba.
Stop sekvencie: stop, stop_sequences 4 reťazce Hostované open-weight modely Použijú sa prvé 4 neprázdne reťazce.
Obrázok alebo súbor zadaný ako URL 8 MiB, načítané do 20 sekúnd, najviac 5 presmerovaní, verejná adresa http alebo https Každý endpoint, ktorý berie obrázky alebo súbory Request sa vybaví bez tejto časti. Žiadna chyba.
Obrázok alebo súbor poslaný inline (base64) Žiadny vlastný limit. Počíta sa do 32 MiB tela requestu. Každý endpoint, ktorý berie obrázky alebo súbory Status 413 pre celý request.
text v POST /v1/tokenize 4,000,000 bajtov /v1/tokenize Status 413, typ invalid_request_error, správa text too long.
messages v POST /v1/tokenize a telo POST /v1/messages/count_tokens Telo requestu 32 MiB Oba endpointy na počítanie Status 413.
Kontextové okno Podľa modelu: context_window v GET /v1/models Každý model Čo sa stane s dlhšou konverzáciou, závisí od modelu. Modely a ceny
Webové vyhľadávania (web_search: true) Podľa plánu a dňa: Free 3, Plus 30, Standard 50, Pro 60. Jedno vyhľadávanie sa započíta pre request, ktorého vyhľadávanie našlo výsledky. Requesty, ktoré nastavia web_search: true Keď žiadne nezostanú, request sa vybaví bez vyhľadávania. Žiadna chyba. Vstavané webové vyhľadávanie

Chyby

Odpovede tejto stránky. Na /v1/messages je rovnaký objekt error zabalený ako {"type": "error", "error": {…}}.

Stav Typ Správa Kedy a čo robiť
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervácia requestu sa nezmestí do vášho zostatku. Počkajte do 00:00 UTC, dobite kredit, zmeňte plán alebo pošlite menšie max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Viac než 120 requestov v aktuálnej minúte. Počkajte N sekúnd a pošlite znova.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Volania Shannon Coder v aktuálnom 4-hodinovom okne sú vyčerpané.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model v tejto chvíli nemôže request prijať. Pošlite ho znova po krátkej pauze.
503 api_error Could not verify your quota right now. Please retry. Váš zostatok sa nepodarilo prečítať. Nič sa neúčtuje; pošlite request znova. Na /v1/responses s modelom Shannon je status 500.
413 invalid_request_error Telo requestu je väčšie než 32 MiB. Na endpointoch vo formáte OpenAI nesie objekt error hodnotu code: "request_too_large".
413 invalid_request_error text too long text v POST /v1/tokenize je dlhší než 4,000,000 bajtov.