Přeskočit na obsah
Limity a zůstatek

Limity a zůstatek

Každý požadavek se obsluhuje stejně. Žádné úrovně rychlosti. Žádná zvláštní kvóta API. Za své tokeny jste už zaplatili — využívejte je tak rychle, jak chcete.

Tato stránka vysvětluje, z čeho se skládá váš zůstatek, co jeden požadavek rezervuje a kolik stojí, kolik požadavků smíte poslat a těch několik limitů, na které může jeden požadavek narazit.

hodnota 1M tokenů zůstatku
$5.00
denní limit se obnoví
00:00 UTC
ochrana proti zahlcení, na účet
120 požadavků / min

Jak se požadavky obsluhují

  • Žádné úrovně rychlosti — Jedno pravidlo omezuje, jak rychle smějí požadavky přicházet, a platí stejně pro každý účet a každý plán: 120 požadavků za minutu. Na tokeny za minutu žádný limit není.
  • Žádná zvláštní kvóta API — API čerpá stejný zůstatek jako chat. Plán určuje velikost dnešního limitu. Neurčuje frekvenci požadavků.
  • Tak rychle, jak chcete — Požadavky odeslané paralelně se přijmou a čekají ve frontě. Nejsou odmítnuty kvůli tomu, že jsou paralelní.

Váš zůstatek

Váš zůstatek se počítá v tokenech. 1,000,000 tokenů zůstatku má hodnotu $5.00 a každá cena na stránce Modely a ceny je sazba vůči této hodnotě.

Zůstatek se v každém okamžiku skládá ze dvou částí.

  • Dnešní limit plánu — Počet tokenů daný vaším plánem. Každý den v 00:00 UTC se obnoví. Co zbude na konci dne, se nepřenáší.
  • Zakoupený kredit — Tokeny, které jste koupili jako balíček. Kredit nevyprší a funguje na každém plánu, včetně Free.
Plán Tokenů za den Hodnota
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Pořadí čerpání — Každý požadavek nejdřív čerpá dnešní limit plánu. Zakoupený kredit se použije jen na to, co v ten den přesahuje limit.
  • Chat a API sdílejí zůstatek — Na účet připadá jeden zůstatek. Klíč API čerpá ze zůstatku účtu, kterému patří, za stejné ceny jako chat.
  • Balíčky — Kredit se prodává v balíčcích po 1,000,000 ($5.00), 2,000,000 ($10.00) a 5,000,000 ($25.00) tokenech, nebo v libovolné částce od 1,000,000 do 100,000,000 tokenů za $5.00 za 1,000,000.

Dobít kredit Změnit plán

Co požadavek rezervuje a kolik stojí

  • Rezervace — Když požadavek dorazí, rezervuje si ze zůstatku svůj výstupní rozpočet: max_tokens na /v1/chat/completions a /v1/messages, max_output_tokens na /v1/responses. /v1/chat/completions čte také max_completion_tokens. Výchozí hodnota je 4,096 a rozsah je 1 až 65,536.
  • Přijetí — Požadavek se přijme, jen pokud se rezervace vejde do toho, co ze zůstatku zbývá. Zůstatek, který je nad nulou, ale menší než výstupní rozpočet, dostane odpověď Quota exceeded. Pošlete menší max_tokens, abyste zbytek využili.
  • Vyúčtování — Když je odpověď kompletní, rezervace se nahradí skutečným poplatkem. Poplatek může být nižší i vyšší než rezervace.
  • Vrácení — Požadavek, který skončí chybovým statusem, vrátí svou rezervaci celou.

Skutečné účtování závisí na rodině modelu.

Modely Co se účtuje
Modely Shannon usage.total_tokens za cenu modelu za 1M. Vstup i výstup mají jednu sazbu.
Hostované modely s otevřenými váhami Necachovaný vstup za sazbu vstupu, cachovaný vstup za cachovanou sazbu, výstup za sazbu výstupu.

Částka v USD se ze zůstatku v tokenech odečte za $5.00 za 1,000,000, zaokrouhleno na celý token.

Počítání tokenů přes POST /v1/tokenize nebo POST /v1/messages/count_tokens je zdarma a nic nerezervuje. Počítání tokenů

Kde vidět zůstatek a využití

Stránka Klíče a využití ukazuje, kolik můžete právě teď utratit, dnešní limit plánu, zakoupený kredit a útratu za API za posledních 30 dní. Pod tím vypisuje každý požadavek, který váš klíč provedl: čas, endpoint, model, cachovaný vstup, účtované tokeny a cenu. Klíče a využití

Každá odpověď nese také objekt usage s počty tokenů daného volání.

Endpoint Pole usage Přidávají hostované modely s otevřenými váhami
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage obsahuje počty tokenů modelu. Částka odečtená ze zůstatku v odpovědi není: je ve sloupci Účtované tokeny v seznamu požadavků na stránce Klíče a využití.
  • Na /v1/messages s hostovaným modelem s otevřenými váhami je input_tokens necachovaná část vstupu, cache_read_input_tokens je cachovaná část a cache_creation_input_tokens je vždy 0.
  • Stream na /v1/chat/completions nese usage ve svém posledním chunku před [DONE]. Streamování

Když zůstatek dojde

Požadavek, jehož rezervace se nevejde do zůstatku, dostane odpověď se statusem 429, typem rate_limit_error a zprávou níže. Nic se neúčtuje. Stejná odpověď přijde i tehdy, když je zůstatek nad nulou, ale menší než výstupní rozpočet požadavku.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Na /v1/responses může objekt error obsahovat také code a param, obě null.

Co můžete udělat:

  • Počkejte na další limit plánu v 00:00 UTC.
  • Dobijte kredit. Kredit se čerpá po limitu plánu a nevyprší. Dobít kredit
  • Přejděte na plán s větším denním limitem. Změnit plán
  • Pošlete menší max_tokens, pokud ještě nějaký zůstatek zbývá: rezervace pak bude menší.

Limit volání Shannon Coder

shannon-coder-1 na /v1/chat/completions a /v1/messages se počítá na volání, ne na tokeny. Každý plán zahrnuje určitý počet volání na 4hodinové okno. Jeden požadavek je jedno volání.

Plán Volání na 4hodinové okno
Free 3
Plus 20
Standard 40
Pro 60
  • Okna začínají v 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Volání, která na konci okna zbydou, se nepřenášejí.
  • Volání se započítá při přijetí požadavku, dřív než model odpoví. Požadavek, který poté selže, se jako volání počítá také.
  • Tato volání nerezervují žádné tokeny a nic neberou z vašeho zůstatku. Seznam požadavků na stránce Klíče a využití ukazuje jejich počet tokenů a hodnotu podle uvedené ceny.
  • Výchozí max_tokens modelu shannon-coder-1 na těchto dvou endpointech je 65,536.
  • Když nezbývají žádná volání, odpovědí je status 429, typ rate_limit_error a zpráva Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Na /v1/responses nemá shannon-coder-1 žádný limit volání: účtuje se v tokenech ze zůstatku za $8.00 za 1M, jako každý jiný model.

Ochrana proti zahlcení

Účet smí poslat 120 požadavků za minutu. To je jediný limit frekvence požadavků a je stejný na každém plánu. Slouží k zastavení zahlcení, ne ke zpomalení běžného používání.

  • Minuta je pevné okno o 60 sekundách, které se otevře vaším prvním požadavkem. Když skončí, počítání začne znovu od nuly.
  • Počítá se na účet, ne na klíč ani na IP adresu. Výměna klíče nové okno neotevře.
  • Na 121. požadavek v rámci okna přijde odpověď se statusem 429, typem rate_limit_error a zprávou Too many requests. Retry in <N>s. N je počet sekund do konce okna, od 1 do 60.
  • Ochrana proti zahlcení se kontroluje dřív než zůstatek. Požadavek, který odmítne, nic nerezervuje a nic nestojí.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Požadavek Ochrana proti zahlcení
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Počítá se, jeden za požadavek.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Nepočítá se.
shannon-coder-1 na /v1/chat/completions a /v1/messages Místo toho se počítá limitem volání Shannon Coder.
Požadavek, na který přišlo 401, nebo 400 kvůli neznámému model Nepočítá se.
Požadavek odmítnutý ochranou proti zahlcení Počítá se do okna. Nic se neúčtuje.

Paralelní požadavky

Počet požadavků, které může mít účet současně otevřené, není nijak omezen a za paralelní odesílání žádná chyba nepřichází. Požadavky, které nemohou začít hned, čekají ve frontě a vyřizují se postupně.

  • Každý požadavek se při příchodu počítá do 120 za minutu, ať už dřívější požadavky skončily, nebo ne.
  • Každý požadavek drží vlastní rezervaci, dokud neskončí. Dvacet otevřených požadavků s výchozím výstupním rozpočtem drží 20 × 4,096 = 81,920 tokenů zůstatku. Pokud jsou rezervace dohromady větší než váš zůstatek, další požadavek dostane odpověď Quota exceeded, i když by dokončená volání stála méně. Menší max_tokens drží méně.
  • Požadavek bez streamování nic neposílá, dokud není odpověď kompletní, proto nastavte klientovi timeout, který čekání pokryje. Stream drží spojení otevřené, i když čeká. Streamování

Limity jednoho požadavku

Limit Hodnota Platí pro Při dosažení limitu
Tělo požadavku 32 MiB (33,554,432 bajtů) Každý endpoint Status 413, typ invalid_request_error.
Výstupní rozpočet: max_tokens, max_completion_tokens, max_output_tokens 1 až 65,536. Výchozí 4,096; pro shannon-coder-1 na /v1/chat/completions a /v1/messages je výchozí 65,536. Každý model, jako částka rezervovaná ze zůstatku. Jako limit délky odpovědi: hostované modely s otevřenými váhami, shannon-1.6-lite, shannon-1.6-pro a shannon-coder-1. Hodnota mimo rozsah se posune na nejbližší mez rozsahu. Žádná chyba.
Stop sekvence: stop, stop_sequences 4 řetězce Hostované modely s otevřenými váhami Použijí se první 4 neprázdné řetězce.
Obrázek nebo soubor zadaný jako URL 8 MiB, načtení do 20 sekund, nejvýše 5 přesměrování, veřejná adresa http nebo https Každý endpoint, který přijímá obrázky nebo soubory Požadavek se zodpoví bez této části. Žádná chyba.
Obrázek nebo soubor odeslaný přímo v požadavku (base64) Žádný vlastní limit. Počítá se do těla požadavku o velikosti 32 MiB. Každý endpoint, který přijímá obrázky nebo soubory Status 413 pro celý požadavek.
text v POST /v1/tokenize 4,000,000 bajtů /v1/tokenize Status 413, typ invalid_request_error, zpráva text too long.
messages v POST /v1/tokenize a tělo POST /v1/messages/count_tokens Tělo požadavku o velikosti 32 MiB Oba endpointy pro počítání Status 413.
Kontextové okno Podle modelu: context_window v GET /v1/models Každý model Co se stane s delší konverzací, závisí na modelu. Modely a ceny
Vyhledávání na webu (web_search: true) Podle plánu a dne: Free 3, Plus 30, Standard 50, Pro 60. Jedno vyhledávání se počítá u požadavku, jehož vyhledávání našlo výsledky. Požadavky s nastaveným web_search: true Když žádné nezbývá, odpoví se bez vyhledávání. Žádná chyba. Vestavěné webové vyhledávání

Chyby

Odpovědi této stránky. Na /v1/messages je stejný objekt error zabalen jako {"type": "error", "error": {…}}.

Stav Typ Zpráva Kdy a co dělat
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervace požadavku se nevejde do vašeho zůstatku. Počkejte do 00:00 UTC, dobijte kredit, změňte plán, nebo pošlete menší max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Více než 120 požadavků v aktuální minutě. Počkejte N sekund a pošlete znovu.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Volání Shannon Coder v aktuálním 4hodinovém okně jsou vyčerpána.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model v tuto chvíli nemůže požadavek přijmout. Po krátké pauze jej pošlete znovu.
503 api_error Could not verify your quota right now. Please retry. Váš zůstatek se nepodařilo přečíst. Nic se neúčtuje; pošlete požadavek znovu. Na /v1/responses s modelem Shannon je status 500.
413 invalid_request_error Tělo požadavku je větší než 32 MiB. Na endpointech ve formátu OpenAI nese objekt error hodnotu code: "request_too_large".
413 invalid_request_error text too long text v POST /v1/tokenize je delší než 4,000,000 bajtů.