Limity a zůstatek
Každý požadavek se obsluhuje stejně. Žádné úrovně rychlosti. Žádná zvláštní kvóta API. Za své tokeny jste už zaplatili — využívejte je tak rychle, jak chcete.
Tato stránka vysvětluje, z čeho se skládá váš zůstatek, co jeden požadavek rezervuje a kolik stojí, kolik požadavků smíte poslat a těch několik limitů, na které může jeden požadavek narazit.
- hodnota 1M tokenů zůstatku
- $5.00
- denní limit se obnoví
- 00:00 UTC
- ochrana proti zahlcení, na účet
- 120 požadavků / min
Jak se požadavky obsluhují
- Žádné úrovně rychlosti — Jedno pravidlo omezuje, jak rychle smějí požadavky přicházet, a platí stejně pro každý účet a každý plán: 120 požadavků za minutu. Na tokeny za minutu žádný limit není.
- Žádná zvláštní kvóta API — API čerpá stejný zůstatek jako chat. Plán určuje velikost dnešního limitu. Neurčuje frekvenci požadavků.
- Tak rychle, jak chcete — Požadavky odeslané paralelně se přijmou a čekají ve frontě. Nejsou odmítnuty kvůli tomu, že jsou paralelní.
Váš zůstatek
Váš zůstatek se počítá v tokenech. 1,000,000 tokenů zůstatku má hodnotu $5.00 a každá cena na stránce Modely a ceny je sazba vůči této hodnotě.
Zůstatek se v každém okamžiku skládá ze dvou částí.
- Dnešní limit plánu — Počet tokenů daný vaším plánem. Každý den v 00:00 UTC se obnoví. Co zbude na konci dne, se nepřenáší.
- Zakoupený kredit — Tokeny, které jste koupili jako balíček. Kredit nevyprší a funguje na každém plánu, včetně Free.
| Plán | Tokenů za den | Hodnota |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Pořadí čerpání — Každý požadavek nejdřív čerpá dnešní limit plánu. Zakoupený kredit se použije jen na to, co v ten den přesahuje limit.
- Chat a API sdílejí zůstatek — Na účet připadá jeden zůstatek. Klíč API čerpá ze zůstatku účtu, kterému patří, za stejné ceny jako chat.
- Balíčky — Kredit se prodává v balíčcích po 1,000,000 ($5.00), 2,000,000 ($10.00) a 5,000,000 ($25.00) tokenech, nebo v libovolné částce od 1,000,000 do 100,000,000 tokenů za $5.00 za 1,000,000.
Co požadavek rezervuje a kolik stojí
- Rezervace — Když požadavek dorazí, rezervuje si ze zůstatku svůj výstupní rozpočet:
max_tokensna/v1/chat/completionsa/v1/messages,max_output_tokensna/v1/responses./v1/chat/completionsčte takémax_completion_tokens. Výchozí hodnota je 4,096 a rozsah je 1 až 65,536. - Přijetí — Požadavek se přijme, jen pokud se rezervace vejde do toho, co ze zůstatku zbývá. Zůstatek, který je nad nulou, ale menší než výstupní rozpočet, dostane odpověď
Quota exceeded. Pošlete menšímax_tokens, abyste zbytek využili. - Vyúčtování — Když je odpověď kompletní, rezervace se nahradí skutečným poplatkem. Poplatek může být nižší i vyšší než rezervace.
- Vrácení — Požadavek, který skončí chybovým statusem, vrátí svou rezervaci celou.
Skutečné účtování závisí na rodině modelu.
| Modely | Co se účtuje |
|---|---|
| Modely Shannon | usage.total_tokens za cenu modelu za 1M. Vstup i výstup mají jednu sazbu. |
| Hostované modely s otevřenými váhami | Necachovaný vstup za sazbu vstupu, cachovaný vstup za cachovanou sazbu, výstup za sazbu výstupu. |
Částka v USD se ze zůstatku v tokenech odečte za $5.00 za 1,000,000, zaokrouhleno na celý token.
Počítání tokenů přes POST /v1/tokenize nebo POST /v1/messages/count_tokens je zdarma a nic nerezervuje. Počítání tokenů
Kde vidět zůstatek a využití
Stránka Klíče a využití ukazuje, kolik můžete právě teď utratit, dnešní limit plánu, zakoupený kredit a útratu za API za posledních 30 dní. Pod tím vypisuje každý požadavek, který váš klíč provedl: čas, endpoint, model, cachovaný vstup, účtované tokeny a cenu. Klíče a využití
Každá odpověď nese také objekt usage s počty tokenů daného volání.
| Endpoint | Pole usage | Přidávají hostované modely s otevřenými váhami |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageobsahuje počty tokenů modelu. Částka odečtená ze zůstatku v odpovědi není: je ve sloupci Účtované tokeny v seznamu požadavků na stránce Klíče a využití.- Na
/v1/messagess hostovaným modelem s otevřenými váhami jeinput_tokensnecachovaná část vstupu,cache_read_input_tokensje cachovaná část acache_creation_input_tokensje vždy0. - Stream na
/v1/chat/completionsneseusageve svém posledním chunku před[DONE]. Streamování
Když zůstatek dojde
Požadavek, jehož rezervace se nevejde do zůstatku, dostane odpověď se statusem 429, typem rate_limit_error a zprávou níže. Nic se neúčtuje. Stejná odpověď přijde i tehdy, když je zůstatek nad nulou, ale menší než výstupní rozpočet požadavku.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Na /v1/responses může objekt error obsahovat také code a param, obě null.
Co můžete udělat:
- Počkejte na další limit plánu v 00:00 UTC.
- Dobijte kredit. Kredit se čerpá po limitu plánu a nevyprší. Dobít kredit
- Přejděte na plán s větším denním limitem. Změnit plán
- Pošlete menší
max_tokens, pokud ještě nějaký zůstatek zbývá: rezervace pak bude menší.
Limit volání Shannon Coder
shannon-coder-1 na /v1/chat/completions a /v1/messages se počítá na volání, ne na tokeny. Každý plán zahrnuje určitý počet volání na 4hodinové okno. Jeden požadavek je jedno volání.
| Plán | Volání na 4hodinové okno |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Okna začínají v 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Volání, která na konci okna zbydou, se nepřenášejí.
- Volání se započítá při přijetí požadavku, dřív než model odpoví. Požadavek, který poté selže, se jako volání počítá také.
- Tato volání nerezervují žádné tokeny a nic neberou z vašeho zůstatku. Seznam požadavků na stránce Klíče a využití ukazuje jejich počet tokenů a hodnotu podle uvedené ceny.
- Výchozí
max_tokensmodelushannon-coder-1na těchto dvou endpointech je 65,536. - Když nezbývají žádná volání, odpovědí je status
429, typrate_limit_errora zprávaShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Na
/v1/responsesnemáshannon-coder-1žádný limit volání: účtuje se v tokenech ze zůstatku za $8.00 za 1M, jako každý jiný model.
Ochrana proti zahlcení
Účet smí poslat 120 požadavků za minutu. To je jediný limit frekvence požadavků a je stejný na každém plánu. Slouží k zastavení zahlcení, ne ke zpomalení běžného používání.
- Minuta je pevné okno o 60 sekundách, které se otevře vaším prvním požadavkem. Když skončí, počítání začne znovu od nuly.
- Počítá se na účet, ne na klíč ani na IP adresu. Výměna klíče nové okno neotevře.
- Na 121. požadavek v rámci okna přijde odpověď se statusem
429, typemrate_limit_errora zprávouToo many requests. Retry in <N>s.Nje počet sekund do konce okna, od 1 do 60. - Ochrana proti zahlcení se kontroluje dřív než zůstatek. Požadavek, který odmítne, nic nerezervuje a nic nestojí.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Požadavek | Ochrana proti zahlcení |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Počítá se, jeden za požadavek. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Nepočítá se. |
shannon-coder-1 na /v1/chat/completions a /v1/messages | Místo toho se počítá limitem volání Shannon Coder. |
Požadavek, na který přišlo 401, nebo 400 kvůli neznámému model | Nepočítá se. |
| Požadavek odmítnutý ochranou proti zahlcení | Počítá se do okna. Nic se neúčtuje. |
Paralelní požadavky
Počet požadavků, které může mít účet současně otevřené, není nijak omezen a za paralelní odesílání žádná chyba nepřichází. Požadavky, které nemohou začít hned, čekají ve frontě a vyřizují se postupně.
- Každý požadavek se při příchodu počítá do 120 za minutu, ať už dřívější požadavky skončily, nebo ne.
- Každý požadavek drží vlastní rezervaci, dokud neskončí. Dvacet otevřených požadavků s výchozím výstupním rozpočtem drží 20 × 4,096 = 81,920 tokenů zůstatku. Pokud jsou rezervace dohromady větší než váš zůstatek, další požadavek dostane odpověď
Quota exceeded, i když by dokončená volání stála méně. Menšímax_tokensdrží méně. - Požadavek bez streamování nic neposílá, dokud není odpověď kompletní, proto nastavte klientovi timeout, který čekání pokryje. Stream drží spojení otevřené, i když čeká. Streamování
Limity jednoho požadavku
| Limit | Hodnota | Platí pro | Při dosažení limitu |
|---|---|---|---|
| Tělo požadavku | 32 MiB (33,554,432 bajtů) | Každý endpoint | Status 413, typ invalid_request_error. |
Výstupní rozpočet: max_tokens, max_completion_tokens, max_output_tokens | 1 až 65,536. Výchozí 4,096; pro shannon-coder-1 na /v1/chat/completions a /v1/messages je výchozí 65,536. | Každý model, jako částka rezervovaná ze zůstatku. Jako limit délky odpovědi: hostované modely s otevřenými váhami, shannon-1.6-lite, shannon-1.6-pro a shannon-coder-1. | Hodnota mimo rozsah se posune na nejbližší mez rozsahu. Žádná chyba. |
Stop sekvence: stop, stop_sequences | 4 řetězce | Hostované modely s otevřenými váhami | Použijí se první 4 neprázdné řetězce. |
| Obrázek nebo soubor zadaný jako URL | 8 MiB, načtení do 20 sekund, nejvýše 5 přesměrování, veřejná adresa http nebo https | Každý endpoint, který přijímá obrázky nebo soubory | Požadavek se zodpoví bez této části. Žádná chyba. |
| Obrázek nebo soubor odeslaný přímo v požadavku (base64) | Žádný vlastní limit. Počítá se do těla požadavku o velikosti 32 MiB. | Každý endpoint, který přijímá obrázky nebo soubory | Status 413 pro celý požadavek. |
text v POST /v1/tokenize | 4,000,000 bajtů | /v1/tokenize | Status 413, typ invalid_request_error, zpráva text too long. |
messages v POST /v1/tokenize a tělo POST /v1/messages/count_tokens | Tělo požadavku o velikosti 32 MiB | Oba endpointy pro počítání | Status 413. |
| Kontextové okno | Podle modelu: context_window v GET /v1/models | Každý model | Co se stane s delší konverzací, závisí na modelu. Modely a ceny |
Vyhledávání na webu (web_search: true) | Podle plánu a dne: Free 3, Plus 30, Standard 50, Pro 60. Jedno vyhledávání se počítá u požadavku, jehož vyhledávání našlo výsledky. | Požadavky s nastaveným web_search: true | Když žádné nezbývá, odpoví se bez vyhledávání. Žádná chyba. Vestavěné webové vyhledávání |
Chyby
Odpovědi této stránky. Na /v1/messages je stejný objekt error zabalen jako {"type": "error", "error": {…}}.
| Stav | Typ | Zpráva | Kdy a co dělat |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezervace požadavku se nevejde do vašeho zůstatku. Počkejte do 00:00 UTC, dobijte kredit, změňte plán, nebo pošlete menší max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Více než 120 požadavků v aktuální minutě. Počkejte N sekund a pošlete znovu. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Volání Shannon Coder v aktuálním 4hodinovém okně jsou vyčerpána. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model v tuto chvíli nemůže požadavek přijmout. Po krátké pauze jej pošlete znovu. |
503 | api_error | Could not verify your quota right now. Please retry. | Váš zůstatek se nepodařilo přečíst. Nic se neúčtuje; pošlete požadavek znovu. Na /v1/responses s modelem Shannon je status 500. |
413 | invalid_request_error | Tělo požadavku je větší než 32 MiB. Na endpointech ve formátu OpenAI nese objekt error hodnotu code: "request_too_large". | |
413 | invalid_request_error | text too long | text v POST /v1/tokenize je delší než 4,000,000 bajtů. |