Limite și sold
Fiecare cerere este servită egal. Fără niveluri de rată. Fără cotă API separată. Ți-ai plătit deja token-urile — folosește-le cât de repede vrei.
Această pagină explică din ce este format soldul tău, ce rezervă și cât costă o cerere, câte cereri poți trimite și puținele limite pe care le poate întâlni o singură cerere.
- valoarea a 1M token-uri de sold
- $5.00
- cota zilnică se reînnoiește
- 00:00 UTC
- protecție anti-flood, per cont
- 120 cereri / min
Cum sunt servite cererile
- Fără niveluri de rată — O singură regulă limitează cât de repede pot sosi cererile și este aceeași pentru fiecare cont și fiecare plan: 120 de cereri pe minut. Nu există nicio limită de token-uri pe minut.
- Fără cotă API separată — API-ul consumă același sold ca și chatul. Un plan stabilește mărimea cotei de astăzi. Nu stabilește o rată a cererilor.
- Cât de repede vrei — Cererile trimise în paralel sunt acceptate și așteaptă la coadă. Nu sunt refuzate pentru că sunt paralele.
Soldul tău
Soldul tău este numărat în token-uri. 1,000,000 de token-uri de sold valorează $5.00, iar fiecare preț de pe pagina Models & pricing este un tarif raportat la această valoare.
În orice moment, soldul este suma a două părți.
- Cota planului de astăzi — Un număr de token-uri stabilit de planul tău. Se reînnoiește în fiecare zi la 00:00 UTC. Ce rămâne la sfârșitul zilei nu se reportează.
- Credit achiziționat — Token-uri pe care le-ai cumpărat ca pachet. Creditul nu expiră și funcționează pe orice plan, inclusiv Free.
| Plan | Token-uri pe zi | Valoare |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Ordinea consumului — Fiecare cerere consumă mai întâi cota planului de astăzi. Creditul achiziționat se folosește doar pentru ce depășește cota din ziua respectivă.
- Chatul și API-ul îl folosesc împreună — Există un singur sold per cont. O cheie API consumă din soldul contului căruia îi aparține, la aceleași prețuri ca în chat.
- Pachete — Creditul se vinde în pachete de 1,000,000 ($5.00), 2,000,000 ($10.00) și 5,000,000 ($25.00) token-uri sau ca o sumă la alegere, de la 1,000,000 la 100,000,000 token-uri, la $5.00 per 1,000,000.
Reîncărcare credit Schimbare plan
Ce rezervă o cerere și cât costă
- Rezervare — Când sosește o cerere, ea rezervă din soldul tău bugetul de ieșire:
max_tokenspe/v1/chat/completionsși/v1/messages,max_output_tokenspe/v1/responses./v1/chat/completionscitește șimax_completion_tokens. Valoarea implicită este 4,096, iar intervalul este de la 1 la 65,536. - Admitere — Cererea este acceptată doar dacă rezervarea încape în ce a rămas din soldul tău. Un sold mai mare ca zero, dar mai mic decât bugetul de ieșire, primește răspunsul
Quota exceeded. Trimite unmax_tokensmai mic pentru a folosi restul. - Decontare — Când răspunsul este complet, rezervarea este înlocuită cu taxa reală. Taxa poate fi mai mică sau mai mare decât rezervarea.
- Returnare — O cerere care se termină cu un status de eroare își returnează rezervarea integral.
Taxarea reală depinde de familia modelului.
| Modele | Ce se taxează |
|---|---|
| Modele Shannon | usage.total_tokens la prețul modelului per 1M. Intrarea și ieșirea au un singur tarif. |
| Modele open-weight găzduite | Intrarea necache-uită la tariful de intrare, intrarea din cache la tariful pentru cache, ieșirea la tariful de ieșire. |
Suma în USD este scăzută din soldul tău în token-uri la $5.00 per 1,000,000, rotunjită la un token întreg.
Numărarea token-urilor cu POST /v1/tokenize sau POST /v1/messages/count_tokens este gratuită și nu rezervă nimic. Numărarea token-urilor
Unde vezi soldul și utilizarea
Pagina Keys & usage arată ce poți cheltui chiar acum, cota planului de astăzi, creditul tău achiziționat și cheltuielile API din ultimele 30 de zile. Mai jos listează fiecare cerere făcută de cheia ta: ora, endpoint-ul, modelul, intrarea din cache, token-urile taxate și costul. Chei și utilizare
Fiecare răspuns conține și un obiect usage cu numărul de token-uri al apelului respectiv.
| Endpoint | Câmpuri din usage | Adăugate de modelele open-weight găzduite |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageconține numărul de token-uri al modelului. Suma scăzută din soldul tău nu apare în răspuns: este coloana Billed tokens din lista de cereri din Keys & usage.- Pe
/v1/messagescu un model open-weight găzduit,input_tokenseste partea necache-uită a intrării,cache_read_input_tokenseste partea din cache, iarcache_creation_input_tokenseste întotdeauna0. - Un stream pe
/v1/chat/completionsconțineusageîn ultimul chunk, înainte de[DONE]. Streaming
Când soldul se epuizează
O cerere a cărei rezervare nu încape în soldul tău primește răspuns cu statusul 429, tipul rate_limit_error și mesajul de mai jos. Nu se taxează nimic. Același răspuns se trimite și când soldul este mai mare ca zero, dar mai mic decât bugetul de ieșire al cererii.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Pe /v1/responses, obiectul error poate conține și code și param, ambele null.
Ce poți face:
- Așteaptă următoarea cotă a planului, la 00:00 UTC.
- Reîncarcă creditul. Creditul se consumă după cota planului și nu expiră. Reîncărcare credit
- Treci la un plan cu o cotă zilnică mai mare. Schimbare plan
- Trimite un
max_tokensmai mic, dacă a mai rămas ceva sold: rezervarea va fi atunci mai mică.
Cota de apeluri Shannon Coder
shannon-coder-1 pe /v1/chat/completions și /v1/messages se numără în apeluri, nu în token-uri. Fiecare plan include un număr de apeluri pe fereastră de 4 ore. O cerere este un apel.
| Plan | Apeluri pe fereastră de 4 ore |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Ferestrele încep la 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Apelurile rămase la sfârșitul unei ferestre nu se reportează.
- Un apel este numărat când cererea este acceptată, înainte ca modelul să răspundă. O cerere care eșuează ulterior se numără tot ca apel.
- Aceste apeluri nu rezervă token-uri și nu iau nimic din soldul tău. Lista de cereri din Keys & usage arată numărul lor de token-uri și valoarea acestuia la prețul listat.
- Valoarea implicită a
max_tokenspentrushannon-coder-1pe aceste două endpoint-uri este 65,536. - Când nu mai ai apeluri, răspunsul are statusul
429, tipulrate_limit_errorși mesajulShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Pe
/v1/responses,shannon-coder-1nu are cotă de apeluri: este taxat în token-uri din soldul tău la $8.00 per 1M, ca orice alt model.
Protecție anti-flood
Un cont poate trimite 120 de cereri pe minut. Aceasta este singura limită a ratei cererilor și este aceeași pe orice plan. Există pentru a opri inundările de cereri, nu pentru a încetini folosirea normală.
- Minutul este o fereastră fixă de 60 de secunde, care se deschide cu prima ta cerere. Când se termină, numărătoarea pornește din nou de la zero.
- Numărătoarea este per cont, nu per cheie și nu per adresă IP. Schimbarea cheii nu deschide o fereastră nouă.
- A 121-a cerere dintr-o fereastră primește răspuns cu statusul
429, tipulrate_limit_errorși mesajulToo many requests. Retry in <N>s.Neste numărul de secunde până la sfârșitul ferestrei, de la 1 la 60. - Protecția anti-flood se verifică înaintea soldului. O cerere refuzată de ea nu rezervă nimic și nu costă nimic.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Cerere | Protecție anti-flood |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Se numără, câte una per cerere. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Nu se numără. |
shannon-coder-1 pe /v1/chat/completions și /v1/messages | Se numără în schimb prin cota de apeluri Shannon Coder. |
O cerere cu răspuns 401 sau 400 pentru un model necunoscut | Nu se numără. |
| O cerere refuzată de protecția anti-flood | Se numără în fereastră. Nu se taxează nimic. |
Cereri în paralel
Nu există nicio limită pentru câte cereri poate avea un cont deschise simultan și nicio eroare pentru trimiterea cererilor în paralel. Cererile care nu pot porni imediat așteaptă la coadă și primesc răspuns pe rând.
- Fiecare cerere se numără în cele 120 pe minut în momentul sosirii, indiferent dacă cererile anterioare s-au terminat sau nu.
- Fiecare cerere își ține propria rezervare până se termină. Douăzeci de cereri deschise cu bugetul de ieșire implicit rețin 20 × 4,096 = 81,920 token-uri din sold. Dacă rezervările împreună depășesc soldul tău, următoarea cerere primește răspunsul
Quota exceeded, chiar dacă apelurile terminate ar fi costat mai puțin. Unmax_tokensmai mic reține mai puțin. - O cerere fără streaming nu trimite nimic până când răspunsul este complet, așa că setează clientului un timeout care acoperă așteptarea. Un stream își ține conexiunea deschisă cât așteaptă. Streaming
Limitele unei singure cereri
| Limită | Valoare | Se aplică la | La limită |
|---|---|---|---|
| Corpul cererii | 32 MiB (33,554,432 octeți) | Fiecare endpoint | Status 413, tip invalid_request_error. |
Buget de ieșire: max_tokens, max_completion_tokens, max_output_tokens | De la 1 la 65,536. Implicit 4,096; pentru shannon-coder-1 pe /v1/chat/completions și /v1/messages, valoarea implicită este 65,536. | Fiecare model, ca sumă rezervată din soldul tău. Ca limită a lungimii răspunsului: modelele open-weight găzduite, shannon-1.6-lite, shannon-1.6-pro și shannon-coder-1. | O valoare în afara intervalului este mutată la cel mai apropiat capăt al intervalului. Fără eroare. |
Secvențe de oprire: stop, stop_sequences | 4 șiruri | Modele open-weight găzduite | Se folosesc primele 4 șiruri nevide. |
| Imagine sau fișier dat ca URL | 8 MiB, citit în 20 de secunde, cel mult 5 redirecționări, o adresă publică http sau https | Fiecare endpoint care primește imagini sau fișiere | Cererea primește răspuns fără acea parte. Fără eroare. |
| Imagine sau fișier trimis inline (base64) | Nicio limită proprie. Se numără în corpul cererii de 32 MiB. | Fiecare endpoint care primește imagini sau fișiere | Status 413 pentru întreaga cerere. |
text din POST /v1/tokenize | 4,000,000 de octeți | /v1/tokenize | Status 413, tip invalid_request_error, mesaj text too long. |
messages din POST /v1/tokenize și corpul lui POST /v1/messages/count_tokens | Corpul cererii de 32 MiB | Ambele endpoint-uri de numărare | Status 413. |
| Fereastra de context | Per model: context_window în GET /v1/models | Fiecare model | Ce se întâmplă cu o conversație mai lungă depinde de model. Modele și prețuri |
Căutări web (web_search: true) | Per plan și zi: Free 3, Plus 30, Standard 50, Pro 60. Se numără o căutare pentru o cerere a cărei căutare a găsit rezultate. | Cereri care setează web_search: true | Când nu mai ai căutări, cererea primește răspuns fără căutare. Fără eroare. Căutare web integrată |
Erori
Răspunsurile acestei pagini. Pe /v1/messages, același obiect error este învelit ca {"type": "error", "error": {…}}.
| Stare | Tip | Mesaj | Când și ce să faci |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezervarea cererii nu încape în soldul tău. Așteaptă 00:00 UTC, reîncarcă creditul, schimbă planul sau trimite un max_tokens mai mic. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Mai mult de 120 de cereri în minutul curent. Așteaptă N secunde și trimite din nou. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Apelurile Shannon Coder din fereastra curentă de 4 ore au fost epuizate. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Modelul nu poate prelua cererea în acest moment. Trimite-o din nou după o scurtă pauză. |
503 | api_error | Could not verify your quota right now. Please retry. | Soldul tău nu a putut fi citit. Nu se taxează nimic; trimite cererea din nou. Pe /v1/responses cu un model Shannon, statusul este 500. |
413 | invalid_request_error | Corpul cererii este mai mare de 32 MiB. Pe endpoint-urile în format OpenAI, obiectul error conține code: "request_too_large". | |
413 | invalid_request_error | text too long | text din POST /v1/tokenize are peste 4,000,000 de octeți. |