Sari la conținut
Limite și sold

Limite și sold

Fiecare cerere este servită egal. Fără niveluri de rată. Fără cotă API separată. Ți-ai plătit deja token-urile — folosește-le cât de repede vrei.

Această pagină explică din ce este format soldul tău, ce rezervă și cât costă o cerere, câte cereri poți trimite și puținele limite pe care le poate întâlni o singură cerere.

valoarea a 1M token-uri de sold
$5.00
cota zilnică se reînnoiește
00:00 UTC
protecție anti-flood, per cont
120 cereri / min

Cum sunt servite cererile

  • Fără niveluri de rată — O singură regulă limitează cât de repede pot sosi cererile și este aceeași pentru fiecare cont și fiecare plan: 120 de cereri pe minut. Nu există nicio limită de token-uri pe minut.
  • Fără cotă API separată — API-ul consumă același sold ca și chatul. Un plan stabilește mărimea cotei de astăzi. Nu stabilește o rată a cererilor.
  • Cât de repede vrei — Cererile trimise în paralel sunt acceptate și așteaptă la coadă. Nu sunt refuzate pentru că sunt paralele.

Soldul tău

Soldul tău este numărat în token-uri. 1,000,000 de token-uri de sold valorează $5.00, iar fiecare preț de pe pagina Models & pricing este un tarif raportat la această valoare.

În orice moment, soldul este suma a două părți.

  • Cota planului de astăzi — Un număr de token-uri stabilit de planul tău. Se reînnoiește în fiecare zi la 00:00 UTC. Ce rămâne la sfârșitul zilei nu se reportează.
  • Credit achiziționat — Token-uri pe care le-ai cumpărat ca pachet. Creditul nu expiră și funcționează pe orice plan, inclusiv Free.
Plan Token-uri pe zi Valoare
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Ordinea consumului — Fiecare cerere consumă mai întâi cota planului de astăzi. Creditul achiziționat se folosește doar pentru ce depășește cota din ziua respectivă.
  • Chatul și API-ul îl folosesc împreună — Există un singur sold per cont. O cheie API consumă din soldul contului căruia îi aparține, la aceleași prețuri ca în chat.
  • Pachete — Creditul se vinde în pachete de 1,000,000 ($5.00), 2,000,000 ($10.00) și 5,000,000 ($25.00) token-uri sau ca o sumă la alegere, de la 1,000,000 la 100,000,000 token-uri, la $5.00 per 1,000,000.

Reîncărcare credit Schimbare plan

Ce rezervă o cerere și cât costă

  • Rezervare — Când sosește o cerere, ea rezervă din soldul tău bugetul de ieșire: max_tokens pe /v1/chat/completions și /v1/messages, max_output_tokens pe /v1/responses. /v1/chat/completions citește și max_completion_tokens. Valoarea implicită este 4,096, iar intervalul este de la 1 la 65,536.
  • Admitere — Cererea este acceptată doar dacă rezervarea încape în ce a rămas din soldul tău. Un sold mai mare ca zero, dar mai mic decât bugetul de ieșire, primește răspunsul Quota exceeded. Trimite un max_tokens mai mic pentru a folosi restul.
  • Decontare — Când răspunsul este complet, rezervarea este înlocuită cu taxa reală. Taxa poate fi mai mică sau mai mare decât rezervarea.
  • Returnare — O cerere care se termină cu un status de eroare își returnează rezervarea integral.

Taxarea reală depinde de familia modelului.

Modele Ce se taxează
Modele Shannon usage.total_tokens la prețul modelului per 1M. Intrarea și ieșirea au un singur tarif.
Modele open-weight găzduite Intrarea necache-uită la tariful de intrare, intrarea din cache la tariful pentru cache, ieșirea la tariful de ieșire.

Suma în USD este scăzută din soldul tău în token-uri la $5.00 per 1,000,000, rotunjită la un token întreg.

Numărarea token-urilor cu POST /v1/tokenize sau POST /v1/messages/count_tokens este gratuită și nu rezervă nimic. Numărarea token-urilor

Unde vezi soldul și utilizarea

Pagina Keys & usage arată ce poți cheltui chiar acum, cota planului de astăzi, creditul tău achiziționat și cheltuielile API din ultimele 30 de zile. Mai jos listează fiecare cerere făcută de cheia ta: ora, endpoint-ul, modelul, intrarea din cache, token-urile taxate și costul. Chei și utilizare

Fiecare răspuns conține și un obiect usage cu numărul de token-uri al apelului respectiv.

Endpoint Câmpuri din usage Adăugate de modelele open-weight găzduite
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage conține numărul de token-uri al modelului. Suma scăzută din soldul tău nu apare în răspuns: este coloana Billed tokens din lista de cereri din Keys & usage.
  • Pe /v1/messages cu un model open-weight găzduit, input_tokens este partea necache-uită a intrării, cache_read_input_tokens este partea din cache, iar cache_creation_input_tokens este întotdeauna 0.
  • Un stream pe /v1/chat/completions conține usage în ultimul chunk, înainte de [DONE]. Streaming

Când soldul se epuizează

O cerere a cărei rezervare nu încape în soldul tău primește răspuns cu statusul 429, tipul rate_limit_error și mesajul de mai jos. Nu se taxează nimic. Același răspuns se trimite și când soldul este mai mare ca zero, dar mai mic decât bugetul de ieșire al cererii.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Pe /v1/responses, obiectul error poate conține și code și param, ambele null.

Ce poți face:

  • Așteaptă următoarea cotă a planului, la 00:00 UTC.
  • Reîncarcă creditul. Creditul se consumă după cota planului și nu expiră. Reîncărcare credit
  • Treci la un plan cu o cotă zilnică mai mare. Schimbare plan
  • Trimite un max_tokens mai mic, dacă a mai rămas ceva sold: rezervarea va fi atunci mai mică.

Cota de apeluri Shannon Coder

shannon-coder-1 pe /v1/chat/completions și /v1/messages se numără în apeluri, nu în token-uri. Fiecare plan include un număr de apeluri pe fereastră de 4 ore. O cerere este un apel.

Plan Apeluri pe fereastră de 4 ore
Free 3
Plus 20
Standard 40
Pro 60
  • Ferestrele încep la 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Apelurile rămase la sfârșitul unei ferestre nu se reportează.
  • Un apel este numărat când cererea este acceptată, înainte ca modelul să răspundă. O cerere care eșuează ulterior se numără tot ca apel.
  • Aceste apeluri nu rezervă token-uri și nu iau nimic din soldul tău. Lista de cereri din Keys & usage arată numărul lor de token-uri și valoarea acestuia la prețul listat.
  • Valoarea implicită a max_tokens pentru shannon-coder-1 pe aceste două endpoint-uri este 65,536.
  • Când nu mai ai apeluri, răspunsul are statusul 429, tipul rate_limit_error și mesajul Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Pe /v1/responses, shannon-coder-1 nu are cotă de apeluri: este taxat în token-uri din soldul tău la $8.00 per 1M, ca orice alt model.

Protecție anti-flood

Un cont poate trimite 120 de cereri pe minut. Aceasta este singura limită a ratei cererilor și este aceeași pe orice plan. Există pentru a opri inundările de cereri, nu pentru a încetini folosirea normală.

  • Minutul este o fereastră fixă de 60 de secunde, care se deschide cu prima ta cerere. Când se termină, numărătoarea pornește din nou de la zero.
  • Numărătoarea este per cont, nu per cheie și nu per adresă IP. Schimbarea cheii nu deschide o fereastră nouă.
  • A 121-a cerere dintr-o fereastră primește răspuns cu statusul 429, tipul rate_limit_error și mesajul Too many requests. Retry in <N>s. N este numărul de secunde până la sfârșitul ferestrei, de la 1 la 60.
  • Protecția anti-flood se verifică înaintea soldului. O cerere refuzată de ea nu rezervă nimic și nu costă nimic.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Cerere Protecție anti-flood
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Se numără, câte una per cerere.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Nu se numără.
shannon-coder-1 pe /v1/chat/completions și /v1/messages Se numără în schimb prin cota de apeluri Shannon Coder.
O cerere cu răspuns 401 sau 400 pentru un model necunoscut Nu se numără.
O cerere refuzată de protecția anti-flood Se numără în fereastră. Nu se taxează nimic.

Cereri în paralel

Nu există nicio limită pentru câte cereri poate avea un cont deschise simultan și nicio eroare pentru trimiterea cererilor în paralel. Cererile care nu pot porni imediat așteaptă la coadă și primesc răspuns pe rând.

  • Fiecare cerere se numără în cele 120 pe minut în momentul sosirii, indiferent dacă cererile anterioare s-au terminat sau nu.
  • Fiecare cerere își ține propria rezervare până se termină. Douăzeci de cereri deschise cu bugetul de ieșire implicit rețin 20 × 4,096 = 81,920 token-uri din sold. Dacă rezervările împreună depășesc soldul tău, următoarea cerere primește răspunsul Quota exceeded, chiar dacă apelurile terminate ar fi costat mai puțin. Un max_tokens mai mic reține mai puțin.
  • O cerere fără streaming nu trimite nimic până când răspunsul este complet, așa că setează clientului un timeout care acoperă așteptarea. Un stream își ține conexiunea deschisă cât așteaptă. Streaming

Limitele unei singure cereri

Limită Valoare Se aplică la La limită
Corpul cererii 32 MiB (33,554,432 octeți) Fiecare endpoint Status 413, tip invalid_request_error.
Buget de ieșire: max_tokens, max_completion_tokens, max_output_tokens De la 1 la 65,536. Implicit 4,096; pentru shannon-coder-1 pe /v1/chat/completions și /v1/messages, valoarea implicită este 65,536. Fiecare model, ca sumă rezervată din soldul tău. Ca limită a lungimii răspunsului: modelele open-weight găzduite, shannon-1.6-lite, shannon-1.6-pro și shannon-coder-1. O valoare în afara intervalului este mutată la cel mai apropiat capăt al intervalului. Fără eroare.
Secvențe de oprire: stop, stop_sequences 4 șiruri Modele open-weight găzduite Se folosesc primele 4 șiruri nevide.
Imagine sau fișier dat ca URL 8 MiB, citit în 20 de secunde, cel mult 5 redirecționări, o adresă publică http sau https Fiecare endpoint care primește imagini sau fișiere Cererea primește răspuns fără acea parte. Fără eroare.
Imagine sau fișier trimis inline (base64) Nicio limită proprie. Se numără în corpul cererii de 32 MiB. Fiecare endpoint care primește imagini sau fișiere Status 413 pentru întreaga cerere.
text din POST /v1/tokenize 4,000,000 de octeți /v1/tokenize Status 413, tip invalid_request_error, mesaj text too long.
messages din POST /v1/tokenize și corpul lui POST /v1/messages/count_tokens Corpul cererii de 32 MiB Ambele endpoint-uri de numărare Status 413.
Fereastra de context Per model: context_window în GET /v1/models Fiecare model Ce se întâmplă cu o conversație mai lungă depinde de model. Modele și prețuri
Căutări web (web_search: true) Per plan și zi: Free 3, Plus 30, Standard 50, Pro 60. Se numără o căutare pentru o cerere a cărei căutare a găsit rezultate. Cereri care setează web_search: true Când nu mai ai căutări, cererea primește răspuns fără căutare. Fără eroare. Căutare web integrată

Erori

Răspunsurile acestei pagini. Pe /v1/messages, același obiect error este învelit ca {"type": "error", "error": {…}}.

Stare Tip Mesaj Când și ce să faci
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervarea cererii nu încape în soldul tău. Așteaptă 00:00 UTC, reîncarcă creditul, schimbă planul sau trimite un max_tokens mai mic.
429 rate_limit_error Too many requests. Retry in <N>s. Mai mult de 120 de cereri în minutul curent. Așteaptă N secunde și trimite din nou.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Apelurile Shannon Coder din fereastra curentă de 4 ore au fost epuizate.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Modelul nu poate prelua cererea în acest moment. Trimite-o din nou după o scurtă pauză.
503 api_error Could not verify your quota right now. Please retry. Soldul tău nu a putut fi citit. Nu se taxează nimic; trimite cererea din nou. Pe /v1/responses cu un model Shannon, statusul este 500.
413 invalid_request_error Corpul cererii este mai mare de 32 MiB. Pe endpoint-urile în format OpenAI, obiectul error conține code: "request_too_large".
413 invalid_request_error text too long text din POST /v1/tokenize are peste 4,000,000 de octeți.