Preskoči na sadržaj
Ograničenja i stanje

Ograničenja i stanje

Svaki zahtjev se poslužuje jednako. Nema razina ograničenja. Nema zasebne API kvote. Svoje tokene ste već platili — koristite ih koliko god brzo želite.

Ova stranica objašnjava od čega se sastoji vaše stanje, što jedan zahtjev rezervira i koliko košta, koliko zahtjeva smijete poslati i nekoliko ograničenja na koja jedan zahtjev može naići.

vrijednost 1M tokena stanja
$5.00
dnevni dopušteni iznos se obnavlja
00:00 UTC
flood protection, po računu
120 zahtjeva / min

Kako se zahtjevi poslužuju

  • Nema razina ograničenja — Jedno pravilo ograničava koliko brzo zahtjevi smiju stizati i isto je za svaki račun i svaki plan: 120 zahtjeva u minuti. Nema ograničenja tokena u minuti.
  • Nema zasebne API kvote — API troši isto stanje kao chat. Plan određuje veličinu današnjeg dopuštenog iznosa. Ne određuje učestalost zahtjeva.
  • Koliko god brzo želite — Zahtjevi poslani paralelno se prihvaćaju i čekaju u redu. Ne odbijaju se zato što su paralelni.

Vaše stanje

Vaše stanje računa se u tokenima. 1,000,000 tokena stanja vrijedi $5.00, a svaka cijena na stranici Modeli i cijene je stopa u odnosu na tu vrijednost.

U svakom trenutku stanje je zbroj dvaju dijelova.

  • Današnji dopušteni iznos plana — Broj tokena koji određuje vaš plan. Obnavlja se svaki dan u 00:00 UTC. Ono što ostane na kraju dana ne prenosi se.
  • Kupljeni kredit — Tokeni koje ste kupili kao paket. Kredit ne istječe i radi na svakom planu, uključujući Free.
Plan Tokena dnevno Vrijedi
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Redoslijed trošenja — Svaki zahtjev prvo troši današnji dopušteni iznos plana. Kupljeni kredit koristi se samo za ono što prelazi dopušteni iznos tog dana.
  • Chat i API dijele ga — Postoji jedno stanje po računu. API ključ troši sa stanja računa kojem pripada, po istim cijenama kao chat.
  • Paketi — Kredit se prodaje u paketima od 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokena ili kao iznos po vašem izboru od 1,000,000 do 100,000,000 tokena po cijeni $5.00 za 1,000,000.

Dopuna kredita Promjena plana

Što zahtjev rezervira i koliko košta

  • Rezervacija — Kada zahtjev stigne, rezervira svoj izlazni proračun sa vašeg stanja: max_tokens na /v1/chat/completions i /v1/messages, max_output_tokens na /v1/responses. /v1/chat/completions čita i max_completion_tokens. Zadana vrijednost je 4,096, a raspon je od 1 do 65,536.
  • Prihvaćanje — Zahtjev se prihvaća samo ako rezervacija stane u ono što je preostalo od vašeg stanja. Stanje koje je veće od nule, ali manje od izlaznog proračuna, dobiva odgovor Quota exceeded. Pošaljite manji max_tokens da iskoristite ostatak.
  • Obračun — Kada je odgovor potpun, rezervacija se zamjenjuje stvarnom naplatom. Naplata može biti niža ili viša od rezervacije.
  • Povrat — Zahtjev koji završi statusom greške u potpunosti vraća svoju rezervaciju.

Stvarna naplata ovisi o obitelji modela.

Modeli Što se naplaćuje
Shannon modeli usage.total_tokens po cijeni modela za 1M. Ulaz i izlaz imaju jednu cijenu.
Hostirani open-weight modeli Necacheirani ulaz po cijeni ulaza, cacheirani ulaz po cijeni cacheiranog ulaza, izlaz po cijeni izlaza.

Iznos u USD uzima se s vašeg stanja u tokenima po $5.00 za 1,000,000, zaokružen na cijeli token.

Brojanje tokena pomoću POST /v1/tokenize ili POST /v1/messages/count_tokens je besplatno i ništa ne rezervira. Brojanje tokena

Gdje vidjeti stanje i upotrebu

Stranica Ključevi i upotreba prikazuje što možete potrošiti upravo sada, današnji dopušteni iznos plana, vaš kupljeni kredit i API potrošnju u zadnjih 30 dana. Ispod toga navodi svaki zahtjev koji je napravio vaš ključ: vrijeme, endpoint, model, cacheirani ulaz, naplaćene tokene i trošak. Ključevi i upotreba

Svaki odgovor nosi i objekt usage s brojevima tokena tog poziva.

Endpoint Polja usage Dodaju hostirani open-weight modeli
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage sadrži brojeve tokena modela. Iznos uzet s vašeg stanja nije u odgovoru: nalazi se u stupcu Naplaćeni tokeni na popisu zahtjeva na stranici Ključevi i upotreba.
  • Na /v1/messages s hostiranim open-weight modelom input_tokens je necacheirani dio ulaza, cache_read_input_tokens je cacheirani dio, a cache_creation_input_tokens je uvijek 0.
  • Stream na /v1/chat/completions nosi usage u svom zadnjem chunku prije [DONE]. Streaming

Kada stanje ponestane

Zahtjev čija rezervacija ne stane u vaše stanje dobiva odgovor sa statusom 429, tipom rate_limit_error i porukom u nastavku. Ništa se ne naplaćuje. Isti odgovor šalje se i kada je stanje veće od nule, ali manje od izlaznog proračuna zahtjeva.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Na /v1/responses objekt error može sadržavati i code i param, oba null.

Što možete učiniti:

  • Pričekajte sljedeći dopušteni iznos plana u 00:00 UTC.
  • Dopunite kredit. Kredit se troši nakon dopuštenog iznosa plana i ne istječe. Dopuna kredita
  • Prijeđite na plan s većim dnevnim dopuštenim iznosom. Promjena plana
  • Pošaljite manji max_tokens, ako je ostalo nešto stanja: rezervacija je tada manja.

Dopušteni broj Shannon Coder poziva

shannon-coder-1 na /v1/chat/completions i /v1/messages broji se u pozivima, a ne u tokenima. Svaki plan uključuje određeni broj poziva po prozoru od 4 sata. Jedan zahtjev je jedan poziv.

Plan Pozivi po prozoru od 4 sata
Free 3
Plus 20
Standard 40
Pro 60
  • Prozori počinju u 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Pozivi koji ostanu na kraju prozora ne prenose se.
  • Poziv se broji kada je zahtjev prihvaćen, prije nego model odgovori. Zahtjev koji nakon toga ne uspije također se računa kao poziv.
  • Ovi pozivi ne rezerviraju tokene i ništa ne uzimaju s vašeg stanja. Popis zahtjeva na stranici Ključevi i upotreba prikazuje njihov broj tokena i njegovu vrijednost po navedenoj cijeni.
  • Zadani max_tokens za shannon-coder-1 na ova dva endpointa je 65,536.
  • Kada nema preostalih poziva, odgovor ima status 429, tip rate_limit_error i poruku Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Na /v1/responses shannon-coder-1 nema dopuštenog broja poziva: naplaćuje se u tokenima sa vašeg stanja po $8.00 za 1M, kao i svaki drugi model.

Flood protection

Račun smije slati 120 zahtjeva u minuti. To je jedino ograničenje učestalosti zahtjeva i isto je na svakom planu. Postoji da spriječi poplave zahtjeva, a ne da uspori uobičajenu upotrebu.

  • Minuta je fiksni prozor od 60 sekundi koji se otvara vašim prvim zahtjevom. Kada završi, brojanje počinje ponovno od nule.
  • Brojanje je po računu, ne po ključu i ne po IP adresi. Zamjena ključa ne otvara novi prozor.
  • 121. zahtjev unutar prozora dobiva odgovor sa statusom 429, tipom rate_limit_error i porukom Too many requests. Retry in <N>s. N je broj sekundi do kraja prozora, od 1 do 60.
  • Flood protection provjerava se prije stanja. Zahtjev koji odbije ništa ne rezervira i ništa ne košta.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Zahtjev Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Broji se, jedan po zahtjevu.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Ne broji se.
shannon-coder-1 na /v1/chat/completions i /v1/messages Umjesto toga broji se prema dopuštenom broju Shannon Coder poziva.
Zahtjev koji je dobio odgovor 401 ili 400 zbog nepoznatog model Ne broji se.
Zahtjev koji je odbio flood protection Broji se u prozor. Ništa se ne naplaćuje.

Paralelni zahtjevi

Ne postoji ograničenje broja zahtjeva koje račun ima otvorene istodobno, niti greška zbog slanja paralelnih zahtjeva. Zahtjevi koji ne mogu odmah početi čekaju u redu i odgovara im se redom.

  • Svaki zahtjev ulazi u 120 u minuti kada stigne, bez obzira jesu li raniji zahtjevi završili.
  • Svaki zahtjev drži vlastitu rezervaciju dok ne završi. Dvadeset otvorenih zahtjeva sa zadanim izlaznim proračunom drži 20 × 4,096 = 81,920 tokena stanja. Ako su rezervacije zajedno veće od vašeg stanja, sljedeći zahtjev dobiva odgovor Quota exceeded, iako bi završeni pozivi koštali manje. Manji max_tokens drži manje.
  • Zahtjev bez streaminga ne šalje ništa dok njegov odgovor nije potpun, zato svom klijentu postavite timeout koji pokriva čekanje. Stream drži svoju vezu otvorenom dok čeka. Streaming

Ograničenja jednog zahtjeva

Ograničenje Vrijednost Vrijedi za Na granici
Tijelo zahtjeva 32 MiB (33,554,432 bajtova) Svaki endpoint Status 413, tip invalid_request_error.
Izlazni proračun: max_tokens, max_completion_tokens, max_output_tokens Od 1 do 65,536. Zadano 4,096; za shannon-coder-1 na /v1/chat/completions i /v1/messages zadano je 65,536. Svaki model, kao iznos rezerviran sa vašeg stanja. Kao ograničenje duljine odgovora: hostirani open-weight modeli, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. Vrijednost izvan raspona pomiče se na najbliži kraj raspona. Bez greške.
Stop sekvence: stop, stop_sequences 4 niza Hostirani open-weight modeli Koristi se prva 4 neprazna niza.
Slika ili datoteka zadana kao URL 8 MiB, čitanje unutar 20 sekundi, najviše 5 preusmjeravanja, javna http ili https adresa Svaki endpoint koji prima slike ili datoteke Zahtjev dobiva odgovor bez tog dijela. Bez greške.
Slika ili datoteka poslana inline (base64) Nema vlastitog ograničenja. Ulazi u tijelo zahtjeva od 32 MiB. Svaki endpoint koji prima slike ili datoteke Status 413 za cijeli zahtjev.
text u POST /v1/tokenize 4,000,000 bajtova /v1/tokenize Status 413, tip invalid_request_error, poruka text too long.
messages u POST /v1/tokenize i tijelo POST /v1/messages/count_tokens Tijelo zahtjeva od 32 MiB Oba endpointa za brojanje Status 413.
Kontekstni prozor Po modelu: context_window u GET /v1/models Svaki model Što se događa s dužim razgovorom ovisi o modelu. Modeli i cijene
Web pretrage (web_search: true) Po planu i danu: Free 3, Plus 30, Standard 50, Pro 60. Jedna pretraga broji se za zahtjev čija je pretraga pronašla rezultate. Zahtjevi koji postave web_search: true Kada nijedna nije preostala, zahtjev dobiva odgovor bez pretrage. Bez greške. Ugrađena web pretraga

Greške

Odgovori ove stranice. Na /v1/messages isti objekt error umotan je kao {"type": "error", "error": {…}}.

Status Tip Poruka Kada i što učiniti
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervacija zahtjeva ne stane u vaše stanje. Pričekajte 00:00 UTC, dopunite kredit, promijenite plan ili pošaljite manji max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Više od 120 zahtjeva u trenutačnoj minuti. Pričekajte N sekundi i pošaljite ponovno.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Shannon Coder pozivi trenutačnog prozora od 4 sata su potrošeni.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model trenutačno ne može primiti zahtjev. Pošaljite ga ponovno nakon kratke stanke.
503 api_error Could not verify your quota right now. Please retry. Vaše stanje nije moglo biti pročitano. Ništa se ne naplaćuje; pošaljite zahtjev ponovno. Na /v1/responses sa Shannon modelom status je 500.
413 invalid_request_error Tijelo zahtjeva veće je od 32 MiB. Na endpointima u OpenAI formatu objekt error sadrži code: "request_too_large".
413 invalid_request_error text too long text u POST /v1/tokenize dulji je od 4,000,000 bajtova.