Preskoči na sadržaj
Ograničenja i stanje

Ograničenja i stanje

Svaki zahtev se opslužuje jednako. Bez nivoa ograničenja brzine. Bez posebne API kvote. Svoje tokene ste već platili — koristite ih koliko god brzo želite.

Ova stranica objašnjava od čega se sastoji vaše stanje, šta jedan zahtev rezerviše i košta, koliko zahteva smete da pošaljete i nekoliko ograničenja na koja jedan zahtev može da naiđe.

vrednost 1M tokena stanja
$5.00
dnevni limit se obnavlja
00:00 UTC
zaštita od flooda, po nalogu
120 zahteva / min

Kako se zahtevi opslužuju

  • Bez nivoa ograničenja brzine — Jedno pravilo ograničava koliko brzo zahtevi smeju da stižu i isto je za svaki nalog i svaki plan: 120 zahteva u minuti. Nema ograničenja tokena u minuti.
  • Bez posebne API kvote — API troši isto stanje kao čet. Plan određuje veličinu današnjeg limita. Ne određuje brzinu zahteva.
  • Koliko god brzo želite — Zahtevi poslati paralelno se prihvataju i čekaju u redu. Ne odbijaju se zato što su paralelni.

Vaše stanje

Vaše stanje se računa u tokenima. 1,000,000 tokena stanja vredi $5.00, a svaka cena na stranici Modeli i cene je stopa u odnosu na tu vrednost.

U svakom trenutku stanje je zbir dva dela.

  • Današnji limit plana — Broj tokena koji određuje vaš plan. Obnavlja se svakog dana u 00:00 UTC. Ono što preostane na kraju dana ne prenosi se.
  • Kupljeni kredit — Tokeni koje ste kupili kao paket. Kredit ne ističe i važi na svakom planu, uključujući Free.
Plan Tokena dnevno Vredi
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Redosled trošenja — Svaki zahtev prvo troši današnji limit plana. Kupljeni kredit se koristi samo za ono što prelazi limit tog dana.
  • Čet i API ga dele — Postoji jedno stanje po nalogu. API ključ troši sa stanja naloga koji ga poseduje, po istim cenama kao čet.
  • Paketi — Kredit se prodaje u paketima od 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokena, ili kao iznos po vašem izboru od 1,000,000 do 100,000,000 tokena po ceni od $5.00 za 1,000,000.

Dopuna kredita Promena plana

Šta zahtev rezerviše i šta košta

  • Rezervacija — Kada zahtev stigne, rezerviše svoj izlazni budžet sa vašeg stanja: max_tokens na /v1/chat/completions i /v1/messages, max_output_tokens na /v1/responses. /v1/chat/completions čita i max_completion_tokens. Podrazumevano je 4,096, a opseg je od 1 do 65,536.
  • Prihvatanje — Zahtev se prihvata samo ako rezervacija stane u ono što je preostalo na vašem stanju. Stanje koje je veće od nule, ali manje od izlaznog budžeta, dobija odgovor Quota exceeded. Pošaljite manji max_tokens da iskoristite ostatak.
  • Obračun — Kada je odgovor završen, rezervacija se zamenjuje stvarnom naplatom. Naplata može biti niža ili viša od rezervacije.
  • Povraćaj — Zahtev koji se završi statusom greške vraća svoju rezervaciju u celosti.

Stvarna naplata zavisi od porodice modela.

Modeli Šta se naplaćuje
Shannon modeli usage.total_tokens po ceni modela za 1M. Ulaz i izlaz imaju jednu cenu.
Hostovani open-weight modeli Nekeširani ulaz po ceni ulaza, keširani ulaz po ceni keširanog, izlaz po ceni izlaza.

Iznos u USD se uzima sa vašeg stanja u tokenima po $5.00 za 1,000,000, zaokružen na ceo token.

Brojanje tokena pomoću POST /v1/tokenize ili POST /v1/messages/count_tokens je besplatno i ništa ne rezerviše. Brojanje tokena

Gde videti stanje i upotrebu

Stranica Ključevi i upotreba prikazuje šta možete da potrošite upravo sada, današnji limit plana, vaš kupljeni kredit i API potrošnju poslednjih 30 dana. Ispod toga navodi svaki zahtev koji je vaš ključ uputio: vreme, endpoint, model, keširani ulaz, naplaćene tokene i cenu. Ključevi i upotreba

Svaki odgovor nosi i objekat usage sa brojevima tokena tog poziva.

Endpoint Polja u usage Dodaju hostovani open-weight modeli
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage sadrži brojeve tokena modela. Iznos skinut sa vašeg stanja nije u odgovoru: to je kolona Naplaćeni tokeni na listi zahteva u Ključevi i upotreba.
  • Na /v1/messages sa hostovanim open-weight modelom, input_tokens je nekeširani deo ulaza, cache_read_input_tokens je keširani deo, a cache_creation_input_tokens je uvek 0.
  • Stream na /v1/chat/completions nosi usage u svom poslednjem delu pre [DONE]. Streaming

Kada se stanje potroši

Na zahtev čija se rezervacija ne uklapa u vaše stanje odgovara se statusom 429, tipom rate_limit_error i porukom ispod. Ništa se ne naplaćuje. Isti odgovor se šalje kada je stanje veće od nule, ali manje od izlaznog budžeta zahteva.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Na /v1/responses objekat error može sadržati i code i param, oba null.

Šta možete da uradite:

  • Sačekajte sledeći limit plana u 00:00 UTC.
  • Dopunite kredit. Kredit se troši posle limita plana i ne ističe. Dopuna kredita
  • Pređite na plan sa većim dnevnim limitom. Promena plana
  • Pošaljite manji max_tokens, ako je nešto stanja preostalo: rezervacija je tada manja.

Dozvola Shannon Coder poziva

shannon-coder-1 na /v1/chat/completions i /v1/messages računa se u pozivima, a ne u tokenima. Svaki plan uključuje određen broj poziva po 4-časovnom periodu. Jedan zahtev je jedan poziv.

Plan Poziva po 4-časovnom periodu
Free 3
Plus 20
Standard 40
Pro 60
  • Periodi počinju u 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Pozivi koji preostanu na kraju perioda ne prenose se.
  • Poziv se računa kada se zahtev prihvati, pre nego što model odgovori. Zahtev koji kasnije ne uspe i dalje se računa kao poziv.
  • Ovi pozivi ne rezervišu tokene i ne uzimaju ništa sa vašeg stanja. Lista zahteva u Ključevi i upotreba prikazuje njihov broj tokena i njegovu vrednost po navedenoj ceni.
  • Podrazumevani max_tokens za shannon-coder-1 na ova dva endpointa je 65,536.
  • Kada nema preostalih poziva, odgovor je status 429, tip rate_limit_error, poruka Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Na /v1/responses shannon-coder-1 nema dozvolu poziva: naplaćuje se u tokenima sa vašeg stanja po $8.00 za 1M, kao i svaki drugi model.

Zaštita od flooda

Nalog može da pošalje 120 zahteva u minuti. To je jedino ograničenje brzine zahteva i isto je na svakom planu. Postoji da zaustavi flood, a ne da uspori normalnu upotrebu.

  • Minut je fiksni period od 60 sekundi koji se otvara vašim prvim zahtevom. Kada istekne, brojanje počinje iznova od nule.
  • Brojanje je po nalogu, a ne po ključu ni po IP adresi. Rotiranje ključa ne otvara novi period.
  • Na 121. zahtev unutar perioda odgovara se statusom 429, tipom rate_limit_error i porukom Too many requests. Retry in <N>s. N je broj sekundi do kraja perioda, od 1 do 60.
  • Zaštita od flooda proverava se pre stanja. Zahtev koji odbije ništa ne rezerviše i ništa ne košta.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Zahtev Zaštita od flooda
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Računa se, jedan po zahtevu.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Ne računa se.
shannon-coder-1 na /v1/chat/completions i /v1/messages Umesto toga računa se dozvolom Shannon Coder poziva.
Zahtev na koji je odgovoreno sa 401, ili sa 400 za nepoznat model Ne računa se.
Zahtev koji je odbila zaštita od flooda Računa se u period. Ništa se ne naplaćuje.

Paralelni zahtevi

Nema ograničenja koliko zahteva nalog može imati otvoreno istovremeno, niti greške zbog slanja zahteva paralelno. Zahtevi koji ne mogu odmah da počnu čekaju u redu i odgovara im se redom.

  • Svaki zahtev se računa u 120 u minuti kada stigne, bez obzira na to da li su raniji zahtevi završeni.
  • Svaki zahtev drži svoju rezervaciju dok se ne završi. Dvadeset otvorenih zahteva sa podrazumevanim izlaznim budžetom drži 20 × 4,096 = 81,920 tokena stanja. Ako su rezervacije zajedno veće od vašeg stanja, sledeći zahtev dobija odgovor Quota exceeded, iako bi završeni pozivi koštali manje. Manji max_tokens drži manje.
  • Zahtev bez streaminga ne šalje ništa dok njegov odgovor nije kompletan, zato klijentu dajte timeout koji pokriva čekanje. Stream drži vezu otvorenom dok čeka. Streaming

Ograničenja jednog zahteva

Ograničenje Vrednost Važi za Na ograničenju
Telo zahteva 32 MiB (33,554,432 bajtova) Svaki endpoint Status 413, tip invalid_request_error.
Izlazni budžet: max_tokens, max_completion_tokens, max_output_tokens 1 do 65,536. Podrazumevano 4,096; za shannon-coder-1 na /v1/chat/completions i /v1/messages podrazumevano je 65,536. Svaki model, kao iznos rezervisan sa vašeg stanja. Kao ograničenje dužine odgovora: hostovani open-weight modeli, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. Vrednost van opsega pomera se na najbliži kraj opsega. Bez greške.
Stop sekvence: stop, stop_sequences 4 stringa Hostovani open-weight modeli Koristi se prvih 4 neprazna stringa.
Slika ili fajl dat kao URL 8 MiB, čita se u roku od 20 sekundi, najviše 5 preusmeravanja, javna http ili https adresa Svaki endpoint koji prima slike ili fajlove Na zahtev se odgovara bez tog dela. Bez greške.
Slika ili fajl poslat direktno u zahtevu (base64) Nema sopstveno ograničenje. Računa se u telo zahteva od 32 MiB. Svaki endpoint koji prima slike ili fajlove Status 413 za ceo zahtev.
text u POST /v1/tokenize 4,000,000 bajtova /v1/tokenize Status 413, tip invalid_request_error, poruka text too long.
messages u POST /v1/tokenize i telo POST /v1/messages/count_tokens Telo zahteva od 32 MiB Oba endpointa za brojanje Status 413.
Kontekstni prozor Po modelu: context_window u GET /v1/models Svaki model Šta se dešava sa dužim razgovorom zavisi od modela. Modeli i cene
Web pretrage (web_search: true) Po planu i danu: Free 3, Plus 30, Standard 50, Pro 60. Jedna pretraga se računa za zahtev čija je pretraga našla rezultate. Zahtevi koji postavljaju web_search: true Kada nijedna ne preostane, na zahtev se odgovara bez pretrage. Bez greške. Ugrađena web pretraga

Greške

Odgovori ove stranice. Na /v1/messages isti objekat error je upakovan kao {"type": "error", "error": {…}}.

Status Tip Poruka Kada i šta uraditi
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervacija zahteva ne uklapa se u vaše stanje. Sačekajte 00:00 UTC, dopunite kredit, promenite plan ili pošaljite manji max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Više od 120 zahteva u tekućem minutu. Sačekajte N sekundi i pošaljite ponovo.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Shannon Coder pozivi tekućeg 4-časovnog perioda su potrošeni.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model trenutno ne može da primi zahtev. Pošaljite ga ponovo posle kratke pauze.
503 api_error Could not verify your quota right now. Please retry. Vaše stanje nije moglo da se pročita. Ništa se ne naplaćuje; pošaljite zahtev ponovo. Na /v1/responses sa Shannon modelom status je 500.
413 invalid_request_error Telo zahteva je veće od 32 MiB. Na endpointima u OpenAI formatu objekat error nosi code: "request_too_large".
413 invalid_request_error text too long text u POST /v1/tokenize duži je od 4,000,000 bajtova.