Ograničenja i stanje
Svaki zahtev se opslužuje jednako. Bez nivoa ograničenja brzine. Bez posebne API kvote. Svoje tokene ste već platili — koristite ih koliko god brzo želite.
Ova stranica objašnjava od čega se sastoji vaše stanje, šta jedan zahtev rezerviše i košta, koliko zahteva smete da pošaljete i nekoliko ograničenja na koja jedan zahtev može da naiđe.
- vrednost 1M tokena stanja
- $5.00
- dnevni limit se obnavlja
- 00:00 UTC
- zaštita od flooda, po nalogu
- 120 zahteva / min
Kako se zahtevi opslužuju
- Bez nivoa ograničenja brzine — Jedno pravilo ograničava koliko brzo zahtevi smeju da stižu i isto je za svaki nalog i svaki plan: 120 zahteva u minuti. Nema ograničenja tokena u minuti.
- Bez posebne API kvote — API troši isto stanje kao čet. Plan određuje veličinu današnjeg limita. Ne određuje brzinu zahteva.
- Koliko god brzo želite — Zahtevi poslati paralelno se prihvataju i čekaju u redu. Ne odbijaju se zato što su paralelni.
Vaše stanje
Vaše stanje se računa u tokenima. 1,000,000 tokena stanja vredi $5.00, a svaka cena na stranici Modeli i cene je stopa u odnosu na tu vrednost.
U svakom trenutku stanje je zbir dva dela.
- Današnji limit plana — Broj tokena koji određuje vaš plan. Obnavlja se svakog dana u 00:00 UTC. Ono što preostane na kraju dana ne prenosi se.
- Kupljeni kredit — Tokeni koje ste kupili kao paket. Kredit ne ističe i važi na svakom planu, uključujući Free.
| Plan | Tokena dnevno | Vredi |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Redosled trošenja — Svaki zahtev prvo troši današnji limit plana. Kupljeni kredit se koristi samo za ono što prelazi limit tog dana.
- Čet i API ga dele — Postoji jedno stanje po nalogu. API ključ troši sa stanja naloga koji ga poseduje, po istim cenama kao čet.
- Paketi — Kredit se prodaje u paketima od 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokena, ili kao iznos po vašem izboru od 1,000,000 do 100,000,000 tokena po ceni od $5.00 za 1,000,000.
Šta zahtev rezerviše i šta košta
- Rezervacija — Kada zahtev stigne, rezerviše svoj izlazni budžet sa vašeg stanja:
max_tokensna/v1/chat/completionsi/v1/messages,max_output_tokensna/v1/responses./v1/chat/completionsčita imax_completion_tokens. Podrazumevano je 4,096, a opseg je od 1 do 65,536. - Prihvatanje — Zahtev se prihvata samo ako rezervacija stane u ono što je preostalo na vašem stanju. Stanje koje je veće od nule, ali manje od izlaznog budžeta, dobija odgovor
Quota exceeded. Pošaljite manjimax_tokensda iskoristite ostatak. - Obračun — Kada je odgovor završen, rezervacija se zamenjuje stvarnom naplatom. Naplata može biti niža ili viša od rezervacije.
- Povraćaj — Zahtev koji se završi statusom greške vraća svoju rezervaciju u celosti.
Stvarna naplata zavisi od porodice modela.
| Modeli | Šta se naplaćuje |
|---|---|
| Shannon modeli | usage.total_tokens po ceni modela za 1M. Ulaz i izlaz imaju jednu cenu. |
| Hostovani open-weight modeli | Nekeširani ulaz po ceni ulaza, keširani ulaz po ceni keširanog, izlaz po ceni izlaza. |
Iznos u USD se uzima sa vašeg stanja u tokenima po $5.00 za 1,000,000, zaokružen na ceo token.
Brojanje tokena pomoću POST /v1/tokenize ili POST /v1/messages/count_tokens je besplatno i ništa ne rezerviše. Brojanje tokena
Gde videti stanje i upotrebu
Stranica Ključevi i upotreba prikazuje šta možete da potrošite upravo sada, današnji limit plana, vaš kupljeni kredit i API potrošnju poslednjih 30 dana. Ispod toga navodi svaki zahtev koji je vaš ključ uputio: vreme, endpoint, model, keširani ulaz, naplaćene tokene i cenu. Ključevi i upotreba
Svaki odgovor nosi i objekat usage sa brojevima tokena tog poziva.
| Endpoint | Polja u usage | Dodaju hostovani open-weight modeli |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagesadrži brojeve tokena modela. Iznos skinut sa vašeg stanja nije u odgovoru: to je kolona Naplaćeni tokeni na listi zahteva u Ključevi i upotreba.- Na
/v1/messagessa hostovanim open-weight modelom,input_tokensje nekeširani deo ulaza,cache_read_input_tokensje keširani deo, acache_creation_input_tokensje uvek0. - Stream na
/v1/chat/completionsnosiusageu svom poslednjem delu pre[DONE]. Streaming
Kada se stanje potroši
Na zahtev čija se rezervacija ne uklapa u vaše stanje odgovara se statusom 429, tipom rate_limit_error i porukom ispod. Ništa se ne naplaćuje. Isti odgovor se šalje kada je stanje veće od nule, ali manje od izlaznog budžeta zahteva.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Na /v1/responses objekat error može sadržati i code i param, oba null.
Šta možete da uradite:
- Sačekajte sledeći limit plana u 00:00 UTC.
- Dopunite kredit. Kredit se troši posle limita plana i ne ističe. Dopuna kredita
- Pređite na plan sa većim dnevnim limitom. Promena plana
- Pošaljite manji
max_tokens, ako je nešto stanja preostalo: rezervacija je tada manja.
Dozvola Shannon Coder poziva
shannon-coder-1 na /v1/chat/completions i /v1/messages računa se u pozivima, a ne u tokenima. Svaki plan uključuje određen broj poziva po 4-časovnom periodu. Jedan zahtev je jedan poziv.
| Plan | Poziva po 4-časovnom periodu |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Periodi počinju u 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Pozivi koji preostanu na kraju perioda ne prenose se.
- Poziv se računa kada se zahtev prihvati, pre nego što model odgovori. Zahtev koji kasnije ne uspe i dalje se računa kao poziv.
- Ovi pozivi ne rezervišu tokene i ne uzimaju ništa sa vašeg stanja. Lista zahteva u Ključevi i upotreba prikazuje njihov broj tokena i njegovu vrednost po navedenoj ceni.
- Podrazumevani
max_tokenszashannon-coder-1na ova dva endpointa je 65,536. - Kada nema preostalih poziva, odgovor je status
429, tiprate_limit_error, porukaShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Na
/v1/responsesshannon-coder-1nema dozvolu poziva: naplaćuje se u tokenima sa vašeg stanja po $8.00 za 1M, kao i svaki drugi model.
Zaštita od flooda
Nalog može da pošalje 120 zahteva u minuti. To je jedino ograničenje brzine zahteva i isto je na svakom planu. Postoji da zaustavi flood, a ne da uspori normalnu upotrebu.
- Minut je fiksni period od 60 sekundi koji se otvara vašim prvim zahtevom. Kada istekne, brojanje počinje iznova od nule.
- Brojanje je po nalogu, a ne po ključu ni po IP adresi. Rotiranje ključa ne otvara novi period.
- Na 121. zahtev unutar perioda odgovara se statusom
429, tipomrate_limit_errori porukomToo many requests. Retry in <N>s.Nje broj sekundi do kraja perioda, od 1 do 60. - Zaštita od flooda proverava se pre stanja. Zahtev koji odbije ništa ne rezerviše i ništa ne košta.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Zahtev | Zaštita od flooda |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Računa se, jedan po zahtevu. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Ne računa se. |
shannon-coder-1 na /v1/chat/completions i /v1/messages | Umesto toga računa se dozvolom Shannon Coder poziva. |
Zahtev na koji je odgovoreno sa 401, ili sa 400 za nepoznat model | Ne računa se. |
| Zahtev koji je odbila zaštita od flooda | Računa se u period. Ništa se ne naplaćuje. |
Paralelni zahtevi
Nema ograničenja koliko zahteva nalog može imati otvoreno istovremeno, niti greške zbog slanja zahteva paralelno. Zahtevi koji ne mogu odmah da počnu čekaju u redu i odgovara im se redom.
- Svaki zahtev se računa u 120 u minuti kada stigne, bez obzira na to da li su raniji zahtevi završeni.
- Svaki zahtev drži svoju rezervaciju dok se ne završi. Dvadeset otvorenih zahteva sa podrazumevanim izlaznim budžetom drži 20 × 4,096 = 81,920 tokena stanja. Ako su rezervacije zajedno veće od vašeg stanja, sledeći zahtev dobija odgovor
Quota exceeded, iako bi završeni pozivi koštali manje. Manjimax_tokensdrži manje. - Zahtev bez streaminga ne šalje ništa dok njegov odgovor nije kompletan, zato klijentu dajte timeout koji pokriva čekanje. Stream drži vezu otvorenom dok čeka. Streaming
Ograničenja jednog zahteva
| Ograničenje | Vrednost | Važi za | Na ograničenju |
|---|---|---|---|
| Telo zahteva | 32 MiB (33,554,432 bajtova) | Svaki endpoint | Status 413, tip invalid_request_error. |
Izlazni budžet: max_tokens, max_completion_tokens, max_output_tokens | 1 do 65,536. Podrazumevano 4,096; za shannon-coder-1 na /v1/chat/completions i /v1/messages podrazumevano je 65,536. | Svaki model, kao iznos rezervisan sa vašeg stanja. Kao ograničenje dužine odgovora: hostovani open-weight modeli, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. | Vrednost van opsega pomera se na najbliži kraj opsega. Bez greške. |
Stop sekvence: stop, stop_sequences | 4 stringa | Hostovani open-weight modeli | Koristi se prvih 4 neprazna stringa. |
| Slika ili fajl dat kao URL | 8 MiB, čita se u roku od 20 sekundi, najviše 5 preusmeravanja, javna http ili https adresa | Svaki endpoint koji prima slike ili fajlove | Na zahtev se odgovara bez tog dela. Bez greške. |
| Slika ili fajl poslat direktno u zahtevu (base64) | Nema sopstveno ograničenje. Računa se u telo zahteva od 32 MiB. | Svaki endpoint koji prima slike ili fajlove | Status 413 za ceo zahtev. |
text u POST /v1/tokenize | 4,000,000 bajtova | /v1/tokenize | Status 413, tip invalid_request_error, poruka text too long. |
messages u POST /v1/tokenize i telo POST /v1/messages/count_tokens | Telo zahteva od 32 MiB | Oba endpointa za brojanje | Status 413. |
| Kontekstni prozor | Po modelu: context_window u GET /v1/models | Svaki model | Šta se dešava sa dužim razgovorom zavisi od modela. Modeli i cene |
Web pretrage (web_search: true) | Po planu i danu: Free 3, Plus 30, Standard 50, Pro 60. Jedna pretraga se računa za zahtev čija je pretraga našla rezultate. | Zahtevi koji postavljaju web_search: true | Kada nijedna ne preostane, na zahtev se odgovara bez pretrage. Bez greške. Ugrađena web pretraga |
Greške
Odgovori ove stranice. Na /v1/messages isti objekat error je upakovan kao {"type": "error", "error": {…}}.
| Status | Tip | Poruka | Kada i šta uraditi |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezervacija zahteva ne uklapa se u vaše stanje. Sačekajte 00:00 UTC, dopunite kredit, promenite plan ili pošaljite manji max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Više od 120 zahteva u tekućem minutu. Sačekajte N sekundi i pošaljite ponovo. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Shannon Coder pozivi tekućeg 4-časovnog perioda su potrošeni. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model trenutno ne može da primi zahtev. Pošaljite ga ponovo posle kratke pauze. |
503 | api_error | Could not verify your quota right now. Please retry. | Vaše stanje nije moglo da se pročita. Ništa se ne naplaćuje; pošaljite zahtev ponovo. Na /v1/responses sa Shannon modelom status je 500. |
413 | invalid_request_error | Telo zahteva je veće od 32 MiB. Na endpointima u OpenAI formatu objekat error nosi code: "request_too_large". | |
413 | invalid_request_error | text too long | text u POST /v1/tokenize duži je od 4,000,000 bajtova. |