Ograničenja i stanje
Svaki zahtjev se opslužuje jednako. Bez nivoa brzine. Bez zasebne API kvote. Već ste platili svoje tokene — koristite ih koliko god brzo želite.
Ova stranica objašnjava od čega se sastoji vaše stanje, šta jedan zahtjev rezerviše i košta, koliko zahtjeva smijete poslati i nekoliko ograničenja na koja može naići pojedinačni zahtjev.
- vrijednost 1M tokena stanja
- $5.00
- dnevna kvota se obnavlja
- 00:00 UTC
- flood zaštita, po računu
- 120 zahtjeva / min
Kako se zahtjevi opslužuju
- Bez nivoa brzine — Jedno pravilo ograničava koliko brzo zahtjevi smiju stizati i isto je za svaki račun i svaki plan: 120 zahtjeva u minuti. Ne postoji ograničenje tokena u minuti.
- Bez zasebne API kvote — API troši isto stanje kao chat. Plan određuje veličinu današnje dnevne kvote. Ne određuje brzinu zahtjeva.
- Koliko god brzo želite — Zahtjevi poslani paralelno se prihvataju i čekaju u redu. Ne odbijaju se zato što su paralelni.
Vaše stanje
Vaše stanje se broji u tokenima. 1,000,000 tokena stanja vrijedi $5.00, a svaka cijena na stranici Modeli i cijene je stopa u odnosu na tu vrijednost.
U svakom trenutku stanje je zbir dva dijela.
- Današnja dnevna kvota plana — Broj tokena koji određuje vaš plan. Obnavlja se svaki dan u 00:00 UTC. Ono što ostane na kraju dana ne prenosi se dalje.
- Kupljeni kredit — Tokeni koje ste kupili kao paket. Kredit ne ističe i radi na svakom planu, uključujući Free.
| Plan | Tokena dnevno | Vrijedi |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Redoslijed trošenja — Svaki zahtjev prvo troši današnju dnevnu kvotu plana. Kupljeni kredit koristi se samo za ono što pređe kvotu tog dana.
- Chat i API ga dijele — Postoji jedno stanje po računu. API ključ troši sa stanja računa kojem pripada, po istim cijenama kao chat.
- Paketi — Kredit se prodaje u paketima od 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokena, ili u iznosu po vašem izboru od 1,000,000 do 100,000,000 tokena po cijeni $5.00 za 1,000,000.
Šta zahtjev rezerviše i koliko košta
- Rezervacija — Kada zahtjev stigne, rezerviše svoj izlazni budžet sa vašeg stanja:
max_tokensna/v1/chat/completionsi/v1/messages,max_output_tokensna/v1/responses./v1/chat/completionsčita imax_completion_tokens. Zadana vrijednost je 4,096, a raspon je od 1 do 65,536. - Prihvatanje — Zahtjev se prihvata samo ako rezervacija stane u ono što je ostalo od vašeg stanja. Stanje koje je veće od nule ali manje od izlaznog budžeta dobiva odgovor
Quota exceeded. Pošaljite manjimax_tokensda iskoristite ostatak. - Obračun — Kada je odgovor završen, rezervacija se zamjenjuje stvarnom naplatom. Naplata može biti niža ili viša od rezervacije.
- Povrat — Zahtjev koji završi statusom greške vraća svoju rezervaciju u cijelosti.
Stvarna naplata ovisi o porodici modela.
| Modeli | Šta se naplaćuje |
|---|---|
| Shannon modeli | usage.total_tokens po cijeni modela za 1M. Ulaz i izlaz imaju jednu cijenu. |
| Hostirani open-weight modeli | Nekeširani ulaz po cijeni ulaza, keširani ulaz po cijeni keširanog, izlaz po cijeni izlaza. |
Iznos u USD uzima se sa vašeg stanja u tokenima po $5.00 za 1,000,000, zaokružen na cijeli token.
Brojanje tokena pomoću POST /v1/tokenize ili POST /v1/messages/count_tokens je besplatno i ništa ne rezerviše. Brojanje tokena
Gdje vidjeti stanje i korištenje
Stranica Ključevi i korištenje prikazuje šta možete potrošiti upravo sada, današnju dnevnu kvotu plana, vaš kupljeni kredit i API potrošnju u posljednjih 30 dana. Ispod toga navodi svaki zahtjev koji je napravio vaš ključ: vrijeme, endpoint, model, keširani ulaz, naplaćene tokene i trošak. Ključevi i korištenje
Svaki odgovor sadrži i objekat usage sa brojem tokena tog poziva.
| Endpoint | Polja u usage | Dodaju hostirani open-weight modeli |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagesadrži brojeve tokena modela. Iznos uzet sa vašeg stanja nije u odgovoru: nalazi se u koloni Naplaćeni tokeni u listi zahtjeva na stranici Ključevi i korištenje.- Na
/v1/messagessa hostiranim open-weight modelom,input_tokensje nekeširani dio ulaza,cache_read_input_tokensje keširani dio, acache_creation_input_tokensje uvijek0. - Stream na
/v1/chat/completionsnosiusageu svom posljednjem chunku prije[DONE]. Streaming
Kada se stanje potroši
Na zahtjev čija rezervacija ne stane u vaše stanje odgovara se statusom 429, tipom rate_limit_error i porukom ispod. Ništa se ne naplaćuje. Isti odgovor se šalje kada je stanje veće od nule ali manje od izlaznog budžeta zahtjeva.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Na /v1/responses objekat error može sadržavati i code i param, oba null.
Šta možete učiniti:
- Sačekajte sljedeću dnevnu kvotu plana u 00:00 UTC.
- Dopunite kredit. Kredit se troši poslije dnevne kvote plana i ne ističe. Dopuna kredita
- Pređite na plan s većom dnevnom kvotom. Promjena plana
- Pošaljite manji
max_tokens, ako je ostalo nešto stanja: rezervacija je tada manja.
Kvota poziva Shannon Codera
shannon-coder-1 na /v1/chat/completions i /v1/messages broji se u pozivima, a ne u tokenima. Svaki plan uključuje određen broj poziva u 4-satnom prozoru. Jedan zahtjev je jedan poziv.
| Plan | Poziva u 4-satnom prozoru |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Prozori počinju u 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Pozivi koji ostanu na kraju prozora ne prenose se dalje.
- Poziv se broji kada je zahtjev prihvaćen, prije nego što model odgovori. Zahtjev koji nakon toga ne uspije i dalje se računa kao poziv.
- Ovi pozivi ne rezervišu tokene i ne uzimaju ništa sa vašeg stanja. Lista zahtjeva na stranici Ključevi i korištenje prikazuje njihov broj tokena i njegovu vrijednost po navedenoj cijeni.
- Zadani
max_tokenszashannon-coder-1na ova dva endpointa je 65,536. - Kada nema preostalih poziva, odgovor ima status
429, tiprate_limit_errori porukuShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Na
/v1/responses,shannon-coder-1nema kvotu poziva: naplaćuje se u tokenima sa vašeg stanja po $8.00 za 1M, kao i svaki drugi model.
Flood zaštita
Račun smije slati 120 zahtjeva u minuti. To je jedino ograničenje brzine zahtjeva i isto je na svakom planu. Postoji da zaustavi poplave zahtjeva, a ne da uspori normalnu upotrebu.
- Minuta je fiksni prozor od 60 sekundi koji se otvara vašim prvim zahtjevom. Kada se završi, brojanje počinje ponovo od nule.
- Brojanje je po računu, a ne po ključu niti po IP adresi. Rotiranje ključa ne otvara novi prozor.
- Na 121. zahtjev unutar prozora odgovara se statusom
429, tipomrate_limit_errori porukomToo many requests. Retry in <N>s.Nje broj sekundi do kraja prozora, od 1 do 60. - Flood zaštita se provjerava prije stanja. Zahtjev koji odbije ništa ne rezerviše i ništa ne košta.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Zahtjev | Flood zaštita |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Broji se, jedan po zahtjevu. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Ne broji se. |
shannon-coder-1 na /v1/chat/completions i /v1/messages | Umjesto toga broji se kvotom poziva Shannon Codera. |
Zahtjev na koji je odgovoreno sa 401, ili sa 400 za nepoznat model | Ne broji se. |
| Zahtjev koji je odbila flood zaštita | Broji se u prozor. Ništa se ne naplaćuje. |
Paralelni zahtjevi
Ne postoji ograničenje koliko zahtjeva račun smije imati otvoreno istovremeno, niti greška za slanje zahtjeva paralelno. Zahtjevi koji ne mogu odmah početi čekaju u redu i odgovara im se redom.
- Svaki zahtjev se računa u 120 u minuti kada stigne, bez obzira jesu li raniji zahtjevi završeni.
- Svaki zahtjev drži svoju rezervaciju dok se ne završi. Dvadeset otvorenih zahtjeva sa zadanim izlaznim budžetom drži 20 × 4,096 = 81,920 tokena stanja. Ako su rezervacije zajedno veće od vašeg stanja, sljedeći zahtjev dobiva odgovor
Quota exceeded, iako bi završeni pozivi koštali manje. Manjimax_tokensdrži manje. - Zahtjev bez streaminga ne šalje ništa dok njegov odgovor nije kompletan, zato svom klijentu zadajte timeout koji pokriva čekanje. Stream drži svoju konekciju otvorenom dok čeka. Streaming
Ograničenja pojedinačnog zahtjeva
| Ograničenje | Vrijednost | Odnosi se na | Na granici |
|---|---|---|---|
| Tijelo zahtjeva | 32 MiB (33,554,432 bajtova) | Svaki endpoint | Status 413, tip invalid_request_error. |
Izlazni budžet: max_tokens, max_completion_tokens, max_output_tokens | Od 1 do 65,536. Zadano 4,096; za shannon-coder-1 na /v1/chat/completions i /v1/messages zadano je 65,536. | Svaki model, kao iznos rezervisan sa vašeg stanja. Kao ograničenje dužine odgovora: hostirani open-weight modeli, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. | Vrijednost izvan raspona pomjera se na najbliži kraj raspona. Bez greške. |
Stop sekvence: stop, stop_sequences | 4 stringa | Hostirani open-weight modeli | Koristi se prvih 4 neprazna stringa. |
| Slika ili datoteka zadana kao URL | 8 MiB, čita se u roku od 20 sekundi, najviše 5 preusmjeravanja, javna http ili https adresa | Svaki endpoint koji prima slike ili datoteke | Na zahtjev se odgovara bez tog dijela. Bez greške. |
| Slika ili datoteka poslana umetnuto (base64) | Nema vlastitog ograničenja. Računa se u tijelo zahtjeva od 32 MiB. | Svaki endpoint koji prima slike ili datoteke | Status 413 za cijeli zahtjev. |
text u POST /v1/tokenize | 4,000,000 bajtova | /v1/tokenize | Status 413, tip invalid_request_error, poruka text too long. |
messages u POST /v1/tokenize i tijelo POST /v1/messages/count_tokens | Tijelo zahtjeva od 32 MiB | Oba endpointa za brojanje | Status 413. |
| Kontekstni prozor | Po modelu: context_window u GET /v1/models | Svaki model | Šta se dešava s dužim razgovorom ovisi o modelu. Modeli i cijene |
Pretrage weba (web_search: true) | Po planu i danu: Free 3, Plus 30, Standard 50, Pro 60. Jedna pretraga se računa za zahtjev čija je pretraga našla rezultate. | Zahtjevi koji postavljaju web_search: true | Kada nijedna ne preostane, na zahtjev se odgovara bez pretrage. Bez greške. Ugrađena web pretraga |
Greške
Odgovori na ovoj stranici. Na /v1/messages isti objekat error je umotan kao {"type": "error", "error": {…}}.
| Status | Tip | Poruka | Kada i šta učiniti |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezervacija zahtjeva ne staje u vaše stanje. Sačekajte 00:00 UTC, dopunite kredit, promijenite plan ili pošaljite manji max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Više od 120 zahtjeva u tekućoj minuti. Sačekajte N sekundi i pošaljite ponovo. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Shannon Coder pozivi iz tekućeg 4-satnog prozora su potrošeni. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model trenutno ne može primiti zahtjev. Pošaljite ga ponovo nakon kratke pauze. |
503 | api_error | Could not verify your quota right now. Please retry. | Vaše stanje nije moglo biti pročitano. Ništa se ne naplaćuje; pošaljite zahtjev ponovo. Na /v1/responses sa Shannon modelom status je 500. |
413 | invalid_request_error | Tijelo zahtjeva je veće od 32 MiB. Na endpointima u OpenAI formatu objekat error sadrži code: "request_too_large". | |
413 | invalid_request_error | text too long | text u POST /v1/tokenize duži je od 4,000,000 bajtova. |