Preskoči na sadržaj
Ograničenja i stanje

Ograničenja i stanje

Svaki zahtjev se opslužuje jednako. Bez nivoa brzine. Bez zasebne API kvote. Već ste platili svoje tokene — koristite ih koliko god brzo želite.

Ova stranica objašnjava od čega se sastoji vaše stanje, šta jedan zahtjev rezerviše i košta, koliko zahtjeva smijete poslati i nekoliko ograničenja na koja može naići pojedinačni zahtjev.

vrijednost 1M tokena stanja
$5.00
dnevna kvota se obnavlja
00:00 UTC
flood zaštita, po računu
120 zahtjeva / min

Kako se zahtjevi opslužuju

  • Bez nivoa brzine — Jedno pravilo ograničava koliko brzo zahtjevi smiju stizati i isto je za svaki račun i svaki plan: 120 zahtjeva u minuti. Ne postoji ograničenje tokena u minuti.
  • Bez zasebne API kvote — API troši isto stanje kao chat. Plan određuje veličinu današnje dnevne kvote. Ne određuje brzinu zahtjeva.
  • Koliko god brzo želite — Zahtjevi poslani paralelno se prihvataju i čekaju u redu. Ne odbijaju se zato što su paralelni.

Vaše stanje

Vaše stanje se broji u tokenima. 1,000,000 tokena stanja vrijedi $5.00, a svaka cijena na stranici Modeli i cijene je stopa u odnosu na tu vrijednost.

U svakom trenutku stanje je zbir dva dijela.

  • Današnja dnevna kvota plana — Broj tokena koji određuje vaš plan. Obnavlja se svaki dan u 00:00 UTC. Ono što ostane na kraju dana ne prenosi se dalje.
  • Kupljeni kredit — Tokeni koje ste kupili kao paket. Kredit ne ističe i radi na svakom planu, uključujući Free.
Plan Tokena dnevno Vrijedi
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Redoslijed trošenja — Svaki zahtjev prvo troši današnju dnevnu kvotu plana. Kupljeni kredit koristi se samo za ono što pređe kvotu tog dana.
  • Chat i API ga dijele — Postoji jedno stanje po računu. API ključ troši sa stanja računa kojem pripada, po istim cijenama kao chat.
  • Paketi — Kredit se prodaje u paketima od 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokena, ili u iznosu po vašem izboru od 1,000,000 do 100,000,000 tokena po cijeni $5.00 za 1,000,000.

Dopuna kredita Promjena plana

Šta zahtjev rezerviše i koliko košta

  • Rezervacija — Kada zahtjev stigne, rezerviše svoj izlazni budžet sa vašeg stanja: max_tokens na /v1/chat/completions i /v1/messages, max_output_tokens na /v1/responses. /v1/chat/completions čita i max_completion_tokens. Zadana vrijednost je 4,096, a raspon je od 1 do 65,536.
  • Prihvatanje — Zahtjev se prihvata samo ako rezervacija stane u ono što je ostalo od vašeg stanja. Stanje koje je veće od nule ali manje od izlaznog budžeta dobiva odgovor Quota exceeded. Pošaljite manji max_tokens da iskoristite ostatak.
  • Obračun — Kada je odgovor završen, rezervacija se zamjenjuje stvarnom naplatom. Naplata može biti niža ili viša od rezervacije.
  • Povrat — Zahtjev koji završi statusom greške vraća svoju rezervaciju u cijelosti.

Stvarna naplata ovisi o porodici modela.

Modeli Šta se naplaćuje
Shannon modeli usage.total_tokens po cijeni modela za 1M. Ulaz i izlaz imaju jednu cijenu.
Hostirani open-weight modeli Nekeširani ulaz po cijeni ulaza, keširani ulaz po cijeni keširanog, izlaz po cijeni izlaza.

Iznos u USD uzima se sa vašeg stanja u tokenima po $5.00 za 1,000,000, zaokružen na cijeli token.

Brojanje tokena pomoću POST /v1/tokenize ili POST /v1/messages/count_tokens je besplatno i ništa ne rezerviše. Brojanje tokena

Gdje vidjeti stanje i korištenje

Stranica Ključevi i korištenje prikazuje šta možete potrošiti upravo sada, današnju dnevnu kvotu plana, vaš kupljeni kredit i API potrošnju u posljednjih 30 dana. Ispod toga navodi svaki zahtjev koji je napravio vaš ključ: vrijeme, endpoint, model, keširani ulaz, naplaćene tokene i trošak. Ključevi i korištenje

Svaki odgovor sadrži i objekat usage sa brojem tokena tog poziva.

Endpoint Polja u usage Dodaju hostirani open-weight modeli
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage sadrži brojeve tokena modela. Iznos uzet sa vašeg stanja nije u odgovoru: nalazi se u koloni Naplaćeni tokeni u listi zahtjeva na stranici Ključevi i korištenje.
  • Na /v1/messages sa hostiranim open-weight modelom, input_tokens je nekeširani dio ulaza, cache_read_input_tokens je keširani dio, a cache_creation_input_tokens je uvijek 0.
  • Stream na /v1/chat/completions nosi usage u svom posljednjem chunku prije [DONE]. Streaming

Kada se stanje potroši

Na zahtjev čija rezervacija ne stane u vaše stanje odgovara se statusom 429, tipom rate_limit_error i porukom ispod. Ništa se ne naplaćuje. Isti odgovor se šalje kada je stanje veće od nule ali manje od izlaznog budžeta zahtjeva.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Na /v1/responses objekat error može sadržavati i code i param, oba null.

Šta možete učiniti:

  • Sačekajte sljedeću dnevnu kvotu plana u 00:00 UTC.
  • Dopunite kredit. Kredit se troši poslije dnevne kvote plana i ne ističe. Dopuna kredita
  • Pređite na plan s većom dnevnom kvotom. Promjena plana
  • Pošaljite manji max_tokens, ako je ostalo nešto stanja: rezervacija je tada manja.

Kvota poziva Shannon Codera

shannon-coder-1 na /v1/chat/completions i /v1/messages broji se u pozivima, a ne u tokenima. Svaki plan uključuje određen broj poziva u 4-satnom prozoru. Jedan zahtjev je jedan poziv.

Plan Poziva u 4-satnom prozoru
Free 3
Plus 20
Standard 40
Pro 60
  • Prozori počinju u 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Pozivi koji ostanu na kraju prozora ne prenose se dalje.
  • Poziv se broji kada je zahtjev prihvaćen, prije nego što model odgovori. Zahtjev koji nakon toga ne uspije i dalje se računa kao poziv.
  • Ovi pozivi ne rezervišu tokene i ne uzimaju ništa sa vašeg stanja. Lista zahtjeva na stranici Ključevi i korištenje prikazuje njihov broj tokena i njegovu vrijednost po navedenoj cijeni.
  • Zadani max_tokens za shannon-coder-1 na ova dva endpointa je 65,536.
  • Kada nema preostalih poziva, odgovor ima status 429, tip rate_limit_error i poruku Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Na /v1/responses, shannon-coder-1 nema kvotu poziva: naplaćuje se u tokenima sa vašeg stanja po $8.00 za 1M, kao i svaki drugi model.

Flood zaštita

Račun smije slati 120 zahtjeva u minuti. To je jedino ograničenje brzine zahtjeva i isto je na svakom planu. Postoji da zaustavi poplave zahtjeva, a ne da uspori normalnu upotrebu.

  • Minuta je fiksni prozor od 60 sekundi koji se otvara vašim prvim zahtjevom. Kada se završi, brojanje počinje ponovo od nule.
  • Brojanje je po računu, a ne po ključu niti po IP adresi. Rotiranje ključa ne otvara novi prozor.
  • Na 121. zahtjev unutar prozora odgovara se statusom 429, tipom rate_limit_error i porukom Too many requests. Retry in <N>s. N je broj sekundi do kraja prozora, od 1 do 60.
  • Flood zaštita se provjerava prije stanja. Zahtjev koji odbije ništa ne rezerviše i ništa ne košta.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Zahtjev Flood zaštita
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Broji se, jedan po zahtjevu.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Ne broji se.
shannon-coder-1 na /v1/chat/completions i /v1/messages Umjesto toga broji se kvotom poziva Shannon Codera.
Zahtjev na koji je odgovoreno sa 401, ili sa 400 za nepoznat model Ne broji se.
Zahtjev koji je odbila flood zaštita Broji se u prozor. Ništa se ne naplaćuje.

Paralelni zahtjevi

Ne postoji ograničenje koliko zahtjeva račun smije imati otvoreno istovremeno, niti greška za slanje zahtjeva paralelno. Zahtjevi koji ne mogu odmah početi čekaju u redu i odgovara im se redom.

  • Svaki zahtjev se računa u 120 u minuti kada stigne, bez obzira jesu li raniji zahtjevi završeni.
  • Svaki zahtjev drži svoju rezervaciju dok se ne završi. Dvadeset otvorenih zahtjeva sa zadanim izlaznim budžetom drži 20 × 4,096 = 81,920 tokena stanja. Ako su rezervacije zajedno veće od vašeg stanja, sljedeći zahtjev dobiva odgovor Quota exceeded, iako bi završeni pozivi koštali manje. Manji max_tokens drži manje.
  • Zahtjev bez streaminga ne šalje ništa dok njegov odgovor nije kompletan, zato svom klijentu zadajte timeout koji pokriva čekanje. Stream drži svoju konekciju otvorenom dok čeka. Streaming

Ograničenja pojedinačnog zahtjeva

Ograničenje Vrijednost Odnosi se na Na granici
Tijelo zahtjeva 32 MiB (33,554,432 bajtova) Svaki endpoint Status 413, tip invalid_request_error.
Izlazni budžet: max_tokens, max_completion_tokens, max_output_tokens Od 1 do 65,536. Zadano 4,096; za shannon-coder-1 na /v1/chat/completions i /v1/messages zadano je 65,536. Svaki model, kao iznos rezervisan sa vašeg stanja. Kao ograničenje dužine odgovora: hostirani open-weight modeli, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. Vrijednost izvan raspona pomjera se na najbliži kraj raspona. Bez greške.
Stop sekvence: stop, stop_sequences 4 stringa Hostirani open-weight modeli Koristi se prvih 4 neprazna stringa.
Slika ili datoteka zadana kao URL 8 MiB, čita se u roku od 20 sekundi, najviše 5 preusmjeravanja, javna http ili https adresa Svaki endpoint koji prima slike ili datoteke Na zahtjev se odgovara bez tog dijela. Bez greške.
Slika ili datoteka poslana umetnuto (base64) Nema vlastitog ograničenja. Računa se u tijelo zahtjeva od 32 MiB. Svaki endpoint koji prima slike ili datoteke Status 413 za cijeli zahtjev.
text u POST /v1/tokenize 4,000,000 bajtova /v1/tokenize Status 413, tip invalid_request_error, poruka text too long.
messages u POST /v1/tokenize i tijelo POST /v1/messages/count_tokens Tijelo zahtjeva od 32 MiB Oba endpointa za brojanje Status 413.
Kontekstni prozor Po modelu: context_window u GET /v1/models Svaki model Šta se dešava s dužim razgovorom ovisi o modelu. Modeli i cijene
Pretrage weba (web_search: true) Po planu i danu: Free 3, Plus 30, Standard 50, Pro 60. Jedna pretraga se računa za zahtjev čija je pretraga našla rezultate. Zahtjevi koji postavljaju web_search: true Kada nijedna ne preostane, na zahtjev se odgovara bez pretrage. Bez greške. Ugrađena web pretraga

Greške

Odgovori na ovoj stranici. Na /v1/messages isti objekat error je umotan kao {"type": "error", "error": {…}}.

Status Tip Poruka Kada i šta učiniti
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervacija zahtjeva ne staje u vaše stanje. Sačekajte 00:00 UTC, dopunite kredit, promijenite plan ili pošaljite manji max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Više od 120 zahtjeva u tekućoj minuti. Sačekajte N sekundi i pošaljite ponovo.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Shannon Coder pozivi iz tekućeg 4-satnog prozora su potrošeni.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model trenutno ne može primiti zahtjev. Pošaljite ga ponovo nakon kratke pauze.
503 api_error Could not verify your quota right now. Please retry. Vaše stanje nije moglo biti pročitano. Ništa se ne naplaćuje; pošaljite zahtjev ponovo. Na /v1/responses sa Shannon modelom status je 500.
413 invalid_request_error Tijelo zahtjeva je veće od 32 MiB. Na endpointima u OpenAI formatu objekat error sadrži code: "request_too_large".
413 invalid_request_error text too long text u POST /v1/tokenize duži je od 4,000,000 bajtova.