Kalo te përmbajtja
Kufijtë dhe bilanci

Kufijtë dhe bilanci

Çdo kërkesë shërbehet njësoj. Pa nivele shpejtësie. Pa kuotë të veçantë API. Tokens-at i keni paguar tashmë — përdori sa më shpejt të doni.

Kjo faqe shpjegon nga çfarë përbëhet bilanci juaj, çfarë rezervon dhe çfarë kushton një kërkesë, sa kërkesa mund të dërgoni dhe kufijtë e paktë që mund të has një kërkesë e vetme.

vlera e 1M tokens bilanc
$5.00
kuota ditore rinovohet
00:00 UTC
mbrojtja nga vërshimi i kërkesave, për llogari
120 kërkesa / min

Si shërbehen kërkesat

  • Pa nivele shpejtësie — Një rregull kufizon sa shpejt mund të arrijnë kërkesat, dhe është i njëjtë për çdo llogari dhe çdo plan: 120 kërkesa në minutë. Nuk ka kufi tokens-ash në minutë.
  • Pa kuotë të veçantë API — API-ja shpenzon të njëjtin bilanc si biseda. Një plan cakton madhësinë e kuotës së sotme. Nuk cakton shpejtësi kërkesash.
  • Sa shpejt të doni — Kërkesat e dërguara paralelisht pranohen dhe presin në radhë. Nuk refuzohen për shkak se janë paralele.

Bilanci juaj

Bilanci juaj numërohet në tokens. 1,000,000 tokens bilanc vlejnë $5.00, dhe çdo çmim në faqen Modelet dhe çmimet është një tarifë ndaj kësaj vlere.

Në çdo çast bilanci është shuma e dy pjesëve.

  • Kuota e planit për sot — Një numër tokens i caktuar nga plani juaj. Rinovohet çdo ditë në 00:00 UTC. Ajo që mbetet në fund të ditës nuk bartet.
  • Kredi e blerë — Tokens që blini si pako. Krediti nuk skadon dhe vlen në çdo plan, përfshirë Free.
Plani Tokens në ditë Vlera
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Radha e shpenzimit — Çdo kërkesë shpenzon fillimisht kuotën e planit për sot. Krediti i blerë përdoret vetëm për atë që tejkalon kuotën atë ditë.
  • Biseda dhe API e ndajnë — Ka një bilanc për llogari. Një çelës API shpenzon nga bilanci i llogarisë që e zotëron, me të njëjtat çmime si biseda.
  • Pakot — Krediti shitet në pako me 1,000,000 ($5.00), 2,000,000 ($10.00) dhe 5,000,000 ($25.00) tokens, ose si një shumë sipas dëshirës nga 1,000,000 deri në 100,000,000 tokens me $5.00 për 1,000,000.

Shto kredi Ndrysho planin

Çfarë rezervon dhe çfarë kushton një kërkesë

  • Rezervimi — Kur arrin një kërkesë, ajo rezervon buxhetin e saj të daljes nga bilanci juaj: max_tokens në /v1/chat/completions dhe /v1/messages, max_output_tokens në /v1/responses. /v1/chat/completions lexon edhe max_completion_tokens. Parazgjedhja është 4,096 dhe intervali është 1 deri 65,536.
  • Pranimi — Kërkesa pranohet vetëm nëse rezervimi ngjit në atë që ka mbetur nga bilanci juaj. Një bilanc mbi zero por më i vogël se buxheti i daljes merr përgjigjen Quota exceeded. Dërgoni një max_tokens më të vogël për të përdorur pjesën tjetër.
  • Rregullimi — Kur përgjigjja është e plotë, rezervimi zëvendësohet me faturimin e vërtetë. Faturimi mund të jetë më i ulët ose më i lartë se rezervimi.
  • Kthimi — Një kërkesë që mbaron me status gabimi ia kthen rezervimin plotësisht.

Faturimi i vërtetë varet nga familja e modelit.

Modelet Çfarë faturohet
Modelet Shannon usage.total_tokens me çmimin e modelit për 1M. Hyrja dhe dalja kanë një tarifë.
Modele open-weight të hostuara Hyrja pa cache me tarifën e hyrjes, hyrja e ruajtur në cache me tarifën e cache-it, dalja me tarifën e daljes.

Shuma në USD merret nga bilanci juaj në tokens me $5.00 për 1,000,000, e rrumbullakosur në një token të plotë.

Numërimi i tokens-ave me POST /v1/tokenize ose POST /v1/messages/count_tokens është falas dhe nuk rezervon asgjë. Numërimi i tokens-ave

Ku të shihni bilancin dhe përdorimin

Faqja Çelësat dhe përdorimi tregon çfarë mund të shpenzoni tani, kuotën e planit për sot, kreditin tuaj të blerë dhe shpenzimet API të 30 ditëve të fundit. Më poshtë liston çdo kërkesë që ka bërë çelësi juaj: kohën, endpoint-in, modelin, hyrjen e ruajtur në cache, tokens-at e faturuar dhe koston. Çelësat dhe përdorimi

Çdo përgjigje mban edhe një objekt usage me numërimet e tokens-ave të asaj thirrjeje.

Endpoint Fushat e usage Shtuar nga modelet open-weight të hostuara
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage mban numërimet e tokens-ave të modelit. Shuma e marrë nga bilanci juaj nuk është në përgjigje: është kolona Tokens të faturuar e listës së kërkesave te Çelësat dhe përdorimi.
  • Në /v1/messages me një model open-weight të hostuar, input_tokens është pjesa e hyrjes pa cache, cache_read_input_tokens është pjesa e ruajtur në cache dhe cache_creation_input_tokens është gjithmonë 0.
  • Një stream në /v1/chat/completions e mban usage në pjesën e fundit para [DONE]. Transmetim

Kur bilanci mbaron

Një kërkesë, rezervimi i së cilës nuk ngjit në bilancin tuaj, merr përgjigje me status 429, llojin rate_limit_error dhe mesazhin më poshtë. Nuk faturohet asgjë. E njëjta përgjigje dërgohet kur bilanci është mbi zero por më i vogël se buxheti i daljes së kërkesës.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Në /v1/responses objekti error mund të mbajë edhe code dhe param, të dyja null.

Çfarë mund të bëni:

  • Prisni kuotën e radhës të planit në 00:00 UTC.
  • Shtoni kredi. Krediti shpenzohet pas kuotës së planit dhe nuk skadon. Shto kredi
  • Kaloni në një plan me kuotë ditore më të madhe. Ndrysho planin
  • Dërgoni një max_tokens më të vogël, nëse ka mbetur ndonjë bilanc: rezervimi atëherë është më i vogël.

Kuota e thirrjeve Shannon Coder

shannon-coder-1 në /v1/chat/completions dhe /v1/messages numërohet në thirrje, jo në tokens. Çdo plan përfshin një numër thirrjesh për dritare 4-orëshe. Një kërkesë është një thirrje.

Plani Thirrje për dritare 4-orëshe
Free 3
Plus 20
Standard 40
Pro 60
  • Dritaret fillojnë në 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Thirrjet që mbeten në fund të një dritareje nuk bartën.
  • Një thirrje numërohet kur kërkesa pranohet, para se modeli të përgjigjet. Një kërkesë që dështon pas kësaj prapë numërohet si thirrje.
  • Këto thirrje nuk rezervojnë tokens dhe nuk marrin asgjë nga bilanci juaj. Lista e kërkesave te Çelësat dhe përdorimi tregon numrin e tyre të tokens-ave dhe vlerën e tij me çmimin e listuar.
  • max_tokens i parazgjedhur i shannon-coder-1 në këto dy endpoint-e është 65,536.
  • Kur nuk ka më thirrje, përgjigjja është status 429, lloji rate_limit_error, mesazhi Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Në /v1/responses, shannon-coder-1 nuk ka kuotë thirrjesh: faturohet në tokens nga bilanci juaj me $8.00 për 1M, si çdo model tjetër.

Mbrojtja nga vërshimi i kërkesave

Një llogari mund të dërgojë 120 kërkesa në minutë. Ky është kufiri i vetëm për shpejtësinë e kërkesave dhe është i njëjtë në çdo plan. Ekziston për të ndaluar vërshimet, jo për ta ngadalësuar përdorimin normal.

  • Minuta është një dritare fikse prej 60 sekondash që hapet me kërkesën tuaj të parë. Kur mbaron, numërimi fillon përsëri nga zero.
  • Numërimi është për llogari, jo për çelës dhe jo për adresë IP. Rrotullimi i çelësit nuk hap dritare të re.
  • Kërkesa e 121-të brenda një dritareje merr përgjigje me status 429, llojin rate_limit_error dhe mesazhin Too many requests. Retry in <N>s. N është numri i sekondave deri në fund të dritares, nga 1 deri 60.
  • Mbrojtja nga vërshimi i kërkesave kontrollohet para bilancit. Një kërkesë që ajo e refuzon nuk rezervon asgjë dhe nuk kushton asgjë.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Kërkesa Mbrojtja nga vërshimi i kërkesave
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Numërohet, një për kërkesë.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Nuk numërohet.
shannon-coder-1 në /v1/chat/completions dhe /v1/messages Numërohet në vend të kësaj nga kuota e thirrjeve Shannon Coder.
Një kërkesë që merr përgjigje 401, ose 400 për një model të panjohur Nuk numërohet.
Një kërkesë e refuzuar nga mbrojtja nga vërshimi i kërkesave Numërohet në dritare. Nuk faturohet asgjë.

Kërkesat paralele

Nuk ka kufi për sa kërkesa ka të hapura një llogari në të njëjtën kohë, dhe nuk ka gabim për dërgimin e kërkesave paralelisht. Kërkesat që nuk mund të nisin menjëherë presin në radhë dhe marrin përgjigje me radhë.

  • Çdo kërkesë numërohet te 120 në minutë kur arrin, pavarësisht nëse kërkesat e mëparshme kanë mbaruar.
  • Çdo kërkesë e mban rezervimin e vet derisa mbaron. Njëzet kërkesa të hapura me buxhetin e parazgjedhur të daljes mbajnë 20 × 4,096 = 81,920 tokens bilanc. Nëse rezervimet së bashku janë më të mëdha se bilanci juaj, kërkesa tjetër merr përgjigjen Quota exceeded, megjithëse thirrjet e mbaruara do të kishin kushtuar më pak. Një max_tokens më i vogël mban më pak.
  • Një kërkesë pa streaming nuk dërgon asgjë derisa përgjigjja të jetë e plotë, prandaj jepini klientit tuaj një timeout që e mbulon pritjen. Një stream e mban lidhjen e hapur ndërsa pret. Transmetim

Kufijtë e një kërkese të vetme

Kufiri Vlera Vlen për Te kufiri
Trupi i kërkesës 32 MiB (33,554,432 bajte) Çdo endpoint Statusi 413, lloji invalid_request_error.
Buxheti i daljes: max_tokens, max_completion_tokens, max_output_tokens 1 deri 65,536. Parazgjedhja 4,096; për shannon-coder-1 në /v1/chat/completions dhe /v1/messages parazgjedhja është 65,536. Çdo model, si sasia e rezervuar nga bilanci juaj. Si kufi i gjatësisë së përgjigjes: modelet open-weight të hostuara, shannon-1.6-lite, shannon-1.6-pro dhe shannon-coder-1. Një vlerë jashtë intervalit zhvendoset te skaji më i afërt i intervalit. Pa gabim.
Stop sequences: stop, stop_sequences 4 stringje Modelet open-weight të hostuara Përdoren 4 stringjet e para jo bosh.
Imazh ose skedar i dhënë si URL 8 MiB, i lexuar brenda 20 sekondash, më së shumti 5 ridrejtime, një adresë publike http ose https Çdo endpoint që pranon imazhe ose skedarë Kërkesa merr përgjigje pa atë pjesë. Pa gabim.
Imazh ose skedar i dërguar brenda kërkesës (base64) Pa kufi të vetin. Numërohet në trupin e kërkesës 32 MiB. Çdo endpoint që pranon imazhe ose skedarë Statusi 413 për të gjithë kërkesën.
text i POST /v1/tokenize 4,000,000 bajte /v1/tokenize Statusi 413, lloji invalid_request_error, mesazhi text too long.
messages i POST /v1/tokenize dhe trupi i POST /v1/messages/count_tokens Trupi i kërkesës 32 MiB Të dy endpoint-et e numërimit Statusi 413.
Dritarja e kontekstit Për model: context_window te GET /v1/models Çdo model Çfarë ndodh me një bisedë më të gjatë varet nga modeli. Modelet dhe çmimet
Kërkime në ueb (web_search: true) Për plan dhe ditë: Free 3, Plus 30, Standard 50, Pro 60. Numërohet një kërkim për një kërkesë, kërkimi i së cilës gjeti rezultate. Kërkesat që vendosin web_search: true Kur nuk ka më, kërkesa merr përgjigje pa kërkim. Pa gabim. Kërkim i integruar në ueb

Gabimet

Përgjigjet e kësaj faqeje. Në /v1/messages i njëjti objekt error mbështillet si {"type": "error", "error": {…}}.

Statusi Lloji Mesazhi Kur, dhe çfarë të bëni
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezervimi i kërkesës nuk ngjit në bilancin tuaj. Prisni 00:00 UTC, shtoni kredi, ndryshoni planin, ose dërgoni një max_tokens më të vogël.
429 rate_limit_error Too many requests. Retry in <N>s. Më shumë se 120 kërkesa në minutën aktuale. Prisni N sekonda dhe dërgoni përsëri.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Thirrjet Shannon Coder të dritares aktuale 4-orëshe janë shfrytëzuar.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Modeli nuk e pranon dot kërkesën në këtë çast. Dërgojeni përsëri pas një pauze të shkurtër.
503 api_error Could not verify your quota right now. Please retry. Bilanci juaj nuk u lexua dot. Nuk faturohet asgjë; dërgojeni kërkesën përsëri. Në /v1/responses me një model Shannon statusi është 500.
413 invalid_request_error Trupi i kërkesës është më i madh se 32 MiB. Në endpoint-et e formatit OpenAI objekti error mban code: "request_too_large".
413 invalid_request_error text too long text i POST /v1/tokenize është më i gjatë se 4,000,000 bajte.