Kufijtë dhe bilanci
Çdo kërkesë shërbehet njësoj. Pa nivele shpejtësie. Pa kuotë të veçantë API. Tokens-at i keni paguar tashmë — përdori sa më shpejt të doni.
Kjo faqe shpjegon nga çfarë përbëhet bilanci juaj, çfarë rezervon dhe çfarë kushton një kërkesë, sa kërkesa mund të dërgoni dhe kufijtë e paktë që mund të has një kërkesë e vetme.
- vlera e 1M tokens bilanc
- $5.00
- kuota ditore rinovohet
- 00:00 UTC
- mbrojtja nga vërshimi i kërkesave, për llogari
- 120 kërkesa / min
Si shërbehen kërkesat
- Pa nivele shpejtësie — Një rregull kufizon sa shpejt mund të arrijnë kërkesat, dhe është i njëjtë për çdo llogari dhe çdo plan: 120 kërkesa në minutë. Nuk ka kufi tokens-ash në minutë.
- Pa kuotë të veçantë API — API-ja shpenzon të njëjtin bilanc si biseda. Një plan cakton madhësinë e kuotës së sotme. Nuk cakton shpejtësi kërkesash.
- Sa shpejt të doni — Kërkesat e dërguara paralelisht pranohen dhe presin në radhë. Nuk refuzohen për shkak se janë paralele.
Bilanci juaj
Bilanci juaj numërohet në tokens. 1,000,000 tokens bilanc vlejnë $5.00, dhe çdo çmim në faqen Modelet dhe çmimet është një tarifë ndaj kësaj vlere.
Në çdo çast bilanci është shuma e dy pjesëve.
- Kuota e planit për sot — Një numër tokens i caktuar nga plani juaj. Rinovohet çdo ditë në 00:00 UTC. Ajo që mbetet në fund të ditës nuk bartet.
- Kredi e blerë — Tokens që blini si pako. Krediti nuk skadon dhe vlen në çdo plan, përfshirë Free.
| Plani | Tokens në ditë | Vlera |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Radha e shpenzimit — Çdo kërkesë shpenzon fillimisht kuotën e planit për sot. Krediti i blerë përdoret vetëm për atë që tejkalon kuotën atë ditë.
- Biseda dhe API e ndajnë — Ka një bilanc për llogari. Një çelës API shpenzon nga bilanci i llogarisë që e zotëron, me të njëjtat çmime si biseda.
- Pakot — Krediti shitet në pako me 1,000,000 ($5.00), 2,000,000 ($10.00) dhe 5,000,000 ($25.00) tokens, ose si një shumë sipas dëshirës nga 1,000,000 deri në 100,000,000 tokens me $5.00 për 1,000,000.
Çfarë rezervon dhe çfarë kushton një kërkesë
- Rezervimi — Kur arrin një kërkesë, ajo rezervon buxhetin e saj të daljes nga bilanci juaj:
max_tokensnë/v1/chat/completionsdhe/v1/messages,max_output_tokensnë/v1/responses./v1/chat/completionslexon edhemax_completion_tokens. Parazgjedhja është 4,096 dhe intervali është 1 deri 65,536. - Pranimi — Kërkesa pranohet vetëm nëse rezervimi ngjit në atë që ka mbetur nga bilanci juaj. Një bilanc mbi zero por më i vogël se buxheti i daljes merr përgjigjen
Quota exceeded. Dërgoni njëmax_tokensmë të vogël për të përdorur pjesën tjetër. - Rregullimi — Kur përgjigjja është e plotë, rezervimi zëvendësohet me faturimin e vërtetë. Faturimi mund të jetë më i ulët ose më i lartë se rezervimi.
- Kthimi — Një kërkesë që mbaron me status gabimi ia kthen rezervimin plotësisht.
Faturimi i vërtetë varet nga familja e modelit.
| Modelet | Çfarë faturohet |
|---|---|
| Modelet Shannon | usage.total_tokens me çmimin e modelit për 1M. Hyrja dhe dalja kanë një tarifë. |
| Modele open-weight të hostuara | Hyrja pa cache me tarifën e hyrjes, hyrja e ruajtur në cache me tarifën e cache-it, dalja me tarifën e daljes. |
Shuma në USD merret nga bilanci juaj në tokens me $5.00 për 1,000,000, e rrumbullakosur në një token të plotë.
Numërimi i tokens-ave me POST /v1/tokenize ose POST /v1/messages/count_tokens është falas dhe nuk rezervon asgjë. Numërimi i tokens-ave
Ku të shihni bilancin dhe përdorimin
Faqja Çelësat dhe përdorimi tregon çfarë mund të shpenzoni tani, kuotën e planit për sot, kreditin tuaj të blerë dhe shpenzimet API të 30 ditëve të fundit. Më poshtë liston çdo kërkesë që ka bërë çelësi juaj: kohën, endpoint-in, modelin, hyrjen e ruajtur në cache, tokens-at e faturuar dhe koston. Çelësat dhe përdorimi
Çdo përgjigje mban edhe një objekt usage me numërimet e tokens-ave të asaj thirrjeje.
| Endpoint | Fushat e usage | Shtuar nga modelet open-weight të hostuara |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagemban numërimet e tokens-ave të modelit. Shuma e marrë nga bilanci juaj nuk është në përgjigje: është kolona Tokens të faturuar e listës së kërkesave te Çelësat dhe përdorimi.- Në
/v1/messagesme një model open-weight të hostuar,input_tokensështë pjesa e hyrjes pa cache,cache_read_input_tokensështë pjesa e ruajtur në cache dhecache_creation_input_tokensështë gjithmonë0. - Një stream në
/v1/chat/completionse mbanusagenë pjesën e fundit para[DONE]. Transmetim
Kur bilanci mbaron
Një kërkesë, rezervimi i së cilës nuk ngjit në bilancin tuaj, merr përgjigje me status 429, llojin rate_limit_error dhe mesazhin më poshtë. Nuk faturohet asgjë. E njëjta përgjigje dërgohet kur bilanci është mbi zero por më i vogël se buxheti i daljes së kërkesës.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Në /v1/responses objekti error mund të mbajë edhe code dhe param, të dyja null.
Çfarë mund të bëni:
- Prisni kuotën e radhës të planit në 00:00 UTC.
- Shtoni kredi. Krediti shpenzohet pas kuotës së planit dhe nuk skadon. Shto kredi
- Kaloni në një plan me kuotë ditore më të madhe. Ndrysho planin
- Dërgoni një
max_tokensmë të vogël, nëse ka mbetur ndonjë bilanc: rezervimi atëherë është më i vogël.
Kuota e thirrjeve Shannon Coder
shannon-coder-1 në /v1/chat/completions dhe /v1/messages numërohet në thirrje, jo në tokens. Çdo plan përfshin një numër thirrjesh për dritare 4-orëshe. Një kërkesë është një thirrje.
| Plani | Thirrje për dritare 4-orëshe |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Dritaret fillojnë në 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Thirrjet që mbeten në fund të një dritareje nuk bartën.
- Një thirrje numërohet kur kërkesa pranohet, para se modeli të përgjigjet. Një kërkesë që dështon pas kësaj prapë numërohet si thirrje.
- Këto thirrje nuk rezervojnë tokens dhe nuk marrin asgjë nga bilanci juaj. Lista e kërkesave te Çelësat dhe përdorimi tregon numrin e tyre të tokens-ave dhe vlerën e tij me çmimin e listuar.
max_tokensi parazgjedhur ishannon-coder-1në këto dy endpoint-e është 65,536.- Kur nuk ka më thirrje, përgjigjja është status
429, llojirate_limit_error, mesazhiShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Në
/v1/responses,shannon-coder-1nuk ka kuotë thirrjesh: faturohet në tokens nga bilanci juaj me $8.00 për 1M, si çdo model tjetër.
Mbrojtja nga vërshimi i kërkesave
Një llogari mund të dërgojë 120 kërkesa në minutë. Ky është kufiri i vetëm për shpejtësinë e kërkesave dhe është i njëjtë në çdo plan. Ekziston për të ndaluar vërshimet, jo për ta ngadalësuar përdorimin normal.
- Minuta është një dritare fikse prej 60 sekondash që hapet me kërkesën tuaj të parë. Kur mbaron, numërimi fillon përsëri nga zero.
- Numërimi është për llogari, jo për çelës dhe jo për adresë IP. Rrotullimi i çelësit nuk hap dritare të re.
- Kërkesa e 121-të brenda një dritareje merr përgjigje me status
429, llojinrate_limit_errordhe mesazhinToo many requests. Retry in <N>s.Nështë numri i sekondave deri në fund të dritares, nga 1 deri 60. - Mbrojtja nga vërshimi i kërkesave kontrollohet para bilancit. Një kërkesë që ajo e refuzon nuk rezervon asgjë dhe nuk kushton asgjë.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Kërkesa | Mbrojtja nga vërshimi i kërkesave |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Numërohet, një për kërkesë. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Nuk numërohet. |
shannon-coder-1 në /v1/chat/completions dhe /v1/messages | Numërohet në vend të kësaj nga kuota e thirrjeve Shannon Coder. |
Një kërkesë që merr përgjigje 401, ose 400 për një model të panjohur | Nuk numërohet. |
| Një kërkesë e refuzuar nga mbrojtja nga vërshimi i kërkesave | Numërohet në dritare. Nuk faturohet asgjë. |
Kërkesat paralele
Nuk ka kufi për sa kërkesa ka të hapura një llogari në të njëjtën kohë, dhe nuk ka gabim për dërgimin e kërkesave paralelisht. Kërkesat që nuk mund të nisin menjëherë presin në radhë dhe marrin përgjigje me radhë.
- Çdo kërkesë numërohet te 120 në minutë kur arrin, pavarësisht nëse kërkesat e mëparshme kanë mbaruar.
- Çdo kërkesë e mban rezervimin e vet derisa mbaron. Njëzet kërkesa të hapura me buxhetin e parazgjedhur të daljes mbajnë 20 × 4,096 = 81,920 tokens bilanc. Nëse rezervimet së bashku janë më të mëdha se bilanci juaj, kërkesa tjetër merr përgjigjen
Quota exceeded, megjithëse thirrjet e mbaruara do të kishin kushtuar më pak. Njëmax_tokensmë i vogël mban më pak. - Një kërkesë pa streaming nuk dërgon asgjë derisa përgjigjja të jetë e plotë, prandaj jepini klientit tuaj një timeout që e mbulon pritjen. Një stream e mban lidhjen e hapur ndërsa pret. Transmetim
Kufijtë e një kërkese të vetme
| Kufiri | Vlera | Vlen për | Te kufiri |
|---|---|---|---|
| Trupi i kërkesës | 32 MiB (33,554,432 bajte) | Çdo endpoint | Statusi 413, lloji invalid_request_error. |
Buxheti i daljes: max_tokens, max_completion_tokens, max_output_tokens | 1 deri 65,536. Parazgjedhja 4,096; për shannon-coder-1 në /v1/chat/completions dhe /v1/messages parazgjedhja është 65,536. | Çdo model, si sasia e rezervuar nga bilanci juaj. Si kufi i gjatësisë së përgjigjes: modelet open-weight të hostuara, shannon-1.6-lite, shannon-1.6-pro dhe shannon-coder-1. | Një vlerë jashtë intervalit zhvendoset te skaji më i afërt i intervalit. Pa gabim. |
Stop sequences: stop, stop_sequences | 4 stringje | Modelet open-weight të hostuara | Përdoren 4 stringjet e para jo bosh. |
| Imazh ose skedar i dhënë si URL | 8 MiB, i lexuar brenda 20 sekondash, më së shumti 5 ridrejtime, një adresë publike http ose https | Çdo endpoint që pranon imazhe ose skedarë | Kërkesa merr përgjigje pa atë pjesë. Pa gabim. |
| Imazh ose skedar i dërguar brenda kërkesës (base64) | Pa kufi të vetin. Numërohet në trupin e kërkesës 32 MiB. | Çdo endpoint që pranon imazhe ose skedarë | Statusi 413 për të gjithë kërkesën. |
text i POST /v1/tokenize | 4,000,000 bajte | /v1/tokenize | Statusi 413, lloji invalid_request_error, mesazhi text too long. |
messages i POST /v1/tokenize dhe trupi i POST /v1/messages/count_tokens | Trupi i kërkesës 32 MiB | Të dy endpoint-et e numërimit | Statusi 413. |
| Dritarja e kontekstit | Për model: context_window te GET /v1/models | Çdo model | Çfarë ndodh me një bisedë më të gjatë varet nga modeli. Modelet dhe çmimet |
Kërkime në ueb (web_search: true) | Për plan dhe ditë: Free 3, Plus 30, Standard 50, Pro 60. Numërohet një kërkim për një kërkesë, kërkimi i së cilës gjeti rezultate. | Kërkesat që vendosin web_search: true | Kur nuk ka më, kërkesa merr përgjigje pa kërkim. Pa gabim. Kërkim i integruar në ueb |
Gabimet
Përgjigjet e kësaj faqeje. Në /v1/messages i njëjti objekt error mbështillet si {"type": "error", "error": {…}}.
| Statusi | Lloji | Mesazhi | Kur, dhe çfarë të bëni |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezervimi i kërkesës nuk ngjit në bilancin tuaj. Prisni 00:00 UTC, shtoni kredi, ndryshoni planin, ose dërgoni një max_tokens më të vogël. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Më shumë se 120 kërkesa në minutën aktuale. Prisni N sekonda dhe dërgoni përsëri. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Thirrjet Shannon Coder të dritares aktuale 4-orëshe janë shfrytëzuar. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Modeli nuk e pranon dot kërkesën në këtë çast. Dërgojeni përsëri pas një pauze të shkurtër. |
503 | api_error | Could not verify your quota right now. Please retry. | Bilanci juaj nuk u lexua dot. Nuk faturohet asgjë; dërgojeni kërkesën përsëri. Në /v1/responses me një model Shannon statusi është 500. |
413 | invalid_request_error | Trupi i kërkesës është më i madh se 32 MiB. Në endpoint-et e formatit OpenAI objekti error mban code: "request_too_large". | |
413 | invalid_request_error | text too long | text i POST /v1/tokenize është më i gjatë se 4,000,000 bajte. |