Limites et saldum
Omnis petitio aequaliter servitur. Nulli gradus celeritatis. Nulla quota API separata. Tokens tuos iam solvisti — utere iis quam celeriter vis.
Haec pagina explicat ex quibus saldum tuum constet, quid una petitio reservet et constet, quot petitiones mittere possis, et paucos limites quos una petitio invenire potest.
- valor 1M tokenum saldi
- $5.00
- quota cotidiana renovatur
- 00:00 UTC
- defensio inundationis, per rationem
- 120 petitiones / min
Quomodo petitiones serviantur
- Nulli gradus celeritatis — Una regula limitat quam celeriter petitiones advenire possint, et eadem est pro omni ratione et omni plano: 120 petitiones per minutum. Nullus limes est tokenum per minutum.
- Nulla quota API separata — API idem saldum consumit ac chat. Planum magnitudinem quotae diei ponit. Celeritatem petitionum non ponit.
- Quam celeriter vis — Petitiones parallele missae accipiuntur et in ordine exspectant. Non recusantur quia parallelae sunt.
Saldum tuum
Saldum tuum in tokens computatur. 1,000,000 tokenum saldi valent $5.00, et omne pretium in pagina Models & pricing est ratio contra hunc valorem.
Quovis momento saldum est summa duarum partium.
- Quota diei — Numerus tokenum a plano tuo positus. Cotidie novus est ad 00:00 UTC. Quod in fine diei superest non transfertur.
- Creditum emptum — Tokens quos ut fasciculum emisti. Creditum non exspirat et in omni plano operatur, etiam in Free.
| Planum | Tokens per diem | Valor |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Ordo consumptionis — Omnis petitio primum quotam diei consumit. Creditum emptum utitur tantum pro eo quod quotam illo die excedit.
- Chat et API id communicant — Unum saldum est per rationem. Clavis API de saldo rationis quae eam possidet consumit, ad eadem pretia ac chat.
- Fasciculi — Creditum in fasciculis 1,000,000 ($5.00), 2,000,000 ($10.00) et 5,000,000 ($25.00) tokenum venditur, aut ut quantitas ex tua electione a 1,000,000 ad 100,000,000 tokens ad $5.00 per 1,000,000.
Quid petitio reservet et quanti constet
- Reservare — Cum petitio advenit, budget outputi suum de saldo tuo reservat:
max_tokensin/v1/chat/completionset/v1/messages,max_output_tokensin/v1/responses./v1/chat/completionsetiammax_completion_tokenslegit. Defaultum est 4,096 et range est 1 ad 65,536. - Admittere — Petitio accipitur tantum si reservatio in id quod de saldo tuo superest capitur. Saldum supra nihil sed minus quam budget outputi responsionem
Quota exceededaccipit. Mittemax_tokensminorem ut reliquum utaris. - Conficere — Cum responsio completa est, reservatio pretio vero substituitur. Pretium inferius vel superius reservatione esse potest.
- Reddere — Petitio quae cum statu erroris finit reservationem suam totam reddit.
Pretium verum a familia modelli pendet.
| Modelli | Quid computetur |
|---|---|
| Modelli Shannon | usage.total_tokens ad pretium modelli per 1M. Input et output unum rate habent. |
| Modelli open-weight hosted | Input non-cached ad rate input, input cached ad rate cached, output ad rate output. |
Summa in USD de saldo tuo in tokens ad $5.00 per 1,000,000 trahitur, ad totum token rotundata.
Tokens computare cum POST /v1/tokenize vel POST /v1/messages/count_tokens gratis est et nihil reservat. Computatio tokenum
Ubi saldum et usum videas
Pagina Keys & usage ostendit quid nunc consumere possis, quotam plani hodiernam, creditum tuum emptum et consumptionem API ultimorum 30 dierum. Infra omnem petitionem quam clavis tua fecit enumerat: tempus, endpoint, modellum, input cached, tokens computati et pretium. Claves et usus
Omnis responsio etiam objectum usage fert cum numeris tokenum illius vocationis.
| Endpoint | Campi usage | Addita a modellis open-weight hosted |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagenumeros tokenum modelli tenet. Quantitas de saldo tuo tracta in responsione non est: est columna Billed tokens indicis petitionum in Keys & usage.- In
/v1/messagescum modello open-weight hosted,input_tokensest pars non-cached inputi,cache_read_input_tokensest pars cached etcache_creation_input_tokenssemper est0. - Stream in
/v1/chat/completionsusagein ultimo chunk ante[DONE]fert. Fluens
Cum saldum deficit
Petitio cuius reservatio in saldum tuum non capitur respondetur cum statu 429, type rate_limit_error et nuntio infra. Nihil computatur. Eadem responsio mittitur cum saldum supra nihil est sed minus quam budget outputi petitionis.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} In /v1/responses objectum error etiam code et param tenere potest, ambo null.
Quid facere possis:
- Exspecta quotam plani proximam ad 00:00 UTC.
- Adde creditum. Creditum post quotam plani consumitur et non exspirat. Addere creditum
- Muta ad planum cum quota cotidiana maiore. Mutare planum
- Mitte
max_tokensminorem, si aliquid saldi superest: reservatio tunc minor est.
Quota vocationum Shannon Coder
shannon-coder-1 in /v1/chat/completions et /v1/messages in vocationibus computatur, non in tokens. Quodque planum numerum vocationum per fenestram 4 horarum includit. Una petitio est una vocatio.
| Planum | Vocationes per fenestram 4 horarum |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Fenestrae ad 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC incipiunt. Vocationes quae in fine fenestrae supersunt non transferuntur.
- Vocatio computatur cum petitio accipitur, antequam modellum respondet. Petitio quae postea deficit adhuc ut vocatio computatur.
- Hae vocationes nullos tokens reservant nec quicquam de saldo tuo trahunt. Index petitionum in Keys & usage numerum tokenum earum et valorem eius ad pretium indicatum ostendit.
max_tokensdefaultumshannon-coder-1in his duobus endpoints est 65,536.- Cum nullae vocationes supersunt, responsio est status
429, typerate_limit_error, nuntiusShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - In
/v1/responses,shannon-coder-1nullam quotam vocationum habet: in tokens de saldo tuo ad $8.00 per 1M computatur, sicut omne aliud modellum.
Defensio inundationis
Ratio 120 petitiones per minutum mittere potest. Hic est solus limes celeritatis petitionum, et idem est in omni plano. Exstat ad inundationes prohibendas, non ad usum normalem tardandum.
- Minutum est fenestra fixa 60 secundarum quae cum prima petitione tua aperitur. Cum finit, numeratio a nihilo iterum incipit.
- Numeratio est per rationem, non per clavem nec per inscriptionem IP. Clavem mutare novam fenestram non aperit.
- Petitio 121 intra fenestram respondetur cum statu
429, typerate_limit_erroret nuntioToo many requests. Retry in <N>s.Nest numerus secundarum usque ad finem fenestrae, ab 1 ad 60. - Defensio inundationis ante saldum inspicitur. Petitio quam recusat nihil reservat et nihil constat.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Petitio | Defensio inundationis |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Computatur, una per petitionem. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Non computatur. |
shannon-coder-1 in /v1/chat/completions et /v1/messages | Pro eo quota vocationum Shannon Coder computatur. |
Petitio cum 401 respondetur, vel cum 400 pro model ignoto | Non computatur. |
| Petitio a defensione inundationis recusata | Ad fenestram computatur. Nihil computatur in pretio. |
Petitiones parallelae
Nullus limes est quot petitiones ratio simul apertas habeat, et nullus error pro petitionibus parallelis mittendis. Petitiones quae statim incipere non possunt in ordine exspectant et vicissim respondentur.
- Quaeque petitio ad 120 per minutum computatur cum advenit, sive priores petitiones finierunt sive non.
- Quaeque petitio reservationem suam tenet donec finit. Viginti petitiones apertae cum budget outputi defaulto 20 × 4,096 = 81,920 tokens saldi tenent. Si reservationes simul maiores sunt quam saldum tuum, petitio proxima responsionem
Quota exceededaccipit, etiam si vocationes finitae minus constitissent.max_tokensminor minus tenet. - Petitio sine streaming nihil mittit donec responsio completa est, itaque da clienti tuo timeout qui exspectationem comprehendat. Stream connexionem suam apertam tenet dum exspectat. Fluens
Limites unius petitionis
| Limes | Valor | Valet pro | Ad limitem |
|---|---|---|---|
| Corpus petitionis | 32 MiB (33,554,432 bytes) | Omne endpoint | Status 413, type invalid_request_error. |
Budget outputi: max_tokens, max_completion_tokens, max_output_tokens | 1 ad 65,536. Defaultum 4,096; pro shannon-coder-1 in /v1/chat/completions et /v1/messages defaultum est 65,536. | Omne modellum, ut quantitas de saldo tuo reservata. Ut limes longitudinis responsionis: modelli open-weight hosted, shannon-1.6-lite, shannon-1.6-pro et shannon-coder-1. | Valor extra range ad finem proximum range movetur. Nullus error. |
Sequentiae stop: stop, stop_sequences | 4 strings | Modelli open-weight hosted | Primi 4 strings non vacui adhibentur. |
| Imago vel fasciculus ut URL datus | 8 MiB, intra 20 secundas lectae, ad summum 5 redirectiones, inscriptio publica http vel https | Omne endpoint quod imagines vel fasciculos accipit | Petitio sine ea parte respondetur. Nullus error. |
| Imago vel fasciculus inline missus (base64) | Nullus limes proprius. Ad corpus petitionis 32 MiB computatur. | Omne endpoint quod imagines vel fasciculos accipit | Status 413 pro tota petitione. |
text ipsius POST /v1/tokenize | 4,000,000 bytes | /v1/tokenize | Status 413, type invalid_request_error, nuntius text too long. |
messages ipsius POST /v1/tokenize et corpus POST /v1/messages/count_tokens | Corpus petitionis 32 MiB | Ambo endpoints computationis | Status 413. |
| Context window | Per modellum: context_window in GET /v1/models | Omne modellum | Quid conversationi longiori accidat a modello pendet. Modella et pretia |
Quaestus interretiales (web_search: true) | Per planum et diem: Free 3, Plus 30, Standard 50, Pro 60. Unus quaestus computatur pro petitione cuius quaestus eventus invenit. | Petitiones quae web_search: true ponunt | Cum nullus superest, petitio sine quaestu respondetur. Nullus error. Quaestus interretialis |
Errores
Responsiones huius paginae. In /v1/messages idem objectum error ut {"type": "error", "error": {…}} involvitur.
| Status | Genus | Nuntius | Quando, et quid faciendum |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Reservatio petitionis in saldum tuum non capitur. Exspecta 00:00 UTC, adde creditum, muta planum, aut mitte max_tokens minorem. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Plus quam 120 petitiones in minuto currenti. Exspecta N secundas et mitte iterum. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Vocationes Shannon Coder fenestrae 4 horarum currentis consumptae sunt. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Modellum petitionem hoc momento accipere non potest. Mitte eam iterum post brevem pausam. |
503 | api_error | Could not verify your quota right now. Please retry. | Saldum tuum legi non potuit. Nihil computatur; mitte petitionem iterum. In /v1/responses cum modello Shannon status est 500. |
413 | invalid_request_error | Corpus petitionis maius est quam 32 MiB. In endpoints formae OpenAI objectum error fert code: "request_too_large". | |
413 | invalid_request_error | text too long | text ipsius POST /v1/tokenize longius est quam 4,000,000 bytes. |