Ad contentum transili
Limites et saldum

Limites et saldum

Omnis petitio aequaliter servitur. Nulli gradus celeritatis. Nulla quota API separata. Tokens tuos iam solvisti — utere iis quam celeriter vis.

Haec pagina explicat ex quibus saldum tuum constet, quid una petitio reservet et constet, quot petitiones mittere possis, et paucos limites quos una petitio invenire potest.

valor 1M tokenum saldi
$5.00
quota cotidiana renovatur
00:00 UTC
defensio inundationis, per rationem
120 petitiones / min

Quomodo petitiones serviantur

  • Nulli gradus celeritatis — Una regula limitat quam celeriter petitiones advenire possint, et eadem est pro omni ratione et omni plano: 120 petitiones per minutum. Nullus limes est tokenum per minutum.
  • Nulla quota API separata — API idem saldum consumit ac chat. Planum magnitudinem quotae diei ponit. Celeritatem petitionum non ponit.
  • Quam celeriter vis — Petitiones parallele missae accipiuntur et in ordine exspectant. Non recusantur quia parallelae sunt.

Saldum tuum

Saldum tuum in tokens computatur. 1,000,000 tokenum saldi valent $5.00, et omne pretium in pagina Models & pricing est ratio contra hunc valorem.

Quovis momento saldum est summa duarum partium.

  • Quota diei — Numerus tokenum a plano tuo positus. Cotidie novus est ad 00:00 UTC. Quod in fine diei superest non transfertur.
  • Creditum emptum — Tokens quos ut fasciculum emisti. Creditum non exspirat et in omni plano operatur, etiam in Free.
Planum Tokens per diem Valor
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Ordo consumptionis — Omnis petitio primum quotam diei consumit. Creditum emptum utitur tantum pro eo quod quotam illo die excedit.
  • Chat et API id communicant — Unum saldum est per rationem. Clavis API de saldo rationis quae eam possidet consumit, ad eadem pretia ac chat.
  • Fasciculi — Creditum in fasciculis 1,000,000 ($5.00), 2,000,000 ($10.00) et 5,000,000 ($25.00) tokenum venditur, aut ut quantitas ex tua electione a 1,000,000 ad 100,000,000 tokens ad $5.00 per 1,000,000.

Addere creditum Mutare planum

Quid petitio reservet et quanti constet

  • Reservare — Cum petitio advenit, budget outputi suum de saldo tuo reservat: max_tokens in /v1/chat/completions et /v1/messages, max_output_tokens in /v1/responses. /v1/chat/completions etiam max_completion_tokens legit. Defaultum est 4,096 et range est 1 ad 65,536.
  • Admittere — Petitio accipitur tantum si reservatio in id quod de saldo tuo superest capitur. Saldum supra nihil sed minus quam budget outputi responsionem Quota exceeded accipit. Mitte max_tokens minorem ut reliquum utaris.
  • Conficere — Cum responsio completa est, reservatio pretio vero substituitur. Pretium inferius vel superius reservatione esse potest.
  • Reddere — Petitio quae cum statu erroris finit reservationem suam totam reddit.

Pretium verum a familia modelli pendet.

Modelli Quid computetur
Modelli Shannon usage.total_tokens ad pretium modelli per 1M. Input et output unum rate habent.
Modelli open-weight hosted Input non-cached ad rate input, input cached ad rate cached, output ad rate output.

Summa in USD de saldo tuo in tokens ad $5.00 per 1,000,000 trahitur, ad totum token rotundata.

Tokens computare cum POST /v1/tokenize vel POST /v1/messages/count_tokens gratis est et nihil reservat. Computatio tokenum

Ubi saldum et usum videas

Pagina Keys & usage ostendit quid nunc consumere possis, quotam plani hodiernam, creditum tuum emptum et consumptionem API ultimorum 30 dierum. Infra omnem petitionem quam clavis tua fecit enumerat: tempus, endpoint, modellum, input cached, tokens computati et pretium. Claves et usus

Omnis responsio etiam objectum usage fert cum numeris tokenum illius vocationis.

Endpoint Campi usage Addita a modellis open-weight hosted
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage numeros tokenum modelli tenet. Quantitas de saldo tuo tracta in responsione non est: est columna Billed tokens indicis petitionum in Keys & usage.
  • In /v1/messages cum modello open-weight hosted, input_tokens est pars non-cached inputi, cache_read_input_tokens est pars cached et cache_creation_input_tokens semper est 0.
  • Stream in /v1/chat/completions usage in ultimo chunk ante [DONE] fert. Fluens

Cum saldum deficit

Petitio cuius reservatio in saldum tuum non capitur respondetur cum statu 429, type rate_limit_error et nuntio infra. Nihil computatur. Eadem responsio mittitur cum saldum supra nihil est sed minus quam budget outputi petitionis.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

In /v1/responses objectum error etiam code et param tenere potest, ambo null.

Quid facere possis:

  • Exspecta quotam plani proximam ad 00:00 UTC.
  • Adde creditum. Creditum post quotam plani consumitur et non exspirat. Addere creditum
  • Muta ad planum cum quota cotidiana maiore. Mutare planum
  • Mitte max_tokens minorem, si aliquid saldi superest: reservatio tunc minor est.

Quota vocationum Shannon Coder

shannon-coder-1 in /v1/chat/completions et /v1/messages in vocationibus computatur, non in tokens. Quodque planum numerum vocationum per fenestram 4 horarum includit. Una petitio est una vocatio.

Planum Vocationes per fenestram 4 horarum
Free 3
Plus 20
Standard 40
Pro 60
  • Fenestrae ad 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC incipiunt. Vocationes quae in fine fenestrae supersunt non transferuntur.
  • Vocatio computatur cum petitio accipitur, antequam modellum respondet. Petitio quae postea deficit adhuc ut vocatio computatur.
  • Hae vocationes nullos tokens reservant nec quicquam de saldo tuo trahunt. Index petitionum in Keys & usage numerum tokenum earum et valorem eius ad pretium indicatum ostendit.
  • max_tokens defaultum shannon-coder-1 in his duobus endpoints est 65,536.
  • Cum nullae vocationes supersunt, responsio est status 429, type rate_limit_error, nuntius Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • In /v1/responses, shannon-coder-1 nullam quotam vocationum habet: in tokens de saldo tuo ad $8.00 per 1M computatur, sicut omne aliud modellum.

Defensio inundationis

Ratio 120 petitiones per minutum mittere potest. Hic est solus limes celeritatis petitionum, et idem est in omni plano. Exstat ad inundationes prohibendas, non ad usum normalem tardandum.

  • Minutum est fenestra fixa 60 secundarum quae cum prima petitione tua aperitur. Cum finit, numeratio a nihilo iterum incipit.
  • Numeratio est per rationem, non per clavem nec per inscriptionem IP. Clavem mutare novam fenestram non aperit.
  • Petitio 121 intra fenestram respondetur cum statu 429, type rate_limit_error et nuntio Too many requests. Retry in <N>s. N est numerus secundarum usque ad finem fenestrae, ab 1 ad 60.
  • Defensio inundationis ante saldum inspicitur. Petitio quam recusat nihil reservat et nihil constat.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Petitio Defensio inundationis
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Computatur, una per petitionem.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Non computatur.
shannon-coder-1 in /v1/chat/completions et /v1/messages Pro eo quota vocationum Shannon Coder computatur.
Petitio cum 401 respondetur, vel cum 400 pro model ignoto Non computatur.
Petitio a defensione inundationis recusata Ad fenestram computatur. Nihil computatur in pretio.

Petitiones parallelae

Nullus limes est quot petitiones ratio simul apertas habeat, et nullus error pro petitionibus parallelis mittendis. Petitiones quae statim incipere non possunt in ordine exspectant et vicissim respondentur.

  • Quaeque petitio ad 120 per minutum computatur cum advenit, sive priores petitiones finierunt sive non.
  • Quaeque petitio reservationem suam tenet donec finit. Viginti petitiones apertae cum budget outputi defaulto 20 × 4,096 = 81,920 tokens saldi tenent. Si reservationes simul maiores sunt quam saldum tuum, petitio proxima responsionem Quota exceeded accipit, etiam si vocationes finitae minus constitissent. max_tokens minor minus tenet.
  • Petitio sine streaming nihil mittit donec responsio completa est, itaque da clienti tuo timeout qui exspectationem comprehendat. Stream connexionem suam apertam tenet dum exspectat. Fluens

Limites unius petitionis

Limes Valor Valet pro Ad limitem
Corpus petitionis 32 MiB (33,554,432 bytes) Omne endpoint Status 413, type invalid_request_error.
Budget outputi: max_tokens, max_completion_tokens, max_output_tokens 1 ad 65,536. Defaultum 4,096; pro shannon-coder-1 in /v1/chat/completions et /v1/messages defaultum est 65,536. Omne modellum, ut quantitas de saldo tuo reservata. Ut limes longitudinis responsionis: modelli open-weight hosted, shannon-1.6-lite, shannon-1.6-pro et shannon-coder-1. Valor extra range ad finem proximum range movetur. Nullus error.
Sequentiae stop: stop, stop_sequences 4 strings Modelli open-weight hosted Primi 4 strings non vacui adhibentur.
Imago vel fasciculus ut URL datus 8 MiB, intra 20 secundas lectae, ad summum 5 redirectiones, inscriptio publica http vel https Omne endpoint quod imagines vel fasciculos accipit Petitio sine ea parte respondetur. Nullus error.
Imago vel fasciculus inline missus (base64) Nullus limes proprius. Ad corpus petitionis 32 MiB computatur. Omne endpoint quod imagines vel fasciculos accipit Status 413 pro tota petitione.
text ipsius POST /v1/tokenize 4,000,000 bytes /v1/tokenize Status 413, type invalid_request_error, nuntius text too long.
messages ipsius POST /v1/tokenize et corpus POST /v1/messages/count_tokens Corpus petitionis 32 MiB Ambo endpoints computationis Status 413.
Context window Per modellum: context_window in GET /v1/models Omne modellum Quid conversationi longiori accidat a modello pendet. Modella et pretia
Quaestus interretiales (web_search: true) Per planum et diem: Free 3, Plus 30, Standard 50, Pro 60. Unus quaestus computatur pro petitione cuius quaestus eventus invenit. Petitiones quae web_search: true ponunt Cum nullus superest, petitio sine quaestu respondetur. Nullus error. Quaestus interretialis

Errores

Responsiones huius paginae. In /v1/messages idem objectum error ut {"type": "error", "error": {…}} involvitur.

Status Genus Nuntius Quando, et quid faciendum
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Reservatio petitionis in saldum tuum non capitur. Exspecta 00:00 UTC, adde creditum, muta planum, aut mitte max_tokens minorem.
429 rate_limit_error Too many requests. Retry in <N>s. Plus quam 120 petitiones in minuto currenti. Exspecta N secundas et mitte iterum.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Vocationes Shannon Coder fenestrae 4 horarum currentis consumptae sunt.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Modellum petitionem hoc momento accipere non potest. Mitte eam iterum post brevem pausam.
503 api_error Could not verify your quota right now. Please retry. Saldum tuum legi non potuit. Nihil computatur; mitte petitionem iterum. In /v1/responses cum modello Shannon status est 500.
413 invalid_request_error Corpus petitionis maius est quam 32 MiB. In endpoints formae OpenAI objectum error fert code: "request_too_large".
413 invalid_request_error text too long text ipsius POST /v1/tokenize longius est quam 4,000,000 bytes.