Salta al contingut
Límits i saldo

Límits i saldo

Totes les sol·licituds s'atenen per igual. Sense nivells de freqüència. Sense quota d'API separada. Ja has pagat els teus tokens: fes-los servir tan de pressa com vulguis.

Aquesta pàgina explica de què es compon el teu saldo, què reserva i què costa una sol·licitud, quantes sol·licituds pots enviar i els pocs límits que una sola sol·licitud pot trobar.

valor d'1M de tokens de saldo
$5.00
la quota diària es renova
00:00 UTC
protecció contra inundació, per compte
120 sol·licituds / min

Com s'atenen les sol·licituds

  • Sense nivells de freqüència — Una sola regla limita la rapidesa amb què poden arribar les sol·licituds, i és la mateixa per a tots els comptes i tots els plans: 120 sol·licituds per minut. No hi ha cap límit de tokens per minut.
  • Sense quota d'API separada — L'API gasta el mateix saldo que el xat. Un pla fixa la mida de la quota d'avui. No fixa una freqüència de sol·licituds.
  • Tan de pressa com vulguis — Les sol·licituds enviades en paral·lel s'accepten i esperen a la cua. No es refusen pel fet de ser en paral·lel.

El teu saldo

El teu saldo es compta en tokens. 1,000,000 de tokens de saldo valen $5.00, i cada preu de la pàgina Models i preus és una tarifa respecte d'aquest valor.

En qualsevol moment el saldo és la suma de dues parts.

  • Quota del pla d'avui — Un nombre de tokens fixat pel teu pla. Es renova cada dia a les 00:00 UTC. El que et queda al final del dia no es transfereix al següent.
  • Crèdit comprat — Tokens que has comprat en un paquet. El crèdit no caduca i serveix a tots els plans, també al Free.
Pla Tokens per dia Val
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Ordre de consum — Cada sol·licitud gasta primer la quota del pla d'avui. El crèdit comprat només es fa servir per a allò que supera la quota d'aquell dia.
  • El xat i l'API el comparteixen — Hi ha un saldo per compte. Una clau API gasta del saldo del compte al qual pertany, als mateixos preus que el xat.
  • Paquets — El crèdit es ven en paquets de 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokens, o per l'import que triïs, de 1,000,000 a 100,000,000 tokens a $5.00 per 1,000,000.

Recarregar crèdit Canviar pla

Què reserva una sol·licitud i què costa

  • Reserva — Quan arriba una sol·licitud, reserva del teu saldo el seu pressupost de sortida: max_tokens a /v1/chat/completions i /v1/messages, max_output_tokens a /v1/responses. /v1/chat/completions també llegeix max_completion_tokens. El valor per defecte és 4,096 i l'interval va d'1 a 65,536.
  • Admissió — La sol·licitud només s'accepta si la reserva cap en el que queda del teu saldo. Un saldo per sobre de zero però més petit que el pressupost de sortida rep la resposta Quota exceeded. Envia un max_tokens més petit per fer servir la resta.
  • Liquidació — Quan la resposta és completa, la reserva se substitueix pel cobrament real. El cobrament pot ser inferior o superior a la reserva.
  • Retorn — Una sol·licitud que acaba amb un estat d'error retorna la seva reserva sencera.

El cobrament real depèn de la família del model.

Models Què es cobra
Models Shannon usage.total_tokens al preu del model per 1M. L'entrada i la sortida tenen una sola tarifa.
Models open-weight hostejats L'entrada sense cache a la tarifa d'entrada, l'entrada en cache a la tarifa de cache, la sortida a la tarifa de sortida.

L'import en USD es descompta del teu saldo en tokens a $5.00 per 1,000,000, arrodonit a un token sencer.

Comptar tokens amb POST /v1/tokenize o POST /v1/messages/count_tokens és gratuït i no reserva res. Recompte de tokens

On veure el saldo i l'ús

La pàgina Keys & usage mostra què pots gastar ara mateix, la quota del pla d'avui, el teu crèdit comprat i el consum de l'API dels darrers 30 dies. Més avall llista totes les sol·licituds que ha fet la teva clau: hora, endpoint, model, entrada en cache, tokens facturats i cost. Keys & usage

Cada resposta porta també un objecte usage amb els recomptes de tokens d'aquella crida.

Endpoint Camps d'usage Afegits pels models open-weight hostejats
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage conté els recomptes de tokens del model. L'import descomptat del teu saldo no és a la resposta: és la columna Tokens facturats de la llista de sol·licituds de Keys & usage.
  • A /v1/messages amb un model open-weight hostejat, input_tokens és la part de l'entrada sense cache, cache_read_input_tokens és la part en cache i cache_creation_input_tokens és sempre 0.
  • Un stream a /v1/chat/completions porta usage en el seu últim fragment abans de [DONE]. Streaming

Quan s'esgota el saldo

Una sol·licitud la reserva de la qual no cap al teu saldo es respon amb l'estat 429, el tipus rate_limit_error i el missatge de sota. No es cobra res. S'envia la mateixa resposta quan el saldo és per sobre de zero però més petit que el pressupost de sortida de la sol·licitud.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

A /v1/responses, l'objecte error també pot contenir code i param, tots dos null.

Què pots fer:

  • Espera la propera quota del pla a les 00:00 UTC.
  • Recarrega crèdit. El crèdit es gasta després de la quota del pla i no caduca. Recarregar crèdit
  • Canvia a un pla amb una quota diària més gran. Canviar pla
  • Envia un max_tokens més petit, si et queda una mica de saldo: així la reserva és més petita.

Quota de crides de Shannon Coder

shannon-coder-1 a /v1/chat/completions i /v1/messages es compta en crides, no en tokens. Cada pla inclou un nombre de crides per finestra de 4 hores. Una sol·licitud és una crida.

Pla Crides per finestra de 4 hores
Free 3
Plus 20
Standard 40
Pro 60
  • Les finestres comencen a les 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Les crides que queden al final d'una finestra no es transfereixen a la següent.
  • Una crida es compta quan s'accepta la sol·licitud, abans que el model respongui. Una sol·licitud que falla després continua comptant com a crida.
  • Aquestes crides no reserven tokens ni descompten res del teu saldo. La llista de sol·licituds de Keys & usage en mostra el recompte de tokens i el valor al preu de llista.
  • El max_tokens per defecte de shannon-coder-1 en aquests dos endpoints és 65,536.
  • Quan no queden crides, la resposta té l'estat 429, el tipus rate_limit_error i el missatge Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • A /v1/responses, shannon-coder-1 no té quota de crides: es cobra en tokens del teu saldo a $8.00 per 1M, com tots els altres models.

Protecció contra inundació

Un compte pot enviar 120 sol·licituds per minut. És l'únic límit de freqüència de sol·licituds, i és el mateix a tots els plans. Existeix per aturar les inundacions, no per alentir l'ús normal.

  • El minut és una finestra fixa de 60 segons que s'obre amb la teva primera sol·licitud. Quan acaba, el recompte torna a començar a zero.
  • El recompte és per compte, no per clau ni per adreça IP. Rotar la clau no obre una finestra nova.
  • La sol·licitud 121 dins d'una finestra es respon amb l'estat 429, el tipus rate_limit_error i el missatge Too many requests. Retry in <N>s. N és el nombre de segons fins que acaba la finestra, d'1 a 60.
  • La protecció contra inundació es comprova abans que el saldo. Una sol·licitud que refusa no reserva res i no costa res.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Sol·licitud Protecció contra inundació
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Es compta, una per sol·licitud.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens No es compta.
shannon-coder-1 a /v1/chat/completions i /v1/messages Es compta amb la quota de crides de Shannon Coder.
Una sol·licitud que es respon amb 401, o amb 400 per a un model desconegut No es compta.
Una sol·licitud refusada per la protecció contra inundació Es compta dins de la finestra. No es cobra res.

Sol·licituds en paral·lel

No hi ha cap límit de quantes sol·licituds pot tenir obertes alhora un compte, ni cap error per enviar sol·licituds en paral·lel. Les sol·licituds que no poden començar d'immediat esperen a la cua i es responen per ordre.

  • Cada sol·licitud compta per als 120 per minut quan arriba, tant si les sol·licituds anteriors han acabat com si no.
  • Cada sol·licitud manté la seva pròpia reserva fins que acaba. Vint sol·licituds obertes amb el pressupost de sortida per defecte mantenen 20 × 4,096 = 81,920 tokens de saldo. Si les reserves juntes són més grans que el teu saldo, la sol·licitud següent rep la resposta Quota exceeded, encara que les crides acabades haurien costat menys. Un max_tokens més petit manté menys.
  • Una sol·licitud sense streaming no envia res fins que la resposta és completa, així que dona al teu client un timeout que cobreixi l'espera. Un stream manté la connexió oberta mentre espera. Streaming

Límits d'una sola sol·licitud

Límit Valor S'aplica a En arribar al límit
Cos de la sol·licitud 32 MiB (33,554,432 bytes) Tots els endpoints Estat 413, tipus invalid_request_error.
Pressupost de sortida: max_tokens, max_completion_tokens, max_output_tokens D'1 a 65,536. Per defecte 4,096; per a shannon-coder-1 a /v1/chat/completions i /v1/messages el valor per defecte és 65,536. Tots els models, com a quantitat reservada del teu saldo. Com a límit de la longitud de la resposta: els models open-weight hostejats, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. Un valor fora de l'interval es mou a l'extrem més proper de l'interval. Sense error.
Seqüències d'aturada: stop, stop_sequences 4 cadenes Models open-weight hostejats Es fan servir les 4 primeres cadenes no buides.
Imatge o fitxer donat com a URL 8 MiB, llegits en 20 segons, com a màxim 5 redireccions, una adreça http o https pública Tots els endpoints que accepten imatges o fitxers La sol·licitud es respon sense aquesta part. Sense error.
Imatge o fitxer enviat en línia (base64) Sense límit propi. Compta dins dels 32 MiB del cos de la sol·licitud. Tots els endpoints que accepten imatges o fitxers Estat 413 per a tota la sol·licitud.
text de POST /v1/tokenize 4,000,000 bytes /v1/tokenize Estat 413, tipus invalid_request_error, missatge text too long.
messages de POST /v1/tokenize i el cos de POST /v1/messages/count_tokens El cos de sol·licitud de 32 MiB Els dos endpoints de recompte Estat 413.
Finestra de context Per model: context_window a GET /v1/models Tots els models Què passa amb una conversa més llarga depèn del model. Models i preus
Cerques web (web_search: true) Per pla i dia: Free 3, Plus 30, Standard 50, Pro 60. Es compta una cerca per a una sol·licitud la cerca de la qual ha trobat resultats. Sol·licituds que defineixen web_search: true Quan no en queda cap, la sol·licitud es respon sense cerca. Sense error. Cerca web

Errors

Les respostes d'aquesta pàgina. A /v1/messages, el mateix objecte error s'embolcalla com a {"type": "error", "error": {…}}.

Estat Tipus Missatge Quan, i què cal fer
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan La reserva de la sol·licitud no cap al teu saldo. Espera fins a les 00:00 UTC, recarrega crèdit, canvia de pla o envia un max_tokens més petit.
429 rate_limit_error Too many requests. Retry in <N>s. Més de 120 sol·licituds en el minut actual. Espera N segons i torna a enviar.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Les crides de Shannon Coder de la finestra actual de 4 hores s'han esgotat.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. El model no pot acceptar la sol·licitud en aquest moment. Torna-la a enviar després d'una breu pausa.
503 api_error Could not verify your quota right now. Please retry. No s'ha pogut llegir el teu saldo. No es cobra res; torna a enviar la sol·licitud. A /v1/responses amb un model Shannon l'estat és 500.
413 invalid_request_error El cos de la sol·licitud és més gran que 32 MiB. Als endpoints de format OpenAI, l'objecte error porta code: "request_too_large".
413 invalid_request_error text too long text de POST /v1/tokenize és més llarg que 4,000,000 bytes.