Límits i saldo
Totes les sol·licituds s'atenen per igual. Sense nivells de freqüència. Sense quota d'API separada. Ja has pagat els teus tokens: fes-los servir tan de pressa com vulguis.
Aquesta pàgina explica de què es compon el teu saldo, què reserva i què costa una sol·licitud, quantes sol·licituds pots enviar i els pocs límits que una sola sol·licitud pot trobar.
- valor d'1M de tokens de saldo
- $5.00
- la quota diària es renova
- 00:00 UTC
- protecció contra inundació, per compte
- 120 sol·licituds / min
Com s'atenen les sol·licituds
- Sense nivells de freqüència — Una sola regla limita la rapidesa amb què poden arribar les sol·licituds, i és la mateixa per a tots els comptes i tots els plans: 120 sol·licituds per minut. No hi ha cap límit de tokens per minut.
- Sense quota d'API separada — L'API gasta el mateix saldo que el xat. Un pla fixa la mida de la quota d'avui. No fixa una freqüència de sol·licituds.
- Tan de pressa com vulguis — Les sol·licituds enviades en paral·lel s'accepten i esperen a la cua. No es refusen pel fet de ser en paral·lel.
El teu saldo
El teu saldo es compta en tokens. 1,000,000 de tokens de saldo valen $5.00, i cada preu de la pàgina Models i preus és una tarifa respecte d'aquest valor.
En qualsevol moment el saldo és la suma de dues parts.
- Quota del pla d'avui — Un nombre de tokens fixat pel teu pla. Es renova cada dia a les 00:00 UTC. El que et queda al final del dia no es transfereix al següent.
- Crèdit comprat — Tokens que has comprat en un paquet. El crèdit no caduca i serveix a tots els plans, també al Free.
| Pla | Tokens per dia | Val |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Ordre de consum — Cada sol·licitud gasta primer la quota del pla d'avui. El crèdit comprat només es fa servir per a allò que supera la quota d'aquell dia.
- El xat i l'API el comparteixen — Hi ha un saldo per compte. Una clau API gasta del saldo del compte al qual pertany, als mateixos preus que el xat.
- Paquets — El crèdit es ven en paquets de 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokens, o per l'import que triïs, de 1,000,000 a 100,000,000 tokens a $5.00 per 1,000,000.
Què reserva una sol·licitud i què costa
- Reserva — Quan arriba una sol·licitud, reserva del teu saldo el seu pressupost de sortida:
max_tokensa/v1/chat/completionsi/v1/messages,max_output_tokensa/v1/responses./v1/chat/completionstambé llegeixmax_completion_tokens. El valor per defecte és 4,096 i l'interval va d'1 a 65,536. - Admissió — La sol·licitud només s'accepta si la reserva cap en el que queda del teu saldo. Un saldo per sobre de zero però més petit que el pressupost de sortida rep la resposta
Quota exceeded. Envia unmax_tokensmés petit per fer servir la resta. - Liquidació — Quan la resposta és completa, la reserva se substitueix pel cobrament real. El cobrament pot ser inferior o superior a la reserva.
- Retorn — Una sol·licitud que acaba amb un estat d'error retorna la seva reserva sencera.
El cobrament real depèn de la família del model.
| Models | Què es cobra |
|---|---|
| Models Shannon | usage.total_tokens al preu del model per 1M. L'entrada i la sortida tenen una sola tarifa. |
| Models open-weight hostejats | L'entrada sense cache a la tarifa d'entrada, l'entrada en cache a la tarifa de cache, la sortida a la tarifa de sortida. |
L'import en USD es descompta del teu saldo en tokens a $5.00 per 1,000,000, arrodonit a un token sencer.
Comptar tokens amb POST /v1/tokenize o POST /v1/messages/count_tokens és gratuït i no reserva res. Recompte de tokens
On veure el saldo i l'ús
La pàgina Keys & usage mostra què pots gastar ara mateix, la quota del pla d'avui, el teu crèdit comprat i el consum de l'API dels darrers 30 dies. Més avall llista totes les sol·licituds que ha fet la teva clau: hora, endpoint, model, entrada en cache, tokens facturats i cost. Keys & usage
Cada resposta porta també un objecte usage amb els recomptes de tokens d'aquella crida.
| Endpoint | Camps d'usage | Afegits pels models open-weight hostejats |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageconté els recomptes de tokens del model. L'import descomptat del teu saldo no és a la resposta: és la columna Tokens facturats de la llista de sol·licituds de Keys & usage.- A
/v1/messagesamb un model open-weight hostejat,input_tokensés la part de l'entrada sense cache,cache_read_input_tokensés la part en cache icache_creation_input_tokensés sempre0. - Un stream a
/v1/chat/completionsportausageen el seu últim fragment abans de[DONE]. Streaming
Quan s'esgota el saldo
Una sol·licitud la reserva de la qual no cap al teu saldo es respon amb l'estat 429, el tipus rate_limit_error i el missatge de sota. No es cobra res. S'envia la mateixa resposta quan el saldo és per sobre de zero però més petit que el pressupost de sortida de la sol·licitud.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} A /v1/responses, l'objecte error també pot contenir code i param, tots dos null.
Què pots fer:
- Espera la propera quota del pla a les 00:00 UTC.
- Recarrega crèdit. El crèdit es gasta després de la quota del pla i no caduca. Recarregar crèdit
- Canvia a un pla amb una quota diària més gran. Canviar pla
- Envia un
max_tokensmés petit, si et queda una mica de saldo: així la reserva és més petita.
Quota de crides de Shannon Coder
shannon-coder-1 a /v1/chat/completions i /v1/messages es compta en crides, no en tokens. Cada pla inclou un nombre de crides per finestra de 4 hores. Una sol·licitud és una crida.
| Pla | Crides per finestra de 4 hores |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Les finestres comencen a les 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Les crides que queden al final d'una finestra no es transfereixen a la següent.
- Una crida es compta quan s'accepta la sol·licitud, abans que el model respongui. Una sol·licitud que falla després continua comptant com a crida.
- Aquestes crides no reserven tokens ni descompten res del teu saldo. La llista de sol·licituds de Keys & usage en mostra el recompte de tokens i el valor al preu de llista.
- El
max_tokensper defecte deshannon-coder-1en aquests dos endpoints és 65,536. - Quan no queden crides, la resposta té l'estat
429, el tipusrate_limit_errori el missatgeShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - A
/v1/responses,shannon-coder-1no té quota de crides: es cobra en tokens del teu saldo a $8.00 per 1M, com tots els altres models.
Protecció contra inundació
Un compte pot enviar 120 sol·licituds per minut. És l'únic límit de freqüència de sol·licituds, i és el mateix a tots els plans. Existeix per aturar les inundacions, no per alentir l'ús normal.
- El minut és una finestra fixa de 60 segons que s'obre amb la teva primera sol·licitud. Quan acaba, el recompte torna a començar a zero.
- El recompte és per compte, no per clau ni per adreça IP. Rotar la clau no obre una finestra nova.
- La sol·licitud 121 dins d'una finestra es respon amb l'estat
429, el tipusrate_limit_errori el missatgeToo many requests. Retry in <N>s.Nés el nombre de segons fins que acaba la finestra, d'1 a 60. - La protecció contra inundació es comprova abans que el saldo. Una sol·licitud que refusa no reserva res i no costa res.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Sol·licitud | Protecció contra inundació |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Es compta, una per sol·licitud. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | No es compta. |
shannon-coder-1 a /v1/chat/completions i /v1/messages | Es compta amb la quota de crides de Shannon Coder. |
Una sol·licitud que es respon amb 401, o amb 400 per a un model desconegut | No es compta. |
| Una sol·licitud refusada per la protecció contra inundació | Es compta dins de la finestra. No es cobra res. |
Sol·licituds en paral·lel
No hi ha cap límit de quantes sol·licituds pot tenir obertes alhora un compte, ni cap error per enviar sol·licituds en paral·lel. Les sol·licituds que no poden començar d'immediat esperen a la cua i es responen per ordre.
- Cada sol·licitud compta per als 120 per minut quan arriba, tant si les sol·licituds anteriors han acabat com si no.
- Cada sol·licitud manté la seva pròpia reserva fins que acaba. Vint sol·licituds obertes amb el pressupost de sortida per defecte mantenen 20 × 4,096 = 81,920 tokens de saldo. Si les reserves juntes són més grans que el teu saldo, la sol·licitud següent rep la resposta
Quota exceeded, encara que les crides acabades haurien costat menys. Unmax_tokensmés petit manté menys. - Una sol·licitud sense streaming no envia res fins que la resposta és completa, així que dona al teu client un timeout que cobreixi l'espera. Un stream manté la connexió oberta mentre espera. Streaming
Límits d'una sola sol·licitud
| Límit | Valor | S'aplica a | En arribar al límit |
|---|---|---|---|
| Cos de la sol·licitud | 32 MiB (33,554,432 bytes) | Tots els endpoints | Estat 413, tipus invalid_request_error. |
Pressupost de sortida: max_tokens, max_completion_tokens, max_output_tokens | D'1 a 65,536. Per defecte 4,096; per a shannon-coder-1 a /v1/chat/completions i /v1/messages el valor per defecte és 65,536. | Tots els models, com a quantitat reservada del teu saldo. Com a límit de la longitud de la resposta: els models open-weight hostejats, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. | Un valor fora de l'interval es mou a l'extrem més proper de l'interval. Sense error. |
Seqüències d'aturada: stop, stop_sequences | 4 cadenes | Models open-weight hostejats | Es fan servir les 4 primeres cadenes no buides. |
| Imatge o fitxer donat com a URL | 8 MiB, llegits en 20 segons, com a màxim 5 redireccions, una adreça http o https pública | Tots els endpoints que accepten imatges o fitxers | La sol·licitud es respon sense aquesta part. Sense error. |
| Imatge o fitxer enviat en línia (base64) | Sense límit propi. Compta dins dels 32 MiB del cos de la sol·licitud. | Tots els endpoints que accepten imatges o fitxers | Estat 413 per a tota la sol·licitud. |
text de POST /v1/tokenize | 4,000,000 bytes | /v1/tokenize | Estat 413, tipus invalid_request_error, missatge text too long. |
messages de POST /v1/tokenize i el cos de POST /v1/messages/count_tokens | El cos de sol·licitud de 32 MiB | Els dos endpoints de recompte | Estat 413. |
| Finestra de context | Per model: context_window a GET /v1/models | Tots els models | Què passa amb una conversa més llarga depèn del model. Models i preus |
Cerques web (web_search: true) | Per pla i dia: Free 3, Plus 30, Standard 50, Pro 60. Es compta una cerca per a una sol·licitud la cerca de la qual ha trobat resultats. | Sol·licituds que defineixen web_search: true | Quan no en queda cap, la sol·licitud es respon sense cerca. Sense error. Cerca web |
Errors
Les respostes d'aquesta pàgina. A /v1/messages, el mateix objecte error s'embolcalla com a {"type": "error", "error": {…}}.
| Estat | Tipus | Missatge | Quan, i què cal fer |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | La reserva de la sol·licitud no cap al teu saldo. Espera fins a les 00:00 UTC, recarrega crèdit, canvia de pla o envia un max_tokens més petit. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Més de 120 sol·licituds en el minut actual. Espera N segons i torna a enviar. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Les crides de Shannon Coder de la finestra actual de 4 hores s'han esgotat. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | El model no pot acceptar la sol·licitud en aquest moment. Torna-la a enviar després d'una breu pausa. |
503 | api_error | Could not verify your quota right now. Please retry. | No s'ha pogut llegir el teu saldo. No es cobra res; torna a enviar la sol·licitud. A /v1/responses amb un model Shannon l'estat és 500. |
413 | invalid_request_error | El cos de la sol·licitud és més gran que 32 MiB. Als endpoints de format OpenAI, l'objecte error porta code: "request_too_large". | |
413 | invalid_request_error | text too long | text de POST /v1/tokenize és més llarg que 4,000,000 bytes. |