Límites e saldo
Todas as solicitudes se atenden por igual. Sen niveis de taxa. Sen cota de API separada. Xa pagaches polos teus tokens: úsaos tan rápido como queiras.
Esta páxina explica de que se compón o teu saldo, o que reserva e custa unha solicitude, cantas solicitudes podes enviar e os poucos límites que pode atopar unha soa solicitude.
- valor de 1M de tokens de saldo
- $5.00
- a cota diaria renóvase
- 00:00 UTC
- protección contra inundación, por conta
- 120 solicitudes / min
Como se atenden as solicitudes
- Sen niveis de taxa — Unha regra limita a rapidez con que poden chegar as solicitudes, e é a mesma para todas as contas e todos os plans: 120 solicitudes por minuto. Non hai límite de tokens por minuto.
- Sen cota de API separada — A API gasta o mesmo saldo que o chat. Un plan define o tamaño da cota de hoxe. Non define unha taxa de solicitudes.
- Tan rápido como queiras — As solicitudes enviadas en paralelo acéptanse e agardan na cola. Non se rexeitan por seren paralelas.
O teu saldo
O teu saldo cóntase en tokens. 1,000,000 de tokens de saldo valen $5.00, e todos os prezos da páxina Modelos e prezos son unha tarifa en relación con ese valor.
En todo momento o saldo é a suma de dúas partes.
- Cota do plan de hoxe — Un número de tokens definido polo teu plan. Renóvase cada día ás 00:00 UTC. O que sobra ao final dun día non se acumula.
- Crédito adquirido — Tokens que compraches como paquete. O crédito non caduca e funciona en todos os plans, incluído Free.
| Plan | Tokens por día | Valor |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Orde de gasto — Cada solicitude gasta primeiro a cota do plan de hoxe. O crédito adquirido só se usa para o que supere a cota ese día.
- O chat e a API compártenno — Hai un saldo por conta. Unha clave API gasta do saldo da conta á que pertence, aos mesmos prezos que o chat.
- Paquetes — O crédito véndese en paquetes de 1,000,000 ($5.00), 2,000,000 ($10.00) e 5,000,000 ($25.00) tokens, ou por unha cantidade á túa elección desde 1,000,000 ata 100,000,000 tokens a $5.00 por 1,000,000.
O que reserva unha solicitude e o que custa
- Reservar — Cando chega unha solicitude, reserva o seu orzamento de saída do teu saldo:
max_tokensen/v1/chat/completionse/v1/messages,max_output_tokensen/v1/responses./v1/chat/completionstamén lemax_completion_tokens. O valor predeterminado é 4,096 e o intervalo vai de 1 a 65,536. - Admitir — A solicitude acéptase só se a reserva cabe no que queda do teu saldo. Un saldo superior a cero pero menor que o orzamento de saída recibe a resposta
Quota exceeded. Envía unmax_tokensmenor para usar o resto. - Liquidar — Cando a resposta está completa, a reserva substitúese polo custo real. O custo pode ser menor ou maior que a reserva.
- Devolver — Unha solicitude que remata cun estado de erro devolve a súa reserva por completo.
O custo real depende da familia do modelo.
| Modelos | Que se cobra |
|---|---|
| Modelos Shannon | usage.total_tokens ao prezo do modelo por 1M. A entrada e a saída teñen unha soa tarifa. |
| Modelos open-weight alojados | A entrada sen caché á tarifa de entrada, a entrada en caché á tarifa de caché e a saída á tarifa de saída. |
O importe en USD tómase do teu saldo en tokens a $5.00 por 1,000,000, redondeado a un token enteiro.
Contar tokens con POST /v1/tokenize ou POST /v1/messages/count_tokens é gratuíto e non reserva nada. Reconto de tokens
Onde ver o saldo e o uso
A páxina Claves e uso mostra o que podes gastar agora mesmo, a cota do plan de hoxe, o teu crédito adquirido e o gasto da API dos últimos 30 días. Debaixo lista todas as solicitudes que fixo a túa clave: hora, endpoint, modelo, entrada en caché, tokens facturados e custo. Claves e uso
Todas as respostas levan tamén un obxecto usage cos recontos de tokens desa chamada.
| Endpoint | Campos de usage | Engadido polos modelos open-weight alojados |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagecontén os recontos de tokens do modelo. A cantidade que se descontou do teu saldo non está na resposta: é a columna Tokens facturados da lista de solicitudes en Claves e uso.- En
/v1/messagescun modelo open-weight alojado,input_tokensé a parte da entrada sen caché,cache_read_input_tokensé a parte en caché ecache_creation_input_tokensé sempre0. - Un stream en
/v1/chat/completionslevausageno seu último chunk antes de[DONE]. Streaming
Cando se esgota o saldo
Unha solicitude cuxa reserva non cabe no teu saldo recibe o estado 429, o tipo rate_limit_error e a mensaxe de abaixo. Non se cobra nada. Envíase a mesma resposta cando o saldo é superior a cero pero menor que o orzamento de saída da solicitude.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} En /v1/responses, o obxecto error tamén pode conter code e param, ambos null.
Que podes facer:
- Agarda á seguinte cota do plan ás 00:00 UTC.
- Recarga crédito. O crédito gástase despois da cota do plan e non caduca. Recargar crédito
- Cambia a un plan cunha cota diaria maior. Cambiar plan
- Envía un
max_tokensmenor, se queda algo de saldo: así a reserva é menor.
Cota de chamadas de Shannon Coder
shannon-coder-1 en /v1/chat/completions e /v1/messages cóntase en chamadas, non en tokens. Cada plan inclúe un número de chamadas por xanela de 4 horas. Unha solicitude é unha chamada.
| Plan | Chamadas por xanela de 4 horas |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- As xanelas comezan ás 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. As chamadas que sobran ao final dunha xanela non se acumulan.
- Unha chamada cóntase cando se acepta a solicitude, antes de que responda o modelo. Unha solicitude que falla despois conta igualmente como chamada.
- Estas chamadas non reservan tokens nin quitan nada do teu saldo. A lista de solicitudes en Claves e uso mostra o seu reconto de tokens e o seu valor ao prezo listado.
- O
max_tokenspredeterminado deshannon-coder-1nestes dous endpoints é 65,536. - Sen chamadas restantes, a resposta ten o estado
429, o tiporate_limit_errore a mensaxeShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - En
/v1/responses,shannon-coder-1non ten cota de chamadas: cóbrase en tokens do teu saldo a $8.00 por 1M, como todos os demais modelos.
Protección contra inundación
Unha conta pode enviar 120 solicitudes por minuto. Ese é o único límite á taxa de solicitudes e é o mesmo en todos os plans. Existe para frear as inundacións, non para ralentizar o uso normal.
- O minuto é unha xanela fixa de 60 segundos que se abre coa túa primeira solicitude. Cando remata, o reconto comeza de novo en cero.
- O reconto é por conta, non por clave nin por enderezo IP. Rotar a clave non abre unha xanela nova.
- A solicitude 121 dentro dunha xanela recibe o estado
429, o tiporate_limit_errore a mensaxeToo many requests. Retry in <N>s.Né o número de segundos ata que remata a xanela, de 1 a 60. - A protección contra inundación compróbase antes do saldo. Unha solicitude que rexeita non reserva nada e non custa nada.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Solicitude | Protección contra inundación |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Conta, unha por solicitude. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Non conta. |
shannon-coder-1 en /v1/chat/completions e /v1/messages | Cóntase en cambio coa cota de chamadas de Shannon Coder. |
Unha solicitude que recibe 401, ou 400 por un model descoñecido | Non conta. |
| Unha solicitude rexeitada pola protección contra inundación | Conta para a xanela. Non se cobra nada. |
Solicitudes en paralelo
Non hai límite para o número de solicitudes que unha conta ten abertas á vez, nin erro por enviar solicitudes en paralelo. As solicitudes que non poden comezar de inmediato agardan na cola e respóndense por turnos.
- Cada solicitude conta para as 120 por minuto cando chega, rematasen ou non as solicitudes anteriores.
- Cada solicitude mantén a súa propia reserva ata que remata. Vinte solicitudes abertas co orzamento de saída predeterminado reteñen 20 × 4,096 = 81,920 tokens de saldo. Se as reservas xuntas son maiores que o teu saldo, a seguinte solicitude recibe a resposta
Quota exceeded, aínda que as chamadas rematadas custasen menos. Unmax_tokensmenor retén menos. - Unha solicitude sen streaming non envía nada ata que a súa resposta está completa, así que dálle ao teu cliente un tempo límite que cubra a espera. Un stream mantén a súa conexión aberta mentres espera. Streaming
Límites dunha soa solicitude
| Límite | Valor | Aplícase a | No límite |
|---|---|---|---|
| Corpo da solicitude | 32 MiB (33,554,432 bytes) | Todos os endpoints | Estado 413, tipo invalid_request_error. |
Orzamento de saída: max_tokens, max_completion_tokens, max_output_tokens | De 1 a 65,536. Valor predeterminado 4,096; para shannon-coder-1 en /v1/chat/completions e /v1/messages o valor predeterminado é 65,536. | Todos os modelos, como a cantidade reservada do teu saldo. Como límite da lonxitude da resposta: os modelos open-weight alojados, shannon-1.6-lite, shannon-1.6-pro e shannon-coder-1. | Un valor fóra do intervalo móvese ao extremo máis próximo do intervalo. Sen erro. |
Secuencias de parada: stop, stop_sequences | 4 cadeas | Modelos open-weight alojados | Úsanse as primeiras 4 cadeas non baleiras. |
| Imaxe ou ficheiro dado como URL | 8 MiB, lidos en 20 segundos, como máximo 5 redireccións, un enderezo http ou https público | Todos os endpoints que aceptan imaxes ou ficheiros | A solicitude respóndese sen esa parte. Sen erro. |
| Imaxe ou ficheiro enviado en liña (base64) | Sen límite propio. Conta para o corpo da solicitude de 32 MiB. | Todos os endpoints que aceptan imaxes ou ficheiros | Estado 413 para toda a solicitude. |
text de POST /v1/tokenize | 4,000,000 bytes | /v1/tokenize | Estado 413, tipo invalid_request_error, mensaxe text too long. |
messages de POST /v1/tokenize e o corpo de POST /v1/messages/count_tokens | O corpo da solicitude de 32 MiB | Os dous endpoints de reconto | Estado 413. |
| Ventá de contexto | Por modelo: context_window en GET /v1/models | Todos os modelos | O que pasa cunha conversa máis longa depende do modelo. Modelos e prezos |
Buscas web (web_search: true) | Por plan e día: Free 3, Plus 30, Standard 50, Pro 60. Cóntase unha busca por cada solicitude cuxa busca atopou resultados. | Solicitudes que definen web_search: true | Se non queda ningunha, a solicitude respóndese sen busca. Sen erro. Busca web |
Erros
As respostas desta páxina. En /v1/messages o mesmo obxecto error envólvese como {"type": "error", "error": {…}}.
| Estado | Tipo | Mensaxe | Cando e que facer |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | A reserva da solicitude non cabe no teu saldo. Agarda ata as 00:00 UTC, recarga crédito, cambia de plan ou envía un max_tokens menor. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Máis de 120 solicitudes no minuto actual. Agarda N segundos e envía de novo. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Esgotáronse as chamadas de Shannon Coder da xanela actual de 4 horas. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | O modelo non pode atender a solicitude neste momento. Envíaa de novo despois dunha pequena pausa. |
503 | api_error | Could not verify your quota right now. Please retry. | Non se puido ler o teu saldo. Non se cobra nada; envía a solicitude de novo. En /v1/responses cun modelo Shannon o estado é 500. |
413 | invalid_request_error | O corpo da solicitude é maior de 32 MiB. Nos endpoints en formato OpenAI, o obxecto error leva code: "request_too_large". | |
413 | invalid_request_error | text too long | text de POST /v1/tokenize ten máis de 4,000,000 bytes. |