Saltar ao contido
Límites e saldo

Límites e saldo

Todas as solicitudes se atenden por igual. Sen niveis de taxa. Sen cota de API separada. Xa pagaches polos teus tokens: úsaos tan rápido como queiras.

Esta páxina explica de que se compón o teu saldo, o que reserva e custa unha solicitude, cantas solicitudes podes enviar e os poucos límites que pode atopar unha soa solicitude.

valor de 1M de tokens de saldo
$5.00
a cota diaria renóvase
00:00 UTC
protección contra inundación, por conta
120 solicitudes / min

Como se atenden as solicitudes

  • Sen niveis de taxa — Unha regra limita a rapidez con que poden chegar as solicitudes, e é a mesma para todas as contas e todos os plans: 120 solicitudes por minuto. Non hai límite de tokens por minuto.
  • Sen cota de API separada — A API gasta o mesmo saldo que o chat. Un plan define o tamaño da cota de hoxe. Non define unha taxa de solicitudes.
  • Tan rápido como queiras — As solicitudes enviadas en paralelo acéptanse e agardan na cola. Non se rexeitan por seren paralelas.

O teu saldo

O teu saldo cóntase en tokens. 1,000,000 de tokens de saldo valen $5.00, e todos os prezos da páxina Modelos e prezos son unha tarifa en relación con ese valor.

En todo momento o saldo é a suma de dúas partes.

  • Cota do plan de hoxe — Un número de tokens definido polo teu plan. Renóvase cada día ás 00:00 UTC. O que sobra ao final dun día non se acumula.
  • Crédito adquirido — Tokens que compraches como paquete. O crédito non caduca e funciona en todos os plans, incluído Free.
Plan Tokens por día Valor
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Orde de gasto — Cada solicitude gasta primeiro a cota do plan de hoxe. O crédito adquirido só se usa para o que supere a cota ese día.
  • O chat e a API compártenno — Hai un saldo por conta. Unha clave API gasta do saldo da conta á que pertence, aos mesmos prezos que o chat.
  • Paquetes — O crédito véndese en paquetes de 1,000,000 ($5.00), 2,000,000 ($10.00) e 5,000,000 ($25.00) tokens, ou por unha cantidade á túa elección desde 1,000,000 ata 100,000,000 tokens a $5.00 por 1,000,000.

Recargar crédito Cambiar plan

O que reserva unha solicitude e o que custa

  • Reservar — Cando chega unha solicitude, reserva o seu orzamento de saída do teu saldo: max_tokens en /v1/chat/completions e /v1/messages, max_output_tokens en /v1/responses. /v1/chat/completions tamén le max_completion_tokens. O valor predeterminado é 4,096 e o intervalo vai de 1 a 65,536.
  • Admitir — A solicitude acéptase só se a reserva cabe no que queda do teu saldo. Un saldo superior a cero pero menor que o orzamento de saída recibe a resposta Quota exceeded. Envía un max_tokens menor para usar o resto.
  • Liquidar — Cando a resposta está completa, a reserva substitúese polo custo real. O custo pode ser menor ou maior que a reserva.
  • Devolver — Unha solicitude que remata cun estado de erro devolve a súa reserva por completo.

O custo real depende da familia do modelo.

Modelos Que se cobra
Modelos Shannon usage.total_tokens ao prezo do modelo por 1M. A entrada e a saída teñen unha soa tarifa.
Modelos open-weight alojados A entrada sen caché á tarifa de entrada, a entrada en caché á tarifa de caché e a saída á tarifa de saída.

O importe en USD tómase do teu saldo en tokens a $5.00 por 1,000,000, redondeado a un token enteiro.

Contar tokens con POST /v1/tokenize ou POST /v1/messages/count_tokens é gratuíto e non reserva nada. Reconto de tokens

Onde ver o saldo e o uso

A páxina Claves e uso mostra o que podes gastar agora mesmo, a cota do plan de hoxe, o teu crédito adquirido e o gasto da API dos últimos 30 días. Debaixo lista todas as solicitudes que fixo a túa clave: hora, endpoint, modelo, entrada en caché, tokens facturados e custo. Claves e uso

Todas as respostas levan tamén un obxecto usage cos recontos de tokens desa chamada.

Endpoint Campos de usage Engadido polos modelos open-weight alojados
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage contén os recontos de tokens do modelo. A cantidade que se descontou do teu saldo non está na resposta: é a columna Tokens facturados da lista de solicitudes en Claves e uso.
  • En /v1/messages cun modelo open-weight alojado, input_tokens é a parte da entrada sen caché, cache_read_input_tokens é a parte en caché e cache_creation_input_tokens é sempre 0.
  • Un stream en /v1/chat/completions leva usage no seu último chunk antes de [DONE]. Streaming

Cando se esgota o saldo

Unha solicitude cuxa reserva non cabe no teu saldo recibe o estado 429, o tipo rate_limit_error e a mensaxe de abaixo. Non se cobra nada. Envíase a mesma resposta cando o saldo é superior a cero pero menor que o orzamento de saída da solicitude.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

En /v1/responses, o obxecto error tamén pode conter code e param, ambos null.

Que podes facer:

  • Agarda á seguinte cota do plan ás 00:00 UTC.
  • Recarga crédito. O crédito gástase despois da cota do plan e non caduca. Recargar crédito
  • Cambia a un plan cunha cota diaria maior. Cambiar plan
  • Envía un max_tokens menor, se queda algo de saldo: así a reserva é menor.

Cota de chamadas de Shannon Coder

shannon-coder-1 en /v1/chat/completions e /v1/messages cóntase en chamadas, non en tokens. Cada plan inclúe un número de chamadas por xanela de 4 horas. Unha solicitude é unha chamada.

Plan Chamadas por xanela de 4 horas
Free 3
Plus 20
Standard 40
Pro 60
  • As xanelas comezan ás 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. As chamadas que sobran ao final dunha xanela non se acumulan.
  • Unha chamada cóntase cando se acepta a solicitude, antes de que responda o modelo. Unha solicitude que falla despois conta igualmente como chamada.
  • Estas chamadas non reservan tokens nin quitan nada do teu saldo. A lista de solicitudes en Claves e uso mostra o seu reconto de tokens e o seu valor ao prezo listado.
  • O max_tokens predeterminado de shannon-coder-1 nestes dous endpoints é 65,536.
  • Sen chamadas restantes, a resposta ten o estado 429, o tipo rate_limit_error e a mensaxe Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • En /v1/responses, shannon-coder-1 non ten cota de chamadas: cóbrase en tokens do teu saldo a $8.00 por 1M, como todos os demais modelos.

Protección contra inundación

Unha conta pode enviar 120 solicitudes por minuto. Ese é o único límite á taxa de solicitudes e é o mesmo en todos os plans. Existe para frear as inundacións, non para ralentizar o uso normal.

  • O minuto é unha xanela fixa de 60 segundos que se abre coa túa primeira solicitude. Cando remata, o reconto comeza de novo en cero.
  • O reconto é por conta, non por clave nin por enderezo IP. Rotar a clave non abre unha xanela nova.
  • A solicitude 121 dentro dunha xanela recibe o estado 429, o tipo rate_limit_error e a mensaxe Too many requests. Retry in <N>s. N é o número de segundos ata que remata a xanela, de 1 a 60.
  • A protección contra inundación compróbase antes do saldo. Unha solicitude que rexeita non reserva nada e non custa nada.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Solicitude Protección contra inundación
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Conta, unha por solicitude.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Non conta.
shannon-coder-1 en /v1/chat/completions e /v1/messages Cóntase en cambio coa cota de chamadas de Shannon Coder.
Unha solicitude que recibe 401, ou 400 por un model descoñecido Non conta.
Unha solicitude rexeitada pola protección contra inundación Conta para a xanela. Non se cobra nada.

Solicitudes en paralelo

Non hai límite para o número de solicitudes que unha conta ten abertas á vez, nin erro por enviar solicitudes en paralelo. As solicitudes que non poden comezar de inmediato agardan na cola e respóndense por turnos.

  • Cada solicitude conta para as 120 por minuto cando chega, rematasen ou non as solicitudes anteriores.
  • Cada solicitude mantén a súa propia reserva ata que remata. Vinte solicitudes abertas co orzamento de saída predeterminado reteñen 20 × 4,096 = 81,920 tokens de saldo. Se as reservas xuntas son maiores que o teu saldo, a seguinte solicitude recibe a resposta Quota exceeded, aínda que as chamadas rematadas custasen menos. Un max_tokens menor retén menos.
  • Unha solicitude sen streaming non envía nada ata que a súa resposta está completa, así que dálle ao teu cliente un tempo límite que cubra a espera. Un stream mantén a súa conexión aberta mentres espera. Streaming

Límites dunha soa solicitude

Límite Valor Aplícase a No límite
Corpo da solicitude 32 MiB (33,554,432 bytes) Todos os endpoints Estado 413, tipo invalid_request_error.
Orzamento de saída: max_tokens, max_completion_tokens, max_output_tokens De 1 a 65,536. Valor predeterminado 4,096; para shannon-coder-1 en /v1/chat/completions e /v1/messages o valor predeterminado é 65,536. Todos os modelos, como a cantidade reservada do teu saldo. Como límite da lonxitude da resposta: os modelos open-weight alojados, shannon-1.6-lite, shannon-1.6-pro e shannon-coder-1. Un valor fóra do intervalo móvese ao extremo máis próximo do intervalo. Sen erro.
Secuencias de parada: stop, stop_sequences 4 cadeas Modelos open-weight alojados Úsanse as primeiras 4 cadeas non baleiras.
Imaxe ou ficheiro dado como URL 8 MiB, lidos en 20 segundos, como máximo 5 redireccións, un enderezo http ou https público Todos os endpoints que aceptan imaxes ou ficheiros A solicitude respóndese sen esa parte. Sen erro.
Imaxe ou ficheiro enviado en liña (base64) Sen límite propio. Conta para o corpo da solicitude de 32 MiB. Todos os endpoints que aceptan imaxes ou ficheiros Estado 413 para toda a solicitude.
text de POST /v1/tokenize 4,000,000 bytes /v1/tokenize Estado 413, tipo invalid_request_error, mensaxe text too long.
messages de POST /v1/tokenize e o corpo de POST /v1/messages/count_tokens O corpo da solicitude de 32 MiB Os dous endpoints de reconto Estado 413.
Ventá de contexto Por modelo: context_window en GET /v1/models Todos os modelos O que pasa cunha conversa máis longa depende do modelo. Modelos e prezos
Buscas web (web_search: true) Por plan e día: Free 3, Plus 30, Standard 50, Pro 60. Cóntase unha busca por cada solicitude cuxa busca atopou resultados. Solicitudes que definen web_search: true Se non queda ningunha, a solicitude respóndese sen busca. Sen erro. Busca web

Erros

As respostas desta páxina. En /v1/messages o mesmo obxecto error envólvese como {"type": "error", "error": {…}}.

Estado Tipo Mensaxe Cando e que facer
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan A reserva da solicitude non cabe no teu saldo. Agarda ata as 00:00 UTC, recarga crédito, cambia de plan ou envía un max_tokens menor.
429 rate_limit_error Too many requests. Retry in <N>s. Máis de 120 solicitudes no minuto actual. Agarda N segundos e envía de novo.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Esgotáronse as chamadas de Shannon Coder da xanela actual de 4 horas.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. O modelo non pode atender a solicitude neste momento. Envíaa de novo despois dunha pequena pausa.
503 api_error Could not verify your quota right now. Please retry. Non se puido ler o teu saldo. Non se cobra nada; envía a solicitude de novo. En /v1/responses cun modelo Shannon o estado é 500.
413 invalid_request_error O corpo da solicitude é maior de 32 MiB. Nos endpoints en formato OpenAI, o obxecto error leva code: "request_too_large".
413 invalid_request_error text too long text de POST /v1/tokenize ten máis de 4,000,000 bytes.