Saltar al contenido
Límites y saldo

Límites y saldo

Todas las solicitudes se atienden por igual. Sin niveles de límite de tasa. Sin cuota de API aparte. Ya pagaste tus tokens: úsalos tan rápido como quieras.

Esta página explica de qué se compone tu saldo, qué reserva y cuánto cuesta una solicitud, cuántas solicitudes puedes enviar y los pocos límites que puede encontrar una sola solicitud.

valor de 1M de tokens de saldo
$5.00
la cuota diaria se renueva
00:00 UTC
protección contra flood, por cuenta
120 solicitudes / min

Cómo se atienden las solicitudes

  • Sin niveles de límite de tasa — Una regla limita la rapidez con que pueden llegar las solicitudes, y es la misma para todas las cuentas y todos los planes: 120 solicitudes por minuto. No hay límite de tokens por minuto.
  • Sin cuota de API aparte — La API gasta el mismo saldo que el chat. Un plan fija el tamaño de la cuota de hoy. No fija una tasa de solicitudes.
  • Tan rápido como quieras — Las solicitudes enviadas en paralelo se aceptan y esperan en cola. No se rechazan por ser paralelas.

Tu saldo

Tu saldo se cuenta en tokens. 1,000,000 de tokens de saldo valen $5.00, y cada precio de la página Modelos y precios es una tarifa respecto a ese valor.

En cualquier momento el saldo es la suma de dos partes.

  • Cuota del plan de hoy — Un número de tokens fijado por tu plan. Se renueva cada día a las 00:00 UTC. Lo que sobra al final de un día no se acumula.
  • Crédito comprado — Tokens que compraste como paquete. El crédito no caduca y sirve en todos los planes, incluido Free.
Plan Tokens por día Equivale a
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Orden de gasto — Cada solicitud gasta primero la cuota del plan de hoy. El crédito comprado se usa solo para lo que exceda la cuota de ese día.
  • El chat y la API lo comparten — Hay un saldo por cuenta. Una clave API gasta del saldo de la cuenta a la que pertenece, a los mismos precios que el chat.
  • Paquetes — El crédito se vende en paquetes de 1,000,000 ($5.00), 2,000,000 ($10.00) y 5,000,000 ($25.00) tokens, o como una cantidad a tu elección de 1,000,000 a 100,000,000 tokens a $5.00 por 1,000,000.

Recargar crédito Cambiar plan

Qué reserva una solicitud y cuánto cuesta

  • Reservar — Cuando llega una solicitud, reserva de tu saldo su presupuesto de salida: max_tokens en /v1/chat/completions y /v1/messages, max_output_tokens en /v1/responses. /v1/chat/completions también lee max_completion_tokens. El valor predeterminado es 4,096 y el rango va de 1 a 65,536.
  • Admitir — La solicitud se acepta solo si la reserva cabe en lo que queda de tu saldo. Un saldo superior a cero pero menor que el presupuesto de salida recibe la respuesta Quota exceeded. Envía un max_tokens menor para usar el resto.
  • Liquidar — Cuando la respuesta está completa, la reserva se sustituye por el cobro real. El cobro puede ser menor o mayor que la reserva.
  • Devolver — Una solicitud que termina con un estado de error devuelve su reserva completa.

El cobro real depende de la familia del modelo.

Modelos Qué se cobra
Modelos Shannon usage.total_tokens al precio del modelo por 1M. La entrada y la salida tienen una sola tarifa.
Modelos de pesos abiertos alojados La entrada sin caché a la tarifa de entrada, la entrada en caché a la tarifa de caché, la salida a la tarifa de salida.

El importe en USD se descuenta de tu saldo en tokens a $5.00 por 1,000,000, redondeado a un token entero.

Contar tokens con POST /v1/tokenize o POST /v1/messages/count_tokens es gratis y no reserva nada. Conteo de tokens

Dónde ver el saldo y el uso

La página Claves y uso muestra lo que puedes gastar ahora mismo, la cuota del plan de hoy, tu crédito comprado y el gasto de API de los últimos 30 días. Debajo lista cada solicitud que hizo tu clave: hora, endpoint, modelo, entrada en caché, tokens facturados y costo. Claves y uso

Cada respuesta lleva además un objeto usage con los recuentos de tokens de esa llamada.

Endpoint Campos de usage Añadido por los modelos de pesos abiertos alojados
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage contiene los recuentos de tokens del modelo. La cantidad descontada de tu saldo no está en la respuesta: es la columna Tokens facturados de la lista de solicitudes en Claves y uso.
  • En /v1/messages con un modelo de pesos abiertos alojado, input_tokens es la parte de la entrada sin caché, cache_read_input_tokens es la parte en caché y cache_creation_input_tokens es siempre 0.
  • Un stream en /v1/chat/completions lleva usage en su último fragmento antes de [DONE]. Streaming

Cuando se acaba el saldo

Una solicitud cuya reserva no cabe en tu saldo se responde con el estado 429, tipo rate_limit_error y el mensaje siguiente. No se cobra nada. Se envía la misma respuesta cuando el saldo es superior a cero pero menor que el presupuesto de salida de la solicitud.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

En /v1/responses el objeto error también puede contener code y param, ambos null.

Qué puedes hacer:

  • Espera a la siguiente cuota del plan a las 00:00 UTC.
  • Recarga crédito. El crédito se gasta después de la cuota del plan y no caduca. Recargar crédito
  • Cambia a un plan con una cuota diaria mayor. Cambiar plan
  • Envía un max_tokens menor, si queda algo de saldo: la reserva será entonces menor.

Cuota de llamadas de Shannon Coder

shannon-coder-1 en /v1/chat/completions y /v1/messages se cuenta en llamadas, no en tokens. Cada plan incluye un número de llamadas por ventana de 4 horas. Una solicitud es una llamada.

Plan Llamadas por ventana de 4 horas
Free 3
Plus 20
Standard 40
Pro 60
  • Las ventanas empiezan a las 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Las llamadas que sobran al final de una ventana no se acumulan.
  • Una llamada se cuenta cuando se acepta la solicitud, antes de que el modelo responda. Una solicitud que falla después sigue contando como llamada.
  • Estas llamadas no reservan tokens ni toman nada de tu saldo. La lista de solicitudes en Claves y uso muestra su número de tokens y su valor al precio indicado.
  • El max_tokens predeterminado de shannon-coder-1 en estos dos endpoints es 65,536.
  • Sin llamadas restantes, la respuesta tiene el estado 429, tipo rate_limit_error, mensaje Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • En /v1/responses, shannon-coder-1 no tiene cuota de llamadas: se cobra en tokens de tu saldo a $8.00 por 1M, como cualquier otro modelo.

Protección contra flood

Una cuenta puede enviar 120 solicitudes por minuto. Es el único límite de tasa de solicitudes y es el mismo en todos los planes. Existe para frenar los flood, no para ralentizar el uso normal.

  • El minuto es una ventana fija de 60 segundos que se abre con tu primera solicitud. Cuando termina, el conteo vuelve a empezar desde cero.
  • El conteo es por cuenta, no por clave ni por dirección IP. Rotar la clave no abre una ventana nueva.
  • La solicitud 121 dentro de una ventana se responde con el estado 429, tipo rate_limit_error y el mensaje Too many requests. Retry in <N>s. N es el número de segundos hasta que termina la ventana, de 1 a 60.
  • La protección contra flood se comprueba antes que el saldo. Una solicitud que rechaza no reserva nada y no cuesta nada.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Solicitud Protección contra flood
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Se cuenta, una por solicitud.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens No se cuenta.
shannon-coder-1 en /v1/chat/completions y /v1/messages Se cuenta en cambio por la cuota de llamadas de Shannon Coder.
Una solicitud respondida con 401, o con 400 por un model desconocido No se cuenta.
Una solicitud rechazada por la protección contra flood Cuenta para la ventana. No se cobra nada.

Solicitudes en paralelo

No hay límite de cuántas solicitudes puede tener abiertas a la vez una cuenta, ni un error por enviar solicitudes en paralelo. Las solicitudes que no pueden empezar de inmediato esperan en cola y se responden por turno.

  • Cada solicitud cuenta para las 120 por minuto cuando llega, hayan terminado o no las solicitudes anteriores.
  • Cada solicitud mantiene su propia reserva hasta que termina. Veinte solicitudes abiertas con el presupuesto de salida predeterminado retienen 20 × 4,096 = 81,920 tokens de saldo. Si las reservas juntas son mayores que tu saldo, la siguiente solicitud recibe la respuesta Quota exceeded, aunque las llamadas terminadas habrían costado menos. Un max_tokens menor retiene menos.
  • Una solicitud sin streaming no envía nada hasta que su respuesta está completa, así que da a tu cliente un timeout que cubra la espera. Un stream mantiene su conexión abierta mientras espera. Streaming

Límites de una sola solicitud

Límite Valor Se aplica a En el límite
Cuerpo de la solicitud 32 MiB (33,554,432 bytes) Todos los endpoints Estado 413, tipo invalid_request_error.
Presupuesto de salida: max_tokens, max_completion_tokens, max_output_tokens De 1 a 65,536. Predeterminado 4,096; para shannon-coder-1 en /v1/chat/completions y /v1/messages el valor predeterminado es 65,536. Todos los modelos, como la cantidad reservada de tu saldo. Como límite de la longitud de la respuesta: los modelos de pesos abiertos alojados, shannon-1.6-lite, shannon-1.6-pro y shannon-coder-1. Un valor fuera del rango se lleva al extremo más cercano del rango. Sin error.
Secuencias de parada: stop, stop_sequences 4 cadenas Modelos de pesos abiertos alojados Se usan las primeras 4 cadenas no vacías.
Imagen o archivo dado como URL 8 MiB, leído en 20 segundos, como máximo 5 redirecciones, una dirección http o https pública Todos los endpoints que aceptan imágenes o archivos La solicitud se responde sin esa parte. Sin error.
Imagen o archivo enviado en línea (base64) Sin límite propio. Cuenta para el cuerpo de solicitud de 32 MiB. Todos los endpoints que aceptan imágenes o archivos Estado 413 para toda la solicitud.
text de POST /v1/tokenize 4,000,000 bytes /v1/tokenize Estado 413, tipo invalid_request_error, mensaje text too long.
messages de POST /v1/tokenize y el cuerpo de POST /v1/messages/count_tokens El cuerpo de solicitud de 32 MiB Ambos endpoints de conteo Estado 413.
Ventana de contexto Por modelo: context_window en GET /v1/models Todos los modelos Lo que ocurre con una conversación más larga depende del modelo. Modelos y precios
Búsquedas web (web_search: true) Por plan y día: Free 3, Plus 30, Standard 50, Pro 60. Se cuenta una búsqueda por cada solicitud cuya búsqueda encontró resultados. Solicitudes que establecen web_search: true Si no queda ninguna, la solicitud se responde sin búsqueda. Sin error. Búsqueda web integrada

Errores

Las respuestas de esta página. En /v1/messages el mismo objeto error se envuelve como {"type": "error", "error": {…}}.

Estado Tipo Mensaje Cuándo y qué hacer
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan La reserva de la solicitud no cabe en tu saldo. Espera a las 00:00 UTC, recarga crédito, cambia de plan o envía un max_tokens menor.
429 rate_limit_error Too many requests. Retry in <N>s. Más de 120 solicitudes en el minuto actual. Espera N segundos y envía de nuevo.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Se agotaron las llamadas de Shannon Coder de la ventana actual de 4 horas.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. El modelo no puede aceptar la solicitud en este momento. Envíala de nuevo tras una breve pausa.
503 api_error Could not verify your quota right now. Please retry. No se pudo leer tu saldo. No se cobra nada; envía la solicitud de nuevo. En /v1/responses con un modelo Shannon el estado es 500.
413 invalid_request_error El cuerpo de la solicitud es mayor que 32 MiB. En los endpoints con formato OpenAI, el objeto error lleva code: "request_too_large".
413 invalid_request_error text too long text de POST /v1/tokenize supera los 4,000,000 bytes.