Límites y saldo
Todas las solicitudes se atienden por igual. Sin niveles de límite de tasa. Sin cuota de API aparte. Ya pagaste tus tokens: úsalos tan rápido como quieras.
Esta página explica de qué se compone tu saldo, qué reserva y cuánto cuesta una solicitud, cuántas solicitudes puedes enviar y los pocos límites que puede encontrar una sola solicitud.
- valor de 1M de tokens de saldo
- $5.00
- la cuota diaria se renueva
- 00:00 UTC
- protección contra flood, por cuenta
- 120 solicitudes / min
Cómo se atienden las solicitudes
- Sin niveles de límite de tasa — Una regla limita la rapidez con que pueden llegar las solicitudes, y es la misma para todas las cuentas y todos los planes: 120 solicitudes por minuto. No hay límite de tokens por minuto.
- Sin cuota de API aparte — La API gasta el mismo saldo que el chat. Un plan fija el tamaño de la cuota de hoy. No fija una tasa de solicitudes.
- Tan rápido como quieras — Las solicitudes enviadas en paralelo se aceptan y esperan en cola. No se rechazan por ser paralelas.
Tu saldo
Tu saldo se cuenta en tokens. 1,000,000 de tokens de saldo valen $5.00, y cada precio de la página Modelos y precios es una tarifa respecto a ese valor.
En cualquier momento el saldo es la suma de dos partes.
- Cuota del plan de hoy — Un número de tokens fijado por tu plan. Se renueva cada día a las 00:00 UTC. Lo que sobra al final de un día no se acumula.
- Crédito comprado — Tokens que compraste como paquete. El crédito no caduca y sirve en todos los planes, incluido Free.
| Plan | Tokens por día | Equivale a |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Orden de gasto — Cada solicitud gasta primero la cuota del plan de hoy. El crédito comprado se usa solo para lo que exceda la cuota de ese día.
- El chat y la API lo comparten — Hay un saldo por cuenta. Una clave API gasta del saldo de la cuenta a la que pertenece, a los mismos precios que el chat.
- Paquetes — El crédito se vende en paquetes de 1,000,000 ($5.00), 2,000,000 ($10.00) y 5,000,000 ($25.00) tokens, o como una cantidad a tu elección de 1,000,000 a 100,000,000 tokens a $5.00 por 1,000,000.
Qué reserva una solicitud y cuánto cuesta
- Reservar — Cuando llega una solicitud, reserva de tu saldo su presupuesto de salida:
max_tokensen/v1/chat/completionsy/v1/messages,max_output_tokensen/v1/responses./v1/chat/completionstambién leemax_completion_tokens. El valor predeterminado es 4,096 y el rango va de 1 a 65,536. - Admitir — La solicitud se acepta solo si la reserva cabe en lo que queda de tu saldo. Un saldo superior a cero pero menor que el presupuesto de salida recibe la respuesta
Quota exceeded. Envía unmax_tokensmenor para usar el resto. - Liquidar — Cuando la respuesta está completa, la reserva se sustituye por el cobro real. El cobro puede ser menor o mayor que la reserva.
- Devolver — Una solicitud que termina con un estado de error devuelve su reserva completa.
El cobro real depende de la familia del modelo.
| Modelos | Qué se cobra |
|---|---|
| Modelos Shannon | usage.total_tokens al precio del modelo por 1M. La entrada y la salida tienen una sola tarifa. |
| Modelos de pesos abiertos alojados | La entrada sin caché a la tarifa de entrada, la entrada en caché a la tarifa de caché, la salida a la tarifa de salida. |
El importe en USD se descuenta de tu saldo en tokens a $5.00 por 1,000,000, redondeado a un token entero.
Contar tokens con POST /v1/tokenize o POST /v1/messages/count_tokens es gratis y no reserva nada. Conteo de tokens
Dónde ver el saldo y el uso
La página Claves y uso muestra lo que puedes gastar ahora mismo, la cuota del plan de hoy, tu crédito comprado y el gasto de API de los últimos 30 días. Debajo lista cada solicitud que hizo tu clave: hora, endpoint, modelo, entrada en caché, tokens facturados y costo. Claves y uso
Cada respuesta lleva además un objeto usage con los recuentos de tokens de esa llamada.
| Endpoint | Campos de usage | Añadido por los modelos de pesos abiertos alojados |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagecontiene los recuentos de tokens del modelo. La cantidad descontada de tu saldo no está en la respuesta: es la columna Tokens facturados de la lista de solicitudes en Claves y uso.- En
/v1/messagescon un modelo de pesos abiertos alojado,input_tokenses la parte de la entrada sin caché,cache_read_input_tokenses la parte en caché ycache_creation_input_tokenses siempre0. - Un stream en
/v1/chat/completionsllevausageen su último fragmento antes de[DONE]. Streaming
Cuando se acaba el saldo
Una solicitud cuya reserva no cabe en tu saldo se responde con el estado 429, tipo rate_limit_error y el mensaje siguiente. No se cobra nada. Se envía la misma respuesta cuando el saldo es superior a cero pero menor que el presupuesto de salida de la solicitud.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} En /v1/responses el objeto error también puede contener code y param, ambos null.
Qué puedes hacer:
- Espera a la siguiente cuota del plan a las 00:00 UTC.
- Recarga crédito. El crédito se gasta después de la cuota del plan y no caduca. Recargar crédito
- Cambia a un plan con una cuota diaria mayor. Cambiar plan
- Envía un
max_tokensmenor, si queda algo de saldo: la reserva será entonces menor.
Cuota de llamadas de Shannon Coder
shannon-coder-1 en /v1/chat/completions y /v1/messages se cuenta en llamadas, no en tokens. Cada plan incluye un número de llamadas por ventana de 4 horas. Una solicitud es una llamada.
| Plan | Llamadas por ventana de 4 horas |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Las ventanas empiezan a las 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Las llamadas que sobran al final de una ventana no se acumulan.
- Una llamada se cuenta cuando se acepta la solicitud, antes de que el modelo responda. Una solicitud que falla después sigue contando como llamada.
- Estas llamadas no reservan tokens ni toman nada de tu saldo. La lista de solicitudes en Claves y uso muestra su número de tokens y su valor al precio indicado.
- El
max_tokenspredeterminado deshannon-coder-1en estos dos endpoints es 65,536. - Sin llamadas restantes, la respuesta tiene el estado
429, tiporate_limit_error, mensajeShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - En
/v1/responses,shannon-coder-1no tiene cuota de llamadas: se cobra en tokens de tu saldo a $8.00 por 1M, como cualquier otro modelo.
Protección contra flood
Una cuenta puede enviar 120 solicitudes por minuto. Es el único límite de tasa de solicitudes y es el mismo en todos los planes. Existe para frenar los flood, no para ralentizar el uso normal.
- El minuto es una ventana fija de 60 segundos que se abre con tu primera solicitud. Cuando termina, el conteo vuelve a empezar desde cero.
- El conteo es por cuenta, no por clave ni por dirección IP. Rotar la clave no abre una ventana nueva.
- La solicitud 121 dentro de una ventana se responde con el estado
429, tiporate_limit_errory el mensajeToo many requests. Retry in <N>s.Nes el número de segundos hasta que termina la ventana, de 1 a 60. - La protección contra flood se comprueba antes que el saldo. Una solicitud que rechaza no reserva nada y no cuesta nada.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Solicitud | Protección contra flood |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Se cuenta, una por solicitud. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | No se cuenta. |
shannon-coder-1 en /v1/chat/completions y /v1/messages | Se cuenta en cambio por la cuota de llamadas de Shannon Coder. |
Una solicitud respondida con 401, o con 400 por un model desconocido | No se cuenta. |
| Una solicitud rechazada por la protección contra flood | Cuenta para la ventana. No se cobra nada. |
Solicitudes en paralelo
No hay límite de cuántas solicitudes puede tener abiertas a la vez una cuenta, ni un error por enviar solicitudes en paralelo. Las solicitudes que no pueden empezar de inmediato esperan en cola y se responden por turno.
- Cada solicitud cuenta para las 120 por minuto cuando llega, hayan terminado o no las solicitudes anteriores.
- Cada solicitud mantiene su propia reserva hasta que termina. Veinte solicitudes abiertas con el presupuesto de salida predeterminado retienen 20 × 4,096 = 81,920 tokens de saldo. Si las reservas juntas son mayores que tu saldo, la siguiente solicitud recibe la respuesta
Quota exceeded, aunque las llamadas terminadas habrían costado menos. Unmax_tokensmenor retiene menos. - Una solicitud sin streaming no envía nada hasta que su respuesta está completa, así que da a tu cliente un timeout que cubra la espera. Un stream mantiene su conexión abierta mientras espera. Streaming
Límites de una sola solicitud
| Límite | Valor | Se aplica a | En el límite |
|---|---|---|---|
| Cuerpo de la solicitud | 32 MiB (33,554,432 bytes) | Todos los endpoints | Estado 413, tipo invalid_request_error. |
Presupuesto de salida: max_tokens, max_completion_tokens, max_output_tokens | De 1 a 65,536. Predeterminado 4,096; para shannon-coder-1 en /v1/chat/completions y /v1/messages el valor predeterminado es 65,536. | Todos los modelos, como la cantidad reservada de tu saldo. Como límite de la longitud de la respuesta: los modelos de pesos abiertos alojados, shannon-1.6-lite, shannon-1.6-pro y shannon-coder-1. | Un valor fuera del rango se lleva al extremo más cercano del rango. Sin error. |
Secuencias de parada: stop, stop_sequences | 4 cadenas | Modelos de pesos abiertos alojados | Se usan las primeras 4 cadenas no vacías. |
| Imagen o archivo dado como URL | 8 MiB, leído en 20 segundos, como máximo 5 redirecciones, una dirección http o https pública | Todos los endpoints que aceptan imágenes o archivos | La solicitud se responde sin esa parte. Sin error. |
| Imagen o archivo enviado en línea (base64) | Sin límite propio. Cuenta para el cuerpo de solicitud de 32 MiB. | Todos los endpoints que aceptan imágenes o archivos | Estado 413 para toda la solicitud. |
text de POST /v1/tokenize | 4,000,000 bytes | /v1/tokenize | Estado 413, tipo invalid_request_error, mensaje text too long. |
messages de POST /v1/tokenize y el cuerpo de POST /v1/messages/count_tokens | El cuerpo de solicitud de 32 MiB | Ambos endpoints de conteo | Estado 413. |
| Ventana de contexto | Por modelo: context_window en GET /v1/models | Todos los modelos | Lo que ocurre con una conversación más larga depende del modelo. Modelos y precios |
Búsquedas web (web_search: true) | Por plan y día: Free 3, Plus 30, Standard 50, Pro 60. Se cuenta una búsqueda por cada solicitud cuya búsqueda encontró resultados. | Solicitudes que establecen web_search: true | Si no queda ninguna, la solicitud se responde sin búsqueda. Sin error. Búsqueda web integrada |
Errores
Las respuestas de esta página. En /v1/messages el mismo objeto error se envuelve como {"type": "error", "error": {…}}.
| Estado | Tipo | Mensaje | Cuándo y qué hacer |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | La reserva de la solicitud no cabe en tu saldo. Espera a las 00:00 UTC, recarga crédito, cambia de plan o envía un max_tokens menor. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Más de 120 solicitudes en el minuto actual. Espera N segundos y envía de nuevo. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Se agotaron las llamadas de Shannon Coder de la ventana actual de 4 horas. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | El modelo no puede aceptar la solicitud en este momento. Envíala de nuevo tras una breve pausa. |
503 | api_error | Could not verify your quota right now. Please retry. | No se pudo leer tu saldo. No se cobra nada; envía la solicitud de nuevo. En /v1/responses con un modelo Shannon el estado es 500. |
413 | invalid_request_error | El cuerpo de la solicitud es mayor que 32 MiB. En los endpoints con formato OpenAI, el objeto error lleva code: "request_too_large". | |
413 | invalid_request_error | text too long | text de POST /v1/tokenize supera los 4,000,000 bytes. |