Limites et solde
Chaque requête est servie de façon égale. Pas de niveaux de débit. Pas de quota API distinct. Vous avez déjà payé vos tokens — utilisez-les aussi vite que vous voulez.
Cette page explique de quoi se compose votre solde, ce qu'une requête réserve et coûte, combien de requêtes vous pouvez envoyer et les quelques limites qu'une requête seule peut rencontrer.
- valeur de 1M de tokens de solde
- $5.00
- le quota quotidien se renouvelle
- 00:00 UTC
- protection anti-flood, par compte
- 120 requêtes / min
Comment les requêtes sont servies
- Pas de niveaux de débit — Une seule règle limite la vitesse d'arrivée des requêtes, et elle est la même pour chaque compte et chaque forfait : 120 requêtes par minute. Il n'y a pas de limite de tokens par minute.
- Pas de quota API distinct — L'API consomme le même solde que le chat. Un forfait fixe la taille du quota du jour. Il ne fixe pas de rythme de requêtes.
- Aussi vite que vous voulez — Les requêtes envoyées en parallèle sont acceptées et attendent en file. Elles ne sont pas refusées parce qu'elles sont parallèles.
Votre solde
Votre solde est compté en tokens. 1,000,000 de tokens de solde valent $5.00, et chaque prix de la page Modèles et tarifs est un tarif par rapport à cette valeur.
À tout moment, le solde est la somme de deux parties.
- Forfait du jour — Un nombre de tokens fixé par votre forfait. Il est renouvelé chaque jour à 00:00 UTC. Ce qui reste à la fin d'une journée n'est pas reporté.
- Crédits achetés — Des tokens que vous avez achetés sous forme de pack. Les crédits n'expirent pas et fonctionnent sur tous les forfaits, y compris Free.
| Forfait | Tokens par jour | Valeur |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Ordre de consommation — Chaque requête consomme d'abord le forfait du jour. Les crédits achetés ne servent que pour ce qui dépasse le forfait ce jour-là.
- Le chat et l'API le partagent — Il y a un solde par compte. Une clé API consomme le solde du compte qui la possède, aux mêmes prix que le chat.
- Packs — Les crédits sont vendus en packs de 1,000,000 ($5.00), 2,000,000 ($10.00) et 5,000,000 ($25.00) tokens, ou pour un montant de votre choix de 1,000,000 à 100,000,000 tokens à $5.00 par 1,000,000.
Recharger les crédits Changer de forfait
Ce qu'une requête réserve et ce qu'elle coûte
- Réservation — Quand une requête arrive, elle réserve son budget de sortie sur votre solde :
max_tokenssur/v1/chat/completionset/v1/messages,max_output_tokenssur/v1/responses./v1/chat/completionslit aussimax_completion_tokens. La valeur par défaut est 4,096 et la plage va de 1 à 65,536. - Admission — La requête n'est acceptée que si la réservation tient dans ce qui reste de votre solde. Un solde supérieur à zéro mais inférieur au budget de sortie reçoit la réponse
Quota exceeded. Envoyez unmax_tokensplus petit pour utiliser le reste. - Règlement — Quand la réponse est terminée, la réservation est remplacée par le coût réel. Le coût peut être inférieur ou supérieur à la réservation.
- Restitution — Une requête qui se termine par un statut d'erreur restitue sa réservation en totalité.
Le coût réel dépend de la famille du modèle.
| Modèles | Ce qui est facturé |
|---|---|
| Modèles Shannon | usage.total_tokens au prix du modèle par 1M. L'entrée et la sortie ont un seul tarif. |
| Modèles open-weight hébergés | L'entrée hors cache au tarif d'entrée, l'entrée en cache au tarif du cache, la sortie au tarif de sortie. |
Le montant en USD est prélevé sur votre solde en tokens à $5.00 par 1,000,000, arrondi à un token entier.
Compter des tokens avec POST /v1/tokenize ou POST /v1/messages/count_tokens est gratuit et ne réserve rien. Décompte de tokens
Où voir le solde et l'utilisation
La page Clés et utilisation montre ce que vous pouvez dépenser maintenant, le forfait du jour, vos crédits achetés et les dépenses API des 30 derniers jours. En dessous, elle liste chaque requête effectuée par votre clé : heure, point de terminaison, modèle, entrée en cache, tokens facturés et coût. Clés et utilisation
Chaque réponse porte aussi un objet usage avec les nombres de tokens de cet appel.
| Point de terminaison | Champs de usage | Ajouté par les modèles open-weight hébergés |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagecontient les nombres de tokens du modèle. Le montant prélevé sur votre solde n'est pas dans la réponse : c'est la colonne Tokens facturés de la liste des requêtes dans Clés et utilisation.- Sur
/v1/messagesavec un modèle open-weight hébergé,input_tokensest la partie de l'entrée hors cache,cache_read_input_tokensest la partie en cache etcache_creation_input_tokensvaut toujours0. - Un flux sur
/v1/chat/completionsporteusagedans son dernier chunk avant[DONE]. Diffusion en continu
Quand le solde est épuisé
Une requête dont la réservation ne tient pas dans votre solde reçoit le statut 429, le type rate_limit_error et le message ci-dessous. Rien n'est facturé. La même réponse est envoyée quand le solde est supérieur à zéro mais inférieur au budget de sortie de la requête.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Sur /v1/responses, l'objet error peut aussi contenir code et param, tous deux null.
Ce que vous pouvez faire :
- Attendez le prochain forfait du jour à 00:00 UTC.
- Rechargez des crédits. Les crédits sont consommés après le forfait du jour et n'expirent pas. Recharger les crédits
- Passez à un forfait avec un quota quotidien plus élevé. Changer de forfait
- Envoyez un
max_tokensplus petit, s'il reste un peu de solde : la réservation est alors plus petite.
Quota d'appels Shannon Coder
shannon-coder-1 sur /v1/chat/completions et /v1/messages est compté en appels, pas en tokens. Chaque forfait inclut un nombre d'appels par fenêtre de 4 heures. Une requête est un appel.
| Forfait | Appels par fenêtre de 4 heures |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Les fenêtres démarrent à 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Les appels restants à la fin d'une fenêtre ne sont pas reportés.
- Un appel est compté quand la requête est acceptée, avant que le modèle réponde. Une requête qui échoue ensuite compte quand même comme un appel.
- Ces appels ne réservent aucun token et ne prélèvent rien sur votre solde. La liste des requêtes dans Clés et utilisation montre leur nombre de tokens et sa valeur au prix indiqué.
- Le
max_tokenspar défaut deshannon-coder-1sur ces deux points de terminaison est 65,536. - Quand il ne reste plus d'appels, la réponse a le statut
429, le typerate_limit_erroret le messageShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Sur
/v1/responses,shannon-coder-1n'a pas de quota d'appels : il est facturé en tokens sur votre solde à $8.00 par 1M, comme tout autre modèle.
Protection anti-flood
Un compte peut envoyer 120 requêtes par minute. C'est la seule limite sur le rythme des requêtes, et elle est la même sur tous les forfaits. Elle existe pour arrêter les floods, pas pour ralentir un usage normal.
- La minute est une fenêtre fixe de 60 secondes qui s'ouvre avec votre première requête. Quand elle se termine, le décompte repart à zéro.
- Le décompte est par compte, pas par clé ni par adresse IP. Renouveler la clé n'ouvre pas une nouvelle fenêtre.
- La 121e requête dans une fenêtre reçoit le statut
429, le typerate_limit_erroret le messageToo many requests. Retry in <N>s.Nest le nombre de secondes jusqu'à la fin de la fenêtre, de 1 à 60. - La protection anti-flood est vérifiée avant le solde. Une requête qu'elle refuse ne réserve rien et ne coûte rien.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Requête | Protection anti-flood |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Compté, une fois par requête. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Non compté. |
shannon-coder-1 sur /v1/chat/completions et /v1/messages | Compté à la place par le quota d'appels Shannon Coder. |
Une requête qui reçoit 401, ou 400 pour un model inconnu | Non compté. |
| Une requête refusée par la protection anti-flood | Compté dans la fenêtre. Rien n'est facturé. |
Requêtes parallèles
Il n'y a aucune limite au nombre de requêtes qu'un compte a ouvertes en même temps, et aucune erreur pour l'envoi de requêtes en parallèle. Les requêtes qui ne peuvent pas démarrer immédiatement attendent en file et reçoivent une réponse à tour de rôle.
- Chaque requête compte dans les 120 par minute à son arrivée, que les requêtes précédentes soient terminées ou non.
- Chaque requête garde sa propre réservation jusqu'à sa fin. Vingt requêtes ouvertes avec le budget de sortie par défaut retiennent 20 × 4,096 = 81,920 tokens de solde. Si les réservations ensemble dépassent votre solde, la requête suivante reçoit la réponse
Quota exceeded, même si les appels terminés auraient coûté moins. Unmax_tokensplus petit retient moins. - Une requête sans streaming n'envoie rien tant que sa réponse n'est pas complète : donnez donc à votre client un délai d'expiration qui couvre l'attente. Un flux garde sa connexion ouverte pendant qu'il attend. Diffusion en continu
Limites d'une requête seule
| Limite | Valeur | S'applique à | À la limite |
|---|---|---|---|
| Corps de la requête | 32 MiB (33,554,432 octets) | Chaque point de terminaison | Statut 413, type invalid_request_error. |
Budget de sortie : max_tokens, max_completion_tokens, max_output_tokens | 1 à 65,536. Par défaut 4,096 ; pour shannon-coder-1 sur /v1/chat/completions et /v1/messages, la valeur par défaut est 65,536. | Chaque modèle, comme montant réservé sur votre solde. Comme limite de longueur de la réponse : les modèles open-weight hébergés, shannon-1.6-lite, shannon-1.6-pro et shannon-coder-1. | Une valeur hors de la plage est ramenée à l'extrémité la plus proche de la plage. Pas d'erreur. |
Séquences d'arrêt : stop, stop_sequences | 4 chaînes | Modèles open-weight hébergés | Les 4 premières chaînes non vides sont utilisées. |
| Image ou fichier donné sous forme d'URL | 8 MiB, lus en 20 secondes, 5 redirections au maximum, une adresse http ou https publique | Chaque point de terminaison qui accepte des images ou des fichiers | La requête reçoit une réponse sans cette partie. Pas d'erreur. |
| Image ou fichier envoyé en ligne (base64) | Pas de limite propre. Il compte dans le corps de requête de 32 MiB. | Chaque point de terminaison qui accepte des images ou des fichiers | Statut 413 pour toute la requête. |
text de POST /v1/tokenize | 4,000,000 octets | /v1/tokenize | Statut 413, type invalid_request_error, message text too long. |
messages de POST /v1/tokenize et le corps de POST /v1/messages/count_tokens | Le corps de requête de 32 MiB | Les deux points de terminaison de comptage | Statut 413. |
| Fenêtre de contexte | Par modèle : context_window dans GET /v1/models | Chaque modèle | Ce qui arrive à une conversation plus longue dépend du modèle. Modèles et tarifs |
Recherches web (web_search: true) | Par forfait et par jour : Free 3, Plus 30, Standard 50, Pro 60. Une recherche est comptée pour une requête dont la recherche a trouvé des résultats. | Requêtes qui définissent web_search: true | S'il n'en reste aucune, la requête reçoit une réponse sans recherche. Pas d'erreur. Recherche Web intégrée |
Erreurs
Les réponses de cette page. Sur /v1/messages, le même objet error est encapsulé sous la forme {"type": "error", "error": {…}}.
| Statut | Type | Message | Quand, et que faire |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | La réservation de la requête ne tient pas dans votre solde. Attendez 00:00 UTC, rechargez des crédits, changez de forfait ou envoyez un max_tokens plus petit. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Plus de 120 requêtes dans la minute en cours. Attendez N secondes et renvoyez. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Les appels Shannon Coder de la fenêtre actuelle de 4 heures sont épuisés. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Le modèle ne peut pas prendre la requête en ce moment. Renvoyez-la après une courte pause. |
503 | api_error | Could not verify your quota right now. Please retry. | Votre solde n'a pas pu être lu. Rien n'est facturé ; renvoyez la requête. Sur /v1/responses avec un modèle Shannon, le statut est 500. |
413 | invalid_request_error | Le corps de la requête dépasse 32 MiB. Sur les points de terminaison au format OpenAI, l'objet error porte code: "request_too_large". | |
413 | invalid_request_error | text too long | text de POST /v1/tokenize dépasse 4,000,000 octets. |