Aller au contenu
Limites et solde

Limites et solde

Chaque requête est servie de façon égale. Pas de niveaux de débit. Pas de quota API distinct. Vous avez déjà payé vos tokens — utilisez-les aussi vite que vous voulez.

Cette page explique de quoi se compose votre solde, ce qu'une requête réserve et coûte, combien de requêtes vous pouvez envoyer et les quelques limites qu'une requête seule peut rencontrer.

valeur de 1M de tokens de solde
$5.00
le quota quotidien se renouvelle
00:00 UTC
protection anti-flood, par compte
120 requêtes / min

Comment les requêtes sont servies

  • Pas de niveaux de débit — Une seule règle limite la vitesse d'arrivée des requêtes, et elle est la même pour chaque compte et chaque forfait : 120 requêtes par minute. Il n'y a pas de limite de tokens par minute.
  • Pas de quota API distinct — L'API consomme le même solde que le chat. Un forfait fixe la taille du quota du jour. Il ne fixe pas de rythme de requêtes.
  • Aussi vite que vous voulez — Les requêtes envoyées en parallèle sont acceptées et attendent en file. Elles ne sont pas refusées parce qu'elles sont parallèles.

Votre solde

Votre solde est compté en tokens. 1,000,000 de tokens de solde valent $5.00, et chaque prix de la page Modèles et tarifs est un tarif par rapport à cette valeur.

À tout moment, le solde est la somme de deux parties.

  • Forfait du jour — Un nombre de tokens fixé par votre forfait. Il est renouvelé chaque jour à 00:00 UTC. Ce qui reste à la fin d'une journée n'est pas reporté.
  • Crédits achetés — Des tokens que vous avez achetés sous forme de pack. Les crédits n'expirent pas et fonctionnent sur tous les forfaits, y compris Free.
Forfait Tokens par jour Valeur
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Ordre de consommation — Chaque requête consomme d'abord le forfait du jour. Les crédits achetés ne servent que pour ce qui dépasse le forfait ce jour-là.
  • Le chat et l'API le partagent — Il y a un solde par compte. Une clé API consomme le solde du compte qui la possède, aux mêmes prix que le chat.
  • Packs — Les crédits sont vendus en packs de 1,000,000 ($5.00), 2,000,000 ($10.00) et 5,000,000 ($25.00) tokens, ou pour un montant de votre choix de 1,000,000 à 100,000,000 tokens à $5.00 par 1,000,000.

Recharger les crédits Changer de forfait

Ce qu'une requête réserve et ce qu'elle coûte

  • Réservation — Quand une requête arrive, elle réserve son budget de sortie sur votre solde : max_tokens sur /v1/chat/completions et /v1/messages, max_output_tokens sur /v1/responses. /v1/chat/completions lit aussi max_completion_tokens. La valeur par défaut est 4,096 et la plage va de 1 à 65,536.
  • Admission — La requête n'est acceptée que si la réservation tient dans ce qui reste de votre solde. Un solde supérieur à zéro mais inférieur au budget de sortie reçoit la réponse Quota exceeded. Envoyez un max_tokens plus petit pour utiliser le reste.
  • Règlement — Quand la réponse est terminée, la réservation est remplacée par le coût réel. Le coût peut être inférieur ou supérieur à la réservation.
  • Restitution — Une requête qui se termine par un statut d'erreur restitue sa réservation en totalité.

Le coût réel dépend de la famille du modèle.

Modèles Ce qui est facturé
Modèles Shannon usage.total_tokens au prix du modèle par 1M. L'entrée et la sortie ont un seul tarif.
Modèles open-weight hébergés L'entrée hors cache au tarif d'entrée, l'entrée en cache au tarif du cache, la sortie au tarif de sortie.

Le montant en USD est prélevé sur votre solde en tokens à $5.00 par 1,000,000, arrondi à un token entier.

Compter des tokens avec POST /v1/tokenize ou POST /v1/messages/count_tokens est gratuit et ne réserve rien. Décompte de tokens

Où voir le solde et l'utilisation

La page Clés et utilisation montre ce que vous pouvez dépenser maintenant, le forfait du jour, vos crédits achetés et les dépenses API des 30 derniers jours. En dessous, elle liste chaque requête effectuée par votre clé : heure, point de terminaison, modèle, entrée en cache, tokens facturés et coût. Clés et utilisation

Chaque réponse porte aussi un objet usage avec les nombres de tokens de cet appel.

Point de terminaison Champs de usage Ajouté par les modèles open-weight hébergés
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage contient les nombres de tokens du modèle. Le montant prélevé sur votre solde n'est pas dans la réponse : c'est la colonne Tokens facturés de la liste des requêtes dans Clés et utilisation.
  • Sur /v1/messages avec un modèle open-weight hébergé, input_tokens est la partie de l'entrée hors cache, cache_read_input_tokens est la partie en cache et cache_creation_input_tokens vaut toujours 0.
  • Un flux sur /v1/chat/completions porte usage dans son dernier chunk avant [DONE]. Diffusion en continu

Quand le solde est épuisé

Une requête dont la réservation ne tient pas dans votre solde reçoit le statut 429, le type rate_limit_error et le message ci-dessous. Rien n'est facturé. La même réponse est envoyée quand le solde est supérieur à zéro mais inférieur au budget de sortie de la requête.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Sur /v1/responses, l'objet error peut aussi contenir code et param, tous deux null.

Ce que vous pouvez faire :

  • Attendez le prochain forfait du jour à 00:00 UTC.
  • Rechargez des crédits. Les crédits sont consommés après le forfait du jour et n'expirent pas. Recharger les crédits
  • Passez à un forfait avec un quota quotidien plus élevé. Changer de forfait
  • Envoyez un max_tokens plus petit, s'il reste un peu de solde : la réservation est alors plus petite.

Quota d'appels Shannon Coder

shannon-coder-1 sur /v1/chat/completions et /v1/messages est compté en appels, pas en tokens. Chaque forfait inclut un nombre d'appels par fenêtre de 4 heures. Une requête est un appel.

Forfait Appels par fenêtre de 4 heures
Free 3
Plus 20
Standard 40
Pro 60
  • Les fenêtres démarrent à 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Les appels restants à la fin d'une fenêtre ne sont pas reportés.
  • Un appel est compté quand la requête est acceptée, avant que le modèle réponde. Une requête qui échoue ensuite compte quand même comme un appel.
  • Ces appels ne réservent aucun token et ne prélèvent rien sur votre solde. La liste des requêtes dans Clés et utilisation montre leur nombre de tokens et sa valeur au prix indiqué.
  • Le max_tokens par défaut de shannon-coder-1 sur ces deux points de terminaison est 65,536.
  • Quand il ne reste plus d'appels, la réponse a le statut 429, le type rate_limit_error et le message Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Sur /v1/responses, shannon-coder-1 n'a pas de quota d'appels : il est facturé en tokens sur votre solde à $8.00 par 1M, comme tout autre modèle.

Protection anti-flood

Un compte peut envoyer 120 requêtes par minute. C'est la seule limite sur le rythme des requêtes, et elle est la même sur tous les forfaits. Elle existe pour arrêter les floods, pas pour ralentir un usage normal.

  • La minute est une fenêtre fixe de 60 secondes qui s'ouvre avec votre première requête. Quand elle se termine, le décompte repart à zéro.
  • Le décompte est par compte, pas par clé ni par adresse IP. Renouveler la clé n'ouvre pas une nouvelle fenêtre.
  • La 121e requête dans une fenêtre reçoit le statut 429, le type rate_limit_error et le message Too many requests. Retry in <N>s. N est le nombre de secondes jusqu'à la fin de la fenêtre, de 1 à 60.
  • La protection anti-flood est vérifiée avant le solde. Une requête qu'elle refuse ne réserve rien et ne coûte rien.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Requête Protection anti-flood
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Compté, une fois par requête.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Non compté.
shannon-coder-1 sur /v1/chat/completions et /v1/messages Compté à la place par le quota d'appels Shannon Coder.
Une requête qui reçoit 401, ou 400 pour un model inconnu Non compté.
Une requête refusée par la protection anti-flood Compté dans la fenêtre. Rien n'est facturé.

Requêtes parallèles

Il n'y a aucune limite au nombre de requêtes qu'un compte a ouvertes en même temps, et aucune erreur pour l'envoi de requêtes en parallèle. Les requêtes qui ne peuvent pas démarrer immédiatement attendent en file et reçoivent une réponse à tour de rôle.

  • Chaque requête compte dans les 120 par minute à son arrivée, que les requêtes précédentes soient terminées ou non.
  • Chaque requête garde sa propre réservation jusqu'à sa fin. Vingt requêtes ouvertes avec le budget de sortie par défaut retiennent 20 × 4,096 = 81,920 tokens de solde. Si les réservations ensemble dépassent votre solde, la requête suivante reçoit la réponse Quota exceeded, même si les appels terminés auraient coûté moins. Un max_tokens plus petit retient moins.
  • Une requête sans streaming n'envoie rien tant que sa réponse n'est pas complète : donnez donc à votre client un délai d'expiration qui couvre l'attente. Un flux garde sa connexion ouverte pendant qu'il attend. Diffusion en continu

Limites d'une requête seule

Limite Valeur S'applique à À la limite
Corps de la requête 32 MiB (33,554,432 octets) Chaque point de terminaison Statut 413, type invalid_request_error.
Budget de sortie : max_tokens, max_completion_tokens, max_output_tokens 1 à 65,536. Par défaut 4,096 ; pour shannon-coder-1 sur /v1/chat/completions et /v1/messages, la valeur par défaut est 65,536. Chaque modèle, comme montant réservé sur votre solde. Comme limite de longueur de la réponse : les modèles open-weight hébergés, shannon-1.6-lite, shannon-1.6-pro et shannon-coder-1. Une valeur hors de la plage est ramenée à l'extrémité la plus proche de la plage. Pas d'erreur.
Séquences d'arrêt : stop, stop_sequences 4 chaînes Modèles open-weight hébergés Les 4 premières chaînes non vides sont utilisées.
Image ou fichier donné sous forme d'URL 8 MiB, lus en 20 secondes, 5 redirections au maximum, une adresse http ou https publique Chaque point de terminaison qui accepte des images ou des fichiers La requête reçoit une réponse sans cette partie. Pas d'erreur.
Image ou fichier envoyé en ligne (base64) Pas de limite propre. Il compte dans le corps de requête de 32 MiB. Chaque point de terminaison qui accepte des images ou des fichiers Statut 413 pour toute la requête.
text de POST /v1/tokenize 4,000,000 octets /v1/tokenize Statut 413, type invalid_request_error, message text too long.
messages de POST /v1/tokenize et le corps de POST /v1/messages/count_tokens Le corps de requête de 32 MiB Les deux points de terminaison de comptage Statut 413.
Fenêtre de contexte Par modèle : context_window dans GET /v1/models Chaque modèle Ce qui arrive à une conversation plus longue dépend du modèle. Modèles et tarifs
Recherches web (web_search: true) Par forfait et par jour : Free 3, Plus 30, Standard 50, Pro 60. Une recherche est comptée pour une requête dont la recherche a trouvé des résultats. Requêtes qui définissent web_search: true S'il n'en reste aucune, la requête reçoit une réponse sans recherche. Pas d'erreur. Recherche Web intégrée

Erreurs

Les réponses de cette page. Sur /v1/messages, le même objet error est encapsulé sous la forme {"type": "error", "error": {…}}.

Statut Type Message Quand, et que faire
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan La réservation de la requête ne tient pas dans votre solde. Attendez 00:00 UTC, rechargez des crédits, changez de forfait ou envoyez un max_tokens plus petit.
429 rate_limit_error Too many requests. Retry in <N>s. Plus de 120 requêtes dans la minute en cours. Attendez N secondes et renvoyez.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Les appels Shannon Coder de la fenêtre actuelle de 4 heures sont épuisés.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Le modèle ne peut pas prendre la requête en ce moment. Renvoyez-la après une courte pause.
503 api_error Could not verify your quota right now. Please retry. Votre solde n'a pas pu être lu. Rien n'est facturé ; renvoyez la requête. Sur /v1/responses avec un modèle Shannon, le statut est 500.
413 invalid_request_error Le corps de la requête dépasse 32 MiB. Sur les points de terminaison au format OpenAI, l'objet error porte code: "request_too_large".
413 invalid_request_error text too long text de POST /v1/tokenize dépasse 4,000,000 octets.