Limits und Guthaben
Jede Anfrage wird gleich bedient. Keine Ratenstufen. Kein separates API-Kontingent. Sie haben Ihre Tokens bereits bezahlt — nutzen Sie sie so schnell, wie Sie möchten.
Diese Seite erklärt, woraus Ihr Guthaben besteht, was eine Anfrage reserviert und kostet, wie viele Anfragen Sie senden dürfen und welche wenigen Limits eine einzelne Anfrage treffen kann.
- Wert von 1M Tokens Guthaben
- $5.00
- Tageskontingent erneuert sich
- 00:00 UTC
- Flood-Schutz, pro Konto
- 120 Anfragen / Min.
Wie Anfragen bedient werden
- Keine Ratenstufen — Eine Regel begrenzt, wie schnell Anfragen eintreffen dürfen, und sie ist für jedes Konto und jeden Plan gleich: 120 Anfragen pro Minute. Es gibt kein Limit für Tokens pro Minute.
- Kein separates API-Kontingent — Die API verbraucht dasselbe Guthaben wie der Chat. Ein Plan legt die Größe des heutigen Kontingents fest. Er legt keine Anfragerate fest.
- So schnell, wie Sie möchten — Parallel gesendete Anfragen werden angenommen und warten in der Schlange. Sie werden nicht deshalb abgelehnt, weil sie parallel sind.
Ihr Guthaben
Ihr Guthaben wird in Tokens gezählt. 1,000,000 Tokens Guthaben sind $5.00 wert, und jeder Preis auf der Seite Modelle & Preise ist ein Satz gegenüber diesem Wert.
Das Guthaben ist jederzeit die Summe aus zwei Teilen.
- Heutiges Plan-Kontingent — Eine Anzahl Tokens, die Ihr Plan festlegt. Sie wird jeden Tag um 00:00 UTC erneuert. Was am Ende eines Tages übrig ist, wird nicht übertragen.
- Gekauftes Guthaben — Tokens, die Sie als Paket gekauft haben. Guthaben verfällt nicht und funktioniert bei jedem Plan, auch bei Free.
| Plan | Tokens pro Tag | Wert |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Reihenfolge der Verwendung — Jede Anfrage verbraucht zuerst das heutige Plan-Kontingent. Gekauftes Guthaben wird nur für das verwendet, was an diesem Tag über das Kontingent hinausgeht.
- Chat und API teilen es — Es gibt ein Guthaben pro Konto. Ein API-Key verbraucht vom Guthaben des Kontos, dem er gehört, zu denselben Preisen wie der Chat.
- Pakete — Guthaben wird in Paketen von 1,000,000 ($5.00), 2,000,000 ($10.00) und 5,000,000 ($25.00) Tokens verkauft oder als Betrag Ihrer Wahl von 1,000,000 bis 100,000,000 Tokens zu $5.00 pro 1,000,000.
Was eine Anfrage reserviert und was sie kostet
- Reservieren — Wenn eine Anfrage eintrifft, reserviert sie ihr Output-Budget von Ihrem Guthaben:
max_tokensbei/v1/chat/completionsund/v1/messages,max_output_tokensbei/v1/responses./v1/chat/completionsliest auchmax_completion_tokens. Der Standard ist 4,096 und der Bereich 1 bis 65,536. - Annehmen — Die Anfrage wird nur angenommen, wenn die Reservierung in das passt, was von Ihrem Guthaben übrig ist. Ein Guthaben, das über null liegt, aber kleiner als das Output-Budget ist, erhält die Antwort
Quota exceeded. Senden Sie ein kleineresmax_tokens, um den Rest zu nutzen. - Abrechnen — Ist die Antwort vollständig, wird die Reservierung durch die tatsächliche Berechnung ersetzt. Die Berechnung kann niedriger oder höher als die Reservierung sein.
- Zurückgeben — Eine Anfrage, die mit einem Fehlerstatus endet, gibt ihre Reservierung vollständig zurück.
Die tatsächliche Berechnung hängt von der Modellfamilie ab.
| Modelle | Was berechnet wird |
|---|---|
| Shannon-Modelle | usage.total_tokens zum Preis des Modells pro 1M. Input und Output haben einen Preis. |
| Gehostete Open-Weight-Modelle | Nicht gecachter Input zum Input-Preis, Cached Input zum Cached-Preis, Output zum Output-Preis. |
Der Betrag in USD wird zu $5.00 pro 1,000,000 in Tokens von Ihrem Guthaben abgezogen, auf einen ganzen Token gerundet.
Das Zählen von Tokens mit POST /v1/tokenize oder POST /v1/messages/count_tokens ist kostenlos und reserviert nichts. Token zählen
Wo Sie Guthaben und Nutzung sehen
Die Seite Keys & Nutzung zeigt, was Sie jetzt ausgeben können, das heutige Plan-Kontingent, Ihr gekauftes Guthaben und die API-Ausgaben der letzten 30 Tage. Darunter listet sie jede Anfrage, die Ihr Key gestellt hat: Zeit, Endpunkt, Modell, Cached Input, abgerechnete Tokens und Kosten. Keys & Nutzung
Jede Antwort enthält außerdem ein Objekt usage mit den Token-Anzahlen dieses Aufrufs.
| Endpunkt | Felder von usage | Von gehosteten Open-Weight-Modellen ergänzt |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageenthält die Token-Anzahlen des Modells. Der von Ihrem Guthaben abgezogene Betrag steht nicht in der Antwort: Er steht in der Spalte Abgerechnete Tokens der Anfrageliste unter Keys & Nutzung.- Bei
/v1/messagesmit einem gehosteten Open-Weight-Modell istinput_tokensder nicht gecachte Teil des Inputs,cache_read_input_tokensder gecachte Teil undcache_creation_input_tokensimmer0. - Ein Stream bei
/v1/chat/completionsträgtusagein seinem letzten Chunk vor[DONE]. Streaming
Wenn das Guthaben aufgebraucht ist
Eine Anfrage, deren Reservierung nicht in Ihr Guthaben passt, wird mit Status 429, Typ rate_limit_error und der folgenden Nachricht beantwortet. Es wird nichts berechnet. Dieselbe Antwort wird gesendet, wenn das Guthaben über null liegt, aber kleiner als das Output-Budget der Anfrage ist.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Bei /v1/responses kann das Objekt error auch code und param enthalten, beide null.
Was Sie tun können:
- Warten Sie um 00:00 UTC auf das nächste Plan-Kontingent.
- Laden Sie Guthaben auf. Guthaben wird nach dem Plan-Kontingent verbraucht und verfällt nicht. Guthaben aufladen
- Wechseln Sie zu einem Plan mit größerem Tageskontingent. Plan ändern
- Senden Sie ein kleineres
max_tokens, wenn noch etwas Guthaben übrig ist: Die Reservierung ist dann kleiner.
Shannon-Coder-Aufruf-Kontingent
shannon-coder-1 wird bei /v1/chat/completions und /v1/messages in Aufrufen gezählt, nicht in Tokens. Jeder Plan enthält eine Anzahl Aufrufe pro 4-Stunden-Fenster. Eine Anfrage ist ein Aufruf.
| Plan | Aufrufe pro 4-Stunden-Fenster |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Fenster beginnen um 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Aufrufe, die am Ende eines Fensters übrig sind, werden nicht übertragen.
- Ein Aufruf wird gezählt, wenn die Anfrage angenommen wird, bevor das Modell antwortet. Eine Anfrage, die danach fehlschlägt, zählt trotzdem als Aufruf.
- Diese Aufrufe reservieren keine Tokens und ziehen nichts von Ihrem Guthaben ab. Die Anfrageliste unter Keys & Nutzung zeigt ihre Token-Anzahl und deren Wert zum gelisteten Preis.
- Das Standard-
max_tokensvonshannon-coder-1beträgt bei diesen beiden Endpunkten 65,536. - Sind keine Aufrufe mehr übrig, lautet die Antwort Status
429, Typrate_limit_error, NachrichtShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Bei
/v1/responseshatshannon-coder-1kein Aufruf-Kontingent: Es wird wie jedes andere Modell in Tokens von Ihrem Guthaben zu $8.00 pro 1M berechnet.
Flood-Schutz
Ein Konto darf 120 Anfragen pro Minute senden. Das ist das einzige Limit für die Anfragerate, und es ist bei jedem Plan gleich. Es soll Fluten stoppen, nicht die normale Nutzung bremsen.
- Die Minute ist ein festes Fenster von 60 Sekunden, das mit Ihrer ersten Anfrage beginnt. Wenn es endet, beginnt die Zählung wieder bei null.
- Gezählt wird pro Konto, nicht pro Key und nicht pro IP-Adresse. Das Rotieren des Keys öffnet kein neues Fenster.
- Die 121. Anfrage innerhalb eines Fensters wird mit Status
429, Typrate_limit_errorund der NachrichtToo many requests. Retry in <N>s.beantwortet.Nist die Anzahl Sekunden bis zum Ende des Fensters, von 1 bis 60. - Der Flood-Schutz wird vor dem Guthaben geprüft. Eine Anfrage, die er ablehnt, reserviert nichts und kostet nichts.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Anfrage | Flood-Schutz |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Gezählt, eine pro Anfrage. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Nicht gezählt. |
shannon-coder-1 bei /v1/chat/completions und /v1/messages | Stattdessen vom Shannon-Coder-Aufruf-Kontingent gezählt. |
Eine Anfrage, die mit 401 beantwortet wird, oder mit 400 bei einem unbekannten model | Nicht gezählt. |
| Eine vom Flood-Schutz abgelehnte Anfrage | Wird auf das Fenster angerechnet. Es wird nichts berechnet. |
Parallele Anfragen
Es gibt kein Limit dafür, wie viele Anfragen ein Konto gleichzeitig offen hat, und keinen Fehler für parallel gesendete Anfragen. Anfragen, die nicht sofort starten können, warten in der Schlange und werden der Reihe nach beantwortet.
- Jede Anfrage zählt beim Eintreffen zu den 120 pro Minute, unabhängig davon, ob frühere Anfragen beendet sind.
- Jede Anfrage hält ihre eigene Reservierung, bis sie endet. Zwanzig offene Anfragen mit dem Standard-Output-Budget halten 20 × 4,096 = 81,920 Tokens Guthaben. Sind die Reservierungen zusammen größer als Ihr Guthaben, erhält die nächste Anfrage die Antwort
Quota exceeded, obwohl die beendeten Aufrufe weniger gekostet hätten. Ein kleineresmax_tokenshält weniger. - Eine Anfrage ohne Streaming sendet nichts, bis ihre Antwort vollständig ist, geben Sie Ihrem Client daher ein Timeout, das die Wartezeit abdeckt. Ein Stream hält seine Verbindung offen, während er wartet. Streaming
Limits einer einzelnen Anfrage
| Limit | Wert | Gilt für | Am Limit |
|---|---|---|---|
| Request-Body | 32 MiB (33,554,432 Bytes) | Jeder Endpunkt | Status 413, Typ invalid_request_error. |
Output-Budget: max_tokens, max_completion_tokens, max_output_tokens | 1 bis 65,536. Standard 4,096; bei shannon-coder-1 an /v1/chat/completions und /v1/messages ist der Standard 65,536. | Jedes Modell, als der von Ihrem Guthaben reservierte Betrag. Als Limit für die Länge der Antwort: die gehosteten Open-Weight-Modelle, shannon-1.6-lite, shannon-1.6-pro und shannon-coder-1. | Ein Wert außerhalb des Bereichs wird auf das nächstliegende Ende des Bereichs gesetzt. Kein Fehler. |
Stop-Sequenzen: stop, stop_sequences | 4 Strings | Gehostete Open-Weight-Modelle | Die ersten 4 nicht leeren Strings werden verwendet. |
| Als URL angegebenes Bild oder Datei | 8 MiB, innerhalb von 20 Sekunden gelesen, höchstens 5 Weiterleitungen, eine öffentliche http- oder https-Adresse | Jeder Endpunkt, der Bilder oder Dateien annimmt | Die Anfrage wird ohne diesen Teil beantwortet. Kein Fehler. |
| Inline gesendetes Bild oder Datei (Base64) | Kein eigenes Limit. Sie zählen zum 32-MiB-Request-Body. | Jeder Endpunkt, der Bilder oder Dateien annimmt | Status 413 für die gesamte Anfrage. |
text von POST /v1/tokenize | 4,000,000 Bytes | /v1/tokenize | Status 413, Typ invalid_request_error, Nachricht text too long. |
messages von POST /v1/tokenize und der Body von POST /v1/messages/count_tokens | Der 32-MiB-Request-Body | Beide Zähl-Endpunkte | Status 413. |
| Kontextfenster | Pro Modell: context_window in GET /v1/models | Jedes Modell | Was mit einer längeren Konversation geschieht, hängt vom Modell ab. Modelle & Preise |
Websuchen (web_search: true) | Pro Plan und Tag: Free 3, Plus 30, Standard 50, Pro 60. Eine Suche wird für eine Anfrage gezählt, deren Suche Ergebnisse gefunden hat. | Anfragen, die web_search: true setzen | Ist keine mehr übrig, wird die Anfrage ohne Suche beantwortet. Kein Fehler. Integrierte Websuche |
Fehler
Die Antworten dieser Seite. Bei /v1/messages wird dasselbe Objekt error als {"type": "error", "error": {…}} verpackt.
| Status | Typ | Nachricht | Wann, und was zu tun ist |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Die Reservierung der Anfrage passt nicht in Ihr Guthaben. Warten Sie auf 00:00 UTC, laden Sie Guthaben auf, wechseln Sie den Plan oder senden Sie ein kleineres max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Mehr als 120 Anfragen in der aktuellen Minute. Warten Sie N Sekunden und senden Sie erneut. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Die Shannon-Coder-Aufrufe des aktuellen 4-Stunden-Fensters sind aufgebraucht. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Das Modell kann die Anfrage im Moment nicht annehmen. Senden Sie sie nach einer kurzen Pause erneut. |
503 | api_error | Could not verify your quota right now. Please retry. | Ihr Guthaben konnte nicht gelesen werden. Es wird nichts berechnet; senden Sie die Anfrage erneut. Bei /v1/responses mit einem Shannon-Modell ist der Status 500. |
413 | invalid_request_error | Der Request-Body ist größer als 32 MiB. Bei den Endpunkten im OpenAI-Format enthält das Objekt error code: "request_too_large". | |
413 | invalid_request_error | text too long | text von POST /v1/tokenize ist länger als 4,000,000 Bytes. |