Zum Inhalt springen
Limits und Guthaben

Limits und Guthaben

Jede Anfrage wird gleich bedient. Keine Ratenstufen. Kein separates API-Kontingent. Sie haben Ihre Tokens bereits bezahlt — nutzen Sie sie so schnell, wie Sie möchten.

Diese Seite erklärt, woraus Ihr Guthaben besteht, was eine Anfrage reserviert und kostet, wie viele Anfragen Sie senden dürfen und welche wenigen Limits eine einzelne Anfrage treffen kann.

Wert von 1M Tokens Guthaben
$5.00
Tageskontingent erneuert sich
00:00 UTC
Flood-Schutz, pro Konto
120 Anfragen / Min.

Wie Anfragen bedient werden

  • Keine Ratenstufen — Eine Regel begrenzt, wie schnell Anfragen eintreffen dürfen, und sie ist für jedes Konto und jeden Plan gleich: 120 Anfragen pro Minute. Es gibt kein Limit für Tokens pro Minute.
  • Kein separates API-Kontingent — Die API verbraucht dasselbe Guthaben wie der Chat. Ein Plan legt die Größe des heutigen Kontingents fest. Er legt keine Anfragerate fest.
  • So schnell, wie Sie möchten — Parallel gesendete Anfragen werden angenommen und warten in der Schlange. Sie werden nicht deshalb abgelehnt, weil sie parallel sind.

Ihr Guthaben

Ihr Guthaben wird in Tokens gezählt. 1,000,000 Tokens Guthaben sind $5.00 wert, und jeder Preis auf der Seite Modelle & Preise ist ein Satz gegenüber diesem Wert.

Das Guthaben ist jederzeit die Summe aus zwei Teilen.

  • Heutiges Plan-Kontingent — Eine Anzahl Tokens, die Ihr Plan festlegt. Sie wird jeden Tag um 00:00 UTC erneuert. Was am Ende eines Tages übrig ist, wird nicht übertragen.
  • Gekauftes Guthaben — Tokens, die Sie als Paket gekauft haben. Guthaben verfällt nicht und funktioniert bei jedem Plan, auch bei Free.
Plan Tokens pro Tag Wert
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Reihenfolge der Verwendung — Jede Anfrage verbraucht zuerst das heutige Plan-Kontingent. Gekauftes Guthaben wird nur für das verwendet, was an diesem Tag über das Kontingent hinausgeht.
  • Chat und API teilen es — Es gibt ein Guthaben pro Konto. Ein API-Key verbraucht vom Guthaben des Kontos, dem er gehört, zu denselben Preisen wie der Chat.
  • Pakete — Guthaben wird in Paketen von 1,000,000 ($5.00), 2,000,000 ($10.00) und 5,000,000 ($25.00) Tokens verkauft oder als Betrag Ihrer Wahl von 1,000,000 bis 100,000,000 Tokens zu $5.00 pro 1,000,000.

Guthaben aufladen Plan ändern

Was eine Anfrage reserviert und was sie kostet

  • Reservieren — Wenn eine Anfrage eintrifft, reserviert sie ihr Output-Budget von Ihrem Guthaben: max_tokens bei /v1/chat/completions und /v1/messages, max_output_tokens bei /v1/responses. /v1/chat/completions liest auch max_completion_tokens. Der Standard ist 4,096 und der Bereich 1 bis 65,536.
  • Annehmen — Die Anfrage wird nur angenommen, wenn die Reservierung in das passt, was von Ihrem Guthaben übrig ist. Ein Guthaben, das über null liegt, aber kleiner als das Output-Budget ist, erhält die Antwort Quota exceeded. Senden Sie ein kleineres max_tokens, um den Rest zu nutzen.
  • Abrechnen — Ist die Antwort vollständig, wird die Reservierung durch die tatsächliche Berechnung ersetzt. Die Berechnung kann niedriger oder höher als die Reservierung sein.
  • Zurückgeben — Eine Anfrage, die mit einem Fehlerstatus endet, gibt ihre Reservierung vollständig zurück.

Die tatsächliche Berechnung hängt von der Modellfamilie ab.

Modelle Was berechnet wird
Shannon-Modelle usage.total_tokens zum Preis des Modells pro 1M. Input und Output haben einen Preis.
Gehostete Open-Weight-Modelle Nicht gecachter Input zum Input-Preis, Cached Input zum Cached-Preis, Output zum Output-Preis.

Der Betrag in USD wird zu $5.00 pro 1,000,000 in Tokens von Ihrem Guthaben abgezogen, auf einen ganzen Token gerundet.

Das Zählen von Tokens mit POST /v1/tokenize oder POST /v1/messages/count_tokens ist kostenlos und reserviert nichts. Token zählen

Wo Sie Guthaben und Nutzung sehen

Die Seite Keys & Nutzung zeigt, was Sie jetzt ausgeben können, das heutige Plan-Kontingent, Ihr gekauftes Guthaben und die API-Ausgaben der letzten 30 Tage. Darunter listet sie jede Anfrage, die Ihr Key gestellt hat: Zeit, Endpunkt, Modell, Cached Input, abgerechnete Tokens und Kosten. Keys & Nutzung

Jede Antwort enthält außerdem ein Objekt usage mit den Token-Anzahlen dieses Aufrufs.

Endpunkt Felder von usage Von gehosteten Open-Weight-Modellen ergänzt
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage enthält die Token-Anzahlen des Modells. Der von Ihrem Guthaben abgezogene Betrag steht nicht in der Antwort: Er steht in der Spalte Abgerechnete Tokens der Anfrageliste unter Keys & Nutzung.
  • Bei /v1/messages mit einem gehosteten Open-Weight-Modell ist input_tokens der nicht gecachte Teil des Inputs, cache_read_input_tokens der gecachte Teil und cache_creation_input_tokens immer 0.
  • Ein Stream bei /v1/chat/completions trägt usage in seinem letzten Chunk vor [DONE]. Streaming

Wenn das Guthaben aufgebraucht ist

Eine Anfrage, deren Reservierung nicht in Ihr Guthaben passt, wird mit Status 429, Typ rate_limit_error und der folgenden Nachricht beantwortet. Es wird nichts berechnet. Dieselbe Antwort wird gesendet, wenn das Guthaben über null liegt, aber kleiner als das Output-Budget der Anfrage ist.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Bei /v1/responses kann das Objekt error auch code und param enthalten, beide null.

Was Sie tun können:

  • Warten Sie um 00:00 UTC auf das nächste Plan-Kontingent.
  • Laden Sie Guthaben auf. Guthaben wird nach dem Plan-Kontingent verbraucht und verfällt nicht. Guthaben aufladen
  • Wechseln Sie zu einem Plan mit größerem Tageskontingent. Plan ändern
  • Senden Sie ein kleineres max_tokens, wenn noch etwas Guthaben übrig ist: Die Reservierung ist dann kleiner.

Shannon-Coder-Aufruf-Kontingent

shannon-coder-1 wird bei /v1/chat/completions und /v1/messages in Aufrufen gezählt, nicht in Tokens. Jeder Plan enthält eine Anzahl Aufrufe pro 4-Stunden-Fenster. Eine Anfrage ist ein Aufruf.

Plan Aufrufe pro 4-Stunden-Fenster
Free 3
Plus 20
Standard 40
Pro 60
  • Fenster beginnen um 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Aufrufe, die am Ende eines Fensters übrig sind, werden nicht übertragen.
  • Ein Aufruf wird gezählt, wenn die Anfrage angenommen wird, bevor das Modell antwortet. Eine Anfrage, die danach fehlschlägt, zählt trotzdem als Aufruf.
  • Diese Aufrufe reservieren keine Tokens und ziehen nichts von Ihrem Guthaben ab. Die Anfrageliste unter Keys & Nutzung zeigt ihre Token-Anzahl und deren Wert zum gelisteten Preis.
  • Das Standard-max_tokens von shannon-coder-1 beträgt bei diesen beiden Endpunkten 65,536.
  • Sind keine Aufrufe mehr übrig, lautet die Antwort Status 429, Typ rate_limit_error, Nachricht Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Bei /v1/responses hat shannon-coder-1 kein Aufruf-Kontingent: Es wird wie jedes andere Modell in Tokens von Ihrem Guthaben zu $8.00 pro 1M berechnet.

Flood-Schutz

Ein Konto darf 120 Anfragen pro Minute senden. Das ist das einzige Limit für die Anfragerate, und es ist bei jedem Plan gleich. Es soll Fluten stoppen, nicht die normale Nutzung bremsen.

  • Die Minute ist ein festes Fenster von 60 Sekunden, das mit Ihrer ersten Anfrage beginnt. Wenn es endet, beginnt die Zählung wieder bei null.
  • Gezählt wird pro Konto, nicht pro Key und nicht pro IP-Adresse. Das Rotieren des Keys öffnet kein neues Fenster.
  • Die 121. Anfrage innerhalb eines Fensters wird mit Status 429, Typ rate_limit_error und der Nachricht Too many requests. Retry in <N>s. beantwortet. N ist die Anzahl Sekunden bis zum Ende des Fensters, von 1 bis 60.
  • Der Flood-Schutz wird vor dem Guthaben geprüft. Eine Anfrage, die er ablehnt, reserviert nichts und kostet nichts.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Anfrage Flood-Schutz
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Gezählt, eine pro Anfrage.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Nicht gezählt.
shannon-coder-1 bei /v1/chat/completions und /v1/messages Stattdessen vom Shannon-Coder-Aufruf-Kontingent gezählt.
Eine Anfrage, die mit 401 beantwortet wird, oder mit 400 bei einem unbekannten model Nicht gezählt.
Eine vom Flood-Schutz abgelehnte Anfrage Wird auf das Fenster angerechnet. Es wird nichts berechnet.

Parallele Anfragen

Es gibt kein Limit dafür, wie viele Anfragen ein Konto gleichzeitig offen hat, und keinen Fehler für parallel gesendete Anfragen. Anfragen, die nicht sofort starten können, warten in der Schlange und werden der Reihe nach beantwortet.

  • Jede Anfrage zählt beim Eintreffen zu den 120 pro Minute, unabhängig davon, ob frühere Anfragen beendet sind.
  • Jede Anfrage hält ihre eigene Reservierung, bis sie endet. Zwanzig offene Anfragen mit dem Standard-Output-Budget halten 20 × 4,096 = 81,920 Tokens Guthaben. Sind die Reservierungen zusammen größer als Ihr Guthaben, erhält die nächste Anfrage die Antwort Quota exceeded, obwohl die beendeten Aufrufe weniger gekostet hätten. Ein kleineres max_tokens hält weniger.
  • Eine Anfrage ohne Streaming sendet nichts, bis ihre Antwort vollständig ist, geben Sie Ihrem Client daher ein Timeout, das die Wartezeit abdeckt. Ein Stream hält seine Verbindung offen, während er wartet. Streaming

Limits einer einzelnen Anfrage

Limit Wert Gilt für Am Limit
Request-Body 32 MiB (33,554,432 Bytes) Jeder Endpunkt Status 413, Typ invalid_request_error.
Output-Budget: max_tokens, max_completion_tokens, max_output_tokens 1 bis 65,536. Standard 4,096; bei shannon-coder-1 an /v1/chat/completions und /v1/messages ist der Standard 65,536. Jedes Modell, als der von Ihrem Guthaben reservierte Betrag. Als Limit für die Länge der Antwort: die gehosteten Open-Weight-Modelle, shannon-1.6-lite, shannon-1.6-pro und shannon-coder-1. Ein Wert außerhalb des Bereichs wird auf das nächstliegende Ende des Bereichs gesetzt. Kein Fehler.
Stop-Sequenzen: stop, stop_sequences 4 Strings Gehostete Open-Weight-Modelle Die ersten 4 nicht leeren Strings werden verwendet.
Als URL angegebenes Bild oder Datei 8 MiB, innerhalb von 20 Sekunden gelesen, höchstens 5 Weiterleitungen, eine öffentliche http- oder https-Adresse Jeder Endpunkt, der Bilder oder Dateien annimmt Die Anfrage wird ohne diesen Teil beantwortet. Kein Fehler.
Inline gesendetes Bild oder Datei (Base64) Kein eigenes Limit. Sie zählen zum 32-MiB-Request-Body. Jeder Endpunkt, der Bilder oder Dateien annimmt Status 413 für die gesamte Anfrage.
text von POST /v1/tokenize 4,000,000 Bytes /v1/tokenize Status 413, Typ invalid_request_error, Nachricht text too long.
messages von POST /v1/tokenize und der Body von POST /v1/messages/count_tokens Der 32-MiB-Request-Body Beide Zähl-Endpunkte Status 413.
Kontextfenster Pro Modell: context_window in GET /v1/models Jedes Modell Was mit einer längeren Konversation geschieht, hängt vom Modell ab. Modelle & Preise
Websuchen (web_search: true) Pro Plan und Tag: Free 3, Plus 30, Standard 50, Pro 60. Eine Suche wird für eine Anfrage gezählt, deren Suche Ergebnisse gefunden hat. Anfragen, die web_search: true setzen Ist keine mehr übrig, wird die Anfrage ohne Suche beantwortet. Kein Fehler. Integrierte Websuche

Fehler

Die Antworten dieser Seite. Bei /v1/messages wird dasselbe Objekt error als {"type": "error", "error": {…}} verpackt.

Status Typ Nachricht Wann, und was zu tun ist
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Die Reservierung der Anfrage passt nicht in Ihr Guthaben. Warten Sie auf 00:00 UTC, laden Sie Guthaben auf, wechseln Sie den Plan oder senden Sie ein kleineres max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Mehr als 120 Anfragen in der aktuellen Minute. Warten Sie N Sekunden und senden Sie erneut.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Die Shannon-Coder-Aufrufe des aktuellen 4-Stunden-Fensters sind aufgebraucht.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Das Modell kann die Anfrage im Moment nicht annehmen. Senden Sie sie nach einer kurzen Pause erneut.
503 api_error Could not verify your quota right now. Please retry. Ihr Guthaben konnte nicht gelesen werden. Es wird nichts berechnet; senden Sie die Anfrage erneut. Bei /v1/responses mit einem Shannon-Modell ist der Status 500.
413 invalid_request_error Der Request-Body ist größer als 32 MiB. Bei den Endpunkten im OpenAI-Format enthält das Objekt error code: "request_too_large".
413 invalid_request_error text too long text von POST /v1/tokenize ist länger als 4,000,000 Bytes.