Zum Inhalt sprangen
Limiten a Solde

Limiten a Solde

All Ufro gëtt gläich behandelt. Keng Rate-Stufen. Keng separat API-Quota. Dir hutt Är Tokens scho bezuelt — benotzt se sou séier, wéi Dir wëllt.

Dës Säit erkläert, woraus Äre Solde besteet, wat eng Ufro reservéiert a kascht, wéi vill Ufroe Dir däerft schécken, an déi puer Limiten, op déi eng eenzel Ufro stéisst.

Wäert vun 1M Tokens Solde
$5.00
Deeglech Zuelung erneiert sech
00:00 UTC
Flood-Schutz, pro Kont
120 Ufroen / Min

Wéi Ufroe beäntwert ginn

  • Keng Rate-Stufen — Eng Regel begrenzt, wéi séier Ufroe däerfen ukommen, a si ass fir all Kont an all Plan d'selwecht: 120 Ufroen pro Minutt. Et gëtt keng Limit u Tokens pro Minutt.
  • Keng separat API-Quota — D'API verbraucht deeselwechte Solde wéi de Chat. E Plan setzt d'Gréisst vun der Zuelung vun haut. Hie setzt keng Ufro-Rate.
  • Sou séier, wéi Dir wëllt — Ufroen, déi parallel geschéckt ginn, ginn ugeholl a waarde an der Schlaang. Si ginn net refuséiert, well se parallel sinn.

Äre Solde

Äre Solde gëtt a Tokens gezielt. 1,000,000 Tokens Solde sinn $5.00 wäert, an all Präis op der Säit Modeller & Präisser bezitt sech op dee Wäert.

Zu all Moment ass de Solde d'Zomm vun zwee Deeler.

  • Plan-Zuelung vun haut — Eng Zuel vun Tokens, déi Äre Plan festleet. Se ass all Dag um 00:00 UTC nei. Wat um Enn vun engem Dag iwwereg ass, gëtt net iwwerholl.
  • Gekaafte Crédit — Tokens, déi Dir als Pack kaaft hutt. De Crédit verfält net a funktionéiert mat all Plan, och mat Free.
Plan Tokens pro Dag Wäert
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Reiefolleg vun den Ausgaben — All Ufro verbraucht fir d'éischt d'Plan-Zuelung vun haut. Gekaafte Crédit gëtt nëmmen fir dat benotzt, wat u deem Dag iwwer d'Zuelung erausgeet.
  • Chat an API deelen en — Et gëtt een Solde pro Kont. E API-Schlëssel verbraucht aus dem Solde vum Kont, dem e gehéiert, zu de selwechte Präisser wéi de Chat.
  • Packen — De Crédit gëtt a Packe vu 1,000,000 ($5.00), 2,000,000 ($10.00) an 5,000,000 ($25.00) Tokens verkaaft, oder als e Betrag no Ärer Wiel vun 1,000,000 bis 100,000,000 Tokens zu $5.00 pro 1,000,000.

Crédits updaten Plan ënderen

Wat eng Ufro reservéiert a wat si kascht

  • Reservéieren — Wann eng Ufro ukënnt, reservéiert si hire Output-Budget aus Ärem Solde: max_tokens op /v1/chat/completions an /v1/messages, max_output_tokens op /v1/responses. /v1/chat/completions liest och max_completion_tokens. De Standard ass 4,096 an de Beräich ass 1 bis 65,536.
  • Unhuelen — D'Ufro gëtt nëmmen ugeholl, wann d'Reservatioun an dat passt, wat vun Ärem Solde iwwereg ass. E Solde, dee méi wéi null awer méi kleng ass wéi de Output-Budget, kritt d'Äntwert Quota exceeded. Schéckt e méi klengt max_tokens, fir de Rescht ze benotzen.
  • Ofrechnen — Wann d'Äntwert komplett ass, gëtt d'Reservatioun duerch déi richteg Käschte ersat. D'Käschte kënnen nidderegt oder méi héich sinn wéi d'Reservatioun.
  • Zréckginn — Eng Ufro, déi mat engem Feeler-Status ophält, gëtt hir Reservatioun ganz zréck.

Déi richteg Käschte hänke vun der Modellfamill of.

Modeller Wat berechent gëtt
Shannon-Modeller usage.total_tokens zum Präis vum Modell pro 1M. Input an Output hunn een Tarif.
Hosted Open-Weight-Modeller Net gecachten Input zum Input-Tarif, gecachten Input zum Cache-Tarif, Output zum Output-Tarif.

De Betrag an USD gëtt zu $5.00 pro 1,000,000 an Tokens aus Ärem Solde ofgezunn, op e ganzen Token opgerënnt.

D'Zielen vun Tokens mat POST /v1/tokenize oder POST /v1/messages/count_tokens ass gratis a reservéiert näischt. Tokenzielung

Wou Dir Solde a Notzung gesitt

D'Säit Schlësselen & Notzung weist, wat Dir elo ausginn kënnt, d'Plan-Zuelung vun haut, Äre gekaafte Crédit an d'API-Ausgabe vun de leschte 30 Deeg. Drënner lëscht si all Ufro, déi Äre Schlëssel gemaach huet: Zäit, Endpoint, Modell, gecachten Input, berechent Tokens a Käschten. Schlësselen & Notzung

All Äntwert enthält och en usage-Objet mat den Tokenzuele vun deem Ruff.

Endpoint Felder vun usage Vun Hosted Open-Weight-Modeller derbäigesat
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage enthält d'Tokenzuele vum Modell. De Betrag, deen aus Ärem Solde ofgezunn gëtt, ass net an der Äntwert: et ass d'Kolonn Berechent Tokens vun der Ufroelëscht op Schlësselen & Notzung.
  • Op /v1/messages mat engem Hosted Open-Weight-Modell ass input_tokens den net gecachten Deel vum Input, cache_read_input_tokens ass den gecachten Deel an cache_creation_input_tokens ass ëmmer 0.
  • E Stream op /v1/chat/completions huet usage a sengem leschte Chunk virun [DONE]. Streaming

Wann de Solde opgebraucht ass

Eng Ufro, där hir Reservatioun net an Ären Solde passt, gëtt mam Status 429, dem Typ rate_limit_error an der Message ënnendrënner beäntwert. Et gëtt näischt berechent. Déiselwecht Äntwert gëtt geschéckt, wann de Solde méi wéi null awer méi kleng ass wéi de Output-Budget vun der Ufro.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Op /v1/responses ka säin error-Objet och code an param enthalen, béid null.

Dat kënnt Dir maachen:

  • Waart op déi nächst Plan-Zuelung um 00:00 UTC.
  • Lued Crédit op. De Crédit gëtt no der Plan-Zuelung verbraucht a verfält net. Crédits updaten
  • Wiesselt op e Plan mat enger méi grousser deeglecher Zuelung. Plan ënderen
  • Schéckt e méi klengt max_tokens, wann nach e bëssen Solde do ass: d'Reservatioun ass dann méi kleng.

Shannon-Coder-Ruff-Zuelung

shannon-coder-1 op /v1/chat/completions an /v1/messages gëtt a Ruffer gezielt, net a Tokens. All Plan enthält eng Zuel u Ruffer pro 4-Stonne-Fënster. Eng Ufro ass ee Ruff.

Plan Ruffer pro 4-Stonne-Fënster
Free 3
Plus 20
Standard 40
Pro 60
  • D'Fënstere fänken um 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC un. Ruffer, déi um Enn vun engem Fënster iwwereg sinn, ginn net iwwerholl.
  • E Ruff gëtt gezielt, wann d'Ufro ugeholl gëtt, ier de Modell äntwert. Eng Ufro, déi duerno feelschléit, zielt trotzdem als Ruff.
  • Dës Ruffer reservéieren keng Tokens a huelen näischt aus Ärem Solde. D'Ufroelëscht op Schlësselen & Notzung weist hir Tokenzuel an hire Wäert zum opgelëschte Präis.
  • De Standard-max_tokens vu shannon-coder-1 op dëse zwee Endpoints ass 65,536.
  • Ouni Ruffer méi ass d'Äntwert de Status 429, den Typ rate_limit_error an d'Message Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Op /v1/responses huet shannon-coder-1 keng Ruff-Zuelung: et gëtt a Tokens aus Ärem Solde berechent, zu $8.00 pro 1M, wéi all aner Modell.

Flood-Schutz

E Kont däerf 120 Ufroen pro Minutt schécken. Dat ass déi eenzeg Limit fir d'Ufro-Rate, a si ass bei all Plan d'selwecht. Si ass do, fir Fluten ze stoppen, net fir normal Notzung ze bremsen.

  • D'Minutt ass e fest Fënster vu 60 Sekonnen, dat mat Ärer éischter Ufro opgeet. Wann et eriwwer ass, fänkt d'Zielen nees bei null un.
  • D'Zielen ass pro Kont, net pro Schlëssel an net pro IP-Adress. Wann Dir de Schlëssel erneiert, geet kee neit Fënster op.
  • Déi 121. Ufro an engem Fënster gëtt mam Status 429, dem Typ rate_limit_error an der Message Too many requests. Retry in <N>s. beäntwert. N ass d'Zuel vu Sekonnen, bis d'Fënster eriwwer ass, vun 1 bis 60.
  • De Flood-Schutz gëtt virum Solde kontrolléiert. Eng Ufro, déi en refuséiert, reservéiert näischt a kascht näischt.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Ufro Flood-Schutz
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Gezielt, eng pro Ufro.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Net gezielt.
shannon-coder-1 op /v1/chat/completions an /v1/messages Amplaz vun der Shannon-Coder-Ruff-Zuelung gezielt.
Eng Ufro, déi mat 401 beäntwert gëtt, oder mat 400 bei engem onbekannten model Net gezielt.
Eng Ufro, déi de Flood-Schutz refuséiert Zielt fir d'Fënster mat. Et gëtt näischt berechent.

Parallel Ufroen

Et gëtt keng Limit, wéi vill Ufroen e Kont zur selwechter Zäit op huet, a kee Feeler fir parallel Ufroen. Ufroen, déi net direkt kënne starten, waarde an der Schlaang a ginn nodeneen beäntwert.

  • All Ufro zielt bei de 120 pro Minutt mat, wann si ukënnt, egal ob fréier Ufroen fäerdeg sinn oder net.
  • All Ufro hält hir eege Reservatioun, bis si ophält. Zwanzeg oppen Ufroe mam Standard-Output-Budget halen 20 × 4,096 = 81,920 Tokens Solde. Wann d'Reservatioune zesummen méi grouss si wéi Äre Solde, kritt déi nächst Ufro d'Äntwert Quota exceeded, och wann déi fäerdeg Ruffer manner kascht hätten. E méi klengt max_tokens hält manner.
  • Eng Ufro ouni Streaming schéckt näischt, bis hir Äntwert komplett ass, gitt Ärem Client dofir en Timeout, deen d'Waarden ofdeckt. E Stream hält seng Verbindung op, wärend en waart. Streaming

Limiten vun enger eenzeler Ufro

Limit Wäert Gëllt fir Bei der Limit
Body vun der Ufro 32 MiB (33,554,432 Bytes) All Endpoint Status 413, Typ invalid_request_error.
Output-Budget: max_tokens, max_completion_tokens, max_output_tokens 1 bis 65,536. Standard 4,096; bei shannon-coder-1 op /v1/chat/completions an /v1/messages ass de Standard 65,536. All Modell, als de Betrag, deen aus Ärem Solde reservéiert gëtt. Als Limit fir d'Längt vun der Äntwert: d'Hosted Open-Weight-Modeller, shannon-1.6-lite, shannon-1.6-pro a shannon-coder-1. E Wäert baussent dem Beräich gëtt op dat nootst Enn vum Beräich geréckelt. Kee Feeler.
Stop-Sequenzen: stop, stop_sequences 4 Strings Hosted Open-Weight-Modeller Déi éischt 4 net eidel Strings ginn benotzt.
Bild oder Datei als URL 8 MiB, bannent 20 Sekonnen gelies, héchstens 5 Weiderleedungen, eng ëffentlech http- oder https-Adress All Endpoint, deen Biller oder Fichieren hëlt D'Ufro gëtt ouni dësen Deel beäntwert. Kee Feeler.
Bild oder Datei, inline geschéckt (base64) Keng eege Limit. Et zielt zum 32-MiB-Body vun der Ufro. All Endpoint, deen Biller oder Fichieren hëlt Status 413 fir déi ganz Ufro.
text vun POST /v1/tokenize 4,000,000 Bytes /v1/tokenize Status 413, Typ invalid_request_error, Message text too long.
messages vun POST /v1/tokenize an de Body vun POST /v1/messages/count_tokens De 32-MiB-Body vun der Ufro Béid Zielendpoints Status 413.
Kontextfënster Pro Modell: context_window an GET /v1/models All Modell Wat mat enger méi laanger Konversatioun geschitt, hänkt vum Modell of. Modeller a Präisser
Websichen (web_search: true) Pro Plan an Dag: Free 3, Plus 30, Standard 50, Pro 60. Eng Sich gëtt fir eng Ufro gezielt, där hir Sich Resultater fonnt huet. Ufroen, déi web_search: true setzen Wann keng méi iwwereg ass, gëtt d'Ufro ouni Sich beäntwert. Kee Feeler. Integréiert Websich

Feeler

D'Äntwerte vun dëser Säit. Op /v1/messages ass dat selwecht error-Objet als {"type": "error", "error": {…}} agepackt.

Status Typ Message Wéini, a wat ze maachen
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan D'Reservatioun vun der Ufro passt net an Ären Solde. Waart bis 00:00 UTC, lued Crédit op, wiesselt de Plan, oder schéckt e méi klengt max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Méi wéi 120 Ufroen an der aktueller Minutt. Waart N Sekonnen a schéckt nach eng Kéier.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan D'Shannon-Coder-Ruffer vum aktuelle 4-Stonne-Fënster sinn opgebraucht.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. De Modell kann d'Ufro an dësem Moment net huelen. Schéckt se no enger kuerzer Paus nach eng Kéier.
503 api_error Could not verify your quota right now. Please retry. Äre Solde konnt net gelies ginn. Et gëtt näischt berechent; schéckt d'Ufro nach eng Kéier. Op /v1/responses mat engem Shannon-Modell ass de Status 500.
413 invalid_request_error De Body vun der Ufro ass méi grouss wéi 32 MiB. Op den Endpoints am OpenAI-Format enthält d'error-Objet code: "request_too_large".
413 invalid_request_error text too long text vun POST /v1/tokenize ass méi laang wéi 4,000,000 Bytes.