Limiten a Solde
All Ufro gëtt gläich behandelt. Keng Rate-Stufen. Keng separat API-Quota. Dir hutt Är Tokens scho bezuelt — benotzt se sou séier, wéi Dir wëllt.
Dës Säit erkläert, woraus Äre Solde besteet, wat eng Ufro reservéiert a kascht, wéi vill Ufroe Dir däerft schécken, an déi puer Limiten, op déi eng eenzel Ufro stéisst.
- Wäert vun 1M Tokens Solde
- $5.00
- Deeglech Zuelung erneiert sech
- 00:00 UTC
- Flood-Schutz, pro Kont
- 120 Ufroen / Min
Wéi Ufroe beäntwert ginn
- Keng Rate-Stufen — Eng Regel begrenzt, wéi séier Ufroe däerfen ukommen, a si ass fir all Kont an all Plan d'selwecht: 120 Ufroen pro Minutt. Et gëtt keng Limit u Tokens pro Minutt.
- Keng separat API-Quota — D'API verbraucht deeselwechte Solde wéi de Chat. E Plan setzt d'Gréisst vun der Zuelung vun haut. Hie setzt keng Ufro-Rate.
- Sou séier, wéi Dir wëllt — Ufroen, déi parallel geschéckt ginn, ginn ugeholl a waarde an der Schlaang. Si ginn net refuséiert, well se parallel sinn.
Äre Solde
Äre Solde gëtt a Tokens gezielt. 1,000,000 Tokens Solde sinn $5.00 wäert, an all Präis op der Säit Modeller & Präisser bezitt sech op dee Wäert.
Zu all Moment ass de Solde d'Zomm vun zwee Deeler.
- Plan-Zuelung vun haut — Eng Zuel vun Tokens, déi Äre Plan festleet. Se ass all Dag um 00:00 UTC nei. Wat um Enn vun engem Dag iwwereg ass, gëtt net iwwerholl.
- Gekaafte Crédit — Tokens, déi Dir als Pack kaaft hutt. De Crédit verfält net a funktionéiert mat all Plan, och mat Free.
| Plan | Tokens pro Dag | Wäert |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Reiefolleg vun den Ausgaben — All Ufro verbraucht fir d'éischt d'Plan-Zuelung vun haut. Gekaafte Crédit gëtt nëmmen fir dat benotzt, wat u deem Dag iwwer d'Zuelung erausgeet.
- Chat an API deelen en — Et gëtt een Solde pro Kont. E API-Schlëssel verbraucht aus dem Solde vum Kont, dem e gehéiert, zu de selwechte Präisser wéi de Chat.
- Packen — De Crédit gëtt a Packe vu 1,000,000 ($5.00), 2,000,000 ($10.00) an 5,000,000 ($25.00) Tokens verkaaft, oder als e Betrag no Ärer Wiel vun 1,000,000 bis 100,000,000 Tokens zu $5.00 pro 1,000,000.
Wat eng Ufro reservéiert a wat si kascht
- Reservéieren — Wann eng Ufro ukënnt, reservéiert si hire Output-Budget aus Ärem Solde:
max_tokensop/v1/chat/completionsan/v1/messages,max_output_tokensop/v1/responses./v1/chat/completionsliest ochmax_completion_tokens. De Standard ass 4,096 an de Beräich ass 1 bis 65,536. - Unhuelen — D'Ufro gëtt nëmmen ugeholl, wann d'Reservatioun an dat passt, wat vun Ärem Solde iwwereg ass. E Solde, dee méi wéi null awer méi kleng ass wéi de Output-Budget, kritt d'Äntwert
Quota exceeded. Schéckt e méi klengtmax_tokens, fir de Rescht ze benotzen. - Ofrechnen — Wann d'Äntwert komplett ass, gëtt d'Reservatioun duerch déi richteg Käschte ersat. D'Käschte kënnen nidderegt oder méi héich sinn wéi d'Reservatioun.
- Zréckginn — Eng Ufro, déi mat engem Feeler-Status ophält, gëtt hir Reservatioun ganz zréck.
Déi richteg Käschte hänke vun der Modellfamill of.
| Modeller | Wat berechent gëtt |
|---|---|
| Shannon-Modeller | usage.total_tokens zum Präis vum Modell pro 1M. Input an Output hunn een Tarif. |
| Hosted Open-Weight-Modeller | Net gecachten Input zum Input-Tarif, gecachten Input zum Cache-Tarif, Output zum Output-Tarif. |
De Betrag an USD gëtt zu $5.00 pro 1,000,000 an Tokens aus Ärem Solde ofgezunn, op e ganzen Token opgerënnt.
D'Zielen vun Tokens mat POST /v1/tokenize oder POST /v1/messages/count_tokens ass gratis a reservéiert näischt. Tokenzielung
Wou Dir Solde a Notzung gesitt
D'Säit Schlësselen & Notzung weist, wat Dir elo ausginn kënnt, d'Plan-Zuelung vun haut, Äre gekaafte Crédit an d'API-Ausgabe vun de leschte 30 Deeg. Drënner lëscht si all Ufro, déi Äre Schlëssel gemaach huet: Zäit, Endpoint, Modell, gecachten Input, berechent Tokens a Käschten. Schlësselen & Notzung
All Äntwert enthält och en usage-Objet mat den Tokenzuele vun deem Ruff.
| Endpoint | Felder vun usage | Vun Hosted Open-Weight-Modeller derbäigesat |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageenthält d'Tokenzuele vum Modell. De Betrag, deen aus Ärem Solde ofgezunn gëtt, ass net an der Äntwert: et ass d'Kolonn Berechent Tokens vun der Ufroelëscht op Schlësselen & Notzung.- Op
/v1/messagesmat engem Hosted Open-Weight-Modell assinput_tokensden net gecachten Deel vum Input,cache_read_input_tokensass den gecachten Deel ancache_creation_input_tokensass ëmmer0. - E Stream op
/v1/chat/completionshuetusagea sengem leschte Chunk virun[DONE]. Streaming
Wann de Solde opgebraucht ass
Eng Ufro, där hir Reservatioun net an Ären Solde passt, gëtt mam Status 429, dem Typ rate_limit_error an der Message ënnendrënner beäntwert. Et gëtt näischt berechent. Déiselwecht Äntwert gëtt geschéckt, wann de Solde méi wéi null awer méi kleng ass wéi de Output-Budget vun der Ufro.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Op /v1/responses ka säin error-Objet och code an param enthalen, béid null.
Dat kënnt Dir maachen:
- Waart op déi nächst Plan-Zuelung um 00:00 UTC.
- Lued Crédit op. De Crédit gëtt no der Plan-Zuelung verbraucht a verfält net. Crédits updaten
- Wiesselt op e Plan mat enger méi grousser deeglecher Zuelung. Plan ënderen
- Schéckt e méi klengt
max_tokens, wann nach e bëssen Solde do ass: d'Reservatioun ass dann méi kleng.
Shannon-Coder-Ruff-Zuelung
shannon-coder-1 op /v1/chat/completions an /v1/messages gëtt a Ruffer gezielt, net a Tokens. All Plan enthält eng Zuel u Ruffer pro 4-Stonne-Fënster. Eng Ufro ass ee Ruff.
| Plan | Ruffer pro 4-Stonne-Fënster |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- D'Fënstere fänken um 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC un. Ruffer, déi um Enn vun engem Fënster iwwereg sinn, ginn net iwwerholl.
- E Ruff gëtt gezielt, wann d'Ufro ugeholl gëtt, ier de Modell äntwert. Eng Ufro, déi duerno feelschléit, zielt trotzdem als Ruff.
- Dës Ruffer reservéieren keng Tokens a huelen näischt aus Ärem Solde. D'Ufroelëscht op Schlësselen & Notzung weist hir Tokenzuel an hire Wäert zum opgelëschte Präis.
- De Standard-
max_tokensvushannon-coder-1op dëse zwee Endpoints ass 65,536. - Ouni Ruffer méi ass d'Äntwert de Status
429, den Typrate_limit_erroran d'MessageShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Op
/v1/responseshuetshannon-coder-1keng Ruff-Zuelung: et gëtt a Tokens aus Ärem Solde berechent, zu $8.00 pro 1M, wéi all aner Modell.
Flood-Schutz
E Kont däerf 120 Ufroen pro Minutt schécken. Dat ass déi eenzeg Limit fir d'Ufro-Rate, a si ass bei all Plan d'selwecht. Si ass do, fir Fluten ze stoppen, net fir normal Notzung ze bremsen.
- D'Minutt ass e fest Fënster vu 60 Sekonnen, dat mat Ärer éischter Ufro opgeet. Wann et eriwwer ass, fänkt d'Zielen nees bei null un.
- D'Zielen ass pro Kont, net pro Schlëssel an net pro IP-Adress. Wann Dir de Schlëssel erneiert, geet kee neit Fënster op.
- Déi 121. Ufro an engem Fënster gëtt mam Status
429, dem Typrate_limit_erroran der MessageToo many requests. Retry in <N>s.beäntwert.Nass d'Zuel vu Sekonnen, bis d'Fënster eriwwer ass, vun 1 bis 60. - De Flood-Schutz gëtt virum Solde kontrolléiert. Eng Ufro, déi en refuséiert, reservéiert näischt a kascht näischt.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Ufro | Flood-Schutz |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Gezielt, eng pro Ufro. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Net gezielt. |
shannon-coder-1 op /v1/chat/completions an /v1/messages | Amplaz vun der Shannon-Coder-Ruff-Zuelung gezielt. |
Eng Ufro, déi mat 401 beäntwert gëtt, oder mat 400 bei engem onbekannten model | Net gezielt. |
| Eng Ufro, déi de Flood-Schutz refuséiert | Zielt fir d'Fënster mat. Et gëtt näischt berechent. |
Parallel Ufroen
Et gëtt keng Limit, wéi vill Ufroen e Kont zur selwechter Zäit op huet, a kee Feeler fir parallel Ufroen. Ufroen, déi net direkt kënne starten, waarde an der Schlaang a ginn nodeneen beäntwert.
- All Ufro zielt bei de 120 pro Minutt mat, wann si ukënnt, egal ob fréier Ufroen fäerdeg sinn oder net.
- All Ufro hält hir eege Reservatioun, bis si ophält. Zwanzeg oppen Ufroe mam Standard-Output-Budget halen 20 × 4,096 = 81,920 Tokens Solde. Wann d'Reservatioune zesummen méi grouss si wéi Äre Solde, kritt déi nächst Ufro d'Äntwert
Quota exceeded, och wann déi fäerdeg Ruffer manner kascht hätten. E méi klengtmax_tokenshält manner. - Eng Ufro ouni Streaming schéckt näischt, bis hir Äntwert komplett ass, gitt Ärem Client dofir en Timeout, deen d'Waarden ofdeckt. E Stream hält seng Verbindung op, wärend en waart. Streaming
Limiten vun enger eenzeler Ufro
| Limit | Wäert | Gëllt fir | Bei der Limit |
|---|---|---|---|
| Body vun der Ufro | 32 MiB (33,554,432 Bytes) | All Endpoint | Status 413, Typ invalid_request_error. |
Output-Budget: max_tokens, max_completion_tokens, max_output_tokens | 1 bis 65,536. Standard 4,096; bei shannon-coder-1 op /v1/chat/completions an /v1/messages ass de Standard 65,536. | All Modell, als de Betrag, deen aus Ärem Solde reservéiert gëtt. Als Limit fir d'Längt vun der Äntwert: d'Hosted Open-Weight-Modeller, shannon-1.6-lite, shannon-1.6-pro a shannon-coder-1. | E Wäert baussent dem Beräich gëtt op dat nootst Enn vum Beräich geréckelt. Kee Feeler. |
Stop-Sequenzen: stop, stop_sequences | 4 Strings | Hosted Open-Weight-Modeller | Déi éischt 4 net eidel Strings ginn benotzt. |
| Bild oder Datei als URL | 8 MiB, bannent 20 Sekonnen gelies, héchstens 5 Weiderleedungen, eng ëffentlech http- oder https-Adress | All Endpoint, deen Biller oder Fichieren hëlt | D'Ufro gëtt ouni dësen Deel beäntwert. Kee Feeler. |
| Bild oder Datei, inline geschéckt (base64) | Keng eege Limit. Et zielt zum 32-MiB-Body vun der Ufro. | All Endpoint, deen Biller oder Fichieren hëlt | Status 413 fir déi ganz Ufro. |
text vun POST /v1/tokenize | 4,000,000 Bytes | /v1/tokenize | Status 413, Typ invalid_request_error, Message text too long. |
messages vun POST /v1/tokenize an de Body vun POST /v1/messages/count_tokens | De 32-MiB-Body vun der Ufro | Béid Zielendpoints | Status 413. |
| Kontextfënster | Pro Modell: context_window an GET /v1/models | All Modell | Wat mat enger méi laanger Konversatioun geschitt, hänkt vum Modell of. Modeller a Präisser |
Websichen (web_search: true) | Pro Plan an Dag: Free 3, Plus 30, Standard 50, Pro 60. Eng Sich gëtt fir eng Ufro gezielt, där hir Sich Resultater fonnt huet. | Ufroen, déi web_search: true setzen | Wann keng méi iwwereg ass, gëtt d'Ufro ouni Sich beäntwert. Kee Feeler. Integréiert Websich |
Feeler
D'Äntwerte vun dëser Säit. Op /v1/messages ass dat selwecht error-Objet als {"type": "error", "error": {…}} agepackt.
| Status | Typ | Message | Wéini, a wat ze maachen |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | D'Reservatioun vun der Ufro passt net an Ären Solde. Waart bis 00:00 UTC, lued Crédit op, wiesselt de Plan, oder schéckt e méi klengt max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Méi wéi 120 Ufroen an der aktueller Minutt. Waart N Sekonnen a schéckt nach eng Kéier. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | D'Shannon-Coder-Ruffer vum aktuelle 4-Stonne-Fënster sinn opgebraucht. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | De Modell kann d'Ufro an dësem Moment net huelen. Schéckt se no enger kuerzer Paus nach eng Kéier. |
503 | api_error | Could not verify your quota right now. Please retry. | Äre Solde konnt net gelies ginn. Et gëtt näischt berechent; schéckt d'Ufro nach eng Kéier. Op /v1/responses mat engem Shannon-Modell ass de Status 500. |
413 | invalid_request_error | De Body vun der Ufro ass méi grouss wéi 32 MiB. Op den Endpoints am OpenAI-Format enthält d'error-Objet code: "request_too_large". | |
413 | invalid_request_error | text too long | text vun POST /v1/tokenize ass méi laang wéi 4,000,000 Bytes. |