Grænser og saldo
Hver anmodning betjenes lige. Ingen hastighedsniveauer. Ingen separat API-kvote. Du har allerede betalt for dine tokens — brug dem så hurtigt, du vil.
Denne side forklarer, hvad din saldo består af, hvad én anmodning reserverer og koster, hvor mange anmodninger du må sende, og de få grænser, en enkelt anmodning kan møde.
- værdi af 1M tokens af saldo
- $5.00
- daglig kvote fornyes
- 00:00 UTC
- flood protection, per konto
- 120 anmodninger / min
Hvordan anmodninger betjenes
- Ingen hastighedsniveauer — Én regel begrænser, hvor hurtigt anmodninger må ankomme, og den er den samme for alle konti og alle planer: 120 anmodninger per minut. Der er ingen grænse for tokens per minut.
- Ingen separat API-kvote — API'et bruger den samme saldo som chat. En plan fastsætter størrelsen på dagens kvote. Den fastsætter ikke en anmodningshastighed.
- Så hurtigt du vil — Anmodninger sendt parallelt accepteres og venter i kø. De afvises ikke for at være parallelle.
Din saldo
Din saldo tælles i tokens. 1,000,000 tokens af saldo er $5.00 værd, og hver pris på siden Modeller og priser er en takst i forhold til den værdi.
Til enhver tid er saldoen summen af to dele.
- Dagens plan-kvote — Et antal tokens, der er fastsat af din plan. Det fornyes hver dag kl. 00:00 UTC. Det, der er tilbage ved dagens slutning, overføres ikke.
- Købt kredit — Tokens, du har købt som en pakke. Kredit udløber ikke og virker på alle planer, også Free.
| Plan | Tokens per dag | Værdi |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Rækkefølge for forbrug — Hver anmodning bruger først dagens plan-kvote. Købt kredit bruges kun til det, der går ud over kvoten den dag.
- Chat og API deler den — Der er én saldo per konto. En API-nøgle bruger af saldoen på den konto, der ejer den, til de samme priser som chat.
- Pakker — Kredit sælges i pakker på 1,000,000 ($5.00), 2,000,000 ($10.00) og 5,000,000 ($25.00) tokens eller som et beløb efter eget valg fra 1,000,000 til 100,000,000 tokens til $5.00 per 1,000,000.
Hvad en anmodning reserverer, og hvad den koster
- Reserver — Når en anmodning ankommer, reserverer den sit outputbudget fra din saldo:
max_tokenspå/v1/chat/completionsog/v1/messages,max_output_tokenspå/v1/responses./v1/chat/completionslæser ogsåmax_completion_tokens. Standardværdien er 4,096, og intervallet er 1 til 65,536. - Accept — Anmodningen accepteres kun, hvis reservationen kan rummes i det, der er tilbage af din saldo. En saldo, der er over nul, men mindre end outputbudgettet, får svaret
Quota exceeded. Send en mindremax_tokensfor at bruge resten. - Afregn — Når svaret er færdigt, erstattes reservationen af den reelle afregning. Afregningen kan være lavere eller højere end reservationen.
- Tilbagefør — En anmodning, der ender med en fejlstatus, giver sin reservation tilbage i fuld størrelse.
Den reelle afregning afhænger af modelfamilien.
| Modeller | Hvad der afregnes |
|---|---|
| Shannon-modeller | usage.total_tokens til modellens pris per 1M. Input og output har én takst. |
| Hostede open-weight-modeller | Ikke-cached input til inputtaksten, cached input til cachetaksten, output til outputtaksten. |
Beløbet i USD trækkes fra din saldo i tokens til $5.00 per 1,000,000, rundet til en hel token.
Tælling af tokens med POST /v1/tokenize eller POST /v1/messages/count_tokens er gratis og reserverer intet. Tælling af tokens
Hvor du ser saldo og forbrug
Siden Nøgler og forbrug viser, hvad du kan bruge lige nu, dagens plan-kvote, din købte kredit og API-forbruget de seneste 30 dage. Under det står hver anmodning, din nøgle har foretaget: tidspunkt, endpoint, model, cached input, afregnede tokens og omkostninger. Nøgler og forbrug
Hvert svar indeholder også et usage-objekt med token-tællingerne for det kald.
| Endpoint | Felter i usage | Tilføjet af hostede open-weight-modeller |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageindeholder modellens token-tællinger. Det beløb, der trækkes fra din saldo, står ikke i svaret: det er kolonnen Afregnede tokens i anmodningslisten under Nøgler og forbrug.- På
/v1/messagesmed en hostet open-weight-model erinput_tokensden ikke-cached del af inputtet,cache_read_input_tokenser den cached del, ogcache_creation_input_tokenser altid0. - En stream på
/v1/chat/completionsharusagei sit sidste chunk før[DONE]. Streaming
Når saldoen løber tør
En anmodning, hvis reservation ikke kan rummes i din saldo, besvares med status 429, type rate_limit_error og beskeden nedenfor. Der afregnes intet. Det samme svar sendes, når saldoen er over nul, men mindre end anmodningens outputbudget.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} På /v1/responses kan error-objektet også indeholde code og param, begge null.
Det kan du gøre:
- Vent på næste plan-kvote kl. 00:00 UTC.
- Opfyld kredit. Kredit bruges efter plan-kvoten og udløber ikke. Opfyld kredit
- Skift til en plan med en større daglig kvote. Skift plan
- Send en mindre
max_tokens, hvis der er noget saldo tilbage: så er reservationen mindre.
Shannon Coders kaldkvote
shannon-coder-1 på /v1/chat/completions og /v1/messages tælles i kald, ikke i tokens. Hver plan indeholder et antal kald per 4-timers vindue. Én anmodning er ét kald.
| Plan | Kald per 4-timers vindue |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Vinduer starter kl. 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Kald, der er tilbage ved vinduets slutning, overføres ikke.
- Et kald tælles, når anmodningen accepteres, før modellen svarer. En anmodning, der fejler bagefter, tæller stadig som et kald.
- Disse kald reserverer ingen tokens og trækker intet fra din saldo. Anmodningslisten under Nøgler og forbrug viser deres antal tokens og værdien til den opførte pris.
- Standardværdien af
max_tokenser 65,536 for modellenshannon-coder-1i begge disse endpoints. - Når der ikke er flere kald, er svaret status
429, typerate_limit_error, beskedShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - På
/v1/responsesharshannon-coder-1ingen kaldkvote: den afregnes i tokens fra din saldo til $8.00 per 1M, som alle andre modeller.
Flood protection
En konto må sende 120 anmodninger per minut. Det er den eneste grænse for anmodningshastighed, og den er den samme på alle planer. Den findes for at stoppe oversvømmelser, ikke for at bremse almindelig brug.
- Minuttet er et fast vindue på 60 sekunder, der åbner med din første anmodning. Når det slutter, starter tællingen igen fra nul.
- Tællingen er per konto, ikke per nøgle og ikke per IP-adresse. Roterer du nøglen, åbner det ikke et nyt vindue.
- Den 121. anmodning inden for et vindue besvares med status
429, typerate_limit_errorog beskedenToo many requests. Retry in <N>s.Ner antallet af sekunder, til vinduet slutter, fra 1 til 60. - Flood protection kontrolleres før saldoen. En anmodning, den afviser, reserverer intet og koster intet.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Anmodning | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Tælles, én per anmodning. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Tælles ikke. |
shannon-coder-1 på /v1/chat/completions og /v1/messages | Tælles i stedet af Shannon Coders kaldkvote. |
En anmodning besvaret med 401 eller med 400 for en ukendt model | Tælles ikke. |
| En anmodning afvist af flood protection | Tælles med i vinduet. Der afregnes intet. |
Parallelle anmodninger
Der er ingen grænse for, hvor mange anmodninger en konto har åbne på samme tid, og ingen fejl for at sende anmodninger parallelt. Anmodninger, der ikke kan starte med det samme, venter i kø og besvares efter tur.
- Hver anmodning tæller med i de 120 per minut, når den ankommer, uanset om tidligere anmodninger er færdige.
- Hver anmodning holder sin egen reservation, til den slutter. Tyve åbne anmodninger med standardoutputbudgettet holder 20 × 4,096 = 81,920 tokens af saldo. Hvis reservationerne tilsammen er større end din saldo, får den næste anmodning svaret
Quota exceeded, selv om de færdige kald ville have kostet mindre. En mindremax_tokensholder mindre. - En anmodning uden streaming sender intet, før svaret er færdigt, så giv din klient en timeout, der dækker ventetiden. En stream holder sin forbindelse åben, mens den venter. Streaming
Grænser for en enkelt anmodning
| Grænse | Værdi | Gælder for | Ved grænsen |
|---|---|---|---|
| Anmodningens body | 32 MiB (33,554,432 bytes) | Alle endpoints | Status 413, type invalid_request_error. |
Outputbudget: max_tokens, max_completion_tokens, max_output_tokens | 1 til 65,536. Standard 4,096; for shannon-coder-1 på /v1/chat/completions og /v1/messages er standarden 65,536. | Alle modeller, som det beløb der reserveres fra din saldo. Som grænse for svarets længde: de hostede open-weight-modeller, shannon-1.6-lite, shannon-1.6-pro og shannon-coder-1. | En værdi uden for intervallet flyttes til den nærmeste ende af intervallet. Ingen fejl. |
Stopsekvenser: stop, stop_sequences | 4 strenge | Hostede open-weight-modeller | De første 4 ikke-tomme strenge bruges. |
| Billede eller fil angivet som en URL | 8 MiB, læst inden for 20 sekunder, højst 5 omdirigeringer, en offentlig http- eller https-adresse | Alle endpoints, der tager imod billeder eller filer | Anmodningen besvares uden den del. Ingen fejl. |
| Billede eller fil sendt inline (base64) | Ingen egen grænse. Det tæller med i anmodningens body på 32 MiB. | Alle endpoints, der tager imod billeder eller filer | Status 413 for hele anmodningen. |
text i POST /v1/tokenize | 4,000,000 bytes | /v1/tokenize | Status 413, type invalid_request_error, besked text too long. |
messages i POST /v1/tokenize og body i POST /v1/messages/count_tokens | Anmodningens body på 32 MiB | Begge tælle-endpoints | Status 413. |
| Kontekstvindue | Per model: context_window i GET /v1/models | Alle modeller | Hvad der sker med en længere samtale, afhænger af modellen. Modeller og priser |
Websøgninger (web_search: true) | Per plan og dag: Free 3, Plus 30, Standard 50, Pro 60. Én søgning tælles for en anmodning, hvor søgningen fandt resultater. | Anmodninger, der sætter web_search: true | Når der ikke er flere tilbage, besvares anmodningen uden søgning. Ingen fejl. Indbygget websøgning |
Fejl
Svarene på denne side. På /v1/messages er det samme error-objekt pakket ind som {"type": "error", "error": {…}}.
| Status | Type | Besked | Hvornår, og hvad du skal gøre |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Anmodningens reservation kan ikke rummes i din saldo. Vent til 00:00 UTC, opfyld kredit, skift plan, eller send en mindre max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Mere end 120 anmodninger i det nuværende minut. Vent N sekunder, og send igen. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Shannon Coder-kaldene i det nuværende 4-timers vindue er brugt op. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Modellen kan ikke tage imod anmodningen lige nu. Send den igen efter en kort pause. |
503 | api_error | Could not verify your quota right now. Please retry. | Din saldo kunne ikke læses. Der afregnes intet; send anmodningen igen. På /v1/responses med en Shannon-model er statussen 500. |
413 | invalid_request_error | Anmodningens body er større end 32 MiB. På OpenAI-format-endpointsene indeholder error-objektet code: "request_too_large". | |
413 | invalid_request_error | text too long | text i POST /v1/tokenize er længere end 4,000,000 bytes. |