Gränser och balans
Varje begäran betjänas lika. Inga hastighetsnivåer. Ingen separat API-kvot. Du har redan betalat för dina tokens — använd dem så fort du vill.
Den här sidan förklarar vad din balans består av, vad en begäran reserverar och kostar, hur många begäranden du får skicka och de få gränser som en enskild begäran kan möta.
- värdet av 1M tokens balans
- $5.00
- dagskvoten förnyas
- 00:00 UTC
- flood protection, per konto
- 120 begäranden / min
Hur begäranden betjänas
- Inga hastighetsnivåer — En regel begränsar hur snabbt begäranden får komma in, och den är densamma för varje konto och varje plan: 120 begäranden per minut. Det finns ingen gräns för tokens per minut.
- Ingen separat API-kvot — API:et förbrukar samma balans som chatten. En plan bestämmer storleken på dagens kvot. Den bestämmer ingen begäranfrekvens.
- Så fort du vill — Begäranden som skickas parallellt accepteras och väntar i kö. De avvisas inte för att de är parallella.
Din balans
Din balans räknas i tokens. 1,000,000 tokens av balans är värda $5.00, och varje pris på sidan Modeller och priser är ett pris i förhållande till det värdet.
Balansen är vid varje ögonblick summan av två delar.
- Dagens plankvot — Ett antal tokens som bestäms av din plan. Det förnyas varje dag kl. 00:00 UTC. Det som är kvar vid dagens slut överförs inte.
- Inköpt kredit — Tokens som du köpt som ett paket. Krediten går inte ut och fungerar på varje plan, även Free.
| Plan | Tokens per dag | Värde |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Förbrukningsordning — Varje begäran förbrukar först dagens plankvot. Inköpt kredit används bara för det som går utöver kvoten den dagen.
- Chatten och API:et delar den — Det finns en balans per konto. En API-nyckel förbrukar från balansen på det konto som äger den, till samma priser som i chatten.
- Paket — Kredit säljs i paket om 1,000,000 ($5.00), 2,000,000 ($10.00) och 5,000,000 ($25.00) tokens, eller som ett valfritt belopp från 1,000,000 till 100,000,000 tokens för $5.00 per 1,000,000.
Vad en begäran reserverar och vad den kostar
- Reservera — När en begäran kommer in reserverar den sin outputbudget från din balans:
max_tokenspå/v1/chat/completionsoch/v1/messages,max_output_tokenspå/v1/responses./v1/chat/completionsläser ävenmax_completion_tokens. Standardvärdet är 4,096 och intervallet är 1 till 65,536. - Godkänn — Begäran accepteras bara om reservationen ryms i det som återstår av din balans. En balans som är över noll men mindre än outputbudgeten får svaret
Quota exceeded. Skicka ett mindremax_tokensför att använda resten. - Reglera — När svaret är klart ersätts reservationen av den verkliga debiteringen. Debiteringen kan vara lägre eller högre än reservationen.
- Återlämna — En begäran som slutar med en felstatus lämnar tillbaka hela sin reservation.
Den verkliga debiteringen beror på modellfamiljen.
| Modeller | Vad som debiteras |
|---|---|
| Shannon-modeller | usage.total_tokens till modellens pris per 1M. Input och output har samma pris. |
| Hostade open-weight-modeller | Ocachad input till inputpriset, cachad input till cachepriset, output till outputpriset. |
Beloppet i USD tas från din balans i tokens till $5.00 per 1,000,000, avrundat till en hel token.
Att räkna tokens med POST /v1/tokenize eller POST /v1/messages/count_tokens är gratis och reserverar ingenting. Tokenräkning
Var du ser balans och användning
Sidan Nycklar och användning visar vad du kan förbruka just nu, dagens plankvot, din inköpta kredit och API-förbrukningen de senaste 30 dagarna. Under den listas varje begäran som din nyckel har gjort: tid, endpoint, modell, cachad input, fakturerade tokens och kostnad. Nycklar och användning
Varje svar innehåller också ett usage-objekt med tokenräkningarna för anropet.
| Endpoint | Fält i usage | Läggs till av hostade open-weight-modeller |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageinnehåller modellens tokenräkningar. Det belopp som dras från din balans finns inte i svaret: det är kolumnen Debiterade tokens i begäranlistan på Nycklar och användning.- På
/v1/messagesmed en hostad open-weight-modell ärinput_tokensden ocachade delen av inputen,cache_read_input_tokensär den cachade delen ochcache_creation_input_tokensär alltid0. - En ström på
/v1/chat/completionsbärusagei sin sista chunk före[DONE]. Streaming
När balansen tar slut
En begäran vars reservation inte ryms i din balans besvaras med status 429, typ rate_limit_error och meddelandet nedan. Ingenting debiteras. Samma svar skickas när balansen är över noll men mindre än begärans outputbudget.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} På /v1/responses kan error-objektet även innehålla code och param, båda null.
Det här kan du göra:
- Vänta på nästa plankvot kl. 00:00 UTC.
- Fyll på kredit. Krediten förbrukas efter plankvoten och går inte ut. Fyll på kredit
- Byt till en plan med större daglig kvot. Byt plan
- Skicka ett mindre
max_tokens, om det finns någon balans kvar: reservationen blir då mindre.
Anropskvot för Shannon Coder
shannon-coder-1 på /v1/chat/completions och /v1/messages räknas i anrop, inte i tokens. Varje plan innehåller ett antal anrop per 4-timmarsfönster. En begäran är ett anrop.
| Plan | Anrop per 4-timmarsfönster |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Fönstren börjar kl. 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Anrop som är kvar vid ett fönsters slut överförs inte.
- Ett anrop räknas när begäran accepteras, innan modellen svarar. En begäran som misslyckas därefter räknas ändå som ett anrop.
- Dessa anrop reserverar inga tokens och tar ingenting från din balans. Begäranlistan under Nycklar och användning visar deras tokenantal och dess värde till listat pris.
- Standardvärdet för
max_tokenspåshannon-coder-1på dessa två endpoints är 65,536. - När inga anrop återstår är svaret status
429, typrate_limit_error, meddelandeShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - På
/v1/responsesharshannon-coder-1ingen anropskvot: den debiteras i tokens från din balans till $8.00 per 1M, som alla andra modeller.
Flood protection
Ett konto får skicka 120 begäranden per minut. Det är den enda gränsen för begäranfrekvens, och den är densamma på alla planer. Den finns för att stoppa översvämningar, inte för att bromsa normal användning.
- Minuten är ett fast fönster på 60 sekunder som öppnas med din första begäran. När det slutar börjar räkningen om från noll.
- Räkningen sker per konto, inte per nyckel och inte per IP-adress. Att rotera nyckeln öppnar inget nytt fönster.
- Den 121:a begäran inom ett fönster besvaras med status
429, typrate_limit_erroroch meddelandetToo many requests. Retry in <N>s.När antalet sekunder tills fönstret slutar, från 1 till 60. - Flood protection kontrolleras före balansen. En begäran som den avvisar reserverar ingenting och kostar ingenting.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Begäran | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Räknas, en per begäran. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Räknas inte. |
shannon-coder-1 på /v1/chat/completions och /v1/messages | Räknas i stället mot Shannon Coder-anropskvoten. |
En begäran som besvaras med 401, eller med 400 för en okänd model | Räknas inte. |
| En begäran som avvisas av flood protection | Räknas mot fönstret. Ingenting debiteras. |
Parallella begäranden
Det finns ingen gräns för hur många begäranden ett konto har öppna samtidigt, och inget fel för att skicka begäranden parallellt. Begäranden som inte kan starta direkt väntar i kö och besvaras i tur och ordning.
- Varje begäran räknas mot de 120 per minut när den kommer in, oavsett om tidigare begäranden har blivit klara.
- Varje begäran håller sin egen reservation tills den är slut. Tjugo öppna begäranden med standardbudgeten för output håller 20 × 4,096 = 81,920 tokens av balans. Om reservationerna tillsammans är större än din balans får nästa begäran svaret
Quota exceeded, trots att de avslutade anropen hade kostat mindre. Ett mindremax_tokenshåller mindre. - En begäran utan streaming skickar ingenting förrän svaret är klart, så ge din klient en timeout som täcker väntan. En ström håller sin anslutning öppen medan den väntar. Streaming
Gränser för en enskild begäran
| Gräns | Värde | Gäller för | Vid gränsen |
|---|---|---|---|
| Begäranskropp | 32 MiB (33,554,432 byte) | Varje endpoint | Status 413, typ invalid_request_error. |
Outputbudget: max_tokens, max_completion_tokens, max_output_tokens | 1 till 65,536. Standard 4,096; för shannon-coder-1 på /v1/chat/completions och /v1/messages är standardvärdet 65,536. | Varje modell, som det belopp som reserveras från din balans. Som gräns för svarets längd: de hostade open-weight-modellerna, shannon-1.6-lite, shannon-1.6-pro och shannon-coder-1. | Ett värde utanför intervallet flyttas till närmaste ände av intervallet. Inget fel. |
Stoppsekvenser: stop, stop_sequences | 4 strängar | Hostade open-weight-modeller | De första 4 icke-tomma strängarna används. |
| Bild eller fil angiven som URL | 8 MiB, läst inom 20 sekunder, högst 5 omdirigeringar, en offentlig http- eller https-adress | Varje endpoint som tar bilder eller filer | Begäran besvaras utan den delen. Inget fel. |
| Bild eller fil skickad inbäddad (base64) | Ingen egen gräns. Den räknas mot begäranskroppen på 32 MiB. | Varje endpoint som tar bilder eller filer | Status 413 för hela begäran. |
text i POST /v1/tokenize | 4,000,000 byte | /v1/tokenize | Status 413, typ invalid_request_error, meddelande text too long. |
messages i POST /v1/tokenize och kroppen i POST /v1/messages/count_tokens | Begäranskroppen på 32 MiB | Båda räkningsendpointsen | Status 413. |
| Kontextfönster | Per modell: context_window i GET /v1/models | Varje modell | Vad som händer med en längre konversation beror på modellen. Modeller och priser |
Webbsökningar (web_search: true) | Per plan och dag: Free 3, Plus 30, Standard 50, Pro 60. En sökning räknas för en begäran vars sökning gav resultat. | Begäranden som sätter web_search: true | När inga återstår besvaras begäran utan sökning. Inget fel. Inbyggd webbsökning |
Fel
Svaren på den här sidan. På /v1/messages är samma error-objekt inpackat som {"type": "error", "error": {…}}.
| Status | Typ | Meddelande | När, och vad du ska göra |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Begärans reservation ryms inte i din balans. Vänta till 00:00 UTC, fyll på kredit, byt plan, eller skicka ett mindre max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Fler än 120 begäranden under den aktuella minuten. Vänta N sekunder och skicka igen. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Shannon Coder-anropen för det aktuella 4-timmarsfönstret är förbrukade. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Modellen kan inte ta emot begäran just nu. Skicka den igen efter en kort paus. |
503 | api_error | Could not verify your quota right now. Please retry. | Din balans kunde inte läsas. Ingenting debiteras; skicka begäran igen. På /v1/responses med en Shannon-modell är statusen 500. |
413 | invalid_request_error | Begäranskroppen är större än 32 MiB. På endpoints i OpenAI-format bär error-objektet code: "request_too_large". | |
413 | invalid_request_error | text too long | text i POST /v1/tokenize är längre än 4,000,000 byte. |