Hoppa till innehållet
Gränser och balans

Gränser och balans

Varje begäran betjänas lika. Inga hastighetsnivåer. Ingen separat API-kvot. Du har redan betalat för dina tokens — använd dem så fort du vill.

Den här sidan förklarar vad din balans består av, vad en begäran reserverar och kostar, hur många begäranden du får skicka och de få gränser som en enskild begäran kan möta.

värdet av 1M tokens balans
$5.00
dagskvoten förnyas
00:00 UTC
flood protection, per konto
120 begäranden / min

Hur begäranden betjänas

  • Inga hastighetsnivåer — En regel begränsar hur snabbt begäranden får komma in, och den är densamma för varje konto och varje plan: 120 begäranden per minut. Det finns ingen gräns för tokens per minut.
  • Ingen separat API-kvot — API:et förbrukar samma balans som chatten. En plan bestämmer storleken på dagens kvot. Den bestämmer ingen begäranfrekvens.
  • Så fort du vill — Begäranden som skickas parallellt accepteras och väntar i kö. De avvisas inte för att de är parallella.

Din balans

Din balans räknas i tokens. 1,000,000 tokens av balans är värda $5.00, och varje pris på sidan Modeller och priser är ett pris i förhållande till det värdet.

Balansen är vid varje ögonblick summan av två delar.

  • Dagens plankvot — Ett antal tokens som bestäms av din plan. Det förnyas varje dag kl. 00:00 UTC. Det som är kvar vid dagens slut överförs inte.
  • Inköpt kredit — Tokens som du köpt som ett paket. Krediten går inte ut och fungerar på varje plan, även Free.
Plan Tokens per dag Värde
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Förbrukningsordning — Varje begäran förbrukar först dagens plankvot. Inköpt kredit används bara för det som går utöver kvoten den dagen.
  • Chatten och API:et delar den — Det finns en balans per konto. En API-nyckel förbrukar från balansen på det konto som äger den, till samma priser som i chatten.
  • Paket — Kredit säljs i paket om 1,000,000 ($5.00), 2,000,000 ($10.00) och 5,000,000 ($25.00) tokens, eller som ett valfritt belopp från 1,000,000 till 100,000,000 tokens för $5.00 per 1,000,000.

Fyll på kredit Byt plan

Vad en begäran reserverar och vad den kostar

  • Reservera — När en begäran kommer in reserverar den sin outputbudget från din balans: max_tokens på /v1/chat/completions och /v1/messages, max_output_tokens på /v1/responses. /v1/chat/completions läser även max_completion_tokens. Standardvärdet är 4,096 och intervallet är 1 till 65,536.
  • Godkänn — Begäran accepteras bara om reservationen ryms i det som återstår av din balans. En balans som är över noll men mindre än outputbudgeten får svaret Quota exceeded. Skicka ett mindre max_tokens för att använda resten.
  • Reglera — När svaret är klart ersätts reservationen av den verkliga debiteringen. Debiteringen kan vara lägre eller högre än reservationen.
  • Återlämna — En begäran som slutar med en felstatus lämnar tillbaka hela sin reservation.

Den verkliga debiteringen beror på modellfamiljen.

Modeller Vad som debiteras
Shannon-modeller usage.total_tokens till modellens pris per 1M. Input och output har samma pris.
Hostade open-weight-modeller Ocachad input till inputpriset, cachad input till cachepriset, output till outputpriset.

Beloppet i USD tas från din balans i tokens till $5.00 per 1,000,000, avrundat till en hel token.

Att räkna tokens med POST /v1/tokenize eller POST /v1/messages/count_tokens är gratis och reserverar ingenting. Tokenräkning

Var du ser balans och användning

Sidan Nycklar och användning visar vad du kan förbruka just nu, dagens plankvot, din inköpta kredit och API-förbrukningen de senaste 30 dagarna. Under den listas varje begäran som din nyckel har gjort: tid, endpoint, modell, cachad input, fakturerade tokens och kostnad. Nycklar och användning

Varje svar innehåller också ett usage-objekt med tokenräkningarna för anropet.

Endpoint Fält i usage Läggs till av hostade open-weight-modeller
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage innehåller modellens tokenräkningar. Det belopp som dras från din balans finns inte i svaret: det är kolumnen Debiterade tokens i begäranlistan på Nycklar och användning.
  • På /v1/messages med en hostad open-weight-modell är input_tokens den ocachade delen av inputen, cache_read_input_tokens är den cachade delen och cache_creation_input_tokens är alltid 0.
  • En ström på /v1/chat/completions bär usage i sin sista chunk före [DONE]. Streaming

När balansen tar slut

En begäran vars reservation inte ryms i din balans besvaras med status 429, typ rate_limit_error och meddelandet nedan. Ingenting debiteras. Samma svar skickas när balansen är över noll men mindre än begärans outputbudget.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

På /v1/responses kan error-objektet även innehålla code och param, båda null.

Det här kan du göra:

  • Vänta på nästa plankvot kl. 00:00 UTC.
  • Fyll på kredit. Krediten förbrukas efter plankvoten och går inte ut. Fyll på kredit
  • Byt till en plan med större daglig kvot. Byt plan
  • Skicka ett mindre max_tokens, om det finns någon balans kvar: reservationen blir då mindre.

Anropskvot för Shannon Coder

shannon-coder-1 på /v1/chat/completions och /v1/messages räknas i anrop, inte i tokens. Varje plan innehåller ett antal anrop per 4-timmarsfönster. En begäran är ett anrop.

Plan Anrop per 4-timmarsfönster
Free 3
Plus 20
Standard 40
Pro 60
  • Fönstren börjar kl. 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Anrop som är kvar vid ett fönsters slut överförs inte.
  • Ett anrop räknas när begäran accepteras, innan modellen svarar. En begäran som misslyckas därefter räknas ändå som ett anrop.
  • Dessa anrop reserverar inga tokens och tar ingenting från din balans. Begäranlistan under Nycklar och användning visar deras tokenantal och dess värde till listat pris.
  • Standardvärdet för max_tokens på shannon-coder-1 på dessa två endpoints är 65,536.
  • När inga anrop återstår är svaret status 429, typ rate_limit_error, meddelande Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • På /v1/responses har shannon-coder-1 ingen anropskvot: den debiteras i tokens från din balans till $8.00 per 1M, som alla andra modeller.

Flood protection

Ett konto får skicka 120 begäranden per minut. Det är den enda gränsen för begäranfrekvens, och den är densamma på alla planer. Den finns för att stoppa översvämningar, inte för att bromsa normal användning.

  • Minuten är ett fast fönster på 60 sekunder som öppnas med din första begäran. När det slutar börjar räkningen om från noll.
  • Räkningen sker per konto, inte per nyckel och inte per IP-adress. Att rotera nyckeln öppnar inget nytt fönster.
  • Den 121:a begäran inom ett fönster besvaras med status 429, typ rate_limit_error och meddelandet Too many requests. Retry in <N>s. N är antalet sekunder tills fönstret slutar, från 1 till 60.
  • Flood protection kontrolleras före balansen. En begäran som den avvisar reserverar ingenting och kostar ingenting.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Begäran Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Räknas, en per begäran.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Räknas inte.
shannon-coder-1 på /v1/chat/completions och /v1/messages Räknas i stället mot Shannon Coder-anropskvoten.
En begäran som besvaras med 401, eller med 400 för en okänd model Räknas inte.
En begäran som avvisas av flood protection Räknas mot fönstret. Ingenting debiteras.

Parallella begäranden

Det finns ingen gräns för hur många begäranden ett konto har öppna samtidigt, och inget fel för att skicka begäranden parallellt. Begäranden som inte kan starta direkt väntar i kö och besvaras i tur och ordning.

  • Varje begäran räknas mot de 120 per minut när den kommer in, oavsett om tidigare begäranden har blivit klara.
  • Varje begäran håller sin egen reservation tills den är slut. Tjugo öppna begäranden med standardbudgeten för output håller 20 × 4,096 = 81,920 tokens av balans. Om reservationerna tillsammans är större än din balans får nästa begäran svaret Quota exceeded, trots att de avslutade anropen hade kostat mindre. Ett mindre max_tokens håller mindre.
  • En begäran utan streaming skickar ingenting förrän svaret är klart, så ge din klient en timeout som täcker väntan. En ström håller sin anslutning öppen medan den väntar. Streaming

Gränser för en enskild begäran

Gräns Värde Gäller för Vid gränsen
Begäranskropp 32 MiB (33,554,432 byte) Varje endpoint Status 413, typ invalid_request_error.
Outputbudget: max_tokens, max_completion_tokens, max_output_tokens 1 till 65,536. Standard 4,096; för shannon-coder-1 på /v1/chat/completions och /v1/messages är standardvärdet 65,536. Varje modell, som det belopp som reserveras från din balans. Som gräns för svarets längd: de hostade open-weight-modellerna, shannon-1.6-lite, shannon-1.6-pro och shannon-coder-1. Ett värde utanför intervallet flyttas till närmaste ände av intervallet. Inget fel.
Stoppsekvenser: stop, stop_sequences 4 strängar Hostade open-weight-modeller De första 4 icke-tomma strängarna används.
Bild eller fil angiven som URL 8 MiB, läst inom 20 sekunder, högst 5 omdirigeringar, en offentlig http- eller https-adress Varje endpoint som tar bilder eller filer Begäran besvaras utan den delen. Inget fel.
Bild eller fil skickad inbäddad (base64) Ingen egen gräns. Den räknas mot begäranskroppen på 32 MiB. Varje endpoint som tar bilder eller filer Status 413 för hela begäran.
text i POST /v1/tokenize 4,000,000 byte /v1/tokenize Status 413, typ invalid_request_error, meddelande text too long.
messages i POST /v1/tokenize och kroppen i POST /v1/messages/count_tokens Begäranskroppen på 32 MiB Båda räkningsendpointsen Status 413.
Kontextfönster Per modell: context_window i GET /v1/models Varje modell Vad som händer med en längre konversation beror på modellen. Modeller och priser
Webbsökningar (web_search: true) Per plan och dag: Free 3, Plus 30, Standard 50, Pro 60. En sökning räknas för en begäran vars sökning gav resultat. Begäranden som sätter web_search: true När inga återstår besvaras begäran utan sökning. Inget fel. Inbyggd webbsökning

Fel

Svaren på den här sidan. På /v1/messages är samma error-objekt inpackat som {"type": "error", "error": {…}}.

Status Typ Meddelande När, och vad du ska göra
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Begärans reservation ryms inte i din balans. Vänta till 00:00 UTC, fyll på kredit, byt plan, eller skicka ett mindre max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Fler än 120 begäranden under den aktuella minuten. Vänta N sekunder och skicka igen.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Shannon Coder-anropen för det aktuella 4-timmarsfönstret är förbrukade.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Modellen kan inte ta emot begäran just nu. Skicka den igen efter en kort paus.
503 api_error Could not verify your quota right now. Please retry. Din balans kunde inte läsas. Ingenting debiteras; skicka begäran igen. På /v1/responses med en Shannon-modell är statusen 500.
413 invalid_request_error Begäranskroppen är större än 32 MiB. På endpoints i OpenAI-format bär error-objektet code: "request_too_large".
413 invalid_request_error text too long text i POST /v1/tokenize är längre än 4,000,000 byte.