Gå til indhold
Grænser og saldo

Grænser og saldo

Hver anmodning betjenes lige. Ingen hastighedsniveauer. Ingen separat API-kvote. Du har allerede betalt for dine tokens — brug dem så hurtigt, du vil.

Denne side forklarer, hvad din saldo består af, hvad én anmodning reserverer og koster, hvor mange anmodninger du må sende, og de få grænser, en enkelt anmodning kan møde.

værdi af 1M tokens af saldo
$5.00
daglig kvote fornyes
00:00 UTC
flood protection, per konto
120 anmodninger / min

Hvordan anmodninger betjenes

  • Ingen hastighedsniveauer — Én regel begrænser, hvor hurtigt anmodninger må ankomme, og den er den samme for alle konti og alle planer: 120 anmodninger per minut. Der er ingen grænse for tokens per minut.
  • Ingen separat API-kvote — API'et bruger den samme saldo som chat. En plan fastsætter størrelsen på dagens kvote. Den fastsætter ikke en anmodningshastighed.
  • Så hurtigt du vil — Anmodninger sendt parallelt accepteres og venter i kø. De afvises ikke for at være parallelle.

Din saldo

Din saldo tælles i tokens. 1,000,000 tokens af saldo er $5.00 værd, og hver pris på siden Modeller og priser er en takst i forhold til den værdi.

Til enhver tid er saldoen summen af to dele.

  • Dagens plan-kvote — Et antal tokens, der er fastsat af din plan. Det fornyes hver dag kl. 00:00 UTC. Det, der er tilbage ved dagens slutning, overføres ikke.
  • Købt kredit — Tokens, du har købt som en pakke. Kredit udløber ikke og virker på alle planer, også Free.
Plan Tokens per dag Værdi
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Rækkefølge for forbrug — Hver anmodning bruger først dagens plan-kvote. Købt kredit bruges kun til det, der går ud over kvoten den dag.
  • Chat og API deler den — Der er én saldo per konto. En API-nøgle bruger af saldoen på den konto, der ejer den, til de samme priser som chat.
  • Pakker — Kredit sælges i pakker på 1,000,000 ($5.00), 2,000,000 ($10.00) og 5,000,000 ($25.00) tokens eller som et beløb efter eget valg fra 1,000,000 til 100,000,000 tokens til $5.00 per 1,000,000.

Opfyld kredit Skift plan

Hvad en anmodning reserverer, og hvad den koster

  • Reserver — Når en anmodning ankommer, reserverer den sit outputbudget fra din saldo: max_tokens på /v1/chat/completions og /v1/messages, max_output_tokens på /v1/responses. /v1/chat/completions læser også max_completion_tokens. Standardværdien er 4,096, og intervallet er 1 til 65,536.
  • Accept — Anmodningen accepteres kun, hvis reservationen kan rummes i det, der er tilbage af din saldo. En saldo, der er over nul, men mindre end outputbudgettet, får svaret Quota exceeded. Send en mindre max_tokens for at bruge resten.
  • Afregn — Når svaret er færdigt, erstattes reservationen af den reelle afregning. Afregningen kan være lavere eller højere end reservationen.
  • Tilbagefør — En anmodning, der ender med en fejlstatus, giver sin reservation tilbage i fuld størrelse.

Den reelle afregning afhænger af modelfamilien.

Modeller Hvad der afregnes
Shannon-modeller usage.total_tokens til modellens pris per 1M. Input og output har én takst.
Hostede open-weight-modeller Ikke-cached input til inputtaksten, cached input til cachetaksten, output til outputtaksten.

Beløbet i USD trækkes fra din saldo i tokens til $5.00 per 1,000,000, rundet til en hel token.

Tælling af tokens med POST /v1/tokenize eller POST /v1/messages/count_tokens er gratis og reserverer intet. Tælling af tokens

Hvor du ser saldo og forbrug

Siden Nøgler og forbrug viser, hvad du kan bruge lige nu, dagens plan-kvote, din købte kredit og API-forbruget de seneste 30 dage. Under det står hver anmodning, din nøgle har foretaget: tidspunkt, endpoint, model, cached input, afregnede tokens og omkostninger. Nøgler og forbrug

Hvert svar indeholder også et usage-objekt med token-tællingerne for det kald.

Endpoint Felter i usage Tilføjet af hostede open-weight-modeller
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage indeholder modellens token-tællinger. Det beløb, der trækkes fra din saldo, står ikke i svaret: det er kolonnen Afregnede tokens i anmodningslisten under Nøgler og forbrug.
  • På /v1/messages med en hostet open-weight-model er input_tokens den ikke-cached del af inputtet, cache_read_input_tokens er den cached del, og cache_creation_input_tokens er altid 0.
  • En stream på /v1/chat/completions har usage i sit sidste chunk før [DONE]. Streaming

Når saldoen løber tør

En anmodning, hvis reservation ikke kan rummes i din saldo, besvares med status 429, type rate_limit_error og beskeden nedenfor. Der afregnes intet. Det samme svar sendes, når saldoen er over nul, men mindre end anmodningens outputbudget.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

På /v1/responses kan error-objektet også indeholde code og param, begge null.

Det kan du gøre:

  • Vent på næste plan-kvote kl. 00:00 UTC.
  • Opfyld kredit. Kredit bruges efter plan-kvoten og udløber ikke. Opfyld kredit
  • Skift til en plan med en større daglig kvote. Skift plan
  • Send en mindre max_tokens, hvis der er noget saldo tilbage: så er reservationen mindre.

Shannon Coders kaldkvote

shannon-coder-1 på /v1/chat/completions og /v1/messages tælles i kald, ikke i tokens. Hver plan indeholder et antal kald per 4-timers vindue. Én anmodning er ét kald.

Plan Kald per 4-timers vindue
Free 3
Plus 20
Standard 40
Pro 60
  • Vinduer starter kl. 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Kald, der er tilbage ved vinduets slutning, overføres ikke.
  • Et kald tælles, når anmodningen accepteres, før modellen svarer. En anmodning, der fejler bagefter, tæller stadig som et kald.
  • Disse kald reserverer ingen tokens og trækker intet fra din saldo. Anmodningslisten under Nøgler og forbrug viser deres antal tokens og værdien til den opførte pris.
  • Standardværdien af max_tokens er 65,536 for modellen shannon-coder-1 i begge disse endpoints.
  • Når der ikke er flere kald, er svaret status 429, type rate_limit_error, besked Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • På /v1/responses har shannon-coder-1 ingen kaldkvote: den afregnes i tokens fra din saldo til $8.00 per 1M, som alle andre modeller.

Flood protection

En konto må sende 120 anmodninger per minut. Det er den eneste grænse for anmodningshastighed, og den er den samme på alle planer. Den findes for at stoppe oversvømmelser, ikke for at bremse almindelig brug.

  • Minuttet er et fast vindue på 60 sekunder, der åbner med din første anmodning. Når det slutter, starter tællingen igen fra nul.
  • Tællingen er per konto, ikke per nøgle og ikke per IP-adresse. Roterer du nøglen, åbner det ikke et nyt vindue.
  • Den 121. anmodning inden for et vindue besvares med status 429, type rate_limit_error og beskeden Too many requests. Retry in <N>s. N er antallet af sekunder, til vinduet slutter, fra 1 til 60.
  • Flood protection kontrolleres før saldoen. En anmodning, den afviser, reserverer intet og koster intet.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Anmodning Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Tælles, én per anmodning.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Tælles ikke.
shannon-coder-1 på /v1/chat/completions og /v1/messages Tælles i stedet af Shannon Coders kaldkvote.
En anmodning besvaret med 401 eller med 400 for en ukendt model Tælles ikke.
En anmodning afvist af flood protection Tælles med i vinduet. Der afregnes intet.

Parallelle anmodninger

Der er ingen grænse for, hvor mange anmodninger en konto har åbne på samme tid, og ingen fejl for at sende anmodninger parallelt. Anmodninger, der ikke kan starte med det samme, venter i kø og besvares efter tur.

  • Hver anmodning tæller med i de 120 per minut, når den ankommer, uanset om tidligere anmodninger er færdige.
  • Hver anmodning holder sin egen reservation, til den slutter. Tyve åbne anmodninger med standardoutputbudgettet holder 20 × 4,096 = 81,920 tokens af saldo. Hvis reservationerne tilsammen er større end din saldo, får den næste anmodning svaret Quota exceeded, selv om de færdige kald ville have kostet mindre. En mindre max_tokens holder mindre.
  • En anmodning uden streaming sender intet, før svaret er færdigt, så giv din klient en timeout, der dækker ventetiden. En stream holder sin forbindelse åben, mens den venter. Streaming

Grænser for en enkelt anmodning

Grænse Værdi Gælder for Ved grænsen
Anmodningens body 32 MiB (33,554,432 bytes) Alle endpoints Status 413, type invalid_request_error.
Outputbudget: max_tokens, max_completion_tokens, max_output_tokens 1 til 65,536. Standard 4,096; for shannon-coder-1 på /v1/chat/completions og /v1/messages er standarden 65,536. Alle modeller, som det beløb der reserveres fra din saldo. Som grænse for svarets længde: de hostede open-weight-modeller, shannon-1.6-lite, shannon-1.6-pro og shannon-coder-1. En værdi uden for intervallet flyttes til den nærmeste ende af intervallet. Ingen fejl.
Stopsekvenser: stop, stop_sequences 4 strenge Hostede open-weight-modeller De første 4 ikke-tomme strenge bruges.
Billede eller fil angivet som en URL 8 MiB, læst inden for 20 sekunder, højst 5 omdirigeringer, en offentlig http- eller https-adresse Alle endpoints, der tager imod billeder eller filer Anmodningen besvares uden den del. Ingen fejl.
Billede eller fil sendt inline (base64) Ingen egen grænse. Det tæller med i anmodningens body på 32 MiB. Alle endpoints, der tager imod billeder eller filer Status 413 for hele anmodningen.
text i POST /v1/tokenize 4,000,000 bytes /v1/tokenize Status 413, type invalid_request_error, besked text too long.
messages i POST /v1/tokenize og body i POST /v1/messages/count_tokens Anmodningens body på 32 MiB Begge tælle-endpoints Status 413.
Kontekstvindue Per model: context_window i GET /v1/models Alle modeller Hvad der sker med en længere samtale, afhænger af modellen. Modeller og priser
Websøgninger (web_search: true) Per plan og dag: Free 3, Plus 30, Standard 50, Pro 60. Én søgning tælles for en anmodning, hvor søgningen fandt resultater. Anmodninger, der sætter web_search: true Når der ikke er flere tilbage, besvares anmodningen uden søgning. Ingen fejl. Indbygget websøgning

Fejl

Svarene på denne side. På /v1/messages er det samme error-objekt pakket ind som {"type": "error", "error": {…}}.

Status Type Besked Hvornår, og hvad du skal gøre
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Anmodningens reservation kan ikke rummes i din saldo. Vent til 00:00 UTC, opfyld kredit, skift plan, eller send en mindre max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Mere end 120 anmodninger i det nuværende minut. Vent N sekunder, og send igen.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Shannon Coder-kaldene i det nuværende 4-timers vindue er brugt op.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Modellen kan ikke tage imod anmodningen lige nu. Send den igen efter en kort pause.
503 api_error Could not verify your quota right now. Please retry. Din saldo kunne ikke læses. Der afregnes intet; send anmodningen igen. På /v1/responses med en Shannon-model er statussen 500.
413 invalid_request_error Anmodningens body er større end 32 MiB. På OpenAI-format-endpointsene indeholder error-objektet code: "request_too_large".
413 invalid_request_error text too long text i POST /v1/tokenize er længere end 4,000,000 bytes.