Hopp til innholdet
Grenser og saldo

Grenser og saldo

Hver forespørsel behandles likt. Ingen ratenivåer. Ingen egen API-kvote. Du har allerede betalt for tokens-ene dine — bruk dem så fort du vil.

Denne siden forklarer hva saldoen din består av, hva én forespørsel reserverer og koster, hvor mange forespørsler du kan sende, og de få grensene en enkelt forespørsel kan møte.

verdi av 1M tokens saldo
$5.00
daglig kvote fornyes
00:00 UTC
flood protection, per konto
120 forespørsler / min

Hvordan forespørsler behandles

  • Ingen ratenivåer — Én regel begrenser hvor fort forespørsler kan komme inn, og den er lik for alle kontoer og alle planer: 120 forespørsler per minutt. Det er ingen grense for tokens per minutt.
  • Ingen egen API-kvote — API-et bruker den samme saldoen som chat. En plan bestemmer størrelsen på dagens kvote. Den bestemmer ikke forespørselsraten.
  • Så fort du vil — Forespørsler som sendes parallelt, aksepteres og venter i kø. De avvises ikke fordi de er parallelle.

Saldoen din

Saldoen din telles i tokens. 1,000,000 tokens saldo er verdt $5.00, og hver pris på siden Models & pricing er en sats mot denne verdien.

Til enhver tid er saldoen summen av to deler.

  • Dagens plan-kvote — Et antall tokens bestemt av planen din. Det fornyes hver dag kl. 00:00 UTC. Det som er igjen ved slutten av dagen, overføres ikke.
  • Kjøpt kreditt — Tokens du har kjøpt som en pakke. Kreditt utløper ikke og fungerer på alle planer, også Free.
Plan Tokens per dag Verdi
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Rekkefølge for forbruk — Hver forespørsel bruker først dagens plan-kvote. Kjøpt kreditt brukes bare for det som går utover kvoten den dagen.
  • Chat og API deler den — Det finnes én saldo per konto. En API-nøkkel bruker av saldoen til kontoen som eier den, til samme priser som i chat.
  • Pakker — Kreditt selges i pakker på 1,000,000 ($5.00), 2,000,000 ($10.00) og 5,000,000 ($25.00) tokens, eller som et beløp du velger selv, fra 1,000,000 til 100,000,000 tokens, til $5.00 per 1,000,000.

Fyll på kreditt Bytt plan

Hva en forespørsel reserverer og hva den koster

  • Reserver — Når en forespørsel kommer inn, reserverer den utdatabudsjettet sitt fra saldoen din: max_tokens på /v1/chat/completions og /v1/messages, max_output_tokens på /v1/responses. /v1/chat/completions leser også max_completion_tokens. Standardverdien er 4,096 og området er 1 til 65,536.
  • Godta — Forespørselen aksepteres bare hvis reservasjonen får plass i det som er igjen av saldoen din. En saldo som er over null, men mindre enn utdatabudsjettet, får svaret Quota exceeded. Send en mindre max_tokens for å bruke resten.
  • Avregn — Når svaret er fullført, erstattes reservasjonen av den faktiske belastningen. Belastningen kan være lavere eller høyere enn reservasjonen.
  • Tilbakefør — En forespørsel som ender med en feilstatus, gir reservasjonen tilbake i sin helhet.

Den faktiske belastningen avhenger av modellfamilien.

Modeller Hva som belastes
Shannon-modeller usage.total_tokens til modellens pris per 1M. Input og output har én sats.
Hostede åpne vektmodeller Ucachet input til inputsatsen, cachet input til cachesatsen, output til outputsatsen.

Beløpet i USD trekkes fra saldoen din i tokens til $5.00 per 1,000,000, rundet til et helt token.

Å telle tokens med POST /v1/tokenize eller POST /v1/messages/count_tokens er gratis og reserverer ingenting. Token-telling

Hvor du ser saldo og forbruk

Siden Keys & usage viser hva du kan bruke akkurat nå, dagens plan-kvote, den kjøpte kreditten din og API-forbruket de siste 30 dagene. Under det lister den hver forespørsel nøkkelen din har gjort: tid, endepunkt, modell, cachet input, fakturerte tokens og kostnad. Nøkler og bruk

Hvert svar har også et usage-objekt med tokenantallene for det kallet.

Endepunkt Felt i usage Lagt til av hostede åpne vektmodeller
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage inneholder tokenantallene til modellen. Beløpet som trekkes fra saldoen din, står ikke i svaret: det er kolonnen Billed tokens i forespørselslisten på Keys & usage.
  • På /v1/messages med en hostet åpen vektmodell er input_tokens den ucachede delen av inputen, cache_read_input_tokens er den cachede delen, og cache_creation_input_tokens er alltid 0.
  • En strøm på /v1/chat/completions har usage i den siste chunken før [DONE]. Strømming

Når saldoen går tom

En forespørsel hvis reservasjon ikke får plass i saldoen din, besvares med status 429, type rate_limit_error og meldingen nedenfor. Ingenting belastes. Det samme svaret sendes når saldoen er over null, men mindre enn utdatabudsjettet til forespørselen.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

På /v1/responses kan error-objektet også inneholde code og param, begge null.

Dette kan du gjøre:

  • Vent på neste plan-kvote kl. 00:00 UTC.
  • Fyll på kreditt. Kreditt brukes etter plan-kvoten og utløper ikke. Fyll på kreditt
  • Bytt til en plan med større daglig kvote. Bytt plan
  • Send en mindre max_tokens hvis det er noe saldo igjen: da blir reservasjonen mindre.

Kallkvote for Shannon Coder

shannon-coder-1 på /v1/chat/completions og /v1/messages telles i kall, ikke i tokens. Hver plan inkluderer et antall kall per 4-timersvindu. Én forespørsel er ett kall.

Plan Kall per 4-timersvindu
Free 3
Plus 20
Standard 40
Pro 60
  • Vinduene starter kl. 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Kall som er igjen ved slutten av et vindu, overføres ikke.
  • Et kall telles når forespørselen aksepteres, før modellen svarer. En forespørsel som feiler etterpå, teller fortsatt som et kall.
  • Disse kallene reserverer ingen tokens og trekker ingenting fra saldoen din. Forespørselslisten på Keys & usage viser tokenantallet deres og verdien til listepris.
  • Standardverdien for max_tokens til shannon-coder-1 på disse to endepunktene er 65,536.
  • Når det ikke er flere kall igjen, er svaret status 429, type rate_limit_error, melding Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • På /v1/responses har shannon-coder-1 ingen kallkvote: den belastes i tokens fra saldoen din til $8.00 per 1M, som alle andre modeller.

Flood protection

En konto kan sende 120 forespørsler per minutt. Det er den eneste grensen for forespørselsrate, og den er lik på alle planer. Den finnes for å stoppe oversvømmelser, ikke for å bremse vanlig bruk.

  • Minuttet er et fast vindu på 60 sekunder som åpnes med den første forespørselen din. Når det slutter, starter tellingen på null igjen.
  • Tellingen gjelder per konto, ikke per nøkkel og ikke per IP-adresse. Å bytte nøkkel åpner ikke et nytt vindu.
  • Den 121. forespørselen i et vindu besvares med status 429, type rate_limit_error og meldingen Too many requests. Retry in <N>s. N er antall sekunder til vinduet slutter, fra 1 til 60.
  • Flood protection sjekkes før saldoen. En forespørsel den avviser, reserverer ingenting og koster ingenting.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Forespørsel Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Telles, én per forespørsel.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Telles ikke.
shannon-coder-1 på /v1/chat/completions og /v1/messages Telles i stedet av kallkvoten for Shannon Coder.
En forespørsel besvart med 401, eller med 400 for en ukjent model Telles ikke.
En forespørsel avvist av flood protection Telles mot vinduet. Ingenting belastes.

Parallelle forespørsler

Det er ingen grense for hvor mange forespørsler en konto kan ha åpne samtidig, og ingen feil for å sende forespørsler parallelt. Forespørsler som ikke kan starte med en gang, venter i kø og besvares etter tur.

  • Hver forespørsel teller mot de 120 per minutt når den kommer inn, uavhengig av om tidligere forespørsler er ferdige.
  • Hver forespørsel holder sin egen reservasjon til den er ferdig. Tjue åpne forespørsler med standard utdatabudsjett holder 20 × 4,096 = 81,920 tokens saldo. Hvis reservasjonene til sammen er større enn saldoen din, får neste forespørsel svaret Quota exceeded, selv om de ferdige kallene ville kostet mindre. En mindre max_tokens holder mindre.
  • En forespørsel uten streaming sender ingenting før svaret er fullført, så gi klienten din en tidsgrense som dekker ventetiden. En strøm holder forbindelsen åpen mens den venter. Strømming

Grenser for en enkelt forespørsel

Grense Verdi Gjelder for Ved grensen
Forespørselskropp 32 MiB (33,554,432 byte) Alle endepunkter Status 413, type invalid_request_error.
Utdatabudsjett: max_tokens, max_completion_tokens, max_output_tokens 1 til 65,536. Standard 4,096; for shannon-coder-1 på /v1/chat/completions og /v1/messages er standarden 65,536. Alle modeller, som beløpet som reserveres fra saldoen din. Som grense for lengden på svaret: de hostede åpne vektmodellene, shannon-1.6-lite, shannon-1.6-pro og shannon-coder-1. En verdi utenfor området flyttes til nærmeste ende av området. Ingen feil.
Stoppsekvenser: stop, stop_sequences 4 strenger Hostede åpne vektmodeller De første 4 ikke-tomme strengene brukes.
Bilde eller fil oppgitt som URL 8 MiB, lest innen 20 sekunder, høyst 5 omdirigeringer, en offentlig http- eller https-adresse Alle endepunkter som tar imot bilder eller filer Forespørselen besvares uten den delen. Ingen feil.
Bilde eller fil sendt inline (base64) Ingen egen grense. Det teller mot forespørselskroppen på 32 MiB. Alle endepunkter som tar imot bilder eller filer Status 413 for hele forespørselen.
text i POST /v1/tokenize 4,000,000 byte /v1/tokenize Status 413, type invalid_request_error, melding text too long.
messages i POST /v1/tokenize og kroppen til POST /v1/messages/count_tokens Forespørselskroppen på 32 MiB Begge telleendepunktene Status 413.
Kontekstvindu Per modell: context_window i GET /v1/models Alle modeller Hva som skjer med en lengre samtale, avhenger av modellen. Modeller og priser
Websøk (web_search: true) Per plan og dag: Free 3, Plus 30, Standard 50, Pro 60. Ett søk telles for en forespørsel der søket ga treff. Forespørsler som setter web_search: true Når ingen er igjen, besvares forespørselen uten søk. Ingen feil. Innebygd websøk

Feil

Svarene på denne siden. På /v1/messages er det samme error-objektet pakket inn som {"type": "error", "error": {…}}.

Status Type Melding Når, og hva du bør gjøre
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Reservasjonen til forespørselen får ikke plass i saldoen din. Vent til 00:00 UTC, fyll på kreditt, bytt plan, eller send en mindre max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Mer enn 120 forespørsler i inneværende minutt. Vent N sekunder og send på nytt.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Shannon Coder-kallene i det gjeldende 4-timersvinduet er brukt opp.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Modellen kan ikke ta imot forespørselen akkurat nå. Send den på nytt etter en kort pause.
503 api_error Could not verify your quota right now. Please retry. Saldoen din kunne ikke leses. Ingenting belastes; send forespørselen på nytt. På /v1/responses med en Shannon-modell er statusen 500.
413 invalid_request_error Forespørselskroppen er større enn 32 MiB. På endepunktene i OpenAI-format har error-objektet code: "request_too_large".
413 invalid_request_error text too long text i POST /v1/tokenize er lengre enn 4,000,000 byte.