Grenser og saldo
Hver forespørsel behandles likt. Ingen ratenivåer. Ingen egen API-kvote. Du har allerede betalt for tokens-ene dine — bruk dem så fort du vil.
Denne siden forklarer hva saldoen din består av, hva én forespørsel reserverer og koster, hvor mange forespørsler du kan sende, og de få grensene en enkelt forespørsel kan møte.
- verdi av 1M tokens saldo
- $5.00
- daglig kvote fornyes
- 00:00 UTC
- flood protection, per konto
- 120 forespørsler / min
Hvordan forespørsler behandles
- Ingen ratenivåer — Én regel begrenser hvor fort forespørsler kan komme inn, og den er lik for alle kontoer og alle planer: 120 forespørsler per minutt. Det er ingen grense for tokens per minutt.
- Ingen egen API-kvote — API-et bruker den samme saldoen som chat. En plan bestemmer størrelsen på dagens kvote. Den bestemmer ikke forespørselsraten.
- Så fort du vil — Forespørsler som sendes parallelt, aksepteres og venter i kø. De avvises ikke fordi de er parallelle.
Saldoen din
Saldoen din telles i tokens. 1,000,000 tokens saldo er verdt $5.00, og hver pris på siden Models & pricing er en sats mot denne verdien.
Til enhver tid er saldoen summen av to deler.
- Dagens plan-kvote — Et antall tokens bestemt av planen din. Det fornyes hver dag kl. 00:00 UTC. Det som er igjen ved slutten av dagen, overføres ikke.
- Kjøpt kreditt — Tokens du har kjøpt som en pakke. Kreditt utløper ikke og fungerer på alle planer, også Free.
| Plan | Tokens per dag | Verdi |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Rekkefølge for forbruk — Hver forespørsel bruker først dagens plan-kvote. Kjøpt kreditt brukes bare for det som går utover kvoten den dagen.
- Chat og API deler den — Det finnes én saldo per konto. En API-nøkkel bruker av saldoen til kontoen som eier den, til samme priser som i chat.
- Pakker — Kreditt selges i pakker på 1,000,000 ($5.00), 2,000,000 ($10.00) og 5,000,000 ($25.00) tokens, eller som et beløp du velger selv, fra 1,000,000 til 100,000,000 tokens, til $5.00 per 1,000,000.
Hva en forespørsel reserverer og hva den koster
- Reserver — Når en forespørsel kommer inn, reserverer den utdatabudsjettet sitt fra saldoen din:
max_tokenspå/v1/chat/completionsog/v1/messages,max_output_tokenspå/v1/responses./v1/chat/completionsleser ogsåmax_completion_tokens. Standardverdien er 4,096 og området er 1 til 65,536. - Godta — Forespørselen aksepteres bare hvis reservasjonen får plass i det som er igjen av saldoen din. En saldo som er over null, men mindre enn utdatabudsjettet, får svaret
Quota exceeded. Send en mindremax_tokensfor å bruke resten. - Avregn — Når svaret er fullført, erstattes reservasjonen av den faktiske belastningen. Belastningen kan være lavere eller høyere enn reservasjonen.
- Tilbakefør — En forespørsel som ender med en feilstatus, gir reservasjonen tilbake i sin helhet.
Den faktiske belastningen avhenger av modellfamilien.
| Modeller | Hva som belastes |
|---|---|
| Shannon-modeller | usage.total_tokens til modellens pris per 1M. Input og output har én sats. |
| Hostede åpne vektmodeller | Ucachet input til inputsatsen, cachet input til cachesatsen, output til outputsatsen. |
Beløpet i USD trekkes fra saldoen din i tokens til $5.00 per 1,000,000, rundet til et helt token.
Å telle tokens med POST /v1/tokenize eller POST /v1/messages/count_tokens er gratis og reserverer ingenting. Token-telling
Hvor du ser saldo og forbruk
Siden Keys & usage viser hva du kan bruke akkurat nå, dagens plan-kvote, den kjøpte kreditten din og API-forbruket de siste 30 dagene. Under det lister den hver forespørsel nøkkelen din har gjort: tid, endepunkt, modell, cachet input, fakturerte tokens og kostnad. Nøkler og bruk
Hvert svar har også et usage-objekt med tokenantallene for det kallet.
| Endepunkt | Felt i usage | Lagt til av hostede åpne vektmodeller |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageinneholder tokenantallene til modellen. Beløpet som trekkes fra saldoen din, står ikke i svaret: det er kolonnen Billed tokens i forespørselslisten på Keys & usage.- På
/v1/messagesmed en hostet åpen vektmodell erinput_tokensden ucachede delen av inputen,cache_read_input_tokenser den cachede delen, ogcache_creation_input_tokenser alltid0. - En strøm på
/v1/chat/completionsharusagei den siste chunken før[DONE]. Strømming
Når saldoen går tom
En forespørsel hvis reservasjon ikke får plass i saldoen din, besvares med status 429, type rate_limit_error og meldingen nedenfor. Ingenting belastes. Det samme svaret sendes når saldoen er over null, men mindre enn utdatabudsjettet til forespørselen.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} På /v1/responses kan error-objektet også inneholde code og param, begge null.
Dette kan du gjøre:
- Vent på neste plan-kvote kl. 00:00 UTC.
- Fyll på kreditt. Kreditt brukes etter plan-kvoten og utløper ikke. Fyll på kreditt
- Bytt til en plan med større daglig kvote. Bytt plan
- Send en mindre
max_tokenshvis det er noe saldo igjen: da blir reservasjonen mindre.
Kallkvote for Shannon Coder
shannon-coder-1 på /v1/chat/completions og /v1/messages telles i kall, ikke i tokens. Hver plan inkluderer et antall kall per 4-timersvindu. Én forespørsel er ett kall.
| Plan | Kall per 4-timersvindu |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Vinduene starter kl. 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Kall som er igjen ved slutten av et vindu, overføres ikke.
- Et kall telles når forespørselen aksepteres, før modellen svarer. En forespørsel som feiler etterpå, teller fortsatt som et kall.
- Disse kallene reserverer ingen tokens og trekker ingenting fra saldoen din. Forespørselslisten på Keys & usage viser tokenantallet deres og verdien til listepris.
- Standardverdien for
max_tokenstilshannon-coder-1på disse to endepunktene er 65,536. - Når det ikke er flere kall igjen, er svaret status
429, typerate_limit_error, meldingShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - På
/v1/responsesharshannon-coder-1ingen kallkvote: den belastes i tokens fra saldoen din til $8.00 per 1M, som alle andre modeller.
Flood protection
En konto kan sende 120 forespørsler per minutt. Det er den eneste grensen for forespørselsrate, og den er lik på alle planer. Den finnes for å stoppe oversvømmelser, ikke for å bremse vanlig bruk.
- Minuttet er et fast vindu på 60 sekunder som åpnes med den første forespørselen din. Når det slutter, starter tellingen på null igjen.
- Tellingen gjelder per konto, ikke per nøkkel og ikke per IP-adresse. Å bytte nøkkel åpner ikke et nytt vindu.
- Den 121. forespørselen i et vindu besvares med status
429, typerate_limit_errorog meldingenToo many requests. Retry in <N>s.Ner antall sekunder til vinduet slutter, fra 1 til 60. - Flood protection sjekkes før saldoen. En forespørsel den avviser, reserverer ingenting og koster ingenting.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Forespørsel | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Telles, én per forespørsel. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Telles ikke. |
shannon-coder-1 på /v1/chat/completions og /v1/messages | Telles i stedet av kallkvoten for Shannon Coder. |
En forespørsel besvart med 401, eller med 400 for en ukjent model | Telles ikke. |
| En forespørsel avvist av flood protection | Telles mot vinduet. Ingenting belastes. |
Parallelle forespørsler
Det er ingen grense for hvor mange forespørsler en konto kan ha åpne samtidig, og ingen feil for å sende forespørsler parallelt. Forespørsler som ikke kan starte med en gang, venter i kø og besvares etter tur.
- Hver forespørsel teller mot de 120 per minutt når den kommer inn, uavhengig av om tidligere forespørsler er ferdige.
- Hver forespørsel holder sin egen reservasjon til den er ferdig. Tjue åpne forespørsler med standard utdatabudsjett holder 20 × 4,096 = 81,920 tokens saldo. Hvis reservasjonene til sammen er større enn saldoen din, får neste forespørsel svaret
Quota exceeded, selv om de ferdige kallene ville kostet mindre. En mindremax_tokensholder mindre. - En forespørsel uten streaming sender ingenting før svaret er fullført, så gi klienten din en tidsgrense som dekker ventetiden. En strøm holder forbindelsen åpen mens den venter. Strømming
Grenser for en enkelt forespørsel
| Grense | Verdi | Gjelder for | Ved grensen |
|---|---|---|---|
| Forespørselskropp | 32 MiB (33,554,432 byte) | Alle endepunkter | Status 413, type invalid_request_error. |
Utdatabudsjett: max_tokens, max_completion_tokens, max_output_tokens | 1 til 65,536. Standard 4,096; for shannon-coder-1 på /v1/chat/completions og /v1/messages er standarden 65,536. | Alle modeller, som beløpet som reserveres fra saldoen din. Som grense for lengden på svaret: de hostede åpne vektmodellene, shannon-1.6-lite, shannon-1.6-pro og shannon-coder-1. | En verdi utenfor området flyttes til nærmeste ende av området. Ingen feil. |
Stoppsekvenser: stop, stop_sequences | 4 strenger | Hostede åpne vektmodeller | De første 4 ikke-tomme strengene brukes. |
| Bilde eller fil oppgitt som URL | 8 MiB, lest innen 20 sekunder, høyst 5 omdirigeringer, en offentlig http- eller https-adresse | Alle endepunkter som tar imot bilder eller filer | Forespørselen besvares uten den delen. Ingen feil. |
| Bilde eller fil sendt inline (base64) | Ingen egen grense. Det teller mot forespørselskroppen på 32 MiB. | Alle endepunkter som tar imot bilder eller filer | Status 413 for hele forespørselen. |
text i POST /v1/tokenize | 4,000,000 byte | /v1/tokenize | Status 413, type invalid_request_error, melding text too long. |
messages i POST /v1/tokenize og kroppen til POST /v1/messages/count_tokens | Forespørselskroppen på 32 MiB | Begge telleendepunktene | Status 413. |
| Kontekstvindu | Per modell: context_window i GET /v1/models | Alle modeller | Hva som skjer med en lengre samtale, avhenger av modellen. Modeller og priser |
Websøk (web_search: true) | Per plan og dag: Free 3, Plus 30, Standard 50, Pro 60. Ett søk telles for en forespørsel der søket ga treff. | Forespørsler som setter web_search: true | Når ingen er igjen, besvares forespørselen uten søk. Ingen feil. Innebygd websøk |
Feil
Svarene på denne siden. På /v1/messages er det samme error-objektet pakket inn som {"type": "error", "error": {…}}.
| Status | Type | Melding | Når, og hva du bør gjøre |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Reservasjonen til forespørselen får ikke plass i saldoen din. Vent til 00:00 UTC, fyll på kreditt, bytt plan, eller send en mindre max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Mer enn 120 forespørsler i inneværende minutt. Vent N sekunder og send på nytt. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Shannon Coder-kallene i det gjeldende 4-timersvinduet er brukt opp. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Modellen kan ikke ta imot forespørselen akkurat nå. Send den på nytt etter en kort pause. |
503 | api_error | Could not verify your quota right now. Please retry. | Saldoen din kunne ikke leses. Ingenting belastes; send forespørselen på nytt. På /v1/responses med en Shannon-modell er statusen 500. |
413 | invalid_request_error | Forespørselskroppen er større enn 32 MiB. På endepunktene i OpenAI-format har error-objektet code: "request_too_large". | |
413 | invalid_request_error | text too long | text i POST /v1/tokenize er lengre enn 4,000,000 byte. |