Limieten en saldo
Elke aanvraag wordt gelijk bediend. Geen rate tiers. Geen aparte API-quota. Je hebt je tokens al betaald — gebruik ze zo snel als je wilt.
Deze pagina legt uit waaruit je saldo bestaat, wat één aanvraag reserveert en kost, hoeveel aanvragen je mag versturen en de enkele limieten die één aanvraag kan tegenkomen.
- waarde van 1M tokens saldo
- $5.00
- dagelijkse limiet wordt vernieuwd
- 00:00 UTC
- flood protection, per account
- 120 aanvragen / min
Hoe aanvragen worden bediend
- Geen rate tiers — Eén regel beperkt hoe snel aanvragen mogen binnenkomen, en ze is voor elk account en elk plan gelijk: 120 aanvragen per minuut. Er is geen limiet op tokens per minuut.
- Geen aparte API-quota — De API gebruikt hetzelfde saldo als chat. Een plan bepaalt de grootte van de limiet van vandaag. Het bepaalt geen aanvraagsnelheid.
- Zo snel als je wilt — Aanvragen die parallel worden verstuurd, worden geaccepteerd en wachten in de rij. Ze worden niet geweigerd omdat ze parallel zijn.
Je saldo
Je saldo wordt in tokens geteld. 1,000,000 tokens saldo zijn $5.00 waard, en elke prijs op de pagina Modellen en prijzen is een tarief ten opzichte van die waarde.
Het saldo is op elk moment de som van twee delen.
- Planlimiet van vandaag — Een aantal tokens dat door je plan wordt bepaald. Het is elke dag om 00:00 UTC nieuw. Wat er aan het einde van een dag over is, wordt niet meegenomen.
- Aangeschaft credit — Tokens die je als pack hebt gekocht. Credit verloopt niet en werkt op elk plan, ook Free.
| Plan | Tokens per dag | Waard |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Volgorde van uitgeven — Elke aanvraag gebruikt eerst de planlimiet van vandaag. Aangeschaft credit wordt alleen gebruikt voor wat die dag boven de limiet uitkomt.
- Chat en API delen het — Er is één saldo per account. Een API-sleutel geeft uit van het saldo van het account dat hem bezit, tegen dezelfde prijzen als chat.
- Packs — Credit wordt verkocht in packs van 1,000,000 ($5.00), 2,000,000 ($10.00) en 5,000,000 ($25.00) tokens, of als bedrag naar keuze van 1,000,000 tot 100,000,000 tokens tegen $5.00 per 1,000,000.
Credits opwaarderen Plan wijzigen
Wat een aanvraag reserveert en wat ze kost
- Reserveren — Als een aanvraag binnenkomt, reserveert ze haar outputbudget van je saldo:
max_tokensop/v1/chat/completionsen/v1/messages,max_output_tokensop/v1/responses./v1/chat/completionsleest ookmax_completion_tokens. De standaardwaarde is 4,096 en het bereik is 1 tot 65,536. - Toelaten — De aanvraag wordt alleen geaccepteerd als de reservering in het resterende saldo past. Een saldo dat boven nul ligt maar kleiner is dan het outputbudget, krijgt het antwoord
Quota exceeded. Stuur een kleineremax_tokensom de rest te gebruiken. - Afrekenen — Zodra het antwoord compleet is, wordt de reservering vervangen door de echte kosten. De kosten kunnen lager of hoger zijn dan de reservering.
- Teruggeven — Een aanvraag die met een foutstatus eindigt, geeft haar reservering volledig terug.
De echte kosten hangen af van de modelfamilie.
| Modellen | Wat wordt gefactureerd |
|---|---|
| Shannon-modellen | usage.total_tokens tegen de prijs van het model per 1M. Input en output hebben één tarief. |
| Gehoste open-weight modellen | Niet-gecachte input tegen het inputtarief, gecachte input tegen het cachetarief, output tegen het outputtarief. |
Het bedrag in USD wordt van je saldo in tokens afgeschreven tegen $5.00 per 1,000,000, afgerond op een heel token.
Tokens tellen met POST /v1/tokenize of POST /v1/messages/count_tokens is gratis en reserveert niets. Tokens tellen
Waar je saldo en gebruik ziet
De pagina Sleutels en gebruik toont wat je nu kunt uitgeven, de planlimiet van vandaag, je aangeschafte credit en de API-uitgaven van de afgelopen 30 dagen. Daaronder staat elke aanvraag die je sleutel heeft gedaan: tijd, endpoint, model, gecachte input, gefactureerde tokens en kosten. Sleutels en gebruik
Elk antwoord bevat ook een usage-object met de tokentellingen van die call.
| Endpoint | Velden van usage | Toegevoegd door gehoste open-weight modellen |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagebevat de tokentellingen van het model. Het bedrag dat van je saldo wordt afgeschreven staat niet in het antwoord: het is de kolom Gefactureerde tokens van de aanvraaglijst op Sleutels en gebruik.- Op
/v1/messagesmet een gehost open-weight model isinput_tokenshet niet-gecachte deel van de input,cache_read_input_tokenshet gecachte deel encache_creation_input_tokensaltijd0. - Een stream op
/v1/chat/completionsbevatusagein zijn laatste chunk vóór[DONE]. Streaming
Als het saldo op is
Een aanvraag waarvan de reservering niet in je saldo past, wordt beantwoord met status 429, type rate_limit_error en het onderstaande bericht. Er wordt niets gefactureerd. Hetzelfde antwoord wordt verstuurd als het saldo boven nul ligt maar kleiner is dan het outputbudget van de aanvraag.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Op /v1/responses kan het error-object ook code en param bevatten, beide null.
Wat je kunt doen:
- Wacht op de volgende planlimiet om 00:00 UTC.
- Laad credit op. Credit wordt na de planlimiet uitgegeven en verloopt niet. Credits opwaarderen
- Stap over naar een plan met een grotere dagelijkse limiet. Plan wijzigen
- Stuur een kleinere
max_tokensals er nog saldo over is: de reservering is dan kleiner.
Shannon Coder-calllimiet
shannon-coder-1 op /v1/chat/completions en /v1/messages wordt in calls geteld, niet in tokens. Elk plan bevat een aantal calls per venster van 4 uur. Eén aanvraag is één call.
| Plan | Calls per venster van 4 uur |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Vensters beginnen om 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Calls die aan het einde van een venster over zijn, worden niet meegenomen.
- Een call wordt geteld op het moment dat de aanvraag wordt geaccepteerd, voordat het model antwoordt. Een aanvraag die daarna mislukt, telt nog steeds als call.
- Deze calls reserveren geen tokens en nemen niets van je saldo. De aanvraaglijst op Sleutels en gebruik toont hun aantal tokens en de waarde daarvan tegen de vermelde prijs.
- De standaard-
max_tokensvanshannon-coder-1op deze twee endpoints is 65,536. - Als er geen calls meer zijn, is het antwoord status
429, typerate_limit_error, berichtShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Op
/v1/responsesheeftshannon-coder-1geen calllimiet: het wordt in tokens van je saldo gefactureerd tegen $8.00 per 1M, zoals elk ander model.
Flood protection
Een account mag 120 aanvragen per minuut versturen. Dat is de enige limiet op de aanvraagsnelheid, en ze is voor elk plan gelijk. Ze bestaat om floods te stoppen, niet om normaal gebruik te vertragen.
- De minuut is een vast venster van 60 seconden dat opent met je eerste aanvraag. Als het eindigt, begint de telling weer bij nul.
- De telling geldt per account, niet per sleutel en niet per IP-adres. Het vernieuwen van de sleutel opent geen nieuw venster.
- De 121e aanvraag binnen een venster wordt beantwoord met status
429, typerate_limit_erroren het berichtToo many requests. Retry in <N>s.Nis het aantal seconden tot het venster eindigt, van 1 tot 60. - Flood protection wordt gecontroleerd vóór het saldo. Een aanvraag die het weigert, reserveert niets en kost niets.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Aanvraag | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Geteld, één per aanvraag. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Niet geteld. |
shannon-coder-1 op /v1/chat/completions en /v1/messages | In plaats daarvan geteld door de Shannon Coder-calllimiet. |
Een aanvraag die is beantwoord met 401, of met 400 voor een onbekend model | Niet geteld. |
| Een aanvraag die door flood protection is geweigerd | Geteld voor het venster. Er wordt niets gefactureerd. |
Parallelle aanvragen
Er is geen limiet op het aantal aanvragen dat een account tegelijk open heeft, en geen fout voor het parallel versturen van aanvragen. Aanvragen die niet direct kunnen starten, wachten in de rij en worden om de beurt beantwoord.
- Elke aanvraag telt mee voor de 120 per minuut op het moment dat ze binnenkomt, of eerdere aanvragen nu klaar zijn of niet.
- Elke aanvraag houdt haar eigen reservering vast tot ze eindigt. Twintig open aanvragen met het standaard outputbudget houden 20 × 4,096 = 81,920 tokens saldo vast. Als de reserveringen samen groter zijn dan je saldo, krijgt de volgende aanvraag het antwoord
Quota exceeded, ook al zouden de afgeronde calls minder hebben gekost. Een kleineremax_tokenshoudt minder vast. - Een aanvraag zonder streaming stuurt niets tot haar antwoord compleet is, dus geef je client een timeout die de wachttijd dekt. Een stream houdt zijn verbinding open terwijl hij wacht. Streaming
Limieten van één aanvraag
| Limiet | Waarde | Geldt voor | Bij de limiet |
|---|---|---|---|
| Request-body | 32 MiB (33,554,432 bytes) | Elk endpoint | Status 413, type invalid_request_error. |
Outputbudget: max_tokens, max_completion_tokens, max_output_tokens | 1 tot 65,536. Standaard 4,096; voor shannon-coder-1 op /v1/chat/completions en /v1/messages is de standaardwaarde 65,536. | Elk model, als het bedrag dat van je saldo wordt gereserveerd. Als limiet op de lengte van het antwoord: de gehoste open-weight modellen, shannon-1.6-lite, shannon-1.6-pro en shannon-coder-1. | Een waarde buiten het bereik wordt naar het dichtstbijzijnde uiteinde van het bereik verplaatst. Geen fout. |
Stopsequenties: stop, stop_sequences | 4 strings | Gehoste open-weight modellen | De eerste 4 niet-lege strings worden gebruikt. |
| Afbeelding of bestand opgegeven als URL | 8 MiB, binnen 20 seconden gelezen, maximaal 5 redirects, een openbaar http- of https-adres | Elk endpoint dat afbeeldingen of bestanden accepteert | De aanvraag wordt zonder dat onderdeel beantwoord. Geen fout. |
| Afbeelding of bestand inline verstuurd (base64) | Geen eigen limiet. Het telt mee voor de request-body van 32 MiB. | Elk endpoint dat afbeeldingen of bestanden accepteert | Status 413 voor de hele aanvraag. |
text van POST /v1/tokenize | 4,000,000 bytes | /v1/tokenize | Status 413, type invalid_request_error, bericht text too long. |
messages van POST /v1/tokenize en de body van POST /v1/messages/count_tokens | De request-body van 32 MiB | Beide telendpoints | Status 413. |
| Contextvenster | Per model: context_window in GET /v1/models | Elk model | Wat er met een langer gesprek gebeurt, hangt af van het model. Modellen en prijzen |
Websearches (web_search: true) | Per plan en dag: Free 3, Plus 30, Standard 50, Pro 60. Eén zoekopdracht wordt geteld voor een aanvraag waarvan de zoekopdracht resultaten vond. | Aanvragen die web_search: true instellen | Als er geen meer over zijn, wordt de aanvraag zonder zoekopdracht beantwoord. Geen fout. Ingebouwde webzoekopdracht |
Fouten
De antwoorden van deze pagina. Op /v1/messages wordt hetzelfde error-object verpakt als {"type": "error", "error": {…}}.
| Status | Type | Bericht | Wanneer, en wat te doen |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | De reservering van de aanvraag past niet in je saldo. Wacht tot 00:00 UTC, laad credit op, wijzig je plan of stuur een kleinere max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Meer dan 120 aanvragen in de huidige minuut. Wacht N seconden en verstuur opnieuw. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | De Shannon Coder-calls van het huidige venster van 4 uur zijn op. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Het model kan de aanvraag op dit moment niet aannemen. Verstuur haar opnieuw na een korte pauze. |
503 | api_error | Could not verify your quota right now. Please retry. | Je saldo kon niet worden gelezen. Er wordt niets gefactureerd; verstuur de aanvraag opnieuw. Op /v1/responses met een Shannon-model is de status 500. |
413 | invalid_request_error | De request-body is groter dan 32 MiB. Op de endpoints in het OpenAI-formaat bevat het error-object code: "request_too_large". | |
413 | invalid_request_error | text too long | text van POST /v1/tokenize is langer dan 4,000,000 bytes. |