Naar de inhoud
Limieten en saldo

Limieten en saldo

Elke aanvraag wordt gelijk bediend. Geen rate tiers. Geen aparte API-quota. Je hebt je tokens al betaald — gebruik ze zo snel als je wilt.

Deze pagina legt uit waaruit je saldo bestaat, wat één aanvraag reserveert en kost, hoeveel aanvragen je mag versturen en de enkele limieten die één aanvraag kan tegenkomen.

waarde van 1M tokens saldo
$5.00
dagelijkse limiet wordt vernieuwd
00:00 UTC
flood protection, per account
120 aanvragen / min

Hoe aanvragen worden bediend

  • Geen rate tiers — Eén regel beperkt hoe snel aanvragen mogen binnenkomen, en ze is voor elk account en elk plan gelijk: 120 aanvragen per minuut. Er is geen limiet op tokens per minuut.
  • Geen aparte API-quota — De API gebruikt hetzelfde saldo als chat. Een plan bepaalt de grootte van de limiet van vandaag. Het bepaalt geen aanvraagsnelheid.
  • Zo snel als je wilt — Aanvragen die parallel worden verstuurd, worden geaccepteerd en wachten in de rij. Ze worden niet geweigerd omdat ze parallel zijn.

Je saldo

Je saldo wordt in tokens geteld. 1,000,000 tokens saldo zijn $5.00 waard, en elke prijs op de pagina Modellen en prijzen is een tarief ten opzichte van die waarde.

Het saldo is op elk moment de som van twee delen.

  • Planlimiet van vandaag — Een aantal tokens dat door je plan wordt bepaald. Het is elke dag om 00:00 UTC nieuw. Wat er aan het einde van een dag over is, wordt niet meegenomen.
  • Aangeschaft credit — Tokens die je als pack hebt gekocht. Credit verloopt niet en werkt op elk plan, ook Free.
Plan Tokens per dag Waard
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Volgorde van uitgeven — Elke aanvraag gebruikt eerst de planlimiet van vandaag. Aangeschaft credit wordt alleen gebruikt voor wat die dag boven de limiet uitkomt.
  • Chat en API delen het — Er is één saldo per account. Een API-sleutel geeft uit van het saldo van het account dat hem bezit, tegen dezelfde prijzen als chat.
  • Packs — Credit wordt verkocht in packs van 1,000,000 ($5.00), 2,000,000 ($10.00) en 5,000,000 ($25.00) tokens, of als bedrag naar keuze van 1,000,000 tot 100,000,000 tokens tegen $5.00 per 1,000,000.

Credits opwaarderen Plan wijzigen

Wat een aanvraag reserveert en wat ze kost

  • Reserveren — Als een aanvraag binnenkomt, reserveert ze haar outputbudget van je saldo: max_tokens op /v1/chat/completions en /v1/messages, max_output_tokens op /v1/responses. /v1/chat/completions leest ook max_completion_tokens. De standaardwaarde is 4,096 en het bereik is 1 tot 65,536.
  • Toelaten — De aanvraag wordt alleen geaccepteerd als de reservering in het resterende saldo past. Een saldo dat boven nul ligt maar kleiner is dan het outputbudget, krijgt het antwoord Quota exceeded. Stuur een kleinere max_tokens om de rest te gebruiken.
  • Afrekenen — Zodra het antwoord compleet is, wordt de reservering vervangen door de echte kosten. De kosten kunnen lager of hoger zijn dan de reservering.
  • Teruggeven — Een aanvraag die met een foutstatus eindigt, geeft haar reservering volledig terug.

De echte kosten hangen af van de modelfamilie.

Modellen Wat wordt gefactureerd
Shannon-modellen usage.total_tokens tegen de prijs van het model per 1M. Input en output hebben één tarief.
Gehoste open-weight modellen Niet-gecachte input tegen het inputtarief, gecachte input tegen het cachetarief, output tegen het outputtarief.

Het bedrag in USD wordt van je saldo in tokens afgeschreven tegen $5.00 per 1,000,000, afgerond op een heel token.

Tokens tellen met POST /v1/tokenize of POST /v1/messages/count_tokens is gratis en reserveert niets. Tokens tellen

Waar je saldo en gebruik ziet

De pagina Sleutels en gebruik toont wat je nu kunt uitgeven, de planlimiet van vandaag, je aangeschafte credit en de API-uitgaven van de afgelopen 30 dagen. Daaronder staat elke aanvraag die je sleutel heeft gedaan: tijd, endpoint, model, gecachte input, gefactureerde tokens en kosten. Sleutels en gebruik

Elk antwoord bevat ook een usage-object met de tokentellingen van die call.

Endpoint Velden van usage Toegevoegd door gehoste open-weight modellen
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage bevat de tokentellingen van het model. Het bedrag dat van je saldo wordt afgeschreven staat niet in het antwoord: het is de kolom Gefactureerde tokens van de aanvraaglijst op Sleutels en gebruik.
  • Op /v1/messages met een gehost open-weight model is input_tokens het niet-gecachte deel van de input, cache_read_input_tokens het gecachte deel en cache_creation_input_tokens altijd 0.
  • Een stream op /v1/chat/completions bevat usage in zijn laatste chunk vóór [DONE]. Streaming

Als het saldo op is

Een aanvraag waarvan de reservering niet in je saldo past, wordt beantwoord met status 429, type rate_limit_error en het onderstaande bericht. Er wordt niets gefactureerd. Hetzelfde antwoord wordt verstuurd als het saldo boven nul ligt maar kleiner is dan het outputbudget van de aanvraag.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Op /v1/responses kan het error-object ook code en param bevatten, beide null.

Wat je kunt doen:

  • Wacht op de volgende planlimiet om 00:00 UTC.
  • Laad credit op. Credit wordt na de planlimiet uitgegeven en verloopt niet. Credits opwaarderen
  • Stap over naar een plan met een grotere dagelijkse limiet. Plan wijzigen
  • Stuur een kleinere max_tokens als er nog saldo over is: de reservering is dan kleiner.

Shannon Coder-calllimiet

shannon-coder-1 op /v1/chat/completions en /v1/messages wordt in calls geteld, niet in tokens. Elk plan bevat een aantal calls per venster van 4 uur. Eén aanvraag is één call.

Plan Calls per venster van 4 uur
Free 3
Plus 20
Standard 40
Pro 60
  • Vensters beginnen om 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Calls die aan het einde van een venster over zijn, worden niet meegenomen.
  • Een call wordt geteld op het moment dat de aanvraag wordt geaccepteerd, voordat het model antwoordt. Een aanvraag die daarna mislukt, telt nog steeds als call.
  • Deze calls reserveren geen tokens en nemen niets van je saldo. De aanvraaglijst op Sleutels en gebruik toont hun aantal tokens en de waarde daarvan tegen de vermelde prijs.
  • De standaard-max_tokens van shannon-coder-1 op deze twee endpoints is 65,536.
  • Als er geen calls meer zijn, is het antwoord status 429, type rate_limit_error, bericht Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Op /v1/responses heeft shannon-coder-1 geen calllimiet: het wordt in tokens van je saldo gefactureerd tegen $8.00 per 1M, zoals elk ander model.

Flood protection

Een account mag 120 aanvragen per minuut versturen. Dat is de enige limiet op de aanvraagsnelheid, en ze is voor elk plan gelijk. Ze bestaat om floods te stoppen, niet om normaal gebruik te vertragen.

  • De minuut is een vast venster van 60 seconden dat opent met je eerste aanvraag. Als het eindigt, begint de telling weer bij nul.
  • De telling geldt per account, niet per sleutel en niet per IP-adres. Het vernieuwen van de sleutel opent geen nieuw venster.
  • De 121e aanvraag binnen een venster wordt beantwoord met status 429, type rate_limit_error en het bericht Too many requests. Retry in <N>s. N is het aantal seconden tot het venster eindigt, van 1 tot 60.
  • Flood protection wordt gecontroleerd vóór het saldo. Een aanvraag die het weigert, reserveert niets en kost niets.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Aanvraag Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Geteld, één per aanvraag.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Niet geteld.
shannon-coder-1 op /v1/chat/completions en /v1/messages In plaats daarvan geteld door de Shannon Coder-calllimiet.
Een aanvraag die is beantwoord met 401, of met 400 voor een onbekend model Niet geteld.
Een aanvraag die door flood protection is geweigerd Geteld voor het venster. Er wordt niets gefactureerd.

Parallelle aanvragen

Er is geen limiet op het aantal aanvragen dat een account tegelijk open heeft, en geen fout voor het parallel versturen van aanvragen. Aanvragen die niet direct kunnen starten, wachten in de rij en worden om de beurt beantwoord.

  • Elke aanvraag telt mee voor de 120 per minuut op het moment dat ze binnenkomt, of eerdere aanvragen nu klaar zijn of niet.
  • Elke aanvraag houdt haar eigen reservering vast tot ze eindigt. Twintig open aanvragen met het standaard outputbudget houden 20 × 4,096 = 81,920 tokens saldo vast. Als de reserveringen samen groter zijn dan je saldo, krijgt de volgende aanvraag het antwoord Quota exceeded, ook al zouden de afgeronde calls minder hebben gekost. Een kleinere max_tokens houdt minder vast.
  • Een aanvraag zonder streaming stuurt niets tot haar antwoord compleet is, dus geef je client een timeout die de wachttijd dekt. Een stream houdt zijn verbinding open terwijl hij wacht. Streaming

Limieten van één aanvraag

Limiet Waarde Geldt voor Bij de limiet
Request-body 32 MiB (33,554,432 bytes) Elk endpoint Status 413, type invalid_request_error.
Outputbudget: max_tokens, max_completion_tokens, max_output_tokens 1 tot 65,536. Standaard 4,096; voor shannon-coder-1 op /v1/chat/completions en /v1/messages is de standaardwaarde 65,536. Elk model, als het bedrag dat van je saldo wordt gereserveerd. Als limiet op de lengte van het antwoord: de gehoste open-weight modellen, shannon-1.6-lite, shannon-1.6-pro en shannon-coder-1. Een waarde buiten het bereik wordt naar het dichtstbijzijnde uiteinde van het bereik verplaatst. Geen fout.
Stopsequenties: stop, stop_sequences 4 strings Gehoste open-weight modellen De eerste 4 niet-lege strings worden gebruikt.
Afbeelding of bestand opgegeven als URL 8 MiB, binnen 20 seconden gelezen, maximaal 5 redirects, een openbaar http- of https-adres Elk endpoint dat afbeeldingen of bestanden accepteert De aanvraag wordt zonder dat onderdeel beantwoord. Geen fout.
Afbeelding of bestand inline verstuurd (base64) Geen eigen limiet. Het telt mee voor de request-body van 32 MiB. Elk endpoint dat afbeeldingen of bestanden accepteert Status 413 voor de hele aanvraag.
text van POST /v1/tokenize 4,000,000 bytes /v1/tokenize Status 413, type invalid_request_error, bericht text too long.
messages van POST /v1/tokenize en de body van POST /v1/messages/count_tokens De request-body van 32 MiB Beide telendpoints Status 413.
Contextvenster Per model: context_window in GET /v1/models Elk model Wat er met een langer gesprek gebeurt, hangt af van het model. Modellen en prijzen
Websearches (web_search: true) Per plan en dag: Free 3, Plus 30, Standard 50, Pro 60. Eén zoekopdracht wordt geteld voor een aanvraag waarvan de zoekopdracht resultaten vond. Aanvragen die web_search: true instellen Als er geen meer over zijn, wordt de aanvraag zonder zoekopdracht beantwoord. Geen fout. Ingebouwde webzoekopdracht

Fouten

De antwoorden van deze pagina. Op /v1/messages wordt hetzelfde error-object verpakt als {"type": "error", "error": {…}}.

Status Type Bericht Wanneer, en wat te doen
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan De reservering van de aanvraag past niet in je saldo. Wacht tot 00:00 UTC, laad credit op, wijzig je plan of stuur een kleinere max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Meer dan 120 aanvragen in de huidige minuut. Wacht N seconden en verstuur opnieuw.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan De Shannon Coder-calls van het huidige venster van 4 uur zijn op.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Het model kan de aanvraag op dit moment niet aannemen. Verstuur haar opnieuw na een korte pauze.
503 api_error Could not verify your quota right now. Please retry. Je saldo kon niet worden gelezen. Er wordt niets gefactureerd; verstuur de aanvraag opnieuw. Op /v1/responses met een Shannon-model is de status 500.
413 invalid_request_error De request-body is groter dan 32 MiB. Op de endpoints in het OpenAI-formaat bevat het error-object code: "request_too_large".
413 invalid_request_error text too long text van POST /v1/tokenize is langer dan 4,000,000 bytes.