Salti al la enhavo
Limoj kaj saldo

Limoj kaj saldo

Ĉiu peto estas servata egale. Neniuj tarifaj niveloj. Neniu aparta API-kvoto. Vi jam pagis por viaj tokenoj — uzu ilin tiel rapide, kiel vi volas.

Ĉi tiu paĝo klarigas el kio konsistas via saldo, kion unu peto rezervas kaj kostas, kiom da petoj vi rajtas sendi, kaj la malmultajn limojn, kiujn unuopa peto povas renkonti.

valoro de 1M tokenoj de saldo
$5.00
la ĉiutaga kvoto renoviĝas
00:00 UTC
flood protection, por konto
120 petoj / min

Kiel petoj estas servataj

  • Neniuj tarifaj niveloj — Unu regulo limigas kiom rapide petoj povas alveni, kaj ĝi estas sama por ĉiu konto kaj ĉiu plano: 120 petoj por minuto. Ne ekzistas limo de tokenoj por minuto.
  • Neniu aparta API-kvoto — La API elspezas la saman saldon kiel babilo. Plano fiksas la grandon de la kvoto de hodiaŭ. Ĝi ne fiksas rapidecon de petoj.
  • Tiel rapide, kiel vi volas — Paralele senditaj petoj estas akceptataj kaj atendas en vico. Ili ne estas rifuzataj pro tio, ke ili estas paralelaj.

Via saldo

Via saldo estas kalkulata en tokenoj. 1,000,000 tokenoj de saldo valoras $5.00, kaj ĉiu prezo en la paĝo Models & pricing estas kurzo kontraŭ tiu valoro.

En ĉiu momento la saldo estas la sumo de du partoj.

  • Plana kvoto de hodiaŭ — Nombro da tokenoj fiksita de via plano. Ĝi estas nova ĉiutage je 00:00 UTC. Kio restas ĉe la fino de tago, ne transiras.
  • Aĉetita kreditaĵo — Tokenoj, kiujn vi aĉetis kiel pakaĵon. Kreditaĵo ne eksvalidiĝas kaj validas ĉe ĉiu plano, Free inkluzive.
Plano Tokenoj tage Valoro
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Ordo de elspezado — Ĉiu peto unue elspezas la planan kvoton de hodiaŭ. Aĉetita kreditaĵo estas uzata nur por tio, kio superas la kvoton en tiu tago.
  • Babilo kaj API kunuzas ĝin — Estas unu saldo por konto. API-ŝlosilo elspezas el la saldo de la konto, kiu posedas ĝin, laŭ la samaj prezoj kiel babilo.
  • Pakaĵoj — Kreditaĵo estas vendata en pakaĵoj de 1,000,000 ($5.00), 2,000,000 ($10.00) kaj 5,000,000 ($25.00) tokenoj, aŭ kiel kvanto laŭ via elekto de 1,000,000 ĝis 100,000,000 tokenoj je $5.00 por 1,000,000.

Ripleni kreditojn Ŝanĝi planon

Kion peto rezervas kaj kion ĝi kostas

  • Rezervo — Kiam peto alvenas, ĝi rezervas sian eligan buĝeton el via saldo: max_tokens ĉe /v1/chat/completions kaj /v1/messages, max_output_tokens ĉe /v1/responses. /v1/chat/completions legas ankaŭ max_completion_tokens. La defaŭlto estas 4,096 kaj la intervalo estas 1 ĝis 65,536.
  • Akcepto — La peto estas akceptita nur se la rezervo eniras en tion, kio restas de via saldo. Saldo, kiu estas super nulo sed pli malgranda ol la eliga buĝeto, ricevas la respondon Quota exceeded. Sendu pli malgrandan max_tokens por uzi la reston.
  • Kvitigo — Kiam la respondo estas kompleta, la rezervo estas anstataŭata per la vera kosto. La kosto povas esti pli malalta aŭ pli alta ol la rezervo.
  • Redono — Peto, kiu finiĝas per erara stato, redonas sian rezervon plene.

La vera kosto dependas de la modelfamilio.

Modeloj Kio estas kalkulata
Shannon-modeloj usage.total_tokens laŭ la prezo de la modelo por 1M. Enigo kaj eligo havas unu prezon.
Gastigitaj malfermpezaj modeloj Nekaŝmemorita enigo laŭ la enig-prezo, kaŝmemorita enigo laŭ la kaŝmemorita prezo, eligo laŭ la elig-prezo.

La sumo en USD estas prenita el via saldo en tokenoj je $5.00 por 1,000,000, rondigita al tuta tokeno.

Kalkulado de tokenoj per POST /v1/tokenize aŭ POST /v1/messages/count_tokens estas senpaga kaj rezervas nenion. Kalkulado de tokenoj

Kie vidi saldon kaj uzadon

La paĝo Keys & usage montras tion, kion vi povas elspezi nun, la planan kvoton de hodiaŭ, vian aĉetitan kreditaĵon kaj la API-elspezon de la lastaj 30 tagoj. Sub tio ĝi listigas ĉiun peton, kiun via ŝlosilo faris: tempo, endpoint, modelo, kaŝmemorita enigo, kalkulitaj tokenoj kaj kosto. Ŝlosiloj kaj uzado

Ĉiu respondo portas ankaŭ objekton usage kun la nombroj de tokenoj de tiu voko.

Ĉuĵuŝpunkto Kampoj de usage Aldonitaj de gastigitaj malfermpezaj modeloj
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage enhavas la nombrojn de tokenoj de la modelo. La sumo prenita el via saldo ne estas en la respondo: ĝi estas la kolumno Billed tokens de la listo de petoj en Keys & usage.
  • Ĉe /v1/messages kun gastigita malfermpeza modelo, input_tokens estas la nekaŝmemorita parto de la enigo, cache_read_input_tokens estas la kaŝmemorita parto kaj cache_creation_input_tokens estas ĉiam 0.
  • Fluo ĉe /v1/chat/completions portas usage en sia lasta peco antaŭ [DONE]. Fluigo

Kiam la saldo elĉerpiĝas

Peto, kies rezervo ne eniras en vian saldon, estas respondata per stato 429, tipo rate_limit_error kaj la mesaĝo sube. Nenio estas kalkulata. La sama respondo estas sendata kiam la saldo estas super nulo sed pli malgranda ol la eliga buĝeto de la peto.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Ĉe /v1/responses la objekto error povas enhavi ankaŭ code kaj param, ambaŭ null.

Kion vi povas fari:

  • Atendu la sekvan planan kvoton je 00:00 UTC.
  • Replenigu kreditaĵon. Kreditaĵo estas elspezata post la plana kvoto kaj ne eksvalidiĝas. Ripleni kreditojn
  • Ŝanĝu al plano kun pli granda ĉiutaga kvoto. Ŝanĝi planon
  • Sendu pli malgrandan max_tokens, se restas iom da saldo: la rezervo tiam estas pli malgranda.

Kvoto de vokoj de Shannon Coder

shannon-coder-1 ĉe /v1/chat/completions kaj /v1/messages estas kalkulata en vokoj, ne en tokenoj. Ĉiu plano inkluzivas certan nombron da vokoj por 4-hora fenestro. Unu peto estas unu voko.

Plano Vokoj por 4-hora fenestro
Free 3
Plus 20
Standard 40
Pro 60
  • La fenestroj komenciĝas je 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Vokoj, kiuj restas ĉe la fino de fenestro, ne transiras.
  • Voko estas kalkulata kiam la peto estas akceptita, antaŭ ol la modelo respondas. Peto, kiu malsukcesas poste, tamen kalkuliĝas kiel voko.
  • Ĉi tiuj vokoj rezervas neniujn tokenojn kaj prenas nenion el via saldo. La listo de petoj en Keys & usage montras ilian nombron da tokenoj kaj ĝian valoron laŭ la listigita prezo.
  • La defaŭlta max_tokens de shannon-coder-1 ĉe ĉi tiuj du endpoints estas 65,536.
  • Kiam ne restas vokoj, la respondo estas stato 429, tipo rate_limit_error, mesaĝo Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Ĉe /v1/responses, shannon-coder-1 ne havas kvoton de vokoj: ĝi estas kalkulata en tokenoj el via saldo je $8.00 por 1M, kiel ĉiu alia modelo.

Flood protection

Konto rajtas sendi 120 petojn por minuto. Tio estas la sola limo de la rapideco de petoj, kaj ĝi estas sama ĉe ĉiu plano. Ĝi ekzistas por haltigi inundojn, ne por malrapidigi normalan uzon.

  • La minuto estas fiksa fenestro de 60 sekundoj, kiu malfermiĝas per via unua peto. Kiam ĝi finiĝas, la kalkulo rekomenciĝas de nulo.
  • La kalkulo estas por konto, ne por ŝlosilo kaj ne por IP-adreso. Rotacio de la ŝlosilo ne malfermas novan fenestron.
  • La 121-a peto en fenestro estas respondata per stato 429, tipo rate_limit_error kaj la mesaĝo Too many requests. Retry in <N>s. N estas la nombro da sekundoj ĝis la fino de la fenestro, de 1 ĝis 60.
  • Flood protection estas kontrolata antaŭ la saldo. Peto, kiun ĝi rifuzas, rezervas nenion kaj kostas nenion.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Peto Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Kalkulata, unu por peto.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Ne kalkulata.
shannon-coder-1 ĉe /v1/chat/completions kaj /v1/messages Anstataŭe kalkulata per la kvoto de vokoj de Shannon Coder.
Peto respondita per 401, aŭ per 400 pro nekonata model Ne kalkulata.
Peto rifuzita de flood protection Kalkulata en la fenestro. Nenio estas kalkulata kiel kosto.

Paralelaj petoj

Ne ekzistas limo pri tio, kiom da petoj konto havas malfermaj samtempe, nek eraro pro sendado de petoj paralele. Petoj, kiuj ne povas ekstari tuj, atendas en vico kaj estas respondataj laŭvice.

  • Ĉiu peto kalkuliĝas en la 120 por minuto kiam ĝi alvenas, ĉu aŭ ne pli fruaj petoj jam finiĝis.
  • Ĉiu peto tenas sian propran rezervon ĝis ĝi finiĝas. Dudek malfermaj petoj kun la defaŭlta eliga buĝeto tenas 20 × 4,096 = 81,920 tokenojn de saldo. Se la rezervoj kune estas pli grandaj ol via saldo, la sekva peto ricevas la respondon Quota exceeded, kvankam la finitaj vokoj kostus malpli. Pli malgranda max_tokens tenas malpli.
  • Peto sen streaming sendas nenion ĝis ĝia respondo estas kompleta, do donu al via kliento tempolimon, kiu kovras la atendon. Fluo tenas sian konekton malfermita dum ĝi atendas. Fluigo

Limoj de unuopa peto

Limo Valoro Validas por Ĉe la limo
Korpo de peto 32 MiB (33,554,432 bajtoj) Ĉiu endpoint Stato 413, tipo invalid_request_error.
Eliga buĝeto: max_tokens, max_completion_tokens, max_output_tokens 1 ĝis 65,536. Defaŭlto 4,096; por shannon-coder-1 ĉe /v1/chat/completions kaj /v1/messages la defaŭlto estas 65,536. Ĉiu modelo, kiel la kvanto rezervita el via saldo. Kiel limo de la longeco de la respondo: la gastigitaj malfermpezaj modeloj, shannon-1.6-lite, shannon-1.6-pro kaj shannon-coder-1. Valoro ekster la intervalo estas movita al la plej proksima fino de la intervalo. Neniu eraro.
Haltaj sekvencoj: stop, stop_sequences 4 ĉenoj Gastigitaj malfermpezaj modeloj La unuaj 4 neplenaj ĉenoj estas uzataj.
Bildo aŭ dosiero donita kiel URL 8 MiB, legata ene de 20 sekundoj, maksimume 5 alidirektoj, publika adreso http aŭ https Ĉiu endpoint, kiu akceptas bildojn aŭ dosierojn La peto estas respondata sen tiu parto. Neniu eraro.
Bildo aŭ dosiero sendita enlinie (base64) Neniu propra limo. Ĝi kalkuliĝas en la korpon de peto de 32 MiB. Ĉiu endpoint, kiu akceptas bildojn aŭ dosierojn Stato 413 por la tuta peto.
text de POST /v1/tokenize 4,000,000 bajtoj /v1/tokenize Stato 413, tipo invalid_request_error, mesaĝo text too long.
messages de POST /v1/tokenize kaj la korpo de POST /v1/messages/count_tokens La korpo de peto de 32 MiB Ambaŭ endpoints por kalkulado Stato 413.
Kunteksta fenestro Laŭ modelo: context_window en GET /v1/models Ĉiu modelo Kio okazas al pli longa konversacio dependas de la modelo. Modeloj kaj prezoj
Retserĉoj (web_search: true) Laŭ plano kaj tago: Free 3, Plus 30, Standard 50, Pro 60. Unu serĉo estas kalkulata por peto, kies serĉo trovis rezultojn. Petoj, kiuj agordas web_search: true Kiam ne restas serĉoj, la peto estas respondata sen serĉo. Neniu eraro. Retserĉo

Eraroj

La respondoj de ĉi tiu paĝo. Ĉe /v1/messages la sama objekto error estas envolvita kiel {"type": "error", "error": {…}}.

Stato Tipo Mesaĝo Kiam, kaj kion fari
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan La rezervo de la peto ne eniras en vian saldon. Atendu ĝis 00:00 UTC, replenigu kreditaĵon, ŝanĝu planon, aŭ sendu pli malgrandan max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Pli ol 120 petoj en la nuna minuto. Atendu N sekundojn kaj resendu.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan La vokoj de Shannon Coder en la nuna 4-hora fenestro estas elĉerpitaj.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. La modelo ne povas akcepti la peton en ĉi tiu momento. Resendu ĝin post mallonga paŭzo.
503 api_error Could not verify your quota right now. Please retry. Via saldo ne povis esti legita. Nenio estas kalkulata; resendu la peton. Ĉe /v1/responses kun Shannon-modelo la stato estas 500.
413 invalid_request_error La korpo de la peto estas pli granda ol 32 MiB. Ĉe la endpoints de formato OpenAI la objekto error portas code: "request_too_large".
413 invalid_request_error text too long text de POST /v1/tokenize estas pli longa ol 4,000,000 bajtoj.