Siirry sisältöön
Rajat ja saldo

Rajat ja saldo

Jokaista pyyntöä palvellaan yhtä lailla. Ei nopeusportaita. Ei erillistä API-kiintiötä. Olet jo maksanut tokenisi — käytä ne niin nopeasti kuin haluat.

Tällä sivulla selitetään, mistä saldosi koostuu, mitä yksi pyyntö varaa ja maksaa, kuinka monta pyyntöä saat lähettää ja ne harvat rajat, joihin yksittäinen pyyntö voi törmätä.

1M tokenin saldon arvo
$5.00
päivittäinen kiintiö uusiutuu
00:00 UTC
tulvasuoja, tiliä kohti
120 pyyntöä / min

Miten pyyntöjä palvellaan

  • Ei nopeusportaita — Yksi sääntö rajoittaa, kuinka nopeasti pyyntöjä saa tulla, ja se on sama jokaiselle tilille ja jokaiselle tilaukselle: 120 pyyntöä minuutissa. Tokeneille minuuttia kohti ei ole rajaa.
  • Ei erillistä API-kiintiötä — API kuluttaa samaa saldoa kuin chat. Tilaus määrittää tämän päivän kiintiön koon. Se ei määritä pyyntötahtia.
  • Niin nopeasti kuin haluat — Rinnakkain lähetetyt pyynnöt hyväksytään ja ne odottavat jonossa. Niitä ei hylätä sen vuoksi, että ne ovat rinnakkaisia.

Saldosi

Saldosi lasketaan tokeneina. 1,000,000 tokenia saldoa on arvoltaan $5.00, ja jokainen Models & pricing -sivun hinta on hinta suhteessa tähän arvoon.

Saldo on milloin tahansa kahden osan summa.

  • Tämän päivän kiintiö — Tilauksesi määrittämä tokenmäärä. Se uusiutuu joka päivä kello 00:00 UTC. Päivän lopussa jäljelle jäänyt osa ei siirry eteenpäin.
  • Ostettu saldo — Paketteina ostamasi tokenit. Saldo ei vanhene ja toimii jokaisella tilauksella, myös Free-tilauksella.
Tilaus Tokenia päivässä Arvo
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Kulutusjärjestys — Jokainen pyyntö kuluttaa ensin tämän päivän kiintiötä. Ostettua saldoa käytetään vain siihen, mikä ylittää päivän kiintiön.
  • Chat ja API jakavat sen — Tiliä kohti on yksi saldo. API-avain kuluttaa sen tilin saldoa, joka omistaa avaimen, samoilla hinnoilla kuin chat.
  • Paketit — Saldoa myydään paketteina, joiden koko on 1,000,000 ($5.00), 2,000,000 ($10.00) ja 5,000,000 ($25.00) tokenia, tai valitsemanasi määränä välillä 1,000,000–100,000,000 tokenia hintaan $5.00 per 1,000,000.

Lisää saldoa Vaihda tilausta

Mitä pyyntö varaa ja mitä se maksaa

  • Varaus — Kun pyyntö saapuu, se varaa tulostebudjettinsa saldostasi: max_tokens päätepisteissä /v1/chat/completions ja /v1/messages, max_output_tokens päätepisteessä /v1/responses. Päätepiste /v1/chat/completions lukee myös max_completion_tokens. Oletus on 4,096 ja vaihteluväli 1–65,536.
  • Hyväksyntä — Pyyntö hyväksytään vain, jos varaus mahtuu saldosi jäljellä olevaan osaan. Saldo, joka on yli nollan mutta pienempi kuin tulostebudjetti, saa vastauksen Quota exceeded. Lähetä pienempi max_tokens, jos haluat käyttää loput.
  • Selvitys — Kun vastaus on valmis, varaus korvataan todellisella veloituksella. Veloitus voi olla varausta pienempi tai suurempi.
  • Palautus — Pyyntö, joka päättyy virhetilaan, palauttaa varauksensa kokonaan.

Todellinen veloitus riippuu malliperheestä.

Mallit Mitä veloitetaan
Shannon-mallit usage.total_tokens mallin hinnalla per 1M. Syötteellä ja tulosteella on yksi hinta.
Hostatut avoimen painon mallit Välimuistiton syöte syötehinnalla, välimuistisyöte välimuistihinnalla, tuloste tulostehinnalla.

USD-summa vähennetään saldostasi tokeneina hintaan $5.00 per 1,000,000, pyöristettynä kokonaiseen tokeniin.

Tokenien laskenta komennoilla POST /v1/tokenize tai POST /v1/messages/count_tokens on ilmaista, eikä se varaa mitään. Tokenien laskenta

Mistä näet saldon ja käytön

Keys & usage -sivu näyttää, paljonko voit kuluttaa juuri nyt, tämän päivän kiintiön, ostetun saldosi ja viimeisen 30 päivän API-kulut. Sen alla on lista jokaisesta avaimesi tekemästä pyynnöstä: aika, päätepiste, malli, välimuistisyöte, laskutetut tokenit ja kustannus. Avaimet ja käyttö

Jokaisessa vastauksessa on myös usage-objekti, jossa on kyseisen kutsun tokenmäärät.

Päätepiste Kentät kohdassa usage Hostattujen avoimen painon mallien lisäämät
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage sisältää mallin tokenmäärät. Saldostasi vähennettyä summaa ei ole vastauksessa: se on Keys & usage -sivun pyyntölistan Billed tokens -sarakkeessa.
  • Päätepisteessä /v1/messages hostatulla avoimen painon mallilla input_tokens on syötteen välimuistiton osa, cache_read_input_tokens on välimuistissa ollut osa ja cache_creation_input_tokens on aina 0.
  • Päätepisteen /v1/chat/completions striimin viimeisessä chunkissa ennen [DONE]-merkintää on usage. Suoratoisto

Kun saldo loppuu

Pyyntöön, jonka varaus ei mahdu saldoosi, vastataan tilalla 429, tyypillä rate_limit_error ja alla olevalla viestillä. Mitään ei veloiteta. Sama vastaus lähetetään, kun saldo on yli nollan mutta pienempi kuin pyynnön tulostebudjetti.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Päätepisteessä /v1/responses error-objektissa voi olla myös code ja param, jotka molemmat ovat null.

Mitä voit tehdä:

  • Odota seuraavaa kiintiötä kello 00:00 UTC.
  • Lisää saldoa. Ostettu saldo kuluu kiintiön jälkeen eikä vanhene. Lisää saldoa
  • Vaihda tilaukseen, jonka päivittäinen kiintiö on suurempi. Vaihda tilausta
  • Lähetä pienempi max_tokens, jos saldoa on vielä jäljellä: silloin varaus on pienempi.

Shannon Coderin kutsukiintiö

Mallia shannon-coder-1 päätepisteissä /v1/chat/completions ja /v1/messages lasketaan kutsuina, ei tokeneina. Jokaiseen tilaukseen kuuluu tietty määrä kutsuja 4 tunnin jaksoa kohti. Yksi pyyntö on yksi kutsu.

Tilaus Kutsuja 4 tunnin jaksossa
Free 3
Plus 20
Standard 40
Pro 60
  • Jaksot alkavat kello 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Jakson lopussa jäljelle jääneet kutsut eivät siirry eteenpäin.
  • Kutsu lasketaan, kun pyyntö hyväksytään, ennen kuin malli vastaa. Pyyntö, joka epäonnistuu sen jälkeen, lasketaan silti kutsuksi.
  • Nämä kutsut eivät varaa tokeneita eivätkä vie mitään saldostasi. Keys & usage -sivun pyyntölista näyttää niiden tokenmäärän ja sen arvon listahinnalla.
  • Mallin shannon-coder-1 oletus max_tokens näissä kahdessa päätepisteessä on 65,536.
  • Kun kutsuja ei ole jäljellä, vastaus on tila 429, tyyppi rate_limit_error ja viesti Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Päätepisteessä /v1/responses mallilla shannon-coder-1 ei ole kutsukiintiötä: se veloitetaan tokeneina saldostasi hintaan $8.00 per 1M, kuten kaikki muutkin mallit.

Tulvasuoja

Tili saa lähettää 120 pyyntöä minuutissa. Se on ainoa pyyntötahdin raja, ja se on sama jokaisella tilauksella. Sen tarkoitus on estää tulvat, ei hidastaa tavallista käyttöä.

  • Minuutti on kiinteä 60 sekunnin ikkuna, joka avautuu ensimmäisestä pyynnöstäsi. Kun se päättyy, laskenta alkaa uudelleen nollasta.
  • Laskenta tehdään tiliä kohti, ei avainta eikä IP-osoitetta kohti. Avaimen vaihtaminen ei avaa uutta ikkunaa.
  • Ikkunan 121. pyyntöön vastataan tilalla 429, tyypillä rate_limit_error ja viestillä Too many requests. Retry in <N>s. N on sekuntien määrä ikkunan päättymiseen, 1–60.
  • Tulvasuoja tarkistetaan ennen saldoa. Pyyntö, jonka se hylkää, ei varaa mitään eikä maksa mitään.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Pyyntö Tulvasuoja
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Lasketaan, yksi pyyntöä kohti.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Ei lasketa.
shannon-coder-1 päätepisteissä /v1/chat/completions ja /v1/messages Lasketaan sen sijaan Shannon Coderin kutsukiintiöön.
Pyyntö, johon vastattiin 401:llä tai tuntemattoman model-arvon vuoksi 400:lla Ei lasketa.
Pyyntö, jonka tulvasuoja hylkäsi Lasketaan ikkunaan. Mitään ei veloiteta.

Rinnakkaiset pyynnöt

Tilillä samanaikaisesti avoimien pyyntöjen määrälle ei ole rajaa, eikä rinnakkaisista pyynnöistä seuraa virhettä. Pyynnöt, jotka eivät voi alkaa heti, odottavat jonossa ja saavat vastauksen vuorotellen.

  • Jokainen pyyntö lasketaan 120 pyynnön minuuttirajaan, kun se saapuu, riippumatta siitä, ovatko aiemmat pyynnöt valmistuneet.
  • Jokainen pyyntö pitää omaa varaustaan, kunnes se päättyy. Kaksikymmentä avointa pyyntöä oletustulostebudjetilla pitää 20 × 4,096 = 81,920 tokenia saldoa. Jos varaukset yhteensä ovat suuremmat kuin saldosi, seuraava pyyntö saa vastauksen Quota exceeded, vaikka valmiit kutsut olisivat maksaneet vähemmän. Pienempi max_tokens varaa vähemmän.
  • Pyyntö ilman striimausta ei lähetä mitään ennen kuin sen vastaus on valmis, joten anna asiakkaallesi aikakatkaisu, joka kattaa odotuksen. Striimi pitää yhteytensä auki odottaessaan. Suoratoisto

Yksittäisen pyynnön rajat

Raja Arvo Koskee Rajalla
Pyynnön runko 32 MiB (33,554,432 tavua) Jokainen päätepiste Tila 413, tyyppi invalid_request_error.
Tulostebudjetti: max_tokens, max_completion_tokens, max_output_tokens 1–65,536. Oletus 4,096; mallilla shannon-coder-1 päätepisteissä /v1/chat/completions ja /v1/messages oletus on 65,536. Jokainen malli saldostasi varattavana määränä. Vastauksen pituuden rajana: hostatut avoimen painon mallit, shannon-1.6-lite, shannon-1.6-pro ja shannon-coder-1. Vaihteluvälin ulkopuolinen arvo siirretään vaihteluvälin lähimpään päähän. Ei virhettä.
Pysäytyssekvenssit: stop, stop_sequences 4 merkkijonoa Hostatut avoimen painon mallit Käytetään 4 ensimmäistä ei-tyhjää merkkijonoa.
URL-osoitteena annettu kuva tai tiedosto 8 MiB, luetaan 20 sekunnissa, enintään 5 uudelleenohjausta, julkinen http- tai https-osoite Jokainen päätepiste, joka ottaa kuvia tai tiedostoja Pyyntöön vastataan ilman tuota osaa. Ei virhettä.
Upotettuna lähetetty kuva tai tiedosto (base64) Ei omaa rajaa. Se lasketaan mukaan 32 MiB:n pyynnön runkoon. Jokainen päätepiste, joka ottaa kuvia tai tiedostoja Tila 413 koko pyynnölle.
Komennon POST /v1/tokenize kenttä text 4,000,000 tavua /v1/tokenize Tila 413, tyyppi invalid_request_error, viesti text too long.
Komennon POST /v1/tokenize kenttä messages ja komennon POST /v1/messages/count_tokens runko 32 MiB:n pyynnön runko Molemmat laskentapäätepisteet Tila 413.
Kontekstikoko Mallikohtainen: context_window komennossa GET /v1/models Jokainen malli Pidemmän keskustelun kohtalo riippuu mallista. Mallit ja hinnoittelu
Verkkohaut (web_search: true) Tilausta ja päivää kohti: Free 3, Plus 30, Standard 50, Pro 60. Yksi haku lasketaan pyynnölle, jonka haku löysi tuloksia. Pyynnöt, jotka asettavat web_search: true Kun hakuja ei ole jäljellä, pyyntöön vastataan ilman hakua. Ei virhettä. Sisäänrakennettu verkkohaku

Virheet

Tämän sivun vastaukset. Päätepisteessä /v1/messages sama error-objekti kääritään muotoon {"type": "error", "error": {…}}.

Tila Tyyppi Viesti Milloin ja mitä tehdä
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Pyynnön varaus ei mahdu saldoosi. Odota kellonaikaa 00:00 UTC, lisää saldoa, vaihda tilausta tai lähetä pienempi max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Yli 120 pyyntöä meneillään olevassa minuutissa. Odota N sekuntia ja lähetä uudelleen.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Meneillään olevan 4 tunnin jakson Shannon Coder -kutsut on käytetty.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Malli ei voi ottaa pyyntöä vastaan juuri nyt. Lähetä se uudelleen lyhyen tauon jälkeen.
503 api_error Could not verify your quota right now. Please retry. Saldoasi ei voitu lukea. Mitään ei veloiteta; lähetä pyyntö uudelleen. Päätepisteessä /v1/responses Shannon-mallilla tila on 500.
413 invalid_request_error Pyynnön runko on suurempi kuin 32 MiB. OpenAI-muotoisissa päätepisteissä error-objektissa on code: "request_too_large".
413 invalid_request_error text too long Komennon POST /v1/tokenize kenttä text on pidempi kuin 4,000,000 tavua.