Rajat ja saldo
Jokaista pyyntöä palvellaan yhtä lailla. Ei nopeusportaita. Ei erillistä API-kiintiötä. Olet jo maksanut tokenisi — käytä ne niin nopeasti kuin haluat.
Tällä sivulla selitetään, mistä saldosi koostuu, mitä yksi pyyntö varaa ja maksaa, kuinka monta pyyntöä saat lähettää ja ne harvat rajat, joihin yksittäinen pyyntö voi törmätä.
- 1M tokenin saldon arvo
- $5.00
- päivittäinen kiintiö uusiutuu
- 00:00 UTC
- tulvasuoja, tiliä kohti
- 120 pyyntöä / min
Miten pyyntöjä palvellaan
- Ei nopeusportaita — Yksi sääntö rajoittaa, kuinka nopeasti pyyntöjä saa tulla, ja se on sama jokaiselle tilille ja jokaiselle tilaukselle: 120 pyyntöä minuutissa. Tokeneille minuuttia kohti ei ole rajaa.
- Ei erillistä API-kiintiötä — API kuluttaa samaa saldoa kuin chat. Tilaus määrittää tämän päivän kiintiön koon. Se ei määritä pyyntötahtia.
- Niin nopeasti kuin haluat — Rinnakkain lähetetyt pyynnöt hyväksytään ja ne odottavat jonossa. Niitä ei hylätä sen vuoksi, että ne ovat rinnakkaisia.
Saldosi
Saldosi lasketaan tokeneina. 1,000,000 tokenia saldoa on arvoltaan $5.00, ja jokainen Models & pricing -sivun hinta on hinta suhteessa tähän arvoon.
Saldo on milloin tahansa kahden osan summa.
- Tämän päivän kiintiö — Tilauksesi määrittämä tokenmäärä. Se uusiutuu joka päivä kello 00:00 UTC. Päivän lopussa jäljelle jäänyt osa ei siirry eteenpäin.
- Ostettu saldo — Paketteina ostamasi tokenit. Saldo ei vanhene ja toimii jokaisella tilauksella, myös Free-tilauksella.
| Tilaus | Tokenia päivässä | Arvo |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Kulutusjärjestys — Jokainen pyyntö kuluttaa ensin tämän päivän kiintiötä. Ostettua saldoa käytetään vain siihen, mikä ylittää päivän kiintiön.
- Chat ja API jakavat sen — Tiliä kohti on yksi saldo. API-avain kuluttaa sen tilin saldoa, joka omistaa avaimen, samoilla hinnoilla kuin chat.
- Paketit — Saldoa myydään paketteina, joiden koko on 1,000,000 ($5.00), 2,000,000 ($10.00) ja 5,000,000 ($25.00) tokenia, tai valitsemanasi määränä välillä 1,000,000–100,000,000 tokenia hintaan $5.00 per 1,000,000.
Mitä pyyntö varaa ja mitä se maksaa
- Varaus — Kun pyyntö saapuu, se varaa tulostebudjettinsa saldostasi:
max_tokenspäätepisteissä/v1/chat/completionsja/v1/messages,max_output_tokenspäätepisteessä/v1/responses. Päätepiste/v1/chat/completionslukee myösmax_completion_tokens. Oletus on 4,096 ja vaihteluväli 1–65,536. - Hyväksyntä — Pyyntö hyväksytään vain, jos varaus mahtuu saldosi jäljellä olevaan osaan. Saldo, joka on yli nollan mutta pienempi kuin tulostebudjetti, saa vastauksen
Quota exceeded. Lähetä pienempimax_tokens, jos haluat käyttää loput. - Selvitys — Kun vastaus on valmis, varaus korvataan todellisella veloituksella. Veloitus voi olla varausta pienempi tai suurempi.
- Palautus — Pyyntö, joka päättyy virhetilaan, palauttaa varauksensa kokonaan.
Todellinen veloitus riippuu malliperheestä.
| Mallit | Mitä veloitetaan |
|---|---|
| Shannon-mallit | usage.total_tokens mallin hinnalla per 1M. Syötteellä ja tulosteella on yksi hinta. |
| Hostatut avoimen painon mallit | Välimuistiton syöte syötehinnalla, välimuistisyöte välimuistihinnalla, tuloste tulostehinnalla. |
USD-summa vähennetään saldostasi tokeneina hintaan $5.00 per 1,000,000, pyöristettynä kokonaiseen tokeniin.
Tokenien laskenta komennoilla POST /v1/tokenize tai POST /v1/messages/count_tokens on ilmaista, eikä se varaa mitään. Tokenien laskenta
Mistä näet saldon ja käytön
Keys & usage -sivu näyttää, paljonko voit kuluttaa juuri nyt, tämän päivän kiintiön, ostetun saldosi ja viimeisen 30 päivän API-kulut. Sen alla on lista jokaisesta avaimesi tekemästä pyynnöstä: aika, päätepiste, malli, välimuistisyöte, laskutetut tokenit ja kustannus. Avaimet ja käyttö
Jokaisessa vastauksessa on myös usage-objekti, jossa on kyseisen kutsun tokenmäärät.
| Päätepiste | Kentät kohdassa usage | Hostattujen avoimen painon mallien lisäämät |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagesisältää mallin tokenmäärät. Saldostasi vähennettyä summaa ei ole vastauksessa: se on Keys & usage -sivun pyyntölistan Billed tokens -sarakkeessa.- Päätepisteessä
/v1/messageshostatulla avoimen painon mallillainput_tokenson syötteen välimuistiton osa,cache_read_input_tokenson välimuistissa ollut osa jacache_creation_input_tokenson aina0. - Päätepisteen
/v1/chat/completionsstriimin viimeisessä chunkissa ennen[DONE]-merkintää onusage. Suoratoisto
Kun saldo loppuu
Pyyntöön, jonka varaus ei mahdu saldoosi, vastataan tilalla 429, tyypillä rate_limit_error ja alla olevalla viestillä. Mitään ei veloiteta. Sama vastaus lähetetään, kun saldo on yli nollan mutta pienempi kuin pyynnön tulostebudjetti.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Päätepisteessä /v1/responses error-objektissa voi olla myös code ja param, jotka molemmat ovat null.
Mitä voit tehdä:
- Odota seuraavaa kiintiötä kello 00:00 UTC.
- Lisää saldoa. Ostettu saldo kuluu kiintiön jälkeen eikä vanhene. Lisää saldoa
- Vaihda tilaukseen, jonka päivittäinen kiintiö on suurempi. Vaihda tilausta
- Lähetä pienempi
max_tokens, jos saldoa on vielä jäljellä: silloin varaus on pienempi.
Shannon Coderin kutsukiintiö
Mallia shannon-coder-1 päätepisteissä /v1/chat/completions ja /v1/messages lasketaan kutsuina, ei tokeneina. Jokaiseen tilaukseen kuuluu tietty määrä kutsuja 4 tunnin jaksoa kohti. Yksi pyyntö on yksi kutsu.
| Tilaus | Kutsuja 4 tunnin jaksossa |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Jaksot alkavat kello 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Jakson lopussa jäljelle jääneet kutsut eivät siirry eteenpäin.
- Kutsu lasketaan, kun pyyntö hyväksytään, ennen kuin malli vastaa. Pyyntö, joka epäonnistuu sen jälkeen, lasketaan silti kutsuksi.
- Nämä kutsut eivät varaa tokeneita eivätkä vie mitään saldostasi. Keys & usage -sivun pyyntölista näyttää niiden tokenmäärän ja sen arvon listahinnalla.
- Mallin
shannon-coder-1oletusmax_tokensnäissä kahdessa päätepisteessä on 65,536. - Kun kutsuja ei ole jäljellä, vastaus on tila
429, tyyppirate_limit_errorja viestiShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Päätepisteessä
/v1/responsesmallillashannon-coder-1ei ole kutsukiintiötä: se veloitetaan tokeneina saldostasi hintaan $8.00 per 1M, kuten kaikki muutkin mallit.
Tulvasuoja
Tili saa lähettää 120 pyyntöä minuutissa. Se on ainoa pyyntötahdin raja, ja se on sama jokaisella tilauksella. Sen tarkoitus on estää tulvat, ei hidastaa tavallista käyttöä.
- Minuutti on kiinteä 60 sekunnin ikkuna, joka avautuu ensimmäisestä pyynnöstäsi. Kun se päättyy, laskenta alkaa uudelleen nollasta.
- Laskenta tehdään tiliä kohti, ei avainta eikä IP-osoitetta kohti. Avaimen vaihtaminen ei avaa uutta ikkunaa.
- Ikkunan 121. pyyntöön vastataan tilalla
429, tyypillärate_limit_errorja viestilläToo many requests. Retry in <N>s.Non sekuntien määrä ikkunan päättymiseen, 1–60. - Tulvasuoja tarkistetaan ennen saldoa. Pyyntö, jonka se hylkää, ei varaa mitään eikä maksa mitään.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Pyyntö | Tulvasuoja |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Lasketaan, yksi pyyntöä kohti. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Ei lasketa. |
shannon-coder-1 päätepisteissä /v1/chat/completions ja /v1/messages | Lasketaan sen sijaan Shannon Coderin kutsukiintiöön. |
Pyyntö, johon vastattiin 401:llä tai tuntemattoman model-arvon vuoksi 400:lla | Ei lasketa. |
| Pyyntö, jonka tulvasuoja hylkäsi | Lasketaan ikkunaan. Mitään ei veloiteta. |
Rinnakkaiset pyynnöt
Tilillä samanaikaisesti avoimien pyyntöjen määrälle ei ole rajaa, eikä rinnakkaisista pyynnöistä seuraa virhettä. Pyynnöt, jotka eivät voi alkaa heti, odottavat jonossa ja saavat vastauksen vuorotellen.
- Jokainen pyyntö lasketaan 120 pyynnön minuuttirajaan, kun se saapuu, riippumatta siitä, ovatko aiemmat pyynnöt valmistuneet.
- Jokainen pyyntö pitää omaa varaustaan, kunnes se päättyy. Kaksikymmentä avointa pyyntöä oletustulostebudjetilla pitää 20 × 4,096 = 81,920 tokenia saldoa. Jos varaukset yhteensä ovat suuremmat kuin saldosi, seuraava pyyntö saa vastauksen
Quota exceeded, vaikka valmiit kutsut olisivat maksaneet vähemmän. Pienempimax_tokensvaraa vähemmän. - Pyyntö ilman striimausta ei lähetä mitään ennen kuin sen vastaus on valmis, joten anna asiakkaallesi aikakatkaisu, joka kattaa odotuksen. Striimi pitää yhteytensä auki odottaessaan. Suoratoisto
Yksittäisen pyynnön rajat
| Raja | Arvo | Koskee | Rajalla |
|---|---|---|---|
| Pyynnön runko | 32 MiB (33,554,432 tavua) | Jokainen päätepiste | Tila 413, tyyppi invalid_request_error. |
Tulostebudjetti: max_tokens, max_completion_tokens, max_output_tokens | 1–65,536. Oletus 4,096; mallilla shannon-coder-1 päätepisteissä /v1/chat/completions ja /v1/messages oletus on 65,536. | Jokainen malli saldostasi varattavana määränä. Vastauksen pituuden rajana: hostatut avoimen painon mallit, shannon-1.6-lite, shannon-1.6-pro ja shannon-coder-1. | Vaihteluvälin ulkopuolinen arvo siirretään vaihteluvälin lähimpään päähän. Ei virhettä. |
Pysäytyssekvenssit: stop, stop_sequences | 4 merkkijonoa | Hostatut avoimen painon mallit | Käytetään 4 ensimmäistä ei-tyhjää merkkijonoa. |
| URL-osoitteena annettu kuva tai tiedosto | 8 MiB, luetaan 20 sekunnissa, enintään 5 uudelleenohjausta, julkinen http- tai https-osoite | Jokainen päätepiste, joka ottaa kuvia tai tiedostoja | Pyyntöön vastataan ilman tuota osaa. Ei virhettä. |
| Upotettuna lähetetty kuva tai tiedosto (base64) | Ei omaa rajaa. Se lasketaan mukaan 32 MiB:n pyynnön runkoon. | Jokainen päätepiste, joka ottaa kuvia tai tiedostoja | Tila 413 koko pyynnölle. |
Komennon POST /v1/tokenize kenttä text | 4,000,000 tavua | /v1/tokenize | Tila 413, tyyppi invalid_request_error, viesti text too long. |
Komennon POST /v1/tokenize kenttä messages ja komennon POST /v1/messages/count_tokens runko | 32 MiB:n pyynnön runko | Molemmat laskentapäätepisteet | Tila 413. |
| Kontekstikoko | Mallikohtainen: context_window komennossa GET /v1/models | Jokainen malli | Pidemmän keskustelun kohtalo riippuu mallista. Mallit ja hinnoittelu |
Verkkohaut (web_search: true) | Tilausta ja päivää kohti: Free 3, Plus 30, Standard 50, Pro 60. Yksi haku lasketaan pyynnölle, jonka haku löysi tuloksia. | Pyynnöt, jotka asettavat web_search: true | Kun hakuja ei ole jäljellä, pyyntöön vastataan ilman hakua. Ei virhettä. Sisäänrakennettu verkkohaku |
Virheet
Tämän sivun vastaukset. Päätepisteessä /v1/messages sama error-objekti kääritään muotoon {"type": "error", "error": {…}}.
| Tila | Tyyppi | Viesti | Milloin ja mitä tehdä |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Pyynnön varaus ei mahdu saldoosi. Odota kellonaikaa 00:00 UTC, lisää saldoa, vaihda tilausta tai lähetä pienempi max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Yli 120 pyyntöä meneillään olevassa minuutissa. Odota N sekuntia ja lähetä uudelleen. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Meneillään olevan 4 tunnin jakson Shannon Coder -kutsut on käytetty. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Malli ei voi ottaa pyyntöä vastaan juuri nyt. Lähetä se uudelleen lyhyen tauon jälkeen. |
503 | api_error | Could not verify your quota right now. Please retry. | Saldoasi ei voitu lukea. Mitään ei veloiteta; lähetä pyyntö uudelleen. Päätepisteessä /v1/responses Shannon-mallilla tila on 500. |
413 | invalid_request_error | Pyynnön runko on suurempi kuin 32 MiB. OpenAI-muotoisissa päätepisteissä error-objektissa on code: "request_too_large". | |
413 | invalid_request_error | text too long | Komennon POST /v1/tokenize kenttä text on pidempi kuin 4,000,000 tavua. |