Had dan baki
Setiap permintaan dilayan sama rata. Tiada peringkat kadar. Tiada kuota API yang berasingan. Anda sudah membayar untuk token anda — gunakannya sepantas yang anda mahu.
Halaman ini menerangkan apa yang membentuk baki anda, apa yang ditempah dan dikos oleh satu permintaan, berapa banyak permintaan yang boleh anda hantar, dan beberapa had yang boleh dihadapi oleh satu permintaan.
- nilai 1M token baki
- $5.00
- kuota harian diperbaharui
- 00:00 UTC
- flood protection, bagi setiap akaun
- 120 permintaan / min
Cara permintaan dilayan
- Tiada peringkat kadar — Satu peraturan mengehadkan kelajuan permintaan tiba, dan ia sama untuk setiap akaun dan setiap pelan: 120 permintaan seminit. Tiada had pada token seminit.
- Tiada kuota API yang berasingan — API membelanjakan baki yang sama seperti sembang. Pelan menetapkan saiz kuota hari ini. Ia tidak menetapkan kadar permintaan.
- Sepantas yang anda mahu — Permintaan yang dihantar secara selari diterima dan menunggu dalam barisan. Ia tidak ditolak kerana selari.
Baki anda
Baki anda dikira dalam token. 1,000,000 token baki bernilai $5.00, dan setiap harga pada halaman Model & harga ialah kadar berbanding nilai itu.
Pada bila-bila masa, baki ialah jumlah dua bahagian.
- Kuota pelan hari ini — Bilangan token yang ditetapkan oleh pelan anda. Ia diperbaharui setiap hari pada 00:00 UTC. Baki pada penghujung hari tidak dibawa ke hadapan.
- Kredit yang dibeli — Token yang anda beli sebagai pek. Kredit tidak tamat tempoh dan berfungsi pada setiap pelan, termasuk Free.
| Pelan | Token sehari | Bernilai |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Urutan perbelanjaan — Setiap permintaan membelanjakan kuota pelan hari ini dahulu. Kredit yang dibeli hanya digunakan untuk bahagian yang melebihi kuota pada hari itu.
- Sembang dan API berkongsinya — Terdapat satu baki bagi setiap akaun. Kunci API membelanjakan daripada baki akaun yang memilikinya, pada harga yang sama seperti sembang.
- Pek — Kredit dijual dalam pek 1,000,000 ($5.00), 2,000,000 ($10.00) dan 5,000,000 ($25.00) token, atau sebagai jumlah pilihan anda daripada 1,000,000 hingga 100,000,000 token pada $5.00 bagi setiap 1,000,000.
Tambah nilai kredit Tukar pelan
Apa yang ditempah oleh permintaan dan berapa kosnya
- Tempah — Apabila permintaan tiba, ia menempah bajet outputnya daripada baki anda:
max_tokenspada/v1/chat/completionsdan/v1/messages,max_output_tokenspada/v1/responses./v1/chat/completionsjuga membacamax_completion_tokens. Nilai lalainya 4,096 dan julatnya 1 hingga 65,536. - Terima — Permintaan diterima hanya jika tempahan itu muat dalam baki anda yang berbaki. Baki yang melebihi sifar tetapi lebih kecil daripada bajet output akan mendapat balasan
Quota exceeded. Hantarmax_tokensyang lebih kecil untuk menggunakan bakinya. - Selesai — Apabila jawapan lengkap, tempahan digantikan dengan caj sebenar. Caj boleh lebih rendah atau lebih tinggi daripada tempahan.
- Pulang — Permintaan yang berakhir dengan status ralat memulangkan tempahannya sepenuhnya.
Caj sebenar bergantung pada keluarga model.
| Model | Apa yang dicaj |
|---|---|
| Model Shannon | usage.total_tokens pada harga model bagi setiap 1M. Input dan output mempunyai satu kadar. |
| Model open-weight yang dihoskan | Input tanpa cache pada kadar input, input cached pada kadar cached, output pada kadar output. |
Jumlah dalam USD diambil daripada baki anda dalam token pada $5.00 bagi setiap 1,000,000, dibundarkan kepada token yang bulat.
Mengira token dengan POST /v1/tokenize atau POST /v1/messages/count_tokens adalah percuma dan tidak menempah apa-apa. Pengiraan token
Tempat melihat baki dan penggunaan
Halaman Kunci & penggunaan menunjukkan apa yang boleh anda belanjakan sekarang, kuota pelan hari ini, kredit yang anda beli dan perbelanjaan API 30 hari yang lalu. Di bawahnya, ia menyenaraikan setiap permintaan yang dibuat oleh kunci anda: masa, endpoint, model, input cached, token yang dibilkan dan kos. Kunci & penggunaan
Setiap balasan juga membawa objek usage dengan bilangan token bagi panggilan itu.
| Endpoint | Medan usage | Ditambah oleh model open-weight yang dihoskan |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagememegang bilangan token model. Jumlah yang diambil daripada baki anda tidak ada dalam balasan: ia ialah lajur Token dibilkan dalam senarai permintaan pada Kunci & penggunaan.- Pada
/v1/messagesdengan model open-weight yang dihoskan,input_tokensialah bahagian input yang tidak di-cache,cache_read_input_tokensialah bahagian cached dancache_creation_input_tokenssentiasa0. - Stream pada
/v1/chat/completionsmembawausagedalam chunk terakhirnya sebelum[DONE]. Penstriman
Apabila baki habis
Permintaan yang tempahannya tidak muat dalam baki anda dijawab dengan status 429, jenis rate_limit_error dan mesej di bawah. Tiada caj dikenakan. Balasan yang sama dihantar apabila baki melebihi sifar tetapi lebih kecil daripada bajet output permintaan.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Pada /v1/responses, objek error juga boleh memegang code dan param, kedua-duanya null.
Apa yang boleh anda lakukan:
- Tunggu kuota pelan seterusnya pada 00:00 UTC.
- Tambah nilai kredit. Kredit dibelanjakan selepas kuota pelan dan tidak tamat tempoh. Tambah nilai kredit
- Tukar kepada pelan dengan kuota harian yang lebih besar. Tukar pelan
- Hantar
max_tokensyang lebih kecil, jika masih ada baki: tempahan menjadi lebih kecil.
Kuota panggilan Shannon Coder
shannon-coder-1 pada /v1/chat/completions dan /v1/messages dikira dalam panggilan, bukan dalam token. Setiap pelan termasuk sejumlah panggilan bagi setiap tetingkap 4 jam. Satu permintaan ialah satu panggilan.
| Pelan | Panggilan bagi setiap tetingkap 4 jam |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Tetingkap bermula pada 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Panggilan yang berbaki pada penghujung tetingkap tidak dibawa ke hadapan.
- Panggilan dikira apabila permintaan diterima, sebelum model menjawab. Permintaan yang gagal selepas itu tetap dikira sebagai panggilan.
- Panggilan ini tidak menempah token dan tidak mengambil apa-apa daripada baki anda. Senarai permintaan pada Kunci & penggunaan menunjukkan bilangan token dan nilainya pada harga yang disenaraikan.
max_tokenslalai bagishannon-coder-1pada dua endpoint ini ialah 65,536.- Apabila tiada panggilan lagi, balasannya ialah status
429, jenisrate_limit_error, mesejShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Pada
/v1/responses,shannon-coder-1tidak mempunyai kuota panggilan: ia dicaj dalam token daripada baki anda pada $8.00 bagi setiap 1M, seperti model lain.
Flood protection
Satu akaun boleh menghantar 120 permintaan seminit. Itulah satu-satunya had pada kadar permintaan, dan ia sama pada setiap pelan. Ia wujud untuk menghentikan lonjakan permintaan, bukan untuk melambatkan penggunaan biasa.
- Minit ialah tetingkap tetap selama 60 saat yang dibuka dengan permintaan pertama anda. Apabila ia berakhir, kiraan bermula semula dari sifar.
- Kiraan adalah bagi setiap akaun, bukan bagi setiap kunci dan bukan bagi setiap alamat IP. Memutar kunci tidak membuka tetingkap baharu.
- Permintaan ke-121 dalam satu tetingkap dijawab dengan status
429, jenisrate_limit_errordan mesejToo many requests. Retry in <N>s.Nialah bilangan saat sehingga tetingkap berakhir, daripada 1 hingga 60. - Flood protection disemak sebelum baki. Permintaan yang ditolaknya tidak menempah apa-apa dan tidak berkos.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Permintaan | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Dikira, satu bagi setiap permintaan. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Tidak dikira. |
shannon-coder-1 pada /v1/chat/completions dan /v1/messages | Dikira oleh kuota panggilan Shannon Coder sebaliknya. |
Permintaan yang dijawab dengan 401, atau dengan 400 untuk model yang tidak dikenali | Tidak dikira. |
| Permintaan yang ditolak oleh flood protection | Dikira dalam tetingkap. Tiada caj dikenakan. |
Permintaan selari
Tiada had pada bilangan permintaan yang dibuka oleh satu akaun serentak, dan tiada ralat kerana menghantar permintaan secara selari. Permintaan yang tidak dapat bermula serta-merta menunggu dalam barisan dan dijawab mengikut giliran.
- Setiap permintaan dikira dalam 120 seminit apabila ia tiba, sama ada permintaan terdahulu sudah selesai atau belum.
- Setiap permintaan memegang tempahannya sendiri sehingga ia berakhir. Dua puluh permintaan terbuka dengan bajet output lalai memegang 20 × 4,096 = 81,920 token baki. Jika jumlah tempahan lebih besar daripada baki anda, permintaan seterusnya mendapat balasan
Quota exceeded, walaupun panggilan yang sudah selesai akan berkos lebih rendah.max_tokensyang lebih kecil memegang lebih sedikit. - Permintaan tanpa streaming tidak menghantar apa-apa sehingga jawapannya lengkap, jadi berikan klien anda tamat masa yang meliputi penantian itu. Stream mengekalkan sambungannya terbuka semasa menunggu. Penstriman
Had bagi satu permintaan
| Had | Nilai | Terpakai pada | Pada had |
|---|---|---|---|
| Badan permintaan | 32 MiB (33,554,432 bait) | Setiap endpoint | Status 413, jenis invalid_request_error. |
Bajet output: max_tokens, max_completion_tokens, max_output_tokens | 1 hingga 65,536. Lalai 4,096; bagi shannon-coder-1 pada /v1/chat/completions dan /v1/messages, lalainya 65,536. | Setiap model, sebagai jumlah yang ditempah daripada baki anda. Sebagai had pada panjang jawapan: model open-weight yang dihoskan, shannon-1.6-lite, shannon-1.6-pro dan shannon-coder-1. | Nilai di luar julat dialihkan ke hujung julat yang terdekat. Tiada ralat. |
Jujukan henti: stop, stop_sequences | 4 rentetan | Model open-weight yang dihoskan | 4 rentetan tidak kosong yang pertama digunakan. |
| Imej atau fail yang diberikan sebagai URL | 8 MiB, dibaca dalam masa 20 saat, paling banyak 5 ubah hala, alamat http atau https awam | Setiap endpoint yang menerima imej atau fail | Permintaan dijawab tanpa bahagian itu. Tiada ralat. |
| Imej atau fail yang dihantar sebaris (base64) | Tiada had tersendiri. Ia dikira dalam badan permintaan 32 MiB. | Setiap endpoint yang menerima imej atau fail | Status 413 untuk seluruh permintaan. |
text bagi POST /v1/tokenize | 4,000,000 bait | /v1/tokenize | Status 413, jenis invalid_request_error, mesej text too long. |
messages bagi POST /v1/tokenize dan badan POST /v1/messages/count_tokens | Badan permintaan 32 MiB | Kedua-dua endpoint pengiraan | Status 413. |
| Tetingkap konteks | Bagi setiap model: context_window dalam GET /v1/models | Setiap model | Apa yang berlaku kepada perbualan yang lebih panjang bergantung pada model. Model & harga |
Carian web (web_search: true) | Bagi setiap pelan dan hari: Free 3, Plus 30, Standard 50, Pro 60. Satu carian dikira bagi permintaan yang carian itu menemui hasil. | Permintaan yang menetapkan web_search: true | Apabila tiada lagi, permintaan dijawab tanpa carian. Tiada ralat. Carian Web Terbina dalam |
Ralat
Balasan pada halaman ini. Pada /v1/messages, objek error yang sama dibungkus sebagai {"type": "error", "error": {…}}.
| Status | Jenis | Mesej | Bila, dan apa yang perlu dibuat |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Tempahan permintaan tidak muat dalam baki anda. Tunggu sehingga 00:00 UTC, tambah nilai kredit, tukar pelan, atau hantar max_tokens yang lebih kecil. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Lebih daripada 120 permintaan dalam minit semasa. Tunggu N saat dan hantar semula. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Panggilan Shannon Coder bagi tetingkap 4 jam semasa telah habis digunakan. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model tidak dapat menerima permintaan pada masa ini. Hantar semula selepas berhenti seketika. |
503 | api_error | Could not verify your quota right now. Please retry. | Baki anda tidak dapat dibaca. Tiada caj dikenakan; hantar semula permintaan. Pada /v1/responses dengan model Shannon, statusnya ialah 500. |
413 | invalid_request_error | Badan permintaan lebih besar daripada 32 MiB. Pada endpoint format OpenAI, objek error membawa code: "request_too_large". | |
413 | invalid_request_error | text too long | text bagi POST /v1/tokenize lebih panjang daripada 4,000,000 bait. |