Batas dan saldo
Setiap permintaan dilayani secara setara. Tanpa tingkat rate. Tanpa kuota API terpisah. Anda sudah membayar token Anda — pakai secepat yang Anda mau.
Halaman ini menjelaskan terdiri dari apa saldo Anda, apa yang dicadangkan dan dibiayai satu permintaan, berapa banyak permintaan yang boleh Anda kirim, dan beberapa batas yang dapat ditemui satu permintaan.
- nilai 1M token saldo
- $5.00
- kuota harian diperbarui
- 00:00 UTC
- flood protection, per akun
- 120 permintaan / menit
Bagaimana permintaan dilayani
- Tanpa tingkat rate — Satu aturan membatasi seberapa cepat permintaan boleh tiba, dan sama untuk setiap akun dan setiap paket: 120 permintaan per menit. Tidak ada batas token per menit.
- Tanpa kuota API terpisah — API memakai saldo yang sama dengan chat. Paket menentukan besar kuota hari ini. Paket tidak menentukan laju permintaan.
- Secepat yang Anda mau — Permintaan yang dikirim paralel diterima dan mengantre. Permintaan tidak ditolak hanya karena paralel.
Saldo Anda
Saldo Anda dihitung dalam token. 1,000,000 token saldo bernilai $5.00, dan setiap harga di halaman Model & harga adalah tarif terhadap nilai itu.
Pada setiap saat, saldo adalah jumlah dari dua bagian.
- Kuota paket hari ini — Sejumlah token yang ditentukan paket Anda. Diperbarui setiap hari pukul 00:00 UTC. Sisa di akhir hari tidak dibawa ke hari berikutnya.
- Kredit yang dibeli — Token yang Anda beli sebagai paket. Kredit tidak kedaluwarsa dan berlaku di setiap paket, termasuk Free.
| Paket | Token per hari | Senilai |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Urutan pemakaian — Setiap permintaan memakai kuota paket hari ini lebih dulu. Kredit yang dibeli hanya dipakai untuk bagian yang melebihi kuota pada hari itu.
- Chat dan API berbagi saldo — Ada satu saldo per akun. API key memakai saldo akun pemiliknya, dengan harga yang sama seperti chat.
- Paket kredit — Kredit dijual dalam paket 1,000,000 ($5.00), 2,000,000 ($10.00), dan 5,000,000 ($25.00) token, atau sebagai jumlah pilihan Anda dari 1,000,000 hingga 100,000,000 token dengan tarif $5.00 per 1,000,000.
Apa yang dicadangkan dan dibiayai sebuah permintaan
- Cadangan — Ketika permintaan tiba, ia mencadangkan anggaran outputnya dari saldo Anda:
max_tokensdi/v1/chat/completionsdan/v1/messages,max_output_tokensdi/v1/responses./v1/chat/completionsjuga membacamax_completion_tokens. Defaultnya 4,096 dan rentangnya 1 sampai 65,536. - Penerimaan — Permintaan diterima hanya jika cadangannya muat dalam sisa saldo Anda. Saldo yang di atas nol tetapi lebih kecil daripada anggaran output mendapat balasan
Quota exceeded. Kirimmax_tokensyang lebih kecil untuk memakai sisanya. - Penyelesaian — Ketika jawaban selesai, cadangan diganti dengan tagihan sebenarnya. Tagihan dapat lebih rendah atau lebih tinggi daripada cadangan.
- Pengembalian — Permintaan yang berakhir dengan status error mengembalikan seluruh cadangannya.
Tagihan sebenarnya bergantung pada keluarga model.
| Model | Yang ditagih |
|---|---|
| Model Shannon | usage.total_tokens dengan harga model per 1M. Input dan output memiliki satu tarif. |
| Model open-weight hosted | Input tanpa cache dengan tarif input, input ter-cache dengan tarif cached, output dengan tarif output. |
Jumlah dalam USD diambil dari saldo token Anda dengan tarif $5.00 per 1,000,000, dibulatkan ke bilangan token bulat.
Menghitung token dengan POST /v1/tokenize atau POST /v1/messages/count_tokens gratis dan tidak mencadangkan apa pun. Penghitungan token
Tempat melihat saldo dan penggunaan
Halaman Keys & usage menampilkan apa yang dapat Anda belanjakan sekarang, kuota paket hari ini, kredit yang Anda beli, dan pengeluaran API selama 30 hari terakhir. Di bawahnya tercantum setiap permintaan yang dibuat kunci Anda: waktu, endpoint, model, input ter-cache, token yang ditagih, dan biaya. Keys & usage
Setiap balasan juga membawa objek usage berisi jumlah token dari panggilan itu.
| Endpoint | Field usage | Ditambahkan oleh model open-weight hosted |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageberisi jumlah token dari model. Jumlah yang diambil dari saldo Anda tidak ada di balasan: jumlah itu ada di kolom Token tertagih pada daftar permintaan di Keys & usage.- Di
/v1/messagesdengan model open-weight hosted,input_tokensadalah bagian input yang tidak ter-cache,cache_read_input_tokensadalah bagian yang ter-cache, dancache_creation_input_tokensselalu0. - Stream pada
/v1/chat/completionsmembawausagedi chunk terakhirnya sebelum[DONE]. Streaming
Ketika saldo habis
Permintaan yang cadangannya tidak muat dalam saldo Anda dijawab dengan status 429, tipe rate_limit_error, dan pesan di bawah. Tidak ada yang ditagih. Balasan yang sama dikirim ketika saldo di atas nol tetapi lebih kecil daripada anggaran output permintaan.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Di /v1/responses, objek error juga dapat berisi code dan param, keduanya null.
Yang dapat Anda lakukan:
- Tunggu kuota paket berikutnya pada pukul 00:00 UTC.
- Isi ulang kredit. Kredit dipakai setelah kuota paket dan tidak kedaluwarsa. Isi ulang kredit
- Pindah ke paket dengan kuota harian yang lebih besar. Ubah paket
- Kirim
max_tokensyang lebih kecil, jika masih ada saldo: cadangannya akan lebih kecil.
Kuota panggilan Shannon Coder
shannon-coder-1 di /v1/chat/completions dan /v1/messages dihitung dalam panggilan, bukan token. Setiap paket menyertakan sejumlah panggilan per jendela 4 jam. Satu permintaan adalah satu panggilan.
| Paket | Panggilan per jendela 4 jam |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Jendela dimulai pada pukul 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Panggilan yang tersisa di akhir jendela tidak dibawa ke jendela berikutnya.
- Panggilan dihitung ketika permintaan diterima, sebelum model menjawab. Permintaan yang gagal setelahnya tetap dihitung sebagai panggilan.
- Panggilan ini tidak mencadangkan token dan tidak mengambil apa pun dari saldo Anda. Daftar permintaan di Keys & usage menampilkan jumlah token dan nilainya pada harga yang tercantum.
- Default
max_tokensuntukshannon-coder-1di kedua endpoint ini adalah 65,536. - Jika panggilan habis, balasannya berstatus
429, bertiperate_limit_error, dengan pesanShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Di
/v1/responses,shannon-coder-1tidak memiliki kuota panggilan: ia ditagih dalam token dari saldo Anda dengan $8.00 per 1M, seperti model lainnya.
Flood protection
Sebuah akun boleh mengirim 120 permintaan per menit. Itu satu-satunya batas laju permintaan, dan sama di setiap paket. Batas ini ada untuk menghentikan banjir permintaan, bukan memperlambat penggunaan normal.
- Menit adalah jendela tetap berdurasi 60 detik yang dibuka oleh permintaan pertama Anda. Ketika berakhir, hitungan dimulai lagi dari nol.
- Penghitungan dilakukan per akun, bukan per kunci dan bukan per alamat IP. Merotasi kunci tidak membuka jendela baru.
- Permintaan ke-121 dalam satu jendela dijawab dengan status
429, tiperate_limit_error, dan pesanToo many requests. Retry in <N>s.Nadalah jumlah detik sampai jendela berakhir, dari 1 sampai 60. - Flood protection diperiksa sebelum saldo. Permintaan yang ditolaknya tidak mencadangkan apa pun dan tidak dikenai biaya.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Permintaan | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Dihitung, satu per permintaan. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Tidak dihitung. |
shannon-coder-1 di /v1/chat/completions dan /v1/messages | Dihitung oleh kuota panggilan Shannon Coder sebagai gantinya. |
Permintaan yang dijawab dengan 401, atau dengan 400 karena model tidak dikenal | Tidak dihitung. |
| Permintaan yang ditolak oleh flood protection | Dihitung dalam jendela. Tidak ada yang ditagih. |
Permintaan paralel
Tidak ada batas jumlah permintaan yang dapat dibuka akun secara bersamaan, dan tidak ada error karena mengirim permintaan paralel. Permintaan yang tidak dapat langsung dimulai mengantre dan dijawab bergiliran.
- Setiap permintaan dihitung dalam 120 per menit saat tiba, baik permintaan sebelumnya sudah selesai maupun belum.
- Setiap permintaan menahan cadangannya sendiri sampai selesai. Dua puluh permintaan terbuka dengan anggaran output default menahan 20 × 4,096 = 81,920 token saldo. Jika seluruh cadangan lebih besar daripada saldo Anda, permintaan berikutnya mendapat balasan
Quota exceeded, padahal panggilan yang sudah selesai akan berbiaya lebih kecil.max_tokensyang lebih kecil menahan lebih sedikit. - Permintaan tanpa streaming tidak mengirim apa pun sampai jawabannya lengkap, jadi beri klien Anda timeout yang mencakup waktu tunggu itu. Stream menjaga koneksinya tetap terbuka selagi menunggu. Streaming
Batas satu permintaan
| Batas | Nilai | Berlaku untuk | Pada batas |
|---|---|---|---|
| Body permintaan | 32 MiB (33,554,432 byte) | Setiap endpoint | Status 413, tipe invalid_request_error. |
Anggaran output: max_tokens, max_completion_tokens, max_output_tokens | 1 sampai 65,536. Default 4,096; untuk shannon-coder-1 di /v1/chat/completions dan /v1/messages defaultnya 65,536. | Setiap model, sebagai jumlah yang dicadangkan dari saldo Anda. Sebagai batas panjang jawaban: model open-weight hosted, shannon-1.6-lite, shannon-1.6-pro, dan shannon-coder-1. | Nilai di luar rentang dipindahkan ke ujung rentang terdekat. Tanpa error. |
Stop sequence: stop, stop_sequences | 4 string | Model open-weight hosted | 4 string tidak kosong yang pertama yang dipakai. |
| Gambar atau file yang diberikan sebagai URL | 8 MiB, dibaca dalam 20 detik, paling banyak 5 pengalihan, alamat http atau https publik | Setiap endpoint yang menerima gambar atau file | Permintaan dijawab tanpa bagian itu. Tanpa error. |
| Gambar atau file yang dikirim inline (base64) | Tidak ada batas tersendiri. Dihitung dalam body permintaan 32 MiB. | Setiap endpoint yang menerima gambar atau file | Status 413 untuk seluruh permintaan. |
text pada POST /v1/tokenize | 4,000,000 byte | /v1/tokenize | Status 413, tipe invalid_request_error, pesan text too long. |
messages pada POST /v1/tokenize dan body POST /v1/messages/count_tokens | Body permintaan 32 MiB | Kedua endpoint penghitungan | Status 413. |
| Jendela konteks | Per model: context_window di GET /v1/models | Setiap model | Apa yang terjadi pada percakapan yang lebih panjang bergantung pada model. Model & harga |
Pencarian web (web_search: true) | Per paket dan hari: Free 3, Plus 30, Standard 50, Pro 60. Satu pencarian dihitung untuk permintaan yang pencariannya menemukan hasil. | Permintaan yang mengatur web_search: true | Jika habis, permintaan dijawab tanpa pencarian. Tanpa error. Pencarian Web Terintegrasi |
Error
Balasan di halaman ini. Di /v1/messages, objek error yang sama dibungkus sebagai {"type": "error", "error": {…}}.
| Status | Tipe | Pesan | Kapan, dan apa yang harus dilakukan |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Cadangan permintaan tidak muat dalam saldo Anda. Tunggu pukul 00:00 UTC, isi ulang kredit, ganti paket, atau kirim max_tokens yang lebih kecil. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Lebih dari 120 permintaan dalam menit berjalan. Tunggu N detik dan kirim ulang. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Panggilan Shannon Coder pada jendela 4 jam saat ini sudah habis. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model tidak dapat menerima permintaan saat ini. Kirim ulang setelah jeda singkat. |
503 | api_error | Could not verify your quota right now. Please retry. | Saldo Anda tidak dapat dibaca. Tidak ada yang ditagih; kirim ulang permintaan. Di /v1/responses dengan model Shannon, statusnya 500. |
413 | invalid_request_error | Body permintaan lebih besar dari 32 MiB. Pada endpoint berformat OpenAI, objek error membawa code: "request_too_large". | |
413 | invalid_request_error | text too long | text pada POST /v1/tokenize lebih panjang dari 4,000,000 byte. |