Langsung ke konten
Batas dan saldo

Batas dan saldo

Setiap permintaan dilayani secara setara. Tanpa tingkat rate. Tanpa kuota API terpisah. Anda sudah membayar token Anda — pakai secepat yang Anda mau.

Halaman ini menjelaskan terdiri dari apa saldo Anda, apa yang dicadangkan dan dibiayai satu permintaan, berapa banyak permintaan yang boleh Anda kirim, dan beberapa batas yang dapat ditemui satu permintaan.

nilai 1M token saldo
$5.00
kuota harian diperbarui
00:00 UTC
flood protection, per akun
120 permintaan / menit

Bagaimana permintaan dilayani

  • Tanpa tingkat rate — Satu aturan membatasi seberapa cepat permintaan boleh tiba, dan sama untuk setiap akun dan setiap paket: 120 permintaan per menit. Tidak ada batas token per menit.
  • Tanpa kuota API terpisah — API memakai saldo yang sama dengan chat. Paket menentukan besar kuota hari ini. Paket tidak menentukan laju permintaan.
  • Secepat yang Anda mau — Permintaan yang dikirim paralel diterima dan mengantre. Permintaan tidak ditolak hanya karena paralel.

Saldo Anda

Saldo Anda dihitung dalam token. 1,000,000 token saldo bernilai $5.00, dan setiap harga di halaman Model & harga adalah tarif terhadap nilai itu.

Pada setiap saat, saldo adalah jumlah dari dua bagian.

  • Kuota paket hari ini — Sejumlah token yang ditentukan paket Anda. Diperbarui setiap hari pukul 00:00 UTC. Sisa di akhir hari tidak dibawa ke hari berikutnya.
  • Kredit yang dibeli — Token yang Anda beli sebagai paket. Kredit tidak kedaluwarsa dan berlaku di setiap paket, termasuk Free.
Paket Token per hari Senilai
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Urutan pemakaian — Setiap permintaan memakai kuota paket hari ini lebih dulu. Kredit yang dibeli hanya dipakai untuk bagian yang melebihi kuota pada hari itu.
  • Chat dan API berbagi saldo — Ada satu saldo per akun. API key memakai saldo akun pemiliknya, dengan harga yang sama seperti chat.
  • Paket kredit — Kredit dijual dalam paket 1,000,000 ($5.00), 2,000,000 ($10.00), dan 5,000,000 ($25.00) token, atau sebagai jumlah pilihan Anda dari 1,000,000 hingga 100,000,000 token dengan tarif $5.00 per 1,000,000.

Isi ulang kredit Ubah paket

Apa yang dicadangkan dan dibiayai sebuah permintaan

  • Cadangan — Ketika permintaan tiba, ia mencadangkan anggaran outputnya dari saldo Anda: max_tokens di /v1/chat/completions dan /v1/messages, max_output_tokens di /v1/responses. /v1/chat/completions juga membaca max_completion_tokens. Defaultnya 4,096 dan rentangnya 1 sampai 65,536.
  • Penerimaan — Permintaan diterima hanya jika cadangannya muat dalam sisa saldo Anda. Saldo yang di atas nol tetapi lebih kecil daripada anggaran output mendapat balasan Quota exceeded. Kirim max_tokens yang lebih kecil untuk memakai sisanya.
  • Penyelesaian — Ketika jawaban selesai, cadangan diganti dengan tagihan sebenarnya. Tagihan dapat lebih rendah atau lebih tinggi daripada cadangan.
  • Pengembalian — Permintaan yang berakhir dengan status error mengembalikan seluruh cadangannya.

Tagihan sebenarnya bergantung pada keluarga model.

Model Yang ditagih
Model Shannon usage.total_tokens dengan harga model per 1M. Input dan output memiliki satu tarif.
Model open-weight hosted Input tanpa cache dengan tarif input, input ter-cache dengan tarif cached, output dengan tarif output.

Jumlah dalam USD diambil dari saldo token Anda dengan tarif $5.00 per 1,000,000, dibulatkan ke bilangan token bulat.

Menghitung token dengan POST /v1/tokenize atau POST /v1/messages/count_tokens gratis dan tidak mencadangkan apa pun. Penghitungan token

Tempat melihat saldo dan penggunaan

Halaman Keys & usage menampilkan apa yang dapat Anda belanjakan sekarang, kuota paket hari ini, kredit yang Anda beli, dan pengeluaran API selama 30 hari terakhir. Di bawahnya tercantum setiap permintaan yang dibuat kunci Anda: waktu, endpoint, model, input ter-cache, token yang ditagih, dan biaya. Keys & usage

Setiap balasan juga membawa objek usage berisi jumlah token dari panggilan itu.

Endpoint Field usage Ditambahkan oleh model open-weight hosted
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage berisi jumlah token dari model. Jumlah yang diambil dari saldo Anda tidak ada di balasan: jumlah itu ada di kolom Token tertagih pada daftar permintaan di Keys & usage.
  • Di /v1/messages dengan model open-weight hosted, input_tokens adalah bagian input yang tidak ter-cache, cache_read_input_tokens adalah bagian yang ter-cache, dan cache_creation_input_tokens selalu 0.
  • Stream pada /v1/chat/completions membawa usage di chunk terakhirnya sebelum [DONE]. Streaming

Ketika saldo habis

Permintaan yang cadangannya tidak muat dalam saldo Anda dijawab dengan status 429, tipe rate_limit_error, dan pesan di bawah. Tidak ada yang ditagih. Balasan yang sama dikirim ketika saldo di atas nol tetapi lebih kecil daripada anggaran output permintaan.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Di /v1/responses, objek error juga dapat berisi code dan param, keduanya null.

Yang dapat Anda lakukan:

  • Tunggu kuota paket berikutnya pada pukul 00:00 UTC.
  • Isi ulang kredit. Kredit dipakai setelah kuota paket dan tidak kedaluwarsa. Isi ulang kredit
  • Pindah ke paket dengan kuota harian yang lebih besar. Ubah paket
  • Kirim max_tokens yang lebih kecil, jika masih ada saldo: cadangannya akan lebih kecil.

Kuota panggilan Shannon Coder

shannon-coder-1 di /v1/chat/completions dan /v1/messages dihitung dalam panggilan, bukan token. Setiap paket menyertakan sejumlah panggilan per jendela 4 jam. Satu permintaan adalah satu panggilan.

Paket Panggilan per jendela 4 jam
Free 3
Plus 20
Standard 40
Pro 60
  • Jendela dimulai pada pukul 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Panggilan yang tersisa di akhir jendela tidak dibawa ke jendela berikutnya.
  • Panggilan dihitung ketika permintaan diterima, sebelum model menjawab. Permintaan yang gagal setelahnya tetap dihitung sebagai panggilan.
  • Panggilan ini tidak mencadangkan token dan tidak mengambil apa pun dari saldo Anda. Daftar permintaan di Keys & usage menampilkan jumlah token dan nilainya pada harga yang tercantum.
  • Default max_tokens untuk shannon-coder-1 di kedua endpoint ini adalah 65,536.
  • Jika panggilan habis, balasannya berstatus 429, bertipe rate_limit_error, dengan pesan Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Di /v1/responses, shannon-coder-1 tidak memiliki kuota panggilan: ia ditagih dalam token dari saldo Anda dengan $8.00 per 1M, seperti model lainnya.

Flood protection

Sebuah akun boleh mengirim 120 permintaan per menit. Itu satu-satunya batas laju permintaan, dan sama di setiap paket. Batas ini ada untuk menghentikan banjir permintaan, bukan memperlambat penggunaan normal.

  • Menit adalah jendela tetap berdurasi 60 detik yang dibuka oleh permintaan pertama Anda. Ketika berakhir, hitungan dimulai lagi dari nol.
  • Penghitungan dilakukan per akun, bukan per kunci dan bukan per alamat IP. Merotasi kunci tidak membuka jendela baru.
  • Permintaan ke-121 dalam satu jendela dijawab dengan status 429, tipe rate_limit_error, dan pesan Too many requests. Retry in <N>s. N adalah jumlah detik sampai jendela berakhir, dari 1 sampai 60.
  • Flood protection diperiksa sebelum saldo. Permintaan yang ditolaknya tidak mencadangkan apa pun dan tidak dikenai biaya.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Permintaan Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Dihitung, satu per permintaan.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Tidak dihitung.
shannon-coder-1 di /v1/chat/completions dan /v1/messages Dihitung oleh kuota panggilan Shannon Coder sebagai gantinya.
Permintaan yang dijawab dengan 401, atau dengan 400 karena model tidak dikenal Tidak dihitung.
Permintaan yang ditolak oleh flood protection Dihitung dalam jendela. Tidak ada yang ditagih.

Permintaan paralel

Tidak ada batas jumlah permintaan yang dapat dibuka akun secara bersamaan, dan tidak ada error karena mengirim permintaan paralel. Permintaan yang tidak dapat langsung dimulai mengantre dan dijawab bergiliran.

  • Setiap permintaan dihitung dalam 120 per menit saat tiba, baik permintaan sebelumnya sudah selesai maupun belum.
  • Setiap permintaan menahan cadangannya sendiri sampai selesai. Dua puluh permintaan terbuka dengan anggaran output default menahan 20 × 4,096 = 81,920 token saldo. Jika seluruh cadangan lebih besar daripada saldo Anda, permintaan berikutnya mendapat balasan Quota exceeded, padahal panggilan yang sudah selesai akan berbiaya lebih kecil. max_tokens yang lebih kecil menahan lebih sedikit.
  • Permintaan tanpa streaming tidak mengirim apa pun sampai jawabannya lengkap, jadi beri klien Anda timeout yang mencakup waktu tunggu itu. Stream menjaga koneksinya tetap terbuka selagi menunggu. Streaming

Batas satu permintaan

Batas Nilai Berlaku untuk Pada batas
Body permintaan 32 MiB (33,554,432 byte) Setiap endpoint Status 413, tipe invalid_request_error.
Anggaran output: max_tokens, max_completion_tokens, max_output_tokens 1 sampai 65,536. Default 4,096; untuk shannon-coder-1 di /v1/chat/completions dan /v1/messages defaultnya 65,536. Setiap model, sebagai jumlah yang dicadangkan dari saldo Anda. Sebagai batas panjang jawaban: model open-weight hosted, shannon-1.6-lite, shannon-1.6-pro, dan shannon-coder-1. Nilai di luar rentang dipindahkan ke ujung rentang terdekat. Tanpa error.
Stop sequence: stop, stop_sequences 4 string Model open-weight hosted 4 string tidak kosong yang pertama yang dipakai.
Gambar atau file yang diberikan sebagai URL 8 MiB, dibaca dalam 20 detik, paling banyak 5 pengalihan, alamat http atau https publik Setiap endpoint yang menerima gambar atau file Permintaan dijawab tanpa bagian itu. Tanpa error.
Gambar atau file yang dikirim inline (base64) Tidak ada batas tersendiri. Dihitung dalam body permintaan 32 MiB. Setiap endpoint yang menerima gambar atau file Status 413 untuk seluruh permintaan.
text pada POST /v1/tokenize 4,000,000 byte /v1/tokenize Status 413, tipe invalid_request_error, pesan text too long.
messages pada POST /v1/tokenize dan body POST /v1/messages/count_tokens Body permintaan 32 MiB Kedua endpoint penghitungan Status 413.
Jendela konteks Per model: context_window di GET /v1/models Setiap model Apa yang terjadi pada percakapan yang lebih panjang bergantung pada model. Model & harga
Pencarian web (web_search: true) Per paket dan hari: Free 3, Plus 30, Standard 50, Pro 60. Satu pencarian dihitung untuk permintaan yang pencariannya menemukan hasil. Permintaan yang mengatur web_search: true Jika habis, permintaan dijawab tanpa pencarian. Tanpa error. Pencarian Web Terintegrasi

Error

Balasan di halaman ini. Di /v1/messages, objek error yang sama dibungkus sebagai {"type": "error", "error": {…}}.

Status Tipe Pesan Kapan, dan apa yang harus dilakukan
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Cadangan permintaan tidak muat dalam saldo Anda. Tunggu pukul 00:00 UTC, isi ulang kredit, ganti paket, atau kirim max_tokens yang lebih kecil.
429 rate_limit_error Too many requests. Retry in <N>s. Lebih dari 120 permintaan dalam menit berjalan. Tunggu N detik dan kirim ulang.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Panggilan Shannon Coder pada jendela 4 jam saat ini sudah habis.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model tidak dapat menerima permintaan saat ini. Kirim ulang setelah jeda singkat.
503 api_error Could not verify your quota right now. Please retry. Saldo Anda tidak dapat dibaca. Tidak ada yang ditagih; kirim ulang permintaan. Di /v1/responses dengan model Shannon, statusnya 500.
413 invalid_request_error Body permintaan lebih besar dari 32 MiB. Pada endpoint berformat OpenAI, objek error membawa code: "request_too_large".
413 invalid_request_error text too long text pada POST /v1/tokenize lebih panjang dari 4,000,000 byte.