Langkau ke kandungan
Had dan baki

Had dan baki

Setiap permintaan dilayan sama rata. Tiada peringkat kadar. Tiada kuota API yang berasingan. Anda sudah membayar untuk token anda — gunakannya sepantas yang anda mahu.

Halaman ini menerangkan apa yang membentuk baki anda, apa yang ditempah dan dikos oleh satu permintaan, berapa banyak permintaan yang boleh anda hantar, dan beberapa had yang boleh dihadapi oleh satu permintaan.

nilai 1M token baki
$5.00
kuota harian diperbaharui
00:00 UTC
flood protection, bagi setiap akaun
120 permintaan / min

Cara permintaan dilayan

  • Tiada peringkat kadar — Satu peraturan mengehadkan kelajuan permintaan tiba, dan ia sama untuk setiap akaun dan setiap pelan: 120 permintaan seminit. Tiada had pada token seminit.
  • Tiada kuota API yang berasingan — API membelanjakan baki yang sama seperti sembang. Pelan menetapkan saiz kuota hari ini. Ia tidak menetapkan kadar permintaan.
  • Sepantas yang anda mahu — Permintaan yang dihantar secara selari diterima dan menunggu dalam barisan. Ia tidak ditolak kerana selari.

Baki anda

Baki anda dikira dalam token. 1,000,000 token baki bernilai $5.00, dan setiap harga pada halaman Model & harga ialah kadar berbanding nilai itu.

Pada bila-bila masa, baki ialah jumlah dua bahagian.

  • Kuota pelan hari ini — Bilangan token yang ditetapkan oleh pelan anda. Ia diperbaharui setiap hari pada 00:00 UTC. Baki pada penghujung hari tidak dibawa ke hadapan.
  • Kredit yang dibeli — Token yang anda beli sebagai pek. Kredit tidak tamat tempoh dan berfungsi pada setiap pelan, termasuk Free.
Pelan Token sehari Bernilai
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Urutan perbelanjaan — Setiap permintaan membelanjakan kuota pelan hari ini dahulu. Kredit yang dibeli hanya digunakan untuk bahagian yang melebihi kuota pada hari itu.
  • Sembang dan API berkongsinya — Terdapat satu baki bagi setiap akaun. Kunci API membelanjakan daripada baki akaun yang memilikinya, pada harga yang sama seperti sembang.
  • Pek — Kredit dijual dalam pek 1,000,000 ($5.00), 2,000,000 ($10.00) dan 5,000,000 ($25.00) token, atau sebagai jumlah pilihan anda daripada 1,000,000 hingga 100,000,000 token pada $5.00 bagi setiap 1,000,000.

Tambah nilai kredit Tukar pelan

Apa yang ditempah oleh permintaan dan berapa kosnya

  • Tempah — Apabila permintaan tiba, ia menempah bajet outputnya daripada baki anda: max_tokens pada /v1/chat/completions dan /v1/messages, max_output_tokens pada /v1/responses. /v1/chat/completions juga membaca max_completion_tokens. Nilai lalainya 4,096 dan julatnya 1 hingga 65,536.
  • Terima — Permintaan diterima hanya jika tempahan itu muat dalam baki anda yang berbaki. Baki yang melebihi sifar tetapi lebih kecil daripada bajet output akan mendapat balasan Quota exceeded. Hantar max_tokens yang lebih kecil untuk menggunakan bakinya.
  • Selesai — Apabila jawapan lengkap, tempahan digantikan dengan caj sebenar. Caj boleh lebih rendah atau lebih tinggi daripada tempahan.
  • Pulang — Permintaan yang berakhir dengan status ralat memulangkan tempahannya sepenuhnya.

Caj sebenar bergantung pada keluarga model.

Model Apa yang dicaj
Model Shannon usage.total_tokens pada harga model bagi setiap 1M. Input dan output mempunyai satu kadar.
Model open-weight yang dihoskan Input tanpa cache pada kadar input, input cached pada kadar cached, output pada kadar output.

Jumlah dalam USD diambil daripada baki anda dalam token pada $5.00 bagi setiap 1,000,000, dibundarkan kepada token yang bulat.

Mengira token dengan POST /v1/tokenize atau POST /v1/messages/count_tokens adalah percuma dan tidak menempah apa-apa. Pengiraan token

Tempat melihat baki dan penggunaan

Halaman Kunci & penggunaan menunjukkan apa yang boleh anda belanjakan sekarang, kuota pelan hari ini, kredit yang anda beli dan perbelanjaan API 30 hari yang lalu. Di bawahnya, ia menyenaraikan setiap permintaan yang dibuat oleh kunci anda: masa, endpoint, model, input cached, token yang dibilkan dan kos. Kunci & penggunaan

Setiap balasan juga membawa objek usage dengan bilangan token bagi panggilan itu.

Endpoint Medan usage Ditambah oleh model open-weight yang dihoskan
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage memegang bilangan token model. Jumlah yang diambil daripada baki anda tidak ada dalam balasan: ia ialah lajur Token dibilkan dalam senarai permintaan pada Kunci & penggunaan.
  • Pada /v1/messages dengan model open-weight yang dihoskan, input_tokens ialah bahagian input yang tidak di-cache, cache_read_input_tokens ialah bahagian cached dan cache_creation_input_tokens sentiasa 0.
  • Stream pada /v1/chat/completions membawa usage dalam chunk terakhirnya sebelum [DONE]. Penstriman

Apabila baki habis

Permintaan yang tempahannya tidak muat dalam baki anda dijawab dengan status 429, jenis rate_limit_error dan mesej di bawah. Tiada caj dikenakan. Balasan yang sama dihantar apabila baki melebihi sifar tetapi lebih kecil daripada bajet output permintaan.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Pada /v1/responses, objek error juga boleh memegang code dan param, kedua-duanya null.

Apa yang boleh anda lakukan:

  • Tunggu kuota pelan seterusnya pada 00:00 UTC.
  • Tambah nilai kredit. Kredit dibelanjakan selepas kuota pelan dan tidak tamat tempoh. Tambah nilai kredit
  • Tukar kepada pelan dengan kuota harian yang lebih besar. Tukar pelan
  • Hantar max_tokens yang lebih kecil, jika masih ada baki: tempahan menjadi lebih kecil.

Kuota panggilan Shannon Coder

shannon-coder-1 pada /v1/chat/completions dan /v1/messages dikira dalam panggilan, bukan dalam token. Setiap pelan termasuk sejumlah panggilan bagi setiap tetingkap 4 jam. Satu permintaan ialah satu panggilan.

Pelan Panggilan bagi setiap tetingkap 4 jam
Free 3
Plus 20
Standard 40
Pro 60
  • Tetingkap bermula pada 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Panggilan yang berbaki pada penghujung tetingkap tidak dibawa ke hadapan.
  • Panggilan dikira apabila permintaan diterima, sebelum model menjawab. Permintaan yang gagal selepas itu tetap dikira sebagai panggilan.
  • Panggilan ini tidak menempah token dan tidak mengambil apa-apa daripada baki anda. Senarai permintaan pada Kunci & penggunaan menunjukkan bilangan token dan nilainya pada harga yang disenaraikan.
  • max_tokens lalai bagi shannon-coder-1 pada dua endpoint ini ialah 65,536.
  • Apabila tiada panggilan lagi, balasannya ialah status 429, jenis rate_limit_error, mesej Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Pada /v1/responses, shannon-coder-1 tidak mempunyai kuota panggilan: ia dicaj dalam token daripada baki anda pada $8.00 bagi setiap 1M, seperti model lain.

Flood protection

Satu akaun boleh menghantar 120 permintaan seminit. Itulah satu-satunya had pada kadar permintaan, dan ia sama pada setiap pelan. Ia wujud untuk menghentikan lonjakan permintaan, bukan untuk melambatkan penggunaan biasa.

  • Minit ialah tetingkap tetap selama 60 saat yang dibuka dengan permintaan pertama anda. Apabila ia berakhir, kiraan bermula semula dari sifar.
  • Kiraan adalah bagi setiap akaun, bukan bagi setiap kunci dan bukan bagi setiap alamat IP. Memutar kunci tidak membuka tetingkap baharu.
  • Permintaan ke-121 dalam satu tetingkap dijawab dengan status 429, jenis rate_limit_error dan mesej Too many requests. Retry in <N>s. N ialah bilangan saat sehingga tetingkap berakhir, daripada 1 hingga 60.
  • Flood protection disemak sebelum baki. Permintaan yang ditolaknya tidak menempah apa-apa dan tidak berkos.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Permintaan Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Dikira, satu bagi setiap permintaan.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Tidak dikira.
shannon-coder-1 pada /v1/chat/completions dan /v1/messages Dikira oleh kuota panggilan Shannon Coder sebaliknya.
Permintaan yang dijawab dengan 401, atau dengan 400 untuk model yang tidak dikenali Tidak dikira.
Permintaan yang ditolak oleh flood protection Dikira dalam tetingkap. Tiada caj dikenakan.

Permintaan selari

Tiada had pada bilangan permintaan yang dibuka oleh satu akaun serentak, dan tiada ralat kerana menghantar permintaan secara selari. Permintaan yang tidak dapat bermula serta-merta menunggu dalam barisan dan dijawab mengikut giliran.

  • Setiap permintaan dikira dalam 120 seminit apabila ia tiba, sama ada permintaan terdahulu sudah selesai atau belum.
  • Setiap permintaan memegang tempahannya sendiri sehingga ia berakhir. Dua puluh permintaan terbuka dengan bajet output lalai memegang 20 × 4,096 = 81,920 token baki. Jika jumlah tempahan lebih besar daripada baki anda, permintaan seterusnya mendapat balasan Quota exceeded, walaupun panggilan yang sudah selesai akan berkos lebih rendah. max_tokens yang lebih kecil memegang lebih sedikit.
  • Permintaan tanpa streaming tidak menghantar apa-apa sehingga jawapannya lengkap, jadi berikan klien anda tamat masa yang meliputi penantian itu. Stream mengekalkan sambungannya terbuka semasa menunggu. Penstriman

Had bagi satu permintaan

Had Nilai Terpakai pada Pada had
Badan permintaan 32 MiB (33,554,432 bait) Setiap endpoint Status 413, jenis invalid_request_error.
Bajet output: max_tokens, max_completion_tokens, max_output_tokens 1 hingga 65,536. Lalai 4,096; bagi shannon-coder-1 pada /v1/chat/completions dan /v1/messages, lalainya 65,536. Setiap model, sebagai jumlah yang ditempah daripada baki anda. Sebagai had pada panjang jawapan: model open-weight yang dihoskan, shannon-1.6-lite, shannon-1.6-pro dan shannon-coder-1. Nilai di luar julat dialihkan ke hujung julat yang terdekat. Tiada ralat.
Jujukan henti: stop, stop_sequences 4 rentetan Model open-weight yang dihoskan 4 rentetan tidak kosong yang pertama digunakan.
Imej atau fail yang diberikan sebagai URL 8 MiB, dibaca dalam masa 20 saat, paling banyak 5 ubah hala, alamat http atau https awam Setiap endpoint yang menerima imej atau fail Permintaan dijawab tanpa bahagian itu. Tiada ralat.
Imej atau fail yang dihantar sebaris (base64) Tiada had tersendiri. Ia dikira dalam badan permintaan 32 MiB. Setiap endpoint yang menerima imej atau fail Status 413 untuk seluruh permintaan.
text bagi POST /v1/tokenize 4,000,000 bait /v1/tokenize Status 413, jenis invalid_request_error, mesej text too long.
messages bagi POST /v1/tokenize dan badan POST /v1/messages/count_tokens Badan permintaan 32 MiB Kedua-dua endpoint pengiraan Status 413.
Tetingkap konteks Bagi setiap model: context_window dalam GET /v1/models Setiap model Apa yang berlaku kepada perbualan yang lebih panjang bergantung pada model. Model & harga
Carian web (web_search: true) Bagi setiap pelan dan hari: Free 3, Plus 30, Standard 50, Pro 60. Satu carian dikira bagi permintaan yang carian itu menemui hasil. Permintaan yang menetapkan web_search: true Apabila tiada lagi, permintaan dijawab tanpa carian. Tiada ralat. Carian Web Terbina dalam

Ralat

Balasan pada halaman ini. Pada /v1/messages, objek error yang sama dibungkus sebagai {"type": "error", "error": {…}}.

Status Jenis Mesej Bila, dan apa yang perlu dibuat
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Tempahan permintaan tidak muat dalam baki anda. Tunggu sehingga 00:00 UTC, tambah nilai kredit, tukar pelan, atau hantar max_tokens yang lebih kecil.
429 rate_limit_error Too many requests. Retry in <N>s. Lebih daripada 120 permintaan dalam minit semasa. Tunggu N saat dan hantar semula.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Panggilan Shannon Coder bagi tetingkap 4 jam semasa telah habis digunakan.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model tidak dapat menerima permintaan pada masa ini. Hantar semula selepas berhenti seketika.
503 api_error Could not verify your quota right now. Please retry. Baki anda tidak dapat dibaca. Tiada caj dikenakan; hantar semula permintaan. Pada /v1/responses dengan model Shannon, statusnya ialah 500.
413 invalid_request_error Badan permintaan lebih besar daripada 32 MiB. Pada endpoint format OpenAI, objek error membawa code: "request_too_large".
413 invalid_request_error text too long text bagi POST /v1/tokenize lebih panjang daripada 4,000,000 bait.