ข้ามไปยังเนื้อหา
ขีดจำกัดและยอดคงเหลือ

ขีดจำกัดและยอดคงเหลือ

ทุกคำขอได้รับบริการเท่ากัน ไม่มีระดับอัตรา ไม่มีโควตา API แยกต่างหาก คุณจ่ายค่า tokens ไปแล้ว ใช้เร็วแค่ไหนก็ได้

หน้านี้อธิบายว่ายอดคงเหลือประกอบด้วยอะไร หนึ่งคำขอจองและคิดเงินเท่าไร ส่งคำขอได้กี่รายการ และขีดจำกัดไม่กี่ข้อที่คำขอเดียวอาจพบ

มูลค่าของยอดคงเหลือ 1M tokens
$5.00
โควตารายวันต่ออายุ
00:00 UTC
การป้องกันการท่วมคำขอ ต่อบัญชี
120 คำขอ / นาที

คำขอได้รับการให้บริการอย่างไร

  • ไม่มีระดับอัตรา — มีกฎข้อเดียวที่จำกัดความเร็วที่คำขอจะเข้ามาได้ และเหมือนกันทุกบัญชีทุกแผน: 120 คำขอต่อนาที ไม่มีขีดจำกัด tokens ต่อนาที
  • ไม่มีโควตา API แยกต่างหาก — API ใช้ยอดคงเหลือเดียวกันกับแชต แผนกำหนดขนาดของโควตาวันนี้ ไม่ได้กำหนดอัตราคำขอ
  • เร็วแค่ไหนก็ได้ — คำขอที่ส่งแบบขนานจะได้รับการยอมรับและรอในคิว ไม่ถูกปฏิเสธเพียงเพราะเป็นแบบขนาน

ยอดคงเหลือของคุณ

ยอดคงเหลือของคุณนับเป็น tokens ยอดคงเหลือ 1,000,000 tokens มีมูลค่า $5.00 และราคาทุกรายการในหน้าโมเดลและราคาคืออัตราเทียบกับมูลค่านี้

ในทุกขณะ ยอดคงเหลือคือผลรวมของสองส่วน

  • โควตาแผนรายวัน — จำนวน tokens ที่กำหนดโดยแผนของคุณ ต่ออายุใหม่ทุกวันเวลา 00:00 UTC ส่วนที่เหลือเมื่อสิ้นวันจะไม่ยกไป
  • เครดิตที่ซื้อเพิ่ม — Tokens ที่คุณซื้อเป็นแพ็ก เครดิตไม่มีวันหมดอายุและใช้ได้กับทุกแผน รวมถึง Free
แผน Tokens ต่อวัน มูลค่า
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • ลำดับการใช้จ่าย — ทุกคำขอจะใช้โควตาแผนรายวันก่อน เครดิตที่ซื้อเพิ่มจะถูกใช้เฉพาะส่วนที่เกินโควตาในวันนั้น
  • แชตและ API ใช้ร่วมกัน — แต่ละบัญชีมียอดคงเหลือเดียว API key ใช้จากยอดคงเหลือของบัญชีที่เป็นเจ้าของคีย์ ในราคาเดียวกับแชต
  • แพ็ก — เครดิตขายเป็นแพ็ก 1,000,000 ($5.00), 2,000,000 ($10.00) และ 5,000,000 ($25.00) tokens หรือจำนวนตามที่คุณเลือกตั้งแต่ 1,000,000 ถึง 100,000,000 tokens ในอัตรา $5.00 ต่อ 1,000,000

เติมเครดิต เปลี่ยนแผน

สิ่งที่คำขอจองและค่าใช้จ่าย

  • จอง — เมื่อคำขอมาถึง จะจองงบเอาต์พุตจากยอดคงเหลือของคุณ: max_tokens บน /v1/chat/completions และ /v1/messages, max_output_tokens บน /v1/responses นอกจากนี้ /v1/chat/completions ยังอ่าน max_completion_tokens ค่าเริ่มต้นคือ 4,096 และช่วงที่ใช้ได้คือ 1 ถึง 65,536
  • ยอมรับ — คำขอจะได้รับการยอมรับก็ต่อเมื่อค่าที่จองพอดีกับยอดคงเหลือของคุณ หากยอดคงเหลือมากกว่าศูนย์แต่น้อยกว่างบเอาต์พุต จะได้รับคำตอบ Quota exceeded ให้ส่ง max_tokens ที่น้อยลงเพื่อใช้ส่วนที่เหลือ
  • ชำระ — เมื่อคำตอบสมบูรณ์ ค่าที่จองไว้จะถูกแทนที่ด้วยค่าใช้จ่ายจริง ซึ่งอาจต่ำกว่าหรือสูงกว่าค่าที่จอง
  • คืน — คำขอที่จบด้วยสถานะข้อผิดพลาดจะคืนค่าที่จองไว้ครบถ้วน

ค่าใช้จ่ายจริงขึ้นอยู่กับตระกูลของโมเดล

โมเดล สิ่งที่คิดเงิน
โมเดล Shannon usage.total_tokens ตามราคาต่อ 1M ของโมเดล อินพุตและเอาต์พุตใช้อัตราเดียวกัน
โมเดล open-weight ที่โฮสต์ อินพุตที่ไม่ได้แคชคิดตามอัตราอินพุต อินพุตที่แคชไว้คิดตามอัตราแคช เอาต์พุตคิดตามอัตราเอาต์พุต

จำนวนเงิน USD จะถูกหักจากยอดคงเหลือเป็น tokens ในอัตรา $5.00 ต่อ 1,000,000 ปัดเป็น token เต็มหน่วย

การนับ tokens ด้วย POST /v1/tokenize หรือ POST /v1/messages/count_tokens ไม่มีค่าใช้จ่ายและไม่จองอะไร การนับ token

ดูยอดคงเหลือและการใช้งานได้ที่ไหน

หน้าคีย์และการใช้งานแสดงสิ่งที่คุณใช้ได้ในตอนนี้ โควตาแผนรายวัน เครดิตที่ซื้อเพิ่ม และยอดใช้จ่าย API ในรอบ 30 วันที่ผ่านมา ด้านล่างแสดงรายการทุกคำขอที่คีย์ของคุณส่ง: เวลา endpoint โมเดล อินพุตที่แคชไว้ tokens ที่เรียกเก็บ และค่าใช้จ่าย คีย์และการใช้งาน

ทุกคำตอบมีออบเจ็กต์ usage ที่แสดงจำนวน tokens ของการเรียกนั้นด้วย

เอนด์พอยต์ ฟิลด์ของ usage เพิ่มโดยโมเดล open-weight ที่โฮสต์
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage เก็บจำนวน tokens ของโมเดล จำนวนที่หักจากยอดคงเหลือของคุณไม่อยู่ในคำตอบ: ดูได้ที่คอลัมน์ Billed tokens ของรายการคำขอในหน้าคีย์และการใช้งาน
  • บน /v1/messages กับโมเดล open-weight ที่โฮสต์ input_tokens คือส่วนของอินพุตที่ไม่ได้แคช, cache_read_input_tokens คือส่วนที่แคชไว้ และ cache_creation_input_tokens เป็น 0 เสมอ
  • สตรีมบน /v1/chat/completions ส่ง usage ใน chunk สุดท้ายก่อน [DONE] สตรีมมิง

เมื่อยอดคงเหลือหมด

คำขอที่ค่าที่จองไม่พอดีกับยอดคงเหลือของคุณจะได้รับคำตอบสถานะ 429 ประเภท rate_limit_error และข้อความด้านล่าง ไม่มีการคิดเงิน คำตอบเดียวกันนี้ยังถูกส่งเมื่อยอดคงเหลือมากกว่าศูนย์แต่น้อยกว่างบเอาต์พุตของคำขอ

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

บน /v1/responses ออบเจ็กต์ error อาจมี code และ param ด้วย โดยทั้งคู่เป็น null

สิ่งที่คุณทำได้:

  • รอโควตาแผนรอบถัดไปเวลา 00:00 UTC
  • เติมเครดิต เครดิตจะถูกใช้หลังโควตาแผน และไม่หมดอายุ เติมเครดิต
  • เปลี่ยนไปใช้แผนที่มีโควตารายวันมากกว่า เปลี่ยนแผน
  • ส่ง max_tokens ที่น้อยลง หากยังมียอดคงเหลืออยู่: ค่าที่จองก็จะน้อยลง

โควตาการเรียก Shannon Coder

shannon-coder-1 บน /v1/chat/completions และ /v1/messages นับเป็นจำนวนการเรียก ไม่ใช่ tokens แต่ละแผนมีจำนวนการเรียกต่อช่วง 4 ชั่วโมง หนึ่งคำขอคือหนึ่งการเรียก

แผน การเรียกต่อช่วง 4 ชั่วโมง
Free 3
Plus 20
Standard 40
Pro 60
  • แต่ละช่วงเริ่มเวลา 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC การเรียกที่เหลือเมื่อสิ้นสุดช่วงจะไม่ยกไป
  • การเรียกจะถูกนับเมื่อคำขอได้รับการยอมรับ ก่อนที่โมเดลจะตอบ คำขอที่ล้มเหลวภายหลังก็ยังนับเป็นหนึ่งการเรียก
  • การเรียกเหล่านี้ไม่จอง tokens และไม่หักจากยอดคงเหลือของคุณ รายการคำขอในหน้าคีย์และการใช้งานแสดงจำนวน tokens และมูลค่าตามราคาที่ประกาศ
  • max_tokens เริ่มต้นของ shannon-coder-1 บนสอง endpoint นี้คือ 65,536
  • เมื่อไม่มีการเรียกเหลือ คำตอบจะเป็นสถานะ 429 ประเภท rate_limit_error ข้อความ Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan
  • บน /v1/responses shannon-coder-1 ไม่มีโควตาการเรียก: คิดเป็น tokens จากยอดคงเหลือของคุณที่ $8.00 ต่อ 1M เหมือนโมเดลอื่นทุกตัว

Flood protection

บัญชีหนึ่งส่งได้ 120 คำขอต่อนาที นี่คือขีดจำกัดเดียวของอัตราคำขอ และเท่ากันในทุกแผน มีไว้เพื่อหยุดการท่วมคำขอ ไม่ได้มีไว้ชะลอการใช้งานปกติ

  • หนึ่งนาทีคือช่วงเวลาคงที่ 60 วินาทีที่เริ่มเมื่อคุณส่งคำขอแรก เมื่อสิ้นสุด การนับจะเริ่มใหม่จากศูนย์
  • การนับเป็นรายบัญชี ไม่ใช่ตามคีย์และไม่ใช่ตามที่อยู่ IP การหมุนเวียนคีย์ (rotate) ไม่ได้เปิดช่วงเวลาใหม่
  • คำขอลำดับที่ 121 ภายในช่วงเวลาหนึ่งจะได้รับคำตอบสถานะ 429 ประเภท rate_limit_error และข้อความ Too many requests. Retry in <N>s. โดย N คือจำนวนวินาทีจนกว่าช่วงเวลาจะสิ้นสุด ตั้งแต่ 1 ถึง 60
  • Flood protection ตรวจก่อนยอดคงเหลือ คำขอที่ถูกปฏิเสธจะไม่จองอะไรและไม่มีค่าใช้จ่าย
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
คำขอ Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses นับ หนึ่งรายการต่อหนึ่งคำขอ
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens ไม่นับ
shannon-coder-1 บน /v1/chat/completions และ /v1/messages นับด้วยโควตาการเรียก Shannon Coder แทน
คำขอที่ตอบด้วย 401 หรือ 400 เพราะ model ที่ไม่รู้จัก ไม่นับ
คำขอที่ถูก flood protection ปฏิเสธ นับรวมในช่วงเวลา ไม่มีการคิดเงิน

คำขอแบบขนาน

ไม่มีขีดจำกัดว่าบัญชีหนึ่งเปิดคำขอพร้อมกันได้กี่รายการ และไม่มีข้อผิดพลาดสำหรับการส่งคำขอแบบขนาน คำขอที่เริ่มทันทีไม่ได้จะรอในคิวและได้รับคำตอบตามลำดับ

  • แต่ละคำขอนับรวมใน 120 ต่อนาทีเมื่อมาถึง ไม่ว่าคำขอก่อนหน้าจะเสร็จแล้วหรือไม่
  • แต่ละคำขอถือค่าที่จองของตัวเองจนกว่าจะจบ คำขอที่เปิดอยู่ยี่สิบรายการด้วยงบเอาต์พุตเริ่มต้นถือยอดคงเหลือ 20 × 4,096 = 81,920 tokens หากค่าที่จองรวมกันมากกว่ายอดคงเหลือ คำขอถัดไปจะได้รับคำตอบ Quota exceeded แม้ว่าการเรียกที่เสร็จแล้วจะคิดเงินน้อยกว่า max_tokens ที่น้อยลงจะถือน้อยลง
  • คำขอที่ไม่ใช่สตรีมจะไม่ส่งอะไรจนกว่าคำตอบจะสมบูรณ์ ดังนั้นให้ตั้ง timeout ของไคลเอนต์ให้ครอบคลุมเวลารอ สตรีมจะเปิดการเชื่อมต่อค้างไว้ระหว่างรอ สตรีมมิง

ขีดจำกัดของคำขอเดียว

ขีดจำกัด ค่า ใช้กับ เมื่อถึงขีดจำกัด
เนื้อหาคำขอ (request body) 32 MiB (33,554,432 ไบต์) ทุก endpoint สถานะ 413 ประเภท invalid_request_error
งบเอาต์พุต: max_tokens, max_completion_tokens, max_output_tokens 1 ถึง 65,536 ค่าเริ่มต้น 4,096 สำหรับ shannon-coder-1 บน /v1/chat/completions และ /v1/messages ค่าเริ่มต้นคือ 65,536 ทุกโมเดล ในฐานะจำนวนที่จองจากยอดคงเหลือของคุณ ในฐานะขีดจำกัดความยาวของคำตอบ: โมเดล open-weight ที่โฮสต์, shannon-1.6-lite, shannon-1.6-pro และ shannon-coder-1 ค่านอกช่วงจะถูกปรับไปที่ปลายช่วงที่ใกล้ที่สุด ไม่มีข้อผิดพลาด
ลำดับหยุด (stop sequences): stop, stop_sequences 4 สตริง โมเดล open-weight ที่โฮสต์ ใช้ 4 สตริงแรกที่ไม่ว่าง
รูปภาพหรือไฟล์ที่ระบุเป็น URL 8 MiB อ่านภายใน 20 วินาที redirect ไม่เกิน 5 ครั้ง ที่อยู่ http หรือ https สาธารณะ ทุก endpoint ที่รับรูปภาพหรือไฟล์ คำขอจะถูกตอบโดยไม่มีส่วนนั้น ไม่มีข้อผิดพลาด
รูปภาพหรือไฟล์ที่ส่งแบบ inline (base64) ไม่มีขีดจำกัดของตัวเอง นับรวมในเนื้อหาคำขอ 32 MiB ทุก endpoint ที่รับรูปภาพหรือไฟล์ สถานะ 413 สำหรับทั้งคำขอ
text ของ POST /v1/tokenize 4,000,000 ไบต์ /v1/tokenize สถานะ 413 ประเภท invalid_request_error ข้อความ text too long
messages ของ POST /v1/tokenize และ body ของ POST /v1/messages/count_tokens เนื้อหาคำขอ 32 MiB ทั้งสอง endpoint สำหรับนับ สถานะ 413
Context window ตามโมเดล: context_window ใน GET /v1/models ทุกโมเดล สิ่งที่เกิดกับบทสนทนาที่ยาวกว่านั้นขึ้นอยู่กับโมเดล โมเดลและราคา
การค้นหาเว็บ (web_search: true) ต่อแผนและต่อวัน: Free 3, Plus 30, Standard 50, Pro 60 คำขอที่การค้นหาพบผลลัพธ์นับเป็นการค้นหาหนึ่งครั้ง คำขอที่ตั้ง web_search: true เมื่อไม่เหลือ คำขอจะถูกตอบโดยไม่ค้นหา ไม่มีข้อผิดพลาด ค้นหาเว็บในตัว

ข้อผิดพลาด

คำตอบที่พบในหน้านี้ บน /v1/messages ออบเจ็กต์ error เดียวกันจะถูกห่อเป็น {"type": "error", "error": {…}}

สถานะ ประเภท ข้อความ เมื่อใด และควรทำอย่างไร
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan ค่าที่จองของคำขอไม่พอดีกับยอดคงเหลือของคุณ ให้รอถึง 00:00 UTC เติมเครดิต เปลี่ยนแผน หรือส่ง max_tokens ที่น้อยลง
429 rate_limit_error Too many requests. Retry in <N>s. มีคำขอมากกว่า 120 รายการในนาทีปัจจุบัน ให้รอ N วินาทีแล้วส่งอีกครั้ง
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan การเรียก Shannon Coder ของช่วง 4 ชั่วโมงปัจจุบันใช้หมดแล้ว
429 rate_limit_error Shannon routes are temporarily busy. Please retry. ขณะนี้โมเดลรับคำขอไม่ได้ ให้ส่งอีกครั้งหลังหยุดสักครู่
503 api_error Could not verify your quota right now. Please retry. อ่านยอดคงเหลือของคุณไม่ได้ ไม่มีการคิดเงิน ให้ส่งคำขออีกครั้ง บน /v1/responses กับโมเดล Shannon สถานะคือ 500
413 invalid_request_error เนื้อหาคำขอ (request body) ใหญ่กว่า 32 MiB บน endpoint รูปแบบ OpenAI ออบเจ็กต์ error จะมี code: "request_too_large"
413 invalid_request_error text too long text ของ POST /v1/tokenize ยาวกว่า 4,000,000 ไบต์