ขีดจำกัดและยอดคงเหลือ
ทุกคำขอได้รับบริการเท่ากัน ไม่มีระดับอัตรา ไม่มีโควตา API แยกต่างหาก คุณจ่ายค่า tokens ไปแล้ว ใช้เร็วแค่ไหนก็ได้
หน้านี้อธิบายว่ายอดคงเหลือประกอบด้วยอะไร หนึ่งคำขอจองและคิดเงินเท่าไร ส่งคำขอได้กี่รายการ และขีดจำกัดไม่กี่ข้อที่คำขอเดียวอาจพบ
- มูลค่าของยอดคงเหลือ 1M tokens
- $5.00
- โควตารายวันต่ออายุ
- 00:00 UTC
- การป้องกันการท่วมคำขอ ต่อบัญชี
- 120 คำขอ / นาที
คำขอได้รับการให้บริการอย่างไร
- ไม่มีระดับอัตรา — มีกฎข้อเดียวที่จำกัดความเร็วที่คำขอจะเข้ามาได้ และเหมือนกันทุกบัญชีทุกแผน: 120 คำขอต่อนาที ไม่มีขีดจำกัด tokens ต่อนาที
- ไม่มีโควตา API แยกต่างหาก — API ใช้ยอดคงเหลือเดียวกันกับแชต แผนกำหนดขนาดของโควตาวันนี้ ไม่ได้กำหนดอัตราคำขอ
- เร็วแค่ไหนก็ได้ — คำขอที่ส่งแบบขนานจะได้รับการยอมรับและรอในคิว ไม่ถูกปฏิเสธเพียงเพราะเป็นแบบขนาน
ยอดคงเหลือของคุณ
ยอดคงเหลือของคุณนับเป็น tokens ยอดคงเหลือ 1,000,000 tokens มีมูลค่า $5.00 และราคาทุกรายการในหน้าโมเดลและราคาคืออัตราเทียบกับมูลค่านี้
ในทุกขณะ ยอดคงเหลือคือผลรวมของสองส่วน
- โควตาแผนรายวัน — จำนวน tokens ที่กำหนดโดยแผนของคุณ ต่ออายุใหม่ทุกวันเวลา 00:00 UTC ส่วนที่เหลือเมื่อสิ้นวันจะไม่ยกไป
- เครดิตที่ซื้อเพิ่ม — Tokens ที่คุณซื้อเป็นแพ็ก เครดิตไม่มีวันหมดอายุและใช้ได้กับทุกแผน รวมถึง Free
| แผน | Tokens ต่อวัน | มูลค่า |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- ลำดับการใช้จ่าย — ทุกคำขอจะใช้โควตาแผนรายวันก่อน เครดิตที่ซื้อเพิ่มจะถูกใช้เฉพาะส่วนที่เกินโควตาในวันนั้น
- แชตและ API ใช้ร่วมกัน — แต่ละบัญชีมียอดคงเหลือเดียว API key ใช้จากยอดคงเหลือของบัญชีที่เป็นเจ้าของคีย์ ในราคาเดียวกับแชต
- แพ็ก — เครดิตขายเป็นแพ็ก 1,000,000 ($5.00), 2,000,000 ($10.00) และ 5,000,000 ($25.00) tokens หรือจำนวนตามที่คุณเลือกตั้งแต่ 1,000,000 ถึง 100,000,000 tokens ในอัตรา $5.00 ต่อ 1,000,000
สิ่งที่คำขอจองและค่าใช้จ่าย
- จอง — เมื่อคำขอมาถึง จะจองงบเอาต์พุตจากยอดคงเหลือของคุณ:
max_tokensบน/v1/chat/completionsและ/v1/messages,max_output_tokensบน/v1/responsesนอกจากนี้/v1/chat/completionsยังอ่านmax_completion_tokensค่าเริ่มต้นคือ 4,096 และช่วงที่ใช้ได้คือ 1 ถึง 65,536 - ยอมรับ — คำขอจะได้รับการยอมรับก็ต่อเมื่อค่าที่จองพอดีกับยอดคงเหลือของคุณ หากยอดคงเหลือมากกว่าศูนย์แต่น้อยกว่างบเอาต์พุต จะได้รับคำตอบ
Quota exceededให้ส่งmax_tokensที่น้อยลงเพื่อใช้ส่วนที่เหลือ - ชำระ — เมื่อคำตอบสมบูรณ์ ค่าที่จองไว้จะถูกแทนที่ด้วยค่าใช้จ่ายจริง ซึ่งอาจต่ำกว่าหรือสูงกว่าค่าที่จอง
- คืน — คำขอที่จบด้วยสถานะข้อผิดพลาดจะคืนค่าที่จองไว้ครบถ้วน
ค่าใช้จ่ายจริงขึ้นอยู่กับตระกูลของโมเดล
| โมเดล | สิ่งที่คิดเงิน |
|---|---|
| โมเดล Shannon | usage.total_tokens ตามราคาต่อ 1M ของโมเดล อินพุตและเอาต์พุตใช้อัตราเดียวกัน |
| โมเดล open-weight ที่โฮสต์ | อินพุตที่ไม่ได้แคชคิดตามอัตราอินพุต อินพุตที่แคชไว้คิดตามอัตราแคช เอาต์พุตคิดตามอัตราเอาต์พุต |
จำนวนเงิน USD จะถูกหักจากยอดคงเหลือเป็น tokens ในอัตรา $5.00 ต่อ 1,000,000 ปัดเป็น token เต็มหน่วย
การนับ tokens ด้วย POST /v1/tokenize หรือ POST /v1/messages/count_tokens ไม่มีค่าใช้จ่ายและไม่จองอะไร การนับ token
ดูยอดคงเหลือและการใช้งานได้ที่ไหน
หน้าคีย์และการใช้งานแสดงสิ่งที่คุณใช้ได้ในตอนนี้ โควตาแผนรายวัน เครดิตที่ซื้อเพิ่ม และยอดใช้จ่าย API ในรอบ 30 วันที่ผ่านมา ด้านล่างแสดงรายการทุกคำขอที่คีย์ของคุณส่ง: เวลา endpoint โมเดล อินพุตที่แคชไว้ tokens ที่เรียกเก็บ และค่าใช้จ่าย คีย์และการใช้งาน
ทุกคำตอบมีออบเจ็กต์ usage ที่แสดงจำนวน tokens ของการเรียกนั้นด้วย
| เอนด์พอยต์ | ฟิลด์ของ usage | เพิ่มโดยโมเดล open-weight ที่โฮสต์ |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageเก็บจำนวน tokens ของโมเดล จำนวนที่หักจากยอดคงเหลือของคุณไม่อยู่ในคำตอบ: ดูได้ที่คอลัมน์ Billed tokens ของรายการคำขอในหน้าคีย์และการใช้งาน- บน
/v1/messagesกับโมเดล open-weight ที่โฮสต์input_tokensคือส่วนของอินพุตที่ไม่ได้แคช,cache_read_input_tokensคือส่วนที่แคชไว้ และcache_creation_input_tokensเป็น0เสมอ - สตรีมบน
/v1/chat/completionsส่งusageใน chunk สุดท้ายก่อน[DONE]สตรีมมิง
เมื่อยอดคงเหลือหมด
คำขอที่ค่าที่จองไม่พอดีกับยอดคงเหลือของคุณจะได้รับคำตอบสถานะ 429 ประเภท rate_limit_error และข้อความด้านล่าง ไม่มีการคิดเงิน คำตอบเดียวกันนี้ยังถูกส่งเมื่อยอดคงเหลือมากกว่าศูนย์แต่น้อยกว่างบเอาต์พุตของคำขอ
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} บน /v1/responses ออบเจ็กต์ error อาจมี code และ param ด้วย โดยทั้งคู่เป็น null
สิ่งที่คุณทำได้:
- รอโควตาแผนรอบถัดไปเวลา 00:00 UTC
- เติมเครดิต เครดิตจะถูกใช้หลังโควตาแผน และไม่หมดอายุ เติมเครดิต
- เปลี่ยนไปใช้แผนที่มีโควตารายวันมากกว่า เปลี่ยนแผน
- ส่ง
max_tokensที่น้อยลง หากยังมียอดคงเหลืออยู่: ค่าที่จองก็จะน้อยลง
โควตาการเรียก Shannon Coder
shannon-coder-1 บน /v1/chat/completions และ /v1/messages นับเป็นจำนวนการเรียก ไม่ใช่ tokens แต่ละแผนมีจำนวนการเรียกต่อช่วง 4 ชั่วโมง หนึ่งคำขอคือหนึ่งการเรียก
| แผน | การเรียกต่อช่วง 4 ชั่วโมง |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- แต่ละช่วงเริ่มเวลา 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC การเรียกที่เหลือเมื่อสิ้นสุดช่วงจะไม่ยกไป
- การเรียกจะถูกนับเมื่อคำขอได้รับการยอมรับ ก่อนที่โมเดลจะตอบ คำขอที่ล้มเหลวภายหลังก็ยังนับเป็นหนึ่งการเรียก
- การเรียกเหล่านี้ไม่จอง tokens และไม่หักจากยอดคงเหลือของคุณ รายการคำขอในหน้าคีย์และการใช้งานแสดงจำนวน tokens และมูลค่าตามราคาที่ประกาศ
max_tokensเริ่มต้นของshannon-coder-1บนสอง endpoint นี้คือ 65,536- เมื่อไม่มีการเรียกเหลือ คำตอบจะเป็นสถานะ
429ประเภทrate_limit_errorข้อความShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan - บน
/v1/responsesshannon-coder-1ไม่มีโควตาการเรียก: คิดเป็น tokens จากยอดคงเหลือของคุณที่ $8.00 ต่อ 1M เหมือนโมเดลอื่นทุกตัว
Flood protection
บัญชีหนึ่งส่งได้ 120 คำขอต่อนาที นี่คือขีดจำกัดเดียวของอัตราคำขอ และเท่ากันในทุกแผน มีไว้เพื่อหยุดการท่วมคำขอ ไม่ได้มีไว้ชะลอการใช้งานปกติ
- หนึ่งนาทีคือช่วงเวลาคงที่ 60 วินาทีที่เริ่มเมื่อคุณส่งคำขอแรก เมื่อสิ้นสุด การนับจะเริ่มใหม่จากศูนย์
- การนับเป็นรายบัญชี ไม่ใช่ตามคีย์และไม่ใช่ตามที่อยู่ IP การหมุนเวียนคีย์ (rotate) ไม่ได้เปิดช่วงเวลาใหม่
- คำขอลำดับที่ 121 ภายในช่วงเวลาหนึ่งจะได้รับคำตอบสถานะ
429ประเภทrate_limit_errorและข้อความToo many requests. Retry in <N>s.โดยNคือจำนวนวินาทีจนกว่าช่วงเวลาจะสิ้นสุด ตั้งแต่ 1 ถึง 60 - Flood protection ตรวจก่อนยอดคงเหลือ คำขอที่ถูกปฏิเสธจะไม่จองอะไรและไม่มีค่าใช้จ่าย
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | คำขอ | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | นับ หนึ่งรายการต่อหนึ่งคำขอ |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | ไม่นับ |
shannon-coder-1 บน /v1/chat/completions และ /v1/messages | นับด้วยโควตาการเรียก Shannon Coder แทน |
คำขอที่ตอบด้วย 401 หรือ 400 เพราะ model ที่ไม่รู้จัก | ไม่นับ |
| คำขอที่ถูก flood protection ปฏิเสธ | นับรวมในช่วงเวลา ไม่มีการคิดเงิน |
คำขอแบบขนาน
ไม่มีขีดจำกัดว่าบัญชีหนึ่งเปิดคำขอพร้อมกันได้กี่รายการ และไม่มีข้อผิดพลาดสำหรับการส่งคำขอแบบขนาน คำขอที่เริ่มทันทีไม่ได้จะรอในคิวและได้รับคำตอบตามลำดับ
- แต่ละคำขอนับรวมใน 120 ต่อนาทีเมื่อมาถึง ไม่ว่าคำขอก่อนหน้าจะเสร็จแล้วหรือไม่
- แต่ละคำขอถือค่าที่จองของตัวเองจนกว่าจะจบ คำขอที่เปิดอยู่ยี่สิบรายการด้วยงบเอาต์พุตเริ่มต้นถือยอดคงเหลือ 20 × 4,096 = 81,920 tokens หากค่าที่จองรวมกันมากกว่ายอดคงเหลือ คำขอถัดไปจะได้รับคำตอบ
Quota exceededแม้ว่าการเรียกที่เสร็จแล้วจะคิดเงินน้อยกว่าmax_tokensที่น้อยลงจะถือน้อยลง - คำขอที่ไม่ใช่สตรีมจะไม่ส่งอะไรจนกว่าคำตอบจะสมบูรณ์ ดังนั้นให้ตั้ง timeout ของไคลเอนต์ให้ครอบคลุมเวลารอ สตรีมจะเปิดการเชื่อมต่อค้างไว้ระหว่างรอ สตรีมมิง
ขีดจำกัดของคำขอเดียว
| ขีดจำกัด | ค่า | ใช้กับ | เมื่อถึงขีดจำกัด |
|---|---|---|---|
| เนื้อหาคำขอ (request body) | 32 MiB (33,554,432 ไบต์) | ทุก endpoint | สถานะ 413 ประเภท invalid_request_error |
งบเอาต์พุต: max_tokens, max_completion_tokens, max_output_tokens | 1 ถึง 65,536 ค่าเริ่มต้น 4,096 สำหรับ shannon-coder-1 บน /v1/chat/completions และ /v1/messages ค่าเริ่มต้นคือ 65,536 | ทุกโมเดล ในฐานะจำนวนที่จองจากยอดคงเหลือของคุณ ในฐานะขีดจำกัดความยาวของคำตอบ: โมเดล open-weight ที่โฮสต์, shannon-1.6-lite, shannon-1.6-pro และ shannon-coder-1 | ค่านอกช่วงจะถูกปรับไปที่ปลายช่วงที่ใกล้ที่สุด ไม่มีข้อผิดพลาด |
ลำดับหยุด (stop sequences): stop, stop_sequences | 4 สตริง | โมเดล open-weight ที่โฮสต์ | ใช้ 4 สตริงแรกที่ไม่ว่าง |
| รูปภาพหรือไฟล์ที่ระบุเป็น URL | 8 MiB อ่านภายใน 20 วินาที redirect ไม่เกิน 5 ครั้ง ที่อยู่ http หรือ https สาธารณะ | ทุก endpoint ที่รับรูปภาพหรือไฟล์ | คำขอจะถูกตอบโดยไม่มีส่วนนั้น ไม่มีข้อผิดพลาด |
| รูปภาพหรือไฟล์ที่ส่งแบบ inline (base64) | ไม่มีขีดจำกัดของตัวเอง นับรวมในเนื้อหาคำขอ 32 MiB | ทุก endpoint ที่รับรูปภาพหรือไฟล์ | สถานะ 413 สำหรับทั้งคำขอ |
text ของ POST /v1/tokenize | 4,000,000 ไบต์ | /v1/tokenize | สถานะ 413 ประเภท invalid_request_error ข้อความ text too long |
messages ของ POST /v1/tokenize และ body ของ POST /v1/messages/count_tokens | เนื้อหาคำขอ 32 MiB | ทั้งสอง endpoint สำหรับนับ | สถานะ 413 |
| Context window | ตามโมเดล: context_window ใน GET /v1/models | ทุกโมเดล | สิ่งที่เกิดกับบทสนทนาที่ยาวกว่านั้นขึ้นอยู่กับโมเดล โมเดลและราคา |
การค้นหาเว็บ (web_search: true) | ต่อแผนและต่อวัน: Free 3, Plus 30, Standard 50, Pro 60 คำขอที่การค้นหาพบผลลัพธ์นับเป็นการค้นหาหนึ่งครั้ง | คำขอที่ตั้ง web_search: true | เมื่อไม่เหลือ คำขอจะถูกตอบโดยไม่ค้นหา ไม่มีข้อผิดพลาด ค้นหาเว็บในตัว |
ข้อผิดพลาด
คำตอบที่พบในหน้านี้ บน /v1/messages ออบเจ็กต์ error เดียวกันจะถูกห่อเป็น {"type": "error", "error": {…}}
| สถานะ | ประเภท | ข้อความ | เมื่อใด และควรทำอย่างไร |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | ค่าที่จองของคำขอไม่พอดีกับยอดคงเหลือของคุณ ให้รอถึง 00:00 UTC เติมเครดิต เปลี่ยนแผน หรือส่ง max_tokens ที่น้อยลง |
429 | rate_limit_error | Too many requests. Retry in <N>s. | มีคำขอมากกว่า 120 รายการในนาทีปัจจุบัน ให้รอ N วินาทีแล้วส่งอีกครั้ง |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | การเรียก Shannon Coder ของช่วง 4 ชั่วโมงปัจจุบันใช้หมดแล้ว |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | ขณะนี้โมเดลรับคำขอไม่ได้ ให้ส่งอีกครั้งหลังหยุดสักครู่ |
503 | api_error | Could not verify your quota right now. Please retry. | อ่านยอดคงเหลือของคุณไม่ได้ ไม่มีการคิดเงิน ให้ส่งคำขออีกครั้ง บน /v1/responses กับโมเดล Shannon สถานะคือ 500 |
413 | invalid_request_error | เนื้อหาคำขอ (request body) ใหญ่กว่า 32 MiB บน endpoint รูปแบบ OpenAI ออบเจ็กต์ error จะมี code: "request_too_large" | |
413 | invalid_request_error | text too long | text ของ POST /v1/tokenize ยาวกว่า 4,000,000 ไบต์ |