Chuyển đến nội dung
Giới hạn và số dư

Giới hạn và số dư

Mọi yêu cầu được phục vụ như nhau. Không có bậc tốc độ. Không có hạn ngạch API riêng. Bạn đã trả tiền cho token của mình rồi — hãy dùng nhanh bao nhiêu tùy thích.

Trang này giải thích số dư của bạn gồm những gì, một yêu cầu giữ chỗ và tốn bao nhiêu, bạn được gửi bao nhiêu yêu cầu, và một vài giới hạn mà một yêu cầu đơn lẻ có thể gặp.

giá trị của 1M token số dư
$5.00
hạn mức hằng ngày được làm mới
00:00 UTC
flood protection, theo tài khoản
120 yêu cầu / phút

Cách các yêu cầu được phục vụ

  • Không có bậc tốc độ — Một quy tắc giới hạn tốc độ các yêu cầu có thể đến, và nó giống nhau cho mọi tài khoản và mọi gói: 120 yêu cầu mỗi phút. Không có giới hạn token mỗi phút.
  • Không có hạn ngạch API riêng — API trừ cùng một số dư với chat. Gói quy định quy mô hạn mức hôm nay. Nó không quy định tốc độ yêu cầu.
  • Nhanh tùy thích — Các yêu cầu gửi song song được chấp nhận và xếp hàng chờ. Chúng không bị từ chối chỉ vì song song.

Số dư của bạn

Số dư của bạn được tính bằng token. 1,000,000 token số dư có giá trị $5.00, và mọi mức giá trên trang Models & pricing là tỷ lệ so với giá trị đó.

Tại mọi thời điểm, số dư là tổng của hai phần.

  • Hạn mức gói hôm nay — Một số token do gói của bạn quy định. Hạn mức được làm mới mỗi ngày lúc 00:00 UTC. Phần còn lại vào cuối ngày không được chuyển sang ngày sau.
  • Tín dụng đã mua — Token bạn đã mua theo gói. Tín dụng không hết hạn và dùng được trên mọi gói, kể cả Free.
Gói Token mỗi ngày Giá trị
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Thứ tự chi tiêu — Mỗi yêu cầu trừ vào hạn mức gói hôm nay trước. Tín dụng đã mua chỉ được dùng cho phần vượt quá hạn mức trong ngày đó.
  • Chat và API dùng chung — Mỗi tài khoản có một số dư. API key trừ vào số dư của tài khoản sở hữu nó, với cùng mức giá như chat.
  • Các gói — Tín dụng được bán theo gói 1,000,000 ($5.00), 2,000,000 ($10.00) và 5,000,000 ($25.00) token, hoặc theo số lượng tùy chọn từ 1,000,000 đến 100,000,000 token với giá $5.00 cho mỗi 1,000,000.

Nạp thêm tín dụng Thay đổi gói

Một yêu cầu giữ chỗ bao nhiêu và tốn bao nhiêu

  • Giữ chỗ — Khi một yêu cầu đến, nó giữ ngân sách đầu ra từ số dư của bạn: max_tokens trên /v1/chat/completions và /v1/messages, max_output_tokens trên /v1/responses. /v1/chat/completions cũng đọc max_completion_tokens. Mặc định là 4,096 và phạm vi từ 1 đến 65,536.
  • Chấp nhận — Yêu cầu chỉ được chấp nhận nếu phần giữ chỗ vừa với số dư còn lại của bạn. Số dư lớn hơn không nhưng nhỏ hơn ngân sách đầu ra sẽ nhận phản hồi Quota exceeded. Hãy gửi max_tokens nhỏ hơn để dùng phần còn lại.
  • Quyết toán — Khi câu trả lời hoàn tất, phần giữ chỗ được thay bằng mức phí thực tế. Mức phí có thể thấp hơn hoặc cao hơn phần giữ chỗ.
  • Hoàn lại — Yêu cầu kết thúc với trạng thái lỗi sẽ được hoàn lại toàn bộ phần giữ chỗ.

Mức tính phí thực tế phụ thuộc vào dòng model.

Model Cái được tính phí
Các model Shannon usage.total_tokens theo giá của model cho mỗi 1M. Đầu vào và đầu ra có chung một mức giá.
Các model open-weight hosted Đầu vào không cache tính theo giá đầu vào, đầu vào được cache tính theo giá cached, đầu ra tính theo giá đầu ra.

Số tiền USD được trừ khỏi số dư token của bạn với giá $5.00 cho mỗi 1,000,000, làm tròn đến một token nguyên.

Đếm token bằng POST /v1/tokenize hoặc POST /v1/messages/count_tokens là miễn phí và không giữ chỗ gì. Đếm token

Nơi xem số dư và mức sử dụng

Trang Keys & usage hiển thị số bạn có thể chi tiêu ngay bây giờ, hạn mức gói hôm nay, tín dụng đã mua và chi phí API của 30 ngày qua. Bên dưới là danh sách mọi yêu cầu mà key của bạn đã thực hiện: thời gian, endpoint, model, đầu vào được cache, token được tính phí và chi phí. Keys & usage

Mọi phản hồi cũng mang một đối tượng usage với số token của lượt gọi đó.

Endpoint Các trường của usage Được thêm bởi các model open-weight hosted
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage chứa số token của model. Số tiền bị trừ khỏi số dư của bạn không nằm trong phản hồi: đó là cột Billed tokens trong danh sách yêu cầu ở Keys & usage.
  • Trên /v1/messages với một model open-weight hosted, input_tokens là phần đầu vào không cache, cache_read_input_tokens là phần được cache và cache_creation_input_tokens luôn là 0.
  • Một luồng stream trên /v1/chat/completions mang usage trong chunk cuối cùng trước [DONE]. Truyền phát

Khi số dư cạn

Yêu cầu có phần giữ chỗ không vừa với số dư của bạn được trả lời với trạng thái 429, loại rate_limit_error và thông báo bên dưới. Không có gì bị tính phí. Cùng phản hồi này cũng được gửi khi số dư lớn hơn không nhưng nhỏ hơn ngân sách đầu ra của yêu cầu.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Trên /v1/responses, đối tượng error cũng có thể chứa code và param, cả hai đều là null.

Những việc bạn có thể làm:

  • Chờ hạn mức gói tiếp theo lúc 00:00 UTC.
  • Nạp thêm tín dụng. Tín dụng được dùng sau hạn mức gói và không hết hạn. Nạp thêm tín dụng
  • Chuyển sang gói có hạn mức hằng ngày lớn hơn. Thay đổi gói
  • Gửi max_tokens nhỏ hơn, nếu còn một phần số dư: khi đó phần giữ chỗ sẽ nhỏ hơn.

Hạn mức lượt gọi Shannon Coder

shannon-coder-1 trên /v1/chat/completions và /v1/messages được tính theo lượt gọi, không phải theo token. Mỗi gói bao gồm một số lượt gọi cho mỗi khung thời gian 4 giờ. Một yêu cầu là một lượt gọi.

Gói Lượt gọi mỗi khung 4 giờ
Free 3
Plus 20
Standard 40
Pro 60
  • Các khung thời gian bắt đầu lúc 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Lượt gọi còn lại vào cuối một khung không được chuyển sang khung sau.
  • Một lượt gọi được tính khi yêu cầu được chấp nhận, trước khi model trả lời. Yêu cầu thất bại sau đó vẫn được tính là một lượt gọi.
  • Các lượt gọi này không giữ token nào và không trừ gì khỏi số dư của bạn. Danh sách yêu cầu ở Keys & usage hiển thị số token và giá trị của chúng theo giá niêm yết.
  • max_tokens mặc định của shannon-coder-1 trên hai endpoint này là 65,536.
  • Khi hết lượt gọi, phản hồi có trạng thái 429, loại rate_limit_error, thông báo Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Trên /v1/responses, shannon-coder-1 không có hạn mức lượt gọi: nó được tính bằng token từ số dư của bạn với giá $8.00 cho mỗi 1M, như mọi model khác.

Flood protection

Một tài khoản có thể gửi 120 yêu cầu mỗi phút. Đó là giới hạn duy nhất về tốc độ yêu cầu, và nó giống nhau trên mọi gói. Nó tồn tại để chặn flood, không phải để làm chậm việc sử dụng bình thường.

  • Phút là một khung cố định 60 giây, mở ra khi bạn gửi yêu cầu đầu tiên. Khi khung kết thúc, số đếm bắt đầu lại từ không.
  • Số đếm tính theo tài khoản, không theo key và không theo địa chỉ IP. Xoay vòng key không mở ra một khung mới.
  • Yêu cầu thứ 121 trong một khung được trả lời với trạng thái 429, loại rate_limit_error và thông báo Too many requests. Retry in <N>s. N là số giây cho đến khi khung kết thúc, từ 1 đến 60.
  • Flood protection được kiểm tra trước số dư. Yêu cầu bị từ chối ở bước này không giữ chỗ và không tốn phí.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Yêu cầu Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Được tính, mỗi yêu cầu một lần.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Không được tính.
shannon-coder-1 trên /v1/chat/completions và /v1/messages Được tính theo hạn mức lượt gọi Shannon Coder thay thế.
Yêu cầu được trả lời với 401, hoặc với 400 do model không xác định Không được tính.
Yêu cầu bị flood protection từ chối Được tính vào khung. Không có gì bị tính phí.

Yêu cầu song song

Không có giới hạn về số yêu cầu một tài khoản có thể mở cùng lúc, và không có lỗi khi gửi yêu cầu song song. Các yêu cầu không thể bắt đầu ngay sẽ xếp hàng chờ và được trả lời lần lượt.

  • Mỗi yêu cầu được tính vào 120 mỗi phút khi nó đến, bất kể các yêu cầu trước đó đã xong hay chưa.
  • Mỗi yêu cầu giữ phần giữ chỗ riêng cho đến khi kết thúc. Hai mươi yêu cầu đang mở với ngân sách đầu ra mặc định giữ 20 × 4,096 = 81,920 token số dư. Nếu tổng các phần giữ chỗ lớn hơn số dư của bạn, yêu cầu tiếp theo nhận phản hồi Quota exceeded, dù các lượt gọi đã xong sẽ tốn ít hơn. max_tokens nhỏ hơn giữ ít hơn.
  • Yêu cầu không streaming không gửi gì cho đến khi câu trả lời hoàn tất, vì vậy hãy đặt cho client của bạn một timeout bao phủ thời gian chờ. Một luồng stream giữ kết nối mở trong khi chờ. Truyền phát

Giới hạn của một yêu cầu đơn lẻ

Giới hạn Giá trị Áp dụng cho Khi đạt giới hạn
Nội dung yêu cầu 32 MiB (33,554,432 byte) Mọi endpoint Trạng thái 413, loại invalid_request_error.
Ngân sách đầu ra: max_tokens, max_completion_tokens, max_output_tokens 1 đến 65,536. Mặc định 4,096; với shannon-coder-1 trên /v1/chat/completions và /v1/messages, mặc định là 65,536. Mọi model, là số lượng được giữ từ số dư của bạn. Là giới hạn độ dài câu trả lời: các model open-weight hosted, shannon-1.6-lite, shannon-1.6-pro và shannon-coder-1. Giá trị nằm ngoài phạm vi được chuyển về đầu gần nhất của phạm vi. Không có lỗi.
Chuỗi dừng: stop, stop_sequences 4 chuỗi Các model open-weight hosted 4 chuỗi không rỗng đầu tiên được sử dụng.
Hình ảnh hoặc tệp được cung cấp dưới dạng URL 8 MiB, đọc trong vòng 20 giây, tối đa 5 lần chuyển hướng, một địa chỉ http hoặc https công khai Mọi endpoint nhận hình ảnh hoặc tệp Yêu cầu được trả lời mà không có phần đó. Không có lỗi.
Hình ảnh hoặc tệp gửi inline (base64) Không có giới hạn riêng. Nó được tính vào nội dung yêu cầu 32 MiB. Mọi endpoint nhận hình ảnh hoặc tệp Trạng thái 413 cho toàn bộ yêu cầu.
text của POST /v1/tokenize 4,000,000 byte /v1/tokenize Trạng thái 413, loại invalid_request_error, thông báo text too long.
messages của POST /v1/tokenize và nội dung của POST /v1/messages/count_tokens Nội dung yêu cầu 32 MiB Cả hai endpoint đếm Trạng thái 413.
Cửa sổ ngữ cảnh Theo từng model: context_window trong GET /v1/models Mọi model Điều xảy ra với cuộc hội thoại dài hơn phụ thuộc vào model. Model và giá
Tìm kiếm web (web_search: true) Theo gói và theo ngày: Free 3, Plus 30, Standard 50, Pro 60. Một lượt tìm kiếm được tính cho yêu cầu mà việc tìm kiếm có kết quả. Các yêu cầu đặt web_search: true Khi hết lượt, yêu cầu được trả lời mà không tìm kiếm. Không có lỗi. Tìm kiếm web tích hợp

Lỗi

Các phản hồi của trang này. Trên /v1/messages, cùng đối tượng error được bọc dưới dạng {"type": "error", "error": {…}}.

Trạng thái Loại Thông báo Khi nào, và cần làm gì
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Phần giữ chỗ của yêu cầu không vừa với số dư của bạn. Hãy chờ đến 00:00 UTC, nạp thêm tín dụng, đổi gói, hoặc gửi max_tokens nhỏ hơn.
429 rate_limit_error Too many requests. Retry in <N>s. Hơn 120 yêu cầu trong phút hiện tại. Hãy chờ N giây rồi gửi lại.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Các lượt gọi Shannon Coder của khung 4 giờ hiện tại đã dùng hết.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model không thể nhận yêu cầu vào lúc này. Hãy gửi lại sau một khoảng nghỉ ngắn.
503 api_error Could not verify your quota right now. Please retry. Không đọc được số dư của bạn. Không có gì bị tính phí; hãy gửi lại yêu cầu. Trên /v1/responses với model Shannon, trạng thái là 500.
413 invalid_request_error Nội dung yêu cầu lớn hơn 32 MiB. Trên các endpoint định dạng OpenAI, đối tượng error mang code: "request_too_large".
413 invalid_request_error text too long text của POST /v1/tokenize dài hơn 4,000,000 byte.