Ліміти та баланс
Кожен запит обслуговується однаково. Жодних рівнів швидкості. Жодної окремої квоти API. Ви вже заплатили за свої токени — використовуйте їх так швидко, як хочете.
Ця сторінка пояснює, з чого складається ваш баланс, що резервує і коштує один запит, скільки запитів можна надсилати та які кілька обмежень може зустріти окремий запит.
- вартість 1M токенів балансу
- $5.00
- щоденний ліміт оновлюється
- 00:00 UTC
- захист від флуду, на обліковий запис
- 120 запитів / хв
Як обслуговуються запити
- Жодних рівнів швидкості — Одне правило обмежує, як швидко можуть надходити запити, і воно однакове для кожного облікового запису та кожного плану: 120 запитів на хвилину. Обмеження токенів на хвилину немає.
- Жодної окремої квоти API — API витрачає той самий баланс, що й чат. План визначає розмір сьогоднішнього ліміту. Він не задає частоту запитів.
- Так швидко, як хочете — Запити, надіслані паралельно, приймаються й чекають у черзі. Їх не відхиляють за паралельність.
Ваш баланс
Ваш баланс рахується в токенах. 1,000,000 токенів балансу коштують $5.00, а кожна ціна на сторінці Models & pricing — це тариф відносно цієї вартості.
У будь-який момент баланс — це сума двох частин.
- Сьогоднішній ліміт плану — Кількість токенів, яку задає ваш план. Оновлюється щодня о 00:00 UTC. Те, що лишилося наприкінці дня, не переноситься.
- Придбані кредити — Токени, які ви купили пакетом. Кредит не спливає і діє на кожному плані, зокрема Free.
| План | Токенів на день | Вартість |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Порядок витрат — Кожен запит спочатку витрачає сьогоднішній ліміт плану. Придбані кредити використовуються лише для того, що перевищує ліміт цього дня.
- Чат і API мають спільний баланс — На обліковий запис припадає один баланс. API-ключ витрачає баланс облікового запису, якому він належить, за тими самими цінами, що й чат.
- Пакети — Кредит продається пакетами по 1,000,000 ($5.00), 2,000,000 ($10.00) і 5,000,000 ($25.00) токенів або на суму на ваш вибір від 1,000,000 до 100,000,000 токенів за $5.00 за 1,000,000.
Що запит резервує і скільки коштує
- Резервування — Коли надходить запит, він резервує свій бюджет виводу з вашого балансу:
max_tokensна/v1/chat/completionsі/v1/messages,max_output_tokensна/v1/responses./v1/chat/completionsтакож читаєmax_completion_tokens. Значення за замовчуванням — 4,096, діапазон — від 1 до 65,536. - Прийняття — Запит приймається, лише якщо резерв вміщується в те, що лишилося на вашому балансі. Баланс, що вищий за нуль, але менший за бюджет виводу, отримує відповідь
Quota exceeded. Надішліть меншеmax_tokens, щоб використати залишок. - Розрахунок — Коли відповідь завершено, резерв замінюється справжньою вартістю. Вона може бути нижчою або вищою за резерв.
- Повернення — Запит, що завершується статусом помилки, повністю повертає свій резерв.
Справжня вартість залежить від сімейства моделі.
| Моделі | Що тарифікується |
|---|---|
| Моделі Shannon | usage.total_tokens за ціною моделі за 1M. Вхід і вихід мають один тариф. |
| Хостовані open-weight моделі | Некешований вхід за ціною входу, кешований вхід за ціною кешу, вихід за ціною виходу. |
Сума в USD списується з вашого балансу в токенах за курсом $5.00 за 1,000,000, округлена до цілого токена.
Підрахунок токенів через POST /v1/tokenize або POST /v1/messages/count_tokens безкоштовний і нічого не резервує. Підрахунок токенів
Де бачити баланс і використання
Сторінка Keys & usage показує, що ви можете витратити просто зараз, сьогоднішній ліміт плану, придбані кредити та витрати API за останні 30 днів. Нижче вона перелічує кожен запит вашого ключа: час, ендпоінт, модель, кешований вхід, тарифіковані токени та вартість. Ключі та використання
Кожна відповідь також містить об'єкт usage з кількістю токенів цього виклику.
| Ендпоінт | Поля usage | Додається хостованими open-weight моделями |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageмістить кількість токенів моделі. Суми, яка списується з вашого балансу, у відповіді немає: вона в колонці Billed tokens списку запитів на Keys & usage.- На
/v1/messagesіз хостованою open-weight моделлюinput_tokens— це некешована частина входу,cache_read_input_tokens— кешована частина, аcache_creation_input_tokensзавжди дорівнює0. - Стрім на
/v1/chat/completionsнесеusageв останньому чанку перед[DONE]. Стримінг
Коли баланс закінчується
Запит, резерв якого не вміщується в ваш баланс, отримує відповідь зі статусом 429, типом rate_limit_error і повідомленням нижче. Нічого не списується. Така сама відповідь надсилається, коли баланс вищий за нуль, але менший за бюджет виводу запиту.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} На /v1/responses об'єкт error може також містити code і param, обидва null.
Що можна зробити:
- Зачекайте наступного ліміту плану о 00:00 UTC.
- Поповніть кредит. Кредит витрачається після ліміту плану і не спливає. Поповнити кредит
- Перейдіть на план із більшим щоденним лімітом. Змінити план
- Надішліть менше
max_tokens, якщо на балансі щось лишилося: тоді резерв буде меншим.
Ліміт викликів Shannon Coder
shannon-coder-1 на /v1/chat/completions і /v1/messages рахується у викликах, а не в токенах. Кожен план включає певну кількість викликів на 4-годинне вікно. Один запит — це один виклик.
| План | Викликів на 4-годинне вікно |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Вікна починаються о 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Виклики, що лишилися наприкінці вікна, не переносяться.
- Виклик рахується, коли запит прийнято, до відповіді моделі. Запит, який згодом завершується помилкою, усе одно рахується як виклик.
- Ці виклики не резервують токенів і нічого не забирають із вашого балансу. Список запитів на Keys & usage показує їхню кількість токенів і її вартість за прейскурантною ціною.
- Значення
max_tokensза замовчуванням дляshannon-coder-1на цих двох ендпоінтах — 65,536. - Коли викликів не лишилося, відповідь має статус
429, типrate_limit_errorі повідомленняShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - На
/v1/responsesдляshannon-coder-1немає ліміту викликів: він тарифікується в токенах із вашого балансу за $8.00 за 1M, як і будь-яка інша модель.
Захист від флуду
Обліковий запис може надсилати 120 запитів на хвилину. Це єдине обмеження частоти запитів, і воно однакове на кожному плані. Воно існує, щоб зупиняти флуд, а не уповільнювати звичайне використання.
- Хвилина — це фіксоване вікно в 60 секунд, що відкривається вашим першим запитом. Коли воно закінчується, лічильник знову починається з нуля.
- Лічильник діє на обліковий запис, а не на ключ чи IP-адресу. Заміна ключа не відкриває нового вікна.
- 121-й запит у межах вікна отримує відповідь зі статусом
429, типомrate_limit_errorі повідомленнямToo many requests. Retry in <N>s.N— кількість секунд до кінця вікна, від 1 до 60. - Захист від флуду перевіряється до балансу. Запит, який він відхиляє, нічого не резервує і нічого не коштує.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Запит | Захист від флуду |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Рахується, по одному на запит. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Не рахується. |
shannon-coder-1 на /v1/chat/completions і /v1/messages | Натомість рахується ліміт викликів Shannon Coder. |
Запит, на який відповіли 401, або 400 для невідомої model | Не рахується. |
| Запит, відхилений захистом від флуду | Рахується у вікні. Нічого не списується. |
Паралельні запити
Кількість одночасно відкритих запитів облікового запису не обмежена, і за паралельні запити помилки немає. Запити, які не можуть стартувати одразу, чекають у черзі й обслуговуються по черзі.
- Кожен запит зараховується до 120 на хвилину в момент надходження, незалежно від того, чи завершилися попередні запити.
- Кожен запит тримає власний резерв, доки не завершиться. Двадцять відкритих запитів зі стандартним бюджетом виводу тримають 20 × 4,096 = 81,920 токенів балансу. Якщо сума резервів більша за ваш баланс, наступний запит отримає відповідь
Quota exceeded, хоча завершені виклики коштували б менше. Меншийmax_tokensтримає менше. - Запит без стрімінгу нічого не надсилає, доки відповідь не буде завершена, тож задайте клієнту тайм-аут, що покриває очікування. Стрім тримає з'єднання відкритим, поки чекає. Стримінг
Обмеження окремого запиту
| Ліміт | Значення | Застосовується до | При досягненні ліміту |
|---|---|---|---|
| Тіло запиту | 32 MiB (33,554,432 байтів) | Кожен ендпоінт | Статус 413, тип invalid_request_error. |
Бюджет виводу: max_tokens, max_completion_tokens, max_output_tokens | Від 1 до 65,536. За замовчуванням 4,096; для shannon-coder-1 на /v1/chat/completions і /v1/messages за замовчуванням 65,536. | Кожна модель, як сума, що резервується з вашого балансу. Як обмеження довжини відповіді: хостовані open-weight моделі, shannon-1.6-lite, shannon-1.6-pro і shannon-coder-1. | Значення поза діапазоном зсувається до найближчої межі діапазону. Помилки немає. |
Послідовності зупинки: stop, stop_sequences | 4 рядки | Хостовані open-weight моделі | Використовуються перші 4 непорожні рядки. |
| Зображення або файл, указані як URL | 8 MiB, читання протягом 20 секунд, не більше 5 перенаправлень, публічна адреса http або https | Кожен ендпоінт, що приймає зображення або файли | Відповідь надається без цієї частини. Помилки немає. |
| Зображення або файл, надіслані inline (base64) | Власного ліміту немає. Враховується в тілі запиту 32 MiB. | Кожен ендпоінт, що приймає зображення або файли | Статус 413 для всього запиту. |
text у POST /v1/tokenize | 4,000,000 байтів | /v1/tokenize | Статус 413, тип invalid_request_error, повідомлення text too long. |
messages у POST /v1/tokenize і тіло POST /v1/messages/count_tokens | Тіло запиту 32 MiB | Обидва ендпоінти підрахунку | Статус 413. |
| Контекстне вікно | Залежить від моделі: context_window у GET /v1/models | Кожна модель | Що станеться з довшою розмовою, залежить від моделі. Моделі та ціни |
Веб-пошуки (web_search: true) | На план і день: Free 3, Plus 30, Standard 50, Pro 60. Один пошук рахується для запиту, пошук якого знайшов результати. | Запити з web_search: true | Коли пошуків не лишилося, відповідь надається без пошуку. Помилки немає. Вбудований веб‑пошук |
Помилки
Відповіді на цій сторінці. На /v1/messages той самий об'єкт error загортається як {"type": "error", "error": {…}}.
| Статус | Тип | Повідомлення | Коли і що робити |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Резерв запиту не вміщується в ваш баланс. Зачекайте до 00:00 UTC, поповніть кредит, змініть план або надішліть менше max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Понад 120 запитів за поточну хвилину. Зачекайте N секунд і надішліть знову. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Виклики Shannon Coder поточного 4-годинного вікна вичерпано. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Модель зараз не може прийняти запит. Надішліть його знову після короткої паузи. |
503 | api_error | Could not verify your quota right now. Please retry. | Не вдалося прочитати ваш баланс. Нічого не списано; надішліть запит знову. На /v1/responses із моделлю Shannon статус — 500. |
413 | invalid_request_error | Тіло запиту більше за 32 MiB. На ендпоінтах формату OpenAI об'єкт error містить code: "request_too_large". | |
413 | invalid_request_error | text too long | text у POST /v1/tokenize довший за 4,000,000 байтів. |