Перейти до вмісту
Ліміти та баланс

Ліміти та баланс

Кожен запит обслуговується однаково. Жодних рівнів швидкості. Жодної окремої квоти API. Ви вже заплатили за свої токени — використовуйте їх так швидко, як хочете.

Ця сторінка пояснює, з чого складається ваш баланс, що резервує і коштує один запит, скільки запитів можна надсилати та які кілька обмежень може зустріти окремий запит.

вартість 1M токенів балансу
$5.00
щоденний ліміт оновлюється
00:00 UTC
захист від флуду, на обліковий запис
120 запитів / хв

Як обслуговуються запити

  • Жодних рівнів швидкості — Одне правило обмежує, як швидко можуть надходити запити, і воно однакове для кожного облікового запису та кожного плану: 120 запитів на хвилину. Обмеження токенів на хвилину немає.
  • Жодної окремої квоти API — API витрачає той самий баланс, що й чат. План визначає розмір сьогоднішнього ліміту. Він не задає частоту запитів.
  • Так швидко, як хочете — Запити, надіслані паралельно, приймаються й чекають у черзі. Їх не відхиляють за паралельність.

Ваш баланс

Ваш баланс рахується в токенах. 1,000,000 токенів балансу коштують $5.00, а кожна ціна на сторінці Models & pricing — це тариф відносно цієї вартості.

У будь-який момент баланс — це сума двох частин.

  • Сьогоднішній ліміт плану — Кількість токенів, яку задає ваш план. Оновлюється щодня о 00:00 UTC. Те, що лишилося наприкінці дня, не переноситься.
  • Придбані кредити — Токени, які ви купили пакетом. Кредит не спливає і діє на кожному плані, зокрема Free.
План Токенів на день Вартість
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Порядок витрат — Кожен запит спочатку витрачає сьогоднішній ліміт плану. Придбані кредити використовуються лише для того, що перевищує ліміт цього дня.
  • Чат і API мають спільний баланс — На обліковий запис припадає один баланс. API-ключ витрачає баланс облікового запису, якому він належить, за тими самими цінами, що й чат.
  • Пакети — Кредит продається пакетами по 1,000,000 ($5.00), 2,000,000 ($10.00) і 5,000,000 ($25.00) токенів або на суму на ваш вибір від 1,000,000 до 100,000,000 токенів за $5.00 за 1,000,000.

Поповнити кредит Змінити план

Що запит резервує і скільки коштує

  • Резервування — Коли надходить запит, він резервує свій бюджет виводу з вашого балансу: max_tokens на /v1/chat/completions і /v1/messages, max_output_tokens на /v1/responses. /v1/chat/completions також читає max_completion_tokens. Значення за замовчуванням — 4,096, діапазон — від 1 до 65,536.
  • Прийняття — Запит приймається, лише якщо резерв вміщується в те, що лишилося на вашому балансі. Баланс, що вищий за нуль, але менший за бюджет виводу, отримує відповідь Quota exceeded. Надішліть менше max_tokens, щоб використати залишок.
  • Розрахунок — Коли відповідь завершено, резерв замінюється справжньою вартістю. Вона може бути нижчою або вищою за резерв.
  • Повернення — Запит, що завершується статусом помилки, повністю повертає свій резерв.

Справжня вартість залежить від сімейства моделі.

Моделі Що тарифікується
Моделі Shannon usage.total_tokens за ціною моделі за 1M. Вхід і вихід мають один тариф.
Хостовані open-weight моделі Некешований вхід за ціною входу, кешований вхід за ціною кешу, вихід за ціною виходу.

Сума в USD списується з вашого балансу в токенах за курсом $5.00 за 1,000,000, округлена до цілого токена.

Підрахунок токенів через POST /v1/tokenize або POST /v1/messages/count_tokens безкоштовний і нічого не резервує. Підрахунок токенів

Де бачити баланс і використання

Сторінка Keys & usage показує, що ви можете витратити просто зараз, сьогоднішній ліміт плану, придбані кредити та витрати API за останні 30 днів. Нижче вона перелічує кожен запит вашого ключа: час, ендпоінт, модель, кешований вхід, тарифіковані токени та вартість. Ключі та використання

Кожна відповідь також містить об'єкт usage з кількістю токенів цього виклику.

Ендпоінт Поля usage Додається хостованими open-weight моделями
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage містить кількість токенів моделі. Суми, яка списується з вашого балансу, у відповіді немає: вона в колонці Billed tokens списку запитів на Keys & usage.
  • На /v1/messages із хостованою open-weight моделлю input_tokens — це некешована частина входу, cache_read_input_tokens — кешована частина, а cache_creation_input_tokens завжди дорівнює 0.
  • Стрім на /v1/chat/completions несе usage в останньому чанку перед [DONE]. Стримінг

Коли баланс закінчується

Запит, резерв якого не вміщується в ваш баланс, отримує відповідь зі статусом 429, типом rate_limit_error і повідомленням нижче. Нічого не списується. Така сама відповідь надсилається, коли баланс вищий за нуль, але менший за бюджет виводу запиту.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

На /v1/responses об'єкт error може також містити code і param, обидва null.

Що можна зробити:

  • Зачекайте наступного ліміту плану о 00:00 UTC.
  • Поповніть кредит. Кредит витрачається після ліміту плану і не спливає. Поповнити кредит
  • Перейдіть на план із більшим щоденним лімітом. Змінити план
  • Надішліть менше max_tokens, якщо на балансі щось лишилося: тоді резерв буде меншим.

Ліміт викликів Shannon Coder

shannon-coder-1 на /v1/chat/completions і /v1/messages рахується у викликах, а не в токенах. Кожен план включає певну кількість викликів на 4-годинне вікно. Один запит — це один виклик.

План Викликів на 4-годинне вікно
Free 3
Plus 20
Standard 40
Pro 60
  • Вікна починаються о 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Виклики, що лишилися наприкінці вікна, не переносяться.
  • Виклик рахується, коли запит прийнято, до відповіді моделі. Запит, який згодом завершується помилкою, усе одно рахується як виклик.
  • Ці виклики не резервують токенів і нічого не забирають із вашого балансу. Список запитів на Keys & usage показує їхню кількість токенів і її вартість за прейскурантною ціною.
  • Значення max_tokens за замовчуванням для shannon-coder-1 на цих двох ендпоінтах — 65,536.
  • Коли викликів не лишилося, відповідь має статус 429, тип rate_limit_error і повідомлення Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • На /v1/responses для shannon-coder-1 немає ліміту викликів: він тарифікується в токенах із вашого балансу за $8.00 за 1M, як і будь-яка інша модель.

Захист від флуду

Обліковий запис може надсилати 120 запитів на хвилину. Це єдине обмеження частоти запитів, і воно однакове на кожному плані. Воно існує, щоб зупиняти флуд, а не уповільнювати звичайне використання.

  • Хвилина — це фіксоване вікно в 60 секунд, що відкривається вашим першим запитом. Коли воно закінчується, лічильник знову починається з нуля.
  • Лічильник діє на обліковий запис, а не на ключ чи IP-адресу. Заміна ключа не відкриває нового вікна.
  • 121-й запит у межах вікна отримує відповідь зі статусом 429, типом rate_limit_error і повідомленням Too many requests. Retry in <N>s. N — кількість секунд до кінця вікна, від 1 до 60.
  • Захист від флуду перевіряється до балансу. Запит, який він відхиляє, нічого не резервує і нічого не коштує.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Запит Захист від флуду
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Рахується, по одному на запит.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Не рахується.
shannon-coder-1 на /v1/chat/completions і /v1/messages Натомість рахується ліміт викликів Shannon Coder.
Запит, на який відповіли 401, або 400 для невідомої model Не рахується.
Запит, відхилений захистом від флуду Рахується у вікні. Нічого не списується.

Паралельні запити

Кількість одночасно відкритих запитів облікового запису не обмежена, і за паралельні запити помилки немає. Запити, які не можуть стартувати одразу, чекають у черзі й обслуговуються по черзі.

  • Кожен запит зараховується до 120 на хвилину в момент надходження, незалежно від того, чи завершилися попередні запити.
  • Кожен запит тримає власний резерв, доки не завершиться. Двадцять відкритих запитів зі стандартним бюджетом виводу тримають 20 × 4,096 = 81,920 токенів балансу. Якщо сума резервів більша за ваш баланс, наступний запит отримає відповідь Quota exceeded, хоча завершені виклики коштували б менше. Менший max_tokens тримає менше.
  • Запит без стрімінгу нічого не надсилає, доки відповідь не буде завершена, тож задайте клієнту тайм-аут, що покриває очікування. Стрім тримає з'єднання відкритим, поки чекає. Стримінг

Обмеження окремого запиту

Ліміт Значення Застосовується до При досягненні ліміту
Тіло запиту 32 MiB (33,554,432 байтів) Кожен ендпоінт Статус 413, тип invalid_request_error.
Бюджет виводу: max_tokens, max_completion_tokens, max_output_tokens Від 1 до 65,536. За замовчуванням 4,096; для shannon-coder-1 на /v1/chat/completions і /v1/messages за замовчуванням 65,536. Кожна модель, як сума, що резервується з вашого балансу. Як обмеження довжини відповіді: хостовані open-weight моделі, shannon-1.6-lite, shannon-1.6-pro і shannon-coder-1. Значення поза діапазоном зсувається до найближчої межі діапазону. Помилки немає.
Послідовності зупинки: stop, stop_sequences 4 рядки Хостовані open-weight моделі Використовуються перші 4 непорожні рядки.
Зображення або файл, указані як URL 8 MiB, читання протягом 20 секунд, не більше 5 перенаправлень, публічна адреса http або https Кожен ендпоінт, що приймає зображення або файли Відповідь надається без цієї частини. Помилки немає.
Зображення або файл, надіслані inline (base64) Власного ліміту немає. Враховується в тілі запиту 32 MiB. Кожен ендпоінт, що приймає зображення або файли Статус 413 для всього запиту.
text у POST /v1/tokenize 4,000,000 байтів /v1/tokenize Статус 413, тип invalid_request_error, повідомлення text too long.
messages у POST /v1/tokenize і тіло POST /v1/messages/count_tokens Тіло запиту 32 MiB Обидва ендпоінти підрахунку Статус 413.
Контекстне вікно Залежить від моделі: context_window у GET /v1/models Кожна модель Що станеться з довшою розмовою, залежить від моделі. Моделі та ціни
Веб-пошуки (web_search: true) На план і день: Free 3, Plus 30, Standard 50, Pro 60. Один пошук рахується для запиту, пошук якого знайшов результати. Запити з web_search: true Коли пошуків не лишилося, відповідь надається без пошуку. Помилки немає. Вбудований веб‑пошук

Помилки

Відповіді на цій сторінці. На /v1/messages той самий об'єкт error загортається як {"type": "error", "error": {…}}.

Статус Тип Повідомлення Коли і що робити
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Резерв запиту не вміщується в ваш баланс. Зачекайте до 00:00 UTC, поповніть кредит, змініть план або надішліть менше max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Понад 120 запитів за поточну хвилину. Зачекайте N секунд і надішліть знову.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Виклики Shannon Coder поточного 4-годинного вікна вичерпано.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Модель зараз не може прийняти запит. Надішліть його знову після короткої паузи.
503 api_error Could not verify your quota right now. Please retry. Не вдалося прочитати ваш баланс. Нічого не списано; надішліть запит знову. На /v1/responses із моделлю Shannon статус — 500.
413 invalid_request_error Тіло запиту більше за 32 MiB. На ендпоінтах формату OpenAI об'єкт error містить code: "request_too_large".
413 invalid_request_error text too long text у POST /v1/tokenize довший за 4,000,000 байтів.