Прескокни до содржината
Ограничувања и салдо

Ограничувања и салдо

Секое барање се услужува еднакво. Без нивоа на стапка. Без посебна API квота. Веќе ги плативте вашите токени — користете ги колку брзо сакате.

Оваа страница објаснува од што се состои вашето салдо, што резервира и чини едно барање, колку барања смеете да испратите и малкуте ограничувања на кои може да наиде едно барање.

вредност на 1M токени салдо
$5.00
дневниот лимит се обновува
00:00 UTC
flood protection, по сметка
120 барања / мин

Како се услужуваат барањата

  • Без нивоа на стапка — Едно правило ограничува колку брзо смеат да пристигнуваат барањата и е исто за секоја сметка и секој план: 120 барања во минута. Нема ограничување на токени во минута.
  • Без посебна API квота — API-то го троши истото салдо како разговорот. Планот ја одредува големината на денешниот лимит. Не одредува стапка на барања.
  • Колку брзо сакате — Барањата испратени паралелно се прифаќаат и чекаат во ред. Не се одбиваат поради тоа што се паралелни.

Вашето салдо

Вашето салдо се брои во токени. 1,000,000 токени салдо вредат $5.00, а секоја цена на страницата Модели и цени е стапка спрема таа вредност.

Во секој момент салдото е збир од два дела.

  • Дневен лимит на планот — Број токени утврден од вашиот план. Се обновува секој ден во 00:00 UTC. Она што ќе остане на крајот од денот не се пренесува.
  • Купен кредит — Токени што сте ги купиле како пакет. Кредитот не истекува и важи на секој план, вклучително и Free.
План Токени по ден Вреди
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Редослед на трошење — Секое барање прво го троши дневниот лимит на планот. Купениот кредит се користи само за она што го надминува лимитот тој ден.
  • Разговорот и API-то го делат — Постои едно салдо по сметка. API клучот троши од салдото на сметката што го поседува, по истите цени како разговорот.
  • Пакети — Кредитот се продава во пакети од 1,000,000 ($5.00), 2,000,000 ($10.00) и 5,000,000 ($25.00) токени, или како износ по ваш избор од 1,000,000 до 100,000,000 токени по $5.00 за 1,000,000.

Дополни кредит Промени план

Што резервира барањето и колку чини

  • Резервирање — Кога ќе пристигне барањето, тоа резервира свој излезен буџет од вашето салдо: max_tokens на /v1/chat/completions и /v1/messages, max_output_tokens на /v1/responses. /v1/chat/completions го чита и max_completion_tokens. Стандардната вредност е 4,096, а опсегот е од 1 до 65,536.
  • Прифаќање — Барањето се прифаќа само ако резервацијата собира во она што останало од вашето салдо. Салдо над нула, но помало од излезниот буџет, го добива одговорот Quota exceeded. Испратете помал max_tokens за да го искористите остатокот.
  • Порамнување — Кога одговорот е готов, резервацијата се заменува со вистинската наплата. Наплатата може да биде пониска или повисока од резервацијата.
  • Враќање — Барање што завршува со статус на грешка ја враќа својата резервација во целост.

Вистинската наплата зависи од фамилијата на моделот.

Модели Што се наплатува
Модели Shannon usage.total_tokens по цената на моделот за 1M. Влезот и излезот имаат една цена.
Хостирани open-weight модели Некеширан влез по цената за влез, кеширан влез по цената за кеширано, излез по цената за излез.

Износот во USD се одзема од вашето салдо во токени по $5.00 за 1,000,000, заокружен на цел токен.

Броењето токени со POST /v1/tokenize или POST /v1/messages/count_tokens е бесплатно и не резервира ништо. Броење токени

Каде да го видите салдото и употребата

Страницата Клучеви и употреба прикажува колку можете да потрошите веднаш, денешниот лимит на планот, вашиот купен кредит и API трошењето за последните 30 дена. Подолу ги наведува сите барања направени со вашиот клуч: време, ендпоинт, модел, кеширан влез, наплатени токени и трошок. Клучеви и употреба

Секој одговор содржи и објект usage со бројките на токени на тој повик.

Ендпоинт Полиња на usage Ги додаваат хостираните open-weight модели
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage ги содржи бројките на токени на моделот. Износот земен од вашето салдо не е во одговорот: тоа е колоната Наплатени токени во листата на барања на Клучеви и употреба.
  • На /v1/messages со хостиран open-weight модел, input_tokens е некешираниот дел од влезот, cache_read_input_tokens е кешираниот дел, а cache_creation_input_tokens е секогаш 0.
  • Streaming на /v1/chat/completions носи usage во својот последен chunk пред [DONE]. Стриминг

Кога салдото ќе се потроши

Барање чија резервација не собира во вашето салдо се одговара со статус 429, тип rate_limit_error и пораката подолу. Ништо не се наплатува. Истиот одговор се испраќа и кога салдото е над нула, но помало од излезниот буџет на барањето.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

На /v1/responses објектот error може да содржи и code и param, и двата null.

Што можете да направите:

  • Почекајте го следниот лимит на планот во 00:00 UTC.
  • Дополнете кредит. Кредитот се троши по лимитот на планот и не истекува. Дополни кредит
  • Преминете на план со поголем дневен лимит. Промени план
  • Испратете помал max_tokens, ако има останато некое салдо: тогаш резервацијата е помала.

Лимит на повици на Shannon Coder

shannon-coder-1 на /v1/chat/completions и /v1/messages се брои во повици, а не во токени. Секој план вклучува одреден број повици по прозорец од 4 часа. Едно барање е еден повик.

План Повици по прозорец од 4 часа
Free 3
Plus 20
Standard 40
Pro 60
  • Прозорците започнуваат во 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Повиците што ќе останат на крајот од прозорецот не се пренесуваат.
  • Повикот се брои кога барањето ќе се прифати, пред моделот да одговори. Барање што потоа не успее сепак се брои како повик.
  • Овие повици не резервираат токени и не земаат ништо од вашето салдо. Листата на барања на страницата Клучеви и употреба го прикажува нивниот број токени и неговата вредност по наведената цена.
  • Стандардниот max_tokens на shannon-coder-1 на овие два ендпоинта е 65,536.
  • Кога нема повеќе повици, одговорот е статус 429, тип rate_limit_error, порака Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • На /v1/responses, shannon-coder-1 нема лимит на повици: наплатува во токени од вашето салдо по $8.00 за 1M, како секој друг модел.

Flood protection

Сметката може да испрати 120 барања во минута. Тоа е единственото ограничување на стапката на барања и е исто на секој план. Постои за да ги запре преплавувањата, а не да ја забави нормалната употреба.

  • Минутата е фиксен прозорец од 60 секунди што се отвора со вашето прво барање. Кога ќе заврши, бројот започнува повторно од нула.
  • Бројот е по сметка, а не по клуч и не по IP адреса. Менувањето на клучот не отвора нов прозорец.
  • 121-вото барање во рамките на еден прозорец се одговара со статус 429, тип rate_limit_error и пораката Too many requests. Retry in <N>s. N е бројот секунди до крајот на прозорецот, од 1 до 60.
  • Flood protection се проверува пред салдото. Барање што го одбива не резервира ништо и не чини ништо.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Барање Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Се брои, по едно за барање.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Не се брои.
shannon-coder-1 на /v1/chat/completions и /v1/messages Се брои наместо тоа според лимитот на повици на Shannon Coder.
Барање одговорено со 401, или со 400 за непознат model Не се брои.
Барање одбиено од flood protection Се брои во прозорецот. Ништо не се наплатува.

Паралелни барања

Нема ограничување колку барања една сметка може да има отворени истовремено, ниту грешка за испраќање барања паралелно. Барањата што не можат да започнат веднаш чекаат во ред и се одговараат по редослед.

  • Секое барање се брои во 120 во минута кога ќе пристигне, без разлика дали претходните барања завршиле.
  • Секое барање ја држи својата резервација додека не заврши. Дваесет отворени барања со стандарден излезен буџет држат 20 × 4,096 = 81,920 токени салдо. Ако резервациите заедно се поголеми од вашето салдо, следното барање го добива одговорот Quota exceeded, иако завршените повици би чинеле помалку. Помал max_tokens држи помалку.
  • Барање без streaming не испраќа ништо додека одговорот не е готов, затоа дајте му на вашиот клиент timeout што го покрива чекањето. Streaming-от ја држи врската отворена додека чека. Стриминг

Ограничувања на едно барање

Ограничување Вредност Важи за На границата
Тело на барање 32 MiB (33,554,432 бајти) Секој ендпоинт Статус 413, тип invalid_request_error.
Излезен буџет: max_tokens, max_completion_tokens, max_output_tokens 1 до 65,536. Стандардно 4,096; за shannon-coder-1 на /v1/chat/completions и /v1/messages стандардно е 65,536. Секој модел, како износ резервиран од вашето салдо. Како ограничување на должината на одговорот: хостираните open-weight модели, shannon-1.6-lite, shannon-1.6-pro и shannon-coder-1. Вредност надвор од опсегот се поместува до најблискиот крај на опсегот. Без грешка.
Секвенци за запирање: stop, stop_sequences 4 стринга Хостирани open-weight модели Се користат првите 4 непразни стрингови.
Слика или датотека дадена како URL 8 MiB, прочитани во рок од 20 секунди, најмногу 5 пренасочувања, јавна http или https адреса Секој ендпоинт што прима слики или датотеки Барањето се одговара без тој дел. Без грешка.
Слика или датотека испратена вградено (base64) Нема свое ограничување. Се брои во телото на барањето од 32 MiB. Секој ендпоинт што прима слики или датотеки Статус 413 за целото барање.
text на POST /v1/tokenize 4,000,000 бајти /v1/tokenize Статус 413, тип invalid_request_error, порака text too long.
messages на POST /v1/tokenize и телото на POST /v1/messages/count_tokens Телото на барањето од 32 MiB Двата ендпоинта за броење Статус 413.
Контекстен прозорец По модел: context_window во GET /v1/models Секој модел Што се случува со подолг разговор зависи од моделот. Модели и цени
Веб пребарувања (web_search: true) По план и ден: Free 3, Plus 30, Standard 50, Pro 60. Се брои едно пребарување за барање чие пребарување нашло резултати. Барања што поставуваат web_search: true Кога нема повеќе, барањето се одговара без пребарување. Без грешка. Вградено веб пребарување

Грешки

Одговорите на оваа страница. На /v1/messages истиот објект error е завиткан како {"type": "error", "error": {…}}.

Статус Тип Порака Кога и што да направите
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Резервацијата на барањето не собира во вашето салдо. Почекајте до 00:00 UTC, дополнете кредит, сменете го планот или испратете помал max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Повеќе од 120 барања во тековната минута. Почекајте N секунди и испратете повторно.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Повиците на Shannon Coder од тековниот прозорец од 4 часа се искористени.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Моделот не може да го прими барањето во овој момент. Испратете го повторно по кратка пауза.
503 api_error Could not verify your quota right now. Please retry. Вашето салдо не можеше да се прочита. Ништо не се наплатува; испратете го барањето повторно. На /v1/responses со модел Shannon статусот е 500.
413 invalid_request_error Телото на барањето е поголемо од 32 MiB. На ендпоинтите во OpenAI формат објектот error содржи code: "request_too_large".
413 invalid_request_error text too long text на POST /v1/tokenize е подолг од 4,000,000 бајти.