Ограничувања и салдо
Секое барање се услужува еднакво. Без нивоа на стапка. Без посебна API квота. Веќе ги плативте вашите токени — користете ги колку брзо сакате.
Оваа страница објаснува од што се состои вашето салдо, што резервира и чини едно барање, колку барања смеете да испратите и малкуте ограничувања на кои може да наиде едно барање.
- вредност на 1M токени салдо
- $5.00
- дневниот лимит се обновува
- 00:00 UTC
- flood protection, по сметка
- 120 барања / мин
Како се услужуваат барањата
- Без нивоа на стапка — Едно правило ограничува колку брзо смеат да пристигнуваат барањата и е исто за секоја сметка и секој план: 120 барања во минута. Нема ограничување на токени во минута.
- Без посебна API квота — API-то го троши истото салдо како разговорот. Планот ја одредува големината на денешниот лимит. Не одредува стапка на барања.
- Колку брзо сакате — Барањата испратени паралелно се прифаќаат и чекаат во ред. Не се одбиваат поради тоа што се паралелни.
Вашето салдо
Вашето салдо се брои во токени. 1,000,000 токени салдо вредат $5.00, а секоја цена на страницата Модели и цени е стапка спрема таа вредност.
Во секој момент салдото е збир од два дела.
- Дневен лимит на планот — Број токени утврден од вашиот план. Се обновува секој ден во 00:00 UTC. Она што ќе остане на крајот од денот не се пренесува.
- Купен кредит — Токени што сте ги купиле како пакет. Кредитот не истекува и важи на секој план, вклучително и Free.
| План | Токени по ден | Вреди |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Редослед на трошење — Секое барање прво го троши дневниот лимит на планот. Купениот кредит се користи само за она што го надминува лимитот тој ден.
- Разговорот и API-то го делат — Постои едно салдо по сметка. API клучот троши од салдото на сметката што го поседува, по истите цени како разговорот.
- Пакети — Кредитот се продава во пакети од 1,000,000 ($5.00), 2,000,000 ($10.00) и 5,000,000 ($25.00) токени, или како износ по ваш избор од 1,000,000 до 100,000,000 токени по $5.00 за 1,000,000.
Што резервира барањето и колку чини
- Резервирање — Кога ќе пристигне барањето, тоа резервира свој излезен буџет од вашето салдо:
max_tokensна/v1/chat/completionsи/v1/messages,max_output_tokensна/v1/responses./v1/chat/completionsго чита иmax_completion_tokens. Стандардната вредност е 4,096, а опсегот е од 1 до 65,536. - Прифаќање — Барањето се прифаќа само ако резервацијата собира во она што останало од вашето салдо. Салдо над нула, но помало од излезниот буџет, го добива одговорот
Quota exceeded. Испратете помалmax_tokensза да го искористите остатокот. - Порамнување — Кога одговорот е готов, резервацијата се заменува со вистинската наплата. Наплатата може да биде пониска или повисока од резервацијата.
- Враќање — Барање што завршува со статус на грешка ја враќа својата резервација во целост.
Вистинската наплата зависи од фамилијата на моделот.
| Модели | Што се наплатува |
|---|---|
| Модели Shannon | usage.total_tokens по цената на моделот за 1M. Влезот и излезот имаат една цена. |
| Хостирани open-weight модели | Некеширан влез по цената за влез, кеширан влез по цената за кеширано, излез по цената за излез. |
Износот во USD се одзема од вашето салдо во токени по $5.00 за 1,000,000, заокружен на цел токен.
Броењето токени со POST /v1/tokenize или POST /v1/messages/count_tokens е бесплатно и не резервира ништо. Броење токени
Каде да го видите салдото и употребата
Страницата Клучеви и употреба прикажува колку можете да потрошите веднаш, денешниот лимит на планот, вашиот купен кредит и API трошењето за последните 30 дена. Подолу ги наведува сите барања направени со вашиот клуч: време, ендпоинт, модел, кеширан влез, наплатени токени и трошок. Клучеви и употреба
Секој одговор содржи и објект usage со бројките на токени на тој повик.
| Ендпоинт | Полиња на usage | Ги додаваат хостираните open-weight модели |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageги содржи бројките на токени на моделот. Износот земен од вашето салдо не е во одговорот: тоа е колоната Наплатени токени во листата на барања на Клучеви и употреба.- На
/v1/messagesсо хостиран open-weight модел,input_tokensе некешираниот дел од влезот,cache_read_input_tokensе кешираниот дел, аcache_creation_input_tokensе секогаш0. - Streaming на
/v1/chat/completionsносиusageво својот последен chunk пред[DONE]. Стриминг
Кога салдото ќе се потроши
Барање чија резервација не собира во вашето салдо се одговара со статус 429, тип rate_limit_error и пораката подолу. Ништо не се наплатува. Истиот одговор се испраќа и кога салдото е над нула, но помало од излезниот буџет на барањето.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} На /v1/responses објектот error може да содржи и code и param, и двата null.
Што можете да направите:
- Почекајте го следниот лимит на планот во 00:00 UTC.
- Дополнете кредит. Кредитот се троши по лимитот на планот и не истекува. Дополни кредит
- Преминете на план со поголем дневен лимит. Промени план
- Испратете помал
max_tokens, ако има останато некое салдо: тогаш резервацијата е помала.
Лимит на повици на Shannon Coder
shannon-coder-1 на /v1/chat/completions и /v1/messages се брои во повици, а не во токени. Секој план вклучува одреден број повици по прозорец од 4 часа. Едно барање е еден повик.
| План | Повици по прозорец од 4 часа |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Прозорците започнуваат во 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Повиците што ќе останат на крајот од прозорецот не се пренесуваат.
- Повикот се брои кога барањето ќе се прифати, пред моделот да одговори. Барање што потоа не успее сепак се брои како повик.
- Овие повици не резервираат токени и не земаат ништо од вашето салдо. Листата на барања на страницата Клучеви и употреба го прикажува нивниот број токени и неговата вредност по наведената цена.
- Стандардниот
max_tokensнаshannon-coder-1на овие два ендпоинта е 65,536. - Кога нема повеќе повици, одговорот е статус
429, типrate_limit_error, поракаShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - На
/v1/responses,shannon-coder-1нема лимит на повици: наплатува во токени од вашето салдо по $8.00 за 1M, како секој друг модел.
Flood protection
Сметката може да испрати 120 барања во минута. Тоа е единственото ограничување на стапката на барања и е исто на секој план. Постои за да ги запре преплавувањата, а не да ја забави нормалната употреба.
- Минутата е фиксен прозорец од 60 секунди што се отвора со вашето прво барање. Кога ќе заврши, бројот започнува повторно од нула.
- Бројот е по сметка, а не по клуч и не по IP адреса. Менувањето на клучот не отвора нов прозорец.
- 121-вото барање во рамките на еден прозорец се одговара со статус
429, типrate_limit_errorи поракатаToo many requests. Retry in <N>s.Nе бројот секунди до крајот на прозорецот, од 1 до 60. - Flood protection се проверува пред салдото. Барање што го одбива не резервира ништо и не чини ништо.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Барање | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Се брои, по едно за барање. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Не се брои. |
shannon-coder-1 на /v1/chat/completions и /v1/messages | Се брои наместо тоа според лимитот на повици на Shannon Coder. |
Барање одговорено со 401, или со 400 за непознат model | Не се брои. |
| Барање одбиено од flood protection | Се брои во прозорецот. Ништо не се наплатува. |
Паралелни барања
Нема ограничување колку барања една сметка може да има отворени истовремено, ниту грешка за испраќање барања паралелно. Барањата што не можат да започнат веднаш чекаат во ред и се одговараат по редослед.
- Секое барање се брои во 120 во минута кога ќе пристигне, без разлика дали претходните барања завршиле.
- Секое барање ја држи својата резервација додека не заврши. Дваесет отворени барања со стандарден излезен буџет држат 20 × 4,096 = 81,920 токени салдо. Ако резервациите заедно се поголеми од вашето салдо, следното барање го добива одговорот
Quota exceeded, иако завршените повици би чинеле помалку. Помалmax_tokensдржи помалку. - Барање без streaming не испраќа ништо додека одговорот не е готов, затоа дајте му на вашиот клиент timeout што го покрива чекањето. Streaming-от ја држи врската отворена додека чека. Стриминг
Ограничувања на едно барање
| Ограничување | Вредност | Важи за | На границата |
|---|---|---|---|
| Тело на барање | 32 MiB (33,554,432 бајти) | Секој ендпоинт | Статус 413, тип invalid_request_error. |
Излезен буџет: max_tokens, max_completion_tokens, max_output_tokens | 1 до 65,536. Стандардно 4,096; за shannon-coder-1 на /v1/chat/completions и /v1/messages стандардно е 65,536. | Секој модел, како износ резервиран од вашето салдо. Како ограничување на должината на одговорот: хостираните open-weight модели, shannon-1.6-lite, shannon-1.6-pro и shannon-coder-1. | Вредност надвор од опсегот се поместува до најблискиот крај на опсегот. Без грешка. |
Секвенци за запирање: stop, stop_sequences | 4 стринга | Хостирани open-weight модели | Се користат првите 4 непразни стрингови. |
| Слика или датотека дадена како URL | 8 MiB, прочитани во рок од 20 секунди, најмногу 5 пренасочувања, јавна http или https адреса | Секој ендпоинт што прима слики или датотеки | Барањето се одговара без тој дел. Без грешка. |
| Слика или датотека испратена вградено (base64) | Нема свое ограничување. Се брои во телото на барањето од 32 MiB. | Секој ендпоинт што прима слики или датотеки | Статус 413 за целото барање. |
text на POST /v1/tokenize | 4,000,000 бајти | /v1/tokenize | Статус 413, тип invalid_request_error, порака text too long. |
messages на POST /v1/tokenize и телото на POST /v1/messages/count_tokens | Телото на барањето од 32 MiB | Двата ендпоинта за броење | Статус 413. |
| Контекстен прозорец | По модел: context_window во GET /v1/models | Секој модел | Што се случува со подолг разговор зависи од моделот. Модели и цени |
Веб пребарувања (web_search: true) | По план и ден: Free 3, Plus 30, Standard 50, Pro 60. Се брои едно пребарување за барање чие пребарување нашло резултати. | Барања што поставуваат web_search: true | Кога нема повеќе, барањето се одговара без пребарување. Без грешка. Вградено веб пребарување |
Грешки
Одговорите на оваа страница. На /v1/messages истиот објект error е завиткан како {"type": "error", "error": {…}}.
| Статус | Тип | Порака | Кога и што да направите |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Резервацијата на барањето не собира во вашето салдо. Почекајте до 00:00 UTC, дополнете кредит, сменете го планот или испратете помал max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Повеќе од 120 барања во тековната минута. Почекајте N секунди и испратете повторно. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Повиците на Shannon Coder од тековниот прозорец од 4 часа се искористени. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Моделот не може да го прими барањето во овој момент. Испратете го повторно по кратка пауза. |
503 | api_error | Could not verify your quota right now. Please retry. | Вашето салдо не можеше да се прочита. Ништо не се наплатува; испратете го барањето повторно. На /v1/responses со модел Shannon статусот е 500. |
413 | invalid_request_error | Телото на барањето е поголемо од 32 MiB. На ендпоинтите во OpenAI формат објектот error содржи code: "request_too_large". | |
413 | invalid_request_error | text too long | text на POST /v1/tokenize е подолг од 4,000,000 бајти. |