Limity i saldo
Każde zapytanie jest obsługiwane jednakowo. Bez poziomów szybkości. Bez osobnego limitu API. Za swoje tokeny już zapłacono — zużywaj je tak szybko, jak chcesz.
Ta strona wyjaśnia, z czego składa się Twoje saldo, co jedno zapytanie rezerwuje i ile kosztuje, ile zapytań możesz wysyłać oraz kilka limitów, na które może trafić pojedyncze zapytanie.
- wartość 1M tokenów salda
- $5.00
- dzienny limit się odnawia
- 00:00 UTC
- ochrona przed floodem, na konto
- 120 zapytań / min
Jak obsługiwane są zapytania
- Bez poziomów szybkości — Jedna reguła ogranicza, jak szybko mogą nadchodzić zapytania, i jest taka sama dla każdego konta i każdego planu: 120 zapytań na minutę. Nie ma limitu tokenów na minutę.
- Bez osobnego limitu API — API wydaje to samo saldo co czat. Plan ustala wielkość dzisiejszego limitu. Nie ustala tempa zapytań.
- Tak szybko, jak chcesz — Zapytania wysłane równolegle są przyjmowane i czekają w kolejce. Nie są odrzucane za to, że są równoległe.
Twoje saldo
Twoje saldo jest liczone w tokenach. 1,000,000 tokenów salda jest warte $5.00, a każda cena na stronie Models & pricing jest stawką względem tej wartości.
W każdej chwili saldo jest sumą dwóch części.
- Dzisiejszy limit planu — Liczba tokenów ustalona przez Twój plan. Co dzień o 00:00 UTC jest odnawiana. To, co zostanie na koniec dnia, nie przechodzi na następny.
- Zakupione środki — Tokeny kupione w pakiecie. Środki nie wygasają i działają w każdym planie, także w Free.
| Plan | Tokeny dziennie | Wartość |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Kolejność wydawania — Każde zapytanie najpierw zużywa dzisiejszy limit planu. Zakupione środki są używane tylko na to, co przekracza limit tego dnia.
- Czat i API dzielą je — Na konto przypada jedno saldo. Klucz API wydaje z salda konta, do którego należy, po tych samych cenach co czat.
- Pakiety — Środki są sprzedawane w pakietach po 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokenów albo w dowolnej wybranej ilości od 1,000,000 do 100,000,000 tokenów po $5.00 za 1,000,000.
Co zapytanie rezerwuje i ile kosztuje
- Rezerwacja — Gdy zapytanie nadchodzi, rezerwuje swój budżet wyjścia z Twojego salda:
max_tokensw/v1/chat/completionsi/v1/messages,max_output_tokensw/v1/responses./v1/chat/completionsczyta teżmax_completion_tokens. Wartość domyślna to 4,096, a zakres od 1 do 65,536. - Przyjęcie — Zapytanie jest przyjmowane tylko wtedy, gdy rezerwacja mieści się w tym, co zostało z Twojego salda. Saldo większe od zera, ale mniejsze niż budżet wyjścia, dostaje odpowiedź
Quota exceeded. Wyślij mniejszemax_tokens, aby wykorzystać resztę. - Rozliczenie — Gdy odpowiedź jest kompletna, rezerwacja zostaje zastąpiona rzeczywistym kosztem. Koszt może być niższy lub wyższy niż rezerwacja.
- Zwrot — Zapytanie, które kończy się statusem błędu, zwraca całą rezerwację.
Rzeczywisty koszt zależy od rodziny modelu.
| Modele | Co jest naliczane |
|---|---|
| Modele Shannon | usage.total_tokens po cenie modelu za 1M. Wejście i wyjście mają jedną stawkę. |
| Hostowane modele open-weight | Wejście niecache'owane po stawce wejścia, wejście z cache po stawce cache, wyjście po stawce wyjścia. |
Kwota w USD jest pobierana z Twojego salda w tokenach po $5.00 za 1,000,000, zaokrąglona do pełnego tokenu.
Liczenie tokenów przez POST /v1/tokenize lub POST /v1/messages/count_tokens jest bezpłatne i niczego nie rezerwuje. Liczenie tokenów
Gdzie zobaczyć saldo i użycie
Strona Keys & usage pokazuje, ile możesz wydać teraz, dzisiejszy limit planu, zakupione środki i wydatki API z ostatnich 30 dni. Poniżej wymienia każde zapytanie wykonane Twoim kluczem: czas, endpoint, model, wejście z cache, rozliczone tokeny i koszt. Keys & usage
Każda odpowiedź zawiera też obiekt usage z liczbą tokenów danego wywołania.
| Endpoint | Pola usage | Dodawane przez hostowane modele open-weight |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagezawiera liczbę tokenów modelu. Kwoty pobranej z Twojego salda nie ma w odpowiedzi: to kolumna Rozliczone tokeny na liście zapytań w Keys & usage.- W
/v1/messagesz hostowanym modelem open-weightinput_tokensto niecache'owana część wejścia,cache_read_input_tokensto część z cache, acache_creation_input_tokenszawsze wynosi0. - Stream w
/v1/chat/completionsprzekazujeusagew ostatnim chunku przed[DONE]. Streaming
Gdy saldo się skończy
Zapytanie, którego rezerwacja nie mieści się w Twoim saldzie, dostaje odpowiedź ze statusem 429, typem rate_limit_error i komunikatem poniżej. Nic nie jest naliczane. Ta sama odpowiedź jest wysyłana, gdy saldo jest większe od zera, ale mniejsze niż budżet wyjścia zapytania.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} W /v1/responses obiekt error może zawierać także code i param, oba równe null.
Co możesz zrobić:
- Poczekaj na kolejny limit planu o 00:00 UTC.
- Doładuj środki. Środki są wydawane po limicie planu i nie wygasają. Doładuj środki
- Przejdź na plan z większym dziennym limitem. Zmień plan
- Wyślij mniejsze
max_tokens, jeśli zostało jakieś saldo: rezerwacja będzie wtedy mniejsza.
Limit wywołań Shannon Coder
shannon-coder-1 w /v1/chat/completions i /v1/messages jest liczony w wywołaniach, nie w tokenach. Każdy plan zawiera pewną liczbę wywołań na 4-godzinne okno. Jedno zapytanie to jedno wywołanie.
| Plan | Wywołania na 4-godzinne okno |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Okna zaczynają się o 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Wywołania, które zostaną na koniec okna, nie przechodzą dalej.
- Wywołanie jest liczone w chwili przyjęcia zapytania, zanim model odpowie. Zapytanie, które potem zakończy się błędem, nadal liczy się jako wywołanie.
- Te wywołania nie rezerwują tokenów i nic nie pobierają z Twojego salda. Lista zapytań w Keys & usage pokazuje ich liczbę tokenów i wartość po cenie z cennika.
- Domyślne
max_tokensdlashannon-coder-1w tych dwóch endpointach wynosi 65,536. - Gdy nie zostało żadne wywołanie, odpowiedź ma status
429, typrate_limit_errori komunikatShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - W
/v1/responsesmodelshannon-coder-1nie ma limitu wywołań: jest rozliczany w tokenach z Twojego salda po $8.00 za 1M, jak każdy inny model.
Ochrona przed floodem
Konto może wysłać 120 zapytań na minutę. To jedyny limit tempa zapytań i jest taki sam w każdym planie. Służy do powstrzymywania floodu, nie do spowalniania normalnego użycia.
- Minuta to stałe okno 60 sekund, które otwiera się wraz z Twoim pierwszym zapytaniem. Gdy się kończy, licznik zaczyna od zera.
- Licznik dotyczy konta, nie klucza ani adresu IP. Rotacja klucza nie otwiera nowego okna.
- 121. zapytanie w oknie dostaje odpowiedź ze statusem
429, typemrate_limit_errori komunikatemToo many requests. Retry in <N>s.Nto liczba sekund do końca okna, od 1 do 60. - Ochrona przed floodem jest sprawdzana przed saldem. Zapytanie, które odrzuci, nic nie rezerwuje i nic nie kosztuje.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Zapytanie | Ochrona przed floodem |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Liczone, jedno na zapytanie. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Nieliczone. |
shannon-coder-1 w /v1/chat/completions i /v1/messages | Liczone zamiast tego w limicie wywołań Shannon Coder. |
Zapytanie z odpowiedzią 401 albo 400 dla nieznanego model | Nieliczone. |
| Zapytanie odrzucone przez ochronę przed floodem | Liczone do okna. Nic nie jest naliczane. |
Zapytania równoległe
Nie ma limitu liczby zapytań, które konto ma otwarte w tym samym czasie, ani błędu za wysyłanie zapytań równolegle. Zapytania, które nie mogą ruszyć od razu, czekają w kolejce i są obsługiwane po kolei.
- Każde zapytanie wlicza się do 120 na minutę w chwili nadejścia, niezależnie od tego, czy wcześniejsze zapytania się zakończyły.
- Każde zapytanie trzyma własną rezerwację do swojego końca. Dwadzieścia otwartych zapytań z domyślnym budżetem wyjścia trzyma 20 × 4,096 = 81,920 tokenów salda. Jeśli rezerwacje razem są większe niż Twoje saldo, następne zapytanie dostaje odpowiedź
Quota exceeded, mimo że zakończone wywołania kosztowałyby mniej. Mniejszemax_tokenstrzyma mniej. - Zapytanie bez streamingu niczego nie wysyła, dopóki odpowiedź nie jest kompletna, więc ustaw w kliencie timeout obejmujący to oczekiwanie. Stream utrzymuje otwarte połączenie, gdy czeka. Streaming
Limity pojedynczego zapytania
| Limit | Wartość | Dotyczy | Po osiągnięciu limitu |
|---|---|---|---|
| Treść zapytania | 32 MiB (33,554,432 bajtów) | Każdy endpoint | Status 413, typ invalid_request_error. |
Budżet wyjścia: max_tokens, max_completion_tokens, max_output_tokens | Od 1 do 65,536. Domyślnie 4,096; dla shannon-coder-1 w /v1/chat/completions i /v1/messages domyślnie 65,536. | Każdy model, jako kwota rezerwowana z Twojego salda. Jako limit długości odpowiedzi: hostowane modele open-weight, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. | Wartość spoza zakresu jest przesuwana do najbliższego końca zakresu. Bez błędu. |
Sekwencje zatrzymania: stop, stop_sequences | 4 ciągi | Hostowane modele open-weight | Używane są pierwsze 4 niepuste ciągi. |
| Obraz lub plik podany jako URL | 8 MiB, odczyt w ciągu 20 sekund, najwyżej 5 przekierowań, publiczny adres http lub https | Każdy endpoint przyjmujący obrazy lub pliki | Zapytanie dostaje odpowiedź bez tej części. Bez błędu. |
| Obraz lub plik wysłany inline (base64) | Brak własnego limitu. Liczy się do treści zapytania o rozmiarze 32 MiB. | Każdy endpoint przyjmujący obrazy lub pliki | Status 413 dla całego zapytania. |
text w POST /v1/tokenize | 4,000,000 bajtów | /v1/tokenize | Status 413, typ invalid_request_error, komunikat text too long. |
messages w POST /v1/tokenize i treść POST /v1/messages/count_tokens | Treść zapytania o rozmiarze 32 MiB | Oba endpointy liczące | Status 413. |
| Okno kontekstu | Zależnie od modelu: context_window w GET /v1/models | Każdy model | Co dzieje się z dłuższą rozmową, zależy od modelu. Modele i ceny |
Wyszukiwania w sieci (web_search: true) | Według planu i dnia: Free 3, Plus 30, Standard 50, Pro 60. Liczone jest jedno wyszukiwanie dla zapytania, w którym wyszukiwanie znalazło wyniki. | Zapytania z ustawionym web_search: true | Gdy nic nie zostało, zapytanie dostaje odpowiedź bez wyszukiwania. Bez błędu. Wbudowane wyszukiwanie w sieci |
Błędy
Odpowiedzi tej strony. W /v1/messages ten sam obiekt error jest opakowany jako {"type": "error", "error": {…}}.
| Status | Typ | Komunikat | Kiedy i co zrobić |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Rezerwacja zapytania nie mieści się w Twoim saldzie. Poczekaj do 00:00 UTC, doładuj środki, zmień plan albo wyślij mniejsze max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Ponad 120 zapytań w bieżącej minucie. Poczekaj N sekund i wyślij ponownie. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Wywołania Shannon Coder z bieżącego 4-godzinnego okna zostały wyczerpane. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Model nie może w tej chwili przyjąć zapytania. Wyślij je ponownie po krótkiej przerwie. |
503 | api_error | Could not verify your quota right now. Please retry. | Nie udało się odczytać Twojego salda. Nic nie jest naliczane; wyślij zapytanie ponownie. W /v1/responses z modelem Shannon status wynosi 500. |
413 | invalid_request_error | Treść zapytania jest większa niż 32 MiB. W endpointach w formacie OpenAI obiekt error zawiera code: "request_too_large". | |
413 | invalid_request_error | text too long | text w POST /v1/tokenize jest dłuższe niż 4,000,000 bajtów. |