Przejdź do treści
Limity i saldo

Limity i saldo

Każde zapytanie jest obsługiwane jednakowo. Bez poziomów szybkości. Bez osobnego limitu API. Za swoje tokeny już zapłacono — zużywaj je tak szybko, jak chcesz.

Ta strona wyjaśnia, z czego składa się Twoje saldo, co jedno zapytanie rezerwuje i ile kosztuje, ile zapytań możesz wysyłać oraz kilka limitów, na które może trafić pojedyncze zapytanie.

wartość 1M tokenów salda
$5.00
dzienny limit się odnawia
00:00 UTC
ochrona przed floodem, na konto
120 zapytań / min

Jak obsługiwane są zapytania

  • Bez poziomów szybkości — Jedna reguła ogranicza, jak szybko mogą nadchodzić zapytania, i jest taka sama dla każdego konta i każdego planu: 120 zapytań na minutę. Nie ma limitu tokenów na minutę.
  • Bez osobnego limitu API — API wydaje to samo saldo co czat. Plan ustala wielkość dzisiejszego limitu. Nie ustala tempa zapytań.
  • Tak szybko, jak chcesz — Zapytania wysłane równolegle są przyjmowane i czekają w kolejce. Nie są odrzucane za to, że są równoległe.

Twoje saldo

Twoje saldo jest liczone w tokenach. 1,000,000 tokenów salda jest warte $5.00, a każda cena na stronie Models & pricing jest stawką względem tej wartości.

W każdej chwili saldo jest sumą dwóch części.

  • Dzisiejszy limit planu — Liczba tokenów ustalona przez Twój plan. Co dzień o 00:00 UTC jest odnawiana. To, co zostanie na koniec dnia, nie przechodzi na następny.
  • Zakupione środki — Tokeny kupione w pakiecie. Środki nie wygasają i działają w każdym planie, także w Free.
Plan Tokeny dziennie Wartość
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Kolejność wydawania — Każde zapytanie najpierw zużywa dzisiejszy limit planu. Zakupione środki są używane tylko na to, co przekracza limit tego dnia.
  • Czat i API dzielą je — Na konto przypada jedno saldo. Klucz API wydaje z salda konta, do którego należy, po tych samych cenach co czat.
  • Pakiety — Środki są sprzedawane w pakietach po 1,000,000 ($5.00), 2,000,000 ($10.00) i 5,000,000 ($25.00) tokenów albo w dowolnej wybranej ilości od 1,000,000 do 100,000,000 tokenów po $5.00 za 1,000,000.

Doładuj środki Zmień plan

Co zapytanie rezerwuje i ile kosztuje

  • Rezerwacja — Gdy zapytanie nadchodzi, rezerwuje swój budżet wyjścia z Twojego salda: max_tokens w /v1/chat/completions i /v1/messages, max_output_tokens w /v1/responses. /v1/chat/completions czyta też max_completion_tokens. Wartość domyślna to 4,096, a zakres od 1 do 65,536.
  • Przyjęcie — Zapytanie jest przyjmowane tylko wtedy, gdy rezerwacja mieści się w tym, co zostało z Twojego salda. Saldo większe od zera, ale mniejsze niż budżet wyjścia, dostaje odpowiedź Quota exceeded. Wyślij mniejsze max_tokens, aby wykorzystać resztę.
  • Rozliczenie — Gdy odpowiedź jest kompletna, rezerwacja zostaje zastąpiona rzeczywistym kosztem. Koszt może być niższy lub wyższy niż rezerwacja.
  • Zwrot — Zapytanie, które kończy się statusem błędu, zwraca całą rezerwację.

Rzeczywisty koszt zależy od rodziny modelu.

Modele Co jest naliczane
Modele Shannon usage.total_tokens po cenie modelu za 1M. Wejście i wyjście mają jedną stawkę.
Hostowane modele open-weight Wejście niecache'owane po stawce wejścia, wejście z cache po stawce cache, wyjście po stawce wyjścia.

Kwota w USD jest pobierana z Twojego salda w tokenach po $5.00 za 1,000,000, zaokrąglona do pełnego tokenu.

Liczenie tokenów przez POST /v1/tokenize lub POST /v1/messages/count_tokens jest bezpłatne i niczego nie rezerwuje. Liczenie tokenów

Gdzie zobaczyć saldo i użycie

Strona Keys & usage pokazuje, ile możesz wydać teraz, dzisiejszy limit planu, zakupione środki i wydatki API z ostatnich 30 dni. Poniżej wymienia każde zapytanie wykonane Twoim kluczem: czas, endpoint, model, wejście z cache, rozliczone tokeny i koszt. Keys & usage

Każda odpowiedź zawiera też obiekt usage z liczbą tokenów danego wywołania.

Endpoint Pola usage Dodawane przez hostowane modele open-weight
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage zawiera liczbę tokenów modelu. Kwoty pobranej z Twojego salda nie ma w odpowiedzi: to kolumna Rozliczone tokeny na liście zapytań w Keys & usage.
  • W /v1/messages z hostowanym modelem open-weight input_tokens to niecache'owana część wejścia, cache_read_input_tokens to część z cache, a cache_creation_input_tokens zawsze wynosi 0.
  • Stream w /v1/chat/completions przekazuje usage w ostatnim chunku przed [DONE]. Streaming

Gdy saldo się skończy

Zapytanie, którego rezerwacja nie mieści się w Twoim saldzie, dostaje odpowiedź ze statusem 429, typem rate_limit_error i komunikatem poniżej. Nic nie jest naliczane. Ta sama odpowiedź jest wysyłana, gdy saldo jest większe od zera, ale mniejsze niż budżet wyjścia zapytania.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

W /v1/responses obiekt error może zawierać także code i param, oba równe null.

Co możesz zrobić:

  • Poczekaj na kolejny limit planu o 00:00 UTC.
  • Doładuj środki. Środki są wydawane po limicie planu i nie wygasają. Doładuj środki
  • Przejdź na plan z większym dziennym limitem. Zmień plan
  • Wyślij mniejsze max_tokens, jeśli zostało jakieś saldo: rezerwacja będzie wtedy mniejsza.

Limit wywołań Shannon Coder

shannon-coder-1 w /v1/chat/completions i /v1/messages jest liczony w wywołaniach, nie w tokenach. Każdy plan zawiera pewną liczbę wywołań na 4-godzinne okno. Jedno zapytanie to jedno wywołanie.

Plan Wywołania na 4-godzinne okno
Free 3
Plus 20
Standard 40
Pro 60
  • Okna zaczynają się o 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Wywołania, które zostaną na koniec okna, nie przechodzą dalej.
  • Wywołanie jest liczone w chwili przyjęcia zapytania, zanim model odpowie. Zapytanie, które potem zakończy się błędem, nadal liczy się jako wywołanie.
  • Te wywołania nie rezerwują tokenów i nic nie pobierają z Twojego salda. Lista zapytań w Keys & usage pokazuje ich liczbę tokenów i wartość po cenie z cennika.
  • Domyślne max_tokens dla shannon-coder-1 w tych dwóch endpointach wynosi 65,536.
  • Gdy nie zostało żadne wywołanie, odpowiedź ma status 429, typ rate_limit_error i komunikat Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • W /v1/responses model shannon-coder-1 nie ma limitu wywołań: jest rozliczany w tokenach z Twojego salda po $8.00 za 1M, jak każdy inny model.

Ochrona przed floodem

Konto może wysłać 120 zapytań na minutę. To jedyny limit tempa zapytań i jest taki sam w każdym planie. Służy do powstrzymywania floodu, nie do spowalniania normalnego użycia.

  • Minuta to stałe okno 60 sekund, które otwiera się wraz z Twoim pierwszym zapytaniem. Gdy się kończy, licznik zaczyna od zera.
  • Licznik dotyczy konta, nie klucza ani adresu IP. Rotacja klucza nie otwiera nowego okna.
  • 121. zapytanie w oknie dostaje odpowiedź ze statusem 429, typem rate_limit_error i komunikatem Too many requests. Retry in <N>s. N to liczba sekund do końca okna, od 1 do 60.
  • Ochrona przed floodem jest sprawdzana przed saldem. Zapytanie, które odrzuci, nic nie rezerwuje i nic nie kosztuje.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Zapytanie Ochrona przed floodem
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Liczone, jedno na zapytanie.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Nieliczone.
shannon-coder-1 w /v1/chat/completions i /v1/messages Liczone zamiast tego w limicie wywołań Shannon Coder.
Zapytanie z odpowiedzią 401 albo 400 dla nieznanego model Nieliczone.
Zapytanie odrzucone przez ochronę przed floodem Liczone do okna. Nic nie jest naliczane.

Zapytania równoległe

Nie ma limitu liczby zapytań, które konto ma otwarte w tym samym czasie, ani błędu za wysyłanie zapytań równolegle. Zapytania, które nie mogą ruszyć od razu, czekają w kolejce i są obsługiwane po kolei.

  • Każde zapytanie wlicza się do 120 na minutę w chwili nadejścia, niezależnie od tego, czy wcześniejsze zapytania się zakończyły.
  • Każde zapytanie trzyma własną rezerwację do swojego końca. Dwadzieścia otwartych zapytań z domyślnym budżetem wyjścia trzyma 20 × 4,096 = 81,920 tokenów salda. Jeśli rezerwacje razem są większe niż Twoje saldo, następne zapytanie dostaje odpowiedź Quota exceeded, mimo że zakończone wywołania kosztowałyby mniej. Mniejsze max_tokens trzyma mniej.
  • Zapytanie bez streamingu niczego nie wysyła, dopóki odpowiedź nie jest kompletna, więc ustaw w kliencie timeout obejmujący to oczekiwanie. Stream utrzymuje otwarte połączenie, gdy czeka. Streaming

Limity pojedynczego zapytania

Limit Wartość Dotyczy Po osiągnięciu limitu
Treść zapytania 32 MiB (33,554,432 bajtów) Każdy endpoint Status 413, typ invalid_request_error.
Budżet wyjścia: max_tokens, max_completion_tokens, max_output_tokens Od 1 do 65,536. Domyślnie 4,096; dla shannon-coder-1 w /v1/chat/completions i /v1/messages domyślnie 65,536. Każdy model, jako kwota rezerwowana z Twojego salda. Jako limit długości odpowiedzi: hostowane modele open-weight, shannon-1.6-lite, shannon-1.6-pro i shannon-coder-1. Wartość spoza zakresu jest przesuwana do najbliższego końca zakresu. Bez błędu.
Sekwencje zatrzymania: stop, stop_sequences 4 ciągi Hostowane modele open-weight Używane są pierwsze 4 niepuste ciągi.
Obraz lub plik podany jako URL 8 MiB, odczyt w ciągu 20 sekund, najwyżej 5 przekierowań, publiczny adres http lub https Każdy endpoint przyjmujący obrazy lub pliki Zapytanie dostaje odpowiedź bez tej części. Bez błędu.
Obraz lub plik wysłany inline (base64) Brak własnego limitu. Liczy się do treści zapytania o rozmiarze 32 MiB. Każdy endpoint przyjmujący obrazy lub pliki Status 413 dla całego zapytania.
text w POST /v1/tokenize 4,000,000 bajtów /v1/tokenize Status 413, typ invalid_request_error, komunikat text too long.
messages w POST /v1/tokenize i treść POST /v1/messages/count_tokens Treść zapytania o rozmiarze 32 MiB Oba endpointy liczące Status 413.
Okno kontekstu Zależnie od modelu: context_window w GET /v1/models Każdy model Co dzieje się z dłuższą rozmową, zależy od modelu. Modele i ceny
Wyszukiwania w sieci (web_search: true) Według planu i dnia: Free 3, Plus 30, Standard 50, Pro 60. Liczone jest jedno wyszukiwanie dla zapytania, w którym wyszukiwanie znalazło wyniki. Zapytania z ustawionym web_search: true Gdy nic nie zostało, zapytanie dostaje odpowiedź bez wyszukiwania. Bez błędu. Wbudowane wyszukiwanie w sieci

Błędy

Odpowiedzi tej strony. W /v1/messages ten sam obiekt error jest opakowany jako {"type": "error", "error": {…}}.

Status Typ Komunikat Kiedy i co zrobić
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Rezerwacja zapytania nie mieści się w Twoim saldzie. Poczekaj do 00:00 UTC, doładuj środki, zmień plan albo wyślij mniejsze max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Ponad 120 zapytań w bieżącej minucie. Poczekaj N sekund i wyślij ponownie.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Wywołania Shannon Coder z bieżącego 4-godzinnego okna zostały wyczerpane.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Model nie może w tej chwili przyjąć zapytania. Wyślij je ponownie po krótkiej przerwie.
503 api_error Could not verify your quota right now. Please retry. Nie udało się odczytać Twojego salda. Nic nie jest naliczane; wyślij zapytanie ponownie. W /v1/responses z modelem Shannon status wynosi 500.
413 invalid_request_error Treść zapytania jest większa niż 32 MiB. W endpointach w formacie OpenAI obiekt error zawiera code: "request_too_large".
413 invalid_request_error text too long text w POST /v1/tokenize jest dłuższe niż 4,000,000 bajtów.