Limiti e saldo
Ogni richiesta è servita allo stesso modo. Nessuna fascia di frequenza. Nessuna quota API separata. Hai già pagato i tuoi token: usali alla velocità che vuoi.
Questa pagina spiega di cosa è fatto il tuo saldo, cosa riserva e cosa costa una richiesta, quante richieste puoi inviare e i pochi limiti in cui può imbattersi una singola richiesta.
- valore di 1M di token di saldo
- $5.00
- la quota giornaliera si rinnova
- 00:00 UTC
- flood protection, per account
- 120 richieste / min
Come vengono servite le richieste
- Nessuna fascia di frequenza — Una sola regola limita la velocità con cui possono arrivare le richieste, ed è la stessa per ogni account e ogni piano: 120 richieste al minuto. Non c'è alcun limite ai token al minuto.
- Nessuna quota API separata — L'API consuma lo stesso saldo della chat. Un piano stabilisce la dimensione della quota di oggi. Non stabilisce una frequenza di richieste.
- Veloce quanto vuoi — Le richieste inviate in parallelo vengono accettate e attendono in coda. Non vengono rifiutate perché parallele.
Il tuo saldo
Il tuo saldo è conteggiato in token. 1,000,000 di token di saldo valgono $5.00, e ogni prezzo nella pagina Modelli e prezzi è una tariffa rispetto a quel valore.
In ogni momento il saldo è la somma di due parti.
- Quota del piano odierna — Un numero di token stabilito dal tuo piano. Si rinnova ogni giorno alle 00:00 UTC. Ciò che resta alla fine di un giorno non viene riportato.
- Credito acquistato — Token che hai acquistato come pacchetto. Il credito non scade e vale su ogni piano, compreso Free.
| Piano | Token al giorno | Valore |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Ordine di consumo — Ogni richiesta consuma prima la quota del piano di oggi. Il credito acquistato viene usato solo per ciò che supera la quota di quel giorno.
- Chat e API lo condividono — C'è un solo saldo per account. Una chiave API consuma dal saldo dell'account a cui appartiene, agli stessi prezzi della chat.
- Pacchetti — Il credito si vende in pacchetti da 1,000,000 ($5.00), 2,000,000 ($10.00) e 5,000,000 ($25.00) token, oppure per un importo a tua scelta da 1,000,000 a 100,000,000 token a $5.00 per 1,000,000.
Cosa riserva una richiesta e quanto costa
- Riserva — Quando arriva una richiesta, riserva il suo budget di output dal tuo saldo:
max_tokenssu/v1/chat/completionse/v1/messages,max_output_tokenssu/v1/responses./v1/chat/completionslegge anchemax_completion_tokens. Il default è 4,096 e l'intervallo va da 1 a 65,536. - Ammissione — La richiesta viene accettata solo se la riserva rientra in ciò che resta del tuo saldo. Un saldo superiore a zero ma inferiore al budget di output riceve la risposta
Quota exceeded. Invia unmax_tokenspiù piccolo per usare il resto. - Regolazione — Quando la risposta è completa, la riserva viene sostituita dall'addebito reale. L'addebito può essere inferiore o superiore alla riserva.
- Restituzione — Una richiesta che termina con uno stato di errore restituisce per intero la propria riserva.
L'addebito reale dipende dalla famiglia del modello.
| Modelli | Cosa viene addebitato |
|---|---|
| Modelli Shannon | usage.total_tokens al prezzo del modello per 1M. Input e output hanno un'unica tariffa. |
| Modelli open-weight ospitati | Input non cached alla tariffa dell'input, input cached alla tariffa cached, output alla tariffa dell'output. |
L'importo in USD viene prelevato dal tuo saldo in token a $5.00 per 1,000,000, arrotondato a un token intero.
Contare i token con POST /v1/tokenize o POST /v1/messages/count_tokens è gratuito e non riserva nulla. Conteggio dei token
Dove vedere saldo e utilizzo
La pagina Chiavi e utilizzo mostra quanto puoi spendere adesso, la quota del piano di oggi, il tuo credito acquistato e la spesa API degli ultimi 30 giorni. Sotto elenca ogni richiesta effettuata dalla tua chiave: ora, endpoint, modello, input cached, token fatturati e costo. Chiavi e utilizzo
Ogni risposta porta anche un oggetto usage con i conteggi dei token di quella chiamata.
| Endpoint | Campi di usage | Aggiunti dai modelli open-weight ospitati |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usagecontiene i conteggi dei token del modello. L'importo prelevato dal tuo saldo non è nella risposta: è la colonna Token fatturati dell'elenco delle richieste in Chiavi e utilizzo.- Su
/v1/messagescon un modello open-weight ospitato,input_tokensè la parte non cached dell'input,cache_read_input_tokensè la parte cached ecache_creation_input_tokensè sempre0. - Uno stream su
/v1/chat/completionsportausagenell'ultimo chunk prima di[DONE]. Streaming
Quando il saldo si esaurisce
Una richiesta la cui riserva non rientra nel tuo saldo riceve come risposta lo stato 429, il tipo rate_limit_error e il messaggio qui sotto. Non viene addebitato nulla. La stessa risposta viene inviata quando il saldo è superiore a zero ma inferiore al budget di output della richiesta.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Su /v1/responses l'oggetto error può contenere anche code e param, entrambi null.
Cosa puoi fare:
- Attendi la prossima quota del piano alle 00:00 UTC.
- Ricarica il credito. Il credito viene speso dopo la quota del piano e non scade. Ricarica credito
- Passa a un piano con una quota giornaliera più ampia. Cambia piano
- Invia un
max_tokenspiù piccolo, se resta un po' di saldo: la riserva è allora più piccola.
Quota di chiamate Shannon Coder
shannon-coder-1 su /v1/chat/completions e /v1/messages è conteggiato in chiamate, non in token. Ogni piano include un numero di chiamate per finestra di 4 ore. Una richiesta è una chiamata.
| Piano | Chiamate per finestra di 4 ore |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Le finestre iniziano alle 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Le chiamate rimaste alla fine di una finestra non vengono riportate.
- Una chiamata viene conteggiata quando la richiesta è accettata, prima che il modello risponda. Una richiesta che fallisce dopo conta comunque come chiamata.
- Queste chiamate non riservano token e non prelevano nulla dal tuo saldo. L'elenco delle richieste in Chiavi e utilizzo mostra il loro numero di token e il suo valore al prezzo indicato.
- Il
max_tokenspredefinito dishannon-coder-1su questi due endpoint è 65,536. - Senza chiamate rimaste la risposta ha stato
429, tiporate_limit_error, messaggioShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Su
/v1/responses,shannon-coder-1non ha una quota di chiamate: viene addebitato in token dal tuo saldo a $8.00 per 1M, come ogni altro modello.
Flood protection
Un account può inviare 120 richieste al minuto. È l'unico limite alla frequenza delle richieste, ed è lo stesso su ogni piano. Esiste per fermare le inondazioni di richieste, non per rallentare l'uso normale.
- Il minuto è una finestra fissa di 60 secondi che si apre con la tua prima richiesta. Quando termina, il conteggio riparte da zero.
- Il conteggio è per account, non per chiave né per indirizzo IP. Ruotare la chiave non apre una nuova finestra.
- La 121ª richiesta all'interno di una finestra riceve come risposta lo stato
429, il tiporate_limit_errore il messaggioToo many requests. Retry in <N>s.Nè il numero di secondi fino alla fine della finestra, da 1 a 60. - La flood protection viene verificata prima del saldo. Una richiesta che rifiuta non riserva nulla e non costa nulla.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Richiesta | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Conteggiato, uno per richiesta. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Non conteggiato. |
shannon-coder-1 su /v1/chat/completions e /v1/messages | Conteggiato invece dalla quota di chiamate Shannon Coder. |
Una richiesta che riceve come risposta 401, oppure 400 per un model sconosciuto | Non conteggiato. |
| Una richiesta rifiutata dalla flood protection | Conteggiato nella finestra. Non viene addebitato nulla. |
Richieste in parallelo
Non c'è alcun limite al numero di richieste che un account può avere aperte contemporaneamente, né un errore per l'invio di richieste in parallelo. Le richieste che non possono partire subito attendono in coda e ricevono risposta a turno.
- Ogni richiesta conta per le 120 al minuto quando arriva, a prescindere dal fatto che le richieste precedenti siano terminate.
- Ogni richiesta mantiene la propria riserva fino alla fine. Venti richieste aperte con il budget di output predefinito mantengono 20 × 4,096 = 81,920 token di saldo. Se le riserve insieme sono maggiori del tuo saldo, la richiesta successiva riceve la risposta
Quota exceeded, anche se le chiamate terminate sarebbero costate meno. Unmax_tokenspiù piccolo mantiene meno. - Una richiesta senza streaming non invia nulla finché la risposta non è completa, quindi dai al tuo client un timeout che copra l'attesa. Uno stream mantiene aperta la connessione mentre attende. Streaming
Limiti di una singola richiesta
| Limite | Valore | Si applica a | Al limite |
|---|---|---|---|
| Corpo della richiesta | 32 MiB (33,554,432 byte) | Ogni endpoint | Stato 413, tipo invalid_request_error. |
Budget di output: max_tokens, max_completion_tokens, max_output_tokens | Da 1 a 65,536. Default 4,096; per shannon-coder-1 su /v1/chat/completions e /v1/messages il default è 65,536. | Ogni modello, come quantità riservata dal tuo saldo. Come limite alla lunghezza della risposta: i modelli open-weight ospitati, shannon-1.6-lite, shannon-1.6-pro e shannon-coder-1. | Un valore fuori dall'intervallo viene portato all'estremo più vicino dell'intervallo. Nessun errore. |
Sequenze di stop: stop, stop_sequences | 4 stringhe | Modelli open-weight ospitati | Vengono usate le prime 4 stringhe non vuote. |
| Immagine o file dati come URL | 8 MiB, letti entro 20 secondi, al massimo 5 reindirizzamenti, un indirizzo http o https pubblico | Ogni endpoint che accetta immagini o file | La richiesta riceve risposta senza quella parte. Nessun errore. |
| Immagine o file inviati inline (base64) | Nessun limite proprio. Conta per il corpo della richiesta di 32 MiB. | Ogni endpoint che accetta immagini o file | Stato 413 per l'intera richiesta. |
text di POST /v1/tokenize | 4,000,000 byte | /v1/tokenize | Stato 413, tipo invalid_request_error, messaggio text too long. |
messages di POST /v1/tokenize e il corpo di POST /v1/messages/count_tokens | Il corpo della richiesta di 32 MiB | Entrambi gli endpoint di conteggio | Stato 413. |
| Finestra di contesto | Per modello: context_window in GET /v1/models | Ogni modello | Cosa succede a una conversazione più lunga dipende dal modello. Modelli e prezzi |
Ricerche web (web_search: true) | Per piano e per giorno: Free 3, Plus 30, Standard 50, Pro 60. Viene conteggiata una ricerca per una richiesta la cui ricerca ha trovato risultati. | Richieste che impostano web_search: true | Se non ne restano, la richiesta riceve risposta senza ricerca. Nessun errore. Ricerca web integrata |
Errori
Le risposte di questa pagina. Su /v1/messages lo stesso oggetto error è racchiuso come {"type": "error", "error": {…}}.
| Stato | Tipo | Messaggio | Quando, e cosa fare |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | La riserva della richiesta non rientra nel tuo saldo. Attendi le 00:00 UTC, ricarica il credito, cambia piano oppure invia un max_tokens più piccolo. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Più di 120 richieste nel minuto in corso. Attendi N secondi e invia di nuovo. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Le chiamate Shannon Coder della finestra di 4 ore in corso sono esaurite. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Il modello non può accettare la richiesta in questo momento. Inviala di nuovo dopo una breve pausa. |
503 | api_error | Could not verify your quota right now. Please retry. | Non è stato possibile leggere il tuo saldo. Non viene addebitato nulla; invia di nuovo la richiesta. Su /v1/responses con un modello Shannon lo stato è 500. |
413 | invalid_request_error | Il corpo della richiesta è più grande di 32 MiB. Sugli endpoint nel formato OpenAI l'oggetto error porta code: "request_too_large". | |
413 | invalid_request_error | text too long | text di POST /v1/tokenize è più lungo di 4,000,000 byte. |