Vai al contenuto
Limiti e saldo

Limiti e saldo

Ogni richiesta è servita allo stesso modo. Nessuna fascia di frequenza. Nessuna quota API separata. Hai già pagato i tuoi token: usali alla velocità che vuoi.

Questa pagina spiega di cosa è fatto il tuo saldo, cosa riserva e cosa costa una richiesta, quante richieste puoi inviare e i pochi limiti in cui può imbattersi una singola richiesta.

valore di 1M di token di saldo
$5.00
la quota giornaliera si rinnova
00:00 UTC
flood protection, per account
120 richieste / min

Come vengono servite le richieste

  • Nessuna fascia di frequenza — Una sola regola limita la velocità con cui possono arrivare le richieste, ed è la stessa per ogni account e ogni piano: 120 richieste al minuto. Non c'è alcun limite ai token al minuto.
  • Nessuna quota API separata — L'API consuma lo stesso saldo della chat. Un piano stabilisce la dimensione della quota di oggi. Non stabilisce una frequenza di richieste.
  • Veloce quanto vuoi — Le richieste inviate in parallelo vengono accettate e attendono in coda. Non vengono rifiutate perché parallele.

Il tuo saldo

Il tuo saldo è conteggiato in token. 1,000,000 di token di saldo valgono $5.00, e ogni prezzo nella pagina Modelli e prezzi è una tariffa rispetto a quel valore.

In ogni momento il saldo è la somma di due parti.

  • Quota del piano odierna — Un numero di token stabilito dal tuo piano. Si rinnova ogni giorno alle 00:00 UTC. Ciò che resta alla fine di un giorno non viene riportato.
  • Credito acquistato — Token che hai acquistato come pacchetto. Il credito non scade e vale su ogni piano, compreso Free.
Piano Token al giorno Valore
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Ordine di consumo — Ogni richiesta consuma prima la quota del piano di oggi. Il credito acquistato viene usato solo per ciò che supera la quota di quel giorno.
  • Chat e API lo condividono — C'è un solo saldo per account. Una chiave API consuma dal saldo dell'account a cui appartiene, agli stessi prezzi della chat.
  • Pacchetti — Il credito si vende in pacchetti da 1,000,000 ($5.00), 2,000,000 ($10.00) e 5,000,000 ($25.00) token, oppure per un importo a tua scelta da 1,000,000 a 100,000,000 token a $5.00 per 1,000,000.

Ricarica credito Cambia piano

Cosa riserva una richiesta e quanto costa

  • Riserva — Quando arriva una richiesta, riserva il suo budget di output dal tuo saldo: max_tokens su /v1/chat/completions e /v1/messages, max_output_tokens su /v1/responses. /v1/chat/completions legge anche max_completion_tokens. Il default è 4,096 e l'intervallo va da 1 a 65,536.
  • Ammissione — La richiesta viene accettata solo se la riserva rientra in ciò che resta del tuo saldo. Un saldo superiore a zero ma inferiore al budget di output riceve la risposta Quota exceeded. Invia un max_tokens più piccolo per usare il resto.
  • Regolazione — Quando la risposta è completa, la riserva viene sostituita dall'addebito reale. L'addebito può essere inferiore o superiore alla riserva.
  • Restituzione — Una richiesta che termina con uno stato di errore restituisce per intero la propria riserva.

L'addebito reale dipende dalla famiglia del modello.

Modelli Cosa viene addebitato
Modelli Shannon usage.total_tokens al prezzo del modello per 1M. Input e output hanno un'unica tariffa.
Modelli open-weight ospitati Input non cached alla tariffa dell'input, input cached alla tariffa cached, output alla tariffa dell'output.

L'importo in USD viene prelevato dal tuo saldo in token a $5.00 per 1,000,000, arrotondato a un token intero.

Contare i token con POST /v1/tokenize o POST /v1/messages/count_tokens è gratuito e non riserva nulla. Conteggio dei token

Dove vedere saldo e utilizzo

La pagina Chiavi e utilizzo mostra quanto puoi spendere adesso, la quota del piano di oggi, il tuo credito acquistato e la spesa API degli ultimi 30 giorni. Sotto elenca ogni richiesta effettuata dalla tua chiave: ora, endpoint, modello, input cached, token fatturati e costo. Chiavi e utilizzo

Ogni risposta porta anche un oggetto usage con i conteggi dei token di quella chiamata.

Endpoint Campi di usage Aggiunti dai modelli open-weight ospitati
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage contiene i conteggi dei token del modello. L'importo prelevato dal tuo saldo non è nella risposta: è la colonna Token fatturati dell'elenco delle richieste in Chiavi e utilizzo.
  • Su /v1/messages con un modello open-weight ospitato, input_tokens è la parte non cached dell'input, cache_read_input_tokens è la parte cached e cache_creation_input_tokens è sempre 0.
  • Uno stream su /v1/chat/completions porta usage nell'ultimo chunk prima di [DONE]. Streaming

Quando il saldo si esaurisce

Una richiesta la cui riserva non rientra nel tuo saldo riceve come risposta lo stato 429, il tipo rate_limit_error e il messaggio qui sotto. Non viene addebitato nulla. La stessa risposta viene inviata quando il saldo è superiore a zero ma inferiore al budget di output della richiesta.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Su /v1/responses l'oggetto error può contenere anche code e param, entrambi null.

Cosa puoi fare:

  • Attendi la prossima quota del piano alle 00:00 UTC.
  • Ricarica il credito. Il credito viene speso dopo la quota del piano e non scade. Ricarica credito
  • Passa a un piano con una quota giornaliera più ampia. Cambia piano
  • Invia un max_tokens più piccolo, se resta un po' di saldo: la riserva è allora più piccola.

Quota di chiamate Shannon Coder

shannon-coder-1 su /v1/chat/completions e /v1/messages è conteggiato in chiamate, non in token. Ogni piano include un numero di chiamate per finestra di 4 ore. Una richiesta è una chiamata.

Piano Chiamate per finestra di 4 ore
Free 3
Plus 20
Standard 40
Pro 60
  • Le finestre iniziano alle 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Le chiamate rimaste alla fine di una finestra non vengono riportate.
  • Una chiamata viene conteggiata quando la richiesta è accettata, prima che il modello risponda. Una richiesta che fallisce dopo conta comunque come chiamata.
  • Queste chiamate non riservano token e non prelevano nulla dal tuo saldo. L'elenco delle richieste in Chiavi e utilizzo mostra il loro numero di token e il suo valore al prezzo indicato.
  • Il max_tokens predefinito di shannon-coder-1 su questi due endpoint è 65,536.
  • Senza chiamate rimaste la risposta ha stato 429, tipo rate_limit_error, messaggio Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Su /v1/responses, shannon-coder-1 non ha una quota di chiamate: viene addebitato in token dal tuo saldo a $8.00 per 1M, come ogni altro modello.

Flood protection

Un account può inviare 120 richieste al minuto. È l'unico limite alla frequenza delle richieste, ed è lo stesso su ogni piano. Esiste per fermare le inondazioni di richieste, non per rallentare l'uso normale.

  • Il minuto è una finestra fissa di 60 secondi che si apre con la tua prima richiesta. Quando termina, il conteggio riparte da zero.
  • Il conteggio è per account, non per chiave né per indirizzo IP. Ruotare la chiave non apre una nuova finestra.
  • La 121ª richiesta all'interno di una finestra riceve come risposta lo stato 429, il tipo rate_limit_error e il messaggio Too many requests. Retry in <N>s. N è il numero di secondi fino alla fine della finestra, da 1 a 60.
  • La flood protection viene verificata prima del saldo. Una richiesta che rifiuta non riserva nulla e non costa nulla.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Richiesta Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Conteggiato, uno per richiesta.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Non conteggiato.
shannon-coder-1 su /v1/chat/completions e /v1/messages Conteggiato invece dalla quota di chiamate Shannon Coder.
Una richiesta che riceve come risposta 401, oppure 400 per un model sconosciuto Non conteggiato.
Una richiesta rifiutata dalla flood protection Conteggiato nella finestra. Non viene addebitato nulla.

Richieste in parallelo

Non c'è alcun limite al numero di richieste che un account può avere aperte contemporaneamente, né un errore per l'invio di richieste in parallelo. Le richieste che non possono partire subito attendono in coda e ricevono risposta a turno.

  • Ogni richiesta conta per le 120 al minuto quando arriva, a prescindere dal fatto che le richieste precedenti siano terminate.
  • Ogni richiesta mantiene la propria riserva fino alla fine. Venti richieste aperte con il budget di output predefinito mantengono 20 × 4,096 = 81,920 token di saldo. Se le riserve insieme sono maggiori del tuo saldo, la richiesta successiva riceve la risposta Quota exceeded, anche se le chiamate terminate sarebbero costate meno. Un max_tokens più piccolo mantiene meno.
  • Una richiesta senza streaming non invia nulla finché la risposta non è completa, quindi dai al tuo client un timeout che copra l'attesa. Uno stream mantiene aperta la connessione mentre attende. Streaming

Limiti di una singola richiesta

Limite Valore Si applica a Al limite
Corpo della richiesta 32 MiB (33,554,432 byte) Ogni endpoint Stato 413, tipo invalid_request_error.
Budget di output: max_tokens, max_completion_tokens, max_output_tokens Da 1 a 65,536. Default 4,096; per shannon-coder-1 su /v1/chat/completions e /v1/messages il default è 65,536. Ogni modello, come quantità riservata dal tuo saldo. Come limite alla lunghezza della risposta: i modelli open-weight ospitati, shannon-1.6-lite, shannon-1.6-pro e shannon-coder-1. Un valore fuori dall'intervallo viene portato all'estremo più vicino dell'intervallo. Nessun errore.
Sequenze di stop: stop, stop_sequences 4 stringhe Modelli open-weight ospitati Vengono usate le prime 4 stringhe non vuote.
Immagine o file dati come URL 8 MiB, letti entro 20 secondi, al massimo 5 reindirizzamenti, un indirizzo http o https pubblico Ogni endpoint che accetta immagini o file La richiesta riceve risposta senza quella parte. Nessun errore.
Immagine o file inviati inline (base64) Nessun limite proprio. Conta per il corpo della richiesta di 32 MiB. Ogni endpoint che accetta immagini o file Stato 413 per l'intera richiesta.
text di POST /v1/tokenize 4,000,000 byte /v1/tokenize Stato 413, tipo invalid_request_error, messaggio text too long.
messages di POST /v1/tokenize e il corpo di POST /v1/messages/count_tokens Il corpo della richiesta di 32 MiB Entrambi gli endpoint di conteggio Stato 413.
Finestra di contesto Per modello: context_window in GET /v1/models Ogni modello Cosa succede a una conversazione più lunga dipende dal modello. Modelli e prezzi
Ricerche web (web_search: true) Per piano e per giorno: Free 3, Plus 30, Standard 50, Pro 60. Viene conteggiata una ricerca per una richiesta la cui ricerca ha trovato risultati. Richieste che impostano web_search: true Se non ne restano, la richiesta riceve risposta senza ricerca. Nessun errore. Ricerca web integrata

Errori

Le risposte di questa pagina. Su /v1/messages lo stesso oggetto error è racchiuso come {"type": "error", "error": {…}}.

Stato Tipo Messaggio Quando, e cosa fare
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan La riserva della richiesta non rientra nel tuo saldo. Attendi le 00:00 UTC, ricarica il credito, cambia piano oppure invia un max_tokens più piccolo.
429 rate_limit_error Too many requests. Retry in <N>s. Più di 120 richieste nel minuto in corso. Attendi N secondi e invia di nuovo.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Le chiamate Shannon Coder della finestra di 4 ore in corso sono esaurite.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Il modello non può accettare la richiesta in questo momento. Inviala di nuovo dopo una breve pausa.
503 api_error Could not verify your quota right now. Please retry. Non è stato possibile leggere il tuo saldo. Non viene addebitato nulla; invia di nuovo la richiesta. Su /v1/responses con un modello Shannon lo stato è 500.
413 invalid_request_error Il corpo della richiesta è più grande di 32 MiB. Sugli endpoint nel formato OpenAI l'oggetto error porta code: "request_too_large".
413 invalid_request_error text too long text di POST /v1/tokenize è più lungo di 4,000,000 byte.