Όρια και υπόλοιπο
Κάθε αίτημα εξυπηρετείται ισότιμα. Χωρίς επίπεδα ρυθμού. Χωρίς ξεχωριστή ποσόστωση API. Έχετε ήδη πληρώσει για τα tokens σας — χρησιμοποιήστε τα όσο γρήγορα θέλετε.
Αυτή η σελίδα εξηγεί από τι αποτελείται το υπόλοιπό σας, τι δεσμεύει και τι κοστίζει ένα αίτημα, πόσα αιτήματα μπορείτε να στείλετε και τα λίγα όρια που μπορεί να συναντήσει ένα μεμονωμένο αίτημα.
- αξία 1M tokens υπολοίπου
- $5.00
- το ημερήσιο όριο ανανεώνεται
- 00:00 UTC
- προστασία από υπερφόρτωση, ανά λογαριασμό
- 120 αιτήματα / λεπτό
Πώς εξυπηρετούνται τα αιτήματα
- Χωρίς επίπεδα ρυθμού — Ένας κανόνας περιορίζει πόσο γρήγορα μπορούν να φτάνουν τα αιτήματα και είναι ίδιος για κάθε λογαριασμό και κάθε πλάνο: 120 αιτήματα ανά λεπτό. Δεν υπάρχει όριο tokens ανά λεπτό.
- Χωρίς ξεχωριστή ποσόστωση API — Το API ξοδεύει το ίδιο υπόλοιπο με το chat. Ένα πλάνο ορίζει το μέγεθος του σημερινού ορίου. Δεν ορίζει ρυθμό αιτημάτων.
- Όσο γρήγορα θέλετε — Τα αιτήματα που στέλνονται παράλληλα γίνονται δεκτά και περιμένουν σε ουρά. Δεν απορρίπτονται επειδή είναι παράλληλα.
Το υπόλοιπό σας
Το υπόλοιπό σας μετριέται σε tokens. 1,000,000 tokens υπολοίπου αξίζουν $5.00, και κάθε τιμή στη σελίδα Μοντέλα & τιμές είναι ποσοστό αυτής της αξίας.
Σε κάθε στιγμή, το υπόλοιπο είναι το άθροισμα δύο μερών.
- Ημερήσιο όριο του πλάνου — Ένας αριθμός tokens που ορίζει το πλάνο σας. Ανανεώνεται κάθε μέρα στις 00:00 UTC. Ό,τι απομένει στο τέλος της ημέρας δεν μεταφέρεται.
- Αγορασμένο credit — Tokens που αγοράσατε ως πακέτο. Το credit δεν λήγει και λειτουργεί σε κάθε πλάνο, και στο Free.
| Πλάνο | Tokens ανά ημέρα | Αξία |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- Σειρά κατανάλωσης — Κάθε αίτημα καταναλώνει πρώτα το σημερινό ημερήσιο όριο του πλάνου. Το αγορασμένο credit χρησιμοποιείται μόνο για ό,τι ξεπερνά το όριο εκείνης της ημέρας.
- Το chat και το API το μοιράζονται — Υπάρχει ένα υπόλοιπο ανά λογαριασμό. Ένα κλειδί API ξοδεύει από το υπόλοιπο του λογαριασμού στον οποίο ανήκει, με τις ίδιες τιμές όπως το chat.
- Πακέτα — Το credit πωλείται σε πακέτα των 1,000,000 ($5.00), 2,000,000 ($10.00) και 5,000,000 ($25.00) tokens, ή ως ποσό της επιλογής σας από 1,000,000 έως 100,000,000 tokens προς $5.00 ανά 1,000,000.
Προσθήκη πιστωτικού Αλλαγή σχεδίου
Τι δεσμεύει ένα αίτημα και τι κοστίζει
- Δέσμευση — Όταν φτάνει ένα αίτημα, δεσμεύει από το υπόλοιπό σας τον προϋπολογισμό εξόδου του:
max_tokensστα/v1/chat/completionsκαι/v1/messages,max_output_tokensστο/v1/responses. Το/v1/chat/completionsδιαβάζει επίσης τοmax_completion_tokens. Η προεπιλογή είναι 4,096 και το εύρος 1 έως 65,536. - Αποδοχή — Το αίτημα γίνεται δεκτό μόνο αν η δέσμευση χωράει σε ό,τι απομένει από το υπόλοιπό σας. Ένα υπόλοιπο πάνω από το μηδέν αλλά μικρότερο από τον προϋπολογισμό εξόδου παίρνει την απάντηση
Quota exceeded. Στείλτε μικρότεροmax_tokensγια να χρησιμοποιήσετε το υπόλοιπο. - Εκκαθάριση — Όταν η απάντηση ολοκληρωθεί, η δέσμευση αντικαθίσταται από την πραγματική χρέωση. Η χρέωση μπορεί να είναι χαμηλότερη ή υψηλότερη από τη δέσμευση.
- Επιστροφή — Ένα αίτημα που τελειώνει με κατάσταση σφάλματος επιστρέφει ολόκληρη τη δέσμευσή του.
Η πραγματική χρέωση εξαρτάται από την οικογένεια του μοντέλου.
| Μοντέλα | Τι χρεώνεται |
|---|---|
| Μοντέλα Shannon | Το usage.total_tokens στην τιμή του μοντέλου ανά 1M. Η είσοδος και η έξοδος έχουν μία τιμή. |
| Φιλοξενούμενα μοντέλα ανοιχτών βαρών | Η μη cached είσοδος με την τιμή εισόδου, η cached είσοδος με την τιμή cached, η έξοδος με την τιμή εξόδου. |
Το ποσό σε USD αφαιρείται από το υπόλοιπό σας σε tokens προς $5.00 ανά 1,000,000, στρογγυλεμένο σε ακέραιο token.
Η μέτρηση tokens με POST /v1/tokenize ή POST /v1/messages/count_tokens είναι δωρεάν και δεν δεσμεύει τίποτα. Καταμέτρηση tokens
Πού να δείτε υπόλοιπο και χρήση
Η σελίδα Κλειδιά & χρήση δείχνει όσα μπορείτε να ξοδέψετε αυτή τη στιγμή, το σημερινό ημερήσιο όριο του πλάνου, το αγορασμένο credit και τη δαπάνη API των τελευταίων 30 ημερών. Από κάτω απαριθμεί κάθε αίτημα που έκανε το κλειδί σας: ώρα, endpoint, μοντέλο, cached είσοδο, χρεωμένα tokens και κόστος. Κλειδιά & χρήση
Κάθε απάντηση φέρει επίσης ένα αντικείμενο usage με τους αριθμούς tokens εκείνης της κλήσης.
| Endpoint | Πεδία του usage | Προστίθενται από τα φιλοξενούμενα μοντέλα ανοιχτών βαρών |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
- Το
usageπεριέχει τους αριθμούς tokens του μοντέλου. Το ποσό που αφαιρείται από το υπόλοιπό σας δεν υπάρχει στην απάντηση: βρίσκεται στη στήλη Χρεωμένα tokens της λίστας αιτημάτων στο Κλειδιά & χρήση. - Στο
/v1/messagesμε φιλοξενούμενο μοντέλο ανοιχτών βαρών, τοinput_tokensείναι το μη cached μέρος της εισόδου, τοcache_read_input_tokensείναι το cached μέρος και τοcache_creation_input_tokensείναι πάντα0. - Ένα stream στο
/v1/chat/completionsφέρει τοusageστο τελευταίο του chunk πριν από το[DONE]. Ροή
Όταν εξαντληθεί το υπόλοιπο
Ένα αίτημα του οποίου η δέσμευση δεν χωράει στο υπόλοιπό σας απαντάται με κατάσταση 429, τύπο rate_limit_error και το μήνυμα παρακάτω. Δεν χρεώνεται τίποτα. Η ίδια απάντηση στέλνεται όταν το υπόλοιπο είναι πάνω από το μηδέν αλλά μικρότερο από τον προϋπολογισμό εξόδου του αιτήματος.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} Στο /v1/responses το αντικείμενο error μπορεί να περιέχει και τα code και param, και τα δύο null.
Τι μπορείτε να κάνετε:
- Περιμένετε το επόμενο ημερήσιο όριο του πλάνου στις 00:00 UTC.
- Προσθέστε credit. Το credit καταναλώνεται μετά το ημερήσιο όριο του πλάνου και δεν λήγει. Προσθήκη πιστωτικού
- Αλλάξτε σε πλάνο με μεγαλύτερο ημερήσιο όριο. Αλλαγή σχεδίου
- Στείλτε μικρότερο
max_tokens, αν απομένει κάποιο υπόλοιπο: τότε η δέσμευση είναι μικρότερη.
Όριο κλήσεων Shannon Coder
Το shannon-coder-1 στα /v1/chat/completions και /v1/messages μετριέται σε κλήσεις, όχι σε tokens. Κάθε πλάνο περιλαμβάνει έναν αριθμό κλήσεων ανά παράθυρο 4 ωρών. Ένα αίτημα είναι μία κλήση.
| Πλάνο | Κλήσεις ανά παράθυρο 4 ωρών |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- Τα παράθυρα ξεκινούν στις 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Οι κλήσεις που απομένουν στο τέλος ενός παραθύρου δεν μεταφέρονται.
- Μια κλήση μετριέται όταν γίνεται δεκτό το αίτημα, πριν απαντήσει το μοντέλο. Ένα αίτημα που αποτυγχάνει στη συνέχεια μετριέται παρ' όλα αυτά ως κλήση.
- Αυτές οι κλήσεις δεν δεσμεύουν tokens και δεν αφαιρούν τίποτα από το υπόλοιπό σας. Η λίστα αιτημάτων στο Κλειδιά & χρήση δείχνει τον αριθμό tokens τους και την αξία τους στην αναγραφόμενη τιμή.
- Το προεπιλεγμένο
max_tokensτουshannon-coder-1σε αυτά τα δύο endpoints είναι 65,536. - Όταν δεν απομένουν κλήσεις, η απάντηση έχει κατάσταση
429, τύποrate_limit_errorκαι μήνυμαShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - Στο
/v1/responses, τοshannon-coder-1δεν έχει όριο κλήσεων: χρεώνεται σε tokens από το υπόλοιπό σας προς $8.00 ανά 1M, όπως κάθε άλλο μοντέλο.
Προστασία από υπερφόρτωση
Ένας λογαριασμός μπορεί να στείλει 120 αιτήματα ανά λεπτό. Αυτό είναι το μόνο όριο στον ρυθμό αιτημάτων και είναι ίδιο σε κάθε πλάνο. Υπάρχει για να σταματά τις πλημμύρες αιτημάτων, όχι για να επιβραδύνει την κανονική χρήση.
- Το λεπτό είναι ένα σταθερό παράθυρο 60 δευτερολέπτων που ανοίγει με το πρώτο σας αίτημα. Όταν τελειώσει, η μέτρηση ξεκινά ξανά από το μηδέν.
- Η μέτρηση γίνεται ανά λογαριασμό, όχι ανά κλειδί και όχι ανά διεύθυνση IP. Η αλλαγή του κλειδιού δεν ανοίγει νέο παράθυρο.
- Το 121ο αίτημα μέσα σε ένα παράθυρο απαντάται με κατάσταση
429, τύποrate_limit_errorκαι το μήνυμαToo many requests. Retry in <N>s.ΤοNείναι ο αριθμός δευτερολέπτων μέχρι να τελειώσει το παράθυρο, από 1 έως 60. - Η προστασία από υπερφόρτωση ελέγχεται πριν από το υπόλοιπο. Ένα αίτημα που αρνείται δεν δεσμεύει τίποτα και δεν κοστίζει τίποτα.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Αίτημα | Προστασία από υπερφόρτωση |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | Μετριέται, ένα ανά αίτημα. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | Δεν μετριέται. |
shannon-coder-1 στα /v1/chat/completions και /v1/messages | Μετριέται αντίθετα από το όριο κλήσεων Shannon Coder. |
Ένα αίτημα που απαντάται με 401, ή με 400 για άγνωστο model | Δεν μετριέται. |
| Ένα αίτημα που αρνείται η προστασία από υπερφόρτωση | Μετριέται στο παράθυρο. Δεν χρεώνεται τίποτα. |
Παράλληλα αιτήματα
Δεν υπάρχει όριο στο πόσα αιτήματα έχει ανοιχτά ταυτόχρονα ένας λογαριασμός, ούτε σφάλμα για παράλληλα αιτήματα. Τα αιτήματα που δεν μπορούν να ξεκινήσουν αμέσως περιμένουν σε ουρά και απαντώνται με τη σειρά.
- Κάθε αίτημα προσμετράται στα 120 ανά λεπτό όταν φτάνει, ανεξάρτητα από το αν έχουν τελειώσει τα προηγούμενα αιτήματα.
- Κάθε αίτημα κρατά τη δική του δέσμευση μέχρι να τελειώσει. Είκοσι ανοιχτά αιτήματα με τον προεπιλεγμένο προϋπολογισμό εξόδου κρατούν 20 × 4,096 = 81,920 tokens υπολοίπου. Αν οι δεσμεύσεις μαζί είναι μεγαλύτερες από το υπόλοιπό σας, το επόμενο αίτημα παίρνει την απάντηση
Quota exceeded, ακόμη κι αν οι ολοκληρωμένες κλήσεις θα κόστιζαν λιγότερο. Ένα μικρότεροmax_tokensκρατά λιγότερα. - Ένα αίτημα χωρίς streaming δεν στέλνει τίποτα μέχρι να ολοκληρωθεί η απάντησή του, οπότε δώστε στον client σας timeout που καλύπτει την αναμονή. Ένα stream κρατά τη σύνδεσή του ανοιχτή όσο περιμένει. Ροή
Όρια ενός μεμονωμένου αιτήματος
| Όριο | Τιμή | Ισχύει για | Στο όριο |
|---|---|---|---|
| Σώμα αιτήματος | 32 MiB (33,554,432 bytes) | Κάθε endpoint | Κατάσταση 413, τύπος invalid_request_error. |
Προϋπολογισμός εξόδου: max_tokens, max_completion_tokens, max_output_tokens | 1 έως 65,536. Προεπιλογή 4,096· για το shannon-coder-1 στα /v1/chat/completions και /v1/messages η προεπιλογή είναι 65,536. | Κάθε μοντέλο, ως το ποσό που δεσμεύεται από το υπόλοιπό σας. Ως όριο στο μήκος της απάντησης: τα φιλοξενούμενα μοντέλα ανοιχτών βαρών, τα shannon-1.6-lite, shannon-1.6-pro και shannon-coder-1. | Μια τιμή εκτός του εύρους μετακινείται στο πλησιέστερο άκρο του εύρους. Χωρίς σφάλμα. |
Ακολουθίες διακοπής: stop, stop_sequences | 4 strings | Φιλοξενούμενα μοντέλα ανοιχτών βαρών | Χρησιμοποιούνται τα πρώτα 4 μη κενά strings. |
| Εικόνα ή αρχείο που δίνεται ως URL | 8 MiB, ανάγνωση μέσα σε 20 δευτερόλεπτα, το πολύ 5 ανακατευθύνσεις, δημόσια διεύθυνση http ή https | Κάθε endpoint που δέχεται εικόνες ή αρχεία | Το αίτημα απαντάται χωρίς αυτό το μέρος. Χωρίς σφάλμα. |
| Εικόνα ή αρχείο που στέλνεται inline (base64) | Κανένα δικό του όριο. Προσμετράται στο σώμα αιτήματος των 32 MiB. | Κάθε endpoint που δέχεται εικόνες ή αρχεία | Κατάσταση 413 για ολόκληρο το αίτημα. |
Το text του POST /v1/tokenize | 4,000,000 bytes | /v1/tokenize | Κατάσταση 413, τύπος invalid_request_error, μήνυμα text too long. |
Το messages του POST /v1/tokenize και το σώμα του POST /v1/messages/count_tokens | Το σώμα αιτήματος των 32 MiB | Και τα δύο endpoints μέτρησης | Κατάσταση 413. |
| Παράθυρο συμφραζομένων | Ανά μοντέλο: context_window στο GET /v1/models | Κάθε μοντέλο | Τι συμβαίνει με μια μεγαλύτερη συνομιλία εξαρτάται από το μοντέλο. Μοντέλα & τιμές |
Αναζητήσεις στον ιστό (web_search: true) | Ανά πλάνο και ημέρα: Free 3, Plus 30, Standard 50, Pro 60. Μία αναζήτηση μετριέται για ένα αίτημα του οποίου η αναζήτηση βρήκε αποτελέσματα. | Αιτήματα που ορίζουν web_search: true | Όταν δεν απομένουν, το αίτημα απαντάται χωρίς αναζήτηση. Χωρίς σφάλμα. Ενσωματωμένη αναζήτηση ιστού |
Σφάλματα
Οι απαντήσεις αυτής της σελίδας. Στο /v1/messages το ίδιο αντικείμενο error τυλίγεται ως {"type": "error", "error": {…}}.
| Κατάσταση | Τύπος | Μήνυμα | Πότε, και τι να κάνετε |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | Η δέσμευση του αιτήματος δεν χωράει στο υπόλοιπό σας. Περιμένετε μέχρι τις 00:00 UTC, προσθέστε credit, αλλάξτε πλάνο ή στείλτε μικρότερο max_tokens. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | Περισσότερα από 120 αιτήματα στο τρέχον λεπτό. Περιμένετε N δευτερόλεπτα και στείλτε ξανά. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | Οι κλήσεις Shannon Coder του τρέχοντος παραθύρου 4 ωρών έχουν εξαντληθεί. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | Το μοντέλο δεν μπορεί να δεχτεί το αίτημα αυτή τη στιγμή. Στείλτε το ξανά έπειτα από μια σύντομη παύση. |
503 | api_error | Could not verify your quota right now. Please retry. | Το υπόλοιπό σας δεν μπόρεσε να διαβαστεί. Δεν χρεώνεται τίποτα· στείλτε ξανά το αίτημα. Στο /v1/responses με μοντέλο Shannon η κατάσταση είναι 500. |
413 | invalid_request_error | Το σώμα του αιτήματος είναι μεγαλύτερο από 32 MiB. Στα endpoints μορφής OpenAI το αντικείμενο error φέρει code: "request_too_large". | |
413 | invalid_request_error | text too long | Το text του POST /v1/tokenize είναι μεγαλύτερο από 4,000,000 bytes. |