Μετάβαση στο περιεχόμενο
Όρια και υπόλοιπο

Όρια και υπόλοιπο

Κάθε αίτημα εξυπηρετείται ισότιμα. Χωρίς επίπεδα ρυθμού. Χωρίς ξεχωριστή ποσόστωση API. Έχετε ήδη πληρώσει για τα tokens σας — χρησιμοποιήστε τα όσο γρήγορα θέλετε.

Αυτή η σελίδα εξηγεί από τι αποτελείται το υπόλοιπό σας, τι δεσμεύει και τι κοστίζει ένα αίτημα, πόσα αιτήματα μπορείτε να στείλετε και τα λίγα όρια που μπορεί να συναντήσει ένα μεμονωμένο αίτημα.

αξία 1M tokens υπολοίπου
$5.00
το ημερήσιο όριο ανανεώνεται
00:00 UTC
προστασία από υπερφόρτωση, ανά λογαριασμό
120 αιτήματα / λεπτό

Πώς εξυπηρετούνται τα αιτήματα

  • Χωρίς επίπεδα ρυθμού — Ένας κανόνας περιορίζει πόσο γρήγορα μπορούν να φτάνουν τα αιτήματα και είναι ίδιος για κάθε λογαριασμό και κάθε πλάνο: 120 αιτήματα ανά λεπτό. Δεν υπάρχει όριο tokens ανά λεπτό.
  • Χωρίς ξεχωριστή ποσόστωση API — Το API ξοδεύει το ίδιο υπόλοιπο με το chat. Ένα πλάνο ορίζει το μέγεθος του σημερινού ορίου. Δεν ορίζει ρυθμό αιτημάτων.
  • Όσο γρήγορα θέλετε — Τα αιτήματα που στέλνονται παράλληλα γίνονται δεκτά και περιμένουν σε ουρά. Δεν απορρίπτονται επειδή είναι παράλληλα.

Το υπόλοιπό σας

Το υπόλοιπό σας μετριέται σε tokens. 1,000,000 tokens υπολοίπου αξίζουν $5.00, και κάθε τιμή στη σελίδα Μοντέλα & τιμές είναι ποσοστό αυτής της αξίας.

Σε κάθε στιγμή, το υπόλοιπο είναι το άθροισμα δύο μερών.

  • Ημερήσιο όριο του πλάνου — Ένας αριθμός tokens που ορίζει το πλάνο σας. Ανανεώνεται κάθε μέρα στις 00:00 UTC. Ό,τι απομένει στο τέλος της ημέρας δεν μεταφέρεται.
  • Αγορασμένο credit — Tokens που αγοράσατε ως πακέτο. Το credit δεν λήγει και λειτουργεί σε κάθε πλάνο, και στο Free.
Πλάνο Tokens ανά ημέρα Αξία
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • Σειρά κατανάλωσης — Κάθε αίτημα καταναλώνει πρώτα το σημερινό ημερήσιο όριο του πλάνου. Το αγορασμένο credit χρησιμοποιείται μόνο για ό,τι ξεπερνά το όριο εκείνης της ημέρας.
  • Το chat και το API το μοιράζονται — Υπάρχει ένα υπόλοιπο ανά λογαριασμό. Ένα κλειδί API ξοδεύει από το υπόλοιπο του λογαριασμού στον οποίο ανήκει, με τις ίδιες τιμές όπως το chat.
  • Πακέτα — Το credit πωλείται σε πακέτα των 1,000,000 ($5.00), 2,000,000 ($10.00) και 5,000,000 ($25.00) tokens, ή ως ποσό της επιλογής σας από 1,000,000 έως 100,000,000 tokens προς $5.00 ανά 1,000,000.

Προσθήκη πιστωτικού Αλλαγή σχεδίου

Τι δεσμεύει ένα αίτημα και τι κοστίζει

  • Δέσμευση — Όταν φτάνει ένα αίτημα, δεσμεύει από το υπόλοιπό σας τον προϋπολογισμό εξόδου του: max_tokens στα /v1/chat/completions και /v1/messages, max_output_tokens στο /v1/responses. Το /v1/chat/completions διαβάζει επίσης το max_completion_tokens. Η προεπιλογή είναι 4,096 και το εύρος 1 έως 65,536.
  • Αποδοχή — Το αίτημα γίνεται δεκτό μόνο αν η δέσμευση χωράει σε ό,τι απομένει από το υπόλοιπό σας. Ένα υπόλοιπο πάνω από το μηδέν αλλά μικρότερο από τον προϋπολογισμό εξόδου παίρνει την απάντηση Quota exceeded. Στείλτε μικρότερο max_tokens για να χρησιμοποιήσετε το υπόλοιπο.
  • Εκκαθάριση — Όταν η απάντηση ολοκληρωθεί, η δέσμευση αντικαθίσταται από την πραγματική χρέωση. Η χρέωση μπορεί να είναι χαμηλότερη ή υψηλότερη από τη δέσμευση.
  • Επιστροφή — Ένα αίτημα που τελειώνει με κατάσταση σφάλματος επιστρέφει ολόκληρη τη δέσμευσή του.

Η πραγματική χρέωση εξαρτάται από την οικογένεια του μοντέλου.

Μοντέλα Τι χρεώνεται
Μοντέλα Shannon Το usage.total_tokens στην τιμή του μοντέλου ανά 1M. Η είσοδος και η έξοδος έχουν μία τιμή.
Φιλοξενούμενα μοντέλα ανοιχτών βαρών Η μη cached είσοδος με την τιμή εισόδου, η cached είσοδος με την τιμή cached, η έξοδος με την τιμή εξόδου.

Το ποσό σε USD αφαιρείται από το υπόλοιπό σας σε tokens προς $5.00 ανά 1,000,000, στρογγυλεμένο σε ακέραιο token.

Η μέτρηση tokens με POST /v1/tokenize ή POST /v1/messages/count_tokens είναι δωρεάν και δεν δεσμεύει τίποτα. Καταμέτρηση tokens

Πού να δείτε υπόλοιπο και χρήση

Η σελίδα Κλειδιά & χρήση δείχνει όσα μπορείτε να ξοδέψετε αυτή τη στιγμή, το σημερινό ημερήσιο όριο του πλάνου, το αγορασμένο credit και τη δαπάνη API των τελευταίων 30 ημερών. Από κάτω απαριθμεί κάθε αίτημα που έκανε το κλειδί σας: ώρα, endpoint, μοντέλο, cached είσοδο, χρεωμένα tokens και κόστος. Κλειδιά & χρήση

Κάθε απάντηση φέρει επίσης ένα αντικείμενο usage με τους αριθμούς tokens εκείνης της κλήσης.

Endpoint Πεδία του usage Προστίθενται από τα φιλοξενούμενα μοντέλα ανοιχτών βαρών
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • Το usage περιέχει τους αριθμούς tokens του μοντέλου. Το ποσό που αφαιρείται από το υπόλοιπό σας δεν υπάρχει στην απάντηση: βρίσκεται στη στήλη Χρεωμένα tokens της λίστας αιτημάτων στο Κλειδιά & χρήση.
  • Στο /v1/messages με φιλοξενούμενο μοντέλο ανοιχτών βαρών, το input_tokens είναι το μη cached μέρος της εισόδου, το cache_read_input_tokens είναι το cached μέρος και το cache_creation_input_tokens είναι πάντα 0.
  • Ένα stream στο /v1/chat/completions φέρει το usage στο τελευταίο του chunk πριν από το [DONE]. Ροή

Όταν εξαντληθεί το υπόλοιπο

Ένα αίτημα του οποίου η δέσμευση δεν χωράει στο υπόλοιπό σας απαντάται με κατάσταση 429, τύπο rate_limit_error και το μήνυμα παρακάτω. Δεν χρεώνεται τίποτα. Η ίδια απάντηση στέλνεται όταν το υπόλοιπο είναι πάνω από το μηδέν αλλά μικρότερο από τον προϋπολογισμό εξόδου του αιτήματος.

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

Στο /v1/responses το αντικείμενο error μπορεί να περιέχει και τα code και param, και τα δύο null.

Τι μπορείτε να κάνετε:

  • Περιμένετε το επόμενο ημερήσιο όριο του πλάνου στις 00:00 UTC.
  • Προσθέστε credit. Το credit καταναλώνεται μετά το ημερήσιο όριο του πλάνου και δεν λήγει. Προσθήκη πιστωτικού
  • Αλλάξτε σε πλάνο με μεγαλύτερο ημερήσιο όριο. Αλλαγή σχεδίου
  • Στείλτε μικρότερο max_tokens, αν απομένει κάποιο υπόλοιπο: τότε η δέσμευση είναι μικρότερη.

Όριο κλήσεων Shannon Coder

Το shannon-coder-1 στα /v1/chat/completions και /v1/messages μετριέται σε κλήσεις, όχι σε tokens. Κάθε πλάνο περιλαμβάνει έναν αριθμό κλήσεων ανά παράθυρο 4 ωρών. Ένα αίτημα είναι μία κλήση.

Πλάνο Κλήσεις ανά παράθυρο 4 ωρών
Free 3
Plus 20
Standard 40
Pro 60
  • Τα παράθυρα ξεκινούν στις 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. Οι κλήσεις που απομένουν στο τέλος ενός παραθύρου δεν μεταφέρονται.
  • Μια κλήση μετριέται όταν γίνεται δεκτό το αίτημα, πριν απαντήσει το μοντέλο. Ένα αίτημα που αποτυγχάνει στη συνέχεια μετριέται παρ' όλα αυτά ως κλήση.
  • Αυτές οι κλήσεις δεν δεσμεύουν tokens και δεν αφαιρούν τίποτα από το υπόλοιπό σας. Η λίστα αιτημάτων στο Κλειδιά & χρήση δείχνει τον αριθμό tokens τους και την αξία τους στην αναγραφόμενη τιμή.
  • Το προεπιλεγμένο max_tokens του shannon-coder-1 σε αυτά τα δύο endpoints είναι 65,536.
  • Όταν δεν απομένουν κλήσεις, η απάντηση έχει κατάσταση 429, τύπο rate_limit_error και μήνυμα Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan.
  • Στο /v1/responses, το shannon-coder-1 δεν έχει όριο κλήσεων: χρεώνεται σε tokens από το υπόλοιπό σας προς $8.00 ανά 1M, όπως κάθε άλλο μοντέλο.

Προστασία από υπερφόρτωση

Ένας λογαριασμός μπορεί να στείλει 120 αιτήματα ανά λεπτό. Αυτό είναι το μόνο όριο στον ρυθμό αιτημάτων και είναι ίδιο σε κάθε πλάνο. Υπάρχει για να σταματά τις πλημμύρες αιτημάτων, όχι για να επιβραδύνει την κανονική χρήση.

  • Το λεπτό είναι ένα σταθερό παράθυρο 60 δευτερολέπτων που ανοίγει με το πρώτο σας αίτημα. Όταν τελειώσει, η μέτρηση ξεκινά ξανά από το μηδέν.
  • Η μέτρηση γίνεται ανά λογαριασμό, όχι ανά κλειδί και όχι ανά διεύθυνση IP. Η αλλαγή του κλειδιού δεν ανοίγει νέο παράθυρο.
  • Το 121ο αίτημα μέσα σε ένα παράθυρο απαντάται με κατάσταση 429, τύπο rate_limit_error και το μήνυμα Too many requests. Retry in <N>s. Το N είναι ο αριθμός δευτερολέπτων μέχρι να τελειώσει το παράθυρο, από 1 έως 60.
  • Η προστασία από υπερφόρτωση ελέγχεται πριν από το υπόλοιπο. Ένα αίτημα που αρνείται δεν δεσμεύει τίποτα και δεν κοστίζει τίποτα.
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
Αίτημα Προστασία από υπερφόρτωση
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses Μετριέται, ένα ανά αίτημα.
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens Δεν μετριέται.
shannon-coder-1 στα /v1/chat/completions και /v1/messages Μετριέται αντίθετα από το όριο κλήσεων Shannon Coder.
Ένα αίτημα που απαντάται με 401, ή με 400 για άγνωστο model Δεν μετριέται.
Ένα αίτημα που αρνείται η προστασία από υπερφόρτωση Μετριέται στο παράθυρο. Δεν χρεώνεται τίποτα.

Παράλληλα αιτήματα

Δεν υπάρχει όριο στο πόσα αιτήματα έχει ανοιχτά ταυτόχρονα ένας λογαριασμός, ούτε σφάλμα για παράλληλα αιτήματα. Τα αιτήματα που δεν μπορούν να ξεκινήσουν αμέσως περιμένουν σε ουρά και απαντώνται με τη σειρά.

  • Κάθε αίτημα προσμετράται στα 120 ανά λεπτό όταν φτάνει, ανεξάρτητα από το αν έχουν τελειώσει τα προηγούμενα αιτήματα.
  • Κάθε αίτημα κρατά τη δική του δέσμευση μέχρι να τελειώσει. Είκοσι ανοιχτά αιτήματα με τον προεπιλεγμένο προϋπολογισμό εξόδου κρατούν 20 × 4,096 = 81,920 tokens υπολοίπου. Αν οι δεσμεύσεις μαζί είναι μεγαλύτερες από το υπόλοιπό σας, το επόμενο αίτημα παίρνει την απάντηση Quota exceeded, ακόμη κι αν οι ολοκληρωμένες κλήσεις θα κόστιζαν λιγότερο. Ένα μικρότερο max_tokens κρατά λιγότερα.
  • Ένα αίτημα χωρίς streaming δεν στέλνει τίποτα μέχρι να ολοκληρωθεί η απάντησή του, οπότε δώστε στον client σας timeout που καλύπτει την αναμονή. Ένα stream κρατά τη σύνδεσή του ανοιχτή όσο περιμένει. Ροή

Όρια ενός μεμονωμένου αιτήματος

Όριο Τιμή Ισχύει για Στο όριο
Σώμα αιτήματος 32 MiB (33,554,432 bytes) Κάθε endpoint Κατάσταση 413, τύπος invalid_request_error.
Προϋπολογισμός εξόδου: max_tokens, max_completion_tokens, max_output_tokens 1 έως 65,536. Προεπιλογή 4,096· για το shannon-coder-1 στα /v1/chat/completions και /v1/messages η προεπιλογή είναι 65,536. Κάθε μοντέλο, ως το ποσό που δεσμεύεται από το υπόλοιπό σας. Ως όριο στο μήκος της απάντησης: τα φιλοξενούμενα μοντέλα ανοιχτών βαρών, τα shannon-1.6-lite, shannon-1.6-pro και shannon-coder-1. Μια τιμή εκτός του εύρους μετακινείται στο πλησιέστερο άκρο του εύρους. Χωρίς σφάλμα.
Ακολουθίες διακοπής: stop, stop_sequences 4 strings Φιλοξενούμενα μοντέλα ανοιχτών βαρών Χρησιμοποιούνται τα πρώτα 4 μη κενά strings.
Εικόνα ή αρχείο που δίνεται ως URL 8 MiB, ανάγνωση μέσα σε 20 δευτερόλεπτα, το πολύ 5 ανακατευθύνσεις, δημόσια διεύθυνση http ή https Κάθε endpoint που δέχεται εικόνες ή αρχεία Το αίτημα απαντάται χωρίς αυτό το μέρος. Χωρίς σφάλμα.
Εικόνα ή αρχείο που στέλνεται inline (base64) Κανένα δικό του όριο. Προσμετράται στο σώμα αιτήματος των 32 MiB. Κάθε endpoint που δέχεται εικόνες ή αρχεία Κατάσταση 413 για ολόκληρο το αίτημα.
Το text του POST /v1/tokenize 4,000,000 bytes /v1/tokenize Κατάσταση 413, τύπος invalid_request_error, μήνυμα text too long.
Το messages του POST /v1/tokenize και το σώμα του POST /v1/messages/count_tokens Το σώμα αιτήματος των 32 MiB Και τα δύο endpoints μέτρησης Κατάσταση 413.
Παράθυρο συμφραζομένων Ανά μοντέλο: context_window στο GET /v1/models Κάθε μοντέλο Τι συμβαίνει με μια μεγαλύτερη συνομιλία εξαρτάται από το μοντέλο. Μοντέλα & τιμές
Αναζητήσεις στον ιστό (web_search: true) Ανά πλάνο και ημέρα: Free 3, Plus 30, Standard 50, Pro 60. Μία αναζήτηση μετριέται για ένα αίτημα του οποίου η αναζήτηση βρήκε αποτελέσματα. Αιτήματα που ορίζουν web_search: true Όταν δεν απομένουν, το αίτημα απαντάται χωρίς αναζήτηση. Χωρίς σφάλμα. Ενσωματωμένη αναζήτηση ιστού

Σφάλματα

Οι απαντήσεις αυτής της σελίδας. Στο /v1/messages το ίδιο αντικείμενο error τυλίγεται ως {"type": "error", "error": {…}}.

Κατάσταση Τύπος Μήνυμα Πότε, και τι να κάνετε
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan Η δέσμευση του αιτήματος δεν χωράει στο υπόλοιπό σας. Περιμένετε μέχρι τις 00:00 UTC, προσθέστε credit, αλλάξτε πλάνο ή στείλτε μικρότερο max_tokens.
429 rate_limit_error Too many requests. Retry in <N>s. Περισσότερα από 120 αιτήματα στο τρέχον λεπτό. Περιμένετε N δευτερόλεπτα και στείλτε ξανά.
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan Οι κλήσεις Shannon Coder του τρέχοντος παραθύρου 4 ωρών έχουν εξαντληθεί.
429 rate_limit_error Shannon routes are temporarily busy. Please retry. Το μοντέλο δεν μπορεί να δεχτεί το αίτημα αυτή τη στιγμή. Στείλτε το ξανά έπειτα από μια σύντομη παύση.
503 api_error Could not verify your quota right now. Please retry. Το υπόλοιπό σας δεν μπόρεσε να διαβαστεί. Δεν χρεώνεται τίποτα· στείλτε ξανά το αίτημα. Στο /v1/responses με μοντέλο Shannon η κατάσταση είναι 500.
413 invalid_request_error Το σώμα του αιτήματος είναι μεγαλύτερο από 32 MiB. Στα endpoints μορφής OpenAI το αντικείμενο error φέρει code: "request_too_large".
413 invalid_request_error text too long Το text του POST /v1/tokenize είναι μεγαλύτερο από 4,000,000 bytes.