सीमाएँ और बैलेंस
हर अनुरोध समान रूप से पूरा किया जाता है। कोई रेट टियर नहीं। कोई अलग API कोटा नहीं। आप अपने टोकन के पैसे पहले ही दे चुके हैं, उन्हें जितनी तेज़ी से चाहें इस्तेमाल करें।
यह पेज समझाता है कि आपका बैलेंस किससे बना है, एक अनुरोध क्या रिज़र्व करता है और कितना लागत वाला है, आप कितने अनुरोध भेज सकते हैं, और वे कुछ सीमाएँ जो एक अकेले अनुरोध को मिल सकती हैं।
- बैलेंस के 1M टोकन का मान
- $5.00
- दैनिक अलाउंस नया होता है
- 00:00 UTC
- flood protection, प्रति अकाउंट
- 120 अनुरोध / मिनट
अनुरोध कैसे पूरे किए जाते हैं
- कोई रेट टियर नहीं — एक नियम तय करता है कि अनुरोध कितनी तेज़ी से आ सकते हैं, और वह हर अकाउंट और हर प्लान के लिए समान है: प्रति मिनट 120 अनुरोध। प्रति मिनट टोकन पर कोई सीमा नहीं है।
- कोई अलग API कोटा नहीं — API वही बैलेंस खर्च करती है जो चैट करती है। प्लान आज के अलाउंस का आकार तय करता है। वह अनुरोध दर तय नहीं करता।
- जितनी तेज़ चाहें — समानांतर भेजे गए अनुरोध स्वीकार होते हैं और कतार में इंतज़ार करते हैं। उन्हें समानांतर होने के कारण मना नहीं किया जाता।
आपका बैलेंस
आपका बैलेंस टोकन में गिना जाता है। बैलेंस के 1,000,000 टोकन की कीमत $5.00 है, और Models & pricing पेज की हर कीमत इसी मान के मुकाबले एक दर है।
किसी भी क्षण बैलेंस दो हिस्सों का योग होता है।
- आज का प्लान अलाउंस — टोकन की एक संख्या जो आपका प्लान तय करता है। यह हर दिन 00:00 UTC पर नई हो जाती है। दिन के अंत में जो बचता है वह आगे नहीं जाता।
- खरीदा गया क्रेडिट — वे टोकन जो आपने पैक के रूप में खरीदे। क्रेडिट की समय-सीमा खत्म नहीं होती और यह हर प्लान पर चलता है, Free पर भी।
| प्लान | प्रति दिन टोकन | मान |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- खर्च का क्रम — हर अनुरोध पहले आज का प्लान अलाउंस खर्च करता है। खरीदा गया क्रेडिट केवल उसी के लिए इस्तेमाल होता है जो उस दिन अलाउंस से ज़्यादा हो।
- चैट और API इसे साझा करते हैं — हर अकाउंट का एक ही बैलेंस होता है। API key उस अकाउंट के बैलेंस से खर्च करती है जिसकी वह है, चैट वाली ही कीमतों पर।
- पैक — क्रेडिट 1,000,000 ($5.00), 2,000,000 ($10.00) और 5,000,000 ($25.00) टोकन के पैक में बिकता है, या 1,000,000 से 100,000,000 टोकन के बीच आपकी चुनी हुई मात्रा में, $5.00 प्रति 1,000,000 की दर से।
क्रेडिट टॉप-अप करें प्लान बदलें
अनुरोध क्या रिज़र्व करता है और उसकी लागत क्या है
- रिज़र्व — अनुरोध आने पर वह आपके बैलेंस से अपना आउटपुट बजट रिज़र्व करता है:
/v1/chat/completionsऔर/v1/messagesपरmax_tokens,/v1/responsesपरmax_output_tokens।/v1/chat/completionsmax_completion_tokensभी पढ़ता है। डिफ़ॉल्ट 4,096 है और सीमा 1 से 65,536 है। - स्वीकार — अनुरोध तभी स्वीकार होता है जब रिज़र्वेशन आपके बैलेंस के बचे हिस्से में समा जाए। जो बैलेंस शून्य से ऊपर है पर आउटपुट बजट से छोटा है, उसे
Quota exceededउत्तर मिलता है। बाकी बैलेंस इस्तेमाल करने के लिए छोटाmax_tokensभेजें। - निपटान — उत्तर पूरा होने पर रिज़र्वेशन की जगह असली शुल्क ले लेता है। शुल्क रिज़र्वेशन से कम या ज़्यादा हो सकता है।
- वापसी — जो अनुरोध एरर स्टेटस के साथ खत्म होता है, वह अपना रिज़र्वेशन पूरा वापस दे देता है।
असली शुल्क मॉडल परिवार पर निर्भर करता है।
| मॉडल | क्या चार्ज होता है |
|---|---|
| Shannon मॉडल | मॉडल की प्रति 1M कीमत पर usage.total_tokens। इनपुट और आउटपुट की एक ही दर है। |
| होस्टेड ओपन-वेट मॉडल | अनकैश्ड इनपुट इनपुट दर पर, कैश किया गया इनपुट कैश्ड दर पर, आउटपुट आउटपुट दर पर। |
USD की राशि आपके बैलेंस से टोकन में $5.00 प्रति 1,000,000 की दर से ली जाती है, और पूरे टोकन में पूर्णांकित की जाती है।
POST /v1/tokenize या POST /v1/messages/count_tokens से टोकन गिनना मुफ़्त है और कुछ रिज़र्व नहीं करता। टोकन गिनती
बैलेंस और उपयोग कहाँ देखें
Keys & usage पेज दिखाता है कि आप अभी क्या खर्च कर सकते हैं, आज का प्लान अलाउंस, आपका खरीदा गया क्रेडिट और पिछले 30 दिनों का API खर्च। उसके नीचे आपकी key के हर अनुरोध की सूची है: समय, endpoint, मॉडल, कैश किया गया इनपुट, बिल किए गए टोकन और लागत। Keys और उपयोग
हर उत्तर में एक usage ऑब्जेक्ट भी होता है, जिसमें उस कॉल की टोकन गिनती होती है।
| एंडपॉइंट | usage के फ़ील्ड | होस्टेड ओपन-वेट मॉडल द्वारा जोड़े गए |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageमें मॉडल की टोकन गिनती होती है। आपके बैलेंस से ली गई राशि उत्तर में नहीं होती: वह Keys & usage की अनुरोध सूची का Billed tokens कॉलम है।- होस्टेड ओपन-वेट मॉडल के साथ
/v1/messagesपर,input_tokensइनपुट का अनकैश्ड हिस्सा है,cache_read_input_tokensकैश किया गया हिस्सा है औरcache_creation_input_tokensहमेशा0होता है। -
/v1/chat/completionsकी स्ट्रीम[DONE]से पहले अपने अंतिम चंक मेंusageदेती है। स्ट्रीमिंग
जब बैलेंस खत्म हो जाए
जिस अनुरोध का रिज़र्वेशन आपके बैलेंस में नहीं समाता, उसका उत्तर स्टेटस 429, प्रकार rate_limit_error और नीचे दिए संदेश के साथ आता है। कुछ चार्ज नहीं होता। यही उत्तर तब भी भेजा जाता है जब बैलेंस शून्य से ऊपर है पर अनुरोध के आउटपुट बजट से छोटा है।
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} /v1/responses पर error ऑब्जेक्ट में code और param भी हो सकते हैं, दोनों null।
आप यह कर सकते हैं:
- 00:00 UTC पर अगले प्लान अलाउंस का इंतज़ार करें।
- क्रेडिट टॉप-अप करें। क्रेडिट प्लान अलाउंस के बाद खर्च होता है और उसकी समय-सीमा खत्म नहीं होती। क्रेडिट टॉप-अप करें
- बड़े दैनिक अलाउंस वाले प्लान पर जाएँ। प्लान बदलें
- अगर कुछ बैलेंस बचा है, तो छोटा
max_tokensभेजें: तब रिज़र्वेशन छोटा होगा।
Shannon Coder कॉल अलाउंस
/v1/chat/completions और /v1/messages पर shannon-coder-1 कॉल में गिना जाता है, टोकन में नहीं। हर प्लान में हर 4 घंटे की विंडो के लिए कुछ कॉल शामिल हैं। एक अनुरोध एक कॉल है।
| प्लान | प्रति 4 घंटे की विंडो में कॉल |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- विंडो 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC पर शुरू होती हैं। विंडो के अंत में बची कॉल आगे नहीं जातीं।
- कॉल तब गिनी जाती है जब अनुरोध स्वीकार होता है, मॉडल के उत्तर देने से पहले। जो अनुरोध बाद में विफल होता है वह भी एक कॉल गिना जाता है।
- ये कॉल कोई टोकन रिज़र्व नहीं करतीं और आपके बैलेंस से कुछ नहीं लेतीं। Keys & usage की अनुरोध सूची इनकी टोकन संख्या और सूचीबद्ध कीमत पर उसका मान दिखाती है।
- इन दोनों endpoints पर
shannon-coder-1का डिफ़ॉल्टmax_tokens65,536 है। - कॉल खत्म होने पर उत्तर स्टेटस
429, प्रकारrate_limit_errorऔर संदेशShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/planहोता है। /v1/responsesपरshannon-coder-1का कोई कॉल अलाउंस नहीं है: इसका शुल्क आपके बैलेंस से टोकन में $8.00 प्रति 1M पर लगता है, हर दूसरे मॉडल की तरह।
Flood protection
एक अकाउंट प्रति मिनट 120 अनुरोध भेज सकता है। अनुरोध दर पर यही एकमात्र सीमा है, और यह हर प्लान पर समान है। यह बाढ़ रोकने के लिए है, सामान्य उपयोग धीमा करने के लिए नहीं।
- मिनट 60 सेकंड की एक तय विंडो है जो आपके पहले अनुरोध से खुलती है। खत्म होने पर गिनती फिर शून्य से शुरू होती है।
- गिनती प्रति अकाउंट होती है, प्रति key या प्रति IP पते नहीं। key बदलने से नई विंडो नहीं खुलती।
- विंडो के भीतर 121वें अनुरोध का उत्तर स्टेटस
429, प्रकारrate_limit_errorऔर संदेशToo many requests. Retry in <N>s.के साथ आता है।Nविंडो खत्म होने तक के सेकंड हैं, 1 से 60 तक। - Flood protection बैलेंस से पहले जाँचा जाता है। जिस अनुरोध को वह मना करता है, वह कुछ रिज़र्व नहीं करता और उसकी कोई लागत नहीं होती।
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | अनुरोध | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | गिना जाता है, प्रति अनुरोध एक। |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | नहीं गिना जाता। |
/v1/chat/completions और /v1/messages पर shannon-coder-1 | इसके बजाय Shannon Coder कॉल अलाउंस से गिना जाता है। |
जिस अनुरोध का उत्तर 401 से दिया गया, या अज्ञात model के लिए 400 से | नहीं गिना जाता। |
| Flood protection द्वारा मना किया गया अनुरोध | विंडो में गिना जाता है। कुछ चार्ज नहीं होता। |
समानांतर अनुरोध
एक अकाउंट के एक साथ कितने अनुरोध खुले हो सकते हैं, इस पर कोई सीमा नहीं है, और समानांतर अनुरोध भेजने पर कोई एरर नहीं है। जो अनुरोध तुरंत शुरू नहीं हो सकते वे कतार में इंतज़ार करते हैं और बारी-बारी से जवाब पाते हैं।
- हर अनुरोध आते ही प्रति मिनट 120 में गिना जाता है, चाहे पिछले अनुरोध पूरे हुए हों या नहीं।
- हर अनुरोध अपने खत्म होने तक अपना रिज़र्वेशन रोके रखता है। डिफ़ॉल्ट आउटपुट बजट वाले बीस खुले अनुरोध 20 × 4,096 = 81,920 टोकन का बैलेंस रोकते हैं। अगर रिज़र्वेशन मिलाकर आपके बैलेंस से बड़े हैं, तो अगले अनुरोध को
Quota exceededउत्तर मिलता है, भले ही पूरी हो चुकी कॉल की लागत कम होती। छोटाmax_tokensकम रोकता है। - स्ट्रीमिंग के बिना अनुरोध उत्तर पूरा होने तक कुछ नहीं भेजता, इसलिए अपने क्लाइंट को ऐसा टाइमआउट दें जो इस प्रतीक्षा को कवर करे। स्ट्रीम प्रतीक्षा के दौरान अपना कनेक्शन खुला रखती है। स्ट्रीमिंग
एक अनुरोध की सीमाएँ
| सीमा | मान | कहाँ लागू | सीमा पर |
|---|---|---|---|
| अनुरोध की बॉडी | 32 MiB (33,554,432 बाइट) | हर endpoint | स्टेटस 413, प्रकार invalid_request_error। |
आउटपुट बजट: max_tokens, max_completion_tokens, max_output_tokens | 1 से 65,536। डिफ़ॉल्ट 4,096; /v1/chat/completions और /v1/messages पर shannon-coder-1 का डिफ़ॉल्ट 65,536 है। | हर मॉडल, आपके बैलेंस से रिज़र्व की गई मात्रा के रूप में। उत्तर की लंबाई की सीमा के रूप में: होस्टेड ओपन-वेट मॉडल, shannon-1.6-lite, shannon-1.6-pro और shannon-coder-1। | सीमा से बाहर के मान को सीमा के सबसे पास वाले सिरे पर ले जाया जाता है। कोई एरर नहीं। |
स्टॉप सीक्वेंस: stop, stop_sequences | 4 स्ट्रिंग | होस्टेड ओपन-वेट मॉडल | पहली 4 गैर-खाली स्ट्रिंग इस्तेमाल होती हैं। |
| URL के रूप में दी गई इमेज या फ़ाइल | 8 MiB, 20 सेकंड के भीतर पढ़ी गई, अधिकतम 5 रीडायरेक्ट, एक सार्वजनिक http या https पता | इमेज या फ़ाइलें लेने वाला हर endpoint | अनुरोध का उत्तर उस हिस्से के बिना दिया जाता है। कोई एरर नहीं। |
| इनलाइन भेजी गई इमेज या फ़ाइल (base64) | अपनी कोई सीमा नहीं। यह 32 MiB अनुरोध बॉडी में गिनी जाती है। | इमेज या फ़ाइलें लेने वाला हर endpoint | पूरे अनुरोध के लिए स्टेटस 413। |
POST /v1/tokenize का text | 4,000,000 बाइट | /v1/tokenize | स्टेटस 413, प्रकार invalid_request_error, संदेश text too long। |
POST /v1/tokenize के messages और POST /v1/messages/count_tokens की बॉडी | 32 MiB अनुरोध बॉडी | दोनों गिनती वाले endpoints | स्टेटस 413। |
| कॉन्टेक्स्ट विंडो | हर मॉडल के लिए: GET /v1/models में context_window | हर मॉडल | लंबी बातचीत का क्या होता है, यह मॉडल पर निर्भर करता है। मॉडल और कीमतें |
वेब खोजें (web_search: true) | प्रति प्लान और दिन: Free 3, Plus 30, Standard 50, Pro 60। जिस अनुरोध की खोज में परिणाम मिले, उसके लिए एक खोज गिनी जाती है। | web_search: true सेट करने वाले अनुरोध | कोई न बचने पर अनुरोध का उत्तर खोज के बिना दिया जाता है। कोई एरर नहीं। इनबिल्ट Web Search |
एरर
इस पेज के उत्तर। /v1/messages पर यही error ऑब्जेक्ट {"type": "error", "error": {…}} के रूप में लिपटा होता है।
| स्टेटस | प्रकार | संदेश | कब, और क्या करें |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | अनुरोध का रिज़र्वेशन आपके बैलेंस में नहीं समाता। 00:00 UTC का इंतज़ार करें, क्रेडिट टॉप-अप करें, प्लान बदलें, या छोटा max_tokens भेजें। |
429 | rate_limit_error | Too many requests. Retry in <N>s. | मौजूदा मिनट में 120 से अधिक अनुरोध। N सेकंड रुकें और फिर भेजें। |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | मौजूदा 4 घंटे की विंडो की Shannon Coder कॉल खत्म हो गई हैं। |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | मॉडल इस क्षण अनुरोध नहीं ले सकता। थोड़े विराम के बाद उसे फिर भेजें। |
503 | api_error | Could not verify your quota right now. Please retry. | आपका बैलेंस पढ़ा नहीं जा सका। कुछ चार्ज नहीं हुआ; अनुरोध फिर भेजें। Shannon मॉडल के साथ /v1/responses पर स्टेटस 500 होता है। |
413 | invalid_request_error | अनुरोध की बॉडी 32 MiB से बड़ी है। OpenAI-फ़ॉर्मेट endpoints पर error ऑब्जेक्ट में code: "request_too_large" होता है। | |
413 | invalid_request_error | text too long | POST /v1/tokenize का text 4,000,000 बाइट से लंबा है। |