कंटेंट पर जाएँ
सीमाएँ और बैलेंस

सीमाएँ और बैलेंस

हर अनुरोध समान रूप से पूरा किया जाता है। कोई रेट टियर नहीं। कोई अलग API कोटा नहीं। आप अपने टोकन के पैसे पहले ही दे चुके हैं, उन्हें जितनी तेज़ी से चाहें इस्तेमाल करें।

यह पेज समझाता है कि आपका बैलेंस किससे बना है, एक अनुरोध क्या रिज़र्व करता है और कितना लागत वाला है, आप कितने अनुरोध भेज सकते हैं, और वे कुछ सीमाएँ जो एक अकेले अनुरोध को मिल सकती हैं।

बैलेंस के 1M टोकन का मान
$5.00
दैनिक अलाउंस नया होता है
00:00 UTC
flood protection, प्रति अकाउंट
120 अनुरोध / मिनट

अनुरोध कैसे पूरे किए जाते हैं

  • कोई रेट टियर नहीं — एक नियम तय करता है कि अनुरोध कितनी तेज़ी से आ सकते हैं, और वह हर अकाउंट और हर प्लान के लिए समान है: प्रति मिनट 120 अनुरोध। प्रति मिनट टोकन पर कोई सीमा नहीं है।
  • कोई अलग API कोटा नहीं — API वही बैलेंस खर्च करती है जो चैट करती है। प्लान आज के अलाउंस का आकार तय करता है। वह अनुरोध दर तय नहीं करता।
  • जितनी तेज़ चाहें — समानांतर भेजे गए अनुरोध स्वीकार होते हैं और कतार में इंतज़ार करते हैं। उन्हें समानांतर होने के कारण मना नहीं किया जाता।

आपका बैलेंस

आपका बैलेंस टोकन में गिना जाता है। बैलेंस के 1,000,000 टोकन की कीमत $5.00 है, और Models & pricing पेज की हर कीमत इसी मान के मुकाबले एक दर है।

किसी भी क्षण बैलेंस दो हिस्सों का योग होता है।

  • आज का प्लान अलाउंस — टोकन की एक संख्या जो आपका प्लान तय करता है। यह हर दिन 00:00 UTC पर नई हो जाती है। दिन के अंत में जो बचता है वह आगे नहीं जाता।
  • खरीदा गया क्रेडिट — वे टोकन जो आपने पैक के रूप में खरीदे। क्रेडिट की समय-सीमा खत्म नहीं होती और यह हर प्लान पर चलता है, Free पर भी।
प्लान प्रति दिन टोकन मान
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • खर्च का क्रम — हर अनुरोध पहले आज का प्लान अलाउंस खर्च करता है। खरीदा गया क्रेडिट केवल उसी के लिए इस्तेमाल होता है जो उस दिन अलाउंस से ज़्यादा हो।
  • चैट और API इसे साझा करते हैं — हर अकाउंट का एक ही बैलेंस होता है। API key उस अकाउंट के बैलेंस से खर्च करती है जिसकी वह है, चैट वाली ही कीमतों पर।
  • पैक — क्रेडिट 1,000,000 ($5.00), 2,000,000 ($10.00) और 5,000,000 ($25.00) टोकन के पैक में बिकता है, या 1,000,000 से 100,000,000 टोकन के बीच आपकी चुनी हुई मात्रा में, $5.00 प्रति 1,000,000 की दर से।

क्रेडिट टॉप-अप करें प्लान बदलें

अनुरोध क्या रिज़र्व करता है और उसकी लागत क्या है

  • रिज़र्व — अनुरोध आने पर वह आपके बैलेंस से अपना आउटपुट बजट रिज़र्व करता है: /v1/chat/completions और /v1/messages पर max_tokens, /v1/responses पर max_output_tokens। /v1/chat/completions max_completion_tokens भी पढ़ता है। डिफ़ॉल्ट 4,096 है और सीमा 1 से 65,536 है।
  • स्वीकार — अनुरोध तभी स्वीकार होता है जब रिज़र्वेशन आपके बैलेंस के बचे हिस्से में समा जाए। जो बैलेंस शून्य से ऊपर है पर आउटपुट बजट से छोटा है, उसे Quota exceeded उत्तर मिलता है। बाकी बैलेंस इस्तेमाल करने के लिए छोटा max_tokens भेजें।
  • निपटान — उत्तर पूरा होने पर रिज़र्वेशन की जगह असली शुल्क ले लेता है। शुल्क रिज़र्वेशन से कम या ज़्यादा हो सकता है।
  • वापसी — जो अनुरोध एरर स्टेटस के साथ खत्म होता है, वह अपना रिज़र्वेशन पूरा वापस दे देता है।

असली शुल्क मॉडल परिवार पर निर्भर करता है।

मॉडल क्या चार्ज होता है
Shannon मॉडल मॉडल की प्रति 1M कीमत पर usage.total_tokens। इनपुट और आउटपुट की एक ही दर है।
होस्टेड ओपन-वेट मॉडल अनकैश्ड इनपुट इनपुट दर पर, कैश किया गया इनपुट कैश्ड दर पर, आउटपुट आउटपुट दर पर।

USD की राशि आपके बैलेंस से टोकन में $5.00 प्रति 1,000,000 की दर से ली जाती है, और पूरे टोकन में पूर्णांकित की जाती है।

POST /v1/tokenize या POST /v1/messages/count_tokens से टोकन गिनना मुफ़्त है और कुछ रिज़र्व नहीं करता। टोकन गिनती

बैलेंस और उपयोग कहाँ देखें

Keys & usage पेज दिखाता है कि आप अभी क्या खर्च कर सकते हैं, आज का प्लान अलाउंस, आपका खरीदा गया क्रेडिट और पिछले 30 दिनों का API खर्च। उसके नीचे आपकी key के हर अनुरोध की सूची है: समय, endpoint, मॉडल, कैश किया गया इनपुट, बिल किए गए टोकन और लागत। Keys और उपयोग

हर उत्तर में एक usage ऑब्जेक्ट भी होता है, जिसमें उस कॉल की टोकन गिनती होती है।

एंडपॉइंट usage के फ़ील्ड होस्टेड ओपन-वेट मॉडल द्वारा जोड़े गए
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage में मॉडल की टोकन गिनती होती है। आपके बैलेंस से ली गई राशि उत्तर में नहीं होती: वह Keys & usage की अनुरोध सूची का Billed tokens कॉलम है।
  • होस्टेड ओपन-वेट मॉडल के साथ /v1/messages पर, input_tokens इनपुट का अनकैश्ड हिस्सा है, cache_read_input_tokens कैश किया गया हिस्सा है और cache_creation_input_tokens हमेशा 0 होता है।
  • /v1/chat/completions की स्ट्रीम [DONE] से पहले अपने अंतिम चंक में usage देती है। स्ट्रीमिंग

जब बैलेंस खत्म हो जाए

जिस अनुरोध का रिज़र्वेशन आपके बैलेंस में नहीं समाता, उसका उत्तर स्टेटस 429, प्रकार rate_limit_error और नीचे दिए संदेश के साथ आता है। कुछ चार्ज नहीं होता। यही उत्तर तब भी भेजा जाता है जब बैलेंस शून्य से ऊपर है पर अनुरोध के आउटपुट बजट से छोटा है।

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

/v1/responses पर error ऑब्जेक्ट में code और param भी हो सकते हैं, दोनों null।

आप यह कर सकते हैं:

  • 00:00 UTC पर अगले प्लान अलाउंस का इंतज़ार करें।
  • क्रेडिट टॉप-अप करें। क्रेडिट प्लान अलाउंस के बाद खर्च होता है और उसकी समय-सीमा खत्म नहीं होती। क्रेडिट टॉप-अप करें
  • बड़े दैनिक अलाउंस वाले प्लान पर जाएँ। प्लान बदलें
  • अगर कुछ बैलेंस बचा है, तो छोटा max_tokens भेजें: तब रिज़र्वेशन छोटा होगा।

Shannon Coder कॉल अलाउंस

/v1/chat/completions और /v1/messages पर shannon-coder-1 कॉल में गिना जाता है, टोकन में नहीं। हर प्लान में हर 4 घंटे की विंडो के लिए कुछ कॉल शामिल हैं। एक अनुरोध एक कॉल है।

प्लान प्रति 4 घंटे की विंडो में कॉल
Free 3
Plus 20
Standard 40
Pro 60
  • विंडो 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC पर शुरू होती हैं। विंडो के अंत में बची कॉल आगे नहीं जातीं।
  • कॉल तब गिनी जाती है जब अनुरोध स्वीकार होता है, मॉडल के उत्तर देने से पहले। जो अनुरोध बाद में विफल होता है वह भी एक कॉल गिना जाता है।
  • ये कॉल कोई टोकन रिज़र्व नहीं करतीं और आपके बैलेंस से कुछ नहीं लेतीं। Keys & usage की अनुरोध सूची इनकी टोकन संख्या और सूचीबद्ध कीमत पर उसका मान दिखाती है।
  • इन दोनों endpoints पर shannon-coder-1 का डिफ़ॉल्ट max_tokens 65,536 है।
  • कॉल खत्म होने पर उत्तर स्टेटस 429, प्रकार rate_limit_error और संदेश Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan होता है।
  • /v1/responses पर shannon-coder-1 का कोई कॉल अलाउंस नहीं है: इसका शुल्क आपके बैलेंस से टोकन में $8.00 प्रति 1M पर लगता है, हर दूसरे मॉडल की तरह।

Flood protection

एक अकाउंट प्रति मिनट 120 अनुरोध भेज सकता है। अनुरोध दर पर यही एकमात्र सीमा है, और यह हर प्लान पर समान है। यह बाढ़ रोकने के लिए है, सामान्य उपयोग धीमा करने के लिए नहीं।

  • मिनट 60 सेकंड की एक तय विंडो है जो आपके पहले अनुरोध से खुलती है। खत्म होने पर गिनती फिर शून्य से शुरू होती है।
  • गिनती प्रति अकाउंट होती है, प्रति key या प्रति IP पते नहीं। key बदलने से नई विंडो नहीं खुलती।
  • विंडो के भीतर 121वें अनुरोध का उत्तर स्टेटस 429, प्रकार rate_limit_error और संदेश Too many requests. Retry in <N>s. के साथ आता है। N विंडो खत्म होने तक के सेकंड हैं, 1 से 60 तक।
  • Flood protection बैलेंस से पहले जाँचा जाता है। जिस अनुरोध को वह मना करता है, वह कुछ रिज़र्व नहीं करता और उसकी कोई लागत नहीं होती।
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
अनुरोध Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses गिना जाता है, प्रति अनुरोध एक।
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens नहीं गिना जाता।
/v1/chat/completions और /v1/messages पर shannon-coder-1 इसके बजाय Shannon Coder कॉल अलाउंस से गिना जाता है।
जिस अनुरोध का उत्तर 401 से दिया गया, या अज्ञात model के लिए 400 से नहीं गिना जाता।
Flood protection द्वारा मना किया गया अनुरोध विंडो में गिना जाता है। कुछ चार्ज नहीं होता।

समानांतर अनुरोध

एक अकाउंट के एक साथ कितने अनुरोध खुले हो सकते हैं, इस पर कोई सीमा नहीं है, और समानांतर अनुरोध भेजने पर कोई एरर नहीं है। जो अनुरोध तुरंत शुरू नहीं हो सकते वे कतार में इंतज़ार करते हैं और बारी-बारी से जवाब पाते हैं।

  • हर अनुरोध आते ही प्रति मिनट 120 में गिना जाता है, चाहे पिछले अनुरोध पूरे हुए हों या नहीं।
  • हर अनुरोध अपने खत्म होने तक अपना रिज़र्वेशन रोके रखता है। डिफ़ॉल्ट आउटपुट बजट वाले बीस खुले अनुरोध 20 × 4,096 = 81,920 टोकन का बैलेंस रोकते हैं। अगर रिज़र्वेशन मिलाकर आपके बैलेंस से बड़े हैं, तो अगले अनुरोध को Quota exceeded उत्तर मिलता है, भले ही पूरी हो चुकी कॉल की लागत कम होती। छोटा max_tokens कम रोकता है।
  • स्ट्रीमिंग के बिना अनुरोध उत्तर पूरा होने तक कुछ नहीं भेजता, इसलिए अपने क्लाइंट को ऐसा टाइमआउट दें जो इस प्रतीक्षा को कवर करे। स्ट्रीम प्रतीक्षा के दौरान अपना कनेक्शन खुला रखती है। स्ट्रीमिंग

एक अनुरोध की सीमाएँ

सीमा मान कहाँ लागू सीमा पर
अनुरोध की बॉडी 32 MiB (33,554,432 बाइट) हर endpoint स्टेटस 413, प्रकार invalid_request_error।
आउटपुट बजट: max_tokens, max_completion_tokens, max_output_tokens 1 से 65,536। डिफ़ॉल्ट 4,096; /v1/chat/completions और /v1/messages पर shannon-coder-1 का डिफ़ॉल्ट 65,536 है। हर मॉडल, आपके बैलेंस से रिज़र्व की गई मात्रा के रूप में। उत्तर की लंबाई की सीमा के रूप में: होस्टेड ओपन-वेट मॉडल, shannon-1.6-lite, shannon-1.6-pro और shannon-coder-1। सीमा से बाहर के मान को सीमा के सबसे पास वाले सिरे पर ले जाया जाता है। कोई एरर नहीं।
स्टॉप सीक्वेंस: stop, stop_sequences 4 स्ट्रिंग होस्टेड ओपन-वेट मॉडल पहली 4 गैर-खाली स्ट्रिंग इस्तेमाल होती हैं।
URL के रूप में दी गई इमेज या फ़ाइल 8 MiB, 20 सेकंड के भीतर पढ़ी गई, अधिकतम 5 रीडायरेक्ट, एक सार्वजनिक http या https पता इमेज या फ़ाइलें लेने वाला हर endpoint अनुरोध का उत्तर उस हिस्से के बिना दिया जाता है। कोई एरर नहीं।
इनलाइन भेजी गई इमेज या फ़ाइल (base64) अपनी कोई सीमा नहीं। यह 32 MiB अनुरोध बॉडी में गिनी जाती है। इमेज या फ़ाइलें लेने वाला हर endpoint पूरे अनुरोध के लिए स्टेटस 413।
POST /v1/tokenize का text 4,000,000 बाइट /v1/tokenize स्टेटस 413, प्रकार invalid_request_error, संदेश text too long।
POST /v1/tokenize के messages और POST /v1/messages/count_tokens की बॉडी 32 MiB अनुरोध बॉडी दोनों गिनती वाले endpoints स्टेटस 413।
कॉन्टेक्स्ट विंडो हर मॉडल के लिए: GET /v1/models में context_window हर मॉडल लंबी बातचीत का क्या होता है, यह मॉडल पर निर्भर करता है। मॉडल और कीमतें
वेब खोजें (web_search: true) प्रति प्लान और दिन: Free 3, Plus 30, Standard 50, Pro 60। जिस अनुरोध की खोज में परिणाम मिले, उसके लिए एक खोज गिनी जाती है। web_search: true सेट करने वाले अनुरोध कोई न बचने पर अनुरोध का उत्तर खोज के बिना दिया जाता है। कोई एरर नहीं। इनबिल्ट Web Search

एरर

इस पेज के उत्तर। /v1/messages पर यही error ऑब्जेक्ट {"type": "error", "error": {…}} के रूप में लिपटा होता है।

स्टेटस प्रकार संदेश कब, और क्या करें
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan अनुरोध का रिज़र्वेशन आपके बैलेंस में नहीं समाता। 00:00 UTC का इंतज़ार करें, क्रेडिट टॉप-अप करें, प्लान बदलें, या छोटा max_tokens भेजें।
429 rate_limit_error Too many requests. Retry in <N>s. मौजूदा मिनट में 120 से अधिक अनुरोध। N सेकंड रुकें और फिर भेजें।
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan मौजूदा 4 घंटे की विंडो की Shannon Coder कॉल खत्म हो गई हैं।
429 rate_limit_error Shannon routes are temporarily busy. Please retry. मॉडल इस क्षण अनुरोध नहीं ले सकता। थोड़े विराम के बाद उसे फिर भेजें।
503 api_error Could not verify your quota right now. Please retry. आपका बैलेंस पढ़ा नहीं जा सका। कुछ चार्ज नहीं हुआ; अनुरोध फिर भेजें। Shannon मॉडल के साथ /v1/responses पर स्टेटस 500 होता है।
413 invalid_request_error अनुरोध की बॉडी 32 MiB से बड़ी है। OpenAI-फ़ॉर्मेट endpoints पर error ऑब्जेक्ट में code: "request_too_large" होता है।
413 invalid_request_error text too long POST /v1/tokenize का text 4,000,000 बाइट से लंबा है।