حدود اور بیلنس
ہر درخواست کو برابر سروس ملتی ہے۔ کوئی ریٹ درجے نہیں۔ کوئی الگ API کوٹہ نہیں۔ آپ اپنے ٹوکنز کی ادائیگی پہلے ہی کر چکے ہیں — انہیں جتنی تیزی سے چاہیں استعمال کریں۔
یہ صفحہ بتاتا ہے کہ آپ کا بیلنس کس چیز سے بنتا ہے، ایک درخواست کیا محفوظ کرتی ہے اور اس پر کتنا خرچ آتا ہے، آپ کتنی درخواستیں بھیج سکتے ہیں، اور وہ چند حدود جن سے ایک درخواست کا واسطہ پڑ سکتا ہے۔
- بیلنس کے 1M ٹوکنز کی مالیت
- $5.00
- روزانہ الاؤنس نیا ہوتا ہے
- 00:00 UTC
- flood protection، فی اکاؤنٹ
- 120 درخواستیں / منٹ
درخواستوں کو سروس کیسے دی جاتی ہے
- کوئی ریٹ درجے نہیں — ایک اصول طے کرتا ہے کہ درخواستیں کتنی تیزی سے آ سکتی ہیں، اور یہ ہر اکاؤنٹ اور ہر پلان کے لیے یکساں ہے: 120 درخواستیں فی منٹ۔ ٹوکنز فی منٹ پر کوئی حد نہیں۔
- کوئی الگ API کوٹہ نہیں — API وہی بیلنس خرچ کرتی ہے جو چیٹ کرتی ہے۔ پلان آج کے الاؤنس کا حجم طے کرتا ہے۔ یہ درخواستوں کی رفتار طے نہیں کرتا۔
- جتنی تیزی سے چاہیں — متوازی بھیجی گئی درخواستیں قبول کی جاتی ہیں اور قطار میں انتظار کرتی ہیں۔ انہیں متوازی ہونے کی وجہ سے مسترد نہیں کیا جاتا۔
آپ کا بیلنس
آپ کا بیلنس ٹوکنز میں گنا جاتا ہے۔ بیلنس کے 1,000,000 ٹوکنز کی مالیت $5.00 ہے، اور ماڈلز اور قیمتیں صفحے کی ہر قیمت اسی مالیت کے مقابلے میں ایک نرخ ہے۔
کسی بھی لمحے بیلنس دو حصوں کا مجموعہ ہوتا ہے۔
- آج کا پلان الاؤنس — ٹوکنز کی وہ تعداد جو آپ کا پلان طے کرتا ہے۔ یہ ہر روز 00:00 UTC پر نئی ہو جاتی ہے۔ دن کے آخر میں جو بچ جائے وہ آگے منتقل نہیں ہوتا۔
- خریدا ہوا کریڈٹ — وہ ٹوکنز جو آپ نے پیک کے طور پر خریدے۔ کریڈٹ ختم نہیں ہوتا اور ہر پلان پر کام کرتا ہے، Free سمیت۔
| پلان | فی دن ٹوکنز | مالیت |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- خرچ کی ترتیب — ہر درخواست پہلے آج کا پلان الاؤنس خرچ کرتی ہے۔ خریدا ہوا کریڈٹ صرف اس کے لیے استعمال ہوتا ہے جو اس دن الاؤنس سے زیادہ ہو۔
- چیٹ اور API اسے مشترکہ استعمال کرتے ہیں — ہر اکاؤنٹ کا ایک بیلنس ہے۔ API کلید اپنے مالک اکاؤنٹ کے بیلنس سے خرچ کرتی ہے، چیٹ والی ہی قیمتوں پر۔
- پیکس — کریڈٹ 1,000,000 ($5.00)، 2,000,000 ($10.00) اور 5,000,000 ($25.00) ٹوکنز کے پیکس میں فروخت ہوتا ہے، یا آپ کی پسند کی مقدار میں 1,000,000 سے 100,000,000 ٹوکنز تک، $5.00 فی 1,000,000 پر۔
کریڈٹ ٹاپ اپ کریں پلان تبدیل کریں
درخواست کیا محفوظ کرتی ہے اور اس پر کتنا خرچ آتا ہے
- محفوظ کرنا — جب درخواست آتی ہے تو وہ آپ کے بیلنس میں سے اپنا آؤٹ پٹ بجٹ محفوظ کرتی ہے:
/v1/chat/completionsاور/v1/messagesپرmax_tokens،/v1/responsesپرmax_output_tokens۔/v1/chat/completionsmax_completion_tokensبھی پڑھتا ہے۔ ڈیفالٹ 4,096 ہے اور دائرہ 1 سے 65,536 ہے۔ - قبولیت — درخواست صرف تب قبول ہوتی ہے جب محفوظ کی گئی مقدار آپ کے بیلنس میں باقی مقدار میں سما جائے۔ جو بیلنس صفر سے اوپر ہو مگر آؤٹ پٹ بجٹ سے کم ہو اسے
Quota exceededکا جواب ملتا ہے۔ باقی بیلنس استعمال کرنے کے لیے چھوٹاmax_tokensبھیجیں۔ - تصفیہ — جب جواب مکمل ہو جائے تو محفوظ کی گئی مقدار اصل چارج سے بدل دی جاتی ہے۔ چارج محفوظ کی گئی مقدار سے کم بھی ہو سکتا ہے اور زیادہ بھی۔
- واپسی — جو درخواست ایرر اسٹیٹس پر ختم ہو وہ اپنی محفوظ کی گئی مقدار پوری واپس کر دیتی ہے۔
اصل چارج ماڈل فیملی پر منحصر ہے۔
| ماڈلز | کیا چارج ہوتا ہے |
|---|---|
| Shannon ماڈلز | usage.total_tokens ماڈل کی فی 1M قیمت پر۔ ان پٹ اور آؤٹ پٹ کا ایک ہی نرخ ہے۔ |
| ہوسٹڈ اوپن ویٹ ماڈلز | غیر کیشڈ ان پٹ ان پٹ نرخ پر، کیشڈ ان پٹ کیشڈ نرخ پر، آؤٹ پٹ آؤٹ پٹ نرخ پر۔ |
USD میں رقم آپ کے بیلنس سے ٹوکنز میں $5.00 فی 1,000,000 پر لی جاتی ہے، اور پورے ٹوکن تک گول کی جاتی ہے۔
POST /v1/tokenize یا POST /v1/messages/count_tokens سے ٹوکنز کی گنتی مفت ہے اور کچھ محفوظ نہیں کرتی۔ ٹوکن گنتی
بیلنس اور استعمال کہاں دیکھیں
Keys & usage صفحہ دکھاتا ہے کہ آپ ابھی کیا خرچ کر سکتے ہیں، آج کا پلان الاؤنس، آپ کا خریدا ہوا کریڈٹ اور پچھلے 30 دنوں کا API خرچ۔ اس کے نیچے وہ ہر درخواست درج کرتا ہے جو آپ کی کلید نے کی: وقت، endpoint، ماڈل، کیشڈ ان پٹ، بل شدہ ٹوکنز اور لاگت۔ Keys & usage
ہر جواب میں usage آبجیکٹ بھی ہوتا ہے جس میں اس کال کے ٹوکنز کی گنتی ہوتی ہے۔
| اینڈ پوائنٹ | usage کے فیلڈز | ہوسٹڈ اوپن ویٹ ماڈلز کے اضافے |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageماڈل کے ٹوکنز کی گنتی رکھتا ہے۔ آپ کے بیلنس سے لی جانے والی رقم جواب میں نہیں ہوتی: وہ Keys & usage پر درخواستوں کی فہرست کا Billed tokens کالم ہے۔- ہوسٹڈ اوپن ویٹ ماڈل کے ساتھ
/v1/messagesپرinput_tokensان پٹ کا غیر کیشڈ حصہ ہے،cache_read_input_tokensکیشڈ حصہ ہے اورcache_creation_input_tokensہمیشہ0ہوتا ہے۔ -
/v1/chat/completionsپر سٹریم[DONE]سے پہلے اپنے آخری chunk میںusageرکھتی ہے۔ اسٹریمنگ
جب بیلنس ختم ہو جائے
جس درخواست کی محفوظ کی جانے والی مقدار آپ کے بیلنس میں نہ سمائے اس کا جواب اسٹیٹس 429، type rate_limit_error اور نیچے دیے گئے پیغام سے دیا جاتا ہے۔ کوئی چارج نہیں لگتا۔ یہی جواب تب بھی بھیجا جاتا ہے جب بیلنس صفر سے اوپر ہو مگر درخواست کے آؤٹ پٹ بجٹ سے کم ہو۔
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} /v1/responses پر error آبجیکٹ میں code اور param بھی ہو سکتے ہیں، دونوں null۔
آپ یہ کر سکتے ہیں:
- 00:00 UTC پر اگلے پلان الاؤنس کا انتظار کریں۔
- کریڈٹ ٹاپ اپ کریں۔ کریڈٹ پلان الاؤنس کے بعد خرچ ہوتا ہے اور ختم نہیں ہوتا۔ کریڈٹ ٹاپ اپ کریں
- بڑے روزانہ الاؤنس والے پلان پر جائیں۔ پلان تبدیل کریں
- اگر کچھ بیلنس باقی ہے تو چھوٹا
max_tokensبھیجیں: اس سے محفوظ کی جانے والی مقدار کم ہو جاتی ہے۔
Shannon Coder کال الاؤنس
/v1/chat/completions اور /v1/messages پر shannon-coder-1 کالز میں گنا جاتا ہے، ٹوکنز میں نہیں۔ ہر پلان میں فی 4 گھنٹے ونڈو کالز کی ایک تعداد شامل ہے۔ ایک درخواست ایک کال ہے۔
| پلان | فی 4 گھنٹے ونڈو کالز |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- ونڈوز 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC پر شروع ہوتی ہیں۔ ونڈو کے آخر میں جو کالز باقی ہوں وہ آگے منتقل نہیں ہوتیں۔
- کال درخواست قبول ہوتے ہی، ماڈل کے جواب دینے سے پہلے، گنی جاتی ہے۔ جو درخواست بعد میں ناکام ہو وہ بھی کال میں شمار ہوتی ہے۔
- یہ کالز کوئی ٹوکنز محفوظ نہیں کرتیں اور آپ کے بیلنس سے کچھ نہیں لیتیں۔ Keys & usage پر درخواستوں کی فہرست ان کے ٹوکنز کی تعداد اور درج قیمت پر اس کی مالیت دکھاتی ہے۔
- ان دونوں endpoints پر
shannon-coder-1کا ڈیفالٹmax_tokens65,536 ہے۔ - کالز باقی نہ ہوں تو جواب اسٹیٹس
429، typerate_limit_errorاور پیغامShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/planہوتا ہے۔ /v1/responsesپرshannon-coder-1کا کوئی کال الاؤنس نہیں: اس کا چارج آپ کے بیلنس سے ٹوکنز میں $8.00 فی 1M پر لگتا ہے، ہر دوسرے ماڈل کی طرح۔
Flood protection
ایک اکاؤنٹ فی منٹ 120 درخواستیں بھیج سکتا ہے۔ درخواستوں کی رفتار پر یہی واحد حد ہے، اور یہ ہر پلان پر یکساں ہے۔ یہ سیلاب روکنے کے لیے ہے، عام استعمال سست کرنے کے لیے نہیں۔
- منٹ 60 سیکنڈ کی مقررہ ونڈو ہے جو آپ کی پہلی درخواست سے کھلتی ہے۔ ختم ہونے پر گنتی دوبارہ صفر سے شروع ہوتی ہے۔
- گنتی فی اکاؤنٹ ہے، فی کلید یا فی IP پتہ نہیں۔ کلید rotate کرنے سے نئی ونڈو نہیں کھلتی۔
- ونڈو کے اندر 121ویں درخواست کا جواب اسٹیٹس
429، typerate_limit_errorاور پیغامToo many requests. Retry in <N>s.سے دیا جاتا ہے۔Nونڈو کے ختم ہونے تک کے سیکنڈ ہیں، 1 سے 60 تک۔ - Flood protection بیلنس سے پہلے جانچا جاتا ہے۔ جو درخواست یہ مسترد کرے وہ کچھ محفوظ نہیں کرتی اور اس پر کچھ خرچ نہیں آتا۔
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | درخواست | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | شمار ہوتا ہے، فی درخواست ایک۔ |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | شمار نہیں ہوتا۔ |
/v1/chat/completions اور /v1/messages پر shannon-coder-1 | اس کے بجائے Shannon Coder کال الاؤنس سے گنا جاتا ہے۔ |
جس درخواست کا جواب 401 سے دیا جائے، یا نامعلوم model پر 400 سے | شمار نہیں ہوتا۔ |
| Flood protection سے مسترد ہونے والی درخواست | ونڈو میں شمار ہوتا ہے۔ کوئی چارج نہیں لگتا۔ |
متوازی درخواستیں
ایک اکاؤنٹ بیک وقت کتنی درخواستیں کھلی رکھ سکتا ہے اس کی کوئی حد نہیں، اور متوازی درخواستیں بھیجنے پر کوئی ایرر نہیں۔ جو درخواستیں فوراً شروع نہ ہو سکیں وہ قطار میں انتظار کرتی ہیں اور باری باری جواب پاتی ہیں۔
- ہر درخواست آتے ہی فی منٹ 120 میں شمار ہوتی ہے، چاہے پچھلی درخواستیں ختم ہوئی ہوں یا نہیں۔
- ہر درخواست ختم ہونے تک اپنی محفوظ کی گئی مقدار روکے رکھتی ہے۔ ڈیفالٹ آؤٹ پٹ بجٹ کے ساتھ بیس کھلی درخواستیں 20 × 4,096 = 81,920 ٹوکنز بیلنس روکتی ہیں۔ اگر مجموعی محفوظ مقداریں آپ کے بیلنس سے بڑی ہوں تو اگلی درخواست کو
Quota exceededکا جواب ملتا ہے، چاہے مکمل شدہ کالز کی لاگت کم ہوتی۔ چھوٹاmax_tokensکم روکتا ہے۔ - سٹریمنگ کے بغیر درخواست جواب مکمل ہونے تک کچھ نہیں بھیجتی، اس لیے اپنے کلائنٹ کو ایسا ٹائم آؤٹ دیں جو اس انتظار کو سمیٹ سکے۔ سٹریم انتظار کے دوران اپنا کنکشن کھلا رکھتی ہے۔ اسٹریمنگ
ایک درخواست کی حدود
| حد | قدر | کہاں لاگو ہوتا ہے | حد پر |
|---|---|---|---|
| درخواست کی باڈی | 32 MiB (33,554,432 بائٹس) | ہر endpoint | اسٹیٹس 413، type invalid_request_error۔ |
آؤٹ پٹ بجٹ: max_tokens، max_completion_tokens، max_output_tokens | 1 سے 65,536۔ ڈیفالٹ 4,096؛ /v1/chat/completions اور /v1/messages پر shannon-coder-1 کا ڈیفالٹ 65,536 ہے۔ | ہر ماڈل، آپ کے بیلنس سے محفوظ کی جانے والی مقدار کے طور پر۔ جواب کی لمبائی کی حد کے طور پر: ہوسٹڈ اوپن ویٹ ماڈلز، shannon-1.6-lite، shannon-1.6-pro اور shannon-coder-1۔ | دائرے سے باہر کی قدر دائرے کے قریب ترین سرے پر لے آئی جاتی ہے۔ کوئی ایرر نہیں۔ |
Stop sequences: stop، stop_sequences | 4 سٹرنگز | ہوسٹڈ اوپن ویٹ ماڈلز | پہلی 4 غیر خالی سٹرنگز استعمال ہوتی ہیں۔ |
| URL کے طور پر دی گئی تصویر یا فائل | 8 MiB، 20 سیکنڈ کے اندر پڑھی جانے والی، زیادہ سے زیادہ 5 ری ڈائریکٹس، عوامی http یا https پتہ | ہر وہ endpoint جو تصاویر یا فائلیں لیتا ہے | درخواست کا جواب اس حصے کے بغیر دیا جاتا ہے۔ کوئی ایرر نہیں۔ |
| ان لائن بھیجی گئی تصویر یا فائل (base64) | اپنی کوئی حد نہیں۔ یہ 32 MiB درخواست باڈی میں شمار ہوتی ہے۔ | ہر وہ endpoint جو تصاویر یا فائلیں لیتا ہے | پوری درخواست کے لیے اسٹیٹس 413۔ |
POST /v1/tokenize کا text | 4,000,000 بائٹس | /v1/tokenize | اسٹیٹس 413، type invalid_request_error، پیغام text too long۔ |
POST /v1/tokenize کا messages اور POST /v1/messages/count_tokens کی باڈی | 32 MiB درخواست باڈی | گنتی کے دونوں endpoints | اسٹیٹس 413۔ |
| کانٹیکسٹ ونڈو | فی ماڈل: GET /v1/models میں context_window | ہر ماڈل | لمبی گفتگو کے ساتھ کیا ہوتا ہے، یہ ماڈل پر منحصر ہے۔ ماڈلز اور قیمتیں |
ویب سرچز (web_search: true) | فی پلان اور دن: Free 3، Plus 30، Standard 50، Pro 60۔ جس درخواست کی سرچ کو نتائج ملیں اس کے لیے ایک سرچ گنی جاتی ہے۔ | وہ درخواستیں جو web_search: true سیٹ کرتی ہیں | کوئی باقی نہ ہو تو درخواست کا جواب سرچ کے بغیر دیا جاتا ہے۔ کوئی ایرر نہیں۔ ویب تلاش |
ایررز
اس صفحے کے جوابات۔ /v1/messages پر وہی error آبجیکٹ {"type": "error", "error": {…}} کے اندر لپٹا ہوتا ہے۔
| اسٹیٹس | قسم | پیغام | کب، اور کیا کریں |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | درخواست کی محفوظ کی جانے والی مقدار آپ کے بیلنس میں نہیں سماتی۔ 00:00 UTC کا انتظار کریں، کریڈٹ ٹاپ اپ کریں، پلان بدلیں، یا چھوٹا max_tokens بھیجیں۔ |
429 | rate_limit_error | Too many requests. Retry in <N>s. | موجودہ منٹ میں 120 سے زیادہ درخواستیں۔ N سیکنڈ انتظار کریں اور دوبارہ بھیجیں۔ |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | موجودہ 4 گھنٹے کی ونڈو کی Shannon Coder کالز ختم ہو چکی ہیں۔ |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | ماڈل اس وقت درخواست قبول نہیں کر سکتا۔ مختصر وقفے کے بعد دوبارہ بھیجیں۔ |
503 | api_error | Could not verify your quota right now. Please retry. | آپ کا بیلنس پڑھا نہیں جا سکا۔ کوئی چارج نہیں لگا؛ درخواست دوبارہ بھیجیں۔ Shannon ماڈل کے ساتھ /v1/responses پر اسٹیٹس 500 ہوتا ہے۔ |
413 | invalid_request_error | درخواست کی باڈی 32 MiB سے بڑی ہے۔ OpenAI فارمیٹ والے endpoints پر error آبجیکٹ میں code: "request_too_large" ہوتا ہے۔ | |
413 | invalid_request_error | text too long | POST /v1/tokenize کا text 4,000,000 بائٹس سے لمبا ہے۔ |