مواد پر جائیں
حدود اور بیلنس

حدود اور بیلنس

ہر درخواست کو برابر سروس ملتی ہے۔ کوئی ریٹ درجے نہیں۔ کوئی الگ API کوٹہ نہیں۔ آپ اپنے ٹوکنز کی ادائیگی پہلے ہی کر چکے ہیں — انہیں جتنی تیزی سے چاہیں استعمال کریں۔

یہ صفحہ بتاتا ہے کہ آپ کا بیلنس کس چیز سے بنتا ہے، ایک درخواست کیا محفوظ کرتی ہے اور اس پر کتنا خرچ آتا ہے، آپ کتنی درخواستیں بھیج سکتے ہیں، اور وہ چند حدود جن سے ایک درخواست کا واسطہ پڑ سکتا ہے۔

بیلنس کے 1M ٹوکنز کی مالیت
$5.00
روزانہ الاؤنس نیا ہوتا ہے
00:00 UTC
flood protection، فی اکاؤنٹ
120 درخواستیں / منٹ

درخواستوں کو سروس کیسے دی جاتی ہے

  • کوئی ریٹ درجے نہیں — ایک اصول طے کرتا ہے کہ درخواستیں کتنی تیزی سے آ سکتی ہیں، اور یہ ہر اکاؤنٹ اور ہر پلان کے لیے یکساں ہے: 120 درخواستیں فی منٹ۔ ٹوکنز فی منٹ پر کوئی حد نہیں۔
  • کوئی الگ API کوٹہ نہیں — API وہی بیلنس خرچ کرتی ہے جو چیٹ کرتی ہے۔ پلان آج کے الاؤنس کا حجم طے کرتا ہے۔ یہ درخواستوں کی رفتار طے نہیں کرتا۔
  • جتنی تیزی سے چاہیں — متوازی بھیجی گئی درخواستیں قبول کی جاتی ہیں اور قطار میں انتظار کرتی ہیں۔ انہیں متوازی ہونے کی وجہ سے مسترد نہیں کیا جاتا۔

آپ کا بیلنس

آپ کا بیلنس ٹوکنز میں گنا جاتا ہے۔ بیلنس کے 1,000,000 ٹوکنز کی مالیت $5.00 ہے، اور ماڈلز اور قیمتیں صفحے کی ہر قیمت اسی مالیت کے مقابلے میں ایک نرخ ہے۔

کسی بھی لمحے بیلنس دو حصوں کا مجموعہ ہوتا ہے۔

  • آج کا پلان الاؤنس — ٹوکنز کی وہ تعداد جو آپ کا پلان طے کرتا ہے۔ یہ ہر روز 00:00 UTC پر نئی ہو جاتی ہے۔ دن کے آخر میں جو بچ جائے وہ آگے منتقل نہیں ہوتا۔
  • خریدا ہوا کریڈٹ — وہ ٹوکنز جو آپ نے پیک کے طور پر خریدے۔ کریڈٹ ختم نہیں ہوتا اور ہر پلان پر کام کرتا ہے، Free سمیت۔
پلان فی دن ٹوکنز مالیت
Free 30,000 $0.15
Plus 80,000 $0.40
Standard 265,000 $1.325
Pro 665,000 $3.325
  • خرچ کی ترتیب — ہر درخواست پہلے آج کا پلان الاؤنس خرچ کرتی ہے۔ خریدا ہوا کریڈٹ صرف اس کے لیے استعمال ہوتا ہے جو اس دن الاؤنس سے زیادہ ہو۔
  • چیٹ اور API اسے مشترکہ استعمال کرتے ہیں — ہر اکاؤنٹ کا ایک بیلنس ہے۔ API کلید اپنے مالک اکاؤنٹ کے بیلنس سے خرچ کرتی ہے، چیٹ والی ہی قیمتوں پر۔
  • پیکس — کریڈٹ 1,000,000 ($5.00)، 2,000,000 ($10.00) اور 5,000,000 ($25.00) ٹوکنز کے پیکس میں فروخت ہوتا ہے، یا آپ کی پسند کی مقدار میں 1,000,000 سے 100,000,000 ٹوکنز تک، $5.00 فی 1,000,000 پر۔

کریڈٹ ٹاپ اپ کریں پلان تبدیل کریں

درخواست کیا محفوظ کرتی ہے اور اس پر کتنا خرچ آتا ہے

  • محفوظ کرنا — جب درخواست آتی ہے تو وہ آپ کے بیلنس میں سے اپنا آؤٹ پٹ بجٹ محفوظ کرتی ہے: /v1/chat/completions اور /v1/messages پر max_tokens، /v1/responses پر max_output_tokens۔ /v1/chat/completions max_completion_tokens بھی پڑھتا ہے۔ ڈیفالٹ 4,096 ہے اور دائرہ 1 سے 65,536 ہے۔
  • قبولیت — درخواست صرف تب قبول ہوتی ہے جب محفوظ کی گئی مقدار آپ کے بیلنس میں باقی مقدار میں سما جائے۔ جو بیلنس صفر سے اوپر ہو مگر آؤٹ پٹ بجٹ سے کم ہو اسے Quota exceeded کا جواب ملتا ہے۔ باقی بیلنس استعمال کرنے کے لیے چھوٹا max_tokens بھیجیں۔
  • تصفیہ — جب جواب مکمل ہو جائے تو محفوظ کی گئی مقدار اصل چارج سے بدل دی جاتی ہے۔ چارج محفوظ کی گئی مقدار سے کم بھی ہو سکتا ہے اور زیادہ بھی۔
  • واپسی — جو درخواست ایرر اسٹیٹس پر ختم ہو وہ اپنی محفوظ کی گئی مقدار پوری واپس کر دیتی ہے۔

اصل چارج ماڈل فیملی پر منحصر ہے۔

ماڈلز کیا چارج ہوتا ہے
Shannon ماڈلز usage.total_tokens ماڈل کی فی 1M قیمت پر۔ ان پٹ اور آؤٹ پٹ کا ایک ہی نرخ ہے۔
ہوسٹڈ اوپن ویٹ ماڈلز غیر کیشڈ ان پٹ ان پٹ نرخ پر، کیشڈ ان پٹ کیشڈ نرخ پر، آؤٹ پٹ آؤٹ پٹ نرخ پر۔

USD میں رقم آپ کے بیلنس سے ٹوکنز میں $5.00 فی 1,000,000 پر لی جاتی ہے، اور پورے ٹوکن تک گول کی جاتی ہے۔

POST /v1/tokenize یا POST /v1/messages/count_tokens سے ٹوکنز کی گنتی مفت ہے اور کچھ محفوظ نہیں کرتی۔ ٹوکن گنتی

بیلنس اور استعمال کہاں دیکھیں

Keys & usage صفحہ دکھاتا ہے کہ آپ ابھی کیا خرچ کر سکتے ہیں، آج کا پلان الاؤنس، آپ کا خریدا ہوا کریڈٹ اور پچھلے 30 دنوں کا API خرچ۔ اس کے نیچے وہ ہر درخواست درج کرتا ہے جو آپ کی کلید نے کی: وقت، endpoint، ماڈل، کیشڈ ان پٹ، بل شدہ ٹوکنز اور لاگت۔ Keys & usage

ہر جواب میں usage آبجیکٹ بھی ہوتا ہے جس میں اس کال کے ٹوکنز کی گنتی ہوتی ہے۔

اینڈ پوائنٹ usage کے فیلڈز ہوسٹڈ اوپن ویٹ ماڈلز کے اضافے
/v1/chat/completions prompt_tokens, completion_tokens, total_tokens prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens
/v1/messages input_tokens, output_tokens cache_read_input_tokens, cache_creation_input_tokens
/v1/responses input_tokens, output_tokens, total_tokens input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens
  • usage ماڈل کے ٹوکنز کی گنتی رکھتا ہے۔ آپ کے بیلنس سے لی جانے والی رقم جواب میں نہیں ہوتی: وہ Keys & usage پر درخواستوں کی فہرست کا Billed tokens کالم ہے۔
  • ہوسٹڈ اوپن ویٹ ماڈل کے ساتھ /v1/messages پر input_tokens ان پٹ کا غیر کیشڈ حصہ ہے، cache_read_input_tokens کیشڈ حصہ ہے اور cache_creation_input_tokens ہمیشہ 0 ہوتا ہے۔
  • /v1/chat/completions پر سٹریم [DONE] سے پہلے اپنے آخری chunk میں usage رکھتی ہے۔ اسٹریمنگ

جب بیلنس ختم ہو جائے

جس درخواست کی محفوظ کی جانے والی مقدار آپ کے بیلنس میں نہ سمائے اس کا جواب اسٹیٹس 429، type rate_limit_error اور نیچے دیے گئے پیغام سے دیا جاتا ہے۔ کوئی چارج نہیں لگتا۔ یہی جواب تب بھی بھیجا جاتا ہے جب بیلنس صفر سے اوپر ہو مگر درخواست کے آؤٹ پٹ بجٹ سے کم ہو۔

{
  "error": {
    "type": "rate_limit_error",
    "message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
  }
}

/v1/responses پر error آبجیکٹ میں code اور param بھی ہو سکتے ہیں، دونوں null۔

آپ یہ کر سکتے ہیں:

  • 00:00 UTC پر اگلے پلان الاؤنس کا انتظار کریں۔
  • کریڈٹ ٹاپ اپ کریں۔ کریڈٹ پلان الاؤنس کے بعد خرچ ہوتا ہے اور ختم نہیں ہوتا۔ کریڈٹ ٹاپ اپ کریں
  • بڑے روزانہ الاؤنس والے پلان پر جائیں۔ پلان تبدیل کریں
  • اگر کچھ بیلنس باقی ہے تو چھوٹا max_tokens بھیجیں: اس سے محفوظ کی جانے والی مقدار کم ہو جاتی ہے۔

Shannon Coder کال الاؤنس

/v1/chat/completions اور /v1/messages پر shannon-coder-1 کالز میں گنا جاتا ہے، ٹوکنز میں نہیں۔ ہر پلان میں فی 4 گھنٹے ونڈو کالز کی ایک تعداد شامل ہے۔ ایک درخواست ایک کال ہے۔

پلان فی 4 گھنٹے ونڈو کالز
Free 3
Plus 20
Standard 40
Pro 60
  • ونڈوز 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC پر شروع ہوتی ہیں۔ ونڈو کے آخر میں جو کالز باقی ہوں وہ آگے منتقل نہیں ہوتیں۔
  • کال درخواست قبول ہوتے ہی، ماڈل کے جواب دینے سے پہلے، گنی جاتی ہے۔ جو درخواست بعد میں ناکام ہو وہ بھی کال میں شمار ہوتی ہے۔
  • یہ کالز کوئی ٹوکنز محفوظ نہیں کرتیں اور آپ کے بیلنس سے کچھ نہیں لیتیں۔ Keys & usage پر درخواستوں کی فہرست ان کے ٹوکنز کی تعداد اور درج قیمت پر اس کی مالیت دکھاتی ہے۔
  • ان دونوں endpoints پر shannon-coder-1 کا ڈیفالٹ max_tokens 65,536 ہے۔
  • کالز باقی نہ ہوں تو جواب اسٹیٹس 429، type rate_limit_error اور پیغام Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan ہوتا ہے۔
  • /v1/responses پر shannon-coder-1 کا کوئی کال الاؤنس نہیں: اس کا چارج آپ کے بیلنس سے ٹوکنز میں $8.00 فی 1M پر لگتا ہے، ہر دوسرے ماڈل کی طرح۔

Flood protection

ایک اکاؤنٹ فی منٹ 120 درخواستیں بھیج سکتا ہے۔ درخواستوں کی رفتار پر یہی واحد حد ہے، اور یہ ہر پلان پر یکساں ہے۔ یہ سیلاب روکنے کے لیے ہے، عام استعمال سست کرنے کے لیے نہیں۔

  • منٹ 60 سیکنڈ کی مقررہ ونڈو ہے جو آپ کی پہلی درخواست سے کھلتی ہے۔ ختم ہونے پر گنتی دوبارہ صفر سے شروع ہوتی ہے۔
  • گنتی فی اکاؤنٹ ہے، فی کلید یا فی IP پتہ نہیں۔ کلید rotate کرنے سے نئی ونڈو نہیں کھلتی۔
  • ونڈو کے اندر 121ویں درخواست کا جواب اسٹیٹس 429، type rate_limit_error اور پیغام Too many requests. Retry in <N>s. سے دیا جاتا ہے۔ N ونڈو کے ختم ہونے تک کے سیکنڈ ہیں، 1 سے 60 تک۔
  • Flood protection بیلنس سے پہلے جانچا جاتا ہے۔ جو درخواست یہ مسترد کرے وہ کچھ محفوظ نہیں کرتی اور اس پر کچھ خرچ نہیں آتا۔
{
  "error": {
    "type": "rate_limit_error",
    "message": "Too many requests. Retry in 37s."
  }
}
درخواست Flood protection
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses شمار ہوتا ہے، فی درخواست ایک۔
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens شمار نہیں ہوتا۔
/v1/chat/completions اور /v1/messages پر shannon-coder-1 اس کے بجائے Shannon Coder کال الاؤنس سے گنا جاتا ہے۔
جس درخواست کا جواب 401 سے دیا جائے، یا نامعلوم model پر 400 سے شمار نہیں ہوتا۔
Flood protection سے مسترد ہونے والی درخواست ونڈو میں شمار ہوتا ہے۔ کوئی چارج نہیں لگتا۔

متوازی درخواستیں

ایک اکاؤنٹ بیک وقت کتنی درخواستیں کھلی رکھ سکتا ہے اس کی کوئی حد نہیں، اور متوازی درخواستیں بھیجنے پر کوئی ایرر نہیں۔ جو درخواستیں فوراً شروع نہ ہو سکیں وہ قطار میں انتظار کرتی ہیں اور باری باری جواب پاتی ہیں۔

  • ہر درخواست آتے ہی فی منٹ 120 میں شمار ہوتی ہے، چاہے پچھلی درخواستیں ختم ہوئی ہوں یا نہیں۔
  • ہر درخواست ختم ہونے تک اپنی محفوظ کی گئی مقدار روکے رکھتی ہے۔ ڈیفالٹ آؤٹ پٹ بجٹ کے ساتھ بیس کھلی درخواستیں 20 × 4,096 = 81,920 ٹوکنز بیلنس روکتی ہیں۔ اگر مجموعی محفوظ مقداریں آپ کے بیلنس سے بڑی ہوں تو اگلی درخواست کو Quota exceeded کا جواب ملتا ہے، چاہے مکمل شدہ کالز کی لاگت کم ہوتی۔ چھوٹا max_tokens کم روکتا ہے۔
  • سٹریمنگ کے بغیر درخواست جواب مکمل ہونے تک کچھ نہیں بھیجتی، اس لیے اپنے کلائنٹ کو ایسا ٹائم آؤٹ دیں جو اس انتظار کو سمیٹ سکے۔ سٹریم انتظار کے دوران اپنا کنکشن کھلا رکھتی ہے۔ اسٹریمنگ

ایک درخواست کی حدود

حد قدر کہاں لاگو ہوتا ہے حد پر
درخواست کی باڈی 32 MiB (33,554,432 بائٹس) ہر endpoint اسٹیٹس 413، type invalid_request_error۔
آؤٹ پٹ بجٹ: max_tokens، max_completion_tokens، max_output_tokens 1 سے 65,536۔ ڈیفالٹ 4,096؛ /v1/chat/completions اور /v1/messages پر shannon-coder-1 کا ڈیفالٹ 65,536 ہے۔ ہر ماڈل، آپ کے بیلنس سے محفوظ کی جانے والی مقدار کے طور پر۔ جواب کی لمبائی کی حد کے طور پر: ہوسٹڈ اوپن ویٹ ماڈلز، shannon-1.6-lite، shannon-1.6-pro اور shannon-coder-1۔ دائرے سے باہر کی قدر دائرے کے قریب ترین سرے پر لے آئی جاتی ہے۔ کوئی ایرر نہیں۔
Stop sequences: stop، stop_sequences 4 سٹرنگز ہوسٹڈ اوپن ویٹ ماڈلز پہلی 4 غیر خالی سٹرنگز استعمال ہوتی ہیں۔
URL کے طور پر دی گئی تصویر یا فائل 8 MiB، 20 سیکنڈ کے اندر پڑھی جانے والی، زیادہ سے زیادہ 5 ری ڈائریکٹس، عوامی http یا https پتہ ہر وہ endpoint جو تصاویر یا فائلیں لیتا ہے درخواست کا جواب اس حصے کے بغیر دیا جاتا ہے۔ کوئی ایرر نہیں۔
ان لائن بھیجی گئی تصویر یا فائل (base64) اپنی کوئی حد نہیں۔ یہ 32 MiB درخواست باڈی میں شمار ہوتی ہے۔ ہر وہ endpoint جو تصاویر یا فائلیں لیتا ہے پوری درخواست کے لیے اسٹیٹس 413۔
POST /v1/tokenize کا text 4,000,000 بائٹس /v1/tokenize اسٹیٹس 413، type invalid_request_error، پیغام text too long۔
POST /v1/tokenize کا messages اور POST /v1/messages/count_tokens کی باڈی 32 MiB درخواست باڈی گنتی کے دونوں endpoints اسٹیٹس 413۔
کانٹیکسٹ ونڈو فی ماڈل: GET /v1/models میں context_window ہر ماڈل لمبی گفتگو کے ساتھ کیا ہوتا ہے، یہ ماڈل پر منحصر ہے۔ ماڈلز اور قیمتیں
ویب سرچز (web_search: true) فی پلان اور دن: Free 3، Plus 30، Standard 50، Pro 60۔ جس درخواست کی سرچ کو نتائج ملیں اس کے لیے ایک سرچ گنی جاتی ہے۔ وہ درخواستیں جو web_search: true سیٹ کرتی ہیں کوئی باقی نہ ہو تو درخواست کا جواب سرچ کے بغیر دیا جاتا ہے۔ کوئی ایرر نہیں۔ ویب تلاش

ایررز

اس صفحے کے جوابات۔ /v1/messages پر وہی error آبجیکٹ {"type": "error", "error": {…}} کے اندر لپٹا ہوتا ہے۔

اسٹیٹس قسم پیغام کب، اور کیا کریں
429 rate_limit_error Quota exceeded. Upgrade your plan at shannon-ai.com/plan درخواست کی محفوظ کی جانے والی مقدار آپ کے بیلنس میں نہیں سماتی۔ 00:00 UTC کا انتظار کریں، کریڈٹ ٹاپ اپ کریں، پلان بدلیں، یا چھوٹا max_tokens بھیجیں۔
429 rate_limit_error Too many requests. Retry in <N>s. موجودہ منٹ میں 120 سے زیادہ درخواستیں۔ N سیکنڈ انتظار کریں اور دوبارہ بھیجیں۔
429 rate_limit_error Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan موجودہ 4 گھنٹے کی ونڈو کی Shannon Coder کالز ختم ہو چکی ہیں۔
429 rate_limit_error Shannon routes are temporarily busy. Please retry. ماڈل اس وقت درخواست قبول نہیں کر سکتا۔ مختصر وقفے کے بعد دوبارہ بھیجیں۔
503 api_error Could not verify your quota right now. Please retry. آپ کا بیلنس پڑھا نہیں جا سکا۔ کوئی چارج نہیں لگا؛ درخواست دوبارہ بھیجیں۔ Shannon ماڈل کے ساتھ /v1/responses پر اسٹیٹس 500 ہوتا ہے۔
413 invalid_request_error درخواست کی باڈی 32 MiB سے بڑی ہے۔ OpenAI فارمیٹ والے endpoints پر error آبجیکٹ میں code: "request_too_large" ہوتا ہے۔
413 invalid_request_error text too long POST /v1/tokenize کا text 4,000,000 بائٹس سے لمبا ہے۔