מגבלות ויתרה
כל בקשה מטופלת באופן שווה. בלי דרגות קצב. בלי מכסת API נפרדת. כבר שילמתם על הטוקנים שלכם: השתמשו בהם מהר כמו שתרצו.
הדף הזה מסביר ממה מורכבת היתרה שלכם, מה בקשה אחת מפרישה ומה היא עולה, כמה בקשות מותר לשלוח, ואת המגבלות המעטות שבקשה בודדת יכולה להיתקל בהן.
- שווי של 1M טוקנים של יתרה
- $5.00
- המכסה היומית מתחדשת
- 00:00 UTC
- הגנת הצפה, לכל חשבון
- 120 בקשות / דקה
איך בקשות מטופלות
- בלי דרגות קצב — כלל אחד מגביל באיזה קצב בקשות רשאיות להגיע, והוא זהה לכל חשבון ולכל תוכנית: 120 בקשות בדקה. אין מגבלה על טוקנים לדקה.
- בלי מכסת API נפרדת — ה-API מוציא את אותה יתרה כמו הצ'אט. תוכנית קובעת את גודל המכסה של היום. היא אינה קובעת קצב בקשות.
- מהר כמו שתרצו — בקשות שנשלחות במקביל מתקבלות וממתינות בתור. הן אינן נדחות בגלל שהן במקביל.
היתרה שלכם
היתרה שלכם נספרת בטוקנים. 1,000,000 טוקנים של יתרה שווים $5.00, וכל מחיר בדף מודלים ותמחור הוא שיעור ביחס לערך הזה.
בכל רגע היתרה היא סכום של שני חלקים.
- מכסת התוכנית להיום — מספר טוקנים שנקבע לפי התוכנית שלכם. הוא מתחדש מדי יום ב-00:00 UTC. מה שנשאר בסוף יום אינו עובר הלאה.
- קרדיט שנרכש — טוקנים שקניתם כחבילה. קרדיט אינו פג ופועל בכל תוכנית, כולל Free.
| תוכנית | טוקנים ליום | שווי |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- סדר ההוצאה — כל בקשה מוציאה קודם את מכסת התוכנית להיום. קרדיט שנרכש משמש רק למה שחורג מהמכסה באותו יום.
- הצ'אט וה-API חולקים אותה — לכל חשבון יש יתרה אחת. מפתח API מוציא מיתרת החשבון שהוא שייך לו, באותם מחירים כמו בצ'אט.
- חבילות — קרדיט נמכר בחבילות של 1,000,000 ($5.00), 2,000,000 ($10.00) ו-5,000,000 ($25.00) טוקנים, או בסכום לבחירתכם מ-1,000,000 עד 100,000,000 טוקנים ב-$5.00 לכל 1,000,000.
מה בקשה מפרישה ומה היא עולה
- הפרשה — כשבקשה מגיעה היא מפרישה את תקציב הפלט שלה מהיתרה שלכם:
max_tokensב-/v1/chat/completionsוב-/v1/messages,max_output_tokensב-/v1/responses./v1/chat/completionsקורא גם אתmax_completion_tokens. ברירת המחדל היא 4,096 והטווח הוא 1 עד 65,536. - קבלה — הבקשה מתקבלת רק אם ההפרשה נכנסת במה שנותר מהיתרה שלכם. יתרה שגדולה מאפס אך קטנה מתקציב הפלט מקבלת את התשובה
Quota exceeded. שלחוmax_tokensקטן יותר כדי להשתמש בשאר. - סגירת חשבון — כשהתשובה שלמה, ההפרשה מוחלפת בחיוב האמיתי. החיוב יכול להיות נמוך או גבוה מההפרשה.
- החזרה — בקשה שמסתיימת בסטטוס שגיאה מחזירה את ההפרשה שלה במלואה.
החיוב האמיתי תלוי במשפחת המודל.
| מודלים | מה מחויב |
|---|---|
| מודלי Shannon | usage.total_tokens במחיר המודל לכל 1M. לקלט ולפלט יש תעריף אחד. |
| מודלי open-weight מתארחים | קלט שאינו במטמון בתעריף הקלט, קלט במטמון בתעריף המטמון, פלט בתעריף הפלט. |
הסכום ב-USD נלקח מהיתרה שלכם בטוקנים ב-$5.00 לכל 1,000,000, מעוגל לטוקן שלם.
ספירת טוקנים עם POST /v1/tokenize או POST /v1/messages/count_tokens היא חינמית ואינה מפרישה דבר. ספירת טוקנים
איפה רואים יתרה ושימוש
הדף מפתחות ושימוש מראה מה אפשר להוציא עכשיו, את מכסת התוכנית להיום, את הקרדיט שנרכש ואת הוצאות ה-API של 30 הימים האחרונים. מתחת לזה הוא מפרט כל בקשה שהמפתח שלכם ביצע: זמן, endpoint, מודל, קלט במטמון, טוקנים מחויבים ועלות. מפתחות ושימוש
כל תשובה נושאת גם אובייקט usage עם ספירות הטוקנים של אותה קריאה.
| Endpoint | שדות של usage | מתווספים על ידי מודלי open-weight מתארחים |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageמכיל את ספירות הטוקנים של המודל. הסכום שנלקח מהיתרה שלכם אינו בתשובה: הוא בעמודה טוקנים מחויבים ברשימת הבקשות בדף מפתחות ושימוש.- ב-
/v1/messagesעם מודל open-weight מתארח,input_tokensהוא החלק של הקלט שאינו במטמון,cache_read_input_tokensהוא החלק שבמטמון ו-cache_creation_input_tokensהוא תמיד0. - stream ב-
/v1/chat/completionsנושאusageב-chunk האחרון שלו, לפני[DONE]. הזרמה
כשהיתרה נגמרת
בקשה שההפרשה שלה אינה נכנסת ביתרה שלכם נענית בסטטוס 429, בסוג rate_limit_error ובהודעה שלהלן. דבר אינו מחויב. אותה תשובה נשלחת כשהיתרה גדולה מאפס אך קטנה מתקציב הפלט של הבקשה.
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} ב-/v1/responses האובייקט error יכול להכיל גם code ו-param, שניהם null.
מה אפשר לעשות:
- המתינו למכסת התוכנית הבאה ב-00:00 UTC.
- טענו קרדיט. קרדיט מוצא אחרי מכסת התוכנית ואינו פג. טעינת קרדיט
- עברו לתוכנית עם מכסה יומית גדולה יותר. שינוי תוכנית
- שלחו
max_tokensקטן יותר, אם נשארה יתרה: ההפרשה אז קטנה יותר.
מכסת קריאות Shannon Coder
shannon-coder-1 ב-/v1/chat/completions וב-/v1/messages נספר בקריאות, לא בטוקנים. כל תוכנית כוללת מספר קריאות לכל חלון של 4 שעות. בקשה אחת היא קריאה אחת.
| תוכנית | קריאות לכל חלון של 4 שעות |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- החלונות מתחילים ב-00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC. קריאות שנותרו בסוף חלון אינן עוברות הלאה.
- קריאה נספרת כשהבקשה מתקבלת, לפני שהמודל עונה. בקשה שנכשלת אחר כך עדיין נספרת כקריאה.
- הקריאות האלה אינן מפרישות טוקנים ואינן לוקחות דבר מהיתרה שלכם. רשימת הבקשות בדף מפתחות ושימוש מראה את מספר הטוקנים שלהן ואת ערכם במחיר המפורסם.
- ברירת המחדל של
max_tokensב-shannon-coder-1בשני ה-endpoints האלה היא 65,536. - כשלא נותרו קריאות התשובה היא סטטוס
429, סוגrate_limit_error, הודעהShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan. - ב-
/v1/responsesאין ל-shannon-coder-1מכסת קריאות: הוא מחויב בטוקנים מהיתרה שלכם ב-$8.00 לכל 1M, כמו כל מודל אחר.
הגנת הצפה
חשבון רשאי לשלוח 120 בקשות בדקה. זו המגבלה היחידה על קצב הבקשות, והיא זהה בכל תוכנית. היא קיימת כדי לעצור הצפות, לא כדי להאט שימוש רגיל.
- הדקה היא חלון קבוע של 60 שניות שנפתח עם הבקשה הראשונה שלכם. כשהוא מסתיים, הספירה מתחילה שוב מאפס.
- הספירה היא לפי חשבון, לא לפי מפתח ולא לפי כתובת IP. החלפת המפתח אינה פותחת חלון חדש.
- הבקשה ה-121 בתוך חלון נענית בסטטוס
429, בסוגrate_limit_errorובהודעהToo many requests. Retry in <N>s.Nהוא מספר השניות עד סוף החלון, מ-1 עד 60. - הגנת ההצפה נבדקת לפני היתרה. בקשה שהיא דוחה אינה מפרישה דבר ואינה עולה דבר.
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | בקשה | הגנת הצפה |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | נספר, אחד לכל בקשה. |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | אינו נספר. |
shannon-coder-1 ב-/v1/chat/completions וב-/v1/messages | נספר במקום זאת במכסת הקריאות של Shannon Coder. |
בקשה שנענתה ב-401, או ב-400 עבור model לא מוכר | אינו נספר. |
| בקשה שהגנת ההצפה דחתה | נספר בחלון. דבר אינו מחויב. |
בקשות במקביל
אין מגבלה על מספר הבקשות שחשבון מחזיק פתוחות בו-זמנית, ואין שגיאה על שליחת בקשות במקביל. בקשות שאינן יכולות להתחיל מיד ממתינות בתור ונענות לפי הסדר.
- כל בקשה נספרת ב-120 לדקה כשהיא מגיעה, בין אם בקשות קודמות הסתיימו ובין אם לא.
- כל בקשה מחזיקה הפרשה משלה עד שהיא מסתיימת. עשרים בקשות פתוחות עם תקציב הפלט המוגדר כברירת מחדל מחזיקות 20 × 4,096 = 81,920 טוקנים של יתרה. אם ההפרשות יחד גדולות מהיתרה שלכם, הבקשה הבאה מקבלת את התשובה
Quota exceeded, אף על פי שהקריאות שהסתיימו היו עולות פחות.max_tokensקטן יותר מחזיק פחות. - בקשה בלי streaming אינה שולחת דבר עד שהתשובה שלמה, ולכן הגדירו ללקוח שלכם timeout שמכסה את ההמתנה. stream שומר את החיבור פתוח בזמן שהוא ממתין. הזרמה
מגבלות של בקשה בודדת
| מגבלה | ערך | חל על | בגבול |
|---|---|---|---|
| גוף הבקשה | 32 MiB (33,554,432 בייטים) | כל endpoint | סטטוס 413, סוג invalid_request_error. |
תקציב פלט: max_tokens, max_completion_tokens, max_output_tokens | 1 עד 65,536. ברירת מחדל 4,096; ב-shannon-coder-1 ב-/v1/chat/completions וב-/v1/messages ברירת המחדל היא 65,536. | כל מודל, כסכום שמופרש מהיתרה שלכם. כמגבלה על אורך התשובה: מודלי ה-open-weight המתארחים, shannon-1.6-lite, shannon-1.6-pro ו-shannon-coder-1. | ערך מחוץ לטווח מועבר לקצה הקרוב של הטווח. בלי שגיאה. |
רצפי עצירה: stop, stop_sequences | 4 מחרוזות | מודלי open-weight מתארחים | משתמשים ב-4 המחרוזות הלא ריקות הראשונות. |
| תמונה או קובץ שניתנו כ-URL | 8 MiB, נקראים בתוך 20 שניות, לכל היותר 5 הפניות, כתובת http או https ציבורית | כל endpoint שמקבל תמונות או קבצים | הבקשה נענית בלי החלק הזה. בלי שגיאה. |
| תמונה או קובץ שנשלחו בתוך הבקשה (base64) | אין מגבלה משלהם. הם נספרים בגוף הבקשה של 32 MiB. | כל endpoint שמקבל תמונות או קבצים | סטטוס 413 לכל הבקשה. |
text של POST /v1/tokenize | 4,000,000 בייטים | /v1/tokenize | סטטוס 413, סוג invalid_request_error, הודעה text too long. |
messages של POST /v1/tokenize וגוף הבקשה של POST /v1/messages/count_tokens | גוף הבקשה של 32 MiB | שני ה-endpoints של הספירה | סטטוס 413. |
| חלון ההקשר | לפי מודל: context_window ב-GET /v1/models | כל מודל | מה קורה לשיחה ארוכה יותר תלוי במודל. מודלים ותמחור |
חיפושים ברשת (web_search: true) | לפי תוכנית ויום: Free 3, Plus 30, Standard 50, Pro 60. חיפוש אחד נספר עבור בקשה שהחיפוש שלה מצא תוצאות. | בקשות שקובעות web_search: true | כשלא נותר חיפוש הבקשה נענית בלי חיפוש. בלי שגיאה. חיפוש ווב מובנה |
שגיאות
התשובות של הדף הזה. ב-/v1/messages אותו אובייקט error עטוף כ-{"type": "error", "error": {…}}.
| סטטוס | סוג | הודעה | מתי, ומה לעשות |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | ההפרשה של הבקשה אינה נכנסת ביתרה שלכם. המתינו ל-00:00 UTC, טענו קרדיט, החליפו תוכנית, או שלחו max_tokens קטן יותר. |
429 | rate_limit_error | Too many requests. Retry in <N>s. | יותר מ-120 בקשות בדקה הנוכחית. המתינו N שניות ושלחו שוב. |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | קריאות Shannon Coder של חלון 4 השעות הנוכחי נוצלו. |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | המודל אינו יכול לקבל את הבקשה ברגע זה. שלחו אותה שוב אחרי הפסקה קצרה. |
503 | api_error | Could not verify your quota right now. Please retry. | לא ניתן היה לקרוא את היתרה שלכם. דבר אינו מחויב; שלחו את הבקשה שוב. ב-/v1/responses עם מודל Shannon הסטטוס הוא 500. |
413 | invalid_request_error | גוף הבקשה גדול מ-32 MiB. ב-endpoints בפורמט OpenAI האובייקט error נושא code: "request_too_large". | |
413 | invalid_request_error | text too long | text של POST /v1/tokenize ארוך מ-4,000,000 בייטים. |