ដែនកំណត់ និងសមតុល្យ
រាល់ request ត្រូវបានបម្រើស្មើគ្នា។ គ្មានថ្នាក់អត្រា។ គ្មានកូតា API ដាច់ដោយឡែក។ អ្នកបានបង់ថ្លៃ token របស់អ្នករួចហើយ — សូមប្រើវាឱ្យលឿនតាមដែលអ្នកចង់។
ទំព័រនេះពន្យល់ថាសមតុល្យរបស់អ្នកធ្វើពីអ្វី មួយ request បម្រុង និងមានតម្លៃប៉ុន្មាន អ្នកអាចផ្ញើ request បានប៉ុន្មាន និងដែនកំណត់ពីរបីដែល request តែមួយអាចជួប។
- តម្លៃនៃ 1M token នៃសមតុល្យ
- $5.00
- កូតាប្រចាំថ្ងៃថ្មីឡើងវិញ
- 00:00 UTC
- flood protection ក្នុងមួយគណនី
- 120 request / នាទី
របៀបដែល request ត្រូវបានបម្រើ
- គ្មានថ្នាក់អត្រា — ច្បាប់មួយកំណត់ថា request អាចមកដល់លឿនប៉ុណ្ណា ហើយវាដូចគ្នាសម្រាប់រាល់គណនី និងរាល់គម្រោង៖ 120 request ក្នុងមួយនាទី។ គ្មានដែនកំណត់លើ token ក្នុងមួយនាទីទេ។
- គ្មានកូតា API ដាច់ដោយឡែក — API ចំណាយសមតុល្យដូចគ្នានឹង chat។ គម្រោងកំណត់ទំហំកូតាប្រចាំថ្ងៃ។ វាមិនកំណត់អត្រា request ទេ។
- លឿនតាមដែលអ្នកចង់ — request ដែលផ្ញើស្របគ្នាត្រូវបានទទួលយក ហើយរង់ចាំជាជួរ។ ពួកវាមិនត្រូវបានបដិសេធដោយសារតែស្របគ្នាទេ។
សមតុល្យរបស់អ្នក
សមតុល្យរបស់អ្នកត្រូវបានរាប់ជា token។ សមតុល្យ 1,000,000 token មានតម្លៃ $5.00 ហើយរាល់តម្លៃនៅលើទំព័រ Models & pricing គឺជាអត្រាធៀបនឹងតម្លៃនោះ។
គ្រប់ពេលវេលា សមតុល្យគឺជាផលបូកនៃពីរផ្នែក។
- កូតាគម្រោងប្រចាំថ្ងៃ — ចំនួន token ដែលកំណត់ដោយគម្រោងរបស់អ្នក។ វាថ្មីរៀងរាល់ថ្ងៃនៅម៉ោង 00:00 UTC។ អ្វីដែលនៅសល់នៅចុងថ្ងៃមិនត្រូវបានបន្តទៅថ្ងៃបន្ទាប់ទេ។
- ឥណទានដែលបានទិញ — token ដែលអ្នកបានទិញជាកញ្ចប់។ ឥណទានមិនផុតកំណត់ទេ ហើយប្រើបានលើគ្រប់គម្រោង រួមទាំង Free ផង។
| គម្រោង | token ក្នុងមួយថ្ងៃ | តម្លៃ |
|---|---|---|
| Free | 30,000 | $0.15 |
| Plus | 80,000 | $0.40 |
| Standard | 265,000 | $1.325 |
| Pro | 665,000 | $3.325 |
- លំដាប់នៃការចំណាយ — រាល់ request ចំណាយកូតាគម្រោងប្រចាំថ្ងៃជាមុនសិន។ ឥណទានដែលបានទិញត្រូវបានប្រើតែសម្រាប់ផ្នែកដែលលើសពីកូតានៅថ្ងៃនោះប៉ុណ្ណោះ។
- Chat និង API ប្រើរួមគ្នា — មានសមតុល្យមួយក្នុងមួយគណនី។ API key ចំណាយពីសមតុល្យរបស់គណនីដែលជាម្ចាស់វា ក្នុងតម្លៃដូចគ្នានឹង chat។
- កញ្ចប់ — ឥណទានត្រូវបានលក់ជាកញ្ចប់ 1,000,000 ($5.00), 2,000,000 ($10.00) និង 5,000,000 ($25.00) token ឬជាចំនួនតាមការជ្រើសរើសរបស់អ្នកពី 1,000,000 ដល់ 100,000,000 token ក្នុងតម្លៃ $5.00 ក្នុង 1,000,000។
អ្វីដែល request បម្រុង និងតម្លៃរបស់វា
- បម្រុង — នៅពេល request មកដល់ វាបម្រុង output budget របស់វាពីសមតុល្យរបស់អ្នក៖
max_tokensលើ/v1/chat/completionsនិង/v1/messages,max_output_tokensលើ/v1/responses។/v1/chat/completionsក៏អានmax_completion_tokensដែរ។ លំនាំដើមគឺ 4,096 ហើយដែនគឺពី 1 ដល់ 65,536។ - ទទួលយក — request ត្រូវបានទទួលយកលុះត្រាតែការបម្រុងស្ថិតក្នុងអ្វីដែលនៅសល់នៃសមតុល្យរបស់អ្នក។ សមតុល្យដែលលើសពីសូន្យ ប៉ុន្តែតិចជាង output budget នឹងទទួលបានចម្លើយ
Quota exceeded។ សូមផ្ញើmax_tokensតូចជាងដើម្បីប្រើផ្នែកដែលនៅសល់។ - ទូទាត់ — នៅពេលចម្លើយពេញលេញ ការបម្រុងត្រូវបានជំនួសដោយការគិតថ្លៃពិត។ ការគិតថ្លៃអាចទាបជាង ឬខ្ពស់ជាងការបម្រុង។
- ប្រគល់មកវិញ — request ដែលបញ្ចប់ដោយ error status ប្រគល់ការបម្រុងរបស់វាមកវិញទាំងស្រុង។
ការគិតថ្លៃពិតអាស្រ័យលើក្រុមម៉ូដែល។
| ម៉ូដែល | អ្វីដែលត្រូវគិតថ្លៃ |
|---|---|
| ម៉ូដែល Shannon | usage.total_tokens តាមតម្លៃរបស់ម៉ូដែលក្នុង 1M។ Input និង output មានអត្រាតែមួយ។ |
| ម៉ូដែល open-weight ដែលបង្ហោះ | input ដែលមិនបាន cache តាមអត្រា input, input ដែលបាន cache តាមអត្រា cached, output តាមអត្រា output។ |
ចំនួនជា USD ត្រូវបានយកពីសមតុល្យ token របស់អ្នកក្នុងតម្លៃ $5.00 ក្នុង 1,000,000 ហើយបង្គត់ទៅជា token ទាំងមូល។
ការរាប់ token ជាមួយ POST /v1/tokenize ឬ POST /v1/messages/count_tokens ឥតគិតថ្លៃ ហើយមិនបម្រុងអ្វីទេ។ ការរាប់ token
កន្លែងមើលសមតុល្យ និងការប្រើប្រាស់
ទំព័រ Keys & usage បង្ហាញអ្វីដែលអ្នកអាចចំណាយបានឥឡូវនេះ កូតាគម្រោងប្រចាំថ្ងៃ ឥណទានដែលបានទិញរបស់អ្នក និងការចំណាយ API ក្នុងរយៈពេល 30 ថ្ងៃចុងក្រោយ។ ខាងក្រោមនោះវារាយរាល់ request ដែល key របស់អ្នកបានធ្វើ៖ ម៉ោង endpoint ម៉ូដែល input ដែលបាន cache token ដែលបានគិតថ្លៃ និងតម្លៃ។ Keys & usage
រាល់ចម្លើយក៏មាន object usage ដែលមានចំនួន token នៃការហៅនោះដែរ។
| Endpoint | Field នៃ usage | បន្ថែមដោយម៉ូដែល open-weight ដែលបង្ហោះ |
|---|---|---|
/v1/chat/completions | prompt_tokens, completion_tokens, total_tokens | prompt_tokens_details.cached_tokens, completion_tokens_details.reasoning_tokens |
/v1/messages | input_tokens, output_tokens | cache_read_input_tokens, cache_creation_input_tokens |
/v1/responses | input_tokens, output_tokens, total_tokens | input_tokens_details.cached_tokens, output_tokens_details.reasoning_tokens |
usageមានចំនួន token របស់ម៉ូដែល។ ចំនួនដែលយកពីសមតុល្យរបស់អ្នកមិនស្ថិតក្នុងចម្លើយទេ៖ វាស្ថិតក្នុងជួរឈរ Billed tokens នៃបញ្ជី request នៅ Keys & usage។- លើ
/v1/messagesជាមួយម៉ូដែល open-weight ដែលបង្ហោះinput_tokensគឺជាផ្នែក input ដែលមិនបាន cache,cache_read_input_tokensគឺជាផ្នែកដែលបាន cache ហើយcache_creation_input_tokensគឺ0ជានិច្ច។ - stream លើ
/v1/chat/completionsមានusageក្នុង chunk ចុងក្រោយមុន[DONE]។ ស្ទ្រីម
នៅពេលសមតុល្យអស់
request ដែលការបម្រុងរបស់វាមិនស្ថិតក្នុងសមតុល្យរបស់អ្នក ត្រូវបានឆ្លើយដោយ status 429 ប្រភេទ rate_limit_error និងសារខាងក្រោម។ គ្មានអ្វីត្រូវបានគិតថ្លៃទេ។ ចម្លើយដូចគ្នាត្រូវបានផ្ញើនៅពេលសមតុល្យលើសពីសូន្យ ប៉ុន្តែតិចជាង output budget របស់ request។
{
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Quota exceeded. Upgrade your plan at shannon-ai.com/plan"
}
} លើ /v1/responses object error ក៏អាចមាន code និង param ដែលទាំងពីរជា null។
អ្វីដែលអ្នកអាចធ្វើបាន៖
- រង់ចាំកូតាគម្រោងបន្ទាប់នៅម៉ោង 00:00 UTC។
- បញ្ចូលឥណទាន។ ឥណទានត្រូវបានចំណាយបន្ទាប់ពីកូតាគម្រោង ហើយមិនផុតកំណត់ទេ។ បញ្ចូលឥណទាន
- ប្តូរទៅគម្រោងដែលមានកូតាប្រចាំថ្ងៃធំជាង។ ប្តូរគម្រោង
- ផ្ញើ
max_tokensតូចជាង ប្រសិនបើនៅសល់សមតុល្យខ្លះ៖ ពេលនោះការបម្រុងនឹងតូចជាង។
កូតាការហៅ Shannon Coder
shannon-coder-1 លើ /v1/chat/completions និង /v1/messages ត្រូវបានរាប់ជាការហៅ មិនមែនជា token ទេ។ គ្រប់គម្រោងរួមមានចំនួនការហៅក្នុងមួយចន្លោះ 4 ម៉ោង។ មួយ request គឺមួយការហៅ។
| គម្រោង | ការហៅក្នុងមួយចន្លោះ 4 ម៉ោង |
|---|---|
| Free | 3 |
| Plus | 20 |
| Standard | 40 |
| Pro | 60 |
- ចន្លោះចាប់ផ្តើមនៅ 00:00, 04:00, 08:00, 12:00, 16:00, 20:00 UTC។ ការហៅដែលនៅសល់នៅចុងចន្លោះមិនត្រូវបានបន្តទៅចន្លោះបន្ទាប់ទេ។
- ការហៅត្រូវបានរាប់នៅពេល request ត្រូវបានទទួលយក មុនពេលម៉ូដែលឆ្លើយ។ request ដែលបរាជ័យនៅពេលក្រោយនៅតែរាប់ជាការហៅមួយ។
- ការហៅទាំងនេះមិនបម្រុង token ហើយមិនយកអ្វីពីសមតុល្យរបស់អ្នកទេ។ បញ្ជី request នៅ Keys & usage បង្ហាញចំនួន token របស់ពួកវា និងតម្លៃរបស់វាតាមតម្លៃដែលបានចុះបញ្ជី។
max_tokensលំនាំដើមរបស់shannon-coder-1លើ endpoint ទាំងពីរនេះគឺ 65,536។- នៅពេលគ្មានការហៅនៅសល់ ចម្លើយមាន status
429ប្រភេទrate_limit_errorនិងសារShannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan។ - លើ
/v1/responsesshannon-coder-1គ្មានកូតាការហៅទេ៖ វាត្រូវបានគិតជា token ពីសមតុល្យរបស់អ្នកក្នុងតម្លៃ $8.00 ក្នុង 1M ដូចម៉ូដែលផ្សេងទៀតទាំងអស់។
Flood protection
គណនីអាចផ្ញើ 120 request ក្នុងមួយនាទី។ នោះជាដែនកំណត់តែមួយគត់លើអត្រា request ហើយវាដូចគ្នាលើគ្រប់គម្រោង។ វាមានដើម្បីបញ្ឈប់ការជន់លិច មិនមែនដើម្បីបន្ថយការប្រើប្រាស់ធម្មតាទេ។
- នាទីគឺជាចន្លោះថេរ 60 វិនាទី ដែលបើកជាមួយ request ដំបូងរបស់អ្នក។ នៅពេលវាចប់ ការរាប់ចាប់ផ្តើមឡើងវិញពីសូន្យ។
- ការរាប់គឺតាមគណនី មិនមែនតាម key ឬតាមអាសយដ្ឋាន IP ទេ។ ការប្តូរ key មិនបើកចន្លោះថ្មីទេ។
- request លេខ 121 ក្នុងចន្លោះមួយត្រូវបានឆ្លើយដោយ status
429ប្រភេទrate_limit_errorនិងសារToo many requests. Retry in <N>s.Nគឺជាចំនួនវិនាទីរហូតដល់ចន្លោះចប់ ពី 1 ដល់ 60។ - Flood protection ត្រូវបានពិនិត្យមុនសមតុល្យ។ request ដែលវាបដិសេធមិនបម្រុងអ្វី ហើយមិនគិតថ្លៃទេ។
{
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} {
"type": "error",
"error": {
"type": "rate_limit_error",
"message": "Too many requests. Retry in 37s."
}
} | Request | Flood protection |
|---|---|
POST /v1/chat/completions, POST /v1/messages, POST /v1/responses | ត្រូវបានរាប់ មួយក្នុងមួយ request។ |
GET /v1/models, POST /v1/tokenize, POST /v1/messages/count_tokens | មិនត្រូវបានរាប់។ |
shannon-coder-1 លើ /v1/chat/completions និង /v1/messages | ត្រូវបានរាប់ដោយកូតាការហៅ Shannon Coder ជំនួសវិញ។ |
request ដែលត្រូវបានឆ្លើយដោយ 401 ឬដោយ 400 សម្រាប់ model ដែលមិនស្គាល់ | មិនត្រូវបានរាប់។ |
| request ដែលត្រូវបានបដិសេធដោយ flood protection | ត្រូវបានរាប់ចូលក្នុងចន្លោះ។ គ្មានអ្វីត្រូវបានគិតថ្លៃទេ។ |
Request ស្របគ្នា
គ្មានដែនកំណត់លើចំនួន request ដែលគណនីមួយអាចបើកក្នុងពេលតែមួយទេ ហើយក៏គ្មាន error សម្រាប់ការផ្ញើ request ស្របគ្នាដែរ។ request ដែលមិនអាចចាប់ផ្តើមភ្លាមៗរង់ចាំជាជួរ ហើយត្រូវបានឆ្លើយតាមវេន។
- រាល់ request រាប់ចូលក្នុង 120 ក្នុងមួយនាទីនៅពេលវាមកដល់ ទោះ request មុនៗចប់ហើយឬមិនទាន់។
- រាល់ request កាន់ការបម្រុងផ្ទាល់ខ្លួនរហូតដល់វាចប់។ request ម្ភៃដែលបើកជាមួយ output budget លំនាំដើមកាន់ 20 × 4,096 = 81,920 token នៃសមតុល្យ។ ប្រសិនបើការបម្រុងទាំងអស់រួមគ្នាធំជាងសមតុល្យរបស់អ្នក request បន្ទាប់នឹងទទួលបានចម្លើយ
Quota exceededទោះបីការហៅដែលបានបញ្ចប់ត្រូវចំណាយតិចជាងក៏ដោយ។max_tokensតូចជាងកាន់តិចជាង។ - request ដែលគ្មាន streaming មិនផ្ញើអ្វីទេរហូតដល់ចម្លើយពេញលេញ ដូច្នេះសូមកំណត់ timeout ឱ្យ client របស់អ្នកដែលគ្របដណ្តប់ការរង់ចាំ។ stream រក្សាការតភ្ជាប់បើកខណៈពេលវារង់ចាំ។ ស្ទ្រីម
ដែនកំណត់នៃ request តែមួយ
| ដែនកំណត់ | តម្លៃ | អនុវត្តចំពោះ | ពេលដល់ដែនកំណត់ |
|---|---|---|---|
| ខ្លឹមសារ request | 32 MiB (33,554,432 byte) | គ្រប់ endpoint | Status 413 ប្រភេទ invalid_request_error។ |
Output budget៖ max_tokens, max_completion_tokens, max_output_tokens | 1 ដល់ 65,536។ លំនាំដើម 4,096៖ សម្រាប់ shannon-coder-1 លើ /v1/chat/completions និង /v1/messages លំនាំដើមគឺ 65,536។ | គ្រប់ម៉ូដែល ជាចំនួនដែលត្រូវបម្រុងពីសមតុល្យរបស់អ្នក។ ជាដែនកំណត់លើប្រវែងចម្លើយ៖ ម៉ូដែល open-weight ដែលបង្ហោះ, shannon-1.6-lite, shannon-1.6-pro និង shannon-coder-1។ | តម្លៃក្រៅដែនត្រូវបានរំកិលទៅចុងដែនដែលជិតបំផុត។ គ្មាន error។ |
Stop sequence៖ stop, stop_sequences | 4 string | ម៉ូដែល open-weight ដែលបង្ហោះ | string មិនទទេ 4 ដំបូងត្រូវបានប្រើ។ |
| រូបភាព ឬឯកសារដែលផ្តល់ជា URL | 8 MiB អានក្នុងរយៈពេល 20 វិនាទី redirect ច្រើនបំផុត 5 អាសយដ្ឋាន http ឬ https សាធារណៈ | គ្រប់ endpoint ដែលទទួលរូបភាព ឬឯកសារ | request ត្រូវបានឆ្លើយដោយគ្មានផ្នែកនោះ។ គ្មាន error។ |
| រូបភាព ឬឯកសារដែលផ្ញើជា inline (base64) | គ្មានដែនកំណត់ផ្ទាល់ខ្លួនទេ។ វារាប់ចូលក្នុងខ្លឹមសារ request 32 MiB។ | គ្រប់ endpoint ដែលទទួលរូបភាព ឬឯកសារ | Status 413 សម្រាប់ request ទាំងមូល។ |
text នៃ POST /v1/tokenize | 4,000,000 byte | /v1/tokenize | Status 413 ប្រភេទ invalid_request_error សារ text too long។ |
messages នៃ POST /v1/tokenize និងខ្លឹមសារនៃ POST /v1/messages/count_tokens | ខ្លឹមសារ request 32 MiB | endpoint រាប់ទាំងពីរ | Status 413។ |
| Context window | តាមម៉ូដែល៖ context_window ក្នុង GET /v1/models | គ្រប់ម៉ូដែល | អ្វីដែលកើតឡើងចំពោះការសន្ទនាវែងជាងនេះអាស្រ័យលើម៉ូដែល។ ម៉ូដែល និងតម្លៃ |
ការស្វែងរកវេប (web_search: true) | តាមគម្រោង និងថ្ងៃ៖ Free 3, Plus 30, Standard 50, Pro 60។ ការស្វែងរកមួយត្រូវបានរាប់សម្រាប់ request ដែលការស្វែងរករបស់វាបានរកឃើញលទ្ធផល។ | request ដែលកំណត់ web_search: true | នៅពេលគ្មានសល់ request ត្រូវបានឆ្លើយដោយគ្មានការស្វែងរក។ គ្មាន error។ ស្វែងរកវេបក្នុងស្រាប់ |
កំហុស
ចម្លើយនៃទំព័រនេះ។ លើ /v1/messages object error ដូចគ្នាត្រូវបានរុំជា {"type": "error", "error": {…}}។
| ស្ថានភាព | ប្រភេទ | សារ | ពេលណា និងត្រូវធ្វើអ្វី |
|---|---|---|---|
429 | rate_limit_error | Quota exceeded. Upgrade your plan at shannon-ai.com/plan | ការបម្រុងរបស់ request មិនស្ថិតក្នុងសមតុល្យរបស់អ្នកទេ។ សូមរង់ចាំដល់ 00:00 UTC, បញ្ចូលឥណទាន, ប្តូរគម្រោង ឬផ្ញើ max_tokens តូចជាង។ |
429 | rate_limit_error | Too many requests. Retry in <N>s. | លើសពី 120 request ក្នុងនាទីបច្ចុប្បន្ន។ សូមរង់ចាំ N វិនាទី ហើយផ្ញើម្តងទៀត។ |
429 | rate_limit_error | Shannon Coder call quota reached. Upgrade your plan at shannon-ai.com/plan | ការហៅ Shannon Coder នៃចន្លោះ 4 ម៉ោងបច្ចុប្បន្នត្រូវបានប្រើអស់។ |
429 | rate_limit_error | Shannon routes are temporarily busy. Please retry. | ម៉ូដែលមិនអាចទទួល request បានក្នុងពេលនេះទេ។ សូមផ្ញើវាម្តងទៀតបន្ទាប់ពីផ្អាកមួយភ្លែត។ |
503 | api_error | Could not verify your quota right now. Please retry. | មិនអាចអានសមតុល្យរបស់អ្នកបានទេ។ គ្មានអ្វីត្រូវបានគិតថ្លៃទេ សូមផ្ញើ request ម្តងទៀត។ លើ /v1/responses ជាមួយម៉ូដែល Shannon status គឺ 500។ |
413 | invalid_request_error | ខ្លឹមសារ request ធំជាង 32 MiB។ លើ endpoint ទ្រង់ទ្រាយ OpenAI object error មាន code: "request_too_large"។ | |
413 | invalid_request_error | text too long | text នៃ POST /v1/tokenize វែងជាង 4,000,000 byte។ |