Obrazy i pliki
Wysyłaj obrazy z wiadomością: które modele je przyjmują, akceptowane formy i ich limity.
POST https://api.shannon-ai.com/v1/chat/completions
Obraz podróżuje wewnątrz wiadomości użytkownika, jako jedna część jej content. Przykład czyta lokalny plik i wysyła go jako data URL.
import base64
from openai import OpenAI
client = OpenAI(api_key="YOUR_API_KEY", base_url="https://api.shannon-ai.com/v1")
with open("photo.jpg", "rb") as f:
image = base64.b64encode(f.read()).decode()
response = client.chat.completions.create(
model="shannon-3",
messages=[{
"role": "user",
"content": [
{"type": "text", "text": "What is in this picture?"},
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64," + image}},
],
}],
)
print(response.choices[0].message.content) import fs from "node:fs";
import OpenAI from "openai";
const client = new OpenAI({ apiKey: "YOUR_API_KEY", baseURL: "https://api.shannon-ai.com/v1" });
const image = fs.readFileSync("photo.jpg").toString("base64");
const response = await client.chat.completions.create({
model: "shannon-3",
messages: [{
role: "user",
content: [
{ type: "text", text: "What is in this picture?" },
{ type: "image_url", image_url: { url: "data:image/jpeg;base64," + image } },
],
}],
});
console.log(response.choices[0].message.content); # Linux: base64 -w0 photo.jpg macOS: base64 -i photo.jpg
IMAGE=$(base64 -w0 photo.jpg)
curl https://api.shannon-ai.com/v1/chat/completions \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d @- <<EOF
{
"model": "shannon-3",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "What is in this picture?"},
{"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,${IMAGE}"}}
]
}]
}
EOF {
"id": "chatcmpl-8d1f3a5c7e9b4d2f6a8c0e2b4d6f8a1c",
"object": "chat.completion",
"created": 1791590400,
"model": "shannon-3",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "A grey cat asleep on a windowsill, with a potted fern beside it.",
"reasoning_content": null
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 286,
"completion_tokens": 19,
"total_tokens": 305
}
} Które modele przyjmują obrazy
| Modele | Czyta |
|---|---|
shannon-3, shannon-3-pro, shannon-3.1, shannon-3.1-pro | Obrazy oraz dokumenty: PDF, Word, PowerPoint, Excel i pliki zwykłego tekstu. |
shannon-1.6-lite, shannon-1.6-pro | Obrazy. |
shannon-2-lite, shannon-2-pro | Obrazy, w zapytaniach, które wysyłają też tools lub response_format. |
Kimi-K3-3BIT-REAP, MiniMax-M3-3BIT-REAP, Kimi-K2.6-W4A16-AUTOROUND-REAP, inkling-W4A16-AUTOROUND-REAP, MiMo-V2.5-W8A16 | Obrazy. |
DeepSeek-V4-Pro-0813-3BIT-REAP, GLM-5.2-3BIT-REAP, Nemotron3Ultra-3BIT-REAP, DeepSeek-V4-Flash-0731-W4A16-AUTOROUND-REAP, Laguna-S-2.1-W4A16-AUTOROUND-REAP, MiMo-V2.5-Pro-W8A16, Hy3-W8A16 | Tekst. Zapytanie z obrazem dostaje odpowiedź ze statusem 400. |
shannon-coder-1 | Tekst. |
GET /v1/models raportuje obraz na wejściu dla każdego id jako capabilities.vision. Modele i ceny
- Modele Shannon czytają pliki z ostatniej wiadomości użytkownika. Umieść obraz w wiadomości, która o niego pyta.
- Rodzina Shannon 3 zachowuje też w widoku kilka obrazów i dokumentów z wcześniejszych wiadomości użytkownika, jeśli wysłano je inline, i czyta określoną maksymalną liczbę obrazów na zapytanie, licząc od pierwszego.
- Hostowane modele open-weight czytają obrazy z każdej wiadomości rozmowy.
Akceptowane formy
Plik wysyła się na jeden z dwóch sposobów: w zapytaniu jako base64 albo jako adres, który API pobiera. Każdy plik podróżuje razem z zapytaniem; API nie ma endpointu do przesyłania plików.
| Endpoint | W zapytaniu (base64) | Przez adres |
|---|---|---|
/v1/chat/completions | {"type": "image_url", "image_url": {"url": "data:image/jpeg;base64,…"}} | {"type": "image_url", "image_url": {"url": "https://…"}} |
/v1/responses | {"type": "input_image", "image_url": "data:image/jpeg;base64,…"} | {"type": "input_image", "image_url": "https://…"} |
/v1/messages | {"type": "image", "source": {"type": "base64", "media_type": "image/jpeg", "data": "…"}} | {"type": "image", "source": {"type": "url", "url": "https://…"}} |
Ta sama wiadomość użytkownika w każdym formacie:
{
"role": "user",
"content": [
{"type": "text", "text": "What is in this picture?"},
{
"type": "image_url",
"image_url": {
"url": "data:image/jpeg;base64,/9j/4AAQSkZJRgABAQAAAQABAAD…"
}
}
]
} {
"role": "user",
"content": [
{"type": "input_text", "text": "What is in this picture?"},
{
"type": "input_image",
"image_url": "data:image/jpeg;base64,/9j/4AAQSkZJRgABAQAAAQABAAD…"
}
]
} {
"role": "user",
"content": [
{"type": "text", "text": "What is in this picture?"},
{
"type": "image",
"source": {
"type": "base64",
"media_type": "image/jpeg",
"data": "/9j/4AAQSkZJRgABAQAAAQABAAD…"
}
}
]
} - Data URL ma postać
data:<media type>;base64,<data>. Część;base64jest wymagana. - W
/v1/chat/completionsi/v1/responsesimage_urlmoże być samym ciągiem albo obiektem{"url": "…"}. - Typ pliku pochodzi z data URL lub z
media_type. Bez niego obraz jest czytany jakoimage/png. - Pliki wbudowane liczą się do rozmiaru treści zapytania, która może mieć do 32 MiB.
- Akceptowane dla zgodności:
image_url.detail.
Limity dla plików zdalnych
Gdy wysyłasz adres, API pobiera plik przed uruchomieniem modelu, w następujących granicach:
| Limit | Zasada |
|---|---|
| Rozmiar | Do 8 MiB na plik. |
| Czas | 20 sekund na odpowiedź. |
| Przekierowania | Najwyżej 5. |
| Adres | http:// lub https://, bez nazwy użytkownika i hasła w adresie, na hoście z adresem publicznym. |
| Odpowiedź hosta | Status z zakresu 200 i niepusta treść. Typ pliku jest odczytywany z Content-Type. |
| Żądane jako | User-Agent: ShannonBot/1.0 (+https://shannon-ai.com) |
Jak obrazy liczą się w tokenach
W hostowanych modelach open-weight obraz liczy się jako jeden token na każdy fragment 28 × 28 pikseli: szerokość podzielona przez 28 i zaokrąglona w górę, razy wysokość podzielona przez 28 i zaokrąglona w górę. Wynik wchodzi do usage.prompt_tokens i jest rozliczany jako wejście.
- 1024 × 1024
- 1,369 tokenów
- 1920 × 1080
- 2,691 tokenów
- 512 × 512
- 361 tokenów
- Obraz zdalny jest najpierw pobierany, więc liczy się jego rzeczywisty rozmiar.
- Obraz, którego rozmiaru nie da się odczytać, liczy się jako 1,024 tokenów.
- Endpointy liczące stosują tę samą regułę dla data URL. Nie pobierają adresu zdalnego i liczą go jako 1,024 tokenów. Liczenie tokenów
- W modelu Shannon koszt zapytania z obrazami odczytasz z
usagew odpowiedzi.
Dokumenty i inne pliki
Rodzina Shannon 3 (shannon-3, shannon-3-pro, shannon-3.1, shannon-3.1-pro) czyta także dokumenty. Tekst dokumentu jest wyodrębniany i przekazywany modelowi razem z Twoją wiadomością.
| Dokument | Typ nośnika |
|---|---|
application/pdf | |
| Word | application/vnd.openxmlformats-officedocument.wordprocessingml.document |
| PowerPoint | application/vnd.openxmlformats-officedocument.presentationml.presentation |
| Excel | application/vnd.openxmlformats-officedocument.spreadsheetml.sheet |
Dokument jest częścią wiadomości użytkownika, tak jak obraz:
| Endpoint | W zapytaniu (base64) | Przez adres |
|---|---|---|
/v1/chat/completions, /v1/messages | {"type": "document", "source": {"type": "base64", "media_type": "application/pdf", "data": "…"}} | {"type": "document", "source": {"type": "url", "url": "https://…"}} |
/v1/responses | {"type": "input_file", "file_data": "data:application/pdf;base64,…"} | {"type": "input_file", "file_url": "https://…"} |
{
"model": "shannon-3",
"messages": [
{
"role": "user",
"content": [
{
"type": "document",
"source": {
"type": "base64",
"media_type": "application/pdf",
"data": "JVBERi0xLjcKJeLjz9MK…"
}
},
{"type": "text", "text": "Summarise this report in five points."}
]
}
]
} {
"model": "shannon-3",
"input": [
{
"role": "user",
"content": [
{
"type": "input_file",
"file_data": "data:application/pdf;base64,JVBERi0xLjcKJeLjz9MK…"
},
{
"type": "input_text",
"text": "Summarise this report in five points."
}
]
}
]
} {
"model": "shannon-3",
"messages": [
{
"role": "user",
"content": [
{
"type": "document",
"source": {
"type": "base64",
"media_type": "application/pdf",
"data": "JVBERi0xLjcKJeLjz9MK…"
}
},
{"type": "text", "text": "Summarise this report in five points."}
]
}
]
} - Podaj prawdziwy typ nośnika pliku. Bez niego dokument jest czytany jako
application/pdf. - Plik zwykłego tekstu, taki jak CSV, jest czytany jako tekst i dołączany w ten sam sposób.
- Gdy dokumentu nie da się odczytać albo plik jest innego typu, model zostaje o tym poinformowany i może to powiedzieć w odpowiedzi. Status nadal wynosi
200. - W każdym innym modelu część z dokumentem jest pomijana w tym, co model czyta, a odpowiedź powstaje z reszty zapytania.
- Dokument wysłany przez adres jest pobierany z zachowaniem limitów dla plików zdalnych powyżej.
Błędy
| Status | Typ | Komunikat | Kiedy |
|---|---|---|---|
400 | invalid_request_error | <id> does not accept image input | Obraz wysłano do hostowanego modelu open-weight, który przyjmuje tylko tekst. Z Twojego salda nic nie jest pobierane. |
400 | invalid_request_error | audio and video input are not supported by any hosted model | Część audio lub wideo wysłano do hostowanego modelu open-weight. |
413 | invalid_request_error | Failed to buffer the request body: … | Treść zapytania wraz z plikami wbudowanymi jest większa niż 32 MiB. Błąd niesie code: "request_too_large". |
Model Shannon odpowiada ze statusem 200 niezależnie od plików, które niesie zapytanie: część, której nie czyta, jest pomijana. Obsługa błędów