Vision
Bilder und Video zusammen mit Text senden und eine Textantwort erhalten
Talos m1 nimmt multimodale Eingaben entgegen. Sie können Text, Bilder und Video senden, und das Modell antwortet mit Text.
from openai import OpenAI
client = OpenAI(
base_url="https://api.ablatic.ai/v1",
api_key="sk-ablatic-...",
)
resp = client.chat.completions.create(
model="talos",
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "What is in this image?"},
{
"type": "image_url",
"image_url": {"url": "https://example.com/photo.jpg"},
},
],
}
],
)
print(resp.choices[0].message.content)Die Ausgabe ist immer Text. Das Modell erzeugt keine Bilder, kein Audio und kein Video.
Gescannte und abfotografierte PDFs erreichen dasselbe Vision-Modell. Senden Sie das PDF, und Talos rendert die Seiten zu Bildern, sobald die Datei keine Textebene enthält. Siehe Dateien.
OpenAI-Oberfläche
Bei /v1/chat/completions kann eine User-Nachricht eine Liste von Content-Teilen enthalten. Mischen Sie text-Teile mit image_url-Teilen. Der image_url.url-Wert kann eine öffentliche URL oder eine Data-URL sein.
Anthropic-Oberfläche
Bei /v1/messages senden Sie Bild-Content-Blöcke. Jeder Block verwendet eine source, die entweder base64-codierte Bilddaten oder eine URL ist.
import anthropic
client = anthropic.Anthropic(
base_url="https://api.ablatic.ai",
api_key="sk-ablatic-...",
)
msg = client.messages.create(
model="talos",
max_tokens=512,
messages=[
{
"role": "user",
"content": [
{"type": "text", "text": "Describe this image."},
{
"type": "image",
"source": {"type": "url", "url": "https://example.com/photo.jpg"},
},
],
}
],
)
print(msg.content)