Textgenerierung
Chat Completions mit Talos m1 erzeugen
Senden Sie eine Liste von Nachrichten und erhalten Sie mit POST /v1/chat/completions eine Textantwort.
from openai import OpenAI
client = OpenAI(
base_url="https://api.ablatic.ai/v1",
api_key="sk-ablatic-...",
)
resp = client.chat.completions.create(
model="talos",
messages=[
{"role": "system", "content": "You are a concise assistant."},
{"role": "user", "content": "Name three rivers in Austria."},
],
temperature=0.7,
max_tokens=512,
)
print(resp.choices[0].message.content)Messages
Das messages-Array enthält die Konversation. Jedes Element hat ein role- und ein content-Feld. Es werden drei Rollen verwendet:
systemlegt Verhalten und Anweisungen für das Modell fest.userist der Mensch-Turn.assistantist ein vorheriger Modell-Turn, den Sie einbinden, um eine Konversation fortzusetzen.
Sie können 1 bis 200 Nachrichten senden. Das vollständige Kontextfenster umfasst 200000 Token.
Parameter
| Parameter | Typ | Hinweise |
|---|---|---|
model | string | Standardwert talos. |
messages | array | Erforderlich. 1 bis 200 Elemente. |
temperature | number | 0 bis 2. Höher bedeutet zufälliger. |
max_tokens | integer | 1 bis 200000. Begrenzt die erzeugte Antwort. |
top_p | number | Nucleus-Sampling. |
reasoning_effort | string | none/minimal (fast), low (knappes thinking), medium (thinking), high/xhigh/max (thinking, größeres Reasoning-Budget). |
Reasoning Effort
talos läuft standardmäßig im Thinking-Modus. Das Feld reasoning_effort steuert, wie viel das Modell vor der Antwort schlussfolgert: none und minimal entsprechen fast, low knappem thinking, medium thinking, und high (sowie xhigh/max) heben das Reasoning-Token-Budget an. Wenn Sie reasoning_effort weglassen, läuft die Anfrage im Thinking-Modus, nicht auf dem schnellsten Pfad.
Für die niedrigste Latenz setzen Sie reasoning_effort auf none, wodurch der Fast-Modus gewählt wird.
resp = client.chat.completions.create(
model="talos",
reasoning_effort="none",
messages=[{"role": "user", "content": "Give me a one-line summary."}],
)Thinking verbraucht Output-Token, setzen Sie max_tokens also hoch genug, damit das Reasoning abschließen kann. Ein zu kleiner Wert schlägt mit einem Fehler fehl, statt eine unvollständige Antwort zurückzugeben. Nutzen Sie ein großes max_tokens (1024 oder mehr) für hohen Effort (high/xhigh/max), der länger schlussfolgert und langsamer läuft. Siehe Reasoning.
Response
Die Antwort ist ein chat.completion-Objekt. Der Antworttext steht in choices[0].message.content. Das usage-Objekt meldet prompt_tokens, completion_tokens und total_tokens. Ein reasoning_tokens-Wert erscheint, wenn das Modell schlussfolgert.