Docs
Funktionen

Textgenerierung

Chat Completions mit Talos m1 erzeugen

Senden Sie eine Liste von Nachrichten und erhalten Sie mit POST /v1/chat/completions eine Textantwort.

from openai import OpenAI

client = OpenAI(
    base_url="https://api.ablatic.ai/v1",
    api_key="sk-ablatic-...",
)

resp = client.chat.completions.create(
    model="talos",
    messages=[
        {"role": "system", "content": "You are a concise assistant."},
        {"role": "user", "content": "Name three rivers in Austria."},
    ],
    temperature=0.7,
    max_tokens=512,
)
print(resp.choices[0].message.content)

Messages

Das messages-Array enthält die Konversation. Jedes Element hat ein role- und ein content-Feld. Es werden drei Rollen verwendet:

  • system legt Verhalten und Anweisungen für das Modell fest.
  • user ist der Mensch-Turn.
  • assistant ist ein vorheriger Modell-Turn, den Sie einbinden, um eine Konversation fortzusetzen.

Sie können 1 bis 200 Nachrichten senden. Das vollständige Kontextfenster umfasst 200000 Token.

Parameter

ParameterTypHinweise
modelstringStandardwert talos.
messagesarrayErforderlich. 1 bis 200 Elemente.
temperaturenumber0 bis 2. Höher bedeutet zufälliger.
max_tokensinteger1 bis 200000. Begrenzt die erzeugte Antwort.
top_pnumberNucleus-Sampling.
reasoning_effortstringnone/minimal (fast), low (knappes thinking), medium (thinking), high/xhigh/max (thinking, größeres Reasoning-Budget).

Reasoning Effort

talos läuft standardmäßig im Thinking-Modus. Das Feld reasoning_effort steuert, wie viel das Modell vor der Antwort schlussfolgert: none und minimal entsprechen fast, low knappem thinking, medium thinking, und high (sowie xhigh/max) heben das Reasoning-Token-Budget an. Wenn Sie reasoning_effort weglassen, läuft die Anfrage im Thinking-Modus, nicht auf dem schnellsten Pfad.

Für die niedrigste Latenz setzen Sie reasoning_effort auf none, wodurch der Fast-Modus gewählt wird.

resp = client.chat.completions.create(
    model="talos",
    reasoning_effort="none",
    messages=[{"role": "user", "content": "Give me a one-line summary."}],
)

Thinking verbraucht Output-Token, setzen Sie max_tokens also hoch genug, damit das Reasoning abschließen kann. Ein zu kleiner Wert schlägt mit einem Fehler fehl, statt eine unvollständige Antwort zurückzugeben. Nutzen Sie ein großes max_tokens (1024 oder mehr) für hohen Effort (high/xhigh/max), der länger schlussfolgert und langsamer läuft. Siehe Reasoning.

Response

Die Antwort ist ein chat.completion-Objekt. Der Antworttext steht in choices[0].message.content. Das usage-Objekt meldet prompt_tokens, completion_tokens und total_tokens. Ein reasoning_tokens-Wert erscheint, wenn das Modell schlussfolgert.

Nächste Schritte