Reasoning und Thinking
Wie Talos vor der Antwort schlussfolgert und warum Sie ein großzügiges max_tokens setzen sollten
Talos ist ein Reasoning-Modell. Bevor es die Antwort schreibt, arbeitet es das Problem intern durch. Standardmäßig läuft talos im Thinking-Modus, die meisten Anfragen schlussfolgern also zuerst und antworten dann.
Wohin das Reasoning geht
Die sichtbare Antwort bleibt sauber. Das Modell hält sein Reasoning getrennt vom zurückgegebenen Inhalt, daher enthält choices[0].message.content nur die Antwort, nicht das Denken, das sie erzeugt hat.
Wenn Reasoning läuft, kann die API die Reasoning-Spur separat in reasoning_content zurückgeben, und das usage-Objekt meldet einen reasoning_tokens-Wert. Lesen Sie diese, wenn Sie die Spur möchten. Ignorieren Sie sie, erhalten Sie dennoch eine saubere Antwort in content.
Setzen Sie ein großzügiges max_tokens
Thinking verbraucht Output-Token. Jeder Reasoning-Modus reserviert ein Mindest-Generierungsbudget, daher schöpfen Reasoning und Antwort beide aus dem max_tokens, das Sie setzen. Setzen Sie es hoch genug, damit das Reasoning abschließen kann, sonst schlägt die Anfrage mit einem Fehler fehl, statt eine unvollständige Antwort zurückzugeben.
Bemessen Sie max_tokens nach dem Effort:
- fast und low/medium-thinking: setzen Sie es großzügig, einige Hundert Token oder mehr, damit die Antwort nach dem Reasoning Platz hat.
- hoher Effort (
high/xhigh/max): setzen Sie es hoch, 1024 oder mehr. Höherer Effort hebt das Reasoning-Token-Budget an, das Modell kann also länger schlussfolgern, läuft langsamer und hält einen Slot für gleichzeitige Anfragen länger. Rechnen Sie mit der höheren Latenz.
Sie wählen Modus und Tiefe über reasoning_effort, nicht durch einen Modellwechsel. Dieselbe max_tokens-Empfehlung gilt für den jeweils gewählten Effort — max_tokens begrenzt das tatsächliche Reasoning, ein kleines max_tokens bei hohem Effort hält das Reasoning also trotzdem kurz.
from openai import OpenAI
client = OpenAI(
base_url="https://api.ablatic.ai/v1",
api_key="sk-ablatic-...",
)
resp = client.chat.completions.create(
model="talos",
messages=[{"role": "user", "content": "Plan a three-day trip to Vienna."}],
max_tokens=4096, # Platz für Reasoning und Antwort lassen
)
print(resp.choices[0].message.content)Auf der Anthropic-Schnittstelle ist max_tokens erforderlich, und es gilt dieselbe Empfehlung: bemessen Sie es für Reasoning und Antwort zusammen.
Wählen Sie, wie viel das Modell schlussfolgert
Nutzen Sie reasoning_effort, um die Tiefe zu setzen: none oder minimal für Fast (kein Reasoning), low für knappes Thinking, medium für den Standard, und high (oder xhigh/max), um das Reasoning-Token-Budget anzuheben. low verkürzt das Reasoning messbar; Effort über medium hebt die Decke an, statt den Modus zu wechseln. Die vollständige Zuordnung finden Sie unter Modelle.