Docs
API-Referenz

Chat Completions

Der Chat-Completion-Endpunkt im OpenAI-Stil, Anfrageparameter und Antwortform

POST /v1/chat/completions ist der Chat-Endpunkt im OpenAI-Stil. Er akzeptiert das offizielle openai SDK unverändert.

Request

Authentifizieren Sie sich mit Authorization: Bearer sk-ablatic-....

cURL

curl https://api.ablatic.ai/v1/chat/completions \
  -H "Authorization: Bearer $ABLATIC_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "talos",
    "messages": [{ "role": "user", "content": "Hello" }]
  }'

Parameter

NameTypErforderlichBeschreibung
modelstringneinModell-id. Standard talos. Siehe Models
messagesarrayjaKonversationsnachrichten, 1 bis 2000
streambooleanneinStreamt Token über SSE, endend mit data: [DONE]
temperaturenumberneinSampling-Temperatur, 0 bis 2
max_tokensintegerneinMaximale Output-Token, 1 bis 200000
top_pnumberneinNucleus-Sampling-Schwelle
toolsarrayneinTool-Definitionen. Verwendet function.parameters
tool_choicestring or objectneinRichtlinie zur Tool-Auswahl
response_formatobjectneinEines von text, json_object, json_schema
reasoning_effortstringneinReasoning-Tiefe. none/minimal zu fast, low zu knappem thinking, medium (Standard) zu thinking, high/xhigh/max zu thinking mit größerem Reasoning-Token-Budget
max_reasoning_tokensintegerneinObergrenze für Reasoning-Token, 0 bis 200000
session_idstringneinFasst Anfragen zu einer Sitzung zusammen
glassboxobjectneinAktiviert Glassbox-Trace und Confidence
refusal_modestringneinEines von soft, strict

Modus und Tiefe werden über reasoning_effort gesetzt. Lassen Sie ihn weg, ist der Standard medium (thinking). Für die geringste Latenz senden Sie reasoning_effort mit none; für das kürzeste Reasoning bei aktivem Thinking senden Sie low. Siehe Reasoning-Modi. Beim Streamen kommt die Reasoning-Spur in delta.reasoning_content, getrennt von delta.content.

Response

Die Antwort ist ein chat.completion-Objekt.

{
  "id": "chatcmpl-...",
  "object": "chat.completion",
  "created": 1744761600,
  "model": "talos-thinking",
  "choices": [
    {
      "index": 0,
      "message": {
        "role": "assistant",
        "content": "Hello. How can I help?"
      },
      "finish_reason": "stop"
    }
  ],
  "usage": {
    "prompt_tokens": 9,
    "completion_tokens": 7,
    "total_tokens": 16,
    "reasoning_tokens": 0
  }
}

Das model-Feld der Antwort gibt den aufgelösten Modus als talos-<mode> wieder. usage trägt prompt_tokens, completion_tokens, total_tokens und reasoning_tokens, wenn Reasoning lief. reasoning_tokens zählt Token, die bereits in completion_tokens enthalten sind, addieren Sie beide also nie.

finish_reason

WertBedeutung
stopDas Modell hat seine Antwort abgeschlossen
lengthDer Output hat max_tokens erreicht, oder das Modell hat sein ganzes Budget im Reasoning verbraucht, ohne zu antworten
tool_callsDas Modell hat ein oder mehrere Tools aufgerufen. Siehe Function Calling
low_confidenceNur mit Glassbox. Confidence lag unter Ihrem Schwellwert
abstainedNur mit Glassbox. Confidence lag unter der harten Grenze

Erweiterungsfelder

Diese nicht standardmäßigen Felder erscheinen neben dem Standardobjekt.

FeldBeschreibung
talos_traceGlassbox-Trace-Objekt. Nur vorhanden, wenn Sie Glassbox aktivieren, sonst weggelassen
talos_complexityKomplexitäts-Signalobjekt. Immer vorhanden
session_idGibt die von Ihnen gesendete session_id wieder. Nur vorhanden, wenn Sie eine gesendet haben

Glassbox und Confidence sind opt-in und standardmäßig deaktiviert. Wenn deaktiviert, ist talos_trace.confidence gleich null. Verlassen Sie sich nicht auf Live-Confidence-Werte.

Die Antwort trägt einen X-Request-Id-Header. Geben Sie ihn in Support-Tickets an.

Weiter