Docs
API-Referenz

Messages

Der Messages-Endpunkt im Anthropic-Stil, Parameter, Antwortform und Token-Zählung

POST /v1/messages ist der Endpunkt im Anthropic-Stil. Er ist ein Drop-in für das anthropic SDK und Claude Code.

Request

Authentifizieren Sie sich mit x-api-key: sk-ablatic-.... Die Basis-URL für diese Oberfläche ist https://api.ablatic.ai.

cURL

curl https://api.ablatic.ai/v1/messages \
  -H "x-api-key: $ABLATIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "talos",
    "max_tokens": 1024,
    "messages": [{ "role": "user", "content": "Hello" }]
  }'

Parameter

NameTypErforderlichBeschreibung
modelstringjaModell-id, nicht leer
messagesarrayjaKonversationsnachrichten, 1 bis 200
max_tokensintegerjaMaximale Output-Token, 1 bis 200000
systemstring or arrayneinSystem-Prompt
metadataobjectneinAnfrage-Metadaten
stop_sequencesarrayneinAkzeptiert, aber ignoriert
streambooleanneinStreamt über den Anthropic-SSE-Event-Graph
temperaturenumberneinSampling-Temperatur, 0 bis 2
top_pnumberneinNucleus-Sampling-Schwelle
top_kintegerneinTop-k-Sampling-Schwelle
toolsarrayneinTool-Definitionen. Verwendet input_schema
tool_choiceobjectneinRichtlinie zur Tool-Auswahl
thinkingobjectnein{ "type": ..., "budget_tokens": ... }

Der Modellname wählt den Reasoning-Modus per Teilzeichenkette. Ein Name, der haiku enthält, wählt fast, sonnet und opus thinking (opus mit dem größten Reasoning-Token-Budget). Senden Sie talos für den Standard-Thinking-Modus. Unbekannte Namen wählen thinking.

Response

{
  "id": "msg_...",
  "type": "message",
  "role": "assistant",
  "model": "talos",
  "content": [
    { "type": "text", "text": "Hello. How can I help?" }
  ],
  "stop_reason": "end_turn",
  "stop_sequence": null,
  "usage": {
    "input_tokens": 9,
    "output_tokens": 7,
    "cache_creation_input_tokens": 0,
    "cache_read_input_tokens": 0
  }
}

Das model-Feld gibt das von Ihnen gesendete Modell wieder. usage meldet input_tokens, output_tokens, cache_creation_input_tokens und cache_read_input_tokens.

Verhaltenshinweise

response_format wird auf dieser Oberfläche nicht beachtet. Hier gibt es keine strukturierten Outputs. Für den JSON-Modus verwenden Sie Chat Completions.

  • Prompt-Caching ist real und wird abgerechnet. Der Server cacht Prompt-Präfixe automatisch. Auf dieser Schnittstelle markiert cache_control, welche Präfixe geprimt werden, und formt die usage-Aufschlüsselung passend zu Anthropic. Gecachte Reads werden mit Rabatt berechnet, der erste Write zum normalen Input-Tarif, ohne Aufschlag. Siehe Nutzung und Abrechnung. Bis zu 4 cache_control-Breakpoints werden behalten, weitere werden abgeschnitten.
  • Vorherige thinking-Blöcke im Input werden verworfen.
  • PDF-document-Blöcke werden extrahiert. URL-Dokumente werden nicht abgerufen.

Token zählen

POST /v1/messages/count_tokens liefert eine Schätzung zurück.

{ "input_tokens": 42 }

Die Zählung ist eine Heuristik (etwa Zeichen geteilt durch 4), keine exakte Token-Zählung.

Batches

POST /v1/messages/batches und die zugehörigen Endpunkte führen Anthropic-Message-Batches aus. Der Body ist requests[] aus { custom_id, params }, mit einem Ergebnis-Fenster von 29 Tagen, einem Limit von 100000 Anfragen oder 256 MiB pro Batch und 50 gleichzeitig laufenden pro Nutzer. Sie unterstützen Idempotency-Key, und Ergebnisse streamen als application/x-ndjson, sobald processing_status gleich ended ist. Siehe Batch.

Weiter