Messages
Der Messages-Endpunkt im Anthropic-Stil, Parameter, Antwortform und Token-Zählung
POST /v1/messages ist der Endpunkt im Anthropic-Stil. Er ist ein Drop-in für das anthropic SDK und Claude Code.
Request
Authentifizieren Sie sich mit x-api-key: sk-ablatic-.... Die Basis-URL für diese Oberfläche ist https://api.ablatic.ai.
cURL
curl https://api.ablatic.ai/v1/messages \
-H "x-api-key: $ABLATIC_API_KEY" \
-H "anthropic-version: 2023-06-01" \
-H "Content-Type: application/json" \
-d '{
"model": "talos",
"max_tokens": 1024,
"messages": [{ "role": "user", "content": "Hello" }]
}'Parameter
| Name | Typ | Erforderlich | Beschreibung |
|---|---|---|---|
model | string | ja | Modell-id, nicht leer |
messages | array | ja | Konversationsnachrichten, 1 bis 200 |
max_tokens | integer | ja | Maximale Output-Token, 1 bis 200000 |
system | string or array | nein | System-Prompt |
metadata | object | nein | Anfrage-Metadaten |
stop_sequences | array | nein | Akzeptiert, aber ignoriert |
stream | boolean | nein | Streamt über den Anthropic-SSE-Event-Graph |
temperature | number | nein | Sampling-Temperatur, 0 bis 2 |
top_p | number | nein | Nucleus-Sampling-Schwelle |
top_k | integer | nein | Top-k-Sampling-Schwelle |
tools | array | nein | Tool-Definitionen. Verwendet input_schema |
tool_choice | object | nein | Richtlinie zur Tool-Auswahl |
thinking | object | nein | { "type": ..., "budget_tokens": ... } |
Der Modellname wählt den Reasoning-Modus per Teilzeichenkette. Ein Name, der haiku enthält, wählt fast, sonnet und opus thinking (opus mit dem größten Reasoning-Token-Budget). Senden Sie talos für den Standard-Thinking-Modus. Unbekannte Namen wählen thinking.
Response
{
"id": "msg_...",
"type": "message",
"role": "assistant",
"model": "talos",
"content": [
{ "type": "text", "text": "Hello. How can I help?" }
],
"stop_reason": "end_turn",
"stop_sequence": null,
"usage": {
"input_tokens": 9,
"output_tokens": 7,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0
}
}Das model-Feld gibt das von Ihnen gesendete Modell wieder. usage meldet input_tokens, output_tokens, cache_creation_input_tokens und cache_read_input_tokens.
Verhaltenshinweise
response_format wird auf dieser Oberfläche nicht beachtet. Hier gibt es keine strukturierten Outputs. Für den JSON-Modus verwenden Sie Chat Completions.
- Prompt-Caching ist real und wird abgerechnet. Der Server cacht Prompt-Präfixe automatisch. Auf dieser Schnittstelle markiert
cache_control, welche Präfixe geprimt werden, und formt dieusage-Aufschlüsselung passend zu Anthropic. Gecachte Reads werden mit Rabatt berechnet, der erste Write zum normalen Input-Tarif, ohne Aufschlag. Siehe Nutzung und Abrechnung. Bis zu 4cache_control-Breakpoints werden behalten, weitere werden abgeschnitten. - Vorherige
thinking-Blöcke im Input werden verworfen. - PDF-
document-Blöcke werden extrahiert. URL-Dokumente werden nicht abgerufen.
Token zählen
POST /v1/messages/count_tokens liefert eine Schätzung zurück.
{ "input_tokens": 42 }Die Zählung ist eine Heuristik (etwa Zeichen geteilt durch 4), keine exakte Token-Zählung.
Batches
POST /v1/messages/batches und die zugehörigen Endpunkte führen Anthropic-Message-Batches aus. Der Body ist requests[] aus { custom_id, params }, mit einem Ergebnis-Fenster von 29 Tagen, einem Limit von 100000 Anfragen oder 256 MiB pro Batch und 50 gleichzeitig laufenden pro Nutzer. Sie unterstützen Idempotency-Key, und Ergebnisse streamen als application/x-ndjson, sobald processing_status gleich ended ist. Siehe Batch.