Anthropic bietet drei Service-Tiers an:
Der Standard-Tier ist der Standard-Service-Tier für alle API-Anfragen. Die API priorisiert diese Anfragen zusammen mit allen anderen Anfragen mit bestmöglicher Verfügbarkeit (Best-Effort).
Die API priorisiert Anfragen in diesem Tier gegenüber allen anderen Anfragen. Diese Priorisierung hilft, „server overloaded"-Fehler zu minimieren, selbst zu Spitzenzeiten.
Weitere Informationen findest du unter Bestehende Priority-Tier-Verpflichtungen.
Bei der Bearbeitung einer Anfrage entscheidet sich Anthropic in den folgenden Szenarien dafür, eine Anfrage dem Priority Tier zuzuweisen:
Anthropic rechnet die Nutzung wie folgt auf die Priority-Tier-Kapazität an:
Input-Token
inference_geo: "us") auf Claude 4.6 und späteren Modellen zählen Input-Token als 1,1 Token pro TokenOutput-Token
inference_geo: "us") auf Claude 4.6 und späteren Modellen zählen Output-Token als 1,1 Token pro TokenAndernfalls werden Anfragen im Standard-Tier verarbeitet.
Du kannst steuern, welche Service-Tiers für eine Anfrage verwendet werden können, indem du den Parameter service_tier setzt:
client = anthropic.Anthropic()
message = client.messages.create(
model="claude-opus-4-8",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello, Claude!"}],
service_tier="auto", # Automatically use Priority Tier when available, fallback to standard
)
print(message.usage.service_tier)Der Parameter service_tier akzeptiert die folgenden Werte:
"auto" (Standard) - Verwendet die Priority-Tier-Kapazität, falls verfügbar, und greift andernfalls auf deine andere Kapazität zurück"standard_only" - Verwendet nur die Kapazität des Standard-Tiers; nützlich, wenn du deine Priority-Tier-Kapazität nicht nutzen möchtestDas usage-Objekt der Antwort enthält auch den Service-Tier, der der Anfrage zugewiesen wurde:
{
"usage": {
"input_tokens": 410,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"output_tokens": 585,
"service_tier": "priority"
}
}Dadurch kannst du feststellen, welcher Service-Tier der Anfrage zugewiesen wurde.
Wenn du service_tier="auto" mit einem Modell anforderst, für das eine Priority-Tier-Verpflichtung besteht, liefern diese Response-Header Einblicke:
anthropic-priority-input-tokens-limit: 10000
anthropic-priority-input-tokens-remaining: 9618
anthropic-priority-input-tokens-reset: 2025-01-12T23:11:59Z
anthropic-priority-output-tokens-limit: 10000
anthropic-priority-output-tokens-remaining: 6000
anthropic-priority-output-tokens-reset: 2025-01-12T23:12:21ZDu kannst das Vorhandensein dieser Header nutzen, um zu erkennen, ob deine Anfrage für den Priority Tier infrage kam, selbst wenn sie über dem Limit lag.
Eine Priority-Tier-Verpflichtung besteht aus:
Priority Tier zielt auf eine Verfügbarkeit von 99,5 % mit priorisierten Rechenressourcen ab. Anfragen, die über deine zugesicherte Kapazität hinausgehen, fallen automatisch auf den Standard-Tier zurück.
Priority Tier wird auf allen verfügbaren Claude-Modellen unterstützt, mit Ausnahme von Claude Mythos 5, Claude Mythos Preview, Claude Opus 5 und Claude Sonnet 5.
Weitere Details zu den verfügbaren Modellen findest du in der Modellübersicht.
Was this page helpful?