Fast Mode liefert bis zu 2,5-mal mehr Output-Token pro Sekunde von Claude Opus 5 und Claude Opus 4.8 zu einem Premium-Preis. Setze speed: "fast" zusammen mit dem Beta-Header fast-mode-2026-02-01 in deiner Anfrage, um dich dafür anzumelden.
Fast Mode wird von den folgenden Modellen unterstützt:
Fast Mode führt dasselbe Modell mit einer schnelleren Inferenzkonfiguration aus. Es gibt keine Änderung an Intelligenz oder Fähigkeiten.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Fast Mode wird mit einem Multiplikator auf die Standardtarife über das gesamte Kontextfenster hinweg berechnet, einschließlich Anfragen mit mehr als 200k Input-Token. Die folgende Tabelle zeigt die Fast-Mode-Preise für die unterstützten Modelle:
| Modell | Input | Output |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | 10 USD / MTok | 50 USD / MTok |
Die Fast-Mode-Preise kombinieren sich mit anderen Preismodifikatoren:
Vollständige Preisdetails findest du auf der Seite Preise.
Fast Mode hat ein eigenes Ratenlimit, das von den Standard-Opus-Ratenlimits getrennt ist. Wenn dein Fast-Mode-Ratenlimit überschritten wird, gibt die API einen 429-Fehler mit einem retry-after-Header zurück, der angibt, wann wieder Kapazität verfügbar sein wird.
Die Antwort enthält Header, die den Status deines Fast-Mode-Ratenlimits anzeigen:
| Header | Beschreibung |
|---|---|
anthropic-fast-input-tokens-limit | Maximale Fast-Mode-Input-Token pro Minute |
anthropic-fast-input-tokens-remaining | Verbleibende Fast-Mode-Input-Token |
anthropic-fast-input-tokens-reset | Zeitpunkt, zu dem das Fast-Mode-Input-Token-Limit zurückgesetzt wird |
anthropic-fast-output-tokens-limit | Maximale Fast-Mode-Output-Token pro Minute |
anthropic-fast-output-tokens-remaining | Verbleibende Fast-Mode-Output-Token |
anthropic-fast-output-tokens-reset | Zeitpunkt, zu dem das Fast-Mode-Output-Token-Limit zurückgesetzt wird |
Tier-spezifische Ratenlimits findest du auf der Seite Ratenlimits.
Das usage-Objekt der Antwort enthält ein speed-Feld, das angibt, welche Geschwindigkeit verwendet wurde, entweder "fast" oder "standard". Das Anfordern von speed: "fast" bei einem Modell, das Fast Mode nicht unterstützt, gibt einen Fehler zurück, ebenso wie das Überschreiten der Ratenlimits oder der Kapazität von Fast Mode (ein 429 oder 529). Wenn eine Anfrage mit speed: "fast" erfolgreich ist, ist usage.speed gleich "fast". Wenn du Claude Opus 4.6 verwendest und Fast Mode anforderst, ist das Verhalten einzigartig. Anstatt wie andere Modelle, die Fast Mode nicht unterstützen, einen Fehler zurückzugeben, wechselt es stillschweigend zur Standardgeschwindigkeit. Obwohl bei Opus 4.6 kein Fehler auftritt, zeigt das speed-Feld korrekt "standard" an.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Um die Fast-Mode-Nutzung und -Kosten in deiner Organisation zu verfolgen, siehe die Usage and Cost API.
Wenn die Fast-Mode-Ratenlimits überschritten werden, gibt die API einen 429-Fehler mit einem retry-after-Header zurück. Die Anthropic-SDKs wiederholen diese Anfragen standardmäßig automatisch bis zu 2-mal (konfigurierbar mit max_retries) und warten vor jedem Wiederholungsversuch die vom Server angegebene Verzögerung ab. Da Fast Mode eine kontinuierliche Token-Auffüllung verwendet, ist die retry-after-Verzögerung in der Regel kurz und Anfragen sind erfolgreich, sobald Kapazität verfügbar ist.
Wenn du lieber auf die Standardgeschwindigkeit zurückfallen möchtest, anstatt auf Fast-Mode-Kapazität zu warten, fange den Ratenlimit-Fehler ab und wiederhole die Anfrage ohne speed: "fast". Setze max_retries bei der ursprünglichen Fast-Anfrage auf 0, um automatische Wiederholungsversuche zu überspringen und bei Ratenlimit-Fehlern sofort fehlzuschlagen.
Da das Setzen von max_retries auf 0 auch Wiederholungsversuche für andere vorübergehende Fehler (Überlastung, interne Serverfehler) deaktiviert, senden die folgenden Beispiele die ursprüngliche Anfrage für diese Fälle mit Standard-Wiederholungsversuchen erneut.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Erhalte validierte JSON-Ergebnisse aus Agenten-Workflows.
Erfahre mehr über Anthropics Preisstruktur für Modelle und Funktionen.
Steuere mit dem Effort-Parameter, wie viele Token Claude beim Antworten verwendet, und wäge zwischen Antwortgründlichkeit und Token-Effizienz ab.
Streame Messages-API-Antworten inkrementell mit Server-Sent Events, einschließlich Text, Tool-Nutzung und Deltas für erweitertes Denken.
Was this page helpful?