La "fast mode" (modalità veloce) offre fino a 2,5 volte più token di output al secondo da Claude Opus 5 e Claude Opus 4.8 a un prezzo premium. Imposta speed: "fast" con l'header beta fast-mode-2026-02-01 nella tua richiesta per attivarla.
La fast mode è supportata sui seguenti modelli:
La fast mode esegue lo stesso modello con una configurazione di inferenza più veloce. Non ci sono cambiamenti nell'intelligenza o nelle capacità.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)La fast mode ha un prezzo calcolato come moltiplicatore sulle tariffe standard per l'intera finestra di contesto, incluse le richieste con oltre 200k token di input. La tabella seguente mostra i prezzi della fast mode per i modelli supportati:
| Modello | Input | Output |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
I prezzi della fast mode si sommano ad altri modificatori di prezzo:
Per i dettagli completi sui prezzi, consulta la pagina Prezzi.
La fast mode ha un limite di velocità dedicato, separato dai limiti di velocità standard di Opus. Quando il tuo limite di velocità della fast mode viene superato, l'API restituisce un errore 429 con un header retry-after che indica quando la capacità sarà disponibile.
La risposta include header che indicano lo stato del tuo limite di velocità della fast mode:
| Header | Descrizione |
|---|---|
anthropic-fast-input-tokens-limit | Numero massimo di token di input della fast mode al minuto |
anthropic-fast-input-tokens-remaining | Token di input della fast mode rimanenti |
anthropic-fast-input-tokens-reset | Momento in cui il limite di token di input della fast mode si reimposta |
anthropic-fast-output-tokens-limit | Numero massimo di token di output della fast mode al minuto |
anthropic-fast-output-tokens-remaining | Token di output della fast mode rimanenti |
anthropic-fast-output-tokens-reset | Momento in cui il limite di token di output della fast mode si reimposta |
Per i limiti di velocità specifici per livello, consulta la pagina Limiti di velocità.
L'oggetto usage della risposta include un campo speed che indica quale velocità è stata utilizzata, "fast" o "standard". Richiedere speed: "fast" su un modello che non supporta la fast mode restituisce un errore, così come il superamento dei limiti di velocità o della capacità della fast mode (un 429 o 529). Quando una richiesta con speed: "fast" ha successo, usage.speed è "fast". Se stai utilizzando Claude Opus 4.6 e richiedi la fast mode, il suo comportamento è unico. Invece di restituire un errore come gli altri modelli che non supportano la fast mode, passa silenziosamente alla velocità standard. Sebbene non ci sia alcun errore con Opus 4.6, il campo speed mostra accuratamente "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Per monitorare l'utilizzo e i costi della fast mode nella tua organizzazione, consulta la Usage and Cost API.
Quando i limiti di velocità della fast mode vengono superati, l'API restituisce un errore 429 con un header retry-after. Gli SDK di Anthropic riprovano automaticamente queste richieste fino a 2 volte per impostazione predefinita (configurabile con max_retries), attendendo il ritardo specificato dal server prima di ogni retry. Poiché la fast mode utilizza un rifornimento continuo di token, il ritardo retry-after è tipicamente breve e le richieste hanno successo una volta che la capacità è disponibile.
Se preferisci ricadere sulla velocità standard anziché attendere la capacità della fast mode, intercetta l'errore di limite di velocità e riprova senza speed: "fast". Imposta max_retries a 0 sulla richiesta fast iniziale per saltare i retry automatici e fallire immediatamente in caso di errori di limite di velocità.
Poiché impostare max_retries a 0 disabilita anche i retry per altri errori transitori (sovraccarico, errori interni del server), gli esempi seguenti riemettono la richiesta originale con i retry predefiniti per quei casi.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Ottieni risultati JSON validati dai workflow degli agenti.
Scopri la struttura dei prezzi di Anthropic per modelli e funzionalità.
Controlla quanti token Claude utilizza quando risponde con il parametro effort, bilanciando tra completezza della risposta ed efficienza dei token.
Trasmetti in streaming le risposte dell'API Messages in modo incrementale con server-sent events, inclusi testo, uso degli strumenti e delta del pensiero esteso.
Was this page helpful?