Claude Fable 5 è il modello più capace di Anthropic tra quelli ampiamente rilasciati, disponibile a livello generale sulla Claude API, Amazon Bedrock, Claude Platform on AWS, Google Cloud e Microsoft Foundry. Claude Mythos 5 condivide le stesse capacità ed è offerto con disponibilità limitata ai clienti approvati in Project Glasswing.
Le impostazioni di base condivise da claude-fable-5 e claude-mythos-5:
thinking. Sia thinking: {type: "disabled"} sia il pensiero esteso manuale (thinking: {type: "enabled", budget_tokens: N}) restituiscono un errore 400.invalid_request_error. Le organizzazioni con un accordo ZDR devono contattare il proprio team di account Anthropic per discutere la configurazione della conservazione dei dati. In alternativa, puoi configurare la conservazione dei dati per workspace. Consulta Requisiti di conservazione dei dati specifici per modello per i dettagli per piattaforma.Dove i due modelli divergono:
stop_reason: "refusal". Claude Mythos 5 non include questi classificatori. Consulta Rifiuti e fallback.Claude Mythos 5 è il successore ad accesso limitato di Claude Mythos Preview, l'anteprima di ricerca solo su invito. Claude Fable 5 è il modello disponibile a livello generale con le stesse capacità, e le modifiche in questa sezione si applicano ugualmente a entrambe le destinazioni.
La migrazione è per lo più drop-in. Claude Mythos 5 e Claude Fable 5 utilizzano la stessa Messages API e gli stessi pattern di uso degli strumenti di Claude Mythos Preview, e i conteggi dei token sono sostanzialmente invariati perché tutti e tre i modelli utilizzano lo stesso tokenizer. Le modifiche chiave da verificare sono le funzionalità non più disponibili (elencate nella sezione successiva) e l'output del thinking. Se migri a Claude Fable 5, pianifica anche la gestione dei rifiuti dei classificatori di sicurezza, che Claude Mythos Preview e Claude Mythos 5 non hanno; consulta Rifiuti e fallback.
Per la tempistica di ritiro di Claude Mythos Preview, consulta Deprecazioni dei modelli.
model = "claude-mythos-preview" # Before
model = "claude-mythos-5" # After
# Oppure, per il modello generalmente disponibile con le stesse funzionalità:
model = "claude-fable-5" # AfterPensiero esteso e budget di token per il thinking: Il pensiero esteso manuale (thinking: {type: "enabled", budget_tokens: N}) non è supportato su claude-mythos-5 o claude-fable-5 e restituisce un errore 400. L'adaptive thinking è sempre attivo: il modello determina quando e quanto pensare per ogni richiesta, e non è richiesta alcuna configurazione thinking. thinking: {type: "disabled"} restituisce un errore. budget_tokens non ha un sostituto diretto: il thinking è adattivo, e il parametro effort è un controllo separato a livello di output, non un budget per il thinking.
Prima (Claude Mythos Preview):
client.messages.create(
model="claude-mythos-preview",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Dopo (Claude Mythos 5):
client.messages.create(
model="claude-mythos-5",
max_tokens=16000,
messages=[{"role": "user", "content": "..."}],
)La modifica per Claude Fable 5 è identica, con claude-fable-5 come nome del modello.
Prefill dell'assistente: Il prefill del messaggio dell'assistente non è supportato su claude-mythos-5 o claude-fable-5 e restituisce un errore 400, come su Claude Mythos Preview. Usa invece istruzioni nel prompt di sistema.
Output del thinking: Su claude-mythos-5 e claude-fable-5, la catena di pensiero grezza non viene mai restituita, ma i blocchi di thinking contengono comunque testo riassunto leggibile quando thinking.display è impostato su summarized. Restituisci i blocchi di thinking invariati quando continui una conversazione sullo stesso modello. Consulta Output del thinking su Claude Fable 5 e Claude Mythos 5.
claude-mythos-5 e claude-fable-5 utilizzano lo stesso tokenizer di claude-mythos-preview (il tokenizer introdotto con Claude Opus 4.7). I conteggi dei token sono sostanzialmente invariati quando si migra da claude-mythos-preview. Rispetto ai modelli precedenti a Claude Opus 4.7, lo stesso contenuto può essere tokenizzato in circa il 30% di token in più, variando in base al contenuto e alla forma del carico di lavoro.
/v1/messages/count_tokens restituisce valori sostanzialmente invariati per claude-mythos-5 e claude-fable-5 rispetto a claude-mythos-preview. Ristabilisci le baseline di costo e latenza sui tuoi carichi di lavoro.
claude-mythos-preview a claude-mythos-5, o a claude-fable-5 per il modello disponibile a livello generale.thinking: {type: "enabled", budget_tokens: N}). L'adaptive thinking è sempre attivo, e non è richiesto alcun campo thinking.thinking: {type: "disabled"}. Disabilitare il thinking restituisce un errore su claude-mythos-5 e claude-fable-5.budget_tokens. Non ha un sostituto diretto: il thinking è adattivo, e il parametro effort è un controllo separato a livello di output, non un budget per il thinking.thinking lo tratti solo come testo di visualizzazione e restituisca i blocchi di thinking invariati quando continua sullo stesso modello. thinking.display ha come valore predefinito "omitted" su claude-mythos-5 e claude-fable-5, come su Claude Mythos Preview; imposta display: "summarized" per ricevere riassunti leggibili. Consulta Output del thinking su Claude Fable 5 e Claude Mythos 5.thinking e redacted_thinking dai turni precedenti dell'assistente. I blocchi di thinking di claude-mythos-5 e claude-fable-5 sono legati al modello che li ha prodotti, e i modelli diversi da Claude Fable 5 e Claude Mythos 5 li ignorano silenziosamente. La rimozione mantiene le richieste cross-modello minime e uniformi.stop_reason: "refusal" e leggi il campo stop_details.category. Claude Fable 5 esegue classificatori di sicurezza che Claude Mythos Preview e Claude Mythos 5 non hanno. Consulta Rifiuti e fallback.claude-mythos-preview.Claude Fable 5 e Claude Mythos 5 utilizzano la stessa Messages API e gli stessi pattern di uso degli strumenti di Claude Opus 5, con la stessa finestra di contesto da 1M di token per impostazione predefinita e gli stessi 128k token di output massimi. Le restrizioni sul prefill e sui parametri di campionamento, e il comportamento di visualizzazione del thinking, sono riportati invariati da Claude Opus 5. Le modifiche da verificare sono il thinking sempre attivo, i prezzi, il Priority Tier e la conservazione dei dati.
model = "claude-opus-5" # Before
model = "claude-fable-5" # After
# Oppure, per il modello Project Glasswing con le stesse funzionalità:
model = "claude-mythos-5" # AfterIl thinking non può più essere disabilitato: Su Claude Opus 5, il thinking è attivo per impostazione predefinita e può essere disattivato con thinking: {type: "disabled"} a un livello di effort pari a high o inferiore. Su claude-fable-5 e claude-mythos-5, l'adaptive thinking è sempre attivo, e thinking: {type: "disabled"} restituisce un errore 400 a qualsiasi livello di effort. Rimuovi la configurazione thinking: {type: "disabled"} e usa invece livelli di effort più bassi per controllare la spesa di token.
Prezzi: Claude Fable 5 e Claude Mythos 5 hanno un prezzo di 10 USD per milione di token di input e 50 USD per milione di token di output, rispetto a 5 USD e 25 USD per Claude Opus 5. Consulta Prezzi di Claude.
Priority Tier: Il Priority Tier non è supportato su Claude Opus 5, quindi nessun traffico esistente è interessato. Se la tua organizzazione ha un impegno Priority Tier, Claude Fable 5 lo supporta; Claude Mythos 5 no.
Conservazione dei dati: Claude Fable 5 e Claude Mythos 5 richiedono una conservazione dei dati di 30 giorni e non sono disponibili con accordi di "zero data retention" (ZDR); entrambi sono designati come Covered Models. Consulta Requisiti di conservazione dei dati specifici per modello.
claude-opus-5 a claude-fable-5 (o claude-mythos-5).thinking: {type: "disabled"}; restituisce un errore 400 su claude-fable-5 e claude-mythos-5. Usa invece livelli di effort più bassi per controllare la spesa di token, e rivedi max_tokens per i carichi di lavoro che venivano eseguiti con il thinking disabilitato su Claude Opus 5.La migrazione è per lo più drop-in. Claude Fable 5 e Claude Mythos 5 utilizzano la stessa Messages API e gli stessi pattern di uso degli strumenti di Claude Opus 4.8, con la stessa finestra di contesto da 1M di token per impostazione predefinita e gli stessi 128k token di output massimi. I conteggi dei token sono sostanzialmente invariati perché i modelli utilizzano lo stesso tokenizer. Le modifiche chiave da verificare sono l'adaptive thinking sempre attivo, l'output del thinking, i rifiuti dei classificatori di sicurezza (solo Claude Fable 5) e i prezzi.
model = "claude-opus-4-8" # Before
model = "claude-fable-5" # After
# Oppure, per il modello Project Glasswing con le stesse funzionalità:
model = "claude-mythos-5" # AfterGli elementi in questa sezione descrivono le differenze di API e comportamento che vale la pena verificare dopo aver sostituito l'ID del modello. Salvo dove indicato, si applicano ugualmente a claude-fable-5 e claude-mythos-5.
L'adaptive thinking è sempre attivo: L'adaptive thinking è l'unica modalità di thinking su claude-fable-5 e claude-mythos-5. Il modello determina quando e quanto pensare per ogni richiesta, e non è richiesta alcuna configurazione thinking. thinking: {type: "disabled"} restituisce un errore. Usa il parametro effort per controllare la profondità del thinking.
Il cambiamento di comportamento da verificare: su Claude Opus 4.8, le richieste senza un campo thinking vengono eseguite senza thinking; su claude-fable-5 e claude-mythos-5, quelle stesse richieste vengono eseguite con adaptive thinking. max_tokens rimane un limite rigido sull'output totale, thinking più testo di risposta, quindi rivedilo per i carichi di lavoro che venivano eseguiti senza thinking su Claude Opus 4.8. Consulta Controllo dei costi.
Prima (Claude Opus 4.8):
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)Dopo (Claude Fable 5):
client.messages.create(
model="claude-fable-5",
max_tokens=16000,
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)La modifica per Claude Mythos 5 è identica, con claude-mythos-5 come nome del modello.
Pensiero esteso e budget di thinking (invariato): Il pensiero esteso manuale (thinking: {type: "enabled", budget_tokens: N}) non è supportato su claude-fable-5 o claude-mythos-5 e restituisce un errore 400, come su Claude Opus 4.8. budget_tokens non ha un sostituto diretto: il thinking è adattivo, e il parametro effort è un controllo separato a livello di output, non un budget per il thinking.
Prefill dell'assistente (invariato): Il prefill del messaggio dell'assistente non è supportato su claude-fable-5 o claude-mythos-5 e restituisce un errore 400, come su Claude Opus 4.8. Usa invece istruzioni nel prompt di sistema.
Output del thinking: Su claude-fable-5 e claude-mythos-5, la catena di pensiero grezza non viene mai restituita, ma i blocchi di thinking contengono comunque testo riassunto leggibile quando thinking.display è impostato su summarized. Restituisci i blocchi di thinking invariati quando continui una conversazione sullo stesso modello. Consulta Output del thinking su Claude Fable 5 e Claude Mythos 5.
Classificatori di sicurezza e stop reason refusal (solo Claude Fable 5): claude-fable-5 esegue classificatori di sicurezza sulle richieste e durante la generazione della risposta. Claude Mythos 5 non include questi classificatori. Quando un classificatore rifiuta una richiesta, la Messages API restituisce stop_reason: "refusal" come risposta HTTP 200 riuscita, non come errore. Il campo stop_details.category riporta quale classificatore è stato attivato, con categorie come "cyber", "bio" e "reasoning_extraction", oppure null quando il rifiuto non corrisponde ad alcuna categoria nominata. Consulta la tabella delle categorie di rifiuto per l'elenco completo.
Non ti vengono addebitati i token di input di una richiesta rifiutata prima che venga generato qualsiasi output. Quando un classificatore si attiva a metà dello streaming, l'input e l'output già trasmesso in streaming vengono addebitati; scarta l'output parziale.
Per rieseguire automaticamente le richieste rifiutate su un altro modello, passa il parametro opt-in fallbacks, che è in beta sulla Claude API. Il parametro non è disponibile sulla Message Batches API o su Amazon Bedrock, Google Cloud e Microsoft Foundry; su queste tre piattaforme, esegui il retry lato client o usa il middleware di refusal-fallback dell'SDK. Consulta Rifiuti e fallback.
Inizia con effort high: Il valore predefinito del parametro effort rimane high. Su Claude Opus 4.8, la raccomandazione per il coding e il lavoro ad alta autonomia è di impostare esplicitamente xhigh. Su claude-fable-5 e claude-mythos-5, usa high come valore predefinito per la maggior parte delle attività e riserva xhigh per i carichi di lavoro più sensibili alle capacità. Le impostazioni di effort più basse funzionano comunque bene e spesso superano le prestazioni di xhigh sui modelli precedenti. Riduci l'effort se un'attività viene completata ma richiede più tempo del necessario. Consulta Prompting di Claude Fable 5.
Minimo inferiore per la cache dei prompt: La lunghezza minima del prompt memorizzabile in cache su claude-fable-5 e claude-mythos-5 è di 512 token, inferiore ai 1.024 token su Claude Opus 4.8. I prompt che erano troppo corti per essere memorizzati in cache su Claude Opus 4.8 possono ora creare voci di cache, senza richiedere modifiche al codice. Consulta Cache dei prompt per i minimi per modello.
claude-fable-5 e claude-mythos-5 richiedono una conservazione dei dati di 30 giorni; sulla Claude API, le richieste a claude-fable-5 che non soddisfano questo requisito restituiscono un errore 400 invalid_request_error. Claude Opus 4.8 rimane disponibile con ZDR. Consulta Requisiti di conservazione dei dati specifici per modello.claude-opus-4-8 a claude-fable-5 (o claude-mythos-5).thinking: {type: "disabled"}. Disabilitare il thinking restituisce un errore su claude-fable-5 e claude-mythos-5, e le richieste senza un campo thinking vengono eseguite con adaptive thinking.claude-fable-5 e claude-mythos-5.thinking lo tratti solo come testo di visualizzazione e restituisca i blocchi di thinking invariati quando continua sullo stesso modello. thinking.display ha come valore predefinito "omitted" su claude-fable-5 e claude-mythos-5, come su Claude Opus 4.8; imposta display: "summarized" per ricevere riassunti leggibili. Consulta Output del thinking su Claude Fable 5 e Claude Mythos 5.thinking e redacted_thinking dai turni precedenti dell'assistente. I blocchi di thinking di claude-fable-5 e claude-mythos-5 sono legati al modello che li ha prodotti, e i modelli diversi da Claude Fable 5 e Claude Mythos 5 li ignorano silenziosamente. La rimozione mantiene le richieste cross-modello minime e uniformi. L'eccezione è il riscatto di un fallback credit, che richiede il corpo della richiesta riprodotto secondo le regole esatte di quella funzionalità.stop_reason: "refusal" e leggi il campo stop_details.category. Per rieseguire automaticamente le richieste rifiutate su un altro modello, considera il parametro opt-in fallbacks (beta). Consulta Rifiuti e fallback.effort. Inizia con high per la maggior parte delle attività, inclusi i carichi di lavoro che venivano eseguiti con xhigh su Claude Opus 4.8.claude-opus-4-8; i prezzi per token differiscono.Claude Opus 5 è un miglioramento sostanziale rispetto a Claude Opus 4.8, forte nel ragionamento profondo, nelle attività agentiche e a lungo orizzonte, e nello scaling del calcolo in fase di test. Per le differenze comportamentali e i pattern di prompting specifici del modello, consulta Prompting di Claude Opus 5.
Claude Opus 5 è un aggiornamento drop-in per Claude Opus 4.8 allo stesso prezzo di 5 USD per milione di token di input e 25 USD per milione di token di output; consulta Prezzi di Claude. Ci sono due modifiche che causano incompatibilità per il codice già in esecuzione su Claude Opus 4.8, trattate nella sezione Modifiche che causano incompatibilità di seguito. Claude Opus 5 supporta lo stesso set di funzionalità di Claude Opus 4.8, inclusi la finestra di contesto da 1M di token (il valore predefinito, senza header beta), 128k token di output massimi, adaptive thinking, cache dei prompt, elaborazione batch, la Files API, supporto PDF, vision, e strumenti lato server e lato client, con due eccezioni: web fetch non è disponibile su Claude Opus 5, e il Priority Tier non è supportato su Claude Opus 5. Consulta la pagina di ciascuno strumento per la disponibilità per modello.
# Migrazione Opus
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # Afterclaude-opus-5 è un ID di modello fisso senza suffisso di data, lo stesso schema di claude-opus-4-8 e claude-sonnet-5.
Thinking attivo per impostazione predefinita: Su Claude Opus 4.8, le richieste senza un campo thinking vengono eseguite senza thinking; su Claude Opus 5, le stesse richieste vengono eseguite con adaptive thinking. max_tokens rimane un limite rigido sull'output totale, thinking più testo di risposta, quindi rivedilo per i carichi di lavoro che venivano eseguiti senza thinking su Claude Opus 4.8. Per preservare il vecchio comportamento, passa thinking: {type: "disabled"}, soggetto al limite di effort nell'elemento successivo; nota che con il thinking disabilitato il modello può occasionalmente emettere chiamate a strumenti come testo semplice o includere tag XML interni nel suo output visibile, quindi preferisci livelli di effort più bassi con il thinking abilitato dove possibile, e consulta Esecuzione con thinking disabilitato per le mitigazioni dove non è possibile.
La disabilitazione del thinking è limitata a effort high: Puoi ancora disattivare il thinking con thinking: {type: "disabled"}, ma solo a un livello di effort pari a high o inferiore. Una richiesta che combina thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400. Claude Opus 4.8 accetta questa combinazione, quindi verifica le richieste che disabilitano il thinking prima di migrare.
Il controllo viene applicato su ogni richiesta: la configurazione di effort e thinking di ogni richiesta viene validata in modo indipendente, quindi una richiesta che aumenta l'effort a xhigh o max mentre il thinking è disabilitato viene rifiutata anche se le richieste precedenti nella conversazione sono state accettate.
Prima (accettato su Claude Opus 4.8, rifiutato su Claude Opus 5):
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Dopo (Claude Opus 5), rimuovi il campo thinking per riabilitare il thinking:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)oppure mantieni il thinking disabilitato e abbassa l'effort:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Queste non sono obbligatorie ma miglioreranno la tua esperienza:
Testa l'effort max per il lavoro critico in termini di capacità: Claude Opus 5 supporta l'intero set di livelli di effort (low, medium, high, xhigh, max). Dove la capacità massima conta più della spesa di token, testa l'effort max. Può offrire miglioramenti sulle attività più impegnative ma può mostrare rendimenti decrescenti dall'aumento dell'uso di token e può essere incline all'overthinking su quelle più semplici. Se esegui con effort xhigh o max, imposta un max_tokens elevato in modo che il modello abbia spazio per pensare e agire; inizia con 64k token e regola da lì.
Considera i fallback automatici: Claude Opus 5 viene fornito con classificatori di sicurezza per la cybersecurity i cui rifiuti della categoria cyber possono ricadere su Claude Opus 4.8. Per rieseguire automaticamente le richieste rifiutate su un altro modello, considera il parametro fallbacks con la modalità "default" (fallbacks: "default"), che seleziona un modello di fallback consigliato in base alla categoria di rifiuto invece di un elenco di modelli mantenuto manualmente. Il fallback lato server è in beta; la modalità "default" richiede l'header beta server-side-fallback-2026-07-01. Consulta Rifiuti e fallback.
Memorizza in cache prompt più brevi: La lunghezza minima del prompt memorizzabile in cache su Claude Opus 5 è di 512 token, ridotta dai 1.024 token su Claude Opus 4.8. I prompt che erano troppo corti per essere memorizzati in cache su Claude Opus 4.8 possono ora creare voci di cache, senza richiedere modifiche al codice. Consulta Cache dei prompt per i minimi per modello.
Modifica gli strumenti a metà conversazione (beta): Puoi aggiungere o rimuovere strumenti tra i turni di una conversazione senza invalidare gli hit della cache dei prompt sui turni precedenti. Invia l'header beta mid-conversation-tool-changes-2026-07-01. Questo è utile per i carichi di lavoro agentici che espongono strumenti progressivamente o li ritirano man mano che un'attività avanza; senza di esso, un elenco di strumenti modificato invalida il prefisso memorizzato in cache.
Riadatta i prompt di lunghezza e verbosità: Le risposte visibili predefinite e i deliverable scritti sono più lunghi su Claude Opus 5 rispetto a Claude Opus 4.8, e abbassare l'effort riduce il volume del thinking senza accorciare in modo affidabile la risposta visibile. Richiedi esplicitamente concisione o una lunghezza target nel prompt. Consulta Lunghezza e verbosità della risposta e Lunghezza dei deliverable scritti.
Rimuovi le istruzioni di verifica ereditate e limita l'ambito: Claude Opus 5 verifica il proprio lavoro senza che gli venga detto, quindi rimuovi le istruzioni esplicite di verifica o auto-controllo ereditate da prompt ottimizzati per modelli precedenti; lasciarle causa una verifica eccessiva. Per attività ristrette, limita esplicitamente l'ambito dell'attività. Nei framework multi-agente, fornisci indicazioni esplicite su quali scenari giustificano la delega o limita il numero di subagenti, perché Claude Opus 5 delega più prontamente rispetto ai modelli precedenti. Consulta Ambito dell'attività e verifica eccessiva e Controllo della generazione di subagenti.
claude-opus-4-8 a claude-opus-5.thinking: vengono eseguiti con thinking su Claude Opus 5. Rivedi max_tokens, che rimane un limite rigido sull'output totale (thinking più testo di risposta), oppure passa thinking: {type: "disabled"} con effort high o inferiore per preservare il vecchio comportamento. Se disabiliti il thinking, consulta Esecuzione con thinking disabilitato per gli artefatti di output che possono apparire e le relative mitigazioni tramite prompting.thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400, applicato su ogni richiesta. Riabilita il thinking o abbassa l'effort a high o inferiore.effort: esegui una nuova analisi dell'effort sulle tue valutazioni invece di riportare un'impostazione ottimizzata per un modello precedente. Vale la pena testare effort low e medium come controlli di costo e latenza, e testa l'effort max dove la capacità massima conta più della spesa di token. Se esegui con effort xhigh o max, aumenta max_tokens ad almeno 64k come punto di partenza.stop_reason: "refusal", e considera fallbacks: "default" (beta) per rieseguire automaticamente le richieste rifiutate su un modello di fallback consigliato.Claude Opus 5 dovrebbe offrire ottime prestazioni immediate sui prompt e sulle valutazioni esistenti di Claude Opus 4.7, allo stesso prezzo di 5 $ per milione di token di input e 25 $ per milione di token di output. Supporta lo stesso insieme di funzionalità di Claude Opus 4.7, tra cui la finestra di contesto da 1M di token, 128k token massimi di output, il pensiero adattivo, la cache dei prompt, l'elaborazione batch, la Files API, il supporto PDF, la visione e gli strumenti lato server e lato client, con due eccezioni: web fetch non è disponibile su Claude Opus 5 e Priority Tier non è supportato su Claude Opus 5. Aggiunge inoltre i messaggi di sistema a metà conversazione e documenta pubblicamente i dettagli di arresto per rifiuto.
# Migrazione Opus
model = "claude-opus-4-7" # Before
model = "claude-opus-5" # AfterPensiero attivo per impostazione predefinita: Su Claude Opus 4.7, le richieste senza un campo thinking vengono eseguite senza pensiero; su Claude Opus 5, le stesse richieste vengono eseguite con il pensiero adattivo. max_tokens rimane un limite rigido sull'output totale, pensiero più testo di risposta, quindi rivedilo per i carichi di lavoro che venivano eseguiti senza pensiero su Claude Opus 4.7. Per preservare il comportamento precedente, passa thinking: {type: "disabled"}, soggetto al limite di effort descritto nel punto successivo; nota che con il pensiero disabilitato il modello può occasionalmente emettere chiamate agli strumenti come testo semplice o includere tag XML interni nel suo output visibile, quindi preferisci livelli di effort più bassi con il pensiero abilitato dove possibile, e consulta Esecuzione con il pensiero disabilitato per le mitigazioni dove non è possibile.
La disabilitazione del pensiero è limitata all'effort high: Puoi disattivare il pensiero con thinking: {type: "disabled"}, ma solo a un livello di effort pari a high o inferiore. Una richiesta che combina thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400. Claude Opus 4.7 accetta questa combinazione, quindi verifica le richieste che disabilitano il pensiero prima di migrare.
Il controllo viene applicato a ogni richiesta: la configurazione di effort e pensiero di ogni richiesta viene validata in modo indipendente, quindi una richiesta che aumenta l'effort a xhigh o max mentre il pensiero è disabilitato viene rifiutata anche se le richieste precedenti nella conversazione erano state accettate.
Prima (accettato su Claude Opus 4.7, rifiutato su Claude Opus 5):
client.messages.create(
model="claude-opus-4-7",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Dopo (Claude Opus 5), rimuovi il campo thinking per eseguire con il pensiero:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)oppure mantieni il pensiero disabilitato e abbassa l'effort:
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Gli elementi seguenti non sono modifiche che causano incompatibilità; descrivono differenze di comportamento che vale la pena verificare dopo aver cambiato l'ID del modello.
Parametri di campionamento (invariati): Impostare temperature, top_p o top_k a un valore non predefinito restituisce un errore 400 su Claude Opus 5, come su Claude Opus 4.7. I tipi di richiesta dell'SDK definiscono ancora questi campi per compatibilità con i modelli precedenti, quindi il codice che li imposta supera il controllo dei tipi, ma l'API rifiuta la richiesta lato server. Se hai rimosso questi parametri durante la migrazione a Opus 4.7, non sono necessarie ulteriori modifiche.
L'effort predefinito è high: Il valore predefinito del parametro effort su Claude Opus 5 è high sulla Claude API e su Claude Code. Se imposti già l'effort esplicitamente, la tua impostazione rimane invariata.
Livelli di effort ricalibrati: L'allocazione di token dietro ciascun livello di effort cambia su Claude Opus 5 rispetto a Claude Opus 4.7, e Claude Opus 5 supporta l'insieme completo di livelli di effort (low, medium, high, xhigh, max). Esegui una nuova analisi dell'effort sulle tue valutazioni invece di riportare un'impostazione ottimizzata per Claude Opus 4.7. Vale la pena testare gli effort low e medium come controlli di costo e latenza, e testare l'effort max dove la massima capacità conta più della spesa in token. Se esegui con effort xhigh o max, imposta un max_tokens elevato in modo che il modello abbia spazio per pensare e agire; inizia da 64k token e regola da lì. Consulta Effort.
La finestra di contesto da 1M è l'impostazione predefinita: Claude Opus 5 fornisce la finestra di contesto completa da 1M di token per impostazione predefinita, senza header beta e senza sovrapprezzo per il contesto lungo. Se il tuo client passa un header beta per la finestra di contesto per compatibilità con modelli precedenti, puoi rimuoverlo su Claude Opus 5.
Messaggi di sistema a metà conversazione: Claude Opus 5 accetta messaggi role: "system" immediatamente dopo un turno utente nell'array messages (soggetto alle regole di posizionamento). Usa il campo system di primo livello per le istruzioni che si applicano dall'inizio. Claude Opus 4.7 rifiuta role: "system" in messages con un errore 400. Se mantieni percorsi di codice che ricostruiscono l'intera cronologia dei messaggi per aggiornare le istruzioni, puoi semplificarli e preservare gli hit della cache dei prompt sui turni precedenti.
Dettagli di arresto per rifiuto: L'oggetto stop_details nelle risposte di rifiuto (disponibile da Claude Opus 4.7) è ora documentato pubblicamente. Quando il modello rifiuta una richiesta, identifica la categoria di rifiuto, in aggiunta allo stop reason refusal esistente. Non è richiesto alcun header beta e non è possibile disattivarlo. Consulta Gestione degli stop reason.
Minimo inferiore per la cache dei prompt: La lunghezza minima del prompt memorizzabile in cache su Claude Opus 5 è di 512 token, inferiore rispetto a Claude Opus 4.7. I prompt che erano troppo brevi per essere memorizzati in cache su Claude Opus 4.7 possono ora creare voci di cache, senza modifiche al codice. Consulta Cache dei prompt per i minimi per modello.
Modalità veloce: Claude Opus 5 supporta la modalità veloce (anteprima di ricerca); la modalità veloce non è disponibile su Claude Opus 4.7, dove le richieste con speed: "fast" restituiscono un errore. Il parametro speed: "fast" e l'header beta fast-mode-2026-02-01 funzionano senza modifiche su Claude Opus 5.
Queste non sono obbligatorie ma miglioreranno la tua esperienza:
Considera i fallback automatici: Claude Opus 5 viene fornito con classificatori di sicurezza per la cybersecurity i cui rifiuti di categoria cyber possono ricadere su Claude Opus 4.8. Per rieseguire automaticamente le richieste rifiutate su un altro modello, considera il parametro fallbacks con la modalità "default" (fallbacks: "default"), che seleziona un modello di fallback consigliato in base alla categoria di rifiuto invece di un elenco di modelli mantenuto manualmente. Il fallback lato server è in beta; la modalità "default" richiede l'header beta server-side-fallback-2026-07-01. Consulta Rifiuti e fallback.
Modifica gli strumenti a metà conversazione (beta): Puoi aggiungere o rimuovere strumenti tra i turni di una conversazione senza invalidare gli hit della cache dei prompt sui turni precedenti. Invia l'header beta mid-conversation-tool-changes-2026-07-01. Questo è utile per carichi di lavoro agentici che espongono strumenti progressivamente o li ritirano man mano che un'attività avanza; senza di esso, un elenco di strumenti modificato invalida il prefisso memorizzato in cache.
Riottimizza i prompt di lunghezza e verbosità: Le risposte visibili predefinite e i deliverable scritti risultano più lunghi su Claude Opus 5 rispetto ai modelli Opus precedenti, e abbassare l'effort riduce il volume del pensiero senza accorciare in modo affidabile la risposta visibile. Richiedi esplicitamente concisione o una lunghezza target nel prompt. Consulta Lunghezza e verbosità della risposta e Lunghezza dei deliverable scritti.
Rimuovi le istruzioni di verifica ereditate e limita l'ambito: Claude Opus 5 verifica il proprio lavoro senza che gli venga richiesto, quindi rimuovi le istruzioni esplicite di verifica o autocontrollo ereditate da prompt ottimizzati per modelli precedenti; lasciarle causa una verifica eccessiva. Per attività ristrette, limita esplicitamente l'ambito dell'attività. Nei framework multi-agente, fornisci indicazioni esplicite su quali scenari giustificano la delega o limita il numero di sottoagenti, perché Claude Opus 5 delega più prontamente rispetto ai modelli precedenti. Consulta Ambito dell'attività e verifica eccessiva e Controllo della generazione di sottoagenti.
claude-opus-4-7 a claude-opus-5 (o aggiorna gli alias).thinking: vengono eseguiti con il pensiero su Claude Opus 5. Rivedi max_tokens, che rimane un limite rigido sull'output totale (pensiero più testo di risposta), oppure passa thinking: {type: "disabled"} con effort high o inferiore per preservare il comportamento precedente. Se disabiliti il pensiero, consulta Esecuzione con il pensiero disabilitato per gli artefatti di output che possono apparire e le relative mitigazioni tramite prompt.thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400, applicato a ogni richiesta. Riabilita il pensiero o abbassa l'effort a high o inferiore.effort: esegui una nuova analisi dell'effort sulle tue valutazioni invece di riportare un'impostazione ottimizzata per Claude Opus 4.7. Testa gli effort low e medium come controlli di costo e latenza, e l'effort max dove la massima capacità conta più della spesa in token. Se esegui con effort xhigh o max, aumenta max_tokens ad almeno 64k come punto di partenza.stop_details sui rifiuti (disponibile da Claude Opus 4.7; ora documentato pubblicamente), e considera fallbacks: "default" (beta) per rieseguire automaticamente le richieste rifiutate su un modello di fallback consigliato.speed: "fast" e l'header beta fast-mode-2026-02-01 funzionano senza modifiche su Claude Opus 5.Claude Opus 5 dovrebbe offrire ottime prestazioni immediate sui prompt e sulle valutazioni esistenti di Claude Opus 4.6 allo stesso prezzo, ma ci sono alcune modifiche comportamentali e dell'API che vale la pena conoscere durante la migrazione. La maggior parte di queste modifiche è entrata in vigore con Claude Opus 4.7; altre due, il pensiero attivo per impostazione predefinita e un limite di effort sulla disattivazione del pensiero, entrano in vigore con Claude Opus 5. Tutte sono trattate di seguito, quindi questa sezione è completa per il codice proveniente direttamente da Claude Opus 4.6. Claude Opus 5 supporta lo stesso insieme di funzionalità di Claude Opus 4.6, tra cui:
Due eccezioni: web fetch non è disponibile su Claude Opus 5, e Priority Tier non è supportato su Claude Opus 5.
# Migrazione Opus
model = "claude-opus-4-6" # Before
model = "claude-opus-5" # AfterPensiero esteso rimosso: thinking: {type: "enabled", budget_tokens: N} non è più supportato su Claude Opus 4.7 o modelli successivi e restituisce un errore 400. Passa al pensiero adattivo (thinking: {type: "adaptive"}) e usa il parametro effort per controllare la profondità del pensiero. Su Claude Opus 5, il pensiero adattivo è attivo per impostazione predefinita: thinking: {type: "adaptive"} è valido ed equivalente a omettere completamente il campo thinking (vedi il punto successivo).
Prima (Claude Opus 4.6):
client.messages.create(
model="claude-opus-4-6",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Dopo (Claude Opus 5):
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"}, # or "max", "xhigh", "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Il pensiero adattivo è guidabile tramite prompting e il parametro effort; vedi Scegliere un livello di effort.
Pensiero attivo per impostazione predefinita: Su Claude Opus 4.6 e Claude Opus 4.7, le richieste senza un campo thinking vengono eseguite senza pensiero; su Claude Opus 5, le stesse richieste vengono eseguite con il pensiero adattivo. max_tokens rimane un limite rigido sull'output totale, pensiero più testo di risposta, quindi rivedilo per i carichi di lavoro che venivano eseguiti senza pensiero. Per preservare il comportamento precedente, passa thinking: {type: "disabled"}, soggetto al limite di effort nel punto successivo; nota che con il pensiero disabilitato il modello può occasionalmente emettere chiamate agli strumenti come testo semplice o includere tag XML interni nel suo output visibile, quindi preferisci livelli di effort più bassi con il pensiero abilitato dove possibile, e consulta Esecuzione con pensiero disabilitato per le mitigazioni dove non è possibile.
La disattivazione del pensiero è limitata all'effort high: Puoi disattivare il pensiero con thinking: {type: "disabled"}, ma solo a un livello di effort pari a high o inferiore. Una richiesta che combina thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400 su Claude Opus 5, applicato a ogni richiesta. Verifica le richieste che disabilitano il pensiero prima di migrare: riabilita il pensiero o abbassa l'effort a high o inferiore.
Parametri di campionamento rimossi: Impostare temperature, top_p o top_k a qualsiasi valore non predefinito su Claude Opus 4.7 o modelli successivi, incluso Claude Opus 5, restituisce un errore 400. Il percorso di migrazione più sicuro è omettere completamente questi parametri dai payload delle richieste. Il prompting è il modo consigliato per guidare il comportamento del modello su Claude Opus 5. Se usavi temperature = 0 per il determinismo, nota che non ha mai garantito output identici sui modelli precedenti.
Contenuto del pensiero omesso per impostazione predefinita: I blocchi di pensiero appaiono ancora nel flusso di risposta su Claude Opus 4.7 e modelli successivi, ma il loro campo thinking è vuoto a meno che tu non aderisca esplicitamente. Questa è una modifica silenziosa rispetto a Claude Opus 4.6, dove l'impostazione predefinita era restituire il testo di pensiero riassunto. Per ripristinare il contenuto di pensiero riassunto, imposta thinking.display su "summarized":
thinking = {
"type": "adaptive",
"display": "summarized",
}L'impostazione predefinita è "omitted" su Claude Opus 4.7 e modelli successivi. Se il tuo prodotto trasmette in streaming il ragionamento agli utenti, la nuova impostazione predefinita appare come una lunga pausa prima che inizi l'output; imposta display: "summarized" per ripristinare il progresso visibile durante il pensiero. Vedi Controllare la visualizzazione del pensiero per i dettagli.
Conteggio dei token aggiornato: Claude Opus 4.7 ha introdotto un nuovo tokenizer, che anche i modelli Opus successivi, incluso Claude Opus 5, utilizzano. Contribuisce a migliorare le prestazioni su un'ampia gamma di attività e può utilizzare approssimativamente da 1x a 1,35x più token durante l'elaborazione del testo rispetto ai modelli precedenti a Claude Opus 4.7 (fino a circa il 35% in più, variabile in base al contenuto).
/v1/messages/count_tokens restituisce un numero diverso di token per Claude Opus 5 rispetto a Claude Opus 4.6. L'efficienza dei token può variare in base alla forma del carico di lavoro.
Interventi di prompting, task_budget ed effort possono aiutare a controllare i costi e garantire un utilizzo appropriato dei token. Questi controlli possono comportare un compromesso sull'intelligenza del modello. Aggiorna i tuoi parametri max_tokens per dare margine aggiuntivo, inclusi i trigger di compattazione. Claude Opus 5 fornisce una finestra di contesto da 1M al prezzo standard dell'API senza sovrapprezzo per contesto lungo.
Rimozione del prefill (ereditata da Opus 4.6): Il prefill dei messaggi dell'assistente restituisce un errore 400 su Claude Opus 4.7 e modelli successivi, incluso Claude Opus 5. Usa invece output strutturati, istruzioni nel prompt di sistema o output_config.format.
Il parametro effort ti consente di regolare l'intelligenza di Claude rispetto alla spesa di token, scambiando capacità per maggiore velocità e costi inferiori. Claude Opus 5 supporta l'intero insieme di livelli di effort e ha come impostazione predefinita high. Esegui una nuova analisi dei livelli di effort sulle tue valutazioni anziché riportare un'impostazione ottimizzata per un modello precedente:
max: Può offrire miglioramenti sulle attività più impegnative ma può mostrare rendimenti decrescenti dall'aumento dell'utilizzo di token e può essere incline a pensare troppo su quelle più semplici. Testalo dove la massima capacità conta più della spesa di token.xhigh: Capacità estesa per lavori agentici e di codifica a lunga esecuzione che necessitano di maggiore profondità rispetto all'impostazione predefinita.high: L'impostazione predefinita. Bilancia l'utilizzo di token e l'intelligenza per la maggior parte delle attività.medium: Riduzione per risparmiare sui costi rispetto all'impostazione predefinita, vale la pena testarlo come controllo di costi e latenza.low: Il più efficiente. Riservalo per attività brevi e circoscritte e carichi di lavoro sensibili alla latenza.Se esegui con effort xhigh o max, imposta un max_tokens elevato in modo che il modello abbia spazio per pensare e agire; inizia da 64k token e regola da lì. L'effort è più importante per questo modello che per qualsiasi Opus precedente. Sperimenta attivamente con esso quando esegui l'aggiornamento.
Claude Opus 4.7 ha introdotto diverse differenze comportamentali rispetto a Claude Opus 4.6 che non sono modifiche che causano incompatibilità dell'API ma possono richiedere aggiornamenti dei prompt o rimozione di scaffolding. Queste si applicano anche a Claude Opus 5, con gli aggiustamenti indicati di seguito.
La lunghezza della risposta varia in base al caso d'uso: Claude Opus 4.7 calibra la lunghezza della risposta in base a quanto giudica complessa l'attività, anziché utilizzare una verbosità fissa predefinita. Questo di solito significa risposte più brevi su ricerche semplici e molto più lunghe su analisi aperte.
Se il tuo prodotto dipende da un certo stile o verbosità dell'output, potresti dover regolare i tuoi prompt. Ad esempio, per ridurre la verbosità, aggiungi: "Fornisci risposte concise e mirate. Salta il contesto non essenziale e mantieni gli esempi al minimo." Se noti tipi specifici di spiegazioni eccessive, aggiungi istruzioni mirate nel tuo prompt per prevenirle.
Gli esempi positivi che mostrano come Claude può comunicare con il livello appropriato di concisione tendono a essere più efficaci degli esempi negativi o delle istruzioni che dicono al modello cosa non fare. Su Claude Opus 5, le risposte visibili predefinite e i deliverable scritti sono più lunghi rispetto ai modelli Opus precedenti, e abbassare l'effort riduce il volume del pensiero senza accorciare in modo affidabile la risposta visibile; richiedi esplicitamente nel prompt la concisione o una lunghezza target. Vedi Lunghezza della risposta e verbosità.
Interpretazione più letterale delle istruzioni: Claude Opus 4.7 interpreta i prompt in modo più letterale ed esplicito rispetto a Claude Opus 4.6, in particolare ai livelli di effort più bassi. Non generalizza silenziosamente un'istruzione da un elemento a un altro e non inferisce richieste che non hai fatto. Il vantaggio di questo letteralismo è la precisione e meno confusione. Generalmente funziona meglio per casi d'uso dell'API con prompt attentamente ottimizzati, estrazione strutturata e pipeline in cui desideri un comportamento prevedibile. Una revisione dei prompt e dell'harness può essere particolarmente utile per la migrazione a Claude Opus 5.
Tono più diretto: Come con qualsiasi nuovo modello, lo stile di prosa nella scrittura di lunga durata può cambiare. Claude Opus 4.7 è più diretto e deciso, con meno formulazioni orientate alla convalida e meno emoji rispetto allo stile più caloroso di Claude Opus 4.6. Se il tuo prodotto si basa su una voce specifica, rivaluta i prompt di stile rispetto alla nuova baseline.
Aggiornamenti di progresso integrati nelle tracce agentiche: Claude Opus 4.7 fornisce aggiornamenti più regolari e di qualità superiore all'utente durante lunghe tracce agentiche. Se hai aggiunto scaffolding per forzare messaggi di stato intermedi ("Dopo ogni 3 chiamate agli strumenti, riassumi il progresso"), prova a rimuoverlo. Se ritieni che la lunghezza o i contenuti degli aggiornamenti rivolti all'utente di Claude Opus 4.7 non siano ben calibrati per il tuo caso d'uso, descrivi esplicitamente come dovrebbero apparire questi aggiornamenti nel prompt e fornisci esempi.
Generazione di subagenti modificata: Claude Opus 4.7 tende a generare meno subagenti per impostazione predefinita rispetto a Claude Opus 4.6, mentre Claude Opus 5 delega ai subagenti più prontamente rispetto ai modelli precedenti. Il comportamento è guidabile tramite prompting in entrambe le direzioni; fornisci indicazioni esplicite su quando i subagenti sono desiderabili, o limita il numero di subagenti. Vedi Controllare la generazione di subagenti.
Calibrazione dell'effort più rigorosa: Cambiando significativamente rispetto a Claude Opus 4.6, Claude Opus 4.7 rispetta rigorosamente i livelli di effort, specialmente nella fascia bassa. A low e medium, il modello limita il suo lavoro a ciò che è stato richiesto anziché fare più del richiesto.
Questo è positivo per latenza e costi, ma su attività moderatamente complesse eseguite con effort low c'è un certo rischio di ragionamento insufficiente. Se osservi un ragionamento superficiale su problemi complessi, aumenta l'effort a high o xhigh anziché aggirare il problema con il prompting.
Se devi mantenere l'effort a low per la latenza, aggiungi indicazioni mirate: "Questa attività comporta un ragionamento a più passaggi. Rifletti attentamente sul problema prima di rispondere." Vedi Livelli di effort consigliati per Claude Opus 4.7.
Meno chiamate agli strumenti per impostazione predefinita: Claude Opus 4.7 ha la tendenza a usare gli strumenti meno spesso di Claude Opus 4.6 e a usare di più il ragionamento. Questo produce risultati migliori nella maggior parte dei casi.
Per aumentare l'uso degli strumenti, aumenta l'impostazione di effort. Le impostazioni di effort high o xhigh mostrano un uso degli strumenti sostanzialmente maggiore nella ricerca agentica e nella codifica. Puoi anche modificare il tuo prompt per istruire esplicitamente il modello su quando e come usare correttamente i suoi strumenti.
Salvaguardie di cybersecurity in tempo reale: Aggiunte di recente in Claude Opus 4.7, le richieste che coinvolgono argomenti proibiti o ad alto rischio possono portare a rifiuti. Per lavori di sicurezza legittimi come penetration testing, ricerca sulle vulnerabilità o red-teaming, fai domanda al Cyber Verification Program per richiedere restrizioni ridotte. Vedi Salvaguardie, avvisi e ricorsi per il contesto.
Supporto per immagini ad alta risoluzione: Claude Opus 4.7 è il primo modello Claude con supporto per immagini ad alta risoluzione. La risoluzione massima dell'immagine è di 2.576 pixel sul lato lungo, rispetto ai 1.568 pixel dei modelli precedenti. Questo sblocca miglioramenti sui carichi di lavoro intensivi di visione ed è particolarmente prezioso per l'uso del computer, la comprensione degli screenshot e l'analisi dei documenti.
Il supporto ad alta risoluzione è automatico e non richiede alcun header beta o opt-in lato client. Due cose da pianificare:
max_tokens e le aspettative di costo per i carichi di lavoro ricchi di immagini, oppure riduci la risoluzione prima dell'invio se non hai bisogno della fedeltà aggiuntiva.Vedi Supporto per immagini ad alta risoluzione su Claude Opus 4.7 per i dettagli.
Queste non sono obbligatorie ma miglioreranno la tua esperienza:
Rivaluta max_tokens: Poiché lo stesso testo produce un conteggio di token più elevato su Claude Opus 4.7 e modelli successivi, aggiorna i tuoi parametri max_tokens per dare margine aggiuntivo, inclusi i trigger di compattazione. Interventi di prompting, task_budget ed effort possono aiutare a controllare i costi e garantire un utilizzo appropriato dei token.
Verifica le aspettative sul conteggio dei token: Qualsiasi percorso di codice che stima i token lato client o presuppone un rapporto fisso token-carattere dovrebbe essere ritestato rispetto a Claude Opus 5. Usa l'endpoint di conteggio dei token per verificare.
Adotta i task budget (beta): Claude Opus 4.7 introduce i task budget. Questi budget ti consentono di informare Claude su quanti token ha a disposizione per un ciclo agentico completo, inclusi pensiero, chiamate agli strumenti, risultati degli strumenti e output finale. Il modello vede un conto alla rovescia in esecuzione e lo usa per dare priorità al lavoro e completare l'attività in modo ordinato man mano che il budget viene consumato. Per usarlo, imposta l'header beta task-budgets-2026-03-13 e aggiungi quanto segue alla tua configurazione di output:
output_config = {
"effort": "high",
"task_budget": {"type": "tokens", "total": 128000},
}Potresti dover sperimentare con diversi task budget per il tuo caso d'uso. Se al modello viene dato un task budget troppo restrittivo, potrebbe completare l'attività in modo meno approfondito, facendo riferimento al suo budget come vincolo.
Per attività agentiche aperte in cui la qualità conta più della velocità, non impostare un task budget. Riserva i task budget per carichi di lavoro in cui hai bisogno che il modello limiti il suo lavoro a un'allocazione di token. Il valore minimo per un task budget è 20k token.
Un task budget non è un limite rigido; è un suggerimento di cui il modello è consapevole. Differisce da max_tokens:
task_budget: un limite consultivo sull'intero ciclo agentico. Il modello lo vede e lo usa per regolare il proprio ritmo.max_tokens: un tetto rigido per richiesta sui token generati. Non viene passato al modello, quindi il modello non ne è consapevole.Usa task_budget quando vuoi che il modello si autoregoli, e max_tokens come tetto rigido per limitare l'utilizzo.
Imposta un max_tokens elevato con effort max o xhigh: Se stai eseguendo Claude Opus 4.7 o un modello successivo con effort max o xhigh, imposta un budget elevato di token massimi di output in modo che il modello abbia spazio per pensare e agire attraverso i suoi subagenti e le chiamate agli strumenti. Inizia da 64k token e regola da lì.
Riduci la risoluzione delle immagini se l'alta risoluzione non è necessaria: Claude Opus 4.7 e i modelli successivi supportano immagini fino a 2576px / 3,75MP. Le immagini ad alta risoluzione usano più token. Se la fedeltà aggiuntiva dell'immagine non è necessaria, riduci la risoluzione delle immagini prima di inviarle a Claude per evitare aumenti nell'utilizzo dei token. Vedi Immagini e visione.
Considera i fallback automatici: Claude Opus 5 viene fornito con classificatori di sicurezza per la cybersecurity i cui rifiuti di categoria cyber possono ricadere su Claude Opus 4.8. Per rieseguire automaticamente le richieste rifiutate su un altro modello, considera il parametro fallbacks con la modalità "default" (fallbacks: "default"), che seleziona un modello di fallback consigliato in base alla categoria di rifiuto invece di un elenco di modelli mantenuto manualmente. Il fallback lato server è in beta; la modalità "default" richiede l'header beta server-side-fallback-2026-07-01. Vedi Rifiuti e fallback.
Memorizza nella cache prompt più brevi: La lunghezza minima del prompt memorizzabile nella cache su Claude Opus 5 è di 512 token, inferiore rispetto ai modelli Opus precedenti. I prompt che erano troppo brevi per essere memorizzati nella cache possono ora creare voci di cache, senza modifiche al codice richieste. Vedi Cache dei prompt per i minimi per modello.
Modifica gli strumenti a metà conversazione (beta): Puoi aggiungere o rimuovere strumenti tra i turni di una conversazione senza invalidare gli hit della cache dei prompt sui turni precedenti. Invia l'header beta mid-conversation-tool-changes-2026-07-01. Questo è utile per carichi di lavoro agentici che espongono strumenti progressivamente o li ritirano man mano che un'attività avanza; senza di esso, un elenco di strumenti modificato invalida il prefisso memorizzato nella cache.
Rimuovi le istruzioni di verifica ereditate e limita l'ambito: Claude Opus 5 verifica il proprio lavoro senza che gli venga detto di farlo, quindi rimuovi le istruzioni esplicite di verifica o autocontrollo ereditate da prompt ottimizzati per modelli precedenti; lasciarle causa una verifica eccessiva. Per attività ristrette, limita esplicitamente l'ambito dell'attività. Vedi Ambito dell'attività e verifica eccessiva.
claude-opus-4-6 a claude-opus-5 (o aggiorna gli alias).temperature, top_p e top_k dai payload delle richieste.thinking: {type: "enabled", budget_tokens: N} con thinking: {type: "adaptive"} più il parametro effort, oppure rimuovi completamente il campo thinking; il pensiero adattivo è attivo per impostazione predefinita su Claude Opus 5.thinking: vengono eseguiti con il pensiero su Claude Opus 5. Rivedi max_tokens, che rimane un limite rigido sull'output totale (pensiero più testo di risposta), oppure passa thinking: {type: "disabled"} con effort high o inferiore per preservare il comportamento precedente.thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400, applicato a ogni richiesta. Riabilita il pensiero o abbassa l'effort a high o inferiore.max_tokens per tenere conto della tokenizzazione aggiornata.xhigh o max, aumenta max_tokens ad almeno 64k come punto di partenza.stop_reason: "refusal", e considera fallbacks: "default" (beta) per rieseguire automaticamente le richieste rifiutate su un modello di fallback consigliato.Se stai migrando da Claude Opus 4.5, Opus 4.1 o un modello precedente direttamente a Claude Opus 5, applica tutte le modifiche precedenti in questa sezione più le seguenti modifiche cumulative, che sono entrate in vigore tra Opus 4.5 e Opus 4.7. Se stai migrando da Opus 4.6, le modifiche precedenti in questa sezione sono tutto ciò di cui hai bisogno.
# Migrazione Opus
model = "claude-opus-4-5" # Before
model = "claude-opus-5" # AfterRimozione del prefill è trattata nelle modifiche che causano incompatibilità per la migrazione da Claude Opus 4.6.
Quoting dei parametri degli strumenti: Claude Opus 4.6 e i modelli successivi possono produrre un escaping delle stringhe JSON leggermente diverso negli argomenti delle chiamate agli strumenti (ad esempio, gestione diversa degli escape Unicode o dell'escaping delle barre). Se analizzi l'input delle chiamate agli strumenti come stringa grezza anziché usare un parser JSON, verifica la tua logica di parsing. I parser JSON standard (come json.loads() o JSON.parse()) gestiscono queste differenze automaticamente.
Queste modifiche migliorano la tua esperienza su Claude Opus 4.7 e modelli successivi. Gli elementi contrassegnati come (obbligatorio su Opus 4.7) erano raccomandazioni opzionali quando Opus 4.6 è stato lanciato ma ora sono obbligatori; il resto rimane consigliato.
Migra al pensiero adattivo (obbligatorio su Opus 4.7): thinking: {type: "enabled", budget_tokens: N} restituisce un errore 400 su Claude Opus 4.7 e modelli successivi. Passa a thinking: {type: "adaptive"} e usa il parametro effort per controllare la profondità del pensiero; su Claude Opus 5, thinking: {type: "adaptive"} è equivalente a omettere il campo thinking, che viene eseguito con il pensiero adattivo per impostazione predefinita. Vedi Pensiero.
response = client.beta.messages.create(
model="claude-opus-4-5",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 32000},
betas=["interleaved-thinking-2025-05-14"],
messages=[{"role": "user", "content": "Your prompt here"}],
)Nota che la migrazione passa anche da client.beta.messages.create a client.messages.create. Il pensiero adattivo e l'effort sono funzionalità GA e non richiedono il namespace beta dell'SDK né alcun header beta.
Rimuovi l'header beta effort: Il parametro effort è ora GA. Rimuovi betas=["effort-2025-11-24"] dalle tue richieste.
Rimuovi l'header beta fine-grained tool streaming: Il fine-grained tool streaming è ora GA. Rimuovi betas=["fine-grained-tool-streaming-2025-05-14"] dalle tue richieste.
Rimuovi l'header beta interleaved thinking: Il pensiero adattivo abilita automaticamente l'interleaved thinking su Claude Opus 4.7, Opus 4.6 e Sonnet 4.6. Rimuovi betas=["interleaved-thinking-2025-05-14"] dalle tue richieste. L'header è ancora funzionale su Sonnet 4.6 con pensiero esteso manuale, ma la modalità manuale è deprecata.
Migra a output_config.format: Se usi output strutturati, aggiorna output_format={...} a output_config={"format": {...}}. Il vecchio parametro rimane funzionale ma è deprecato e sarà rimosso in una futura release del modello.
Se stai migrando da Opus 4.1 o modelli precedenti direttamente a Claude Opus 5, applica tutte le modifiche precedenti in questa sezione, più le modifiche aggiuntive in questa sottosezione.
# Da Opus 4.1
model = "claude-opus-4-1-20250805" # Before
model = "claude-opus-5" # After
# Da Sonnet 3.7
model = "claude-3-7-sonnet-20250219" # Before
model = "claude-opus-5" # AfterRimuovi i parametri di campionamento
A partire da Claude Opus 4.7, impostare temperature, top_p o top_k a qualsiasi valore non predefinito restituisce un errore 400. Il percorso di migrazione più sicuro è omettere completamente questi parametri dalle richieste e usare il prompting per guidare il comportamento del modello. Se usavi temperature = 0 per il determinismo, nota che non ha mai garantito output identici.
# Before - This will error in Claude 4+ models
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
temperature=0.7,
top_p=0.9, # Non-default sampling params return 400 on Opus 4.7
# ...
)
# After
response = client.messages.create(
model="claude-opus-5",
# ...
)Aggiorna le versioni degli strumenti
Aggiorna alle versioni più recenti degli strumenti. Rimuovi qualsiasi codice che usa il comando undo_edit.
# Prima
tools = [{"type": "text_editor_20250124", "name": "str_replace_editor"}]
# Dopo
tools = [{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"}]text_editor_20250728 e str_replace_based_edit_tool. Vedi la documentazione dello strumento editor di testo per i dettagli.code_execution_20260521. Vedi la documentazione dello strumento di esecuzione di codice per le istruzioni di migrazione.Gestisci lo stop reason refusal
Aggiorna la tua applicazione per gestire gli stop reason refusal:
response = client.messages.create(...)
if response.stop_reason == "refusal":
# Gestisci il rifiuto in modo appropriato
passGestisci lo stop reason model_context_window_exceeded
I modelli Claude 4.5+ restituiscono uno stop reason model_context_window_exceeded quando la generazione si interrompe a causa del raggiungimento del limite della finestra di contesto, anziché del limite max_tokens richiesto. Aggiorna la tua applicazione per gestire questo nuovo stop reason:
response = client.messages.create(...)
if response.stop_reason == "model_context_window_exceeded":
# Gestisci il limite della finestra di contesto in modo appropriato
passVerifica la gestione dei parametri degli strumenti (newline finali)
I modelli Claude 4.5+ preservano i newline finali nei parametri stringa delle chiamate agli strumenti che in precedenza venivano rimossi. Se i tuoi strumenti si basano sulla corrispondenza esatta delle stringhe rispetto ai parametri delle chiamate agli strumenti, verifica che la tua logica gestisca correttamente i newline finali.
Aggiorna i tuoi prompt per le modifiche comportamentali
I modelli Claude 4+ hanno uno stile di comunicazione più conciso e diretto e richiedono indicazioni esplicite. Consulta le best practice di prompting per indicazioni sull'ottimizzazione.
token-efficient-tools-2025-02-19 e output-128k-2025-02-19. Tutti i modelli Claude 4+ hanno l'uso degli strumenti efficiente nei token integrato e questi header non hanno effetto.claude-opus-5output_config.formatthinking: {type: "enabled", budget_tokens: N} con thinking: {type: "adaptive"} più il parametro effort (restituisce 400 su Opus 4.7)effort-2025-11-24 (effort è ora GA)fine-grained-tool-streaming-2025-05-14interleaved-thinking-2025-05-14 (il pensiero adattivo abilita automaticamente l'interleaved thinking)output_format a output_config.format (se applicabile)temperature, top_p e top_k (i valori non predefiniti restituiscono 400 su Opus 4.7)text_editor_20250728, code_execution_20260521)refusalmodel_context_window_exceededtoken-efficient-tools-2025-02-19, output-128k-2025-02-19)Claude Opus 5 e Claude Sonnet 5 condividono la stessa superficie API: entrambi funzionano con il pensiero adattivo attivo per impostazione predefinita, entrambi impostano il parametro effort su high per impostazione predefinita sull'API Claude e su Claude Code, entrambi offrono una finestra di contesto da 1M di token per impostazione predefinita con 128k token di output massimi, e nessuno dei due supporta il Priority Tier. Il pensiero esteso manuale e i parametri di campionamento non predefiniti restituiscono un errore 400 su entrambi i modelli, così come il prefill dell'assistente.
model = "claude-sonnet-5" # Before
model = "claude-opus-5" # AfterPrezzi: Claude Opus 5 ha un prezzo di $5 per milione di token di input e $25 per milione di token di output. Claude Sonnet 5 ha un prezzo di $2/$10 per milione di token di input/output. Consulta Prezzi di Claude per i prezzi completi.
La disabilitazione del pensiero è limitata all'effort high: Su Claude Sonnet 5, thinking: {type: "disabled"} è accettato a qualsiasi livello di effort. Su Claude Opus 5, è accettato solo a un livello di effort pari a high o inferiore; una richiesta che combina thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400, applicato su ogni richiesta. Verifica le richieste che disabilitano il pensiero prima di migrare.
Messaggi di sistema a metà conversazione: Claude Opus 5 accetta messaggi con role: "system" immediatamente dopo un turno utente nell'array messages (soggetto alle regole di posizionamento); Claude Sonnet 5 no. Se mantieni percorsi di codice che ricostruiscono l'intera cronologia dei messaggi per aggiornare le istruzioni, puoi semplificarli e preservare gli hit della cache dei prompt sui turni precedenti.
Web fetch non è disponibile: Lo strumento web fetch è disponibile su Claude Sonnet 5 ma non su Claude Opus 5.
claude-sonnet-5 a claude-opus-5.thinking: {type: "disabled"} con effort xhigh o max restituisce un errore 400 su Claude Opus 5. Riabilita il pensiero o abbassa l'effort a high o inferiore.Claude Sonnet 5 offre la migliore combinazione di velocità e intelligenza nella famiglia di modelli Claude. Si basa su Claude Sonnet 4.6.
Claude Sonnet 5 è un aggiornamento diretto per Claude Sonnet 4.6, con un prezzo di $2/$10 USD per milione di token di input/output; consulta Prezzi per i dettagli. Ci sono due modifiche API che causano incompatibilità per il codice già in esecuzione su Claude Sonnet 4.6: il pensiero esteso manuale (thinking: {type: "enabled", budget_tokens: N}) e i parametri di campionamento (temperature, top_p, top_k) impostati su valori non predefiniti non sono più accettati e restituiscono un errore 400. Usa invece il pensiero adattivo con il parametro effort. Claude Sonnet 5 supporta lo stesso insieme di funzionalità di Claude Sonnet 4.6, inclusi la finestra di contesto da 1M di token, il pensiero adattivo, la cache dei prompt, l'elaborazione batch, la Files API, il supporto PDF, la visione e l'insieme completo di strumenti lato server e lato client. Il Priority Tier non è disponibile su Claude Sonnet 5. Claude Sonnet 5 utilizza anche un nuovo tokenizer.
# Migrazione a Sonnet
model = "claude-sonnet-4-6" # Before
model = "claude-sonnet-5" # AfterGli elementi 4 e 5 nell'elenco seguente sono modifiche che causano incompatibilità. max_tokens rimane un limite rigido sull'output totale (pensiero più testo di risposta), quindi rivedilo per i carichi di lavoro che venivano eseguiti senza pensiero su Claude Sonnet 4.6.
Nuovo tokenizer: Claude Sonnet 5 utilizza un nuovo tokenizer. Lo stesso testo di input produce circa il 30% di token in più rispetto a Claude Sonnet 4.6. L'aumento esatto dipende dal contenuto. Richieste, risposte ed eventi di streaming mantengono la stessa forma e non sono necessarie modifiche al codice, ma tutto ciò che misuri o pianifichi in token cambia: i campi usage e i risultati del conteggio dei token per lo stesso testo sono più alti, la finestra di contesto da 1M di token contiene meno testo e un limite max_tokens calibrato per Claude Sonnet 4.6 potrebbe troncare un output equivalente. Il prezzo per token è inferiore ($2/$10 rispetto ai $3/$15 di Claude Sonnet 4.6 per milione di token di input/output), ma il costo di una richiesta equivalente non diminuisce in proporzione diretta. Riesegui il conteggio dei token su Claude Sonnet 5 invece di riutilizzare i conteggi misurati su modelli precedenti.
128k token di output massimi (invariato): Claude Sonnet 5 supporta fino a 128k token di output, come Claude Sonnet 4.6. I valori max_tokens esistenti rimangono validi. Tieni conto del nuovo tokenizer quando li dimensioni.
Prefill dei messaggi dell'assistente (invariato): Il prefill del messaggio dell'assistente restituisce un errore 400 su Claude Sonnet 5, come su Claude Sonnet 4.6. Se hai rimosso il prefill durante la migrazione a Claude Sonnet 4.6, non sono necessarie ulteriori modifiche. Usa invece gli output strutturati, le istruzioni nel prompt di sistema o output_config.format.
Pensiero adattivo attivo per impostazione predefinita: Su Claude Sonnet 4.6, le richieste senza un campo thinking vengono eseguite senza pensiero; su Claude Sonnet 5, le stesse richieste vengono eseguite con il pensiero adattivo. Per disattivare il pensiero, passa thinking: {type: "disabled"}. Il pensiero esteso manuale (thinking: {type: "enabled", budget_tokens: N}) non è supportato e restituisce un errore 400. Usa il parametro effort (predefinito high) per controllare la profondità del pensiero.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=16000,
thinking={"type": "adaptive", "display": "summarized"},
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Are there an infinite number of prime numbers such that n mod 4 == 3?",
}
],
)
# La risposta contiene blocchi di pensiero riassunti e blocchi di testo
for block in response.content:
match block.type:
case "thinking":
print(f"\nThinking summary: {block.thinking}")
case "text":
print(f"\nResponse: {block.text}")Parametri di campionamento rimossi: I parametri di campionamento (temperature, top_p, top_k) impostati su un valore non predefinito non sono accettati e restituiscono un errore 400.
Salvaguardie di cybersecurity: Claude Sonnet 5 è il primo modello di livello Sonnet con salvaguardie di cybersecurity in tempo reale. Le richieste che riguardano argomenti di cybersecurity proibiti o ad alto rischio possono essere rifiutate. I rifiuti vengono restituiti come risposta HTTP 200 riuscita con stop_reason: "refusal", non come errore. Consulta Salvaguardie, avvisi e ricorsi per il contesto.
claude-sonnet-4-6 a claude-sonnet-5.max_tokens dimensionati vicino alla lunghezza di output prevista e aumentali fino al massimo di 128k (invariato rispetto a Claude Sonnet 4.6) dove utile.thinking: {type: "enabled", budget_tokens: N} (restituisce un errore 400). Il pensiero adattivo è attivo per impostazione predefinita; passa {type: "disabled"} per disattivarlo, oppure usa il parametro effort per controllare la profondità.temperature, top_p e top_k impostati su valori non predefiniti (restituiscono un errore 400 su Claude Sonnet 5).stop_reason: "refusal" se il tuo carico di lavoro può toccare argomenti di cybersecurity.max_tokens per i carichi di lavoro che in precedenza venivano eseguiti senza pensiero.Se stai migrando da Claude Sonnet 4.5 o da un modello Sonnet precedente direttamente a Claude Sonnet 5, applica le modifiche di Migrazione a Claude Sonnet 5 da Claude Sonnet 4.6 più le modifiche in questa sezione.
Il prefill dei messaggi dell'assistente non è più supportato
Il prefill dei messaggi dell'assistente restituisce un errore 400 su Claude Sonnet 4.6 e modelli successivi, incluso Claude Sonnet 5. Usa invece gli output strutturati, le istruzioni nel prompt di sistema o output_config.format.
Casi d'uso comuni del prefill e migrazioni:
Controllo della formattazione dell'output (forzare output JSON/YAML): Usa gli output strutturati o strumenti con campi enum per attività di classificazione.
Eliminazione dei preamboli (rimozione di frasi come "Ecco..."): Aggiungi istruzioni dirette nel prompt di sistema: "Rispondi direttamente senza preambolo. Non iniziare con frasi come 'Ecco...', 'In base a...', ecc."
Evitare rifiuti inappropriati: Claude è ora molto migliore nei rifiuti appropriati. Un prompting chiaro nel messaggio utente senza prefill dovrebbe essere sufficiente.
Continuazioni (riprendere risposte interrotte): Sposta la continuazione nel messaggio utente: "La tua risposta precedente è stata interrotta e terminava con [previous_response]. Continua da dove ti sei fermato."
Idratazione del contesto / coerenza del ruolo (aggiornare il contesto in conversazioni lunghe): Inserisci quelli che in precedenza erano promemoria dell'assistente precompilati nel turno utente.
L'escaping JSON dei parametri degli strumenti può differire
L'escaping delle stringhe JSON nei parametri degli strumenti può differire dai modelli precedenti. I parser JSON standard gestiscono questo automaticamente, ma il parsing personalizzato basato su stringhe potrebbe richiedere aggiornamenti.
Modifiche al pensiero esteso: Le configurazioni budget_tokens di Claude Sonnet 4.5 (thinking: {type: "enabled", budget_tokens: N}) non sono supportate su Claude Sonnet 5 e restituiscono un errore 400. Il pensiero adattivo è attivo per impostazione predefinita, quindi la maggior parte dei carichi di lavoro non necessita di alcuna configurazione thinking; usa il parametro effort per controllare la profondità del pensiero. Se eseguivi Claude Sonnet 4.5 senza pensiero esteso, passa thinking: {type: "disabled"} per preservare quel comportamento.
Rimuovi i parametri di campionamento
I parametri di campionamento (temperature, top_p, top_k) impostati su un valore non predefinito restituiscono un errore 400 su Claude Sonnet 5. Rimuovili dalle richieste e usa il prompting per guidare il comportamento del modello.
Aggiorna le versioni degli strumenti
Aggiorna alle versioni più recenti degli strumenti (text_editor_20250728, code_execution_20260521). Rimuovi qualsiasi codice che utilizza il comando undo_edit.
Gestisci lo stop reason refusal
Aggiorna la tua applicazione per gestire gli stop reason refusal.
Aggiorna i tuoi prompt per le modifiche comportamentali
I modelli Claude 4 hanno uno stile di comunicazione più conciso e diretto. Consulta le best practice di prompting per indicazioni sull'ottimizzazione.
Claude Haiku 4.5 e Claude Sonnet 5 differiscono a livello di API più dei modelli adiacenti all'interno di una stessa classe: Claude Haiku 4.5 utilizza il pensiero esteso manuale (disattivato per impostazione predefinita), una finestra di contesto da 200k token e fino a 64k token di output, mentre Claude Sonnet 5 funziona con il pensiero adattivo attivo per impostazione predefinita, offre una finestra di contesto da 1M di token per impostazione predefinita e supporta fino a 128k token di output.
model = "claude-haiku-4-5-20251001" # Before
model = "claude-sonnet-5" # AfterConfigurazione del pensiero: Claude Haiku 4.5 supporta il pensiero esteso manuale (thinking: {type: "enabled", budget_tokens: N}) e rifiuta thinking: {type: "adaptive"}. Su Claude Sonnet 5, il supporto è invertito: il pensiero adattivo è attivo per impostazione predefinita e il pensiero esteso manuale restituisce un errore 400. Rimuovi le configurazioni thinking: {type: "enabled", budget_tokens: N} e affidati all'impostazione predefinita, oppure passa thinking: {type: "disabled"} per disattivare il pensiero. budget_tokens non ha un sostituto diretto; usa il parametro effort per controllare la profondità del pensiero. Effort non è disponibile su Claude Haiku 4.5 e ha come valore predefinito high su Claude Sonnet 5.
Parametri di campionamento rimossi: temperature e top_p funzionano su Claude Haiku 4.5 (uno alla volta, non entrambi). Su Claude Sonnet 5, impostare temperature, top_p o top_k su un valore non predefinito restituisce un errore 400. Rimuovi questi parametri e usa il prompting per guidare il comportamento del modello.
Prefill dell'assistente rimosso: Il prefill del messaggio dell'assistente funziona su Claude Haiku 4.5 ma restituisce un errore 400 su Claude Sonnet 5. Usa invece gli output strutturati, le istruzioni nel prompt di sistema o output_config.format.
Finestra di contesto e output più ampi: Claude Sonnet 5 offre una finestra di contesto da 1M di token per impostazione predefinita, rispetto ai 200k token di Claude Haiku 4.5, e supporta fino a 128k token di output, rispetto ai 64k. Claude Sonnet 5 utilizza anche un tokenizer diverso, quindi riesegui il conteggio dei token invece di riutilizzare i conteggi misurati su Claude Haiku 4.5.
Prezzi: Claude Haiku 4.5 ha un prezzo di $1/$5 per milione di token di input/output. Claude Sonnet 5 ha un prezzo di $2/$10 per milione di token di input/output. Consulta Prezzi di Claude.
Salvaguardie di cybersecurity: Claude Sonnet 5 ha salvaguardie di cybersecurity in tempo reale. Le richieste che riguardano argomenti di cybersecurity proibiti o ad alto rischio possono essere rifiutate, restituite come risposta HTTP 200 riuscita con stop_reason: "refusal". Consulta Salvaguardie, avvisi e ricorsi per il contesto.
claude-haiku-4-5-20251001 (o l'alias claude-haiku-4-5) a claude-sonnet-5.thinking: {type: "enabled", budget_tokens: N} (restituisce un errore 400). Il pensiero adattivo è attivo per impostazione predefinita; passa thinking: {type: "disabled"} per preservare il comportamento senza pensiero e rivedi max_tokens per i carichi di lavoro che venivano eseguiti senza pensiero.high) per controllare la profondità del pensiero e la spesa in token; non è disponibile su Claude Haiku 4.5, quindi nessuna impostazione esistente viene trasferita.temperature e top_p (i valori non predefiniti restituiscono un errore 400 su Claude Sonnet 5).max_tokens, che puoi aumentare fino al massimo di 128k.stop_reason: "refusal" se il tuo carico di lavoro può toccare argomenti di cybersecurity.Claude Haiku 4.5 è il modello Haiku più veloce e intelligente con prestazioni quasi di frontiera, offrendo qualità di modello premium per applicazioni interattive ed elaborazione ad alto volume.
Per una panoramica completa delle capacità, consulta la panoramica dei modelli.
Aggiorna il nome del modello:
# Da Haiku 3.5
model = "claude-3-5-haiku-20241022" # Before
model = "claude-haiku-4-5-20251001" # AfterRivedi i nuovi limiti di velocità: Haiku 4.5 ha limiti di velocità separati da Haiku 3.5. Consulta la documentazione sui Limiti di velocità per i dettagli.
Esplora le nuove capacità: Consulta la panoramica dei modelli per dettagli sulla consapevolezza del contesto, la maggiore capacità di output (64k token), l'intelligenza superiore e la velocità migliorata.
Queste modifiche che causano incompatibilità si applicano quando si migra dai modelli Claude 3.x Haiku.
Aggiorna i parametri di campionamento
Usa solo temperature OPPURE top_p, non entrambi. Impostare entrambi restituisce un errore 400 su Claude Haiku 4.5.
Aggiorna le versioni degli strumenti
Aggiorna alle versioni più recenti degli strumenti (text_editor_20250728, code_execution_20250825). Rimuovi qualsiasi codice che utilizza il comando undo_edit.
Gestisci lo stop reason refusal
Aggiorna la tua applicazione per gestire gli stop reason refusal.
Aggiorna i tuoi prompt per le modifiche comportamentali
I modelli Claude 4 hanno uno stile di comunicazione più conciso e diretto. Consulta le best practice di prompting per indicazioni sull'ottimizzazione.
claude-haiku-4-5-20251001text_editor_20250728, code_execution_20250825); le versioni legacy non sono supportateundo_edit (se applicabile)temperature OPPURE top_p, non entrambi (impostare entrambi restituisce un errore 400)refusal nella tua applicazioneWas this page helpful?