Claude Fable 5 est le modèle le plus performant d'Anthropic parmi ceux largement diffusés, disponible en disponibilité générale sur l'API Claude, Amazon Bedrock, Claude Platform on AWS, Google Cloud et Microsoft Foundry. Claude Mythos 5 partage les mêmes capacités et est proposé en disponibilité limitée aux clients approuvés dans le cadre de Project Glasswing.
Les paramètres de base partagés par claude-fable-5 et claude-mythos-5 :
thinking n'est requise. thinking: {type: "disabled"} et la réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) renvoient tous deux une erreur 400.invalid_request_error. Les organisations disposant d'un accord ZDR doivent contacter leur équipe de compte Anthropic pour discuter de la configuration de conservation des données. Vous pouvez également configurer la conservation des données par espace de travail. Voir Exigences de conservation des données spécifiques aux modèles pour les détails par plateforme.Points de divergence entre les deux modèles :
stop_reason: "refusal". Claude Mythos 5 n'inclut pas ces classificateurs. Voir Refus et repli.Claude Mythos 5 est le successeur à accès restreint de Claude Mythos Preview, l'aperçu de recherche sur invitation uniquement. Claude Fable 5 est le modèle en disponibilité générale avec les mêmes capacités, et les changements de cette section s'appliquent de manière égale aux deux cibles.
La migration est essentiellement un remplacement direct. Claude Mythos 5 et Claude Fable 5 utilisent la même Messages API et les mêmes schémas d'utilisation d'outils que Claude Mythos Preview, et les comptages de tokens restent à peu près inchangés car les trois modèles utilisent le même tokenizer. Les principaux changements à vérifier sont les fonctionnalités qui ne sont plus disponibles (listées dans la section suivante) et la sortie de réflexion. Si vous migrez vers Claude Fable 5, prévoyez également les refus des classificateurs de sécurité, que Claude Mythos Preview et Claude Mythos 5 n'ont pas ; voir Refus et repli.
Pour le calendrier de retrait de Claude Mythos Preview, voir Dépréciations de modèles.
model = "claude-mythos-preview" # Before
model = "claude-mythos-5" # After
# Ou, pour le modèle en disponibilité générale avec les mêmes capacités :
model = "claude-fable-5" # AfterRéflexion étendue et budgets de tokens de réflexion : La réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) n'est pas prise en charge sur claude-mythos-5 ou claude-fable-5 et renvoie une erreur 400. La réflexion adaptative est toujours activée : le modèle détermine quand et dans quelle mesure réfléchir à chaque requête, et aucune configuration thinking n'est requise. thinking: {type: "disabled"} renvoie une erreur. budget_tokens n'a pas de remplacement direct : la réflexion est adaptative, et le paramètre effort est un contrôle distinct au niveau de la sortie, pas un budget de réflexion.
Avant (Claude Mythos Preview) :
client.messages.create(
model="claude-mythos-preview",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Mythos 5) :
client.messages.create(
model="claude-mythos-5",
max_tokens=16000,
messages=[{"role": "user", "content": "..."}],
)Le changement pour Claude Fable 5 est identique, avec claude-fable-5 comme nom de modèle.
Préremplissage de l'assistant : Le préremplissage du message de l'assistant n'est pas pris en charge sur claude-mythos-5 ou claude-fable-5 et renvoie une erreur 400, comme sur Claude Mythos Preview. Utilisez plutôt des instructions dans l'invite système.
Sortie de réflexion : Sur claude-mythos-5 et claude-fable-5, la chaîne de pensée brute n'est jamais renvoyée, mais les blocs de réflexion contiennent toujours du texte résumé lisible lorsque thinking.display est défini sur summarized. Renvoyez les blocs de réflexion inchangés lorsque vous poursuivez une conversation sur le même modèle. Voir Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.
claude-mythos-5 et claude-fable-5 utilisent le même tokenizer que claude-mythos-preview (le tokenizer introduit avec Claude Opus 4.7). Les comptages de tokens restent à peu près inchangés lors de la migration depuis claude-mythos-preview. Par rapport aux modèles antérieurs à Claude Opus 4.7, le même contenu peut être tokenisé en environ 30 % de tokens supplémentaires, variant selon le contenu et la forme de la charge de travail.
/v1/messages/count_tokens renvoie des valeurs à peu près inchangées pour claude-mythos-5 et claude-fable-5 par rapport à claude-mythos-preview. Réétablissez une référence de coût et de latence sur vos propres charges de travail.
claude-mythos-preview vers claude-mythos-5, ou vers claude-fable-5 pour le modèle en disponibilité générale.thinking: {type: "enabled", budget_tokens: N}). La réflexion adaptative est toujours activée, et aucun champ thinking n'est requis.thinking: {type: "disabled"}. La désactivation de la réflexion renvoie une erreur sur claude-mythos-5 et claude-fable-5.budget_tokens. Il n'a pas de remplacement direct : la réflexion est adaptative, et le paramètre effort est un contrôle distinct au niveau de la sortie, pas un budget de réflexion.thinking le traite uniquement comme du texte d'affichage et renvoie les blocs de réflexion inchangés lors de la poursuite sur le même modèle. thinking.display a pour valeur par défaut "omitted" sur claude-mythos-5 et claude-fable-5, comme sur Claude Mythos Preview ; définissez display: "summarized" pour recevoir des résumés lisibles. Voir Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.thinking et redacted_thinking des tours d'assistant précédents. Les blocs de réflexion de claude-mythos-5 et claude-fable-5 sont liés au modèle qui les a produits, et les modèles autres que Claude Fable 5 et Claude Mythos 5 les ignorent silencieusement. Leur suppression permet de garder les requêtes inter-modèles minimales et uniformes.stop_reason: "refusal" et lisez le champ stop_details.category. Claude Fable 5 exécute des classificateurs de sécurité que Claude Mythos Preview et Claude Mythos 5 n'ont pas. Voir Refus et repli.claude-mythos-preview.Claude Fable 5 et Claude Mythos 5 utilisent la même Messages API et les mêmes schémas d'utilisation d'outils que Claude Opus 5, avec la même fenêtre de contexte de 1M de tokens par défaut et le même maximum de 128k tokens de sortie. Les restrictions sur le préremplissage et les paramètres d'échantillonnage, ainsi que le comportement d'affichage de la réflexion, sont repris de Claude Opus 5 sans changement. Les changements à vérifier sont la réflexion toujours activée, la tarification, le Priority Tier et la conservation des données.
model = "claude-opus-5" # Before
model = "claude-fable-5" # After
# Ou, pour le modèle Project Glasswing avec les mêmes capacités :
model = "claude-mythos-5" # AfterLa réflexion ne peut plus être désactivée : Sur Claude Opus 5, la réflexion est activée par défaut et peut être désactivée avec thinking: {type: "disabled"} à un niveau d'effort de high ou inférieur. Sur claude-fable-5 et claude-mythos-5, la réflexion adaptative est toujours activée, et thinking: {type: "disabled"} renvoie une erreur 400 à tout niveau d'effort. Supprimez la configuration thinking: {type: "disabled"} et utilisez plutôt des niveaux d'effort inférieurs pour contrôler la dépense de tokens.
Tarification : Claude Fable 5 et Claude Mythos 5 sont facturés à 10 USD par million de tokens d'entrée et 50 USD par million de tokens de sortie, contre 5 USD et 25 USD pour Claude Opus 5. Voir Tarification de Claude.
Priority Tier : Le Priority Tier n'est pas pris en charge sur Claude Opus 5, donc aucun trafic existant n'est affecté. Si votre organisation dispose d'un engagement Priority Tier, Claude Fable 5 le prend en charge ; Claude Mythos 5 non.
Conservation des données : Claude Fable 5 et Claude Mythos 5 nécessitent une conservation des données de 30 jours et ne sont pas disponibles dans le cadre d'accords de « zero data retention » (ZDR) ; les deux sont désignés comme Covered Models. Voir Exigences de conservation des données spécifiques aux modèles.
claude-opus-5 vers claude-fable-5 (ou claude-mythos-5).thinking: {type: "disabled"} ; elle renvoie une erreur 400 sur claude-fable-5 et claude-mythos-5. Utilisez plutôt des niveaux d'effort inférieurs pour contrôler la dépense de tokens, et réexaminez max_tokens pour les charges de travail qui s'exécutaient avec la réflexion désactivée sur Claude Opus 5.La migration est essentiellement un remplacement direct. Claude Fable 5 et Claude Mythos 5 utilisent la même Messages API et les mêmes schémas d'utilisation d'outils que Claude Opus 4.8, avec la même fenêtre de contexte de 1M de tokens par défaut et le même maximum de 128k tokens de sortie. Les comptages de tokens restent à peu près inchangés car les modèles utilisent le même tokenizer. Les principaux changements à vérifier sont la réflexion adaptative toujours activée, la sortie de réflexion, les refus des classificateurs de sécurité (Claude Fable 5 uniquement) et la tarification.
model = "claude-opus-4-8" # Before
model = "claude-fable-5" # After
# Ou, pour le modèle Project Glasswing avec les mêmes capacités :
model = "claude-mythos-5" # AfterLes éléments de cette section décrivent les différences d'API et de comportement qu'il convient de vérifier après avoir changé l'ID de modèle. Sauf indication contraire, ils s'appliquent de manière égale à claude-fable-5 et claude-mythos-5.
La réflexion adaptative est toujours activée : La réflexion adaptative est le seul mode de réflexion sur claude-fable-5 et claude-mythos-5. Le modèle détermine quand et dans quelle mesure réfléchir à chaque requête, et aucune configuration thinking n'est requise. thinking: {type: "disabled"} renvoie une erreur. Utilisez le paramètre effort pour contrôler la profondeur de réflexion.
Le changement de comportement à vérifier : sur Claude Opus 4.8, les requêtes sans champ thinking s'exécutent sans réflexion ; sur claude-fable-5 et claude-mythos-5, ces mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.8. Voir Contrôle des coûts.
Avant (Claude Opus 4.8) :
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Fable 5) :
client.messages.create(
model="claude-fable-5",
max_tokens=16000,
output_config={"effort": "high"},
messages=[{"role": "user", "content": "..."}],
)Le changement pour Claude Mythos 5 est identique, avec claude-mythos-5 comme nom de modèle.
Réflexion étendue et budgets de réflexion (inchangé) : La réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) n'est pas prise en charge sur claude-fable-5 ou claude-mythos-5 et renvoie une erreur 400, comme sur Claude Opus 4.8. budget_tokens n'a pas de remplacement direct : la réflexion est adaptative, et le paramètre effort est un contrôle distinct au niveau de la sortie, pas un budget de réflexion.
Préremplissage de l'assistant (inchangé) : Le préremplissage du message de l'assistant n'est pas pris en charge sur claude-fable-5 ou claude-mythos-5 et renvoie une erreur 400, comme sur Claude Opus 4.8. Utilisez plutôt des instructions dans l'invite système.
Sortie de réflexion : Sur claude-fable-5 et claude-mythos-5, la chaîne de pensée brute n'est jamais renvoyée, mais les blocs de réflexion contiennent toujours du texte résumé lisible lorsque thinking.display est défini sur summarized. Renvoyez les blocs de réflexion inchangés lorsque vous poursuivez une conversation sur le même modèle. Voir Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.
Classificateurs de sécurité et motif d'arrêt refusal (Claude Fable 5 uniquement) : claude-fable-5 exécute des classificateurs de sécurité sur les requêtes et pendant la génération de réponse. Claude Mythos 5 n'inclut pas ces classificateurs. Lorsqu'un classificateur refuse une requête, la Messages API renvoie stop_reason: "refusal" sous forme de réponse HTTP 200 réussie, et non d'erreur. Le champ stop_details.category indique quel classificateur s'est déclenché, avec des catégories telles que "cyber", "bio" et "reasoning_extraction", ou null lorsque le refus ne correspond à aucune catégorie nommée. Voir le tableau des catégories de refus pour l'ensemble complet.
Vous n'êtes pas facturé pour les tokens d'entrée d'une requête refusée avant toute génération de sortie. Lorsqu'un classificateur se déclenche en cours de streaming, l'entrée et la sortie déjà diffusée sont facturées ; supprimez la sortie partielle.
Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, passez le paramètre optionnel fallbacks, qui est en bêta sur l'API Claude. Le paramètre n'est pas disponible sur la Message Batches API ni sur Amazon Bedrock, Google Cloud et Microsoft Foundry ; sur ces trois plateformes, exécutez la nouvelle tentative côté client ou utilisez le middleware de repli en cas de refus du SDK. Voir Refus et repli.
Commencez à l'effort high : La valeur par défaut du paramètre effort reste high. Sur Claude Opus 4.8, la recommandation pour le codage et le travail à haute autonomie est de définir explicitement xhigh. Sur claude-fable-5 et claude-mythos-5, utilisez high comme valeur par défaut pour la plupart des tâches et réservez xhigh aux charges de travail les plus sensibles aux capacités. Les paramètres d'effort inférieurs fonctionnent toujours bien et dépassent souvent les performances de xhigh sur les modèles précédents. Réduisez l'effort si une tâche se termine mais prend plus de temps que nécessaire. Voir Prompting de Claude Fable 5.
Minimum de mise en cache des prompts réduit : La longueur minimale de prompt pouvant être mise en cache sur claude-fable-5 et claude-mythos-5 est de 512 tokens, inférieure aux 1 024 tokens sur Claude Opus 4.8. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.8 peuvent désormais créer des entrées de cache, sans modification de code requise. Voir Mise en cache des prompts pour les minimums par modèle.
claude-fable-5 et claude-mythos-5 nécessitent une conservation des données de 30 jours ; sur l'API Claude, les requêtes à claude-fable-5 qui ne répondent pas à cette exigence renvoient une erreur 400 invalid_request_error. Claude Opus 4.8 reste disponible sous ZDR. Voir Exigences de conservation des données spécifiques aux modèles.claude-opus-4-8 vers claude-fable-5 (ou claude-mythos-5).thinking: {type: "disabled"}. La désactivation de la réflexion renvoie une erreur sur claude-fable-5 et claude-mythos-5, et les requêtes sans champ thinking s'exécutent avec la réflexion adaptative.claude-fable-5 et claude-mythos-5.thinking le traite uniquement comme du texte d'affichage et renvoie les blocs de réflexion inchangés lors de la poursuite sur le même modèle. thinking.display a pour valeur par défaut "omitted" sur claude-fable-5 et claude-mythos-5, comme sur Claude Opus 4.8 ; définissez display: "summarized" pour recevoir des résumés lisibles. Voir Sortie de réflexion sur Claude Fable 5 et Claude Mythos 5.thinking et redacted_thinking des tours d'assistant précédents. Les blocs de réflexion de claude-fable-5 et claude-mythos-5 sont liés au modèle qui les a produits, et les modèles autres que Claude Fable 5 et Claude Mythos 5 les ignorent silencieusement. Leur suppression permet de garder les requêtes inter-modèles minimales et uniformes. L'exception est l'utilisation d'un crédit de repli, qui nécessite que le corps de la requête soit renvoyé selon les règles exactes de cette fonctionnalité.stop_reason: "refusal" et lisez le champ stop_details.category. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre optionnel fallbacks (bêta). Voir Refus et repli.effort. Commencez à high pour la plupart des tâches, y compris les charges de travail qui s'exécutaient à xhigh sur Claude Opus 4.8.claude-opus-4-8 ; la tarification par token diffère.Claude Opus 5 représente une amélioration majeure par rapport à Claude Opus 4.8, performant sur le raisonnement approfondi, les tâches agentiques et à long horizon, et la mise à l'échelle du calcul au moment du test. Pour les différences de comportement et les schémas de prompting spécifiques au modèle, voir Prompting de Claude Opus 5.
Claude Opus 5 est une mise à niveau directe de Claude Opus 4.8 au même tarif de 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie ; voir Tarification de Claude. Il y a deux changements incompatibles pour le code déjà exécuté sur Claude Opus 4.8, couverts sous Changements incompatibles ci-dessous. Claude Opus 5 prend en charge le même ensemble de fonctionnalités que Claude Opus 4.8, y compris la fenêtre de contexte de 1M de tokens (par défaut, sans en-tête bêta), 128k tokens de sortie maximum, la réflexion adaptative, la mise en cache des prompts, le traitement par lots, la Files API, la prise en charge des PDF, la vision, et les outils côté serveur et côté client, avec deux exceptions : web fetch n'est pas disponible sur Claude Opus 5, et le Priority Tier n'est pas pris en charge sur Claude Opus 5. Consultez chaque page d'outil pour la disponibilité par modèle.
# Migration Opus
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # Afterclaude-opus-5 est un ID de modèle fixe sans suffixe de date, le même schéma que claude-opus-4-8 et claude-sonnet-5.
Réflexion activée par défaut : Sur Claude Opus 4.8, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.8. Pour préserver l'ancien comportement, passez thinking: {type: "disabled"}, sous réserve du plafond d'effort de l'élément suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible, donc préférez des niveaux d'effort inférieurs avec la réflexion activée lorsque c'est possible, et voir Exécution avec la réflexion désactivée pour les mesures d'atténuation lorsque ce n'est pas possible.
La désactivation de la réflexion est plafonnée à l'effort high : Vous pouvez toujours désactiver la réflexion avec thinking: {type: "disabled"}, mais uniquement à un niveau d'effort de high ou inférieur. Une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400. Claude Opus 4.8 accepte cette combinaison, donc auditez les requêtes qui désactivent la réflexion avant de migrer.
La vérification est appliquée à chaque requête : la configuration d'effort et de réflexion de chaque requête est validée indépendamment, donc une requête qui augmente l'effort à xhigh ou max alors que la réflexion est désactivée est rejetée même si des requêtes antérieures dans la conversation ont été acceptées.
Avant (accepté sur Claude Opus 4.8, rejeté sur Claude Opus 5) :
client.messages.create(
model="claude-opus-4-8",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Opus 5), soit supprimez le champ thinking pour réactiver la réflexion :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)soit gardez la réflexion désactivée et réduisez l'effort :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Ceux-ci ne sont pas obligatoires mais amélioreront votre expérience :
Testez l'effort max pour le travail critique en termes de capacités : Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort (low, medium, high, xhigh, max). Lorsque la capacité maximale importe plus que la dépense de tokens, testez l'effort max. Il peut apporter des gains sur les tâches les plus exigeantes mais peut présenter des rendements décroissants dus à l'augmentation de l'utilisation de tokens et peut être sujet à la sur-réflexion sur les tâches plus simples. Si vous exécutez à l'effort xhigh ou max, définissez un max_tokens élevé pour que le modèle ait de la marge pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là.
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre fallbacks avec le mode "default" (fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus au lieu d'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode "default" nécessite l'en-tête bêta server-side-fallback-2026-07-01. Voir Refus et repli.
Mettez en cache des prompts plus courts : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, contre 1 024 tokens sur Claude Opus 4.8. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.8 peuvent désormais créer des entrées de cache, sans modification de code requise. Voir Mise en cache des prompts pour les minimums par modèle.
Changez d'outils en cours de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les correspondances de cache de prompt sur les tours antérieurs. Envoyez l'en-tête bêta mid-conversation-tool-changes-2026-07-01. Ceci est utile pour les charges de travail agentiques qui exposent des outils progressivement ou les retirent à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache.
Réajustez les prompts de longueur et de verbosité : Les réponses visibles par défaut et les livrables écrits sont plus longs sur Claude Opus 5 que sur Claude Opus 4.8, et réduire l'effort diminue le volume de réflexion sans raccourcir de manière fiable la réponse visible. Demandez explicitement la concision ou une longueur cible dans le prompt. Voir Longueur et verbosité des réponses et Longueur des livrables écrits.
Supprimez les instructions de vérification héritées et limitez le périmètre : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande, donc supprimez les instructions explicites de vérification ou d'auto-contrôle héritées de prompts ajustés pour des modèles antérieurs ; les laisser en place provoque une sur-vérification. Pour les tâches restreintes, limitez explicitement le périmètre de la tâche. Dans les frameworks multi-agents, donnez des directives explicites sur les scénarios qui justifient une délégation ou plafonnez le nombre de sous-agents, car Claude Opus 5 délègue plus facilement que les modèles antérieurs. Voir Périmètre de tâche et sur-vérification et Contrôle de la création de sous-agents.
claude-opus-4-8 vers claude-opus-5.thinking : elles s'exécutent avec la réflexion sur Claude Opus 5. Réexaminez max_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passez thinking: {type: "disabled"} à un effort high ou inférieur pour préserver l'ancien comportement. Si vous désactivez la réflexion, consultez Exécution avec la réflexion désactivée pour les artefacts de sortie qui peuvent apparaître et leurs mesures d'atténuation par prompting.thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou réduisez l'effort à high ou inférieur.effort : effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reprendre un paramètre ajusté pour un modèle antérieur. Les efforts low et medium méritent d'être testés comme contrôles de coût et de latence, et testez l'effort max lorsque la capacité maximale importe plus que la dépense de tokens. Si vous exécutez à l'effort xhigh ou max, augmentez max_tokens à au moins 64k comme point de départ.stop_reason: "refusal", et envisagez fallbacks: "default" (bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé.Claude Opus 5 devrait offrir de solides performances prêtes à l'emploi sur les prompts et évaluations existants de Claude Opus 4.7, au même tarif de 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie. Il prend en charge le même ensemble de fonctionnalités que Claude Opus 4.7, notamment la fenêtre de contexte de 1M de tokens, les 128k tokens de sortie maximum, la réflexion adaptative, la mise en cache des prompts, le traitement par lots, l'API Files, la prise en charge des PDF, la vision, ainsi que les outils côté serveur et côté client, à deux exceptions près : web fetch n'est pas disponible sur Claude Opus 5, et Priority Tier n'est pas pris en charge sur Claude Opus 5. Il ajoute également les messages système en milieu de conversation et documente publiquement les détails d'arrêt pour refus.
# Migration Opus
model = "claude-opus-4-7" # Before
model = "claude-opus-5" # AfterRéflexion activée par défaut : Sur Claude Opus 4.7, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.7. Pour conserver l'ancien comportement, passez thinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible, donc préférez des niveaux d'effort plus faibles avec la réflexion activée lorsque c'est possible, et consultez Exécution avec la réflexion désactivée pour les mesures d'atténuation lorsque ce n'est pas possible.
La désactivation de la réflexion est plafonnée à l'effort high : Vous pouvez désactiver la réflexion avec thinking: {type: "disabled"}, mais uniquement à un niveau d'effort de high ou inférieur. Une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400. Claude Opus 4.7 accepte cette combinaison, donc auditez les requêtes qui désactivent la réflexion avant de migrer.
La vérification est appliquée à chaque requête : la configuration d'effort et de réflexion de chaque requête est validée indépendamment, donc une requête qui augmente l'effort à xhigh ou max alors que la réflexion est désactivée est rejetée même si des requêtes antérieures dans la conversation ont été acceptées.
Avant (accepté sur Claude Opus 4.7, rejeté sur Claude Opus 5) :
client.messages.create(
model="claude-opus-4-7",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "xhigh"},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Opus 5), soit supprimez le champ thinking pour exécuter avec la réflexion :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
output_config={"effort": "xhigh"}, # thinking is on by default
messages=[{"role": "user", "content": "..."}],
)soit gardez la réflexion désactivée et abaissez l'effort :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "disabled"},
output_config={"effort": "high"}, # or "medium", "low"
messages=[{"role": "user", "content": "..."}],
)Les éléments suivants ne sont pas des changements incompatibles ; ils décrivent des différences de comportement qu'il vaut la peine de vérifier après avoir changé l'ID du modèle.
Paramètres d'échantillonnage (inchangés) : Définir temperature, top_p ou top_k à une valeur autre que celle par défaut renvoie une erreur 400 sur Claude Opus 5, comme sur Claude Opus 4.7. Les types de requête du SDK définissent toujours ces champs pour la compatibilité avec les modèles antérieurs, donc le code qui les définit passe la vérification de type, mais l'API rejette la requête côté serveur. Si vous avez supprimé ces paramètres lors de la migration vers Opus 4.7, aucune modification supplémentaire n'est nécessaire.
L'effort par défaut est high : La valeur par défaut du paramètre effort sur Claude Opus 5 est high sur l'API Claude et Claude Code. Si vous définissez déjà l'effort explicitement, votre réglage reste inchangé.
Niveaux d'effort recalibrés : L'allocation de tokens derrière chaque niveau d'effort change sur Claude Opus 5 par rapport à Claude Opus 4.7, et Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort (low, medium, high, xhigh, max). Effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reporter un réglage ajusté pour Claude Opus 4.7. Les efforts low et medium méritent d'être testés comme contrôles de coût et de latence, et testez l'effort max lorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effort xhigh ou max, définissez un max_tokens élevé pour que le modèle ait de la marge pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là. Voir Effort.
La fenêtre de contexte de 1M est la valeur par défaut : Claude Opus 5 fournit la fenêtre de contexte complète de 1M de tokens par défaut, sans en-tête bêta et sans supplément pour contexte long. Si votre client passe un en-tête bêta de fenêtre de contexte pour la compatibilité avec des modèles plus anciens, vous pouvez le supprimer sur Claude Opus 5.
Messages système en milieu de conversation : Claude Opus 5 accepte les messages role: "system" immédiatement après un tour utilisateur dans le tableau messages (sous réserve des règles de placement). Utilisez le champ system de niveau supérieur pour les instructions qui s'appliquent dès le début. Claude Opus 4.7 rejette role: "system" dans messages avec une erreur 400. Si vous maintenez des chemins de code qui reconstruisent l'historique complet des messages pour mettre à jour les instructions, vous pouvez les simplifier et préserver les correspondances de cache de prompts sur les tours antérieurs.
Détails d'arrêt pour refus : L'objet stop_details sur les réponses de refus (disponible depuis Claude Opus 4.7) est désormais documenté publiquement. Lorsque le modèle refuse une requête, il identifie la catégorie de refus, en plus de la raison d'arrêt refusal existante. Aucun en-tête bêta n'est requis, et il n'y a pas de désactivation possible. Voir Gestion des raisons d'arrêt.
Minimum de mise en cache des prompts abaissé : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, inférieure à celle de Claude Opus 4.7. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.7 peuvent désormais créer des entrées de cache, sans modification de code requise. Voir Mise en cache des prompts pour les minimums par modèle.
Mode rapide : Claude Opus 5 prend en charge le mode rapide (aperçu de recherche) ; le mode rapide n'est pas disponible sur Claude Opus 4.7, où les requêtes avec speed: "fast" renvoient une erreur. Le paramètre speed: "fast" et l'en-tête bêta fast-mode-2026-02-01 fonctionnent sans changement sur Claude Opus 5.
Ces changements ne sont pas obligatoires mais amélioreront votre expérience :
Envisagez les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre fallbacks avec le mode "default" (fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus au lieu d'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode "default" nécessite l'en-tête bêta server-side-fallback-2026-07-01. Voir Refus et repli.
Changer d'outils en milieu de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les correspondances de cache de prompts sur les tours antérieurs. Envoyez l'en-tête bêta mid-conversation-tool-changes-2026-07-01. Ceci est utile pour les charges de travail agentiques qui exposent des outils progressivement ou les retirent à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache.
Réajustez les prompts de longueur et de verbosité : Les réponses visibles par défaut et les livrables écrits sont plus longs sur Claude Opus 5 que sur les modèles Opus antérieurs, et abaisser l'effort réduit le volume de réflexion sans raccourcir de manière fiable la réponse visible. Demandez explicitement la concision ou une longueur cible dans le prompt à la place. Voir Longueur et verbosité des réponses et Longueur des livrables écrits.
Supprimez les instructions de vérification héritées et limitez la portée : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande, donc supprimez les instructions explicites de vérification ou d'auto-contrôle héritées de prompts ajustés pour des modèles antérieurs ; les laisser en place provoque une sur-vérification. Pour les tâches restreintes, limitez explicitement la portée de la tâche. Dans les frameworks multi-agents, donnez des directives explicites sur les scénarios qui justifient une délégation ou plafonnez le nombre de sous-agents, car Claude Opus 5 délègue plus facilement que les modèles antérieurs. Voir Portée de la tâche et sur-vérification et Contrôle de la création de sous-agents.
claude-opus-4-7 à claude-opus-5 (ou mettez à jour les alias).thinking : elles s'exécutent avec la réflexion sur Claude Opus 5. Réexaminez max_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passez thinking: {type: "disabled"} à l'effort high ou inférieur pour conserver l'ancien comportement. Si vous désactivez la réflexion, consultez Exécution avec la réflexion désactivée pour les artefacts de sortie qui peuvent apparaître et leurs mesures d'atténuation par prompting.thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Réactivez la réflexion ou abaissez l'effort à high ou inférieur.effort : effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reporter un réglage ajusté pour Claude Opus 4.7. Testez les efforts low et medium comme contrôles de coût et de latence, et l'effort max lorsque la capacité maximale importe plus que la dépense en tokens. Si vous exécutez à l'effort xhigh ou max, augmentez max_tokens à au moins 64k comme point de départ.stop_details sur les refus (disponible depuis Claude Opus 4.7 ; désormais documenté publiquement), et envisagez fallbacks: "default" (bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé.speed: "fast" et l'en-tête bêta fast-mode-2026-02-01 fonctionnent sans changement sur Claude Opus 5.Claude Opus 5 devrait offrir de solides performances prêtes à l'emploi sur les prompts et évaluations existants de Claude Opus 4.6 au même tarif, mais il existe quelques changements de comportement et d'API qu'il est utile de connaître lors de votre migration. La plupart de ces changements ont pris effet dans Claude Opus 4.7 ; deux autres, la réflexion activée par défaut et un plafond d'effort sur la désactivation de la réflexion, prennent effet sur Claude Opus 5. Tous sont couverts ci-dessous, de sorte que cette section est complète pour le code provenant directement de Claude Opus 4.6. Claude Opus 5 prend en charge le même ensemble de fonctionnalités que Claude Opus 4.6, notamment :
Deux exceptions : web fetch n'est pas disponible sur Claude Opus 5, et Priority Tier n'est pas pris en charge sur Claude Opus 5.
# Migration Opus
model = "claude-opus-4-6" # Before
model = "claude-opus-5" # AfterSuppression de la réflexion étendue : thinking: {type: "enabled", budget_tokens: N} n'est plus pris en charge sur Claude Opus 4.7 ou les modèles ultérieurs et renvoie une erreur 400. Passez à la réflexion adaptative (thinking: {type: "adaptive"}) et utilisez le paramètre effort pour contrôler la profondeur de réflexion. Sur Claude Opus 5, la réflexion adaptative est activée par défaut : thinking: {type: "adaptive"} est valide et équivalent à l'omission complète du champ thinking (voir le point suivant).
Avant (Claude Opus 4.6) :
client.messages.create(
model="claude-opus-4-6",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 10000},
messages=[{"role": "user", "content": "..."}],
)Après (Claude Opus 5) :
client.messages.create(
model="claude-opus-5",
max_tokens=16000,
thinking={"type": "adaptive"},
output_config={"effort": "high"}, # or "max", "xhigh", "medium", "low"
messages=[{"role": "user", "content": "..."}],
)La réflexion adaptative est orientable via le prompting et le paramètre effort ; voir Choisir un niveau d'effort.
Réflexion activée par défaut : Sur Claude Opus 4.6 et Claude Opus 4.7, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. max_tokens reste une limite stricte sur la sortie totale, réflexion plus texte de réponse, donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion. Pour préserver l'ancien comportement, passez thinking: {type: "disabled"}, sous réserve du plafond d'effort décrit au point suivant ; notez qu'avec la réflexion désactivée, le modèle peut occasionnellement émettre des appels d'outils sous forme de texte brut ou inclure des balises XML internes dans sa sortie visible, donc préférez des niveaux d'effort plus bas avec la réflexion activée lorsque c'est possible, et consultez Exécution avec la réflexion désactivée pour des mesures d'atténuation lorsque ce n'est pas possible.
La désactivation de la réflexion est plafonnée à l'effort high : Vous pouvez désactiver la réflexion avec thinking: {type: "disabled"}, mais uniquement à un niveau d'effort de high ou inférieur. Une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400 sur Claude Opus 5, appliquée à chaque requête. Auditez les requêtes qui désactivent la réflexion avant de migrer : réactivez la réflexion ou abaissez l'effort à high ou moins.
Suppression des paramètres d'échantillonnage : Définir temperature, top_p ou top_k à une valeur autre que la valeur par défaut sur Claude Opus 4.7 ou les modèles ultérieurs, y compris Claude Opus 5, renvoie une erreur 400. La voie de migration la plus sûre consiste à omettre entièrement ces paramètres des charges utiles de requête. Le prompting est la méthode recommandée pour guider le comportement du modèle sur Claude Opus 5. Si vous utilisiez temperature = 0 pour le déterminisme, notez que cela n'a jamais garanti des sorties identiques sur les modèles antérieurs.
Contenu de réflexion omis par défaut : Les blocs de réflexion apparaissent toujours dans le flux de réponse sur Claude Opus 4.7 et les modèles ultérieurs, mais leur champ thinking est vide sauf si vous l'activez explicitement. Il s'agit d'un changement silencieux par rapport à Claude Opus 4.6, où le comportement par défaut était de renvoyer un texte de réflexion résumé. Pour restaurer le contenu de réflexion résumé, définissez thinking.display sur "summarized" :
thinking = {
"type": "adaptive",
"display": "summarized",
}La valeur par défaut est "omitted" sur Claude Opus 4.7 et les modèles ultérieurs. Si votre produit diffuse le raisonnement aux utilisateurs, la nouvelle valeur par défaut apparaît comme une longue pause avant le début de la sortie ; définissez display: "summarized" pour restaurer une progression visible pendant la réflexion. Voir Contrôler l'affichage de la réflexion pour plus de détails.
Comptage de tokens mis à jour : Claude Opus 4.7 a introduit un nouveau tokenizer, que les modèles Opus ultérieurs, y compris Claude Opus 5, utilisent également. Il contribue à améliorer les performances sur un large éventail de tâches, et il peut utiliser environ 1x à 1,35x plus de tokens lors du traitement de texte par rapport aux modèles antérieurs à Claude Opus 4.7 (jusqu'à ~35 % de plus, variable selon le contenu).
/v1/messages/count_tokens renvoie un nombre de tokens différent pour Claude Opus 5 par rapport à Claude Opus 4.6. L'efficacité des tokens peut varier selon la forme de la charge de travail.
Les interventions de prompting, task_budget et effort peuvent aider à contrôler les coûts et à garantir une utilisation appropriée des tokens. Ces contrôles peuvent impliquer un compromis sur l'intelligence du modèle. Mettez à jour vos paramètres max_tokens pour donner une marge supplémentaire, y compris les déclencheurs de compactage. Claude Opus 5 fournit une fenêtre de contexte de 1M au tarif API standard sans supplément pour contexte long.
Suppression du préremplissage (reporté d'Opus 4.6) : Le préremplissage des messages assistant renvoie une erreur 400 sur Claude Opus 4.7 et les modèles ultérieurs, y compris Claude Opus 5. Utilisez plutôt les sorties structurées, les instructions d'invite système ou output_config.format.
Le paramètre effort vous permet d'ajuster l'intelligence de Claude par rapport à la dépense de tokens, en échangeant la capacité contre une vitesse plus rapide et des coûts plus bas. Claude Opus 5 prend en charge l'ensemble complet des niveaux d'effort et utilise high par défaut. Effectuez un nouveau balayage d'effort sur vos propres évaluations plutôt que de reporter un réglage ajusté pour un modèle antérieur :
max : Peut apporter des gains sur les tâches les plus exigeantes mais peut montrer des rendements décroissants dus à une utilisation accrue de tokens et peut être sujet à une sur-réflexion sur les tâches plus simples. Testez-le là où la capacité maximale importe plus que la dépense de tokens.xhigh : Capacité étendue pour le travail agentique et de codage de longue durée qui nécessite plus de profondeur que la valeur par défaut.high : La valeur par défaut. Équilibre l'utilisation de tokens et l'intelligence pour la plupart des tâches.medium : Réduction économique par rapport à la valeur par défaut, à tester comme contrôle de coût et de latence.low : Le plus efficace. À réserver aux tâches courtes et délimitées et aux charges de travail sensibles à la latence.Si vous exécutez à l'effort xhigh ou max, définissez un max_tokens élevé pour que le modèle ait de la marge pour réfléchir et agir ; commencez à 64k tokens et ajustez à partir de là. L'effort est plus important pour ce modèle que pour tout Opus antérieur. Expérimentez activement avec ce paramètre lors de votre mise à niveau.
Claude Opus 4.7 a introduit plusieurs différences de comportement par rapport à Claude Opus 4.6 qui ne sont pas des changements incompatibles d'API mais peuvent nécessiter des mises à jour de prompts ou la suppression d'échafaudages. Elles se reportent sur Claude Opus 5, avec les ajustements notés ci-dessous.
La longueur de réponse varie selon le cas d'usage : Claude Opus 4.7 calibre la longueur de réponse en fonction de la complexité qu'il attribue à la tâche, plutôt que d'utiliser une verbosité fixe par défaut. Cela signifie généralement des réponses plus courtes sur les recherches simples et beaucoup plus longues sur les analyses ouvertes.
Si votre produit dépend d'un certain style ou d'une certaine verbosité de sortie, vous devrez peut-être ajuster vos prompts. Par exemple, pour réduire la verbosité, ajoutez : « Fournis des réponses concises et ciblées. Omets le contexte non essentiel et limite les exemples au minimum. » Si vous observez des types spécifiques de sur-explication, ajoutez des instructions ciblées dans votre prompt pour les prévenir.
Les exemples positifs montrant comment Claude peut communiquer avec le niveau de concision approprié tendent à être plus efficaces que les exemples négatifs ou les instructions qui indiquent au modèle ce qu'il ne doit pas faire. Sur Claude Opus 5, les réponses visibles par défaut et les livrables écrits sont plus longs que sur les modèles Opus antérieurs, et abaisser l'effort réduit le volume de réflexion sans raccourcir de manière fiable la réponse visible ; demandez explicitement la concision ou une longueur cible dans le prompt. Voir Longueur de réponse et verbosité.
Suivi des instructions plus littéral : Claude Opus 4.7 interprète les prompts de manière plus littérale et explicite que Claude Opus 4.6, particulièrement aux niveaux d'effort inférieurs. Il ne généralise pas silencieusement une instruction d'un élément à un autre, et il n'infère pas de demandes que vous n'avez pas formulées. L'avantage de ce littéralisme est la précision et moins de va-et-vient. Il fonctionne généralement mieux pour les cas d'usage API avec des prompts soigneusement ajustés, l'extraction structurée et les pipelines où vous souhaitez un comportement prévisible. Une revue des prompts et du harnais peut être particulièrement utile pour la migration vers Claude Opus 5.
Ton plus direct : Comme avec tout nouveau modèle, le style de prose sur l'écriture longue peut évoluer. Claude Opus 4.7 est plus direct et affirmé, avec moins de formulations axées sur la validation et moins d'emojis que le style plus chaleureux de Claude Opus 4.6. Si votre produit repose sur une voix spécifique, réévaluez les prompts de style par rapport à la nouvelle référence.
Mises à jour de progression intégrées dans les traces agentiques : Claude Opus 4.7 fournit des mises à jour plus régulières et de meilleure qualité à l'utilisateur tout au long des longues traces agentiques. Si vous avez ajouté un échafaudage pour forcer des messages d'état intermédiaires (« Après chaque 3 appels d'outils, résume la progression »), essayez de le supprimer. Si vous constatez que la longueur ou le contenu des mises à jour destinées à l'utilisateur de Claude Opus 4.7 ne sont pas bien calibrés pour votre cas d'usage, décrivez explicitement à quoi ces mises à jour devraient ressembler dans le prompt et fournissez des exemples.
Création de sous-agents modifiée : Claude Opus 4.7 tend à créer moins de sous-agents par défaut que Claude Opus 4.6, tandis que Claude Opus 5 délègue aux sous-agents plus volontiers que les modèles antérieurs. Le comportement est orientable via le prompting dans les deux directions ; donnez des directives explicites sur les cas où les sous-agents sont souhaitables, ou plafonnez le nombre de sous-agents. Voir Contrôler la création de sous-agents.
Calibration d'effort plus stricte : Changement significatif par rapport à Claude Opus 4.6, Claude Opus 4.7 respecte strictement les niveaux d'effort, particulièrement dans la partie basse. À low et medium, le modèle limite son travail à ce qui a été demandé plutôt que d'en faire plus que demandé.
C'est bon pour la latence et le coût, mais sur des tâches modérément complexes exécutées à l'effort low, il existe un certain risque de sous-réflexion. Si vous observez un raisonnement superficiel sur des problèmes complexes, augmentez l'effort à high ou xhigh plutôt que de contourner le problème par le prompting.
Si vous devez maintenir l'effort à low pour la latence, ajoutez des directives ciblées : « Cette tâche implique un raisonnement en plusieurs étapes. Réfléchis soigneusement au problème avant de répondre. » Voir Niveaux d'effort recommandés pour Claude Opus 4.7.
Moins d'appels d'outils par défaut : Claude Opus 4.7 a tendance à utiliser les outils moins souvent que Claude Opus 4.6 et à utiliser davantage le raisonnement. Cela produit de meilleurs résultats dans la plupart des cas.
Pour augmenter l'utilisation d'outils, augmentez le réglage d'effort. Les réglages d'effort high ou xhigh montrent une utilisation d'outils substantiellement plus élevée dans la recherche agentique et le codage. Vous pouvez également ajuster votre prompt pour instruire explicitement le modèle sur quand et comment utiliser correctement ses outils.
Protections de cybersécurité en temps réel : Nouvellement ajoutées dans Claude Opus 4.7, les requêtes impliquant des sujets interdits ou à haut risque peuvent entraîner des refus. Pour le travail de sécurité légitime tel que les tests d'intrusion, la recherche de vulnérabilités ou le red-teaming, postulez au Cyber Verification Program pour demander des restrictions réduites. Voir Protections, avertissements et recours pour le contexte.
Prise en charge des images haute résolution : Claude Opus 4.7 est le premier modèle Claude avec prise en charge des images haute résolution. La résolution d'image maximale est de 2 576 pixels sur le bord long, contre 1 568 pixels sur les modèles antérieurs. Cela débloque des gains sur les charges de travail intensives en vision et est particulièrement précieux pour l'utilisation de l'ordinateur, la compréhension de captures d'écran et l'analyse de documents.
La prise en charge haute résolution est automatique et ne nécessite aucun en-tête bêta ni activation côté client. Deux éléments à prévoir :
max_tokens et les attentes de coût pour les charges de travail intensives en images, ou sous-échantillonnez avant l'envoi si vous n'avez pas besoin de la fidélité supplémentaire.Voir Prise en charge des images haute résolution sur Claude Opus 4.7 pour plus de détails.
Ces changements ne sont pas obligatoires mais amélioreront votre expérience :
Réévaluer max_tokens : Comme le même texte produit un nombre de tokens plus élevé sur Claude Opus 4.7 et les modèles ultérieurs, mettez à jour vos paramètres max_tokens pour donner une marge supplémentaire, y compris les déclencheurs de compactage. Les interventions de prompting, task_budget et effort peuvent aider à contrôler les coûts et à garantir une utilisation appropriée des tokens.
Auditer les attentes de comptage de tokens : Tout chemin de code qui estime les tokens côté client ou suppose un ratio fixe token/caractère doit être retesté avec Claude Opus 5. Utilisez le point de terminaison de comptage de tokens pour vérifier.
Adopter les budgets de tâche (bêta) : Claude Opus 4.7 introduit les budgets de tâche. Ces budgets vous permettent d'informer Claude du nombre de tokens dont il dispose pour une boucle agentique complète, incluant la réflexion, les appels d'outils, les résultats d'outils et la sortie finale. Le modèle voit un compte à rebours en cours et l'utilise pour prioriser le travail et terminer la tâche proprement à mesure que le budget est consommé. Pour l'utiliser, définissez l'en-tête bêta task-budgets-2026-03-13 et ajoutez ce qui suit à votre configuration de sortie :
output_config = {
"effort": "high",
"task_budget": {"type": "tokens", "total": 128000},
}Vous devrez peut-être expérimenter avec différents budgets de tâche pour votre cas d'usage. Si le modèle reçoit un budget de tâche trop restrictif, il peut accomplir la tâche de manière moins approfondie, en citant son budget comme contrainte.
Pour les tâches agentiques ouvertes où la qualité importe plus que la vitesse, ne définissez pas de budget de tâche. Réservez les budgets de tâche aux charges de travail où vous avez besoin que le modèle limite son travail à une allocation de tokens. La valeur minimale pour un budget de tâche est de 20k tokens.
Un budget de tâche n'est pas un plafond strict ; c'est une suggestion dont le modèle a connaissance. Il diffère de max_tokens :
task_budget : un plafond indicatif sur l'ensemble de la boucle agentique. Le modèle le voit et l'utilise pour se rythmer.max_tokens : un plafond strict par requête sur les tokens générés. Il n'est pas transmis au modèle, donc le modèle n'en a pas connaissance.Utilisez task_budget lorsque vous voulez que le modèle s'auto-modère, et max_tokens comme plafond strict pour limiter l'utilisation.
Définir un max_tokens élevé à l'effort max ou xhigh : Si vous exécutez Claude Opus 4.7 ou un modèle ultérieur à l'effort max ou xhigh, définissez un budget de tokens de sortie maximum élevé pour que le modèle ait de la marge pour réfléchir et agir à travers ses sous-agents et appels d'outils. Commencez à 64k tokens et ajustez à partir de là.
Sous-échantillonner les images si la haute résolution est inutile : Claude Opus 4.7 et les modèles ultérieurs prennent en charge les images jusqu'à 2576px / 3,75MP. Les images haute résolution utilisent plus de tokens. Si la fidélité d'image supplémentaire est inutile, sous-échantillonnez les images avant de les envoyer à Claude pour éviter les augmentations d'utilisation de tokens. Voir Images et vision.
Envisager les replis automatiques : Claude Opus 5 est livré avec des classificateurs de sécurité en cybersécurité dont les refus de catégorie cyber peuvent se replier sur Claude Opus 4.8. Pour réexécuter automatiquement les requêtes refusées sur un autre modèle, envisagez le paramètre fallbacks avec le mode "default" (fallbacks: "default"), qui sélectionne un modèle de repli recommandé en fonction de la catégorie de refus au lieu d'une liste de modèles maintenue manuellement. Le repli côté serveur est en bêta ; le mode "default" nécessite l'en-tête bêta server-side-fallback-2026-07-01. Voir Refus et repli.
Mettre en cache des prompts plus courts : La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, inférieure à celle des modèles Opus antérieurs. Les prompts qui étaient trop courts pour être mis en cache peuvent désormais créer des entrées de cache, sans modification de code requise. Voir Mise en cache des prompts pour les minimums par modèle.
Changer d'outils en cours de conversation (bêta) : Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation sans invalider les correspondances de cache de prompt sur les tours antérieurs. Envoyez l'en-tête bêta mid-conversation-tool-changes-2026-07-01. C'est utile pour les charges de travail agentiques qui exposent les outils progressivement ou les retirent à mesure qu'une tâche avance ; sans cela, une liste d'outils modifiée invalide le préfixe mis en cache.
Supprimer les instructions de vérification reportées et contraindre le périmètre : Claude Opus 5 vérifie son propre travail sans qu'on le lui demande, donc supprimez les instructions explicites de vérification ou d'auto-contrôle reportées de prompts ajustés pour des modèles antérieurs ; les laisser en place provoque une sur-vérification. Pour les tâches restreintes, contraignez explicitement le périmètre de la tâche. Voir Périmètre de tâche et sur-vérification.
claude-opus-4-6 à claude-opus-5 (ou mettre à jour les alias).temperature, top_p et top_k des charges utiles de requête.thinking: {type: "enabled", budget_tokens: N} par thinking: {type: "adaptive"} plus le paramètre effort, ou supprimer entièrement le champ thinking ; la réflexion adaptative est activée par défaut sur Claude Opus 5.thinking : elles s'exécutent avec réflexion sur Claude Opus 5. Réexaminer max_tokens, qui reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), ou passer thinking: {type: "disabled"} à l'effort high ou inférieur pour préserver l'ancien comportement.thinking: {type: "disabled"} avec l'effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Réactiver la réflexion ou abaisser l'effort à high ou moins.max_tokens pour tenir compte de la tokenisation mise à jour.xhigh ou max, augmenter max_tokens à au moins 64k comme point de départ.stop_reason: "refusal", et envisager fallbacks: "default" (bêta) pour réexécuter automatiquement les requêtes refusées sur un modèle de repli recommandé.Si vous migrez depuis Claude Opus 4.5, Opus 4.1 ou un modèle antérieur directement vers Claude Opus 5, appliquez tous les changements plus haut dans cette section plus les changements cumulatifs suivants, qui ont pris effet entre Opus 4.5 et Opus 4.7. Si vous migrez depuis Opus 4.6, les changements plus haut dans cette section sont tout ce dont vous avez besoin.
# Migration Opus
model = "claude-opus-4-5" # Before
model = "claude-opus-5" # AfterLa suppression du préremplissage est couverte dans les changements incompatibles pour la migration depuis Claude Opus 4.6.
Échappement des paramètres d'outils : Claude Opus 4.6 et les modèles ultérieurs peuvent produire un échappement de chaîne JSON légèrement différent dans les arguments d'appel d'outil (par exemple, une gestion différente des échappements Unicode ou de l'échappement des barres obliques). Si vous analysez l'input d'appel d'outil comme une chaîne brute plutôt qu'en utilisant un analyseur JSON, vérifiez votre logique d'analyse. Les analyseurs JSON standard (tels que json.loads() ou JSON.parse()) gèrent ces différences automatiquement.
Ces changements améliorent votre expérience sur Claude Opus 4.7 et les modèles ultérieurs. Les éléments marqués (requis sur Opus 4.7) étaient des recommandations optionnelles lors du lancement d'Opus 4.6 mais sont désormais obligatoires ; les autres restent recommandés.
Migrer vers la réflexion adaptative (requis sur Opus 4.7) : thinking: {type: "enabled", budget_tokens: N} renvoie une erreur 400 sur Claude Opus 4.7 et les modèles ultérieurs. Passez à thinking: {type: "adaptive"} et utilisez le paramètre effort pour contrôler la profondeur de réflexion ; sur Claude Opus 5, thinking: {type: "adaptive"} est équivalent à l'omission du champ thinking, qui s'exécute avec la réflexion adaptative par défaut. Voir Réflexion.
response = client.beta.messages.create(
model="claude-opus-4-5",
max_tokens=16000,
thinking={"type": "enabled", "budget_tokens": 32000},
betas=["interleaved-thinking-2025-05-14"],
messages=[{"role": "user", "content": "Your prompt here"}],
)Notez que la migration passe également de client.beta.messages.create à client.messages.create. La réflexion adaptative et l'effort sont des fonctionnalités en disponibilité générale (GA) et ne nécessitent pas l'espace de noms SDK bêta ni aucun en-tête bêta.
Supprimer l'en-tête bêta effort : Le paramètre effort est désormais en GA. Supprimez betas=["effort-2025-11-24"] de vos requêtes.
Supprimer l'en-tête bêta de streaming d'outils à grain fin : Le streaming d'outils à grain fin est désormais en GA. Supprimez betas=["fine-grained-tool-streaming-2025-05-14"] de vos requêtes.
Supprimer l'en-tête bêta de réflexion entrelacée : La réflexion adaptative active automatiquement la réflexion entrelacée sur Claude Opus 4.7, Opus 4.6 et Sonnet 4.6. Supprimez betas=["interleaved-thinking-2025-05-14"] de vos requêtes. L'en-tête reste fonctionnel sur Sonnet 4.6 avec la réflexion étendue manuelle, mais le mode manuel est déprécié.
Migrer vers output_config.format : Si vous utilisez les sorties structurées, mettez à jour output_format={...} vers output_config={"format": {...}}. L'ancien paramètre reste fonctionnel mais est déprécié et sera supprimé dans une future version de modèle.
Si vous migrez depuis Opus 4.1 ou des modèles antérieurs directement vers Claude Opus 5, appliquez tous les changements plus haut dans cette section, plus les changements supplémentaires de cette sous-section.
# Depuis Opus 4.1
model = "claude-opus-4-1-20250805" # Before
model = "claude-opus-5" # After
# Depuis Sonnet 3.7
model = "claude-3-7-sonnet-20250219" # Before
model = "claude-opus-5" # AfterSupprimer les paramètres d'échantillonnage
À partir de Claude Opus 4.7, définir temperature, top_p ou top_k à une valeur autre que la valeur par défaut renvoie une erreur 400. La voie de migration la plus sûre consiste à omettre entièrement ces paramètres des requêtes et à utiliser le prompting pour guider le comportement du modèle. Si vous utilisiez temperature = 0 pour le déterminisme, notez que cela n'a jamais garanti des sorties identiques.
# Avant - Ceci générera une erreur avec les modèles Claude 4+
response = client.messages.create(
model="claude-3-7-sonnet-20250219",
temperature=0.7,
top_p=0.9, # Non-default sampling params return 400 on Opus 4.7
# ...
)
# Après
response = client.messages.create(
model="claude-opus-5",
# ...
)Mettre à jour les versions d'outils
Mettez à jour vers les dernières versions d'outils. Supprimez tout code utilisant la commande undo_edit.
# Avant
tools = [{"type": "text_editor_20250124", "name": "str_replace_editor"}]
# Après
tools = [{"type": "text_editor_20250728", "name": "str_replace_based_edit_tool"}]text_editor_20250728 et str_replace_based_edit_tool. Voir la documentation de l'outil éditeur de texte pour plus de détails.code_execution_20260521. Voir la documentation de l'outil d'exécution de code pour les instructions de migration.Gérer la raison d'arrêt refusal
Mettez à jour votre application pour gérer les raisons d'arrêt refusal :
response = client.messages.create(...)
if response.stop_reason == "refusal":
# Gérer le refus de manière appropriée
passGérer la raison d'arrêt model_context_window_exceeded
Les modèles Claude 4.5+ renvoient une raison d'arrêt model_context_window_exceeded lorsque la génération s'arrête parce que la limite de la fenêtre de contexte est atteinte, plutôt que la limite max_tokens demandée. Mettez à jour votre application pour gérer cette nouvelle raison d'arrêt :
response = client.messages.create(...)
if response.stop_reason == "model_context_window_exceeded":
# Gérez la limite de la fenêtre de contexte de manière appropriée
passVérifier la gestion des paramètres d'outils (sauts de ligne finaux)
Les modèles Claude 4.5+ préservent les sauts de ligne finaux dans les paramètres de chaîne d'appel d'outil qui étaient auparavant supprimés. Si vos outils reposent sur une correspondance exacte de chaîne avec les paramètres d'appel d'outil, vérifiez que votre logique gère correctement les sauts de ligne finaux.
Mettre à jour vos prompts pour les changements de comportement
Les modèles Claude 4+ ont un style de communication plus concis et direct et nécessitent des directives explicites. Consultez les bonnes pratiques de prompting pour des conseils d'optimisation.
token-efficient-tools-2025-02-19 et output-128k-2025-02-19. Tous les modèles Claude 4+ ont une utilisation d'outils efficace en tokens intégrée et ces en-têtes n'ont aucun effet.claude-opus-5output_config.format à la placethinking: {type: "enabled", budget_tokens: N} par thinking: {type: "adaptive"} plus le paramètre effort (renvoie 400 sur Opus 4.7)effort-2025-11-24 (effort est désormais en GA)fine-grained-tool-streaming-2025-05-14interleaved-thinking-2025-05-14 (la réflexion adaptative active automatiquement la réflexion entrelacée)output_format vers output_config.format (le cas échéant)temperature, top_p et top_k (les valeurs non par défaut renvoient 400 sur Opus 4.7)text_editor_20250728, code_execution_20260521)refusalmodel_context_window_exceededtoken-efficient-tools-2025-02-19, output-128k-2025-02-19)Claude Opus 5 et Claude Sonnet 5 partagent la même surface d'API : les deux fonctionnent avec la réflexion adaptative activée par défaut, les deux définissent par défaut le paramètre effort sur high dans l'API Claude et Claude Code, les deux offrent une fenêtre de contexte de 1 million de tokens par défaut avec 128k tokens de sortie maximum, et aucun des deux ne prend en charge le Priority Tier. La réflexion étendue manuelle et les paramètres d'échantillonnage non définis par défaut renvoient une erreur 400 sur les deux modèles, tout comme le préremplissage de l'assistant.
model = "claude-sonnet-5" # Before
model = "claude-opus-5" # AfterTarification : Claude Opus 5 est facturé 5 $ par million de tokens d'entrée et 25 $ par million de tokens de sortie. Claude Sonnet 5 est facturé 2 $/10 $ par million de tokens d'entrée/sortie. Consultez la tarification de Claude pour la tarification complète.
La désactivation de la réflexion est plafonnée au niveau d'effort high : Sur Claude Sonnet 5, thinking: {type: "disabled"} est accepté à tous les niveaux d'effort. Sur Claude Opus 5, il n'est accepté qu'à un niveau d'effort de high ou inférieur ; une requête qui combine thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400, appliquée à chaque requête. Auditez les requêtes qui désactivent la réflexion avant de migrer.
Messages système en milieu de conversation : Claude Opus 5 accepte les messages role: "system" immédiatement après un tour utilisateur dans le tableau messages (sous réserve des règles de placement) ; Claude Sonnet 5 ne les accepte pas. Si vous maintenez des chemins de code qui reconstruisent l'historique complet des messages pour mettre à jour les instructions, vous pouvez les simplifier et préserver les correspondances de cache de prompts sur les tours précédents.
Web fetch n'est pas disponible : L'outil web fetch est disponible sur Claude Sonnet 5 mais pas sur Claude Opus 5.
claude-sonnet-5 vers claude-opus-5.thinking: {type: "disabled"} avec un effort xhigh ou max renvoie une erreur 400 sur Claude Opus 5. Réactivez la réflexion ou abaissez l'effort à high ou moins.Claude Sonnet 5 offre la meilleure combinaison de vitesse et d'intelligence de la famille de modèles Claude. Il s'appuie sur Claude Sonnet 4.6.
Claude Sonnet 5 est une mise à niveau directe de Claude Sonnet 4.6, facturée 2 $/10 $ USD par million de tokens d'entrée/sortie ; consultez la Tarification pour plus de détails. Il existe deux changements d'API incompatibles pour le code fonctionnant déjà sur Claude Sonnet 4.6 : la réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) et les paramètres d'échantillonnage (temperature, top_p, top_k) définis sur des valeurs non par défaut ne sont plus acceptés et renvoient une erreur 400. Utilisez plutôt la réflexion adaptative avec le paramètre effort. Claude Sonnet 5 prend en charge le même ensemble de fonctionnalités que Claude Sonnet 4.6, notamment la fenêtre de contexte de 1 million de tokens, la réflexion adaptative, la mise en cache des prompts, le traitement par lots, l'API Files, la prise en charge des PDF, la vision, et l'ensemble complet des outils côté serveur et côté client. Le Priority Tier n'est pas disponible sur Claude Sonnet 5. Claude Sonnet 5 utilise également un nouveau tokenizer.
# Migration vers Sonnet
model = "claude-sonnet-4-6" # Before
model = "claude-sonnet-5" # AfterLes points 4 et 5 de la liste suivante sont des changements incompatibles. max_tokens reste une limite stricte sur la sortie totale (réflexion plus texte de réponse), donc réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Sonnet 4.6.
Nouveau tokenizer : Claude Sonnet 5 utilise un nouveau tokenizer. Le même texte d'entrée produit environ 30 % de tokens en plus que sur Claude Sonnet 4.6. L'augmentation exacte dépend du contenu. Les requêtes, les réponses et les événements de streaming conservent la même forme, et aucune modification de code n'est requise, mais tout ce que vous mesurez ou budgétisez en tokens change : les champs usage et les résultats de comptage de tokens pour le même texte sont plus élevés, la fenêtre de contexte de 1 million de tokens contient moins de texte, et une limite max_tokens ajustée pour Claude Sonnet 4.6 peut tronquer une sortie équivalente. La tarification par token est inférieure (2 $/10 $ contre 3 $/15 $ par million de tokens d'entrée/sortie pour Claude Sonnet 4.6), mais le coût d'une requête équivalente ne diminue pas en proportion directe. Relancez le comptage de tokens sur Claude Sonnet 5 plutôt que de réutiliser les comptages mesurés sur les modèles antérieurs.
128k tokens de sortie maximum (inchangé) : Claude Sonnet 5 prend en charge jusqu'à 128k tokens de sortie, comme Claude Sonnet 4.6. Les valeurs max_tokens existantes restent valides. Tenez compte du nouveau tokenizer lors de leur dimensionnement.
Préremplissage des messages de l'assistant (inchangé) : Le préremplissage du message de l'assistant renvoie une erreur 400 sur Claude Sonnet 5, comme sur Claude Sonnet 4.6. Si vous avez supprimé le préremplissage lors de la migration vers Claude Sonnet 4.6, aucune modification supplémentaire n'est nécessaire. Utilisez plutôt les sorties structurées, les instructions d'invite système ou output_config.format.
Réflexion adaptative activée par défaut : Sur Claude Sonnet 4.6, les requêtes sans champ thinking s'exécutent sans réflexion ; sur Claude Sonnet 5, les mêmes requêtes s'exécutent avec la réflexion adaptative. Pour désactiver la réflexion, passez thinking: {type: "disabled"}. La réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) n'est pas prise en charge et renvoie une erreur 400. Utilisez le paramètre effort (par défaut high) pour contrôler la profondeur de réflexion.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-sonnet-5",
max_tokens=16000,
thinking={"type": "adaptive", "display": "summarized"},
output_config={"effort": "high"},
messages=[
{
"role": "user",
"content": "Are there an infinite number of prime numbers such that n mod 4 == 3?",
}
],
)
# La réponse contient des blocs de réflexion résumés et des blocs de texte
for block in response.content:
match block.type:
case "thinking":
print(f"\nThinking summary: {block.thinking}")
case "text":
print(f"\nResponse: {block.text}")Paramètres d'échantillonnage supprimés : Les paramètres d'échantillonnage (temperature, top_p, top_k) définis sur une valeur non par défaut ne sont pas acceptés et renvoient une erreur 400.
Protections de cybersécurité : Claude Sonnet 5 est le premier modèle de niveau Sonnet doté de protections de cybersécurité en temps réel. Les requêtes impliquant des sujets de cybersécurité interdits ou à haut risque peuvent être refusées. Les refus sont renvoyés sous forme de réponse HTTP 200 réussie avec stop_reason: "refusal", et non comme une erreur. Consultez Protections, avertissements et recours pour plus de contexte.
claude-sonnet-4-6 vers claude-sonnet-5.max_tokens dimensionnées proche de la longueur de sortie attendue, et augmentez-les jusqu'au maximum de 128k (inchangé par rapport à Claude Sonnet 4.6) si utile.thinking: {type: "enabled", budget_tokens: N} (renvoie une erreur 400). La réflexion adaptative est activée par défaut ; passez {type: "disabled"} pour la désactiver, ou utilisez le paramètre effort pour contrôler la profondeur.temperature, top_p et top_k définis sur des valeurs non par défaut (ils renvoient une erreur 400 sur Claude Sonnet 5).stop_reason: "refusal" si votre charge de travail peut toucher à des sujets de cybersécurité.max_tokens pour les charges de travail qui s'exécutaient auparavant sans réflexion.Si vous migrez depuis Claude Sonnet 4.5 ou un modèle Sonnet antérieur directement vers Claude Sonnet 5, appliquez les changements de Migration vers Claude Sonnet 5 depuis Claude Sonnet 4.6 ainsi que les changements de cette section.
Le préremplissage des messages de l'assistant n'est plus pris en charge
Le préremplissage des messages de l'assistant renvoie une erreur 400 sur Claude Sonnet 4.6 et les modèles ultérieurs, y compris Claude Sonnet 5. Utilisez plutôt les sorties structurées, les instructions d'invite système ou output_config.format.
Cas d'usage courants du préremplissage et migrations :
Contrôle du formatage de sortie (forcer une sortie JSON/YAML) : Utilisez les sorties structurées ou des outils avec des champs enum pour les tâches de classification.
Élimination des préambules (suppression des phrases « Voici... ») : Ajoutez des instructions directes dans l'invite système : « Répondez directement sans préambule. Ne commencez pas par des phrases comme "Voici...", "D'après...", etc. »
Éviter les refus inappropriés : Claude gère désormais beaucoup mieux les refus appropriés. Un prompt clair dans le message utilisateur sans préremplissage devrait suffire.
Continuations (reprise de réponses interrompues) : Déplacez la continuation dans le message utilisateur : « Votre réponse précédente a été interrompue et s'est terminée par [previous_response]. Continuez là où vous vous êtes arrêté. »
Hydratation du contexte / cohérence du rôle (rafraîchissement du contexte dans les longues conversations) : Injectez ce qui était auparavant des rappels préremplis de l'assistant dans le tour utilisateur à la place.
L'échappement JSON des paramètres d'outils peut différer
L'échappement des chaînes JSON dans les paramètres d'outils peut différer des modèles précédents. Les analyseurs JSON standard gèrent cela automatiquement, mais l'analyse personnalisée basée sur des chaînes peut nécessiter des mises à jour.
Changements de la réflexion étendue : Les configurations budget_tokens de Claude Sonnet 4.5 (thinking: {type: "enabled", budget_tokens: N}) ne sont pas prises en charge sur Claude Sonnet 5 et renvoient une erreur 400. La réflexion adaptative est activée par défaut, donc la plupart des charges de travail n'ont besoin d'aucune configuration thinking ; utilisez le paramètre effort pour contrôler la profondeur de réflexion. Si vous exécutiez Claude Sonnet 4.5 sans réflexion étendue, passez thinking: {type: "disabled"} pour préserver ce comportement.
Supprimez les paramètres d'échantillonnage
Les paramètres d'échantillonnage (temperature, top_p, top_k) définis sur une valeur non par défaut renvoient une erreur 400 sur Claude Sonnet 5. Supprimez-les des requêtes et utilisez le prompting pour guider le comportement du modèle à la place.
Mettez à jour les versions des outils
Mettez à jour vers les dernières versions des outils (text_editor_20250728, code_execution_20260521). Supprimez tout code utilisant la commande undo_edit.
Gérez la raison d'arrêt refusal
Mettez à jour votre application pour gérer les raisons d'arrêt refusal.
Mettez à jour vos prompts pour les changements de comportement
Les modèles Claude 4 ont un style de communication plus concis et direct. Consultez les bonnes pratiques de prompting pour des conseils d'optimisation.
Claude Haiku 4.5 et Claude Sonnet 5 diffèrent davantage au niveau de l'API que des modèles adjacents au sein d'une même classe : Claude Haiku 4.5 utilise la réflexion étendue manuelle (désactivée par défaut), une fenêtre de contexte de 200k tokens et jusqu'à 64k tokens de sortie, tandis que Claude Sonnet 5 fonctionne avec la réflexion adaptative activée par défaut, offre une fenêtre de contexte de 1 million de tokens par défaut et prend en charge jusqu'à 128k tokens de sortie.
model = "claude-haiku-4-5-20251001" # Before
model = "claude-sonnet-5" # AfterConfiguration de la réflexion : Claude Haiku 4.5 prend en charge la réflexion étendue manuelle (thinking: {type: "enabled", budget_tokens: N}) et rejette thinking: {type: "adaptive"}. Sur Claude Sonnet 5, la prise en charge est inversée : la réflexion adaptative est activée par défaut, et la réflexion étendue manuelle renvoie une erreur 400. Supprimez les configurations thinking: {type: "enabled", budget_tokens: N} et utilisez la valeur par défaut, ou passez thinking: {type: "disabled"} pour désactiver la réflexion. budget_tokens n'a pas de remplacement direct ; utilisez le paramètre effort pour contrôler la profondeur de réflexion. L'effort n'est pas disponible sur Claude Haiku 4.5 et est défini par défaut sur high sur Claude Sonnet 5.
Paramètres d'échantillonnage supprimés : temperature et top_p fonctionnent sur Claude Haiku 4.5 (un à la fois, pas les deux). Sur Claude Sonnet 5, définir temperature, top_p ou top_k sur une valeur non par défaut renvoie une erreur 400. Supprimez ces paramètres et utilisez le prompting pour guider le comportement du modèle.
Préremplissage de l'assistant supprimé : Le préremplissage du message de l'assistant fonctionne sur Claude Haiku 4.5 mais renvoie une erreur 400 sur Claude Sonnet 5. Utilisez plutôt les sorties structurées, les instructions d'invite système ou output_config.format.
Fenêtre de contexte et sortie plus grandes : Claude Sonnet 5 offre une fenêtre de contexte de 1 million de tokens par défaut, contre 200k tokens sur Claude Haiku 4.5, et prend en charge jusqu'à 128k tokens de sortie, contre 64k. Claude Sonnet 5 utilise également un tokenizer différent, donc relancez le comptage de tokens plutôt que de réutiliser les comptages mesurés sur Claude Haiku 4.5.
Tarification : Claude Haiku 4.5 est facturé 1 $/5 $ par million de tokens d'entrée/sortie. Claude Sonnet 5 est facturé 2 $/10 $ par million de tokens d'entrée/sortie. Consultez la tarification de Claude.
Protections de cybersécurité : Claude Sonnet 5 dispose de protections de cybersécurité en temps réel. Les requêtes impliquant des sujets de cybersécurité interdits ou à haut risque peuvent être refusées, renvoyées sous forme de réponse HTTP 200 réussie avec stop_reason: "refusal". Consultez Protections, avertissements et recours pour plus de contexte.
claude-haiku-4-5-20251001 (ou l'alias claude-haiku-4-5) vers claude-sonnet-5.thinking: {type: "enabled", budget_tokens: N} (renvoie une erreur 400). La réflexion adaptative est activée par défaut ; passez thinking: {type: "disabled"} pour préserver le comportement sans réflexion, et réexaminez max_tokens pour les charges de travail qui s'exécutaient sans réflexion.high) pour contrôler la profondeur de réflexion et la dépense en tokens ; il n'est pas disponible sur Claude Haiku 4.5, donc aucun réglage existant n'est transféré.temperature et top_p (les valeurs non par défaut renvoient une erreur 400 sur Claude Sonnet 5).max_tokens, que vous pouvez augmenter jusqu'au maximum de 128k.stop_reason: "refusal" si votre charge de travail peut toucher à des sujets de cybersécurité.Claude Haiku 4.5 est le modèle Haiku le plus rapide et le plus intelligent avec des performances proches de la frontière, offrant une qualité de modèle premium pour les applications interactives et le traitement à haut volume.
Pour un aperçu complet des capacités, consultez la vue d'ensemble des modèles.
Mettez à jour le nom de votre modèle :
# De Haiku 3.5
model = "claude-3-5-haiku-20241022" # Before
model = "claude-haiku-4-5-20251001" # AfterExaminez les nouvelles limites de débit : Haiku 4.5 a des limites de débit distinctes de Haiku 3.5. Consultez la documentation sur les limites de débit pour plus de détails.
Explorez les nouvelles capacités : Consultez la vue d'ensemble des modèles pour plus de détails sur la conscience du contexte, la capacité de sortie accrue (64k tokens), l'intelligence supérieure et la vitesse améliorée.
Ces changements incompatibles s'appliquent lors de la migration depuis les modèles Claude 3.x Haiku.
Mettez à jour les paramètres d'échantillonnage
Utilisez uniquement temperature OU top_p, pas les deux. Définir les deux renvoie une erreur 400 sur Claude Haiku 4.5.
Mettez à jour les versions des outils
Mettez à jour vers les dernières versions des outils (text_editor_20250728, code_execution_20250825). Supprimez tout code utilisant la commande undo_edit.
Gérez la raison d'arrêt refusal
Mettez à jour votre application pour gérer les raisons d'arrêt refusal.
Mettez à jour vos prompts pour les changements de comportement
Les modèles Claude 4 ont un style de communication plus concis et direct. Consultez les bonnes pratiques de prompting pour des conseils d'optimisation.
claude-haiku-4-5-20251001text_editor_20250728, code_execution_20250825) ; les versions héritées ne sont pas prises en chargeundo_edit (le cas échéant)temperature OU top_p, pas les deux (définir les deux renvoie une erreur 400)refusal dans votre applicationWas this page helpful?