Claude Opus 5 représente une amélioration majeure par rapport à Claude Opus 4.8, avec les gains les plus importants dans le raisonnement approfondi, les tâches agentiques et à long horizon, et la mise à l'échelle du calcul au moment du test. Cette page résume toutes les nouveautés de Claude Opus 5, notamment la réflexion activée par défaut, les changements d'outils en cours de conversation, et un changement incompatible concernant les conditions dans lesquelles la réflexion peut être désactivée.
| Modèle | ID de modèle API | Description |
|---|---|---|
| Claude Opus 5 | claude-opus-5 | Pour le codage agentique complexe et le travail en entreprise |
Claude Opus 5 dispose d'une fenêtre de contexte de 1 million de tokens (1 million de tokens est à la fois la valeur par défaut et le maximum ; il n'existe pas de variante avec un contexte plus petit), de 128k tokens de sortie maximum, et de la réflexion activée par défaut.
Pour la tarification complète et les spécifications, consultez la vue d'ensemble des modèles.
Vous pouvez ajouter ou supprimer des outils entre les tours d'une conversation tout en préservant le cache de prompt, au lieu de renvoyer une liste d'outils fixe pendant toute la durée d'une session. Les changements d'outils en cours de conversation sont en bêta : incluez l'en-tête bêta mid-conversation-tool-changes-2026-07-01 dans vos requêtes. Consultez Changements d'outils en cours de conversation pour l'utilisation.
Le paramètre fallbacks prend en charge un nouveau mode "default", qui applique les modèles de repli recommandés par Anthropic par catégorie de refus au lieu d'une liste de modèles que vous maintenez vous-même. L'ensemble du paramètre fallbacks est en bêta. Utilisez l'en-tête bêta server-side-fallback-2026-07-01, qui prend en charge à la fois le mode "default" et les listes de modèles explicites (l'en-tête antérieur server-side-fallback-2026-06-01 n'accepte que les listes explicites). Consultez Refus et repli.
La longueur minimale de prompt pouvant être mise en cache sur Claude Opus 5 est de 512 tokens, contre 1 024 tokens sur Claude Opus 4.8. Les prompts qui étaient trop courts pour être mis en cache sur Claude Opus 4.8 peuvent désormais créer des entrées de cache sans modification de code. Consultez Mise en cache des prompts pour les minimums par modèle.
Le mode rapide (aperçu de recherche) est disponible pour Claude Opus 5 uniquement sur l'API Claude ; il n'est actuellement pas disponible sur Amazon Bedrock, Google Cloud ou Microsoft Foundry. Le mode rapide pour Claude Opus 5 est facturé 10 USD par million de tokens d'entrée et 50 USD par million de tokens de sortie. Consultez Mode rapide pour l'accès, les modèles pris en charge et la tarification.
Sur Claude Opus 4.8, les requêtes s'exécutent sans réflexion à moins que vous ne définissiez thinking: {"type": "adaptive"}. Sur Claude Opus 5, les mêmes requêtes s'exécutent avec la réflexion activée : le modèle décide quand et combien réfléchir à chaque tour, et le paramètre d'effort est le contrôle de la profondeur de réflexion. La valeur transmise reste inchangée ; thinking: {"type": "adaptive"} reste valide et équivalent au comportement par défaut.
Étant donné que max_tokens est une limite stricte sur la sortie totale (réflexion plus texte de réponse), réexaminez-le pour les charges de travail qui s'exécutaient sans réflexion sur Claude Opus 4.8.
L'API conserve l'option de désactiver la réflexion, sous réserve de la restriction d'effort ci-dessous.
Claude Opus 5 convertit l'effort supplémentaire en meilleurs résultats de manière plus fiable que tout modèle Opus antérieur, de sorte que le niveau d'effort que vous choisissez a plus de poids. L'échelle complète est disponible : low, medium, high, xhigh et max, avec max comme niveau supérieur pour le raisonnement le plus approfondi possible. Commencez au niveau par défaut, high, et ajustez dans l'une ou l'autre direction en fonction de vos évaluations : descendez lorsque la qualité se maintient pour économiser des tokens et de la latence, ou montez pour les travaux les plus exigeants. Lorsque vous exécutez avec un effort xhigh ou max, définissez un max_tokens élevé afin que le modèle ait de la marge pour réfléchir et agir à travers les sous-agents et les appels d'outils.
Cette requête pousse l'effort au maximum avec max :
client = anthropic.Anthropic()
with client.messages.stream(
model="claude-opus-5",
max_tokens=64000,
output_config={"effort": "max"},
messages=[
{
"role": "user",
"content": "Explain why the sum of two even numbers is always even.",
}
],
) as stream:
response = stream.get_final_message()
print(response)La réflexion est activée par défaut sur Claude Opus 5, donc aucun champ thinking n'est nécessaire.
high ou inférieurSur Claude Opus 5, thinking: {"type": "disabled"} n'est accepté que lorsque le niveau d'effort est high ou inférieur. Définir thinking: {"type": "disabled"} avec un effort xhigh ou max renvoie une erreur 400. Il s'agit d'un comportement en disponibilité générale à partir de Claude Opus 5, appliqué à chaque requête, et c'est un changement incompatible par rapport à Claude Opus 4.8, où la désactivation de la réflexion était indépendante du niveau d'effort. Si vous désactivez actuellement la réflexion à des niveaux d'effort élevés, soit conservez la réflexion désactivée et définissez l'effort à high ou inférieur, soit conservez le niveau d'effort et supprimez le champ thinking.
Avec la réflexion désactivée, Claude Opus 5 peut occasionnellement écrire un appel d'outil dans sa sortie texte au lieu d'émettre un bloc tool_use, ou inclure des balises XML internes dans sa réponse visible. Dans la mesure du possible, gardez la réflexion activée et contrôlez le coût en tokens avec des niveaux d'effort inférieurs ; pour les intégrations qui doivent garder la réflexion désactivée, consultez Exécution avec la réflexion désactivée pour des mesures d'atténuation par prompting.
Au-delà des changements d'API ci-dessus, Claude Opus 5 se comporte différemment de Claude Opus 4.8 d'une manière que vous pourriez remarquer sans modifier aucun code. Les réponses par défaut destinées à l'utilisateur et les livrables écrits sont plus longs. Dans les sessions agentiques, le modèle narre sa progression à l'utilisateur plus souvent. Dans les frameworks multi-agents, il délègue aux sous-agents plus volontiers. Il vérifie également son propre travail sans qu'on le lui demande, donc supprimez les instructions de vérification héritées des modèles antérieurs (« inclure une étape de vérification finale », « utiliser un sous-agent pour vérifier ») ; elles provoquent une sur-vérification sur Claude Opus 5. Pour les patterns de prompting qui ajustent chacun de ces comportements, consultez Prompting de Claude Opus 5.
Comparé à Claude Opus 4.8, Claude Opus 5 représente une amélioration majeure plutôt qu'incrémentale, et il offre une intelligence de pointe à la moitié du coût de Claude Fable 5. Les gains les plus importants concernent :
max) en meilleurs résultats.low et medium produisant une qualité solide pour une fraction des tokens et de la latence des réglages supérieurs.Pour les patterns de prompting qui tirent le meilleur parti de ces capacités, consultez Prompting de Claude Opus 5.
Claude Opus 5 est facturé 5 USD par million de tokens d'entrée et 25 USD par million de tokens de sortie, inchangé par rapport à Claude Opus 4.8.
Consultez Tarification pour la tarification complète, y compris le traitement par lots, la mise en cache des prompts et les tarifs du mode rapide.
Claude Opus 5 est disponible sur :
claude-opus-5.anthropic.claude-opus-5. Claude Opus 5 est également accessible via l'API InvokeModel sur bedrock-runtime, servi par la même infrastructure ; l'intégration Claude sur Amazon Bedrock (héritée) ne l'inclut pas dans sa table d'ID de modèle versionnés par ARN.claude-opus-5.Claude Opus 4.8 reste disponible sur toutes ces plateformes.
Pour migrer depuis Claude Opus 4.8, mettez à jour votre ID de modèle :
model = "claude-opus-4-8" # Before
model = "claude-opus-5" # AfterEnsuite, examinez les deux changements de comportement : la réflexion est activée par défaut, et désactiver la réflexion avec un effort xhigh ou max renvoie une erreur 400. Consultez le guide de migration pour des instructions étape par étape.
Spécifications complètes et tarification pour tous les modèles Claude actuels.
Différences de comportement et patterns de prompting spécifiques à Claude Opus 5.
Contrôlez le nombre de tokens que Claude utilise lors de ses réponses, de low à max.
Comment fonctionne la réflexion lorsqu'elle est activée par défaut, et quand elle peut être désactivée.
Donnez à Claude un budget de tokens indicatif pour cadencer son travail.
Guide pour migrer vers les derniers modèles Claude depuis les versions précédentes de Claude.
Obtenez un débit de tokens de sortie par seconde plus élevé des modèles Claude Opus à un tarif premium.
Was this page helpful?