Le paramètre « effort » (effort) vous permet de contrôler le nombre de tokens que Claude consacre à répondre aux requêtes. Vous pouvez arbitrer entre l'exhaustivité des réponses et l'efficacité en tokens avec un seul modèle. Le paramètre effort est disponible sur tous les modèles pris en charge sans nécessiter d'en-tête bêta.
Par défaut, Claude utilise un effort élevé, consacrant autant de tokens que nécessaire pour obtenir d'excellents résultats. Vous pouvez augmenter le niveau d'effort à max pour obtenir la capacité absolue la plus élevée, ou le réduire pour être plus économe en tokens, en optimisant la vitesse et le coût tout en acceptant une certaine réduction de capacité.
Le paramètre effort affecte tous les tokens de la réponse, notamment :
Cette approche présente deux avantages majeurs :
| Niveau | Description | Cas d'usage typique |
|---|---|---|
max | Capacité maximale absolue sans aucune contrainte sur la consommation de tokens. Disponible sur Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Mythos Preview, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5 et Claude Sonnet 4.6. | Tâches nécessitant le raisonnement le plus approfondi possible et l'analyse la plus exhaustive |
xhigh | Capacité étendue pour les travaux à long horizon. Disponible sur Claude Fable 5, Claude Mythos 5, Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7 et Claude Sonnet 5. | Tâches agentiques et de programmation de longue durée (plus de 30 minutes) avec des budgets de tokens se comptant en millions |
high | Capacité élevée. Équivalent à ne pas définir le paramètre. | Raisonnement complexe, problèmes de programmation difficiles, tâches agentiques |
medium | Approche équilibrée avec des économies de tokens modérées. | Tâches agentiques nécessitant un équilibre entre vitesse, coût et performance |
low | Le plus efficace. Économies de tokens significatives avec une certaine réduction de capacité. | Tâches plus simples nécessitant la meilleure vitesse et les coûts les plus bas, comme les sous-agents |
xhigh est un niveau plus récent ; certains modèles qui prennent en charge max ne prennent pas en charge xhigh.
Claude Sonnet 5 utilise par défaut l'effort high sur l'API Claude et Claude Code.
Sonnet 4.6 utilise par défaut l'effort high. Définissez explicitement l'effort lorsque vous utilisez Sonnet 4.6 pour éviter une latence inattendue :
Commencez par xhigh pour les cas d'usage de programmation et agentiques, et utilisez high comme minimum pour la plupart des charges de travail sensibles à l'intelligence. Descendez à medium pour les charges de travail sensibles au coût, ou montez à max uniquement lorsque vos évaluations montrent une marge de progression mesurable à xhigh.
La valeur par défaut de l'API est high. Pour utiliser xhigh, définissez effort explicitement ; la valeur que vous transmettez remplace la valeur par défaut.
| Effort | Recommandations pour Claude Opus 4.7 |
|---|---|
low | Efficace, mais idéal pour les tâches courtes et bien délimitées. Associez low à des listes de contrôle explicites si votre tâche comporte plusieurs sections. |
medium | Le choix de remplacement direct pour le flux de travail moyen où vous souhaitez de bons résultats tout en réduisant les coûts. |
high | Cas d'usage avancés qui nécessitent tout de même un équilibre entre intelligence et consommation de tokens. C'est souvent le meilleur équilibre entre qualité et efficacité en tokens. |
xhigh | Le point de départ recommandé pour le travail de programmation et agentique, ainsi que pour les tâches exploratoires telles que les appels d'outils répétés, la recherche web détaillée et la recherche dans des bases de connaissances. Attendez-vous à une consommation de tokens nettement plus élevée qu'avec high. |
max | À réserver aux problèmes véritablement à la frontière des capacités. Sur la plupart des charges de travail, max ajoute un coût significatif pour des gains de qualité relativement faibles, et sur certaines tâches à sortie structurée ou moins sensibles à l'intelligence, il peut conduire à une sur-réflexion. |
Claude Opus 4.7 respecte également les niveaux d'effort plus strictement que Claude Opus 4.6, en particulier à low et medium. À des niveaux d'effort plus faibles, le modèle limite son travail à ce qui a été demandé plutôt que d'en faire plus que nécessaire. Si vous observez un raisonnement superficiel sur des problèmes complexes avec Claude Opus 4.7, augmentez l'effort plutôt que de contourner le problème par le prompt. Si vous devez maintenir un effort faible pour des raisons de latence, ajoutez des indications ciblées comme « Cette tâche implique un raisonnement en plusieurs étapes. Réfléchissez attentivement avant de répondre. »
Lorsque vous exécutez Claude Opus 4.7 avec un effort xhigh ou max, définissez un max_tokens élevé afin que le modèle dispose de suffisamment d'espace pour réfléchir et agir à travers les sous-agents et les appels d'outils. Commencer à 64k tokens et ajuster à partir de là constitue une valeur par défaut raisonnable.
Les recommandations pour Claude Opus 4.7 s'appliquent également à Claude Opus 4.8. Commencez par xhigh pour les cas d'usage de programmation et agentiques, utilisez high pour la plupart des autres charges de travail sensibles à l'intelligence, et descendez à medium ou low uniquement lorsque vous avez mesuré que le niveau inférieur maintient la qualité sur vos évaluations.
La valeur par défaut de l'API est high. Définissez effort explicitement pour utiliser un niveau différent ; la valeur que vous transmettez remplace la valeur par défaut.
Lorsque vous exécutez Claude Opus 4.8 avec un effort xhigh ou max, définissez un max_tokens élevé afin que le modèle dispose de suffisamment d'espace pour réfléchir et agir à travers les sous-agents et les appels d'outils. Commencer à 64k tokens et ajuster à partir de là constitue une valeur par défaut raisonnable.
Claude Opus 5 prend en charge les cinq niveaux d'effort. Commencez par high, la valeur par défaut, et ajustez en fonction de vos évaluations : montez à xhigh pour les travaux de programmation et agentiques exigeants, ou à max lorsqu'une tâche justifie une consommation de tokens sans contrainte, et utilisez low et medium généreusement comme contrôle principal du coût en tokens et du temps de réponse partout où vos évaluations montrent que la qualité se maintient. Si vous avez repris des paramètres d'effort d'un modèle antérieur, effectuez un nouveau balayage des niveaux d'effort sur vos évaluations plutôt que de les réutiliser.
L'effort contrôle le volume de réflexion, pas la longueur visible de la réponse : sur Claude Opus 5, modifier l'effort ne raccourcit pas de manière fiable les réponses, donc utilisez le prompt pour contrôler la longueur à la place.
La valeur par défaut de l'API est high. Définissez effort explicitement pour utiliser un niveau différent ; la valeur que vous transmettez remplace la valeur par défaut.
Sur Claude Opus 5, la réflexion ne peut pas être désactivée avec un effort xhigh ou max : les requêtes qui définissent thinking: {"type": "disabled"} à ces niveaux renvoient une erreur 400. Consultez Effort avec réflexion.
Lorsque vous exécutez Claude Opus 5 avec un effort xhigh ou max, définissez un max_tokens élevé afin que le modèle dispose de suffisamment d'espace pour réfléchir et agir à travers les sous-agents et les appels d'outils. Commencer à 64k tokens et ajuster à partir de là constitue une valeur par défaut raisonnable.
L'effort est le contrôle principal pour arbitrer entre intelligence, latence et coût sur Claude Fable 5. Commencez par high, la valeur par défaut, pour la plupart des tâches, utilisez xhigh pour les charges de travail les plus sensibles à la capacité, et descendez à medium ou low pour le travail de routine. Les paramètres d'effort plus faibles sur Claude Fable 5 donnent tout de même de bons résultats et dépassent souvent les performances de xhigh sur les modèles précédents. À high et xhigh, définissez un max_tokens élevé : il s'agit d'une limite stricte sur la sortie totale, réflexion plus texte de réponse. Consultez Contrôle des coûts.
Réduisez l'effort si une tâche se termine mais prend plus de temps que nécessaire, ou si vous souhaitez un style de travail plus rapide et plus interactif. Les mêmes recommandations s'appliquent à Claude Mythos 5. Pour des conseils plus complets, consultez Rédiger des prompts pour Claude Fable 5.
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
messages=[
{
"role": "user",
"content": "Analyze the trade-offs between microservices and monolithic architectures",
}
],
output_config={"effort": "medium"},
)
for block in response.content:
if block.type == "text":
print(block.text)Lors de l'utilisation d'outils, le paramètre effort affecte à la fois les explications entourant les appels d'outils et les appels d'outils eux-mêmes. Les niveaux d'effort plus faibles ont tendance à :
Les niveaux d'effort plus élevés peuvent :
Le paramètre thinking contrôle si Claude réfléchit dans des blocs de réflexion avant de répondre ; le paramètre effort contrôle la quantité de travail que Claude consacre à l'ensemble de la réponse, ce qui, en mode adaptatif, inclut la fréquence et la profondeur de sa réflexion. Ne passez pas adaptive comme valeur d'effort : adaptive est un mode de réflexion, pas un niveau d'effort.
À des niveaux d'effort plus élevés, Claude réfléchit sur la plupart des requêtes et plus longuement ; à des niveaux plus faibles, il peut ignorer entièrement la réflexion pour les problèmes plus simples. Consultez Réflexion et effort pour des conseils complets sur la façon dont les deux contrôles fonctionnent ensemble.
Sur Claude Opus 4.5, le seul modèle à réflexion étendue uniquement qui prend en charge l'effort, celui-ci fonctionne conjointement avec budget_tokens : définissez le niveau d'effort pour votre tâche, puis définissez le budget de tokens de réflexion en fonction de la profondeur de raisonnement requise par la tâche.
Pour la disponibilité de la réflexion par modèle, consultez le tableau de configuration par modèle. L'effort fonctionne avec ou sans réflexion ; consultez Fonctionnement de l'effort.
output_config.effort est un paramètre au niveau de la requête : chaque requête porte sa propre valeur, donc pour exécuter une partie ultérieure d'une conversation à un niveau d'effort différent, définissez la nouvelle valeur sur la requête suivante. Le niveau d'effort s'applique à l'ensemble de la requête. Comme l'effort façonne le prompt rendu, le modifier entre les requêtes ne préserve pas les préfixes mis en cache des tours précédents ; si vous comptez sur la mise en cache des prompts au cours d'une longue session, choisissez un niveau d'effort au début et maintenez-le constant.
high par défaut, mais le bon point de départ dépend de votre modèle et de votre charge de travail.Donnez à Claude un budget de tokens indicatif pour la boucle agentique complète afin d'aider le modèle à s'autoréguler sur les tâches agentiques longues.
Comprenez la réflexion adaptative, où Claude décide quand et combien réfléchir, et orientez-la avec l'effort et le prompt.
Comprenez comment fonctionne la réflexion, quand Claude réfléchit par défaut et comment la réflexion interagit avec l'effort.
| Supported models |
|
|---|---|
| Supported platforms |
|
Was this page helpful?