Le mode rapide offre jusqu'à 2,5 fois plus de tokens de sortie par seconde avec Claude Opus 5 et Claude Opus 4.8, à un tarif premium. Définissez speed: "fast" avec l'en-tête bêta fast-mode-2026-02-01 dans votre requête pour l'activer.
Le mode rapide est pris en charge sur les modèles suivants :
Le mode rapide exécute le même modèle avec une configuration d'inférence plus rapide. Il n'y a aucun changement en matière d'intelligence ou de capacités.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Le mode rapide est facturé selon un multiplicateur appliqué aux tarifs standard sur l'ensemble de la fenêtre de contexte, y compris les requêtes dépassant 200k tokens d'entrée. Le tableau suivant présente la tarification du mode rapide pour les modèles pris en charge :
| Modèle | Entrée | Sortie |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | 10 $ USD / MTok | 50 $ USD / MTok |
La tarification du mode rapide se cumule avec d'autres modificateurs de tarification :
Pour les détails complets sur la tarification, consultez la page Tarification.
Le mode rapide dispose d'une limite de débit dédiée, distincte des limites de débit standard d'Opus. Lorsque votre limite de débit du mode rapide est dépassée, l'API renvoie une erreur 429 avec un en-tête retry-after indiquant quand la capacité sera disponible.
La réponse inclut des en-têtes qui indiquent l'état de votre limite de débit du mode rapide :
| En-tête | Description |
|---|---|
anthropic-fast-input-tokens-limit | Nombre maximal de tokens d'entrée en mode rapide par minute |
anthropic-fast-input-tokens-remaining | Tokens d'entrée en mode rapide restants |
anthropic-fast-input-tokens-reset | Heure à laquelle la limite de tokens d'entrée en mode rapide se réinitialise |
anthropic-fast-output-tokens-limit | Nombre maximal de tokens de sortie en mode rapide par minute |
anthropic-fast-output-tokens-remaining | Tokens de sortie en mode rapide restants |
anthropic-fast-output-tokens-reset | Heure à laquelle la limite de tokens de sortie en mode rapide se réinitialise |
Pour les limites de débit spécifiques à chaque niveau, consultez la page Limites de débit.
L'objet usage de la réponse inclut un champ speed qui indique quelle vitesse a été utilisée, soit "fast", soit "standard". Demander speed: "fast" sur un modèle qui ne prend pas en charge le mode rapide renvoie une erreur, tout comme le dépassement des limites de débit ou de la capacité du mode rapide (une erreur 429 ou 529). Lorsqu'une requête avec speed: "fast" réussit, usage.speed vaut "fast". Si vous utilisez Claude Opus 4.6 et demandez le mode rapide, son comportement est unique. Au lieu de renvoyer une erreur comme les autres modèles qui ne prennent pas en charge le mode rapide, il bascule silencieusement vers la vitesse standard. Bien qu'il n'y ait pas d'erreur avec Opus 4.6, le champ speed indique correctement "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Pour suivre l'utilisation et les coûts du mode rapide dans votre organisation, consultez l'API Usage and Cost.
Lorsque les limites de débit du mode rapide sont dépassées, l'API renvoie une erreur 429 avec un en-tête retry-after. Les SDK Anthropic réessaient automatiquement ces requêtes jusqu'à 2 fois par défaut (configurable avec max_retries), en attendant le délai spécifié par le serveur avant chaque nouvelle tentative. Comme le mode rapide utilise un réapprovisionnement continu des tokens, le délai retry-after est généralement court et les requêtes réussissent dès que la capacité est disponible.
Si vous préférez basculer vers la vitesse standard plutôt que d'attendre la capacité du mode rapide, interceptez l'erreur de limite de débit et réessayez sans speed: "fast". Définissez max_retries à 0 sur la requête rapide initiale pour ignorer les nouvelles tentatives automatiques et échouer immédiatement en cas d'erreur de limite de débit.
Comme définir max_retries à 0 désactive également les nouvelles tentatives pour d'autres erreurs transitoires (surcharge, erreurs internes du serveur), les exemples suivants réémettent la requête d'origine avec les nouvelles tentatives par défaut pour ces cas.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Obtenez des résultats JSON validés à partir de workflows d'agents.
Découvrez la structure tarifaire d'Anthropic pour les modèles et les fonctionnalités.
Contrôlez le nombre de tokens que Claude utilise lors de ses réponses avec le paramètre effort, en arbitrant entre l'exhaustivité des réponses et l'efficacité en tokens.
Diffusez les réponses de l'API Messages de manière incrémentale avec des événements envoyés par le serveur, y compris les deltas de texte, d'utilisation d'outils et de réflexion étendue.
Was this page helpful?