Il existe deux types de limites :
L'API applique des limites configurées par le service au niveau de l'organisation, mais vous pouvez également définir des limites configurables par l'utilisateur pour les espaces de travail de votre organisation.
Chacun des niveaux Start, Build et Scale comporte un plafond de dépenses mensuel, qui correspond au montant maximal que votre organisation peut dépenser sur l'API chaque mois civil. Une fois que vous atteignez le plafond de dépenses de votre niveau, l'utilisation de l'API est suspendue jusqu'au mois suivant, sauf si vous demandez une limite plus élevée. Vous pouvez consulter le plafond de dépenses mensuel de votre organisation et définir votre propre limite sur la page Billing (Facturation).
| Niveau d'utilisation | Plafond de dépenses mensuel |
|---|---|
| Start | 500 $ USD |
| Build | 1 000 $ USD |
| Scale | 200 000 $ USD |
Les organisations du niveau Custom n'ont pas de plafond de dépenses mensuel ; les limites sont convenues avec leur équipe de compte.
Vous pouvez également définir votre propre limite de dépenses en dessous du plafond de votre niveau pour contrôler les coûts :
Accédez à la page Billing
Rendez-vous sur Settings > Billing dans la Claude Console.
Ouvrez l'éditeur de limite de dépenses
Dans la section Spend limits (Limites de dépenses), cliquez sur Adjust limit (Ajuster la limite), ou sur Set limit (Définir une limite) si aucune limite n'est actuellement définie.
Ajustez votre limite de dépenses
Saisissez une nouvelle valeur. Votre limite de dépenses ne peut pas dépasser le plafond de votre niveau actuel.
Les limites de débit pour l'API Messages sont mesurées en requêtes par minute (RPM), en « input tokens per minute » (tokens d'entrée par minute), ou ITPM, et en « output tokens per minute » (tokens de sortie par minute), ou OTPM, pour chaque classe de modèle.
Si vous dépassez l'une des limites de débit, vous obtiendrez une erreur 429 décrivant quelle limite de débit a été dépassée, ainsi qu'un en-tête retry-after indiquant combien de temps attendre.
De nombreux fournisseurs d'API utilisent une limite combinée de « tokens per minute » (tokens par minute), ou TPM, qui peut inclure tous les tokens, mis en cache ou non, en entrée comme en sortie. Pour la plupart des modèles Claude, seuls les tokens d'entrée non mis en cache comptent dans vos limites de débit ITPM. Il s'agit d'un avantage clé qui rend les limites de débit effectivement plus élevées qu'elles ne pourraient le paraître initialement.
Les limites de débit ITPM sont estimées au début de chaque requête, et l'estimation est ajustée pendant la requête pour refléter le nombre réel de tokens d'entrée utilisés.
Voici ce qui compte dans l'ITPM :
input_tokens (tokens après le dernier point de rupture de cache) ✓ Comptent dans l'ITPMcache_creation_input_tokens (tokens en cours d'écriture dans le cache) ✓ Comptent dans l'ITPMcache_read_input_tokens (tokens lus depuis le cache) ✗ Ne comptent PAS dans l'ITPM pour la plupart des modèlesExemple : Avec une limite ITPM de 2 000 000 et un taux de succès du cache de 80 %, vous pourriez effectivement traiter 10 000 000 de tokens d'entrée au total par minute (2 M non mis en cache + 8 M mis en cache), car les tokens mis en cache ne comptent pas dans votre limite de débit.
Les limites de débit OTPM sont évaluées en temps réel à mesure que les tokens de sortie sont produits, en ne comptant que les tokens réellement générés. Le paramètre max_tokens n'entre pas dans le calcul des limites de débit OTPM, il n'y a donc aucun inconvénient en matière de limite de débit à définir une valeur max_tokens plus élevée.
Les limites de débit sont appliquées séparément pour chaque modèle ; vous pouvez donc utiliser différents modèles jusqu'à leurs limites respectives simultanément. Vous pouvez vérifier vos limites de débit actuelles et leur comportement sur la page Rate limits dans la Claude Console, ou lire les limites configurées par programmation avec l'API Rate Limits.
| Modèle | Requêtes maximales par minute (RPM) | Tokens d'entrée maximaux par minute (ITPM) | Tokens de sortie maximaux par minute (OTPM) |
|---|---|---|---|
| Claude Fable 5 | 1 000 | 500 000 | 100 000 |
| Claude Opus 5 | 1 000 | 2 000 000 | 400 000 |
| Claude Opus 4.x* | 1 000 | 2 000 000 | 400 000 |
| Claude Sonnet 5 | 1 000 | 2 000 000 | 400 000 |
| Claude Sonnet 4.x** | 1 000 | 2 000 000 | 400 000 |
| Claude Haiku 4.5 | 1 000 | 2 000 000 | 400 000 |
| Claude Haiku 3.5 (retiré, sauf sur Bedrock et Google Cloud) | 1 000 | 100 000† | 20 000 |
* La limite de débit Opus est une limite totale qui s'applique au trafic combiné de Claude Opus 4.8, Opus 4.7, Opus 4.6 et Opus 4.5. Claude Opus 5 dispose d'une limite de débit distincte et ne fait pas partie de ce compartiment combiné.
** La limite de débit Sonnet 4.x est une limite totale qui s'applique au trafic combiné de Sonnet 4.6 et Sonnet 4.5. Claude Sonnet 5 dispose d'une limite de débit distincte et ne fait pas partie de ce compartiment combiné.
† La limite compte les cache_read_input_tokens dans l'utilisation ITPM.
L'API Message Batches possède son propre ensemble de limites de débit qui sont partagées entre tous les modèles. Celles-ci incluent une limite de requêtes par minute (RPM) pour tous les points de terminaison de l'API et une limite sur le nombre de requêtes de lot pouvant se trouver dans la file d'attente de traitement en même temps. Une « requête de lot » désigne ici une partie d'un Message Batch. Vous pouvez créer un Message Batch contenant des milliers de requêtes de lot, chacune comptant dans cette limite. Une requête de lot est considérée comme faisant partie de la file d'attente de traitement tant qu'elle n'a pas encore été traitée avec succès par le modèle.
| Requêtes maximales par minute (RPM) | Requêtes de lot maximales dans la file d'attente de traitement | Requêtes de lot maximales par lot |
|---|---|---|
| 1 000 | 200 000 | 100 000 |
Les points de terminaison des agents gérés Claude sont soumis à des limites de débit par organisation. Ces limites sont distinctes des limites de débit de l'API Messages ci-dessus.
| Opération | Limite |
|---|---|
| Points de terminaison de création (par exemple, agents, sessions et environnements) | 300 requêtes par minute |
| Points de terminaison de lecture (par exemple, récupération, liste et streaming) | 1 200 requêtes par minute |
Lorsque vous utilisez le mode rapide (aperçu de recherche) avec speed: "fast" sur Claude Opus 5 ou Opus 4.8, des limites de débit dédiées s'appliquent, distinctes des limites de débit standard d'Opus. Lorsque les limites de débit du mode rapide sont dépassées, l'API renvoie une erreur 429 avec un en-tête retry-after. Le mode rapide n'est pas disponible sur Claude Opus 4.7 (les requêtes renvoient une erreur) ni sur Claude Opus 4.6 (les requêtes vers claude-opus-4-6 avec speed: "fast" s'exécutent à vitesse standard). Consultez Mode rapide.
La réponse inclut des en-têtes anthropic-fast-* qui indiquent l'état de votre limite de débit en mode rapide. Consultez Limites de débit du mode rapide pour plus de détails sur ces en-têtes.
Vous pouvez surveiller votre utilisation des limites de débit sur la page Usage de la Claude Console.
En plus de fournir des graphiques de tokens et de requêtes, la page Usage propose deux graphiques distincts de limites de débit. Utilisez ces graphiques pour voir la marge de croissance dont vous disposez, identifier les moments où vous pourriez atteindre un pic d'utilisation, comprendre quelles limites de débit demander et apprendre à améliorer vos taux de mise en cache. Les graphiques visualisent un certain nombre de métriques pour une limite de débit donnée (par exemple, par modèle) :
Pour demander des limites de débit plus élevées ou un plafond de dépenses mensuel plus élevé, utilisez Request rate limit increase (Demander une augmentation de limite de débit) sur la page Rate limits.
Pour en savoir plus sur les espaces de travail, consultez Espaces de travail.
Pour protéger les espaces de travail de votre organisation contre une surutilisation potentielle, vous pouvez définir des limites de dépenses et de débit personnalisées par espace de travail.
Exemple : si la limite de votre organisation est de 40 000 tokens d'entrée par minute et de 8 000 tokens de sortie par minute, vous pourriez limiter un espace de travail à 30 000 tokens d'entrée par minute. Cela protège les autres espaces de travail contre une surutilisation potentielle et assure une répartition plus équitable des ressources au sein de votre organisation. Les tokens par minute restants non utilisés (ou davantage, si cet espace de travail n'utilise pas la limite) sont alors disponibles pour les autres espaces de travail.
Remarque :
Pour lire vos limites de débit actuelles d'organisation et d'espace de travail par programmation, utilisez l'API Rate Limits.
La réponse de l'API inclut des en-têtes qui vous indiquent la limite de débit appliquée, l'utilisation actuelle et le moment où la limite sera réinitialisée.
Les en-têtes suivants sont renvoyés :
| En-tête | Description |
|---|---|
retry-after | Le nombre de secondes à attendre avant de pouvoir réessayer la requête. Les tentatives antérieures échoueront. |
anthropic-ratelimit-requests-limit | Le nombre maximal de requêtes autorisées au cours de toute période de limite de débit. |
anthropic-ratelimit-requests-remaining | Le nombre de requêtes restantes avant d'être limité en débit. |
anthropic-ratelimit-requests-reset | Le moment où la limite de débit des requêtes sera entièrement reconstituée, fourni au format RFC 3339. |
anthropic-ratelimit-tokens-limit | Le nombre maximal de tokens autorisés au cours de toute période de limite de débit. |
anthropic-ratelimit-tokens-remaining | Le nombre de tokens restants (arrondi au millier le plus proche) avant d'être limité en débit. |
anthropic-ratelimit-tokens-reset | Le moment où la limite de débit des tokens sera entièrement reconstituée, fourni au format RFC 3339. |
anthropic-ratelimit-input-tokens-limit | Le nombre maximal de tokens d'entrée autorisés au cours de toute période de limite de débit. |
anthropic-ratelimit-input-tokens-remaining | Le nombre de tokens d'entrée restants (arrondi au millier le plus proche) avant d'être limité en débit. |
anthropic-ratelimit-input-tokens-reset | Le moment où la limite de débit des tokens d'entrée sera entièrement reconstituée, fourni au format RFC 3339. |
anthropic-ratelimit-output-tokens-limit | Le nombre maximal de tokens de sortie autorisés au cours de toute période de limite de débit. |
anthropic-ratelimit-output-tokens-remaining | Le nombre de tokens de sortie restants (arrondi au millier le plus proche) avant d'être limité en débit. |
anthropic-ratelimit-output-tokens-reset | Le moment où la limite de débit des tokens de sortie sera entièrement reconstituée, fourni au format RFC 3339. |
anthropic-priority-input-tokens-limit | Le nombre maximal de tokens d'entrée Priority Tier autorisés au cours de toute période de limite de débit. (Priority Tier uniquement) |
anthropic-priority-input-tokens-remaining | Le nombre de tokens d'entrée Priority Tier restants (arrondi au millier le plus proche) avant d'être limité en débit. (Priority Tier uniquement) |
anthropic-priority-input-tokens-reset | Le moment où la limite de débit des tokens d'entrée Priority Tier sera entièrement reconstituée, fourni au format RFC 3339. (Priority Tier uniquement) |
anthropic-priority-output-tokens-limit | Le nombre maximal de tokens de sortie Priority Tier autorisés au cours de toute période de limite de débit. (Priority Tier uniquement) |
anthropic-priority-output-tokens-remaining | Le nombre de tokens de sortie Priority Tier restants (arrondi au millier le plus proche) avant d'être limité en débit. (Priority Tier uniquement) |
anthropic-priority-output-tokens-reset | Le moment où la limite de débit des tokens de sortie Priority Tier sera entièrement reconstituée, fourni au format RFC 3339. (Priority Tier uniquement) |
Les en-têtes anthropic-ratelimit-tokens-* affichent les valeurs de la limite la plus restrictive actuellement en vigueur. Par exemple, si vous avez dépassé la limite de tokens par minute de l'espace de travail, les en-têtes contiendront les valeurs de limite de débit de tokens par minute de l'espace de travail. Si les limites d'espace de travail ne s'appliquent pas, les en-têtes renverront le total des tokens restants, où le total est la somme des tokens d'entrée et de sortie. Cette approche garantit que vous avez une visibilité sur la contrainte la plus pertinente concernant votre utilisation actuelle de l'API.
Was this page helpful?