Esistono due tipi di limiti:
L'API applica limiti configurati dal servizio a livello di organizzazione, ma puoi anche impostare limiti configurabili dall'utente per i workspace della tua organizzazione.
Ciascuno dei livelli Start, Build e Scale prevede un tetto di spesa mensile, che è il massimo che la tua organizzazione può spendere sull'API ogni mese di calendario. Una volta raggiunto il tetto di spesa del tuo livello, l'utilizzo dell'API viene sospeso fino al mese successivo, a meno che tu non richieda un limite più elevato. Puoi visualizzare il tetto di spesa mensile della tua organizzazione e impostare il tuo limite nella pagina Billing.
| Livello di utilizzo | Tetto di spesa mensile |
|---|---|
| Start | $500 USD |
| Build | $1.000 USD |
| Scale | $200.000 USD |
Le organizzazioni nel livello Custom non hanno un tetto di spesa mensile; i limiti vengono concordati con il loro team di account.
Puoi anche impostare il tuo limite di spesa al di sotto del tetto del tuo livello per controllare i costi:
Vai alla pagina Billing
Vai a Settings > Billing nella Claude Console.
Apri l'editor del limite di spesa
Nella sezione Spend limits, fai clic su Adjust limit (o Set limit se non è attualmente impostato alcun limite).
Modifica il tuo limite di spesa
Inserisci un nuovo valore. Il tuo limite di spesa non può superare il tetto del tuo livello attuale.
I limiti di velocità per la Messages API sono misurati in richieste al minuto (RPM), token di input al minuto (ITPM) e token di output al minuto (OTPM) per ciascuna classe di modello.
Se superi uno qualsiasi dei limiti di velocità, riceverai un errore 429 che descrive quale limite di velocità è stato superato, insieme a un header retry-after che indica quanto tempo attendere.
Molti provider di API utilizzano un limite combinato di "token al minuto" (TPM) che può includere tutti i token, sia memorizzati nella cache che non, sia di input che di output. Per la maggior parte dei modelli Claude, solo i token di input non memorizzati nella cache contano ai fini dei tuoi limiti di velocità ITPM. Questo è un vantaggio chiave che rende i limiti di velocità effettivamente più elevati di quanto potrebbero inizialmente apparire.
I limiti di velocità ITPM vengono stimati all'inizio di ogni richiesta, e la stima viene adeguata durante la richiesta per riflettere il numero effettivo di token di input utilizzati.
Ecco cosa conta ai fini dell'ITPM:
input_tokens (token dopo l'ultimo breakpoint della cache) ✓ Contano ai fini dell'ITPMcache_creation_input_tokens (token scritti nella cache) ✓ Contano ai fini dell'ITPMcache_read_input_tokens (token letti dalla cache) ✗ NON contano ai fini dell'ITPM per la maggior parte dei modelliEsempio: Con un limite ITPM di 2.000.000 e un tasso di cache hit dell'80%, potresti effettivamente elaborare 10.000.000 di token di input totali al minuto (2M non memorizzati nella cache + 8M memorizzati nella cache), perché i token memorizzati nella cache non contano ai fini del tuo limite di velocità.
I limiti di velocità OTPM vengono valutati in tempo reale man mano che i token di output vengono prodotti, contando solo i token effettivamente generati. Il parametro max_tokens non influisce sui calcoli del limite di velocità OTPM, quindi non c'è alcuno svantaggio in termini di limite di velocità nell'impostare un valore max_tokens più elevato.
I limiti di velocità vengono applicati separatamente per ciascun modello; pertanto puoi utilizzare modelli diversi fino ai rispettivi limiti simultaneamente. Puoi controllare i tuoi limiti di velocità attuali e il comportamento nella pagina Rate limits nella Claude Console, oppure leggere i limiti configurati programmaticamente con la Rate Limits API.
| Modello | Richieste massime al minuto (RPM) | Token di input massimi al minuto (ITPM) | Token di output massimi al minuto (OTPM) |
|---|---|---|---|
| Claude Fable 5 | 1.000 | 500.000 | 100.000 |
| Claude Opus 5 | 1.000 | 2.000.000 | 400.000 |
| Claude Opus 4.x* | 1.000 | 2.000.000 | 400.000 |
| Claude Sonnet 5 | 1.000 | 2.000.000 | 400.000 |
| Claude Sonnet 4.x** | 1.000 | 2.000.000 | 400.000 |
| Claude Haiku 4.5 | 1.000 | 2.000.000 | 400.000 |
| Claude Haiku 3.5 (ritirato, eccetto su Bedrock e Google Cloud) | 1.000 | 100.000† | 20.000 |
* Il limite di velocità di Opus è un limite totale che si applica al traffico combinato di Claude Opus 4.8, Opus 4.7, Opus 4.6 e Opus 4.5. Claude Opus 5 ha un limite di velocità separato e non fa parte di questo bucket combinato.
** Il limite di velocità di Sonnet 4.x è un limite totale che si applica al traffico combinato di Sonnet 4.6 e Sonnet 4.5. Claude Sonnet 5 ha un limite di velocità separato e non fa parte di questo bucket combinato.
† Il limite conta cache_read_input_tokens ai fini dell'utilizzo ITPM.
La Message Batches API ha il proprio set di limiti di velocità che sono condivisi tra tutti i modelli. Questi includono un limite di richieste al minuto (RPM) per tutti gli endpoint API e un limite sul numero di richieste batch che possono essere nella coda di elaborazione contemporaneamente. Una "richiesta batch" qui si riferisce a una parte di un Message Batch. Puoi creare un Message Batch contenente migliaia di richieste batch, ciascuna delle quali conta ai fini di questo limite. Una richiesta batch è considerata parte della coda di elaborazione quando non è ancora stata elaborata con successo dal modello.
| Richieste massime al minuto (RPM) | Richieste batch massime nella coda di elaborazione | Richieste batch massime per batch |
|---|---|---|
| 1.000 | 200.000 | 100.000 |
Gli endpoint di Claude Managed Agents hanno limiti di velocità per organizzazione. Questi limiti sono separati dai limiti di velocità della Messages API sopra indicati.
| Operazione | Limite |
|---|---|
| Endpoint di creazione (ad esempio, agenti, sessioni e ambienti) | 300 richieste al minuto |
| Endpoint di lettura (ad esempio, recupero, elenco e stream) | 1.200 richieste al minuto |
Quando si utilizza la fast mode (anteprima di ricerca) con speed: "fast" su Claude Opus 5 o Opus 4.8, si applicano limiti di velocità dedicati che sono separati dai limiti di velocità standard di Opus. Quando i limiti di velocità della fast mode vengono superati, l'API restituisce un errore 429 con un header retry-after. La fast mode non è disponibile su Claude Opus 4.7 (le richieste restituiscono un errore) o Claude Opus 4.6 (le richieste a claude-opus-4-6 con speed: "fast" vengono eseguite a velocità standard). Consulta Fast mode.
La risposta include header anthropic-fast-* che indicano lo stato del tuo limite di velocità della fast mode. Consulta Limiti di velocità della fast mode per i dettagli su questi header.
Puoi monitorare l'utilizzo dei tuoi limiti di velocità nella pagina Usage della Claude Console.
Oltre a fornire grafici di token e richieste, la pagina Usage fornisce due grafici separati dei limiti di velocità. Usa questi grafici per vedere quanto margine hai per crescere, identificare quando potresti raggiungere il picco di utilizzo, capire quali limiti di velocità richiedere e imparare come migliorare i tuoi tassi di caching. I grafici visualizzano una serie di metriche per un determinato limite di velocità (ad esempio, per modello):
Per richiedere limiti di velocità più elevati o un tetto di spesa mensile più elevato, usa Request rate limit increase nella pagina Rate limits.
Per ulteriori informazioni sui workspace, consulta Workspace.
Per proteggere i Workspace nella tua Organizzazione da un potenziale uso eccessivo, puoi impostare limiti di spesa e di velocità personalizzati per Workspace.
Esempio: se il limite della tua Organizzazione è di 40.000 token di input al minuto e 8.000 token di output al minuto, potresti limitare un Workspace a 30.000 token di input al minuto. Questo protegge gli altri Workspace da un potenziale uso eccessivo e garantisce una distribuzione più equa delle risorse nella tua Organizzazione. I restanti token al minuto non utilizzati (o più, se quel Workspace non utilizza il limite) sono quindi disponibili per l'uso da parte di altri Workspace.
Nota:
Per leggere programmaticamente i tuoi attuali limiti di velocità dell'organizzazione e dei workspace, usa la Rate Limits API.
La risposta dell'API include header che mostrano il limite di velocità applicato, l'utilizzo corrente e quando il limite verrà reimpostato.
Vengono restituiti i seguenti header:
| Header | Descrizione |
|---|---|
retry-after | Il numero di secondi da attendere prima di poter riprovare la richiesta. I tentativi precedenti falliranno. |
anthropic-ratelimit-requests-limit | Il numero massimo di richieste consentite in qualsiasi periodo di limite di velocità. |
anthropic-ratelimit-requests-remaining | Il numero di richieste rimanenti prima di essere limitati. |
anthropic-ratelimit-requests-reset | L'ora in cui il limite di velocità delle richieste sarà completamente reintegrato, fornita in formato RFC 3339. |
anthropic-ratelimit-tokens-limit | Il numero massimo di token consentiti in qualsiasi periodo di limite di velocità. |
anthropic-ratelimit-tokens-remaining | Il numero di token rimanenti (arrotondato al migliaio più vicino) prima di essere limitati. |
anthropic-ratelimit-tokens-reset | L'ora in cui il limite di velocità dei token sarà completamente reintegrato, fornita in formato RFC 3339. |
anthropic-ratelimit-input-tokens-limit | Il numero massimo di token di input consentiti in qualsiasi periodo di limite di velocità. |
anthropic-ratelimit-input-tokens-remaining | Il numero di token di input rimanenti (arrotondato al migliaio più vicino) prima di essere limitati. |
anthropic-ratelimit-input-tokens-reset | L'ora in cui il limite di velocità dei token di input sarà completamente reintegrato, fornita in formato RFC 3339. |
anthropic-ratelimit-output-tokens-limit | Il numero massimo di token di output consentiti in qualsiasi periodo di limite di velocità. |
anthropic-ratelimit-output-tokens-remaining | Il numero di token di output rimanenti (arrotondato al migliaio più vicino) prima di essere limitati. |
anthropic-ratelimit-output-tokens-reset | L'ora in cui il limite di velocità dei token di output sarà completamente reintegrato, fornita in formato RFC 3339. |
anthropic-priority-input-tokens-limit | Il numero massimo di token di input Priority Tier consentiti in qualsiasi periodo di limite di velocità. (Solo Priority Tier) |
anthropic-priority-input-tokens-remaining | Il numero di token di input Priority Tier rimanenti (arrotondato al migliaio più vicino) prima di essere limitati. (Solo Priority Tier) |
anthropic-priority-input-tokens-reset | L'ora in cui il limite di velocità dei token di input Priority Tier sarà completamente reintegrato, fornita in formato RFC 3339. (Solo Priority Tier) |
anthropic-priority-output-tokens-limit | Il numero massimo di token di output Priority Tier consentiti in qualsiasi periodo di limite di velocità. (Solo Priority Tier) |
anthropic-priority-output-tokens-remaining | Il numero di token di output Priority Tier rimanenti (arrotondato al migliaio più vicino) prima di essere limitati. (Solo Priority Tier) |
anthropic-priority-output-tokens-reset | L'ora in cui il limite di velocità dei token di output Priority Tier sarà completamente reintegrato, fornita in formato RFC 3339. (Solo Priority Tier) |
Gli header anthropic-ratelimit-tokens-* mostrano i valori per il limite più restrittivo attualmente in vigore. Ad esempio, se hai superato il limite di token al minuto del Workspace, gli header conterranno i valori del limite di velocità dei token al minuto del Workspace. Se i limiti del Workspace non si applicano, gli header restituiranno i token totali rimanenti, dove il totale è la somma dei token di input e output. Questo approccio garantisce che tu abbia visibilità sul vincolo più rilevante per il tuo attuale utilizzo dell'API.
Was this page helpful?