제한에는 두 가지 유형이 있습니다:
API는 조직 수준에서 서비스 구성 제한을 적용하지만, 조직의 워크스페이스에 대해 사용자가 구성 가능한 제한을 설정할 수도 있습니다.
Start, Build, Scale 등급은 각각 월간 지출 상한이 있으며, 이는 조직이 매월 API에 지출할 수 있는 최대 금액입니다. 등급의 지출 상한에 도달하면 더 높은 제한을 요청하지 않는 한 다음 달까지 API 사용이 일시 중지됩니다. Billing 페이지에서 조직의 월간 지출 상한을 확인하고 자체 한도를 설정할 수 있습니다.
| 사용량 등급 | 월간 지출 상한 |
|---|---|
| Start | $500 USD |
| Build | $1,000 USD |
| Scale | $200,000 USD |
Custom 등급의 조직은 월간 지출 상한이 없으며, 제한은 계정 팀과 협의하여 결정됩니다.
비용을 관리하기 위해 등급의 상한보다 낮은 자체 지출 한도를 설정할 수도 있습니다:
Billing 페이지로 이동
Claude Console에서 Settings > Billing으로 이동하세요.
지출 한도 편집기 열기
Spend limits 섹션에서 Adjust limit(또는 현재 한도가 설정되지 않은 경우 Set limit)을 클릭하세요.
지출 한도 조정
새 값을 입력하세요. 지출 한도는 현재 등급의 상한을 초과할 수 없습니다.
Messages API의 속도 제한은 각 모델 클래스에 대해 분당 요청 수(RPM), 분당 입력 토큰 수(ITPM), 분당 출력 토큰 수(OTPM)로 측정됩니다.
속도 제한 중 하나라도 초과하면 어떤 속도 제한이 초과되었는지 설명하는 429 오류와 함께 대기 시간을 나타내는 retry-after 헤더를 받게 됩니다.
많은 API 제공업체는 캐시된 토큰과 캐시되지 않은 토큰, 입력 및 출력을 모두 포함할 수 있는 통합 "분당 토큰 수"(TPM) 제한을 사용합니다. 대부분의 Claude 모델에서는 캐시되지 않은 입력 토큰만 ITPM 속도 제한에 포함됩니다. 이는 속도 제한이 처음 보이는 것보다 실질적으로 더 높게 작용하도록 하는 주요 이점입니다.
ITPM 속도 제한은 각 요청 시작 시 추정되며, 요청 중에 실제 사용된 입력 토큰 수를 반영하도록 추정치가 조정됩니다.
ITPM에 포함되는 항목은 다음과 같습니다:
input_tokens (마지막 캐시 중단점 이후의 토큰) ✓ ITPM에 포함됨cache_creation_input_tokens (캐시에 기록되는 토큰) ✓ ITPM에 포함됨cache_read_input_tokens (캐시에서 읽은 토큰) ✗ 대부분의 모델에서 ITPM에 포함되지 않음예시: 2,000,000 ITPM 제한과 80% 캐시 적중률이 있는 경우, 캐시된 토큰은 속도 제한에 포함되지 않으므로 분당 총 10,000,000개의 입력 토큰(캐시되지 않은 2M + 캐시된 8M)을 실질적으로 처리할 수 있습니다.
OTPM 속도 제한은 출력 토큰이 생성됨에 따라 실시간으로 평가되며, 실제로 생성된 토큰만 계산합니다. max_tokens 매개변수는 OTPM 속도 제한 계산에 반영되지 않으므로, 더 높은 max_tokens 값을 설정해도 속도 제한 측면에서 불이익이 없습니다.
속도 제한은 각 모델에 대해 별도로 적용되므로, 서로 다른 모델을 각각의 제한까지 동시에 사용할 수 있습니다. Claude Console의 Rate limits 페이지에서 현재 속도 제한 및 동작을 확인하거나, Rate Limits API를 사용하여 구성된 제한을 프로그래밍 방식으로 읽을 수 있습니다.
| 모델 | 분당 최대 요청 수(RPM) | 분당 최대 입력 토큰 수(ITPM) | 분당 최대 출력 토큰 수(OTPM) |
|---|---|---|---|
| Claude Fable 5 | 1,000 | 500,000 | 100,000 |
| Claude Opus 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Opus 4.x* | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 5 | 1,000 | 2,000,000 | 400,000 |
| Claude Sonnet 4.x** | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 4.5 | 1,000 | 2,000,000 | 400,000 |
| Claude Haiku 3.5 (Bedrock 및 Google Cloud를 제외하고 종료됨) | 1,000 | 100,000† | 20,000 |
* Opus 속도 제한은 Claude Opus 4.8, Opus 4.7, Opus 4.6, Opus 4.5의 통합 트래픽에 적용되는 총 제한입니다. Claude Opus 5는 별도의 속도 제한을 가지며 이 통합 버킷에 포함되지 않습니다.
** Sonnet 4.x 속도 제한은 Sonnet 4.6 및 Sonnet 4.5의 통합 트래픽에 적용되는 총 제한입니다. Claude Sonnet 5는 별도의 속도 제한을 가지며 이 통합 버킷에 포함되지 않습니다.
† 이 제한은 cache_read_input_tokens를 ITPM 사용량에 포함합니다.
Message Batches API는 모든 모델에서 공유되는 자체 속도 제한 세트를 가지고 있습니다. 여기에는 모든 API 엔드포인트에 대한 분당 요청 수(RPM) 제한과 처리 대기열에 동시에 있을 수 있는 배치 요청 수에 대한 제한이 포함됩니다. 여기서 "배치 요청"은 Message Batch의 일부를 의미합니다. 수천 개의 배치 요청을 포함하는 Message Batch를 생성할 수 있으며, 각 요청은 이 제한에 포함됩니다. 배치 요청은 모델에 의해 아직 성공적으로 처리되지 않은 경우 처리 대기열의 일부로 간주됩니다.
| 분당 최대 요청 수(RPM) | 처리 대기열의 최대 배치 요청 수 | 배치당 최대 배치 요청 수 |
|---|---|---|
| 1,000 | 200,000 | 100,000 |
Claude Managed Agents 엔드포인트는 조직별로 속도 제한이 적용됩니다. 이러한 제한은 위의 Messages API 속도 제한과 별개입니다.
| 작업 | 제한 |
|---|---|
| 생성 엔드포인트(예: 에이전트, 세션, 환경) | 분당 300개 요청 |
| 읽기 엔드포인트(예: 조회, 목록, 스트림) | 분당 1,200개 요청 |
Claude Opus 5 또는 Opus 4.8에서 speed: "fast"와 함께 fast mode(리서치 프리뷰)를 사용하는 경우, 표준 Opus 속도 제한과 별개인 전용 속도 제한이 적용됩니다. Fast mode 속도 제한을 초과하면 API는 retry-after 헤더와 함께 429 오류를 반환합니다. Fast mode는 Claude Opus 4.7에서는 사용할 수 없으며(요청 시 오류 반환), Claude Opus 4.6에서도 사용할 수 없습니다(speed: "fast"와 함께 claude-opus-4-6에 대한 요청은 표준 속도로 실행됨). Fast mode를 참조하세요.
응답에는 fast mode 속도 제한 상태를 나타내는 anthropic-fast-* 헤더가 포함됩니다. 이러한 헤더에 대한 자세한 내용은 Fast mode 속도 제한을 참조하세요.
Claude Console의 Usage 페이지에서 속도 제한 사용량을 모니터링할 수 있습니다.
토큰 및 요청 차트를 제공하는 것 외에도, Usage 페이지는 두 개의 별도 속도 제한 차트를 제공합니다. 이러한 차트를 사용하여 성장 여유 공간을 확인하고, 최대 사용량에 도달하는 시점을 파악하고, 요청할 속도 제한을 이해하고, 캐싱 비율을 개선하는 방법을 알아볼 수 있습니다. 차트는 주어진 속도 제한(예: 모델별)에 대한 여러 지표를 시각화합니다:
더 높은 속도 제한 또는 더 높은 월간 지출 상한을 요청하려면 Rate limits 페이지에서 Request rate limit increase를 사용하세요.
워크스페이스에 대한 자세한 내용은 워크스페이스를 참조하세요.
조직의 워크스페이스를 잠재적인 과다 사용으로부터 보호하기 위해 워크스페이스별로 사용자 지정 지출 및 속도 제한을 설정할 수 있습니다.
예시: 조직의 제한이 분당 40,000개 입력 토큰 및 분당 8,000개 출력 토큰인 경우, 한 워크스페이스를 분당 30,000개 입력 토큰으로 제한할 수 있습니다. 이렇게 하면 다른 워크스페이스를 잠재적인 과다 사용으로부터 보호하고 조직 전체에서 리소스를 더 공평하게 분배할 수 있습니다. 남은 분당 미사용 토큰(또는 해당 워크스페이스가 제한을 사용하지 않는 경우 그 이상)은 다른 워크스페이스에서 사용할 수 있습니다.
참고:
현재 조직 및 워크스페이스 속도 제한을 프로그래밍 방식으로 읽으려면 Rate Limits API를 사용하세요.
API 응답에는 적용된 속도 제한, 현재 사용량, 제한이 재설정되는 시점을 보여주는 헤더가 포함됩니다.
다음 헤더가 반환됩니다:
| 헤더 | 설명 |
|---|---|
retry-after | 요청을 재시도할 수 있을 때까지 대기해야 하는 시간(초)입니다. 더 이른 재시도는 실패합니다. |
anthropic-ratelimit-requests-limit | 속도 제한 기간 내에 허용되는 최대 요청 수입니다. |
anthropic-ratelimit-requests-remaining | 속도 제한이 적용되기 전까지 남은 요청 수입니다. |
anthropic-ratelimit-requests-reset | 요청 속도 제한이 완전히 보충되는 시간으로, RFC 3339 형식으로 제공됩니다. |
anthropic-ratelimit-tokens-limit | 속도 제한 기간 내에 허용되는 최대 토큰 수입니다. |
anthropic-ratelimit-tokens-remaining | 속도 제한이 적용되기 전까지 남은 토큰 수(천 단위로 반올림)입니다. |
anthropic-ratelimit-tokens-reset | 토큰 속도 제한이 완전히 보충되는 시간으로, RFC 3339 형식으로 제공됩니다. |
anthropic-ratelimit-input-tokens-limit | 속도 제한 기간 내에 허용되는 최대 입력 토큰 수입니다. |
anthropic-ratelimit-input-tokens-remaining | 속도 제한이 적용되기 전까지 남은 입력 토큰 수(천 단위로 반올림)입니다. |
anthropic-ratelimit-input-tokens-reset | 입력 토큰 속도 제한이 완전히 보충되는 시간으로, RFC 3339 형식으로 제공됩니다. |
anthropic-ratelimit-output-tokens-limit | 속도 제한 기간 내에 허용되는 최대 출력 토큰 수입니다. |
anthropic-ratelimit-output-tokens-remaining | 속도 제한이 적용되기 전까지 남은 출력 토큰 수(천 단위로 반올림)입니다. |
anthropic-ratelimit-output-tokens-reset | 출력 토큰 속도 제한이 완전히 보충되는 시간으로, RFC 3339 형식으로 제공됩니다. |
anthropic-priority-input-tokens-limit | 속도 제한 기간 내에 허용되는 최대 Priority Tier 입력 토큰 수입니다. (Priority Tier 전용) |
anthropic-priority-input-tokens-remaining | 속도 제한이 적용되기 전까지 남은 Priority Tier 입력 토큰 수(천 단위로 반올림)입니다. (Priority Tier 전용) |
anthropic-priority-input-tokens-reset | Priority Tier 입력 토큰 속도 제한이 완전히 보충되는 시간으로, RFC 3339 형식으로 제공됩니다. (Priority Tier 전용) |
anthropic-priority-output-tokens-limit | 속도 제한 기간 내에 허용되는 최대 Priority Tier 출력 토큰 수입니다. (Priority Tier 전용) |
anthropic-priority-output-tokens-remaining | 속도 제한이 적용되기 전까지 남은 Priority Tier 출력 토큰 수(천 단위로 반올림)입니다. (Priority Tier 전용) |
anthropic-priority-output-tokens-reset | Priority Tier 출력 토큰 속도 제한이 완전히 보충되는 시간으로, RFC 3339 형식으로 제공됩니다. (Priority Tier 전용) |
anthropic-ratelimit-tokens-* 헤더는 현재 적용 중인 가장 제한적인 제한의 값을 표시합니다. 예를 들어, 워크스페이스 분당 토큰 제한을 초과한 경우 헤더에는 워크스페이스 분당 토큰 속도 제한 값이 포함됩니다. 워크스페이스 제한이 적용되지 않는 경우 헤더는 남은 총 토큰 수를 반환하며, 여기서 총합은 입력 및 출력 토큰의 합계입니다. 이 접근 방식은 현재 API 사용에 대한 가장 관련성 높은 제약 조건을 파악할 수 있도록 보장합니다.
Was this page helpful?