Fast mode는 Claude Opus 5 및 Claude Opus 4.8에서 프리미엄 가격으로 초당 출력 토큰을 최대 2.5배 더 높게 제공합니다. 요청에 fast-mode-2026-02-01 베타 헤더와 함께 speed: "fast"를 설정하여 옵트인하세요.
Fast mode는 다음 모델에서 지원됩니다:
Fast mode는 더 빠른 추론 구성으로 동일한 모델을 실행합니다. 지능이나 기능에는 변화가 없습니다.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Fast mode는 200k 입력 토큰을 초과하는 요청을 포함하여 전체 컨텍스트 윈도우에 걸쳐 표준 요금에 배수를 적용한 가격으로 책정됩니다. 다음 표는 지원되는 모델의 fast mode 가격을 보여줍니다:
| 모델 | 입력 | 출력 |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
Fast mode 가격은 다른 가격 수정자와 중첩 적용됩니다:
전체 가격 세부 정보는 가격 페이지를 참조하세요.
Fast mode는 표준 Opus 속도 제한과 별도인 전용 속도 제한을 가집니다. Fast mode 속도 제한을 초과하면 API는 용량이 사용 가능해지는 시점을 나타내는 retry-after 헤더와 함께 429 오류를 반환합니다.
응답에는 fast mode 속도 제한 상태를 나타내는 헤더가 포함됩니다:
| 헤더 | 설명 |
|---|---|
anthropic-fast-input-tokens-limit | 분당 최대 fast mode 입력 토큰 수 |
anthropic-fast-input-tokens-remaining | 남은 fast mode 입력 토큰 수 |
anthropic-fast-input-tokens-reset | Fast mode 입력 토큰 제한이 재설정되는 시간 |
anthropic-fast-output-tokens-limit | 분당 최대 fast mode 출력 토큰 수 |
anthropic-fast-output-tokens-remaining | 남은 fast mode 출력 토큰 수 |
anthropic-fast-output-tokens-reset | Fast mode 출력 토큰 제한이 재설정되는 시간 |
티어별 속도 제한은 속도 제한 페이지를 참조하세요.
응답의 usage 객체에는 사용된 속도를 나타내는 speed 필드가 포함되며, 값은 "fast" 또는 "standard"입니다. Fast mode를 지원하지 않는 모델에서 speed: "fast"를 요청하면 오류가 반환되며, fast mode의 속도 제한이나 용량을 초과하는 경우에도 마찬가지입니다(429 또는 529). speed: "fast"가 포함된 요청이 성공하면 usage.speed는 "fast"입니다. Claude Opus 4.6을 사용하면서 fast mode를 요청하는 경우 동작이 고유합니다. Fast mode를 지원하지 않는 다른 모델처럼 오류를 반환하는 대신 조용히 표준 속도로 전환됩니다. Opus 4.6에서는 오류가 없지만 speed 필드는 정확하게 "standard"를 표시합니다.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}조직 전체의 fast mode 사용량 및 비용을 추적하려면 Usage and Cost API를 참조하세요.
Fast mode 속도 제한을 초과하면 API는 retry-after 헤더와 함께 429 오류를 반환합니다. Anthropic SDK는 기본적으로 이러한 요청을 최대 2회까지 자동으로 재시도하며(max_retries로 구성 가능), 각 재시도 전에 서버가 지정한 지연 시간만큼 대기합니다. Fast mode는 지속적인 토큰 보충을 사용하므로 retry-after 지연은 일반적으로 짧으며 용량이 확보되면 요청이 성공합니다.
Fast mode 용량을 기다리는 대신 표준 속도로 폴백하려면 속도 제한 오류를 캐치하고 speed: "fast" 없이 재시도하세요. 초기 fast 요청에서 max_retries를 0으로 설정하여 자동 재시도를 건너뛰고 속도 제한 오류 시 즉시 실패하도록 하세요.
max_retries를 0으로 설정하면 다른 일시적 오류(과부하, 내부 서버 오류)에 대한 재시도도 비활성화되므로, 다음 예제에서는 해당 경우에 대해 기본 재시도로 원래 요청을 다시 보냅니다.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)에이전트 워크플로에서 검증된 JSON 결과를 얻으세요.
모델 및 기능에 대한 Anthropic의 가격 구조에 대해 알아보세요.
effort 매개변수로 Claude가 응답할 때 사용하는 토큰 수를 제어하여 응답의 철저함과 토큰 효율성 간의 균형을 조정하세요.
텍스트, 도구 사용 및 확장 사고 델타를 포함하여 서버 전송 이벤트로 Messages API 응답을 점진적으로 스트리밍하세요.
Was this page helpful?