快速模式可让 Claude Opus 5 和 Claude Opus 4.8 以高达 2.5 倍的每秒输出令牌速度运行,但需支付额外费用。在您的请求中设置 speed: "fast" 并添加 fast-mode-2026-02-01 beta 标头即可启用。
快速模式支持以下模型:
快速模式使用更快的推理配置运行相同的模型。智能水平和功能没有任何变化。
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)快速模式在整个上下文窗口范围内(包括超过 20 万输入令牌的请求)按标准费率的倍数定价。下表显示了支持的模型的快速模式定价:
| 模型 | 输入 | 输出 |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | 10 美元 / 百万令牌 | 50 美元 / 百万令牌 |
快速模式定价可与其他定价调整项叠加:
有关完整的定价详情,请参阅定价页面。
快速模式拥有独立于标准 Opus 速率限制的专用速率限制。当超出快速模式速率限制时,API 会返回 429 错误,并附带 retry-after 标头,指示何时有可用容量。
响应中包含指示快速模式速率限制状态的标头:
| 标头 | 描述 |
|---|---|
anthropic-fast-input-tokens-limit | 每分钟快速模式输入令牌的最大数量 |
anthropic-fast-input-tokens-remaining | 剩余的快速模式输入令牌数 |
anthropic-fast-input-tokens-reset | 快速模式输入令牌限制重置的时间 |
anthropic-fast-output-tokens-limit | 每分钟快速模式输出令牌的最大数量 |
anthropic-fast-output-tokens-remaining | 剩余的快速模式输出令牌数 |
anthropic-fast-output-tokens-reset | 快速模式输出令牌限制重置的时间 |
有关各层级的具体速率限制,请参阅速率限制页面。
响应的 usage 对象包含一个 speed 字段,指示使用了哪种速度,值为 "fast" 或 "standard"。在不支持快速模式的模型上请求 speed: "fast" 会返回错误,超出快速模式的速率限制或容量时也会返回错误(429 或 529)。当带有 speed: "fast" 的请求成功时,usage.speed 为 "fast"。如果您使用的是 Claude Opus 4.6 并请求快速模式,其行为是独特的:它不会像其他不支持快速模式的模型那样返回错误,而是静默切换到标准速度。虽然 Opus 4.6 不会报错,但 speed 字段会准确显示为 "standard"。
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}要跟踪整个组织的快速模式使用情况和成本,请参阅用量和成本 API。
当超出快速模式速率限制时,API 会返回带有 retry-after 标头的 429 错误。Anthropic SDK 默认会自动重试这些请求最多 2 次(可通过 max_retries 配置),每次重试前会等待服务器指定的延迟时间。由于快速模式使用连续令牌补充机制,retry-after 延迟通常很短,一旦有可用容量,请求就会成功。
如果您希望回退到标准速度而不是等待快速模式容量恢复,可以捕获速率限制错误并在不带 speed: "fast" 的情况下重试。在初始快速请求上将 max_retries 设置为 0,以跳过自动重试并在遇到速率限制错误时立即失败。
由于将 max_retries 设置为 0 也会禁用对其他瞬时错误(过载、内部服务器错误)的重试,以下示例会针对这些情况使用默认重试设置重新发出原始请求。
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)从智能体工作流中获取经过验证的 JSON 结果。
了解 Anthropic 针对模型和功能的定价结构。
使用 effort 参数控制 Claude 响应时使用的令牌数量,在响应完整性和令牌效率之间进行权衡。
通过服务器发送事件增量流式传输 Messages API 响应,包括文本、工具使用和扩展思考增量。
Was this page helpful?