快速模式可讓 Claude Opus 5 和 Claude Opus 4.8 以高達 2.5 倍的每秒輸出 token 速度運作,並採用進階定價。在您的請求中設定 speed: "fast" 並加上 fast-mode-2026-02-01 beta 標頭即可啟用。
快速模式支援以下模型:
快速模式使用更快的推論配置來執行相同的模型。智慧程度或功能不會有任何變化。
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)快速模式的定價是在標準費率基礎上乘以一個倍數,適用於整個上下文視窗,包括超過 20 萬個輸入 token 的請求。下表顯示支援模型的快速模式定價:
| 模型 | 輸入 | 輸出 |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | $10 美元 / 百萬 token | $50 美元 / 百萬 token |
快速模式定價會與其他定價修飾符疊加:
如需完整的定價詳情,請參閱定價頁面。
快速模式有專屬的速率限制,與標準 Opus 速率限制分開計算。當您超過快速模式的速率限制時,API 會回傳 429 錯誤,並附帶 retry-after 標頭,指示何時會有可用容量。
回應中包含指示您快速模式速率限制狀態的標頭:
| 標頭 | 說明 |
|---|---|
anthropic-fast-input-tokens-limit | 每分鐘快速模式輸入 token 上限 |
anthropic-fast-input-tokens-remaining | 剩餘的快速模式輸入 token |
anthropic-fast-input-tokens-reset | 快速模式輸入 token 限制重置的時間 |
anthropic-fast-output-tokens-limit | 每分鐘快速模式輸出 token 上限 |
anthropic-fast-output-tokens-remaining | 剩餘的快速模式輸出 token |
anthropic-fast-output-tokens-reset | 快速模式輸出 token 限制重置的時間 |
如需各層級的速率限制,請參閱速率限制頁面。
回應的 usage 物件包含一個 speed 欄位,指示使用了哪種速度,值為 "fast" 或 "standard"。在不支援快速模式的模型上請求 speed: "fast" 會回傳錯誤,超過快速模式的速率限制或容量時也會回傳錯誤(429 或 529)。當帶有 speed: "fast" 的請求成功時,usage.speed 為 "fast"。如果您使用的是 Claude Opus 4.6 並請求快速模式,其行為是獨特的。它不會像其他不支援快速模式的模型那樣回傳錯誤,而是靜默切換至標準速度。雖然 Opus 4.6 不會產生錯誤,但 speed 欄位會準確顯示 "standard"。
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}若要追蹤您組織中的快速模式使用量和成本,請參閱 Usage and Cost API。
當超過快速模式速率限制時,API 會回傳 429 錯誤並附帶 retry-after 標頭。Anthropic SDK 預設會自動重試這些請求最多 2 次(可透過 max_retries 設定),並在每次重試前等待伺服器指定的延遲時間。由於快速模式使用連續 token 補充機制,retry-after 延遲通常很短,一旦有可用容量,請求就會成功。
如果您希望回退至標準速度,而不是等待快速模式容量,請捕捉速率限制錯誤並在不帶 speed: "fast" 的情況下重試。在初始快速請求上將 max_retries 設為 0,以跳過自動重試並在遇到速率限制錯誤時立即失敗。
由於將 max_retries 設為 0 也會停用其他暫時性錯誤(過載、內部伺服器錯誤)的重試,以下範例會針對這些情況以預設重試設定重新發出原始請求。
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)從代理工作流程取得經過驗證的 JSON 結果。
了解 Anthropic 針對模型和功能的定價結構。
透過 effort 參數控制 Claude 回應時使用的 token 數量,在回應完整性與 token 效率之間取得平衡。
使用伺服器傳送事件逐步串流 Messages API 回應,包括文字、工具使用和擴展思考的增量內容。
Was this page helpful?