Быстрый режим обеспечивает до 2,5 раз больше выходных токенов в секунду от Claude Opus 5 и Claude Opus 4.8 по премиальной цене. Установите speed: "fast" с бета-заголовком fast-mode-2026-02-01 в вашем запросе, чтобы включить его.
Быстрый режим поддерживается для следующих моделей:
Быстрый режим запускает ту же модель с более быстрой конфигурацией инференса. Интеллект и возможности модели не меняются.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Быстрый режим тарифицируется с множителем к стандартным тарифам по всему контекстному окну, включая запросы с более чем 200 тыс. входных токенов. В следующей таблице приведены цены быстрого режима для поддерживаемых моделей:
| Модель | Вход | Выход |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | 10 USD / млн токенов | 50 USD / млн токенов |
Цены быстрого режима суммируются с другими модификаторами цен:
Полную информацию о ценах см. на странице Цены.
Быстрый режим имеет выделенное ограничение скорости, отдельное от стандартных ограничений скорости Opus. Когда ваше ограничение скорости быстрого режима превышено, API возвращает ошибку 429 с заголовком retry-after, указывающим, когда ёмкость будет доступна.
Ответ включает заголовки, которые указывают статус вашего ограничения скорости быстрого режима:
| Заголовок | Описание |
|---|---|
anthropic-fast-input-tokens-limit | Максимальное количество входных токенов быстрого режима в минуту |
anthropic-fast-input-tokens-remaining | Оставшиеся входные токены быстрого режима |
anthropic-fast-input-tokens-reset | Время сброса лимита входных токенов быстрого режима |
anthropic-fast-output-tokens-limit | Максимальное количество выходных токенов быстрого режима в минуту |
anthropic-fast-output-tokens-remaining | Оставшиеся выходные токены быстрого режима |
anthropic-fast-output-tokens-reset | Время сброса лимита выходных токенов быстрого режима |
Ограничения скорости для конкретных уровней см. на странице Ограничения скорости.
Объект usage в ответе включает поле speed, которое указывает, какая скорость была использована: "fast" или "standard". Запрос speed: "fast" для модели, которая не поддерживает быстрый режим, возвращает ошибку, как и превышение ограничений скорости или ёмкости быстрого режима (429 или 529). Когда запрос с speed: "fast" выполняется успешно, usage.speed равно "fast". Если вы используете Claude Opus 4.6 и запрашиваете быстрый режим, его поведение уникально. Вместо возврата ошибки, как у других моделей, не поддерживающих быстрый режим, он незаметно переключается на стандартную скорость. Хотя с Opus 4.6 ошибки нет, поле speed корректно показывает "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Чтобы отслеживать использование и затраты быстрого режима в вашей организации, см. Usage and Cost API.
Когда ограничения скорости быстрого режима превышены, API возвращает ошибку 429 с заголовком retry-after. SDK Anthropic автоматически повторяют эти запросы до 2 раз по умолчанию (настраивается с помощью max_retries), ожидая указанную сервером задержку перед каждой повторной попыткой. Поскольку быстрый режим использует непрерывное пополнение токенов, задержка retry-after обычно короткая, и запросы выполняются успешно, как только ёмкость становится доступной.
Если вы предпочитаете переключиться на стандартную скорость, а не ждать ёмкости быстрого режима, перехватите ошибку ограничения скорости и повторите запрос без speed: "fast". Установите max_retries в 0 для первоначального быстрого запроса, чтобы пропустить автоматические повторные попытки и немедленно завершиться с ошибкой при ошибках ограничения скорости.
Поскольку установка max_retries в 0 также отключает повторные попытки для других временных ошибок (перегрузка, внутренние ошибки сервера), следующие примеры повторно отправляют исходный запрос с повторными попытками по умолчанию для этих случаев.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Получайте валидированные результаты в формате JSON из агентных рабочих процессов.
Узнайте о структуре цен Anthropic для моделей и функций.
Управляйте количеством токенов, которые Claude использует при ответе, с помощью параметра effort, балансируя между полнотой ответа и эффективностью использования токенов.
Получайте ответы Messages API инкрементально с помощью server-sent events, включая дельты текста, использования инструментов и расширенного мышления.
Was this page helpful?