O modo rápido oferece até 2,5x mais tokens de saída por segundo do Claude Opus 5 e do Claude Opus 4.8 com preço premium. Defina speed: "fast" com o cabeçalho beta fast-mode-2026-02-01 na sua requisição para ativar.
O modo rápido é compatível com os seguintes modelos:
O modo rápido executa o mesmo modelo com uma configuração de inferência mais rápida. Não há mudança na inteligência ou nas capacidades.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)O modo rápido é cobrado com um multiplicador sobre as tarifas padrão em toda a janela de contexto, incluindo requisições com mais de 200k tokens de entrada. A tabela a seguir mostra os preços do modo rápido para os modelos compatíveis:
| Modelo | Entrada | Saída |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | US$ 10 / MTok | US$ 50 / MTok |
Os preços do modo rápido se acumulam com outros modificadores de preço:
Para detalhes completos de preços, consulte a página de Preços.
O modo rápido tem um limite de taxa dedicado que é separado dos limites de taxa padrão do Opus. Quando seu limite de taxa do modo rápido é excedido, a API retorna um erro 429 com um cabeçalho retry-after indicando quando a capacidade estará disponível.
A resposta inclui cabeçalhos que indicam o status do seu limite de taxa do modo rápido:
| Cabeçalho | Descrição |
|---|---|
anthropic-fast-input-tokens-limit | Máximo de tokens de entrada do modo rápido por minuto |
anthropic-fast-input-tokens-remaining | Tokens de entrada do modo rápido restantes |
anthropic-fast-input-tokens-reset | Momento em que o limite de tokens de entrada do modo rápido é redefinido |
anthropic-fast-output-tokens-limit | Máximo de tokens de saída do modo rápido por minuto |
anthropic-fast-output-tokens-remaining | Tokens de saída do modo rápido restantes |
anthropic-fast-output-tokens-reset | Momento em que o limite de tokens de saída do modo rápido é redefinido |
Para limites de taxa específicos por nível, consulte a página de Limites de taxa.
O objeto usage da resposta inclui um campo speed que indica qual velocidade foi usada, "fast" ou "standard". Solicitar speed: "fast" em um modelo que não é compatível com o modo rápido retorna um erro, assim como exceder os limites de taxa ou a capacidade do modo rápido (um 429 ou 529). Quando uma requisição com speed: "fast" é bem-sucedida, usage.speed é "fast". Se você estiver usando o Claude Opus 4.6 e solicitar o modo rápido, o comportamento dele é único. Em vez de retornar um erro como outros modelos que não são compatíveis com o modo rápido, ele muda silenciosamente para a velocidade padrão. Embora não haja erro com o Opus 4.6, o campo speed mostra corretamente "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Para acompanhar o uso e os custos do modo rápido em toda a sua organização, consulte a API de Uso e Custo.
Quando os limites de taxa do modo rápido são excedidos, a API retorna um erro 429 com um cabeçalho retry-after. Os SDKs da Anthropic tentam novamente essas requisições automaticamente até 2 vezes por padrão (configurável com max_retries), aguardando o atraso especificado pelo servidor antes de cada nova tentativa. Como o modo rápido usa reposição contínua de tokens, o atraso de retry-after é normalmente curto e as requisições são bem-sucedidas assim que a capacidade estiver disponível.
Se você preferir recorrer à velocidade padrão em vez de aguardar a capacidade do modo rápido, capture o erro de limite de taxa e tente novamente sem speed: "fast". Defina max_retries como 0 na requisição rápida inicial para pular as novas tentativas automáticas e falhar imediatamente em erros de limite de taxa.
Como definir max_retries como 0 também desativa novas tentativas para outros erros transitórios (sobrecarga, erros internos do servidor), os exemplos a seguir reenviam a requisição original com novas tentativas padrão para esses casos.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Obtenha resultados JSON validados de fluxos de trabalho de agentes.
Saiba mais sobre a estrutura de preços da Anthropic para modelos e recursos.
Controle quantos tokens o Claude usa ao responder com o parâmetro de esforço, equilibrando entre a completude da resposta e a eficiência de tokens.
Transmita respostas da Messages API incrementalmente com server-sent events, incluindo deltas de texto, uso de ferramentas e pensamento estendido.
Was this page helpful?