Fast mode menghasilkan hingga 2,5x lebih banyak token output per detik dari Claude Opus 5 dan Claude Opus 4.8 dengan harga premium. Atur speed: "fast" dengan header beta fast-mode-2026-02-01 pada permintaan Anda untuk mengaktifkannya.
Fast mode didukung pada model berikut:
Fast mode menjalankan model yang sama dengan konfigurasi inferensi yang lebih cepat. Tidak ada perubahan pada kecerdasan atau kemampuan.
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=4096,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[
{"role": "user", "content": "Refactor this module to use dependency injection"}
],
)
for block in response.content:
if block.type == "text":
print(block.text)Fast mode dihargai dengan pengali pada tarif standar di seluruh jendela konteks penuh, termasuk permintaan dengan lebih dari 200k token input. Tabel berikut menunjukkan harga fast mode untuk model yang didukung:
| Model | Input | Output |
|---|---|---|
| Claude Opus 5 / Claude Opus 4.8 | $10 USD / MTok | $50 USD / MTok |
Harga fast mode berlaku secara kumulatif dengan pengubah harga lainnya:
Untuk detail harga lengkap, lihat halaman Harga.
Fast mode memiliki batas laju khusus yang terpisah dari batas laju Opus standar. Ketika batas laju fast mode Anda terlampaui, API mengembalikan error 429 dengan header retry-after yang menunjukkan kapan kapasitas akan tersedia.
Respons menyertakan header yang menunjukkan status batas laju fast mode Anda:
| Header | Deskripsi |
|---|---|
anthropic-fast-input-tokens-limit | Token input fast mode maksimum per menit |
anthropic-fast-input-tokens-remaining | Token input fast mode yang tersisa |
anthropic-fast-input-tokens-reset | Waktu ketika batas token input fast mode direset |
anthropic-fast-output-tokens-limit | Token output fast mode maksimum per menit |
anthropic-fast-output-tokens-remaining | Token output fast mode yang tersisa |
anthropic-fast-output-tokens-reset | Waktu ketika batas token output fast mode direset |
Untuk batas laju spesifik per tier, lihat halaman Batas laju.
Objek usage dalam respons menyertakan field speed yang menunjukkan kecepatan mana yang digunakan, baik "fast" atau "standard". Meminta speed: "fast" pada model yang tidak mendukung fast mode akan mengembalikan error, begitu juga ketika melampaui batas laju atau kapasitas fast mode (error 429 atau 529). Ketika permintaan dengan speed: "fast" berhasil, usage.speed bernilai "fast". Jika Anda menggunakan Claude Opus 4.6 dan meminta fast mode, perilakunya unik. Alih-alih mengembalikan error seperti model lain yang tidak mendukung fast mode, model ini secara diam-diam beralih ke kecepatan standar. Meskipun tidak ada error dengan Opus 4.6, field speed secara akurat menunjukkan "standard".
client = anthropic.Anthropic()
response = client.beta.messages.create(
model="claude-opus-5",
max_tokens=1024,
speed="fast",
betas=["fast-mode-2026-02-01"],
messages=[{"role": "user", "content": "Hello"}],
)
print(response.usage.speed) # "fast" or "standard"{
"id": "msg_01XFDUDYJgAACzvnptvVoYEL",
"type": "message",
"role": "assistant",
"usage": {
"input_tokens": 8,
"output_tokens": 12,
"speed": "fast"
}
}Untuk melacak penggunaan dan biaya fast mode di seluruh organisasi Anda, lihat Usage and Cost API.
Ketika batas laju fast mode terlampaui, API mengembalikan error 429 dengan header retry-after. SDK Anthropic secara otomatis mencoba ulang permintaan ini hingga 2 kali secara default (dapat dikonfigurasi dengan max_retries), menunggu selama penundaan yang ditentukan server sebelum setiap percobaan ulang. Karena fast mode menggunakan pengisian ulang token secara berkelanjutan, penundaan retry-after biasanya singkat dan permintaan berhasil setelah kapasitas tersedia.
Jika Anda lebih memilih untuk beralih ke kecepatan standar daripada menunggu kapasitas fast mode, tangkap error batas laju dan coba ulang tanpa speed: "fast". Atur max_retries ke 0 pada permintaan fast awal untuk melewati percobaan ulang otomatis dan langsung gagal pada error batas laju.
Karena mengatur max_retries ke 0 juga menonaktifkan percobaan ulang untuk error sementara lainnya (overloaded, internal server error), contoh berikut mengirim ulang permintaan asli dengan percobaan ulang default untuk kasus-kasus tersebut.
client = anthropic.Anthropic()
def create_message_with_fast_fallback(max_retries=0, max_attempts=3, **params):
try:
return client.with_options(max_retries=max_retries).beta.messages.create(
**params
)
except anthropic.RateLimitError:
if params.get("speed") == "fast":
del params["speed"]
return create_message_with_fast_fallback(max_retries=max_retries, **params)
raise
except (
anthropic.APIStatusError,
anthropic.APIConnectionError,
) as error:
if isinstance(error, anthropic.APIStatusError) and error.status_code < 500:
raise
if max_attempts > 1:
return create_message_with_fast_fallback(
max_retries=max_retries, max_attempts=max_attempts - 1, **params
)
raise
message = create_message_with_fast_fallback(
model="claude-opus-5",
max_tokens=1024,
messages=[{"role": "user", "content": "Hello"}],
betas=["fast-mode-2026-02-01"],
speed="fast",
max_retries=0,
)Dapatkan hasil JSON yang tervalidasi dari alur kerja agen.
Pelajari tentang struktur harga Anthropic untuk model dan fitur.
Kontrol berapa banyak token yang digunakan Claude saat merespons dengan parameter effort, menyeimbangkan antara kelengkapan respons dan efisiensi token.
Stream respons Messages API secara bertahap dengan server-sent events, termasuk delta teks, penggunaan alat, dan pemikiran diperpanjang.
Was this page helpful?