По мере роста разговоров вы в конечном итоге приблизитесь к ограничениям контекстного окна. Для длительных разговоров и агентных рабочих процессов серверная компактизация является основной стратегией управления контекстом.
«Context window» (контекстное окно) относится ко всему тексту, на который языковая модель может ссылаться при генерации ответа, включая сам ответ. Это отличается от большого корпуса данных, на котором языковая модель была обучена, и вместо этого представляет собой «рабочую память» модели. Большее контекстное окно позволяет модели обрабатывать более сложные и длинные подсказки, но больше контекста не означает автоматически лучше. По мере роста количества токенов точность и полнота воспроизведения ухудшаются — явление, известное как context rot (деградация контекста). Это делает курирование того, что находится в контексте, столь же важным, как и то, сколько места доступно.
Следующая диаграмма иллюстрирует стандартное поведение контекстного окна для запросов API1:
1 Чат-интерфейсы, такие как claude.ai, также могут управлять контекстным окном по скользящему принципу «первым пришёл — первым ушёл».
Всё в запросе учитывается в контекстном окне: системная подсказка, каждое сообщение в messages (включая результаты инструментов, изображения и документы) и ваши определения инструментов. Вывод, который Claude генерирует для хода, включая его расширенное мышление, также учитывается. Каждый ответ сообщает, что потребил запрос, в своём поле usage. Если вы используете кэширование подсказок, количество входных токенов разделяется между input_tokens, cache_read_input_tokens и cache_creation_input_tokens, и все три учитываются в окне. Чтобы оценить запрос перед его отправкой, используйте API подсчёта токенов.
Claude Opus 5, Claude Opus 4.8, Claude Opus 4.7, Claude Opus 4.6, Claude Sonnet 5 и Claude Sonnet 4.6 имеют контекстное окно в 1M токенов в Claude API, Amazon Bedrock, Google Cloud и Microsoft Foundry. Claude Mythos Preview также имеет контекстное окно в 1M токенов.
Claude Fable 5 и Claude Mythos 5 ( и ) также имеют контекстное окно в 1M токенов. Один запрос к любой модели с контекстным окном в 1M токенов может сгенерировать до 128k выходных токенов (max_tokens). Другие модели Claude, включая Claude Sonnet 4.5, имеют контекстное окно в 200k токенов.
Для каждой модели с контекстным окном в 1M токенов 1M является значением по умолчанию: вам не нужен бета-заголовок, и запросы с длинным контекстом тарифицируются по стандартным ценам.
Один запрос может включать до 600 изображений или страниц PDF (100 для моделей с контекстным окном в 200k токенов). Если вы отправляете много изображений или большие документы, вы можете достичь ограничений на размер запроса раньше, чем лимита токенов.
См. таблицу сравнения моделей для списка размеров контекстного окна по моделям.
С мышлением все входные и выходные токены, включая токены мышления, учитываются в лимите контекстного окна, с несколькими нюансами в многоходовых ситуациях.
Токены мышления являются подмножеством вашего параметра max_tokens, тарифицируются как выходные токены и учитываются в ограничениях скорости. С адаптивным мышлением Claude определяет своё распределение мышления динамически, поэтому использование токенов мышления варьируется от запроса к запросу.
Остаются ли блоки мышления из предыдущих ходов ассистента в контекстном окне, зависит от модели. На Claude Opus 4.5 и более поздних моделях Opus, Claude Sonnet 4.6 и более поздних моделях Sonnet, Claude Fable 5, Claude Mythos 5 и Claude Mythos Preview API сохраняет предыдущие блоки мышления по умолчанию, и они учитываются в контекстном окне, как и любые другие входные токены. На более ранних моделях Opus и Sonnet и всех моделях Haiku API автоматически удаляет предыдущие блоки мышления из истории разговора, когда вы передаёте их обратно, что сохраняет ёмкость токенов для содержимого разговора. Значения по умолчанию для каждой модели см. в разделе сохранение блоков мышления по моделям. Чтобы переопределить значение по умолчанию в любом направлении, используйте очистку блоков мышления.
Следующая диаграмма показывает, как управляются токены, когда мышление включено на модели, которая удаляет предыдущие блоки мышления:
Следующая диаграмма иллюстрирует, как управляются токены, когда вы комбинируете мышление с использованием инструментов на модели, которая удаляет предыдущие блоки мышления:
Архитектура первого хода
Обработка результата инструмента (ход 2)
tool_result. Вы должны вернуть блок мышления с соответствующими результатами инструментов. Это единственный случай, когда вы должны возвращать блоки мышления.user, если не включено чередующееся мышление).Новый ход пользователя (ход 3)
user.user вне цикла использования инструментов, Claude генерирует новый блок мышления и продолжает оттуда.assistant.Чтобы уменьшить контекст, потребляемый самими определениями инструментов, см. Управление контекстом инструментов или отложите определения инструментов с помощью инструмента поиска инструментов.
Claude Sonnet 5, Claude Sonnet 4.6, Claude Sonnet 4.5 и Claude Haiku 4.5 обладают осведомлённостью о контексте: эти модели отслеживают своё оставшееся контекстное окно (свой «бюджет токенов») на протяжении всего разговора. Это позволяет модели управлять длительными задачами с учётом оставшегося пространства, а не угадывать, сколько токенов осталось. Осведомлённость о контексте автоматическая: вам ничего не нужно включать, и вы никогда не отправляете теги, показанные в этом разделе, самостоятельно. API внедряет их.
В системной подсказке каждого запроса API сообщает Claude его общее контекстное окно:
<budget:token_budget>200000</budget:token_budget>Бюджет соответствует контекстному окну, доступному для вашего запроса: 1M токенов для Claude Sonnet 5 и Claude Sonnet 4.6 и 200k токенов для Claude Sonnet 4.5 и Claude Haiku 4.5. Примеры в этом разделе показывают модель с контекстным окном в 200k токенов.
После каждого вызова инструмента API сообщает Claude обновление о его оставшейся ёмкости:
<system_warning>Token usage: 35000/200000; 165000 remaining</system_warning>Токены изображений включены в эти бюджеты.
Claude Opus 4.7 и более поздние модели Opus, Claude Fable 5 и Claude Mythos 5 не получают эти внедрённые теги. На Claude Opus 4.7 и более поздних моделях Opus, Claude Fable 5 и Claude Mythos 5 вы можете задать модели явный бюджет с помощью бюджетов задач, которые находятся в бета-версии.
Рекомендации по составлению подсказок с использованием осведомлённости о контексте см. в разделе Лучшие практики составления подсказок.
Если ваши разговоры регулярно приближаются к ограничениям контекстного окна, используйте серверную компактизацию. Компактизация автоматически суммирует более ранние части разговора на сервере, чтобы разговор мог продолжаться за пределами лимита контекстного окна. Она доступна в бета-версии для моделей Claude 4.6 и более поздних, а также Claude Mythos Preview.
Для более специализированных потребностей редактирование контекста предлагает дополнительные стратегии:
Кэшированные префиксы подсказок по-прежнему занимают контекстное окно: кэширование подсказок меняет то, сколько вы платите за эти токены, а не то, учитываются ли они.
Если один только ввод уже превышает контекстное окно модели, API возвращает ошибку 400 invalid_request_error («prompt is too long») на каждой модели.
На моделях Claude 4.5 и новее, если входные токены плюс max_tokens превышают размер контекстного окна, API принимает запрос. Если генерация затем достигает лимита контекстного окна, она останавливается с stop_reason: "model_context_window_exceeded". На более ранних моделях API вместо этого возвращает ошибку валидации. Чтобы включить поведение model_context_window_exceeded на этих моделях, используйте бета-заголовок model-context-window-exceeded-2025-08-26. Подробности см. в разделе Причины остановки и резервные варианты.
Чтобы оставаться в пределах ограничений контекстного окна, используйте API подсчёта токенов для оценки использования токенов перед отправкой сообщений Claude.
Серверная компактизация контекста для управления длинными разговорами, которые приближаются к ограничениям контекстного окна.
Автоматически управляйте контекстом разговора по мере его роста с помощью редактирования контекста.
См. таблицу сравнения моделей для списка размеров контекстного окна и цен на входные/выходные токены по моделям.
Дайте Claude улучшенное рассуждение для сложных задач и контролируйте, как возвращается содержимое мышления.
Was this page helpful?