Окно контекста (1M) и лимиты вывода

Тема дорожной карты · Claude от Anthropic

Окно контекста — это сколько токенов модель видит за один запрос: системный промпт, история сообщений, tool-блоки и сам ответ. В линейке 2026 года 1M токенов стало стандартом: Claude Fable 5, Opus 4.8/4.7/4.6 и Sonnet 4.6 получают окно в 1M токенов по обычной цене — long-context наценки больше нет. Исключение — Haiku 4.5 с окном 200K токенов. Отдельно от окна контекста существует лимит вывода (max output): 128K токенов у Fable и Opus, 64K у Sonnet 4.6 и Haiku 4.5. Эти две цифры путают чаще всего — большое окно на вход не означает, что модель может столько же сгенерировать.

Как это работает

Все токены запроса и ответа делят одно окно: чем больше вы подаёте на вход, тем меньше остаётся под генерацию в пределах max output. Точные значения для каждой модели не нужно запоминать — Models API (GET /v1/models/{id}) возвращает context window, max output и дерево capabilities для любого идентификатора. Практическое ограничение на вывод: для генерации больше ~16K токенов обязателен streaming — без него соединение обрывается по HTTP-таймауту раньше, чем модель закончит ответ. Стоимость запроса пропорциональна числу токенов, поэтому на длинных контекстах критичен prompt caching: закешированный префикс оплачивается по сниженной ставке, а счёт за повторяющийся контекст падает в разы.

Когда применять

1M контекста раскрывается там, где раньше требовался RAG-конвейер: анализ целой кодовой базы, пачки юридических документов, длинные логи агентных сессий. Если корпус влезает в окно — иногда проще подать его целиком с prompt caching, чем строить retrieval. Haiku 4.5 с 200K берите для массовых коротких запросов, где большое окно не нужно. Лимит вывода планируйте заранее: отчёт на 100K+ токенов генерируйте на Fable или Opus (128K max output) со streaming, либо разбивайте на части.

Типичные ошибки

Смешивание лимитов входа и выхода — окно в 1M не даст Sonnet сгенерировать больше 64K токенов. Генерация длинного вывода без streaming — таймаут после ~16K. «Заливка» всего окна без нужды: токены стоят денег, а нерелевантный контекст ухудшает качество ответов — подавайте то, что относится к задаче. Игнорирование rate limits: миллионные запросы быстро съедают токен-бюджет вашего tier — следите за заголовками лимитов и обрабатывайте HTTP 429. Наконец, расчёт на память из старых доков — лимиты меняются от версии к версии, проверяйте их через Models API, а не по статьям годичной давности.

Связанные понятия

Полезные ресурсы

Проверить знания (2)

Загрузка вопросов…