Окно контекста (1M) и лимиты вывода
Тема дорожной карты · Claude от Anthropic
Окно контекста — это сколько токенов модель видит за один запрос: системный промпт, история сообщений, tool-блоки и сам ответ. В линейке 2026 года 1M токенов стало стандартом: Claude Fable 5, Opus 4.8/4.7/4.6 и Sonnet 4.6 получают окно в 1M токенов по обычной цене — long-context наценки больше нет. Исключение — Haiku 4.5 с окном 200K токенов. Отдельно от окна контекста существует лимит вывода (max output): 128K токенов у Fable и Opus, 64K у Sonnet 4.6 и Haiku 4.5. Эти две цифры путают чаще всего — большое окно на вход не означает, что модель может столько же сгенерировать.
Как это работает
Все токены запроса и ответа делят одно окно: чем больше вы подаёте на вход, тем меньше остаётся под генерацию в пределах max output. Точные значения для каждой модели не нужно запоминать — Models API (GET /v1/models/{id}) возвращает context window, max output и дерево capabilities для любого идентификатора. Практическое ограничение на вывод: для генерации больше ~16K токенов обязателен streaming — без него соединение обрывается по HTTP-таймауту раньше, чем модель закончит ответ. Стоимость запроса пропорциональна числу токенов, поэтому на длинных контекстах критичен prompt caching: закешированный префикс оплачивается по сниженной ставке, а счёт за повторяющийся контекст падает в разы.
Когда применять
1M контекста раскрывается там, где раньше требовался RAG-конвейер: анализ целой кодовой базы, пачки юридических документов, длинные логи агентных сессий. Если корпус влезает в окно — иногда проще подать его целиком с prompt caching, чем строить retrieval. Haiku 4.5 с 200K берите для массовых коротких запросов, где большое окно не нужно. Лимит вывода планируйте заранее: отчёт на 100K+ токенов генерируйте на Fable или Opus (128K max output) со streaming, либо разбивайте на части.
Типичные ошибки
Смешивание лимитов входа и выхода — окно в 1M не даст Sonnet сгенерировать больше 64K токенов. Генерация длинного вывода без streaming — таймаут после ~16K. «Заливка» всего окна без нужды: токены стоят денег, а нерелевантный контекст ухудшает качество ответов — подавайте то, что относится к задаче. Игнорирование rate limits: миллионные запросы быстро съедают токен-бюджет вашего tier — следите за заголовками лимитов и обрабатывайте HTTP 429. Наконец, расчёт на память из старых доков — лимиты меняются от версии к версии, проверяйте их через Models API, а не по статьям годичной давности.
Связанные понятия
Полезные ресурсы
Проверить знания (2)
Загрузка вопросов…