Параметр effort (и legacy budget tokens)
Тема дорожной карты · Claude от Anthropic
Исторически глубина рассуждений Claude управлялась параметром budget_tokens: расширенное мышление включалось как thinking: {"type": "enabled", "budget_tokens": N}, где бюджет должен был быть меньше max_tokens и не меньше 1024 токенов. Сегодня это legacy-подход: на Opus 4.6 и Sonnet 4.6 он объявлен устаревшим, а на Fable 5, Opus 4.7 и Opus 4.8 полностью удалён — такой запрос возвращает HTTP 400. Рабочим budget_tokens остаётся только на более старых моделях вроде Sonnet 4.5. Современная замена — параметр effort, который управляет не только глубиной мышления, но и общим расходом токенов на ответ.
Как это работает
Параметр передаётся как output_config: {"effort": "low" | "medium" | "high" | "xhigh" | "max"}; значение по умолчанию — high. Уровень xhigh появился в Opus 4.7 и считается лучшим выбором для кодинга и агентных сценариев — именно он используется по умолчанию в Claude Code. Уровень max поддерживается только на Fable 5, Opus 4.6+ и Sonnet 4.6, а на Sonnet 4.5 и Haiku параметр вызывает ошибку. Чем ниже effort, тем экономнее ведёт себя модель: меньше вызовов инструментов (и они более консолидированные), лаконичнее вывод. Это принципиально другая ментальная модель, чем «бюджет на мышление»: effort регулирует, сколько модель думает и действует в целом. Заодно учтите: на Fable 5, Opus 4.7 и 4.8 удалены и сэмплинг-параметры temperature, top_p, top_k — их отправка тоже даёт 400, а поведение теперь настраивается промптингом.
Когда применять
Используйте effort как основной рычаг баланса «качество — стоимость — задержка» для каждого маршрута: xhigh — для кодинга и автономных агентов, high — разумный дефолт для интеллектуально-чувствительных задач, medium — когда нужно снизить расход токенов, low — для сабагентов и коротких, чувствительных к задержке операций. Если вы мигрируете код, который тюнил budget_tokens, не ищите точного соответствия в токенах — подберите уровень effort экспериментально на своих рабочих нагрузках вместе с адаптивным мышлением.
Типичные ошибки
Классика миграции — оставить budget_tokens в запросах к Fable 5, Opus 4.7 или 4.8 и получать 400 на каждом вызове. Вторая ошибка — запросить effort: "max" на Sonnet 4.5 или Haiku, где параметр не поддерживается и вызывает ошибку. Третья — считать effort жёстким лимитом токенов: это регулятор поведения, а не потолок; жёсткое ограничение на один ответ по-прежнему задаёт max_tokens, а бюджет на весь агентный цикл — Task Budgets. Наконец, не переносите старые temperature/top_p/top_k на новые модели — вместо сэмплинг-параметров формулируйте желаемую вариативность прямо в промпте.
Связанные понятия
Полезные ресурсы
Проверить знания (2)
Загрузка вопросов…