Foundation-модели для таблиц (TabPFN)
Тема дорожной карты · Основы машинного обучения
Табличные foundation-модели (TFM) — это предобученные трансформеры, которые решают задачи классификации и регрессии на табличных данных без обучения под конкретный датасет: модель один раз предобучена на миллионах синтетических таблиц, а на вашей задаче делает предсказание за один forward pass, получив обучающие примеры прямо в контекст. Флагман направления — TabPFN (версия v2 вышла со статьёй в Nature в январе 2025, TabPFN-2.5 — в конце 2025), а на бенчмарке TabArena такие модели уже обходят одиночные градиентные бустинги, уступая только тяжёлым AutoML-ансамблям. Это первый структурный сдвиг в классическом ML на табличках за десятилетие доминирования XGBoost.
Как это работает
Идея повторяет in-context learning языковых моделей. TFM — это трансформер, предобученный на огромном количестве синтетических датасетов, сгенерированных из случайных причинных графов (prior-data fitted networks, PFN). Во время инференса модель получает на вход и обучающие строки с ответами, и тестовые строки без ответов — и предсказывает метки тестовых строк напрямую, аппроксимируя байесовский вывод по пространству «правдоподобных механизмов порождения данных». Обучения градиентным спуском на вашем датасете не происходит вовсе: «fit» у TabPFN — это, по сути, запоминание контекста.
Отсюда и ограничения: контекст трансформера конечен, поэтому классический TabPFN лучше всего работает на небольших и средних датасетах (тысячи — десятки тысяч строк, ограниченное число признаков). TabPFN-2.5 расширил эти лимиты, а ансамблевые обвязки (например, в AutoGluon) комбинируют TFM с бустингами, забирая лучшее от обоих подходов.
Когда применять
Пробуйте TFM, когда датасет небольшой, а качество критично: на выборках до ~10–50 тысяч строк TabPFN часто обходит тщательно затюненный XGBoost при нулевых затратах на подбор гиперпараметров — и это отличный быстрый бейзлайн. Они же удобны в AutoML-пайплайнах и при частом переобучении на новых срезах данных. Для миллионов строк, строгих лимитов на латентность инференса или интерпретируемость (SHAP по деревьям) градиентный бустинг остаётся практичным дефолтом — держите в голове обе опции и решайте по валидации.
Типичные ошибки
Главная ошибка — переносить интуицию «fit = обучение»: у TabPFN «обучение» мгновенное, зато инференс дороже, чем у готового бустинга, потому что каждый предикт заново прогоняет контекст через трансформер — для высоконагруженного онлайн-скоринга это может стать блокером. Вторая — кормить TFM датасеты далеко за пределами заявленных лимитов по строкам и признакам: качество деградирует незаметно, без ошибок. Третья — сравнивать TabPFN с бустингом нечестно: дефолтный XGBoost против TFM — не аргумент; тюньте бустинг так же тщательно, как в проде, и сравнивайте на кросс-валидации. Наконец, не забывайте, что предобучение на синтетике не отменяет утечки данных в ваших признаках — валидационная гигиена нужна та же.
Связанные понятия
Полезные ресурсы
Проверить знания (2)
Загрузка вопросов…