State-space модели (Mamba)

Тема дорожной карты · Глубокое обучение

State-space модели (SSM) — семейство архитектур для последовательностей, выросшее из классической теории линейных динамических систем и ставшее в 2024–2026 годах главной альтернативой трансформерам. Ключевые представители — S4, Mamba и Mamba-2, а также гибриды SSM + attention (Jamba, Zamba, Granite 4.0). Их главное преимущество — линейная сложность по длине последовательности: там, где self-attention платит O(n²) за контекст, SSM обрабатывает токены за O(n) и держит константную память на шаг генерации, как RNN, но при этом обучается параллельно, как свёртка.

Как это работает

В основе лежит уравнение состояния: скрытый вектор h(t) обновляется линейным правилом по входу x(t), а выход y(t) — линейная функция состояния. Дискретизированная версия этого уравнения разворачивается либо как рекуррентность (эффективный инференс токен за токеном), либо как длинная свёртка (параллельное обучение на GPU) — одна и та же модель имеет два эквивалентных представления.

Прорыв Mamba — селективность: параметры перехода делаются зависимыми от входа, поэтому модель учится «забывать» нерелевантные токены и удерживать важные, что раньше было слабым местом линейных SSM. Mamba-2 связала SSM с вариантом attention через формализм state-space duality (SSD), а Mamba-3 (ICLR 2026) добавила ещё три улучшения устойчивости и качества. В продакшн-моделях чаще встречаются гибриды: несколько attention-слоёв на десятки SSM-слоёв дают качество трансформера при кратно меньшей стоимости длинного контекста.

Когда применять

SSM стоит рассматривать, когда узкое место — длина последовательности: логи и телеметрия, аудио и сигналы, геномные данные, документы на сотни тысяч токенов, стриминговый инференс на edge-устройствах с жёстким бюджетом памяти. Для типовых NLP-задач с контекстом до десятков тысяч токенов зрелая экосистема трансформеров (инструменты, чекпойнты, серверы инференса) обычно перевешивает. Если вы обучаете модель с нуля под длинные последовательности — начните с Mamba-подобного бэкбона или гибрида; если используете готовые LLM — просто знайте, что часть современных открытых моделей внутри уже гибридные.

Типичные ошибки

Частая ошибка — ждать от чистых SSM трансформерного качества на задачах точного копирования и in-context retrieval: селективное состояние сжимает историю, и «выдернуть» точную подстроку из далёкого прошлого модели сложнее, чем attention с прямым доступом ко всем токенам; именно поэтому побеждают гибриды. Вторая — сравнивать скорость на коротких последовательностях: выигрыш SSM проявляется на длинных контекстах, на 2К токенов оптимизированный FlashAttention может быть быстрее. Третья — писать собственную реализацию selective scan на PyTorch «в лоб»: без fused CUDA-ядер она медленнее трансформера; используйте официальные ядра mamba-ssm или реализации из Hugging Face Transformers.

Связанные понятия

Полезные ресурсы

Проверить знания (2)

Загрузка вопросов…