Mamba: альтернатива Transformer'у на основе State Space Model
Princeton University (Sengupta Lab)
Mamba — это новая архитектура на основе State Space Model (SSM), которая обещает производительность, сравнимую с Transformer, но с линейной масштабируемостью по длине последовательности. Авторы заявляют, что Mamba-3B превосходит Transformer'ы того же размера и сравнивается с моделями вдвое большего размера. Mamba устраняет квадратичное узкое место Attention, обеспечивая быстрый инференс и работу с последовательностями до миллиона токенов.
Mamba — это альтернативная архитектура, основанная на State Space Models (SSM), которая впервые обещает производительность, аналогичную Transformer, при линейной масштабируемости по длине последовательности (до миллиона токенов). Авторы Три Дао и Альберт Гу утверждают, что Mamba-3B превосходит Transformer'ы того же размера и сравнивается с моделями вдвое большего размера как в предварительном обучении, так и в последующих оценках. Основное преимущество Mamba — устранение квадратичного узкого места Attention: она не требует хранения KV-кэша для всех предыдущих токенов, что даёт ускорение до 5 раз по сравнению с Transformer. Mamba состоит из стеков Mamba-блоков, где вместо Attention используется механизм Selective State Space Model (SSSM), а вычисления выполняются с помощью проекций, аналогичных MLP. Ключевое нововведение — селективность: матрицы A (забывание) и B (запоминание) динамически адаптируются к входным данным, что позволяет модели эффективно сжимать релевантную информацию в скрытом состоянии, как RNN, но с лучшей производительностью.
- Сокращения
- SSM = State Space Model — модель пространства состояний
- MLP = Multilayer Perceptron — многослойный перцептрон
- RNN = Recurrent Neural Network — рекуррентная нейронная сеть
- OOM = Out Of Memory — нехватка памяти
Источник: The Gradient —
оригинал
