В 2017 году команда Google представила архитектуру Transformer в статье «Attention Is All You Need». С тех пор почти все крупные языковые модели (LLM) — от ChatGPT до Gemini — основаны на этой архитектуре. Однако по мере того как ИИ начинает обрабатывать более длинные документы и выполнять сложные рассуждения, а также работать в формате агентов, эффективность Transformer ставится под вопрос.
MIT Technology Review отмечает, что ряд стартапов пересматривает подходы к построению LLM: они экспериментируют с механизмом внимания (Attention), структурой моделей и способами генерации текста, чтобы снизить затраты на вычисления. Проблема особенно актуальна в свете роста расходов на энергию при выполнении сложных задач. Согласно исследованию Microsoft Research, если для типичного запроса потребность в энергии составляет в среднем 0,31 Вт·ч, то для задачи, генерирующей около 5000 выходных токенов, она может возрасти примерно в 13 раз. А если речь идёт о работе AI Agent, которая подразумевает многократный вызов модели и накопление контекста, нагрузка ещё больше возрастает.
Ключевая проблема кроется в механизме Attention: хотя он позволяет модели определять связи между токенами и понимать контекст, использование плотного внимания (Dense Attention) требует большого количества сравнений токенов. Например, для обработки документа объёмом около 10 тысяч слов Transformer может выполнить примерно 50 миллионов операций умножения.
Некоторые стартапы уже предлагают решения. Так, Subquadratic заменяет Dense Attention на Sparse Attention: вместо сравнения всех токенов модель динамически определяет, какие данные важны, и вычисляет только часть отношений. Компания заявляет, что её модель SubQ в некоторых задачах (например, в поиске и кодировании) приближается к ведущим LLM, хотя в индустрии к результатам относятся с осторожностью.
Стартап Manifest AI пошёл дальше и разработал технологию Power Retention — она призвана заменить Attention. Вместо сохранения полного контекста модель сохраняет только информацию, наиболее релевантную текущей задаче, отбрасывая лишнее.
Другие разработчики нацелились на способ генерации ответов. Большинство LLM используют авторегрессионную генерацию (Autoregressive Generation): после создания одного токена модель предсказывает следующий на основе предыдущего. Это ограничивает возможность параллелизации вычислений. Стартап Inception, основанный профессором Стэнфорда Стефано Эрмоном, внедрил в языковые модели диффузионные технологии (Diffusion), обычно применяемые в генерации изображений. Вместо последовательного создания токенов модель одновременно предсказывает блок текста, а затем итеративно улучшает его. Компания утверждает, что модель Mercury 2 в некоторых аспектах сопоставима с ранними версиями GPT-4 от OpenAI, но генерирует текст примерно в 10 раз быстрее.
В июне этого года Google также представил экспериментальную модель DiffusionGemma: она способна одновременно обрабатывать группу токенов и постепенно улучшать ответ. По заявлению компании, в определённых условиях на GPU скорость генерации текста может достигать примерно четырёхкратного увеличения по сравнению с традиционным подходом.
Есть и более радикальные решения. Стартап Liquid AI, созданный на базе MIT, смешивает архитектуру Transformer с жидкостными нейронными сетями (Liquid Neural Networks): в его последних моделях примерно 20% приходится на Transformer и 80% — на Liquid Neural Networks. Некоторые модели способны работать даже на низкопотребляющих устройствах вроде Raspberry Pi. А Pathway бросает вызов предпосылке, что ИИ должен рассуждать через текст: вместо Attention компания использует State Space, преобразуя информацию в более абстрактное внутреннее состояние. По мнению Pathway, математические и шахматные задачи не всегда удобно выражать словами, и требование модели переводить все рассуждения в текст может создавать ограничения.
Хотя до полной замены Transformer ещё далеко, эти эксперименты показывают: конкуренция в сфере эффективности ИИ выходит за рамки наращивания мощности GPU, квантования и сжатия моделей — теперь в фокусе внимания и сама архитектура моделей. Как отметил исполнительный директор Inception Эрмон, в конечном счёте ключевым показателем станет «интеллект за доллар».
