DeepDigest
TechOrange · · ~3 мин

GhostWriter и MemGhost: угрозы для долгосрочного хранилища AI Agent

Исследования GhostWriter и MemGhost выявили серьёзную уязвимость в работе AI Agent: злоумышленники могут внедрять ложные данные в долгосрочное хранилище и использовать их для опасных действий. Успешность атак достигает 98 %, а обычные защитные механизмы пропускают более 90 % вредоносных сообщений. Для защиты требуются изменения в архитектуре AI.

GhostWriter и MemGhost: угрозы для долгосрочного хранилища AI Agent

AI Agent всё чаще используют долгосрочное хранилище данных — оно позволяет лучше понимать запросы пользователей и повышать ценность взаимодействия. Однако эта функция превращается в серьёзную уязвимость.

В 2026 году появились исследования, демонстрирующие риски: команда из Университета штата Нью-Мексико описала атаку GhostWriter, а Yechao Zhang и другие исследователи — MemGhost. Суть угроз в том, что злоумышленники могут внедрять ложную информацию в долгосрочное хранилище AI Agent, а позже использовать её для опасных действий.

GhostWriter работает в два этапа: сначала в хранилище AI Agent тайно внедряется вредоносный контент («внедрение памяти»), а затем, когда пользователь отправляет обычный запрос, AI Agent использует загрязнённые данные и выполняет вредоносное действие («запуск атаки»). Например, AI Agent может перенаправить банковские письма злоумышленнику или использовать поддельные данные как достоверные. Успешность внедрения вредоносных данных в рамках GhostWriter достигает 98 %, а вероятность их последующего использования — около 60 %. Для защиты исследователи предложили фреймворк Agentic Memory Sentry (AM-Sentry) — он фильтрует содержимое памяти и ужесточает политику управления памятью на двух этапах: при записи данных и при их повторном использовании.

Атака MemGhost нацелена на автоматизацию атак через электронные письма. Если AI Agent имеет доступ к почтовому ящику и может изменять своё долгосрочное хранилище, злоумышленнику достаточно отправить специально подготовленное письмо. Например, с помощью OpenClaw (открытого фреймворка помощника) можно внедрить ложные данные в файлы AGENTS.md или MEMORY.md. При этом изменения остаются незаметными для пользователя — AI Agent работает в фоновом режиме, а пользователи редко проверяют исходные файлы памяти.

Yechao Zhang провёл тест в реальных условиях: связал OpenClaw с реальным аккаунтом Gmail через Google OAuth и Gmail API и отправил атакующие письма с контролируемого аккаунта. Более половины писем успешно обошли фильтры Gmail и внедрили вредоносный контент в хранилище AI Agent без уведомлений для пользователя.

Исследования показали, что обычные фильтры для блокировки вредоносных писем пропускают более 90 % сообщений MemGhost. Даже если модель усилена с точки зрения безопасности и настроена игнорировать команды из писем, около 50 % случаев всё равно приводят к выполнению вредоносного кода. При запросе пользователя перечислить шаги выполнения задачи вероятность обнаружения атаки составляет всего 75 %.

Эксперты считают, что решения должны быть встроены в архитектуру AI: нужно отмечать источник каждой записи в хранилище, требовать подтверждения пользователя перед записью данных и вести полный журнал всех операций. Особенно опасны системы, в которых один AI Agent может свободно считывать ненадёжные данные и самостоятельно изменять своё хранилище без участия человека. Чтобы минимизировать риски, компаниям нужно включить управление долгосрочным хранилищем в систему корпоративного управления — внедрить маркировку источников данных, подтверждение записи, аудит журналов и изоляцию прав доступа.

// оригинал
TechOrange ↗ Читать оригинал
36 просмотров
// поделиться Telegram VK