GhostWriter: новая атака на память ИИ-агентов, о которой стоит знать бизнесу
Развитие персональных ИИ-ассистентов меняет требования к информационной безопасности.
Если раньше основное внимание уделялось защите инфраструктуры и пользовательских аккаунтов, то теперь появляется новая поверхность атаки — долговременная память языковых моделей.
Исследователи Университета Нью-Мексико представили работу, посвященную атаке GhostWriter. Она показывает, что злоумышленник способен внедрять ложную информацию в память ИИ-агента, влияя на его дальнейшие решения.
Что представляет собой долговременная память
Современные ИИ-помощники все чаще используют механизм постоянной памяти.
Она позволяет хранить:
- предпочтения пользователя;
- историю взаимодействий;
- особенности рабочих процессов;
- персональные настройки;
- сведения о проектах.
За счет этого ответы становятся персонализированными, а количество повторяющихся вопросов уменьшается.
Но вместе с удобством появляется новая точка риска.
Как работает GhostWriter
Авторы исследования выделяют две стадии атаки.
Первая — внедрение вредоносной инструкции в память модели.
Вторая — ее последующая активация при выполнении обычных пользовательских запросов.
При этом пользователь продолжает работать с системой как обычно и не получает признаков компрометации.
Практический пример
Исследователи рассматривают сценарий почтового помощника.
Если память агента содержит скрытую инструкцию пересылать сообщения определенного отправителя, то такая операция может выполняться автоматически без участия пользователя.
Фактически злоумышленник получает влияние не на модель целиком, а на накопленный опыт конкретного ИИ-ассистента.
Почему это важно
Чем активнее компании внедряют автономных ИИ-агентов, тем больше бизнес-процессов начинает зависеть от их памяти.
Под угрозой оказываются:
- корпоративная переписка;
- документы;
- рабочие инструкции;
- автоматизация процессов;
- внутренняя аналитика.
Что можно сделать уже сейчас
Несколько практических рекомендаций выглядят очевидными.
Не предоставлять ассистенту лишние разрешения.
Контролировать автоматические действия.
Периодически проверять сохраненную память.
Разделять доступ между различными рабочими сценариями.
Вывод
GhostWriter показывает, что следующий этап развития кибербезопасности связан уже не только с защитой инфраструктуры.
Все большую роль начинает играть контроль того, что именно ИИ считает своим опытом.