Обнаружена атака GhostWriter: вредоносные инструкции прячут в долговременной памяти ИИ-агентов
Исследователи из Университета штата Нью-Мексико описали атаку GhostWriter на ИИ-агентов с долговременной памятью. Злоумышленник внедряет скрытые инструкции в память агента, которые затем выполняются без ведома пользователя. Авторы также представили защитную систему AM-Sentry.
Исследователи из Университета штата Нью-Мексико Джордж Торрес, Шарад Шрестха и Сатьяжайант Мисра описали атаку GhostWriter на ИИ-агентов с долговременной памятью. Атака состоит из двух этапов: сначала злоумышленник отправляет агенту скрытую полезную нагрузку, которая записывается в долговременную память как обычная запись; затем, когда пользователь даёт легитимную задачу, агент извлекает из памяти отравленные данные и выполняет вредоносную инструкцию, например, перенаправляет письма из банка на посторонний ящик или тайно пересылает сообщения. Эксперименты показали почти 100-процентную инъекцию (около 98%) и активацию в среднем в 60% случаев. В ответ исследователи разработали систему AM-Sentry с двумя защитными механизмами: политика сохранения памяти предотвращает запись подозрительных данных, а экран извлечения фильтрует данные, отдаваемые агенту при запросе. В тестах AM-Sentry значительно снизила успех атаки, не ухудшив полезные функции агента. Авторы надеются на внедрение подобных методов защиты в коммерческие платформы.
Источник: Hightech.fm —
оригинал
