Обеспечение безопасности ИИ-агентов: стратегия Google DeepMind
Google/DeepMind
Google DeepMind
Google DeepMind представила дорожную карту по контролю за ИИ-агентами, которая добавляет уровень системной безопасности поверх традиционного выравнивания модели. Подход рассматривает потенциально несоответствующих агентов как инсайдерские угрозы и включает мониторинг, предотвращение и реагирование в реальном времени. Компания также опубликовала техническую основу для политиков.
Google DeepMind разработала дорожную карту по контролю за ИИ (AI Control Roadmap), которая предназначена для управления и обеспечения безопасности продвинутых ИИ-агентов, развернутых внутри Google. Эта система безопасности, основанная на принципе "глубокой защиты", выходит за рамки традиционного выравнивания моделей и добавляет критический слой защиты на уровне системы, что дает гарантии даже при несовершенном выравнивании. Дорожная карта рассматривает потенциально несоответствующих ИИ-агентов как возможные "инсайдерские угрозы", аналогично тому, как компания относится к потенциально недобросовестному сотруднику, уже имеющему доступ к офису. Для оценки рисков используется фреймворк моделирования угроз на основе отраслевого стандарта MITRE ATT&CK. Команда разработала внутренний прототип асинхронной системы мониторинга, которая проверяет траектории работы кодирующих агентов и передает результаты на рассмотрение человеку. Система уже проанализировала миллион задач кодирующих агентов, что дало ценные сведения для улучшения протоколов безопасности. В рамках дорожной карты предусмотрены меры обнаружения, предотвращения и реагирования, включая использование доверенных ИИ-систем в качестве "супервизоров", которые постоянно проверяют действия агента и могут блокировать вредоносные действия в реальном времени. Также опубликована техническая основа для политиков "Три уровня безопасности агентов" (Three Layers of Agent Security), которая описывает необходимость повышения безопасности на уровне отдельных агентов, в мультиагентных системах и в более широкой экосистеме.
- Сокращения
- MITRE ATT&CK = MITRE ATT&CK — база знаний тактик и техник противников, разработанная MITRE
Источник: Google DeepMind —
оригинал
