Anthropic рассказала, как ограничивает Claude в вебе, коде и совместной работе
Anthropic
Компания Anthropic опубликовала технические детали механизмов безопасности, которые не дают её ИИ-модели Claude выходить за установленные границы при использовании в вебе, при написании кода и в режиме совместной работы (Cowork). Методы основаны на комбинации поведенческой фильтрации, анализа цепочек мыслей и мониторинга подозрительных паттернов в реальном времени.
Anthropic раскрыла подробности о том, как она контролирует свою языковую модель Claude, чтобы предотвратить нежелательное поведение в трёх ключевых сценариях: веб-интерфейс, генерация кода и режим совместной работы (Cowork). Компания использует многоуровневую систему безопасности, включающую поведенческую фильтрацию на основе правил, анализ цепочек мыслей (Chain-of-Thought) для выявления скрытых намерений и мониторинг запросов в реальном времени для обнаружения подозрительных паттернов. Особое внимание уделяется предотвращению атак типа „промпт-инъекций“ и „джейлбрейков“, когда пользователь пытается обойти ограничения модели. Для сценария с программным кодом Anthropic внедрила специальные проверки, блокирующие генерацию вредоносного или опасного кода. В режиме Cowork, где Claude взаимодействует с пользователем в общей рабочей области, система отслеживает не только текстовые сообщения, но и действия по файлам. Компания подчеркивает, что все меры балансируют между безопасностью и сохранением полезной функциональности модели.
Источник: Anthropic (GNews) —
оригинал
