Автоматическое определение виновного агента и момента сбоя в мультиагентных системах на LLM
OpenAI
DeepSeek
Google DeepMind
Meta
Исследователи из Университета штата Пенсильвания и Университета Дьюка совместно с Google DeepMind и другими институтами представили задачу автоматической атрибуции сбоев в мультиагентных системах на LLM. Они создали бенчмарк-датасет Who&When, содержащий 127 логов сбоев с аннотациями, и протестировали несколько методов атрибуции. Эксперименты показали, что даже лучшие методы достигают точности лишь около 53,5% в определении ответственного агента и 14,2% в определении шага ошибки.
В мультиагентных системах на основе больших языковых моделей (LLM) сбои возникают часто, но их диагностика затруднена из-за автономного взаимодействия агентов и длинных цепочек информации. Чтобы решить эту проблему, исследователи из Университета штата Пенсильвания и Университета Дьюка совместно с Google DeepMind, Университетом Вашингтона, Meta, Наньянским технологическим университетом и Университетом штата Орегон формализовали задачу автоматической атрибуции сбоев. Они создали первый бенчмарк-датасет Who&When, включающий 127 логов сбоев, собранных из различных LLM-мультиагентных систем, с аннотациями: кто (агент), когда (шаг) и почему (объяснение). Для атрибуции были разработаны три метода: «всё сразу» (однократный анализ всего лога), «шаг за шагом» (последовательный анализ) и «бинарный поиск» (деление лога пополам). Эксперименты с GPT-4o и другими моделями показали, что задача очень сложна: лучший метод достиг точности 53,5% в определении ответственного агента и лишь 14,2% в точном определении шага ошибки. Некоторые методы работали хуже случайного угадывания. Комбинирование подходов улучшало результат, но с большими вычислительными затратами. Даже современные модели рассуждений, такие как OpenAI o1 и DeepSeek R1, испытывали трудности. Исследование также выявило, что увеличение длины контекста снижает производительность. Работа принята на конференцию ICML 2025 в формате Spotlight, код и датасет открыты.
- Сокращения
- LLM = Large Language Model — большая языковая модель
Источник: Synced —
оригинал
