ИсследованияРоботика 🇺🇸 20.07.2026 07:04

Визуально-языковые модели обучают роботов распознавать эмоции человека

Google/DeepMindGoogle/DeepMind
Исследователи из Университета Монаша обучили коллаборативного робота распознавать человеческие эмоции с помощью визуально-языковой модели (VLM), учитывающей не только мимику, но и контекст взаимодействия. В экспериментах с 40 добровольцами VLM превзошла традиционную систему анализа эмоций, но её способность предсказывать внутренние чувства человека оказалась ограниченной.
В недавнем исследовании, опубликованном 18 мая в IEEE Robotics and Automation Letters, учёные под руководством Сын Чан Хонга из Университета Монаша (Мельбурн, Австралия) обучили коллаборативного робота распознавать человеческие эмоции, используя визуально-языковую модель (VLM) на базе Gemini 2.5, которая учитывает не только выражения лица, но и контекст взаимодействия. В первом эксперименте добровольцы описывали эмоции людей в видеороликах с передачей объектов роботом, и VLM показала точность 0,86 по шкале от 0 до 1, тогда как традиционная система, основанная на анализе мимики и отслеживании объектов, набрала 0,77. Во втором эксперименте 40 участников взаимодействовали с роботом, который намеренно ошибался, а затем либо приносил эмоционально адаптированные извинения, либо использовал заранее записанную фразу. 31 из 40 человек предпочли персонализированные извинения, однако опросы показали, что доверие к роботу снижалось независимо от типа извинений. Кроме того, VLM хорошо совпадала с оценками сторонних наблюдателей, но значительно хуже предсказывала эмоции, которые участники сообщали о себе сами. «VLM — хороший наблюдатель внешних социальных сигналов, но не читатель мыслей», — отметил Хонг, подчеркнув, что функциональность робота по-прежнему важнее его эмоциональных навыков.
Сокращения
VLM = Vision Language Model — визуально-языковая модель
Источник: IEEE Spectrum AI — оригинал

Наши прошлые публикации по теме

Есть свежие новости