PEVA: прогнозирование эгоцентричного видео на основе движений всего тела
Berkeley Artificial Intelligence Research (BAIR)
Исследователи из BAIR (Berkeley AI Research) представили модель PEVA (Predict Ego-centric Video from human Actions), которая предсказывает следующее видео от первого лица на основе предыдущих кадров и заданного изменения позы человека. Модель обучена на наборе данных Nymeria, содержащем эгоцентричное видео и запись движений тела. PEVA способна генерировать атомарные действия, симулировать контрфактические ситуации и выдавать длинные последовательности видео, а также может быть использована для планирования.
Исследователи из BAIR (Berkeley AI Research) разработали модель PEVA (Predict Ego-centric Video from human Actions) для прогнозирования эгоцентричного видео на основе действий человека. Модель использует структурированное представление движений всего тела: каждое действие кодируется как 48-мерный вектор, включающий глобальное положение и относительные повороты 15 суставов верхней части тела. PEVA основана на Conditional Diffusion Transformer (CDiT) с тремя улучшениями: случайные пропуски временных шагов для обучения как краткосрочной, так и долгосрочной динамике; обучение на целых последовательностях с loss на каждом префиксе; внедрение действий в виде 1D тензора для conditioning высокоразмерных движений. Модель обучалась на наборе данных Nymeria, содержащем реальное эгоцентричное видео и захват поз тела. На тестировании PEVA генерирует атомарные действия (движения руками, повороты и перемещения), симулирует контрфактические ситуации (например, что было бы, если бы человек повернул не туда) и выдаёт до 16 секунд связного видео. При планировании модель оценивает несколько кандидатов действий по их перцептивному сходству с целевым изображением (метрика LPIPS), что позволяет, например, найти путь к холодильнику, исключив неверные варианты. Количественные оценки показывают, что PEVA превосходит базовые модели по перцептивным метрикам и хорошо масштабируется с размером модели. Планирование в текущей версии ограничено симуляцией движений отдельных рук и не поддерживает полную оптимизацию траектории. Будущие направления включают интеграцию высокоуровневого целевого conditioning и объектно-ориентированных представлений.
- Сокращения
- PEVA = Predict Ego-centric Video from human Actions — Прогнозирование эгоцентричного видео по действиям человека
- CDiT = Conditional Diffusion Transformer — Условный диффузионный трансформер
- LPIPS = Learned Perceptual Image Patch Similarity — Обучаемое перцептивное сходство фрагментов изображений
- CEM = Cross-Entropy Method — Метод кросс-энтропии
- VAE = Variational Autoencoder — Вариационный автокодировщик
Источник: BAIR (Berkeley AI) —
оригинал
