Google DeepMind представляет Gemini Omni — мультимодальную модель для создания и редактирования видео
Google/DeepMind
Google DeepMind
Google DeepMind анонсировала Gemini Omni — новую модель, способную генерировать и редактировать видео на основе комбинации изображений, аудио, видео и текста. Первая версия, Gemini Omni Flash, уже доступна в приложении Gemini, Google Flow и YouTube Shorts. Модель позволяет редактировать видео через диалог на естественном языке, сохраняя согласованность персонажей и физику.
Google DeepMind представила Gemini Omni — новую мультимодальную модель, которая объединяет способности ИИ к рассуждению и генерации контента. Omni может принимать на вход любые комбинации изображений, аудио, видео и текста и создавать на их основе высококачественные видео, используя реальные знания Gemini из различных областей. Первая модель семейства — Gemini Omni Flash — запускается сегодня для подписчиков Google AI Plus, Pro и Ultra в приложении Gemini и Google Flow, а также бесплатно в YouTube Shorts и приложении YouTube Create. Omni позволяет редактировать видео через естественный язык: каждое новое указание строится на предыдущем, сохраняя согласованность персонажей, физику и контекст сцены. Пользователи могут изменять окружение, действия, добавлять или удалять объекты, а также менять стиль и угол съёмки в ходе нескольких итераций. Модель также способна генерировать видео по текстовым описаниям, комбинируя интуитивное понимание физики и культурный контекст. В ближайшее время модель станет доступна разработчикам и корпоративным клиентам через API. Все созданные видео содержат невидимый цифровой водяной знак SynthID для верификации.
- Сокращения
- API = Application Programming Interface — интерфейс программирования приложений
- FPS = Frames Per Second — кадров в секунду
Источник: Google DeepMind —
оригинал
