WAIC 2026: Ишэ Чжихан представила модель AWE 3.5 — первый нативный мозг для воплощённого интеллекта
На WAIC 2026 компания Ишэ Чжихан (Itas Zhihang) показала обновлённую модель AWE 3.5 — первый нативный воплощённый базовый модель, объединяющий предобучение и дообучение в едином фреймворке. Роботы на стенде выполняли множество задач без переключения параметров, а посетители могли взаимодействовать с симулированным миром, сгенерированным моделью в реальном времени.
На выставке WAIC 2026 компания Ишэ Чжихан (它石智航) представила новую версию своей модели воплощённого интеллекта — AWE 3.5, которую называют первым нативным базовым моделью, объединяющим предобучение и дообучение в едином фреймворке. На стенде была развёрнута полноценная сборочная линия жгутов проводов в масштабе 1:1, где несколько роботов одновременно выполняли различные операции на конвейере. По словам главного учёного Дин Вэньчао, роботы работали настолько быстро, что пришлось снижать темп, чтобы не закончились материалы. AWE 3.5 позволяет роботам выполнять множество задач — от сборки и упаковки до сортировки — без перезагрузки модели или смены параметров. Посетители могли надеть перчатки для сбора данных и взаимодействовать с параллельным миром, сгенерированным моделью: поднимать кубики, перетаскивать коробки — причём все физические эффекты моделировались без использования законов Ньютона или физического движка, только на основе обучения на реальных данных. Модель также демонстрирует способность к долговременной памяти и пространственному пониманию, что критически важно для предсказания будущих состояний в течении нескольких минут. Архитектура AWE 3.5 — это единая структура (One Model), которая с самого предобучения объединяет визуальные, языковые и моторные модальности. Она может выступать как базовая политика (Base Policy), выдающая команды, так и как модель мира (Action Condition World Model), предсказывающая изменения окружающей среды. Это позволяет формировать замкнутый цикл обучения с подкреплением в симуляции, что значительно ускоряет отработку действий. Компания утверждает, что AWE 3.5 обучена на сверхмиллионе часов human-centric данных, что сопоставимо с объёмом данных для видеогенерации. Благодаря повышению эффективности данных и инфраструктуре, выполнение новой задачи теперь требует всего несколько часов сбора данных. По мнению руководства, масштабирование воплощённого интеллекта уже полностью раскрыто, и в 2027 году ожидается переломный момент, когда роботы начнут реально работать в промышленности, а не просто демонстрировать трюки.
- Сокращения
- VLA = Vision-Language-Action — Видение-Язык-Действие
- SFT = Supervised Fine-Tuning — Контролируемая донастройка
- AGI = Artificial General Intelligence — Общий искусственный интеллект
Источник: QbitAI 量子位 —
оригинал
