DeepDigest
Leiphone · · ~5 мин

DM0.5 от «»: прорыв в воплощённом интеллекте в RoboDojo

Модель DM0.5 от компании «» заняла первое место в системе оценки роботов RoboDojo. Она демонстрирует высокие результаты в задачах на память, долгосрочное выполнение и точность действий. Модель интегрирует память на этапе предобучения и использует уникальный набор данных для обучения.

DM0.5 от «»: прорыв в воплощённом интеллекте в RoboDojo

Компания «» с моделью DM0.5 заняла первое место в RoboDojo — авторитетной системе оценки моделей роботов. RoboDojo организована Гонконгским университетом совместно с UC Berkeley, Цинхуа и около 20 другими ведущими учреждениями. В системе 42 задачи, которые проверяют обобщение, память, точные операции, долгосрочное выполнение и понимание открытой семантики. 18 задач проводятся с тремя двурукими роботами (ARX X5, Piper и др.) при унифицированных условиях — оценка проводится вслепую.

По состоянию на июль текущего года в симуляционном рейтинге среди 30+ моделей (включая π0.5 (Physical Intelligence), NVIDIA GR00T-N1.7, OpenVLA-OFT) средний уровень успеха головных моделей — 8,80 %, у людей — 76,03 %. В рейтинге реальных машин общий уровень успеха головных моделей — 12,8 %, у людей — 100 %. Уровень успеха в задачах с открытой семантикой — 1,67 % (1 правильный ответ из 60 попыток).

Модель DM0.5 показала впечатляющие результаты: общий балл — 24,90, средний уровень успеха — 19,34 %. В одном из тестов на столе случайным образом размещаются три блока (красный, зелёный, синий) и три чашки — нужно накрыть блоки, а затем открыть чашки в порядке: красный, зелёный, синий. Большинство моделей роботов не справляются с этой задачей, но DM0.5 успешно её решает.

Одной из ключевых особенностей DM0.5 является интеграция памяти как изначальной способности на этапе предобучения. Архитектура модели включает 4B VLM-многомодальный основной блок и 680M Action Expert, а также «слой абстракции контекста» для сжатия информации. Это позволяет модели изначально усваивать историческую информацию и поддерживать память до 60 секунд. В задаче Cover Blocks (проверка памяти) DM0.5 при трёх случайных семенах прошла её со 100 % результатом, соблюдая условия: сохранение эффективного положения чашки и возврат объектов на исходные места. По метрике Memory DM0.5 получила 47,74 балла и 47,44 % успешности, тогда как второй участник — 13,37 балла и 12,11 % (разница в оценках — более чем в 3 раза, в успешности — почти в 4 раза).

Современные воплощённые модели (например, VLA) при принятии решений учитывают только текущую или несколько последних кадров. Они подходят для коротких задач (до 10 секунд), но не справляются с долгосрочными (приготовление еды, уборка и т. д.) из‑за отсутствия памяти. Основная сложность внедрения долгосрочной памяти в модели — высокая стоимость: увеличение длины контекста ведёт к росту вычислительных затрат и требует перестройки архитектуры.

DM0.5 использует несколько подходов:
* архитектурные решения с «первоначальным» усвоением истории;
* системное обновление на этапе предобучения (работа с историческим контекстом, воплощённым рассуждением, контролем действий, качеством данных);
* доработку на этапе микрообучения.

Также в DM0.5 добавлено 20-секундное историческое наблюдение в SFT для переноса способности понимания временных рядов на целевые задачи. Разрыв по метрике Memory — около 4 раз. DM0.5 достигает успеха за счёт сочетания предобучения и целенаправленного SFT.

Модель демонстрирует впечатляющие практические возможности:
* сборка миниатюрных блоков (ширина компонента <1 см) с точностью действий в диапазоне 0,1–1 мм; робот корректирует действия при ошибках (пауза ~0,5 с, затем перехват и корректировка позиции), среднее время сборки — 12 секунд;
* тонкая работа (очистка и нарезка огурца): контроль силы через измерение тока в двигателях суставов, использование руки с 58 степенями свободы;
* сортировка в логистике: среднее время отделения предмета — 3 секунды, точность >99 %, без заранее заданных сценариев, на основе реального визуального распознавания;
* тест на устойчивость к помехам: робот останавливается, анализирует ситуацию при вмешательстве (толчок, встряхивание камеры), продолжает задачу, учитывая предыдущие действия;
* способность запоминать действия за 60 секунд и анализировать демонстрационные видео для последующего воспроизведения действий.

Для обучения DM0.5 требуется специфический набор данных — нельзя использовать интернет-корпусы, в отличие от чат‑ботов. У «» три типа данных:
* 50 тыс. часов данных о высокоточных операциях (секунды — согласование команд и действий);
* 100 тыс. часов видео с первого лица (генерируют 3D‑разметку с точностью до миллиметра);
* 1 млн кв. м моделирования пространств (цифровая реконструкция реальных интерьеров).

DM0.5 использует «»: перед генерацией действия модель анализирует ряд вопросов (расположение объекта, предыдущее действие, нужно ли завершать шаг, последствия альтернативного действия) — всего 11 задач рассуждения. Модель двухсистемная: Sys2 отвечает за понимание команд и прогнозирование, Sys1 — за высокочастотные реакции.

Оптимизация (Vision TensorRT, FP8, CUDA Graph) сократила задержку ядра модели с 534 мс до 57,49 мс (ускорение в 9,29 раза), время отклика API — до 70 мс.

Другие результаты тестирования моделей:
* LIBERO — успешность 99,0 %;
* RoboTwin 2.0 — 93,6 % в простых сценариях, 93,3 % в сложных;
* VLA-Arena — 89,0 %, 53,6 %, 44,1 % для трёх уровней сложности;
* навигация R2R и RxR — успешность в незнакомых сценариях 59,7 % и 65,5 % соответственно;
* RoboChallenge Table30 v2 (4 типа роботов, 30 сложных задач) — DM0.5: успешность 43,0 %, суммарный балл 54,42 (1‑е место).

На 2000 тестовых эпизодах LIBERO успех снизился на 0,05 процентного пункта (с 98,45 % до 98,40 %).

DM0.5 — открытая модель; способна реагировать на внезапные прерывания со стороны человека, выполнять задачи на конвейере (одна задача за 3 секунды). Полный рабочий процесс с моделями и фреймворками (от LIBERO до RoboTwin2, RoboChallenge и SO101) размещён на GitHub и Hugging Face, код передан в сообщество LeRobot.

ITU (Международный союз электросвязи) провела первую очную встречу группы по вопросам воплощённого интеллекта. «» избрана главой рабочей группы «открытая экосистема». Воплощённому интеллекту нужен общий базовый слой: компании повторяют работу друг друга, малые команды не могут войти в сферу. Открытый базовый слой даст разработчикам уверенность в использовании данных. RoboDojo с результатом 1,67 % в краткосрочной перспективе — проблема отрасли, в долгосрочной — положительный фактор: появляется объективный критерий оценки «умности» роботов. DM0.5 после достижения вершины открыт для общего доступа — предоставляет критерии оценки, доказательства и результаты.

// оригинал
Leiphone ↗ Читать оригинал
6 просмотров
// поделиться Telegram VK