исследования 1 мин

Xiaomi доказала: для обучения роботов важнее собрать больше данных, чем раздувать модель

Xiaomi выпустила AI-модель Xiaomi-Robotics-1 для роботов, которая работает по принципу языковых моделей — чем больше данных, тем лучше результат. Главная фишка: вместо дорогого обучения физических роботов компания записывала данные портативными захватами в руках людей — собрали 100 000+ часов движений в реальных условиях. Тесты показали: рост объёма данных поднял успешность модели с 25% до 75%, тогда как увеличение размера модели дало намного меньший эффект.

Это меняет экономику робототехники: вместо дорогих роботов-учителей можно массово собирать данные людьми с дешёвыми захватами. Если тренд подтвердится, барьер входа в робототехнику резко упадёт — как когда-то случилось с NLP после появления больших датасетов.

Данные против вычислений: Xiaomi переписывает правила робототехники

Xiaomi представила модель Xiaomi-Robotics-1, которая ломает главную проблему AI-робототехники — дефицит обучающих данных. Если языковые модели учатся на половине интернета, то роботам приходится осваивать каждое движение с нуля, обычно через дорогое дистанционное управление физическими машинами.

Компания пошла другим путём: вместо роботов использовала портативные захваты с камерами, которые люди просто держат в руках и выполняют задачи — на кухнях, в офисах, магазинах, на производстве и даже на улице. Результат: более 100 000 часов записей движений в реальных условиях.

Автоматизация разметки

Такой массив данных создаёт новую проблему: каждое движение нужно описать текстом, чтобы модель училась. Ручная разметка нереалистична, поэтому Xiaomi использовала другую AI-модель для автоматического описания — весь датасет разметили за две недели.

Данные важнее мощности

Тесты на физических роботах (колёсных и с двумя манипуляторами) показали ключевой результат: рост объёма данных поднял успешность в незнакомых условиях с ~25% до 75%, тогда как увеличение размера модели дало намного меньший прирост. Это совпадает с мартовскими исследованиями по визуальным данным: для задач с изображениями добавление данных эффективнее, чем масштабирование модели.

Практические результаты

Xiaomi-Robotics-1 показала лучшие результаты по стандартным бенчмаркам. В демо робот самостоятельно упаковал чемодан за 10+ минут, перемещаясь по комнате. В тестах на адаптацию к новым задачам (упаковка телефона, загрузка стиралки, подача бумаги в принтер) модель после менее 10 часов обучения на каждую задачу достигла 75% успешности против 40% у конкурирующей модели Physical Intelligence.

Контекст индустрии

Разные команды атакуют проблему данных с разных сторон: Nvidia генерирует синтетические данные, китайский BAAI учит модель Orca на 125 000 часов видео вообще без разметки действий. Xiaomi выбрала гибрид: автоматизация разметки в масштабе плюс сбор данных дешёвым методом.

Модель и код выложат в открытый доступ на GitHub и Hugging Face. Команда уже опубликовала предыдущую версию Xiaomi-Robotics-0 с фокусом на быстродействие в реальном времени.

Ключевые выводы

  • Для обучения роботов объём данных важнее размера модели — противоречит балансу «данные=вычисления» из NLP
  • Портативные захваты в руках людей решают проблему дорогого телеоперирования и позволяют собирать данные где угодно
  • Автоматическая разметка через AI сократила время обработки 100К+ часов видео до двух недель
  • Модель адаптируется к новым задачам после <10 часов обучения с 75% успешностью — в 1.8× лучше конкурентов
  • Подход масштабируется: команда не достигла предела эффекта от роста данных

Автор: Ксения Лаврова · Источник: the-decoder.com

Мнение редакции

Это один из тех материалов, где цифры говорят громче слов: 75% против 40% у конкурента — не погрешность, а пропасть. Xiaomi не просто выпустила очередную модель, а показала, что робототехника может идти путём NLP: сначала накопить критическую массу данных, потом масштабировать.

Впрочем, есть нюанс: Physical Intelligence (та самая проигравшая сторона) в апреле огребала критику за то, что их модель якобы «обобщала», а на деле просто вспоминала похожие примеры из обучения. Если Xiaomi утверждает, что больше данных решает всё — как отличить реальное обобщение от более плотного покрытия вариантов? С датасетом в 100К+ часов эта граница размывается. Но с практической точки зрения — какая разница, если робот просто работает?

Ещё по теме

Комментарии