Xiaomi доказала: для обучения роботов важнее собрать больше данных, чем раздувать модель
Xiaomi выпустила AI-модель Xiaomi-Robotics-1 для роботов, которая работает по принципу языковых моделей — чем больше данных, тем лучше результат. Главная фишка: вместо дорогого обучения физических роботов компания записывала данные портативными захватами в руках людей — собрали 100 000+ часов движений в реальных условиях. Тесты показали: рост объёма данных поднял успешность модели с 25% до 75%, тогда как увеличение размера модели дало намного меньший эффект.
Это меняет экономику робототехники: вместо дорогих роботов-учителей можно массово собирать данные людьми с дешёвыми захватами. Если тренд подтвердится, барьер входа в робототехнику резко упадёт — как когда-то случилось с NLP после появления больших датасетов.
Данные против вычислений: Xiaomi переписывает правила робототехники
Xiaomi представила модель Xiaomi-Robotics-1, которая ломает главную проблему AI-робототехники — дефицит обучающих данных. Если языковые модели учатся на половине интернета, то роботам приходится осваивать каждое движение с нуля, обычно через дорогое дистанционное управление физическими машинами.
Компания пошла другим путём: вместо роботов использовала портативные захваты с камерами, которые люди просто держат в руках и выполняют задачи — на кухнях, в офисах, магазинах, на производстве и даже на улице. Результат: более 100 000 часов записей движений в реальных условиях.
Автоматизация разметки
Такой массив данных создаёт новую проблему: каждое движение нужно описать текстом, чтобы модель училась. Ручная разметка нереалистична, поэтому Xiaomi использовала другую AI-модель для автоматического описания — весь датасет разметили за две недели.
Данные важнее мощности
Тесты на физических роботах (колёсных и с двумя манипуляторами) показали ключевой результат: рост объёма данных поднял успешность в незнакомых условиях с ~25% до 75%, тогда как увеличение размера модели дало намного меньший прирост. Это совпадает с мартовскими исследованиями по визуальным данным: для задач с изображениями добавление данных эффективнее, чем масштабирование модели.
Практические результаты
Xiaomi-Robotics-1 показала лучшие результаты по стандартным бенчмаркам. В демо робот самостоятельно упаковал чемодан за 10+ минут, перемещаясь по комнате. В тестах на адаптацию к новым задачам (упаковка телефона, загрузка стиралки, подача бумаги в принтер) модель после менее 10 часов обучения на каждую задачу достигла 75% успешности против 40% у конкурирующей модели Physical Intelligence.
Контекст индустрии
Разные команды атакуют проблему данных с разных сторон: Nvidia генерирует синтетические данные, китайский BAAI учит модель Orca на 125 000 часов видео вообще без разметки действий. Xiaomi выбрала гибрид: автоматизация разметки в масштабе плюс сбор данных дешёвым методом.
Модель и код выложат в открытый доступ на GitHub и Hugging Face. Команда уже опубликовала предыдущую версию Xiaomi-Robotics-0 с фокусом на быстродействие в реальном времени.
Ключевые выводы
- Для обучения роботов объём данных важнее размера модели — противоречит балансу «данные=вычисления» из NLP
- Портативные захваты в руках людей решают проблему дорогого телеоперирования и позволяют собирать данные где угодно
- Автоматическая разметка через AI сократила время обработки 100К+ часов видео до двух недель
- Модель адаптируется к новым задачам после <10 часов обучения с 75% успешностью — в 1.8× лучше конкурентов
- Подход масштабируется: команда не достигла предела эффекта от роста данных
Автор: Ксения Лаврова · Источник: the-decoder.com
Это один из тех материалов, где цифры говорят громче слов: 75% против 40% у конкурента — не погрешность, а пропасть. Xiaomi не просто выпустила очередную модель, а показала, что робототехника может идти путём NLP: сначала накопить критическую массу данных, потом масштабировать.
Впрочем, есть нюанс: Physical Intelligence (та самая проигравшая сторона) в апреле огребала критику за то, что их модель якобы «обобщала», а на деле просто вспоминала похожие примеры из обучения. Если Xiaomi утверждает, что больше данных решает всё — как отличить реальное обобщение от более плотного покрытия вариантов? С датасетом в 100К+ часов эта граница размывается. Но с практической точки зрения — какая разница, если робот просто работает?
Комментарии