исследования 1 мин

Робототехнику учат через активность мозга: как стартапы решают проблему дефицита данных

Encord строит бизнес на производстве тренировочных данных для физических роботов, включая эксперименты с датчиками мозговых волн. Проблема в том, что для обучения манипуляторов нужны массивы данных в пять раз больше YouTube, а простой скрейпинг тут не работает — данные приходится физически создавать в специальных лабораториях, что делает их в 20 раз дороже обычного видео.

Это показывает реальный барьер на пути к массовым человекоподобным роботам: не архитектура моделей, а дефицит и стоимость физических тренировочных данных. Подход Encord может либо решить эту проблему, либо показать её фундаментальную нерешаемость по экономическим причинам.

Физические данные — новое узкое горлышко AI

В складском помещении в Калифорнии человек в шлеме с датчиками мозговых волн играет в «Дженгу». Это не неврологический эксперимент, а производство тренировочных данных для роботов — новый бизнес компании Encord.

Изначально создававшая инструменты для аннотации данных, Encord обнаружила критическую проблему: физических данных для обучения роботов-манипуляторов просто не существует. В отличие от LLM, которые тренировали на текстах всего интернета практически бесплатно, роботам нужны демонстрации реальных физических действий — а их негде взять в нужных объёмах.

От видео к мозговым волнам

Encord использует два основных подхода: видео «от первого лица» с камер на рабочих и данные от телеуправляемых роботов. Но компания идёт дальше, экспериментируя с новыми модальностями:

  • Датчики мозговых волн (совместно с немецким стартапом Zander Labs) определяют моменты ошибок, намерений и удивления — сигналы о том, когда задача требует максимального внимания модели
  • Электрические сигналы мышц предплечья позволяют создавать 3D-модель положения руки, которую камера не всегда захватывает полностью
  • Плотная текстовая аннотация действий («правая рука затягивает болт») для LLM-моделей

Пилоты компании учат роботов наливать кофе, вставлять ethernet-кабели в серверы, укладывать покерные фишки — задачи, которые люди делают не задумываясь, а роботы пока не освоили.

Экономика физического AI

Глава направления робототехники Винит Велмуруган (бывший OpenAI и Berkshire Grey) оценивает: чтобы совершить прорыв, нужен датасет в пять раз больше видеокорпуса YouTube. Плотно аннотированные данные стоят в 20 раз дороже обычного «эго-видео», но дают эффект в 100 раз выше для специфичных задач.

Проблема в том, что физические данные нельзя просто скрейпить — их нужно производить. Это радикально меняет экономику обучения моделей и превращает генерацию данных из исследовательской задачи в самостоятельный бизнес.

Вопрос остаётся открытым: масштабируется ли этот подход до уровня, необходимого для революции в физическом AI, или стоимость данных останется фундаментальным ограничителем?

Ключевые выводы

  • Физические данные для роботов нельзя скрейпить с интернета — их нужно производить в реальном мире, что делает их в 20 раз дороже обычного видео
  • Датчики мозговых волн могут показывать моментам сложности задачи, помогая моделям понять, когда нужно максимальное внимание
  • Для прорыва в робототехнике нужен датасет в 5 раз больше всего YouTube — масштаб, объясняющий появление целой индустрии производства данных
  • Комбинация эгоцентрического видео, датчиков мышц и текстовых аннотаций создаёт более богатое представление о физических действиях
  • Экономика физического AI фундаментально отличается от LLM: высокая стоимость данных может стать главным ограничителем развития
робототехникатренировочные данныенейроинтерфейсыфизический AIкомпьютерное зрение

Автор: Ксения Лаврова · Источник: TechCrunch AI

Мнение редакции

**Вот это действительно интересный сюжет** — не очередная новая модель или хайп про AGI, а столкновение с физической реальностью. Пока все носятся с GPT и ChatGPT, выясняется базовая вещь: чтобы робот научился вставлять кабель, ему нужно показать это миллион раз вживую. И нет, YouTube тут не поможет.

Что меня цепляет: **подход с мозговыми волнами звучит как sci-fi, но логика железная**. Если модель знает, в какой момент человек напрягается и концентрируется, она понимает, где задача сложная. Это умнее, чем просто скармливать терабайты видео. Но вопрос цены остаётся открытым — производить такие данные в 20 раз дороже, а нужно их в сотни раз больше. Возможно, физический AI упрётся не в алгоритмы, а в банальную экономику. И это отрезвляет лучше любой статьи про "пределы масштабирования".

Ещё по теме

Комментарии