модели 2 мин

Photon-1 научилась управлять компьютером, играть в шашки и симулировать физику на видео без единой подписи действий

Induction Labs выпустила Photon-1 — модель на 106 млрд параметров, которая училась 18 лет видео с экранов компьютеров, но ни разу не видела меток «что сделал пользователь». Вместо этого она предсказывает следующий кадр и сама выводит неявную политику действий. После дообучения она управляет Linux-десктопом лучше Gemini Flash, играет в шашки и моделирует бильярд — хотя эти задачи никогда не встречались в предобучении.

Это первая публичная демонстрация, что агент может научиться управлять компьютером, глядя на видео без единой метки действий — потенциальный путь к радикальному удешевлению и масштабированию обучения мультимодальных агентов. Если подход заработает, отпадает нужда в дорогой разметке траекторий.

Обучение без меток: как это работает

Большинство агентов, обучающихся на видео, требуют разметки: для каждого кадра нужна метка действия (клик, ввод, скролл). Induction Labs утверждает, что это узкое место. Их imagination models — архитектура фундаментальных моделей, которая предобучается на сыром видео вообще без меток действий.

Photon-1 — тестовый экземпляр: разреженный MoE-трансформер на 106B параметров (A5B активных), обученный на 18 годах записей экранов компьютеров (575 млн кадров, 1 кадр/сек). Модель не генерирует пиксели напрямую — она предсказывает следующий латентный токен в выученном пространстве представлений. Из этого она выводит неявную политику действий: учится понимать, что делает человек, без явных меток.

Сжатие и масштабирование

Ключевая фишка — finite scalar quantization (FSQ). Каждый кадр сжимается до 960 дискретных токенов (~2.2 КБ на кадр) — заявленный прирост >100× против OCR и мультимодальных представлений. Каждый токен — 8-мерный вектор, где каждая координата принимает одно из пяти значений: −1, −½, 0, ½, 1. Итоговая кодовая книга — 5⁸ возможных кодов.

Чтобы добиться такого уровня, Photon-1 использует дифференциальный латентный энкодер: кодирует кадры парами, чтобы описывать не содержимое, а разницу между кадрами.

Данные и обучение

Корпус стартовал с индекса из 2 млрд публичных видео. После фильтрации осталось ~2 млн записей экранов. Внутренняя модель детекции ключевых кадров вычистила дубли. Финал: 575 млн кадров = 552 млрд токенов. Обучение с нуля за один эпох.

Предобучение MoE-модели с контекстом 32K заняло ~30 000 GPU-часов H200 (4.4×10²² FLOPs) при 40% MFU. Команда имплементировала обучение в PyTorch с кастомными ядрами для энкодера и MoE-слоёв.

От воображения к действию

Для управления компьютером Photon-1 дообучили на <35 000 траекторий computer use. Специальные токены позволяют модели выдавать действия. На инференсе она сначала предсказывает состояние следующего кадра, затем — действие, которое к нему ведёт.

Далее — онлайн RL: роллауты в реальном времени на виртуальных Linux-машинах (5 DE: LXQt, Xfce, MATE, GNOME, Plasma), программная проверка исходов → reward. Каждая VM имеет Google-аккаунт для веб-приложений и клон ChatGPT без рейт-лимитов.

Сравнение с Gemini

Модель Предобучение FLOPs Цена инференса (взвешенная)
Gemini 3.1 Flash-Lite 1.2×10²⁴ $0.36/1М токенов
Photon-1 0.044×10²⁴ $0.11/1М токенов

На внутреннем бенчмарке computer use Photon-1 обошла Gemini Flash при ~27× меньше предобучения и ~3× дешевле на инференсе (при соотношении вход:выход 10:1).

Два нюанса: (1) цифры Gemini — консервативная оценка Induction Labs (8B активных параметров, 25T токенов обучения); (2) бенчмарк внутренний, публично не воспроизводим.

Обобщение за пределы десктопа

Photon-1 видела только компьютерные экраны. Команда дообучила её на 20 000 турнирных партий в шашки (Open Checkers Archive 2.0) и 10 000 синтетических игр в бильярд (5 fps). Результат: Photon-1 обогнала LLM-baseline (Ling-flash-2.0, 20T токенов) и vision-only baseline по качеству симуляции и ходов. На бильярде MAE 0.47 против истинной физики (vs 1.15 у LLM, 1.44 у vision-only).

Бонус: после RL модель научилась использовать внутренний ChatGPT-клон в VM — составлять артефакты и отвечать на вопросы, направляя LLM как человек.

Ключевые выводы

  • Imagination models учатся предсказывать следующий кадр без меток действий — и из этого выводят неявную политику: «что делал человек»
  • FSQ сжимает кадр до 960 токенов (~2.2 КБ) — заявленный прирост >100× против OCR/мультимодальных энкодеров при сохранении текста и состояния
  • Photon-1 обучена на 18 годах видео экранов (575M кадров) за ~30k GPU-часов H200 при 40% MFU и один эпох
  • На внутреннем бенчмарке computer use модель обошла Gemini Flash при ~27× меньше предобучения и ~3× дешевле на инференсе
  • Несмотря на то что видела только десктоп, после дообучения Photon-1 превзошла LLM-baseline на шашках и моделировании бильярдной физики
foundation modelsMoEcomputer usevision encoderRLFSQ

Автор: Артём Ковалёв · Источник: marktechpost.com

Мнение редакции

**Звучит как магия, но есть подвох.** Идея красивая: вместо дорогой разметки «здесь клик, тут скролл» — просто показываем модели тонну видео с экрана, она учится предсказывать следующий кадр и сама *выводит* действия. Induction Labs заявляет, что их Photon-1 обошла Gemini Flash на внутреннем бенчмарке при 27× меньше предобучения и 3× дешевле на инференсе. Круто, если правда.

Но дьявол в деталях. Во-первых, бенчмарк **внутренний** — никто кроме них его не видел. Во-вторых, цифры Gemini — их собственная *консервативная оценка*, а не официальные данные Google. В-третьих, дообучение всё равно потребовало 35k размеченных траекторий computer use плюс онлайн RL на фермах VM — это не «обучение вообще без меток», а «предобучение без меток, потом классическая разметка». Сжатие FSQ до 2.2 КБ на кадр — впечатляет, если не теряет критичных деталей (OCR, layout). Генерализация на шашки и бильярд после обучения только на десктопе — это реально интересно и намекает, что модель научилась чему-то про физику мира, а не просто запомнила паттерны UI. Но пока это одна лаборатория, один закрытый бенчмарк и много громких слов. Жду независимых тестов.

Инструменты из статьи

Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.

Доступ из РФ →

Ещё по теме

Комментарии