Photon-1 научилась управлять компьютером, играть в шашки и симулировать физику на видео без единой подписи действий
Induction Labs выпустила Photon-1 — модель на 106 млрд параметров, которая училась 18 лет видео с экранов компьютеров, но ни разу не видела меток «что сделал пользователь». Вместо этого она предсказывает следующий кадр и сама выводит неявную политику действий. После дообучения она управляет Linux-десктопом лучше Gemini Flash, играет в шашки и моделирует бильярд — хотя эти задачи никогда не встречались в предобучении.
Это первая публичная демонстрация, что агент может научиться управлять компьютером, глядя на видео без единой метки действий — потенциальный путь к радикальному удешевлению и масштабированию обучения мультимодальных агентов. Если подход заработает, отпадает нужда в дорогой разметке траекторий.
Обучение без меток: как это работает
Большинство агентов, обучающихся на видео, требуют разметки: для каждого кадра нужна метка действия (клик, ввод, скролл). Induction Labs утверждает, что это узкое место. Их imagination models — архитектура фундаментальных моделей, которая предобучается на сыром видео вообще без меток действий.
Photon-1 — тестовый экземпляр: разреженный MoE-трансформер на 106B параметров (A5B активных), обученный на 18 годах записей экранов компьютеров (575 млн кадров, 1 кадр/сек). Модель не генерирует пиксели напрямую — она предсказывает следующий латентный токен в выученном пространстве представлений. Из этого она выводит неявную политику действий: учится понимать, что делает человек, без явных меток.
Сжатие и масштабирование
Ключевая фишка — finite scalar quantization (FSQ). Каждый кадр сжимается до 960 дискретных токенов (~2.2 КБ на кадр) — заявленный прирост >100× против OCR и мультимодальных представлений. Каждый токен — 8-мерный вектор, где каждая координата принимает одно из пяти значений: −1, −½, 0, ½, 1. Итоговая кодовая книга — 5⁸ возможных кодов.
Чтобы добиться такого уровня, Photon-1 использует дифференциальный латентный энкодер: кодирует кадры парами, чтобы описывать не содержимое, а разницу между кадрами.
Данные и обучение
Корпус стартовал с индекса из 2 млрд публичных видео. После фильтрации осталось ~2 млн записей экранов. Внутренняя модель детекции ключевых кадров вычистила дубли. Финал: 575 млн кадров = 552 млрд токенов. Обучение с нуля за один эпох.
Предобучение MoE-модели с контекстом 32K заняло ~30 000 GPU-часов H200 (4.4×10²² FLOPs) при 40% MFU. Команда имплементировала обучение в PyTorch с кастомными ядрами для энкодера и MoE-слоёв.
От воображения к действию
Для управления компьютером Photon-1 дообучили на <35 000 траекторий computer use. Специальные токены позволяют модели выдавать действия. На инференсе она сначала предсказывает состояние следующего кадра, затем — действие, которое к нему ведёт.
Далее — онлайн RL: роллауты в реальном времени на виртуальных Linux-машинах (5 DE: LXQt, Xfce, MATE, GNOME, Plasma), программная проверка исходов → reward. Каждая VM имеет Google-аккаунт для веб-приложений и клон ChatGPT без рейт-лимитов.
Сравнение с Gemini
| Модель | Предобучение FLOPs | Цена инференса (взвешенная) |
|---|---|---|
| Gemini 3.1 Flash-Lite | 1.2×10²⁴ | $0.36/1М токенов |
| Photon-1 | 0.044×10²⁴ | $0.11/1М токенов |
На внутреннем бенчмарке computer use Photon-1 обошла Gemini Flash при ~27× меньше предобучения и ~3× дешевле на инференсе (при соотношении вход:выход 10:1).
Два нюанса: (1) цифры Gemini — консервативная оценка Induction Labs (8B активных параметров, 25T токенов обучения); (2) бенчмарк внутренний, публично не воспроизводим.
Обобщение за пределы десктопа
Photon-1 видела только компьютерные экраны. Команда дообучила её на 20 000 турнирных партий в шашки (Open Checkers Archive 2.0) и 10 000 синтетических игр в бильярд (5 fps). Результат: Photon-1 обогнала LLM-baseline (Ling-flash-2.0, 20T токенов) и vision-only baseline по качеству симуляции и ходов. На бильярде MAE 0.47 против истинной физики (vs 1.15 у LLM, 1.44 у vision-only).
Бонус: после RL модель научилась использовать внутренний ChatGPT-клон в VM — составлять артефакты и отвечать на вопросы, направляя LLM как человек.
Ключевые выводы
- Imagination models учатся предсказывать следующий кадр без меток действий — и из этого выводят неявную политику: «что делал человек»
- FSQ сжимает кадр до 960 токенов (~2.2 КБ) — заявленный прирост >100× против OCR/мультимодальных энкодеров при сохранении текста и состояния
- Photon-1 обучена на 18 годах видео экранов (575M кадров) за ~30k GPU-часов H200 при 40% MFU и один эпох
- На внутреннем бенчмарке computer use модель обошла Gemini Flash при ~27× меньше предобучения и ~3× дешевле на инференсе
- Несмотря на то что видела только десктоп, после дообучения Photon-1 превзошла LLM-baseline на шашках и моделировании бильярдной физики
Автор: Артём Ковалёв · Источник: marktechpost.com
**Звучит как магия, но есть подвох.** Идея красивая: вместо дорогой разметки «здесь клик, тут скролл» — просто показываем модели тонну видео с экрана, она учится предсказывать следующий кадр и сама *выводит* действия. Induction Labs заявляет, что их Photon-1 обошла Gemini Flash на внутреннем бенчмарке при 27× меньше предобучения и 3× дешевле на инференсе. Круто, если правда.
Но дьявол в деталях. Во-первых, бенчмарк **внутренний** — никто кроме них его не видел. Во-вторых, цифры Gemini — их собственная *консервативная оценка*, а не официальные данные Google. В-третьих, дообучение всё равно потребовало 35k размеченных траекторий computer use плюс онлайн RL на фермах VM — это не «обучение вообще без меток», а «предобучение без меток, потом классическая разметка». Сжатие FSQ до 2.2 КБ на кадр — впечатляет, если не теряет критичных деталей (OCR, layout). Генерализация на шашки и бильярд после обучения только на десктопе — это реально интересно и намекает, что модель научилась чему-то про физику мира, а не просто запомнила паттерны UI. Но пока это одна лаборатория, один закрытый бенчмарк и много громких слов. Жду независимых тестов.
Инструменты из статьи
Универсальный AI-ассистент OpenAI: тексты, код, анализ, изображения, голос.
Доступ из РФ →
Комментарии