Видео Bad Apple в нейросети на 3 МБ: как уместить 2,7 млрд пикселей в 790к параметров
Разработчик сжал классическую анимацию Bad Apple (6524 кадра, 854×480) в нейросеть весом 3,2 МБ. Вместо хранения кадров MLP с SIREN-активациями принимает координаты (время, x, y) и генерирует пиксель на лету. После доработок (time-stretch и выборка по движению) MSE упала в 9 раз — статичные кадры стали точнее в 15 раз, динамичные в 3,6 раза.
Показывает, как нейросети вытесняют классические алгоритмы в компрессии и генерации контента — подход уже применим для продуктов, где размер критичен, а рендер можно делать на стороне устройства.
Что произошло
Автор обучил компактную нейросеть (5 слоёв, 512 нейронов, SIREN-активации) воспроизводить легендарную черно-белую анимацию Bad Apple. Вместо хранения растровых кадров сеть принимает 3D-координату (номер кадра t, позиция пикселя y, x) и выдаёт яркость от 0 до 1. Итог: ~2,7 млрд пикселей оригинального видео (6524 кадра 854×480) сжаты в 790 тысяч параметров — 3,2 МБ в float32, 1,6 МБ в float16.
Первая версия на ReLU + Fourier features застряла на MSE 0,12 и размывала быстрые движения. Переход на SIREN дал высокочастотные детали, но temporal resolution провисала. Автор добавил time-stretch (масштабирование временной координаты в 4 раза до первого слоя) и motion-focused sampling: половина батча — пиксели, которые изменились между соседними кадрами. Bad Apple на 90% статична, и равномерная выборка душила градиенты на движущихся краях.
Результаты после доработок: валидационный MSE упал с 0,0795 до 0,0090 (×9), кадры с движением стали точнее в 3,6 раза, статичные — в 15 раз. 398 из 400 тестовых кадров улучшились. Обучение: одна общая сеть на весь объём (без latent-кодов на кадр — они вызывали catastrophic forgetting), Adam с cosine LR + weight EMA, затем низко-LR-проход по всем кадрам.
Исходник: 1620 кадров 384×384 (1/10 пикселей оригинала), SIREN с ω₀=30, sigmoid на выходе. Код и чекпоинты выложены на GitHub.
Автор: Артём Ковалёв · Источник: reddit.com
Разработчикам. SIREN для implicit neural representations с time-stretch и motion-focused sampling решает проблему размытия движения; подход заменяет кодеки там, где нужна компактность + программируемость (генеративное видео, эмбеддинги в приложения). Готовый код для экспериментов.
Бизнесу. Нейро-компрессия видео открывает ниши: микровидео в IoT/edge-приложениях (AR-инструкции, встроенная анимация), NFT/креатив (видео в смарт-контракте), генеративный контент (замена кодеков в стриминге). Конкурентное преимущество — размер + интерполяция из коробки.
Инвесторам. Implicit neural representations (NeRF, SIREN) переходят от исследований к продуктам: видео-компрессия, 3D-ассеты, генерация контента. Потенциал в edge AI, стриминге, метавселенных; стоит следить за стартапами на стыке neural codecs и real-time синтеза.
- Плагин для Unity/Unreal: паковать кат-сцены и intro в нейросети — экономия бандвидта и места на диске
- SaaS для сжатия корпоративного видео: обучающие ролики, инструкции — 10x компрессия + встроенная интерполяция кадров
- NFT-коллекции с on-chain видео: сеть 1–3 МБ помещается в смарт-контракт, mint дешевле
- AR-очки и wearables: микровидео для подсказок/анимаций без прожорливого стриминга
- Генеративный видео-редактор: пользователь двигает слайдер времени — сеть дорисовывает новые кадры без ререндера
- SIREN требует обучения для каждого видео — не real-time кодек, подходит только для статичного контента
- Качество сильно зависит от motion pattern: Bad Apple чёрно-белая с резкими контурами, на сложном видео (шумы, градиенты, текстуры) MSE может быть неприемлемым
- Интерпретация: 790k параметров — это 3 МБ, но инференс медленнее классических кодеков; для воспроизведения нужна GPU или оптимизированная CPU-сеть
- Catastrophic forgetting при масштабировании: автор отказался от per-frame latents, но для длинных видео (часы, фильмы) подход может не сработать
Это не просто tech demo, а рабочий proof-of-concept neural codec для узких задач. Парень честно показал, где ReLU с Fourier провалился, как SIREN дала детали, но убила движение, и как time-stretch + умная выборка вытащили качество. 9x улучшение MSE — не маркетинг, а результат инженерной работы.
Практически: для стартапа это готовая технология под edge-приложения (AR-инструкции, IoT-дисплеи), NFT с on-chain видео или генеративный контент. Но не стоит переоценивать универсальность: Bad Apple — чёрно-белая графика, на реальном видео с шумом/текстурами результат может быть хуже. Следите за implicit neural representations — это не хайп 2023, а медленно созревающая инфраструктура для контента следующего поколения.
Комментарии