инструменты 1 мин

Энтузиаст сжал «Звёздные войны» до 320 КБ текста и восстановил видео через AI

Разработчик создал пайплайн, который разбивает фильм на ~2000 сцен, описывает каждую через Gemini Flash-Lite (~100 слов), сжимает описания до <1 МБ и восстанавливает видео через Wan 2.2, добавляя звук через MMAudio и MusicGen. Стоимость восстановления одного фильма — около $30, основная сложность — поддержание визуальной целостности персонажей между независимо сгенерированными сценами.

Это ранний прототип того, как может выглядеть хранение и передача медиа в будущем: не сами пиксели, а семантические описания для локальной генерации. При дальнейшем развитии генеративных моделей такой подход может радикально изменить стриминг и архивацию видео.

Фильм в текстовом файле

Пользователь Reddit под ником Willsolo представил экспериментальный пайплайн для экстремального сжатия видео через промежуточное текстовое представление с последующей AI-регенерацией.

Как это работает

Сжатие: - PySceneDetect разбивает фильм на ~2000 отдельных сцен по изменению кадра - Gemini Flash-Lite анализирует 8 случайных кадров из каждой сцены и создаёт структурированное описание (~100 слов) - Все описания сжимаются алгоритмом xz до ~320 КБ

Восстановление: - Каждое текстовое описание подаётся в Wan 2.2 TI2V-5B (самохостинг на RunPod A6000) - MMAudio генерирует звуковые эффекты, MusicGen — музыку - ElevenLabs TTS озвучивает диалоги по оригинальным временным меткам субтитров - Сцены длиннее 5 секунд склеиваются через chain last-frame→first-frame

Технические проблемы

Главная сложность — визуальная целостность персонажей. Поскольку каждая сцена генерируется независимо, разработчик применил кластеризацию описаний персонажей по всему фильму и инжектил их в промпты. VACE с референсными портретами помогает поддерживать consistency.

Экономика

  • Минимальная стоимость GPU: $0.33/час (A6000)
  • Полная регенерация одного фильма: ~$30
  • Автор опубликовал детальный разбор с примерами сцен и сравнением затрат между моделями

Код проекта доступен на GitHub под названием "lossy".

Ключевые выводы

  • Промежуточное текстовое представление позволяет сжать полнометражный фильм до <1 МБ с возможностью AI-регенерации
  • Главная техническая проблема AI-регенерации фильмов — не качество отдельных кадров, а визуальная целостность персонажей между независимо сгенерированными сценами
  • Экономика AI-регенерации видео приближается к практичности: $30 за фильм при самохостинге
  • Композитный подход (специализированные модели для видео, SFX, музыки, TTS) даёт лучший результат, чем универсальные решения
генеративное видеосжатиеtext-to-videoopen sourcevideo synthesis

Автор: Павел Заславский · Источник: reddit.com

Мнение редакции

Технически это впечатляет — PySceneDetect + Gemini для описаний + Wan 2.2 для регенерации, весь стек за $30 на RunPod. Но давайте честно: это пока proof-of-concept, не революция. Визуальная целостность персонажей — всё ещё проблема, и кластеризация описаний с VACE — это костыль, хоть и умный.

Интереснее здесь не «ого, фильм в мегабайт», а принципиальный сдвиг мышления. Мы привыкли хранить медиа как последовательность пикселей, но если генеративные модели станут достаточно хороши и дешёвы, зачем? Храни семантику, рендери локально. Netflix будущего может стримить не битрейт, а JSON с промптами. Но до этого будущего — годы работы над consistency и вычислительная доступность, которой сейчас нет.

Инструменты из статьи

ElevenLabsбез VPN

Синтез и клонирование голоса. Поддерживает русский, реалистичная интонация.

Доступ из РФ →

Ещё по теме

Комментарии