Трансформер для апскейла сжали до 668 КБ с помощью тернарной квантизации BitNet
Исследователи применили 1.58-битную квантизацию BitNet к vision-трансформеру Swin2SR для увеличения изображений. Модель весит всего 668 КБ в сжатом виде, работает в браузере и даёт +2.66 dB прироста качества над бикубической интерполяцией при увеличении в 2 раза.
Это первый практический пример того, как экстремальное сжатие моделей BitNet работает для компьютерного зрения, а не только для LLM. Для разработчиков и бизнеса это означает новый класс edge AI: модели, которые грузятся быстрее картинок и работают в браузере без серверов.
Что сделали
Команда взяла lightweight-версию Swin2SR (vision-трансформер для увеличения изображений в 2 раза, 1.01M параметров) и применила тернарную квантизацию в стиле BitNet — каждый вес стал −1, 0 или +1 плюс небольшой коэффициент масштабирования на группу (~2.18 эффективных бита на вес).
Результат: модель весит 668 КБ в ONNX (gzipped) — меньше большинства картинок, которые она обрабатывает. Запускается в браузере через ONNX Runtime Web, ничего не уходит на сервер. Выдаёт 34.44 dB PSNR на классическом бенчмарке Set5 (×2 RGB) против 31.79 dB у бикубической интерполяции — прирост +2.66 dB.
Ограничения
Честно заявлены: работает только на чистых изображениях при увеличении ×2, не спасёт сильно сжатый JPEG или артефакты. Не генеративная модель — улучшает то, что есть, но не додумывает детали. Тернарная квантизация приносит небольшую потерю качества против FP32, но размер модели уменьшается примерно в 7 раз.
Модель под лицензией Apache 2.0, основана на Swin2SR из mv-lab, доступна на HuggingFace в формате ONNX и safetensors для Transformers.
Автор: Юлия Тарасова · Источник: reddit.com
Разработчикам. Готовая инфраструктура для встраивания локального апскейла в веб-приложения без GPU и серверов. ONNX Runtime Web + safetensors, все веса умещаются в CDN-файл меньше мегабайта. Рецепт квантизации можно применить к другим vision-трансформерам для клиентских приложений.
Бизнесу. Открывает возможность встраивать улучшение качества изображений прямо в браузер — никаких облачных GPU, мгновенная загрузка, данные не покидают устройство. Подходит для SaaS-редакторов, приложений для фото, медицинских визуализаций, дизайн-инструментов, где важна приватность.
Инвесторам. Тренд на экстремальное сжатие моделей переходит с LLM на компьютерное зрение. Потенциал: edge AI для браузеров и мобильных устройств без зависимости от облака. Первые коммерческие продукты, использующие такие подходы, могут получить преимущество в приватности и скорости развертывания.
- SaaS-редакторы и дизайн-инструменты с локальным апскейлом: пользователи загружают картинки, улучшают без загрузки на сервер — конкурентное преимущество по приватности
- Мобильные и прогрессивные веб-приложения для фото: модель грузится быстрее главной страницы, работает офлайн
- Медицинские и научные визуализации на edge-устройствах: увеличение качества снимков прямо на планшете врача без передачи данных
- Библиотеки и API для разработчиков: упакованные решения для быстрого встраивания апскейла в существующие продукты
- Консалтинг и кастомная квантизация: применение рецепта BitNet к другим vision-задачам (детекция, сегментация) для edge-развёртывания
- Ограниченная применимость: работает только на чистых изображениях ×2, не справляется с сильными артефактами — узкая ниша
- Качество ниже FP32-моделей: тернарная квантизация приносит жертвы, пользователи могут предпочесть облачные решения с максимальным качеством
- Конкуренция со стороны генеративных моделей: новые диффузионные апскейлеры создают детали, а не просто улучшают — могут вытеснить такие подходы
- Технический порог входа: интеграция ONNX Runtime Web требует знаний, не все разработчики готовы связываться с низкоуровневыми оптимизациями
Честно говоря, это круче, чем кажется на первый взгляд. Все носятся с BitNet для языковых моделей, но вот вам практический кейс для компьютерного зрения — модель меньше мегабайта, которая улучшает картинки прямо в браузере. Да, она не творит чудес, не спасёт картошку из соцсетей, но для чистых изображений прирост качества реальный, а главное — данные не покидают устройство.
Для разработчиков это золотая жила: можно встроить локальный апскейл в редакторы, медицинские приложения, дизайн-инструменты без головной боли с серверами и GPU. Ограничения есть, но авторы сами их признают — это вызывает больше доверия, чем обычный хайп. Если экосистема edge AI для браузеров наберёт обороты, такие решения станут стандартом для задач, где важна приватность и скорость.
Комментарии