исследования 1 мин

EdgeRazor: сжатие LLM до 1.88 бита на параметр без потери качества

Исследователи из Нанкинского университета предложили метод EdgeRazor, который сжимает большие языковые модели до экстремально низкой точности (1.88 бита на параметр) через дистилляцию с управлением энтропией. Работает с обычными форматами инференса, но требует вычислительных мощностей для создания студенческой модели. Открыт код и несколько примеров моделей.

Если метод масштабируется, это путь к запуску frontier-моделей на обычных ноутбуках и дешёвых edge-устройствах — революция в доступности AI для конечных пользователей и малого бизнеса.

Что сделали

Команда из Нанкинского университета опубликовала EdgeRazor — метод сжатия LLM через квантизацию со смешанной точностью и дистилляцию с управлением энтропией. Ключевое отличие: вместо простого округления весов метод переносит распределение вероятностей учительской модели в скрытые слои студенческой модели с низкой битностью, не пытаясь сохранить структуру параметров учителя.

Результат: модели работают при 1.88 бита на параметр (обычно используют 4-8 бит), при этом сохраняют больше способностей оригинала, чем при классической квантизации. Код открыт, загружены примеры моделей на Hugging Face (MobileLLM, Qwen3-0.6B/1.7B, Qwen2.5-Omni-7B).

Важный плюс: сжатые модели используют стандартные форматы, не нужно переделывать llama.cpp или другие движки инференса. Минус: процесс дистилляции требует больше вычислений, чем обычная квантизация (но меньше, чем полноценный QAT), поэтому пока примеры только на маленьких моделях.

Автор: Ксения Лаврова · Источник: reddit.com

Разработчикам. Готовый код на GitHub для применения метода к своим моделям. Совместимость с существующими движками инференса (llama.cpp, vLLM) без модификации. Можно экспериментировать с 7B+ моделями на потребительских GPU, если готовы потратить время на дистилляцию.

Бизнесу. Возможность запускать более умные модели на дешёвом железе (edge-устройства, мобильники, старые серверы). Снижение облачных расходов на инференс при сохранении качества ответов. Особенно актуально для B2C-продуктов с миллионами запросов.

Инвесторам. Тренд на экстремальное сжатие моделей набирает обороты — конкуренция за edge AI. Если метод масштабируется на 70B+ модели, это серьёзно подорвёт рынок облачного инференса. Смотреть на стартапы, которые первыми применят подобные техники в продакшене.

Хайп35
Реальная польза65
Заработать70
  • Сервис дистилляции моделей по заказу: компании присылают свои файнтюны, получают сжатые версии под конкретное железо
  • Edge AI продукты: чат-боты, ассистенты, переводчики на устройствах без интернета (медицина, производство, военка)
  • Библиотека готовых EdgeRazor-моделей для популярных задач: SaaS-подписка на оптимизированные модели
  • Консалтинг для компаний с большими расходами на инференс: миграция на сжатые модели = экономия 50-70% на железе
  • Открыть тему в Telegram/Discord про практическое применение EdgeRazor — собрать комьюнити, монетизировать через курсы/воркшопы
  • Метод вычислительно дорогой — для моделей 70B+ нужны кластеры GPU, непонятно, окупается ли это экономией на инференсе
  • Авторы показали примеры только на маленьких моделях (до 7B) — нет доказательств, что метод работает на frontier-моделях
  • Квантизация ниже 2 бит часто ломает reasoning и редкие языки — риск получить модель, которая хороша в бенчмарках, но бесполезна в реальных задачах
  • Конкуренция: GPTQ, GGUF, AWQ уже работают и имеют инфраструктуру, EdgeRazor должен доказать кратное превосходство, чтобы оправдать переход

Идея красивая: вместо того, чтобы тупо резать биты, научить маленькую модель повторять рассуждения большой через энтропию — то есть не просто копировать веса, а копировать стиль принятия решений. На бумаге выглядит как прорыв, и если бы авторы показали результаты на Llama-70B или Qwen-72B, я бы уже искал, где применить.

Но пока это исследовательская работа с примерами на игрушечных моделях до 7B. Плюс процесс дистилляции недешёвый — для серьёзных моделей нужны серьёзные ресурсы. Открытый код — отличный шаг, но нужны независимые бенчмарки от комьюнити на реальных задачах. Если EdgeRazor действительно держит качество на больших моделях при 2 битах, это убийца облачного инференса и золотое дно для edge AI. Пока — мониторим и ждём подтверждений.

Ещё по теме

Комментарии