исследования 2 мин

Почему «идеальное сжатие» AI-моделей может проваливать задачу — исследование 12 доменов с предсказаниями против реальности

Исследователь показал на 12 доменах (от радаров до языковых моделей): алгоритм сжатия, оптимальный по метрике восстановления данных, может проигрывать на реальной задаче другому методу с «худшим» восстановлением — потому что задача чувствительна к другим измерениям данных. Когда меняешь задачу — победитель меняется местами. Все предсказания зарегистрированы заранее, включая провалы.

Если сжимаете модели (квантизация, pruning, distillation) по стандартным метрикам точности восстановления — можете убить производительность на задаче, даже при «идеальных» числах. Исследование показывает, как выбирать метрику под конкретную модель, и где это критично (например, KV-кэш в LLM).

Баг, запустивший исследование

Автор наткнулся на странность: 4-битный квантайзер для KV-кэша языковой модели показывал косинусное сходство 0.995 (почти идеал), но взрывал perplexity в ~1000 раз. Другой метод с «худшим» восстановлением работал нормально. Метрика качества и реальная задача разошлись полностью.

Суть теории

При сжатии данных для downstream-модели ошибка на задаче зависит не от общей точности восстановления, а от того, какие измерения данных читает конкретная модель. Математически: искажение ≈ tr(P_C Σ_δ), где P_C — матрица чувствительности модели (Fisher-взвешенные градиенты), Σ_δ — ковариация ошибки сжатия.

Обычное сжатие считает P_C = I (все направления равны). Задаче важны совсем другие оси — и метод, «портящий» неважные направления ради важных, побеждает.

12 доменов под микроскопом

Автор зарегистрировал все предсказания до запуска (sealed pre-registration: гипотеза + планка pass/fail публикуются заранее). Результаты:

  • Llama-3.2-3B (KV-кэш + softmax attention): «худший» код победил 16/16 раз при одинаковом восстановлении до 7.5e-9 — метрика восстановления потеряла различающую силу.
  • Акустика, радары, сейсмика (LOCATA, AV16.3, PDAR, 77 ГГц FMCW): flip в 74–100% случаев.
  • Градиенты в оптимизации: flip НЕ появился — автор предсказал это заранее (top-Hessian направления совпадают с энергией градиента, так что обычное сжатие уже оптимально).
  • Юридический поиск, этика, музыка: подтверждения с нюансами.

Честные провалы

Автор публикует все отрицательные результаты:

  • Одна статистика для диагностики режимов сломалась на первом же тесте → пришлось строить двухосевую.
  • Гипотеза про density-quotient опровергнута в 4 тестах подряд.
  • Паттерн: flip работает, где оператор чтения идентифицируем и не совпадает с энергией сигнала. В остальных случаях — нет, и это информативно.

Связь с прошлым

Это не новая физика: Hessian-взвешенное сжатие известно (OBD → GPTQ), теория indirect source coding — с 1962 (Dobrushin–Tsybakov). Новое:

  1. Слепое восстановление subspace чтения из чёрного ящика (с валидацией против ground truth).
  2. Flip показан проспективно через домены.
  3. Теоремы кодирования: consumer-relative R(D), successive-refinement регион, mismatch bounds.
  4. Таксономия случаев, где flip невозможен.

Ограничения

Ядро — синтетические консьюмеры (для ground truth). Одна обученная модель (Llama). Эксплораторные строки помечены отдельно. Соло-автор. Эксперименты и драфт — AI-assisted (с протоколом верификации; ошибки ассистента залогированы публично).

Код, регистрации, JSON результатов — на GitHub (ahb-sjsu). Препринты на Zenodo с DOI (нет endorsement для arXiv).

Ключевые выводы

  • Метрика качества сжатия (reconstruction error) может не коррелировать с качеством на задаче — если задача чувствительна к другим измерениям данных
  • «Худший» по восстановлению метод может выигрывать на задаче, а при смене задачи — победитель меняется местами (flip эффект)
  • Flip предсказуем: появляется, где read operator модели идентифицируем и не совпадает с энергией сигнала; в градиентной оптимизации его нет по структурным причинам
  • Sealed pre-registration работает: публикация отрицательных результатов выявила границы теории и сломанные метрики
  • Для сжатия KV-кэша LLM метрика косинусного сходства может быть бесполезна — perplexity взлетает при 0.995 similarity

Автор: Никита Громов · Источник: reddit.com

Мнение редакции

Это одна из тех работ, где честность дороже результата. Автор не просто показал flip эффект (когда «идеальное сжатие» проигрывает на задаче), но и **публично зарегистрировал каждое предсказание до запуска**, включая провалы. Результат: теория работает там, где read operator модели не совпадает с энергией сигнала — и ломается ровно в предсказанных местах (например, в градиентах). Пример с Llama KV-кэшем особенно едкий: cosine similarity 0.995, а perplexity взлетает в 1000 раз — потому что attention читает данные совсем не так, как метрика восстановления.

Минусы: синтетические консьюмеры в ядре (для ground truth это норма, но на production моделях пока одна точка — Llama), AI-assisted драфтинг (с логированием ошибок, но всё же), solo-автор без arXiv endorsement (пришлось на Zenodo). Зато код, данные, регистрации — всё открыто, можно рвать на части. Если занимаетесь квантизацией/сжатием моделей и до сих пор верите MSE/cosine — этот текст болезненный, но полезный.

Ещё по теме

Комментарии