исследования 1 мин

Пропусти слой или зациклись: как научить LLM менять глубину вычислений на лету

Исследователи из arXiv показали, что слои предобученных LLM можно динамически пропускать или повторять в зависимости от запроса — без дообучения. Лёгкая сеть-предсказатель генерирует индивидуальный «маршрут» через слои для каждого входа, улучшая точность на математических задачах и одновременно снижая число вычислений.

Для владельцев локальных LLM это шанс получить «два в одном»: быстрый инференс на простых задачах и высокую точность на сложных — без дообучения и смены модели. Нужна лишь поддержка в софте.

Динамическая глубина без дообучения

Исследователи Li, Li и Zhou представили концепцию program-of-layers (PoLar) — метод, позволяющий LLM динамически менять порядок и количество выполняемых слоёв во время инференса. В отличие от классического прямого прохода фиксированной глубины, PoLar формирует индивидуальный «маршрут» для каждого входа: слои можно пропускать или повторять.

Как это работает

Авторы протестировали подход на Llama-3.2, Qwen1.5, Qwen2.5 и Qwen3. Ключевой элемент — лёгкая сеть-предсказатель, которая обучается генерировать программу выполнения: какие слои задействовать, какие пропустить, какие зациклить. Обучение происходит без изменения весов основной модели.

Результаты

На математических бенчмарках PoLar показал: - Повышение точности по сравнению со стандартным инференсом и динамическими методами. - Снижение числа выполняемых слоёв для простых запросов. - Исправление ошибок исходной модели за счёт альтернативных маршрутов с меньшей глубиной. - Сохранение преимуществ на out-of-distribution данных.

Зачем это локальному сообществу

Для пользователей локальных LLM это означает возможность гибких trade-off'ов: быстрый инференс на лету для простых задач, глубокий — для сложных. Требуется модификация стека (llama.cpp, vLLM и подобных), но потенциал велик: одна модель, разные режимы работы без дообучения.

Авторы подчёркивают: фиксированная глубина — лишь узкое подмножество скрытых вычислительных способностей LLM.

Ключевые выводы

  • Слои предобученных LLM можно динамически пропускать или зацикливать без дообучения модели.
  • Лёгкая сеть-предсказатель генерирует индивидуальный маршрут слоёв для каждого входа.
  • PoLar улучшает точность на математике, одновременно снижая число вычислений для простых запросов.
  • Фиксированный прямой проход использует лишь часть скрытых способностей модели.
  • Метод открывает путь к гибким trade-off'ам скорость/качество в локальных LLM без смены весов.
inferenceдинамическая глубинаPoLarлокальные LLMоптимизация

Автор: Ксения Лаврова · Источник: reddit.com

Мнение редакции

**На первый взгляд** это звучит как очередной академический трюк из серии «а давайте попробуем вот так». Но тут интересная штука: авторы показали, что один и тот же запрос модель может обработать десятком разных способов — и часть из них работает *лучше* стандартного прямого прохода, причём быстрее. Это не магия, а признание того, что мы заставляем LLM работать в одном жёстком режиме, хотя внутри у неё запас гибкости.

**Практический вопрос** — когда llama.cpp и компания поддержат это из коробки? Потому что идея «одна модель, три скорости» без файнтюна выглядит как настоящий апгрейд для локального инференса. Пока это proof-of-concept, но если зайдёт — goodbye, жёсткие trade-off'ы между размером модели и скоростью.

Ещё по теме

Комментарии