Cactus Hybrid: Gemma 4 научили признаваться, когда модель не уверена
Команда Cactus модифицировала Gemma 4, добавив слой из 68k параметров, который предсказывает уверенность модели в своём ответе (0-1). Это позволяет автоматически маршрутизировать только 15-35% запросов на большую облачную модель, достигая при этом качества Gemini 3.1 Flash-Lite. Ключевая фишка: зонд читает «самосознание» модели из скрытых состояний, а не из текста ответа или энтропии токенов.
Это первый практичный способ калибровать уверенность маленьких моделей без парсинга текста или хрупкой эвристики. Для разработчиков — конкретная экономия денег и приватность; для индустрии — шаг к умным гибридным системам, где модели сами знают свои границы.
Gemma 4 с калиброванной уверенностью
Команда Cactus представила Cactus Hybrid — модификацию Gemma 4 (E2B), которая к каждому ответу возвращает численную оценку уверенности от 0 до 1. Это решает классическую проблему гибридных систем: когда использовать быструю локальную модель, а когда — дорогую облачную.
Как это работает
Вместо ненадёжных методов (просить модель оценить себя текстом или считать энтропию токенов) разработчики провели механистическое исследование архитектуры Gemma 4. Оказалось, скрытые состояния промежуточных слоёв несут сигнал «самосознания» модели.
Добавлен компактный зондирующий слой всего на 68 тысяч параметров (LayerNorm, low-rank проекция, attention pooling, маленький MLP). Он читает промежуточный слой во время генерации и предсказывает p(ошибка). Оценка уверенности = 1 - p(ошибка), возвращается как структурированные данные — не нужно парсить текст.
Результаты
На 12 бенчмарках (текст, изображения, аудио) зонд показал в среднем 0.814 AUROC против 0.549 у энтропии токенов. Впечатляет: зонд не обучался на аудиоданных, но на четырёх аудио-бенчмарках выдал 0.79-0.88 AUROC, пока энтропия проваливалась (0.32-0.52). Это значит, он читает модально-независимый сигнал корректности, а не запоминает паттерны.
Практический выигрыш: маршрутизируя только 15-55% запросов на Gemini 3.1 Flash-Lite (в зависимости от задачи), гибрид достигает качества полноценной облачной модели: - ChartQA: 15-20% в облако - LibriSpeech: 25-30% - MMBench, GigaSpeech, MMAU: 30-35% - MMLU-Pro: 45-55%
Доступность
Веса опубликованы на HuggingFace, код (MIT) на GitHub с поддержкой Transformers, MLX, llama.cpp, Cactus. Интеграция с Ollama, vLLM, SGLang в работе.
Ограничения: зонд работает только для single-sequence декодирования до 1024 токенов, маршрутизацию лучше делать по задачам, а не по шагам. Иерархическая маршрутизация (локально → DeepSeek → GPT) в разработке. Техника специфична для каждой модели.
Ключевые выводы
- Скрытые состояния промежуточных слоёв Gemma 4 содержат модально-независимый сигнал уверенности модели
- Зонд на 68k параметров даёт 0.814 AUROC против 0.549 у энтропии токенов на кросс-модальных бенчмарках
- Гибридная маршрутизация позволяет 65-85% запросов обрабатывать локально, достигая качества облачной модели
- Зонд обобщается на незнакомые модальности (аудио) без переобучения — это не переподгонка
- Экономика: маршрутизация 15-35% запросов в облако vs 100% даёт огромную разницу в стоимости и приватности
Автор: Ксения Лаврова · Источник: reddit.com
Это одна из тех редких работ, где красивая идея подкреплена реальными цифрами и открытым кодом. Калибровка уверенности через скрытые состояния — не новая мысль, но команда Cactus показала, что это можно сделать крошечным зондом на 68k параметров, причём обобщение на незнакомые модальности (аудио) без переобучения — убедительное доказательство, что модель читает что-то фундаментальное, а не подгоняется под тесты.
Практическая ценность очевидна: экономия на API-вызовах в 3-6 раз, приватность (большинство запросов не уходит в облако), скорость. Но есть нюанс: техника boutique для каждой модели, веса нужны отдельные. Пока это Gemma 4, завтра — что? Если команда сможет масштабировать подход на популярные модели (Llama, Qwen) и упростить обучение зондов — это станет стандартом. А пока — отличный инструмент для тех, кто строит гибридные системы уже сегодня.
Инструменты из статьи
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →
Комментарии