исследования 1 мин

Google Research: передовые LLM знают 95% фактов, но не могут вспомнить треть из них

Исследователи Google разработали фреймворк для профилирования знаний LLM и обнаружили: модели вроде Gemini 3 и GPT-5 хранят 95-98% фактов в параметрах, но не могут вспомнить 26-34% из них без подсказок. Проблема не в отсутствии знаний, а в неспособности их извлечь — это меняет подход к улучшению точности моделей.

Это исследование переворачивает понимание того, как делать LLM точнее: вместо бесконечного увеличения размера и данных акцент смещается на методы, помогающие моделям эффективнее использовать уже накопленные знания. Для бизнеса это путь к точности без дорогого масштабирования.

Команда Google Research представила метод knowledge profiling — способ точно определить, почему LLM ошибается с фактами. Вместо простого подсчёта правильных ответов они разделили проблему на две: модель никогда не учила факт (encoding failure — пустые полки) или факт в памяти есть, но модель не может его вспомнить (recall failure — потерянные ключи).

Для проверки создали бенчмарк WikiProfile из 2150 фактов Википедии, каждый с 10 вопросами. Тестировали 13 моделей, включая Gemini 3 и GPT-5, с цепочками рассуждений и без. Результат: 95-98% фактов закодированы в параметрах передовых моделей, но 26-34% из них модель не может вспомнить напрямую. Даже с режимом thinking (внутренние рассуждения) остаётся 11-12% провалов.

Увеличение размера модели улучшает запоминание фактов, но слабо помогает с их извлечением. В семействе Gemma 3 более крупные версии хранят больше знаний, но доля ошибок из-за плохого recall растёт. Узкое место сместилось: раньше проблема была в накоплении знаний, теперь — в их использовании. Факт легче вспомнить, если вопрос похож на контекст из обучающих данных — смена формулировки или порядка сущностей резко снижает точность.

Выводы меняют стратегию: вместо бесконечного увеличения параметров и данных нужны методы пост-обучения и инференса, помогающие моделям эффективнее доставать то, что уже записано.

LLMfactualitybenchmarksGoogle Researchscaling

Автор: Сергей Ефимов · Источник: research.google

Разработчикам. Новый подход к диагностике ошибок LLM: вместо слепого увеличения размера модели можно работать над prompt-инженерингом, retrieval-augmented generation и техниками вроде цепочек рассуждений, чтобы улучшить recall. WikiProfile — готовый бенчмарк для тестирования.

Бизнесу. Если ваш AI-продукт выдаёт неточности, проблема не обязательно в нехватке данных — возможно, модель просто не извлекает то, что знает. Это открывает путь к более дешёвым решениям: улучшать промпты и постпроцессинг вместо дорогого переобучения.

Инвесторам. Рынок дорогого scaling под вопросом: если передовые модели уже хранят 95% фактов, дальнейшее увеличение параметров даёт убывающую отдачу. Растёт спрос на инструменты для улучшения inference-time reasoning, RAG-системы и методы оптимизации recall — ниши с высоким ROI.

Хайп25
Реальная польза80
Заработать75
  • Разработка специализированных prompt-техник и фреймворков для улучшения recall в существующих LLM — консалтинг и инструменты для компаний
  • Создание SaaS-платформ для автоматической диагностики knowledge profiling на корпоративных моделях — выявление слабых мест без переобучения
  • Инструменты для автоматической генерации тестовых наборов по методике WikiProfile для специализированных доменов (медицина, право, финансы)
  • Разработка middleware-решений, которые на лету улучшают recall через контекстное переформулирование запросов и промежуточные рассуждения
  • Консалтинг по оптимизации стоимости AI-инфраструктуры: вместо перехода на более крупные модели клиенты улучшают recall на текущих
  • Исследование от Google — возможна предвзятость в сторону собственных моделей Gemini, независимая репликация результатов пока отсутствует
  • WikiProfile опирается на факты Википедии, которая активно присутствует в обучающих данных — результаты могут не переноситься на узкоспециализированные домены
  • Методика измерения encoding и recall через LLM-авторейтеры сама зависит от качества оценщика — циклическая зависимость может искажать выводы
  • Проблема recall может быть артефактом архитектуры трансформеров, а не универсальным свойством — решения могут устареть при смене парадигмы

Это одно из тех исследований, которое меняет вектор всей индустрии. Google по сути говорит: ребят, мы уже натренировали модели на всём, что можно, дальше просто пихать данные бессмысленно. Проблема в том, что модель не может достать из себя то, что в ней есть — как будто у тебя дома миллион книг, но нет каталога.

Здесь два важных момента. Первый: это честное признание, что гонка за параметрами упирается в потолок — экономика AI-стартапов должна пересмотреть ставки. Второй: открывается огромная ниша для инструментов улучшения recall — промпты, RAG, inference-time методы. Кто первым сделает удобный middleware для корпораций, тот поймает волну. Но осторожно: исследование от Google, а значит, есть шанс, что они продвигают свою повестку перед запуском новых продуктов.

Ещё по теме

Комментарии