исследования 1 мин

Что будет, если обучить языковую модель только на материалах начальной школы

Исследователи создали LittleLearner — семейство моделей (0.6B-5B параметров), обученных исключительно на материалах до 5 класса. Эксперимент показал: ни масштабирование, ни дообучение, ни промпт-инжиниринг не помогли моделям выйти за рамки знаний из предобучения. Граница способностей жёстко задаётся тренировочными данными.

Понимание, что модели не могут выйти за рамки своих тренировочных данных, критично для разработки AI-продуктов и оценки реальных возможностей технологии.

Что сделали

Команда исследователей создала LittleCurriculum — датасет из 88 млрд токенов, отфильтрованный строго по программе американской начальной школы (K–5, примерно до 5 класса). Материал прогнали через пятиступенчатый фильтр по стандартам Common Core: всё, что выходит за рамки программы начальной школы — факты, концепции, специальная лексика — явно исключили.

На этих данных обучили три модели LittleLearner (0.6B, 1.3B, 5B параметров) и для каждой создали контрольную версию на нефильтрованных данных с той же архитектурой и объёмом токенов. Затем проверили, можно ли стандартными методами — масштабированием, дообучением через GRPO, промптами — заставить модель решать задачи за рамками школьной программы.

Результат

Ни один метод не сработал. Модели отлично справлялись с задачами в рамках K–5, но не освоили ничего сложнее: дообучение усиливало только то, что уже было в предтренинге. Граница знаний оказалась жёсткой. Это прямое доказательство: современные модели не рождают новые способности из ничего — они извлекают то, что уже зашито в данные обучения.

Автор: Ксения Лаврова · Источник: hnrss.org

Разработчикам. Можно точно контролировать границы знаний модели и изучать, как работают цепочки рассуждений, файнтюнинг и промпт-инжиниринг. Полезно для дебаггинга и интерпретируемости: если модель ошибается, ясно — чего ей не хватало в данных.

Бизнесу. Важно понимать: ChatGPT умён ровно настолько, насколько богаты его тренировочные данные. Нельзя ожидать от модели экспертных знаний в домене, который не был в предобучении — дообучение лишь усиливает существующее, но не добавляет принципиально новое.

Инвесторам. Реальная ценность LLM определяется качеством и объёмом данных, а не только размером модели. Стартапы, делающие ставку на дообучение слабых моделей в узких доменах без релевантного предтренинга, рискуют не получить нужного качества.

Хайп20
Реальная польза75
Заработать50
  • Образовательные AI-ассистенты с заранее ограниченным уровнем сложности — модели для детей, которые не выдают контент выше возрастного уровня
  • Инструменты для исследователей AI safety: контролируемая среда для изучения emergence и границ способностей моделей
  • Платформы для тестирования эффективности файнтюнинга и промпт-инжиниринга в условиях ограниченного домена
  • Датасеты и модели для сравнения обучения AI и людей: можно изучать, как дети и модели осваивают одни и те же концепции
  • Сервисы для корпораций: предобученные модели на узких, контролируемых доменных данных для compliance и предсказуемости
  • Исследование подтверждает: без качественных данных дообучение бесполезно — переоценка возможностей RAG и prompt engineering
  • Стартапы, обещающие экспертные AI-решения на базе дообучения слабых моделей, могут столкнуться с потолком качества
  • Ограниченная применимость: модели с узким датасетом подходят только для исследований и узких задач, не для продакшена
  • Риск переоценки emergent abilities: многое, что кажется новым навыком, может быть просто извлечением скрытого из данных

Это один из тех экспериментов, которые ставят точку в спорах. Многие верят, что масштабирование и умный файнтюнинг творят чудеса — мол, дообучи модель на узкой задаче, и она станет экспертом. LittleLearner показывает: если в предобучении не было знаний про отрицательные числа или дроби, то никакой RLHF и промпт-магия их не добавят. Модель просто усиливает то, что уже знает.

Для бизнеса это урок: не стоит ожидать, что GPT станет экспертом в вашей узкой нише только потому, что вы его дообучили на паре тысяч примеров. Если домена не было в базовых данных — потолок будет низким. Для AI safety это золото: можно контролируемо изучать, откуда берутся способности моделей. А для разработчиков — напоминание, что данные предобучения важнее всех последующих трюков.

Инструменты из статьи

AI-платформа для автоматизированной оценки навыков code review у...

Доступ из РФ →

Ещё по теме

Комментарии