#scaling laws

И исследования ·20 авг 2026

Apple показала, как правильно миксовать данные для обучения языковых моделей: можно повторять один датасет до 20 раз

Исследователи Apple ML провели 2000+ экспериментов и выяснили: при обучении моделей на смеси данных (например, редкий язык + общий корпус) можно повторять целевые данные 15-20 раз без переобучения. Они вывели scaling law с учётом повторений, который показывает оптимальные пропорции микса для любого бюджета и размера модели.

0 107
И исследования ·31 июл 2026

Как устроены LLM: взгляд через призму нелинейной динамики

Исследователи AI часто не могут объяснить, почему языковые модели внезапно обретают новые способности при определённом размере или объёме обучающих данных. Автор предлагает рассматривать LLM как нелинейные динамические системы — тогда «внезапные скачки» становятся фазовыми переходами (как замерзание воды), а архитектурные трюки оказываются инструментами удержания модели «на грани хаоса».

0 95