Apple показала, как правильно миксовать данные для обучения языковых моделей: можно повторять один датасет до 20 раз
Исследователи Apple ML провели 2000+ экспериментов и выяснили: при обучении моделей на смеси данных (например, редкий язык + общий корпус) можно повторять целевые данные 15-20 раз без переобучения. Они вывели scaling law с учётом повторений, который показывает оптимальные пропорции микса для любого бюджета и размера модели.
0
107