Корейский стартап на 24 GPU обогнал госпрограммы по ИИ в тесте GPQA Diamond
Модель Darwin-398B от южнокорейского стартапа VIDRAFT заняла третье место в мире и первое в Корее на бенчмарке GPQA Diamond — выпускном тесте по научному мышлению, устойчивом к поиску в интернете. При этом стартап использует всего около 24 GPU, а государственные модели с гораздо большими ресурсами отстают на 4–5 пунктов.
Показывает, что в гонке больших языковых моделей инженерные методы могут конкурировать с огромными бюджетами и вычислительными мощностями. Интересно разработчикам, изучающим модельные слияния, и всем, кто следит за соревнованием национальных AI-программ.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Darwin-398B создана методом эволюционного слияния открытых моделей на малом кластере, а не полным предобучением — подход «метод важнее масштаба»
- Корейские государственные модели (Solar-Open2-250B, A.X-K2, K-EXAONE-2.0-750B) заметно отстают от небольшого стартапа на том же бенчмарке
- GPQA Diamond измеряет способность к рассуждению, а не запоминанию, так как вопросы пишут эксперты и их нельзя загуглить
- Результат ограничен одним бенчмарком и базовыми моделями без дообучения, но демонстрирует эффективность малых команд
Ксения Лаврова
Medium #llm
Читать оригинал
Комментарии