модели 1 мин

Корейский стартап на 24 GPU обогнал госпрограммы по ИИ в тесте GPQA Diamond

Модель Darwin-398B от южнокорейского стартапа VIDRAFT заняла третье место в мире и первое в Корее на бенчмарке GPQA Diamond — выпускном тесте по научному мышлению, устойчивом к поиску в интернете. При этом стартап использует всего около 24 GPU, а государственные модели с гораздо большими ресурсами отстают на 4–5 пунктов.

Показывает, что в гонке больших языковых моделей инженерные методы могут конкурировать с огромными бюджетами и вычислительными мощностями. Интересно разработчикам, изучающим модельные слияния, и всем, кто следит за соревнованием национальных AI-программ.

Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.

О чём статья

  • Darwin-398B создана методом эволюционного слияния открытых моделей на малом кластере, а не полным предобучением — подход «метод важнее масштаба»
  • Корейские государственные модели (Solar-Open2-250B, A.X-K2, K-EXAONE-2.0-750B) заметно отстают от небольшого стартапа на том же бенчмарке
  • GPQA Diamond измеряет способность к рассуждению, а не запоминанию, так как вопросы пишут эксперты и их нельзя загуглить
  • Результат ограничен одним бенчмарком и базовыми моделями без дообучения, но демонстрирует эффективность малых команд
бенчмаркиevolutionary mergingюжная кореямалые командыreasoning
Ксения Лаврова Medium #llm
Читать оригинал

Ещё по теме

Комментарии