Kimi K3: слишком велик, чтобы запустить
Автор провёл практический тест Kimi K3 — крупнейшей открытой модели с 2,8 трлн параметров и контекстом на 1 млн токенов. После 11 часов настройки кластера из 4×H100 и 594 ГБ весов выяснилось, что модель в 21 из 41 теста давала неверные ответы, включая полностью выдуманные данные при работе с длинным контекстом.
Инженерам и исследователям, которые оценивают возможность внедрения сверхбольших открытых моделей: реальный опыт развёртывания показывает, что инфраструктурные требования и качество результатов могут не оправдать заявленных характеристик.
Это аннотация к авторской статье. Мы не публикуем и не пересказываем чужие тексты целиком — полная версия у автора.
О чём статья
- Физические ограничения: модель весит 594 ГБ, требует распределения весов по NVMe-массиву и тензорного параллелизма на нескольких GPU
- Качество вывода под вопросом: в тестах на извлечение данных, генерацию кода и логику модель ошибалась более чем в половине случаев
- Разрыв между заявленными 2,8 трлн параметров и реальными возможностями: экономика и практическая применимость модели не соответствуют маркетинговым обещаниям
Ксения Лаврова
Medium #artificial-intelligence
Читать оригинал
Инструменты из статьи
Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...
Доступ из РФ →
Комментарии