Kimi K3 выходит сегодня: 1,4 ТБ весов и суровая математика GPU
Moonshot AI публикует веса модели Kimi K3 (2,8 трлн параметров, 896 экспертов MoE). Команда Qubrid разбирает требования к памяти: на A100 нужно 3 узла, на H200 — два, только B300 с нативной FP4 подходит для одного узла. Обещают тесты производительности на всех трёх конфигурациях к концу недели.
Первая детальная оценка инфраструктурных требований для мегамодели нового поколения — показывает реальную пропасть между анонсами и возможностью запуска, критична для инженеров, планирующих развёртывание.
Kimi K3: реальность развёртывания гигантской модели
Moonshot AI выпускает веса модели Kimi K3 — 2,8 триллиона параметров с архитектурой MoE (896 экспертов, 16 активных на токен), контекстом 1M и поддержкой изображений. Размер дистрибутива — около 1,4 ТБ благодаря квантизации MXFP4, обученной awareness-методом.
Команда Qubrid делится жёсткой арифметикой развёртывания:
Память и железо
-
8× A100 (80GB) = 640 GB. Для 1,4 ТБ весов нужно три узла, причём Ampere не поддерживает FP4/FP8 тензорные ядра — придётся деквантизировать или использовать INT4-кернелы. «Будет некрасиво, но кто-то должен показать реальные цифры».
-
8× H200 = ~1,13 ТБ. Минимум два узла, и каждый токен проходит через межузловые соединения.
-
8× B300 = ~2,3 ТБ. Единственная конфигурация, где всё умещается в один узел с запасом под KV-кэш длинных контекстов. Blackwell имеет нативную FP4 — именно под неё Moonshot и квантизовал.
Что говорят сами авторы
Moonshot честно признаёт слабости: качество падает, если агентский фреймворк обрезает историю рассуждений; модель склонна действовать вместо уточняющих вопросов; в чате пока уступает Claude 3.5 Opus и DeepSeek R1.
Планы Qubrid
Кластер B300 запускают в эти выходные. К концу недели обещают метрики: токены/сек, time-to-first-token и стоимость на миллион токенов для всех трёх GPU-конфигураций.
Ключевые выводы
- Kimi K3 (2,8T параметров, 1,4 ТБ весов) физически не влезает в стандартные 8-GPU узлы A100/H200 без мультиузловой конфигурации
- Только Blackwell (B300) с нативной FP4 позволяет запустить модель в одном узле — именно под эту архитектуру Moonshot делал квантизацию
- Ampere (A100) потребует деквантизации или INT4-кернелов, что резко снизит производительность
- Moonshot публично признаёт ограничения модели: проблемы с обрезанными контекстами, преждевременные действия, отставание в чате от Claude/DeepSeek
- Реальные бенчмарки производительности на разном железе появятся к концу недели — первые публичные цифры для практического развёртывания
Автор: Артём Ковалёв · Источник: reddit.com
**Это редкий случай, когда индустрия говорит правду.** Обычно анонсы моделей звучат как «запустите у себя», а потом выясняется, что нужна стойка серверов. Ребята из Qubrid сделали то, что должны были сделать сами авторы: посчитали реальные требования к памяти и честно сказали — на A100 будет «некрасиво».
Особенно ценно, что Moonshot сами признают слабости модели в документации. Это не скромность — это инженерная честность, которой катастрофически не хватает в гонке бенчмарков. Модель может круто выглядеть на MMLU, но если она в продакшене обрезает свои рассуждения или действует вместо того, чтобы спросить — это проблема. Следите за бенчмарками от Qubrid на этой неделе: это будут первые цифры, которым можно верить.
Инструменты из статьи
Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...
Доступ из РФ →
Комментарии