модели 1 мин

Kimi K3 выходит сегодня: 1,4 ТБ весов и суровая математика GPU

Moonshot AI публикует веса модели Kimi K3 (2,8 трлн параметров, 896 экспертов MoE). Команда Qubrid разбирает требования к памяти: на A100 нужно 3 узла, на H200 — два, только B300 с нативной FP4 подходит для одного узла. Обещают тесты производительности на всех трёх конфигурациях к концу недели.

Первая детальная оценка инфраструктурных требований для мегамодели нового поколения — показывает реальную пропасть между анонсами и возможностью запуска, критична для инженеров, планирующих развёртывание.

Kimi K3: реальность развёртывания гигантской модели

Moonshot AI выпускает веса модели Kimi K3 — 2,8 триллиона параметров с архитектурой MoE (896 экспертов, 16 активных на токен), контекстом 1M и поддержкой изображений. Размер дистрибутива — около 1,4 ТБ благодаря квантизации MXFP4, обученной awareness-методом.

Команда Qubrid делится жёсткой арифметикой развёртывания:

Память и железо

  • 8× A100 (80GB) = 640 GB. Для 1,4 ТБ весов нужно три узла, причём Ampere не поддерживает FP4/FP8 тензорные ядра — придётся деквантизировать или использовать INT4-кернелы. «Будет некрасиво, но кто-то должен показать реальные цифры».

  • 8× H200 = ~1,13 ТБ. Минимум два узла, и каждый токен проходит через межузловые соединения.

  • 8× B300 = ~2,3 ТБ. Единственная конфигурация, где всё умещается в один узел с запасом под KV-кэш длинных контекстов. Blackwell имеет нативную FP4 — именно под неё Moonshot и квантизовал.

Что говорят сами авторы

Moonshot честно признаёт слабости: качество падает, если агентский фреймворк обрезает историю рассуждений; модель склонна действовать вместо уточняющих вопросов; в чате пока уступает Claude 3.5 Opus и DeepSeek R1.

Планы Qubrid

Кластер B300 запускают в эти выходные. К концу недели обещают метрики: токены/сек, time-to-first-token и стоимость на миллион токенов для всех трёх GPU-конфигураций.

Ключевые выводы

  • Kimi K3 (2,8T параметров, 1,4 ТБ весов) физически не влезает в стандартные 8-GPU узлы A100/H200 без мультиузловой конфигурации
  • Только Blackwell (B300) с нативной FP4 позволяет запустить модель в одном узле — именно под эту архитектуру Moonshot делал квантизацию
  • Ampere (A100) потребует деквантизации или INT4-кернелов, что резко снизит производительность
  • Moonshot публично признаёт ограничения модели: проблемы с обрезанными контекстами, преждевременные действия, отставание в чате от Claude/DeepSeek
  • Реальные бенчмарки производительности на разном железе появятся к концу недели — первые публичные цифры для практического развёртывания

Автор: Артём Ковалёв · Источник: reddit.com

Мнение редакции

**Это редкий случай, когда индустрия говорит правду.** Обычно анонсы моделей звучат как «запустите у себя», а потом выясняется, что нужна стойка серверов. Ребята из Qubrid сделали то, что должны были сделать сами авторы: посчитали реальные требования к памяти и честно сказали — на A100 будет «некрасиво».

Особенно ценно, что Moonshot сами признают слабости модели в документации. Это не скромность — это инженерная честность, которой катастрофически не хватает в гонке бенчмарков. Модель может круто выглядеть на MMLU, но если она в продакшене обрезает свои рассуждения или действует вместо того, чтобы спросить — это проблема. Следите за бенчмарками от Qubrid на этой неделе: это будут первые цифры, которым можно верить.

Инструменты из статьи

Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...

Доступ из РФ →

Ещё по теме

Комментарии