Kimi K3: китайская ИИ-модель на 2,8 триллиона параметров делает ставку на память, а не на вычисления
Moonshot AI выпустила Kimi K3 — крупнейшую открытую модель с 2,8 трлн параметров. Её архитектура — обход американских санкций на чипы: вместо мощных GPU компания использует mixture-of-experts (активны только 1,8% модели одновременно), 4-битную квантизацию и распределённую память на десятках ускорителей. Проблема в том, что китайская промышленность отстаёт именно по высокоскоростной памяти, а не по вычислительной мощности.
K3 показывает, как китайские лаборатории обходят американские санкции через архитектурные решения, но также обнажает узкое место — отставание в производстве высокоскоростной памяти. Это важный сигнал для понимания реальных ограничений китайской ИИ-индустрии.
Самая большая открытая модель — и самая медленная?
Moonshot AI представила Kimi K3 — модель с 2,8 триллиона параметров, крупнейшую среди открытых весов. Для сравнения: конкурирующая DeepSeek V4 Pro весит 1,6 трлн параметров. Но размер здесь — не главное. Важно как модель работает под капотом.
Вычисления меняют на память
Архитектура K3 — это серия компромиссов, продиктованных американскими экспортными ограничениями на чипы. Moonshot применила mixture-of-experts: из 896 специализированных блоков модель активирует только 16 одновременно (1,8% от общего объёма). Вычислений на токен — минимум, но все 2,8 трлн параметров должны постоянно находиться в памяти.
Дальше — 4-битная квантизация вместо стандартных 16 бит. Это сжимает модель с 5,6 до 1,4 ТБ. Компания прямо пишет о «совместимости с широким спектром железа» — читай: не только с Nvidia.
Третий трюк — Kimi Delta Attention, оптимизация для работы с контекстом до 1 млн токенов (несколько тысяч страниц). При такой длине именно накопленный контекст, а не сама модель, съедает больше всего памяти.
Узкое место — не там, где думают
Moonshot рекомендует запускать K3 на 64+ ускорителях, объединённых в единый пул памяти. Это подход Huawei CloudMatrix: память можно агрегировать из множества обычных чипов, тогда как вычислительную мощность для обучения так не соберёшь.
Проблема: именно высокоскоростная память (HBM) — слабое место китайской полупроводниковой индустрии. В августе 2025 Пекин на торговых переговорах просил снять ограничения именно на HBM, а не на литографию или доступ к TSMC. Прогноз на этот год — ~2 млн стеков HBM, хватит на 250-300 тыс. чипов Huawei Ascend 910C, хотя SMIC способна выпустить в разы больше самих процессоров.
Кто реально сможет запустить?
Веса K3 станут доступны 27 июля. Азиатские компании интересуются открытыми моделями ради цены, контроля данных и поддержки локальных языков. Банки и страховые в Юго-Восточной Азии тестируют self-hosted модели, чтобы данные не покидали внутренние системы.
Но 1,4 ТБ весов плюс память под контекст — это не игрушка. Немногие организации потянут 64+ ускорителя. K3 — политический и технический statement, но её практическое применение пока под вопросом.
Ключевые выводы
- Kimi K3 (2,8 трлн параметров) — крупнейшая открытая модель, но её размер — побочный эффект архитектуры, а не цель
- Mixture-of-experts снижает вычисления на 98%, но требует держать всю модель в памяти — торговля compute на memory
- Китайская промышленность отстаёт именно по высокоскоростной памяти (HBM), а не по производству чипов
- Moonshot рекомендует 64+ ускорителя в едином пуле — подход Huawei, позволяющий обходить санкции через агрегацию памяти
- Практическое применение K3 ограничено: немногие компании смогут развернуть инфраструктуру такого масштаба
Автор: Ксения Лаврова · Источник: artificialintelligence-news.com
**Интересно здесь не то, что K3 огромная, а то, *как* она огромная.** Moonshot по сути превратила модель в гигантскую справочную систему, где 98% параметров спят в памяти, пока работают только 2%. Это элегантный обход санкций — но с ловушкой: память в Китае дефицитнее, чем сами чипы. Пекин на переговорах просил снять ограничения именно на HBM, а не на литографию, что красноречиво.
**Практический вывод:** K3 — это statement, а не продукт для массового рынка. Азиатские банки и страховые хотят self-hosted модели ради контроля данных, но 64+ ускорителя и 1,4 ТБ весов — это уровень инфраструктуры крупного облачного провайдера. Moonshot показала, что может, но кто реально развернёт это у себя — вопрос открытый. Веса выходят 27 июля, посмотрим, кто первым рискнёт.
Инструменты из статьи
Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...
Доступ из РФ →
Комментарии