Cursor открыл код Mixture-of-Kittens: ядро для обучения MoE-моделей в 2.4 раза быстрее конкурентов
Cursor Research выложил в открытый доступ MoK — мегаядро для обучения mixture-of-experts моделей на стойках GB300 NVL72. Вместо разделения коммуникации и вычислений всё слито в один детерминированный kernel, что даёт до 2.37x прирост скорости против лучших публичных решений. Уже работает на десятках тысяч GPU в продакшене при обучении Composer.
Это первое публичное production-grade ядро для обучения MoE на самом новом железе. Если вы обучаете большие модели или строите GPU-инфраструктуру — это новый стандарт скорости, который нельзя игнорировать.
Что произошло
Cursor Research открыл исходники Mixture-of-Kittens (MoK) — специализированного ядра для обучения mixture-of-experts (MoE) моделей на стойках NVIDIA GB300 NVL72. MoK сливает все этапы коммуникации между GPU и вычисления в один детерминированный kernel вместо традиционного разделения. Результат: до 2.37x прирост производительности против сильнейших публичных бейзлайнов (DeepEP, HybridEP). На 512 GPU end-to-end скорость выросла с 760 до 1070 токенов/сек на GPU — плюс 41%.
Код под Apache-2.0 на GitHub, но порог входа высокий: нужны GPU Blackwell SM100/SM103 (стойки GB200 или GB300 NVL72 по 72 чипа), CUDA 13.0+, PyTorch 2.10+, Python 3.12+. Технически это доступно только крупным лабораториям, стартапам с GPU-бюджетом в миллионы и национальным вычислительным центрам. Обычные команды на 8 GPU остаются за бортом.
Ключевые инженерные решения: pull-based диспетчеризация вместо push (сигналы быстрее в 5.8 раз — 18 vs 103 мкс), кольцевой буфер токенов без участия CPU, средняя гранулярность overlap (не слишком мелкая, как Comet, не грубая, как DeepEP). Всё детерминированно, поддержка BF16 и MXFP8. Уже работает в проде на обучении Composer при десятках тысяч GPU.
Автор: Анна Мельникова · Источник: marktechpost.com
Разработчикам. Готовый production-grade kernel для MoE-слоёв с полным кодом. Можно интегрировать в свои пайплайны обучения, если есть доступ к NVL72. Детерминизм упрощает отладку и RL post-training. Примеры для Kimi 2.5, GLM-5.2, Qwen3.5, DeepSeek-V4 в репозитории.
Бизнесу. Прямая экономия на GPU-времени: 2x быстрее = вдвое меньше аренды железа или вдвое больше экспериментов. Актуально для GPU-облаков (продавать как ускоритель), стартапов с foundation-моделями (быстрее итерации) и enterprise AI labs (снижение costs). Но нужны многомиллионные капзатраты на Blackwell — барьер для большинства.
Инвесторам. Технологический барьер для конкурентов: требует топовое железо + глубокая инженерия. Cursor укрепляет позицию в code-gen и foundation models. Выигрывают GPU-облака (Lambda, CoreWeave), производители инфраструктуры (NVIDIA экосистема) и стартапы с доступом к капиталу на NVL72. Риск: узкая применимость ограничивает adoption вне топ-20 лабораторий.
- Запустить GPU-облако с MoK как конкурентным преимуществом — премиум-тариф за 2x скорость обучения MoE
- Консалтинг по интеграции MoK для компаний с собственными NVL72: оптимизация пайплайнов обучения под заказ
- Форк MoK под AMD MI300/MI400 или будущие Intel Gaudi — захватить рынок non-NVIDIA MoE
- SaaS-платформа для пост-тренинга RL-агентов на MoK: детерминизм снижает costs экспериментов
- Обучающие курсы и сертификации по MoE-оптимизации на Blackwell для ML-инженеров крупных корпораций
- Жёсткая привязка к Blackwell (GB300 NVL72) — 99% команд физически не имеют доступа к железу
- Узкая ниша применения: только pretraining и post-training DeepSeek-style MoE, не универсальный ускоритель
- Риск быстрого устаревания при выходе H200 NVL или следующего поколения GPU с другой архитектурой NVLink
- Открытый код может позволить NVIDIA или Meta быстро догнать и встроить в официальные библиотеки (PyTorch, Megatron)
MoK — это реальный production-код от команды, которая обучает модели на десятках тысяч GPU. Не исследовательский прототип, а то, что работает в бою прямо сейчас. Cursor не просто открыл код — они подняли планку для всей индустрии. Теперь конкурентам придётся либо писать свои custom kernels, либо мириться с отставанием в 2x по скорости.
Но давайте честно: это инструмент для элиты. GB300 NVL72 — это стойка из 72 GPU, которая стоит как хороший дом в Кремниевой долине. Cursor прямо говорит: если у вас нет доступа к этому железу, можете даже не пытаться запустить. Это не токсичность, это просто физика — код завязан на Blackwell-специфичные фичи вроде symmetric memory и Cluster Launch Control. Для большинства команд MoK останется красивой демонстрацией того, что возможно на вершине пищевой цепи ML-инфраструктуры.
Инструменты из статьи
AI-редактор кода на базе VS Code: автодополнение, агентный режим, работа с...
Доступ из РФ →
Комментарии