инструменты 1 мин

Kimi K3 (0.5 петабайта) запустили на одном CPU с 8 ГБ оперативки — голый C99, без GPU

Энтузиаст запустил гигантскую модель Kimi K3 (1.56 ТБ checkpoint) на обычном CPU с 8 ГБ RAM, написав inference-движок на чистом C99. Стриминг экспертов с NVMe, 4-битная квантизация без распаковки, 33 секунды на токен. Никаких фреймворков, GPU или BLAS — только OpenMP и 176 КБ бинарник.

Показывает, что запуск гигантских моделей возможен без GPU-кластеров — важно для приватных инсталляций, обучения и экспериментов. Для разработчиков — источник инсайтов про оптимизацию инференса.

Что произошло

Разработчик FareedKhan557 развернул Kimi K3 на 32 H100 на работе, а потом захотел потыкать модель дома — и написал собственный inference-движок на чистом C99. Результат: модель с чекпоинтом в 1.56 ТБ запускается на CPU с 8 ГБ оперативки.

Как это работает: - 93% модели — это routed experts (896 экспертов), но на токен активируются только 16 - Эксперты не держатся в памяти — подгружаются с NVMe по требованию - Веса в 4-битной упаковке перемножаются сразу, без распаковки - Dense trunk переупакован в один файл, стримится слой за слоем - Объём занятой RAM регулируется настройками

Цифры: - Минимум: 8.24 ГБ RAM, ~33 сек/токен - Оптимум: ~128 ГБ RAM, ~20 сек/токен (дальше не ускоряется) - Вывод побайтово идентичен при любом бюджете памяти

Реализация — 6 C-файлов, libm и OpenMP, бинарник 176 КБ. Никаких BLAS, PyTorch, GPU. Есть тесты на синтетической 13-слойной модели без скачивания весов.

Автор честно говорит: это не для продакшена, а чтобы понять архитектуру изнутри. Но proof-of-concept сильный.

Автор: Анна Мельникова · Источник: reddit.com

Разработчикам. Показывает, как работать с гигантскими моделями без GPU: стриминг весов с диска, упакованная 4-битная арифметика без распаковки, управление памятью вручную. Чистая C-реализация — отличная база для понимания архитектуры MoE и оптимизаций инференса. Есть референсные тесты против PyTorch.

Бизнесу. Доказывает, что inference огромных моделей возможен на CPU — потенциал для edge-деплоя или приватных инсталляций без дорогих GPU-кластеров. Пока медленно для продакшена, но направление для оптимизации затрат в специфичных сценариях (например, offline-обработка, когда латентность не критична).

Инвесторам. Демонстрация того, что зависимость от GPU-инфраструктуры не абсолютна — возможны альтернативные пути инференса. Открывает вопросы про эффективность CPU-based решений и софтверные оптимизации как конкурента hardware scaling. Следите за проектами, которые двигают эффективность инференса без увеличения железа.

Хайп30
Реальная польза45
Заработать35
  • CPU-инференс для приватных деплоев: компании с требованиями к безопасности данных могут гонять большие модели on-premise без GPU
  • Offline AI-обработка: пакетная генерация (контент, аналитика) где скорость не критична, но важна экономика
  • Образовательные платформы: дешёвые стенды для обучения работе с большими моделями без аренды облачных GPU
  • Оптимизация inference-движков: конкурентное преимущество для стартапов, которые сделают подобное быстрее и удобнее (специализированные компиляторы, JIT для MoE)
  • Edge AI для enterprise: модели в локальных дата-центрах, где есть NVMe и CPU, но нет GPU-кластеров
  • 33 сек/токен — это не продакшен: даже для batch-обработки слишком медленно, чтобы конкурировать с GPU-инференсом
  • 1.7 ТБ на диске + требование к NVMe — барьер для массового использования, не каждый девелопер готов выделить такие ресурсы
  • Доказательство концепта, но не готовый продукт: автор честно говорит, что это для обучения, а не для серьёзного применения
  • CPU-инференс вряд ли догонит GPU по скорости для таких моделей — возможно, ниша останется маргинальной

Это классический hackers-проект: «потому что могу». Парень не обещает революцию в продакшене — он хотел разобраться в архитектуре Kimi K3 и доказать, что CPU-инференс возможен. И доказал. 33 секунды на токен — это, конечно, не для чатботов, но для offline-задач или обучения вполне рабочий вариант.

Основная ценность — в демонстрации подхода: как обойти ограничения памяти через стриминг весов с NVMe, как упаковать 4-битную квантизацию без распаковки, как минимизировать зависимости. Код чистый, тесты есть, можно изучать. Для коммерческих продуктов это пока экзотика, но для энтузиастов и тех, кто хочет понять MoE изнутри — золото. Плюс напоминание, что GPU-гонка — не единственный путь, если задача позволяет подождать.

Инструменты из статьи

Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...

Доступ из РФ →

Ещё по теме

Комментарии