#MoE

И инструменты ·18 авг 2026

DeepSeek V4 Flash на четырёх RTX 3060: 100 tok/s на 144 ГБ модели с контекстом 360k

Энтузиаст запустил 144 ГБ модель DeepSeek V4 Flash на четырёх потребительских RTX 3060 12GB, добившись скорости обработки промпта ~100 tok/s и контекста 368k токенов. Ключ — экстремальное распределение экспертов MoE по GPU через llama.cpp и агрессивная настройка микробатчей. Показывает, что большие MoE-модели можно разгонять на доступном железе.

0 22
И инструменты ·17 авг 2026

NVIDIA Nemotron 3.5 Lightning в AWS SageMaker: MoE-модель для AI-агентов в один клик

AWS добавила в SageMaker JumpStart модель NVIDIA Nemotron 3.5 Lightning — компактную MoE-модель (30B параметров, 3B активных) с контекстом 1M токенов, специально заточенную под массовые агентские задачи. Обещает в 4 раза выше throughput и на 30% быстрее выполнение типовых шагов агентов, работает на одной GPU.

0 39
И инструменты ·6 авг 2026

Как ускорить Qwen 35B в 2.4 раза на RTX 3090 без потери скорости генерации

Исследователь показал, как сбросив 8 экспертных слоёв MoE-модели Qwen3.6-35B на CPU, можно увеличить batch-размеры и разогнать prompt processing с 564 до 1330 токенов/сек (2.36×) на RTX 3090, сохранив скорость генерации. Ключ — освобождение VRAM для увеличения батча, а не сам CPU-оффлоад.

0 124
М модели ·12 авг 2026

NVIDIA выпустила Nemotron 3.5 Lightning — открытую MoE-модель на 30B с 3B активных параметров и роутер NeMo Switchyard

NVIDIA представила Nemotron 3.5 Lightning — легковесную MoE-модель для агентов (30B параметров, активно 3B) с контекстом 1M токенов и скоростью в 4 раза выше аналогов. В комплекте роутер NeMo Switchyard, который снижает расходы на 74% за счёт умной маршрутизации между моделями. Работает на одной GPU, открытые веса, коммерческая лицензия.

0 35
И инструменты ·3 авг 2026

Запустили DeepSeek V4-Flash (284B) на паре RTX 3090 и подержанном сервере за $6K — 33 токена в секунду

Энтузиаст развернул официальный чекпоинт DeepSeek V4-Flash (284B параметров, 156 ГБ) на железе с eBay: серверная тачка Dell R940 с 4 процессорами Xeon и 768 ГБ DDR4 + две RTX 3090. Выхлоп: 33 токена/сек одному пользователю, 68 в агрегате для четверых. Главная находка — 95% работы делает процессор с памятью, видеокарты задействованы на 25%. Итого реальная альтернатива облакам за ~$6000 на подержанном железе, если вам нужна полная модель, а не перепаковка.

0 127
М модели ·1 авг 2026

Gemma 4 26B в 2 ГБ — реальность, но заголовок вводит в заблуждение

Проект TurboFieldfare действительно запускает Gemma 4 26B с резидентным использованием ~2 ГБ RAM на Apple Silicon, но это не означает, что модель «поместилась» в 2 ГБ. Система стримит экспертов MoE-модели с SSD (14.3 ГБ), держа в памяти только ядро и KV-кеш. Автор разбирает, почему такой подход работает для MoE, но не для плотных моделей, и почему локальный инференс не всегда дешевле облачного API.

0 127
И инструменты ·2 авг 2026

Хакерская оптимизация DeepSeek-V4: как сэкономить 30 ГБ RAM без потери качества

Энтузиаст TacoTakumi перепаковал DeepSeek-V4-Flash в 3-битный формат, квантизировав только экспертные слои. Результат: 111 ГБ вместо 140+, на 40% быстрее оригинала при частичной загрузке в RAM, качество лучше чем у полной IQ3_S-квантизации. Для тех, кто гоняет большие MoE-модели на разношёрстных GPU и не хочет скатываться до 2-битных квантов.

0 128
И инструменты ·2 авг 2026

Kimi K3 (0.5 петабайта) запустили на одном CPU с 8 ГБ оперативки — голый C99, без GPU

Энтузиаст запустил гигантскую модель Kimi K3 (1.56 ТБ checkpoint) на обычном CPU с 8 ГБ RAM, написав inference-движок на чистом C99. Стриминг экспертов с NVMe, 4-битная квантизация без распаковки, 33 секунды на токен. Никаких фреймворков, GPU или BLAS — только OpenMP и 176 КБ бинарник.

0 116
М модели ·30 июл 2026

Kimi K3 вошёл в топ-4 моделей мира: как китайцы обогнали DeepSeek по инженерии

Moonshot AI выпустила Kimi K3 — открытую модель, занявшую 4-е место из 580 в рейтинге Artificial Analysis (после Claude Opus 5, Fable 5 и GPT-5.6 Sol). Ключевые фишки: Delta Attention сжимает KV-кеш в 4 раза (27 ГБ вместо 105 для контекста на 1 млн токенов), новый алгоритм балансировки 896 экспертов (Quantile Balancing), и AgentENV — рантайм для обучения с подкреплением, создавший 51 млн песочниц с паузой траектории за 133 мс.

0 128
И исследования ·1 авг 2026

Есть ли физический предел сжатия AI-моделей без потери интеллекта?

После выхода DeepSeek V4 Flash индустрия задаётся вопросом: можно ли бесконечно уменьшать модели, сохраняя их способности, или существует минимальный порог параметров для конкретного уровня интеллекта? Оптимизация (MoE, дистилляция, лучшие данные) пока творит чудеса, но рано или поздно упрёмся в фундаментальные ограничения — либо в стоимость обучения, либо в информационную ёмкость самой архитектуры.

0 105
И инструменты ·4 авг 2026

Cursor открыл код Mixture-of-Kittens: ядро для обучения MoE-моделей в 2.4 раза быстрее конкурентов

Cursor Research выложил в открытый доступ MoK — мегаядро для обучения mixture-of-experts моделей на стойках GB300 NVL72. Вместо разделения коммуникации и вычислений всё слито в один детерминированный kernel, что даёт до 2.37x прирост скорости против лучших публичных решений. Уже работает на десятках тысяч GPU в продакшене при обучении Composer.

0 57
И инструменты ·2 авг 2026

DeepSeek-V4-Flash на 284 млрд параметров запустили на 5,3 ГБ памяти — как это вообще возможно

Энтузиаст запустил DeepSeek-V4-Flash (284B параметров) на MacBook с 24 ГБ памяти, используя всего 5,3 ГБ оперативки. Секрет — движок Mference, который держит в памяти только активные эксперты MoE-моделей (~13B на токен), остальное подгружает с SSD. Скорость до 5 токенов/сек, 2-битный квант, 91 ГБ на диске.

0 75
М модели ·31 июл 2026

DeepSeek V4-Flash получил апгрейд: втрое дешевле Pro, круче на агентах и коде

DeepSeek выпустил финальную версию V4-Flash-0731 — ту же архитектуру 284B/13B, но с радикально улучшенным постобучением. Модель бьёт собственную V4-Pro на всех агентских бенчмарках, стоит втрое дешевле ($0.28 за миллион выходных токенов против $0.87), MIT-лицензия без ограничений. Самохостинг реален от 110 GB памяти на 3-битной квантизации.

0 75
М модели ·8 авг 2026

MoE-модель Qwen 35B-A3B в 4 раза быстрее dense-модели 27B при почти равном качестве кода

Разработчик сравнил MoE-архитектуру Qwen 35B-A3B с плотной моделью 27B на локальных задачах по кодингу. MoE оказалась в ~4 раза быстрее (116 vs 30 токенов/сек), но разница в качестве кода — минимальная на стандартных задачах. Dense-модель выигрывала только на сложных edge-кейсах с неявными зависимостями.

0 21
И инструменты ·27 июл 2026

Ling-3.0-flash: обещания поддержки vs реальность — вес-файлы задерживаются, llama.cpp даже не планирует

Ant Group анонсировала Ling-3.0-flash, но вес-файлы ещё не открыты. SGLang обещает поддержку «в день релиза», vLLM ждёт публикации весов, а llama.cpp закрыл запрос на поддержку предыдущей версии (Ling-2.6) как «не планируется». Судя по паттерну предыдущих релизов, веса появятся после окончания бесплатного доступа к API — примерно 3 августа.

0 98
И инструменты ·2 авг 2026

WinterMix: новый метод квантизации MLX побил 6-битные сборки при меньшем весе — 82 ГБ против 95 ГБ

Разработчик создал новый метод квантизации для MLX-моделей на Apple Silicon, который даёт лучший результат для Qwen3.5-122B: сборка на 82 ГБ обгоняет 6-битные на 94-95 ГБ, а версия на 68 ГБ позволяет держать 5-8 агентов с контекстом 100К токенов одновременно на Mac с 128 ГБ RAM. Перплексия всего на 0.3-0.7% хуже исходного GGUF, при этом MLX даёт 9x быстрее prefill и на 20% быстрее генерацию токенов на M5 Max.

0 47
И инструменты ·29 июл 2026

Запустил модель на 1.56 ТБ на игровом ноуте с 6 ГБ видеопамяти — вот что вышло

Энтузиаст запустил гигантскую MoE-модель (1.56 ТБ, 896 экспертов на слой) на бюджетном ноутбуке HP Victus с RTX 4050 (6 ГБ VRAM). Первая попытка — краш до первого токена. После патча движка и стриминга весов с SSD получилось 0.1 токена в секунду — медленно, но работает. Бутылочное горлышко — 33 ГБ чтения с диска на каждый токен.

0 80
М модели ·27 июл 2026

Gemma 4 и Qwen 3.6 MoE на встроенной графике AMD: тесты показали, почему MoE — это будущее локальных LLM

Энтузиаст протестировал новые модели Gemma 4 и Qwen 3.6 MoE на мини-ПК с APU AMD 6800H (встроенная графика Radeon 680M). Главный вывод: Mixture of Experts (MoE) модели дают скорость маленькой модели при интеллекте большой — Qwen 3.6 35B в 6,5 раз быстрее обычной 31B модели. Квантизация Q4 оптимальна для APU, Q8 убивает производительность, а новые форматы FP4 пока работают хуже обычных.

0 66
И инструменты ·25 июл 2026

MTP в llama.cpp: в 2 раза быстрее на обычных моделях, провал на MoE

В llama.cpp появилась нативная поддержка MTP (Multi Token Prediction) — технологии, где модель предсказывает несколько токенов за раз. На обычных dense-моделях (Qwen, DeepSeek, GLM) это даёт ускорение в 1.4-2.2 раза. На MoE-моделях прирост минимальный или его вообще нет — архитектура MoE уже оптимизирована по затратам на декодинг. Старые методы спекулятивной декодинга с отдельными draft-моделями показали себя ненадёжно.

0 71
И инструменты ·23 июл 2026

DFlash превратил 118B-модель на двух RTX 5090 в тормоз: как вернуть скорость или забить на спекуляцию

Энтузиаст запустил огромную MoE-модель Laguna S 2.1 (118B параметров, 71 ГБ) на двух RTX 5090 с технологией DFlash speculative decoding — и она замедлила генерацию в 2,5 раза вместо ускорения. Причина: дефолтные настройки llama.cpp заставляли драфтер генерировать слишком много токенов без уверенности, а верификация каждого токена обходилась дорого из-за оффлоада экспертов в CPU RAM. После тюнинга (ограничение длины драфта, порог уверенности 0.6, квантизация драфтера в Q8) скорость выросла с 23 до 64 tok/s — но это всё равно примерно как без драфта (62 tok/s), так что вывод: на такой конфигурации спекулятивная генерация бесполезна.

0 85
М модели ·26 июл 2026

Как модель на 1,6 триллиона параметров работает на ноутбуке: C-код, который вы можете запустить

Автор показывает, как запустить гигантские MoE-модели вроде DeepSeek V4 на обычном ноутбуке. Ключ — в том, что Mixture-of-Experts активирует только ~3% параметров за раз, остальные 97% можно держать на диске и подгружать по требованию. Статья объясняет математику разреженности и предлагает полный рабочий стриминговый движок на C.

0 64
М модели ·27 июл 2026

Kimi K3 выходит сегодня: 1,4 ТБ весов и суровая математика GPU

Moonshot AI публикует веса модели Kimi K3 (2,8 трлн параметров, 896 экспертов MoE). Команда Qubrid разбирает требования к памяти: на A100 нужно 3 узла, на H200 — два, только B300 с нативной FP4 подходит для одного узла. Обещают тесты производительности на всех трёх конфигурациях к концу недели.

0 53
М модели ·1 авг 2026

AMD выпустила Instella-MoE-16B-A3B: открытая MoE-модель с 2.8B активных параметров, обученная на Instinct GPU

AMD опубликовала полностью открытую Mixture-of-Experts модель Instella-MoE-16B-A3B (16B параметров, 2.8B активных), обученную на своих Instinct GPU. Выложены веса всех стадий обучения, датасеты, конфиги и код. Две ключевые фишки — Gated MLA и FarSkip-Collective — ускоряют обучение на 12.7% и первый токен на 39.2%. Модель показывает 76.7 на бенчмарках базы и 73.22 после донастройки, обгоняя открытые аналоги. Веса под ResearchRAIL (только для исследований), код под MIT.

0 37
И инструменты ·22 июл 2026

Как выжать 340 токенов в секунду из 204GB MoE-модели на одной видеокарте

Энтузиаст разработал метод запуска огромных MoE-моделей (Kimi 2.7, 204GB) на одной системе через хитрую комбинацию unified memory, кэширования VRAM и выборочной выгрузки экспертов. На DGX Spark достиг 340 токенов/сек на промпте и 9.6 на генерации — в разы быстрее CPU. На обычных 3090 тоже работает, но медленнее из-за узкого PCIe.

0 74
М модели ·26 июл 2026

Photon-1 научилась управлять компьютером, играть в шашки и симулировать физику на видео без единой подписи действий

Induction Labs выпустила Photon-1 — модель на 106 млрд параметров, которая училась 18 лет видео с экранов компьютеров, но ни разу не видела меток «что сделал пользователь». Вместо этого она предсказывает следующий кадр и сама выводит неявную политику действий. После дообучения она управляет Linux-десктопом лучше Gemini Flash, играет в шашки и моделирует бильярд — хотя эти задачи никогда не встречались в предобучении.

0 51
И инструменты ·21 июл 2026

DeepSeek V4 на одной B300: всего 770 токенов/сек в vLLM — что не так?

Разработчик получает всего 770 токенов/сек при batch-обработке на DeepSeek V4-Flash с одной GPU B300 через vLLM, хотя ожидал несколько тысяч. Выяснилось, что быстрое MoE-ядро требует несколько GPU, а спекулятивное декодирование DSpark на насыщенном батче снижает производительность вдвое. Ищет советы по оптимизации конфигурации.

0 78
И инструменты ·23 июл 2026

Бесконечное «думание» Laguna-S-2.1 оказалось проблемой квантизации

Пользователь llama.cpp обнаружил, что зацикливание модели Laguna-S-2.1 (когда она бесконечно «думает» и не закрывает теги </think>) связано не с настройками, а с некачественной квантизацией. Переход на APEX-квантизацию с разной точностью для разных слоёв устранил 90% проблемы.

0 59
И инструменты ·25 июл 2026

Как запустить 480-миллиардную модель на MacBook с 36 ГБ памяти — стриминг экспертов MoE с SSD

Разработчик форкнул llama.cpp, чтобы запускать огромные MoE-модели (до 480B параметров) на обычном MacBook, подгружая веса экспертов с SSD по требованию вместо загрузки всей модели в RAM. Qwen 35B выдаёт ~13-19 tok/s, даже 118B-модель работает на устройстве с 36 ГБ памяти. Приложение доступно как готовый .dmg для macOS, код открыт (MIT), все бенчмарки — включая провалившиеся эксперименты — опубликованы.

0 20