модели 1 мин

AMD выпустила Instella-MoE-16B-A3B: открытая MoE-модель с 2.8B активных параметров, обученная на Instinct GPU

AMD опубликовала полностью открытую Mixture-of-Experts модель Instella-MoE-16B-A3B (16B параметров, 2.8B активных), обученную на своих Instinct GPU. Выложены веса всех стадий обучения, датасеты, конфиги и код. Две ключевые фишки — Gated MLA и FarSkip-Collective — ускоряют обучение на 12.7% и первый токен на 39.2%. Модель показывает 76.7 на бенчмарках базы и 73.22 после донастройки, обгоняя открытые аналоги. Веса под ResearchRAIL (только для исследований), код под MIT.

Первая полностью открытая MoE от крупного производителя GPU показывает, что обучать конкурентные модели можно не только на NVIDIA. Если вы планируете R&D или on-premise AI, стоит посмотреть на AMD как альтернативу — и код, и методология доступны.

Что произошло

AMD опубликовала Instella-MoE-16B-A3B — Mixture-of-Experts модель с 16 миллиардами параметров, из которых активны одновременно только 2.8B. Обучена с нуля на Instinct MI300X и MI325X GPU. Компания выложила веса каждого этапа обучения, составы датасетов, конфиги и inference-код.

Архитектура: 27 слоев, 2048 скрытых юнитов, 16 голов внимания. Каждый MoE-слой использует 2 общих эксперта плюс 6 роутированных из 64. Две ключевые инновации: Gated Multi-head Latent Attention (добавляет управляемый гейт к MLA) и FarSkip-Collective (пропускает устаревшие активации, совмещая коммуникацию экспертов с вычислениями). Это дало ускорение обучения на 12.7% и снижение времени до первого токена на 39.2% при инференсе с expert parallelism.

Обучение: пре-тренинг на 7.1T токенов (Nemotron-CC-v2, MegaMath, FineMath, RefineCode, TxT360), мид-тренинг на Dolma3, расширение контекста до 64K через YaRN и увеличенный RoPE theta. Пост-тренинг: SFT, DPO, затем RL через Miles framework (RLVR + Multi-Teacher On-Policy Distillation).

Результаты: база показывает 76.7 в среднем (лучше среди полностью открытых: Moonlight-16B 76.2, SmolLM3-3B 70.5, OLMo-3-7B 70.1), после донастройки Think-версия выдает 73.22 (обгоняя Olmo3-7B-Think 71.97, Qwen3.5-4B 69.73). На WinoGrande — 86.5, HumanEval+ — 65.7.

Веса — ResearchRAIL (только исследования), код — MIT. AMD по сути делает полный рецепт своей MoE открытым, показывая возможности своего железа.

MoEAMD Instinctоткрытые моделиобучение LLMROCm

Автор: Артём Ковалёв · Источник: marktechpost.com

Разработчикам. Получаете полный рецепт MoE-модели под капотом: архитектурные трюки вроде Gated MLA и FarSkip-Collective, pipeline обучения на 7.1T токенов, код инференса на SGLang. Можно воспроизвести end-to-end и экспериментировать с expert-parallel serving, 64K контекстом, RL-донастройкой. Код MIT, веса только для экспериментов.

Бизнесу. Открытая альтернатива проприетарным MoE для R&D в облаках и semiconductor. Нельзя коммерчески деплоить веса (ResearchRAIL), но можно переобучить по этому рецепту. Ниша — исследовательские лаборатории, университеты, корпоративные AI-команды с GPU-кластерами. Для MVP-стартапов не подходит.

Инвесторам. AMD демонстрирует конкурентоспособность Instinct против NVIDIA в обучении и инференсе. Открытая модель — маркетинговый ход: привлекает разработчиков к ROCm-экосистеме. Реальная ставка — на enterprise R&D и академические лаборатории, которые начнут покупать Instinct для экспериментов. Прямой денежный эффект от модели — нулевой, но это инвестиция в доверие к стеку AMD AI.

Хайп40
Реальная польза55
Заработать30
  • Переобучить Instella на своих данных для внутреннего корпоративного ассистента (код MIT, можно легально форкать и донастраивать)
  • Запустить исследовательский SaaS для академии: предобученные MoE-модели + инструменты экспериментов на Instinct GPU
  • Разработать expert-parallel serving framework для production MoE на AMD hardware — пока ниша свободна
  • Сделать консалтинг по миграции обучения моделей с NVIDIA на AMD Instinct — показать TCO-экономию
  • Построить платформу fine-tuning MoE для enterprise клиентов, которые хотят on-premise решения на AMD железе
  • ResearchRAIL лицензия убивает все коммерческие варианты использования весов — нельзя деплоить в продакшене
  • AMD Instinct GPU всё ещё дороже и менее доступны, чем NVIDIA H100/A100 — узкая аудитория потенциальных пользователей
  • Результаты модели отстают от проприетарных Qwen3.5 и коммерческих закрытых — реально интересно только для исследований
  • Ecosystem AMD ROCm всё ещё уступает CUDA — риск потратить время на интеграцию и столкнуться с багами и отсутствием поддержки библиотек

AMD делает умный маркетинговый ход: не пытается победить OpenAI или Anthropic в гонке моделей, а показывает разработчикам и корпорациям, что Instinct GPU могут обучать конкурентные открытые модели. Instella — не продукт, а витрина возможностей ROCm-экосистемы. Веса под ResearchRAIL (только исследования), но MIT-код позволяет взять весь pipeline и переобучить на своих данных.

Реально интересно для enterprise R&D, университетов и компаний, которые строят on-premise AI. Для стартапов бесполезно: нельзя коммерчески деплоить, а переобучать с нуля — дорого. Но если у вас уже есть GPU-кластер и вы думаете, брать ли NVIDIA или AMD — Instella показывает, что AMD может. Gated MLA и FarSkip-Collective — любопытные архитектурные трюки, стоит изучить код. В целом — солидная заявка, но до реального влияния на рынок далеко.

Ещё по теме

Комментарии