инструменты 1 мин

Ling-3.0-flash: обещания поддержки vs реальность — вес-файлы задерживаются, llama.cpp даже не планирует

Ant Group анонсировала Ling-3.0-flash, но вес-файлы ещё не открыты. SGLang обещает поддержку «в день релиза», vLLM ждёт публикации весов, а llama.cpp закрыл запрос на поддержку предыдущей версии (Ling-2.6) как «не планируется». Судя по паттерну предыдущих релизов, веса появятся после окончания бесплатного доступа к API — примерно 3 августа.

Показывает растущий разрыв между маркетинговыми анонсами «открытых» моделей и реальной доступностью для разработчиков. Если вы планируете использовать Ling-3.0-flash на своём железе через llama.cpp — это может вообще не случиться без усилий сообщества.

Путаница вокруг релиза Ling-3.0-flash

Ant Group объявила о выпуске Ling-3.0-flash — новой быстрой модели с гибридной архитектурой (KDA + MLA attention). Но реальная доступность остаётся туманной.

Кто что обещает

SGLang публично заявил о работе с командой Ant над поддержкой «с первого дня». vLLM сообщил, что поддержка появится «как только веса станут открытыми», и посвятил четыре абзаца одобрению практики «сначала анонс, потом веса».

Но конкретных дат нет. На Hugging Face нет карточки модели, нет заявления о лицензии, нет открытых PR в репозиториях vLLM или SGLang.

Проблема с llama.cpp

llama.cpp — популярный инструмент для запуска моделей в формате GGUF на обычном железе — не поддерживает архитектуру BailingMoE, которую использует семейство Ling начиная с версии 2.6.

Запрос на поддержку Ling-2.6-flash открыли 3 мая, он набрал семь апвотов, потерял актуальность и был закрыт 18 июня как «не планируется». Более ранний PR на Ling v2 провисел три месяца и закрылся без слияния.

Парадокс: сама система внимания (delta-net/KDA) уже реализована в llama.cpp для Qwen3.5 и Kimi-Linear. Проблема только в конвертации BailingMoE — это не сложная задача, но кто-то должен написать код.

Когда ждать веса?

Оригинальный пост Ant от 24 июля гласит: «Бесплатный доступ до 3 августа. Открытый релиз скоро».

По аналогии с Ling-2.6-flash (анонс 22 апреля, веса на HF 28 апреля), паттерн таков: бесплатная неделя API, затем публикация весов.

Реалистичный порядок поддержки: SGLang → vLLM → GGUF (когда найдётся волонтёр). Для сравнения: Kimi K3 получил частичные GGUF через несколько часов после релиза весов — там инфраструктура была готова.

Ключевые выводы

  • Популярные инференс-движки (SGLang, vLLM) обещают поддержку Ling-3.0-flash, но ждут публикации весов — конкретных дат нет
  • llama.cpp не поддерживает архитектуру BailingMoE и закрыл запрос на Ling-2.6 как «не планируется»
  • Техническая проблема решаема (ядра внимания уже есть), но требует волонтёрской работы
  • Судя по паттерну предыдущих релизов Ant, веса появятся после окончания бесплатного API-доступа — около 3 августа
  • Разрыв между анонсом и реальной доступностью открытых весов становится отраслевой практикой

Автор: Марина Соколова · Источник: reddit.com

Мнение редакции

Это отличный срез того, как работает индустрия «открытых» моделей в 2025-м. Компания делает громкий анонс, все начинают обсуждать архитектуру и бенчмарки, но скачать файлы нельзя — только платный API или недельный фрибик. SGLang и vLLM обещают поддержку «скоро», но без весов это пустые слова. А llama.cpp — главный инструмент для локального запуска — вообще проигнорировал предыдущую версию этой модели и закрыл запрос на поддержку.

Интересно другое: техническая проблема не фундаментальная. Ядра внимания уже есть (их добавили для Qwen и Kimi), не хватает только конвертера для MoE-архитектуры BailingMoE. Это работа на несколько дней для опытного контрибьютора, но её никто не делает — потому что у maintainer'ов llama.cpp нет мотивации гоняться за каждым китайским релизом, особенно когда веса выходят с задержкой и непонятной лицензией. Судя по паттерну (неделя API, потом веса), ждать до начала августа. Но даже тогда GGUF-версия появится только если кто-то из сообщества возьмётся за PR.

Инструменты из статьи

Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...

Доступ из РФ →

Ещё по теме

Комментарии