Ling-3.0-flash: обещания поддержки vs реальность — вес-файлы задерживаются, llama.cpp даже не планирует
Ant Group анонсировала Ling-3.0-flash, но вес-файлы ещё не открыты. SGLang обещает поддержку «в день релиза», vLLM ждёт публикации весов, а llama.cpp закрыл запрос на поддержку предыдущей версии (Ling-2.6) как «не планируется». Судя по паттерну предыдущих релизов, веса появятся после окончания бесплатного доступа к API — примерно 3 августа.
Показывает растущий разрыв между маркетинговыми анонсами «открытых» моделей и реальной доступностью для разработчиков. Если вы планируете использовать Ling-3.0-flash на своём железе через llama.cpp — это может вообще не случиться без усилий сообщества.
Путаница вокруг релиза Ling-3.0-flash
Ant Group объявила о выпуске Ling-3.0-flash — новой быстрой модели с гибридной архитектурой (KDA + MLA attention). Но реальная доступность остаётся туманной.
Кто что обещает
SGLang публично заявил о работе с командой Ant над поддержкой «с первого дня». vLLM сообщил, что поддержка появится «как только веса станут открытыми», и посвятил четыре абзаца одобрению практики «сначала анонс, потом веса».
Но конкретных дат нет. На Hugging Face нет карточки модели, нет заявления о лицензии, нет открытых PR в репозиториях vLLM или SGLang.
Проблема с llama.cpp
llama.cpp — популярный инструмент для запуска моделей в формате GGUF на обычном железе — не поддерживает архитектуру BailingMoE, которую использует семейство Ling начиная с версии 2.6.
Запрос на поддержку Ling-2.6-flash открыли 3 мая, он набрал семь апвотов, потерял актуальность и был закрыт 18 июня как «не планируется». Более ранний PR на Ling v2 провисел три месяца и закрылся без слияния.
Парадокс: сама система внимания (delta-net/KDA) уже реализована в llama.cpp для Qwen3.5 и Kimi-Linear. Проблема только в конвертации BailingMoE — это не сложная задача, но кто-то должен написать код.
Когда ждать веса?
Оригинальный пост Ant от 24 июля гласит: «Бесплатный доступ до 3 августа. Открытый релиз скоро».
По аналогии с Ling-2.6-flash (анонс 22 апреля, веса на HF 28 апреля), паттерн таков: бесплатная неделя API, затем публикация весов.
Реалистичный порядок поддержки: SGLang → vLLM → GGUF (когда найдётся волонтёр). Для сравнения: Kimi K3 получил частичные GGUF через несколько часов после релиза весов — там инфраструктура была готова.
Ключевые выводы
- Популярные инференс-движки (SGLang, vLLM) обещают поддержку Ling-3.0-flash, но ждут публикации весов — конкретных дат нет
- llama.cpp не поддерживает архитектуру BailingMoE и закрыл запрос на Ling-2.6 как «не планируется»
- Техническая проблема решаема (ядра внимания уже есть), но требует волонтёрской работы
- Судя по паттерну предыдущих релизов Ant, веса появятся после окончания бесплатного API-доступа — около 3 августа
- Разрыв между анонсом и реальной доступностью открытых весов становится отраслевой практикой
Автор: Марина Соколова · Источник: reddit.com
Это отличный срез того, как работает индустрия «открытых» моделей в 2025-м. Компания делает громкий анонс, все начинают обсуждать архитектуру и бенчмарки, но скачать файлы нельзя — только платный API или недельный фрибик. SGLang и vLLM обещают поддержку «скоро», но без весов это пустые слова. А llama.cpp — главный инструмент для локального запуска — вообще проигнорировал предыдущую версию этой модели и закрыл запрос на поддержку.
Интересно другое: техническая проблема не фундаментальная. Ядра внимания уже есть (их добавили для Qwen и Kimi), не хватает только конвертера для MoE-архитектуры BailingMoE. Это работа на несколько дней для опытного контрибьютора, но её никто не делает — потому что у maintainer'ов llama.cpp нет мотивации гоняться за каждым китайским релизом, особенно когда веса выходят с задержкой и непонятной лицензией. Судя по паттерну (неделя API, потом веса), ждать до начала августа. Но даже тогда GGUF-версия появится только если кто-то из сообщества возьмётся за PR.
Инструменты из статьи
Открытая языковая модель класса 3T параметров от Moonshot AI, представляющая...
Доступ из РФ →
Комментарии