инструменты 1 мин

Liquid AI выпустила DSpark-драфтеры для LFM2.5: ускорение декодинга до 3,18x без потери качества

Liquid AI представила драфт-модели для LFM2.5 (1.2B, 2.6B, 8B), которые ускоряют генерацию текста до 3,18x на H100 и до 2,87x на M4 Max через спекулятивное декодирование. Драфтер (~300M параметров) предлагает 9 токенов за раз, целевая модель проверяет все разом. Выход идентичен оригиналу при жадном декодинге, точность не меняется. Работает в llama.cpp и SGLang, но требует самостоятельного хостинга.

Это первая открытая реализация спекулятивного декодинга для малых моделей с конкретными цифрами на реальном железе и готовыми чекпоинтами. Разработчики получают инструмент для ускорения локального inference без потери качества, стартапы — дешёвую лицензию, а enterprise — повод задуматься о затратах на облачные API.

Liquid AI опубликовала чекпоинты драфт-моделей для трёх версий LFM2.5: 1.2B-Instruct, 2.6B и 8B-A1B. Каждый драфтер добавляет путь спекулятивного декодинга к целевой модели.

Архитектура: драфтер на ~300M параметров (5 слоёв full-attention, hidden_size=2048, GQA с 32 головами по 8 KV, размер блока 9) предлагает 9 токенов-кандидатов после якорного. Целевая модель проверяет все 10 токенов за один forward pass. Совпадающие принимаются, первое расхождение заменяется токеном таргета, остаток отбрасывается. Словарь и веса эмбеддингов связаны с целевой моделью при загрузке.

Результаты на H100 (BF16, SGLang, batch=1, temp=0): средний прирост от 2,10x для 1.2B до 2,67x для 2.6B, пик 3,18x на 8B-A1B в MATH500 (428→1362 tok/s). На M4 Max (llama.cpp, Metal, FP16 GGUF): от 2,54x для 1.2B до 1,18x для 8B-A1B (средний). MoE-модель на Apple Silicon показала скромный рост из-за ограничений Metal-бэкенда llama.cpp и увеличения трафика весов при верификации k токенов.

Ускорение коррелирует с acceptance rate: 8,27 из 10 токенов на MATH500 даёт 3,18x, 4,02 на GSM8K — только 1,29x. При жадном декодинге последовательность идентична оригиналу, точность на бенчмарках не меняется.

Лицензия LFM Open License v1.0 разрешает коммерческое использование бесплатно до $10M годовой выручки; крупному бизнесу нужна отдельная лицензия. Веса в Safetensors и GGUF, драфтеры не развёрнуты в хостинговых API Hugging Face — только self-hosting через SGLang или llama.cpp с поддержкой DSpark.

Автор: Никита Громов · Источник: marktechpost.com

Разработчикам. Готовые веса в Safetensors и GGUF, поддержка в llama.cpp и SGLang с первого дня. Память растёт на ~655 MB (2.6B drafter в BF16), скорость декодинга — в 2-3 раза на H100 и Mac M4 Max. Выход детерминирован, benchmark scores остаются теми же, интеграция в локальные coding assistants и on-device агенты работает из коробки.

Бизнесу. Подходит для indie и стартапов до $10M выручки, крупным нужна отдельная лицензия. Применение: on-premise обработка в здравоохранении, финансах, оборонке; локальные ассистенты и offline copilot на ноутбуках; роботика и встраиваемые системы. Self-hosting обязателен — хостинговые API пока без поддержки.

Инвесторам. Liquid AI закрывает нишу высокоскоростного локального inference для регулируемых отраслей и edge-устройств. Ускорение без потери качества — конкурентное преимущество перед облачными провайдерами в healthcare, fintech, defense. Модель лицензирования ограничивает масштаб без дополнительных переговоров, что снижает TAM для крупных игроков.

Хайп35
Реальная польза62
Заработать58
  • Разработка on-device coding copilot для Mac и Linux с ускорением 2,5-3x на M4 Max — рынок разработчиков, ценящих приватность и offline работу.
  • Встроенные агенты для роботов и IoT на ARM/Apple Silicon: драфтеры дают скорость при малом энергопотреблении, подходят для real-time систем.
  • SaaS для малого бизнеса с годовой выручкой до $10M: юридические, медицинские, финансовые ассистенты с гарантией локальной обработки данных — дёшево лицензируются, легко монетизируются.
  • Адаптация для консалтинга и кастомных решений в регулируемых отраслях: облачные провайдеры не дают такого контроля, здесь можно брать премиум за интеграцию.
  • Библиотеки и сервисы для упрощения деплоя DSpark-моделей: llama.cpp и SGLang требуют экспертизы, можно продавать готовую упаковку и поддержку.
  • Драфтеры не поддерживаются хостинговыми API — барьер входа для тех, кто не хочет управлять инфрой. Широкое распространение тормозится.
  • Ускорение сильно зависит от предсказуемости вывода: от 3,18x до 1,18x на разных задачах. На сложных задачах с низкой acceptance rate выигрыш мизерный.
  • MoE-модель на Apple Silicon даёт всего 1,18x из-за узких мест Metal-бэкенда llama.cpp — половина целевой аудитории Mac-разработчиков недовольна.
  • Лицензия с порогом $10M отсекает крупные корпорации без переговоров — снижает потенциал быстрого масштабирования и входа в enterprise-сегмент.

Liquid AI сделала то, что обещали многие: реально ускорила inference малых моделей без костылей и потери точности. Спекулятивное декодирование с блоками из 9 токенов — не новость, но здесь впервые есть готовые веса, цифры на H100 и Mac, поддержка в llama.cpp и SGLang с первого дня. Прирост от 2,5x до 3,18x на предсказуемых задачах (математика, код) — это серьёзно, особенно для тех, кто запускает модели локально.

Но есть нюансы. На непредсказуемых задачах ускорение падает до 1,3x, а MoE на Apple Silicon вообще даёт скромные 1,18x из-за узких мест в Metal-бэкенде. Хостинговых API нет — только self-hosting, что отсекает половину потенциальных пользователей. Лицензия с порогом $10M выручки хороша для indie и стартапов, но тормозит масштабирование в корпоративном сегменте. В итоге: если у вас локальная обработка, регулируемая отрасль или желание не платить за облачные токены — берите и экспериментируйте. Если нужен масс-маркет или plug-and-play в облаке — подождите следующего релиза.

Ещё по теме

Комментарии