модели 1 мин

Liquid AI выпустила LFM2.5-2.6B: агентная модель на 2.7 млрд параметров, которая работает локально с контекстом 128К и вызовом функций

Liquid AI представила LFM2.5-2.6B — компактную агентную модель (2.7 млрд параметров), которая запускается локально на смартфонах, ноутбуках и роботах. Модель поддерживает контекст 128К токенов, вызов инструментов и многошаговые задачи. Веса открыты, доступны в форматах GGUF, MLX, ONNX. По бенчмаркам следования инструкциям обгоняет модели вчетверо крупнее.

Это первый реально применимый агентный AI для устройств: работает на телефоне, не требует облака, обходит крупные модели по следованию инструкциям. Если вы делаете продукт, где данные не могут уходить с устройства, это меняет правила игры.

Что выпустили

Liquid AI представила LFM2.5-2.6B — агентную модель размером 2.69 миллиарда параметров, которая полностью работает на устройстве: смартфоне, ноутбуке, десктопе или роботе. Модель умеет планировать действия, вызывать инструменты и решать многошаговые задачи. Контекст — 131 тысяча токенов, словарь — 128 тысяч токенов, обучалась на 34 триллионах токенов.

Два чекпоинта

Вышли две версии: базовая LFM2.5-2.6B-Base для файнтюна и полная LFM2.5-2.6B, дообученная для агентных задач. Веса открыты на Hugging Face под лицензией lfm1.0, доступны в форматах GGUF, MLX и ONNX. Работает из коробки в llama.cpp, vLLM, SGLang и LM Studio.

Как работает

Архитектура: 30 слоёв — 22 свёрточных блока с двойными гейтами плюс 8 блоков grouped-query attention. На Apple M5 Max модель выдаёт 220 токенов в секунду и занимает меньше 2.5 ГБ. На смартфоне — около 30 токенов в секунду. Один GPU NVIDIA H100 SXM5 может обслуживать до 1.3 миллиарда токенов в день.

Бенчмарки

По ToolSandbox, Multi-IF и IFStruct модель обходит gemma-4-E4B-it (8 млрд параметров) и Qwen3.5-9B (9.7 млрд параметров). Единственное исключение — кодинг: на LiveCodeBenchv6 модель набрала 59.41 против 69.86 у Qwen3.5-9B.

Автор: Ксения Лаврова · Источник: marktechpost.com

Разработчикам. Готовый стек для локального инференса: GGUF для llama.cpp, MLX для Mac, ONNX для edge-устройств. LoRA-файнтюн через TRL и Unsloth. Контекст 128К позволяет обрабатывать длинные документы без разбивки. Inference полностью на устройстве — нулевая латентность до API.

Бизнесу. Нулевая маржинальная стоимость каждого запроса: модель работает локально, не нужны API-ключи и облако. Применимо в регулируемых отраслях (финансы, здравоохранение, оборонка), где данные не могут покидать периметр. Подходит для автомобилей, роботов, потребительской электроники и air-gapped сред.

Инвесторам. Открытые веса и поддержка всех популярных форматов снижают барьер входа для OEM и стартапов. Компактный размер (под 3 ГБ) открывает рынок edge AI: встраиваемые системы, роботы, автомобили. Liquid AI фокусируется на агентных сценариях — растущий сегмент между чат-ботами и полноценными ассистентами.

Хайп35
Реальная польза72
Заработать68
  • Локальные ассистенты для смартфонов и ноутбуков: обработка документов, извлечение данных из форм и инвойсов без отправки в облако — продукт для privacy-sensitive пользователей.
  • Робототехника: агентные команды для промышленных и сервисных роботов, работающие оффлайн. Контекст 128К позволяет держать длинную историю взаимодействий.
  • OEM-интеграции: встраивание модели в автомобили (голосовое управление, навигация), умные устройства (IoT), медицинское оборудование — zero marginal cost привлекателен для массовых устройств.
  • Финтех и здравоохранение: автоматизация извлечения данных из регуляторных документов, анализ медкарт и договоров — всё локально, без риска утечки.
  • Self-hosted SaaS: платформа для компаний среднего размера, которые хотят AI без зависимости от OpenAI/Anthropic — один GPU H100 обслуживает 1.3 млрд токенов в день.
  • Кодинг слабее крупных моделей: LiveCodeBench показывает 59.41 против 69.86 у Qwen3.5-9B — не подходит для coding-агентов.
  • Liquid AI прямо не рекомендует модель для knowledge-heavy задач — ограниченная применимость в сценариях, где нужна глубокая экспертиза.
  • Открытые веса = конкуренция клонов: через месяц появятся десятки файнтюнов, размывающих позиционирование.
  • Хайп вокруг on-device AI может не оправдать ожидания: большинству пользователей удобнее облачные решения с лучшим качеством.

Это не хайп — это реально работающий продукт. Liquid AI сделала то, что обещали многие: компактную агентную модель, которая работает на устройстве и по качеству не уступает облачным гигантам. Контекст 128К, открытые веса, поддержка всех форматов из коробки — это не демка, а готовое решение для production.

Но есть нюанс: модель заточена под узкие сценарии — извлечение данных, следование инструкциям, tool calling. Для кодинга и knowledge-heavy задач она слаба. Если вы делаете продукт для регулируемых отраслей (финтех, медтех, оборонка) или встраиваемые системы (роботы, автомобили), это лучший вариант на рынке. Если нужен универсальный ассистент — смотрите в сторону облачных моделей.

Инструменты из статьи

LM Studioбез VPN

Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.

Доступ из РФ →

Ещё по теме

Комментарии