Liquid AI выпустила LFM2.5-2.6B: агентная модель на 2.7 млрд параметров, которая работает локально с контекстом 128К и вызовом функций
Liquid AI представила LFM2.5-2.6B — компактную агентную модель (2.7 млрд параметров), которая запускается локально на смартфонах, ноутбуках и роботах. Модель поддерживает контекст 128К токенов, вызов инструментов и многошаговые задачи. Веса открыты, доступны в форматах GGUF, MLX, ONNX. По бенчмаркам следования инструкциям обгоняет модели вчетверо крупнее.
Это первый реально применимый агентный AI для устройств: работает на телефоне, не требует облака, обходит крупные модели по следованию инструкциям. Если вы делаете продукт, где данные не могут уходить с устройства, это меняет правила игры.
Что выпустили
Liquid AI представила LFM2.5-2.6B — агентную модель размером 2.69 миллиарда параметров, которая полностью работает на устройстве: смартфоне, ноутбуке, десктопе или роботе. Модель умеет планировать действия, вызывать инструменты и решать многошаговые задачи. Контекст — 131 тысяча токенов, словарь — 128 тысяч токенов, обучалась на 34 триллионах токенов.
Два чекпоинта
Вышли две версии: базовая LFM2.5-2.6B-Base для файнтюна и полная LFM2.5-2.6B, дообученная для агентных задач. Веса открыты на Hugging Face под лицензией lfm1.0, доступны в форматах GGUF, MLX и ONNX. Работает из коробки в llama.cpp, vLLM, SGLang и LM Studio.
Как работает
Архитектура: 30 слоёв — 22 свёрточных блока с двойными гейтами плюс 8 блоков grouped-query attention. На Apple M5 Max модель выдаёт 220 токенов в секунду и занимает меньше 2.5 ГБ. На смартфоне — около 30 токенов в секунду. Один GPU NVIDIA H100 SXM5 может обслуживать до 1.3 миллиарда токенов в день.
Бенчмарки
По ToolSandbox, Multi-IF и IFStruct модель обходит gemma-4-E4B-it (8 млрд параметров) и Qwen3.5-9B (9.7 млрд параметров). Единственное исключение — кодинг: на LiveCodeBenchv6 модель набрала 59.41 против 69.86 у Qwen3.5-9B.
Автор: Ксения Лаврова · Источник: marktechpost.com
Разработчикам. Готовый стек для локального инференса: GGUF для llama.cpp, MLX для Mac, ONNX для edge-устройств. LoRA-файнтюн через TRL и Unsloth. Контекст 128К позволяет обрабатывать длинные документы без разбивки. Inference полностью на устройстве — нулевая латентность до API.
Бизнесу. Нулевая маржинальная стоимость каждого запроса: модель работает локально, не нужны API-ключи и облако. Применимо в регулируемых отраслях (финансы, здравоохранение, оборонка), где данные не могут покидать периметр. Подходит для автомобилей, роботов, потребительской электроники и air-gapped сред.
Инвесторам. Открытые веса и поддержка всех популярных форматов снижают барьер входа для OEM и стартапов. Компактный размер (под 3 ГБ) открывает рынок edge AI: встраиваемые системы, роботы, автомобили. Liquid AI фокусируется на агентных сценариях — растущий сегмент между чат-ботами и полноценными ассистентами.
- Локальные ассистенты для смартфонов и ноутбуков: обработка документов, извлечение данных из форм и инвойсов без отправки в облако — продукт для privacy-sensitive пользователей.
- Робототехника: агентные команды для промышленных и сервисных роботов, работающие оффлайн. Контекст 128К позволяет держать длинную историю взаимодействий.
- OEM-интеграции: встраивание модели в автомобили (голосовое управление, навигация), умные устройства (IoT), медицинское оборудование — zero marginal cost привлекателен для массовых устройств.
- Финтех и здравоохранение: автоматизация извлечения данных из регуляторных документов, анализ медкарт и договоров — всё локально, без риска утечки.
- Self-hosted SaaS: платформа для компаний среднего размера, которые хотят AI без зависимости от OpenAI/Anthropic — один GPU H100 обслуживает 1.3 млрд токенов в день.
- Кодинг слабее крупных моделей: LiveCodeBench показывает 59.41 против 69.86 у Qwen3.5-9B — не подходит для coding-агентов.
- Liquid AI прямо не рекомендует модель для knowledge-heavy задач — ограниченная применимость в сценариях, где нужна глубокая экспертиза.
- Открытые веса = конкуренция клонов: через месяц появятся десятки файнтюнов, размывающих позиционирование.
- Хайп вокруг on-device AI может не оправдать ожидания: большинству пользователей удобнее облачные решения с лучшим качеством.
Это не хайп — это реально работающий продукт. Liquid AI сделала то, что обещали многие: компактную агентную модель, которая работает на устройстве и по качеству не уступает облачным гигантам. Контекст 128К, открытые веса, поддержка всех форматов из коробки — это не демка, а готовое решение для production.
Но есть нюанс: модель заточена под узкие сценарии — извлечение данных, следование инструкциям, tool calling. Для кодинга и knowledge-heavy задач она слаба. Если вы делаете продукт для регулируемых отраслей (финтех, медтех, оборонка) или встраиваемые системы (роботы, автомобили), это лучший вариант на рынке. Если нужен универсальный ассистент — смотрите в сторону облачных моделей.
Инструменты из статьи
Десктоп-приложение для локального запуска открытых LLM с удобным интерфейсом.
Доступ из РФ →
Комментарии