Liquid AI выпустила энкодеры LFM2.5 на 230М и 350М параметров: работают на CPU с контекстом 8К токенов
Liquid AI открыла две модели-энкодера (230М и 350М параметров) с контекстом 8192 токена, которые работают быстро на обычном процессоре. Переделали декодеры LFM2.5 в двунаправленные энкодеры для задач классификации, фильтрации и детекции PII — там, где GPU нет или дорого.
Первый раз появились конкурентные энкодеры для длинных контекстов, которые реально работают на CPU. Открывает AI для систем без GPU — embedded, on-premise, edge.
Что произошло
Liquid AI выкатила два open-weight энкодера — LFM2.5-Encoder-230M и LFM2.5-Encoder-350M. Обе модели построены на гибридной архитектуре LFM2, обрабатывают до 8192 токенов (примерно 13-15 страниц текста) и заточены под работу на процессоре без GPU.
Энкодеры не обучались с нуля — взяли готовые декодеры LFM2.5, переделали causal-attention в двунаправленную, сделали свёртки симметричными и дообучили методом masked language modeling с 30% маскирования (в два раза плотнее, чем у BERT).
Обучение в два этапа: сначала на коротких контекстах (1024 токена) для общего понимания языка, затем расширение до 8К на полном датасете с усилением фактов, юридических и мультиязычных данных (15 языков). Лицензия LFM Open License v1.0.
Результаты
LFM2.5-Encoder-350M показал 81.02 балла в среднем по 17 задачам (GLUE, SuperGLUE, мультиязычная классификация) — 4-е место из 14 моделей. Выше только модели крупнее: XLM-R XL (3.5B параметров), ModernBERT-large (395M) и XLM-R large (560M).
Меньшая версия на 230M параметров набрала 79.29 — обогнала ModernBERT-base и все EuroBERT-модели, включая версии до 2.1B параметров.
На CPU при контексте 8К токенов 230М-версия делает проход за ~28 секунд против 90+ у ModernBERT-base — в три раза быстрее.
Методология открыта под Apache-2.0: все модели тестировались в fp32/bf16, одинаковый AdamW, подбор learning rate по 10 вариантам и 3 сидам, итоговые оценки по 5 новым сидам. Версия transformers зафиксирована на 4.56.2.
Автор: Анна Мельникова · Источник: marktechpost.com
Разработчикам. Готовые энкодеры для задач классификации, роутинга запросов, PII-детекции и safety-фильтров. Работают через transformers с trust_remote_code=True, обязательный файнтюнинг под задачу. Туториал по файнтюнингу на 8К контексте включён. Пять демо на CPU-only Hugging Face Spaces: zero-shot роутинг, проверка политик, spell checking, PII-детекция на 40 типов данных в 16 языках.
Бизнесу. Сценарии для встраиваемых систем, edge-устройств (автомобили, промконтроллеры), регулируемых отраслей (финансы, медицина, юриспруденция), где данные не могут уходить в облако. Дешёвая первая стадия фильтрации перед тяжёлыми моделями. 8К токенов хватает на полный контракт или медкарту без разбивки.
Инвесторам. Liquid AI наступает на нишу inference без GPU — рынок edge AI и enterprise on-premise. Прямая конкуренция ModernBERT и XLM-R на задачах, где GPU дорого или недоступно. Архитектура с медленным ростом сложности при длинных контекстах открывает преимущество на длинных документах. Открытые веса снижают порог входа для интеграторов.
- Встроить в SaaS для обработки длинных документов (контракты, медкарты, судебные дела) без затрат на GPU — продавать как on-premise решение для регулируемых отраслей
- Сделать первую стадию фильтрации в RAG-пайплайнах: дешёвый роутинг запросов перед вызовом дорогих LLM, снижение costs per request в разы
- Запустить edge-продукт для автомобильной электроники или IoT: детекция PII, фильтрация контента, классификация команд прямо на устройстве
- Обучить кастомный файнтюн под специфическую отрасль (финтех, легалтех) и продать как white-label решение с гарантией локального хранения данных
- Разработать API-сервис для батчевой обработки документов с SLA на CPU-only инфраструктуре — конкурировать ценой с GPU-зависимыми провайдерами
- Энкодеры требуют обязательного файнтюнинга — не plug-and-play, нужны данные и компетенции ML-инженера для каждой задачи
- Метрики на академических бенчмарках (GLUE, SuperGLUE) не всегда коррелируют с качеством на реальных бизнес-задачах — нужна валидация на своих данных
- Архитектура LFM2 менее изучена, чем BERT/RoBERTa — меньше туториалов, плагинов, community support, выше порог входа
- Скорость на CPU сильно зависит от железа — 28 секунд на forward pass всё ещё долго для high-throughput систем, нужно тестировать на целевом железе
Это реально важный релиз для всех, кто строит AI-системы вне облака. Большинство фреймворков заточены под GPU, а тут модель показывает конкурентное качество на обычном процессоре и при этом работает в три раза быстрее на длинных контекстах. Да, нужен файнтюнинг, да, архитектура не мейнстримовая — но если у вас edge-устройства, регулируемая отрасль или просто жёсткий бюджет на inference, это один из немногих реальных вариантов.
Осторожность нужна с бенчмарками: академические датасеты — это одно, ваши реальные данные — другое. И 28 секунд на forward pass звучит быстро в сравнении с 90, но в абсолютных цифрах это всё ещё медленно для high-load систем. Зато методология открыта, код есть, демо работают — можно быстро проверить на своих задачах. Если зайдёт — сэкономите на железе кратно.
Комментарии