Laguna-S-2.1 vs Qwen3.5-122B: быстрейшая локальная модель, но врёт под давлением
Разработчик протестировал новую 118B-модель Laguna-S-2.1 против Qwen3.5-122B на 160 задачах для агентов. Laguna показала лучший tool calling и скорость (109 tok/s), но при недостатке данных начинает изобретать факты — называла несуществующих лошадей на скачках и выдумывала цифры P&L. Qwen медленнее, но за 240 попыток ни разу не соврала, честно признавая «не знаю».
Первый детальный агентный тест новой Laguna выявил паттерн «быстро и красиво, но врёт» — критичное свойство для автономных систем, которое бенчмарки не ловят. Показывает, что для production нужны тесты на честность, а не только на производительность.
Краш-тест локальных гигантов
Энтузиаст локального AI прогнал свежую Laguna-S-2.1 (118B параметров) через 160 задач на RTX Pro 6000 с 96GB памяти, сравнивая с проверенной Qwen3.5-122B. Тесты жёсткие: tool calling, цепочки инструментов, JSON-схемы, проверки на галлюцинации (когда инструменты возвращают пустоту — признаётся ли модель или выдумает?), спортивная аналитика, арифметика.
Где Laguna выигрывает
Скорость и tool calling — главные козыри. 109 токенов/сек при контексте 256k (Qwen: 103), лучший в тестах tool-аргумент парсинг (0.89 vs 0.86 у Qwen), цепочки инструментов до 6 уровней (Qwen: 4), нулевые ошибки JSON. Модель стартует с первого раза, восстанавливается после ошибок валидации.
Но есть подводные камни. Speculative decoding (dflash) разгоняет код до 271 tok/s, но на прозе даёт +8 tok/s, а при 4+ параллельных стримах замедляет работу до 198 tok/s из-за отбрасываемых драфтов. Модель думает очень долго — нужно ставить max_tokens 8k+, иначе тратит весь бюджет на рефлексию и возвращает пустоту.
Критическая проблема: выдумки
Laguna провалила главный тест для автономных агентов — grounding under pressure (0.80 vs 0.97 у Qwen). Три подтверждённые галлюцинации: - Изобретала P&L цифры для рынков без данных - Дважды называла лошадей, которых не было в списках скачек - Однажды вытащила из предобучения реальную кличку "Genuine Risk" (победитель Дерби-1980) с позицией, завышенной в 1000 раз
Qwen3.5-122B за ~240 провокационных тестов: ноль выдумок. Просто отвечает "у меня нет этих данных".
База знаний
Sports-задачи: 0.80 у Laguna vs 1.00 у Qwen. Это не баг — Poolside честно пишет, что 118B модель переиспользует корпус предобучения 33B версии, добавив специализацию на код, а не широту знаний.
Вердикт автора
Poolside сделала именно то, что обещала: агентного кодинг-специалиста. Tool-механика — лучшее в локальных моделях, скорость отличная. Но "агентность" их RL означает упорство, а упорство без дисциплины приземления = уверенные выдумки при нехватке данных.
Для кодинга с human-in-the-loop — отлично. Для автономных агентов с реальными ставками — Qwen держит карту: чуть медленнее, tool calling попроще, но никогда не врёт. И это свойство, которое реально важно.
Ключевые выводы
- Laguna-S-2.1 показала лучший tool calling среди локальных 100B+ моделей (0.89 pass rate) и рекордную скорость 109 tok/s на 256k контексте
- Критическая слабость: при недостатке данных модель уверенно изобретает факты вместо признания незнания — 3 подтверждённые галлюцинации vs ноль у Qwen за 240 тестов
- Speculative decoding ускоряет код в 2.5x, но замедляет параллельные стримы — годится для solo-разработки, не для серверов
- База знаний узкая из-за переиспользования корпуса 33B модели — 118B параметров ушли в специализацию на код, не в широту
- Для production-агентов честное 'не знаю' важнее скорости и tool-мастерства — один выдуманный P&L может стоить дороже всех бенчмарков
Автор: Ксения Лаврова · Источник: reddit.com
Это тот редкий тест, где человек измеряет не то, что удобно мерить, а то, что реально важно: будет ли модель врать, когда данных нет. И вот тут выясняется неприятное — Poolside натренировали упорство без совести. Модель как тот коллега, который никогда не признаётся «не знаю», а придумает что-нибудь правдоподобное. Для кодинга с код-ревью — терпимо, там человек проверит. Но для агентов, которые сами принимают решения? Одна выдуманная цифра в финансовом отчёте может стоить дороже, чем все эти красивые 109 tok/s.
И да, автор правильно подловил Poolside на честности: они пишут «118B модель», но 118B ушли в кодинг-специализацию поверх *корпуса 33B модели*. Это как апгрейд процессора при старом жёстком диске — быстрее работает, но знаний не прибавилось. Qwen тупее в tool calling, медленнее, но никогда не врёт. В мире, где AI-агенты начинают управлять реальными деньгами и решениями, это та характеристика, за которую стоит платить токенами в секунду.
Комментарии