#длинный контекст

И инструменты ·18 авг 2026

Qwen 3.8 27B локально vs API: как разработчик сэкономил $650+ за один вечер на длинных задачах

Разработчик прогнал 8-часовую задачу на локальной Qwen 3.8 27B (27 млрд параметров) с 262K контекстом: 966 вызовов модели, 131M входных и 853K выходных токенов, 105 tok/s. Та же работа через API обошлась бы в $18-677 в зависимости от провайдера. Локальный инференс на RTX PRO 6000 с квантизацией Q4/Q5/Q6 показал нулевую стоимость и отличную скорость для multi-agent задач с огромным контекстом.

0 92
М модели ·10 авг 2026

Muse Glimmer 30B влезает в RTX 3090 с полным контекстом — тест на реальном железе

Новая модель Muse Glimmer 30B реально работает на одной RTX 3090 (24GB VRAM) с контекстом до 256k токенов, занимая ~22-23GB. Для сравнения: Qwen3.6-27B и Gemma-4-31B на том же железе дают только 70-125k токенов. Скорость 64-124 tok/s с DFlash, тест на 150k токенов прошёл без проблем.

0 26
М модели ·30 июл 2026

Kimi K3: слишком велик, чтобы запустить

Автор провёл практический тест Kimi K3 — крупнейшей открытой модели с 2,8 трлн параметров и контекстом на 1 млн токенов. После 11 часов настройки кластера из 4×H100 и 594 ГБ весов выяснилось, что модель в 21 из 41 теста давала неверные ответы, включая полностью выдуманные данные при работе с длинным контекстом.

0 74
И инструменты ·29 июл 2026

Liquid AI выпустила энкодеры LFM2.5 на 230М и 350М параметров: работают на CPU с контекстом 8К токенов

Liquid AI открыла две модели-энкодера (230М и 350М параметров) с контекстом 8192 токена, которые работают быстро на обычном процессоре. Переделали декодеры LFM2.5 в двунаправленные энкодеры для задач классификации, фильтрации и детекции PII — там, где GPU нет или дорого.

0 66
М модели ·24 июл 2026

Laguna S2.1 в деле: медленная, но решает баги, с которыми не справляются Qwen и Claude

Практический тест Laguna S2.1 показал, что модель не подходит для планирования задач из-за слишком глубокого рассуждения, но оказалась эффективна для сложной отладки кода. В отличие от Qwen, DeepSeek и Claude, которые часто фиксят первую попавшуюся проблему и останавливаются, Laguna тратит сотни тысяч токенов на анализ, но находит ВСЕ корневые причины багов. Модель заняла нишу «тяжёлой артиллерии» для задач, с которыми не справляются универсальные LLM.

0 94