#оптимизация inference

И инструменты ·21 авг 2026

Sparse Attention для Minimax H3: до 70% экономии памяти и 2x ускорение генерации видео

Разработчик Zironic представил оптимизированную реализацию Sparse Attention для Minimax H3 с гибким контролем плотности внимания (10-50%), INT8/FP8 квантизацией и снижением пикового потребления памяти до 70%. В отличие от других патчей, работает только с видеотокенами и интегрируется с Comfy Kitchen напрямую.

0 85
И инструменты ·20 авг 2026

Liquid AI выпустила DSpark-драфтеры для LFM2.5: ускорение декодинга до 3,18x без потери качества

Liquid AI представила драфт-модели для LFM2.5 (1.2B, 2.6B, 8B), которые ускоряют генерацию текста до 3,18x на H100 и до 2,87x на M4 Max через спекулятивное декодирование. Драфтер (~300M параметров) предлагает 9 токенов за раз, целевая модель проверяет все разом. Выход идентичен оригиналу при жадном декодинге, точность не меняется. Работает в llama.cpp и SGLang, но требует самостоятельного хостинга.

0 50
И инструменты ·30 июл 2026

Tencent открыл AngelSpec — фреймворк для обучения драфтеров спекулятивной декодировки под разные типы задач

Tencent выложил AngelSpec — torch-фреймворк для обучения черновых моделей в спекулятивной декодировке. Вместо одной универсальной модели обучает две: MTP для диалогов, DFly для кода и математики. На Qwen3-8B и Hy3-A21B прирост acceptance length до 60%, особенно на код и формальные рассуждения.

0 81
М модели ·25 июл 2026

DSpark: спекулятивное декодирование с управлением по уверенности

DSpark — новый метод ускорения генерации текста большими языковыми моделями через спекулятивное декодирование. Система использует параллельную генерацию черновиков (как в DFlash), добавляет лёгкую последовательную голову для учёта зависимостей между токенами и применяет калиброванные оценки уверенности, чтобы верифицировать только те предложенные токены, которые действительно стоят вычислительных затрат целевой модели.

0 108
И инструменты ·23 июл 2026

Как заставить 3B-модель работать как 30B: метод «структурной упряжки» вместо слепого промпт-инжиниринга

Разработчик поделился методом, как выжать максимум из малых локальных LLM (3B–8B параметров). Вместо огромных системных промптов он использует жёсткие markdown-шаблоны — «скелеты» с чёткими слотами для переменных. Модель не придумывает структуру, а только заполняет пробелы по строгим правилам, что резко повышает качество и стабильность генерации.

0 90