#inference

И инструменты ·19 авг 2026

Инженер разогнал GPU 2017 года до уровня RTX 5090 на Qwen 3.8 — софтом против железа

Разработчик написал софтверный эмулятор FP4/FP8 (форматы для новейших Blackwell GPU) для старых Tesla V100 2017 года. Четыре V100 выдали те же 219 tok/s на Qwen 3.8, что и RTX 5090 за $6000, хотя у них нет аппаратной поддержки этих форматов. Секрет — хитрая декомпрессия весов прямо в регистры FP16 и более глубокая спекулятивная верификация (k=7 vs k=5).

0 121
И инструменты ·18 авг 2026

ByteDance научил LLM писать CUDA-код быстрее компилятора: 2.11× против torch.compile

ByteDance и Tsinghua AIR выпустили CUDA Agent — систему RL, которая учит большую языковую модель генерировать GPU-ядра быстрее стандартного компилятора. На бенчмарке из 250 задач модель обгоняет torch.compile в 96.8% случаев с ускорением 2.11× в среднем, доказав, что LLM могут оптимизировать низкоуровневый код на уровне экспертов.

0 117
И исследования ·7 авг 2026

Apple сравнила диффузионные и авторегрессионные языковые модели: когда параллельная генерация текста побеждает

Исследователи Apple опубликовали детальное сравнение двух архитектур LLM: классических авторегрессионных моделей (генерируют текст токен за токеном) и диффузионных (генерируют параллельно). Вывод: диффузия работает быстрее на коротких контекстах благодаря параллелизму, но проигрывает на длинных последовательностях и батчах. Ключ к ускорению DLM — сокращение шагов сэмплирования.

0 112
И инструменты ·6 авг 2026

Как работает vLLM: разбор системы высокопроизводительного инференса LLM

Детальный разбор vLLM — движка для быстрого запуска больших языковых моделей. Объясняет ключевые техники: paged attention для экономии памяти, continuous batching для одновременной обработки запросов, chunked prefill для длинных промптов и prefix caching для переиспользования общих частей запросов. Показывает, как система масштабируется от однопроцессного инференса до multi-GPU кластера.

0 112
И инструменты ·3 авг 2026

Запустили DeepSeek V4-Flash (284B) на паре RTX 3090 и подержанном сервере за $6K — 33 токена в секунду

Энтузиаст развернул официальный чекпоинт DeepSeek V4-Flash (284B параметров, 156 ГБ) на железе с eBay: серверная тачка Dell R940 с 4 процессорами Xeon и 768 ГБ DDR4 + две RTX 3090. Выхлоп: 33 токена/сек одному пользователю, 68 в агрегате для четверых. Главная находка — 95% работы делает процессор с памятью, видеокарты задействованы на 25%. Итого реальная альтернатива облакам за ~$6000 на подержанном железе, если вам нужна полная модель, а не перепаковка.

0 127
М модели ·31 июл 2026

Квантизация Qwen3.6-27B до 3.33 BPW без потери качества: проверено на реальной модели, а не на бумаге

Разработчик сжал файнтюн Qwen3.6-27B до 10.4 ГБ (3.33 бита на вес) методом покомпонентной квантизации с KLD-контролем. Главное: на этот раз проверил не отдельные слои, а собранную модель целиком — и нашёл реальную деградацию, которую пришлось чинить вручную. Модуль внимания сжимается почти даром, основная цена качества — в FFN.

0 116
И исследования ·5 авг 2026

Apple исследует проблему «выбросов» в Diffusion Transformers: как лишние токены замедляют генерацию изображений

Команда Apple Machine Learning обнаружила, что в моделях генерации изображений на основе Diffusion Transformers (DiTs) появляются токены-«выбросы» с аномально высокими значениями, которые потребляют непропорционально много внимания модели, но не несут полезной информации. Проблема встречается и в энкодерах (ViT), и внутри самих DiT. Исследователи предложили методы подавления этих токенов, что улучшает качество и эффективность генерации.

0 29
И инструменты ·22 июл 2026

MindControl: форк llama.cpp, который направляет рассуждения модели инъекциями во время сэмплирования

Разработчик создал форк llama.cpp, который решает проблему зацикливания и деградации рассуждений у небольших локальных моделей (типа Qwen3.6-27B). Система автоматически инжектирует промпты вроде «у меня бюджет в X токенов» в процесс генерации, напоминая модели о лимитах и направляя к выводам. В тестах подход показал заметное улучшение качества reasoning.

0 112
И исследования ·21 июл 2026

Пропусти слой или зациклись: как научить LLM менять глубину вычислений на лету

Исследователи из arXiv показали, что слои предобученных LLM можно динамически пропускать или повторять в зависимости от запроса — без дообучения. Лёгкая сеть-предсказатель генерирует индивидуальный «маршрут» через слои для каждого входа, улучшая точность на математических задачах и одновременно снижая число вычислений.

0 94
И инструменты ·2 авг 2026

DeepSeek V4 Flash ломается при квантизации KV Cache — тесты показали 10% деградацию точности

Пользователь провёл тесты квантизации KV Cache для DeepSeek V4 Flash (BF16 → Q8) и получил значительное падение качества: средний KL divergence вырос до 0.146 (против 0.0036 у Qwen 397B), точность топ-токенов упала до 87% (против 98% у Qwen). Вывод: для DS4F квантизация KV Cache — плохая идея.

0 26
И инструменты ·22 июл 2026

Почему две видеокарты для LLM загружены только наполовину — и это не поломка

Пользователь разобрался, почему его две GeForce RTX 5060 Ti никогда не грузятся выше 50% при запуске LLM. Причина — в архитектуре послойного разделения модели: карты работают по очереди, а не параллельно. Каждый сгенерированный токен требует прочитать из памяти все 22 ГБ весов модели, и узким местом становится пропускная способность памяти, а не вычисления.

0 86
И инструменты ·4 авг 2026

Llama.cpp ускорили на 4-8% за счёт переноса сэмплинга на GPU

В llama.cpp добавили опцию переноса сэмплирования токенов с CPU на GPU при использовании MTP (multi-token prediction). На RTX 5090 прирост скорости достигает 8%, на старой Tesla P40 — 4%. Это самое заметное улучшение производительности локального инференса за последнее время.

0 18
И инструменты ·21 июл 2026

DeepSeek V4 на одной B300: всего 770 токенов/сек в vLLM — что не так?

Разработчик получает всего 770 токенов/сек при batch-обработке на DeepSeek V4-Flash с одной GPU B300 через vLLM, хотя ожидал несколько тысяч. Выяснилось, что быстрое MoE-ядро требует несколько GPU, а спекулятивное декодирование DSpark на насыщенном батче снижает производительность вдвое. Ищет советы по оптимизации конфигурации.

0 78
И инструменты ·31 июл 2026

Архитектура инференса LLM: батчинг, KV-кеш и мультиарендность

Статья объясняет, как устроены системы инференса больших языковых моделей изнутри. Автор разбирает, почему наивный подход тратит ресурсы GPU впустую, как работают современные техники оптимизации (continuous batching, PagedAttention) и что происходит, когда нужно обслуживать множество пользователей одновременно на одном железе.

0 25
М модели ·24 июл 2026

Как современные LLM генерируют текст: пошаговый разбор на чистом Python

Автор показывает, что происходит «под капотом» языковой модели между вводом запроса и получением ответа. Вместо использования готовых библиотек он загружает реальные веса модели Qwen3-0.6B и воссоздаёт весь конвейер инференса в 200 строках чистого Python с использованием MLX (фреймворк Apple для массивов).

0 53
И инструменты ·24 июл 2026

Hetzner запустил экспериментальный API для LLM-инференса

Немецкий хостер Hetzner открыл бесплатный тестовый API для запуска языковых моделей — пока доступна одна небольшая модель Qwen на 35 млрд параметров, но компания хочет понять, нужен ли рынку ещё один inference-провайдер. Это эксперимент без SLA и гарантий, но с OpenAI-совместимым интерфейсом и неожиданно быстрой скоростью отклика.

0 38
И инструменты ·26 июл 2026

Разделение Prefill и Decode: когда стоит разбивать инференс на два стека

Все крупные движки инференса LLM теперь поддерживают разделение фаз prefill (обработка промпта) и decode (генерация токенов) на отдельные пулы GPU. Автор объясняет техническую природу этого подхода и главное — когда он действительно нужен, а когда создаёт лишние сложности.

0 20