#VRAM

И инструменты ·14 авг 2026

torch-preflight — линтер для PyTorch, который ловит баги до запуска на GPU

Разработчик создал статический анализатор для PyTorch-кода, который находит типичные ошибки (забытый zero_grad, утечки памяти в autograd, неправильный gradient accumulation) без запуска кода. Бонус — оценка потребления VRAM до аренды GPU.

0 115
И инструменты ·6 авг 2026

Как ускорить Qwen 35B в 2.4 раза на RTX 3090 без потери скорости генерации

Исследователь показал, как сбросив 8 экспертных слоёв MoE-модели Qwen3.6-35B на CPU, можно увеличить batch-размеры и разогнать prompt processing с 564 до 1330 токенов/сек (2.36×) на RTX 3090, сохранив скорость генерации. Ключ — освобождение VRAM для увеличения батча, а не сам CPU-оффлоад.

0 124
И инструменты ·9 авг 2026

Как снизить VRAM для MiniMax H3 с 15.7 до 4.5 ГБ без потери качества

Энтузиаст заменил 32B CLIP-энкодер MiniMax H3 на 4B-модель Qwen3-VL с линейной проекцией. VRAM упал с 15.7 до 4.5 ГБ, а генерация работает почти так же. Метод: ridge regression для обучения проекции между скрытыми состояниями моделей с общим токенизатором. Код открыт, работает в ComfyUI.

0 65
И инструменты ·29 июл 2026

llama.cpp теперь загружает MTP-тензоры по умолчанию — лишний гигабайт VRAM для всех

Свежие сборки llama.cpp автоматически загружают MTP/NextN-тензоры из GGUF-моделей (GLM-5.2, Qwen3.5-MoE и др.), даже если спекулятивная декодировка отключена. Раньше эти блоки грузились только при явном --spec-type draft-mtp. Теперь каждый запуск жрёт на ~1 дополнительный MoE-слой памяти, даже если MTP не используется.

0 61
И инструменты ·26 июл 2026

BeeLlama.cpp v0.4.1: новые способы сжатия KV-кэша для LLM без потери точности

Вышла версия форка llama.cpp с улучшенными алгоритмами квантизации KV-кэша: KVarN (нормализация по дисперсии), precision tail (хранение последних токенов в высоком качестве) и дополнительные типы сжатия q2_0-q6_1. Бенчмарки показывают, что хранение последних 1024 токенов в полной точности позволяет kvarn5 и q6_0 достичь качества q8_0 при меньшем расходе видеопамяти.

0 56
И инструменты ·22 июл 2026

Как выжать 340 токенов в секунду из 204GB MoE-модели на одной видеокарте

Энтузиаст разработал метод запуска огромных MoE-моделей (Kimi 2.7, 204GB) на одной системе через хитрую комбинацию unified memory, кэширования VRAM и выборочной выгрузки экспертов. На DGX Spark достиг 340 токенов/сек на промпте и 9.6 на генерации — в разы быстрее CPU. На обычных 3090 тоже работает, но медленнее из-за узкого PCIe.

0 74
И инструменты ·29 июл 2026

Почему AI-моделям нужно так много RAM и VRAM

Статья объясняет, почему память — главное узкое место при работе с AI-моделями, а не процессорная мощность. Автор разбирает, сколько памяти требуется для хранения параметров моделей, в чём разница между RAM и VRAM, и почему GPU не может работать с данными, не помещающимися в его видеопамять.

0 44