#GPU оптимизация

И инструменты ·19 авг 2026

Инженер разогнал GPU 2017 года до уровня RTX 5090 на Qwen 3.8 — софтом против железа

Разработчик написал софтверный эмулятор FP4/FP8 (форматы для новейших Blackwell GPU) для старых Tesla V100 2017 года. Четыре V100 выдали те же 219 tok/s на Qwen 3.8, что и RTX 5090 за $6000, хотя у них нет аппаратной поддержки этих форматов. Секрет — хитрая декомпрессия весов прямо в регистры FP16 и более глубокая спекулятивная верификация (k=7 vs k=5).

0 121
И инструменты ·4 авг 2026

Cursor открыл код Mixture-of-Kittens: ядро для обучения MoE-моделей в 2.4 раза быстрее конкурентов

Cursor Research выложил в открытый доступ MoK — мегаядро для обучения mixture-of-experts моделей на стойках GB300 NVL72. Вместо разделения коммуникации и вычислений всё слито в один детерминированный kernel, что даёт до 2.37x прирост скорости против лучших публичных решений. Уже работает на десятках тысяч GPU в продакшене при обучении Composer.

0 57
И инструменты ·29 июл 2026

Krea 2 LoRA: как дообучить на RTX 5080 16GB и почему популярные гайды врут

Энтузиаст обучил LoRA-адаптер для Krea 2 на RTX 5080 с 16GB VRAM вопреки популярным статьям, утверждающим, что нужно больше памяти. Полный тренинг 1152 шага занял 67 минут, пик VRAM — 93.8%. Бонус: разбор проблем официальных репозиториев (gated-доступ), bagов модели (bleeding в промпты без триггеров) и пошаговый рецепт с точными версиями библиотек.

0 80
И инструменты ·25 июл 2026

Программист год писал тренер для SDXL под свои 12 ГБ видеопамяти — и выложил бесплатно

Разработчик создал Aozora — бесплатный GUI-тренер для файнтюнинга SDXL и Anima на потребительских GPU с 12 ГБ видеопамяти. Инструмент тренирует 80-90% полной модели SDXL в пределах 11.8 ГБ VRAM (~1.55 сек/итерация) и 100% Anima в разрешении 1152×1152 (~11.4 ГБ, 2.67 сек/итерация). Код написан с нуля, а не обёртка над существующими решениями.

0 42