#CUDA

И инструменты ·18 авг 2026

ByteDance научил LLM писать CUDA-код быстрее компилятора: 2.11× против torch.compile

ByteDance и Tsinghua AIR выпустили CUDA Agent — систему RL, которая учит большую языковую модель генерировать GPU-ядра быстрее стандартного компилятора. На бенчмарке из 250 задач модель обгоняет torch.compile в 96.8% случаев с ускорением 2.11× в среднем, доказав, что LLM могут оптимизировать низкоуровневый код на уровне экспертов.

0 117
И инструменты ·1 авг 2026

Три бага PyTorch убили ComfyUI на Quadro RTX 6000. Разбор с кодом и фиксами

Разработчик восемь часов искал, почему ComfyUI выдаёт чёрные картинки на Quadro RTX 6000. Нашёл три независимых бага: переполнение FP16 в torch.mm() (PyTorch 2.12+), несовместимость аллокатора памяти на Turing и физический дефект VRAM. Выложил фиксы и диагностические скрипты на GitHub.

0 106
И инструменты ·24 июл 2026

audio.cpp 0.4: нейросетевой TTS на C++ разгоняется до 10× реального времени

Вышел релиз audio.cpp 0.4 с поддержкой новых TTS-моделей (Higgs Audio v3, Fish Audio S2 Pro) и полноценной работой с форматом GGUF. Квантизация Q8 даёт прирост скорости до 1.5× и экономию видеопамяти до 37% на CUDA. Higgs Audio генерирует речь в 8–10 раз быстрее реального времени, Fish Audio — в 3× на RTX 5090.

0 27