ByteDance научил LLM писать CUDA-код быстрее компилятора: 2.11× против torch.compile
ByteDance и Tsinghua AIR выпустили CUDA Agent — систему RL, которая учит большую языковую модель генерировать GPU-ядра быстрее стандартного компилятора. На бенчмарке из 250 задач модель обгоняет torch.compile в 96.8% случаев с ускорением 2.11× в среднем, доказав, что LLM могут оптимизировать низкоуровневый код на уровне экспертов.