инструменты 1 мин

ByteDance научил LLM писать CUDA-код быстрее компилятора: 2.11× против torch.compile

ByteDance и Tsinghua AIR выпустили CUDA Agent — систему RL, которая учит большую языковую модель генерировать GPU-ядра быстрее стандартного компилятора. На бенчмарке из 250 задач модель обгоняет torch.compile в 96.8% случаев с ускорением 2.11× в среднем, доказав, что LLM могут оптимизировать низкоуровневый код на уровне экспертов.

Это первая демонстрация того, что автоматическая оптимизация GPU-кода на уровне экспертов возможна через RL-обучение LLM. Для индустрии inference это путь к снижению cost-per-token в разы без найма узких специалистов по CUDA.

Что произошло

ByteДance Seed и университет Tsinghua выпустили CUDA Agent — систему обучения с подкреплением, которая превращает большую языковую модель в генератор GPU-ядер, обгоняющих стандартный компилятор PyTorch.

Проблема узкая, но упрямая: современные LLM уже пишут корректный CUDA-код, но медленный. Базовая модель Seed1.6 (23B активных параметров из 230B MoE) на бенчмарке KernelBench проходит 74% задач, но обгоняет torch.compile только в 27% случаев со средним замедлением 0.69×.

CUDA Agent меняет правила игры: модель помещается в реальное CUDA-окружение с профилировщиком, проверками корректности и изолированной песочницей с ограниченными правами. Обучение идёт через PPO на 150 шагов с контекстом 131,072 токена.

Результат на 250 задачах: 98.8% корректных решений, 96.8% быстрее компилятора, среднее ускорение 2.11×. На самом сложном уровне Level-3 система опережает Claude Opus 4.5 и Gemini 3 Pro на 40 процентных пунктов.

Технологически интересны пять защит от reward hacking: заблокированные скрипты верификации, запрет фоллбеков на torch.nn.functional, проверка на пяти случайных входах, профилирование с синхронизацией GPU и прогревом, отсутствие доступа к вебу. Награда дискретная: от −1 за ошибку до 3 за обгон и компилятора, и eager-режима более чем на 5%.

Датасет CUDA-Agent-Ops-6K создан синтетически: LLM семплирует до 5 операторов из torch и transformers, склеивает в один слой, фильтр оставляет только детерминированные операции с временем выполнения 1-100 мс.

Веса модели не выложены — это проприетарная Seed1.6. Публично: датасет, спецификация SKILL.md, рецепты наград и warm-up.

CUDAreinforcement learningоптимизация кодаGPUinference

Автор: Павел Заславский · Источник: marktechpost.com

Разработчикам. Получаешь готовый рецепт для обучения LLM писать оптимизированные GPU-ядра: датасет CUDA-Agent-Ops-6K, спецификацию SKILL.md, архитектуру reward-функции с защитой от читерства и пайплайн PPO-обучения. Можно адаптировать на открытые модели типа DeepSeek или Qwen для генерации фьюженых ядер под твою инфраструктуру. Профилировщик работает через ReAct-паттерн с Bash-инструментами, проверяет корректность на пяти случайных входах и измеряет скорость с синхронизацией GPU.

Бизнесу. Открывается путь к снижению стоимости inference на 50% и больше через автоматическую генерацию оптимизированных ядер для GPU-кластеров. Особенно актуально для inference-провайдеров, облаков, где латентность критична — автопилоты, трейдинг, медицинская визуализация, рекомендательные системы. Вместо ручной оптимизации каждого оператора команда из 2-3 ML-инженеров может обучить модель делать это автоматически на новых поколениях GPU.

Инвесторам. Технология сдвигает баланс в индустрии inference — кто первым автоматизирует оптимизацию на уровне CUDA, получит структурное преимущество в cost-per-token. Растёт ценность GPU-облаков с кастомизацией под задачи, инструментов для RL-обучения кода, инфраструктуры профилирования. Потенциал роста в секторах inference-as-a-service, автопилотов, финтеха, медтеха — везде, где каждая миллисекунда GPU-времени на счету.

Хайп35
Реальная польза72
Заработать68
  • Обучить открытую модель DeepSeek-R1 или Qwen2.5-Coder на CUDA-Agent-Ops-6K и продавать оптимизированные ядра inference-провайдерам как сервис — экономия 30-50% на GPU-времени окупит подписку
  • Запустить SaaS для автоматической генерации CUDA-ядер под конкретные GPU (H100, A100, 4090) — загружаешь модель, получаешь оптимизированный код с профилем производительности
  • Создать маркетплейс готовых CUDA-ядер для популярных операций (attention, conv, matmul) с бенчмарками — монетизация через лицензии или rev-share с облачными провайдерами
  • Адаптировать подход для других low-level языков — генерация Triton, Metal, ROCm — и продавать toolchain разработчикам AI-фреймворков
  • Консалтинг для крупных AI-лабораторий: обучение кастомных CUDA-агентов под их инфраструктуру, интеграция в CI/CD пайплайны для автоматической оптимизации новых моделей
  • Веса модели не выложены, базовая Seed1.6 проприетарная — репликация требует 128× H20 GPU и доступна только крупным лабораториям, mid-size команды могут адаптировать только части
  • Реальная применимость узкая: 83.77% датасета — композиции из двух операторов, сложные многооператорные цепочки и edge-cases остаются вопросом
  • Защита от reward hacking работает в контролируемой среде, но в продакшене модель может находить shortcuts типа кеширования или изменения точности вычислений
  • Бенчмарк KernelBench может не отражать реальное распределение операций в production inference — ускорение на синтетике не гарантирует выигрыш на боевых workloads

Это серьёзный технический прорыв, но с оговорками. ByteDance доказал, что LLM могут оптимизировать низкоуровневый код на уровне экспертов — 2.11× среднего ускорения против промышленного компилятора это не шутки. Агентный подход с профилировщиком, PPO-обучением и защитой от reward hacking выглядит продуманно, а дискретная reward-функция элегантно решает проблему нестабильности.

Но есть нюансы. Веса не выложили, базовая модель проприетарная, обучение требует 128 H20 GPU — это уровень frontier labs, не гаражных стартапов. Бенчмарк синтетический, 83% задач — просто две операции склеены, реальные production workloads сложнее. Зато публичные части (датасет, SKILL.md, reward-архитектура) позволяют mid-size командам адаптировать идею на открытые модели типа DeepSeek или Qwen. Реальный impact будет, когда кто-то выложит обученные веса или сделает коммерческий сервис — пока это proof of concept с высоким входным порогом, но очень многообещающий.

Ещё по теме

Комментарии