инструменты 1 мин

Llama.cpp ускорили на 4-8% за счёт переноса сэмплинга на GPU

В llama.cpp добавили опцию переноса сэмплирования токенов с CPU на GPU при использовании MTP (multi-token prediction). На RTX 5090 прирост скорости достигает 8%, на старой Tesla P40 — 4%. Это самое заметное улучшение производительности локального инференса за последнее время.

Локальный запуск больших моделей на своём железе становится реальной альтернативой облачным API. Каждый процент скорости снижает требования к GPU и делает self-hosting доступнее для малого бизнеса.

Что произошло

В популярный проект llama.cpp (запуск LLM на потребительском железе) внесли патч PR #25532, который переносит сэмплирование токенов с CPU на GPU в режиме multi-token prediction (MTP). Раньше при включённом MTP генерация следующих токенов шла на процессоре, создавая узкое место. Теперь весь пайплайн выполняется на видеокарте.

Автор теста на RTX 5090 получил прирост скорости на 8% для модели Qwen3.6:35B. На старой Tesla P40 (Pascal, 580 GB/s пропускная способность памяти) прирост составил 4% — от ~73 tok/s до ~76 tok/s на задачах генерации кода. Это ощутимо, учитывая, что P40 упирается в память, а не в вычисления, и прирост на топовых картах может быть больше.

Практически: для домашнего self-hosting LLM это заметное улучшение — на топовом железе скорость растёт сильнее, на бюджетных GPU (вроде старых Tesla/Quadro) тоже есть эффект, хоть и меньше.

Автор: Юлия Тарасова · Источник: reddit.com

Разработчикам. Теперь в llama.cpp можно включить флаг -bs (backend sampling) и получить бесплатные 4-8% к скорости при включённом MTP. Особенно актуально для inference-пайплайнов на consumer GPU или дешёвых серверных картах.

Бизнесу. Self-hosted LLM становятся быстрее при тех же затратах на железо. Если вы держите inference на своих серверах или даёте доступ к локальным моделям, можете снизить latency или обслужить больше запросов без апгрейда GPU.

Инвесторам. Рост эффективности локальных LLM (llama.cpp — де-факто стандарт для self-hosting) снижает барьер входа для компаний, которые хотят не зависеть от OpenAI/Anthropic. Растёт спрос на GPU среднего класса и софт для on-premise AI.

Хайп25
Реальная польза60
Заработать55
  • Упаковать llama.cpp с оптимизациями в SaaS для компаний, которые хотят self-hosted LLM (API-обёртка + автоматические обновления)
  • Консалтинг по миграции с облачных LLM на локальные: помочь компаниям настроить inference на своих GPU и сэкономить на API
  • Продавать готовые сервера с предустановленными llama.cpp + популярными моделями: plug-and-play решение для малого/среднего бизнеса
  • Создать маркетплейс оптимизированных моделей под llama.cpp (квантованные, tuned для скорости) с бенчмарками под конкретное железо
  • Разработать мониторинг и A/B тестирование для локальных моделей: DevOps-инструмент для команд, которые переходят на self-hosting
  • 4-8% прирост — это хорошо, но не революция. На старых GPU эффект минимален, на новых — больше, но upgrade-цикл не изменится
  • Работает только при включённом MTP (multi-token prediction), который не все модели поддерживают эффективно
  • Прирост зависит от пропускной способности памяти GPU: на дешёвых картах benefit будет скромным
  • Llama.cpp — open source, любой может взять и использовать бесплатно, сложно монетизировать напрямую

Это не революция, но показатель здорового развития: llama.cpp — стандарт для тех, кто запускает модели дома или на своих серверах, и каждый такой апдейт — это снижение барьера входа. На практике 4-8% прироста — это примерно на 2-5 токенов в секунду больше на средних моделях, что ощутимо в живой работе (меньше ждёшь ответа, больше запросов обрабатывается). RTX 5090 получает больше пользы, старые карты — меньше, но даже на бюджетных GPU что-то есть.

Для бизнеса важнее тренд: self-hosted модели становятся быстрее, не требуя upgrade железа. Если вы продаёте консалтинг, инструменты для локальных LLM или интеграцию моделей в корпоративные системы — это ваша ниша растёт. Сам llama.cpp — open source, но вокруг него можно строить сервисы, SaaS-обёртки, маркетплейсы моделей. Прирост скорости небольшой, но стабильный — значит, спрос на локальные решения будет только расти.

Ещё по теме

Комментарии