Локальный AI за 900 евро: интегрированная графика AMD Radeon 780M тянет модели на 30+ миллиардов параметров
Энтузиаст показал, как запускать LLM на 30+ миллиардов параметров на мини-ПК с интегрированной графикой AMD Radeon 780M и 64 ГБ оперативки за ~900 евро. Qwen 3.6 35B выдаёт 21 токен/сек, Gemma 4 31B — 5-6 токенов/сек. Не быстро, но работает для личных задач без облака.
Показывает, что локальный AI становится доступнее: даже без дорогих GPU можно экспериментировать с большими моделями. Для разработчиков и малого бизнеса — способ сэкономить и контролировать данные.
Пользователь Reddit показал, как собрать бюджетную систему для локального AI на AMD Radeon 780M — интегрированной графике в процессорах типа Ryzen 7 260 или Ryzen 9 8945HX. Конфигурация: мини-ПК barebone (~300-400 евро), 64 ГБ DDR5 SO-DIMM (~500 евро б/у), SSD (~50-100 евро). Итого около 900 евро.
Ключ в том, что настройками ядра Linux можно выделить интегрированной графике до 48 ГБ системной памяти как «видеопамять». Это позволяет запускать квантованные модели на 30+ миллиардов параметров через llama.cpp с бэкендом Vulkan.
Практические результаты: - Qwen 3.6 35B (Q8 квантизация): ~21 токен/сек при генерации, ~287 токенов/сек при обработке промпта. - Gemma 4 31B (Q8): ~5.7 токен/сек при генерации с Multi-Token Prediction.
На плотных моделях дополнительная дискретная GPU типа RTX 5060 8GB почти не помогает. Но для MoE-моделей (Mixture of Experts) можно частично разгружать слои на GPU и ускорить генерацию с 5-6 до ~35 токенов/сек, правда ценой более медленной обработки промпта.
Решение не для продакшена, но для экспериментов, обучения и личных задач — работающий вариант без облака и дорогих GPU.
Автор: Марина Соколова · Источник: reddit.com
Разработчикам. Можно экспериментировать с локальным AI без дорогого железа: llama.cpp, Vulkan-бэкенд, квантизация Q8, настройки ядра для выделения памяти встроенной графике. Подойдёт для разработки промптов, тестов, прототипов, которым не нужна высокая скорость. MoE-модели можно распределить между iGPU и дискреткой.
Бизнесу. Для задач типа аннотации данных, внутренних чат-ботов, классификации на небольших объёмах — дешёвый on-premise вариант. Ограничение по скорости, но для несрочных задач или малого бизнеса может закрыть вопрос конфиденциальности и контроля данных без аренды облака.
Инвесторам. Показывает растущий спрос на доступный локальный AI. Рынок может расшириться за счёт потребителей, не готовых платить облакам, но требующих контроля данных. Производители мини-ПК и AMD могут нарастить долю в нише локального inference, если оптимизируют драйверы и софт.
- Консалтинг и сборка готовых mini-PC конфигураций для малого бизнеса и энтузиастов: подбор железа, настройка ядра, оптимизация моделей под конкретные задачи.
- SaaS-платформа для управления локальным AI: оркестрация моделей, квантизация, мониторинг — упаковка llama.cpp и подобных инструментов в простой интерфейс для не-разработчиков.
- Продажа готовых образов Linux с преднастроенными ядром и llama.cpp под AMD iGPU — как дистрибутив для AI-энтузиастов.
- Оптимизация драйверов и инструментов для AMD iGPU: партнёрства с AMD, разработка патчей для ядра и Vulkan-бэкендов — может превратиться в консалтинг или продуктовый стартап.
- Создание библиотек и плагинов для распределения MoE-моделей между iGPU и дискреткой — ускоренная генерация при минимальных затратах на железо.
- Скорость 5-6 токенов/сек делает решение непригодным для интерактивных приложений и большинства коммерческих сценариев — пользователь не будет ждать ответа секундами.
- Производительность зависит от глубоких настроек ядра Linux и Vulkan — для массового пользователя это барьер, требует технической подготовки и времени.
- AMD может не развивать поддержку интегрированных GPU для AI-задач так же активно, как NVIDIA для дискретных карт — драйверы могут застрять на текущем уровне.
- Невозможность запуска топовых моделей типа DeepSeek, мультимодальных или действительно крупных (100B+) без экстремальной квантизации — ограничивает применение.
Это классный пример того, как энтузиасты находят обходные пути там, где рынок диктует «купи GPU за $2000». Да, 5 токенов в секунду — это не скорость света, но для многих задач этого достаточно: аннотация данных, внутренние эксперименты, обучающие проекты. Главное — решение показывает, что локальный AI не обязательно требует космических бюджетов.
Но массовым это не станет, пока кто-то не упакует всё в удобную коробку: готовый мини-ПК с предустановленной ОС, простым интерфейсом и автонастройкой. Сейчас это для тех, кто не боится командной строки и готов копаться в настройках ядра. Если AMD или сторонние вендоры подхватят идею и выпустят готовое решение — может появиться целая ниша локальных AI-станций для малого бизнеса и энтузиастов.
Комментарии