Какой самый дешёвый компьютер потянет локальные LLM? Тест от 0.6B до 8B на Celeron за $100
Энтузиаст проверил, можно ли запускать LLM на дешёвой одноплатной x86-системе за $100–130. Celeron N5095 с 16 ГБ ОЗУ справился с Qwen3 0.6B на 6.8 токен/сек (пригодно для классификации и фоновых задач), но 8B модели работали по 0.9 токен/сек — слишком медленно. Дальше планируется тест через Vulkan на встроенной графике.
Показывает реальный нижний порог бюджета для локальных LLM и практические ограничения дешёвого железа. Полезно тем, кто хочет экспериментировать с AI без облачных подписок или строит edge-решения на минимальном бюджете.
Сколько стоит запустить LLM локально?
Энтузиаст под ником tre7744 решил проверить минимальный порог входа для локального запуска языковых моделей. В качестве подопытного выступила одноплатная x86-система Youyeetoo X1S с процессором Celeron N5095 (4 ядра, 15 Вт), 16 ГБ ОЗУ и 128 ГБ NVMe, стоимостью $100–130 на AliExpress.
Результаты тестов через Ollama (только CPU)
Было протестировано 6 моделей:
- Qwen3 0.6B: в среднем 6.8 токен/сек — вполне пригодно для классификации, маршрутизации и фоновых задач
- 8B модель: уместилась в 16 ГБ, но выдала всего 0.9 токен/сек — для реальной работы непригодна
- Ещё 4 промежуточные модели с подробными данными в репозитории
Под нагрузкой процессор в среднем грелся до 74.6°C (пик 77°C) на стоковом кулере, троттлинга не было.
Узкое место
Оllama автоматически выбрала CPU-режим, хотя встроенная графика Jasper Lake была доступна. Автор отмечает: 8B упёрлись не в объём ОЗУ, а в пропускную способность памяти — модель загружается, но работает слишком медленно.
Что дальше?
Планируется сравнительный тест с llama.cpp через Vulkan на встроенной графике — есть данные, что на N100 Vulkan-инференс работает. Автор ищет сравнительные результаты от владельцев N100/N150 и опыт использования Jasper Lake/Alder Lake-N iGPU.
Выводы: для бюджетных фоновых задач с маленькими моделями даже 15-ваттный Celeron справляется. Большие модели требуют не только памяти, но и её скорости.
Автор: Анна Мельникова · Источник: reddit.com
Это тот редкий случай, когда кто-то реально проверил минимальный порог входа — не на бумаге, а с цифрами и логами. Да, 0.6B модель на 6.8 токен/сек — это не ChatGPT, но для фоновых задач (классификация, саммари, маршрутизация запросов) вполне рабочий вариант. А главное — это всего $100–130 и 15 ватт, без облачных подписок и с полным контролем данных.
Другой вопрос — насколько это практично. 8B модели встали колом не из-за нехватки памяти, а из-за её скорости. И вот тут интересно будет посмотреть на тесты через Vulkan на встроенной графике — если там хотя бы 2–3 токен/сек выжать, это уже меняет картину. Пока что вывод простой: если задача простая и бюджет микроскопический — Celeron справится. Если нужно что-то посерьёзнее — копите на нормальное железо или идите в облако.
Инструменты из статьи
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →
Комментарии