инструменты 1 мин

Какой самый дешёвый компьютер потянет локальные LLM? Тест от 0.6B до 8B на Celeron за $100

Энтузиаст проверил, можно ли запускать LLM на дешёвой одноплатной x86-системе за $100–130. Celeron N5095 с 16 ГБ ОЗУ справился с Qwen3 0.6B на 6.8 токен/сек (пригодно для классификации и фоновых задач), но 8B модели работали по 0.9 токен/сек — слишком медленно. Дальше планируется тест через Vulkan на встроенной графике.

Показывает реальный нижний порог бюджета для локальных LLM и практические ограничения дешёвого железа. Полезно тем, кто хочет экспериментировать с AI без облачных подписок или строит edge-решения на минимальном бюджете.

Сколько стоит запустить LLM локально?

Энтузиаст под ником tre7744 решил проверить минимальный порог входа для локального запуска языковых моделей. В качестве подопытного выступила одноплатная x86-система Youyeetoo X1S с процессором Celeron N5095 (4 ядра, 15 Вт), 16 ГБ ОЗУ и 128 ГБ NVMe, стоимостью $100–130 на AliExpress.

Результаты тестов через Ollama (только CPU)

Было протестировано 6 моделей:

  • Qwen3 0.6B: в среднем 6.8 токен/сек — вполне пригодно для классификации, маршрутизации и фоновых задач
  • 8B модель: уместилась в 16 ГБ, но выдала всего 0.9 токен/сек — для реальной работы непригодна
  • Ещё 4 промежуточные модели с подробными данными в репозитории

Под нагрузкой процессор в среднем грелся до 74.6°C (пик 77°C) на стоковом кулере, троттлинга не было.

Узкое место

Оllama автоматически выбрала CPU-режим, хотя встроенная графика Jasper Lake была доступна. Автор отмечает: 8B упёрлись не в объём ОЗУ, а в пропускную способность памяти — модель загружается, но работает слишком медленно.

Что дальше?

Планируется сравнительный тест с llama.cpp через Vulkan на встроенной графике — есть данные, что на N100 Vulkan-инференс работает. Автор ищет сравнительные результаты от владельцев N100/N150 и опыт использования Jasper Lake/Alder Lake-N iGPU.

Выводы: для бюджетных фоновых задач с маленькими моделями даже 15-ваттный Celeron справляется. Большие модели требуют не только памяти, но и её скорости.

Автор: Анна Мельникова · Источник: reddit.com

Это тот редкий случай, когда кто-то реально проверил минимальный порог входа — не на бумаге, а с цифрами и логами. Да, 0.6B модель на 6.8 токен/сек — это не ChatGPT, но для фоновых задач (классификация, саммари, маршрутизация запросов) вполне рабочий вариант. А главное — это всего $100–130 и 15 ватт, без облачных подписок и с полным контролем данных.

Другой вопрос — насколько это практично. 8B модели встали колом не из-за нехватки памяти, а из-за её скорости. И вот тут интересно будет посмотреть на тесты через Vulkan на встроенной графике — если там хотя бы 2–3 токен/сек выжать, это уже меняет картину. Пока что вывод простой: если задача простая и бюджет микроскопический — Celeron справится. Если нужно что-то посерьёзнее — копите на нормальное железо или идите в облако.

Инструменты из статьи

Ollamaбез VPN

Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...

Доступ из РФ →

Ещё по теме

Комментарии