Энтузиаст запустил 27-миллиардную языковую модель на одноплатнике с 16 ГБ памяти
Разработчик смог запустить полноценную 27-миллиардную языковую модель Bonsai на одноплатном компьютере Jetson Orin NX 16GB, используя экстремальное 1-битное сжатие. Модель работает полностью офлайн, потребляет около 25 Вт и выдаёт ~7 токенов в секунду — медленно, но для одного пользователя вполне пригодно.
Это практическая демонстрация того, как квантование делает большие языковые модели доступными для локального запуска на бюджетном оборудовании — важный шаг к приватности и автономности AI-приложений без зависимости от облачных сервисов.
Большая модель на маленьком железе
Энтузиаст из Reddit продемонстрировал работу 27-миллиардной языковой модели Bonsai на одноплатном компьютере Jetson Orin NX с 16 ГБ оперативной памяти. Для справки: такие модели обычно требуют серверного оборудования с десятками гигабайт VRAM.
Технические детали
Ключевой трюк — экстремальное 1-битное квантование с форматом Q1_0_g128. Это позволило ужать модель до 3,53 ГБ на диске. Энергопотребление составило в среднем 20,7 Вт, пик — 24,6 Вт. Скорость генерации текста — около 7 токенов в секунду при обработке промпта на 128 токенов в секунду.
Важный нюанс: стандартный Ollama с этим не работает. Нужно собирать форк llama.cpp от PrismML вручную с поддержкой CUDA. Автор столкнулся с проблемами: nvcc не был в PATH на стоковой прошивке JetPack, а сборка падала из-за нехватки памяти без swap-файла.
Компромиссы качества
Автор честно признаёт: 1-битное сжатие — это жестокая компрессия. На английском языке модель работает удивительно хорошо. Но при попытке генерации на корейском начались проблемы: случайные токены из других языков, искажение технических терминов. Для неанглийского контента такая конфигурация непригодна.
Для тех, кому нужно лучшее качество, доступна тернарная (3-битная) версия, но автор не тестировал, поместится ли она на 16 ГБ.
Практическое применение
Несмотря на ограничения, это впечатляющая демонстрация возможностей периферийных вычислений (edge AI). Полностью офлайновая работа мощной модели на устройстве с энергопотреблением обычной лампочки открывает перспективы для автономных систем, где недоступен облачный AI.
Ключевые выводы
- 27-миллиардная модель может работать на одноплатнике с 16 ГБ благодаря 1-битному квантованию до 3,53 ГБ
- Энергопотребление составляет ~25 Вт — сопоставимо с зарядкой смартфона
- Стандартный Ollama не поддерживает кастомное 1-битное квантование — нужна ручная сборка llama.cpp
- Качество генерации на неанглийских языках сильно деградирует при экстремальном сжатии
- Edge AI становится реальностью: мощные модели могут работать полностью офлайн на доступном железе
Автор: Павел Заславский · Источник: reddit.com
Это один из тех постов, где энтузиаст делает то, что «по идее не должно работать», и документирует весь процесс. Впечатляет не столько сам факт запуска (1-битное квантование — известная техника), сколько честность в описании компромиссов.
Особенно ценно, что автор не скрывает проблемы: корейский язык модель понимает отвратительно, стандартный Ollama не работает из коробки, сборка требует ручных костылей. Это не «вау, AI на тостере!», а реальный кейс для узкого сценария: английская генерация в полностью офлайн-режиме на устройстве мощностью с лампочку. Для приватных задач или автономных систем — вполне жизнеспособно. Для продакшена — вряд ли.
Инструменты из статьи
Локальный запуск открытых LLM (Llama, Qwen, GLM) на своём железе. Бесплатно...
Доступ из РФ →
Комментарии