#локальные-модели

И инструменты ·29 июл 2026

Как запустить ML-модели на любом железе без CUDA: опыт PostSlate с Vulkan

Команда видеоредактора PostSlate показала, как ncnn с Vulkan-бэкендом решает проблему кросс-платформенного inference на клиентских устройствах. Вместо CUDA (только NVIDIA) они получили 10-кратное ускорение распознавания лиц на любых GPU — от Intel интегрированных до Apple Silicon — без установки дополнительных рантаймов.

0 121
И исследования ·27 июл 2026

Локальная LLM играет в шутер Perfect Dark на Mac — агент ходит, целится и стреляет сам

Энтузиаст научил локальную языковую модель играть в классический шутер Perfect Dark на Mac. Система двухуровневая: быстрый слой управляет прицеливанием и движением каждые ~50 мс, LLM принимает стратегические решения медленнее. Работает через оригинальный бинарник игры, используя MLX-фреймворк Apple.

0 86
М модели ·27 июл 2026

Gemma 4 и Qwen 3.6 MoE на встроенной графике AMD: тесты показали, почему MoE — это будущее локальных LLM

Энтузиаст протестировал новые модели Gemma 4 и Qwen 3.6 MoE на мини-ПК с APU AMD 6800H (встроенная графика Radeon 680M). Главный вывод: Mixture of Experts (MoE) модели дают скорость маленькой модели при интеллекте большой — Qwen 3.6 35B в 6,5 раз быстрее обычной 31B модели. Квантизация Q4 оптимальна для APU, Q8 убивает производительность, а новые форматы FP4 пока работают хуже обычных.

0 66
И инструменты ·29 июл 2026

Как заставить локальные LLM не ломать JSON: грамматический подход через llama.cpp

Разработчик решил проблему невалидного JSON от локальных моделей через GBNF-грамматики в llama.cpp. Система компилирует схемы инструментов в правила грамматики, которые запрещают модели генерировать невалидный вывод на уровне токенов. Применил в проекте Eris — локальном AI-агенте на Rust с памятью в Markdown.

0 27