#локальный AI

И инструменты ·20 авг 2026

Liquid AI выпустила DSpark-драфтеры для LFM2.5: ускорение декодинга до 3,18x без потери качества

Liquid AI представила драфт-модели для LFM2.5 (1.2B, 2.6B, 8B), которые ускоряют генерацию текста до 3,18x на H100 и до 2,87x на M4 Max через спекулятивное декодирование. Драфтер (~300M параметров) предлагает 9 токенов за раз, целевая модель проверяет все разом. Выход идентичен оригиналу при жадном декодинге, точность не меняется. Работает в llama.cpp и SGLang, но требует самостоятельного хостинга.

0 50
И инструменты ·17 авг 2026

Qwen 3.8 27B на RTX 5060 Ti 16GB: 73k контекст и автономная разработка на 3 промптах

Энтузиаст прогнал 1M+ токенов через Qwen 3.8 27B на RTX 5060 Ti 16GB, добился 73k контекста в 16GB VRAM через квантизацию KV-кэша (q4_1) и нативный MTP. Построил полноценный REST API + MCP-сервер всего 3 промптами — модель работала автономно 2 часа, писала код, тесты, линтинг. Поделился точной конфигурацией llama.cpp для бюджетного железа.

0 115
И инструменты ·18 авг 2026

DeepSeek V4 Flash на четырёх RTX 3060: 100 tok/s на 144 ГБ модели с контекстом 360k

Энтузиаст запустил 144 ГБ модель DeepSeek V4 Flash на четырёх потребительских RTX 3060 12GB, добившись скорости обработки промпта ~100 tok/s и контекста 368k токенов. Ключ — экстремальное распределение экспертов MoE по GPU через llama.cpp и агрессивная настройка микробатчей. Показывает, что большие MoE-модели можно разгонять на доступном железе.

0 22
И инструменты ·15 авг 2026

Почему быстрый запуск AI-моделей на Mac — это боль: разбор инструментов для Apple Silicon

Разработчик потратил 2 недели, чтобы понять, как оптимально запускать LLM на Mac. Вывод: софт для Apple Silicon — хаос. Нет единого фреймворка с полным набором оптимизаций (prefix caching, speculative decoding и т.д.), в отличие от NVIDIA/CUDA. Новые модели типа Qwen используют гибридный KV-кэш, который ломает привычные подходы. Лучший вариант сейчас — vllm-metal, но и он неполон.

0 42
И инструменты ·9 авг 2026

Локальный AI за 900 евро: интегрированная графика AMD Radeon 780M тянет модели на 30+ миллиардов параметров

Энтузиаст показал, как запускать LLM на 30+ миллиардов параметров на мини-ПК с интегрированной графикой AMD Radeon 780M и 64 ГБ оперативки за ~900 евро. Qwen 3.6 35B выдаёт 21 токен/сек, Gemma 4 31B — 5-6 токенов/сек. Не быстро, но работает для личных задач без облака.

0 83
И инструменты ·5 авг 2026

Qwen3-TTS в llama.cpp: клонирование голоса теперь работает локально из коробки

В llama.cpp добавили полноценную поддержку Qwen3-TTS — модели клонирования голоса из 3 секунд референса. Теперь можно синтезировать речь на 10 языках локально, через тот же движок, на котором крутятся LLM. Это упрощает интеграцию TTS в существующие проекты на llama.cpp, но есть нюансы.

0 105
И инструменты ·2 авг 2026

DeepSeek-V4-Flash на 284 млрд параметров запустили на 5,3 ГБ памяти — как это вообще возможно

Энтузиаст запустил DeepSeek-V4-Flash (284B параметров) на MacBook с 24 ГБ памяти, используя всего 5,3 ГБ оперативки. Секрет — движок Mference, который держит в памяти только активные эксперты MoE-моделей (~13B на токен), остальное подгружает с SSD. Скорость до 5 токенов/сек, 2-битный квант, 91 ГБ на диске.

0 75
И инструменты ·29 июл 2026

llama.cpp теперь загружает MTP-тензоры по умолчанию — лишний гигабайт VRAM для всех

Свежие сборки llama.cpp автоматически загружают MTP/NextN-тензоры из GGUF-моделей (GLM-5.2, Qwen3.5-MoE и др.), даже если спекулятивная декодировка отключена. Раньше эти блоки грузились только при явном --spec-type draft-mtp. Теперь каждый запуск жрёт на ~1 дополнительный MoE-слой памяти, даже если MTP не используется.

0 61
И инструменты ·22 июл 2026

Почему две видеокарты для LLM загружены только наполовину — и это не поломка

Пользователь разобрался, почему его две GeForce RTX 5060 Ti никогда не грузятся выше 50% при запуске LLM. Причина — в архитектуре послойного разделения модели: карты работают по очереди, а не параллельно. Каждый сгенерированный токен требует прочитать из памяти все 22 ГБ весов модели, и узким местом становится пропускная способность памяти, а не вычисления.

0 86