#локальные LLM

И инструменты ·13 авг 2026

Как собрать домашний AI-сервер из e-waste: AMD V620 и куча хлама вместо облачных API

Разработчик собрал AI-сервер для запуска LLM-моделей из дешёвого е-waste: 4x AMD V620 (серверные GPU без вентиляторов по цене металлолома), старая материнка X299, самый провальный процессор Intel за 20 лет и 3D-печатные кулеры. Цель — не зависеть от чужих облачных сервисов и научиться работать с железом напрямую.

0 119
И инструменты ·4 авг 2026

DeepSeek V4 Flash в 2-битной квантизации первым справился с SQL-тестами на локальной машине

Энтузиаст запустил DeepSeek V4 Flash в агрессивной 2-битной квантизации на двух RTX 3080 и получил 100% на SQL-бенчмарке — то, что раньше удавалось только Claude Opus 4.7 и GPT-5.5 в облаке. Кастомная сборка GGUF с допиленным движком antirez выдала 300 токенов/сек промпта и 11-12 токенов/сек генерации.

0 80
И инструменты ·29 июл 2026

Малые локальные LLM с правильной оркестрацией решают задачи вдвое лучше: исследование на 100 кейсах

Инженер протестировал методы оркестрации на небольших open-source моделях (1.2B–26B параметров). 90% техник не сработали, но оставшиеся 10% удвоили процент выполненных задач — с 15% до 32% на LFM 1.2B, до 56% на Gemma 4 26B. Вывод: проблема малых моделей не в весах, а в плохой инженерной обвязке.

0 107
И инструменты ·2 авг 2026

DeepSeek V4 Flash локально: три подводных камня с tool calls и кэшем

Пользователь потратил кучу времени на локальный запуск DeepSeek V4 Flash и нашёл три критичных проблемы: GGUF от Unsloth падает на CPU (4-7 tok/s вместо GPU), tool calls молча ломаются из-за бага в Unsloth Studio, а после 130K токенов cache invalidation убивает производительность из-за лимита в 30GB. Решение — перейти на MLX-версию и переключиться с Unsloth на Hermes Agent.

0 48
И исследования ·21 июл 2026

Пропусти слой или зациклись: как научить LLM менять глубину вычислений на лету

Исследователи из arXiv показали, что слои предобученных LLM можно динамически пропускать или повторять в зависимости от запроса — без дообучения. Лёгкая сеть-предсказатель генерирует индивидуальный «маршрут» через слои для каждого входа, улучшая точность на математических задачах и одновременно снижая число вычислений.

0 94
И инструменты ·28 июл 2026

Конвейер для AI-кодинга: каждый этап — своя модель

Разработчик создал open-source инструмент AutoDev Studio, который позволяет использовать разные AI-модели на разных этапах разработки софта: одну для планирования, другую для написания кода, третью для ревью. Можно миксовать локальные LLM (через Ollama) и облачные сервисы вроде Claude Code, Gemini или Codex. На тестах с большими Python-репозиториями (35k и 82k строк кода) такой подход оказался на 7–75% дешевле, чем прогон одной моделью.

0 51
Д другое ·31 июл 2026

Reddit требует маркировать «открытые» модели без весов тегом [no weights]

Пользователь r/LocalLLaMA предлагает обязательную маркировку постов об «открытых» моделях, веса которых фактически недоступны для скачивания — особенно после случаев с Meta, обещавшей релиз, но не выпустившей веса. Цель: не кликать на анонсы моделей, которые нельзя запустить локально прямо сейчас.

0 41