#DeepSeek

И инструменты ·11 авг 2026

DeepSeek V4 0731: квантизация до 104 ГБ с 83.6% точностью на RTX 5090

Команда AtomicChat квантизовала DeepSeek V4 0731, выявив критические баги в llama.cpp (NaN-значения и потерю точности при конвертации FP8). Создали 13 квантов с imatrix на 1.87M токенах, оптимизированных под RTX 5090. Лучший результат: 104 ГБ (AD-IQ2_M) с 83.6% точностью top-1, что обходит публичные кванты по PPL при одинаковом размере.

0 70
М модели ·9 авг 2026

DeepSeek V4 Flash показал 82,7% на Terminal-Bench 2.1 — независимая проверка подтвердила результаты компании

Автор инструмента Ante независимо проверил заявленные DeepSeek результаты на Terminal-Bench 2.1 (бенчмарк для агентов в терминале). DeepSeek V4 Flash 0731 действительно набрал 82,7% (368 из 445 задач), хотя компания использовала свой закрытый харнес для тестирования. Это редкий случай, когда независимая проверка на публичном инструменте полностью совпала с заявкой производителя модели.

0 106
И инструменты ·4 авг 2026

DeepSeek V4 Flash в 2-битной квантизации первым справился с SQL-тестами на локальной машине

Энтузиаст запустил DeepSeek V4 Flash в агрессивной 2-битной квантизации на двух RTX 3080 и получил 100% на SQL-бенчмарке — то, что раньше удавалось только Claude Opus 4.7 и GPT-5.5 в облаке. Кастомная сборка GGUF с допиленным движком antirez выдала 300 токенов/сек промпта и 11-12 токенов/сек генерации.

0 80
Д другое ·28 июл 2026

«Плохие парни открыли двери, а чемпионы свободы сдают ключи в аренду»: взгляд из третьего мира на open-source AI

Пользователь из Южной Африки размышляет о парадоксе: западные компании годами прятали передовые AI-модели за закрытыми API под предлогом безопасности, взимая плату за доступ. Когда же китайские игроки начали выпускать открытые модели и заставили остальных последовать примеру, старые ярлыки «хорошие/плохие» перестали работать. Для стран третьего мира это не геополитика, а вопрос доступа к технологиям: кто реально относится к человечеству как к виду, способному справиться с прогрессом, а кто просто защищает бизнес-модель.

0 133
М модели ·31 июл 2026

DeepSeek V4-Flash получил апгрейд: втрое дешевле Pro, круче на агентах и коде

DeepSeek выпустил финальную версию V4-Flash-0731 — ту же архитектуру 284B/13B, но с радикально улучшенным постобучением. Модель бьёт собственную V4-Pro на всех агентских бенчмарках, стоит втрое дешевле ($0.28 за миллион выходных токенов против $0.87), MIT-лицензия без ограничений. Самохостинг реален от 110 GB памяти на 3-битной квантизации.

0 75
И инструменты ·6 авг 2026

Фреймворки для AI-агентов: разница в цене до 3х, в скорости — вдвое

Composio протестировала DeepSeek V4 Flash на четырёх агентских фреймворках (Claude Code, Codex, OpenCode, Oh My Pi) на 30 реальных задачах. Результат: выбор обёртки вокруг модели меняет стоимость в 3 раза, скорость — в 2,2 раза. Claude Code самый быстрый (122 сек), но дорогой ($0.195 за задачу). OpenCode самый дешёвый ($0.073), но медленнее. Oh My Pi лидирует по проценту успешных задач (17/30), но самый медленный (272 сек).

0 30
И инструменты ·2 авг 2026

DeepSeek V4 Flash локально: три подводных камня с tool calls и кэшем

Пользователь потратил кучу времени на локальный запуск DeepSeek V4 Flash и нашёл три критичных проблемы: GGUF от Unsloth падает на CPU (4-7 tok/s вместо GPU), tool calls молча ломаются из-за бага в Unsloth Studio, а после 130K токенов cache invalidation убивает производительность из-за лимита в 30GB. Решение — перейти на MLX-версию и переключиться с Unsloth на Hermes Agent.

0 48
М модели ·26 июл 2026

Как модель на 1,6 триллиона параметров работает на ноутбуке: C-код, который вы можете запустить

Автор показывает, как запустить гигантские MoE-модели вроде DeepSeek V4 на обычном ноутбуке. Ключ — в том, что Mixture-of-Experts активирует только ~3% параметров за раз, остальные 97% можно держать на диске и подгружать по требованию. Статья объясняет математику разреженности и предлагает полный рабочий стриминговый движок на C.

0 64
И инструменты ·3 авг 2026

Как использовать API китайских AI-моделей из-за рубежа: оплата, доступ и стоимость

Китайские AI-модели выглядят привлекательно по цене, но доступ к ним из других стран часто затруднён из-за требований к регистрации (материковый номер телефона) и оплате (Alipay, WeChat Pay). Автор разбирает варианты решения через агрегаторы API и анализирует реальную экономику использования четырёх популярных китайских моделей.

0 27
И инструменты ·21 июл 2026

DeepSeek V4 на одной B300: всего 770 токенов/сек в vLLM — что не так?

Разработчик получает всего 770 токенов/сек при batch-обработке на DeepSeek V4-Flash с одной GPU B300 через vLLM, хотя ожидал несколько тысяч. Выяснилось, что быстрое MoE-ядро требует несколько GPU, а спекулятивное декодирование DSpark на насыщенном батче снижает производительность вдвое. Ищет советы по оптимизации конфигурации.

0 78
Б бизнес ·23 июл 2026

Основатель DeepSeek: мы жертвуем деньгами ради AGI — и это стратегия

Лян Вэньфэн провёл четырёхчасовую встречу с инвесторами DeepSeek, где объяснил: компания не гонится за ростом пользователей, не будет закрывать код и не планирует становиться «следующим ByteDance». Единственная цель — AGI. Коммерциализация, продукты, мультимодальность — всё вторично. Open source — сознательная жертва ради сплочённости команды и увеличения шансов на успех. Основное отставание от США — в ресурсах, а не в идеях.

0 19