модели 1 мин

DeepSeek V4-Flash получил апгрейд: втрое дешевле Pro, круче на агентах и коде

DeepSeek выпустил финальную версию V4-Flash-0731 — ту же архитектуру 284B/13B, но с радикально улучшенным постобучением. Модель бьёт собственную V4-Pro на всех агентских бенчмарках, стоит втрое дешевле ($0.28 за миллион выходных токенов против $0.87), MIT-лицензия без ограничений. Самохостинг реален от 110 GB памяти на 3-битной квантизации.

Это первая открытая модель с производительностью топ-уровня на агентах и коде по цене, при которой можно строить бизнес без венчурных денег на GPU. Меняется экономика AI-стартапов.

31 июля 2024 DeepSeek опубликовал официальный релиз V4-Flash-0731 на Hugging Face и открыл публичную бету API. Никакой новой архитектуры — те же 284B параметров с активацией 13B на токен, MoE с 256 роутинговыми экспертами, миллион токенов контекста. Вся магия в постобучении.

Результат: модель обошла собственную V4-Pro (preview) на каждом агентском бенчмарке, который DeepSeek опубликовал. Terminal Bench 2.1 — 82.7 против 72.1 у Pro. NL2Repo — 54.2 против 38.5. Cybergym — 76.7 против 52.7. DeepSWE (код из описания в реальный репозиторий) — 54.4 против 12.8. Toolathlon и AutomationBench — та же история.

Цена через API: $0.14 за миллион входных токенов без кеша, $0.28 за выходные. Это треть от стоимости Pro ($0.87). Для агентских петель и массовой генерации кода — игра меняется.

Самохостинг: веса MIT-лицензированы без гейткипинга. Нужно минимум 110 GB общей памяти (RAM + VRAM) на 3-битной квантизации или 4×GB300 на полной точности. Unsloth опубликовал динамические GGUF: 162 GB на 8-бит без потерь, 103 GB на 3-бит. Это уровень средних и крупных компаний с кластером или одной мощной рабочей станции.

Архитектура гибридная: Compressed Sparse Attention плюс Heavily Compressed Attention, Manifold-Constrained Hyper-Connections вместо обычных residual. Первые три MoE-слоя используют хеш-роутинг. Обучение — более 32 триллионов токенов, оптимизатор Muon.

Критичный нюанс: все бенчмарки запущены на внутреннем харнессе DeepSeek, который не опубликован. Агентские метрики чувствительны к окружению — прогоняйте свои тесты перед продом.

Автор: Ксения Лаврова · Источник: marktechpost.com

Разработчикам. MIT-лицензия даёт полную свободу интеграции. DSpark (спекулятивное декодирование) ускоряет генерацию на 60-85% на потоке через один флаг vLLM. Поддержка Responses API и адаптация под Codex открывают прямую интеграцию в CI/CD и IDE. Самохостинг на 3-бит от 110 GB — можно запустить на хорошей рабочей станции.

Бизнесу. Цена $0.28 за миллион выходных токенов разблокирует агентов и кодогенерацию для стартапов без GPU-бюджета. Отсутствие vendor lock-in (MIT, ungated) снижает риски зависимости. Производительность на уровне Claude Opus 4.8 на некоторых задачах (Terminal Bench, NL2Repo близко) при радикально меньшей цене.

Инвесторам. DeepSeek атакует рынок инфраструктурного AI снизу: открытые веса, агрессивный прайсинг, производительность топ-уровня. Это давление на Anthropic и OpenAI по марже. Рынок агентских фреймворков (LangChain, AutoGPT) получает дешёвый бэкенд. Под угрозой провайдеры закрытых API без конкурентной цены.

Хайп35
Реальная польза78
Заработать82
  • Агентские платформы на V4-Flash: чат-боты для поддержки, автоматизация DevOps, code review — рентабельно при массовом использовании
  • Сервисы конвертации 'текст → код → репозиторий' для no-code платформ и маркетплейсов фриланса
  • Самохостинговые решения для корпораций с compliance-требованиями: финтех, медтех, госсектор — полный контроль данных
  • Инструменты для IDE и редакторов кода: автодополнение, рефакторинг, генерация тестов — конкурент GitHub Copilot по цене в разы ниже
  • Маркетплейс промптов и агентских шаблонов под V4-Flash: готовые воркфлоу для бизнеса
  • Все бенчмарки от вендора на закрытом харнессе — реальная производительность может отличаться, особенно на нестандартных задачах
  • Самохостинг выглядит доступно на бумаге, но 110 GB на 3-бит — это агрессивная квантизация с возможной потерей качества; полноценный деплой требует серьёзного железа
  • Нет обновления V4-Pro API и веб-моделей — фокус только на Flash может говорить об ограниченных ресурсах на широкий фронт
  • Отсутствие Jinja-шаблонов и кастомный encoding/ усложняют интеграцию — нужна адаптация существующих пайплайнов

DeepSeek делает то, чего не делают OpenAI и Anthropic: выпускает модель с топовой производительностью на агентах и коде по цене, при которой её можно крутить в проде без привлечения инвесторов. $0.28 за миллион выходных токенов — это уровень, когда автоматизация становится рентабельной для обычных компаний, а не только для BigTech.

Но есть подвох: все цифры от вендора, харнесс закрыт, и никто кроме DeepSeek не прогонял эти бенчмарки. Агентские метрики вообще очень чувствительны к окружению. Так что да, это выглядит круто, но прогоняйте свои тесты перед тем, как строить на этом продукт. И учтите, что самохостинг на 3-бит — это компромисс: качество может просесть, а для полной точности нужен серьёзный кластер.

Инструменты из статьи

DeepSeekбез VPN

Китайская LLM с сильным кодом и рассуждениями. Очень дешёвый API.

Доступ из РФ →

Ещё по теме

Комментарии