DeepSeek V4-Flash получил апгрейд: втрое дешевле Pro, круче на агентах и коде
DeepSeek выпустил финальную версию V4-Flash-0731 — ту же архитектуру 284B/13B, но с радикально улучшенным постобучением. Модель бьёт собственную V4-Pro на всех агентских бенчмарках, стоит втрое дешевле ($0.28 за миллион выходных токенов против $0.87), MIT-лицензия без ограничений. Самохостинг реален от 110 GB памяти на 3-битной квантизации.
Это первая открытая модель с производительностью топ-уровня на агентах и коде по цене, при которой можно строить бизнес без венчурных денег на GPU. Меняется экономика AI-стартапов.
31 июля 2024 DeepSeek опубликовал официальный релиз V4-Flash-0731 на Hugging Face и открыл публичную бету API. Никакой новой архитектуры — те же 284B параметров с активацией 13B на токен, MoE с 256 роутинговыми экспертами, миллион токенов контекста. Вся магия в постобучении.
Результат: модель обошла собственную V4-Pro (preview) на каждом агентском бенчмарке, который DeepSeek опубликовал. Terminal Bench 2.1 — 82.7 против 72.1 у Pro. NL2Repo — 54.2 против 38.5. Cybergym — 76.7 против 52.7. DeepSWE (код из описания в реальный репозиторий) — 54.4 против 12.8. Toolathlon и AutomationBench — та же история.
Цена через API: $0.14 за миллион входных токенов без кеша, $0.28 за выходные. Это треть от стоимости Pro ($0.87). Для агентских петель и массовой генерации кода — игра меняется.
Самохостинг: веса MIT-лицензированы без гейткипинга. Нужно минимум 110 GB общей памяти (RAM + VRAM) на 3-битной квантизации или 4×GB300 на полной точности. Unsloth опубликовал динамические GGUF: 162 GB на 8-бит без потерь, 103 GB на 3-бит. Это уровень средних и крупных компаний с кластером или одной мощной рабочей станции.
Архитектура гибридная: Compressed Sparse Attention плюс Heavily Compressed Attention, Manifold-Constrained Hyper-Connections вместо обычных residual. Первые три MoE-слоя используют хеш-роутинг. Обучение — более 32 триллионов токенов, оптимизатор Muon.
Критичный нюанс: все бенчмарки запущены на внутреннем харнессе DeepSeek, который не опубликован. Агентские метрики чувствительны к окружению — прогоняйте свои тесты перед продом.
Автор: Ксения Лаврова · Источник: marktechpost.com
Разработчикам. MIT-лицензия даёт полную свободу интеграции. DSpark (спекулятивное декодирование) ускоряет генерацию на 60-85% на потоке через один флаг vLLM. Поддержка Responses API и адаптация под Codex открывают прямую интеграцию в CI/CD и IDE. Самохостинг на 3-бит от 110 GB — можно запустить на хорошей рабочей станции.
Бизнесу. Цена $0.28 за миллион выходных токенов разблокирует агентов и кодогенерацию для стартапов без GPU-бюджета. Отсутствие vendor lock-in (MIT, ungated) снижает риски зависимости. Производительность на уровне Claude Opus 4.8 на некоторых задачах (Terminal Bench, NL2Repo близко) при радикально меньшей цене.
Инвесторам. DeepSeek атакует рынок инфраструктурного AI снизу: открытые веса, агрессивный прайсинг, производительность топ-уровня. Это давление на Anthropic и OpenAI по марже. Рынок агентских фреймворков (LangChain, AutoGPT) получает дешёвый бэкенд. Под угрозой провайдеры закрытых API без конкурентной цены.
- Агентские платформы на V4-Flash: чат-боты для поддержки, автоматизация DevOps, code review — рентабельно при массовом использовании
- Сервисы конвертации 'текст → код → репозиторий' для no-code платформ и маркетплейсов фриланса
- Самохостинговые решения для корпораций с compliance-требованиями: финтех, медтех, госсектор — полный контроль данных
- Инструменты для IDE и редакторов кода: автодополнение, рефакторинг, генерация тестов — конкурент GitHub Copilot по цене в разы ниже
- Маркетплейс промптов и агентских шаблонов под V4-Flash: готовые воркфлоу для бизнеса
- Все бенчмарки от вендора на закрытом харнессе — реальная производительность может отличаться, особенно на нестандартных задачах
- Самохостинг выглядит доступно на бумаге, но 110 GB на 3-бит — это агрессивная квантизация с возможной потерей качества; полноценный деплой требует серьёзного железа
- Нет обновления V4-Pro API и веб-моделей — фокус только на Flash может говорить об ограниченных ресурсах на широкий фронт
- Отсутствие Jinja-шаблонов и кастомный encoding/ усложняют интеграцию — нужна адаптация существующих пайплайнов
DeepSeek делает то, чего не делают OpenAI и Anthropic: выпускает модель с топовой производительностью на агентах и коде по цене, при которой её можно крутить в проде без привлечения инвесторов. $0.28 за миллион выходных токенов — это уровень, когда автоматизация становится рентабельной для обычных компаний, а не только для BigTech.
Но есть подвох: все цифры от вендора, харнесс закрыт, и никто кроме DeepSeek не прогонял эти бенчмарки. Агентские метрики вообще очень чувствительны к окружению. Так что да, это выглядит круто, но прогоняйте свои тесты перед тем, как строить на этом продукт. И учтите, что самохостинг на 3-бит — это компромисс: качество может просесть, а для полной точности нужен серьёзный кластер.
Комментарии