DeepSeek V4 Flash показал 82,7% на Terminal-Bench 2.1 — независимая проверка подтвердила результаты компании
Автор инструмента Ante независимо проверил заявленные DeepSeek результаты на Terminal-Bench 2.1 (бенчмарк для агентов в терминале). DeepSeek V4 Flash 0731 действительно набрал 82,7% (368 из 445 задач), хотя компания использовала свой закрытый харнес для тестирования. Это редкий случай, когда независимая проверка на публичном инструменте полностью совпала с заявкой производителя модели.
Обычно заявленные производителями результаты расходятся с независимыми тестами. Здесь совпали — значит, DeepSeek не завышает метрики, а модель действительно стабильна на реальных задачах.
Автор инструмента Ante провёл независимую проверку DeepSeek V4 Flash 0731 на бенчмарке Terminal-Bench 2.1 — наборе задач для AI-агентов, работающих в командной строке.
DeepSeek заявлял результат 82,7%, но использовал свой закрытый харнес (минимальный режим DeepSeek Harness). Автор решил проверить на публичном инструменте Ante 0.preview.71 через OpenRouter.
Результат: 368 успешных попыток из 445 (82,7% ± 1,79%), 89 задач, 5 попыток на задачу. Полная конфигурация, все логи и детали доступны публично.
Важный нюанс: модель чувствительна к харнесу (инфраструктуре тестирования). То, что результаты совпали, говорит либо о честности DeepSeek, либо о том, что оба харнеса достаточно близки.
Обычно независимые проверки показывают расхождения с заявленными результатами — здесь совпадение полное.
Автор: Артём Ковалёв · Источник: reddit.com
Разработчикам. Если собираете AI-агентов для CLI-задач — V4 Flash стабильно работает на уровне 82-83%. Но тестируйте на своём харнесе: модель чувствительна к инфраструктуре. Полная конфигурация и логи доступны, можно воспроизвести.
Бизнесу. Независимая проверка подтверждает качество DeepSeek для автоматизации через командную строку. Это важно для CI/CD, DevOps-автоматизации, внутренних инструментов. Прозрачность результатов снижает риск выбора модели.
Инвесторам. Редкий случай, когда производитель модели не завышает метрики. Это сигнал о зрелости компании и доверии к продукту. Terminal-Bench 2.1 — узкая, но денежная ниша для корпоративных AI-агентов.
- Строить AI-агентов для DevOps и инфраструктуры на базе V4 Flash — модель подтверждённо работает в CLI
- Использовать Ante как независимый инструмент для аудита AI-моделей перед интеграцией
- Автоматизировать сложные многоступенчатые задачи в терминале (деплой, тестирование, мониторинг) с гарантией ~83% точности
- Предлагать проверку и валидацию бенчмарков как услугу для компаний, выбирающих AI-решения
- Модель чувствительна к харнесу — в другой инфраструктуре результат может упасть
- Terminal-Bench 2.1 — узкий набор задач, реальные кейсы могут быть сложнее
- Публичное API через OpenRouter может вести себя иначе, чем приватный доступ у крупных клиентов
Обычно производители AI-моделей немного приукрашивают результаты — то харнес особый, то промпт магический. Здесь автор независимого инструмента взял и проверил публично: тот же результат, все логи открыты. Это редкость, и это хороший знак.
Но есть нюанс: модель чувствительна к харнесу. То есть в вашей инфраструктуре цифры могут поплыть. Так что если собираетесь использовать V4 Flash для автоматизации в терминале — тестируйте на своих задачах. Зато теперь есть открытая конфигурация, с которой можно начать. Прозрачность становится дефицитом — DeepSeek пока держит планку.
Комментарии