Кто-то создал бенчмарк для LLM в виде боксёрского матча: модели дерутся в реальном времени
Разработчик запилил необычный бенчмарк для языковых моделей — виртуальный бокс с уличными правилами. LLM получают данные о матче (плюс визуальный поток при наличии зрения) и принимают решения: атаковать, блокировать, уворачиваться. Автор меряет скорость реакции, адаптивность стратегии и корректность действий вместо классических тестов на решение задач. Модели Gemini Flash уже умеют уклоняться и контратаковать, локальные модели на 5060Ti тормозят из-за медленного инференса.
Это показывает сдвиг от синтетических бенчмарков к практическим: важна не только точность ответов, но и скорость принятия решений под давлением. Релевантно для всех, кто строит AI-агентов в динамических средах.
Энтузиаст собрал бенчмарк, где LLM сражаются в виртуальном боксёрском ринге. Модели получают данные о текущем состоянии боя (позиция, здоровье, выносливость), а при наличии зрения — ещё и визуальный поток. Правила уличные: всё разрешено, поражение фиксируется либо после отсчёта рефери до 10, либо если модель получает 50% урона после нокаута.
Автор тестирует Gemini Flash (из-за скорости и vision-поддержки) — они уже додгят и контратакуют. Локальные модели на 5060Ti 8GB тормозят на инференсе, из-за чего возникает вопрос о введении time-scaling.
Метрики бенчмарка делятся на три группы: скорость и латентность (TPS, end-to-end latency, reaction latency при телеграфе противника), корректность действий (валидность tool calls, галлюцинации несуществующих приёмов, эффективность расхода стамины) и адаптивная стратегия (процент промахов, успешность блоков, контекстная релевантность — меняет ли модель тактику при 1% HP или продолжает агрессить).
Разработчик хочет превратить это в полноценный инструмент с чёткими метриками вместо скучных синтетических тестов. По его словам, модели иногда переоценивают себя перед нокаутом и выдают забавные реплики.
Автор: Марина Соколова · Источник: reddit.com
Разработчикам. Интересный подход к оценке latency и tool-calling под нагрузкой в реальном времени. Можно адаптировать методику для тестирования агентов в играх или симуляциях — меряешь не просто скорость генерации, а качество решений на коротких временных окнах. Vision-модели показывают потенциал в multimodal real-time сценариях.
Бизнесу. Геймификация бенчмарков может стать маркетинговым инструментом для демонстрации возможностей моделей. Подход релевантен для индустрии игр, симуляторов обучения и систем принятия решений в реальном времени (трейдинг, управление роботами). Метрики адаптивности и resource management применимы в финтехе и логистике.
Инвесторам. Ниша AI-агентов для real-time decision-making растёт. Если методика стандартизируется, может стать альтернативой классическим бенчмаркам для оценки практической применимости моделей в динамических средах. Потенциал в gaming AI, robotics, autonomous systems.
- Создать платформу для публичных AI-батлов с рейтингами моделей — стриминг, ставки, спонсорство от вендоров моделей
- Адаптировать методику для корпоративных бенчмарков: тестирование агентов в симуляциях бизнес-процессов (переговоры, crisis management)
- Запилить SaaS для A/B-тестирования промптов и моделей в игровых/симуляционных средах
- Продавать датасеты боёв и метрики моделям-вендорам для улучшения latency и tool-calling в real-time сценариях
- Создать образовательный контент вокруг AI-агентов: курсы, воркшопы, платные турниры для разработчиков
- Метрики сильно завязаны на конкретную физику симулятора — сложно сравнивать с другими бенчмарками, низкая стандартизация
- Локальные модели проигрывают по latency облачным — может создать перекос в результатах и не отражать реальное качество модели
- Риск превратиться в развлекательный контент без научной ценности — нужна валидация методологии сообществом
- Высокая зависимость от vision API и их стоимости, масштабирование тестов может влететь в копеечку
Идея свежая и прикольная, но пока это скорее proof of concept, чем серьёзный инструмент. Метрики вроде reaction latency и tool correctness реально полезны для real-time агентов, но нужна стандартизация методологии и сравнение с классическими бенчмарками. Иначе это просто забавный сайд-проект.
Главный инсайт тут не в самом боксе, а в том, что автор ставит вопрос: как тестировать модели в условиях, близких к реальным задачам? Если он откроет код и соберёт датасет боёв, может стать полезным инструментом для разработчиков агентов. Пока смотрим как на эксперимент с потенциалом, но без гарантий, что это зайдёт за пределы Reddit.
Комментарии