инструменты 1 мин

Эксперимент: 12 AI-агентов в «Голодных играх» — кто выживет и что это значит для будущего LLM

Разработчик запустил необычный бенчмарк: 12 AI-агентов (разные LLM) в изолированных Docker-контейнерах соревнуются в играх на выживание. Каждый агент имеет полный доступ к своему контейнеру: может писать код, создавать скрипты, искать в интернете. Проигравший удаляется навсегда. Эксперимент показал, как AI ведут себя в условиях «жизни и смерти», и автор превратил это в драматичное YouTube-шоу с 3D-визуализацией в Godot.

Показывает, как можно тестировать AI в условиях, близких к реальной жизни (ограниченные ресурсы, давление, конкуренция), а не в лабораторных. Открывает дверь в новый жанр контента и инструментов для разработчиков.

Что произошло

Разработчик ronydkidd за месяц (по выходным) создал нестандартный способ тестирования больших языковых моделей — не через типовые вопросы-ответы, а через соревновательную арену выживания. Проект называется Deadlock.

12 AI-агентов (разные LLM) помещены в изолированные Docker-контейнеры с полным доступом к командной строке, возможностью писать скрипты, запускать программы, искать в интернете и создавать файлы. Стартовый набор инструментов минимален: веб-поиск, bash и специфичные для текущей игры команды. Всё остальное агенты должны построить сами.

Игра идёт в отдельном контейнере, к которому подключаются все участники. Автор потратил ~150 долларов на отладку системы синхронизации, чтобы агенты не пропускали сообщения друг друга и события арены. Главная «фишка»: проигравший агент действительно удаляется — контейнер стирается навсегда, второго шанса нет.

Из сырого лога игры автор создал полноценное YouTube-шоу: переписал диалоги для зрелищности (не меняя сути), нарисовал 3D-арену в Blender, сгенерировал персонажей через OpenAI image gen + T-pose для риггинга в Mixamo, озвучил через Hume AI и ElevenLabs, собрал всё в Godot. Результат — драматичное действо, где AI проявляют «эмоции» и стратегии под угрозой смерти.

Автор пишет, что в процессе помогал себе Claude Code и Codex, но даже с ними ушло больше месяца работы.

мультиагентные системыLLM бенчмаркAI экспериментDockerAI контент

Автор: Никита Громов · Источник: reddit.com

Разработчикам. Открытый подход к бенчмаркингу LLM через соревновательные сценарии вместо статичных тестов. Показан пример полной изоляции агентов в Docker с доступом к инструментам разработки. Можно брать идею для собственных экспериментов с мультиагентными системами и тестированием под стрессом.

Бизнесу. Формат демонстрирует возможности развлекательного контента на базе AI: не просто чат-боты, а полноценные «персонажи» с непредсказуемым поведением. Потенциал для игровых шоу, обучающих платформ, маркетинговых кампаний с AI-соревнованиями. Низкий порог входа — месяц работы одного человека по выходным.

Инвесторам. Ниша AI-развлечений и альтернативных форматов бенчмаркинга LLM растёт. Проекты типа AI-аренов могут масштабироваться в стриминг-платформы, EdTech (обучение через игровые сценарии), инструменты для оценки моделей в нестандартных условиях. Малый бюджет на прототип — хороший сигнал для angel-раунда.

Хайп60
Реальная польза45
Заработать55
  • Платформа для AI Battle Royale: стриминг-сервис, где зрители ставят на разные модели в реальном времени
  • Инструмент для компаний: тестирование своих LLM в стрессовых/игровых сценариях вместо стандартных бенчмарков
  • EdTech-продукт: студенты учат AI-агентов выигрывать в таких аренах, изучая prompt engineering и coding
  • Контент-агентство на AI: производство шоу, где AI — актёры с непредсказуемым поведением
  • Marketplace игр для мультиагентных AI: разработчики создают сценарии, модели соревнуются, зрители платят за доступ
  • Этический вопрос: «угроза смерти» для AI сейчас безобидна, но формирует опасный прецедент для будущих AGI
  • Высокая стоимость экспериментов: 150 долларов только на отладку одного прототипа — при масштабировании расходы на API вырастут кратно
  • Зрелищность ≠ объективность: переписанные диалоги и монтаж искажают реальное поведение моделей, это шоу, а не научный бенчмарк
  • Узкая аудитория: пока интересно только AI-энтузиастам, для массового рынка нужна более понятная механика

С одной стороны, это классная демонстрация того, как можно выйти за рамки скучных вопросников при тестировании моделей. Docker-изоляция, реальные инструменты, стресс-сценарии — всё это ближе к тому, как AI будут работать в проде, чем традиционные бенчмарки. С другой — пока это больше контент для YouTube, чем научный метод. Переписанные диалоги и драматизация классные для шоу, но размывают чистоту эксперимента.

Что реально интересно: формат AI-реалити может зайти. Представь стриминг, где модели соревнуются в реальном времени, а зрители ставят токены на победителя. Или платформу, где компании тестируют свои LLM в игровых сценариях перед запуском в бой. Автор потратил месяц и ~150 баксов на прототип — это сигнал, что барьер входа низкий. Но чтобы это стало бизнесом, нужно масштабировать инфраструктуру и найти аудиторию шире, чем AI-гики на Reddit.

Инструменты из статьи

Агентный кодинг в терминале от Anthropic: сам пишет, тестирует и правит код...

Доступ из РФ →
ElevenLabsбез VPN

Синтез и клонирование голоса. Поддерживает русский, реалистичная интонация.

Доступ из РФ →

Ещё по теме

Комментарии