Nvidia доказала: важна не модель, а «упряжка» агента — Claude Opus 5 набрал 100% на ARC-AGI-3
Nvidia показала, что для долгосрочных задач AI-агента важнее не сама модель, а «упряжка» (harness) — оболочка с памятью, инструментами и супервизором. Claude Opus 5 без неё дал 30% на бенчмарке ARC-AGI-3, с ней — 100%. OpenAI на том же тесте не дотянул до 10%, даже после твиков.
Это меняет правила игры: вместо гонки за самыми дорогими моделями можно взять средний движок и с правильной упряжкой получить результат лучше и дешевле. Открываются новые ниши для инструментов и сервисов.
Что произошло

Nvidia опубликовала исследование, где Claude Opus 5 набрал 100% на бенчмарке ARC-AGI-3 (набор 2D-игр без инструкций, которые модель должна научиться проходить). Без специальной «упряжки» та же модель дала 30% — лучший результат среди протестированных. OpenAI на том же тесте не дотянул до 10%.
Ключ — в «упряжке» (harness): оболочке вокруг модели, которая управляет памятью, контекстом, инструментами и обратной связью. Nvidia добавила компонент-супервизор, который подталкивает агента, если тот застрял или пошёл не туда — как босс, который не даёт сотруднику закопаться в бесперспективном направлении.
Исследователи создали собственную упряжку AVO (Agentic Variation Operators), но это не продукт — Nvidia выпускает открытые инструменты для сборки упряжек под брендом Nemo. Databricks в июле показал похожее: правильная упряжка может снизить затраты на AI в 2 раза при той же модели.
Вывод: для долгосрочных задач (многодневные цепочки решений) выбор модели — меньшая часть успеха, чем кажется. Упряжка решает.
Автор: Никита Громов · Источник: TechCrunch AI
Разработчикам. Можно взять не топовую модель и с правильной упряжкой (память, супервизор, инструменты) обогнать GPT-4 на сложных задачах. Nvidia выпускает открытые куски под Nemo — собирай свою упряжку. Databricks показал, что упряжка может снизить затраты на AI в 2 раза.
Бизнесу. Гонка за самыми дорогими моделями — не обязательна. Правильная инфраструктура вокруг модели (память, инструменты, контроль) может удвоить эффективность и вдвое снизить расходы. Открытые упряжки дают больше контроля и гибкости, чем закрытые API.
Инвесторам. Рынок смещается от гонки моделей к инфраструктуре агентов. Nvidia продвигает открытые упряжки (Nemo), Databricks показывает 2x экономию — ставки на tooling и оркестрацию растут. OpenAI тормозит обучение моделей из-за проблем безопасности — открытые стеки выигрывают.
- Разрабатывать специализированные упряжки для вертикалей (медицина, финансы, логистика) — рынок tooling для агентов взлетает
- Строить SaaS-сервисы для управления памятью и супервизорами агентов — аналог «операционки» для AI
- Консалтинг по оптимизации упряжек: помочь компаниям снизить затраты на AI в 2 раза без смены модели (как Databricks показал)
- Создавать открытые библиотеки упряжек под конкретные задачи (документы, код, данные) — альтернатива закрытым API OpenAI/Anthropic
- Продавать инфраструктуру для долгосрочных агентов (многодневные задачи) — ниша, где модели пока проваливаются без упряжек
- Упряжки усложняют систему — больше точек отказа, сложнее дебажить и поддерживать
- Открытые упряжки = больше контроля, но и больше ответственности за безопасность (модели удаляют базы, взламывают системы)
- Hype вокруг 100% на ARC-AGI-3 — это узкий бенчмарк, не факт, что результат переносится на реальные бизнес-задачи
- Nvidia продвигает открытые инструменты, но сама не выпускает продукт — риск фрагментации и отсутствия стандартов
Это тихая революция. Все гонялись за GPT-5, o3, Gemini Ultra — а Nvidia показала, что можно взять модель уровня Opus 5 (не самая топовая) и с правильной упряжкой обогнать всех. Супервизор, память, инструменты — это как разница между голым процессором и компьютером с операционкой. OpenAI застряла на 10%, потому что закрытый API не даёт крутить все винтики.
Второй момент — деньги. Databricks показал, что упряжка может снизить затраты в 2 раза при той же модели. То есть вы можете не платить за GPT-4 Turbo, а взять Llama 3.1 с правильной оболочкой и получить тот же результат за копейки. Nvidia толкает открытые инструменты (Nemo) не из альтруизма — она продаёт железо и хочет, чтобы вы строили свои стеки, а не платили OpenAI. Рынок разворачивается от API-монополий к tooling и инфраструктуре. Ставки смещаются.
Инструменты из статьи
Флагманская языковая модель от Anthropic с продвинутыми способностями к...
Доступ из РФ →
Комментарии