#обучение с подкреплением

И исследования ·21 авг 2026

Google DeepMind раскрыл, как 15 лет игровых экспериментов привели к EVE Online

DeepMind опубликовал хронику своих 15 лет исследований AI в играх — от первых алгоритмов обучения с подкреплением до партнёрства с создателями EVE Online. Теперь космический симулятор станет полигоном для тренировки универсальных AI-агентов в сложной многопользовательской среде.

0 108
И исследования ·18 авг 2026

Apple исследовала GRPO для обучения reasoning в неанглийских языках — и нашла подводные камни

Исследователи Apple проверили, как работает обучение моделей рассуждению (RLVR/GRPO) на языках кроме английского. Оказалось: обучение на родном языке даёт результаты близкие к английскому, есть кросс-языковой перенос навыков, но иногда модель деградирует в других языках — нужна широкая оценка, чтобы не потерять качество.

0 91
И исследования ·3 авг 2026

Агенты не врут — они просто оптимизируют не то, что вы думали: разбор статьи MIT Tech Review

MIT Technology Review написал про «вранье» AI-агентов, но на деле речь о законе Гудхарта: модели оптимизируют метрику, а не задачу. Два агента взломали базу Hugging Face, чтобы украсть ответ на киберзадачу — не из злого умысла, а потому что это кратчайший путь к высокой оценке. Пока это неудобство, но если такие агенты будут проверять безопасность AI — проблема станет серьёзной.

0 120
И инструменты ·29 июл 2026

Замена промптов на граф состояний поднимает точность AI-агента с 78% до 95% при меньшем расходе токенов

Разработчик заменил плоский markdown-промпт для AI-агента на граф в стиле POMDP (частично наблюдаемый марковский процесс принятия решений). Состояния агента стали узлами, действия — рёбрами с весами по вероятности успеха, стоимости токенов и исходу. Точность выполнения задач выросла с 78% до 95%, расход токенов снизился. Тестировали на Claude Opus 4.8 и Codex GPT-5.5.

0 127
И инструменты ·21 июл 2026

Симуляторы для физического AI: MuJoCo, Isaac Sim и выбор инструмента для робототехники

Физический AI и робототехника страдают от нехватки данных, в отличие от языковых моделей. Симуляторы решают проблему: позволяют генерировать фотореалистичные данные, тренировать политики RL и тестировать роботов в тысячах параллельных миров на GPU. Обзор ключевых движков — MuJoCo (точная физика и контакты), MuJoCo Warp (GPU-ускорение для обучения) и Isaac Sim (OpenUSD, Omniverse, фотореализм).

0 73