#LLM-агенты

И исследования ·21 июл 2026

Apple научила LLM-агентов работать с API без реальных сред — только на синтетике

Исследователи Apple разработали метод синтетической генерации данных для обучения LLM-агентов работе с API — без необходимости запускать реальные среды и базы данных. LLM сама создаёт разнообразные задачи, имитирует ответы API и фильтрует результат. Тесты на бенчмарках AppWorld и OfficeBench показали значительный прирост качества при дообучении на таких данных.

0 135
И исследования ·14 июл 2026

LLM-агенты провалили тест на командную игру: новый бенчмарк показал 6% успеха

Учёные протестировали 13 современных языковых моделей в новом бенчмарке на многоагентную координацию в открытом мире — агенты должны вместе исследовать локации, обмениваться ресурсами, крафтить предметы и сражаться с мобами. Большинство показали жалкие ~6% нормализованной отдачи, но Gemini 3.1 Pro в zero-shot режиме неожиданно сравнялся с лучшими MARL-агентами, обученными на миллиарде шагов. Ключевой вывод: координация — это отдельное узкое место, которое не решается просто долгим горизонтом планирования.

0 54