Apple научила LLM-агентов работать с API без реальных сред — только на синтетике
Исследователи Apple разработали метод синтетической генерации данных для обучения LLM-агентов работе с API — без необходимости запускать реальные среды и базы данных. LLM сама создаёт разнообразные задачи, имитирует ответы API и фильтрует результат. Тесты на бенчмарках AppWorld и OfficeBench показали значительный прирост качества при дообучении на таких данных.
Это снимает главный барьер для развития LLM-агентов: теперь можно быстро и дёшево обучать ИИ работе с любыми API, не разворачивая реальные сервисы. Для разработчиков это значит ускорение создания умных ассистентов и автоматизации, для индустрии — новый виток автономных агентов.
Проблема: дефицит данных для обучения API-агентов
Обучение LLM-агентов, способных вызывать API и решать сложные задачи (например, бронировать билеты, управлять проектами, искать информацию), требует огромных объёмов качественных траекторий взаимодействия. Традиционный подход — собирать данные в реальных средах с живыми API и заполненными базами данных — упирается в масштабируемость: развернуть и поддерживать такие окружения дорого и трудоёмко.
Решение: LLM как цифровой симулятор мира
Исследователи Apple Machine Learning предложили environment-free подход: генерировать синтетические данные без запуска реальных сред. На вход подаются только спецификации API.
Как это работает:
- Генерация задач. LLM создаёт разнообразные задачи, решаемые через предоставленные API.
- Симуляция взаимодействия. Агент-учитель (teacher agent) итеративно решает задачу, а LLM-симулятор генерирует правдоподобные ответы API с учётом контекста задачи и истории вызовов.
- Фильтрация. LLM-судья проверяет траектории и отсеивает некачественные данные.
Метод протестировали на сложных бенчмарках AppWorld и OfficeBench, включающих как информационный поиск, так и задачи с изменением состояния среды.
Результаты: реальный прирост без реальных сред
Дообучение моделей на синтетических данных показало значительный прирост производительности. Это доказывает, что качественный супервайзинг для API-агентов можно получить без исполняемых окружений.
Подход открывает путь к масштабируемому обучению агентов на разнообразных API-экосистемах: больше не нужно разворачивать инфраструктуру для каждого нового сервиса — достаточно спецификаций.
Контекст
Статья опубликована на EACL (апрель 2024). Ранее интерактивные цифровые агенты, обученные на инструкциях, справлялись менее чем с половиной задач в сложных бенчмарках. Новый метод Apple закрывает этот разрыв через умную генерацию синтетики.
Ключевые выводы
- Для обучения API-агентов больше не нужны реальные среды и базы данных — достаточно спецификаций API и LLM-симуляторов.
- Трёхступенчатый пайплайн (генерация задач → симуляция → фильтрация) обеспечивает качество синтетических траекторий без человеческой разметки.
- Дообучение на синтетике даёт значительный прирост на реальных бенчмарках (AppWorld, OfficeBench), включая state-changing задачи.
- Метод масштабируется на любые API-экосистемы без необходимости разворачивать инфраструктуру для каждого сервиса.
- LLM одновременно выступает генератором задач, симулятором среды и судьёй качества — трио ролей в одном.
Автор: Сергей Ефимов · Источник: machinelearning.apple.com
**Изящное решение проблемы курицы и яйца.** Чтобы научить агента звонить в API, нужны тысячи примеров взаимодействий. Но чтобы их собрать, нужны живые среды, базы данных, инфраструктура — дорого, долго, не масштабируется. Apple предлагает элегантный выход: пусть LLM сама себе нафантазирует задачи, сыграет роль API и проверит результат. Звучит как магия, но работает: модели, обученные на такой синтетике, показывают реальный прирост на бенчмарках.
Ключевой вопрос — насколько далеко можно зайти без реальной обратной связи от среды. Синтетика хороша для обучения базовым паттернам, но граничные случаи, баги API, неожиданные состояния систем — всё это LLM-симулятор может упустить. Тем не менее, для быстрого прототипирования и обучения на новых API это золотая жила. Особенно если учесть, что сейчас большинство агентов справляется с менее чем половиной задач в AppWorld — планка низкая, есть куда расти даже на синтетике.
Комментарии