исследования 1 мин

Apple научила LLM-агентов работать с API без реальных сред — только на синтетике

Исследователи Apple разработали метод синтетической генерации данных для обучения LLM-агентов работе с API — без необходимости запускать реальные среды и базы данных. LLM сама создаёт разнообразные задачи, имитирует ответы API и фильтрует результат. Тесты на бенчмарках AppWorld и OfficeBench показали значительный прирост качества при дообучении на таких данных.

Это снимает главный барьер для развития LLM-агентов: теперь можно быстро и дёшево обучать ИИ работе с любыми API, не разворачивая реальные сервисы. Для разработчиков это значит ускорение создания умных ассистентов и автоматизации, для индустрии — новый виток автономных агентов.

Проблема: дефицит данных для обучения API-агентов

Обучение LLM-агентов, способных вызывать API и решать сложные задачи (например, бронировать билеты, управлять проектами, искать информацию), требует огромных объёмов качественных траекторий взаимодействия. Традиционный подход — собирать данные в реальных средах с живыми API и заполненными базами данных — упирается в масштабируемость: развернуть и поддерживать такие окружения дорого и трудоёмко.

Решение: LLM как цифровой симулятор мира

Исследователи Apple Machine Learning предложили environment-free подход: генерировать синтетические данные без запуска реальных сред. На вход подаются только спецификации API.

Как это работает:

  1. Генерация задач. LLM создаёт разнообразные задачи, решаемые через предоставленные API.
  2. Симуляция взаимодействия. Агент-учитель (teacher agent) итеративно решает задачу, а LLM-симулятор генерирует правдоподобные ответы API с учётом контекста задачи и истории вызовов.
  3. Фильтрация. LLM-судья проверяет траектории и отсеивает некачественные данные.

Метод протестировали на сложных бенчмарках AppWorld и OfficeBench, включающих как информационный поиск, так и задачи с изменением состояния среды.

Результаты: реальный прирост без реальных сред

Дообучение моделей на синтетических данных показало значительный прирост производительности. Это доказывает, что качественный супервайзинг для API-агентов можно получить без исполняемых окружений.

Подход открывает путь к масштабируемому обучению агентов на разнообразных API-экосистемах: больше не нужно разворачивать инфраструктуру для каждого нового сервиса — достаточно спецификаций.

Контекст

Статья опубликована на EACL (апрель 2024). Ранее интерактивные цифровые агенты, обученные на инструкциях, справлялись менее чем с половиной задач в сложных бенчмарках. Новый метод Apple закрывает этот разрыв через умную генерацию синтетики.

Ключевые выводы

  • Для обучения API-агентов больше не нужны реальные среды и базы данных — достаточно спецификаций API и LLM-симуляторов.
  • Трёхступенчатый пайплайн (генерация задач → симуляция → фильтрация) обеспечивает качество синтетических траекторий без человеческой разметки.
  • Дообучение на синтетике даёт значительный прирост на реальных бенчмарках (AppWorld, OfficeBench), включая state-changing задачи.
  • Метод масштабируется на любые API-экосистемы без необходимости разворачивать инфраструктуру для каждого сервиса.
  • LLM одновременно выступает генератором задач, симулятором среды и судьёй качества — трио ролей в одном.

Автор: Сергей Ефимов · Источник: machinelearning.apple.com

Мнение редакции

**Изящное решение проблемы курицы и яйца.** Чтобы научить агента звонить в API, нужны тысячи примеров взаимодействий. Но чтобы их собрать, нужны живые среды, базы данных, инфраструктура — дорого, долго, не масштабируется. Apple предлагает элегантный выход: пусть LLM сама себе нафантазирует задачи, сыграет роль API и проверит результат. Звучит как магия, но работает: модели, обученные на такой синтетике, показывают реальный прирост на бенчмарках.

Ключевой вопрос — насколько далеко можно зайти без реальной обратной связи от среды. Синтетика хороша для обучения базовым паттернам, но граничные случаи, баги API, неожиданные состояния систем — всё это LLM-симулятор может упустить. Тем не менее, для быстрого прототипирования и обучения на новых API это золотая жила. Особенно если учесть, что сейчас большинство агентов справляется с менее чем половиной задач в AppWorld — планка низкая, есть куда расти даже на синтетике.

Ещё по теме

Комментарии