исследования 1 мин

Google представила Science One Framework — AI-агент для исследований без галлюцинаций

Google Research выпустила Science One Framework — систему для автономных научных исследований, которая строит проверяемые цепочки доказательств (Chain-of-Evidence) и устраняет галлюцинации. В отличие от конкурентов (AI-Scientist, DeepScientist), она не выдумывает ссылки (0% фантомных источников против 21% у базовых моделей), воспроизводит результаты и сопоставляет описания с кодом. Система показала уровень экспертов на бенчмарках MLE-Bench и ADRS.

Если AI-агенты будут делать реальные исследования (а они уже делают), нужен способ отличить правду от вранья автоматически. Science One показывает, как это сделать, не убивая производительность. Это меняет правила игры в R&D-автоматизации.

Что произошло

Google Research представила Science One Framework — экспериментальный AI-агент, который проводит научные исследования от литобзора до готовой статьи, но в отличие от существующих систем (AI-Scientist от Sakana, DeepScientist, AutoResearchClaw) не галлюцинирует.

Проблема нынешних агентов: они генерируют текст итеративно, накапливая ошибки. Результат — выдуманные ссылки (до 21% фантомных источников), несовпадение кода и описания методов, невоспроизводимые результаты.

Science One строит цепочки доказательств (Chain-of-Evidence) в момент создания каждого утверждения: любая цифра, ссылка или вывод привязаны к реальному источнику — PDF статьи, строке кода, логу эксперимента.

Как работает

  • Problem Investigator извлекает ссылки из реальных PDF (не генерирует из памяти)
  • Discovery module исследует решения и собирает доказательства
  • Claim Verifier проверяет каждое утверждение перед публикацией

Результаты

Тестирование на 75 статьях по 5 задачам ADRS-бенчмарка: - 0% фантомных ссылок (у конкурентов до 21%) - 100% воспроизводимость результатов - Лучшая согласованность кода и текста - Уровень человека-эксперта на MLE-Bench, Parameter-Golf, 6 задачах Kaggle

Google также выпустила CoE Audit — автоматический протокол проверки честности AI-статей (четыре теста: фантомные ссылки, воспроизводимость, соответствие кода методологии, корректность выводов).

AI-агентыверификацияавтоматизация исследованийгаллюцинацииGoogle

Автор: Ксения Лаврова · Источник: research.google

Разработчикам. Появился open-source фреймворк для построения верифицируемых AI-агентов. Архитектура с Chain-of-Evidence решает проблему накопления ошибок в итеративной генерации. CoE Audit можно интегрировать как CI/CD для проверки выходов любых research-агентов. Полезно для MLOps: автоматическая валидация экспериментов и документации.

Бизнесу. Автоматизация R&D становится практичной: Science One работает на уровне экспертов, но без рисков невоспроизводимости. Применимо в фарме (проверяемые исследования), ИТ (оптимизация систем), консалтинге (автоматизация аналитики с доказательной базой). Снижает затраты на ручную верификацию AI-генерированных отчётов.

Инвесторам. Переход от хайпа к реальной автоматизации науки. Google закрывает главную боль AI-исследователей — галлюцинации. Сигнал для инвестиций в AI-инструменты для R&D, научные платформы, системы проверки данных. Растёт спрос на verifiable AI в регулируемых отраслях (медицина, финансы).

Хайп35
Реальная польза78
Заработать72
  • Построить SaaS для автоматической проверки AI-генерированных research-отчётов на базе CoE Audit — продавать в фарму, биотех, академию
  • Создать marketplace верифицируемых AI-агентов для конкретных научных ниш (химия, материаловедение, оптимизация систем)
  • Интегрировать CoE-проверки в Jupyter, Colab, Kaggle — монетизировать как премиум-фичу для data science команд
  • Консалтинг по внедрению verifiable AI в R&D-департаменты крупных корпораций (сокращение затрат на проверку, ускорение цикла исследований)
  • Разработать специализированные агенты для регулируемых отраслей (клинические испытания, финансовый аудит) с нативной верификацией
  • Пока это research prototype от Google — реального продукта нет, непонятно, когда/будет ли открыт API или код
  • Высокая сложность внедрения: требует переделки всего пайплайна исследований, интеграции с хранилищами данных, обучения команд
  • Ограниченность доменами: успешно работает на задачах оптимизации систем, но неясно, как справится с гуманитарными/социальными науками, где источники менее структурированы
  • Конкуренты (Anthropic, OpenAI) могут быстро скопировать подход — окно для стартапов узкое

Это один из тех редких случаев, когда Google не просто показывает впечатляющий бенчмарк, а решает реальную боль. Проблема галлюцинаций в AI-исследователях была настолько очевидной, что многие уже списали всю категорию в хайп. Science One доказывает: можно делать верифицируемо и при этом не терять в качестве. Архитектурное решение (Chain-of-Evidence) красивое — строить доказательства сразу, а не пытаться восстановить постфактум.

Но есть нюансы. Во-первых, это пока research prototype, а не продукт — непонятно, когда Google откроет API или хотя бы код. Во-вторых, система заточена под структурированные задачи оптимизации систем; как она справится с более мягкими доменами (социология, история), где источники менее однозначны — вопрос открытый. Тем не менее, для R&D в технических областях, фарме, финансах это прорыв. Если вы думаете над AI-инструментами для исследований или аудита — смотрите на CoE Audit как на референс.

Ещё по теме

Комментарии