SymptomAI от Google: ИИ ставит диагнозы точнее врачей в половине случаев
Google Research провёл масштабное исследование (почти 14 тысяч участников) конверсационного ИИ-агента SymptomAI на базе Gemini Flash 2.0, который собирает анамнез и составляет дифференциальный диагноз. Панель врачей в слепом тесте чаще предпочитала диагнозы ИИ, чем коллег-клиницистов. Точность подтверждали данные с носимых устройств Fitbit.
Это первое реальное доказательство, что LLM могут проводить клиническое интервью на уровне врачей, а не только решать учебные задачки. Если масштабировать — это способ дать качественную первичную диагностику миллионам людей, у которых нет быстрого доступа к врачу.
SymptomAI от Google: ИИ ставит диагнозы точнее врачей в половине случаев

Google Research представил результаты первого в своём роде масштабного исследования конверсационного ИИ-агента для сбора анамнеза и составления дифференциального диагноза. В эксперименте приняли участие 13 917 добровольцев, каждый из которых описывал свои симптомы одной из пяти версий SymptomAI — агента на базе Gemini Flash 2.0.
Как работал эксперимент

Участники в случайном порядке получали доступ к одной из пяти версий агента с разной степенью гибкости ведения диалога: от полностью свободного опроса до строгого следования каноническим вопросам из медицинских учебников. Агент задавал уточняющие вопросы и в конце выдавал список возможных диагнозов (дифференциальный диагноз, DDx) и рекомендации.
Через две недели участников просили сообщить реальный диагноз, поставленный их лечащим врачом. Параллельно панель из трёх сертифицированных клиницистов изучила транскрипты бесед и составила собственные списки диагнозов, не зная, что генерировал ИИ, а что — коллеги.
Результаты: ИИ не уступает врачам
В слепом тесте клиницисты чаще выбирали DDx от SymptomAI, чем списки, составленные другими врачами. По метрике top-5 accuracy (попадание реального диагноза в пятёрку предложенных) ИИ-агент также показал результат выше или на уровне человеческих оценок.
Дополнительная валидация пришла от данных носимых устройств Fitbit: разговоры, завершившиеся диагнозом инфекционного заболевания, коррелировали с физиологическими трендами, указывающими на иммунный ответ (лихорадка, изменение пульса).
Почему это важно
Исследование впервые проверяет диагностические способности LLM не на идеальных учебных кейсах, а на реальных пациентах с разной медицинской грамотностью, неполной информацией и естественной речью. Это шаг к ИИ-инструментам, способным снизить барьеры доступа к качественному медицинскому опросу — финансовые, географические, системные.
Важно: все диагнозы генерировались исключительно для исследовательских целей и не представляли собой клинических заключений.
Ключевые выводы
- SymptomAI на базе Gemini Flash 2.0 в слепом тесте превзошёл или сравнялся с клиницистами по качеству дифференциальных диагнозов
- Исследование впервые проверило LLM на реальных пациентах (n=13 917) вместо синтетических медкейсов
- Точность диагнозов подтвердили данные с носимых Fitbit — физиологические тренды совпали с инфекционными диагнозами ИИ
- Разные подходы к интервью (свободный vs. структурированный) дали разные результаты — гибкость не всегда лучше
- Результаты открывают путь к более доступной первичной медпомощи через ИИ-агентов
Автор: Артём Ковалёв · Источник: research.google
Это действительно серьёзная работа, а не очередной бенчмарк на учебных кейсах. Google взял почти 14 тысяч живых людей, дал им поговорить с ИИ про симптомы, а потом сравнил с реальными диагнозами от врачей. И ИИ не провалился — в слепом тесте клиницисты чаще выбирали его варианты, чем списки коллег. Плюс данные с фитнес-трекеров подтвердили: когда ИИ говорил «инфекция», у пациента действительно скакала температура и пульс.
Но есть нюансы. Во-первых, это исследование, а не продукт — все диагнозы генерировались только для анализа. Во-вторых, пока непонятно, как это работает на сложных случаях и редких болезнях. И главное — медицинский ИИ всегда будет политическим минным полем: ошибся врач — человеческий фактор, ошибся ИИ — скандал и иски. Но как инструмент для первичного скрининга или помощи в регионах без врачей — это реально может изменить доступ к медицине.
Комментарии