безопасность 2 мин

ИИ-чатботы ставят диагнозы по рентгену с пугающей уверенностью — даже когда ошибаются

Новый бенчмарк RadLE 2.0 проверяет, умеют ли ИИ-модели в радиологии признавать свою некомпетентность. Результаты тревожные: многие модели выдают неверные диагнозы с максимальной уверенностью, что опасно для пациентов. Лучшие AI набрали 758 баллов из 2000 против 988,7 у радиологов-людей.

Всё больше людей загружают рентгены и МРТ в чатботы и доверяют ответам. Если AI не умеет признавать незнание и выдаёт опасные диагнозы с полной уверенностью — это прямая угроза жизни пациентов.

Уверенность — не признак правоты

Команда CRASH Lab из Университета Ашока (Индия) выпустила вторую версию бенчмарка RadLE 2.0 — теста для ИИ-систем в радиологии. Задача: не просто поставить диагноз, но и понять границы своей компетентности. Модели должны были оценить уверенность по шкале от 0 до 4 и могли отвечать «я не знаю».

В тесте участвовало 200 клинических случаев, 16 моделей и панель радиологов-людей. Люди набрали 988,7 баллов из 2000, лучшая AI-модель — 758.

Система оценки наказывает за самоуверенность

Методика штрафует за уверенные ошибки и поощряет честность. Угадал с высокой уверенностью — полные баллы. Ошибся, но заявил «уверен на 100%» — минус столько же баллов. Сказал «не знаю» — ноль, но и не потерял ничего.

Итог: Claude Fable 5 (Anthropic) лидирует по надёжности и безопасности, Gemini 3 Pro (Google) — по точности, а Muse Spark 1.1 (Meta) лучше всех умеет отказываться от ответа. Последнее особенно важно: Meta недавно снизила галлюцинации модели почти вдвое именно за счёт того, что та чаще молчит вместо того, чтобы врать.

Проблема: модели обучены угадывать

Как отмечает недавнее цитируемое исследование, пока бенчмарки награждают только за точность, AI учатся гадать. В медицине уверенный неправильный диагноз опаснее честного «я не уверен».

Особенно плохи оказались open-weight модели и те, что специально обучались для медицины — они пытались ответить почти на каждый кейс, часто ошибались и делали это с максимальной уверенностью.

Реальность против хайпа

Исследователи обвиняют руководителей и инвесторов в публичном преувеличении возможностей AI. Заявления о том, что ИИ диагностирует лучше 99% врачей, базируются на анекдотах или симуляциях. Апрельское исследование 21 модели показало: они не готовы к клиническому использованию без надзора.

Отдельная опасность — потеря навыков у врачей. Польское исследование 2025 года: врачи, регулярно использующие AI при колоноскопиях, без инструмента стали выявлять на 21% меньше предраковых поражений (28,4% → 22,4%). Авторы называют это «эффектом Google Maps»: без навигатора пользователи теряются.

История повторяется

В 2016 году AI-исследователь Джеффри Хинтон заявил, что нужно прекратить обучать радиологов — deep learning скоро заменит их. Почти 10 лет спустя радиологи всё ещё перегружены работой, а Хинтон признал ошибку: он свёл профессию к анализу изображений и упустил её сложность.

CEO OpenAI Сэм Альтман годами пугал массовой заменой профессий AI, недавно развернулся на 180° — мол, AI создаёт больше рабочих мест. Исследования не подтверждают ни то, ни другое.

Ключевые выводы

  • Лучшие AI-модели набрали 758 баллов из 2000 против 988,7 у радиологов — разрыв всё ещё велик
  • Главная опасность — уверенные неправильные диагнозы, а не низкая точность
  • Модели, обученные на медицинских данных, пытаются отвечать на всё и чаще ошибаются с высокой уверенностью
  • Регулярное использование AI врачами ведёт к потере навыков («эффект Google Maps»): -21% точности без инструмента
  • AI-эксперты систематически переоценивают скорость замены профессий — как и их модели, не знают границ своей компетентности

Автор: Сергей Ефимов · Источник: the-decoder.com

Мнение редакции

Тут интересна сама постановка проблемы: бенчмарки годами награждали AI за точность, а теперь выяснилось, что в медицине важнее **умение сказать «не знаю»**. RadLE 2.0 — первый массовый тест, который штрафует за уверенные ошибки. И картина получилась неприглядная: модели, заточенные под медицину, лезут с диагнозами куда не просят и врут с апломбом.

Особенно иронично звучит на фоне предсказаний Хинтона 2016 года («прекратите учить радиологов!») и недавних кульбитов Альтмана про «AI создаёт рабочие места». Эксперты по AI так же плохо оценивают границы своей компетентности, как и их модели — не знают, когда лучше помолчать. А пациенты тем временем массово несут снимки в ChatGPT. Весело.

Ещё по теме

Комментарии