исследования 1 мин

Почему AI в фармацевтике упёрся в стену из недостающих данных

AI ускоряет поиск новых лекарств, но столкнулся с фундаментальной проблемой: модели учатся только на успехах, игнорируя провалы. Публичные датасеты исчерпаны, негативные результаты никто не публикует, а фейковые данные стали генерировать проще. Без полных, качественных данных — включая неудачи — AI рискует повторять одни и те же ошибки.

AI обещает революцию в фармацевтике, но успех упирается в данные: без полных датасетов (включая провалы) и защиты от фейков модели будут повторять чужие ошибки. Это тормозит разработку лекарств, которые могли бы спасать жизни.

Фармацевтика ставит на AI — но данных не хватает

Вывести новое лекарство на рынок сегодня стоит $1–2,5 млрд и занимает 10–15 лет, при этом 90% кандидатов проваливаются. Индустрия делает ставку на искусственный интеллект, чтобы сократить время и риски: AI помогает предсказывать, какие молекулы сработают, ещё до физических тестов.

Как это работает. Вместо тестирования сотен тысяч соединений в лабораториях компании используют AI для дизайна молекул с нуля. Модели предсказывают, как кандидат свяжется с целевым белком, отсеивая слабые варианты до начала экспериментов.

Но есть нюанс: AI не умеет предсказывать кинетику или «производимость» молекул — всё равно нужна валидация в лаборатории. Это создаёт бутылочное горлышко: AI генерирует больше кандидатов, лаборатории не успевают их проверять.

Проблема: все модели учатся на одном и том же

Пол Белчер из Cytiva называет это «стеной данных». Открытые датасеты исчерпаны — все модели видели одно и то же, выводы одинаковые, прогресс стопорится. Хуже того: эти данные изначально не проектировались для AI — нет структуры, разметки, разнообразия.

Главная дыра — провалы не публикуются. Научные журналы печатают только успехи. Неудачные эксперименты остаются в лабораторных тетрадях и никогда не используются для обучения моделей. «Мы шутим, что нужен журнал негативных данных», — говорит Белчер. Без знания о том, что не работает, модели не могут избегать ошибок — они просто не знают, чего избегать.

Фейковые данные: новая головная боль

С появлением генеративного AI подделать научные изображения стало элементарно. Ещё в 2016 году микробиолог Элизабет Бик нашла манипуляции в 4% биомедицинских статей — до эпохи генеративок. Сейчас риски выше: если модель обучается на фейковых данных, последствия могут быть катастрофическими.

Вендоры начинают внедрять защиту. Cytiva, например, использует блокчейн-хеши для проверки целостности изображений — интерес проявляют научные издательства.

Вывод: AI в фармацевтике работает, но упёрся в качество и полноту данных. Без доступа к негативным результатам и без инструментов проверки подлинности модели рискуют повторять одни и те же ошибки. Закрыть этот цикл данных — следующий критический шаг для индустрии.

Ключевые выводы

  • AI в фармацевтике сдвигает поиск лекарств от физического скрининга к предиктивному дизайну молекул, но не может пока предсказать кинетику — валидация в лаборатории всё равно нужна
  • Все модели обучаются на одних публичных датасетах и упёрлись в «стену данных» — прогресс стопорится из-за отсутствия разнообразия
  • Негативные результаты (провалы экспериментов) почти никогда не публикуются, но именно они нужны AI, чтобы избегать ошибок, а не только находить успехи
  • Генеративный AI сделал подделку научных данных тривиальной задачей — индустрия начинает внедрять блокчейн-проверки целостности
  • Рост числа AI-кандидатов перегружает лаборатории: старые методы не справляются с проверкой сложных, разнообразных молекул
фармацевтикаdrug-discoveryкачество-данныхнаучная-публикацияподделка-данных

Автор: Сергей Ефимов · Источник: technologyreview.com

Мнение редакции

История знакомая: AI врывается в индустрию, обещает чудеса, упирается в банальность — мусор на входе, мусор на выходе. Только тут цена ошибки — миллиарды долларов и годы разработки лекарств.

Интересно другое: индустрия осознала, что проблема не в моделях, а в культуре науки. Никто не хочет делиться провалами — это не котируется, не публикуется, не финансируется. Получается замкнутый круг: AI видит только половину картины (успехи), а вторую половину (почему не сработало) прячут в лабораторных тетрадях. Плюс теперь нейросети сами генерируют фейковые данные — и отличить их от реальных без блокчейн-проверок невозможно. Фармацевты поставили на AI большие деньги, но без «журнала негативных данных» (как они сами шутят) эта ставка рискует не окупиться. Закрыть цикл данных — включить провалы в обучение — это не технический, а культурный сдвиг. Пока не видно, кто готов первым открыть свои скелеты из шкафа.

Ещё по теме

Комментарии