Наука

ИИ в открытии лекарств сталкивается с проблемами качества данных и предвзятости

2 min read

ИИ в открытии лекарств сталкивается с проблемами качества данных и предвзятости
Photo: Logan Gutierrez · Unsplash
0 0
XWhatsAppTelegramLinkedIn

Высокая стоимость и длительные сроки разработки лекарств побуждают фармацевтические компании внедрять искусственный интеллект (ИИ) для повышения успешности и снижения рисков. ИИ используется для создания кандидатов в лекарства с нуля и прогнозирования их взаимодействия с мишенями заболеваний, заменяя традиционный физический скрининг огромных молекулярных библиотек. Этот сдвиг позволяет компаниям быстрее выявлять перспективные соединения и отсеивать низкокачественные кандидаты до лабораторных испытаний, экономя время и ресурсы.

Однако кандидаты, созданные ИИ, все еще требуют лабораторной валидации, поскольку текущие модели не могут надежно предсказывать кинетику или разрабатываемость. Это увеличило нагрузку на лабораторные группы, которые должны тестировать и характеризовать растущий объем разнообразных соединений, созданных ИИ. Традиционные рабочие процессы скрининга, рассчитанные на бинарные результаты «да/нет», с трудом обеспечивают детальные данные, необходимые для этих сложных кандидатов.

Основная проблема — качество и полнота обучающих данных. Многие модели ИИ полагаются на общедоступные наборы данных, которым не хватает структуры, маркировки и разнообразия, что приводит к «стене данных», когда модели приходят к схожим выводам с убывающей отдачей. Публикационная предвзятость усугубляет это, так как большинство общедоступных данных сосредоточено на положительных результатах, в то время как отрицательные данные — неудачные эксперименты и несвязывающиеся соединения — остаются неопубликованными. Пол Белчер, директор по стратегии белковых исследований в Cytiva, отмечает, что эта предвзятость ограничивает способность моделей учиться на неудачах и делать надежные прогнозы.

Целостность данных — еще одна проблема. Фальсификация изображений, таких как вестерн-блоты, стала проще с помощью генеративного ИИ. Исследование микробиолога Элизабет Бик показало, что почти 4% биомедицинских статей по состоянию на 2016 год содержали дублированные или манипулированные изображения. Белчер предупреждает, что манипулированные данные, используемые для обучения ИИ, могут иметь катастрофические последствия. Некоторые поставщики разрабатывают инструменты для проверки подлинности данных, такие как Image Integrity Checker от Cytiva, который использует безопасные хэш-алгоритмы для обнаружения подделок. Издательства проявляют интерес к внедрению таких инструментов в качестве стандартной практики.

Заглядывая вперед, отрасль должна решить эти проблемы с данными, чтобы полностью реализовать потенциал ИИ в открытии лекарств. Это включает создание более полных наборов данных, включающих отрицательные результаты, улучшение маркировки и структуры данных, а также внедрение инструментов верификации для обеспечения целостности данных. Без этих шагов модели ИИ рискуют увековечить предвзятость и давать ненадежные прогнозы, подрывая их обещание ускорить разработку лекарств.

Sources

Report / request removal

Related

Comments

No comments yet. Be the first.