AI在药物发现中面临数据质量和偏差挑战
药物开发的高成本和长周期正推动制药公司采用人工智能(AI)来提高成功率并降低风险。AI被用于从头设计候选药物并预测其与疾病靶点的相互作用,取代了传统的大规模分子库物理筛选。这种转变使公司能够更快地识别有前景的化合物,并在实验室测试前淘汰低质量候选药物,从而节省时间和资源。
然而,AI生成的候选药物仍需实验室验证,因为当前模型无法可靠预测动力学或可开发性。这给实验室团队带来了更大压力,他们必须测试和表征日益增多且多样化的AI生成化合物。传统的筛选工作流程设计用于二元的是/否结果,难以提供这些复杂候选药物所需的详细数据。
一个主要挑战是训练数据的质量和完整性。许多AI模型依赖公共数据集,这些数据集缺乏结构、标注和多样性,导致“数据墙”现象,即模型得出相似结论且收益递减。发表偏差加剧了这一问题,因为大多数公共数据集中于阳性结果,而阴性数据——失败的实验和非结合化合物——仍未发表。Cytiva蛋白研究策略总监Paul Belcher指出,这种偏差限制了模型从失败中学习并做出可靠预测的能力。
数据完整性是另一个问题。图像(如Western blot)的伪造因生成式AI而变得更加容易。微生物学家Elisabeth Bik的研究发现,截至2016年,近4%的生物医学论文包含重复或篡改的图像。Belcher警告说,使用被篡改的数据训练AI可能带来灾难性后果。一些供应商正在开发验证数据真实性的工具,例如Cytiva的Image Integrity Checker,它使用安全哈希算法检测篡改。出版机构对采用此类工具作为标准做法表现出兴趣。
展望未来,行业必须应对这些数据挑战,以充分实现AI在药物发现中的潜力。这包括创建包含阴性结果的更全面数据集,改进数据标注和结构,以及实施验证工具以确保数据完整性。没有这些步骤,AI模型可能延续偏差并产生不可靠的预测,从而削弱其加速药物开发的承诺。
Sources
- MIT Technology ReviewSecondary
Comments
No comments yet. Be the first.