AI創薬におけるデータ品質とバイアスの課題
医薬品開発の高コストと長い期間が、製薬企業に人工知能(AI)を導入させ、成功率向上とリスク低減を促している。AIは、膨大な分子ライブラリーの従来の物理的スクリーニングに代わり、薬剤候補をゼロから設計し、疾患標的との相互作用を予測するために使用されている。このシフトにより、企業は有望な化合物をより迅速に特定し、ラボ試験前に低品質の候補を排除でき、時間とリソースを節約できる。
しかし、現在のモデルは動態や開発可能性を確実に予測できないため、AIが生成した候補は依然としてラボでの検証が必要である。これにより、多様で増加するAI生成化合物のテストと特性評価を担当するラボチームへの負担が増大している。従来のスクリーニングワークフローは二値的なyes/no結果向けに設計されており、これらの複雑な候補に必要な詳細データを提供するのに苦労している。
大きな課題はトレーニングデータの品質と完全性である。多くのAIモデルは、構造、ラベリング、多様性に欠ける公開データセットに依存しており、モデルが同様の結論に達し収穫逓減する「データの壁」に直面する。出版バイアスがこれを悪化させ、ほとんどの公開データは肯定的結果に焦点を当て、失敗実験や非結合化合物などの否定的データは未公開のままである。Cytivaのタンパク質研究戦略ディレクター、ポール・ベルチャー氏は、このバイアスがモデルの失敗からの学習能力と信頼性のある予測を制限すると指摘する。
データの完全性も懸念事項である。ウェスタンブロットなどの画像の改ざんは、生成AIによって容易になっている。微生物学者エリザベス・ビックの研究によると、2016年時点で生物医学論文の約4%に重複または操作された画像が含まれていた。ベルチャー氏は、操作されたデータをAIのトレーニングに使用すると悲惨な結果を招く可能性があると警告する。一部のベンダーは、CytivaのImage Integrity Checkerのように、セキュアハッシュアルゴリズムを使用して改ざんを検出するデータ信頼性検証ツールを開発している。出版社はこれらのツールを標準的な慣行として採用することに関心を示している。
今後、業界はAIの創薬における可能性を完全に実現するために、これらのデータ課題に取り組む必要がある。これには、否定的結果を含むより包括的なデータセットの作成、データのラベリングと構造の改善、データの完全性を確保するための検証ツールの導入が含まれる。これらのステップがなければ、AIモデルはバイアスを永続させ、信頼性の低い予測を生み出し、創薬を加速するという約束を損なうリスクがある。
Comments
No comments yet. Be the first.