DC娱乐网

AI4Bio这个方向是Biology的主战场不是AI!

AI4Bio这两年越来越热,但真正进入药物研发后,会发现一个反直觉的事实:模型可能恰恰不是最难的部分。AlphaFold、ESM、scGPT、Virtual Cell以及各种Foundation Model不断出现,很容易让人产生一种错觉:模型越大、benchmark越高,AI4Bio能力就越强。但biology不是互联网,数据稀疏、异质、噪声大,而且真正决定药物研发成败的高质量human data往往并不公开。

所以争论“CS背景还是biology背景更适合AI4Bio”,可能一开始就问错了问题。真正重要的是能不能完成一条完整链路:Biological Question → Data → Model → Validation → Decision。CS背景可能很会建模,却未必知道什么biology问题值得解决;biology背景理解机制,却可能缺乏把科学问题转化成computable problem的能力。未来真正稀缺的是能够跨越这条链路的人。

这也是为什么AI4Bio长期最重要的资产可能不是Foundation Model,而是human genetics、clinical data、multi-omics、single-cell、spatial和perturbation data,以及背后的validation infrastructure。当模型越来越容易获得,单纯algorithm advantage的半衰期会越来越短,真正难复制的是proprietary data、problem formulation、验证能力和持续产生新数据的feedback loop。

另一个值得警惕的现象是“论文繁荣、决策贫困”。AI4Bio很多方向还缺少统一benchmark,每个人都可以定义自己的任务、数据和评价体系,因此很容易做出SOTA。但药物研发最终面对的不是leaderboard,而是一个更残酷的问题:这个模型有没有改变实验设计、靶点选择、患者分层或者go/no-go decision?如果AUC从0.82提高到0.87,却没有改变任何研发决策,那么这5%的提升可能几乎没有实际价值。