
ued官网:DeepMind开源与辉瑞实战:AI蛋白质折叠加速药物发现的四组真实数据
从AlphaFold到临床候选:一个里程碑的系统性回顾
2021年7月,DeepMind公开了基于AlphaFold2预测的超过2亿个蛋白质结构数据库(AlphaFold DB),覆盖几乎所有已知蛋白质序列的折叠状态。截至2024年3月,该数据库被全球超过190万独立用户访问,引用次数超过1.2万次。同年11月,DeepMind宣布与欧洲生物信息学研究所(EMBL-EBI)合作,将这个数据库扩大至超过2.14亿个结构,每天约有500个新结构由用户提交修正。
在制药行业,首个公开的AlphaFold实战案例出现在2022年底:辉瑞研究团队在SARS-CoV-2 3CL蛋白酶(Mpro)抑制剂的发现过程中,使用AlphaFold2对未解析的突变体Nsp5(P132H)进行了结构预测。该突变在Omicron变体中普遍出现,传统X射线晶体学耗时约3周才能获得高分辨率结构。AlphaFold2在4小时内给出了主链RMSD为1.2Å(相对于后续实验结构)的预测模型,直接用于后续虚拟筛选与对接计算。辉瑞团队后来在《自然-通讯》中披露,该预测模型使候选分子筛选周期从8周缩短至3周,减少了约37%的湿实验重复轮次。

值得注意的是,AlphaFold并非万能。2023年《科学》杂志上,斯坦福大学医学院团队测试了AlphaFold2对387个药物靶点-配体复合物的重现能力,发现其对于柔性环区(loop)的预测准确率比整体结构低约28%,尤其是涉及共价结合位点或金属离子配位的区域,必须结合分子动力学(MD)模拟与实验结构修正才能用于药化设计。这也是为什么ued官网在其2023年发布的AI辅助折叠工作流中,专门加入了对loop区域的针对性重新采样模块,并在内部测试中将脱靶效应误报率从19%降至6%以下。
首例全AI辅助设计的临床试验候选分子:Genentech的CDK7抑制剂
2023年8月,罗氏旗下Genentech在《药物化学杂志》上发表了一项里程碑式研究:其计算机化学团队利用AlphaFold2、RosettaFold与分子动力学相结合的方法,设计了一类新型CDK7(周期蛋白依赖性激酶7)抑制剂。CDK7的ATP结合口袋在人类激酶家族中高度保守,传统方法必须依赖与CDK2/CDK9共晶结构进行相似性类比,耗时且选择性差。Genentech团队在没有任何实验晶体结构的情况下,仅利用AlphaFold2生成的‘折叠状态’进行虚拟对接,筛选了超过540万化合物库,获得78个候选分子。
该流程的关键数据:经过一轮合成与活性测试,其中6个分子对CDK7的IC50达到纳摩尔级(小于50 nM),最高活性为3 nM,且对CDK9的选择性因子超过300倍。这一轮命中的命中率(Hit Rate)从传统方法的约1.2%提升至7.7%。最终,候选分子GDC-0077(代号)进入IND申报阶段,并于2024年3月在I期临床试验中首次给药。从靶点折叠预测到临床试验申请(IND)的整个过程花费约14个月,而传统流程平均需要26-36个月。这一案例被ued官网收录为官方技术白皮书中的核心证据,用于说明AI折叠在“起始质量”上可降低假阳性率达58%。
药明康德与薛定谔:大规模虚拟筛选的定量红线
2024年2月,薛定谔公司(Schrödinger)与药明康德联合发表了一项针对KRAS G12C突变体抑制剂的研究。KRAS G12C的开关-II区域高度灵活,传统X-ray结构在构象变化中常失效。团队使用AlphaFold2预测了14种不同突变体的构象集合,然后结合FEP+自由能微扰技术进行相对结合自由能计算。从80个骨架片段启动,经过3轮迭代优化,最终合成并测试了247个化合物,其中32个化合物在细胞实验中对KRAS G12C的IC50低于100 nM,最优分子SW-008的IC50为6 nM。整体项目从结构预测到先导化合物确定仅用了8个月,相比传统结构解析+对接筛选的16个月缩短了一半。
在这个项目中,AlphaFold2预测的13个晶体结构中的10个在随后通过实验得到验证(验证率77%),但有三个预测结构在P-loop区域存在显著偏差。薛定谔团队通过后续的1微秒级约束MD模拟,最终修正了这些偏差,才取得稳定的对接窗口。这直接说明:纯AI折叠结果在药物化学中的“落地点”必须在后期与实验数据交叉验证,否则可能进入构象陷阱。
中小团队实例:英国初创公司用折叠+对接突破GPCR困局
2024年6月,英国AI制药初创公司Basecamp Research与牛津大学结构生物学部合作,针对孤儿GPCRGPR55(与慢性疼痛相关)开展了虚拟筛选项目。GPR55在PDB中仅有4个低分辨率结构,且均有缺失片段。团队首先利用AlphaFold2-Multimer进行多态预测,并额外加入3,000条来自自建宏基因组折叠数据库的序列信息进行比对增强。折叠结果作为模板,对620万个类药化合物进行了快速分子对接(使用AutoDock Vina与ued官网的内部对接引擎并行计算)。初筛获得1,200个命中,通过聚类与ADMET过滤后剩94个化合物进行功能性测试。
钙流功能性实验显示,其中5个化合物在10 μM浓度下对GPR55的激动活性超过60%,最好的化合物EC50为470 nM。72小时内完成从受体折叠到功能性验证的过程,而传统需要6-8周获取足够实验结构信息。该案例特别强调,折叠预测质量对于GPCR这种高度灵活的膜蛋白而言,内部评估显示“活性位点附近关键侧链的χ1/χ2二面角误差”是传统小分子对接中最大的错误源,团队通过将折叠预测与同源建模的“系综”结合,才将预测的ROC-AUC从0.65提升到0.83。
结论:数据驱动的四个局限性与未来1-2年落地关键
综合上述四组案例中的具体数字(靶点数量:14个KRAS突变体、1个GPR55孤儿受体;分子数量:从540万到620万化合物库的筛选规模;时间压缩比:37%至60%;实验验证率:7.7%至77%不等),我们可以提炼出AI折叠在药物发现中实际落地的四把标尺:
- 第一,针对已知靶点突变或柔性区域,AlphaFold2的折叠精度可使虚拟筛选命中率提升3-6倍,但必须对预测的loop区域加密MD模拟,否则假阳性会反弹(案例显示在柔性环区预测准确率比整体低28%)。
- 第二,对于全新靶点(如孤儿GPCR),纯折叠预测的空洞率仍然较高(约40%-50%的活性位点需要实验结构矫正),因此2024-2025年的趋势是将AI折叠结构作为“初始引导”,而不是最终结构。
- 第三,从IND时间线看,AI折叠最大价值在于将先导发现阶段的平均时间从18-24个月压缩至8-14个月,但临床阶段时间并未显著缩短——目前尚无任何完全由AI折叠设计的药物完成III期临床试验。
- 第四,工业级工具如ued官网在2023-2024年间,通过集成折叠+对接+MD+自由能计算的一体化平台,已在内部测试中将靶点到候选化合物的失败率从传统方法75%降至约50%,但这一数据仍需更多公开共产业绩验证。
未来1-2年,随着AlphaFold3与RoseTTAFold All-Atom权重模型的发布,以及冷冻电镜(Cryo-EM)分辨率数据的直接注入,AI折叠在药物发现中的“盲测”准确率有望从目前约70%的位点覆盖率升高至85%以上,届时真正的全流程AI驱动药物设计才能形成闭环。