![]()
导读
AlphaFold 彻底改写了蛋白质结构预测领域,让整个生物医药界对AI 抗体设计寄予极高期待。
大量论文、预印本、商业宣传不断渲染:AI 可以直接在计算机里 “造出” 高亲和力治疗性抗体,跳过繁琐的噬菌体、酵母展示筛选,大幅压缩抗体药物研发周期。
近日,一项名为“AIntibody Challenge”(抗体AI挑战赛)的研究结果显示,AI在某些任务上确实能赢,甚至超越传统实验,但远未到“无所不能”的程度,且不同AI模型的能力差异巨大,跨任务泛化能力有限。
深究科学 | 撰文
8月26日,一篇发表在Nature Biotechnology的重磅工作,AIntibody盲法前瞻性挑战赛,效仿 CASP 蛋白质结构预测竞赛,集结 29 家机构,交出 511 条 AI 设计抗体序列,全部合成真实验证,用 SPR、KinExA 测定真实亲和力,搭配 5 项可开发性实验,完成一次不带滤镜的 “AI 抗体全真大考”。
![]()
这场测试没有推翻 AI 的价值,但撕下行业泡沫,清晰划出当下 AI 抗体能做什么、做不到什么。
01
三大任务,直面工业真实场景
挑战赛选用研究最充分的 SARS‑CoV‑2 RBD 作为抗原,设置三个高度贴合抗体药物管线的任务,全部采用盲测前瞻性设计:参赛团队拿到测序数据集,不知道真实实验结果,提交序列;主办方统一合成全长 IgG,标准化实验检测亲和力与成药性,杜绝回顾性分析带来的虚高性能。
任务 1:计算机亲和力成熟(In‑silico 亲和力成熟)
![]()
给定一轮筛选后的 NGS 测序数据,固定 HCDR3 与框架区,只修改其余 CDR,在原有亲本抗体基础上优化亲和力,同时保证可开发性。对应工业界抗体后期亲和力优化环节。
任务 2:HCDR3 簇内亲和力排序
![]()
数据集被划分成 3 个 HCDR3 序列簇(27F、28F、47F),团队需要从数千条序列里,预测每个簇内亲和力最高、成药性合格的抗体。对应高通量测序后,从海量克隆里挑出最优候选的 hit‑expansion 流程。
任务 3:库外全新 CDR 设计
![]()
基于全部测序数据集,生成数据库中不存在的全新 CDR 组合,框架保持不变,追求高亲和力与良好成药性,代表最有想象力的 “从头 AI 抗体设计”。
评价标准不只有亲和力 KD,还引入药物开发至关重要的可开发性(developability):热稳定性 Tm、聚集温度 Tagg、疏水性 HIC、多特异性 BVP、自相互作用 AC‑SINS 五项实验,每条抗体打分,总分≤3 才算具备药物开发潜力,避免 “亲和力爆表,但一做药就聚集、多特异、无法生产” 的纸上分子。
02
成绩单——有高光,也有不足
任务 1 亲和力成熟:AI 真正闪光的地方
在已有亲本抗体、充足测序多样性数据加持下,AI 交出了全场最好的答卷。Aureka 的结构感知模型拿到 95 pM 的抗体,和亲本相比亲和力提升约 2000 倍,与实验筛选得到的最优抗体(113 pM)统计学上几乎持平。
有意思的是,不用复杂 AI 的简单统计共识法(ProBioGen)也拿到第三名 540 pM 的优异结果,仅仅对测序库做位置频率统计,不靠深度学习就超过绝大多数 AI 算法。
整体统计:166 条提交序列中,63% 同时做到结合抗原且可开发;3% 拿到亚纳摩尔亲和力,0.6% 实现小于 100 pM 超高亲和力。
这证明:当拥有充足真实筛选测序数据,针对已有抗体做局部 CDR 优化,AI 确实可以缩短 2‑3 周实验周期,具备实实在在工业价值。但也存在问题:部分团队一条合格可开发结合抗体都没有,模型之间差距巨大。
任务 2 簇内预测:大部分 AI,干不过随机挑选克隆
这是全文最颠覆认知的结论。
研究基线显示,从 HCDR3 簇里随机挑选克隆,就有 39% 概率比丰度最高的簇对照亲和力更好。
![]()
但绝大多数 AI 模型的表现低于这个随机基线:AI 提交序列中,只有 9.8%‑13.8% 优于簇对照。全 26 支队伍里,仅有华盛顿大学 WashU 一支队伍超过随机基线。即便任务拿到部分真实亲和力标签,大部分 AI 依然无法从海量序列中精准定位高亲和力克隆。
同时,模型没有跨集群泛化能力:同一个赢算法,在 A 簇夺冠,换到 B 簇就表现平庸。
这里暴露行业巨大痛点:亲和力预测依然是整个领域最大短板。即便有测序、部分亲和力标签,想直接从序列预测真实结合强弱,现有模型依然非常吃力,远达不到工业期待。另外 HCDR3 深刻决定可开发性,同一个算法,在 47F 簇全部抗体成药性优秀,换到 28F 簇大量分子出现聚集、多特异性问题,算法很难预判这些生物物理风险。
任务 3 库外全新 CDR 设计:能造出超级分子,但 “药化陷阱” 重重
Xencor 的蛋白语言模型产出全场最强 2.9 pM 的超紧密结合抗体。然而,这支冠军抗体在疏水性 HIC 色谱柱无法有效洗脱—— 按照药物开发标准属于严重致命缺陷。挑战赛的加权计分规则允许单项失败被其他指标抵消,才让它拿到第一名,但现实药物开发中会被直接淘汰。
![]()
全局结果:168 条提交序列,接近三分之一(30.4%)完全不结合抗原;即便结合,高亲和力分子往往伴随成药性缺陷。很多获胜设计并非天马行空全新 HCDR3,只是在数据集已有的 HCDR3 基础上,对周边 CDR 做少量保守突变,真正意义上完全跳出原有文库的创新很少。
这也意味着,当下生成式AI更擅长“微调或改良”,而不是凭空创造。
03
不存在 “通杀一切” 的万能模型
参赛方法被分为四大类:统计启发式基线、传统机器学习、蛋白语言模型 PLM(Transformer / 抗体大模型)、结构感知方法(AlphaFold3、ProteinMPNN 等)。
挑战赛得出一个非常务实的结论:没有一类算法在全部任务通吃,最优方案高度依赖任务类型。
![]()
亲和力成熟任务:结构感知 + 蛋白语言模型组合夺冠,简单统计基线也可以打出高分;
簇内预测任务:冠军来自传统高斯过程回归、定制 Transformer、PLM,不同簇胜出方法完全不同,没有一类技术占绝对上风;
库外全新 CDR 生成:蛋白语言模型表现相对最好。
同一个团队的同一套算法,往往是 “一个任务封神,另一个任务拉胯”,跨任务泛化能力普遍很差。
论文提出务实思路,工业管线不要迷信 “一个模型解决全部问题”,应当采用组合策略:
库内亲和力成熟:可以使用统计共识 + AI 模型并行; 簇内候选筛选:不能完全依赖 AI 预测,保留随机挑选作为重要基线; 全新序列生成:优先蛋白语言模型,但必须严格后续实验验证成药性。
同时,研究发现,可开发性很难靠计算精准预判。大量 AI 给出高亲和力序列,会出现多特异性、聚集风险;计算打分不能可靠替代五项湿实验检测。
AIntibody 最大价值,是给整个领域敲了一记警钟:很多论文的亮眼效果,来自回顾性数据集的 “便利光环”,一旦切换成盲法、前瞻性、全部合成实测,性能会大幅缩水。
在合适场景,也就是已有结合分子、拥有高质量测序数据集,做局部 CDR 亲和力优化,AI 确实可以产出媲美实验筛选的候选,节约实验时间成本。
但现阶段 AI 不能完全替代湿实验,它更适合作为 “高效候选生成器”,产出一批候选序列,仍然必须经过完整体外实验验证亲和力与成药性。
04
下一代 AIntibody 的方向
这项研究只是第一代基准,作者公布全部测序、亲和力、成药性原始数据,全部获胜团队开源代码,供全球科研人员测试迭代自己的算法。
下一代 AIntibody 挑战赛计划:
取消大量预先提供的亲和力标签,模拟早期真实抗体发现,仅输入测序数据; 修改评分规则,设置硬性成药性一票否决,杜绝 “高亲和力抵消成药性缺陷”; 拓展更多抗原靶点,摆脱本次仅使用 RBD 的局限,检验模型跨抗原泛化能力。
AIntibody 的启示,不止局限抗体 AI,对整个生成生物学都有借鉴意义:
仿真、回顾性测试只能作为前期筛选;真正的金标准永远是盲法前瞻性 + 全部实验验证。
AI 抗体设计不是 “已经实现革命”,而是站在转折点。它已经拿到入场券,在部分场景可以赋能药物研发,但距离可以脱离实验、“输入抗原直接输出临床级抗体” 的终极理想,仍隔着巨大的生物现实鸿沟。
参考文献
Erasmus M F, et al. A blinded, prospective benchmark of in silico antibody discovery anchored to experimental affinity and developability. Nature Biotechnology, 2026, doi:10.1038/s41587‑026‑03238‑6
Deep Science预印本
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.