输入抗原然后一通运算,输出几条序列,同时配上几张三维结构图, 这基本上是AI抗体设计的现状。
2026年Nature的一篇文章测试了29家机构的511条AI设计的抗体。结果表明一些简单的活儿,比如 比如亲和力优化, AI可以胜任,但再进行复杂的成药任务,现阶段是无法胜任的。
要更好的迭代判断,模型需要大量数据来训练,而这些数据目前严重不足。
![]()
01
数据决定模型认知
基于免疫库序列训练的模型,可以学习抗体序列的规律;使用结构数据训练的模型,可以学习序列与空间构象的关系。
如果希望模型能识别中和力、受体激动效应或聚集风险,同样需要与这些属性相关的训练信息和验证数据。
因此AI模型训练要用湿实验把模糊的开发目标转化为可测量、可学习的数据集。
![]()
如果数据标签是某浓度下结合力,模型学到的是与这个读数相关的规律。但不会因标签叫“结合”,就默认学会预测平衡亲和力,更不能进一步推导药理功能。
数据标签越接近目的属性,模型的输出越准确,但接近目标的数据构成往往更复杂、更难扩大规模。这导致两难取舍,容易获取的大规模数据,未必能回答重要问题;贴近机制的数据,数量又非常有限。
总之,模型开发是明确实验数据与设计目标间的关系,关系不清楚,模型就不准!
02
湿实验联系序列和功能
一条序列与它生物学性质间的联系需要湿实验来解决,湿实验的数据标签会决定模型学到了什么!
生物学数据具有很强的条件依赖性!
同一序列用不同抗体形式、不同抗原构建体或不同的检测方法,得到的读数未必相同。即便都叫亲和力,也需要理解测量方法、实验范围与拟合假设。如果条件信息没有,模型看到的是同一序列的多个互相冲突的数字。
所以AI训练的数据不是简单的序列—数值两列,数据标签后面要有大量的背景信息同时给出。
按这个标准,现有的数据可能是一堆垃圾!
![]()
很多公司认为做了很多实验,攒了大量数据,但对AI来说可能不是蜜糖而是砒霜!你以为要训练一个智能,最后可能出来一个智障!
NGS出现以后,抗体序列产生速度非常快,天然BCR库很容易做到百万、千万甚至更大的量级。
但真正有一一对应的KD、kon/koff、epitope等功能数据的序列要少几个数量级。
缺乏Large、Diverse、Unbiased的高质量数据是现有模型的主要瓶颈。
现存数据不是随机抽样,严重偏向已被大量研究的序列,这导致模型的可靠性明显下降。失败的阴性数据对模型来说同样可以定义抗体设计空间的边界。
而且阴性数据的价值取决于被怎样定义。抗体表达低导致的亲和力测试失败,如果不区分就记成阴性,模型就可能把表达问题误学成结合问题,或把检测失败误学成分子缺陷。
对AI而言,有价值的数据集不是片面筛选的,要保留数据的完整性。由于之前的漏斗筛选模型,大量数据没被收集起来,就比较遗憾了。
再有如上文亲和力的例子,同样的数据点不同实验间结果不同,所以无法直接合并。只留一致的数据,那数据库太小;把所有数据都放进来,噪音就一起增加了。
所以AI真正想要的是10万条抗体序列✖️同一实验体系✖️同一protocol✖️ 完整的元数据。
现有的数据常只有一个维度,但抗体是典型的多目标优化问题。
比如现有不少亲和力的数据,如果只训练KD模型很简单,但是要做抗体药物模型,要同时优化一系列参数,亲和力、特异性、表达、稳定性、溶解性、聚集(倾向)、多反应性、药代动力学(PK)、免疫原性……
于是经常出现KD提高了10倍,但表达变差了,牵一发而动全身!
理想数据应该是同一条序列标签下,同时拥有多个属性的湿实验测试数据。
![]()
基于上述,市场现存最好的数据压根不在公开数据库,也不在那些自我感觉良好的阿狗阿猫手里!
大概率在在罗氏、基因泰克、安进、再生元、AZ这些巨头过去二三十年的项目里。
不过他们也有难处,一条抗体一路下来会留下大量序列-表型的数据,但很多数据散落在旧数据库,项目报告资料,实验仪器原始文件,甚至已经离职员工留下的文件夹里。
03
Closed Loop,数据复利模型
AI公司都喜欢讲讲Closed loop,抗体可能是最适合建立Closed loop的药物形式。从序列到分子,工程链条清晰,可通过一系列标准化实验得到相对量化的读数。
如果这个循环可以持续,就和AI模型的迭代非常同步了。
![]()
第一轮模型可能很一般,1000个设计中只有20个像样;第二轮有了第一批实验数据,命中率提高到5%;第三轮又学到前一批失败。循环往复,最终模型越来越厉害!
这个学习循环一旦建立,算法就不再是壁垒!
用一套固定分析方法、统一SOP把成百上千的靶点序列相关的数据做出来,再一轮一轮的训练模型,这个过程很难复制,这才是AI公司真正的护城河。
所以AI抗体公司真正有价值的数据,不是从原来数据上修修补补而是原生的、标准化的数据。
所有的数据能标准的和序列一一对应,连续定量的读出而且和AI的学习进化过程同步,这样的数据和从100篇paper里扒出来的公开数据,价值不可同日而语。
04
未来最强AI抗体公司,必须是自动化湿实验公司
如果前面判断成立,那未来AI抗体公司的组织结构也会发生变化。
早期AI Biotech讲的是20个算法工程师训练一个很厉害的模型,然后和药企合作。而实际能落地、有壁垒的是掌握湿实验能力和数据的公司。
这里对湿实验平台的要求比传统抗体筛选更高,能力要全面,实验要高通量且标准化!
![]()
过去平台指标往往是能完成多少交付工作,但AI时代还要评估每一个实验点能产生多少模型能用的信息,追求的不只是高通量还是高信息量。
同样筛1000条抗体,如果只留下“结合/不结合”两个标签,这1000个实验点对模型的价值有限;但如果每条抗体同时有KD、kon、koff、expression、Tm、aggregation、polyreactivity、epitope和cell potency,那这1000条数据的训练价值完全是另一个量级。
![]()
再有就是自动化的数据收集和分析,很多药企不缺实验,但无法拿出来能训练模型的实验数据。
仪器产生的原始文件、ELN记录、Excel表格、项目PPT、实验条件和样本信息根本没有整理,一旦需要训练模型,再花大量人工去整理清洗这不光麻烦还不合AI胃口。
真正的自动化平台,从实验开始就按“要给AI学习使用”的标注设计。
![]()
从源头基于序列、抗原结构、测试SOP等设计统一的数据结构。无论阴性阳性,都自动收集,形成模型喜欢的从样品到分析再到读出的完整可追溯数据链。
这也是为什么未来真正强的AI 抗体公司,看起来可能越来越像一家高度自动化的实验数据工厂。
谁可以低成本、高通量,持续的迭代产生AI模型需要的实验数据,谁就有机会拥有更好的AI。
![]()
欢迎加入胖猫的知识星球!
AI时代,一起用产业专业的视角看懂生物医药!
和志同道合的小伙伴们,一起抓住时代的大机会~
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.