随着DNA甲基化、转录组、蛋白质组、临床指标及遗传学等多组学技术快速发展,衰老研究已经积累了海量数据。然而,传统AI生物医学评测主要关注知识问答、序列功能预测或药理学任务,模型往往可以依靠预训练语料中的知识完成任务,却很少真正面对“原始实验数据→生物学结论”的问题。
2026年9月17日,来自英矽智能的Alex Zhavoronkov团队等在Cell发表题为“An open benchmark and language models for AI in aging biology”的文章。
该研究开发了LongevityBench(LB)平台,涵盖临床、DNA甲基化、转录组、蛋白质组和遗传学5个领域、17项任务,并进一步开发了5个针对衰老数据进行训练的Longevity-LLMs(L-LLMs),系统比较其与前沿大模型在衰老生物学数据分析中的表现。
值得指出的是,这项研究真正推动的不是“哪个AI模型更聪明”,而是把衰老研究中的AI从“文献知识问答”推进到了“直接读取多组学数据、发现生物学模式并辅助提出研究假设”的阶段。
![]()
研究人员首先评估了来自OpenAI、Google、Anthropic、xAI、DeepSeek和Moonshot AI等6家公司的18个前沿模型。结果显示,没有任何一个通用大模型能够在全部衰老任务中稳定占据优势。Gemini-3.1-Pro在综合排名中表现突出,但其置信区间与Claude Opus、Sonnet和Kimi等多个模型重叠,因此并不存在统计学意义上全面领先的单一模型。尤其值得注意的是,临床NHANES任务相对容易,而DNA甲基化、转录组和蛋白质组等真正需要从高维生物数据中提取衰老信号的任务明显更加困难。
当模型真正面对高维组学数据时,通用LLM的能力明显下降。例如,在GEO DNA甲基化年龄两两比较任务中,最佳前沿模型的concordance仅达到0.69;GTEx转录组年龄比较中,没有模型超过0.56,甚至部分模型低于随机水平。在Olink蛋白质组年龄比较中,传统蛋白质年龄时钟达到0.749,而最佳前沿LLM仅为0.703。这说明一个重要问题:语言模型拥有大量生物医学知识,并不意味着它已经能够像专门的生物统计模型一样理解高维组学数据。
研究人员随后提出5个Longevity-LLMs,参数规模仅为0.6B–9B,基于Qwen3/3.5和LFM2架构,并使用衰老领域数据进行多任务训练。令人关注的是,加入领域训练后,模型表现发生明显变化:在全部26个被比较的模型中,综合排名前3的位置均被L-LLMs占据,其中L-Qwen3.5-9B取得最高综合排名,甚至超过所有前沿通用模型;即使只有0.6B参数的L-Qwen3模型,也进入整体前列。研究提示,对于结构化生物数据分析,模型是否接受了针对性领域训练,可能比单纯增加参数规模更加重要。
进一步分析发现,L-LLM的优势并不是简单来自参数数量增加。部分任务中,2.6B模型甚至优于9B模型;在OpenGenes基因表达方向判断任务中,L-LFM2-1.2B达到78.0%,而9B模型为71.0%。在蛋白质组年龄回归任务中,L-Qwen3-0.6B的平均绝对误差达到5.7岁,为所有模型中最低水平之一。说明针对生物学数据进行专门训练,可以让相对小型的模型学习到通用LLM难以稳定获得的组学数据表示。
为了进一步了解模型究竟在“看什么”,研究团队对L-Qwen3.5-9B进行了feature ablation分析。在5类pairwise任务、1,922个prompt中,共有20/47种特征删除会显著降低模型对正确答案的置信度,而且没有任何单一特征组占据绝对主导地位。在临床任务中,删除血液检测信息会导致47.4%的原本正确答案发生变化;在DNA甲基化、转录组和蛋白质组任务中,模型同样受到多个生物学程序共同影响。这提示模型并非单纯记忆某一个指标,而可能利用了分散于多个通路和生物学特征中的衰老信息。
在Benchmark之外,研究团队进一步构建了Longevity Claw,将L-Qwen3.5-9B与衰老时钟、基因集富集分析和人群数据分析工具连接起来,使模型能够执行多阶段研究任务。作为能力展示,研究团队让模型围绕衰老标志和可药物化衰老靶点生成候选基因,并进行置信度、drugability、安全性、新颖性等维度评分,共得到328个候选靶点。模型生成结果与既往独立发表的靶点集合存在高于随机水平的重叠,其中KDM1A这一候选靶点随后已有独立研究显示其与衰老和癌症表型相关。
![]()
总而言之,该研究开发了LongevityBench这一面向衰老生物学的开放式AI评测体系,并系统比较了18个前沿LLM与5个专门训练的Longevity-LLM。研究发现,通用大模型在衰老组学任务上的表现高度不均衡,而经过领域数据训练的0.6B–9B小型模型能够在多个任务中达到甚至超过大型通用模型的水平。进一步构建的Longevity Claw则展示了将LLM与aging clocks、基因集分析和人群数据工具整合后用于衰老科研的可能性。
参考文献:
https://www.sciencedirect.com/science/article/pii/S0092867426009992?via%3Dihub
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.