今天,AI科技圈全体狂欢。
凌晨,OpenAI发布了新一代旗舰模型GPT-6 Astra,号称地表最强AI大模型。
![]()
它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。
OpenAI副总裁Greg Brockman称这是一次“世代跃迁”,甚至表示它开启AGI的新时代。
目前,绝大多数的报道都是代码、视频生成能力,但关于AI怎么做科学研究这块,几乎没人细讲。
但如果把视线从AGI叙事上移开,再看一眼GPT-6 Astra的能力数据,会发现一个更值得AI4S关注的变化。
AI模型正在跨过一道新的门槛。
这一次,真正值得细读的,不是它离AGI还有多远,而是它已经开始具备什么样的科学能力。
Greg Burnham将其描述为:“一个时代的结束,另一个时代的开始。”
![]()
科研Agent,能力更强了
首先,需要介绍一下Terminal-Bench这个基准。
它已成为AI智能体能力评估的重要标杆,几乎所有前沿实验室都在使用它来追踪和比较各自智能体的性能。
Terminal-Bench Science 0.1,则被称为“科学版Terminal-Bench”,专门测试智能体能否用代码和终端工具完成科研工作流的评测
它一共包含70个由领域研究人员策划的任务,覆盖生命科学、物理科学、地球科学、数学科学和工程科学五大领域。
在这个基准上,Astra以64.6%的成绩刷新了SOTA,作为对照的Claude Fable 5.1,是52.6%。
![]()
不仅如此,Astra跑出这个成绩所用的预估API成本,还比对照组低了约31%。
也就是说,这不只是能力上的领先,还是效率上的领先。
放回AI4S的场景里理解一下,以前“文献调研→提出假设→跑模拟→核对数据→给出下一步建议”这条链条,是分成好几轮对话,靠人工衔接。
现在,这条链条理论上已经能被一个Agent自己串起来跑完。
一位科学家直接用Astra做出了一个复杂的生物医学应用,专门用来分析流式细胞术的数据。
流式细胞术是免疫学里最基础的技术之一,让科学家能一次性分析血液、组织或者其他样本里,成千上万甚至几百万个单细胞,用带荧光标记的抗体,把特定的细胞类型揪出来,顺便测一下它们表达了什么蛋白质。
以前该领域一直被商业软件占领。
![]()
这位科学家表示,他们实验室这么多年,每年都要为分析这类数据的商业软件,掏出几千美元的订阅和授权费。
现在,他把所有订阅全取消了。因为他用Astra几乎已经自己搭出了一个功能齐全、研究级别的同类应用。
![]()
而且他还补了一句,这个UI/UX,已经比他用过的很多商业工具都要好。
以前我们聊AI4S,聊的还是AI能不能帮科学家提效。这个案例已经不是提效了,这是一个科学家,靠自己写Prompt,把一整个商业软件公司,给绕过去了。
那些靠卖分析软件订阅费吃饭的公司,这一刻,可能真的要开始睡不着觉了。
不仅如此,Agent成本大幅下降意味着,原来只有大药企、头部实验室才能使用的科研Agent能力,中小型团队可能也开始玩得起了。
![]()
科研跑分:从能聊到能考
官方报告中,专门给出了Advancing scientific discovery(推进科学发现)这一章。
在这一章,GPT-6 Astra拿了一系列SOTA(最佳表现)。
GPQA Diamond能够测试研究生水平的生物学、化学和物理学科学推理能力。GPT-6 Astra在对比测试中取得了96.0%的新高分。
![]()
HealthBench Professional是用于评估大语言模型在真实临床工作场景中表现的基准,GPT-6 Astra得分最高63.4%,比上一代Sol的60.5%又高了一截。
![]()
这两个还算是传统项目,大家都在卷。真正有意思的是接下来这几个,之前很少有模型愿意测试的难度极高的垂类基准。
LifeSciBench:评估AI在整个生命科学研究中的实用性。
GeneBench-Pro:专注于计算生物学与基因组学中的高阶统计推理能力。
MedChemBench:专注于药物化学中的推理与决策能力。
GPT-6 Astra分别在三个基准中,拿到了60.3%、37.8%、49.3%的分数,都略有提升,同时成本大幅度下降。
但这里有个细节,OpenAI在脚注里写了一句:Claude Fable 5和5.1,没有被放进这几项的对比里。
理由是,它们在这些题目上,大部分选择了直接拒答。
不是答错,而是拒答。两个模型的表现,其实是两条完全不同的安全路线。
Anthropic一条更保守,碰到敏感的生化类问题,宁可不答也不冒险;而OpenAI一条选择在监管框架内,尽量把答案给出来。
这对之后科学家怎么选AI模型,这应该会有实实在在的影响。
![]()
桌面操作能力,史诗级提升
还有一组数据,容易被忽略,但对AI4S行业的冲击可能是最直接的。
ScreenSpot-Pro,测的是Agent在不借助外部工具的情况下,直接识别并操作屏幕上的界面元素。
Astra拿到92.7%,对照的GPT-5.6 Sol是76.9%。
![]()
OSWorld 2.0,测的是Agent在真实桌面环境里完成任务的能力,Astra拿到72.6%,Sol是65.7%,Claude Opus 5是70.2%。
![]()
BenchCAD,测的是操作专业软件完成实际工作,Astra拿到95.9%,Sol是83.3%。
说明Agent已经能像人一样,直接用鼠标键盘操作那些从来没开放过API、只能靠人工点来点去的老旧专业软件。
不管是ChemDraw、LIMS系统,还是实验室里Excel记录流程。
官网给的两个具体科研场景。
第一个测序,让Astra直接进到专业生物信息学软件MultiQC里,核查基因测序的质量,把遗传变异可视化出来,帮研究者判断接下来该往哪个方向继续深挖。
第二个追踪细胞,GPT-6 Astra 在 Jupyter中构建并运行细胞追踪工作流程,将原始显微镜图像转换为带标记的轨迹和谱系记录,以帮助研究人员跟踪单个细胞的运动和分裂。
这才是这次AI for Science真正的跨越。
以前AI在科研里扮演的角色,更像是一个博学的学士,本质上还是问答形式。
现在它开始变成一个愿意动手干脏活累活的实验室助理,自己打开软件、自己检查数据、引导科学家做出判断。
如果通用Agent已经不需要专门适配API,直接看屏幕操作就能完成任务,那垂直工作台集成的含金量,正在被悄悄稀释。
![]()
回到开头那句话。
一个时代结束,另一个时代开始。我觉得这句话放在这里,倒也没那么标题党。
以前我们说AI4S,除开基础大模型外,聊得更多是垂直平台怎么把专业软件的接口打通,集成到一个工作台中。
这是一道很深的护城河,因为大多数科研软件压根没开放过API,得靠人一点点适配。
但这次Astra展示的东西,不仅是模型能力的大幅提升,还在展示:不需要平台开放接口,AI直接看屏幕操作就行了。
当通用大模型的科学能力每往前挪一步,垂直AI4S平台就必须回答一个问题——你比它多做对了什么。
是数据的专有性,是流程的领域know-how,还是验证环节的不可替代性?
这个问题AI4S行业迟早要正面回答。
真正能留下来的,可能只有最稀缺的能力。一方面,手里有没有别人拿不到的专有数据;另一方面,是否具有基于物理世界的验证能力,这还是AI模型的短板。
至于AGI来没来,交给别人吵去吧。
— The End—
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.