网易首页 > 网易号 > 正文 申请入驻

GPT-6发布,AGI来没来不知道,但AI4S真的飞升了

0
分享至

今天,AI科技圈全体狂欢。

凌晨,OpenAI发布了新一代旗舰模型GPT-6 Astra,号称地表最强AI大模型。


它在计算机使用、浏览、软件工程、网络安全、科学和专业工作领域,全部刷新SOTA。

OpenAI副总裁Greg Brockman称这是一次“世代跃迁”,甚至表示它开启AGI的新时代。

目前,绝大多数的报道都是代码、视频生成能力,但关于AI怎么做科学研究这块,几乎没人细讲。

但如果把视线从AGI叙事上移开,再看一眼GPT-6 Astra的能力数据,会发现一个更值得AI4S关注的变化。

AI模型正在跨过一道新的门槛。

这一次,真正值得细读的,不是它离AGI还有多远,而是它已经开始具备什么样的科学能力

Greg Burnham将其描述为:“一个时代的结束,另一个时代的开始。”


科研Agent,能力更强了

首先,需要介绍一下Terminal-Bench这个基准。

它已成为AI智能体能力评估的重要标杆,几乎所有前沿实验室都在使用它来追踪和比较各自智能体的性能。

Terminal-Bench Science 0.1,则被称为“科学版Terminal-Bench”,专门测试智能体能否用代码和终端工具完成科研工作流的评测

它一共包含70个由领域研究人员策划的任务,覆盖生命科学、物理科学、地球科学、数学科学和工程科学五大领域。

在这个基准上,Astra以64.6%的成绩刷新了SOTA,作为对照的Claude Fable 5.1,是52.6%。


不仅如此,Astra跑出这个成绩所用的预估API成本,还比对照组低了约31%。

也就是说,这不只是能力上的领先,还是效率上的领先。

放回AI4S的场景里理解一下,以前“文献调研→提出假设→跑模拟→核对数据→给出下一步建议”这条链条,是分成好几轮对话,靠人工衔接。

现在,这条链条理论上已经能被一个Agent自己串起来跑完。

一位科学家直接用Astra做出了一个复杂的生物医学应用,专门用来分析流式细胞术的数据。

流式细胞术是免疫学里最基础的技术之一,让科学家能一次性分析血液、组织或者其他样本里,成千上万甚至几百万个单细胞,用带荧光标记的抗体,把特定的细胞类型揪出来,顺便测一下它们表达了什么蛋白质。

以前该领域一直被商业软件占领。


这位科学家表示,他们实验室这么多年,每年都要为分析这类数据的商业软件,掏出几千美元的订阅和授权费。

现在,他把所有订阅全取消了。因为他用Astra几乎已经自己搭出了一个功能齐全、研究级别的同类应用。


而且他还补了一句,这个UI/UX,已经比他用过的很多商业工具都要好。

以前我们聊AI4S,聊的还是AI能不能帮科学家提效。这个案例已经不是提效了,这是一个科学家,靠自己写Prompt,把一整个商业软件公司,给绕过去了。

那些靠卖分析软件订阅费吃饭的公司,这一刻,可能真的要开始睡不着觉了。

不仅如此,Agent成本大幅下降意味着,原来只有大药企、头部实验室才能使用的科研Agent能力,中小型团队可能也开始玩得起了。


科研跑分:从能聊到能考

官方报告中,专门给出了Advancing scientific discovery(推进科学发现)这一章。
在这一章,GPT-6 Astra拿了一系列SOTA(最佳表现)。

GPQA Diamond能够测试研究生水平的生物学、化学和物理学科学推理能力。GPT-6 Astra在对比测试中取得了96.0%的新高分。


HealthBench Professional是用于评估大语言模型在真实临床工作场景中表现的基准,GPT-6 Astra得分最高63.4%,比上一代Sol的60.5%又高了一截。




这两个还算是传统项目,大家都在卷。真正有意思的是接下来这几个,之前很少有模型愿意测试的难度极高的垂类基准。

  • LifeSciBench:评估AI在整个生命科学研究中的实用性。

  • GeneBench-Pro:专注于计算生物学与基因组学中的高阶统计推理能力。

  • MedChemBench:专注于药物化学中的推理与决策能力。

GPT-6 Astra分别在三个基准中,拿到了60.3%、37.8%、49.3%的分数,都略有提升,同时成本大幅度下降。

但这里有个细节,OpenAI在脚注里写了一句:Claude Fable 5和5.1,没有被放进这几项的对比里。

理由是,它们在这些题目上,大部分选择了直接拒答。

不是答错,而是拒答。两个模型的表现,其实是两条完全不同的安全路线。

Anthropic一条更保守,碰到敏感的生化类问题,宁可不答也不冒险;而OpenAI一条选择在监管框架内,尽量把答案给出来。

这对之后科学家怎么选AI模型,这应该会有实实在在的影响。


桌面操作能力,史诗级提升

还有一组数据,容易被忽略,但对AI4S行业的冲击可能是最直接的。

ScreenSpot-Pro,测的是Agent在不借助外部工具的情况下,直接识别并操作屏幕上的界面元素。

Astra拿到92.7%,对照的GPT-5.6 Sol是76.9%。


OSWorld 2.0,测的是Agent在真实桌面环境里完成任务的能力,Astra拿到72.6%,Sol是65.7%,Claude Opus 5是70.2%。


BenchCAD,测的是操作专业软件完成实际工作,Astra拿到95.9%,Sol是83.3%。

说明Agent已经能像人一样,直接用鼠标键盘操作那些从来没开放过API、只能靠人工点来点去的老旧专业软件。

不管是ChemDraw、LIMS系统,还是实验室里Excel记录流程。

官网给的两个具体科研场景。

第一个测序,让Astra直接进到专业生物信息学软件MultiQC里,核查基因测序的质量,把遗传变异可视化出来,帮研究者判断接下来该往哪个方向继续深挖。

第二个追踪细胞,GPT-6 Astra 在 Jupyter中构建并运行细胞追踪工作流程,将原始显微镜图像转换为带标记的轨迹和谱系记录,以帮助研究人员跟踪单个细胞的运动和分裂。

这才是这次AI for Science真正的跨越。

以前AI在科研里扮演的角色,更像是一个博学的学士,本质上还是问答形式。

现在它开始变成一个愿意动手干脏活累活的实验室助理,自己打开软件、自己检查数据、引导科学家做出判断。

如果通用Agent已经不需要专门适配API,直接看屏幕操作就能完成任务,那垂直工作台集成的含金量,正在被悄悄稀释。


回到开头那句话。

一个时代结束,另一个时代开始。我觉得这句话放在这里,倒也没那么标题党。

以前我们说AI4S,除开基础大模型外,聊得更多是垂直平台怎么把专业软件的接口打通,集成到一个工作台中。

这是一道很深的护城河,因为大多数科研软件压根没开放过API,得靠人一点点适配。

但这次Astra展示的东西,不仅是模型能力的大幅提升,还在展示:不需要平台开放接口,AI直接看屏幕操作就行了。

当通用大模型的科学能力每往前挪一步,垂直AI4S平台就必须回答一个问题——你比它多做对了什么。

是数据的专有性,是流程的领域know-how,还是验证环节的不可替代性?

这个问题AI4S行业迟早要正面回答。

真正能留下来的,可能只有最稀缺的能力。一方面,手里有没有别人拿不到的专有数据;另一方面,是否具有基于物理世界的验证能力,这还是AI模型的短板。

至于AGI来没来,交给别人吵去吧。

— The End—


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
洛杉矶奥运女排门票已出5张,中国女排迎利好,日本女排仍是对手

洛杉矶奥运女排门票已出5张,中国女排迎利好,日本女排仍是对手

体育大学僧
2026-09-07 12:10:16
当孩子说“再玩10分钟”时,你的第一句话,决定了他20年后的人生

当孩子说“再玩10分钟”时,你的第一句话,决定了他20年后的人生

户外阿毽
2026-09-05 12:14:10
一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

一个被很多人忽略的史诗时刻:特斯拉可能正在把电池工艺推向爆发

旧史新谭
2026-09-07 18:40:37
美网终极对决来袭!胜率仅12%惨遭看衰,硬地苦主横亘身前、教练全力撑腰笃定冲冠,郑钦文仅剩最后一张外卡

美网终极对决来袭!胜率仅12%惨遭看衰,硬地苦主横亘身前、教练全力撑腰笃定冲冠,郑钦文仅剩最后一张外卡

风吹一生v
2026-09-07 21:51:37
心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理学上说:你跟伴侣倾诉委屈时,对方的第一反应不是心疼你、理解你,反而不断回避你、指责你、反驳你,你们其实并没有在沟通

心理观察局
2026-09-07 06:23:08
大S闺房曝光!太过诡异像灵堂引人不适,难怪大师预言她活不过50岁

大S闺房曝光!太过诡异像灵堂引人不适,难怪大师预言她活不过50岁

瞎说娱乐
2026-08-27 11:09:48
承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

承认吧,如今很多家庭已经供不起一个大学生本科四年的全部开销了

天天热点见闻
2026-09-07 06:10:14
港姐王菲宣布订婚!

港姐王菲宣布订婚!

浙江之声
2026-09-06 14:32:28
又一个高学历女同胞恋爱脑,死在了异国他乡,她是富家女,才24岁

又一个高学历女同胞恋爱脑,死在了异国他乡,她是富家女,才24岁

皮蛋儿电影
2026-09-07 11:48:42
态度变了?郑钦文逆转赢球后,美媒发文锐评,原来李娜真没说错

态度变了?郑钦文逆转赢球后,美媒发文锐评,原来李娜真没说错

吃青菜长高
2026-09-07 11:48:36
神经科主任:只要血常规没这3个箭头,脑梗风险或不用太焦虑

神经科主任:只要血常规没这3个箭头,脑梗风险或不用太焦虑

医学科普汇
2026-08-25 23:00:08
台湾退役中将帅化民表示:不少人都说中国军事力量已居世界顶尖水平,但在他看来,真正需要思考的不是先打谁,而是大陆为何始终隐忍不出手

台湾退役中将帅化民表示:不少人都说中国军事力量已居世界顶尖水平,但在他看来,真正需要思考的不是先打谁,而是大陆为何始终隐忍不出手

人生录
2026-07-27 00:05:06
魔鬼!郑钦文复制拉杜卡努10连胜夺冠?需连赢4大克星:3胜22负

魔鬼!郑钦文复制拉杜卡努10连胜夺冠?需连赢4大克星:3胜22负

顺静自然
2026-09-07 12:49:23
奔驰那封回执,把星宇的国内公关干沉默了

奔驰那封回执,把星宇的国内公关干沉默了

娱乐圈的笔娱君
2026-08-31 01:19:35
老胡,你也是掏上粪了!

老胡,你也是掏上粪了!

胖胖说他不胖
2026-09-07 09:55:26
1955年全军授衔之前,刘少奇坚持反对给陈毅授元帅军衔,周恩来听闻此事,立马写了封信,为什么陈毅能被授予元帅军衔呢?

1955年全军授衔之前,刘少奇坚持反对给陈毅授元帅军衔,周恩来听闻此事,立马写了封信,为什么陈毅能被授予元帅军衔呢?

纪史行者
2026-08-28 00:30:05
两个女生同名同姓、同年同月同日生还考上同校同专业,家长:希望两人成为姐妹,走得更远

两个女生同名同姓、同年同月同日生还考上同校同专业,家长:希望两人成为姐妹,走得更远

封面新闻
2026-09-06 21:49:06
人社局回应“星宇解约107名应届生”:93人已收到offer,推荐岗位超500个

人社局回应“星宇解约107名应届生”:93人已收到offer,推荐岗位超500个

手工制作阿爱
2026-09-07 17:18:55
连生4胎没领证,被全网嘲了十年"豪门梦碎":如今纪晓波欠债56亿跑路被通缉,全网才看懂,那张她最想要的结婚证,救了她一命

连生4胎没领证,被全网嘲了十年"豪门梦碎":如今纪晓波欠债56亿跑路被通缉,全网才看懂,那张她最想要的结婚证,救了她一命

黎兜兜
2026-09-06 21:12:20
中足联官网确认:申花进铜梁龙的第二球为吴曦打进

中足联官网确认:申花进铜梁龙的第二球为吴曦打进

懂球帝
2026-09-07 13:31:07
2026-09-08 02:08:49
智药局 incentive-icons
智药局
我们更懂药物创新
1308文章数 229关注度
往期回顾 全部

科技要闻

小米澎程N90 Max定价26.99万元

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

头条要闻

伊朗试验特殊武器爆炸场面如同地狱 美军舰直接跑了

体育要闻

压哨避开CBA选秀规则?NBL香港金牛队已为男篮国手王俊杰报备合同

娱乐要闻

热搜第一,演员李沐宸致歉

财经要闻

证监会原副主席王建军一审被判无期徒刑

汽车要闻

智能可变大空间SUV 小米澎程系列车型上市 20.99万起

态度原创

手机
亲子
旅游
公开课
军事航空

手机要闻

2026荣耀全球开发者大会日程公布,MagicOS 11定档9月15日

亲子要闻

三岁分床、五岁分房,真的可行吗?

旅游要闻

走进合川涞滩古镇 探寻三江之畔的人文底蕴

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

媒体:中美战区司令会晤释放的信号 台湾要听懂

无障碍浏览 进入关怀版