网易首页 > 网易号 > 正文 申请入驻

四周优化30个模型,最强AI也只做到67%

0
分享至

不到四周,30多个开源生物分子模型被重写了一遍。AlphaFold3、Boltz-2、Chai-1、ESMFold2、RFdiffusion,这些名字在生物计算圈里几乎等于基础设施。Anthropic 公布的结果是:允许少量数值精度变化时,任务平均加速约 4 倍;要求输出完全一致时,平均加速接近 2 倍。相关代码同步开源。

更值得琢磨的是干活的方式。代码优化主要由 Claude 自己完成,盯着它的只有两名 Anthropic 技术人员。这两人懂生物建模,但按报告的说法,他们并不具备传统意义上的推理优化或 GPU kernel 工程背景。


这份报告回答的是"AI 能不能做到"。它没回答的是另一个问题:AI 写出来的科学代码,离榨干硬件性能还有多远。

一段跑得通、却慢了三倍的代码

几乎同一时间,一个开源项目试图接住这个问题。9 月 17 日,AItonomy Foundation 发布首个开源项目 ScienceIDE,赞助方为 PhAI Labs 与阿里 Qwen。它要做的事,是把世界上的科学代码库转化成可执行、可验证的学习环境。

筹备期间,团队在等离子体物理与天体物理代码上做过一次实验,对象是 PLUTO。这是一套广泛使用的高性能科学计算代码,代表性论文发表于 2007 年,覆盖流体力学、磁流体力学、相对论流体力学与相对论磁流体力学等多个物理系统。

它的复杂度不在代码量上。以流体和磁流体计算为例,Godunov 型激波捕捉格式要把空间重构、网格界面的黎曼求解器和时间推进组织成完整流程,每一步都有自己的数据依赖、访存模式和数值稳定性要求。磁流体模拟还要处理磁场无散条件,约束输运与散度清理把额外的物理约束直接带进了数值实现。

团队在 M1 Ultra、A100 和 H100 上重新实现 PLUTO 的磁流体力学模块。A100 的一次测试里,AI 生成的第一版实现已经能跑,检查的算例上也得到符合预期的物理结果;但相对团队使用的 128 核 CPU 节点配置,速度提升还不到 5 倍。随后团队用一两天时间与 AI 一起分析瓶颈,调整数据布局、内存访问、kernel 组织以及不必要的数据搬运。在不改变所求解物理问题的前提下,这套 GPU 实现的速度又提高到第一版的接近 3 倍

也就是说,AI 已经把代码"写出来"之后,仍然留下了数倍的性能空间。要继续挖这部分空间,AI 必须能测量、诊断、修改、验证,再根据结果继续迭代。数据布局怎么匹配线程访问?相邻线程能否形成合并访存?哪些中间结果值得缓存,哪些可以重算以减少内存流量?kernel fusion 能不能减少启动开销,又会不会增加寄存器压力、影响 occupancy?这些都得靠 profiling 和实际运行来判断。

跑得通,不等于算得对

性能优化始终伴随另一个问题:改写后的程序,还能不能可靠地回答原来的研究问题。

Anthropic 的报告里有个现成的例证。为了测试优化极限,他们让 Claude 在单个 8 卡 B300 节点上预测 31,000 到 70,000 token 以上的完整病毒衣壳和蛋白区室。推理全部跑通了,这本身就是此前需要多节点集群才能做的事。但报告写得很直接:这些结构没有被正确预测。报告分析指出,预测结构发生坍塌,模型在训练上下文近两个数量级之外缺乏泛化能力。

程序能跑,不代表科学上正确。判断一个科学结果对不对,要拿它去和科学参考答案比对,而不是看程序有没有报错退出。

放到科学代码加速这件事上,判据很具体:质量与能量的守恒误差是否可控?磁场散度是否满足所选数值方法的要求?激波位置、波传播速度和关键物理量是否与参考结果一致?不同的科学问题,验收标准也不一样。不把这些定下来,一个程序完全可以通过少算几步、降低分辨率或跳过重要过程变快,同时失去原来的用途。ScienceIDE 把这一点称为科学等效性,并把它写成了任务是否算完成的判据。

最强的模型,也只做到 67%

如果一次成功的优化只是一个交付物,那它只能被使用,不能被学习。ScienceIDE 想解决的是后一件事。

做法是:由领域专家定义科学算例与验收标准,再与 AI 一起把代码库整理成可执行环境。在这些环境里,AI 完成任务、运行程序、检查科学结果,经过验证的交互经验被用于评测、监督微调和强化学习。

论文报告的集合包含来自 27 个科学代码库64 个环境2,812 个任务,以及 1,076 项可执行的科学检查,覆盖天体磁流体、空间等离子体、海洋气候、引力 N 体、光子学与电磁、材料、量子、相对论、粒子探测器、免疫学等方向。任务分为加速、修复、发现、复现、集成、标定、实现七类。当前任务主要集中在代码修复与功能实现,加速类任务还只有初步实例。

为了衡量难度,团队挑出 85 个难任务作为公开评测集 ScienceIDE-Hard,来自 PLUTO、Athena++、MITgcm、LAPS、PHANTOM 等环境,包含 52 个修复任务和 33 个实现任务。判定标准是在任务的验收条件下与私有科学参考答案一致,而不是执行成功。

参评的是来自 8 家厂商的 15 个模型,通过 Codex、Claude Code 或 Gemini CLI 执行,每个 episode 一小时预算。结果:

  • Claude Fable 5.1:67.1%
  • Claude Opus 5:64.6%
  • GPT-6-astra:63.1%
  • 一半以上的前沿模型停在 30% 以下

真正的科学任务,远没有被解决。

科学不只是应用场景,也可能是训练场

这项工作还有另一侧结果。团队用经过验证的科学交互轨迹做监督微调,训练并开源了 PhAI-IDE-4B、9B、72B 三个规模的模型。提升的不只是科学任务本身,代码、推理、知识三类通用基准同时受益。

在 72B 上,APPS Introductory 从 0.609 提升到 0.672,LiveCodeBench Execution 从 0.539 提升到 0.594;在 9B 上,BBH Word Sorting 从 0.240 提升到 0.576。

这组结果指向一个判断:科学不只是 AI 的应用场景,也可能是推高智能上限的训练场。与常规代码任务相比,科学任务天然更长程,也更依赖对物理约束与数值行为的理解。

AItonomy Foundation 是一个注册在硅谷的非营利组织,愿景是加速 AI 与科学之间的闭环。按其官网表述,这两个方向都依赖可靠的反馈:模型提出的假设需要通过计算或实验接受检验;科研过程中产生的数据、操作记录与失败尝试,也需要经过整理和验证,才能成为模型的学习材料。论文能传递研究成果,却往往难以完整保留得出成果之前的判断、调整与试错。

目前参与的研究者来自伯克利、CMU、康奈尔、加州理工、哈佛、MIT、牛津、UCL、普林斯顿、斯坦福等二十余所机构,以个人身份参与。团队还公开表示,希望把 Anthropic 此次开源的 36 个优化包整理成 ScienceIDE 环境——这些包附带参考实现和可度量的验收标准,条件接近理想。如果这件事成立,社区将不只是使用这批优化的结果,而是能在这类工作上训练和评测模型。

PLUTO 那次实验给出的答案是数倍。要把这数倍拿到手,靠的不是更强的一次生成,是测量、诊断、修改、验证,再迭代。Anthropic 的报告证明了模型有能力做这类工作;ScienceIDE 想回答的是下一个问题:怎样让这种能力持续积累,把一次次成功的优化,变成 AI 可以反复学习、验证,并迁移到新问题上的经验。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
Lisa参加肥伦秀不敢开麦演唱,以纯访谈形式进行,美国观众不惯着

Lisa参加肥伦秀不敢开麦演唱,以纯访谈形式进行,美国观众不惯着

芊手若
2026-09-18 13:18:28
三喜临门!山东泰山队迎3个好消息,泽卡荣获最佳,梯队迎5连冠

三喜临门!山东泰山队迎3个好消息,泽卡荣获最佳,梯队迎5连冠

王大发不懂球
2026-09-19 21:29:17
历史上唯一一张亲王腰挂佩刀骑马照,光绪皇帝的生父醇亲王!

历史上唯一一张亲王腰挂佩刀骑马照,光绪皇帝的生父醇亲王!

小豫讲故事
2026-09-19 06:00:14
沙特和以色列一拍即合,巴基斯坦土耳其联盟已吹了

沙特和以色列一拍即合,巴基斯坦土耳其联盟已吹了

移光幻影
2026-09-19 21:34:25
全网骂翻!陈小春封箱退场被喷耍大牌!揭穿内娱最荒唐的双标现场

全网骂翻!陈小春封箱退场被喷耍大牌!揭穿内娱最荒唐的双标现场

情感大头说说
2026-09-17 09:53:03
惨败日本后!郭士强、篮协正式发声,“下课”冲上热搜

惨败日本后!郭士强、篮协正式发声,“下课”冲上热搜

暗香暗香
2026-09-19 18:09:53
饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

饶颖:赵忠祥与我发生关系7年,他的特殊性癖,让我身心受到伤害

林轻吟
2026-09-19 16:09:02
秦王级别墓葬现世!墓主或为秦始皇嫡祖母

秦王级别墓葬现世!墓主或为秦始皇嫡祖母

91.6陕西交通广播
2026-09-18 20:56:20
崔永元曝敬一丹抢救细节:挺过18天最凶险阶段,一度能自主呼吸

崔永元曝敬一丹抢救细节:挺过18天最凶险阶段,一度能自主呼吸

普陀动物世界
2026-09-19 01:34:16
亨普梅开二度,曼城险胜利物浦

亨普梅开二度,曼城险胜利物浦

星河漫山野
2026-09-19 05:29:53
问界之后,享界也要“单飞”?

问界之后,享界也要“单飞”?

车轱辘话V
2026-09-19 11:49:55
30周年庆:7款PC游戏打包15美元,总价值214美元

30周年庆:7款PC游戏打包15美元,总价值214美元

时光慢旅人
2026-09-19 03:40:21
31岁医学女博士辞去医生工作,送外卖、做驻唱:想试试生活有多少种可能

31岁医学女博士辞去医生工作,送外卖、做驻唱:想试试生活有多少种可能

扬子晚报
2026-09-17 20:39:38
CCTV5+直播!国足亚运队PK伊朗,赢球=提前出线,超龄球员继续挑大梁

CCTV5+直播!国足亚运队PK伊朗,赢球=提前出线,超龄球员继续挑大梁

绿茵舞着
2026-09-20 01:25:12
马竞vs皇马,马竞主帅西蒙尼在赛前采访中谈穆帅:由衷敬重穆里尼奥,经常学习穆的比赛!

马竞vs皇马,马竞主帅西蒙尼在赛前采访中谈穆帅:由衷敬重穆里尼奥,经常学习穆的比赛!

福酱的小时光
2026-09-20 05:33:07
波兰竟也来插手南海?中方无需再忍,主动破局,果断收复关键岛屿

波兰竟也来插手南海?中方无需再忍,主动破局,果断收复关键岛屿

心灵的触动a
2026-09-19 05:26:34
高晓松要拍《林徽因传》,被梁再冰警告:“你要是拍我妈和徐志摩的感情线,我告你破产!”高晓松满脸不快

高晓松要拍《林徽因传》,被梁再冰警告:“你要是拍我妈和徐志摩的感情线,我告你破产!”高晓松满脸不快

背包旅行
2026-09-15 10:01:19
当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

当年一针疫苗没打的500万人,如今结局出人意料,太真实了!

坠入二次元的海洋
2026-09-11 00:35:48
故事:天涯神帖被还原,据说这是马航出事最接近的真相

故事:天涯神帖被还原,据说这是马航出事最接近的真相

飞云如水
2024-11-03 22:02:02
5根标枪全折断!亚运头号夺金热门遭重大事故,冲金之路蒙上阴影

5根标枪全折断!亚运头号夺金热门遭重大事故,冲金之路蒙上阴影

排球黄金眼
2026-09-19 06:19:49
2026-09-20 06:12:49
字节漫游指南
字节漫游指南
有态度网友ytd
193文章数 117关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

厨师被指在餐馆扎血测艾滋病 老板:有关部门已介入

头条要闻

厨师被指在餐馆扎血测艾滋病 老板:有关部门已介入

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

甜度爆表!许嵩冯禧晒婚纱照官宣结婚

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

健康
亲子
时尚
公开课
军事航空

脑动脉瘤的治疗方法,该选哪一种?

亲子要闻

从“世界高品质”到“透明真安心”,好奇诠释48年品质坚守

早秋外套别总穿黑色,准备一件黄色针织衫,温柔大方又减龄

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普再称对伊朗战争将很快结束

无障碍浏览 进入关怀版