一个叫 Surface Evolver Bench 的榜单,测的不是聊天,也不是写代码,而是让大模型去写一种叫 Surface Evolver 的物理模拟数据文件。这个基准由 Yann Henon 创建,问的是同一个问题:LLM 智能体能不能写出完整的、能跑起来的液体表面模拟文件。
Surface Evolver 本身是一个存在多年的物理程序,专门用来建模由表面张力塑形的液体表面。这个基准把它变成了考题,一共 16 道任务,每道都要求智能体在几何约束、接触角、重力、体积条件之下,把一块液体表面模拟出来。
![]()
它到底怎么考
每道题不是让模型直接交答案,而是给了一个智能体循环:可以查文档、可以运行模拟器、可以反复调整,最后提交一份数据文件。模型每道题只跑一次,同一个模型的不同推理强度版本,会作为独立条目出现在榜单上。
评分是确定性的,而且带部分分。一道题要过三关:数据文件通过静态检查、完成一次隐藏的模拟运行、把隐藏的物理量(体积、面积、能量)在容差范围内对上参考解。
只有三关全过,这道题才算通过。这就是为什么榜单上通过率总是低于平均分——平均分是部分分的平均,通过率是更严格的二值判定。
分数和通过率,为什么差这么多
榜单数据来自公开的 Surface Evolver Bench 排行榜。图表里报的是平均分,也就是所有任务上的部分分平均值;更严格的二值通过率,则和数据一起保留在导出文件里。
这个设计其实挺有意思。部分分意味着模型只要做对了一部分检查,就能拿到分;但通过率要求的是全对。两个数字放在一起看,能看出模型是"接近做对"还是"真的做对"。
16 道题、每道一次运行、三关全过才算通过——这套规则把"看起来会"和"实际能跑"分得很开。对做智能体评测的人来说,这种确定性评分加部分分的组合,比单纯给个总分更能说明问题。
至于榜单上具体哪些模型排在哪、平均分和通过率各是多少,数据都在公开排行榜和导出文件里,可以自己去看。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.