网易首页 > 网易号 > 正文 申请入驻

拜拜了SWE-Bench!Cursor刚发了个AI Coding评测基准,难哭Claude

0
分享至

一水 发自 凹非寺
量子位 | 公众号 QbitAI

编程智能体时代,顶流Cursor举旗发布新的评测基准——

CursorBench,专门评价Cursor中不同模型谁更“智能体”(即高效执行复杂任务)。

结果你猜怎么着?曾在SWE-Bench上威名赫赫的Claude Haiku 4.5/Sonnet 4.5全部歇菜了。

  • Claude Haiku 4.5的分数从73.3→29.4;
  • Claude Sonnet 4.5的分数从77.2→37.9。

而这,也恰好体现了CursorBench和其他编程基准之间的区别:

  • SWE-Bench衡量的是程序能否解决问题,CursorBench衡量的是程序能否高效地解决问题。这种差距正是普通基准测试所无法弥补的——在真实的token约束下完成任务。



“龙虾”当道,谁都知道现在评价AI要看执行能力,而且还是要高效执行那种。

而CursorBench的出现,恰好填补了相关空白。

不过问题来了,CursorBench具体咋评的?

线上+线下混合评

关于咋评的这个问题,Cursor还专门撰写了一篇博客。



一上来,Cursor就介绍了一个基本背景——

随着AI编程助手越来越像“智能体”,目前很多公开的benchmark已经不够用了

问题呢主要有这么三个:

一是任务类型不真实

以大家比较熟知的benchmark为例,SWE-Bench主要是修复GitHub issue的bug,任务比较单一。

Terminal-Bench虽然不再局限于代码仓库,但更偏向各种“谜题式任务”,比如根据给定环境完成一系列挑战,此时AI更像是在参加某种竞赛而非进行日常开发。

所以Cursor就说了,“我们发现,这些任务与开发者要求智能体完成的编程工作并不契合”。

现实生活中更常见的是,开发者会要求AI修改多个文件、分析生产日志、运行实验……总之比基准更复杂。

二是评分机制不合理

很多公开基准通常都假设——一个问题只有一个正确答案。

但现实是,一个需求可能有多种实现方式,不同方案的代码风格、架构选择都有可能不同。

这就往往会导致两种情况:要么直接给正确的方案打叉(出现误判)、要么直接为了可评估性而强行消除模糊性(人为施加限制)。

无论是哪一种,基准都无法反映真实情况。

三是公认的数据污染问题

这一点就不必多说了,一旦基准出现够久,后来的模型很可能就会直接抓取这些基准数据进行训练。

所以,在这种近乎“透题”的情况下进行评分,其结果到底有多大价值就可想而知了。



而面对这些问题,Cursor拿出了一套“线上+线下混合评”的全新方案。

线下就是我们说的CursorBench,流程也相对简单——

让不同模型都去完成同一批标准任务,然后系统从正确性、代码质量、效率、交互行为等维度进行打分,最终每个模型都能拿到一个离线benchmark分数。

采用这种标准化流程的好处显而易见,包括可以相对而言把模型拉到同一起跑线进行比较、可以重复测试、成本也相对可控。

不过有人可能就说了,这和其他基准好像没差啊?

别急,CursorBench的“制胜法宝”在这里——选的任务不一样

其不一样体现在三个维度:

一是任务真

以前的基准更像是“刻意找题”,找GitHub issue、找各种谜题;而CursorBench的题都来自自家Cursor平台。

Cursor有一个工具叫Cursor Blame,它可以追踪某一段代码是由哪个AI请求生成的。

于是就能拿到这样一对对真实数据——开发者请求+某个模型最终提交的代码。

而这些,就构成了CursorBench绝佳的“出题范本”。而且Cursor补充道:

  • 许多任务来自我们的内部代码库和受控来源,从而降低了模型在训练阶段见过这些任务的风险。我们每隔几个月就会更新一次这套基准,以跟踪开发者使用智能体方式的变化。

二是任务规模大

如今用Cursor的人实在太多了,所以CursorBench的任务规模明显更大。

比如在正确性评估中,无论从代码行数还是平均文件数来看,其问题规模从初始版本到当前的CursorBench-3大致翻了一倍。Cursor表示:

  • 虽然代码行数并不是衡量难度的完美指标,但该指标上的增长反映了我们将更具挑战性的任务纳入CursorBench 的方式,例如处理monorepo的多工作区环境、排查生产日志,以及执行长时间运行的实验。



三是任务描述刻意保持“模糊”

这点也比较好理解。

很多公开基准里的任务描述通常非常详细,但现实中大家和AI说话时往往模棱两可。

所以太精准反而与真实相悖。



至此,基于以上特殊设计,CursorBench成了编程智能体时代真正以“真实开发场景”为原点设计的基准测试。

当然这还没完,光做题怎么够呢?很多AI线下分数高,但用户一上手就发现很拉胯。

对此,Cursor还搞了一套线上评测——直接看真实用户使用效果

他们会使用A/B Test这种方式,观察一部分用户用模型A、另一部分用户用模型B之后的对比效果。

具体主要看开发者是否接受AI生成的代码、是否继续追问、是否撤销修改、任务是否真正完成等可追踪的产品指标。

如此一来,线上和线下就可以形成完美互补,甚至形成良性循环——

线下CursorBench先快速筛选模型能力,然后线上验证模型是否真的更好,发现偏差后再去调整benchmark或模型

飞轮这不就起来了(doge)。

所以,结果呢?

那么模型们在新基准CursorBench上的表现如何呢?

来看最终performance(越靠近右上角越好,代表“以最低成本实现最高性能”):



见此图表,网友们一时讨论连连:

啧,没想到Claude Sonnet 4.5的“性价比”有点低啊。



这个Composer模型(Cursor自研编码模型)又是哪里冒出来的。



Anyway,从Cursor公布的结果来看,一个很明显的结论是——

CursorBench在前沿模型之间的区分度明显更高

这个其实是自然而然的。基准一饱和,模型们往往拉不开差距,大家分都高、都好。

但一遇到新的、难的,实力差距便自然显露了。

尤其在CursorBench这种任务规模更大、环境更复杂的基准上,差距无疑将被进一步放大。

只需对比模型在SWE-Bench和CursorBench上的得分就能看出来了(左边全挤在一起、右边呈阶梯式):



以及Cursor还强调了一点——

CursorBench的排名,与真实用户体验更加一致

通过前面提到的线上实验,他们发现CursorBench的模型排名,和这些线上指标变化基本是同方向的。



接下来,Cursor还将着手开发下一代评测套件:

  • 虽然CursorBench-3的任务比公开基准上的任务持续时间更长,但它们仍然可以在一次会话内完成。我们预计在未来一年里,绝大多数开发工作将转向由在各自计算机上独立运行的长时运行智能体来完成,因此我们也正规划对CursorBench作出相应调整。

嗯,瞄准的还是智能体,只不过是运行时间更长的智能体。


[1]https://x.com/cursor_ai/status/2032148125448610145
[2]https://cursor.com/cn/blog/cursorbench
[3]https://www.objectwire.org/technology/cursor

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
正告台独:中国收复的是土地,不是所有人!

正告台独:中国收复的是土地,不是所有人!

叶葉夜
2026-08-27 17:48:53
海里明明有很多鱼,为何海盗们在船上饥肠辘辘,却不吃海里的鱼?

海里明明有很多鱼,为何海盗们在船上饥肠辘辘,却不吃海里的鱼?

壹知眠羊
2026-07-05 07:05:39
胡锡进再发长文痛批孙宇晨:孙宇晨想要休战,但他的做法不是道歉,而是“关灯”,是给景甜未来关灯

胡锡进再发长文痛批孙宇晨:孙宇晨想要休战,但他的做法不是道歉,而是“关灯”,是给景甜未来关灯

韩小娱
2026-08-30 06:15:47
“发现了一个女士皮包,没有发现……” 现场搜救人员将每一件物品逐一清点、仔细登记、妥善保管。搜救,仍在继续……

“发现了一个女士皮包,没有发现……” 现场搜救人员将每一件物品逐一清点、仔细登记、妥善保管。搜救,仍在继续……

政知新媒体
2026-08-30 20:36:50
善恶有报,黄有龙案判了,更多恶行被扒,幸亏赵薇留了张“好牌”

善恶有报,黄有龙案判了,更多恶行被扒,幸亏赵薇留了张“好牌”

梦在深巷qw
2026-07-09 07:20:47
多位亲人失联,村支书边巴回忆:我也想哭,但作为党员,要马上组织群众,把他们送到安全地方,来不及难过

多位亲人失联,村支书边巴回忆:我也想哭,但作为党员,要马上组织群众,把他们送到安全地方,来不及难过

极目新闻
2026-08-30 11:07:45
中国永远无法原谅的5个国家,日本只排在第二位,真正排在第一的名字,很多人第一次听到都会愣住

中国永远无法原谅的5个国家,日本只排在第二位,真正排在第一的名字,很多人第一次听到都会愣住

纪史行者
2026-08-30 00:25:03
俄乌战场出现中国痕迹,难怪俄军突然激进,乌军发现端倪可惜晚了

俄乌战场出现中国痕迹,难怪俄军突然激进,乌军发现端倪可惜晚了

云上乌托邦
2026-08-28 16:29:04
湖人消息:东契奇或申请交易,无缘库明加原因曝光,哄抢冠军前锋

湖人消息:东契奇或申请交易,无缘库明加原因曝光,哄抢冠军前锋

冷月小风风
2026-08-30 11:10:29
八千万欧元买个“无球跑动”?诺坎普八万球迷集体起立,这掌声扇了谁的脸!

八千万欧元买个“无球跑动”?诺坎普八万球迷集体起立,这掌声扇了谁的脸!

陌上初安j
2026-08-30 00:37:48
南部战区亮剑:菲律宾宣布长期封锁黄岩岛,先问问解放军答不答应

南部战区亮剑:菲律宾宣布长期封锁黄岩岛,先问问解放军答不答应

一簌月光
2026-08-27 17:11:55
我采访过的孙宇晨

我采访过的孙宇晨

娱乐硬糖
2026-08-30 17:12:09
热刺主帅证实理查利森等多人申请离队,称绝不强留无心恋战者

热刺主帅证实理查利森等多人申请离队,称绝不强留无心恋战者

星耀国际足坛
2026-08-30 23:46:26
玥儿已经开学了,筱梅跟霖霖手牵手逛夜市,霖霖朋友阿嬷说漏了嘴

玥儿已经开学了,筱梅跟霖霖手牵手逛夜市,霖霖朋友阿嬷说漏了嘴

人间烟火记事本
2026-08-29 22:24:14
央视直播决赛时间再调整!今晚6点45分开,冲冠之战牵动球迷心弦

央视直播决赛时间再调整!今晚6点45分开,冲冠之战牵动球迷心弦

阿凫爱吐槽
2026-08-31 01:24:24
苹果下半年新品曝光:AirPods 5、OLED iPad mini要来了

苹果下半年新品曝光:AirPods 5、OLED iPad mini要来了

IT之家
2026-08-30 23:41:05
心理学上说:越是分房睡、经济AA制、不干涉对方隐私的夫妻,感情浓度往往越低,这叫心有隔阂,情无归处,爱已疏离,已把婚姻变成合租模式

心理学上说:越是分房睡、经济AA制、不干涉对方隐私的夫妻,感情浓度往往越低,这叫心有隔阂,情无归处,爱已疏离,已把婚姻变成合租模式

黎兜兜
2026-08-29 12:16:18
向太揭秘捧儿子拍《封神》内情:本稳赚数亿,却被老公操作搞到巨亏

向太揭秘捧儿子拍《封神》内情:本稳赚数亿,却被老公操作搞到巨亏

喜欢历史的阿繁
2026-08-28 08:53:24
集体抽筋!中国女排体能储备远不及泰国,吴梦洁庄宇珊先后被累倒

集体抽筋!中国女排体能储备远不及泰国,吴梦洁庄宇珊先后被累倒

杨华评论
2026-08-30 22:10:47
50天狂卖5500万瓶!三得利罪恶碳酸饮料,被自律人买疯了

50天狂卖5500万瓶!三得利罪恶碳酸饮料,被自律人买疯了

Foodaily每日食品
2026-08-12 08:15:56
2026-08-31 02:56:49
量子位 incentive-icons
量子位
追踪人工智能动态
13234文章数 176544关注度
往期回顾 全部

科技要闻

OpenClaw:红过,爱过,散了

头条要闻

媒体:曾是商务标配 中国男人正在"抛弃"皮鞋

头条要闻

媒体:曾是商务标配 中国男人正在"抛弃"皮鞋

体育要闻

库明加和狼,突破天花板差的那一点距离

娱乐要闻

梅艳芳母亲覃美金离世,享年102岁

财经要闻

纪念币骗局触碰法律红线!专坑老人!

汽车要闻

巨幕长联屏/天神之眼/云辇-C 方程豹钛9将于四季度上市

态度原创

本地
艺术
时尚
教育
公开课

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

艺术要闻

情绪暴击!90后天才摄影师,用忧郁镜头把女性之美拍成诗,每一帧都让人沦陷!

乐福鞋,搞定一周穿搭

教育要闻

老师也要“幼升小”、“小升初”了,上海探索跨学段教师转岗

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版