网易首页 > 网易号 > 正文 申请入驻

南开大学等机构联合研究揭示:AI编程助手在复杂任务中表现不佳

0
分享至


这项由南开大学、上海人工智能实验室、上海交通大学等多家知名机构合作开展的研究发表于2026年2月的arXiv预印本平台,论文编号为arXiv:2602.14337v1。想象一下你雇佣了一个声称"无所不能"的编程助手,给它一份详细的软件开发需求书,结果几天后它交给你一个半成品——要么功能只完成了三成,要么虽然新功能勉强能用但把原有功能搞砸了。这正是当前最先进AI编程代理面临的尴尬处境。

在人工智能快速发展的今天,各种AI编程助手如雨后春笋般涌现,它们声称能够像人类工程师一样理解需求、编写代码、调试程序。然而,现有的评估基准就像是只考察厨师能否煎蛋的烹饪比赛——过于简单且脱离实际。真正的软件开发更像是准备一桌满汉全席,需要统筹规划、协调配合、持续数小时甚至数天的精细操作。

为了真正检验这些AI助手在复杂工程任务中的表现,研究团队构建了一个名为"LongCLI-Bench"的全新评估基准。这个基准就像是为AI助手设计的"软件工程师资格考试",包含20个精心筛选的复杂任务,每个任务都需要在命令行环境中完成多步骤的编程工作。这些任务并非凭空捏造,而是从超过1000个真实的计算机科学课程作业和实际工作流程中精挑细选出来的。

这些任务覆盖了软件开发的四个核心场景。首先是"从零开始"类型,就像让你在空地上盖一栋房子,需要AI助手完全凭借需求文档构建一个可运行的软件项目。其次是"功能扩展"类型,相当于在现有房屋基础上加盖二楼,要求AI助手为已有代码库添加新功能。第三是"bug修复"类型,如同房屋漏水需要找到根源并修补,AI助手必须诊断并解决代码中的复杂问题。最后是"代码重构"类型,类似于室内装修改造,在不影响原有功能的前提下优化代码结构。

研究团队特别创新性地采用了"双重考验"的评估方式。传统的测试就像只检查新装修的房间是否漂亮,而忽略了装修过程是否破坏了房屋的水电系统。这里的双重考验包括"从失败到成功"测试和"从成功到成功"测试。前者验证AI助手是否真正完成了新需求,后者则检查在实现新功能的过程中是否破坏了原有系统的正常运转。

更进一步,研究团队还引入了"步骤级评分"机制。这就像是烹饪比赛中不仅看最终菜品,还要观察厨师的每一个操作步骤。通过这种细粒度的评估,研究人员能够精确定位AI助手在漫长工作流程中究竟在哪个环节出了问题——是一开始的规划就有误,还是中途某个具体实现环节卡住了。

当前最优秀的AI编程助手包括商业产品Codex和Claude Code,以及基于开源框架OpenHands的各种模型。Codex使用GPT系列模型作为核心,能够通过专门设计的工具与代码库交互。Claude Code则采用Anthropic公司的Claude系列模型,同样具备强大的代码理解和生成能力。OpenHands作为开源方案,为研究社区提供了可定制的代理框架,支持多种开源大语言模型。

实验结果令人意外且发人深省。即使是表现最佳的Claude-Opus-4.6模型,其整体通过率也仅有16.7%,这意味着十个复杂任务中只能完整完成不到两个。更令人担忧的是,从步骤级分析来看,大多数AI助手在任务完成度达到30%之前就已经"罢工"了。这就像是马拉松选手刚跑出几公里就体力不支,根本无法应对长距离的挑战。

深入分析失败原因,研究团队发现了几个关键问题。首先是"重复陷阱"现象——AI助手遇到错误时往往会陷入机械式的重复尝试,就像一个人反复用同一把错误的钥匙开门,却从不思考是否应该换把钥匙或者检查门锁是否损坏。其次是"环境理解偏差",AI助手经常将环境配置问题误判为代码逻辑错误,导致修复方向完全错误。最后是"长期记忆缺失",在漫长的开发过程中,AI助手会逐渐"忘记"早期的约束条件或目标,导致后期工作与前期不一致。

令人欣慰的是,研究团队也探索了改善AI助手表现的方法。自我纠错机制能够带来一定程度的改善——当AI助手获得测试反馈后,它可以重新审视自己的工作并进行调整。然而,更显著的提升来自人机协作模式。

研究团队设计了两种人机协作方案。第一种是"静态计划注入",相当于在AI助手开始工作前给它一份详细的施工图纸,明确告诉它应该按什么顺序完成哪些子任务。第二种是"动态交互指导",允许AI助手在遇到困难时主动寻求人类专家的指导建议。实验结果显示,这两种协作方式都能显著提升任务完成率,其中组合使用时效果最佳。

这种协作模式的成功揭示了一个重要启示:与其一味追求AI的完全自主性,不如专注于构建高效的人机协作系统。就像现代飞行中,虽然自动驾驶系统已经非常先进,但在复杂情况下仍需要飞行员的判断和干预。AI编程助手的未来发展方向可能也是如此——在大部分常规工作中实现自动化,在关键决策点引入人类智慧。

从技术角度来看,这项研究还暴露了当前AI系统在处理长期依赖关系和维持上下文一致性方面的根本性挑战。软件开发本质上是一个需要全局思维和局部执行相结合的复杂过程,既要有宏观的架构规划能力,又要有微观的代码实现技巧。目前的AI模型虽然在单点能力上已经相当出色,但在协调这种多层次、长时间跨度的复杂任务时仍力不从心。

研究团队的工作也为AI编程工具的实际应用提供了重要参考。对于软件开发团队而言,这意味着当前的AI编程助手更适合承担辅助角色——帮助完成代码片段的生成、进行初步的bug检测、提供编程建议等,而不应期望它们能够独立完成大型项目的开发。合理的预期管理和恰当的任务分配将是发挥AI编程工具价值的关键。

展望未来,这项研究为AI编程能力的进一步发展指明了方向。除了继续提升模型的代码理解和生成能力外,增强长期记忆管理、改善上下文维持机制、优化错误恢复策略等都是亟待突破的技术难点。同时,开发更智能的人机交互接口,让AI助手能够更好地理解人类意图并适时寻求帮助,也将是一个重要的研究方向。

说到底,这项研究就像是给AI编程助手做了一次"全面体检",结果发现这些看似强大的工具在面对真正复杂的工程挑战时还存在不少"体能不足"的问题。但这并不意味着我们应该对AI编程的前景感到悲观。相反,正是通过这样严谨的评估和分析,我们才能更清楚地认识到当前技术的边界,找到最有效的改进路径。

就像任何新兴技术一样,AI编程助手的发展也需要经历从"概念验证"到"实用化"再到"成熟应用"的过程。目前我们还处在这个发展曲线的早期阶段,虽然已经看到了令人兴奋的可能性,但要真正实现"AI程序员"的愿景,还需要在技术突破和应用模式创新两个维度继续努力。

对于普通软件开发者而言,这项研究传达的信息是:AI编程工具已经可以成为有价值的工作伙伴,但还不能完全替代人类的判断和创造力。学会与AI协作,善用AI的优势来提升自己的工作效率,同时在AI力有不逮的地方发挥人类的独特价值,这可能是当前最明智的策略。毕竟,最好的团队往往不是由完全相同的成员组成,而是由具有互补技能的个体构成的。

Q&A

Q1:LongCLI-Bench是什么?

A:LongCLI-Bench是一个专门评估AI编程助手处理复杂长期任务能力的测试基准,包含20个从1000多个真实编程任务中精选出来的复杂项目,涵盖从零开始开发、功能扩展、bug修复和代码重构四种场景。

Q2:为什么最先进的AI编程助手通过率只有不到20%?

A:主要原因包括AI助手容易陷入重复错误的循环、无法准确理解环境配置问题、在长期任务中会逐渐忘记早期的约束条件,以及缺乏有效的全局规划和局部执行协调能力。

Q3:人机协作如何提升AI编程助手的表现?

A:研究发现通过给AI助手提供详细计划指导和允许它主动寻求人类专家建议,可以将任务完成率从16.7%提升到61.7%,这说明AI助手在人类指导下能够发挥更大价值。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
詹姆斯父子再同队难度暴增!湖人不愿轻易交易布朗尼 除非有重磅筹码

詹姆斯父子再同队难度暴增!湖人不愿轻易交易布朗尼 除非有重磅筹码

醉卧浮生
2026-07-22 07:52:24
一年亏损4千万,全国陷“关停潮”,曾经的金饭碗,彻底变天了!

一年亏损4千万,全国陷“关停潮”,曾经的金饭碗,彻底变天了!

青眼财经
2026-07-20 15:50:54
生物进化论残酷真相:雌性不会选择基因最优秀的雄性,却会选让它“安全感拉满但基因平庸”的雄性托付终身,这是物种延续最反直觉底层逻辑

生物进化论残酷真相:雌性不会选择基因最优秀的雄性,却会选让它“安全感拉满但基因平庸”的雄性托付终身,这是物种延续最反直觉底层逻辑

心理观察局
2026-07-22 07:01:07
帅啊!中国外卖服获法国设计金奖!网友:“法国是不是热疯了!”

帅啊!中国外卖服获法国设计金奖!网友:“法国是不是热疯了!”

LOGO研究所
2026-07-19 09:53:46
“最没用的兜底!”男孩在山姆不结账吃烧鸡被喷,半分教养都没有!

“最没用的兜底!”男孩在山姆不结账吃烧鸡被喷,半分教养都没有!

林林先生
2026-07-20 14:08:36
米利西奇主动辞去中国女足主帅职务,这剧本好熟悉,想起了里皮

米利西奇主动辞去中国女足主帅职务,这剧本好熟悉,想起了里皮

姜大叔侃球
2026-07-22 17:21:13
“月之暗面”创始人杨植麟美国博导:苹果谷歌的邀约,都没让他放弃回国创业的初心

“月之暗面”创始人杨植麟美国博导:苹果谷歌的邀约,都没让他放弃回国创业的初心

红星新闻
2026-07-22 17:49:28
大生意!因凡蒂诺:国际足联美加墨世界杯周期收入将超150亿美元

大生意!因凡蒂诺:国际足联美加墨世界杯周期收入将超150亿美元

体育大生意
2026-07-22 10:43:44
闹大了!韩红黑料越扒越狠,央视表态后,网友怒了:开除军籍党籍

闹大了!韩红黑料越扒越狠,央视表态后,网友怒了:开除军籍党籍

曹莽看世界
2026-07-20 21:01:40
马宁回应“国安配马宁,能赢阿根廷”热梗:我觉得没什么,开开玩笑玩玩梗,这就是球迷最可爱的一面

马宁回应“国安配马宁,能赢阿根廷”热梗:我觉得没什么,开开玩笑玩玩梗,这就是球迷最可爱的一面

鲁中晨报
2026-07-22 20:28:26
省厅遇见已经是局长的前女友,她撕了我工作证,省长帮我捡了起来

省厅遇见已经是局长的前女友,她撕了我工作证,省长帮我捡了起来

千秋文化
2026-07-17 19:15:49
全球浆果巨头怡颗莓检出8种永久致癌物,常年卖3倍高价!国内下架

全球浆果巨头怡颗莓检出8种永久致癌物,常年卖3倍高价!国内下架

大稻网络科技
2026-07-21 11:59:55
巴迪略:帕雷德斯你这条狗,滚一边哭去吧你

巴迪略:帕雷德斯你这条狗,滚一边哭去吧你

懂球帝
2026-07-22 10:39:34
苗原:韩鹏在足协9月职业级教练证书培训班的待定名单中

苗原:韩鹏在足协9月职业级教练证书培训班的待定名单中

懂球帝
2026-07-22 15:48:07
众人都觉得这支一万三千人的杂牌军必败,其海量弹药火力重创日军,上千敌军阵亡后敌方才幡然醒悟

众人都觉得这支一万三千人的杂牌军必败,其海量弹药火力重创日军,上千敌军阵亡后敌方才幡然醒悟

磊子讲史
2026-07-14 09:56:30
琼瑶用80年才明白的3句话,我希望你20岁就知道

琼瑶用80年才明白的3句话,我希望你20岁就知道

小鱼盈盈讲故事
2026-07-11 21:35:11
洗个头花2万!宁波警方破获特大美发诈骗案,细节披露:店家偷偷将面膜颗粒涂抹到顾客头皮上谎称是“虫卵”,进而推销天价“药水”

洗个头花2万!宁波警方破获特大美发诈骗案,细节披露:店家偷偷将面膜颗粒涂抹到顾客头皮上谎称是“虫卵”,进而推销天价“药水”

极目新闻
2026-07-22 13:11:06
口碑翻车!郑州的方中山紧急停业:一碗胡辣汤,败给了卫生底线

口碑翻车!郑州的方中山紧急停业:一碗胡辣汤,败给了卫生底线

童童聊娱乐啊
2026-07-22 15:01:51
492分进八大校,728分无缘一中?东莞中考名额分配太意外

492分进八大校,728分无缘一中?东莞中考名额分配太意外

糖逗在娱乐
2026-07-22 17:48:10
《澎湖海战》集体翻车:给影视圈敲响的4记硬核警钟,再也没人能靠主旋律躺赢

《澎湖海战》集体翻车:给影视圈敲响的4记硬核警钟,再也没人能靠主旋律躺赢

浪子说
2026-07-22 00:23:11
2026-07-22 21:19:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9274文章数 567关注度
往期回顾 全部

科技要闻

马斯克看笑了:谷歌什么都有 偏偏没最强AI

头条要闻

女生高考后和妈妈"扛砖赚学费"被质疑摆拍 当事人发声

头条要闻

女生高考后和妈妈"扛砖赚学费"被质疑摆拍 当事人发声

体育要闻

阿根廷的亚军:单核足球的极限?

娱乐要闻

47岁汤唯宣布二胎产子 大女儿10岁

财经要闻

宜家出售八城"蓝盒子" 30年大店逻辑生变

汽车要闻

上汽贾健旭谈汽车全球化:出海要合规 欧洲人只爱小车是误解

态度原创

家居
手机
亲子
本地
公开课

家居要闻

2026建博会(广州) 公装联探展交流活动

手机要闻

2000 元手机怎么选?避开三大套路,看完不再盲目跟风交学费

亲子要闻

先做买只炸毛蛋的好朋友还是先做丑蛋的家人?

本地新闻

杭州诗意路名,自带氛围感

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版