![]()
![]()
模型参数更大、推理更快、对话更像人,曾经是大模型厂商最常强调的能力。今年,变化更明显地发生在产品端:厂商竞争的重点不再只是模型本身,还包括 AI 能进入多少真实工作流程、最终交付什么结果。
OpenAI 将 Codex 带入 ChatGPT,让用户能够从对话直接进入代码修改、测试和项目执行;Anthropic 持续扩展 Claude Code 的任务执行入口;阿里的千问、字节的豆包也在向研究、办公和开发等具体场景延伸。产品路径各不相同,但方向逐渐一致:把 AI 从“会聊天”推向“能干活”。
当 AI 能够接住一项完整任务,评价标准也随之改变。一份财务报告、一次数据分析或一段代码开发,都要求系统理解目标、拆解步骤、调用工具,并按照指定格式交付结果。完成这些工作之后,AI 才不只是提供答案的工具,而是开始进入真实的生产流程。
百度文心助手也在沿着这条路线推进。其任务 Agent 开始覆盖内容创作、数据分析、研究和代码运维等多步骤任务。2026 年 7 月,文心助手任务 Agent 以 Orion Mission Mode 参加 PinchBench v2,在当时公布的评测结果中,以 94.6%的综合成功率和94.4%的平均得分位列第一。
这项成绩提供了一个观察百度 AI 产品的新入口:在大模型从对话助手走向任务助手的过程中,文心助手如何组织搜索、模型和工具能力,又能否将复杂任务稳定地转化为可用结果。
文心助手位列龙虾产品测评第一
8 月 4 日,SuperCLUE-XClaw 发布最新一期龙虾产品测评榜单。在十款参评的国产“龙虾”产品,即具备自主任务执行能力的AI智能体产品中,百度文心助手综合排名第一。
SuperCLUE 是国内第三方中文大模型评测体系之一,其结果常被媒体和研究机构引用。此次测评覆盖代码开发、内容创作、数据处理、记忆能力和研究分析五个维度,题目均设置了具体任务和明确的交付要求。
从最终结果看,文心助手综合排名第一,五个维度的得分均超过90分。其中,代码开发得分90.28分,内容创作得分99.44分,数据处理以98.86分位列第一,研究分析得分96.44分,记忆能力则获得100分。五项指标覆盖代码及应用开发、内容生成、数据分析、信息研究和长流程任务等不同场景,反映了产品处理多类任务的综合表现。
![]()
在五项指标中,记忆能力直接影响多步骤任务的连续性。与单轮问答不同,任务型AI在生成报告、分析数据或开发应用时,通常需要跨越多个执行环节。系统不仅要保留用户最初提出的目标和限制,还要持续调用每一步产生的中间结果,避免后续执行偏离方向。文心助手在该项测评中获得满分,显示其在测试范围内处理长流程任务、保持上下文约束方面表现较为稳定。
文心助手多次登顶国内外权威榜单
SuperCLUE-XClaw 并不是文心助手近期获得的唯一一项榜单成绩。7月20日,工程向AI智能体评测榜单 PinchBench v2 发布结果,文心助手任务 Agent 在 59 个参评对象中位列第一,Best Score 为 94.6%,Average Score 为94.4%。
![]()
PinchBench v2由Kilo AI运营,以148项企业自动化任务为评测核心,覆盖内容创作、数据分析、研究、代码开发和运维等场景,相关榜单快照累计完成617次测试运行。参评对象包括qwen3.7 max、Claude Opus 4.8-fast、GPT-5.6-luna等海内外头部模型。相比主要考察知识和回答质量的模型测试,PinchBench更关注智能体能否调用工具、组织多个执行步骤,并按照要求生成可验证的交付物。
这份榜单的参评阵容并不轻松,Claude Opus 4.8-fast、通义千问 Qwen3.7-max、GPT-5.6-luna 等全球主流模型都在同一评测范围内。文心助手任务 Agent 能在其中排名第一,尤其是在工具调用、多步骤任务规划与长程执行等维度得分突出,说明这不是某个单项能力的偶然领先,而是综合任务处理能力的整体优势。
一个月内,从国际权威的智能体评测榜单到国内最具影响力的第三方中文大模型评测体系,文心助手在两套完全独立、评测逻辑和参评对象都不同的体系里都拿到了第一。这种跨榜单、跨维度的连续领先,比单次高分更值得关注。说到底,这不是刷分刷出来的偶然结果,而是底层能力的真实体现。
复杂任务,检验文心助手执行力
百度正在把复杂任务理解、任务规划、工具调用和结果校验等能力接入文心助手,让 AI 从回答问题进一步走向完成任务。榜单分数给出了横向参照,具体任务则更能检验产品成色。最近一批实测中,文心助手接到了几类链路较长、交付要求较高的任务,可以逐一拆开来看。
代码开发:一个任务要求它单文件生成一个深色科技风的量化交易终端「QUANT ENGINE v10.0」,四宫格布局。左上要有 ECharts K 线图叠加 MA20 均线并支持播放/暂停/重置动画,左下要有完整的策略引擎(输入标的、胜率、止损、目标、赔率,支持 AI 生成策略、生成多策略、反向做空),右上要有实时切换多空标签的信号面板,右下要有渐隐效果的终端日志滚动输出。这不是「写一个能跑的 Demo」级别的要求,而是把 UI 设计、数据可视化、交互逻辑、动效细节全部揉在一份需求里一次性生成。另一个任务是做一个 3D 太阳系模拟器,要能看到各行星的真实运行轨迹和详细介绍,考验的是模型对三维空间关系和物理规律的理解转化能力。
内容创作:一份要求在 2000 字以上的商业计划书任务,命题是「AI 智能硬件初创公司 2026 年 Q2 BP」,必须包含执行摘要、行业痛点与市场机遇、产品核心优势、商业模式与盈利路径、财务预测与融资需求五个章节,还要求语言风格专业严谨、具有说服力,并直接生成 Word 文件。这类任务真正的难点不在「写字数」,而在于让一份商业文档在结构、逻辑、专业术语和说服力上同时站得住。这恰恰是内容创作维度 99.44 分背后的支撑。
教学与场景化产品:一个任务是给初二学生做「天气系统与气候」的交互式气象模拟网页,要求能调节温度、湿度、气压参数并实时观察云的形成和降水变化,还能切换查看冷锋/暖锋/台风的三维运动模拟。另一个任务的复杂程度更值得细看:制作一个小学生学习打卡工作台「一一的家」,需求文档长达数千字:花朵积分体系、九级学习等级、TTS 语音朗读、Localstorage 持久化存储、响应式布局适配手机端、精确到色值的品牌视觉规范(主色紫色 #B791FA、选中态背景 ),还要有随机生成的古诗题库、课文预习库、拼音练习、数学练习、英语单词练习,甚至加了一只可互动的虚拟宠物和完整的积分商城兑换体系。这份需求几乎是一份完整的产品需求文档(PRD),文心助手需要把这些散落的、细节高度密集的要求,转化成一个真实可交互、双击即可打开的响应式 Web 应用。
研究分析:一个任务是对最新菲尔兹奖得主关于三维挂谷猜想的研究做深度解读,涉及对前沿数学研究的理解与转译能力。另一个任务是做近一个月国内外主流大模型的能力对比与价格分析报告,要求模型自己检索信息、交叉验证、提炼结论,最终产出一份有数据支撑的分析报告。
把这几类任务放在一起看,难点都落在执行环节:既要调用工具、拆分步骤,也要记住前文要求,并按指定格式交付结果。PinchBench 考察的工具调用和多步骤规划,SuperCLUE 关注的记忆能力,在这些任务中往往同时出现。文心助手需要做的,是把用户相对模糊的需求整理成一条可执行的任务链,并把每个环节接起来。
▍搜索积累如何撑起文心助手
文心助手近期的表现,很难绕开百度长期积累的搜索能力。
搜索和 Agent 面对的都是同一类问题:用户给出的需求往往并不完整,系统需要先判断意图,再寻找信息、组织步骤并返回结果。区别在于,传统搜索主要负责找到信息,Agent 还要继续调用工具、处理文件,并完成后续操作。
从这个角度看,百度过去在查询理解、信息检索、知识组织和结果排序上的积累,为文心助手进入复杂任务场景提供了一定基础。文心助手所做的,是把原先停留在信息获取环节的能力继续向后延伸:从提供资料,走向整理资料、分析数据和生成结果。
这也可以解释文心助手在不同评测中的部分优势。PinchBench v2 关注任务规划和工具调用,考察的是系统能否把复杂需求拆成多个步骤并持续执行;SuperCLUE-XClaw 涉及数据处理、内容创作、记忆、代码和研究分析,更接近综合任务能力。两套评测侧重点不同,但都要求模型理解需求、组织信息,并维持较长的执行链路。
不过,搜索积累并不会自动转化为 Agent 能力。传统搜索强调召回、排序和结果呈现,Agent 还要处理工具稳定性、上下文保持、错误修正和最终交付。文心助手当前的成绩,更适合被理解为百度正在把搜索时代积累的部分能力,逐步迁移到任务执行场景。
百度 App 和文心助手也提供了较大的用户入口。大量真实查询能够暴露不同任务中的失败点,包括意图识别偏差、步骤遗漏、格式错误和结果不可用。这类反馈对于任务型产品的迭代,比单纯提高模型参数更直接。
大模型产品的比较标准因此正在发生变化。用户不再只看回答是否流畅,也开始看任务能否完成、结果是否可靠、交付是否符合要求。文心助手在近期评测中的表现,说明百度已经进入这轮任务型 AI 产品竞争的前列。但搜索积累能否持续转化为产品优势,还要看它在更多真实任务中的稳定性,以及能否把一次成功执行变成可重复的交付能力。
✦精选内容✦
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.