日前,百度文心助手任务 Agent(Orion Mission Mode)以94.6%的综合成功率、94.4%的平均得分,在全球工程向AI智能体评测榜单 PinchBench v2 中荣登榜首。
在 148 项真实任务的综合评测中,文心助手任务 Agent 超越 Anthropic Claude Opus 4.8-fast、阿里千问 Qwen3.7-max、英伟达 Nemotron-3 Ultra、OpenAI GPT-5.6-luna 等海内外主流大模型。 此次 PinchBench v2 榜单以 148 项真实企业自动化任务为核心测试标准,覆盖创意内容、写作、数据分析、研究知识、代码运维等多维场景。据榜单数据显示,文心助手任务 Agent 在创意内容、写作内容等多个赛道获得领先的评测认证,工具调用、多步骤任务自主规划与长程任务执行能力表现突出。此次评测流程,百度 AI 搜索团队以 Orion Mission Mode 的名称,在GitHub 上开源。
据悉,文心助手任务 Agent 依托百度搜索二十余年技术积累与百度搜索猎户座 AI 引擎的多智能体框架能力,为智能体应用开发提供了自主可控、高性能的国产化底层模型底座。目前,该核心技术已全面应用于百度 APP 及文心助手。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.