2026年的硅谷,办公形态正在发生一次底层切换:从“人操作软件”变成“人交代任务,Agent操作软件”。微软围绕Microsoft 365把Copilot Cowork、Office Agent能力和Agent 365逐渐串联;Google让Workspace Studio把企业SOP变成可复用的Agent流程;OpenAI则在7月发布ChatGPT Work,让它跨文件持续工作数小时。
产品形态各异,方向却趋于一致:Agent不重新做一套办公软件,而是争夺现有软件之上的任务执行层。国内的情况略有不同,第一轮真正跑出规模的,是WorkBuddy、百度搭子这类更接近Claude Code的独立Agent。
![]()
标准化办公任务:模型与Harness差距不大
7月23日,腾讯发布WorkBuddy Bench,把七个头部模型装进CodeBuddy Code和Claude Code两套Agent Harness,完成代码、网页、办公和安全四类共260项任务。办公是模型与Harness变化后表现最稳定的一类:在CodeBuddy Code环境里,七个模型得分落在77.47—82.37之间;换一套Harness,七个模型里有五个得分变化不到2分,中位绝对变化只有0.86分。
这至少说明,在这组标准化办公任务里,模型和Harness暂时没有拉出像代码、安全任务那样明显的差距。“能把事情做出来”,正在接近一项越来越普遍的基础能力。
速度提升后,验证成本成了新瓶颈
Agent提高了任务完成速度,人的工作却没有按同样比例消失。一个研究员可以把五家公司的三年财务数据交给Agent,让它找异常、查原因,再做成一页PPT,过去最耗时间的步骤可以被大幅压缩。可如果研究员拿到结果后,还得重新打开财报、逐个检查数字、确认日期和来源,AI省下来的制作时间,又有一部分变成了核对时间。
这是办公Agent接下来一道更难的题:会干活之后,怎么让人敢直接用。
百度恰好在这个时间点追了上来,它手里的牌与腾讯并不一样。昨日发布的Q2财报显示,百度AI应用季度收入为25亿元,同比增长3%;6月,搭子企业版上线;同期百度文库和网盘的AI DAU渗透率同比增长27.4%。这些收入和用户并不全部来自办公Agent,但意味着百度不是从一个空白的桌面产品开始竞争——它身后还有搜索、文库、网盘等已经运行多年的信息和文件体系。
当“把事情做出来”越来越接近基础能力,办公Agent的竞争开始向两头移动:一头是用户为什么愿意把第一项真实任务交给它;另一头是任务做完以后,为什么敢不再重新检查一遍。腾讯和百度手里的旧资产,恰好分别对应这两个问题。
Agent比Chatbot更需要别人教你怎么用
ChatGPT刚出现时,用户几乎不需要产品教育,打开一个对话框,问一句“北京明天天气怎么样”,用户就能理解它是什么。Agent复杂得多,它能读本地文件、改Excel、操作浏览器、调用Skill、执行几十分钟的任务,还可以定时运行、连接外部软件。能力越多,用户反而会面临一个更具体的问题:我现在到底应该把哪件事交给它?
对Agent来说,最有效的产品说明,往往是别人已经做出来的东西。7月1日,微软三名研究人员公布了一项关于公司内部Claude Code和GitHub Copilot CLI采用情况的研究。他们分析了微软数万名工程师在2026年初的真实使用数据。研究把“第一次使用”和“之后持续使用”分开,结果显示,两者由不同因素驱动:工程师之后会不会留下来使用,更多与自身编程活动相关;但一开始会不会试,明显受到周围同事影响。
论文对此的概括很直接:first use spread primarily through social networks,即第一次使用主要沿着社交网络传播。并建议企业在推广Agent时,把“visible peer use”,也就是让人看到身边的同事正在实际使用,纳入推广策略。
研究对象是微软工程师,产品是Coding Agent,不能直接推导所有办公用户都会重复同样的路径。但它解释了一个Agent产品很特殊的传播机制:功能介绍没有任务演示有效。
腾讯正好有一张适合承载这种传播的关系网。WorkBuddy已经支持用户从微信、企业微信、QQ、钉钉、飞书等通信入口远程给电脑下发任务并接收结果,腾讯至少拥有一张更容易让Agent使用方式在同事、朋友和群聊中被看见的关系网。
传统互联网经常衡量获客成本CAC,Agent时代可能需要多看一个传统互联网不太关注的指标:获得第一项真实任务的成本。广告可以购买安装量,免费Token可以换来注册量,但两者都不能保证用户知道第二天该拿它做什么,同时做出来的结果还可以。
这也是为什么WorkBuddy目前超过1100万的PC月活值得观察,但还不能简单解释成“腾讯流量大,所以腾讯赢了”。产品能力、补贴、上线时间和市场投放都会影响数字,现阶段没有证据可以证明微信关系链与WorkBuddy的增长存在单一因果关系。更准确的说法应该是:腾讯拥有一项恰好适配Agent冷启动问题的资产。
百度搭子的增长:市场远未定型
百度搭子的增长速度则说明,市场还远没有定型。百度3月正式推出DuMate,官方资料显示,它从一开始就定位为桌面级办公Agent,之后保持了非常高的迭代频率。截至8月7日个人版已推进至v1.0.67,期间陆续增加网页发布、内嵌浏览器、远程任务和自动化模板等能力。8月12日,百度披露,搭子上线以来日均提问次数已经增长60倍,近一个月又增长两倍。
但如果竞争一直停留在“谁能更快让用户知道Agent能干活”,百度面对的是一道不那么有利的题。腾讯可以利用人与人的关系,让一个任务沿着同事、朋友和群聊继续传播。搜索可以带来需求,文库和网盘可以带来内容,地图可以带来位置,云可以连接企业,但它很难短期再造一张微信式的人际关系网。
所以它需要换一道题,不是继续证明自己的Agent也会干活,而是去证明当Agent干完活以后,用户可以少检查一遍。这才是搜索、专业内容和知识体系真正可能重新变得值钱的地方。
验证成本:办公Agent与Chatbot的最大区别
Agent做得越多,人验证它的成本就越重要,这是办公Agent与Chatbot最大的区别之一。让模型写一篇文案,里面有一句错误,修改一句就可以。让Agent完成一次行业研究,它会自己搜索、筛选材料、提取数据、计算、形成判断,再制作文件。链条越长、任务执行得越完整,一个早期错误被放大的空间反而越大。
接入搜索也没有彻底解决这个问题。ACL 2026的多项工作仍在专门研究RAG场景中的幻觉检测,其中一项方法直接将生成内容与检索证据对齐;另一项构建长上下文RAG基准的研究发现,现有幻觉检测器距离性能上限仍有明显空间。换句话说,检索到了证据,不等于生成内容就完全可靠。
办公Agent的竞争,正在从“谁能干活”转向“谁能让用户放心用”。腾讯有社交关系链解决冷启动,百度有搜索和内容体系押注验证成本。两条路线谁能跑通,将决定下一阶段办公Agent市场的格局。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.