![]()
![]()
文|Sleepy
办公 Agent 现在最大的问题,是它交付的结果太难分辨质量高低了。
现在让 AI 写报告、做 PPT,已经很少会得到那种一眼就知道不能用的东西。大多数时候,框架完整,内容齐全,第一眼甚至挑不出太明显的问题。
麻烦也在于此。明显没做完的任务很好处理,人知道还差什么。最难接手的是那些已经做到八九成的结果,看起来差不多了,真正要用的时候,才开始发现数据要重新核对,前面的过程也未必经得起追溯。
接手的人大概率不会全部重做,只能在现有结果上继续检查和修改。AI 省下来的时间,有相当一部分在这里又被浪费掉了。
BetterUp Labs 和 Stanford Social Media Lab 把这类 AI 产物叫作 workslop。
2025 年的一项调查里,40% 的美国桌面工作者说自己在过去一个月收到过这类内容,平均每次要花接近两个小时处理。AI 把生成变便宜了,但那些看起来已经完成、实际还需要重新核验和修改的东西,也带来了一笔新的成本。
验收成本。
8 月 27 日,百度搭子在上海举行「搭子进行时」产品发布会,个人版、企业版和专业套件同步更新。两天前,字节刚刚发布了自己的办公 Agent。这条赛道在一个夏天里挤进了几乎所有大厂,各家的能力也越来越趋同。
百度把这次发布会的重点放在「交付」上,希望把办公 AI 的评价标准,从能不能生成、生成得多快,往结果到底能不能直接用上推进一步。
当模型越来越会做出一份像成品的东西,用户接下来要花多少时间确认它真的能用,开始成为新的成本。
AI 越来越擅长制造完成感,验收成本也随之上升。
![]()
AI省下的时间
微软研究院和卡内基梅隆大学调查了 319 名知识工作者,收集了 936 个真实的生成式 AI 使用案例。AI 的确减少了直接执行任务的工作量,但约六成案例仍然需要某种形式的检查,包括核对事实、判断内容是否符合要求,以及确认结果能不能直接使用。
过去分析师自己找资料、做表格、写报告,虽然慢,但大致知道数字和判断从哪里来。Agent 可以把检索、文件读取和工具调用放到后台,一次性交出结果。生成速度快了,人却更难了解中间发生了什么,省下来的部分时间也因此转到了最后的核验上。
几年前,大模型的错误通常很明显,年份写错、人物搞混,看一眼就知道有问题。现在很多错误已经没有这么容易发现。Stack Overflow 去年调查了近 4.9 万名开发者,66% 的人最常遇到的问题是 AI 给出的答案「almost right, but not quite」。
德勤澳大利亚就碰到过一次。就业和劳资关系部花 44 万澳元委托其完成一份福利合规评估报告,发布后被发现引用了不存在的学术文献和一段并不存在的联邦法院法官原话。GPTZero 今年又检查了四大的多份公开研究,毕马威一份报告列出的 45 条参考文献,只有 5 条能对应到真实来源。
![]()
今年 7 月,Sage 调查了全球两千多名高级财务决策者。财务人员平均每周要花接近 13 个小时重建、验证和解释 AI 输出。71% 的财务负责人说,即使一套 AI 工具有 99% 的准确率,只要讲不清答案是怎么来的,他们仍然不会使用。Sage 把这部分新增的工作叫作「Verification Tax」。
当写报告、做表格、操作浏览器逐渐成为 Agent 的常规能力,产品之间的差距也开始往任务末端移动。结果交出来以后还需要多少人工处理,开始和生成本身一样重要。
![]()
逐渐趋同的能力
8 月 17 日,AI 产品榜·桌面榜发布 2026 年 7 月榜单。国内 AI 办公桌面端月活跃用户总量约 3000 万,百度搭子以 674.30 万月活位列 AI 办公智能体总榜第二,月活环比增长 1063.79%,在增速榜上排第一。腾讯 WorkBuddy 环比增长 304.40%,排增速榜第二。两家合起来接近 1800 万,占了整个大盘的六成左右。
![]()
![]()
3000 万这个数字,放在办公软件的用户规模里并不算大。对照传统办公软件的用户量,AI 办公还有大约 20 倍的渗透空间。中国的白领大约 1.2 亿,现在各家 AI 办公的日活加起来还只是零头。
这个夏天,大厂陆续进场。
阿里千问办公 8 月初公测。8 月 25 日,字节发布「豆包工作」,把 TRAE、扣子和 7 月底并入的飞书产品团队集中到同一个品牌下,办公 AI 从多线并行转成单点推进。豆包工作与飞书打通,用飞书账号登录后,可以在权限范围内调用聊天记录、文档、会议纪要和日程。
这些发布会讲的能力其实很接近。写文档、做表格、生成 PPT、操作浏览器和电脑、跨软件把一件事做完,每一家都在讲这个故事。
国内几家办公 Agent 用的基础模型水平接近,工具调用的做法也大同小异,一项能力领先,通常只能领先几个月。能力拉平的第一个后果,是单功能产品先被吃掉。AI 产品榜 7 月的数据里,AI PPT 榜 TOP10 全线下跌,因为用户已经不需要专门打开一个 AI 工具来做 PPT了,办公 Agent 足够解决。
十年前的移动办公走过一次同样的路。钉钉 2015 年上线,企业微信 2016 年跟上,飞书后来加入,功能清单越做越像,最后拉开距离的是谁真的进了组织的日常流程,谁只是被装在手机上。
百度智能云给这套解法配的是一张全栈的底牌。从底层芯片、云、MaaS,到中间的 Harness 框架,再到搭子和它上面挂着的秒哒、胜算、伐谋等应用,几乎每一层都有自己的东西。
百度搭子团队对终局的判断是,AI 办公不会是一家独大的市场,职业太分散,没有谁能长期在所有任务上都做到专业可用,用户已经开始给任务分级,哪些交给搭子,哪些拿去别的产品做实验。
同一道题的两种解法,最后都要回答企业那句「这东西我敢不敢直接拿去用」。
办公也是少数从第一天就能收订阅费的 AI 场景。百度搭子、Workbuddy、豆包工作都推出了分档订阅,各家都没打算把它当成流量入口来养。
付了钱的用户,对结果的容忍度会比免费聊天框低得多。能力趋同以后,用户的比较会很快从「它会不会做」,转到「它做完之后我还要干多少活」。
百度搭子把「交付即惊艳」放到发布会中央,就是在提前回应这个变化。
![]()
任务完成不等于工作结束
发布会上,百度搭子先给了一组数字,搭子 3 月发布以来,5 个月迭代了 150 次,过去一个月用户增长近 9 倍。用户规模增长,说明命中了需求;体验是否极致、交付是否惊艳,才决定用户会不会留下。
百度搭子 3 月 22 日全量上线时,重点还是让 Agent 把任务跑起来。用户给一个目标,它负责拆解,再调用搜索、文件和网页工具把事情做完。
6 月升级 Harness 引擎,长程任务的 Token 消耗降低了 75%,解决的也还是任务能不能更稳定、更便宜地跑下去。
7 月以后,自媒体套件先上线,8 月又加入金融和设计套件。搭子开始继续往任务的后半段走。
套件上得很慢。百度搭子的办法是一个一个推,一个套件打磨一个月甚至更久,上线前先让业内的人认可。
金融套件找的是资深的操盘手,自媒体套件找的是 MCN 和 KOL 博主,行业里怎么选题、怎么分析账号,由这些人写进去。
对于为什么不直接堆 Skill,团队的解释是技能太多太散,普通用户分不清哪个靠谱,套件把数据源、技能、MCP 和工作流打包成一种工种,用户对着自己的职业找就行。
自媒体套件上线时,有自媒体需求的用户只占搭子的 2%,4 周后到了 15%。
真正到了办公场景里,内容生成出来通常还不算结束。PPT 做完以后可能还要调整版式,研究和财务工作则要继续核对数据来源和分析过程。
过去很多 Agent 产品的重点更多还是把任务完成,现在百度搭子开始把后面的加工和检查也做得更重。百度搭子这次讲「交付」,对应的其实就是这部分变化。
![]()
发布会上,百度搭子把所谓的「交付」进一步拆成了几个标准。
专业执行,理解目标、规划步骤、调用资料和工具,并校验关键事实;交付惊艳,形成内容扎实、表达清晰、可以直接使用的成果;开放共创,支持用户修改、接管和复用,也让成熟的工作方法能够被分享。
放到实际工作里,这些标准最终指向的是同一个问题,Agent 交出来的东西还需要人处理多久。
百度素材里有个 70 岁的长白山野生动物摄影师,攒了 100TB 的红外相机视频,过去靠人眼一帧一帧看。他自己说,现在看素材比拍摄都累,70 岁了,眼神不行。搭子把有野生动物出现的画面挑出来、归档,再按他的习惯整理成监测日志。审素材这件事,从他身上挪到了百度搭子身上。
比如研究和财务任务,结果不能只有一个结论。数据从哪里来、计算用了什么口径、判断依据是什么,都要让接手的人能够直接核查。PPT 也不仅是把内容填满,如果拿到以后还要重新调整大量页面,前面省下来的时间就会被重新花掉。
这次个人版新增的工作台、PPT 美化、产物管理、项目管理和多模型调度,也是在继续压缩这段距离。百度自己把这些能力称为「五大交付支柱」,专业套件则面向更专业的场景单独提供。
这里开始出现了一条比较明确的产品逻辑,衡量 Agent 的能力,开始要看它交付以后,人还要做多少工作。
![]()
生产变便宜之后
几年前,一个内容团队很重的成本,是找到能够稳定写出三五千字稿件的人,而今天单看文章生成这部分已经便宜了很多。
但一篇内容真正发布出来,写正文只是其中一部分工作。选题之前要做判断,写作之前要找资料、熟悉行业,稿子出来以后还要核事实、改标题、做视觉和适配不同平台。模型把写字这一步压得很快,而前后的其他工作还是需要做的。
百度搭子这次展示自媒体套件时,也没有只强调写稿。它把账号分析、资料研究、选题、图文、短视频和发布素材放在同一套流程里,最后交付的也不只是一篇正文。
套件里还埋了一层更细的功夫。不同平台的审核规则不一样,博主用得深了会知道,哪些词在某个平台容易被限流。这些更隐蔽的规则被做进了创作环节,用户不用自己挨个踩坑。
这背后的逻辑就是,一个 Agent 就算一分钟写完 3000 字,如果创作者拿到以后还要花很长时间核查、修改和准备发布,就不算真正的提效。
![]()
我自己平时写稿,日常就是选题、找资料、采访、写正文。拿到自媒体套件以后,我给它布置了一个比较笼统的写作任务,没有写特别详细的指令,想看看它自己会怎么处理。
它先把任务拆开,查近期同题材的公开内容、判断内容取向、分析标题结构和写法、确定选题切口、搭文章框架,然后才动笔写正文,最后还出了配图建议和不同平台的发布素材。这个拆解顺序和我自己平时的流程几乎一致。
拿到初稿以后,我主要查了引用的事实和数据能不能对上,以及正文里有没有一眼看出是机器写的套话。初稿里的数据都能找到出处,没有出现编造的引用或者不存在的信源。正文语言也相对干净,没有堆「值得注意的是」「总而言之」这类 AI 味儿填充句式,能看出来写作环节有过专业内容人员的调校。
然后我自己补了一些自己采访里的细节,调了几处语气节奏,整个验收加修改大概不到半小时,比预期短,也没有出现那种「看着能用,一上手才发现要重做」的情况。
过去创作者大量时间耗在找资料、整理信息和处理格式上,如果这些工作能被 Agent 连起来,人就可以把更多时间放在判断、审美和最后的确认上。
我的亲身体验印证了这一点。这次我没有预先喂给搭子任何素材库,只给了一个选题方向,它自己完成了查资料、搭框架、写初稿、出配图这一整条链路——交出来的东西直接是能读、能发的成品,不是一份还要重新搭骨架的草稿。真正需要我插手的,是判断这个框架是不是我想要的角度、这几张配图的调性合不合账号气质,这些本来就该由人来把关,不是搭子没做到位。
这也解释了为什么同一个产品在不同人手里差别巨大。手上有素材、有判断、知道要什么的人,用 Agent 会快很多;换一个对自己要什么都还没想清楚的人去用,大概率还是会先卡在"我到底要什么"这一步——这不是工具的问题,创意和判断从来没法被外包。工具把有准备的人和没准备的人之间的差距拉得更开了,但人和 Agent 配合的分工逻辑没有变。
这种分工在内容行业还能留出一些容错空间。而到了金融行业,结果一旦进入投资、授信或者财务决策,要求就完全不同了。
![]()
金融不会只看答案
金融对 AI 结果的要求更严格。一个数字或者判断最后可能进入授信、投资、采购和财务决策,专业人员不仅要看结论,还要确认它用了什么数据、什么口径,为什么会得出这个判断。
一份研报写收入增长 20%,分析师首先会确认统计周期和数据来源;模型判断一家供应商风险上升,也要有相应的经营数据和行业信息支撑。
在金融里,一个无法核查的正确答案,依然很难进入决策。
百度搭子金融套件除了客户材料整理、财报分析、行业研究和风险识别,也把数据来源和分析过程保留在结果里。这样分析师拿到报告以后,可以沿着模型使用的材料继续检查,不必重新做一遍研究。
百度搭子团队发现,约 16% 到 19% 的用户在用它处理个人投资,才决定先啃这个场景。数据源上,它接了百度自己攒了二十多年的阿拉丁,对外再连同花顺和一批投研机构。至于推荐准不准,团队的说法是,现在主要积累先验数据,后验要靠更多用户在持续使用里给反馈,一个判断在盘面上对不对,过几天才见分晓。
蓝海黑石把搭子接进了原有的 SAP、WMS 和 PLM 系统。采购、库存和产品数据仍然由这些业务系统管理,搭子读取内部数据,再结合外部原材料行情做分析,生成趋势判断、风险提示和采购建议。
按照企业 CIO 张明杰现场分享的情况,过去需要几天完成的分析,现在可以先由 Agent 完成大部分工作。
到了这里,问题又往前走了一步。AI 给出采购建议还不算结束,后面还有审批和执行;会议里识别出的待办,也要真正进入项目管理。
Agent 能不能接进这些原有流程,决定了它交出来的是一份供人阅读的结果,还是一项已经继续往下推进的工作。
![]()
一个人会用,和一家公司会用
一个特别会用 Agent 的人,确实可以把自己的效率拉得很高。
Prompt、Skill 和工作流用得熟,过去几个人配合完成的事情,一个人也能做下来。但如果这些方法只存在于某个员工自己的账号和习惯里,他一走,这部分效率也很难留下来。
![]()
这也是百度搭子企业版这次重点做行业套件、知识库和 VPC 的原因。公司真正想留下来的,不只是员工做过的文档,还有一件事具体怎么做,遇到什么情况该怎么判断。
这类经验过去很难完整写进 SOP。
资深采购看到原料价格和库存变化,知道什么时候该提前锁价;财务人员看到几个指标同时异常,会知道接下来该多查什么。这些判断来自长期工作,很少被专门整理成规则。
Agent 提供了另一种可能,把其中一部分逐渐写进 Skill、规则和流程,再和企业自己的数据、系统连接起来。蓝海黑石把搭子接入 SAP、WMS 和 PLM,走的也是这条路。
一个人的效率能不能被其他人重复出来,决定了它是不是公司的效率。
个人效率要变成公司的效率,这件事在 IT 史上已经发生过一次。1987 年,经济学家罗伯特·索洛留下一句话,计算机时代的痕迹到处都看得到,唯独在生产率统计里看不到。企业买了机器,员工也确实用得更快,宏观数据上却长期没有反应。
后来的研究给出的解释是,回报要等到企业重新组织流程、重新分配岗位、重新培训人之后才会出现,中间隔了将近十年。
Agent 现在和那时的处境很接近。个人层面的提速已经能看到,公司层面的生产率还要等有人把它落到流程、权限和责任里。
但能够复制还不够。企业里换一批人、换一批任务,结果要保持稳定,权限不能失控,出了问题还要知道发生过什么。
百度搭子目前把权限、审计、沙箱隔离和人工确认放进企业版的安全体系,文件删除、系统修改和数据外发这类操作都需要人工授权。
企业版的付费方式和个人版也不一样。个人版按月订阅,企业版按坐席收计费,一个坐席 189 元。百度搭子没按云资源的用量计价,理由是客户算不清一堆底层投入能带来多少产出,不如直接告诉他,这些资源点大概能跑多少任务、省多少人力。
资源点在坐席之间可以灵活调,高频的员工多分、低频的少分,当月没用完也不回收,高峰期优先保障企业版。企业版这次一口气上了 15 个套件、96 项技能,覆盖金融财务、商务法务、产品研发、运营人力四块。
人也不会因为 Agent 能力提高就被取代,只是介入的位置会变。如果专业人员还要长期盯着格式、搬数据、确认大量低风险操作,省下来的时间并不多。真正需要人的地方,是那些涉及风险、判断和责任的环节。
真正稀缺的是专业人员的判断时间。
![]()
成功率和返工率
跑分上,百度搭子也不弱。5月的PinchBench里,它拿到93.3%和93.2%,占了当时榜单前两位;DeepResearch Bench里综合得分58.03,同样是当时的第一。这个Benchmark考察的是23个真实工作场景、147项任务里的多步推理、工具调用、成功率、速度和成本。
但这些数字能证明的,只是Agent会不会跑、跑得快不快。进了真实工作以后,还有一件事跑分测不出来:一次"成功完成",员工验收要花五分钟,还是一个半小时。
![]()
![]()
这中间的差距,我在验收自媒体套件写的那篇稿子时感受很直接。
拿到初稿以后我审核的是引用的数据对不对,正文里的判断有没有依据,格式拿过来能不能直接用。文章中的每个数字都能溯源到原始来源,没有编造的引用;而且在我提出我的文章核心观点之后,百度搭子还又做了同题材的内容调研,结论不是凭空来的;格式这条,配图建议和不同平台的发布素材都出了,不需要我从头排版。三件事查完,补上自己采访的细节、调几处语气,整个验收不到半小时。
今天的多模态 Agent 一次生成很多文件很简单。真正需要验证的是,这些东西离正式可用还有多远。如果编辑团队拿到以后仍然需要从头核新闻稿、大改视频和海报,那么完成的主要还是生成。大部分内容经过简单确认就能进入传播流程,才更接近百度搭子这次所说的「交付」。
我验收那篇稿子时查的三件事,放到这个场景里一模一样。新闻稿的事实能不能核对,视频和海报的品相能不能直接用,金句是不是真来自演讲现场。每多一道需要人重新做的工序,「交付」就退回成了「生成」。
这也让「交付即惊艳」变成了一个比跑分更难证明的承诺。成功率、速度和 MAU 都已经有成熟的统计方法,返工率却很难用一个漂亮的数字概括。它最终发生在每一份报告、每一张表格和每一次人工确认里。
搭子团队自己也不否认这一点。群访时被问到最看重什么指标,团队的回答是任务交付率和生成物的质量。交付怎么量化,他们的说法是标准不通用,金融报告看数据准不准,高光混剪看抽的片段好不好,前一个客观,后一个带主观。
集团层面还提了个新指标叫 DAA,看活跃 Agent 的数量,智能体有没有真的进到企业和用户的生产流程里。
这也是这条赛道接下来最有意思的地方。能力已经趋同,跑分还能再涨几个点,用户的选择却会越来越依赖一种说不清楚的体感,就是这东西交给它以后,自己心里踏不踏实。这种体感很难被营销制造出来。
美国外科医生、作家 Atul Gawande 在《清单革命》里写过现代医疗遇到的一类问题。医学知识越来越丰富,医生能处理的疾病越来越复杂,但很多事故发生,是因为很多事情没有被正确执行和检查。最后真正降低手术风险的工具之一,只是一张要求所有人逐项确认的清单。
办公 AI 也开始碰到类似的问题。它不会出现在任何 Benchmark 里,但每一次确认,都在决定这份结果到底是省了时间,还是制造了新的工作量。
过去几年,行业的大部分进步都在回答模型还会不会做更多事情。写作、搜索、编程、做图、操作电脑,这张能力清单还会继续变长。但当 Agent 已经可以独立完成一项任务的大部分工作,决定它有没有真正提高生产率的,就不再只是能力清单有多长。
下一阶段要解决的,是怎么让「做完了」这三个字变得真的值得信任。
![]()
![]()
![]()
![]()
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.