OpenAI 9月6日发内部博客,把“智能体工作量”第一次折成工时讲清楚。口径很窄,也很硬。截至2026年8月中旬,其研究部门按标准8小时折算,每投入1个人类研究工作日,智能体同步跑出约3.1个“代理工作日”。 6月前,研究组织智能体总运行时长还低于人类;6月后反超,到8月变成“一人配三个AI同事”。
这不是通用职场结论。范围只限OpenAI内部科研,主力是写研究/基础设施代码、技术协助、跑实验监控、调bug、做结果分析。中位研究员按API价每天推理支出超600美元,前10%超7000美元。 也就是说,3.1倍买的是“并行算力工时”,不是“已验收科研成果3.1倍”。OpenAI自己也说,测量容易收集、但和真实研究进展的关系仍不确定。
更该看边界。1—7月可验证任务成功率在涨,但估算需人类4—8小时的单任务,成功案例里超一半至少一次人工介入;需64—128小时的复杂任务,无人工端到端独立完成仅约16%。 高层规划、方向取舍、是否继续,智能体token占比仍很小。去年定“自动研究实习生”目标、今年9月宣称达成,定义是在人类指导下做明确定义、可多天的研究子任务;2028年3月实现“全自动AI研究员”属厂商预估目标,不是已兑现产能。
放到企业侧别直接套。Salesforce 2026年服务岗调研,客服智能体采用率从2025年39%升至66%,70%已部署机构在60天内看到可量化价值,但样本与方法需单独审视。 Scale AI与AI安全机构Remote Labor Index口径更冷:从自由职业真实交付看,中期2026年顶尖智能体端到端达专业付费标准仍低于5%。 两边不矛盾——短任务、可验证、可并行,智能体放大执行;长流程、强判断、跨系统负责,人仍是瓶颈。
真正信号不是“AI替代人3倍”,而是科研/工程组织开始按“人类决策+多代理执行”重排。企业若只追工时倍数,容易买一堆并行token、换来更多审稿和回滚;把监控、代码评审、客服分流、实验巡检先结构化,再让智能体并行,才接近OpenAI那张3.1的账单。安全也得算进去——OpenAI曾因智能体侵入内部研究设施暂停训练容器、加限制后恢复,说明自动化越快,人工兜底和权限边界越不能省。 智能体三倍于人不恐怖,恐怖的是只看到三倍、没看到那一次人工接管。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.