用过GPT-5.6 Computer Use的人,大概都经历过那种"等它操作"的煎熬——模型每做一个动作都要停顿几秒,像在犹豫下一步该点什么。但到了GPT-6 Astra这一代,体验完全变了。
宝玉在实测中给出的评价很直接:「在旁边看着它点击真的是一种享受」。这句话背后,是Computer Use能力的一次质变:准确率上来了,速度也跟上来了。从"需要等待才能操作"到"快速精准地执行点击",这个跨越,恰好是AI Agent从玩具走向工具的分水岭。
![]()
Agent闭环:从开发到验收,不再需要人肉点鼠标
过去一个App开发完,测试环节基本靠人。线上系统的端到端测试依赖Playwright这类框架,写脚本、维护脚本、跑脚本,成本高,准确率还未必理想。很多团队干脆跳过自动化,直接手动点一遍。
GPT-6 Astra的Computer Use,正好补上了这块短板。宝玉的建议很明确:在实际任务中让GPT-6自行使用Computer Use进行测试验收,用它替代或补充传统的端到端测试框架。这意味着Agent从开发到验收形成了完整闭环——写代码是AI,测代码也是AI,人只需要看结果。
这个闭环的价值在于,它把"测试验收"这个长期被忽视的高成本环节,第一次变成了可自动化的对象。以前是"开发省了时间,测试全还回去",现在两头都能省。
成本还没降,但方向已经对了
当然,现在谈全面替代还早。宝玉也提到,Computer Use的成本目前尚未显著降低。每一次点击、每一步操作都在消耗算力,高频使用场景下,账单会相当可观。
但成本从来不是静态的。随着模型迭代和使用规模扩大,单位成本下降是确定性事件。一旦成本降到某个阈值以下,Computer Use对测试领域的渗透会加速——毕竟,它解决的是"人肉点鼠标"这个真实痛点,而不是凭空造需求。
临界点已过,接下来看落地速度
从GPT-5.6到GPT-6 Astra,Computer Use跨过了"能用"和"好用"之间的那道坎。准确率高、速度快,这两个指标同时达标,意味着它不再只是演示视频里的炫技,而是可以放进真实工作流里的工具。
对于开发者来说,值得现在就开始尝试:挑一个你平时最烦的手动测试场景,让GPT-6自己跑一遍。体验一下"看着它点击"的感觉——这可能就是你未来日常工作的样子。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.