IT时代网8月20日消息,据外媒报道,OpenAI员工乐观估计,公司正接近实现自创立之初就设定的目标:让AI智能体像人类一样熟练地操作电脑,尤其是使用浏览器。自2015年成立以来,OpenAI一直希望实现这一能力,其中最大的难题之一是获得足够的训练数据。
经过多年开发,公司现在已有信心开始向客户逐步开放电脑操作功能。OpenAI电脑操作团队经理阿里·韦恩斯坦表示,一旦ChatGPT操作电脑和软件的速度超过你我,就会改变人们默认与电脑交互的方式。最新模型从训练初期到后期各阶段,都加入了专门提升电脑操作能力的数据与训练流程。
参与相关基准测试的哥伦比亚大学AI研究员周宇解释,这些训练是在通用模型已有能力之上继续强化,让模型学会完成更多电脑任务。最初的预训练阶段,OpenAI很可能加入了逐帧屏幕截图;后续阶段则向模型展示完成特定任务所需的正确操作,例如填写税务表格或生成物体3D模型,其中一部分数据来自真人示范。
OpenAI也改变了模型实际操作电脑时获取信息的方式。韦恩斯坦介绍,过去ChatGPT需要反复截屏、分析像素、发送指令再重新截屏,如今打开网站后系统可直接读取网页底层信息,从内存结构、无障碍信息到链接关系都能应对,截图仍是流程的一部分,用户需允许录屏以便系统识别当前内容。这些能力结合后,代码工具就能自行测试生成的代码、发现问题并继续修改,形成完整闭环。
韦恩斯坦与负责浏览器能力的詹姆斯·孙认为,电脑操作技术的一大价值,是让智能体得以进入互联网中大量彼此独立的长尾网站。已有用户用它自动处理数据录入、合规任务与日程安排。不过周宇也坦言,目前该技术速度距离普通消费者期待仍有明显差距,在训练数据充足的有限领域表现很好,但要适应任意网页、应用与操作系统仍非常困难。
OpenAI CEO萨姆·奥尔特曼曾在2025年谈到早期功能时公开示警,认为实用价值很大、潜在风险同样不小,建议只向智能体提供完成任务所必需的最低权限。OpenAI目前正在研究确认策略,只要智能体准备向外传输数据或删除内容,就必须先征得用户同意,以在安全与易用之间寻找平衡。
![]()
注:本文综合自IT之家等,文中包含AI辅助创作的内容。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.