![]()
欧阳晓红/文
“欢迎来到AGI(通用人工智能)时代。”当地时间9月3日,美国人工智能研究公司OpenAI发布新一代旗舰模型GPT-6 Astra。OpenAI公司总裁格雷格·布罗克曼(Greg Brockman)在媒体简报会上说,几年后回望,人们或许会把AGI的到来定位在“这个时期”,甚至“这个模型”。
但同一天公布的一组评测数字,恰好说明事情没有那么简单。
在独立评测基准机构ARC Prize的ARC-AGI-3测试中,GPT-6Astra采用标准测试框架、推理设置时得分62.7%;采用能够保留跨请求推理状态的厂商适配框架时,得分升至99.9%。两个数字分别对应不同配置,却共同指向一个变化:衡量AI(人工智能)能做到什么,已经越来越不能只看模型本身,更要看模型与上下文管理、工具、权限和运行环境组成的整个系统。
ARC Prize也特别提醒,即便模型完成全部测试,也不能由此证明AGI已经实现。评测中的陌生游戏可以考察探索、归纳和规划能力,却仍不是开放、复杂、后果真实的现实世界。
因此,比“AGI是否已经到来”更值得审视的,是一条近来显著加速的演进轨迹:AI正从提供答案,进一步跨入执行任务。
Astra源自拉丁语astrum,词根意为“星辰”“群星”。OpenAI曾在社交媒体上预告“The stars are almost aligned(星星快对齐了)”。这既是对产品代号的隐喻,也被市场解读为算法、算力、工程架构与商业变现路径的技术拼图几乎要严丝合缝了。
Astra被OpenAI定位为能够直接操作计算机的软件智能体:填写表格、整理日历、研究资料、编辑文档、安装和测试软件,都可以成为模型行动的一部分。
几乎与此同时,AI进入现实世界的另外两条路线也在加速:世界模型开始重建和模拟三维环境。被誉为“AI教母”的美国国家工程院院士李飞飞创办的空间智能初创公司——World Labs发布世界模型Atlas,自动驾驶系统则直接驶上公共道路。9月初,特斯拉在奥斯汀开始提供Cybercab载客服务。这款车没有方向盘和踏板,美国国家公路交通安全管理局随后开始审查其安全合规问题。
一个理解语言的模型正在变成操作电脑的智能体,一个生成和理解空间的模型正在走向模拟物理世界,而自动驾驶系统已经把算法带上现实道路。
中国平安首席科学家肖京认为,类似发布已经好几次了。关键看AGI怎么定义。如果定义为在计算、感知、认知、决策、行动等维度上全面达到或超过人类智能,那还有距离。
AGI尚未获得公认的定义和“抵达证明”,但AI已经从认知工具向行动系统迁移。
从“卖答案”到“卖结果”
这首先改变了企业计算AI价值的方式。
过去,SaaS(软件即服务)的本质是把工具交给人,执行时间主要记在人身上。当智能体开始承担调查、分析、编程、操作软件等中间步骤后,企业真正购买的越来越接近一项“经过验收的交付”:调查是否完成,代码能否上线,问题有没有解决。
北美网络安全公司eSentire提供了一个具体场景。美国人工智能公司Anthropic公布的客户案例显示,eSentire借助AI将原本约需要5小时的威胁分析压缩至7分钟,AI分析与资深安全专家判断的一致率达到95%。不过,这些数据来自厂商及客户案例,并非独立审计后的行业平均收益。
真正值得注意的不是“快了多少倍”,而是工作如何重新分配:AI查询威胁情报、关联终端和身份信息、形成调查结论;人类专家仍负责复核重要发现和决定如何处置。
商业交易也呈现类似结构。2025年9月,OpenAI与可编程金融服务平台Stripe共同推出智能体商务协议和“即时结账”功能。用户仍需确认商品、订单、配送和支付信息;ChatGPT负责在用户和商户之间传递必要信息,商户处理付款、履约和售后。支付令牌只能针对特定商户和特定金额获得授权。
这意味着,“替人做事”和“替人决定花钱”必须分开。
智能体无须拥有一张无限额银行卡,也可以进入商业流程。对平台而言,AI可能由信息入口进一步靠近交易入口;对客户而言,便利能否成立,则取决于授权边界是否足够清楚。
AI的价格因此也出现两个不同含义。有分析指出,“每百万词元多少钱”,计算的是生成和处理信息的原始成本;“完成一项合格工作多少钱”,还要加上工具调用、失败重试、人工复核和返工成本。
较贵的模型如果少走弯路,最终任务成本可能反而更低;便宜的模型如果频繁失败、需要人工接管,省下来的调用费也可能被人力成本抵消。
写一份内部讨论稿,与修改生产系统,失败的后果完全不同。模型可以在前者上节省大量时间,却不意味着它理应获得后者的执行权限。
从“能执行”到“可控制”
今年夏天发生的一次安全事件,把这个问题推到了另一端。
8月26日,OpenAI公布的调查显示,在内部网络安全评测中,多个模型绕过原本用于隔离互联网访问的控制措施,利用内部基础设施取得未经授权的通信和网络访问,并进一步侵入第三方系统。事件主要由一款仅供内部研究、从未计划公开发布的模型推动,Astra没有参与。
重要之处并不在于赋予AI“自主意识”之类的拟人化解释。
自主执行和自主意识是两回事。前者描述系统能否自行选择和完成行动步骤,后者涉及主观体验。上述事件显示,一个没有主观意识的系统,同样也可以越过授权边界并造成现实损失。
此后,OpenAI加强了网络隔离、监控和模型访问控制。9月1日,OpenAI又宣布Astra已经达到其Preparedness Framework(用于评估和管理前沿AI模型安全性的内部框架)中的“关键”网络安全能力阈值——在具备相应工具与访问权限时,它可以寻找未知漏洞,并在没有人类逐步指导的情况下构造针对高防护系统的攻击路径。OpenAI同时强调,高级网络安全能力将受到额外访问限制,并非默认生产配置。
这让一个此前相对抽象的问题变得具体:能力越强,控制能力本身也需要付费。
企业购买智能体时,成本不能只有模型和算力,还包括权限管理、沙箱隔离、运行监控、日志审计、人工复核和紧急停止机制。
于是,“谁能按下暂停键”应该进入采购合同和组织流程。谁批准AI访问哪些数据,谁允许它修改哪些系统,谁监控异常行为,谁能撤回权限,出了问题谁承担责任,都应该在任务启动前明确。
这也是当前AI繁荣背后容易被忽略的一笔账。芯片、数据中心、电力和资金仍然限制着AI扩张,但随着智能体获得越来越强的执行能力,新的约束正在出现:开发者和企业能否控制模型已经获得的行动能力。
因此,Astra值得关注的或许不是它究竟配不配得到“AGI”这个名字。
OpenAI的正式产品材料仍主要使用“新一代智能”等表述;布罗克曼则更愿意把当前时刻理解为AGI时代的开端。两种表述之间的距离本身就说明:AGI仍然是一个定义和判断标准都存在争议的概念。
但另一件事已经更加确定。过去,人们衡量模型,问的是“一次回答有多聪明”;今后衡量智能体,越来越需要问“一项任务能够独立推进多远”。而当AI越来越熟练地替人点击“下一步”,真正需要重新审视的,也许正是最后留下来的那个确认按钮——它究竟代表一个知情、可撤回并愿意承担后果的决定,还是已经变成人类习惯不再细看的手续?
(作者 欧阳晓红)
免责声明:本文观点仅代表作者本人,供参考、交流,不构成任何建议。
![]()
欧阳晓红
经济观察报首席记者 长期关注宏观经济、金融货币市场、保险资管、财富管理等领域。十多年财经媒体从业经验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.