所有人都在讨论GPT-6 Astra的跑分。FrontierMath 98%,ARC-AGI-3 99.9%,ExploitBench 100%。数字是真的,也确实亮眼。但如果你在构建agent,这周OpenAI发布的东西里,跑分恰恰是最不值得关注的部分。
真正值得关注的是随模型一起推出的三个Responses API原语:异步工具调用、中途转向、子agent编排槽位。这些不是模型能力,是运行时基础设施。OpenAI这次不只是发布了一个更聪明的模型——他们发布了一个伪装成模型升级的agent运行时。
![]()
为什么这件事比跑分重要
过去两年,每个agent框架——LangChain、CrewAI、AutoGen、Orca——都在从外部构建编排。工具分发、并行执行、状态管理、结果路由:全是应用层代码,包裹着一个本质上是同步的模型API。Astra把编排搬到了内部。这个变化会改变每个agent构建者的自建vs购买决策。
三个运行时原语拆解
剥掉跑分的光环,Astra实际发布的能力有三项,它们和“智能”无关,和执行基础设施有关。
第一个是异步工具调用。现在生产环境里的每个agent框架都有同一个瓶颈:模型调用工具时,它要等待。整个推理链在你跑数据库查询、等API响应、或等浏览器自动化完成时完全停摆。单次工具调用的延迟还能接受,但一个十步的agent工作流,每一步依赖不同的外部系统,串行等待时间会累积成几分钟的死推理。
Astra在函数定义上的async: true参数从协议层面改变了这件事。工具被标记为async后,模型发出调用、拿到call_id,然后继续推理任务中独立的部分,同时你的应用在后台执行工具。结果返回时,你对着原来的call_id提交,模型把它合并进正在进行的工作里。
这不是提示工程,是协议变更。模型不再是请求-响应端点,而是一个事件驱动的进程:可以派发工作、继续思考、再派发工作、在结果到达时对账。这就是运行时的定义。
关键架构洞察
异步工具调用把模型的推理时间线和应用的执行时间线分开了。模型不用等你的CI管道跑完测试——它先去看文档,测试执行的同时并行推进,两边都好了再合并结果。人类工程师就是这么工作的。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.