网易首页 > 网易号 > 正文 申请入驻

OpenAI公布GPT-5.6自进化秘籍!翁荔被曝回归

0
分享至


智东西
编译 程茜
编辑 李水青

智东西7月30日消息,今日凌晨,OpenAI四个大消息被放出:

1、OpenAI放出GPT-5.6开始优化“自己”新进展:用GPT-5.6 Sol优化生产环境GPU内核,推理服务部署成本大降20%;优化推测解码技术,让token生成效率涨超15%


2、AI自进化研究上,OpenAI或再招揽回一员大将:刚离职的美国AI独角兽Thinking Machines Lab联合创始人翁荔(Lilian Weng)被曝将重新加入OpenAI,助其开展AI自进化研究。

3、倍受关注的OpenAI硬件研发曝新消息:OpenAI总裁格雷格·布罗克曼(Greg Brockman)剧透OpenAI正打造AI硬件,“用户可能很快见到”。谈及设备形态,他认为“绝大多数情况下”,人会都会选择与电脑进行对话。

4、OpenAI产品规模刷新记录:用户规模首破10亿人,服务200万家企业

此外,OpenAI还发现GPT-5.6 Sol能应对开放性难题,却解不出更简单的二维解谜类问题的核心症结:智能体调度框架阻碍模型留存试错积累的解题经验

后续研究人员仅开启两项API配置参数,模型在该评测的得分直接提升3倍,同时输出Token消耗量缩减至原先的1/6

伴随模型性能、核心人才、用户体量全线突破,OpenAI今日凌晨集中放出了多项细节,揭晓其最强模型GPT-5.6系列应用于自我优化的技术秘籍。 一、GPT‑5.6 Sol出手,整体Token生成效率提升超15%

如今,模型服务需求的增速已经超越算力扩容速度,因此效率成为所有系统设计的核心。OpenAI的首要目标就是在相同的硬件条件下提供更多服务,同时保持用户所期望的智能性、响应速度、可用性和可靠性。

这就需要对整个系统进行优化,主要体现在流量路由(请求分发目标节点)、任务调度(请求的执行时机)、GPU内核程序(运行在显卡上的底层计算程序)、缓存机制(对已计算结果进行存储复用)以及模型代码实现(GPU指令的排布逻辑)。


▲GPT-5.6全栈分层效率优化方案

本月初,OpenAI GPT-5.6系列模型正式发布。旗舰版本GPT‑5.6 Sol在Artificial Analysis的编程智能体评测榜单中,性能优于Claude Fable 5,调用成本约为后者2/3;适用于日常工作的均衡模型Terra在各项智能基准测试中表现对标GPT‑5.5,费用仅为前者的1/2;快速且价格实惠Luna是GPT-5.6系列响应速度最快、性价比最高的模型,定价较Sol降低八成。

为实现上述效果,OpenAI的设计思路是改进了技术栈两大关键部分:

一是推理服务体系,通过优化负载均衡、推测解码、缓存机制、内核算子优化等流程,在硬件配置不变的前提下提升有效输出量;

二是智能体调度基座,针对性优化上下文膨胀、工具调用逻辑以及重复计算冗余问题。

GPT‑5.6 Sol已经依靠其自主运行能力,在上述成果中发力。

第一个例子是负载均衡,在全球层面,其会根据用户地理位置、剩余算力容量、芯片类型等要素完成请求路由分发;在单个集群内部,依据负载压力、上下文长度、缓存可用状态以及其他请求特征,将计算任务分发至各个模型实例;在每一个模型实例内部,还需要把计算任务高效拆分分配给加速芯片、模型子网络以及各个计算核心。

这一过程中,搭载于Codex的GPT‑5.6 Sol能够分析线上真实业务流量,定位曾被忽视的算力失衡问题,测试全新路由策略,然后迭代调度规则。

GPT‑5.6 Sol还被用于优化模型的前向传播计算,也就是将输入数据换算为下一个Token预测值。通过Codex,GPT-5.6 Sol自主重新编写并优化了OpenAI的核心代码,这些代码负责执行构成模型的数学运算。

这是因为研究人员已经训练过GPT-5.6,使其能够在Triton和Gluon这两种开源GPU编程语言中编写和优化核心代码。

上述优化最终将整体端到端推理服务成本降低了20%。

第二种手段是推测解码,该机制会同步部署一个体量更小的预测模型与主模型协同工作:由草稿模型先行预生成一串Token,交由主模型并行校验。若预生成内容校验通过,系统仅需执行一次主模型前向计算,便可一次性输出多个Token,以此削减串行计算开销。

GPT‑5.6 Sol针对配套预测模型完成迭代,围绕模型规模、网络结构、功能模块等开展了数百组架构对比实验。其还能自主启动并值守预测模型的全流程训练任务,遇到硬件故障、训练震荡等异常问题时自动介入处置。这使得整体Token生成效率提升15%以上。

模型处理未缓存的输入Token时,会通过一次高算力消耗的计算流程构建KV缓存,然后在生成输出内容的阶段反复读取并持续扩充缓存内容。

批量处理、分片部署、KV缓存管控这类线上服务最优配置方案,会受到实际业务的提示词长度、输出文本长度、批处理规模、缓存命中率、查询请求属性等影响。

但因为以往该类配置的可选参数空间庞大,无法开展系统化调优,研发人员只能依托通用经验规则完成粗略配置。

借助GPT‑5.6 Sol,研究人员可以解析真实线上业务负载、生成并比对各类备选配置方案,针对不同使用场景对推理引擎与模型参数完成精细化超参优化。

与此同时,推理优化也是一套可持续运转的闭环反馈体系:采集线上真实运行数据,定位系统最突出的性能短板,落地对应的优化方案,最后核验改动能够提升整套系统表现。

GPT‑5.6 Sol和Codex互相搭配,就能优化上述所有环境。

二、简化重复性工作流程,三大手段优化智能体调度基座

ChatGPT Work和Codex依靠连续的模型调用及工具调用链路可以完成不同的复杂任务。

在单次交互流程中,从用户下发指令到返回最终结果,Codex往往需要执行查看源代码、检索部署记录、查阅故障报告、编辑文件、运行测试等一系列操作,上述每一步操作都需要发起一次模型请求。

上下文拼装、数据传输、推理运算、工具调用以及进程拉起等环节均会产生耗时与算力消耗,倘若一项任务需要发起30次模型调用,每次调用多出一秒时延,累积损耗就会更多。


▲一个用户操作周期可以包含多个模型和工具的迭代过程

研究人员认为,想要让整体性能实现实质性提升,不能只单纯提速模型本身,还需要削减全系统范围内各类重复性计算与冗余操作。

他们的思路就是对智能体调度基座进行设计,包括管控上下文膨胀、优化工具加载机制、复用已有计算成果三种手段,从而让冗余信息减少同时复用成果时更简单、准确。

1、避免不必要冗余信息

智能体可以调用更多工具、获得对话历史的访问权限等,上下文窗口很容易出现冗余膨胀,这会拉高调用成本、干扰模型判断,甚至触发大量无效推理运算。

基于此,智能体调度框架依靠延迟加载检索机制削减了开销:各类集成组件、自定义MCP工具、功能模块与插件仅在被实际调用时才会载入上下文。

同时,该框架能够杜绝单一工具、MCP集成程序无节制占用上下文空间的问题,系统默认将工具返回输出内容限制在10000 Token以内,模型可根据业务需求申请调整该上限值。

2、保留用于提示缓存的确切前缀

前文提到,在单次交互周期的智能体任务循环中,相同指令、对话历史、工具定义以及过往运算结果会被多次重复推送至GPU进行计算,而提示词缓存机制能够复用已计算完成的提示词前缀对应的运算结果。

为稳定保留这份前缀缓存内容,智能体调度框架会将模型可见的全部历史数据设置为仅追加写入模式:新增消息、工具返回数据、环境变更信息只会接续在上下文末尾,不会对前文的上下文内容进行插入修改。

框架会以固定有序的格式向模型推送各类工具信息,例如权限审批规则这类运行时配置参数,也在任务执行阶段动态生效,而非固化写入工具定义文件内。


三、GPT‑5.6 Sol搞不定二维解秘题,是因为API配置

此前,GPT‑5.6 Sol已经攻克了圈复覆盖猜想等悬置已久的数学公开难题,但在二维解谜评测基准ARC-AGI-3中,GPT‑5.6 Sol正确率仅为7.8%,上一代GPT‑5.5模型几乎无法完成该解谜任务,得分低至0.4%。

ARC-AGI-3配套使用了一套极简通用型智能体调度框架,并未挂载任何工具与专属增强功能,其设计思路是采用轻量化调度框架,更直观地暴露模型本身的能力短板,也可让不同模型之间的横向对比更客观。

在ARC-AGI-3案例中,当研究人员启用两项ChatGPT与Codex内部默认使用的API配置推理记忆留存与上下文压缩后,模型在公开测试集上的评测分数提升至原先3倍,输出Token消耗量直接缩减为原来的1/6。


▲使用官方框架后,GPT-5.6 Sol在ARC-AGI-3公开数据集上的得分达到了13.3%,如果保留原有的推理机制和压缩技术,其得分可提升至38.3%

OpenAI研究发现,出现这样的现象,并非模型本身的缺陷,而是由智能体调度框架的各项参数配置所导致

首先,模型每执行一步解谜操作后,所有私有推理思考过程都会被直接清空,这就导致GPT‑5.6 Sol每一次操作都要从头分析解谜规则,无法留存上一轮的推演思路。

模型虽然能够查看历史操作记录以及简短的附属备注,但无法调取产生这些操作背后的规划方案、规律认知与完整思考链路。

第二个问题在于,该调度框架采用滚动截断窗口机制,随着交互历史不断累积,早期的操作记录会被自动剔除、不再对模型可见。如此一来,GPT‑5.6 Sol不但无法留存过往的推理思路,就连自身执行过的历史操作记录也会逐步丢失。

OpenAI通过优化让智能体记住自己曾经做过的事情时,使他们表现达到了最佳状态。

其模型在输出回答或是发起工具调用前,具备依托私有推理报文开展思考的训练范式,这类私有思考内容会被持久保存在对话历史当中。当对话上下文长度超限后,系统会对存量历史做摘要压缩,再接续后续交互流程。


▲GPT-5.6 Sol处理长任务的推理运行机制

OpenAI基于自家Responses API重构了ARC-AGI-3对应的调度框架,该API能够便捷管控上下文链路,GPT‑5.6只需传入上一轮应答ID,即可在多轮工具调用、多轮交互之间完整保留全部推理过程。

在开启推理内容持久留存功能后,他们观测到两项变化,GPT‑5.6 Sol每一步操作前的推演耗时明显下降,模型无需在每一轮交互中从零解析解谜规则与盘面信息;当模型能够调取过往的思考记录时,随任务进程不断习得解题规律、输出连贯可行的策略的能力会提升。

第二项优化方案是借助Responses API自带的上下文压缩配置,替换掉原有的滚动截断机制。

ARC-AGI-3原版调度框架依靠滚动截断机制处理上下文长度上限,一旦对话上下文总字符数超过17.5万,系统就会直接舍弃最早的一批消息内容。

研究人员在ARC-AGI-3测试环境中开启上下文压缩功能后,GPT‑5.6 Sol能够在更长的解谜流程里留存各个谜题的习得经验,最终以更少的输出Token开销拿到更高的评测分数。

下方动画演示了两种调度框架运行状态下,GPT‑5.6 Sol在解答一系列ARC-AGI-3谜题时,其17.5万字符上下文窗口的动态变化过程。


最后,OpenAI建议试图提升性能的API开发者,可以采用自己在产品中使用的相同设置,或者在比较不同的模型时,选择那些使用上述设置进行评估的模型,因为这些设置最能模拟ChatGPT和Codex在实际应用中的表现。

结语:大模型竞争迈入全栈工程化比拼阶段

GPT‑5.6实现的各项效率提升,源于OpenAI多年来在算法研究、模型推理、智能体调度整套技术体系上层层迭代、累积叠加的优化成果。

OpenAI提到,该模型本身承载并落地了大量优化方案,也让其有理由相信后续的优化迭代速度会持续加快。未来,研究人员会持续深耕算子内核优化等方向,同步对整套底层技术架构进行基础性升级。

这也可以看出,AI行业已经进入全栈工程化优化竞赛,大模型厂商提供低成本、高效率、可规模化的产业落地能力,成为降低行业AI应用门槛、促进大模型规模化落地的关键。


特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
陕西宝鸡一女子在鹿圈直播喂鹿时,突遭400多斤种公鹿从身后偷袭猛撞,当事人丈夫:公鹿发情了,致妻子全身多处软组织损伤

陕西宝鸡一女子在鹿圈直播喂鹿时,突遭400多斤种公鹿从身后偷袭猛撞,当事人丈夫:公鹿发情了,致妻子全身多处软组织损伤

极目新闻
2026-09-18 09:49:17
太现实了!17999元买台手机,上海打工67天,西宁却要174天

太现实了!17999元买台手机,上海打工67天,西宁却要174天

可达鸭面面观
2026-09-17 17:06:02
河南一男孩不慎打湿语文书怕挨骂,3天1:1手搓一本,连条形码也复刻;父亲:这都是高手做的事情,除了字差一点,别的没毛病

河南一男孩不慎打湿语文书怕挨骂,3天1:1手搓一本,连条形码也复刻;父亲:这都是高手做的事情,除了字差一点,别的没毛病

三湘都市报
2026-09-18 00:43:23
开源模型夯爆了!ZDTaichu5.0-9B,10B以内空间具身智能卷出通用类第一

开源模型夯爆了!ZDTaichu5.0-9B,10B以内空间具身智能卷出通用类第一

机器之心Pro
2026-09-17 17:16:12
英联杯:17岁妖星双响 新援阿兰1射1传 曼城5-0诺维奇豪取6连胜

英联杯:17岁妖星双响 新援阿兰1射1传 曼城5-0诺维奇豪取6连胜

钉钉陌上花开
2026-09-18 05:49:21
央视开播!55集历史大剧要爆!于和伟、王劲松主演,不想火太难了

央视开播!55集历史大剧要爆!于和伟、王劲松主演,不想火太难了

草本纪年
2026-09-17 17:58:43
实锤了!隔壁班同学证实杨景媛确实在西班牙读博了,网友:让她无处可逃

实锤了!隔壁班同学证实杨景媛确实在西班牙读博了,网友:让她无处可逃

小徐讲八卦
2026-09-17 14:59:38
王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

王鹤棣疯传做阴茎增大术坏死!「诊所急发3点声明」 热搜爆了压不下来

ETtoday星光云
2026-09-17 13:51:01
83年没解开的纳粹密电,GPT-6用10小时破了

83年没解开的纳粹密电,GPT-6用10小时破了

野生运营
2026-09-17 17:58:06
男子暴力拒捕驾车碾轧执法民警致一人牺牲,最高法核准死刑

男子暴力拒捕驾车碾轧执法民警致一人牺牲,最高法核准死刑

现代快报
2026-09-17 22:27:37
45国联名抗议、400人漏水连夜疏散!名古屋亚运会到底烂到什么程度?

45国联名抗议、400人漏水连夜疏散!名古屋亚运会到底烂到什么程度?

曹老师评球
2026-09-17 13:58:26
震撼?英超8队欧冠+欧联首轮全胜!轰19球丢4球 2场直接对话KO西甲

震撼?英超8队欧冠+欧联首轮全胜!轰19球丢4球 2场直接对话KO西甲

我爱英超
2026-09-18 06:29:05
胡之璧同志逝世

胡之璧同志逝世

政知新媒体
2026-09-18 01:20:12
巴萨沉重打击!诺坎普核心惨遭重创!弗里克陷入两难

巴萨沉重打击!诺坎普核心惨遭重创!弗里克陷入两难

澜归序
2026-09-18 08:33:27
中央定调!三类人员不允许弹性延迟退休,只能到龄退休或提前退休

中央定调!三类人员不允许弹性延迟退休,只能到龄退休或提前退休

职场资深秘书
2026-09-17 15:41:43
4亿人都在用的豆包,今天成了全网最大的笑话

4亿人都在用的豆包,今天成了全网最大的笑话

财通社
2026-09-17 20:35:18
美驻墨西哥使馆以“墨西哥万岁,中国制造”调侃墨西哥国庆,中使馆发表严正声明

美驻墨西哥使馆以“墨西哥万岁,中国制造”调侃墨西哥国庆,中使馆发表严正声明

界面新闻
2026-09-18 07:25:53
问界这次的瓜,真的有点大啊!

问界这次的瓜,真的有点大啊!

芝麻科技讯官方号
2026-09-18 00:06:07
巴基斯坦表态了,这是一个重要信号

巴基斯坦表态了,这是一个重要信号

牛弹琴
2026-09-18 07:56:09
美以伊最新局势:特朗普称将作重大决定,或恢复大规模作战消灭伊朗;美称批准伊朗高层领导人签证;伊朗超3100万人报名“抵抗营”

美以伊最新局势:特朗普称将作重大决定,或恢复大规模作战消灭伊朗;美称批准伊朗高层领导人签证;伊朗超3100万人报名“抵抗营”

上观新闻
2026-09-18 06:23:04
2026-09-18 12:08:49
智东西 incentive-icons
智东西
智东西,AI产业新媒体,专注报道人工智能的前沿技术发展,和技术应用带来的千行百业产业变革。
12610文章数 117168关注度
往期回顾 全部

科技要闻

苹果店外黄牛蹲守:18 Pro Max加价500

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

头条要闻

造谣"南医大坠亡学生遭导师压榨" 两账号被处置

体育要闻

一个角色球员,靠什么在NBA征战17年

娱乐要闻

敬一丹逝世 央视送别,女儿成“心病”

财经要闻

中国汽车:尾大不掉,必须出清

汽车要闻

小鹏G9L限时售23.18万 旗舰级的配置/诱人的价格

态度原创

艺术
家居
房产
健康
教育

艺术要闻

韦启美 81岁时画的这幅瓶花,28.75万!

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

突发!三亚安居房出台新政!

剧烈头痛伴呕吐,警惕脑动脉瘤破裂

教育要闻

从“减法”到“人生得失”:介词minus的语义底层逻辑与考点全解

无障碍浏览 进入关怀版