出品 | 网易智能
作者 | 小扣
编辑 | 王凤枝
GPT-6到底有多强?看完OpenAI的官方介绍,我想拿几件费时间、又容易出错的工作试一试。
OpenAI这次主打GPT-6 Astra在复杂编程、专业文档制作和电脑操作上的表现。我就沿着这几个方向,选了前端、后端、办公和电脑操作四类任务:改一款3D游戏,修一个抢购商城,把41份互相冲突的材料整理成董事会文件,再打开华为发布会视频,自己挑片段、做成动图。
同样的材料和要求,我也交给了上一代GPT-5.6 Sol,两边都开高推理强度。我想看看,新一代模型的进步,落到这些具体工作里,究竟是做得更快、考虑得更周全,还是交出来的东西更好用。
01前端:接手一款还要继续更新的游戏
前端这一项,我想看看GPT-6能不能接手一款已有的游戏,继续加功能,而不只是做出一个好看的页面。
我给两款模型的任务是修改《沉没博物馆》。这是一款双机器人协作的3D游戏:洪水不断上涨,玩家要安排两个机器人配合开门,按优先级带走展品,再一起撤离。
除了玩法,我还要求暂停、撤销和存档都能正常工作。暂停以后,洪水、电量和巡逻障碍都得停;撤销一步,机器人的位置、电量和手里的物品也要恢复。做到一半,又追加了色弱模式、救援优先级和第四张地图,旧存档也必须继续能用。
Astra用了约31分45秒,交出了可以在浏览器里运行的版本,还录下了一段连续演示动图。下面就是游戏实际运行的画面。

图:Astra版本的连续演示,包含双机器人、展品、门、洪水与撤离过程。GIF为1024×720、25.01秒。
游戏能玩起来了,兼容性检查却发现一个问题:加载其中一类旧存档后,机器人手里原本拿着的展品不见了。Astra认出了新版记录携带物品的方式,却漏掉了一类旧版记录。低帧率时自动降低画面负担的触发条件,也没有完全按要求做。
Sol这边因服务容量不足中断了修改,没能交出可用版本,也就无法用这一轮判断它能否完成这款游戏。
半小时左右能拿到一个可运行的版本,我觉得已经有实用价值。但如果真要让老玩家更新,丢失携带物品的问题必须先修好。
02后端:抢购、扣款和退款,都得算对
后端这一项,我想看看模型能不能把商城里的抢购、扣款和退款处理妥当。
我给它们准备了一个有问题的模拟闪购后台。库存只有20件,却要同时接住100笔抢购请求;用户重复提交请求,不能重复扣款;支付后系统突然崩溃,重启时也不能把同一笔钱再扣一次。数据库里还有退款、通知重试和权限问题需要处理。
第一轮修完,第二轮再追加优惠券分摊和数据库迁移的要求。这时模型得在已有代码上继续改,既要算对退款,也要处理升级中断、退回旧版服务等情况。
两款模型先守住了最重要的抢购流程:100个请求最终成功20个、失败80个,库存没有变成负数。相同请求重试时,都能返回第一次结果,首次失败的请求也会被记住;支付中途崩溃和事故对账等检查,两边也通过了。
差别出现在一笔退款里。
这笔模拟订单原价200元,用了30元优惠券。退回其中价值100元的商品时,按题目要求,优惠券需要分摊到商品上:退货部分分到15元优惠,应该退回的现金是85元。
Astra给出了85元现金、15元优惠券分摊。Sol却给出100元现金,优惠券分摊为0。照它的结果处理,就会多退15元。
退回旧版服务时,两边的处理也不同。Astra恢复了旧版需要的兼容状态,同时保留新增数据和历史记录;Sol发现数据库里已经有新版订单后,拒绝继续回退。
![]()
图:Sol版本的事务与消息发送边界代码,直接截自提交源码。
![]()
图:Astra版本把本地业务提交、接收端落地和发送端确认分开处理。
这一项我更认可Astra。防止超卖和重复扣款,两款模型都做到了,但Astra把后面追加的退款与回退要求处理得更完整。
03办公:41份材料,整理成一套能开会的文件
办公这一项,我想让模型完成一整套关账材料:先把不同文件里的账核清,再做出Excel、董事会PPT和管理层备忘录。三份文件不能各算各的,最后拿去开会,还得让人看得明白。
我给了它们41份材料,包括Excel、PDF合同、邮件、会议记录、截图、旧版PPT和人工批注。材料之间有冲突,模型要找出4处错误、标明位置,再统一税口径、退款归属月份和销售渠道。Excel要保留公式,图表可以继续编辑;PPT限定12页,Word限定2页。
做到一半,我又撤回一笔收入、补一笔退款,并修改了返点生效日。它们需要跟着更新整套文件,但原来的模板、批注和旧版对照不能丢。
这一项,两边都交齐了。Excel各有19个工作表,PPT都是12页,Word都是2页。核心数字也一致:不含税净销售额180万元,退款20万元,贡献利润37.5万元,比预算少40万元。
还有一个处理让我比较放心:仓库损耗截图里有个金额看不清,两款模型都把它留作待确认,没有猜一个数字填进去。
Astra完成整套材料用了约40分8秒,Sol约66分1秒,前者快了约26分钟。但把文件打开看,我更喜欢Sol的呈现。
![]()
图:Astra版本的Excel仪表盘,第一轮、第二轮和变化值并排呈现,信息密度更高。
![]()
图:Sol版本的Excel仪表盘,重点数字和第二轮调整更醒目。
![]()
图:Astra版本的12页董事会包,整体更传统、表格更密。
![]()
图:Sol版本的12页董事会包,图表更多,页面层级也更鲜明。
Sol的仪表盘更容易找到重点,PPT的页面层级也更清楚。它用了3个原生图表,Astra用了1个,两边都有7个可编辑表格。Astra的版本更传统,表格密一些,适合仔细核对;Sol则更方便在会议上讲清楚数字。
急着拿到整套材料,Astra更省时间;如果第二天就要拿去开会,我会选Sol的版本。
04电脑操作:看发布会,挑片段,再做成动图
电脑操作这一项,我想看看模型能不能直接使用浏览器,替我完成一件写稿时会遇到的事:从发布会视频里挑一小段画面,做成可以插入文章的动图。
我给两款模型的是同一条华为官方YouTube发布会视频。整场长两个多小时,这次只让它们按正常速度看同一个4分30秒片段,再从中选出4至6秒,做成GIF。
选段要让普通读者一眼能看懂,制作也有要求:画面从浏览器实际播放中获取,尺寸、帧率和文件大小都要合适,不能把浏览器边框、播放控制条或聊天栏一起截进去。
两款模型都看完了指定片段,选择却不一样。Sol挑中了玻璃耐用性对比:两种玻璃并排放着,测试压头上下运动。Astra选的是手机展开,机身从合拢变成展开,随后被举起来展示。
![]()
图:上方是Sol选择的玻璃耐用性演示,下方是Astra选择的手机展开镜头。两张截图都保留了真实YouTube页面、播放器时间、标题和Huawei频道。
到了制作环节,Astra交出了一张5秒、50帧的GIF,尺寸、帧率和大小都符合要求。画面没有多余的网页控件,只留下源视频自带的华为标识。

图:手机从折叠状态展开,随后被单手举起展示。GIF为960×540、5秒、10fps。
Sol完成了观看和选段,却没能把浏览器截图做成同时符合要求的动图。帧率、时长和干净画面这几件事,没能一起处理好。
这个结果有点可惜。单看选段,我更喜欢Sol:两种玻璃并排接受测试,更适合配合耐用性的介绍。
但要插进文章,我手里能直接用的只有Astra那张动图。Sol选中的片段,还得继续加工。
05干完这些活,Token花了多少?
看完成品,我又对照了一下运行日志,想知道两款模型为这些工作消耗了多少Token,也就是它们读入和生成内容时使用的计量单位。
先只看双方都交出成品的后端和办公两项。Astra合计用了约915万Token,Sol约2608万,前者少64.9%。如果只算输出部分,Astra少33.5%;非缓存输入则少19.2%。
再把四项工作的全部尝试算进去,包括失败和经我确认后的恢复运行,Astra用了约1207万Token,Sol约3750万,前者少67.8%。其中,GIF这一项,Astra一次成功运行用了约41万Token;Sol两次运行合计超过1000万,仍然没有可用动图。
后一组数字包含没有做成的工作,不能当作完成同样任务的效率比较。但对使用者来说,失败尝试同样会消耗资源,这部分也不该从记录里消失。
Astra这轮用的Token明显更少,不过费用还要另算。按测试时记录的Standard API文本报价,Astra每百万输入、输出Token分别为10美元和50美元,Sol为4美元和20美元,Astra的单价都是Sol的2.5倍。
实际花费还受缓存、工具调用和Codex套餐计费方式影响。这次的运行日志不是逐项结算的API账单,67.8%只是Token用量的差距,不能直接当成费用省了多少。
做完这一轮,我会怎么选
如果接下来还要处理这样几件连着做、做完还要继续修改的工作,我会先用Astra。这次它交出的东西更齐,退款和版本回退也处理得更完整,办公任务还比Sol快了约26分钟。
但Sol没有因为“上一代”三个字就失去位置。办公材料的呈现,我更喜欢它;挑发布会素材时,它选中的画面也更合我的需要。Astra自己的旧存档问题,同样说明新版交来的东西还得检查。
这四项测试只是我的一次使用对比。下次遇到类似的工作,我会先让Astra上手,再根据成品决定用哪一份。比如这次的董事会PPT,我就会留下Sol的版本。
