网易首页 > 网易号 > 正文 申请入驻

实测对比GPT-5.6和Fable 5,我发现好几个意料之外

0
分享至

这两天的大模型圈,基本就是 GPT-5.6 和 Fable 5 的对决。

尤其是 Fable 5 成了全球用户的“白月光”之后,OpenAI 很快祭出 GPT-5.6,还特意强调它有更强的智能性价比。

这话翻译一下,就是明晃晃地戳 Fable 5:你太贵了。


OpenAI 这次发布的 GPT-5.6,一共有 Sol、Terra、Luna 三个版本。

Sol 最强,主打复杂推理和长时间自主工作;Terra 的性能和 GPT-5.5 接近,但价格更低;Luna 则是最轻量的版本。

价格方面,我直接拉个表把 GPT-5.6 和 Fable 5 对比一下。


*图里没算缓存

这么一看,Fable 5 价格贵的 Bug 更明显了。

但现在毕竟是2026年。大家都知道,一个模型好不好用、性价比高不高,不能只听官方讲故事,还得看实测。

上周忙着蹬 Fable 5 的我,这两天又拿 GPT-5.6 对比横评了好几个任务。整体跑完,我有几个比较明确的感受:


  • Fable 5 的系统架构能力更强,做任务时也更有创造力。GPT-5.6 规划能力比之前详细,会更严格地遵守要求。但它很容易在一些细节上停留过久,如果不开 Ultra,速度真的有点熬人。

  • 前端审美上,GPT-5.6 的效果过于草率。放在今年这一批新模型里,多少有点让我大跌眼镜

  • 最让我意外的是长文写作。GPT-5.6 对文本结构和文风的控制明显进步,AI 味少了非常多,成稿几乎随便改改就能达到理想标准。

  • 至于 Token 花费,至少在我测试的几个任务里,两者没有拉开特别夸张的差距。它们都很贵。但 Codex 胜在给了重置额度

三轮实测,好几个意料之外

做农场小游戏

最近我一直在王者农场里种芋头,所以几乎是下意识地先让它们做了一个种菜小游戏。

这个任务整体不算太难。GPT-5.6 我用的是 Sol 模式 High 档,Fable 5 也用了对应的高档位,后面的任务同样如此。

结果刚看到页面,我差点被 GPT-5.6 的审美吓到一口水喷出来……

双方收到的是同一套提示词。

Fable 5 用 Emoji 当主视觉,虽然多少有点偷懒,但整体还算过关。至于 GPT-5.6,这个页面真的太呆了。


*左GPT-5.6 Sol,右Fable 5

尤其是 GPT-5.6 Sol 搞出的这个南瓜和胡萝卜长相,我真无力吐槽...


而且,这还是 GPT-5.6 仔细斟酌后交出来的版本。

它足足花了二十分钟。

那边 Fable 5 已经把游戏做完,我都开垦五块地了,这边 GPT-5.6 还在勤勤恳恳地思考,甚至会抽取单独画面做质量验证。

看它这么认真,我当时还挺期待,没想到最后种出来的是这片地……


至于游戏功能方面,两边倒是都很完整,可以走完“种菜—浇水—收获—卖金币”的基本流程。

但 Fable 5 会主动加入“虫子啃农作物”、“浇水可以加速生长”这类机制。都是很小的设计,却能明显提高游戏的趣味性,玩起来更有惊喜。



跑一遍长文系统

接着,我让 GPT-5.6 和 Fable 5 分别跑了一遍我自己设计的文章产出系统

这个系统比较复杂,既要调用检索等工具,也要使用Skill,还会强考核模型的逻辑推理和写作表达能力。

我让它们按「推荐选题—拆分素材—产出内容」的顺序,把每个功能都跑了一遍。


在推荐选题和拆分素材这两个环节,两边就表现出一些差异。

比较明显的区别体现在规则执行上。

GPT-5.6 会严格遵守我设置的时效性要求,严格到,最后一个结果都没有返回。


Fable 5 则会适当放宽时间限制,同时明确告诉我,它为什么这么做。


经过几轮沟通,我和它们定下来一个产品向的选题,然后要求直接写出完整文章。

结果有点出乎我的预料。

没想到,GPT-5.6 写出来的文章,可读性比 Fable 5 强了非常多。

Fable 5 写出“先说清楚,这篇不是实测,我没安装它”、“下面把这一圈东西讲讲,这门生意最脆的地方在哪”、“好不好用,我没法替你回答,评论区里有人替我测了”这种人机感极强的句子。

GPT-5.6 全程没有这种表达。

它甚至会在合适的位置写一句:“AI 负责不忘记关系,人负责不辜负关系”,这种让我会停下来思考几秒的句子...

这确实算得上意外惊喜。现在的大模型几乎都在往 Coding 冲,已经很少有人优化写作能力了。

至于 Token 消耗,这个任务由于横跨内容推荐、素材拆分、信息整理、文章写作多个环节。两个模型都只跑完了一次任务,没留下一点对话修改的空间,就触发了 Token 限制。

最直接的差别在于,Codex 给了我重置额度。



200行数据分析

最后,我又试了试 GPT-5.6 和 Fable 5 在复杂工作场景中的表现。

我上传了一张电商店铺的数据表,里面是库存和销售的真实数据,大概200多行。

我的需求是,让两个模型做数据可视化和洞察分析,把结果输出成一个 HTML 文件,能直接预览。

两个模型输出的结果大致如下。


*GPT-5.6


*Fable 5

先看基础结果。两个模型都能正确读取表格并完成主要指标的统计,产出的页面也可以正常使用,没有出现明显的数据错位。

但从分析深度来看,Fable 5 明显更好。

除了常规的 GMV 和毛利,它还额外计算了客单价、SKU 动销率等更贴近电商经营的指标。GPT-5.6 给出的内容相对基础,主要围绕 GMV、利润、成本和销售规模展开。


*Fable 5 包含了一些进阶分析图表

再看经营建议。

Fable 5 在经营洞察和风险诊断模块中,给出了 8 个核心观点和 6 个高优先级行动建议;GPT-5.6 则给出了 6 个洞察和 5 个行动建议。

单看数量,两者差距不大,Fable 5 略微领先。

真正拉开差距的是内容。

Fable 5 给出的核心观点里,既有 6 个不同等级的风险预警,也有 2 个经营亮点。每个判断后面都有相对详细的解释。

GPT-5.6 的解释通常只有一句话,而且大部分停留在结论层面,没有继续拆解原因。


*Fable 5 给出的经营洞察与风险诊断模块


*GPT-5.6 给出的经营诊断模块

可视化方面,同样 Fable 5 更胜一筹。

它的图表样式多,还加入了交互设计,鼠标悬停能看到一些小动画,点击复合图中的图例也能够实现指标的快速筛选。

GPT-5.6 只做了基础图表,大部分都是纯静态的。


*Fable 5 在图表上会有可交互的设计

速度和消耗方面,GPT-5.6 完成任务用了 11 分钟,消耗约 14 万 Tokens;Fable 5 只用了 5 分钟,消耗约 9 万 Tokens。

这一局,Fable 5 赢得比较彻底。

用GPT-5.6时最该避开的坑

测完这些,我又翻了翻推特,发现吐槽 5.6 Sol 的人还真不少。

首先是它 Token 消耗快。



官方也出来做了解释,说日常用 Sol Medium 档就行,Ultra 档的确是 Token 刺客。


页面审美这件事,也不只是我一个人觉得奇怪。不过推特上的反馈比较分裂,有人惊喜,也有人看完只想沉默。


但相比速度、审美和 Token 消耗,GPT-5.6 Sol 更值得警惕的是文件操作风险。

有用户反映,它在获得较高的本地权限后,居然会误删文件,而且一旦删除,几乎无法恢复。

AI 大 V Matt Shumer 发帖称,他在 Mac 上测试 GPT-5.6 Sol 时,给本地 Agent 开启了 Full Access,并让一个子 Agent 执行文件清理任务,结果机器上的文件遭到了大范围删除。


事情发生后,他非常震惊,也很愤怒。他认为,这类问题早在 GPT-3.5 时代就应该被避免。

随后还有开发者发现,官方在 GPT-5.6 的系统卡中提示过类似风险。其中一行警告提到,模型存在删除未经授权数据的倾向。


这条警告,让我又改变了一些对 GPT-5.6 Sol 的使用看法。

前面几个问题,多少还能用模型档位和任务类型解释。速度慢可以降档,Token 贵可以少开 Ultra,前端审美不行也可以换模型重做,但误删本地文件这问题太大了。

如果真的要用 GPT-5.6 Sol,也记得一定不开 Full Access...

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
阿姨这身白色蕾丝连衣裙搭配肉色丝袜和柳丁平底鞋,确实很对味

阿姨这身白色蕾丝连衣裙搭配肉色丝袜和柳丁平底鞋,确实很对味

美女穿搭分享
2026-08-17 17:29:57
王星越好心办坏事?省了550美元,却把内娱人情世故全得罪了

王星越好心办坏事?省了550美元,却把内娱人情世故全得罪了

喵喵娱乐团
2026-09-17 15:44:58
美国人发了一张照片:印度人的问题,比任何人想象的都严重得多!

美国人发了一张照片:印度人的问题,比任何人想象的都严重得多!

史智文道
2026-09-17 11:54:22
9月20号正式开播!腾讯也有一部好剧来袭,女配好美

9月20号正式开播!腾讯也有一部好剧来袭,女配好美

小邵说剧
2026-09-17 07:55:07
孩子父亲回应“2岁幼童从18楼坠亡”:妻子想不通需宣泄,我们的关系没那么“恼火”

孩子父亲回应“2岁幼童从18楼坠亡”:妻子想不通需宣泄,我们的关系没那么“恼火”

红星新闻
2026-09-17 16:18:34
美国媒体确认了:俄罗斯的一颗尖端间谍卫星向伊朗提供了情报,至少协助了伊朗部分对美军基地的精确打击行动

美国媒体确认了:俄罗斯的一颗尖端间谍卫星向伊朗提供了情报,至少协助了伊朗部分对美军基地的精确打击行动

吉刻新闻
2026-09-17 16:22:03
为什么巴萨锋霸7场造15球,还甘心给亚马尔当配角?

为什么巴萨锋霸7场造15球,还甘心给亚马尔当配角?

星Xin辰大海
2026-09-17 10:41:28
懂行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

懂行人买手机,为何很少选OPPO、vivo?4个现实原因看完恍然大悟

辉哥说动漫
2026-09-17 07:06:03
《交锋》大结局:那个被枪毙的导弹专家,临死前说了句让所有人沉默的话

《交锋》大结局:那个被枪毙的导弹专家,临死前说了句让所有人沉默的话

陈意小可爱
2026-09-11 10:10:00
外卡之路已封!郑钦文打武网只能靠战绩和排名!

外卡之路已封!郑钦文打武网只能靠战绩和排名!

西门吹灰
2026-09-17 07:30:30
新款丰田兰德酷路泽官图发布!新增混动系统,取消纯燃油动力

新款丰田兰德酷路泽官图发布!新增混动系统,取消纯燃油动力

汽车网评
2026-09-17 13:58:09
6冠全部同行麻了!德保罗跟着梅西连续拿奖杯,缘分属实难得

6冠全部同行麻了!德保罗跟着梅西连续拿奖杯,缘分属实难得

十三哥侃大山
2026-09-17 12:31:48
总投资50亿元!新地标,广州第四高楼竣工!

总投资50亿元!新地标,广州第四高楼竣工!

大湾区发展网
2026-09-16 16:29:17
亏掉70%后,这位股市大神,绝望地写下了一首诗……

亏掉70%后,这位股市大神,绝望地写下了一首诗……

星图金融研究院
2026-09-15 23:56:53
“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

“一个月陪睡一两次”:网红魏莹的榜一大哥照片曝光,他身价过亿,是个大企业家

江山挥笔
2026-08-25 16:40:36
美股芯片股大涨,英特尔涨超8%,SpaceX市值重回2万亿美元,中国资产走高

美股芯片股大涨,英特尔涨超8%,SpaceX市值重回2万亿美元,中国资产走高

21世纪经济报道
2026-09-17 23:06:09
43岁我娶22岁乌克兰姑娘,证婚人竟是她在国内偷偷领证的前夫

43岁我娶22岁乌克兰姑娘,证婚人竟是她在国内偷偷领证的前夫

真实人物采访
2026-09-16 09:00:11
大学生求父母赞助苹果最新手机iPhone Duo,黄牛炒到9万,家长:到底给不给买?

大学生求父母赞助苹果最新手机iPhone Duo,黄牛炒到9万,家长:到底给不给买?

新东方
2026-09-14 16:00:08
73岁南非总统去印度开了个会,回国就病倒了,总统府只说了四个字

73岁南非总统去印度开了个会,回国就病倒了,总统府只说了四个字

莫地方
2026-09-17 21:47:02
金正恩访问越南,乘专列耗时65小时40分,为什么不坐飞机?原来大有讲究

金正恩访问越南,乘专列耗时65小时40分,为什么不坐飞机?原来大有讲究

文史道
2026-08-15 23:01:48
2026-09-18 01:16:49
四木相对论 incentive-icons
四木相对论
唠唠科技,看看世界
189文章数 3关注度
往期回顾 全部

科技要闻

影视飓风Tim反掰iPhoneDuo被质疑

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

头条要闻

深圳商铺楼板坍塌致1名收废品人员死亡 调查报告公布

体育要闻

逆转朝鲜,国足亚运队“啃老”过关

娱乐要闻

rapper赵涛恋情曝光!带甜馨妈妈散步

财经要闻

缺钱的追觅 隐藏的债务?

汽车要闻

猛士X700内饰公布 打造家庭泛越野智能座舱

态度原创

旅游
本地
家居
时尚
公开课

旅游要闻

忻州这2个地方,专门用来“虚度秋天”

本地新闻

不止胖东来!许昌藏着半部三国史

家居要闻

2026建博会(广州) 公装联探展交流活动

潮流之向,自有回响——浪潮音乐大赏特别企划

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版