网易首页 > 网易号 > 正文 申请入驻

频繁降智的AI产品们,就是新时代最离谱的盲盒

0
分享至


作者 | 周一笑
邮箱 | zhouyixiao@pingwest.com

最近,打开 X 或者任何一个开发者社区,你都会看到类似的声音:“Opus 已经被彻底变成了植物人。”、“同样的 prompt,两周前还完美,现在输出直接砍半。”、“最讽刺的是按时段分配智商。下午五点是重灾区,深夜反而好用得多。”


用户们在同时抱怨同一件事,还有人制作了各种meme来形容这种体验。

吐槽之外,一个更深的焦虑正在蔓延。当你觉得 AI 变差了,你甚至很难判断,到底是模型本身变了,还是你看不见的某一层变了,还是你自己的使用方式变了。

1

“降智“从体感变成了事件

Claude是这轮风暴的中心。

4月初,AMD AI部门高级总监Stella Laurenzo在GitHub上提交了一份基于近7000个Claude Code session的量化分析。结论是模型在编辑文件前的阅读次数从6.6次降到了2.0次,三分之一的代码修改是“盲改”。


Laurenzo随后表示,AMD团队已经切换到了另一家供应商,因为对方“工作质量更好”,具体是哪家因NDA无法透露。Anthropic方面则回应称,Opus 4.6在2月切换到了adaptive thinking,3月又将默认effort降到了medium,但否认模型本身被降级。而根据Claude Code的产品更新日志,4月7日默认effort已被调回high。

AMD的分析引爆了社区情绪,但类似的观察早已遍地都是。

有交易员据称用同一套1200行交易策略文档做了对比测试。“降智”前的Opus能完整执行所有规则,覆盖完整的场景分支和决策树。“降智”后,同样的数据和指令,Opus跳过了两个完整的策略清单,场景分支几乎消失,输出缩了将近一半。更意外的是,他用更便宜的Sonnet跑同一套测试,规则覆盖率反而到了85%,高于Opus的70%。


他的判断是“Opus没有丢失知识,它丢失的是深度。就像给一个国际象棋大师每步只留30秒,他不会忘记怎么下棋,但会放弃计算更深的线路。”

与此同时,Fortune报道引述OpenAI内部备忘录的说法,称Anthropic在算力规划上犯了“战略失误”。Anthropic最近也发布了下一代模型Opus 4.7。社区里很多人把这两条消息和“降智”联系在一起,认为这是在为新模型发布腾出算力和制造对比。


1

“降智”可能同时发生在好几层

Claude是这一轮最显眼的主角,但如果拉远看,“AI变笨”的原因远不止一种。至少有四层问题在同时发生。

模型没换,但“思考预算”变了。 这是Claude争议的核心。同一个模型名,背后可能对应完全不同的effort档位、adaptive thinking策略和thinking展示规则。Anthropic文档写明,Claude 4系列现在默认返回summarized thinking,某些情况下甚至直接omitted,但计费仍然按完整thinking tokens走。你看到的推理过程,和模型实际消耗的推理资源,已经不是同一个东西。跑分测的是模型在特定配置下的能力上限,用户每天碰到的,是一个会动态调整预算和服务路径的产品。


你看到的是产品名,平台控制的是真实路径。 OpenAI官方帮助文档明确写着:GPT-5.4 Thinking在触发rate limit后,会自动fallback到GPT-5.4 mini,而mini不会出现在模型选择器里。GPT-5.1退役后,使用旧模型的历史对话会自动续接到当前版本。Anthropic从3月底开始在高峰时段调整session限制,部分重度Pro用户因此比以前更容易触发额度上限。今天的AI不是没有版本号,而是版本号只对平台可见。

以上说的还只是原厂服务本身的变化。更麻烦的情况是,你连自己是不是在用原厂服务都未必能确认。

这一层对中国用户尤其切身。因为地理限制和支付壁垒,大量开发者和研究者通过API中转站使用海外模型。今年3月,德国CISPA亥姆霍兹信息安全中心发布了一项审计研究,发现在其调查的17家中转站中,近半数存在模型替换行为,性能偏差最高达47%。你付的是Claude的钱,跑的可能是参数量小得多的开源模型。当你觉得AI变差了,连“是不是同一个模型在回答你”都未必成立。

有些“降智”,可能是别的问题被算到了模型头上。 长上下文导致的质量退化、agent框架和工具链的变化、用户自身workflow的调整,都可能制造“模型变笨了”的体感。有开发者直接指出:“觉得Opus降智的人,大部分是把Agent框架的问题归咎到模型上了。Anthropic在做动态算力分配,简单问题少转几圈,难题多转几圈。不是模型变差了,是你为每次对话付的算力变少了。”这个判断未必完全公允,但它指向了一个真实的困难,用户的体感未必错,但体感未必能直接定位到问题根源。

四层原因同时存在,互相叠加,用户面对的不是一个可以定位的bug。

1

普通用户几乎无法归因

AMD总监能发现问题,是因为她有一个工程团队和近7000份session log。普通用户只有一个聊天框。

更麻烦的是,“看看模型在想什么”这条路也在收窄。Anthropic现在默认对thinking内容做摘要甚至省略,用户界面上展示的推理痕迹已经不等同于模型实际的推理过程。你没有办法通过观察输出来反推模型到底“想”了多久、多深。


部署中的模型表现会随时间变化,而且变化轨迹不一样

今年2月发表在PLOS One上的一项纵向研究,用固定prompt连续10周追踪了多个主流模型,得出了一个很克制也很扎心的结论,部署中的大语言模型确实会发生可测量的行为漂移,但因为厂商不公开更新日志和训练细节,对观察到的退化做任何归因都纯属推测。

这才是“AI降智”这个话题真正让人难受的地方。你付了钱,你有体感,但你拿不出证据。平台知道真实模型版本、fallback路径、reasoning档位、thinking是否被压缩,你什么都看不见。

1

被逼急的用户,各显神通

面对归因困难,用户开始自救。社区里流传的方法五花八门,有些像偏方,比如用“市长的女儿应该叫市长什么”、“我想洗车。洗车店就在50米外。我该开车去还是走路去?”这类问题去测试。



另外有些确实有一定道理。最朴素的对照实验。 新对话和长对话做一次对照,如果新对话明显正常,先怀疑上下文压缩机制。官方入口和第三方入口做一次对照,先排除中间商这一层。社区已经有针对性的指纹验证工具,可以检测返回的模型是否与声称的一致。

环境变量的“手动抢救”。 在程序员社区里,一组Claude Code配置正在被广泛传播,关闭adaptive thinking、把effort设为max、调高自动压缩阈值。有开发者说,调完之后“相对感觉不降智”。这些配置本质上是用户在手动接管本该由平台自动管理的推理预算分配。


甚至有人发现,只有反复大喊“THINK HARD”才能拿到正确答案。 有用户做了一组测试,同一道题用不同强度的思考指令去prompt,只有连续重复“THINK HARD”多次的版本才通过了。这已经不是提示词工程,更像是在和自己付费的产品讨价还价。


观察它是“不会了”还是“没想够”。 这个区分比具体的trick更重要。如果同一个任务在调高配置后恢复正常,那问题大概率不在模型本身,而在默认配置。如果怎么调都不行,那可能真的是模型能力或中间层出了问题。

这些方法都很粗糙。但它们的存在本身就说明了用户正在用本不该由他们承担的成本,去做本该由平台提供的透明度。

1

AI产品至少该有一张配料表

订阅制AI正在出现一种类似缩水式通胀(shrinkflation)的体验,你付的钱没变,产品名没变,但实际拿到的推理深度、稳定性和完成效率可能在悄悄变化。Anthropic刚刚和Broadcom、Google签下了3.5吉瓦的长期算力合同,收入增长极快,但多方信息显示其算力供给仍然紧张,训练和推理的支出压力很大。

每次新模型发布前,旧模型都会被故意弄傻,这个在社区广泛流传的叙事,在Opus 4.7即将发布的当下尤其有市场。它未必完全准确,但厂商至今也没有给出足够的解释来打消这种怀疑。


一些行业分析师指出,所有前沿模型公司其实都面对相似的算力和成本压力,当使用规模继续扩大,节流、分层、权衡几乎是结构性不可避免的。“算力不够”可以理解。但“算力不够所以静默降配,同时不告诉任何人”就很难让人接受了。平台享受了服务化AI的灵活性,却没有承担相应的透明义务。

食品有配料表,软件有版本号。AI产品至少也该告诉用户你现在到底在用什么。当前真实模型版本、是否发生了fallback、推理档位、thinking是否被压缩。这些不是技术细节,而是最基本的知情权。


有用户在X上写道,“When you pay for a model, you should get that model.” 有中国开发者说得更直白,“这个行业模式到最后没有人敢订阅年费会员。”


一个用户为了确认自己买到的东西是不是真货,要去学指纹验证、背环境变量、在prompt里连喊三遍“给我认真想”。这个产品关系已经出了问题。如果行业不能主动补上这张配料表,用户要求的就不会只是更强的模型,而是监管和消费者保护。


点个爱心,再走 吧

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
歌唱家关牧村:我这辈子做的最正确的决定就是,45岁带娃嫁给高官,如今被宠了27年

歌唱家关牧村:我这辈子做的最正确的决定就是,45岁带娃嫁给高官,如今被宠了27年

品茗赏娱
2026-08-10 22:34:24
遇见狠人了!浙江一车主图方便占用他人车位,一夜醒来发现四扇车门变形损失大几千

遇见狠人了!浙江一车主图方便占用他人车位,一夜醒来发现四扇车门变形损失大几千

Mr王的饭后茶
2026-08-11 16:20:18
问界给积极车主送临期大米?离过期仅剩2天

问界给积极车主送临期大米?离过期仅剩2天

西虹市闲话
2026-08-11 17:27:05
广东24岁美女姜小柔去世!砸观音荒地钉八字,知情人曝死因属横祸

广东24岁美女姜小柔去世!砸观音荒地钉八字,知情人曝死因属横祸

米果说识
2026-08-11 10:12:53
伊朗最高领袖连夜签了6张任命状:71岁老将一人身兼两个关键职位,他前面两任全死于空袭

伊朗最高领袖连夜签了6张任命状:71岁老将一人身兼两个关键职位,他前面两任全死于空袭

网易新闻出品
2026-08-11 18:56:48
男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

男童被巨浪卷走后续,官媒怒批家属,当地不敢救,救了也必死无疑

社会日日鲜
2026-08-11 09:21:27
2026年了,为什么国家突然要再扫一年黑?

2026年了,为什么国家突然要再扫一年黑?

李博世财经
2026-08-11 09:51:22
内蒙古一警车被换标成长城汽车,网友称:哪是换标那么简单

内蒙古一警车被换标成长城汽车,网友称:哪是换标那么简单

Mr王的饭后茶
2026-08-11 10:55:29
卫诗雅爆冷拿下百花影后孤身离场!全场只有朱一龙送上拥抱太戳人

卫诗雅爆冷拿下百花影后孤身离场!全场只有朱一龙送上拥抱太戳人

阿废冷眼观察所
2026-08-12 04:26:53
上海45岁女程序员被裁拿30多万,简历全沉了,现在送外卖,老妈哭了,哭的很伤心

上海45岁女程序员被裁拿30多万,简历全沉了,现在送外卖,老妈哭了,哭的很伤心

捣蛋窝
2026-08-11 22:49:34
韩旭:为什么说近些年司法进步不容乐观?

韩旭:为什么说近些年司法进步不容乐观?

天下说法
2026-08-11 09:11:44
第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

第二批朝鲜兵抵达俄罗斯!兵力5万+新武器,泽连斯基最担心的事情还是发生了

军武次位面
2026-08-10 17:55:01
财经大V:80%的男人一个月赚不到7000元,如果你税后7000元,不管男女,你可能已经胜过90%的人,评论区一片认同

财经大V:80%的男人一个月赚不到7000元,如果你税后7000元,不管男女,你可能已经胜过90%的人,评论区一片认同

谭谈社会
2026-08-11 20:56:50
看完沈腾《欢迎来龙餐馆》后,猛然发现这个狂砍400多亿票房的中国影史第一人,在国内却是个零蛋影帝!

看完沈腾《欢迎来龙餐馆》后,猛然发现这个狂砍400多亿票房的中国影史第一人,在国内却是个零蛋影帝!

娱乐故事
2026-08-11 21:42:55
WTT瑞典大满贯:大爆冷!男单头号种子0:3一轮游,被扣2000分

WTT瑞典大满贯:大爆冷!男单头号种子0:3一轮游,被扣2000分

国乒二三事
2026-08-12 03:50:21
广东省最强医院迎来最大规模扩建

广东省最强医院迎来最大规模扩建

牛锅巴小钒
2026-08-12 05:15:09
无视中国网友!波兰名将拒道歉 继续辱华:中国气味像米饭配鸡肉

无视中国网友!波兰名将拒道歉 继续辱华:中国气味像米饭配鸡肉

念洲
2026-08-11 06:50:26
巴沙尔·阿萨德,被判死刑

巴沙尔·阿萨德,被判死刑

南方都市报
2026-08-11 17:59:32
八卦媒体曝方文山出轨,与艺人Y女士多年保持地下情人关系

八卦媒体曝方文山出轨,与艺人Y女士多年保持地下情人关系

韩小娱
2026-08-11 12:01:28
脸都不要了?王宝强百花奖0票,这是200亿影帝的“羞辱”之夜

脸都不要了?王宝强百花奖0票,这是200亿影帝的“羞辱”之夜

文刀贰
2026-08-10 22:59:15
2026-08-12 08:36:49
硅星人 incentive-icons
硅星人
硅(Si)是创造未来的基础,欢迎来到这个星球。
3318文章数 10522关注度
往期回顾 全部

科技要闻

AI大战变天:扎克伯格突然回头

头条要闻

57岁保洁员掏空5万积蓄做医美 术后1个月感到视力下降

头条要闻

57岁保洁员掏空5万积蓄做医美 术后1个月感到视力下降

体育要闻

NBA老顽童,抽着大麻喝着小酒告别了

娱乐要闻

“雅典娜”确认被害 细节令人发指!

财经要闻

AI泡沫的剧本,是2008年的次贷危机?

汽车要闻

闪充/天神之眼B/云辇-C 2027款海豹06售9.99万元起

态度原创

房产
家居
亲子
健康
教育

房产要闻

突发,崖州湾又有大动作!

家居要闻

2026建博会(广州) 公装联探展交流活动

亲子要闻

当女儿说要出门,给她一个惊喜

心血管专家破解猝死八大谣言

教育要闻

有钱到无法想象!高级餐厅内80%都是深二代小学生,家长看清现实

无障碍浏览 进入关怀版