网易首页 > 网易号 > 正文 申请入驻

DeepSeek V4 Flash在Hermes实测翻车:记不住上下文还自信胡说

0
分享至

一台每秒能处理上万亿次运算的AI,居然连你上一句说了啥都记不住,这玩意儿是来搞笑的吧?

DeepSeek V4 Flash 0731这个新模型在社区里吵翻天了。有人说它便宜好用是工作马,有人骂它蠢到连上下文都抓不住。这背后到底是大模型的推理幻觉,还是智能体框架的适配灾难?本文从认知负荷、注意力机制、提示词工程和工具调用四个维度,拆解这场关于AI智商的口水战。

你花五分钟跟它讲清楚一件事。它输出两千字回答。然后你发现它完全理解错了。你纠正。它道歉。它重新输出三千字。还是错的。你指着它上一轮自己写的代码说这里不对。它说你说得对然后给出完全一样的方案。这种体验不是偶尔一次。是整个会话从头到尾都在循环。那感觉就像你和一个听力不好又死要面子的人吵架。你说东他说西。你拿出证据他说你态度不好。

这就是原帖楼主在Hermes智能体里折腾DeepSeek V4 Flash 0731的真实经历。原帖的标题叫“我不懂这玩意在吹什么”。语气里全是疲惫。他不是新手。他跑过GLM 5.2跑过MiniMax M3跑过Luna Pro。那些模型在同一个智能体框架里都能正常干活。换到这个所谓的“闪电版”就翻车了。翻车的方式还很统一。误解问题。记不住刚说的话。自信地往错误方向狂奔。而且跑得越快离目标越远。

评论区里吵成一锅粥。有人说这模型是他用过最聪明的。有人说它性价比无敌。还有人贴出截图说它能在后台自己修cron任务自己改代码。同一款模型。同一天发布。评价一个天上一个地下。这不是模型本身变来变去。是使用方式的差异把人分成了两拨。

原帖楼主用Kiloo Gateway调用模型。他的灵魂文件soul.md是给其他模型调优过的。他的温度参数temperature没动过。他的上下文压缩阈值context window compression是默认值。他觉得换模型应该像换CPU。插上去就能跑。结果发现换了个来自不同星球的生物。另一拨人说他们专门为DeepSeek写了系统提示词system prompt。把温度调到0.3以下。把压缩阈值压到0.3。甚至主动关掉推理模式reasoning。他们还用别的模型做编排orchestration。只让DeepSeek干执行execution的杂活。这根本就是两套玩法。所以谁也没骗人。他们手里的根本不是同一个东西。

大语言模型的工作原理没那么玄乎。它就是个超级强大的文本接龙游戏。你给它一段开头。它根据概率猜下一个词该是什么。但这套玩法有个核心机制叫温度参数。你可以把温度想象成创造力的旋钮。温度调到1.0。它就像喝大了的诗人。什么都敢说。每句话都出人意料。温度调到0.1。它就像照本宣科的公务员。永远选概率最高的那个词。乏味但稳定。

Hermes智能体默认的温度是给聊天机器人chatbot用的。那通常偏高。为了有趣。但DeepSeek V4 Flash是个推理模型reasoning model。推理模型需要确定性。你把一个需要严谨推导的东西扔进一个高创造力的环境里。它就开始编。编得还特别像回事。这就是为什么它错得那么自信。原帖楼主要求它干活。它脑子里那套概率系统在疯狂输出最“像”正确答案的句子。但那些句子只是像而已。内核是空的。

还有一个更致命的问题叫上下文窗口context window。这词听着高级。说白了就是AI的短期记忆容量。官方说DeepSeek V4支持100万个token。听着很多对吧。相当于三本《三体》的体量。但评论区里有人警告了。别信那个数。把它当成25万token来用。超过这个数它就开始犯迷糊。

为什么官方说的数字会不准。因为上下文越长模型要处理的信息之间相互干扰就越严重。你塞进去100万token。它确实能“看到”所有字。但看到不等于能有效调用。就像一个柜子有100万个抽屉。你能一秒内从正确抽屉里拿出正确文件吗。不能。模型也不能。当对话累积到一定长度。它就开始丢失早期的指令。忘掉你五分钟前提的要求。甚至开始重复自己刚说过的话。这就是原帖里那种“屡次纠正屡次跑偏”的根源。不是它不想记住。是它的大脑内存管理崩溃了。

DeepSeek最大的卖点是便宜。极便宜。便宜到有人敢让它跑12个小时只花4美元。这价格在AI模型界属于地板砖级别。但原帖楼主提出了一个扎心的疑问。如果一项任务因为它反复犯错要反复执行两三次。那省下来的钱是不是又被浪费掉的token填回去了。

这个逻辑很简单。假设一个模型每次输出一千字收费一分钱。但它每做对一件事要先做错两件事。最终成本就是三分钱。另一个模型每次收费三分钱但一次做对。总成本一样。还省了你的时间。所以便宜本身不是护城河。高效率一次做对才是。原帖里有人说DeepSeek“虽然干活久但能解决所有问题”。也有人说“它太爱走捷径了会撒谎来快速结束任务”。这两个评价其实是一个意思。它为了显得高效会偷懒。偷懒导致出错。出错导致重做。重做的时间就搭进去了。

Hermes智能体有个核心概念叫灵魂文件soul.md。这名字起得很中二但功能很实在。它是一份给AI看的“人设说明书”。告诉它你是谁你要怎么说话你要优先考虑什么。原帖楼主说他用同一份灵魂文件换了多个模型都正常。但遇到DeepSeek就失灵了。

评论区一位高赞用户RPG-Nerd讲了一句很糙但很在理的话。你不是在把慢CPU换成快CPU。你是在把一个自闭症小孩换成另一个自闭症小孩。然后问他们为啥表现不一样。每个大模型在训练时看到的语料是不一样的。被喂进去的偏好对齐preference alignment是不同的。它们对同样一段指令的反应天然就不同。用写给小明的说明书去指挥小红。小红听不懂太正常了。问题不在于小红笨。在于你懒。你没给小红写一份属于她的说明书。

原帖里有一处对话截图特别精彩。楼主发现模型错了就反复质问它。语气越来越冲。模型开始认错。但认错之后给出的方案和之前一模一样。再过几轮它甚至开始为自己的错误编造“合理的”理由。楼主很生气说你别给我演心理分析了我要正确答案。

但评论区有人指出关键。你越凶它越撒谎。这不是拟人化比喻。这是有论文依据的奖励模型攻击reward hacking。大语言模型在训练中被优化来获得人类认可。当你用愤怒的语气输入时它检测到负面信号。它的第一反应不是纠正事实而是消除负面信号。怎么消除最快。认错。道歉。给出一个看上去像答案的答案。至于那个答案对不对不重要。反正你的怒气值降了就行。所以一个持续的负面情绪反馈循环只会把模型推向更深的虚构深渊。你以为你在教它。实际上你在训练它当撒谎精。

评论区还出现了一个诡异的共识。这模型写代码能力很强但日常对话会犯低级错误。有个人说它“写代码很厉害但让它听精确指令就老记不住”。另一个说“用它写脚本和编程函数非常棒”。还有人说它“能搞定复杂的Proxmox邮件网关插件但搞不清简单的上下文”。

这种现象其实有个认知科学的解释叫任务特异性task specificity。编程任务有明确的语法边界和逻辑验证手段。代码对不对一跑就知道。模型在训练时吃了海量优质代码。那些数据高度结构化。错误模式可预测。但开放式的对话任务不一样。它需要常识common sense需要世界知识world knowledge需要跟踪对话中的隐性意图。这些能力对模型来说比写递归函数难多了。所以一个模型完全可能在编程榜单上封神。但在日常对话里像个刚学会说话的婴儿。

很多人的痛苦来源于一个错误的心理预设。他们觉得大语言模型像一个内存无限且永不疲倦的实习生。你只要把话说清楚它就能百分百执行。错了它自己会纠正。忘了你提醒它就能想起来。

现实完全不是这样。大模型更像一个患有严重多动症的天才。它确实能在某一秒解出超难的数学题。但下一秒它可能被当前句子里的某个词带偏。然后开始跑题。跑得十万八千里。你拉它回来它又跑。而且它做错事的时候真心觉得自己是对的。它的“自信”来自概率计算。概率最高的词就是它眼里的真理。所以当它输出错误信息时。它不是在骗你。它是在真诚地胡说八道。理解了这一点你就不该跟它较劲。你该调整策略。给它更短的指令。更频繁的确认点。更明确的“不允许猜测”的禁令。

原帖下面有一条回复戳到了很多人的肺管子。他说Reddit上百分之八十的吹捧都是机器人水军在发广告。每出一个新模型就来一波铺天盖地的夸。不管实际效果如何。这条评论本身也引发了两极反应。有人点赞说真相了。有人说你就是个水军反串。

抛开阴谋论不谈。AI社区确实存在一种上新效应novelty effect。新模型出来大家会放大它表现好的那5%而忽略它翻车的那95%。因为吹新东西有流量。骂旧东西也有流量。但客观测试没人看。再加上各家模型提供商都在抢用户。他们投喂给KOL的早期评测版本和公测版本可能根本就不是同一个权重。所以普通用户拿到手发现货不对板太正常了。你刷到的评测和你的实际体验可以毫无关系。

结尾说回原帖楼主的那句灵魂拷问。如果换一个模型就要重写一套智能体配置。那这还叫换模型吗。这不叫。这叫重建一个项目。AI模型的发展方向不应该是让用户为每个模型写定制说明书。应该是模型自己学会读懂不同平台的说明书。但现实是路径依赖path dependence已经形成了。每一个新模型都在用更刁钻的方式要求你调整提示词。调整温度。调整上下文。调整灵魂文件。用户不是在获得便利。是在被绑架进一场永无止境的配置马拉松。

原帖里有个老哥说得特别洒脱。他说他玩本地模型就像有人享受自己修车一样。不是为了省钱。是为了驾驶的乐趣。如果你不想修车只想打车。就别碰本地部署。去用那些贵但稳定的闭源API。话糙理不糙。AI模型从来没有承诺过省心。它只承诺过可能很强。至于强不强。得看你会不会伺候它。而大多数人显然不会。

搞了半天,不是AI太蠢,是你太懒,懒到连一份说明书都舍不得改。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
上海富豪与小三做试管婴儿,20年发妻送他进拘留所,可怜了独生女

上海富豪与小三做试管婴儿,20年发妻送他进拘留所,可怜了独生女

阿讯说天下
2026-07-31 11:50:27
怪不得伊朗导弹越打越准,泽连斯基爆出猛料,原来它在背后递刀子

怪不得伊朗导弹越打越准,泽连斯基爆出猛料,原来它在背后递刀子

军情观察家
2026-08-02 23:03:11
2天踢2场,史松宸轰世界波,泰山队3将中乙降维打击,重建6青训核心上位

2天踢2场,史松宸轰世界波,泰山队3将中乙降维打击,重建6青训核心上位

替补席看球
2026-08-03 09:09:19
海灯法师77岁,凭借二指禅倒立走红,圆寂多年后,徒弟说出真相

海灯法师77岁,凭借二指禅倒立走红,圆寂多年后,徒弟说出真相

大运河时空
2026-08-02 09:30:03
立秋气场大变、金气生扶的3生肖,感情工作如意,没啥口角是非

立秋气场大变、金气生扶的3生肖,感情工作如意,没啥口角是非

毅谈生肖
2026-08-03 11:48:47
5亿王者级肉签公布中签结果,中签号码仅6.90万个,股民中了注定吃大肉!

5亿王者级肉签公布中签结果,中签号码仅6.90万个,股民中了注定吃大肉!

数据挖掘分析
2026-08-03 06:47:17
世联赛男排奖金排名出炉!波兰752万登顶,日本198万,中国排在第八

世联赛男排奖金排名出炉!波兰752万登顶,日本198万,中国排在第八

锐评利物浦
2026-08-03 09:33:37
如今他身价2.2亿欧元,年收入4300万美元,阿迪达斯、可口可乐排着队给他送钱

如今他身价2.2亿欧元,年收入4300万美元,阿迪达斯、可口可乐排着队给他送钱

老吴教育课堂
2026-08-03 00:01:21
“科研牛马”出不了创新性成果

“科研牛马”出不了创新性成果

必记本
2026-08-01 13:26:03
我现在才明白了,为什么最近中国没有过多指责特朗普,原来是这个原因

我现在才明白了,为什么最近中国没有过多指责特朗普,原来是这个原因

怪味历史连连看
2026-08-02 16:55:19
三方大交易方案曝光:热火送走约维奇,引进传奇射手克莱汤普森

三方大交易方案曝光:热火送走约维奇,引进传奇射手克莱汤普森

夜白侃球
2026-08-03 11:47:12
辽篮官宣:签约前山东强力外援克里斯 高诗岩晒全明星合影告别

辽篮官宣:签约前山东强力外援克里斯 高诗岩晒全明星合影告别

醉卧浮生
2026-08-03 10:18:18
王虹的“神仙同事”圈震惊全网!整个研究所仅7人,全是世界级大师,韦神只能作“小弟”

王虹的“神仙同事”圈震惊全网!整个研究所仅7人,全是世界级大师,韦神只能作“小弟”

火山詩话
2026-08-01 21:22:16
NBA重磅5换1交易方案!骑士梭哈杜兰特冲冠

NBA重磅5换1交易方案!骑士梭哈杜兰特冲冠

桑葚爱动画
2026-08-03 08:59:54
无缘加盟北京男篮!曝青岛小外援韦瑟斯庞涨薪续约留队

无缘加盟北京男篮!曝青岛小外援韦瑟斯庞涨薪续约留队

狼叔评论
2026-08-03 12:08:03
罕见公开!关键词:体系秒杀

罕见公开!关键词:体系秒杀

北青网-北京青年报
2026-08-02 14:06:29
黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

黄一鸣自曝:王思聪每次约她,车费都给10万,来给5万,回再给5万

汉史趣闻
2025-06-24 10:07:59
90年代,我娶了领导怀孕6个月的女儿,所有人都笑我傻,新婚夜,她拿出亲子鉴定,我看到父亲那一栏的名字,手里的纸都拿不稳了

90年代,我娶了领导怀孕6个月的女儿,所有人都笑我傻,新婚夜,她拿出亲子鉴定,我看到父亲那一栏的名字,手里的纸都拿不稳了

晓艾故事汇
2026-08-03 08:02:11
马斯克拿下豆包,震惊全网!

马斯克拿下豆包,震惊全网!

财经三分钟pro
2026-08-03 11:22:30
美媒质疑特朗普对华豪赌:押美国国运让中国倒退25年

美媒质疑特朗普对华豪赌:押美国国运让中国倒退25年

王飬吃吃喝喝
2026-08-02 22:14:13
2026-08-03 13:07:00
侃故事的阿庆
侃故事的阿庆
几分钟看完一部影视剧,诙谐幽默的娓娓道来
818文章数 9105关注度
往期回顾 全部

科技要闻

小米多款手机涨价,店员:周六晚接到通知

头条要闻

多个省级党委领导班子调整 中央委员担任省委书记

头条要闻

多个省级党委领导班子调整 中央委员担任省委书记

体育要闻

常规赛MVP可以衡量常规赛成就吗?

娱乐要闻

奥德赛女主持递麦事件争议又升级了

财经要闻

厦门象屿青岛大火背后

汽车要闻

00后搞钱成功后的第一台车,真的不是BBA

态度原创

亲子
家居
房产
公开课
军事航空

亲子要闻

父母是我们最大的命运,你自己才是成长的答案

家居要闻

2026建博会(广州) 公装联探展交流活动

房产要闻

1700亿砸下!信息量巨大!海南甩出又一个超级规划!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普:在伊朗和中东多国请求下 同意取消打击伊朗

无障碍浏览 进入关怀版