网易首页 > 网易号 > 正文 申请入驻

Gemini节节败退,但却在这屠榜

0
分享至

海明威在《流动的盛宴》里写过一句很有名的话:“你只要写出一句真实的句子。写出你所知道的最真实的句子。”(“All you have to do is write one true sentence. Write the truest sentence that you know.”

在海明威看来,伟大的写作从来不是把所有东西堆在读者眼前,而是“冰山理论”——露出水面的只有八分之一,剩下八分之七的尊严、情感与生活细节,都藏在水面之下的留白里。

但在大语言模型的跑分世界里,事情往往是倒过来的。

如果你常看各类大模型基准榜单,对过去数月的Gemini 的印象大概并不算太好。在代码生成、复杂数学推理以及多步骤 Agent 任务上,Anthropic 的 Claude Opus 和 OpenAI 的新旗舰常常轮番坐庄,Gemini 迟迟不发布新的Pro模型,老是拿Flash模型的小版本升级凑数——在不少人眼中,Gemini都快要被开除“御三家”的队列了。

但在另一张榜单上,却是迥异的面目。

我说的是今年2月,硅谷知名的数据标注与前沿 AI 评测机构 Surge AI 发布的:Hemingway-bench*(海明威写作基准)*。Surge AI 长期为顶尖大模型实验室提供高质量的人类专家反馈与评估环境,在业内以严苛、专业的人类盲测著称。

在这份榜单的前十名里,出现了一幕让人颇感意外的奇观:Google 旗下的 Gemini 模型密密麻麻地占据了 6 个席位。从 Gemini 3.7 Flash、3.6 Flash,到 3.5 Flash 与 3.1 Pro,除了第一名被 Anthropic 新一代旗舰模型 Claude Fable 5 拿走之外,Gemini 几乎成了 Fable 之下唯一的霸榜者。



平日里看似被压着打的 Gemini,在人类专家眼中,俨然成了文豪——尤其是便宜的Gemini 3.7 Flash,与Claude Fable 5也不过些许差异。

作家的眼睛与机器的尺子

要理解Gemini的霸榜,先得看看 Hemingway-bench 到底在测什么。

过去行业里测大模型的“创意写作”,大多依赖自动化评测,也就是所谓的 LLM-as-a-Judge。比如著名的 EQ-Bench Creative Writing,通常用一个强推理模型当作裁判,给被测文本打分。

这种裁判机制有个致命的盲区:机器无法感知“审美疲劳”

自动化裁判极度偏爱繁复的比喻、工整的对仗、高级的生僻词,以及密不透风的结构。这就导致模型迅速学会了“打分规则套利”——你让它写一篇关于高三升入大学的短文,它能一口气在五句话里塞进四个晦涩的比喻,把故事硬生生拉长到主人公人到中年离婚写书,只为了展现所谓的“叙事张力”。机器裁判给这种文本打了满分,但任何一个有正常阅读品味的人读起来,都只会觉得油腻与窒息。

Hemingway-bench 抛弃了这套自欺欺人的机器裁判。

它找来了专业编剧、诗人、演说撰稿人和资深编辑,面对 5000 多组真实写作任务进行双盲对战评审。人类评委不会花两秒钟扫一眼排版就投票,他们会读上几十分钟,专门抓那些看似华丽实则空洞的“AI套话”(AI Slop),严厉惩罚无休止的自我解释与内容膨胀,只为找出真正有语感、有同理心、懂留白的文字。

机器在数浮夸的辞藻,而作家在看水面下的八分之七。

为什么是Gemini

为什么偏偏是平时被调侃为“Agent落后”的 Gemini,在这个榜单里大放异彩?

其实并不奇怪。

翻看评委们的细分评价,Gemini 系列(尤其是 Flash 家族)展现出了一种其他巨头模型身上罕见的特质:松弛感

很多顶级模型在经过高强度的代码训练与强化学习之后,为了强化Agent能力,尤其是代码能力,患上了严重的“工程师职业病”。无论写什么故事或感谢信,它们都恨不得把前因后果、心理动机和所有逻辑漏洞在正文里交代得一清二楚,生怕读者看不明白。这种在推理任务中必不可少的防错机制,放到文学创作里就成了灾难性的居高临下与过度说教。

而 Gemini 展现出了一种难得的灵性。评测专家发现,Gemini 3.x Flash 非常擅长在严苛的风格限制下写作,并且对微观的生活细节有着惊人的捕捉力。它描写祖母做菜,会落笔在厨房午后斜照的一抹光线与油烟声,而不是长篇大论去升华亲情;它写失落,懂得让角色沉默地看着斑驳的旧照片,而不是堆砌排比句去抒情。

更耐人寻味的是,屠榜的主力大多是 Google 的 Flash 轻量模型。没有被过于沉重的思维链死死箍住,反而让它们保留了轻盈敏捷的叙事呼吸感。

演进的悖论与意外的赢家

榜单里还藏着几个耐人寻味的细节。

最典型的莫过于 Claude Opus 系列的“演进悖论”。

在自动化评测 EQ-Bench 里,新一代的 Claude Opus 5 拿下了惊人的 2104.9 分,傲视群雄。但到了海明威榜单的人类作家眼前,Opus 5 仅排在并列第 10 位(1050分),虽然名义上略高过2月发布的“老将” Opus 4.6(1046分,第13位),但优势微乎其微;而中间迭代的 Opus 4.7 与 4.8(均只有 1040 分)更是出现倒退。

在创作者社区里,许多人甚至觉得 Opus 5 的写作体感还不如 4.6。原因不难理解:Opus 5 太想当一个全能的超级大脑了,以至于写起文章来动辄长篇大论、满嘴大词与行业黑话,连写封便条都要“过度工程化”。Anthropic 真正懂文学的,其实是新发布的顶级模型Claude Fable 5(1113分,登顶第1),而曾经的旗舰 Opus 却在代码进化的同时丢掉了最初的质朴与灵气。

与之相比,OpenAI 的 GPT-5.6 Sol 展现了后来居上的韧劲,拿下第 7 名(1060分)。相比早期版本略显死板的商务腔,5.6 在叙事结构和自然表达之间找到了更好的平衡——这一进步,与我的日常使用的体感相近。

而在我们中国的大模型阵营中,也有几款交出了亮眼的成绩单。

月之暗面的Kimi K3拿下了 1067 分,高居全球第 6,不仅超越了 GPT-5.6 Sol 与 Opus 5,也是整个榜单中表现最亮眼的中国模型。Kimi 在长文本叙事的一致性与语境把握上非常扎实,日常与创意表达都相当耐读。

紧随其后的是智谱的GLM-5.3,以 1050 分跻身并列前十,展现出极佳的中文行文质感;而DeepSeek V4 Pro(1048分,第12位)同样咬紧了第一梯队。这些模型证明了一点:在脱离了英文自动化刷分套路之后,扎实的语料与语境理解依然能在国际专家的盲测中站稳脚跟。

说到底,写作从来不是算力的线性堆叠。

当所有大模型都在为了更高的逻辑基准把自己武装成严密无缝的代码机器时,Gemini 却在海明威的尺子下证明了另一件事:

写得最好看的,往往不是那个最想证明自己无所不知的模型,而是懂得何时该停笔、给真实世界留下一抹余温的那个。

本文由笔者构思,Gemini 3.7 Flash执笔,笔者微改并审定。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
人社部给退休人吃定心丸!养老金谣言别信了,真相来了

人社部给退休人吃定心丸!养老金谣言别信了,真相来了

白昼说故事
2026-09-03 13:00:39
牛鬼蛇神现原形,于东来公开为韩红发声不到24小时,不堪一幕上演

牛鬼蛇神现原形,于东来公开为韩红发声不到24小时,不堪一幕上演

离离言几许
2026-09-03 02:12:58
这丑校服是非穿不可吗?!

这丑校服是非穿不可吗?!

基本常识
2026-09-02 22:55:20
朝鲜切实执行12年制义务教育,金正恩在教员大会上深情发言:世上再没有母亲、老师这样亲切而高贵的称呼,老师才是这个国家所有人的恩人

朝鲜切实执行12年制义务教育,金正恩在教员大会上深情发言:世上再没有母亲、老师这样亲切而高贵的称呼,老师才是这个国家所有人的恩人

大风新闻
2026-09-03 13:38:08
抖音主播码字的:郭德纲是我举报的,我是骨干,证据都是我提供的

抖音主播码字的:郭德纲是我举报的,我是骨干,证据都是我提供的

早起的鸟儿有饭吃
2026-09-03 02:08:06
常州女首富怒了:已投诉和举报部分媒体!

常州女首富怒了:已投诉和举报部分媒体!

深蓝财经
2026-09-02 16:32:37
中国全额缴纳2026年联合国会费

中国全额缴纳2026年联合国会费

澎湃新闻
2026-09-03 04:16:04
被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

被当街扒裤的女子回应了:她是女主播,打她的女人找不到老公了,怀疑她是小三

汉史趣闻
2026-09-02 18:57:28
后天起,入户调查!请积极配合

后天起,入户调查!请积极配合

河南交通广播1041
2026-09-03 13:55:37
一年贬值一半,一公斤牛肉花掉1/10月工资——伊朗的“经济战”正压垮普通人的餐桌

一年贬值一半,一公斤牛肉花掉1/10月工资——伊朗的“经济战”正压垮普通人的餐桌

可达鸭面面观
2026-09-03 12:04:28
57岁王新军猝然离世,让人恶心的一幕上演了,秦海璐有苦说不出

57岁王新军猝然离世,让人恶心的一幕上演了,秦海璐有苦说不出

小武侃风云
2026-09-03 12:11:03
海航双胞胎姐妹花空姐,同时怀孕了

海航双胞胎姐妹花空姐,同时怀孕了

微微热评
2026-09-03 12:18:33
哪怕你正蹲厕所,也把这条看完!这6件事没人告诉你,但能保命

哪怕你正蹲厕所,也把这条看完!这6件事没人告诉你,但能保命

小鹿姐姐情感说
2026-09-03 07:55:52
美民众抗议不断,特朗普张嘴就来:你们再闹下去,中国就要赢了!

美民众抗议不断,特朗普张嘴就来:你们再闹下去,中国就要赢了!

福建睿平
2026-09-03 07:27:27
英伟达大爆发!股民天塌了,章盟主清仓中际旭创?真相来了

英伟达大爆发!股民天塌了,章盟主清仓中际旭创?真相来了

金石随笔
2026-09-03 00:28:07
今日最惨新股!上市大涨173%,两天回撤36.5%,首日入场的全被套!

今日最惨新股!上市大涨173%,两天回撤36.5%,首日入场的全被套!

趋势清风侠
2026-09-03 14:34:53
科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

科大讯飞出轨女主朱倩旧照疑曝光!小眼睛大脸盘,身材一般,和网传照片天差地别

小徐讲八卦
2026-09-03 11:53:43
电梯造谣女伏法!舆论再次失控,网友疯狂抵制,关联品牌被拉下水

电梯造谣女伏法!舆论再次失控,网友疯狂抵制,关联品牌被拉下水

社会日日鲜
2026-09-03 11:00:32
伊朗副总统:当初选择日本车就好了,中国车质量差价格高

伊朗副总统:当初选择日本车就好了,中国车质量差价格高

贱议你读史
2026-09-02 21:21:39
打通吉隆!“最后一公里,一定要进去”

打通吉隆!“最后一公里,一定要进去”

环球网资讯
2026-09-03 11:42:10
2026-09-03 16:47:02
EarlETF只投基不炒股 incentive-icons
EarlETF只投基不炒股
只投基不炒股,赚钱更容易一些
980文章数 3074关注度
往期回顾 全部

科技要闻

大模型扎堆!谷歌刚发,Meta就跟上

头条要闻

星宇处理的"人力资源总监"疑不存在 认错"认得很有限"

头条要闻

星宇处理的"人力资源总监"疑不存在 认错"认得很有限"

体育要闻

小卡回应处罚:不知晓任何规避工资帽意图

娱乐要闻

王宝强携女友回工作室!相恋8年仍未婚

财经要闻

再见了,期房!商品房预售制卒于2026

汽车要闻

实拍捷途旅行者7 风格更潮/混动版配上华为乾崑ADS 5

态度原创

家居
教育
手机
旅游
数码

家居要闻

2026建博会(广州) 公装联探展交流活动

教育要闻

甘肃:2027年秋季学期起,AI通识教育实现中小学全覆盖

手机要闻

雷军官宣小米18 Fold“中折叠”手机搭载徕卡专业三摄

旅游要闻

诗画济宁丨油葵花开正艳 金色花海扮靓滨湖水城

数码要闻

QDOLED高刷来袭!雷神新款27寸显示器到手3499元:2K 360Hz屏

无障碍浏览 进入关怀版