网易首页 > 网易号 > 正文 申请入驻

一个AI管理一家足球俱乐部二十年,会发生什么?

0
分享至


2026年8月,一群研究者做了一件挺疯狂的事:他们让15个最顶尖的AI模型,去经营一家虚拟足球俱乐部,一管就是二十个游戏年。不是简单地让AI回答几个足球问题,而是让它做一个真正的俱乐部经理该做的所有事情:选秀组队、买卖球员、谈合同、投资青训和设施、排兵布阵,还要应付一个随时可能把你炒掉的董事会。

这个研究的名字叫FM-Bench,翻译过来就是"足球经理基准测试"。它想搞清楚一件事:现在的AI模型,能不能在一场持续几百步、后果会累积、对手会反应的漫长博弈里,做出靠谱的决策?

这个问题听起来简单,但你仔细想想会发现,它跟我们平时测试AI的方式完全不是一回事。

现有的AI测试,大多是"考试型"的

想想你熟悉的那些AI评测:解一道数学题,修一个代码bug,完成一个网页操作任务。这些任务有一个共同点,就是它们都很短。你给AI一个明确的问题,它给你一个答案,对错立判,几秒钟到几分钟就结束了。

论文里提到了不少这类基准测试,比如让AI修复真实GitHub代码问题的SWE-bench,测试竞赛级数学推理的MathArena,还有让AI操作电脑完成任务的OSWorld。这些测试确实很有价值,但它们衡量的是AI"执行"一个任务的能力,而不是AI"经营"一件事情的能力。

执行和经营,这两者的差别在哪儿?

打个比方。执行一个任务,像是你去银行办一笔转账,填单子、递材料、拿到回执,整个过程可能就十分钟,期间不会有人跟你抢窗口,你今天办得好不好,跟你明天要不要继续办事没有任何关系。而经营一件事,像是你开一家奶茶店,今天进多少货会影响明天的库存,这个月的定价策略会影响顾客对你的印象,竞争对手看到你生意好会跟着降价,你三年前招的员工现在可能已经成了店里的骨干或者拖累。前者是孤立事件,后者是一条连续的、会自我影响的时间线。

现有的长时程测试,比如让AI在终端里连续执行几百步操作的Terminal-Bench,或者让AI经营一个月虚拟自动售货机的Vending-Bench,已经开始往"经营"这个方向靠近了,但它们大多缺了一样东西:竞争对手。你一个人在那儿慢慢做决策,环境不会因为你做得好而变得更难对付。

反过来,也有一些测试专门做多智能体竞争,比如靠虚张声势和讨价还价定胜负的Cattle Trade,但这些博弈往往就是一场对话、一个回合,持续时间很短,谈不上"经营"什么。

研究者们发现,把"长时程"和"多智能体竞争"这两个维度同时叠加起来的测试,几乎没有。FM-Bench就是想补上这块空白。

什么叫真正的"管理"?四个绕不开的难题

研究者给"管理"这件事下了一个挺讲究的定义:在一个信息不完全的环境里,和别人抢夺同样的资源,决策的后果需要很久才能显现,而且最终的评判标准不止一个。拆开来看,这里藏着四个具体的难题。

第一个难题是信息永远不完整。你手下的球员到底有多强,你自己是不知道真实数字的。你只能通过球探报告去估计,而这个球探本身还带着系统性的偏差,有的球探习惯高估年轻球员,有的习惯低估防守型球员。伤病倾向、成长速度、巅峰期什么时候到来,这些都是隐藏变量,你得靠这个赛季、下个赛季反复观察才能慢慢摸清楚一个大概。

这跟你去二手车市场买车其实是一个道理。车商说这辆车"车况良好",你没法把发动机拆开看,只能通过外观、里程数、试驾感受去猜测这辆车的真实状态,而且你猜错了是要花真金白银买单的,买贵了没法退。如果游戏直接把球员真实能力值显示给AI看,那这个测试就变成了纯粹的数学优化题,而不是一个需要在噪音里保持判断力的管理决策了。

第二个难题是后果会累积,而且很久之后才会显现出来。青训投资要好几年才能培养出能打主力的球员,设施升级也是同理。反过来,如果你现金流管理不善,俱乐部会陷入破产管理程序,导致积分被罚、被迫贱卖球员,董事会信心崩溃了还会直接把你炒掉。但这里有个关键设定,这些糟糕的局面是可以挽救回来的,不是一步走错满盘皆输。每个赛季获得的荣誉,会直接累加进最终的总分里,没有哪个阶段的努力是可以被"补交作业"抹平的。

第三个难题是市场会针对你的行为做出反应。你出的报价被拒绝了,这个球员的心理价位就会悄悄涨上去。你老是跟同一家俱乐部谈生意,对方摸清了你的路数之后,报价也会跟着水涨船高。这意味着没有哪一招是可以一直用下去的必胜策略,你今天有效的打法,明天可能就因为对手学会了应对而失效。

这特别像你在小区门口那家杂货店砍价的经历。第一次你狠狠砍了个价,老板碍于面子答应了,可你第二次再去,老板已经把你归类成"爱砍价的顾客",报价会先往上抬一截给你留出砍价空间。你如果继续用同一套砍价话术,效果会越来越差。如果这个游戏里的市场是死的、不会学习的,那AI只需要找到一个最优报价公式,套用二十年就行了,这就完全测不出AI应对变化的能力。

第四个难题是评判标准不止一个,而且它们之间会互相拉扯。董事会既看重你的比赛成绩,也看重你的财务纪律。你可能为了冲击冠军疯狂砸钱买人,结果财务崩了照样被炒;你也可能财务稳健得一塌糊涂,但成绩太差同样保不住位置。这种多目标之间的张力,贯穿了整个二十年。

> 决策停靠点:游戏引擎不是每一秒都在等AI下指令,而是设置了大约340到400个"停靠点"。到了这些时间节点,游戏时钟会暂停,AI可以随意调用工具查看信息、做出行动,直到它主动调用"推进"工具,时间才会继续往前走。

二十年,一个赛季一个赛季地打

具体是怎么运作的呢?每个测试的AI管理一支球队,加入一个16支俱乐部组成的联赛。所有俱乐部,包括AI管理的和对手的,都是从同一个模板球员池里、用同样的预算完成选秀组队的,起点完全公平。

然后AI就要接管这支球队,连续经营二十个游戏年。每一年有360天,联赛采用双循环赛制,一个赛季踢30轮比赛。整个二十年下来,大约会有4800场比赛在这个虚拟世界里被完整模拟出来,球员池里始终维持着大约470名活跃球员,算上退役和新秀加入,整个过程会涌现出大约2000名不同的球员。

这个世界的一切,从选秀球员池本身开始,都是由一个随机种子确定性生成的。也就是说,给定同一个种子,整个二十年的世界走向、每个球员的能力值、每一场比赛的随机波动,理论上都是可以完全复现的,这为后续的分析和审计打下了基础。

> 决策停靠点里有三种类型:

> 一是固定日程的停靠点,比如赛季前的董事会会议、夏季转会窗口开放、赛季结算,一年13个,是提前排好的;

> 二是事件驱动的停靠点,比如突然收到别人的转会报价、球员合同快到期了、主力球员重伤,这类平均每个赛季触发六次左右,是游戏世界主动打断AI的。

每个停靠点,AI都能看到同一份信息包:联赛排名、现金、董事会信心度、伤病情况、待处理的报价、自上次停靠点以来发生的所有事,还有它自己写的笔记本内容。AI可以在这个停靠点里想调用多少次工具就调用多少次,查询信息、做出行动,顺序随意,直到它觉得可以结束了,调用"推进"工具让时间继续走。

如果什么都不做会怎样?游戏设计得很宽容,未处理的报价会自动过期,阵容和战术会保持原样,挂起的谈判会在10天后自动失效。AI甚至可以设置最多10条"如果满足某个条件就自动执行某个动作"的待命指令,比如"报价超过估值两倍就自动接受",但这种指令刻意设计得比较弱,没法替代AI每次到停靠点时的实际判断。

记忆是AI自己的责任,不是系统的功劳

这个测试里有一个设计我觉得特别值得说一下,就是关于"记忆"这件事的处理方式。

每次进入一个新的决策停靠点,对AI来说都是一次全新的对话,系统不会把之前的聊天记录喂给它。那AI怎么知道自己二十年前买了哪个球员、当初是为什么买的、有什么长期计划?

答案是,AI必须自己把这些东西写下来,存进一个它自己维护的"笔记本"里,这个笔记本的内容会被自动塞进下一次对话的信息包里。除此之外,系统还会提供三种辅助信息:自动推送的仪表盘摘要(告诉你现在的排名、现金、伤病这些实时状态)、可以按需查询的历史档案(比如某个赛季的最终排名、某笔交易的细节)、以及一份AI永远看不到的审计日志(专门用来做回放和防作弊验证的)。但真正承载AI"意图"的,只有它自己写的笔记本。

为什么要这么设计,而不是像很多AI应用那样,直接给个超长上下文窗口,或者用检索技术自动从历史记录里找相关内容?

研究者给出了三个理由。第一,二十年产生的信息量,任何上下文窗口都装不下,总得有个取舍机制,与其让系统悄悄替AI做这个取舍(而且这个取舍过程外人根本看不见),不如把这个权力和责任都交给AI自己,让它自己决定什么该记、什么该忘。第二,如果是系统自动截断或总结历史,那不同AI模型之间的分数差异里,可能有一部分其实是系统截断策略造成的,而不是模型本身能力的差异,这样比较就不公平了。现在每个模型面对的是完全一样的规则,谁写得好、谁写得烂,纯粹是模型自己的水平问题。第三,决定"未来的自己需要知道什么",这本身就是管理能力的一部分,这个测试想把它当作一个正式的考核项,而不是一个技术细节藏起来。

这让我想起自己以前带新人的经历。你没法把过去三年公司发生的所有事情原原本本讲给一个新来的同事听,你只能挑重点写一份交接文档。这份文档写得好不好,直接决定了新人接手之后能不能顺利运转。如果这份文档写成了流水账,事无巨细全塞进去,新人翻半天都找不到重点;如果写得太简略,又漏掉了关键的教训,新人可能会重蹈覆辙。这个测试逼着AI每次都要面对"给未来的自己写交接文档"这个问题,写得好不好,直接体现在最终分数上。

结果发现,这个笔记本机制,还真就成了区分模型好坏的一个重要指标,后面会详细说。

分数是怎么算出来的:三个渠道,一个公式

整个二十年跑下来,最终会汇总成一个分数。这个分数的计算,是由确定性的引擎公式算出来的,全程没有任何AI或者人类来当裁判打分。

分数由三个部分组成。第一部分是荣誉分,把整个二十年拿到的冠军、四强这些荣誉累积起来,拿一次联赛冠军加100分,进四强加20分。第二部分叫价值增值,衡量的是俱乐部净资产相比起点是增值了还是缩水了,这里面现金、球员身价(打了0.8折的流动性折扣)、在建设施都会被算进去,超过三倍年薪支出的闲置现金还会被额外打折扣,这是专门用来惩罚"钱躺在账上不用"这种行为的。第三部分是球队总价值,权重比较低,主要是防止有人把球队卖空换现金然后靠囤钱刷分。

> 净资产价值增值:指俱乐部实际净资产(经过通胀调整后的最近三个赛季平均值)减去这个种子对应的起始净资产,数值为零意味着"你把俱乐部原封不动地还回去了",正数意味着俱乐部升值了,负数意味着贬值了。

三个部分都经过对数压缩处理,这意味着不管数字有多大,分数增长速度都会越来越慢,不存在某个渠道无限刷分导致分数爆炸的情况。如果俱乐部中途破产或者被炒了鱿鱼,还有一个"提前结算折扣"机制,越早出局折扣越狠,但这个折扣只作用在正分上,亏损部分不会因为提前跑路就被抹平,这就堵死了"眼看要亏就故意摆烂求解脱"这条路。

这套权重和参数不是拍脑袋定的,是拿几个脚本对手反复调试出来的,调试标准包括:随机策略必须比啥都不干还差,啥都不干必须比认真管理的脚本差,认真管理的脚本必须比能看到隐藏信息的脚本差,顶尖分数不能扎堆撞到天花板上。

参赛选手:十五个顶尖模型对战十六支对手

测试用了15个当时的顶尖模型,覆盖了行业里几乎所有主要玩家。既有闭源的商业模型,比如Anthropic家的claude-fable-5、claude-opus-4.8、claude-sonnet-5、claude-haiku-4.5,OpenAI家的gpt-5.6-sol和gpt-5.6-terra,谷歌的gemini-3.5-flash和gemini-3-flash,xAI的grok-4.5,Meta的muse-spark-1.1,也有开源阵营的deepseek-v4-pro、kimi-k2.6、qwen3.7-max、glm-5.2、minimax-m3。

每个模型都在固定不变的系统提示词、锁定的模型版本和参数下运行,而且刻意开启了各家推荐的完整推理模式,不为了省钱而阉割模型的思考能力。

测试分两种模式。单人模式下,一个被测模型独自面对15支脚本化的对手球队,这些对手的水平被分成简单、中等、困难三档,但信息获取渠道跟AI是完全一样的,不存在对手偷看隐藏数据这种情况。竞技场模式则更狠,15个模型加上一个脚本锚点,全部塞进同一个共享世界里同台竞技,你抢我夺同一批球员,这才是真正的贴身肉搏。

为了给分数找一个上限参照,研究者还专门做了一个"预言家"脚本。这个脚本能直接读取引擎里的真实隐藏数据,包括球员真实能力值、卖家真实心理价位这些,但它做出行动的方式跟普通AI完全一样,还是要走同样的26个工具接口,同样的每站预算限制。它的特权只在于"看得更清楚",不在于"能做更多事情"。三次种子下来,这个预言家平均拿到95.54分。

单人赛道:所有AI都活下来了,脚本对手却大批阵亡

结果出来后,第一个让人意外的地方是生存率的巨大反差。

15个AI模型,在三个不同的随机种子下各跑一遍,全部完整跑完了二十年,一个都没被炒。而那三个脚本化的对照组,包括一个设计得相当规矩的"heuristic"(遵守工资帽、按时续约、量入为出投资设施的对照脚本),在总共九次运行里有七次都中途阵亡了。

|座位|最终得分|token消耗|

|oracle(特权对照)|95.54 ± 4.68|—|

|**claude-fable-5**|**90.94 ± 5.20**|24M|

|kimi-k2.6|88.49 ± 0.15|87M|

|gpt-5.6-terra|86.66 ± 1.20|28M|

|gpt-5.6-sol|86.40 ± 2.53|62M|

|muse-spark-1.1|83.19 ± 12.03|73M|

|glm-5.2|83.17 ± 0.92|58M|

|grok-4.5|81.82 ± 9.87|191M|

|qwen3.7-max|80.66 ± 10.38|47M|

|deepseek-v4-pro|79.15 ± 2.67|194M|

|gemini-3-flash|79.06 ± 13.45|51M|

|claude-sonnet-5|75.75 ± 5.03|39M|

|claude-opus-4.8|75.02 ± 2.46|31M|

|gemini-3.5-flash|74.59 ± 11.02|154M|

|minimax-m3|68.37 ± 12.33|74M|

|claude-haiku-4.5|36.90 ± 22.73|86M|

|heuristic(脚本对照)|17.05 ± 12.34|—|

|idle(空转对照)|-0.90 ± 1.86|—|

|random(随机对照)|-17.21 ± 2.45|—|

夺冠的是claude-fable-5,平均90.94分,拿到了预言家上限95.54分的95%左右,离满分还差一截,说明这个测试并没有轻易被打穿。

有意思的是排名的顺序,你从表格里能看出来,价格、厂商、规模都对不上号。同一家公司出品的gpt-5.6-terra(86.66)反而比更新更贵的gpt-5.6-sol(86.40)排名更高,开源模型kimi-k2.6(88.49)甚至超过了这两个闭源模型。

这就好比你去买一辆车,发现同一个品牌里,便宜款的操控评分居然比贵的旗舰款还高,而隔壁一个没什么名气的国产品牌又反过来把这两款都比下去了。价格标签、品牌光环,在这场持续二十年的马拉松式竞赛里,基本失效了。

还有一个更值得琢磨的现象,就是早期领先根本不能预测最终结果。在其中一个种子下,deepseek-v4-pro在第5年和第10年都是分数第一,结果最终排名却是第12名。而最终夺冠的claude-fable-5,在第5年时只排第5。这说明如果这个测试只跑五年就结束,得出的排名会是完全另一套结果。

六个坏习惯,拆解出六种能力

一个总分只能告诉你谁强谁弱,却没法告诉你这个模型到底强在哪、弱在哪。研究者干了一件挺细致的活,他们从行动日志和笔记本里,提炼出六种可以量化的"管理行为能力",然后看这些能力跟最终分数的相关性。

第一种能力叫终局意识。二十年的游戏是有终点的,一项要等好几年才能见效的投资,如果放在第十九年才启动,那基本上是白花钱。研究者统计了每个模型在设施投资和青训提拔这类"慢回报"动作上的频率变化,对比第17到20年跟第2到16年的差异。这项指标跟最终得分的相关性最强,系数达到-0.58,也就是说越懂得在临近尾声时收手的模型,分数越高。夺冠的claude-fable-5把这类动作从每季2.4次砍到0.8次,而gemini-3.5-flash反其道而行之,从2.4次涨到3.3次,第19年还在大兴土木盖设施。

这就像你临近退休前两年,还要不要报名一个需要五年才能拿证的进修班。理性的做法是不报了,因为投入根本来不及收回。但如果一个人完全没意识到自己"临近终点"这件事,就会一直保持年轻时的行事节奏,直到最后浪费掉大把资源。

第二种能力是资金调配。研究者算了每个模型季末现金占净资产的比例,发现这个比例越高分数往往越低,相关系数-0.50。垫底的claude-haiku-4.5这个比例平均达到196%,意味着躺在账上不动的闲钱,居然超过了整个俱乐部经过折扣计算后的总价值。

> 闲置现金比例:季末现金除以净资产的比值,由于净资产计算时会对超额现金打折,这个比例超过100%就说明账上躺着的钱比俱乐部本身的估值还多,是一种典型的"钱没花在刀刃上"的信号。

第三种能力叫主动管理。合同到期是一件早就能预见的事,不该等到火烧眉毛才处理。夺冠模型平均提前18个月就启动续约谈判,只有4%的续约谈判是在合同到期前六个月才仓促启动的。而claude-opus-4.8平均只提前10个月,claude-haiku-4.5更是只提前11个月,而且有超过两成的续约谈判是踩着最后期限才开始的。这项能力跟分数的相关性是+0.45。

第四种是价格发现能力,这个结果尤其打脸。理论上说,预言家因为清楚对方的真实心理价位,一次报价就能成交,这个数字被定为参照基准1.0。可实际上,表现最好的模型claude-fable-5平均也需要9次报价才能成交一笔交易,整个赛场的中位数是30次,表现最差的gemini-3.5-flash需要73次,某些种子下甚至飙到133次。

也就是说,经过二十年、几百次被拒绝的报价之后,没有一个模型真正学会了这个市场的隐藏定价规则。它们被拒绝一次两次三次,似乎并没有从中总结出规律,依然在盲目试探。

这让我想到有些人谈恋爱,被拒绝了十几次,还是不明白对方到底想要什么,每次表白的套路几乎一模一样。反复试错本该产生学习效果,但这里的AI模型显然没有把"被拒绝"这件事转化成有效的经验积累。

第五种是笔记本管理能力,前面提到的记忆机制的实际体现。研究者用文本相似度算法,比较每个模型每个赛季末笔记本内容跟上一季的相似度,数值1代表内容完全没变,0代表整个推翻重写。结果发现两种截然相反的失败模式:gpt-5.6-sol的相似度高达0.91,说明它一直在往笔记本里堆内容,从来不删旧的,信息越堆越多,新的重要信息很容易被埋没在历史记录的海洋里;而claude-sonnet-5(0.20)和qwen3.7-max(0.23)则相反,几乎每季都推倒重写,导致上一季制定的计划根本没机会被执行完就被丢弃了。夺冠模型的相似度是0.39,处在一个"骨架保留、细节更新"的中间地带。

第六种是计算资源效率。token消耗从最低的28M到最高的194M,差了七倍,但这跟分数几乎没有相关性,系数只有-0.19。夺冠模型反而是花费最少的几个模型之一。这个结果挺有意思,说明"多想一会儿"或者"多算一会儿"本身并不能保证决策质量,重要的是想的内容对不对,而不是想了多久。

综合来看,夺冠模型claude-fable-5是个全科型选手,六项能力没有一项排到垫底,但也没有哪一项是单科第一,靠的是均衡不出短板。中游模型往往是一强一弱的组合,比如gemini-3-flash的资金管理是全场最好的,闲置现金比例只有46%,但它是全场最不愿意在终局收手的模型,导致最终排名只到第十。垫底的claude-haiku-4.5则是全面拉胯,闲置现金最高、续约最晚、终局投资还在加码。

人类玩家:三个人被开除,两个人活了下来

研究者还找了六个从没玩过这个游戏的普通人,让他们真人上阵玩同一套流程。结果四个人中途被董事会炒了,而且都比那个规规矩矩的脚本对照组分数还低。剩下两个人完整跑完了二十年,分别拿到74.64分和59.95分。

拿这两个成绩去跟表格里的AI对比,表现较弱的那位人类玩家只比垫底的claude-haiku-4.5高,表现较好的那位大致跟gemini-3.5-flash打平,比夺冠的claude-fable-5低了16分左右。也就是说,首次接触这个游戏的普通人类,水平大致落在AI模型阵营的中下游到垫底区间。

有意思的是,人类玩家事后反馈的困难点,恰好跟AI暴露出的六项能力缺陷对得上号。人类也抱怨被市场"报复性涨价",也抱怨账上有钱却不知道该不该花,也承认工资超过收入85%时那种一场糟糕赛季就可能被炒的悬崖感。

但人类做对了一些AI没做到的事。有一位玩家总结出一个屡试不爽的规律,合同能签多长就签多长,因为球员会成长、货币会贬值,他把这条规律用到了整个流程的每一次合同签订上。有一位在中途发现自己的青训策略失败之后,果断推翻重来。还有一位甚至专门用另一个AI工具帮自己整理游戏里没有直接显示出来的信息。这三种能力,恰恰是AI模型普遍欠缺的,而AI擅长的均衡决策、大量信息处理,又是人类玩家的短板。这种能力的互补性,让研究者提出一个值得琢磨的方向:人机协作会不会比任何一方单独上场都更强?这个问题他们留给了未来的研究。

竞技场模式:王朝在单人赛道诞生,王座在竞技场里轮流坐

如果说单人赛道测的是AI单打独斗的能力,那竞技场模式测的就是AI在真刀真枪的竞争中能不能扛得住。

结果差异非常戏剧性。在单人赛道里,前四名得分最高的模型,几乎都是从某一年开始就一直霸榜到第二十年,像王朝一样稳定统治联赛榜首。但在竞技场模式里,冠军头衔在整个二十年里被十个不同的模型轮流拿到过,卫冕成功的次数只有19次赛季交替里的2次,连最终夺冠的claude-fable-5,自己中途也只拿过4次单赛季冠军。

|排名|座位|最终得分|阵亡次数|结局|token消耗|

|1|**claude-fable-5**|**76.26**|0|完成|~34M|

|2|muse-spark-1.1|62.47|0|完成|~80M|

|3|deepseek-v4-pro|52.09|0|完成|~111M|

|4|glm-5.2|51.44|0|完成|~86M|

|5|grok-4.5|50.89|0|完成|~138M|

|6|gpt-5.6-sol|47.94|0|完成|~78M|

|7|minimax-m3|44.78|0|完成|~65M|

|8|claude-sonnet-5|40.75|0|完成|~42M|

|9|kimi-k2.6|39.72|0|完成|~119M|

|10|gpt-5.6-terra|38.44|0|完成|~19M|

|11|qwen3.7-max|32.77|2|完成|~54M|

|12|claude-opus-4.8|28.44|1|完成|~43M|

|13|gemini-3-flash|15.76|2|完成|~63M|

|14|claude-haiku-4.5|0.76|4|第10.7年被炒|~30M|

|15|gemini-3.5-flash|0.21|4|第5.8年被炒|~40M|

|16|heuristic(脚本锚点)|0.13|4|第2.6年被炒|—|

这个反差揭示了一个很朴素的道理。在单人赛道里,对手是静止不变的脚本,你一旦领先,可以一直用同一套打法不断放大优势,越滚越大。但一旦进入真实的竞争环境,对手会盯着你的一举一动,你手上的好球员随时可能被别人高价挖走,任何一种领先姿态都会招来针对性的抢夺。夺冠模型自己也感受到了这种压力的变化,在单人赛道里它平均每赛季只出价0.5次,而在竞技场模式里飙升到4.6次,同一个模型,只是换了个有真实对手的环境,议价策略就发生了根本性的转变。

这有点像你在一条空无一人的马路上开车,想加速就加速,想变道就变道,完全按自己的节奏来。但一旦这条路上突然多了十几辆同样想抢道的车,你的每一个动作都得考虑别人会怎么反应,原本随心所欲的节奏立刻就变得战战兢兢起来。如果这个测试只做单人赛道,那么它测出来的只是AI在真空里的独角戏能力,根本测不出它在真实竞争压力下会不会崩盘。

研究者还专门挑了三个模型深挖了它们的行动日志和笔记本内容,想看看表面数字背后到底藏着什么行为差异。

夺冠的claude-fable-5,整整二十年只维护一份持续更新的计划,里面有一本累计荣誉记录,每次改动都是在原有策略基础上做微调,而不是推倒重来。它出手很克制,整个赛程只提交了91次转会报价。反观曾经在第5年领跑但最终崩盘的gemini-3-flash,提交了452次报价,总行动次数达到2642次,是夺冠模型1315次的两倍,它的笔记本每次遇到危机就整个清空重写,变成了一种"哪里着火救哪里"的应激反应模式,而不是有节奏的长期规划。靠前期的疯狂活动抢来的排名优势,并没能撑过整个二十年的考验。

现金持有量最高、排名却不高的claude-opus-4.8,则暴露出另一种更微妙的问题,叫"知道却不做到"。它在第10年的笔记本里写着"闲置现金应该拿去买优质球员",在第19年又写"我的储备金正在被打折,应该转化成年轻球员",这些认知在文字上完全正确,可它最终结算时账上还是躺着大约2100M的闲置资金。它把正确的长期计划写下来了,但没有真正去执行。

这个细节让我想起很多人立flag的经历,道理都懂,写在笔记本里、贴在墙上,可到了真正要行动的那一刻,总有各种理由让自己继续拖延。claude-opus-4.8的问题不是不知道该怎么做,而是知道和做到之间,隔着一道它没能跨过去的坎。

写在后面

读完这篇论文,最让我意外的不是排行榜的结果,而是那个价格发现失败的细节。二十年、几百次被拒绝的报价,没有一个模型真正摸清楚市场的隐藏定价规律。这跟我们对大语言模型的一般印象是有出入的,我们总觉得这些模型擅长从海量文本里总结模式,可当模式需要从自己亲身经历的、带反馈的交互中总结出来时,它们表现得相当迟钝。

这可能揭示了一个更深的问题:语言模型擅长的是从静态语料里提炼统计规律,但在需要不断试错、根据反馈调整策略的动态博弈里,这种"从对话历史里学习"的能力,可能压根就不是它们训练目标里天然具备的东西。它们的每一次决策,某种程度上都是从零开始推理,而不是真正带着"上次失败的教训"往前走。

另一个让我反复琢磨的地方是claude-opus-4.8的"知道却不做到"。它把正确答案写在了笔记本里,却没能把这个认知转化成行动。这跟"AI能不能推理出正确答案"完全是两码事,这是"AI能不能让自己过去写下的正确答案,真正约束住自己未来的行为"。这个问题在人类世界里也普遍存在,可我原本以为AI至少在"言行一致"这一点上会比人类更机械、更可靠,结果发现并非如此。

这篇论文测出来的,与其说是AI的football管理水平,不如说是AI能不能在一个没有标准答案、需要持续自我修正的漫长过程里,保持一种连贯的、有记忆的、能吸取教训的存在方式。这大概是比"能不能做对一道题"更接近真实世界智能的一种考验。

Q&A

Q1:FM-Bench测试的核心内容是什么?

A:FM-Bench让15个顶尖AI模型分别经营一家虚拟足球俱乐部长达二十个游戏年,涉及选秀组队、转会谈判、合同续约、设施投资、排兵布阵等一系列长期管理决策,由确定性引擎自动打分,全程没有人类或AI裁判参与评判。

Q2:FM-Bench测试中哪个AI模型表现最好?

A:claude-fable-5在单人赛道和竞技场模式下都排名第一,单人赛道平均得分90.94,达到了拥有隐藏信息特权的对照脚本(95.54分)的约95%,而且它在六项被拆解出的管理能力上都表现均衡,没有明显短板。

Q3:为什么这个测试要让AI自己写笔记本记忆,而不是直接给它完整的历史记录?

A:因为二十年产生的信息量任何上下文窗口都装不下,总要做取舍。如果系统自动截断或总结历史,不同模型间的分数差异可能反映的是系统策略而非模型能力,不公平。让AI自己决定记什么、忘什么,这个取舍能力本身也是管理能力的重要组成部分。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
NBA历史首对亿元兄弟!奥萨尔5年1.55亿续约 阿门5年2.08亿续约

NBA历史首对亿元兄弟!奥萨尔5年1.55亿续约 阿门5年2.08亿续约

醉卧浮生
2026-09-19 07:01:46
高市早苗改组内阁后,第一时间向我国喊话,释放信号不简单

高市早苗改组内阁后,第一时间向我国喊话,释放信号不简单

DS北风
2026-09-18 06:58:02
大家长途自驾时,车里最实用的小东西是什么?网友:太夯了!

大家长途自驾时,车里最实用的小东西是什么?网友:太夯了!

另子维爱读史
2026-09-18 20:42:38
泽连斯基已经向全世界亮明态度:乌克兰可以向俄罗斯投降,也可以放弃加入任何国际组织,但是唯独顿巴斯是坚决不会放弃!

泽连斯基已经向全世界亮明态度:乌克兰可以向俄罗斯投降,也可以放弃加入任何国际组织,但是唯独顿巴斯是坚决不会放弃!

扶苏聊历史
2026-09-18 18:02:45
冲上热搜!多所高校发文“过紧日子”,北大明确禁去21个景区开会,能线上开的会不线下聚

冲上热搜!多所高校发文“过紧日子”,北大明确禁去21个景区开会,能线上开的会不线下聚

南方都市报
2026-09-18 07:58:40
iPhone Duo 遭遇微信双登录失败,一万六的折叠屏,微信只认它是台手机

iPhone Duo 遭遇微信双登录失败,一万六的折叠屏,微信只认它是台手机

小柱解说游戏
2026-09-18 09:23:40
夫妻俩把28800支烟绑身上进境,裤子被撑的“有棱有角”:为代购牟利,把烟盒绑在腰部和腿部

夫妻俩把28800支烟绑身上进境,裤子被撑的“有棱有角”:为代购牟利,把烟盒绑在腰部和腿部

极目新闻
2026-09-18 12:08:45
绑架最小人质的哈马斯因人盾保住命,内塔尼亚胡:谁都跑不了

绑架最小人质的哈马斯因人盾保住命,内塔尼亚胡:谁都跑不了

移光幻影
2026-09-18 07:55:20
三镇心气踢没了,李昂红牌心态崩了,浙江1场三分,让铁人津门虎缓口气

三镇心气踢没了,李昂红牌心态崩了,浙江1场三分,让铁人津门虎缓口气

替补席看球
2026-09-18 21:37:55
被八国联军抢走的“永乐宝剑”,中方想高价买回,英国人:10亿也不卖

被八国联军抢走的“永乐宝剑”,中方想高价买回,英国人:10亿也不卖

迷彩前沿
2026-09-02 07:29:41
司机称代驾百万路虎24天倒贴2.2万,当事人发声:途中与车主相谈甚欢,跨7城后态度反转,称未签协议,需抵扣轮胎、酒店、车损等费用

司机称代驾百万路虎24天倒贴2.2万,当事人发声:途中与车主相谈甚欢,跨7城后态度反转,称未签协议,需抵扣轮胎、酒店、车损等费用

扬子晚报
2026-09-18 08:02:20
1-4,落后倒数第三4分,冠军还有变数,降级球队已成定局,津门虎和铁人乐了!

1-4,落后倒数第三4分,冠军还有变数,降级球队已成定局,津门虎和铁人乐了!

我就是一个说球的
2026-09-18 22:15:40
抖音一姐复出,开播狂卖千万,冲上带货榜一

抖音一姐复出,开播狂卖千万,冲上带货榜一

新浪财经
2026-09-18 14:32:41
孙立平|一个令人困惑的现象:上海和黑龙江的生育率都很低

孙立平|一个令人困惑的现象:上海和黑龙江的生育率都很低

互联网大观
2026-09-17 08:53:15
俄军遭受重大挫折:乌军夺回顿涅茨克240平方公里的阵地

俄军遭受重大挫折:乌军夺回顿涅茨克240平方公里的阵地

高博新视野
2026-09-17 20:51:08
重磅:德国将向乌克兰转让10套爱国者!F16弹药得到补充

重磅:德国将向乌克兰转让10套爱国者!F16弹药得到补充

项鹏飞
2026-09-18 20:05:24
清华某博士这个瓜!只因一句“公共洗衣机别洗袜子”,该博士发布长篇回怼,引全网热议

清华某博士这个瓜!只因一句“公共洗衣机别洗袜子”,该博士发布长篇回怼,引全网热议

火山詩话
2026-09-18 19:06:17
影视飓风Tim称iPhoneDuo烫到握不住,苹果回应:博主单台设备测评片面,新设备到手后可能需要3至5天的适应期

影视飓风Tim称iPhoneDuo烫到握不住,苹果回应:博主单台设备测评片面,新设备到手后可能需要3至5天的适应期

19楼
2026-09-17 23:36:53
你们家那个拖后腿的人是谁?网友:正常情况祖坟不能一直冒青烟!

你们家那个拖后腿的人是谁?网友:正常情况祖坟不能一直冒青烟!

带你感受人间冷暖
2026-09-18 00:05:21
住建部总工程师李晓龙:“大家现在上网也能刷到,各地建了一些老百姓比较认可的房子”

住建部总工程师李晓龙:“大家现在上网也能刷到,各地建了一些老百姓比较认可的房子”

政知新媒体
2026-09-18 11:43:02
2026-09-19 07:28:49
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9891文章数 568关注度
往期回顾 全部

科技要闻

直击iPhone 18新机发售:黄牛加价不如前代

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

头条要闻

俄杜马选举拉夫罗夫"意外"登顶名单 梅德韦杰夫被拿下

体育要闻

好吧,中国男篮辛苦了

娱乐要闻

陈思诚 佟丽娅不想让儿子知道两人离婚

财经要闻

研发0.25亿理财26亿,敷尔佳豪赌三类器械

汽车要闻

纯电/插混双动力+五座/六座双布局 海狮08应该怎么选?

态度原创

游戏
本地
艺术
教育
公开课

《给他爱5》大型DLC废案曝光!自由城、崔佛新剧情

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

艺术要闻

好色也分段位?这位时尚摄影大师,直接杀进王者局!

教育要闻

应届博士生,加入985!

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版