一个看似完美的两局演示,差点让我相信LLM规划器真的有效。在重复囚徒困境游戏中,我给两个LLM玩家加了一个私有规划器,前两局结果堪称教科书:第1-6轮双方合作,第7轮一方背叛获利,第8轮双方背叛锁定优势。两次镜像对局全部成功,没有非法动作,没有回退模型。
然后我改了随机种子。
![]()
结果完全变了。用严格JSON Schema重建规划器后,在5到9轮隐藏对局长度上做了干净对比,镜像每个种子的两个座位。结构化规划器确实稳定输出schema,但游戏轨迹没有改善,成本反而贵了1.94倍。
这是个很小的结果:每个条件10局,一个模型家族,一个重复博弈。它不能证明规划普遍让LLM变差,但它证明了一件事:两局漂亮的演示远远不够。
以下是我现在信任任何LLM规划器实验前必查的7个清单项。
清单1:你的"对照组"真的独立吗?
我的试点实验只用一个种子,交换座位跑了两局。这控制了座位优势,但没有引入新的对局长度、策略历史或随机条件。两局游戏仍然采样同一个隐藏总轮数:8轮。我有两个座位臂,不是两个独立环境。
修复方法很简单:按隐藏对局长度分层。5轮配种子2201,6轮配2205,7轮配2200,8轮配2203,9轮配2202,每个条件跑左右两个座位方向。镜像回答"结果是否跟座位走",分层回答"结果在条件变化后是否存活"。两个都需要。
清单2:环境知道的,即使智能体不知道,也会混淆结果
总轮数对玩家是隐藏的,但它仍然塑造了游戏。一个恰好触发在第7轮的规划,在8局对局里看起来聪明绝顶;同样的触发在5局里可能太晚,在9局里可能产生两轮互叛。如果环境知道某个值——即使智能体不知道——这个值仍然可能混淆结果。
对游戏智能体来说,这包括:
- 隐藏的对局总长度
- 对手的策略分布
- 收益矩阵的边界条件
我现在把这些写进实验计划,而不是留在随机数生成器里。
清单3:跨种子批次,第一眼效果可能骗人
我的第一轮跨种子规划器批次看起来戏剧性十足——然后仔细检查发现,所谓的效果来自种子选择偏差。某些种子天然产生合作轨迹,某些天然产生背叛轨迹,规划器只是碰巧被分配到了"好"种子。
核查方法:每个种子必须跑两个座位方向,且种子分配必须预先注册。事后挑种子等于事后挑结论。
清单4:成本不是可选项,是核心指标
我的结构化规划器成本是基线1.94倍。如果它带来了显著收益,这个溢价可能值得。但它没有改善轨迹,那这个成本就是纯浪费。任何规划器实验报告,如果没写token成本对比,等于没做实验。
清单5:schema合规不等于行为改善
我的规划器在输出合法JSON方面非常可靠——100%合规。但合规的输出没有转化为更好的游戏决策。这提醒我:格式正确是必要条件,不是充分条件。评估规划器必须看下游行为指标,不能只看输出格式。
清单6:小样本的统计功效要提前算
每个条件10局,总共几十局,这个样本量能检测多大的效应?坦白说,只能检测非常大的效应。如果规划器的真实提升是5%,我这个实验根本测不出来。报告里必须写清楚:这个实验能排除多大的效应,不能排除多大的。
清单7:负面结果也是结果
我的规划器没有改善游戏轨迹,成本还贵了1.94倍。这个负面结果有价值——它防止别人在同样的设置上浪费时间。但前提是实验设计足够干净,让人相信这个负面结果不是实验缺陷造成的。
回到开头那个完美的两局演示。它错了吗?没有。那两局确实按计划发生了。但它只证明了:在特定种子、特定轮数、特定座位配置下,规划器按预期工作。它没有证明:规划器普遍有效。
这七个检查清单,本质上是一句话:先问实验设计能不能排除混淆变量,再问结果是否可信。两局演示能激发直觉,但不能建立结论。建立结论需要分层、镜像、跨种子、算成本、报功效——以及最重要的,诚实地报告负面结果。
我的规划器实验没有通过全部七项检查。它通过了镜像,通过了分层,但在成本效益上失败了。这个失败是有价值的:它告诉我,在重复囚徒困境这个特定设置下,结构化规划器不值得1.94倍的成本。
下次我会先跑完七个检查,再决定要不要相信一个漂亮的演示。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.