![]()
中国社会科学报综合报道无论是与单一对手玩扑克,还是与另一位潜在买家争夺一套房产,人们总是在信息不完全的条件下行事。我们知道自己手中的牌或能承受的最高价,却不知道对手的底牌或对方的出价上限。这类“不完全信息博弈”广泛存在于从商业谈判到战略决策的现实世界中。近日,一项由美国麻省理工学院研究人员合作完成并在国际表征学习大会(ICLR)上发布的研究成果,为理解和优化这类博弈提供了全新视角。
该研究关注的焦点是两类算法的比较。一类是基于博弈论原理精心设计的“专才”算法,另一类是名为策略梯度算法的通用型算法。策略梯度算法自20世纪90年代起被用于决策领域,“策略”指的是智能体(agent)采取行动的一套规则,即其决策方案;“梯度”则是一个数学概念,指向变化最快的方向,好比站在山坡上,顺着梯度走就能最快登顶。该方法通过让神经网络在连续的小步骤中朝特定目标移动,并在过程中不断调整和修正路线,来一步步接近最终目的地。
该领域长期以来的默认假设是:专为博弈设计的“专才”算法必然优于“通才”策略梯度算法。然而研究结果却颠覆了这一认知。论文作者之一、麻省理工学院计算机科学系助理教授加布里埃莱·法里纳(Gabriele Farina)指出,在多智能体环境中,策略梯度算法的分析远比单智能体场景复杂。卡内基梅隆大学计算机科学系教授塞缪尔·索科塔(Zico Kolter)表示,该领域此前几乎公认“专才”的博弈论算法才是最佳选择,但新研究表明,策略梯度算法反而可能表现更优。“这提出了一个有趣的问题:为什么这一现象被忽视了这么久?”
该研究的另一重要贡献,是为不同算法提供了一套公平的评估基准。团队开发的基准测试软件相当于一个试验场,研究者可将算法放入其中,在特定任务上训练后观察其表现。评估指标被称为“可利用性”(exploitability),用于衡量玩家在面对“最坏情况对手”时的表现。索科塔解释说,在扑克这类游戏中,这个对手虽然不知道你手中的牌,却清楚你拿到任何牌时会如何行动。得分越接近零,说明策略越接近完美;得分越高,则意味着离最优策略越远。
团队在五类游戏中进行了实验,包括玩家无法看到对手落子的“幻影井字棋”(Phantom Tic-Tac-Toe)、不完全信息变体的“六贯棋”(Hex)以及“大话骰”(Liar’s Dice)等。结果显示,采用策略梯度算法训练的智能体,其“可利用性”得分优于基于博弈论算法训练的对手。
谷歌深度思维(Google DeepMind)人工智能实验室计算机科学家兼博弈论专家伊恩·根普(Ian Gemp)对此结果感到惊喜,他说道:“这项研究提醒我们,对策略梯度算法这类通用决策算法进行现代化改造,依然是解决复杂战略问题的一条高效路径。”
从更广泛的社会科学视角来看,这项研究的启示或许在于它挑战了“专才必胜”的思维定式。经济学、政治学、国际关系等领域的决策者,面对的往往都是信息不完全且环境动态变化的情景。策略梯度算法这类“通才”工具之所以能够胜出,恰恰说明在复杂条件下,灵活调整和不断试错的思维方式可能比固守一套理论更有效。
来源 : 中国社会科学报
责任编辑: 赵琪
新媒体编辑:张雨楠
如需交流可联系我们
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.