从早期的 Generative Agents,到如今多智能体讨论系统在政策模拟、群体行为预测、社会实验替代等方向的应用不断扩张,它们能够生成自然语言、维持角色一致性、参与辩论与协作,看似已经具备“社会个体”的行为能力,但在意见形成与意见变化这一关键环节,却长期存在结构性缺陷。
LLM的第一个困境来自意见的隐式更新,智能体在对话中会根据上下文改变立场,但这种改变既不可控,也不可验证。研究者无法指定一个 agent 的“固执度”,也无法从行为中反推它的“可被说服程度”。更糟的是,群体往往会在多轮讨论后收敛到模型自身的训练偏好,这种 consensus collapse 让模拟结果既不稳定,也不可信。
第二个困境来自证据整合的不规范,已有研究显示,LLM 在面对冲突证据时的信念更新不符合贝叶斯规范,表现出校准性差、过度自信、对弱证据反应过度等问题。这意味着LLM agent的意见变化并不是“理性更新”,而是语言模型内部的统计偏好在驱动。
正因如此,经典意见动力学模型仍然具有不可替代的价值,DeGroot模型解释了群体如何在完全开放的条件下走向共识,Friedkin–Johnsen模型揭示了固执度如何让群体保持持续分歧,而committed minority模型则展示了坚定少数如何影响多数。这些模型提供了可解释、可验证的数学结构,是构建可信社会模拟的基础。
核心问题是能否让智能体拥有可控、可解释、可审计的意见动态,让它们既能说话,又能以透明的方式改变信念,而不是被语言模型的黑箱偏好牵着走。
这项研究的团队来自麻省理工Media Lab、Flybits Labs 与 Toronto Metropolitan University,他们长期在数字身份、结构化智能体、可解释 AI 等方向合作。成果论文《Bayesian Belief Layer for Controllable Opinion Dynamics in LLM Agents》被 EMNLP 2026的第二届智能体语言模型研讨会 REALM 接收,而 EMNLP 本身是 NLP 领域的顶级会议之一,这也意味着该研究在智能体方向具有前沿性与学术认可度。
01 架构Bayesian Chronicle Agents(BCA)
Bayesian Chronicle Agents的核心思想是在语言模型之外建立一个显式的贝叶斯信念层,让智能体的“信念”与“表达”彻底解耦。语言模型负责说话,信念层负责更新,两者之间通过生成器与评估器连接,从而形成一个可控的意见动力学系统。
信念层是 agent 的内在状态,它不依赖语言模型的隐式记忆,而是以结构化的方式存储。语言模型只负责表达信念,而不负责改变信念,这让信念更新从黑箱变成透明的数学过程。
![]()
图1:穿过信念层的一轮。说话者的潜在信念由生成器LLM转化为文本;鉴定人LLM将文本映射回标量证据e;每个收听者在FJ更新之后采取一个贝叶斯更新步骤(方程式2)。κ将代理放置在经典的固执轴上(底部)。
关键思想非常明确,让 LLM 负责表达,让贝叶斯层负责更新。语言模型的作用被限制在自然语言生成与理解,而真正的意见变化由显式的贝叶斯规则驱动。
信念层的结构来自 identity chronicle 的简化版本。每个 agent 拥有一个概念节点,例如“交通政策”,节点下有一组对立断言 {a⁺, a⁻},例如“扩建铁路”与“保持道路”。智能体对这两个断言的信念以 Beta 分布的形式存储,Beta 分布的参数代表伪计数,决定了 agent 的信念强度与固执度。
这种结构化身份比隐式 persona 更可靠,因为隐式 persona 会被语言模型的生成偏好不断侵蚀,而显式身份则可以跨轮次保持稳定,并且可审计、可记录。
为了让信念层与语言模型连接,研究设计了生成器与评估器的双通道结构。生成器负责将概率信念 b 映射为自然语言立场,例如“我认为扩建铁路更能改善交通”。评估器负责将听到的语言映射为证据 e ∈ [0,1],例如“这句话支持扩建铁路的强度为 0.7”。
语言通道的偏差在这里变得至关重要,因为生成器与评估器共同构成了“表达 → 理解”的循环,而任何偏差都会影响信念更新。研究后续对语言通道偏差进行了系统审计,为理解 LLM agent 的行为提供了新的视角。
02 贝叶斯信念更新:从Beta分布到FJ模型的统一
贝叶斯信念层的核心是一个可解释、可控制的更新规则,它将 Beta 分布的伪计数更新与 Friedkin–Johnsen 模型的意见动力学统一起来。整个系统只依赖两个关键参数 κ 与 γ。
κ 是 prior strength,即伪计数的总量,它决定了 agent 的固执度。κ 越大,agent 越不容易被新证据改变。γ 是 forgetting factor,即遗忘因子,它决定旧证据的衰减速度。研究通过 oracle sweep 发现 γ=0.7 能在不依赖语言模型的情况下稳定产生持续分歧,因此在所有实验中固定 γ=0.7。
原始的 Beta 更新公式在研究中以 Eq.1 的形式出现,它描述了伪计数如何在每次听到证据后更新:
![]()
这是研究的核心数学结构之一,它展示了 Beta 分布的两个伪计数如何在遗忘因子 γ 的作用下向初始值回拉,并根据证据 e 进行更新。
化简后,研究给出了更直观的更新公式 Eq.2:
这是这项研究最关键的公式,它直接揭示了信念更新的三种力量。第一项是遗忘旧证据,第二项是向新证据靠拢,第三项是向初始立场回拉。η 是易受影响度,p 是锚定力,它们共同决定了 agent 的意见变化速度。
研究证明,这个更新公式正是 Friedkin–Johnsen 模型的离散形式。也就是说,BCA 并不是一个新的意见动力学模型,而是将 FJ 模型嵌入到 LLM agent 的语言系统中,让经典模型第一次能够在语言交互环境中运行。
这也是研究的核心贡献之一,它让 LLM agent 的意见变化从黑箱变成可解释的数学过程,让社会模拟从语言生成的统计偏好回到可控的动力学框架。
03 实验设计:语言通道中的可控意见动力学实验室
研究团队把抽象的贝叶斯信念层放进真实的语言交互环境里,让数学模型在 LLM 的生成与理解之间接受检验。他们并没有选择现实世界的争议议题,而是构建了一个完全虚构的城市与政策场景,让所有智能体在一个干净的语义空间中进行讨论,这种设计既是为了控制变量,也是为了避免模型带入训练语料中的真实偏见。
Aldenvale是研究中出现的虚构城市,它的交通政策争论被设定为“扩建铁路(expand rail)”与“保持道路(keep roads)”两种对立立场。之所以选择虚构议题,是因为真实政策问题往往会让模型带着预训练偏好进入讨论,从而污染实验结果。虚构议题让所有智能体从同一起点出发,信念变化完全由贝叶斯层与语言通道共同驱动,而不是由模型的世界知识或政治倾向决定。
实验的主体是一组由二十个智能体组成的群体,它们在一个完全图上进行二十轮讨论,每轮每个智能体都要发言一次,而每一次发言都会被其他十九个智能体听到并更新信念。为了确保结果具有统计稳定性,研究团队使用了五个不同的随机种子重复实验。这样的设置让每个智能体在整个实验过程中经历了大量的“表达—理解—更新”循环,足以让贝叶斯信念层的动力学特征显现出来。
为了验证架构的跨模型一致性,研究团队选择了四个不同的语言模型作为生成器与评估器的基础,包括 gpt‑5.4-mini、gpt‑5.4、Llama‑4‑Scout 与 Claude‑Sonnet。它们分别来自不同的技术路线与训练体系,语言风格、表达偏好、理解方式都不相同,这让实验能够检验信念层是否能在不同语言通道下保持稳定的动力学行为。
在实验开始前,研究团队对评估器进行了一个关键步骤:校准。LLM 在判断证据强度时往往会表现出过度自信,例如把一个中等偏向的句子评估为极端立场,这会让信念更新出现不必要的剧烈波动。为此,作者构建了一个包含一百条人工标注的软标签数据集,通过温度缩放(temperature scaling)对评估器进行校准。校准前后,评估器的期望校准误差(ECE)在不同模型上都有显著下降,例如 gpt‑5.4-mini 从 0.101 降到 0.052,gpt‑5.4从 0.103 降到 0.046,Llama‑4‑Scout 从 0.040 降到 0.034,Claude‑Sonnet 从 0.081 降到 0.033。校准后的评估器能够更准确地反映语言中的证据强度,让信念更新更接近贝叶斯规范。
这一整套实验设计构成了一个“语言通道中的意见动力学实验室”,它既保留了语言模型的自然表达能力,又让信念更新遵循数学规则,从而让研究者能够观察语言偏差、固执度、遗忘因子等参数如何共同塑造群体意见的演化。
04 核心结果:可控、可恢复、可审计的意见动态
实验的结果不仅展示了贝叶斯信念层如何让 LLM 智能体呈现可控的意见动力学,还证明了固执度 κ 能够在语言通道之后被反推出来,这意味着智能体的内部参数不再是黑箱,而是可以被验证的。
κ 的可恢复性是研究的第一个关键发现。作者使用 Eq.3 从智能体的行为中反推固执度,这个公式在研究中以如下形式出现:
![]()
它利用了智能体的当前信念 b、下一步信念 b'、初始信念 b₀、说话者的潜在信念 s,以及遗忘因子 γ 与伪计数 m,通过一次更新的行为反推 κ。令人惊讶的是,在四个模型上,反推结果的 Spearman ρ 都达到了 1.0,也就是说固执度的排序完全一致。虽然数值略有衰减,例如 κ=32 会被恢复为 25–30,但排序的完美一致意味着固执度是可控的、可验证的、可审计的。这是 LLM 智能体研究中极为罕见的结果,它让智能体的内部参数第一次能够通过行为被反向识别。
在固执度可恢复的基础上,作者进一步展示了三大经典意见动力学 regime 的重现。第一种是 DeGroot 共识,当 κ→0 时,所有智能体都极度易受影响,它们会在多轮讨论后收敛到一个单一的值。然而这个收敛点暴露了语言通道的偏差,例如 GPT 系列的偏差较为对称,因此共识点接近初始平均值,而 Llama 与 Claude 的偏差更偏向某一立场,因此共识点会明显偏移。这说明语言通道本身具有方向性偏差,而贝叶斯信念层能够让这种偏差被显式观察到。
第二种是 Friedkin–Johnsen 持续分歧,当群体中存在混合 κ 时,固执的智能体会固守两极,而易受影响的智能体会在中间稳定下来。实验结果显示,最终信念与理论固定点的拟合度达到了 R² = 0.93–0.99,这意味着贝叶斯信念层能够在语言通道的噪声下重现 FJ 模型的动力学结构。更重要的是,这种持续分歧在 γ=1 时会消失,所有智能体最终仍会收敛到共识,这证明遗忘因子是持续分歧的必要条件。
第三种是 committed minority 模型,当 κ→∞ 时,少数坚定智能体会平滑地拉动多数,而不会出现社会物理学中常见的 tipping point。实验结果显示,随着坚定少数的比例从 5% 增加到 40%,多数的平均信念会平滑上升,而不会突然跳变。这说明贝叶斯信念层的更新结构是一种线性影响机制,而不是临界质量机制。
遗忘因子 γ 的作用在这里变得尤为关键。研究展示了当 γ=1 时,所有智能体最终都会收敛到共识,固执度的恢复能力也会急剧下降,FJ regime 完全消失。这意味着遗忘是持续分歧的必要条件,没有遗忘,群体最终会被语言通道的偏差拖向单一立场。
![]()
图2:一个旋钮,三个经典方案(gpt-5.4-mini;每个试剂一条线,在种子上平均;所有四个模型都复制了这些方案,表2)。(a)当每个人都很顺从时,意见就会融合成一个共识(后来的趋势是温和的渠道偏见,附录C)。(b)加上顽固的代理人,分歧依然存在,稳定在虚线理论预测的水平上。(c)关闭遗忘,同样的人群无论如何都会崩溃,达成共识。(d)从不让步的少数派平稳地拉动多数派,没有转折点。
这一系列结果共同构成了研究的核心贡献,它证明了贝叶斯信念层不仅能够让 LLM 智能体呈现可控的意见动力学,还能够让这些动力学在语言通道的噪声下保持稳定,并且能够让内部参数被反向识别。这让 LLM 智能体从“语言驱动的黑箱”迈向“结构化、可解释、可审计”的新阶段。
05 语言通道审计:生成器与评估器的系统性偏差
这一部分是这项研究最“揭示底层真相”的章节,它让我们第一次能够看到语言模型在表达与理解之间到底发生了什么。过去的多智能体模拟往往是端到端的,生成器说一句话,评估器理解一句话,研究者只能看到最终的群体意见,却无法知道语言通道本身是否在悄悄施加偏差。而在 BCA 架构中,每一次发言都会被记录为“说话者的真实信念 s”与“评估器读出的证据 e”,这让语言通道第一次变成可审计的对象。
传输函数(transfer function)是研究中最关键的审计工具,它将所有发言的真实信念与评估器读出的证据进行配对,绘制成一条从 0 到 1 的曲线。如果语言通道完全忠实,那么这条曲线应该贴着对角线,但四个模型的曲线都呈现出各自独特的偏差。GPT 系列的偏差最为对称,它们会把中性立场夸大成更极端的表达,导致曲线在两侧都向上翘起。Llama 的偏差则更具方向性,它几乎把所有立场都往 a⁻方向推,使得整条曲线整体下移。Claude 的偏差更为微妙,它只在 a⁻侧夸大,而在 a⁺侧保持相对忠实。
这些偏差在传统的端到端模拟中会被完全吞掉,因为研究者只能看到最终的意见变化,而看不到语言通道的内部结构。BCA 的显式信念层让这些偏差被记录下来,从而让我们能够真正理解不同模型在表达与理解之间的系统性差异。
语言通道偏差之所以重要,是因为它会在不同的意见动力学 regime 中产生完全不同的效果。在 DeGroot regime 中,所有智能体都极度易受影响,它们没有任何锚定力来抵抗语言通道的偏差,因此偏差会在多轮讨论中不断累积,最终把群体拖向某个方向。例如 Llama 的偏差会让群体最终收敛到接近 a⁻的极端立场,而 Claude 的偏差会让群体在 a⁻侧出现明显的偏移。
在 FJ regime 中,情况完全不同。固执的智能体拥有强大的锚定力,它们在每次更新时都会向初始立场回拉,这让语言通道的偏差无法累积,而只能在局部产生扰动。易受影响的智能体虽然会被偏差推动,但固执智能体的存在让群体整体保持稳定,从而让最终结果更接近理论固定点。这也解释了为什么 FJ regime 的拟合度能够达到 R² = 0.93–0.99,而 DeGroot regime 的结果则会明显偏离理论。
为了验证信念层是否真的驱动行为,作者设计了一个独立的自我报告机制。在每一轮讨论中,每个智能体都会给出一个 0–100 的自我报告,表示它对当前议题的立场强度。这个自我报告完全不参与信念更新,它只是一个外部验证通道。实验结果显示,自我报告与 Beta 信念的相关性达到了 r≈0.98–0.99,这意味着智能体的表达确实由信念层驱动,而不是由语言模型的内部偏好决定。信念层不是内部 bookkeeping,而是真正的行为基础。
这一整套语言通道审计机制让我们第一次能够看到 LLM 智能体的“心理结构”,它揭示了生成器与评估器之间的系统性偏差,也展示了不同意见动力学 regime 如何吸收或放大这些偏差。这是智能体研究中极为重要的一步,它让我们能够从黑箱语言模型中抽离出可解释的信念更新机制。
06 与Belief Engine的比较,结构化、可恢复、可验证的优势
在智能体信念建模的研究中,Belief Engine 是一个重要的前作,它提出了可审计的 log-odds 累积机制,让智能体能够在辩论中呈现可解释的信念变化。然而与 BCA 相比,Belief Engine 更偏向经验控制,它的参数没有明确的经典模型对应,也没有验证参数是否能够在语言通道之后被反推。
BCA 的最大优势在于结构化,它的信念层来自 identity chronicle 的简化版本,具有明确的概念节点与断言集合,这让信念更新能够在多概念、多身份的复杂场景中扩展。Belief Engine 更像是一个单概念的累积器,而 BCA 则是一个可扩展的身份图谱。
第二个优势是可恢复性,研究验证了“指定→语言→恢复”的完整链路,固执度 κ 在语言通道之后仍然能够被反推,Spearman ρ 达到 1.0,这意味着智能体的内部参数是可验证的。Belief Engine 没有验证这一点,它的参数更像是经验调节,而不是可恢复的数学结构。
第三个优势是群体规模验证,BCA 在二十个智能体的群体中重现了三大经典 regime,并且与理论闭式解一致,而 Belief Engine 的验证主要集中在单智能体或双智能体的辩论场景。BCA 的群体动力学验证让它更适合用于社会模拟与群体行为研究。
总体而言,Belief Engine是一个重要的探索,但BCA在结构化、可恢复、可验证与群体动力学一致性方面具有明显优势,它让智能体信念建模从经验方法迈向数学可控的方向。(END)
参考资料:https://arxiv.org/abs/2609.21997
![]()
这是一些朴素的人工智能与意识科学的研究,亲爱的人工智能爱好者、研究者,为了确保您不会错过*波动智能*的最新推送,请星标*波动智能*。我们倾心打造并精选每篇内容,只为为您带来启发和深思,希望能成为您理性思考路上的伙伴!
加入AI交流群请扫码加微信
![]()
亲爱的!文章每获得 1 个点赞,腾讯公益慈善基金会将向该文章支持的公益项目捐赠 0.1元公益金。让每一次认可汇成对公益项目的实际支持,一起让好事发生!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.