贝叶斯因子成组序贯设计
Bayes Factor Group Sequential Designs
https://arxiv.org/pdf/2601.02851v2
![]()
![]()
摘要
贝叶斯因子,即从先验几率到后验几率的基于数据的更新因子,是两个竞争假设相对证据的一种有原则的度量。它天然适合临床试验和动物实验等环境中的序贯数据分析,在这些环境中,因疗效或无效而提前停止是可取的。然而,设计此类研究具有挑战性,因为计算设计特征(例如获得结论性证据的概率或预期样本量)通常需要计算密集型的蒙特卡洛模拟,因为不存在闭式或高效的数值方法。为了解决这个问题,我们将经典成组序贯设计理论的结果扩展到序贯贝叶斯因子设计。关键思想是根据累积 (z) 统计量推导贝叶斯因子停止区域,并利用累积 (z) 统计量的已知分布,通过多元正态积分来计算停止概率。所得方法快速、准确且无需模拟。我们用临床试验、动物实验和心理学研究的例子来说明它。我们还提供了 bfpwr R 包中的开源实现。我们的方法使探索序贯贝叶斯因子设计像经典成组序贯设计一样直接,使实验者能够快速设计出信息丰富且高效的实验。
关键词和短语:贝叶斯假设检验,设计先验,预测功效,样本量确定,序贯临床试验。
1. 引言
实验设计中的一个关键决策是选择样本量,例如,参与者、动物或测量的数量。样本量太小可能会导致无结论的结果,而样本量太大可能会过于昂贵、在逻辑上具有挑战性,或在伦理上存在问题。序贯设计经常被提出作为减少样本量的一种手段 [30]。在序贯设计中,当在中期分析中发现结论性证据时,可以提前停止实验。例如,如果有证据表明治疗有效(因疗效而停止),或者如果有证据表明治疗无效甚至有害(因无效而停止),临床试验可能会提前停止。
尽管具有吸引力,但序贯设计带来了统计和实践上的挑战。例如,它们可能会使参数估计产生偏差 [53],或威胁盲法试验的完整性,因为中期分析可能需要初步揭盲 [16]。此外,频率派序贯设计的分析可能不直观。例如,如果由于重复分析而未能越过更严格的阈值,那么最终 p 值低于传统的5%阈值可能仍不足以宣布疗效。许多实践者发现这难以接受,因为如果只进行了一次分析,相同的数据将允许做出疗效声明 [40]。
1.1 序贯分析的贝叶斯方法
贝叶斯方法通常被认为更适合序贯分析 [23]。重复“更新”是贝叶斯框架所固有的,并且贝叶斯概率原则上不受多重性问题的影响 [然而,见 59, 82]。出于这个原因,监管机构越来越接受贝叶斯方法,并且 FDA 最近发布了明确允许在临床试验中将贝叶斯方法用于主要推断的指南草案,前提是它们得到适当的论证 [72, 34]。
两种流行的序贯分析贝叶斯方法基于后验尾部概率 [6, 21, 64, 54] 和贝叶斯因子 [60, 28, 35, 48]。对于方向性假设(例如,检验治疗效应是小于还是大于零),两者密切相关,因为贝叶斯因子停止规则等价于后验尾部概率规则,其阈值根据先验几率进行相应转换。然而,贝叶斯因子更自然地适应点(或“尖锐”)零假设,例如不存在治疗效应,因为贝叶斯因子量化了支持此类假设的证据,而不需要为其分配先验概率。由于点零假设是确证性和监管性检验的核心,贝叶斯因子在临床试验环境中特别有吸引力。
贝叶斯因子还具有另一个对监管机构有吸引力的性质。预期证据权重(预期对数贝叶斯因子)在备择假设下的先验与真实数据生成机制匹配时最大,因此指定一个过于乐观的备择先验只会减少支持治疗的预期证据,而不会使试验偏向于它 [28]。这与基于后验尾部概率的推断形成对比,在后一种推断中,乐观的先验可能会使结论偏向于治疗,这是反对使用贝叶斯方法的一个常见论点 [23]。
贝叶斯因子也天然适合序贯分析。在零假设下,支持备择假设的贝叶斯因子是一个检验鞅 [63],因此,无论数据被分析多少次,曾经获得误导性证据的概率都是有界的。这与标准后验尾部概率形成对比,在标准后验尾部概率中,中期分析次数的增加会将错误拒绝零假设的概率膨胀到一(“抽样至预定结论” [11, 10],另见 [26] 第13.3.2章)。在这个意义上,贝叶斯因子可以被视为似然比的贝叶斯推广 [74, 57],并且与最近流行的 e 值和“随时有效”方法密切相关 [52, 20]。
1.2 序贯贝叶斯因子设计
我们关注序贯贝叶斯因子设计,这些设计已被广泛应用于多个领域,包括生物医学研究 [10, 12, 65, 18, 28, 35, 84, 83, 55, 42, 48, 36]、社会科学 [61, 60, 68, 38, 69, 67] 以及科技行业中的 A/B 测试 [14, 37]。此类设计的核心是贝叶斯因子
![]()
![]()
![]()
![]()
![]()
1.3 贡献与大纲
在本文中,我们提出了关于序贯贝叶斯因子设计的一种替代视角,它能够快速、无需模拟地计算其设计特征。关键思想是将贝叶斯因子表达为 z 统计量(观察到的参数估计值与零值之间的标准化差异)的函数,使得停止规则对应于累积 z 统计量空间中的区域(见图1中最下面的图)。基于并扩展经典成组序贯设计理论的结果,这些区域的概率,以及因此的设计特征,可以通过多元正态积分确定性地计算出来。只要贝叶斯因子可以表示为 z 统计量的函数,并且累积 z 统计量至少近似地遵循典型多元正态分布,该方法就适用。我们还提供了 R 包 bfpwr 中的开源实现,这使得规划序贯贝叶斯因子设计像规划经典成组序贯设计一样直接。
在接下来的第2节中,我们概述序贯贝叶斯因子设计特征的一般计算。然后,我们解释了一种当贝叶斯因子可以表示为 z 统计量的函数时,高效且无需模拟地计算设计特征的方法(第3节)。临床试验和动物实验的应用说明了该方法如何在实践中使用(第4节)。第5节概述了贝叶斯因子 t 检验 [19] 的序贯版本的扩展。本文以结论性讨论、局限性和未来研究机会结束(第6节)。附录A说明了我们的 R 包 bfpwr 的使用。
2. 序贯贝叶斯因子设计特征
![]()
![]()
![]()
3. 基于 Z 统计量的贝叶斯因子
![]()
![]()
![]()
![]()
3.1 基于 z 统计量的停止区域
![]()
![]()
虽然超矩形数量的指数增长带来了某些计算挑战,但在我们的应用中,当穷举计算多达十次分析的设计中所有超矩形的概率时,我们没有观察到任何数值问题。在许多领域,涉及如此大量分析的设计很少遇到。例如,临床试验中最常见的中期分析次数即使有,也通常只有一两次 [70]。此外,对于只有一个临界 z z值的贝叶斯因子(例如,单侧检验),超矩形的数量仅随分析次数线性增加。因此,穷举计算它们的概率不会带来计算问题,即使对于非常大量的分析也是如此。
3.2 设计先验下 z 统计量的预测分布
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
4. 应用
我们现在将使用来自临床试验和动物实验的案例研究来说明序贯贝叶斯因子设计的规划。
4.1 Low-PV 试验
![]()
![]()
![]()
![]()
![]()
![]()
![]()
![]()
增加分析次数会减少预期样本量(第三行图),这是由于潜在的提前停止,同时对样本量的标准差产生非单调影响(第四行图)——在较小的最大样本量下增加,在较大的最大样本量下减少。将标准差除以预期样本量得到变异系数(底行图),这使得在考虑不同预期样本量的同时比较样本量变异性成为可能。对于给定的最大样本量,变异系数随着分析次数的增加而增加,因为更多可能的停止样本量变得可用。同时,对于给定的分析次数,增加最大样本量最初会增加变异系数,直到达到最大值,之后它再次减少。然而,对于少量分析(例如,两或三次),这种变化相对较小,因此变异系数几乎保持恒定。
总之,与固定设计相比,即使只有两或三次分析的序贯设计也能极大地提高效率。它减少了预期样本量并增加了正确证据的概率,同时仅略微增加了误导性证据的概率和样本量的变异性。
4.2 关于减重的大鼠实验
在动物研究中,正如在临床试验中一样,每一个额外的观测都承载着重要的伦理分量。因此,减少样本量至关重要,这是动物研究中3R(“替代、减少、优化”)原则的支柱之一 [58]。我们现在将重新分析一项大鼠临床前实验的数据,该数据由 Kang 等人 [31] 进行了回顾性分析。在该实验中,大鼠被随机分配到候选药物的不同剂量水平或对照组,以估计药物对减重的影响。由于保密问题,Kang 等人已删除了可用于识别药物或研究的信息。图6的顶部图显示了各组测量的减重值。可以看出,低剂量组(黄色)与对照组(黑色)差异很小,而中剂量(蓝色)和高剂量(绿色)组显示出高得多的减重。
![]()
![]()
![]()
![]()
总之,所开发的序贯贝叶斯因子设计方法能够快速计算关键设计特征,同时考虑参数不确定性。这可能导致更高效的设计。例如,与其向所有组分配相等数量的大鼠,人们可以向中剂量和高剂量组分配更少的大鼠,向低剂量组分配更多的大鼠,从而确保所有组都有高概率获得信息丰富的推断。
5. 序贯贝叶斯 t 检验
贝叶斯因子版本的 t 检验是社会科学中序贯假设检验的一种流行方法。假设数据服从正态分布且方差未知,Gronau 等人 [19] 提出了一种“知情”t 检验贝叶斯因子,它可以通过信息先验分布将先验信息纳入考虑。该贝叶斯因子是
![]()
![]()
![]()
![]()
6. 讨论
贝叶斯因子是序贯数据分析的自然工具:数据可以重复分析而无需担心多重性,停止决策自然地与竞争假设的先验几率到后验几率的可解释更新相联系,并且与后验尾部概率不同,不需要为竞争假设指定先验概率。尽管有这些优势,序贯贝叶斯因子设计的更广泛采用仍然有限,一个潜在原因是计算其设计特征的困难。现有方法通常依赖于大量模拟,这可能计算成本高昂、对蒙特卡洛误差敏感,并且在探索许多设计选项时不方便。
在本文中,我们介绍了一种通过将贝叶斯因子表达为 (z) 统计量的函数并扩展经典成组序贯设计理论的结果来克服这些局限的一般方法。这一视角表明,贝叶斯因子停止规则对应于累积 (z) 统计量空间中的超矩形区域集合。在典型 (z) 统计量分布下,这些区域的概率可以使用多元正态积分高效计算,从而无需模拟。所得计算快速、准确,并且可扩展到具有许多中期分析的设计。该方法还自然地纳入了设计先验,使实验者能够在设计阶段考虑参数不确定性。传统的固定参数计算是一种特殊情况,从而能够在统一框架内灵活探索贝叶斯和频率派操作特征。
然而,也有一些局限性。该方法要求贝叶斯因子可以表示为 (z) 统计量的函数,并且累积 (z) 统计量至少近似服从典型多元正态分布。不满足这些假设的情况(例如,小样本量和/或极端概率的二元数据)可能仍需要模拟或其他数值方法来计算设计特征。为这些情况开发修改可能是未来研究的一个方向。
总之,许多序贯贝叶斯因子设计可以像经典成组序贯设计一样快速可靠地规划。我们配套的 R 包 bfpwr 实现了这些方法,并为实验者提供了一个设计高效且信息丰富研究的实用工具。
原文链接:https://arxiv.org/pdf/2601.02851v2
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.