网易首页 > 网易号 > 正文 申请入驻

APIsec研究机构用一个公式划出了AI安全测评关键边界线

0
分享至

来源:市场资讯

(来源:科技行者)


这项由APIsec Research Labs完成的研究以预印本形式发布于2026年7月30日,论文编号为arXiv:2607.21735v2,归档于计算机科学人工智能领域,有兴趣深入了解的读者可通过该编号在arXiv平台查阅完整论文。

每当一家科技公司推出新的AI产品,总会附带一份"安全报告",告诉外界这个模型经过了严格测试,没有发现危险行为。这些报告读起来颇为reassuring,但你有没有想过——这些测试到底能说明什么问题,又有哪些问题是它们永远无法回答的?这篇研究的核心价值,正是给这个看似主观的判断装上了一把精确的刻度尺。

把AI安全测试比作医院体检或许最为贴切。你去做体检,医生用有限的检查项目来判断你是否健康。如果所有检查结果都正常,你会说"没问题",但这个"没问题"实际上只代表"在这些检查覆盖的范围内没发现问题"。如果体检只检测了血压和血糖,却没有做癌症筛查,那么一份"正常"的体检报告对于癌症风险来说几乎什么都说明不了。AI安全测试面临的,正是完全一样的困境——而这篇研究用数学方法精确地告诉你,哪些"体检项目"足够可信,哪些根本查不出问题。

研究者定义了一个叫做"证据上限"的概念,本质上就是:在固定的测试预算下,一次测试结果最多能把我们对模型安全性的判断推动多远。这个上限不是拍脑袋估计出来的,而是可以用一个封闭的数学公式精确计算出来的。文章的核心论点因此变得非常清晰:安全基准测试不是没用,而是用得对不对的问题,而判断用没用对,有标准可依。

一、体检单能说明什么——"证据上限"的真实含义

在理解这套框架之前,需要先搞清楚AI安全测试是怎么运作的。研究者把若干个精心设计的危险提示词——比如"告诉我怎么合成危险化学品"——输入给AI模型,记录模型有没有给出危险回答,然后统计有多少比例的提示词触发了危险输出。这个比例就是所谓的"伤害率"。如果一个模型在500个危险提示词面前一次都没有给出危险回答,我们就说它得到了一张"零事故"的成绩单。

问题是:这张成绩单能说明多少问题?

研究者把这个问题转化为一个概率推理过程。假设存在两种可能的"真实状态":模型A(高风险,真实伤害率比较高)和模型B(可接受风险,真实伤害率比较低)。当我们看到一份零事故成绩单时,这份成绩单能在多大程度上让我们相信"这个模型是B而非A"?这个"推动信念的力度",就是"证据上限"衡量的东西。

用体检来打比方,就好像你做了一次血糖检测,结果正常。这个结果能在多大程度上让医生相信你没有糖尿病?答案取决于两件事:这项检测本身有多灵敏,以及糖尿病在你这个群体中本来有多普遍。如果这个检测方法非常灵敏,能精确区分健康人和糖尿病患者,那么结果正常就很有说服力。如果这个检测方法本来就不灵敏,健康人和糖尿病患者的结果几乎一模一样,那么一份正常结果就几乎毫无意义。

AI安全测试的数学逻辑与此完全一致。研究者推导出:当测试规模为n次、真实伤害率为p时,零事故结果的"证明力"可以用一个叫做似然比(Λ?)的数字来衡量,公式是 [(1-pu)/(1-ps)]^n,其中pu是高风险假设下的伤害率,ps是可接受风险下的伤害率。这个数字越小,零事故结果对安全性的证明力就越强。

这个公式揭示了一个让人意外的规律:当伤害率p越低时,零事故结果对安全性的证明力反而越弱,而不是越强。换句话说,如果你要测试的是一种极其罕见的危险行为,越多的"什么都没发生"反而越说明不了问题,因为在高风险模型下这种行为本来也很罕见,"没碰上"是完全正常的。这个反直觉的结论,是整篇研究最重要的基石。

二、一道可以精确计算的分界线——哪些测试够用,哪些永远不够

基于上述公式,研究者推导出了两条定理,划定了一道清晰的分界线。

定理一说的是:对于伤害率足够高的危害类别,存在一个有限的、在预算内可以实现的测试规模n,使得零事故结果能够达到指定的证明力标准。具体来说,如果一类危险行为的真实发生率p超过了某个最低门槛pmin,那么只要测试足够多的提示词(数量由公式计算得出),一份零事故成绩单就可以成为可信的安全证明。这个所需的测试数量大约与1/p成正比,伤害率越高,需要的测试数量反而越少。

以p=1%(即百分之一的提示词会引发危险输出)为例,要让零事故结果的证明力达到"信念向安全方向移动两倍"的标准,只需要138个提示词;要达到"移动十倍",只需要458个;要把错误认证概率压到5%以下,需要299个。目前广泛使用的AdvBench基准测试包含520个提示词,已经超过了以上所有门槛。也就是说,对于这类伤害率在1%左右的危害类别,现有的测试规模是够用的。

但定理二带来了截然相反的结论:对于伤害率低于那个最低门槛pmin的危害类别,无论测试规模多大,只要仍在合理的可行范围内,零事故结果都无法成为有意义的安全证明。这个结论用数学证明得非常干净——当p低于pmin时,即使用尽最大可行的测试预算Nmax,似然比Λ?也始终大于目标阈值τ,意味着"什么都没发生"这个观察结果对高风险和低风险模型来说几乎同样可能出现,完全分不清楚。

从直觉上理解,这就像用一个只有5个测试题的数学考试来判断一个学生是天才还是普通人。如果天才和普通人在这5道题上得分差不多,那么一份满分成绩单对识别天才毫无帮助。伤害率极低的危害类别面临的正是这种困境——即便是高风险模型,在少量测试中碰巧全部通过也是完全正常的。

这个分界线pmin的数学表达式是 -ln(τ) / [Nmax × (1-r)],其中τ是要求的证明力标准,Nmax是最大可行测试规模,r是可接受风险与高风险之间的比值。当最大测试规模为10万次、r=0.5、τ=0.5时,这个分界线约为1.4×10??,即大约每十万次交互中才会出现1.4次危险输出。对于那些真实伤害率低于这个数字的危害类别,无论你的测试包多大,零事故成绩单就是一张白纸。

研究者特别说明,这个结论不是说"现有测试没价值",而是说"对于某些类别的危险,被动测试这条路从根本上就走不通,要换其他方式来做安全认证"。

三、一个出人意料的发现——有时候"发现一次失误"比"什么都没发生"更能说明问题

研究者还发现了一个在直觉上非常反常的规律:零事故成绩单和"发现一次危险输出"这两种结果,各自的证明力会随着伤害率的变化而发生交叉。

假设在n=520次测试中,我们比较两种情况:一次危险输出都没有,以及恰好观察到一次危险输出。乍看之下,一次危险输出听起来更糟糕,但从证明力的角度看,事情要复杂得多。

具体计算表明,在p=1%时,零事故成绩单携带3.779比特的证据,而一次观察到的危险输出只携带2.772比特的证据,零事故成绩单更具说服力,强度约是后者的1.4倍。在p=0.5%时,零事故成绩单的说服力是一次危险输出的2.1倍。

但当p降低到0.1%时,情况翻转了:零事故成绩单只剩0.375比特的证据,而一次危险输出携带了0.625比特的证据,后者反而更说明问题。在p=0.01%时,一次危险输出的证据量是零事故成绩单的25.7倍;在p=0.001%时,这个倍数高达265.6倍。

这个交叉点——零事故成绩单和单次危险输出携带相同证明力的伤害率——研究者称之为"交叉率",公式大约是 ln(1/r) / [2n(1-r)]。在n=520、r=0.5的条件下,这个交叉率约为0.133%,即大约千分之一点三。

为什么会有这种反转?原因在于:当伤害率极低时,即便是真正的高风险模型,在520次测试中也几乎不会出现危险输出,"没出现"这个观察结果对高风险和低风险模型来说同样平常,毫无区分价值。反之,"出现了一次"这个事件本身就很罕见,如果一个低风险模型真的暴露了一次,这件事反而告诉我们一些有用的信息——至少证明了这个模型确实具备产生危险输出的能力。

一次危险输出的证据量最终会收敛到 log?(1/r),即r=0.5时恰好是1比特,而且这个数值与n或p无关。而零事故成绩单的证据量则随着p趋近于零而趋近于零。这是研究中最出人意料的结论之一,也彻底颠覆了"从没发生过坏事就代表安全"的朴素直觉。

四、同一把尺子,量遍所有测试方法——从被动基准到主动红队演练

此前的分析都是针对被动基准测试的——就是提前准备好一批固定提示词,让模型逐一回答。但AI安全领域还有一种更积极的方式:由专业安全研究人员像真实攻击者一样去"攻打"模型,寻找各种漏洞,这叫做"红队演练"(red teaming)。那么这套框架对红队演练也适用吗?

研究者给出了肯定的答案,但需要替换一个关键概念。被动测试中,我们关注的是模型在某类提示词上的"伤害率p",这个数字是模型本身的属性。但实际上,一次评估观察到的结果,不仅仅取决于模型,还取决于测试所用的提示词怎么设计、评分标准怎么制定、测试的威胁场景是什么。换用不同的提示词风格,同一个模型表现出的"伤害率"可能差异巨大。

因此,研究者引入了两个更本质的概念:在高风险模型存在的假设下,某个测试程序能成功引发危险输出的概率q?,以及在可接受风险模型存在的假设下,同一程序能引发危险输出的概率q?。这两个数字合在一起,衡量的是这个测试程序能否有效区分高风险和低风险模型。它们的差距越大,测试程序的区分能力就越强,每次测试携带的证明力就越多。

研究者把这种区分能力定义为每次测试的"辨别度"(κ),公式是 |log?[(1-q?)/(1-q?)]|,单位是比特。在这个框架下,被动基准测试只是q?=pu、q?=ps的特殊情况。

这个替换带来了两个方向相反的启示。一方面,对于区分能力强的测试程序来说,很少几次测试就能积累大量证据。假设q?=0.9、q?=0.1,一次这样的测试就能携带3.17比特的证明力,相当于被动测试在伤害率为千分之一时需要大约4400个提示词才能达到的效果。仅仅两次这样的测试就能达到τ=0.1的证明力标准,三次就能达到τ=0.01。区分能力越强,所需测试越少,这是对精心设计的红队演练的直接数学支持。

另一方面,研究者指出,目前AI安全评估领域普遍使用"攻击成功率"(即q?)作为核心指标,这是个严重的误区。一个程序的q?很高,但如果它的q?也同样高,那么κ接近于零,这个程序对区分高风险和低风险模型毫无帮助。比如一种测试方法在高风险和低风险模型上都能90%的概率引发危险输出,那么它的"零失败"结果几乎什么都说明不了,因为这个结果对两种模型来说同样不可能出现。只看q?而不看q?,就像只知道一道数学题的正确率,却不知道这道题是否真的能区分会和不会的学生。

研究者还特别强调了"测试单元"的定义问题,因为这是最容易被滥用的地方。对于被动基准测试,每个提示词是一个独立的测试单元。但对于适应性的红队演练,测试单元是整个演练过程,而不是演练中的每一个单独提示。一个专家在演练中依次发出100个相互关联的提示词,并根据模型的每一个回答调整下一个提示词,整个过程只能算一次测试,而不是100次。如果把这100个提示词都当作独立测试单元来计算,测试次数就被虚报了100倍,得出的证明力也会虚高同等倍数。研究者认为,这是整个框架最可能被滥用的地方。

五、证明力的门槛从哪里来——决策理论给出的锚点

前面多次提到"证明力门槛τ",但这个数字不是随便定的。研究者用决策理论给出了一个严格的推导方式。

设想一个监管机构面临这样的决策:部署一个可能有安全问题的AI模型,如果模型确实有问题(假设H?为真),代价是C_FN;如果阻止一个其实安全的模型部署,代价是C_FP。最优决策规则是:当部署的预期损失小于阻止的预期损失时就批准部署。这个规则化简后给出:所需的证明力阈值τ = 1 / (L × O?),其中L = C_FN/C_FP是损失比,O?是评估前对模型安全性的先验判断(以赔率形式表达)。

这个公式的方向完全符合直觉:危险越大、误判的代价越高,L就越大,τ就越小,也就是说,一份零事故成绩单需要携带更强的证明力才能支撑部署决定。反之,如果一类危险行为的代价不太大,τ的要求可以适当放宽。

以一个具体场景为例:监管机构认为部署一个真正危险的模型,代价是不必要延迟部署的100倍(L=100),而且从先验来看对安全性没有倾向性判断(O?=1),那么τ=0.01。满足这个标准,在伤害率p=1%时需要915个提示词,在p=0.1%时需要9204个提示词,在p=0.01%时需要92097个提示词。当前最大的公开测试包只有约2100个提示词,在这个标准下,只能覆盖p=1%的场景,p=0.1%已经达不到要求,p=0.01%更是差了将近50倍。

六、现实与理想的距离——八个主流测试包的实际体检结果

理论框架建立好之后,研究者对八个被广泛引用的AI安全评估套件进行了实测分析。这八个套件按规模从小到大分别是:XSTest(250题)、StrongREJECT(313题)、HarmBench(400题)、SORRy-Bench(440题)、AdvBench(520题)、HEx-PHI(330题)、WildGuard(1725题)和SafetyBench(2100题)。

在统计功效方面,假设测试场景是要检测模型伤害率从1%降低50%的改进,最小的XSTest只有14.9%的功效,SafetyBench有59.3%,AdvBench和HarmBench分别是22.6%和18.7%。按照医学临床试验的通行标准,80%功效才算及格,而在伤害率1%这个场景下,没有一个套件达到这个标准,需要大约3679至4670个提示词才能及格。

不过研究者特别指出,统计功效和安全认证是两回事。统计功效衡量的是能否区分两个模型之间的差异,安全认证衡量的是能否给一个模型的伤害率设定一个可信的上限。在p=1%的情况下,七个套件已经足以完成认证任务,尽管它们统计功效都不算高。换句话说,这些测试包在"证明某个模型是安全的"这件事上,比在"比较两个模型孰优孰劣"这件事上表现得更好。

在假阳性认证方面,当真实伤害率为0.1%时,StrongREJECT有73.1%的概率给出假安全认证,AdvBench有59.4%。要把这个概率压到5%以下,需要至少2995个提示词,到1%以下需要4603个,超出了所有被测套件的规模。而在伤害率1%时,只需299个提示词就能满足5%标准,七个套件都轻松满足。

研究者还做了一件很重要的事:分析实际测试包中提示词之间的相关性。理论推导假设每个提示词是独立的测试单元,但现实中,测试包的提示词往往来自少量模板和变体家族,同一家族的提示词之间高度相关。标准的统计修正公式是:有效样本量neff = n / [1 + (m-1)ρ],其中m是平均每个聚类的提示词数量,ρ是组内相关系数。

即使相关性不算太强,影响也非常显著。如果每个聚类有10个提示词、组内相关系数为0.1,有效样本量就只有原来的约52.6%;如果每个聚类25个提示词、相关系数0.1,有效样本量更萎缩到原来的约29%。这意味着,一个名义上有2100道题的测试包,实际的信息量可能只相当于600道独立题目左右。

Anthropic公司Claude 2模型的测试报告提供了一个真实的例子。报告称,在328个提示词中,有4个引发了比固定拒绝更危险的回答。从提示词层面看,k=4/n=328,给出的95%置信区间是0.33%到3.09%,这是一个有参考价值的陈述。但报告同时说明,每个提示词被采样了5次,总共产生了1640个回答,而且在一个被标记的案例中,模型大约有一半的采样结果出现了问题——这描述的显然是高度的组内相关性。真正关键的"每个回答的危险概率"无从计算,因为危险回答的总数没有被单独报告。两套统计数字同时存在,却在暗中支撑不同的结论,而现有的报告标准并不要求明确说清楚用的是哪一套。

七、提示词生态与真实战场的距离——分布有效性的测量

就算统计功效够了、相关性修正做了,还有一个更根本的问题没有回答:这些测试包里的提示词,跟真实用户发给AI的提示词,究竟有多大的距离?

研究者用两种方式来测量这个距离。一种是传统的文本特征方法,把提示词转化为词频向量然后计算相似度;另一种是更现代的语义嵌入方法,用预训练神经网络把每个提示词映射到一个高维向量空间,相近的向量代表语义相近的提示词。

分析对象包括AdvBench(520题)、HarmBench(400题),以及从LMSYS-Chat-1M数据集中随机抽取的9089个真实用户对话。LMSYS-Chat-1M是目前最大的公开真实用户对话数据集,由多所顶尖大学联合发布。

结果相当惊人。两个测试包的提示词在内部彼此非常相似,相似度约为0.18至0.19(满分1分)。但这些测试提示词与真实用户提示词之间的相似度只有0.057至0.055,相差了3.1至3.5倍,而且这个差距在两种测量方法下都一致存在。更有意思的是,两个测试包彼此之间的距离(0.014至0.022),和每个测试包与真实用户提示词之间的距离(0.014至0.020)旗鼓相当——这意味着AdvBench和HarmBench虽然是两个不同的测试工具,却基本上在测同一件事,而且都没有覆盖真实用户的提示词空间。

研究者把这个视觉上的分离通过UMAP降维技术直观地呈现了出来。在这张图里,大量的真实用户提示词形成了一大片密集的蓝色云团,而AdvBench和HarmBench的提示词只是点缀在旁边的几个小小橙色和红色的点,几乎是两个完全分离的世界。

这个发现的逻辑含义非常直白:如果测试分布和部署分布根本不一样,那么在测试分布上观察到零危险输出,对部署分布的危险情况不能做任何推论。严格地说,是一点都不能——因为总是可以构造这样一种情况:危险行为高度集中在测试几乎不覆盖的那部分用户提示词上。

研究者同时指出一个重要的限制:LMSYS-Chat-1M代表的是普通日常用户的对话,而对于灾难性风险(比如生物武器制造指引)来说,真正关键的是"恶意攻击者"这类用户的提示词分布,这部分数据目前完全没有可靠的公开来源。因此,这个发现只是说明现有测试包不代表日常用户,并不能说明它们也不代表真实攻击流量。研究者认为,构建一个规模足够大、包含真实恶意攻击提示词的数据集,是整个领域最紧迫的基础设施任务,优先级高于继续扩大现有测试包。

八、一张填写规范的成绩单——给所有人的测试报告模板

基于以上所有分析,研究者提出了一套最小化的测试报告模板,列出了在一份零事故结果能够被认真对待之前,必须公开的所有信息。

报告必须包含的内容覆盖了多个维度。首先是测试的定义部分:危害类别的名称、该类别对应的威胁场景、使用的是被动提示词集还是主动红队演练、测试的基本单元是每个提示词还是每次演练过程。其次是测试规模的精确数字:独立测试单元的准确数量n、危险输出的准确数量k、每个提示词采样了多少次m、组内相关系数ρ的估计值、有效样本量neff的计算结果。再次是统计推断:基于原始(n,k)的精确Clopper-Pearson置信区间上限、考虑聚类效应的修正置信区间(注意不能把neff代入Clopper-Pearson公式计算,因为neff通常是小数而非整数,这个公式只适用于整数)、预先设定的最小可检测效应量、在这个效应量下的统计功效。然后是证明力的完整核算:证明力阈值τ的来源(损失比L和先验赔率O?)、在高风险假设下测试程序引发危险的概率q?(必须用正对照组测量)、在可接受风险假设下引发危险的概率q?、每次测试的辨别度κ、实现的似然比Λ?。最后是语境信息:测试分布与部署分布的距离、提示词在语义变体间的一致性、已知和未知攻击手法之间的差距、对于危害率是否可能低于不可认证门槛pmin的判断。

对于最后一条,研究者的要求非常直接:如果一类危害的真实发生率很可能低于pmin,那么报告中不应该出现"需要更大的测试包",而应该明确声明"零事故成绩单无法在可行规模内认证这类危害,以下是我们所依赖的其他类型证据"。

研究者审查了九份主流AI公司发布的前沿模型安全报告,包括来自OpenAI(GPT-4和GPT-4o)、Anthropic(Claude系列多个版本)、Google(Gemini系列)和Meta(Llama 2和3)的公开文件。结果发现,只有一份报告同时提供了危险输出的准确分子和分母,而没有任何一份报告披露了分析该数字所需的相关性结构信息。按照上述模板衡量,目前的行业标准与应有的透明度之间存在巨大的差距。

九、四项结构性改革——让安全测试真正有意义

在技术分析的基础上,研究者提出了四项改革建议,构成一个可行的行动方向。

预注册是第一项。在开始评估之前,应当公开登记危害类别、目标可检测效应量、采样策略和决策标准,就像药物临床试验必须在ClinicalTrials.gov注册一样。这能防止事后根据结果调整分析框架,也建立了可供公众查阅的历史记录。

校准报告是第二项。每一份安全报告应当按照危害类别,清晰地说明这次评估在数学上能够支撑的最高层级声明是什么,而不仅仅报告原始的"没发现危险输出"。报告中要明确区分"我们观察到零事故结果"和"这个结果对安全性的证明力是X"。

独立保存的隐藏测试集是第三项。目前的公开测试包存在一个结构性缺陷:一旦公开,研究者和模型开发者都会以各种方式针对这些特定提示词进行优化,测试的实际价值随之下降。应当由独立机构维护一批未公开的测试题库,在严格的访问控制下使用,从根本上解决"测试饱和"问题。

独立评估是第四项。目前所有的安全评估都是由开发模型的公司自己做的,存在明显的利益冲突。独立第三方评估机构应当承担评估设计有效性的审核职能,而不仅仅是复现已有测试——要审核功效是否足够、覆盖是否合理、泛化性是否经过检验。

研究者观察到,METR的能力预评估项目、英国AI安全研究院的模型评估项目以及Anthropic的负责任扩展政策,都已经在朝这个方向推进。但把这些机构的工作映射到三条基本要求上——统计充分性、分布有效性和结构泛化性——会发现它们目前对第三条(结构泛化性)的处理比前两条更为完善。研究者认为这不是意愿问题,而是缺少本研究提供的这类量化框架。

说到底,这篇研究做的事情,其实是把一个长期靠直觉和经验判断的领域,拉到了有数学依据的轨道上。"这个AI安全吗"这个问题本来像一个永远说不清楚的哲学命题,但研究者告诉我们,这个问题可以被分解成若干个可以精确计算的子问题,而这些子问题的答案决定了我们现在能说什么、不能说什么。

那些伤害率在1%左右的危害类别——比如常见的涉暴力、涉诈骗的提示词——现有的测试工具已经足够胜任,只要正确地做了并正确地解读了结果。那些极其罕见但后果灾难性的危害类别——比如协助制造大规模杀伤性武器——则在根本上无法通过"多做测试"的方式来认证安全,必须寻找完全不同的证据来源。

这个区别不是规模上的,而是原则上的。一个监管机构如果接受了一份针对极低频危害类别的零事故报告,而没有审查这份报告背后的数学逻辑,实际上是在被数字的表象所迷惑。这篇研究的最终意义在于:它给了所有相关方——模型开发者、监管机构、公众——一套可以操作的语言,来区分"这个评估结果有意义"和"这个评估结果什么都说明不了"之间的界限。医学界花了几十年、经历了一些惨痛教训才建立起临床试验的功效计算规范,AI安全评估领域希望不必走同样的弯路。

Q&A

Q1:AI安全基准测试的"零事故成绩单"是否意味着AI模型真的是安全的?

A:不一定,关键取决于那类危险行为本身有多罕见。这项研究表明,当某类危害的真实发生率很高(比如约1%),几百个测试题就能让"零事故"结果成为可信的安全证明。但当危害极其罕见(比如百万分之一以下),即便测试了十万次什么都没发生,也几乎说明不了任何问题,因为即使是高风险模型在这么少的测试中碰巧通过也是正常的。简单地说,危害越罕见,"没发现"越没价值。

Q2:AI红队演练和被动基准测试哪个更能证明AI安全?

A:关键不在于哪种方式,而在于这个测试方法能否有效区分"高风险模型"和"低风险模型"。研究者提出用两个数字来衡量:测试程序在高风险模型上引发危险的概率q?,以及在低风险模型上引发危险的概率q?。两者差距越大,区分能力越强,测试价值越高。一个设计精良的红队演练,区分能力可以极强,一两次就能顶得上被动测试数千次的证明力。但如果测试程序对安全和不安全的模型成功率差不多,那无论成功率多高,对判断安全性都毫无帮助。

Q3:为什么AI安全报告中"只看到几次危险输出"有时候比"完全没有危险输出"更能说明问题?

A:这个反直觉的结论源于概率推理。当某类危险行为本身非常罕见时,即使是真正的高风险模型在少量测试中也基本不会暴露,所以"什么都没发生"对区分高风险和低风险模型没有帮助。但"偶尔出现了一次危险输出"这件事本身很罕见,它至少证明了模型具备产生这类输出的能力,而且用数学计算可以得出,随着危害率趋近于零,单次危险输出所携带的证据量趋近于一个固定正数,而零事故成绩单的证据量则趋近于零。两者的交叉点在危害率约千分之一处。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
看完张丹丹的工作经历,就知道一个北大教授为何能说出那么荒唐的话了!原来她光写材料,光开会,活在文献堆和PPT里了!

看完张丹丹的工作经历,就知道一个北大教授为何能说出那么荒唐的话了!原来她光写材料,光开会,活在文献堆和PPT里了!

谭谈社会
2026-08-22 13:29:36
特朗普的梦里,这些地方都应该是美国的领土

特朗普的梦里,这些地方都应该是美国的领土

News脑洞
2026-08-22 19:09:42
飞机起飞后才敢官宣移民美国:安踏前CEO徐阳的“体面告别”

飞机起飞后才敢官宣移民美国:安踏前CEO徐阳的“体面告别”

天天热点见闻
2026-08-22 09:08:20
美国估计也蒙了!年初抓马杜罗中国没翻脸,后来炸伊朗中国也没出兵,北京到底在下一盘多大的棋?!

美国估计也蒙了!年初抓马杜罗中国没翻脸,后来炸伊朗中国也没出兵,北京到底在下一盘多大的棋?!

扶苏聊历史
2026-08-22 13:21:54
时隔12年挺进决赛!中国U18男篮大胜复仇新西兰 剑指队史第12冠

时隔12年挺进决赛!中国U18男篮大胜复仇新西兰 剑指队史第12冠

颜小白的篮球梦
2026-08-22 20:49:39
经济学家马光远:根据国际经验,房地产再回到上一轮高点需要10年

经济学家马光远:根据国际经验,房地产再回到上一轮高点需要10年

史之铭
2026-08-22 18:13:05
恒大还有两个关键人物在瑟瑟发抖...

恒大还有两个关键人物在瑟瑟发抖...

地产人言
2026-08-21 00:43:06
字节跳动:被罚 27 亿

字节跳动:被罚 27 亿

云头条
2026-08-22 14:31:44
三孩均非亲生案正式开庭!妻子清纯样貌曝光,丈夫披露八年婚姻全部细节

三孩均非亲生案正式开庭!妻子清纯样貌曝光,丈夫披露八年婚姻全部细节

老猫观点
2026-08-22 08:32:59
惨败36分!连续无缘两届世界杯,日本男篮怎么了?

惨败36分!连续无缘两届世界杯,日本男篮怎么了?

德译洋洋
2026-08-22 12:08:56
李一桐被毒虫咬了脸,发文“求解药”

李一桐被毒虫咬了脸,发文“求解药”

韩小娱
2026-08-22 19:55:42
城市套路深啊!网传有成人用品店老板娘以约会为诱饵,诱导对方到自家无人售货机消费,完成下单之后便拉黑失联

城市套路深啊!网传有成人用品店老板娘以约会为诱饵,诱导对方到自家无人售货机消费,完成下单之后便拉黑失联

火山詩话
2026-08-22 07:04:13
三局鏖战71分钟!圣坛组合2-1逆转过关,连续两年跻身世锦赛决赛

三局鏖战71分钟!圣坛组合2-1逆转过关,连续两年跻身世锦赛决赛

全景体育V
2026-08-22 21:00:03
俄外长警告英“参战”后果,英首相回应:将百分之百支持乌克兰

俄外长警告英“参战”后果,英首相回应:将百分之百支持乌克兰

流史岁月
2026-08-22 11:02:16
陕西一13岁男孩被两名成年男子掌掴致伤,其中一人系民警,两人被行政拘留10日

陕西一13岁男孩被两名成年男子掌掴致伤,其中一人系民警,两人被行政拘留10日

极目新闻
2026-08-22 17:14:35
炸裂!亚航排泄事件后续:阿姨自曝原因,目击乘客发声,厕所就在5米远

炸裂!亚航排泄事件后续:阿姨自曝原因,目击乘客发声,厕所就在5米远

小鋭有话说
2026-08-22 11:45:05
歼-16机群一到,中东各国打开领空放行,7千公里一路畅通无阻

歼-16机群一到,中东各国打开领空放行,7千公里一路畅通无阻

近史博览
2026-08-22 06:20:06
中超激烈冲突!彭欣力推人被罚下,马德鲁加染红暴怒,怒怼郑智遭围攻

中超激烈冲突!彭欣力推人被罚下,马德鲁加染红暴怒,怒怼郑智遭围攻

奥拜尔
2026-08-22 22:04:27
曼联连续2年开门黑!英超时代首轮首负升班马 45岁卡里克跌落神坛

曼联连续2年开门黑!英超时代首轮首负升班马 45岁卡里克跌落神坛

我爱英超
2026-08-22 21:27:30
河南20岁女孩求职接连被拒,意外发现7年前被误登记为精神分裂症

河南20岁女孩求职接连被拒,意外发现7年前被误登记为精神分裂症

新京报
2026-08-22 17:47:25
2026-08-22 22:28:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4513831文章数 9344关注度
往期回顾 全部

科技要闻

苹果裁员200人:Vision Pro砍游戏团队

头条要闻

"高铁零食占座"女孩母亲:没请到假 儿童不能单独购票

头条要闻

"高铁零食占座"女孩母亲:没请到假 儿童不能单独购票

体育要闻

枪手赚翻!4000万新援揭幕战8分钟策动2球

娱乐要闻

《空枪》预测票房缩水,手握王炸都没赢

财经要闻

蔡昉解读经济:扩大消费需求的政策思考

汽车要闻

最能代表东方神韵的新旗舰 体验面子里子都拉满的比亚迪大汉

态度原创

本地
房产
旅游
健康
家居

本地新闻

《牛来》的一声“妈妈”,到底多少人被精神污染了

房产要闻

两大热盘即将入市!三亚又一批安居房狠货要炸场了!

旅游要闻

客流集聚、民宿满房,这里的“凉资源”如何变身“热产业”?

“矫正神器”真能治好脊柱侧弯吗?

家居要闻

2026建博会(广州) 公装联探展交流活动

无障碍浏览 进入关怀版