网易首页 > 网易号 > 正文 申请入驻

我们能不能挡住AI生成的灾难视频

0
分享至


2026年初,如果你在社交媒体上刷到一段战场画面,一段空难现场,或者一段疫情封城的街景视频,你会不会毫不犹豫地相信它是真的?

这不是一个假设性的问题。就在几个月前,AI视频生成模型已经进化到能够仅凭一张照片就生成一段几秒钟的动态视频,画面里的烟雾会飘散,火光会跳动,人群会走动,连镜头的抖动感都做得以假乱真。研究者们把一堆真实的灾难视频和AI生成的对应版本放在一起做了个小测试,让人猜哪个是真的哪个是假的。结果很多人都猜错了。

这篇论文的题目直白得让人心里一紧,我们真的能防住AI生成的视频攻击现实世界危机事件吗。答案不算乐观,一群来自新加坡国立大学、加州大学伯克利分校、香港科技大学等十几所机构的研究者们联合做了一次相当彻底的调查,他们造了一个专门的测试集,把市面上能找到的检测方法几乎都拉出来溜了一遍,结果发现,没有一种方法能稳定地识别出这些伪造视频。这篇文章想把这件事讲清楚,讲清楚问题出在哪,讲清楚为什么这件事比想象中难得多。

问题到底难在哪

先说一个背景。过去几年,关于"怎么检测AI生成的视频"这个课题,学术界已经发表了不少研究,也造了不少测试集,比如GVF、GenVideo、GenVidBench这些。这些测试集通常的做法是,从网上随便扒一批视频,比如做饭的、跳舞的、风景的,然后用生成模型造出对应的假视频,拿去训练和测试检测器。

问题是,这些测试集里几乎没有专门针对"真实世界危机事件"的内容。战争、灾难、公共卫生突发事件,这些恰恰是最容易被拿来做谣言的题材,因为它们天然带有情绪冲击力,容易在社交媒体上疯狂转发。可现有的测试集偏偏没怎么覆盖这块。

这就好比你要测试一个门锁的防盗能力,但测试的时候只拿普通的钥匙去试,没试过专业撬锁工具。锁看起来很结实,可一旦真正的窃贼上门,后果完全是另一回事。危机事件视频和普通视频的生成难度、传播路径、造假动机都不一样,拿普通视频测出来的检测器性能,不能简单地套用到危机场景里。

于是研究团队决定自己动手,造一个专门针对这类场景的测试集,他们管它叫RA-Bench。

> **RA-Bench**:Real videos as Anchors的缩写,意思是"以真实视频作为锚点"的基准测试集,专门用来评估AI生成视频检测器在真实危机事件场景下的表现。

这个名字本身就透露了设计思路,不是简单地堆一堆真视频和假视频,而是让每一个真实视频都成为一个"锚",生成模型围绕这个锚去伪造对应的假视频,这样真假配对更加紧密,测试也更有针对性。

RA-Bench是怎么造出来的

整个数据集的构建过程分成五个阶段,挺讲究的,咱们一步步看。

第一步是收集真实素材。研究团队从政府机构、公共媒体资源库、新闻平台这些渠道,收集了675段描绘真实世界危机和重大社会事件的视频。这些视频被归到10个大类,44个细分小类里,大类包括天气自然灾害、战争冲突、政治治理、公共安全、事故基建故障、经济社会恐慌、公共卫生、科技、太空探索,以及大型公共活动。

值得说一句的是,他们没有强行给每个类别设定相同的配额。因为如果人为地让每个类别数量均等,反而会扭曲现实中这些危机事件的自然分布比例,让测试结果脱离真实的部署场景。这就像做民意调查的时候,你不能为了凑数据好看就人为地把各个年龄段的样本数拉平,现实世界里人口结构本来就是不均匀的,硬拉平反而失真。

第二步是自动预处理。675段原始视频被用场景切割工具切成了5774个可审核的短片段。因为相邻的镜头往往内容重复度很高,团队还专门用一个预训练的图像识别网络做了近重复片段的初筛,把可能重复的片段标记出来,交给后续人工审核。

> **PySceneDetect**:一个开源的视频场景切割工具,能够检测视频中的镜头切换点,把长视频自动分割成一个个独立的短片段。

第三步是人工审核,而且是两轮审核。第一轮由七名志愿者对5774个片段逐一评估,标准包括画面质量、是否符合分类主题、时长是否合适、是否重复、是否涉及隐私风险等等。每个片段由两名审核员独立判断,给出保留、拒绝或者不确定三种意见。如果两人意见不一致,或者有人标了不确定,这个片段就会被送到第二轮,由另外四名审核员做最终裁决。

这套流程听起来繁琐,但背后的逻辑很实在。一个片段到底该不该被收进测试集,这个判断本身带有主观性,一个人可能觉得画质够用,另一个人可能觉得不够,两轮审核加交叉验证,是为了尽量把主观误差磨平,让最终留下来的样本质量有个基本保障。这有点像法庭审判要有陪审团而不是一个法官说了算,不是因为一个人一定会犯错,而是多人交叉判断能显著降低系统性偏差。

经过这两轮审核,5774个片段里有2426个被保留下来。

第四步是后处理。团队把这2426个片段的时长统一规整到3到15秒之间,太短的直接舍弃,太长的截断。然后统一用H.264编码格式重新编码,这一步很关键,因为如果真实视频和生成视频用不同的编码格式,检测器很可能偷懒去学编码格式的差异,而不是真正学会识别内容本身的真假,这样测出来的准确率就是虚高的假象。

接着团队还做了同质化剪枝,去除来自同一个视频源里过于重复的片段,并对每个视频源的版权授权情况做了核实登记。经过这一系列操作,最终留下1830个片段,来自338个不同的视频来源,总时长大约5.1小时,平均每个片段10.08秒。

第五步,也是整个流程里最有意思的一步,是配对生成假视频。

用真实的第一帧去骗AI造假

这一步的设计思路,是整篇论文里我觉得最值得细讲的地方。

团队没有随便找个提示词就让AI生成视频,而是先用Gemini-3.1-Pro-Preview这个大模型,给每一段真实视频生成一段结构化的详细描述,包括画面主体、背景、镜头运动方式、拍摄风格、动作过程等等。然后再把这段描述转换成一句通用的英文生成提示词,这句提示词会被原封不动地发给所有参与测试的生成模型。

> **I2V**:Image-to-Video的缩写,指的是图像到视频的生成方式,也就是给AI一张静态图片和一段文字描述,让它生成一段动态视频,视频的第一帧通常就是那张输入图片。

关键的设计是,每个生成模型除了拿到这句提示词,还会拿到真实视频的第一帧画面作为条件输入。这意味着生成出来的假视频,开头那一帧和真实视频一模一样,后面的内容才是AI凭空编出来的。

这个设计模拟的是一个非常现实的造谣场景。想象一下,有人拍到了一张真实的火灾现场照片,这张照片是真的,没有任何疑点,但如果有人拿这张照片去喂给AI视频生成工具,让它续写接下来发生的事,比如火势蔓延、建筑坍塌、人群逃散,生成出来的视频前几帧和真实照片完全吻合,后面的内容却是彻底编造的。这种造假方式比凭空生成一整段视频要阴险得多,因为它有一个真实的锚点作为信任背书,观众看到开头是真的,很容易默认整段视频都是真的。

如果不这样设计会怎样。如果生成的视频完全脱离真实素材,只是根据文字描述凭空生成,那么这段假视频和真实世界的关联性会弱很多,传播时也更容易被识破,因为它缺少一个可以让人产生初始信任的锚点。真正危险的造假手法,恰恰是这种嫁接式的,拿一部分真实证据去撑起一整段虚构内容的骗局,就像伪造文件时最狡猾的做法不是从头到尾全部编造,而是拿一份真实的官方文件盖章页去嫁接一份编造的正文,真章假文,才最容易骗过审查。

生成视频的时长也做了精心设计,团队让生成时长与对应真实片段的时长成正比,同时限制在2到8秒的范围内,这样能防止检测模型偷懒学到"时长固定就是假的"这种捷径式判断规则。

最终,团队用了四个开源生成模型和五个闭源商业生成模型(比如Kling、Runway、Seedance2.0、Hailuo这些市面上知名的产品),一共生成了16056段假视频。加上1830段真实片段,整个RA-Bench测试集总共有17886段视频。

检测器到底靠不靠谱

数据集造好了,接下来就是重头戏,拿现有的检测方法去跑一遍,看看效果如何。

研究团队把检测方法分成三大类,分别测试。

第一类是传统检测器,一共测了七种,包括CNNSpot、NPR、UnivFD、ForgeLens这些针对图像层面伪造痕迹的检测方法,以及DeCoF、D3、ReStraV这些专门针对视频时序信息的检测方法。

> **AUC**:Area Under Curve的缩写,是评估分类器性能的常用指标,数值范围从0到100%,50%代表和随机猜测差不多,数值越高说明检测器区分真假的能力越强。

结果非常打脸。这七种检测器在公开的参考数据集上,AUC分数普遍在67.6%到98.6%之间,听起来挺唬人。但把它们放到RA-Bench上一测,分数直接跌到43.9%到57.3%,有26个检测器与生成源的组合,AUC甚至低于50%,这意味着这些检测器给假视频打的"造假概率分"比给真视频打的还低,相当于反着来都比它准。

更麻烦的是排名的崩塌。原本在公开测试集上排名第二的UnivFD,在RA-Bench上掉到了第六;原本排名垫底的NPR,反而爬到了第三。这不是简单的整体性能下降,而是整个排位洗牌了。这就像一群运动员在熟悉的主场比赛拿了好名次,换到一个陌生的客场比赛,不仅成绩普遍变差,连原本的名次顺序都乱了套,说明他们的实力评估本身就是有偏差的,只是特别适应主场环境而已。

第二类是零样本多模态大模型,团队测了包括Qwen3.5系列、Qwen3.7-Plus、Gemini-3.1-Pro-Preview、GPT-5.5在内的十种模型,用了三种不同的提问方式。

> **零样本**:指模型没有经过针对这个具体任务的专门训练,直接靠通用能力去完成任务,这里指的是没有专门训练过识别AI生成视频的大模型,直接靠常识去判断真假。

结果显示,即便是表现最好的Gemini-3.1-Pro-Preview,整体的BAcc(平衡准确率)也只有63%左右,而且这个数字在不同生成源上波动很大,在LTX这个生成源上能达到74.5%,但在Seedance2.0上只有54.3%,相差整整20个百分点。

更奇怪的现象是,同一个模型,换一种提问方式,判断倾向会完全反转。比如Qwen3.5-0.8B这个模型,用二选一的简单问法时,只把19.7%的假视频判定为假,但换成让它打分诊断的问法,这个比例一下子飙升到97.8%,再换成连续打分的问法,几乎100%都判成假的。同一个视觉输入,同一个判断任务,仅仅因为提问的措辞不同,结果就能天差地别。

这说明什么。说明很多模型其实没有真正学会"辨别真假"这件事,它们学到的更像是"在某种提问句式下,该给出什么样的回答倾向"。这就好比考试的时候,有的学生不是真正理解了知识点,而是摸清了出题老师的出题习惯,老师喜欢考选择题他就能蒙对,换成简答题立马露馅。表面上看两次都是同一个学生在考同一个知识点,但实际上他考察的根本不是知识本身,是对题型的适应。

第三类是专门针对AI生成视频检测微调过的大模型,测试了Skyra-SFT、Skyra-RL和BusterX++这三个系统。

> **微调**:指在通用大模型的基础上,用针对性的数据继续训练,让模型专门擅长某个具体任务,这里是专门用AI生成视频检测数据训练过的模型。

这一部分的发现相当耐人寻味。Skyra系列模型在官方推荐的使用方式下,表现看起来相当不错,平均BAcc能到68.5%到69.5%。但研究团队做了一个很聪明的对照实验,他们发现Skyra模型接收视频帧的时候,每一帧上都会带一个绝对时间戳标签,而这个时间戳里藏着一个巨大的漏洞,官方训练数据里,凡是视频最后一帧时间戳恰好是5.00秒的,有超过一半的概率是假视频,而在另一个基准测试集里,这个比例甚至高达99.9%。

也就是说,模型可能压根没有认真去看视频内容,它学会了一个投机取巧的规律,只要看到最后一帧标着5.00秒,就倾向于判断这是假的。研究团队做了个简单的实验来验证这个猜测,把绝对时间戳换成纯粹的帧序号标签(比如"第1帧""第2帧"),视觉内容完全不变,只是去掉了具体的秒数信息。结果模型的平均BAcc直接从68.5%掉到54.4%,几乎跌回随机蒙的水平。

这个发现让我想起了一个经典的机器学习笑话式案例,曾经有个模型号称能从X光片里识别病情严重程度,后来发现它其实是在学习照片里医院设备型号的差异,因为病情严重的病人更可能被转诊到设备更先进的医院拍片,模型学的根本不是医学特征,是设备铭牌。如果不做这种反事实验证,你永远不知道模型学到的到底是真本事还是投机取巧的捷径,而这种捷径在真实世界的实战场景里往往完全失效,因为造假者根本不会按照训练数据里那种巧合的时间戳规律去生成视频。

BusterX++这个模型则表现出另一种问题,它几乎对所有视频都倾向于判断为真,在九个生成源上,它把假视频正确识别出来的比例只有4.1%到9.1%,却把93%以上的真视频判断对了。这不是它擅长分辨真假,而是它学会了一个偷懒策略,无脑说"这是真的",在真实视频占多数的场景里,这样蒙也能拿到不错的整体准确率,但对于检测系统来说,这恰恰是最危险的失效模式,因为它意味着几乎所有的假视频都会被放过。

什么样的视频更难被识破

除了测试检测器本身的表现,团队还深入分析了,到底是什么因素让某些生成视频特别难被识别。

他们用了一套叫VBench++的评测工具,给所有16056段生成视频打分,评估维度包括画面质量、动作流畅度、与原始条件图片的一致性等等。

> **条件保真度**:指生成视频的画面内容和用来生成它的那张初始图片之间的一致程度,一致性越高,说明生成的视频越贴近真实素材的视觉风格。

分析发现,条件保真度和时序一致性越高的视频,越难被Gemini这样的多模态大模型识破,一个条件保真度提升50个点的视频,能让Gemini的诊断式判断里假视频识别率下降14.4个百分点。这个道理很直白,如果生成的视频画面风格、光影、材质都和真实素材高度吻合,那么留给检测器抓辫子的破绽自然就少了。

但有意思的是,传统检测器对这套逻辑并不买账。传统检测器的平均表现受动态内容的影响几乎为零,反而是画面质量分数和主体一致性这些指标对它的影响更大。这说明不同的检测器家族,压根不是在看同一件事,Gemini这类大模型可能更关注画面是否"看起来像真实拍摄",而传统检测器可能在捕捉一些更底层的像素级统计特征。

另一个关键发现和条件输入的"真实成分"有关。团队用同一批1830个提示词,分别测试了纯文字生成视频、只用第一帧真实图片作为条件的生成视频,以及同时用第一帧和最后一帧真实图片作为条件的生成视频。结果显示,给的真实条件越多,微调过的检测大模型就越容易把它误判成真视频,从纯文字生成到只用首帧条件,微调模型的平均假视频识别率从70.5%骤降到42.7%,再加上尾帧条件后,进一步跌到28.3%。

这个结果其实揭示了一个挺让人担忧的矛盾。造假者提供的真实素材越多,伪造的视频反而越难被抓,这意味着那种"拿一张真实照片去嫁接AI续写内容"的造假手法,恰恰是最难防的一种,因为它天然占据了更多"看起来真"的优势。而传统检测器对这个维度不太敏感,变化方向甚至不统一,有的检测器分数升高,有的降低,没有一致的规律。

值得一提的是,研究团队还专门测试了改变生成时用的随机种子会不会影响检测结果,答案是不会,换三个不同的随机种子,检测器的表现只会有极小幅度的波动,这说明前面发现的种种规律,不是某次生成运气好或运气差造成的偶然现象,而是相对稳定的系统性规律。

人也会被骗

技术层面聊得差不多了,咱们再看看人类自己的表现如何。

研究团队组织了20名审核员,对RA-Bench里的视频做真假判断,每段视频三选一,标注为真、不确定或者假,而且审核过程中真假视频是随机混排的,审核员完全不知道当前看的视频来自哪个生成模型。

结果显示,审核员平均能把60.3%的假视频判断为假,听起来还凑合,但拆开来看差异巨大。开源生成模型造出来的假视频,审核员平均能识破68.6%,而闭源商业生成模型造出来的假视频,识破率只有52.9%,其中Seedance2.0和Kling这两个模型生成的视频最难被识破,识破率只有40.7%和45.1%。

更值得警惕的是,真实视频也有22.8%的判断被误标为假的。也就是说,真实拍摄的危机事件画面,有超过五分之一的概率被人当成AI造假,这对新闻传播和公众信任是一个相当致命的问题。

基于这个发现,团队做了一个更狠的筛选,他们找出了那些被三名审核员全部误判为真的假视频,一共1080段,再让另外两名独立审核员复审一遍,只有同时被这两名审核员也判断为真的视频才会留下来,最终留下633段,这些视频形成了一个专门的挑战集,叫做RA-Bench-HumanProof。

> **RA-Bench-HumanProof**:从RA-Bench里筛选出的一个子集,包含633段AI生成的视频,这些视频被五名不同的独立审核员全部误判为真实视频,用来专门测试检测器在人类都识破不了的情况下能否发挥作用。

这个名字翻译过来大概是"人类过滤剩下的难题",意思是这些视频已经骗过了所有人类审核员,接下来看看AI检测器能不能力挽狂澜。

结果相当不理想。在这633段人类都判断错误的视频上,Gemini的两种判断方式的BAcc都只有54%左右,几乎和随机猜测没什么区别,七个传统检测器的平均AUC只有47.5%,同样接近随机水平。就连那个之前依赖时间戳漏洞的Skyra模型,去掉时间戳漏洞之后也只剩53.7%的BAcc,BusterX++更是只识别出了3.9%的假视频。

这个结果意味着,那些能骗过人眼的假视频,同样也能骗过现有的检测器,人类的失误和机器的失误发生在同一批视频上,这个重叠恰恰是最危险的地带,这些视频一旦流出,不管是靠人工审核还是靠自动化检测系统,都拦不住。

视频在传播路径上会怎样变化

最后一个实验环节,研究团队考虑了一个更贴近现实的问题,视频在社交媒体传播过程中,通常不会保持原始的高清标准格式,而是会经历压缩、转码、加水印、降低帧率这些处理,那检测器在这种"降质"之后表现会怎样?

为此他们专门造了一个模拟社交传播链路的测试环境,叫做RA-Bench-LastMile,涵盖150个真实事件锚点和对应的九个生成源视频,模拟的处理步骤包括常见的VP9转H.264格式转码、画面尺寸减半的降采样、帧率降到8帧每秒,以及加上一个仿真的新闻台标水印。

> **VP9转H.264**:这是两种不同的视频压缩编码标准,VP9常用于网络流媒体,H.264是更通用的传输格式,社交媒体平台在处理用户上传的视频时经常需要做这种格式转换。

结果显示,传统检测器的平均AUC从原始状态的51.4%降到全套处理后的47.3%,降幅看起来不算太大,但检测器的排名彻底洗牌了,原始状态和全套处理后的排名相关性只有0.07,几乎等于重新洗牌。

而微调过的检测大模型受到的冲击要严重得多。五种微调配置的平均假视频识别率,从原始状态的46.0%,一路跌到全套处理后的仅仅1.4%。这个数字意味着什么,意味着如果一段生成的假视频经过了社交媒体常见的压缩传播链路,几乎所有这些检测大模型都会把它误判为真实视频。

拆解开来看,画面降采样这一步的影响最大,单独这一项就能让平均假视频识别率从29.9%骤降到7.9%。降低帧率的影响则表现出和之前一样的模式,对依赖绝对时间戳的Skyra配置影响特别大,BAcc下降11.7到12.9个百分点,而去掉时间戳依赖的对照版本只下降2.4到3.4个百分点,进一步印证了这些模型对时间信息的过度依赖。

加水印这个操作单独看也很有意思,尽管画面内容本身完全没变,只是右上角多了一个模拟新闻台标,但这个改动让假视频识别率从29.9%降到14.0%,同时让真视频识别率从79.1%升到88.5%。这说明模型在某种程度上把"带新闻台标"这个表面特征和"这是真新闻"划上了等号,这恰恰是造假者最容易利用的漏洞,因为伪造一个新闻台标的成本几乎为零。

表格里的关键数字

咱们把前面讲的核心数据整理一下,方便对照:

传统检测器在公开参考数据集上的AUC区间是67.6%到98.6%,而在RA-Bench上跌到43.9%到57.3%,这是全篇最扎眼的数字对比。

微调过的检测大模型,把时间戳换成帧序号后,BAcc只剩54.4%到54.9%,而BusterX++的假视频识别率只有4.1%到9.1%。

人类审核员对开源生成模型的假视频识破率是68.6%,对闭源商业模型的假视频识破率是52.9%,其中Seedance2.0最难识破,只有40.7%。

在RA-Bench-HumanProof这批人类都判断失误的挑战视频上,Gemini的BAcc只有54.7%和54.5%,七个传统检测器的平均AUC是47.5%。

在模拟社交传播的完整处理链路下,微调大模型的平均假视频识别率从46.0%骤降到1.4%,几乎全部失效。

这些数字连起来看,勾勒出的是一个相当悲观的结论,现有的检测手段,不管是老派的图像特征分析,还是新潮的多模态大模型,都没有做好准备去应对真正逼真、真正经过精心设计、并且经过传播链路处理的AI生成危机视频。

那接下来怎么办

论文的作者们没有停留在指出问题上,他们提出了几个值得关注的方向。

一个思路是不要指望单一检测器包打天下,而是把多个检测器和取证工具组合起来,做成一种模块化或者智能体式的协作系统,让不同的检测手段互相印证、互相补足各自的盲区。

另一个思路是把重心放在提升多模态大模型的可解释性上,现在这些模型给出的判断理由本身可信度还有待验证,得先建立起评估这些"解释"是否靠谱的基准,才能进一步用它来指导检测系统的设计。

还有一个挺有意思的方向叫主动水印。

> **主动水印**:在视频生成的过程中,主动嵌入一些人眼看不见但机器可识别的标记信号,这样后续检测的时候不需要靠分析画面内容去猜测真假,而是直接检测这个嵌入的标记是否存在。

这个思路的逻辑是,与其被动地去猜一段视频是不是AI生成的,不如让生成模型在造出视频的那一刻就主动打上一个隐藏标记,这样后续检测直接扫描这个标记就行,不用再和造假者玩猫鼠游戏。这有点像纸币上的防伪水印,与其让售货员练就火眼金睛去辨认假钞的纸质和印刷细节,不如从造币厂那一步就嵌入一个专业设备才能识别的防伪特征,这样识别的可靠性和效率都会高得多。

论文里还提到,随着像Seedance2.0这样的模型开始原生生成带音频同步的视频内容,未来的检测研究恐怕也得从纯视觉扩展到音视频联合分析,单靠画面已经不够了。

写在后面

读完这篇论文,最让我意外的一点是,那个关于时间戳的发现。一个专门为了检测AI生成视频而训练的大模型,竟然在悄悄利用训练数据里一个和内容真假毫无关系的巧合规律,只因为最后一帧标着5.00秒就倾向于判假。这个细节让我重新想了一遍,任何一个看起来准确率很高的AI系统,如果没有人专门去做这种反事实的拆解实验,你根本不知道它学到的是真本事还是一个隐藏的投机取巧的捷径。这个套路其实到处都是,只是很少有人愿意花这个功夫去验证。

另一个让我一直琢磨的地方是,给的真实素材越多,生成的假视频反而越难被识破,这个规律听起来有点反常识。我们通常会觉得,造假嫁接的真实成分越多,应该越容易在细节上露馅才对,但实验数据恰恰相反。这可能说明,现在的检测方法本质上还是在找"AI生成痕迹",而不是在验证"这段内容有没有事实依据",这两件事听起来接近,其实是完全不同的两套逻辑,前者关心的是像素统计规律,后者关心的是叙事的真实性,而现在几乎所有检测器做的都是前者。

这篇论文没有解决的问题,恰恰是它自己在文章末尾也承认的,现实里的造假往往不只是单纯的视频生成,还会叠加剪辑拼贴、伪造字幕、编造上下文这些多层手法,这篇论文测的是每个环节单独拿出来的效果,真实世界的造假流程会不会把这些环节串起来产生更强的叠加效应?这个问题目前还没人给出答案。

Q&A

Q1:RA-Bench是什么?

A:RA-Bench是一个专门用来评估AI生成视频检测能力的基准测试集,包含1830个真实世界危机事件视频和16056个AI生成的对应假视频,涵盖战争、自然灾害、公共卫生等10个社会风险类别,是目前首个专门针对真实危机事件场景设计的检测评估数据集。

Q2:现有的AI生成视频检测器为什么在RA-Bench上表现这么差?

A:因为这些检测器大多是在普通生活场景视频上训练和测试的,没有见过针对真实危机事件的精心伪造视频。测试结果显示,传统检测器的准确率从公开参考数据集的67.6%到98.6%,跌到RA-Bench上的43.9%到57.3%,而且不同检测器之间的排名也大幅变化,说明它们并没有学到真正通用的辨别真假的能力。

Q3:什么是RA-Bench-HumanProof,为什么它特别重要?

A:RA-Bench-HumanProof是从RA-Bench里筛选出的633段视频,这些视频被五名独立审核员全部误判为真实视频。在这批视频上,现有检测器的表现也几乎接近随机猜测,说明能骗过人眼的假视频,同样能骗过AI检测系统,这个重叠是当前AI生成视频防御体系里最危险的盲区。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
626 天王者归来!曼联弃将涅槃重生!彻底征服老特拉福德

626 天王者归来!曼联弃将涅槃重生!彻底征服老特拉福德

奶盖熊本熊
2026-08-31 07:04:02
景甜隐性的三观负面影响,堪比"彭宇案”

景甜隐性的三观负面影响,堪比"彭宇案”

人格志
2026-08-30 18:33:22
巴萨捡漏签下枪手锋线弃将,曼城昔日巨星,价廉物美仅需1000万欧元

巴萨捡漏签下枪手锋线弃将,曼城昔日巨星,价廉物美仅需1000万欧元

零度眼看球
2026-08-31 06:52:18
谁给你的自信?渡边:我们要向外界证明,日本男篮是亚洲最强队伍

谁给你的自信?渡边:我们要向外界证明,日本男篮是亚洲最强队伍

移动挡拆
2026-08-30 23:25:38
上海一名36岁男子妻子离世,独自抚养一双儿女,岳母主动提出

上海一名36岁男子妻子离世,独自抚养一双儿女,岳母主动提出

王二哥老搞笑
2026-08-31 00:57:37
比劳动仲裁狠100倍!星宇以为员工要仲裁,结果人家反手告到欧盟

比劳动仲裁狠100倍!星宇以为员工要仲裁,结果人家反手告到欧盟

江启
2026-08-28 07:11:43
日本不是第一?近代史对中国伤害最深的5个国家,排名出乎意料!

日本不是第一?近代史对中国伤害最深的5个国家,排名出乎意料!

老达子
2026-08-28 06:40:06
亚锦赛丢冠,中国女排落泪,最大责任人出炉,三大失误浮出水面

亚锦赛丢冠,中国女排落泪,最大责任人出炉,三大失误浮出水面

南海浪花
2026-08-30 22:08:06
逃到海外3年,丁玉梅再迎噩耗,原来许家印还给她留了一张底牌

逃到海外3年,丁玉梅再迎噩耗,原来许家印还给她留了一张底牌

乐天闲聊
2026-08-27 09:53:36
法布雷加斯盛赞科莫客胜那不勒斯:所有球员都是英雄

法布雷加斯盛赞科莫客胜那不勒斯:所有球员都是英雄

懂球帝
2026-08-31 04:05:52
中国女排遭泰国逆转亚锦赛摘银,无缘提前锁定洛奥席位

中国女排遭泰国逆转亚锦赛摘银,无缘提前锁定洛奥席位

澎湃新闻
2026-08-30 21:26:05
闹大了!清华美院又乱画英雄人物,宇航员浑身肥肉,官媒亲自下场

闹大了!清华美院又乱画英雄人物,宇航员浑身肥肉,官媒亲自下场

就一点
2026-08-27 01:20:28
米粉被检出甲醛,香港呼吁:不要食用,停止出售

米粉被检出甲醛,香港呼吁:不要食用,停止出售

21世纪经济报道
2026-08-30 14:45:26
冯坤现状:在泰国生活很安稳,儿子长的很像她,成泰国女排团宠

冯坤现状:在泰国生活很安稳,儿子长的很像她,成泰国女排团宠

手工制作阿歼
2026-08-29 01:13:37
我退休旅游五年,走遍全国后才发觉:旅行对老年人来说,真没啥意义

我退休旅游五年,走遍全国后才发觉:旅行对老年人来说,真没啥意义

心理观察局
2026-05-18 11:38:19
陈建斌蒋勤勤送儿子去美国读书,5个人包车14天,总共花费49000元

陈建斌蒋勤勤送儿子去美国读书,5个人包车14天,总共花费49000元

小椰的奶奶
2026-08-30 00:37:29
米尔斯海默:美国对伊朗已无军事牌可打,手段用尽伊朗仍屹立不倒

米尔斯海默:美国对伊朗已无军事牌可打,手段用尽伊朗仍屹立不倒

自愈小日子
2026-08-30 03:14:49
突然,猛烈抛售!“大风暴”来袭!欧洲大国,发生了什么?

突然,猛烈抛售!“大风暴”来袭!欧洲大国,发生了什么?

证券时报
2026-08-30 13:43:16
全网求证属实!景甜年初低调奔赴马尔代夫度假,松弛状态美出圈

全网求证属实!景甜年初低调奔赴马尔代夫度假,松弛状态美出圈

阿废冷眼观察所
2026-08-28 14:15:49
民航机长打假:孙宇晨说飞机油费花了百万美元细节,没有一条对的

民航机长打假:孙宇晨说飞机油费花了百万美元细节,没有一条对的

蹲坑看世界
2026-08-29 12:31:58
2026-08-31 07:27:00
科技行者 incentive-icons
科技行者
科技正在如何变革商业世界
9677文章数 568关注度
往期回顾 全部

科技要闻

OpenClaw:红过,爱过,散了

头条要闻

媒体:曾是商务标配 中国男人正在"抛弃"皮鞋

头条要闻

媒体:曾是商务标配 中国男人正在"抛弃"皮鞋

体育要闻

库明加和狼,突破天花板差的那一点距离

娱乐要闻

梅艳芳母亲覃美金离世,享年102岁

财经要闻

纪念币骗局触碰法律红线!专坑老人!

汽车要闻

巨幕长联屏/天神之眼/云辇-C 方程豹钛9将于四季度上市

态度原创

本地
亲子
数码
时尚
公开课

本地新闻

昆明的雨,解锁汪曾祺的浪漫雨季

亲子要闻

智力小动画:忘记了什么?

数码要闻

Apple Watch Series 12或推出白色与深灰色陶瓷表壳

乐福鞋,搞定一周穿搭

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版