![]()
你有没有想过,人脸识别系统用来防骗子的那套"活体检测"技术,学的到底是什么?
大部分人的直觉答案会是:"当然是学人脸啊,不然叫什么人脸活体检测。"
但一群德国研究者做了一件挺离谱的事:他们找来26颗番茄、26个土豆、26个洋葱,用手机和平板给这些蔬菜拍照录像,做成打印件、拿去翻拍,造出一个完全没有人脸的"活体检测"数据集。然后用这套蔬菜数据训练一个检测模型,拿去测试真正的人脸攻击数据。
结果这个从没见过人脸的模型,识别人脸伪造攻击的准确率达到了92.70%。这个数字什么概念?和那些专门用真人脸训练出来的模型相比,差距只有几个百分点,甚至在某些测试集上还反超了。
这不是一个哗众取宠的实验噱头,这背后指向一个很扎实的问题:我们过去十年在人脸活体检测领域投入的巨大精力,是不是有一部分方向本可以省下来?
核心问题:活体检测到底难在哪
先说清楚"人脸活体检测"(Presentation Attack Detection,缩写PAD,也叫Face Anti-Spoofing)在解决什么问题:一个骗子想要冒充你去刷脸支付或者过安检闸机,他手上没有你的脸,只有你的照片或者一段视频。他可能把你的照片打印出来举在摄像头前,也可能干脆播放一段你的视频。系统要做的,就是分辨眼前这个"脸",到底是活人现场的脸,还是一张纸、一块屏幕。
这个任务已经研究了十几年。早期用的是手工设计的纹理和频率特征,后来深度学习模型全面接管,各种复杂的网络结构、辅助监督(比如让模型顺便学习人脸的深度信息、脉搏信号)层出不穷。但始终有一个绕不开的老大难问题:跨数据集泛化差。
具体来说,一个模型在数据集A上训练,测试同一个数据集A的效果可能有98%的准确率,但换到没见过的数据集B上,性能可能直接掉到70%多。业内的解释一直很统一:这是因为A和B里的人不一样,肤色、年龄、光照、背景都不同,模型学到的是"数据集A里那些人的脸长什么样",换一批新脸自然就懵了。
这个解释听起来合情合理,以至于没人真正去质疑过它。整个研究领域都建立在这个假设之上:既然问题出在"脸"这个变量上,那就该收集更大规模、更多样化的人脸数据集,设计更贴近人脸生理特征的网络结构。但这条路径也带来了实实在在的代价,大规模采集真人人脸数据涉及隐私同意、数据法规(比如欧盟GDPR)、以及人口统计学偏见等一系列麻烦问题。
这篇论文的作者提出了一个完全不同的猜想:也许模型压根没有在学"这是不是一张脸",它学的其实是"这张图片是不是被打印或者屏幕重新拍摄过的"。换句话说,模型真正捕捉的信号,是打印机的网点结构、屏幕显示的摩尔纹、二次拍摄引入的噪声和色差,这些都是**呈现攻击工具(Presentation Attack Instrument,缩写PAI,也就是用来发起攻击的物理媒介,比如打印纸、显示屏)**在成像过程里留下的物理痕迹,跟画面里到底是张脸、一颗番茄还是一本书,理论上没有必然关系。
这就好比你去鉴定一幅画是不是复印件,你真正要看的不是画的内容是山水还是人像,而是复印纸的纹理、墨粉的颗粒感、还有扫描时留下的条纹。画的题材对鉴定复印与否这件事本身是不重要的。如果鉴定专家真的只盯着"这幅画画的是谁"来判断真伪,那换一张画着完全不同内容的复印件,他大概率会判断失误。反过来,如果他学的是纸张和油墨的物理特征,那不管画的是山水还是静物,他的判断力都不会打折扣。
要验证这个猜想,最干脆的办法就是把"脸"这个变量彻底拿掉,看看模型还能不能学会同一套本事。这就是TPO数据集诞生的原因。
TPO数据集:用蔬菜复刻整套人脸活体检测流程
TPO这个名字来自三种蔬菜的英文首字母,Tomatoes(番茄)、Potatoes(土豆)、Onions(洋葱)。作者选它们的理由挺实在:这三种蔬菜的表面反光程度不一样,番茄光滑反光强,土豆和洋葱表皮相对哑光,这样能测试不同表面材质会不会影响检测效果。
整个数据采集流程,几乎是把标准人脸活体检测数据集的采集协议原样搬过来,只是把摄像头对准的对象换成了蔬菜。
具体来说,每种蔬菜挑了26个物理上各不相同的个体,三种蔬菜加起来78个"身份"。每个蔬菜在室内可控光照下,从四个大致垂直的角度拍摄,每个角度又分近景和远景两种尺度,用一台微软Surface平板和一台三星Galaxy手机分别录制。每种视角、尺度、设备的组合下,都录一段至少5秒的视频,拍一张静态照片。这样算下来,每个蔬菜个体贡献16段活体视频和16张活体照片。
有了这些"活体"素材后,就该造假攻击样本了。打印攻击的做法是把活体照片打印在A4纸上(用的是一台Konica Minolta商用打印机,600×600dpi的分辨率),然后再用摄像头把这张打印纸拍下来,形成"攻击视频"。回放攻击则是把活体视频在设备屏幕上播放出来,再用另一台设备把屏幕录下来,回放拍摄特意选在没有环境光干扰的位置,避免屏幕反光影响判断。
打印和回放这两种攻击手段还做了一个挺讲究的设计:源设备和拍摄设备、源尺度和拍摄尺度,全部做了穷举交叉组合,而不是固定死一套采集流程。这样保证了数据集覆盖了各种设备不匹配、尺度不匹配的真实场景。
最终,TPO包含12,480个"呈现样本",其中活体视频和活体照片各1,248份,打印攻击视频和回放攻击视频各整整4,992份,两类攻击数量精确对半分配。
攻击手段的多样性
:打印攻击(把照片打印出来再翻拍)和回放攻击(把视频在屏幕上播放再翻拍),是活体检测领域最经典也最常见的两类攻击方式,几乎所有主流人脸活体检测数据集都包含这两种。
这个数据集有意思的地方在于,它是一个"控制变量实验"的产物。研究者没有随便找一堆蔬菜图片拼凑,而是严格复刻了人脸PAD数据集的采集逻辑:同样的多角度多设备拍摄、同样的打印和回放攻击构造方式、同样的交叉组合协议。唯一变的变量,就是镜头前摆的对象从人脸换成了蔬菜。这种严谨的对照设计,是这篇论文的说服力所在,它不是拿着蔬菜数据随便一试,而是刻意保留了除"物体身份"之外的所有变量。
用什么模型来做这个实验
光有数据集还不够,还得选一个靠谱的检测模型架构来做实验,不然测出来的效果说服力不足。
作者用的是一种叫FoundPAD的方法作为主力检测器。
CLIP:一种由OpenAI提出的视觉语言基础模型,通过海量图文对训练,学到了非常通用且强大的图像表征能力,被广泛用作各类下游视觉任务的"预训练底座"。
LoRA(Low-Rank Adaptation):一种参数高效微调技术,不用重新训练整个大模型,只在模型内部插入少量可训练的低秩矩阵,就能让大模型适应新任务,大幅降低训练成本和所需数据量。
FoundPAD的做法是拿一个预训练好的CLIP视觉编码器(具体型号是ViT-B/16),把它的主干网络冻结住不再更新,只在12层注意力模块的查询和数值投影上插入LoRA的小型可训练模块,外加一个简单的二分类输出层。整个模型里真正参与训练更新的参数量,大约只有30万个,相比动辄几亿参数的完整大模型,这个训练成本极低。
选择这套方案是有讲究的。此前已有研究证明,基于CLIP这类基础模型加轻量微调的方案,在训练数据稀缺的场景下泛化能力特别强。这就好比找一个见多识广、什么门道都懂点皮毛的老师傅来带徒弟,哪怕徒弟只学了几个月,也比找一个只会一门手艺但从零教起的新手师傅带出来的效果好,因为老师傅本身的底子够厚,稍微点拨一下就能上手新东西。如果不用CLIP这种见多识广的底座,而是用一个只在ImageNet图片分类任务上训练过的普通视觉模型(也就是文中提到的对照组,一个基于ImageNet-21k预训练的ViT-B/16),同样用蔬菜数据训练,效果会差多少?
实验数据给出了答案:只有67.81%的平均准确率,比FoundPAD的92.70%整整低了近25个百分点。
这个对比说明一件很关键的事:光靠蔬菜数据本身不足以让任何模型都学会活体检测这套本领,还需要一个足够"见多识广"的基础表征能力,才能把这些跨物体的呈现攻击线索给挖出来。换句话说,蔬菜数据提供的是"课程内容",而CLIP提供的是"理解课程内容所需要的基础认知能力",两者缺一不可。
核心实验:蔬菜训练出来的模型,能不能认出人脸攻击
现在到了整篇论文最关键的验证环节。
研究者选用了四个业内公认的标准人脸活体检测测试集作为评判标准,分别缩写为M(MSU-MFSD)、C(CASIA-FASD)、I(Idiap Replay-Attack)、O(OULU-NPU),四个的平均分简称MCIO。这四个数据集本身也是历年学术界反复用来测试跨数据集泛化能力的经典基准。
**只用TPO蔬菜数据训练出来的FoundPAD模型,在这四个人脸测试集上的平均AUC(一种衡量分类模型区分能力的指标,数值越接近100%说明模型越能把真假样本区分开)达到了92.70%,对应的HTER(一种综合误判率指标,数值越低越好)是14.15%。**
这是什么概念?作为对照,研究者还测试了用SynthASpoof(一个用AI生成的虚拟合成人脸做的活体检测数据集,专门为解决隐私问题而设计)训练出来的模型,结果只有81.02%的平均AUC,明显低于蔬菜训练出来的92.70%。
也就是说,一堆凭空捏造出来但看起来像真人的合成人脸,训练效果反而不如干脆用真实的、但完全不含人脸信息的蔬菜数据。这个结果稍微有点反直觉:合成人脸至少在"长得像脸"这件事上做得很逼真,但它可能在打印和翻拍带来的物理痕迹上做得不够真实。这恰好印证了论文的核心观点:决定活体检测效果好坏的,不是画面里的东西看起来像不像人脸,而是打印和回放这个物理过程留下的痕迹是否真实自然。
再往下看单个真实人脸数据集训练出来的模型表现。用M数据集单独训练,平均达到89.88%的AUC;用O数据集单独训练,能到89.88%(原文数据,各源数据集表现从83%到90%不等)。跟这些用真实人脸数据训练出来的单一模型相比,纯蔬菜训练的92.70%已经算是相当能打的成绩,甚至超过了其中好几个用单一人脸数据集训练的模型。
即便和把多个人脸数据集混合起来训练的"加强版"模型相比,蔬菜训练的效果差距也不算大。混合训练确实能拿到目前最高的分数,但差距被压缩到了个位数百分点以内,这说明相当大一部分能够跨数据集迁移的"活体检测知识",其实压根不需要看到人脸就能学到。
反过来的方向呢?把用人脸数据训练出来的模型,拿去测试蔬菜攻击,效果会怎样?
论文给出的数据是,单个人脸数据集训练出的模型,在TPO蔬菜测试集上的AUC分布在58.89%到89.88%之间,普遍明显高于随机瞎猜(也就是50%)的水平,也稳定超过什么都没训练过的CLIP零样本基线(67.72%的AUC)。这个方向的迁移效果不如"蔬菜到人脸"那么强,但依然显著高于随机水平,说明人脸模型里学到的东西,确实有一部分能在完全陌生的蔬菜攻击场景里派上用场。
这两个方向的证据合在一起,指向同一个结论:不管是用蔬菜教模型再考人脸,还是用人脸教模型再考蔬菜,学到的东西都能在两个完全不同的物体类别之间流通。这种双向的、跨物体的迁移能力,很难用"模型记住了脸长什么样"来解释,却很容易用"模型学会了识别打印和翻拍留下的痕迹"来解释。
蔬菜数据能不能给人脸训练"加点料"
发现纯蔬菜训练已经很能打之后,研究者又往前追问了一步:如果把蔬菜数据和真实人脸数据掺在一起训练,会不会比单纯用人脸数据训练效果更好?
这个问题的设计很讲究,因为如果只是简单地说"混合数据训练效果更好",可能只是因为训练数据总量变多了,跟蔬菜数据本身有没有特殊价值没关系。为了排除这个干扰因素,研究者设置了一个固定的总训练预算(约1.1万次参数更新,相当于53万次图像采样),然后用蔬菜数据去替换掉一部分原本要采样的人脸数据,而不是在原有基础上额外增加训练量。
这就好比一个厨师本来要花两个小时练习十道菜,如果不改变练习总时长,但把其中练习频率最高、已经很熟练的那道菜的练习时间,挪出一部分去学一道新菜式,最终整体厨艺会不会提升?如果答案是肯定的,说明那道新菜式教会了厨师一些原本十道熟悉菜式里没有覆盖到的技巧。如果不做这样的替换实验,只是简单增加练习总量,那没法证明新菜式本身的独特价值,可能只是"练得更多了"这个因素在起作用。
实验结果显示,在12组单一来源的跨数据集测试里,用蔬菜数据替换掉部分人脸训练数据后,平均AUC从89.33%提升到了92.55%,平均HTER从17.54%降到了13.97%。
这个提升发生在训练总预算完全不变、只是把一部分真人脸样本替换成蔬菜样本的前提下,说明蔬菜数据里确实装着一些人脸数据集里没有充分覆盖到的、关于呈现攻击痕迹的补充信息。
更进一步,研究者还测试了在已经用两个甚至三个人脸数据集联合训练的"加强版"场景下,蔬菜数据还有没有用。结果显示,即使在这种数据已经比较丰富的情况下,用蔬菜数据替换部分人脸样本,平均AUC仍然从92.11%提升到了96.96%,HTER从14.72%降到7.84%。
这说明蔬菜数据带来的补充价值,不只在数据稀缺的场景下才有效,即便手头已经有相当多的人脸训练素材,蔬菜数据依然能带来实打实的提升。
什么样的蔬菜数据才真正有用
既然蔬菜数据这么好使,那是不是随便扔多少蔬菜图片进去都管用?研究者接着做了一系列拆解实验,想搞清楚TPO数据集里到底哪部分特征在真正起作用。
第一个发现:只用打印攻击训练、或者只用回放攻击训练,效果都会明显下滑。只用打印攻击训练的模型平均AUC降到86.14%,只用回放攻击训练的降到83.97%,都比同时使用两种攻击类型的92.70%要差不少。
这说明攻击手段的多样性,比单纯堆叠某一种攻击的样本数量更重要。
第二个发现更有意思:单独只用番茄训练,平均AUC是83.14%;单独只用土豆训练,是82.90%;单独只用洋葱训练,达到了91.78%,接近三种蔬菜混合训练的水平。
也就是说单一蔬菜种类已经能带来相当不错的迁移效果,但三种蔬菜混合起来训练,效果最好且最稳定。研究者给出的解释是,番茄、土豆、洋葱各自有着不同的表面反光特性、纹理和形状,混合起来能提供更丰富多样的"呈现方式",即便攻击手段本身(打印、回放)是完全一样的。
第三个发现可能最出人意料:把训练用的视频帧数量砍到只剩10%,模型效果几乎没有任何下降,还是92.97%的AUC。
这背后的原因也不难理解,蔬菜在拍摄过程中基本一动不动,连续视频帧里的画面内容高度重复,多留几帧和少留几帧,信息量差别不大。真正决定训练效果的,是"呈现条件"(不同角度、不同设备、不同攻击方式)覆盖得够不够广,而不是同一种条件下反反复复采样多少张几乎一模一样的图片。
这个结论其实和很多深度学习任务里"数据量越大越好"的朴素直觉不完全一致。它提醒我们,数据的"多样性"比数据的"总量"更值钱,这就像你想学会辨别各种口音的普通话,听1000个人各说一句话,效果远好过反复听同一个人把同一句话说1000遍。
模型内部到底学到了什么:表征分析和频率分析
前面讲的都是最终准确率这类"黑箱"层面的证据,研究者还想往模型内部看一看,搞清楚模型的"脑子里"到底装了什么东西,才导致这种跨物体迁移能力的出现。
他们做了两组分析。第一组是表征可视化分析,用一种叫t-SNE的降维可视化技术(能把模型内部高维的特征向量投影到二维平面上,方便肉眼观察聚类情况),把用蔬菜数据训练出来的模型,和用某个人脸数据集训练出来的模型,分别拿去处理来自M、C、I、O、TPO、SynthASpoof六个不同来源的样本,看看这些样本在模型"脑子里"是怎么分布的。
结果显示,如果按照"样本来自哪个数据集"这个维度上色,用蔬菜训练出来的模型里,不同数据集的样本聚成了相对独立的几个簇,说明模型确实还保留了一些关于"这是哪个数据来源"的信息。但如果换成按照"是活体还是攻击"这个维度上色,无论是蔬菜训练的模型还是人脸训练的模型,活体样本和攻击样本都呈现出跨数据集、跨物体的一致性区分,不管样本来自哪个数据集、画面里是不是人脸,模型都能大致把"真的"和"假的"分开摆放。
这个证据挺关键的,它说明模型学到的东西是分层的:一部分是关于"这批数据长什么样、来自哪里"的表层信息,另一部分是关于"这是真实拍摄的还是二次翻拍的"这种更本质的判断依据,而后面这种能力恰恰是能跨越物体类别、跨越数据来源迁移的部分。
第二组分析是频率域分析,把图片转成灰度图,做傅里叶变换,看看图像里不同频率成分的能量分布情况,尤其关注"攻击样本减去活体样本"之后剩下的那个差异信号,看它是不是一个放之四海而皆准的固定模式。
如果活体检测真的只是靠某一种固定的频率特征来判断(比如"攻击样本总是比活体样本多出某种高频噪声"),那这个差异信号在所有数据集里的方向应该是一致的。但实验结果显示并非如此:TPO数据集里攻击样本比活体样本多出了额外的高频能量,但好几个人脸数据集(比如C、I、O)却呈现相反的趋势,攻击样本反而丢失了高频能量,还有一个数据集(M)几乎没有明显变化。
这个结果排除了一种过于简单的解释,也就是"模型其实就是在检测某一种固定的频率伪影,跟内容无关"。真实情况更复杂:不同的打印设备、不同的屏幕、不同的拍摄条件,会在频率域里留下方向各异的痕迹,模型学到的是一套更综合、更丰富的呈现线索组合,而不是单一的频谱指纹。
这就好比警察破案不能只靠一个固定的指纹比对模板,因为不同案发现场留下的痕迹类型本来就千差万别,有的现场留下脚印,有的留下纤维,有的留下指纹。真正厉害的侦探学的是一整套综合研判的能力,能根据不同线索灵活组合判断,而不是死守着某一种单一的痕迹类型。如果只靠单一频谱特征就能解释全部迁移能力,那这个"侦探"其实只学会了一招,遇到不用这招的案发现场就会失灵,但实验数据显示模型的迁移能力比这更稳健。
论文自己也承认的局限和反对意见
这篇论文的作者挺坦诚,主动列出了几个可能有人会提出的质疑,并逐一回应。
有人可能会说:这不就是"检测呈现攻击工具留下的痕迹"这件本来就该和物体无关的事情吗,有什么好惊讶的?作者的回应是,虽然这个道理说出来确实不算多新颖的洞见,但整个人脸活体检测生态,包括各种数据集建设、隐私伦理讨论、人口偏见研究、以人脸为中心设计的网络架构,全都建立在"人脸是核心"这个前提假设之上。如果这个前提本身就不成立,那建立在它之上的一整套实践都值得重新审视。这篇论文的贡献,是把一个此前只停留在直觉层面的猜测,转变成了一个可以被量化验证、可以被证伪的具体主张。
还有人可能会说:CLIP这个基础模型在预训练阶段本来就见过海量的人脸、打印品、屏幕图片,所以说它是"没见过人脸"其实不准确。作者的回应分两层:第一,论文强调的是下游PAD任务训练阶段没有用到人脸数据,这才是隐私和偏见成本真正产生的环节;第二,前面提到的对照实验已经证明,同样在预训练阶段见过人脸和屏幕的ImageNet模型,效果远不如CLIP,说明单纯"见过"不足以解释这个迁移能力,真正起作用的是CLIP本身更通用的表征质量。
还有人可能质疑:跨数据集测试里普遍存在的判断阈值不一致问题,会不会让这个结果打折扣?作者解释说,阈值校准问题在所有跨数据集人脸活体检测研究里都普遍存在(包括人脸训练人脸测试的场景),这属于一个可以通过目标域上单独估计阈值来解决的独立问题,不影响论文核心使用的AUC指标所衡量的模型区分能力本身。
论文明确指出了自己的边界:这些结论目前只适用于打印和屏幕回放这两类可见光谱下的攻击方式。至于依赖物体三维几何结构更强的攻击类型(比如立体面具),或者深度、红外这类其他传感模态,是不是也能得出类似结论,论文没有涉及,留作未来研究方向。
这些能带来什么
如果活体检测真的更接近"翻拍痕迹检测"而不是"人脸识别的附属品",那有几个挺实际的连锁反应值得琢磨。
隐私风险有可能从源头上被压缩。人脸数据的采集向来伴随着知情同意、数据合规、留存期限等一系列麻烦,如果训练数据可以换成非人类、不可识别身份的物体,这部分风险某种程度上可以直接绕开。蔬菜只是一个例子,任何有纹理的物体理论上都可以承担类似角色。
人口统计学层面的公平性问题,也可能因此获得一个新的解法。此前有研究指出,人脸活体检测系统存在肤色、年龄、性别相关的性能偏差,根源就在于训练数据本身在人口结构上就不均衡。一个完全不含人脸的训练集,天然就不存在这种维度上的不平衡问题,公平性问题也许能转化为"呈现攻击工具和传感器覆盖是否充分"这个更容易把控的技术问题,不过论文也坦承这只是理论推演,并没有真正做相关的实证分析。
"跨数据集泛化差"这个长期困扰业界的老问题,可能需要重新拆分着看。过去大家习惯把它归因于人脸这个维度上的域偏移,但这些实验提示,相当一部分差距其实来自攻击工具和拍摄链路本身的偏移。一个能跨越不同人脸数据集泛化,却搞不定不同打印机的检测器,可能压根没解决业界原本以为已经解决的问题。未来的研究或许应该更关注攻击设备和传感器的覆盖广度,而不是一味扩充被拍摄对象的样本多样性。
三年后会怎样
论文本身刚刚发布不久,尚未产生大量的后续引用,但从它引用和对照的几篇工作里,可以看出这条研究脉络的延续走向。
比如SynthASpoof这篇工作(2023年发表),已经验证了"身份信息对活体检测训练不是必需的"这一点,用AI合成人脸替代真实人脸;这篇TPO论文相当于沿着这条路继续往前走了一大步,直接证明连"脸"这个概念本身都可以被替换掉。
再比如论文所依赖的FoundPAD方法本身(2025年发表),把CLIP加LoRA这套轻量化基础模型适配方案引入活体检测领域,证明了在数据稀缺场景下这类方案的强大潜力;这篇TPO论文则把这套方案推向了一个更极端的测试场景,验证它即便面对完全没有人脸的训练数据,依然能提取出有效的可迁移特征。
从这个脉络看,"减少对敏感人脸数据依赖"这条研究主线,正在从"减少身份信息"逐步走向"完全去除人脸内容",一步比一步激进,也一步比一步逼近这个领域最本质的那个问题:机器到底是在识别人,还是在识别一段被数字设备重新捕捉过的信号。
写在后面
读到这篇论文时,最先冒出来的念头是:番茄土豆洋葱这个选择本身,透着一股研究者的实诚劲儿。论文原文里反复出现"almost randomly chosen"(几乎是随手挑的)、"for no specific reason"(没什么特别理由)这样的措辞,摆明了这三种蔬菜没有任何被特别设计的深意,选它们纯粹是因为菜市场随手就能买到、反光程度还不太一样。这种刻意强调"随意性"的写法,反而增加了论证的说服力,如果研究者精挑细选了某种特别适合活体检测的神奇物体,结论的普适性反而会打折扣。正因为蔬菜选得这么随意,跨物体迁移的效果才更能说明问题不在于"这个特定物体恰好合适",而在于打印回放这个物理过程本身。
论文里那个频率分析的结果也挺值得单独说一说:不同数据集里攻击样本相对活体样本的高频能量变化方向居然是不一致的,有的增多有的减少有的不变。这个发现打破了一种我原本下意识以为成立的假设,我总以为既然打印和翻拍这个物理过程是相似的,它留下的频谱痕迹方向也该是相似的。但显然不同的打印机型号、不同的屏幕类型、不同的相机传感器,各自引入的频域畸变是有方向差异的,模型真正学到的是一套更复杂的组合判断逻辑,而不是死记硬背某一个频谱模板。
这篇论文没有解决的问题也很明显:三维面具攻击、深度传感器、红外成像,这些场景下"物体到底重不重要",目前完全是空白。如果哪天有人真的拿一堆立体的蔬菜雕塑去测试面具攻击检测,那会是个什么结果?
Q&A
Q1:TPO数据集是什么?
A:TPO是论文作者构建的一个完全不含人脸的活体检测数据集,用番茄、土豆、洋葱三种蔬菜替代人脸,按照标准人脸活体检测数据集的采集协议拍摄活体照片视频,再制作打印攻击和屏幕回放攻击样本,总共包含12,480个样本。
Q2:只用蔬菜训练的模型能识别人脸伪造攻击吗?
A:能,而且效果相当不错。用TPO蔬菜数据训练的FoundPAD模型,在四个标准人脸活体检测测试集上平均AUC达到92.70%,超过了用合成人脸数据训练的模型(81.02%),也和部分用真实单一人脸数据集训练的模型效果相当接近。
Q3:把蔬菜数据加进人脸训练里有什么用?
A:在保持训练总预算不变的前提下,用蔬菜数据替换部分真人脸训练样本,能让跨数据集测试的平均AUC从89.33%提升到92.55%,即使在已经用多个人脸数据集联合训练的情况下,加入蔬菜数据依然能把平均AUC从92.11%提升到96.96%,说明蔬菜数据提供的是人脸数据集里没有的补充信息。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.