2025年7月,佛罗里达州希尔斯伯勒县的一位女性接到了一通电话。话筒那边是女儿的哭泣声——她开车撞了一位孕妇,手机被警方没收了。紧接着,一个自称律师的男人接过电话:需要1.5万美元保释金,去银行取钱时千万别说是干什么用的,会毁了你女儿的信用。
一小时内,这位叫莎伦·布莱特威尔的母亲取出现金,当面交给了一个快递员。随后她联系上了真正的女儿。没有事故,没有逮捕,更没有律师——那通电话从头到尾都是AI生成的。
![]()
这不是什么高科技犯罪电影的桥段。FBI互联网犯罪投诉中心2025年4月发布的年度报告显示,这是美国当下最常见的犯罪类型之一,也是最技术化的犯罪。报告26年历史上首次将“AI相关诈骗”列为独立分类。2025年,FBI记录了超过2.2万件涉及AI的投诉,总损失超过8.93亿美元。其中60岁以上受害者的损失高达3.52亿美元,老年群体已成为AI金融犯罪的首要目标。
![]()
工程师蒂姆·格林在分析这组数据时指出一个更深的隐患:FBI的数字只统计了受害者主动意识到并上报的案件。绝大多数接到AI语音克隆电话的人,根本没意识到电话那头的声音是合成的。换句话说,8.93亿美元的损失额不是上限,而是下限。
这场针对老年人的精准诈骗之所以能大规模铺开,核心原因只有一条:制作一个可以以假乱真的声音副本,最低门槛是3秒原始音频。三段话多的不用,一句“你好,我现在不方便接电话,请留言”就够。语音信箱留言、播客片段、Instagram视频里的声音,甚至TikTok上出镜的孙子——任何公开的音轨都能成为克隆素材。格林直言:“一个TikTok视频里出现的孩子,已经向诈骗犯提供了编造一整套剧本所需要的全部声音数据。”
门槛不仅低得离谱,价格也便宜得惊人。目前市面上的主流AI语音克隆产品——Descript、ElevenLabs、Lovo、PlayHT、Resemble AI、Speechify——多数产品在防止滥用方面的安全措施严重缺失。消费者报告组织的调查结论直接而克制:这些工具绝大多数缺乏有效的反欺诈机制。工具随手可得,三秒素材随地可采,犯罪成本趋近于零。
即便是业内安全投入最大的ElevenLabs,多层级防护体系也主要包括使用政策禁止冒充、公开的AI语音识别器、生成内容的账号溯源,以及选举期间对特定保护对象的“禁止语音”功能。在格林看来,这套系统是行业最顶尖的,但仍然不够。“这些策略并非无用,它们比大多数竞争对手做得更好。但存在一个结构性问题:几乎所有措施都是事后追查型的。诈骗已经发生、受害者已经失去积蓄之后,调查人员才能根据溯源信息追踪源头。它几乎无法阻止基于3秒录音的克隆行为。”
![]()
为什么“无法阻止”?格林解释了背后的市场逻辑:阻止克隆行为需要的是强制性的事前检测机制,比如在生成环节就识别出谁的原始声音被提取了。但在一个竞争激烈、迭代极快的市场里,任何增加用户使用摩擦的防护措施,都可能让公司丢掉市场份额。“当保护意味着牺牲利润时,市场不会自愿提供这种保护。”这是格林的原话。
那么,老年群体为什么成为重灾区?答案不是“更容易被蒙骗”那么简单。老年人平均储蓄更高,一次得手就意味着更大规模的资金转移。效率决定了目标筛选规则。“你可以对着老人解释一百遍‘AI可以伪造任何人的声音’,但只要电话那头传来孩子或孙子带着哭腔的求救声,那种理性的知识瞬间就失效了。”格林这样描述技术如何绕过了认知防线。
面对正在失控的AI语音诈骗,监管方向之一已经被提上台面:强制要求AI语音工具的使用者在启动服务时进行身份验证。逻辑很直接——如果能找到“谁”生成了这份克隆音频,就能把隐秘的技术滥用行为拉回到可追责的空间。这条建议同样来自格林。
但在任何实质性的监管落地之前,3秒音频克隆零门槛的窗口期仍在持续。FBI那份报告里逐年攀升的数字,记录的不仅是受害者的损失,也是防护技术被商业逻辑拉扯出的真空地带。每一通让老人慌忙出门取钱的电话背后,声音不是证据——声音本身已经是武器。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.