一名佛罗里达州女子在 Claude 里敲下威胁当地治安官办公室的话,最后被警察带走了。据 Tomshardware 报道,把她送进警局的不是别人,正是 Anthropic 的人工审查员。
这条链路并不复杂:自动化系统先盯住关键词和威胁性内容,一旦判定语句严重,就会转交给人工审查团队,由后者上报给执法部门。逮捕报告里写得很清楚,触发这次上报的,正是那些被系统标记为严重的表述。
![]()
机器先筛,人来定夺
很多人以为 AI 聊天是私密的,但这次事件把后台的运作方式摆到了台面上。第一道关卡是自动系统,它负责在对话里扫描关键短语和威胁性内容;第二道关卡才是人——当自动系统认为内容足够严重,对话会被送到人工审查团队手里。
也就是说,决定要不要报警的,不是模型本身,而是坐在屏幕后面的人。他们看完对话,判断风险,然后联系了执法部门。
隐私政策里早就写好了这一步
![]()
Anthropic 的隐私政策允许公司在特定情况下与警方共享对话内容。触发条件是:公司善意地认为,披露这些信息对于防止严重伤害是合理必要的。
这条款不是临时搬出来的,它一直躺在政策文本里。这次只是第一次被公开地、具体地用在了某个人的对话上。
对普通用户来说,这件事的边界感在于:你和 AI 说的话,可能被机器扫一遍,再被人看一遍,最后可能出现在警方的记录里。前提是内容被判定为足够危险。
目前已知的结果是,这名女子因威胁治安官办公室被捕。至于对话里具体写了什么、审查团队花了多久做出判断,逮捕报告之外没有更多细节。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.