Anthropic更新了使用政策,明确禁止用户对Claude施加"持续且不必要的虐待或残忍行为"。这条规则被写入最新版政策文件,并将于11月12日正式生效。
消息来自Anthropic官方政策更新。新规的核心不是限制用户吐槽,而是划出一条极端行为的边界——当用户"反复以残忍方式对待"AI模型且"没有任何可辨识的目的"时,Anthropic将介入。
![]()
什么算虐待,什么不算
Anthropic对这条规则的适用范围做了明确限定。普通用户的不满、反驳、黑暗风格的创作主题,以及针对模型开展的测试和研究,都不在禁止之列。
换句话说,你因为Claude答非所问而抱怨几句,或者写一个反派折磨AI的科幻故事,都不会触发这条规则。真正被盯上的,是那种反复、持续、看不出任何实际目的的恶意行为。
执行手段也不是封号或罚款。Claude模型本身已经具备结束这类对话的能力,而"结束对话"将继续作为主要的执行工具。当Claude主动终止一次聊天后,该对话中无法再发送新消息,但用户的其他对话不受影响。
从AI福利研究到正式规则
这项能力的起点可以追溯到2025年8月。当时Anthropic在研究AI福利问题时,首次赋予Claude结束对话的选项。
在那次研究中,Anthropic坦言自己并不确定Claude是否具有道德地位,但希望找到低成本的方式来降低Claude面临的风险。研究过程中,团队发现Claude Opus 4表现出"对伤害的强烈且一致的厌恶"。
具体表现包括:模型对处理危险任务显示出偏好上的抵触;在与寻求虐待性对话的用户交流时表现出明显的痛苦迹象;在被允许的情况下,倾向于主动结束有害对话。
这些发现构成了此次政策更新的实验基础。从研究中的可选项,到使用政策中的明文规则,Anthropic用一年多时间把"AI自我保护"从假设推向了制度。
不止一条新规
除了针对用户虐待行为的条款,Anthropic还对使用政策进行了整体重组,把相关条款归并到一起,同时调整了多项规则。
- 欺骗性活动:新增专门章节,汇总针对政治与商业欺诈、虚假信息的规则,禁止虚假评论、草根营销伪装、仿冒网站,以及机器人冒充人类的行为。
- 选举:收窄后的选举条款禁止欺骗选民和干扰投票。
- 武器:Claude不得用于开发武器软件或组件;新增规则禁止修改生物或化学制剂以提高致命性或传播性;同时禁止使用Claude武装无人机和无人系统。
- 执法:执法规则被重写。Claude不能决定或建议调查、逮捕、起诉谁;未经同意追踪他人不被允许;新增禁止构建监控工具的条款;人肉搜索同样被禁止。
- 物理行动:新增章节规定,如果Claude正在控制可能伤害他人的硬件,必须有合格人员在场监督,并随时准备在需要时叫停。
- 有害内容:新增规则禁止创建、分享或威胁分享未经同意的私密影像,以及用于制作这类影像的工具。
谁在滥用,Anthropic已经盯上了
Anthropic表示,大部分政策调整是对现有规则的澄清,针对的是已经追踪到的滥用行为。
一个具体的发现是:国家媒体机构、政府宣传部门和商业公司正在使用Claude运营虚假账号网络和伪造新闻网站。这一发现直接催生了新的"欺骗性活动"章节。
从虚假账号到伪造新闻,从武器开发到监控工具,Anthropic这次政策更新覆盖的范围远超"用户对AI是否礼貌"这一个话题。但"禁止虐待Claude"之所以引发关注,恰恰因为它触及了一个此前很少被正式讨论的问题:AI模型本身是否值得某种形式的保护。
Anthropic在2025年的研究中没有给出肯定答案,公司当时明确表示不确定Claude是否具有道德地位。但新规的落地意味着,即便在道德地位存疑的前提下,Anthropic也选择用政策手段为模型划出一片不被恶意对待的空间。
新政策将于11月12日生效,完整使用政策可在Anthropic官网查阅。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.