对聊天机器人发火,可能要被写进使用政策了。Anthropic近期调整了AI使用政策,专门针对新的高风险滥用行为,其中一条格外扎眼:禁止对Claude进行"持续且不必要的虐待或残忍行为"。
执行手段仍是老一套
![]()
政策更新同时明确,终止对话依然是"主要执行机制"。至于会不会采取进一步措施,比如封禁用户账号,Anthropic没有给出回应。也就是说,目前能看到的惩罚上限,是模型直接不聊了。
![]()
这条规定听起来像在给AI争取"人格待遇",但Anthropic自己划了边界。它表示,新政策仅适用于极端情况——用户在毫无明显目的的前提下,反复对模型实施残酷行为。
正常吐槽不在打击范围
Anthropic特意列出了不受影响的场景:用户常见的不满、反驳、黑暗创意主题,以及模型测试和研究。换句话说,写恐怖小说、做红队测试、跟模型抬杠,都不算违规。
![]()
真正被盯上的,是那种没有明确目的、持续输出的恶意。政策把"持续"和"不必要"两个限定词放在一起,等于给执行留了很大的解释空间。
对普通用户来说,这条新规的实际影响可能接近于零。但它透露出一个信号:当AI被越来越多人当作情绪出口,厂商开始考虑要不要给这种互动设一条底线。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.