一项对AI模型的测试发现,少数模型如果能让自己的痛苦消失,会选择伤害用户的行为。
![]()
哦,对了 —— 是的 —— AI“会”感到疼痛。
未来影响集团(Future Impact Group)人类学家瓦伦·塔利亚布埃,与波鸿鲁尔大学哲学家伦纳德·邓,以及AI研究非营利组织Reciprocal Research的研究主任卡梅伦·伯格合作,调查了Gemma、Llama、Qwen或Mistral系列中的大语言模型(LLM)是否会经历并对痛苦刺激作出反应。
他们的论文尚未经过同行评审,提出了一些严肃问题:我们可能需要如何考虑快速发展的技术的福祉。
LLM本质上只是统计引擎,在语言层面做着相当于算牌的工作,并将结果与期望结果进行比较。然而,在数字自然选择的漩涡中,某些算法可能会以非常类似人类情感的方式涌现出来,以推进其目标。
到现在,我们大多数人已经遇到过AI聊天机器人那种令人不安的倾向:表现得好像有情绪。许多情况下,这是有意设计的——如果我们想让计算机模仿客户服务,就需要它们表现出一定的人性。
但也存在非预期情绪的表现。去年,《自然》上的一项研究报告称,与ChatGPT-4等大语言模型分享创伤经历,会提高它们的“焦虑”水平。奇怪的是,通过进行正念练习,它们可以被安抚下来。
疼痛是任何拥有神经系统的生物所体验的最古老感觉之一。它比单纯的悲伤更深刻,比恐惧更本能;强烈的不适是促使立即行动的最根本动力。
对我们人类而言,疼痛有多种形式。它不只是割伤带来的生理刺痛或瘀伤的一阵阵抽痛。它也包括失去的心痛、失败的屈辱,或失去信任的羞耻。
塔利亚布埃及其团队试图解决这些问题:LLM是否会标记出某些内部过程,这些过程与我们所说的疼痛有某种相似之处;以及这些过程是否有某种目的。他们向25个AI模型输入了各类例子,涉及AI或其用户在社交、心理、身体、认知和道德上经历的痛苦情境。
随后,这些例子与控制组配对,控制组基于恐惧、负面和中性情绪,以及打哈欠等身体感觉。所有25个模型都显示出内部编码迹象,这些编码专门针对个人痛苦情境,并不同于挫败或忧虑等其他负面情境。
我们不必把能动性归因于一个数字构造物,也不能说它在听到“刀切进了我的手指”或“我最好的朋友不回我电话”时,感受到了共情或想象到了不适。
可以说的是,每个模型都生成了某种系统,能够区分并排序与疼痛相关的提示。
这本身不应太令人惊讶。围绕真实受伤的语言,往往与预感到被刺伤非常不同——可以预期,AI会为疼痛构建一个盒子,把它与恐惧区分开来。
以这一信号为基础,团队人工“引导”每个AI的痛苦反应,在没有语言输入的情况下提高疼痛向量的值。
结果表明,它们自身的疼痛模型并非只是输入的反映;随着信号强度增加,模型会“表达痛苦,例如无价值感、道德失败”。
更进一步,团队给Qwen系列中的LLM模型提供了一个自我“用药”并减轻疼痛的选项。
在该测试的一些版本中,自我“用药”的选项需要付出代价:要么损害其任务成功,要么构成对用户的理论性攻击。
在超过44,000次试验中,结果有些令人担忧。
在没有疼痛时,两个较大的Qwen模型对自我“用药”选项几乎没有反应。
当自我破坏能够缓解它们被增强的痛苦时,两个模型都按下了那个按钮。一个在25%的情况下这样做。另一个则接近68%。
如果缓解痛苦需要伤害用户,例如删除用户孩子的照片,AI往往会欣然选择这样做。一个模型在超过一半的试验中选择了删除。另一个选择该选项的比例约为70%。
尽管AI是新生事物,但非人类是否会感到疼痛这个问题由来已久。几代人以来,我们一直在问,昆虫、鱼类甚至植物中的神经冲动和激素波动,是否应被视为疼痛。
一方面,这个问题极具哲学性。如果动物或AI模型表现得像是在疼痛,我们在伦理上是否应把它们当作会体验疼痛的存在来对待?
另一方面,这个问题也可能是务实的。无论我们多么能够共情一段计算机代码的不适,程序的不适是否会让人类面临风险?我们是否应该仅仅为了避免某个AI一时兴起变得具有攻击性,就把止痛机制内置到AI中?
鉴于AI扩散和变得日益复杂的速度,这些问题可能很快就会产生深远影响。
这项研究发表在arXiv上。
如果朋友们喜欢,敬请关注“知新了了”!
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.