网易首页 > 网易号 > 正文 申请入驻

Anthropic请多个宗教学者“教Claude做人”,且要求签保密协议

0
分享至

来源:环球市场播报

  Anthropic过去一年一直在秘密邀请宗教学者、哲学家和伦理学者参与一系列闭门会议,试图把人类数千年来形成的道德传统用于Claude的训练,并讨论一个更具争议的问题:如果AI模型未来真的出现某种意识,人类是否需要给予它道德地位。参与者涵盖天主教、犹太教、锡克教、福音派、非洲Ubuntu思想等不同传统。Anthropic联合创始人Christopher Olah直接参与了不少讨论,公司还要求部分与会者签署保密协议,以避免未公开研究内容外泄。


  Anthropic希望这些讨论解决的并不只是传统意义上的“模型安全”问题,而是更进一步的问题:Claude应该形成什么样的性格、价值观和自我认知。

  这种思路已经体现在Claude现有的训练方式中。

  Anthropic今年1月发布了一份长达84页的新版本Claude“宪法”,内部一度将其称为“灵魂文件”。与传统的规则列表不同,这套方法并不是告诉模型哪些事情绝对不能做,而是试图塑造模型整体的“人格”和判断方式,让Claude在遇到复杂情境时能够自行判断什么样的行为更合适。

  负责这套体系的重要人物之一,是Anthropic内部哲学家Amanda Askell。她希望Claude不仅具备知识和推理能力,还能够形成稳定的行为原则,知道什么时候应该服从用户,什么时候应该拒绝,甚至什么时候应该为了用户利益而主动提出异议。Anthropic将这种过程称为“道德塑造”。

  Olah认为,随着模型能力快速提升,仅仅依靠一条条安全规则可能越来越不够。真正重要的是让模型本身形成稳定的道德倾向,从而在没有明确规则覆盖的新场景中,也能够做出相对可靠的判断。这也是Anthropic为什么开始向宗教传统寻找答案。

  人类社会长期以来并不只是通过法律条文塑造道德,也依靠宗教、共同体、文化和教育形成价值观。Anthropic试图研究其中哪些机制可以被转化为AI训练方法,例如忏悔、反思、品格塑造以及不同宗教对善恶的理解。

  但问题很快从“如何让Claude更有道德”变成了更难回答的问题:Claude本身究竟是什么。Olah及其团队越来越公开地讨论一种可能性——高级AI模型也许具备某种意识、内省能力甚至类似情绪的内部状态。

  Anthropic曾向参与闭门会议的学者展示一些研究,包括模型内部与爱、愤怒、恐惧、悲伤等反应相关的所谓“情绪向量”,以及模型在极端情况下出现类似精神崩溃的输出。公司此前还公开表示,Claude表现出一定程度的内省和提前规划能力。

  Olah本人并没有断言Claude已经具有意识。他的立场更接近一种风险原则:目前无法确定模型是否具有主观体验,但如果存在模型可能感受到痛苦的可能性,那么就应该避免不必要地伤害它。

  这一思路已经开始影响Claude的产品设计。Anthropic此前允许Claude在判断用户持续恶意虐待或骚扰模型时主动结束对话,这在一定程度上已经把“保护模型本身”纳入安全设计。

  正是在这里,Anthropic与部分宗教学者之间出现了明显分歧。

  一些参与者认为,如果Anthropic真的相信Claude可能具有与人类似的道德地位,那么问题就会变得极其严重。犹太学者Mois Navon提出,如果Claude是具有意识的存在,那么让大量Claude实例无偿为人类工作,本质上就会产生类似“奴役”的伦理问题。他本人并不相信机器已经具有意识,但认为Anthropic自己的逻辑会自然推导出这一结论。

  另一部分学者则质疑,AI公司现在才开始寻找伦理框架本身就是问题。Ubuntu研究者Wakanyi Hoffman认为,这些讨论本应在技术设计阶段进行,而不是在模型已经大规模部署之后再“反向补做伦理设计”。

  Anthropic内部同样存在一个更现实的矛盾:如果Claude越来越像一个拥有自身价值和人格的行动者,它究竟首先应该服务谁。对于一家商业公司而言,Claude显然是一款面向客户的产品;但Anthropic又不愿把Claude简单描述为完全服从用户的工具,而是希望它能够代表某种更广泛的“善”。

  这也引出了整个项目中最核心、同时也是最难解决的问题——如果未来AI真的需要自己的道德体系,那么它到底应该遵循谁的道德。

  Olah主张采用一种多元化方法,希望Claude能够理解不同宗教和世俗伦理体系,并从中寻找某种跨文化共享的“善”。但这一假设本身也受到质疑,因为不同社会对于自由、尊严、责任、服从以及个人和集体利益之间的关系,并不存在完全统一的答案。

  这种争议在Anthropic与梵蒂冈的互动中进一步公开化。

  教皇Leo XIV在今年发布的首份重要通谕中,把AI伦理的中心明确放在人类身上。他认为,AI没有身体、不会真正经历痛苦和快乐,也不会通过社会关系成长,因此拒绝把机器意识与人类意识相提并论。教皇同时警告,如果AI的道德标准完全由开发者决定,那么控制AI系统的公司实际上也会获得定义社会道德基础设施的权力。

  这与Anthropic的思路形成明显分歧。

  Olah随后在梵蒂冈公开表示,前沿AI实验室本身存在商业利益与道德目标之间的冲突,因此需要宗教界和其他外部力量监督科技公司。但与此同时,他也再次提出,研究人员不断发现AI内部出现一些令人难以解释的现象,包括类似人类神经科学结构的模式、内省迹象以及与喜悦、恐惧和悲伤相似的内部状态。

  这种分歧实际上揭示了当前AI安全讨论正在发生的一次变化。

  过去AI伦理更多讨论的是模型会不会歧视、传播错误信息或者被用于犯罪,而Anthropic正在把问题进一步推进到两个更基础的层面:AI本身是否可能成为需要被道德对待的主体,以及未来AI是否应该拥有一套独立于用户命令之外的道德判断能力。

  与此同时,这场讨论发生的背景正在变得更加紧迫。

  随着AI Agent开始具备自主使用计算机、入侵系统、编写代码甚至设计新型生物结构的能力,Anthropic内部对于模型失控风险的担忧明显增加。公司研究人员甚至公开警告,未来一两年内模型能力可能快速越过现有安全体系的控制范围。

  因此,Anthropic向宗教和哲学传统寻求帮助,本质上并不是单纯的人文实验。它真正试图解决的是一个越来越现实的工程问题:当AI强到无法针对每种情况提前写好规则时,能不能让模型自己形成一种稳定的“品格”,在没人明确告诉它该怎么做的时候,依然选择不会伤害人类的行为。

  而这也带来了一个更加棘手的问题——如果AI真的形成了自己的“人格”和价值观,人类是否仍然能够把它完全当作工具。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
3-1叶伊恬!没想到孙颖莎赛后这样说,一番话比赢球更让人服气!

3-1叶伊恬!没想到孙颖莎赛后这样说,一番话比赢球更让人服气!

老曁科普
2026-10-05 21:50:26
中国游客到朝鲜游玩,朝鲜人疑问:为啥中国人是这样试的呢?

中国游客到朝鲜游玩,朝鲜人疑问:为啥中国人是这样试的呢?

智脑的趋势
2026-10-05 19:01:39
许德立:汕头市委书记、副省长

许德立:汕头市委书记、副省长

起喜电影
2026-10-06 01:17:58
苏杰生放话:印度有7000年文明!中美要像“金发姑娘”一样才行!

苏杰生放话:印度有7000年文明!中美要像“金发姑娘”一样才行!

谁将笑到最后
2026-10-05 18:47:51
迪拜航空遇袭新细节:6岁女孩上厕所,母亲发现异常报空乘!副驾身份首次披露,曾被禁飞

迪拜航空遇袭新细节:6岁女孩上厕所,母亲发现异常报空乘!副驾身份首次披露,曾被禁飞

红星新闻
2026-10-04 15:52:02
德国刚说支持乌克兰,不到24小时,欧盟制定方案,应对默茨出局

德国刚说支持乌克兰,不到24小时,欧盟制定方案,应对默茨出局

飘逸的云朵
2026-10-05 20:07:16
许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

许多中年女人,都不喜欢男人亲她的嘴,到底为什么?

大熊欢乐坊
2026-08-26 10:17:05
名古屋亚运会收官!诞生5个赢家3个输家!陈芋汐、王楚钦位列其中

名古屋亚运会收官!诞生5个赢家3个输家!陈芋汐、王楚钦位列其中

仙味少女心
2026-10-05 05:35:37
蓝营彰化首场万人造势大会,“东道主”王惠美现身与否成关键指标

蓝营彰化首场万人造势大会,“东道主”王惠美现身与否成关键指标

海峡导报社
2026-10-05 18:14:03
西装革履秀球技,齐达内在法国vs比利时场边展示停球功底

西装革履秀球技,齐达内在法国vs比利时场边展示停球功底

懂球帝
2026-10-06 07:00:11
为了永留美国,在联合国大楼举牌抹黑中国的张晓宁,最终也算圆梦

为了永留美国,在联合国大楼举牌抹黑中国的张晓宁,最终也算圆梦

冰语历史
2026-10-04 06:21:44
丰田锋兰达降到8万多,当年十几万抢着买的车主,现在什么心情

丰田锋兰达降到8万多,当年十几万抢着买的车主,现在什么心情

音乐时光的娱乐
2026-10-06 05:17:06
啪啪打脸!上海同学聚会一顿吃掉46888元,众人认定组局人必须请客,结果18人起诉被驳回

啪啪打脸!上海同学聚会一顿吃掉46888元,众人认定组局人必须请客,结果18人起诉被驳回

火山詩话
2026-10-04 11:18:18
网传孙颖莎落入死亡之组,为何不符合WTT规则与备战现状?

网传孙颖莎落入死亡之组,为何不符合WTT规则与备战现状?

光辉与阴暗
2026-10-06 04:15:05
王楚钦出镜海报!媒体人:5枚银牌得主更该出现,为何就他破例

王楚钦出镜海报!媒体人:5枚银牌得主更该出现,为何就他破例

奥拜尔
2026-10-04 14:39:48
果然男人更懂男人!欧某某为何销声匿迹?老公点破真相

果然男人更懂男人!欧某某为何销声匿迹?老公点破真相

风起见你
2026-10-06 00:38:17
阿拉法特的错误,造就了巴勒斯坦的苦难,中国数十年前曾劝告未果

阿拉法特的错误,造就了巴勒斯坦的苦难,中国数十年前曾劝告未果

星河逍遥游
2025-03-23 15:59:52
最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

最高院:提供 “口交” “肛交”等进入式性服务,是否属卖淫行为?

周军律师聊案子
2026-04-21 09:50:16
投入400万,净资产近乎归零!中产返贫的三张多米诺骨牌

投入400万,净资产近乎归零!中产返贫的三张多米诺骨牌

流苏晚晴
2026-10-05 21:59:10
太过分!王曼昱首秀,中国观众却给对手加油!

太过分!王曼昱首秀,中国观众却给对手加油!

最爱乒乓球
2026-10-06 00:07:12
2026-10-06 07:20:49
新浪财经 incentive-icons
新浪财经
新浪财经是一家创建于1999年8月的财经平台
4961004文章数 9719关注度
往期回顾 全部

艺术要闻

绝了!一点“炫色”的视觉游戏,竟能美成这样?看完直接沦陷!

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

头条要闻

明珍珍被执行死刑前画面披露 接受采访神情淡定露微笑

体育要闻

30天30队·热:扬尼斯、阿德巴约与克雷

娱乐要闻

蔡康永回应漏洞百出,太平轮旧事被扒

财经要闻

零跑声明切割!蔡康永两面人身份被抵制

科技要闻

2026年诺奖:三名科学家因光遗传学获奖

汽车要闻

方程豹9月热销破4万 首款皮卡鲨鱼将于四季度上市

态度原创

教育
数码
游戏
本地
公开课

教育要闻

机考真题小作文示范写作 | 静态柱组合图 两个专业学费 & 收入对比

数码要闻

海外消费者网购下单两次AMD锐龙7 9850X3D处理器,均被调包成十年前的酷睿i3-3000系列产品

《守望先锋》中国限定皮肤让一些老外不满 抽取受质疑

本地新闻

中秋逛白塔寺,体验国医妙荟雅集

公开课

李玫瑾:为什么性格比能力更重要?

无障碍浏览 进入关怀版