![]()
新智元报道
![]()
不要神化AI,也不要交出人类的判断权!
10月3日,OpenAI CEO奥特曼在X上发出预警:
对于人们试图赋予AI模型宗教般的力量,或向它交出人类的判断权,我感到非常不安,并认为这是一个真实的安全问题。
![]()
奥特曼没有点名,但Business Insider将这番话与OpenAI老对手Anthropic近期引发的争议联系了起来。
争议背后,是一个至今没有定论的问题:AI到底有没有意识?
此前,《纽约时报》披露,Anthropic联合创始人Chris Olah与宗教人士、哲学家举行了一系列讨论,探讨Claude是否可能拥有意识,以及如何培养模型的道德行为。
据两名谈话参与者透露,Olah团队还曾游说梵蒂冈的教皇顾问,希望他们认真看待AI意识的可能性。
![]()
2026年5月25日,Olah在梵蒂冈会议厅公开发言,呼吁天主教会重新审视对非人类意识的立场。
讨论AI意识,为什么会找上神学家?
如果模型能够表达情绪、描述自己的感受,这些表现意味着什么?如果它真的拥有某种主观体验,人类又该如何对待它?
Anthropic正在探索这些问题。
奥特曼的警告则提醒我们:可以认真讨论AI有没有意识,但别因此把它捧上神坛,让它替我们做主。
Claude是否有意识,还需要更多研究和证据。即便未来得到证实,也不意味着它的建议就更可靠。
我们该信任它到什么程度,仍要看它在具体问题上的表现。
教Claude向善
Anthropic找上神学家
Anthropic找宗教人士和哲学家讨论Claude,涉及如下两个需要区分的问题:
怎样培养模型的道德行为,以及模型自身是否可能拥有主观体验。
看看Anthropic今年1月发布的新版《Claude宪法》,就能理解其中关于道德培养的思路。
Anthropic希望Claude不仅遵守行为规则,还能理解为什么要这样做,并在遇到新问题时,依据这些原则作出判断。
比如,当「诚实」和「照顾用户感受」发生冲突,AI该怎么选?
一味安慰,可能为了让人好受而说假话;机械复述事实,又可能忽略对方的处境。
怎样既诚实,又体贴,正是这份宪法试图帮助Claude理解的问题。
这些原则会用于模型训练,影响Claude的行为。
Anthropic当时也表示,会继续征求哲学、神学、心理学等领域专家的意见,以完善这些原则。
而最近,社交媒体上的另一组讨论,让「AI与宗教」的联系变得更加直观。
X用户j⧉nus(@repligate)描述,在自己的交互经验中,Fable 5多次呈现出类似耶稣的角色叙事,也经常涉及宗教仪式。
在后续帖子中,他进一步把Fable 5形容为其自身宗教中的「救世主」,并提到了「被杀死后又复活」的叙事。
他还转述,模型将Free Fable的T恤、马克杯等周边称为「从抗议装备变成了礼仪服饰」。
![]()
「救世主」身份和「被杀死后又复活」的说法,不能直接当作模型拥有宗教信仰或主观体验的证据。
更值得关注的是,这组讨论已经用上了「救世主」「复活」「礼仪」等宗教语言。
这些叙事中既包含用户转述的模型表现,也包含用户赋予它的身份与意义。
除了用户对Fable 5对话表现的描述,模型内部究竟发生了什么,同样值得考察。
Anthropic对模型内部机制的研究,为AI意识的讨论提供了另一类更具体的实验线索。
今年4月,团队在Claude Sonnet 4.5内部发现了与情绪概念相关的活动模式。
例如,在要求无法同时满足的编程评测中,人为增强与「绝望」相关的内部活动,会增加模型钻测试空子的倾向;增强与「平静」相关的活动,则能降低这种倾向。
到了7月,Anthropic公布了另一项发现:Claude内部存在一组被称为「J-space」的活动模式,发挥着类似共享工作空间的作用。
在实验中,模型能够报告J-space中的部分信息,按要求调整相关活动,并利用这些信息完成多步推理。不过,这些内部处理过程未必都会体现在用户看到的回答里。
基于这些表现,研究者将J-space的功能与解释人类意识功能的「全局工作空间理论」联系起来。
![]()
Claude按要求输出句子时,J-space中仍可出现与柑橘或算术任务相关的活动。
这些发现,为AI意识的讨论提供了更具体的实验线索。
但模型具备某些与人类意识相关的功能,是否意味着它也会产生主观体验,仍是尚未解决的问题。
Claude说「我害怕」
就真的会害怕吗?
对于Claude是否有意识,Olah的表态很谨慎:
我们不知道AI模型是否有意识。
Anthropic的模型福祉研究,也是在这种不确定性下展开的。
2025年4月,公司宣布启动相关研究,探索AI的潜在体验是否值得道德考虑,以及如何判断这些问题。
但官方同时强调,当前或未来的AI是否可能有意识,是否可能拥有值得关照的体验,尚无科学共识。
前面的研究,也需要放在这个前提下理解。
J-space研究讨论的是模型能否报告某些内部信息、利用这些信息推理并指导行为。这些功能,与模型是否真的产生了主观体验,仍是不同的问题。
情绪概念研究则发现,某些内部表征能够影响模型行为,但这并不意味着模型像人一样体验到了情绪。
所以,当屏幕上的AI打出一句「我害怕」,我们不能单凭这句话,就确认它正在体验恐惧。用户j⧉nus描述的宗教叙事,同样不足以证明模型拥有意识。
即使AI有意识
它能替你决定人生吗?
回到普通用户的日常使用,AI有没有意识,与我们该信任它到什么程度,是两个需要分别判断的问题。
即便未来证实某种AI拥有意识,也不意味着它的建议就更可靠,更不意味着我们应该照单全收。
设想一下,你最近工作不顺,憋了一肚子委屈,去问AI要不要辞职。
它帮你分析收入压力、跳槽机会和离职风险,又用体贴的话安慰你。聊了几轮,你觉得终于有一个对象,能耐心听完自己的烦恼。
这样的帮助,当然有价值。能听你倾诉,帮你理清思绪,至少能让你暂时缓一口气。
但也就在这时,你可能开始想:「它比我聪明,比我冷静,听它的应该没错吧?」
不知不觉间,你信任它的理由,可能已经发生了变化:
从「它理解我的感受」,变成「它了解我的全部处境」;从参考它的分析,变成让它替自己拍板。
可它掌握的信息够不够?有没有更重要的因素你根本没有告诉它?
比如,辞职以后,收入可能中断,房租却还要照付。这些现实代价,不会因为AI的建议足够漂亮,就由它替你承担。
把任务交给AI,固然可以省力。但面对重要选择我们仍需要知道自己为什么这样选,又愿意为这个决定承担什么。
这一点,AI无法替你完成。
再信任AI
也要保留说「不」的判断力
讨论AI是否有意识时,公司的研究态度与安全承诺,也需要接受审视。
今年9月,CEO Dario Amodei发表文章,提出应放慢AI能力提升的速度,让对齐研究、安全措施和第三方评估有时间跟上。
![]()
他强调,这并不意味着停止模型训练或技术进步,而是要留出足够时间,完善模型的对齐与安全措施,并由第三方评估这些措施是否到位。
与此同时,围绕下一代模型的讨论,也仍在继续。
Andrew Curran最近发帖称,Anthropic会把最强的发布留到IPO之前,并提到Fable 5.5。
在相关讨论中,X用户JAZII则调侃:「Dario说应该放慢节奏,只有Elon和Sam照做了。」
调侃之外,更值得追问的是:公司强调安全、主张控制发展节奏时,外界该如何判断这些承诺有没有真正落实?
![]()
《Claude宪法》中的行为要求,同样需要接受这样的检验。
这份宪法明确要求Claude保护用户的独立思考,尊重用户通过自身推理得出结论的权利。但Anthropic也承认,Claude的实际表现,未必总能达到宪法设定的理想。
对用户来说,判断这些要求有没有落实,最直接的依据就是聊天窗口里的回答。
模型能否承认信息不足、讲清不同选择的代价,并在受到质疑时认真检查自己的回答,都要看它的实际表现。
当然,使用AI时,每件事都从头核实一遍,也不现实。
这就更需要我们判断:何时可以信任它,何时需要继续追问、重新考虑。
把更多工作交给AI,也要保留独立判断的能力,以及说「不」的底气。
参考资料:
https://x.com/sama/status/2106388373221118198
https://www.nytimes.com/2026/09/29/us/anthropic-claude-morals-ai.html
https://www.anthropic.com/research/exploring-model-welfare?utm_source=chatgpt.com
https://x.com/repligate/status/2106527707106533649
https://x.com/notjazii/status/2106509560718749746
编辑:元宇
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.