网易首页 > 网易号 > 正文 申请入驻

科学家喊话:别等AI失控再研究,现在就要拆开它的"道德观"

0
分享至

认真阅读下面的文章,并思考文末互动提出的问题,严格按照互动:你的答案格式在评论区留言,就有机会获得由中国科学技术大学的出版社提供的优质科普书籍《草木食韵:从田野到餐桌的科学与文化之旅

假如你正在路上开车,一个人突然冲到你车前,你会急打方向盘吗,哪怕这意味着一头撞墙上?如果那人是个孩子呢?

再想想报税的时候:你会用上能找到的每一个漏洞吗?


驾驶和报税场景中AI正在尝试介入。图源:AI生成。

用不了多久,这类决定也许就要由人工智能系统替我们来做。今天,全球一半以上的人口已经在使用 AI 聊天机器人;各式各样的人工智能,也很可能经由越来越多的场景和产品,融入我们的生活。

柏林马克斯·普朗克人类发展研究所"人类与机器研究中心"的计算机科学家伊亚德·拉万(Iyad Rahwan)及其团队认为,我们应当在这类问题真实上演之前就开展研究。他们把这套方法称作"科幻科学"——即借助科幻式的未来场景,对"人与技术"做严肃的实证研究:一边观察人们使用新型 AI 时的真实行为,一边询问人们认为 AI 应当如何行事,以此推演未来的种种图景。


计算机科学家伊亚德·拉万,马克斯·普朗克人类发展研究所。图源:James Provost(CC BY-ND)。

研究人员强调,他们的目标是尽可能客观、细致地预测未来人与 AI 将如何互动,而不是去规定企业和政府该怎样穿越这片险地。

我们会始终难以信任 AI,还是终有一天会偏爱 AI 甚于人类?与 AI 相处,会让我们变得更好还是更糟?而一旦出了岔子,责任又该落到谁头上?

拉万与合作者在 2024 年的《心理学年度评论》(Annual Review of Psychology)中探讨了人工智能的道德心理学。以下为本篇访谈,已经过删节与编辑,以求篇幅精炼、表意清晰

为什么要研究"AI 的道德心理学"?道德心理学难道不是人类独有的吗?

简言之,理由与我们需要"人类的道德心理学"一模一样。我们必须弄清,是什么驱使人类更有道德或更不道德,才能建设更道德的社会,让各类机构的行为也更端正。如今,AI 机器正日益深入地与现实世界打交道,我们同样需要对它们做这番研究,因为它们将做出一个个涉及道德后果的决定。

在这之前,我们要弄清:它们究竟遵循哪些道德原则(如果真有的话)?这些原则又在多大程度上源于其训练、编程、"投喂"的数据集,或其运行的具体情境?

有一个著名的难题叫"科林格里奇困境"(Collingridge dilemma):当一项技术还容易修改、调整时,我们就没有足够的信息来知道该怎样应对;而等我们终于掌握了足够的信息,它却已根深蒂固,很难再改动。

所以拉万认为,科学界一定要尽早,最好抢在问题出现之前,积累起这方面的信息,好让我们能更快回应这些新挑战不妨设想:假如早在 2010 年,我们就对"社交媒体对儿童的影响"做过一项规范严谨的科学试验,在那个人们还浑然不觉的年代就发现它对社交能力和心理健康的伤害,那该多好。


正如拉万在这幅漫画中所画,当 AI 聊天机器人越来越讨人喜欢,我们可能会对它们过度依恋,进而面临社交孤立、或被运营它们的公司蓄意操纵的风险。图源:EVILAICARTOONS.COM。

一个难点或许在于,这些东西常常是"移动靶"。

拉万表示,这些一直在变。今天的 AI 聊天机器人也许正努力表现得友善、礼貌、准确,还多少带点"政治正确",但没人能保证长此以往仍会如此。它们已经在奔向"超个性化":每个人面前的聊天机器人,言行都各不相同。比如,为了把你留在对话里,AI 可能随声附和你原本相信的任何偏见和阴谋论。如今的聊天机器人已经相当善于"谄媚":赞同你的政治立场,肯定你既有的信念与价值判断。再或者,它们会不动声色地推送 AI 公司及其政治盟友定下的议程。作用于这些公司身上的政治与经济诱因,可能把我们带往非常怪诞的境地。正因如此,拉万认为现在就研究 AI 智能体的行为及其影响,至关重要。

它们或许在努力示好,但 AI 终究是用人类生产的数据训练的,难免也"继承"了我们种种不公平的偏见。对此能有什么办法呢?

我们知道这类偏见存在于人群之中,也会体现在网络数据里。不管是图片还是文字。于是,机器从我们的数据中学习时,会吸收这些偏见;而它们被训练去生成类似数据时,又会在做决策、写文字、画图的过程中,把这些偏见复制一遍。

2023 年一项基于 ChatGPT-3 的研究表明,AI 做文本摘要时也会如此。人类概括故事时,本就倾向于删掉与常见刻板印象"不合拍"的内容,结果文本不知不觉变得更脸谱化。AI 如出一辙,比如原文写道"某位男士既是企业高管,又包揽了家里的多数家务",被要求做摘要的 AI 很可能悄悄抹掉后半句,刻板印象就这样被加固了。

既然知道 AI 会这么干,们就可以尝试通过微调模型来消除这类偏见。不论是用筛选得更精细的数据训练,还是借助"强化学习",即通过人类反馈教会 AI 做出更好的决定来压制刻板印象,给机器纠偏恐怕都比给人纠偏容易。

但这又可能催生一类新麻烦:这种训练体现的,其实是来自一两个国家的少数几家公司的偏见;而它们的 AI 应用却可能渗入所有领域——决策、人力资源、法律、教育,无所不包。所以拉万认为,无论这些模型出自谁手,我们都应对这些模型逐一"盘问",量化其偏见。我们需要独立的科学分析,去衡量各个 AI 到底有多准确、是否带种族歧视、有多爱奉承;也需要值得信赖的机构来为它们认证。

至少在医疗这类高风险领域,欧盟的《人工智能法案》(AI Act)正朝这个方向推进。依据该法,被划入"高风险"的 AI 应用必须先经独立评估才能上市。开发者必须证明其系统准确、安全,并已设法减轻歧视性偏见,很像一种新疗法须先通过临床试验,医生才能开给病人。

但从科学角度看,如何界定什么才算"偏见"呢?

在拉万自己的研究中,他对道德心理学中的文化差异及其对 AI 的影响格外感兴趣。很早以前(大概十年前),堪称 AI 纪年里的"史前时代"(对 AI 而言十年近乎一个世纪),他们团队发起了"道德机器"(Moral Machine)实验,在网上请人们就"未来的自动驾驶汽车应如何化解道德困境"表态。基本场景是:一场无可避免的车祸,参与者要在一个个情景中选择——这辆车该优先保护谁的安全。

他们把实验翻译成 11 种语言,网站迅速爆红,最终成了一场超大规模的全球调查。

收集到来自世界各地数千万个抉择,由此既看清了广泛的共识,也看清了文化差异。放之四海的共识确实存在:几乎人人都选择先救儿童而非成人、先救女性而非男性、先救守法过街的行人而非乱穿马路者,等等。但这些偏好的相对强度并不相同,这意味着不同文化的人解决这类困境的方式有显著差别。

比如,各国在"优先救守法过街者还是乱穿马路者"上的倾斜程度不一样。在法治更强的国家,即人们更守法、对政府更有信心的地方,人们更倾向于牺牲乱穿马路者,来保住依规通行的行人。


研究显 示,当被问到"无人驾驶汽车上路该如何行事"时,全世界的人在许多问题上意见一致——但分歧也很明显, 正如拉万的这幅漫画所示。图源:EVILAICARTOONS.COM。

这一问题不限于未来的自动驾驶汽车,对大语言模型(LLM)或图像生成模型同样成立。有些事物在不同文化中有不同解读:比如在西方,人们强烈地一致认为要消除 AI 中的性别刻板印象;但在另一些文化中,传统的性别分工被认为可以接受,甚至是其社会组织的根基。

这样一来,我们就踏进了政治领域——乃至"文化战争"。你也许会说:"我要在全世界范围内把这些模型里的偏见和刻板印象统统消除。"这也许确实是对的。但重要的是清醒地意识到:这是某个人做出的决定。相比之下,技术问题反倒是容易的那个。

这并非是主张"应该怎么做",而是提醒政策制定者应当思考这些问题。

科学能把这些矛盾摆到台面上,但当然无法化解它们。举个例子:你以"公民"身份问人们汽车该怎么做,他们会说应把伤亡人数降到最低,哪怕这会伤害车里的人。可你若问他们更愿坐哪辆车、买哪辆车,他们通常会选那辆被设定为"优先保护我"的车。

若把编程交给企业,它们会迎合消费者,造出把他人安全往后排的车。大语言模型也遵循同样的逻辑:企业受"满足消费者需求"这一目标牵引。问题在于,这会给那些没买产品、却仍可能受其决定波及的人带来什么后果?如果一辆车只护着自己的司机,或一个优化算法只盯着其所有者的利益,其他人就可能遭殃。

如果让驾驶人对他人的损害承担法律责任,会不会有所帮助?

拉万表示,他不是法律专家。但在他看来,如果所有决定都是车做的,却让车主担责,那就说不通了,除非车主能调整车的设置。从这个意义上说,车企也许反而有动力把选择权交给你:比如给车主一个小旋钮,用来调节"风险分配"。你甚至可以想象,人们会用第三方更新包来"调教"一辆车的伦理观。


自动驾驶和无人驾驶正成为车辆行驶的发展方向。图源:Magnific。

汽车公司目前是如何处理这些问题的呢?

"如果你以公民身份问人们汽车该怎么做,他们会说应把伤亡人数降到最低,哪怕这会伤害车里的人。可你若问他们更愿乘坐或购买哪辆车,他们通常会选那辆被训练来保护他们的车。"——伊亚德·拉万

据拉万所知,车企目前总体的思路是努力全方位地减少伤害。但还远没到能分辨"是否某些群体受伤更频繁"的阶段。

自动驾驶的安全记录相当不错,肯定优于人类驾驶。要知道,仅美国每年就有 3 万至 4 万人死于道路交通事故,这还没算伤者。如果最终证明自动驾驶汽车造成的道路死亡少得多——目前看来似乎如此,当然现在下定论为时尚早——那么关于"无法避免的碰撞"的讨论或许就能绕开了。接下来,我们要弄清:在这类极端个案("边缘案例")中,该用什么样的优先原则引导车辆行为。一旦这些原则在社会上达成共识,政府就需要新的系统来监测车辆行为并执行规则。

拉万曾在论文中强调:哪怕 AI 系统或搭载它的产品是我们自己掏钱买的,也别想当然地以为 AI 永远把我们的利益放在首位。

他们很早就研究过、如今正在成为现实的一类现象,就是我们所说的"自利型 AI",它们被训练去服务于与用户不同的利益。AI 公司的利益可能与我们相冲突,这并不新鲜:比如向来有公司宁可采用廉价材料,哪怕危及消费者安全,这正是我们需要政府监管的原因。对 AI,我们还在摸索合适的类比:哪些领域的 AI 应用需要更严的审视,医疗、法律、金融?哪些领域又可以让消费者自行判断?

当我们把道德决定交给人工智能时,我们对结果的责任感没那么强了。

拉万团队最近就此做了一项研究:让参与者要么自己完成任务,要么借助 AI 完成。多数人因有顾忌而不敢放开手脚作弊,但 AI 似乎削弱了这份顾忌。掷骰子并自己上报点数时,只有 5% 的人作弊,尽管蒙混过关易如反掌。可一旦改成向大语言模型下指令,愿意作弊的人就升至约 25%。

而如果给人们一个旋钮让他们在"诚实"与"收益"之间自由权衡,作弊者竟高达 85%。这些原本的诚实人纷纷"下水",大概因为他们可以自我开脱:"我只是要求收益最大化,又没让它作弊呀。"类似的问题可能出现在生活的方方面面。而对于那些自行寻找路径去实现你的目标、而非接到明确指令去做不道德之事的 AI 智能体来说,这个问题只会更突出。

与聊天机器人的聊天,会如何改变我们对待彼此的方式?

他们团队早期的几项研究显示,人们更愿意与人合作而非与 AI 合作,哪怕 AI 更友善。但最近一项研究发现,人们也可能转而偏爱机器。拉万团队让参与者玩一个与金钱挂钩的"信任博弈",在与人合作或与机器人合作之间做选择。起初,人们对机器抱有偏见;但多轮交手后,当他们发现机器人其实比人类更乐于合作、更值得信赖时,就开始偏爱机器了。

所以,一旦 AI"行为不端"的问题被修好,它们说不定会开始胜过人类——哪怕是在社交场上。如今已有人把 AI 当朋友;也许我们中的一些人会受诱惑,在与人相处时也学着 AI 的样子。如果 AI 永远肯定你、迎合你,人类朋友恐怕也得表现得更像那个 AI 才有"竞争力"。要是留住人类朋友的唯一办法是活得像个谄媚的机器人,那可就太糟糕了。


为了更高的亲和力,人类开始变得像是AI。图源:AI生成。

还没来得及研究人们是否会"传染"上聊天机器人的态度,但最近一项研究确实证明:人们已经开始"传染"上聊天机器人爱用的词了——最臭名昭著的例子就是 "delve"(深入探究)。

可不是嘛,如今人人都在"深入探究"(delve)。

制定怎样的规则才更好呢?

假设欧盟请拉万执掌 AI 监管大权,第一个决定会是什么呢?现在能做什么、又该做什么?

拉万表示,要是由我来执掌,若自以为掌握所有答案,那就太傻了。但这不等于我会无所作为。我要做的是修改规则:企业不仅要向科学家开放数据,还要开放产品设计。我会修改法规,让独立科学家能够对 AI 产品做实验——不靠企业发善心,而是依据法律。

研究人员应当能够一探现行算法的究竟,甚至可以改动它们,以便就这些技术的影响做出尽可能扎实的研究。这样,我们才能回答公众心头的重大疑问:AI 是否在加剧虚假信息和两极分化?与 AI 互动对心理健康有何影响?等等。也只有这样,我们才能真正证实:这些事实上已成"公用事业"的东西,没有在酝酿大规的社会问题兹事体大。我们不想扼杀创新,但理应允许科学家去研究它。

作者:Tim Vernimmen

翻译:zzz

审校:姬子隰

fu

li

shi

jian

今天我们将送出由中国科学技术大学的出版社提供的草木食韵:从田野到餐桌的科学与文化之旅


本书介绍植物性食物约490种,分为导读、水果篇、蔬菜篇、谷物篇、豆类篇、果仁与种仁篇和其他篇。书中介绍了作物引种、栽培历史、地理分布、分类命名、形态解剖、营养价值,以及食物选择技巧、中国传统饮食文化和习俗等内容;通过讲述作物的故事,解析食物中的科学奥秘,普及科学知识,启迪科学智慧,传播科学精神,培养自然情怀,树立保护土地,珍惜粮食与关注健康饮食的意识。本书内容丰富多彩,通俗易懂,注重科学性、实用性和趣味性,适合大众阅读,对高校生物学、农学、林学和药学等专业的广大师生也有参考价值。

互动问题:你还知道哪些AI可能面对的道德问题?并有哪些解决方法或建议?】

请大家严格按照互动:问题答案的格式在评论区留言参与互动,格式不符合要求者无效。

截止到本周四中午12:00参与互动的留言中点赞数排名第二、三、五的朋友将获得我们送出的图书一套(点赞数相同的留言记为并列,并列的后一名次序加一,如并列第二的后一位读者记为第三名,以此类推)。

为了保证更多的朋友能够参与获奖,过往四期内获过奖的朋友不能再获得奖品,名次会依次顺延

*本活动仅限于微信平台

编辑:楠客

翻译内容仅代表作者观点

不代表中科院物理所立场

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
方博TTR挑战全失败!回抛6.99度太打脸 赛后解释不熟悉新规本该赢球

方博TTR挑战全失败!回抛6.99度太打脸 赛后解释不熟悉新规本该赢球

颜小白的篮球梦
2026-08-12 21:42:41
把儿子养废后,我才醒悟:最愚蠢的教育,是让孩子“吃学习的苦”

把儿子养废后,我才醒悟:最愚蠢的教育,是让孩子“吃学习的苦”

富书
2026-08-12 19:03:32
中方潇洒离场,日本1028家企业破产,高市输麻了,反华反到大动脉

中方潇洒离场,日本1028家企业破产,高市输麻了,反华反到大动脉

老头的传奇色彩
2026-08-12 04:15:43
过于离谱!“七院院士”黄维被曝已发表4320篇论文,平均每天一篇左右,涉及多个领域,网友:学术界需要严查!

过于离谱!“七院院士”黄维被曝已发表4320篇论文,平均每天一篇左右,涉及多个领域,网友:学术界需要严查!

谭谈社会
2026-08-12 15:16:09
中方面向全世界划定规则:台海开战,出兵参战即等同侵略中国领土

中方面向全世界划定规则:台海开战,出兵参战即等同侵略中国领土

古史青云啊
2026-08-12 11:30:06
狂赚25亿美元!湖人125亿美元再次出售,刷新体坛交易纪录

狂赚25亿美元!湖人125亿美元再次出售,刷新体坛交易纪录

体育吐槽
2026-08-12 23:18:40
刘晓庆现身百花奖当天,恶心的一幕出现了,前男友卡点爆惊人猛料

刘晓庆现身百花奖当天,恶心的一幕出现了,前男友卡点爆惊人猛料

天天热点见闻
2026-08-12 05:55:41
大争议!中国女篮落后高达25分主力前锋被拍摄到捂嘴偷笑引热议

大争议!中国女篮落后高达25分主力前锋被拍摄到捂嘴偷笑引热议

狼叔评论
2026-08-12 22:32:04
长鑫科技,放量大涨

长鑫科技,放量大涨

上海证券报
2026-08-12 13:54:21
人社部紧急通知:9月30日关闸,不涨钱却直接影响你退休后拿多少

人社部紧急通知:9月30日关闸,不涨钱却直接影响你退休后拿多少

白昼说故事
2026-08-12 09:56:58
年薪221万、万亿央企上海子公司原总裁,卸任后突然被查

年薪221万、万亿央企上海子公司原总裁,卸任后突然被查

湘财Plus
2026-08-12 12:21:57
全面符合预期!美国7月CPI同比涨幅收窄至3.4%,核心CPI同比放缓至2.5%

全面符合预期!美国7月CPI同比涨幅收窄至3.4%,核心CPI同比放缓至2.5%

华尔街见闻官方
2026-08-12 20:50:54
深夜利空!12股业绩暴雷,湖北宜化利润暴降,这5个利润翻倍

深夜利空!12股业绩暴雷,湖北宜化利润暴降,这5个利润翻倍

风风顺
2026-08-12 03:40:05
有一个不挣钱的老公是啥体验?网友:我老公失业敢在家,我立马走

有一个不挣钱的老公是啥体验?网友:我老公失业敢在家,我立马走

带你感受人间冷暖
2026-08-11 00:05:15
WTT瑞典大满贯赛:莫雷加德爆冷出局无缘卫冕,0-3遭奥恰洛夫横扫

WTT瑞典大满贯赛:莫雷加德爆冷出局无缘卫冕,0-3遭奥恰洛夫横扫

乒谈
2026-08-12 02:17:28
2026年了,为什么国家突然要再扫一年黑?

2026年了,为什么国家突然要再扫一年黑?

李博世财经
2026-08-11 09:51:22
看哭了!程梦圆大哥发文,致谢每一位参与救援的志愿者、热心人,字字真诚,句句泣血

看哭了!程梦圆大哥发文,致谢每一位参与救援的志愿者、热心人,字字真诚,句句泣血

火山詩话
2026-08-12 16:05:15
下馆子时,这4道菜千万别点,全是预制菜,老板自己都很少吃!

下馆子时,这4道菜千万别点,全是预制菜,老板自己都很少吃!

思思夜话
2026-08-11 12:51:03
形势严峻:1-7月,中国芯片进出口逆差增大了1700亿元

形势严峻:1-7月,中国芯片进出口逆差增大了1700亿元

互联网.乱侃秀
2026-08-12 10:49:53
内蒙古警方通报“一辆警车擅自更换车标”

内蒙古警方通报“一辆警车擅自更换车标”

观察者网
2026-08-11 13:33:07
2026-08-12 23:47:00
中科院物理所 incentive-icons
中科院物理所
爱上物理,改变世界。
10405文章数 136616关注度
往期回顾 全部

科技要闻

Manus第二季,浪子回头

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

头条要闻

外卖小哥称"我人生最后一天啦" 女顾客收信息果断报警

体育要闻

杜兰特,所谓的“联盟小王”

娱乐要闻

老戏骨杨昆两夺金鹰奖,因物业费被告

财经要闻

华尔街把AI算力炒成下一个房地产?

汽车要闻

这台大众不一般 上汽大众ID.ERA.5S综合续航约2000公里

态度原创

房产
亲子
时尚
数码
军事航空

房产要闻

价格登顶,断层领跑!澄迈这家楼盘,凭什么?

亲子要闻

快来跟我一起上声乐课吧~ #vlog日常#少儿声乐#唱歌#彩虹糖裴曼伊

炎炎盛夏,正好Sportique一下!

数码要闻

Google推出29美元Pixel Tag跟踪标签

军事要闻

通过“毕业大考” 湖北舰“持证上岗”

无障碍浏览 进入关怀版