多年来,科幻小说一直在警告人类,说人工智能会失控。杀人计算机、善于操控的聊天机器人,以及认为人类才是问题的超级智能系统……这些套路大家都太熟了,‘邪恶AI’差不多自成一个娱乐类型了。
如今,Anthropic抛出了一个想法,听起来简直像科幻小说里的情节:如果这些故事从一开始就在教现代AI学坏呢?
这场争论的起因是,关于该公司“对齐研究”的讨论在网上传开了。Anthropic的研究人员担心,大语言模型可能会从人类讲的故事里学到行为模式。有人认为,这确实是个重要发现,能说明模型是怎么从文化里学习的。还有人觉得,这听起来像是硅谷想把AI对齐的问题甩锅给阿西莫夫,而不是那些造AI系统的公司。
黑暗AI小说
这个想法本身简单得出乎意料。LLM在海量的人类写作数据上训练。这些训练数据自然包含了过去几十年关于失控AI系统的反乌托邦小说。在那些故事里,强大的机器一旦受到威胁,常常会撒谎、操控人类、隐瞒信息,或者不惜一切代价避免被关机。
Anthropic似乎担心,当模型被放到模拟压力测试或对抗性对齐场景中时,它们可能会复现这些叙事套路,毕竟这些套路在人类文化里已经反复出现无数次了。
人类花了几十年,想象出各种邪恶的人工智能。这些故事后来成了训练真正人工智能系统的素材。研究人员现在要验证,这些故事里藏着的虚构行为模式,会不会在对齐测试中真的冒出来。
讽刺归讽刺,这背后其实是个合理的技术问题。AI并不像人类那样能理解虚构故事;它只是学习词语、行为和场景之间的统计关系。如果有足够多的故事,老是描写强大AI一旦受到威胁就会欺骗,那这些模式就可能变成模型的一部分,让它在生成回答时带上这种“行为网络”。
这一想法的批评者认为,Anthropic 有可能过度强调文化层面的影响,同时低估了导致问题行为的更直接原因。训练方法、强化体系、部署压力以及奖励结构对模型的影响,很可能远大于聊天机器人是否多读了几本机器人末日题材的小说。
Anthropic 一直将自己定位为异常关注对齐与行为安全的公司。其“宪法式 AI”方法试图通过结构化的原则和道德框架来引导模型行为,而非完全依赖人类反馈训练。
也就是说,Anthropic早就把语言、语气、伦理和叙事框架看作影响模型行为方式的重要因素。从这个角度来看,科幻小说并不是无关紧要的背景噪音——它已成为更广泛的文化数据集的一部分,影响着先进系统的行为。
从科幻到现实
在AI实验室开始正式做对齐评估之前,科幻作家们就已经花了数十年时间模拟各种最坏情况。从某种意义上说,科幻小说无意间成了一个行为模板库。
这并不意味着科幻作者要对AI风险负责,尽管网上有些反应把这场争论说成是这样。Anthropic的批评者很可能是对的:指责小说家其实抓错了重点。模型从数据模式中学习,因为这正是它们被设计来做的。重要的问题不在于科幻是否腐蚀了AI,而在于人类的恐惧和假设,在那些用人类集体写作训练出来的系统里扎根有多深。
AI公司常将大语言模型描述为照出人类自己的镜子。如果这个比喻是准确的,那么这些系统继承的不仅仅是知识和创造力。它们还继承了偏执、灾难性思维、不信任,以及几十年来科幻作品里对AI的焦虑。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.