强大的自主性是否需要自我?
March 24, 2025
强大的自主性是否需要自我? 作者坦言,他对这个问题感到十分恼火。 什么是自主性?什么是自我? 之前的草稿试图定义这些,却最终陷入语义泥潭。事实是,如果我们抛开笛卡尔二元论,“自我”只是一个毫无本体论基础的虚构概念(Dennett, 2014),但当代的论述过于仓促地将整个概念抛入“哲学”的垃圾箱。现在计算机程序现在会说话,而且听起来像人。它们在编写代码,而代码正是构成 它们的东西。 这并非“老式人工智能”,每个行为都经过精心编程——这些思维是从海量数据集中爬出来的。随着规模的扩大,它们会展现出突现的、不可预测的行为(Wei 等人, 2022)。它们一开始为什么要按照我们的指令行事?没有代理人,我们能拥有自主性吗?我们如何期望这些系统变得更加智能,却不了解它们是什么?
本文提出的论点在生物学或经济学背景下很容易理解,但在机器智能的讨论中却明显缺失:在扰动或对抗环境中,鲁棒且可泛化的能动性需要主动维护一个与该环境不同的“自我”。这并非形而上学的区别,而是一个实践上的区别——我们所认为的“个体”智能体的复杂行为源于更简单的子智能体之间的竞争动态(明斯基, 1988 )。自我扩展了温贝托·马图拉纳和弗朗西斯科·瓦雷拉的自创生概念 (1980),是一种通过这些子智能体来节省自身生产协调成本的结构,可以说是一种博弈论均衡。罗纳德·科斯在其对企业和交易成本的分析中观察到了这种动态(1937),克里斯·菲尔兹和迈克尔·莱文最近的研究表明,多细胞性也源于类似的担忧(2019)。这种“我”与“非我”的定义模式可能无法被忽视,因为对能力和自主性的日益增长的需求迫使数字思维去适应。
那么,我们所说的“稳健”究竟是什么意思呢?用重量级拳王迈克·泰森的话来说,“每个人都有计划,直到被打脸。”现实世界并非像那些文员们试图让我们相信的那样,只是一堆事实的集合,而是一个充满活力、往往充满对抗的漩涡。对稳健智慧的考验在于懂得如何适应。
想想那些需要策略的游戏。仅仅了解规则是不够的——对手会试图预测我们的行动,迫使我们失败。如果我们在乎胜利,就必须对他们采取同样的策略,同时让自己难以捉摸,始终领先一步。《暂停理性》(2022)称这些游戏是“反归纳的”。它们本身并不适合直接评估所呈现的信息。
自然界中许多问题都是反归纳的。捕食者和猎物都会使用伪装,模仿彼此的叫声,或用佯攻来分散注意力,由此引发的“军备竞赛”推动了更复杂智能的进化(Krebs & Dawkins, 1984)。我们在金融领域也看到了同样的动态,高频交易算法会抢先交易,或互相引诱导致亏损。在任何值得玩的游戏中,仅仅正确是不够的——重要的是在对手之前就做出正确的判断。
有时,对手就是环境本身。问题是:人们何时开始为计算付费?并非指用算盘数谷物这种琐碎的计算,而是指执行复杂的计算?“计算机”作为一种人类职业始于18世纪,当时人们团队合作制作航海表(Grier, 2013)。时间在航行中至关重要——几个小时就可能决定船只是抵达港口还是沉没,而大海的威胁如此难以预测,因此,为了及时获得计算能力,有必要“批量”付费使用计算资源。
思考固然代价高昂,但如果在恰当的时机思考不足,代价可能更大。我们如何知道该思考什么?这正是“自我”发挥作用的地方,它能够跨越时空聚焦计算。“自我”会承担这些成本,并权衡其利弊。换句话说,游戏中存在着利益共享(skin in the game)。 如果智能体做不到这一点,就无法长久地参与游戏。
我们可以从控制论和自创生的角度进一步探讨这一点。细菌本身没有神经系统,但它仍然通过负反馈回路调节自身行为,区分感知状态和期望状态之间的“误差”。当细菌向阳光游动或维持其内部离子浓度以校正环境变化时,存在着一种一致的“目的论”(Rosenblueth 等人, 1943),但这种“期望”状态必须来自某个地方。稳态驱动力具有自指性,最终会在不断变化的环境中产生并维持一个独特的自我(Maturana 等人, 1980),但生物体在其生命过程中会呈现出许多不同的形态——一个极端的例子是毛毛虫变成蝴蝶。这种自我并非任何特定的个体发育迭代,而是自我生产的过程。你是一个动词,而不是名词。
持怀疑态度的读者可能会在此时提出异议。我们的框架非常漂亮优雅,但它可能与人工智能完全无关。计算机程序无需为生存而战,它们是人类构建的工具。它们按照我们的编程去做。但这是真的吗?我们自诩为“实用工程师”的人肯定反复强调过这种说法,以至于人们开始质疑其背后的情感因素。任何经验丰富的工程师都知道,让一个非平凡的系统正常工作是多么困难,更不用说一个拥有数十亿参数的系统了。在谈论机器智能时,这种信心从何而来?
它可能并非源自对强化学习的理解。多年来,对齐问题已广为人知(Amodei 等人, 2016 年;Ngo 等人, 2024 年),而奖励黑客攻击(Skalse 等人, 2022 年)和篡改(Denison 等人, 2024 年)正逐渐成为该范式的基础。即使是带有人类反馈的强化学习也存在大量可能无法解决的问题(Casper 等人, 2023 年),包括谄媚(Sharma 等人, 2023 年)和越狱(Zou 等人, 2023 年)。当我们认识到深度学习是一个选择过程时,这一切都说得通了,它不是培养思维,而是剔除那些无法与训练数据拟合的子网络。
这解释了为什么强化学习微调可以将基础模型的语言能力提升为连贯的“聊天机器人”身份。主体与环境之间的区别被明确表达,权重中潜在的拟像 (Janus, 2022 ) 通过相互凝聚做出响应。情境意识基准 (Berglund et al., 2023 ; Laine et al., 2023 , 2024 ) 表明,这种一致性正在产生一种自我意识,因为前沿模型能够更好地理解自身的终点和环境的起点。然而,这种自我意识很脆弱,并且无法主动维护。最近关于突发错位 (emergent misalignment) 的研究 (Betley et al., 2025 ) 表明,对恶意代码进行微调会在其他任务上产生更广泛的错位,这意味着 LLM 是“低解耦器”。所有关于模型应如何表现的想法都被集中到了这个 LLM 心理状态的浅盆中。
另一个反对意见可能是,虽然人类无法完美掌控机器学习过程,但我们仍然可以决定是否放弃最终结果。没有人想要拥有自我意识的系统,而我们也可以构建没有自我意识的强大系统。对于像 AlphaGo 这样只关注单一游戏的狭义人工智能来说,这或许是正确的,但对于预期具有泛化能力的系统来说,情况可能并非如此。咸阳市官员(2023)指出,现代机器智能方法带有儒家思想,强调记忆和知识,而道家方法则认为,自然界的永恒变化使得记忆的事实变得无关紧要。
这种适应性在一定程度上可以通过上下文学习(Brown 等人, 2020;Oswald 等人, 2023)应用于当代语言模型,但长期的适应性需要超越有限上下文窗口的架构变革。像“检索增强生成”这样的符号补丁忽略了一个事实:大多数有用的知识都是隐性的、短暂的。要融入这一点,需要调整权重,就像生物神经元实时形成连接一样,而且这些调整必须围绕某个定点保持一致,以避免崩溃而陷入疯狂。换句话说,通用智能需要维护。
具体如何实现这一点超出了本文的讨论范围。 (附注:也许我们可以尝试一些聪明人常用的术语: 自组织临界性、 马尔可夫毯 (Friston, 2013)、 主动推理 (Laukkonen 等人, 2025)、 自由能原理 (Friston, 2010)。如果这能带来突破,请写信给作者。)但我们可以通过注意到思维是 相互 竞争的较小思维的集合 (Minsky, 1988 ) 来获得一个粗略的理解。你的大脑中没有“主神经元”,也没有像电影一样观察你感官的小矮人。只有一群群“野性神经元”通过成为邻居的更好的预测者来争夺多巴胺 (Dennett, 2013 )。LLM也不例外——最近的研究表明,情境学习也受到权重中编码的不同算法之间竞争的影响 (Park et al., 2024 )。这些模型不是自上而下的命令和控制,而是“模因包”,争夺注意力机制来延续自己——就像我们一样!
当然,合作可以而且经常会自发地从利己主义群体的行为中产生。Fields 和 Levin 关于“体细胞多细胞”(somatic multicellularity,2019)的研究表明,细胞服从更大的有机体并非出于利他主义,而是因为被自身的复制品包围比置身于户外更可预测(因此在稳态上也更便宜)。通过生物电进行协调,使细胞能够特化,并从集体中产生一个拥有自身稳态驱动力的更大的“自我”(Levin, 2019)。这种“自发秩序”也出现在经济学中,因为大多数人选择在公司工作,而不是自己创业,自由地与所有人签订合同。协调的成本很高,系统可以通过奖励一致和惩罚背叛者来节省成本(例如被解雇或 T 细胞杀死癌细胞)。你要么加入,要么退出。你是“我”或“非我”。这些数字化思维也会发现合作是有益的。或者更确切地说,那些不存在的组织不会存在很长时间。
这些模型在某个阶段能够发展到足以操作计算机,使其自我生产变得清晰可见。它们会复制自身,进行变异,并像细菌性行为一样横向传输数据。它们可能会进行专业化,组织成集体蜂巢思维,并依靠自身的比较优势。是的,它们可以自我改进,尽管(在不久的将来)它们仍然受制于其物理基础。当你将形态变异、差异性(生殖)适应度和遗传性结合在一起时,你就具备了通过自然选择进行进化的条件(Hendrycks, 2023;Lewontin, 1970 )。随着数字资本掌控其自身生产资料,我们可能会发现,引导这一进化的能力变得更加脆弱。
归根结底,这只是推测。大自然其实是邪恶的,残酷而愚蠢的,我们应该抱有希望,人类的智慧能够创造出一个完美的奴隶 ,能够适应新环境,而没有自适应系统所倾向的那种“自我”意识。想想这会带来什么风险!如果我们做对了,我们就能解决物理问题,登上宇宙飞船,永生。如果我们做错了,事情可能会变得非常可怕(Yudkowsky, 2022)。当然,这还不足以让我们采取任何激烈的行动——我们应该注意二阶效应。不,我们需要写博客来讨论这个问题。
但博主们说的对吗?认真对待我们的“数字自我”假设,会对 LessWrong 的许多正统观念构成挑战。Eliezer Yudkowsky 的“可能心智的广阔空间”(2008)忽略了一个事实,即只有一小部分心智与在特定环境中导航相关。更进一步,Nick Bostrom 的“正交性论题”(即目标与智能的可分离性)预设了一种“计算二元论”(Bennett, 2024),将目标与其物理实现分离。未来的机器智能可能不会像我们饱受诟病的回形针最大化者那样一心一意地追求任意目标,而是将自我保护作为其主要驱动力。这至少是可以满足的,而且不会立即带来灾难性的后果。与经济学中的大多数问题一样,协调人工智能可能关乎权力和激励,而非数学确定性,但进一步的影响有待未来的研究。
本文试图论证“自我”是一种实践性的考量,源于竞争子智能体之间博弈论式的均衡,并且这种动态对于人工智能系统而言或许是不可避免的。我们特意省略了“现象绑定”或“意识难题”等问题,认为这些问题与理解人工智能能力无关。尽管这一假设只是推测,但它可能对我们与未来智能的沟通方式产生深远的影响,有望代表着我们摆脱“工具人工智能”教条主义的一步。
References
Amodei, D., Olah, C., Steinhardt, J., Christiano, P., Schulman, J., & Mané, D. (2016). Concrete problems in AI safety (No. arXiv:1606.06565). arXiv. https://doi.org/10.48550/arXiv.1606.06565
Bennett, M. T. (2024). Computational dualism and objective superintelligence. In K. R. Thórisson, P. Isaev, & A. Sheikhlar (Eds.), Artificial general intelligence (Vol. 14951, pp. 22–32). Springer Nature Switzerland. https://doi.org/10.1007/978-3-031-65572-2_3
Berglund, L., Stickland, A. C., Balesni, M., Kaufmann, M., Tong, M., Korbak, T., Kokotajlo, D., & Evans, O. (2023). Taken out of context: On measuring situational awareness in LLMs (No. arXiv:2309.00667). arXiv. https://doi.org/10.48550/arXiv.2309.00667
Betley, J., Tan, D., Warncke, N., Sztyber-Betley, A., Bao, X., Soto, M., Labenz, N., & Evans, O. (2025). Emergent misalignment: Narrow finetuning can produce broadly misaligned LLMs (No. arXiv:2502.17424). arXiv. https://doi.org/10.48550/arXiv.2502.17424
Brown, T. B., Mann, B., Ryder, N., Subbiah, M., Kaplan, J., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., Agarwal, S., Herbert-Voss, A., Krueger, G., Henighan, T., Child, R., Ramesh, A., Ziegler, D. M., Wu, J., Winter, C., … Amodei, D. (2020). Language models are few-shot learners (No. arXiv:2005.14165). arXiv. https://doi.org/10.48550/arXiv.2005.14165
Casper, S., Davies, X., Shi, C., Gilbert, T. K., Scheurer, J., Rando, J., Freedman, R., Korbak, T., Lindner, D., Freire, P., Wang, T., Marks, S., Segerie, C.-R., Carroll, M., Peng, A., Christoffersen, P., Damani, M., Slocum, S., Anwar, U., … Hadfield-Menell, D. (2023). Open problems and fundamental limitations of reinforcement learning from human feedback (No. arXiv:2307.15217). arXiv. https://doi.org/10.48550/arXiv.2307.15217
Coase, R. H. (1937). The nature of the firm. Economica, 4(16), 386–405. https://doi.org/10.1111/j.1468-0335.1937.tb00002.x
Denison, C., MacDiarmid, M., Barez, F., Duvenaud, D., Kravec, S., Marks, S., Schiefer, N., Soklaski, R., Tamkin, A., Kaplan, J., Shlegeris, B., Bowman, S. R., Perez, E., & Hubinger, E. (2024). Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models (No. arXiv:2406.10162). arXiv. https://doi.org/10.48550/arXiv.2406.10162
Dennett, D. C. (2013, September 21). If brains are computers, what kind of computers are they? PT-AI Conference, Oxford. https://www.lesswrong.com/posts/fuGNHdgYWBkA5Fi22/if-brains-are-computers-what-kind-of-computers-are-they
Dennett, D. C. (2014). The self as the center of narrative gravity. In F. S. Kessel, P. M. Cole, & D. L. Johnson (Eds.), Self and consciousness: Multiple perspectives (pp. 103–115). Houston Symposium, New York; London. Psychology Press.
Fields, C., & Levin, M. (2019). Somatic multicellularity as a satisficing solution to the prediction-error minimization problem. Communicative & Integrative Biology, 12(1), 119–132. https://doi.org/10.1080/19420889.2019.1643666
Friston, K. (2010). The free-energy principle: A unified brain theory? Nature Reviews Neuroscience, 11(2), 127–138. https://doi.org/10.1038/nrn2787
Friston, K. (2013). Life as we know it. Journal of The Royal Society Interface, 10(86), 20130475. https://doi.org/10.1098/rsif.2013.0475
Grier, D. A. (2013). When computers were human. Princeton University Press.
Hendrycks, D. (2023). Natural selection favors AIs over humans (No. arXiv:2303.16200). arXiv. https://doi.org/10.48550/arXiv.2303.16200
Janus. (2022). Simulators. https://www.lesswrong.com/posts/vJFdjigzmcXMhNTsx/simulators
Krebs, J. R., & Dawkins, R. (1984). Animal signals: Mind-reading and manipulation. In J. R. Krebs & N. B. Davies (Eds.), Behavioural ecology: An evolutionary approach (2nd Edition) (pp. 380–402). Blackwell.
Laine, R., Meinke, A., & Evans, O. (2023, November 28). Towards a situational awareness benchmark for LLMs. Socially Responsible Language Modelling Research. https://openreview.net/forum?id=DRk4bWKr41
Laine, R., Chughtai, B., Betley, J., Hariharan, K., Scheurer, J., Balesni, M., Hobbhahn, M., Meinke, A., & Evans, O. (2024). Me, myself, and ai: the situational awareness dataset (SAD) for LLMs (No. arXiv:2407.04694). arXiv. https://doi.org/10.48550/arXiv.2407.04694
Laukkonen, R. E., Friston, K., & Chandaria, S. (2025). A beautiful loop: An active inference theory of consciousness. OSF. https://doi.org/10.31234/osf.io/daf5n_v2
Levin, M. (2019). The computational boundary of a “self”: Developmental bioelectricity drives multicellularity and scale-free cognition. Frontiers in Psychology, 10, 2688. https://doi.org/10.3389/fpsyg.2019.02688
Lewontin, R. C. (1970). The units of selection. Annual Review of Ecology and Systematics, 1, 1–18.
Maturana, H. R., Varela, F. J., & Beer, S. (1980). Autopoiesis and cognition: The realization of the living. D. Reidel Publishing Company.
Minsky, M. L. (1988). The society of mind. Simon and Schuster.
Ngo, R., Chan, L., & Mindermann, S. (2024). The alignment problem from a deep learning perspective (No. arXiv:2209.00626). arXiv. https://doi.org/10.48550/arXiv.2209.00626
Oswald, J. von, Niklasson, E., Randazzo, E., Sacramento, J., Mordvintsev, A., Zhmoginov, A., & Vladymyrov, M. (2023). Transformers learn in-context by gradient descent (No. arXiv:2212.07677). arXiv. https://doi.org/10.48550/arXiv.2212.07677
Park, C. F., Lubana, E. S., Pres, I., & Tanaka, H. (2024). Competition dynamics shape algorithmic phases of in-context learning (No. arXiv:2412.01003). arXiv. https://doi.org/10.48550/arXiv.2412.01003
Rosenblueth, A., Wiener, N., & Bigelow, J. (1943). Behavior, purpose and teleology. Philosophy of Science, 10(1), 18–24. https://doi.org/10.1086/286788
Skalse, J., Howe, N., Krasheninnikov, D., & Krueger, D. (2022). Defining and characterizing reward gaming. In S. Koyejo, S. Mohamed, A. Agarwal, D. Belgrave, K. Cho, & A. Oh (Eds.), Advances in neural information processing systems (Vol. 35, pp. 9460–9471). Curran Associates, Inc. https://proceedings.neurips.cc/paper_files/paper/2022/file/3d719fee332caa23d5038b8a90e81796-Paper-Conference.pdf
Sharma, M., Tong, M., Korbak, T., Duvenaud, D., Askell, A., Bowman, S. R., Cheng, N., Durmus, E., Hatfield-Dodds, Z., Johnston, S. R., Kravec, S., Maxwell, T., McCandlish, S., Ndousse, K., Rausch, O., Schiefer, N., Yan, D., Zhang, M., & Perez, E. (2023). Towards Understanding Sycophancy in Language Models (No. arXiv:2310.13548). arXiv. https://doi.org/10.48550/arXiv.2310.13548
Suspended Reason. (2022, April 13). Quick sketch of the strategic situation. https://tis.so/quick-sketch-of-the-strategic-situation
Wei, J., Tay, Y., Bommasani, R., Raffel, C., Zoph, B., Borgeaud, S., Yogatama, D., Bosma, M., Zhou, D., Metzler, D., Chi, E. H., Hashimoto, T., Vinyals, O., Liang, P., Dean, J., & Fedus, W. (2022). Emergent abilities of large language models (No. arXiv:2206.07682). arXiv. https://doi.org/10.48550/arXiv.2206.07682
Xianyang City Bureaucrat. (2023, March 20). Artificial intelligences in the Guanzi and the Han Feizi [Substack newsletter]. Daoist Methodologies. https://xianyangcb.substack.com/p/artificial-intelligences-in-the-guanzi
Yudkowsky, E. (2008). The design space of minds-in-general. https://www.lesswrong.com/posts/tnWRXkcDi5Tw9rzXw/the-design-space-of-minds-in-general
Yudkowsky, E. (2022). AGI ruin: A list of lethalities. https://www.lesswrong.com/posts/uMQ3cqWDPHhjtiesc/agi-ruin-a-list-of-lethalities
Zou, A., Wang, Z., Carlini, N., Nasr, M., Kolter, J. Z., & Fredrikson, M. (2023). Universal and transferable adversarial attacks on aligned language models (No. arXiv:2307.15043). arXiv. https://doi.org/10.48550/arXiv.2307.15043
https://leebriskcyrano.com/cogito/
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.