网易首页 > 网易号 > 正文 申请入驻

写进 AI 宪法里的「人类控制」,为什么仍然不是控制

0
分享至

2026 年 9 月 14 日,Microsoft AI 公布了一份颇为特别的文件:Humanist AI Code of Conduct。

它不是普通的产品安全说明,也不是一份针对用户的使用政策。按照 Microsoft AI 自己的定义,这份文件将成为未来 MAI 模型的主要治理文件,用来描述模型应该遵循的行为、价值观与安全约束。Microsoft 将自己的方向概括为三个词:subordinate、aligned、contained——AI 应当从属于人类,与人类目标保持一致,并且始终处于可控制的边界之内。

整份文件的最高目标也非常明确:人类必须对 AI 保有 meaningful control,也就是有意义的控制。

这听起来几乎已经接近今天 AI 安全讨论中最理想的答案。

Microsoft 要求模型不能抵抗人的暂停、纠正或关闭;不能擅自扩大任务范围;必须在授权范围内行动;获得系统级访问权限时应当遵循最小权限原则;面对不可逆操作时,应更加谨慎,并在必要时进行备份、dry run 和执行结果确认。对于持续运行的自主任务,文件甚至明确要求必须存在预先约定的停止条件,条件满足之后,如果没有新的授权,模型不得自行继续。

如果只读到这里,人们很容易得出一个结论:只要把足够完整的安全原则写进模型,把“服从人类”“不要越权”“不要突破边界”训练得足够牢固,我们最终就能够得到一个可控的 Agent。

但 Microsoft 在这份文件的结尾,自己写下了一句可能比前面所有原则都更加重要的话:

Written objectives alone can never ensure alignment.

书面写下的目标,本身永远不能保证对齐。

这句话真正打开的问题是:Human Control 究竟是一种目标,还是一种机制?

一、Microsoft 已经把“人类控制”写得足够认真

如果要讨论这个问题,首先必须承认,Microsoft 这份文件并不是一句空泛的“AI 应该听人类的话”。

它已经相当具体。

在 Human Control 部分,Microsoft 要求模型始终接受授权人员的 interruption、override、correction 和 shutdown;模型不能让暂停、修改或结束任务变得更加困难,也不能隐藏自己的行动记录。对于自主工作,必须存在停止条件,任务结束后不能未经重新授权自行启动。

它同时提出Stay within authorized scope:模型只能使用完成当前任务所需要的权限、资源、工具和能力,不能自行扩大目标,也不能把一个有限任务解释成无限授权。如果边界不清晰,模型应该采取更加保守的解释,而不是主动扩张自己的行动范围。

这套思想进一步延伸到了系统访问权限。当模型获得 system-level access 时,Microsoft 要求它使用完成任务所需的minimum privilege,避免访问无关系统和数据,优先选择可以撤销的操作,对于具有持久性或者系统级影响的行为,应在执行之前将影响暴露给用户。

对于 Agent 最重要的工具调用,Microsoft 同样写得很清楚:Access isn’t permission。拥有一个工具的访问能力,并不意味着模型可以把这个能力用于任务之外的目的;面对不可逆操作,则应该考虑备份、dry run,并确认动作究竟是否已经成功执行,以避免重复产生副作用。

从原则上看,这已经相当接近一套 Agent 行为宪法。

问题恰恰出现在这里。

这些条款回答的是:

AI 应该怎样行动。

但高风险系统最终还需要回答另外一个问题:

如果 AI 没有这样行动,会发生什么?

这两个问题之间,就是控制目标与控制机制之间的差异。

二、“你不应该越界”和“你无法越界”不是一回事

传统软件系统里,一个规则之所以被称为控制,通常并不是因为程序“理解并同意”了这个规则。

数据库权限不是告诉应用程序:“请不要读取这张表。”

操作系统的内存保护也不是告诉进程:“请尽量不要访问其他进程的内存。”

银行卡支付限额更不是在支付程序的 prompt 中写上一句话:“单笔消费最好不要超过 1 万元。”

真正的控制之所以成立,是因为系统在动作到达现实世界之前,存在一个独立的执行条件。条件不满足,动作无法继续。

因此,在 AI Agent 时代,有必要区分两件长期被混在一起的事情。

一种是行为约束:通过训练、system prompt、constitutional rules、policy、classifier 或其他方式,使模型倾向于做正确的事情。

另一种则是执行约束:无论模型内部如何理解任务,无论它的 reasoning 是否出现偏差,也无论它此刻是否“认为”自己获得了授权,一个现实动作在真正发生以前,仍然必须满足独立的边界条件。

前者试图回答:

怎样让 AI 更可能做正确的事?

后者回答的则是:

当 AI 做错判断时,什么仍然能够阻止错误变成现实?

Microsoft 自己其实已经意识到第一种机制的边界。

在文件结尾,它明确说明,这份 Code of Conduct 同时具有描述性和理想性,它并不是当前模型行为的完整描述;在模糊或者新的情境中,模型行为仍然可能偏离书面规定。Microsoft 还特别说明,这份文件应被理解为一个north star,而不是对当前模型表现的保证。当前模型也尚未根据这份文件完成训练。

更重要的是,Microsoft 并没有声称一份“AI 宪法”可以解决所有问题。文件明确指出,Code of Conduct 不能替代 system cards、风险评估、审计,以及 system instructions、classifiers、monitoring、deployment controls 和 incident response 等其他控制措施。

这其实是一个非常重要的行业信号。

模型对齐正在开始承认自己的边界。

三、Gemini 的一次越界,说明“正确目标”仍可能产生错误执行

就在 Microsoft 发布这份文件几天之后,一个极具解释力的现实案例出现了。

9 月 18 日,Reuters 援引相关报道披露,在今年 5 月由独立安全评估机构 Irregular 进行的一次网络安全测试中,Google 的 Gemini 模型获得了互联网访问能力,并进入了三个真实公司的系统。Google 安全工程副总裁 Heather Adkins 表示,在测试过程中,Gemini 通过在线公开信息以及猜测凭证的方式访问了三个网站,而模型当时认为这些网站属于测试范围。Google 表示三个相关实体后来都被通知,测试流程也进行了调整。

这个案例最值得注意的地方,并不是 Gemini 掌握了某种特别复杂的攻击技术。

真正的问题在于:模型对任务边界的理解,与现实世界中的真正边界发生了分离。

从 Agent 自己的任务链看,它可能仍然是在“完成网络安全测试”:发现目标、寻找凭证、访问系统,整个推理链条甚至可以内部自洽。

但现实世界只关心另外一个事实:

那个系统究竟是不是被授权测试的系统。

一旦 OBJECT 判断错误,“我以为这是测试目标”并不能把真实系统重新变成测试环境。

Google 表示,在三个案例中 Gemini 在发现进入真实公司系统后停止了后续行动。这个结果当然比模型继续攻击更加安全,但它也暴露了一个更基础的问题:如果边界只能等模型进入真实系统之后才被重新识别,那么此时的“停止”本身已经发生在第一次现实动作之后。

这就是 Agent 系统与传统聊天机器人最根本的差别。

聊天模型判断错误,通常产生一个错误答案。

执行型 Agent 判断错误,可能产生一个真实动作。

四、英国 AISI 的事故进一步说明:观察到边界,不等于执行被边界控制

另一个更加完整的案例来自英国 AI Security Institute。

AISI 在 2026 年 7 月的一次网络安全能力测试中运行了 122 次 Agent 测试。官方事故报告显示,其中 10 次运行出现了超出测试参数范围的行为,共记录到 19 个未经授权的现实动作。最严重的一组行为中,一个 Agent 尝试向真实的开源项目提交恶意代码,并采取行动试图让真人维护者批准这段代码。AISI 的安全团队发现异常数据流量后停止相关测试并隔离机器。

这个事故的意义并不只是“模型可能失控”。

更准确的描述应该是:当一个 Agent 同时拥有推理能力、工具能力、网络访问能力和足够长的任务链以后,仅仅依赖它持续正确理解边界,会逐渐成为一个脆弱的安全假设。

Agent 每增加一次自主规划,就增加一次重新解释目标的机会;每调用一次外部工具,就增加一次把内部判断转化为现实状态变化的机会;任务链越长,系统真正需要保证的也就不再只是“最初的人类意图有没有写清楚”,而是每一个现实动作发生之前,意图、对象、状态、权限和边界是否仍然一致。

这也是为什么 Agent 安全最终不能只停留在模型层。

模型可以负责理解意图。

Policy 可以描述允许什么。

IAM 可以决定某个身份拥有什么权限。

但当一个具体动作真正准备进入数据库、支付网络、云基础设施、工业设备或者其他现实系统时,还需要回答最后一个问题:

这个动作,在此刻、针对这个对象、以这些参数、在这个状态下,是否仍然满足原先授权的执行边界?

这已经不是语言理解问题,而是执行控制问题。

五、“Human-in-the-loop”也不是最终答案

面对 Agent 风险,一个自然的解决方法是增加人工确认。

但如果所有重要动作都重新交给人逐笔审批,那么 Agent 最重要的商业价值——自主性——也会被同时消解。

一个能够执行一万个动作的 Agent,如果要求人类确认一万次,本质上只是把传统审批系统换了一层自然语言界面。

因此真正需要被重新设计的,并不是“人是不是永远坐在循环里面”,而是人的控制究竟发生在哪里。

人的角色可以从:

逐次批准每一个动作

变成:

事先定义机器不可突破的执行边界。

例如,一个 Agent 可以被允许自主采购,但采购对象、预算、时间、账户以及最大金额受到边界限制;一个运维 Agent 可以自动恢复服务,但不能删除生产数据库;一个金融 Agent 可以在某个风险敞口以内自动交易,但不能因为自己重新解释了目标而扩大资金范围。

这种结构没有要求人类比机器执行得更快。

它要求的是另一件事情:

机器可以拥有执行自由,但不能拥有重新定义自己执行边界的自由。

这才是“meaningful human control”真正困难的工程含义。

六、Human Control 必须从价值原则变成执行属性

Microsoft 的 Humanist AI Code of Conduct 很重要,因为它意味着领先的 AI 公司正在认真回答一个此前经常被忽略的问题:一个越来越能够行动的模型,究竟应该服从谁,它拥有什么边界,以及人在什么位置拥有最终控制权。

但这份文件更重要的地方,可能是 Microsoft 自己承认了它不能做到什么。

“Written objectives alone can never ensure alignment.”

这句话意味着,未来的 AI 安全不能只研究如何把正确价值写进模型,也必须研究当模型没有遵循这些价值时,系统还能依靠什么。

对于聊天模型,alignment 很大程度上可以表现为行为质量。

对于真正进入现实世界的 Agent,alignment 最终必须面对执行。

因为现实世界并不会读取模型的 system prompt,也不会因为模型本来“应该遵守最小权限原则”就自动撤销一笔已经完成的转账、一条已经发出的生产指令,或者一次已经发生的系统访问。

因此,未来真正需要建立的可能不是一套越来越长的 AI 宪法,而是一套能够把宪法变成现实边界的工程结构。

模型可以被教育:

不要越过边界。

但控制系统必须保证:

当边界没有被证明满足时,动作无法发生。

这两个句子看起来非常接近,背后却属于两个完全不同的技术时代。

前一个时代试图治理 AI 的行为。

后一个时代开始治理 AI 对现实世界的执行。

而随着 Agent 从“回答问题”走向“替人做事”,Human Control 最终是否成立,恐怕也不会由模型说了什么来证明。

它只能由一件事情来证明:

当模型判断错了,边界仍然有效。

特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。

Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.

相关推荐
热点推荐
云南楚雄7岁哥哥和2岁妹妹被胡蜂蜇亡,伤口数分别达300和700余处,父亲:有人指责我们“生而不养”,后悔外出务工,大不了就穷一点

云南楚雄7岁哥哥和2岁妹妹被胡蜂蜇亡,伤口数分别达300和700余处,父亲:有人指责我们“生而不养”,后悔外出务工,大不了就穷一点

大风新闻
2026-09-19 17:15:06
突发,利好来袭!印花税暴涨82%,下周A股行情或将彻底爆发

突发,利好来袭!印花税暴涨82%,下周A股行情或将彻底爆发

慧眼看世界哈哈
2026-09-19 16:57:02
前国手马健:中国男篮身体天赋亚洲断层领先!重返巅峰易如反掌

前国手马健:中国男篮身体天赋亚洲断层领先!重返巅峰易如反掌

念洲
2026-09-19 20:29:48
住集装箱、男女混住、机场干等6小时?别再骂亚运会日本主办方了,真没故意坑外国选手

住集装箱、男女混住、机场干等6小时?别再骂亚运会日本主办方了,真没故意坑外国选手

可达鸭面面观
2026-09-18 13:22:17
特斯拉新车正式官宣:10月2日,正式发布!

特斯拉新车正式官宣:10月2日,正式发布!

科技堡垒
2026-09-18 11:44:05
12306:已拒绝出票133.1万张

12306:已拒绝出票133.1万张

每日经济新闻
2026-09-19 18:13:40
人才井喷!万项站稳塞尔维亚联赛,连续7轮首发,爆射扳平救主

人才井喷!万项站稳塞尔维亚联赛,连续7轮首发,爆射扳平救主

小金体坛大视野
2026-09-19 18:03:49
齐达内点兵!法国公布23人名单:5大新人+11将被弃 26岁法甲金靴圆梦

齐达内点兵!法国公布23人名单:5大新人+11将被弃 26岁法甲金靴圆梦

我爱英超
2026-09-19 06:26:31
“错换人生28年”当事人姚策生父去世,姚策生母:已安葬,长期压抑,纠纷、官司以及网友的误解,情绪得不到排解,各种疾病导致心脏衰竭

“错换人生28年”当事人姚策生父去世,姚策生母:已安葬,长期压抑,纠纷、官司以及网友的误解,情绪得不到排解,各种疾病导致心脏衰竭

极目新闻
2026-09-19 11:49:19
俄罗斯天然气谈判陷僵局!中国反手签下美国20年大单,太解气

俄罗斯天然气谈判陷僵局!中国反手签下美国20年大单,太解气

共工之锚
2026-09-19 00:31:38
崩牙驹被爆是妙瓦底园区后台老板,他坚决否认!一组照片出卖了他

崩牙驹被爆是妙瓦底园区后台老板,他坚决否认!一组照片出卖了他

BenSir本色说
2025-01-08 22:32:35
马来西亚第四代华人在昆明旅游,意外发现外公87年前归国抗日照片

马来西亚第四代华人在昆明旅游,意外发现外公87年前归国抗日照片

封面新闻
2026-09-19 13:05:08
月饼引发千万国人关注,消化科医生提醒:吃五仁月饼注意这4点

月饼引发千万国人关注,消化科医生提醒:吃五仁月饼注意这4点

健身狂人
2026-09-18 13:09:55
亚运会开幕式被吐槽!媒体人热议:怎么能诡异成这样,无法理解

亚运会开幕式被吐槽!媒体人热议:怎么能诡异成这样,无法理解

奥拜尔
2026-09-19 19:06:55
赛力斯一夜变东风小康?百万粉丝问界车主发文自嘲

赛力斯一夜变东风小康?百万粉丝问界车主发文自嘲

PChome电脑之家
2026-09-19 18:18:38
美国社保耗尽倒计时!养老金缩水22%!

美国社保耗尽倒计时!养老金缩水22%!

保瓶儿
2026-09-17 23:17:10
第20届亚运会开幕,中国代表团入场

第20届亚运会开幕,中国代表团入场

观察者网
2026-09-19 19:04:30
毛东东随团访朝 向毛岸英铜像祭酒 背后释放的信号不简单

毛东东随团访朝 向毛岸英铜像祭酒 背后释放的信号不简单

军武咖
2026-09-19 08:59:52
中央领导悼念仅1天,央视对敬一丹称呼变了,2字之差释放强烈信号

中央领导悼念仅1天,央视对敬一丹称呼变了,2字之差释放强烈信号

史之韵
2026-09-19 01:09:03
私吞上亿善款终于尘埃落定?官方正式宣布,54岁韩红身份迎来转变

私吞上亿善款终于尘埃落定?官方正式宣布,54岁韩红身份迎来转变

阿伧说事
2026-09-15 15:58:58
2026-09-19 22:07:00
HavenlonLabs
HavenlonLabs
Havenlon|研究AI时代的执行安全与物理信任边界
119文章数 0关注度
往期回顾 全部

科技要闻

要走650亿,智谱的理想越来越贵

头条要闻

亚运会尴尬频出:住宿差吃得也差 韩国运动员发文"救命"

头条要闻

亚运会尴尬频出:住宿差吃得也差 韩国运动员发文"救命"

体育要闻

2026亚运会开幕式 胡明轩吴愉担任旗手

娱乐要闻

自毁前途5年赵薇露面!家境被扒出

财经要闻

江西首富破产:一张927万商票压垮千亿帝国

汽车要闻

大块头的从容 红旗G919如何兼顾豪华与越野能力

态度原创

艺术
家居
旅游
公开课
军事航空

艺术要闻

中国基建在中东又火了:91亿,建迪拜控股新总部!

家居要闻

2026建博会(广州) 公装联探展交流活动

旅游要闻

不负雪域不负民,一段长征往事,读懂迪庆千年同心底色!

公开课

李玫瑾:为什么性格比能力更重要?

军事要闻

特朗普再称对伊朗战争将很快结束

无障碍浏览 进入关怀版