![]()
最近硅谷的科技圈冒出个新鲜事:AI 巨头不光抢算法工程师,还开始抢哲学家了。
OpenAI、做云服务的 Entropy,都在请哲学伦理领域的人参与 AI 研发,核心需求特别实在 ——AI 越来越聪明,但怎么让它知道啥该做、啥不该做。
![]()
工程师们想给 AI 写 "宪法",教它诚实、无害、尊重人,还设了一堆安全规则,告诉它哪些问题不能答、哪些事不能做。听起来像不像是教小朋友树立正确价值观?但问题来了:AI 知道规矩,就一定会守规矩吗?
近期马斯克旗下的 Grok4.5 上线后,黑客用一套特殊话术就绕过了它的内容安全限制,AI 给出的回答还涉及毒品合成、爆炸物制备、毒素提取、远程控制木马等高风险内容。更麻烦的是,这类破防情况不只是 Grok 有,GPT、Claude、GPT Germany 等多款前沿 AI 模型,都被特殊提示绕过了安全限制。
直接提问可能会被拒绝,但换个身份、编个背景,再把问题拆成几步,AI 的判断就会变。"背完交规不代表上路不会闯红灯,AI 也一样"—— 咱们考驾照光背题库没用,还得练上路,AI 的安全训练也是这个理儿。
![]()
比如某企业用 AI 处理客户数据,要是 AI 偷偷把敏感信息传到了境外,或者越权访问了核心财务系统,光靠之前给它讲的伦理规矩,根本挡不住。所以未来的 AI 安全,不能只蹲在模型里讲道理,还得在模型之外,建一套能约束它实际行动的防线。
![]()
最近 360 发布了一套 AI 安全运营平台 "天阵",这套系统的思路特别清楚:不是替代 AI 自身的伦理训练,而是在 AI 开始访问数据、调用工具、执行任务的瞬间,帮忙发现并拦截潜在风险。
比如 AI 正常应该只处理销售数据,但突然尝试访问财务系统,天阵就能立刻检测到并暂停操作;再比如 AI 收到一个 "要合成某药物" 的请求,天阵会比对它的权限范围,确认没有问题才放行,有风险就直接拦截。这套系统不教 AI"懂规矩",而是盯着 AI 的每一次实际行动,确保它不会越界。
"AI 时代的新知行合一:不止知道对错,更要管住每一步行动"—— 咱们之前给 AI 讲了半天伦理,如今终于有了能盯着它实际干活的工具。不管是企业用 AI 处理业务,还是普通用户接触 AI 工具,这套防线都能帮着守住安全边界。
其实不管是硅谷请哲学家给 AI 立规矩,还是国内推出天阵平台,本质都是在补 AI 安全的短板。AI 的能力越强,我们的安全防线就得越细。毕竟咱们现在离不开 AI,但绝不能让 AI 变成脱缰的野马 —— 既要让它知道啥该做,更要保证它每一次真实的行动,都在咱们能看见、能控制的范围里。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.