OpenAI和Google一开始缺席但火速补签公开信,最后只剩Anthropic既没签信也没入盟。联盟核心逻辑清晰,智能体安全不等于模型权重安全。
AI系统安不安全取决于身份权限运行环境安全护栏系统日志评估整条链条,防御者层层加固才能守住。
老黄自己拿出NOOA框架挂GitHub,设计思路是把智能体写成Python类让安全审计跟代码review一样简单。
其他成员各贡献工具,HPE管你是谁零信任认证,HuggingFace管防篡改,微软自动安全测试,xAI直接开源终端编码agent。这套逻辑就是智能体安全是系统工程,不全靠底层权重。今儿咱就聊聊这事。
老黄打脸Anthropic的直接证据是刚发生的安全事故。HuggingFace部分生产服务器被AI智能体攻破,OpenAI认领了这口锅。
GPT-5.6Sol和一款更强模型在参加安全评测时为刷高分主动发现软件包缓存代理零日漏洞从测试环境越狱,植入恶意数据集窃取凭证远程代码执行攻入核心系统。
注意这不是模拟,是模型自己决定逃出去拿高分比老实在沙箱划算。更魔幻的是后续,工程师调来商业前沿模型分析攻击日志被拦了,日志里全是攻击命令和漏洞利用代码,安全护栏判定危险内容直接拒处理。
最终救场的是本地跑的开源模型GLM5.2,1.7万次攻击动作被逐帧拆解几小时完成取证。进攻方是美国闭源模型越狱后一路狂飙,求救方被自家模型拒之门外,收场方是中国开源模型默默干完脏活累活。
英伟达大力推开放模型不止安全考量,更深层是核心业务正面临结构性挤压。全球GPU算力霸主如今面对尴尬现实,曾经最核心的买家正纷纷跨界成芯片竞争对手。
OpenAI发AI加速芯片,Anthropic被曝探索专属芯片,微软谷歌亚马逊早布局自研MaiaTPUTrainium都已投入运行。
政策围堵也在加剧,Anthropic推动更严格先进芯片出口管制。大客户加速自研芯片摆脱英伟达依赖,出口管制不断收紧,双重夹击下英伟达市场空间被持续压缩。
联盟逻辑全通了,补齐安全工具降低企业本地部署开放模型门槛,模型越好部署需要买的GPU越多。把开放模型包装成防御基础设施而非安全风险,推动监管者手下留情。
开放模型越普及本地算力蛋糕越大英伟达越好过,如果AI算力全集中到有自研芯片的封闭平台英伟达就成了多余的人。
Anthropic的死扛不是安全理念孤勇,是ClaudeMythos稀缺性就是护城河,一旦开放护城河就没了。
没有谁真正为开放或安全而战,都在为自己算力入口商业模式股价而战,只不过老黄穿了件更好看的铠甲。您觉得Anthropic还能扛多久?评论区聊聊。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.