企业AI曾向高管们承诺几乎能保证运营稳定:更少的停机、更少的人为错误,以及能够在客户察觉之前就发现问题的系统。但软件公司 Splunk 的一份关于AI相关停机的新报告表明,这些承诺正撞上一个更棘手的现实。
对企业而言,停机——即维持运营的软件系统和应用出现意外中断——可能引发从销售损失到物流网络冻结和客户反弹等一系列问题。多年来,公司一直将这个问题视为从根本上可解决的:只要将足够多的正确流程自动化,人为错误基本就能被技术手段消除。根据思科旗下 Splunk 公司的报告,基于这种逻辑,公司每年在防停机AI系统上的中位支出为2450万美元。但许多公司现在报告称,AI自己也开始添乱,成了停机的新原因,在此过程中悄然引入了几种新的故障模式。
半数受访组织经历了与错误的AI自动化或模型漂移相关的停机。近三分之一怪罪于把AI塞进生产系统时冒出的漏洞。这份报告是和牛津经济研究院一起做的,调查了全球2000强公司的2000名高管,估计非计划停机现在每年给企业造成6000亿美元的损失,仅两年内就增长了50%。每分钟停机成本约为15000美元,而企业平均每年损失3亿美元,但还没人正式管这叫危机。
Splunk 称之为可靠性悖论:越防越乱——公司越积极地部署AI以消除运营风险,就越发现自己需要管理一种更新、更不可预测的风险类别。
“组织正在将AI部署到关键任务系统中,却没有明确定义的升级路径,”Splunk 高级副总裁兼总经理 Kamal Hathi 表示。“他们缺少能盯住模型漂移的监控,而且出了问题也没人明确负责。”
财务风险远不止于IT预算。Hathi 指出,每次重大事件平均导致股价下跌3.4%,勒索软件赎金几乎涨了两倍,达到4000万美元,而监管罚款现在平均为5100万美元。
旨在降低风险的AI如今却在制造风险
AI竞赛几乎将速度置于一切之上。从最初的副驾驶和聊天界面开始,如今正加速迈向自主代理,往往没有人类参与其中。这种速度也在改变失败的表现形式。
Hathi表示,企业并非误读了AI的价值,而是低估了负责任部署所需的条件。大家总爱把AI部署当成一次软件升级。但AI会从不断变化的环境中学习,并以不符合确定性逻辑的方式与系统交互。“韧性不能等出了事再想,”他说道,指的是吸收干扰、快速恢复并保持连续性的能力。
报告发现,44%的组织使用代理式AI,但68%担心这些系统可能行为不可预测。攻击的种类也在变多。提示注入和数据投毒是两种针对AI的攻击,坏人通过操纵AI系统看到或学到的内容来改变其行为,这类攻击正在增加。近四分之一的组织遭遇过此类攻击,77%的技术领导者认为配备生成式AI的网络犯罪分子将增加其组织的宕机时间。
“代理系统得一步步挣来自己的自主权,”Hathi说。“每一步都得看得见、有人负责——不能先大规模铺开,再回头查问题。”
无人预见的无声故障模式
Splunk的开发者布道总监兼首席布道师Greg Leffler表示,AI相关的宕机很少像传统故障那样。它往往不是一下子崩掉,而是系统行为慢慢被侵蚀,在没人察觉之前就已经扩散开了。
他指出,在企业环境中反复出现两种模式。第一种是模型漂移,他将其描述为“一个六个月前还能做出正确决策的自动化流程,它的训练数据已经跟不上现在的流量情况了。等大家发现的时候,问题已经扩散到各个关联服务里了。”第二种是集成故障,即人工智能系统靠不完整的数据做决定,在关联系统里引发连锁故障,而这些系统没有哪个团队能完全管得住或从头到尾盯着。这两种情况都会慢慢让人失去信心,直到某个关键环节彻底崩了。
人工智能系统上线时总觉得它们自己能纠错,而传统基础设施可从来不敢这么想。莱弗勒表示:“软件上线时的那套工程规矩——分步上线、灰度测试、回滚机制——现在必须用在每个能做主的生产模型上。”
然而,该报告最扎心的发现并非关于模型能力,而是关于谁说了算。尽管在监控平台上砸了不少钱,但只有38%的受访技术高管表示,他们总能找出宕机的根本原因。
莱弗勒解释说,随着自动化包办更多日常运营决策,越来越少工程师能练出在自动化故障时排查问题所需的、对系统的深层直觉。与此同时,当今的技术架构特别依赖外部人工智能提供商和第三方服务,团队几乎看不到内部情况,这造成了他所称的“层层看不清的问题”:风险一层套一层,大部分都超出咱们能看到的范围。
莱弗勒表示:“AI代理系统应独立排查问题、做常规修复并回滚代码——但凡风险高点的决定,都得交给人工审批。”
他补充说,这一挑战既是技术挑战,也是文化挑战。“如果工程团队衡量可靠性时,不像衡量速度那样严格,治理框架永远干不过交付时间表。”
影子AI让企业越来越看不清
一些最难量化、或许也最难解决的问题,正发生在企业正式技术系统之外。早期的“影子IT”通常涉及员工在正式IT监管之外采用未经批准的软件、云服务或协作工具,从而引发安全和合规方面的麻烦。影子AI让风险更大了。
高达66%的组织报告称,员工在工作中使用未经批准的AI工具来编写代码、生成业务内容、自动做决策,但公司往往看不清这些工具用了哪些数据,也不知道它们的建议会怎么影响生产环境。与影子IT不同,影子AI能够塑造运营行为,却几乎不留下决策方式或原因的痕迹。
“这既是政策问题,也是可见性问题,更是治理问题,”哈西表示。“仅靠政策无法解决。企业得搞一套评估系统,定好AI该干什么,再用日志、指标和追踪这些数据来支撑。”
AI将不断变得更智能。更艰巨的挑战——也是大多数企业才刚刚开始面对的——是建一套系统,能在AI出问题变成业务危机前,就发现并纠正它。
“现在每个竞争对手都能用上差不多的模型和云基础设施,”哈蒂说。“韧性、治理和可观测性才是真正拉开差距的地方。谁先吃透这些理念,谁就能定义AI时代什么叫卓越运营。”
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.