瓶颈转移了,而大多数团队还没注意到。它不再是写代码,而是证明代码。
我不断听到工程师们同样的轻声抱怨:"我花在审AI代码上的时间,比我自己写代码还多。"我们倾向于把这当成一个生产力问题,好像工具没省下时间。我觉得我们读错了。AI并没有没能省时间。它在一个环节省下了时间,却悄悄把成本压到了另一个环节。
![]()
生成变便宜了。验证没有。
没人做预算的不对称
几十年来,写代码是那个昂贵的环节,而且它的昂贵方式让审查保持成比例。如果一个资深工程师花一天产出一份改动,审查者会花二十分钟。这个比例大致稳定,所以成本留在上游。
现在模型九十秒就能产出同样的改动。那二十分钟的审查没有变短。它可能变长,因为涌进来的量超过了任何团队的审查能力曾经需要承受的水平。当一个环节提速、下一个环节原地不动,原地不动的那个就成了约束。
约束实际出现在哪里
过去几个月我一直在构建智能体系统,验证问题很快就从抽象变得具体。它在我自己的工作中出现在四个地方:
- 工具调用。智能体在沙箱里执行删除,和在真实生产环境里执行删除,不是一回事。简单的允许/拒绝二元判断区分不了这两者,结果只能在"权限给太大"和"审批审到麻木"之间二选一。我最终在模型之外建了一道四态闸门(允许、审计、升级、拒绝),任何提示词都覆盖不了拒绝这一档。
- 计划审批。一个列出了正确步骤、但顺序排错的规划器,比一个明显坏掉的规划器更危险。我用确定性闸门拦住未验证的依赖、不安全的执行顺序和薄弱的回滚方案,在人看到计划之前就挡掉。
- 闸门本身。这一条最让我意外。一道确定性闸门如果悄悄停止触发,你的指标反而会变好看:阻塞数下降,仪表盘一片绿。就像那个一直显示有一个Pod在运行的ReplicaSet,实际上四个版本从没真正跑起来,而所有健康检查都通过了。解法是给每道闸门配一个金丝雀,断言它还在触发。
- 审查者群体本身。当生成变便宜,每个人都成了审查者,而我们大多数人从没受过这方面的训练,更别说被考核过。这是技能缺口,不是工具缺口,它不会自己消失。
为什么加审查者不是解法
直觉反应是增加审查人力。但审查注意力不随数量线性扩展,而且它的退化方式很具体。量一大,人就开始按"看起来像不像对的"做模式匹配,而不是推理"到底对不对"。diff越干净,越不容易被追问。
你不会靠在同一个环节加人解决验证瓶颈。解法是把工作从人的注意力里挪出去,交给闸门,让人的注意力只花在真正模糊的地方——那是它唯一擅长的事。
四道闸门,把工作挪回流水线
这些做法本身都不新鲜。它们只是在生成变便宜之后,从"可选"变成了"必须"。
- 闸门一:工具调用的上下文感知授权。问的不是"这个工具能不能用",而是"这个工具,在这个位置,对这份数据,由这个智能体来用,能不能用"。四个决策而不是两个,可解释、可审计,遇到未知一律拒绝。
- 闸门二:人工审查前的结构校验。每个前置条件都映射到一个更早的任务。每个高影响范围的步骤都有可达的回滚路径。这是确定性的,不花什么成本,能在人看之前消掉大约一半的缺陷。
- 闸门三:给每道闸门配金丝雀。如果一道安全检查停止触发,必须有东西变红。"阻塞数下降"不该是守卫死掉的第一个信号。
- 闸门四:升级是一条真路径,不是死胡同。一个智能体拒绝了97个风险计划里的96个,只要升级路径能把足够上下文送到人面前做决定,它就是在尽职。没有出口的拒绝,只是堵塞。
核心思路就一句:不要试图验证更多,而是让更少的东西需要人来验证。
诚实的局限
闸门只能覆盖你想到要编码的失败模式。我的结构校验在依赖顺序和回滚上很强;它们在"这段逻辑以一种没人预料到的方式微妙地错了"上很弱。那仍然需要人,最好是一个读推理而不是读表面的人。
而且闸门有真实的成本:它们会僵化。一道对上一季度风险画像正确的闸门,可能变成噪音。金丝雀告诉你一道闸门还活着。它不会告诉你这道闸门是否还值得保留。
我不断回到的问题
如果生成现在很便宜,而验证现在是约束,那么最高杠杆的工程投入就不是更好的模型。而是决定什么值得信任的那套机制。这意味着未来几年赢的团队,可能不是写最多AI代码的团队。而是那些认真对待证明它的团队。
你现在的瓶颈是写,还是证明?我很好奇这对其他团队是否也一样,还是我只是在过度拟合自己的经验。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.