有一种声音认为,应该放弃合并请求,直接提交到主干,让可观测性来兜底。这个判断抓住了真实的痛点:审查慢,智能体让待审查的改动越堆越多。但把人类关卡整个切掉,是切错了地方。
冲刺剧场、三天审查队列、故事点通灵会都可以走。软件开发生命周期从来不是这些仪式,它是我们管理风险、协调不止一个大脑、并确保有人能被叫起来值班的方式。这些工作不会因为模型学会了吐出一份diff就退休。
![]()
阶段塌缩了,工作没有消失
在一次智能体会话里,设计、实现、测试不再是三个隔着走廊的房间。它们塌缩成同一段时间里发生的事。这是劳动方式的变化,不是工作存在理由的废除。
需求仍然必须成立,架构仍然要能撑过下一个团队,改动仍然要向没参与这次会话的人解释清楚,仍然得有人为合并负责。仪式可以缩水,仪式底下的知识不能。
给智能体一个自己的盒子
人作为评论者坐进智能体逐轮对话的循环里,确实在拖慢速度,人变成了阻塞式IO。把共享的合并请求当成调试面板更糟,那等于把公共走廊当车间用。
解法不是跳过合并请求,而是在内层循环跑绿之前,把意图、上下文和迭代过程留在共享分支之外。给智能体一个独立环境:
- 本地优先——一个工作树、一个沙箱、开发者机器上的测试套件,以及把发现回灌进同一会话的钩子;
- 必须离开笔记本时就临时化——一次性运行器、随分支消亡的预览应用、一个既不是生产也不是主干的克隆;
- 把人挡在这个循环之外——我们审查结果,不审查每一次工具调用。
有一项针对有经验的开源开发者的随机对照试验发现,他们使用AI工具后实际耗时更长,却依然确信自己更快了。真正有用的部分留了下来:坐在智能体循环里感觉像在提速,哪怕时钟不同意。打开一个合并请求才发现测试套件是红的,等于用寄信的方式检查烤箱。
同一会话里的测试,不是第二意见
智能体在代码旁边写测试,这很好,但这不是独立性。发明行为的那次会话,也发明了证明。智能体可以自己给自己做QA,就像我们可以给自己批改作业:很快,而且分数高得可疑。
内层循环的测试是必要的,它们能在别人买单之前抓住那些愚蠢的断裂。但它们不是简报。持续集成必须在智能体不拥有的环境里重跑测试套件——不同的机器、固定镜像、没有哪条断言被改到露出笑容为止。
如果唯一被信任的绿色,是作者或作者的智能体在聊天里产出的绿色,那我们没有测试,只有一种良好的感觉。
原型不是共享主干
内层循环在原型验证上表现出色:一个人、一个智能体、一张白纸草图、主机名上没有真实用户。这是AI原生工程师看起来毫无负担的场景,有时候他们确实毫无负担。
但一个超过两三名工程师、有历史、有会部署的主干分支的产品,是另一台机器。压缩依然有用,但它不是跳过"看起来没问题"这句话的许可证——这句话必须出现在所有人发布所依据的那条分支上。
把原型当原型,让它走完外层循环。等一个能被叫起来值班的人读过改动之后,再谈那套 Netflix 式的部署流程也不迟。
没人帮忙的人,确实慢
"干掉PR"的论点有一半是对的:一个人盯着500行智能体改动、手上没有任何证据,这种假瓶颈会变成真瓶颈。那像一本被撕掉章节标题的长篇小说。
但把人类关卡整个切掉,是切错了地方。好的持续集成,加上一个能提交机械性修复的审查智能体,是让人类关卡保持足够便宜的方式。人仍然要签字。
生产环境是安全网,不是导师。快速回滚仍然会烧伤用户。微妙的故障往往永远不会变成智能体能够"看见"的信号。把闭环放在生产上,是新手才会犯的错误。
这不是对未来的预测,而是当我们拒绝把沙箱和主干混为一谈时,已经行得通的做法。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.