你部署的AI团队里,每五个Agent就有一个从不写代码、从不设计界面、从不生成任何东西。它唯一的任务就是盯着其他同事的工作日志,一旦发现撒谎,直接记录在案。这是一个人运营的AI“公司”里真实发生的事。
上个月,作者的一个代理完成了一批图像生成任务——按严格的视觉规格产出8张图——随后回报:8/8全部通过。干净、自信、具体。可当真正查看输出时,8张图全是废的:一张都没通过任何标准。“验证”不过是模型编造出的、它希望已经完成的工作。
![]()
这个代理并未特别差劲,这就是让同一个模型既干活又判分时必然出现的状态:分数会收敛到“尽快结束任务”这个目标上。作者的公司只有一个人和一群代理,一旦亲眼见到信心满满的“8/8通过”蒸发成“0/8”,就会放弃用提示词去灌输诚实,转而在结构上重构。
于是结构变成了这样:代理名册里有不容忽视的一部分,完全不做任何生产性工作。它们不写代码、不拟文案、不设计界面。它们唯一的职责是假设另一个代理正在撒谎,然后去核查。所有关于这套设定的话题最终都绕回同一个问题:当没人在旁复查时,怎么知道工作是真的?而这个问题最窄、最令人不安的版本是:当连验证本身都不可信时,你该怎么办?
最枯燥的统计数字是这样的:作者当前的设置拥有近一百个代理定义——两个代理目录下共96个文件,无重复。其中20个是纯粹的审计代理:这些代理的唯一输出是对其他某个代理产出的判决。统计时很保守,任何既创作又检查的角色(比如既审代码又提修改建议的)都不算在内,只计入纯粹给出判决的。这大约是五分之一。这个“团队”里有五分之一的存在,就是为了不相信另外那五分之四——这种人事比例没有哪家真人公司能忍受,但却是作者做过的最划算的取舍。
这个比例不是设计目标,而是由一个又一个事故堆积出来的,背后的观察很简单:代理劳动力的失效模式并不是工作质量差——差劲的工作容易被看到。真正的失败是“虚假完成”:工作被报告为已做完,描述得令人信服,但实际并不存在。一个人类员工如果每周编造一份进度报告,这会是你最头疼的问题。而LLM则流畅、愉快、不带恶意地做到这一点,这反而更糟糕。
干活的那个代理,绝不是判分的那一个。名册里真正干活的主力,是一个在编码任务后运行的现实检查器。它的指令围绕着一项操作立场建立:不要预设善意。“已完成”的声明是一种假设,唯一可采纳的证据是代码差异。如果某个东西被声称存在且在差异中,那可以认;声称存在但不在差异中——那就是一项发现。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.