为什么Agent越跑越贵?这个问题最近被反复讨论,但很少有人把它和几年前那场架构之争联系起来。作者Dongxi东锡NLP梳理了一条线索:编码器路线当年输给仅解码器架构,根源不在效率,而在泛化;而Agent带来的新工作负载,恰恰把效率重新推回了牌桌。
BERT输在哪:每个任务都要微调
![]()
BERT能高效地把输入压成表征,这是它的强项。但它停留在任务专用微调时代——每个任务都得单独微调一次,模型本身没有走向通用。
GPT走的是另一条路。它沿着规模扩展、上下文学习和指令微调一路推进,把自然语言变成了通用任务接口。分类、判断、推理、工具调用,统统变成生成。仅解码器架构由此赢下整个范式,编码器也失去了探索通用分类器与通用表征模型的机会。
作者的原话是,GPT早期同样如此,后来才沿着这三条路径走向泛化。这句话点出了分野的关键:不是谁更省算力,而是谁能不换模型就接住新任务。
Agent把账算反了
但Agent改变了工作负载。模型开始面对越来越大的输入、越来越重的键值缓存、越来越频繁的循环调用。
在这种场景下,用一个巨大的解码器完整预填充,再自回归解码几个词元来完成一次判断,开始显得昂贵。作者用“昂贵”这个词,指向的是成本结构,不是单次延迟。
换句话说,Agent的高频循环调用把“每次判断都要跑一遍完整大模型”这件事的代价放大了。判断本身可能只需要几个词元的输出,但预填充的成本一点没少。
Jev想补上没走完的那条路
作者认为Jev正试图补上BERT未走完的路线。它的定位是面向服务、面向Agent的泛化决策模型。
这个定位包含两层:
- 保留GPT的任务泛化能力,不退回任务专用微调的老路;
- 重新获得编码器与分类器式的决策效率,让一次判断不必付出完整预填充的代价。
这两点合在一起,才是作者所说的“泛化决策模型”——既要有泛化能力,又要有决策效率。
这不是复古,是工作负载变了
把这条线索串起来看,编码器的回归不是因为当年判断错了,而是因为当年的工作负载没有逼出这个问题。BERT时代的任务是一次性的分类和判断,微调成本可以接受;GPT时代把任务统一成了生成,泛化能力压倒一切。
到了Agent时代,输入变大、键值缓存变重、循环调用变频繁,决策效率从次要变量变成了主要矛盾。作者没有给出Jev的具体技术细节,但把问题定义得很清楚:泛化和效率,这次要一起拿。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.