为什么一个AI代理在调用天气工具之前,要先停下来问自己一句"用户到底说的是哪个城市"?这个看似多余的动作,正是AWS在周四发布的Strands Decider 2B想要解决的问题。
它不是又一个生成式大模型,而是一个专门用来"做选择题"的决策模型。AWS把它做成了可下载的版本,连同训练数据和脚本一起放出,让开发者能看清整套配方。
![]()
决策模型和生成模型,分工不同
决策模型放弃自由文本生成,转而从开发者提供的选项里挑一个,或者返回一个数值分数。这让它们适合处理自然语言请求的路由、工具选择、输出评估,以及检查代理准备执行的动作。
至于对话和更复杂的工作,仍然交给生成式模型去做。两者不是替代关系,而是流水线上的不同工位。
这股风潮由TypeSafe的Jev在几周前带起,随后主要AI厂商纷纷推出自己的版本。OpenAI在周二发布了Decisions API,但那是有限预览的托管接口,把Luna模型聚焦在有预设答案的问题上。AWS走的是另一条路:模型可下载,训练数据和脚本一并给出。
把语言模型的"嘴"换成"打分器"
Strands Decider以Qwen3.5-2B作为语言理解底座,AWS管这部分叫"躯干"。团队移除了负责生成文本的语言模型头,换上一个指针头,用来给候选答案打分。
这个头只有一百多万个参数,主干部分使用了一个rank-16的LoRA适配器。限制答案空间的做法,能防止模型凭空编造一个没被提供的选项。
当然,这并不意味着它每次都答对。不过这个取舍并不算大——大语言模型也不是永远正确。换来的回报是更快的决策速度,以及可供开发者使用的置信度分数。
在AWS给出的示例里,用户问天气却没说是哪座城市,代理猜了一个城市,并提议调用天气工具。在工具真正运行之前,Decider会检查参数值是否有对话依据、代理掌握的信息是否足够。应用随后把代理送回去,让它先问清楚用户指的是哪座城市。
这套检查走的是Strands的干预系统,开发者可以选择放行工具调用、拒绝、请求人工确认,或者把反馈退回给代理。在这个演示中,Decider在本地运行,代理则通过Amazon Bedrock调用生成式模型。AWS表示还在开发决策模型的集成库。
跑在显卡上的速度账
和Kev一样,Strands Decider建立在开放的Qwen模型之上,这也说明当前这波实验有多依赖开放权重。Kev已经支持本地部署和微调,而AWS这次把训练数据和脚本一起放出,开发者可以检视配方,并把它调整到自己的任务上。
AWS称其重点在于平衡准确率、校准度和延迟。校准度指的是模型的置信度分数与实际答对频率的贴合程度。在JevBench公开测试集上,AWS表示Strands Decider在约20亿参数的公开模型中排名第二,在提供完整训练配方的公开模型中排名第一。
AWS还提到,Strands Decider 2B把JevBench简单档位的每一道题都答对了,而这正是它被设计来处理的那类日常代理决策。
速度方面,AWS报告在Nvidia RTX 3090上决策耗时低于100毫秒,任务变复杂时响应时间会上升。在M3 MacBook上,小型任务的中位数约为150毫秒。
现在放出的这个模型是这套架构的第二个主要迭代版本。AWS称更早的一版头部设计表现明显更差。公司把此前每一个迭代都留在了代码仓库里,开发者可以追溯模型是怎么演化的。
Strands Decider孵化于Strands Labs,这是AWS今年早些时候启动的代理式AI实验基地。它也是继Strands Harness之后的又一发布,后者打包了运行长生命周期代理所需的工具和配套机制。
托管版本还是个问号
有一件事还有待观察:AWS是否会在自己的云上提供这个模型——或者它的未来版本——的托管服务。
混合场景适合做实验和在本地跑,但要把基于这个模型的应用投入生产,开发者会希望也能有一个托管版本可用。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.