微软在10月9日推出了一款叫 Microsoft-Decision-1 的模型,专为结构化决策任务打造。官方给出的定位很明确:响应延迟和决策质量都要做到顶尖,实际表现全面超越大语言模型及其他传统决策模型。目前它已上线 Microsoft Foundry,并同步接入 OpenRouter。
真正让人多看两眼的,是速度。基准测试数据显示,它的响应速度位列第一:比排名次席的 Quyet-1.0-Large 快 4.5 倍,比 GPT-6 Sol 快了 35 倍。这个差距不是小幅领先,是量级上的拉开。
![]()
底座不是自研,是Qwen3.5-9B
构建这款模型时,微软对 Qwen3.5-9B 进行了后训练,实现了超低延迟的单次推理决策评分机制。后续微软将以此为基础,迁移适配至包括 Microsoft AI(MAI)和 OpenAI 在内的其他底座模型。
换句话说,这次先跑通的是"后训练+单次推理评分"这条路径,底座可以换。对做决策类应用的团队来说,这个信号比模型本身更值得留意——同一套方法能不能搬到别的底座上,决定了它是不是一次性的实验。
准确率与安全性的双重验证
在包含 36 项基准测试、涵盖近 15 万个训练阶段完全隔离(Blind Evaluation)的测试内容的对比评测中,Microsoft-Decision-1 斩获了最高准确率。隔离训练阶段的评测方式,意味着测试内容没有在训练中出现过,成绩更能反映真实泛化能力。
安全方面,微软基于 11 项安全基准测试、共计 5,250 条请求进行了系统评测,范围涵盖有害内容、越狱攻击及提示词注入。结果表明,该模型在有效拦截各类恶意行为的同时,依然保持了极高的可用性。
价格是另一个变量
每百万 Token 输入 0.042 美元(约合 0.28 元人民币),输出免费。对需要高频调用决策评分的场景来说,输出侧不计费会直接改变成本结构——调用次数越多,这个定价的杠杆效应越明显。
速度第一、准确率第一、输出免费,再加上一个可迁移的后训练方案,微软这次把决策模型这条细分赛道的门槛摆到了台面上。
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.