微软 10 月 9 日在自家技术刊物 Command Line 上发布 Microsoft-Decision-1,一个专做”选择题”的模型:路由、分类、排序、校验、工作流控制。署名作者是微软首席技术官办公室的软件工程副总裁 Achint Srivastava。模型已上架 Microsoft Foundry,也接入了 OpenRouter。
它的输出很窄。调用方先给一组固定选项,模型对每个选项给出一个校准过的概率,软件拿到结果直接执行。是/否、多选、打分、按评分细则(rubric)打分都支持;写长文、做复杂推理不在它的分工里。
微软自报的成绩
微软称,Decision-1 在 36 项基准、近 15 万道题的对比中准确率最高,P50 延迟约为 GPT-6 Sol 的 1/35。文章举了个例子:一条流程串着 20 个决策,每个多花 100 毫秒,整条链就慢 2 秒。
稳定性方面,同一请求做 8 种扰动,决策平均翻转率 1.3%;只改写、反转或打乱选项顺序时,翻转率为 0。微软给这项测试定的原则是:
“Equivalent inputs should produce equivalent decisions.”(等价的输入应当得到等价的决策。)
安全测试覆盖 11 项基准、5250 条请求,类型包括有害内容、越狱和提示注入,但文中没有给出拒绝率。
内部试用有几组数据。Xbox 研究团队用它处理一万多条用户反馈,质量与 GPT-6 Sol 相当,速度快 14 倍以上,成本低 200 倍以上;Copilot 团队测得质量与 GPT-5.6 Luna 相当,速度快 100 倍。这些都来自微软自测,36 项基准各叫什么、具体准确率多少,文章没有列出,目前也没有第三方复现。至于排第二的是哪个模型、慢多少,微软原文和中文转述给出的说法对不上,以官方后续更新为准。
定价贴着用法走
价格是每百万输入 token 0.042 美元,输出免费,按 IT 之家的换算约合 0.28 元人民币。决策类调用的输出往往只有几个 token,钱主要花在输入的上下文上,这套定价跟实际用法对得上。
这类模型在应用里一般放在大模型前面:先判断一条请求该交给哪个模型、走哪条流程,或者判断智能体某一步的产出合不合格,再决定下一步。这些判断原本多由通用大模型顺手做,换成小而快的专用模型,省下的是延迟和调用费。
底座来自千问
文中有一句话分量不轻:Decision-1 是在阿里开源的 Qwen3.5-9B 上做的后训练。微软还说,之后会把同一套方法迁到其他底座上,点名了 Microsoft AI(MAI)的自研模型和 OpenAI 的模型。
对国内开发者,这条信息可以从三处看。第一,千问的开源权重进入了微软的正式产品,而且微软在发布文里写明了出处。第二,想做同类东西的团队,路径基本摊开了:找一个 9B 级的开源模型,围绕”固定选项加校准概率”做后训练,单次前向就出结果。第三,Decision-1 本身没有开放权重,国内要用只能走 Foundry 或 OpenRouter 的接口;它的底座 Qwen3.5-9B 倒是可以直接下载。
微软今年已经陆续推出多款 MAI 自研模型。Decision-1 先借外部开源底座起步,等换到 MAI 底座之后成绩能否保持,要看下一版公布的数据。
参考来源:微软 Command Line 发布文、CocoLoop、IT之家;按微软自测口径核对基准数量、延迟倍数与每百万 token 价格。