微软推出决策打分模型 Microsoft-Decision-1,已在 Microsoft Foundry 和 OpenRouter 上线。该模型面向路由、分类、优先级排序、校验及工作流控制,输出可供软件直接使用的结构化结果。微软希望借此将决策能力接入现有应用、智能体和工作流,并在发布方自测中报告了准确率与延迟方面的表现。
微软在介绍中将决策模型定位为专门提供结构化输出的模型,而通常的大语言模型侧重文本生成或复杂问题推理。Microsoft-Decision-1 的具体工作方式是:接收一组固定的答案选项,为每个选项给出经过校准的概率分数。
按微软说明,模型支持是/否、多项选择和评分选项,也可以依据评分细则,对 AI 回答及智能体动作进行打分。这些功能通过结构化 API 调用提供,服务于应用中的判断、分类和流程控制环节。
据微软公布的测试结果,Microsoft-Decision-1 在其开展的 36 项基准对比中取得最高准确率。测试覆盖近 15 万道题,相关基准在训练期间保持未见。
速度方面,微软称它是此次测试中测得最快的模型:速度约为第二名 H2O-Lightning-4B v1.1 的 2.5 倍、GPT-6 Sol 的 35 倍。微软同时在延迟说明中指出,按 P50 延迟衡量,相对 GPT-6 Sol 的速度优势约为 35 倍。上述比较针对发布方测试中的决策任务。
微软用串行工作流解释低延迟的意义:当后一步依赖前一步时,每次决策增加的等待时间会累积。其举例称,如果每个决策多耗时 100 毫秒,连续执行 20 个决策,就会使整个工作流多出 2 秒。
微软表示,Microsoft-Decision-1 由 Qwen3.5-9B 后训练而来,目标是实现快速、单次前向计算的决策打分。微软还称,很快会基于其他模型重新训练,其中包括微软 AI(MAI)和 OpenAI 的模型;这属于发布方公布的后续计划。
文中性能排名与速度倍数均为微软公布的测试结果。