资讯›热点›正文

微软推出 Decision-1 决策模型,基于阿里巴巴 Qwen3.5 构建

云端漫步 2026-10-12 04:06 阅读 0 热点
微软于 10 月 9 日发布首款决策评分模型 Microsoft-Decision-1,基于阿里巴巴开源模型 Qwen3.5-9B 后训练,已在 Microsoft Foundry 与 OpenRouter 上线。官方称其在 36 项基准、近 15 万道题的盲测中准确率达第一,延迟比 GPT-6 Sol 快约 35 倍,输入定价每百万 token 仅 0.042 美元。

微软于当地时间 10 月 9 日发布首款决策评分模型 Microsoft-Decision-1,已上线 Microsoft Foundry 与 OpenRouter。与动辄生成长文的大语言模型不同,Decision-1 专攻「做决定」:给定一组固定选项,它单次推理就返回每个选项的校准概率,供软件直接调用。CEO 萨提亚·纳德拉(Satya Nadella)在社交平台表示,微软内部多个团队已在事故响应、反馈分类等场景实测该模型。微软推出 Decision-1 决策模型,基于阿里巴巴 Qwen3.5 构建

最引人注目的是,Decision-1 并非基于微软自家或合作伙伴 OpenAI 的底座,而是对阿里巴巴开源模型 Qwen3.5-9B 进行后训练而成。微软表示,未来还会把它迁移到自研的 MAI 模型以及 OpenAI 模型之上。这一选择颇有深意:在 OpenAI 刚刚开放 Decisions API 三天后,微软用一款来自中国的开源权重模型,交出了自己的答卷,定价也刻意与初创公司 TypeSafe 的 Jev 看齐。微软推出 Decision-1 决策模型,基于阿里巴巴 Qwen3.5 构建

在性能上,微软给出了一组硬指标。在覆盖近 15 万道、训练阶段完全隔离的 36 项基准测试中,Decision-1 取得最高准确率;延迟方面,其 P50 响应比 GPT-6 Sol 快约 35 倍,比第二名 H2O-Lightning-4B 也快 2.5 倍。面对同义改写、选项顺序调换等八类扰动,它平均只在 1.3% 的情况下改变判断,选项被改写或打乱时更是零翻转,体现出决策的稳定性。

从落地看,Decision-1 瞄准的是智能体管线里的「判断节点」:把请求路由到正确的队列或模型、对工单排优先级、给 AI 回复打分、做内容安全筛查。微软披露的内部数据颇具说服力——Xbox 研究团队用它处理上万条玩家反馈,速度和成本分别优于 GPT-6 Sol 约 14 倍和 200 倍;Copilot 团队用它给对话与智能体回复评级,速度提升约 100 倍;Microsoft Discovery 用它给实验打分,一致性提升 46 倍。定价上,输入每百万 token 仅 0.042 美元,输出免费,上下文窗口为 3.2 万 token。

背景上,「决策模型」是今年崛起的新品类,Cloudflare、Perplexity、AWS 等已先后入局。与生成式大模型拼参数、拼创意不同,这类模型比的是谁更便宜、更稳、更可校准。微软把路由与审核环节收归自家 Foundry,既能降低对外部模型的依赖,也有望把智能体产生的周边流量留在 Azure 生态内——在智能体走向规模化的当下,这步棋的战略意味,或许比模型本身更值得玩味。

读者评论 (0)

想参与讨论?请 登录 后发表评论。

还没有评论,欢迎抢沙发!