">

微软发布 Microsoft-Decision-1:专做决策打分的模型,已上 Foundry 与 OpenRouter

微软于 2026 年 10 月 9 日在官方博客发布 Microsoft-Decision-1。它不是生成文本的通用大模型,而是决策打分模型:给定一组固定选项,为每个选项输出经过校准的概率分数。官方列出的用途包括路由、分类、优先级排序、校验与工作流控制,模型已在 Microsoft Foundry 与 OpenRouter 上线。

这次发布的是什么

微软于 2026 年 10 月 9 日在官方博客发布 Microsoft-Decision-1,署名作者是 Office of the CTO 的 Achint Srivastava。它的定位不是生成文本的通用大模型,而是决策打分模型:给定一组固定的候选选项,为每个选项输出一个经过校准的概率分数,供软件直接决定下一步。官方列出的用途包括路由、分类、优先级排序、校验与工作流控制。模型已在 Microsoft Foundry 的模型目录与 OpenRouter 上线。

可用性与限制

  • 上线渠道:Microsoft Foundry 的模型目录与 OpenRouter,两者都是官方在博文里给出的入口。
  • 输入形态:需要先给出固定的选项集合,支持是否题、多选题与评分题,也支持按 rubric 给 AI 回答与智能体动作打分。
  • 输出形态:返回的是每个选项的校准概率,不是一段文本;按分数行动的阈值要自己设定。
  • 价格:官方页面列有输入与输出 token 的计费方式,具体单价与是否有免费额度以官方页面当期说明为准,本文不转述数字。
  • 定位边界:它不替代通用大模型做长文本生成,官方的用法是把「判断」这一步从生成模型里拆出来。

主要功能

  • 对固定选项集合输出校准概率,覆盖是否、多选与评分三类题型。
  • 按 rubric 给 AI 回答与智能体动作打分,用于结果验收与是否重试的判断。
  • 承担智能体控制:评估下一步是继续、停止、重试,还是转交给模型、工具或人工。
  • 做模型路由:按质量、成本与延迟要求,为进来的请求挑选合适的模型。
  • 覆盖数据标注、意图分析、事件分级路由、搜索相关性、内容分类与安全筛查等场景。

技术原理

据官方说明,Microsoft-Decision-1 是在 Qwen3.5-9B 上做后训练得到的,目标是单次前向就完成决策打分;官方称后续会在包括 MAI 与 OpenAI 在内的其他基座上重做一遍。概率作为接口的一部分返回,而不是只给排序,因此应用可以直接用置信度决定行动、推迟还是转人工;官方的表述是 90% 的预测在代表性样本上大约十次中命中九次。稳健性方面,官方称对同一请求做了八种扰动(改写选项描述、反转或打乱选项、改键名、加入格式噪声等),平均有 1.3% 的决策发生翻转,其中选项描述改写与选项反转或打乱为零翻转。训练与评测的完整细节以官方博客为准,本文不转述基准分数。

实际体验

可复现的验证步骤:先挑一条你现在靠提示词让通用模型做二判的链路(比如「这条工单要不要升级」),把候选选项固定成两三项,改成调用 Microsoft-Decision-1 并取回每个选项的概率,用同一批样本对比两种做法的判定一致率与端到端延迟。接着把阈值从高往低调,观察转人工比例与误判比例怎么变,找出你场景里能接受的平衡点。再挑一组措辞不同的同义请求(改写选项描述、打乱选项顺序)跑一遍,看分数是否稳定。接口字段与示例代码以 Microsoft Foundry 的官方模型页为准。

项目地址与获取方式

官方公告在 commandline.microsoft.com 的 Microsoft-Decision-1 博文;模型入口是 Microsoft Foundry 的模型目录,另外也可以通过 OpenRouter 使用。请通过官方渠道获取,避免安装被篡改的版本。

适合谁用

  • 在智能体链路里需要频繁判断「下一步做什么」的工程团队。
  • 用通用模型做分类、打标与路由,想把这部分成本与延迟单独压下来的团队。
  • 需要对 AI 输出做自动验收、按 rubric 决定接受或重试的产品。
  • 什么人不必用:只想要一段生成文本,或判断标准每次都在变的场景,直接用通用模型更省事。

常见问题

它和通用大模型有什么区别?

官方的定位是决策打分模型:不生成文本,而是对给定的固定选项输出校准后的概率,供软件分支。通用模型更像写答案,它更像做判断,两者通常是配合关系而不是替代关系。

概率分数该怎么用?

官方把概率作为接口的一部分返回,应用可以据此决定直接执行、推迟还是转人工。建议先用自己的一批样本跑出分布再定阈值,而不是照搬官方示例里的数值。

官方给出的基准成绩能直接拿来选模型吗?

官方称在 36 项基准、约十五万道题的比较上有更好的表现,且这批基准对训练不可见。但这是官方口径,本站未独立复现;选型时建议用自己的任务集再验一遍。

现在能免费试用吗?

官方页面列有输入与输出 token 的计费方式。是否有免费额度、额度多少,一律以官方页面当期说明为准,本文不转述数字。

它会取代现有的判断逻辑吗?

不一定。更现实的做法是把它放在规则与生成模型之间:规则处理确定性的部分,它处理需要语义判断的部分,通用模型处理需要生成的部分。

相关工具与内容

Related
快讯 1 小时前

Cloudflare 推出 Clef-omni:决策模型开始直接吃音频、视频与图片

Cloudflare 于 2026 年 10 月 9 日在官方博客发布 Clef-omni,把决策模型的输入从文本与图像扩展到音频与视频,一次调用即可跨模态打分;同时宣布 Clef 本体提速、Clef-flash 降价。官方称权重以开放权重形式发布在 Hugging Face,并与 Jev API 兼容。

前沿快讯 5 阅读
快讯 1 小时前

Ollama v0.40.2 发布:旧模型后台升级到 llama.cpp,列表不再出重复项

Ollama 于 2026 年 10 月 8 日发布 v0.40.2(GitHub Release 时间 2026-10-08T16:53:47Z,非预发布)。核心变化是用旧版本下载的模型会在首次运行时后台升级,以在 llama.cpp 上运行时获得更好的性能与兼容性;同时修掉了列表出现重复条目,以及启动 Claude 时没有用满上下文长度两个问题。

前沿快讯 5 阅读
快讯 1 小时前

Deno 团队加入 Cloudflare:workerd 与 celld 合并,Deno Deploy 六个月后关闭

2026 年 10 月 9 日,Cloudflare 与 Deno 两边的官方博客同步宣布 Deno 团队整体加入 Cloudflare,目标是把 workerd 与 celld 合并,让 Workers 与 Durable Objects 能在自有基础设施上自托管。官方给出的安排是:Deno 运行时再维护一年,Deno Deploy 六个月后关闭,JSR 继续运行。

前沿快讯 6 阅读

继续阅读:Cloudflare 推出 Clef-omni:决策模型开始直接吃音频、视频与图片 · Ollama v0.40.2 发布:旧模型后台升级到 llama.cpp,列表不再出重复项

关于本文:本站文章由编辑部独立撰写,评测口径与免责说明见关于我们。想继续找工具,可从分类导航按场景浏览,或回首页搜索。

链接已复制