微软于 2026 年 10 月 9 日发布 ONNX Runtime 1.31.0。这一版把模型包与 EPContext 数据回调提升为稳定的 C / C++ 接口,改进 CPU 加载开销与 INT4/INT8 量化的 MoE 专家推理,让 CoreML 参与按设备选择执行提供器(含 Apple Neural Engine),并新增工作区内存核算。同时 ACL 执行提供器进入弃用状态,且受支持的原生构建默认开启 1DS 遥测。
ONNX Runtime 1.31.0:模型包接口转正,MoE 量化推理与设备选择继续补强
这次发布的是什么
微软于 2026 年 10 月 9 日发布 ONNX Runtime 1.31.0(GitHub Release published_at 为 2026-10-09T04:51:32Z,非预发布版本;改动区间为 1.30.0 以来)。官方对这一版的概括是:把模型包与 EPContext 数据回调提升为稳定的 C 与 C++ 接口、改进 CPU 模型加载与量化 MoE 推理、扩展按设备选择执行提供器的能力、加强模型加载与运行时可靠性。CUDA 与 WebGPU 的内核更新在此只作概述,细节放在各自独立的插件执行提供器发布里。配套的 CUDA 插件执行提供器为 v0.3.0、WebGPU 插件为 v0.5.0。
可用性与限制
- 插件配套:CUDA 插件执行提供器 v0.3.0 与 WebGPU 插件 v0.5.0 与 1.31.0 配套。官方提示核心与插件必须使用相同的贡献算子 schema,建议从同一份 ONNX Runtime 修订构建,schema 不匹配可能导致错误执行或崩溃,且注册插件时未必能检测出来。
- 遥测:受支持的原生构建现在默认启用 1DS 遥测;Windows 上仍可用 TraceLogging 选项选择,也可以用 --no_telemetry 关闭。这是这一版里对使用者最直接的默认值变化。
- 弃用:ACL 执行提供器已弃用,将在后续版本移除;源码构建使用 --use_acl 时会收到弃用警告。
- ONNX 依赖:仍停留在 1.22.0。官方说明 ONNX 1.23 的初次集成因上游问题被回退,本版未提供该集成带来的新算子集与 FLOAT6 支持。
- 行为变更:GatherBlockQuantized 对越界索引改为在 CPU、CUDA、WebGPU 上输出全零切片,这与 ONNX Gather 的报错语义刻意不同。
主要功能
- 稳定化模型包接口:把模型包的 C 与 C++ API 转为稳定接口,用于加载模型包、选择兼容的模型变体与创建会话。
- 稳定化 EPContext 数据回调:命名读写回调转为稳定接口,并加入执行提供器支持协商,已注册的回调不会再静默回退到文件系统读写。
- 降低 CPU 会话初始化开销:对符合条件的权重预处理做并行化。
- 加速量化 MoE 专家:用 MLAS QNBit 内核与分组专家调度加速按块处理的 INT4 / INT8 量化 MoE 专家。
- 扩展按设备选择执行提供器:CoreML 现在可以参与按设备的执行提供器选择,并可通过 PREFER_NPU 选中 Apple Neural Engine。
- 新增工作区内存核算:为受限内存下的图分区加入工作区内存核算与校验,可用 strict_workspace_verification 在初始化阶段直接失败。
- 支持更大模型的内存内编译:编译接口扩展后可把外部初始值与执行提供器上下文写入缓冲区,使大于 2 GB 的模型也能走内存内编译流程。
- 关闭设备探测:新增源码构建选项 DISABLE_DEVICE_DISCOVERY,跳过平台加速器探测并只上报 CPU 设备。
技术原理
据官方说明,这一版的两条主线是接口转正与量化推理路径的深化。模型包与 EPContext 回调此前是实验接口,1.31.0 把它们提升为稳定的 C / C++ API:模型包负责把一组相关的模型变体与权重打包交付,EPContext 回调则允许应用自己管理执行提供器上下文数据的读写,而不是默认落到文件系统。配套加入的「支持协商」很关键 —— 已注册的回调不会再静默回退到文件读写,避免应用以为自己接管了存储、实际仍在写盘。
另一条主线是把量化 MoE 的推理路径做细:按块处理的 INT4 / INT8 量化专家配上 MLAS 的 QNBit 内核与分组专家调度,同时 CPU 侧通过并行化权重预处理缩短会话初始化时间。官方还在指令集层面补了 x86 的 FP16 LayerNorm / RMSNorm 加速、Arm KleidiAI 的 SVE2.1 FP16 GEMM 支持,以及更多 RISC-V 向量内核。工作区内存核算则是给受限内存环境下的图分区加了一本账,超出发声明或出现孤立预留时可以配置为直接失败,而不是等到运行时才崩。
实际体验
想在自己环境里确认这些改动,可以按下面的顺序验证:
- 装到 1.31.0 后先打印版本号,确认解析到的确实是 1.31.0,以及当前构建启用了哪些执行提供器。
- 若关注默认遥测变化,查一下构建脚本或源码里 1DS 遥测的开关,确认 --no_telemetry 能按预期关闭。
- 若用到 GPU 插件,核对插件版本与核心版本是否配套(CUDA v0.3.0、WebGPU v0.5.0),并确认贡献算子 schema 来自同一修订。
- 在 CPU 上加载一个量化 MoE 模型,比较会话初始化耗时与旧版本,观察是否有变化;这一步只做计时对比,不引用任何数值结论。
- 若用 --use_acl 构建,确认是否收到弃用警告,据此规划迁移。
项目地址与获取方式
发布页在 https://github.com/microsoft/onnxruntime/releases/tag/v1.31.0 ,仓库为 microsoft/onnxruntime,采用开源许可。预编译包请通过官方渠道获取(官方发布页给出的包与语言绑定的官方分发渠道),避免安装被篡改的版本。CUDA 与 WebGPU 的内核细节见各自插件执行提供器的发布说明。
适合谁用
- 在本地或边缘设备上部署 ONNX 模型、需要稳定接口的工程团队。
- 跑量化 MoE 模型、受 CPU 初始化耗时或显存受限困扰的部署方。
- 在 Apple 平台上想让模型落到 Neural Engine 的开发者(CoreML 已可参与按设备选择)。
- 不适合:只用云端 API、不接触模型文件的人 —— 这一版的改动都在本地推理链路上。
- 不适合:期待新算子集或 FLOAT6 支持的人 —— 官方说明 ONNX 1.23 的集成已被回退,本版不含。
常见问题
1.31.0 会带来破坏性变更吗?
官方在兼容性一节列了几项:GatherBlockQuantized 对越界索引改为输出全零切片(与 ONNX Gather 的报错语义不同)、实验接口迁移到稳定接口后对应的实验查表项被移除、ACL 执行提供器进入弃用状态。
默认遥测能不能关?
可以。官方说明受支持的原生构建默认启用 1DS 遥测,Windows 上仍可选 TraceLogging,也可以用 --no_telemetry 关闭。
插件和核心版本必须严格对应吗?
官方建议两者从同一份 ONNX Runtime 修订构建,且必须使用相同的贡献算子 schema;只满足最低核心版本并不保证贡献算子的兼容性,schema 不匹配可能导致错误执行或崩溃。
这一版支持 ONNX 1.23 吗?
不支持。官方说明 ONNX 依赖仍是 1.22.0,ONNX 1.23 的初次集成因上游问题被回退,本版不含该集成的新算子集与 FLOAT6 支持。
想关掉设备探测可以吗?
可以。官方新增了源码构建选项 DISABLE_DEVICE_DISCOVERY,开启后跳过平台加速器探测并只上报 CPU 设备。
相关工具与内容
- 分类:AI 编程、其他AI、AI 对话
- 同题材快讯:Ollama v0.40.2 发布
- 同题材快讯:vLLM v0.31.0 发布
- 延伸阅读:本地 AI 硬件相关快讯
- 工具页:通义千问、DeepSeek
相关内容
Vercel CLI 向智能体开放域名购买:流程可以跑完,付款仍需人确认
Vercel 于 2026 年 10 月 9 日在官方 Changelog 发布更新:编码智能体可以通过 Vercel CLI 走完域名搜索、查可用性、询价到发起购买的完整流程,但成交这一步被刻意留给人类确认 —— 非交互执行时 CLI 返回结构化错误,把确认交回给人。
Open WebUI v0.12.0:实时语音通话、3D 动态形象与双因素登录一起到位
Open WebUI 于 2026 年 10 月 10 日发布 v0.12.0。这一版把语音通话切到实时模式(默认走 OpenAI Realtime 的 gpt-realtime-2.1-mini 配 Marin 音色),支持上传 VRM 模型做带口型的 3D 动态形象,并加入强制双因素登录;同时还带来共享对话可回复、模型控件、长工具调用中的上下文压缩等一批改动。
InvokeAI 7.0.0 alpha 2:多画板项目、MySQL 后端与更多 GGUF 模型支持
InvokeAI 于 2026 年 10 月 11 日发布 7.0.0 alpha 2(PyPI 包 invokeai 7.0.0a2 上传于 2026-10-11T02:05:42)。相对 alpha 1 增加了项目内多画板、MySQL 与 MariaDB 数据库后端、krea2 / ideogram4 / ernie-image 的 GGUF 变换器支持、视频参考帧与音频参考等外部调用能力,以及显存预留配置项。官方同时强调这是 alpha 版本,且 v7 的数据库迁移是单向的。