H Company 于 2026 年 9 月 28 日发布 Holo4 系列智能体模型,含 27B 稠密与 35B-A3B 混合专家两个尺寸,权重开放下载并提供托管 API,面向桌面、网页与移动端软件操作。
Holo4 开源:能操作桌面与网页的通用智能体模型
这次发布的是什么
法国 AI 实验室 H Company 于 2026 年 9 月 28 日发布 Holo4,一个面向计算机操作的智能体模型系列,包含 27B 稠密与 35B-A3B 混合专家两个尺寸。两个尺寸都可通过 H Models API 调用,权重也已开放下载。
官方对 Holo4 的定义是:能通过任意可用接口与软件交互——图形界面、代码、MCP 与 API。它会点击和键入屏幕、自己写并运行代码、调用 MCP 或 API 工具,按任务需要选其中合适的一种。官方强调同一个模型可以跑在桌面、网页、Android、代码沙箱和企业 API 上,调用方式一致,不需要为不同平台选不同模型。
同批还发布了 Holotron4 Nano,官方称这是对 Holotron 3 的更新版本,基于 NVIDIA Nemotron 3 Nano Omni 做后训练得到。
可用性与限制
- 获取方式:权重开放下载,格式为 BF16、FP8、NVFP4 与 4-bit GGUF;同时提供 H Models API。
- 上下文:官方标注两个尺寸的上下文长度均为 256K。
- 许可差异:两个尺寸的许可并不相同,官方页面对 35B-A3B 标注为 Apache 2.0,27B 则标注为研究用途;商用前请以官方仓库的许可文件为准。
- 基座来源:官方提到 27B 的基座是 Qwen3.8 27B,其余细节以官方模型卡为准。
- 计费:API 按 token 计费,具体价格与每任务成本以官网为准,本稿不抄录数字。
- 分数口径:官方公布的基准分数由官方在自己的 harness 下测得,与其他厂商自行公布的数字并非同一环境,官方自己也做了注明。
- 待发布项:官方称将在近日发布优化过的 DSpark drafter 检查点用于加速推理,当前尚未提供。
主要功能
- 点击与键入图形界面完成操作
- 自行编写并执行代码
- 调用 MCP 工具与外部 API
- 在同一模型下覆盖桌面与网页
- 支持 Android 端应用操作
- 面向企业软件的业务流程自动化
技术原理
官方把训练拆成三段,并公开了任务来源。
任务来自内部的 Agentic Task Factory。它从产品文档、真实网站截图与真实软件出发,自动生成可交互环境、任务与验证器;一个任务只有在验证器对未修改的初始状态失败、对正确状态通过、且能拒绝所有近似错误答案,并被智能体通过真实接口解决之后才会保留。官方称目前已产出约一万个任务,覆盖网页应用、MCP 服务与桌面环境,也包含同一状态同时以图形界面和 MCP 暴露的混合环境。
训练先是监督微调,官方公布用了一千余亿 token,其中约四分之三是来自上述工厂的成功智能体轨迹,按桌面、网页、MCP 与 API、移动端分配,其余覆盖多模态推理、图形界面定位与纯文本工具使用和编码。随后是长周期任务上的异步在线强化学习,训练出两个专用 LoRA 专家——一个面向桌面与网页,一个面向终端、MCP 与 API——最后以等权合并回微调后的模型,官方称合并后不再做进一步训练。
官方还提到同步重建了 harness,让智能体在数百步规模下保持可靠记忆,并把 shell 放到桌面机器本机运行。
实际体验
本稿没有部署这两个模型跑任务,不写未经执行的实测结论。下面是可以自己复现的验证顺序。
第一步,先按用途选尺寸:要放进付费产品,先读仓库的许可文件确认能否商用,两个尺寸的许可不同,这一步最容易踩。第二步,若是本地运行,选与你显存匹配的量化格式,GGUF 那几档可以直接进支持该格式的本地运行时。第三步,挑一个你已经能手工完成、且验收标准明确的桌面或网页任务,让模型从零跑一遍,记录它在第几步偏离。第四步,把官方开放的轨迹数据集拿出来对照——官方把公开基准背后的每一条轨迹都放了出来,可逐步回放,这是这次发布里少见的可以直接查的部分。
判断这类模型能不能用,关键不看总分,看它在你自己的软件环境里能不能稳定跑完完整流程。官方分数只宜用来缩小候选范围。
项目地址与获取方式
权重在 Hugging Face 上提供,两个尺寸分别对应各自的仓库,格式含 BF16、FP8、NVFP4 与 4-bit GGUF;Holotron4 Nano 以 BF16 与 FP8 提供。托管调用走 H Models API,官方另有快速上手文档。官方还公开了基准轨迹数据集,可在官方轨迹站点逐步回放,也可下载。
请通过官方仓库与官方 API 获取,避免从第三方镜像下载权重,以免拿到被篡改的版本。许可条款、上下文配置与当前可用尺寸以官方仓库为准。
适合谁用
- 在做桌面或网页流程自动化、且现有单一接口模型覆盖不全的智能体开发者。
- 想在自有环境部署计算机操作模型、不愿意把每步操作都发到第三方 API 的团队。
- 研究智能体训练方法的从业者,官方公开的任务生成流程与轨迹数据有直接参考价值。
- 需要在网页、桌面与移动端共用同一套调用方式的工程团队,这是官方强调的设计目标。
- 不必急着跟进的情况:只要一个稳定的对话或写作助手,或者没有本地推理资源——这类模型的价值在「替你操作软件」,用不上这个能力时它的复杂度是纯负担。
常见问题
27B 和 35B-A3B 该选哪个?
官方的定位是 27B 稠密模型在网页、桌面与移动端的长程多步任务上准确率更高,35B-A3B 混合专家模型速度更快、成本更低。但两个尺寸的许可不同,选择时先看许可是否允许你的用途,再看性能与成本,这个顺序不要倒过来。
可以商用吗?
请先看官方仓库中的许可文件再决定。官方页面对 35B-A3B 标注为 Apache 2.0,27B 标注为研究用途,也就是说能直接放进商业产品的很可能是后者。许可条款以仓库文件为准,不要只看发布公告的概述。
官方公布的基准分数可信吗?
官方自己注明了口径:Holo4 的分数来自官方 harness,多轮取平均,对比项来自各家的模型卡、官方榜单与厂商图表,harness 与 effort 档位并不统一,且尚无独立第三方复现。这次发布的一个可取之处是轨迹全部公开,可以逐条回放核对,比只看总分靠谱。
本地部署需要什么条件?
官方提供了 BF16、FP8、NVFP4 与 4-bit GGUF 多种格式,量化档位可以直接进支持 GGUF 的本地运行时。但官方标注的 256K 上下文是配置上限,不是某台具体机器的实测要求,实际能跑多长取决于你的硬件与并发。显存与吞吐请以自己的环境实测为准。
和通用大模型相比差别在哪?
差别在训练目标。通用模型主要优化「说得好」,Holo4 这类模型优化的是「把软件操作做完」,训练数据本身就是大量带验证器的真实软件任务。如果你的需求是写文案或做分析,通用模型更合适;如果是让模型替你点完一整套流程,这类模型才对得上。
相关工具与内容
想搭自己的智能体流程,站内 AI智能体 分类下收录了 扣子、Dify 与 n8n 等可编排方案。编码与终端类场景可以看 AI编程 里的 Claude Code、Cursor 与 CodeBuddy;WorkBuddy 也归在同类。选型时怎么在功能与成本之间取舍,2026 年第四季度 AI 工具怎么选 里有更完整的对照。
相关内容
Claude Sonnet 5.5 发布:5.5 家族第二款模型
Anthropic 于 2026 年 9 月 28 日发布 Claude Sonnet 5.5,为 5.5 家族继 Opus 5.5 之后的第二款模型,官方定位为更快、更低成本的补充型号,已在 Claude 平台与三大云上线。
华为 openPangu-2.0 训练与 RL 代码开源
华为于 2026 年 9 月 28 日宣布开源 openPangu-2.0 的预训练、SFT 代码与后训练 RL 代码,训练框架与昇腾原生强化学习框架同步上线 Ascend Tribe 开源社区。
DeepSeek 4.4 分怎么来的:推理摊开看,模型还能自己部署
DeepSeek 在本站五维评测口径下总分 4.4,是对话类里得分最高的一款:可用性与成本效率都落在最有利档位,模型权重开放可本地部署。本文逐项给出打分依据、与 Kimi、ChatGPT、Claude、Perplexity 的横比,以及什么情况下该换工具。