AI DAILY / 2026-09-29
Holo4:面向通用计算机操作任务的智能体模型系列
Holo4: powering generalist computer-use agents
全文中文翻译 · AI 生成,仅供学习交流
Holo4:为通用计算机使用智能体提供动力
Holo4 是我们推出的全新系列智能体模型(agentic models)。它有两个规格:27B dense(稠密)和 35B-A3B Mixture of Experts(混合专家,MoE)。两者均已在 H Models API 上线。同时我们还在发布 Holotron 3 的更新版本:Holotron4 Nano。
Holo4 在前代模型的基础上,通过任何可用的接口与软件交互:图形用户界面(GUI)、代码、MCP(Model Context Protocol,模型上下文协议)和 API。它在学术基准上成绩不错,但我们打造它是为了真实业务工作流。它通过监督学习与强化学习,在大量环境和任务上训练而成,其中包括由我们的 Agentic Task Factory 生成的任务。
立即上手:🤖模型:Holo4-27B Holo4-35B-A3B Holotron4 Nano🗂️完整合集(FP16、FP8、GGUF):Holo4🎞️轨迹:viewer dataset⚡H Models API:quickstart📝完整博客文章:hcompany.ai/newsroom/holo4
为每一种接口而生的模型
Holo4 能在屏幕上点击和输入,能编写并运行自己的代码,也能调用 MCP 或 API 工具。它会根据任务选择最合适的方式。大多数智能体模型只为单一接口训练:偏重 GUI 的模型在没有屏幕时就"失明",而偏好工具调用的模型则会卡在没有 API 的应用前。真实工作并不是这样割裂的,单个业务任务往往需要组合使用这些不同的方式。
Holo4 可在桌面、Web、Android、代码沙箱以及各类业务 API 上运行。各种场景下都是同一个模型,调用方式也完全一致。你无需为每个平台选择不同的模型。

Holo4 模型相对于它们的 Qwen 基座有大幅提升。在长流程任务上,Holo4 仅次于最强的闭源模型:在 OSWorld 2.0 上,Holo4 27B 得分为 61.7%,而 Opus 5.5 为 81.8%,Holo4 35B-A3B 达到 30.9%。不过 Holo4 以少得多的参数量和低得多的成本做到了这一点。我们在公开基准上开源了支撑这些分数的每一条轨迹:你可以在 trajectories.hcompany.ai 逐步回放,也可以从 Hugging Face 下载。
与前沿模型竞争,成本却只是其零头
在最难的桌面控制(OSWorld 2.0)和 API 使用(AutomationBench)这两类学术基准上,Holo4 以更低的单任务成本与前沿模型展开竞争。


关于成本-性能图表的说明
OSWorld 2.0。
成本是根据每次智能体运行的输入与输出 token 数估算的。Holo4 按 H Models API 的定价计费(单次运行)。Qwen3.8 27B:模型卡分数,成本来自我们在阿里云公开价目下的运行 token 数。Qwen3.6 35B-A3B:在我们框架内的单次运行,按阿里云公开价目,缓存命中按输入价的 20% 计。GPT 与 Opus 的投入量扫描数据来自 OpenAI 的发布数据;其他闭源与开源模型数据点使用官方 OSWorld 2.0 排行榜。版本、框架与任务子集存在差异。折线连接的是闭源模型中未受支配的分数-成本组合点;Holo4 不在折线内。
AutomationBench。
Holo4、Qwen3.8 27B 与 Qwen3.6 35B-A3B:AutomationBench v1.0.6,分数与成本在我们的内部框架内测得。其他模型:公开集分数来自 AutomationBench 的 README,单任务成本来自官方排行榜(排行榜跑的是私有集)。私有集评估完成后,我们将公布 Holo4 在其上的成绩。
能真正干活的 AI
Holo4 模型在 Agentic Task Factory 生成的环境与任务上训练,在专业软件场景中表现出色。以下对比展示的是 Holo4 27B 与其基座模型 Qwen3.8 27B。两者使用相同的提示词与框架。
三维建模 · 埃菲尔铁塔
在 FreeCAD 中构建一个埃菲尔铁塔的三维模型,比例尺为 1 毫米对应 1 米,居中于原点,并与 X、Y 轴对齐。按此设计执行。
塔身在每个高度平面上都为正方形,永不为圆形。从中心轴线到角点的半宽:地面层为 62.5 毫米,57 高度处为 32.5 毫米,115 高度处为 17.5 毫米,276 高度处为 9.35 毫米。在这些高度之间,半宽沿一条平滑曲线变化,靠近地面处下降陡峭,越往上越平缓,绝不是直线。
四条相同的塔腿,各占一个象限,每条都是一个方形柱,外角沿上述轮廓变化。每条塔腿在地面处宽 14 毫米,在 276 高度处收窄至 4 毫米。塔腿从地面直到第一平台彼此分开,并随高度上升而向中间收拢。塔腿之间的空间不做填充:从任何一侧都能直接看穿整座塔。
三层平台,每层都是一个居中于轴线的实心方形板:57 高度处边长 72 毫米、厚 4 毫米;115 高度处边长 40 毫米、厚 3 毫米;276 高度处边长 22 毫米、厚 3 毫米。
从 276 到 324 高度之间有一根桅杆,方形截面,底部 8 毫米,向上收窄至顶端 2 毫米。
每个部件必须是具有非零体积的闭合实体,且任何部件都不得填充塔腿之间的空间。
Holo4 27B(84 次调用,1.3M tokens) Qwen3.8 27B(60 次调用,1.0M tokens)
三维建模 · H 公司 Logo
在 FreeCAD 中构建 H 公司 Logo 的三维模型:一个实心填充圆盘,旁边是一个粗体无衬线大写字母 H,两者挤出到相同的厚度,两个形状高度相近且彼此分开不重叠,圆盘的中心与 H 的中部齐平。两个形状均为黑色。
Holo4 27B(94 次调用,1.5M tokens) Qwen3.8 27B(118 次调用,1.9M tokens)
游戏设计 · 吃豆人
在 Godot 中构建一个吃豆人(Pac-Man)风格的游戏并保持运行。
一个矩形迷宫,墙壁按网格布局,每条开放走廊中都布满 pellet(豆子)。一个玩家标记沿着走廊持续移动,每经过一个豆子就将其吃掉并得 1 分。三个幽灵在同一条走廊中移动并追击玩家。若幽灵抓住玩家,玩家失去一条命,所有元素重置回起始位置。分数与生命值显示在屏幕上。
不会有人来玩这个游戏。玩家用一个简单的启发式方法自己驱动:每个路口,它朝最近的豆子前进,除非有幽灵靠近,此时它会朝远离幽灵的方向移动。游戏必须无人值守且无限运行,完全不需要键盘输入。
一切就绪后,启动游戏并让其持续运行。
Holo4 27B(68 次调用,2.4M tokens,268 行) Qwen3.8 27B(197 次调用,11.4M tokens,327 行)
我们如何构建 Holo4
智能体任务工厂
我们的内部智能体流水线,仅凭文档(如真实网站的截图或开源软件)就能构建交互式环境和可验证的任务。迄今为止,它已生成约 10,000 个任务,覆盖 Web 应用、MCP 服务器以及桌面环境,其中包括通过 GUI 和 MCP 同时暴露同一状态的混合环境。
训练框架
在训练的同时,我们基于智能体在 OSWorld 2.0 上的表现反馈,重建了我们的训练框架(harness),即执行模型动作并在数百步中管理其上下文的循环。智能体会标注每个任务失败的原因,工程师随后审阅并修复这些问题。最大改动是为智能体提供一个可靠的、能跟踪数百步的记忆系统,以及一台桌面机器本身的 shell。
Opus 5(70.2%)和 GPT-5.6 Sol(66.2%)使用 OpenAI 发布数据中 v2026.08.08 离线集上的最大投入量部分奖励,与成本-性能图中一致。其他参考分数来自模型卡与官方排行榜。任务版本、子集与框架存在差异。
Holotron4 Nano
我们的后训练栈被设计成能适配新的基础模型,并产出跨接口与跨环境泛化的智能体。作为 NVIDIA Nemotron Coalition 的成员,我们将最新训练栈应用于 Nemotron 3 Nano Omni 模型,作为 Holotron 3 的后续工作。
同样的方法将 Nemotron 3 Nano Omni 转化为 Holotron4 Nano,一款通用智能体模型,在 GUI 工作流以及暴露 MCP、API 或编码沙箱的环境中,相较基座模型均有显著提升。
