Hugging Face Blog

Holo4: powering generalist computer-use agents

8.5内容质量

TL;DR · AI 摘要

Holo4模型在保持低成本的同时实现接近前沿模型的性能,支持多接口交互并开源轨迹数据。

核心要点

  • Holo4-27B在OSWorld 2.0基准得分61.7%,仅比Opus 5.5低19.1个百分点
  • 35B-A3B版本参数量比Qwen3.8 27B多8B但成本降低80%
  • 支持GUI/代码/MCP/API四类接口的统一交互

结构提纲

按章节快速跳转。

  1. 介绍Holo4模型系列及其在多接口交互上的突破性进展

  2. Holo4包含27B密集模型和35B-A3B专家混合模型两个版本

  3. 支持GUI、代码、MCP和API四种交互方式的统一模型调用

  4. 在OSWorld 2.0基准测试中表现优于Qwen但低于Opus模型

  5. 参数量比竞品少但推理成本降低至1/5

  6. 支持桌面、Web、Android等多平台统一调用

思维导图

用一张图看清主题之间的关系。

查看大纲文本(无障碍 / 无 JS 友好)
  • Holo4模型
    • 模型版本
      • 27B密集模型
      • 35B-A3B专家混合
    • 核心能力
      • 多接口交互
      • 业务流程适配
    • 性能指标
      • OSWorld 2.0得分61.7%
      • 成本比Opus降低80%

金句 / Highlights

值得收藏与分享的关键句。

#Holo4#模型#Hugging Face#计算机使用代理
打开原文

Holo4:赋能通用型计算机使用代理

返回文章列表

[0

团队

]

文章

发布于 2026年9月28日

[-1

点赞

67

[

  • +61

Maxime Theillard

h-maxime

关注

Hcompany

Frederic Renard

frenard-h

Vincent Coyette

vincentcoyette

Emrick Sinitambirivoutin

emricksini-h

Avshalom Manevich

avshalom-h

Antonio Loison

antonioloison

Antoine Bonnet

ABonnetH

Maxime Langevin

maxime-hcompany

Aleix Cambray (H-AI)

h-aleixcambray

Léonard Benedetti

l-benedetti

Tony Wu

tonywu71

Mats L. Richter

MatsLRichter

Michael Eickenberg

michaelhai

Sławek Mucha

smucha-h

Matthias Brunel

mbrunel-H

Daniel Beechey

daniel-beechey-h

Holo4 是我们新推出的系列代理模型,提供两种规格:27B 全连接模型和 35B-A3B 专家混合模型。两种模型均可通过 H Models API 获得。我们同时发布了 Holotron3 的更新版本:Holotron4 Nano。

Holo4 在先前模型基础上进行改进,能够通过任何可用接口与软件交互:GUI、代码、MCP 和 API。它在学术基准测试中表现优异,但我们的设计目标是真实商业工作流。该模型通过监督学习和强化学习在大量环境和任务上进行训练,包括由我们的代理任务工厂生成的任务。

立即开始:

  • 🤖 模型:Holo4-27B | Holo4-35B-A3B | Holotron4 Nano
  • 🗂️ 完整系列(FP16、FP8、GGUF):Holo4
  • 🎞️ 运行轨迹:查看器 | 数据集
  • ⚡ H Models API:快速入门
  • 📝 完整博客文章:hcompany.ai/newsroom/holo4

适配所有接口的模型

Holo4 可以在屏幕上点击和输入文字,编写并运行自己的代码,调用 MCP 或 API 工具。它会根据任务选择最合适的接口。大多数代理模型仅针对单一接口进行训练:专注于 GUI 的模型在没有屏幕时无法工作,而偏好工具调用的模型则可能在没有 API 的应用程序前陷入僵局。真实工作场景不会如此割裂,单一业务任务可能需要结合不同方法。

Holo4 可在桌面、网页、Android 系统、代码沙盒以及商业 API 上运行。在所有场景中使用的是相同模型,调用方式也完全一致。您无需为每个平台选择不同模型。

Holo4 模型在 Qwen 基础模型上有了显著提升。在长流程任务中,Holo4 仅落后于最强的闭源模型:在 OSWorld 2.0 基准测试中,Holo4 27B 得分 61.7%(Opus 5.5 得分 81.8%),Holo4 35B-A3B 达到 30.9%。但它的参数量少几个数量级,成本也低得多。我们开源了所有公开基准测试中取得成绩的运行轨迹:可通过 trajectories.hcompany.ai 逐帧回放,或从 Hugging Face 下载。

与前沿模型竞争,成本仅为其几分之一

在最困难的桌面控制(OSWorld 2.0)和 API 使用(AutomationBench)学术基准测试中,Holo4 以远低于前沿模型的成本实现竞争力。

成本效益图表说明

OSWorld 2.0。成本根据每次智能体运行的输入和输出令牌数估算。Holo4 按 H 模型 API 的定价标准计费(单次运行)。Qwen3.8 27B:模型卡得分,成本基于我们在阿里云列表价格下的运行令牌数。Qwen3.6 35B-A3B:在我们的测试套件中单次运行,阿里云列表价格下缓存命中率为输入价格的 20%。OpenAI 发布的数据提供了 GPT 和 Opus 的努力范围;其他闭源和开源权重模型使用官方 OSWorld 2.0 领域排行榜。不同模型的发布版本、测试套件和任务子集存在差异。该线连接闭源模型中非支配的得分和成本对,Holo4 被排除在外。

AutomationBench。Holo4、Qwen3.8 27B 和 Qwen3.6 35B-A3B:AutomationBench v1.0.6,得分和成本通过我们的内部测试套件测量。其他模型:公开数据集得分来自 AutomationBench README,每个任务的成本来自官方排行榜(基于私有数据集运行)。一旦 Holo4 在私有数据集上完成评估,我们将报告其结果。

能够执行工作的 AI

Holo4 模型基于我们的智能体任务工厂中的环境和任务进行训练,在专业软件上表现出色。以下示例展示了 Holo4 27B 与其基础模型 Qwen3.8 27B 的对比,两者使用相同的提示和测试套件。

3D 建模 · 埃菲尔铁塔

在 FreeCAD 中以 1 毫米对 1 米的比例创建埃菲尔铁塔的 3D 模型,模型需以原点为中心,并与 X 和 Y 轴对齐。按照此设计进行建模。塔的平面在所有高度均为方形,从不为圆形。从中心轴到角落的半宽在地面为 62.5 毫米,在高度 57 处为 32.5 毫米,在高度 115 处为 17.5 毫米,在高度 276 处为 9.35 毫米。在这些高度之间,半宽遵循一条平滑曲线,靠近地面时急剧下降,更高处则逐渐下降,且从不为直线。四个相同的腿,每个象限一个,均为方形柱体,其外角遵循该轮廓。每条腿在地面处宽 14 毫米,到高度 276 处逐渐收窄至 4 毫米。腿从地面到第一平台部分与地面分离,随着高度上升逐渐汇聚。腿之间不填充任何空间:塔是开放的,从任何一侧都可以直接穿过。三个平台,每个平台均为实心方形板,位于轴心上:在高度 57 处,宽 72 毫米,厚 4 毫米;在高度 115 处,宽 40 毫米,厚 3 毫米;在高度 276 处,宽 22 毫米,厚 3 毫米。从高度 276 到 324 的桅杆为方形,底部宽 8 毫米,尖端逐渐收窄至 2 毫米。所有部件必须为封闭实心结构且体积不为零,且任何部件不得填充腿之间的空间。

Holo4 27B(84 次调用,130 万令牌)

Qwen3.8 27B(60 次调用,100 万令牌)

3D 建模 · H 字母标志

在 FreeCAD 中创建 H 公司的 3D 标志模型:一个实心填充的圆盘与一个方正的无衬线大写 H 字母并排,两者均以相同厚度进行拉伸,两个形状高度相近且不重叠,圆盘的中心与 H 字母的中线对齐。将两个形状均着色为黑色。

Holo4 27B(94 次调用,150 万令牌)

Qwen3.8 27B(118 次调用,190 万令牌)

游戏设计 · 《吃豆人》

在Godot中构建一个类似吃豆人游戏并让它持续运行。一个由墙壁组成的矩形迷宫按照网格布局,所有开放通道中都填满了豆子。玩家标记物会持续沿着通道移动,每经过一个豆子就会吃掉它并获得一分。三个幽灵在相同通道中移动并追逐玩家。如果幽灵抓住玩家,玩家会失去一条生命并重置到初始位置。分数和生命值会显示在屏幕上。没有人会来玩这个。玩家通过一个简单的启发式策略自主驱动:在每个岔路口时,它会朝着最近的豆子前进,除非有幽灵靠近,此时会远离幽灵。游戏必须无人值守且无限运行,完全不需要任何键盘输入。当它正常运行时,启动游戏并让它持续运行。

Holo4 27B(68次调用,240万tokens,268行)

Qwen3.8 27B(197次调用,1140万tokens,327行)

我们如何构建Holo4

智能体任务工厂

我们内部的智能体流水线仅通过文档即可构建交互式环境和可验证任务,例如真实网站或开源软件的截图。到目前为止,它已为网页应用、MCP服务器和桌面环境生成了约10,000个任务,包括通过GUI和MCP暴露相同状态的混合环境。

训练

Harness

在训练过程中,我们重建了Harness——这个执行模型动作并在数百个步骤中管理其上下文的循环,使用了OSWorld 2.0上智能体性能的反馈。智能体标记了每个任务失败的原因,工程师审查了他们的修复方案。最大的改进是为智能体提供了可靠的内存,可追踪数百个步骤,并在桌面机器本身上添加了shell。

Opus 5(70.2%)和GPT-5.6 Sol(66.2%)在OpenAI发布的v2026.08.08离线数据集上使用最大努力部分奖励,如成本-性能图所示。其他参考分数来自模型卡片和官方排行榜。任务发布、子集和Harness各不相同。

Holotron4 Nano

我们的后训练堆栈设计用于适应新的基础模型,并生成能跨接口和环境泛化的智能体。作为NVIDIA Nemotron联盟的成员,我们将最新的堆栈应用于Nemotron 3 Nano Omni模型,作为Holotron 3的后续版本。

同样的方案将Nemotron 3 Nano Omni转化为Holotron4 Nano,这是一个通用智能体模型,在GUI工作流和暴露MCP、API或编码沙盒的环境中显著优于基础模型。

这些改进是相对于Nemotron 3 Nano Omni的绝对百分比提升。

这些成果表明我们的方案具有良好的迁移能力,可以将通用模型转化为智能体专家。其中没有任何内容与模型规模相关。

亲自运行

两种版本今天都可以通过H Models API获取。权重在Hugging Face上以BF16、FP8、NVFP4和4位GGUF格式提供,与我们的小型模型Holotron4 Nano并列。

我们将在未来几天内发布优化的DSpark草稿检查点,以进一步加速推理。

本文提到的模型 3

本文提到的数据集 1

本文提到的集合 1

更多来自该作者的文章

NeoMME:一种高效的多模态原生且多语言编码器

120

2026年9月3日

Holo3.1:快速且本地化的计算机使用智能体

51

2026年6月2日

社区

编辑

预览

通过拖拽、粘贴或点击此处上传图片、音频和视频

点击或粘贴此处以上传图片

评论

· 注册或登录以发表评论

  • +55