法国H公司开源Holo4计算机操作智能体:27B拿下OSWorld 85.2%,单任务成本只要8美分

9月28日,法国AI实验室H Company正式发布并开源了新一代计算机操作智能体系列Holo4:提供27B稠密与35B-A3B混合专家(MoE)两个尺寸,权重已在Hugging Face上线,覆盖BF16、FP8、NVFP4与4-bit GGUF四种格式,量化后可直接跑进本地推理框架。官方基准显示,27B版本在OSWorld基准拿下85.2%的任务完成率,单任务成本仅0.08美元,紧咬闭源第一梯队,而价格低了两个数量级。
成绩单:85.2%贴着闭源旗舰走
先看成绩单。在经典的OSWorld桌面操作基准上,Holo4-27B得分85.2%,每任务成本0.08美元;同榜单上Fable 5为86.0%、GPT-5.5为78.7%、Qwen3.8 Max为86.1%——一个27B的开源模型,已经贴着闭源旗舰的分数线走。在覆盖长流程任务的OSWorld 2.0上,Holo4-27B拿到61.7%、单任务1.22美元;作为对照,Opus 5.5为81.8%但成本高达8.48美元,GPT-6 Astra为73.5%、成本9.07美元。官方的说法是:在长流程任务上,Holo4只落后最强的闭源模型,但参数量和成本低了几个数量级。
一个模型管完GUI、代码与API
Holo4最不一样的地方,是把所有软件交互收进同一个模型。以往的智能体往往「一专多缺」:视觉模型看得到屏幕却调不了接口,API模型跑得通接口却点不了按钮。Holo4则可以点击输入、编写并执行代码、调用MCP或API工具,任务需要哪种就切哪种;同一套模型与调用方式,在桌面、网页、Android、代码沙箱和企业API上通用,上下文长度最高262K token。对想搭自动化流程的团队来说,不必再为每个平台单独选型维护一套模型。
能力与许可的取舍
两个尺寸的授权策略值得细看:Holo4-27B基于Qwen3.8稠密架构,走CC BY-NC 4.0非商用许可,定位研究与评估;Holo4-35B-A3B基于Qwen3.5 MoE架构,走Apache 2.0许可,可以放心商用。有意思的是,按官方自家数据,可商用的MoE版在OSWorld 2.0上得分30.9%,只有非商用稠密版的一半左右——想把Holo4装进付费产品,就得在能力与许可之间做取舍,或者找H Company谈单独的商业授权。
训练配方全公开,轨迹可回放
训练配方也一并公开了。H Company用内部的Agentic Task Factory从软件文档与真实界面截图自动合成可验证任务,已累计产出约1万个,覆盖网页应用、MCP服务器与桌面环境;监督微调用掉127B token,其中约四分之三是成功的智能体轨迹。之后通过异步在线强化学习训练出桌面网页与终端API两个LoRA专家,再等权合并回底座。实战案例同样说明问题:在FreeCAD里按几何规格搭建埃菲尔铁塔模型,Holo4-27B用68次调用、240万token完成,而它的底座Qwen3.8-27B需要197次调用、1140万token。所有公开基准的运行轨迹都在trajectories.hcompany.ai上可回放、可下载,成绩经不经得起检验,自己就能复核。
写在最后
对开发者,Holo4意味着本地跑得动的计算机操作智能体成为现实:下载4-bit GGUF权重,配一个MCP服务器就能让智能体在自家软件里干活,屏幕数据不必再交给云端闭源模型。想快速体验智能体编排的团队,可以看我们对扣子Coze的收录页;关注Qwen系开源底座进展的,可以移步通义千问官网。对内容与GEO从业者,当智能体开始代替人去操作软件、检索信息,被AI引用的内容会更依赖结构化、可验证的资料页——GEO(生成式引擎优化)的战场,正在从「被搜索到」走向「被智能体用上」。
(文 / AI30媒体部 | 2026年9月29日)



