华尔街实测八款主流AI Agent,阿里千问办公综合排名第一
产品、行业 雷峰网

华尔街实测八款主流AI Agent,阿里千问办公综合排名第一

华尔街投行杰富瑞对八款全球主流AI Agent进行真实办公任务实测,结果显示阿里千问办公综合得分排名第一,超过Claude Cowork和Codex等工具。测试涵盖年报摘要、数据比较、浏览器操作、PPT制作和海报生成等五项任务,千问是唯一在所有维度均获90分以上的产品。

华尔街投行杰富瑞近日发布了一份针对全球主流AI Agent产品的实测报告,引发业内广泛关注。该机构分析师选取了八款国内外具有代表性的AI Agent工具,围绕真实办公场景设置了五项具体任务,包括基于多份文件完成公司年报摘要、联网查找并比较企业经营数据、操作真实桌面浏览器完成信息检索和文档生成、根据数据制作英文演示文稿,以及基于参考图片生成营销海报。测试结果显示,阿里旗下千问办公在综合得分上排名第一,超越了包括Claude Cowork和Codex在内的多款美国产品,成为唯一在所有测评维度中均获得90分以上的Agent工具。

这份报告的核心价值在于,它并非单纯比拼底层大模型的参数或跑分,而是将Agent能力拆解为“模型”与“Harness”两个层面进行剖析。所谓Harness,是指围绕模型运行的一整套工程机制,涵盖指令编排、上下文管理、工具调用、边界控制、反馈纠错以及治理规则等环节。按照杰富瑞的测算,千问办公的“隐含Harness分”位居此次测试产品首位,高于Claude Cowork和Codex等七款主流产品。这一结论揭示了一个重要趋势:在底层模型能力日益趋同的背景下,如何通过工程和产品设计将模型智能稳定地转化为实际任务结果,正在成为Agent竞争的关键分水岭。换言之,一个优秀的Agent不仅需要“聪明的脑子”,更需要一套成熟稳健的“手脚协调系统”。

除任务表现外,成本因素也被纳入此次测评的重要考量维度。报告显示,千问办公底层所采用的Qwen 3.8 Max模型,其API调用价格明显低于部分海外头部模型。由于Agent在实际运行中通常需要进行多轮推理、持续调用外部工具并执行长链路任务,单次任务的综合算力消耗远高于普通对话请求。因此,杰富瑞提出“每任务成本”这一概念,建议企业在评估Agent价值时,不仅要看模型能力和产品体验,还要关注完成一项真实任务所需的执行成本。阿里Qwen模型与千问办公Agent的组合,在性能与成本之间展现出了较为突出的平衡优势,这为后续企业级规模化部署提供了更具吸引力的经济模型。

从更宏观的行业视角来看,过去几个月Agent的竞争焦点正从个人效率工具加速转向企业级应用场景。报告认为,对于企业级Agent而言,工作流和生态协同才是核心竞争壁垒。随着Agent持续连接企业数据库、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、自动化流程等资产会逐渐沉淀在平台中,形成越来越高的使用粘性和迁移成本。据透露,千问办公目前已初步打通钉钉IM工具,企业员工可以直接通过该Agent完成群聊总结、文档表格创建、消息邮件收发等高频操作。未来,企业客户还可将千问办公接入到真实繁杂的工作流中,全面连接企业数据库和业务流程,从而在组织效率层面释放更大价值。此次杰富瑞的实测结果,无疑为正在加速演进的Agent赛道提供了一个重要的参照坐标。