2026-08-20 09:06:45
来源:量子位
成本也正成为 Agent 商业化需要考虑的重要因素
8 月 19 日消息,华尔街投行杰富瑞分析师近日对八款全球主流 AI Agent 进行了真实办公任务实测。结果显示,得益于模型与 Harness 的协同效应,阿里“千问办公”综合得分荣登榜首,超越了美国的 Claude Cowork 和 Codex 等主流 Agent 工具。

此次测试共设置了 5 项真实办公任务,包括:基于多份文件完成公司年报摘要、联网检索并对比公司经营数据、操作真实桌面浏览器完成信息检索与文档生成、根据数据制作英文 PPT,以及基于参考图片生成营销海报。测试结果显示,“千问办公”整体表现较为均衡,尤其在复杂办公任务、网页浏览器控制以及多模态内容生成等场景中表现突出,成为唯一一个在所有测评维度中均获得 90 分以上的 Agent 产品。
报告进一步将 Agent 能力拆分为“模型”与“Harness”两部分进行分析。所谓 Harness,是指围绕模型运行的一整套工程机制,包括指令、上下文、工具调用、边界控制、反馈纠错和治理等。按照杰富瑞的测算,“千问办公”的“隐含 Harness 分”位居此次参测产品首位,高于 Claude Cowork 和 Codex 等其他七款国内外主流 Agent 产品。这也意味着,在底层模型之外,如何通过工程和产品能力将模型智能稳定地转化为实际任务结果,正成为 Agent 竞争的关键维度。
除任务表现外,成本也正成为 Agent 商业化落地必须考量的重要因素。报告显示,“千问办公”底座大模型 Qwen 3.8 Max 的 API 价格明显低于部分海外头部模型。由于 Agent 通常需要进行多轮推理、持续调用工具并执行长链路任务,企业未来在衡量 Agent 价值时,除了模型和产品能力,也将更加关注“Cost per Task”(单项任务成本),即完成一项真实任务所需的实际执行成本。阿里 Qwen 模型与“千问办公” Agent 的组合,在此次评估中展现出了显著的性能与成本优势。
过去几个月, Agent 的竞争重心正在从个人办公转向企业级场景。报告指出,对于企业级 Agent 而言,工作流和生态协同是其核心竞争壁垒。随着 Agent 持续深度连接企业数据、业务系统、协作工具和权限体系,用户的历史任务、工作习惯、连接器、Skills(技能)和自动化流程将逐渐沉淀在产品中,从而形成更高的用户粘性和迁移成本。
据介绍,“千问办公”不仅能帮助个人提效,“专为企业级 AI 需求而设计”也是其鲜明特色。目前,“千问办公”已初步打通钉钉 IM 工具,企业员工通过“千问办公”即可完成群聊总结、文档表格创建、消息邮件收发等操作。未来,企业客户还可以将“千问办公”接入到更为复杂的实际工作流中,全面连接企业真实的数据库和业务流程,助力企业全面提升办公与组织协同效率。