WorkBuddy 生态战开打:杰富瑞实测千问办公 95 分、豆包 77 分、WorkBuddy 66 分,先发优势正被任务执行力追赶
8 月 19 日前后,多家财经媒体转述了华尔街投行杰富瑞(Jefferies)的一份 AI Agent 研究报告。报告对 8 款中美主流 AI Agent 做了真实办公任务实测,满分 100:阿里千问办公 95 分居首,Anthropic 的 Claude Cowork 94 分、OpenAI Codex 92 分紧随,Kimi Work 86 分、豆包 77 分、MiniMax Code 71 分,腾讯 WorkBuddy 与谷歌 Gemini Spark 同为 66 分垫底。
一个问题先摆出来:当流量领先者拿了最低分,护城河还守得住吗?
一、五道题,考的是「执行力」
据上海证券报、广西日报等转述,杰富瑞的测试覆盖多文件检索、联网研究、浏览器操作、PPT 制作及多模态内容生成五类场景。具体任务包括基于多份文档做公司年报摘要、联网比对企业经营数据、操作真实浏览器检索资料、根据原始数据制作英文 PPT、参照参考图制作营销海报。
ChinaBiz Insider 的英文报道进一步披露了评分拆解:杰富瑞把 Agent 拆成「模型」与「Harness(工程框架)」两层,Harness 又细分为指令、上下文、工具、边界、反馈、治理六个功能层,并采用 60% 模型 + 40% Harness 的加权口径反推各产品的隐含 Harness 分。
五道题考的不是「会不会聊」,而是「能不能交付」。这套设定,恰好把各家在模型智商之外的工程短板一次性暴露出来。
二、66 分的含金量
腾讯 WorkBuddy 拿到 66 分,与 Gemini Spark 并列末位。但口径要拆开看:易观数据显示,2026 年 6 月国内 17 款主流桌面端 AI 原生办公智能体月访问量合计约 6000 万次,其中 WorkBuddy 约 2097 万次居首(据 21 世纪经济报道)。
也就是说,流量第一、工程分垫底,出现了明显背离。ChinaBiz Insider 引述杰富瑞归因,认为这与分发优势(先发入口、腾讯系流量)而非 Harness 工程质量本身有关。报告同时指出,千问办公的底层模型 Qwen 3.8 Max 智商分仅排第四,却靠 Harness 工程反超 Claude 与 Codex。
这解释了一个反常识的现象:同一模型换一套 Harness,实测能差 18 个百分点——杰富瑞用 Claude Opus 4.6 在 Terminal-Bench 2.0 上做控制变量,分数在 58.0% 到 76.4% 间波动,18.4 分的差距全部来自工程框架。

三、先发优势正被追赶
标题里「先发优势正被任务执行力追赶」并非空话。杰富瑞报告把 8 款产品按「模型智商」和「工程框架」两套维度排了两张表,结论偏向:企业采购若只锚定模型基准,会系统性错配预算。
豆包 77 分、Kimi Work 86 分,均已超过 WorkBuddy。更关键的是,千问办公 95 分是全场唯一全科目过 90 的产品;而 WorkBuddy 在浏览器控制(Task 2)等任务上明显偏弱,被报告点名。
真正的考验,是 66 分会不会变成用户留存的天花板。流量可以靠入口红利堆出来,但周活是否留得住,最终要看交付质量——这正是「先发优势」最脆弱的地方。
四、打分口径,能当真吗
问题也随之而来:这场「考试」的分数,可比性到底有多高?
第一,五道任务都是特定场景,未必覆盖每个产品的主打能力;第二,60/40 的加权权重是杰富瑞自选的,换一套权重,排序可能变化;第三,报告本身是券商研究,服务于投资叙事,对「Harness 是新护城河」的立论有鲜明倾向。
广西日报在转载时就提醒:分析师的评测结果,不能等同于行业排行榜。把一份横向测评直接读成「谁强谁弱」的终局,对任何一方都不公平。

五、分数之后,看什么
对旁观者来说,这份报告最有价值的不是排名,而是那个被反复验证的变量:决定 Agent 交付质量的,越来越不是底层模型,而是把指令、上下文、工具、边界串起来的 Harness。
WorkBuddy 手握流量第一的先发位,但 66 分提示工程框架仍有大段补课空间;千问办公则证明,中等智商模型配强 Harness,照样能打。
到那时,答案才会真正浮出水面:当各家模型智商差距被 Harness 抹平,用户是用脚投票留在流量入口,还是流向上级执行力更强的那一个?
