腾讯混元Hy4 preview首发接入WorkBuddy:上线首日排队、推理集群紧急扩容,Hy3限免延至9月30日

腾讯混元Hy4 preview首发接入WorkBuddy:上线首日排队、推理集群紧急扩容,Hy3限免延至9月30日
摘要:8 月 28 日,腾讯混元发布并开源 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,WorkBuddy 国内版与国际版同步首发接入。三天后的 8 月 31 日,腾讯混元与 WorkBuddy 联合项目团队发出公告:上线首日,Wo...

腾讯混元Hy4 preview首发接入WorkBuddy:上线首日排队、推理集群紧急扩容,Hy3限免延至9月30日

一个新模型上线当天就把自己挤爆了,这在 2026 年不算常见。

8 月 28 日,腾讯混元发布并开源 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,WorkBuddy 国内版与国际版同步首发接入。三天后的 8 月 31 日,腾讯混元与 WorkBuddy 联合项目团队发出公告:上线首日,WorkBuddy 任务队列里就出现了排队,团队已对 Hy4 preview 推理集群紧急扩容,并公开致歉。

这不是营销事故,更像一次没做足压力测试就开闸的真实供需测试。770B 的 MoE 旗舰要在免费额度内承接 C 端并发,算力账怎么算都是紧的。真正的看点在于:一个号称"为生产力而生"的模型,在办公智能体里到底能替用户多干多少活;以及排队的那些人,是不是真的非它不可。

一、770B 与 1M,扩容扩在哪

Hy4 preview 的规格跳了一整代。

腾讯官方资料显示,上一代 Hy3 为 295B 总参数、21B 激活参数、256K 上下文;Hy4 preview 把三项全部往上翻,做到 770B 总参、49B 激活、1M 上下文。架构仍是 MoE:backbone 共 78 层,第 1 层为 dense FFN,其余 77 层每层 256 个路由专家加 1 个共享专家,每个 token 激活 top-8 路由加 1 个共享专家,hidden size 6144。长上下文不靠 rope-scaling 硬拉,而是用稀疏注意力配合 IndexCache 的跨层索引复用。Hugging Face 文件页显示的 780B,是把内置的 MTP 投机解码层(10B 总参 / 0.7B 激活)算了进去,官方口径的 770B 指 backbone。

对办公场景而言,1M 这个数字比 770B 更实际。它意味着一整个代码仓库、一整年的经营报表、几百份合同可以同时丢进上下文,而不是切段喂进去。WorkBuddy 里"把 18 个月账单跑一遍""对 108 家下属企业全库扫描"这类任务,此前要拆成多轮,现在有机会一次端上去。

参数效率是另一个角度。据第三方模型对比文章观察,Hy4 preview 在 Terminal-Bench 上的分数已经超过激活参数量明显更大的 DeepSeek V4 Pro。MoE 只在推理时激活部分专家,实际计算量远低于总参数给人的印象,这对想私有化部署的团队是实打实的成本差异。腾讯首席 AI 科学家姚顺雨主导了这轮迭代,从 2026 年 2 月重建预训练与强化学习基础设施算起,平均两个月一个大版本。

二、12 项跑分里的进步与水分区

腾讯公布的 12 项 benchmark 里,能在公开文字报道中逐条对上的有这几项:Terminal Bench 2.1 从 Hy3 的 70.8 升到 85.4,涨 14.6 分;DeepSWE 从 28.0 翻到 64.3;Toolathlon-Verified 从 56.2 升到 74.1;APEX-Agents(pass@1)拿到 37.1,Kimi K3 是 37.2,差 0.1。科学与推理线上,BioMysteryBench 从 54.9 升到 71.3,GPQA Diamond 从 90.9 升到 92.3。长上下文检索 OneMillionBench(with tools)为 65.4,Hy3 是 51.5。

前提必须说清楚:这 12 项全部是腾讯自述。发布当天没有 Artificial Analysis 收录,没有 HF Open LLM Leaderboard 数据,也没有社区独立实测,第三方媒体基本是通稿转载。腾讯自己在方法论注释里也标了,表中带星号的分数是腾讯对别家模型的第三方复现,不是对方自报数。

相对更值得参考的是内部盲测:163 名腾讯内部专家、203 个工程任务,在 WorkBuddy 环境下盲评,Hy4 preview 均分 2.99/4.00,略优于 GLM 5.3 的 2.92 和 Kimi K3 的 2.94。这套数据出自自家测试,参考价值要打折,但它衡量的是真实工作流表现,比刷榜分数离用户更近。第三方竞技场 Arena.ai 的结果显示,Hy4 preview 在 Code Arena: WebDev 以 1633 分暂列约第 5,开源模型里约排第 3,而 Hy3 此前总榜第 31,提升了 115 分。

官方自己的定性倒很克制:这是 Hy4 的早期版本,预训练和后训练均仍有较大提升空间,已知问题包括复杂任务下的长思考与过度自我验证倾向。

核心数据一览

三、首日排队:一次真实的压力测试

8 月 31 日的公告给了三条信息。

其一,8 月 28 日 Hy4 preview 在 WorkBuddy 首发接入后,上线首日即在任务队列中出现排队,团队已针对推理集群紧急扩容,并将持续动态调配资源。其二,受限于高端算力总量与高峰并发集中,仍不排除个别时段继续排队。其三,过渡方案两条:切换到 Hy3 等其他模型;非紧急需求错峰在晚间时段使用。

这三条拼起来,是 2026 年 AI 行业最真实的一处供需关系:770B 的 MoE 旗舰推理成本高,免费额度一开,并发立刻打满。腾讯没有披露具体调用量、扩容倍数和平均排队时长——这是这份公告里最该补而没补的数据。

一个有意思的细节是模型自己也参与了优化。腾讯混元团队称,Hy4 preview 自主分析了推理系统的瓶颈,在算子融合、通信优化等环节完成多轮优化,端到端吞吐相比基线提升 31.8%,且在不同上下文长度与并发水平下收益一致。如果这条成立,硬件扩容之外还有一层软件侧的余量。

四、两条限免线:9 月 10 日与 9 月 30 日

时间表要记清楚。

Hy4 preview 限免至 2026 年 9 月 10 日 23:59,窗口两周;Hy3 在 WorkBuddy 的限免延长至 2026 年 9 月 30 日 23:59。两条线错峰,逻辑很清楚:Hy3 做日常办公与常规问答的免费基座,Hy4 preview 开一个两周窗口,让开发者和企业用户评估新模型的 Agent 能力。

三条容易被忽略的规则:一是每日免费额度有限,平台为每位用户分配了每日额度,触发限频后页面提示额度重置时间,之后可消耗积分继续使用;二是 Hy4 preview 和 Hy3 均为大语言模型,暂不具备图像 / 视频等多模态生成能力,在 WorkBuddy 里发起生图、视频任务时系统会自动切换到其他多模态模型执行,按正常规则产生积分消耗,不占用 Hy4 preview 的免费额度;三是当日资源繁忙时会进入排队。

API 侧价格同时给出:输入 6 元/百万 tokens、输出 18 元/百万 tokens,缓存命中低至 0.3 元;美元计价为输入 0.834 美元、输出 2.501 美元、缓存命中 0.042 美元。开发者可通过腾讯云 TokenHub 和 OpenRouter 接入。

趋势与结构拆解

五、什么任务值得切到 Hy4

对用户来说,真正的问题不是"要不要追新",而是"哪些活值得排这个队"。

值得切的三类:长上下文任务,1M 窗口对全代码库问答、整年长文档解析、跨文件数据分析是硬优势;多步骤 Agent 任务,Toolathlon-Verified 从 56.2 到 74.1 提升的是工具调用链,正对 WorkBuddy 的自动化流水线;软件工程长任务,DeepSWE 翻倍到 64.3、Terminal Bench 2.1 到 85.4,长程开发的理解、规划、调试与验证是提升最集中的地方。

不值得切的两类:日常文档、表格、PPT 这类轻量办公,Hy3 免费用到 9 月 30 日,切过去只是给集群添堵;以及所有生图、视频等多模态任务,切了也会自动跳回多模态模型,免费额度不省反花积分。

还有一条现实提醒:官方明说这是早期版本,复杂任务存在长思考与过度自我验证倾向。越长的任务,Hy4 preview 可能越"想得多"。把最复杂、最不容错的一步留给人复核,比全盘交给它划算。

两周的免费窗口,9 月 10 日 23:59 就关。对想评估的团队来说,值得做的不是刷几个 demo,而是挑一条真实业务流——比如上海家化那条原本要 5 到 6 人天的月度账单分析——用 Hy4 preview 完整跑一遍,看它比 Hy3 少走几轮。答案在那条业务流里,不在跑分表上。到那时,Hy4 正式版值不值得付费,才会真正清楚。

卖家应对与观察方向