大模型原厂集体涨价、第三方托管越卖越便宜:DeepSeek 输出涨到 4.5 倍、GLM 月费最高 +261%,跨境 API 用户怎么选
原厂和中间商的价格走势劈成了两半。一边是原厂集体涨价:DeepSeek V4-Pro 高峰时段输出价从 6 元/百万 token 涨到 27 元(4.5 倍),智谱 GLM Coding Plan 月费最高 +261%;另一边是第三方托管(硅基流动、火山方舟等)部分反而更便宜。跨境 API 用户夹在中间,怎么选才不花冤枉钱,得先把账算明白。
原厂集体涨价:DeepSeek 4.5 倍、GLM +261%

具体涨幅:DeepSeek V4-Pro 自 2026 年 8 月 16/17 日启用峰谷定价,高峰(北京时间 9:00–12:00、14:00–18:00)输出价由 6 元/百万 token 涨至 27 元(4.5 倍),输入由 3 元涨至 9 元,缓存命中输入由 0.025 元飙至 0.3 元(+1100%),闲时减半。智谱 GLM Coding Plan 2026 年 7 月 31 日改版:Lite 49→118 元(+141%)、Pro 149→538 元(+261%)、Max 469→1078 元(+130%)。其他:智谱 2026 Q1 累计提价 83%;月之暗面 Kimi K3(7 月)输出 100 元/百万 token,较前代涨近 4 倍;MiniMax M3(6 月)API 全面翻倍;腾讯云/阿里云/百度智能云 3 月上调 5%–34%;摩根士丹利称 2026 Q2 国内平均 API 输入/输出价较 2025 Q1 涨 48%/80%。
第三方托管反而更贵?

这里有个反叙事要厘清:第三方托管不是都更便宜。DeepSeek 官方 2026 年 5 月把 V4-Pro 直连价永久下调 75%(约 3 元输入/6 元输出),而硅基流动仍维持 12/24 元(溢价约 4 倍);美团 LongCat、Qwen 在硅基流动亦溢价 2–2.5 倍;硅基流动对部分开源模型仅比直连低 5%–15%,原厂降价持续压缩中间商空间。所以"第三方越卖越便宜"只在部分开源模型上成立,对热门闭源/限价模型,中间商反而更贵。选托管不能只看"比官网便宜"的传说,要逐模型比价。
跨境 API 用户怎么选

价格敏感、批量任务:用 DeepSeek 闲时档(高峰减半)或火山方舟 Seed 2.1(¥6 输入/¥30 输出)、阿里百炼 Qwen,成本低。重稳定合规:走原厂直连,规避高溢价二道贩子,且直连的 SLA 和合规背书更稳,跨境业务(客户数据出境、发票、合同)更经得起查。混合策略:把高价值、低频次、要质量的任务给原厂直连,把海量、低客单、可容错的批量任务给便宜通道。别迷信"哪个便宜用哪个",要看任务性质和合规要求。
错峰 + 缓存命中压成本

实操三招:①错峰——DeepSeek 峰谷价差 4.5 倍,把批量生成(Listing、文案、翻译)排到闲时,单这一招能砍掉大半成本;②提升缓存命中——相同前缀的对话和上下文复用缓存,输入价能从 0.3 元压到接近 0.025 元档,系统设计上尽量共用 system prompt 和历史前缀;③多供应商路由——用路由层按任务选最便宜的可用模型,避免被单一厂商涨价锁死。跨境卖家做 AI 提效(客服、选品、内容)本来就是持续烧 token 的活,把"峰谷 + 缓存 + 路由"做成默认架构,比事后抱怨涨价有用。
注意事项
DeepSeek 峰谷价差是按北京时间,跨境团队若在其他时区排任务要换算时区再错峰。第三方托管溢价因模型而异,逐模型比价别想当然。原厂直连的合规优势对跨境业务重要,别为省几个 token 把客户数据喂给无合规背书的二道贩子。
FAQ
Q:DeepSeek 闲时价能省多少? A:高峰输出 27 元、闲时减半约 13.5 元,差 4.5 倍量级,批量任务排闲时省最多。
Q:第三方托管一定更便宜吗? A:不一定,热门模型常溢价 2–4 倍,仅部分开源模型比直连低 5%–15%。
Q:跨境业务该走直连还是托管? A:重合规稳定走原厂直连,海量低客单批量走便宜通道,混合最稳。
参考来源
- DeepSeek 官方:V4-Pro 峰谷定价公告(2026 年 8 月)
- 智谱 AI:GLM Coding Plan 改版(2026 年 7 月 31 日)
- 摩根士丹利:2026 Q2 国内 API 价格报告
- 硅基流动 / 火山方舟 定价页(第三方托管对比)
- 亿邦动力:大模型原厂涨价与第三方托管走势