智谱旗舰模型 GLM-5.2 的 OpenRouter 聚合路由价已降至每百万输入 Token 0.07 美元、输出 0.22 美元,约为常见直连参考价的5%。同一目录中,DeepSeek V4-Flash 为0.14/0.28美元。需要区分的是,这次对比反映的是第三方路由报价,智谱直连 API 仍按自有价格页计费。
95%降价的真实口径
GLM-5.2 是智谱面向长程任务的旗舰模型,支持 1M Token 上下文,适合处理大型代码项目和需要多步执行的智能体任务。Token 可以理解为模型计费和处理文本时使用的基本单位,输入、输出和缓存命中通常分别计价。
这次价格变化首先发生在“从哪里调用模型”这一层。OpenRouter 是一个多模型 API 路由平台,会把同一个模型接入多个推理服务商,再以统一入口提供调用。其当前模型目录把 z-ai/glm-5.2 的报价列为每百万输入 Token 0.07 美元、输出 0.22 美元,缓存命中输入为 0.013 美元。
按 GLM-5.2 常见的直连参考价每百万输入 1.40 美元、输出 4.40 美元计算,OpenRouter 这组报价约为原价的 5%,对应约 95% 的降幅。这个数字描述的是路由服务价格,不是智谱官方宣布把所有 API 入口统一降到同一水平。
同一目录中,GLM-5.2 已低于 DeepSeek V4-Flash
把两个模型放在同一个 OpenRouter 目录里比较,价格口径才一致:
| 模型 | 输入 / 百万 Token | 缓存命中输入 / 百万 Token | 输出 / 百万 Token |
|---|---|---|---|
| GLM-5.2 | 0.07 美元 | 0.013 美元 | 0.22 美元 |
| DeepSeek V4-Flash | 0.14 美元 | 0.028 美元 | 0.28 美元 |
在这组路由报价中,GLM-5.2 的输入价格是 DeepSeek V4-Flash 的一半,输出价格低约 21%。缓存命中输入也更低。对长上下文编程和智能体工作流来说,重复发送项目说明、工具结果和历史对话时,缓存命中价格会直接影响账单。
DeepSeek V4-Flash 的官方 API 价格则是每百万输入 Token 1 元、输出 2 元,缓存命中输入 0.02 元。它支持 1M 上下文和最长 384K 输出,并已提供工具调用与 Responses API 等能力。不同平台的汇率、服务费、路由策略和优惠可能不同,因此不能把某个平台的报价直接当成模型厂商的统一价格。
智谱直连 API 仍是另一套价格
智谱价格页当前列出的 GLM-5.2 标准单价为每百万输入 Token 8 元、输出 28 元,缓存命中为 2 元,页面标注的有效期到 8 月 31 日。按这个入口调用时,GLM-5.2 并没有变成每百万 Token 0.07/0.22 美元的报价。
这也是“GLM-5.2 降价95%”容易被误读的地方:模型权重、官方直连 API、云平台托管和第三方路由可以同时存在多套价格。开发者需要先确定使用入口,再比较输入、输出、缓存和并发限制,不能只看一个百分比。
开发者如何调用
想测试当前这组低价路由,可以在 OpenRouter 使用模型 ID z-ai/glm-5.2,通过兼容 OpenAI 格式的接口发起请求。GLM-5.2 是文本输入、文本输出模型,官方模型目录给出的上下文长度约为 1M Token,最大输出长度为 128K Token。
如果项目需要智谱官方账单、国内平台支持或直接使用 BigModel 账户,则应从智谱开放平台创建 API 密钥,并按价格页的人民币单价结算。两种入口使用的模型名称相近,但价格、服务商、限流和可用功能由各自平台决定。
对于个人开发者,OpenRouter 路由适合先用小规模请求比较代码修复、长文档处理和工具调用效果;对于生产系统,应该用真实输入输出比例测算总成本,再决定是否固定某个服务商。GLM-5.2 的低价路由降低了试用门槛,但它并不自动代表所有 GLM API 入口都同步降价。


