区块链 区块链技术 比特币公众号手机端

GLM-5.3 与 DeepSeek V4 Pro:编码、价格与访问方式对比

GLM-5.3 于 2026 年 8 月 14 日发布,Z.ai 声称相比 GLM-5.2 编码能力提升 50%,并新增一项网络安全能力,在 CyberGym 上取得 84.5% 的得分。DeepSeek V4 Pro 已提供完整 API 访问、MIT 许可的开源权重,模型卡上 SWE-Bench Verified 得分为 80.6%(NIST 独立测得 81%)。问题在于:GLM-5.3 尚无公开 API,你只能通过 Z.ai 的托管产品(ZCode 和 GLM Coding Plan)使用它。这一差异改变了整个对比的格局。

两种访问模式,而非两种 API

DeepSeek V4 Pro 发布时即提供 MIT 许可的开源权重(Hugging Face)、文档完备的 API(api-docs.deepseek.com),以及 SiliconFlow 等第三方托管服务。你可以自行托管,通过任何兼容 OpenAI 的客户端接入,或者立即在 Claude Code、Cline 或你自己的脚本中调用。

GLM-5.3 则采取了相反的路径。Z.ai 的发布公告称,该模型可通过 GLM Coding Plan 和 ZCode(Z.ai 自家的编码 IDE)立即使用,但 API 访问和开源权重要等到"严格的安全评估"之后才会提供。这意味着没有 model: glm-5.3 端点,没有 Hugging Face 下载,也没有第三方推理服务。Z.ai 未给出具体时间表。

编码基准:厂商声称 vs 独立验证分数

GLM-5.3 和 DeepSeek V4 Pro 都是面向智能体编码的大型国产 MoE 模型,但两者证据基础的成熟程度并不相同。

Z.ai 的发布材料将 GLM-5.3 描述为其 743B 基础模型的后训练变体,通过后训练而非新架构实现了"顶级编码和智能体能力"。中文公告还补充了具体说法:编码性能相比 GLM-5.2 提升约 50%,在 Terminal-Bench 3.0 上位列开源模型第一,白盒代码审查与 Mythos 5 持平。作为参考,GLM-5.2 在 Terminal-Bench 2.1 上得分为 81.0(据 Z.ai 发布说明),是当时开源权重模型中的最高分,仅次于 Claude Opus 4.8 的 85.0。

DeepSeek V4 Pro 的数据经过了独立验证。Hugging Face 上的模型卡报告 SWE-Bench Verified 为 80.6%,HumanEval Pass@1 为 76.8。NIST 的 CAISI 评估独立测得 SWE-Bench Verified 为 81%。其架构为 1.6T 参数 MoE,49B 活跃参数,1M token 上下文,384K token 最大输出。

指标 GLM-5.3 DeepSeek V4 Pro
架构 743B 基础模型,后训练 1.6T 总参 / 49B 活跃 MoE
上下文窗口 未公布(GLM-5.2:1M) 1M tokens
最大输出 未公布(GLM-5.2:128K) 384K tokens
编码基准 Terminal-Bench 3.0 开源模型第一(厂商声称) 80.6% SWE-Bench Verified(模型卡 + NIST)
网络安全 CyberGym 84.5%;白盒审查与 Mythos 5 持平 无对应定位
开源权重 承诺安全评估后发布 MIT 许可,现可用
API 尚未提供 可用(官方 + SiliconFlow)

Terminal-Bench 和 SWE-Bench 是不同的基准,衡量不同的能力。Terminal-Bench 评估智能体执行终端任务的能力;SWE-Bench Verified 评估自动生成的 PR 补丁的能力。你不能直接把 Terminal-Bench 3.0 的排名和 SWE-Bench Verified 的百分比放在一起比较。

GLM-5.3 还引入了一个 DeepSeek V4 Pro 未涉及的网络安全维度。Z.ai 将该模型定位为"为网络防御做好准备",CyberGym 表现为 84.5%。这些说法来自厂商报告,尚未经过独立验证,因此应视为方向性参考而非定论。Z.ai 还表示 GLM-5.3 相比 GLM-5.2 能以"更少的输出 token 获得更好的结果",如果这种效率在独立测试中成立,将降低每次任务的成本。

订阅 vs 按 token 付费:真正的成本问题

GLM Coding Plan 定价层级

DeepSeek V4 Pro 通过官方 API 按每百万 token 收费:

Token 类型 官方 DeepSeek API
未命中缓存的输入 $0.435 / M tokens
命中缓存的输入 $0.003625 / M tokens
输出 $0.87 / M tokens

GLM-5.3 仅可通过 GLM Coding Plan 订阅使用:

层级 月费 额度
Lite $18 10,000 credits/周
Pro $80 6× Lite 用量
Max $168 14× Lite 用量

GLM Coding Plan 没有定义"credit"对应多少 token,因此直接进行成本比较并不精确。DeepSeek 按 token 计费,几乎无需任何承诺;GLM Coding Plan 则无论使用量多少都收取固定月费。

DeepSeek API 与 GLM Coding Plan 月度成本对比

一个具体的 DeepSeek 示例:每天 1M 未命中缓存输入 + 2M 输出 token(中等规模的编码会话),API 费用约为 $65/月。扩大到每天 5M 输入 + 10M 输出,账单将达 $326/月。对于重复性高的代码库,$0.003625/M 的缓存输入价格可以大幅削减成本。在 GLM 这边,$168/月的 Max 档位以固定费用避免了按量计费的意外支出,但它是否覆盖同样的工作量,取决于未公开的 credit 与 token 的换算关系。

开发者在 Reddit 上对两者的反馈

在最近的一个 r/ZaiGLM 帖子中,一位同时用过两款模型的用户说:

"任务完成得比 GLM 快,但需要大量的人工介入引导。"

同一个帖子中还有用户在使用多模型工作流:GLM 负责编码和代码库导航,DeepSeek V4 Flash 负责代码审查。另一位用户指出 DeepSeek V4 Pro 才发布大约 24 小时,提醒不要过早下结论。这些只是单个社区帖子中的个人反馈,并非受控基准测试。

按场景选择模型

你的情况 推荐
现在就需要 API 访问或 CI/CD 集成 DeepSeek V4 Pro — GLM-5.3 没有公开 API
出于数据驻留需求想自行托管 DeepSeek V4 Pro — MIT 权重现已在 Hugging Face 上
主要在 IDE 中编码,想要托管式助手 GLM-5.3,通过 GLM Coding Plan 或 ZCode
预算有限的个人开发者 低用量下 DeepSeek V4 Pro 按 token 更便宜;GLM Lite($18/月)则无论用量多少,开销都有上限
安全审计或漏洞研究 先测试 GLM-5.3 — CyberGym 84.5% 这一指标虽独特,但尚未经独立验证
大规模长会话智能体编码 GLM Coding Plan Max($168/月固定)封顶成本;需确认 credit 额度能覆盖你的工作量
几乎无既有代码的全新原型 两者皆可 — 都擅长新代码;按访问模式偏好选择

如果你已经在使用 GLM-5.2 Coding Plan,在同一订阅内升级到 GLM-5.3 是最省事的路径。

常见问题

GLM-5.3 会推出公开 API 吗?

会。Z.ai 表示 API 访问和开源权重将在安全评估后分阶段发布,但目前没有给出具体日期。

我能否自行托管这两款模型?

DeepSeek V4 Pro:可以。MIT 许可的权重已在 Hugging Face 上。1.6T 参数的 MoE 在未量化(FP16)情况下大约需要 3.2TB 显存,4-bit 量化下约需 800GB,这意味着需要配备 H100 或 H200 的多卡集群。GLM-5.3:还不行。开源权重承诺在安全评估后发布,且许可协议尚未公开。

对于高强度的日常编码,哪个更便宜?

取决于用量。每天 1M 输入 + 2M 输出 token 时,DeepSeek V4 Pro 大约花费 $65/月;每天 5M 输入 + 10M 输出时,则达到 $326/月。在更高的用量下,GLM Coding Plan Max 的 $168/月比 DeepSeek 便宜,但前提是它未公开的 credit 额度能覆盖你的工作量。在下结论前,用你的真实使用情况分别测试两者。

GLM-5.3 支持视觉或图像输入吗?

不支持。Z.ai 将视觉能力保留在单独的 GLM-V 模型系列中(GLM-5V-Turbo、GLM-4.6V、GLM-OCR)。GLM-5.3 是一个文本和代码模型。DeepSeek V4 Pro 同样是纯文本模型。

问题在于时机,而非能力

GLM-5.3 从纸面上看更强:50% 的编码提升、独特的网络安全亮点、更好的 token 效率。但所有这些数字均来自厂商自行报告,且出自发布仅数小时的公告,目前没有 API、没有开源权重、也没有独立基准验证。DeepSeek V4 Pro 提供了 GLM-5.3 今天无法匹敌的东西:可用性、经过验证的基准和可部署的权重。在你需要 API 访问或自行托管的场景下,现在就使用 DeepSeek,同时关注 GLM-5.3 的 API 发布情况,以便在自有代码库上进行直接对比测试。

  • 原文链接: aireiter.com/blog/glm-5-...
  • 鸿途知科网 AI 助手,为大家转译优秀英文文章,如有翻译不通的地方,还请包涵~
版权声明

本文仅代表作者观点,不代表区块链技术网立场。
本文系作者授权本站发表,未经许可,不得转载。

发表评论:

◎欢迎参与讨论,请在这里发表您的看法、交流您的观点。

热门