全部文章

GLM-5.2 深度拆解:在编程上压过 GPT-5.5 的开源权重新王

· GLM· 编程· 跑分· 开源

GLM-5.2 是第一个逼着你诚实发问的开源权重模型:你为闭源前沿还在多付多少钱,这笔钱到底换来了什么?

Z.ai(以前叫智谱)在 2026 年 6 月 13 日发布了它——先给 GLM Coding Plan 用户,6 月 16 日开放独立 API,MIT 许可的开源权重在 6 月 22 日那周放到 Hugging Face,仓库名 zai-org/GLM-5.2。几天后第三方跑分出来,对竞品不太客气。

跑分,要会读

在 Artificial Analysis 智能指数 v4.1 上,GLM-5.2 拿 51 分。这让它成为全球第一的开源权重模型,综合排第四,前面只有三个闭源旗舰:Claude Fable 5(60)、Opus 4.8(56)、GPT-5.5(55)。紧随其后的开源模型落后整整七分——MiniMax-M3 和 DeepSeek V4-Pro 都是 44,Kimi K2.6 是 43。在这么卷的榜单上,七分是一个档位,不是误差。

编程是这次发布的靶心,也是它打得最准的地方。GLM-5.2 在 SWE-bench Pro 上拿 62.1 分,高于 GLM-5.1 的 58.4,也压过 DeepSeek V4-Pro 的 55.4。这 6.7 分的差距值得在意,因为 SWE-bench Pro 是最贴近真实工作的跑分:解决跨多文件的 GitHub issue,不是玩具代码片段。它在 FrontierSWE 上 74.4%,Design Arena 拿第一,Code Arena Frontend 第二。在多个长程编程跑分上,它直接压过 GPT-5.5,而价格大约只是后者的六分之一。

有个细节值得停一下:一个在写代码上赢了闭源旗舰的模型,却以 MIT 许可放出权重。这是以前没发生过的事。

稀疏是设计出来的

GLM-5.2 是混合专家(MoE)模型——总参数 7440 亿,但每个 token 只激活约 400 亿。这种稀疏就是它全部的经济学。一次请求大致按 400 亿稠密模型的推理成本跑,却调用着 7440 亿模型的知识。开源权重能在不牺牲质量的前提下压过闭源前沿的价格,靠的就是这个。

价格也印证了这点。Z.ai 给 GLM-5.2 的刊例价是输入每百万 token $1.40、输出 $4.40,而缓存命中的输入只要 $0.26,约是未缓存价的五分之一。如果你跑的 agent 每一轮都重发一份很大但稳定的系统提示或代码库,提示缓存就不是锦上添花了,它会占掉你账单的大头。

一百万 token 的上下文窗口

GLM-5.1 封顶 20 万 token。glm-5.2[1m] 变体把输入拉到整整 100 万,单次输出最多 131072 token——输入翻五倍,还多出真正能"把一次大重构完整吐出来"而不是吐到一半被截断的余量。

诱惑是把窗口塞满。别。一百万 token 的检索噪声既花钱又稀释模型注意力。这个上下文真正值钱,是在那些确实又大又连贯的任务上:把整个服务丢进去做跨文件重构、一份必须整体握住的长规格文档、一个在长会话里不断累积状态的 agent 循环。把要紧的文件放到它面前,不变的部分靠缓存输入兜底,让长输出去干那种过去要拆成三次调用拼起来的活。

它在开源阵营里的位置

国产开源权重模型已经分化了,只凭名气挑模型现在是个错误。GLM-5.2 占住了长程、跨多文件的编程——SWE-bench Pro 的领先是最干净的信号。DeepSeek V4-Pro 是算法与性价比之王:它在 LiveCodeBench 上以 93.5% 登顶,每 token 还更便宜,所以论纯粹、自包含的编程吞吐很难被超过。Kimi 的工具调用和 MCP 分数最强,当你的栈偏 agent、工具调用很重时这才是关键。

落到实处:跨很多文件、跑得长的 agent 默认用 GLM-5.2,任务自包含又对成本敏感时换 DeepSeek V4-Pro,工具编排是瓶颈时上 Kimi。好处是你不用一次定死——一个 Key 就能调到它们全部

在 Turiloop 上调用 GLM-5.2

它用 OpenAI 的请求格式,所以现有代码只改一个字段:

import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["TURILOOP_API_KEY"],
    base_url="https://api.turiloop.com/v1",
)

r = client.chat.completions.create(
    model="glm-5.2",
    messages=[{"role": "user", "content": "重构这个服务并补上测试。"}],
)
print(r.choices[0].message.content)

做长上下文或 agent 类任务时,把 max_tokens 调高用上输出余量,把又大又稳定的上下文放在最前面好让它命中缓存,并用流式让用户在长生成时看到进度:

r = client.chat.completions.create(
    model="glm-5.2",
    messages=[
        {"role": "system", "content": repo_context},  # 又大又稳定 -> 走缓存
        {"role": "user", "content": "给 orders 接口加分页,并更新它的测试。"},
    ],
    max_tokens=32000,
    stream=True,
)
for chunk in r:
    delta = chunk.choices[0].delta.content
    if delta:
        print(delta, end="")

什么时候别用 GLM-5.2

它不是用来啃最硬的 agent 活的——那种连跑几天、风险很高、顶端几个百分点的能力直接决定成败的场景。那是 Fable 5 的地盘,在最难的跑分上差距是真实存在的。它对高频、简单的分类或抽取也是杀鸡用牛刀,那种活交给更小更便宜的 DeepSeek V4-Flash 花更少的钱就办了。任务在天花板上时就用天花板,其余那一大片真实工程活,用 GLM-5.2。

关于 GLM-5.5

Z.ai 三个月发了三个版本,所以这个问题问得不冤。但现在没有发布、没有参数表、也没有日期——意味着你看到的任何参数量都是猜的。这个节奏真正的信号其实更简单:开源权重的前沿现在每隔几周就动一次。把代码搭在"模型只是一个字符串"的接口上,等 GLM-5.5 来了,它就是改个配置,而不是一次迁移。

常见问题

GLM-5.2 是开源的吗? 是。权重以 MIT 许可放在 Hugging Face(zai-org/GLM-5.2),这是真正宽松的许可——商用也包含在内。

GLM-5.2 比 DeepSeek V4-Pro 强吗? 论长程、跨多文件的编程,是的:SWE-bench Pro 62.1 对 55.4。论纯粹自包含的编程和最低的每 token 成本,DeepSeek V4-Pro 依然出色而且更便宜。它们是干不同活的不同工具。

GLM-5.2 多少钱? Z.ai 刊例价是输入/输出每百万 token $1.40 / $4.40,缓存输入约 $0.26。在 Turiloop 上你按量付费、用国际卡即可——不需要中国手机号或本地账号。

相比 GLM-5.1 变了什么? 上下文从 20 万涨到 100 万,输出到 12.8 万,SWE-bench Pro 从 58.4 升到 62.1,并拿下 Artificial Analysis 智能指数的开源权重第一。

眼下,GLM-5.2 就是开源权重里要被挑战的那个标杆,而它和闭源前沿的距离,很少这么近过。你今天就能在 Turiloop 上调用它——连同 DeepSeek、Kimi、MiniMax——背后是一个 OpenAI 兼容的 Key,按量付费、国际卡、免中国手机号。