全部文章

GLM-5.2 vs Claude Fable 5:性价比之王对决天花板

· GLM· 对比· 定价· 编程

六月里隔了不到一周,两个模型先后发布,而它们分处市场的两端。Claude Fable 5 是你今天能调用的最强模型,GLM-5.2 是你今天能调用的最强开源权重模型。有意思的问题不是抽象地比谁"更好",而是各自的价格花在哪儿值。

天花板:Claude Fable 5

Anthropic 在 6 月 9 日发布 Fable 5,把它放在 Opus 4.8 之上整整一档,称作 Mythos 级。跑分不是接近,是甩开:它在 Artificial Analysis 智能指数上以 60 分领跑,SWE-Bench Pro 拿 80.3%,次席落后 11 分;agentic 分 80.7,是目前最高的。在追踪这些的各大榜单上,Fable 5 综合智能第一、编程第一、agent 任务第一。它有 100 万 token 上下文,单次最多能返回 12.8 万 token。当一个 agent 要连跑几个小时、或一次迁移横跨几十个文件、走错一步代价很大时,你会想要它。

代价是账单。Fable 5 输入 $10、输出 $50 每百万 token,是 Opus 4.8 的两倍。有篇评测说得很直白:大约两倍的价钱,换来比上一代旗舰多约 6% 的性能。如果你需要那 6%,每分钱都值;但多数工作负载并不需要。

性价比:GLM-5.2

GLM-5.2 在 6 月 13 日发布,以 51 分在开源权重模型里登顶 Artificial Analysis 智能指数(综合第四,前面只有 Fable 5、Opus 4.8、GPT-5.5),明显领先 DeepSeek V4-Pro、MiniMax-M3 和 Kimi K2.6。编程上它在 Design Arena 拿第一,SWE-bench Pro 拿 62.1(对 DeepSeek V4-Pro 的 55.4),并直接压过 GPT-5.5。它是个 7440 亿参数的 MoE、约 400 亿激活、100 万上下文,而且 Z.ai 以 MIT 许可放出权重。(更深的拆解见 GLM-5.2 深度。)

它在最难的 agent 跑分上不会超过 Fable 5,但也不需要。它用 Fable 5 零头的价格,给你"贴近前沿"的代码能力,而且你愿意的话还能自己部署。

怎么选

Fable 5 用在任务真正处于前沿时:多日自治会话、大型有风险的迁移,那种顶端几个百分点的能力会改变结果、而 token 账单跟工程师时间比只是零头的场景。

GLM-5.2 用在其余一切,也就是绝大多数:日常代码生成、重构、agent 循环、任何要跑量的活。你保住大部分质量,把成本砍掉一大截。

好消息是你不用二选一。在 Turiloop 上两者都在一个 OpenAI 兼容的 Key 背后,所以你可以默认用 GLM-5.2,把偶尔的硬骨头升级给 Fable 5,只改模型字段:

def solve(prompt, hard=False):
    model = "claude-fable-5" if hard else "glm-5.2"
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return r.choices[0].message.content

默认便宜、按需上前沿,通常就是对的答案。按量付费、国际卡、免中国手机号。到 Turiloop 拿个 Key