这个问题在 2026 年 6 月有短答案,前提是先说清你在优化什么:
| 你优化的目标 | 选谁 | 招牌跑分 | 价格(美元/百万 in/out) |
|---|---|---|---|
| 不看钱要最强 | Claude Fable 5 | SWE-bench Pro 80.3% | $10 / $50 |
| 每块钱买最多能力(多数团队) | GLM-5.2 | SWE-bench Pro 62.1 | $1.40 / $4.40 |
| 纯算法题 | DeepSeek V4-Pro | LiveCodeBench 93.5 | $0.435 / $0.87 |
| 跑量 / 样板代码 | DeepSeek V4-Flash | 够用 | $0.14 / $0.28 |
读到这就停,选出来的也不会错。往下是解释每个选择什么时候赢,因为"写代码最强"底下其实藏着至少三种不同的活。
活儿一:在真实代码库里解决真实 issue
对应的跑分是 SWE-bench Pro——跨多文件的 GitHub issue,不是玩具函数。2026 年 6 月的排位:Claude Fable 5 拿 80.3%,然后一段长长的空当,接着是 GLM-5.2 的 62.1、GLM-5.1 的 58.4、Kimi K2.6 约 58.6、DeepSeek V4-Pro 的 55.4。
这张表有两层读法。第一,Fable 5 确实自成一档——agent 要连跑几天、或一次高风险迁移横跨几十个文件时,那截多出来的能力自己会回本,我们专门写过什么时候值得上天花板。第二,GLM-5.2 是非前沿选项里明显最强的,输出价约是 Fable 5 的十分之一;它的 100 万 token 上下文还意味着整个服务能塞进一个 prompt——怎么用好这点见 GLM-5.2 深度拆解。
活儿二:困难但自包含的算法题
换个跑分,冠军就换人。LiveCodeBench——竞赛式编程题——上 DeepSeek V4-Pro 拿 93.5,全球所有模型最高,闭源开源都算上,还有 3206 的 Codeforces 评分作陪。如果你的活长得像"把这个刁钻算法写对",$0.435 / $0.87 的 V4-Pro 就是答案,把价格算进去之后没有悬念。
活儿三:跑量——补全、样板、重构体力活
真实团队里大多数代码 token 并不难:测试脚手架、CRUD 接口、格式转换、注释生成。DeepSeek V4-Flash 用 $0.14 / $0.28 把这些包了,输出价比 GLM-5.2 便宜约 30 倍。有效的套路是两行路由:默认 Flash,提示真难时升级到 GLM-5.2 或 V4-Pro。代码在智能路由实战里。
几句老实话
- 工具调用很重的 agent 栈: Kimi K2.6 在国产模型里工具调用和 MCP 分数最强。如果你的瓶颈是编排而不是代码本身,拿你自己的调用轨迹把它和 GLM-5.2 对跑一下。
- 跑分会饱和。 SWE-bench Pro 上 62 对 55 的差距有意义,1 分的差距没有。花钱之前,先在自己的仓库上跑自己的评测。
- 变化很快。 GLM-5.2 从没发布到开源第一只用了 6 月的一周。把模型做成一个配置字符串,别做成架构决定。
海外怎么真正跑起来
Fable 5 在哪都买得到,难的是国产模型:大陆注册、本地支付。Turiloop 是一个 OpenAI 兼容的 API 网关,把 GLM-5.2、DeepSeek V4-Pro/Flash、Kimi K2.6、MiniMax 放在同一个 Key 背后,按量计费、国际卡支付、不需要中国手机号。把 OpenAI SDK 指到 https://api.turiloop.com/v1,上面那个路由器就是全部的接入工作。
常见问题
写代码 GLM-5.2 比 GPT-5.5 强吗? 在多个长程编程跑分上,是——GLM-5.2 赢了 GPT-5.5,价格还只有它约六分之一($1.40/$4.40 对 $5/$30 每百万 token)。综合智能指数上 GPT-5.5 仍更高(55 对 51)。
写代码最便宜 / 免费的选项是什么? 有 GPU 的话,自己部署 GLM-5.2 的 MIT 权重是免费的。走 API 的话,$0.14/$0.28 的 DeepSeek V4-Flash 是还能写出可用代码的最低价。
要不要所有活都用 Claude Fable 5? 只有当 token 账单和工程师时间相比可以忽略时。它是最强编程模型,但每百万输出 token 收 $50——把日常活路由给 GLM-5.2 或 V4-Flash,常规任务几乎不掉质量,账单能省 10 到 50 倍。
编程 agent 用哪个模型最好? 预算内跑长的多文件任务:GLM-5.2(1M 上下文、SWE-bench Pro 62.1)。不计成本要最稳:Claude Fable 5。工具调用极重的编排:拿你的栈把 Kimi K2.6 和 GLM-5.2 对跑。
*跑分与价格截至 2026 年 6 月 29 日——来源:SWE-bench Pro、LiveCodeBench、Artificial Analysis、各厂商官方价格页。*