2026 年 4 到 6 月,国产实验室接连放出好几个强开源模型。它们不做同一件事,所以有用的问题不是"哪个整体最好",而是"手头这个活该用哪个"。下面把它们怎么分工讲清楚,带上跑分和价格。
一句话结论
要一个名字,就是 GLM-5.2。智谱 6 月 13 日发布,它成了第一个领跑 Artificial Analysis 智能指数的开源模型:51 分,综合第四,前面只有 Fable 5、Opus 4.8、GPT-5.5。SWE-bench Pro 拿 62.1,100 万 token 上下文,MIT 开源。完整拆解见 GLM-5.2 深度。
这是你的默认选择。其余的看你在做什么:DeepSeek V4-Pro 仍在纯算法编程上最强,V4-Flash 赢在成本,Kimi 赢在长上下文工具调用。
DeepSeek V4-Pro:代码与推理旗舰
1.6 万亿参数、490 亿激活。它在 LiveCodeBench 上以 93.5 登顶,Codeforces 评分 3206,已是大师级别,压过多个闭源 API。agent 任务上 Terminal-Bench 2.0 拿 67.9%,高难推理上 GPQA Diamond 拿 90.1%。
正经代码生成、竞赛级逻辑、质量决定成败的 agent 循环,用它。在 Turiloop 上它只是闭源价格的零头,当前全模型还有折扣。看实时价格。
DeepSeek V4-Flash:成本杀手
2840 亿总参、130 亿激活。它牺牲一点能力(Terminal-Bench 56.9%),换来价格大降:约 $0.14 / $0.28 每百万 token,命中缓存约 $0.014。
把不需要深推理的活交给它,也就是大多数大批量的活:分类、抽取、摘要、初稿。在 Turiloop 上每 token 的成本基本可以忽略。
GLM-5.2:新的综合王者
智谱 6 月 13 日的 GLM-5.2,是市面上最强的开源模型。它 Artificial Analysis 智能指数 51 分(开源第一)、SWE-bench Pro 62.1,在跨多文件的 GitHub issue 上压过 DeepSeek V4-Pro 的 55.4。它带 100 万 token 上下文和 MIT 权重。底层是 7440 亿 MoE、约 400 亿激活,这就是它能用非前沿的价格给你贴近前沿质量的原因。
把它设成正经编程和长程 agent 的默认。它现在既是全能选手,也是要被挑战的那个标杆。如果用不上这点优势,更老的 GLM-5.1 是更省的日常档。在 Turiloop 上按量付费、用国际卡。完整拆解见 GLM-5.2 深度。
Kimi K2.6:长上下文 agent
月之暗面为长文档和多步 agent 造了 K2.6。它 Terminal-Bench 2.0 拿 66.7%、SWE-Bench Pro 约 58.6%,提示缓存定价(缓存读取约 $0.16/M)让一段长而复用的 system prompt 在整个会话里都很便宜。
大上下文分析、agent 流水线、任何复用一大段稳定提示的场景,用它。在 Turiloop 上它比任何闭源前沿模型都便宜。
MiniMax M2.5:性价比通用选手
MiniMax 的 M2 系列是聊天和助手类工作的性价比通用选手,在 Turiloop 上也是个低成本全能档。想要便宜又能打、又不想在选型上多费脑筋的通用助手流量,用它。
每种活一句话
- 综合最强,编程与 agent → GLM-5.2
- 纯算法难代码 → DeepSeek V4-Pro
- 大批量便宜任务 → DeepSeek V4-Flash
- 预算有限的日常代码 → GLM-5.1
- 长上下文与提示复用 → Kimi K2.6
- 通用助手流量 → MiniMax M2.5
最省又好的配置几乎从来不是单一模型,而是把每种活路由给合适的那个。在 Turiloop 上它们都在一个 OpenAI 兼容的 Key 背后,切换只是改一行 model,国际卡按量付费。