2026 年年中真正有意思的问题,已经不是"国产开源模型能不能打闭源前沿",DeepSeek V4-Pro 早就在多个代码榜上登顶了。真正的问题是:选它,你牺牲了什么、又省下了什么。下面用数据说话。
参赛选手
- DeepSeek V4-Pro(2026 年 4 月 24 日发布):1.6 万亿总参、490 亿激活。DeepSeek 的推理和代码旗舰。
- DeepSeek V4-Flash:2840 亿 / 130 亿激活。又快又极便宜的档位。
- GPT-5.5(OpenAI):闭源 agent 代码旗舰。
- Claude Opus 4.8(Anthropic,2026 年 5 月 28 日发布):100 万 token 上下文,长程 agent 任务很强。
代码 benchmark
- LiveCodeBench:DeepSeek V4-Pro 93.5,所有受测模型(含闭源 API)里最高分。GPT-5.5 在 85 以上。
- Codeforces(Elo):DeepSeek V4-Pro 3206,大师级评分。
- Terminal-Bench 2.0(真实终端和 agent 任务):DeepSeek V4-Pro 67.9%,领先 Kimi K2.6(66.7%)。V4-Flash 为 56.9%。
- SWE-Bench Pro(真实 GitHub issue 修复):GPT-5.5 与 Kimi K2.6 都约 58.6%;DeepSeek V4-Pro 为 55.4%。(6 月稍后发布的 GLM-5.2 在这项以 62.1 领跑开源阵营。)
结论:在纯代码生成和竞赛编程上,V4-Pro 已经追平甚至超过闭源前沿。在长程 agent 修复(SWE-Bench Pro)上,GPT-5.5 和最强开源模型大致打平,闭源前沿在这块已经没有明显护城河了。
推理与知识
- GPQA Diamond(高难理科问答):DeepSeek V4-Pro 90.1%,MiniMax M3 92.68%,Gemini 3.1 Pro 以 94.3% 居首。
- MMLU:GPT-5.5 约 92.4%。
V4-Pro 有竞争力,但在最难的推理集上不是绝对第一,这正是闭源前沿仍略微领先的地方。
价格:差距巨大
每百万 token(输入 / 输出):
- DeepSeek V4-Pro:$0.435 / $0.87。
- DeepSeek V4-Flash:$0.14 / $0.28,命中缓存约 $0.014。
- GPT-5.5:$5.00 / $30.00。
- Claude Opus 4.8:$5.00 / $25.00。
在输出价上(多数工作负载的主要成本),DeepSeek V4-Pro 比 GPT-5.5 便宜约 34 倍、比 Claude Opus 4.8 便宜约 29 倍,代码能力却追平甚至更强。对不需要顶级推理的任务,V4-Flash 比闭源旗舰便宜约 100 倍。
那到底该用哪个?
- 写代码、做 agent、大批量 → DeepSeek V4-Pro。前沿级代码,成本只要零头。
- 便宜的分类、抽取、初稿 → DeepSeek V4-Flash。规模化下近乎免费。
- 最难的推理,或你已经被某家锁定 → GPT-5.5 / Claude Opus 4.8 仍有小幅优势,代价是几十倍的价格。
对多数团队,务实答案是混用:把大头路由给 DeepSeek,只把真正需要的少量请求留给闭源前沿。
在一个地方调用它们
通过 Turiloop 一个 OpenAI 兼容的 Key,你能同时调用 DeepSeek V4-Pro/Flash 和 Claude Opus 4.8,用国际卡按量付费,所以在"便宜档"和"前沿档"之间切换只是改一行模型名。DeepSeek V4-Flash 每 token 近乎为零,V4-Pro 也只是闭源价格的零头,当前都在折扣。