全部文章

DeepSeek V4-Flash:2026 最便宜还能打的模型(以及什么时候该升级)

· DeepSeek· 定价· 教程

不是每个提示都需要旗舰。真实生产流量里有一大部分(分类、抽取、路由、短初稿)简单到"最便宜的能打模型"在成本上完胜、又不丢质量。2026 年年中,这个模型就是 DeepSeek V4-Flash

它是什么

V4-Flash 是 DeepSeek V4 家族(2026 年 4 月发布)里的轻量一半:2840 亿总参、130 亿激活。小激活量正是它又快又便宜的原因。它在 Terminal-Bench 2.0 上拿 56.9%,低于 V4-Pro 的 67.9%,但对绝大多数日常任务绰绰有余。

价格才是头条

每百万 token:

  • 输入:约 $0.14
  • 输出:约 $0.28
  • 命中缓存:约 $0.014

这比 $25–30 输出的闭源旗舰便宜约 100 倍。在 Turiloop 上每 token 近乎为零,而且当前全模型折扣。

V4-Flash 的主场

  • 分类与路由:情绪、意图、内容审核、决定一条该进哪个队列。
  • 抽取:从文本里抽字段、解析票据、把杂乱输入结构化。
  • 摘要与短初稿:TL;DR、邮件初稿、更新日志。
  • 大批量流水线:任何你跑几百万次、单价主导成本的活。

什么时候升级到 V4-Pro

当任务需要多步推理或规划、难代码的正确性、或长程 agent 可靠性时,换 V4-Pro(或闭源前沿)。

聪明的套路是两档:默认 V4-Flash,把难提示升级到 V4-Pro。两者在一个 OpenAI 兼容的 Key 背后,所以只是改一行:

def ask(prompt: str, hard: bool = False):
    model = "deepseek-v4-pro" if hard else "deepseek-v4-flash"
    r = client.chat.completions.create(
        model=model,
        messages=[{"role": "user", "content": prompt}],
    )
    return r.choices[0].message.content

一个快速成本例子

假设你每月用 V4-Flash 跑 1 亿 token 分类,拆成 8000 万输入、2000 万输出。也就是 80 × $0.14 + 20 × $0.28,约 每月 $16.8。同样的量放在 $5/$30 的前沿模型上要 每月 $1,000。再叠上稳定 system prompt 的缓存命中,Flash 这个数还能更低。

V4-Flash 就是那个你把大头流量路由过去、账单上几乎察觉不到的模型。到 Turiloop 拿个 Key 试试:国际卡、按量付费、免中国手机号。