DeepSeek V4 Pro 和 Flash 怎么选:一条分流规则讲清楚
DeepSeek 的 V4 家族用两个价位卖同一套架构:旗舰 V4 Pro 和主打高吞吐的 V4 Flash。价差大约 3 倍,但对大多数工作负载来说,能力差距远小于价差——这正是这道选择题有意思的地方。
下面是基准测试的真实情况,以及一条帮你省钱又不在关键处掉链子的分流规则。数据截至 2026 年 8 月。
一句话结论
- Pro 是当今世界上写代码最强的模型之一:在 SWE-bench Verified(衡量修复真实 GitHub 问题的基准)上以 80.6 对 80.8 与 Anthropic 的 Claude Opus 4.7 战成统计学平手,Codeforces 竞赛分还压过 GPT-5.5。
- Flash 在编程基准上只落后 Pro 一两分,价格却只有三分之一;综合智能指数落后约 5 分——差距主要体现在知识深度和最复杂的多步 agent 任务上。
- 有个反转:DeepSeek 七月底发布的 Flash 重训版(V4-Flash-0731)在官方公布的 agent 与编程基准上,反超了旧版 Pro 预览版。便宜的那档没在原地踏步。
3 倍价差买到了什么
BoostRail 目录价(每百万 token,美元):
- deepseek-v4-pro——输入 $0.41 / 输出 $0.83,缓存读取 $0.041
- deepseek-v4-flash——输入 $0.13 / 输出 $0.27,缓存读取 $0.013
两点值得注意。第一,按旗舰模型的标准,连 Pro 都算便宜——这正是 DeepSeek 成名的性价比故事。第二,两款模型的缓存读取都只按输入价的 10% 计费;对于每轮循环都要重读同一段上下文的 agent 负载,这一条影响巨大。
什么时候值得上 Pro
把 deepseek-v4-pro 留给最难的那 20%:
- 跨文件重构、真实 bug 修复——SWE-bench 级别的能力在这里直接兑现
- 一步走错就全盘皆输的长 agent 任务链
- 吃知识储备而非"就着给定材料推理"的任务
什么时候 Flash 是正确默认
大批量的 80% 交给 deepseek-v4-flash:
- 规模化的摘要、分类、信息抽取、格式整理
- 代码补全和样板代码——那一两分的差距在这里根本看不出来
- 吞吐量和单价说了算的后台流水线
- 基于你提供的上下文做推理的场景(比如检索增强),知识深度在这里不那么要紧
一个好记的心智模型:Flash 干的是你会交给"手快又靠谱的多面手"的活;Pro 干的是你希望"专家签字确认"的活。
两个都用,按任务分流
实际的最优解不是二选一,而是分流。走 OpenAI 兼容网关,两个模型就差一个字符串:
# 同一个 client、同一套代码——model 字段就是分流开关
fast = client.chat.completions.create(model="deepseek-v4-flash", messages=batch_job)
deep = client.chat.completions.create(model="deepseek-v4-pro", messages=hard_task)
所有负载先从 Flash 起步,输出质量明显不够再升 Pro。团队几乎总会发现:自己的流量里"Flash 就够了"的比例远比想象中高。你的具体配比可以用成本计算器算出实数。
常见问题
Flash 就是"笨一点的 Pro"吗? 它是同一家族的小规模版本,为吞吐量调优。编程能力惊人地接近;知识深度和最难的 agent 工作流上差距是真实的。0731 重训版又把 agent 任务上的差距缩小了一截。
DeepSeek 为什么比其他旗舰便宜这么多? 极致的架构效率加开源权重路线。上面的价格不是促销价,就是 V4 家族的正常经济账。
走网关拿到的是哪个版本? 目录以稳定 id deepseek-v4-pro 和 deepseek-v4-flash 提供当前稳定 API 版本,你不用自己管理版本后缀。现价随时看模型目录。
*基准数字核实于 2026 年 8 月的公开第三方评测;模型格局变得很快——分流规则是耐用的,具体数字是易腐的。*