跳到正文
deepseekprice

社区自建的非官方站点,与 DeepSeek 官方无关。

检查点 V4-Pro-0813 与 V4-Flash-0731 · 2026年8月15日 取数

V4-Flash 还是 V4-Pro

在当前这两个检查点上,两个模型的能力差 1 分,价格差 3.0×。Flash 还更快,并发额度是它的 5.0×。这么一说答案好像很明显,对大多数场景也确实如此——但价目表只是你要付的那笔钱的一半。

另一半是每个模型为了得出答案要烧掉多少 token,这个数没有任何对比表会写。这页给出那个临界点的具体值:token 消耗到 3.0× 时,便宜的那个就不便宜了。

三个关键差距

能力差距

53 vs 52

Pro 领先 1 分——多数场景里这在噪声范围内

价格差距

3.0×

Pro 的每个输出 token 贵这么多

临界点

3.0×

token 消耗到这个倍数,两边账单打平

为什么网上搜到的对比大多是错的

这两个模型名在不同时间指的其实是不同的东西,谁强谁弱翻转过两次。7 月 31 日到 8 月 13 日之间,Flash 确实大幅领先 V4-Pro 预览版——网上能搜到的对比文章,大多写于这段时间。V4-Pro-0813 把差距补了回来。任何声称某一方大幅领先的说法,描述的都是一个已经过期的快照。

  1. 2026-04-24

    V4-Pro 与 V4-Flash 同日发布

    同一天以 MIT 协议开放权重,上下文都是 100 万 tokens。Flash 是单独训的,不是从 Pro 蒸出来的——所以它从来就不是 Pro 的缩小版。

  2. 2026-07-31

    Flash 重做后训练

    0731 这一版在价格不变的前提下把 agent 和工具调用的表现磨得更利,一度在 Intelligence Index 上反超 V4-Pro 预览版。网上能搜到的对比文章,大多写于这段时间。

  3. 2026-08-13

    V4-Pro-0813 正式可用

    正式版加了可选推理强度(low / high / max)、原生 OpenAI Responses API 和 DSpark 投机解码,也把 Pro 重新拉回领先——领先一分。DeepSeek Harness 同日发布。

  4. 2026-08-16

    新价目表生效

    两个模型一起涨价,也一起恢复分时段计费。两者之间的比价大体没变,所以这次涨价并不影响你在它俩之间怎么选。

Intelligence Index 的分数是在最高推理强度下测的。指数升到 v4.1.1 时 Artificial Analysis 把 Flash-0731 从 50 上调到了 52,别处引用的数字可能还停在调整之前。

逐项对照

DeepSeek V4-Pro 与 V4-Flash 在能力、速度、价格和限额上的对照。
项目 DeepSeek V4-Pro DeepSeek V4-Flash
Intelligence Index Artificial Analysis,最高推理强度 53 52
输出速度 Artificial Analysis 中位数 77.6 tok/s 120.6 tok/s
输出价 · 空闲时段 高峰时段比例相同 ¥13.50/百万 ¥4.50/百万
并发请求数 按账号封顶,多开 API key 也不会变高 500 2,500
上下文窗口 完全一样 1M 1M
参数量 各训各的——Flash 不是 Pro 蒸馏出来的 总计 1.6T · 激活 49B 总计 284B · 激活 13B

能力与速度数据来自 Artificial Analysis;价格、上下文和并发来自 DeepSeek 自己的文档。作为标尺, Claude Opus 5 (max) 得 63 分在同一套指数上的分数如上。

折扣从哪儿开始失效

小模型干同一件事,可能要多试几次、想得更久、多调几次工具。有一份跑了三个真实编码任务的实测,正好撞上这一幕:便宜的那个活干得更好,但多烧的 token 把两边账单拉平了。所以问题不是谁的单价低,而是便宜那个得多花多少,差距才会被抹平。

1.00×

DeepSeek V4-Pro

实测负载,原样不动

DeepSeek V4-Flash

token 用量相同 临界点 3.0×

基准就是本站那次实测:155.9M 提示词、98.1% 缓存命中率、754K 输出,按新价目表算。滑杆的倍数会同时作用在三档价上,也就是假设便宜模型多干的活平摊在输入和输出上。

比选模型更要紧的那个开关

V4-Pro-0813 开始支持选推理强度——low、high、max。这个开关决定模型在回答之前生成多少思考 token,而思考 token 按输出价计费,是整张表上最贵的一档。钱照收,你还看不见。

73.6%

——DeepSeek V4-Pro 在 high 强度下,生成的 token 里思考占比

数据来自一台机器上的 613 次请求。那一轮里,输出账单大约 74% 买的是推理过程,不是答案。 同一批日志里 DeepSeek V4-Flash 的请求是 57.2%,但跑的任务不一样——当第二个数据点看,不是正面对比。

实际的结论是:想换模型省钱之前,先看看现在这个的推理强度停在哪一档。改一行配置,直接作用在最贵那档上,而且不影响你拿到的是哪个模型的答案。

怎么选

默认用 DeepSeek V4-Flash

  • 大流量的线上业务。 1 分的指数差距碰上真实业务基本就消失了,而你要为它多付 3.0×。
  • 任何对延迟敏感的场景。 输出速度快 1.6×,这是用户能直接感觉到的,指数分数不是。
  • 并行或批量任务。 2,500 路并发对 500 路——5.0× 的天花板差距,在能力开始起作用之前就已经决定了吞吐量。

这些情况升级到 DeepSeek V4-Pro

  • 长时间自主运行的 agent。 每一步一点点错误率,跑很多步就会累积起来,而重跑一次的成本比那点能力溢价高得多。
  • 跨多文件的硬重构、前沿推理。 这类活是真的需要指数榜顶端那点能力。
  • 对准确率要求高的输出 ——答错一次的代价,超过两张价目表之间的差价。

按难度分流(默认 Flash,遇到难的再升到 Pro)比二选一更划算,而且两者价目表结构一样,账好算。

不管你选哪个,账单上最大的那根杠杆既不是模型也不是推理强度,而是 你的缓存命中率。在那次实测里,它从一张 ¥711.73 的账单上砍掉了 ¥665.21——比换任何模型都多。

关于选型

写入缓存要另外收钱吗?

不收。缓存是自动的,也没有单独的写入费——你要么按命中价结算,要么按未命中价,没有第三项。

这不是细节,是和一部分同行的实质差别。Anthropic 写提示词缓存要额外加钱,得靠后面读回来的次数把这笔钱赚回来才划算。DeepSeek 这边第一次请求就按未命中价走,本来也要付这个钱。

代价是没有任何承诺。官方明说缓存是尽力而为,没人再用的条目几小时到几天就清掉了。

V4-Pro 和 V4-Flash 差在哪?

上下文都是 1M tokens,最大输出长度也一样。差别在价格,还有一次能开多少路:DeepSeek V4-Pro 允许 500 路并发,DeepSeek V4-Flash 是 2,500 路。

DeepSeek V4-Flash 高峰时段输出每百万 ¥9.00,DeepSeek V4-Pro 是 ¥27.00。两个模型同一天切新卡,高峰时段也完全一样。

实际用下来,V4-Flash 真比 V4-Pro 省钱吗?

价目表上输出差 3.0×。账单未必认这个数——单价只是一半的答案,另一半是模型为了把活干完要烧多少 token,而小模型未必烧得更少。有一份公开的实测拿两个模型跑了三个真实编码任务,结论是便宜的那个活干得还更好,但多花的 token 把两边账单拉平了。

还有个因素通常比选模型影响更大:推理强度。本站那份实测里,生成的 token 有 73.6% 是思考 token——响应里看不见,但按输出价全额计费,而输出是整张卡上最贵的一档。

所以既别看折扣标题,也别看跑分表。拿你自己的活在两边各跑一遍,比总 token 数而不是比单价,顺便看看推理强度是不是一直开在最高档。

涨完之后还比 Claude、OpenAI、Gemini 便宜吗?

多数场景还是便宜,但差距比以前小了;再把缓存命中算进去,和各家便宜档位的距离会进一步缩。

到底怎么比,取决于你自己的输入输出配比和命中率——计算器就是干这个的:把你的用量同时套到所有价目表上,而不是对着一个未必符合你情况的标题数字下结论。

跑分是第三方对特定检查点的测量,会随时间修订,每个数字的取数日期都标在这页上。价格来自 DeepSeek 公布的价目表。但这两样都替代不了一件事:拿你自己的活在两个模型上各跑一遍,比总 token 数。