DeepSeek API 费用估算
别人报价都是“每百万 tokens 多少钱”一个数,但 DeepSeek 根本不是这么收的:输入按缓存命中与否分两个价,整张表还随时段变。这个计算器把四个价一起套到你自己的用量上,顺便告诉你同样的活在 Anthropic、OpenAI和Google 那边要多少钱。
输入 token 里能从缓存直接拿到的比例。编码助手和 agent 循环一直在重发同一段前缀,命中率经常在 90% 以上—— DeepSeek Harness(dsh) 的会话就是个真实例子。
拉到 0,就是全部错开高峰跑的价钱。
8 月 17 日起
—
每月 · — 每天
调价前
—
每月 · — 每天
同样的量全挪到空闲时段跑: — 每月,省下 —.
同样用量,其他几家 · 每月(美元)
- DeepSeek V4-Pro —
- Anthropic Claude Sonnet 5 — —
- Anthropic Claude Opus 5 — —
- OpenAI GPT-5.6-sol — —
- OpenAI GPT-5.6-terra — —
- OpenAI GPT-5.6-luna — —
- Google Gemini 3.1 Pro Preview — —
这里假设各家的 token 用量和缓存命中率都一样,是简化过的——各家缓存的脾气其实不同。另外只有 DeepSeek 分时段计费,所以其他几行没有高峰/空闲之分。 Claude、OpenAI、Gemini 官方只公布美元价,所以这一栏统一按美元比,没有做汇率折算。DeepSeek 那一行同时按美元列出,两边才是同一把尺子。
各家的附加条件
- Anthropic Claude Sonnet 5 — 写入 5 分钟缓存要在读取价之外另付 $2.50 / 百万 tokens。
- Anthropic Claude Opus 5 — 写缓存 Anthropic 单独收一笔钱。
- OpenAI GPT-5.6-sol — 缓存自动生效,不单收写入费。
- OpenAI GPT-5.6-terra — 缓存自动生效,不单收写入费。
- OpenAI GPT-5.6-luna — 缓存自动生效,不单收写入费。
- Google Gemini 3.1 Pro Preview — 这里的价格只适用于 20 万 tokens 以内的提示词,更长的走更贵的一档。 显式上下文缓存,Google 还要在读取价之外按小时收存储费。
这个数是怎么算出来的
输入先拆开,再定价
每天的输入量先按命中率劈成两半,各按各的价算。默认 80% 命中率下,大部分输入走的是便宜那档——所以只报一个“输入价”是会骗人的。
一天也要拆开
高峰比例这个滑杆是在两档价之间做加权。它是流量占比,不是排班表——照你实际有多少量真的落在高峰窗口里填。
一个月按 30 天算
月度数字就是日成本乘 30。真实月份是 28 到 31 天,所以这个数拿来做预算可以,别当账单看。
横向对比是故意简化的
其他几家按同样的 token 量和同样的命中率算。它们都不分时段计费,而且各家写缓存的收法不一样——这个对比给的是差距的大致形状,不是报价单。
这几个档位假设了什么
| 档位 | 输入/天 | 输出/天 | 缓存命中 |
|---|---|---|---|
| 轻度 偶尔聊两句、写点一次性脚本,一天几十次调用。 | 200K | 40K | 40% |
| 天天写代码 编码助手开一整天,围着同一批文件来回改。 | 5M | 400K | 85% |
| 重度 Agent 长时间自动跑,反复重读大段上下文,工具调用密集。 | 40M | 3M | 90% |
这几档是给 DeepSeek V4-Pro 用的起点,不是实测值。你自己控制台里有真实数据的话,直接换掉。
关于这个估算
空闲时段能便宜多少?
官方说的是:空闲时段价格是高峰时段的一半,输入输出都一样。DeepSeek V4-Pro 的输出,就是从每百万 ¥27.00 降到 ¥13.50。
要看清这个“一半”是相对谁的一半:它是新价高峰的一半,不是退回旧价格。空闲时段的输出仍然是调价前的 2.3×。
算哪一档看请求到达 DeepSeek 的时间。能等的批量任务是最容易吃满这个折扣的——挪几个小时,不改一行代码。
缓存命中是怎么计费的?
输入 tokens 分两个价。DeepSeek 能直接从缓存里拿的,高峰时段每百万 ¥0.30;要重新算一遍的,每百万 ¥9.00——差 30×。
缓存认的是前缀一模一样。所以它奖励的是:把提示词里不变的那部分(系统指令、工具定义、你正在反复改的那个文件)原样钉在最前面,把每次都变的东西放到后面。前缀顺序一动,之前攒的缓存就白攒了。
编码助手和长链路 agent 每一轮都在重发同一段上下文,命中率普遍能上 90%。所以这个站的计算器默认从 80% 起算,而不是假设每个 token 都按全价走。
我的缓存命中率大概能到多少?
完全看提示词长什么样,差距大得离谱。实测一段编码 agent 的 613 次请求、155.9M 提示词 tokens,命中率 98.1%——因为 agent 每轮都在重发一段又长又稳的上下文。
这是天花板,不是平均水平。同一批日志里,每个会话的第一次请求只有 16.8%——那会儿还没东西可命中;而要是把时间戳、请求 ID 这类东西放在提示词最前面,跑再久命中率也趋近于零。
别拿别人的数字做预算,包括这一个。算你自己那两个数就行,每次 API 响应里都带着。
涨价之后,缓存还值得优化吗?
相对来说更不值了,绝对来说更值——反直觉的是前面那半句。缓存命中这一档涨了 6.0×,比未命中的 1.5× 和输出的 2.3× 都猛。最便宜的那档涨得最狠。
结果就是:缓存做得越好,这次涨价打得越疼。把实测那份 98.1% 命中的负载按新的空闲价重算,账单变成原来的 2.7×;同样这批 tokens,如果一点缓存率为0,反而只涨 1.5×。
但绝对值上缓存比以前更值钱,因为它是在一个更大的数上打折。还是那份负载,缓存把一张本该 ¥711.73 的账单压掉了 ¥665.21。
怎么测我自己的缓存命中率?
每次 API 响应的 `usage` 里都躺着两个计数器:`prompt_cache_hit_tokens` 和 `prompt_cache_miss_tokens`。两者不重叠,加起来正好是提示词长度,命中率就是前者除以总和。记下来,就不用猜了。
如果你用 DeepSeek Harness,这些数已经在硬盘上了——它把每次请求的 token 明细都写进了 `~/.dsh/sessions`。本站公开的那个审计脚本(/dsh-cache-audit.py)就是读这些日志,直接打印你自己的真实命中率和账单。零依赖,不联网。
写入缓存要另外收钱吗?
不收。缓存是自动的,也没有单独的写入费——你要么按命中价结算,要么按未命中价,没有第三项。
这不是细节,是和一部分同行的实质差别。Anthropic 写提示词缓存要额外加钱,得靠后面读回来的次数把这笔钱赚回来才划算。DeepSeek 这边第一次请求就按未命中价走,本来也要付这个钱。
代价是没有任何承诺。官方明说缓存是尽力而为,没人再用的条目几小时到几天就清掉了。
V4-Pro 和 V4-Flash 差在哪?
上下文都是 1M tokens,最大输出长度也一样。差别在价格,还有一次能开多少路:DeepSeek V4-Pro 允许 500 路并发,DeepSeek V4-Flash 是 2,500 路。
DeepSeek V4-Flash 高峰时段输出每百万 ¥9.00,DeepSeek V4-Pro 是 ¥27.00。两个模型同一天切新卡,高峰时段也完全一样。
实际用下来,V4-Flash 真比 V4-Pro 省钱吗?
价目表上输出差 3.0×。账单未必认这个数——单价只是一半的答案,另一半是模型为了把活干完要烧多少 token,而小模型未必烧得更少。有一份公开的实测拿两个模型跑了三个真实编码任务,结论是便宜的那个活干得还更好,但多花的 token 把两边账单拉平了。
还有个因素通常比选模型影响更大:推理强度。本站那份实测里,生成的 token 有 73.6% 是思考 token——响应里看不见,但按输出价全额计费,而输出是整张卡上最贵的一档。
所以既别看折扣标题,也别看跑分表。拿你自己的活在两边各跑一遍,比总 token 数而不是比单价,顺便看看推理强度是不是一直开在最高档。
涨完之后还比 Claude、OpenAI、Gemini 便宜吗?
多数场景还是便宜,但差距比以前小了;再把缓存命中算进去,和各家便宜档位的距离会进一步缩。
到底怎么比,取决于你自己的输入输出配比和命中率——计算器就是干这个的:把你的用量同时套到所有价目表上,而不是对着一个未必符合你情况的标题数字下结论。