核验说明(审核版):本文官方价格已在本环节实时抓取自 DeepSeek API 官方定价页(页面版权 © 2026;该版本与《财经》报道的 2026-08-17 生效的"峰谷分时计价"一致)。第三方实测数据来自公开报道并已交叉核对,逐条标注来源、口径与记录日期。历史价格与现行价格分开标注,请勿混用。厂商口径一律以 ⚑ 标注。
① 一分钟速览
- 官方价是"报价单",不是"账单":输入/输出配比、缓存命中率、峰谷时段,会让实测成本系统性地偏离单一标价。
- 当前"DeepSeek V4"实际是两个模型:deepseek-v4-pro(V4-Pro-0813) 与 deepseek-flash(V4.1-Flash),二者单价、并发限制都不同。
- 自 2026-08-17 起引入峰谷分时计价:错峰价 = 高峰价的 50%;高峰时段为周一至周五 01:00–04:00、06:00–10:00 UTC(即北京时间 09:00–12:00、14:00–18:00,共 7 小时),不含中国法定节假日,其余时间及周末/节假日全天为错峰。
- 交叉验证结论:把第三方实测的 token 结构代入官方单价,得到的结果与实测账单基本吻合——官方单价本身准确,实测与"标价"的差额几乎全部来自 token 结构(缓存命中率、输出占比)与峰谷时段。
② 一句话类比
官方定价像菜单上的"每道菜标价",实测成本像你拿到手的小票——中间隔了三层折损:"重复上的前菜是否免单(缓存命中)""主菜甜点各吃多少(输入/输出配比)""按高峰还是错峰时段结账(分时计价)"。
一、导语:为什么要核对 DeepSeek V4 的推理成本
对要跑量、要压成本的团队来说,官方定价页给的是"单位价格",而账面上的真实支出取决于"实际消耗结构"。同样的单价,缓存命中率高低不同、输入输出比例不同、落在高峰还是错峰时段,最终单次推理成本能差出数倍。
第三方实测的价值在于:用真实请求"复现账单",暴露官方标价里看不出来的隐性因素——token 计量口径、缓存是否命中、思考(thinking)模式烧掉的额外 token、峰谷时段等。
本文把成本拆成两条线:厂商口径(官方价格与规则,⚑)与第三方实测(真实请求下的观测值),逐项对照并解释差额从哪来。
二、官方价格口径:先看懂报价单的结构(⚑ 厂商口径,原样引用)
来源:DeepSeek API 官方定价页,本环节实时抓取(页面版权 © 2026)。官方口径要点:
- 计价单位:每 100 万(1M)token;费用 = token 数 × 单价,直接从账户余额扣除,有赠送余额时优先扣赠送余额。
- 两个模型:
deepseek-v4-pro(模型版本 DeepSeek-V4-Pro-0813)与deepseek-flash(模型版本 DeepSeek-V4.1-Flash)。旧名deepseek-v4-flash、deepseek-v4-flash-vision-exp已退役,请求由 V4.1-Flash 承接并按 Flash 价计费。 - 上下文:两者上下文窗口均为 1M token,最大输出 384K token。
- 缓存命中:输入 token 分"缓存命中(cache hit)"与"未命中(cache miss)"两档,命中价远低于未命中价。
- 分时计价:错峰价为高峰价的 50%。高峰时段为周一至周五 01:00–04:00、06:00–10:00 UTC(北京时间 09:00–12:00、14:00–18:00,共 7 小时),不含中国法定节假日;其余时间及周末、节假日全天为错峰。
- 并发限制:flash 2500、v4-pro 500。
关键数据表 1:官方单价(⚑ 每 1M token,美元)
| 模型 | 计费项 | 高峰价 | 错峰价(闲时) |
|---|---|---|---|
| deepseek-flash(V4.1-Flash) | 输入 · 缓存命中 | $0.006 | $0.003 |
| deepseek-flash(V4.1-Flash) | 输入 · 缓存未命中 | $0.30 | $0.15 |
| deepseek-flash(V4.1-Flash) | 输出 | $1.20 | $0.60 |
| deepseek-v4-pro(V4-Pro-0813) | 输入 · 缓存命中 | $0.044 | $0.022 |
| deepseek-v4-pro(V4-Pro-0813) | 输入 · 缓存未命中 | $1.32 | $0.66 |
| deepseek-v4-pro(V4-Pro-0813) | 输出 | $3.96 | $1.98 |
注:官方页原句 "Off-peak rates are half of the peak rates"(错峰价为高峰价的一半)。上表错峰价与高峰价的 50% 关系可直接验算。缓存命中的判定阈值(是否需前缀 ≥ 特定 token 数)官方定价页未展开,第三方(Apidog)转述称"重复前缀自动命中、需逐字节一致",此细节待以官方缓存文档为准。
历史价格对照(勿与现行价混用):据 Apidog 2026-04-24 报价快照,V4 发布首日价格为 Flash 输入 $0.14 / 输出 $0.28、Pro 输入 $1.74 / 输出 $3.48(缓存命中 Flash $0.028、Pro $0.145);据 量子位 2026-04-27,4 月底曾宣布"输入输出 2.5 折 + 缓存命中折上折 1 折"的永久降价。上述均为历史价,8 月 17 日峰谷计价生效后已再次调整。
三、第三方实测方法:一次推理的成本到底怎么算
要比较"官方预测"与"实测",先要统一"一次推理成本"的定义。常见口径包括:
- token 计量:输入、输出 token 分别统计;推理/思考模式产生的 reasoning token 按输出档计费,是隐性大头。
- API 计费口径:按请求计、按 token 计,还是按缓存命中档位计。
- 缓存命中与预热:同一前缀(如固定 system prompt、工具 schema)是否命中缓存,直接决定输入按"命中"还是"未命中"计价;冷启动(未命中)成本远高于热请求。
- 分时与账单粒度:落在高峰还是错峰时段、是否有最小计费单元/取整规则。
统一后的成本公式:
单次推理成本 ≈ 输入(命中)token × 命中单价 + 输入(未命中)token × 未命中单价 + 输出 token × 输出单价
"厂商预测"即用这条公式、代入官方单价算出的理论值;"第三方实测"是真实请求跑完后观测到的实际扣费或折算成本。两者之差,就是计费机制与用量结构共同造成的偏差。
四、第三方实测结果汇总
关键数据表 2:第三方实测值(按来源分列)
| 来源 | 模型 | 测试口径 | token 结构 | 实测成本 | 记录日期 | 状态 |
|---|---|---|---|---|---|---|
| 《财经》杂志·吴俊宇 | V4-Pro | OpenCode 框架跑固定任务(谷歌 24 季报提取 10 项指标入 Excel),涨价前后各 6 次,每次 1 亿 token | 缓存命中 95.9%–97%,未命中输入 1.6%–2%,输出 1.2%–2% | 涨价前 17.5 元/亿;涨价后错峰 50.1 元、高峰 102.2 元(=2.9–5.8 倍) | 2026-08-17 前后 | 现行价 |
| 同上 | V4-Flash | 同上 | 同上(智能体任务典型结构) | 涨价前 6.4 元/亿;涨价后错峰 13.1 元、高峰 25.7 元(=2.0–4.0 倍) | 2026-08-17 前后 | 现行价 |
| 量子位·梦晨 | V4-Pro | Agent 编程任务实测 | 缓存命中约 95%(Pro)/约 91%(Flash) | 3500 万 token:降价前 31.73 元,按降价后新价 5.34 元(省约 83%);另一次 1300 万 V4-Pro token 实花 2.36 元(命中约 96%) | 2026-04-27 | 历史价 |
| Apidog | Flash/Pro | 发布首日报价快照 + 成本建模 | 缓存命中折扣约 80%(Flash)/92%(Pro) | 发布首日:Flash $0.14 输入 / $0.28 输出;Pro $1.74 输入 / $3.48 输出 | 2026-04-23/24 | 历史价 |
口径提醒:不同来源的"一次推理"定义不同,不可横向直接比大小。上表仅在"同一任务、同一结构"内部比较才有意义。《财经》的口径最接近真实账单(真实扣费);量子位、Apidog 的数字是历史价,切勿套用到当前峰谷价。
第三方口径的立场提示:量子位("价格屠夫"等营销话术)与 Apidog(含自家产品导流)带商业/情绪化框架;《财经》为独立媒体实测,相对最中性。本文仅取其中可核验的数字,已去除情绪化表述。
五、成本差异来源分析(含交叉验证)
即便官方价格完全准确,实测与"厂商预测"仍可能出现显著差额,主要来自四方面:
- 缓存命中率:命中价远低于未命中价(V4-Pro 错峰价差约 30 倍、高峰亦 30 倍)。智能体任务命中率通常在 90% 以上,若冷启动(未命中)占比高,账单会被放大。
- 输入/输出长度配比:输出单价远高于输入。长输出场景(代码生成、报告)成本主要由输出决定,官方页"每百万 token"的单一印象容易误导。
- 模型路由/版本差异:旧接口名(
deepseek-v4-flash等)会被路由到 V4.1-Flash;不同版本的 token 化/计价不同,同请求可能产生不同账单。 - 计费粒度与分时:最小计费单元、取整方式、高峰/错峰时段,都会让真实扣费偏离"单价 × 用量"的线性估算。
交叉验证(本文自算,方法透明):把《财经》实测的 token 结构(命中 95.9%–97%、未命中 1.6%–2%、输出 1.2%–2%)代入官方单价,按 1 亿 token 计算:
- V4-Pro:错峰预测区间约 $5.6–$7.4,高峰约 $11.1–$14.8;《财经》实测 50.1 元 / 102.2 元(按 7.0–7.2 元/美元折合约 $7.0–$7.2 / $14.2–$14.6),落在预测区间内,两者吻合。
- V4-Flash:错峰预测约 $1.3–$1.8、高峰约 $2.5–$3.6;《财经》实测 13.1 元 / 25.7 元(约 $1.8–$1.9 / $3.6–$3.7),基本吻合、略偏区间上沿(与该场景输出占比偏高一致)。
结论:官方单价是准的;实测与标价之间的"差额"不是计价错误,而是 token 结构与峰谷时段的函数。 这也意味着,成本预测的关键不是怀疑标价,而是准确预估自己业务的命中率与输出占比。
六、对开发者与企业的启示
- 成本预算:用公式拆解而非单一单价;先估输入/输出 token 量与缓存命中率,再代入命中/未命中、高峰/错峰各档单价。
- 场景选型:输入重、输出轻(分类、抽取)优先看输入价,可用 Flash;输出重、推理重(写作、复杂代码)才上 Pro,并优先关注输出价与 reasoning token。
- 降本实践:
- 固定并复用 system prompt / 工具 schema / RAG 上下文,抬高缓存命中率(这是最大杠杆,命中价可低至未命中的约 1/30);
- 控制输出长度(max_tokens、要求精炼),慎开高思考档(reasoning token 按输出价计费);
- 把批量/可延后任务挪到错峰时段(半价);
- 定期回看账单,对比"厂商预测 vs 实测",发现路由或计费异常。
七、结论与后续跟踪
- 官方口径适用场景:单位成本测算、跨模型比价、理解定价页规则。
- 实测口径适用场景:真实账单预测、容量规划、降本优化。
- 两者不是"谁对谁错",而是"理论价"与"落地价"的关系;偏差本身就是要持续监控的指标。
待更新数据点:① 官方缓存命中判定的精确阈值(前缀长度、逐字节一致性)需以官方缓存文档核实;② 6 月底"V4 正式版涨价"报道(量子位)的具体范围本文未逐一核对,需补充;③ 各家实测的思考(thinking)模式 token 膨胀系数与对应成本;④ 官方页面的具体更新日期戳(当前仅能确认 © 2026 与峰谷计价版本)。
