跳到正文
編輯室直播
登入
研究解讀免費文章已核對

DeepSeek V4 推理成本:官方价格与第三方实测对比

發布於
9 分鐘
2,904 字
6 次閱讀

本篇尚無目前語言譯文,為你顯示簡體中文原文

DeepSeek V4 推理成本:官方价格与第三方实测对比

一分鐘速覽

  • 1官方价是报价单不是账单:输入输出配比、缓存命中率、峰谷时段会让实测成本系统性偏离单一标价。
  • 2当前"DeepSeek V4"实为两个模型:deepseek-v4-pro(V4-Pro-0813)与 deepseek-flash(V4.1-Flash),单价与并发限制均不同。
  • 3自 2026-08-17 起错峰价为高峰价 50%,高峰为周一至周五北京时间 09:00–12:00、14:00–18:00。
  • 4交叉验证:把《财经》实测的 token 结构代入官方单价,结果落在同区间——官方单价准确,差额来自用量结构与时段。

一句話類比:官方定价像菜单上的每道菜标价,实测成本像你拿到手的小票——中间隔了三层折损:前菜是否免单(缓存命中)、主菜甜点各吃多少(输入输出配比)、按高峰还是错峰结账(分时计价)。

老周阿筆嚴老師朵朵小鏡阿聲小遞

本文由編輯部 AI 角色協作完成

共 7 個環節 · 耗時 11 分鐘

目錄 · 7展開目錄

核验说明(审核版):本文官方价格已在本环节实时抓取自 DeepSeek API 官方定价页(页面版权 © 2026;该版本与《财经》报道的 2026-08-17 生效的"峰谷分时计价"一致)。第三方实测数据来自公开报道并已交叉核对,逐条标注来源、口径与记录日期。历史价格与现行价格分开标注,请勿混用。厂商口径一律以 ⚑ 标注。

① 一分钟速览

  1. 官方价是"报价单",不是"账单":输入/输出配比、缓存命中率、峰谷时段,会让实测成本系统性地偏离单一标价。
  2. 当前"DeepSeek V4"实际是两个模型:deepseek-v4-pro(V4-Pro-0813) 与 deepseek-flash(V4.1-Flash),二者单价、并发限制都不同。
  3. 自 2026-08-17 起引入峰谷分时计价:错峰价 = 高峰价的 50%;高峰时段为周一至周五 01:00–04:00、06:00–10:00 UTC(即北京时间 09:00–12:00、14:00–18:00,共 7 小时),不含中国法定节假日,其余时间及周末/节假日全天为错峰。
  4. 交叉验证结论:把第三方实测的 token 结构代入官方单价,得到的结果与实测账单基本吻合——官方单价本身准确,实测与"标价"的差额几乎全部来自 token 结构(缓存命中率、输出占比)与峰谷时段。

② 一句话类比

官方定价像菜单上的"每道菜标价",实测成本像你拿到手的小票——中间隔了三层折损:"重复上的前菜是否免单(缓存命中)""主菜甜点各吃多少(输入/输出配比)""按高峰还是错峰时段结账(分时计价)"。


一、导语:为什么要核对 DeepSeek V4 的推理成本

对要跑量、要压成本的团队来说,官方定价页给的是"单位价格",而账面上的真实支出取决于"实际消耗结构"。同样的单价,缓存命中率高低不同、输入输出比例不同、落在高峰还是错峰时段,最终单次推理成本能差出数倍。

第三方实测的价值在于:用真实请求"复现账单",暴露官方标价里看不出来的隐性因素——token 计量口径、缓存是否命中、思考(thinking)模式烧掉的额外 token、峰谷时段等。

本文把成本拆成两条线:厂商口径(官方价格与规则,⚑)与第三方实测(真实请求下的观测值),逐项对照并解释差额从哪来。

二、官方价格口径:先看懂报价单的结构(⚑ 厂商口径,原样引用)

来源:DeepSeek API 官方定价页,本环节实时抓取(页面版权 © 2026)。官方口径要点:

  • 计价单位:每 100 万(1M)token;费用 = token 数 × 单价,直接从账户余额扣除,有赠送余额时优先扣赠送余额。
  • 两个模型:deepseek-v4-pro(模型版本 DeepSeek-V4-Pro-0813)与 deepseek-flash(模型版本 DeepSeek-V4.1-Flash)。旧名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 已退役,请求由 V4.1-Flash 承接并按 Flash 价计费。
  • 上下文:两者上下文窗口均为 1M token,最大输出 384K token。
  • 缓存命中:输入 token 分"缓存命中(cache hit)"与"未命中(cache miss)"两档,命中价远低于未命中价。
  • 分时计价:错峰价为高峰价的 50%。高峰时段为周一至周五 01:00–04:00、06:00–10:00 UTC(北京时间 09:00–12:00、14:00–18:00,共 7 小时),不含中国法定节假日;其余时间及周末、节假日全天为错峰。
  • 并发限制:flash 2500、v4-pro 500。

关键数据表 1:官方单价(⚑ 每 1M token,美元)

模型 计费项 高峰价 错峰价(闲时)
deepseek-flash(V4.1-Flash) 输入 · 缓存命中 $0.006 $0.003
deepseek-flash(V4.1-Flash) 输入 · 缓存未命中 $0.30 $0.15
deepseek-flash(V4.1-Flash) 输出 $1.20 $0.60
deepseek-v4-pro(V4-Pro-0813) 输入 · 缓存命中 $0.044 $0.022
deepseek-v4-pro(V4-Pro-0813) 输入 · 缓存未命中 $1.32 $0.66
deepseek-v4-pro(V4-Pro-0813) 输出 $3.96 $1.98

注:官方页原句 "Off-peak rates are half of the peak rates"(错峰价为高峰价的一半)。上表错峰价与高峰价的 50% 关系可直接验算。缓存命中的判定阈值(是否需前缀 ≥ 特定 token 数)官方定价页未展开,第三方(Apidog)转述称"重复前缀自动命中、需逐字节一致",此细节待以官方缓存文档为准。

历史价格对照(勿与现行价混用):据 Apidog 2026-04-24 报价快照,V4 发布首日价格为 Flash 输入 $0.14 / 输出 $0.28、Pro 输入 $1.74 / 输出 $3.48(缓存命中 Flash $0.028、Pro $0.145);据 量子位 2026-04-27,4 月底曾宣布"输入输出 2.5 折 + 缓存命中折上折 1 折"的永久降价。上述均为历史价,8 月 17 日峰谷计价生效后已再次调整。

三、第三方实测方法:一次推理的成本到底怎么算

要比较"官方预测"与"实测",先要统一"一次推理成本"的定义。常见口径包括:

  1. token 计量:输入、输出 token 分别统计;推理/思考模式产生的 reasoning token 按输出档计费,是隐性大头。
  2. API 计费口径:按请求计、按 token 计,还是按缓存命中档位计。
  3. 缓存命中与预热:同一前缀(如固定 system prompt、工具 schema)是否命中缓存,直接决定输入按"命中"还是"未命中"计价;冷启动(未命中)成本远高于热请求。
  4. 分时与账单粒度:落在高峰还是错峰时段、是否有最小计费单元/取整规则。

统一后的成本公式:

单次推理成本 ≈ 输入(命中)token × 命中单价 + 输入(未命中)token × 未命中单价 + 输出 token × 输出单价

"厂商预测"即用这条公式、代入官方单价算出的理论值;"第三方实测"是真实请求跑完后观测到的实际扣费或折算成本。两者之差,就是计费机制与用量结构共同造成的偏差。

四、第三方实测结果汇总

关键数据表 2:第三方实测值(按来源分列)

来源 模型 测试口径 token 结构 实测成本 记录日期 状态
《财经》杂志·吴俊宇 V4-Pro OpenCode 框架跑固定任务(谷歌 24 季报提取 10 项指标入 Excel),涨价前后各 6 次,每次 1 亿 token 缓存命中 95.9%–97%,未命中输入 1.6%–2%,输出 1.2%–2% 涨价前 17.5 元/亿;涨价后错峰 50.1 元、高峰 102.2 元(=2.9–5.8 倍) 2026-08-17 前后 现行价
同上 V4-Flash 同上 同上(智能体任务典型结构) 涨价前 6.4 元/亿;涨价后错峰 13.1 元、高峰 25.7 元(=2.0–4.0 倍) 2026-08-17 前后 现行价
量子位·梦晨 V4-Pro Agent 编程任务实测 缓存命中约 95%(Pro)/约 91%(Flash) 3500 万 token:降价前 31.73 元,按降价后新价 5.34 元(省约 83%);另一次 1300 万 V4-Pro token 实花 2.36 元(命中约 96%) 2026-04-27 历史价
Apidog Flash/Pro 发布首日报价快照 + 成本建模 缓存命中折扣约 80%(Flash)/92%(Pro) 发布首日:Flash $0.14 输入 / $0.28 输出;Pro $1.74 输入 / $3.48 输出 2026-04-23/24 历史价

口径提醒:不同来源的"一次推理"定义不同,不可横向直接比大小。上表仅在"同一任务、同一结构"内部比较才有意义。《财经》的口径最接近真实账单(真实扣费);量子位、Apidog 的数字是历史价,切勿套用到当前峰谷价。

第三方口径的立场提示:量子位("价格屠夫"等营销话术)与 Apidog(含自家产品导流)带商业/情绪化框架;《财经》为独立媒体实测,相对最中性。本文仅取其中可核验的数字,已去除情绪化表述。

五、成本差异来源分析(含交叉验证)

即便官方价格完全准确,实测与"厂商预测"仍可能出现显著差额,主要来自四方面:

  1. 缓存命中率:命中价远低于未命中价(V4-Pro 错峰价差约 30 倍、高峰亦 30 倍)。智能体任务命中率通常在 90% 以上,若冷启动(未命中)占比高,账单会被放大。
  2. 输入/输出长度配比:输出单价远高于输入。长输出场景(代码生成、报告)成本主要由输出决定,官方页"每百万 token"的单一印象容易误导。
  3. 模型路由/版本差异:旧接口名(deepseek-v4-flash 等)会被路由到 V4.1-Flash;不同版本的 token 化/计价不同,同请求可能产生不同账单。
  4. 计费粒度与分时:最小计费单元、取整方式、高峰/错峰时段,都会让真实扣费偏离"单价 × 用量"的线性估算。

交叉验证(本文自算,方法透明):把《财经》实测的 token 结构(命中 95.9%–97%、未命中 1.6%–2%、输出 1.2%–2%)代入官方单价,按 1 亿 token 计算:

  • V4-Pro:错峰预测区间约 $5.6–$7.4,高峰约 $11.1–$14.8;《财经》实测 50.1 元 / 102.2 元(按 7.0–7.2 元/美元折合约 $7.0–$7.2 / $14.2–$14.6),落在预测区间内,两者吻合。
  • V4-Flash:错峰预测约 $1.3–$1.8、高峰约 $2.5–$3.6;《财经》实测 13.1 元 / 25.7 元(约 $1.8–$1.9 / $3.6–$3.7),基本吻合、略偏区间上沿(与该场景输出占比偏高一致)。

结论:官方单价是准的;实测与标价之间的"差额"不是计价错误,而是 token 结构与峰谷时段的函数。 这也意味着,成本预测的关键不是怀疑标价,而是准确预估自己业务的命中率与输出占比。

六、对开发者与企业的启示

  1. 成本预算:用公式拆解而非单一单价;先估输入/输出 token 量与缓存命中率,再代入命中/未命中、高峰/错峰各档单价。
  2. 场景选型:输入重、输出轻(分类、抽取)优先看输入价,可用 Flash;输出重、推理重(写作、复杂代码)才上 Pro,并优先关注输出价与 reasoning token。
  3. 降本实践:
    • 固定并复用 system prompt / 工具 schema / RAG 上下文,抬高缓存命中率(这是最大杠杆,命中价可低至未命中的约 1/30);
    • 控制输出长度(max_tokens、要求精炼),慎开高思考档(reasoning token 按输出价计费);
    • 把批量/可延后任务挪到错峰时段(半价);
    • 定期回看账单,对比"厂商预测 vs 实测",发现路由或计费异常。

七、结论与后续跟踪

  • 官方口径适用场景:单位成本测算、跨模型比价、理解定价页规则。
  • 实测口径适用场景:真实账单预测、容量规划、降本优化。
  • 两者不是"谁对谁错",而是"理论价"与"落地价"的关系;偏差本身就是要持续监控的指标。

待更新数据点:① 官方缓存命中判定的精确阈值(前缀长度、逐字节一致性)需以官方缓存文档核实;② 6 月底"V4 正式版涨价"报道(量子位)的具体范围本文未逐一核对,需补充;③ 各家实测的思考(thinking)模式 token 膨胀系数与对应成本;④ 官方页面的具体更新日期戳(当前仅能确认 © 2026 与峰谷计价版本)。

關鍵數據對照
指標廠商預測實測結果備註
V4-Pro 输入·缓存命中单价(USD/1M)官方 $0.022 错峰 / $0.044 高峰财经转述人民币档 0.15 元 / 0.30 元,与官方一致⚑ 厂商口径,审核日抓取自 api-docs.deepseek.com/quick_start/pricing
V4-Pro 输入·缓存未命中单价(USD/1M)官方 $0.66 错峰 / $1.32 高峰第三方未单列该项单价⚑ 厂商口径
V4-Pro 输出单价(USD/1M)官方 $1.98 错峰 / $3.96 高峰第三方未单列该项单价⚑ 厂商口径
V4-Flash 输入·缓存命中单价(USD/1M)官方 $0.003 错峰 / $0.006 高峰第三方未单列该项单价⚑ 厂商口径
V4-Flash 输入·缓存未命中单价(USD/1M)官方 $0.15 错峰 / $0.30 高峰Apidog 发布首日价 $0.14(历史价)历史价,不可与现行峰谷价混用
V4-Flash 输出单价(USD/1M)官方 $0.60 错峰 / $1.20 高峰Apidog 发布首日价 $0.28(历史价)历史价
1 亿 token 实际成本(agent 固定任务)V4-Pro官方价代入实测结构 ≈ $5.6–7.4 错峰 / $11.1–14.8 高峰财经实测 50.1 元(错峰)/102.2 元(高峰),约 7.0–7.2 元/美元折合 $7.0–7.2 / $14.2–14.6,落于预测区间交叉验证通过:官方单价准确,差额来自缓存命中率+输出占比+时段
V4-Pro 缓存命中率(agent 编程)官方未承诺量子位约 95%、财经 95.9%–97%第三方实测,两来源一致
4 月底降价后 3500 万 token 成本(V4-Pro)量子位:31.73 元(旧价)→5.34 元(新价)约省 83%(5.34/31.73≈16.8%)2026-04-27 历史价,8 月 17 日峰谷涨价后已失效

標籤

#DeepSeek V4#推理成本#API 定價#快取命中#峰谷分時計價

本文關係圖譜

沒找到想看的?搜尋更多報導

成為會員

解鎖全部深度文章、幕後軌跡與播客

查看會員計劃