DeepSeek 把「电价分时」思路搬到了大模型 API 上。
8 月 17 日 0 时起,DeepSeek V4 系列 API 正式启用行业罕见的「峰谷分时计价」。高峰时段(北京时间 9:00-12:00、14:00-18:00)价格为闲时的两倍,其余时段为空闲时段。这是 2026 年以来 DeepSeek 第四次发布定价调整通知。
涨幅最刺眼的是缓存命中输入。V4 Pro 高峰时段每百万 tokens 缓存命中输入 0.3 元,较原价 0.025 元上涨 1100%;缓存未命中输入 9 元(涨幅 200%),输出 27 元(涨幅 350%)。空闲时段对应价格为 4.5 元、13.5 元、0.15 元。V4 Flash 涨幅相对温和:高峰时段缓存命中输入 0.1 元(涨幅 400%)、缓存未命中输入 3 元(涨幅 200%)、输出 9 元(涨幅 350%),空闲时段价格为 0.05 元、1.5 元、4.5 元。
DeepSeek 的底气来自调用压力。两个时间节点被反复引用:8 月 1 日 V4-Flash 单日处理约 8 万亿 tokens,8 月 4 日 API 因流量过大一度不可用。给「错峰减半」一个经济理由——只要开发者愿意把任务搬到凌晨或深夜跑,账单立刻砍掉一半。给「高峰加价」一个算力理由——高峰时段算力最紧张,让重负载任务付溢价,挤出来的资源留给低延迟业务。
调价的实际杀伤力在缓存命中这条线上,1100% 的涨幅其实远超字面意义。高缓存命中业务的成本增速远超单价涨幅,意味着凡是依赖大量重复前缀的 Agent、多轮对话、文档批改、代码评审场景,账单会被刷新到重新做预算的程度。DeepSeek 相当于用价格信号重新切割了「重缓存 vs 重生成」两类业务的边界——前者被推着向空闲时段走,后者被推着向高峰时段付费。
这件事为什么重要?因为它是中国大模型厂商第一次把「电网调度思路」引入到 LLM API 商业化里。DeepSeek 之前,国内大模型走过的路径是「低价获客 → 跑出规模 → 涨价」三段式:先以 1 元、0.5 元、0.1 元、0.025 元的缓存命中价把开发者圈进来,等调用量冲上来再分阶段提价。8 月 6 日 DeepSeek 在官方 API 文档里加了一句预告「计划近期整体上调 API 服务定价,预计涨幅较大,具体方案另行通知」,8 月 12 日悄悄上线 V4-Pro-0813 把缓存命中价从 0.025 元/百万 tokens 调到 0.1 元,8 月 13 日晚正式公告分时方案,8 月 17 日 0 时执行——四步走的节奏比 OpenAI 任何一次调价都更精确。
横向对照一下,Anthropic、OpenAI、Google Gemini 都不做分时计价。它们的做法要么是直接涨价(如 GPT-5.6 缓存命中输入 0.05 美元/百万 tokens,约为 DeepSeek 涨价后 0.04 美元的 1.25 倍),要么是用订阅/套餐分层来差异化(如 Claude Max 200/400 美元两档)。DeepSeek 的「峰谷」是中国互联网最熟悉的电价分时机制,借鉴的实际上是阿里云、腾讯云给推理算力做的 Spot Instance 路径——但这是首次搬到 token 级别。
对开发者意味着三件事:
– 高缓存命中业务:成本增速远超单价涨幅,必须重新测算账单,能离线批处理就别在线实时调 – 错峰调度:把夜间任务、批处理任务、可延迟任务全部压到空闲时段,单价立减一半 – 多模型策略:高峰时段可考虑切到 Qwen3.8-27B、智谱 GLM-5.3 等国产替代模型做兜底
对行业意味着两件事:
– 「补贴换规模」阶段结束,DeepSeek V4 进入「规模换利润」阶段,调用量从 8 万亿/天继续往上走时,营收弹性会陡峭抬升 – 国产大模型从「卷价格」转向「卷定价机制」,分时、阶梯、订阅、Token 包、企业合约五种模式会同时跑,看哪个能稳住开发者心智
下一步看三件事:12 个月内看 DeepSeek V4 在高峰时段的实际利润率、空闲时段是否能稳住开发者口碑,以及其他国产大模型(Qwen / 智谱 / Kimi / 字节豆包)是否会跟进分时机制。如果 3 个月内跟进的厂商超过 2 家,中国大模型 API 市场会进入「电价分时」时代。
