NeuralOS
Modelos

DeepSeek推出高峰时段定价:一天两次涨价的API

DeepSeek V4引入分时段计费:每天两个时间窗口内,token(输入和输出)价格翻倍,非高峰时段则回落。这是大型实验室首次"按钟点"收费,类似Uber的动态加价。推理开始表现得像电力一样。

EN
Equipo NeuralOS
Radar de IA
Jul 1, 20264 min read
In short

DeepSeek V4推出分时段计费:每天两个时间窗口内其token(输入和输出)价格翻倍,非高峰时段则回落。推理开始像电力一样收费,给AI做预算也从"用了多少token"变成了"在什么时段"。

想象一下,早上十点打开你的AI服务商控制台,却发现昨晚只要一块钱的同一次调用,今天要两块钱。没有藏在角落的小字,也没有隐性罚款:原因很简单,就是时间。DeepSeek刚刚宣布的正是这件事。凭借V4模型,这家中国实验室从7月中旬起引入分时段计费:在每天两个时间窗口内——北京时间9:00至12:00以及14:00至18:00——价格翻倍,而在这些高峰之外又会回落。这是大型实验室首次真正按钟点收费。

## Uber模式,但用来思考

这套机制和你已经在Uber或分时电价上熟悉的动态加价一模一样:需求上升,价格上涨;需求下降,价格下跌。落到具体数字上,V4-Pro版本在高峰时段的输出价格从每百万token 6元涨到12元(峰值约合1.70美元);V4-Flash则从2元涨到4元。这里有一个不容搞错的关键细节:加价并非只落在模型生成的内容上。据The Next Web报道,在高峰窗口内**输入价格同样翻倍**,也就是你发给它的那些token。非高峰时段则纹丝不动。DeepSeek并没有把它包装成什么花招:它把这当作一个价格信号,让有条件的用户把负载转移到低谷时段,在所有人都抢GPU的时候把资源腾出来。

## 一家实验室为何敢这么做

这个点子背后是物理学,而非营销。服务一个大模型是一个产能问题:GPU数量有限,而在亚洲的办公时段里,它们会同时被塞满。高峰多收、低谷少收,是最诚实的一种说法:'我现在没位置了;晚点再来,还能便宜一半。'这和为什么下午三点和凌晨三点的电价不同是同一个逻辑。而这个转向之所以引人注目,是因为DeepSeek此前走的正是相反的路:它刚刚把V4的75%折扣变成永久性的,此前一整年都在削低竞争对手的价格。短短几周之内,从白送token到按钟点收费,这足以说明算力已经变得多么昂贵。

## 账单不再只取决于用了多少,还取决于什么时候

对于在这些API之上构建软件的人来说,这个变化比看起来更深刻。到目前为止,给AI做预算就是token乘以一个固定价格。有了动态定价,这笔账变成了一个调度问题:一个谁都不着急的批处理任务——重新处理文档、生成embeddings、夜间摘要——如果你把它安排在低谷时段而不是中午一股脑跑起来,成本可能减半。反过来也一样:一个无视钟点的集成可能在无人察觉的情况下让账单翻倍,因为代码运行得一样好;变的只是对账单。推理开始表现得像一项公用事业,而公用事业要靠时段纪律来管理,而不是靠指望。

## 这对用AI构建产品的人意味着什么

这个教训让人不舒服,却也让人解脱:如果你的产品靠调用模型为生,成本不再是月底才看的一个数字,而是你要实时操作的一根杠杆。这要求两样直到昨天还算可选的东西:能理解上下文的成本护栏——不只是'用了多少token',而是'此刻是什么价'——以及把不紧急的负载挪到便宜时段的能力。在NeuralOS,我们正是从这个角度出发:cost guardrails和积分系统的存在,就是为了不让一次昂贵的调用在你不经意间溜走;而带有持久等待(waits durables)的automations引擎,可以让批处理任务延后到你选定的窗口执行,而不丢失执行的线索。我们不承诺替你去谈判每家服务商的钟点——那是空话——我们提供的是那块仪表盘,让'什么时候'不再是账单上的意外,而成为你自己的一个决定。

Share
Ready to build?

Start building in
under 3 minutes

Join 4,200+ builders. No credit card. Build your first app with AI in minutes.