标签

AI定价斩杀线刷屏,DeepSeek用户单日Token消耗破8万亿

发布时间:2026-08-04 10:15阅读:1

点击上方蓝字关注,第一时间获取推送

7月31日深夜,DeepSeek V4 Flash 正式版 API 开启公开测试。几乎同一时间,OpenAI 公布 GPT-5.6 Luna 大幅降价八成:输出费用从每百万 Token 6 美元降至 1.2 美元,输入从 1 美元降至 0.2 美元。两家厂商,一东一西,恰好撞在了同一节点。

三天之后,开源 AI 编程平台 OpenCode 发布消息:DeepSeek V4 Flash 在其平台上单日处理量突破 8 万亿 Token,其中 5 万亿来自免费试用额度,3 万亿是开发者实际付费调用。紧随其后,OpenRouter 上周数据将其推至周调用榜首,7.22 万亿 Token。

"DeepSeek 成为AI大模型的斩杀线"这一话题,迅速登上热搜。百度两条相关词条同时上榜,一条追问"斩杀线",一条追问"斩杀线究竟斩的是什么"。同一个疑问被反复提出,说明围观者的关注相当认真:这个数字究竟代表什么?这条线,又是如何被划定的?

8万亿Token是什么概念,一个超出日常经验的数字

先把这一数字讲明白,它并非一个含糊的"很惊人"。8 万亿 Token 是 OpenCode 这家第三方 AI 编程平台单日跑出的量,并非 DeepSeek 全平台的总量。但即便是单一平台的量,也足以说明问题——开发者正在将真实的工作负载,从其他平台迁移过来。

简单换算一下:每个中文字符大约对应一到两个 Token,8 万亿 Token 就是数万亿汉字的处理量。这个规模,在一年前仅属于少数头部云厂商的推理集群;放到今天,它属于一个刚发布三天的模型。换算成时间更直观——若按每百万 Token 输出消耗约两分钟算力粗略估算,8 万亿 Token 意味着这三天里,全球有相当数量的开发者,将他们的代码审查、需求拆解、Bug 修复,都托付给了同一个新面孔。

增速也在印证这种迁移。OpenCode CEO Jay 在 8 月 1 日发文:V4 Flash 上线后,平台使用量单日增幅 30%,OpenCode Go 的新订阅用户也增长 30%。留意一个细节:8 万亿 Token 中,5 万亿来自免费试用额度。免费额度是深水炸弹——它让开发者零成本地将工作流迁移过来试跑,跑顺了,使用习惯便留下了。增长不是凭空出现的,是先用免费的钩子把用户勾住,再用体验让用户留下来。

OpenAI刚打完八折,DeepSeek就把价格斩到了脚踝

把账算清,就明白开发者为何愿意留下。

DeepSeek V4 Flash 的官方报价是:输入命中缓存 0.2 元/百万 Token,未命中输入 1 元/百万 Token,输出 2 元/百万 Token。2 元人民币,是输出单价。百度热搜的聚合摘要称其仅为 Claude Opus 4.8 的 1/85,严谨点讲,约略是八十分之一。而 OpenCode Go 集成的 V4 Flash,价格还可进一步压低至官方 API 的约六分之一。

OpenAI 已将 GPT-5.6 Luna 的价格砍掉 80%,但即便如此,第一财经的测算表明,V4 Flash 在自有 API 上的单任务成本仍比 Luna 低约 60%。换言之,OpenAI 祭出史无前例的八折,折扣之后,对手依旧比它便宜一半以上。

价格战的打法已然改变。过去是"我比你便宜一点",现在是"我比你便宜一个数量级"。最具戏剧性的场景出现在评论区:OpenAI 核心产品与平台负责人 Tibo 亲自下场,在 DeepSeek 相关讨论的评论区为 Luna 拉客,开发者并不买账,回复整齐划一——"我们想要 DeepSeek 的价格"。这一幕被截图广泛传播,成为这场价格战最生动的注解:连对方的高管都不得不承认,这已非营销所能应对,而是价格锚点本身被彻底拔除。

便宜的底气,藏在98%的缓存折扣里

低价从来不是喊出来的,是算出来的。DeepSeek 敢把输出价定为 2 元,底气藏在缓存策略之中。

V4 Flash 提供约 98% 的缓存命中折扣:命中缓存的 Token,仅按标价的 2% 计费。行业普遍的折扣水平在 90% 左右,DeepSeek 直接将这一档位压至 98%。这一差距意味着什么?对于 Agent 场景——模型反复调用同一段上下文、同一套工具定义、同一份代码库——缓存命中率天然较高,大部分 Token 都按 2% 计价,成本被压缩至近乎可忽略。缓存折扣是为高频场景准备的,而 Agent 恰恰是最高频的场景。

技术底子也撑得起这一价格。V4 Flash 采用 MoE 架构,总参数规模 284B,但每次仅激活 13B 参数;支持最长 100 万 Token 上下文;非思考与思考模式可自由切换。13B 的激活规模,意味着每次调用要消耗的算力,都远小于那些动辄数百亿激活参数的大模型——成本低,速度也快。

而 Agent 市场,恰恰是对"快"和"便宜"最敏感的领域。AIBase 的分析指出,DeepSeek 的战略意图,就是用高性价比的轻量模型切入 Agent 应用市场。推理价格降一个数量级,Agent 的商业模式就多出一个数量级的想象空间——过去跑不起的循环调用、批量处理、自主迭代,如今都跑得起了。价格不只是价格,它是打开应用场景的那把钥匙。

130亿激活参数,凭什么追平万亿级对手

便宜之外,性能并未被牺牲,这是"斩杀线"真正立住的关键。

在 Artificial Analysis 智能指数中,V4 Flash 拿到 50 分,仅比 GPT-5.6 Luna 的 51 分低 1 分。编程领域,0731 正式版之后,V4 Flash 的能力已超越 GLM-5.2,接近 Opus 4.8,与 Luna 互有胜负;Terminal Bench 2.1 上取得 82.7 分,Cybergym 76.7 分,Toolathlon verified 70.3 分。

注意其激活参数仅 130 亿。对比自家旗舰 V4-Pro 激活 490 亿参数,两者相差数倍——用约四分之一的激活参数,打出接近旗舰的表现,这背后是工程效率,而非堆料。更为关键的是,正式版与预览版结构、尺寸完全一致,仅重新做了后训练。换言之,性能的提升不依赖改架构,而是把已有底座打磨至极致,迭代速度快到令人咋舌。

配套动作同样值得玩味。DeepSeek 自研的 Agent 框架 Harness 首次以正式命名亮相;V4 Flash 原生支持 OpenAI 力推的 Responses API 格式,并针对性适配了 Codex。翻译过来就是:DeepSeek 不只卖模型,还在铺设 Agent 时代的基础设施接口。它要的不只是让你用它的模型,而是让它的模型嵌入你未来的开发流程。

斩杀线斩掉的,是旧时代的定价规则

"斩杀线"本是网络流行语,据快科技溯源,最早由网友用来形容"AI 大模型中的斩杀线"——谁定价贵过这条线,谁就在开发者市场出局。它没有明确的发明者,却精准刻画了一种情绪:行业的价格锚点,一夜之间被重置。

这条线划定之后,最先被迫调整的是巨头。第一财经的分析说得直白:中国开源模型快速迭代,模型差距持续缩小,美国头部模型也不得不重新考量性价比。OpenAI 选在 DeepSeek 上线的同一天宣布降价 80%,很难说是巧合。而距 DeepSeek 完成超 500 亿元首轮融资尚不足两个月,报道称其估值已攀升至约 710 亿美元——资本市场的资金,也在用脚投票。

被这条线波及的,还有追赶者。7 月底到 8 月初,印度、韩国接连发布新一代大模型:印度 169PI 推出 320 亿参数的轻量模型 Alpie,被开发者拆解后发现基于 DeepSeek-R1-Distill-Qwen-32B 蒸馏改造;Sarvam AI 推出 105B 参数的 Sarvam-105B;韩国 SK 电讯发布 6880 亿参数的 A.X K2,LG 上线 7500 亿参数的 K-EXAONE 2.0。厂商口径中,它们在数学推理(AIME 97.1 分)、韩语专项基准(KMMLU-Pro 80.5 分)上优于 DeepSeek V4 Flash,但游民星空的报道指出,通用能力并未实现全面超越——这些数据大多源自厂商自测,仍需第三方独立复核。

游民星空的评论点破了一层现实:印度轻量化模型直接复用 DeepSeek 基座的行为,侧面印证中国开源 AI 体系正在向外形成技术溢出。斩杀线划下的,不只是价格,还有开源生态的扩散半径——当你的模型成为别人的底座,你的生态就长进了别人的产品里。

也有媒体在预告更狠的下一刀:快科技评论称,V4 Flash 只是 284B 参数的"小模型",真正的大杀器是传闻中的 V4 Pro——1.6 万亿参数加持 Harness 工具,官方尚未正式公告,但光是传闻,已让行业神经紧绷。若 V4 Pro 正式版也有 Flash 这般幅度的提升,美国大模型还能保持性能优势的,恐怕就只剩 Fable 这种级别的选手了。

斩杀线斩掉的,是旧时代的定价规则;而新的赛道上,跑着的不只是 DeepSeek 一家。价格只是入场券,性能是站上台的资格,生态才是决定能跑多远的关键。这场游戏的下一局,可能比这一局更精彩——而这一回,规则的制定权,握在了写代码的人手中。

— END —

点击下方赞👍和推荐❤️,分享给更多的人