DeepSeek再现重磅迭代 业界重温2025年春日盛景
7月31日下午,DeepSeek在API文档更新记录中不声不响地披露了一条消息:V4-Flash正式版(亦称V4-Flash-0731)正式开启公测。
紧接着,开发者社区出现了一个令人意外的境况——V4-Flash正式版的总参数与激活参数相较此前预览版并未做出任何调整,但其在代码生成和智能体方面的表现,却以"飞跃式"的姿态跻身全球顶尖模型行列。
自2026年起,主流开源模型的角逐步入了"万亿参数时代"。更大规模的算力集群自然而然地再次成为模型能力跃升的核心要素。
然而此次,DeepSeek似乎再一次颠覆了这一思维定势——恰似2025年春季的场景再现。
自从"GPT时刻"降临以来,"算力等于智力"的规模法则(Scaling Law)一直为硅谷及全球资本市场所推崇。
直至2024年底DeepSeek V3面世、2025年1月R1推出——前者凭借不足600万美元的训练投入便与GPT-4o比肩而立,后者借助纯强化学习路径追近OpenAI o1。"规模法则"首次面临直接挑战,英伟达单日市值蒸发约5000亿美元,"DeepSeek时刻"由此载入史册。
不过,"DeepSeek时刻"并未画上各家模型企业参数比拼的休止符。
迈入2026年后,"规模法则"再度回归:4月份,DeepSeek V4-Pro预览版以1.6万亿的总参数量、490亿激活参数量强势开局;7月阿里Qwen 3.8-Max预览版将总参数拉升至2.4万亿;同月,月之暗面旗下Kimi K3以2.8万亿的参数规模登顶全球开源模型规模之巅。
"大力出奇迹"重新成为行业主旋律——直至7月31日DeepSeek V4-Flash-0731正式上线,盲目堆砌参数的思维惯性才得以暂缓。
依据DeepSeek官方公布的数据,V4-Flash正式版在九项智能体与代码基准测评中的得分,无一例外地超越了自家总参数1.6万亿、激活参数490亿的V4-Pro预览版。
其中在九项基准里的"DeepSWE"测试中,V4-Flash正式版与Pro预览版的差距高达41.6分;而在"ALE"基准上,V4-Flash正式版甚至与全球顶级水平的Claude Opus 4.8仅有半分之遥。
这意味着,V4-Flash正式版仅动用Pro预览版六分之一的总参数以及不到四分之一的激活参数,便实现了对Pro预览版的大幅赶超。
若仅将目光聚焦于V4-Flash正式版与Pro预览版的对比之上,似乎可以轻松得出这样的判断:"规模法则"在此处已然失效。
当然,没有人真正认为"规模法则"已彻底失效。在版本更新说明里,DeepSeek明确指出,V4-Flash正式版基准测评采用了自主研发的、类似于"Codex"的工具——DeepSeek Harness极简模式进行跑分。叠加此次DeepSeek重新构建了后训练流程,强化了智能体与工具调用方向的专家训练强度,多项AI工程革新的协同发力,才使DeepSeek又一次成为超越算力范畴的"X因素"。
然而,V4-Flash正式版同样存在局限。
据21世纪经济报道记者观察,一些海外开发者社区的用户反馈称,V4-Flash正式版的输入缓存命中率较低、安全分类器频繁出现超时,这一现象在某种程度上折射出算力与参数储备的欠缺依旧会制约模型能力的上限。
在全球资本市场层面,V4-Flash正式版上线后,英伟达、博通、AMD等企业在7月31日的股价并未出现明显异常波动。市场已对DeepSeek创新引发的冲击习以为常,亦不把AI工程技术的演进视作算力需求的负面信号。
"规模法则距上限尚远,国内模型规模受限根源在于算力短缺,并非规律本身失效。"DeepSeek创始人梁文锋此前在一份广泛流传的融资会议纪要中如此阐述。但他同样强调,规模已不再是唯一的发力点,思维链与智能体将成为下一阶段的杠杆。
摩根大通此前亦曾分析,DeepSeek强化了"算力供给扩张、价格管控、结构性成本曲线下移"三大支柱,对整个行业而言是顺风助力,而非零和博弈。
不过,全球竞相追逐顶尖模型的浪潮,实际上已在不知不觉中发生变化。
近日,来自全球多家媒体的报道显示,部分欧美企业已开始将中国的大模型整合至工作流之中,并借助其处理绝大多数常规任务。仅在面对最为复杂的任务时,这些公司才会选择调用Anthropic Claude Fable等顶级模型。
上述变化无疑同中国模型较低的使用成本密切相关。另一方面,美国模型使用权限的不确定性,也迫使非美地区客户不得不部署备选方案。
一些券商的观点则更值得细细品味。
天风证券(3.740, 0.02, 0.54%)(维权)计算机领域的缪欣君团队在V4-Flash正式版问世当日,便以"大超预期"为其定性,指出其综合表现已逼近Opus 4.8、智能体代码能力与GPT-5.6 Luna相差无几,再次重申对下半年国产模型产业链的看好,认为尤其是"增速30%+、具备扎实基本面"的软件企业将率先获益于AI催生的新增需求。
这一判断的独特之处在于,此前市场普遍预期AI模型的持续演进会对"软件即服务"类公司构成利空。但如今,DeepSeek的性价比已足以让软件企业自身使用并提升效率,更多曾因Token费用过高而对AI望而却步的软件公司有望开发出更具性价比的AI互联网产品,过去难以兑现的AI智能体使用需求也将逐步落地。
就在数周之前,当Kimi K3将参数规模推至2.8万亿时,业界领军者普遍笃信,即便中国模型也须遵循"更大等于更强"的规律,踏上"大激活配高知识容量"的发展路径。
V4-Flash正式版的横空出世则再一次印证,AI的演进不仅需要大投入造就的飞跃,更离不开精雕细琢的慢功夫。
从定价层面审视,本次V4-Flash正式版的输入(缓存未命中)、输入(缓存命中)、输出每百万Token的报价分别为0.14美元、0.0028美元与0.28美元,与在"ALE"基准上仅相差半分的Claude Opus 4.8相比,三项价格依次为后者的36倍、179倍和89倍。
"梁文锋仿佛站在了行业内所有模型厂商的对立面。"一位专注于AI初创企业孵化的从业者向记者坦言。DeepSeek系列模型长期在性价比之巅占据稳固位置,倒逼同行必须拿出性能超越DeepSeek的产品才能立足。
类似的论调在V4-Flash正式版上线以来的AI开发者社群中层出不穷。
"梁文锋掌舵的DeepSeek犹如一台永不停歇的收割机。"一些略带激进色彩的言论指出,"所有AI大模型企业都在追赶梁文锋的步伐,无论采用何种策略,唯有超越DeepSeek方能存活。"