大模型热潮下的冷思考:数据才是AI竞争的真正胜负手
过去两年,AI领域几乎所有的聚光灯都打在了大模型身上。参数规模、上下文窗口、推理性能、多模态支持——这些关键词占据了各类科技头条。资本与舆论形成了一种近乎笃定的判断:算法突破叠加算力堆积就能产生智能涌现。
然而,如果你是真正在一线推进AI应用落地的实践者,会发现一个令人警觉的现象:同样的开源模型架构,有人训练出来是"学霸",有人训练出来是"学渣"。参数规模相同,GPU配置相同,唯一的差异就在于输入的训练数据。
我想表达的观点或许不够讨好,但值得深入思考:在AI的"三驾马车"(算法、算力、数据)之中,算法正在走向同质化,算力正触及物理极限,唯有数据才是未来十年最宽阔、最深厚的竞争壁垒。
"
算法与算力的红利期正在消退
先谈算法。Transformer架构仍是主流,但各头部模型之间的差距正在明显收窄。MoE、RLHF、CoT……这些技术术语很快就不再是独家秘籍,而是公开的"操作手册"。在LMSYS Chatbot Arena排行榜上,前10名模型的评分差距已压缩至3%以内。如今一家初创企业借助开源的Llama或Qwen,采用相近的训练流程,就能复现出接近GPT-4的能力水平。
这意味着什么?算法带来的技术红利正在被快速拉平。当所有人都能使用相同的架构、相同的策略训练模型时,真正的分水岭就不再是"如何训练",而是"用什么训练"。
再看算力。算力确实是硬性门槛,但它的边际收益正在逐步递减,因为芯片制程逼近1纳米,能耗与散热问题日益突出。更关键的是,多项研究结果表明,即使堆叠再多的GPU,也无法根除模型的"幻觉"、"偏见"、"逻辑断层"——这本质上是数据问题,而非算力问题。
"
模型供应商着急,企业用户更着急
算法趋同、算力见顶,那数据呢?数据的状况更加令人担忧,且呈现出两个层面的严峻挑战。
第一个层面,是模型供应商的困境:公开的高质量数据正在枯竭。
约60%用于训练GPT-3的token来自Common Crawl等公共爬虫数据集,"唾手可得的果实"已被采摘殆尽。马斯克公开表示"人工智能已经耗尽了所有人类产生的数据来训练自己,如今不得不依赖容易产生幻觉的合成数据",OpenAI联合创始人苏茨克维也承认,人工智能已触及"数据峰值"。合成数据正成为补充路径,但它本身仍需要高质量真实数据作为种子和验证基准——这不是绕过了数据问题,只是换了一种形式面对它。
第二个层面,是企业用户的困境:内部数据根本没有做好准备。
这是更触目惊心的现实。麦肯锡2025年的一份调研显示,全球仅有6%的企业真正将AI用出了高绩效。MIT的追踪报告更为扎心:95%的生成式AI项目至今未产生可衡量的财务回报。Gartner预测,在缺乏AI就绪数据体系支撑的AI项目中,约60%将被废弃。
为何企业内部数据如此不堪?
原因并不复杂:数据分散在各个"烟囱系统"中,财务、人力、销售彼此隔离;数据格式杂乱,同一个"客户状态"字段在不同系统里含义各异;更棘手的是,许多老旧系统根本没有API,有API的也无法互通。SAP执行董事会成员曾公开将AI与旧ERP的组合形容为"弗兰肯斯坦式的架构怪物"——过去二三十年建设的信息化系统架构,跟大模型所需的技术架构根本不匹配。
某金融公司斥巨资打造"业务分析师Agent",因内部数据质量差、指标定义混乱,Agent输出错误结论,最终无法投入使用。这不是个例,而是普遍现象。
"
数据资产成为企业真正的竞争壁垒
前面这些架构趋同也好、算力边际递减也罢,再棘手也还是工程范畴内能看到解法的事,但下面这个就是商业层面的硬仗了。
数据标注公司Scale AI的故事,最能说明市场用真金白银投票的方向。2024年,它完成10亿美元融资,估值达138亿美元。次年Meta以143亿美元收购其49%股份,估值推高至290亿美元。这家公司的核心业务是什么?数据标注——一个几年前还被视为产业链最底层的脏活累活,如今倒成了战略级核心资产。
但Scale AI代表的是通用数据服务,更值得关注的是垂直领域里的场景数据壁垒。通用模型在医疗、法律、金融这些专业场景中,经常表现得非常"水土不服",因为这些领域的核心知识、判断规则、推理模式,藏在私有业务系统、专业文档、专家经验和长期反馈数据里,是不会公开在网页上的。谁能在垂直领域率先把高密度、高动态的场景数据积累起来,谁就建立了对手很难逾越的壁垒。
医疗领域。某三甲医院基于自有的临床数据训练的辅助诊断模型,在特定病种上的准确率超过通用大模型——不是因为算法更优,而是因为训练数据包含了该院数十年积累的病例特征、用药习惯和疗效反馈,这些信息是公开数据里找不到的。
金融领域。某金融机构的风控Agent,因内部积累了多年的交易特征和欺诈模式数据,对新型欺诈行为的识别速度远超行业平均水平,因为每一次真实交易都在为模型贡献新的训练样本。
再来看一个更具体的例子:B2B营销和供应链领域。大量企业面临一个经典困境:有好产品,找不到买家。展会、扫楼、电销的效率低得可怜。这个问题的本质不是缺算法,而是缺一张能说清楚"谁在供应什么、谁需要什么、上下游怎么连"的数据网络。
国内人工智能服务商探迹科技从这个最底层的数据问题切入,花了数年时间,构建了一个覆盖20亿商品数据、40万亿产品关系对的底层数据集,在此基础上形成了产业链知识图谱。这张图谱的壁垒不在于"数据量大",而在于三件事很难同时做到:数据的持续更新能力、跨行业的数据关联挖掘、将非结构化商业信息变成结构化知识。这三件事的共同特征是"慢、重、需要行业积累"——模型厂商不愿做,互联网巨头来不及做。恰恰因为慢、因为重,它才成为真正的竞争壁垒。
类似的现象在其他行业也在发生。中国移动已经构建了226个通用数据集和151个行业数据集。云从科技提出"行业AI理解力"的概念,认为核心竞争力就在于沉淀高质量行业数据集。
当通用模型的能力逐渐趋同时,谁先完成了特定场景的数据资产积累,谁就能占据不可逆的先发优势。模型可以更换,算力可以租用,但企业独有的数据资产是搬不走的——而且治理得越好,复用效率越高。
"
四个正在发生的趋势
基于以上分析,几个清晰的判断已经浮现。
第一,数据质量工程化。企业会建立系统化的数据标注、清洗、合成、评估、治理体系。数据团队的规模和能力,直接决定模型迭代速度。
第二,数据飞轮成为标配。每个成功的AI应用都会内置一个闭环:用户使用产生数据,数据优化模型,模型提升体验,体验吸引更多用户。数据不是静态的资产,而是动态增长的引擎。
第三,数据合规和安全成本会持续上升。国内外AI法规陆续落地,数据的合法性、隐私保护、偏见检测,不再是"加分项",而是"入场券"。企业今天不把合规体系建好,未来面临的不只是技术债,还有法律债。
第四,"小数据+强对齐"会成为差异化路线。不是所有场景都需要万亿token。在有些细分任务里,几千条高质量指令的数据,加上精心设计的对齐策略,效果远好于大而全的模型。某医疗团队用5000条专家标注的数据训练出的专科诊断模型,在特定病种上的表现超过了通用大模型——数据质量,不是数据量,才是决定性变量。对中小企业而言,这是一条更现实的差异化路径,但这条路同样要求数据质量足够高。
"
结语
Scale AI创始人曾经表达过的一个观点:很多人以为AI的核心是算法,但其实算法只是食谱,数据才是食材。没有好的食材,最顶级的厨师也做不出好菜。
大模型确实是了不起的工程成就,但别忘了,所有智能,都源于数据。数据定义了模型看到的世界,也限定了它可能的认知边界。
下一个十年,AI竞争的终局不是"谁拥有最强的模型",而是"谁拥有最不可替代的数据",是时候把目光从聚光灯下移开,投向那沉默但无处不在的基石了。