标签

从算力到记忆:Kimi K3如何重新定义大模型的未来

发布时间:2026-07-21 02:28阅读:3

在很多人看来,大模型能力的提升主要得益于硬件性能的增强。

但实际上,当前制约AI发展的核心因素,已经从计算能力转移到了存储机制。

如果说过去几年AI竞争的重心是"算力",那么从2026年起,行业正在迈入一个全新的阶段:

Memory First(记忆优先)时代。

而Kimi K3的架构突破,正是这一趋势最具代表性的案例。

让我们先看一个思想实验。

老师给每位学生一本包含100万页的教材。

每当被问到问题时,学生都必须从头到尾翻阅整本书来寻找答案。

效率如何?答案显而易见。

传统Transformer的工作方式正是如此。

每当生成一个新的Token,都需要反复回溯之前的所有内容。

为了解决这个问题,AI会维护一份称为KV Cache的"工作记录"。

上下文越丰富,这份记录就越冗长。

当上下文达到几十万Token时,GPU的大部分时间并非用于推理计算,而是在不断翻阅这份记录。

因此,当前大模型最昂贵的成本并非计算本身,而是:

传输这些记录的开销。

去年,DeepSeek提出了一个精妙的方案——MLA(Multi-head Latent Attention)。

其核心思想类似于:

学生不再携带完整教材,

而是在阅读每一章节后,

提炼出一页高质量的摘要。

需要时,根据摘要还原详细内容。

这样一来:

原本需要保存100本教材的空间,

现在可能只需要保存10本摘要。

本质上,

MLA并没有改变学生的学习模式,

只是大幅减轻了书包重量。

公开数据显示,MLA能够将KV Cache压缩约90%,同时仍保持Full Attention的表达能力。

而Kimi K3则更进了一步。

它引入了:

KDA(Kimi Delta Attention)

这代表了近年来备受关注的技术方向:

Linear Attention(线性注意力)。

这里最关键的改变不是压缩,

而是:

彻底放弃存储。

继续用学生做比喻。

过去:

学生始终保留完整的笔记。

现在:

学生的大脑中只保留几个最关键的结论。

比如:

牛顿第二定律

勾股定理

重大历史事件时间线

至于已经理解透彻的推导过程,

可以直接忽略。

因为在真正需要时,

可以重新推导。

因此KDA不再维护持续膨胀的KV Cache,

而是仅维护一个持续更新的小型Memory State。

无论阅读一千页,

还是一百万页,

这个"脑容量"基本保持不变。

这正是Linear Attention的核心优势。

更有意义的是:

KDA并非简单地记忆,

而是掌握了:

选择性遗忘。

回想一下人类的记忆模式。

昨天午饭吃了什么?

相信很多人已经记不清了。

但小时候第一次骑自行车的经历,

很多人二十年后依然历历在目。

原因在于:

关键信息,

会被长期保留。

琐碎信息,

很快被遗忘。

KDA的实现机制与此非常相似。

过去:

一个Head内的所有信息,

采用统一的遗忘策略。

现在:

KDA为每个Channel配置了独立的"遗忘速率"。

某些信息,

会被永久保存。

某些信息,

几秒钟后就会被覆盖。

就像一位尽职的图书馆管理员,

每天都会整理书架。

但并非一次性清空,

而是:

经典著作永久珍藏。

过期期刊及时回收。

在有限的空间内,

容纳更多真正有价值的信息。

很多人可能会疑惑:

既然Linear Attention更节省资源,

为何不全面采用?

答案其实很简单。

人类的记忆实际上分为两种类型。

第一种:

日常琐事。

第二种:

跨时空的联想能力。

例如:

多年之后,

看到一张老照片,

突然唤起对整个大学时光的回忆。

Transformer的Full Attention,

特别擅长处理这种:

全局关联能力。

而纯Linear Attention,

虽然效率很高,

但在长距离关联、少样本学习(Few-shot)、上下文学习(In-context Learning)等方面,通常仍略逊于Full Attention。

因此Kimi K3没有采取极端方案。

它采用了一种混合架构:

3层KDA + 1层MLA。

大部分时间,

AI以高效模式运行。

每隔若干层,

进行一次全局梳理。

这就像:

日常工作保持整洁,

每月进行一次深度清洁。

既保证效率,

又不会丢失整体框架。

很多人认为,

Attention的创新仅仅是算法层面的改进。

但实际上,影响最深远的,

可能是底层硬件。

过去几年,

GPU一直在追求:

TFLOPS(每秒浮点运算能力)。

但越来越多的工程师发现:

GPU实际上有大量时间并未用于计算。

而是在:

等待数据从HBM(高带宽显存)传输过来。

这就好像:

一位全球最快的厨师,

一直守在灶台前。

并非不会做菜,

而是在等待服务员送来食材。

因此,如今GPU最大的瓶颈,

更像是:

物流配送,

而非烹饪技术。

而KDA、MLA这类架构创新,本质上就是减少需要频繁传输的数据量,让GPU将更多时间投入真正的计算,而非等待内存访问。

如果将Attention的发展历程绘制成一条进化路径,大致可以理解为:

Transformer:每个人都随身携带完整资料。

GQA / MQA:开始共享资料。

MLA:将资料压缩为精简摘要。

KDA:不再保存资料,仅保留持续更新的长期记忆。

Kimi K3:融合两种方案,需要精确检索时查阅摘要,需要快速思考时依赖长期记忆。

过去十年,AI行业一直在追求:

让GPU算得更快。

而Kimi K3所代表的方向向我们揭示:

下一代AI更需要解决的问题可能是:

如何让AI减少数据传输,增加深度思考。

这与人类学习的过程极为相似。

真正智慧的人,

不是机械地记住所有知识。

而是懂得:

什么值得铭记,什么应该放下。

或许,这才是下一代大模型真正开始"像人一样思考"的关键转折点。