从算力到记忆:Kimi K3如何重新定义大模型的未来
在很多人看来,大模型能力的提升主要得益于硬件性能的增强。
但实际上,当前制约AI发展的核心因素,已经从计算能力转移到了存储机制。
如果说过去几年AI竞争的重心是"算力",那么从2026年起,行业正在迈入一个全新的阶段:
Memory First(记忆优先)时代。
而Kimi K3的架构突破,正是这一趋势最具代表性的案例。
让我们先看一个思想实验。
老师给每位学生一本包含100万页的教材。
每当被问到问题时,学生都必须从头到尾翻阅整本书来寻找答案。
效率如何?答案显而易见。
传统Transformer的工作方式正是如此。
每当生成一个新的Token,都需要反复回溯之前的所有内容。
为了解决这个问题,AI会维护一份称为KV Cache的"工作记录"。
上下文越丰富,这份记录就越冗长。
当上下文达到几十万Token时,GPU的大部分时间并非用于推理计算,而是在不断翻阅这份记录。
因此,当前大模型最昂贵的成本并非计算本身,而是:
传输这些记录的开销。
去年,DeepSeek提出了一个精妙的方案——MLA(Multi-head Latent Attention)。
其核心思想类似于:
学生不再携带完整教材,
而是在阅读每一章节后,
提炼出一页高质量的摘要。
需要时,根据摘要还原详细内容。
这样一来:
原本需要保存100本教材的空间,
现在可能只需要保存10本摘要。
本质上,
MLA并没有改变学生的学习模式,
只是大幅减轻了书包重量。
公开数据显示,MLA能够将KV Cache压缩约90%,同时仍保持Full Attention的表达能力。
而Kimi K3则更进了一步。
它引入了:
KDA(Kimi Delta Attention)
这代表了近年来备受关注的技术方向:
Linear Attention(线性注意力)。
这里最关键的改变不是压缩,
而是:
彻底放弃存储。
继续用学生做比喻。
过去:
学生始终保留完整的笔记。
现在:
学生的大脑中只保留几个最关键的结论。
比如:
牛顿第二定律
勾股定理
重大历史事件时间线
至于已经理解透彻的推导过程,
可以直接忽略。
因为在真正需要时,
可以重新推导。
因此KDA不再维护持续膨胀的KV Cache,
而是仅维护一个持续更新的小型Memory State。
无论阅读一千页,
还是一百万页,
这个"脑容量"基本保持不变。
这正是Linear Attention的核心优势。
更有意义的是:
KDA并非简单地记忆,
而是掌握了:
选择性遗忘。
回想一下人类的记忆模式。
昨天午饭吃了什么?
相信很多人已经记不清了。
但小时候第一次骑自行车的经历,
很多人二十年后依然历历在目。
原因在于:
关键信息,
会被长期保留。
琐碎信息,
很快被遗忘。
KDA的实现机制与此非常相似。
过去:
一个Head内的所有信息,
采用统一的遗忘策略。
现在:
KDA为每个Channel配置了独立的"遗忘速率"。
某些信息,
会被永久保存。
某些信息,
几秒钟后就会被覆盖。
就像一位尽职的图书馆管理员,
每天都会整理书架。
但并非一次性清空,
而是:
经典著作永久珍藏。
过期期刊及时回收。
在有限的空间内,
容纳更多真正有价值的信息。
很多人可能会疑惑:
既然Linear Attention更节省资源,
为何不全面采用?
答案其实很简单。
人类的记忆实际上分为两种类型。
第一种:
日常琐事。
第二种:
跨时空的联想能力。
例如:
多年之后,
看到一张老照片,
突然唤起对整个大学时光的回忆。
Transformer的Full Attention,
特别擅长处理这种:
全局关联能力。
而纯Linear Attention,
虽然效率很高,
但在长距离关联、少样本学习(Few-shot)、上下文学习(In-context Learning)等方面,通常仍略逊于Full Attention。
因此Kimi K3没有采取极端方案。
它采用了一种混合架构:
3层KDA + 1层MLA。
大部分时间,
AI以高效模式运行。
每隔若干层,
进行一次全局梳理。
这就像:
日常工作保持整洁,
每月进行一次深度清洁。
既保证效率,
又不会丢失整体框架。
很多人认为,
Attention的创新仅仅是算法层面的改进。
但实际上,影响最深远的,
可能是底层硬件。
过去几年,
GPU一直在追求:
TFLOPS(每秒浮点运算能力)。
但越来越多的工程师发现:
GPU实际上有大量时间并未用于计算。
而是在:
等待数据从HBM(高带宽显存)传输过来。
这就好像:
一位全球最快的厨师,
一直守在灶台前。
并非不会做菜,
而是在等待服务员送来食材。
因此,如今GPU最大的瓶颈,
更像是:
物流配送,
而非烹饪技术。
而KDA、MLA这类架构创新,本质上就是减少需要频繁传输的数据量,让GPU将更多时间投入真正的计算,而非等待内存访问。
如果将Attention的发展历程绘制成一条进化路径,大致可以理解为:
Transformer:每个人都随身携带完整资料。
↓
GQA / MQA:开始共享资料。
↓
MLA:将资料压缩为精简摘要。
↓
KDA:不再保存资料,仅保留持续更新的长期记忆。
↓
Kimi K3:融合两种方案,需要精确检索时查阅摘要,需要快速思考时依赖长期记忆。
过去十年,AI行业一直在追求:
让GPU算得更快。
而Kimi K3所代表的方向向我们揭示:
下一代AI更需要解决的问题可能是:
如何让AI减少数据传输,增加深度思考。
这与人类学习的过程极为相似。
真正智慧的人,
不是机械地记住所有知识。
而是懂得:
什么值得铭记,什么应该放下。
或许,这才是下一代大模型真正开始"像人一样思考"的关键转折点。