标签

微信小微背后的AI大模型WeLM详解

发布时间:2026-08-13 00:39阅读:3

近期,微信开启了原生 AI 助手“小微”的灰度测试。

不同于元宝等独立 AI 应用,小微直接集成于微信内部。用户仅需通过文字或语音指令告知需求,它便能调用微信内的功能与服务来达成目标。

用户可从微信首页左上角的入口进入。从产品形态上看,小微并非传统聊天机器人,而更像是一个嵌入微信生态的消费级智能体。

小微之所以能实现这些功能,背后隐藏着一个鲜为人知的名字:WeLM。

昨日,微信官方低调介绍了 WeLM。

WeLM 是微信 AI 团队长期深耕的大语言模型。

其实这个名字并不陌生。早在 2022 年,微信 AI 团队便推出了 WeLM,那是一个拥有 10B 参数的中文预训练模型。

研究论文指出,该模型在 18 项中文任务中表现优异,甚至在某些任务上超越了参数量更大的模型。

而如今支撑小微的 WeLM,已历经多轮迭代升级。

目前,微信 AI 团队已将 WeLM 迁移至稀疏 MoE(混合专家)架构。

资料显示,WeLM-80B 总参数为 800 亿,但激活参数仅约 30 亿;该模型在 14 万亿 tokens 数据上训练,支持推理、多语言理解及 128K 上下文能力。

80B 代表总参数量,3B 则是单次推理时的实际计算规模。MoE 架构允许模型保留大容量参数,仅激活部分专家,从而降低计算开销。

对于拥有海量用户和请求的微信而言,这种设计至关重要。

微信需要的是能支撑数亿用户高频调用的 AI 基础设施,而非偶尔使用的大模型。每一次回答的计算节省,都能转化为巨大的成本差异。

微信 AI 团队并未止步于 80B。WeLM 现已拥有 617B 参数版本。

WeLM-617B 总参数高达 6170 亿,激活参数为 230 亿,同样基于 MoE 架构。

据此前论文披露,微信团队未单纯堆砌参数,而是探索了新的 Scaling 方法——Hidden Decoding。

简单来说,传统 Scaling 通常是通过扩大模型规模或延长回答前的“思考”时间。

Hidden Decoding 则另辟蹊径:保持模型主体不变,让每个 token 在内部进行更多计算。

团队将序列中的 token 扩展为多个 stream,利用隐藏计算增强推理,无需增加 Transformer 的层数或宽度。

为控制成本,团队设计了 Stream-Factorized Attention,将 Attention 开销从平方级降至近似线性增长。

这些技术路径无疑非常适合微信庞大的用户生态。

小微与 WeLM 的结合让人深思:微信或许无需开发超级 AI App,而是直接将 AI 转化为微信自身的操作层。