标签

AI时代:普通人如何理解AI运作原理与核心常识

发布时间:2026-08-10 04:20阅读:2

最近,关于字节跳动禁止内部蒸馏开源模型的新闻引发了热议。那么,字节为何要封禁内部蒸馏开源模型呢?我们用大白话来解读:首先,什么是“蒸馏”?为什么叫“蒸馏”而不是“模仿”?

蒸馏,即知识蒸馏,是Hinton在2015年提出的一个概念,借用化学蒸馏的比喻,与普通的“模仿”有着本质区别。化学蒸馏:混合原料加热,提取精华成分并冷凝,丢弃杂质,得到浓缩物,而非复制整个桶的原料。对应AI蒸馏:大模型(教师)中包含海量冗余信息。我们不复制整个大模型,而是提取其核心认知、判断倾向和概率分布,迁移给小模型(学生)。小模型的参数量远小于教师,仅保留精华知识。模型蒸馏就像大老师教小学生抄作业。大模型是“大老师”,能力很强、体型庞大、训练成本数亿、参数量达千亿,推理速度慢且昂贵。小模型是“小学生”,体积小、速度快、成本低,但无法自学复杂知识。蒸馏意味着不向小模型提供原始训练数据集,而是直接使用大模型的输出回答作为“课本”来训练小模型。小模型不查看海量原始互联网书籍,只模仿大老师的说话、思考和输出风格。小模型最终表现出与“大老师”高度相似的说话风格和答案,但它并非从头学习世界知识,只是学会了模仿大模型的输出套路。举个例子:老师花几年时间博览群书、刷题思考(大模型的原始预训练)。而蒸馏相当于你不读书或刷题,只是疯狂抄下这个老师的所有标准答案并背诵答题套路。考试成绩看起来不错,但你没有自己的底层知识体系。遇到老师从未见过的新问题时,很容易胡说八道。而正规的预训练是喂给模型海量真实的原始数据,让模型自己归纳世界规律。蒸馏则是使用另一个大模型生成的答案作为训练素材进行模仿输出。API是程序接口,简单来说,它是程序之间相互提问的通道。例如,调用豆包API意味着你的程序向豆包服务器发送问题,豆包将回答返回给你的程序。而API检测是字节内部的监控手段,内部写代码或做实验的员工不得批量疯狂调用自家大模型API,抓取大量模型返回的回答用于训练另一个新模型。系统后台会实时监控。监控输出文本是否被导出用于作为训练集?一旦识别你在做“蒸馏”,系统会限流、告警或拦截,阻止你将大量API返回结果抓取出来训练新模型(监控的不是员工聊天内容,而是接口调用行为模式:大量抓取模型生成内容是蒸馏的典型特征)。字节内部的规定是:内部研发人员禁止使用自家大模型的输出来蒸馏出新模型。在技术上,API检测和拦截工具防止你轻易获取大量模型输出来进行训练。在制度上,研发规范要求开发模型不能走蒸馏这条路,不鼓励依赖蒸馏开发新模型,也不将蒸馏模型作为主要技术路线。但允许进行少量学术实验,但不允许将蒸馏作为产品模型的主要手段。这并非完全禁止在研究中触碰蒸馏技术,而是严禁将蒸馏作为开发新一代基础大模型的核心手段。

张一鸣为何认为蒸馏会阻碍真正的长期技术突破?这里需要区分几件事:第一,工程优化与底层技术突破。蒸馏并非完全无用,它有适用的场景:例如,已经拥有一个非常强的大模型,通过蒸馏将其压缩成小版本,安装在本地手机上,以追求速度和节省算力。这被称为工程优化,非常适合产品落地。但它的缺点是:1. 知识是二手的,没有新增认知。也就是说,蒸馏小模型学到的所有东西都来自原始大模型。大模型懂什么,它才懂什么。原始大模型犯的错误,蒸馏模型会原样继承,甚至错误会被放大。就像抄作业一样,你不会比写作业的人懂得更多,顶多是模仿得很像,不会产生新的认知。第二,整个行业陷入“模仿内卷”,原地踏步。如果大家都依靠蒸馏开发新模型,例如A训练一个大模型;B不啃海量原始数据艰苦预训练,直接蒸馏A,然后C再蒸馏B,这样一代代传递下去,模型只是复刻前人的能力,不会诞生超越前辈的能力。所有人都在“模仿另一个模型的输出”,没有人去攻坚原始预训练、新算法或新架构。行业看起来模型遍地开花,但底层没有实质性进步。第三,错误会层层累积。大模型本身就会产生幻觉。蒸馏将生成的文本作为训练数据,幻觉和错误会一代代放大。越往后,蒸馏出的模型产生幻觉的概率越高。张一鸣这一观点的核心是:蒸馏适合做产品优化,但不能用来做下一代基础模型。沉迷于蒸馏会逃避真正最难的原始预训练工作,扼杀底层创新。也就是说,不是说蒸馏技术本身是垃圾,而是不能将蒸馏作为创造更强基础模型的主要路径。张一鸣的意思是什么?字节想要的技术突破又是什么?简单来说,就是从头训练原生基础大模型,追求能力上的本质飞跃,而不是模仿和复刻已有模型。依靠海量真实的原始世界数据(书籍、网页、论文等),使用新的模型架构和训练算法,训练出原生基座大模型。这个模型是自己从零开始学习理解世界,而不是模仿另一个模型的回答。目标是提升模型本身的底层能力,包括更强的逻辑推理、真正的世界认知和更少的幻觉,而不是“模仿现有模型说话很像”。目标是超越现有水平的基座,而不是做一个高仿副本。那么,这很难吗?难在哪里?是的,非常难,是金钱和技术双重地狱:1. 烧钱惊人:原生预训练需要采购海量GPU显卡,一次训练成本数亿甚至数十亿。而蒸馏成本极低,几张显卡就能运行。2. 高质量原始数据很难获取:互联网上干净、高质量的原始文本越来越少。到处都是AI生成的垃圾文本。寻找海量干净、真实的原始人类数据,是全球大模型公司最头疼的头号难题。3. 算法架构创新的门槛高:蒸馏是拿来主义,原生基座需要探索新的网络架构和训练策略,大量实验会失败,试错成本极高。4. 对比:蒸馏是捷径,见效快,可以快速开发出一个看起来不错的模型,快速提交成果;原生预训练周期漫长,可能砸了很多钱,但最终效果不尽如人意。因此,许多团队有动力走蒸馏捷径:短期效果好看,省事省钱。但长期来看,行业并没有实质性进步。因此,从长期科研角度来看,拒绝将蒸馏作为基座模型的主要路线是正确的。如果全行业都沉迷于蒸馏捷径,大家都在互相抄袭,确实会出现技术内卷,所有人都在做高仿,没有人愿意啃硬骨头。然而,在现实中,蒸馏本身是一个非常实用的工程工具。大模型落地手机、边缘侧,几乎离不开蒸馏。区分场景很关键:做产品小模型可以蒸馏;做下一代基础基座,不能依赖蒸馏。字节内部限制的是后者,而不是完全废除蒸馏技术。对于企业内部工程师来说:蒸馏的短期收益太高。蒸馏可以在几个星期内开发出一个看起来效果不错的模型,可以写报告或制作Demo。而原生预训练需要几个月的时间,投入巨额算力,甚至可能失败。如果公司没有严格的限制,内部团队很容易优先选择捷径,所有人都去做蒸馏,艰苦的原生模型研发工作就没人愿意碰。从公司管理角度来看,依靠API检测加上制度堵上这条捷径,迫使团队去啃最难的活,逻辑上说得通,但这条路风险巨大,代价高昂。坚持原生基座路线意味着要持续烧巨额资金,投入巨大,不一定能换来技术突破。可能砸了很多钱,但出来的模型并没有达到预期效果。外面的许多竞争对手会利用蒸馏快速迭代并快速发布产品,短期内看起来气势如虹。字节必须忍受短期节奏慢,承受业绩和舆论压力。蒸馏不等于抄袭作弊,它的原罪不是技术本身,而是将蒸馏产物作为全新的基础大模型,对外声称是全新原生研发。一个蒸馏得到的小模型,如果老老实实承认是基于某某基座蒸馏,用于边缘侧产品,本身没有问题。问题是将二手模仿的模型包装成原生创新基座。一个现实的矛盾是,现在互联网到处都是AI生成的内容,网上已经充满了AI生成的文本。即使你做原生预训练,你在收集的原始数据中也会混入大量AI生成的内容,从而带来类似蒸馏的污染。即使禁止内部蒸馏,外部世界的数据污染依然客观存在。完全隔离模仿和复制带来的负面影响,在现实中很难实现。因此,字节这套内部策略本质上是一种权衡:牺牲短期快速出成果的捷径,强制团队走高成本、高风险但有机会带来底层真正创新的原生预训练路线。但现实挑战重重,既要承受巨额成本,又要对抗行业遍地AI生成数据的污染,还要平衡产品落地,这不是仅靠几条内部规定就能完全解决的问题。

最近,有敏锐的网友发现某图书版权页上悄然多了一行字:“禁止将本书内容用于人工智能训练。”

这是什么意思呢?其实就是禁止拿我的东西去喂你的模型。

这与字节跳动禁止内部蒸馏开源模型同属AI时代不允许拿我的东西去训练你的AI的一个道理。

简单来说,就是不允许拿这本书里的文字,当作训练AI模型的“素材(喂数据)”

所谓“喂”就是“喂数据”(行业术语),就是把大量文本丢给大模型,让它从中学习语言、知识和写作风格,这个过程圈内称为“喂数据”。

大语言模型训练会大规模抓取公开的书籍、文章和互联网网页文本。就是把书籍文字扫描/转录成电子文本,输入模型。这一步俗称喂书、喂语料。

AI读完海量文字后学会了回答和写文章。

很多时候,没有专门征得原作者或出版社的许可,就拿去训练了。

把整本书扒下来做AI训练,本身就存在版权争议。这句话相当于把态度白纸黑字印在书上,强化权利告知,未来如果AI公司盗用本书训练,打官司时这行字可以作为证据。

如果有人强行扫描录入书籍文本,技术上依然可以“喂给AI”,这句话无法通过印刷直接技术拦截,更多是法律与版权层面的警示。

其实,仅靠印刷一行文字,完全阻挡不了有组织的扫描盗录。真正解决问题,还需要完善相关立法、建立AI训练语料登记溯源机制、发展技术检测手段、搭建商业授权渠道,平衡AI技术发展和创作者版权保护。

今天,我在微博上又看到一个投票问答,问的是“词元”用英语怎么说?

那么,什么是词元呢?我们只知道词汇、词语、词组,真的不知道什么是词元。

“词元”的英文是Token。“词元”这个名词是官方给英文Token定下的一个中文名字,词元其实就是用来喂大模型的“养料”。

由词元又衍生出了一个名词叫“词元经济”。

那么,词元经济又是什么呢?

词元经济就是我们在与AI对话时,向AI提问,AI回答我们。这看似正常与AI的对话,背后其实非常烧钱。

我们与AI对话,AI其实是听不懂的,它脑子里只有一种叫“词元”的东西,这个词元它不是字,也不是词,而是模型能够理解的最小碎片。

我们问AI,AI一个字一个字蹦,整个过程都是词元在流动,流动的背后就是消耗,消耗就意味着成本。

那么我们现在用的豆包、千问、元宝都是直接使用的,不用付费,但这背后其实是有人替我们付费了。

数据中心烧着电,服务器跑着计算,每一秒都是钱。

我们使用电是按度计算,手机上网按流量计算,那么AI干活就用词元计算。

我们给AI发出一个问题,AI回答的每个字、每个符号都是一个个词元,AI处理多少词元就消耗多少算力,就是多少钱。

词元经济就是围绕“词元”这套计量单位发展出来的整套AI生意。

比如,上游建设大模型、算力服务器,就相当于“发电厂”,也就是生产词元的能力。

然后中游就是各大AI平台,把AI能力打包,按词元数量卖给企业或开发者,就像电网卖电一样。

到了下游就是企业、普通人调用AI写文案、做分析、写代码,消耗词元,那就付费使用,就像家家户户用电一样。

这就是词元经济。

以前AI服务很难算账,让AI帮我做项目,我该付多少钱?没有统一尺子。

现在不一样了,词元就是统一尺子。

用多少词元,就付多少钱。

知识、AI服务就变成可以计数、报价、交易的商品。

现在基础问答是免费的,但复杂长文本、图片、视频、高速响应、大文件解析、高级模型等,需要开通会员付费。

这样就形成了用付费会员来补贴免费用户的算力开销,也就是一部分付费用户,在间接补贴大量免费用户。

我们使用基础AI,看似没掏钱,但我们每一次的提问、纠错、对话,都产生了真实场景数据,平台在合规前提下,就用来优化模型效果,降低人工标注成本,提升产品的商业价值。我们虽然没有掏钱,但贡献了宝贵的使用数据。

那么免费AI模式可持续吗?

基础功能可以长期免费,但“全部功能永久无限免费”不可持续。

比如简单的文字对话这类基础能力,是有希望长期免费的。

硬件、算法持续进步,普通文本推理成本不断下降,边际成本越来越低;依靠会员+B端企业收入,是完全可以支撑基础免费的,就类似搜索引擎永久免费的逻辑一样。

但高消耗能力很难无限免费了。

如图片生成、AI视频、超大文件解析、深度复杂推理等,这类活计算力消耗巨大,功能要么有限额度,要么必须付费。

如果所有人无限制随便用,算力成本会直接把公司压垮。

现在的免费逻辑是:企业大客户+付费会员出钱,资本阶段性输血,普通用户贡献数据,共同承担免费用户的成本。

未来大概率是:基础聊天永久免费,重度、高级能力收费,不会所有功能无限白嫖。

提醒大家需要注意的是:不要重度依赖某一家完全免费的AI服务,避免它后续缩减额度或者下线。

隐私敏感内容,不要随便输入AI,毕竟你的对话会成为平台可使用的数据。