AI、机器学习、深度学习与LLM之间究竟有什么联系?
副标题:厘清基础模型、多模态和生成式 AI 的真实定位
资料校准日期:2026 年 8 月 28 日
面向读者:AI 初学者、产品经理、研发工程师,以及希望系统补全 AI 基础知识的读者
第 1 篇里,我绘制了一张 AI 应用的全景图。后续几篇按 RAG、Workflow、Agent 和协议层层递进,讲解模型如何对接知识、工具和业务系统。
可工程实践越深入,越有必要回头把地基夯实:AI、机器学习、深度学习、Transformer、基础模型、LLM、多模态模型和生成式 AI,是否构成一条由大到小的嵌套链?
答案是否定的——只有部分概念存在这种从属关系。多数术语分别指代技术领域、学习方式、网络结构、模型种类、能力维度和应用体系。强行串成一条线,正是“名词越学越糊涂”的症结所在。
因此从第 14 篇起,我会暂时搁置 Agent 工程,先把基础坐标理顺,再深入模型训练、推理以及完整应用架构。
我们常看到类似排列:AI → 机器学习 → 深度学习 → Transformer → LLM → RAG → Agent。看似规整,实则把不同维度的概念混为一谈。
AI 是一片广阔的领域;机器学习和深度学习是达成智能的技术路径;Transformer 是网络架构;LLM 是模型品类;生成式 AI 概括一种生成能力与应用形态;RAG、Workflow、Agent 则归属应用层面的工程范式。
它们确有联系,但“相关”并不等同于“具备父子从属关系”。比起死记定义,先弄清一个名词究竟在回答什么问题更为关键。
面对一个 AI 名词,我习惯先将其放入六个坐标:领域、学习范式、网络架构、模型类别、能力类型和系统工程。
同一套系统可同时占据多个坐标。比如企业助手能采用自监督预训练的 Transformer 类 LLM,拥有文本生成能力,并在应用层借助 RAG、工具和 Workflow 落实业务需求。
在通用语境下,深度学习 ⊂ 机器学习 ⊂ 人工智能成立。但这种集合关系只回应“技术方法的归属范围”,并不能无限向右延伸所有热门词汇。
人工智能(Artificial Intelligence,AI)指让机器具备感知、推理、学习、规划、决策或行动能力的广袤领域。AI 不仅涵盖机器学习,还包括规则系统、搜索、规划、知识表示等手段。
机器学习(Machine Learning,ML)让系统从数据或交互经验中提炼规律,开发者无需逐条手写判断规则。
深度学习(Deep Learning,DL)是机器学习的一类子方法,通常采用具有多层表示学习能力的神经网络。它擅长从图像、声音、文本等高维数据中自动抽取特征。
常见误区是把“当下的 AI”等同于大模型。大模型是当代 AI 的关键路径之一,但 AI 的范畴远大于此,许多业务系统仍会融合规则、搜索、优化算法和机器学习模型。
学习范式并非模型名称,它刻画的是训练阶段提供什么数据、什么反馈,以及要求模型学会什么。
监督学习使用带标签的样本,例如“这封邮件是垃圾邮件”“这张图是猫”。模型学习从输入到目标标签或数值之间的映射。
无监督学习通常缺少人工目标标签,重在挖掘数据结构,如聚类、降维和异常模式识别。
自监督学习从原始数据自身构造训练信号,比如遮住部分文本让模型预测,或根据上文预测后续 Token。现代基础模型的大规模预训练普遍采用自监督目标。
强化学习让智能体在环境中行动,依据奖励信号优化策略。奖励往往延迟出现,因此它关注连续决策与长期回报,而非单条样本的标签对错。
这些范式并非互斥。一个模型可能先自监督预训练,再以监督数据微调,随后借助人类反馈或规则反馈对齐。
神经网络是一类计算模型;深度学习强调利用多层网络学习层次化表示。两者高度关联,却不能随意互换名称。
传统机器学习往往依赖人工特征:先由人提取关键词、纹理或统计指标,再交给模型分类。深度神经网络则让靠近输入的层捕捉局部模式,中间层组合复杂结构,后面的层形成与任务相关的高级表示。
“深”并非层数越多越佳。网络能否稳定训练、数据是否充分、任务是否需要复杂表示,以及计算成本是否可承受,共同决定架构选型。
Transformer 最早出现在 2017 年论文《Attention Is All You Need》中,是一种以注意力机制为核心的神经网络架构。
它要回答的是序列信息怎样交互、如何并行计算。现代许多 LLM 采用 Transformer 或其变体,但两者并不等同:
因此,把 Transformer 排在 AI、ML、DL 之后作为“下一层”,会同时模糊方法集合、网络架构和模型类别三个维度。
Stanford CRFM 把基础模型(Foundation Model)定义为:在广泛数据上大规模训练,并能适配多种下游任务的模型。
“基础”不是说它天生正确或能直接部署,而是说众多下游应用构建于其上。适配手段可以是 Prompt、检索增强、微调、参数高效微调、工具接入或任务专用头。
基础模型可以面向语言,也可以面向视觉、语音或多模态。其核心特征是广泛训练、可迁移性和对下游的基础支撑,而非固定的参数规模或某一产品形态。
基础模型还会引入“同源风险”:偏差、缺陷和能力变化可能顺着大量下游应用扩散,因此评估、版本管理和治理尤为关键。
大型语言模型(Large Language Model,LLM)突出语言建模能力、训练规模和对文本或语言化信息的处理。许多现代 LLM 同时承担基础模型角色,但“LLM”和“基础模型”侧重不同属性。
更准确的理解是:
于是“LLM = 生成式 AI = AI”实为三次范围扩张。LLM 只是生成式 AI 的重要技术基础之一,更远非 AI 的全部。
文本、图像、音频和视频属于不同模态。多模态模型(Multimodal Model)能够接收、关联或生成两种及以上模态的信息。
它既可能把不同输入编码到可关联的表示空间,也可能借助跨模态注意力或连接模块,让文本与视觉、音频信息相互影响。典型场景包括看图问答、视频理解、语音助手、文生图和实时语音交互。
“多模态”描述的是处理的数据范围与交互能力,并不等于某种固定架构。系统支持上传图片,也不意味着它真能理解所有视觉细节;分辨率、采样、时序、工具链和评估集都会左右实际表现。
生成式 AI(Generative AI)聚焦依据输入生成新内容,涵盖文本、代码、图像、音频、视频和结构化数据。
它不应被安插在 AI → ML → DL 集合之后,充当更小的子层级。更恰当的画法是把“生成”视为一条能力轴:不同模型家族都可能具备生成能力。
LLM 可生成文本和代码;扩散模型常用于图像、音频或视频生成;多模态模型可跨模态理解与生成。同一个产品还可能同时调用生成模型、检索系统、分类模型和确定性规则。
判别式任务重在给定候选或目标空间内做判断,如分类、回归、排序和检测;生成式任务重在产出新内容或数据序列。
邮件分类器输出“垃圾邮件/正常邮件”,属于判别;模型撰写一封回复邮件,属于生成。合同风险评分属于判别;生成修改建议和条款草案属于生成。
但不要把“模型”永远划成两座孤岛。同一基础模型可通过不同输入、输出约束和适配方式完成生成、分类、抽取和评分。这里对比的是任务及输出形式,而非给所有模型贴唯一标签。
模型提供语言理解、表示、推理或生成能力,但企业应用还离不开知识、数据、工具、流程、身份、权限、状态、评估和监控。
模型“知道怎么写差旅申请”,不等于它了解公司最新制度;模型能生成工具参数,不代表它拥有执行权限;模型回复“已经创建”,也不代表业务系统真的产生了一条申请记录。
完整系统必须把不稳定的模型输出纳入可验证的工程边界:外部事实由检索或数据库提供,真实动作由应用执行,关键路径由 Workflow 把控,高风险操作由策略和人工审批把关。
RAG、Workflow、Tool Calling 和 Agent 都不是新的模型层级。它们刻画的是应用如何编排模型、知识、工具、状态和控制权。
它们既可使用同一个 LLM,也可组合出现。差异主要在系统编排与控制方式,而非底层模型变成了另一种物种。
现在再看本系列贯穿始终的企业知识与业务助手,每个组件都能归位。
用户在交互层提出“查询北京差旅标准并创建申请”。应用层负责界面和业务语义;编排层以 Workflow 控制查询、确认、审批和写入;能力层提供 RAG、工具调用或局部 Agent;模型层借助 LLM 理解语言并生成结构化结果;数据层保存制度、员工与业务状态;治理层贯穿身份、权限、审计、评估和成本。
这里没有哪个组件能单独代表整套系统。模型划定能力上限,工程系统决定能力能否被稳定调用。
完成概念校准后,后续将沿“内部机制 → 模型类别 → 训练适配 → 使用方法 → 多模态应用 → 完整系统”逐层展开。
如果今天只能记住一条原则:遇到新名词,先问它在描述领域、训练方式、架构、模型、能力,还是应用系统;不要急着把它挂到一条层级链上。
下一篇预告:
《Token、Embedding、Attention 与 Transformer:LLM 究竟如何处理一句话?》
说明:本文把“领域、学习范式、网络架构、模型类别、能力类型、系统工程”当作概念校准框架;这是辅助学习与选型的工程化整理,并非某官方机构钦定的唯一分类法。