54个AI核心术语速通指南:零基础也能读懂
近两年,AI领域涌现出大量新概念。
Token、Transformer、RAG、MCP、Agent、Skill、Vibe Coding……这些词汇似乎人人皆知,但要真正讲明白又不容易。
普通人无需先掌握高等数学,也不必把自己塑造成算法专家。抓住20%的关键概念,就能弄懂大多数AI产品的运行逻辑、为何时灵时钝,以及后续的学习路径。
我将这些概念归纳为七个模块。不急着一一背诵,让我们沿着一条主线逐步理解:模型如何习得能力,为何能产出内容,人怎样与之交流,它怎样对接外部资源,又是如何演化为Agent和实际产品的。
训练AI的首要要素是Data,即数据。文本、图像、音频、视频和代码,都可充当训练素材。但原始数据往往需要清洗、去重和转化,成为机器可读取的形态,才能进入训练环节。
神经网络可视作一个含有海量参数的复合系统,它能从大量样本中归纳输入与输出的对应关系。
比方说教小孩识别猫。如果只是描述"猫有两只耳朵、四条腿、一条尾巴",效果可能有限。更高效的方式是让他观察大量猫的图片,同时告诉他狗、羊、猪都不是猫。样本积累到一定程度后,他会意识到耳朵轮廓、面部特征、胡须与毛发的组合更接近猫。
神经网络的学习机制与此类似。
权重决定各特征的重要程度。初始阶段,模型或许认为"四条腿"和"尾巴"很关键;浏览海量图片后,它发现狗同样具备这些特征,于是提升猫耳、面部和胡须的权重。
Loss Function(损失函数)相当于错题打分器。将狗误判为猫且置信度极高时,损失值会显著上升。梯度下降寻找能使损失下降的参数调整路径,反向传播则把误差逐层回溯,定位可能的故障点,随后修正参数。
这一不断看样本、做预测、检验偏差、调整参数的循环称作训练。模型训练结束后,依据你的输入产出答复,称为推理。
LLM即Large Language Model,意为大语言模型。它从巨量文本中提炼规律,再依据规律生成内容。
文本送入模型前,需先经过Tokenization(分词),切分为一个个Token(词元)。Token并不严格对应一个汉字或单词,更接近模型处理文本时的信息单元。上下文长度和调用费用,一般都与Token数量挂钩。
当前主流大语言模型基本基于Transformer架构。其核心能力之一是注意力机制:处理某个Token时,会评估它与上下文中其他Token的关联强度。
举例:"小猫追赶老鼠,由于它肚子饿了。"此处的"它"既可能指猫,也可能指老鼠。模型会综合上下文,判定"它"更倾向于猫。
模型生成语句依赖的是Next Token Prediction,即预测下一Token。遇到"今天天气格外……"时,后续可能是"晴朗""闷热""寒冷"或"宜人"。模型为候选Token计算概率分布,输出一个后,继续预测下一个,逐字拼出完整回复。
同一问题的答案为何会有差异?这取决于Sampling(采样)。模型可按概率分布进行采样,未必每次都选择概率最高的选项。Temperature(温度)调控随机性:温度低时输出更稳定,适合代码生成和确定性任务;温度高时变化更多,适合创作类任务。
Pre-training(预训练)类似通识教育,让模型掌握语言、知识与客观规律;Post-training(后训练)类似岗前培训,教会它遵循指令、规避风险、使用工具。Context Window(上下文窗口)决定模型单次处理的信息总量。窗口再大也有上限,堆砌过多无关内容反而可能干扰结果。
模型具备能力,并不意味着你必定能获得理想输出。中间还需要一层桥梁:交互。
Prompt(提示词)是传递给模型的任务描述。目标、背景、约束与输出标准越明晰,模型越容易落实。这类似于你向同事布置任务:仅说"帮我处理一下",对方只能猜测;若讲清需解决的问题、交付形式、何为达标,复工率会降低很多。
System Prompt(系统提示词)是优先级更高的约束,通常由模型厂商或应用设定,用于界定身份、行为边界、输出风格和工具调用规则。
Few-shot(少样本示例)是向模型展示少量范式。与其撰写冗长的风格说明,不如直接给出一两条符合预期的输入和输出对照。若要求结果以JSON、表格或固定字段形式呈现,则称为结构化输出。
可同步处理文字、图像、音频和视频的模型,名为多模态模型。然而即便功能强大,模型也可能产生幻觉,即以自信的口吻输出错误或编造的内容。涉及实时信息和关键事实时,不能仅凭语气判断真伪,还要核实