标签

“模型”与“模态”之别:人工智能中的model、modal与modality解析

发布时间:2026-08-05 21:36阅读:2

在人工智能的各类文献中,model和modal这两个词频繁出现。它们的拼写仅有一字之差,中文译名“模型”和“模态”听起来也很类似,因此人们常将它们混淆为同一事物。事实上,两者不仅词性不同,所处的概念层次也有显著差异:

简而言之,模型是负责信息处理的计算系统,而模态则是信息被呈现或感知的方式。

英语中的model可以泛指对某个实体、系统或过程的简化表示。比如,地球仪是地球的实体模型,数学公式能构成物理过程的数学模型,经济学模型则可展现不同经济变量间的关联。

在人工智能和机器学习领域,model的含义更为特定。根据国际标准ISO/IEC 22989:2022《信息技术——人工智能——人工智能概念与术语》,机器学习模型是基于算法训练所获得的成果[1]。

美国国家标准与技术研究院则将人工智能模型定义为信息系统的一部分,它运用计算、统计或机器学习技术,依据给定输入产生输出[2]。

例如,一个图像分类模型接收图片后,能输出“猫”、“狗”或“汽车”等标签;一个语言模型接收词元序列后,可预测后续词元;一个语音识别模型接收音频信号后,能转换成相应文本。

因此,人工智能中的model通常可理解为:经过设计或训练、能接收输入并按特定规则生成输出的计算架构。

模型可能包含网络结构、参数及相应的运算过程。训练模型,就是根据数据不断优化参数;使用模型,则是将新输入交给已训练好的模型,获得预测或生成结果。

另一方面,中文“模态”通常对应英文名词modality,其形容词形式为modal。Model、modality和modal三者的基本关系如下表所示:

英文

词性

常见中文表达

示例

model

名词,也可作动词

模型;建模

语言模型language model

modality

名词

模态

视觉模态visual modality

modal

形容词

模态的

模态信息modal information

multimodal

形容词

多模态的

多模态模型multimodal model

需注意的是,modal在多个学科中都可译为“模态”,但各领域的“模态”并非同一概念。在逻辑学中,“模态”主要指命题的必然性、可能性等特征;在工程和振动研究中,“模态”指系统固有的振动模式;在人工智能中,“模态”则通常指文本、图像、音频等信息的呈现或感知形式。因此,即使英文形式和中文译名完全相同,也不能认为它们代表相同的专业概念。理解“模态”的具体含义,仍需结合其所属学科和上下文。总之,术语的形式一致,不代表其专业概念一致。

人工智能中的“模态”是什么

在人工智能领域,modality通常指信息存在、表达、输入或感知的某种方式。常见模态包括:文本;图像;音频;视频;语音;深度信息;触觉信息;生理信号;传感器数据。 例如,一张照片属于图像模态,一段录音属于音频模态,一篇文章属于文本模态。多模态机器学习研究则尝试构建能处理、关联或整合多种模态信息的计算方法。

巴尔特Ÿ鲁沙伊蒂斯等人将多模态机器学习概括为利用多种模态进行建模的研究领域,并将其主要问题归纳为表示、翻译、对齐、融合和协同学习等方面[3]。这说明,多模态研究并不只是让模型分别“看到图片”和“读到文字”,还要处理不同模态之间如何建立联系的问题。例如,面对一张街道照片和一句“图中有几辆汽车”的文字提问,系统需要:处理图像中的视觉信息;处理问题中的语言信息;把“汽车”这一语言概念与图像中的相应对象联系起来;根据两种模态的信息生成答案。这里,图片和文字是两种不同的模态,负责处理它们并生成答案的计算系统则是一个模型。

模型和模态究竟是什么关系

模型与模态并不是两个并列的对象。更准确地说,模型是信息处理系统,模态是模型所处理的信息形式。例如:一个模型可以只处理一种模态,也可以处理多种模态。

只处理文本的语言模型属于单模态模型;只进行图像分类的视觉模型也可以视为单模态模型。如果一个模型能够共同处理文本和图像,它就属于多模态模型。

什么是单模态模型

单模态模型主要接收和处理一种模态的数据。例如:

需注意的是,“单模态”并不等于“结构简单”,也不意味着模型能力较弱。一个只处理文本的大语言模型可能拥有非常复杂的网络结构和大量参数,但只要它的输入和输出主要局限于语言或文本表示,仍可从数据模态角度将其视为单模态模型。

这里讨论的“单”和“多”,不是模型数量或网络层数,而是模型所涉及的信息形式数量。

什么是多模态模型

多模态模型是能够处理、联系或生成多种模态信息的模型。例如,一个模型可以接收图片并生成文字说明;根据文字描述生成图像;同时分析视频画面、人物语言和背景声音;根据图片和文字共同回答问题;接收语音指令并结合摄像头画面采取行动。

在多模态机器学习中,模态与数据格式密切相关,但二者不是同一个概念。模态指数据所表达的信息类型,如文本、图像、语音和视频;数据格式则规定这些信息在计算机中如何编码、组织和储存。换言之,数据格式是模态信息的技术载体。同一种模态可以采用不同的数据格式,例如JPG和PNG都可以承载图像信息,MP3和WAV都可以承载音频信息;同一种文件格式或数据容器也可能同时包含多种模态,例如一段视频文件可以同时包含动态画面、语音、背景音乐和字幕。由此可见,模态是信息的类型,数据格式是信息在计算机中的编码和存储方式。同一种模态可以使用不同的数据格式,一个文件也可能包含多种模态的信息。

把模型称为“多模态模型”,也不意味着它像人一样拥有完整的视觉、听觉和语言理解能力。这一名称首先说明,它的计算结构能够接收、建立联系或生成多种形式的数据。

举例来说,假设用户向人工智能系统上传一张厨房照片,并提问:“桌上有几个苹果?”这个过程中涉及的术语可以这样区分:

可见,“模型”和“模态”分别回答下面两个不同的问题:模型回答“谁在处理信息”,模态回答“处理的是什么形式的信息”。

model和modal很容易混淆,首先是因为拼写相近:model:m-o-d-e-l;modal:m-o-d-a-l。 其次,中文“模型”和“模态”都以“模”开头,在多模态人工智能资料中又经常同时出现。例如:multimodal model:多模态模型;multimodal large language model:多模态大语言模型;cross-modal alignment:跨模态对齐;modality fusion:模态融合。

一句话里可能同时出现model、modal和modality。如果没有注意词性和概念层级,就容易把它们混为一谈。

实际上,multimodal model可以拆分为:multi- 多个; modal模态的;model模型。 因此,它的完整意思是,能够处理或整合多种模态信息的模型。

“多模态模型”和“大语言模型”采用的分类标准也不相同。“语言模型”主要依据模型处理和建模的对象命名,强调它对语言序列中的概率关系进行建模;“多模态模型”则强调模型能够处理多种信息形式。

因此,二者可能发生交叉,例如:

由此可见,“大语言模型”强调语言建模及模型规模,“多模态模型”强调可以处理的信息形式。二者不是同义词。

结语

Model与modal虽然拼写相近,在人工智能中表示的却是两个不同层级的概念。model是“模型”,指处理输入并产生输出的计算结构;modality是“模态”,指文本、图像、音频等信息形式;modal则是相应的形容词,表示“模态的”。一个模型可以处理一种模态,也可以处理多种模态。前者称为单模态模型,后者称为多模态模型。因此,最简明的区分方式是:模型是处理信息的计算系统,模态是信息呈现和被处理的形式。理解这一点,也就理解了“语言模型”、“视觉模型”、“多模态模型”、“跨模态对齐”和“模态融合”等术语之间的关系。

参考文献

[1] INTERNATIONAL ORGANIZATION FOR STANDARDIZATION, INTERNATIONAL ELECTROTECHNICAL COMMISSION.Information technology—Artificial intelligence—Artificial intelligence concepts and terminology: ISO/IEC 22989:2022[S]. Geneva: ISO, 2022.

[2] NATIONAL INSTITUTE OF STANDARDS AND TECHNOLOGY. Artificial intelligence model[EB/OL]. [2026-08-05]. https://csrc.nist.gov/glossary/term/artificial_intelligence_model.

[3] BALTRUŠAITIS T, AHUJA C, MORENCY L P. Multimodal machine learning: a survey and taxonomy[J].IEEE Transactions on Pattern Analysis and Machine Intelligence, 2019, 41(2): 423-443. DOI:10.1109/TPAMI.2018.2798607.