AI是否真的能'看懂'图像?多模态技术的真相解析
AI 演进的因果链条 · 05
从仅能处理文字,到能够讨论眼前的世界
多模态革新不仅是模型能力的跃升,更是人机交互界面的扩展。
阅读时间约 9 分钟·无公式版·系列第 5 篇
一张错误提示截图、一页手写草稿、一张销售数据图——以前,你需要先把它们转写成文字,AI 才能给出回应。
如今的互动变得直接许多:把图像丢进对话窗口,然后问一句"哪里有问题?"
模型或许能标出异常走向、识别界面提示、解析一道几何题目,甚至依据草图生成网页结构。这种体验自然得让人觉得:
AI 终于拥有了眼睛。
但疑问也随之浮现:它是真的"理解"了,还是仅仅学会了为像素编造一段看似合理的叙述?
答案并非简单的"是"或"否"。多模态模型确实能够从图像中抽取和组合信息,但它的视觉认知方式、稳定程度与人类感知仍有显著差异。
先做个小测试
同一张图片,AI 通常更容易出错的地方是:A.画面整体含义;B.密集小字与精确数字;C.是否有一只显眼的猫?
多数情形下答案是 B。能判断"这是一张财务报表",并不等于每一行数字都读取正确。
"模态"可以看作信息传递的载体:文字是一类,图像、声音、视频也是。
纯文本模型只能接受文字输入,因此所有问题都需要人工转述一次。你面对一张折线图,必须描述坐标轴、颜色和拐点;遇到软件报错,要复制错误信息并补充界面状态。
这一过程不仅繁琐,还会造成信息损失。人们往往只描述自己留意到的部分,而那些被忽略的细节,或许才是关键所在。
多模态将入口向前迈进了一步:图像本身就能充当上下文。用户不必先完成识别、抄录和归纳,模型可以同步参考图片与问题。
这让三类任务变得轻松起来:
表面看只是新增了一个上传按钮,实则要攻克一个根本难题:文字是有序符号序列,图像却是庞大的像素矩阵,二者如何融入同一推理流程?
一张照片里的"猫",并不驻留在某个具体像素中。
它散落在轮廓、纹理、色彩与空间布局里。同一只猫变换角度、光照或背景后,像素会发生剧烈改变;一张小猫贴纸与一只真实猫,在视觉层面又可能截然不同。
视觉模型首先要将底层像素转化为更有价值的表征。常见方案包括卷积网络,也涵盖将图像切分为小块、如同处理序列般输入 Transformer 的方式。2020 年的 Vision Transformer 论文证明了"图像块序列"这条路径的可行性,但这只是视觉领域的一类通用方法,不能据此推断某个闭源模型内部就采用了固定大小的 patch。
接下来还要建立图与文的关联。CLIP 的经典训练任务很直观:提供一批图像与文字描述,让模型判断哪段文字与哪张图片更匹配。经过海量图文对的训练,"斑马"这个词与条纹动物的视觉模式会落入可比较的表征空间。
然而识别物体仅是基础环节。真正有价值的图像问答还需要理解关系:谁位于谁左侧、箭头指向何处、折线在哪一季度拐弯、题目询问的是颜色还是数量。
因此"看懂一张图"至少涵盖三件不同的事:
不同多模态模型的实现路径不尽相同,但可以用一条通用链路来理解:
有些系统由视觉编码器对接语言模型,有些则把多种模态在更早阶段联合训练;视觉表征的数量、分辨率策略与连接方式也存在差异。
特别是 GPT-4:OpenAI 在 2023 年的技术报告中确认它能接收图像与文本并输出文本,但未公开模型规模、视觉编码器、训练算力和完整架构。因此,互联网上流传的"先切成多少像素的小块、再经过哪两个编码器"只能视为推测,不能当作 GPT-4 的官方原理。
这并不妨碍我们把握核心:图片不会原样进入语言推理,它会先被压缩和表征化。压缩使计算成为可能,也意味着细微、密集或位置敏感的信息可能流失。
与其罗列一份很快过时的模型榜单,不如铭记四个关键节点。
2021 年,OpenAI 发布 CLIP。它借助大规模图文对学习"哪段文字更匹配哪张图",证实了自然语言能够成为视觉概念的灵活监督信号。
2023 年 3 月的 GPT-4 技术报告将其界定为可接收图像和文本输入、生成文本输出的多模态模型。视觉功能随后在 GPT-4V 阶段向更广泛用户开放。
价值不限于首次识别。你可以追问"第三根柱为何更高",再继续问"如果剔除异常值呢"。图片与对话历史共同构成上下文,多轮修正降低了使用门槛。
2024 年发布 GPT-4o 时,OpenAI 强调它在文本、视觉和音频上端到端训练。此前的语音模式通常由语音转文字、文本模型、文字转语音三段串联,语调、背景声和说话节奏会在中间环节丢失。统一训练让声音本身也能参与理解与响应。
这条路径揭示,多模态的目标不是不断附加识别模块,而是让不同形式的信息在更早期阶段相互影响。
多模态模型擅长完成"初步理解"和"交互式整理":
但一旦任务需要像素级定位、绝对精确或专业诊断,就必须保持警惕。
官方公开的图像输入限制涵盖:旋转文字可能被误读;不同线型和颜色编码的图表可能混淆;空间定位和精确计数不稳定;图片在处理前可能被缩放;专业医学影像不应交给通用模型作诊断。
分析图表时,先排查三个陷阱
① 坐标轴是否从 0 起始;② 图例颜色和线型是否读反;③ 数字与行列是否发生错位。
让 AI 给出分析后,再要求它逐项引用画面证据,最后人工核对关键数字。
语言模型擅长生成连贯答案,这既是优势,也是隐患。
当图片模糊、文字过小或关系复杂时,模型可能依据常见模式补全缺失信息。于是,一段流畅描述中会混入图片里根本不存在的细节——视觉版的"幻觉"。
更稳妥的使用方式不是简单地问一句"分析这张图"就全盘接受,而是拆解为可核验的小问题:
这也说明了为何多模态并非通往"全知"的捷径。它拓展了输入带宽,也同时扩大了错误发生的表面。
三个词,能概括吗?
视觉表征、跨模态连接、语言推理,各自解决了什么问题?
参考答案:将像素压缩为有用特征;让视觉信息进入共同上下文;围绕用户问题选择和组合信息。
所以,AI 真的"看懂"图片了吗?
如果"看懂"指能识别内容、把图文关联起来并围绕问题推理,答案是:在很多场景里,它已经达到了相当实用的水平。
如果"看懂"意味着像人一样稳定感知每个细节、理解现实因果并对判断负责,答案依旧是否定的。
多模态让 AI 从纯文字世界跨出了一步:它开始接触图像、声音和视频。但看见只解决了"输入",还没有解决"行动"。
它能读懂一张天气截图,却不会因此自动获取明天的最新预报;能看懂订餐页面,也不会天然替你完成预订。
下一章,轮到 AI 从"观察者"变为"执行者"——工具调用如何让模型真正开始做事。
互动专栏|你最想让 AI 看懂什么?
A.工作图表;B.软件截图;C.手写笔记;D.生活照片。
欢迎留下选项和真实场景。也可以发来你曾经被 AI 看错的一类图片。
下一章预告:《AI为何终于能替你做事了?工具调用的关键一跃》
资料校对:Vision Transformer、CLIP、GPT-4 技术报告、GPT-4V 系统卡、GPT-4o 发布说明。