标签

AI发展史(二十五):当AI获得视觉与听觉,它看见了更广阔的世界,但并非每个行业现在都需要它

发布时间:2026-08-06 07:48阅读:2

此前的语言模型主要是借助文本来认知世界。

我们提交一份病历,它便为我们提炼病情要点。

抛出一个疑问,它便输出一段解答。

这类AI恰似一位博览群书的长者,底蕴深厚,且善于表达。

然而现实世界远不止文字这么简单。

患者的表情、呼吸的声响、胸部的CT影像、心电图的曲线、监护设备的波形、外科手术的画面、病理切片的图像。

这些信息很难用寥寥数语完整呈现。

于是AI获得了新的能力:多模态。

什么是多模态?

“模态”这个词听起来晦涩,本质上就是:信息以何种形式呈现。

文字属于一种模态。

图像属于一种模态。

声音属于一种模态。

视频也是一种模态。

能够同步处理这些不同信息的AI,便被称为:多模态AI。

举例来说,你将一张胸部X光片和患者病史一并交给AI。

它既要解析图像,也要理解文字,最终再输出综合判断,这便是多模态的体现。

人类天然就是多模态的存在

我们对世界的认知从来不是依赖单一信息。

医生接诊患者时,不只是倾听主诉。

还会留意:面色、呼吸、步态、精神面貌。

再结合:病史、体格检查、化验结果、影像资料。

最终形成诊断结论。

多模态AI本质上是让机器开始模拟这一流程。

过去AI只能阅读医生整理好的文字材料。

未来它或许能直接观察患者。

聆听声音,判读影像,分析波形,理解这个世界的本来面貌。

多模态为何举足轻重?

因为文字只是对现实的一次压缩。

一张复杂的CT,即便写成数百字报告,仍会遗漏大量细节。

一段十分钟的手术录像,最终写入病历的可能仅有一句话。

一整天的监护波形,归纳之后或许只剩若干异常数值。

AI若仅能阅读文字,它所看到的永远是一个经过人工筛选的世界。

多模态让AI有机会触及更多原始信息,这会显著提升它的能力边界。

由多模态迈向“世界模型”

多模态解决的是:AI能否看见和听见世界。

但看见世界,并不等同于理解世界。

更长远的目标叫做:世界模型。

何谓世界模型?可简略理解为:AI不仅了解眼前正在发生什么。

还明白:为何会发生?接下来可能发生什么?自身的干预又将引发何种后果?

比如AI观察到患者血压降低、心率上升、术野出血增多。

若仅是多模态识别,它会分别罗列这些异常。

若具备更接近世界模型的能力,它还应理解:这些变化或许源于失血,持续发展可能导致循环衰竭。

若采取止血、补液或输血等措施,患者状态可能出现哪些转变。

因此,多模态为AI装配了眼睛和耳朵。

世界模型则期望AI真正领悟:这个世界的运转规律。

医疗是多模态应用的最佳场景之一

医院中的数据天然具有多模态属性。

病历、影像、病理、心电图、监护波形、超声视频、患者声线,甚至基因信息。

未来的医疗AI极可能不再局限于阅读一份病情摘要。

而是同步理解:患者陈述了什么,影像揭示了什么,检验出现了哪些波动,监护仪正呈现什么走向。

对麻醉而言,它甚至能同步剖析:术前病历、气道影像、胸部图像、心电图、术中生命体征、麻醉机参数、输液泵速率。

届时AI对患者的认知,必然会比今日全面得多。

前景虽美,当下依旧骨感。

多模态看似前沿,却也意味着更昂贵的投入。

一段文本处理起来毫不费力。

一张图像需识别海量像素。

一段视频等同于连续处理成千上万帧画面,还需把握时序关系,声音、图像与视频同步输入,算力开销将呈几何级数攀升。

同时,医院还须应对:数据如何采集?患者是否知情同意?视频保存多长时间?不同设备能否互通?差错发生后如何溯源?谁来标注训练样本?

这些问题远比展示一段炫酷视频复杂得多。

所以现阶段文字依然是行业AI的主导

这也是我们始终坚守:将患者资料整理为Markdown文本的原因。

并非因为我们不了解多模态。

而是因为我们深知当下的算力依然捉襟见肘。

医生不愿久候,服务器也无法无限扩容。

文字具备诸多现实优势:易于获取,便于脱敏,方便检索,利于引用,便于审计,且最为节省算力。

医院当前最关键的数据本质上多为文字与结构化信息:病历、医嘱、检验、报告、制度、指南。

这些基础数据尚待梳理妥当。

就急于引入图像、声音和视频。

极易将系统堆砌得愈发繁杂。

却未能攻克真正的痛点。

并非所有炫目的功能都值得此刻开发

比如拍摄一张患者正面照、一张侧面照,再拍一张张口照,让AI自动识别困难气道。

听起来颇为前沿,但仍需权衡:判断是否可信?照片角度是否规范?患者是否配合拍摄?是否需要专门训练模型?

结果是否真的胜过医生床旁查体?又将耗费多少算力?

若这些问题悬而未决,暂时搁置并不代表掉队,而是更为理性的选择。

真正卓越的医院AI并非功能越多越优。

而是每一项功能都切实具备价值。

多模态应从何处破局?

我认为当下更适合挑选少量高价值场景率先发力。

比如:语音自动转录病历、监护波形异常趋势预警、伤口照片前后比对、影像报告与病历资料联合解析。

这些任务边界相对清晰,数据较易获取,医生也能迅速复核结果。

先攻克这些具体难题。

比一上来就追逐一个无所不见、无所不闻的多模态AI更为务实。

文字不会因多模态而退场

即便未来AI能够观看视频、聆听声音、理解图像。

文字依旧举足轻重。

因为文字是人类最精炼的信息压缩手段。

一段两小时的手术录像最终或许只需提炼为几百字。

一天的监护数据最终所需的,可能仅是若干关键异常。

未来的多模态AI,大概率不是削减文字。

而是将更丰富的现实世界信息,转化为更精准、更完整、可追溯的文字。

可以这样诠释:多模态承担感知世界之责,文字承担沉淀世界之职。

尾声

多模态让AI从一个只懂读书的头脑开始拥有眼睛和耳朵。

它拓展了AI的能力边界,也为未来的世界模型构筑了重要基石。

但每增添一种感官,都需付出更多算力、更多存储、更多数据治理,以及更繁复的安全代价。

因此我们既要眺望远方,也不能脱离当下。

今天对多数医院和行业AI而言。

将文字数据梳理到位,将结构化数据打磨精确,将RAG落实到位,将结果做到可引用、可核查,依旧比盲目跟风多模态更为紧要。

并非最前沿的技术就一定是当下最契合的技术。

未来当算力更低廉、设备接口更规范、多模态模型更稳健,AI自然会看见更多、听见更多、理解更多。

但在今天,我们仍应将有限的算力倾注于最具价值之处。

下一篇,我们继续探讨一个让AI从“擅长回答问题”迈向“能够执行任务”的概念:Agent。

大模型只是一个会思索、会表达的大脑。

当它配备工具、记忆、规划与行动能力之后。

它才真正蜕变为智能体。

若你只想铭记一句话

多模态让AI拥有更多感官,也为世界模型奠定了基础。

但在算力依旧紧缺的当下,文字依然是行业AI最经济、稳定、可靠的中流砥柱。

知而行之,行而求索。

从手术室到机房,从临床到系统。

记录一名麻醉医生关于医疗AI、医院信息化与持续精进的求索之旅。

—— 医路智行录