AI发展史(二十五):当AI获得视觉与听觉,它看见了更广阔的世界,但并非每个行业现在都需要它
此前的语言模型主要是借助文本来认知世界。
我们提交一份病历,它便为我们提炼病情要点。
抛出一个疑问,它便输出一段解答。
这类AI恰似一位博览群书的长者,底蕴深厚,且善于表达。
然而现实世界远不止文字这么简单。
患者的表情、呼吸的声响、胸部的CT影像、心电图的曲线、监护设备的波形、外科手术的画面、病理切片的图像。
这些信息很难用寥寥数语完整呈现。
于是AI获得了新的能力:多模态。
什么是多模态?
“模态”这个词听起来晦涩,本质上就是:信息以何种形式呈现。
文字属于一种模态。
图像属于一种模态。
声音属于一种模态。
视频也是一种模态。
能够同步处理这些不同信息的AI,便被称为:多模态AI。
举例来说,你将一张胸部X光片和患者病史一并交给AI。
它既要解析图像,也要理解文字,最终再输出综合判断,这便是多模态的体现。
人类天然就是多模态的存在
我们对世界的认知从来不是依赖单一信息。
医生接诊患者时,不只是倾听主诉。
还会留意:面色、呼吸、步态、精神面貌。
再结合:病史、体格检查、化验结果、影像资料。
最终形成诊断结论。
多模态AI本质上是让机器开始模拟这一流程。
过去AI只能阅读医生整理好的文字材料。
未来它或许能直接观察患者。
聆听声音,判读影像,分析波形,理解这个世界的本来面貌。
多模态为何举足轻重?
因为文字只是对现实的一次压缩。
一张复杂的CT,即便写成数百字报告,仍会遗漏大量细节。
一段十分钟的手术录像,最终写入病历的可能仅有一句话。
一整天的监护波形,归纳之后或许只剩若干异常数值。
AI若仅能阅读文字,它所看到的永远是一个经过人工筛选的世界。
多模态让AI有机会触及更多原始信息,这会显著提升它的能力边界。
由多模态迈向“世界模型”
多模态解决的是:AI能否看见和听见世界。
但看见世界,并不等同于理解世界。
更长远的目标叫做:世界模型。
何谓世界模型?可简略理解为:AI不仅了解眼前正在发生什么。
还明白:为何会发生?接下来可能发生什么?自身的干预又将引发何种后果?
比如AI观察到患者血压降低、心率上升、术野出血增多。
若仅是多模态识别,它会分别罗列这些异常。
若具备更接近世界模型的能力,它还应理解:这些变化或许源于失血,持续发展可能导致循环衰竭。
若采取止血、补液或输血等措施,患者状态可能出现哪些转变。
因此,多模态为AI装配了眼睛和耳朵。
世界模型则期望AI真正领悟:这个世界的运转规律。
医疗是多模态应用的最佳场景之一
医院中的数据天然具有多模态属性。
病历、影像、病理、心电图、监护波形、超声视频、患者声线,甚至基因信息。
未来的医疗AI极可能不再局限于阅读一份病情摘要。
而是同步理解:患者陈述了什么,影像揭示了什么,检验出现了哪些波动,监护仪正呈现什么走向。
对麻醉而言,它甚至能同步剖析:术前病历、气道影像、胸部图像、心电图、术中生命体征、麻醉机参数、输液泵速率。
届时AI对患者的认知,必然会比今日全面得多。
前景虽美,当下依旧骨感。
多模态看似前沿,却也意味着更昂贵的投入。
一段文本处理起来毫不费力。
一张图像需识别海量像素。
一段视频等同于连续处理成千上万帧画面,还需把握时序关系,声音、图像与视频同步输入,算力开销将呈几何级数攀升。
同时,医院还须应对:数据如何采集?患者是否知情同意?视频保存多长时间?不同设备能否互通?差错发生后如何溯源?谁来标注训练样本?
这些问题远比展示一段炫酷视频复杂得多。
所以现阶段文字依然是行业AI的主导
这也是我们始终坚守:将患者资料整理为Markdown文本的原因。
并非因为我们不了解多模态。
而是因为我们深知当下的算力依然捉襟见肘。
医生不愿久候,服务器也无法无限扩容。
文字具备诸多现实优势:易于获取,便于脱敏,方便检索,利于引用,便于审计,且最为节省算力。
医院当前最关键的数据本质上多为文字与结构化信息:病历、医嘱、检验、报告、制度、指南。
这些基础数据尚待梳理妥当。
就急于引入图像、声音和视频。
极易将系统堆砌得愈发繁杂。
却未能攻克真正的痛点。
并非所有炫目的功能都值得此刻开发
比如拍摄一张患者正面照、一张侧面照,再拍一张张口照,让AI自动识别困难气道。
听起来颇为前沿,但仍需权衡:判断是否可信?照片角度是否规范?患者是否配合拍摄?是否需要专门训练模型?
结果是否真的胜过医生床旁查体?又将耗费多少算力?
若这些问题悬而未决,暂时搁置并不代表掉队,而是更为理性的选择。
真正卓越的医院AI并非功能越多越优。
而是每一项功能都切实具备价值。
多模态应从何处破局?
我认为当下更适合挑选少量高价值场景率先发力。
比如:语音自动转录病历、监护波形异常趋势预警、伤口照片前后比对、影像报告与病历资料联合解析。
这些任务边界相对清晰,数据较易获取,医生也能迅速复核结果。
先攻克这些具体难题。
比一上来就追逐一个无所不见、无所不闻的多模态AI更为务实。
文字不会因多模态而退场
即便未来AI能够观看视频、聆听声音、理解图像。
文字依旧举足轻重。
因为文字是人类最精炼的信息压缩手段。
一段两小时的手术录像最终或许只需提炼为几百字。
一天的监护数据最终所需的,可能仅是若干关键异常。
未来的多模态AI,大概率不是削减文字。
而是将更丰富的现实世界信息,转化为更精准、更完整、可追溯的文字。
可以这样诠释:多模态承担感知世界之责,文字承担沉淀世界之职。
尾声
多模态让AI从一个只懂读书的头脑开始拥有眼睛和耳朵。
它拓展了AI的能力边界,也为未来的世界模型构筑了重要基石。
但每增添一种感官,都需付出更多算力、更多存储、更多数据治理,以及更繁复的安全代价。
因此我们既要眺望远方,也不能脱离当下。
今天对多数医院和行业AI而言。
将文字数据梳理到位,将结构化数据打磨精确,将RAG落实到位,将结果做到可引用、可核查,依旧比盲目跟风多模态更为紧要。
并非最前沿的技术就一定是当下最契合的技术。
未来当算力更低廉、设备接口更规范、多模态模型更稳健,AI自然会看见更多、听见更多、理解更多。
但在今天,我们仍应将有限的算力倾注于最具价值之处。
下一篇,我们继续探讨一个让AI从“擅长回答问题”迈向“能够执行任务”的概念:Agent。
大模型只是一个会思索、会表达的大脑。
当它配备工具、记忆、规划与行动能力之后。
它才真正蜕变为智能体。
若你只想铭记一句话
多模态让AI拥有更多感官,也为世界模型奠定了基础。
但在算力依旧紧缺的当下,文字依然是行业AI最经济、稳定、可靠的中流砥柱。
知而行之,行而求索。
从手术室到机房,从临床到系统。
记录一名麻醉医生关于医疗AI、医院信息化与持续精进的求索之旅。
—— 医路智行录