港科大首创AI协作机制 助力医学通用与专科模型协同诊疗
香港科技大学(港科大)研究团队成功研发一套创新的人工智能(AI)"通才—专才协同" 架构(Generalist–Specialist Collaboration, GSCo),达成了医学通用基础模型与专科模型在疾病诊断任务中的高效配合。研究结果表明,GSCo于医学影像诊断、视觉问答及放射报告生成等多项任务中的表现,均显著优于单独运行的通用或专科模型;同时,该架构能大幅削减训练医学模型以适应全新临床任务的研发开销。此项突破有望加速医学基础模型融入日常临床实践。研究论文已于国际权威期刊《自然—生物医学工程》刊发,题为 "依托通才—专才协作推动医学人工智能的通用化"。
港科大计算机科学及工程学系、化学及生物工程学系助理教授、医工交叉联合创新中心主任陈浩教授(中),与论文共同第一作者、计算机科学及工程学系博士生何肃南(左)及聂宇翔(右)携手国际团队,共同打造了崭新的医学人工智能架构 GSCo 。
本次研究由港科大计算机科学及工程学系、化学及生物工程学系助理教授、医工交叉联合创新中心主任陈浩教授领衔的团队,联合哈佛医学院、威尔康奈尔医学院、香港中文大学、香港大学,以及中山大学等机构共同推进。
医疗AI模型长期面临两难困境。通用基础模型虽基于海量医学语料库训练而成,具备灵活处理多元任务与精准识别影像模态的能力,但在单一疾病诊断上往往精准度不足。相反,专科模型虽能提供精确的临床推理与专业诊断,却因过度专门化,一旦遭遇新任务或部署到新医院,便需重新训练。专科模型亦无法与临床医生以自然语言共同推理,面对新的医学影像诊断任务时,准确率会急剧下滑。此外,为每项新任务反复训练通用基础模型,运算开销不仅高昂,更受限于患者隐私合规要求,数据无法离开医院。因此,仅依赖通用或专科模型,皆难以满足实际临床工作的需要。
图为GSCo 架构的搭建流程。在搭建阶段,团队利用多模态医学语料库训练开源医学通用模型MedDr,同时构建一组面向下游任务的轻量级专科模型。在协同推论阶段,专科模型输出诊断预测,与视觉相似的案例对照,再由 MedDr 将这些证据与自身医学知识整合,得出最终诊断结论。
为攻克上述难题,本次跨院校国际团队开发出全新协作式 AI 架构 "GSCo" 。该架构建基于陈浩教授团队研发的开源医学通用模型 MedDr,运用多元医学影像模态和逾200万个样本对MedDr进行深度训练,并同步建立了一组轻量级专科模型,仅需单张消费级显示适配器(GPU)便可完成训练。在双向协作下,专科模型在AI推论过程中负责比对相似的历史病例,并输出诊断预测;MedDr则担当 "核心决策者" 的职能,负责将专科模型提供的证据与自身医学知识融合,从而输出最终诊断结果。
为评估GSCo的效能,研究团队在32个公开数据集、共约260,000张医学影像上展开全面评测,涵盖医学影像诊断、视觉问答及放射报告生成等多项任务。结果显示,MedDr的表现显著优于RadFM、LLaVA-Med及Med-Flamingo等现有医学通用模型,而GSCo在所有内部及外部基准检验中均取得整体排名第一,表现优于十个最先进的视觉基础模型。
在一项皮肤病变诊断测试中,团队首先利用HAM10000皮肤镜图像数据集训练专科模型,并通过GSCo架构,将其部署于全新的BCN20000皮肤镜图像数据集进行测试。结果显示,GSCo诊断表现高达0.8420分(满分为1.0),远超通用模型 MedDr在零样本状态下取得的0.7545分,以及专科模型独立运行时的最佳成绩(0.8292分)。
图为GSCo的两种核心协作机制示意图。开展专家混合诊断(上方)时,轻量级专科模型会在数据集上各自独立训练;推论时,将测试影像输入到专科模型,并以其预测结果为参考。开展检索增强诊断(下方)时,将每一组 "影像—文字配对" 进行编码,并置入医学数据库;推论时,系统会检索最相似案例,向 MedDr 提供证据。
在另一项针对胸部 X 光报告生成的临床人工评估中,七位执业放射科医生中有六位一致认为,GSCo生成的报告质量优于当前最先进的专科模型R2GenGPT。压力测试更进一步证实MedDr的高稳定度,即使刻意植入系统性偏差,假设所有病理影像被错误判定为正常时,MedDr仍能正确识别出67.6%的肿瘤影像。凭借这一出色纠错能力,GSCo的整体准确度因而获得显著提升。
与微调通用模型相比,调整GSCo以执行全新临床任务的研发开销可大幅降低近100倍。在GSCo架构下开发的专科模型,可在医院内部利用本院数据训练;随后只需以匿名形式共享成果,便可确保患者病历毋需外流。
论文通讯作者陈浩教授表示:"医学 AI通用与专科模型各有所长,而GSCo的核心价值正是让两个独立运行的模型能以 '协作者' 身份并肩合作,并由通用模型担任总决策者,将专科模型的专家建议与模型自身广博的医学知识完美融合。团队期望,这一崭新架构能为医学基础模型融入临床工作流程,提供更具操作性的路径,尤其让AI计算资源受限的环境,也能共享AI医疗成果。"
展望未来,研究团队计划将MedDr进一步拓展至计算机断层扫描、磁力共振成像等三维影像模态及医学影像领域。同时,团队将探索更先进的多模态及基于图结构的检索策略,并研究通用与专科模型之间更多元的协作形式,例如引入测试时运算,以赋予模型深度思考能力,进一步提升诊断结果的精准度。MedDr开源通用模型和GSCo架构已公开发布,以推动全球科研及临床应用。