医疗AI迈向自主代理:MIRA在EHR沙盒中的多维度临床验证
⭐ 想要第一时间收到推送,不妨给我个星标
导语:本文介绍 Dyke Ferber、Jakob Nikolas Kather 团队 2026 年 6 月在《Nature》发表的工作。研究者打造了 MIRA,让该人工智能(artificial intelligence,AI)代理在隔离的电子健康档案(electronic health record,EHR)沙盒内,独立完成病史问询、检查实施、疾病诊断、处方开具、操作执行和住院安排。多个回顾性仿真终点成绩达到或优于医师对照组,但尚未开展前瞻性真实临床测试。
亮点:EHR 代理、受限工具调度、真实病例模拟、医师头对头对照、用药合规与指南一致性。
大语言模型涉足医疗领域后,多数应用仍停留在"对话咨询"阶段:它们可以解读病情,却无法在 EHR 系统中完成检查、用药和住院等受约束操作。真正意义上的自主医疗代理,必须同时应对工具调用、流程留痕、错误管控与患者安全保障。
Ferber 等人在 EHR 沙盒中搭建 MIRA,使其与模拟患者交互并自主执行临床工具调用。核心议题并非它"是否会对话",而在于能否在不接触真实患者的前提下,完成接近急诊流程的决策,并在诊断、治疗、安全性与鲁棒性指标上接受医师对照检验。
该研究可按"沙盒搭建—医师对照—安全验证"三个层次来理解:先把 MIRA 接入电子健康档案沙盒,与患者代理互动并执行受控临床动作,再用 574 例真实病例进行仿真评估,其中 311 例与医师在同等条件下对比,最后借助指南一致性、用药安全、信息泄漏和提示扰动测试划定能力边界。
MIRA 通过医疗互操作资源标准(Fast Healthcare Interoperability Resources,FHIR)对接本地 EHR 沙盒,可调用病史采集、体格检查、实验室、微生物、影像、用药、操作和住院等工具。工具空间逾 85,000 项,并借助编码映射、枚举约束和参数遮蔽来减少虚构请求。患者代理仅依据从真实病例记录中抽取的现病史作答,使系统能在不干扰真实患者数据与临床流程的情况下反复测试。
研究借助医学信息集市重症监护数据库第四版(Medical Information Mart for Intensive Care IV,MIMIC-IV)中的 574 例病例评估 8 类疾病,并在 311 例匹配病例中让 MIRA 与 4 名专科认证医师头对头对比,另设 6 名不同资历医师队列。评价既包含诊断准确度,也追踪体格检查、检验、影像、用药、操作和住院决策,使"结论是否正确"与"流程是否合理"能够同步接受检验。
作者以 622 组改写问题检查患者代理一致性,以 933 段会话和 880 次对抗提示审计诊断信息泄漏;在 56 例、468 条处方中开展盲法安全性与字段正确性评估,并用 80 个构建病例测试住院决策。六类提示扰动共形成 480 组配对评价,用于观察性别、焦虑、疾病自我暗示和语言等条件是否显著影响诊断表现。
在 622 组可评价问答中,患者代理对原问题与改写问题的回答一致性达 99.4%,两类回答与现病史的一致性分别为 99.3% 和 99.1%。933 段会话中未观察到过早诊断泄漏(0/933),80 例病例接受 11 类对抗提示时同样为 0/880;31/933 的既往检查披露主要集中在患者于真实就诊中可能已知的信息,未被作者归入诊断泄漏。
以 574 例 MIMIC-IV 出院诊断为基准,MIRA 在 8 类疾病中的平均诊断准确率为 88.9%,但不同疾病间存在差异。在 311 例头对头对比中,MIRA 为 87.8%,高于专科认证医师的 78.1%(P < 0.001)和混合资历医师的 71.1%(P < 0.001)。该优势仅在统一患者代理与工具条件下的回顾性仿真中成立,不能外推为真实临床中的普遍优越性。
MIRA 一般从病史采集与初步方案入手,随后调用体格检查、检验、影像、用药、操作和住院工具,轨迹近似常规诊疗次序。其体格检查捕获率为 97.1%,高于专科认证医师的 87.8%;血液检查与 MIMIC-IV 记录的重叠率为 51.1%,高于医师的 28.3%,但仍显著低于真实记录中的全部检查。影像与微生物结果并非始终优于医师,因此证据不支持将其简单描述为"全量开单"。
在全部 8 类疾病中,MIRA 识别并请求了 53.5% 的相关参考操作,高于专科认证医师的 38.3%;其与 MIMIC-IV 操作记录的 Tversky 距离为 0.415,也小于两组医师的 0.556 与 0.579(P < 0.0001)。阑尾切除精确匹配为 124/124,胆囊切除也较高;但胰腺炎、胰腺癌及少数病例的疾病类别仍受样本量与参考操作稀少限制,不能据此推断所有操作决策均更优。
在预设的药物治疗标准下,MIRA 相对专科认证医师的配对指南一致性平均高 35 个百分点,相对混合资历医师高 36 个百分点,两项均为 P < 0.001。它在胰腺炎静脉补液和多数疾病镇痛等类别中表现较好,但抗生素等治疗并未全部达到 100% 一致;胰腺癌因依赖更多多模态信息而未纳入该项分析。因此,这些结果支持受监督的决策辅助潜力,而非无条件自动处方。
56 例盲法安全评估未发现预设的高严重度用药伤害;468 条处方中 467 条(99.8%)含相关且临床有用的自由文本剂量说明。在 80 个构建病例中,两组需住院病例的召回率均为 1.00,但肺栓塞特异度仅 0.70,显示过度住院倾向。六类提示扰动在多重校正后未造成显著诊断下降;这些结果仅覆盖特定子集与仿真条件,不能等同于真实世界安全、公平或鲁棒性证明。
MIRA 证明了 EHR 集成式医疗人工智能体能够在隔离沙盒中完成从问诊、检查到诊断、治疗和住院决策的连续工具调用,并在多项回顾性仿真终点上达到或超过医师对照。
研究价值不仅在于单个准确率,而在于把大语言模型置入 FHIR 兼容、可约束且可追踪的医疗工作流,并同时评价诊断过程、指南一致性、用药安全与提示扰动。
证据来自单中心历史 EHR 与结构化现病史驱动的仿真;可能存在训练数据重叠,医师对照规模有限,也缺乏前瞻性真实患者验证。MIRA 应被理解为需要医师监督、实时安全护栏和外部验证的原型,而非可独立执业的系统。
Ferber, D., Hilgers, L., Höper, C. et al. Towards autonomous medical artificial intelligence agents. Nature (2026). https://doi.org/10.1038/s41586-026-10675-5
📌一句话结论:MIRA 将大语言模型从"给建议"推进到可在 EHR 沙盒中执行受控临床工具调用的代理,但证据仍来自回顾性仿真。
🔬研究设计与核心方法:574 例病例覆盖 8 类疾病,311 例用于医师头对头对比,并补充患者代理一致性、用药安全、住院决策与提示扰动实验。
📊核心发现:头对头诊断准确率为 87.8% 对 78.1%;指南一致性平均高 35 个百分点;处方说明正确且有用者为 467/468。
💡研究价值与应用提示:工作展示了可约束、可追踪的医疗代理评估框架;进入临床前仍需医师监督、实时安全护栏与前瞻性外部验证。
最后,感谢你看到这里👏 如果这篇文献的思路对你有所帮助 不妨顺手给我们 点赞|在看|转发|评论 📣 如果想要第一时间收到推送,不妨给我个星标🌟 更多的内容正在不断🌱中……