AI科研丨Science 通用人工智能智能体 Biomni 实现自主生物医学探索
⭐ 想要第一时间收到推送,不妨给我个星标
导语:本文介绍共同第一作者 Kexin Huang、Serena Zhang、Hanchen Wang、Yuanhao Qu、Yingzhou Lu、Ryan Li 与共同通讯作者 Kexin Huang、Jure Leskovec 于2026年7月9日在《Science》在线刊发的成果。针对工具、数据库、代码与实验协议相互割裂的难题,作者打造通用生物医学智能体 Biomni,并借助通用基准、专家任务、强化学习以及计算与湿实验案例进行分层评估。结果显示其能够整合资源、压缩部分任务耗时并助力科研人员;但证据仅限于所测任务,不能说明它能取代专家、直接用于临床或脱离监督运行实验室。
亮点:整合生物医学行动空间、灵活编排工作流、多路径实证任务检验。
生物医学研究涉及大量工具、数据库、代码和实验流程,跨资源组合既费时又依赖专业经验,碎片化的工作流已成为制约研究规模化推进的瓶颈。
本研究探讨:通用人工智能(artificial intelligence,AI)智能体(artificial intelligence agent,AI agent)能否脱离预设模板,自主调配专业资源,并在基准测试、专家任务和实际研究案例中维持可核验的表现?
该研究可按“行动空间搭建—通用与专家评测—专项强化—真实任务检验”四个阶段展开:先汇聚生物医学资源,再与基础模型、专用智能体及人类专家对比,继而通过强化学习强化专项能力,最终在计算分析、湿实验与自动化案例中验证;现有证据仍限于所测范围。
研究者首先从25个 bioRxiv 学科类别各筛选近期论文,借助行动发现智能体提取复现实验所需的任务、工具、数据库和软件,再由专家核验,形成 Biomni-E1 环境。Biomni-A1 利用大语言模型(large language model,LLM)检索资源并逐步规划,以代码作为统一动作接口,从而支持循环、条件分支、并行计算和异构工具调用(Fig. 1)。
评测由通用能力逐步推进至真实任务:先在 Biomni-Eval1 与 HLE-Bio 上对比基础模型、专用智能体和编程智能体,再让 Biomni 与从业5年以上的人类专家分别完成单细胞注释、罕见病诊断与因果基因识别,同时记录准确率与耗时。作者还设置开放式克隆任务,由独立专家盲评方案的正确性与完备性。
针对智能体未能稳定调用环境能力的问题,研究者先从前沿教师模型蒸馏开放权重模型,再让 Biomni-R0 在 Biomni-E1 中基于专家标注奖励进行强化学习(reinforcement learning,RL)。8B 与32B模型均以前后表现与任务级指标衡量,目的并非另设固定流程,而是让规划与执行依据任务成功信号持续迭代。
最终,研究以五条典型路径检验可迁移性:从原始可穿戴数据复现人群分析;解析胚胎骨骼多组学并提出调控假说;生成并实际执行克隆方案;编排结构预测和稳定性模型优化蛋白;将自然语言实验意图转化为机器人代码。不同案例的证据强度各异,涵盖既有数据复现、探索性发现、计算预测和单次湿实验验证,不能等同于临床部署。
Biomni-E1 由近期文献驱动的行动发现与人工核验共同搭建,最终汇聚105个生物软件包、150个专业工具和59个数据库。Biomni-A1 收到问题后先检索相关资源,再制定计划并生成可执行代码,依据运行观察反复修正规划。该架构的核心并非单一模型,而是将推理、工具、数据和执行环境组织为可动态组合的研究流程(Fig. 1)。
在含443条查询、覆盖10类任务的 Biomni-Eval1 中,Biomni 三次运行的平均准确率为57%,优于基础 LLM、TxAgent、Claude Code 及配置同一环境的 ReAct 基线(25%–44%)。在生物医学版 Humanity's Last Exam(HLE-Bio)中,不同骨干模型接入 Biomni 架构后均较仅模型基线提升6–12个百分点,表明增益并非依赖特定底座(Fig. 2A–B)。
研究将 Biomni 与相关领域工作至少5年的人类专家对比。单细胞RNA测序(single-cell RNA sequencing,scRNA-seq)注释准确率为45.8%,处于两名强专家40.5%–50.9%的区间;罕见病诊断与全基因组关联研究(genome-wide association study,GWAS)因果基因识别同样达到专家准确率范围。三类任务的平均耗时约75、3和4分钟,均显著少于专家,但这仅限于规定任务内的对照(Fig. 2C–E)。
Biomni-R0 在环境交互中接受专家标注奖励后,8B 模型的平均任务表现由0.32升至0.59,32B 模型由0.35升至0.67;8B 版本略超教师模型 Claude 4 Sonnet 的0.56,32B 进一步提升。任务级分析在成簇规律间隔短回文重复(clustered regularly interspaced short palindromic repeats,CRISPR)筛选设计、因果基因、变异优先级、数据库查询与罕见病诊断中均显示改善,但并不意味着所有生物医学任务已达专家水准(Fig. 2F–H)。
Biomni 从1,027名参与者的分钟级 Fitbit 心率和步数原始记录出发,建立个体基线并复现六项2019冠状病毒病(coronavirus disease 2019,COVID-19)相关生理标志物、24小时节律和0–6分风险评分。所得静息心率与昼夜节律振幅相关性为 r=-0.34,步数与心率变异性相关性为 r=+0.54,与原研究及后续文献相近。该案例支持既有队列分析复现,并非前瞻性疾病预测验证(Fig. 3A–D)。
在336,162个单核液滴、胎龄5–11周的人胚胎骨骼数据上,Biomni 用约5小时完成单核RNA测序(single-nucleus RNA sequencing,snRNA-seq)、单核染色质可及性测序(single-nucleus assay for transposase-accessible chromatin sequencing,snATAC-seq)与空间信息的10阶段分析。它复现 RUNX2 等已知基因调控网络(gene regulatory network,GRN)关系,并提名 AUTS2、ZFHX3 和 PBX1;后者仍需独立实验检验,属探索性假说(Fig. 3E–H)。
在10个涵盖多种组装方式的开放式克隆任务中,盲法专家认为 Biomni 方案的准确性和完整性与资深研究者相近,且优于人类学员常见的残缺方案。随后,研究者按 Biomni 生成的流程,将靶向 B2M 的单向导RNA(single-guide RNA,sgRNA)克隆进 lentiCRISPR v2 Blast;次日获得菌落,挑取的两个菌落经 Sanger 测序均与目标插入完全一致。湿实验结论仅限此一例(Fig. 4)。
Biomni 整合 AlphaFold-2、ThermoMPNN 与文献检索,对一条起始蛋白序列完成三轮迭代,提出 Q83I、C66F 和 C110F 三处突变。累计稳定性变化预测值(predicted change in folding free energy,ΔΔG)为-4.108 kcal/mol,同时保持98%序列同一性。结果展现了自然语言驱动的模型编排能力,但热稳定性改善源于计算预测,论文未报告该蛋白的湿实验验证(Fig. 5A–B)。
Biomni 将自然语言液体转移要求转换为包含台面配置、错误处理和资源清理的 PyLabRobot 代码,并在 Hamilton STAR 环境验证。更复杂的细胞活力流程覆盖8种化合物、12点连续稀释和3个重复,生成的方案包含吸头选择、梯度计算和体积校验。该案例证明从实验意图到可执行自动化代码的接口能力,但尚不能泛化为无监督闭环实验室(Fig. 5C–D)。
Biomni 将语言模型推理、资源检索和代码执行统一到生物医学行动环境中,在多类基准、专家任务及五条真实案例路径上展示了跨任务组合能力。论文支持“增强研究者并压缩部分工作流”,不支持“全面替代专家”。
研究的核心创新在于先用文献驱动方式搭建可扩展行动空间,再以代码作为通用接口灵活编排工具,并通过强化学习改进专项规划。评测同时覆盖数字基准、人工专家对照、真实数据复现、湿实验和机器人执行,证据形式较单一排行榜更为丰富。
所测任务仅覆盖生物医学的一部分,表现仍不均衡;复杂分析常需结构化提示,近期文献优先策略也可能遗漏基础方法。当前 PDF 未含补充方法,且候选调控因子、蛋白稳定性和部分自动化结果尚缺独立复现。临床判断、生物安全和实验监督仍需人类把关。
数据与代码说明:论文提供开源与可复现性说明,但当前主文 PDF 未包含补充材料中的完整方法、提示词和全部补充表,相关细节需结合正式补充材料复核。
Huang K, Zhang S, Wang H, et al. Autonomous biomedical research with an artificial intelligence agent. Science. Published online July 9, 2026. doi:10.1126/science.adz4351. PMID:42424436.
📌一句话结论:Biomni 展示了通用人工智能智能体跨生物医学工具、数据与实验流程组合研究任务的能力,但仍需专家监督。
🔬研究设计与核心方法:研究搭建统一行动环境,以检索、大语言模型规划和代码执行连接资源,并用基准、专家对照、强化学习和五类真实案例分层验证。
📊核心发现:Biomni 在所测通用基准中优于多类模型或智能体基线,在三类规定任务中以接近专家的准确率缩短耗时,并完成数据复现、湿实验克隆和自动化代码案例。
💡研究价值与应用提示:该系统将碎片化研究资源组织为可执行工作流,为“人工智能增强科学家”提供方法框架;现有证据不支持无监督替代专家或直接临床部署。
最后,感谢你看到这里👏 如果这篇文献的思路对你有所帮助 不妨顺手给我们 点赞|在看|转发|评论 📣 如果想要第一时间收到推送,不妨给我个星标🌟 更多的内容正在不断🌱中……