标签

人工智能研究范式转变:从模型驱动迈向智能体驱动

发布时间:2026-09-04 09:41阅读:1

基于近五日1281篇,当前人工智能研究的前沿格局进行系统性综述发现:智能体(Agentic AI)已成为该领域新的组织性范式,约五分之一文章直接以智能体为主题;研究重心正从单一模型能力转向模型与执行框架(harness)的双组件系统,并围绕推理时计算、检索增强、多模态执行、世界模型、安全治理、评测效度、效率系统与领域应用形成相互耦合的多个主题板块。本文梳理各主题的核心进展、代表性工作及其内在逻辑关系,提出"能力底座—智能体范式—领域应用"纵向传导、"安全治理与评测"双向约束、"效率系统"横向支撑的生态结构,并对语音音频、代码软件、数据工程、人机与社会等支流在生态中的位置一并给出分析,最后对未来趋势作出判断。

图1 主题关键词

智能体以276 篇高居榜首,但更值得关注的是内涵质变:社区不再把它当作"调用大模型的脚本",而是当作一种需要工程化、可复用、可治理的软件形态。

最直接的证据来自对"执行框架"(harness)的研究:Credo 指出编码智能体搜索得到的框架是"隐式、命令式、任务特定"的代码,提出用可声明式原语描述工作流;DuMateBench 从生产级平台脱敏真实会话构建评测集,强调前置交互历史与工作区状态;REVISE 研究并发工作流中"丢弃与复用旧结果"的正确性—效率权衡。

可复用原语、真实会话评测、并发控制、状态管理——几乎每一件都是传统软件工程概念在智能体世界的重演,"智能体软件工程"的轮廓已经浮现。

更具前瞻性的是"模型与框架共进化"思潮:SafeEvolve 提出,智能体能力由基座模型与交互框架共同决定,安全对齐必须让两者从在线经验中共同演化——"对齐"从模型训练问题,扩展为系统设计与模型训练的联合问题。多智能体方向同样活跃,其中相当一部分工作开始认真对待"多个智能体共享上下文、凭证与工具时的隔离与授权"——这是分布式系统语义在语言模型时代的回归。

智能体范式还在向"操作物理世界"扩散:AutoXRD 自动解析粉末衍射、原子力显微镜智能体、肿瘤学多智能体信息抽取等科学仪器智能体大量涌现,普遍采用"智能体决策+ 确定性校验器"的混合结构——这正是后文领域应用主题的先声。

智能体能力的上限取决于推理与规划。窗口161 篇推理论文呈现两个方向:向内理解推理机制,向外扩展推理时计算。

机制理解上,SHAPE 借用数学教育学的"语义空间—启发式"框架解剖思维链(CoT),研究正从"用 CoT"走向"懂 CoT"。推理时计算上,BASIN 识别出"推理盆地塌缩":推理时搜索常聚集在结构相似的少量轨迹上,因而提出结构感知的状态选择,固定算力下相比 Tree-of-Thoughts最高提升22 个百分点。

数据与基准层面,SCAFFOLD 为计算机科学论文的图表配上问答与思维链推理轨迹,试图为图表理解提供训练燃料。对"引导器"可靠性的质疑同样值得关注:有工作从理论上证明,直接用过程奖励模型(PRM)分数会因极值效应,系统性偏向"看似可行实则错误"的前缀——当推理时计算越来越依赖奖励信号,信号自身的可靠性就成了系统级问题。规划方面,神经符号方法在回归,基于扩散的多智能体时序逻辑规划也试图兼顾表达力与可扩展性。

一句话:推理研究正从"提示技巧"转向"搜索、验证与引导的系统科学",并开始与定理证明、时序逻辑等形式方法重新连接。

检索增强生成(RAG)的形态正在升级:从"给模型外挂资料库",变为"可学习的推理组件"。

最标志性的变化是强化学习进入检索决策:AgenticRag-R1 批评现有智能体 RAG 动作空间粗粒度、奖励分配薄弱,提出将检索、推理与"栈记忆"深度耦合的 RL 框架;PAGE-RAG 在固定预算下做多跳问答,以"