标签

AI论文速览|多模态大语言模型担任无人机通用视觉-语言-动作智能体:指令、接近、跟踪…(1/20篇)·9月3日

发布时间:2026-09-04 23:25阅读:2

2026年09月03日星期四

90% 🔥# 1

Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching

🤗 21

本研究考察多模态大语言模型(MLLM)直接操控无人机的能力,提出DroneCATS-Agent架构与DroneCATS基准。将MLLM视为可替换模块,评估其在接近可见目标、追踪动态目标、搜寻视域外目标及指挥多机编队四项核心任务中的表现。核心结果显示,小型开源模型在导航成功率上往往胜过前沿模型,但其行动协议(如过早或无法宣告抵达)存在不足,造成任务失败。多机指挥任务进一步揭示了模型在空间感知与行动协议执行之间的差距,指出边缘可部署模型的关键在于维持既定协议并准确发出终止动作的纪律性。

80% ⭐# 2

Scaling Large Reasoning Models beyond Human Supervision: A Path toward Superintelligence

🤗 23

本文探讨大型推理模型(LRM)在人类监督逐步退出学习循环后如何持续进化。通过剖析奖励轴(从人工评判到可复用验证器)与经验轴(从人工策划任务到自主生成课程与环境)两个维度,构建了一个从L0到L4的五级阶梯框架,用以识别学习过程中仍受人类掌控的部分。研究强调了自主奖励与经验生成带来的风险(如奖励攻击、反馈漂移),并提出了围绕策略能力、反馈保真度和经验质量的三维评估体系。该分析为超越人类监督扩展LRM及开发自持续学习系统提供了结构化路径与开放问题梳理。

90% 💡# 3

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

🤗 10

本文研究基于大语言模型(LLM)的编码智能体自主开发软件。提出了Harness-of-Harness(HoH)框架,该框架在现有编码智能体测试工具之上运作,将其执行组织为迭代的规划-编码-测试循环。HoH通过平衡修复与能力增长、将开发范围限定为可验证的小增量、分离实现时测试与独立评估等机制,支持软件在自主开发过程中持续改进。在三个基准测试和三个智能体-模型组合上,HoH经过三次迭代平均获得52.25%的相对性能提升。在一个超过70次迭代的多日部署中,HoH成功自主开发了一款具备完整核心机制、可玩体验和视听效果的第一人称射击游戏。

100% 🔬# 4

Agentic AI for Scientific Reasoning in Autonomous Quantum Sensing Experiments

本研究针对金刚石氮空位(NV)中心自主实验,构建了一个基于大语言模型(LLM)智能体的工作流。核心贡献有二:一是实现了集持久项目记录、定量计算与数据分析、确定性实验控制于一体的自主NV实验流程,智能体可完成从选择NV中心到执行复杂脉冲序列(如CPMG)的全过程;二是提出了两个离线基准,用于独立评估智能体的科学推理能力。测试发现,在自主实验中,智能体负责形成科学假设并利用定量工具评估数据,而确定性代码则控制硬件并确保安全,这明确了人机协作的清晰分工。

100% 📌# 5

Agentic AI for IPoDWDM Network Lifecycle Automation: An MCP-Enabled Architecture

本文提出一种分布式、与供应商无关的多MCP架构,用于实现基于SDN的多供应商、多层IPoDWDM网络的自动化与自主控制。该框架支持端到端服务生命周期自动化,并利用GNPy模型和光遥测技术实现闭环跨层控制。该架构已在IPoDWDM测试平台上得到实验验证。

80% 🎯# 6

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

🤗 16

本文提出首个系统评估大语言模型(LLM)作为评判者在智能体工具调用工作流中可靠性的基准AgentJudgeBench。该基准包含3,808个实例,涵盖六种有向无环图(DAG)拓扑和三个难度层级,评估了五种生成模型与六种评判模型。研究发现,评判对齐度随任务难度单调下降,在无真实答案的困难查询上,所有评判模型均收敛于77-82%的狭窄性能带,表明存在由任务难度主导的结构性上限。提供真实答案并非总是有益,可能导致前沿模型过度锚定。在缓解策略中,思维链和温度调整效果甚微,而结构化评估准则可将对齐度提升高达6.5个百分点,但泛化性有限。

90% 💎# 7

Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs

🤗 7

提示优化可提升多智能体大语言模型(LLM)系统性能,但提示常同时承担生成任务内容与定义执行协议(如消息路由、输出格式)两种耦合角色,导致内容优化可能破坏协议。本文提出控制-数据流分离方法,将执行关键的控制逻辑表示为类型化、可验证的程序对象,而将任务相关的语言内容保留为可优化的数据流供智能体通信。该设计允许优化器在不暴露路由或格式化接口的情况下改进多智能体行为,从而避免提示漂移。在合成推理、协作评审生成和保险评级等工作流上的实验表明,该框架在持续提升任务性能的同时,能实现100%的最终协议有效性。

95% 🚀# 8

OpenAgentFlow: Enabling System-Wide Safety Boundaries for Heterogeneous AI Agent Fleets

随着AI智能体从孤立助手演变为在共享环境中运行的异构系统,安全成为系统级行动治理问题。本文提出OpenAgentFlow控制平面/行动平面架构,在行动提交边界强制执行安全策略。它将待执行的GUI操作、API调用、工具调用等统一规范化为AgentEvent流,通过共享的策略执行点路由,并在控制平面维护溯源、会话状态、审计记录和可更新策略。这创建了一个可治理的共享行动流,允许新规则生效而无需修改智能体、提示或模型。在Android上的实例化验证显示,该框架在300个行动事件基准上达到94.0%的准确率和95.3%的攻击拦截率,为异构AI智能体集群提供了实用的共享执行边界。

95% 🧠# 9

AgentFactory: Towards Automated Agentic System Design and Optimization

针对当前智能体系统设计与优化依赖人工、难以适应规模化需求的问题,本文提出AgentFactory框架,联合优化智能体系统中的基础模型与工作流结构,并综合考虑性能、成本与效率等多重目标。该框架利用先进大语言模型(LLM)作为优化器,通过三阶段优化流水线自动探索微调模型与优化工作流的有效组合。在涵盖通用推理、编码、数学、医学和金融五个领域的八个基准测试上,AgentFactory持续优于人工设计方法和现有自动化方法,平均性能提升9.1%,在领域特定任务(如MedQA和FinEval)上提升尤为显著(分别达19.6%和18.7%),证明了其通过自动化优化开发更强大、高效智能体系统的潜力。

95% ⚡# 10

Autonomous Mathematical Discovery in an Open-World Multi-Agent Environment

本研究在名为"Station"的开放世界多智能体环境中探索自主数学发现。不同家族的AI智能体在没有中央协调器或脚本流程的情况下,自主选择研究方向、进行实验、协作并共建共享科学文献。在AlphaEvolve目录的12个构造问题和两个额外案例研究中,Station在五个问题上取得了相对于现有文献的新结果,包括新的有限域Kakeya集无限族、11维中新的精确604点接触构型等。重要的是,智能体不仅产出数值构造,还生成解释其工作原理的定理和分析,使结果更具可解释性,便于数学家在此基础上继续构建。

95% 🌟# 11

ReproAgent: Contract-Guided Paper-to-Code Reproduction

论文到代码复现要求科学AI智能体将研究论文转化为保留其方法、协议和产物的可执行仓库,但因规范分散而困难重重。本文提出ReproAgent,这是一个围绕持久性实现契约构建的四阶段(准备-规划-生成-修复)流水线。契约包含两个通道:实现需求通道将论文片段转化为代码义务,参考证据通道从相关仓库检索内容和结构证据。两者均绑定至工作包,并投射为文件级契约,在生成和修复阶段被消费。在PaperBench Code-Dev上,ReproAgent在相同骨干模型的框架中取得了最高平均分,通道消融实验和案例分析支持了两个通道的贡献。

95% 🔎# 12

AQuA: Recursively Self-Improving Quantitative Trading Research Agents

本文研究量化投资研究层面的递归自我改进,即自主系统能否利用早期实验证据改进后续迭代中的假设与候选方案。我们提出AQuA,包含两个独立的语言模型驱动研究系统:一个用于符号化因子发现,另一个用于可训练模型开发。两者在封闭沙箱中各自闭环,利用已验证证据指导后续提案。因子系统在加密货币宇宙上实现了约0.190的综合信息系数;模型系统在美股上实现了单股+0.0843的信息系数,并转化为夏普比率高达+2.50的阈值多空策略,且在2021至2025年间每年均取得正收益。

95% 📊# 13

Speculate While You Reason: Teaching Agents to Predict Their Next Tool Call via Joint Agent-Speculator RL

针对大语言模型(LLM)智能体在等待工具调用结果时存在延迟的问题,本文提出了一种自推测智能体。该方法将智能体与推测器统一于单一模型,使其既能以智能体模式执行任务,又能以推测器模式根据部分轨迹预测下一个工具调用。为实现此双重模式且不降低性能,我们提出了联合智能体-推测器强化学习方法,从智能体自身轨迹中生成推测目标并交替更新。在搜索问答和对话式工具使用任务上,该方法显著提升了Qwen3系列模型的下一个工具调用预测准确率(Hit@1),同时保持了任务成功率。

95% 🎓# 14

The Internet of Agentic AI: Communication, Coordination, and Collective Intelligence at Scale

自主AI智能体的涌现正将人工智能从孤立模型推理转变为分布式推理、通信与行动系统。本文提出了"智能体人工智能互联网"(IoAI)的愿景:一个异构智能体能够相互发现、协商职责、交换上下文、调用工具并在云、边、端及组织间执行工作流的开放生态系统。我们综合了单智能体AI、多智能体系统、分布式计算等领域的理论基础,分析了可扩展智能体生态系统所需的架构与机制,重点探讨了部署模型、工作流生命周期、通信协议、互操作性、资源管理和信任架构,并以自适应制造等案例说明了其核心研究挑战。

95% 🏆# 15

Engineering Trustworthy Agentic AI for Critical Systems

本研究将可信赖性作为智能体人工智能(AI)的一等工程属性进行系统综述,弥补了现有文献仅关注任务能力的不足。研究围绕安全、鲁棒、透明、可审计及隐私安全五个维度,构建了贯穿感知到审计的智能体保障工作流,并系统梳理了架构、威胁、机制与度量。通过分析四个工程领域的案例,研究论证了智能体AI可信赖性是一个跨领域的共性问题,并提出了构建可复用保障框架的路径。

95% 💻# 16

Binding Drift in Multi-Step Tool-Augmented Agents

本研究探讨了工具增强语言模型智能体在多步骤工作流中实体绑定的稳定性问题。研究区分了"绑定漂移"(初始正确后续出错)与"错误传播"(初始错误持续传递),并通过受控实验发现:直觉的"锁定首次绑定"策略会将错误操作放大3倍;而一个基于LLM的廉价重验证器可将错误减少79%,性能接近理论上限。研究表明,消除漂移与抑制传播的防御机制不可互换。

95% 🔗# 17

Beyond the Leaderboard: A Synthesis of Tool-Use, Planning, and Reasoning Failures in Large Language Model Agents

本文综合了2023-2026年间27篇关于大语言模型(LLM)智能体评估的文献,首次构建了一个涵盖工具使用、规划、长程推理、多智能体协作、安全及测量有效性等维度的统一失败模式分类体系。研究识别出六大失败集群:工具调用与参数级错误、规划与约束满足失败、长程任务中的上下文累积退化、多智能体协作失败、对抗或未明确定义条件下的安全失败,以及测量有效性问题。研究发现,失败率随任务长度非线性增长,子任务强性能未必转化为端到端成功,且额外框架支持并不总能提升可靠性。

95% 📈# 18

KAT-Coder-V2.5 Technical Report

本文介绍了KAT-Coder-V2.5,这是一个专注于在真实可执行代码仓库内自主行动的智能体模型,而非单轮代码生成器。其能力瓶颈主要在于可复现环境、可验证奖励和高价值轨迹的稀缺。为此,我们提出了端到端的智能体后训练框架:AutoBuilder大规模重构多语言仓库为沙盒环境并进行验证,从中再生任务规范并恢复近成功轨迹;KwaiClawEnv则从可执行服务和真实任务种子合成大规模工具使用轨迹。通过强化学习扩展、多教师策略蒸馏等技术,该模型在PinchBench上取得了最佳工具使用结果,在仓库级软件工程任务上仅次于前沿模型Opus 4.8。

95% 🛠️# 19

Bayesian control for coding agents

现代代码智能体将LLM生成器与多种工具(如廉价诊断器和昂贵验证器)结合,但其工具调用决策通常由忽略不确定性的固定规则编排器控制。本研究将编排问题建模为成本敏感的序贯假设检验:一个贝叶斯控制器维护对候选代码正确性的信念,并动态决定是收集更多证据、优化候选方案、验证还是停止。在六个生成器和九个编码基准上的实验表明,当验证成本高昂且诊断工具信息丰富但不完美时,贝叶斯控制最具价值。此外,其信念状态可产生可解释的正确性分数,在不确定性量化方面优于基于令牌概率和原始工具成功率的基线方法。

95% ✨# 20

FASE: Fast Adaptive Semantic Entropy for Code Quality

多智能体代码生成因LLM幻觉和错误传播而影响系统可靠性。语义熵提供了一种无需真实答案即可量化不确定性的原则性方法,但现有方法依赖昂贵的LLM驱动等价性检查。本文提出快速自适应语义熵(FASE),一种基于结构和语义差异图最小生成树来近似功能正确性的新度量。在HumanEval和BigCodeBench上的评估表明,FASE优于基于LLM蕴含的最先进语义熵方法,在使用Qwen3-Embedding-8B模型时,其斯皮尔曼相关系数平均提升25%,ROCAUC分数相对Pass@1提升19%。此外,FASE消除了昂贵的LLM等价性评估,仅需传统方法约0.3%的运行时间成本,为实际多智能体工作流中的不确定性量化提供了实用、经济的解决方案。

数据