AI论文速览|多模态大语言模型担任无人机通用视觉-语言-动作智能体:指令、接近、跟踪…(1/20篇)·9月3日
2026年09月03日星期四90% 🔥# 1Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching🤗 21本研究考察多模态大语言模型(MLLM)直接操控无人机的能力,提出DroneCATS-Agent架构与DroneCATS基准。将MLLM视为可替换模块,评估其在接近可见目标、追踪动态目标