AI应用前沿|Tool-Genesis:驱动自进化语言智能体工具创建的任务导向基准 (1/20篇) · 7月6日
2026年07月06日星期一Tool-Genesis: A Task-Driven Tool Creation Benchmark for Self-Evolving Language Agent自进化语言智能体领域正快速推进,然而其依据任务需求进行工具构建、适配与维护的能力尚缺乏系统性的评估手段。当前主流基准多受制于预先设定的规范框架,制约了系统的可拓展性与自主进化空间。本研究推出诊断型基准Tool-Genesis,致力于从接口规范性、功能准确性及下游实用价值等多元视角对智能体能力进行量化评估。该基准检
LLM智能体联盟形成:稳定性分析与收敛性保障(系列1/20)·5月4日
2026年05月04日 星期一LLM智能体联盟形成:稳定性分析与收敛性保证面向大型语言模型(LLM)智能体在多智能体系统中的战略协同需求,本文首次给出一套基于享乐博弈论、并带有形式化稳定性保证的LLM智能体联盟形成方案。我们提出LLM联盟形成博弈(LCFG),给出纳什稳定分区的充分条件,同时证明了相关复杂度结论。进一步的分析表明,LLM智能体的行为具有以ε理性偏好为特征的有界理性。借助GPT-4等模型开展的大规模实验验证了该框架:在我们设计的“联盟思维”(CoalT)协议下,LLM联盟在73.2%的情况下