AI评测前沿动态 20260813
一、跨语言 Agent 评估需关注操作轨迹链接:https://arxiv.org/abs/2608.111101. 研究将 tool-using agent 的跨语言能力考察点从最终结果转变为行动策略:即切换语言后,系统是否依然执行相同的工具步骤、成本路径及失败模式。2. 该研究涵盖了8个模型、6个平行基准和41种语言,共计238万次 rollout,并指出原始轨迹相似度会受到短轨迹、空轨迹、随机一致性、模型自复现率及同语重复不稳定性等5类干扰因素影响。3. 在修正这些干扰后,4个前沿模型在贪婪解码下仅