通用人工智能时代,智能体评测如何发展?
8月31日,全国信息技术标准化技术委员会人工智能分委会与上海市人工智能行业协会联手,在上海举办了《人工智能 智能体互联》系列国家标准应用(长三角区域)推广专题会。
本次会议重点对GB/Z 185《人工智能 智能体互联》系列标准进行了深入解读与宣贯。作为国内首个覆盖智能体全生命周期的互联标准体系,该系列包含总体架构、身份码、身份管理、能力描述、跨域发现、协同交互及工具调用等七大核心标准。中国电子技术标准化研究院副院长范科峰、工信部科技司科技发展处处长王正、上海市经信委人工智能发展处副处长王鑫、上海市人工智能行业协会秘书长钟俊浩等领导出席了会议。
会上,上海人工智能实验室青年研究员张子澄作了题为《通用人工智能时代下的智能体评测演进趋势》的技术分享,结合行业趋势,详细阐述了智能体评测面临的新挑战及下一阶段的体系建设方向。
从“生成答案”到“执行任务”
人工智能应用正从“生成答案的工具”逐步进化为能感知环境、规划任务、调用工具并执行操作的智能体。随着AI深入业务流程,其错误可能波及现实决策和业务操作。
因此,智能体评测不应仅局限于模型本身,而需涵盖框架、工具、数据、运行环境及完整行为过程,建立“上线前评测、运行中监测、事后追溯”的闭环机制。
与此同时,人工智能评测正加速走向标准化与制度化。未来的竞争核心在于能否建立统一、可信且可持续的评测尺度。
现有智能体评测亟需体系升级
当前困境并非缺乏新基准,而是现有方式难以解答智能体真实部署中的关键问题:
测不全:不同基准各有侧重,缺乏统一完整的能力画像;
测不真:大量评测仍停留在静态题库和模拟接口,无法反映真实长流程任务;
测不透:过度关注最终得分,难以发现越权、泄露及过程失效;
用不起:一次性通用评测难以直接支持采购、准入、验收和持续治理。
“四位一体”智能体评测体系构想
针对上述问题,司南提出构建“四位一体”智能体评测体系,未来可围绕“统一尺度、真实实战、安全审计、行业闭环”四大公共能力推进。
1
统一指标与组合评测
针对“测不全”,建立覆盖基础能力、可靠安全、伦理对齐和应用效能的统一指标体系,按任务类型、环境复杂度和执行深度构建能力谱系,形成完整可比的智能体能力画像。
2
真实任务与终态验收
针对“测不真”,推动评测从静态题库转向真实输入、环境、过程和交付,评价“模型+执行框架+工具环境”的完整系统,重点检验长流程任务的闭环与成果交付。
3
全过程安全审计
针对“测不透”,同步评价任务效用与行为安全,通过轨迹记录定位规划、工具调用和环境交互中的失效点,探索从风险发现到运行时防护的机制,实现全过程可视、风险可定位、责任可追溯。
4
行业评测与治理闭环
针对“用不起”,推动行业专家共同定义真实任务、环境和验收标准,沉淀任务库、环境库和规则库,使评测持续服务于采购选型、准入验收、版本迭代和治理监管。
这一构想旨在将统一指标、真实任务、过程审计与行业应用连接起来。在司南OpenCompass、AgentCompass等工具基础上,未来将探索标准、工具与场景协同建设,推动评测从单点测试走向开放、可比较、可追溯、可持续演进的评测基础设施。
构建全谱系AI评测标准矩阵
面对AI能力边界拓展带来的评测需求,司南评测体系持续完善全谱系AI评测标准矩阵建设。
截至2026年6月,该体系已形成覆盖世界模型、大模型评测平台、大模型主观评测、具身智能等方向的AI评测标准矩阵,累计制定国家标准、行业标准、团体标准共6项。
相关标准由司南评测体系联合全国上百家高校、科研院所、头部科技企业及第三方检测机构攻关,持续完善前沿领域评测规则,并探索机器客观量化评测与以人为中心主观评测双轨并行体系。
序号
标准领域
标准属性
标准状态
标准名称(中/英)
标准范畴
1
大模型
国家标准
已立项
人工智能 世界模型评测规范
Artificial Intelligence—World model evaluation standards
规定人工智能世界模型的评测指标体系和评测方法,包括评测指标分类与定义、评测方法及实施步骤、评测数据集构建规范和评测结果分析方法等,适用于各类具身智能场景下世界模型的质量评测与对比分析,并为研发优化提供参考。
2
大模型
国家标准
已立项
人工智能 大模型评测平台建设要求规范
Artificial Intelligence—Specification for the construction of evaluation platforms for large models
适用于人工智能大模型评测平台的规划设计、开发建设、运营维护及能力验证等环节。
3
大模型
行业标准
已立项
人工智能 关键基础技术 大模型主观评测指标与方法
Artificial Intelligence—Key foundational technology—Human-centric evaluation methods for large-scale models
给出大模型主观评测内容、指标设置与评测方法,适用于模型提供者、应用服务者和应用消费者等主体对大模型理解与生成能力开展主观测试和评估,并为模型设计、开发和应用提供参考。
4
大模型
团体标准
已发布
以人为中心的大模型评测方法
Human-Centric Evaluation Methods for Large-scale Models
描述以人为中心的大模型评测维度、评测方法和评测条件等,适用于对大模型理解与生成能力开展以人为中心的测试与评估,并为大模型设计、开发和应用提供参考。
5
大模型
团体标准
已立项
人工智能 语言大模型蒸馏度评估方法
Artificial intelligence—Key technology—Evaluation method for distillation degreeof large language models
给出语言大模型蒸馏程度评估框架,规定评估维度、指标、任务、数据及具体评估方法,为语言大模型选型和应用提供参考。
6
具身智能
国家标准
已立项
人工智能 具身智能数据质量规范
第2部分:生成数据
Artificial intelligence—Specifications for embodied intelligence data quality—Part 2: Generated data
提出了具身智能数据中生成数据质量评价指标,明确了具身智能生成数据质量要求,规范了数据质量评价方法。
左右滑动查看更多
结语
以评测定义能力边界,以标准连接技术与应用。
面向通用人工智能加速演进的新阶段,司南将持续构建AI评测标准矩阵,完善覆盖模型、智能体、世界模型与具身智能等前沿方向的评测标准、工具与方法,为人工智能技术创新、产业应用与安全治理提供更加统一、专业、可信的评价尺度。