标签

六项AI国标获批立项,上海实验室加速构建评测标准网络

近期,上海人工智能实验室(上海AI实验室)主导的六项国家级标准成功获得立项批准,涉及大模型、科学智能、AI安全、具身智能等尖端技术方向。借助长期积累的产学研协同优势,该实验室已建立起一套领域完备、层次分明、全流程贯通的AI评测标准体系。通过开发主客观结合的综合性评测框架,实验室着力打造兼顾技术指标与实际应用的评价模式,为推进“人工智能+”战略提供坚实保障。同时,由上海AI实验室引领的多项关键人工智能标准正在有序推动立项与制定进程,其中涵盖IEEE首项科学智能领域国际标准。基于WG9组长单位的职能,实验室正

2026-07-06 23:48:21  |  10 阅读

AI评测新趋势:从榜单刷分到真实场景能力验证

过去我们更在意模型在各类排行榜上的成绩:SWE-bench、Terminal-Bench,领先几个百分点,打破纪录成为焦点。而如今,一个更核心的议题逐渐显现:这些分数,真的能反映AI在真实生产环境中的能力吗?从近期AI评测的发展来看,评测正从“短任务、单分数、排行榜”迈向“长周期、可解释、生产级、安全可信”。本周最受瞩目的项目当属 Sakana AI 推出的CoffeeBench。它不再让Agent执行几分钟就能完成的单点任务,而是搭建了一个持续90天的B2B咖啡供应链模拟平台。系统内包含6个由LLM驱动

2026-07-03 14:12:29  |  18 阅读

可靠人工智能 | 迪博技术顺利通过信通院智能体安全评估

(以下资讯由厂商提供)深圳市迪博技术有限公司系国家级专精特新重点"小巨人"企业,身为全国信标委人工智能分委会委员单位及大数据标准工作组全权成员单位,致力于人工智能全栈解决方案的开发。公司独立研发法象大模型、数据工厂、智能工厂与智能体引擎等AI应用生态技术架构,凭借自有的自然语言处理专利,攻克智能文档结构化核心技术,达成文档要素的精确提取与对齐,打破行业信息处理残缺、失真的技术壁垒,释放海量文档数据价值,打造智能化应用的数据底座。通过深入布局"AI+"垂直行业,融合大模型、数

2026-06-18 18:09:53  |  23 阅读

构建企业AI合规体系:可信治理平台助力安全管控

以往,AI仅作为辅助工具存在,如撰写文案、检索信息、归纳总结等。如今,AI已从聊天界面深入到实际业务流程中。部分企业将大模型整合进客服系统以回应客户咨询;有些企业则将其接入资料库,协助员工查询规章制度、合同及项目信息;还有企业将智能体功能封装为平台,为内部提供办公与运维助手,对外则提供智能化服务。诸如OpenClaw这样的AI能力服务化和平台化尝试,揭示了一个趋势:AI正逐步成为业务系统的重要组成部分。这不仅提升了工作效率,也带来了新的挑战。一旦AI真正融入业务,企业不仅要评估其回答能力,还需确保其安全性

2026-05-20 17:58:00  |  11 阅读

政务AI大模型服务平台成熟度模型解析

文档类型:PDF文档页数:20+获取方式:见文末————————政务领域人工智能大模型统一服务平台成熟度模型框架政务领域人工智能大模型统一服务平台成熟度模型分级定义表点击此处自助下载政务领域人工智能大模型统一服务平台成熟度模型.pdf大模型服务与应用安全评测技术规范.pdfAI智能体:威胁分类、防御框架与落地实践.pdfHermes Agent 从入门到精通.pdf人工智能 政务大模型系统技术要求.pdf大模型服务安全白皮书.pdf大模型面试手册(中文).pdf大模型工具大全.pptx大模型评测幻觉检测.

2026-05-17 10:13:23  |  22 阅读