人工智能安全治理研究新报告发布
2026年6月13日,在中国人民大学人工智能治理研究院成立一周年的院庆活动中,该院七个研究团队集中发布了六份研究报告及“全球人工智能政策法律数据库”。经过修订完善,这些报告将陆续推出,供学术和产业界参考交流。
本期发布的《人工智能安全治理研究报告》遵循“风险识别→机制剖析→防御评估→治理建议”的逻辑路径,参考网信办发布的《人工智能安全治理框架》2.0版和图灵奖得主Yoshua Bengio牵头发布的《国际人工智能安全报告》,将相关议题整合为技术、社会、治理三大维度,深度融合了中国人民大学在人工智能底层算法与法学、社会学、国际关系等优势学科的交叉特色。
报告由人工智能安全治理研究团队编写。第一章,引言与研究背景,由信息学院张文平撰写;第二章,技术安全基础——模型鲁棒性、可靠性与安全性,由信息学院王文轩撰写;第三章,数据安全与隐私保护,由信息学院黄科满撰写;第四章,AI对齐问题——价值观嵌入与目标安全,由高瓴人工智能学院李萌、许志豪、王希廷撰写;第五章,研究基础设施的安全韧性,由信息资源管理学院严承希、李佳怡、琚恒鑫撰写;第六章,人机主体性重构与道德根基,由信息资源管理学院杨泽坤撰写;第七章,意识形态安全与信息生态,由信息学院张文平、陈渝中撰写;第八章,人工智能与国家安全:竞争与治理,由国际关系学院刘丽娜、万新、王越撰写;第九章,人工智能安全的法律规制与全球治理,由国家发展与战略研究院肖超伟撰写;第十章,结论与政策建议,由信息学院许伟、王玮航、于伯平撰写。
【技术维度】
报告指出,大模型安全已从“提示词过滤”问题,升级为跨模态、长链路、工具调用共同作用的系统性风险,能力越强,攻击面越广。2025—2026年,模型进入多模态与智能体大规模落地阶段,风险从输出文本延伸到图像、音频、API、物理世界和高风险行业决策,高危攻击事件同比激增420%,涉及多模态交互与智能体越权的事件增加60%以上。人工智能安全的重点已转向“输入—上下文—工具—物理环境—决策后果”的全链路防护,而非单点拦截。
在数据安全与隐私保护方面,报告研判行业正面临训练数据偏见、数据投毒攻击、数据泄露风险三大系统性挑战:训练数据偏见已从简单的刻板印象演变为影响价值观和文化的系统性风险;数据投毒成本极低且正向数据供应链蔓延,仅需250份恶意文档即可污染大型模型;模型记忆、基础设施漏洞与未授权访问形成风险共振,泄露路径日益复杂。对此,报告提出构建技术、制度与产业三位一体的纵深防御体系。
在价值对齐方面,报告认为当前绝大多数对齐仍停留在浅层行为层面,较容易在少量样本的微调下被逆转,模型甚至能学会区分测试与部署环境,产生“对齐伪装”,导致预部署安全评估防线失效。因此,价值对齐应从表面行为修饰走向深层表征干预,例如,通过本报告提出的ConVA等技术框架,深入激活空间提取安全表征,实施受控的价值向量激活。未来的安全防线不能依靠外部行为审查,而须铸入模型内部表征与自主规划的语法之中。
此外,对于研究基础设施问题,目前设施扩展为涵盖数据资源平台、计算系统与跨机构协同网络等多要素的综合性科研支撑体系。人工智能可以通过异常检测、威胁识别、预测预警和自动响应提升安全韧性;另一方面,人工智能系统本身也成为研究基础设施的重要组成部分,同时也带来了数据滥用、平台攻击和治理失灵等新的风险传导机制。围绕研究基础设施的安全韧性,报告提出了以“风险治理过程—研究基础设施功能—公开可核验证据”为逻辑主线的评估框架,形成“风险抵御、风险吸收、恢复适应、开放协同”四个维度。
【社会维度】
在人机关系方面,报告提示应警惕技术依赖导致的人类主体性削弱,同时正视人工智能系统展现出的目标导向、长时记忆、自我调节等功能性类主体特征,建议承认有限主体性、同时坚持人类最终控制原则,推动责任体系从单一主体走向研发者、用户、平台共担的多主体责任网络。
在意识形态安全与信息生态方面,人工智能生成文本的说服力已足以媲美人类,而生成迭代持续快于检测,形成深度伪造的“检测赤字”,带来主流声音被稀释、社会共识碎片化、文化安全受挑战等系统性影响。报告主张建立技术、平台、政府与社会“四位一体”的多层次协同机制,防线不能仅靠防御性的“堵”,而须转向主动的“疏”与“建”,在文化表征权竞争的新维度下保护创作主权,主动建构安全可信的公共空间并讲好中国故事 。
在国家安全方面,人工智能军事化应用带来新型风险,大国战略竞争格局高度分化。报告揭示了技术民族主义的深层悖论:越追求单边技术优势,就越难形成防范人工智能灾难性风险所必需的多边协调机制。中国坚持自主创新与开放合作并重,积极倡导公正合理的全球人工智能治理秩序,是应对这一挑战的重要建设性方案。
【治理维度】
报告认为,人工智能治理已超越伦理讨论,进入法律、技术与地缘政治交织的硬治理阶段:人工智能具有强烈的军民两用属性,各国治理路径结构性分化,国际机制明显滞后。未来国际治理需要走向可验证、可执行、可包容的强约束机制,重点方向包括:强化联合国包容性框架,帮助发展中国家打破技术垄断;将全球南方的发展关切纳入核心议程;探索建立类似国际原子能机构的人工智能专属机构,将技术转移与安全核查相结合;以监管科技把核查能力下沉到硬件信任根、芯片标识、算力溯源、生成内容水印和模型生命周期审计,构建分层分域、兼顾发展权的强约束协同机制。
【结论与政策建议】
综合全文,报告形成四项主要结论:第一,数据安全治理要从静态存储保护转向全生命周期动态治理;第二,价值对齐要从技术参数校准走向法律伦理制度嵌入;第三,社会治理要从被动风险处置转向敏捷治理和制度韧性建设;第四,基础设施安全要从单点边缘加固转向系统内生免疫。
在政策层面,关键是形成政府、学界和产业界各负其责、协同联动的治理格局。政府应加强统筹协调,完善动态评估机制,积极参与国际规则制定;学界应深化跨学科研究,加强价值对齐、模型可解释性研究和复合型人才培养;产业界应把安全要求贯穿设计和应用全过程。
归根到底,安全不是人工智能发展的附加条件,而是实现高质量发展的基础和前提。只有统筹好发展与安全、创新与治理、效率与公平,才能使人工智能真正成为提升治理效能、促进社会公平、增进人民福祉的重要力量。