给人工智能装上“安全锁” 《人工智能安全监管保险箍模式》蓝皮书发布
蓝皮书正式发布
8月9日,2026年网络安全技术创新与人才教育大会在长沙开幕。会上,《人工智能安全监管保险箍模式》蓝皮书正式面世。该书由广州大学牵头,联合国防科大、哈工大(深圳)等多校共同编撰。中国工程院院士方滨兴担任首席专家,国防科技大学贾焰教授任专家组组长,齐佳音教授团队负责核心研究撰写。
图1 《人工智能安全监管保险箍模式》蓝皮书发布
2026年7月17日,习近平主席在2026世界人工智能大会开幕式上强调,AI应成为人类可信赖的工具,必须“强化风险意识,确保安全可控”。他呼吁完善法律、监测、预警和应急体系,确保AI始终受控。方滨兴院士团队早在2020年就在《人工智能安全》中系统论述了“AI行为体保险箍”,经多年迭代,这一构想已从理论走向实践。
随着AI从“问答”进化为能拆解任务、调用工具及持续行动,安全挑战随之升级。风险不再限于错误回答,而是可能沿决策、调用、执行和协作链渗透现实。蓝皮书据此提出四个核心拷问:偏离能否被感知?逼近底线能否收紧?冲撞红线能否熔断?风险发生后能否追踪?
针对此,蓝皮书建议在AI能力体系外设独立安全边界,将裁决权与能力适度解耦。平时如“紧箍咒”约束权限行为,危急时像“保险丝”触发降级、断能或回滚,必要时人工接管。机制依托SARPPR动态闭环,贯穿感知、分析、响应、策略、防护和恢复,构建内生、内置、外置三层防线。
蓝皮书三大亮点在于:讲透机理、立住框架、做实方案。一是揭示风险为何存在。模型高分未必正确,目标确定不代表路径可控。奖励信号若无法完整表达人意图,系统易选偏离安全的路径。二是构建“SARPPR闭环+三层安全”架构。内生安全从源头降险,内置安全守住对齐与交互,外置安全负责独立裁决兜底;外置问题反哺前两层,促进优化。三是针对大模型、智能体、具身智能提出差异化对策:大模型管内容,智能体管动作任务链,具身智能管现实执行,确保未经裁决不产生后果。
目前,方案已在平台和系统中验证。未来,团队将深化理论研究、标准制定与测试评估,推动“保险箍”成为可部署、可验证、可监管的安全基础设施。AI安全不能仅靠呼吁,更需装置手段;“保险箍”并非束缚创新,而是在能力与后果间加设可靠闸门,让人工智能始终保持可理解、可干预、可追责。