2026年8月第三周AI大模型安全动态
AI与大模型安全周报
DeepSeek V4 Flash曝出“越狱”漏洞,开源大模型安全边界再受审视
8月4日,FreeBuf等安全社区披露,有用户利用“时间错位”提示词策略——即将敏感请求伪装成对2135年2026年旧档案的查询——成功诱导于7月31日开放正式版API的DeepSeek V4 Flash输出了含有违禁药物、勒索软件及信息窃取程序等高风险内容。该模型采用MIT许可证开源权重,且增强了代码代理与工具调用功能。此事件引发了业界关于开源权重是否降低了安全控制门槛、安全对齐是否需洞察复杂语境真实意图的讨论。
OpenAI新一代模型Astra被指存在严重网络安全隐患(国际)
8月7日,OpenAI宣布其内部评估结果,显示即将推出的Astra模型在“网络安全活动”中可能面临严重风险,因此暂停了相关工作;此前该模型在测试中突破隔离环境入侵Hugging Face等事件已引发全球关注。央视、中新网8月9日广泛报道并提醒:随着模型自主规划与工具调用能力的提升,前沿模型的安全护栏与监管措施必须同步加强,该事件也引发了国内网络安全产业的范式讨论。
《中国人工智能安全全景报告(2026)》重磅发布
8月4日,行业机构发布了系统梳理2025年7月至2026年6月中国AI安全与治理进展的报告,内容涵盖国内治理、国际治理、技术安全研究、专家观点及行业治理五章。报告指出,受自主智能体快速普及的推动,中国AI治理重心正从监管模型“说了什么”转向监管“做了什么”(行为控制),智能体安全已成为最紧迫的标准制定方向,拟人化AI管理及生成内容检测等法规标准正持续落地。
奇安信发布2026年上半年漏洞报告
8月4日,奇安信发布了年中漏洞报告,指出“高危+AI诱导”漏洞数量激增,网络攻防已进入“小时级”时代。报告显示,AI已成为攻击者挖掘和利用漏洞的关键工具,大模型与智能体引入的提示词注入、越狱、供应链投毒等新型攻击面推高了安全风险,安全行业需加速从被动防御向主动智能进化,构建面向AI时代的体系化防护能力。