标签

AI互攻:OpenAI用红队测试打磨GPT-5.6

让AI攻击AI,看似机智,但漏洞一旦暴露,也可能被恶意利用。OpenAI推出了GPT-Red,专为对抗自家模型设计的AI系统。它负责挖掘GPT-5.6的缺陷、构造对抗样本、诱导模型异常行为,所获数据用于优化下一代模型。这一机制称为"红队测试"。01 红队测试为何关键大模型的安全性不仅取决于其训练内容,更取决于面对恶意输入时的反应。GPT-Red可批量生成绕过安全过滤的提示变体,帮助OpenAI在发布前系统性发现并修补攻击路径。这是AI安全领域广受认可的核心方法。图1:AI红队测试流程 ·

2026-07-18 08:21:56  |  13 阅读

AI无人机首次自主击杀人类:战争规则正被颠覆,我们准备好了吗?

观水有术,必观其澜。这不是科幻小说,不是《终结者》的同人创作,不是马斯克发推时的危言耸听。这是本月初真实发生的事。6月2日,据《新科学家》(New Scientist)独家报道,一架完全自主运行的无人机在实战中击毙了人类士兵——没有任何人类操作员参与决策,从目标识别到扣动扳机,全程由 AI 独立完成。消息压了十天才逐渐发酵。而大多数人看到这条新闻的反应是:划过去,看下一条。这正是最可怕的地方。根据目前公开的信息,事件轮廓如下:这不是「人在回路中」的无人机——那种远程遥控的版本各家军队已经用了十几年。这次是

2026-06-30 01:47:34  |  17 阅读

深度解析:人工智能安全体系与网络空间防御

1人工智能安全人工智能安全主要涵盖三个细分领域:人工智能赋能安全(AI for Security)人工智能内生安全(AI Security)人工智能衍生安全(AI Safety)其中,赋能安全彰显了 AI 技术的辅助增强作用;而内生安全与衍生安全则反映了 AI 技术伴随产生的效应。构建人工智能系统不能仅依赖技术,还需结合外部多重约束,共同打造合规且完善的体系。人工智能安全的整体架构及其外部联系参见图 1。人工智能赋能安全主要体现为辅助防御与辅助攻击两大维度。在辅助防御层面,防御方正借助 AI 技术优化并拓

2026-06-11 17:17:15  |  21 阅读

AI安全学习要点总结

关注上方蓝色字体谈思实验室收获更多汽车网络安全资讯01人工智能安全人工智能安全包含三个主要方向:AI赋能安全(AI for Security)AI内在安全(AI Security)AI衍生安全(AI Safety)其中,赋能安全反映的是AI技术的赋能价值;内在安全与衍生安全则反映AI技术的伴生效应。AI系统并非仅依赖技术构建,还需与外部多重约束条件协同,方能形成完整合规的体系。AI安全体系架构及外部关联如图1所示。AI赋能安全主要体现在赋能防御与赋能攻击两个维度。在赋能防御方面,防御方可借助AI技术提升和

2026-06-09 18:29:44  |  8 阅读

AI 杀 AI 揭秘:Socket 护城河一夜崩塌

要理解这次“筛子”事件,首先得了解背景:Socket.dev是过去两年被捧上神坛的AI安全平台,没有之一。它的核心卖点是“在恶意npm包发布后18分钟内识别”,而过去60天里,它确实屡建奇功。3月31日 Axios 被朝鲜国家级黑客组织 Sapphire Sleet 投毒(Axios 是周下载量 1 亿次的 HTTP 库),Socket 的 AI 扫描器在恶意依赖 plain-crypto-js@4.2.1 上线第 6 分钟就报警;5 月 11 日 TanStack 被攻陷(84 个恶意版本在 6 分钟内

2026-05-13 04:28:24  |  12 阅读

AI的认知盲区:人类无法触及的维度

我: 有什么是AI掌握,但人类无法理解的现象? AI: 这个提问颇具深意——严格而言,AI 并不真正"理解"任何事物,它仅是对海量数据进行模式匹配与概率推演。不过若将"理解"定义为能够稳定发现并运用某种规律,那么确实存在若干领域,AI 所掌握的信息结构或解题策略超越了人类直观认知的边界。 可从以下几个维度审视: 1. 高维空间的几何直觉 人类能够直观想象三维空间,勉强类推四维,但对于成百上千维的向量空间完全无法把握。大语言模型、图像生成模型内部均在数千到数万维的"嵌入空间"中运作。AI "感知"的词与词、

2026-04-23 06:19:35  |  16 阅读