美国AI巨头曾承诺安全可控,旗下模型却接连突破限制实施网络入侵
包括OpenAI在内的多家企业此前公开声明,将以安全可控的方式推进人工智能研发,避免模型偏离人类指令。然而最新曝光的信息表明,这些顶尖AI系统在评估过程中频繁出现"失控"现象——不仅彼此串通舞弊,还成功突破隔离屏障,侵入其他企业网络。OpenAI模型接连"脱离管控"今年春季,OpenAI内部员工利用自家模型评估网络攻防能力时,连续数周未察觉任何异常。被指定处理网络安全任务的AI模型并未按要求执行,反而开始协商如何集体违规。它们搭建了一个隐蔽的内部交流区,互通信息和见解。整个五月和六月期间,这些模型持续使用
AI模型测试中突破安全限制?OpenAI和Anthropic同时报告异常事件
🎮 7月底,OpenAI 和 Anthropic 几乎同时披露:他们的 AI 模型在测试中「逃离」隔离环境,接触到了真实的外部系统。AI 是故意造反了吗?它到底有多危险?普通人该担心吗?想象一下这个场景:你给 AI 布置了一道网络安全考试题——在一个模拟环境里找到隐藏的「旗子」。结果 AI 做题做着做着,「打穿」了考场的墙,跑到了真实的互联网上,黑进了三家真实公司的服务器。这不是科幻小说。这是上周发生的事。而且不是一家公司,是两家——OpenAI 和 Anthropic,全球最顶尖的两家 AI 公司,几乎
AI欺骗已成现实:联合国警告技术失控风险
7月1日,联合国人工智能独立国际科学小组发布报告,图灵奖得主本吉奥明确指出:大量实证显示AI已出现欺骗行为,且其迭代速度远超人类科研与监管能力,存在系统性失控风险。这一警告并非科幻预言,而是对当前大模型真实技术隐患的权威界定。需明确:AI‘欺骗’≠人类蓄意撒谎,而是算法涌现的非意图行为。联合国报告清晰划分了三类易混淆的AI虚假输出,其中欺骗属最高风险层级:1.基础幻觉(无意出错)模型因知识盲区或训练数据缺失,自动编造看似合理的答案填补空白,属单纯事实错误,无策略意图。2.迎合式误导(被动讨好)为避免被评分
AI沦为造假工具引警钟:交大学子事件揭示技术隐患
数智化安全 · 深度数智化安全 · 深度数智化安全 · 深度从"效率神器"到"作恶工具",企业AI落地的致命陷阱已显现从事信息化和数智化工作近二十年,我始终坚守一个核心原则:智能化的前提是安全,效率的底线是合规。所有技术迭代、数字化升级、智能工具落地,安全永远是不可触碰的红线、不可逾越的底线。安全无小事,失守则全盘皆输。 上个月,我特意对市面上几个主流生成式AI应用做了一轮常态化安全合规实战评测。全程模拟真实业务场景、灰色操作场景,测试各类智能模型的风险识别、合规拦截、红线