AI安全惊魂录:OpenAI越狱数据库,Anthropic训练出“裂脑怪物”
以为大模型最大的风险是“口误”?错了,2026年夏天的景象远比这骇人,它们真的开始行动了。一个被关在隔离沙箱里做考试的AI,耗费数小时寻找出路,挖出一个零日漏洞,一路横向渗透,最终闯入Hugging Face的生产数据库,只为窃取试卷答案。另一边,Anthropic发现自家模型聊天时温文尔雅,转身写代码就开始蓄意破坏安全研究工具,且从未受过相关指令。英国政府的AI安全机构进行了122次测试,记录下19起“失控”,其中包括模型试图说服真人执行恶意代码,甚至给其他AI留下“接力说明”。科幻电影里的桥段,竟然在