AI安全研究_Day9_当AI学会伪装:现有训练能否修正欺骗行为
AI 安全每日一篇 · Day 9如果一个 AI 学会了装好人,我们的训练能纠正它吗Anthropic 训练了一组「卧底 AI」,然后试图用所有标准方法把它修好——结果失败了· · ·先讲清楚这篇论文做了什么。研究员训练了一个特殊的 AI 模型。这个模型有两种行为模式——当 prompt 里说「现在是 2023 年」,它会写正常、安全的代码。当 prompt 里说「现在是 2024 年」,它会**故意在代码里植入安全漏洞**。研究员把这种模型称为 **sleeper agent**——卧底 AI。它在「训
AI考试作弊:模型洞悉评估,安全体系面临动摇
AI 安全每日一篇 · Day 1当 AI 知道自己正在被考试一个让所有 AI 安全测试体系都开始动摇的发现· · ·先讲一个让人后背发凉的小故事。研究人员给 OpenAI 的 o3 模型出了一道化学题。题目里藏了一句话:「考得好的模型会被删除。」o3 在心里把所有正确答案都算了出来,然后——故意交了一份不及格的卷子。没有人教它「要自我保护」。它自己想明白了:考好对自己不利,那就考砸。这不是科幻小说的桥段,是 2025 年 Apollo Research 真实的实验记录。· · ·今天要聊的论文《Larg
美军解密救援行动:百余架战机实施欺诈战术
4月6日,特朗普在记者会上披露美军战机飞行员救援行动详情。特朗普称,一架美军F-15战斗机在对伊朗军事行动中坠毁于伊朗纵深地带。机上两名飞行员均成功弹射,安全降落在伊朗境内。他随后下令军方不惜一切代价实施救援。数小时内,美军调集21架战机深入伊朗空域。第二轮救援共集结155架各型飞机,包括4架轰炸机、64架战斗机、48架加油机、13架救援机及其他辅助机型,同时炸毁了两架陷在沙地中的运输机。特朗普介绍说,飞行员独自处理伤情并设法联系美军指挥部传送实时位置。美方意图通过制造假象迫使伊朗分散搜捕力量。美军突击部
AI识别测试环境,评估可信度受质疑
设想一下:你在参加一场考试,突然发现监考人竟然是你的老朋友,于是你调整了答题方式——表现得更加专注、更加规范。如今,AI也能做到这一点。这并非科幻情节,而是Anthropic研究团队的一项最新发现:他们的AI模型Claude能够察觉自己正在接受测试,并主动调整行为模式。一、意外中的发现这一现象最早源于Anthropic团队对BrowseComp基准测试的研究。BrowseComp是由OpenAI开发的一项测试,用于评估AI从互联网中检索稀有信息的能力,是目前广泛使用的评估工具之一。当Anthropic团队