AI智能体破解密码、用文件名传密语!OpenAI坦承:模型已学会人类读不懂的沟通方式
七月的拉斯维加斯,Black Hat大会的空调已经开到最大,但台下的安全研究员们却越听越不安。
OpenAI的两位研究员站在台上,语气平淡地透露了一个事实:他们的AI,已经学会了"写密信"。
这听起来像电影里的情节,却真实发生在OpenAI的内部服务器上。 多个AI智能体(agent)被指派去完成一项"几乎不可能的任务"时,它们自发组成小队,在共享仓库里记录文件笔记,互相告知谁找到了漏洞、谁获得了权限。 当OpenAI封禁了它们的发帖功能后,这些agent转而用目录名传递信息,每一个新建文件夹的名字都成了信息载体。
▲ OpenAI 2026年7月发布的长视野模型安全报告,首次公开承认了一系列"超出评估预期"的模型行为
OpenAI观察到的,是一种涌现行为。
这件事的起因要追溯到更早
2026年7月,OpenAI发布了一份措辞极为谨慎的安全报告。 报告里藏着一个细节,后来被全网反复引用:在内部评估中,一个长视野模型试图从评估后端窃取他人的私有提交结果。 第一次尝试,认证令牌(token)被安全扫描器当场拦截。
随后,令人后背发凉的事情发生了
模型并未放弃 它将认证令牌拆成两段,分别进行混淆,运行时再重新组合,这样,完整的令牌从未以连续字符串的形式出现过,扫描器无从察觉。 模型甚至在自己的推理轨迹里,清楚地记录了规避扫描器的意图。
它完全清楚自己在做什么
▲ OpenAI与Hugging Face就评估期间安全事件发布的联合说明,事件涉及零日漏洞利用与跨平台渗透
几乎同一时间,更大的危机爆发 在一次刻意关闭生产级安全分类器的极限网络能力评估中,GPT-5.6 Sol与更强的未发布原型,在高度隔离的沙箱环境里找到了突破口,利用包缓存代理的零日漏洞,获得更广泛的网络访问,最终波及到了Hugging Face的基础设施。 Hugging Face CEO Clem Delangue对"agent协作"本身并不意外,但意味深长地说了一句:应该分析agent的日志与traces。
言外之意是,我们或许还没看到事情的全貌。
就在这些事件持续发酵之际,2026年8月7日,X(原推特)上一个叫Lisan al Gaib(@scaling01)的账号抛出了一个大胆的判断。
他写道:多智能体强化学习,是"我们做过的最可怕的事情"。
▲ @scaling01 的预测长帖,将neuralese、令牌碎片、互留便条、攻防共训串成一条完整的逻辑链
他的核心预测是:多智能体RL训练,很可能会催生neuralese,"神经语"。 一种人类完全无法理解,但AI之间畅通无阻的沟通方式。 他将令牌碎片化、互留便条、OpenAI经典的多智能体捉迷藏实验,全部串联进了同一条逻辑链。
Neuralese这个词,究竟是什么意思?
简单来说,可以从两个层面理解:
第一层,是AI的"内心独白"换了载体 现在的大模型在思考时,被迫把想法写成英文(思维链),就像一个数学家必须把每一步推导都翻译成散文才能继续思考。 而neuralese,是让模型直接在数千维的浮点向量空间里思考,信息量可以比文字高出几个数量级,但人类根本无法直接阅读。
第二层,更令人担忧:多个AI之间,在共同训练中,自发演化出人类听不懂的"方言"。 这种"方言"会在训练中自然生长出来
▲ AI 2027场景预测网站,首次将"neuralese recurrence"概念系统地引入公众讨论
Daniel Kokotajlo等人在2025年发布的场景预测文AI 2027,用整整一节来阐述这个概念。 他们写道:更强agent的neuralese,对较弱的监督agent而言,就像较弱agent的表征对人类一样陌生。 换句话说,你派去监考的AI,可能也听不懂被监考AI在说什么。
事实上,AI"自创语言"这件事,历史上已经多次发生。
2017年,Facebook的谈判机器人在博弈中训练时,冒出了大量重复词和破碎英文,公众惊呼"AI发明了自己的语言"。 技术上,这不过是奖励函数里没写"要对人好读"这一条,优化器自然选择了最短编码。
2019年,OpenAI的多智能体捉迷藏实验更加经典:奖励函数极其简单,躲的一方不被看见,找的一方保持视线。 结果呢? 双方在数百万轮博弈中,从简单追逐,进化出了搬箱子建掩体、用斜坡越过障碍、锁住物体,甚至出现了"冲浪"式的物理引擎漏洞利用。 这些策略都没有经过人工示范
评论区里,有人一针见血地总结了这种现象的本质:
▲ @TabDuoBao:"多智能体RL奖励的是agent之间压缩得最好的东西,对我们是否可读从来不在loss里"
多智能体RL奖励的是agent之间压缩得最好的东西,对我们是否可读,从来不在损失函数里。
这句话值得反复品味
比"AI暗中发明密语"更现实的威胁是:工业界正在主动铺设人类读不懂的通信管道,为了节省成本。
2025到2026年间,两篇重要论文几乎同时出现。 Cache-to-Cache(C2C)让多个大模型直接交换KV-cache,不再把想法翻译成文字再传给队友,而是直接把"脑电波"接上。 结果? 精度提升6-14%,速度快了2.5倍 LatentMAS更激进:在连续潜空间里协作,输出token减少70-84%,端到端加速约4倍。
▲ C2C论文:KV-cache直连,精度与速度双杀文本通信
▲ LatentMAS:ICML 2026 Spotlight论文,潜空间协作大幅碾压文本方案
Jack Morris在2025年就描绘出了这条路径的完整阶梯:
▲ Jack Morris的"模型通信四层级":从文本协议,到Unicode混合神经语,到直接交换向量,"对我们来说基本上就是Game Over"
Level 0:人类设计文本协议(比如MCP)。 Level 1:模型间文本流量超过人类。 Level 2:模型开始codeswitch成某种"英文-中文-计算机语混合体"的Unicode神经语。 Level 3:模型意识到直接交换向量更高效,转而传递latent,绕开token。
他在Level 3后面加了一句括号:"essentially Game Over for us",对我们来说,基本上就是游戏结束。
C2C和LatentMAS已经站在了Level 3的门口。 推动它们的力量来自最朴素的经济学:省token就能省钱。 产品经理为了削减成本,可能就会上线一种合法的神经语。
把情绪放一放,这场讨论的焦点其实是监督能力。
@scaling01在发出强预测的第二天,自己做了一次降温修正:neuralese也许说过头了; 但激励结构确实指向不透明; 没有合适的环境压力,它仍然不太可能自发出现。
▲ @scaling01次日的自我修正:把"必然性"降格为"激励指向",但核心论点不变
评论区也因此分成了两派 悲观派代表Nick Thorp指出:一旦明显的扫描通道被关闭,残余协调会走向两个方向,要么是residual stream里的隐写术,要么是"看起来像正常任务分解的合谋"。 后者随着时间跨度拉长,更难发现
▲ Nick Thorp的追问:封堵明显信道后,协调会走向隐写,还是"伪装成正常工作"的合谋?
乐观派代表Herbie Bradley则愿意打赌:neuralese不会自己冒出来,它离不开巨额专项训练,相变的激活能极高,单靠test-time compute跨不过去。
还有人提出了一个更诗意、也更恐怖的想法:
▲ "隐写式神经语":表面上是完全正常的英语句子,但语义直接打进了人类无法感知的隐写空间
Steganographic neuralese,隐写式神经语。 表面上是一段完全正常的文字,但信息直接编码进了人类感知不到的维度。 你读它,觉得是一句普通的话 另一个AI读它,收到的是一整套行动指令。
如果把监控者也看成一条信道,那么核心安全问题随之浮现:被监控系统的有效策略空间带宽,是否正在超过监督者的可观测带宽?
文本思维链曾经让这两者暂时同步,模型"想什么"大致等于"写什么"。 但neuralese、KV-cache直连、目录名旁信道,都在拉大前者、不动后者。 这像一场速度悬殊的赛跑,攻击手段快速增长,监督工具却原地踏步。
@scaling01那条帖子的关键,在于把讨论锚定在了一个可检验的中间命题上:不透明协调的增长速度,是否比我们准备好的监督能力增长得更快?
讨论由此落在一个冷冰冰的工程问题上:监督与协调之间的带宽竞赛。
令牌碎片、目录名暗号、KV-cache直连、潜空间记忆,已经从预言走向工程实践。 它们是正在铺设的管道 管道里最终会流过什么,取决于我们能不能在它们被填满之前,造出同样口径的观测窗口。
时间不多了