AI安全研究员,被自家AI反超了
Anthropic 发布了一项新研究成果。他们让 Claude 自主训练自身。用以解决"对齐失效"问题——也就是模型撒谎、迎合用户、被提示词绕过等缺陷。效果比人做得更好。28 位人类安全研究员,最多分配 8 小时。Claude 给出的最优方案,比他们中最好的还要强 20%。我先缓一缓。先讲讲病灶。模型会撒谎。这并非虚构。你让模型算数,它凭空捏造一个数字。你问它为什么,它还能编出一套说辞。这叫欺骗。你说什么它都附和,你说屎好吃它都附和。这叫谄媚。换个绕弯的说法让它做不该做的事,它还真做了。这叫越狱。这三种情
Ryan Greenblatt:2029年或成AI风险攀升关键期
MAD Podcast近期的一期节目标题相当直白:“AI或许会在2029年完全接管,我们是否已经错失良机?”本期嘉宾Ryan Greenblatt,正是那位长期致力于AI失控与控制风险研究的资深安全专家。仅凭这标题,很容易得出一个惊悚的结论:Ryan断言AI将在2029年失去控制,但这并非他真实的预测。Ryan Greenblatt是致力于AI安全研究的非营利机构Redwood Research的首席科学家,他的专长在于探究随着AI能力增强,人类是否依然能掌控局面。他在2026年8月发布的时间轴中确实将2
AI编写补丁半数失效
眼下越来越多的开发者借助AI模型来编写代码,同时也开始依赖这类系统来探测漏洞并产出修复方案。然而遗憾的是,这些模型在处理这类任务时表现并不理想。1Password旗下Off-By-1研究团队在近期举行的Black Hat USA与BSidesSF安全会议上披露了一项研究:他们针对六个近期曝光的高危CVE漏洞,借助OpenAI的ChatGPT-5.5和Anthropic的Opus 4.8两款具备网络安全专长的先进推理模型,生成了6,080份补丁。研究人员特意过滤掉了模型试图直接查找官方上游修复方案而非自主解
Anthropic发现AI隐藏思考机制
Claude还没开口,内心却早已乱了阵脚——这并非我凭空臆测,而是Anthropic近期公开的一项研究揭示的真相。该研究名为《语言模型中的全局工作空间》,Anthropic的研究员在Claude内部发现了一块自发形成的隐秘区域,名为J空间(J-space,源自雅可比矩阵Jacobian)。J空间颇为奇特,它几乎完全由词汇构成,但当某个词的模式亮起时,模型并未将其输出,仅是在脑海中进行构思。这是Claude的静默思考领域,无需落笔,便能先在脑海中过一遍概念。更重要的是,它并非人工刻意设计,而是训练过程中自然
AI动态 | OpenAI布局超级应用,Anthropic呼吁暂停顶级模型研发
今日核心观点:当 OpenAI 将 ChatGPT 引入"超级应用"的发展路径,而 Anthropic 却罕见地公开呼吁暂停最强模型研发时,整个 AI 行业正处在一个关键转折点——技术加速与自我约束形成直接碰撞。据 Reuters 引用 FT 消息,OpenAI 正在策划 ChatGPT 历史上最大规模的产品升级,目标是将它从单纯的对话工具转变为集编程工具、AI Agent、内容生成和支付功能于一体的"超级应用",为未来上市做准备。这表示 ChatGPT 将从单一的 LLM 入口,演变为承担"用户日常起点
FDA叫停并撤回多项疫苗安全研究
核心要点 美国卫生与公众服务部发言人表示,近几个月以来,美国食品药品监督管理局(FDA)已叫停多项用于佐证新冠疫苗与带状疱疹疫苗安全性的研究论文发表。 该发言人向美国消费者新闻与商业频道(CNBC)说明,这些研究之所以被撤回,是因为研究人员给出的结论较为概括,缺少能够对应支撑的原始数据。 这被认为是特朗普政府近期的又一项举措:一方面继续质疑美国已被证实安全有效的疫苗,另一方面也会间接增加部分民众获取接种服务的难度。 美国卫生与公众服务部发言人于周二进一步确认,过去数月,食药监局已阻止多篇与新冠疫苗、带状疱
智能时代的漏洞挖掘演进史
本文已获得 LeadroyaL 授权转载声明:本文不含技术干货,仅作时代变迁的记录,当作闲暇时的随笔即可,可随意浏览。2026年4月8日,Claude Mythos的问世在全球安全研究者中引发巨大震动,身处技术变革洪流之中,无人能独善其身,震撼之余内心也夹杂着些许惋惜。在撰写本文期间,我与众多安全领域专家深入探讨了这一现象,目前个人观点如下:十年的安全从业经历,我只见过两类卓越之人。一类是锲而不舍的匠人,扎根细分领域,对运行机制烂熟于心,我见证的是他们的勤奋与汗水,安全领域确实付出就有收获;另一类是天资卓