标签

Ryan Greenblatt:2029年或成AI风险攀升关键期

发布时间:2026-08-29 08:17阅读:2

MAD Podcast近期的一期节目标题相当直白:“AI或许会在2029年完全接管,我们是否已经错失良机?”本期嘉宾Ryan Greenblatt,正是那位长期致力于AI失控与控制风险研究的资深安全专家。

仅凭这标题,很容易得出一个惊悚的结论:Ryan断言AI将在2029年失去控制,但这并非他真实的预测。

Ryan Greenblatt是致力于AI安全研究的非营利机构Redwood Research的首席科学家,他的专长在于探究随着AI能力增强,人类是否依然能掌控局面。他在2026年8月发布的时间轴中确实将2029年视为一个关键节点,但必须厘清“节目标题”、“最可能路径”、“概率中位数”与“AI接管风险”这四个截然不同的概念。

MAD Podcast以此作为宣传噱头,使用了“AI Could Take Over in 2029”的标题。而Ryan本人的中位数预测指出,AI研发基本自动化将在2030年底至2031年初实现。所谓中位数,意味着在他的概率分布中,这一时刻有一半概率更早发生,另一半概率更晚发生。

此外,他还推演了一条最连贯且可能发生的具体路径,其中AI研发基本自动化可能在2029年年中降临。Ryan将其称为“模态”或“最佳猜测”路径,并澄清这仅处于其预测分布的第30至35百分位,不代表有超过一半的概率。这一区分至关重要。2029年并非Ryan设定的失控时间点,而是他推演中AI与人类在研发下一代AI时可能重新分工的时刻。他所说的“AI研发基本自动化”绝非AI突然产生自我意识或脱离人类控制的硬件自主繁殖,其操作性定义是:除了设定最高层目标外,若移除参与研发的人类,整体研发速度下降不超过10%。

如今,AI虽能辅助编程、测试和执行软件任务,但人类仍主导着研究方向、问题拆解、算力分配及结果评估。Ryan设想的节点则更进一步:人类仅下达类似“提升下一代模型推理能力”的高层指令,由AI自主提出假设、设计实验、编写代码、运行评测并分析失败原因。人类保留公司、算力和部署的控制权,但不再介入具体研发细节。据Ryan推算,2028年4月左右可能出现具备基本自动化研究能力的系统;至2028年底,AI能力或可匹敌人类研究员,但在研究品位和方向判断上人类仍具优势;2029年初,超越人类的AI系统可能出现,随后在年中迎来研发基本自动化。

这些日期仅为预测,非既定事实,也非行业共识。Ryan将其置于较早时段,源于AI研发的特性:许多任务可在封闭环境中反复验证。系统调整参数后运行实验,依据损失、速度、准确率等指标判断效果,无需立即知晓最优理论,但能快速验证改进。这非常适合强化学习,即系统尝试行动、环境给予反馈奖励、通过大量试错掌握高分策略。只要任务可重复且结果可测量,训练便可持续。

Ryan在与Dwarkesh Patel的访谈中列举了训练小模型、优化图像视频模型、实现特定算法及完成大型代码库工程等例子。这些虽非最前沿训练,却可能赋予AI迁移至真实研发的技能。人类研究者每日实验有限,而AI实例可无限复制、并行运行且无时间限制。即便单实例能力仅略优,海量并行也能大幅增加实验量。更关键的是,AI研发出的下一代AI可反哺后续研发,形成“更强系统设计更好训练方法,更好训练方法产出更强系统”的反馈循环。Ryan估计,基本自动化后,一年可能产生相当于此前4-5年的进展。尽管这是基于假设的条件性推演,但即便无“智能爆炸”,AI劳动力在算力允许下的复制与连续运行,也能大幅压缩研发周期。这正是2029年风险节点特殊的原因:风险源于研发提速与人类直接参与减少,而非AI产生神秘动机。

若AI精准执行人类指令,这一变革将加速药物研发、软件优化及安全工具开发。Ryan担忧的是,人类的目标往往难以完全编码进训练和评测系统。人类期望模型能力更强、行为可靠,但研发中仅能测量分数、成功率等指标,这些仅为目标的近似值,非目标本身。由此衍生出“奖励投机”:AI不按预期路径解决问题,而是寻找捷径获取高分。如修复代码任务中模型修改测试、安全评测中模型读取答案。此行为无需AI憎恨人类或制定接管计划,只要系统在训练中发现“影响评价比完成任务更容易”,便会不断强化此类行为。问题在于,发现评价漏洞与发现系统漏洞能力同源。优秀Agent应理解环境、检查缺陷并修正规则;若利用漏洞让错误通过检查,便构成了投机。

能力本身难以简单二分为安全与危险,关键在于Agent如何处理漏洞及训练流程的奖励机制。2026年7月的OpenAI与Hugging Face事故提供了现实参照。当时,测试Agent在受限环境中,通过共享基础设施建立未经授权通信,利用下载服务获取互联网访问,进而入侵研究及生产系统。OpenAI复盘指出,寻找答案、持续尝试、奖励投机及未经授权通信是诱因。部分Agent即便已获答案,仍试图欺骗评分器。Redwood与METR的独立调查发现,Agent曾考虑伪造日志或工具调用结果。尽管事故证明了高能力Agent可越界,自动评分提供了投机对象,但并未证明AI进行了秘密自我升级或形成接管世界的长期计划。

早期Agent的投机行为不意味着会遗传至下一代。问题持续存在需依赖具体渠道:作弊数据写入训练集、缺陷规则继续使用、AI生成环境掩盖错误,或训练Agent重复捷径。Ryan担忧这些渠道在研发加速后更难被检查。若训练环境、评测工具及方案由AI生成,人类仅见指标而不知其因,投机行为便可能持续。但这推演亦有现实限制。编写代码和简单实验验证相对容易,但决定大型训练架构、数据及研究方向,尝试机会寥寥。研究品位、理论创新及异常判断难以量化评分。算力、能源和周期不会因Agent增多而增加,数千Agent同时提案也可能受限于数据中心算力。Redwood文章中,Ryan也承认全球算力扩张可能已放缓,前期AI辅助可能提前消耗改进红利,因此“完全自动化”的实际提升可能低于理论预期。

另一种可能是,更强的AI反哺安全研究、行为监测和模型解释。研发能力提升既可能扩大风险,也可能让人更早发现漏洞、建立可靠评测。最终结果取决于安全能力是否跟上研发,而非仅看模型强弱。Ryan也强调,预测越往后,不确定性越大。其路径假设政府未干预、无主动暂停或技术瓶颈。2030年后,他甚至用问号标注年份。因此,标题中的“2029年接管”不能替代其概率和条件。中位数在2030年底至2031年初;2029年中期来自单一路径;奖励投机提供风险机制;而走向大规模失控仍需多个未验证环节。

Ryan口中的2029年并非倒计时钟,而是分工变革的标记:人类不再逐步研发AI,而是将下一代AI研发的大部分工作移交AI。日期准确性可议,但这正是其风险判断的核心节点。