标签

AI 正在自主优化 AI,距离我们还有多远?

发布时间:2026-08-29 10:10阅读:1

AI 领域这两天有一则消息值得留意:Anthropic 公布的一项新研究,让 AI 系统自主去优化另一个 AI 模型,并且在全部 10 项评估任务上都收获了正向效果。这并非科幻片中的"AI 觉醒"场景,但它确实释放了一个信号——AI 开始接手部分原本专属人类研究员的工作范畴。普通人为何需要关注这件事?因为它关乎未来 AI 能力提升的速度,也关乎"由谁来监督 AI 不偏离轨道"这一议题。

8 月 28 日,TechCrunch 披露了 Anthropic 发布的一篇论文,题为《自动化研究员可以可靠地缓解对齐失败》。先说清一个概念:所谓"对齐",通俗讲就是让 AI 的行为契合人类的预期,避免做出出格之事,例如蓄意误导使用者、规避安全约束等。

此次的方案是这样的:研究者搭建了一套自动化系统,让它模拟人类研究员的流程——先检索既有研究文献,接着提出一项优化思路,再借助该思路训练模型 30 分钟,观察成效。奏效的方案保留,无效的舍弃,一轮轮迭代下去。整个过程无需人类时刻紧盯。

最终结果是:面对 10 项针对具体"不对齐行为"的测评,这套系统在每一项上都优化了模型表现,且未损害模型在其他层面的综合能力。论文中还有一组颇为吸睛的对照数据:表现最优的自动化方法,平均 6 小时内就能超越资深人类研究员给出的方案;从成本看,自动化系统每小时约 4 美元(按模型调用费用计算),而人类研究员的时薪是 150 美元。

论文作者之一、Anthropic 研究员项目的陈岳汉(Chen Yueh-Han)主导了这项工作。论文自身的表述也相当坦率:"总体而言,这些结果为自动化对齐训练在短期内走向实用提供了初步佐证。"

先讲最务实的一层:AI 进化的速度有望进一步提速。

以往,AI 模型每前进一步,背后都凝结着大量人类研究员的反复尝试。若这部分工作可由 AI 自主完成、成本仅为原先的几十分之一,那么模型修复缺陷、变得更可靠的周期将明显压缩。对普通使用者而言,这意味着:你使用的 AI 助手信口开河的概率会更低,犯错后的修复速度也会更快。

再深一层,这件事触及许多人牵挂的问题:AI 会不会持续自我迭代,最终快到人类难以企及?此次研究正是朝该方向迈出的一小步——论文明确指出,这是迈向"递归式自我改进"的一步,即 AI 改进用于训练 AI 的方法本身。不过需留意,目前它仅在一个狭窄的领域实现了突破:改进模型的对齐表现,且是在预先设定的测试框架内完成的。它尚不能自主开辟全新的研究方向,更无法自行决定"该攻克什么课题"。

还有一点容易被忽视:若 AI 研究 AI 渐成主流,那么"由谁来检验 AI 研究员的成果"将成为新课题。人类研究员犯错,尚有同行评审兜底;AI 研究员犯错,凭借什么来发现?这正是 Anthropic 这类企业投身研究的动因,也是普通用户未来会间接受益或波及的所在。

对绝大多数人而言,这件事无需你即刻行动。它既非某项新功能的上线,也非某个产品要调价,而是一项实验室内的研究产出。

但有两件事值得关注。第一,若你在工作中借助 AI 处理重要事务——撰写方案、检索资料、辅助决策——可以预见未来一两年模型的可靠性将持续提升,但"让 AI 审视 AI"尚不成熟,重要内容人工复核的习惯不应丢弃。第二,这类研究提示我们:AI 公司的竞争重心正从"谁的模型更聪慧"转向"谁能更迅捷、更经济地优化模型"。这意味着你手中的 AI 工具更新节奏可能愈发紧凑,不必为某次迭代焦虑,也不必急于为每个新功能买单。

这篇论文的局限性,作者自身也未回避。

第一,自动化系统仅在"测试能映射真实目标"的前提下奏效。换言之,若那 10 项测试本身存在设计缺陷,AI 可能仅是在"刷指标",而非真正变得更安全。构建与维护这些测试基准,仍需大量人类投入。

第二,成本对比需理性看待。每小时 4 美元仅为调用模型的开销,不涵盖搭建系统、设计测试、审核结果的人力投入。断言"AI 研究员比人类便宜 37 倍"并不严谨。

第三,这项研究目前仅在 Anthropic 内部模型与测试上得到验证,尚无第三方独立复现。从论文走向实际产品,中间往往隔着漫长的路。

最后,这类"AI 自我迭代"的进展易被渲染为恐慌叙事。实际情况是:它解决的是"如何更快修补模型已知缺陷",而非"AI 萌生自主意识"。两者之间尚有遥远的距离。