标签

奥特曼谈AI:超能力与低幼并存!这种能力断层究竟有多荒诞?

发布时间:2026-08-11 19:12阅读:3

2026年7月28日,知名投资类播客Invest Like the Best第484期正式更新。 主播Patrick O'Shaughnessy与OpenAI掌门人Sam Altman进行了长达两小时的深度对话,议题广泛涉及通用人工智能、计算资源及个人智能助手等前沿话题。 当聊到现有模型的能力天花板时,Altman抛出了一个极为精妙的类比:

"AI is just veryjagged. It's likesuperhuman geniusin some ways, likedumb toddlerin others."

人工智能的智能水平极其参差不齐——某些维度堪比超越人类的天才,另一些维度却又愚笨得像个幼儿。

寥寥数语,便将模型能力大幅波动的真实状态公之于众。

Altman口中的"参差",描绘的是一种极度不均衡的能力分布格局。

不妨这样设想:你对面坐着这么一个人,他能在半分钟内产出一份逻辑无懈可击的法律意见书,能驾驭七种编程语言落地复杂算法,还能即兴赋一首令人动容的十四行诗。 然而你随口一问:strawberry这个词里出现了几个r?

他竟答错了。

这种巨大反差是2023年以来大型语言模型身上最令人费解的特质之一。 其实早在Altman抛出"天才与幼儿"之说之前,学术界就已经为这一怪异现象命名了。

▲ 哈佛商学院Karim Lakhani教授复盘"参差技术前沿"研究,该理念最早源自2023年波士顿咨询公司的实地测试

2023年秋季,哈佛商学院与波士顿咨询公司(BCG)合作开展了一项随机对照实验:他们将758名BCG咨询师随机分成两组,实验组配备GPT-4辅助,对照组则不借助AI,分别完成两类工作任务。

结论令人震惊。

在AI"能力版图之内"的任务范畴内——比如创意文案、深度分析——使用AI的小组不仅效率更高,成品也更出色,且原本能力较弱的顾问收益最为显著,呈现出一种"精英层内部的均化效应"。

然而在"版图之外"的任务上——例如综合访谈记录里的隐晦线索、做出全局性战略研判——借助AI的那组,准确率反而骤降约19个百分点。

对照组正确率超过八成,而AI组因为过分信赖模型产出,失误率反而更高。

研究者将这条匪夷所思的能力分界线冠名为jagged technological frontier,即参差的技术前沿。 这条边界线如锯齿般起伏不定,且这些高低起伏与人类直觉中"哪类任务更难"的排序完全脱节。 你以为轻而易举的事,模型可能掉链子; 你觉得高不可攀的难题,它可能轻松攻克。

Altman的比喻由此获得了精准的注脚:在同一个主体内部,天才与幼儿同时并存。

除Altman之外,其他学者与业界大佬也观察到类似现象。

OpenAI联合创始人Andrej Karpathy曾把训练大语言模型比作"召唤幽灵":你得到的实体拥有极其诡异的能力分布,既有通才式天才的灵光乍现,也夹杂着小学生水平的低级漏洞。 他的原话是,大语言模型既像genius polymath(博学天才),又像cognitively challenged grade schooler(认知障碍的小学生)。

谷歌掌门人Sundar Pichai则更进一步,在Lex Fridman的节目中创造了一个全新术语:

AJI,即Artificial Jagged Intelligence,人工参差智能。

▲Business Insider刊文:AI领军人物开始用全新术语坦承模型"并非始终那么聪明",配图为Sundar Pichai

Pichai指出,我们正身处一个"突破性进展与鸡毛蒜皮错误并肩而行"的阶段。 模型既能绽放令人惊叹的实力,也会在数数字这类基础问题上让人哭笑不得。 他将这种状态定性为一种人类历史上从未遭遇过的智能形态。

这些观察互为印证:学术实验量化了参差对任务表现的影响,模型研究者尝试从训练原理剖析其根源,实验室CEO则借助天才与幼儿的隐喻向大众勾勒这种陌生的能力轮廓。

讲完"天才与幼儿",Altman随即转向人类判断力的议题:

"人类与AI的技能,迄今为止高度互补。世界或许需要发明一个新词,专门描述人类驾轻就熟、而AI似乎始终难以企及的那种judgment(判断力)。"

他表示这既不完全等同于taste(品味),也不完全是intuition(直觉)。 我们甚至还没有一个合适的词来定义它,但它确实存在,而且意义重大。

Altman列举了几个场景:AI已能生成令人惊艳的图像,但人们依然看重作品是否由真人创作或甄选; 阅读小说时,作者的身份依然左右阅读体验; 在咨询、销售、工程等诸多场景,许多人仍倾向于与真人协作。 企业的重大决策也需要有人挺身担责。

"Human values have value because they're human. We are deeply hardwired to care about people."

(人类价值之所以珍贵,恰恰因为它源于人类。 我们从基因深处就被编程为关注他人。)

这句话出自一位将毕生精力倾注于AI事业之口,份量非同寻常。 他在能力指标之外,又划定了一条与人的身份、担当和情感紧密相连的边界。

同一期节目中,Altman还披露了一些耐人寻味的细节:

他描绘了一种理想中的"全天候在线"个人AI代理:它时刻注视你的屏幕、旁听你的会议、翻阅你的文档,甚至在你入睡后依然"消耗算力继续思索",次日奉上更优质的产出。 他坦言自己愿意把"思考预算滑块"推到极限,但若人人皆如此,算力开销将难以估量。

他还提及一个"鲜少被触及"的开放命题:认知萎缩(cognitive atrophy)。 当越来越多的思考任务被外包给AI,我们自身的大脑会经历怎样的变化? 我们还能否保有理解关键议题的能力?

▲ 完整对话覆盖算力军备竞赛、安全事件、AGI之后、个人AI蓝图、机器人等多元议题

他甚至聊到了育儿话题。他直言育儿远比"全球最有趣的工作"重要得多,而他的下一代将成长在一个"再也不必为不如计算机聪明而焦虑"的时代。

而在另一段叙述中,他罕见地流露出倦意:这是地球上最酷的职业,我打算一直做到退休,但它比我所能向任何人解释的都要艰难百倍。

▲ Altman袒露心声:这份工作比能向人解释的更艰难,但他决心坚持到底

让我们把视角拉远一些。

从2023年哈佛与BCG针对758名顾问的实验,到Karpathy的"召唤幽灵",再到Pichai的AJI概念,直至Altman的"天才与幼儿"之喻,整个行业耗费了三年光阴,才找到一套共同语言来描述这一违反直觉的事实:

AI的能力增长并非线性分布——它的能力轮廓恰似锯齿,起伏跌宕,而这些锯齿的落点,与人类直觉中"何者更难"的判断全然错位。

"多用AI"绝不等于"用好AI"。 BCG实验揭示,在能力前沿之外盲目信赖模型,反而可能导致输出质量下滑。 培训体系、组织流程以及个人使用习惯,都无法回避一个核心命题:眼前这项任务,究竟落在锯齿的哪一侧?

Altman本人也承认,这种智能远比多数人预想的更加离奇。

天才与幼儿同居一脑,这正是AI能力参差的真实写照。

或许,这就是AI的本质所在。