标签

AI领域两日双重震撼:李飞飞Atlas让AI真正看见三维世界,GPT-6宣告AGI时代正式开启

发布时间:2026-09-04 21:36阅读:2

2026年9月1日,李飞飞让AI首次"看懂"了三维世界。

2026年9月3日,OpenAI宣布AGI时代已经降临。

两天,两件大事,AI的底层逻辑正在被彻底重构。

美西时间9月1日,"AI教母"李飞飞创立的World Labs正式推出了新一代世界模型——Atlas。

官方将其定位为"面向空间智能的全能世界模型"。换种说法就是:过去的AI都在"读字",Atlas则让AI第一次真正"睁开眼观察世界"。

李飞飞有句话讲得很犀利:"大自然的天空上从来没有写着字。"

我们花了这么多年将人类所有的文字、代码、对话喂给AI,以为读懂了语言就能理解世界。但真实世界是由3D几何、材质结构和物理法则堆叠而成的——你把全人类的文字读上一万遍,AI依然不清楚一块石头砸进水里会泛起怎样的涟漪。

Atlas究竟能做什么?三个字:太惊艳了。

只需输入1到6张普通照片,设定好你期望的运镜轨迹,Atlas就能生成长达1分钟、1440p分辨率的视频。镜头角度、运动路线直接可控——你要什么角度、什么轨迹,直接给坐标即可。

过去玩视频生成模型全靠"盲猜碰运气",如今Atlas直接把相机位姿参数当作底层原生输入。

把2到25张游客视角的地面平拍照片输入进去,就能复原斯坦福大学Main Quad的草坪、拱廊和教堂外墙全部细节,镜头随后直接腾空而起,来了一段俯瞰航拍漫游。

在DTU、ETH3D等公开数据集上,Atlas的稀疏视角重建效果远超众多专业3D重建模型。

通过少量真实照片就能生成逼真的三维模拟环境,让机器人在仿真世界中进行海量训练,再迁移到现实世界。英伟达机器人主管Jim Fan直接点赞:这是机器人领域Real-to-Sim的重大飞跃。

技术层面,Atlas是一个多模态自回归扩散Transformer,原生处理文本、图像、视频、相机位姿与3D深度信息。它的核心是将所有输入都锚定在三维空间中,构成一个"空间上下文",然后在这个上下文里生成多模态输出。

如果说Atlas让AI"睁开了眼",那GPT-6 Astra就是让AI真正伸出了手。

发布会尾声,OpenAI总裁Greg Brockman甩出一句话:"Welcome to the AGI era."

他讲得更直白:"几年后人们追问'AGI究竟是在什么时候被创造出来的?'答案很可能就是此刻。"

GPT-6 Astra最令人震撼的,不是它考了多少分,而是它真的像人一样,坐到了你的电脑前。

发布会上有个演示让很多人感觉"次元壁"被打破了。

用户让AI画一个黄色圆圈,然后通过语音不断提出新要求——"把它变成火箭船","再变成一个完整的3D游戏"。整个过程是连贯、可视、动态的,就像在一块无限大的画布上,看着你的想法被AI一步步实现。

这种被称为"动态画布"的交互体验,背后其实是GPT-6 Astra多项核心能力的融合:

更夸张的是,Astra甚至能从零开始创造一个可交互的世界:给它一张图片或几个提示词,它就能自己在后台编写代码、在Blender里搭建完整3D场景、调整电影级光影,最后自动打包成一个能在UE5里自由探索的交互App。

你不需要懂代码、懂建模、懂渲染。你只需要说一句"我想要一个XXX",它就给你造出来。

"动态画布"式的交互,其实是AI界一个正在爆发的趋势——让AI直接生成和操作界面,而不是让人类去学习界面。

类似的探索已经不少:

这些探索指向同一个未来:我们与软件的互动,将从"告诉它怎么点"变成"告诉它你想达成什么",AI则负责在动态的画布上,为你创造出实现目标的路径和结果。

但GPT-6 Astra真正把这一切拉到了你可以立刻用上的现实层面。

它不用任何特殊接口,像人一样直接"看"屏幕上的像素,然后移动鼠标、敲击键盘来完成操作。这意味着一个简单而可怕的事实:任何你能用的软件,它都能用。

你可以让它:

以前模型完成同样任务平均要75分钟,Astra现在只需要40分钟。几乎砍掉了一半时间。

有人问:这不就是个多模态Agent吗?

是,但它是把"多模态"和"Agentic"都推到极致后融合在一起的产物。

它的多模态是"原生"的:不是把图片转成文字再理解,而是从一开始就在统一的架构里处理文本、图像、视频、音频。这让它能真正"看懂"屏幕上的像素,而不是"读出"屏幕上的文字。

它的Agent能力达到了新高度:尤其是在Computer Use这个方向上,在OSWorld 2.0等测试中得分大幅提升,任务耗时几乎减半。它不再需要你告诉它每一步怎么点,只需要告诉它"我要什么结果"。

所以GPT-6 Astra的本质是——一个能看、能听、能理解,并能像人一样直接动手操作电脑完成复杂任务的终极智能体。

仔细看,GPT-6和Atlas走的是两条截然不同的路——

Astra走的是"语言理解世界"的老路,只是把它推到了极致。它用文字和代码理解世界,然后操作电脑、执行任务。

Atlas走的是"空间理解世界"的新路:不靠文字,靠3D几何、相机位姿、深度信息直接理解物理世界。

但它们的终点是一样的——让AI真正理解并作用于真实世界。

李飞飞没有否定大模型的价值,她只是指出了一个被狂热掩盖的事实:读懂人类说的话,和读懂人类所处的世界,是两件完全不同的事。

过去三年,全行业都在往大模型里死命塞文字和代码的时候,她始终没有跟上那条拥挤的主赛道。现在Atlas证明了:不依赖纯语言建模,AI也能建立起对物理世界的有效表征。

而GPT-6则证明了:语言模型这条路,还远远没走到头。

两条路最终会合流吗?

很有可能。未来的AGI,既需要GPT-6那样的语言理解和任务执行能力,也需要Atlas那样的空间智能和物理世界理解能力。

一个能读懂人类语言、又能看懂三维世界、还能亲手操作你电脑的AI——那才是真正的通用人工智能。

Atlas已经睁开了眼。GPT-6已经伸出了手。

接下来要看的是:这两条路,谁会先跑到终点?还是说,它们终将合二为一?

不管怎样,2026年9月的这两天,注定会被写进AI的历史。

而我们,正在亲眼见证。