Vision Pro与AI交汇:未来或将迎来一位'伙伴'
今早醒来,我并没有计划专门去研究 Vision Pro。
只是打开京东 App 的时候,无意中扫了一眼自己的商品收藏夹,发现那台多年前收藏的 Apple Vision Pro 还静静地躺在那里。看到它的那一刻,我忽然意识到,自己已经很长一段时间没有留意过这台设备了。
于是我又打开今日头条,想看看最近 Vision Pro 的相关动态。当我在搜索框里敲下“为什么 Vision Pro”时,下方的搜索建议很快跳出了一条完整的问题:“为什么 Vision Pro 停产了?”
看到这几个字,我的第一反应是有些震惊。
苹果耗费多年心血打造的一台设备,难道这么快就要退出历史舞台了吗?它曾在发布时引发如此巨大的关注,为什么后来却慢慢淡出了普通消费者的视野?
当然,搜索框里的联想词未必能反映事情的真实状况,但这个偶然蹦出的问题,却让我开始重新审视 Vision Pro。
而且想着想着,我又回忆起几年前在深圳工作时,第一次真正上手体验 Vision Pro 的那一天。
那时候,我专门跑去 Apple Store 体验了那台设备。直到今天,我仍然清楚地记得第一次把它戴在头上的感受。在真正体验之前,我对 Vision Pro 的认识,其实和大多数人差不多:一台价格高昂的头显设备,一种更加高级的 VR,或者说是苹果对未来计算形态的一次大胆探索。
可当真正戴上之后,我发现它和我想象中的 VR 并不完全相同。
眼睛看向哪里,系统似乎就知道我在关注哪里;手指轻轻一捏,眼前的内容便会随之响应。不需要鼠标,不需要触控板,也不需要像过去很多 VR 设备那样,时刻握着两个控制器。
那种感觉很奇妙,也很难用参数精确表达。
还记得很多年前,也就是2011年左右吧!第一次接触 iPhone 4 时,我也曾有过类似的感觉。它带来的惊喜,并不仅仅是“屏幕更清晰”“性能更强”这类参数层面的提升,而更像是突然让我看到了一种此前从未真正接触过的产品形态。
所以那一天,我甚至真的动过购买 Vision Pro 的念头。
当然,它的价格对我而言并不便宜。但这么多年过去,我一直认为,“我暂时不舍得花这么多钱去买”和“这个产品根本不值这么多钱”,其实是两件完全不同的事。
真正体验过后,我反而能够理解,它为什么会卖到这样的价位。其中不仅包含两块显示屏,而是一整套极其复杂的技术体系:芯片、摄像头、传感器、眼球追踪、手势识别、空间定位、显示系统以及专门为这种设备量身打造的 visionOS。
只是,能够理解它为什么贵,并不意味着普通消费者就一定能够找到购买它的理由。
这或许恰恰是 Vision Pro 当下最现实的难题。
如果花两三万元买回来,最容易想到、也最能感受到价值的用途,最后还是看电影、看视频或者把电脑屏幕放大到眼前,那么无论这种体验多么震撼,对大多数普通人来说,它都很难成为一种每天必用的设备。
也正是在这里,我突然想到另一个问题:
如果未来的 Vision Pro 真正和 AI 深度融合,会发生什么?
这个念头冒出来后,很多原本看似彼此独立的技术,仿佛忽然被串联了起来。
仔细想想,Vision Pro 现在的操作方式,本身就已经颇具特色。当我们想选择一个对象时,先用眼睛看向它,再用手指轻轻一捏。如今,这只是 visionOS 的一种交互方式,但如果未来站在这套系统背后的,不再只是一个被动等待指令的操作系统,而是一个真正能够理解现实环境的 AI 呢?
也许那时候,眼睛的意义就不再局限于“移动光标”。
它能够告诉 AI,我正在关注什么。
当然,人眼并不会一直停留在某个固定位置。我们走在街上,会看路人、看汽车、看招牌、看天空,有时甚至只是无意识地扫过某个地方。因此,仅仅知道“我正在看哪里”,并不能完全代表我的真实意图。
这时候,手势就会变得尤为关键。
比如我来到一座完全陌生的城市,看到远处一栋很独特的建筑。我先看向那里,再伸手轻轻指一下,然后问一句:“那是什么?”
整个过程中,我无需掏出手机拍照,也不需要打开搜索软件,更不需要在照片上画一个红圈,再解释“我说的是画面右前方那栋灰色建筑”。
我的视线给出了大致范围,手势锁定了具体目标,而语言则表达了真正的问题。AI只需把这几种信息整合起来理解,就能知道我究竟在问什么。
这种交互方式听起来很前沿,但仔细想想,其实一点也不陌生。
因为人与人之间,本来就是这样沟通的。
我们和朋友一起走在街上的时候,从来不会告诉对方:“请看我视野右前方三十度方向、距离大约两百米的那个物体。”我们通常只是看过去,再用手指一下,然后说:“你看那个。”
对方往往立刻就能领会。
也许未来真正成熟的 AI,需要学习的恰恰不是让人掌握越来越复杂的操作规则,而是学会像人一样理解我们的眼神、动作、语言以及我们身处的环境。
想到这里,我又开始设想另外一种更贴近生活的场景。
假如有一天,我戴着这样的设备来到一座完全陌生的城市,需要去一个从未踏足的地方。我只需要告诉它:“带我去这里。”然后就可以直接出发。
一路上,我甚至不需要一直盯着悬浮在眼前的地图,也不一定需要道路上出现一根硕大的蓝色箭头。AI完全可以像一个熟悉当地的朋友一样,一边陪我走路,一边和我闲聊。
我们可能正在聊刚才路边发生的一件趣事,快到路口的时候,它忽然提醒一句:“前面右转。”我转过去以后,我们接着刚才的话题继续聊。
如果遇到一个特别复杂的岔路口,它甚至可以短暂地出现在我的视野旁边,用手势告诉我:“走这边。”等我走上正确的道路,它又重新安静下来。
想到这里,我反而觉得,未来真正高级的空间计算,也许并不是在人的视野里堆砌越来越多的信息。
它可能恰恰相反。
真正优秀的设计,应该懂得何时需要出现,也应该懂得何时什么都不要出现。
现在很多人想象 AR 或空间计算的时候,总喜欢在现实世界上叠加地图、天气、文字、广告、人物标签和各种数据。似乎眼前的信息越多,就代表技术越先进。
但如果真的每天生活在这样的世界里,人恐怕很快就会感到疲惫不堪。
一个真正成熟的 AI,不应该一直提醒我们“前方还有八百米”“当前速度多少”“右转还有多少秒”。它更应该像一个真正的朋友,只在我们需要知道的时候,说一句恰到好处的话。
它可以始终拥有能力,但绝大多数时候保持沉默。
这或许才是未来空间 AI 最舒适的形态。
而且继续往下想,AI 与 Vision Pro 的结合还可能解决当下人工智能一个非常突出的问题:它虽然越来越聪明,却依然和我们的现实世界隔着一道屏幕。
今天如果我在街上看到一辆不认识的汽车,想问 AI 这是什么车型,我通常需要先拿出手机拍照,然后把照片上传,再问它:“这是什么车?”
如果我看到一栋陌生的建筑,同样需要把现实世界先转化成照片或者文字,然后再交给 AI。
未来或许完全不需要这个过程。
因为 AI 和我正在“看同一个世界”。
我看到一辆车,可以直接问:“这是什么车型?”看到一栋建筑,可以随口问:“它是什么时候建的?”工作的时候,我盯着 Excel 里一个算错的公式,也可以直接问:“这里为什么不对?”
不需要截图,不需要复制,不需要重新解释上下文。
因为 AI 本来就清楚我正在看什么。
到了这个阶段,它就不再只是一个被装在手机或电脑里的工具,而开始真正融入人的现实生活。
甚至还有一种更有意思的可能,那就是协助人记忆。
人的记忆并没有我们想象中那么可靠。有时候走在街上,突然遇到一个似曾相识的人,会觉得特别眼熟,却怎么也想不起他的名字,甚至连在哪里见过都一时没有头绪。
如果未来的 AI 真正成为私人设备的一部分,也许它可以在严格授权和隐私保护的前提下,帮我们补齐这一块记忆。
第一次认识一个人的时候,我可以主动告诉设备:“这是张明,今天第一次见面,是王强介绍认识的。”这条信息并不需要进入什么公开数据库,它只是一段属于我自己的个人记忆。
几个月以后再次遇见他,如果我一时间想不起来,只需要问一句:“这个人我以前是不是见过?”
AI就可以在属于我的私人记忆中搜寻答案,也许会告诉我:“你去年见过他一次,是王强介绍的。当时你们聊过某件事情。”
它不是去识别世界上的所有陌生人,也不是把每个人都变成一个可以查询的数据库。
它只是像一个记性特别好的朋友一样,帮我记住自己真正经历过的事。
当然,这里面必然涉及隐私、权限以及伦理问题。
所以未来这样的设备,很可能需要比今天手机更加严格的身份认证。设备必须确认现在戴着它的人就是主人,只有在获得相应权限以后,私人联系人、照片、邮件、历史记录以及个人 AI 记忆才能被调用。
而且我始终认为,一个真正成熟的私人 AI 应该做到一件很重要的事:它可以非常了解我,但提供 AI 服务的公司,并不因此拥有一份可以随意查看的“我的人生数据库”。
这些信息应该尽可能保存在个人设备中,或者通过严格加密的方式同步到属于个人的云端。只有这样,人们才有可能真正安心地把一个长期陪伴自己的 AI 带进生活。
如果未来真的能够做到这一点,Vision Pro 与 AI 的结合就会变得非常有意思。
AI提供“大脑”,摄像头提供“眼睛”,麦克风提供“耳朵”,眼球追踪知道我正在关注哪里,手势识别知道我具体指的是哪个东西,而空间定位则理解我与现实世界之间的位置关系。
visionOS把这些能力整合在一起以后,今天 Vision Pro 那些看似只是为了“不使用控制器”而设计的技术,可能就有了新的意义。
它们也许不仅仅是在帮助人操作一台设备。
它们还可能成为未来 AI 感知现实世界的一套“感官系统”。
过去谈论 AI,我们总是在讨论它的大脑够不够聪明。
但如果继续往前想,也许真正成熟的 AI 同样需要一双眼睛、一双耳朵,需要理解人的动作,也需要知道人究竟生活在怎样的环境里。
而 Vision Pro 这样的空间设备,恰好提供了这种可能。
当然,这并不意味着未来一定就是 Vision Pro,更不意味着未来一定是一副普通眼镜。
至少按照当下的技术条件来看,要把芯片、高清摄像头、显示系统、传感器、麦克风、扬声器、电池、无线通信以及散热全部压缩到一副几十克的眼镜里面,依然非常困难。
所以相比于突然冒出一副拥有全部 Vision Pro 能力的普通眼镜,我反而觉得,更现实的下一步可能是让现在这样的设备不断变轻。
如果未来几代产品能够在保留主要体验的同时,把重量大幅降低,甚至降低到今天的大约一半,那都已经会对佩戴体验产生非常明显的改观。
而且最终的计算方式,也未必要求所有东西全部塞在头上。
也许未来的设备会采用一种更加分布式的形态:眼前的设备负责显示和环境感知,口袋里的设备承担一部分计算,耳机负责声音,而云端只在真正有需要的时候处理大型 AI 任务。
到了那个时候,我们甚至很难简单地说“这是一台什么设备”。
它可能已经变成一整套围绕人的个人计算系统。
至于最终会不会变成普通眼镜,会不会继续叫 Vision Pro,又或者最后出现的是一种今天根本没有想到过的产品,没有人知道。
但这也恰恰是未来最有趣的地方。
我们无法准确预测十年或者二十年以后,人类还会不会像今天一样,把智能手机一直拿在手里。也无法确定最终取代手机的,到底是眼镜、空间设备,还是某种完全不同的东西。
但至少现在,我们能够看到一些正在慢慢汇聚的技术方向。
AI越来越聪明,芯片越来越高效,传感器越来越小,计算机越来越能够理解现实世界,而人与计算机之间的交互,也正在变得越来越自然。
最初,我们通过键盘输入一条条命令。后来有了鼠标,再后来,我们习惯了直接用手指触摸屏幕。到了 Vision Pro,眼睛、手势和语音也开始成为新的输入方式。
也许未来真正发生的变化,并不是人学会更多新的操作方式。
而是计算机越来越懂得怎样理解人。
今天我们讨论 Vision Pro,经常会问一个非常现实的问题:“这么贵、这么重,我为什么要每天戴着它?”
如果它只能提供一块巨大的虚拟屏幕,这个问题确实很难回答。
但如果未来有一天,它能够理解我正在看到什么,听懂我说什么,知道我指向哪里,在我需要的时候帮助我,在我不需要的时候保持安静,甚至成为一个记忆比我更好、知识面比我更广的智能伙伴,那么这个问题也许会完全改变。
到了那个时候,我们问的可能不再是:“为什么我要戴着它?”
而是:
如果真的有这样一个“朋友”,为什么不愿意把它带在身边?
当然,这一天何时到来,最后是不是由苹果实现,那个产品还会不会叫 Vision Pro,没有人能够确定。
我们今天所设想的一切,也不是对未来的准确预测。
它只是建立在已经出现的技术之上,一次关于未来的合理推演。
可是再回过头看今早那个偶然蹦出的搜索联想——“为什么 Vision Pro 停产了”——我反而觉得,也许真正值得思考的问题并不是一款产品今天卖出了多少台,更不是它在某一个阶段有没有遇到困难。
真正值得观察的是,它所代表的那条技术路线,最终会走向哪里。
如果有一天,空间计算真正遇上成熟的 AI,也许人工智能会第一次真正从手机和电脑的屏幕里“走出来”,开始和我们一起理解同一个现实世界。
如果真的有那么一天,我们再回头看今天这台又重、又贵、应用场景还不算丰富的 Vision Pro,也许会突然发现:
原来通往那个时代的第一扇门,很早以前就已经被打开了。
本文为原创文字。
感谢阅读。
这样想想,
好像也挺好的。
胡天骄
2026 · 初秋