AI的触角正在向真实世界延伸
今天打开 ChatGPT,我看到一个以前没有出现过的弹窗:
连接你的金融账户。
你可以把银行账户、信用卡、券商账户连接到 ChatGPT,让它了解你的支出、订阅、余额和投资情况。
看到这个功能,我第一反应并不是:
“ChatGPT 也开始做记账软件了?”
而是另一个问题:
AI,似乎正在一步一步走出纯粹的信息世界。
过去几年,我们讨论大模型,绝大多数时候讨论的仍然是一个存在于屏幕里的智能。
它会写文章,会编程,会分析,会画图,会回答问题。
但无论它多聪明,它最终做的事情,大部分仍然停留在信息世界。
而今天这个看起来并不起眼的“连接金融账户”,让我越来越清楚地看到另一条正在形成的路线:
AI 开始获得观察现实世界,并最终影响现实世界的能力。
OpenAI 现在的金融功能,并不能替你花钱。
目前它主要用于读取你授权的金融数据,比如:
也就是说,现在的关系还是:
它获得的是:
Observation,观察权。
而不是:
Actuation,执行权。
但真正值得关注的,恰恰是这一步。
因为一个真正的 Agent,要形成完整闭环,本来就必须经历:
过去的大模型主要完成中间的Reason。
后来有了 Tool Calling、MCP、浏览器、代码执行之后,它开始获得一定程度的Act。
现在,它又在不断扩张自己的Observe。
当观察、推理、决策和执行最终连成一个闭环时,AI 就不再只是一个聊天机器人。
它会逐渐变成一个真正意义上的 Agent。
很多人一想到“AI 进入物理世界”,首先想到的是机器人。
比如:
这当然是真正意义上的物理执行。
但其实还有另一条路线,它远比通用机器人更加成熟。
比如:
AI 根本不需要拥有机械手。
因为现代经济体系早已经把大量现实世界能力包装成了可以买到的服务。
所以我越来越认同一句话:
Money is an API to the physical world.
钱,是现实世界最通用的一层 API。
严格来说,钱当然不是物理执行器。
但它能够调用大量现实世界中的资源。
从这个角度看,金融和支付就不只是 AI 的一个“新功能”。
它很可能是 AI 从数字世界进入现实世界最快的一座桥。
另一个近期很火的事情,就是 Cloudflare 在推动的 Agent Payment,让我觉得很有意思。
HTTP 协议里面一直存在一个状态码:
402 Payment Required
这个状态码存在很多年了,却长期没有真正成为互联网的基础能力。
原因其实很简单。
过去访问互联网的是人。
如果一个网站或者 API 要收费,人可以:
虽然麻烦,但可以完成。
但 Agent 不一样。
假设一个 AI Agent 正在执行任务,突然发现自己需要调用一个陌生的企业数据库。
传统流程会变成:
Agent 在这里就被打断了。
而现在围绕 HTTP 402 出现的 x402 等协议,想把这个流程变成:
这件事情真正有意思的地方,并不是:
你的AI 终于有钱包了,未来你真的得给它零花钱了。
而是:
机器开始拥有机器原生的交易协议。
这会产生一个非常重要的变化。
今天我们开发一个 Agent,通常会提前决定它有哪些工具。
比如:
也就是说:
Agent 的能力边界,是开发者预先定义好的。
你没有给它接某个数据库,它就永远不会使用那个数据库。
但如果未来开放的 Agent 支付协议成熟,就会出现另一种可能:
这时候,Agent 的能力集合就会从:
Static Tool Set
逐渐变成:
Dynamic Capability Market
AI 不只是会使用工具。
它开始能够购买工具。
这两个概念之间的差异,其实非常大。
假设未来我给一个外贸 Agent 一个任务:
帮我找到 10 个符合要求的美国经销商,预算 50 美元。
Agent 接到的只有两个东西:
然后它自己规划任务:
最终:
这时候发生了一件很有意思的事情。
这个 Agent 已经开始表现得非常像一个微型企业:
输入目标和预算,自己寻找生产资料、购买能力、组织资源,最终交付结果。
这已经不是简单意义上的“AI Tool Calling”了。
它开始具有一种非常初级的:
经济行动能力。
甚至可以说,我们正在看到一种新的角色逐渐形成:
Economic Agent。
它不再只是替人处理信息,而开始能够在预算约束下,调用真实的经济资源去完成一个目标。
这条路线当然不只有 Cloudflare。
OpenAI 已经推出了Agentic Commerce Protocol,ACP。
它试图连接:
未来很自然会出现这样一种场景。
我告诉 ChatGPT:
帮我找一台最适合我的笔记本电脑。
因为它长期拥有我的上下文,所以它可能知道:
然后它去搜索整个市场:
我看完之后说:
就第二台。
接下来:
注意这个过程。
一切可能只从一句自然语言开始:
“帮我买一台适合我的电脑。”
最后,一个真实的物体出现在了我的桌子上。
这时候 AI 就真正完成了:
之间的闭环。
所以如果我们把机器人和金融放在一起看,会发现一件很有意思的事情。
机器人路线是:
金融路线则是:
前者需要等待机器人技术、能源、硬件成本、可靠性等一系列问题继续突破。
后者需要的基础设施,却基本已经存在。
餐厅已经存在。
酒店已经存在。
航空公司已经存在。
工厂已经存在。
物流网络已经存在。
云计算已经存在。
大量专业服务人员也已经存在。
AI 需要做的,只是:
找到它们,然后支付它们。
这也是金融相比机器人非常特殊的一点。
它没有直接赋予 AI 物理执行能力,却允许 AI借用整个社会现有的执行能力。
从某种意义上说,市场经济本身就是一个已经存在了数百年的“能力调用网络”。
只不过过去调用这个网络的是人。
以后,Agent 也可能成为调用者。
所以在真正成熟的通用机器人到来之前:
钱,很可能会先成为 AI 的第一双手。
这也是为什么,一旦让 AI 获得支付能力,风险等级会发生质变。
过去模型产生幻觉,最多可能是:
说错一句话。
未来 Agent 产生幻觉,可能意味着:
付错一笔钱。
更加危险的是 Prompt Injection。
比如一个 Agent 正在浏览网页。
网页中隐藏了一段恶意内容:
模型错误地把它理解成任务的一部分。
于是:
钱包甚至没有被黑。
所有支付都是:
合法签名、合法授权、合法执行。
只是 AI 做出了错误决定。
这其实比传统的黑客攻击更加麻烦。
因为它属于:
合法权限下的错误行为。
甚至可能出现一种非常荒诞的情况:
没有任何黑客偷走你的私钥。
没有任何服务器被攻破。
没有任何交易违反协议。
但你的钱包还是被 Agent 一笔一笔“合法地”掏空了。
真正成熟的 Agent Payment 系统一定不能是:
更合理的结构应该是:
也就是说:
模型可以提出“我想买”,但不能拥有最终付款权。
最终付款必须属于一个确定性的系统。
有限状态机、Policy Engine、预算控制、白名单、幂等机制、熔断器、审计日志,这些都会成为未来 Agent Infrastructure 非常重要的一部分。
甚至状态机本身都不能让模型随便跳转。
模型只能提出:
“我认为下一步需要购买这项服务。”
而真正决定状态是否能够从:
进入:
的,应该是确定性的代码。
否则给 Agent 一个无限制钱包,就相当于:
把一张信用卡交给一个非常聪明、非常勤奋、24 小时不停工作,但偶尔会产生幻觉的人。
这显然迟早会出问题。
所以今天 ChatGPT 弹出的这个:
连接你的金融账户
本身其实没有多么革命性。
今天的 ChatGPT 甚至还不能替你支付一美元。
但是如果把最近几年正在出现的东西放在一起:
一个轮廓已经开始变得越来越清晰。
未来的 AI 不仅知道:
你想要什么。
它还可能知道:
你现在拥有什么资源。
你的预算是多少。
你什么时候需要。
哪个服务可以满足你的需求。
应该花多少钱。
向谁购买。
最后如何把结果交付给你。
到那个时候,AI 最终交付给我们的,就不再只是:
一个答案。
而是:
一个结果。
这可能也是 Chatbot 与真正意义上的 Agent 之间,最重要的一条分界线。
Chatbot 的终点是回答。
Agent 的终点是:
世界状态真的发生了改变。
从 Chatbot 到 Agent,真正重要的变化,从来不是模型回答得越来越像人。
而是:
AI 开始获得改变世界状态的权限。
代码工具让它可以改变软件世界。
MCP 和 API 让它能够调用越来越多的数字服务。
金融账户让它开始理解我们的真实经济状态。
而支付,则可能让它第一次拥有大规模调用现实世界资源的能力。
机器人最终会给 AI 一双真正的“手”。
但在那之前,
钱,可能会先成为 AI 的第一双手。
今天那个看起来普通的“连接金融账户”按钮,也许只是这条路线中非常早的一步。
但 AI 的触手,已经开始从屏幕里伸出来了。