AI究竟有多厉害?我只关注三个维度:任务、依据与代价
最近我读到一篇观点尖锐的 AI 评论文章。它的矛头指向一个愈发普遍的趋势:产品实力、融资叙事、拟人化想象乃至末日论调,时常被混为一谈。
我觉得其中最值得保留的提醒是:大语言模型(Large Language Model, LLM)并非藏在服务器深处的"灵魂"。它建立在数据、统计、矩阵运算和训练流程之上。聊天界面越自然,人越容易把流畅的文字继续推演成"理解""意图",甚至"意识"。
但把 AI 从神话里拉回来,也不等于把它的能力一笔抹掉。对我来说,更稳妥的判断方式不是问它"像不像人",而是把它放回具体任务,看证据,再算成本。
如今的生成式人工智能(Generative AI)确实不存在什么玄妙成分。训练过程中,系统从海量文本、图像、声音和代码中习得统计规律,再依据输入生成概率更高的后续内容。底层依然是数学、数据和算力资源。
可"机制可以解释"和"能力不值得重视"并不是一回事。飞机依靠空气动力学飞行,搜索引擎依靠索引和排序工作,GPS 依靠原子钟与定位计算运行。知晓它为何有效,不会让工程价值消失。
真正容易误导判断的,是从一次惊艳演示直接跳到更大的结论。模型能给出流畅回答,不等于它拥有人的理解;模型在某项测试里拿到高分,也不足以推出"通用智能马上到来"。
反过来也一样。模型会出错,会生成不可靠内容,也可能在陌生环境里失效;但它在写代码、翻译、检索、摘要和图像识别等任务上带来的效率,同样是真实存在的。把能力和边界同时放在桌面上,判断才不会被演示牵着走。
材料提到杨立昆(Yann LeCun) 对纯文本路线的批评。核心观点是:语言模型主要从符号中学习世界,而人和动物还会通过视觉、空间、动作和反馈建立对物理世界的认识。世界模型(World Model)因此被不少研究者视为机器智能继续发展的重要方向。
这个提醒有现实基础。模型在长任务规划、稳定记忆、因果推理以及真实环境互动上,确实还存在明显短板。但我也不会从"现在做不好"直接推到"未来一定做不到"。当训练方式、系统设计、工具和输入模态都在变化时,这种绝对判断需要更强的证据。
更贴近现实的说法是:文本模型擅长语言和代码等符号任务,多模态输入、工具调用、检索和环境反馈正在扩大它们可以处理的问题范围。能力会移动,边界也会移动。与其给技术路线贴永久标签,不如持续测量它在不同任务上的真实表现。
人工智能智能体(AI Agent)通常由模型、目标、工具、记忆和执行流程组成。它可以拆解任务、调用搜索或代码工具、读取结果,再根据反馈决定下一步。
这套结构不需要拥有自主意识,依然可以产生很强的自动化价值。它真正做的,是把原本需要人反复切换的一串操作连接起来。
风险也恰恰来自这种"连接"。权限给得太大、工具结果没有验证、异常没有及时拦截,一个小错误就可能被带进后续步骤,并随着流程不断放大。
所以我判断智能体时,更关心四个问题:它能稳定完成什么任务?失败时能不能停下来?输出能不能复核?出了错由谁负责?这些问题比"它像不像人"更接近真实的系统设计。
AI 讨论里经常出现两种极端说法。一种强调末日:模型一出现,人类的工作、判断和尊严很快都会被替代;另一种强调万能:只要继续增加算力和数据,所有难题最终都会自行消失。
它们看起来方向相反,却有一个共同点:都特别容易获得注意力。恐惧能制造传播,惊叹也能制造传播,而注意力最终可能流向融资、估值、订阅和采购预算。
材料里对部分 AI 公司创始人和研究者的动机判断很强。我更愿意把这些内容停留在观点层面。创始人会推广产品,研究者会强调自己相信的技术路线,投资人会给增长故事定价。这些行为本身并不奇怪,关键是别把宣传语言直接当成技术证据。
有人说"模型让我感到自己没有价值",首先是一种使用体验;有人说"模型正在觉醒",则属于对未来状态的推测。两者都不能自动变成对模型机制和能力的证明。
我认同材料里那种"慢一点判断"的态度。看到一个很惊艳的 AI 演示时,我更愿意先问几个具体问题。
第一,这项能力在哪些任务上能够重复出现?第二,错误率和人工复核成本是多少?第三,部署、算力、数据治理等成本是多少?第四,出现错误时责任如何界定?
这些问题听起来没那么戏剧化,却更接近真正的采购、研发和管理决策。一个能力只有在可重复、可验证、成本可接受、责任可管理的情况下,才更容易从演示变成生产力。
所以,我并不想把 AI 神化,也不想因为它能够被数学和工程解释,就低估它的现实价值。它是一类仍在快速变化的工程系统:能力会扩展,边界会暴露,成本结构也会变化。
用它时保持好奇,评估它时保持怀疑。听到任何过度承诺时,我会重新回到三件事:它到底能完成什么任务,有什么证据证明,以及这件事最终要付出多少成本。