标签

AI二十年:从沉默到会说会看会想

发布时间:2026-07-20 16:07阅读:2

系列 · 终结篇

第一期我们讲到2016年,AlphaGo击败李世石,全世界第一次亲眼看见AI的"可怕"。

但如果把AlphaGo比作一个围棋天才,它的才华是"封闭"的——只会下棋,不会聊天,不会画画,不会写文章。就像一个智商爆表但从不开口的学霸,你知道他准厉害,但说不上来他厉害在哪。

2016年之后发生的事情,才是真正让AI走进你手机、你办公室、你生活的那部分。机器不仅学会了说话,还学会了看、听、画,甚至学会了"推理"。

这篇文章,就是这后十年的故事。

如果你让我选一个字来形容AlphaGo之后这几年AI的发展速度——我只能说:坐过山车都不够快,得坐火箭。

而这个"火箭"的燃料,来自2017年的一篇论文。名字很长,叫《Attention Is All You Need》。翻译过来就是:"注意力,就是你需要的一切。"

这篇论文提出了一个叫Transformer的架构。在此之前,处理语言文字(比如翻译)的主流方式是"一个词一个词按顺序来"——就跟你看英文句子一定从左往右读一样。但Transformer说:不,我可以同时"注意"到句子里每一个词跟其他所有词的关系。

类比:以前的AI读文章像在听人念报告——一句接一句。Transformer读文章像在看报纸——一眼扫过去,标题、导语、图片、段落之间的关系全一目了然。

这个变化听上去没什么,就像一个工厂换了一条新流水线。但就是这条流水线,后来生产出了GPT、ChatGPT、Claude、文心一言、通义千问……你能叫得上名字的所有聊天AI,都是它的"后代"。

神奇吗?更神奇的还在后面。

· · ·

GPT这三个字母,是2018年第一次出现的。但别误会——此GPT绝非彼ChatGPT。初代GPT就像一个刚学会说话的三岁小孩:你问它"天气怎么样",它可能回答"饺子很好吃"。

这不是搞笑,是真实的。

但AI的可怕之处就在于——它学得实在太快了。

2019年,GPT-2出世。参数从1.17亿涨到了15亿。这个版本的GPT终于"说话有点像人了"。它甚至可以自己续写文章,虽然偶尔会跑偏,但已经足够让当时的技术圈倒吸一口凉气——OpenAI甚至一度不敢开源完整模型,理由是"担心被滥用"。

2020年,GPT-3来了。参数直接跳到1750亿。这一次,GPT-3展现了一种所有人没有预料到的能力:"涌现"。

什么叫涌现?你可以把它想象成:你堆了一大堆积木,堆到某个高度的时候,它突然自己变出了一个你从来没有设计过的形状。GPT-3就是那座积木塔——当参数大到一定程度之后,它展现出了很多没有被显式"教"过的能力,比如翻译、写代码、做数学题、写诗。

打个比喻:你以为你在养一缸鱼,养着养着发现鱼开始在鱼缸里写毛笔字。你没教过它这个,但它就是会了。

但真正让全世界炸锅的,还不是GPT-3。

· · ·

2022年11月30日,一家叫OpenAI的公司发布了ChatGPT。

五天内,注册用户破了100万。两个月后,破了1亿。人类历史上没有哪个互联网产品比它长得更快。

在此之前,AI对话对于普通人来说,体验大概是这样:

"嘿Siri,今天天气怎么样?"

"这是我在网上找到的关于'天气'的信息……"

然后你就放弃了。

但ChatGPT完全不同。你问它"怎么跟女朋友道歉",它不仅告诉你具体话术,还会根据你提供的背景(吵了多久、为什么吵、女朋友什么星座)给出定制化建议。它像一个永远耐心、从不生气、知识储备堪比百科全书的朋友。

这不是进步,这是换了个物种。

2016年AlphaGo震撼的是围棋圈、科技圈。2022年ChatGPT震撼的是——所有人。你的同事、你爸妈、你楼下卖煎饼的大叔,都在讨论"那个能聊天的AI"。

而就在ChatGPT爆炸的同时,另一条线也在悄然推进——AI学会了画画。

2022年夏天,Stable Diffusion和Midjourney相继发布。你说一句话,AI就给你一张画。"一只穿着宇航服的柴犬在月球上吃拉面"——以前你得花三天找设计师,现在你只需要等三秒。

划重点:2022年这一年,AI同时攻克了两个人类引以为傲的领域——"说话"和"画画"。就像一个人在同一天学会了弹钢琴和画油画,两样都还弹得不错、画得挺好。

· · ·

如果说2022年是ChatGPT的独角戏,那2023年就是全世界上场的大乱斗。

3月,GPT-4发布,不仅能聊天,还能看懂图片——你给它一张冰箱内部照片,它能告诉你里面有什么食材、能做什么菜。

同一个月,Google紧急发布了Bard(后来的Gemini)。微软把GPT-4深度融入Office全家桶,Word能帮你写文档,Excel能帮你分析数据,PPT能帮你做幻灯片。Meta开源了Llama系列,让任何人都可以下载、修改、部署自己的大模型。

而中国这边,百度推出了文心一言,阿里推出了通义千问,腾讯推出了混元,字节推出了豆包,月之暗面推出了Kimi……一夜之间,"大模型"成了科技圈出现频率最高的词,比"区块链"还高——而且这次是真的有东西了。

到了2024年,OpenAI扔出了另一个核弹:Sora。

同样在2024年,Claude 3.5发布,能力追平甚至在某些任务上超越了GPT-4。AI编程工具Cursor让不会写代码的人也能开发App。AI不再只是一个"聊天玩具",它开始真正参与生产力。

· · ·

进入2025年,AI的发展方向出现了重大转向。

在此之前,大家都比"参数大小"——你的模型1000亿,我就2000亿;你的2000亿,我就5000亿。像一个永远在加码的拍卖会。

但2025年出现了一条新路:推理模型。

这个模型的特别之处在于:它会"思考"。

你问它一道数学题,它不会直接给出答案。而是像一个人在草稿纸上演算一样,先写下"嗯,这道题应该是这样的……不对,我再想想……哦,我明白了……"

在多项推理基准测试中,DeepSeek-R1的表现与OpenAI的o1模型持平,但成本只有对方的不到十分之一。

这一下,全世界都坐不住了。一个成立不到两年的中国团队,用更少的资源做出了更便宜但同样强大的东西——华尔街称之为"AI的斯普特尼克时刻"。

2025年里,AI Agent(智能体)也成了新热词。简单说,以前你只能跟AI聊天;现在你可以告诉它"帮我订一张下周三去上海的机票,选靠过道的座位,顺便查一下那几天的天气",然后它自己去浏览器、去航空公司网站、去天气App帮你全部搞定。

AI从"回答你的问题",变成了"帮你做事"。

到了2026年,多模态模型已经家常便饭——拍照问菜谱、拍文件翻译、面对面对话、视频实时分析。AI编程更是从辅助工具变成了主流开发方式,越来越多的产品经理、设计师开始直接"用嘴写代码"。

· · ·

如果你从头看完这两期,你会发现一个特别值得咀嚼的事实:

2006年,Hinton一个人孤独地研究神经网络,第一次提出了深度学习,但没有人相信他能成。

2016年,AlphaGo击败了人类最顶尖的围棋手,全世界开始正视AI。

2026年,AI已经可以跟你对话、帮你画画、替你写代码、为你做PPT,甚至替你思考。

整整二十年,从一个没人看得起的"夕阳红领域",到变成整个人类社会最炙手可热的科技革命。

但我想说的是另一件事。

过去二十年AI的发展,有一个始终没变的规律:关键突破从来不是来自"更大的算力"或"更多的钱",而是来自一小撮人想通了一些别人没想通的事。

Hinton想通了"逐层预训练"。李飞飞想通了"先有好的数据"。"Transformer八子"想通了"注意力机制"。DeepSeek团队想通了"不需要那么多资源也能做好推理"。

而下一个二十年,AI会变成什么样?

我不知道具体的答案。但我知道一件事:那些能改变方向的人,一定不是最有钱的人,不是最有资源的人,而是——最敢想的人。

就像2006年的Hinton。就像2015年的DeepMind。就像2022年的OpenAI。就像2025年的DeepSeek。

他们都有一个共同点:在所有人说"这不可能"的时候,他们已经开始做了。

下一个说"这不可能"然后被推翻的事情,会是什么?我不知道。但我很期待。

这个系列到这里就结束了。看到这里的朋友,谢谢你。

参考资料:

《Attention Is All You Need》,Google Brain,2017

《Language Models are Few-Shot Learners》(GPT-3论文),OpenAI,2020

OpenAI官方博客(ChatGPT、GPT-4、Sora发布说明)

DeepSeek-R1技术报告,2025

《深度学习革命》(Genius Makers),凯德·梅茨著