硅历04:强化学习与大语言模型的融合
硅历 04
通过反复试错来获取知识,才是智能最核心的属性。
在之前的几篇中,我梳理了人工智能的两大流派:强调人类制定规则的符号主义,以及推崇模拟人脑的连接主义。
其实,除了从生物行为中学习,还有一种源于进化论的路径。它经历了遗传、变异和试错,最终演变成了强化学习。著名的AlphaGo就是这一技术的代表。
鉴于如今的人工智能融合了符号主义、深度学习与强化学习,为了保持记录的完整性,我简要回顾一下强化学习的发展脉络。
1975年,密歇根大学的霍兰德教授受《自然选择的遗传理论》启发,认为进化是族群学习的方式,机器也可效仿。他在《自然与人工系统的适应性》中提出遗传算法,将一组带规则的程序放入群体系统,模拟种群进化:
打个比方,我想调制一杯绝世好喝的奶茶,于是:
随后,霍兰德的学生寇扎用代码实现了该算法,称为「遗传编程」。但与其他路线一样,它受限于算力。从简单例子可见,成百上千个初始群体和迭代,对算力是巨大挑战。
霍兰德模拟的是种群进化,需数百代迭代。但婴儿只需烫一两次就知道避开水壶,这种试错机制,正是后来强化学习的雏形。
1980年代,巴托和萨顿在马萨诸塞大学研究机器学习。虽与连接主义有交集,但他们走出独立路线:认为试错学习比模拟神经元更本质。
因此,强化学习基于两个理论:
一是马尔科夫决策过程。Agent只关注当前状态和动作,执行后获奖励,目标是最大化收益。
打个比方,人生就像马尔科夫过程。基于当前认知做选择,选对获奖励(如好工作),选错遇挫折。
虽人生无绝对对错,但强化学习核心是:在不确定中通过选择,最大化长期收益。
二是动态规划。通过拆分复杂问题为子问题,找到子解推总解,像导航地图指引目的地。
因难获全图,后用蒙特卡洛方法,通过大量尝试复盘找优解。但每次需等结束才更新,太慢。
1988年,萨顿提出「时序差分学习」:每步根据「下一步预期」调整,无需等终局。如下棋每步评估,而非整盘后总结。这是萨顿和巴托的原创贡献,也是深度强化学习的基础。
强化学习长期受冷落,直到AlphaGo击败李世石,才真正进入公众视野。
图源:百度百科
萨顿2019年发表「The Bitter Lesson」,认为算力增加后,通用计算(搜索学习)胜过人工编码知识。
2025年,萨顿与学生合著「Welcome to the Era of Experience」,将机器学习分为3个阶段:
除围棋外,在DeepMind推动下,强化学习在芯片设计、游戏AI、机器人控制领域也取得突破。
2024年,巴托和萨顿因发展强化学习概念和算法基础,共同获得图灵奖。
萨顿称当下为「人类数据时代」,主角正是深度学习——它现有一个新名:「大语言模型」(LLM)。
上一篇提到,辛顿1980年代提出词应具高维向量属性。2013年谷歌实现词向量化,词间关系可计算,如「国王」 - 「男人」 + 「女人」 ≈ 「女王」。
后用「循环神经网络」(RNN)处理句子。RNN有记忆,能理解字义,但有致命缺陷:
2014年,本吉奥和学生Bahdanau提出,机器翻译第3个词时,不应只看源语第3词,而应回看整句,分配不同关注度。
2017年,谷歌Brain发表《Attention is All You Need》,提出Transformer架构,抛弃RNN,只需注意力。重点:
Transformer让模型并行处理每个词,能一次性看完整段,理解第1词与第200词关系。这次革命为「大力出奇迹」铺路。
基于Transformer,人们发现让模型先通过海量文本自训练(填空),再用少量人工标注纠正,效果极佳。
2018年6月,OpenAI发布GPT-1(1.17亿参数)。核心思想:让模型读完互联网,遮住句末词问「下一个词是什么」。
这种「自监督学习」无需人工标注,原文即答案。是连接主义极致:用海量数据+深层网络,学语言语法、语义、逻辑,而非专用解法。
2020年,GPT-3参数达1750亿。发现模型大到一定程度会「开窍」:给几个例子,就能做未训练任务。
这种「少样本学习」能力非刻意设计,是规模临界点自发涌现。即使监控输入输出,也无法解释为何产生「智能」。
OpenAI总结为「Scaling Law」:参数、数据、算力按比例放大,能力会不可预测跃升。
但GPT-3有致命问题:会胡说、偏见、生成有害内容。本质是「超级鹦鹉」——靠记忆和模式匹配说话,非真正理解。
OpenAI用RLHF(基于人类反馈的强化学习)解决此问题。
过程分三步:
仔细分析该方案,会发现:
符号主义定规则,连接主义学数据,强化学习试错——三条路线斗七十年,终在产品中融合。
2022年11月30日,OpenAI发布ChatGPT,仅上线聊天界面,却改变了世界。
从「逻辑理论家」到专家系统、AlexNet、AlphaGo,AI路线各自发展数十年。曾互相攻击、争夺经费。但在ChatGPT,它们首次握手言和。
然而,如萨顿所说,随高质量数据枯竭,人类数据时代已到顶。
2024年,OpenAI o1引入思维链(CoT),写出思考过程,自我验证修正;2025年1月,DeepSeek-R1用纯强化学习让模型自主「想」出推理能力,无需人工规则,自主试错学习。
看大模型思考过程,会发现执行前说「我会首先...」,交付前说「等等!让我再检查一下」。
这标志着大模型从「记忆智能」(靠背诵)走向「推理智能」(靠试错进化),宣告「人类数据时代」结束,或「经验时代」开始。