AI为何能输出复杂推理过程?原理大揭秘
AI 原理系列
当我们使用AI时,若开启深度思考模式,模型会展示一连串的思考轨迹
涵盖拆解难题、逻辑推导,甚至自我纠错
比如像 “等等,感觉不对,我重新思考一下”
这些繁复的逻辑推导究竟是如何实现的?
首先,AI大模型的训练主要分为三个阶段
预训练阶段
监督微调阶段
强化学习阶段
别担心,这三个概念听起来很深奥,但我会尽量通俗地解释,让你了解核心逻辑
让我们开始正题
首先,AI大模型在完成预训练后
—— 就从 初始模型 升级为 基座模型
此时通过海量数据的洗礼,人类世界的常识与物理法则已被内化于模型内部
具体是如何内化的?本质上就是调整模型内部的参数,详情可参考 →AI 是怎么训练的
最关键的是,大模型不仅掌握了人类既有的知识,更重要的是已经习得了人类的逻辑推理能力
比如警察破案或数学证明,都属于逻辑推理,本质上就是这种逻辑链条
—— 因为 xxx,所以 xxx,进而 xxx
为何通过学习常规资料就能学会逻辑,可以参考 →AI 为什么可以推理
然而,此时的基座模型虽然具备逻辑,却并不懂得如何运用
它缺乏拆解问题、逐步推导的习惯,往往直接给出答案
比如你问 “1+1=?”,它只会直接回答 “2”
完全不会去推理,实在是懒得思考
因此面对复杂数学题,往往答非所问,因为题目没见过,又不会拆解,只能瞎猜
如果没看懂这段,可以先看 →AI 是怎么输出的
问题来了
大模型有了逻辑能力却不会用,该怎么办?
没错,我们需要引导它,让它学会主动推理
那这就是
强化学习
简单来说,强化学习的核心
是通过奖惩机制,逼迫模型遇到问题时主动拆解问题
具体分为两种奖励
准确性奖励:回答正确则高分
格式奖励:输出思考过程则高分
这个高分具体起什么作用?
其实和预训练一样,都是修改模型参数,详情见 →AI 是怎么训练的
比如一道数学题 “99×99”
如果直接输出答案 “9801”,就会得低分
如果输出具体拆解步骤,就会得高分
第一步,处理个位数乘法,先算 9×9,得 81
第二步,处理十位和进位,计算 9×90=810,加上进位 81,得出第一行结果 891
第三步,处理十位乘法,同理,用 90 乘以 99,得 8910
最后,将两次结果相加,即 891+8910,最终得出 9801!
如果得高分,大模型就会加强相关参数的权重,以后遇到类似问题,更有可能输出类似答案
如果得低分,就会降低相关参数权重,减少此类输出的概率
如果不理解调整参数,可以看 →AI 是怎么训练的
久而久之,大模型就锻炼出主动推理和拆解问题的能力,改掉了张口就来的毛病
这就是大模型能够输出复杂推理过程的原因
但是!
单纯的强化学习也有缺点
就是完全靠模型自己摸索的思考过程,往往可读性差,甚至夹杂外语,比如
“First!我们要先这么do,然后...oh sorry,let 我重新 check“ (仅作举例
那怎么办?
我们之前提到的三个阶段之一
监督微调!
简单说,就是规范大模型的回答
教它如何输出高质量的思考过程
具体做法是
—— 给它投喂一批高质量、包含长逻辑链的数据示例
数据格式从 【问题 + 答案】变为
—— 问题 + 推理步骤 + 答案
本质上,就是让大模型模仿这个推理过程,然后修改模型参数
把模型的推理步骤往优质步骤上靠
比如面对同一个问题
大模型先输出自己的步骤,然后逐字与优质步骤比对,计算误差后调整参数,让自己能输出类似的格式
这就是监督微调
不过在实际训练中,通常是
先用少量优质数据打基础,教会输出格式
再进行强化学习,激发最强推理上限
所以总的来说
大模型在预训练阶段就有了逻辑能力,但不会主动使用,习惯直接给答案
需要引导和规范,让它主动思考,输出推理过程,改变输出习惯
这就是为何AI大模型能输出复杂逻辑推理过程的原因
(完)