强化学习:从 AlphaGo 到 LLM 对齐——一次技术全景梳理
强化学习(RL)是 AI 领域最接近「通用学习」范式的方法——通过与环境交互、试错、奖惩信号,让智能体自主学会复杂行为。本文从 DQN 到 PPO,从游戏到 LLM 对齐,系统梳理 RL 的发展脉络与核心算法。
一、强化学习的基本框架
强化学习的核心是智能体(Agent)-环境(Environment)交互循环:
智能体观察环境状态 s_t
↓
根据策略 π(a|s) 选择动作 a_t
↓
环境执行动作,返回奖励 r_t 和下一状态 s_{t+1}
↓
智能体更新策略(学习)
↓
循环...
有三个核心概念:
- 策略(Policy)π:在状态 s 下选择动作 a 的概率分布。RL 的目标是找到一个最优策略 π*,最大化累积奖励。
- 价值函数(Value Function)V(s):从状态 s 出发,按照策略 π 能获得的期望累积奖励。用于评估「这个状态有多好」。
- Q 函数(Q-Function)Q(s,a):从状态 s 出发,执行动作 a 后再按策略行事,能获得的期望累积奖励。
二、深度强化学习的突破:DQN 与 DDPG
2.1 DQN:从像素到行动
论文:Mnih et al., 2015, Nature, DOI: 10.1038/nature14236
2015 年,DeepMind 的 Mnih 等人在 Nature 发表论文,展示了深度 Q 网络(DQN)能在 49 款 Atari 2600 游戏上达到人类水平,其中许多游戏 AI 的表现远超人类专业玩家。
核心技术:经验回放(Experience Replay)
DQN 维护一个经验池,存储过去的状态转移(s, a, r, s')。训练时随机采样,打破了连续样本之间的相关性,提高了数据效率。
固定 Q 目标(Fixed Q-Target)
计算目标 Q 值时,使用一个单独的网络(每 N 步更新一次),避免了 TD 误差中的自举误差(bootstrapping error)导致的训练不稳定。
DQN 的局限性:
- 只能处理离散动作空间(无法直接用于连续控制)
- 使用过估计(overestimation)的 Q 值,导致策略过于保守
2.2 DDPG 与连续控制
DDPG(Deep Deterministic Policy Gradient)由 Lillicrap et al. (2015) 提出,是第一个能有效处理连续动作空间的深度强化学习算法。
核心思想:用一个「演员-评论家(Actor-Critic)」架构:
- Actor(演员):输出确定性动作(而非概率分布)
- Critic(评论家):估计 Q 值,评估 Actor 的动作有多好
三、PPO:当前最主流的 RL 算法
3.1 PPO 的诞生
论文:Schulman et al., 2017, arXiv:1707.06347
Proximal Policy Optimization(PPO,近端策略优化)由 OpenAI 的 Schulman 等人提出,迅速成为强化学习领域应用最广泛的算法。
为什么 PPO 如此成功?
它的核心设计哲学是:在保证策略更新的稳定性同时,最大化样本效率。
3.2 PPO 的核心机制:剪裁(Clipping)
PPO 改进自早期的 TRPO(Trust Region Policy Optimization),但用了一个更简单的工程实现:
传统策略梯度方法的问题是:一次糟糕的大步更新可能让策略崩溃(从「好的策略」一下子跳到「很差的策略」)。
PPO 的解决方案是限制策略更新的幅度:
# 策略比率 r(θ) = π_θ(a|s) / π_{θ_old}(a|s)
# 重要性采样的比率衡量了新旧策略的差异
# PPO 目标函数(简化)
L(θ) = E[ min(
r(θ) * A, # 标准策略梯度
clip(r(θ), 1-ε, 1+ε) * A # 剪裁版本
) ]
# ε 通常取 0.2,即限制策略比率变化不超过 20%
当优势函数 A > 0(动作好于平均)时,r(θ) 被限制在 1+ε 以内,防止策略过度乐观;
当 A < 0(动作差于平均)时,r(θ) 被限制在 1-ε 以上,防止策略过度悲观。
3.3 PPO vs 其他算法
| 维度 | PPO | DQN | DDPG | SAC |
|---|---|---|---|---|
| 动作空间 | 离散+连续 | 离散 | 连续 | 连续 |
| 样本效率 | 高 | 低 | 中 | 高 |
| 训练稳定性 | 高 | 中 | 低 | 高 |
| 调参难度 | 低 | 中 | 高 | 中 |
| 超参数敏感性 | 低( clipε=0.2 通用) | 高 | 极高 | 中 |
| 工业应用 | 主流 | 推荐系统 | 机器人 | 机器人 |
四、强化学习在 LLM 训练中的应用
4.1 RLHF:从「模仿人类」到「符合人类偏好」
论文:Ouyang et al., 2022, InstructGPT, arXiv:2203.02155
传统的 LLM 训练分两步:预训练(Predict Next Token)+ 微调(监督微调,SFT)。但 SFT 的问题是:模型模仿的是人类给出的「示范答案」,而不是人类真正想要的答案。
RLHF(Reinforcement Learning from Human Feedback)引入了第三步:
预训练语言模型(GPT-3)
↓
SFT(监督微调):学习格式和基本能力
↓
RLHF:
1. 训练奖励模型(Reward Model):人类对输出质量排序 → 训练一个能预测「人类偏好分数」的模型
2. PPO 优化:用奖励模型作为环境,用 PPO 优化原始语言模型,使其生成人类更喜欢的输出
↓
对齐后的模型(InstructGPT)
RLHF 让 GPT-3 从一个「预测下一个词」的语言模型,变成了一个「有助益、无害、诚实」的对话助手。
关键发现(InstructGPT 论文):即使只有 1.3B 参数的模型,经过 RLHF 对齐后,其输出质量在用户评估中优于 175B 的 SFT 模型——这说明对齐的质量比规模更重要。
4.2 PPO 在 LLM 对齐中的特殊问题
将 PPO 应用于 LLM 时有一个独特挑战:LLM 是自回归生成的,每一步生成 token 的动作空间是整个词表(通常 ~50,000 个词)。这使得标准的 RL 方法面临巨大的动作空间。
解决方案:用奖励模型(RM)在序列级别评估输出质量,而不是 token 级别——这将问题从「每个 token 如何优化」转变为「整条输出如何优化」。
另一个问题:PPO 的 KL 散度惩罚。为了防止 RL 优化过程中模型偏离原始能力太远,PPO 会在奖励函数中加入 KL 散度项,惩罚生成过于偏离原始模型的输出。
五、SAC:最大熵强化学习
Soft Actor-Critic(SAC)由 Haarnoja et al. (2018) 提出,引入了最大熵(Maximum Entropy)的概念:
传统 RL 最大化期望累积奖励:π* = argmax E[ Σ r(s,a) ]
SAC 最大化:π* = argmax E[ Σ r(s,a) + α H(π(·|s)) ]
其中 H(π) 是策略的熵,α 是温度参数。
最大熵的物理意义:鼓励策略在获得高奖励的同时,保持最大的随机性——换句话说,策略不只追求最优,还保持探索的倾向。这解决了 RL 中著名的「探索-利用(Exploration-Exploitation)」困境。
SAC 的另一个优点是自动温度调节:不需要手动设置 α,算法会自动平衡奖励最大化和熵最大化。
六、离线强化学习:从日志数据中学习
传统 RL 需要在线交互——智能体必须在环境中实时行动并收集数据。这在很多场景下是不现实的(如自动驾驶、医疗治疗)。
离线强化学习(Offline RL / Batch RL)的目标是:从已有的日志数据(由人类或旧策略生成)中学习最优策略,而不需要新的在线交互。
主流方法:
| 方法 | 核心思想 | 代表算法 |
|---|---|---|
| 约束策略方法 | 在日志数据分布附近约束新策略 | BCQ, CQL |
| 分布约束方法 | 限制 Q 函数的过度外推 | TD3+BC |
| 模型方法 | 从日志数据中学习环境模型 | MBOP |
离线 RL 是将 RL 技术落地到现实应用的关键,但目前仍是 RL 研究中最具挑战性的子领域之一。
七、RL 的核心挑战
| 挑战 | 描述 | 现状 |
|---|---|---|
| 样本效率 | 需要海量交互数据 | 离线 RL 缓解部分问题 |
| 训练稳定性 | 超参数敏感,容易崩溃 | PPO 显著改善 |
| 稀疏奖励 | 大多数状态没有奖励信号 | 模仿学习、奖励塑造 |
| 泛化能力 | 在训练环境好,测试环境差 | 域随机化、多任务学习 |
| 安全约束 | RL 能找到「作弊」方式绕过奖励函数 | 安全 RL、约束优化 |
| 可复现性 | 同一代码多次训练结果差异大 | 环境标准化 |
八、应用场景全景
| 领域 | 代表案例 | 使用算法 |
|---|---|---|
| 游戏 | AlphaGo/AlphaZero | PPO + MCTS |
| 推荐系统 | 序列推荐、探索-利用平衡 | DQN、SAC |
| 机器人控制 | 机械臂、灵巧操作 | PPO、DDPG、SAC |
| 自动驾驶 | 决策规划、异常处理 | PPO、离线 RL |
| LLM 对齐 | InstructGPT、ChatGPT | PPO-RLHF |
| 蛋白质设计 | 设计新型蛋白质结构 | RL + 物理模拟 |
| 量化交易 | 投资组合优化 | DQN、SAC |
参考文献
Mnih, V., et al. (2015). Human-level control through deep reinforcement learning. Nature, 518, 529–533. DOI: 10.1038/nature14236
Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347. DOI
Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155. DOI
Lillicrap, T.P., et al. (2015). Continuous control with deep reinforcement learning. arXiv:1509.02971. DOI
Haarnoja, T., et al. (2018). Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor. arXiv:1801.01290. DOI
Top comments (0)