DEV Community

Sanya
Sanya

Posted on

强化学习全景:从 DQN 到 PPO,从 AlphaGo 到 LLM 对齐

强化学习:从 AlphaGo 到 LLM 对齐——一次技术全景梳理

强化学习(RL)是 AI 领域最接近「通用学习」范式的方法——通过与环境交互、试错、奖惩信号,让智能体自主学会复杂行为。本文从 DQN 到 PPO,从游戏到 LLM 对齐,系统梳理 RL 的发展脉络与核心算法。


一、强化学习的基本框架

强化学习的核心是智能体(Agent)-环境(Environment)交互循环

智能体观察环境状态 s_t
         ↓
  根据策略 π(a|s) 选择动作 a_t
         ↓
  环境执行动作,返回奖励 r_t 和下一状态 s_{t+1}
         ↓
  智能体更新策略(学习)
         ↓
  循环...
Enter fullscreen mode Exit fullscreen mode

有三个核心概念:

  • 策略(Policy)π:在状态 s 下选择动作 a 的概率分布。RL 的目标是找到一个最优策略 π*,最大化累积奖励。
  • 价值函数(Value Function)V(s):从状态 s 出发,按照策略 π 能获得的期望累积奖励。用于评估「这个状态有多好」。
  • Q 函数(Q-Function)Q(s,a):从状态 s 出发,执行动作 a 后再按策略行事,能获得的期望累积奖励。

二、深度强化学习的突破:DQN 与 DDPG

2.1 DQN:从像素到行动

论文Mnih et al., 2015, Nature, DOI: 10.1038/nature14236

2015 年,DeepMind 的 Mnih 等人在 Nature 发表论文,展示了深度 Q 网络(DQN)能在 49 款 Atari 2600 游戏上达到人类水平,其中许多游戏 AI 的表现远超人类专业玩家。

核心技术:经验回放(Experience Replay)

DQN 维护一个经验池,存储过去的状态转移(s, a, r, s')。训练时随机采样,打破了连续样本之间的相关性,提高了数据效率。

固定 Q 目标(Fixed Q-Target)

计算目标 Q 值时,使用一个单独的网络(每 N 步更新一次),避免了 TD 误差中的自举误差(bootstrapping error)导致的训练不稳定。

DQN 的局限性:

  • 只能处理离散动作空间(无法直接用于连续控制)
  • 使用过估计(overestimation)的 Q 值,导致策略过于保守

2.2 DDPG 与连续控制

DDPG(Deep Deterministic Policy Gradient)由 Lillicrap et al. (2015) 提出,是第一个能有效处理连续动作空间的深度强化学习算法。

核心思想:用一个「演员-评论家(Actor-Critic)」架构:

  • Actor(演员):输出确定性动作(而非概率分布)
  • Critic(评论家):估计 Q 值,评估 Actor 的动作有多好

三、PPO:当前最主流的 RL 算法

3.1 PPO 的诞生

论文Schulman et al., 2017, arXiv:1707.06347

Proximal Policy Optimization(PPO,近端策略优化)由 OpenAI 的 Schulman 等人提出,迅速成为强化学习领域应用最广泛的算法。

为什么 PPO 如此成功?

它的核心设计哲学是:在保证策略更新的稳定性同时,最大化样本效率

3.2 PPO 的核心机制:剪裁(Clipping)

PPO 改进自早期的 TRPO(Trust Region Policy Optimization),但用了一个更简单的工程实现:

传统策略梯度方法的问题是:一次糟糕的大步更新可能让策略崩溃(从「好的策略」一下子跳到「很差的策略」)。

PPO 的解决方案是限制策略更新的幅度

# 策略比率 r(θ) = π_θ(a|s) / π_{θ_old}(a|s)
# 重要性采样的比率衡量了新旧策略的差异

# PPO 目标函数(简化)
L(θ) = E[ min(
    r(θ) * A,                              # 标准策略梯度
    clip(r(θ), 1-ε, 1+ε) * A             # 剪裁版本
) ]

# ε 通常取 0.2,即限制策略比率变化不超过 20%
Enter fullscreen mode Exit fullscreen mode

当优势函数 A > 0(动作好于平均)时,r(θ) 被限制在 1+ε 以内,防止策略过度乐观;
当 A < 0(动作差于平均)时,r(θ) 被限制在 1-ε 以上,防止策略过度悲观。

3.3 PPO vs 其他算法

维度 PPO DQN DDPG SAC
动作空间 离散+连续 离散 连续 连续
样本效率
训练稳定性
调参难度
超参数敏感性 低( clipε=0.2 通用) 极高
工业应用 主流 推荐系统 机器人 机器人

四、强化学习在 LLM 训练中的应用

4.1 RLHF:从「模仿人类」到「符合人类偏好」

论文Ouyang et al., 2022, InstructGPT, arXiv:2203.02155

传统的 LLM 训练分两步:预训练(Predict Next Token)+ 微调(监督微调,SFT)。但 SFT 的问题是:模型模仿的是人类给出的「示范答案」,而不是人类真正想要的答案

RLHF(Reinforcement Learning from Human Feedback)引入了第三步:

预训练语言模型(GPT-3)
        ↓
SFT(监督微调):学习格式和基本能力
        ↓
RLHF:
  1. 训练奖励模型(Reward Model):人类对输出质量排序 → 训练一个能预测「人类偏好分数」的模型
  2. PPO 优化:用奖励模型作为环境,用 PPO 优化原始语言模型,使其生成人类更喜欢的输出
        ↓
对齐后的模型(InstructGPT)
Enter fullscreen mode Exit fullscreen mode

RLHF 让 GPT-3 从一个「预测下一个词」的语言模型,变成了一个「有助益、无害、诚实」的对话助手。

关键发现(InstructGPT 论文):即使只有 1.3B 参数的模型,经过 RLHF 对齐后,其输出质量在用户评估中优于 175B 的 SFT 模型——这说明对齐的质量比规模更重要

4.2 PPO 在 LLM 对齐中的特殊问题

将 PPO 应用于 LLM 时有一个独特挑战:LLM 是自回归生成的,每一步生成 token 的动作空间是整个词表(通常 ~50,000 个词)。这使得标准的 RL 方法面临巨大的动作空间。

解决方案:用奖励模型(RM)在序列级别评估输出质量,而不是 token 级别——这将问题从「每个 token 如何优化」转变为「整条输出如何优化」。

另一个问题:PPO 的 KL 散度惩罚。为了防止 RL 优化过程中模型偏离原始能力太远,PPO 会在奖励函数中加入 KL 散度项,惩罚生成过于偏离原始模型的输出。


五、SAC:最大熵强化学习

Soft Actor-Critic(SAC)由 Haarnoja et al. (2018) 提出,引入了最大熵(Maximum Entropy)的概念:

传统 RL 最大化期望累积奖励:π* = argmax E[ Σ r(s,a) ]
SAC 最大化:π* = argmax E[ Σ r(s,a) + α H(π(·|s)) ]

其中 H(π) 是策略的熵,α 是温度参数。

最大熵的物理意义:鼓励策略在获得高奖励的同时,保持最大的随机性——换句话说,策略不只追求最优,还保持探索的倾向。这解决了 RL 中著名的「探索-利用(Exploration-Exploitation)」困境。

SAC 的另一个优点是自动温度调节:不需要手动设置 α,算法会自动平衡奖励最大化和熵最大化。


六、离线强化学习:从日志数据中学习

传统 RL 需要在线交互——智能体必须在环境中实时行动并收集数据。这在很多场景下是不现实的(如自动驾驶、医疗治疗)。

离线强化学习(Offline RL / Batch RL)的目标是:从已有的日志数据(由人类或旧策略生成)中学习最优策略,而不需要新的在线交互。

主流方法:

方法 核心思想 代表算法
约束策略方法 在日志数据分布附近约束新策略 BCQ, CQL
分布约束方法 限制 Q 函数的过度外推 TD3+BC
模型方法 从日志数据中学习环境模型 MBOP

离线 RL 是将 RL 技术落地到现实应用的关键,但目前仍是 RL 研究中最具挑战性的子领域之一。


七、RL 的核心挑战

挑战 描述 现状
样本效率 需要海量交互数据 离线 RL 缓解部分问题
训练稳定性 超参数敏感,容易崩溃 PPO 显著改善
稀疏奖励 大多数状态没有奖励信号 模仿学习、奖励塑造
泛化能力 在训练环境好,测试环境差 域随机化、多任务学习
安全约束 RL 能找到「作弊」方式绕过奖励函数 安全 RL、约束优化
可复现性 同一代码多次训练结果差异大 环境标准化

八、应用场景全景

领域 代表案例 使用算法
游戏 AlphaGo/AlphaZero PPO + MCTS
推荐系统 序列推荐、探索-利用平衡 DQN、SAC
机器人控制 机械臂、灵巧操作 PPO、DDPG、SAC
自动驾驶 决策规划、异常处理 PPO、离线 RL
LLM 对齐 InstructGPT、ChatGPT PPO-RLHF
蛋白质设计 设计新型蛋白质结构 RL + 物理模拟
量化交易 投资组合优化 DQN、SAC

参考文献

  1. Mnih, V., et al. (2015). Human-level control through deep reinforcement learning. Nature, 518, 529–533. DOI: 10.1038/nature14236

  2. Schulman, J., Wolski, F., Dhariwal, P., Radford, A., & Klimov, O. (2017). Proximal Policy Optimization Algorithms. arXiv:1707.06347. DOI

  3. Ouyang, L., et al. (2022). Training language models to follow instructions with human feedback (InstructGPT). arXiv:2203.02155. DOI

  4. Lillicrap, T.P., et al. (2015). Continuous control with deep reinforcement learning. arXiv:1509.02971. DOI

  5. Haarnoja, T., et al. (2018). Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor. arXiv:1801.01290. DOI

Top comments (0)