解读、编辑|张意梅
审核|蒲诗瑶
ICML 2026 Test of Time Award
- 论文题目:Asynchronous Methods for Deep Reinforcement Learning
- 论文作者:Volodymyr Mnih、Adrià Puigdomènech Badia、Mehdi Mirza、Alex Graves、Tim Harley、Timothy P. Lillicrap、David Silver、Koray Kavukcuoglu
- 作者机构:Google DeepMind
- 论文链接:https://arxiv.org/pdf/1602.01783
1. 研究背景:经验回放解决了什么,又带来了什么
深度神经网络虽能为强化学习提供丰富的状态表示,但在 2016 年之前,简单的在线强化学习算法与深度神经网络的组合普遍被认为训练不稳定。核心原因在于:在线智能体观察到的数据序列是非平稳的,且相邻时刻的更新高度相关。
以 DQN 为代表的算法通过经验回放(experience replay)应对这一问题——将智能体经验存入回放记忆并随机采样,以降低数据非平稳性和更新相关性。这一思路在 Atari 2600 等任务上取得了当时的最佳结果,但也付出了两点代价:
- 资源开销:每次真实交互都要额外占用内存与计算;
- 算法受限:只能使用能从旧策略生成的数据中学习的离策略(off-policy)算法(如 Q-learning),导致 Sarsa、n-step 方法、actor-critic 等基础的在策略(on-policy)算法难以直接与深度网络稳定结合。
此外,当时的深度强化学习高度依赖 GPU(如 DQN)或大规模分布式集群(如 Gorila 框架需 130 台机器)。
2. 核心思想:用并行智能体替代经验回放
这篇论文提出了一个概念简单、资源占用低的替代方案:不再使用经验回放,而是在多个环境副本上异步并行地运行多个智能体。
框架的关键设计包含两点:
第一,单机多线程,而非多机分布式。与 Gorila 不同,作者让所有 actor-learner("演员 - 学习者"线程)运行在同一台机器的多个 CPU 线程上,共同维护一份共享模型参数。由于线程间无需跨机器通信,可采用 Hogwild! 风格的无锁异步梯度更新。
第二,用并行探索来稳定训练。多个并行智能体在同一时刻经历环境的不同状态,且各线程可使用不同的探索策略(如独立采样不同的 ε 值)。这使得多个智能体对参数的在线更新在时间上的相关性明显低于单个智能体。换言之,并行 actor-learner 起到了经验回放在 DQN 中的稳定作用。
这一范式带来了两方面的实际收益:训练时间随并行智能体数量大致线性缩短;同时,由于不再依赖经验回放,Sarsa、actor-critic 等在策略方法也能稳定地训练深度神经网络控制器。论文实验主要在单台多核 CPU 机器上完成,不依赖 GPU。
3. 四种异步算法
在这一框架下,论文给出了四种标准强化学习算法的异步版本,它们都由并行 actor-learner、跨多步累积梯度后再更新这两项设计来保证训练稳定:
(1)异步单步 Q-learning(one-step Q):每个线程在自己的环境副本中按 ε-greedy 策略行动,使用与 DQN 类似的共享目标网络计算 Q-learning 损失,并在累积若干步的梯度后异步应用到共享参数上。
(2)异步单步 Sarsa(one-step SARSA):与上者基本相同,区别仅在于目标值使用的是实际执行动作的 Q 值(r + γQ(s′, a′; θ⁻)),属于在策略方法。
(3)异步 n-step Q-learning(n-step Q):采用前向视角,每个线程先执行最多 t_max 步,再为途经的每个状态 - 动作对计算各自最长可用的 n-step 回报,把最多 t_max 个更新合并为一次梯度更新。相比单步方法,奖励传播更快。
(4)异步优势演员 - 评论家(A3C,Asynchronous Advantage Actor-Critic):网络同时输出策略 π(a|s; θ) 和价值函数 V(s; θ_v),除输出层外的参数全部共享。A3C 采用前向视角,用同一组 n-step 回报同时更新策略与价值函数。策略梯度由优势函数的估计量 A(s, t) 加权。
此外,A3C 在目标函数中加入了策略熵正则项(权重 β),鼓励探索、避免过早收敛。优化器方面,共享统计量的 RMSProp表现出更好的鲁棒性,因此被后续实验采用。
在 Atari 实验中,网络结构与 DQN 相同(两个卷积层加一个全连接层);循环版本在最后一个隐层后追加 256 个 LSTM 单元。每个实验使用 16 个 actor-learner 线程,每 5 个动作更新一次(t_max = 5),折扣因子 γ = 0.99,熵正则权重 β = 0.01。
4. 实验结果
Atari 游戏上的学习速度
论文首先在 5 款 Atari 游戏上比较了 DQN 与四种异步算法的学习速度。DQN 在单块 Nvidia K40 GPU 上训练,异步方法仅使用 16 个 CPU 核心。结果显示,四种异步方法都能成功训练神经网络控制器,总体上比 DQN 学得更快,部分游戏上优势明显;其中策略型的 A3C 显著优于三种价值型方法。
图 1|DQN 与四种异步算法在五款 Atari 2600 游戏上的学习速度对比
横轴为训练时间(小时),纵轴为游戏得分。DQN 在单块 Nvidia K40 GPU 上训练,四种异步方法使用 16 个 CPU 核心。曲线为多次运行的平均:DQN 为固定超参数下 5 个随机种子的结果;异步方法为 50 组实验中最优 5 组的平均。
57 款 Atari 游戏上与当时最优方法的对比
随后,论文按 Double DQN 的训练与评估协议,在全部 57 款 Atari 游戏上评估了 A3C。A3C 使用 16 个 CPU 核心训练 4 天;作为对比的其他方法在 K40 GPU 上训练 8–10 天(Gorila 使用 100 台机器训练 4 天)。
表 1|57 款 Atari 游戏上以 human starts 评估指标得到的人类归一化得分均值与中位数
表中对比了 DQN、Gorila、Double DQN、Dueling Double DQN、Prioritized DQN 与 A3C 的前馈版本(FF)和 LSTM 版本。A3C(LSTM)取得 623.0% 的平均人类归一化得分和 112.6% 的中位人类归一化得分,平均分超过此前最好的 Prioritized DQN(463.6%);训练时间约为其他方法的一半,且仅使用 CPU。前馈版 A3C 训练 1 天时平均分即接近 Dueling Double DQN 训练 8 天的水平。
更多类型的任务:TORCS、MuJoCo 与 Labyrinth
论文还在另外三类环境中评估了 A3C:
- TORCS 3D 赛车:智能体仅从 RGB 图像帧和与沿赛道中心线速度成正比的奖励学习驾驶,在多种配置下,A3C 均为四种异步方法中表现最好的,训练约 12 小时后达到人类测试者得分的约 75%–90%;
- MuJoCo 连续控制:在包含操作与运动任务的刚体物理任务上,无论输入是物理状态还是像素,A3C 通常能在几小时内找到较好解,像素输入下也能在 24 小时内取得较好结果;
- Labyrinth 3D 迷宫:每个回合智能体被放入一个随机生成的新迷宫,需要从纯视觉输入学习寻找苹果与传送门的通用探索策略。A3C LSTM 智能体的最终平均得分约 50,表明它学到了一种在随机 3D 迷宫中探索的合理策略。
这些实验覆盖了 2D 与 3D、离散与连续动作空间、前馈与循环网络,验证了方法的通用性。
可扩展性与数据效率
表 2|不同线程数量下四种异步方法的平均训练加速比
加速比在 7 款 Atari 游戏上平均:对每款游戏,先测出各方法用 1 个线程和 n 个线程达到固定参考分数所需的时间,再以前者除以后者。表中可见,16 线程时四种方法均获得至少一个数量级(10 倍以上)的加速;单步 Q-learning 和 Sarsa 甚至表现出超线性加速,作者认为这来自多线程对单步方法偏差的降低带来的数据效率提升。
图 3|不同数量并行 actor-learner 的数据效率对比
横轴为训练 epoch 总数,纵轴为平均得分。若并行仅带来计算加速,相同帧数下达到的得分应基本不变;而图中单步方法在相同帧数下随线程增多达到更高得分,说明并行还改善了数据效率。
图 4|不同数量并行 actor-learner 的训练速度对比
横轴为训练墙钟时间(小时),纵轴为平均得分。四种异步方法均随并行 actor-learner 数量的增加获得显著加速,验证了框架随并行规模的可扩展性。
对学习率与初始化的稳健性
图 2|A3C 在五款 Atari 游戏上对 50 组不同学习率与随机初始化实验的得分散点图
横轴为学习率,纵轴为最终得分。在每款游戏上都存在一段较宽的学习率区间,其中所有随机初始化都能取得较好得分,且几乎没有得分为 0 的点。这说明在一定范围的学习率和随机初始化下,A3C 都能取得较好结果,方法在开始有效学习后不容易崩溃或发散。
5. 总结与影响
这篇论文的主要贡献可以概括为三点:
- 提出了单机多线程的异步深度强化学习框架:用并行 actor-learner 的去相关作用替代经验回放来稳定训练,使价值型与策略型、离策略与在策略方法都能与深度网络结合,并进一步展示了 A3C 在连续动作控制任务上的可行性;
- 给出了四种异步算法,其中 A3C 在 Atari 上以一半的训练时间和纯 CPU 超过当时的最好结果,并在 TORCS、MuJoCo、Labyrinth 等任务上验证了通用性;
- 系统分析了框架的可扩展性与稳健性:16 线程带来至少一个数量级的加速,方法对学习率与初始化不敏感。
值得注意的是,作者在结论中明确指出:稳定的不使用经验回放的在线 Q-learning 是可行的,但这并不意味着经验回放没有价值——把经验回放并入异步框架以复用旧数据,可能进一步提升数据效率。这为后来将两者结合的研究留出了空间。
十年后,这篇论文获得 ICML 2026 时间检验奖。A3C 提出的并行 actor-learner 与异步更新范式对后续的并行、分布式强化学习架构产生了持续影响,其思想也延续到了 A2C、IMPALA 等后续方法中。
点击 阅读原文 查看原论文

