大数跨境

顶会扎堆刷!强化学习+扩散模型,生成式决策彻底火了

顶会扎堆刷!强化学习+扩散模型,生成式决策彻底火了 AI因斯坦
2026-08-31
0

强化学习与扩散模型的融合正在成为生成式决策领域最活跃的赛道之一,从策略优化到样本生成,两条技术路线的碰撞不断催生出兼具稳定性与泛化能力的新范式。


本文整理了12篇该方向最新前沿论文,覆盖ICML、NeurIPS、ICLR等,方法脉络清晰、实验设置完整,非常适合作为入门跟进和方法创新的起点。想快速出成果的下方领取论文及代码(部分),搭baseline、找改进点、扩实验思路都用得上。


长按识别下方二维码,回复强化扩散

无偿领全部论文合集及项目代码


Learning To Sample From Diffusion Models Via Inverse Reinforcement Learning

基于逆强化学习的扩散模型采样策略学习


文章内容

本文提出一种逆强化学习框架,在不重新训练去噪网络的前提下自动学习扩散模型的采样策略。作者将扩散采样过程建模为离散时间有限 horizon 马尔可夫决策过程,动作对应对采样动力学的可选修改(如随机性注入、无分类器引导、重启采样)。与传统方法不同,该框架不定义显式奖励函数,而是通过策略梯度技术直接匹配专家状态分布,利用噪声水平的结构特性定义专家占用度量,无需专家轨迹。实验表明,该方法能有效提升预训练扩散模型的生成样本质量,并自动调优采样超参数,为扩散采样的自适应优化提供了一种系统化的新范式。



ProDCARL: Reinforcement Learning-Aligned Diffusion Models for De Novo Antimicrobial Peptide Design

ProDCARL:面向从头抗菌肽设计的强化学习对齐扩散模型


文章内容

本文提出 ProDCARL 框架,首次将扩散序列生成与强化学习对齐用于抗菌肽(AMP)从头设计。该框架以 EvoDiff 扩散蛋白生成器为基础,先在 AMP 序列上微调获得领域感知生成器,再耦合 AMP 活性与肽毒性两个预测器作为奖励信号,采用 top-k 策略梯度更新,并引入熵正则化与早停机制以维持多样性、抑制奖励黑客。实验显示,RL 对齐后生成肽的平均 AMP 预测分数从 0.081 翻倍至 0.178,高活性低毒性联合命中率达 6.3%,同时保持 0.929 的高序列多样性,AlphaFold3 与 ProtBERT 分析进一步验证了候选肽的结构合理性。



Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design

重新思考扩散模型强化学习的设计空间:超越损失设计的似然估计重要性


文章内容

本文系统拆解了扩散模型强化学习微调的三大设计因素——策略梯度目标、似然估计器与 rollout 采样方案,并通过在 Stable Diffusion 3.5 Medium 上的受控实验揭示:基于 ELBO 的模型似然估计器(仅从最终生成样本计算)才是驱动高效、稳定 RL 优化的核心因素,其影响远超策略梯度损失函数的具体选择。相比 FlowGRPO 采用的轨迹级估计器导致的收敛慢、算力开销大,ELBO 估计器通过解耦训练与采样动力学,可兼容任意黑盒求解器,实现更快收敛与更优峰值性能。结合 ODE 采样,该方法在 90 GPU 小时内将 GenEval 分数从 0.24 提升至 0.95,效率分别为 FlowGRPO 的 4.6 倍与 SOTA 方法 DiffusionNFT 的 2 倍,且无奖励黑客现象。



↓↓听说在下方一键三连的都Accept了🌝

点点赞
点分享
点喜欢

【声明】内容源于网络
0
0
AI因斯坦
人工智能领域论文干货
内容 96
粉丝 0
AI因斯坦 人工智能领域论文干货
总阅读402
粉丝0
内容96