大数跨境

verl-SpeCo X 昇腾:RL训练中的投机解码协同进化新范式

verl-SpeCo X 昇腾:RL训练中的投机解码协同进化新范式 昇腾AI开发者
2026-07-08
5


投机解码(Speculative Decoding)正成为大模型推理加速的核心技术,但在强化学习(RL)训练场景中,它面临一个关键难题:随着PPO、GRPO等训练过程中目标模型策略持续漂移,离线预训练的静态草稿模型会逐渐“掉队”——预测命中率下降、accept length降低,加速收益逐步坍塌,甚至在长尾场景中完全失效。这已成为制约RL训练吞吐的核心瓶颈。


为此,某股份制头部银行研发团队发起开源项目verl-SpeCo,昇腾团队深度参与共创,首次在RL训练场景中实现目标模型与草稿模型的Co-Training协同训练机制。该框架基于昇腾NPU算力开发,它让草稿模型不再是一个静态的推理加速组件,而是成为RL训练闭环的一部分:随着主模型更新,草稿模型同步学习、持续演进,并通过权重热更新机制实时回到vLLM / SGLang Rollout引擎,形成从训练到推理的端到端加速闭环。


verl-SpeCo当前已支持EAGLE3、DFlash主流投机解码算法,并实现了特征采集、异构词表适配、稀疏训练优化、草稿模型在线训练和权重热更新等核心能力。实验表明,开启Co-Training后,EAGLE3和DFlash的accept length在训练中后期均持续提升,在昇腾NPU上,EAGLE3在推理阶段和端到端分别实现20%和11%的加速。


verl-SpeCo:后训练生态的关键拼图


在大语言模型后训练中,强化学习已成为核心技术。Rollout阶段的效率已成为制约RL吞吐量和训练速度的最大瓶颈。将投机解码引入RL框架是行业共识,但传统方案在训练后期因策略漂移导致接受率断崖下跌,加速效果逐步坍塌。


verl-SpeCo的核心价值在于:将投机解码从“静态推理加速”拓展为RL训练期间的在线自适应双模型协同训练能力。让草稿模型始终跟着目标模型一起更新,长期保持高命中率,从根本上解决草稿模型随训练失效的问题。主要亮点包括:



Co-Training协同训练:首次实现目标模型与草稿模型同步迭代更新,稳定维持加速收益。训练结束同步交付优化后的目标模型与适配的草稿模型权重,推理时可直接启用投机解码加速。


通用可扩展架构:算法逻辑与训练调度完全解耦,已支持EAGLE3(多步自回归,融合低/中/高三层隐藏特征,适配长文本与长尾场景)、DFlash(块级非自回归,并行度高、吞吐强)等主流算法。新增算法仅需继承基类、定义模型结构与loss即可接入。


训练稳定性强:深度优化词表对齐、稀疏监督、显存与通信压缩,保障长文本、长尾样本训练稳定可靠。


训练-推理端到端贯通:构建从在线协同训练、实时权重更新到推理加速的完整闭环,加速能力可直接沉淀、复用。


在线草稿模型 Co-Training 整体闭环架构


昇腾原生开发与关键贡献


verl-SpeCo的训练与推理全流程基于昇腾NPU算力平台开发与验证,联创团队在全栈层面完成了多项关键工作:


推理引擎原生适配


基于昇腾CANN生态,完成vLLM投机解码分支在NPU上的原生移植与深度优化,支持EAGLE3、DFlash 等算法的完整功能链路。针对昇腾NPU的矩阵运算硬件特性,对草稿模型前向推理、特征采集、Top-K概率计算等关键算子进行昇腾亲和性优化。


通信与热更新优化


针对NPU集群的HCCS高速互联特性,联创团队优化了草稿模型权重热更新过程中的参数广播与同步机制,降低多卡通信开销。权重更新通过update_draft_weights 接口实现:在当前Batch完成 Token验证后安全触发,先刷新KVCache保证语义一致,再执行原子级指针替换。整个过程对主训练非阻塞侵入,不中断推理服务。


异构词表与稀疏训练优化


在使用Top-K Logprobs训练时,系统面临目标模型与草稿模型词表不一致、全量词表回传导致带宽占用过高的问题。昇腾团队主导实现了两项关键优化:



Top-K Coverage诊断与动态Mask机制:实时监控词表对齐概率,量化Top-k与草稿模型词表的交集和累积概率质量,过滤低置信区域,避免词表异构导致的训练分布退化。


稀疏受限交叉熵:仅传输目标模型最可能的Top-K个Token 及索引,训练时只在词表重叠部分做映射和损失计算,显存和网络传输压力下降百倍。


昇腾NPU上的实验效果


实验基于数学推理RL场景,使用算法为GRPO,目标模型Qwen3-8B,训练数据DAPO-Math-17k,验证数据AIME_2024,NPU推理引擎为vLLM。硬件环境为Atlas 800 A3。草稿模型采用angelslim-qwen3-8b-eagle3(EAGLE3)。设置三类对照组:无草稿模型基线(no_drafter)、静态投机解码(drafter_no_training)、在线协同训练(co_training),实验结果如下。


昇腾NPU上EAGLE3的实验结果。Co-Training的草稿模型接受长度显著高于静态草稿模型。随训练进行,使用Co-Training的推理时间和端到端时间显著优于另外两种情况,且精度无损。


从实验结果可见:



精度无损:Co-Training实验组的Reward曲线与基线完全对齐,验证加速链路零训练损伤,可在保证RL优化目标不变的前提下稳定提速。


接受长度持续提升:开启Co-Training后,EAGLE3和DFlash的accept length在训练中后期均显著高于静态草稿模型,且随训练持续优化。


推理阶段加速:在昇腾NPU上,EAGLE3相比无投机解码基线,推理阶段实现约20%的吞吐提升,有效降低Rollout 采样延迟。


端到端加速:完整RL训练链路(含目标模型训练、Co-Training、权重热更新)端到端效率提升约11%,加速收益保持稳定。


训练稳定性:NPU长链路训练场景下,协同更新机制运行稳定,未出现因权重热更新或通信同步导致的训练中断或收敛异常。


开源社区与后续规划


verl-SpeCo已作为verl-project独立子项目开源(https://github.com/verl-project/verl-SpeCo),核心功能均已完成开发并发布。


Q3 Roadmap(详见GitHub Issue #7:https://github.com/verl-project/verl-SpeCo/issues/7):



我们欢迎社区反馈与贡献。如果您对任一方向感兴趣,或有新的想法,欢迎通过GitHub Issue或Discussion参与共建。


如有技术问题或合作意向,欢迎加入技术交流群参与讨论。





【声明】内容源于网络
0
0
昇腾AI开发者
昇腾社区
内容 977
粉丝 0
昇腾AI开发者 昇腾社区
总阅读5.1k
粉丝0
内容977