昆仑万维开源 Skywork-MoE:首个单卡可推理的千亿级 MoE 大模型
2024 年 6 月 3 日,昆仑万维正式宣布开源高性能稀疏大模型 Skywork-MoE。该模型基于此前开源的 Skywork-13B 扩展而成,是全球首个完整落地 MoE Upcycling 技术的开源千亿级混合专家(MoE)模型,也是首个支持在单台 RTX 4090 服务器上进行推理的同类模型。
模型性能与商用政策
Skywork-MoE 已完全开源模型权重及技术报告,支持免费商用且无需申请。模型总参数量为 1460 亿,激活参数量为 220 亿,包含 16 个专家网络(Expert),每次推理仅激活其中 2 个。在同等激活参数量下,其性能逼近 700 亿参数的稠密(Dense)模型,同时推理成本降低近 3 倍。
训练优化与并行策略
针对 MoE 模型训练难度大、泛化能力弱的痛点,Skywork-MoE 引入了 Gating Logits 归一化与自适应 Aux Loss 两种优化算法。为实现高效的大规模分布式训练,该模型采用了 Expert Data Parallel(专家数据并行)与非均匀切分流水并行两项核心并行设计。
推理效率与技术突破
在推理层面,Skywork-MoE 是目前支持在 8 台 RTX 4090 服务器上运行的最大开源 MoE 模型。通过首创的非均匀 Tensor Parallel 并行推理技术,结合 FP8 量化方案,模型吞吐量可达 2200 tokens/s。
资源下载与技术文档
模型权重下载:
- 基础版:https://huggingface.co/Skywork/Skywork-MoE-base
- FP8 量化版:https://huggingface.co/Skywork/Skywork-MoE-Base-FP8
开源仓库:https://github.com/SkyworkAI/Skywork-MoE
技术报告:https://github.com/SkyworkAI/Skywork-MoE/blob/main/skywork-moe-tech-report.pdf
推理代码(支持 8x4090 服务器 8bit 量化加载):https://github.com/SkyworkAI/vllm

