ModelScope 发布 CPU 推理引擎 DashInfer
ModelScope 正式推出预训练大语言模型(LLM)推理引擎 DashInfer。该引擎提供 C++ 与 Python 接口,专为多种 CPU 架构设计,旨在实现大模型的高效推理。
核心架构与技术特性
DashInfer 基于 C++ Runtime 构建,支持连续批处理及多 NUMA 推理模式,能够充分释放服务器级 CPU 算力,为 14B 参数及以下的大模型提供多元化的硬件部署方案。项目已开源,具备轻量级架构、高精度计算内核及行业标准推理技术,全面兼容主流开源 LLM 模型及 PTQ 量化技术。
多平台支持与调度机制
引擎提供多语言 API,广泛适配 x86 与 ARMv9 架构 CPU,支持 FP32、BF16 及 InstantQuant 等多种数据类型。在模型交互方面,DashInfer 支持模型的加载、序列化及基于 DLPack 格式的 Tensor 外部框架交互。调度策略上,单 NUMA 环境采用多线程与线程池机制,多 NUMA 环境则通过多进程 Client-Server 架构实现 Tensor Parallel 模型推理。
性能表现与资源链接
测试数据显示,DashInfer 在 ARM 和 x86 CPU 平台上均展现出优异的推理性能,显著提升大模型运行效率。
代码开源地址:https://github.com/modelscope/dash-infer
推理体验地址:https://www.modelscope.cn/studios/modelscope/DashInfer-Demo

