大数跨境

MiniCPM5-2B 开源,端侧通用 Agent 雏形跑出来了

MiniCPM5-2B 开源,端侧通用 Agent 雏形跑出来了 路过银河AI
2026-09-12
11
导读:2B 参数打赢 12B:MiniCPM5-2B 开源,端侧"通用 Agent 雏形"跑出来了端侧大模型这条

端侧大模型赛道迎来新突破。面壁智能联合 OpenBMB 开源社区正式发布新一代端侧语言基座模型MiniCPM5-2B。该模型参数规模仅 2B,却在权威评测中斩获全球 4B 以下开源模型榜首,并首次在端侧尺寸上展现出通用 Agent 的雏形。

一、2B“小钢炮”:Dense 架构直指端侧

作为 MiniCPM5 系列的第二款产品(继 1B 版本后),MiniCPM5-2B 采用Dense 2B Transformer架构,沿用成熟训练配方放大而成,精准定位端侧、本地部署及资源受限场景

其能力远超参数规模限制,支持工具调用、深度搜索、代码生成等复杂任务。面壁智能指出,该模型在 2B 规模上已初步具备通用 Agent 能力;随着端侧 Agent 技术演进,其在办公与生活场景的应用成本有望进一步降低。

二、性能实测:4B 以下开源第一,智能密度翻倍

在 Artificial Analysis Intelligence Index(AA 榜单)评测中,MiniCPM5-2B 综合得分23 分,位居全球 4B 参数以下开源基座模型第一

智能体指标表现尤为抢眼:

指标 MiniCPM5-2B 同级对比模型
AA 综合得分 23 分(4B 以下第一)
Agentic Index(智能体) 20 分 LFM2.5-2.6B、Granite 4.2 3B、Mistral 3 3B 均为2 分
34 项基准平均分 53.9 分(第一) 同级 2B 第二名 33.2 分;超越 4B 最佳模型 Qwen3.5-4B
真实任务评测(人类基线 1000) 891 分 Gemma 4 12B 仅 647 分(参数量约为其 6 倍)

核心优势体现在三个维度:

智能密度:以 2B 参数实现超越 4B 级模型的智能得分。参数量仅为竞品一半,智能得分却接近两倍,参数利用效率极高。
Token 效率:消耗 21k token(1.4k 思考 +7k 答案)即获得 23 分智力得分。相比之下,Granite 4.2 3B 消耗约 19k token(12k 用于思考)仅得 14 分,LFM2.5-2.6B 消耗同等 Token 仅得 11 分。
评测覆盖面:34 项基准全面覆盖代码推理、数学推理、指令遵循、综合知识、长文本理解、工具调用及 Agent 任务。

三、全栈开源:RL 框架、训练配方与数据集同步释放

此次发布不仅开源模型权重,更提供了完整的“全家桶”:面壁智能与 OpenBMB 同步开放自研强化学习框架Meshy、基于奖励的强化学习策略JustRL II,以及全套训练配方与配套数据集。

Meshy 框架:摒弃中央控制器与 Ray 依赖,将训练、推理、奖励计算等环节组织为对等服务。通过 TransferQueue 数据就绪状态驱动流程,支持同步、异步及全异步三种模式切换,便于横向扩展。

JustRL II 策略:针对长思维链强化学习中的数据质量与信用分配难题,数据侧采用三阶段流水线筛选校准;算法侧为 GRPO 引入Critic机制,实现词元级信用分配。该策略显著提升了 MiniCPM5-2B 在强化学习后训练中的性能收益。

UltraData 数据家族:随模型一同释出,包含 UltraX(高质量网页预训练数据)、UltraData-Code(L0–L3 分层代码数据)、UltraData-SFT-Agent-2609(50 万条 Agent 样本)及 UltraData-RL-2609(8 万 + 条高质量 RL 样本,覆盖数学、代码、通用知识与长上下文推理)。

此举赋予开发者可复现、可验证的能力:不仅可直接使用模型,更能依据公开配方自行训练。

四、硬件生态:Intel、瑞芯微、Arm 首日原生适配

端侧模型落地关键在于硬件适配。MiniCPM5-2B 已完成与英特尔、瑞芯微、Arm 等主流芯片平台的首日(Day0)原生适配

英特尔平台:依托酷睿 Ultra 系列 CPU、GPU 和 NPU 异构计算资源,配合 OpenVINO 工具套件优化算子、图融合与内存调度,支持 AI PC 本地部署。
瑞芯微平台:基于 RK3588 与 RK1828 双芯平台,通过 RKNN3 工具链完成量化与算子优化,支持推理、工具调用、深度搜索及代码生成。
Arm 平台:适配启用第二代可伸缩矩阵扩展技术SME2的 Armv9 移动设备。测试显示,相关优化使预填充与解码阶段性能分别提升约1.7 倍1.2 倍

工具链生态完善:训练微调支持 LlamaFactory、ms-swift;推理部署兼容 SGLang、vLLM、llama.cpp、Ollama、Hugging Face Transformers 等主流框架,并支持面壁自研 Arclight CPU 推理框架,开发者可按需灵活选择。

五、行业洞察:端侧竞争的三大转折

第一,竞争焦点从“能跑”转向“能干活”。过去端侧模型侧重在移动端运行,MiniCPM5-2B 则将战场推向 Agent 任务(工具调用、搜索、代码生成)。Agentic Index 上 20 分对 2 分的断层领先,标志着先发者已在新赛道拉开差距。

第二,智能密度成为端侧硬通货。受限于算力与内存,“用一半参数拿到近两倍智能得分”比单纯的高分更具产业价值,直接决定了单设备的能力承载上限。

第三,“训练方法开源”价值超越“权重开源”。Meshy+JustRL II+UltraData 的组合将强化学习工程细节公开,让复现与二次创新成为可能。截至 2026 年 8 月,MiniCPM 系列全球下载量已突破5000 万次,印证了其生态影响力。

未来关键看点在于,此类端侧模型能否在有限资源下稳定执行复杂任务,并在效果、速度与功耗间取得平衡,从而将评测优势转化为实际应用价值。这将是“端侧通用 Agent"从雏形走向成熟的关键一步。

本文由天渊三整理撰写。

【声明】内容源于网络
0
0
路过银河AI
1234
内容 1072
粉丝 1
路过银河AI 1234
总阅读34.6k
粉丝1
内容1.1k