平时用 Claude Code、Codex 这些 Agent 工具帮忙干活,基本都是它们各自的官方模型。
活干得确实好,但代价也摆在那,每月要给高昂的订阅费,或调用 API 消耗 Token 的费用。
于是不少人开始尝试,本地部署模型使用,但是没几个人的电脑能部署上百亿参数的模型。
各大科技巨头,虽然持续在为电脑能部署 10B 以下的端侧模型发力,但大部分还是只能聊聊天。
一旦涉及到让 Agent 调用工具、查资料、执行命令这些多步任务就会掉链子。
直到今天,这个情况终于有所改变,面壁智能开源了一款高密度端侧语言模型:MiniCPM5-2B。
参数规模只有 2B,在大部分手机、电脑上部署都跑得动,而且它的能力并不差。
在基准评测里多项能力,超过参数量翻倍的 4B 模型,甚至有了端侧通用 Agent 能力的雏形。
话不多说,下面来跟大家详细介绍一下。
2B 的参数规模,跑出 4B 以下第一
先看 Artificial Analysis 榜单,在全球 4B 参数规模以下的开源模型里,MiniCPM5-2B 排名第一。
而且从这张图看,4B、9B、12B,甚至 30B 参数的开源模型也排在它身后,这个真有点东西。
面壁智能也整理了一份综合评测对比数据表,平均分 53.9,远超同尺寸的几个主流开源模型。
其中表里带角标的分数来自 Artificial Analysis 官方,其余是面壁智能内部测试的。
我最关心与 Agent 相关的几项分数,在这个评测对比表格里,MiniCPM5-2B 得分的确亮眼。
比如代码智能体的 SWE-bench Verified 拿了 46.4,同尺寸的模型最高才 6 分。
长文本理解的 AA-LCR 也是同样情况,59.0 对 28.7,翻了一倍还多。
工具调用的 τ²-Bench Telecom 更是拿到 97.1,整张表分数最高,超过 4B 级模型。
综合榜单成绩(可上下滑动)
除此之外,模型还支持思考,同一个模型既能快问快答,也能切到深度思考推理模式,可按任务情况来选。
我觉得最重要的还是模型的 Agent 能力,现在工具调用、深度搜索、代码生成等简单的 Agent 任务,可以在本地端侧设备上跑了。
特意去了解了下是怎么做到的?原来面壁智能技术团队从模型预训练阶段,就开始往里面灌 Agent 能力。
再经过监督微调和大规模强化学习,可以说整条训练链路都是围绕 Agent 优化的。
不过也说清楚,要是跟云端大模型相比,差距肯定还是在的,但初步来看端侧通用 Agent 能力的雏形已形成。
以后像聊天记录、会议纪要、合同这些敏感数据,就可以交由本地模型直接处理。
数据在本地,而且离线也能运行,最重要是没有了按 Token 计费的那种焦虑。
连训练数据和框架都开源了
比起榜单的分数,这次更让我意外的,是面壁智能的开源力度。
大部分开源模型都只放模型权重,训练数据和训练配方各家都会捂得紧紧的,很少有人往外放。
这次 MiniCPM5-2B 不只开放了模型权重,就连部分训练方法与训练数据也公开了。
比如强化学习那部分是怎么做的,以及一批微调数据,另外还有四个数据集一起开源。
UltraData-Code:一套分级整理的代码数据,从约 1.9 亿个公开 GitHub 仓库里筛出来,光精选层就有 4000 亿 tokens。
UltraData-SFT-Agent-2609:模型后训练用的核心 Agent 数据,约 50 万条工具调用、搜索、写代码的完整操作轨迹。
UltraData-RL-2609:强化学习阶段用的 8 万多道题,每一道的答案都能被程序自动核对。
UltraX-Preview:约 1000 亿 tokens 精炼过的预训练语料,之前登顶过 Hugging Face 数据集趋势榜第一。
我看了下 UltraX-Preview,每条样本都带着三列,原始文本、精炼后的文本,以及中间到底执行了哪些编辑操作。
这些数据的背后,都是基于面壁智能的数据治理体系 UltraData。
其中 UltraX 是这套体系里最新的数据精炼工具,也是开源的,它实现思路还挺有意思。
不靠人写规则,也不让大模型整篇重写,而是微调了一个轻量模型,专门预测「这行删、这行改、这里插一句」这样的编辑动作。
再由程序照着这些动作去执行,每一条编辑都有记录可查。当处理规模上去了,网页数据的质量也跟着提。
除了数据,这次 OpenBMB 还把自研的强化学习训练框架 Meshy 一起开源了。
它去掉了 RL 训练里的中央控制器,也不再依赖 Ray,训练、推理、奖励计算都做成对等的服务,同步、异步、全异步三种训练模式可以灵活切换。
算法上还配套了一个叫 JustRL II 的强化学习策略,专门解决端侧模型做长思维链强化学习时,分数不升反降的问题。
一方面用三阶段流水线把训练数据里的噪声和难度不匹配的题筛掉,另一方面给 GRPO 加了一个 Critic,把奖励精确分到每个词元上,MiniCPM5-2B 在 RL 后训练里的提升就是靠它。
说到这里就不得不提一下,面壁智能在数据这块的积累已经不是一天两天了。
截至 2026 年 9 月,面壁智能和 OpenBMB 社区共开源了超过 10 个训练数据集,总下载量超过 266 万。
另外截至 2026 年 8 月,MiniCPM 系列模型的下载量也已经破了 5000 万。
如何上手部署体验
想要体验模型的朋友,可以直接在自己电脑本地上部署,对设备的配置要求并不高。
在 Ollama、LM Studio 这些部署本地模型的工具上,搜索模型并下载点几下就能完成部署。
另外模型还支持 vLLM、SGLang、llama.cpp、Ollama 等主流推理框架直接加载使用。
我翻了下 MiniCPM 的开源仓库,docs/deployment/ 目录下每个推理框架都有一页教程,可以跟着步骤敲。
微调这边也一样,LLaMA-Factory、ms-swift 各有一页教程。
另外仓库的 skills/ 目录里,还专门提供了部署和微调模型的 Skill,可以安装到 Claude Code、Cursor 等 Agent 工具里。
使用技能只需说一句「用 vLLM 把 MiniCPM5-2B 模型跑起来」,Agent 就会自动选框架、跑命令,把部署做完。
写在最后
最后说说我的看法,这一次 MiniCPM5-2B 的开源让我看到了端侧通用 Agent 能力雏形。
对于手机、PC、汽车这些终端厂商,还有做端侧应用的开发者,手里多了一个能直接用的底座。
以前使用云端模型存在的隐私、成本、离线这个几个问题,现在也有了一个能落地的解法。
但我认为,比起模型权重开源还有一层更大的价值,那就是这次面壁智能开源的训练数据。
模型能训练到多强,跟数据怎么治理、训练怎么调有很大关系,这些一直是各家捂着的核心技术。
这次面壁智能把训练配方、微调数据和数据治理工具一起放出来,让大家都可以基于这套成果往上优化。
这种能把权重和数据都公开的做法,简直大气,相信往后会有越来越多的团队跟进。
用不了多久,手机、电脑、车机、机器人这些设备上,都能跑一个替我们干活的本地 AI。
感兴趣的朋友,可以了解看看。
MiniCPM5-2B 开源链接 (含模型与 UltraData 系列数据):
Hugging Face:https://huggingface.co/collections/openbmb/minicpm5
GitHub:https://github.com/OpenBMB/MiniCPM
Meshy 框架开源链接:
GitHub:https://github.com/OpenBMB/Meshy
博客:https://maydomain.notion.site/meshy-blog-zh
JustRL II 强化学习算法:
博客:https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn
今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!

