大数跨境

效果惊艳!MiniCPM5-2B 开源了!

效果惊艳!MiniCPM5-2B 开源了! GitHubDaily
2026-09-08
10

平时用 Claude Code、Codex 这些 Agent 工具帮忙干活,基本都是它们各自的官方模型。

活干得确实好,但代价也摆在那,每月要给高昂的订阅费,或调用 API 消耗 Token 的费用。

于是不少人开始尝试,本地部署模型使用,但是没几个人的电脑能部署上百亿参数的模型。

各大科技巨头,虽然持续在为电脑能部署 10B 以下的端侧模型发力,但大部分还是只能聊聊天。

一旦涉及到让 Agent 调用工具、查资料、执行命令这些多步任务就会掉链子。

直到今天,这个情况终于有所改变,面壁智能开源了一款高密度端侧语言模型:MiniCPM5-2B

参数规模只有 2B,在大部分手机、电脑上部署都跑得动,而且它的能力并不差。

在基准评测里多项能力,超过参数量翻倍的 4B 模型,甚至有了端侧通用 Agent 能力的雏形。

话不多说,下面来跟大家详细介绍一下。

2B 的参数规模,跑出 4B 以下第一

先看 Artificial Analysis 榜单,在全球 4B 参数规模以下的开源模型里,MiniCPM5-2B 排名第一。

而且从这张图看,4B、9B、12B,甚至 30B 参数的开源模型也排在它身后,这个真有点东西。

image-20260904010332644

面壁智能也整理了一份综合评测对比数据表,平均分 53.9,远超同尺寸的几个主流开源模型。

其中表里带角标的分数来自 Artificial Analysis 官方,其余是面壁智能内部测试的。

我最关心与 Agent 相关的几项分数,在这个评测对比表格里,MiniCPM5-2B 得分的确亮眼。

比如代码智能体的 SWE-bench Verified 拿了 46.4,同尺寸的模型最高才 6 分。

长文本理解的 AA-LCR 也是同样情况,59.0 对 28.7,翻了一倍还多。

工具调用的 τ²-Bench Telecom 更是拿到 97.1,整张表分数最高,超过 4B 级模型。

MiniCPM5-2B 媒体资料包 (1)


综合榜单成绩(可上下滑动)

除此之外,模型还支持思考,同一个模型既能快问快答,也能切到深度思考推理模式,可按任务情况来选。

我觉得最重要的还是模型的 Agent 能力,现在工具调用、深度搜索、代码生成等简单的 Agent 任务,可以在本地端侧设备上跑了。

特意去了解了下是怎么做到的?原来面壁智能技术团队从模型预训练阶段,就开始往里面灌 Agent 能力。

再经过监督微调和大规模强化学习,可以说整条训练链路都是围绕 Agent 优化的。

不过也说清楚,要是跟云端大模型相比,差距肯定还是在的,但初步来看端侧通用 Agent 能力的雏形已形成

以后像聊天记录、会议纪要、合同这些敏感数据,就可以交由本地模型直接处理。

数据在本地,而且离线也能运行,最重要是没有了按 Token 计费的那种焦虑。

连训练数据和框架都开源了

比起榜单的分数,这次更让我意外的,是面壁智能的开源力度。

大部分开源模型都只放模型权重,训练数据和训练配方各家都会捂得紧紧的,很少有人往外放。

这次 MiniCPM5-2B 不只开放了模型权重,就连部分训练方法与训练数据也公开了。

比如强化学习那部分是怎么做的,以及一批微调数据,另外还有四个数据集一起开源。

  • UltraData-Code:一套分级整理的代码数据,从约 1.9 亿个公开 GitHub 仓库里筛出来,光精选层就有 4000 亿 tokens。

  • UltraData-SFT-Agent-2609:模型后训练用的核心 Agent 数据,约 50 万条工具调用、搜索、写代码的完整操作轨迹。

  • UltraData-RL-2609:强化学习阶段用的 8 万多道题,每一道的答案都能被程序自动核对。

  • UltraX-Preview:约 1000 亿 tokens 精炼过的预训练语料,之前登顶过 Hugging Face 数据集趋势榜第一。

我看了下 UltraX-Preview,每条样本都带着三列,原始文本、精炼后的文本,以及中间到底执行了哪些编辑操作。

这些数据的背后,都是基于面壁智能的数据治理体系 UltraData。

其中 UltraX 是这套体系里最新的数据精炼工具,也是开源的,它实现思路还挺有意思。

不靠人写规则,也不让大模型整篇重写,而是微调了一个轻量模型,专门预测「这行删、这行改、这里插一句」这样的编辑动作。

再由程序照着这些动作去执行,每一条编辑都有记录可查。当处理规模上去了,网页数据的质量也跟着提。

image-20260904010517167

除了数据,这次 OpenBMB 还把自研的强化学习训练框架 Meshy 一起开源了。

它去掉了 RL 训练里的中央控制器,也不再依赖 Ray,训练、推理、奖励计算都做成对等的服务,同步、异步、全异步三种训练模式可以灵活切换。

算法上还配套了一个叫 JustRL II 的强化学习策略,专门解决端侧模型做长思维链强化学习时,分数不升反降的问题。

一方面用三阶段流水线把训练数据里的噪声和难度不匹配的题筛掉,另一方面给 GRPO 加了一个 Critic,把奖励精确分到每个词元上,MiniCPM5-2B 在 RL 后训练里的提升就是靠它。

说到这里就不得不提一下,面壁智能在数据这块的积累已经不是一天两天了。

截至 2026 年 9 月,面壁智能和 OpenBMB 社区共开源了超过 10 个训练数据集,总下载量超过 266 万。

另外截至 2026 年 8 月,MiniCPM 系列模型的下载量也已经破了 5000 万。

如何上手部署体验

想要体验模型的朋友,可以直接在自己电脑本地上部署,对设备的配置要求并不高。

在 Ollama、LM Studio 这些部署本地模型的工具上,搜索模型并下载点几下就能完成部署。

另外模型还支持 vLLM、SGLang、llama.cpp、Ollama 等主流推理框架直接加载使用。

我翻了下 MiniCPM 的开源仓库,docs/deployment/ 目录下每个推理框架都有一页教程,可以跟着步骤敲。

微调这边也一样,LLaMA-Factory、ms-swift 各有一页教程。

image-20260904010604631

另外仓库的 skills/ 目录里,还专门提供了部署和微调模型的 Skill,可以安装到 Claude Code、Cursor 等 Agent 工具里。

使用技能只需说一句「用 vLLM 把 MiniCPM5-2B 模型跑起来」,Agent 就会自动选框架、跑命令,把部署做完。

写在最后

最后说说我的看法,这一次 MiniCPM5-2B 的开源让我看到了端侧通用 Agent 能力雏形。

对于手机、PC、汽车这些终端厂商,还有做端侧应用的开发者,手里多了一个能直接用的底座。

以前使用云端模型存在的隐私、成本、离线这个几个问题,现在也有了一个能落地的解法。

但我认为,比起模型权重开源还有一层更大的价值,那就是这次面壁智能开源的训练数据。

模型能训练到多强,跟数据怎么治理、训练怎么调有很大关系,这些一直是各家捂着的核心技术。

这次面壁智能把训练配方、微调数据和数据治理工具一起放出来,让大家都可以基于这套成果往上优化。

这种能把权重和数据都公开的做法,简直大气,相信往后会有越来越多的团队跟进。

用不了多久,手机、电脑、车机、机器人这些设备上,都能跑一个替我们干活的本地 AI。

感兴趣的朋友,可以了解看看。

MiniCPM5-2B 开源链接 (含模型与 UltraData 系列数据):

  • Hugging Face:https://huggingface.co/collections/openbmb/minicpm5

  • GitHub:https://github.com/OpenBMB/MiniCPM

Meshy 框架开源链接:

  • GitHub:https://github.com/OpenBMB/Meshy

  • 博客:https://maydomain.notion.site/meshy-blog-zh

JustRL II 强化学习算法:

  • 博客:https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn

今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!

【声明】内容源于网络
0
0
GitHubDaily
专注于分享 GitHub 上知名的 Python、Java、Web、AI、数据分析等多个领域的优质学习资源、开源项目及开发者工具,为 GitHub 开发者提供优质编程资讯。
内容 1480
粉丝 0
GitHubDaily 专注于分享 GitHub 上知名的 Python、Java、Web、AI、数据分析等多个领域的优质学习资源、开源项目及开发者工具,为 GitHub 开发者提供优质编程资讯。
总阅读7.4k
粉丝0
内容1.5k