大数跨境

刚刚,国产2B小钢炮开源!逼近人类水平,跑出端侧通用Agent雏形

刚刚,国产2B小钢炮开源!逼近人类水平,跑出端侧通用Agent雏形 新智元
2026-09-08
1
导读:全球4B以下性能第一,国产2B模型全套技术底牌开源!

新智元报道

全球 4B 参数以下开源基座模型新榜首,竟是一个 2B 模型。

9 月 8 日,面壁智能与 OpenBMB 正式开源新一代端侧模型 MiniCPM5-2B。在国际权威基准 Artificial Analysis Intelligence Index(AA 榜单)最新评测中,该模型以 23 分的综合成绩登顶全球 4B 以下开源基座模型第一。

尤为引人注目的是其在智能体(Agent)任务上的断层式领先:在 Agentic Index 指标上,MiniCPM5-2B 斩获 20 分。这一成绩不仅远超同级 2B-4B 模型(普遍仅 2 分),甚至超越了参数量数倍于己的 Qwen3.5 9B、Gemma 4 12B 等模型,展示了端侧模型探索通用 Agent 的巨大潜力。

不同于行业内仅开放权重的做法,面壁智能与 OpenBMB 此次同步开源了 MiniCPM5-2B 背后的训练 Recipe、RL 框架及核心数据集,全面造福开发者。

AA 榜单 4B 以下性能第一,Agent 能力断层领先

根据 AA Index 最新榜单,MiniCPM5-2B 是全球 4B 参数以下得分最高的开源模型(23 分),高于 Gemma 4 12B(22 分)、Qwen3.5 9B(22 分)及 Qwen3.5 4B(20 分)。

在「参数量—得分」坐标系中,MiniCPM5-2B 位于 4B 规模之下帕累托线的最顶端。此前开源的 MiniCPM5-1B 版本同样处于该线上,印证了面壁智能坚持的「密度定律」:以极高的单位参数智能密度,用约一半的参数体量跑出了领先于 4B 模型的智能水平。

高分并非依靠堆砌 Token。在完成同等 Intelligence Index 任务时,MiniCPM5-2B 平均仅消耗 21k 输出 Token(推理 14k、回答 7k),处于全场最低档;而得分相近的 Qwen3.5 9B 需 34k,Granite 4.2 8B 需 26k。这对端侧部署意味着更快的响应速度和更低的推理成本。

评测覆盖通用知识、数学代码推理、指令遵循、长文本及工具调用等任务。在衡量真实工作任务完成度的 GDPval-AA v2 榜单上,MiniCPM5-2B 取得 891 分(人类基线 1000 分),是所有参评模型中最接近人类水平的,领先第二名 Granite 4.2 8B 近 190 分,更是将同尺寸模型远远甩在身后。

公开数据集评测显示,MiniCPM5-2B 在「通用智能体」、「搜索智能体」、「工具调用」、「代码推理」等关键维度均获最高分,验证了高密度端侧模型实现通用 Agent 能力的技术可行性。

端侧 Agent 的落地价值日益清晰:

  • 隐私安全:在授权范围内,端侧 Agent 可直接读取屏幕、调用本地应用并处理敏感数据,这是云端服务难以完全开放的权限增量。
  • 离线可用与确定性响应:不依赖网络连接,减少网络波动或服务故障影响,对嵌入手机、车机等硬件的 Agent 至关重要。
  • 成本优势:本地推理无需按 Token 支付云端 API 费用,显著降低高频 Agent 任务的长期使用成本。

若高密度端侧模型能承接部分 Agent 工作,将实质性改变应用层的成本结构。在生态支持上,MiniCPM5-2B 已适配 LLaMA-Factory、ms-swift 等微调框架,以及 vLLM、SGLang、llama.cpp、Ollama 等主流推理框架。

截至 2026 年 8 月,MiniCPM 系列模型开源下载量已突破 5000 万

从数据治理到训练体系:高密度端侧模型的炼成之路

当参数规模受限于端侧设备,底层的数据治理与训练技术栈成为决定模型上限的关键。此次伴随 MiniCPM5-2B 开源的四个数据集,覆盖了训练流程的不同环节:

  • UltraX(预训练):利用 0.6B 小模型对网页数据进行「行级别」自动编辑,避免语义漂移,提升信息保真度。使用该数据训练 1B 模型,160 亿 Token 即可达到原始数据 200 亿 Token 的效果,节省 20% 训练量。
  • UltraData-Code(代码预训练):对约 1.92 亿个 GitHub 仓库进行 L0–L3 分级治理,完成清洗去重、算法筛选及结构化合成,转化为高质量训练样本。
  • UltraData-SFT-Agent-2609(SFT):包含 50 多万条 Agent 训练样本,覆盖从基础工具调用到复杂工作流的全链路任务。
  • UltraData-RL-2609(RL 后训练):针对奖励信号痛点,设计三阶段清洗流水线,为强化学习提供高信噪比数据。

在训练框架侧,面壁智能开源了自研强化学习框架 Meshy。该框架去除了中央控制器和 Ray 依赖,将训练、推理、奖励计算建模为对等服务,支持同步、异步及全异步模式灵活切换。

针对端侧模型长思维链训练中分数下降的问题,团队提出了基于奖励的强化学习策略 JustRL II:通过三阶段流水线校准数据,并在算法上为 GRPO 引入 Critic 实现词元级信用分配,显著提升了 RL 后训练的性能收益。

面壁智能此次将模型权重、训练数据集、RL 框架及训练 Recipe 一并开源,这在头部大模型团队中极为罕见。

一本开源账:十个数据集,三年时间线

数据管线是各家真正的护城河,但行业普遍存在「只开权重不开数据」的现象。面壁智能及 OpenBMB 社区则坚持长期贡献,累计开源超过 10 个大模型训练数据集:

  • 2023 年 4 月 UltraChat:约 150 万条合成多轮对话,被全球超 200 个模型用于对齐训练。
  • 2023 年 12 月 UltraFeedback:含 6.4 万条提示词及 38 万条 GPT-4 反馈,助力 Zephyr-7B 等明星模型对齐。
  • 2025 年 12 月 Ultra-FineWeb:约 1T 英文加 120B 中文 Token 的高质量语料,曾登 Hugging Face 热门榜第一。
  • 2026 年加速发布:涵盖数学语料、中文预训练合成数据集等,几乎「按月上新」。

截至 2026 年 9 月,UltraData 系列数据集开源总下载量超 266 万次。这些实打实的高价值资产,正在实质性地降低社区研究端侧大模型的门槛。

通往 AGI 之路:高质量数据是最厚的地基

当算力红利见顶,模型能力的增量正转向数据侧。数据治理已从后台工作变为核心竞争力。MiniCPM5-2B 的性能登顶正是这一趋势的证明。

从长期看,开源数据治理工具和方法比单纯开源模型更具深远影响。模型先进性有保质期,但公开的修复方法、工具和高质量数据集是可复用的地基,其复利效应将在更长周期内显现。

资源链接:

  • MiniCPM5-2B 模型及数据(Hugging Face):https://huggingface.co/collections/openbmb/minicpm5
  • GitHub 仓库:https://github.com/OpenBMB/MiniCPM
  • Meshy 框架(GitHub):https://github.com/OpenBMB/Meshy
  • JustRL II 算法博客:https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn
【声明】内容源于网络
0
0
新智元
智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
内容 16526
粉丝 0
新智元 智能+中国主平台,致力于推动中国从互联网+迈向智能+新纪元。重点关注人工智能、机器人等前沿领域发展,关注人机融合、人工智能和机器人革命对人类社会与文明进化的影响,领航中国新智能时代。
总阅读387.9k
粉丝0
内容16.5k