大数跨境

刚刚,面壁智能 2B「小钢炮」登顶!Agent 榜断层第一,连训练数据都开源了

刚刚,面壁智能 2B「小钢炮」登顶!Agent 榜断层第一,连训练数据都开源了 AI信息Gap
2026-09-08
7
导读:刚刚,面壁智能「小钢炮」系列新成员 MiniCPM5-2B 正式开源。

2B 参数的小模型在性能上超越 12B 大模型,这在端侧模型发展史上尚属首次。面壁智能正式开源「小钢炮」系列新成员 MiniCPM5-2B。该模型不仅在 Artificial Analysis 权威榜单中以 23 分的综合智能指数位居榜首,超越 Gemma 4(12B)和 Qwen3.5(9B),更在 Agent 能力评测中以 20 分断层领先。

在综合评测中,MiniCPM5-2B 均分高达 53.9,远超同参数级别的其他模型,甚至优于 4B 级别的 Qwen3.5-4B。此次开源不仅是模型权重的公开,面壁智能更罕见地开放了训练 Recipe、SFT 数据、数据治理工具 UltraX 及 RL 训练框架 Meshy,为开发者提供了完整的方法论支持。截至目前,MiniCPM 系列模型开源下载量已突破 5000 万。

MiniCPM5-2B 首次在端侧实现了通用 Agent 能力雏形,具备工具调用、深度搜索及代码生成能力,部分任务表现超越 Qwen3.5 和 DeepSeek-R1。

2B 的身板,12B 的智商

Artificial Analysis 推出的综合智能指数涵盖 GDPval-AA、Terminal-Bench 等 9 项基准评测;Agentic Index 则专注于衡量模型在工具调用、任务规划等 Agent 工作流中的表现。在基于真实工作任务的 GDPval-AA v2 排行榜中,MiniCPM5-2B 以 891 分位列开源端侧模型第一,大幅领先 Granite 4.2 8B(702 分)及 Gemma 4 12B(647 分)。

在「参数 - 智商」散点图中,MiniCPM5-2B 凭借极高的参数效率达成「帕累托前沿」。面壁智能并未单纯增加参数量,而是通过提升训练数据质量和优化训练方法,践行「大模型密度定律」,实现了用更少参数达到更高智能水平的效果。

大模型密度定律:由清华大学刘知远教授团队提出,核心结论为模型智能密度随时间呈指数级增强,达到特定智能水平所需参数量每 3.5 个月下降一半。

在具体细分领域,MiniCPM5-2B 表现卓越。代码推理 LiveCodeBench v6 得分 69.1,数学竞赛 AIME 2025/2026 得分 86.5,均获全场最高分。在 10 项智能体类评测中,该模型拿下 7 项第一,展现了其在编程、数学及 Agent 任务上的全面优势。

MiniCPM5-2B 的技术突破

精细化数据治理

模型能力上限取决于训练数据质量。针对传统数据过滤方式粗放的问题,面壁智能开发了 0.6B 参数的 UltraX 工具。该工具能逐行审阅网页数据,执行保留、删除、补全或替换操作,实现颗粒度极细的数据治理。实测显示,经 UltraX 处理的数据仅需 160 亿 token 训练量即可超越以往 200 亿 token 的效果,显著提升了模型性能。

此次面壁智能共开源四个核心数据集:覆盖 11 种编程语言的 UltraData-Code、包含 50 万条 Agent 样本的 UltraData-SFT-Agent-2609、经过三轮清洗的 8 万条强化学习样本 UltraData-RL-2609,以及此前已开源的 UltraX 精炼数据。至此,面壁智能与 OpenBMB 社区开源的大模型训练数据集已超过 10 个,UltraData 系列总下载量突破 266 万。

Agent 能力的全流程构建

MiniCPM5-2B 通过从预训练到对齐的全流程优化,成功在端侧小模型上实现了通用 Agent 能力:

Agentic 预训练:在预训练阶段大规模注入 Agent 相关数据,使模型从底层理解工具调用与任务规划。

Agent SFT:利用 50 万条真实交互轨迹进行监督微调,强化模型执行工具调用、代码编写及搜索的能力。

大规模 Agent RL:基于 8 万多条高质量样本,利用自研强化学习框架 Meshy 和算法 JustRL II 进行对齐训练。Meshy 去除了中央控制器依赖,支持多种异步训练模式;JustRL II 通过引入 Critic 模块,将信用分配颗粒度提升至词元级别,有效解决了长思维链训练中的分数下降问题。

实测表现与部署方案

在实际测试中,MiniCPM5-2B 展现了超出预期的理解力与逻辑判断力。面对充满口语和省略的会议速记,它能精准分析歧义并归类需求;在简历筛选任务中,其排序结果有理有据,高度贴合岗位要求;在数据分析场景下,模型甚至能进行自我验证以确保计算准确。

更重要的是,MiniCPM5-2B 支持本地化部署,对硬件要求极低,能够确保敏感数据不出设备,满足高合规性需求。该模型已全面适配 ollama、llama.cpp、vllm、Sglang 等主流推理框架,支持 Llama_factory 和 ms_swift 微调,并拥有自研 CPU 推理框架 arclight 支持。

MiniCPM5-2B 及相关资源开源信息:

  • Hugging Face:https://huggingface.co/collections/openbmb/minicpm5
  • GitHub:https://github.com/OpenBMB/MiniCPM

Meshy 框架开源信息:

  • GitHub:https://github.com/OpenBMB/Meshy

JustRL II 强化学习算法技术博客:

  • Notion Blog:https://panhaoxuan.notion.site/justrl-ii-small-llms-to-128k-reasoning-with-a-critic-cn

MiniCPM5-2B 的发布,标志着端侧模型正式具备了运行复杂 Agent 任务的能力,为本地化 AI 应用开辟了新的可能。

【声明】内容源于网络
0
0
AI信息Gap
各类跨境出海行业相关资讯
内容 1073
粉丝 0
AI信息Gap 各类跨境出海行业相关资讯
总阅读124.8k
粉丝0
内容1.1k