大数跨境

让AI真正跑在设备上:面壁智能发布MiniCPM5-2B,2B参数+512K上下文,端侧智能体就绪

让AI真正跑在设备上:面壁智能发布MiniCPM5-2B,2B参数+512K上下文,端侧智能体就绪 努力犯错玩AI
2026-07-20
4
导读:端侧AI的进化时刻2026年7月19日,WAIC 2026世界人工智能大会上,面壁智能联合OpenBMB正式

端侧AI的进化时刻

2026年7月19日,WAIC 2026世界人工智能大会上,面壁智能联合OpenBMB正式发布了MiniCPM5-2B。这是MiniCPM5系列的第二款模型,也是目前4B以下参数规模中性能最强的端侧文本基座大模型。

MiniCPM5-2B与此前5月发布的MiniCPM5-1B共享同一技术底座——基于UltraData分级数据管理体系和ForgeTrain训练框架。1B版本以极轻量证明了小模型也能强,2B版本在更大参数空间内进一步释放了端侧模型的智能潜力。配合RL+OPD后训练方案,MiniCPM5-2B在数学、代码、指令遵循等任务上表现出了远超自身参数规模的智能水平。

2B参数霸榜4B以下

在最新的人工智能分析榜单AA-Index上,MiniCPM5-2B以17分的成绩占据榜首,取得了全球4B以下模型最高得分。

AA-Index是一个综合性评测基准,覆盖推理、知识、代码、指令遵循、数学、逻辑和智能体等维度。MiniCPM5-2B用仅2B参数实现了超越大部分4B甚至8B级别模型的综合性能——能力维度上,覆盖通用知识、数学与代码推理、复杂指令遵循、多语言理解与生成、长文本处理、工具调用及深度搜索,是当前4B以下任务覆盖最完整的模型。

参考MiniCPM5-1B的评测数据,它在AA-Index上以17.9分位居小尺寸模型第一,超越Qwen3.5-2B的16.3分,同时也超越了LFM2.5-1.2B-Thinking等模型。2B版本在此基础上进一步升级,将性能上限推到了新高度。

在面壁智能提出的"密度定律"框架下,大模型的知识密度每18个月翻一番。MiniCPM5-1B用1B参数实现了接近GPT-3的性能,MiniCPM5-2B则用2B参数把端侧模型的智能边界再次外推。

512K上下文:整本书一次处理

MiniCPM5-2B提供了512K的超长上下文窗口。这意味着单次输入可以处理整本长篇小说、完整的研究生教材、或者数十万行项目代码。

对端侧模型来说,512K上下文是一个重要突破。大多数端侧模型的上下文窗口只有4K到32K,处理长文档时需要分块再拼接,导致上下文断裂。MiniCPM5-2B直接把上限提升到512K,让它能胜任长文档分析、代码库理解、对话历史维护等需要长期记忆的任务。

在实际使用中,意味着丢进一整份IPO招股书、或者一份完整的开源项目代码,模型都能一次性理解并回答问题。这对端侧设备上的知识库问答、代码审查助手等场景尤其重要——不需要联网上传数据,数据完全留存在设备本地。

混合思考:快速响应与深度推理兼得

MiniCPM5-2B原生支持混合思考能力。同一个模型,通过一个开关在两种模式之间灵活切换。

快速响应模式下,模型直接输出答案,延迟低,适合聊天助手、快速问答等场景。深度推理模式下,模型会先经历内部思考过程,生成推理链条后再给出答案,适合数学证明、代码调试和复杂逻辑分析。

"混合思考"是MiniCPM5系列的核心亮点之一。MiniCPM5-1B已通过enable_thinking参数实现了这一能力,2B版本将其带到更高参数空间。一次加载、两种模式,不需要在设备上部署两个模型,也不需要在云端和端侧之间来回切换。对于端侧部署场景,这意味着开发者可以根据设备算力和任务复杂度灵活选择推理模式。

MiniCPM5-2B评测表现

原生智能体能力

端侧AI的下一个方向是智能体——不只是一个问答模型,而是能主动执行任务的AI助手。面壁智能在MiniCPM5-2B的设计和训练阶段就内置了智能体核心能力。

训练过程中执行了200B规模的Agent Midtraining。这相当于用两千亿token的智能体行为数据进行中间训练,让模型学会工具使用的"语法"和"逻辑"。然后是百万条高质量Agent SFT轨迹——人工筛选和标注了百万条真实的工具调用、API交互、搜索决策等轨迹数据,覆盖开发者可能遇到的各类场景。最后是可扩展的Agent RL对齐优化——通过强化学习让模型在复杂环境中学会正确选择工具、合理规划步骤。

最终模型原生具备工具调用、深度搜索和代码生成三大智能体技能。开发者拿到模型后可以直接让它调用API、搜索网络信息、生成和修改代码,不需要额外的插件层或适配层。

实际使用中,在手机端部署MiniCPM5-2B作为本地智能体,可以实现一些过去必须联网才能完成的操作:从日历中读取日程安排并自动排期、读取本地文件并进行代码审查、与本地知识库交互进行RAG问答。所有数据留存在设备本地,不上传云端。

面壁智能认为,端侧智能体是手机、PC、智能座舱上本地化AI助手的核心基座。MiniCPM5-2B的设计目标就是让AI助手不需要联网,直接在设备上完成感知到执行的完整闭环。

多芯片适配:从手机到汽车

面壁智能已完成对AMD、英特尔、联发科、高通等全球主流芯片厂商的端侧模型适配。同时联合众智FlagOS社区完成9款芯片的Day0适配,覆盖华为昇腾、海光、昆仑芯、沐曦、摩尔线程、平头哥、清微智能、天数智芯、英伟达,并延伸至ARM端侧平台。

端侧大模型与云端大模型不同。云端模型跑在统一的数据中心GPU上,开发者只需要管好网络请求就行。端侧模型要面对的硬件生态极度碎片化——不同厂商的芯片架构不同、指令集不同、显存大小不同、算力上限不同。要做到"发版即适配",需要提前与每一家芯片厂商合作做算子优化、量化校准和推理引擎适配。面壁智能在这一领域投入了大量工程资源,MiniCPM5-2B的芯片适配规模在端侧模型中是少见的。

这意味着MiniCPM5-2B从发布当天起就能在广泛硬件平台上运行——从手机SoC到汽车座舱芯片,从国产GPU到国际CPU。开发者不再需要等待逐家适配,模型拿到手就能跑。

面壁智能的端侧模型已在吉利银河M9、长安马自达EZ-60等车型的智能座舱中量产搭载。在智源大会的展示中,搭载面壁模型的智能座舱不依赖云端即可完成"感知—记忆—推理—执行"全闭环,包括主动推荐座舱应用、无感车窗空调调节、事故实时识别与处理引导等。

MiniCPM5-2B芯片适配生态

开源生态与社区影响力

MiniCPM5-2B即将正式开源。届时开发者可通过Hugging Face、魔搭ModelScope等平台获取模型权重,同时获取针对各芯片平台的适配镜像与部署指南。

面壁智能在WAIC 2026期间同步启动了全球开发者大使计划和MiniCPM火种计划,面向全球开发者开放赋能。联合中国信通院启动了AI for AI标准制定,推动端侧AI的标准化进程。同时发起"面壁+行业伙伴计划",向行业伙伴开放基础模型、AgentVerse平台、私有化部署和算力资源。

截至2026年6月底,MiniCPM系列累计下载量突破3800万次,覆盖超过160个国家和地区。在2024年Hugging Face全球最受欢迎大模型统计中,OpenBMB社区的下载量位列中国区第一。从手机、汽车到具身智能,从文本、视觉到语音全模态,MiniCPM正在让AI从云端走进每一个终端设备。

端侧AI的新篇章

MiniCPM5-2B的发布,标志着端侧大模型正式进入智能体时代。2B参数、512K上下文、混合思考、原生工具调用——这些曾经需要云端百亿参数模型才能实现的能力,现在可以跑在手机和汽车上。

MiniCPM系列的演进方向也清晰地展示了端侧AI的发展轨迹:从2024年的MiniCPM-2B超越Llama2-13B,到2025年MiniCPM4系列的稀疏注意力架构,到2026年5月MiniCPM5-1B凭借1B参数超越所有2B以下模型,再到今天的MiniCPM5-2B登顶4B以下榜单。每半年一次能力跃迁,密度定律一路得到验证。

两年前端侧AI还是一个"能做但不能用"的概念。现在MiniCPM5-2B能跑在手机和汽车上,原生支持工具调用和深度搜索,可以直接作为智能体的基座模型。端侧AI正在从"可用"走向"好用",面壁智能在这条赛道上保持了持续领先。

对于正在做端侧AI部署、本地智能体开发、智能座舱、AI PC的团队,MiniCPM5-2B提供了一个值得关注的选择。不是做得更小的妥协版,而是做得更巧的高密度版——让AI真正跑在设备上,不联网、低延迟、数据不出去。

【声明】内容源于网络
0
0
努力犯错玩AI
为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
内容 274
粉丝 0
努力犯错玩AI 为AI开发者打造HuggingFace国内镜像站,提供最新流行开源模型资讯并免费加速下载。更多内容请访问https://aifasthub.com
总阅读1.6k
粉丝0
内容274