大数跨境

15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge

15亿参数挑战机器人控制,MiniCPM-RobotManip正式开源;覆盖文本/图/视频/动作序列,英伟达发布全模态模型Cosmos3-Edge HyperAI超神经
2026-07-30
2
导读:7.25-7.30Weekly Highlights!

在具身智能领域,让机器人具备感知、理解与行动能力,是推动智能体进入真实世界的关键。MiniCPM 推出的 MiniCPM-Robot 系列模型,围绕机器人操作与目标跟踪两大核心任务展开探索。其中,MiniCPM-RobotManip 是一个仅 15 亿参数的视觉语言动作模型,基于 MiniCPM-V 4.6 视觉语言骨干,并结合扩散动作头,实现从视觉观察和语言指令到机器人动作的端到端映射;MiniCPM-RobotTrack 则聚焦实体目标跟踪,以 0.9B 参数实现端侧实时视觉跟踪能力。通过轻量化架构、流式上下文记忆和高效视觉压缩技术,MiniCPM-Robot 系列展现了小规模模型在真实机器人场景中的高效推理潜力。


目前,HyperAI超神经官网已上线了「MiniCPM-Robot:面向真实世界的具身智能模型」,快来试试吧~


在线使用:https://go.hyper.ai/0VsYI


7 月 25 日- 7 月 30 日,hyper.ai 官网更新速览:


* 优质教程精选:8 个

* 社区文章解读:2 篇

* 8 月截稿顶会:6 个


访问官网:hyper.ai


公共教程精选


1. MiniCPM-Robot:面向真实世界的具身智能模型


MiniCPM-Robot 是 OpenBMB 面向真实世界感知、决策与动作的具身智能模型族,首发包含两款模型:面向机器人操作的通用 VLA 模型 MiniCPM-RobotManip,以及面向具身目标跟踪的端侧模型 MiniCPM-RobotTrack。


在线运行:https://go.hyper.ai/0VsYI


Demo 页面


2. Diamond-1.0:自回归语音修复模型


Diamond 是由 nineninesix.ai 于 2026 年 7 月开发的语音修复模型,采用自回归 seq2seq 架构,将退化音频(低码率编码、背景噪声、削波、窄带)还原为 44.1 kHz 近录音室品质语音。


在线运行:https://go.hyper.ai/OHZ6o


Demo 页面


3. Nanbeige4.2-3B:紧凑型智能体模型


Nanbeige4.2-3B 是由南北阁于 2026 年 7 月开发的紧凑型智能体模型,基于 Nanbeige4.2-3B-Base 构建。该模型采用 Looped Transformer(循环 Transformer) 架构,通过复用 Transformer 层来在不增加参数量的前提下提升模型容量——仅用 3B 非嵌入参数(总计 4B),即可在智能体基准测试中超越 Qwen3.5-9B、Gemma4-12B 等更大模型。


在线运行:https://go.hyper.ai/KI1QR


Demo 页面


4. Fara1.5-27B:多模态计算机使用智能体


Fara1.5-27B 是由 Microsoft Research AI Frontiers 于 2026 年 5 月发布的多模态计算机使用智能体。核心创新为仅视觉感知架构:通过截图观察浏览器,以结构化工具调用(点击、输入、滚动、网页搜索等)完成端到端任务,无需访问 DOM。该模型基于 Qwen3.5-27B 进行监督微调,训练数据由 FaraGen1.5 多智能体流程生成。


在线运行:https://go.hyper.ai/9AwuJ


Demo 页面


5. NVIDIA Cosmos3-Edge:全模态推理模型


Cosmos3-Edge 是由 NVIDIA 团队于 2026 年 7 月发布的 4B 参数全模态世界基础模型,核心创新与特点为采用混合 Transformer(MoT)架构,在一个统一框架内融合自回归 Transformer 和扩散 Transformer,分别处理文本生成和图像/视频/动作等多模态生成。


在线运行:https://go.hyper.ai/yB4bz


Demo 页面


6. Mage-Flow:高效原生分辨率图像生成与编辑基础模型


Mage-Flow 是由 Microsoft 于 2026 年 7 月发布的紧凑型 4B 图像生成与编辑基础模型。它通过精心设计的 tokenizer-backbone-system 协同优化,在 4B 参数规模下达到了与更大模型(Qwen-Image 20B、FLUX.2 32B)相媲美的质量,同时保持更快的推理速度和更低的内存占用。


在线运行:https://go.hyper.ai/3cw36


Demo 页面


7. LingBot-World-V2:无限世界与多样化交互的图像到视频生成


LingBot-World-V2 是由 Robbyant 团队于 2026 年 7 月发布的图像到视频生成模型。该模型通过因果预训练实现无限时长交互,并保持稳定输出质量;同时支持 720p 60fps 实时视频生成,具备攻击、射箭、施法等多样化交互能力。此外,LingBot-World-V2 首次将智能体框架引入世界模型,通过行为规划智能体和环境合成智能体,实现更智能的场景理解与交互生成。


在线运行:https://go.hyper.ai/wecWC


Demo 页面


8. MOSS-Transcribe-Diarize:端到端多说话人音频转录与说话人分离


MOSS-Transcribe-Diarize 是由 MOSI.AI (OpenMOSS) 团队于 2026 年 7 月发布的端到端多说话人音频理解模型。只需一次推理,模型即可同时完成语音转写和说话人分离,输出带有时间戳和匿名说话人标签(如 [S01]、[S02])的结构化文本。


在线运行:https://go.hyper.ai/TElI9


Demo 页面


💡我们还建立了 Stable Diffusion 教程交流群,欢迎小伙伴们扫码备注【SD教程】,入群探讨各类技术问题、分享应用效果~



热门百科词条精选


1. 人机回圈 HITL

2. 自动语音识别 ASR

3. 光学字符识别 OCR

4. 世界动作模型 WAM

5. 思维引导的强化学习框架 GTR


这里汇编了数百条 AI 相关词条,让你在这里读懂「人工智能」:

https://go.hyper.ai/wiki


8 月截稿顶会


8 月 01 日

12:00:00

VLDB 2027

8 月 01 日

23:59:59

UbiComp 2026

8 月 03 日

23:59:59

PPoPP 2027

8 月 19 日

23:59:59

NDSS 2027

8 月 25 日

23:59:59

USENIX Security 2027

8 月 31 日

23:59:59

IEEE VR 2027


* 截稿时间为 AoE 时间


一站式追踪人工智能学术顶会:https://go.hyper.ai/event


以上就是本周编辑精选的全部内容,如果你有想要收录 hyper.ai 官方网站的资源,也欢迎留言或投稿告诉我们哦!


下周再见!


关于 HyperAI超神经 (hyper.ai)


HyperAI超神经 (hyper.ai) 是国内领先的人工智能及高性能计算社区,致力于成为国内数据科学领域的基础设施,为国内开发者提供丰富、优质的公共资源,截至目前已经:


* 为 2100+ 公开数据集提供国内加速下载节点

* 收录 700+ 经典及流行在线教程

* 解读 300+ AI4Science 论文案例

* 支持 700+ 相关词条查询

* 托管国内首个完整的 Apache TVM 中文文档


访问官网开启学习之旅:

https://hyper.ai/


更多详细教程,请观看:

 往期推荐 

【声明】内容源于网络
0
0
HyperAI超神经
解构技术先进性与普适性,报道更前沿的 AIforScience 案例
内容 1368
粉丝 0
HyperAI超神经 解构技术先进性与普适性,报道更前沿的 AIforScience 案例
总阅读10.6k
粉丝0
内容1.4k