大数跨境

9 项基准,8 项第一:ZDTaichu5.0-9B 如何做到空间具身能力 9B 级第一梯队?

9 项基准,8 项第一:ZDTaichu5.0-9B 如何做到空间具身能力 9B 级第一梯队? 武汉人工智能研究院
2026-09-22
11
导读:立足武汉,辐射中部,服务全国!

近日,紫东太初正式开源ZDTaichu5.0-9B。

交出一份亮眼的成绩单:在九大国际空间理解Benchmark评测中,ZDTaichu5.0-9B一举拿下8项通用组别第一。

但在我们看来,比榜单数字更值得拆解的核心问题是:一个9B级轻量模型,为什么能在高门槛的空间具身赛道实现突围,跻身同级第一梯队?

行业普遍将空间具身能力视作模型的“加分项”,而在紫东太初的技术逻辑里,空间具身从来不是单点技能,而是一套完整的能力体系——从空间感知、空间推理、跨视角理解,到最终的具身任务规划,环环相扣、全程贯通

ZDTaichu5.0-9B的领先,并非针对单一榜单的微调刷分,而是围绕真实物理世界场景,对整套空间能力链路的系统性、原生性构建。


九大国际空间理解基准,考察的是完全差异化的空间能力维度:

有的侧重物体识别与位置定位,有的聚焦物体空间关系判断;

有的考验跨视角场景对齐,还有的侧重复杂场景下的深度空间推理。

多项任务同步登顶,恰恰印证了ZDTaichu5.0-9B的核心优势:绝非单一能力侥幸出彩,而是全维度空间能力形成系统性优势,真正适配物理世界的复杂、动态、多变的真实场景。

其中,MindCube-tiny 与 ViewSpatial 两大核心基准,最能体现我们的技术突破。

MindCube-tiny:不止于“看见”,真正建立三维空间认知

在高难度复杂三维空间推理任务 MindCube-tiny 中,ZDTaichu5.0-9B取得78.27分,较Qwen3.5-9B高出20.67个百分点,实现同级模型断层领先。

这一分数的核心价值,早已超越基础视觉识别。

普通视觉模型只能解答「图里有什么」,完成表层图像识别;而空间推理,需要模型深度解析视觉信息,自主判断物体精准位置、多维空间关联与整体场景结构,完成复杂逻辑推理。

简单来说:看见是感知,定位关系、理解结构,才是真正的空间认知

这也是机器人、智能体落地真实场景的核心刚需。ZDTaichu5.0-9B的突破,意味着模型不再是简单的“视觉转文本工具”,而是具备了对三维物理世界的结构化理解能力,为后续智能决策、自主规划筑牢底层基础。

ViewSpatial:动态视角下,守住稳定的空间认知

如果说静态三维推理是基础,那跨视角动态理解,就是空间智能的高阶难题,也是实体AI落地的核心瓶颈。

ZDTaichu5.0-9B在 ViewSpatial 基准中斩获高分,攻克了“视角变动即认知失效”的行业痛点。

对人类而言,无论身处房间哪个位置、从何种角度观察,都能笃定眼前是同一个空间;但对AI来说,不同视角对应的是完全不同的视觉输入,极易出现认知割裂。

我们的技术突破在于:让模型跳出单帧图像局限,建立全局、稳定、可迁移的空间坐标系,将不同视角的碎片化信息,统一整合为一套完整的空间认知体系

这一点对具身智能至关重要:机器人移动、机械臂运作、场景动态变化时,物体与设备、物体与环境的空间关系持续更迭。只有守住稳定的空间认知,AI才能完成精准、可靠的任务规划与自主执行。

从 MindCube-tiny 到 ViewSpatial,我们完成了空间具身智能的两次关键跃迁:从读懂静态空间,到吃透动态变化的真实空间


纵观九大评测基准,所有考核最终都指向同一个核心:模型是否具备稳定、通用、可落地的空间认知能力

这也是ZDTaichu5.0-9B与传统视觉语言模型的本质区别。

我们从未将空间具身能力当作“附加功能”或“刷榜专项能力”,而是将其定义为通用多模态模型通往物理世界的核心延伸能力

从空间感知、深度空间推理,到跨视角统一建模、具身任务规划,我们搭建了一条完整、连续、可落地的空间具身能力链路

亮眼的榜单成绩,源自紫东太初长期的原生多模态技术积累,以及针对物理空间场景专项打磨的数据体系、训练体系与技术架构。模型能力是表象,模型、数据、训练方案的深度协同,才是我们持续领跑的核心底气。


行业多数模型面临普遍困境:强化专项能力,必然牺牲通用能力。但对落地而言,二者缺一不可。

ZDTaichu5.0-9B交出了不一样的答案:空间具身能力全面突破的同时,通用能力全程稳居第一梯队。

在图文理解、OCR识别、视觉数学、代码Agent等核心通用任务中,模型性能稳定在线,没有出现能力偏科、性能降级的问题。

我们没有打造一款只为榜单而生的专用空间模型,而是探索出更适配产业落地的全新范式:通用多模态能力 × 空间具身能力 双向兼顾、双向强化

这也是9B轻量参数规模的核心价值:无需堆砌超大参数,就能让模型同时拥有通用认知与物理空间理解能力。


大模型行业长期陷入“参数越大越强”的惯性思维,但走进机器人、智能制造、科研自动化等真实产业场景,落地逻辑全然不同。

产业落地,最终比拼的是算力成本、部署效率、响应速度、场景适配性,而非单纯的参数规模。过重的模型,难以端侧部署、无法高效迭代,很难适配规模化商业应用。

我们深耕9B参数赛道,并非追求“更小的参数”,而是解答一个行业关键问题:轻量模型,能否兼顾顶级通用能力与高阶空间具身能力,真正适配物理世界落地

ZDTaichu5.0-9B的8项第一,就是我们给出的阶段性最优答案。


9项基准、8项通用组别第一,是ZDTaichu5.0-9B交出的亮眼成绩单,但绝非我们的技术终点。

紫东太初始终坚持的方向很清晰:让AI从“看见图像”,升级为“理解空间、预判变化、自主行动”

我们不只为模型贴上“空间具身智能”的标签,而是持续推动空间认知能力与具身推理规划能力,成为通用多模态模型融入物理世界的原生核心能力。

榜单定义当下的能力,而真实的产业场景,定义AI的未来。面向具身智能与产业落地,ZDTaichu5.0-9B,步履不停。


🌟 ZDTaichu5.0‑9B 已正式上线!
期待广大开发者、科研伙伴、产业伙伴基于 ZDTaichu5.0‑9B 开展创新探索、产业落地实践,共同丰富国产大模型生态,推动 AI 技术赋能千行百业!
🌟 开源地址:
Blog:https://taichu-ai.github.io/ZDTaichu5.0-9B
Huggingface:https://huggingface.co/TaichuAI/ZDTaichu5.0-9B
Modelscope:https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B
Github:https://github.com/Taichu-AI/ZDTaichu5.0-9B

【声明】内容源于网络
0
0
武汉人工智能研究院
聚焦人工智能前沿,打造产业发展高地。
内容 266
粉丝 0
武汉人工智能研究院 聚焦人工智能前沿,打造产业发展高地。
总阅读2.0k
粉丝0
内容266