国产多模态新突破:紫东太初 ZDTaichu5.0-9B 实现空间具身与通用能力双领先
国产多模态大模型在物理世界理解上取得重大进展。紫东太初最新开源的通用多模态大模型 ZDTaichu5.0-9B,在九大国际权威空间理解基准测试中斩获八项第一,同时保持了卓越的通用能力,将 10B 以下参数规模模型的空间具身能力推向新高度。
让多模态模型真正“看懂”并“操作”真实物理世界极具挑战。过往模型往往难以兼顾图像理解与空间行动能力,或在提升空间能力的同时牺牲通用性能。ZDTaichu5.0-9B 成功打破了这一局限,实现了全能表现。
在实际演示中,该模型成功控制了美工刀具的收纳过程:精准识别刀柄位置、判断抽屉状态、规划夹爪路径并完成“拉开 - 放入 - 关闭”的连贯动作。这证明了其具备复杂的空间理解与高层任务规划能力。与此同时,其在图文理解、文字识别、数学推理及代码生成等通用任务上依然稳居第一梯队。
空间具身 + 多模态双领先
ZDTaichu5.0-9B 在空间感知与推理任务中表现优异,涵盖了目标定位、三视角推理及交互条件判断等关键场景。
从视频目标定位到三视角推理,空间判断稳准狠
在“找东西”任务中,模型需在杂乱环境中精准定位“从左至右第二个银色盒子”。面对众多干扰项,ZDTaichu5.0-9B 准确理解了属性、对象及空间排列关系,输出的归一化坐标(237,226)精准落入目标区域。
在更高难度的“看位置”任务中,模型需基于三个不同视角的画面,模拟自身移动至窗帘位置并面向沙发,进而判断柜子的相对方位。ZDTaichu5.0-9B 成功完成了对象对应与参照系转换,给出了完全正确的预测结果。
此外,在“找空位”任务中,模型不仅识别出杯子,还准确判断杯柄朝向及周边占用情况,在最右侧杯子杯柄方向找到了可用的空闲区域。这些基础能力共同决定了具身智能能否将指令转化为可执行动作。
在 10B 档位开闭源模型的横向评测中,ZDTaichu5.0-9B 呈现断层领先优势。在涵盖空间感知、三维推理、多视角变换及具身交互的综合榜单中,其得分高达 78.27 分,远超 Gemma4 8B-E4B、Gemini 3 Pro 及 Grok 4 等竞品,展现了全面的物理场景操作理解能力。
双线突破,通用能力不降级
在强化空间能力的同时,ZDTaichu5.0-9B 的通用性能并未妥协。在图解理解基准 AI2D 中得分 91.48,仅次于 Gemini 3 Pro;在 WeMath、MathVista Mini 及 OCRBench 等数学与文字识别测试中均表现强劲。
在 Agent 与文本任务方面,该模型同样出色。在科研 Agent 阻尼振子求解决策中,它完美衔接了问题理解、代码执行(Python/SciPy)、结果核对及图表输出四个阶段,生成了完整的分析报告,证明了其在复杂任务流中的稳定性。
9B 多模态大模型的空间具身能力,是怎样练成的?
ZDTaichu5.0-9B 的成功源于训练与推理两端的创新架构。
全栈数据生产管线:把通用能力、Agent 能力以及空间具身能力全部练进模型
团队构建了一套经过全流程验证、可复用且可迁移的数据工程链路,包含三个渐进式阶段:
第一步:预训练数据管线。覆盖开源图文、结构化文档、多视角视频及仿真三维场景。通过感知哈希与 URL 去重、低质样本过滤、内容重写及视频抽帧描述,建立了视觉、语言、时序和空间概念的对齐联系。
第二步:监督微调数据管线。整合开源指令、业务问答、具身案例及 Agent 轨迹,组织成多轮对话与序列数据。针对具身样本,严格校验图像、问题、对象关系与操作约束的一致性,并引入带步骤的思维链数据进行拒绝采样与格式校验,确保训练样本具备视觉依据与逻辑解释性。
第三步:高质量退火+GRPO 强化学习数据管线。建立“能力域 - 难度 - 质量”三维自动标签系统筛选高信息量样本。利用 GRPO 将答案正确性、坐标命中率及格式合规性转化为奖励信号,驱动模型持续优化。
内置自适应循环推理:把算力用在真正难的判断上
针对不同难度的推理任务,ZDTaichu5.0-9B 引入了内置自适应循环推理机制。模型通过熵门控评估预测不确定性:当确定性较高时直接输出;遇到高不确定性节点,则在内部重复执行部分层块计算,增加计算深度以修正判断,无需调用外部工具。
为防止计算发散,模型配套了三重稳定化工程设计:阻尼更新控制修正幅度;双重停止判据监测分布 KL 散度与隐状态残差;轨迹读出与状态回滚机制选择风险最低的表征结果。这一按需分配算力的思路与国际前沿技术趋势高度一致。
内外循环协同:把单步空间判断接成连续任务
具身智能要求模型不仅能判断当前状态,还需感知行动后的环境变化。ZDTaichu5.0-9B 通过“内部循环”改善感知推理,结合“外部任务循环”接收新观测与执行反馈,实现了长程任务的连续规划。在奶酪盒放入碗内的演示中,模型成功组织了从识别、抓取到放置的全流程,并根据新观察结果动态调整操作,确保了任务最终完成。
从实验台到搬运现场,无需重新造轮子
ZDTaichu5.0-9B 有效解决了对象识别不准、方位转换困难及进度跟踪失效三大难题,实现了从“光说不做”到“知行合一”的跨越。更重要的是,该项目 fully 开源,不仅开放模型权重,还公开了整套工业级验证的数据生产管线方案。
企业可利用自有数据与机器人设备,基于该方案迭代出个性化的空间多模态模型,大幅降低研发成本。目前,该模型已在科研自动化(如试管转移与双臂交接)及智能制造(如机台上料与工件搬运)场景中完成早期验证,展现出强大的适配性与泛化能力。
紫东太初 ZDTaichu5.0-9B 的发布,标志着通用多模态能力向物理具身智能迈出了关键一步。它为行业提供了一个能够看懂物理世界并在真实任务中持续维持状态的基座模型,有望推动更多应用跨越数字与物理的门槛。
项目资源链接:
Blog: https://taichu-ai.github.io/ZDTaichu5.0-9B
GitHub: https://github.com/Taichu-AI/ZDTaichu5.0-9B
HuggingFace: https://huggingface.co/TaichuAI/ZDTaichu5.0-9B
ModelScope: https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

