大数跨境

紫东太初开源 ZDTaichu5.0‑9B:10B 参数内空间具身能力最强的通用多模态大模型

紫东太初开源 ZDTaichu5.0‑9B:10B 参数内空间具身能力最强的通用多模态大模型 武汉人工智能研究院
2026-09-15
9
导读:9月15日,紫东太初正式开源新一代面向物理世界的通用多模态大模型 ZDTaichu5.0‑9B。ZDTaic

9月15日,紫东太初正式开源新一代面向物理世界的通用多模态大模型 ZDTaichu5.0‑9B


ZDTaichu5.0‑9B 参数量约 9B,支持单图、多图、长序列视频与任意分辨率视觉输入,聚焦解决真实物理场景下空间感知、跨视角变换、具身任务规划等难题。

依据九大国际权威空间理解基准横向评测结果: ZDTaichu5.0‑9B为 10B 参数内空间具身能力最强的通用多模态大模型,9 项基准斩获 8 项组别第一。创新采用自适应循环推理架构,对标行业前沿闭源模型 GPT‑6 Astra,ZDTaichu5.0‑9B 展现出高度对齐的技术前瞻性。

其中,代表复杂三维推演能力的 MindCube‑tiny 取得 78.27 分,断层领先同级:较 Qwen3.5‑9B 高出 20.67 个百分点,较 STEP3‑VL‑10B 高出 15.46 个百分点;跨视角评测 ViewSpatial 达到 62.5 分,大幅甩开同级开源竞品。

增强空间具身能力不是一件很难的事,最大的挑战在于空间能力大幅提升的同时能否不以牺牲多模态通用能力为前提。ZDTaichu5.0‑9B模型真正做到了这一点,图文理解、OCR、视觉数学、代码 Agent 保持第一梯队,实现通用能力不衰减,空间具身能力越级突破

这一能力跃升,源自紫东太初在多模态数据全栈工程、自适应循环推理等底层技术创新,也是国内大模型从数字理解迈向物理具身智能的关键落地成果。

不同于市面侧重图文问答的多模态大模型ZDTaichu5.0‑9B 全栈面向物理世界优化,补齐空间感知、参照系转换、具身条件判别、长时序状态维护能力,完整开放整套可复用数据生产管线,并完成科研干湿实验闭环、智能制造高层规划场景验证,为具身大脑、科研自动化、智能制造产业提供可落地、可二次开发的开源基座。


本次横向对比选取 Qwen3.5‑9B、STEP3‑VL‑10B、gemma4‑8B‑E4B,同时对比 Gemini、Grok 等闭源大模型,覆盖空间感知、三维推理、多视角变换、具身交互九大权威 Benchmark。

ZDTaichu5.0‑9B 在 9 项空间榜单中 8 项取得同参数组别第一名。 

能力覆盖四层递进链条:

空间感知→复杂三维空间推理→具身条件推理→物理交互决策,实现从 “看懂二维世界” 到 “理解三维物理世界并规划决策” 的跨越。

空间感知:物体、方位、排布秩序精准识别,视频目标定位实现同级唯一命中。 3DSRBench 得分60.96,较 Qwen3.5‑9B 高出4.18 个百分点;SparBench 得分51.82,高于 Qwen3.5‑9B(50.79)、STEP3‑VL‑10B(45.68)。

实测案例:

视频任务 —— 寻找 “从左到右第二个银色盒子”。

ZDTaichu5.0‑9B 输出归一化坐标 [237,226],精准命中数据集真值;Qwen3.5‑9B 输出 [360,280]、STEP3‑VL‑10B 输出 [327,220] 全部定位错误。该任务需要同时理解物体属性、空间排序、视频时序信息,是机器人抓取的底层核心能力,同级开源模型仅 ZDTaichu5.0‑9B 完成正确目标选择。

杂空间推理:跨视点参照系转换,解决机器人移动之后 “认不出、判不准方位” 行业痛点,ZDTaichu5.0-9B在 ViewSpatial得分62.5,大幅领先 Qwen3.5‑9B(48.20)、STEP3‑VL‑10B(46.14); MMSI‑Bench 47.2,高于 Qwen3.5‑9B(38.7)、STEP3‑VL‑10B(32.18); MindCube‑tiny 78.27,对比 Qwen3.5‑9B 提升20.67 点,对比 STEP3‑VL‑10B 提升15.46 点。

实测案例:

三视角推理——指令要求移动至绿框窗帘位置、面向蓝框沙发,判断红框柜子相对自身方位。

ZDTaichu5.0‑9B 输出正确答案 “右前方”;Qwen3.5‑9B、STEP3‑VL‑10B 全部发生参照系错乱,输出错误结果 “右、上、后方”。 

行业价值:机器人移动、摄像头机位变化之后,绝大多数多模态模型会丢失空间拓扑;ZDTaichu5.0‑9B 可以维持物体相对关系,解决移动机器人空间推理的一大顽疾。

身推理与交互理解不止看懂画面里的物体,更能完成空间层面的逻辑推理,自主判断物品可放置区域、识别操作的必要前提。ZDTaichu5.0-9B 在 ERQA、RoboSpatial 两大机器人具身交互基准上分别取得 48、56 的分数,两项指标均位居开源同参模型首位。

实测案例:

需要选择杯柄侧的空闲可放置区域

ZDTaichu5.0‑9B 输出坐标 [650,720],完全落在合理空闲区域;Qwen3.5‑9B、STEP3‑VL‑10B 输出坐标全部落入物体占用区域。模型需要依次完成目标识别、姿态解析、邻近空间约束校验,直接输出可用于机器人交互的空间点位。

同时ZDTaichu5.0‑9B 没有牺牲通用多模态底座能力:AI2D 91.48、WeMath 75.9、MathVista Mini 84.5、OCRBench 85.5,图文理解、视觉数学、文档文字识别保持第一梯队;

文本智能体能力 IFEval 93.7、AIME2026 89.2、LiveCodeBench v6 73.4,指令遵循、数学、代码工具调用完备。 

市面上很多模型 “通用图文强、空间能力弱”;ZDTaichu5.0‑9B 做到通用能力第一梯队,空间具身能力断层领先同档位开源模型。


空间具身能力不是依靠少量仿真样本刷榜单实现。ZDTaichu5.0‑9B 沉淀一套经过全流程验证、可复用、可迁移到行业自有数据集的完整数据工程链路,覆盖预训练、监督微调、高质量退火、GRPO 可验证强化学习全部环节,开放数据接入、哈希‑URL 双重去重、画质过滤、Recaption 重描述、样本打包、三维能力标签体系、定向筛选、思维链合成、一致性校验全部工艺。外部科研机构、企业开发者,可以直接复用这套流水线,把自有仿真数据、工业现场数据、实验场景数据转化为模型训练样本。

训练整体采用渐进式数据课程体系,能力阶梯式生长:

练阶段 

数据源覆盖开源图文、网页结构化文档、公开视频多视角素材、仿真渲染三维空间场景。处理链路:原始收集→清洗去重(感知哈希 + URL 双去重)→清晰度、图文相关性、隐私安全过滤→内容重写解析、视频抽帧描述。完成视觉、语言、时序、三维空间概念基础对齐。

督微调 SFT 阶段

样本池不再是普通问答,而是大规模任务轨迹:开源 SFT 指令、真实业务问答、空间具身案例、Agent 完整工具调用轨迹。

执行指令质量打分、答案正确性校验、难度分层配比;针对具身样本强制校验图像‑问题‑对象关系‑操作约束一致性;采用多轮对话、多图拼接、视频序列打包拼接构建样本;批量合成带步骤的思维链,经过拒绝采样、格式校验、一致性校验过滤脏样本。

产出训练数据,教会模型如何结合视觉证据完成任务拆解、工具调用、多轮具身交互。

质量退火 + GRPO 可验证奖励强化学习

创新建立能力域‑难度‑质量三维自动标签系统,标签和评测基准能力域一一对齐,通过实践反馈定位能力短板,定向筛选高难度高信息样本,过滤低质噪声样本;

高质量退火环节使用长推理样本;强化学习采用 GRPO 框架,设置多组可自动校验奖励信号:答案正确性奖励、空间框选坐标命中奖励、输出格式合规奖励,把空间点位输出、结构化规划任务变成可反馈的训练目标。容纳超长视频、多模态证据、长链条具身推理全部信息。

绝大多数开源模型只释放权重,不释放数据处理工艺。ZDTaichu5.0‑9B 开放整套管线,解决行业一大痛点 —— 企业拿到权重,却不知道如何用自己的工业、机器人数据继续迭代空间多模态模型


为攻克参照系变换、复杂物体关系推演带来的预测不确定性,同时为复杂空间长程具身任务中每一步高难度判断提供算力支撑,ZDTaichu5.0‑9B 实现原生内置自适应循环推理机制,区别于行业主流外部思维链、外部工具调用方案,该机制运行于模型前向传播内部。

该架构技术路线,与“业界猜测” OpenAI GPT‑6 Astra 所采用的 Loop Transformer(循环 Transformer)具备高度一致的技术前瞻性,均选择将复杂推理过程收敛至模型潜空间内部完成迭代优化,而非依赖显式输出思维链 Token;

通过动态调度内部计算深度,实现 “简单任务少计算、高难度空间与具身任务多轮迭代精调”,以不扩张参数量的方式提升模型有效推理深度。二者在具体技术实现细节上存在差异,但共同指向潜空间自适应推理这一下一代大模型的关键演进方向。

工作逻辑:

①标准前向得到 Token 输出分布与隐层状态;

②熵门控计算预测不确定性; 

③确定性 Token 直接输出,不额外消耗算力;

④遇到空间变换、物体关系判别、操作条件校验等高不确定性节点,模型在内部循环执行层块计算,迭代优化隐层表征,不需要调用外部工具。

配套三重稳定化工程设计保障循环不发散:

①阻尼更新:约束每一轮特征修正幅度,锚定原始表征,避免特征漂移;

②双重停止判据:同时监测 KL 散度 + 隐状态残差,不是简单限制循环次数;

③轨迹读出与状态回滚:保存多轮迭代中间状态,从中选择风险最低的表征结果。

自适应循环推理解决长程任务链条中单步内部感知推理质量提升;完整复杂长程具身任务依然依靠外部任务循环,接收环境新观测更新全局任务状态。

内部循环与外部任务循环两层架构协同,共同支撑复杂物理任务。

传统模型算力平均分配,简单、困难任务消耗同等计算;自适应循环做到算力向难的空间推理问题倾斜,在不显著拉高平均推理成本前提下,大幅提升复杂空间、长流程任务场景的推理正确率。


真实物理世界下的长程具身任务,包含大量相互依赖的链式操作:识别目标、处理遮挡、移动到合适观测位置、打开容器、调用工具、搬运物体,最后校验目标是否完成。高层具身规划,要求模型持续维护全局完整任务状态,而不是为每一张输入图像独立生成单次动作。

在本次评测体系中,ERQA、RoboSpatial 可以提供场景推理与交互理解层面指标佐证;但一套长流程任务能否真正闭环完成,还取决于上层系统的状态更新、技能执行以及环境反馈的有效利用。

实测案例:

让机器人将美工刀收纳到上层抽屉内

长程任务的关键在于这些判断跨步骤保持一致。刀具从收纳架取出后,目标身份仍需延续;抽屉未打开时,放置条件尚未具备;刀具位于开口上方时,还不能视为已进入盒内。每次新观测都应更新当前状态、已完成步骤和下一步操作,而不是重复执行最初生成的动作列表。

这一过程将空间理解转化为技能选择的依据:

①目标被挡住时,需要判断是否先移动遮挡物;

②容器未打开时,需要先满足开合前提;

③机器人尚未处于可交互站位时,直接执行放置可能失败。

模型通过当前图像、目标描述和执行反馈组织下一步语义技能,底层导航、抓取或开合由外部控制器完成。

除此之外,模型可以根据前图像、目标描述和执行反馈直接输出控制指令来控制工具完成任务。

实测案例:

厨房复杂环境,让机器人将奶酪盒放入黑碗中

当下热门的通过 Astra 控制端侧设备领域,我们的模型也同样具备硬核竞争力。ZDTaichu5.0‑9B无需人工分步引导,可直接融合实时图像画面、用户目标描述与设备执行反馈,自主研判场景、规划操作步骤,一键输出精准有效的设备控制指令。整套操作全程自主闭环,能够高效驱动端侧工具、智能设备完成既定任务,完美适配复杂的实操场景。


当前开源多模态赛道,大量模型聚焦互联网图文内容;而物理世界具身智能,面临实例身份持久跟踪、三维参照系转换、长时序任务状态维护巨大挑战。很多模型通用跑分好看,但一旦面对真实机器人、工业、实验场景就快速失效。

ZDTaichu5.0‑9B 不只是跑分模型,已经完成两类高价值实体应用场景端到端场景验证,模型定位高层规划大脑,负责理解语义、识别环境、维护对象身份、拆解操作步骤;底层运动控制、设备安全逻辑保留由机器人 / 自动化硬件控制系统负责。

1. 科研 Agent:打通仿真数值计算与湿实验实体操作闭环

仿真计算链路:接收自然语言科学问题,自主调用 Python/SciPy 工具,同时求解解析解与数值解,交叉比对校验结果,自动输出相空间图、位移‑速度时序曲线等可视化产物,完成从提问到分析图表报告全流程。以阻尼振子任务为典型案例,完整复现科学分析工作流。

湿实体实验两大实测案例:

实测案例:

试管按序入架任务——任务约束:先放初始画面右侧试管,再放左侧试管

抓取、交接会改变物体在画面中坐标,模型持续维护两支试管的实例身份记忆;当观测画面状态为 “一支试管在架内、一支试管在桌面”,模型识别任务尚未完成,输出下一步动作:抓取桌上试管送入试管架。解决多样品操作下物体身份丢失、顺序错乱的问题。

实测案例:

滴管液体转移任务——将左侧容器中的部分液体转移至右侧容器中

模型绑定滴管、源烧杯、目标烧杯三者的空间关系;观测滴管悬停于目标容器上方,识别当前操作阶段,给出继续滴加液体的行动建议。

ZDTaichu5.0‑9B可以把样品身份、空间位置、任务进度三者绑定跟踪,为自动化科学实验平台提供上层任务编排与状态记录能力。

2. 智能制造:实现工单文本到车间物理现场的高层理解与任务规划

面向制造业备料配送、机台上料等典型业务,直面工业现实痛点:密集货架、零件外观高度相似、物体遮挡、目标离开视野、操作存在严格前置条件。

实测案例:

跨工位配送:输入工单:“将红架上的篮筐放到传送带上”

案例呈现机器人从红色料架抓取白色篮筐、协同搬运并放置到绿色传送带上的完整过程。视频结合目标与目的地标记、双臂运动目标点及夹爪开合同步标注,直观呈现空间关系判断、抓取位置选择、双臂配合与放置检查等关键环节,展示高层任务与具体操作之间的衔接。

实测案例:

呈现机器人从料架抓取工件、转向搬运并放置到工作台的完整过程

视频结合目标与目的地标记、动作说明及夹爪开合同步标注,直观呈现空间关系判断、夹持位置选择、长工件避障与放置检查等关键环节,展示高层任务与具体操作之间的联系。


第一,10B参数内空间具身能力最强的通用多模态大模型,在保证通用多模态能力不下滑的前提下,实现空间推理断层级提升

第二,完整开放整套经过工业级验证的数据生产管线,给产业界提供从自有数据迭代空间多模态的完整工艺,而不仅仅开放权重;

第三,完成从基准跑分走向实体任务验证,覆盖科研自动化、干湿实验闭环、智能制造两大赛道,给具身智能提供可以直接二次开发的开源基座。

紫东太初团队后续将持续深化空间具身多模态技术,推进仿真‑现实迁移能力优化,进一步缩小大模型仿真评测与实体物理世界的鸿沟,助力国内机器人、自动化科研、智能制造产业发展。


🌟ZDTaichu5.0‑9B 已正式上线!

期待广大开发者、科研伙伴、产业伙伴基于 ZDTaichu5.0‑9B 开展创新探索、产业落地实践,共同丰富国产大模型生态,推动 AI 技术赋能千行百业!

开源地址:

Blog:https://taichu-ai.github.io/ZDTaichu5.0-9B

Huggingface:https://huggingface.co/TaichuAI/ZDTaichu5.0-9B

Modelscope:https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B

Githubhttps://github.com/Taichu-AI/ZDTaichu5.0-9B

【声明】内容源于网络
0
0
武汉人工智能研究院
聚焦人工智能前沿,打造产业发展高地。
内容 265
粉丝 0
武汉人工智能研究院 聚焦人工智能前沿,打造产业发展高地。
总阅读1.9k
粉丝0
内容265