新智元报道
10B 参数以内,空间具身能力同档第一的通用多模态大模型正式问世。
昨日,紫东太初宣布开源 ZDTaichu5.0-9B,这是新一代面向物理世界的通用多模态大模型。
该模型一经发布便横扫九大国际权威空间基准,在 8 项同参数通用组别中斩获全球第一。其核心优势在于复杂的空间推演能力:在 MindCube-tiny 测试中得分 78.27,领先 Qwen3.5-9B 达 20.67 个百分点,较 STEP3-VL-10B 高出 15.46 个百分点。
在强化空间能力的同时,ZDTaichu5.0-9B 并未牺牲图文理解、OCR、数学及代码等通用能力。面对真实任务,该模型不仅能“读懂”工单指令,更能“看清”物理环境,精准判断移动路径、放置位置及后续操作步骤,有效解决了 AI 进入物理世界时容易出现的逻辑断层问题。
奥特曼要造「大脑」,难在哪里?
OpenAI CEO 山姆·阿尔特曼(Sam Altman)曾在播客中明确表示将研发人形机器人,并指出比机身形态更关键的是赋予机器人真正干活的“大脑”。这一观点直指具身智能的核心难点。
机械臂可以重复执行预设动作,但一旦工位变更、零件移位或任务中断,传统程序便难以应对。真正的挑战在于空间理解:AI 不仅要识别物体是什么,更要判断其方位、姿态及可操作性。此外,长程任务要求模型具备连续的状态记忆与更新能力,任何一步判断失误都可能导致后续操作全盘皆输。
ZDTaichu5.0-9B 旨在解决上述难题,以下通过三道递进式测试题验证其能力。
三题连过,同级全翻车
以下三道题难度逐级递增,对应机器人从“感知”到“决策”再到“交互”的关键环节。
第一题:参照系变换下的方位判断
题目:要求模型移动到指定位置并改变朝向后,判断目标物体的相对方位。
难点在于模型需完成两次参照系转换:先改变自身坐标,再调整视线方向。这要求模型同时维护世界坐标系、本体坐标系和相机坐标系,并在视角切换时保持空间拓扑关系的稳定性。
多数模型因缺乏显式的空间拓扑建模,在视角变化后出现关系断裂。ZDTaichu5.0-9B 准确输出“右前方”,而 Qwen3.5-9B 和 STEP3-VL-10B 均给出错误答案。这证明了该模型在动态环境中维持空间一致性的卓越能力。
第二题:属性绑定与空间排序
题目:找出“从左到右第二个银色盒子”。
这是一道复合题,要求模型同时完成属性识别(银色)、空间排序(从左到右)及序数定位(第二个)。技术上需将视觉属性、序数关系和空间方向精准绑定至同一目标实例。
ZDTaichu5.0-9B 输出的归一化坐标 [237,226] 精准命中真值,而同级其他模型均指向错误目标。在工业场景中,这意味着机器人能在密集货架中准确选取指定料盒,避免抓取错误导致的作业失败。
第三题:可供性推理与空间约束校验
题目:找出杯柄一侧的空闲区域,并给出可放置点位。
此题超越了单纯的物体识别,要求进行可供性推理(Affordance Reasoning):解析物体姿态(杯柄朝向),校验邻近区域是否被占用,并输出合法的操作坐标。
ZDTaichu5.0-9B 给出的坐标 [650,720] 完全落在合理空闲区,而其他模型给出的坐标均会导致物体重叠。这表明该模型已具备从语义识别跨越到空间决策的关键能力,能够支持真实的物理交互。
空间能力上去了,通用能力一分没掉
针对“专攻空间是否会导致通用能力退化”的疑虑,测试数据显示 ZDTaichu5.0-9B 实现了双优。
在基础能力方面,该模型在 AI2D(91.48 分)、WeMath(75.9 分)、MathVista Mini(84.5 分)及 OCRBench(85.5 分)等基准测试中表现优异,确保了读图、计算和文字识别的基本功。
在空间与智能体能力上,其在 ViewSpatial、MindCube-tiny、VSI-Bench 等测试中领先 Gemini 3 Pro 超 7%;同时在 IFEval、AIME2026 及 LiveCodeBench v6 等代码与推理测试中保持高水准,真正做到了“通用能力不衰减,空间具身能力越级突破”。
![]() |
![]() |
![]() |
开发者可使用单一模型同时处理任务理解与现场感知,大幅降低了多模型协作的复杂度。
难题多想几轮:大脑内部也能「三思而后行」
ZDTaichu5.0-9B 引入了“自适应循环推理”机制,使模型在推理过程中具备“三思而后行”的能力。
该机制通过“熵门控”实时监测每个 Token 生成的不确定性。当模型对某步判断信心不足时,会自动触发内部循环,在当前 Token 位置进行多轮修正计算,直至表征稳定后再输出;若确定性高则直接跳过,从而在提升精度的同时控制算力成本。
这一架构设计与传闻中的 GPT-6 Astra“循环 Transformer"机制不谋而合,展现了极高的技术前瞻性。为防止过度思考导致偏差,团队还加入了三重稳定机制:
- 阻尼更新:限制每轮修正幅度,防止特征漂移丢失原始视觉证据。
- 双重停止判据:同时监测输出分布与隐状态残差,精准判断迭代收敛点。
- 轨迹读出与状态回滚:保留中间状态,必要时回退至风险较低的表征。
这种内部循环专注于单步推理的优化,配合外部任务循环的反馈确认,共同支撑长程连续操作。
数据怎么教,决定「大脑」学会了什么
ZDTaichu5.0-9B 采用“渐进式数据课程”训练策略,确保模型从基础认知到高阶任务的平稳过渡。
预训练阶段:整合开源图文、结构化网页、多视角视频及三维仿真数据,并通过感知哈希与 URL 去重、隐私过滤等严格清洗流程,夯实视觉与时空概念基础。
监督微调阶段:引入大规模真实任务轨迹、空间具身案例及 Agent 工具调用记录。重点校验图像、对象关系与操作约束的一致性,剔除逻辑矛盾样本(如抽屉关闭却执行放入操作)。
强化学习阶段:利用 GRPO 算法引入自动化奖励信号,将答案正确性、坐标命中率及格式合规性纳入反馈闭环。例如,若模型选择的放置点落在障碍物上,即便解释完美也会被判负。这套完整的数据生产与训练方案随权重一同开源,供开发者复用。
真正的考场,表现同样不俗
在真实物理环境的长程任务验证中,ZDTaichu5.0-9B 作为高层规划“大脑”,成功协调底层控制系统完成复杂作业。
科研场景:打通仿真与湿实验
面对科学问题,模型能自主调用 Python 和 SciPy 进行解析解与数值解的双重验算,并生成相空间图及时序曲线报告。在实验台操作中,它能持续追踪试管身份与位置变化,即便中途发生遮挡或位移,也能准确记忆任务进度,有序完成样品摆放与液体转移,有效避免了认错样品或搞乱顺序的常见错误。
制造场景:应对工业现场复杂性
在备料配送、机台上下料及工位整理等场景中,模型展现了极强的抗干扰能力。面对密集货架、相似零件及严格的前置条件(如必须先开盖再放置),它能精准识别红色料架与白色篮筐,规划双臂协同路径,并在操作后自行校验结果。
从三道空间测试题到真机实战,ZDTaichu5.0-9B 证明了其“读懂要求 - 判断现场 - 持续反馈”的闭环能力,已在真实产线中跑通全流程。
这颗 9B 的大脑,还能接着往下练
ZDTaichu5.0-9B 的成功开源,标志着具身智能“大脑”的研发迈出了关键一步。它将空间感知、逻辑推理与通用能力集成于 9B 参数规模内,并为开发者提供了完整的权重、数据及训练方案。
未来,紫东太初团队计划进一步打造面向物理世界的具身基础模型,构建“感知—认知—预测—行动—反馈”的自主闭环,推动 AI 从理解数字世界向理解、预测并改变物理世界演进。
开源地址:
Blog: https://taichu-ai.github.io/ZDTaichu5.0-9B
Huggingface: https://huggingface.co/TaichuAI/ZDTaichu5.0-9B
Modelscope: https://www.modelscope.cn/models/TaichuAI/ZDTaichu5.0-9B
Github: GitHub - Taichu-AI/ZDTaichu5.0-9B
编辑:桃子 大卫




