紫东太初开源ZDTaichu5.0-9B:9B参数拿下8项空间理解第一,数据管线也一起送

最近,由中国科学院自动化研究所联合武汉人工智能研究院研发的紫东太初大模型团队宣布开源面向物理世界的通用多模态大模型ZDTaichu5.0-9B:参数量约9B,支持单图、多图、长序列视频及任意分辨率视觉输入,在九大国际权威空间理解基准中拿下8项通用组别第一,被认定为10B参数档位空间具身能力最强的通用多模态大模型。自2021年首次问世以来,紫东太初已完成4次迭代,这一次除了权重,团队连数据生产管线也一并开放了。
九大基准八项第一,空间理解开始量化
先看成绩单。在MindCube-tiny榜单上,ZDTaichu5.0-9B拿到78.27分,作为对照,同档位的Qwen系模型为57.6、STEP3为62.8;在ERQA、RoboSpatial等具身交互理解核心基准的放置任务里,模型输出的坐标均落在合理区域。对机器人而言,「把东西放到该放的地方」考验的正是对三维空间关系的理解——物体在哪、朝向如何、放下去会不会碰,这些在纯语言模型里几乎无从考察的能力,恰恰是空间理解基准要量化的东西。
自适应循环推理:9B跑进消费级GPU
技术路线上,这一版走了自适应循环推理:用熵门控机制实时评估当前预测的不确定性,确定性高的样本直接输出,高不确定性的样本则在内部循环执行层块计算,再配以三重稳定设计兜底。好处是算力花在刀刃上——9B的参数量让模型可以跑在消费级GPU上,端侧与近端部署门槛大幅降低。对要做机器人本体、产线质检或科研自动化的团队来说,不必先租一个训练集群才能起步。
权重之外,数据管线也开源了
真正稀缺的是开源的部分。此次团队不仅开放模型权重(项目页、HuggingFace、ModelScope与GitHub同步上线),还同步开放了经过验证的完整空间多模态数据生产管线详细方案,涵盖数据接入清洗、三维标注、合成校验等环节。大模型领域「开源权重、闭源配方」是常态,数据管线才是从0到1复现能力的关键。企业能不能把自有场景数据转化为模型能力,取决于这条管线的成熟度;把它公开,等于把具身智能研发的隐形门槛拉低了一整截。
从训练场到产线:一脑多形
落地侧,依托紫东太初打造的「一脑多形」具身智能训练平台已在北京、武汉、佛山、青岛、长春等地的具身智能训练场落地,覆盖自主调用工具求解、湿实验试管追踪、双臂协同搬运等真实任务。「通用能力不降级、空间能力可补强」的轻量模型,若能在真实产线与机器人本体上稳定复现,就可能成为具身智能从演示走向规模化应用的底座。
写在最后
对内容与GEO从业者的启示也很直接:当AI开始理解空间与视频,被引用的内容形态会进一步从文字扩展到图文对照、结构化与空间化的资料页。做模型选型与跟进开源进展,可以看我们对书生大模型的收录页;需要客观比较大模型能力,智源的FlagEval天秤评测平台提供了现成的榜单与工具。开源的门槛在降,评测的标尺在细,物理世界这一页,AI正在快速翻过。
(文 / AI30媒体部 | 2026年9月28日)



