紫东太初开源ZDTaichu5.0-9B:9B多模态模型在 9 项空间基准中 8 项登顶
量子位报道,紫东太初 9 月 16 日发布开源通用多模态模型ZDTaichu5.0-9B,称其在 10B以下模型的 9 项国际空间理解基准中 8 项第一,同时通用能力不降级;权重、数据生产管线方案及GitHub、HuggingFace、ModelScope链接一并公开。
AI解读:紫东太初 9 月 16 日开源ZDTaichu5.0-9B,一个 9B规模的通用多模态模型。量子位报道称,在 9 项国际空间理解基准里它拿了 8 项第一,对比对象是 10B档位的开闭源模型。
真正值得留意的不是榜单数字,而是它同时要做两件通常互相拉扯的事:看懂物理空间,又保住图文理解、OCR、数学和代码这类通用能力。报道的说法是空间具身断层领先,通用能力不降级。
对机器人、智能制造和自动化实验团队来说,这条新闻的实际含义是权重和一套号称经过工业级验证的数据生产管线方案一起开放。企业可以用自己的车间录像、操作记录和仿真素材继续训练,不必从零搭一套空间多模态基座。
紫东太初 9 月 16 日开源通用多模态大模型ZDTaichu5.0-9B。据量子位报道,该模型在 9 项国际权威空间理解基准测试中有 8 项排名第一,对比范围是 10B档位的开源与闭源模型。
报道称其通用能力未因空间能力训练而下降:AI2D图解理解 91.48 分,WeMath 75.9分,MathVista Mini 84.5分,OCRBench 85.5分。
团队同时公开了训练与推理的技术路径,包括三阶段数据生产管线和内置自适应循环推理机制,并开放权重。GitHub、HuggingFace、ModelScope和项目Blog链接已一并发布。
空间榜单:9 项中 8 项第一,MindCube-tiny差距最大
量子位列举的对比中,差距最大的一项是MindCube-tiny:ZDTaichu5.0-9B得 78.27 分,Gemma4 8B-E4B为 48.85 分,Gemini 3 Pro为 70.87 分,Grok 4为 63.56 分。
报道称这些基准覆盖空间感知、三维推理、多视角变换和具身交互四类任务。ZDTaichu5.0-9B在这份 10B档位开闭源模型榜单中接近断层领先。
- MindCube-tiny得分:ZDTaichu5.0-9B 78.27,Gemini 3 Pro 70.87,Grok 4 63.56,Gemma4 8B-E4B 48.85
- 榜单覆盖空间感知、三维推理、多视角变换、具身交互
- 对比范围为 10B档位开闭源模型
三个空间实测:找银色盒子、三视角换参照系、找杯柄方向空位
报道用三个任务说明空间能力的具体含义。找东西任务要求从左到右找到第二个银色盒子,画面里台面挤满杯子、收纳容器和杂物,模型给出归一化坐标(237,226),落在目标标注区域内。
三视角推理任务输入同一房间的三个视角,要求模型设想自己移动到绿框窗帘位置、面向蓝框沙发,判断红框柜子在自身哪个方位。模型输出右前方。
找空位任务要求在最右侧杯子的杯柄方向上找一块空闲区域,模型需先认出杯子、判断杯柄朝向、再检查旁边是否被其他物体占用。报道称模型给出了正确区域。
- 目标选择:归一化坐标(237,226)命中标注区域
- 参照系转换:三视角下判断柜子位于自身右前方
- 交互条件判断:识别杯柄朝向并确认旁侧未被占用
通用能力成绩单:AI2D 91.48,仅次于Gemini 3 Pro
量子位给出的通用能力对比中,ZDTaichu5.0-9B的AI2D图解理解得 91.48 分,报道称仅次于Gemini 3 Pro,高于其他所有对照模型。WeMath为 75.9 分,报道称同样领先;MathVista Mini 84.5分,OCRBench 85.5分。
报道还称该模型在Agent与文本任务上表现突出,尤其是代码成绩。科研Agent阻尼振子求解demo中,模型完成解析求解与Python/SciPy数值计算的组织和对照,输出相空间图、位移与速度曲线以及分析报告,四个阶段子任务连续衔接。
- AI2D 91.48,低于Gemini 3 Pro、高于其余对照
- WeMath 75.9、MathVista Mini 84.5、OCRBench 85.5
- Agent demo覆盖问题理解、代码执行、结果核对、图表输出
训练侧:三阶段数据管线,含SFT一致性检查与GRPO奖励信号
报道称数据工程链路分三阶段。预训练阶段覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景,先做感知哈希与URL去重,再过滤低清晰度和图文不相关样本,随后内容重写解析与视频抽帧描述,目标是建立视觉、语言、时序与空间概念之间的对齐。
监督微调阶段覆盖开源SFT指令、真实业务问答、空间具身案例和Agent工具调用轨迹,组织成多轮对话、多图和视频序列。报道特别提到对具身样本会检查图像、问题、对象关系和操作约束是否一致,例如图中抽屉关着时模型不能直接要求夹爪往里放东西;带步骤的思维链要经过拒绝采样、格式和一致性校验。
第三阶段为高质量退火加GRPO强化学习,团队建立能力域-难度-质量三维自动标签系统筛选高信息量样本。报道称评测数据不会直接作为训练样本,标签只用于能力分类与样本筛选参照;GRPO把答案是否正确、空间坐标是否命中、输出格式是否合规转成可自动校验的奖励信号。
- 预训练:感知哈希与URL去重、低质量过滤、视频抽帧描述
- SFT:具身样本检查图像/问题/对象关系/操作约束一致性
- 退火+GRPO:三维标签筛样本,坐标命中与格式合规转为奖励
推理侧:熵门控自适应循环与内外双循环
ZDTaichu5.0-9B引入内置自适应循环推理。模型先完成一次标准前向计算,得到Token预测分布和隐层状态,熵门控评估预测的不确定程度:分布越分散说明把握越小。确定性高时直接输出,遇到高不确定性节点则在内部重复执行部分层块计算,迭代调整隐层表征。报道称这段额外计算发生在前向传播内部,无需调用外部工具。
团队设置三重稳定化设计:阻尼更新控制每轮修正幅度以避免特征漂移;双重停止判据同时监测输出分布的KL散度和隐状态残差;轨迹读出与状态回滚保留迭代中间轨迹并从中选择风险最低的表征结果。
报道指出OpenAI官方文档显示GPT-6 Astra也支持调节推理投入,并称ZDTaichu5.0-9B是在开源模型中率先落地这一机制。外部循环方面,模型接收新观测和执行反馈以更新任务进展,报道以仿真中奶酪盒放入碗内为例,流程为接近、抓取、抬起、移动、放下和退出。
- 熵门控决定当前Token是否需要多轮内部计算
- 三重稳定:阻尼更新、KL散度与隐状态残差双停止判据、轨迹读出与状态回滚
- 报道称GPT-6 Astra同样支持调节推理投入,ZDTaichu5.0-9B称在开源模型中率先落地
落地演示与开放范围
报道给出两个产业场景演示。科研场景的试管转移任务中,两支试管经过抓取、双臂交接和入架,位置与姿态不断变化,模型需持续区分样品身份、判断哪支已入架、哪支仍待处理并安排下一步操作,为自动化科学实验平台提供上层任务编排与状态记录。
制造场景的机台上料演示中,机器人从料架抓取工件、转向搬运再放置到工作台,模型把工单中的目标和位置要求转化为随现场状态更新的操作规划,将目标识别、搬运衔接和放置检查串成连续流程。
开放范围上,报道称ZDTaichu5.0-9B不止开放权重,连同整套经过工业级验证的数据生产管线详细方案一并打开,企业可用自身数据和机器人继续训练、迭代个性化空间多模态模型。来源同时给出Blog、GitHub、HuggingFace和ModelScope链接。报道以量子位署名的评测与演示为依据,未提供第三方独立复现结果。
- 科研:试管抓取、双臂交接与入架,持续跟踪样品身份与任务进度
- 制造:料架抓取、转向搬运、放置检查串成连续规划
- 开放:权重加数据生产管线方案,企业可用自有数据继续训练