
ZDTaichu5.0-9B 是紫东太初开源的 9B 通用多模态模型,在九项空间理解基准中八项领先,同时保持图文理解、数学推理和代码能力处于第一梯队。其核心方法包括三层数据生产管线、内置自适应循环推理和内外循环协同机制。
过去两年,多模态大模型的竞争焦点大多停留在图文问答、文档解析和内容生成层面。但一个更棘手的问题始终悬而未决:当模型需要驱动机器人完成「拉开抽屉、放入刀具、再关上」这类连续物理操作时,它对空间关系的理解是否足够可靠?
参数规模与空间具身能力之间,长期存在一种隐性权衡。为了在真实场景中准确判断物体位置、参照系变换和操作前提,模型往往需要额外的计算投入和专门的数据训练;而一旦向空间任务倾斜,通用图文理解、数学推理和代码能力又容易出现滑坡。
紫东太初近期开源的 ZDTaichu5.0-9B,试图在这个矛盾点上给出一个可复用的工程答案:以 9B 量级同时覆盖通用多模态与空间具身任务,并在多项国际基准中取得领先。
要判断一个模型是否真正「看懂」了物理世界,单看图文问答分数远远不够。更直接的检验来自三类任务:
目标选择与属性绑定。 比如在杂乱台面上找到「从左至右第二个银色盒子」,模型需要同时处理颜色属性、物体类别和空间排列关系,输出精确的归一化坐标。坐标偏差直接决定后续抓取动作是否指向正确对象。
参照系转换与多视角推理。 给定同一房间的三个不同视角,要求模型设想自己移动到某一位置、面向某一物体,再判断另一物体的相对方位。这涉及跨画面的对象对应和观察者参照系的重新建立,是空间推理中难度较高的环节。
交互条件判断。 识别杯子只是起点,模型还需要确定杯柄朝向、检查周边是否被占用,从而找到可操作的空白区域。这类判断直接关系到机器人能否安全、有效地执行任务。
从公开的评测数据看,ZDTaichu5.0-9B 在覆盖空间感知、三维推理、多视角变换和具身交互的九项基准中,有八项在 10B 以下通用模型中位列第一。与同量级模型相比,部分项目的分差达到两位数,显示出较为明显的优势。
空间能力突出并不意味着通用能力必然缩水。在图文理解基准 AI2D 上,该模型取得 91.48 分;数学推理 WeMath 为 75.9 分;MathVista Mini 为 84.5 分;OCRBench 为 85.5 分。这些成绩在同类模型中处于第一梯队,说明空间能力的增强并未以通用能力的大幅退步为代价。
一个更综合的验证来自科研 Agent 场景。在阻尼振子求解任务中,模型需要组织解析推导与 Python/SciPy 数值计算,对照两种结果,并生成相空间图、位移与速度曲线以及分析报告。整个过程涉及问题理解、代码执行、结果核对和图表输出四个阶段,模型均能连续衔接完成。
ZDTaichu5.0-9B 的空间具身能力,首先建立在一条经过全流程验证的数据生产管线上。这条管线分为三个渐进阶段:
预训练阶段覆盖开源图文、网页结构化文档、公开视频多视角素材和仿真渲染三维场景。原始素材先经感知哈希与 URL 去重,再过滤低清晰度和图文不相关样本,随后进行内容重写解析和视频抽帧描述,最终形成可训练的图文与时序输入。这一步建立的是视觉、语言、时序和空间概念之间的对齐关系。
监督微调阶段将开源指令、真实业务问答、空间具身案例和 Agent 工具调用轨迹组织成多轮对话、多图和视频序列。针对具身样本,管线会检查图像、问题、对象关系和操作约束是否一致——如果图中抽屉处于关闭状态,模型就不能直接要求夹爪向内放置物体。带步骤的思维链还需经过拒绝采样、格式和一致性校验。
高质量退火与强化学习阶段引入能力域-难度-质量三维自动标签系统,为模型筛选高信息量样本。GRPO 将答案正确性、空间坐标命中情况和输出格式合规性转化为可自动校验的奖励信号。值得注意的是,评测数据不会直接进入训练集,标签仅用于能力分类和样本筛选。
这条管线的可迁移性意味着,企业未来可以将自有车间录像、实验操作记录和仿真素材转化为训练样本,而不必从零搭建数据工程。
训练数据解决的是「学什么」,推理策略解决的则是「算多少」。不同任务对计算量的需求差异巨大:有些画面目标清晰、关系简单,一次前向计算即可;有些任务需要整合多视角信息、判断遮挡和操作前提,需要更多计算来修正判断。
ZDTaichu5.0-9B 的做法是在前向传播内部引入自适应循环推理。模型先完成一次标准前向计算,得到 Token 预测分布和隐层状态;熵门控随后评估预测的不确定程度。确定性较高时直接输出;遇到高不确定性节点,则在内部重复执行部分层块计算,迭代调整隐层表征。
为防止迭代发散,团队配套了三重稳定化设计:阻尼更新控制每轮修正幅度,避免特征漂移;双重停止判据同时监测输出分布的 KL 散度和隐状态残差;轨迹读出与状态回滚保留中间轨迹并选择风险最低的表征结果。
这一思路与近期部分海外模型强调的「按需分配推理投入」方向一致,说明根据任务难度动态调节计算量,正在成为多模态模型推理侧的共识性方向。
具身任务与静态问答的根本区别在于:每一次行动都会改变环境状态,模型必须根据新的观测持续更新任务进展。
内部循环围绕当前输入改善感知与推理;外部任务循环则接收新观测和执行反馈,更新任务进展。两者协同,使每次行动成为下一轮判断的新条件。以奶酪盒放入碗内的仿真演示为例,模型在工具辅助下识别目标区域,组织接近、抓取、抬起、移动、放下和退出等动作,新的观察结果持续影响后续操作,最终确认奶酪盒留在碗内。
这种内外循环的衔接能力,决定了模型能否在长程任务中保持状态一致性。
从更宏观的视角看,ZDTaichu5.0-9B 的发布是国产多模态开源模型向空间具身方向延伸的一个缩影。
在国内阵营中,通义千问系列持续迭代视觉语言模型,在文档理解和多图推理上积累深厚;DeepSeek 以 MoE 架构和推理效率见长,在数学与代码任务上表现突出;智谱 GLM 系列在 Agent 工具调用和中英双语场景中布局较早;文心一言和豆包则在产品化落地和用户触达上走得更快。
差异在于侧重点:多数国产模型的开源重心仍在通用图文理解和 Agent 能力上,而 ZDTaichu5.0-9B 选择将空间具身作为差异化突破口,并同步开放数据管线方案。这种「权重+管线」的双开放策略,在国产开源多模态中并不常见,对希望基于自有场景继续训练的企业而言,降低了重复造轮子的成本。
在科研场景中,试管转移任务展示了模型的推理连续性。两支试管经过抓取、双臂交接和入架,位置与姿态不断变化,模型需要持续区分样品身份、判断哪支已入架、哪支仍待处理,并据此安排下一步操作。样品身份、空间位置和任务进度由此被关联起来。
在制造场景中,机台上料演示呈现了从料架抓取工件、转向搬运、再放置到工作台的完整过程。模型将工单中的目标和位置要求,转化为随现场状态持续更新的操作规划,把目标识别、搬运衔接和放置检查串成连续流程。
这些案例的共同点在于:模型不仅需要单步的空间判断,还需要在状态变化中维持任务进度的一致性。换一批工件、调整一次对象位置、增加一个操作前提,模型还能否认准对象、更新状态并组织正确的下一步,将成为衡量其真实场景适应能力的重要尺度。
ZDTaichu5.0-9B 是紫东太初开源的通用多模态大模型,参数规模为 9B,同时覆盖图文理解、数学推理、代码生成和空间具身任务规划能力。
在覆盖空间感知、三维推理、多视角变换和具身交互的九项国际基准中,该模型有八项在 10B 以下通用模型中排名第一,部分项目与同量级模型的分差达到两位数。
从公开评测看,其图文理解基准 AI2D 达到 91.48 分,数学推理 WeMath 为 75.9 分,OCRBench 为 85.5 分,通用能力仍处于同类模型第一梯队,未出现明显退步。
除模型权重外,团队还开放了经过工业级验证的数据生产管线方案,企业可基于自有数据和机器人继续训练,迭代出适配自身场景的空间多模态模型。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

智谱AI发布GLM-5.3 Flash,以320B参数实现性能跃升,采用国产芯片,具备原生多模态能力,成本仅为Claude Opus 4.8的1/40,全面开源。

蚂蚁百灵开源 Ling-3.0 系列 6 个训练检查点,覆盖预训练、中期训练与 WSM 合并阶段,为开发者提供更灵活的二次开发起点。

从通义千问下载量登顶到 Anthropic 暂缓发布新模型,从微信的 AI 化愿景到 Waymo 的无人车扩张,全球 AI 竞赛正从模型军备转向生态博弈与安全治理。本文梳理近期科技行业关键动态,解读巨头们的战略转向与行业深层逻辑。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。