
美梦空间与索辰科技联合发布Physical-WAM物理世界动作模型和RoboTwin-Phys物理漂移评测基准。Physical-WAM通过在感知与动作之间插入物理Token表征,让机器人具备摩擦、重心、接触状态等物理量的显式推断能力;RoboTwin-Phys则将物理扰动转化为可控变量,填补了具身智能评测中"物理适应度"的空白。
具身智能正在经历一次认知升级。过去几年,VLA(视觉-语言-动作)模型被视为机器人走向通用的核心路径,但一系列基准测试正在揭示这条路径的天花板。北京大学与BeingBeyond联合提出的BeTTER基准(发表于ECCV 2026)显示,当前最先进的VLA模型在标准静态测试中尚能维持可观的成功率,然而一旦引入空间布局偏移或时序外推等干预条件,性能便出现断崖式下滑。斯坦福大学的另一项研究则从失效机理入手,指出在接触密集型任务中,VLA存在"精度失效"与"力失效"两种彼此独立的崩溃模式。
这些发现指向同一个问题:VLA本质上是在做统计意义上的动作映射——它学会了"看到杯子就该抓",却无法判断"杯壁有多薄、摩擦力够不够、注水后重心会不会偏移"。它更像一个模仿者,而非物理世界的参与者。
当这一局限被逐步放大,"世界模型"开始成为具身智能跨越商业化门槛的新叙事。
机器人训练数据的稀缺是一个结构性难题。文本、图像、视频领域的训练样本可以通过互联网以极低边际成本获取,而有效的物理交互样本必须诞生于真实或高保真仿真的接触过程——抓取、推拨、按压,每一次交互都伴随真机运动、接触反馈和物体状态改变。这类数据采集周期长、硬件损耗大,且不同机器人本体之间存在显著的数据迁移壁垒。结果是,机器人可用的真实物理交互样本仅维持在百万量级,与文本图像领域数十亿级别的数据体量相比存在数万倍的落差。
杭州美梦空间科技有限公司(Memo)提出的Physical-WAM,正是针对这一约束的系统性解法。其核心设计思路是在感知信号输入与动作输出之间插入一层"物理Token"表征。传统世界模型的中间表征是像素或隐空间向量,它能推演"下一帧画面会变成什么样",却无法解释"为什么会变成这样"。Physical-WAM作为具备物理感知能力的WAM基模,基于可观测数据与深层物理数据训练,能够在真实任务中实时觉察物理变化,并预判动作后果、实时修正行为。
整套架构由三个模块构成,形成"感知→预测→生成→修正"的闭环。PhysLens承担"物理翻译器"角色,从多模态感知信号中提取摩擦、重量、重心、接触状态等不可直接观测的物理信息,输出统一的物理Token表征。PhysDream则是"物理预言家",结合当前物理表征、环境状态和候选动作推演未来物理状态,预测打滑、脱手等风险并给出不确定性评估。PhysAct负责物理条件化动作生成,将物理属性与未来状态预测引入动作生成,当环境发生物理漂移时自动调整执行策略。
一个直观的例子是:机器人抓握纸杯时,PhysLens识别出纸杯材质的低刚度特性,PhysDream预测注水后负载增加可能导致杯壁形变或滑脱,PhysAct据此调整抓握力度和接触位置,并在注水过程中持续修正策略直至完成操作。这不再是简单的动作复现,而是类似人类"物理直觉"的随机应变。
技术路线的竞争最终需要评测来裁决。现有具身智能评测基准存在一个结构性盲区:它们测量的是"任务完成度",而非"物理适应度"。一个模型可以在固定摩擦系数、固定物体质量的标准测试集上刷出高分,却对物理参数的扰动毫无鲁棒性。同等推力下,高摩擦的罐子原地倾倒,低摩擦的罐子直接滑飞;夹持擀面杖同一位置,重心偏移就会引发杆体摆动。这些现实世界中司空见惯的"物理漂移",在传统测评中很难得到有效验证。一项能力无法被度量,模型的迭代优化就失去了锚点。
美梦空间的第二个答案是RoboTwin-Phys物理漂移测评基准。这是业内首个以物理因素扰动为核心评测对象的机器人操作基准,能够把现实中抽象的物理参数转化为可控、可标记、可复现的变量。其评测逻辑遵循三层递进:物理属性推断准不准、物理扰动下任务还成不成、性能差距的上界在哪里。在RoboTwin基础上,该基准新增了13类真实世界常见的物理扰动因素,覆盖物体属性、接触属性、阻尼、任务环境到相机配置五大维度,支持单因素扰动到多因素组合扰动测评。
其工程价值体现在三个层面。第一,提供物理真值——包括物理值、接触力日志、物体运动学数据和失败时间线,使评测不只回答"成没成功",还能追问"模型是否估计对了、何时开始失败"。第二,固定种子配对评估,让不同模型面对相同扰动实例,减少运气成分。第三,按推断准确性、扰动下任务成功率、性能上界逐层递进,区分"物理状态识别错了"和"识别对了但动作策略没跟上"。这相当于在"感知—预测—生成"链条的每一环各设了一个考位。RoboTwin-Phys发布即开源,项目代码、数据集与排行榜全部开放,支持第三方验证复现。
美梦空间由北京大学信息技术高等研究院高文院士领衔的AVS先进视觉系统研究中心孵化,核心团队在具身智能、视频编解码、空间计算、人工智能领域积累了深厚的研究经验。2026年8月,物理AI企业索辰科技(688507.SH)完成对美梦空间的独家种子轮战略投资,双方在数据、算力、物理AI等技术层面深度协同,共同推进世界模型研发与产业应用落地。Physical-WAM和RoboTwin-Phys正是双方协同后的阶段性成果。
从更宏观的视角看,"世界模型"本身仍是一个尚未收敛的概念。计算机视觉研究者把它理解为视频生成,机器人领域把它当成状态预测器,强化学习圈子则从MBRL出发将其视为环境代理。毕马威2026年7月发布的《跨越奇点:世界模型如何重塑具身智能产业与商业新范式》报告提供了一个更清晰的坐标系:表征式世界模型回答"世界是什么",生成式世界模型回答"世界会变成什么",交互式世界模型回答"改变世界会发生什么",而理解-生成-预测一体化世界模型则试图回答"如何理解、预测并自主改变世界"。
美梦空间Physical-WAM为物理AI探索了一条可行的技术路径,但仍有若干边界问题待解。物理Token的粒度边界在哪里?摩擦、质量、重心是三个高度抽象的参数,但真实接触中还存在表面粗糙度的各向异性、材料的非线性弹性行为、接触面积的动态变化,当前表征能力的上限需要更系统的消融研究来回答。跨本体的物理迁移效率如何?同一个物体,二指夹爪和灵巧手抓取所需的动作策略不同,物理参数到动作的映射高度依赖末端执行器的形态与动力学特性。仿真物理的保真度天花板在哪里?PhysDream的推演精度受限于仿真引擎的物理保真度和真实传感器的噪声水平,当真实世界存在仿真无法建模的效应,比如织物的非线性大变形、颗粒材料的流动等,这套闭环的鲁棒性边界仍需验证。
值得注意的是,Physical-WAM与RoboTwin-Phys的出现并非孤立事件,它折射出国内具身智能赛道正在从"语言理解"向"物理理解"整体转向。
在模型层面,国内团队近年在世界模型方向上持续加码。智谱GLM系列在多模态理解与视频生成上的迭代,为物理场景的时空推理提供了基础能力;DeepSeek在多模态推理上的开源路线,降低了研究者构建物理仿真管线的门槛;通义千问与文心一言则在具身智能的感知-决策链路上探索语言模型与动作空间的结合方式。与海外VLA路线偏重语言指令跟随不同,国内团队在物理仿真、接触建模和评测基准上的投入更为集中,这与国内制造业场景对机器人操作精度的实际需求密切相关。
在评测层面,RoboTwin-Phys的开源策略也呼应了国内具身智能社区对标准化基础设施的迫切需求。此前国内团队在具身智能评测上多依赖海外基准,物理扰动维度的缺失使得模型迭代缺乏针对性锚点。RoboTwin-Phys将物理漂移量化为可控变量并开放排行榜,为国内研究者提供了一个可复现、可比较的公共标尺。
当然,从实验室走向真实产业场景,仍需要物理数据、世界模型、评测标准三块拼图协同补齐。正如美梦空间CEO李明昊在第五届全球数字贸易博览会上所言,只有让机器人真正读懂物理世界,具身智能才能大规模从实验室走向真实产业场景。这条路径的终点,或许正是行业期待的具身智能"GPT时刻"。
Physical-WAM是美梦空间发布的物理-世界动作模型,核心区别在于在感知输入与动作输出之间插入了"物理Token"表征层。传统世界模型以像素或隐空间向量为中间表征,只能推演画面变化,无法显式感知摩擦、重量、重心等物理量;Physical-WAM通过PhysLens、PhysDream、PhysAct三个模块实现"感知→预测→生成→修正"闭环,让机器人具备物理层面的预判与修正能力。
它解决了现有具身智能评测只测"任务完成度"、不测"物理适应度"的结构性盲区。RoboTwin-Phys新增13类物理扰动因素,覆盖物体属性、接触属性、阻尼、任务环境和相机配置五大维度,将抽象的物理参数转化为可控、可标记、可复现的变量,并按推断准确性、扰动下任务成功率、性能上界三层递进评测,发布即开源。
VLA模型学习的是从观测到动作的统计映射,它知道"何时该伸爪、旋转或松手",却不显式推断物体有多重、表面是否湿滑。斯坦福大学研究指出,在接触丰富任务中VLA存在"精度失效"与"力失效"两种独立崩溃模式;北大BeTTER基准也显示,引入空间布局偏移或时序外推后,VLA成功率断崖式下跌。
索辰科技(688507.SH)是物理AI领域的上市企业,2026年8月完成对美梦空间的独家种子轮战略投资。双方在数据、算力、物理AI等技术层面深度协同,共同推进世界模型研发与产业应用落地,Physical-WAM和RoboTwin-Phys是双方协同后的阶段性成果。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Поместите бренд в ленту читателя
Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

资本狂热与真实作业之间的鸿沟揭示了物理智能的规模化困局。华为联合多家机构发布的报告指出,云边端协同是破解实时性与复杂性两难的系统路径,三域协同与一网贯通构成核心架构。

Skild AI 用自我对弈训练人形机器人踢足球,只给进球奖励却自发涌现盘带护球等技能。本文拆解其技术路线、基础模型布局与仿真到现实的落地挑战。

一批以具身智能为标签的机器人公司集中登陆港交所,却在上市后普遍跌破发行价。标签与业务之间的断层正在透支行业的资本市场信用,后来者将面对更严苛的定价环境。
Получайте свежие материалы по SEO и GEO.
Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.
Войдите, чтобы присоединиться к обсуждению