
亮源新创通过 LightParkour、LightNav-0 和 Light REACT 三项技术,分别解决复杂接触技能扩展、通用导航零样本泛化和全身韧性控制问题,共同服务于具身智能从单点能力走向可规模化训练、对齐与部署的基础模型体系。
过去一年,机器人领域的技术迭代明显提速。VLA、世界模型、强化学习、Sim2Real 等方向持续演进,机器人的技能清单也在不断拉长——行走、奔跑、抓取、导航,乃至完成长程复杂任务。然而,一个更基础的问题正在浮出水面:机器人"会做"一件事,和它能在开放环境中长期、稳定、泛化地把事情做成,本质上是两回事。
能跨过固定高度的障碍,不代表换一种障碍依然有效;能在某个房间里导航,不代表换场景、换本体仍然管用;正常状态下稳定行走,不代表遭受撞击、跌倒甚至关节损伤后还能继续工作。随着具身智能从演示走向真实世界,行业评价标准正在从"会多少技能"转向"能力能否持续规模化扩展"。
这里的 Scaling 并非仅指模型参数量或数据量,而是模型能否经历更多环境、覆盖更多任务、迁移到更多本体,并在进入物理世界后继续适应训练阶段未曾见过的状态。
围绕这一核心问题,亮源新创提出了"三段范式":规模化预训练(Scalable Pre-Training)、规模化对齐(Scalable Alignment)和规模化部署(Scalable Deployment)。三者并非割裂,而是构成一个持续迭代的学习闭环——预训练建立基础能力,对齐通过强化学习等方式提升能力,部署则推动模型进入真实世界并持续产生高质量数据,形成驱动模型优化的数据飞轮。
过去一个多月,亮源新创连续发布了三项技术:LightParkour、LightNav-0 和 Light REACT。它们分别对应跑酷、导航和全身韧性控制,看似方向不同,实则都在回答同一个问题:如何让 Physical AI 从单点能力,逐步形成可规模化训练、对齐和部署的基础模型体系。
跑酷是全身运动中涉及复杂接触的典型任务。普通行走主要依赖双腿与地面形成支撑,但当机器人需要攀爬、撑越或跨越较高障碍时,环境本身会成为身体支撑的一部分。手在哪里接触、何时承重、重心如何移动、障碍高度变化后动作如何调整——这些因素直接决定任务能否完成。
传统动作模仿面临一个明显问题:动作视频记录了"人怎么动",却没有完整记录"这个动作为什么在这个环境里成立"。直接通过动作重定向将人类动作映射到机器人本体,可能出现手掌悬空、身体穿过障碍物,甚至轨迹超出机器人动力学能力的问题。而针对每种障碍重新采集动作,数据成本会随技能、地形和接触方式线性增长。
LightParkour 的思路是:只给机器人一个起点,让技能自己生长。具体而言,先从真实人类动作中恢复一段简短的动作种子,再将动作与对应障碍物一起放入物理仿真。仿真负责重新建立动作、障碍物、接触力和机器人执行器约束之间的关系。机器人成功完成当前动作后,系统提高障碍物难度,并将成功轨迹作为下一轮训练的参考。
于是,从一段针对 45 厘米障碍物的初始动作出发,可以逐步生成覆盖至 75 厘米障碍的参考轨迹——对应 90 厘米高的 Lightbot 0 约 83% 的身高。整个扩展过程中,只有最初的动作和障碍物需要人工对齐,之后的能力增长主要由物理仿真和课程学习完成。
这件事真正重要的地方,不是机器人跨得更高了,而是一个动作样本开始变成一个技能分布。过去需要针对不同障碍重新采集示范,现在模型开始利用物理世界本身的规律,自动生成新的有效经验。这已经出现了基础模型实现 Scaling 的一个关键特征:能力不再和人工数据一一绑定。
进一步地,LightParkour 使用多专家蒸馏,将行走和三项复杂接触技能整合到一个统一策略中。技能切换本身也不再依赖人工规则——系统对不同技能之间的切换进行训练,让机器人自主学习何时保持行走、何时进入全身动作、何时回到普通运动。部署时无需外部提供技能标签,也没有人工编写的状态机负责切换。最终在 Lightbot 0 上运行的是一个统一的循环深度视觉策略,仅使用胸前深度相机、本体感知和速度指令,以 50 Hz 在机载计算平台上运行,不需要运行时参考轨迹、外部运动捕捉或机外状态估计。
导航是机器人进入真实世界后绕不开的基础能力。但通用导航与传统导航存在本质区别:传统系统可以提前建图、依赖定位、针对摄像头和本体进行标定;而面向基础模型的导航系统,需要面对不同环境、不同任务、不同视角甚至不同机器人本体。它不能只"记住怎么走",而要形成可迁移的空间智能。
这首先是一个数据问题。语言模型拥有互联网级文本数据,但机器人没有天然存在的"机器人互联网"。如果所有导航经验都依靠真机遥操作采集,那么每增加一个环境、一个本体,都意味着新的数据成本。
LightNav-0 的做法,是通过 Real2Sim2Real 数据引擎,将 2,000+ 个互联网来源的真实场景转换为可复用仿真环境,形成 4,000+ 小时视觉、语言和动作后训练经验。同一个场景可以产生不同目标、不同路线、不同视角和不同任务,摄像机几何也可以随训练变化,从而避免模型只适应某一种固定机器人视角。
一个值得关注的实验结果是:在当前实验范围内,扩大环境覆盖度比单纯增加相同环境里的轨迹数量更能稳定提升泛化能力。这意味着 Physical AI 的数据 Scaling 可能与大语言模型有所不同——机器人不仅需要更多数据,更需要在更多样化的环境中积累经验。
导航的第二个问题是:如何把视觉和语言理解真正变成行动。例如,机器人接到"走到沙发右边"的指令,理解"沙发"并不困难,真正困难的是判断沙发在哪里、右边在哪里、哪里可以通行,以及接下来应该生成怎样的运动轨迹。
LightNav-0 因此引入 Point CoT:模型首先在图像空间预测目标点和可通行点,再生成后续动作 token。推理过程从"视觉+语言直接生成动作",变成"视觉语言理解→空间推理→动作生成"。在公开的 8 项消融评测中,引入 Point CoT 后,平均任务成功率提高 8.4 个百分点,SPL 提高 5.7 个百分点。随后,LightNav-0 通过 RVQ 动作编码器,将连续机器人轨迹压缩为 3 个动作 token,使视觉、语言、空间位置和机器人动作进入统一的模型训练框架。
最终验证没有停留在一个机器人或一个 Benchmark 里。在 10 个仿真设置中,LightNav-0 覆盖指令跟随、目标导航和具身视觉跟踪等任务;在真实机器人部署中,同一个模型零样本迁移到人形、四足、轮式和飞行机器人等不同本体。官方同时发布了模型、代码和技术报告。这一验证重点考察模型在环境、任务和机器人本体变化条件下的零样本泛化能力。
机器人正常运行时,大多数控制系统都能工作得很好。真正困难的是异常状态:人可能撞到机器人,机器人可能跌倒,执行器可能出现故障,关节可能锁死,环境也可能限制其原本的运动方式。这类异常在单次实验中可能并不高频,但随着部署规模扩大,其绝对发生次数也会增加,对系统韧性、故障恢复能力和运维效率提出更高要求。
Light REACT 的全称是 REsilient humAnoid ConTrol(韧性人形机器人控制),目标不是让机器人永远保持一种标准步态,而是在身体条件发生变化之后,尽可能利用剩余的全身能力继续移动。正常走可以,跛行可以,单腿跳可以;如果双腿已经无法维持直立运动,就让手臂参与支撑,切换到爬行。目标始终是同一个:在当前身体条件允许的范围内,继续完成运动。
关键不是拿到故障标签,而是从历史状态判断身体发生了什么变化。事实上,如何让机器人在面对新任务、新环境和新状态时减少显式人工适配,正在成为近期机器人基础模型研究中值得关注的方向。
今年 8 月,Skild AI 发布 S1,模型观看一次新任务的视频示范后,不修改模型权重,也不针对该任务重新进行后训练,就可以尝试直接执行。在其公开的未见长程任务实验中,同样使用 10 万小时预训练数据时,视频上下文版本成功率达到 66%,语言提示基线则为 9%。Skild AI 将传统机器人面对新任务时仍需要"收集数据—微调模型"的方式,类比为机器人仍处在"BERT 时代"。Generalist AI 随后发布的 GEN-1.5 同样展示了一次示范下的任务适应能力:通过 3—12 秒的单次示范,在不进行梯度更新的情况下,在 10 类短程任务中取得 59% 的平均成功率;使用每项任务约 5 分钟数据进行 10 步梯度更新后,平均成功率进一步提升至 83%。另一条线上,RoboTTT 把机器人可以利用的历史信息进一步扩展到 8K 个时间步,同一模型使用 8K 上下文训练相比 1K 版本闭环表现提升 62%,论文由此将上下文长度提出为机器人基础模型一个新的 Scaling 维度。
这些工作的架构、数据和任务并不相同,但都在触及一个共同问题:当机器人面对变化时,能否更多依靠模型已有能力和上下文完成适应,而不是每次都重新依赖人工采集数据、微调模型或编写规则。
在海外团队推进通用机器人基础模型的同时,国内具身智能领域也在快速跟进。与亮源新创类似,国内多家机构和企业正从数据引擎、统一表示和规模化训练等角度切入。例如,部分国内团队正在构建大规模仿真环境与真实场景融合的数据管线,尝试解决机器人数据稀缺和泛化能力不足的问题;也有研究者在探索将视觉、语言与动作统一到同一 Transformer 架构中的方法,以提升跨本体迁移能力。
在模型层面,国内的大语言模型与多模态模型进展为具身智能提供了可借鉴的基座能力。文心一言、通义千问、DeepSeek、豆包、Kimi、智谱 GLM、讯飞星火等模型在语言理解、多模态感知和推理方面持续迭代,为机器人上层任务规划和人机交互提供了更丰富的选择。不过,具身智能对实时性、安全性和物理交互的要求远高于纯软件场景,国内团队在 Sim2Real 迁移、全身控制与硬件本体协同方面仍面临与海外同行相似的工程挑战。整体来看,国内外在"规模化预训练—对齐—部署"这一范式上的探索正在形成共振,差异更多体现在数据来源、硬件生态和落地场景的侧重点上。
把三项技术放在一起看,亮源新创实际上一直在回答同一个问题:如何让 Physical AI 从单点能力,逐步形成可以规模化训练、规模化对齐和规模化部署的基础模型体系。LightParkour 从一个动作示例出发,将其扩展为能够适应不同环境条件的技能分布;LightNav-0 把这种泛化进一步推到环境、任务和机器人本体;Light REACT 则面向部署后的异常状态,研究机器人如何依据自身交互历史调整运动方式。
三者共同指向一个趋势:具身智能的竞争焦点,正在从"谁能让机器人完成更炫酷的动作",转向"谁能建立更高效的学习闭环"。当能力不再和人工数据一一绑定,当模型开始利用物理规律和上下文自主适应,机器人真正走进开放世界的门槛才会被逐步跨越。
LightParkour 解决复杂接触技能从单一样本到技能分布的扩展问题;LightNav-0 解决通用导航在环境、任务和机器人本体变化下的零样本泛化问题;Light REACT 解决机器人在外力扰动、跌倒和硬件损伤条件下的全身韧性控制问题。三者共同服务于 Physical AI 能力规模化扩展的目标。
Real2Sim2Real 是亮源新创用于导航模型训练的数据管线,它将互联网来源的真实场景转化为可复用的仿真环境,在仿真中生成大量视觉、语言和动作经验,再迁移回真实机器人。其核心价值在于降低对真机遥操作数据的依赖,提高数据多样性和训练效率。
LightNav-0 的实验表明,在当前范围内,扩大环境覆盖度能更稳定地提升泛化能力。这意味着机器人不仅需要更多数据,更需要在多样化环境中积累经验,避免模型只适应某一种固定场景或视角。
Point CoT 让模型先在图像空间预测目标点和可通行点,再生成动作 token,将推理过程从"视觉+语言直接生成动作"变为"视觉语言理解→空间推理→动作生成"。在公开评测中,引入 Point CoT 后平均任务成功率提高 8.4 个百分点。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
Put your brand in the reader feed
In-article ad slots: high-attention moments perfect for product launches and event recruitment.
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

蚂蚁灵波联合魔搭社区、阿里云天池发起首届具身大模型挑战赛,以 LingBot-VLA 2.0 开源基座为核心,设置仿真初赛与上海真机黑客松决赛,面向全球开发者开放。

外滩大会释放明确信号:AI原生代正以学术与产业并行的方式重塑科技格局。从9岁黑客松获奖者到00后创业者,年轻一代跳过传统路径,直接用AI工具定义产品与研究方向。
Get the latest SEO & GEO insights.
We respect your privacy. You can unsubscribe at any time.