
Figure AI 的 Helix 2.5 在 30 个从未见过的家庭中实现约 56% 的零样本任务成功率,而同样硬件去掉预训练后仅 9%。这说明大规模预训练能显著提升机器人在陌生环境中的泛化能力,但 56% 的绝对值仍表明家用机器人距离可靠实用尚有差距。
家用机器人领域长期存在一个尴尬的现实:演示视频里动作流畅,落到真实场景却寸步难行。原因并不复杂——绝大多数系统在进入一个新环境前,需要先采集该场地的专属数据,或者依赖人工远程操作兜底。换句话说,机器人卖出去之后,训练工作才真正开始。
Figure AI 在 9 月 17 日公布的新一代模型 Helix 2.5,试图正面回应这个难题。其核心主张是:机器人无需事先到访目标住宅,也无需针对该住宅做任何微调,就能直接执行叠毛巾、整理床铺、拾取物品等家务任务。
从公开的评测设计看,这次测试覆盖了湾区 30 个真实民宅,全部保留原有家具布局与物品摆放,没有为评测做任何改造。用于测试的玩具、毛巾和床品被提前隔离存放,先由模型初筛、再经人工复核,确认未出现在任何训练数据中。评测采用盲测方式,且没有任何单一任务在预训练数据中的占比超过 1.90%。
在 420 次试验中,Helix 2.5 成功了 237 次,零样本成功率约为 56%。单看这个数字,距离「可靠的家用助手」仍有明显差距。但真正值得关注的是对照组:同样的硬件、同样的任务数据,仅仅去掉预训练环节,成功率就跌到 9%。
这一对比揭示出预训练数据的杠杆效应。随着预训练规模增加,机器人的表现呈现出类似语言模型的可预测比例关系——在其他条件不变的情况下,零样本任务成功率从 9% 提升到 56%,整体成功率提升约 522%。
另一个参照维度来自 Figure 自家上一代模型 Helix 02。后者需要先在目标场地采集数据才能训练,而 Helix 2.5 仅用一半的适应数据量,就在 30 个从未见过的家庭中追平了 Helix 02 在单一场地的成功率。这说明泛化能力的提升并非以牺牲任务表现为代价。
对人而言,换一张床不至于忘记怎么铺被子。对机器人而言,床的高度、墙边的空隙、被角垂落的位置,任何一项变化都可能让熟悉的动作瞬间失效。这种脆弱性源于传统策略对场景特征的过度拟合。
过去几年里,特斯拉 Optimus、1X Neo 等产品的公开演示,大多依赖大量场地专属数据或人工远程操作。Figure 今年 1 月发布的 Helix 02 虽然能完成卸洗碗机这类连续几十步的长时任务,但同样需要先在目标场地采集数据。
Helix 2.5 想回答的问题因此更具根本性:机器人能否走进一个从没见过的家,直接开始干活,不需要主人先配合录一遍自己家的样子。
家用机器人的想象可以追溯到半个世纪前的动画形象。那个围着围裙、拿着拖把的机器人管家,几乎定义了公众对家用机器人的全部期待。但 1970 年代也出现过承诺打扫、修剪草坪甚至遛狗却无法兑现的公司,最终被证明只是借新技术之名行投机之实。
历史反复提醒我们:演示与产品之间存在巨大鸿沟。Helix 2.5 的意义不在于它已经跨过这道鸿沟,而在于它把评测标准从「精心布置的场地」推向了「未经准备的陌生住宅」。这种评测设计本身,比 56% 这个数字更值得行业参考。
在具身智能方向上,国内团队同样把泛化与零样本适应视为核心指标。智谱 GLM 系列、科大讯飞星火等在大模型侧持续迭代,为机器人提供更强的任务理解与规划能力;优必选、宇树科技等硬件厂商则在运动控制与场景适配上积累数据。与 Figure 的路径相比,国内玩家更强调软硬件协同与特定场景的快速落地,例如在工厂、商超等半结构化环境中先实现稳定作业,再逐步向家庭场景渗透。
这种差异并非优劣之分,而是市场结构决定的节奏选择。家庭环境的非结构化程度最高,对泛化能力的要求也最苛刻。Figure 选择直接挑战这一最难场景,国内团队则倾向于用更可控的场景先跑通商业闭环。两条路线最终会在家庭场景交汇,届时比拼的将不只是模型规模,而是数据效率与工程化能力的综合水平。
在 30 个陌生家庭的 420 次试验中成功 237 次,零样本成功率约为 56%。作为对照,去掉预训练环节后成功率仅为 9%。
零样本指模型在完全没有目标场景数据的情况下直接执行任务;少样本则允许提供少量示例或微调数据。Helix 2.5 强调的是前者。
预训练让模型在大量多样化场景中学习通用规律,从而在面对新环境时不必从零开始。缺少预训练,策略容易过拟合到特定场地,换个房间就可能失效。
评测采用盲测,测试物品经过模型初筛与人工复核确认未出现在训练数据中,且没有单一任务在预训练数据中占比超过 1.90%。这些设计降低了数据泄漏的可能性,但 56% 的绝对成功率仍说明距离实用化有距离。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

蚂蚁灵波联合魔搭社区、阿里云天池发起首届具身大模型挑战赛,以 LingBot-VLA 2.0 开源基座为核心,设置仿真初赛与上海真机黑客松决赛,面向全球开发者开放。

亮源新创连续发布 LightParkour、LightNav-0 和 Light REACT 三项技术,围绕规模化预训练、对齐与部署的三段范式,探索具身智能如何从单点技能走向可泛化的基础模型体系。
获取最新的 SEO 与 GEO 技术资讯。
我们尊重您的隐私,随时可以取消订阅。