Bingdada 技术博客Bingdada 技术博客
首页博客SEOGEOAEOAI工具关于
登录注册
Logo

Bingdada 技术博客

专注于SEO搜索引擎优化和GEO生成式引擎优化以及未来人工智能发展趋势的技术博客

快速链接

  • 首页
  • 博客文章
  • 关于我们

联系方式

  • 398848662@qq.com

订阅我们的 Newsletter,获取最新的 SEO 和 GEO 技术资讯。

© 2024 Bingdada 技术博客. All rights reserved.

首页博客国产 AI 前线机器人不预习就进陌生家庭干活,Figure 的零样本泛化意味着什么
机器人不预习就进陌生家庭干活,Figure 的零样本泛化意味着什么
国产 AI 前线

机器人不预习就进陌生家庭干活,Figure 的零样本泛化意味着什么

bingdadabingdada
九月 19, 202614 次阅读约 6 分钟阅读
快速回答

Figure AI 的 Helix 2.5 在 30 个从未见过的家庭中实现约 56% 的零样本任务成功率,而同样硬件去掉预训练后仅 9%。这说明大规模预训练能显著提升机器人在陌生环境中的泛化能力,但 56% 的绝对值仍表明家用机器人距离可靠实用尚有差距。

核心要点
  • Helix 2.5 在 30 个陌生家庭完成 420 次试验,零样本成功率约 56%,无预训练基线仅 9%。
  • 预训练带来的提升呈现类似语言模型的比例关系,整体成功率提升约 522%。
  • 仅用一半适应数据量,Helix 2.5 即在陌生家庭追平上一代模型在单一场地的表现。
  • 评测采用盲测并隔离测试物品,降低数据泄漏可能,但 56% 的绝对值仍说明泛化尚未成熟。
  • 国内团队多从工厂、商超等半结构化场景切入,与 Figure 直接挑战家庭场景形成路径差异。
目录

目录

  • 当机器人走进一个完全陌生的家
  • 56% 这个数字该怎么读
  • 为什么「换个房间就失灵」是行业通病
  • 从动画管家到真实产品,中间隔着什么
  • 国内视角:泛化能力同样是竞争焦点
  • 常见问题
  • Helix 2.5 的零样本成功率是多少?
  • 零样本和少样本有什么区别?
  • 为什么家用机器人需要预训练?
  • Figure 的评测是否可信?
  • 国内有类似的家用机器人进展吗?
  • 关于 Bingdada

当机器人走进一个完全陌生的家

家用机器人领域长期存在一个尴尬的现实:演示视频里动作流畅,落到真实场景却寸步难行。原因并不复杂——绝大多数系统在进入一个新环境前,需要先采集该场地的专属数据,或者依赖人工远程操作兜底。换句话说,机器人卖出去之后,训练工作才真正开始。

Figure AI 在 9 月 17 日公布的新一代模型 Helix 2.5,试图正面回应这个难题。其核心主张是:机器人无需事先到访目标住宅,也无需针对该住宅做任何微调,就能直接执行叠毛巾、整理床铺、拾取物品等家务任务。

从公开的评测设计看,这次测试覆盖了湾区 30 个真实民宅,全部保留原有家具布局与物品摆放,没有为评测做任何改造。用于测试的玩具、毛巾和床品被提前隔离存放,先由模型初筛、再经人工复核,确认未出现在任何训练数据中。评测采用盲测方式,且没有任何单一任务在预训练数据中的占比超过 1.90%。

56% 这个数字该怎么读

在 420 次试验中,Helix 2.5 成功了 237 次,零样本成功率约为 56%。单看这个数字,距离「可靠的家用助手」仍有明显差距。但真正值得关注的是对照组:同样的硬件、同样的任务数据,仅仅去掉预训练环节,成功率就跌到 9%。

这一对比揭示出预训练数据的杠杆效应。随着预训练规模增加,机器人的表现呈现出类似语言模型的可预测比例关系——在其他条件不变的情况下,零样本任务成功率从 9% 提升到 56%,整体成功率提升约 522%。

另一个参照维度来自 Figure 自家上一代模型 Helix 02。后者需要先在目标场地采集数据才能训练,而 Helix 2.5 仅用一半的适应数据量,就在 30 个从未见过的家庭中追平了 Helix 02 在单一场地的成功率。这说明泛化能力的提升并非以牺牲任务表现为代价。

为什么「换个房间就失灵」是行业通病

对人而言,换一张床不至于忘记怎么铺被子。对机器人而言,床的高度、墙边的空隙、被角垂落的位置,任何一项变化都可能让熟悉的动作瞬间失效。这种脆弱性源于传统策略对场景特征的过度拟合。

过去几年里,特斯拉 Optimus、1X Neo 等产品的公开演示,大多依赖大量场地专属数据或人工远程操作。Figure 今年 1 月发布的 Helix 02 虽然能完成卸洗碗机这类连续几十步的长时任务,但同样需要先在目标场地采集数据。

Helix 2.5 想回答的问题因此更具根本性:机器人能否走进一个从没见过的家,直接开始干活,不需要主人先配合录一遍自己家的样子。

从动画管家到真实产品,中间隔着什么

家用机器人的想象可以追溯到半个世纪前的动画形象。那个围着围裙、拿着拖把的机器人管家,几乎定义了公众对家用机器人的全部期待。但 1970 年代也出现过承诺打扫、修剪草坪甚至遛狗却无法兑现的公司,最终被证明只是借新技术之名行投机之实。

历史反复提醒我们:演示与产品之间存在巨大鸿沟。Helix 2.5 的意义不在于它已经跨过这道鸿沟,而在于它把评测标准从「精心布置的场地」推向了「未经准备的陌生住宅」。这种评测设计本身,比 56% 这个数字更值得行业参考。

国内视角:泛化能力同样是竞争焦点

在具身智能方向上,国内团队同样把泛化与零样本适应视为核心指标。智谱 GLM 系列、科大讯飞星火等在大模型侧持续迭代,为机器人提供更强的任务理解与规划能力;优必选、宇树科技等硬件厂商则在运动控制与场景适配上积累数据。与 Figure 的路径相比,国内玩家更强调软硬件协同与特定场景的快速落地,例如在工厂、商超等半结构化环境中先实现稳定作业,再逐步向家庭场景渗透。

这种差异并非优劣之分,而是市场结构决定的节奏选择。家庭环境的非结构化程度最高,对泛化能力的要求也最苛刻。Figure 选择直接挑战这一最难场景,国内团队则倾向于用更可控的场景先跑通商业闭环。两条路线最终会在家庭场景交汇,届时比拼的将不只是模型规模,而是数据效率与工程化能力的综合水平。

常见问题

Helix 2.5 的零样本成功率是多少?

在 30 个陌生家庭的 420 次试验中成功 237 次,零样本成功率约为 56%。作为对照,去掉预训练环节后成功率仅为 9%。

零样本和少样本有什么区别?

零样本指模型在完全没有目标场景数据的情况下直接执行任务;少样本则允许提供少量示例或微调数据。Helix 2.5 强调的是前者。

为什么家用机器人需要预训练?

预训练让模型在大量多样化场景中学习通用规律,从而在面对新环境时不必从零开始。缺少预训练,策略容易过拟合到特定场地,换个房间就可能失效。

Figure 的评测是否可信?

评测采用盲测,测试物品经过模型初筛与人工复核确认未出现在训练数据中,且没有单一任务在预训练数据中占比超过 1.90%。这些设计降低了数据泄漏的可能性,但 56% 的绝对成功率仍说明距离实用化有距离。

国内有类似的家用机器人进展吗?

国内团队在具身智能方向持续投入,但多数选择从工厂、商超等半结构化场景切入,先实现稳定作业再向家庭渗透。与 Figure 直接挑战家庭场景的路径形成互补。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

目录

  • 当机器人走进一个完全陌生的家
  • 56% 这个数字该怎么读
  • 为什么「换个房间就失灵」是行业通病
  • 从动画管家到真实产品,中间隔着什么
  • 国内视角:泛化能力同样是竞争焦点
  • 常见问题
  • Helix 2.5 的零样本成功率是多少?
  • 零样本和少样本有什么区别?
  • 为什么家用机器人需要预训练?
  • Figure 的评测是否可信?
  • 国内有类似的家用机器人进展吗?
  • 关于 Bingdada
常见问题
黄金广告位 · 限时招商
广告位招商中

把品牌放进读者的阅读流

文章内广告位,高注意力场景,适合新品发布与活动招募。

商务合作

标签

#具身智能#Figure AI#Helix 2.5#零样本泛化#家用机器人
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

相关文章

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号
AI人工智能

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

9月 15约 8 分钟阅读
从开源基座到真机实战:蚂蚁灵波如何用一场挑战赛撬动具身智能开发者生态
国产 AI 前线

从开源基座到真机实战:蚂蚁灵波如何用一场挑战赛撬动具身智能开发者生态

蚂蚁灵波联合魔搭社区、阿里云天池发起首届具身大模型挑战赛,以 LingBot-VLA 2.0 开源基座为核心,设置仿真初赛与上海真机黑客松决赛,面向全球开发者开放。

9月 15约 6 分钟阅读
从单一技能到通用基座:具身智能如何跨越规模化落地的鸿沟
国产 AI 前线

从单一技能到通用基座:具身智能如何跨越规模化落地的鸿沟

亮源新创连续发布 LightParkour、LightNav-0 和 Light REACT 三项技术,围绕规模化预训练、对齐与部署的三段范式,探索具身智能如何从单点技能走向可泛化的基础模型体系。

9月 14约 15 分钟阅读

订阅我们的 Newsletter

获取最新的 SEO 与 GEO 技术资讯。

我们尊重您的隐私,随时可以取消订阅。

评论 ({count}) (0)

登录后即可参与讨论

登录注册
还没有评论,来抢沙发吧