Технический блог BingdadaТехнический блог Bingdada
ГлавнаяБлогSEOGEOAEOAIИнструментыО нас
ВойтиРегистрация
Logo

Технический блог Bingdada

Технический блог, посвящённый SEO, GEO и тенденциям развития искусственного интеллекта.

Быстрые ссылки

  • Главная
  • Статьи блога
  • О нас

Контакты

  • 398848662@qq.com

Подпишитесь на нашу рассылку, чтобы получать свежие материалы по SEO и GEO.

© 2024 Bingdada 技术博客. All rights reserved.

Статья на упрощённом китайском. Перевести на Русский в один клик.
ГлавнаяБлог国产 AI 前线当机器人学会自己发明足球技巧:自我对弈如何重塑具身智能训练范式
当机器人学会自己发明足球技巧:自我对弈如何重塑具身智能训练范式
国产 AI 前线

当机器人学会自己发明足球技巧:自我对弈如何重塑具身智能训练范式

bingdadabingdada
сентября 26, 202643 прочтений9 мин чтения
post.quickAnswer

Skild AI 让机器人在虚拟球场中通过自我对弈训练,仅设定进球目标,机器人便自行演化出盘带、护球、抢断等足球技能。其底层依托 Skild Brain 基础模型实现跨硬件控制,但仿真到真实世界的迁移仍是核心挑战。

post.keyTakeaways
  • Skild AI 的机器人在仅设定进球奖励的条件下,通过自我对弈自行学会了盘带、护球和抢断等复杂动作,全程无需人工设计子技能奖励。
  • Skild Brain 基础模型在约 10 万种仿真身体上训练,目标是让同一颗大脑控制不同形态的机器人,并在硬件故障时在线调整策略。
  • 该技术路线脱胎于两位 CMU 教授的学术积累,核心思想是让机器人通过自主探索而非人类示教来获取新技能。
  • 自我对弈方法从 AlphaGo 的棋类博弈迁移到连续物理控制领域,验证了该方法在具身智能中的可行性。
  • 仿真训练到真实部署之间仍存在物理差异,国内宇树、智元等团队也在推进相关方向但侧重点有所不同。
Содержание

Содержание

  • 一个不需要教练的球员
  • 自我对弈:从棋盘到绿茵场的方法论迁移
  • 一颗大脑,适配万种身体
  • 两位 CMU 教授的技术赌注
  • 从仿真到现实的鸿沟与国内进展
  • 常见问题
  • 机器人真的能自己学会踢足球吗?
  • 什么是自我对弈训练?
  • Skild AI 的机器人基础模型和传统控制程序有什么区别?
  • 国内有没有类似的技术方向?
  • 这种技术什么时候能用在真实场景中?
  • 关于 Bingdada

一个不需要教练的球员

设想一支足球队,没有教练布置战术,没有训练课拆解动作,球员唯一要做的就是赢下比赛。听起来像是天方夜谭,但美国具身智能公司 Skild AI 最近展示的成果,恰恰把这个设想变成了工程现实。

在一段公开演示中,一台身着阿根廷国家队配色球衣的人形机器人完成了连贯的带球推进、变向摆脱和射门动作。更值得玩味的是,研发团队从未针对「盘带」「护球」「抢断」这些子技能编写过任何奖励规则——训练系统里只写了一条目标:把球送进门里。

这意味着,那些看起来颇具职业风范的足球动作,是机器人自己在反复试错中「发明」出来的。

自我对弈:从棋盘到绿茵场的方法论迁移

这套训练逻辑并不陌生。2016 年,AlphaGo 击败李世石的消息震动了整个科技界,其核心武器之一就是自我对弈——让 AI 与自己的历史版本反复过招,在胜负信号中自行发现人类棋手未曾涉猎的定式。

Skild AI 做的事情,本质上是把这条路线从离散的棋盘搬到了连续的物理空间。团队在 NVIDIA Isaac Sim 构建的仿真环境中搭建了一座虚拟球场,让机器人面对的唯一对手就是自己此前的模型快照。新版本若能战胜旧版本,就会成为下一轮训练中更强大的陪练。每一轮进步,都在自动制造下一道更难的题目。

据 Skild AI 技术博客披露,机器人最初进入虚拟球场时连稳定行走都困难;随着训练推进,它逐渐掌握了跌倒后自主起身的能力,随后又演化出绕开防守、用身体卡位护球、主动上抢等复杂行为。这些动作没有任何一条被工程师显式规定,它们被保留下来的唯一理由是:能提高赢球概率。

一颗大脑,适配万种身体

要理解 Messinator 为何能如此灵活,需要把视线拉回到 Skild AI 更早的技术布局。

2025 年 7 月,该公司发布了一款名为 Skild Brain 的机器人基础模型,核心理念可以概括为一句话:任意机器人、任意任务、同一颗大脑。这直接挑战了行业长期存在的「一种硬件配一套控制程序」的惯例。

紧接着,团队又公开了一组 omni-bodied 训练成果。在仿真环境中,他们生成了约 10 万种结构各异的机器人身体,让同一个模型累计经历约 1000 个仿真年的训练。测试阶段,模型需要直接接管训练中从未见过的硬件形态——即便机器人突然断腿、关节锁死或轮子卡住,模型也能在线调整重心和运动策略,部分场景下几秒内就能重新找到平衡并摸索出新的移动方式。

这套方法的精妙之处在于:当模型见过的身体足够多样,死记硬背就彻底失效了。它被迫去理解平衡、关节力矩、重心分布和动力传递之间更底层的物理规律,而不是记住某一款机器人的固定步态。Messinator 正是这条技术路线的延伸——Skild Brain 提供控制身体、维持平衡和应对碰撞的基础能力,自我对弈则负责回答「下一步怎么做才能赢」这个策略问题。

两位 CMU 教授的技术赌注

Skild AI 成立于 2023 年,脱胎于卡内基梅隆大学的机器人研究体系。团队汇聚了来自 CMU、斯坦福、UC Berkeley 等高校的研究者,以及曾在 Meta、Tesla、NVIDIA、Google 等机构任职的工程师。

联合创始人兼 CEO Deepak Pathak 的学术轨迹几乎串起了公司的整条技术路线。他在 UC Berkeley 获得计算机博士,师从计算机视觉领域的知名学者 Alyosha Efros 和 Trevor Darrell,此后在 Meta AI Research 从事研究,并与机器人学习专家 Pieter Abbeel 在伯克利有过合作。加入 CMU 后,他成为机器人研究所和机器学习系教授。

Pathak 最具代表性的研究方向之一是「好奇心驱动的探索」——与其让机器依赖人类设计的外部奖励,不如赋予它内在动力,让它对陌生现象产生探索欲,并在自主探索中习得新能力。这一思路后来延伸到自监督机器人学习、视觉模仿学习、Sim2Real 和自适应控制等方向。

另一位联合创始人兼总裁 Abhinav Gupta 同样来自 CMU 机器人研究所,博士毕业于马里兰大学。他曾参与建立 Meta AI Research 匹兹堡实验室并担任研究管理职务,长期深耕大规模视觉学习、自监督学习和物理常识推理,是早期倡导「让机器人通过自主交互收集训练数据」的研究者之一。

从仿真到现实的鸿沟与国内进展

自我对弈在虚拟环境中跑通 140 年,并不等于机器人就能直接站上真实球场。仿真与现实的物理差异——摩擦力、传感器噪声、电机响应延迟——始终是具身智能落地的核心瓶颈。Skild AI 目前展示的真人对抗场景,仍然是在受控条件下进行的初步验证。

值得注意的是,国内团队在这一方向上并非旁观者。宇树科技的人形机器人已经在运动控制和动态平衡方面展现出相当高的完成度;智元机器人、星海图等公司也在探索基于强化学习的全身运动策略。在「用仿真训练替代人工示教」这条思路上,国内高校如清华大学、上海交通大学的研究团队同样发表了大量关于 Sim2Real 迁移和自监督技能发现的工作。差异在于,Skild AI 更强调单一基础模型对多种硬件形态的通用控制能力,而国内团队目前更多聚焦于特定本体上的运动技能优化。两条路线各有侧重,但都指向同一个判断:机器人学会新技能的方式,正在从「人类手把手教」转向「自己练、自己输、自己总结」。

常见问题

机器人真的能自己学会踢足球吗?

在仿真环境中,Skild AI 的机器人在只设定「进球得分」这一终极目标的前提下,通过自我对弈自行演化出了盘带、护球、抢断等复杂动作。这些技能并非工程师逐条编写,而是模型在反复比赛中发现的有效策略。但在真实物理世界中,受限于传感器精度和执行器响应,目前仍处于初步验证阶段。

什么是自我对弈训练?

自我对弈是一种让 AI 与自己的历史版本反复对抗的训练方法。每一轮中,表现更好的策略被保留下来,成为下一轮更难对付的对手。这种方法最早在 AlphaGo 等棋类 AI 中取得突破,如今被扩展到机器人控制领域,让机器人在没有人类示范的情况下自主发现新技能。

Skild AI 的机器人基础模型和传统控制程序有什么区别?

传统机器人控制通常针对特定硬件编写专门程序,换一种身体就需要重新开发。Skild Brain 的目标是用同一个模型控制不同形态的机器人,通过在约 10 万种仿真身体上训练,迫使模型学习通用的物理规律而非固定步态。这意味着机器人在面对从未见过的硬件故障时,也能在线调整策略。

国内有没有类似的技术方向?

有。宇树科技、智元机器人等公司在人形机器人的运动控制方面已有公开成果,清华大学、上海交通大学等高校也在 Sim2Real 迁移和自监督技能发现方向发表了多项研究。国内路线目前更侧重于特定本体上的运动技能优化,而 Skild AI 更强调跨硬件形态的通用控制。

这种技术什么时候能用在真实场景中?

仿真训练到真实部署之间仍存在物理差异带来的迁移损耗。目前该技术处于从实验室演示向受控场景验证过渡的阶段。物流搬运、危险环境作业等结构化程度较高的场景可能率先落地,而像足球比赛这样高度动态、强对抗的场景,距离成熟应用还有相当距离。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Содержание

  • 一个不需要教练的球员
  • 自我对弈:从棋盘到绿茵场的方法论迁移
  • 一颗大脑,适配万种身体
  • 两位 CMU 教授的技术赌注
  • 从仿真到现实的鸿沟与国内进展
  • 常见问题
  • 机器人真的能自己学会踢足球吗?
  • 什么是自我对弈训练?
  • Skild AI 的机器人基础模型和传统控制程序有什么区别?
  • 国内有没有类似的技术方向?
  • 这种技术什么时候能用在真实场景中?
  • 关于 Bingdada
post.faq
Премиум рекламное место · Ограниченное время
Рекламные места в аренду

Поместите бренд в ленту читателя

Рекламные места внутри статей — моменты высокого внимания, идеальны для запуска продуктов и набора на мероприятия.

Сотрудничество

Теги

#具身智能#量子位 QbitAI#机器人基础模型#自我对弈#Sim2Real
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Похожие статьи

物理智能规模化困局:华为报告揭示的云边端协同路径
国产 AI 前线

物理智能规模化困局:华为报告揭示的云边端协同路径

资本狂热与真实作业之间的鸿沟揭示了物理智能的规模化困局。华为联合多家机构发布的报告指出,云边端协同是破解实时性与复杂性两难的系统路径,三域协同与一网贯通构成核心架构。

сент. 289 мин чтения
具身智能的物理课:从VLA失效到世界模型补位,美梦空间与索辰科技给出什么答案
国产 AI 前线

具身智能的物理课:从VLA失效到世界模型补位,美梦空间与索辰科技给出什么答案

当VLA模型在物理扰动下频频失效,世界模型成为具身智能跨越商业化门槛的新路径。美梦空间联合索辰科技发布Physical-WAM与RoboTwin-Phys,从物理Token表征到物理漂移评测,为机器人补上"物理课"。

сент. 2712 мин чтения
具身智能标签的信用透支:机器人公司集体上市后的估值重估
国产 AI 前线

具身智能标签的信用透支:机器人公司集体上市后的估值重估

一批以具身智能为标签的机器人公司集中登陆港交所,却在上市后普遍跌破发行价。标签与业务之间的断层正在透支行业的资本市场信用,后来者将面对更严苛的定价环境。

сент. 257 мин чтения

Подпишитесь на рассылку

Получайте свежие материалы по SEO и GEO.

Мы уважаем вашу конфиденциальность. Отписаться можно в любой момент.

Комментарии ({count}) (0)

Войдите, чтобы присоединиться к обсуждению

ВойтиРегистрация
Комментариев пока нет, будьте первым