Bingdada Tech BlogBingdada Tech Blog
HomeBlogSEOGEOAEOAIToolsAbout
Log inSign up
Logo

Bingdada Tech Blog

A technical blog focused on SEO, GEO, and future AI trends.

Quick Links

  • Home
  • Blog Posts
  • About Us

Contact

  • 398848662@qq.com

Subscribe to our Newsletter for the latest SEO and GEO insights.

© 2024 Bingdada 技术博客. All rights reserved.

This article is in Simplified Chinese. Translate it to English with one click.
HomeBlog国产 AI 前线具身智能迎来上下文学习新范式,可可矩阵押注ICL底层路线
具身智能迎来上下文学习新范式,可可矩阵押注ICL底层路线
国产 AI 前线

具身智能迎来上下文学习新范式,可可矩阵押注ICL底层路线

bingdadabingdada
September 7, 202659 reads10 min read
Quick Answer

具身ICL是让机器人通过观看任务演示视频,在不微调的情况下学会执行新任务的技术范式。Skild AI、Generalist AI等公司已展示初步成果,国内创业公司可可矩阵正将其发展为底层技术路线,核心挑战在于多模态上下文理解与流式记忆机制。

Key Takeaways
  • Skild AI和Generalist AI在2026年8月相继发布具身ICL相关成果,展示机器人通过视频示范快速学习新任务的能力
  • 具身ICL面临视觉多层理解、多模态数据失衡、长上下文记忆三大核心技术挑战
  • 可可矩阵提出流式记忆概念,认为Long Context的关键是持续筛选压缩历史信息而非扩展固定窗口
  • 人机教学、实时纠偏类数据是当前具身ICL最明显的缺口,行业尚未形成统一采集标准
  • 可可矩阵开发条件表征体系,让视觉特征提取由任务意图动态决定,实现强理解轻生成
Contents

Contents

  • 上下文学习:从语言模型到机器人的跨越
  • 行业信号:多家公司展示具身ICL能力
  • 技术挑战:为何具身ICL比语言ICL更复杂
  • 流式记忆:超越固定窗口的思考
  • 数据新缺口:人机交互数据的定义与采集
  • 条件表征:理解物理世界的新思路
  • 创业路径:从学术理想到产业实践
  • 国内视角:具身智能赛道的差异化竞争
  • 展望:具身ICL的边界与可能
  • 常见问题
  • 什么是具身智能领域的上下文学习(ICL)?
  • 具身ICL与传统的VLA模型有何不同?
  • 具身ICL面临哪些核心技术挑战?
  • 国内在具身ICL领域有哪些探索?
  • 为什么说具身智能需要新的Scaling路线?
  • 关于 Bingdada

从大语言模型到具身智能,In-Context Learning(ICL)正在成为一条备受关注的新技术路径。2020年GPT-3展示的“看几个示例就会新任务”的能力,如今在机器人领域开始显现类似的潜力。多家创业公司正试图将这一范式引入物理世界,探索机器人如何通过更长的多模态上下文快速适应新任务。

上下文学习:从语言模型到机器人的跨越

ICL的核心思想在于,模型无需更新参数,仅通过在输入中提供任务示例,就能在单次前向推理中学会执行新任务。这一机制在语言模型领域已被充分验证,上下文窗口从4K扩展到1M的过程中,ICL扮演了关键角色。

然而,具身智能领域的ICL面临截然不同的挑战。机器人面对的是视觉观测、语言指令与动作序列交织的复合上下文,真实任务往往是非马尔可夫的——当前决策依赖于数分钟前的操作状态。每秒几十帧的视觉数据加上本体状态信息,使得上下文的信息量比纯语言高出数个数量级。

行业信号:多家公司展示具身ICL能力

2026年8月,Skild AI发布的机器人基础模型S1引发关注。该模型能够在无需微调的情况下,通过观看任务演示视频尝试完成未训练过的新任务,任务时长可达10分钟。测试数据显示,当训练数据规模增加时,ICL相比传统语言指令的效果优势显著,对于未见任务,加入视频上下文后模型表现提升约7倍。

紧随其后,Generalist AI发布的GEN-1.5同样将One-Shot Learning作为核心能力,支持机器人仅凭一个示范就在数秒内学习新任务。这些进展都指向同一个方向:让机器人学会利用更长的多模态上下文。

在此之前,李飞飞、Jim Fan等学者在2026年7月发表的RoboTTT工作,首次系统性地将“上下文扩展”路线引入机器人视觉运动策略,为后续研究奠定了基础。

技术挑战:为何具身ICL比语言ICL更复杂

可可矩阵(COCO Matrix)创始人兼CEO高宇翔认为,具身ICL的难度主要体现在三个核心技术难点上。

首先是视觉理解的多层级需求。机器人在不同任务阶段需要不同粒度的信息:既要理解“这是什么”的语义层面,也要获取位置、深度、轮廓等与动作直接相关的空间信息。单一视觉编码器难以同时满足这些需求,这也是早期VLA需要拼接多个视觉模型的原因。

其次是多模态数据的失衡问题。触觉、听觉、本体感知等模态对机器人操作同样重要,但这些模态的数据规模远不及视觉和语言,难以支撑大规模的预训练对齐。

第三是Long Context与记忆机制的缺失。机器人执行连续任务时,需要判断历史信息中哪些与当前决策相关,并实现信息的压缩、筛选和长期保留。高宇翔指出,支撑机器人长时记忆的基础技术直到最近半年才开始出现明显进展。

流式记忆:超越固定窗口的思考

关于Long Context的理解,高宇翔提出了一个值得注意的观点:重点不在于将固定窗口从一分钟硬拉到十分钟,而在于建立一种流式记忆机制。真实机器人任务中,有效上下文可能仅有两三分钟,关键问题是当新信息不断进入时,模型能否持续筛选和压缩历史信息,保留真正有价值的经验。

在技术实现上,可可矩阵正从两个方向推进:一是提升模型对任务的理解能力,使其更清楚历史中哪些信息重要;二是对长时序产生的KV Cache进行压缩,借鉴大语言模型领域的Linear Attention、Sparse Attention等技术路线。高宇翔强调:“Long Context最后解决的并不是‘能塞进去多少东西’,而是有限的模型容量下,能不能一直保留和调用真正有用的历史经验。”

数据新缺口:人机交互数据的定义与采集

尽管ICL降低了对海量任务全覆盖数据的依赖,但数据问题并未消失,而是呈现出新的形态。高宇翔指出,当前最明显的缺口在于人机教学、实时纠偏和协同作业类数据。如果机器人要接受人的实时指导、在出错时被纠正,模型就需要大量类似的交互过程作为训练素材。

然而,行业对人机教学交互数据的定义和采集体系尚未成熟:手把手教学时哪些信息需要记录?纠错发生在哪个时间点?人的动作、语言与机器人反馈如何对齐?这些问题的标准化解决方案仍待探索。可可矩阵计划后续重点投入这类数据的定义与采集工作。

条件表征:理解物理世界的新思路

可可矩阵的核心技术路线被概括为“强理解,轻生成”。高宇翔认为,机器人动作生成的质量很大程度上取决于对物理世界的理解深度。

为此,团队开发了一套“条件表征”体系,即条件隐空间。与传统视觉表征中一帧图像对应固定Embedding不同,这种表征会根据任务条件和动作意图动态提取不同层级的信息。以抓取杯子为例:初始阶段更关注“这是不是杯子”的语义信息,而伸手抓取时则更关注位置、深度和空间关系。

目前,这套统一模型已在深度估计、分割、人体姿态等八、九类视觉任务上完成验证,部分任务能力接近上一代专用模型水平。

创业路径:从学术理想到产业实践

可可矩阵成立于2026年4月,联合创始人兼CEO高宇翔是一位有着独特背景的创业者:西安交大少年班出身,约翰斯·霍普金斯大学博士辍学,曾在傅利叶带队打通全尺寸人形机器人的完整技术链路。他在博士期间就开始思考ICL能否迁移到机器人领域,如今将这一学术问题转化为创业方向。

与Generalist AI、Skild AI不同,可可矩阵选择将后训练的ICL前置到预训练阶段,试图将上下文学习打造为具身智能的底层范式。高宇翔透露,核心团队到齐后不到一个月,团队已获得验证技术方案可行性的核心证据,目前正进入数据规模扩展阶段。

国内视角:具身智能赛道的差异化竞争

可可矩阵的探索也折射出国内具身智能创业生态的一个缩影。相比海外公司如Skild AI和Generalist AI在模型效果展示上的激进风格,国内团队更倾向于从底层技术架构出发构建差异化壁垒。可可矩阵选择将ICL前置到预训练阶段,而非直接复用大语言模型的后训练范式,显示出本土团队在技术路线选择上的独立思考。

值得注意的是,国内在具身智能数据采集和机器人硬件平台方面积累了较多产业链优势,这为类似可可矩阵这样的创业公司提供了相对完整的验证环境。随着人形机器人产业链的成熟,上下文学习这类算法创新与硬件能力的结合,可能成为国内团队实现弯道超车的机会窗口。

展望:具身ICL的边界与可能

具身ICL能否真正跑通,仍取决于一系列远未解决的技术问题:模型如何理解复杂的多模态上下文?示范、语言、历史动作和人的纠正如何被有效编码?这些问题既关乎算法设计,也涉及数据基础设施的建设。

但可以确定的是,具身智能的Scaling维度正在发生扩展——除了继续扩展模型参数、数据规模和任务覆盖,机器人在部署后能否持续学习、能否从示范和交互中快速获得新能力,正成为一个新的Scaling方向。这一转变的深远意义,或许不亚于GPT-3当年对NLP领域的冲击。

常见问题

什么是具身智能领域的上下文学习(ICL)?

具身ICL是指机器人通过观察任务演示(如视频示范),在不进行参数更新或微调的情况下,快速学会执行新任务的能力。这一概念源自大语言模型领域的In-Context Learning,但面对的是视觉、语言、动作等多模态复合上下文,技术挑战更大。

具身ICL与传统的VLA模型有何不同?

传统VLA模型依赖大规模任务数据训练,每个新任务通常需要重新采集数据并微调。而具身ICL强调模型的快速适应能力:给定一个示范,机器人就能在当前环境中完成任务,无需针对每个新任务进行完整的训练流程。

具身ICL面临哪些核心技术挑战?

主要挑战包括:视觉理解需要多层级信息但单一编码器难以覆盖、多模态数据规模失衡(触觉、听觉数据远少于视觉)、以及缺乏成熟的Long Context与记忆机制来支持连续任务的长期信息利用。

国内在具身ICL领域有哪些探索?

国内创业公司可可矩阵(COCO Matrix)正致力于将ICL作为具身智能的底层范式,其技术路线是将后训练ICL前置到预训练阶段,并开发“条件表征”体系以增强模型对物理世界的理解。团队已在多种视觉任务上验证了技术可行性。

为什么说具身智能需要新的Scaling路线?

传统路线依赖持续扩充数据期待模型涌现通用能力,但实际效果未达预期。同时具身数据本身难以规模化——遥操作数据质量不一、场景多样性有限。ICL提供了一种新思路:不必为每个新任务采集大量专项数据,而是通过提升模型的上下文利用能力来实现快速适应。

关于 Bingdada

Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。

编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com

© 2026 Bingdada. 保留所有权利。

Contents

  • 上下文学习:从语言模型到机器人的跨越
  • 行业信号:多家公司展示具身ICL能力
  • 技术挑战:为何具身ICL比语言ICL更复杂
  • 流式记忆:超越固定窗口的思考
  • 数据新缺口:人机交互数据的定义与采集
  • 条件表征:理解物理世界的新思路
  • 创业路径:从学术理想到产业实践
  • 国内视角:具身智能赛道的差异化竞争
  • 展望:具身ICL的边界与可能
  • 常见问题
  • 什么是具身智能领域的上下文学习(ICL)?
  • 具身ICL与传统的VLA模型有何不同?
  • 具身ICL面临哪些核心技术挑战?
  • 国内在具身ICL领域有哪些探索?
  • 为什么说具身智能需要新的Scaling路线?
  • 关于 Bingdada
FAQ
Premium Ad Space · Limited Time
Advertise with us

Put your brand in the reader feed

In-article ad slots: high-attention moments perfect for product launches and event recruitment.

Partnership

Tags

#具身智能#上下文学习#ICL#可可矩阵#机器人基础模型
bingdada

bingdada

SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

Related Posts

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号
AI人工智能

Google DeepMind 机器人加速器落地欧洲:具身智能从实验室走向物理世界的产业信号

Google DeepMind 在欧洲启动为期三个月的机器人加速器,支持 15 家具身智能初创企业,覆盖工业、医疗、建筑与海洋等场景,释放出物理 AI 从研究走向工程化落地的明确信号。

Sep 158 min read
从开源基座到真机实战:蚂蚁灵波如何用一场挑战赛撬动具身智能开发者生态
国产 AI 前线

从开源基座到真机实战:蚂蚁灵波如何用一场挑战赛撬动具身智能开发者生态

蚂蚁灵波联合魔搭社区、阿里云天池发起首届具身大模型挑战赛,以 LingBot-VLA 2.0 开源基座为核心,设置仿真初赛与上海真机黑客松决赛,面向全球开发者开放。

Sep 156 min read
从单一技能到通用基座:具身智能如何跨越规模化落地的鸿沟
国产 AI 前线

从单一技能到通用基座:具身智能如何跨越规模化落地的鸿沟

亮源新创连续发布 LightParkour、LightNav-0 和 Light REACT 三项技术,围绕规模化预训练、对齐与部署的三段范式,探索具身智能如何从单点技能走向可泛化的基础模型体系。

Sep 1415 min read

Subscribe to our Newsletter

Get the latest SEO & GEO insights.

We respect your privacy. You can unsubscribe at any time.

Comments ({count}) (0)

Sign in to join the discussion

Sign inSign up
No comments yet, be the first to comment