
Gemini Robotics ER 2 是 Google DeepMind 发布的具身推理模型,作为机器人的高层大脑,通过视频理解实现连续进度分类与时刻定位,支持多机器人协作与工具编排,显著提升了物理世界任务完成的鲁棒性与实时性。
当机器人不再只是被动执行编程指令,而是能通过实时视频“看懂”自己在做什么、下一步该做什么,这标志着物理世界自动化进入了一个全新的阶段。近期,Google DeepMind 团队发布的 Gemini Robotics ER 2 模型,正是朝着这个方向迈出的关键一步。它不再仅仅是一个视觉-语言模型,而是一个为机器人设计的“高层大脑”,负责思考、规划和协调,而将具体的运动控制交给底层的视觉-语言-动作(VLA)模型。
这种架构上的分离,解决了机器人领域一个长期存在的痛点:高层逻辑推理与低层运动控制在时间尺度上的不匹配。传统的“感知-规划-执行”流水线往往存在明显的延迟,导致机器人动作僵硬、反应迟缓。Gemini Robotics ER 2 的设计初衷,就是让机器人能够在执行动作的同时进行“思考”,实现思考与行动的同步。
Gemini Robotics ER 2 相较于前代 ER 1.6 的提升,主要体现在两个维度:时间智能(Temporal Intelligence) 和 多智能体协作(Multi-Robot Collaboration)。
在复杂的物理任务中,机器人最困难的事情之一是判断“任务是否已经完成”。例如,拧紧灯泡或系紧垃圾袋,这些动作的完成标准很难用简单的规则定义。Gemini Robotics ER 2 通过引入“连续进度分类”机制,能够将视频流中的每一帧划分为 0-20%、20-40% 等五个进度等级。这种量化任务进度的方法,赋予了机器人实时态势感知能力。根据 Google DeepMind 公布的数据,该模型在进度分类任务上的准确率达到了 57.4%,显著超越了前代产品和市场上的其他前沿模型。
这项能力的价值在于,它允许机器人在任务执行过程中进行动态调整。如果某个步骤失败了,机器人可以精准地定位到失败点进行重试,而无需从头开始整个流程,这极大地提升了任务执行的鲁棒性。
除了判断进度,机器人还需要识别任务中的“关键时刻”,例如倒咖啡时何时停止。Gemini Robotics ER 2 在“时刻定位”能力上取得了显著进展,它能够精确识别视频流中关键事件发生的具体帧。这意味着机器人可以在正确的时机切换任务、验证操作是否成功,并给出下一步的纠正建议。这种对时间维度的精准把握,是机器人从“自动化工具”走向“自主智能体”的关键能力。
Gemini Robotics ER 2 引入了多机器人协作能力,允许不同的机器人在共享空间中协同工作,完成单个机器人无法独立完成的复杂工作流程。这不仅仅是简单的通信,而是涉及任务分配、路径规划和动作协调的复杂系统工程。例如,在一个仓库场景中,一个机器人负责搬运货架,另一个机器人负责拣选商品,Gemini Robotics ER 2 需要实时协调两者的行动,避免冲突并优化整体效率。
在工具调用方面,Gemini Robotics ER 2 可以原生调用 Google Search 等工具来获取外部信息,或者调用用户自定义的函数。开发者可以将低层控制接口(如 VLA 模型或导航 API)声明为工具,并将多模态视频、音频或文本流直接输入模型。这种设计使得 Gemini Robotics ER 2 成为一个强大的“任务编排器”,而非仅仅是一个单一的模型。
为了验证模型的真实性能,Google DeepMind 团队在模拟环境和真实世界控制中进行了评估,甚至包括人类远程操控模式。结果显示,Gemini Robotics ER 2 在真实 VLA、模拟 VLA 和人类遥操作三种控制模式下,工具编排性能均持续优于 ER 1.6。
一个值得关注的细节是,Gemini Robotics ER 2 集成了 Gemini Live API,使用针对延迟敏感任务优化的双向流式端点。这种设计消除了机器人执行任务时常见的“停顿思考”现象,实现了流畅的连续动作编排。Google 与波士顿动力(Boston Dynamics)合作,使用 Gemini Robotics ER 2 编排 Spot 机器人的 API,实现了通过自然语言指令让 Spot 机器人取回物品的演示,相关代码已在 GitHub 上开源。
目前,开发者可以通过 Gemini API、Google AI Studio 以及 Gemini Enterprise Agent Platform 的私有预览版访问该模型。
Gemini Robotics ER 2 的发布,再次将“具身智能”这一概念推向聚光灯下。在国内,这一赛道同样竞争激烈。百度文心一言、阿里通义千问等大模型厂商,以及 DeepSeek、智谱 GLM 等创业公司,都在积极探索大模型与机器人硬件的结合。
与 Google DeepMind 的“通用大脑”路线不同,国内企业更倾向于软硬一体化的垂直整合。例如,一些厂商专注于特定场景(如仓储物流、家庭服务)的端到端解决方案,强调数据闭环和场景落地。虽然在大规模通用模型的基础研究上可能存在差距,但国内在应用场景的丰富度、供应链的完整性以及工程化落地速度上具有独特优势。未来,通用大模型能力与垂直场景深耕的结合,将是决定这场竞赛胜负的关键。
对于开发者而言,Gemini Robotics ER 2 的开放 API 降低了开发物理 AI 智能体的门槛。但值得注意的是,将这样的模型部署到实际生产环境中,仍然面临数据安全、实时性、硬件适配等多重挑战。
Gemini Robotics ER 2 的发布,是 Google DeepMind 在具身智能领域的一次重要技术升级。它通过强化视频理解、任务编排和多机器人协作,让机器人向“在物理世界中更有帮助”的目标迈进了一大步。尽管距离通用机器人智能还有很长的路要走,但这类“高层大脑”模型的成熟,正在加速机器人从专用工具向通用助手演进。
随着模型能力的持续提升和开源生态的繁荣,我们有理由相信,物理世界的自动化将迎来一个加速发展的黄金时期。
Gemini Robotics ER 2 并不是一个直接输出电机指令的 VLA 模型,而是一个“高层大脑”。它负责感知环境、进行多步任务规划、并通过工具调用的方式指挥底层的 VLA 模型或 API 去执行具体的动作。这种分离架构让高层推理不再受限于低层控制的频率,实现了更灵活的编排。
开发者可以通过 Gemini API、Google AI Studio 以及 Gemini Enterprise Agent Platform(私有预览版)来访问 Gemini Robotics ER 2。Google 官方提供了配置示例和提示词示例,帮助开发者快速上手构建物理 AI 智能体。
Gemini Robotics ER 2 在连续进度分类任务上达到了 57.4% 的准确率,显著优于前代 ER 1.6 和其他竞争模型。它能够将视频帧划分为五个进度等级,使机器人具备实时态势感知和动态纠错能力。
Gemini Robotics ER 2 通过原生调用工具和 API,能够协调多个机器人在共享空间中的行动。它负责任务分配和时序编排,而各个机器人则将自身的控制接口作为工具提供给模型调用。
Bingdada 是一个专注 SEO、GEO(生成式引擎优化)与 AEO(答案引擎优化)的内容平台,由资深内容编辑、SEO 技术工程师与 AI 研究专家组成的团队持续运营。我们追踪搜索引擎与生成式 AI 的最新动态,为读者提供准确、实用、可落地的方法论与行业洞察。
编辑团队:内容策划 · 技术编辑 · AI 研究组
网站:bingdada.com
© 2026 Bingdada. 保留所有权利。
SEO & GEO 技术探索者,专注于搜索引擎优化和生成式引擎优化。

全球AI产业正经历深刻变革:英伟达芯片涨价推高算力成本,资本重注具身智能与垂直应用,企业战略加速调整。从芯片到机器人,从平台去中心化到巨头加码,一场围绕AI基础设施的竞赛正在白热化,重塑产业格局。

Google DeepMind 发布轻量级网络安全模型 Gemini 3.5 Flash Cyber,通过低成本高频扫描重塑漏洞发现模式。实测在 Chrome 等复杂代码库中表现优异,初期仅向政府与受信任伙伴开放,为防御者争取宝贵时间窗口。

昆仑行创始人任庚接受专访,详解具身智能的量产逻辑、软硬一体路线选择,以及对车企跨界、行业派系、融资速度等热点话题的犀利观点。
최신 SEO·GEO 정보를 받아보세요.
개인정보를 존중합니다. 언제든 구독을 취소할 수 있습니다.