Gemini Robotics ER 2: 用视频理解、任务协调和多机器人协作赋能机器人技术

发布于

# Gemini Robotics ER 2

## 推出 Gemini Robotics ER 2

2026年7月30日

Gemini Robotics ER 2 代表了一次机器人技术的重大飞跃,旨在通过视频理解、任务协调和多机器人协作,使机器人在现实世界中更有用。

![两个机器人: Duo 和 Apollo](https://storage.googleapis.com/gweb-uniblog-publish-prod/images/gemini-robotics-2__blog__cover.width-2200.format-webp.webp)

我们推出的 Gemini Robotics ER 2 是一个新模型,旨在为机器人提供高阶大脑。它支持实时空间推理、多步骤任务规划以及不同机器人之间的协作。你可以通过 Gemini API、Google AI Studio 或 Gemini 企业代理平台访问这个模型,开始构建你自己的物理 AI 代理。

### 物理代理能力的提升

大多数物理世界中的任务都复杂且需要多个步骤来完成。Gemini Robotics ER 2 是一个物理代理,能够协调机器人的步骤,使其能够自我纠正,并适应更为新颖的情况。开发者可以将低级控制接口(如视觉-语言-行动 (VLA) 模型或导航 API)声明为工具,并直接将多模态的视频、音频或文本流输入模型。

Gemini Robotics ER 2 改进了该工具协调的工作流程,能够在仿真中、使用现实世界机器人控制中评估其性能,甚至可以与远程控制机器人的人类配合使用。

### 解锁时间智能以确保任务完成

机器人面临的一个最大挑战是知道何时任务完成。Gemini Robotics ER 2 在视频理解和进度跟踪方面带来了突破,确保复杂任务(如紧固灯泡或系垃圾袋)完成符合规范后再切换到下一个任务。

在这个更新中,我们在两个基础能力上取得了进展:进度分类和时刻发现。

#### 进度分类

进度分类是指机器人跟踪任务完成过程的能力。在我们的评估中,我们将视频流中的每一帧分为五个进度级别(0-20%、20-40%、40-60%、60-80%、80-100%)。通过量化任务进度,Gemini Robotics ER 2 为机器人提供了实时的情境意识,使其能够实时调整动作或重试失败的步骤,而无需重新开始整个工作流程。

#### 精确时刻发现

时刻发现是指模型识别关键事件发生的确切视频帧的能力(即何时停止往杯子里倒咖啡)。Gemini Robotics ER 2 在时刻发现的性能上取得了显著提升,使机器人能够精确切换任务、验证成功并建议调整。

### 多机器人协作

没有哪一台机器人适用于所有任务——轮式机器人适合室内环境,而人形机器人可能在不平坦的地形中更具优势。Gemini Robotics 2 可以实现多机器人协作,让不同类型的机器通过共享的语义理解进行沟通,以交接并完成复杂任务。

为了帮助你开始使用,我们分享了 [示例](https://github.com/google-gemini/robotics-samples/blob/main/Getting%20Started/gemini_robotics_er.ipynb),展示如何配置该模型并提示其完成更有用的物理 AI 任务。

在安全性方面,Gemini Robotics ER 2 是我们最安全的模型,在安全指令执行和人类接近度基准测试方面取得了显著进步,这些测试评估模型在推理任务中的物理约束遵循情况及其对人类的空间意识。我们的发现表明,Gemini Robotics ER 2 能够在接近人类时成功停止人形机器人,并且在区域清空后再自动恢复工作。

展望未来,我们计划将这些模型推向更复杂的任务,加速有用机器人的开发,支持机器人社区。

---

原文链接:[点击查看](https://deepmind.google/blog/gemini-robotics-er-2-powering-robotics-with-video-understanding-task-orchestration-and-multi-robot-collaboration/)

评论

暂无评论。

0.074458s