Gemini Robotics-ER 1.6:通过增强的具身推理赋能现实世界的机器人任务

发布于

### Gemini Robotics-ER 1.6:通过增强的具身推理赋能现实世界的机器人任务

在我们的日常生活和工业中,机器人不仅仅是遵循指令,还需要能够对物理世界进行推理。引入全新的 **[Gemini Robotics-ER 1.6](https://deepmind.google/models/gemini-robotics/)**,这是一项显著的升级,它使机器人能够以无与伦比的精度理解其环境。通过提高空间推理和多视图理解,我们正在为下一代物理代理带来新的自主性。

#### 主要特点:
- **推理能力**:专注于视觉和空间理解、任务规划与成功检测等与机器人相关的推理能力。它作为机器人的高层推理模型,可以通过原生调用工具(如 Google 搜索)来寻找信息。
- **性能提升**:与 **[Gemini Robotics-ER 1.5](https://developers.googleblog.com/building-the-next-generation-of-physical-agents-with-gemini-robotics-er-15/)** 和 **[Gemini 3.0 Flash](https://blog.google/products-and-platforms/products/gemini/gemini-3-flash/)** 相比,ER 1.6在指向、计数和成功检测方面的空间和物理推理能力有了显著提升。我们还解锁了新的能力:**仪器读取**,使机器人能够读取复杂的表盘和视镜。

今天,开发者可以通过 **[Gemini API](https://ai.google.dev/gemini-api/docs/robotics-overview)** 和 **[Google AI Studio](https://aistudio.google.com/prompts/new_chat?model=gemini-robotics-er-1.6-preview)** 开始使用 Gemini Robotics-ER 1.6,我们还分享了一个开发者 **[Colab](https://github.com/google-gemini/robotics-samples/blob/main/Getting%20Started/gemini_robotics_er.ipynb)**,并包含了如何配置模型和提示具身推理任务的示例。

#### 成功检测:自主性的引擎
在机器人领域,知道任务何时完成与如何开始同样重要。成功检测是自主性的基石,让智能代理在失败后选择重试还是按照计划继续进行。

**Gemini Robotics-ER 1.6** 提高了多视图推理,使系统能够更好地理解多个摄像头流和它们之间的关系,即使在动态或遮挡的环境中。

#### 仪器读取:现实世界的视觉推理
此任务源于设施检查的需求,尤其是在与 **Boston Dynamics** 的合作中产生。**Gemini Robotics-ER 1.6** 使机器人能够解读多种仪器,包括压力表、水平指示器和现代数字读数。其通过 **[agentic vision](https://blog.google/innovation-and-ai/technology/developers-tools/agentic-vision-gemini-3-flash/)**,结合视觉推理与代码执行,实现了高度精确的仪器读取。

### 安全性:我们的最安全机器人模式
**Gemini Robotics-ER 1.6** 是迄今为止我们最安全的机器人模型,对抗性空间推理任务的合规性远超以往产品。此模型在遵循物理安全约束的能力上也显著提升。

我们期待与大家合作,共同提高机器人具身推理的能力。如果现有功能对您的特定应用有限,欢迎您通过**[此表单](https://forms.gle/a5jRuga5VmnCeQCk9)**提交标记图像,帮助我们构建更稳健的推理功能。

试用 **[Gemini Robotics-ER 1.6](https://aistudio.google.com/prompts/new_chat?model=gemini-robotics-er-1.6-preview)** 现在就加入 Google AI Studio!

---

原文链接:[点击查看](https://deepmind.google/blog/gemini-robotics-er-1-6/)

评论

暂无评论。