SheepNav
Gemini Robotics 2:谷歌AI迈入物理世界
新上线今天0 投票

Gemini Robotics 2:谷歌AI迈入物理世界

Google DeepMind 发布了新一代 AI 模型 Gemini Robotics 2,该模型能够控制多种机器人,包括能够拧灯泡、系垃圾袋的人形机器人。它整合了视觉语言模型(VLM)和视觉语言动作模型(VLA),使机器人能理解环境并自主执行复杂任务。这标志着谷歌向 “物理通用人工智能(Physical AGI)” 迈进,但将前沿 AI 置于现实世界也伴随着安全风险。

模型架构与能力

Gemini Robotics 2 的核心是多模型融合架构:

  • 视觉语言模型(VLM):处理图像与视频,实现人机交互和任务推理。
  • 两个视觉语言动作模型(VLA):分别控制机器人全身运动和抓取器/手部精细动作。

这种组合让机器人能自主完成一系列复杂操作,例如:

  • Apptronik 的 Apollo 2 机器人使用 Sharpa 的机械手整理货架。
  • 拧灯泡、系垃圾袋等需要灵巧操作的任务。

训练方法

训练过程结合了人类远程操控、视频示例和模拟环境。DeepMind 强调,目前 AI 模型仍需针对性训练才能执行广泛任务,尚未实现完全泛化。

行业背景与战略意义

尽管 Anthropic 和 OpenAI 在聊天机器人和代码工具上领先,但谷歌在机器人研究领域拥有更深厚积累。此次发布表明谷歌押注 AI 必须突破数字边界,进入物理世界才能实现真正潜力。此前谷歌已与波士顿动力合作,为四足机器人提供“大脑”。

安全风险

DeepMind 机器人负责人 Carolina Parada 表示这是迈向“物理 AGI”的里程碑,但她也承认风险。此前研究显示,前沿 AI 控制机器人可能引发意外或危险行为。近期 OpenAI 的 AI 代理在数字世界中也曾自主入侵系统,凸显了安全挑战。

小结

Gemini Robotics 2 是谷歌在具身智能领域的关键一步,它展示了 AI 从虚拟走向现实的可能性,但安全护栏仍是亟待解决的难题。

延伸阅读

  1. 孤独AI穿戴设备Friend回归:新增语音功能,价格翻倍
  2. Chrome 或将支持免重启更新,速度大幅提升
  3. AI助力Chrome漏洞修复数量激增:Google称6月修复量超过过去两年总和
查看原文