
新上线今天0 投票
Gemini Robotics 2:谷歌AI迈入物理世界
Google DeepMind 发布了新一代 AI 模型 Gemini Robotics 2,该模型能够控制多种机器人,包括能够拧灯泡、系垃圾袋的人形机器人。它整合了视觉语言模型(VLM)和视觉语言动作模型(VLA),使机器人能理解环境并自主执行复杂任务。这标志着谷歌向 “物理通用人工智能(Physical AGI)” 迈进,但将前沿 AI 置于现实世界也伴随着安全风险。
模型架构与能力
Gemini Robotics 2 的核心是多模型融合架构:
- 视觉语言模型(VLM):处理图像与视频,实现人机交互和任务推理。
- 两个视觉语言动作模型(VLA):分别控制机器人全身运动和抓取器/手部精细动作。
这种组合让机器人能自主完成一系列复杂操作,例如:
- Apptronik 的 Apollo 2 机器人使用 Sharpa 的机械手整理货架。
- 拧灯泡、系垃圾袋等需要灵巧操作的任务。
训练方法
训练过程结合了人类远程操控、视频示例和模拟环境。DeepMind 强调,目前 AI 模型仍需针对性训练才能执行广泛任务,尚未实现完全泛化。
行业背景与战略意义
尽管 Anthropic 和 OpenAI 在聊天机器人和代码工具上领先,但谷歌在机器人研究领域拥有更深厚积累。此次发布表明谷歌押注 AI 必须突破数字边界,进入物理世界才能实现真正潜力。此前谷歌已与波士顿动力合作,为四足机器人提供“大脑”。
安全风险
DeepMind 机器人负责人 Carolina Parada 表示这是迈向“物理 AGI”的里程碑,但她也承认风险。此前研究显示,前沿 AI 控制机器人可能引发意外或危险行为。近期 OpenAI 的 AI 代理在数字世界中也曾自主入侵系统,凸显了安全挑战。
小结
Gemini Robotics 2 是谷歌在具身智能领域的关键一步,它展示了 AI 从虚拟走向现实的可能性,但安全护栏仍是亟待解决的难题。
