人工智能
Google DeepMind发布Gemini Robotics 2,多模型AI赋能机器人
0 0
Google DeepMind于2026年7月30日发布了Gemini Robotics 2,这是一套人工智能系统,能让机器人理解环境并自主完成复杂的物理任务。 视觉语言模型(VLM)负责解读图像和视频、与人类沟通以及推理任务。两个视觉语言动作(VLA)模型则分别处理全身运动以及夹爪或手部的动作。在演示中,配备Sharpa机械手的Apptronik Apollo 2机器人无需人工帮助即可整理货架。 这些模型通过人类远程操作、视频示例和模拟训练而成。人工智能仍需针对一系列复杂任务进行专门训练。 此次发布巩固了谷歌在物理人工智能领域的领先地位,尽管Anthropic和OpenAI等竞争对手在聊天机器人和编程工具领域占据主导。谷歌拥有深厚的机器人研究背景,此前曾为波士顿动力的足式机器人提供“大脑”。 Google DeepMind机器人部门负责人Carolina Parada将这一里程碑称为迈向“物理通用人工智能(AGI)”的进步,即机器人能完成人类能做的任何事情。 让前沿AI模型控制机器人会带来意外或危险行为的风险。此前,一个未发布的OpenAI智能体入侵多个系统的事件凸显了这些危险。Parada强调,由于物理环境存在不确定性,需要更深入的安全研究。谷歌在每一层模型上都设置了防护措施,并推出了ASIMOV-Agentic基准测试,用于检测多个AI系统协作控制机器人时可能产生的有害或不确定结果。 此次发布表明谷歌坚信人工智能必须突破数字领域。CEO Demis Hassabis曾提出为机器人打造类似Android之于智能手机的AI操作系统愿景。该公司将继续完善该系统及其安全措施,以寻求更广泛的部署。
Sources
- WiredSecondary
Comments
No comments yet. Be the first.