AI AI工具情报站
模型动态X:Google DeepMind (@GoogleDeepMind)

Google DeepMind 发布 Gemini Robotics 2 物理 AI

📰 X:Google DeepMind (@GoogleDeepMind)📅 2026-07-30T15:02:00.000Z

核心亮点

Google DeepMind 正式发布 Gemini Robotics 2,把「One brain. For any robot.」变成可落地的产品主张。这一代核心是把世界知识与动作执行打通,让同一个「大脑」驱动形态各异的机器人,而不必为每台机器重训控制策略。说白了,DeepMind 想做机器人领域的「通用操作系统」——厂商造硬件,Gemini 负责让它动起来、做对事。

具体能力

在仿人机器人上,Gemini Robotics 2 主打全身智能:头部、躯干、双臂、双腿协同完成任务,而非仅靠机械臂末端。高级灵巧性让它处理柔软、易碎或形状不规则的物体,比如轻放水果、用指尖捏纸。多机器人团队协作则让多台机器共享环境理解、分工或接力长任务,把单台能力扩展成可编排的「机器班组」。

技术细节

技术上它延续视觉-语言-动作(VLA)路线,把 Gemini 的世界知识与机器人感知、运动控制对齐到同一框架。它强调跨本体泛化,一个形态上学到的技能可较快迁移到另一形态,降低新硬件接入成本。模型在真实与仿真混合数据上训练,弥补真实数据采集昂贵的短板,并把安全约束内置到决策链路,执行前先过边界检查。

与竞品对比

相比同走 VLA 路线的方案,它的卖点是「一个大脑适配多种机器人」的通用性,加上 Gemini 带来的强常识与世界知识。对比只服务单一机械臂或厂牌的方案,野心更大。不过通用也意味着极端精细的工业场景可能仍需微调。简单说,它更适合快速铺开、跨机型统一的场景,而非对单一动作精度要求到极致的小众产线。

行业影响

对厂商而言,它降低了「让硬件真正智能」的门槛:与其花几年自研控制与感知栈,不如接入成熟大脑。对仓储、制造、家庭服务等需多机协同的场景,可编排机器班组有望提升吞吐与灵活性。说白了,当「机器人智能」成为按需调用的能力,硬件公司竞争焦点会转向本体设计与成本,这或是物理 AI 规模化的关键一步。