为何"机动控制"通用机器人的"十进制"必须同时完成两个截然不同的工作.
他们需要读取一个杂乱无章的全室视觉场景,在记忆中持有一个多分钟的计划,并与一个人相会——在同一瞬间,关闭一个高频控制回路,保持平衡的人体平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平平 将这两个工作压缩成单一的端对端网络力量不适的取舍:你想要用于推理的大上下文窗口与你需要的去扭矩控制的低潜相抗衡. 2026年7月28日,Google DeepMind与双子机器人2直接推向了这一取舍,后于7月30日由双子机器人ER
2.
套房不是单一的网络,而是将问题分成三个专业模式——全体视觉语言动作控制(VLA),高层次的内含推理,以及站台适应——每个模式都调取出不同的自律和上下文大小.
在最近的机器人学和VLA研究中,在arXiv机器人列表和Hugging Face Papers上都可以看到同样的模块思维,在这些研究中分解的感知-规划-控制堆栈已经成为了反复出现的模式.
理解DeepMind的具体分裂 澄清了为什么这个架构变得牵引。
三模分解ER2:高层次任务理性双子机器人ER2是堆积器的认知规划器.
这是一个为体现推理而构建的视觉语言模型:它吸收了现场摄像头的摄像头和自然语言的教学,然后将一项可能花上几分钟时间完成的任务分解成结构化的次级目标。
除了规划外,ER 2管理与人类上司的对话,解释空间背景,并协调多个在共享工作空间运行的机器人——决定将哪个子任务交给哪个平台.
运行比控制层慢(大约每秒几回),ER 2为上下文宽度进行交易.
这种分离很重要:一个推理模型能够承受一个大上下文窗口和小心前进的传递,因为它没有走上关键的100赫兹平衡控制路径.
双子机器人2:全博迪VLA控制器 如果ER 2决定了该怎么做,双子机器人2决定了硬件如何移动.
作为视觉-语言-动作(VLA)模型,它驱动双臂操纵器和完整的人形体的运动控制,从脚到指尖.
模型用精细的操纵来统一动态平衡.
它为全身动作产生出轨迹,如蹲下,行走,和通航的杂乱空间等.
对于物理交互,它控制着一系列的终极效应器:五指取出22度自由(DoF)的手来完成捆绑结等微妙任务,并配有双指取出来进行精确的包装和放置.
On-Device 2: 在边缘运行的快速嵌入适应,双子机器人On-Device 2是一款高效的VLA变体,可直接在机器人硬件上进行局部执行.
它的工作是低纬度的闭路控制外加对硬件变异的调整——这是问题中最敏感于每机器人动能突起的部分.
DeepMind报告说,On-Device 2可以适应新的机器人化身,只有几个小时的操作数据,不到200个演示实例.
这种低射能力瞄准了物理AI中的一个真正的瓶颈:重新将精细控制政策瞄准新的动能学,而不为每一个新的形态学收集巨大的演示数据集.
执行循环 A 物理目标需要连续交接所有三层.
考虑一个用户指示人造物清除一个杂乱的工作空间并包装项目:目标规划-ER 2读取相机流,分析场景,将多分分钟的任务分解成独立的分目标,并指定它们.
行动调度 - ER 2将结构化的意向目标传递给双子机器人
2.
轨迹生成 - 双子机器人2将子目标转化为协调的联合控制,平衡行走稳定性与操纵者po