A Survey of Embodied Learning for Object-Centric Robotic Manipulation
1. Intro
两大研究目标
- 机器人操作学习问题进行形式化表述,把现有各类研究整合为一套统一连贯的理论框架。
- 梳理迄今为止机器人操作学习领域具有代表性的一部分研究工作。
2. Common Concepts in Learning for Manipulation
2.1 Manipulations as Physical Systems
遵循物理约束,物体不能穿模,并且需要考虑重力等因素。
2.2 Underactuation, Nonholonomic Constraints, and Modes in Manipulations
欠驱动:环境内物体具有独立状态变量,但它们不属于机器人的动作空间。
2.3 Interactive Perception and Verification
通过交互验证或更新物体的隐藏状态。
2.4 Hierarchical Task Decompositions and Skill Reusability
子问题拆解;底层技能作为基元。把一类相似任务的集合称为任务族。
2.5 Object-Centric Generalization
2.6 Discovering Novel Concepts and Structures
3. Formalizing Manipulation Learning Tasks
3.1 单任务:马尔可夫决策过程
机器人学习问题通常可建模为一个马尔可夫决策过程(MDP):
其中:
- :状态空间;
- :动作空间;
- :奖励函数,表示在状态 执行动作 、转移到 时得到的即时奖励;
- :转移函数,给出在 执行 后到达 的概率分布;
- :折扣因子。
学习目标是找到控制策略 ,以最大化未来奖励的折扣和:
真实机器人常具有部分可观测性,因此 POMDP 更精确;但其学习与求解难度较高,论文以 MDP 作为主要形式化工具。
3.2 任务族与奖励分解
单个 MDP 不足以描述操作学习中的泛化需求。论文将**任务族(task family)**定义为 MDP 上的一个分布 :每个 MDP 对应一项具体任务,例如每一扇不同的门都可视为“开门”任务族中的一个实例。
第 个任务的奖励函数分解为:
其中 是第 项任务专属的目标奖励; 是机器人相关、在整个任务族中共享的背景代价,例如时间、能耗或碰撞风险。
3.3 状态与对象中心分解
第 个任务的状态空间为:
其中 是机器人自身状态, 是环境状态;后者可以是原始像素、传感器读数,也可以是经预处理的任务相关变量。
将环境表示为一组物体状态时,可进一步写为:
其中 表示通用环境状态, 表示第 个任务中第 个相关物体的状态, 为相关物体数量。该分解支持对象中心泛化:关于单个对象或小对象集合学习到的模型、策略可以复用于新的场景。
命题(如 CupOnTable = True)和谓词(如 On(Cup, Table) = True)表示具有模块化特点:机器人可只选择当前任务所需的符号子集;其中谓词还可以直接表达跨对象的泛化。
3.4 模态与守卫区域
操作任务可视为混合系统。每段连续的子动力学系统称为一个模态(mode):同一模态内状态随时间连续变化,但跨模态时动力学规则会跳变。机器人操作中的模态切换通常由接触建立或断开引起,因此即使很小的位置误差,也可能导致完全不同的操作结果。
当机器人进入特定的状态集合——守卫区域(guard region)——时,就会触发模态切换。常见例子包括:
- 机械臂末端接触盒子:无接触模态 机器人—盒子接触模态;
- 盒子接触墙面:机器人—盒子接触模态 盒子—墙面接触模态;
- 机械臂后撤、离开盒子:接触模态 无接触模态。
因此,执行技能时不仅要预测连续运动,还应监测是否发生了预期之外的接触或模式切换。
3.5 Option:高层技能表示
动作空间也可以具有层级结构。论文采用 options 框架,将一项高层运动技能表示为:
其中:
- :启动集合(initiation set),表示哪些状态允许执行该技能;
- :终止条件(termination condition),表示到达状态 后技能停止的概率;
- :option 策略,根据当前状态输出低层控制动作的策略,将启动集合内的状态映射为底层电机动作,对应具体的运动技能控制器。
例如“开门”技能可写为一个 option:
- :机器人位于门前且能够接触门把手
- :在接近、抓握和拉开等不同阶段选择相应动作
- :门已经打开,或执行条件不再满足
options 将长动作序列封装为可调用、可复用的技能,使高层决策可以在“抓取”“开门”等时间抽象动作之间选择,而低层策略负责连续控制。
3.6 上下文向量与完整任务定义
不同任务的状态空间、目标和动力学可能不同。论文使用上下文向量 表示任务内保持不变、但跨任务会变化的属性,例如门的重量、尺寸或蔬菜的材质。这些属性不属于运行中变化的状态,却是策略适配新任务所需的信息。
因此,完整的任务族中第 项任务可写为:
其中动作空间 在任务族内共享,可同时包含低层原子动作与高层 options;上下文也可按对象分解,使策略与模型根据不同对象的固定属性进行适配。
4. Learning Object and Environment Representations
要学习转移模型、技能策略以及技能的前后条件,机器人首先需要能够表示自己所处的环境和正在操作的对象。本节的核心问题是:如何将原始传感器输入组织为可用于控制与泛化的对象中心状态表示。
4.1 对象表征
物理环境可分解为一组对象,每个对象由若干特征或属性描述,例如位姿、形状、质量、材料与运动约束。先进行对象分割、再估计对象属性,能够得到模块化表征,从而让技能在相似对象之间复用。
对象属性的变化可按其是否在一次任务执行中改变来区分:
- 任务内变化属于状态。例如抓取任务中杯子的位置会随机器人动作改变。
- 跨任务变化属于上下文。例如同一任务族中的杯子形状、尺寸或材质在某一任务中固定,却会在另一任务中改变。
泛化的操作技能通常必须同时适配这两种变化:取放技能既要跟踪物体当前位姿,又要适应不同物体的形状。
4.1.1 常见对象变化
论文将操作中常见的变化概括为:
- 位姿:最常见的变化;可操作物体的位姿通常是状态,而擦拭台面的高度等在一次任务中不变的量可作为上下文。
- 形状:关节物体、可变形物体和可分割物体会在任务内改变形状;刚体外形也可能在不同任务间不同。
- 材料与动力学属性:质量、刚度、摩擦和材质会显著影响操作结果,通常作为跨任务的上下文。
- 交互与约束:机器人—对象、对象—对象之间的相对位姿、接触、铰链与约束会随操作发生变化,并常与模态切换相关。
4.1.2 对象表征层次
对象模型可按照抽象程度分为点、部件和对象三个层次。层次越低,几何细节越充分;层次越高,语义抽象和跨对象泛化越容易。
- 点层表征:像素、点云与体素等。它能保留精确形状与局部接触信息,适于使用关键点、非刚性配准或几何变形建立跨实例对应关系。
- 部件层表征:由连续点集组成,关注可操作部件,例如杯把、容器开口、工具尖端。不同类别的对象可能含有功能相似的部件,因此部件层特别适于按可供性迁移技能。
- 对象层表征:描述物体整体的位姿、质量、形状、材料、类别及其关系。机器人通常选择“操作哪个对象”,而不是选择单个像素,因此这一层更适于任务规划。
不必总是识别场景内的每个物体。例如在避障时,将杂乱背景统一表示为障碍物可能比逐个识别更高效、更鲁棒。
4.2 被动感知与交互式感知
**被动感知(passive perception)**是不通过物理交互来观察环境,例如从图像中识别和定位物体。移动相机以获得更好视角仍属于被动感知,因为机器人没有对环境施加作用。
**交互式感知(interactive perception)**则是主动改变环境来获得信息,例如推物体判断其约束、提起物体估计重量,或通过触觉判断接触状态。机器人可以结合视觉、触觉、力觉、听觉等多种模态观察交互结果。
交互式感知需要时间、能量并可能带来风险,但可揭示被动观测难以确定的潜在属性。例如,仅靠图像难以判断两个物体是刚性连接还是恰好接触;施加一个小推力后即可区分两种情况。
4.2.1 主动选择信息性动作
不同探索动作带来的信息不同。机器人可以估计环境变量的不确定性,并选择最大化熵下降、信息增益或互信息的动作。比如判断容器中是否有物品时,摇晃通常比推一下更有信息量。
交互结果还能作为自监督信号:机器人先通过交互得到较可靠的属性标签,再学习用被动视觉预测该属性。例如先称量一批物体的质量,再由图像学习质量估计器。
4.3 学习对象及其属性
4.3.1 对象发现
对象发现本质上是将场景分割为不同对象的问题。仅凭视觉,彼此靠近或相互遮挡的物体可能难以区分;此时机器人可维持“两个区域是否属于同一对象”的概率信念,并利用改变视角或轻微交互消除歧义。
4.3.2 发现自由度
识别对象后,机器人还需要确定其运动学自由度。例如门是绕轴旋转、抽屉沿轨道平移,还是两个物体根本没有机械连接。关节类型及其参数共同定义对象状态空间和可行运动约束;机器人可从观察到的人类动作中估计它们,也可通过主动推拉更快辨识。
4.3.3 估计对象属性
机器人应先判断对象类别或可供性,例如“容器”“可抓取”“可堆叠”,再估计与交互有关的属性。视觉适合估计位置、形状和外观材料;触觉与探索动作通常能更准确地估计摩擦、质量、质心、硬度、内部内容等动力学属性。
4.4 特征学习与选择
环境中大量对象属性和传感器信号都与当前任务无关。例如拧瓶盖时,瓶盖尺寸可能重要,远处椅子的颜色则不重要。选择相关特征能降低学习难度,并提高面对无关变化时的鲁棒性与泛化能力。
- 无监督学习:降维可提取相关结构、滤除噪声;聚类可发现相似对象、操作效果或状态区域。
- 监督与任务驱动学习:决策树、神经网络等可在学习模型或策略的同时发现有用特征。卷积、空间 softmax、自动编码器和分割掩码等结构先验有助于从高维视觉输入中提取控制相关表示。
- 多模态表示:深度模型可联合视觉、触觉、力觉以及语言指令,使被动与交互式信息互补。
本节的关键结论是:优秀的对象表征不只是“识别物体是什么”,还应保留能预测交互结果、选择技能和泛化到新对象的属性与关系。
5. Learning Transition Models
操作的目标是改变环境中对象的状态,因此机器人需要学习动作如何引起状态变化。转移模型既可用于预测单步结果,也可反复调用以预测长时程后果,从而支持规划、模型预测控制和安全评估。
5.1 转移模型的表示与学习
对于任务族,转移模型可以是确定性的:
也可以是给定当前状态和动作后,对下一状态的随机分布:
若对象属性会影响动力学,模型还应以任务上下文为条件,即学习 。例如,推同样形状但质量不同的物体时,预测结果应随质量这一上下文而变化。
5.1.1 连续转移模型
操作通常具有连续状态和动作空间,例如物体位姿、关节角度、速度、力矩或期望末端位姿。常见的连续模型包括线性回归、局部加权回归、高斯过程和神经网络。
- 简单与局部模型:在熟悉的小范围内总结一条简单规律。以推盒子为例:机器人在桌面左侧轻推数次后,可能学到“向右推 厘米,盒子大约右移 厘米”。这条规则只在相近的位置和推力下可靠;换到墙边、加大推力或改推软物体时,就可能失效。局部模型的优点是少量数据即可学习,缺点是适用范围有限。
- 非参数模型:不预先规定一条固定的全局公式,而是预测时优先参考最相似的历史经验。仍以推盒子为例:面对一次新的推法,机器人会找出过去位置、方向和力度最接近的几次推动,再根据这些结果预测盒子的去向。局部加权回归会给“更像”的经验更大权重;高斯过程还会告诉机器人“这里以前几乎没试过,所以预测不确定”。这类方法擅长用少量数据拟合局部细节,但面对远离已有数据的新情况时泛化较弱,且数据增多后计算成本会上升。
- 深度模型:神经网络可学习任务相关的中间特征,并从图像或点云预测物体、像素的变化;代价是若没有预训练或结构先验,训练所需交互数据会显著增加。
- 预测状态表示(PSR):不要求机器人明确写出“物体的完整真实状态”,而是直接学习“过去看到了什么、做了什么 接下来可能看到什么”。例如盒子被遮挡时,机器人看不到它的准确位置;它记录自己刚才向右推过盒子,并预测“接下来相机应在右侧看到盒子;若看不到,它可能已掉下桌面”。因此 PSR 特别适合物体被遮挡、传感器看不全的部分可观测任务。
模型复杂度应与数据量及任务所需表达能力匹配:结构过弱会欠拟合复杂接触,结构过强则会提高采样和训练成本。
5.1.2 离散、混合与物理模型
离散模型常用于高层任务。例如翻煎饼后,结果可以表示为“翻转成功、掉落、未变化”等离散结果。将连续空间离散化时,划分过细会降低样本共享与泛化,划分过粗又会忽略控制所需的差异;理想划分应让同一离散状态内的样本在相同行动下具有相似后果。
混合模型结合离散模态与各模态内连续动力学,适合接触建立、断开等不连续过程。物理引擎模型进一步引入质量、摩擦、几何碰撞等先验,可提高数据效率与外推能力;但真实场景到仿真的状态映射困难,且复杂接触、柔性物体等过程常存在模型偏差。一个实用方案是以解析/物理模型作为先验,再学习数据驱动的残差或校正项。
5.2 转移模型中的不确定性
随机不确定性(Aleatoric uncertainty) 系统本身随机带来的状态转移随机性。 认知不确定性(Epistemic uncertainty) 不是世界本身随机,而是机器人对过程认知不足造成的结果不确定。
若只预测单一下一状态,规划器会把不可靠预测当成事实,长时程滚动时误差会持续累积。
因此,概率模型应同时描述预测均值与不确定度。高斯过程、贝叶斯模型、混合密度网络或模型集成均可用于此目的。机器人可据此:
- 避开高风险、预测不可靠的动作;
- 在结果不确定时执行保守控制或请求更多观测;
- 将不确定度纳入规划目标,而不仅比较预期奖励;
- 分辨是环境本身随机,还是模型尚未学会该区域。
后一个区分尤其重要:随机性无法通过更多数据消除,而模型不确定性可以通过有针对性的探索降低。
5.3 用自监督与探索学习转移
转移模型通常可由机器人自身经验自监督学习:执行动作前记录 ,执行后观测 ,就获得一个训练样本,无须人工逐帧标注。困难在于随机探索往往低效,甚至可能造成危险接触。
多种探索策略用于采集训练样本:
- 随机采样:获得多样化样本,学习通用模型;
- 网格采样:保证动作采样充分覆盖空间,前提是每轮之后环境可以重置;
- 主动采样:挑选信息增益最大的动作;
- 技能局部采样:为优化某一项技能,在技能轨迹附近加噪声采集样本;
- 内在动机(intrinsic motivation):机器人主动寻找当前模型预测很差、会产生显著事件的新场景。
更有效的探索会主动选择信息价值高的动作,例如:
- 优先访问模型不确定度大的状态—动作区域;
- 选择最能区分多个对象或动力学假设的动作;
- 同时考虑信息增益、任务回报与安全约束;
- 从简单动作和局部模型开始,逐步扩大探索范围。
交互式感知与模型学习在这里形成闭环:模型指出哪些属性未知,探索动作收集可消除不确定性的结果,新数据再更新模型。
5.4 转移模型的迁移与复用
转移模型并不天然绑定于某一个任务。若模型采用对象中心表示、显式使用对象上下文,机器人可以把在一个对象或场景中学习的经验迁移到另一个任务。
可复用的方式包括:
- 共享对象或部件模型:将抓取、推、接触等局部交互模型用于拥有相似几何或可供性的对象;
- 上下文条件化:将尺寸、质量、材料等作为输入,使单个模型覆盖一个对象族;
- 参数迁移与快速适配:用已有模型初始化新任务,再以少量新交互校正其参数;
- 仿真到真实迁移:在仿真中利用物理先验与大量数据预训练,再用真实观测修正 sim-to-real 偏差。
迁移成立的前提是任务之间确实共享可预测的结构。对象对应关系、合适的状态抽象和不确定度估计,决定了机器人何时应复用模型、何时应重新探索。
6. Learning Skill Policies
前几部分学习状态与环境模型,最终目标仍是获得能完成操作任务的行为,即技能控制器。策略通常将状态映射为动作(连续动作时也可输出动作的概率密度);本节讨论动作空间、策略结构、学习方法、迁移与安全保证。
6.1 动作空间类型
策略最终必须向执行器发出控制信号。其输出可以是直接的执行器信号,也可以是位置、速度、加速度、力或力矩等期望值,再由底层控制器(如 PID、阻抗或导纳控制器)转换为实际执行器命令。
动作可在关节空间或末端执行器的笛卡尔空间中定义。以对象或环境特征为参考的任务坐标系,能让策略学习“如何操作”而非“在某个绝对位置如何操作”,因此更利于跨工作空间泛化。策略还可输出控制器增益,以在任务的不同阶段调节刚度或顺应性。
6.2 策略结构的谱系
策略表示在表达能力与数据效率之间权衡:越通用的表示通常越灵活,却需要更多数据;越受约束的表示利用的先验越强,样本效率可能更高,但适用范围更窄。
- 非参数策略:如最近邻、高斯过程和局部加权回归;复杂度随数据增长,表达力高。
- 固定大小参数化策略:如查找表、基函数线性组合、神经网络、决策树;通过固定参数结构进行泛化。
- 受限参数化策略:显式加入机器人结构先验,例如 LQR/LQG、动态运动基元(DMP)、概率运动基元(ProMP)与高斯混合回归(GMR)。
- 基于目标的策略:以目标构型为主要参数,通常配合 PID 控制器或运动规划器,结构最强也最受限。
6.3 强化学习
强化学习(RL)通过与环境交互调整策略参数。机器人操作中的主要困难包括:真实数据昂贵、部分可观测性、非平稳性、稀疏奖励、高维连续状态与动作,以及任务成功、能耗和碰撞等多目标间的权衡。
- 基于模型 RL:学习或使用转移模型,再利用模型规划与指导策略搜索。优点是数据效率高,并可在目标变化时重新规划;缺点是模型误差会给学习带来偏差。
- 无模型 RL:直接由真实经验学习策略,不显式建模动力学。它能隐式利用复杂接触动力学,但通常需要大量交互数据,且适应新目标较慢。
- 价值函数方法与策略搜索:前者学习状态或状态—动作的预期回报;后者直接优化策略参数,因而更自然地处理连续动作。两者也可结合为 actor–critic 方法。
6.4 模仿学习
模仿学习从人类或其他专家的示范中学习技能,常用于降低纯 RL 的探索成本。行为克隆直接学习“状态到动作”的映射;逆强化学习则从示范中推断奖励或目标。
论文还区分两类扩展:**从观察学习(LfO)**只观察到人类的视频或状态而没有动作标签;纠正性交互允许人类在机器人执行中给出局部示范、修改或评价,使数据集中在机器人不确定或出错的区域。
6.5 技能迁移
已有技能可通过直接复用并微调、学习随任务上下文变化的参数化技能、元学习、领域适配,以及按难度排序的课程学习迁移到新任务。状态抽象和对象中心表示可以忽略与技能无关的变化;领域随机化等方法则用于缩小仿真与真实世界之间的差异。
6.6 安全与性能保证
机器人操作需要的不只是平均成功率,还可能要求高置信度地避免伤人、损坏物体或损伤机器人。性能可用期望回报衡量,也可使用最坏情况、风险敏感或高置信下界等指标;有的任务要求在学习探索期间就满足约束,有的只要求最终策略安全。
常见保证方式分为两类:基于已知模型和安全规范的形式化验证方法,以及为策略性能提供概率性高置信界的方法。论文指出,真实机器人上低数据量、模型不精确条件下的安全学习仍是重要开放问题。
7. Characterizing Skills by Preconditions and Effects
为了将技能用于规划,机器人不仅要会执行技能,还需要知道技能何时可执行,以及执行后会产生什么结果。前者称为前置条件(precondition),后者称为后置条件或效果(postcondition/effect)。规划器据此连接技能:前一个技能的后置条件必须满足后一个技能的前置条件。
7.1 用命题和谓词表示前后条件
前后条件通常表示为在某个状态下真或假的命题或谓词。谓词如 、 能绑定不同对象,因此比单一命题更紧凑,也更适于迁移。
- 命题(proposition):不带变量,表示一个固定事实,例如
CupOnTable = True,即某个指定的杯子在某张指定的桌子上。 - 谓词(predicate):带有对象参数,是可复用的关系模板,例如 。将参数替换为不同对象,就可得到 、 等实例。
命题像一句写死的话:“这个杯子在这张桌上”;谓词像可套用的句式:“A 在 B 上”。因此,学到谓词后,机器人可以将同一知识迁移到新的对象组合,而无须为每种组合重新学习。
谓词的grounding 是从连续的低层状态与上下文到该谓词真值的映射。它可表示为二分类器,也可表示为满足谓词的状态—上下文分布。将复杂条件拆成模块化谓词,可以在不同技能和任务间共享知识。
7.2 学习前后条件的 grounding
机器人可以用人工标注的正负样本训练谓词分类器,也可通过自身执行经验学习:若从某状态执行技能后达到目标后置条件,该状态即为前置条件的正样本。
后置条件可由人为指定,或将不同初始状态下的执行结果聚类得到。每个不同的结果簇可对应一个后置条件及其适用的前置条件。前后条件还可在与人交互时借助自然语言进行 grounding。
7.3 技能监控与结果检测
机器人需要在执行中判断目标是否达成、是否发生错误,并在必要时提前停止或进行恢复。视觉、触觉、力觉、音频等传感器都可用于检测谓词是否切换。
另一类方法学习成功执行时的典型传感器序列;明显偏离该序列时即视为异常。机器人也可通过额外的交互动作验证结果,例如抓取后尝试提起物体,以确认 是否为真。
7.4 谓词、技能参数与可供性
技能常带有高层参数,例如抓取姿态或擦拭时的目标力。机器人可学习哪些参数取值满足前置条件并最可能达到目标后置条件,再通过采样或优化选择参数。
**可供性(affordance)**描述对象允许机器人执行哪些动作,例如球可被抓取、滚动或弹跳。论文将其视为与对象相关的部分前置条件:它能帮助机器人找到适合某项技能的对象,但完整前置条件仍需满足。
8. Learning Compositional and Hierarchical Task Structures
操作任务可由多个短时程组件技能构成。分解后,每个技能只需关注相关对象和状态特征,学习与探索更容易;同一技能在不同任务中复用,也可形成更高层的状态和动作空间。
8.1 运动技能的形式
层级结构通常以 option 为基本单元:。其中启动集 对应前置条件,终止条件 对应技能应停止的目标区域,策略 决定低层动作。终止目标与实际效果不同:前者说明技能应在哪里结束,后者描述它实际到达的状态分布。
机器人可将经常复用的 options 组成技能库。识别组件技能的两条主要路线是:先获得完整解轨迹再分段,或在学习任务的过程中直接发现技能。
8.2 将轨迹分段为组件技能
该方法从人类示范或机器人已有的成功轨迹中分割技能边界。可依据不同片段的策略、价值函数、奖励函数、前后条件相似度来合并重复子任务;也可依据显著感知事件分段。
接触模态切换是特别重要的边界:抓取、抬起、放置和释放等技能会改变机器人可与哪些对象交互。声音、触觉或视觉中的显著事件也常使技能终止条件更易识别和监控。
8.3 在解题过程中发现技能
另一条路线是在学习解决任务时同步发现技能。其优势是新技能可立即帮助解决尚未能完整求解的复杂任务,并避免不同任务中重复学习相同技能。
可根据显著事件创建技能,使用 skill chaining 让一个技能达到另一技能的前置条件,或采用显式包含层级组件的策略结构。该问题比事后轨迹分段更困难,相关方法仍较少。
8.4 学习决策抽象
技能库提供了对低层动作细节的过程抽象;机器人还可学习决定“选择哪个技能”的抽象输入。其一是直接学习抽象策略,如有限状态机、层级任务网络或语法;其二是学习抽象状态空间,与抽象动作结合形成更简单、通常离散的 MDP,再在其上快速学习或规划。
这种抽象有望提升新任务学习效率、支持任务级规划,并让系统更易于理解和修改。
9. Conclusion
本文从对象与环境表征、转移模型、技能策略、技能前后条件,以及组合与层级结构五个方面综述了机器人操作学习。对象中心表征和交互式感知为状态与属性估计提供基础;连续、离散和混合转移模型描述操作效果;强化学习和模仿学习用于获得技能策略;前后条件、结果监控和层级组合使技能能够被可靠复用。
论文指出,尽管机器学习方法丰富,鲁棒且通用的操作能力仍未解决。主要开放问题包括:将学习模块整合为完整控制系统、在学习过程中安全使用组件(in situ learning)、安全学习与性能保证、多模态感知和人类提示的融合,以及基于显式假设或因果推理的更有效探索。