智元模仿学习面试,教机器人叠衣服到底有多难
上篇聊完智元灵巧手的力控和柔顺控制之后,群里有人问:"控制做好了,怎么让灵巧手学会新的操作技能?一个任务写一套控制代码也太累了吧。"这就是模仿学习要解决的问题——让人类示范几次,机器人自己学会。智元在模仿学习上的投入在国内具身机器人公司里属于第一梯队,他们采集了上千条示范数据来训练通用操作策略,目标是让机器人学会通用的操作技能,而不是每个任务单独编程。这篇聊智元·模仿学习算法工程师面试,覆盖操作技能学习、示范数据采集和泛化能力提升三个方向。模仿学习的两条路线:行为克隆和逆强化学习面试官的开场题通常从方法论层面开始。"行为克隆和逆强化学习有什么区别?各有什么优劣?"行为克隆(Behavior Cloning, BC)是最直接的方法——把人类示范的(观察, 动作)对当作训练数据,训练一个策略网络做监督学习。优点是简单高效,不需要环境交互;缺点是有协变量偏移问题——策略执行时一旦偏离了训练数据的分布,就会进入没见过的状态,做出越来越离谱的动作。逆强化学习(Inverse Reinforcement Learning, IRL)的思路不一样——它假设人类示范是最优的,反过来推断人类在优化什么奖励函数,然后用这个奖励函数做强化学习训练策略。优点是不受协变量偏移影响(因为RL策略会在环境中自主探索),缺点是计算量大、对示范质量要求高、且推断出的奖励函数可能不唯一。智元内部据说两条路线都在用:简单的桌面操作任务(比如抓取放置)用行为克隆快