上海期智研究院研发RL‑100学习框架 提升机器人抗环境扰动能力 实现100%任务成功率
盖世汽车讯 机器人正逐渐进入家庭、公共场所、办公室、工厂以及医疗保健等各类场景。然而,尽管机器人具有巨大潜力,许多现有机器人在动态且不可预测的真实环境中的表现,仍不及其在受控实验室环境中的测试效果。
据外媒报道,上海期智研究院(Shanghai Qi Zhi Institute)的研究人员近日开发出一种名为RL-100的新型人工智能(AI)学习方法,可帮助机器人更快掌握新技能,并在不断变化的环境中稳定完成任务。该团队在发表于期刊《Science Robotics》的一篇论文中介绍了这一框架。RL-100融合了两种AI训练方法——模仿学习(imitation learning)和强化学习(reinforcement learning)。
论文第一作者Kun Lei在接受Tech Xplore采访时表示:“这一项目源于我们反复观察到的一个差距:机器人能够成功演示某项任务,并不意味着它能够在真实世界中稳定可靠地完成这项任务。”
Kun Lei称:“模仿学习通过让机器人学习人类示范,为其提供了良好的起点,但有限的示范数据无法覆盖所有失败情况、外部扰动或意外场景。一个机器人即便10次中成功9次,在实验室里看起来已经相当出色,但对于许多真实世界应用而言,其可靠性仍然不足。”

图片来源:Kun Lei及RL-100研究团队
弥合实验室演示与真实世界应用之间的差距
为了提升机器人在真实动态环境中的表现,Kun Lei及其同事尝试将传统模仿学习策略与强化学习结合起来训练机器人策略(robotic policies)。
模仿学习是指向机器人算法输入人类完成任务的视频(即人类示范),使其学习如何执行相应任务。相比之下,强化学习则通过不断试错进行训练,当AI系统采取正确行动时给予奖励,从而不断优化其决策能力。
Kun Lei表示:“我们思考,强化学习是否可以像基础模型(foundation models)的后训练(post-training)一样,作为机器人策略的后训练阶段。我们的核心目标,是弥合从示范到可靠执行之间的‘最后一公里’差距,不仅提升任务成功率,还提高执行速度、鲁棒性以及从错误中恢复的能力。”
研究团队提出的RL-100学习框架主要包括三个阶段。
首先,利用展示人类完成特定任务的视频,对机器人策略(即根据传感器或摄像头采集的数据规划机器人动作的AI算法)进行训练。
Kun Lei解释道:“第一步,通过模仿学习,使机器人从人类示范中获得具备基本能力的初始策略。第二步,利用离线强化学习(offline reinforcement learning),结合机器人此前积累的运行经验进一步优化策略。在接受候选策略更新之前,一个离线评估机制会预测新策略是否优于当前策略,从而作为一道保守的‘安全门’,避免有害更新。”
完成第二阶段后,机器人将在实际运行过程中继续接受少量强化学习训练。在第三阶段,机器人能够学习如何应对现实任务中偶发的失败场景。
Kun Lei表示:“底层控制器采用基于扩散模型(diffusion-based)的策略,我们在其动作生成全过程中直接引入强化学习更新。同时,我们还将多步扩散控制器蒸馏(distill)为单步策略,在不降低任务性能的前提下,实现更快、更高频率的控制。”

图片来源:Kun Lei及RL-100研究团队
提升机器人完成日常任务的能力
为了评估RL-100框架,研究人员利用其训练了适用于不同机器人手和夹持器(grippers)的机器人策略,并让这些机器人执行多种真实世界任务,包括处理可变形材料、液体和颗粒材料,部分任务还需要双手协同操作。
Kun Lei表示:“我们评估的不仅是平均基准性能,还包括可靠性、任务完成时间、抵抗物理扰动的能力、适应新环境的能力以及持续运行能力。”
“结果发现,该框架提供了一条可重复、可验证的路径,使机器人能够从人类示范顺利过渡到实际部署级别的行为表现。在测试过程中,RL-100在1,000次真实机器人实验中成功完成了全部1,000次任务;在部分任务中,其完成速度达到甚至超过了熟练的人类遥操作员(teleoperators)。”
研究团队的初步测试表明,采用RL-100训练得到的策略实现了100%的任务成功率。更值得注意的是,即使机器人所处环境发生变化,或受到各种物理扰动,其策略依然保持了很高的执行效果。
Kun Lei表示:“我们证明,这些策略只需进行少量额外训练,就能够适应任务的大幅变化。在一次公开部署中,我们开发的橙汁榨取机器人连续运行约7小时,全程未发生故障。
“我们的研究结果表明,机器人无需受限于初始示范数据的覆盖范围和效率。它们可以以人类知识为起点,再利用自身积累的经验不断提升可靠性,在某些情况下甚至能够达到比最初学习示范更高的效率。”

图片来源:Kun Lei及RL-100研究团队
团队未来的研究计划
未来,该团队提出的新型AI学习方法有望应用于更多类型的机器人,并在更广泛的应用场景中开展测试。最终,它有望推动机器人系统承担从制造加工、食品制作到家庭服务等更加丰富的现实任务。
目前,Kun Lei及其同事正尝试将这一后训练强化学习方法扩展至更大规模的视觉-语言-动作模型(Vision-Language-Action,VLA)。如果取得成功,该框架将有望应用于更加复杂的机器人,使其能够执行更加多样化的真实世界任务。
Kun Lei补充道:“我们尤其关注如何在保留基础模型广泛语义泛化能力的同时,通过真实世界强化学习赋予机器人更高的可靠性和物理操作能力。
“此外,我们还计划研究更加复杂、更加杂乱且部分可观测(partially observable)的环境,以及需要长期规划(long-horizon)的任务。另一个重要目标,是通过开发更完善的任务重置、故障恢复、失败检测以及安全探索机制,使整个学习闭环更加自主,从而减少真实机器人训练过程中对人工干预的需求。”
欢欢@盖世汽车供应链
悠悠@盖世汽车
豆豆@盖世汽车





