福莱新材:从人手到灵巧手,触觉手套与具身智能数据采集
分享
2026年9月15日,在2026具身感知融合与多模态大模型创新研讨会上,福莱新材AI算法总监廖永兴指出,触觉在机器人灵巧操作中作用关键,尤其在接触判断、力度调整及滑移感知方面,视觉难以精确替代。他介绍道,具身智能数据采集可分为仿真数据、真机数据和以人为中心的无本体数据三类,并强调以人为中心的数据在规模与成本上更具优势,但需与真机、仿真数据协同使用。
针对手部动捕难以捕捉接触形态的局限,福莱新材推出以触觉采集为主的数据手套系列,融合手部姿态、腕部空间信息、第一视角视觉与任务标签,并强调多模态数据的时间对齐。廖永兴认为,成熟的具身智能需要丰富完备的数据,涵盖手部运动、视觉以及接触信号,以此实现更为精细的灵巧操作。他表示,数据采集手套未来将在具身智能的数据采集工作中发挥重要作用。

廖永兴|福莱新材AI算法总监
以下为演讲内容整理:
当前,具身智能已经从过去简单的运动或执行任务,发展到复杂的灵巧操作。在这些灵巧操作中,触觉起到了非常大的作用,因为在运动轨迹中,哪怕只是相差1毫米的偏差,触觉的反应都非常不一样。因此,我们在触觉方面针对机器人开发了触觉产品。今天我所要分享的,主要是以触觉为本的数据采集手套。
首先了解一下触觉对于灵巧操作的重要性。一个非常简单的例子,就是当你去拧开一个瓶盖时,视觉更多是提供第一时间的反馈,让你知道这个环境、物体的位置,以及你的手如何移动到相应位置去做出某个动作。但在接触发生的时候,你的策略运动、运动策略的判断,需要做出一定的改变。因为有没有接触、接触好不好、握得紧不紧,或者有没有产生滑移和滑动,这些都很难单靠视觉做出精确的判断。触觉在这里面就起到了非常大的作用,它决定了你的运动策略下一步应该加大力量,或者在手指上做一些细微的调整。
在具身智能数据采集里,我们大致可以把它分成三类。在最底层,有仿真数据,通过各种仿真平台,可以模拟机器人或灵巧手在不同物体、不同交互任务、不同环境下所能做到的各种事情。但有一个问题是,它无法很好地模拟真实世界的接触形态,比如摩擦力,或者物体微小的形变、位移,甚至滑动。
在金字塔的最顶端,有真机数据,通过遥操作或者自强化学习、自监督学习等类型的方式,让机器人采集真实世界与物理世界交互的数据。遥操作是一件非常困难的事情。各位如果试过遥操作一个机械臂或者灵巧手,就会发现当你要用这个遥操作系统去完成一个非常细腻的灵巧操作是非常困难的,很多时候需要有一定的技巧。从成本层面而言,遥操作意味着每一次数据采集,都需要配备对应的操作人员、一台机器人或灵巧手,以及一套完整的遥操作作系统来完成全部任务。
而我们所说的以人为中心的数据,即无本体数据,是通过观测人类在真实场景中执行任务的状态所采集的数据。人类自成长过程中便掌握了操作各类任务、各类物体的细节,因此人类本身是理想的学习样本。这类以人为中心的数据,在规模层面更便于采集,采集效率更高;在成本层面,无需依托机器人进行实时数据采集,因此在拓展应用时,能够以更低的成本获取更多数据。
该金字塔模型主要用于阐释数据的采集成本与可获取的数据质量,不代表数据的重要程度。并非以人为中心的数据能够完全替代真机数据或仿真数据,三者在模型训练中各自发挥不同作用。例如真机数据可以最好地验证该组数据或对应模型能否在真实环境中完成预设任务。因为即便采用以人为中心的数据,人手或人体手臂的运动方式,与真实机械手、灵巧手的结构及运动规律仍存在一定差异。但以人为中心的数据仍可提供相较于仿真数据更贴合真实物理世界的交互数据。
在以人为本的数据中,过去已出现多种不同的采集方式。例如以大量第一视角为核心的数据,通过第一人称的简易摄像头,观测人在执行各类任务或操作时手部运动及物体的空间信息。其次是全身动捕或手部动捕的形式,通过手套式设备采集手部的运动姿态。然而,这类数据存在较大局限,即无法完全真实地捕捉前述接触形态,仅能捕捉手指的运动,无法获知在发生接触时,手与被接触物体之间的具体形态、抓取是否稳固,以及是否产生滑移。针对这一缺陷,我们提出了一个产品系列,即触觉手套,用以弥补手部姿态捕捉中接触形态信息的缺失。
DexUMI-Tac是去年较为成功的案例,该方案借助外骨骼式设备采集由人操作产生的本体数据,其采集成本相对更低。不过,目前该方案更多应用于夹爪场景,因为其结构更为简单。如果要将此方式应用于机器人或灵巧手,会存在较大难点。灵巧手与人手在结构与功能上往往存在差异,例如自由度、指长、手掌尺寸等。如果仅依靠数据手套或动捕设备采集人手动作,在数据迁移环节,也就是将人手动作映射至机器手动作,会存在较大难度,需要投入更多工作予以实现。
我们也推出了另一版数据采集系统,针对该问题模拟灵巧手的外骨骼结构,用以采集与灵巧手尽可能匹配的运动范围数据,并配套采集触觉数据,形成完整闭环,使灵巧手能够便捷地从这类数据中学习人类手部技能。手套设备一般主要采集关节运动与触觉信号,而我们所提供的数据采集系统以触觉信号采集为主。同时,系统也会融合空间状态信息,即腕部位置,或是借助头戴摄像头采集第一视角信号,以及任务标签,使整套数据能够记录该段操作对应的行为与完成程度。
因此,一套完整的具身智能采集样本,在搭配我们的数据手套或数据终端后,能够生成完备的多模态数据,例如实时视觉观测信息、接触状态、后续动作以及任务结果。这类多模态数据均需要严格进行时间对齐。在多模态数据采集过程中,经常遇到的痛点有时间对齐问题,视觉采集帧率与手部数据采集帧率可能不一致,或是存在时间偏移。此时,腕部、手指的手部运动数据、视觉观测到的运动信息与触觉感知信号之间会出现错位。该时间差值或许十分微小,但接触事件的发生速度极快,因此即便是微小偏差,往往也会造成模型输出结果不可靠。
此处引用一项研究说明触觉对机器人任务完成程度的提示作用。该研究采用人手采集数据,借助采集方案完成多项厨房场景作业。部分任务例如旋转旋钮、移动碗具与锅具,在有无触觉信息的条件下,效果差距并不显著,甚至表现一致。这类典型的拾取、放置或是幅度较大的粗粒度操作,受触觉的影响并不明显。但在一些更为精细、需要感知微小接触的操作场景中,比如抓取一小撮盐,有无触觉信息时任务成功率差异极大,成功率可以从45%提升至75%。
仔细分析过程可以发现,在缺少触觉的条件下,仅依靠视觉,系统往往无法判断是否接触到盐粒,因为盐粒本身较为松散,且发生接触时视觉容易出现遮挡。而引入触觉信息后,系统能够更好地判断手部是否接触盐粒,以及在执行闭合动作时是否抓取到盐粒。这便证明,触觉在这类复杂精细操作中发挥着十分关键的作用。
我们所提及的规模化数据采集终端聚焦于手部采集,要实现规模化,需要达成几项核心指标。十分重要的一项是同步采集,即触觉终端同步采集手部触觉信息,以及手指或手部姿态等信息。同时在佩戴与标定环节,需要针对不同人员开展对应的标定与定制化处理。标定的意义在于,面对不同人员、不同手掌尺寸,佩戴手套后,在执行相同任务、施加相同力度的条件下,输出信号能够保持一致。因此我们配套了手套标定方案,保证不同人员佩戴同一手套执行相同任务时,信号输出保持一致。此外还有质量筛选,手套可依靠内置算法与硬件消除信号漂移和偏差,能够降低后续数据筛选与数据清洗的工作量。
下面介绍福莱近两年在机器人触觉领域开展的相关工作。产品共经历四代迭代,前两代产品的研发重点是赋予机器人触觉感知能力,例如在早期阶段为机器人配置平面触觉传感器,使其能够完成简单判定。伴随着灵巧操作所面临的难题,我们推出全曲面结构,实现更全面的感知覆盖与更复杂的力检测。今年,我们进一步将更多计算能力部署在边缘端,用于提取更为复杂的触觉信息,例如被接触物体的软硬程度、粗糙度等特征。
如何将触觉与具身智能更好地融合,其中的核心载体便是数据采集手套。我们有一个产品主要面向现有的以视觉为基础的数据采集系统,核心作用是为EgoScale这类以视觉为主的数据采集系统,补充物体交互接触过程中的信息采集能力。产品可实现全手数百个触点感知,能够兼容现有视觉与各类手势识别方案捕捉动作,数据采样速率可达100至300赫兹,这对数据同步至关重要。
第二款是面向特定灵巧手开发的DexUMI-Tac。在研发该数据采集终端前,我们预先考量灵巧手的自由度限制,因此采用外骨骼式结构设计,拟合灵巧手的自由度与手部运动范围,以此降低数据采集后与真实场景匹配及模型训练阶段的难度。
第三款是我们与灏存科技合作开发的数据采集终端,该终端将成熟的现有手部动作捕捉系统集成至数据采集方案中,实现同步手部运动与接触信息的采集。
我们认为,这类数据采集手套未来将在具身智能的数据采集工作中发挥重要作用。成熟的具身智能需要丰富完备的数据,涵盖手部运动、视觉以及接触信号,以此实现更为精细的灵巧操作。
(以上内容来自福莱新材AI算法总监廖永兴于2026年9月15日在2026具身感知融合与多模态大模型创新研讨会发表的《从人手到灵巧手:触觉手套与具身智能数据采集》主题演讲。)
欢欢@盖世汽车供应链
悠悠@盖世汽车
豆豆@盖世汽车






