SUTD开发出全新AI框架 可为自动驾驶系统生成更逼真的4D激光雷达场景
盖世汽车讯 自动驾驶车辆和机器人需要理解一个处于不断运动变化中的世界:车辆会变换车道,行人会横穿马路,道路环境也可能瞬息万变。
为了训练和测试感知及运动规划系统,研究人员需要大量高质量的4D激光雷达(LiDAR)数据。然而,采集真实的激光雷达序列既昂贵又耗时,且需要投入大量人力。现有的4D激光雷达数据生成方法往往难以有效呈现大型户外环境,难以在长时间跨度内同时保持场景结构和物体运动的真实性。

图片来源:SUTD
据外媒报道,新加坡科技设计大学(Singapore University of Technology and Design,SUTD)的研究人员开发出能够更高效、更连贯地生成大规模4D LiDAR场景的AI框架HieraScaffold。LiDAR(即Light Detection and Ranging)利用激光脉冲测量距离并构建周围环境的3D图像;而4D LiDAR则在3D信息的基础上引入了时间维度,使系统能够对场景随时间序列的变化进行建模。
由SUTD助理教授Zhao Na领导的研究团队在2026年国际机器学习会议(ICML)上发表了题为《HieraScaffold:学习用于可扩展 4D LiDAR 生成的紧凑分层表示》(HieraScaffold: Learning Compact Hierarchical Representations for Scalable 4D LiDAR Generation)的论文。该研究提出了一种生成大型户外4D LiDAR环境的新方法,能够同时捕捉静态结构(如道路和建筑物)与移动物体(如车辆和行人)。
一种针对动态场景的“脚手架”结构
HieraScaffold并非对整个3D/4D空间进行密集表征,而是围绕由LiDAR采样的、靠近物体表面的区域构建一个紧凑的“脚手架”结构。它将静态背景和动态前景分别表征为不同的脚手架组件,并将其压缩为紧凑的方向性表征;在生成过程中,先构建静态脚手架,随后基于该静态脚手架生成动态脚手架。
这一点至关重要,因为自动驾驶系统不仅需要感知物体的位置,还需要理解物体在不同时刻之间的运动方式。
“现实世界是动态的,而不是互不关联的快照的集合,”助理教授Zhao表示。 “车辆和行人会移动,因此系统不仅必须了解物体的位置,还要了解它们如何随时间变化。通过向3D空间添加时间,4D LiDAR提供了可靠感知和规划所需的平滑一致的序列。”
HieraScaffold从原始LiDAR序列中学习紧凑的层次表示。它使用无符号距离场和空间梯度从稀疏扫描中重建连续场景几何形状,然后使用保留重要方向几何和运动线索的神经轮廓波表示来压缩所得支架。在此紧凑表示的基础上,HieraScaffold逐步重新耦合分解的组件以生成连贯的4D LiDAR场景。
分块生成提升了场景的一致性
具体而言,HieraScaffold并非试图将整个室外环境生成为一个单一的密集体量,而是将大型场景生成为相互连接的“块”(blocks)。这种基于分块的方法不仅提高了流程的可扩展性,还有助于保持场景相邻区域之间的一致性。
在使用KITTI-360和Waymo Open自动驾驶数据集进行的测试中,HieraScaffold生成的4D LiDAR场景与真实世界数据的吻合度更高,且在时间维度上保持了比LidarDM等现有方法更强的一致性。
生成的场景展现出更佳的整体真实感、更准确的空间结构,且其分布与真实激光雷达(LiDAR)数据更为吻合。此外,生成的激光雷达帧之间过渡更加平滑,这对于构建动态交通场景模型而言是一项重要特性。
对于自动驾驶和机器人技术团队而言,其潜在价值不仅在于生成更多数据,更在于生成具有更高实用价值的多样化数据。在后续实验中,研究人员发现,将10,000个合成激光雷达样本与仅1,000个真实样本结合使用,其在分割和车辆检测任务中的表现,均优于仅使用10,000个真实样本进行训练的效果。
作为补充的合成数据
这表明,高质量的合成数据有望成为真实世界数据的有力补充。通过让感知模型接触更多样化的场景和运动模式,合成数据有助于提升模型的泛化能力。不过,研究人员也提醒道,目前尚不应将合成数据视为真实数据的完全替代品。
“高质量的合成数据不仅仅能增加数据集的规模,”助理教授Zhao说道,“它还能引入有益的多样性,并帮助模型实现更好的泛化。我们的目标并非彻底取代真实数据,而是让训练与测试过程更具可扩展性、灵活性和效率。”
这项技术最终有望降低采集和标注大规模LiDAR数据集的成本。它还能简化动态仿真环境的构建,使系统在进行公共道路测试之前,能够先在虚拟环境中开展更多感知与规划方面的测试。除自动驾驶领域外,该方法还可支持机器人技术、虚拟现实(VR)及增强现实(AR)等需要大量动态三维数据的应用场景。
当前训练数据的局限性
该团队也指出了当前的局限性。现有的LiDAR数据集在场景多样性方面仍显不足,且可能包含未被完全扫描的区域。因此,基于这些数据集训练出的模型,在重建时可能会将缺失区域呈现为孔洞或突兀的边界。若要提升模型的鲁棒性,将需要更完整、更多样化的动态数据集。
接下来,研究人员计划利用更丰富的4D激光雷达数据集来训练HieraScaffold,增强其恢复缺失场景结构的能力,并在进行实际部署前对其鲁棒性进行更广泛的评估。
欢欢@盖世汽车供应链
悠悠@盖世汽车
豆豆@盖世汽车






