—— 汽车产业链供需平台 ——
下载盖世APP

首页 > 资讯 > 新技术 > 比亚迪推出混合世界模型HyWorldVLA

比亚迪推出混合世界模型HyWorldVLA

盖世汽车 刘丽婷 2026-08-12 14:42:54
分享

盖世汽车讯 据外媒报道,比亚迪人工智能团队于7月29日发表了首篇研究论文《HyWorldVLA》,介绍了一种混合世界模型HyworldVLA。该模型结合了像素级和潜在空间世界建模,并采用视觉-语言-动作(VLA)架构,用于自动驾驶。HyWorldVLA在NAVSIM v1公开基准测试中取得了90.59的PDMS评分,超越了以往所有最先进的结果。该基准测试通过碰撞安全性、行驶区域合规性、安全距离、目标完成度和运动舒适性等指标来衡量实际驾驶质量。

BYD.png

图片来源:arxiv.org

该混合世界模型架构解决了自动驾驶世界模型中的一个根本性权衡问题。像素级模型通过预测未来视频帧来获取环境细节,但计算成本高昂且对视觉噪声敏感。潜在空间模型为了提高效率,在压缩的隐藏表示中运行,但可能会丢失对安全驾驶决策至关重要的真实世界细节。HyWorldVLA兼顾了两者:在训练过程中使用像素级监督作为“看门狗”,强制潜在空间保留足够的帧重建信息;同时在压缩空间中进行推理以提高效率。消融实验证实,移除像素级预测会使PDMS值从90.59降至87.50,而移除潜在空间处理则会降至89.91,这验证了这两个组件都是必要的。

训练流程分为三个阶段。首先,视频变分自编码器(VAE)在文本描述作为语义上下文的引导下,将连续的视频帧压缩成紧凑的潜在特征。其次,将图像、动作、语言和潜在特征转换为统一的离散标记,用于自回归的下一标记预测,同时对像素预测和潜在特征预测进行双重监督。像素标记预测起到质量保证作用,防止潜在特征表示崩溃。第三,动作生成模块将潜在特征与历史信息融合,生成轨迹输出,并通过对候选轨迹进行评分和直接生成连续轨迹来验证其有效性。

潜在特征监督权重至关重要:微调过程中不施加任何约束时得分为90.17,最优权重为0.1时得分为90.59,而过高的权重则降至89.75。这表明适度的约束既能保留预训练的语义信息,又不会限制模型发现与驾驶相关的表征的能力。

关注我们更多服务平台

添加社区公众号、小程序, APP, 随时随地云办公尽在掌握

联系我们
盖世汽车社区 盖世汽车中文资讯 盖世汽车会议 盖世汽车研究院 盖世大学堂 Automotive News Global Auto Sources 友情链接 Copyright@2007-2022 All Right Reserved.盖世汽车版权所有
增值电信业务经营许可证 沪B2-2007118 沪ICP备07023350号 沪公网安备 31011402009699号 未经授权禁止复制或建立影像,否则将追究法律责任。