首页 / 人工智能 / AI模型与技术

比亚迪HyWorldVLA取得NAVSIM高分,混合世界模型瞄准驾驶噪声

比亚迪研究团队提出HyWorldVLA,将像素监督与潜在表示学习结合,在NAVSIM基准取得90.59分,并测试雨雾和光照变化下的驾驶规划能力。

今日科技圈头条C编辑部已完成多源核验
查看行业与公司影响↓

比亚迪汽车新技术研究院团队公开了HyWorldVLA,这是一套面向端到端自动驾驶的视觉—语言—动作模型。论文于7月23日提交至arXiv,作者单位标注为比亚迪。模型在NAVSIM v1基准的PDMS指标上取得90.59分,在论文列出的对比实验中高于多种端到端、VLA、像素世界模型和潜在世界模型方案;在NAVSIM v2扩展指标上,论文报告的EPDMS为89.71分。

世界模型通过预测场景接下来可能发生的变化,为车辆轨迹规划提供信息。重建未来像素能够保留道路、车辆和行人的细节,但容易受到雨雾、亮度变化和图像噪声干扰;在压缩后的潜在空间进行预测,可以降低部分视觉扰动的影响,却可能损失具有解释价值的几何细节。HyWorldVLA将这两条技术路线纳入同一训练流程。

预训练阶段,模型一方面预测由视频VAE编码的潜在表示,另一方面重建未来视频帧,用像素信息约束潜在空间。进入联合微调后,系统主要预测潜在特征,再由动作专家据此生成驾驶轨迹。语言引导负责筛选与动作相关的语义,潜在条件则连接未来场景预测与控制输出。消融实验显示,移除语言引导、潜在条件或微调阶段的潜在监督后,PDMS均低于完整配置的90.59分。

团队还从OpenScene测试数据中选取655个包含雨、雾等非均匀噪声的案例。在这组数据上,HyWorldVLA报告的PDMS为86.87分,论文所列多种对比方案的得分为60.65至73.18分。研究人员也改变了前视图的光照条件,以观察模型在明暗变化下的规划表现。这些结果来自公开数据集和论文实验,不是真实道路上的大规模运行统计。

论文未公布训练算力、完整数据规模、量产车型、车端芯片配置或软件推送计划,也未说明该模型是否已参与比亚迪在售车辆的控制。因此,90.59分代表特定公开基准和评价口径下的研究成绩,不能直接换算为道路接管率、安全里程或商业收入。

混合世界模型带动自动驾驶训练与仿真需求

HyWorldVLA把视频重建、潜在状态预测和轨迹生成纳入统一流程,由此形成对视频数据处理、模型训练、仿真评测和车端部署工具的协同需求。对比亚迪而言,内部团队可以围绕自有车辆数据和工程约束继续迭代算法,减少不同模块之间的信息损失,但相应的算力、数据治理和软件集成投入也会增加。对自动驾驶软件行业而言,雨雾和光照噪声测试扩展了评测维度,竞争范围将由单一基准分数延伸至鲁棒性、推理效率与可部署性。由于论文没有对应量产计划,现阶段的影响主要传导至研发能力、训练工具和验证投入,而不是已经形成的车辆销售收入。

涉及行业行业影响分析简要理由
应用软件利好混合世界模型增加视频训练、潜在表示学习和模型评测需求;自动驾驶软件需要整合场景预测、轨迹生成、仿真和部署工具。
涉及的上市公司证券代码个股影响分析简要理由公允价值参考分析师平均目标价参考
比亚迪股份HKEX:01211中性研究成果增强自动驾驶算法储备,但论文没有披露量产车型、上线时间或商业收入。107港元平均120.23港元

公允价值及分析师目标价为截至文章发表时的网上公开数据,数据可能随发布方更新而变化,且因不同口径可能得出不同结果,仅供参考,不等于公司客观价值。

公允价值参考与分析师平均目标价参考由系统填充,仅作为公开市场信息参考,不构成估值或投资建议。

新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。

专题:AI模型与技术

#比亚迪#HyWorldVLA#世界模型#自动驾驶#多模态模型