比亚迪汽车新技术研究院团队公开了HyWorldVLA,这是一套面向端到端自动驾驶的视觉—语言—动作模型。论文于7月23日提交至arXiv,作者单位标注为比亚迪。模型在NAVSIM v1基准的PDMS指标上取得90.59分,在论文列出的对比实验中高于多种端到端、VLA、像素世界模型和潜在世界模型方案;在NAVSIM v2扩展指标上,论文报告的EPDMS为89.71分。
世界模型通过预测场景接下来可能发生的变化,为车辆轨迹规划提供信息。重建未来像素能够保留道路、车辆和行人的细节,但容易受到雨雾、亮度变化和图像噪声干扰;在压缩后的潜在空间进行预测,可以降低部分视觉扰动的影响,却可能损失具有解释价值的几何细节。HyWorldVLA将这两条技术路线纳入同一训练流程。
预训练阶段,模型一方面预测由视频VAE编码的潜在表示,另一方面重建未来视频帧,用像素信息约束潜在空间。进入联合微调后,系统主要预测潜在特征,再由动作专家据此生成驾驶轨迹。语言引导负责筛选与动作相关的语义,潜在条件则连接未来场景预测与控制输出。消融实验显示,移除语言引导、潜在条件或微调阶段的潜在监督后,PDMS均低于完整配置的90.59分。
团队还从OpenScene测试数据中选取655个包含雨、雾等非均匀噪声的案例。在这组数据上,HyWorldVLA报告的PDMS为86.87分,论文所列多种对比方案的得分为60.65至73.18分。研究人员也改变了前视图的光照条件,以观察模型在明暗变化下的规划表现。这些结果来自公开数据集和论文实验,不是真实道路上的大规模运行统计。
论文未公布训练算力、完整数据规模、量产车型、车端芯片配置或软件推送计划,也未说明该模型是否已参与比亚迪在售车辆的控制。因此,90.59分代表特定公开基准和评价口径下的研究成绩,不能直接换算为道路接管率、安全里程或商业收入。
混合世界模型带动自动驾驶训练与仿真需求
HyWorldVLA把视频重建、潜在状态预测和轨迹生成纳入统一流程,由此形成对视频数据处理、模型训练、仿真评测和车端部署工具的协同需求。对比亚迪而言,内部团队可以围绕自有车辆数据和工程约束继续迭代算法,减少不同模块之间的信息损失,但相应的算力、数据治理和软件集成投入也会增加。对自动驾驶软件行业而言,雨雾和光照噪声测试扩展了评测维度,竞争范围将由单一基准分数延伸至鲁棒性、推理效率与可部署性。由于论文没有对应量产计划,现阶段的影响主要传导至研发能力、训练工具和验证投入,而不是已经形成的车辆销售收入。
| 涉及行业 | 行业影响分析 | 简要理由 |
|---|---|---|
| 应用软件 | 利好 | 混合世界模型增加视频训练、潜在表示学习和模型评测需求;自动驾驶软件需要整合场景预测、轨迹生成、仿真和部署工具。 |
| 涉及的上市公司 | 证券代码 | 个股影响分析 | 简要理由 | 公允价值参考 | 分析师平均目标价参考 |
|---|---|---|---|---|---|
| 比亚迪股份 | HKEX:01211 | 中性 | 研究成果增强自动驾驶算法储备,但论文没有披露量产车型、上线时间或商业收入。 | 107港元 | 平均120.23港元 |
公允价值及分析师目标价为截至文章发表时的网上公开数据,数据可能随发布方更新而变化,且因不同口径可能得出不同结果,仅供参考,不等于公司客观价值。
公允价值参考与分析师平均目标价参考由系统填充,仅作为公开市场信息参考,不构成估值或投资建议。
新闻热点内容来源于媒体公开报道。文章分析仅代表个人观点,不构成投资建议。
