连比亚迪都开始发AI论文了!
而且不是成果平平的灌水文章。
最新公开的一篇HyWorldVLA,来自比亚迪汽车新技术研究院,瞄准的是当前自动驾驶最热门的方向——Vision-Language-Action(VLA)+ World Model(世界模型)。
HyWorldVLA在自动驾驶公开基准NAVSIM v1上取得SOTA成绩,PDMS达到 90.59。
太反差了!
过去几年,外界提到比亚迪智能化,更多想到的是“天神之眼”、供应链整合、规模化落地,当然还有今年的“兜底”。
但要让你具体callback一下,迪子有啥具体到“代码级自研”的AI技术、学术成果......一片空白。
甚至有传言比亚迪智能发布会的PPT,都是供应商帮忙做的。
但这篇论文一出,让所有人看到一个基因都完全不一样的比亚迪:
不但有自动驾驶成果,还有一支长期投入物理AI基础模型的研发团队。
先说这篇论文到底在研究什么。
HyWorldVLA瞄准的是当前自动驾驶领域最前沿的一条路线:
让AI从“识别道路”走向“理解世界”。
因此,近几年行业开始探索端到端自动驾驶模型,模型直接从传感器输入,输出车辆控制或轨迹,而进一步的发展,就是加入世界模型(World Model)。
简单理解,世界模型希望让AI拥有一个“内部模拟器”。它不仅知道现在发生了什么,还能预测未来:几秒后道路会如何变化?其他交通参与者可能如何行动?车辆应该采取什么策略?
这也是Tesla FSD、Waymo以及NVIDIA等玩家正在探索的方向。
但问题是,目前的自动驾驶世界模型仍然面临一个核心矛盾:
既想让模型理解真实世界的细节,又希望模型能够高效推理。
一种方式是Pixel-level World Model,也就是直接预测未来视频画面。优势是直观,模型可以生成未来道路、车辆、环境变化。但缺点也明显:计算成本高,而且容易受到视觉噪声影响。
另一种方式是Latent World Model,也就是在压缩后的隐藏空间中预测未来。这种方法效率更高,更适合大规模模型训练。但问题是:模型可能理解了抽象关系,却丢失了真实世界细节。
HyWorldVLA提出的,就是一种混合世界模型(Hybrid World Modeling),留视觉世界模型对于环境细节的理解能力,又利用隐空间模型提升推理效率。
在此基础上,论文进一步引入Vision-Language-Action(VLA)模型,让系统不仅能够理解视觉环境,还能够结合语义信息生成驾驶动作。
把两条路的好处都拿到,同时把各自的短板规避掉,最终形成:看见环境、理解环境、预测未来、采取行动的端到端流程。
效果如何?
HyWorldVLA选择的测试平台,是当前自动驾驶研究领域较受关注的公开基准:NAVSIM v1。
和传统视觉任务测试并不一样,它更关注:如果车辆真的按照AI规划路线行驶,会不会安全、高效完成驾驶任务。
因此,它采用了更接近实际驾驶质量的综合指标PDMS(Predictive Driver Model Score)。其中包括是否发生责任碰撞;是否保持在可行驶区域;是否保持合理安全距离;是否完成驾驶目标;车辆运动是否平顺舒适。
也就是说,一个模型不能靠“慢慢开”获得高分,也不能只追求速度而忽略安全,需要同时做到:安全、效率、舒适。
HyWorldVLA在NAVSIM v1测试中取得PDMS 90.59的成绩,达到公开结果中的领先水平。
这说明:至少在公开数据集和仿真驾驶环境中,比亚迪这套基础模型具备当前自动驾驶研究前沿能力。
但需要客观看待:benchmark领先,不等于已经完成量产自动驾驶。
所以,比亚迪自动驾驶大模型SOTA,更准确的意义是:
比亚迪证明了自己具备多模态、物理AI基础模型研究能力。
HyWorldVLA的混合不是简单地把两条路线拼接在一起,而是在不同训练阶段让像素级和隐空间表征各司其职。整个流程分为三步。
第一步:训练一个视频压缩器。
先用视频VAE把连续的视频帧压缩成紧凑的隐特征,后续模型在这个压缩空间里做预测,而不是在原始像素空间里硬扛噪声。为了提升压缩质量,编码过程中引入了文本信息作为语义指引——用文字描述辅助模型理解画面中哪些是重要结构、哪些是可以忽略的细节,显著改善了重构画面的清晰度。
第二步:预训练。 把图像、动作、语言和隐特征全部转成统一的离散token,拼成一个长序列,用自回归的方式让模型学会预测下一个token是什么。
这个阶段的关键设计是“两条腿走路”——模型同时做两件事:预测未来画ink>面的token,以及预测未来隐特征。画面token预测相当于一个“监工”,逼迫隐空间必须保留足够的信息才能还原出清晰的画面,防止表征在学习过程中变得空洞无用。
第三步:联合微调。 到了这一步,模型不再预测画面,只输出隐特征。动作生成模块把这些隐特征和历史信息融合在一起产出最终轨迹。
论文验证了两种动作模块——一种是从候选轨迹里打分选最优,一种是用生成模型直接输出连续轨迹——两者都有提升,说明这套方法的增益不依赖特定的动作设计。
那SOTA到底靠什么赢的?消融实验给出了答案。
最大的贡献来自“混合”本身。去掉画面预测、只保留隐空间,PDMS从90.59掉到87.50——这是所有消融里跌幅最大的,说明像素级的精细监督对整体表现至关重要。反过来,去掉隐空间、只保留像素级模型,PDMS也掉到89.91。两条路线谁都不能少,单靠一条都到不了90.59。
隐特征监督的权重也很有讲究。联合微调时完全不约束隐特征(λ₃=0),PDMS只有90.17;给一个适中的权重(λ₃=0.1),达到最优90.59;权重继续加大反而掉到89.75。这说明:适度约束能防止预训练学到的语义在微调中被冲掉,但约束太强又会束缚模型自己去发现对开车最有用的表征。
噪声鲁棒性则是隐空间带来的“额外红利”。论文专门收集了655个雨雾场景做测试。纯像素方法WoTE只有60.65,DriveVLA-W0也只有61.18;HyWorldVLA达到86.87。这个差距说明:在恶劣天气下,在压缩空间里做推理远比在像素空间里死磕要可靠得多。
一句话总结:这套方案赢在“分阶段干活”——预训练时用像素重建把隐空间“喂饱”,让它保留足够的环境信息;微调时切换到纯隐空间推理,自动获得了对雨雾光照的免疫力。
两个阶段分工明确,互不干扰,而不是让一个模型同时扛两项任务。
HyWorldVLA代表的是自动驾驶基础模型探索方向,与Tesla FSD、Waymo、NVIDIA Cosmos等路线处于同一技术趋势,但选择了VLA与混合世界模型结合的具体技术路径,有自己的差异化侧重。
但距离真正大规模量产部署,仍需面对真实数据闭环、车端算力约束、长尾场景覆盖等一系列工程化挑战。
HyWorldVLA这篇论文完全由比亚迪汽车新技术研究院(也就是原来的规划院,杨东生领导)独立完成,没有外部高校或研究机构合作署名,这在车企AI论文中不算常见。
顺着“新技术研究院”这条线,再把范围扩大到整个比亚迪关联去扩大检索,可以发现一些更完整的信息。
HyWorldVLA是比亚迪第一篇多模态基础模型论文,但不是第一篇AI论文。
至少还有一篇EMoE-Planner(基于混合专家的自动驾驶规划模型),发表于2025年。
其他的论文还包括赛车轨迹优化(Global minimum time trajectory planning considering curvature and distance for track racing)、胎噪判断地形(Road Terrain Recognition Based on Tire Noise for Autonomous Vehicle)。
但这些领域跟自动驾驶以及更前沿的物理AI基础研究关联不深。
而再往前,公开渠道几乎查阅不到比亚迪的AI学术论文。
这在一定程度上证明,比亚迪对于核心的AI基础模型研究,是近几年才开始做的。
几个高频出现的名字,也印证了这种判断。
Liulong Ma,资料不多,github上极其低调,也没有个人主页和Google学术主页,但比亚迪汽车新技术研究院几篇公开AI论文中都有署名,而且是通讯作者。
第一次出现的时间点,是2025年。
再往前,Liulong Ma在学术界的露出轨迹涵盖自动驾驶规划、机器人导航、多模态感知、世界模型等多个方向,与当前Physical AI技术趋势高度重合——
他出身哈工大,而且是著名的哈工大机器人技术与系统国家重点实验室,以及哈工大机电系。
从他的研究方向上推断,指导老师有可能是哈工大的赵杰教授,哈工大机器人研究所所长。
再从哈工大这条线索入手,还能够发现比亚迪AI团队更鲜明的哈工大基因。
Hongbiao Zhu,前面提到的EMoE-Planner第一作者,2025年论文发表时,也隶属比亚迪汽车新技术研究院,但是他的过往履历,同样紧密关联哈工大,以及CMU。
说明BYD新技术研究院的AI团队,不是单纯招聘汽车算法工程师,而是在吸收顶尖名校的计算机、机器人人才,包括哈工大、CMU,形成一个“机器人AI派”的团队。
最后,总结一下比亚迪自研AI团队的构成呈现几个鲜明特征。
第一,时间线指向从2024年甚至更早启动的真正自研——2025年有EMoE-Planner,2026年有HyWorldVLA,中间还有多篇合作论文发表在ICLR、CVPR、NeurIPS等顶会。
这表明比亚迪内部有一个稳定运转的基础AI研究小组,而非项目制的阶段性投入。
第二,学术圈露出的团队成员背景高度集中,鲜明的哈工大和CMU背景。
第三,这与比亚迪同时在推进的自研机器人项目形成了呼应。
据公开信息,比亚迪自研机器人即将亮相。HyWorldVLA所代表的VLA+世界模型路线,本质上是机器人领域“感知-推理-行动”闭环的自动驾驶版本——两者共享同一套技术栈和人才基因。
比亚迪这个AI团队,和其他车企最大的不同在于,不是从汽车电子或ADAS工程延伸过来的研发路线,某种程度上更接近Tesla AI“机器人+自动驾驶”一体化的组织逻辑。
这是物理AI从技术出发的第一性原理,在组织架构上的反应。
所以,比亚迪发布HyWorldVLA的意义,不只是多了一篇论文。
它让外界第一次看到:这家年销量全球领先的新能源车企,正在展示过去并不显性的能力——物理AI的基础模型研发。
自动驾驶竞争正在从“功能堆叠”进入“物理AI能力竞争”,比亚迪显然已经认识到这一点,不过HyWorldVLA是否代表比亚迪已经进入第一梯队,还有待验证。
但至少,比亚迪是所有老牌车企中,率先摆脱“就事论事”搞智能辅助驾驶,按照AI系统能力建设团队,把研究向机器人和基础大模型推近的玩家。
本文来自微信公众号 “智能车参考”(ID:AI4Auto),作者:有车有据,36氪经授权发布。
发布时间:2026-07-29 17:00