在智能化浪潮席卷全球汽车产业的今天,比亚迪以一场技术秀宣告了其在自动驾驶领域的硬核实力。这家以电池和整车制造闻名的巨头,近期通过其AI团队发表的首篇研究论文,展示了一款名为HyWorldVLA的混合世界模型,以及与之配套的自研智驾芯片“璇玑A3”。这不仅是一次技术突破,更是从算法到硬件的完整闭环,标志着中国汽车制造商在科技前沿的自主创新迈出了关键一步。

从“两条腿走路”到混合世界模型:HyWorldVLA的技术逻辑

自动驾驶的核心难题之一,是车辆如何在复杂动态环境中准确预测下一秒的交通状况。传统方法要么依赖像素级世界模型,逐帧模拟路况,细节丰富但计算负担沉重,且对视觉噪声敏感;要么采用潜在空间模型,在压缩的抽象特征中高效推理,却容易丢失关键细节。比亚迪AI团队提出的HyWorldVLA(Hybrid World Model for Vision-Language-Action)选择“两条腿走路”——同时融合像素级和潜在空间两种世界建模方式,并采用视觉-语言-动作(VLA)架构。

模型的核心创新在于训练阶段:用像素级世界模型作为“监督看门狗”,强制潜在空间保留足够的环境信息,从而在推理时仅使用轻量的潜在空间模型,兼顾效率与准确性。这种混合设计并非简单的叠加,而是通过一个协调机制,让两种模型在训练中相互校验。在自动驾驶公开基准测试NAVSIM v1中,HyWorldVLA取得了90.59的PDMS评分,刷新了历史最佳成绩;在指标更全面的NAVSIM v2上,也以89.71分领先。

PDMS指标综合考量碰撞安全性、可行驶区域合规性、安全距离、目标完成度和运动舒适性等多维度实际驾驶质量,90分以上的成绩意味着模型在绝大多数场景下已经接近人类驾驶员的水平。值得注意的是,HyWorldVLA的VLA架构还引入了自然语言理解能力,使得车辆能够根据驾驶员的口头指令或环境描述做出更智能的决策。这一技术路径与AI Agent技术的发展方向高度契合,也为未来的人车交互提供了新的可能。

90.59分背后的硬核指标:自动驾驶评测新高度

NAVSIM基准测试是自动驾驶领域公认的“试金石”,其评测场景覆盖了高速、城市、乡村及恶劣天气等多种路况。HyWorldVLA在v1版本中夺得90.59分,比此前的冠军模型高出近4个百分点。这个差距看似不大,但在自动驾驶安全领域,每0.1分的提升都可能意味着避免一次事故。

更值得关注的是NAVSIM v2的结果。该版本增加了更多极端场景与长尾事件,例如行人突然横穿、施工区域临时变道等,对模型的泛化能力提出了更高要求。HyWorldVLA依然以89.71分领跑,证明了其混合世界模型在复杂场景下的鲁棒性。消融实验进一步验证了双通路设计的必要性:移除像素级预测后,PDMS从90.59跌至87.50;移除潜在空间处理,则降至89.91。两者缺一不可。

在655个雨雾噪声场景的专项测试中,HyWorldVLA取得了86.87分,比最强基线高出19分以上。这意味着即使在能见度极低的恶劣天气下,模型依然能保持较高的安全裕度。对于经常遭遇雨雾天气的地区而言,这一特性至关重要。比亚迪的AI团队通过将像素级细节与潜在空间抽象相结合,实际上构建了一个能够自适应环境噪声的感知系统。这种能力也使得HyWorldVLA能够更好地适应不同的AI图片生成场景,例如在城市道路重建和模拟训练中生成更真实的障碍物图像。

像素级与潜在空间:一个都不能少的消融实验

为了让读者更直观地理解HyWorldVLA的设计哲学,我们不妨深入消融实验的细节。实验团队分别移除了模型的像素级预测分支和潜在空间处理分支,观察性能变化。

当移除像素级预测时,模型失去了对路况细节的“微观控制”,在遇到路面裂缝、落叶、小动物等低视觉显著性物体时,决策变得犹豫甚至错误。PDMS分数从90.59骤降至87.50,跌幅接近3个百分点。这表明,纯粹依赖压缩特征无法捕捉所有关键信息,尤其是在边缘场景中。

当移除潜在空间处理时,模型虽然保留了完整的像素级预测能力,但推理速度下降明显,且容易受到视觉噪声的干扰。在一个场景中,由于摄像头反光导致的虚假高光被模型误判为障碍物,导致不必要的紧急制动。最终PDMS跌至89.91,虽然比87.50高,但仍然低于完整模型。

这种“双通路”设计与人类视觉系统的双流处理机制(腹侧流识别物体,背侧流感知空间位置)有异曲同工之妙。在自动驾驶领域,类似的混合模型正成为新的研究热点。比亚迪的这次尝试,不仅证明了该路径的有效性,也为其他车企提供了重要的参考。值得注意的是,这类复杂的模型训练通常需要大量高质量数据,而大模型训练过程中,如何高效处理海量场景数据也是一大挑战。

自研芯片“璇玑A3”:从算法到硬件的完整闭环

算法再好,也需要硬件的承载。今年5月,比亚迪发布了中国首款4nm车规级智驾芯片“璇玑A3”。这款芯片采用4nm先进制程,集成16核CPU,DMIPS达到420K,带宽273GB/s,达到了ASIL-D最高功能安全等级。单颗芯片算力约700TOPS,且支持三颗芯片并联,使整车智驾算力最高可超过2100TOPS。

这一性能指标已经超越了市面上绝大多数车载芯片,甚至接近部分数据中心级AI加速卡的水平。更重要的是,HyWorldVLA模型与璇玑A3芯片实现了深度适配:模型中的VLA推理模块在芯片上进行了专门的算子优化,使延迟降低30%以上,能效比提升40%。这意味着,搭载该芯片的车辆能够在极低功耗下完成实时决策,从而为L3级自动驾驶的落地提供了硬件基础。

从算法到芯片的完整闭环,是比亚迪区别于其他造车势力的核心优势。大多数新能源汽车厂商要么采用英伟达、高通等第三方芯片,要么依赖Mobileye的黑盒方案,算法与硬件之间往往存在适配鸿沟。而比亚迪通过自研芯片,能够从底层指令集到上层模型进行协同优化,实现“软硬一体”的极致性能。这种模式让人联想到苹果的A系列芯片与iOS系统,或是特斯拉的FSD芯片与自研算法。

抠图和图像处理领域,类似的软硬件协同设计也已证明能大幅提升效率。比亚迪的这一步,实际上是在为未来更复杂的自动驾驶功能铺路,例如城市NOA(导航辅助驾驶)和全场景泊车。随着芯片算力的提升,基于AI工具导航的开发者生态也将更加丰富,第三方应用可以基于璇玑A3进行定制化开发。

L3级自动驾驶的关键拼图:比亚迪的野心与布局

L3级自动驾驶,即“条件自动化”,意味着在特定场景下(如高速公路)车辆可以完全自主驾驶,驾驶员只需在系统请求时接管。这一级别的落地,不仅需要强大的AI算法,还需要高可靠性的硬件冗余以及符合法规的功能安全等级。比亚迪的HyWorldVLA模型和璇玑A3芯片,恰好补齐了算法与芯片这两块重要拼图。

事实上,比亚迪在自动驾驶领域的布局并非一日之功。早在2020年,比亚迪就开始组建AI团队,并从互联网和AI公司引进大量人才。此次发表首篇研究论文,标志着其技术积累已进入输出阶段。除了HyWorldVLA,比亚迪还在同时推进感知、规划、控制等多个子模块的研发,并计划在2025年之前实现L3级自动驾驶的规模化量产。

值得注意的是,比亚迪的布局并不仅限于乘用车。其商用车、物流车、甚至工程机械领域也都在探索自动驾驶应用。HyWorldVLA的混合世界模型可以通过迁移学习快速适配不同车型,而璇玑A3芯片的模块化设计也支持灵活扩展。这种平台化思路,使得比亚迪在科技前沿的竞争中占据先机。

在行业趋势层面,AI技术正在深刻改变汽车行业的价值链。传统汽车制造商纷纷转型为科技公司,而比亚迪通过自研芯片和算法,掌握了核心话语权。对于消费者而言,这意味着未来科技产品的智能化体验将更加出色。例如,借助文生图技术,车载系统可以根据用户描述生成沿途风景的虚拟图像,增强出行乐趣。

科技前沿的启示:AI技术如何重塑汽车产业

HyWorldVLA的发布,只是比亚迪在AI领域的一个缩影。从更广阔的视角看,汽车产业正在经历一场由AI技术驱动的范式转移。过去,汽车的核心竞争力在于发动机、变速箱和底盘;如今,智能芯片、算法模型和操作系统成为了新的“三大件”。

比亚迪的案例表明,掌握从算法到芯片的完整闭环,能够显著提升产品迭代速度和差异化竞争力。同时,这种闭环也带来了生态壁垒:软件生态深度绑定硬件架构,使得后来者难以复制。对于其他车企而言,要么选择与芯片厂商深度合作,要么自研芯片,但后者需要的资金和技术储备极高。

在AI技术应用层面,除了自动驾驶,AI图片生成、语音交互、自然语言处理等技术也在逐步渗透汽车场景。例如,车内摄像头可以实时分析驾驶员状态,通过艺术签名AI网名生成个性化的欢迎界面;车载系统还能根据用户心情生成诗词,使用古诗词生成功能。这些看似“花哨”的功能,实际上正在构建一种全新的车载体验生态。

展望未来,随着端到端自动驾驶模型的成熟,车辆将越来越像一台“移动的机器人”。比亚迪的HyWorldVLA和璇玑A3芯片,无疑是这一趋势中的重要里程碑。正如业内专家所言,中国汽车工业的下一场竞赛,不再是拼底盘和电池,而是拼“AI智算力”。在科技前沿的这条赛道上,比亚迪已经迈出了坚实的一步。