在自动驾驶领域,Waymo已经累计完成超过2.2亿英里的纯无人驾驶里程,其严重事故率仅为人类驾驶员的1/17。这一成绩背后,隐藏着一个被业界忽视的核心原则:AI项目是否准备好投入生产,不取决于模型在基准测试上的表现,而取决于评估体系的成熟度。对于正在构建智能助手的企业来说,Waymo的“评估驱动开发”方法论提供了一套可迁移的风险管理框架——从持续测试到数据效率,从人类监督到业务对齐,每一个环节都直接决定了AI系统能否真正“安全落地”。
Waymo的评估驱动开发:从“最后检查”到“工程核心”
在大多数科技公司,评估常常被当作模型上线前的最后一道关卡:训练完成后跑一遍测试集,准确率达标就推送生产。Waymo却反其道而行之——将评估嵌入整个工程生命周期,使其成为驱动项目进展的核心引擎。
Manasi Joshi,Waymo系统工程与机器学习总监,在VB Transform 2026上详细解释了这一实践。她称之为“eval-forced development”(评估强制开发),或“eval-centric development”(以评估为中心的开发)。在这种模式下,一个项目的成熟度可以直接通过其评估体系的成熟度来判断。如果一个项目连可靠评估自身表现的能力都没有,那么它根本不具备进入生产环境的前提。
这一理念对AI Agent技术的开发者具有直接启示。许多企业在部署客户服务智能助手或代码辅助工具时,往往只关注模型在通用数据集上的得分,而忽略了评估数据本身的代表性、评测维度的完整性以及持续监控的机制。Waymo的做法表明:评估不是一次性任务,而是与模型训练、仿真、部署并行演进的系统工程。
持续评估:从训练到生产后的全周期监控
Waymo的评估工作覆盖了模型训练的每一个阶段——训练过程中、训练完成后、开环仿真以及闭环仿真中。Joshi强调:“评估不是启动模型的一次性任务。”
实际上,Waymo将评估视为一个持续的过程,贯穿驾驶、仿真和验证三个领域。其方法论整合了多个数据集、性能指标以及能够高效运行的大规模基础设施。对于企业而言,这意味着仅仅在智能助手上线前做一次测试远远不够。团队必须持续评估,因为底层模型会更新、业务流程会变化、用户行为会迁移、新数据会不断涌入。
更重要的是,这些评估必须连接实际的业务成果,而非仅仅依赖行业基准。例如,一个AI画图工具可能在人像生成上得分很高,但如果用户实际需求的场景是建筑渲染,那么通用基准就没有意义。Waymo会为每一个评估结果配套提供数据集属性的说明,让使用者能够判断测试结果的可信度。这种“透明评估”的方法,正是企业AI赛道中许多AI独角兽所欠缺的。
安全第一:如何测试罕见危险场景
Waymo的评估体系始终围绕一个压倒性的目标:安全。公司使用第一方驾驶日志、第三方数据以及能够模拟数十亿英里合成里程的仿真环境,将系统暴露在各种各样的场景中。任务负责人会为弱势道路使用者、铁路道口、施工区域等复杂环境选择专门的数据和指标。
这一原则同样适用于非自动驾驶领域。企业在部署智能助手时,不仅要测试那些常规请求的处理能力,更要测试那些罕见的、可能造成财务、法律、安全或声誉损失的异常场景。例如,一个金融领域的智能助手如果无法正确处理“账户被冻结但用户要求转账”的边界情况,就可能引发严重的合规风险。
Waymo还特别强调,人类监督不可替代。虽然自动化评估能够处理大量常规测试,但生产就绪审查仍然包含大量人工参与。内部安全负责人保留对软件发布和服务区域扩展的最终审批权。Joshi直言:“这不是完全由AI驱动、零人类监督的系统。人命关天。”对于企业智能助手而言,虽然风险等级不同,但法律、品牌声誉同样重要,人类决策者必须保持对关键部署的问责。
数据效率与模型优化:AI独角兽的生存之道
Waymo面临一个与众多企业AI团队相同的困境:计算、存储、内存和网络的需求增长快于可用资源的增长。为了解决这个问题,Waymo在数据提取与存储、分布式训练、模型蒸馏、仿真和评估等各个环节追求效率。
特别值得注意的是“数据效率”——Waymo主动选择最有用的训练样本,而不是默认“数据越多越好”。这一策略与许多AI独角兽盲目堆数据、堆算力的做法形成鲜明对比。在大模型训练中,数据质量往往比数量更重要。Waymo从2017年就开始使用Transformer,随后扩展到LLM、视觉语言模型和视觉语言动作模型,现在已采用生成式多模态模型作为基础模型战略的一部分。
公司在车载系统与离车基础设施之间做了明确分工:每辆车的实时推理需要极致优化,而模型开发、数据处理和仿真则依赖庞大的离车系统。这种架构迫使Waymo同时优化实时推理的效率与支撑系统的规模。对于企业来说,同样的逻辑适用于智能助手的部署——边缘端与云端需要协同优化,而非一味追求大模型的能力。
人类监督与自动化决策的平衡
Waymo并不依赖完全自动化的决策流程。生产就绪审查包括大量人工参与,内部安全负责人拥有最终批准权。这种“人机协作”模式为AI独角兽提供了一个关键启示:即使是最先进的AI系统,也需要明确的人类问责节点。
在Waymo内部,AI还被用作工程师的生产力工具——智能助手帮助分析数据分布、评估数据效率、排查车辆遥测、训练运行和评估任务中的问题。但Waymo同样对这些内部AI助手进行评估,确保它们产生可信、准确的结果,而不是把工程师引向错误方向。
对于企业领导者而言,这意味着部署智能助手时,不能仅仅选择一个强大的模型。组织需要明确的目标、有代表性的评估数据、持续测试、高效运行的底层基础设施,以及指定的人类决策者来承担部署责任。正如Joshi所说:“赢得信任至关重要。”
智能助手评估的通用框架:企业AI赛道的实践指南
Waymo的经验可以提炼为一套面向任何行业的智能助手评估框架:
1. 明确业务目标:评估指标必须直接对应实际业务成果,而非通用基准。例如,一个客服智能助手的评估应关注客户满意度、问题解决率、平均处理时长,而非仅仅模型困惑度。 2. 构建代表性评估数据:数据应覆盖高频场景和罕见边缘情况,包括可能导致风险的场景。企业可以借助AI工具导航找到适合自己行业的标准评估数据集,或自行构建。 3. 持续评估而非一次性测试:模型上线后,评估必须持续进行,因为环境、数据、用户行为都在变化。 4. 人类监督与自动化结合:关键决策点必须有人类参与,确保问责清晰。 5. 关注数据效率:在资源有限的情况下,选择高质量样本比堆积数据更有效。
当前AI赛道上的许多AI独角兽在快速迭代中往往忽视评估的重要性,导致产品事故频发。Waymo的2.2亿英里安全行驶记录证明,慢下来做好评估,反而是最快的安全路径。对于正在构建智能助手的团队来说,不妨从Waymo的“评估成熟度”指标出发,重新审视自己的开发流程——如果你的项目评估体系还不成熟,那么它可能还没有准备好面对真实用户。