当大多数企业还在纠结于如何撰写一份完美的产品需求文档(PRD)时,Expedia集团的首席人工智能和数据官Xavi Amatriain却抛出了一个颠覆性的观点:未来的PRD就是评估(evals)。在刚刚落幕的VB Transform 2026大会上,这位曾主导Google Gemini和搜索AI平台的前谷歌高管,向与会者描绘了一幅人工智能驱动下的产品开发新图景。在他看来,随着AI辅助代码和AI生成代码成为主流,工程师的思考重心将完全转移到如何定义和编写评估上——这些评估不仅包含功能验证,还嵌入了红队测试、安全审查等全维度要求,甚至要在第一行代码写出之前就完成设计。这标志着人工智能从“辅助工具”向“核心引擎”的转变,也意味着企业必须重新思考AI投资的方向和AI独角兽的成长逻辑。
评估取代PRD:AI产品开发范式正在被重写
“新的PRD就是评估,”Amatriain在大会上直言不讳。他解释,在传统软件开发中,PRD描述了产品“应该做什么”,而评估则量化了产品“是否做到了”。在人工智能时代,由于模型行为的不确定性,这种量化变得尤为重要。Amatriain强调,评估应该包含红队测试、安全合规检查等多种类型,并且必须在编码之前就嵌入到产品设计文档中。“你通过评估来编码你希望产品实现的功能,这本身就包含了一整套安全需求。”
这一观点得到了VentureBeat旗下VB Pulse研究团队的数据支撑。调查显示,在157家受访企业中,66%已经允许或计划在12个月内允许部分生产部署无需人工审核,但只有5%的企业完全信任支撑这一决策的自动评估系统。更令人担忧的是,半数企业曾经历过AI Agent通过内部评估却在真实用户面前失败的尴尬。这暴露了一个深层矛盾:企业急于通过AI投资加速部署,却缺乏可靠的评估体系来兜底。
Amatriain认为,解决这一矛盾的关键在于将评估从“事后检查”转变为“事前设计”。他比喻说,就像建筑师在画图纸时就要考虑承重和防火,AI工程师在设计系统时就要把评估标准写进DNA。他甚至预言:“未来所有思考都会集中在评估上。”这种范式转变,对于正在崛起的AI独角兽而言,意味着竞争壁垒将不再是模型参数规模,而是评估体系的完备性和自动化程度。
有趣的是,Amatriain在Google时就培养了一批后来创立Perplexity和Scale AI的人才,这些公司恰恰是评估驱动型AI产品的典范。Perplexity的搜索评估体系、Scale AI的数据标注评估,都印证了“评估即产品”的理念。
三层治理:用原则、流程和自动化代替硬性护栏
面对AI系统失控的风险,许多企业选择堆砌“护栏”——硬性业务规则和人工审核节点。但Amatriain警告说:“你往系统里塞的护栏越多,效果反而越差。它们不仅脆弱,还会破坏反馈循环,让用户和系统都学到错误的东西。”他把护栏称为“必要的恶”,并强调目标是随着时间推移最小化其影响。
替代方案是什么?Expedia采用了一套三层治理架构。第一层是广泛传播的原则。Amatriain认为,在大型组织中,决策是分布式的,高层原则能够统一决策方向。“如果足够幸运,这些原则可能已经融入文化,但大多数时候并非如此。”第二层是执行这些原则的流程和工具。他形象地说:“原则挂在墙上很好看,但需要赋予它们牙齿。”第三层则是自动化,它位于前两层之上,实现高效执行。
在实践中,这套架构体现为Expedia所谓的“Agent发布关卡”——根据风险等级设置不同的检查点。Amatriain强调:“治理必须与风险挂钩。低风险的事情不需要太多治理,但高风险则必须严格把关。”这些关卡将评估轮次、红队测试和安全审查与Agent的风险等级绑定,随着风险升高,检查从推荐变为强制。
这种灵活的分级治理,与一刀切的硬性护栏形成鲜明对比。它允许企业在AI工具导航上快速探索低风险应用,同时在高风险场景(如涉及支付或用户隐私)建立更严格的防线。值得注意的是,并非所有参会者都同意这个观点。在VB Transform同期讨论中,有发言人坚持认为高风险操作需要绝对牢固的护栏,这反映出行业在AI治理路径上仍存在分歧。
专业Agent胜过单一智能:Expedia的模块化架构哲学
“即使我在Google时,我也不相信AGI(通用人工智能)是一个单一模型。”Amatriain坦诚地表示,“更好的思路是把它看作组合——由多个擅长特定任务的专家Agent组成系统。”这种对未来的判断,直接塑造了Expedia的AI架构。
具体来说,Expedia的架构从组件层开始。组件组合成工具,工具组装成技能,技能聚合成子Agent,子Agent再由编排层整合为完整的Agent系统。Amatriain强调,这种体系需要统一的设计原则来规范语气、用户交互方式、上下文传递和记忆管理等。“这是一个系统工程问题,不是模型问题,也不是某个特定解决方案的问题。”
这种模块化设计带来了显著的安全优势。由于每个Agent的职责范围被严格限定,团队可以在组合前独立评估和锁定单个Agent,从而降低整体风险。例如,一个负责查询酒店价格的Agent和一个负责处理支付的Agent可以完全隔离,即便前者被攻破,也不会影响资金安全。这恰恰是AI Agent技术落地的关键。
Amatriain还指出,专注于特定任务的小模型往往比通用大模型更高效、更可控。他举例说,当用户询问“芝加哥7月四星级酒店通常多少钱”时,Agent应该立即给出缓存答案,因为这个问题不需要实时数据;而如果用户问“密歇根湖边带泳池的宠物友好型四星级酒店”,则可能需要30秒的推理窗口去查询多个数据源。这种按需选择的策略,背后是大模型训练和推理成本的精细平衡。
用户必须保留最终点击:旅行AI的信任边界
旅行行业的价格实时变动、航班时刻每分钟变化、酒店评论与供应商宣传往往矛盾——这些特性让AI Agent的决策变得异常复杂。Amatriain描述了一个结合检索增强生成(RAG)和直接API调用的混合系统,根据延迟要求选择不同路径。
“供应商可能说‘我们有一个很棒游泳池’,但游客评论却显示‘游泳池不怎么样,或者下午6点后就关闭了’。”Amatriain解释道。一个通用的聊天机器人可能只会照搬供应商的自述,而Expedia的Agent会交叉验证自己的评论数据库。
更关键的是用户决策权。“我们不想让Agent替你订酒店或买机票,用户必须保留最终点击的主动权。Agent可以推荐、建议、讨论,但最后那一下点击必须由用户完成,这是不可协商的。”Amatriain认为,这不仅仅是一个设计原则,更是一个安全决策。“一旦你建立了这样的设计原则,你就不需要事后加装护栏了。”
这种“用户最终决策”理念,实质上划定了AI的代理边界。在金融、医疗等高风险领域,类似的边界设计同样重要。例如,AI可以生成处方建议,但最终由医生签字;AI可以推荐投资组合,但由用户确认交易。这给正在探索AI工具导航的企业提供了重要参考:不要试图让AI取代人类决策,而是让它成为赋能工具。
有趣的是,Expedia甚至将这种设计原则延伸到了创意场景。例如,用户可以用AI画图生成旅行灵感图片,但最终选择哪张图片、决定是否出发,仍然是人说了算。这种“人机协同”的伦理定位,正在成为行业共识。
安全左移,下一波攻击者将是AI系统
当被问及AI安全时,Amatriain给出了一个前瞻性的判断:“安全需要尽可能左移,成为设计的一部分。”他警告说,未来的攻击者很可能不是人类,而是其他AI系统。这意味着传统的安全审计和事后补丁模式将失效,企业必须在设计阶段就考虑对抗性攻击。
“安全必须是融入设计的原则,而不是事后添加的补丁。”Amatriain强调。他建议企业将安全评估纳入到“评估即PRD”的框架中,让每个评估都包含安全测试用例。例如,在Agent的发布关卡中,红队测试应该是强制性的,并且随着风险等级提升而加强。
这一观点与当前企业数字化转型的大趋势不谋而合。随着越来越多的企业将核心业务交给AI Agent,安全不再是IT部门的专属责任,而是产品经理、工程师和业务方的共同课题。Amatriain还特别提醒,不要因为追求速度而牺牲安全评估。“66%的企业计划在无人工审核的情况下部署,这太激进了。我们需要的是可靠的自动评估,而不是简单的信任。”
对于AI投资界而言,那些能够提供安全评估工具和框架的初创公司,正在成为新的AI独角兽候选者。例如,Scale AI(由Amatriain的前下属创立)就在数据评估和模型安全领域建立了壁垒。
结语:评估驱动的AI时代正在到来
从Expedia的实践中,我们可以提炼出几条清晰的线索:评估从辅助工具变为核心设计;治理从硬性护栏转向弹性分级;架构从单一模型走向专业Agent组合;安全从事后补救左移到事前设计。这些变化共同指向一个结论——人工智能正在从“黑盒实验”走向“工程化系统”。
对于企业决策者而言,这意味着需要重新审视AI投资策略:与其追逐参数更大的模型,不如投资于评估体系的建设;与其担心AI替代人类,不如设计好“最终点击”的边界;与其堆砌规则,不如建立原则驱动的治理文化。
或许,正如Amatriain所说:“未来,你的所有思考都会集中在评估上。”而评估,正是通往可信、可控、可扩展人工智能的钥匙。