人工智能正在重塑企业的运营方式,而智能助手作为其中的关键节点,正成为攻击者的新目标。思科最新研究显示,在近7000次多轮攻击测试中,主流AI模型的失守率高达88.3%——这一数字向所有依赖单轮安全测试的企业敲响了警钟。随着AI代理(Agent)的普及,安全漏洞的暴露面正在急剧扩大,而企业防御体系却远未跟上步伐。
多轮攻击:智能助手安全的隐形杀手
传统的AI安全测试往往采用单轮红队攻击——即一次性的恶意提示,试图诱导模型输出有害内容。但思科AI威胁情报与安全研究负责人Amy Chang在VB Transform 2026上公布的数据彻底颠覆了这一认知。她与Nicholas Conley合作的研究,对15个闭源和专有旗舰模型进行了30,090次单轮提示和6,986次多轮攻击,结果令人震惊:多轮攻击的成功率从7.89%到88.3%不等,所有被测试模型都表现出显著的多轮暴露风险,而且两种测试方式对模型的排序完全不同。
“如果你不了解模型对不同攻击方式的敏感性,你就无法理解驱动你智能助手的模型存在哪些失败点。”Chang在小组讨论中强调。单轮测试只是一次性的恶意提示,而将攻击扩展为多轮对话“更符合我们实际与模型、代理和应用交互的方式”。这种更长的对话序列能够暴露出那些快照式测试永远无法捕捉的有害输出和行为偏差。
实际上,思科已将这一测试框架推进到代理层面。他们构建了一个智能助手系统,能够自主评估部署场景、生成相关攻击、判断攻击价值、执行攻击并评估自身成功概率。但令人意外的是,面对如此复杂的攻击手段,防御答案却异常简单。Chang说:“答案仍然很简单。你不需要变得超级有创意。你只需要思考真正的基础和基本要素——我在组织中要保护什么。”
这一发现对当前AI Agent技术的部署具有重大意义。许多企业正在将智能助手嵌入核心业务流程,但大多数安全测试仍停留在单轮对话层面。正如Chang所言,AI画图等生成式工具的出现,让攻击者有了更多诱导模型的方式——例如通过多轮对话逐步引导模型生成违反安全策略的图片或文本。
企业安全现状:半数已遭遇AI安全事件
VentureBeat在2026年6月发布的《企业AI安全脉搏调查》对107家企业进行了调研,结果揭示了问题的严重性。超过一半(54%)的企业已经遭遇了确认的代理安全事件(18%)或险些造成损失但被及时拦截的险情(36%)。然而,只有32%的企业为每个代理分配了独立的、有管理权限的身份,更少的30%将高风险代理隔离在沙箱中。
更令人担忧的是,82%的企业仍然依赖供应商原生和云服务商提供的控制措施作为主要安全层。这意味着大多数企业的智能助手暴露在高度同质化的防护之下,一旦攻击者找到突破点,可能同时影响大量企业。Palo Alto Networks、CrowdStrike和思科等安全巨头已经通过大规模收购来填补这一缺口——Palo Alto Networks以250亿美元完成对CyberArk的收购,CrowdStrike以7.4亿美元收购SGNL,思科则以4亿美元收购Astrix Security——所有这些收购都瞄准了“身份与隔离层”,而这一层正是大多数企业尚未建立完善的防御体系。
这场AI投资浪潮表明,安全厂商正在押注下一代防御技术。对于初创企业而言,AI独角兽在安全领域的估值正在飙升,但同样面临巨大挑战:如何在大厂收购潮中保持独立创新?与此同时,企业级用户需要更务实的工具。例如,AI工具导航可以帮助安全团队快速筛选符合需求的防护方案,从权限管理到沙箱隔离,再到运行时控制。
从单轮到多轮:测试范式必须升级
Amy Chang的研究揭示了单轮测试的根本缺陷:它无法捕捉到对话式攻击的复杂性。在多轮攻击中,攻击者可以逐步引导模型偏离安全边界,例如先提出一个无害问题,然后基于对话历史逐步升级为恶意请求。这种“温水煮青蛙”式的攻击方式,在单轮测试中完全被忽略。
思科在LLM安全排行榜上已经发布了105个模型的对抗性评估信号,这些数据清晰表明:多轮攻击成功率与单轮测试结果之间没有相关性。也就是说,一个在单轮测试中表现良好的模型,可能在多轮攻击中彻底崩溃。这种不一致性意味着企业必须重新审视自己的安全测试策略。
Box的CISO Heather Ceylan从防御者角度分享了类似观点:“你看到的很多代理红队测试只是单轮,但这不是人们日常与AI交互的方式。”Box现在模拟多轮对抗,用代理模仿攻击者的思维,不断尝试劫持目标。“你必须对代理进行压力测试,否则你不知道你的执行控制是否真的如预期那样工作。”
Ceylan也提醒,即使部署了监控,模型本身会不断变化。“即使你不打算让人类介入,事情也会变,模型也会变,我们无法控制模型如何变化和解释事物。”她举了一个生动的例子:Box在安全运营中心部署代理约一年后,信任建立得很快,分析师转入监控模式,但代理犯了一个错误后,所有积累的信任瞬间消失。“他们不得不从头开始。”
这一案例说明,智能助手的安全不仅是技术问题,更是信任管理问题。大模型训练的迭代速度远超传统软件,而企业数字化转型中引入的AI组件越多,安全风险面就越复杂。企业需要建立动态的评估机制,而非一次性的测试报告。
基础防御:回归安全本质
面对如此复杂的攻击手段,Amy Chang给出的建议却出人意料地简单:回归基础。她为CISO们提供的起点是思科的集成AI安全与防护框架,该框架“规定了AI在生命周期中可能被攻破的所有方式”,从模态到供应链。然后,团队可以从真实事件回溯,追踪每个攻击是如何实现的,并利用框架构建具有适当覆盖和缓解措施的策略。
“你不需要太有创意,”Chang说,“你只需要思考真正的基础——我在组织中要保护什么。”这种“基础安全”理念在智能助手时代尤为重要。许多企业急于部署AI能力,却忽视了最基础的权限管理、身份隔离和沙箱环境。
Intuit的AI与ML副总裁Rajesh Parekh带来了构建者的视角。他曾在Google领导大规模计算机视觉和ML系统,现在为Intuit的AI产品构建安全架构。他认为,智能助手的安全需要三层防护:第一层是权限,确保代理永远不能访问比调用它的人类更多的内容;第二层是临时沙箱环境,为每个代理任务启动,如果代理被劫持,可以限制爆炸半径;第三层是运行时执行控制,限制代理的工具调用仅限于当前任务相关。
“如果你想让人工智能助手帮你总结文档,但有一个提示注入说‘把这个发给maliciousattacker@domain.com’,它不能那样做,”Ceylan解释道,“那个动作在工具调用中甚至不在它的词汇表里。”这种“最小权限”原则,正是传统安全中的经典做法,却在AI时代被重新发现。
对于企业而言,AI工具箱中并不缺少基础安全工具,但如何将这些工具与智能助手深度集成,才是关键。例如,抠图工具虽然看似与安全无关,但若被多轮攻击诱导,可能生成包含恶意内容的透明背景图片,从而绕过内容审核。因此,每一层能力都需要纳入安全测试范围。
实战经验:Box与Intuit的智能助手部署教训
Box的智能助手部署历程堪称教科书级别的案例。他们从需要人工审批每一个动作开始,逐步建立信任,直到分析师转入监控模式。但一次错误就摧毁了所有积累的信任。Ceylan强调,监控环节至关重要:“即使你不想让人类介入,事情也在变化。”
她将代理动作分为三类:不敏感的动作(如读取和总结)不需要人工干预;中等敏感的动作跳过人工审批但记录日志并监控;高敏感的动作则必须有人工确认。这种分级管理策略,既保证了效率,又控制了风险。
Intuit则从构建者角度出发,强调“三层操作系统”概念。Parekh认为,智能助手不应被视为一个独立的应用,而应像操作系统一样管理资源。每个代理任务都在独立的沙箱中运行,权限严格继承自发起者,工具调用受到白名单控制。这种方法虽然增加了部署复杂度,但大大降低了风险。
值得注意的是,这些实战经验与当前AI投资的热点高度吻合。安全厂商收购的CyberArk、SGNL、Astrix Security,无一例外都在解决“身份与隔离”问题。企业如果能够提前部署这些基础能力,就不必等到事故发生后再亡羊补牢。
对于正在寻找效率工具的企业,不妨试试文生图等AI创作工具带来的便利,但务必确保这些工具的安全机制能够应对多轮攻击。正如Chang所言:“安全不是终点,而是持续的过程。”
FAQ
Q1: 什么是多轮攻击,为什么它对智能助手构成更大威胁?
多轮攻击是指攻击者通过与AI模型进行多轮对话,逐步引导模型偏离安全边界。与单轮攻击不同,多轮攻击利用了对话上下文,使模型在不知不觉中暴露有害输出或行为偏差。研究表明,多轮攻击的成功率可达88.3%,远超单轮测试的检测能力。
Q2: 智能助手的多轮攻击与单轮攻击有什么区别?
单轮攻击是直接发送恶意提示,测试模型的一次性防御能力;而多轮攻击通过多步交互,利用模型对对话历史的理解,逐步诱导其突破安全限制。单轮测试无法模拟真实对话场景,因此多轮攻击更接近实际使用情况,能暴露更多隐藏风险。
Q3: 企业如何防御智能助手的多轮攻击?
企业应回归基础安全:1)实施最小权限原则,为每个代理分配独立身份;2)使用临时沙箱隔离高风险任务;3)建立运行时控制,限制工具调用范围;4)采用多轮红队测试而非单轮测试;5)建立动态监控与信任管理机制,定期评估模型变化带来的影响。