智能助手正在成为企业自动化流程的核心引擎,但高昂的模型调用成本让许多团队望而却步。当每个任务都发送给最强大的模型,账单会迅速攀升;而自行构建路由逻辑将简单任务分配给廉价模型,又变成一项需要持续维护的工程。Nvidia近日开源了Nemotron 3.5 Lightning模型与NeMo Switchyard路由库,通过动态分配任务,在自有测试中将成本降至原先的三分之一,为AI赛道注入全新思路。这一组合不仅降低了智能助手的运营门槛,更让AI投资者看到了开源生态下成本优化的可行性。
智能代理的困局:成本与效率的博弈
企业运行7×24小时的AI代理时,始终面临同一个核心矛盾:要么将所有任务交给前沿模型,导致费用失控;要么自己编写复杂的路由逻辑,将简单任务导向廉价模型,但这又需要投入大量工程资源,且每次工作流变更时都要维护。这种两难场景在智能助手领域尤为突出——一个典型的客服智能助手,可能需要处理从简单查询到复杂推理的多种任务,如果固定使用单一模型,要么浪费算力,要么能力不足。
实际上,模型路由并非全新概念。OpenRouter、LiteLLM等平台早已允许开发者跨多个提供商分发流量。但问题在于,这些工具通常只做静态路由,无法根据任务进行中的状态变化动态调整。例如,智能助手在调用工具后返回了错误结果,或者一个原本看似复杂的步骤实际很简单,固定模型选择无法适应这些实时变化。这种僵化使得智能助手的成本优化始终停留在“一刀切”层面,无法真正实现精细化运营。
当前AI赛道的竞争正从“模型参数竞赛”转向“成本效率竞赛”。阿里巴巴、Moonshot、智谱、DeepSeek等中国厂商纷纷发布开源模型,性能逼近前沿,但体积和价格更低。Meta也推出了30B参数的开源智能代理模型Muse Glimmer。开源权重在几个月内就从差异化优势变成了行业标配,Nvidia的发布恰好落在这个转折点上,而非领先于它。
Nvidia的双重解法:Lightning模型与Switchyard路由器
Nvidia的解决方案同时触及问题的两端:一是发布了Nemotron 3.5 Lightning——一个300亿参数的开源混合专家模型,专为高并发、专业化智能代理任务设计;二是推出了NeMo Switchyard——一个开源路由库,能够将智能代理工作流的每一步都分配给最适合的模型。
根据Nvidia官方数据,Lightning的推理速度比同类模型快4倍,在代理任务上比Qwen3.6-35B快约30%,同时保持相同精度。当与Switchyard配合使用时,该组合能在维持前沿级任务完成率的前提下,将基准测试成本降至仅使用Opus 4.8时的约三分之一。这个数字对任何关注AI投资回报率的团队来说都极具吸引力。
“模型+路由”的配对才是关键。单独一个模型解决不了成本问题,单独一个路由器也没有高效模型可路由。Nvidia赌的是:在模型层和路由层同时应用开源,才能真正推动智能代理AI的成本曲线下降,而不是仅靠一个更便宜的模型,或者一个附加在他人堆栈上的更智能的路由器。
Switchyard的真正对手并非其他开源模型,而是Not Diamond(已为OpenRouter的Auto模式提供支持)和RouteLLM(UC Berkeley与LMSYS的开源框架)。这两者都不提供自有模型。Nvidia的优势在于,在一个开源许可下同时拥有模型和路由器的决策权,这是纯路由器或纯模型竞争者无法比拟的。Nvidia生成式AI副总裁Kari Briski在简报中表示:“这就是模型系统的力量——为工作流的每一步匹配最合适的模型。”
Switchyard路由机制:如何动态匹配最优模型
Switchyard解决的核心问题是:随着智能代理在任务中推进,合适的模型会发生变化。代理的状态会随着工具返回结果、出现错误或某个步骤变得常规而非复杂而不断变化,固定模型选择无法适应任何这些变化。
Switchyard提供了多种路由策略,而非单一静态分类。Briski描述了这些策略:“它有很多种路由策略——随机路由器(效果不佳)、代理状态路由器、分类路由器等。根据你的路由策略,它会选择最佳模型。在某些情况下,你可能希望使用Lightning这样高效的模型,如果路由器在你的模型池中配置了Lightning,它就会选择它。”
成本直接进入路由决策,而非事后考虑。Switchyard可以评估模型的“冗长度”——即给定模型针对某个任务倾向于生成多少token——并利用这个预测在工作调用之前将任务导向更便宜的选项。这种预测性成本路由是智能助手实现精细化运营的关键技术。
为了让路由方案不变成另一个集成工程,Nvidia将合作伙伴分为两组:直接调用Switchyard的代理框架(包括Cognition、LangChain和Nous Research),以及将Switchyard支持集成到自身产品中的LLM网关(包括Kong、LiteLLM和OpenRouter)。Kong甚至在Kong AI Gateway中原生集成了Switchyard。Briski强调:“我们热爱生态,希望确保集成。我们已经与OpenRouter、LiteLLM和Kong合作,他们已集成我们的路由算法,你可以在使用最佳工具的地方直接使用。”
这种设计使得智能助理开发者无需从零构建路由系统,只需在现有工具链中调用Switchyard即可。对于企业而言,这意味着可以快速将AI工具导航中的各类模型组合起来,而无需担心底层兼容性问题。
实际案例验证:成本降低与性能保持
Nvidia分享了九家测试Switchyard公司的结果,其中多家给出了具体数据。这些案例证明了智能助手路由方案在实际场景中的有效性:
- LangChain在145个多轮Deep Agents任务中,仅将7%的调用路由至前沿模型,就实现了74%的成本降低,精度仅下降6%。 - Ramp报告称,在Ramp SWE-Bench测试中,其性能与前沿模型持平,同时成本降低58%,运行时间缩短33%。 - Cognition将Switchyard的分阶段路由器集成到Devin Desktop中用于内部使用,在FrontierCode Main基准上达到接近前沿的性能,同时平均成本比将所有任务路由到单个前沿模型降低了28%。
这些数据表明,智能助手通过智能路由,完全可以在不牺牲质量的前提下大幅削减开支。对于关注AI投资回报的企业来说,这意味着采用开源路由方案可能比采购昂贵的前沿模型更划算。
值得注意的是,Switchyard并非试图取代OpenRouter等现有路由平台,而是作为补充层存在。它允许开发者保留现有模型池,同时获得更精细的按步骤路由能力。这种兼容性设计降低了采用门槛,使智能助手团队可以渐进式迁移。
Lightning模型架构与性能优势
Nemotron 3.5 Lightning本身是一个独立开源模型,专为高并发、专业化智能代理任务设计,而非通用用途。它扩展了Nvidia在2025年12月随Nemotron 3系列引入的混合Mamba-Transformer、潜在混合专家架构,该系列也包括Nemotron 3 Super(Nvidia在后续训练比较中用作Lightning的基线)。
在Switchyard这样的路由设置中,Lightning定位在决策路径的快速、廉价端,而非前沿端。但它可以独立于任何路由器运行和部署。模型支持多种推理优化,包括FP8量化、张量并行等,使其在H100等GPU上实现极低延迟。
对于智能助手而言,Lightning特别适合处理高频、重复性任务,如数据提取、简单问答、文本分类等。而当一个任务需要更深层次的推理时,路由器可以自动将请求转发给更强大的模型(如GPT-4或Claude)。这种混合部署模式让智能助手既能快速响应日常请求,又能在关键时刻调用顶级能力。
测试显示,Lightning在代理任务上的平均完成速度比同类模型快30%,而且其输出token数更少(即更简洁),这进一步降低了推理成本。当智能助手需要生成图片描述或创意文案时,可以配合AI画图工具实现端到端自动化。例如,智能助手先路由到Lightning快速生成文案,再调用文生图模型生成配图,整个过程由Switchyard自动协调。
开源生态下的AI赛道新格局
Nvidia的这次发布标志着AI赛道进入“模型+路由”协同竞争的新阶段。过去,开源模型只是闭源模型的廉价替代品;现在,路由技术让多个开源模型组合起来可以匹敌甚至超越单一前沿模型,同时成本更低。
对于智能助手开发者而言,这意味着不再需要“押注”某一个模型。通过Switchyard,可以构建一个动态模型池,随时添加或替换模型,路由器会自动学习最佳分配策略。这降低了对单一模型供应商的依赖,也减少了模型升级带来的迁移成本。
从AI投资角度看,Nvidia的路线图清晰指向“基础设施化”——不再仅仅卖GPU,而是提供从模型到路由的完整软件栈。这种策略可能改变AI投资的逻辑:过去投资者关注模型参数规模和基准分数,现在应更多关注模型的可组合性、路由系统的效率以及生态集成能力。
当然,挑战依然存在。Switchyard需要与现有工作流深度集成,且路由策略的调优需要一定经验。此外,开源路由方案可能面临安全性和隐私方面的顾虑——当任务在不同模型间路由时,数据如何保护?Nvidia表示Switchyard支持本地部署,但企业仍需自行评估。
综上所述,智能助手正在从“单一模型”时代走向“模型系统”时代。Nvidia通过开源Lightning和Switchyard,为这一转变提供了可落地的工具。对于希望控制成本同时保持性能的企业来说,这可能是目前为止最值得关注的智能助手架构之一。不妨通过AI工具箱探索更多开源方案,打造属于你自己的智能助手集群。