在AI生产环境中,GPU内存是最昂贵的资源,也是最容易耗尽的关键瓶颈。随着大模型上下文窗口和多轮对话的普及,AI模型不得不反复重算已经处理过的信息,造成大量GPU算力和内存的浪费。传统思路是将GPU内存视为不可扩展的稀缺资源,而Weka这家AI基础设施公司却提出了一种更聪明的解法:为什么不利用更便宜的存储技术来扩展GPU内存呢?这正是其最新推出的智能工具——NeuralMesh 6软件平台的核心逻辑。该平台与首款自研硬件Wekapod 6一同发布,通过名为Augmented Memory Grid的技术,将NAND闪存聚合起来,以极低的成本模拟GPU内存的行为。这不仅是一次存储技术的升级,更可能重塑AI推理和训练的经济模型。

GPU内存瓶颈:AI推理的“隐形税”

AI大模型的推理过程分为两个阶段:预填充(Prefill)和解码(Decode)。预填充负责计算注意力机制,这是模型理解输入的关键,计算量极大;解码则将计算结果转化为输出,相对轻量。问题在于,在多轮对话(如聊天机器人、编程助手)中,每一轮新交互都会触发对前面所有历史记录的重新预填充。如果用户进行了10轮对话,模型可能多计算了100次注意力;如果达到20轮,这个数字会飙升到400倍。这种“重复计算税”让GPU利用率急剧下降,尤其在长上下文场景下,企业不得不为了处理少量请求而分配大量显存,导致整体效率低下。

Weka联合创始人兼CEO Liran Zvibel指出:“客户现在追逐的是计算资源的可用性,一旦他们从任何人那里获得新的GPU分配,就希望立刻抓取并开始运行,而不是等待数周或数月。”然而,传统存储架构无法满足这种即时性需求。GPU集群的稀缺性已经让AI投资回报率变得难以预测,特别是对于正在构建内部Copilot、客服智能体、软件工程助手或长上下文检索系统的企业来说,GPU利用率已成为制约业务增长的瓶颈。

Augmented Memory Grid:用闪存“偷”GPU内存

Weka的解决方案不是增加更多GPU,而是通过智能工具NeuralMesh 6中的Augmented Memory Grid功能,将NAND闪存当作GPU内存的廉价扩展。具体来说,该技术可以缓存模型在预填充阶段计算出的所有token(即预计算token),当后续同一会话的请求到来时,直接读取缓存结果,无需重新计算。Zvibel表示:“你可以用比共享内存便宜两个数量级的价格部署NAND闪存,我们能够缓存100%的预计算token,因此你永远不需要重做。”

这一技术的关键在于对存储介质的巧妙利用。传统上,GPU内存使用的是昂贵的HBM(高带宽内存),而NAND闪存虽然速度慢,但容量大、成本低。Weka通过软件层优化,使得闪存访问延迟大幅降低,同时利用RDMA网络实现高速数据传输。Augmented Memory Grid实际上是一个分布式缓存层,将预计算token存储在集群中所有节点的NVMe SSD上,通过智能调度算法确保最热的数据靠近GPU。这种架构不仅减少了GPU显存占用,还允许单个GPU服务更多并发请求,从而显著降低推理成本。

NeuralMesh 6四大新功能:从存储到AI原生的跃迁

NeuralMesh 6为AI基础设施带来了四个关键能力,Zvibel称这些功能之前一直在竞争评估中让Weka丢单。

1. 可组合和多租户隔离:支持可组合集群,让主租户获得完整的硬件级隔离(专用CPU、内存和存储)。同时,虚拟多租户通过Weka的RDMA结构实现网络级隔离,单个集群可轻松扩展至1000个租户,配置时间不到30分钟。一个运行50个可组合集群的单一集群,理论上可支持多达5万个租户。这对于需要同时服务多个客户或部门的云服务商和大型企业至关重要。

2. 统一文件与对象存储:大多数存储系统维护两条独立路径——文件路径(用于训练和微调)和对象路径(S3格式,用于推理和云原生工具)。传统方案需要网关进行转换,导致数据实际上存在两份副本。Weka声称同一物理数据可以直接通过任一路径读取,无需转换层或第二份副本,性能比传统S3高出约两个数量级,并采用按容量计费而非按API调用计费。Zvibel特别瞄准了非AWS的GPU云,如Lambda、Nebius、G42和CoreWeave。

3. 元数据优先复制:目标环境在完整数据副本到达之前即可浏览目录结构,数据仅在访问时按需填充。这解决了跨地域迁移的痛点——过去传输PB级数据需要数天甚至数周,现在用户可以在拿到新GPU分配后一个小时内启动运行。

4. AlloyFlash与始终开启的数据缩减:TLC和QLC是两种NAND闪存类型,TLC更快但更贵,QLC更便宜但慢。AlloyFlash在单个集群内混合使用两者,自动将延迟敏感的工作路由到TLC,而大容量工作负载运行在QLC上,既降低成本又不牺牲性能。数据缩减功能默认开启,进一步优化存储效率。

多租户与对象存储:企业级AI部署的实战考量

在AI基础设施中,存储不仅仅是容量问题,更是管理效率问题。企业级部署往往需要同时支持多个团队、多个模型和多个数据管道。可组合集群和虚拟多租户提供了灵活的资源隔离,使得不同项目可以共享同一套存储基础设施而互不干扰。例如,一个大型企业可能同时运行用于内部知识库的RAG系统、用于代码生成的编程助手,以及用于客户服务的对话机器人,每个应用对存储性能、容量和延迟的要求各不相同。NeuralMesh 6通过统一的平台管理这些差异性,同时支持文件接口(适合训练)和对象接口(适合推理),避免了数据在不同系统间反复迁移的麻烦。

此外,这一智能工具对于AI独角兽和初创公司尤为实用。这些公司通常面临GPU资源稀缺、预算紧张的问题,无法像科技巨头那样随意采购高端GPU集群。通过缓存预计算token,它们可以用更少的GPU服务更多的用户,从而提升AI投资回报率。例如,一个AI独角兽在部署NeuralMesh 6后,可能将推理成本降低50%以上,同时将响应速度提升数倍。这种效率提升也间接促进了AI行业的整体创新,因为更多资源可以被释放用于探索新模型和新应用。

值得注意的是,Weka的竞争对手也在积极布局AI基础设施。Dell、NetApp、Pure Storage和VAST在过去两年都调整了产品方向,试图切入AI存储市场。但NAND Research首席分析师Steve McDowell指出:“像Weka和VAST这样的公司才是真正的AI原生数据公司,它们从第一天就在解决这些问题。”他认为Augmented Memory Grid是Weka最清晰的技术领先点。

未来展望:智能工具如何重塑AI基础设施

随着大模型参数规模持续增长、上下文窗口不断扩展(如GPT-4的128K token,甚至未来的百万token),重复计算问题将变得更加严峻。传统思路是等待更快的GPU或更便宜的HBM,但物理定律和成本限制使得这条路越来越难走。Weka的智能工具提供了一种更务实的路径:通过存储技术来弥补计算不足。这类似于超大规模数据中心中使用SSD作为内存缓存(如Intel Optane),但Weka将这一概念推向了极致。

长期来看,这种“存储即内存”的理念可能会催生新的AI架构。例如,未来的模型推理系统可能默认将长上下文的历史记录以预计算token的形式存储在闪存中,GPU只负责增量计算和新生成。这不仅能大幅降低推理成本,还能让小型企业和个人开发者也能运行需要长上下文的复杂应用。同时,这也为AI投资带来了新的方向:投资者不再只关注GPU数量,而是关注整个系统的效率。

对于正在寻找效率工具的企业和开发者,不妨体验一下AI工具导航中的各类AI应用,比如利用AI画图生成设计稿,或者用抠图快速处理图片素材。这些工具虽然与Weka的底层技术不同,但都体现了智能工具提升生产力的共同目标。而Weka的NeuralMesh 6,则是在基础设施层面为AI行业提供了一把关键的钥匙。

结语:从“加GPU”到“用存储”的思维转变

Weka的故事告诉我们,AI基础设施的瓶颈不一定只能用硬件升级来解决。通过智能工具对现有资源进行更高效的利用,往往能带来意想不到的收益。Augmented Memory Grid的出现,标志着存储厂商开始从“数据仓库”角色转变为“AI计算加速器”。对于企业来说,选择合适的基础设施智能工具,将直接影响AI投资回报率和业务竞争力。

未来,随着更多类似AI诗词生成、文生图等创意AI产品的普及,以及企业数字化转型的深入推进,存储与计算的融合将更加紧密。Weka能否在这一波浪潮中脱颖而出,成为AI基础设施的领跑者?让我们拭目以待。