在AI算力军备竞赛中,GPU内存已成为最稀缺的资源。当大模型上下文窗口不断扩展、多轮对话成为常态,重复计算早已消耗了90%以上的GPU算力——而绝大多数企业对此束手无策。最新科技动态显示,Weka公司正试图用廉价闪存改写这个游戏规则。其最新发布的NeuralMesh 6平台与首款自研硬件Wekapod 3,通过一项名为Augmented Memory Grid的技术,将NAND闪存聚合为“虚拟GPU内存”,以不到十分之一的成本缓存模型全部预计算token。这一突破不仅有望降低推理成本,更可能引发新一轮AI投资热潮,让AI赛道的底层基础设施竞争走向白热化。
为什么GPU内存成了AI的“阿喀琉斯之踵”?
当代大语言模型(LLM)的推理过程可以分为两个阶段:预填充(Prefill)和解码(Decode)。预填充负责计算注意力机制(Attention),是算力消耗最大的环节,而解码则相对轻量。问题在于,每一次用户输入——哪怕只是多轮对话中的一句追问——都会触发模型重新计算之前所有交互的注意力权重。如果用户进行了10轮对话,模型可能重复计算100次;20轮对话则重复400次。这种“重复劳动”在长上下文窗口场景下尤为致命,直接导致GPU内存被迅速占满,延迟飙升,吞吐量骤降。
传统做法是堆砌更多GPU内存卡,但HBM(高带宽内存)成本极高,每GB价格是NAND闪存的数十倍。更关键的是,即便企业愿意投入,GPU产能也受限于供应链瓶颈,等待周期长达数月。许多AI团队在获得新GPU分配后,还需要花数天甚至数周进行数据迁移和模型加载,造成巨大的资源浪费。
在这样的背景下,存储行业开始重新思考:为什么一定要用昂贵的GPU内存来存储临时计算状态?能否用更便宜的存储介质来“替身”完成这项工作?这正是Weka所抓住的机遇。
闪存“扩容”GPU:Augmented Memory Grid的底层逻辑
Weka的Augmented Memory Grid(扩展内存网格)是NeuralMesh 6的核心功能。其思路听起来简单:将NAND闪存集群通过高速网络虚拟化为一个巨大的缓存池,专门用于存储模型在推理过程中生成的KV(键值)缓存——即注意力机制中已经计算好的token信息。当模型需要处理新的输入时,不再重新计算,而是直接从闪存缓存中读取。
Weka CEO Liran Zvibel表示,团队发现“你可以用两倍于共享内存的成本,买到两个数量级以上的NAND闪存”。这意味着,在相同的预算下,闪存能提供比GPU内存大100倍的缓存空间。因此,Augmented Memory Grid可以缓存100%的预计算token,让模型“永不重做”。
为了保证性能,Weka在软件层面做了大量优化:利用RDMA(远程直接内存访问)网络实现低延迟传输,同时通过智能预取算法,将最可能被访问的缓存数据提前加载到GPU内存中。这样,AI推理的延迟仅增加几分钟毫秒,却能让GPU利用率提升数倍。
这一技术对于AI Agent技术驱动的多轮对话、代码生成、文档分析等场景尤其重要。例如,一个智能客服Agent需要连续处理数十条用户消息,如果没有缓存,每一次交互都会导致前序计算被丢弃,而有了Augmented Memory Grid,整个会话的上下文都可以在闪存中持久化,Agent可以随时“回忆”之前的内容,而无需重复计算。
NeuralMesh 6四大新特性,直击企业AI部署痛点
除了Augmented Memory Grid,Weka的NeuralMesh 6还带来了四项关键更新,旨在解决企业在多租户、数据格式兼容性、数据迁移和成本控制方面的痛点。
1. 可组合与虚拟多租户
大型AI企业通常需要为不同部门或客户提供独立的环境。NeuralMesh 6支持两种模式:可组合集群(Composable Clusters)为“锚定租户”提供完整的硬件级隔离,包括专用CPU、内存和存储;虚拟多租户则通过RDMA网络实现网络级隔离,每个集群最多支持1000个租户,且可以在30分钟内完成配置。一个集群运行50个可组合子集群时,理论上可支持高达5万个租户。这意味着云服务商可以更灵活地出租GPU资源,同时满足合规和安全要求。
2. 统一文件与对象存储
AI训练和推理通常需要同时处理文件(NFS)和对象(S3)两种数据格式。传统存储系统需要网关进行格式转换,导致数据存储两份、性能下降。NeuralMesh 6宣称同一份物理数据可以直接通过文件路径或S3接口访问,无需转换,性能比传统S3高两个数量级。Zvibel特别指出,这一功能瞄准的是非AWS GPU云(如Lambda、Nebius、G42、CoreWeave),这些云平台通常需要高效的对象存储,且按容量计费而非按API调用次数,能大幅降低存储成本。
3. 元数据优先复制
当企业需要将数据从一个GPU集群迁移到另一个时,传统做法是等待完整数据拷贝完成才能开始使用——这可能需要数天甚至一个月。NeuralMesh 6的“元数据优先复制”允许目标环境在数据完全到达之前即可浏览目录结构,并仅在访问时按需填充数据。这使得新GPU集群可以在1小时内“上线运行”,而不是数周。
4. AlloyFlash与全时数据缩减
AlloyFlash是一种混合TLC和QLC NAND闪存的技术。TLC速度快、耐用,但成本高;QLC容量大、成本低,但速度慢。NeuralMesh 6允许在一个集群中混合使用两种闪存,自动将延迟敏感的工作负载路由到TLC,而容量密集型任务则运行在QLC上,既降低成本又保证性能。同时,数据缩减功能默认开启,可进一步节省存储空间。
这些特性共同构成了一个面向AI时代的数据管理平台,与传统的企业存储系统相比,企业数字化转型中的AI团队能更快地部署和迭代模型。
存储赛道竞争升级:Weka能否成为“AI原生”赢家?
过去18个月,几乎所有主流存储厂商——Dell、NetApp、Pure Storage、VAST——都重新定位为AI基础设施供应商。但NAND Research首席分析师Steve McDowell认为,像Weka和VAST这样的公司才是真正的“AI原生数据公司”,它们从第一天起就为解决AI问题而设计,而传统厂商更多是在原有产品上做“贴牌”适配。
McDowell特别指出,Augmented Memory Grid是Weka最清晰的技术领先点。“Weka拥有市场上技术最成熟的KV缓存实现,且一直在创新。这对于AI推理至关重要,因为它直接节省GPU和内存成本。”
然而,竞争并非一边倒。Dell和NetApp拥有庞大的客户基础和服务网络,Pure Storage在NVMe全闪存阵列上积累了深厚口碑。Weka的挑战在于:如何说服客户为“AI原生”支付溢价,同时证明其方案在超大规模部署中的可靠性。
从AI投资角度看,Weka的最新融资和产品发布可能会吸引更多资本关注AI基础设施赛道。毕竟,当GPU本身成为稀缺品时,任何能提升GPU利用率的方案都具备巨大的商业价值。
从技术到商业:AI投资与AI赛道的新风向
Weka的案例揭示了AI基础设施领域的一个关键趋势:瓶颈正在从“算力不足”转向“内存不足”。随着模型参数规模趋于稳定,上下文窗口成为新的军备竞赛点——Google Gemini 1.5 Pro支持100万token,Claude 3.5 Sonnet支持20万token,而这些长上下文场景恰恰是KV缓存问题的重灾区。
因此,未来AI赛道的胜负手将不再是单纯堆砌GPU,而是如何构建高效的存储-计算协同架构。Weka的做法代表了一种“存储即内存”的思路,类似的技术路线还有VAST的“离散内存架构”和NVIDIA收购Mellanox后推出的“GPU Direct Storage”。
对于创业者和投资者而言,这意味着新的机会窗口:KV缓存中间件、AI数据编排平台、混合内存/闪存硬件设计等方向都可能涌现出独角兽。同时,企业级用户在选择AI基础设施时,也应将存储性能纳入核心评估指标,而非仅仅关注GPU型号。
当然,技术从来不是孤立存在的。Weka的NeuralMesh 6能否真正落地,还取决于它与主流AI框架(如PyTorch、TensorFlow、vLLM)的集成深度,以及客户是否愿意接受软件层面的改变。但无论如何,这场“存储革命”已经吹响了号角。
未来展望:AI与存储的深度融合将走向何方?
展望未来,AI推理的“存储-计算”融合只会越来越紧密。随着CXL(Compute Express Link)等互联技术的成熟,闪存与GPU内存之间的界限可能进一步模糊。Weka的Augmented Memory Grid可以看作这种趋势的早期探索,而大模型训练场景下的数据缓存需求同样巨大。
对于普通用户而言,这些底层技术或许看不见摸不着,但它们带来的影响却非常直观:更便宜的API调用成本、更流畅的对话体验、更快的AI应用迭代。想象一下,当你在使用AI画图工具生成创意图片时,背后可能就有类似的技术在支撑;当你尝试AI诗词生成器写一首藏头诗时,复杂的上下文缓存正在让模型“记住”你之前输入的每一句。
如果你正在寻找提升AI工作效率的工具,不妨试试AI工具导航,那里汇集了众多AI应用,或许能帮你发现更多惊喜。