随着AI写作、大模型推理等场景的爆发式增长,传统存储架构正在遭遇前所未有的挑战:内存(HBM)虽然速度极快但容量有限,固态硬盘(SSD)容量大却延迟过高。这种“存储断层”让AI应用在数据吞吐效率上始终无法达到理想状态。正是在这一背景下,SK海力士与闪迪联合宣布,将在2026年闪存峰会(FMS 2026)上正式发布高带宽闪存(HBF)的首个标准规范。HBF作为介于HBM和SSD之间的新型存储层级,既具备近内存级的带宽,又拥有NAND闪存的大容量特性,有望成为AI写作系统乃至整个AI基础设施的“数据动脉”。

HBF:填补内存与硬盘之间的存储鸿沟

如果说HBM是AI芯片的“高速缓存”,SSD是“长期仓库”,那么HBF就是两者之间的“装配线”——它需要以极快的速度将数据从仓库搬到缓存,同时自身也要具备足够的容量来容纳海量中间结果。HBF(High Bandwidth Flash)正是为此而生。其核心思路是利用NAND闪存的高密度优势,结合类似HBM的3D堆叠与高带宽接口,实现从0.4TB/s到3.0TB/s的数据传输速率,同时支持最高512GB的容量(通过8层或16层NAND芯片堆叠)。

这种设计直接回应了AI推理中的“存储墙”问题。以AI写作场景为例,大型语言模型在生成文本时,需要频繁读取参数和中间激活值,如果数据从SSD读取,延迟可能高达数十微秒;而HBF可以将数据延迟压缩到接近DRAM的水平,同时容量是HBM的数十倍。这意味着AI写作平台可以本地缓存更多模型权重,从而减少远程调用,显著提升生成速度。

从技术架构看,HBF并非简单的“高带宽SSD”。它采用了与HBM类似的宽接口设计,但底层存储介质是NAND闪存而非DRAM,因此功耗和成本都更具优势。SK海力士将HBF定位为“AI存储层”(AI Memory Layer),专门服务于需要频繁访问大数据集但又不适合使用昂贵HBM的场景。这一思路与当前AI Agent技术中“记忆增强”的需求不谋而合——AI Agent需要实时检索历史对话和知识库,HBF的低延迟大容量恰好能胜任这一角色。

标准规范详解:容量、带宽与互联技术

根据官方披露,HBF首个标准规范定义了两种容量配置:基于8层NAND堆叠的256GB版本,以及基于16层NAND堆叠的512GB版本。带宽方面,规范按三个等级(Grade 1~3)划分,覆盖从约0.4TB/s到3.0TB/s的数据传输速率。值得注意的是,Grade 3级别的3TB/s带宽已经接近HBM2E的带宽水平,而容量却高出数倍。

在互联层面,HBF采用行业标准UCIe(Universal Chiplet Interconnect Express)作为与处理器之间的物理接口。这意味着HBF可以灵活连接GPU、CPU、NPU等不同类型的计算芯片,无需为每种处理器定制专用接口。这种“即插即用”的特性大幅降低了系统集成难度,也使得HBF能够快速融入现有的数据中心架构。对于AI写作平台而言,这意味着未来可以在不更换主板的情况下,直接升级存储子系统来应对更大的模型规模。

此外,规范还定义了电源管理、纠错机制和热管理要求。SK海力士特别强调,HBF的功耗效率优于同等容量的HBM方案,这对大规模数据中心尤为重要——每节省1瓦电力,可能意味着数百万美元的运营成本下降。值得关注的是,该规范由全球最大的开放式数据中心技术合作组织OCP(Open Compute Project)正式发布,而非企业私有标准。这种开放性质意味着任何硬件厂商都可以依据该规范生产兼容的HBF产品,从而加速整个生态的成熟。

在应用层面,HBF与AI画图等生成式AI工具的联系尤为紧密。AI画图模型在生成高分辨率图像时,需要反复加载和存储中间特征图,这些数据量动辄数十GB。HBF的高带宽能将这些中间结果的读写时间从秒级缩短到毫秒级,让用户几乎感觉不到等待。同样,文生图应用在批量处理图片时,也能从HBF的并行数据通道中获益。

开放生态联盟:从OCP到谷歌、Tenstorrent

一个标准能否成功,很大程度上取决于生态系统的支持力度。HBF联盟由SK海力士与闪迪于去年8月发起,今年2月正式成立,目前已经吸引了谷歌和Tenstorrent两家重量级成员。谷歌作为全球最大的AI基础设施使用者之一,其加入意味着HBF有可能被纳入谷歌的TPU集群或云端推理方案中。Tenstorrent则是AI芯片领域的新锐,其RISC-V架构处理器对存储带宽有极高要求,HBF的标准化接口正好契合其chiplets设计理念。

SK海力士表示,计划在FMS 2026期间设立展台,首次公开目前开发进展顺利的第十代(V10)375层4D NAND闪存晶圆和产品。这一代NAND的性能功耗比相比上一代提升2.5倍,特别适用于对能效极其敏感的AI基础设施。基于此NAND闪存的企业级固态硬盘(eSSD)预计将于明年初启动量产,而HBF产品的量产时间表则可能在2026年之后。

值得注意的是,HBF联盟的运作模式与AI工具导航平台颇为相似——通过开放标准降低准入门槛,吸引更多参与者共同构建生态。对于AI应用开发者而言,HBF的普及可能意味着他们不再需要针对不同硬件优化存储访问模式,而是可以依赖统一的API来获得高性能。这种“标准化”趋势与企业数字化转型中强调的“平台化”思路一脉相承。

V10 375层NAND:性能功耗比提升2.5倍

作为HBF技术的底层支撑,SK海力士的V10 375层4D NAND闪存是其存储产品的核心组件。与前代产品相比,V10在堆叠层数、单元密度和能效方面均有显著突破。375层堆叠意味着单个芯片可以容纳更多存储单元,从而在相同物理尺寸下提供更高容量。同时,4D NAND架构通过将存储单元垂直排列并优化电路设计,实现了每比特功耗的显著降低。

SK海力士宣称,V10 NAND的性能功耗比较上一代提升2.5倍。这一数字对于AI数据中心来说意义重大:以一万颗GPU组成的集群为例,如果存储子系统功耗降低50%,年电力成本可节省数百万美元。更重要的是,低功耗意味着更少的热量产生,从而降低散热系统的压力,允许在同等空间内部署更多计算节点。

在接口方面,V10 NAND原生支持PCIe 6.0和OCI(Optical Chiplet Interconnect)等高速协议,为HBF的带宽指标提供了物理基础。当HBF产品采用8层V10 NAND堆叠时,其理论容量可达512GB,而带宽则取决于堆叠高度和接口宽度。SK海力士正在测试将HBF与自家GPU(如HBM接口的AI加速器)直接连接,以验证端到端性能。

对于普通用户而言,这些底层技术可能显得遥远,但最终会体现在使用体验上。例如,使用抠图工具处理高清图片时,如果存储子系统能够快速加载和保存每一层蒙版数据,那么整个抠图过程将变得流畅无比。同样,背景去除功能在批量处理视频帧时,也依赖高速存储来避免卡顿。

对AI写作与数据中心的影响:数据吞吐的加速器

回到AI写作这一核心场景。当前主流AI写作平台(如ChatGPT、文心一言等)在生成长文本时,往往需要花费数秒甚至数十秒。其中一部分延迟来自模型推理本身,但更多延迟来自参数加载和中间结果存储。如果采用HBF,模型权重可以完全驻留在HBF中(容量512GB足以容纳数百个大模型参数),而推理过程中的注意力矩阵、键值缓存等中间数据也可以通过HBF高速读写。

想象一下,未来AI写作工具在生成一篇5000字的文章时,从用户按下“生成”到输出完成,可能只需要不到1秒。这不仅是用户体验的提升,更打开了实时交互式写作的新可能:用户可以在写作过程中随时调整风格、补充细节,而系统几乎无延迟地响应。这种交互模式将彻底改变内容创作流程,从“人机协作”进化为“人机共生”。

从数据中心的角度看,HBF的出现可以缓解“内存墙”和“存储墙”的双重压力。传统上,数据中心需要在HBM(成本高、容量小)和SSD(延迟大)之间做权衡。HBF提供了一种折中方案,使得AI推理服务器的存储层次更加丰富。结合大模型训练中常用的混合精度训练和模型并行技术,HBF可以作为“共享内存池”在不同计算节点之间流转数据,减少网络通信开销。

当然,HBF并非万能。对于需要极低延迟(纳秒级)的场合,它仍然无法替代SRAM或HBM;而对于需要极低存储成本的冷数据归档,它也不如传统HDD。但HBF精准地填补了“热数据”与“温数据”之间的空白,这正是AI应用中增长最快的部分。

行业展望:HBF能否成为下一个存储标准?

回顾存储技术发展史,从SATA到NVMe,从硬盘到固态硬盘,每一次突破都伴随着应用场景的驱动。HBF的出现同样遵循这一逻辑:AI对数据吞吐量的需求正在以每年2-3倍的速度增长,而现有存储架构的演进速度却只有每年30%-50%。这种供需失衡催生了HBF这样的创新。

不过,HBF要想成为主流标准,还需要克服几个挑战:首先,成本问题——NAND闪存虽然比DRAM便宜,但HBF的3D堆叠和宽接口设计会增加封装和测试成本;其次,生态兼容性——虽然UCIe是开放标准,但不同厂商的处理器对HBF的支持程度还需要时间验证;最后,竞争威胁——三星、美光等巨头也在研发类似技术,HBF能否在标准和产品层面占据先机仍有变数。

尽管如此,SK海力士与闪迪的联合动作已经释放了明确信号:存储业界正在从“通用型”转向“AI优化型”。未来,我们可能会看到更多专为AI场景设计的存储产品,比如AI诗词生成器所需的超低延迟缓存、藏头诗工具所需的随机访问加速等。这些细分需求将催生一系列创新存储方案。

对于内容创作者和开发者而言,HBF的普及意味着他们可以使用更便宜、更高效的存储来运行AI应用。一个典型的例子是:未来AI写作平台可能不再需要将模型参数全部放入GPU显存,而是将大部分参数存储在HBF中,按需加载。这将大幅降低AI应用的硬件门槛,让更多中小企业和个人开发者能够使用大规模语言模型。

总而言之,HBF标准规范是AI存储领域一个里程碑式的事件。它不仅是技术演进的必然产物,更是AI写作、AI画图、AI视频生成等应用走向普惠化的重要基础设施。当数据不再成为瓶颈,AI的想象力才能真正释放。