留言

国产企业在AI存储领域的深耕表现

随着全球权威评测机构MLCommons于9月1日发布MLPerf Storage v3.0基准测试结果,焱融全闪存储F9000X在多项测试中取得领先地位,展示了其在高度AI训练负载下对网络带宽的高效利用能力。随着AI行业逐步从模型训练走向大规模推理,存储系统面临的数据处理任务不断增加。在训练阶段,存储需快速向GPU提供大量数据,并保存模型状态;而在推理阶段,又需要高效管理不断增长的KV Cache。单一存储产品已经难以满足AI全流程的需求。

焱融围绕AI训练与推理场景,构建了完整的全栈存储解决方案。F9000X的测试表现显示其在训练阶段的实力,特别是新增的KVCache测试用例,进一步扩展了其在AI场景工作负载下的应用范围。近期推出的YRCache ContextBox一体机专为AI推理而设计的KV Cache存储方案,则彰显了其在KV Cache管理和共享复用方面的能力。

在大模型训练中,存储系统必须持续、高效地为不断增加的GPU提供数据,否则可能导致利用率下降。同时,Checkpoint的写入性能直接关乎模型训练中状态的保存及恢复时间。焱融的F9000X作为全闪存储产品,在经验丰富的测试环境中实现了544GiB/s的聚合带宽,创下最高记录。这较之前的478GiB/s有了显著的提升,彰显了对GPU数据供给的高效能力。 龙8头号玩家

在Checkpoint测试中,焱融集群实现了539GiB/s的读带宽和314GiB/s的写带宽,这一出色表现为千亿级、万亿级模型训练的关键数据存档和恢复提供了基础保证。更快的读取和写入速度可大幅减少训练中断带来的算力浪费,也有利于企业降低整体硬件投资。

随着AI进入推理阶段,存储系统将重心转向上下文的管理和复用,长文本和多轮对话产生的KV Cache若无法有效保存,模型将需重复计算同一上下文。对此,焱融推出了AI原生推理存储系统YRCache,统一管理不同层级的KV Cache资源,并合理卸载部分缓存到主机内存和本地SSD,以减少重复计算。

YRCache的多层缓存架构有效分配了资源,其中包括了GPU HBM用于保存活跃KV Cache,主机DRAM用于承载暂时存放的缓存,本地SSD则使用更大容量以支持更多缓存。此外,传统共享分布式存储用于长期保存模型、数据集及Checkpoint等数据。随着推理集群的扩展,焱融为G3.5共享缓存层的能力引入了新的解决方案,推出了YRCache ContextBox一体机,以更好地满足长上下文的存储需求。 龙8头号玩家

本赛季英超仅有三队未尝胜绩:热刺、伯恩茅斯与富勒姆 六部口碑极佳的军旅剧,展现国产剧的真实实力