AI大模型训练推理存储解决方案
银河AI存储 + 碧海高性能对象存储,构建面向AI的数据全生命周期方案
释放GPU算力AI湖仓一体数据智能分层
需求分析
AI训练过程是一个大规模、长时间、高强度的IO密集型过程,其对存储的最大要求就是尽可能提升GPU集群的利用率:
- 海量数据存储:AI训练数据以PB计,要求存储系统具备海量数据的可扩展存储能力;
- 优异读写性能:所有GPU节点参与检查点(Checkpoint)写入存储的完成时间要求分钟级甚至秒级,以减少GPU故障下大量的算力损失;此外,在热点访问规模上,训练任务启动时所有GPU要求分钟级甚至秒级内完成同一份模型文件的加载。存储系统需要具备“高并发、高IO、高带宽、低延迟”的优异性能。
AI推理过程则对存储系统“超高并发、超高带宽、超低启动延迟”提出性能要求:
- 模型加载与部署,一个10+GB模型,要在数秒内加载在数百个计算节点,总带宽要求达到数百GB甚至TB级;此外,首字节启动延迟甚至要求达到微秒级;
- 实时推理数据要求高并发、高吞吐、低延迟读取,P99延迟达到毫秒级。
面对AI训练与推理的性能要求,存力成为制约AI算力的主要瓶颈,而存储系统的软件滞后于硬件的发展,导致400GB InfiniBand、RDMA/RoCEv2网络和存储硬件(NVME SSD)的性能无法完全释放,NVME SSD的性能利用率甚至低于50%。因此,迫切需要面向AI训练和推理的、全新的、优异性能的存储系统,将存储硬件性能完全释放,充分满足AI算力集群对存储系统超高并发、超高带宽、超低延迟的性能需求。
解决方案
霄云银河AI存储 + 碧海高性能对象存储,构建面向AI的数据全生命周期整体解决方案:
1AI训练与推理
- 采用银河AI全闪存储,支持极高并发下的极高带宽吞吐、极低延迟,释放GPU算力集群的计算潜能。
2AI多模态数据湖仓
- 采用碧海高性能对象存储,支持百亿数量、PB级多模态训练数据采集与预处理,百亿级文件/对象性能无衰减。
3数据智能分层
- 银河AI全闪存储作为训练热数据存储层,碧海高性能对象存储作为温数据存储层,两套存储间数据根据访问热度自动高速流动。

方案优势
优异性能
银河AI全闪存储的优异性能,充分释放算力集群的计算潜能,显著提升AI训练和推理的效率。
高可靠
通过高可用硬件架构、多重RAID级别数据保护、多副本或纠删码、异步数据复制,确保数据高可靠。
AI湖仓一体
既承载百亿数量级、PB量级多模态数据,又支撑算力集群数据读写的良好性能。
成本效益
两套存储均可平滑扩容,兼顾性能与成本。
银河AI存储 + 碧海对象存储 —— AI 数据全生命周期底座
服务热线:400-108-0268 | 销售邮箱:sales@shxiaoyun.com.cn