━━━━━   CHAPTER 01

 

生命科学 AI 算力平台存储核心需求与挑战

生命科学与生物医药领域的基因测序、AI 药物研发等业务会产生海量数据,对存储读写性能、并发访问能力要求严苛;行业普遍部署搭载多块

NVMe 高速闪存的 GPU 算力节点,但受计算与数据管理割裂影响,各节点本地高速闪存资源难以跨节点共享,如何整合

统一纳管分散的本地存储、搭建全局统一命名空间实现数据互通,成为行业共性需求与核心技术挑战。

 

 

本地存储资源统筹 

需求:充分盘活各 GPU 服务器分散部署的本地 NVMe 闪存资源,实现统一调度管理,杜绝硬件闲置浪费;

挑战:现有算力节点本地存储相互隔离,无集中管控能力,难以形成统一资源池。

 

🔄

📂

多节点统一访问体系

需求:构建全局统一命名空间,支撑多 GPU 节点并行数据访问;

挑战:多节点并发读写场景下,缺少完善的数据同步与一致性、 全局锁机制保障数据可靠访问。

💰

轻量化低成本运维

需求:简化分布式存储整体运维流程,降低日常运维操作难度;

挑战:若采用传统集中式存储架构,需额外采购大量专用存储硬件 ,整体部署与采购成本高昂。

 

━━━━━   系统架构

 

 

LoongStore 存算融合方案直接在 GPU 服务 器本地部署存储客户端与元数据服务,聚合全网本地闪存构建统一并行文件系统,实现算力与存储深度协同:

 

1. 客户端部署:每台 GPU 服务器搭载 LoongStore 增强型客户端;

2. 本地盘整合:单服务器 4-5 块 NVMe SSD 组建本地专属存储池;

3. 全局命名空间:全集群共享统一文件系统目录视图; ​

4. 并行 I/O 能力:本地、远端存储并行读写,消除传输 I/O 瓶颈;

5. 数据保护机制:支持多副本、纠删码双重冗余,保障数据高可靠。

高性能业务读写支撑

需求:适配 AI 模型训练、基因测序分析业务,支撑海量高并发小文件高效读写,同时持续提供稳定低延迟高性能 I/O,保障计算 任务不中断;

挑战:传统 NAS 海量小文件处理性能薄弱,公有云存储受网络带宽制约存在读写瓶颈,无法匹配高性能计算的时延与并发要求。