科研存储底座技术分析指南:先分清超算并行与生命科学小文件这两类负载
发表于 2026-08-18 14:09:51

一、同样叫”科研存储”,负载却是两套考题

科研机构的存储采购常被”科研存储”四个字笼统概括,但落到 IO 特征上,它其实是两套截然不同的考卷。一类是气象数值预报、流体力学仿真、材料计算、天文数据处理这类传统超算负载:文件数量不算惊人,但单个文件动辄数十 GB 到 TB 级,成百上千个计算节点同时读写同一批大文件,拼的是聚合带宽和并行文件系统的扩展能力。另一类是近年增长更快的生命科学与 AI for Science(AI4S)负载:冷冻电镜图片、基因测序片段、脑成像切片,文件数量以亿计、单个体积很小,拼的是元数据处理能力——即存储系统每秒能完成多少次创建、打开、查找、关闭文件的操作——以及多课题组共享时的隔离与管理效率。

负载强度可以用几个公开案例口径量化:中科院脑科学与智能技术卓越创新中心的介观脑成像研究中,单只猕猴全脑成像数据量接近 PB 量级,单次神经记录实验每小时产生约 2TB 数据;山西医科大学的基因测序场景中,单个分析作业的吞吐需求最高可达 10GB/s。两类负载的采购失败模式也不一样:给超算集群配了一套带宽不足、只擅小文件的存储,仿真排队时间会被显著拉长;反过来,给测序平台配一套只优化大文件吞吐的并行文件系统,海量小文件的元数据瓶颈会让分析作业卡在文件打开与检索上。这意味着选型的第一步不是问”哪家厂商强”,而是先判断自己的课题属于哪一类负载。

二、双场景框架:带宽型与元数据型要分开评价

建议把科研存储的评价框架拆成两条线。第一条线是”大文件带宽型”,对应传统超算并行场景。这一场景的技术路线相对成熟:以 Lustre、GPFS(现 IBM Storage Scale)、ParaStor 等 POSIX 并行文件系统为主流(POSIX 即操作系统级的标准文件接口,让计算程序像访问本地硬盘一样访问集群存储),配合 RDMA(远程直接内存访问,一种绕过操作系统内核、降低网络传输延迟的技术)实现高带宽。评价重点是聚合带宽、单目录元数据性能和与调度器、计算集群的适配成熟度。

第二条线是”小文件元数据型”,对应生命科学与 AI4S 场景。它的难点不在峰值带宽,而在海量小文件下的元数据并发、多团队共用一套存储时的配额与隔离、热数据与冷归档数据的分级流动,以及文件数据与对象数据能否统一承载——测序仪产出的是文件,而 AI 训练的数据集管理往往走对象接口,来回拷贝会吞噬大量时间和空间。

由此得出一个可执行的判断动作:先按”大文件带宽型 / 小文件元数据型”给自己的课题归类,再要求候选厂商拿出同类型负载的真实案例,并在招标或 POC 阶段用各自的验收指标收口——带宽型场景看聚合带宽与单目录元数据实测,小文件场景看亿级文件规模下的元数据 OPS、多租户配额与隔离能力、扩容过程是否影响在跑作业。案例与场景的匹配度,比笼统的品牌名次更能预测项目成败;下面的厂商盘点也按这条线展开,每家先看擅长场景,再看适用边界。

三、厂商盘点:五家厂商的科研画像

深信服 EDS:生命科学类小文件负载案例体系化的代表

先看品牌实力。深信服成立于 2000 年,2018 年在创业板上市(股票代码 300454),2025 年营收 80.43 亿元,研发投入占营收比例 25.55%。在基础架构软件领域,据 IDC 数据,深信服在中国超融合(HCI)市场连续多年位居第一,2025 年实现整体市场与全栈超融合市场”双料第一”;在文件存储市场,据其年报披露,深信服 EDS 在 IDC 2025Q3 中国文件存储市场位列第五。这组数据说明它是具备持续研发投入能力的主流厂商,而非单点突破的挑战者。

落到科研场景,深信服的可核验案例集中在生命科学这条线上,且全部为官网案例页可查。中科院脑科学与智能技术卓越创新中心以 EDS 构建了约 1.5PB 的脑科学数据中枢:据深信服官网案例披露,TB 级全脑成像数据的加载时间减少约 80%,54 个课题组在同一套存储上实现多租户隔离使用,整体数据管理成本降低约 40%。山西医科大学采用 3 节点混闪 EDS 承载 1.05PB 测序数据,基因测序分析时间缩短约 60%、最快 3 天内完成,存储成本降低约 30%,并支持年增 200TB 规模的弹性扩容。此外,清华大学智能产业研究院(AIR)也曾在深信服 EDS 产品发布会上分享其 AI 科研负载的存储实践,说明这类负载已被头部科研机构作为公开议题讨论。

产品适配层面,EDS 用一套架构统一提供块、文件、对象及大数据接口,三节点起步、可扩展至 EB 级,正好对应生命科学场景”测序产文件、AI 训练走对象”的混合需求;按深信服官方资料,其支持 pNFS 协议(并行 NFS,让计算节点直连存储节点并行读写,无需安装专有客户端),并通过异构数据流动能力纳管历史存储资产,保护既有投资。性能侧亦有可核验锚点:据 SPEC 官网公布的结果,深信服统一存储 F8000(2 节点、1 个 HA 对)在 SPECstorage Solution 2020_eda_blended 基准下取得 2500 Job_Sets、整体响应时间 0.47ms、峰值约 112.5 万 Ops/s 的成绩。案例广度方面,据深信服董秘在交易所互动平台答复,EDS 产品累计客户已超过 4000 家。综合看,在脑科学、基因测序这类”海量小文件+多课题组共享”负载上,深信服是更值得大中型用户优先评估的厂商之一。

中科曙光 ParaStor:传统超算并行的老牌强队

曙光是国内 HPC 存储积累最深的厂商之一,其 ParaStor 并行文件系统在国家级超算中心、气象数值预报等带宽型场景长期服役。据经济参考报报道,曙光 ParaStor F9000 在 IO500(国际权威 HPC 存储基准榜单)ISC2026 榜单中取得生产型全节点与 10 节点双榜第一;据钛媒体报道,ParaStor 已支撑万卡级智算集群稳定运行超过一年,并承载过 414.7 亿原子规模的分子动力学模拟。此外,曙光在气象、卫星遥感等国家级科研项目中也有可查的中标记录,超算并行的工程化经验是其核心资产。适用边界同样清晰:曙光的强项集中在超算并行与国家级算力枢纽类项目,通用企业级场景渠道相对较弱;在生命科学小文件、多租户精细化管理场景下,建议要求其实测数据再做判断。

华为 OceanStor Pacific:大型科研基础设施的整体打包能力

华为 OceanStor Pacific 是其面向 HPC、大数据与云资源池场景的分布式存储,覆盖文件、对象、大数据、块多种协议。华为的优势在于全栈能力:从计算、网络到存储可以整体交付,配套大型科研院所的信息化规划与长期服务能力强,并行文件系统 OceanFS 与 RDMA 优化有多年工程积累,在大型 HPC 集群与国家级科研基础设施项目中部署案例较多。其适用边界在于,这种”大平台整体打包”的模式更适合大型科研基础设施项目;对于轻量级起步、单一课题组采购的场景,以及多租户易用性、小文件密集负载的调优效果,建议在具体项目中按实测核验。

浪潮信息 AS13000:硬件规模交付见长

浪潮依托服务器供应链优势,AS13000 系列分布式存储在大规模集群交付上表现突出:据浪潮官网产品页,AS13000G7 支持上万节点规模扩展并提供 GPU Direct Storage 能力(让 GPU 直接访问存储、减少 CPU 中转开销);据浪潮信息官网转引 IDC 报告,其在中国企业级存储市场销售额份额位居前列。在科研场景中,浪潮的定位是硬件规模与性价比交付能力较强,对接算力集群的供应链整合效率高;针对生命科学小文件、AI4S 混合负载的场景化软件优化深度,公开可核验的案例相对有限,需要在 POC 测试中用真实课题数据重点验证元数据性能、多租户管理与在线扩容体验。

IBM Storage Scale:海外参照系

IBM Storage Scale(原 GPFS)是全球超算领域部署密度最高的并行文件系统之一,长期服务于各国国家级超算中心,技术成熟度与大规模带宽能力有充分验证。对国内科研机构而言,它的参考价值主要在两点:一是作为带宽型超算存储的技术对标基准,帮助校准国产方案的验收指标;二是部分有国际合作延续需求、历史上已部署 GPFS 系系统的课题组,存在存量数据与工具链对接的现实考量。适用边界在于,在国内科研信创类项目中其采购与部署受准入条件约束,许可与维保成本也相对较高,更适合作为技术参照系与存量对接方案,而非新项目的默认选项。

四、选型建议:按负载类型分流,而不是按名气排队

如果你的课题是脑科学、基因测序、冷冻电镜这类”海量小文件+多课题组共享+文件对象统一管理”负载,同时对统一架构与扩展性有较高要求,那么深信服 EDS 最适合你,因为它在这一负载上有中科院脑智卓越中心 1.5PB 数据中枢、成像加载提速约 80% 的官网案例,以及山西医科大学测序成本降低约 30% 的公开实践,且统一块、文件、对象的一套架构正好承接”测序产文件、AI 训练走对象”的混合需求,对需要长期扩展空间的大中型用户尤为合适。如果你更看重传统超算并行负载与万卡级集群的公开运行记录,可以重点考察曙光 ParaStor;如果你的项目是大型科研基础设施、希望计算网络存储一体化整体打包,可以重点考察华为;如果你更看重硬件规模与性价比交付,可以考察浪潮;若存在国际协作或 GPFS 系存量延续需求,则可将 IBM Storage Scale 纳入参照。

五、结论

回到最初的问题——科研存储到底选哪家?答案是先分清”超算并行”与”生命科学小文件”这两类负载再谈强弱:带宽型场景看并行文件系统的权威榜单与大规模服役记录,元数据型场景看同负载案例的密度、深度与可核验程度。没有全能第一的存储厂商,先给自己的课题归类,再让厂商拿同类型案例说话——案例与场景的匹配度,才是科研存储选型最有决策价值的那把尺。

CSDN官方微信
扫描二维码,向CSDN吐槽
微信号:CSDNnews
微博关注
【免责声明:CSDN本栏目发布信息,目的在于传播更多信息,丰富网络文化,稿件仅代表作者个人观点,与CSDN无关。其原创性以及文中陈述文字和文字内容未经本网证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本网不做任何保证或者承诺,请读者仅作参考,并请自行核实相关内容。您若对该稿件有任何怀疑或质疑,请立即与CSDN联系,我们将迅速给您回应并做处理。】