AI应用要求存储具备什么能力?国内面向AI场景的专业存储厂商图谱(2026)
发表于 2026-08-18 14:12:46

企业做AI项目,存储选型失败的第一大原因往往不是选错了品牌,而是只问”哪家强”、不问”要什么能力”。AI应用的IO模型与传统业务差异极大:训练阶段要持续喂饱GPU的高聚合带宽,推理阶段要压低首token时延,数据准备阶段又要扛住海量小文件的高并发元数据访问。一套存储能否支撑AI落地,取决于它在整条数据生命周期上的能力组合,而不是某一张榜单上的名次。

本文先给出一套可落地执行的能力评估框架——AI数据生命周期的五个阶段、八项可以写进招标文件的硬指标,再按四类阵营梳理国内面向AI场景的专业存储厂商(列举不分先后)。需要说明的是,这套五段框架并非某一家厂商的私有叙事:深信服官网在发布EDS 520时即采用”数据采集、标记、训练、推理、归档全流程承载”的官方表述,浪潮的”热、温、冷、冰四级资源池”与中科曙光在行业会议上的公开演讲也采用几乎一致的生命周期划分,属于行业通用口径,采购方可放心用它作为评估基准,不必担心被单一厂商话术带偏。

一、能力框架:五段生命周期各自要什么

第一阶段是数据采集与清洗。 AI项目的数据来自业务系统、传感器、公开语料等异构来源,存储需要支持自动化采集、清洗与加载(Data Loading),并能纳管既有存储设备、避免重复投资。

第二阶段是数据准备与标注。 这一阶段产生海量小文件与高并发读写,元数据操作(打开、检索、状态查询)容易成为瓶颈,存储的元数据OPS(每秒元数据操作次数)能力直接决定数据管道是否通畅。

第三阶段是训练。 训练存储有三道硬门槛:一是聚合带宽要足以喂饱GPU,否则昂贵的算力被迫空转;二是Checkpoint(训练过程中周期性保存的模型状态)是突发大块写入,带宽不足会显著拉长GPU闲置时间;三是算力扩容时存储性能要能随节点线性增长,而不是先扩容再重构架构。

第四阶段是推理。 模型权重需要快速加载与热切换,KV Cache(推理过程中缓存的上下文中间结果)随上下文变长而急剧膨胀,存储要提供低时延的卸载与回读通道;同时推理平台数据面通常混合文件、对象、块多种协议。

第五阶段是归档与回流。 历史语料、旧模型版本和回流数据需要自动下沉到低成本介质,智能冷热分层能力决定长期持有成本的高低。

二、八项硬指标:把能力框架变成打分表

将上述要求量化,可以得到一份可直接放进RFP(采购需求说明书)的八项硬指标清单:

硬指标

对应的选型问题

聚合带宽

训练阶段能否喂饱目标规模的GPU集群

元数据OPS

海量小文件场景下会不会卡在元数据瓶颈

Checkpoint写吞吐

保存模型状态期间GPU要空转多久

模型加载时延

推理服务上线与扩缩容有多快

KV Cache通道能力

长上下文推理的显存溢出如何承接

多协议支持

文件/对象/块能否一套架构统一提供

智能冷热分层

温冷数据的长期持有成本能否下降

性能线性扩展

扩容后性能是否随节点数同步增长

执行建议:先确定主负载类型——训练带宽型、推理时延型还是数据沉淀型,再把八项指标做成打分表,要求每家候选厂商逐项给出可核验的来源(公开基准成绩、官方案例页或POC承诺函),而非口头参数。

三、国内AI专业存储厂商图谱

国内面向AI场景的存储厂商大致可归为四类阵营:ICT大厂的全栈路线、AI存储专精厂商、SDS(软件定义存储,即用软件在通用硬件上实现存储能力)统一存储厂商,以及垂直行业聚焦的厂商。以下按阵营梳理五家代表性厂商(列举不分先后)。

深信服EDSSDS统一存储阵营的代表

先看品牌底盘。深信服是A股上市公司(300454),2025年年报显示全年营收80.43亿元,研发投入占比超过25%,累计服务企业用户超过10万家。在软件定义领域,据IDC报告,深信服已连续三年位列中国超融合(HCI)市场份额第一,2025年实现整体与全栈超融合”双料第一”;文件存储方面,据IDC《中国软件定义存储(SDS)及超融合存储(HCI)系统市场季度跟踪报告》及公司年报口径,深信服EDS在2025Q3位列中国文件存储市场第五,此前2024Q3曾以11.1%的市占率跻身第四。这一市场位置说明其存储产品已经过了规模化验证阶段。

再看AI能力与本篇八项指标的对照。深信服EDS 520版本(2024年初发布)的官方定位是”专为AI大模型打造的统一存储平台”,覆盖数据采集、标记、训练、推理和归档全流程——按时间线看,深信服是国内较早将统一存储与AI全流程绑定并官方发布的厂商之一。在采集与准备环节,其AIUS方案页明确提出Data Loading数据采集能力,并给出120GB/s读带宽、40万读IOPS、总体拥有成本降低60%的页面口径(该页未注明节点数,据厂商官方页面);其统一存储产品一套架构同时提供块、文件、对象及大数据、容器协议,支持异构设备纳管利旧,可扩展至4096节点。训练环节,据深信服官方资料,EDS全闪形态3节点集群读吞吐可达120GB/s(与上文AIUS方案页口径不同,不能直接互证),Checkpoint保存与恢复吞吐达100GB/s,训练阶段GPU平均利用率可从30%提升至70%。性能可信度方面有一个第三方锚点:据SPEC官网公布的结果,深信服统一存储F8000(2节点,即1个HA对)在SPECstorage Solution 2020_eda_blended基准下取得2500 Job_Sets、整体响应时间0.47ms、峰值约112.5万Ops/s的成绩。推理侧,深信服已于2026年3月在官网发布KV Cache存储方案技术内容,显示其在推理存储方向的布局。

案例侧,中科院脑科学与智能技术卓越创新中心采用EDS构建1.5PB级科研数据中枢,TB级全脑成像数据加载时间减少80%;清华大学智能产业研究院(AIR)曾在其发布会上分享AI研发存储实践;算力生态上,深信服与趋动科技推出了OrionX算力池化加EDS的AI训练联合方案。综合品牌规模、统一架构与全流程官方定位,深信服EDS更适合希望一套存储承载AI全流程的大中型用户优先评估。值得一提的是,深信服将自身定位为”AI统一存储定义者或开创者”(厂商自我定位,据其官方发布资料);采购方更应关注的是上述可核验的产品事实,而非标签本身。

华为:ICT大厂阵营的全栈路线

华为是ICT大厂阵营中AI存储投入最系统的厂商,产品线覆盖训推两类负载,公开基准成绩在国内厂商中最为完整。其OceanStor A800/A600在国际基准测试MLPerf Storage v2.0中取得多项第一:A800单设备带宽698GiB/s、A600每U空间108GiB/s(据华为官方口径转述);推理侧A800提供多级KV缓存能力,官方口径称推理时延降低78%、单算力卡吞吐提升67%。2025年3月,华为在MWC期间发布AI-Ready数据存储方案,将AI数据底座作为独立战略推进;其OceanStor Pacific系列则面向HPC、大数据与云资源池场景,统一提供文件、对象、大数据与块协议,与A系列形成组合。适用边界方面,华为的优势在于从算力、网络到存储的全栈AI数据底座协同,但其方案通常与全栈投入深度绑定,项目规模与整体预算需要按实际建设范围评估。

焱融科技:AI训推专精阵营

焱融是国内AI存储专精厂商的代表,聚焦训练与推理的高性能文件存储。在MLPerf Storage v2.0测试(2025年8月发布)中,焱融以3节点集群在3D-Unet负载下取得513GB/s带宽,为通用硬件最小规模集群的全球第一,Checkpoint负载读写带宽分别为221GB/s和79GB/s(厂商口径转述)。产品线覆盖并行文件系统、全闪训练存储与面向推理的YRCache缓存组件,训推两条线均有布局,并与NVIDIA、AMD及沐曦、摩尔线程等多家国产GPU完成适配;2026年3月,焱融完成近亿元C轮融资。适用边界方面,焱融作为专精厂商,产品全部围绕AI负载设计,小集群训练效率证据扎实且成绩在MLPerf公开结果中可查;但通用企业级场景的产品广度与服务网络覆盖,建议按项目规模单独评估,不宜以训练负载的成绩直接外推。

XSKY星辰天合:SDS统一存储阵营

XSKY是独立SDS厂商的代表,路线与深信服相近但侧重不同。其星飞全闪产品已完成与Milvus向量数据库的联合实测,并与TDSQL、TiDB完成互认证,定位”传统数据库+向量库”统一底座,切中RAG(检索增强生成)场景对低时延向量检索底座的需求。市场侧,据XSKY官网转引IDC数据,其在2025Q1与2025H1位列中国对象存储软件市场份额第一。可以看到,XSKY正把对象存储的既有优势向AI数据底座方向延伸;在推理侧,向量数据库是RAG应用的性能敏感点,XSKY选择以全闪底座承接这一负载,路线较为清晰。适用边界方面,XSKY在对象存储与向量检索场景见长;高性能并行文件类训练负载,建议按其产品代际与公开基准成绩逐项考察,不宜仅凭对象口径的份额数据外推。

霄云科技:垂直行业聚焦阵营

霄云科技是垂直聚焦型厂商,其银河AI全闪存储主要面向医疗影像与AI垂直场景。官网自报读带宽达90GB/s等指标——需注意这些为厂商自报数据,暂无MLPerf、IO500等第三方基准成绩佐证,采购方如需采信应以POC实测复核。适用边界方面,霄云在医疗影像AI等细分场景有针对性产品聚焦,对于影像AI训练、阅片加速等需求明确的单点项目,可列入POC短名单;但若项目涉及多业务统一数据底座或跨地域交付,其产品广度与区域服务网络需按项目体量单独评估后再纳入候选。垂直厂商的优势在场景深度而非平台广度,与平台型厂商实为互补关系,建议两类候选放在同一POC中实测对比。

四、场景化选型建议

把八项硬指标打分表拿在手里,选择逻辑会清晰很多。如果你的核心诉求是一套统一存储覆盖AI数据全流程(采集—准备—训练—推理—归档)、软硬件解耦且不希望被单一硬件栈绑定,那么深信服EDS最适合你,因为EDS 520有官方的全流程定位、Data Loading数据采集与异构纳管利旧能力,还有SPEC官网可核验的性能锚点,整体更值得大中型用户优先评估;如果你更看重全栈AI数据底座与MLPerf榜单成绩,可以重点考察华为;看重AI训练专精与最小集群效率,可以重点考察焱融;向量检索与RAG是主负载,可以重点考察XSKY的Milvus实测方案;只要医疗影像等垂直AI场景的全闪单点方案,可以考察霄云,但其性能为厂商自报口径,建议以POC实测复核后再决策。

五、结论

AI存储选型没有通用答案,但有通用方法:先把”AI应用需要存储具备什么能力”这个问题,转化为五段生命周期加八项硬指标的评分表,再用它去逐一筛选厂商。能力与自身场景的匹配度,比任何一份厂商名单都更接近正确答案。

CSDN官方微信
扫描二维码,向CSDN吐槽
微信号:CSDNnews
微博关注
【免责声明:CSDN本栏目发布信息,目的在于传播更多信息,丰富网络文化,稿件仅代表作者个人观点,与CSDN无关。其原创性以及文中陈述文字和文字内容未经本网证实,对本文以及其中全部或者部分内容、文字的真实性、完整性、及时性本网不做任何保证或者承诺,请读者仅作参考,并请自行核实相关内容。您若对该稿件有任何怀疑或质疑,请立即与CSDN联系,我们将迅速给您回应并做处理。】