焦点评述

一、概念内涵

在数据洪流奔涌的智能时代,大模型训练与推理、实时数据流分析等场景持续产生海量数据,严苛的低延迟与高吞吐需求正将存储系统推向承载力的极限。以分布式存储为核心的现代存储体系,通过将数据分散部署于通用或异构硬件集群,实现了规模的横向扩展、数据的持久可靠与资源的按需供给。然而,面对超大规模应用、多元业务场景,以及可编程网络设备、异构内存、DPU等新硬件与新计算范式的挑战,下一代存储系统必须推进底层架构革新与关键技术突围。核心趋势包括:计算与存储的解耦协同以提升资源弹性,软件栈重构以释放新硬件潜能,以及引入智能算法以实现自适应调优,从而为智能世界构建高吞吐、低延迟、高可扩展的数据基础设施。


二、研究热点

当前分布式存储研究沿着硬件架构与技术场景双维度升级的路径展开,既面向AI大模型场景重构存储数据通路,也依托新型硬件重塑存储软件栈,并进一步向智能自治的高可用系统演进。

1、面向AI大模型的高性能存储架构与数据加速

在AI大模型时代,训练与长上下文推理对存储带宽、延迟与吞吐提出极致要求,研究聚焦近数据计算、分层存储协同与数据通路优化,缓解算力与存储之间的性能鸿沟。康奈尔大学Mohammad Alian教授团队提出DReX近存储检索架构,采用软硬件协同优化思想,通过基于符号一致性的向量过滤机制,在内存层级削减冗余数据访问与计算开销,提升大模型检索场景的存储访问效率。加州大学圣地亚哥分校Hadi Esmaeilzadeh教授团队设计RAGX外存计算架构,深度利用SSD/Flash的内部并行能力与原生带宽,在外存层级直接执行嵌入检索与部分计算操作,显著减少主机与外存之间的数据搬运延迟。清华大学舒继武教授团队提出大模型存算协同优化方法论,涵盖基于流水线并行的显存扩容、基于隐藏状态的KVCache快速恢复(HCache)及分布式显存池多模型服务,大大缩短端到端推理时间。清华大学武永卫教授团队提出以KVCache为中心的“以存换算”架构Mooncake,分离预填充与解码集群并构建全局缓存池,在严格延迟SLO下显著提升有效请求处理能力。

热点代表性机构/研究团队:

[1]康奈尔大学Mohammad Alian团队(DReX)

[2]加州大学圣地亚哥分校Hadi Esmaeilzadeh团队(RAGX)

[3]清华大学舒继武教授团队(HCache/Medusa/MaxEmbed)

[4]清华大学武永卫教授团队(Mooncake/KTransformers)


2、新硬件驱动的在网存储与软件栈重构

DPU、CXL、NVMe等新型硬件推动存储架构从CPU中心向数据中心转型,研究聚焦存算一体、数据通路优化与存储系统全栈设计,释放新硬件的性能潜力。苏黎世联邦理工学院Lana Josipović教授团队联合加州大学圣地亚哥分校Tajana Rosing教授团队提出OptiPIM存算一体编译优化框架,面向DRAM存算一体架构将算子映射问题转化为可自动求解的优化任务,自动生成适配硬件特性的可执行代码与最优数据布局。NVIDIA联合谷歌、英特尔、Meta组成的Storage-Next团队推动cuFile API开源与STX存储架构标准,基于BlueField-4存储处理器实现GPU直连存储的在网数据处理,重构AI场景下的存储访问软件栈,优化小扇区读写与上下文存储性能。中科曙光存储团队推出ParaStor F9000全闪存储系统,通过定制硬件重新排布网络与NVMe协同通路,结合全链路数据编排技术实现I/O子域隔离,配套精细化调度软件栈释放新硬件的全部性能潜力。

热点代表性机构/研究团队:

[1]苏黎世联邦理工学院Lana Josipović联合加州大学圣地亚哥分校Tajana Rosing团队(OptiPIM)

[2]NVIDIA Storage-Next联合团队

[3]中科曙光存储团队(ParaStor F9000)


3、存储系统的高可用性与智能自治运维

存储规模扩张与异构架构复杂度提升,使得传统人工运维难以应对故障风险与效率压力,研究聚焦AI驱动的故障自愈、智能调度与全生命周期自治管理,保障业务连续性并降低运维成本。IBM存储研究团队推出FlashSystem.ai智能运维体系,内置基于watsonx与Granite 4.0模型训练的专用AI引擎,实现系统状态感知、故障预警、策略自动配置与勒索软件检测的全流程自动化,可减少90%手动运维工作量。HPE研究团队提出基于时序模型(IT-TSFM)与大语言模型的存储基础设施自愈方案,通过分析遥测数据识别“灰色故障”模式,捕捉传统监控易忽略的性能退化信号,提供上下文感知告警与修复建议,实现主动式运维与故障提前干预。阿里云与上海交通大学联合研究团队提出Latte混合存储架构,结合本地存储的高性能与云端存储的高可用能力,通过统一数据路径与调度机制实现自动故障切换与弹性扩展,提升分布式存储的运维效率与业务连续性。

热点代表性机构/研究团队:

[1]IBM存储研究团队(FlashSystem.ai)

[2]HPE研究团队(IT-TSFM自愈方案)

[3]阿里云与上海交通大学联合研究团队(Latte架构)


三、发展趋势

下一代分布式存储正从面向通用负载的“容量型”基础设施,演进出“性能-容量-可靠性”三位一体的智能数据底座,架构敏捷性、硬件亲和性与运维智能化构成核心主线。

1、云边协同与跨域联邦的分布式存储架构

数据产生与处理正从集中式云数据中心向边缘和终端迁移,分布式存储的未来形态将突破单一数据中心的边界。云边协同场景要求存储系统具备跨地域、跨层级的数据管理能力,实现边缘与中心云之间的数据按需流动与统一命名空间;借鉴数据联邦理念,不同机构、不同地理位置的存储资源可通过标准协议实现互联互通,形成逻辑统一的存储池。芝加哥大学SHARED平台已通过OSDF与Globus等工具接入国家级计算生态,为此提供了可行范例。这一趋势将驱动存储系统从“单一集群”向“联邦化存储网络”演进,对跨域元数据管理、安全隐私保护与数据主权治理提出全新要求。同时,存算分离架构的深化将进一步解耦计算与存储生命周期,使两者可按各自最优节奏独立扩展,提升整体资源利用率。


2、面向新硬件的全栈重构与标准化

随着CXL、DPU、持久内存等新硬件逐步成熟,分布式存储系统正经历从“适配硬件”到“原生设计”的范式转变。软件栈将从传统多层内核路径演进为用户态、事件驱动的轻量级数据路径,充分释放新型高速设备性能。在数据拷贝与上下文切换方面,零拷贝、RDMA、GPU-Direct等技术的深度整合有望将存储访问延迟从毫秒级压缩至微秒级。在网计算能力的增强使部分存储语义下沉至网络设备,实现数据“边传边算”,显著降低搬移能耗与时延。标准化层面,NVMe-oF、CXL等开放互联协议的成熟将推动异构存储资源池的互联互通,降低厂商锁定风险,使数据中心能够灵活组合最优存储组件。


3、AI驱动的存储自治与效能可持续

人工智能正从辅助运维工具演进为存储系统的“内嵌大脑”,驱动无人化自治运营。基于大规模运维数据的预训练模型可提前预测磁盘故障与性能抖动,将被动响应转变为主动预防。系统亦能依据应用SLA自动选择最优数据保护策略、存储介质与数据放置位置,实现性能、可靠性与成本的动态平衡。在效能可持续方面,“双碳”目标使绿色存储成为关键考量。未来存储系统将感知数据访问热度的时空分布,通过智能数据分层、节点休眠与可再生能源优先调度,在保证服务质量的前提下最小化能耗与碳排放,实现高性能与可持续发展的协同共进。


编委主任:苏金树 CCF会士 军事科学院教授

本期主编:程葛瑶 CCF分布式计算与系统专委委员 信息支援部队工程大学网络信息体系创新研究中心副研究员

                 曾德泽 CCF分布式计算与系统专委副主任委员(执行) 中国地质大学(武汉)计算机学院教授

人工智能大模型中的数据存储和处理

从ImageNet到ChatGPT的演进揭示了一个核心规律:预训练数据的规模与质量直接决定大模型的能力上限,“数据决定模型”已成为共识。面向包含数据获取、预处理、训练、微调与推理的大模型全生命周期,传统分布式存储与处理系统在扩展性、延迟、带宽以及算存协同等方面面临深刻的根本性挑战。本报告系统阐述了以SuperFS、诸葛弩大数据处理引擎、八卦炉训练平台、mTuner微调框架及MoonCake推理平台为代表的自主技术体系,展示了从数据到智能的全栈基础设施创新,为构建面向大模型时代的高效数据存储与处理系统提供了可行路径。

格式:
视频
从三个维度探索分布式存储系统的性能优化

本报告首先梳理了分布式文件系统的发展现状,深入探讨了分布式存储系统性能度量的核心挑战,包括硬件配置、应用特性及系统配置所带来的复杂性。在此基础上,归纳出三大关键挑战:1)软硬件不匹配,软件在延迟中的占比持续升高且软硬件时延差异显著;2)节点内多种存储介质并存,节点间性能异构;3)多样化应用场景与复杂配置进一步加大了优化难度。针对上述挑战,报告从三个维度提出优化思路:通过去除冗余设计、精简软件栈以降低延迟;面向新型硬件设备与异构存储进行优化;面向应用与复杂场景实现自适应优化。最后,报告展望了分布式存储系统下一步的优化方向与方法。

格式:
视频
在网存储系统研究综述

以可编程交换机和智能网卡为代表的可编程网络设备已在数据中心得到广泛部署,其支持在网络数据传输路径上执行自定义数据处理逻辑,为构建高性能的在网存储系统带来了新机遇,同时也面临硬件资源受限下的软硬件分工与系统容错等挑战。本综述系统梳理了在网存储系统的研究进展,首先分析可编程网络设备的硬件结构与性能特征,归纳出两大关键挑战;进而根据设备执行的缓存、协调、调度、聚合等任务对现有系统进行分类阐述,并结合实例探讨设计难点与软件技术;最后展望了交换机与网卡协同、安全、多租户及自动卸载等未来研究方向。

格式:
文章
基于RDMA的分布式存储系统研究综述

RDMA正在重塑大数据分布式存储。它允许在远端CPU不参与的情况下直接读写异地内存,并带来高带宽、高吞吐与低延迟。但是,若仅把RDMA当作更快的网络模块来“替换”,便难以兑现其语义与性能红利,存储系统必须走向架构级变革。释放RDMA潜力主要依赖两条主线:一是硬件资源的高效管理,如网卡缓存、CPU 缓存、多核并行与内存资源管理;二是软硬件紧耦合设计,借助RDMA特性重构数据组织与索引、优化分布式协议。本文以分布式文件系统、分布式键值存储和分布式事务系统为典型应用场景,分别阐述了它们在硬件资源管理和软件重构两方面的相关研究。

格式:
文章
大模型时代下的存储系统挑战与技术发展

以ChatGPT为代表的大模型在文本与视觉处理等复杂任务中表现卓越,引发了广泛关注。大模型的训练与推理高度依赖GPU算力,但GPU显存容量有限且为易失性介质,难以满足存储需求。本文首先分析了大模型时代下存储系统所面临的三大挑战:数据碎片化与语义稀疏化降低存储利用率;高带宽需求与异构介质间的高通信开销限制显存扩展;以CPU为中心的容错技术在应对高容错需求时开销高昂。进而从数据管理、存储扩容和数据容错三个方面总结现有解决方案。最后展望了大模型时代存储系统的发展趋势。

格式:
文章
基于DPDK的高速存储I/O优化方法

网络I/O在Redis存储过程中是限制存储性能的关键因素,而默认参数或人工参数配置会制约存储性能。本文针对参数配置不当导致存储吞吐性能下降以及时延较高的问题,提出一种存储I/O优化方法GTS。该方法综合考虑各阶段参数对存储性能的影响,基于DPDK优化原理分析处理特性,采用分层模型策略预测存储性能,从而搜索最优参数配置。实验结果表明,与默认参数相比,GTS方法能够有效提升存储吞吐量,且在写密集下较ATH算法具有更低的时延。

格式:
文章

本期编委成员