logo

当 AI 从模型训练走向生产应用,并行文件存储需要重新设计

作者:xxinjiang2026.07.31 13:57浏览量:21

简介:当 AI 从模型训练走向生产应用,并行文件存储需要重新设计

AI 正从单一的模型训练走向规模化生产,训练、推理、Agent、强化学习、仿真等混合负载交织演进,基础设施全面迈向云原生

这一重大的业务形态转变,正在重新定义并行文件存储。百度智能云推出新一代高性能并行文件存储 PFS L3,围绕 AI 生产级工作负载,重新设计资源供给、数据供给、数据管理和协同能力,为企业构建敏捷、高效的 AI 数据基础设施。

过去二十多年,并行文件存储始终是高性能计算的重要基础设施。从科研计算、生命科学到工业仿真,它承担着高性能并行访问的核心职责,为大规模计算提供稳定、高效的数据支撑。

随着深度学习和大模型训练兴起,并行文件存储也自然成为 AI 基础设施的重要组成部分。这并非偶然,而是因为早期 AI 训练与 HPC 具有高度相似的工作负载:少量训练任务持续运行,集群规模相对固定,资源可以提前规划,数据访问模式也较为稳定。在这样的场景下,并行文件存储能够充分发挥高带宽、高并发和低时延优势,为模型训练持续提供稳定的数据供给。

但今天,AI 没有停在训练阶段,正走向生产应用。

一个 AI 平台承载的,早已不局限单一训练任务,而是训练、推理、Agent、强化学习、仿真等多种工作负载的混合体。训练任务可能持续数周,推理服务根据流量实时扩缩容,Agent 按需创建和释放,强化学习需要海量迭代试错产生的数据持续回放,仿真任务则在虚拟环境中不断生成新的训练样本,数据不断在训练、推理、仿真和应用之间流动。

与此同时,AI 基础设施也正在全面走向云原生。不同团队、不同业务乃至不同租户共享同一套计算与存储资源。

AI 工作负载和基础设施形态的变化,并没有改变企业对性能的追求,却重新定义了并行文件存储的能力边界。企业需要的,已经不仅是一套高速读写数据的并行文件存储,更是一套能够弹性供给资源、持续供给数据、高效流动数据、并支撑多团队协同的 AI 数据基础设施。

为此,百度智能云推出并行文件存储 PFS L3。它不是传统并行文件存储的一次性能升级,而是围绕 AI 数据基础设施重新设计,让资源、数据和应用实现高效协同,为训练、推理、Agent 等多种 AI 工作负载构建统一的数据底座。
1785468071094.jpg

1. 存储资源,跟着算力一起弹性伸缩

当前 AI 工作负载最大的特点,是资源需求持续变化。

模型训练跑了三周,实验结束,资源立刻释放。推理服务凌晨流量低谷,中午峰值翻倍。Agent 应用突发上线,百个实例十分钟内拉起,两小时后全部下线。强化学习在数千个并行环境中持续试错,每一轮迭代都在反复回放海量轨迹数据,算力需求随策略更新频繁涨落。仿真任务则在训练与验证之间不断切换,数万仿真核心与数千训练 GPU 轮番上阵,计算资源像潮水一样涌来又退去。

计算资源已经进入按需供给时代,并行文件存储同样需要具备这样的能力。

PFS L3 基于云原生 Serverless 架构,实现容量与性能解耦,支持在线扩缩容、按量计费以及多种性能规格。企业无需提前规划未来几年的存储资源,而是可以根据业务需求动态获取性能和容量,让资源跟随 AI 工作负载变化,在保障业务稳定运行的同时进一步提升资源利用率,降低总体拥有成本。

对于企业而言,并行文件存储不再是一次性建设的固定资源,而是能够伴随 AI 平台持续演进的数据基础设施。

2. 数据供给,决定 AI 基础设施的效率

不同 AI 工作负载,对数据访问模式提出了截然不同的要求。无论是持续的大带宽吞吐、海量小文件访问,还是模型快速加载和低时延交互,本质上都要求存储能够持续、稳定地向计算资源供给数据。

因此,衡量一套并行文件存储的标准,不只是峰值性能,更是能否在不同 AI 工作负载下持续、高效地完成数据供给。

PFS L3 从客户端、网络协议、元数据管理到服务端进行了全栈优化:单客户端读吞吐最高可达数十 GB/s,文件系统总吞吐能力最高可达数 TB/s,最大 IOPS 可达数千万,并支持亚毫秒级访问时延。

依托上述能力,PFS L3 可持续支撑大模型训练的海量数据并行读取、多模态和自动驾驶等训练场景的小文件高并发访问、推理服务弹性扩容时的模型快速加载、Agent 应用中的低时延实时数据交互需求,以及强化学习和仿真场景下的海量数据持续回放与高并发存取等,为不同 AI 工作负载提供稳定、高效的数据供给。

性能不仅体现在数据读写,更体现在计算资源能够快速进入工作状态。

针对云原生和弹性计算场景,PFS L3 持续优化资源挂载与访问链路,实现万级并发、百毫秒级极速挂载。无论是训练任务快速启动,还是大规模 Agent 实例动态创建,存储资源都能在百毫秒内就绪,让 GPU 更快进入计算状态,持续提升 AI 平台运行效率。
1785468307545.jpg

3. 数据管理,重在流动而非搬运

随着 AI 应用不断深入,企业的数据规模正快速迈向 PB 甚至 EB 级。然而,真正参与训练和推理的数据始终只是其中的一部分,大量历史数据访问频率不断下降,却依然占用高性能存储资源。

过去,企业通常通过人工完成冷热数据迁移。训练结束后将历史数据迁移至对象存储,当业务再次需要时再迁回并行文件存储。这种方式虽然降低了存储成本,却增加了数据管理复杂度,也让数据不断在不同存储之间来回搬运。

AI 数据基础设施需要的,不是更多存储层,而是让数据能够根据业务需求和生命周期自动流动。

PFS L3 深度融合百度智能云对象存储 BOS,构建统一的数据管理体系。基于生命周期策略,热点数据保留在并行文件存储,为训练和推理提供高性能访问;冷数据自动流转至对象存储,实现低成本长期保存。当业务再次访问时,系统自动完成数据调度,无需人工迁移,也无需修改应用。

对于用户而言,无论数据存放在 PFS L3 还是 BOS,都始终通过统一的数据入口进行访问,无需关心数据位置,也无需修改应用;对于企业而言,数据能够根据生命周期自动流转,在保障业务体验的同时,实现性能与成本的最佳平衡。

4. 业务协同,建立在数据之上

随着 AI 从单一模型演进为 AI 平台,数据不再服务于某一个训练任务,而是贯穿数据处理、模型开发、训练、推理、仿真和应用部署的整个流程。

今天,一个 AI 项目通常需要数据、算法、平台和业务团队共同参与。如果每个团队都维护独立的数据副本,不仅增加存储成本,也让权限管理、版本一致性和研发协同变得更加复杂。

与此同时,越来越多企业开始建设统一的 AI 平台,不同业务、不同团队乃至不同租户需要共享同一套计算与存储资源。对于并行文件存储而言,真正需要解决的,已经不仅是「如何访问数据」,更是「如何构建统一、安全的数据空间」。

PFS L3 深度融合百度智能云 IAM 身份体系,结合 Access Point 为不同目录设置细粒度的访问策略:不同团队、不同租户可以按照各自的权限边界访问同一份数据,不需要为每个团队单独复制数据、单独运维一套存储,数据共享和安全隔离可以同时满足。

在计算生态方面,PFS L3 基于云原生架构重新设计了客户端体系,摆脱了传统并行文件存储对特定操作系统和内核版本的依赖,兼容虚拟机、容器、AI 训练平台等多种云上计算环境,不需要为不同平台重复适配,帮助企业更加敏捷地融入云原生和 AI 技术生态。

从模型训练到应用部署,从研发协同到生产运行,PFS L3 让数据始终保持一致、可管理,让协同成为 AI 平台的基础能力,而不是额外成本。

5. 在真实 AI 生产环境中持续验证

基础设施产品的价值,最终来自真实业务。

目前,百度沧海团队推出的 PFS L3 已广泛应用于百度多个核心 AI 业务,持续支撑文心大模型训练、百度文库以及百度百舸 AI 计算平台等生产环境。

在文心大模型训练中,PFS L3 持续优化模型权重加载效率,让 GPU 更快进入计算状态,提升算力利用率。

部分场景性能超 PFS L2,特别是大文件顺序读场景,对于模型权重加载提效明显。—— 百度文心一言

在百度文库,统一的数据空间支撑研发、训练和测试协同,减少数据迁移和重复存储,提升研发效率。

性能符合预期,用户态私有化客户端部署很灵活,把代码放在 PFS L3 中,一边开发,一边调试,非常灵活,对效率提升明显。—— 百度文库

在百度百舸 AI 计算平台,PFS L3 长期稳定服务大规模 AI 集群,为训练、推理、强化学习等多种工作负载提供可靠的数据支撑。

试用一段时间,性能达到了预期,稳定性 OK,组内同学都用起来了。—— 百度百舸

来自真实生产环境的实践证明,AI 对并行文件存储的要求已经从单一性能竞争,演进为资源弹性、数据供给、数据管理和云原生协同能力的综合竞争,而这正是 PFS L3 持续演进的方向。

6. 写在最后

每一次计算范式演进,都会推动基础设施同步升级。

HPC 时代,并行文件存储解决的是高性能计算的数据访问问题;大模型训练时代,它成为 AI 模型训练的重要数据底座;而今天,当 AI 从训练走向生产,它正在从一套高性能存储系统,演进为支撑整个 AI 平台持续运行的 AI 数据基础设施。

这也是百度智能云发布 PFS L3 的初衷,为 AI 重新设计并行文件存储。

让存储不再是 AI 平台的被动组件,而是主动驱动数据、算力与应用高效协同的核心力量。

了解百度沧海更多信息

发表评论

活动