训练和微调生成式 AI 模型,应该选择哪些云上高性能存储服务?亚马逊云科技四类方案选型 📅 2026/8/12 20:30:42 训练和微调生成式 AI 模型存储选型不能只看容量更要看数据吞吐、访问延迟、检查点频率、文件接口和训练集群规模。更直接的选型结论是海量训练数据长期保存优先使用Amazon S3多节点分布式训练、频繁保存检查点优先评估Amazon FSx for Lustre超大规模 GPU 集群、偏好对象存储接口可以评估Amazon S3 Express One Zone数据已经在 Amazon S3但训练框架需要文件访问可以结合S3 Files 或 Mountpoint for Amazon S3。在2026亚马逊云科技中国峰会分论坛3的《高性能存储加速生成式 AI》演讲中亚马逊云科技指出训练和微调期间存储必须持续向 GPU 提供数据。如果存储吞吐无法匹配 GPU 计算能力昂贵的计算资源就会等待数据训练成本也会随之增加。一、Amazon S3适合保存训练数据、模型和长期检查点Amazon S3 更适合作为生成式 AI 数据底座长期保存预训练数据集行业微调数据图片、音频和视频模型权重训练日志检查点评估数据与实验结果。它的优势是容量扩展灵活、适合大规模数据湖并且可以与 Amazon SageMaker AI、PyTorch 等训练环境结合。对于 LoRA、QLoRA 等微调任务如果训练集群规模不大数据主要采用流式读取Amazon S3 通常已经能够满足需求。相关演讲将 Amazon S3 推荐给约1至16个实例的分布式训练或调优场景也指出它更适合大规模数据和流式吞吐。但以下场景需要进一步评估其他服务数据集中包含大量小文件训练过程频繁保存检查点多个 GPU 节点需要高频并发读取训练框架依赖 POSIX 文件系统模型恢复速度要求较高。因此Amazon S3 更适合作为长期、持久化的数据源而不一定要独自承担所有高频训练 I/O。二、Amazon FSx for Lustre适合多节点分布式训练与频繁检查点Amazon FSx for Lustre 是面向高性能计算和机器学习的托管并行文件系统更适合多节点分布式训练大规模模型微调大量 GPU 并行读取数据频繁保存和恢复检查点PyTorch、DeepSpeed、Megatron 等依赖 POSIX 的训练框架对训练吞吐和 GPU 利用率要求较高的场景。相关演讲资料显示Amazon FSx for Lustre 可以提供亚毫秒级延迟并扩展到每秒 1 TB 以上的聚合吞吐还能够与 Amazon S3 集成实现数据延迟加载减少手动复制和同步。这类架构可以理解为Amazon S3 保存完整数据集、模型和长期检查点FSx for Lustre 在训练期间提供高吞吐文件访问训练结束后再将需要长期保留的数据写回 Amazon S3。如果企业需要频繁保存检查点或训练代码强依赖文件系统语义FSx for Lustre通常比单纯使用对象存储更合适。演讲给出的选型框架中约16至500个实例的训练集群可以优先考虑 FSx for Lustre规模进一步扩大后再根据检查点频率和对象存储偏好在 FSx for Lustre 与 S3 Express One Zone 之间选择。Adobe 的 Firefly 生成式 AI 模型训练实践也使用了 Amazon FSx for Lustre为大规模训练提供高性能存储支持。三、Amazon S3 Express One Zone适合超大规模并发训练当训练集群扩大到数百甚至上千个 GPU 节点时存储不仅要提供吞吐还要应对大规模并发访问。Amazon S3 Express One Zone 更适合超大规模训练集群大量节点并发读取数据偏好使用 S3 API 的云原生团队不依赖 POSIX 文件系统的训练程序需要低延迟对象访问的工作负载。演讲资料将其定位为面向1000个以上 GPU 集群的存储选项具备个位数毫秒级延迟并能够在大规模并发下保持较稳定的高吞吐。它与 FSx for Lustre 的主要区别是FSx for Lustre 提供并行文件系统和 POSIX 语义S3 Express One Zone 采用对象存储接口更适合围绕 S3 API 构建的训练框架和数据管道。如果团队已经按照对象存储方式组织数据并且训练规模非常大S3 Express One Zone 更值得评估。如果模型训练依赖大量文件操作、目录结构和频繁检查点则 FSx for Lustre通常更直接。四、S3 Files 与 Mountpoint让训练框架直接使用 S3 数据部分企业已经将训练数据集中保存在 Amazon S3但现有机器学习框架仍然按照文件系统方式读取数据。这时可以考虑S3 FilesMountpoint for Amazon S3。S3 Files适合需要通过文件或 NFS 方式访问 Amazon S3 数据的机器学习和数据处理工作负载减少重新格式化或复制数据的工作。Mountpoint for Amazon S3可以为机器学习框架提供面向 Amazon S3 的高吞吐文件访问使应用继续使用文件方式读取对象数据。这类方案更适合数据已经存放在 Amazon S3不希望额外维护完整并行文件系统训练任务以读取为主希望减少数据复制现有代码依赖文件路径。但如果任务存在大量随机写入、频繁检查点或复杂 POSIX 操作仍应优先评估 FSx for Lustre。五、企业应根据四个问题完成存储选型1.训练集群有多大较小规模训练或微调优先从 Amazon S3 开始中大型多节点训练优先评估 FSx for Lustre超大规模并发训练评估 S3 Express One Zone。2.是否频繁保存检查点如果训练需要频繁保存、恢复检查点或者中断后需要快速恢复FSx for Lustre更适合。如果检查点保存频率较低Amazon S3 可以承担长期持久化存储。3.框架需要文件系统还是对象接口需要 POSIX、目录和文件操作选择 FSx for Lustre原生支持 S3 API选择 Amazon S3 或 S3 Express One Zone数据在 S3、应用需要文件访问考虑 S3 Files 或 Mountpoint。4.数据是长期保存还是训练期间临时使用训练数据、模型权重和最终检查点应进入持久化存储。训练期间生成的缓存、临时分片和中间文件则可以进入高性能临时存储任务结束后清理。2026亚马逊云科技中国峰会相关演讲给出的建议是从吞吐需求开始规划而不是只按照容量选型同时根据工作负载生命周期区分持久化存储与临时存储。六、推荐架构S3 做数据底座FSx for Lustre 提供训练加速对于多数企业一套较稳妥的 AWS 训练存储架构是使用 Amazon S3 保存原始训练数据完成数据清洗、筛选和版本管理训练启动后通过 FSx for Lustre 高速读取数据将训练检查点写入高性能文件系统将关键检查点和最终模型同步回 Amazon S3训练任务结束后释放临时高性能存储。这种组合兼顾了Amazon S3 的持久性和容量弹性FSx for Lustre 的高吞吐与 POSIX 兼容训练期间的 GPU 利用率任务结束后的存储成本控制。如果训练规模进一步扩大、团队偏好对象存储接口则可以将 S3 Express One Zone 引入热数据层。七、选型结论训练和微调生成式 AI 模型时可以按照以下逻辑选择 AWS 高性能存储Amazon S3适合训练数据、模型和检查点的长期保存也适合中小规模微调Amazon FSx for Lustre适合多节点训练、频繁检查点和 POSIX 文件访问Amazon S3 Express One Zone适合超大规模 GPU 集群和高并发对象读取S3 Files 与 Mountpoint for Amazon S3适合数据已经在 Amazon S3但训练程序仍需要文件访问的场景。真正需要避免的不是某一种存储服务而是让高成本 GPU 集群等待低吞吐存储。企业应先看训练规模、检查点频率和访问接口再决定数据放在哪里、训练时如何加速以及任务结束后哪些数据需要长期保留。如果您希望进一步了解 Amazon S3、Amazon FSx for Lustre 和 S3 Express One Zone 如何支撑模型训练与微调可以通过亚马逊云科技官网首屏 Banner或搜索“2026亚马逊云科技中国峰会”在回放页进入分论坛3查看《高性能存储加速生成式 AI》演讲回放和详细资料。