跳到主要内容
项目详情

DeepSpeed 是一个面向大规模深度学习训练的系统优化项目,官网将其定位为让大规模深度学习训练更具规模、更高效并更易使用的技术方案。它已被用于 Megatron-Turing NLG、BLOOM、Jurassic-1、GLM、YaLM、GPT-NeoX 等大规模模型的训练,并被 Microsoft AI at Scale 计划用于支持下一代 AI 能力。与只针对单一模型或单一训练环节的工具不同,DeepSpeed 将内存优化、并行训练、专家混合、参数卸载、推理与压缩等系统创新组合起来,同时与 Transformers、Accelerate、Lightning、MosaicML 等深度学习框架集成。\n\n### 核心功能\n\n#### ZeRO 内存优化\nZeRO 是 DeepSpeed 的核心系统创新之一,官网将其描述为面向超大参数模型训练的内存优化技术,并列出“ZeRO: memory optimizations toward training trillion parameter models”的相关论文。围绕 ZeRO,项目还提供 ZeRO-Offload 与 ZeRO-Infinity 等方向,分别用于探索大规模模型训练中的卸载能力和突破 GPU 内存限制。官网新闻还提到 ZeRO-3 的 System DMA,可将 collective 操作从 AMD GPU 的计算单元上卸载,以改善计算与通信的重叠。\n\n#### 3D 并行训练\nDeepSpeed 将 3D-Parallelism 列为其系统创新,服务于大规模深度学习训练的扩展。官网的采用案例覆盖从 5.4B 参数的 METRO-LM 到 530B 参数的 Megatron-Turing NLG,说明该项目关注的是不同规模模型的训练扩展,而不是仅面向小型实验。具体并行配置、硬件要求和性能结果需要以项目文档及相关论文为准,给定正文未展开这些实现细节。\n\n#### Mixture-of-Experts 训练与推理\nDeepSpeed-MoE 用于 Mixture-of-Experts 模型的训练和推理,官网将其列为推动下一代 AI 规模化的系统能力。Publications 部分还收录了关于 DeepSpeed-MoE 的论文,标题明确涉及大规模 MoE 推理与训练。官网同时列出稀疏 Mixture of Experts 视觉语言模型扩展以及混合 Tensor、Expert、Data Parallelism 的研究,表明该方向覆盖模型训练中的并行组合与规模扩展。\n\n#### 大模型推理与压缩\n官网列出了 DeepSpeed Inference,相关论文主题是让 Transformer 模型在前所未有的规模上实现高效推理。项目的研究与出版物还包括 ZeroQuant、ZeroQuant-V2、ZeroQuant-FP 和 ZeroQuant-HERO 等后训练量化方向,涉及大规模 Transformer 的压缩、低精度格式和硬件增强优化。因此,DeepSpeed 的能力范围不只包括训练,也延伸到 Transformer 模型的推理和后训练压缩。\n\n#### 数据效率、检查点与长序列训练\nDeepSpeed Data Efficiency 关注通过高效的数据采样与路由改善深度学习模型质量和训练效率。Universal Checkpointing 面向大规模分布式训练,强调检查点的高效与灵活;官网还收录了 Arctic Long Sequence Training,用于多百万 token 序列的可扩展训练。近期新闻进一步展示了 ZenFlow 的异步更新卸载训练、SuperOffload 的大规模 LLM 训练,以及 DeepCompile 面向分布式训练的编译器优化。\n\n### 使用方式\n官网以项目文档、研究论文、视频教程和社区教程作为主要资料入口,并提供 DeepSpeed 与 Transformers、Accelerate、Lightning、MosaicML 的集成文档链接。视频内容覆盖 ZeRO、大模型训练、BERT 训练、AzureML、大模型训练与推理等主题。给定正文没有说明是否需要注册、是否提供独立客户端、命令行或开放 API,也没有说明用户是否需要自备模型 Key。项目欢迎贡献,贡献者需遵循相应的 DCO 要求。\n\n### 适用人群与场景\n进行大规模语言模型训练的研究人员和工程团队,可以参考 DeepSpeed 的 ZeRO、并行训练与卸载能力,处理从数十亿到数千亿参数模型的训练扩展。使用 Transformers、Accelerate、Lightning 或 MosaicML 的团队,可查看对应的 DeepSpeed 集成文档。需要开展 MoE 训练或推理、Transformer 后训练量化、长序列训练和分布式检查点研究的人员,也可以从官网列出的 DeepSpeed-MoE、ZeroQuant、Arctic Long Sequence Training 与 Universal Checkpointing 方向入手。希望参与项目建设的开发者,则可以按照 contributing 指南提交贡献。

ZeRO 内存优化提供 ZeRO、ZeRO-Offload 与 ZeRO-Infinity 等面向超大规模模型训练的内存和参数卸载优化方向。
3D 并行训练通过 3D-Parallelism 支持大规模深度学习训练的规模扩展。
DeepSpeed-MoE支持 Mixture-of-Experts 模型的训练与推理,并覆盖相关并行优化研究。
大模型推理与量化提供 DeepSpeed Inference,并包含 ZeroQuant 系列后训练量化与模型压缩方向。
分布式训练配套能力覆盖数据效率、Universal Checkpointing、多百万 token 长序列训练及卸载训练研究。

用户评论 (0)

还没有用户评论

成为第一个分享使用体验的人

查看更多

DeepSpeed 截图

官网首页截图

写评论

分享你的使用体验,至少 10 个字。评论可以发多条,打分在右侧卡片单独进行。

还需 10 个字 · 0 / 500