概览
这场竞赛适合谁
适合有 Colossal AI 和 PyTorch 分布式大模型训练经验的团队,能够理解各 rank 的本地梯度,以及数据、张量、流水等并行策略。参赛需组队,每队至少 3 人、最多 5 人;还应能完成软件设计文档、用户手册、测试报告和开源代码仓库提交。
查看官方简介原文
本赛项要求参赛队伍对在Colossal AI加速库上训练的大模型,以三方库的形式实现各rank上权重梯度的统计信息监控,支持业界主流语言、多模态理解和生成模型,支持重计算、分布式优化器等使用场景,尽量减少监控过程对性能的损耗和显存的占用。 Official category: 实战竞技赛. Organizers: 华为技术有限公司. Participants: 5.
参赛准备
从报名到首次提交的准备步骤
- 01
能够读懂官方赛题与参赛规则
- 02
PyTorch 分布式训练
- 03
数据并行与张量/流水并行
- 04
梯度统计与张量操作
- 05
ZeRO 分布式优化器
- 06
AtomGit 与开源许可证合规
投入前确认:核心难点是在权重切分、ZeRO 或 TP/PP 等并行场景下,分别正确记录每个具名权重在 DP 聚合前后的各 rank 本地梯度统计,同时不保存原始梯度张量。实现还要兼顾接近 msprobe.monitor 的接口与输出,并把训练性能损耗和额外显存占用控制在要求范围内,还需在指定语言模型和扩散模型上验证。
来源