概览
这场竞赛适合谁
适合能在 PaddleMIX 中开发 Python 数据处理组件的开发者或团队,尤其是熟悉图文多模态数据、LLaVA 训练数据清洗/配比,并能完成 LLaVA1.5 SFT 验证的人。参赛对象不限,国内及全球开发者均可报名;高校、企业和科研院所也在主要申报单位范围内。
查看官方简介原文
飞桨多模态大模型套件PaddleMIX整合了业界前沿的多模态大模型与飞桨框架底层高性能技术,全面兼顾高性能算法、便捷开发、高效训练和完备部署,其丰富的多模态模型库覆盖图像、文本、视频、音频模态模型。为完善百度飞桨多模态大模型套件PaddleMIX的数据分析和处理能力,参赛项目有机会将验证有效的数据处理方案合入企业实际产品中,包括数据分析和处理功能、单元测试适配、文档适配等,从而为千万用户降本增效。 Official tags: 1. Sign-ups: 16.
参赛准备
从报名到首次提交的准备步骤
- 01
PaddlePaddle/PaddleMIX 开发
- 02
多模态数据质量分析
- 03
LLaVA 1.5 SFT 微调
- 04
A100 多卡训练
- 05
GitHub Fork 与 Pull Request
- 06
Python 单元测试与文档编写
投入前确认:难点不只是提出数据过滤思路,而是要把可验证有效的细粒度处理算子做成可合入 PaddleMIX 的工程代码:完成数据集实验、可视化或模型训练验证、单测和文档,并通过代码 Review 后合入主分支。若要在模型上验证策略,页面要求具备使用 4 张或 8 张 A100 卡进行 LLaVA SFT 训练的环境。
来源