概览
这场竞赛适合谁
适合有飞桨/PaddleMIX 代码开发经验,且能处理图文多模态训练数据的开发者或团队。参赛者需要能围绕 llava_v1_5_mix665k 实现数据分析、过滤、配比或可视化算子,并在 LLaVA1.5 的 SFT 阶段验证效果;页面说明国内及全球开发者均可报名,参赛对象不设限。
查看官方简介原文
本次多模态数据提质大赛赛题名称为“为飞桨多模态大模型套件丰富数据分析和处理的能力”。旨在完善飞桨多模态大模型套件数据分析和处理能力,减少用户开发成本。 参赛项目将验证有效的数据处理方案合入PaddleMIX套件,包括数据分析和处理功能、单元测试适配、文档适配。技术路径采用开源数据llava_v1_5_mix665k,有效性验证试验在LLaVA1.5 sft阶段进行。技术方案可从单条数据和数据集多个角度进行数据质量的分析过滤,也可以从训练数据配比的角度分析训练数据的均衡性。 Official category: 实战竞技赛. Organizers: 百度飞桨. Participants: 199.
参赛准备
从报名到首次提交的准备步骤
- 01
PaddleMIX 开发
- 02
多模态数据处理
- 03
LLaVA1.5 SFT 训练
- 04
Python 数据处理算子开发
- 05
GitHub Fork 与 Pull Request
- 06
单元测试与技术文档编写
投入前确认:难点不只是提出数据清洗思路,而是将可验证的处理算子做成可被 PaddleMIX 接收的开源贡献:完成模型训练验证、评估结果和日志、单元测试、文档,并通过代码 review 合入主分支。若要在模型上验证数据策略,页面要求具备使用 4 张或 8 张 A100 卡进行 SFT 训练的环境。
来源