Overview
Who this competition fits
适合有飞桨/PaddleMIX 代码开发经验,且能处理图文多模态训练数据的开发者或团队。参赛者需要能围绕 llava_v1_5_mix665k 实现数据分析、过滤、配比或可视化算子,并在 LLaVA1.5 的 SFT 阶段验证效果;页面说明国内及全球开发者均可报名,参赛对象不设限。
Read the original official blurb
本次多模态数据提质大赛赛题名称为“为飞桨多模态大模型套件丰富数据分析和处理的能力”。旨在完善飞桨多模态大模型套件数据分析和处理能力,减少用户开发成本。 参赛项目将验证有效的数据处理方案合入PaddleMIX套件,包括数据分析和处理功能、单元测试适配、文档适配。技术路径采用开源数据llava_v1_5_mix665k,有效性验证试验在LLaVA1.5 sft阶段进行。技术方案可从单条数据和数据集多个角度进行数据质量的分析过滤,也可以从训练数据配比的角度分析训练数据的均衡性。 Official category: 实战竞技赛. Organizers: 百度飞桨. Participants: 199.
Preparation
From registration to a first submission
- 01
PaddleMIX 开发
- 02
多模态数据处理
- 03
LLaVA1.5 SFT 训练
- 04
Python 数据处理算子开发
- 05
GitHub Fork 与 Pull Request
- 06
单元测试与技术文档编写
Before you commit: 难点不只是提出数据清洗思路,而是将可验证的处理算子做成可被 PaddleMIX 接收的开源贡献:完成模型训练验证、评估结果和日志、单元测试、文档,并通过代码 review 合入主分支。若要在模型上验证数据策略,页面要求具备使用 4 张或 8 张 A100 卡进行 SFT 训练的环境。
Source
How this page was assembled
Competition information is structured from the official page. Scores are platform estimates for decision support; official rules take precedence.
- Official competition page
- OpenAtom
- Last checked
- Sep 21, 2024