新手分
22/100
适合能在 PaddleMIX 中开发 Python 数据处理组件的开发者或团队,尤其是熟悉图文多模态数据、LLaVA 训练数据清洗/配比,并能完成 LLaVA1.5 SFT 验证的人。参赛对象不限,国内及全球开发者均可报名;高校、企业和科研院所也在主要申报单位范围内。
如果下面这些前置项还很陌生,先补准备通常比直接参赛更划算。
PaddlePaddle/PaddleMIX 开发
多模态数据质量分析
LLaVA 1.5 SFT 微调
A100 多卡训练
GitHub Fork 与 Pull Request
Python 单元测试与文档编写
真正的难点通常不是“会不会调包”,而是验证、时间分配和任务理解。
难点不只是提出数据过滤思路,而是要把可验证有效的细粒度处理算子做成可合入 PaddleMIX 的工程代码:完成数据集实验、可视化或模型训练验证、单测和文档,并通过代码 Review 后合入主分支。若要在模型上验证策略,页面要求具备使用 4 张或 8 张 A100 卡进行 LLaVA SFT 训练的环境。
以下竞赛与当前竞赛方向或难度相近,可以一起对比。
把已确认、待核对和人工审核状态分开看;最终规则与截止时间以官方页为准,发现错误欢迎提交纠错。
官方 metric 还没有从当前抓取结果中确认,仍需人工核对。
reward_value_usd is a rough CNY→USD estimate (×0.14) for ranking only; use reward_summary for the official prize text.