概览
这场竞赛适合谁
适合已有大语言模型微调和代码数据处理经验的学生、工程师或个人开发者团队。参赛者需要能够围绕代码补全准备训练数据、训练 CodeLlama-7B,并提交可复现的数据处理脚本、数据集和源代码材料。
查看官方简介原文
通过本次大赛进一步优化代码大模型训练方法,提升大模型在软件开发相关场景上的代码生成能力,探索更多的应用场景。 Official category: 实战竞技赛. Organizers: 中移(苏州)软件技术有限公司. Participants: 6.
参赛准备
从报名到首次提交的准备步骤
- 01
CodeLlama-7B 微调
- 02
代码补全数据构建
- 03
训练数据清洗与处理
- 04
Python 与深度学习训练脚本
- 05
JSON 结果文件生成
- 06
模型训练可复现文档编写
投入前确认:核心难点是自行根据少量样例准备并优化代码补全训练数据,同时让微调效果可复现;仅提交预测结果不够,还需交付数据处理脚本、受限规模的数据集、原理说明和模型优化文档。初赛还要求将生成结果转换为指定格式的 JSON 文件,并可能被随机抽测复现。
来源