新手分
55/100
适合已经能训练或微调中文 NLP 模型、希望做机器阅读理解的学习者。参赛者需要能处理长篇中文文章,并具备一定的中学语文阅读能力,尤其要面对古诗文、现代文及字词理解、概括、推理和情感分析类问题。
官方提供了可以直接运行的基线,从它开始通常比从零搭快得多。
NCR Chinese reading-comprehension dataset: 8,388 articles and 20,477 questions
Technical discussion group for contestant communication
Organiser staff provide periodic group Q&A
如果下面这些前置项还很陌生,先补准备通常比直接参赛更划算。
中文自然语言处理
机器阅读理解
长文本建模
古诗文与现代文阅读
JSON 数据处理
CSV 预测结果生成
真正的难点通常不是“会不会调包”,而是验证、时间分配和任务理解。
主要难点是从平均长度为 1024 的文章中提取与问题相关的信息,并在古诗文和现代文混合材料上完成细粒度理解与四选一判断。提交时还需按每个问题的 Q_id 生成可识别的 CSV 预测文件,且不能直接提交或高度复现基线预测结果。
以下竞赛与当前竞赛方向或难度相近,可以一起对比。
把已确认、待核对和人工审核状态分开看;最终规则与截止时间以官方页为准,发现错误欢迎提交纠错。
官方 metric 还没有从当前抓取结果中确认,仍需人工核对。