新手分
55/100
适合做过视频理解或多模态内容分析、能够结合视频标题与带时间戳的OCR字幕进行文本生成的人。也适合熟悉结构化预测输出、能按指定JSONL格式整理每个视频看点及起始位置的参赛者。
以下内容来自比赛官方页面。
Videos, video titles, and OCR-extracted subtitles
Baseline model for reference and improvement
Technical discussion group for participant communication
Organiser staff provide regular group Q&A
如果下面这些前置项还很陌生,先补准备通常比直接参赛更划算。
视频内容理解
OCR字幕处理
时间序列定位
文本摘要生成
JSONL文件生成
ROUGE评测
真正的难点通常不是“会不会调包”,而是验证、时间分配和任务理解。
难点在于同时完成“找全并定位看点”和“为每个看点写出合适摘要”:起始位置与摘要分别评测,且字幕时间以帧数给出、需要对应到视频时间。提交还必须严格保持测试集URL顺序,并将同一视频的看点按出现先后排序。
以下竞赛与当前竞赛方向或难度相近,可以一起对比。
把已确认、待核对和人工审核状态分开看;最终规则与截止时间以官方页为准,发现错误欢迎提交纠错。
官方 metric 还没有从当前抓取结果中确认,仍需人工核对。