Overview
Who this competition fits
适合已有中文自然语言处理经验、想做会议转写文本抽取式摘要的人。参赛者需要能处理按主题切分及整场会议两个层级的长篇中文口语转写,并遵守仅限非商业研究的数据使用规则;阿里巴巴员工及浙江大学教职工/学生不能参赛。
Read the original official blurb
本项目为ICASSP2023 信号处理大挑战的通用会议理解及生成挑战赛(MUG challenge)。赛事构建并发布了目前为止规模最大的中文会议数据集,并基于会议人工转写结果进行了多项口语语言处理(SLP)任务的标注;目标是推动SLP在会议文本处理场景的研究并应对其中的多项关键挑战,包括 人人交互场景下多样化的口语现象、会议场景下的长篇章文档建模 等。 Official category: 算法竞赛. Participants: 54. Organizers: 阿里巴巴达摩院, 魔搭modelscope社区, 浙江大学.
Preparation
From registration to a first submission
- 01
Mandarin text processing
- 02
extractive summarization
- 03
long-document Transformer modeling
- 04
ROUGE evaluation
- 05
ModelScope fine-tuning
- 06
meeting-transcript preprocessing
Before you commit: 难点在于从带有口语不流畅、重复、语法错误、指代和残缺句的长会议转写中,直接抽取原句作为摘要,且不能改写句子。模型还要同时覆盖主题级与整场级摘要;会议文本可达数千词,对高计算复杂度的 Transformer 尤其不利。
Source
How this page was assembled
Competition information is structured from the official page. Scores are platform estimates for decision support; official rules take precedence.
- Official competition page
- ModelScope
- Last checked
- Dec 2, 2022