概览
这场竞赛适合谁
适合已有语音增强、降噪、去混响或失真修复经验的音频算法开发者。参赛者需要能自行获取或构建训练数据,并将模型封装为可在平台环境中运行的推理包;可使用预训练模型,但不能调用 API。
查看官方简介原文
音频通信系统,如视频会议软件、语音通信软件、智能手机和固定电话,已被全球几乎所有人广泛使用,成为工作与个人生活中不可或缺的工具。尽管迄今为止已投入大量的研究,如于降噪、解混响的学术研究与工业落地,但要实现一套堪比面对面交流的系统 —— 尤其是在主流设备上实现这一目标,仍有很长的路要走。 Official track: 语音技术. Sponsor: 声网. Teams entered: 700.
参赛准备
从报名到首次提交的准备步骤
- 01
语音增强与语音质量修复
- 02
音频信号处理
- 03
PyTorch 等深度学习框架
- 04
48 kHz WAV 音频处理
- 05
模型推理包打包与 Linux 脚本
- 06
S3 对象存储上传
投入前确认:最大难点是没有官方训练集,只提供验证集,参赛者必须自行选择和处理训练数据,同时兼顾降噪与语音自身音质。提交不仅是上传预测音频,而是要按规范交付 tar.gz 推理包,并严格保证输出文件、格式、路径和时长与输入对应,否则整次提交无效。
来源