概览
这场竞赛适合谁
适合已有文本检索或广告召回经验、能处理搜索词—广告点击日志的参赛者。你需要能在 PaddlePaddle/AI Studio 上,基于指定的 Unimo-text-large 或 Ernie-3.0-xbase 底座实现双塔或生成式检索模型;个人和不超过 5 人的团队均可参加。
查看官方简介原文
NLP的显著进步推动了广告检索等IR技术的发展。随着深度学习的广泛应用,在传统的“索引-召回-排序”架构之上,基于表示学习的双塔匹配等技术已成为标准的召回方式。生成式检索的提出进一步革新了检索系统,省去索引直接将候选语料库编码进模型参数,端到端生成文档标识优化检索过程。我们发起基于大模型的广告检索大赛,通过优化模型不断提升检索效果。 Official tags: 自然语言处理. Sign-ups: 1992.
参赛准备
从报名到首次提交的准备步骤
- 01
能够读懂官方赛题与参赛规则
- 02
能够运行基础方案并完成一次有效提交
- 03
双塔检索建模
- 04
生成式检索
- 05
点击日志处理
- 06
Shell 提交脚本
投入前确认:难点不只是提高召回效果,还要在统一 GPU 环境中兼顾推理速度:总分同时考虑策略效果和单条平均推理时间,超时的效率部分不得分。进入后续阶段还需将可复现的完整模型与脚本打包提交,且代码复现要求使用 Paddle、测试环境不能联网。
来源