概览
这场竞赛适合谁
适合已有 PaddlePaddle/PaddleOCR 使用经验、能训练和优化图像表格结构识别模型的团队。参赛者还需要能处理 PubTabNet 表格图像,并按指定 JSON 格式生成 HTML 结构预测;若希望进入决赛,还应能在 AtomGit 开源完整训练、推理代码和权重,并参加线下答辩。
查看官方简介原文
PaddleOCR 旨在打造一套丰富、领先、且实用的 OCR 工具库,助力开发者训练出更好的模型,并应用落地。作为飞桨开源社区最热门的套件开源项目,PaddleOCR 拥有业界领先的 PP-OCR 模型和多场景通用的表格识别模型,广受众多开发者和用户的认可和使用。本次算法模型挑战赛聚焦通用 OCR 模型,要求开发者以当前飞桨开源模型为基线,不断突破技术瓶颈,研发出更加高效准确的新模型。 Official tags: 通用 OCR 模型. Sign-ups: 245.
参赛准备
从报名到首次提交的准备步骤
- 01
能够读懂官方赛题与参赛规则
- 02
能够运行基础方案并完成一次有效提交
- 03
表格结构识别
- 04
PubTabNet 数据集
- 05
HTML 表格序列生成
- 06
JSONL 结果文件生成
投入前确认:核心难点是同时提高复杂表格结构的逐 Token 识别正确性并维持接近基线的推理速度:单个 Token 出错即会使该图像判错。提交不仅是跑出预测结果,还要求使用 PaddlePaddle 训练,并在复核时提供可复现最佳成绩的源码;进入决赛的队伍还需开源代码。
来源