概览
这场竞赛适合谁
适合已有文档智能处理或多模态大模型应用经验的个人参赛者,能够用通义千问及阿里云云端工具搭建自动化流程,从图片或 PDF 中读取复杂业务表格并生成 Excel 答案。也适合熟悉 OCR、表格结构恢复和基础数值处理的开发者;本赛题不允许多人组队。
查看官方简介原文
本赛题面向图片和 PDF 文件中的复杂表格识别与内容理解。参赛者需要读取 题目清单,识别目标文档中的表格结构和表格内容,并完成结构恢复、内容提取 或简单推理计算,最终提交可自动评分的 Excel 结果文件。 Official category: AI Large Model Competition (AI大模型赛). Official tags: 自然语言处理, 大语言模型. Teams entered: 929.
参赛准备
从报名到首次提交的准备步骤
- 01
通义千问 API 调用
- 02
阿里云云端产品使用
- 03
PDF 与图像 OCR
- 04
表格版面分析
- 05
JSON 结构化输出
- 06
Excel 文件读写
投入前确认:难点是面对跨页表格、合并单元格、多级表头、弱边框、旋转扫描及页眉脚注等干扰,既要恢复逻辑表格结构,又要按题意定位数据并完成推理。结构恢复还必须输出严格的 JSON 行列位置与合并关系,同时全流程只能使用阿里云来源的云端模型、工具和算力,且答案必须程序自动生成。
来源