Overview
Who this competition fits
适合做过图像描述、视觉语言模型或中文文本生成的参赛者,且能在 PaddlePaddle 框架中调整图像编码器、图文连接器或进行 LLM 微调。个人可参赛,也可组建不超过 5 人的团队;需要使用实名认证的 AI Studio 账号完成报名。
Read the original official blurb
在百度商业营销场景,广告图片生成精细化描述具有重要意义和价值。当前,随着大模型时代的到来,利用多模态大语言模型(MLLM)生成图片描述已经成为业界的通用做法(DallE3,Sora, Stable Diffusion3)。本赛道任务是广告图片描述生成,期望通过高质量数据和建模优化,提升图片描述的准确性和完备性。 Official tags: 多模态大语言模型. Sign-ups: 814.
Preparation
From registration to a first submission
- 01
PaddlePaddle 2.5
- 02
多模态图像描述模型
- 03
中文文本生成
- 04
Base64图像数据处理
- 05
模型推理加速
- 06
Linux脚本与依赖打包
Before you commit: 难点不只是生成细粒度中文广告图片描述,还要同时控制推理耗时:总评估同时看描述效果和单样本推理时间。模型必须在指定 PaddlePaddle 框架内实现,不能改动 LLM 的网络结构,并需将权重、源码和可执行推理脚本打包后在离线评测环境中复现。
Source
How this page was assembled
Competition information is structured from the official page. Scores are platform estimates for decision support; official rules take precedence.
- Official competition page
- Baidu AI Studio
- Last checked
- Not recorded