Overview
Who this competition fits
适合愿意以人工方式比较大模型回答质量的个人参与者,尤其是会编写 Prompt、能判断文本、图文理解或生成内容是否符合自己意图的人。比赛仅支持个人参赛;可按兴趣选择纯文本、图文理解、文生图或文生视频对战。
Read the original official blurb
FlagEval大模型角斗场评测大赛以智源研究院FlagEval天秤平台提供的大模型评测能力为基础,为用户提供一个直观、便捷的大模型能力体验的环境。 Official tags: 大模型评测. Sign-ups: 724.
Preparation
From registration to a first submission
- 01
提示词设计
- 02
大模型输出评估
- 03
文本生成质量判断
- 04
图文理解结果判断
- 05
文生图结果判断
- 06
人工标注规范
Before you commit: 核心难点是持续做出可靠且高质量的人工标注:排名不仅看评测量,还综合标注有效抽样得分、内容得分和正确率。每轮需等至少一个模型完整回复后投票,且不能用脚本、不能诱导模型透露身份;投票后也不能修改。
Source
How this page was assembled
Competition information is structured from the official page. Scores are platform estimates for decision support; official rules take precedence.
- Official competition page
- Baidu AI Studio
- Last checked
- Not recorded