概览
这场竞赛适合谁
适合愿意以人工方式比较大模型回答质量的个人参与者,尤其是会编写 Prompt、能判断文本、图文理解或生成内容是否符合自己意图的人。比赛仅支持个人参赛;可按兴趣选择纯文本、图文理解、文生图或文生视频对战。
查看官方简介原文
FlagEval大模型角斗场评测大赛以智源研究院FlagEval天秤平台提供的大模型评测能力为基础,为用户提供一个直观、便捷的大模型能力体验的环境。 Official tags: 大模型评测. Sign-ups: 724.
参赛准备
从报名到首次提交的准备步骤
- 01
提示词设计
- 02
大模型输出评估
- 03
文本生成质量判断
- 04
图文理解结果判断
- 05
文生图结果判断
- 06
人工标注规范
投入前确认:核心难点是持续做出可靠且高质量的人工标注:排名不仅看评测量,还综合标注有效抽样得分、内容得分和正确率。每轮需等至少一个模型完整回复后投票,且不能用脚本、不能诱导模型透露身份;投票后也不能修改。
来源