Tavondo
首页竞赛测评指南平台

没有找到匹配的竞赛

可以尝试平台、方向或竞赛标题

English
首页竞赛测评指南平台
English注册登录
Tavondo

帮你发现适合自己的 AI 竞赛:测评、推荐、目录与指南都在同一处。

发现

竞赛测评指南平台

账户

登录注册能力测评

© 2026 Tavondo

English
  1. 首页
  2. 竞赛
  3. FlagEval大模型角斗场评测大赛

竞赛工作页

Baidu AI Studio大语言模型入门报名状态待确认报名状态待确认

FlagEval大模型角斗场评测大赛

适合愿意以人工方式比较大模型回答质量的个人参与者,尤其是会编写 Prompt、能判断文本、图文理解或生成内容是否符合自己意图的人。比赛仅支持个人参赛;可按兴趣选择纯文本、图文理解、文生图或文生视频对战。

打开官方页面登录后保存去看指南

建议下一步

先判断这场是否适合你现在的阶段,再决定要不要投入时间。

新手分

78/100

分数越高,越适合作为当前阶段的真实起点。

学习价值

72/100

衡量这场比赛能不能真正教会你可迁移的方法。

预计投入

4-12 小时

用它判断这场比赛是否适合你当前的时间预算。

Metric

以官方页面公布的评分规则为准

如果你还解释不清这个指标,通常说明还需要先做准备。

这场竞赛适合谁

适合愿意以人工方式比较大模型回答质量的个人参与者,尤其是会编写 Prompt、能判断文本、图文理解或生成内容是否符合自己意图的人。比赛仅支持个人参赛;可按兴趣选择纯文本、图文理解、文生图或文生视频对战。

官方简介(未加工)
FlagEval大模型角斗场评测大赛以智源研究院FlagEval天秤平台提供的大模型评测能力为基础,为用户提供一个直观、便捷的大模型能力体验的环境。 Official tags: 大模型评测. Sign-ups: 724.

开始前先准备这些

如果下面这些前置项还很陌生,先补准备通常比直接参赛更划算。

提示词设计

大模型输出评估

文本生成质量判断

图文理解结果判断

文生图结果判断

人工标注规范

真正会卡住你的地方

真正的难点通常不是“会不会调包”,而是验证、时间分配和任务理解。

核心难点是持续做出可靠且高质量的人工标注:排名不仅看评测量,还综合标注有效抽样得分、内容得分和正确率。每轮需等至少一个模型完整回复后投票,且不能用脚本、不能诱导模型透露身份;投票后也不能修改。

先看这个更划算

这篇指南是最合适的前置阅读,可以先把基本策略走通。

用一个简单框架选到真正能学到东西、而不是一上来就被劝退的比赛。

如何选择你的第一场 AI 竞赛

你的决策

先用这些信息快速做判断,再决定要不要继续深入。

状态
报名状态待确认
报名
报名状态待确认
参赛资格
待官方确认
奖励
礼品+证书
算力要求
免费 GPU 可用
官方 Metric
以官方页面公布的评分规则为准
核验
来源页面已核验

报名状态尚未核实,投入前先到官方页面确认是否还能加入。

保存到账户

登录后可以保存竞赛并建立自己的候选列表。

登录后保存注册账户

官方入口

最终规则、文件、提交方式和 deadline 仍然以官方页面为准。

打开官方页面

相关竞赛

以下竞赛与当前竞赛方向或难度相近,可以一起对比。

DrivenData

大语言模型

Power Laws: Optimizing Demand-side Strategies

报名状态待确认

DrivenData

大语言模型

临床文档摘要生成

报名状态待确认

Baidu AI Studio

大语言模型

基于文心CV大模型的智慧城市视觉多任务识别

报名状态待确认

Baidu AI Studio

大语言模型

基于文心NLP大模型的阅读理解可解释评测

报名状态待确认

数据与审核状态

把已确认、待核对和人工审核状态分开看;最终规则与截止时间以官方页为准,发现错误欢迎提交纠错。

来源页面已核验Metric 已确认已审核
本站纳入时间
2026年7月21日

官方 metric 还没有从当前抓取结果中确认,仍需人工核对。