新手分
16/100
对评估模型认知能力(而不是记忆或简单复述 benchmark)感兴趣的研究者、benchmark 设计者和进阶 LLM 从业者。
如果下面这些前置项还很陌生,先补准备通常比直接参赛更划算。
benchmark 设计基础
LLM 评测素养
技术写作
了解数据泄漏与污染风险
真正的难点通常不是“会不会调包”,而是验证、时间分配和任务理解。
核心工作是 benchmark 设计和评测方法论:你需要理解高质量的 AGI 向任务到底在衡量什么、如何避免数据泄漏,以及怎样把评审标准讲清楚。
以下竞赛与当前竞赛方向或难度相近,可以一起对比。
把已确认、待核对和人工审核状态分开看;最终规则与截止时间以官方页为准,发现错误欢迎提交纠错。
官方 metric 还没有从当前抓取结果中确认,仍需人工核对。