新手分
48/100
适合已有大语言模型训练或微调经验、能围绕 API 定义构造合成指令数据的开发者或团队。参赛者还需要理解多轮对话中的工具调用时机、历史上下文和函数参数生成;个人和组织机构均可参赛。
如果下面这些前置项还很陌生,先补准备通常比直接参赛更划算。
大语言模型微调
合成数据生成
多轮对话建模
函数调用(Function Calling)
API 参数填充
模型推理环境部署
真正的难点通常不是“会不会调包”,而是验证、时间分配和任务理解。
难点不只是生成对话数据,而是让模型在包含日常聊天的多轮上下文中,既能判断是否该调用工具,又能选对未见过的 API 并准确填全参数。决赛还要求提交可由统一接口测试的模型及环境,并提供代码、训练日志等完整方案。
以下竞赛与当前竞赛方向或难度相近,可以一起对比。
把已确认、待核对和人工审核状态分开看;最终规则与截止时间以官方页为准,发现错误欢迎提交纠错。
官方 metric 还没有从当前抓取结果中确认,仍需人工核对。
reward_value_usd is a rough CNY→USD estimate (×0.14) for ranking only; use reward_summary for the official prize text.