概览
这场竞赛适合谁
适合有 Agent Skill 使用或开发经验、能阅读 SKILL.md 并为办公会议纪要、记忆管理或健康管理场景设计测试用例的人。也适合能处理 JSON/JSONL 文件、撰写带数据分析和可视化的评测报告的参赛者。
查看官方简介原文
在 Agent 生态中,Skills 是赋予智能体特定能力的"神经元"。其质量直接决定了 Agent 在真实场景中的表现上限。如何科学、客观地评估一个 Skill 的优劣,是推动 Agent 生态健康发展的关键命题。 Official track: 大模型技术. Sponsor: 科大讯飞股份有限公司. Teams entered: 397.
参赛准备
从报名到首次提交的准备步骤
- 01
astron-eval 工具使用
- 02
Agent Skill 与 SKILL.md 阅读
- 03
JSON/JSONL 数据处理
- 04
评测集设计
- 05
人工结果复核
- 06
HTML 评测报告制作
投入前确认:难点不是只运行一次工具,而是为至少 3 个 Skill 建立共用且经过自行优化的评测集,并逐条人工复核执行结果。提交还要求将工具产物转换/重命名为规定格式,并让报告中的结论、指标和案例能够回溯到原始结果。
来源