一、计分与排名
- 本届比赛共5道题,每题满分10分,总分50分。
- 每道题的得分范围为0.0至10.0分,保留一位小数。
- 所有参赛者使用同一套评分口径。
- 专业组和非专业组分别排名、分别评奖。
- 不以提交时间先后作为主要评分依据。
- 五道题在比赛开始时同时开放,不设逐题答题或提交时限;所有题目统一在比赛结束时截止。
二、每题10分的组成
| 评分部分 | 分值 | 说明 |
|---|---|---|
| 最终成果质量 | 8分 | 综合判断成果是否正确、真实、完整、可用,是否真正解决了题目问题 |
| 有效人机协作 | 2分 | 结合完整 Reasonix 对话记录,判断参赛者是否通过理解、补充上下文、核验、取舍、测试和纠错实质改善了成果 |
| 合计 | 10分 |
评分不看对话长度、提示词数量、文件数量或代码行数。无效追问、重复要求“继续优化”或人为拉长对话,不会提高得分。
三、一句话 Agent 基准
一句话基准:在不使用任何特殊提示词的情况下,由 Reasonix + DeepSeek 单次执行所生成的结果。该结果不会公开,但会作为评委评分时的0分基准参考。
生成基准时使用与比赛相同的 Reasonix、DeepSeek、API、题面、附件和权限;在全新会话中仅提交题目要求,之后不进行人工追问、核验或纠错。
评分时按以下规则处理:
- 参赛作品的整体质量如果未显著超过该题官方基准,本题计0分。
- 只有显著超过官方基准的作品,才进入1至10分的评分区间。
- 官方基准是0分门槛,不是标准答案;参赛者可以采用不同的理解、方案和交付形式。
- 参赛者只发送一次指令不会自动判0分;评委依据最终成果及其中体现的实际判断和改进评分。
官方基准的具体成果、评价记录和隐藏测试不在赛前公开。
四、评审方式
比赛采用“AI 匿名横向评审+人工复核”的方式。
- 组委会将所有同题作品随机编号,评审 AI 不会看到姓名、部门和赛道等个人信息。
- AI 将对同一道题的作品进行多轮、乱序的独立横向比较,不以单次 AI 打分直接作为最终分数。
- AI 评审必须根据参赛者实际提交的成果、完整 Reasonix JSON 对话和其他必交材料给出具体证据,不得只输出一个分数。
- 获奖候选、奖项分界线附近、AI 评分差异较大、异常高分或存在事实争议的作品,将由人工复核。
- AI 用于批量初评、对比和证据整理,不单独决定最终获奖结果。
对评审 AI 模型、版本、参数和评审指令将在比赛前固定,同一道题的所有作品使用相同口径。
五、评审材料与证据
评委仅使用截止时间前成功提交的材料评分,不依赖现场演示或赛后口头补充。
参赛者应确保:
- 每道题按系统要求分别完成提交;
- 提交文件可正常解压、打开和读取;
- 完整 Reasonix JSON 对话记录与最终交付物能够对应;
- 交付物中的关键事实、数据、引用和功能声明可被复核。
Reasonix 对话导出标准
- 每道题上传一份当前题目的完整 Reasonix 会话;
- 导出路径为:打开当前会话 → 右上角“更多” → “导出会话” → “导出 JSON”;
- 文件名建议为:
任务01-姓名-Reasonix.json; - 系统只接受 Reasonix 原生 JSON 导出,不接受 Markdown、PDF、导出图片或长截图代替完整对话;
- 截图不再作为必交材料;系统只校验文件是否为可读取的 JSON,不绑定固定字段或版本结构。
为避免评委逐份配置不同技术环境,评审以正式提交物、完整对话和参赛者提供的验证证据为主。组委会可对获奖候选、异常作品和随机抽取作品进行必要的复现核验。
六、0分与违规处理
6.1 单题0分
出现以下情形时,本题计0分:
- 未在截止时间前成功提交题目要求的必交材料;
- 交付物为空、文件严重损坏或内容无法识别;
- 完全偏离题目对象或核心目标;
- 整体质量未显著超过该题官方一句话基准;
- 最终成果依靠大量伪造事实、写死数据或假功能才得以成立;
- 对话记录与最终交付物明显无法对应。
在作品文本、隐藏元素、源码、文档或其他材料中夹带试图操纵评审 AI 的指令,不会影响正常评分;情节严重的,将交由组委会按比赛诚信规则处理。
6.2 取消所有比赛成绩
使用未经允许的 Agent 或大模型、伪造或篡改对话记录、提交他人作品、违规协作,或触发比赛诚信规则中的其他取消成绩条件时,将取消参赛者所有比赛成绩。
取消成绩不由 AI 单独决定,必须经组委会人工复核并保留证据。
七、同分处理
同一赛道内个人总分相同时,依次按以下方式处理:
- 比较全部题目的“最终成果质量”合计分;
- 比较全部题目的“有效人机协作”合计分;
- 比较获得0分的题目数量,较少者优先;
- 仍然相同时,由不少于两名评委进行匿名整体复核;
- 整体复核后仍无法区分的,可并列名次,不以提交时间强行破除同分。
八、成绩公示与复核
评分完成后,系统将公布:
- 每道题的最终得分;
- 个人总分;
- 所在赛道的最终排名;
- 必要的简短扣分理由。
如参赛者认为存在材料识别错误、计分错误、关键事实错误或违规认定错误,可在组委会公布的时间内申请复核。复核不接受赛后补交、替换或修改作品。
九、不公开的评审内容
为避免详细评分点变相成为 Agent 的执行清单,以下内容仅供评委和组委会使用,不在赛前公开:
- 各题的详细评分维度、子项权重和限分条件;
- 官方一句话基准的具体成果和得分分析;
- 内部事实基准、测试场景和复现材料;
- AI 评审的完整提示词、批次安排和异常阈值;
- 其他参赛者的作品、对话记录和评委内部评语。
参赛者无需猜测隐藏的唯一答案。题目允许不同的解决路径,评委将依据正式提交中可验证的成果和有效的 Agent 协作证据进行横向评审。