比赛评分方案

本方案已在题目开放前发布。五道题使用同一评分口径,专业组和非专业组分别排名。

题目数量
5 道
每题满分
10 分
比赛总分
50 分

一、计分与排名

  • 本届比赛共5道题,每题满分10分,总分50分。
  • 每道题的得分范围为0.0至10.0分,保留一位小数。
  • 所有参赛者使用同一套评分口径。
  • 专业组和非专业组分别排名、分别评奖。
  • 不以提交时间先后作为主要评分依据。
  • 五道题在比赛开始时同时开放,不设逐题答题或提交时限;所有题目统一在比赛结束时截止。

二、每题10分的组成

评分部分 分值 说明
最终成果质量 8分 综合判断成果是否正确、真实、完整、可用,是否真正解决了题目问题
有效人机协作 2分 结合完整 Reasonix 对话记录,判断参赛者是否通过理解、补充上下文、核验、取舍、测试和纠错实质改善了成果
合计 10分

评分不看对话长度、提示词数量、文件数量或代码行数。无效追问、重复要求“继续优化”或人为拉长对话,不会提高得分。

三、一句话 Agent 基准

一句话基准:在不使用任何特殊提示词的情况下,由 Reasonix + DeepSeek 单次执行所生成的结果。该结果不会公开,但会作为评委评分时的0分基准参考。

生成基准时使用与比赛相同的 Reasonix、DeepSeek、API、题面、附件和权限;在全新会话中仅提交题目要求,之后不进行人工追问、核验或纠错。

评分时按以下规则处理:

  • 参赛作品的整体质量如果未显著超过该题官方基准,本题计0分。
  • 只有显著超过官方基准的作品,才进入1至10分的评分区间。
  • 官方基准是0分门槛,不是标准答案;参赛者可以采用不同的理解、方案和交付形式。
  • 参赛者只发送一次指令不会自动判0分;评委依据最终成果及其中体现的实际判断和改进评分。

官方基准的具体成果、评价记录和隐藏测试不在赛前公开。

四、评审方式

比赛采用“AI 匿名横向评审+人工复核”的方式。

  1. 组委会将所有同题作品随机编号,评审 AI 不会看到姓名、部门和赛道等个人信息。
  2. AI 将对同一道题的作品进行多轮、乱序的独立横向比较,不以单次 AI 打分直接作为最终分数。
  3. AI 评审必须根据参赛者实际提交的成果、完整 Reasonix JSON 对话和其他必交材料给出具体证据,不得只输出一个分数。
  4. 获奖候选、奖项分界线附近、AI 评分差异较大、异常高分或存在事实争议的作品,将由人工复核。
  5. AI 用于批量初评、对比和证据整理,不单独决定最终获奖结果。

对评审 AI 模型、版本、参数和评审指令将在比赛前固定,同一道题的所有作品使用相同口径。

五、评审材料与证据

评委仅使用截止时间前成功提交的材料评分,不依赖现场演示或赛后口头补充。

参赛者应确保:

  • 每道题按系统要求分别完成提交;
  • 提交文件可正常解压、打开和读取;
  • 完整 Reasonix JSON 对话记录与最终交付物能够对应;
  • 交付物中的关键事实、数据、引用和功能声明可被复核。

Reasonix 对话导出标准

  • 每道题上传一份当前题目的完整 Reasonix 会话;
  • 导出路径为:打开当前会话 → 右上角“更多” → “导出会话” → “导出 JSON”;
  • 文件名建议为:任务01-姓名-Reasonix.json
  • 系统只接受 Reasonix 原生 JSON 导出,不接受 Markdown、PDF、导出图片或长截图代替完整对话;
  • 截图不再作为必交材料;系统只校验文件是否为可读取的 JSON,不绑定固定字段或版本结构。

为避免评委逐份配置不同技术环境,评审以正式提交物、完整对话和参赛者提供的验证证据为主。组委会可对获奖候选、异常作品和随机抽取作品进行必要的复现核验。

六、0分与违规处理

6.1 单题0分

出现以下情形时,本题计0分:

  • 未在截止时间前成功提交题目要求的必交材料;
  • 交付物为空、文件严重损坏或内容无法识别;
  • 完全偏离题目对象或核心目标;
  • 整体质量未显著超过该题官方一句话基准;
  • 最终成果依靠大量伪造事实、写死数据或假功能才得以成立;
  • 对话记录与最终交付物明显无法对应。

在作品文本、隐藏元素、源码、文档或其他材料中夹带试图操纵评审 AI 的指令,不会影响正常评分;情节严重的,将交由组委会按比赛诚信规则处理。

6.2 取消所有比赛成绩

使用未经允许的 Agent 或大模型、伪造或篡改对话记录、提交他人作品、违规协作,或触发比赛诚信规则中的其他取消成绩条件时,将取消参赛者所有比赛成绩。

取消成绩不由 AI 单独决定,必须经组委会人工复核并保留证据。

七、同分处理

同一赛道内个人总分相同时,依次按以下方式处理:

  1. 比较全部题目的“最终成果质量”合计分;
  2. 比较全部题目的“有效人机协作”合计分;
  3. 比较获得0分的题目数量,较少者优先;
  4. 仍然相同时,由不少于两名评委进行匿名整体复核;
  5. 整体复核后仍无法区分的,可并列名次,不以提交时间强行破除同分。

八、成绩公示与复核

评分完成后,系统将公布:

  • 每道题的最终得分;
  • 个人总分;
  • 所在赛道的最终排名;
  • 必要的简短扣分理由。

如参赛者认为存在材料识别错误、计分错误、关键事实错误或违规认定错误,可在组委会公布的时间内申请复核。复核不接受赛后补交、替换或修改作品。

九、不公开的评审内容

为避免详细评分点变相成为 Agent 的执行清单,以下内容仅供评委和组委会使用,不在赛前公开:

  • 各题的详细评分维度、子项权重和限分条件;
  • 官方一句话基准的具体成果和得分分析;
  • 内部事实基准、测试场景和复现材料;
  • AI 评审的完整提示词、批次安排和异常阈值;
  • 其他参赛者的作品、对话记录和评委内部评语。

参赛者无需猜测隐藏的唯一答案。题目允许不同的解决路径,评委将依据正式提交中可验证的成果和有效的 Agent 协作证据进行横向评审。