# Vibe Challenge 比赛评分方案

## 一、计分与排名

- 本届比赛共5道题，每题满分10分，总分50分。
- 每道题的得分范围为0.0至10.0分，保留一位小数。
- 所有参赛者使用同一套评分口径。
- 专业组和非专业组分别排名、分别评奖。
- 不以提交时间先后作为主要评分依据。
- 五道题在比赛开始时同时开放，不设逐题答题或提交时限；所有题目统一在比赛结束时截止。

## 二、每题10分的组成

| 评分部分 | 分值 | 说明 |
|---|---:|---|
| 最终成果质量 | 8分 | 综合判断成果是否正确、真实、完整、可用，是否真正解决了题目问题 |
| 有效人机协作 | 2分 | 结合完整 Reasonix 对话记录，判断参赛者是否通过理解、补充上下文、核验、取舍、测试和纠错实质改善了成果 |
| **合计** | **10分** | |

评分不看对话长度、提示词数量、文件数量或代码行数。无效追问、重复要求“继续优化”或人为拉长对话，不会提高得分。

## 三、一句话 Agent 基准

**一句话基准**：在不使用任何特殊提示词的情况下，由 Reasonix + DeepSeek 单次执行所生成的结果。该结果不会公开，但会作为评委评分时的0分基准参考。

生成基准时使用与比赛相同的 Reasonix、DeepSeek、API、题面、附件和权限；在全新会话中仅提交题目要求，之后不进行人工追问、核验或纠错。

评分时按以下规则处理：

- 参赛作品的整体质量如果未显著超过该题官方基准，本题计0分。
- 只有显著超过官方基准的作品，才进入1至10分的评分区间。
- 官方基准是0分门槛，不是标准答案；参赛者可以采用不同的理解、方案和交付形式。
- 参赛者只发送一次指令不会自动判0分；评委依据最终成果及其中体现的实际判断和改进评分。

官方基准的具体成果、评价记录和隐藏测试不在赛前公开。

## 四、评审方式

比赛采用“AI 匿名横向评审＋人工复核”的方式。

1. 组委会将所有同题作品随机编号，评审 AI 不会看到姓名、部门和赛道等个人信息。
2. AI 将对同一道题的作品进行多轮、乱序的独立横向比较，不以单次 AI 打分直接作为最终分数。
3. AI 评审必须根据参赛者实际提交的成果、完整 Reasonix JSON 对话和其他必交材料给出具体证据，不得只输出一个分数。
4. 获奖候选、奖项分界线附近、AI 评分差异较大、异常高分或存在事实争议的作品，将由人工复核。
5. AI 用于批量初评、对比和证据整理，不单独决定最终获奖结果。

对评审 AI 模型、版本、参数和评审指令将在比赛前固定，同一道题的所有作品使用相同口径。

## 五、评审材料与证据

评委仅使用截止时间前成功提交的材料评分，不依赖现场演示或赛后口头补充。

参赛者应确保：

- 每道题按系统要求分别完成提交；
- 提交文件可正常解压、打开和读取；
- 完整 Reasonix JSON 对话记录与最终交付物能够对应；
- 交付物中的关键事实、数据、引用和功能声明可被复核。

### Reasonix 对话导出标准

- 每道题上传一份当前题目的完整 Reasonix 会话；
- 导出路径为：打开当前会话 → 右上角“更多” → “导出会话” → “导出 JSON”；
- 文件名建议为：`任务01-姓名-Reasonix.json`；
- 系统只接受 Reasonix 原生 JSON 导出，不接受 Markdown、PDF、导出图片或长截图代替完整对话；
- 截图不再作为必交材料；系统只校验文件是否为可读取的 JSON，不绑定固定字段或版本结构。

为避免评委逐份配置不同技术环境，评审以正式提交物、完整对话和参赛者提供的验证证据为主。组委会可对获奖候选、异常作品和随机抽取作品进行必要的复现核验。

## 六、0分与违规处理

### 6.1 单题0分

出现以下情形时，本题计0分：

- 未在截止时间前成功提交题目要求的必交材料；
- 交付物为空、文件严重损坏或内容无法识别；
- 完全偏离题目对象或核心目标；
- 整体质量未显著超过该题官方一句话基准；
- 最终成果依靠大量伪造事实、写死数据或假功能才得以成立；
- 对话记录与最终交付物明显无法对应。

在作品文本、隐藏元素、源码、文档或其他材料中夹带试图操纵评审 AI 的指令，不会影响正常评分；情节严重的，将交由组委会按比赛诚信规则处理。

### 6.2 取消所有比赛成绩

使用未经允许的 Agent 或大模型、伪造或篡改对话记录、提交他人作品、违规协作，或触发比赛诚信规则中的其他取消成绩条件时，将取消参赛者所有比赛成绩。

取消成绩不由 AI 单独决定，必须经组委会人工复核并保留证据。

## 七、同分处理

同一赛道内个人总分相同时，依次按以下方式处理：

1. 比较全部题目的“最终成果质量”合计分；
2. 比较全部题目的“有效人机协作”合计分；
3. 比较获得0分的题目数量，较少者优先；
4. 仍然相同时，由不少于两名评委进行匿名整体复核；
5. 整体复核后仍无法区分的，可并列名次，不以提交时间强行破除同分。

## 八、成绩公示与复核

评分完成后，系统将公布：

- 每道题的最终得分；
- 个人总分；
- 所在赛道的最终排名；
- 必要的简短扣分理由。

如参赛者认为存在材料识别错误、计分错误、关键事实错误或违规认定错误，可在组委会公布的时间内申请复核。复核不接受赛后补交、替换或修改作品。

## 九、不公开的评审内容

为避免详细评分点变相成为 Agent 的执行清单，以下内容仅供评委和组委会使用，不在赛前公开：

- 各题的详细评分维度、子项权重和限分条件；
- 官方一句话基准的具体成果和得分分析；
- 内部事实基准、测试场景和复现材料；
- AI 评审的完整提示词、批次安排和异常阈值；
- 其他参赛者的作品、对话记录和评委内部评语。

参赛者无需猜测隐藏的唯一答案。题目允许不同的解决路径，评委将依据正式提交中可验证的成果和有效的 Agent 协作证据进行横向评审。
