# VeriHarness v0.2.3 Verification Prompt Ablation

## 实验设置

- 条件：C0（无 Verification）、C1（V0 Mentor Minimal）、C2（V1 Initial Full）、C3（V2 Overall Compact）。
- 固定部分：Tool V1、Task V1、Claude Opus 4.8 主模型、图片输入、运行环境。
- 数据：case5、case9、case22、case23、case25。
- 规模：4 条件 × 5 cases × 3 replicates = 60 cells，并发 10。
- 离线评估：Gemini 3.1 Pro Preview；VDiff Gold + 全部 discovery rubrics；370 条唯一 rubrics，4,440 条候选判断；每条 rubric 等权。

## 结果

| 条件 | Macro score | Micro score | Pass@4 | 成功 MLLM calls | 平均耗时 | 平均主模型成本 |
|---|---:|---:|---:|---:|---:|---:|
| C0 | 3.675 | 3.644 | 5/15 | 4 | 130s | $1.50 |
| C1 | **3.927** | **3.919** | 6/15 | 5 | 244s | $2.87 |
| C2 | 3.830 | 3.770 | 7/15 | 81 | 749s | $11.00 |
| C3 | 3.875 | 3.829 | **8/15** | 36 | 350s | $5.24 |

相对 C0 的 case-level 平均变化：

- C1：+0.251，95% bootstrap CI [0.052, 0.425]；4 胜 / 1 负。
- C2：+0.155，95% bootstrap CI [-0.133, 0.387]；3 胜 / 1 平 / 1 负。
- C3：+0.200，95% bootstrap CI [0.017, 0.345]；4 胜 / 1 负。

逐 case 最优条件：case22=C1、case23=C1、case25=C2、case5=C1、case9=C3。

## 结论

1. C1 Mentor Minimal 是本轮最好的默认候选：平均质量最高，相比 C0 有正向 case-level 区间，成本显著低于 C2/C3。
2. C3 的平均分略低于 C1，但 Pass@4 最多，并且确保 15/15 cells 使用外部验证；它适合作为“需要可靠触发外部验证”的折中版本。
3. C2 的验证闭环最重，但没有得到相称的平均收益：平均耗时约为 C0 的 5.7 倍、主模型成本约 7.4 倍，case5 反而比 C0 低 0.333。完整版 prompt 可能诱发过度迭代。
4. 不存在所有 case 都最优的单一版本。下一轮应优先研究 C1 与 C3，而不是继续增加 C2 的规则密度。

## 解释边界

- C0 表示“没有 Verification prompt”，不是“禁止使用 MLLM”。Tool V1 本身鼓励主动调用，因此 C0 仍有 4 次成功调用。
- C1 只在 4/15 cells 中调用外部 MLLM；它的增益不能简单解释为“更多外部调用”，更可能来自短而明确的完成标准。
- C2 有 2 次工具输入因图片路径不是 workspace-relative 被 MCP 明确拒绝；两次均被记录并由后续成功调用恢复，没有影响 cell 完成。
- 样本只有 5 个 case，离线 verifier 每个候选只评一次；结论适合指导下一轮实验，不应当作普遍规律。

## 可审计产物

- Generation：`runs/v023-verification-ablation-5case-20260718-01/`
- Evaluation：`runs/v023-verification-ablation-5case-20260718-01/offline-evaluations/vdiff-gold-discovery-v1-20260718-01/`
- 汇总：`summary.json`
- 分析：`analysis.json`
- 表格：`public-tables/condition-summary.csv`、`per-case-effects.csv`、`per-cell-results.csv`
