VeriHarness V0.5 · Round 1

最正式的一次 verification-prompt 实验:image→HTML 复现,3 条件 × 8 case × 2 replicate × 2 生成模型(opus / gpt-5.6)。本页用来直接看效果差异——逐 case 把参考图与 A-raw / B-base / P0 的渲染结果并排比较,并显示离线 gemini 评分。

三条件

A-rawtask prompt only,无 tool / 无 MCP / 无 CallMLLM。整体地板 baseline。
B-basetask + tool prompt + CallMLLM 多模态验证 tool(可用但无验证 prompt)。所有 V 系列公共底座。
P0B-base + 一句极简 "you may verify" 提醒。

条件均值(当前模型 · 0–5)

来源 offline-gemini-v1,score = rubric_pass_rate × 5
Round-1 主发现:最大跃升在 A-raw → B-base(给 agent 验证工具本身);P0 的极简提醒相对 B-base 几乎不增。within-set,8 case × 2 replicate,单轮,无显著性检验,非跨 case 泛化结论。

逐 case 效果对比