# VeriHarness v0.5 — Verification-Prompt Study

完全独立的实验 subproject，与 v0.x 隔离，只共享项目核心主张。**目前最正式的一次实验**：正式对比不同 verification prompt 版本，验证多模态验证环节在 image→HTML agentic coding loop 中的作用。

核心叙事见 [CORE_STORY.md](CORE_STORY.md)，完整协议见
[GOAL_SPEC.md](GOAL_SPEC.md)，来源与哈希见
[SOURCE_LINEAGE.md](SOURCE_LINEAGE.md)。

## 当前阶段：trajectory-driven verification prompt study

- `A-raw`：raw `claude -p` + task prompt，无 tool prompt / 无 MCP / 无 CallMLLM（整体地板）。
- `B-base`：task + tool prompt + CallMLLM MCP，无 verification（所有 V 系列的公共底座）。
- Verification prompt 按 baseline/V1/V2 轨迹逐步设计；当前核心方向是
  grounding、持久 Visual Test Suite 和 comprehensive per-test verification。

两 baseline 各 8 cases × 2 replicate × {opus, gpt} = 32 cells/manifest。

## 环境

```bash
python3 -m venv .venv
.venv/bin/pip install -e '.[dev]'
.venv/bin/playwright install chromium
.venv/bin/python -m pytest -q
```

## 结构

- `src/veriharness_v05/`：vendored 自 v0.4 的 harness（包已重命名），逐模块审查后复用；唯一代码改动是 runner 的 per-condition MCP 开关。
- `prompts/task/V05_faithful_nohack.md`：v0.5 共享 task prompt。
- `prompts/tool/V1_initial_mcp_aligned.md`：CallMLLM tool prompt（B/V 用）。
- `experiments/v05-baselines-*.yaml`：两 baseline manifest（opus / gpt）。
- `data/`：8 cases + `dataset-manifest.json`（gold+discovery，冻结哈希）。
- `tests/test_v05_contract.py`：v0.5 契约测试。

## 隔离

本目录是独立本地 git 仓库。runs / workspaces / venv / 缓存不入库。gemini 与 gpt 的 endpoint/token 只从环境注入。
