Report 014: Claude Haiku 5.5 on release day, three skills
What did Report 014 find?
- What we tested. Claude Haiku 5.5 came out on 7 Oct. We ran it and Claude Haiku 4.5 on three skills, three times each.
- What we found. On Claude Haiku 5.5 no skill clearly helped in two or more of three repeats. Documentation clearly helped Claude Haiku 4.5 in two of three; on Haiku 5.5 all three had too few answers to tell, so these runs cannot say whether it still helps. Code review and git workflow did not clearly help either model in two or more repeats.
- Repeats matter. Four of six model and task pairs changed reading between repeats.
- What it doesn't show. One task per skill and few answers: nothing about other work, and no model ranking.
Release drift report. It measures a new model on the same skills and tasks as earlier reports, beside the model before it, with Report 013’s Claude Sonnet 5.5 and Claude Opus 5.5 receipts as context.
Which skills help Claude Haiku 5.5?
Claude Haiku 5.5 on the three skills and cases of Reports 009, 011 and 013, beside Claude Haiku 4.5, each run three times. On Claude Haiku 5.5 no skill clearly helped in two or more of the three runs. Helped Claude Haiku 4.5; on Claude Haiku 5.5 these runs had too few answers to tell. documentation-and-adrs: clearly helped Claude Haiku 4.5 in two of three runs (one had too few answers to tell), and Claude Haiku 5.5 in zero of three runs (three had too few answers to tell). Did not clearly help either model in two or more of the three runs. code-review-and-quality: clearly helped Claude Haiku 4.5 in one of three runs (two had too few answers to tell), and Claude Haiku 5.5 in one of three runs (two had too few answers to tell). git-workflow-and-versioning: clearly helped Claude Haiku 4.5 in zero of three runs (three showed no clear difference), and Claude Haiku 5.5 in one of three runs (one showed no clear difference, one had too few answers to tell).
A skill counts as helping a model here when it clearly helped it in at least two of the three runs. Every figure below is read from a receipt or a file published beside it, and each block names its files. This report measures what a skill adds to each model on these cases. It makes no claim about any model’s coding ability.
Read from: docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json.
| task | model | run 1 | run 2 | run 3 | clearly helped |
|---|---|---|---|---|---|
| code review | Claude Haiku 5.5 | Clearly helped | Too few answers to tell | Too few answers to tell | one of three |
| code review | Claude Haiku 4.5 | Clearly helped | Too few answers to tell | Too few answers to tell | one of three |
| code review | Claude Sonnet 5.5 (Report 013) | Too few answers to tell | Too few answers to tell | Too few answers to tell | zero of three |
| code review | Claude Opus 5.5 (Report 013) | Too few answers to tell | Too few answers to tell | Too few answers to tell | zero of three |
| git workflow | Claude Haiku 5.5 | Clearly helped | No clear difference | Too few answers to tell | one of three |
| git workflow | Claude Haiku 4.5 | No clear difference | No clear difference | No clear difference | zero of three |
| git workflow | Claude Sonnet 5.5 (Report 013) | No clear difference | No clear difference | No clear difference | zero of three |
| git workflow | Claude Opus 5.5 (Report 013) | Clearly helped | Clearly helped | Too few answers to tell | two of three |
| documentation | Claude Haiku 5.5 | Too few answers to tell | Too few answers to tell | Too few answers to tell | zero of three |
| documentation | Claude Haiku 4.5 | Clearly helped | Clearly helped | Too few answers to tell | two of three |
| documentation | Claude Sonnet 5.5 (Report 013) | Clearly helped | Clearly helped | Clearly helped | three of three |
| documentation | Claude Opus 5.5 (Report 013) | Too few answers to tell | Clearly helped | Clearly helped | two of three |
Clearly helped: in that run the spread of the model’s scores with the skill did not overlap its spread without it, and the averages were at least 0.05 apart.
No clear difference: there were enough answers to see a gap of 0.05, and the spreads overlapped or the gap was smaller.
Too few answers to tell: the scores were too spread out, or too few, to see a gap of 0.05 either way. It does not mean the skill did nothing.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; config.js.
What did each model score, without the skill and with it?
Under each model’s name, one row per run, runs one to three from the top. The hollow dot is a model’s average score without the skill, the filled dot its average with the skill, and the line between them is what the skill added. Each panel spans scores from zero at the left edge to one at the right. The two Claude Haiku rows were run for this report; the Claude Sonnet 5.5 and Claude Opus 5.5 rows are Report 013’s.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.
What do the runs show?
Which skills still help Claude Haiku 5.5?
Still help: none. Stopped helping, as far as these runs can tell: none. Helped Claude Haiku 4.5, too few answers to tell on Claude Haiku 5.5: documentation-and-adrs. Started helping: none. Did not clearly help either model in two or more of the three runs: code-review-and-quality, git-workflow-and-versioning.
A result that had too few answers to tell does not show that a skill stopped working. The two Claude Haiku arms also differ in more than the model: Claude Code applied its per-turn effort to every call of Claude Haiku 5.5 and to no call of Claude Haiku 4.5.
code-review-and-quality: Claude Haiku 5.5 averaged 0.821, 0.813 and 0.823 without the skill and 0.891, 0.861 and 0.770 with it, so the skill added +0.070, +0.048 and -0.053 across the three runs. Claude Haiku 4.5 averaged 0.339, 0.540 and 0.547 without it and 0.677, 0.628 and 0.566 with it, an addition of +0.339, +0.088 and +0.019.
git-workflow-and-versioning: Claude Haiku 5.5 averaged 0.300, 0.849 and 0.613 without the skill and 0.849, 0.839 and 0.848 with it, so the skill added +0.549, -0.010 and +0.235 across the three runs. Claude Haiku 4.5 averaged 0.834, 0.838 and 0.839 without it and 0.832, 0.828 and 0.813 with it, an addition of -0.002, -0.010 and -0.026.
documentation-and-adrs: Claude Haiku 5.5 averaged 0.561, 0.589 and 0.483 without the skill and 0.597, 0.500 and 0.542 with it, so the skill added +0.036, -0.089 and +0.059 across the three runs. Claude Haiku 4.5 averaged 0.626, 0.579 and 0.605 without it and 0.763, 0.772 and 0.739 with it, an addition of +0.138, +0.193 and +0.134.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json.
How often did the skills clearly help each model?
Out of nine results for each model (three tasks, three runs), the skills clearly helped Claude Haiku 5.5 in two of nine, Claude Haiku 4.5 in three of nine, Claude Sonnet 5.5 in three of nine and Claude Opus 5.5 in four of nine. Claude Sonnet 5.5 and Claude Opus 5.5 are Report 013’s receipts, not run again, and these counts set the four models side by side without ranking them.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.
Why run every test three times?
Repeat runs of the same test did not always agree: six of the twelve model and task pairs changed reading between runs. Most of those changes were between clearly helped and too few answers to tell; only one pair, git workflow on Claude Haiku 5.5, read two answers that conflict, clearly helped in one run and no clear difference in another.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.
What are the limits, and what differs from Reports 009, 011 and 013?
What does this report not show?
Each skill was tested on one task only. Nothing here says how these skills do on other tasks, or how these models do at coding in general.
Each arm drew between 3 and 10 answers in a run, and the grader scored every answer three times. That is few answers. Where a result had too few answers to tell, the scores were too spread out, or too few, to see a gap of 0.05.
Every answer was scored by claude-opus-5 as the grader, as in Reports 009, 011 and 013. Our other reports use a different grader, set by the judge policy, so compare these scores with Reports 009, 011 and 013 only.
A result reads one model’s receipt: what the skill added to the model that answered, in that run. The page counts how many runs clearly helped each model and sets the counts side by side; it does not test whether one model’s lift differs from another’s.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; config.js.
What differs from the earlier reports?
Claude Haiku 5.5 came out on 7 Oct 2026, as the vendor’s release notes date it (the record, release-date.json, is published beside this page). The first run began on 7 Oct 2026 at 20:17 UTC.
The model before it is Claude Haiku 4.5. Claude Sonnet 5.5 and Claude Opus 5.5 are Report 013’s receipts, not run again: they ran on the same Claude Code, 2.1.284, on 29 Sep 2026.
Every test ran three times. No model was given an effort or thinking setting. Claude Code applied its own per-turn effort in every call of Claude Haiku 5.5 and no call of Claude Haiku 4.5.
Prices come from the vendor’s pricing page as saved on the day of the run: 0.1 and 0.5 dollars per million input and output tokens for Claude Haiku 5.5 (the vendor’s first rate, for the shorter prompts every call here used), and 1 and 5 for Claude Haiku 4.5. Prices change the estimated cost only, never a score.
A safety limit allowed up to 480 model calls per run directory. It was set for up to twelve skill runs, in case the comparison models were run again; each run made six.
Read from: docs/reports/014/evidence/release-date.json; docs/reports/014/evidence/run-1/run-record.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/014/evidence/guard.py.
Evidence and files
How the runs were set up, in full: departures and what stayed fixed
What departs from Report 013
- The same Claude Code. Every call of the two Claude Haiku arms ran on Claude Code
2.1.284, the version Report 013 pinned, installed at the npm integrity the run record states. Each receipt has a sidecar,<receipt>.surface.json, bound to it by itsreceipt_hashand recording the version each of its calls reported. - The prices are this run’s own. The runner’s registry had no row for
claude-haiku-5-5. This run used a copy of it with that row added at 0.1 and 0.5 dollars per million input and output tokens, andclaude-haiku-4-5-20251001at 1 and 5, each read from the vendor’s pricing page on the day of the run (docs-pricing-snapshot-2026-10-08.json). The rows are this run’s only; the product’s registry,config/models.json, does not carryclaude-haiku-5-5, and each receipt’spricing_snapshot.sourcenames that file,config/models.json, although its prices are this run’s copy. Prices change the estimated cost below and no score. - Two comparison arms are Report 013’s.
claude-sonnet-5-5andclaude-opus-5-5were not run again. Their rows are the receipts Report 013 published, run by run.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/run-record.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json.
What stayed fixed
The inputs are the earlier reports’. The same SKILL.md bytes (skill.content_hash, the same in all of this report’s receipts and Report 013’s for each skill: code-review-and-quality 13d360d7f786, git-workflow-and-versioning 91c8c72654ee, documentation-and-adrs b67a9f07ed10) and the same suites (suite.suite_hash: code-review-and-quality 5d729f885294, git-workflow-and-versioning 4e74150753d0, documentation-and-adrs 6cce54e7d9d0).
The runner is theirs. Driftproof runner 0.10.1 on the claude-cli surface, with the flags their runs used: at most 80 calls and 8.00 dollars of estimated spend per skill run. It puts the SKILL.md text in the prompt for the with-skill arm and gives the baseline arm the task alone, with no tools in either. It draws generations per arm until the spread settles or a maximum is reached, and the judge scores each draw against the case’s rubric on a continuous 0 to 1 scale.
The judge is theirs. claude-opus-5, with the grading template 82586d1e44f8 in every receipt.
The reading. A case’s band is its mean across draws plus or minus the sample standard deviation across draws: a descriptive spread with no coverage probability. A skill clearly helped when the with-skill band and the without-skill band do not overlap and the averages differ by at least the 0.05 effect floor. A case that does not separate is read under spec 035’s rule: when the spreads and draws could not have resolved a shift of the floor’s size, it reads too few answers to tell, and otherwise no clear difference. Neither is evidence that the skill does nothing.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; config.js.
The figures behind each reading: every run’s averages, spreads and answers
Every run, without the skill and with it
| task | model | run | without the skill: average ± spread (answers) | with the skill: average ± spread (answers) | what the skill added | result |
|---|---|---|---|---|---|---|
code-review-and-quality | Claude Haiku 5.5 | run 1 | 0.821 ± 0.051 (4 answers) | 0.891 ± 0.012 (3 answers) | +0.070 | Clearly helped |
code-review-and-quality | Claude Haiku 5.5 | run 2 | 0.813 ± 0.076 (4 answers) | 0.861 ± 0.068 (4 answers) | +0.048 | Too few answers to tell |
code-review-and-quality | Claude Haiku 5.5 | run 3 | 0.823 ± 0.031 (3 answers) | 0.770 ± 0.158 (10 answers) | -0.053 | Too few answers to tell |
code-review-and-quality | Claude Haiku 4.5 | run 1 | 0.339 ± 0.035 (3 answers) | 0.677 ± 0.044 (4 answers) | +0.339 | Clearly helped |
code-review-and-quality | Claude Haiku 4.5 | run 2 | 0.540 ± 0.172 (7 answers) | 0.628 ± 0.112 (6 answers) | +0.088 | Too few answers to tell |
code-review-and-quality | Claude Haiku 4.5 | run 3 | 0.547 ± 0.190 (4 answers) | 0.566 ± 0.111 (4 answers) | +0.019 | Too few answers to tell |
code-review-and-quality | Claude Sonnet 5.5 | run 1 | 0.878 ± 0.027 (3 answers) | 0.887 ± 0.025 (3 answers) | +0.009 | Too few answers to tell |
code-review-and-quality | Claude Sonnet 5.5 | run 2 | 0.849 ± 0.044 (3 answers) | 0.900 ± 0.012 (3 answers) | +0.051 | Too few answers to tell |
code-review-and-quality | Claude Sonnet 5.5 | run 3 | 0.861 ± 0.025 (3 answers) | 0.896 ± 0.002 (3 answers) | +0.034 | Too few answers to tell |
code-review-and-quality | Claude Opus 5.5 | run 1 | 0.831 ± 0.066 (4 answers) | 0.907 ± 0.015 (3 answers) | +0.076 | Too few answers to tell |
code-review-and-quality | Claude Opus 5.5 | run 2 | 0.857 ± 0.027 (3 answers) | 0.894 ± 0.017 (3 answers) | +0.038 | Too few answers to tell |
code-review-and-quality | Claude Opus 5.5 | run 3 | 0.713 ± 0.211 (5 answers) | 0.903 ± 0.015 (3 answers) | +0.190 | Too few answers to tell |
git-workflow-and-versioning | Claude Haiku 5.5 | run 1 | 0.300 ± 0.000 (3 answers) | 0.849 ± 0.008 (3 answers) | +0.549 | Clearly helped |
git-workflow-and-versioning | Claude Haiku 5.5 | run 2 | 0.849 ± 0.012 (3 answers) | 0.839 ± 0.014 (3 answers) | -0.010 | No clear difference |
git-workflow-and-versioning | Claude Haiku 5.5 | run 3 | 0.613 ± 0.293 (7 answers) | 0.848 ± 0.004 (3 answers) | +0.235 | Too few answers to tell |
git-workflow-and-versioning | Claude Haiku 4.5 | run 1 | 0.834 ± 0.016 (3 answers) | 0.832 ± 0.002 (3 answers) | -0.002 | No clear difference |
git-workflow-and-versioning | Claude Haiku 4.5 | run 2 | 0.838 ± 0.015 (3 answers) | 0.828 ± 0.004 (3 answers) | -0.010 | No clear difference |
git-workflow-and-versioning | Claude Haiku 4.5 | run 3 | 0.839 ± 0.014 (3 answers) | 0.813 ± 0.003 (3 answers) | -0.026 | No clear difference |
git-workflow-and-versioning | Claude Sonnet 5.5 | run 1 | 0.860 ± 0.009 (3 answers) | 0.860 ± 0.009 (3 answers) | +0.000 | No clear difference |
git-workflow-and-versioning | Claude Sonnet 5.5 | run 2 | 0.850 ± 0.007 (3 answers) | 0.863 ± 0.000 (3 answers) | +0.013 | No clear difference |
git-workflow-and-versioning | Claude Sonnet 5.5 | run 3 | 0.857 ± 0.009 (3 answers) | 0.863 ± 0.009 (3 answers) | +0.007 | No clear difference |
git-workflow-and-versioning | Claude Opus 5.5 | run 1 | 0.508 ± 0.287 (8 answers) | 0.861 ± 0.005 (3 answers) | +0.353 | Clearly helped |
git-workflow-and-versioning | Claude Opus 5.5 | run 2 | 0.485 ± 0.278 (9 answers) | 0.857 ± 0.000 (3 answers) | +0.371 | Clearly helped |
git-workflow-and-versioning | Claude Opus 5.5 | run 3 | 0.579 ± 0.322 (4 answers) | 0.856 ± 0.010 (3 answers) | +0.276 | Too few answers to tell |
documentation-and-adrs | Claude Haiku 5.5 | run 1 | 0.561 ± 0.042 (3 answers) | 0.597 ± 0.006 (3 answers) | +0.036 | Too few answers to tell |
documentation-and-adrs | Claude Haiku 5.5 | run 2 | 0.589 ± 0.005 (3 answers) | 0.500 ± 0.087 (5 answers) | -0.089 | Too few answers to tell |
documentation-and-adrs | Claude Haiku 5.5 | run 3 | 0.483 ± 0.035 (3 answers) | 0.542 ± 0.065 (5 answers) | +0.059 | Too few answers to tell |
documentation-and-adrs | Claude Haiku 4.5 | run 1 | 0.626 ± 0.044 (3 answers) | 0.763 ± 0.092 (5 answers) | +0.138 | Clearly helped |
documentation-and-adrs | Claude Haiku 4.5 | run 2 | 0.579 ± 0.053 (4 answers) | 0.772 ± 0.063 (5 answers) | +0.193 | Clearly helped |
documentation-and-adrs | Claude Haiku 4.5 | run 3 | 0.605 ± 0.084 (7 answers) | 0.739 ± 0.092 (6 answers) | +0.134 | Too few answers to tell |
documentation-and-adrs | Claude Sonnet 5.5 | run 1 | 0.572 ± 0.025 (3 answers) | 0.781 ± 0.141 (6 answers) | +0.208 | Clearly helped |
documentation-and-adrs | Claude Sonnet 5.5 | run 2 | 0.576 ± 0.025 (3 answers) | 0.813 ± 0.094 (7 answers) | +0.238 | Clearly helped |
documentation-and-adrs | Claude Sonnet 5.5 | run 3 | 0.574 ± 0.036 (3 answers) | 0.847 ± 0.015 (3 answers) | +0.272 | Clearly helped |
documentation-and-adrs | Claude Opus 5.5 | run 1 | 0.534 ± 0.039 (3 answers) | 0.650 ± 0.102 (6 answers) | +0.116 | Too few answers to tell |
documentation-and-adrs | Claude Opus 5.5 | run 2 | 0.550 ± 0.033 (3 answers) | 0.850 ± 0.007 (3 answers) | +0.300 | Clearly helped |
documentation-and-adrs | Claude Opus 5.5 | run 3 | 0.518 ± 0.083 (6 answers) | 0.840 ± 0.020 (3 answers) | +0.322 | Clearly helped |
What the skill added is a model’s average with the skill minus its average without it. The result is the receipt’s own reading of that, as its receipt page shows it. Claude Sonnet 5.5 and Claude Opus 5.5 are Report 013’s receipts, run by run.
Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.
The run record: calls, costs and integrity
Run record
The runs. Each run went arm by arm, one skill at a time, code-review-and-quality first in each. The command file writes a status line after each skill run. The two arms of a run were started separately, claude-haiku-5-5 first and claude-haiku-4-5-20251001 beside it, into the same run directory, so a run’s status lines are the two arms’ together. The runs overlapped in time: the claude-haiku-4-5-20251001 arm of one run ran beside the claude-haiku-5-5 arm of the next. Each receipt’s run.date_utc is written by the runner and is not read here as a start or a finish.
- run 1,
20261007T201714Z: six status lines, each with exit status 0 and one receipt, the last at2026-10-07T21:09:35Z; 160 calls; 0 unmeasured draws. - run 2,
20261007T203747Z: six status lines, each with exit status 0 and one receipt, the last at2026-10-07T21:36:53Z; 200 calls; 0 unmeasured draws. - run 3,
20261007T205604Z: six status lines, each with exit status 0 and one receipt, the last at2026-10-07T22:01:08Z; 232 calls; 0 unmeasured draws.
The caps. A guard in front of Claude Code allowed 480 calls per run and 240 seconds per call, and stops a run when a call reports any model other than the one it asked for; no run stopped.
The cost. Metered spend, as the runner reports it, was 0.00 dollars in each skill run’s console output: the claude-cli surface runs on a subscription. The estimated API-equivalent below is every draw’s generation and judge token counts, as each receipt records them, at the prices each receipt froze, with cached input counted at the full input price, as the runner counts it.
| run | arm | calls | generation, estimated USD | judge, estimated USD | total, estimated USD |
|---|---|---|---|---|---|
| run 1 | claude-haiku-5-5 | 76 | 0.06 | 5.11 | 5.16 |
| run 1 | claude-haiku-4-5-20251001 | 84 | 0.45 | 5.42 | 5.87 |
| run 2 | claude-haiku-5-5 | 88 | 0.07 | 5.96 | 6.03 |
| run 2 | claude-haiku-4-5-20251001 | 112 | 0.63 | 7.54 | 8.16 |
| run 3 | claude-haiku-5-5 | 124 | 0.09 | 8.45 | 8.54 |
| run 3 | claude-haiku-4-5-20251001 | 108 | 0.58 | 7.12 | 7.70 |
| all three runs | 1.87 | 39.60 | 41.47 | ||
Integrity. Each receipt validates with its receipt hash verified, and each sidecar names its receipt’s hash. The raw call records carry the SKILL.md text and stay unpublished; each run’s list of their sha256 is published.
Read from: docs/reports/014/evidence/run-1/run-record.json; docs/reports/014/evidence/run-1/status.jsonl; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/run-record.json; docs/reports/014/evidence/run-2/status.jsonl; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/run-record.json; docs/reports/014/evidence/run-3/status.jsonl; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/guard.py; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/driftproof-calls.SHA256SUMS; docs/reports/014/evidence/run-2/driftproof-calls.SHA256SUMS; docs/reports/014/evidence/run-3/driftproof-calls.SHA256SUMS.
Published evidence
The files this report makes public. For each run, the six receipts with their summaries, surface sidecars and the runner’s console output, the run record, its registry copy, the status lines and the sha256 of every raw call record; the log of the three runs; the pricing snapshot; the release date record; and the call guard. The pricing snapshot records the sha256 of the page it was read from; that page is not published. Claude Sonnet 5.5 and Claude Opus 5.5 are read from Report 013’s evidence, which is published with that report.
docs/reports/014/evidence/docs-pricing-snapshot-2026-10-08.json
sha256a6973f82f458dce2f784ccef13b677c9294423c66be482dd7346542ae768b891docs/reports/014/evidence/guard.py
sha2561afe55847e1e11a988a783ae6dd9dfa0af24df058dbe1fc3423e465f8eeb8ef4docs/reports/014/evidence/release-date.json
sha25615829c0f162165b58b76535cfa22f952f4da772238ba01f61b6a06f25a1cadccdocs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json
sha2567409c0b08102f58df8e9e04498e601bbc8d2456d42ac4eb9f752dc10e635faa9docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha256327eb16cfa0f501ec09633a46bd6247fa388aa4f1053b928c06baf53f122e370docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha256fa0b245ce830b5ba4f65abed3bee03167410601f7872e322a23b55ff66e02249docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha2566d5eba5bddd7878d51eab39d6ad5dd274ff940ac52093bd5519c1fa4c34ecbdedocs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json
sha25617dc654342887aed1d26a27bf22c1a6ca7f32696ff1339e077aab43b737f5f5bdocs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt
sha256dd6ee57b1197a5b2c148f88f88df0c0d03fc09bf096efe60b1117d4d48b93cbbdocs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.summary.md
sha256148c559aed7bc74d73b11727a8ef373ca07e4dd282a0c2269a19d547690e6e78docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json
sha2564f833c704c44b4c4b708013e34211fabad7233981fc485b24ac62ded6252dfd2docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json
sha256f38cffe80c42f5c38d17beab33ffec0357b04b678cd297c8a73094025df9d4a6docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha2560989e8e8623596c0f73f79d02e31229a1e46966615ae2b8029206efeba9dae1edocs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha256e22f925ae199a52ef2542241ffb092ca6935cb1f36af77b8125c31860d9d8fd4docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha25691d1b2c45d1063104a343a2233446eceeb2958586cfb5da4f66e9b5f071f114bdocs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json
sha256624f4514a53a68a5d7c55ef8d6e262db59ed476b3ecc30ef5b0f5c8132917131docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt
sha256b7b7ef164089cd61e658b66e06b0ed1961826ad4aab9637ccdbf4829d7188f32docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.summary.md
sha256a73f272fb51d26e14c5246724856b9e6aabb83319bfec722c9bfd35171d84c57docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json
sha25617b2bf0e5d753287321fc530b3d4d8368014fa95418cf2a4ba24cc807df3e80bdocs/reports/014/evidence/run-1/driftproof-calls.SHA256SUMS
sha2567cc6fec3a1c94de10ebad31bd4b05a2403e54f4d865ef93b862954b55b19ed03docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json
sha256a8b7b5f1eaa7153f7c2308056cd512a521709be79adde2f3500a28e7868759f6docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha2566bd42bae48c2a617e8bb26ecef8be2737f3e533868d793ad612b1aad9a5adee1docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha2565fc938c36594834408eadbeeb70ef1bb8964898616aab92db6b433304b4dc4afdocs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha256a1df7136549b85922cd1fb8efb9e3282268c0725cfb814cf74bf6e94694de1bbdocs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json
sha256192e83c467239cfa603d579366c9518b74783933ac38ed56a7f1f8e7be0a4926docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt
sha2565115150ba880d9084f9b20c3f5961ecb91872c42bbb6f2aeb58da0de2cbf510adocs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.summary.md
sha25646a8e9ff52d67e3d9eebb1523011f316a08fe38f824e7c903eedc778ff19df2edocs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json
sha256d4499e9a01089fb21dc68c04585bea4d27cf0f18f0d63769394e10a0298e8798docs/reports/014/evidence/run-1/registry.json
sha25626e6f9ff9bd1b182987b48c69d6a079c3f13a1d6ca4c21f63ed274c96ddef4c9docs/reports/014/evidence/run-1/run-record.json
sha25626c79da1b7a18cf6782f4a425222f95295450958b771e4892e5ecbc5210537c7docs/reports/014/evidence/run-1/status.jsonl
sha25674a4ae83791d0998ae41670cd24f31a081a11259738bd2255b43510752e273fadocs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json
sha256197ee185344a64f4eefbe81c84f6d3f2cfd25cb1f40d8200594abcaaa3de2a5edocs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha256d96d57640231014b82ac107766d7040c58b247d89b597f6016947f8222eb21e8docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha2563544b5fd3288718f3ee75a43cece10ac3f763283636d87fcab51765d5cf3f05fdocs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha2563b55d471887de8bc5091ff7c63eb3296d9287aa1acf78b2ce7392f8e13f6f8afdocs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json
sha256b0be9dc1a87d175c1c3ae90a2d39ab6ca222371b06ff6b1593b88b95f20b07b8docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt
sha2561af81b8d56ce170b939bb5fd5a222606db0d138b50cec524660fee77757cfbc0docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.summary.md
sha2564adba7180f251320c61c2ad19e1cb280c3be9bcb8164d5aa094a15c2b5d47f6fdocs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json
sha256eda9bca33655adb37aef32dc9a4a4ce538bbdf1cf3c075ff7430cd532038af1cdocs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json
sha25623a2da9f4a5608b88075e611f8f8dd5cd0392dafc29ab3bc13e111513e6e7befdocs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha25691d7201f5a123e32ef24a6957999528bd1ef5c5ea25f962efa8f7ec2e6d48471docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha256c50c194fa48072220176fa584957f5d478a5bf7899988f6db714e6c5fb7bed74docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha256df673686ac363a76c6d9872583084cbd6339af838ab4734312d93dc63e8d5e05docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json
sha25652f94978ca46d0079778b177ca4ee77045644af7e18edb7bfaca8cb3ea7f5280docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt
sha2569d0e219372326a1bed014be15901342cd62700c721cdbdebbb33ce470d2f3fe8docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.summary.md
sha256ddb00e1544002143cd87989597dd9e4d579e44a93484f4b23a257146a255a0fadocs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json
sha2566ed54fd4bbcf6b07313076496a6bc70ca53a15afcdd2fb3b37c6d3cd57452586docs/reports/014/evidence/run-2/driftproof-calls.SHA256SUMS
sha25613501cc74cea72078f65acbe457cbb9bc2e45b1bfe2e98034f8f80681fb62337docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json
sha256c80f0213a59939018e74acecbab3600cedbda108e1e3123263561e549d160295docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha2569482c5995cd293b3e89ba35a63f3ad189dc8540671bd4507df45c725b52eebecdocs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha25693ec8d057a7e7483d456f8f4ffde347a7cde25643c515370ede93ee28536b7d6docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha256c272e4bd61d17e75e8300881ac9c8c5e8af6c4eae19a90f0b0ee972563a643f8docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json
sha256460f50a6dbb609b62fb21cf46438382b9f01cc55e45ce79a3d03e244a015e6ccdocs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt
sha25665af35eb3eb9f0787b8cefc679afc2beb6f08230a4b1c1a2975cd55aae9820c1docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.summary.md
sha256a289b2e3d8cca367d48eb41b44d6d7034f51002017e1587229a63e3a47010080docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json
sha25601dd511100e34f15e2750880003477c1828e643fc1d70965d86d9fb0cf227eb7docs/reports/014/evidence/run-2/registry.json
sha25626e6f9ff9bd1b182987b48c69d6a079c3f13a1d6ca4c21f63ed274c96ddef4c9docs/reports/014/evidence/run-2/run-record.json
sha2569ffbf5b00f2e1a8cd8cb5e2440644a7c3e673b6538891e59e66224e065f4f82cdocs/reports/014/evidence/run-2/status.jsonl
sha256465c50a9aed0c9acb1e351d0f3c079e2b73c20420789dcbcc8bba9ca9f7f70afdocs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json
sha2562f97943876d27abe43248c18eab0d9acdfe5b5aa8da2db416d26107a08ee519edocs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha25658d8c7da93b87e26e217f35fb4a2c57a16d18fc99ad486a5986e24dda7dfd9fcdocs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha25639b8b84f674b7d8b9534b73f616874e1be137a8b75f0cd2d5186b56360f2a560docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha256d534973ec68c817f9876cb636ffe7691c06a6cbfd9c02645c7c610ba5ba2c4c6docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json
sha2566bc26b6843049c6687a0d289e937c233d5d81c0fd95b8374e7328df46d579e94docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt
sha256c2216ce72dabc23d322273269e956f0f23ef962a91d01947155a66c4e16845c1docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.summary.md
sha25600f104f22b214d0a095a20c874ffb3781500724401632bc99dca07942012b016docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json
sha2561ddbf3084806751e5de8f1b087e7512d80d95c6c6fc2088b52ec8aca4681b812docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json
sha256044f0d11596cb1d08361fdc3e6ec37c035fe7c3fade4dd2ba6adeee4e16d032bdocs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha25648c1c78ca007caa75b8fa31ee4e75ea6c154136f609ae1bf724eac2f995d3a4adocs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha256fdda3694edf4c4e71f3c1d424406521671562fd28840376654443edd2c64c7f1docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha2563dc031a154c2d2570937240fc430c2c87e80050dc212f788a68b5f10db66d085docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json
sha256a2bd9689d91c7de05f97ae0c9ad9e4dc77105df7281ca7d493340b91db43b14fdocs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt
sha256eee991cf780c1df506392afb24fcb3b759add62d75c7edfc143a128f99c02331docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.summary.md
sha25618024a789cb36e5bf7faeb601dc8e5fa8eff2752a2e510a0d31731defffc0130docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json
sha256776d3a87232779c8f05871b3dbbf837862d281591645dd5ebb9ad3018cff5d0fdocs/reports/014/evidence/run-3/driftproof-calls.SHA256SUMS
sha256ebd8b9b2329e89098de0994259d90d3eba056d365a463c699efd96d091466114docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json
sha256ccf8b4e46ed8abdf1e0ff689a62220b5e0e99e5cb57f51fe8e9f094a0261d33bdocs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt
sha2567b85daa3b055c228fca2ad595505e31678cd47a2594a212a9542fa8a8c59816adocs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.summary.md
sha2566d67a46f8b36b98d354d18a4b01d5f5e9cd53318b1d429c20993dcd9dc64b78edocs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json
sha2567dfd04928518183d061242edd27886c02df11dc0bdc618d25573cc749f63f194docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json
sha25630a75f51e905bf473ad8f117a0f0a9de745dce51e2454fea2f93e7e90a360043docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt
sha256c63506ab79c4f303340d7ef7d6c531bc6fc5d1f8ed47fe1f8d836da632ee0d70docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.summary.md
sha256c34d53078c4e9d8fb29010428d1e3948e585ecf8b4e689e0adfbd9b471986fd2docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json
sha256f845e2e9339dbffb5ec6b984a466fadd8264808f16c9908b3cd50a3a8a2b570edocs/reports/014/evidence/run-3/registry.json
sha25626e6f9ff9bd1b182987b48c69d6a079c3f13a1d6ca4c21f63ed274c96ddef4c9docs/reports/014/evidence/run-3/run-record.json
sha256a29aa81dfae0ca07f44d2eb380e10437ca7523c60ed5b093341a9acca04f6c24docs/reports/014/evidence/run-3/status.jsonl
sha25686e6a1c39172affc9e8364732ac2f05f571306f09166dca51f15fb6aa85e93cedocs/reports/014/evidence/runs-log.txt
sha2563b4dee8f4daaccf3ef596fea0c8ee7cdf93336ccecc51f5d78935a62050f4776
Validate a receipt with npx driftproof validate <file>. Each copy here is byte-identical to its twin under specs/166-report-014-haiku-5-5/, and each sidecar names the receipt it belongs to and that receipt’s hash.
Receipts
Every receipt this report rests on, each one resolvable. Six for each run, one per model and skill, the same bytes as the evidence copies above.
code-review-and-quality@claude-haiku-5-5(run 1):receipts/report-014/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.jsongit-workflow-and-versioning@claude-haiku-5-5(run 1):receipts/report-014/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.jsondocumentation-and-adrs@claude-haiku-5-5(run 1):receipts/report-014/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.jsoncode-review-and-quality@claude-haiku-4-5-20251001(run 1):receipts/report-014/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.jsongit-workflow-and-versioning@claude-haiku-4-5-20251001(run 1):receipts/report-014/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.jsondocumentation-and-adrs@claude-haiku-4-5-20251001(run 1):receipts/report-014/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.jsoncode-review-and-quality@claude-haiku-5-5(run 2):receipts/report-014/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.jsongit-workflow-and-versioning@claude-haiku-5-5(run 2):receipts/report-014/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.jsondocumentation-and-adrs@claude-haiku-5-5(run 2):receipts/report-014/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.jsoncode-review-and-quality@claude-haiku-4-5-20251001(run 2):receipts/report-014/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.jsongit-workflow-and-versioning@claude-haiku-4-5-20251001(run 2):receipts/report-014/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.jsondocumentation-and-adrs@claude-haiku-4-5-20251001(run 2):receipts/report-014/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.jsoncode-review-and-quality@claude-haiku-5-5(run 3):receipts/report-014/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.jsongit-workflow-and-versioning@claude-haiku-5-5(run 3):receipts/report-014/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.jsondocumentation-and-adrs@claude-haiku-5-5(run 3):receipts/report-014/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.jsoncode-review-and-quality@claude-haiku-4-5-20251001(run 3):receipts/report-014/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.jsongit-workflow-and-versioning@claude-haiku-4-5-20251001(run 3):receipts/report-014/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.jsondocumentation-and-adrs@claude-haiku-4-5-20251001(run 3):receipts/report-014/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json
Validate any of them with npx driftproof validate <file>. The comparison rows are Report 013’s receipts, listed on that report.