Driftproof

Report 014: Claude Haiku 5.5 on release day, three skills

What did Report 014 find?

  • What we tested. Claude Haiku 5.5 came out on 7 Oct. We ran it and Claude Haiku 4.5 on three skills, three times each.
  • What we found. On Claude Haiku 5.5 no skill clearly helped in two or more of three repeats. Documentation clearly helped Claude Haiku 4.5 in two of three; on Haiku 5.5 all three had too few answers to tell, so these runs cannot say whether it still helps. Code review and git workflow did not clearly help either model in two or more repeats.
  • Repeats matter. Four of six model and task pairs changed reading between repeats.
  • What it doesn't show. One task per skill and few answers: nothing about other work, and no model ranking.

Release drift report. It measures a new model on the same skills and tasks as earlier reports, beside the model before it, with Report 013’s Claude Sonnet 5.5 and Claude Opus 5.5 receipts as context.

Which skills help Claude Haiku 5.5?

Claude Haiku 5.5 on the three skills and cases of Reports 009, 011 and 013, beside Claude Haiku 4.5, each run three times. On Claude Haiku 5.5 no skill clearly helped in two or more of the three runs. Helped Claude Haiku 4.5; on Claude Haiku 5.5 these runs had too few answers to tell. documentation-and-adrs: clearly helped Claude Haiku 4.5 in two of three runs (one had too few answers to tell), and Claude Haiku 5.5 in zero of three runs (three had too few answers to tell). Did not clearly help either model in two or more of the three runs. code-review-and-quality: clearly helped Claude Haiku 4.5 in one of three runs (two had too few answers to tell), and Claude Haiku 5.5 in one of three runs (two had too few answers to tell). git-workflow-and-versioning: clearly helped Claude Haiku 4.5 in zero of three runs (three showed no clear difference), and Claude Haiku 5.5 in one of three runs (one showed no clear difference, one had too few answers to tell).

A skill counts as helping a model here when it clearly helped it in at least two of the three runs. Every figure below is read from a receipt or a file published beside it, and each block names its files. This report measures what a skill adds to each model on these cases. It makes no claim about any model’s coding ability.

Read from: docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json.

taskmodelrun 1run 2run 3clearly helped
code reviewClaude Haiku 5.5Clearly helpedToo few answers to tellToo few answers to tellone of three
code reviewClaude Haiku 4.5Clearly helpedToo few answers to tellToo few answers to tellone of three
code reviewClaude Sonnet 5.5 (Report 013)Too few answers to tellToo few answers to tellToo few answers to tellzero of three
code reviewClaude Opus 5.5 (Report 013)Too few answers to tellToo few answers to tellToo few answers to tellzero of three
git workflowClaude Haiku 5.5Clearly helpedNo clear differenceToo few answers to tellone of three
git workflowClaude Haiku 4.5No clear differenceNo clear differenceNo clear differencezero of three
git workflowClaude Sonnet 5.5 (Report 013)No clear differenceNo clear differenceNo clear differencezero of three
git workflowClaude Opus 5.5 (Report 013)Clearly helpedClearly helpedToo few answers to telltwo of three
documentationClaude Haiku 5.5Too few answers to tellToo few answers to tellToo few answers to tellzero of three
documentationClaude Haiku 4.5Clearly helpedClearly helpedToo few answers to telltwo of three
documentationClaude Sonnet 5.5 (Report 013)Clearly helpedClearly helpedClearly helpedthree of three
documentationClaude Opus 5.5 (Report 013)Too few answers to tellClearly helpedClearly helpedtwo of three

Clearly helped: in that run the spread of the model’s scores with the skill did not overlap its spread without it, and the averages were at least 0.05 apart.

No clear difference: there were enough answers to see a gap of 0.05, and the spreads overlapped or the gap was smaller.

Too few answers to tell: the scores were too spread out, or too few, to see a gap of 0.05 either way. It does not mean the skill did nothing.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; config.js.

What did each model score, without the skill and with it?

Code review: each model’s average score in each run, without the skill and with itCode reviewClaude Haiku 5.5Claude Haiku 4.5Claude Sonnet 5.5Claude Opus 5.5
Git workflow: each model’s average score in each run, without the skill and with itGit workflowClaude Haiku 5.5Claude Haiku 4.5Claude Sonnet 5.5Claude Opus 5.5
Documentation: each model’s average score in each run, without the skill and with itDocumentationClaude Haiku 5.5Claude Haiku 4.5Claude Sonnet 5.5Claude Opus 5.5

Under each model’s name, one row per run, runs one to three from the top. The hollow dot is a model’s average score without the skill, the filled dot its average with the skill, and the line between them is what the skill added. Each panel spans scores from zero at the left edge to one at the right. The two Claude Haiku rows were run for this report; the Claude Sonnet 5.5 and Claude Opus 5.5 rows are Report 013’s.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.

What do the runs show?

Which skills still help Claude Haiku 5.5?

Still help: none. Stopped helping, as far as these runs can tell: none. Helped Claude Haiku 4.5, too few answers to tell on Claude Haiku 5.5: documentation-and-adrs. Started helping: none. Did not clearly help either model in two or more of the three runs: code-review-and-quality, git-workflow-and-versioning.

A result that had too few answers to tell does not show that a skill stopped working. The two Claude Haiku arms also differ in more than the model: Claude Code applied its per-turn effort to every call of Claude Haiku 5.5 and to no call of Claude Haiku 4.5.

code-review-and-quality: Claude Haiku 5.5 averaged 0.821, 0.813 and 0.823 without the skill and 0.891, 0.861 and 0.770 with it, so the skill added +0.070, +0.048 and -0.053 across the three runs. Claude Haiku 4.5 averaged 0.339, 0.540 and 0.547 without it and 0.677, 0.628 and 0.566 with it, an addition of +0.339, +0.088 and +0.019.

git-workflow-and-versioning: Claude Haiku 5.5 averaged 0.300, 0.849 and 0.613 without the skill and 0.849, 0.839 and 0.848 with it, so the skill added +0.549, -0.010 and +0.235 across the three runs. Claude Haiku 4.5 averaged 0.834, 0.838 and 0.839 without it and 0.832, 0.828 and 0.813 with it, an addition of -0.002, -0.010 and -0.026.

documentation-and-adrs: Claude Haiku 5.5 averaged 0.561, 0.589 and 0.483 without the skill and 0.597, 0.500 and 0.542 with it, so the skill added +0.036, -0.089 and +0.059 across the three runs. Claude Haiku 4.5 averaged 0.626, 0.579 and 0.605 without it and 0.763, 0.772 and 0.739 with it, an addition of +0.138, +0.193 and +0.134.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json.

How often did the skills clearly help each model?

Out of nine results for each model (three tasks, three runs), the skills clearly helped Claude Haiku 5.5 in two of nine, Claude Haiku 4.5 in three of nine, Claude Sonnet 5.5 in three of nine and Claude Opus 5.5 in four of nine. Claude Sonnet 5.5 and Claude Opus 5.5 are Report 013’s receipts, not run again, and these counts set the four models side by side without ranking them.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.

Why run every test three times?

Repeat runs of the same test did not always agree: six of the twelve model and task pairs changed reading between runs. Most of those changes were between clearly helped and too few answers to tell; only one pair, git workflow on Claude Haiku 5.5, read two answers that conflict, clearly helped in one run and no clear difference in another.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.

What are the limits, and what differs from Reports 009, 011 and 013?

What does this report not show?

Each skill was tested on one task only. Nothing here says how these skills do on other tasks, or how these models do at coding in general.

Each arm drew between 3 and 10 answers in a run, and the grader scored every answer three times. That is few answers. Where a result had too few answers to tell, the scores were too spread out, or too few, to see a gap of 0.05.

Every answer was scored by claude-opus-5 as the grader, as in Reports 009, 011 and 013. Our other reports use a different grader, set by the judge policy, so compare these scores with Reports 009, 011 and 013 only.

A result reads one model’s receipt: what the skill added to the model that answered, in that run. The page counts how many runs clearly helped each model and sets the counts side by side; it does not test whether one model’s lift differs from another’s.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; config.js.

What differs from the earlier reports?

Claude Haiku 5.5 came out on 7 Oct 2026, as the vendor’s release notes date it (the record, release-date.json, is published beside this page). The first run began on 7 Oct 2026 at 20:17 UTC.

The model before it is Claude Haiku 4.5. Claude Sonnet 5.5 and Claude Opus 5.5 are Report 013’s receipts, not run again: they ran on the same Claude Code, 2.1.284, on 29 Sep 2026.

Every test ran three times. No model was given an effort or thinking setting. Claude Code applied its own per-turn effort in every call of Claude Haiku 5.5 and no call of Claude Haiku 4.5.

Prices come from the vendor’s pricing page as saved on the day of the run: 0.1 and 0.5 dollars per million input and output tokens for Claude Haiku 5.5 (the vendor’s first rate, for the shorter prompts every call here used), and 1 and 5 for Claude Haiku 4.5. Prices change the estimated cost only, never a score.

A safety limit allowed up to 480 model calls per run directory. It was set for up to twelve skill runs, in case the comparison models were run again; each run made six.

Read from: docs/reports/014/evidence/release-date.json; docs/reports/014/evidence/run-1/run-record.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/014/evidence/guard.py.

Evidence and files

How the runs were set up, in full: departures and what stayed fixed

What departs from Report 013

  • The same Claude Code. Every call of the two Claude Haiku arms ran on Claude Code 2.1.284, the version Report 013 pinned, installed at the npm integrity the run record states. Each receipt has a sidecar, <receipt>.surface.json, bound to it by its receipt_hash and recording the version each of its calls reported.
  • The prices are this run’s own. The runner’s registry had no row for claude-haiku-5-5. This run used a copy of it with that row added at 0.1 and 0.5 dollars per million input and output tokens, and claude-haiku-4-5-20251001 at 1 and 5, each read from the vendor’s pricing page on the day of the run (docs-pricing-snapshot-2026-10-08.json). The rows are this run’s only; the product’s registry, config/models.json, does not carry claude-haiku-5-5, and each receipt’s pricing_snapshot.source names that file, config/models.json, although its prices are this run’s copy. Prices change the estimated cost below and no score.
  • Two comparison arms are Report 013’s. claude-sonnet-5-5 and claude-opus-5-5 were not run again. Their rows are the receipts Report 013 published, run by run.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.surface.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.surface.json; docs/reports/014/evidence/run-1/run-record.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json.

What stayed fixed

The inputs are the earlier reports’. The same SKILL.md bytes (skill.content_hash, the same in all of this report’s receipts and Report 013’s for each skill: code-review-and-quality 13d360d7f786, git-workflow-and-versioning 91c8c72654ee, documentation-and-adrs b67a9f07ed10) and the same suites (suite.suite_hash: code-review-and-quality 5d729f885294, git-workflow-and-versioning 4e74150753d0, documentation-and-adrs 6cce54e7d9d0).

The runner is theirs. Driftproof runner 0.10.1 on the claude-cli surface, with the flags their runs used: at most 80 calls and 8.00 dollars of estimated spend per skill run. It puts the SKILL.md text in the prompt for the with-skill arm and gives the baseline arm the task alone, with no tools in either. It draws generations per arm until the spread settles or a maximum is reached, and the judge scores each draw against the case’s rubric on a continuous 0 to 1 scale.

The judge is theirs. claude-opus-5, with the grading template 82586d1e44f8 in every receipt.

The reading. A case’s band is its mean across draws plus or minus the sample standard deviation across draws: a descriptive spread with no coverage probability. A skill clearly helped when the with-skill band and the without-skill band do not overlap and the averages differ by at least the 0.05 effect floor. A case that does not separate is read under spec 035’s rule: when the spreads and draws could not have resolved a shift of the floor’s size, it reads too few answers to tell, and otherwise no clear difference. Neither is evidence that the skill does nothing.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; config.js.

The figures behind each reading: every run’s averages, spreads and answers

Every run, without the skill and with it

taskmodelrunwithout the skill: average ± spread (answers)with the skill: average ± spread (answers)what the skill addedresult
code-review-and-qualityClaude Haiku 5.5run 10.821 ± 0.051 (4 answers)0.891 ± 0.012 (3 answers)+0.070Clearly helped
code-review-and-qualityClaude Haiku 5.5run 20.813 ± 0.076 (4 answers)0.861 ± 0.068 (4 answers)+0.048Too few answers to tell
code-review-and-qualityClaude Haiku 5.5run 30.823 ± 0.031 (3 answers)0.770 ± 0.158 (10 answers)-0.053Too few answers to tell
code-review-and-qualityClaude Haiku 4.5run 10.339 ± 0.035 (3 answers)0.677 ± 0.044 (4 answers)+0.339Clearly helped
code-review-and-qualityClaude Haiku 4.5run 20.540 ± 0.172 (7 answers)0.628 ± 0.112 (6 answers)+0.088Too few answers to tell
code-review-and-qualityClaude Haiku 4.5run 30.547 ± 0.190 (4 answers)0.566 ± 0.111 (4 answers)+0.019Too few answers to tell
code-review-and-qualityClaude Sonnet 5.5run 10.878 ± 0.027 (3 answers)0.887 ± 0.025 (3 answers)+0.009Too few answers to tell
code-review-and-qualityClaude Sonnet 5.5run 20.849 ± 0.044 (3 answers)0.900 ± 0.012 (3 answers)+0.051Too few answers to tell
code-review-and-qualityClaude Sonnet 5.5run 30.861 ± 0.025 (3 answers)0.896 ± 0.002 (3 answers)+0.034Too few answers to tell
code-review-and-qualityClaude Opus 5.5run 10.831 ± 0.066 (4 answers)0.907 ± 0.015 (3 answers)+0.076Too few answers to tell
code-review-and-qualityClaude Opus 5.5run 20.857 ± 0.027 (3 answers)0.894 ± 0.017 (3 answers)+0.038Too few answers to tell
code-review-and-qualityClaude Opus 5.5run 30.713 ± 0.211 (5 answers)0.903 ± 0.015 (3 answers)+0.190Too few answers to tell
git-workflow-and-versioningClaude Haiku 5.5run 10.300 ± 0.000 (3 answers)0.849 ± 0.008 (3 answers)+0.549Clearly helped
git-workflow-and-versioningClaude Haiku 5.5run 20.849 ± 0.012 (3 answers)0.839 ± 0.014 (3 answers)-0.010No clear difference
git-workflow-and-versioningClaude Haiku 5.5run 30.613 ± 0.293 (7 answers)0.848 ± 0.004 (3 answers)+0.235Too few answers to tell
git-workflow-and-versioningClaude Haiku 4.5run 10.834 ± 0.016 (3 answers)0.832 ± 0.002 (3 answers)-0.002No clear difference
git-workflow-and-versioningClaude Haiku 4.5run 20.838 ± 0.015 (3 answers)0.828 ± 0.004 (3 answers)-0.010No clear difference
git-workflow-and-versioningClaude Haiku 4.5run 30.839 ± 0.014 (3 answers)0.813 ± 0.003 (3 answers)-0.026No clear difference
git-workflow-and-versioningClaude Sonnet 5.5run 10.860 ± 0.009 (3 answers)0.860 ± 0.009 (3 answers)+0.000No clear difference
git-workflow-and-versioningClaude Sonnet 5.5run 20.850 ± 0.007 (3 answers)0.863 ± 0.000 (3 answers)+0.013No clear difference
git-workflow-and-versioningClaude Sonnet 5.5run 30.857 ± 0.009 (3 answers)0.863 ± 0.009 (3 answers)+0.007No clear difference
git-workflow-and-versioningClaude Opus 5.5run 10.508 ± 0.287 (8 answers)0.861 ± 0.005 (3 answers)+0.353Clearly helped
git-workflow-and-versioningClaude Opus 5.5run 20.485 ± 0.278 (9 answers)0.857 ± 0.000 (3 answers)+0.371Clearly helped
git-workflow-and-versioningClaude Opus 5.5run 30.579 ± 0.322 (4 answers)0.856 ± 0.010 (3 answers)+0.276Too few answers to tell
documentation-and-adrsClaude Haiku 5.5run 10.561 ± 0.042 (3 answers)0.597 ± 0.006 (3 answers)+0.036Too few answers to tell
documentation-and-adrsClaude Haiku 5.5run 20.589 ± 0.005 (3 answers)0.500 ± 0.087 (5 answers)-0.089Too few answers to tell
documentation-and-adrsClaude Haiku 5.5run 30.483 ± 0.035 (3 answers)0.542 ± 0.065 (5 answers)+0.059Too few answers to tell
documentation-and-adrsClaude Haiku 4.5run 10.626 ± 0.044 (3 answers)0.763 ± 0.092 (5 answers)+0.138Clearly helped
documentation-and-adrsClaude Haiku 4.5run 20.579 ± 0.053 (4 answers)0.772 ± 0.063 (5 answers)+0.193Clearly helped
documentation-and-adrsClaude Haiku 4.5run 30.605 ± 0.084 (7 answers)0.739 ± 0.092 (6 answers)+0.134Too few answers to tell
documentation-and-adrsClaude Sonnet 5.5run 10.572 ± 0.025 (3 answers)0.781 ± 0.141 (6 answers)+0.208Clearly helped
documentation-and-adrsClaude Sonnet 5.5run 20.576 ± 0.025 (3 answers)0.813 ± 0.094 (7 answers)+0.238Clearly helped
documentation-and-adrsClaude Sonnet 5.5run 30.574 ± 0.036 (3 answers)0.847 ± 0.015 (3 answers)+0.272Clearly helped
documentation-and-adrsClaude Opus 5.5run 10.534 ± 0.039 (3 answers)0.650 ± 0.102 (6 answers)+0.116Too few answers to tell
documentation-and-adrsClaude Opus 5.5run 20.550 ± 0.033 (3 answers)0.850 ± 0.007 (3 answers)+0.300Clearly helped
documentation-and-adrsClaude Opus 5.5run 30.518 ± 0.083 (6 answers)0.840 ± 0.020 (3 answers)+0.322Clearly helped

What the skill added is a model’s average with the skill minus its average without it. The result is the receipt’s own reading of that, as its receipt page shows it. Claude Sonnet 5.5 and Claude Opus 5.5 are Report 013’s receipts, run by run.

Read from: docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json.

The run record: calls, costs and integrity

Run record

The runs. Each run went arm by arm, one skill at a time, code-review-and-quality first in each. The command file writes a status line after each skill run. The two arms of a run were started separately, claude-haiku-5-5 first and claude-haiku-4-5-20251001 beside it, into the same run directory, so a run’s status lines are the two arms’ together. The runs overlapped in time: the claude-haiku-4-5-20251001 arm of one run ran beside the claude-haiku-5-5 arm of the next. Each receipt’s run.date_utc is written by the runner and is not read here as a start or a finish.

  • run 1, 20261007T201714Z: six status lines, each with exit status 0 and one receipt, the last at 2026-10-07T21:09:35Z; 160 calls; 0 unmeasured draws.
  • run 2, 20261007T203747Z: six status lines, each with exit status 0 and one receipt, the last at 2026-10-07T21:36:53Z; 200 calls; 0 unmeasured draws.
  • run 3, 20261007T205604Z: six status lines, each with exit status 0 and one receipt, the last at 2026-10-07T22:01:08Z; 232 calls; 0 unmeasured draws.

The caps. A guard in front of Claude Code allowed 480 calls per run and 240 seconds per call, and stops a run when a call reports any model other than the one it asked for; no run stopped.

The cost. Metered spend, as the runner reports it, was 0.00 dollars in each skill run’s console output: the claude-cli surface runs on a subscription. The estimated API-equivalent below is every draw’s generation and judge token counts, as each receipt records them, at the prices each receipt froze, with cached input counted at the full input price, as the runner counts it.

runarmcallsgeneration, estimated USDjudge, estimated USDtotal, estimated USD
run 1claude-haiku-5-5760.065.115.16
run 1claude-haiku-4-5-20251001840.455.425.87
run 2claude-haiku-5-5880.075.966.03
run 2claude-haiku-4-5-202510011120.637.548.16
run 3claude-haiku-5-51240.098.458.54
run 3claude-haiku-4-5-202510011080.587.127.70
all three runs1.8739.6041.47

Integrity. Each receipt validates with its receipt hash verified, and each sidecar names its receipt’s hash. The raw call records carry the SKILL.md text and stay unpublished; each run’s list of their sha256 is published.

Read from: docs/reports/014/evidence/run-1/run-record.json; docs/reports/014/evidence/run-1/status.jsonl; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/run-record.json; docs/reports/014/evidence/run-2/status.jsonl; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/run-record.json; docs/reports/014/evidence/run-3/status.jsonl; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.json; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.json; docs/reports/014/evidence/guard.py; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-2/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-5-5-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/code-review-and-quality-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/git-workflow-and-versioning-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-3/documentation-and-adrs-claude-haiku-4-5-20251001-2026-10-07.stdout.txt; docs/reports/014/evidence/run-1/driftproof-calls.SHA256SUMS; docs/reports/014/evidence/run-2/driftproof-calls.SHA256SUMS; docs/reports/014/evidence/run-3/driftproof-calls.SHA256SUMS.

Published evidence

The files this report makes public. For each run, the six receipts with their summaries, surface sidecars and the runner’s console output, the run record, its registry copy, the status lines and the sha256 of every raw call record; the log of the three runs; the pricing snapshot; the release date record; and the call guard. The pricing snapshot records the sha256 of the page it was read from; that page is not published. Claude Sonnet 5.5 and Claude Opus 5.5 are read from Report 013’s evidence, which is published with that report.

Validate a receipt with npx driftproof validate <file>. Each copy here is byte-identical to its twin under specs/166-report-014-haiku-5-5/, and each sidecar names the receipt it belongs to and that receipt’s hash.

Receipts

Every receipt this report rests on, each one resolvable. Six for each run, one per model and skill, the same bytes as the evidence copies above.

Validate any of them with npx driftproof validate <file>. The comparison rows are Report 013’s receipts, listed on that report.