Driftproof

Report 013: Claude Sonnet 5.5 on release day, three skills, three runs

Release drift report. The first table is the type’s question: the model moves under the skill and the harness stays fixed. The second sets two current models side by side on the same harness, and the third holds the model and moves the harness; the type describes neither, and the limits say how each is read.

Claude Sonnet 5.5 on the three skills and cases of Reports 009 and 011, beside fresh Claude Sonnet 5 and Claude Opus 5.5 arms on one Claude Code version, each arm run three times. Read by the runner’s own comparison of the with-skill arms, run by run: against Claude Sonnet 5, documentation-and-adrs reads separation upward in two of three runs, and code-review-and-quality and git-workflow-and-versioning read separation in zero of six; against Claude Opus 5.5, the three skills read separation in zero of nine.

Every figure below is read from a receipt or a file published beside it, and each block names its files. The target model of the new arm is claude-sonnet-5-5, and every draw of every arm was judged by claude-opus-5. This report measures what a skill adds to each model on these cases. It makes no claim about any model’s coding ability.

Read from: docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--documentation-and-adrs.md; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--documentation-and-adrs.md; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--documentation-and-adrs.md; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--code-review-and-quality.md; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--code-review-and-quality.md; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--code-review-and-quality.md; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--git-workflow-and-versioning.md; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--code-review-and-quality.md; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--code-review-and-quality.md; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--code-review-and-quality.md; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--git-workflow-and-versioning.md; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--documentation-and-adrs.md; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--documentation-and-adrs.md; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--documentation-and-adrs.md.

Limits, read these first

Read from: docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/011/evidence/code-review-and-quality-claude-opus-5-5-2026-09-23.json.

What departs from Reports 009 and 011

Read from: docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.surface.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.surface.json; docs/reports/011/evidence/run-20260923T062806Z--run-record.json; docs/reports/011/evidence/code-review-and-quality-claude-opus-5-5-2026-09-23.surface.json; docs/reports/013/evidence/run-1/run-record.json; docs/reports/013/evidence/docs-pricing-snapshot-2026-09-29.json; config/models.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/guard.py; docs/reports/011/evidence/guard.py; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.stdout.txt.

What stayed fixed

The inputs are Reports 009 and 011’s. The same SKILL.md bytes (skill.content_hash, the same in all of this report’s receipts and Report 011’s for each skill: code-review-and-quality 13d360d7f786, git-workflow-and-versioning 91c8c72654ee, documentation-and-adrs b67a9f07ed10) and the same suites (suite.suite_hash: code-review-and-quality 5d729f885294, git-workflow-and-versioning 4e74150753d0, documentation-and-adrs 6cce54e7d9d0).

The runner is theirs. Driftproof runner 0.10.1 on the claude-cli surface, with the flags their runs used: at most 80 calls and 8.00 dollars of estimated spend per skill run. It puts the SKILL.md text in the prompt for the with-skill arm and gives the baseline arm the task alone, with no tools in either. It draws generations per arm until the spread settles or a maximum is reached, and the judge scores each draw against the case’s rubric on a continuous 0 to 1 scale.

The judge is theirs. claude-opus-5, with the grading template 82586d1e44f8 in every receipt.

The rule. A case’s band is its mean across draws plus or minus the sample standard deviation across draws: a descriptive spread with no coverage probability. Two with-skill bands separate under the rule when they do not overlap and their means differ by at least the 0.05 effect floor. A case that does not separate is read under spec 035’s rule: when the two arms’ spreads and draws could not have resolved a shift of the floor’s size, it reads not enough draws to conclude at this effect floor, and otherwise no separation detected. Neither is evidence that nothing differs. The verdicts are the runner’s: driftproof diff over each pair, whose outputs are published below.

Read from: docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/011/evidence/code-review-and-quality-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/011/evidence/git-workflow-and-versioning-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/011/evidence/documentation-and-adrs-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.stdout.txt; config.js.

Did the skills survive the upgrade? Claude Sonnet 5 against Claude Sonnet 5.5

skillrunClaude Sonnet 5, with skill, mean ± sd across drawsClaude Sonnet 5.5, with skill, mean ± sd across drawswith-skill deltaunder the rulelift (Claude Sonnet 5; Claude Sonnet 5.5), context
code-review-and-qualityrun 10.880 ± 0.006 (3 draws)0.887 ± 0.025 (3 draws)+0.007no separation detected; not enough draws to conclude at this effect floor+0.302; +0.009
code-review-and-qualityrun 20.881 ± 0.005 (3 draws)0.900 ± 0.012 (3 draws)+0.019no separation detected+0.207; +0.051
code-review-and-qualityrun 30.657 ± 0.257 (4 draws)0.896 ± 0.002 (3 draws)+0.238no separation detected; not enough draws to conclude at this effect floor+0.085; +0.034
code-review-and-qualitythe three runs0.657 to 0.8810.887 to 0.900no separation detected in one of three; no separation detected; not enough draws to conclude at this effect floor in two of three+0.085 to +0.302; +0.009 to +0.051
git-workflow-and-versioningrun 10.814 ± 0.028 (3 draws)0.860 ± 0.009 (3 draws)+0.046no separation detected; not enough draws to conclude at this effect floor+0.012; +0.000
git-workflow-and-versioningrun 20.851 ± 0.002 (3 draws)0.863 ± 0.000 (3 draws)+0.012no separation detected+0.020; +0.013
git-workflow-and-versioningrun 30.831 ± 0.010 (3 draws)0.863 ± 0.009 (3 draws)+0.032no separation detected-0.004; +0.007
git-workflow-and-versioningthe three runs0.814 to 0.8510.860 to 0.863no separation detected in two of three; no separation detected; not enough draws to conclude at this effect floor in one of three-0.004 to +0.020; +0.000 to +0.013
documentation-and-adrsrun 10.602 ± 0.004 (3 draws)0.781 ± 0.141 (6 draws)+0.178separation detected, upward-0.059; +0.208
documentation-and-adrsrun 20.700 ± 0.098 (5 draws)0.813 ± 0.094 (7 draws)+0.113no separation detected; not enough draws to conclude at this effect floor-0.006; +0.238
documentation-and-adrsrun 30.641 ± 0.167 (5 draws)0.847 ± 0.015 (3 draws)+0.205separation detected, upward-0.085; +0.272
documentation-and-adrsthe three runs0.602 to 0.7000.781 to 0.847separation detected, upward in two of three; no separation detected; not enough draws to conclude at this effect floor in one of three-0.085 to -0.006; +0.208 to +0.272

The with-skill delta is the second with-skill mean minus the first, in the same run. The rule column is the runner’s comparison of the two with-skill bands; the delta and the lifts are context, and no verdict is read from them. A lift is a receipt’s with-skill mean minus its baseline mean. The row for the three runs gives the lowest and highest with-skill mean and lift across the runs, and counts the runner’s readings.

Read from: docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--code-review-and-quality.md; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--code-review-and-quality.md; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--code-review-and-quality.md; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--git-workflow-and-versioning.md; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--documentation-and-adrs.md; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--documentation-and-adrs.md; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--documentation-and-adrs.md.

Do the skills help Claude Sonnet 5.5 as much as Claude Opus 5.5?

skillrunClaude Opus 5.5, with skill, mean ± sd across drawsClaude Sonnet 5.5, with skill, mean ± sd across drawswith-skill deltaunder the rulelift (Claude Opus 5.5; Claude Sonnet 5.5), context
code-review-and-qualityrun 10.907 ± 0.015 (3 draws)0.887 ± 0.025 (3 draws)-0.020no separation detected; not enough draws to conclude at this effect floor+0.076; +0.009
code-review-and-qualityrun 20.894 ± 0.017 (3 draws)0.900 ± 0.012 (3 draws)+0.006no separation detected; not enough draws to conclude at this effect floor+0.038; +0.051
code-review-and-qualityrun 30.903 ± 0.015 (3 draws)0.896 ± 0.002 (3 draws)-0.008no separation detected+0.190; +0.034
code-review-and-qualitythe three runs0.894 to 0.9070.887 to 0.900no separation detected in one of three; no separation detected; not enough draws to conclude at this effect floor in two of three+0.038 to +0.190; +0.009 to +0.051
git-workflow-and-versioningrun 10.861 ± 0.005 (3 draws)0.860 ± 0.009 (3 draws)-0.001no separation detected+0.353; +0.000
git-workflow-and-versioningrun 20.857 ± 0.000 (3 draws)0.863 ± 0.000 (3 draws)+0.007no separation detected+0.371; +0.013
git-workflow-and-versioningrun 30.856 ± 0.010 (3 draws)0.863 ± 0.009 (3 draws)+0.008no separation detected+0.276; +0.007
git-workflow-and-versioningthe three runs0.856 to 0.8610.860 to 0.863no separation detected in three of three+0.276 to +0.371; +0.000 to +0.013
documentation-and-adrsrun 10.650 ± 0.102 (6 draws)0.781 ± 0.141 (6 draws)+0.131no separation detected; not enough draws to conclude at this effect floor+0.116; +0.208
documentation-and-adrsrun 20.850 ± 0.007 (3 draws)0.813 ± 0.094 (7 draws)-0.037no separation detected; not enough draws to conclude at this effect floor+0.300; +0.238
documentation-and-adrsrun 30.840 ± 0.020 (3 draws)0.847 ± 0.015 (3 draws)+0.007no separation detected; not enough draws to conclude at this effect floor+0.322; +0.272
documentation-and-adrsthe three runs0.650 to 0.8500.781 to 0.847no separation detected; not enough draws to conclude at this effect floor in three of three+0.116 to +0.322; +0.208 to +0.272

The same columns, with Claude Opus 5.5 first. The question is about lift, and the runner does not compare lifts: the lift column answers it as context, and the rule column reads only the with-skill bands. The vendor’s list prices for the two models are in the section on departures. No vendor statement about these two models is committed with this report, so none is quoted, and nothing on this page tests one.

Read from: docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--code-review-and-quality.md; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--code-review-and-quality.md; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--code-review-and-quality.md; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--git-workflow-and-versioning.md; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--documentation-and-adrs.md; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--documentation-and-adrs.md; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--documentation-and-adrs.md.

The harness check: Claude Opus 5.5 in Report 011 against Claude Opus 5.5 in this report

skillrunReport 011, with skill, mean ± sd across drawsthis report, with skill, mean ± sd across drawswith-skill deltaunder the rulelift (Report 011; this report), context
code-review-and-qualityrun 10.910 ± 0.015 (3 draws)0.907 ± 0.015 (3 draws)-0.003no separation detected; not enough draws to conclude at this effect floor+0.230; +0.076
code-review-and-qualityrun 20.910 ± 0.015 (3 draws)0.894 ± 0.017 (3 draws)-0.016no separation detected; not enough draws to conclude at this effect floor+0.230; +0.038
code-review-and-qualityrun 30.910 ± 0.015 (3 draws)0.903 ± 0.015 (3 draws)-0.007no separation detected; not enough draws to conclude at this effect floor+0.230; +0.190
code-review-and-qualitythe three runs0.910 (one run)0.894 to 0.907no separation detected; not enough draws to conclude at this effect floor in three of three+0.230; +0.038 to +0.190
git-workflow-and-versioningrun 10.838 ± 0.027 (3 draws)0.861 ± 0.005 (3 draws)+0.023no separation detected; not enough draws to conclude at this effect floor+0.538; +0.353
git-workflow-and-versioningrun 20.838 ± 0.027 (3 draws)0.857 ± 0.000 (3 draws)+0.019no separation detected; not enough draws to conclude at this effect floor+0.538; +0.371
git-workflow-and-versioningrun 30.838 ± 0.027 (3 draws)0.856 ± 0.010 (3 draws)+0.018no separation detected; not enough draws to conclude at this effect floor+0.538; +0.276
git-workflow-and-versioningthe three runs0.838 (one run)0.856 to 0.861no separation detected; not enough draws to conclude at this effect floor in three of three+0.538; +0.276 to +0.371
documentation-and-adrsrun 10.661 ± 0.148 (6 draws)0.650 ± 0.102 (6 draws)-0.011no separation detected; not enough draws to conclude at this effect floor+0.094; +0.116
documentation-and-adrsrun 20.661 ± 0.148 (6 draws)0.850 ± 0.007 (3 draws)+0.189separation detected, upward+0.094; +0.300
documentation-and-adrsrun 30.661 ± 0.148 (6 draws)0.840 ± 0.020 (3 draws)+0.179separation detected, upward+0.094; +0.322
documentation-and-adrsthe three runs0.661 (one run)0.650 to 0.850separation detected, upward in two of three; no separation detected; not enough draws to conclude at this effect floor in one of three+0.094; +0.116 to +0.322

The same columns, with Report 011’s receipt first. Report 011 ran once, so its side of each row is the same receipt in all three runs. Report 011’s receipts are published with that report and linked here, not copied.

Read from: docs/reports/011/evidence/code-review-and-quality-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-1--code-review-and-quality.md; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-2--code-review-and-quality.md; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-3--code-review-and-quality.md; docs/reports/011/evidence/git-workflow-and-versioning-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-3--git-workflow-and-versioning.md; docs/reports/011/evidence/documentation-and-adrs-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-1--documentation-and-adrs.md; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-2--documentation-and-adrs.md; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--harness--run-3--documentation-and-adrs.md.

Four readings

1. With the skill, Claude Sonnet 5.5 separates upward from Claude Sonnet 5 on documentation-and-adrs in two of three runs, and downward in zero of nine readings. On code-review-and-quality and git-workflow-and-versioning it detects separation in zero of six readings, and in three of those six readings the draws could not have told. What the skill adds is another matter: on code-review-and-quality Claude Sonnet 5’s lift is +0.302, +0.207, +0.085 across the runs and Claude Sonnet 5.5’s +0.009, +0.051, +0.034, because Claude Sonnet 5.5 without the skill already reads 0.878, 0.849, 0.861, against Claude Sonnet 5’s 0.578, 0.674, 0.573. So on these cases the rule reads no downward separation in the upgrade, on any skill in any run, and on code-review-and-quality Claude Sonnet 5.5’s lift is the smaller in every run, from a higher score without it. The runner’s comparison of two receipts reads no lift, so that second part is context, not a verdict.

2. With the skill, the rule separates Claude Sonnet 5.5 from Claude Opus 5.5 in zero of nine readings; the lifts differ where the baselines do. Of the nine readings, five are not enough draws to conclude at this effect floor. On git-workflow-and-versioning Claude Opus 5.5’s lift is +0.353, +0.371, +0.276 and Claude Sonnet 5.5’s +0.000, +0.013, +0.007; with the skill the rule detects separation in zero of three runs, and without it Claude Opus 5.5 reads 0.508, 0.485, 0.579 where Claude Sonnet 5.5 reads 0.860, 0.850, 0.857. On documentation-and-adrs both lifts are above zero in every run: Claude Sonnet 5.5 by +0.208, +0.238, +0.272, Claude Opus 5.5 by +0.116, +0.300, +0.322. So on these cases the skill does not take Claude Sonnet 5.5 to a with-skill score the rule can tell apart from Claude Opus 5.5’s, and how much it adds depends on where each model starts without it. The runner does not compare lifts, and none of this is a statement about either model’s coding ability. Each receipt’s own reading of its lift is on its receipt page; a lift is context here, and none is read as a gain.

3. Claude Opus 5.5 on this report’s Claude Code separates from Report 011’s receipts upward on documentation-and-adrs in some runs and not others. On documentation-and-adrs the rule reads separation upward in two of the three runs, against Report 011’s single run, whose spread there was 0.148. On code-review-and-quality and git-workflow-and-versioning it detects separation in zero of six readings. Report 011 is one run, and this report’s own runs differ from each other, so this is a statement about these draws on two Claude Code versions and two dates, not about Claude Code.

4. The runs differ from each other, which is why there are three. Of the nine skill and comparison pairs, five read a different verdict in one run than in another. Claude Opus 5.5’s baseline on code-review-and-quality read 0.831, 0.857, 0.713 across the three runs. Claude Sonnet 5’s with-skill arm on the same skill read 0.657 ± 0.257 (4 draws) in run 3, against 0.880 ± 0.006 (3 draws) and 0.881 ± 0.005 (3 draws) in the other two. A reading from one run of one case is one reading; the counts above say how often it came back.

Read from: docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--documentation-and-adrs.md; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--documentation-and-adrs.md; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--documentation-and-adrs.md; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--code-review-and-quality.md; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--code-review-and-quality.md; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--code-review-and-quality.md; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/diff--upgrade--run-3--git-workflow-and-versioning.md; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--code-review-and-quality.md; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--code-review-and-quality.md; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--code-review-and-quality.md; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--git-workflow-and-versioning.md; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-1--documentation-and-adrs.md; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-2--documentation-and-adrs.md; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/diff--peer--run-3--documentation-and-adrs.md; docs/reports/011/evidence/documentation-and-adrs-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/diff--harness--run-1--documentation-and-adrs.md; docs/reports/013/evidence/diff--harness--run-2--documentation-and-adrs.md; docs/reports/013/evidence/diff--harness--run-3--documentation-and-adrs.md; docs/reports/011/evidence/code-review-and-quality-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/diff--harness--run-1--code-review-and-quality.md; docs/reports/013/evidence/diff--harness--run-2--code-review-and-quality.md; docs/reports/013/evidence/diff--harness--run-3--code-review-and-quality.md; docs/reports/011/evidence/git-workflow-and-versioning-claude-opus-5-5-2026-09-23.json; docs/reports/013/evidence/diff--harness--run-1--git-workflow-and-versioning.md; docs/reports/013/evidence/diff--harness--run-2--git-workflow-and-versioning.md; docs/reports/013/evidence/diff--harness--run-3--git-workflow-and-versioning.md.

Run record

The runs. Each run went arm by arm, claude-sonnet-5-5 first, then claude-sonnet-5, then claude-opus-5-5, one skill at a time, code-review-and-quality first in each. The command file writes a status line after each skill run. The three runs went one after another with the same script and settings. Their log records that the script driving the second and third stopped after the second, in its words three-runs.sh died waiting on the quiet marker, run 3 not started, and that the third then ran, run 3 exit 0. Each receipt’s run.date_utc is written by the runner and is not read here as a start or a finish.

The caps. A guard in front of Claude Code allowed 360 calls per run and 240 seconds per call.

The cost. Metered spend, as the runner reports it, was 0.00 dollars in each skill run’s console output: the claude-cli surface runs on a subscription. The estimated API-equivalent below is every draw’s generation and judge token counts, as each receipt records them, at the prices each receipt froze, with cached input counted at the full input price, as the runner counts it.

runarmcallsgeneration, estimated USDjudge, estimated USDtotal, estimated USD
run 1claude-sonnet-5-5840.795.596.38
run 1claude-sonnet-5800.965.316.27
run 1claude-opus-5-51082.087.249.32
run 2claude-sonnet-5-5880.835.786.62
run 2claude-sonnet-5881.065.636.70
run 2claude-opus-5-5961.786.318.09
run 3claude-sonnet-5-5720.684.805.48
run 3claude-sonnet-51041.286.888.16
run 3claude-opus-5-5961.886.588.46
all three runs11.3554.1465.48

Integrity. Each receipt validates with its receipt hash verified, and each sidecar names its receipt’s hash. The raw call records carry the SKILL.md text and stay unpublished; each run’s list of their sha256 is published.

Read from: docs/reports/013/evidence/runs-log.txt; docs/reports/013/evidence/run-1/run-record.json; docs/reports/013/evidence/run-1/status.jsonl; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/run-record.json; docs/reports/013/evidence/run-2/status.jsonl; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/run-record.json; docs/reports/013/evidence/run-3/status.jsonl; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.json; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.json; docs/reports/013/evidence/guard.py; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/code-review-and-quality-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/code-review-and-quality-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/documentation-and-adrs-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/code-review-and-quality-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/code-review-and-quality-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-2/documentation-and-adrs-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/code-review-and-quality-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-sonnet-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/code-review-and-quality-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/git-workflow-and-versioning-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-3/documentation-and-adrs-claude-opus-5-5-2026-09-29.stdout.txt; docs/reports/013/evidence/run-1/driftproof-calls.SHA256SUMS; docs/reports/013/evidence/run-2/driftproof-calls.SHA256SUMS; docs/reports/013/evidence/run-3/driftproof-calls.SHA256SUMS.

Published evidence

The files this report makes public. For each run, the nine receipts with their summaries, surface sidecars and the runner’s console output, the run record, its registry copy, the status lines and the sha256 of every raw call record; the twenty-seven driftproof diff outputs the verdicts are read from; the log of the three runs; the pricing snapshot; and the call guard. The pricing snapshot records the sha256 of the page it was read from; that page is not published. Each sidecar’s surface_note path is relative to the operator’s run directory; the run record it names is run-<k>/run-record.json here.

Report 011’s three Claude Opus 5.5 receipts, the other side of the harness check, are published with that report: code-review-and-quality, git-workflow-and-versioning, documentation-and-adrs. Validate a receipt with npx driftproof validate <file>. Each copy here is byte-identical to its twin under specs/121-report-013-sonnet-5-5/, and each sidecar names the receipt it belongs to and that receipt’s hash.

Receipts

Every receipt this report rests on, each one resolvable. Nine for each run, one per arm and skill, the same bytes as the evidence copies above.

Validate any of them with npx driftproof validate <file>, and reproduce a verdict with npx driftproof diff <first> <second> over two receipts of one run.