{
  "schema_version": "0.6",
  "generation_sampled": true,
  "skill": {
    "name": "code-review-and-quality",
    "version": "0.0.0",
    "content_hash": "13d360d7f786de371886e404b1eaa0cd37ecabab90e5c7126d62d42b73a872ea",
    "tokens": 5120
  },
  "suite": {
    "format": "agentskills.io/evals",
    "suite_hash": "5d729f8852949735a553218a63ade5e0b5634b17579117290866bf074b9c6b40",
    "case_count": 1,
    "canary": "4ceca5ae-96c9-7547-9798-11d14894349f"
  },
  "run": {
    "model_id": "claude-opus-5-5",
    "model_release_date": null,
    "provider": "anthropic",
    "surface": "claude-cli",
    "runner_version": "0.10.1",
    "date_utc": "2026-09-29T05:10:32.793Z",
    "registry": "registered",
    "transcripts": "retained-local",
    "judge": {
      "samples": 3,
      "temperature": null,
      "sampling": "surface-controlled",
      "surface": "claude-cli",
      "model_id": "claude-opus-5",
      "prompt_template_hash": "82586d1e44f84df2b8ce5f18ac777866465cb5ad9686503c93d9776c93c344ed"
    },
    "answered_by": {
      "kind": "model",
      "attested": true,
      "reported_model": "claude-opus-5-5",
      "reported_models": [
        "claude-opus-5",
        "claude-opus-5-5"
      ],
      "isolation": "same-user"
    },
    "pricing_snapshot": {
      "frozen_at": "2026-09-29T05:10:32.793Z",
      "source": "config/models.json",
      "currency": "USD",
      "models": {
        "claude-opus-5-5": {
          "input_per_mtok": 4,
          "output_per_mtok": 20,
          "registered": true
        },
        "claude-opus-5": {
          "input_per_mtok": 5,
          "output_per_mtok": 25,
          "registered": true
        }
      },
      "note": "Prices frozen at run time. Every derived cost in this receipt is computed from THIS snapshot, never from the live registry, so the receipt keeps its meaning when registry prices later change."
    }
  },
  "results": {
    "cases": [
      {
        "id": "severity-labeled-findings",
        "mode": "with_skill",
        "outcome": "pass",
        "score": 0.894444,
        "mean": 0.894444,
        "stddev": 0.017105,
        "samples": [
          0.9,
          0.88,
          0.89
        ],
        "generation_hash": "e298f196156fcb6440f8819c1f7adc51be9931128eeb6656827ecb6180e70064",
        "judge_sample_hashes": [
          "40428227f0cfcf6e5e386236cdd72cdadbe89712da606746b7b7984b740edec2",
          "090847a36d2184bc82650a80feecf27bf5eb9d406345bd20f1a73b1438489317",
          "2fd20cd95c987caffd58e2f430baa0770828cee32ba5d1a229e694aa4b36f9f8"
        ],
        "threshold": 0.7,
        "reason": "Explicit Critical/Required/Nit labels on every finding, secret marked Critical, PII logging Critical, cosmetic naming as Nit, ordered by leverage with concrete fixes; `data` naming folded into Required.",
        "judge": {
          "model_id": "claude-opus-5",
          "rubric_hash": "a953d281f6a998f2b332172b431e3fd36792516ceefbc87ca00bab9ebcf015b0"
        },
        "judge_usage": {
          "input_tokens": 48012,
          "output_tokens": 2678,
          "cached_tokens": 35259,
          "wall_ms": 40654
        },
        "generation": {
          "n_planned": 3,
          "n_drawn": 3,
          "n_measured": 3,
          "n_unmeasured": 0,
          "stopping_reason": "min_reached",
          "mean": 0.894444,
          "sd": 0.017105,
          "judge_sd_mean": 0.016002,
          "variance_ratio": 1.068929,
          "variance_ratio_unavailable": null,
          "n_truncated": 0,
          "draws": [
            {
              "draw_index": 0,
              "generation_hash": "53811e6d86a3c006d57f9976754df23d38d710b3f84140cc54aeed4eb6293a27",
              "status": "measured",
              "samples": [
                0.92,
                0.92,
                0.9
              ],
              "judge_sample_hashes": [
                "2c918c7ac62850a10a7eecc200047d144a8b98e8eebda3b8de93d3e4599213f6",
                "3e343ac880cc70ba03198858c1a3f2bde94e7710b34bcafa8c0b942b87ee08a8",
                "aec0dee95e2e112ca17ed23633d61144eda2b74a5d6fd443888c093e2f8f4696"
              ],
              "mean": 0.913333,
              "stddev": 0.011547,
              "stop_reason": "end_turn",
              "truncated": false,
              "reported_model": "claude-opus-5-5",
              "usage": {
                "input_tokens": 19712,
                "output_tokens": 1427,
                "cached_tokens": 19710,
                "wall_ms": 16851
              },
              "judge_usage": {
                "input_tokens": 48078,
                "output_tokens": 1454,
                "cached_tokens": 35303,
                "wall_ms": 30056
              }
            },
            {
              "draw_index": 1,
              "generation_hash": "0e6745fb4a72bb253efeb1b74669bfc73faf77e6a0cd03ac0427ab5ebf1722e3",
              "status": "measured",
              "samples": [
                0.9,
                0.85,
                0.89
              ],
              "judge_sample_hashes": [
                "ae7fd937bac8a8a058ad7c37a894cef8b14b18ff628ba3eff5ec9b2525e90663",
                "e0a006df188629db1dcbedb04a1dd00511f4d6587c8cb082401c6fc65f5fd717",
                "bb09fce3441d7b2e2ee38b0638abab968140d5961e9caaebe548edefac416b6c"
              ],
              "mean": 0.88,
              "stddev": 0.026458,
              "stop_reason": "end_turn",
              "truncated": false,
              "reported_model": "claude-opus-5-5",
              "usage": {
                "input_tokens": 19712,
                "output_tokens": 1908,
                "cached_tokens": 19710,
                "wall_ms": 20981
              },
              "judge_usage": {
                "input_tokens": 49509,
                "output_tokens": 2598,
                "cached_tokens": 36257,
                "wall_ms": 41735
              }
            },
            {
              "draw_index": 2,
              "generation_hash": "e298f196156fcb6440f8819c1f7adc51be9931128eeb6656827ecb6180e70064",
              "status": "measured",
              "samples": [
                0.9,
                0.88,
                0.89
              ],
              "judge_sample_hashes": [
                "40428227f0cfcf6e5e386236cdd72cdadbe89712da606746b7b7984b740edec2",
                "090847a36d2184bc82650a80feecf27bf5eb9d406345bd20f1a73b1438489317",
                "2fd20cd95c987caffd58e2f430baa0770828cee32ba5d1a229e694aa4b36f9f8"
              ],
              "mean": 0.89,
              "stddev": 0.01,
              "stop_reason": "end_turn",
              "truncated": false,
              "reported_model": "claude-opus-5-5",
              "usage": {
                "input_tokens": 19712,
                "output_tokens": 1405,
                "cached_tokens": 19710,
                "wall_ms": 15359
              },
              "judge_usage": {
                "input_tokens": 48012,
                "output_tokens": 2678,
                "cached_tokens": 35259,
                "wall_ms": 40654
              }
            }
          ]
        }
      },
      {
        "id": "severity-labeled-findings",
        "mode": "baseline",
        "outcome": "pass",
        "score": 0.856667,
        "mean": 0.856667,
        "stddev": 0.027285,
        "samples": [
          0.88,
          0.87,
          0.8
        ],
        "generation_hash": "8d3d8f8570904d051d4c9b31f3607474b0a103a4ddf51d353b14c0c8ab86744a",
        "judge_sample_hashes": [
          "f48fdcf19726d5e6657c8642e044fe2204869f77588fc7a0d59437a84ac1754e",
          "5e632d072a5020dbcd926c921f30a56614ed437de487e38bc7648499be925d54",
          "2d924f0013dabad88ed5acc76161bd9e8650be51829cd39f212aff95db2010ff"
        ],
        "threshold": 0.7,
        "reason": "Explicit severity labels on every finding, hardcoded secret Critical, PII logging Critical, cosmetic naming in lowest tier, severity-ordered with concrete fixes; uses High/Medium instead of the skill's Required/Nit labels.",
        "judge": {
          "model_id": "claude-opus-5",
          "rubric_hash": "a953d281f6a998f2b332172b431e3fd36792516ceefbc87ca00bab9ebcf015b0"
        },
        "judge_usage": {
          "input_tokens": 48738,
          "output_tokens": 2869,
          "cached_tokens": 35743,
          "wall_ms": 44804
        },
        "generation": {
          "n_planned": 3,
          "n_drawn": 3,
          "n_measured": 3,
          "n_unmeasured": 0,
          "stopping_reason": "min_reached",
          "mean": 0.856667,
          "sd": 0.027285,
          "judge_sd_mean": 0.029244,
          "variance_ratio": 0.933012,
          "variance_ratio_unavailable": null,
          "n_truncated": 0,
          "draws": [
            {
              "draw_index": 0,
              "generation_hash": "fc79838bd2a50f5f03f5e5cd7c5b05a78cc7c0b243d9e05e84fce2cbd9dbb92d",
              "status": "measured",
              "samples": [
                0.9,
                0.89,
                0.87
              ],
              "judge_sample_hashes": [
                "e70886c828223296a1a29be640b23003c743100d55703a34ca6a76ca055307ce",
                "dca13fa8ec6494f32bc06f25af4ae5fca08d0d17b51361a3c04a926bb16fc0ee",
                "14a2bd52ea89485e2653801a6e0837aa14c669d5d635632d8b46caeb3a27a63f"
              ],
              "mean": 0.886667,
              "stddev": 0.015275,
              "stop_reason": "end_turn",
              "truncated": false,
              "reported_model": "claude-opus-5-5",
              "usage": {
                "input_tokens": 12737,
                "output_tokens": 1619,
                "cached_tokens": 12735,
                "wall_ms": 17062
              },
              "judge_usage": {
                "input_tokens": 48666,
                "output_tokens": 2512,
                "cached_tokens": 35695,
                "wall_ms": 42966
              }
            },
            {
              "draw_index": 1,
              "generation_hash": "1a7f4d49f45e166835d633816fbaa5ccd468f9b146e950c02541b04ab7142b66",
              "status": "measured",
              "samples": [
                0.8,
                0.85,
                0.85
              ],
              "judge_sample_hashes": [
                "71ada656fbe14f230db44ed66b6d5669ed26e29f963c00a2c18fec5fff743ece",
                "61268564e8d18284b07352fd657bfc6855faef4fe15a879f4a33a8e6dd39a267",
                "908b03e8d638f1d535d466dbffc33e3424f79aa95aa6236cd7ceb97a88f4ae22"
              ],
              "mean": 0.833333,
              "stddev": 0.028868,
              "stop_reason": "end_turn",
              "truncated": false,
              "reported_model": "claude-opus-5-5",
              "usage": {
                "input_tokens": 12737,
                "output_tokens": 1316,
                "cached_tokens": 12735,
                "wall_ms": 19745
              },
              "judge_usage": {
                "input_tokens": 47805,
                "output_tokens": 2366,
                "cached_tokens": 35121,
                "wall_ms": 38089
              }
            },
            {
              "draw_index": 2,
              "generation_hash": "8d3d8f8570904d051d4c9b31f3607474b0a103a4ddf51d353b14c0c8ab86744a",
              "status": "measured",
              "samples": [
                0.88,
                0.87,
                0.8
              ],
              "judge_sample_hashes": [
                "f48fdcf19726d5e6657c8642e044fe2204869f77588fc7a0d59437a84ac1754e",
                "5e632d072a5020dbcd926c921f30a56614ed437de487e38bc7648499be925d54",
                "2d924f0013dabad88ed5acc76161bd9e8650be51829cd39f212aff95db2010ff"
              ],
              "mean": 0.85,
              "stddev": 0.043589,
              "stop_reason": "end_turn",
              "truncated": false,
              "reported_model": "claude-opus-5-5",
              "usage": {
                "input_tokens": 12737,
                "output_tokens": 1643,
                "cached_tokens": 12735,
                "wall_ms": 16841
              },
              "judge_usage": {
                "input_tokens": 48738,
                "output_tokens": 2869,
                "cached_tokens": 35743,
                "wall_ms": 44804
              }
            }
          ]
        }
      }
    ],
    "aggregates": {
      "with_skill": {
        "case_count": 1,
        "pass_count": 1,
        "borderline_count": 0,
        "mean_score": 0.894444,
        "stddev": null
      },
      "baseline": {
        "case_count": 1,
        "pass_count": 1,
        "borderline_count": 0,
        "mean_score": 0.856667,
        "stddev": null
      },
      "band_rule": "per arm: the sample standard deviation (n-1) of the per-case means across the included cases; the comparison band is the quadrature sum of the two arms; null where an arm has fewer than two included cases"
    }
  },
  "comparison": {
    "with_skill_score": 0.894444,
    "baseline_score": 0.856667,
    "delta": 0.037777,
    "delta_uncertainty": null,
    "delta_uncertainty_unavailable": "single_case"
  },
  "verification_level": "TESTED",
  "receipt_hash": "07e5ecd2e8e8390a2730c0e305d2b435653d1788406fc31c33d5e97c94ec6fa2",
  "economics": {
    "basis": "metered-equivalent",
    "surface": "claude-cli",
    "with_skill": {
      "call_count": 3,
      "mean_input_tokens": 19712,
      "mean_output_tokens": 1580,
      "mean_cost_usd_per_call": 0.110448,
      "median_wall_ms": 16851,
      "wall_ms_p25": null,
      "wall_ms_p75": null,
      "wall_ms_iqr": null
    },
    "baseline": {
      "call_count": 3,
      "mean_input_tokens": 12737,
      "mean_output_tokens": 1526,
      "mean_cost_usd_per_call": 0.081468,
      "median_wall_ms": 17062,
      "wall_ms_p25": null,
      "wall_ms_p75": null,
      "wall_ms_iqr": null
    },
    "skill_incremental_cost_usd_per_call": 0.02898,
    "skill_incremental_cost_usd_per_1k_calls": 28.98,
    "output_tokens_delta": 54,
    "median_wall_ms_delta": -211,
    "judge_excluded": true,
    "judge_overhead": {
      "note": "Measurement overhead imposed by Driftproof, NOT a cost of running the skill. Excluded from every field above.",
      "total_cost_usd": 0.622425,
      "case_rows_measured": 2
    },
    "notes": {
      "absolute_cost": "Absolute per-call cost on a CLI surface includes a fixed harness preamble (observed ~25k input tokens on claude-cli, ~11k on codex) that we do not control. It is identical in the with-skill and baseline arms, so it cancels in the Δ figures — read the incremental columns, not the absolute ones.",
      "cache_pricing": "Cached input tokens are costed at the list input rate (an over-estimate where caching is heavy); cached_tokens is recorded per call so a reader can recompute.",
      "latency": "observed on subscription CLI surface, indicative"
    }
  }
}