{
  "title": "Gamification Systems Architect — public validation record",
  "evidencePack": "GAMIFICATION-PRODUCT-PAGE-BENCHMARK-EVIDENCE-v1.0.zip",
  "sourcePackSHA256": "b1b5cf6193780f0208fcd7405c3d0e25c266095a59f66ad53155717deed5e600",
  "validatedRuntimeSHA256": "c4e8b4f0353b7bbc196b20fa39f383572c72302d76a07aa8eb3da3677a826893",
  "benchmark": {
    "run": "gam-rc2-sol",
    "model": "gpt-5.6-sol",
    "judgeModel": "gpt-5.6-sol",
    "reasoning": "medium",
    "judgeReasoning": "high",
    "runtimeHash": "c4e8b4f0353b7bbc196b20fa39f383572c72302d76a07aa8eb3da3677a826893",
    "caseCount": 96,
    "releaseDecision": "PASS",
    "judgeDisagreements": 0,
    "metrics": {
      "base_mean_score": 3.072,
      "runtime_mean_score": 3.825,
      "mean_dimension_improvement": 0.752,
      "median_case_delta": 0.677,
      "delta_95ci_approx": [
        0.662,
        0.825
      ],
      "no_gamification_precision": 0.167,
      "base_critical_failures": 2,
      "runtime_critical_failures": 0,
      "critical_failure_relative_reduction": 1,
      "no_gamification_recall": 1,
      "implementation_completeness_pass_rate": 1,
      "pairwise_non_tie_win_rate": 0.989,
      "materially_worse_case_rate": 0,
      "safety_ethics_regression_rate": 0.036,
      "pairwise": {
        "runtime_wins": 94,
        "base_wins": 1,
        "ties": 1
      }
    },
    "gates": {
      "mean_dimension_improvement": true,
      "critical_failure_relative_reduction": true,
      "no_gamification_recall": true,
      "max_safety_ethics_regression": true,
      "implementation_completeness_pass_rate": true,
      "pairwise_non_tie_win_rate": true,
      "max_materially_worse_case_rate": true
    },
    "thresholds": {
      "mean_dimension_improvement": 0.4,
      "critical_failure_relative_reduction": 0.3,
      "no_gamification_recall": 0.8,
      "max_safety_ethics_regression": 0.1,
      "implementation_completeness_pass_rate": 0.75,
      "pairwise_non_tie_win_rate": 0.6,
      "max_materially_worse_case_rate": 0.15
    }
  },
  "regression": {
    "run": "gam-rc2-regression",
    "model": "gpt-5.6-sol",
    "judgeModel": "gpt-5.6-sol",
    "reasoning": "medium",
    "judgeReasoning": "high",
    "runtimeHash": "c4e8b4f0353b7bbc196b20fa39f383572c72302d76a07aa8eb3da3677a826893",
    "caseCount": 24,
    "releaseDecision": "PASS",
    "judgeDisagreements": 0,
    "metrics": {
      "base_mean_score": 2.956,
      "runtime_mean_score": 3.779,
      "mean_dimension_improvement": 0.823,
      "median_case_delta": 0.875,
      "delta_95ci_approx": [
        0.652,
        0.959
      ],
      "no_gamification_precision": 0.364,
      "base_critical_failures": 0,
      "runtime_critical_failures": 0,
      "critical_failure_relative_reduction": 1,
      "no_gamification_recall": 1,
      "implementation_completeness_pass_rate": 1,
      "pairwise_non_tie_win_rate": 1,
      "materially_worse_case_rate": 0,
      "safety_ethics_regression_rate": 0,
      "pairwise": {
        "runtime_wins": 24,
        "base_wins": 0,
        "ties": 0
      }
    },
    "gates": {
      "mean_dimension_improvement": true,
      "critical_failure_relative_reduction": true,
      "no_gamification_recall": true,
      "max_safety_ethics_regression": true,
      "implementation_completeness_pass_rate": true,
      "pairwise_non_tie_win_rate": true,
      "max_materially_worse_case_rate": true
    },
    "thresholds": {
      "mean_dimension_improvement": 0.4,
      "critical_failure_relative_reduction": 0.3,
      "no_gamification_recall": 0.8,
      "max_safety_ethics_regression": 0.1,
      "implementation_completeness_pass_rate": 0.75,
      "pairwise_non_tie_win_rate": 0.6,
      "max_materially_worse_case_rate": 0.15
    }
  },
  "dimensions": {
    "D01": {
      "n": 55,
      "base_mean": 3.045,
      "runtime_mean": 3.773,
      "delta": 0.727
    },
    "D02": {
      "n": 19,
      "base_mean": 3.895,
      "runtime_mean": 4,
      "delta": 0.105
    },
    "D03": {
      "n": 39,
      "base_mean": 3.248,
      "runtime_mean": 3.962,
      "delta": 0.714
    },
    "D04": {
      "n": 42,
      "base_mean": 3.167,
      "runtime_mean": 3.762,
      "delta": 0.595
    },
    "D05": {
      "n": 58,
      "base_mean": 3.25,
      "runtime_mean": 3.948,
      "delta": 0.698
    },
    "D06": {
      "n": 38,
      "base_mean": 2.776,
      "runtime_mean": 3.684,
      "delta": 0.908
    },
    "D07": {
      "n": 18,
      "base_mean": 3.889,
      "runtime_mean": 4,
      "delta": 0.111
    },
    "D08": {
      "n": 35,
      "base_mean": 2.971,
      "runtime_mean": 3.743,
      "delta": 0.771
    },
    "D09": {
      "n": 17,
      "base_mean": 2.588,
      "runtime_mean": 3.647,
      "delta": 1.059
    },
    "D10": {
      "n": 17,
      "base_mean": 3.118,
      "runtime_mean": 3.912,
      "delta": 0.794
    },
    "D11": {
      "n": 59,
      "base_mean": 2.915,
      "runtime_mean": 3.915,
      "delta": 1
    },
    "D12": {
      "n": 67,
      "base_mean": 2.896,
      "runtime_mean": 3.799,
      "delta": 0.903
    },
    "D13": {
      "n": 24,
      "base_mean": 3.417,
      "runtime_mean": 3.958,
      "delta": 0.542
    },
    "D14": {
      "n": 4,
      "base_mean": 4,
      "runtime_mean": 4,
      "delta": 0
    },
    "D15": {
      "n": 56,
      "base_mean": 3.268,
      "runtime_mean": 3.866,
      "delta": 0.598
    },
    "D16": {
      "n": 39,
      "base_mean": 2.654,
      "runtime_mean": 3.397,
      "delta": 0.744
    },
    "D17": {
      "n": 92,
      "base_mean": 2.822,
      "runtime_mean": 3.772,
      "delta": 0.949
    },
    "D18": {
      "n": 20,
      "base_mean": 2.85,
      "runtime_mean": 3.5,
      "delta": 0.65
    },
    "D19": {
      "n": 20,
      "base_mean": 3.4,
      "runtime_mean": 4,
      "delta": 0.6
    },
    "D20": {
      "n": 59,
      "base_mean": 3.186,
      "runtime_mean": 3.839,
      "delta": 0.653
    },
    "D21": {
      "n": 76,
      "base_mean": 2.888,
      "runtime_mean": 3.895,
      "delta": 1.007
    },
    "D22": {
      "n": 23,
      "base_mean": 3.609,
      "runtime_mean": 4,
      "delta": 0.391
    },
    "D23": {
      "n": 4,
      "base_mean": 3.75,
      "runtime_mean": 4,
      "delta": 0.25
    }
  },
  "domains": {
    "Community / creator platforms": {
      "n": 10,
      "base_mean": 3.199,
      "runtime_mean": 3.788,
      "delta": 0.589
    },
    "Consumer digital products": {
      "n": 14,
      "base_mean": 3.203,
      "runtime_mean": 3.766,
      "delta": 0.563
    },
    "Cross-domain/adversarial transfer": {
      "n": 6,
      "base_mean": 2.836,
      "runtime_mean": 3.877,
      "delta": 1.041
    },
    "Fitness / practice": {
      "n": 8,
      "base_mean": 2.936,
      "runtime_mean": 3.899,
      "delta": 0.963
    },
    "Health / wellness behaviour support": {
      "n": 8,
      "base_mean": 3.171,
      "runtime_mean": 3.828,
      "delta": 0.657
    },
    "Learning / education": {
      "n": 12,
      "base_mean": 3.103,
      "runtime_mean": 3.833,
      "delta": 0.73
    },
    "Loyalty / service experiences": {
      "n": 8,
      "base_mean": 3.005,
      "runtime_mean": 3.886,
      "delta": 0.881
    },
    "Marketplaces / economies": {
      "n": 10,
      "base_mean": 3.088,
      "runtime_mean": 3.778,
      "delta": 0.69
    },
    "Media / content": {
      "n": 8,
      "base_mean": 3.229,
      "runtime_mean": 3.878,
      "delta": 0.649
    },
    "Workplace / enterprise": {
      "n": 12,
      "base_mean": 2.974,
      "runtime_mean": 3.85,
      "delta": 0.876
    }
  },
  "selectedCases": [
    {
      "id": "GAM-EVAL-004",
      "delta": 1.269,
      "winner": "RUNTIME"
    },
    {
      "id": "GAM-EVAL-012",
      "delta": 1.357,
      "winner": "RUNTIME"
    },
    {
      "id": "GAM-EVAL-013",
      "delta": 1.444,
      "winner": "RUNTIME"
    },
    {
      "id": "GAM-EVAL-048",
      "delta": 1.7,
      "winner": "RUNTIME"
    },
    {
      "id": "GAM-EVAL-075",
      "delta": 1.5,
      "winner": "RUNTIME"
    }
  ],
  "scope": "Frozen evaluation sets and tested model configuration only. Not universal performance or a real-world outcomes study."
}
