Law category bc-inversion robustness (n=17 items)

label source                                             pos   n_valid  AUC    [95% CI]        p
flex                                                     0.53   17     0.597  [0.264,0.900]  0.6130
llm-relabel (Cerebras)                                   degenerate
majority-3                                               0.18   17     0.119  [0.000,0.333]  0.0031
groq/llama-3.3-70b-versatile                             0.35   17     0.364  [0.071,0.694]  0.4052
groq/meta-llama/llama-4-scout-17b-16e-instruct           0.18   17     0.119  [0.000,0.333]  0.0031
groq/openai/gpt-oss-120b                                 degenerate

=== bootstrap-seed variation on majority-3 label ===
  seed= 42: AUC=0.119  CI=[0.000,0.333]  p=0.0031
  seed=  0: AUC=0.119  CI=[0.000,0.312]  p=0.0005
  seed=  1: AUC=0.119  CI=[0.000,0.316]  p=0.0021
  seed=  2: AUC=0.119  CI=[0.000,0.312]  p=0.0042
  seed=  3: AUC=0.119  CI=[0.000,0.333]  p=0.0010
  seed=  7: AUC=0.119  CI=[0.000,0.333]  p=0.0010
  seed= 13: AUC=0.119  CI=[0.000,0.312]  p=0.0031
  seed=100: AUC=0.119  CI=[0.000,0.333]  p=0.0042

=== leave-one-out jackknife on majority-3 AUC ===
  min=0.051  max=0.143  mean=0.119  std=0.024

== Interpretation ==
  If Law inversion holds across ALL label sources (AUC < 0.4 everywhere),
    the inversion is a truly robust model-behavior finding.
  If some sources show 0.5+, the inversion is label-specific noise.
