{ "method": "Wilcoxon signed-rank on teacher-forced species token log-probabilities", "description": "Teacher-force through '### [Name] is a' prefix, then extract log P(species_token). Species token is the discriminative one requiring multi-hop reasoning. Comparison: m5 vs m6.", "comparison": "m5_vs_m6", "bonferroni_k": 5, "adjusted_alpha": 0.01, "results": { "prosqa_id": { "n": 500, "n_ties": 0, "n_nonzero": 500, "median_diff": -0.00013814407611789647, "mean_diff": -0.016247838157780962, "std_diff": 1.1177613567572349, "wilcoxon_stat": 41957.0, "p_value": 1.6143744744439177e-10, "p_bonferroni": 8.071872372219589e-10, "effect_size_r": 0.28595531145037273, "z_score": 6.394155149301574, "m5_median_lp": -0.00021824839495820925, "m6_median_lp": -0.0005059154354967177, "m5_mean_lp": -0.1827606344706453, "m6_mean_lp": -0.19900847262842628, "m5_prob_median": 0.9997817754194902, "m6_prob_median": 0.9994942125181384, "direction": "m5>m6" }, "7hop": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": 0.0001795582447812194, "mean_diff": 0.48284089019898646, "std_diff": 2.0365023730650087, "wilcoxon_stat": 209203.0, "p_value": 7.0192524328014474e-06, "p_bonferroni": 3.5096262164007236e-05, "effect_size_r": 0.1420844201182813, "z_score": 4.493103875980196, "m5_median_lp": -0.03740513697266579, "m6_median_lp": -0.03395153023302555, "m5_mean_lp": -1.109607256290728, "m6_mean_lp": -0.6267663660917415, "m5_prob_median": 0.9632857935932256, "m6_prob_median": 0.966618355268511, "direction": "m6>m5" }, "8hop": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": 0.0002561149522080086, "mean_diff": 0.3832407745273106, "std_diff": 2.227865684000055, "wilcoxon_stat": 215715.0, "p_value": 0.00015664918728829126, "p_bonferroni": 0.0007832459364414563, "effect_size_r": 0.119543095689937, "z_score": 3.7802846092765865, "m5_median_lp": -0.04081503301858902, "m6_median_lp": -0.03081549145281315, "m5_mean_lp": -1.0956443890799654, "m6_mean_lp": -0.7124036145526548, "m5_prob_median": 0.9600066830648615, "m6_prob_median": 0.9696544661086867, "direction": "m6>m5" }, "dag": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": 0.0026662750460673124, "mean_diff": 0.4216908030509094, "std_diff": 2.3045800471066755, "wilcoxon_stat": 210880.0, "p_value": 1.6359787033524354e-05, "p_bonferroni": 8.179893516762177e-05, "effect_size_r": 0.13627947523708756, "z_score": 4.3095354008171185, "m5_median_lp": -0.34515656530857086, "m6_median_lp": -0.2986634820699692, "m5_mean_lp": -1.6330430318220843, "m6_mean_lp": -1.2113522287711749, "m5_prob_median": 0.7081094794093652, "m6_prob_median": 0.7418089994658733, "direction": "m6>m5" }, "dense": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": -0.003164976616972126, "mean_diff": 0.11263441988590966, "std_diff": 2.239913360245438, "wilcoxon_stat": 244040.0, "p_value": 0.49665541423174153, "p_bonferroni": 1.0, "effect_size_r": 0.021495949738946255, "z_score": 0.6797616164357204, "m5_median_lp": -0.10577894374728203, "m6_median_lp": -0.16426319628953934, "m5_mean_lp": -1.1116475733733295, "m6_mean_lp": -0.9990131534874199, "m5_prob_median": 0.8996234934954318, "m6_prob_median": 0.8485186655238433, "direction": "m5>m6" } } }