{ "method": "Wilcoxon signed-rank on teacher-forced species token log-probabilities", "description": "Teacher-force through '### [Name] is a' prefix, then extract log P(species_token). Species token is the discriminative one requiring multi-hop reasoning. Comparison: m3 vs m6.", "comparison": "m3_vs_m6", "bonferroni_k": 5, "adjusted_alpha": 0.01, "results": { "prosqa_id": { "n": 500, "n_ties": 0, "n_nonzero": 500, "median_diff": -0.00036554490657181304, "mean_diff": -0.0860310743720925, "std_diff": 1.2170259847022458, "wilcoxon_stat": 13588.0, "p_value": 5.51961631585719e-52, "p_bonferroni": 2.759808157928595e-51, "effect_size_r": 0.6784589997867199, "z_score": 15.17080443469621, "m3_median_lp": -1.9490528757160064e-05, "m6_median_lp": -0.0005059154354967177, "m3_mean_lp": -0.11297739825633377, "m6_mean_lp": -0.19900847262842628, "m3_prob_median": 0.999980509661182, "m6_prob_median": 0.9994942125181384, "direction": "m3>m6" }, "7hop": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": -0.00025782780085137347, "mean_diff": 0.7641824833154048, "std_diff": 2.6517137931258605, "wilcoxon_stat": 218786.0, "p_value": 0.0005729096557360483, "p_bonferroni": 0.0028645482786802414, "effect_size_r": 0.10891281201066103, "z_score": 3.444125523274317, "m3_median_lp": -0.026303233578801155, "m6_median_lp": -0.03395153023302555, "m3_mean_lp": -1.3909488494071465, "m6_mean_lp": -0.6267663660917415, "m3_prob_median": 0.974039683283398, "m6_prob_median": 0.966618355268511, "direction": "m3>m6" }, "8hop": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": -0.0003167157010466326, "mean_diff": 0.5979843548741289, "std_diff": 2.54137471092738, "wilcoxon_stat": 226686.0, "p_value": 0.009898001252072113, "p_bonferroni": 0.04949000626036057, "effect_size_r": 0.08156691781779862, "z_score": 2.5793724202401473, "m3_median_lp": -0.023225629702210426, "m6_median_lp": -0.03081549145281315, "m3_mean_lp": -1.310387969426784, "m6_mean_lp": -0.7124036145526548, "m3_prob_median": 0.977042009203823, "m6_prob_median": 0.9696544661086867, "direction": "m3>m6" }, "dag": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": -0.0005894981513847597, "mean_diff": 0.5916298918708122, "std_diff": 2.942288236114359, "wilcoxon_stat": 229183.0, "p_value": 0.021108131302877156, "p_bonferroni": 0.10554065651438578, "effect_size_r": 0.07292353834949769, "z_score": 2.3060447622304863, "m3_median_lp": -0.22532972693443298, "m6_median_lp": -0.2986634820699692, "m3_mean_lp": -1.802982120641987, "m6_mean_lp": -1.2113522287711749, "m3_prob_median": 0.7982529698569824, "m6_prob_median": 0.7418089994658733, "direction": "m3>m6" }, "dense": { "n": 1000, "n_ties": 0, "n_nonzero": 1000, "median_diff": -0.00013662463516084244, "mean_diff": 0.6544579904913999, "std_diff": 2.796134035440923, "wilcoxon_stat": 216195.0, "p_value": 0.000193202514204543, "p_bonferroni": 0.000966012571022715, "effect_size_r": 0.1178815730048011, "z_score": 3.7277426485859038, "m3_median_lp": -0.1466745063662529, "m6_median_lp": -0.16426319628953934, "m3_mean_lp": -1.65347114397882, "m6_mean_lp": -0.9990131534874199, "m3_prob_median": 0.8635750198463003, "m6_prob_median": 0.8485186655238433, "direction": "m3>m6" } } }