coconut-curriculum-checkpoints / experiments /wilcoxon_teacher_forced_m3_vs_m5.json
vmaddikera's picture bmarti44's picture
Duplicate from bmarti44/coconut-curriculum-checkpoints
6f25c11
Raw History Blame Contribute Delete
3.77 kB
{
"method": "Wilcoxon signed-rank on teacher-forced species token log-probabilities",
"description": "Teacher-force through '### [Name] is a' prefix, then extract log P(species_token). Species token is the discriminative one requiring multi-hop reasoning. Comparison: m3 vs m5.",
"comparison": "m3_vs_m5",
"bonferroni_k": 5,
"adjusted_alpha": 0.01,
"results": {
"prosqa_id": {
"n": 500,
"n_ties": 0,
"n_nonzero": 500,
"median_diff": -0.0001227500616778343,
"mean_diff": -0.06978289037453805,
"std_diff": 1.0628266559166086,
"wilcoxon_stat": 19908.0,
"p_value": 7.135644023141254e-40,
"p_bonferroni": 3.567822011570627e-39,
"effect_size_r": 0.5910176620488471,
"z_score": 13.215556682442198,
"m3_median_lp": -1.9490528757160064e-05,
"m5_median_lp": -0.0002181292074965313,
"m3_mean_lp": -0.11297737371596042,
"m5_mean_lp": -0.18276026409049848,
"m3_prob_median": 0.999980509661182,
"m5_prob_median": 0.9997818945809493,
"direction": "m3>m5"
},
"7hop": {
"n": 1000,
"n_ties": 0,
"n_nonzero": 1000,
"median_diff": -0.00032740284859755775,
"mean_diff": 0.2813422611065431,
"std_diff": 2.906805478757986,
"wilcoxon_stat": 248577.0,
"p_value": 0.8546955264303868,
"p_bonferroni": 1.0,
"effect_size_r": 0.005791098858817567,
"z_score": 0.18313062549065387,
"m3_median_lp": -0.026303524151444435,
"m5_median_lp": -0.037403758615255356,
"m3_mean_lp": -1.3909491490889976,
"m5_mean_lp": -1.1096068879824543,
"m3_prob_median": 0.9740394002541536,
"m5_prob_median": 0.9632871213462526,
"direction": "m3>m5"
},
"8hop": {
"n": 1000,
"n_ties": 0,
"n_nonzero": 1000,
"median_diff": -0.00027873104806985793,
"mean_diff": 0.21474395308568736,
"std_diff": 2.776021865502376,
"wilcoxon_stat": 248628.0,
"p_value": 0.8590779324092401,
"p_bonferroni": 1.0,
"effect_size_r": 0.005614562073521871,
"z_score": 0.17754804216726866,
"m3_median_lp": -0.02322522271424532,
"m5_median_lp": -0.04081491939723492,
"m3_mean_lp": -1.3103880740790188,
"m5_mean_lp": -1.0956441209933316,
"m3_prob_median": 0.9770424068482431,
"m5_prob_median": 0.960006792142127,
"direction": "m3>m5"
},
"dag": {
"n": 1000,
"n_ties": 0,
"n_nonzero": 1000,
"median_diff": -0.0010396945101547317,
"mean_diff": 0.16994009311438624,
"std_diff": 2.963397551627641,
"wilcoxon_stat": 249483.0,
"p_value": 0.9330900836102644,
"p_bonferroni": 1.0,
"effect_size_r": 0.0026549747906234756,
"z_score": 0.08395767468698836,
"m3_median_lp": -0.22533510625362396,
"m5_median_lp": -0.34515246748924255,
"m3_mean_lp": -1.8029823147184267,
"m5_mean_lp": -1.6330422216040406,
"m3_prob_median": 0.7982486758110119,
"m5_prob_median": 0.7081123811200218,
"direction": "m3>m5"
},
"dense": {
"n": 1000,
"n_ties": 0,
"n_nonzero": 1000,
"median_diff": 0.00026002148661063984,
"mean_diff": 0.5418239545176224,
"std_diff": 2.9624931634035607,
"wilcoxon_stat": 217527.0,
"p_value": 0.0003410538200066114,
"p_bonferroni": 0.001705269100033057,
"effect_size_r": 0.11327084755354884,
"z_score": 3.581938707669256,
"m3_median_lp": -0.14667461067438126,
"m5_median_lp": -0.1057770662009716,
"m3_mean_lp": -1.6534713189456967,
"m5_mean_lp": -1.111647364428074,
"m3_prob_median": 0.8635749297684109,
"m5_prob_median": 0.8996251825817885,
"direction": "m5>m3"
}
}
}