Qwen3-8b-grpo / checkpoint-100 /trainer_state.json
Weisly's picture
Upload LoRA checkpoint
939ca9f verified
Raw
History Blame Contribute Delete
147 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.390625,
"eval_steps": 500,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 773.71875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1684.0,
"completions/max_terminated_length": 1684.0,
"completions/mean_length": 774.71875,
"completions/mean_terminated_length": 774.71875,
"completions/min_length": 389.0,
"completions/min_terminated_length": 389.0,
"epoch": 0.00390625,
"frac_reward_zero_std": 0.375,
"grad_norm": 0.031107431277632713,
"kl": 0.0,
"learning_rate": 0.0,
"loss": 0.0,
"num_tokens": 49271.0,
"reward": 1.4142889976501465,
"reward_std": 0.05336200073361397,
"rewards/ROUGEL_entities_reward/mean": 0.3361639976501465,
"rewards/ROUGEL_entities_reward/std": 0.24250923097133636,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 1
},
{
"completion_length": 829.5,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1716.0,
"completions/max_terminated_length": 1716.0,
"completions/mean_length": 830.5,
"completions/mean_terminated_length": 830.5,
"completions/min_length": 353.0,
"completions/min_terminated_length": 353.0,
"epoch": 0.0078125,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.032838013023138046,
"kl": 0.0,
"learning_rate": 6.250000000000001e-08,
"loss": 0.0,
"num_tokens": 101031.0,
"reward": 1.6849710941314697,
"reward_std": 0.07849985361099243,
"rewards/ROUGEL_entities_reward/mean": 0.4505961537361145,
"rewards/ROUGEL_entities_reward/std": 0.17492875456809998,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.234375,
"rewards/f1_entities_exact_reward/std": 0.253503680229187,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 2
},
{
"completion_length": 858.21875,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1491.0,
"completions/mean_length": 859.15625,
"completions/mean_terminated_length": 779.9000244140625,
"completions/min_length": 390.0,
"completions/min_terminated_length": 390.0,
"epoch": 0.01171875,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.0946029424667358,
"kl": 0.04924837779253721,
"learning_rate": 1.2500000000000002e-07,
"loss": 0.0,
"num_tokens": 154252.0,
"reward": 1.7309010028839111,
"reward_std": 0.20555105805397034,
"rewards/ROUGEL_entities_reward/mean": 0.46527600288391113,
"rewards/ROUGEL_entities_reward/std": 0.34173816442489624,
"rewards/answer_correctness_func/mean": 0.09375,
"rewards/answer_correctness_func/std": 0.2961445748806,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.234375,
"rewards/f1_entities_exact_reward/std": 0.3356355130672455,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 3
},
{
"completion_length": 750.09375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1529.0,
"completions/max_terminated_length": 1529.0,
"completions/mean_length": 751.09375,
"completions/mean_terminated_length": 751.09375,
"completions/min_length": 365.0,
"completions/min_terminated_length": 365.0,
"epoch": 0.015625,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.03853773698210716,
"kl": 0.0008064582070801407,
"learning_rate": 1.875e-07,
"loss": 0.0,
"num_tokens": 203603.0,
"reward": 1.3999865055084229,
"reward_std": 0.06636261940002441,
"rewards/ROUGEL_entities_reward/mean": 0.33748650550842285,
"rewards/ROUGEL_entities_reward/std": 0.24072480201721191,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 4
},
{
"completion_length": 894.84375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1776.0,
"completions/max_terminated_length": 1776.0,
"completions/mean_length": 895.84375,
"completions/mean_terminated_length": 895.84375,
"completions/min_length": 439.0,
"completions/min_terminated_length": 439.0,
"epoch": 0.01953125,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.035162024199962616,
"kl": 0.0008056848309934139,
"learning_rate": 2.5000000000000004e-07,
"loss": 0.0,
"num_tokens": 257926.0,
"reward": 1.6901798248291016,
"reward_std": 0.2885170876979828,
"rewards/ROUGEL_entities_reward/mean": 0.5026798844337463,
"rewards/ROUGEL_entities_reward/std": 0.2995758056640625,
"rewards/answer_correctness_func/mean": 0.03125,
"rewards/answer_correctness_func/std": 0.1767766922712326,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.26753053069114685,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 5
},
{
"completion_length": 964.28125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1814.0,
"completions/max_terminated_length": 1814.0,
"completions/mean_length": 965.28125,
"completions/mean_terminated_length": 965.28125,
"completions/min_length": 482.0,
"completions/min_terminated_length": 482.0,
"epoch": 0.0234375,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.030356423929333687,
"kl": 0.000767507852287963,
"learning_rate": 3.125e-07,
"loss": 0.0,
"num_tokens": 314519.0,
"reward": 1.4136323928833008,
"reward_std": 0.25806623697280884,
"rewards/ROUGEL_entities_reward/mean": 0.39800751209259033,
"rewards/ROUGEL_entities_reward/std": 0.27216652035713196,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.046875,
"rewards/f1_entities_exact_reward/std": 0.1480722874403,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 6
},
{
"completion_length": 737.40625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1714.0,
"completions/max_terminated_length": 1714.0,
"completions/mean_length": 738.40625,
"completions/mean_terminated_length": 738.40625,
"completions/min_length": 271.0,
"completions/min_terminated_length": 271.0,
"epoch": 0.02734375,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.04363395646214485,
"kl": 0.000862537999637425,
"learning_rate": 3.75e-07,
"loss": -0.0,
"num_tokens": 363764.0,
"reward": 1.5545895099639893,
"reward_std": 0.1157001405954361,
"rewards/ROUGEL_entities_reward/mean": 0.3827144205570221,
"rewards/ROUGEL_entities_reward/std": 0.2522861063480377,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.171875,
"rewards/f1_entities_exact_reward/std": 0.24127934873104095,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 7
},
{
"completion_length": 739.125,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1440.0,
"completions/mean_length": 740.09375,
"completions/mean_terminated_length": 697.9031982421875,
"completions/min_length": 383.0,
"completions/min_terminated_length": 383.0,
"epoch": 0.03125,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.2299633026123047,
"kl": 0.03398810001090169,
"learning_rate": 4.375e-07,
"loss": 0.0,
"num_tokens": 412659.0,
"reward": 1.513428807258606,
"reward_std": 0.2709747552871704,
"rewards/ROUGEL_entities_reward/mean": 0.38842886686325073,
"rewards/ROUGEL_entities_reward/std": 0.25137466192245483,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.23546454310417175,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 8
},
{
"completion_length": 832.1875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1915.0,
"completions/max_terminated_length": 1915.0,
"completions/mean_length": 833.1875,
"completions/mean_terminated_length": 833.1875,
"completions/min_length": 432.0,
"completions/min_terminated_length": 432.0,
"epoch": 0.03515625,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.0308236014097929,
"kl": 0.0008265759242931381,
"learning_rate": 5.000000000000001e-07,
"loss": 0.0,
"num_tokens": 465181.0,
"reward": 1.492291808128357,
"reward_std": 0.1271674633026123,
"rewards/ROUGEL_entities_reward/mean": 0.38291680812835693,
"rewards/ROUGEL_entities_reward/std": 0.16038332879543304,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 9
},
{
"completion_length": 788.78125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1711.0,
"completions/max_terminated_length": 1711.0,
"completions/mean_length": 789.78125,
"completions/mean_terminated_length": 789.78125,
"completions/min_length": 344.0,
"completions/min_terminated_length": 344.0,
"epoch": 0.0390625,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.04289854317903519,
"kl": 0.0008371344592887908,
"learning_rate": 5.625e-07,
"loss": -0.0,
"num_tokens": 515798.0,
"reward": 1.7426328659057617,
"reward_std": 0.1278819590806961,
"rewards/ROUGEL_entities_reward/mean": 0.4457578659057617,
"rewards/ROUGEL_entities_reward/std": 0.29676324129104614,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.3463519513607025,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 10
},
{
"completion_length": 947.84375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1947.0,
"completions/max_terminated_length": 1625.0,
"completions/mean_length": 948.8125,
"completions/mean_terminated_length": 916.6128540039062,
"completions/min_length": 368.0,
"completions/min_terminated_length": 368.0,
"epoch": 0.04296875,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.031256962567567825,
"kl": 0.0008525731100235134,
"learning_rate": 6.25e-07,
"loss": 0.0,
"num_tokens": 571372.0,
"reward": 1.6054279804229736,
"reward_std": 0.2585637867450714,
"rewards/ROUGEL_entities_reward/mean": 0.4491780400276184,
"rewards/ROUGEL_entities_reward/std": 0.21337461471557617,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.23546454310417175,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 11
},
{
"completion_length": 796.375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1783.0,
"completions/max_terminated_length": 1783.0,
"completions/mean_length": 797.375,
"completions/mean_terminated_length": 797.375,
"completions/min_length": 379.0,
"completions/min_terminated_length": 379.0,
"epoch": 0.046875,
"frac_reward_zero_std": 0.375,
"grad_norm": 0.03451008349657059,
"kl": 0.0008439397643087432,
"learning_rate": 6.875000000000001e-07,
"loss": 0.0,
"num_tokens": 622380.0,
"reward": 1.8003621101379395,
"reward_std": 0.09649848937988281,
"rewards/ROUGEL_entities_reward/mean": 0.5503621101379395,
"rewards/ROUGEL_entities_reward/std": 0.24412204325199127,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.234375,
"rewards/f1_entities_exact_reward/std": 0.253503680229187,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 12
},
{
"completion_length": 827.34375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2047.0,
"completions/max_terminated_length": 1974.0,
"completions/mean_length": 828.3125,
"completions/mean_terminated_length": 789.0,
"completions/min_length": 342.0,
"completions/min_terminated_length": 342.0,
"epoch": 0.05078125,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.4412877559661865,
"kl": 0.03177165426313877,
"learning_rate": 7.5e-07,
"loss": 0.0,
"num_tokens": 673534.0,
"reward": 1.4974217414855957,
"reward_std": 0.1358407884836197,
"rewards/ROUGEL_entities_reward/mean": 0.4661717712879181,
"rewards/ROUGEL_entities_reward/std": 0.28460103273391724,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 13
},
{
"completion_length": 951.6875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1936.0,
"completions/max_terminated_length": 1936.0,
"completions/mean_length": 952.6875,
"completions/mean_terminated_length": 952.6875,
"completions/min_length": 360.0,
"completions/min_terminated_length": 360.0,
"epoch": 0.0546875,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.047750119119882584,
"kl": 0.0008222978794947267,
"learning_rate": 8.125000000000001e-07,
"loss": 0.0,
"num_tokens": 728552.0,
"reward": 1.4253430366516113,
"reward_std": 0.107511967420578,
"rewards/ROUGEL_entities_reward/mean": 0.40971803665161133,
"rewards/ROUGEL_entities_reward/std": 0.2035004198551178,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.015625,
"rewards/f1_entities_exact_reward/std": 0.0883883461356163,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 14
},
{
"completion_length": 796.71875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1999.0,
"completions/max_terminated_length": 1728.0,
"completions/mean_length": 797.6875,
"completions/mean_terminated_length": 758.9354858398438,
"completions/min_length": 447.0,
"completions/min_terminated_length": 447.0,
"epoch": 0.05859375,
"frac_reward_zero_std": 0.375,
"grad_norm": 1.1840251684188843,
"kl": 0.035019629169255495,
"learning_rate": 8.75e-07,
"loss": 0.0,
"num_tokens": 779450.0,
"reward": 1.8847320079803467,
"reward_std": 0.18553508818149567,
"rewards/ROUGEL_entities_reward/mean": 0.6347318887710571,
"rewards/ROUGEL_entities_reward/std": 0.24349310994148254,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.28125,
"rewards/f1_entities_exact_reward/std": 0.2520080506801605,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 15
},
{
"completion_length": 825.9375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1966.0,
"completions/max_terminated_length": 1966.0,
"completions/mean_length": 826.9375,
"completions/mean_terminated_length": 826.9375,
"completions/min_length": 346.0,
"completions/min_terminated_length": 346.0,
"epoch": 0.0625,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.03686046227812767,
"kl": 0.0009055825939867646,
"learning_rate": 9.375000000000001e-07,
"loss": 0.0,
"num_tokens": 830168.0,
"reward": 1.503725290298462,
"reward_std": 0.03653297573328018,
"rewards/ROUGEL_entities_reward/mean": 0.4412252902984619,
"rewards/ROUGEL_entities_reward/std": 0.18260407447814941,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 16
},
{
"completion_length": 831.65625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1710.0,
"completions/mean_length": 832.625,
"completions/mean_terminated_length": 793.4193115234375,
"completions/min_length": 442.0,
"completions/min_terminated_length": 442.0,
"epoch": 0.06640625,
"frac_reward_zero_std": 0.125,
"grad_norm": 11960.408203125,
"kl": 91286.23423358332,
"learning_rate": 1.0000000000000002e-06,
"loss": 91.2862,
"num_tokens": 882112.0,
"reward": 1.9998295307159424,
"reward_std": 0.1716785728931427,
"rewards/ROUGEL_entities_reward/mean": 0.6092044115066528,
"rewards/ROUGEL_entities_reward/std": 0.2381805032491684,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.265625,
"rewards/f1_entities_exact_reward/std": 0.3588596284389496,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 17
},
{
"completion_length": 735.09375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1963.0,
"completions/max_terminated_length": 1963.0,
"completions/mean_length": 736.09375,
"completions/mean_terminated_length": 736.09375,
"completions/min_length": 304.0,
"completions/min_terminated_length": 304.0,
"epoch": 0.0703125,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.035265810787677765,
"kl": 0.0008649405790492892,
"learning_rate": 1.0625e-06,
"loss": 0.0,
"num_tokens": 930435.0,
"reward": 1.6111576557159424,
"reward_std": 0.2122671902179718,
"rewards/ROUGEL_entities_reward/mean": 0.39240762591362,
"rewards/ROUGEL_entities_reward/std": 0.2360842227935791,
"rewards/answer_correctness_func/mean": 0.0625,
"rewards/answer_correctness_func/std": 0.24593468010425568,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.2961445748806,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 18
},
{
"completion_length": 929.3125,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2029.0,
"completions/mean_length": 930.28125,
"completions/mean_terminated_length": 894.2257690429688,
"completions/min_length": 385.0,
"completions/min_terminated_length": 385.0,
"epoch": 0.07421875,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.1916157007217407,
"kl": 0.026040656957775354,
"learning_rate": 1.125e-06,
"loss": 0.0,
"num_tokens": 986084.0,
"reward": 1.4042803049087524,
"reward_std": 0.2482759654521942,
"rewards/ROUGEL_entities_reward/mean": 0.40428024530410767,
"rewards/ROUGEL_entities_reward/std": 0.2555541396141052,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.03125,
"rewards/f1_entities_exact_reward/std": 0.12296734005212784,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 19
},
{
"completion_length": 858.53125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1999.0,
"completions/max_terminated_length": 1999.0,
"completions/mean_length": 859.53125,
"completions/mean_terminated_length": 859.53125,
"completions/min_length": 327.0,
"completions/min_terminated_length": 327.0,
"epoch": 0.078125,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.2272316217422485,
"kl": 0.04151263926178217,
"learning_rate": 1.1875e-06,
"loss": 0.0,
"num_tokens": 1038577.0,
"reward": 1.4781588315963745,
"reward_std": 0.09865100681781769,
"rewards/ROUGEL_entities_reward/mean": 0.3687838315963745,
"rewards/ROUGEL_entities_reward/std": 0.25713229179382324,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 20
},
{
"completion_length": 735.03125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1646.0,
"completions/max_terminated_length": 1646.0,
"completions/mean_length": 736.03125,
"completions/mean_terminated_length": 736.03125,
"completions/min_length": 370.0,
"completions/min_terminated_length": 370.0,
"epoch": 0.08203125,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.03574994206428528,
"kl": 0.0008639947773190215,
"learning_rate": 1.25e-06,
"loss": 0.0,
"num_tokens": 1087414.0,
"reward": 1.7493736743927002,
"reward_std": 0.3073810338973999,
"rewards/ROUGEL_entities_reward/mean": 0.5149986743927002,
"rewards/ROUGEL_entities_reward/std": 0.2595096230506897,
"rewards/answer_correctness_func/mean": 0.0625,
"rewards/answer_correctness_func/std": 0.24593468010425568,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.171875,
"rewards/f1_entities_exact_reward/std": 0.30078861117362976,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 21
},
{
"completion_length": 936.125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1829.0,
"completions/max_terminated_length": 1829.0,
"completions/mean_length": 937.125,
"completions/mean_terminated_length": 937.125,
"completions/min_length": 387.0,
"completions/min_terminated_length": 387.0,
"epoch": 0.0859375,
"frac_reward_zero_std": 0.375,
"grad_norm": 0.030881009995937347,
"kl": 0.0008643228356959298,
"learning_rate": 1.3125000000000001e-06,
"loss": 0.0,
"num_tokens": 1142902.0,
"reward": 1.4245872497558594,
"reward_std": 0.05940890312194824,
"rewards/ROUGEL_entities_reward/mean": 0.3933371901512146,
"rewards/ROUGEL_entities_reward/std": 0.23100200295448303,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.03125,
"rewards/f1_entities_exact_reward/std": 0.12296734005212784,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 22
},
{
"completion_length": 949.09375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1974.0,
"completions/max_terminated_length": 1957.0,
"completions/mean_length": 950.0625,
"completions/mean_terminated_length": 917.0322265625,
"completions/min_length": 358.0,
"completions/min_terminated_length": 358.0,
"epoch": 0.08984375,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.360364317893982,
"kl": 0.03316311351954937,
"learning_rate": 1.3750000000000002e-06,
"loss": 0.0,
"num_tokens": 1198068.0,
"reward": 1.4728868007659912,
"reward_std": 0.2027805596590042,
"rewards/ROUGEL_entities_reward/mean": 0.4260118901729584,
"rewards/ROUGEL_entities_reward/std": 0.26421165466308594,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 23
},
{
"completion_length": 983.4375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2043.0,
"completions/max_terminated_length": 2041.0,
"completions/mean_length": 984.40625,
"completions/mean_terminated_length": 950.258056640625,
"completions/min_length": 350.0,
"completions/min_terminated_length": 350.0,
"epoch": 0.09375,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.449867844581604,
"kl": 0.03517508413642645,
"learning_rate": 1.4375e-06,
"loss": 0.0,
"num_tokens": 1254353.0,
"reward": 1.5606844425201416,
"reward_std": 0.34358131885528564,
"rewards/ROUGEL_entities_reward/mean": 0.5138094425201416,
"rewards/ROUGEL_entities_reward/std": 0.24284419417381287,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.22840170562267303,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 24
},
{
"completion_length": 986.0625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1981.0,
"completions/max_terminated_length": 1877.0,
"completions/mean_length": 987.03125,
"completions/mean_terminated_length": 954.9677124023438,
"completions/min_length": 385.0,
"completions/min_terminated_length": 385.0,
"epoch": 0.09765625,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.7202436923980713,
"kl": 0.03029360854998231,
"learning_rate": 1.5e-06,
"loss": 0.0,
"num_tokens": 1311054.0,
"reward": 1.5542736053466797,
"reward_std": 0.2044057995080948,
"rewards/ROUGEL_entities_reward/mean": 0.4292736053466797,
"rewards/ROUGEL_entities_reward/std": 0.187626451253891,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.23546454310417175,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 25
},
{
"completion_length": 719.875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1817.0,
"completions/max_terminated_length": 1817.0,
"completions/mean_length": 720.875,
"completions/mean_terminated_length": 720.875,
"completions/min_length": 332.0,
"completions/min_terminated_length": 332.0,
"epoch": 0.1015625,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.04885788634419441,
"kl": 0.0009195755264954641,
"learning_rate": 1.5625e-06,
"loss": 0.0,
"num_tokens": 1359150.0,
"reward": 1.3275928497314453,
"reward_std": 0.05572877824306488,
"rewards/ROUGEL_entities_reward/mean": 0.3275929093360901,
"rewards/ROUGEL_entities_reward/std": 0.2175500988960266,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0,
"rewards/f1_entities_exact_reward/std": 0.0,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 26
},
{
"completion_length": 787.3125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1927.0,
"completions/max_terminated_length": 1927.0,
"completions/mean_length": 788.3125,
"completions/mean_terminated_length": 788.3125,
"completions/min_length": 346.0,
"completions/min_terminated_length": 346.0,
"epoch": 0.10546875,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.047234393656253815,
"kl": 0.0008445628191111609,
"learning_rate": 1.6250000000000001e-06,
"loss": -0.0,
"num_tokens": 1409184.0,
"reward": 1.6741223335266113,
"reward_std": 0.17429909110069275,
"rewards/ROUGEL_entities_reward/mean": 0.4397473633289337,
"rewards/ROUGEL_entities_reward/std": 0.2606096565723419,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.234375,
"rewards/f1_entities_exact_reward/std": 0.253503680229187,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 27
},
{
"completion_length": 908.09375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2037.0,
"completions/max_terminated_length": 1410.0,
"completions/mean_length": 909.0625,
"completions/mean_terminated_length": 872.6773681640625,
"completions/min_length": 436.0,
"completions/min_terminated_length": 436.0,
"epoch": 0.109375,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.1578987836837769,
"kl": 0.029024578165262938,
"learning_rate": 1.6875000000000001e-06,
"loss": 0.0,
"num_tokens": 1463198.0,
"reward": 1.3360178470611572,
"reward_std": 0.194834902882576,
"rewards/ROUGEL_entities_reward/mean": 0.3516428768634796,
"rewards/ROUGEL_entities_reward/std": 0.20796751976013184,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.015625,
"rewards/f1_entities_exact_reward/std": 0.0883883461356163,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 28
},
{
"completion_length": 877.6875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1722.0,
"completions/max_terminated_length": 1722.0,
"completions/mean_length": 878.6875,
"completions/mean_terminated_length": 878.6875,
"completions/min_length": 400.0,
"completions/min_terminated_length": 400.0,
"epoch": 0.11328125,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.036818020045757294,
"kl": 0.0008321568457176909,
"learning_rate": 1.75e-06,
"loss": 0.0,
"num_tokens": 1516328.0,
"reward": 1.284515619277954,
"reward_std": 0.10075192153453827,
"rewards/ROUGEL_entities_reward/mean": 0.2845155596733093,
"rewards/ROUGEL_entities_reward/std": 0.20700469613075256,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0,
"rewards/f1_entities_exact_reward/std": 0.0,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 29
},
{
"completion_length": 801.90625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1763.0,
"completions/max_terminated_length": 1763.0,
"completions/mean_length": 802.90625,
"completions/mean_terminated_length": 802.90625,
"completions/min_length": 354.0,
"completions/min_terminated_length": 354.0,
"epoch": 0.1171875,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.038571011275053024,
"kl": 0.0008754348091315478,
"learning_rate": 1.8125e-06,
"loss": -0.0,
"num_tokens": 1568001.0,
"reward": 1.3216490745544434,
"reward_std": 0.0878436490893364,
"rewards/ROUGEL_entities_reward/mean": 0.3216490149497986,
"rewards/ROUGEL_entities_reward/std": 0.12796050310134888,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0,
"rewards/f1_entities_exact_reward/std": 0.0,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 30
},
{
"completion_length": 1019.875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1994.0,
"completions/max_terminated_length": 1994.0,
"completions/mean_length": 1020.875,
"completions/mean_terminated_length": 1020.875,
"completions/min_length": 317.0,
"completions/min_terminated_length": 317.0,
"epoch": 0.12109375,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.9888184070587158,
"kl": 0.030457815155386925,
"learning_rate": 1.8750000000000003e-06,
"loss": 0.0,
"num_tokens": 1625681.0,
"reward": 1.6338975429534912,
"reward_std": 0.0996546596288681,
"rewards/ROUGEL_entities_reward/mean": 0.5245225429534912,
"rewards/ROUGEL_entities_reward/std": 0.1336575746536255,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 31
},
{
"completion_length": 778.8125,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1987.0,
"completions/max_terminated_length": 1386.0,
"completions/mean_length": 779.78125,
"completions/mean_terminated_length": 740.8386840820312,
"completions/min_length": 448.0,
"completions/min_terminated_length": 448.0,
"epoch": 0.125,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.4051024913787842,
"kl": 0.07832266436889768,
"learning_rate": 1.9375e-06,
"loss": 0.0001,
"num_tokens": 1676698.0,
"reward": 1.6515867710113525,
"reward_std": 0.36416906118392944,
"rewards/ROUGEL_entities_reward/mean": 0.4640866816043854,
"rewards/ROUGEL_entities_reward/std": 0.2700716555118561,
"rewards/answer_correctness_func/mean": 0.03125,
"rewards/answer_correctness_func/std": 0.1767766922712326,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.1875,
"rewards/f1_entities_exact_reward/std": 0.2767903506755829,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 32
},
{
"completion_length": 864.90625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2033.0,
"completions/max_terminated_length": 1989.0,
"completions/mean_length": 865.875,
"completions/mean_terminated_length": 828.2257690429688,
"completions/min_length": 376.0,
"completions/min_terminated_length": 376.0,
"epoch": 0.12890625,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.8691290616989136,
"kl": 0.03025655262172222,
"learning_rate": 2.0000000000000003e-06,
"loss": 0.0,
"num_tokens": 1729458.0,
"reward": 2.1252987384796143,
"reward_std": 0.5289393663406372,
"rewards/ROUGEL_entities_reward/mean": 0.5627987384796143,
"rewards/ROUGEL_entities_reward/std": 0.3745800256729126,
"rewards/answer_correctness_func/mean": 0.21875,
"rewards/answer_correctness_func/std": 0.420013427734375,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.40625,
"rewards/f1_entities_exact_reward/std": 0.39015090465545654,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.03125,
"rewards/reasoning_equal_answer_reward/std": 0.1767766922712326,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 33
},
{
"completion_length": 879.28125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1759.0,
"completions/max_terminated_length": 1759.0,
"completions/mean_length": 880.28125,
"completions/mean_terminated_length": 880.28125,
"completions/min_length": 382.0,
"completions/min_terminated_length": 382.0,
"epoch": 0.1328125,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.03191771358251572,
"kl": 0.0008378682687180117,
"learning_rate": 2.0625e-06,
"loss": 0.0,
"num_tokens": 1782827.0,
"reward": 1.4557617902755737,
"reward_std": 0.16580641269683838,
"rewards/ROUGEL_entities_reward/mean": 0.34638676047325134,
"rewards/ROUGEL_entities_reward/std": 0.18016280233860016,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 34
},
{
"completion_length": 895.1875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1836.0,
"completions/max_terminated_length": 1836.0,
"completions/mean_length": 896.1875,
"completions/mean_terminated_length": 896.1875,
"completions/min_length": 386.0,
"completions/min_terminated_length": 386.0,
"epoch": 0.13671875,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.0351351797580719,
"kl": 0.0007743473688606173,
"learning_rate": 2.125e-06,
"loss": 0.0,
"num_tokens": 1836317.0,
"reward": 1.3723011016845703,
"reward_std": 0.15460538864135742,
"rewards/ROUGEL_entities_reward/mean": 0.3410511016845703,
"rewards/ROUGEL_entities_reward/std": 0.2375221699476242,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.03125,
"rewards/f1_entities_exact_reward/std": 0.12296734005212784,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 35
},
{
"completion_length": 814.5625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1464.0,
"completions/max_terminated_length": 1464.0,
"completions/mean_length": 815.5625,
"completions/mean_terminated_length": 815.5625,
"completions/min_length": 358.0,
"completions/min_terminated_length": 358.0,
"epoch": 0.140625,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.03838350996375084,
"kl": 0.0008724646613700315,
"learning_rate": 2.1875000000000002e-06,
"loss": 0.0,
"num_tokens": 1887779.0,
"reward": 1.421027660369873,
"reward_std": 0.08938203752040863,
"rewards/ROUGEL_entities_reward/mean": 0.35852763056755066,
"rewards/ROUGEL_entities_reward/std": 0.1610291451215744,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 36
},
{
"completion_length": 1043.9375,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 1966.0,
"completions/max_terminated_length": 1925.0,
"completions/mean_length": 1044.84375,
"completions/mean_terminated_length": 949.5516967773438,
"completions/min_length": 361.0,
"completions/min_terminated_length": 361.0,
"epoch": 0.14453125,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.3164830207824707,
"kl": 0.036185771226882935,
"learning_rate": 2.25e-06,
"loss": 0.0,
"num_tokens": 1946890.0,
"reward": 1.2239865064620972,
"reward_std": 0.13413795828819275,
"rewards/ROUGEL_entities_reward/mean": 0.25523650646209717,
"rewards/ROUGEL_entities_reward/std": 0.20075830817222595,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 37
},
{
"completion_length": 1095.15625,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2012.0,
"completions/max_terminated_length": 1988.0,
"completions/mean_length": 1096.09375,
"completions/mean_terminated_length": 1035.033447265625,
"completions/min_length": 349.0,
"completions/min_terminated_length": 349.0,
"epoch": 0.1484375,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.7715964317321777,
"kl": 0.047803448513150215,
"learning_rate": 2.3125000000000003e-06,
"loss": 0.0,
"num_tokens": 2007529.0,
"reward": 1.219300389289856,
"reward_std": 0.209647536277771,
"rewards/ROUGEL_entities_reward/mean": 0.26617541909217834,
"rewards/ROUGEL_entities_reward/std": 0.19572654366493225,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.015625,
"rewards/f1_entities_exact_reward/std": 0.0883883461356163,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 38
},
{
"completion_length": 875.125,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2025.0,
"completions/max_terminated_length": 1905.0,
"completions/mean_length": 876.0625,
"completions/mean_terminated_length": 799.4667358398438,
"completions/min_length": 383.0,
"completions/min_terminated_length": 383.0,
"epoch": 0.15234375,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.2576082944869995,
"kl": 0.028566114604473114,
"learning_rate": 2.375e-06,
"loss": 0.0,
"num_tokens": 2061255.0,
"reward": 1.543312430381775,
"reward_std": 0.20425739884376526,
"rewards/ROUGEL_entities_reward/mean": 0.4026874303817749,
"rewards/ROUGEL_entities_reward/std": 0.3158787488937378,
"rewards/answer_correctness_func/mean": 0.03125,
"rewards/answer_correctness_func/std": 0.1767766922712326,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.24542178213596344,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 39
},
{
"completion_length": 868.09375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1850.0,
"completions/max_terminated_length": 1850.0,
"completions/mean_length": 869.09375,
"completions/mean_terminated_length": 869.09375,
"completions/min_length": 423.0,
"completions/min_terminated_length": 423.0,
"epoch": 0.15625,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.04050038754940033,
"kl": 0.0008488351159030572,
"learning_rate": 2.4375e-06,
"loss": 0.0,
"num_tokens": 2114910.0,
"reward": 1.5773019790649414,
"reward_std": 0.2809327244758606,
"rewards/ROUGEL_entities_reward/mean": 0.4054270386695862,
"rewards/ROUGEL_entities_reward/std": 0.21998822689056396,
"rewards/answer_correctness_func/mean": 0.03125,
"rewards/answer_correctness_func/std": 0.1767766922712326,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.26133573055267334,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 40
},
{
"completion_length": 746.125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1475.0,
"completions/max_terminated_length": 1475.0,
"completions/mean_length": 747.125,
"completions/mean_terminated_length": 747.125,
"completions/min_length": 311.0,
"completions/min_terminated_length": 311.0,
"epoch": 0.16015625,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.0397828109562397,
"kl": 0.0009731970203574747,
"learning_rate": 2.5e-06,
"loss": 0.0,
"num_tokens": 2164246.0,
"reward": 1.9008541107177734,
"reward_std": 0.07794724404811859,
"rewards/ROUGEL_entities_reward/mean": 0.525854229927063,
"rewards/ROUGEL_entities_reward/std": 0.27729788422584534,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.25,
"rewards/f1_entities_exact_reward/std": 0.3592106103897095,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 41
},
{
"completion_length": 960.84375,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 1977.0,
"completions/max_terminated_length": 1768.0,
"completions/mean_length": 961.78125,
"completions/mean_terminated_length": 894.1000366210938,
"completions/min_length": 357.0,
"completions/min_terminated_length": 357.0,
"epoch": 0.1640625,
"frac_reward_zero_std": 0.375,
"grad_norm": 1.2776288986206055,
"kl": 0.0984850749373436,
"learning_rate": 2.5625e-06,
"loss": 0.0001,
"num_tokens": 2220687.0,
"reward": 1.3761751651763916,
"reward_std": 0.03425034135580063,
"rewards/ROUGEL_entities_reward/mean": 0.3136751055717468,
"rewards/ROUGEL_entities_reward/std": 0.21004539728164673,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 42
},
{
"completion_length": 781.8125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1453.0,
"completions/max_terminated_length": 1453.0,
"completions/mean_length": 782.8125,
"completions/mean_terminated_length": 782.8125,
"completions/min_length": 352.0,
"completions/min_terminated_length": 352.0,
"epoch": 0.16796875,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.04102746397256851,
"kl": 0.0008047504670685157,
"learning_rate": 2.6250000000000003e-06,
"loss": 0.0,
"num_tokens": 2271929.0,
"reward": 1.3647174835205078,
"reward_std": 0.1334415078163147,
"rewards/ROUGEL_entities_reward/mean": 0.3334674835205078,
"rewards/ROUGEL_entities_reward/std": 0.18400724232196808,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.03125,
"rewards/f1_entities_exact_reward/std": 0.12296734005212784,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 43
},
{
"completion_length": 866.65625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1973.0,
"completions/max_terminated_length": 1473.0,
"completions/mean_length": 867.625,
"completions/mean_terminated_length": 831.9677124023438,
"completions/min_length": 309.0,
"completions/min_terminated_length": 309.0,
"epoch": 0.171875,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.03564456105232239,
"kl": 0.0008104472508421168,
"learning_rate": 2.6875e-06,
"loss": 0.0,
"num_tokens": 2324513.0,
"reward": 1.3380478620529175,
"reward_std": 0.16338998079299927,
"rewards/ROUGEL_entities_reward/mean": 0.35367289185523987,
"rewards/ROUGEL_entities_reward/std": 0.2080492079257965,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.015625,
"rewards/f1_entities_exact_reward/std": 0.0883883461356163,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 44
},
{
"completion_length": 988.65625,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2024.0,
"completions/mean_length": 989.59375,
"completions/mean_terminated_length": 919.0333862304688,
"completions/min_length": 364.0,
"completions/min_terminated_length": 364.0,
"epoch": 0.17578125,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.3289203643798828,
"kl": 0.05466066673398018,
"learning_rate": 2.7500000000000004e-06,
"loss": 0.0001,
"num_tokens": 2380596.0,
"reward": 1.4342949390411377,
"reward_std": 0.20128795504570007,
"rewards/ROUGEL_entities_reward/mean": 0.4030449390411377,
"rewards/ROUGEL_entities_reward/std": 0.30489441752433777,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.125,
"rewards/f1_entities_exact_reward/std": 0.2199706733226776,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 45
},
{
"completion_length": 777.96875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1422.0,
"completions/max_terminated_length": 1422.0,
"completions/mean_length": 778.96875,
"completions/mean_terminated_length": 778.96875,
"completions/min_length": 333.0,
"completions/min_terminated_length": 333.0,
"epoch": 0.1796875,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.029138894751667976,
"kl": 0.0008950835035648197,
"learning_rate": 2.8125e-06,
"loss": -0.0,
"num_tokens": 2430763.0,
"reward": 1.6776609420776367,
"reward_std": 0.07827550172805786,
"rewards/ROUGEL_entities_reward/mean": 0.39641106128692627,
"rewards/ROUGEL_entities_reward/std": 0.31618690490722656,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.3463519513607025,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 46
},
{
"completion_length": 902.59375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1909.0,
"completions/max_terminated_length": 1909.0,
"completions/mean_length": 903.59375,
"completions/mean_terminated_length": 903.59375,
"completions/min_length": 351.0,
"completions/min_terminated_length": 351.0,
"epoch": 0.18359375,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.03316575661301613,
"kl": 0.00084034533938393,
"learning_rate": 2.875e-06,
"loss": 0.0,
"num_tokens": 2484606.0,
"reward": 1.7022205591201782,
"reward_std": 0.11596342921257019,
"rewards/ROUGEL_entities_reward/mean": 0.48347052931785583,
"rewards/ROUGEL_entities_reward/std": 0.2657451033592224,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.21875,
"rewards/f1_entities_exact_reward/std": 0.2520080506801605,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 47
},
{
"completion_length": 1063.3125,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2045.0,
"completions/max_terminated_length": 2010.0,
"completions/mean_length": 1064.28125,
"completions/mean_terminated_length": 1032.6451416015625,
"completions/min_length": 400.0,
"completions/min_terminated_length": 400.0,
"epoch": 0.1875,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.315568208694458,
"kl": 0.024940223898738623,
"learning_rate": 2.9375000000000003e-06,
"loss": 0.0,
"num_tokens": 2543507.0,
"reward": 1.312612771987915,
"reward_std": 0.3253900706768036,
"rewards/ROUGEL_entities_reward/mean": 0.37511277198791504,
"rewards/ROUGEL_entities_reward/std": 0.2815242409706116,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.875,
"rewards/answer_format_func/std": 0.33601075410842896,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 48
},
{
"completion_length": 790.40625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1731.0,
"completions/max_terminated_length": 1731.0,
"completions/mean_length": 791.40625,
"completions/mean_terminated_length": 791.40625,
"completions/min_length": 364.0,
"completions/min_terminated_length": 364.0,
"epoch": 0.19140625,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.035357240587472916,
"kl": 0.0008986674947664142,
"learning_rate": 3e-06,
"loss": 0.0,
"num_tokens": 2593784.0,
"reward": 1.768296718597412,
"reward_std": 0.20734211802482605,
"rewards/ROUGEL_entities_reward/mean": 0.5182968378067017,
"rewards/ROUGEL_entities_reward/std": 0.13581332564353943,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.234375,
"rewards/f1_entities_exact_reward/std": 0.253503680229187,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 49
},
{
"completion_length": 876.4375,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 1978.0,
"completions/max_terminated_length": 1407.0,
"completions/mean_length": 877.375,
"completions/mean_terminated_length": 804.0000610351562,
"completions/min_length": 455.0,
"completions/min_terminated_length": 455.0,
"epoch": 0.1953125,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.03194103017449379,
"kl": 0.0008543854783056304,
"learning_rate": 3.0625000000000003e-06,
"loss": 0.0,
"num_tokens": 2646016.0,
"reward": 1.638135313987732,
"reward_std": 0.2261456400156021,
"rewards/ROUGEL_entities_reward/mean": 0.5443853735923767,
"rewards/ROUGEL_entities_reward/std": 0.273754358291626,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.23546454310417175,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 50
},
{
"completion_length": 1074.90625,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1955.0,
"completions/mean_length": 1075.84375,
"completions/mean_terminated_length": 1011.0333862304688,
"completions/min_length": 381.0,
"completions/min_terminated_length": 381.0,
"epoch": 0.19921875,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.0201319456100464,
"kl": 0.022831523790955544,
"learning_rate": 3.125e-06,
"loss": 0.0,
"num_tokens": 2706399.0,
"reward": 1.462364673614502,
"reward_std": 0.28029900789260864,
"rewards/ROUGEL_entities_reward/mean": 0.43111473321914673,
"rewards/ROUGEL_entities_reward/std": 0.30877652764320374,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.125,
"rewards/f1_entities_exact_reward/std": 0.2199706733226776,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 51
},
{
"completion_length": 780.90625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1876.0,
"completions/max_terminated_length": 1876.0,
"completions/mean_length": 781.90625,
"completions/mean_terminated_length": 781.90625,
"completions/min_length": 334.0,
"completions/min_terminated_length": 334.0,
"epoch": 0.203125,
"frac_reward_zero_std": 0.375,
"grad_norm": 0.02633880078792572,
"kl": 0.0008717684831935912,
"learning_rate": 3.1875e-06,
"loss": 0.0,
"num_tokens": 2757124.0,
"reward": 1.4692744016647339,
"reward_std": 0.10760265588760376,
"rewards/ROUGEL_entities_reward/mean": 0.3911494016647339,
"rewards/ROUGEL_entities_reward/std": 0.3299289047718048,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.078125,
"rewards/f1_entities_exact_reward/std": 0.18445101380348206,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 52
},
{
"completion_length": 1000.21875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2009.0,
"completions/max_terminated_length": 1990.0,
"completions/mean_length": 1001.1875,
"completions/mean_terminated_length": 968.6773681640625,
"completions/min_length": 390.0,
"completions/min_terminated_length": 390.0,
"epoch": 0.20703125,
"frac_reward_zero_std": 0.125,
"grad_norm": 43595.1640625,
"kl": 663661.0216736235,
"learning_rate": 3.2500000000000002e-06,
"loss": 663.6611,
"num_tokens": 2814698.0,
"reward": 1.6129716634750366,
"reward_std": 0.34194862842559814,
"rewards/ROUGEL_entities_reward/mean": 0.4723466634750366,
"rewards/ROUGEL_entities_reward/std": 0.20310600101947784,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.203125,
"rewards/f1_entities_exact_reward/std": 0.24949544668197632,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 53
},
{
"completion_length": 788.65625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1430.0,
"completions/max_terminated_length": 1430.0,
"completions/mean_length": 789.65625,
"completions/mean_terminated_length": 789.65625,
"completions/min_length": 357.0,
"completions/min_terminated_length": 357.0,
"epoch": 0.2109375,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.04156388342380524,
"kl": 0.0008590234210714698,
"learning_rate": 3.3125e-06,
"loss": 0.0,
"num_tokens": 2864779.0,
"reward": 1.5036687850952148,
"reward_std": 0.18333800137043,
"rewards/ROUGEL_entities_reward/mean": 0.37866872549057007,
"rewards/ROUGEL_entities_reward/std": 0.2451113909482956,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 54
},
{
"completion_length": 878.78125,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1694.0,
"completions/mean_length": 879.71875,
"completions/mean_terminated_length": 801.8333740234375,
"completions/min_length": 381.0,
"completions/min_terminated_length": 381.0,
"epoch": 0.21484375,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.253060221672058,
"kl": 0.028678589966148138,
"learning_rate": 3.3750000000000003e-06,
"loss": 0.0,
"num_tokens": 2917394.0,
"reward": 1.5075453519821167,
"reward_std": 0.21901844441890717,
"rewards/ROUGEL_entities_reward/mean": 0.4137953519821167,
"rewards/ROUGEL_entities_reward/std": 0.25585466623306274,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.23546454310417175,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 55
},
{
"completion_length": 881.03125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1655.0,
"completions/max_terminated_length": 1655.0,
"completions/mean_length": 882.03125,
"completions/mean_terminated_length": 882.03125,
"completions/min_length": 391.0,
"completions/min_terminated_length": 391.0,
"epoch": 0.21875,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.031581878662109375,
"kl": 0.0007841893821023405,
"learning_rate": 3.4375e-06,
"loss": 0.0,
"num_tokens": 2970251.0,
"reward": 1.5474133491516113,
"reward_std": 0.11733610183000565,
"rewards/ROUGEL_entities_reward/mean": 0.39116325974464417,
"rewards/ROUGEL_entities_reward/std": 0.24231143295764923,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.22840170562267303,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 56
},
{
"completion_length": 745.90625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1596.0,
"completions/max_terminated_length": 1596.0,
"completions/mean_length": 746.90625,
"completions/mean_terminated_length": 746.90625,
"completions/min_length": 392.0,
"completions/min_terminated_length": 392.0,
"epoch": 0.22265625,
"frac_reward_zero_std": 0.375,
"grad_norm": 0.031546663492918015,
"kl": 0.0008624131296528503,
"learning_rate": 3.5e-06,
"loss": 0.0,
"num_tokens": 3018128.0,
"reward": 1.8776674270629883,
"reward_std": 0.16294483840465546,
"rewards/ROUGEL_entities_reward/mean": 0.44016748666763306,
"rewards/ROUGEL_entities_reward/std": 0.273531973361969,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.328125,
"rewards/f1_entities_exact_reward/std": 0.35033106803894043,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 57
},
{
"completion_length": 946.9375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1982.0,
"completions/mean_length": 947.90625,
"completions/mean_terminated_length": 912.4193115234375,
"completions/min_length": 423.0,
"completions/min_terminated_length": 423.0,
"epoch": 0.2265625,
"frac_reward_zero_std": 0.5,
"grad_norm": 1.0758155584335327,
"kl": 0.02901648124679923,
"learning_rate": 3.5625e-06,
"loss": 0.0,
"num_tokens": 3073333.0,
"reward": 1.6864192485809326,
"reward_std": 0.24523183703422546,
"rewards/ROUGEL_entities_reward/mean": 0.46766918897628784,
"rewards/ROUGEL_entities_reward/std": 0.30791956186294556,
"rewards/answer_correctness_func/mean": 0.03125,
"rewards/answer_correctness_func/std": 0.1767766922712326,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.21875,
"rewards/f1_entities_exact_reward/std": 0.2822004556655884,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 58
},
{
"completion_length": 844.34375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1750.0,
"completions/mean_length": 845.3125,
"completions/mean_terminated_length": 806.51611328125,
"completions/min_length": 381.0,
"completions/min_terminated_length": 381.0,
"epoch": 0.23046875,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.611671805381775,
"kl": 0.027586993295699358,
"learning_rate": 3.625e-06,
"loss": 0.0,
"num_tokens": 3125323.0,
"reward": 1.3790805339813232,
"reward_std": 0.17383891344070435,
"rewards/ROUGEL_entities_reward/mean": 0.36345553398132324,
"rewards/ROUGEL_entities_reward/std": 0.22647835314273834,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.046875,
"rewards/f1_entities_exact_reward/std": 0.1480722874403,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 59
},
{
"completion_length": 788.65625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2002.0,
"completions/max_terminated_length": 1931.0,
"completions/mean_length": 789.625,
"completions/mean_terminated_length": 750.51611328125,
"completions/min_length": 318.0,
"completions/min_terminated_length": 318.0,
"epoch": 0.234375,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.4535969495773315,
"kl": 0.2797043500468135,
"learning_rate": 3.6875000000000007e-06,
"loss": 0.0003,
"num_tokens": 3175763.0,
"reward": 1.3903493881225586,
"reward_std": 0.27898839116096497,
"rewards/ROUGEL_entities_reward/mean": 0.4215993881225586,
"rewards/ROUGEL_entities_reward/std": 0.2551148533821106,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.015625,
"rewards/f1_entities_exact_reward/std": 0.0883883461356163,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 60
},
{
"completion_length": 792.71875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1667.0,
"completions/max_terminated_length": 1667.0,
"completions/mean_length": 793.71875,
"completions/mean_terminated_length": 793.71875,
"completions/min_length": 384.0,
"completions/min_terminated_length": 384.0,
"epoch": 0.23828125,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.04302690178155899,
"kl": 0.0008610641962150112,
"learning_rate": 3.7500000000000005e-06,
"loss": 0.0,
"num_tokens": 3225790.0,
"reward": 1.4344795942306519,
"reward_std": 0.1498142033815384,
"rewards/ROUGEL_entities_reward/mean": 0.37197959423065186,
"rewards/ROUGEL_entities_reward/std": 0.15754859149456024,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 61
},
{
"completion_length": 933.84375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1850.0,
"completions/max_terminated_length": 1850.0,
"completions/mean_length": 934.84375,
"completions/mean_terminated_length": 934.84375,
"completions/min_length": 319.0,
"completions/min_terminated_length": 319.0,
"epoch": 0.2421875,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.0374126136302948,
"kl": 0.0008230292587541044,
"learning_rate": 3.8125e-06,
"loss": 0.0,
"num_tokens": 3281141.0,
"reward": 1.545864462852478,
"reward_std": 0.2267509251832962,
"rewards/ROUGEL_entities_reward/mean": 0.436489462852478,
"rewards/ROUGEL_entities_reward/std": 0.22274264693260193,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 62
},
{
"completion_length": 726.625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1713.0,
"completions/max_terminated_length": 1713.0,
"completions/mean_length": 727.625,
"completions/mean_terminated_length": 727.625,
"completions/min_length": 424.0,
"completions/min_terminated_length": 424.0,
"epoch": 0.24609375,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.036695897579193115,
"kl": 0.0008863469702191651,
"learning_rate": 3.875e-06,
"loss": 0.0,
"num_tokens": 3329261.0,
"reward": 1.291222095489502,
"reward_std": 0.0680345669388771,
"rewards/ROUGEL_entities_reward/mean": 0.29122209548950195,
"rewards/ROUGEL_entities_reward/std": 0.18511660397052765,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0,
"rewards/f1_entities_exact_reward/std": 0.0,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 63
},
{
"completion_length": 770.03125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1912.0,
"completions/max_terminated_length": 1912.0,
"completions/mean_length": 771.03125,
"completions/mean_terminated_length": 771.03125,
"completions/min_length": 407.0,
"completions/min_terminated_length": 407.0,
"epoch": 0.25,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.3695529699325562,
"kl": 0.027544385753571987,
"learning_rate": 3.9375e-06,
"loss": 0.0,
"num_tokens": 3380906.0,
"reward": 1.7645435333251953,
"reward_std": 0.2773824632167816,
"rewards/ROUGEL_entities_reward/mean": 0.4520435929298401,
"rewards/ROUGEL_entities_reward/std": 0.3055833876132965,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.1875,
"rewards/f1_entities_exact_reward/std": 0.3535533845424652,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 64
},
{
"completion_length": 1081.59375,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2006.0,
"completions/mean_length": 1082.53125,
"completions/mean_terminated_length": 1018.166748046875,
"completions/min_length": 408.0,
"completions/min_terminated_length": 408.0,
"epoch": 0.25390625,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.2219723463058472,
"kl": 0.02520414860919118,
"learning_rate": 4.000000000000001e-06,
"loss": 0.0,
"num_tokens": 3440707.0,
"reward": 1.6349719762802124,
"reward_std": 0.21872639656066895,
"rewards/ROUGEL_entities_reward/mean": 0.3849719166755676,
"rewards/ROUGEL_entities_reward/std": 0.29507917165756226,
"rewards/answer_correctness_func/mean": 0.09375,
"rewards/answer_correctness_func/std": 0.2961445748806,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.15625,
"rewards/f1_entities_exact_reward/std": 0.3222276270389557,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 65
},
{
"completion_length": 845.25,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1681.0,
"completions/max_terminated_length": 1681.0,
"completions/mean_length": 846.25,
"completions/mean_terminated_length": 846.25,
"completions/min_length": 424.0,
"completions/min_terminated_length": 424.0,
"epoch": 0.2578125,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.03518102690577507,
"kl": 0.0008721806952962652,
"learning_rate": 4.0625000000000005e-06,
"loss": 0.0,
"num_tokens": 3491951.0,
"reward": 1.4318032264709473,
"reward_std": 0.09064435213804245,
"rewards/ROUGEL_entities_reward/mean": 0.3380531668663025,
"rewards/ROUGEL_entities_reward/std": 0.1920674592256546,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.09375,
"rewards/f1_entities_exact_reward/std": 0.19827888906002045,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 66
},
{
"completion_length": 765.75,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2019.0,
"completions/max_terminated_length": 1752.0,
"completions/mean_length": 766.71875,
"completions/mean_terminated_length": 726.3225708007812,
"completions/min_length": 420.0,
"completions/min_terminated_length": 420.0,
"epoch": 0.26171875,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.3443408012390137,
"kl": 0.02946723997592926,
"learning_rate": 4.125e-06,
"loss": 0.0,
"num_tokens": 3540814.0,
"reward": 1.4851843118667603,
"reward_std": 0.2511700689792633,
"rewards/ROUGEL_entities_reward/mean": 0.39143434166908264,
"rewards/ROUGEL_entities_reward/std": 0.2150370329618454,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 67
},
{
"completion_length": 735.9375,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 1953.0,
"completions/max_terminated_length": 1662.0,
"completions/mean_length": 736.875,
"completions/mean_terminated_length": 655.800048828125,
"completions/min_length": 288.0,
"completions/min_terminated_length": 288.0,
"epoch": 0.265625,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.547475814819336,
"kl": 0.08277505822479725,
"learning_rate": 4.1875e-06,
"loss": 0.0001,
"num_tokens": 3590206.0,
"reward": 1.3710753917694092,
"reward_std": 0.2990349233150482,
"rewards/ROUGEL_entities_reward/mean": 0.3710753619670868,
"rewards/ROUGEL_entities_reward/std": 0.2627098858356476,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 68
},
{
"completion_length": 855.09375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2037.0,
"completions/max_terminated_length": 1856.0,
"completions/mean_length": 856.0625,
"completions/mean_terminated_length": 817.9677124023438,
"completions/min_length": 355.0,
"completions/min_terminated_length": 355.0,
"epoch": 0.26953125,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.1259685754776,
"kl": 0.035014061257243156,
"learning_rate": 4.25e-06,
"loss": 0.0,
"num_tokens": 3642256.0,
"reward": 1.4482572078704834,
"reward_std": 0.20823946595191956,
"rewards/ROUGEL_entities_reward/mean": 0.401382178068161,
"rewards/ROUGEL_entities_reward/std": 0.30484357476234436,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 69
},
{
"completion_length": 891.4375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1997.0,
"completions/mean_length": 892.40625,
"completions/mean_terminated_length": 855.1290283203125,
"completions/min_length": 381.0,
"completions/min_terminated_length": 381.0,
"epoch": 0.2734375,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.9959722757339478,
"kl": 0.0265270434319973,
"learning_rate": 4.312500000000001e-06,
"loss": 0.0,
"num_tokens": 3695461.0,
"reward": 1.6611111164093018,
"reward_std": 0.3453267514705658,
"rewards/ROUGEL_entities_reward/mean": 0.47361117601394653,
"rewards/ROUGEL_entities_reward/std": 0.28843188285827637,
"rewards/answer_correctness_func/mean": 0.03125,
"rewards/answer_correctness_func/std": 0.1767766922712326,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.1875,
"rewards/f1_entities_exact_reward/std": 0.2767903506755829,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 70
},
{
"completion_length": 982.875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1874.0,
"completions/max_terminated_length": 1648.0,
"completions/mean_length": 983.84375,
"completions/mean_terminated_length": 955.1290283203125,
"completions/min_length": 416.0,
"completions/min_terminated_length": 416.0,
"epoch": 0.27734375,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.029792383313179016,
"kl": 0.0008207843056879938,
"learning_rate": 4.3750000000000005e-06,
"loss": 0.0,
"num_tokens": 3752536.0,
"reward": 1.3520866632461548,
"reward_std": 0.18100523948669434,
"rewards/ROUGEL_entities_reward/mean": 0.3364616632461548,
"rewards/ROUGEL_entities_reward/std": 0.24795283377170563,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.046875,
"rewards/f1_entities_exact_reward/std": 0.1480722874403,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 71
},
{
"completion_length": 850.21875,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 1926.0,
"completions/max_terminated_length": 1693.0,
"completions/mean_length": 851.125,
"completions/mean_terminated_length": 739.9310302734375,
"completions/min_length": 361.0,
"completions/min_terminated_length": 361.0,
"epoch": 0.28125,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.03854809328913689,
"kl": 0.0008960039122030139,
"learning_rate": 4.4375e-06,
"loss": 0.0,
"num_tokens": 3805416.0,
"reward": 1.6687471866607666,
"reward_std": 0.14818844199180603,
"rewards/ROUGEL_entities_reward/mean": 0.4656221270561218,
"rewards/ROUGEL_entities_reward/std": 0.2874893844127655,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.3415895998477936,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 72
},
{
"completion_length": 988.78125,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2010.0,
"completions/max_terminated_length": 1971.0,
"completions/mean_length": 989.75,
"completions/mean_terminated_length": 956.8386840820312,
"completions/min_length": 362.0,
"completions/min_terminated_length": 362.0,
"epoch": 0.28515625,
"frac_reward_zero_std": 0.0,
"grad_norm": 4.410595893859863,
"kl": 1.133633098565042,
"learning_rate": 4.5e-06,
"loss": 0.0011,
"num_tokens": 3862068.0,
"reward": 1.9691169261932373,
"reward_std": 0.5512886643409729,
"rewards/ROUGEL_entities_reward/mean": 0.6253669261932373,
"rewards/ROUGEL_entities_reward/std": 0.2584879398345947,
"rewards/answer_correctness_func/mean": 0.0625,
"rewards/answer_correctness_func/std": 0.24593468010425568,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.3125,
"rewards/f1_entities_exact_reward/std": 0.3045355975627899,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 73
},
{
"completion_length": 775.59375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1774.0,
"completions/max_terminated_length": 1774.0,
"completions/mean_length": 776.59375,
"completions/mean_terminated_length": 776.59375,
"completions/min_length": 398.0,
"completions/min_terminated_length": 398.0,
"epoch": 0.2890625,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.040159571915864944,
"kl": 0.0008282668277388439,
"learning_rate": 4.5625e-06,
"loss": 0.0,
"num_tokens": 3911955.0,
"reward": 1.3375033140182495,
"reward_std": 0.1888979822397232,
"rewards/ROUGEL_entities_reward/mean": 0.3375033736228943,
"rewards/ROUGEL_entities_reward/std": 0.24318675696849823,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.03125,
"rewards/f1_entities_exact_reward/std": 0.12296734005212784,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 74
},
{
"completion_length": 897.1875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2032.0,
"completions/max_terminated_length": 1929.0,
"completions/mean_length": 898.15625,
"completions/mean_terminated_length": 861.5806274414062,
"completions/min_length": 332.0,
"completions/min_terminated_length": 332.0,
"epoch": 0.29296875,
"frac_reward_zero_std": 0.375,
"grad_norm": 1.2010027170181274,
"kl": 0.024983107578009367,
"learning_rate": 4.625000000000001e-06,
"loss": 0.0,
"num_tokens": 3965664.0,
"reward": 1.5350582599639893,
"reward_std": 0.11854691803455353,
"rewards/ROUGEL_entities_reward/mean": 0.4413083791732788,
"rewards/ROUGEL_entities_reward/std": 0.26900914311408997,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.125,
"rewards/f1_entities_exact_reward/std": 0.2199706733226776,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 75
},
{
"completion_length": 752.875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1311.0,
"completions/mean_length": 753.84375,
"completions/mean_terminated_length": 712.0967407226562,
"completions/min_length": 415.0,
"completions/min_terminated_length": 415.0,
"epoch": 0.296875,
"frac_reward_zero_std": 0.375,
"grad_norm": 1.3387047052383423,
"kl": 0.027603973634541035,
"learning_rate": 4.6875000000000004e-06,
"loss": 0.0,
"num_tokens": 4014499.0,
"reward": 1.4758903980255127,
"reward_std": 0.1006816178560257,
"rewards/ROUGEL_entities_reward/mean": 0.36651527881622314,
"rewards/ROUGEL_entities_reward/std": 0.25629162788391113,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 76
},
{
"completion_length": 687.625,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1556.0,
"completions/max_terminated_length": 1556.0,
"completions/mean_length": 688.625,
"completions/mean_terminated_length": 688.625,
"completions/min_length": 360.0,
"completions/min_terminated_length": 360.0,
"epoch": 0.30078125,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.04233290255069733,
"kl": 0.0008787867118371651,
"learning_rate": 4.75e-06,
"loss": 0.0,
"num_tokens": 4062459.0,
"reward": 1.5820362567901611,
"reward_std": 0.13097786903381348,
"rewards/ROUGEL_entities_reward/mean": 0.45703619718551636,
"rewards/ROUGEL_entities_reward/std": 0.1624954342842102,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.125,
"rewards/f1_entities_exact_reward/std": 0.2199706733226776,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 77
},
{
"completion_length": 903.1875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1803.0,
"completions/mean_length": 904.15625,
"completions/mean_terminated_length": 867.258056640625,
"completions/min_length": 432.0,
"completions/min_terminated_length": 432.0,
"epoch": 0.3046875,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.5431634187698364,
"kl": 0.029040120542049408,
"learning_rate": 4.8125e-06,
"loss": 0.0,
"num_tokens": 4116424.0,
"reward": 1.3482718467712402,
"reward_std": 0.0755050778388977,
"rewards/ROUGEL_entities_reward/mean": 0.285771906375885,
"rewards/ROUGEL_entities_reward/std": 0.2148081213235855,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 78
},
{
"completion_length": 971.6875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2025.0,
"completions/max_terminated_length": 2020.0,
"completions/mean_length": 972.65625,
"completions/mean_terminated_length": 938.7096557617188,
"completions/min_length": 306.0,
"completions/min_terminated_length": 306.0,
"epoch": 0.30859375,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.578683614730835,
"kl": 0.02796661714091897,
"learning_rate": 4.875e-06,
"loss": 0.0,
"num_tokens": 4173029.0,
"reward": 1.6396772861480713,
"reward_std": 0.513664960861206,
"rewards/ROUGEL_entities_reward/mean": 0.4365522861480713,
"rewards/ROUGEL_entities_reward/std": 0.2955634593963623,
"rewards/answer_correctness_func/mean": 0.0625,
"rewards/answer_correctness_func/std": 0.24593468010425568,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.1875,
"rewards/f1_entities_exact_reward/std": 0.3045355975627899,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 79
},
{
"completion_length": 735.53125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1546.0,
"completions/max_terminated_length": 1546.0,
"completions/mean_length": 736.53125,
"completions/mean_terminated_length": 736.53125,
"completions/min_length": 329.0,
"completions/min_terminated_length": 329.0,
"epoch": 0.3125,
"frac_reward_zero_std": 0.5,
"grad_norm": 0.035579681396484375,
"kl": 0.0008356323232874274,
"learning_rate": 4.937500000000001e-06,
"loss": 0.0,
"num_tokens": 4221334.0,
"reward": 1.6618772745132446,
"reward_std": 0.08351492881774902,
"rewards/ROUGEL_entities_reward/mean": 0.5212522745132446,
"rewards/ROUGEL_entities_reward/std": 0.21072913706302643,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.22840170562267303,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 80
},
{
"completion_length": 875.875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2027.0,
"completions/max_terminated_length": 1542.0,
"completions/mean_length": 876.84375,
"completions/mean_terminated_length": 839.7418823242188,
"completions/min_length": 447.0,
"completions/min_terminated_length": 447.0,
"epoch": 0.31640625,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.0496132373809814,
"kl": 0.02937435731291771,
"learning_rate": 5e-06,
"loss": 0.0,
"num_tokens": 4273549.0,
"reward": 1.2269667387008667,
"reward_std": 0.07633554935455322,
"rewards/ROUGEL_entities_reward/mean": 0.22696669399738312,
"rewards/ROUGEL_entities_reward/std": 0.1473868191242218,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0,
"rewards/f1_entities_exact_reward/std": 0.0,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 81
},
{
"completion_length": 773.4375,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 1445.0,
"completions/mean_length": 774.375,
"completions/mean_terminated_length": 689.4666748046875,
"completions/min_length": 373.0,
"completions/min_terminated_length": 373.0,
"epoch": 0.3203125,
"frac_reward_zero_std": 0.125,
"grad_norm": 1.8092247247695923,
"kl": 0.03204902959987521,
"learning_rate": 4.999976201801837e-06,
"loss": 0.0,
"num_tokens": 4322861.0,
"reward": 1.5633201599121094,
"reward_std": 0.2757198214530945,
"rewards/ROUGEL_entities_reward/mean": 0.4070702791213989,
"rewards/ROUGEL_entities_reward/std": 0.3196541965007782,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.203125,
"rewards/f1_entities_exact_reward/std": 0.24949544668197632,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 82
},
{
"completion_length": 811.1875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1739.0,
"completions/max_terminated_length": 1739.0,
"completions/mean_length": 812.1875,
"completions/mean_terminated_length": 812.1875,
"completions/min_length": 395.0,
"completions/min_terminated_length": 395.0,
"epoch": 0.32421875,
"frac_reward_zero_std": 0.125,
"grad_norm": 0.03791806846857071,
"kl": 0.0008129881898639724,
"learning_rate": 4.9999048076604286e-06,
"loss": 0.0,
"num_tokens": 4374903.0,
"reward": 1.2671880722045898,
"reward_std": 0.08097401261329651,
"rewards/ROUGEL_entities_reward/mean": 0.2515629827976227,
"rewards/ROUGEL_entities_reward/std": 0.1857381910085678,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0,
"rewards/f1_entities_exact_reward/std": 0.0,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 83
},
{
"completion_length": 945.21875,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1902.0,
"completions/max_terminated_length": 1902.0,
"completions/mean_length": 946.21875,
"completions/mean_terminated_length": 946.21875,
"completions/min_length": 390.0,
"completions/min_terminated_length": 390.0,
"epoch": 0.328125,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.0345589853823185,
"kl": 0.0008043982816161588,
"learning_rate": 4.999785818935018e-06,
"loss": 0.0,
"num_tokens": 4430606.0,
"reward": 1.539707899093628,
"reward_std": 0.1531979739665985,
"rewards/ROUGEL_entities_reward/mean": 0.41470780968666077,
"rewards/ROUGEL_entities_reward/std": 0.16835904121398926,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.109375,
"rewards/f1_entities_exact_reward/std": 0.2100067138671875,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 84
},
{
"completion_length": 919.6875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1972.0,
"completions/max_terminated_length": 1955.0,
"completions/mean_length": 920.65625,
"completions/mean_terminated_length": 886.7418823242188,
"completions/min_length": 353.0,
"completions/min_terminated_length": 353.0,
"epoch": 0.33203125,
"frac_reward_zero_std": 0.375,
"grad_norm": 0.876036524772644,
"kl": 0.029854314867407084,
"learning_rate": 4.9996192378909785e-06,
"loss": 0.0,
"num_tokens": 4485207.0,
"reward": 1.4873874187469482,
"reward_std": 0.1799616515636444,
"rewards/ROUGEL_entities_reward/mean": 0.33113738894462585,
"rewards/ROUGEL_entities_reward/std": 0.3323952555656433,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.125,
"rewards/f1_entities_exact_reward/std": 0.33601075410842896,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 85
},
{
"completion_length": 883.5625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1960.0,
"completions/max_terminated_length": 1853.0,
"completions/mean_length": 884.53125,
"completions/mean_terminated_length": 849.8386840820312,
"completions/min_length": 370.0,
"completions/min_terminated_length": 370.0,
"epoch": 0.3359375,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.041625738143921,
"kl": 0.03574475646018982,
"learning_rate": 4.999405067699773e-06,
"loss": 0.0,
"num_tokens": 4539352.0,
"reward": 1.9239509105682373,
"reward_std": 0.3379821181297302,
"rewards/ROUGEL_entities_reward/mean": 0.5802007913589478,
"rewards/ROUGEL_entities_reward/std": 0.26507386565208435,
"rewards/answer_correctness_func/mean": 0.09375,
"rewards/answer_correctness_func/std": 0.2961445748806,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.265625,
"rewards/f1_entities_exact_reward/std": 0.3356355130672455,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.015625,
"rewards/reasoning_equal_answer_reward/std": 0.0883883461356163,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 86
},
{
"completion_length": 967.25,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1601.0,
"completions/max_terminated_length": 1601.0,
"completions/mean_length": 968.25,
"completions/mean_terminated_length": 968.25,
"completions/min_length": 363.0,
"completions/min_terminated_length": 363.0,
"epoch": 0.33984375,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.0337342731654644,
"kl": 0.0008577157859690487,
"learning_rate": 4.999143312438893e-06,
"loss": 0.0,
"num_tokens": 4595608.0,
"reward": 1.3930331468582153,
"reward_std": 0.08991193026304245,
"rewards/ROUGEL_entities_reward/mean": 0.37740814685821533,
"rewards/ROUGEL_entities_reward/std": 0.262632817029953,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.015625,
"rewards/f1_entities_exact_reward/std": 0.0883883461356163,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 87
},
{
"completion_length": 930.5625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2034.0,
"completions/max_terminated_length": 1869.0,
"completions/mean_length": 931.53125,
"completions/mean_terminated_length": 895.9677124023438,
"completions/min_length": 393.0,
"completions/min_terminated_length": 393.0,
"epoch": 0.34375,
"frac_reward_zero_std": 0.25,
"grad_norm": 4106.8095703125,
"kl": 248.08653182303533,
"learning_rate": 4.998833977091783e-06,
"loss": 0.2481,
"num_tokens": 4650097.0,
"reward": 1.2493809461593628,
"reward_std": 0.22820821404457092,
"rewards/ROUGEL_entities_reward/mean": 0.23375599086284637,
"rewards/ROUGEL_entities_reward/std": 0.2611769437789917,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.046875,
"rewards/f1_entities_exact_reward/std": 0.1480722874403,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 88
},
{
"completion_length": 769.15625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1983.0,
"completions/max_terminated_length": 1426.0,
"completions/mean_length": 770.125,
"completions/mean_terminated_length": 731.0,
"completions/min_length": 370.0,
"completions/min_terminated_length": 370.0,
"epoch": 0.34765625,
"frac_reward_zero_std": 0.0,
"grad_norm": 1.7972824573516846,
"kl": 0.0501269455999136,
"learning_rate": 4.99847706754774e-06,
"loss": 0.0,
"num_tokens": 4699553.0,
"reward": 1.381695032119751,
"reward_std": 0.22855672240257263,
"rewards/ROUGEL_entities_reward/mean": 0.33482009172439575,
"rewards/ROUGEL_entities_reward/std": 0.16944284737110138,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.078125,
"rewards/f1_entities_exact_reward/std": 0.18445101380348206,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 89
},
{
"completion_length": 793.9375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1948.0,
"completions/max_terminated_length": 1948.0,
"completions/mean_length": 794.9375,
"completions/mean_terminated_length": 794.9375,
"completions/min_length": 344.0,
"completions/min_terminated_length": 344.0,
"epoch": 0.3515625,
"frac_reward_zero_std": 0.25,
"grad_norm": 9.503633499145508,
"kl": 28.800375290215015,
"learning_rate": 4.998072590601808e-06,
"loss": 0.0288,
"num_tokens": 4750315.0,
"reward": 1.7471970319747925,
"reward_std": 0.19717249274253845,
"rewards/ROUGEL_entities_reward/mean": 0.5128220319747925,
"rewards/ROUGEL_entities_reward/std": 0.2762593626976013,
"rewards/answer_correctness_func/mean": 0.03125,
"rewards/answer_correctness_func/std": 0.1767766922712326,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.203125,
"rewards/f1_entities_exact_reward/std": 0.27995896339416504,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 90
},
{
"completion_length": 905.125,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2042.0,
"completions/max_terminated_length": 1974.0,
"completions/mean_length": 906.09375,
"completions/mean_terminated_length": 869.4515991210938,
"completions/min_length": 374.0,
"completions/min_terminated_length": 374.0,
"epoch": 0.35546875,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.1816883087158203,
"kl": 0.044529864564538,
"learning_rate": 4.997620553954645e-06,
"loss": 0.0,
"num_tokens": 4804178.0,
"reward": 1.4783854484558105,
"reward_std": 0.3672109842300415,
"rewards/ROUGEL_entities_reward/mean": 0.40026041865348816,
"rewards/ROUGEL_entities_reward/std": 0.23726356029510498,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.171875,
"rewards/f1_entities_exact_reward/std": 0.24127934873104095,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 91
},
{
"completion_length": 1095.4375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1853.0,
"completions/max_terminated_length": 1853.0,
"completions/mean_length": 1096.4375,
"completions/mean_terminated_length": 1096.4375,
"completions/min_length": 384.0,
"completions/min_terminated_length": 384.0,
"epoch": 0.359375,
"frac_reward_zero_std": 0.25,
"grad_norm": 0.0298001766204834,
"kl": 0.0007554437761427835,
"learning_rate": 4.9971209662123774e-06,
"loss": 0.0,
"num_tokens": 4864664.0,
"reward": 1.6353673934936523,
"reward_std": 0.12443146109580994,
"rewards/ROUGEL_entities_reward/mean": 0.40099239349365234,
"rewards/ROUGEL_entities_reward/std": 0.2766393721103668,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.234375,
"rewards/f1_entities_exact_reward/std": 0.253503680229187,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 92
},
{
"completion_length": 730.5,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2036.0,
"completions/max_terminated_length": 1719.0,
"completions/mean_length": 731.46875,
"completions/mean_terminated_length": 689.3870849609375,
"completions/min_length": 352.0,
"completions/min_terminated_length": 352.0,
"epoch": 0.36328125,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.3264824151992798,
"kl": 0.05570895969867706,
"learning_rate": 4.9965738368864345e-06,
"loss": 0.0001,
"num_tokens": 4913231.0,
"reward": 1.7316737174987793,
"reward_std": 0.19201873242855072,
"rewards/ROUGEL_entities_reward/mean": 0.4504236876964569,
"rewards/ROUGEL_entities_reward/std": 0.32061126828193665,
"rewards/answer_correctness_func/mean": 0.09375,
"rewards/answer_correctness_func/std": 0.2961445748806,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.1875,
"rewards/f1_entities_exact_reward/std": 0.3299559950828552,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 93
},
{
"completion_length": 1029.375,
"completions/clipped_ratio": 0.09375,
"completions/max_length": 1992.0,
"completions/max_terminated_length": 1818.0,
"completions/mean_length": 1030.28125,
"completions/mean_terminated_length": 930.7930908203125,
"completions/min_length": 472.0,
"completions/min_terminated_length": 472.0,
"epoch": 0.3671875,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.0809646844863892,
"kl": 0.04943352658301592,
"learning_rate": 4.995979176393372e-06,
"loss": 0.0,
"num_tokens": 4971056.0,
"reward": 1.286555290222168,
"reward_std": 0.18572980165481567,
"rewards/ROUGEL_entities_reward/mean": 0.3178052306175232,
"rewards/ROUGEL_entities_reward/std": 0.2090727686882019,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.90625,
"rewards/answer_format_func/std": 0.2961445748806,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 94
},
{
"completion_length": 775.21875,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1960.0,
"completions/max_terminated_length": 1870.0,
"completions/mean_length": 776.1875,
"completions/mean_terminated_length": 738.0,
"completions/min_length": 375.0,
"completions/min_terminated_length": 375.0,
"epoch": 0.37109375,
"frac_reward_zero_std": 0.5,
"grad_norm": 0.027799174189567566,
"kl": 0.000922409410122782,
"learning_rate": 4.995336996054668e-06,
"loss": 0.0,
"num_tokens": 5021574.0,
"reward": 1.3551305532455444,
"reward_std": 0.035699695348739624,
"rewards/ROUGEL_entities_reward/mean": 0.2926305830478668,
"rewards/ROUGEL_entities_reward/std": 0.1515231877565384,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.0625,
"rewards/f1_entities_exact_reward/std": 0.16800537705421448,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 95
},
{
"completion_length": 754.03125,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 2021.0,
"completions/max_terminated_length": 1719.0,
"completions/mean_length": 754.96875,
"completions/mean_terminated_length": 670.5667114257812,
"completions/min_length": 332.0,
"completions/min_terminated_length": 332.0,
"epoch": 0.375,
"frac_reward_zero_std": 0.625,
"grad_norm": 0.7481793761253357,
"kl": 0.05968023743480444,
"learning_rate": 4.994647308096509e-06,
"loss": 0.0001,
"num_tokens": 5071297.0,
"reward": 1.4473375082015991,
"reward_std": 0.11887349933385849,
"rewards/ROUGEL_entities_reward/mean": 0.3379625082015991,
"rewards/ROUGEL_entities_reward/std": 0.2742195427417755,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.96875,
"rewards/answer_format_func/std": 0.1767766922712326,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.22840170562267303,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 96
},
{
"completion_length": 756.8125,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1560.0,
"completions/max_terminated_length": 1560.0,
"completions/mean_length": 757.8125,
"completions/mean_terminated_length": 757.8125,
"completions/min_length": 414.0,
"completions/min_terminated_length": 414.0,
"epoch": 0.37890625,
"frac_reward_zero_std": 0.375,
"grad_norm": 0.029540961608290672,
"kl": 0.0009005384054034948,
"learning_rate": 4.993910125649561e-06,
"loss": -0.0,
"num_tokens": 5120135.0,
"reward": 1.629094123840332,
"reward_std": 0.03689418360590935,
"rewards/ROUGEL_entities_reward/mean": 0.3790941834449768,
"rewards/ROUGEL_entities_reward/std": 0.31832432746887207,
"rewards/answer_correctness_func/mean": 0.125,
"rewards/answer_correctness_func/std": 0.33601075410842896,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.125,
"rewards/f1_entities_exact_reward/std": 0.33601075410842896,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 97
},
{
"completion_length": 936.9375,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 1903.0,
"completions/max_terminated_length": 1723.0,
"completions/mean_length": 937.90625,
"completions/mean_terminated_length": 906.774169921875,
"completions/min_length": 419.0,
"completions/min_terminated_length": 419.0,
"epoch": 0.3828125,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.03625582158565521,
"kl": 0.0008680867176735774,
"learning_rate": 4.993125462748714e-06,
"loss": 0.0,
"num_tokens": 5176528.0,
"reward": 1.5279531478881836,
"reward_std": 0.277273029088974,
"rewards/ROUGEL_entities_reward/mean": 0.4498281478881836,
"rewards/ROUGEL_entities_reward/std": 0.24050240218639374,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.22840170562267303,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 98
},
{
"completion_length": 794.09375,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1443.0,
"completions/max_terminated_length": 1443.0,
"completions/mean_length": 795.09375,
"completions/mean_terminated_length": 795.09375,
"completions/min_length": 339.0,
"completions/min_terminated_length": 339.0,
"epoch": 0.38671875,
"frac_reward_zero_std": 0.0,
"grad_norm": 0.044495273381471634,
"kl": 0.0009377674432471395,
"learning_rate": 4.992293334332821e-06,
"loss": 0.0,
"num_tokens": 5227423.0,
"reward": 1.5689302682876587,
"reward_std": 0.16798686981201172,
"rewards/ROUGEL_entities_reward/mean": 0.4283052682876587,
"rewards/ROUGEL_entities_reward/std": 0.24358195066452026,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 1.0,
"rewards/answer_format_func/std": 0.0,
"rewards/f1_entities_exact_reward/mean": 0.140625,
"rewards/f1_entities_exact_reward/std": 0.22840170562267303,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 99
},
{
"completion_length": 807.0625,
"completions/clipped_ratio": 0.03125,
"completions/max_length": 2048.0,
"completions/max_terminated_length": 2017.0,
"completions/mean_length": 808.03125,
"completions/mean_terminated_length": 768.0322265625,
"completions/min_length": 379.0,
"completions/min_terminated_length": 379.0,
"epoch": 0.390625,
"frac_reward_zero_std": 0.25,
"grad_norm": 1.4681968688964844,
"kl": 0.09113121591508389,
"learning_rate": 4.991413756244404e-06,
"loss": 0.0001,
"num_tokens": 5278544.0,
"reward": 1.6429879665374756,
"reward_std": 0.30271971225738525,
"rewards/ROUGEL_entities_reward/mean": 0.4711129069328308,
"rewards/ROUGEL_entities_reward/std": 0.23452715575695038,
"rewards/answer_correctness_func/mean": 0.0,
"rewards/answer_correctness_func/std": 0.0,
"rewards/answer_format_func/mean": 0.9375,
"rewards/answer_format_func/std": 0.24593468010425568,
"rewards/f1_entities_exact_reward/mean": 0.234375,
"rewards/f1_entities_exact_reward/std": 0.253503680229187,
"rewards/generation_reward_func/mean": 0.0,
"rewards/generation_reward_func/std": 0.0,
"rewards/reasoning_equal_answer_reward/mean": 0.0,
"rewards/reasoning_equal_answer_reward/std": 0.0,
"rewards/soft_format_reward_func/mean": 0.0,
"rewards/soft_format_reward_func/std": 0.0,
"step": 100
}
],
"logging_steps": 1,
"max_steps": 800,
"num_input_tokens_seen": 5278544,
"num_train_epochs": 4,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}