{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.390625, "eval_steps": 500, "global_step": 100, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "completion_length": 773.71875, "completions/clipped_ratio": 0.0, "completions/max_length": 1684.0, "completions/max_terminated_length": 1684.0, "completions/mean_length": 774.71875, "completions/mean_terminated_length": 774.71875, "completions/min_length": 389.0, "completions/min_terminated_length": 389.0, "epoch": 0.00390625, "frac_reward_zero_std": 0.375, "grad_norm": 0.031107431277632713, "kl": 0.0, "learning_rate": 0.0, "loss": 0.0, "num_tokens": 49271.0, "reward": 1.4142889976501465, "reward_std": 0.05336200073361397, "rewards/ROUGEL_entities_reward/mean": 0.3361639976501465, "rewards/ROUGEL_entities_reward/std": 0.24250923097133636, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 1 }, { "completion_length": 829.5, "completions/clipped_ratio": 0.0, "completions/max_length": 1716.0, "completions/max_terminated_length": 1716.0, "completions/mean_length": 830.5, "completions/mean_terminated_length": 830.5, "completions/min_length": 353.0, "completions/min_terminated_length": 353.0, "epoch": 0.0078125, "frac_reward_zero_std": 0.25, "grad_norm": 0.032838013023138046, "kl": 0.0, "learning_rate": 6.250000000000001e-08, "loss": 0.0, "num_tokens": 101031.0, "reward": 1.6849710941314697, "reward_std": 0.07849985361099243, "rewards/ROUGEL_entities_reward/mean": 0.4505961537361145, "rewards/ROUGEL_entities_reward/std": 0.17492875456809998, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.234375, "rewards/f1_entities_exact_reward/std": 0.253503680229187, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 2 }, { "completion_length": 858.21875, "completions/clipped_ratio": 0.0625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1491.0, "completions/mean_length": 859.15625, "completions/mean_terminated_length": 779.9000244140625, "completions/min_length": 390.0, "completions/min_terminated_length": 390.0, "epoch": 0.01171875, "frac_reward_zero_std": 0.125, "grad_norm": 1.0946029424667358, "kl": 0.04924837779253721, "learning_rate": 1.2500000000000002e-07, "loss": 0.0, "num_tokens": 154252.0, "reward": 1.7309010028839111, "reward_std": 0.20555105805397034, "rewards/ROUGEL_entities_reward/mean": 0.46527600288391113, "rewards/ROUGEL_entities_reward/std": 0.34173816442489624, "rewards/answer_correctness_func/mean": 0.09375, "rewards/answer_correctness_func/std": 0.2961445748806, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.234375, "rewards/f1_entities_exact_reward/std": 0.3356355130672455, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 3 }, { "completion_length": 750.09375, "completions/clipped_ratio": 0.0, "completions/max_length": 1529.0, "completions/max_terminated_length": 1529.0, "completions/mean_length": 751.09375, "completions/mean_terminated_length": 751.09375, "completions/min_length": 365.0, "completions/min_terminated_length": 365.0, "epoch": 0.015625, "frac_reward_zero_std": 0.125, "grad_norm": 0.03853773698210716, "kl": 0.0008064582070801407, "learning_rate": 1.875e-07, "loss": 0.0, "num_tokens": 203603.0, "reward": 1.3999865055084229, "reward_std": 0.06636261940002441, "rewards/ROUGEL_entities_reward/mean": 0.33748650550842285, "rewards/ROUGEL_entities_reward/std": 0.24072480201721191, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 4 }, { "completion_length": 894.84375, "completions/clipped_ratio": 0.0, "completions/max_length": 1776.0, "completions/max_terminated_length": 1776.0, "completions/mean_length": 895.84375, "completions/mean_terminated_length": 895.84375, "completions/min_length": 439.0, "completions/min_terminated_length": 439.0, "epoch": 0.01953125, "frac_reward_zero_std": 0.0, "grad_norm": 0.035162024199962616, "kl": 0.0008056848309934139, "learning_rate": 2.5000000000000004e-07, "loss": 0.0, "num_tokens": 257926.0, "reward": 1.6901798248291016, "reward_std": 0.2885170876979828, "rewards/ROUGEL_entities_reward/mean": 0.5026798844337463, "rewards/ROUGEL_entities_reward/std": 0.2995758056640625, "rewards/answer_correctness_func/mean": 0.03125, "rewards/answer_correctness_func/std": 0.1767766922712326, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.26753053069114685, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 5 }, { "completion_length": 964.28125, "completions/clipped_ratio": 0.0, "completions/max_length": 1814.0, "completions/max_terminated_length": 1814.0, "completions/mean_length": 965.28125, "completions/mean_terminated_length": 965.28125, "completions/min_length": 482.0, "completions/min_terminated_length": 482.0, "epoch": 0.0234375, "frac_reward_zero_std": 0.125, "grad_norm": 0.030356423929333687, "kl": 0.000767507852287963, "learning_rate": 3.125e-07, "loss": 0.0, "num_tokens": 314519.0, "reward": 1.4136323928833008, "reward_std": 0.25806623697280884, "rewards/ROUGEL_entities_reward/mean": 0.39800751209259033, "rewards/ROUGEL_entities_reward/std": 0.27216652035713196, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.046875, "rewards/f1_entities_exact_reward/std": 0.1480722874403, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 6 }, { "completion_length": 737.40625, "completions/clipped_ratio": 0.0, "completions/max_length": 1714.0, "completions/max_terminated_length": 1714.0, "completions/mean_length": 738.40625, "completions/mean_terminated_length": 738.40625, "completions/min_length": 271.0, "completions/min_terminated_length": 271.0, "epoch": 0.02734375, "frac_reward_zero_std": 0.125, "grad_norm": 0.04363395646214485, "kl": 0.000862537999637425, "learning_rate": 3.75e-07, "loss": -0.0, "num_tokens": 363764.0, "reward": 1.5545895099639893, "reward_std": 0.1157001405954361, "rewards/ROUGEL_entities_reward/mean": 0.3827144205570221, "rewards/ROUGEL_entities_reward/std": 0.2522861063480377, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.171875, "rewards/f1_entities_exact_reward/std": 0.24127934873104095, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 7 }, { "completion_length": 739.125, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1440.0, "completions/mean_length": 740.09375, "completions/mean_terminated_length": 697.9031982421875, "completions/min_length": 383.0, "completions/min_terminated_length": 383.0, "epoch": 0.03125, "frac_reward_zero_std": 0.125, "grad_norm": 1.2299633026123047, "kl": 0.03398810001090169, "learning_rate": 4.375e-07, "loss": 0.0, "num_tokens": 412659.0, "reward": 1.513428807258606, "reward_std": 0.2709747552871704, "rewards/ROUGEL_entities_reward/mean": 0.38842886686325073, "rewards/ROUGEL_entities_reward/std": 0.25137466192245483, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.23546454310417175, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 8 }, { "completion_length": 832.1875, "completions/clipped_ratio": 0.0, "completions/max_length": 1915.0, "completions/max_terminated_length": 1915.0, "completions/mean_length": 833.1875, "completions/mean_terminated_length": 833.1875, "completions/min_length": 432.0, "completions/min_terminated_length": 432.0, "epoch": 0.03515625, "frac_reward_zero_std": 0.125, "grad_norm": 0.0308236014097929, "kl": 0.0008265759242931381, "learning_rate": 5.000000000000001e-07, "loss": 0.0, "num_tokens": 465181.0, "reward": 1.492291808128357, "reward_std": 0.1271674633026123, "rewards/ROUGEL_entities_reward/mean": 0.38291680812835693, "rewards/ROUGEL_entities_reward/std": 0.16038332879543304, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 9 }, { "completion_length": 788.78125, "completions/clipped_ratio": 0.0, "completions/max_length": 1711.0, "completions/max_terminated_length": 1711.0, "completions/mean_length": 789.78125, "completions/mean_terminated_length": 789.78125, "completions/min_length": 344.0, "completions/min_terminated_length": 344.0, "epoch": 0.0390625, "frac_reward_zero_std": 0.125, "grad_norm": 0.04289854317903519, "kl": 0.0008371344592887908, "learning_rate": 5.625e-07, "loss": -0.0, "num_tokens": 515798.0, "reward": 1.7426328659057617, "reward_std": 0.1278819590806961, "rewards/ROUGEL_entities_reward/mean": 0.4457578659057617, "rewards/ROUGEL_entities_reward/std": 0.29676324129104614, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.3463519513607025, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 10 }, { "completion_length": 947.84375, "completions/clipped_ratio": 0.03125, "completions/max_length": 1947.0, "completions/max_terminated_length": 1625.0, "completions/mean_length": 948.8125, "completions/mean_terminated_length": 916.6128540039062, "completions/min_length": 368.0, "completions/min_terminated_length": 368.0, "epoch": 0.04296875, "frac_reward_zero_std": 0.125, "grad_norm": 0.031256962567567825, "kl": 0.0008525731100235134, "learning_rate": 6.25e-07, "loss": 0.0, "num_tokens": 571372.0, "reward": 1.6054279804229736, "reward_std": 0.2585637867450714, "rewards/ROUGEL_entities_reward/mean": 0.4491780400276184, "rewards/ROUGEL_entities_reward/std": 0.21337461471557617, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.23546454310417175, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 11 }, { "completion_length": 796.375, "completions/clipped_ratio": 0.0, "completions/max_length": 1783.0, "completions/max_terminated_length": 1783.0, "completions/mean_length": 797.375, "completions/mean_terminated_length": 797.375, "completions/min_length": 379.0, "completions/min_terminated_length": 379.0, "epoch": 0.046875, "frac_reward_zero_std": 0.375, "grad_norm": 0.03451008349657059, "kl": 0.0008439397643087432, "learning_rate": 6.875000000000001e-07, "loss": 0.0, "num_tokens": 622380.0, "reward": 1.8003621101379395, "reward_std": 0.09649848937988281, "rewards/ROUGEL_entities_reward/mean": 0.5503621101379395, "rewards/ROUGEL_entities_reward/std": 0.24412204325199127, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.234375, "rewards/f1_entities_exact_reward/std": 0.253503680229187, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 12 }, { "completion_length": 827.34375, "completions/clipped_ratio": 0.03125, "completions/max_length": 2047.0, "completions/max_terminated_length": 1974.0, "completions/mean_length": 828.3125, "completions/mean_terminated_length": 789.0, "completions/min_length": 342.0, "completions/min_terminated_length": 342.0, "epoch": 0.05078125, "frac_reward_zero_std": 0.25, "grad_norm": 1.4412877559661865, "kl": 0.03177165426313877, "learning_rate": 7.5e-07, "loss": 0.0, "num_tokens": 673534.0, "reward": 1.4974217414855957, "reward_std": 0.1358407884836197, "rewards/ROUGEL_entities_reward/mean": 0.4661717712879181, "rewards/ROUGEL_entities_reward/std": 0.28460103273391724, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 13 }, { "completion_length": 951.6875, "completions/clipped_ratio": 0.0, "completions/max_length": 1936.0, "completions/max_terminated_length": 1936.0, "completions/mean_length": 952.6875, "completions/mean_terminated_length": 952.6875, "completions/min_length": 360.0, "completions/min_terminated_length": 360.0, "epoch": 0.0546875, "frac_reward_zero_std": 0.0, "grad_norm": 0.047750119119882584, "kl": 0.0008222978794947267, "learning_rate": 8.125000000000001e-07, "loss": 0.0, "num_tokens": 728552.0, "reward": 1.4253430366516113, "reward_std": 0.107511967420578, "rewards/ROUGEL_entities_reward/mean": 0.40971803665161133, "rewards/ROUGEL_entities_reward/std": 0.2035004198551178, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.015625, "rewards/f1_entities_exact_reward/std": 0.0883883461356163, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 14 }, { "completion_length": 796.71875, "completions/clipped_ratio": 0.03125, "completions/max_length": 1999.0, "completions/max_terminated_length": 1728.0, "completions/mean_length": 797.6875, "completions/mean_terminated_length": 758.9354858398438, "completions/min_length": 447.0, "completions/min_terminated_length": 447.0, "epoch": 0.05859375, "frac_reward_zero_std": 0.375, "grad_norm": 1.1840251684188843, "kl": 0.035019629169255495, "learning_rate": 8.75e-07, "loss": 0.0, "num_tokens": 779450.0, "reward": 1.8847320079803467, "reward_std": 0.18553508818149567, "rewards/ROUGEL_entities_reward/mean": 0.6347318887710571, "rewards/ROUGEL_entities_reward/std": 0.24349310994148254, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.28125, "rewards/f1_entities_exact_reward/std": 0.2520080506801605, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 15 }, { "completion_length": 825.9375, "completions/clipped_ratio": 0.0, "completions/max_length": 1966.0, "completions/max_terminated_length": 1966.0, "completions/mean_length": 826.9375, "completions/mean_terminated_length": 826.9375, "completions/min_length": 346.0, "completions/min_terminated_length": 346.0, "epoch": 0.0625, "frac_reward_zero_std": 0.125, "grad_norm": 0.03686046227812767, "kl": 0.0009055825939867646, "learning_rate": 9.375000000000001e-07, "loss": 0.0, "num_tokens": 830168.0, "reward": 1.503725290298462, "reward_std": 0.03653297573328018, "rewards/ROUGEL_entities_reward/mean": 0.4412252902984619, "rewards/ROUGEL_entities_reward/std": 0.18260407447814941, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 16 }, { "completion_length": 831.65625, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1710.0, "completions/mean_length": 832.625, "completions/mean_terminated_length": 793.4193115234375, "completions/min_length": 442.0, "completions/min_terminated_length": 442.0, "epoch": 0.06640625, "frac_reward_zero_std": 0.125, "grad_norm": 11960.408203125, "kl": 91286.23423358332, "learning_rate": 1.0000000000000002e-06, "loss": 91.2862, "num_tokens": 882112.0, "reward": 1.9998295307159424, "reward_std": 0.1716785728931427, "rewards/ROUGEL_entities_reward/mean": 0.6092044115066528, "rewards/ROUGEL_entities_reward/std": 0.2381805032491684, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.265625, "rewards/f1_entities_exact_reward/std": 0.3588596284389496, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 17 }, { "completion_length": 735.09375, "completions/clipped_ratio": 0.0, "completions/max_length": 1963.0, "completions/max_terminated_length": 1963.0, "completions/mean_length": 736.09375, "completions/mean_terminated_length": 736.09375, "completions/min_length": 304.0, "completions/min_terminated_length": 304.0, "epoch": 0.0703125, "frac_reward_zero_std": 0.25, "grad_norm": 0.035265810787677765, "kl": 0.0008649405790492892, "learning_rate": 1.0625e-06, "loss": 0.0, "num_tokens": 930435.0, "reward": 1.6111576557159424, "reward_std": 0.2122671902179718, "rewards/ROUGEL_entities_reward/mean": 0.39240762591362, "rewards/ROUGEL_entities_reward/std": 0.2360842227935791, "rewards/answer_correctness_func/mean": 0.0625, "rewards/answer_correctness_func/std": 0.24593468010425568, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.2961445748806, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 18 }, { "completion_length": 929.3125, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2029.0, "completions/mean_length": 930.28125, "completions/mean_terminated_length": 894.2257690429688, "completions/min_length": 385.0, "completions/min_terminated_length": 385.0, "epoch": 0.07421875, "frac_reward_zero_std": 0.125, "grad_norm": 1.1916157007217407, "kl": 0.026040656957775354, "learning_rate": 1.125e-06, "loss": 0.0, "num_tokens": 986084.0, "reward": 1.4042803049087524, "reward_std": 0.2482759654521942, "rewards/ROUGEL_entities_reward/mean": 0.40428024530410767, "rewards/ROUGEL_entities_reward/std": 0.2555541396141052, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.03125, "rewards/f1_entities_exact_reward/std": 0.12296734005212784, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 19 }, { "completion_length": 858.53125, "completions/clipped_ratio": 0.0, "completions/max_length": 1999.0, "completions/max_terminated_length": 1999.0, "completions/mean_length": 859.53125, "completions/mean_terminated_length": 859.53125, "completions/min_length": 327.0, "completions/min_terminated_length": 327.0, "epoch": 0.078125, "frac_reward_zero_std": 0.25, "grad_norm": 1.2272316217422485, "kl": 0.04151263926178217, "learning_rate": 1.1875e-06, "loss": 0.0, "num_tokens": 1038577.0, "reward": 1.4781588315963745, "reward_std": 0.09865100681781769, "rewards/ROUGEL_entities_reward/mean": 0.3687838315963745, "rewards/ROUGEL_entities_reward/std": 0.25713229179382324, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 20 }, { "completion_length": 735.03125, "completions/clipped_ratio": 0.0, "completions/max_length": 1646.0, "completions/max_terminated_length": 1646.0, "completions/mean_length": 736.03125, "completions/mean_terminated_length": 736.03125, "completions/min_length": 370.0, "completions/min_terminated_length": 370.0, "epoch": 0.08203125, "frac_reward_zero_std": 0.125, "grad_norm": 0.03574994206428528, "kl": 0.0008639947773190215, "learning_rate": 1.25e-06, "loss": 0.0, "num_tokens": 1087414.0, "reward": 1.7493736743927002, "reward_std": 0.3073810338973999, "rewards/ROUGEL_entities_reward/mean": 0.5149986743927002, "rewards/ROUGEL_entities_reward/std": 0.2595096230506897, "rewards/answer_correctness_func/mean": 0.0625, "rewards/answer_correctness_func/std": 0.24593468010425568, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.171875, "rewards/f1_entities_exact_reward/std": 0.30078861117362976, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 21 }, { "completion_length": 936.125, "completions/clipped_ratio": 0.0, "completions/max_length": 1829.0, "completions/max_terminated_length": 1829.0, "completions/mean_length": 937.125, "completions/mean_terminated_length": 937.125, "completions/min_length": 387.0, "completions/min_terminated_length": 387.0, "epoch": 0.0859375, "frac_reward_zero_std": 0.375, "grad_norm": 0.030881009995937347, "kl": 0.0008643228356959298, "learning_rate": 1.3125000000000001e-06, "loss": 0.0, "num_tokens": 1142902.0, "reward": 1.4245872497558594, "reward_std": 0.05940890312194824, "rewards/ROUGEL_entities_reward/mean": 0.3933371901512146, "rewards/ROUGEL_entities_reward/std": 0.23100200295448303, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.03125, "rewards/f1_entities_exact_reward/std": 0.12296734005212784, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 22 }, { "completion_length": 949.09375, "completions/clipped_ratio": 0.03125, "completions/max_length": 1974.0, "completions/max_terminated_length": 1957.0, "completions/mean_length": 950.0625, "completions/mean_terminated_length": 917.0322265625, "completions/min_length": 358.0, "completions/min_terminated_length": 358.0, "epoch": 0.08984375, "frac_reward_zero_std": 0.0, "grad_norm": 1.360364317893982, "kl": 0.03316311351954937, "learning_rate": 1.3750000000000002e-06, "loss": 0.0, "num_tokens": 1198068.0, "reward": 1.4728868007659912, "reward_std": 0.2027805596590042, "rewards/ROUGEL_entities_reward/mean": 0.4260118901729584, "rewards/ROUGEL_entities_reward/std": 0.26421165466308594, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 23 }, { "completion_length": 983.4375, "completions/clipped_ratio": 0.03125, "completions/max_length": 2043.0, "completions/max_terminated_length": 2041.0, "completions/mean_length": 984.40625, "completions/mean_terminated_length": 950.258056640625, "completions/min_length": 350.0, "completions/min_terminated_length": 350.0, "epoch": 0.09375, "frac_reward_zero_std": 0.125, "grad_norm": 1.449867844581604, "kl": 0.03517508413642645, "learning_rate": 1.4375e-06, "loss": 0.0, "num_tokens": 1254353.0, "reward": 1.5606844425201416, "reward_std": 0.34358131885528564, "rewards/ROUGEL_entities_reward/mean": 0.5138094425201416, "rewards/ROUGEL_entities_reward/std": 0.24284419417381287, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.22840170562267303, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 24 }, { "completion_length": 986.0625, "completions/clipped_ratio": 0.03125, "completions/max_length": 1981.0, "completions/max_terminated_length": 1877.0, "completions/mean_length": 987.03125, "completions/mean_terminated_length": 954.9677124023438, "completions/min_length": 385.0, "completions/min_terminated_length": 385.0, "epoch": 0.09765625, "frac_reward_zero_std": 0.0, "grad_norm": 1.7202436923980713, "kl": 0.03029360854998231, "learning_rate": 1.5e-06, "loss": 0.0, "num_tokens": 1311054.0, "reward": 1.5542736053466797, "reward_std": 0.2044057995080948, "rewards/ROUGEL_entities_reward/mean": 0.4292736053466797, "rewards/ROUGEL_entities_reward/std": 0.187626451253891, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.23546454310417175, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 25 }, { "completion_length": 719.875, "completions/clipped_ratio": 0.0, "completions/max_length": 1817.0, "completions/max_terminated_length": 1817.0, "completions/mean_length": 720.875, "completions/mean_terminated_length": 720.875, "completions/min_length": 332.0, "completions/min_terminated_length": 332.0, "epoch": 0.1015625, "frac_reward_zero_std": 0.0, "grad_norm": 0.04885788634419441, "kl": 0.0009195755264954641, "learning_rate": 1.5625e-06, "loss": 0.0, "num_tokens": 1359150.0, "reward": 1.3275928497314453, "reward_std": 0.05572877824306488, "rewards/ROUGEL_entities_reward/mean": 0.3275929093360901, "rewards/ROUGEL_entities_reward/std": 0.2175500988960266, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0, "rewards/f1_entities_exact_reward/std": 0.0, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 26 }, { "completion_length": 787.3125, "completions/clipped_ratio": 0.0, "completions/max_length": 1927.0, "completions/max_terminated_length": 1927.0, "completions/mean_length": 788.3125, "completions/mean_terminated_length": 788.3125, "completions/min_length": 346.0, "completions/min_terminated_length": 346.0, "epoch": 0.10546875, "frac_reward_zero_std": 0.0, "grad_norm": 0.047234393656253815, "kl": 0.0008445628191111609, "learning_rate": 1.6250000000000001e-06, "loss": -0.0, "num_tokens": 1409184.0, "reward": 1.6741223335266113, "reward_std": 0.17429909110069275, "rewards/ROUGEL_entities_reward/mean": 0.4397473633289337, "rewards/ROUGEL_entities_reward/std": 0.2606096565723419, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.234375, "rewards/f1_entities_exact_reward/std": 0.253503680229187, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 27 }, { "completion_length": 908.09375, "completions/clipped_ratio": 0.03125, "completions/max_length": 2037.0, "completions/max_terminated_length": 1410.0, "completions/mean_length": 909.0625, "completions/mean_terminated_length": 872.6773681640625, "completions/min_length": 436.0, "completions/min_terminated_length": 436.0, "epoch": 0.109375, "frac_reward_zero_std": 0.0, "grad_norm": 1.1578987836837769, "kl": 0.029024578165262938, "learning_rate": 1.6875000000000001e-06, "loss": 0.0, "num_tokens": 1463198.0, "reward": 1.3360178470611572, "reward_std": 0.194834902882576, "rewards/ROUGEL_entities_reward/mean": 0.3516428768634796, "rewards/ROUGEL_entities_reward/std": 0.20796751976013184, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.015625, "rewards/f1_entities_exact_reward/std": 0.0883883461356163, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 28 }, { "completion_length": 877.6875, "completions/clipped_ratio": 0.0, "completions/max_length": 1722.0, "completions/max_terminated_length": 1722.0, "completions/mean_length": 878.6875, "completions/mean_terminated_length": 878.6875, "completions/min_length": 400.0, "completions/min_terminated_length": 400.0, "epoch": 0.11328125, "frac_reward_zero_std": 0.0, "grad_norm": 0.036818020045757294, "kl": 0.0008321568457176909, "learning_rate": 1.75e-06, "loss": 0.0, "num_tokens": 1516328.0, "reward": 1.284515619277954, "reward_std": 0.10075192153453827, "rewards/ROUGEL_entities_reward/mean": 0.2845155596733093, "rewards/ROUGEL_entities_reward/std": 0.20700469613075256, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0, "rewards/f1_entities_exact_reward/std": 0.0, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 29 }, { "completion_length": 801.90625, "completions/clipped_ratio": 0.0, "completions/max_length": 1763.0, "completions/max_terminated_length": 1763.0, "completions/mean_length": 802.90625, "completions/mean_terminated_length": 802.90625, "completions/min_length": 354.0, "completions/min_terminated_length": 354.0, "epoch": 0.1171875, "frac_reward_zero_std": 0.125, "grad_norm": 0.038571011275053024, "kl": 0.0008754348091315478, "learning_rate": 1.8125e-06, "loss": -0.0, "num_tokens": 1568001.0, "reward": 1.3216490745544434, "reward_std": 0.0878436490893364, "rewards/ROUGEL_entities_reward/mean": 0.3216490149497986, "rewards/ROUGEL_entities_reward/std": 0.12796050310134888, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0, "rewards/f1_entities_exact_reward/std": 0.0, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 30 }, { "completion_length": 1019.875, "completions/clipped_ratio": 0.0, "completions/max_length": 1994.0, "completions/max_terminated_length": 1994.0, "completions/mean_length": 1020.875, "completions/mean_terminated_length": 1020.875, "completions/min_length": 317.0, "completions/min_terminated_length": 317.0, "epoch": 0.12109375, "frac_reward_zero_std": 0.125, "grad_norm": 1.9888184070587158, "kl": 0.030457815155386925, "learning_rate": 1.8750000000000003e-06, "loss": 0.0, "num_tokens": 1625681.0, "reward": 1.6338975429534912, "reward_std": 0.0996546596288681, "rewards/ROUGEL_entities_reward/mean": 0.5245225429534912, "rewards/ROUGEL_entities_reward/std": 0.1336575746536255, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 31 }, { "completion_length": 778.8125, "completions/clipped_ratio": 0.03125, "completions/max_length": 1987.0, "completions/max_terminated_length": 1386.0, "completions/mean_length": 779.78125, "completions/mean_terminated_length": 740.8386840820312, "completions/min_length": 448.0, "completions/min_terminated_length": 448.0, "epoch": 0.125, "frac_reward_zero_std": 0.0, "grad_norm": 1.4051024913787842, "kl": 0.07832266436889768, "learning_rate": 1.9375e-06, "loss": 0.0001, "num_tokens": 1676698.0, "reward": 1.6515867710113525, "reward_std": 0.36416906118392944, "rewards/ROUGEL_entities_reward/mean": 0.4640866816043854, "rewards/ROUGEL_entities_reward/std": 0.2700716555118561, "rewards/answer_correctness_func/mean": 0.03125, "rewards/answer_correctness_func/std": 0.1767766922712326, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.1875, "rewards/f1_entities_exact_reward/std": 0.2767903506755829, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 32 }, { "completion_length": 864.90625, "completions/clipped_ratio": 0.03125, "completions/max_length": 2033.0, "completions/max_terminated_length": 1989.0, "completions/mean_length": 865.875, "completions/mean_terminated_length": 828.2257690429688, "completions/min_length": 376.0, "completions/min_terminated_length": 376.0, "epoch": 0.12890625, "frac_reward_zero_std": 0.0, "grad_norm": 1.8691290616989136, "kl": 0.03025655262172222, "learning_rate": 2.0000000000000003e-06, "loss": 0.0, "num_tokens": 1729458.0, "reward": 2.1252987384796143, "reward_std": 0.5289393663406372, "rewards/ROUGEL_entities_reward/mean": 0.5627987384796143, "rewards/ROUGEL_entities_reward/std": 0.3745800256729126, "rewards/answer_correctness_func/mean": 0.21875, "rewards/answer_correctness_func/std": 0.420013427734375, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.40625, "rewards/f1_entities_exact_reward/std": 0.39015090465545654, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.03125, "rewards/reasoning_equal_answer_reward/std": 0.1767766922712326, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 33 }, { "completion_length": 879.28125, "completions/clipped_ratio": 0.0, "completions/max_length": 1759.0, "completions/max_terminated_length": 1759.0, "completions/mean_length": 880.28125, "completions/mean_terminated_length": 880.28125, "completions/min_length": 382.0, "completions/min_terminated_length": 382.0, "epoch": 0.1328125, "frac_reward_zero_std": 0.125, "grad_norm": 0.03191771358251572, "kl": 0.0008378682687180117, "learning_rate": 2.0625e-06, "loss": 0.0, "num_tokens": 1782827.0, "reward": 1.4557617902755737, "reward_std": 0.16580641269683838, "rewards/ROUGEL_entities_reward/mean": 0.34638676047325134, "rewards/ROUGEL_entities_reward/std": 0.18016280233860016, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 34 }, { "completion_length": 895.1875, "completions/clipped_ratio": 0.0, "completions/max_length": 1836.0, "completions/max_terminated_length": 1836.0, "completions/mean_length": 896.1875, "completions/mean_terminated_length": 896.1875, "completions/min_length": 386.0, "completions/min_terminated_length": 386.0, "epoch": 0.13671875, "frac_reward_zero_std": 0.125, "grad_norm": 0.0351351797580719, "kl": 0.0007743473688606173, "learning_rate": 2.125e-06, "loss": 0.0, "num_tokens": 1836317.0, "reward": 1.3723011016845703, "reward_std": 0.15460538864135742, "rewards/ROUGEL_entities_reward/mean": 0.3410511016845703, "rewards/ROUGEL_entities_reward/std": 0.2375221699476242, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.03125, "rewards/f1_entities_exact_reward/std": 0.12296734005212784, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 35 }, { "completion_length": 814.5625, "completions/clipped_ratio": 0.0, "completions/max_length": 1464.0, "completions/max_terminated_length": 1464.0, "completions/mean_length": 815.5625, "completions/mean_terminated_length": 815.5625, "completions/min_length": 358.0, "completions/min_terminated_length": 358.0, "epoch": 0.140625, "frac_reward_zero_std": 0.0, "grad_norm": 0.03838350996375084, "kl": 0.0008724646613700315, "learning_rate": 2.1875000000000002e-06, "loss": 0.0, "num_tokens": 1887779.0, "reward": 1.421027660369873, "reward_std": 0.08938203752040863, "rewards/ROUGEL_entities_reward/mean": 0.35852763056755066, "rewards/ROUGEL_entities_reward/std": 0.1610291451215744, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 36 }, { "completion_length": 1043.9375, "completions/clipped_ratio": 0.09375, "completions/max_length": 1966.0, "completions/max_terminated_length": 1925.0, "completions/mean_length": 1044.84375, "completions/mean_terminated_length": 949.5516967773438, "completions/min_length": 361.0, "completions/min_terminated_length": 361.0, "epoch": 0.14453125, "frac_reward_zero_std": 0.125, "grad_norm": 1.3164830207824707, "kl": 0.036185771226882935, "learning_rate": 2.25e-06, "loss": 0.0, "num_tokens": 1946890.0, "reward": 1.2239865064620972, "reward_std": 0.13413795828819275, "rewards/ROUGEL_entities_reward/mean": 0.25523650646209717, "rewards/ROUGEL_entities_reward/std": 0.20075830817222595, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 37 }, { "completion_length": 1095.15625, "completions/clipped_ratio": 0.0625, "completions/max_length": 2012.0, "completions/max_terminated_length": 1988.0, "completions/mean_length": 1096.09375, "completions/mean_terminated_length": 1035.033447265625, "completions/min_length": 349.0, "completions/min_terminated_length": 349.0, "epoch": 0.1484375, "frac_reward_zero_std": 0.125, "grad_norm": 1.7715964317321777, "kl": 0.047803448513150215, "learning_rate": 2.3125000000000003e-06, "loss": 0.0, "num_tokens": 2007529.0, "reward": 1.219300389289856, "reward_std": 0.209647536277771, "rewards/ROUGEL_entities_reward/mean": 0.26617541909217834, "rewards/ROUGEL_entities_reward/std": 0.19572654366493225, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.015625, "rewards/f1_entities_exact_reward/std": 0.0883883461356163, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 38 }, { "completion_length": 875.125, "completions/clipped_ratio": 0.0625, "completions/max_length": 2025.0, "completions/max_terminated_length": 1905.0, "completions/mean_length": 876.0625, "completions/mean_terminated_length": 799.4667358398438, "completions/min_length": 383.0, "completions/min_terminated_length": 383.0, "epoch": 0.15234375, "frac_reward_zero_std": 0.25, "grad_norm": 1.2576082944869995, "kl": 0.028566114604473114, "learning_rate": 2.375e-06, "loss": 0.0, "num_tokens": 2061255.0, "reward": 1.543312430381775, "reward_std": 0.20425739884376526, "rewards/ROUGEL_entities_reward/mean": 0.4026874303817749, "rewards/ROUGEL_entities_reward/std": 0.3158787488937378, "rewards/answer_correctness_func/mean": 0.03125, "rewards/answer_correctness_func/std": 0.1767766922712326, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.24542178213596344, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 39 }, { "completion_length": 868.09375, "completions/clipped_ratio": 0.0, "completions/max_length": 1850.0, "completions/max_terminated_length": 1850.0, "completions/mean_length": 869.09375, "completions/mean_terminated_length": 869.09375, "completions/min_length": 423.0, "completions/min_terminated_length": 423.0, "epoch": 0.15625, "frac_reward_zero_std": 0.0, "grad_norm": 0.04050038754940033, "kl": 0.0008488351159030572, "learning_rate": 2.4375e-06, "loss": 0.0, "num_tokens": 2114910.0, "reward": 1.5773019790649414, "reward_std": 0.2809327244758606, "rewards/ROUGEL_entities_reward/mean": 0.4054270386695862, "rewards/ROUGEL_entities_reward/std": 0.21998822689056396, "rewards/answer_correctness_func/mean": 0.03125, "rewards/answer_correctness_func/std": 0.1767766922712326, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.26133573055267334, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 40 }, { "completion_length": 746.125, "completions/clipped_ratio": 0.0, "completions/max_length": 1475.0, "completions/max_terminated_length": 1475.0, "completions/mean_length": 747.125, "completions/mean_terminated_length": 747.125, "completions/min_length": 311.0, "completions/min_terminated_length": 311.0, "epoch": 0.16015625, "frac_reward_zero_std": 0.25, "grad_norm": 0.0397828109562397, "kl": 0.0009731970203574747, "learning_rate": 2.5e-06, "loss": 0.0, "num_tokens": 2164246.0, "reward": 1.9008541107177734, "reward_std": 0.07794724404811859, "rewards/ROUGEL_entities_reward/mean": 0.525854229927063, "rewards/ROUGEL_entities_reward/std": 0.27729788422584534, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.25, "rewards/f1_entities_exact_reward/std": 0.3592106103897095, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 41 }, { "completion_length": 960.84375, "completions/clipped_ratio": 0.0625, "completions/max_length": 1977.0, "completions/max_terminated_length": 1768.0, "completions/mean_length": 961.78125, "completions/mean_terminated_length": 894.1000366210938, "completions/min_length": 357.0, "completions/min_terminated_length": 357.0, "epoch": 0.1640625, "frac_reward_zero_std": 0.375, "grad_norm": 1.2776288986206055, "kl": 0.0984850749373436, "learning_rate": 2.5625e-06, "loss": 0.0001, "num_tokens": 2220687.0, "reward": 1.3761751651763916, "reward_std": 0.03425034135580063, "rewards/ROUGEL_entities_reward/mean": 0.3136751055717468, "rewards/ROUGEL_entities_reward/std": 0.21004539728164673, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 42 }, { "completion_length": 781.8125, "completions/clipped_ratio": 0.0, "completions/max_length": 1453.0, "completions/max_terminated_length": 1453.0, "completions/mean_length": 782.8125, "completions/mean_terminated_length": 782.8125, "completions/min_length": 352.0, "completions/min_terminated_length": 352.0, "epoch": 0.16796875, "frac_reward_zero_std": 0.0, "grad_norm": 0.04102746397256851, "kl": 0.0008047504670685157, "learning_rate": 2.6250000000000003e-06, "loss": 0.0, "num_tokens": 2271929.0, "reward": 1.3647174835205078, "reward_std": 0.1334415078163147, "rewards/ROUGEL_entities_reward/mean": 0.3334674835205078, "rewards/ROUGEL_entities_reward/std": 0.18400724232196808, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.03125, "rewards/f1_entities_exact_reward/std": 0.12296734005212784, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 43 }, { "completion_length": 866.65625, "completions/clipped_ratio": 0.03125, "completions/max_length": 1973.0, "completions/max_terminated_length": 1473.0, "completions/mean_length": 867.625, "completions/mean_terminated_length": 831.9677124023438, "completions/min_length": 309.0, "completions/min_terminated_length": 309.0, "epoch": 0.171875, "frac_reward_zero_std": 0.25, "grad_norm": 0.03564456105232239, "kl": 0.0008104472508421168, "learning_rate": 2.6875e-06, "loss": 0.0, "num_tokens": 2324513.0, "reward": 1.3380478620529175, "reward_std": 0.16338998079299927, "rewards/ROUGEL_entities_reward/mean": 0.35367289185523987, "rewards/ROUGEL_entities_reward/std": 0.2080492079257965, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.015625, "rewards/f1_entities_exact_reward/std": 0.0883883461356163, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 44 }, { "completion_length": 988.65625, "completions/clipped_ratio": 0.0625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2024.0, "completions/mean_length": 989.59375, "completions/mean_terminated_length": 919.0333862304688, "completions/min_length": 364.0, "completions/min_terminated_length": 364.0, "epoch": 0.17578125, "frac_reward_zero_std": 0.125, "grad_norm": 1.3289203643798828, "kl": 0.05466066673398018, "learning_rate": 2.7500000000000004e-06, "loss": 0.0001, "num_tokens": 2380596.0, "reward": 1.4342949390411377, "reward_std": 0.20128795504570007, "rewards/ROUGEL_entities_reward/mean": 0.4030449390411377, "rewards/ROUGEL_entities_reward/std": 0.30489441752433777, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.125, "rewards/f1_entities_exact_reward/std": 0.2199706733226776, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 45 }, { "completion_length": 777.96875, "completions/clipped_ratio": 0.0, "completions/max_length": 1422.0, "completions/max_terminated_length": 1422.0, "completions/mean_length": 778.96875, "completions/mean_terminated_length": 778.96875, "completions/min_length": 333.0, "completions/min_terminated_length": 333.0, "epoch": 0.1796875, "frac_reward_zero_std": 0.25, "grad_norm": 0.029138894751667976, "kl": 0.0008950835035648197, "learning_rate": 2.8125e-06, "loss": -0.0, "num_tokens": 2430763.0, "reward": 1.6776609420776367, "reward_std": 0.07827550172805786, "rewards/ROUGEL_entities_reward/mean": 0.39641106128692627, "rewards/ROUGEL_entities_reward/std": 0.31618690490722656, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.3463519513607025, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 46 }, { "completion_length": 902.59375, "completions/clipped_ratio": 0.0, "completions/max_length": 1909.0, "completions/max_terminated_length": 1909.0, "completions/mean_length": 903.59375, "completions/mean_terminated_length": 903.59375, "completions/min_length": 351.0, "completions/min_terminated_length": 351.0, "epoch": 0.18359375, "frac_reward_zero_std": 0.125, "grad_norm": 0.03316575661301613, "kl": 0.00084034533938393, "learning_rate": 2.875e-06, "loss": 0.0, "num_tokens": 2484606.0, "reward": 1.7022205591201782, "reward_std": 0.11596342921257019, "rewards/ROUGEL_entities_reward/mean": 0.48347052931785583, "rewards/ROUGEL_entities_reward/std": 0.2657451033592224, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.21875, "rewards/f1_entities_exact_reward/std": 0.2520080506801605, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 47 }, { "completion_length": 1063.3125, "completions/clipped_ratio": 0.03125, "completions/max_length": 2045.0, "completions/max_terminated_length": 2010.0, "completions/mean_length": 1064.28125, "completions/mean_terminated_length": 1032.6451416015625, "completions/min_length": 400.0, "completions/min_terminated_length": 400.0, "epoch": 0.1875, "frac_reward_zero_std": 0.125, "grad_norm": 1.315568208694458, "kl": 0.024940223898738623, "learning_rate": 2.9375000000000003e-06, "loss": 0.0, "num_tokens": 2543507.0, "reward": 1.312612771987915, "reward_std": 0.3253900706768036, "rewards/ROUGEL_entities_reward/mean": 0.37511277198791504, "rewards/ROUGEL_entities_reward/std": 0.2815242409706116, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.875, "rewards/answer_format_func/std": 0.33601075410842896, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 48 }, { "completion_length": 790.40625, "completions/clipped_ratio": 0.0, "completions/max_length": 1731.0, "completions/max_terminated_length": 1731.0, "completions/mean_length": 791.40625, "completions/mean_terminated_length": 791.40625, "completions/min_length": 364.0, "completions/min_terminated_length": 364.0, "epoch": 0.19140625, "frac_reward_zero_std": 0.25, "grad_norm": 0.035357240587472916, "kl": 0.0008986674947664142, "learning_rate": 3e-06, "loss": 0.0, "num_tokens": 2593784.0, "reward": 1.768296718597412, "reward_std": 0.20734211802482605, "rewards/ROUGEL_entities_reward/mean": 0.5182968378067017, "rewards/ROUGEL_entities_reward/std": 0.13581332564353943, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.234375, "rewards/f1_entities_exact_reward/std": 0.253503680229187, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 49 }, { "completion_length": 876.4375, "completions/clipped_ratio": 0.0625, "completions/max_length": 1978.0, "completions/max_terminated_length": 1407.0, "completions/mean_length": 877.375, "completions/mean_terminated_length": 804.0000610351562, "completions/min_length": 455.0, "completions/min_terminated_length": 455.0, "epoch": 0.1953125, "frac_reward_zero_std": 0.25, "grad_norm": 0.03194103017449379, "kl": 0.0008543854783056304, "learning_rate": 3.0625000000000003e-06, "loss": 0.0, "num_tokens": 2646016.0, "reward": 1.638135313987732, "reward_std": 0.2261456400156021, "rewards/ROUGEL_entities_reward/mean": 0.5443853735923767, "rewards/ROUGEL_entities_reward/std": 0.273754358291626, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.23546454310417175, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 50 }, { "completion_length": 1074.90625, "completions/clipped_ratio": 0.0625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1955.0, "completions/mean_length": 1075.84375, "completions/mean_terminated_length": 1011.0333862304688, "completions/min_length": 381.0, "completions/min_terminated_length": 381.0, "epoch": 0.19921875, "frac_reward_zero_std": 0.125, "grad_norm": 1.0201319456100464, "kl": 0.022831523790955544, "learning_rate": 3.125e-06, "loss": 0.0, "num_tokens": 2706399.0, "reward": 1.462364673614502, "reward_std": 0.28029900789260864, "rewards/ROUGEL_entities_reward/mean": 0.43111473321914673, "rewards/ROUGEL_entities_reward/std": 0.30877652764320374, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.125, "rewards/f1_entities_exact_reward/std": 0.2199706733226776, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 51 }, { "completion_length": 780.90625, "completions/clipped_ratio": 0.0, "completions/max_length": 1876.0, "completions/max_terminated_length": 1876.0, "completions/mean_length": 781.90625, "completions/mean_terminated_length": 781.90625, "completions/min_length": 334.0, "completions/min_terminated_length": 334.0, "epoch": 0.203125, "frac_reward_zero_std": 0.375, "grad_norm": 0.02633880078792572, "kl": 0.0008717684831935912, "learning_rate": 3.1875e-06, "loss": 0.0, "num_tokens": 2757124.0, "reward": 1.4692744016647339, "reward_std": 0.10760265588760376, "rewards/ROUGEL_entities_reward/mean": 0.3911494016647339, "rewards/ROUGEL_entities_reward/std": 0.3299289047718048, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.078125, "rewards/f1_entities_exact_reward/std": 0.18445101380348206, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 52 }, { "completion_length": 1000.21875, "completions/clipped_ratio": 0.03125, "completions/max_length": 2009.0, "completions/max_terminated_length": 1990.0, "completions/mean_length": 1001.1875, "completions/mean_terminated_length": 968.6773681640625, "completions/min_length": 390.0, "completions/min_terminated_length": 390.0, "epoch": 0.20703125, "frac_reward_zero_std": 0.125, "grad_norm": 43595.1640625, "kl": 663661.0216736235, "learning_rate": 3.2500000000000002e-06, "loss": 663.6611, "num_tokens": 2814698.0, "reward": 1.6129716634750366, "reward_std": 0.34194862842559814, "rewards/ROUGEL_entities_reward/mean": 0.4723466634750366, "rewards/ROUGEL_entities_reward/std": 0.20310600101947784, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.203125, "rewards/f1_entities_exact_reward/std": 0.24949544668197632, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 53 }, { "completion_length": 788.65625, "completions/clipped_ratio": 0.0, "completions/max_length": 1430.0, "completions/max_terminated_length": 1430.0, "completions/mean_length": 789.65625, "completions/mean_terminated_length": 789.65625, "completions/min_length": 357.0, "completions/min_terminated_length": 357.0, "epoch": 0.2109375, "frac_reward_zero_std": 0.125, "grad_norm": 0.04156388342380524, "kl": 0.0008590234210714698, "learning_rate": 3.3125e-06, "loss": 0.0, "num_tokens": 2864779.0, "reward": 1.5036687850952148, "reward_std": 0.18333800137043, "rewards/ROUGEL_entities_reward/mean": 0.37866872549057007, "rewards/ROUGEL_entities_reward/std": 0.2451113909482956, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 54 }, { "completion_length": 878.78125, "completions/clipped_ratio": 0.0625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1694.0, "completions/mean_length": 879.71875, "completions/mean_terminated_length": 801.8333740234375, "completions/min_length": 381.0, "completions/min_terminated_length": 381.0, "epoch": 0.21484375, "frac_reward_zero_std": 0.0, "grad_norm": 1.253060221672058, "kl": 0.028678589966148138, "learning_rate": 3.3750000000000003e-06, "loss": 0.0, "num_tokens": 2917394.0, "reward": 1.5075453519821167, "reward_std": 0.21901844441890717, "rewards/ROUGEL_entities_reward/mean": 0.4137953519821167, "rewards/ROUGEL_entities_reward/std": 0.25585466623306274, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.23546454310417175, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 55 }, { "completion_length": 881.03125, "completions/clipped_ratio": 0.0, "completions/max_length": 1655.0, "completions/max_terminated_length": 1655.0, "completions/mean_length": 882.03125, "completions/mean_terminated_length": 882.03125, "completions/min_length": 391.0, "completions/min_terminated_length": 391.0, "epoch": 0.21875, "frac_reward_zero_std": 0.125, "grad_norm": 0.031581878662109375, "kl": 0.0007841893821023405, "learning_rate": 3.4375e-06, "loss": 0.0, "num_tokens": 2970251.0, "reward": 1.5474133491516113, "reward_std": 0.11733610183000565, "rewards/ROUGEL_entities_reward/mean": 0.39116325974464417, "rewards/ROUGEL_entities_reward/std": 0.24231143295764923, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.22840170562267303, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 56 }, { "completion_length": 745.90625, "completions/clipped_ratio": 0.0, "completions/max_length": 1596.0, "completions/max_terminated_length": 1596.0, "completions/mean_length": 746.90625, "completions/mean_terminated_length": 746.90625, "completions/min_length": 392.0, "completions/min_terminated_length": 392.0, "epoch": 0.22265625, "frac_reward_zero_std": 0.375, "grad_norm": 0.031546663492918015, "kl": 0.0008624131296528503, "learning_rate": 3.5e-06, "loss": 0.0, "num_tokens": 3018128.0, "reward": 1.8776674270629883, "reward_std": 0.16294483840465546, "rewards/ROUGEL_entities_reward/mean": 0.44016748666763306, "rewards/ROUGEL_entities_reward/std": 0.273531973361969, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.328125, "rewards/f1_entities_exact_reward/std": 0.35033106803894043, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 57 }, { "completion_length": 946.9375, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1982.0, "completions/mean_length": 947.90625, "completions/mean_terminated_length": 912.4193115234375, "completions/min_length": 423.0, "completions/min_terminated_length": 423.0, "epoch": 0.2265625, "frac_reward_zero_std": 0.5, "grad_norm": 1.0758155584335327, "kl": 0.02901648124679923, "learning_rate": 3.5625e-06, "loss": 0.0, "num_tokens": 3073333.0, "reward": 1.6864192485809326, "reward_std": 0.24523183703422546, "rewards/ROUGEL_entities_reward/mean": 0.46766918897628784, "rewards/ROUGEL_entities_reward/std": 0.30791956186294556, "rewards/answer_correctness_func/mean": 0.03125, "rewards/answer_correctness_func/std": 0.1767766922712326, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.21875, "rewards/f1_entities_exact_reward/std": 0.2822004556655884, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 58 }, { "completion_length": 844.34375, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1750.0, "completions/mean_length": 845.3125, "completions/mean_terminated_length": 806.51611328125, "completions/min_length": 381.0, "completions/min_terminated_length": 381.0, "epoch": 0.23046875, "frac_reward_zero_std": 0.0, "grad_norm": 1.611671805381775, "kl": 0.027586993295699358, "learning_rate": 3.625e-06, "loss": 0.0, "num_tokens": 3125323.0, "reward": 1.3790805339813232, "reward_std": 0.17383891344070435, "rewards/ROUGEL_entities_reward/mean": 0.36345553398132324, "rewards/ROUGEL_entities_reward/std": 0.22647835314273834, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.046875, "rewards/f1_entities_exact_reward/std": 0.1480722874403, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 59 }, { "completion_length": 788.65625, "completions/clipped_ratio": 0.03125, "completions/max_length": 2002.0, "completions/max_terminated_length": 1931.0, "completions/mean_length": 789.625, "completions/mean_terminated_length": 750.51611328125, "completions/min_length": 318.0, "completions/min_terminated_length": 318.0, "epoch": 0.234375, "frac_reward_zero_std": 0.125, "grad_norm": 1.4535969495773315, "kl": 0.2797043500468135, "learning_rate": 3.6875000000000007e-06, "loss": 0.0003, "num_tokens": 3175763.0, "reward": 1.3903493881225586, "reward_std": 0.27898839116096497, "rewards/ROUGEL_entities_reward/mean": 0.4215993881225586, "rewards/ROUGEL_entities_reward/std": 0.2551148533821106, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.015625, "rewards/f1_entities_exact_reward/std": 0.0883883461356163, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 60 }, { "completion_length": 792.71875, "completions/clipped_ratio": 0.0, "completions/max_length": 1667.0, "completions/max_terminated_length": 1667.0, "completions/mean_length": 793.71875, "completions/mean_terminated_length": 793.71875, "completions/min_length": 384.0, "completions/min_terminated_length": 384.0, "epoch": 0.23828125, "frac_reward_zero_std": 0.0, "grad_norm": 0.04302690178155899, "kl": 0.0008610641962150112, "learning_rate": 3.7500000000000005e-06, "loss": 0.0, "num_tokens": 3225790.0, "reward": 1.4344795942306519, "reward_std": 0.1498142033815384, "rewards/ROUGEL_entities_reward/mean": 0.37197959423065186, "rewards/ROUGEL_entities_reward/std": 0.15754859149456024, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 61 }, { "completion_length": 933.84375, "completions/clipped_ratio": 0.0, "completions/max_length": 1850.0, "completions/max_terminated_length": 1850.0, "completions/mean_length": 934.84375, "completions/mean_terminated_length": 934.84375, "completions/min_length": 319.0, "completions/min_terminated_length": 319.0, "epoch": 0.2421875, "frac_reward_zero_std": 0.0, "grad_norm": 0.0374126136302948, "kl": 0.0008230292587541044, "learning_rate": 3.8125e-06, "loss": 0.0, "num_tokens": 3281141.0, "reward": 1.545864462852478, "reward_std": 0.2267509251832962, "rewards/ROUGEL_entities_reward/mean": 0.436489462852478, "rewards/ROUGEL_entities_reward/std": 0.22274264693260193, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 62 }, { "completion_length": 726.625, "completions/clipped_ratio": 0.0, "completions/max_length": 1713.0, "completions/max_terminated_length": 1713.0, "completions/mean_length": 727.625, "completions/mean_terminated_length": 727.625, "completions/min_length": 424.0, "completions/min_terminated_length": 424.0, "epoch": 0.24609375, "frac_reward_zero_std": 0.25, "grad_norm": 0.036695897579193115, "kl": 0.0008863469702191651, "learning_rate": 3.875e-06, "loss": 0.0, "num_tokens": 3329261.0, "reward": 1.291222095489502, "reward_std": 0.0680345669388771, "rewards/ROUGEL_entities_reward/mean": 0.29122209548950195, "rewards/ROUGEL_entities_reward/std": 0.18511660397052765, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0, "rewards/f1_entities_exact_reward/std": 0.0, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 63 }, { "completion_length": 770.03125, "completions/clipped_ratio": 0.0, "completions/max_length": 1912.0, "completions/max_terminated_length": 1912.0, "completions/mean_length": 771.03125, "completions/mean_terminated_length": 771.03125, "completions/min_length": 407.0, "completions/min_terminated_length": 407.0, "epoch": 0.25, "frac_reward_zero_std": 0.125, "grad_norm": 1.3695529699325562, "kl": 0.027544385753571987, "learning_rate": 3.9375e-06, "loss": 0.0, "num_tokens": 3380906.0, "reward": 1.7645435333251953, "reward_std": 0.2773824632167816, "rewards/ROUGEL_entities_reward/mean": 0.4520435929298401, "rewards/ROUGEL_entities_reward/std": 0.3055833876132965, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.1875, "rewards/f1_entities_exact_reward/std": 0.3535533845424652, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 64 }, { "completion_length": 1081.59375, "completions/clipped_ratio": 0.0625, "completions/max_length": 2048.0, "completions/max_terminated_length": 2006.0, "completions/mean_length": 1082.53125, "completions/mean_terminated_length": 1018.166748046875, "completions/min_length": 408.0, "completions/min_terminated_length": 408.0, "epoch": 0.25390625, "frac_reward_zero_std": 0.0, "grad_norm": 1.2219723463058472, "kl": 0.02520414860919118, "learning_rate": 4.000000000000001e-06, "loss": 0.0, "num_tokens": 3440707.0, "reward": 1.6349719762802124, "reward_std": 0.21872639656066895, "rewards/ROUGEL_entities_reward/mean": 0.3849719166755676, "rewards/ROUGEL_entities_reward/std": 0.29507917165756226, "rewards/answer_correctness_func/mean": 0.09375, "rewards/answer_correctness_func/std": 0.2961445748806, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.15625, "rewards/f1_entities_exact_reward/std": 0.3222276270389557, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 65 }, { "completion_length": 845.25, "completions/clipped_ratio": 0.0, "completions/max_length": 1681.0, "completions/max_terminated_length": 1681.0, "completions/mean_length": 846.25, "completions/mean_terminated_length": 846.25, "completions/min_length": 424.0, "completions/min_terminated_length": 424.0, "epoch": 0.2578125, "frac_reward_zero_std": 0.25, "grad_norm": 0.03518102690577507, "kl": 0.0008721806952962652, "learning_rate": 4.0625000000000005e-06, "loss": 0.0, "num_tokens": 3491951.0, "reward": 1.4318032264709473, "reward_std": 0.09064435213804245, "rewards/ROUGEL_entities_reward/mean": 0.3380531668663025, "rewards/ROUGEL_entities_reward/std": 0.1920674592256546, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.09375, "rewards/f1_entities_exact_reward/std": 0.19827888906002045, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 66 }, { "completion_length": 765.75, "completions/clipped_ratio": 0.03125, "completions/max_length": 2019.0, "completions/max_terminated_length": 1752.0, "completions/mean_length": 766.71875, "completions/mean_terminated_length": 726.3225708007812, "completions/min_length": 420.0, "completions/min_terminated_length": 420.0, "epoch": 0.26171875, "frac_reward_zero_std": 0.25, "grad_norm": 1.3443408012390137, "kl": 0.02946723997592926, "learning_rate": 4.125e-06, "loss": 0.0, "num_tokens": 3540814.0, "reward": 1.4851843118667603, "reward_std": 0.2511700689792633, "rewards/ROUGEL_entities_reward/mean": 0.39143434166908264, "rewards/ROUGEL_entities_reward/std": 0.2150370329618454, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 67 }, { "completion_length": 735.9375, "completions/clipped_ratio": 0.0625, "completions/max_length": 1953.0, "completions/max_terminated_length": 1662.0, "completions/mean_length": 736.875, "completions/mean_terminated_length": 655.800048828125, "completions/min_length": 288.0, "completions/min_terminated_length": 288.0, "epoch": 0.265625, "frac_reward_zero_std": 0.125, "grad_norm": 1.547475814819336, "kl": 0.08277505822479725, "learning_rate": 4.1875e-06, "loss": 0.0001, "num_tokens": 3590206.0, "reward": 1.3710753917694092, "reward_std": 0.2990349233150482, "rewards/ROUGEL_entities_reward/mean": 0.3710753619670868, "rewards/ROUGEL_entities_reward/std": 0.2627098858356476, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 68 }, { "completion_length": 855.09375, "completions/clipped_ratio": 0.03125, "completions/max_length": 2037.0, "completions/max_terminated_length": 1856.0, "completions/mean_length": 856.0625, "completions/mean_terminated_length": 817.9677124023438, "completions/min_length": 355.0, "completions/min_terminated_length": 355.0, "epoch": 0.26953125, "frac_reward_zero_std": 0.125, "grad_norm": 1.1259685754776, "kl": 0.035014061257243156, "learning_rate": 4.25e-06, "loss": 0.0, "num_tokens": 3642256.0, "reward": 1.4482572078704834, "reward_std": 0.20823946595191956, "rewards/ROUGEL_entities_reward/mean": 0.401382178068161, "rewards/ROUGEL_entities_reward/std": 0.30484357476234436, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 69 }, { "completion_length": 891.4375, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1997.0, "completions/mean_length": 892.40625, "completions/mean_terminated_length": 855.1290283203125, "completions/min_length": 381.0, "completions/min_terminated_length": 381.0, "epoch": 0.2734375, "frac_reward_zero_std": 0.25, "grad_norm": 1.9959722757339478, "kl": 0.0265270434319973, "learning_rate": 4.312500000000001e-06, "loss": 0.0, "num_tokens": 3695461.0, "reward": 1.6611111164093018, "reward_std": 0.3453267514705658, "rewards/ROUGEL_entities_reward/mean": 0.47361117601394653, "rewards/ROUGEL_entities_reward/std": 0.28843188285827637, "rewards/answer_correctness_func/mean": 0.03125, "rewards/answer_correctness_func/std": 0.1767766922712326, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.1875, "rewards/f1_entities_exact_reward/std": 0.2767903506755829, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 70 }, { "completion_length": 982.875, "completions/clipped_ratio": 0.03125, "completions/max_length": 1874.0, "completions/max_terminated_length": 1648.0, "completions/mean_length": 983.84375, "completions/mean_terminated_length": 955.1290283203125, "completions/min_length": 416.0, "completions/min_terminated_length": 416.0, "epoch": 0.27734375, "frac_reward_zero_std": 0.125, "grad_norm": 0.029792383313179016, "kl": 0.0008207843056879938, "learning_rate": 4.3750000000000005e-06, "loss": 0.0, "num_tokens": 3752536.0, "reward": 1.3520866632461548, "reward_std": 0.18100523948669434, "rewards/ROUGEL_entities_reward/mean": 0.3364616632461548, "rewards/ROUGEL_entities_reward/std": 0.24795283377170563, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.046875, "rewards/f1_entities_exact_reward/std": 0.1480722874403, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 71 }, { "completion_length": 850.21875, "completions/clipped_ratio": 0.09375, "completions/max_length": 1926.0, "completions/max_terminated_length": 1693.0, "completions/mean_length": 851.125, "completions/mean_terminated_length": 739.9310302734375, "completions/min_length": 361.0, "completions/min_terminated_length": 361.0, "epoch": 0.28125, "frac_reward_zero_std": 0.25, "grad_norm": 0.03854809328913689, "kl": 0.0008960039122030139, "learning_rate": 4.4375e-06, "loss": 0.0, "num_tokens": 3805416.0, "reward": 1.6687471866607666, "reward_std": 0.14818844199180603, "rewards/ROUGEL_entities_reward/mean": 0.4656221270561218, "rewards/ROUGEL_entities_reward/std": 0.2874893844127655, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.3415895998477936, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 72 }, { "completion_length": 988.78125, "completions/clipped_ratio": 0.03125, "completions/max_length": 2010.0, "completions/max_terminated_length": 1971.0, "completions/mean_length": 989.75, "completions/mean_terminated_length": 956.8386840820312, "completions/min_length": 362.0, "completions/min_terminated_length": 362.0, "epoch": 0.28515625, "frac_reward_zero_std": 0.0, "grad_norm": 4.410595893859863, "kl": 1.133633098565042, "learning_rate": 4.5e-06, "loss": 0.0011, "num_tokens": 3862068.0, "reward": 1.9691169261932373, "reward_std": 0.5512886643409729, "rewards/ROUGEL_entities_reward/mean": 0.6253669261932373, "rewards/ROUGEL_entities_reward/std": 0.2584879398345947, "rewards/answer_correctness_func/mean": 0.0625, "rewards/answer_correctness_func/std": 0.24593468010425568, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.3125, "rewards/f1_entities_exact_reward/std": 0.3045355975627899, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 73 }, { "completion_length": 775.59375, "completions/clipped_ratio": 0.0, "completions/max_length": 1774.0, "completions/max_terminated_length": 1774.0, "completions/mean_length": 776.59375, "completions/mean_terminated_length": 776.59375, "completions/min_length": 398.0, "completions/min_terminated_length": 398.0, "epoch": 0.2890625, "frac_reward_zero_std": 0.0, "grad_norm": 0.040159571915864944, "kl": 0.0008282668277388439, "learning_rate": 4.5625e-06, "loss": 0.0, "num_tokens": 3911955.0, "reward": 1.3375033140182495, "reward_std": 0.1888979822397232, "rewards/ROUGEL_entities_reward/mean": 0.3375033736228943, "rewards/ROUGEL_entities_reward/std": 0.24318675696849823, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.03125, "rewards/f1_entities_exact_reward/std": 0.12296734005212784, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 74 }, { "completion_length": 897.1875, "completions/clipped_ratio": 0.03125, "completions/max_length": 2032.0, "completions/max_terminated_length": 1929.0, "completions/mean_length": 898.15625, "completions/mean_terminated_length": 861.5806274414062, "completions/min_length": 332.0, "completions/min_terminated_length": 332.0, "epoch": 0.29296875, "frac_reward_zero_std": 0.375, "grad_norm": 1.2010027170181274, "kl": 0.024983107578009367, "learning_rate": 4.625000000000001e-06, "loss": 0.0, "num_tokens": 3965664.0, "reward": 1.5350582599639893, "reward_std": 0.11854691803455353, "rewards/ROUGEL_entities_reward/mean": 0.4413083791732788, "rewards/ROUGEL_entities_reward/std": 0.26900914311408997, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.125, "rewards/f1_entities_exact_reward/std": 0.2199706733226776, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 75 }, { "completion_length": 752.875, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1311.0, "completions/mean_length": 753.84375, "completions/mean_terminated_length": 712.0967407226562, "completions/min_length": 415.0, "completions/min_terminated_length": 415.0, "epoch": 0.296875, "frac_reward_zero_std": 0.375, "grad_norm": 1.3387047052383423, "kl": 0.027603973634541035, "learning_rate": 4.6875000000000004e-06, "loss": 0.0, "num_tokens": 4014499.0, "reward": 1.4758903980255127, "reward_std": 0.1006816178560257, "rewards/ROUGEL_entities_reward/mean": 0.36651527881622314, "rewards/ROUGEL_entities_reward/std": 0.25629162788391113, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 76 }, { "completion_length": 687.625, "completions/clipped_ratio": 0.0, "completions/max_length": 1556.0, "completions/max_terminated_length": 1556.0, "completions/mean_length": 688.625, "completions/mean_terminated_length": 688.625, "completions/min_length": 360.0, "completions/min_terminated_length": 360.0, "epoch": 0.30078125, "frac_reward_zero_std": 0.125, "grad_norm": 0.04233290255069733, "kl": 0.0008787867118371651, "learning_rate": 4.75e-06, "loss": 0.0, "num_tokens": 4062459.0, "reward": 1.5820362567901611, "reward_std": 0.13097786903381348, "rewards/ROUGEL_entities_reward/mean": 0.45703619718551636, "rewards/ROUGEL_entities_reward/std": 0.1624954342842102, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.125, "rewards/f1_entities_exact_reward/std": 0.2199706733226776, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 77 }, { "completion_length": 903.1875, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 1803.0, "completions/mean_length": 904.15625, "completions/mean_terminated_length": 867.258056640625, "completions/min_length": 432.0, "completions/min_terminated_length": 432.0, "epoch": 0.3046875, "frac_reward_zero_std": 0.0, "grad_norm": 1.5431634187698364, "kl": 0.029040120542049408, "learning_rate": 4.8125e-06, "loss": 0.0, "num_tokens": 4116424.0, "reward": 1.3482718467712402, "reward_std": 0.0755050778388977, "rewards/ROUGEL_entities_reward/mean": 0.285771906375885, "rewards/ROUGEL_entities_reward/std": 0.2148081213235855, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 78 }, { "completion_length": 971.6875, "completions/clipped_ratio": 0.03125, "completions/max_length": 2025.0, "completions/max_terminated_length": 2020.0, "completions/mean_length": 972.65625, "completions/mean_terminated_length": 938.7096557617188, "completions/min_length": 306.0, "completions/min_terminated_length": 306.0, "epoch": 0.30859375, "frac_reward_zero_std": 0.0, "grad_norm": 1.578683614730835, "kl": 0.02796661714091897, "learning_rate": 4.875e-06, "loss": 0.0, "num_tokens": 4173029.0, "reward": 1.6396772861480713, "reward_std": 0.513664960861206, "rewards/ROUGEL_entities_reward/mean": 0.4365522861480713, "rewards/ROUGEL_entities_reward/std": 0.2955634593963623, "rewards/answer_correctness_func/mean": 0.0625, "rewards/answer_correctness_func/std": 0.24593468010425568, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.1875, "rewards/f1_entities_exact_reward/std": 0.3045355975627899, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 79 }, { "completion_length": 735.53125, "completions/clipped_ratio": 0.0, "completions/max_length": 1546.0, "completions/max_terminated_length": 1546.0, "completions/mean_length": 736.53125, "completions/mean_terminated_length": 736.53125, "completions/min_length": 329.0, "completions/min_terminated_length": 329.0, "epoch": 0.3125, "frac_reward_zero_std": 0.5, "grad_norm": 0.035579681396484375, "kl": 0.0008356323232874274, "learning_rate": 4.937500000000001e-06, "loss": 0.0, "num_tokens": 4221334.0, "reward": 1.6618772745132446, "reward_std": 0.08351492881774902, "rewards/ROUGEL_entities_reward/mean": 0.5212522745132446, "rewards/ROUGEL_entities_reward/std": 0.21072913706302643, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.22840170562267303, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 80 }, { "completion_length": 875.875, "completions/clipped_ratio": 0.03125, "completions/max_length": 2027.0, "completions/max_terminated_length": 1542.0, "completions/mean_length": 876.84375, "completions/mean_terminated_length": 839.7418823242188, "completions/min_length": 447.0, "completions/min_terminated_length": 447.0, "epoch": 0.31640625, "frac_reward_zero_std": 0.125, "grad_norm": 1.0496132373809814, "kl": 0.02937435731291771, "learning_rate": 5e-06, "loss": 0.0, "num_tokens": 4273549.0, "reward": 1.2269667387008667, "reward_std": 0.07633554935455322, "rewards/ROUGEL_entities_reward/mean": 0.22696669399738312, "rewards/ROUGEL_entities_reward/std": 0.1473868191242218, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0, "rewards/f1_entities_exact_reward/std": 0.0, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 81 }, { "completion_length": 773.4375, "completions/clipped_ratio": 0.0625, "completions/max_length": 2048.0, "completions/max_terminated_length": 1445.0, "completions/mean_length": 774.375, "completions/mean_terminated_length": 689.4666748046875, "completions/min_length": 373.0, "completions/min_terminated_length": 373.0, "epoch": 0.3203125, "frac_reward_zero_std": 0.125, "grad_norm": 1.8092247247695923, "kl": 0.03204902959987521, "learning_rate": 4.999976201801837e-06, "loss": 0.0, "num_tokens": 4322861.0, "reward": 1.5633201599121094, "reward_std": 0.2757198214530945, "rewards/ROUGEL_entities_reward/mean": 0.4070702791213989, "rewards/ROUGEL_entities_reward/std": 0.3196541965007782, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.203125, "rewards/f1_entities_exact_reward/std": 0.24949544668197632, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 82 }, { "completion_length": 811.1875, "completions/clipped_ratio": 0.0, "completions/max_length": 1739.0, "completions/max_terminated_length": 1739.0, "completions/mean_length": 812.1875, "completions/mean_terminated_length": 812.1875, "completions/min_length": 395.0, "completions/min_terminated_length": 395.0, "epoch": 0.32421875, "frac_reward_zero_std": 0.125, "grad_norm": 0.03791806846857071, "kl": 0.0008129881898639724, "learning_rate": 4.9999048076604286e-06, "loss": 0.0, "num_tokens": 4374903.0, "reward": 1.2671880722045898, "reward_std": 0.08097401261329651, "rewards/ROUGEL_entities_reward/mean": 0.2515629827976227, "rewards/ROUGEL_entities_reward/std": 0.1857381910085678, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0, "rewards/f1_entities_exact_reward/std": 0.0, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 83 }, { "completion_length": 945.21875, "completions/clipped_ratio": 0.0, "completions/max_length": 1902.0, "completions/max_terminated_length": 1902.0, "completions/mean_length": 946.21875, "completions/mean_terminated_length": 946.21875, "completions/min_length": 390.0, "completions/min_terminated_length": 390.0, "epoch": 0.328125, "frac_reward_zero_std": 0.25, "grad_norm": 0.0345589853823185, "kl": 0.0008043982816161588, "learning_rate": 4.999785818935018e-06, "loss": 0.0, "num_tokens": 4430606.0, "reward": 1.539707899093628, "reward_std": 0.1531979739665985, "rewards/ROUGEL_entities_reward/mean": 0.41470780968666077, "rewards/ROUGEL_entities_reward/std": 0.16835904121398926, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.109375, "rewards/f1_entities_exact_reward/std": 0.2100067138671875, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 84 }, { "completion_length": 919.6875, "completions/clipped_ratio": 0.03125, "completions/max_length": 1972.0, "completions/max_terminated_length": 1955.0, "completions/mean_length": 920.65625, "completions/mean_terminated_length": 886.7418823242188, "completions/min_length": 353.0, "completions/min_terminated_length": 353.0, "epoch": 0.33203125, "frac_reward_zero_std": 0.375, "grad_norm": 0.876036524772644, "kl": 0.029854314867407084, "learning_rate": 4.9996192378909785e-06, "loss": 0.0, "num_tokens": 4485207.0, "reward": 1.4873874187469482, "reward_std": 0.1799616515636444, "rewards/ROUGEL_entities_reward/mean": 0.33113738894462585, "rewards/ROUGEL_entities_reward/std": 0.3323952555656433, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.125, "rewards/f1_entities_exact_reward/std": 0.33601075410842896, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 85 }, { "completion_length": 883.5625, "completions/clipped_ratio": 0.03125, "completions/max_length": 1960.0, "completions/max_terminated_length": 1853.0, "completions/mean_length": 884.53125, "completions/mean_terminated_length": 849.8386840820312, "completions/min_length": 370.0, "completions/min_terminated_length": 370.0, "epoch": 0.3359375, "frac_reward_zero_std": 0.0, "grad_norm": 1.041625738143921, "kl": 0.03574475646018982, "learning_rate": 4.999405067699773e-06, "loss": 0.0, "num_tokens": 4539352.0, "reward": 1.9239509105682373, "reward_std": 0.3379821181297302, "rewards/ROUGEL_entities_reward/mean": 0.5802007913589478, "rewards/ROUGEL_entities_reward/std": 0.26507386565208435, "rewards/answer_correctness_func/mean": 0.09375, "rewards/answer_correctness_func/std": 0.2961445748806, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.265625, "rewards/f1_entities_exact_reward/std": 0.3356355130672455, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.015625, "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 86 }, { "completion_length": 967.25, "completions/clipped_ratio": 0.0, "completions/max_length": 1601.0, "completions/max_terminated_length": 1601.0, "completions/mean_length": 968.25, "completions/mean_terminated_length": 968.25, "completions/min_length": 363.0, "completions/min_terminated_length": 363.0, "epoch": 0.33984375, "frac_reward_zero_std": 0.25, "grad_norm": 0.0337342731654644, "kl": 0.0008577157859690487, "learning_rate": 4.999143312438893e-06, "loss": 0.0, "num_tokens": 4595608.0, "reward": 1.3930331468582153, "reward_std": 0.08991193026304245, "rewards/ROUGEL_entities_reward/mean": 0.37740814685821533, "rewards/ROUGEL_entities_reward/std": 0.262632817029953, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.015625, "rewards/f1_entities_exact_reward/std": 0.0883883461356163, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 87 }, { "completion_length": 930.5625, "completions/clipped_ratio": 0.03125, "completions/max_length": 2034.0, "completions/max_terminated_length": 1869.0, "completions/mean_length": 931.53125, "completions/mean_terminated_length": 895.9677124023438, "completions/min_length": 393.0, "completions/min_terminated_length": 393.0, "epoch": 0.34375, "frac_reward_zero_std": 0.25, "grad_norm": 4106.8095703125, "kl": 248.08653182303533, "learning_rate": 4.998833977091783e-06, "loss": 0.2481, "num_tokens": 4650097.0, "reward": 1.2493809461593628, "reward_std": 0.22820821404457092, "rewards/ROUGEL_entities_reward/mean": 0.23375599086284637, "rewards/ROUGEL_entities_reward/std": 0.2611769437789917, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.046875, "rewards/f1_entities_exact_reward/std": 0.1480722874403, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 88 }, { "completion_length": 769.15625, "completions/clipped_ratio": 0.03125, "completions/max_length": 1983.0, "completions/max_terminated_length": 1426.0, "completions/mean_length": 770.125, "completions/mean_terminated_length": 731.0, "completions/min_length": 370.0, "completions/min_terminated_length": 370.0, "epoch": 0.34765625, "frac_reward_zero_std": 0.0, "grad_norm": 1.7972824573516846, "kl": 0.0501269455999136, "learning_rate": 4.99847706754774e-06, "loss": 0.0, "num_tokens": 4699553.0, "reward": 1.381695032119751, "reward_std": 0.22855672240257263, "rewards/ROUGEL_entities_reward/mean": 0.33482009172439575, "rewards/ROUGEL_entities_reward/std": 0.16944284737110138, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.078125, "rewards/f1_entities_exact_reward/std": 0.18445101380348206, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 89 }, { "completion_length": 793.9375, "completions/clipped_ratio": 0.0, "completions/max_length": 1948.0, "completions/max_terminated_length": 1948.0, "completions/mean_length": 794.9375, "completions/mean_terminated_length": 794.9375, "completions/min_length": 344.0, "completions/min_terminated_length": 344.0, "epoch": 0.3515625, "frac_reward_zero_std": 0.25, "grad_norm": 9.503633499145508, "kl": 28.800375290215015, "learning_rate": 4.998072590601808e-06, "loss": 0.0288, "num_tokens": 4750315.0, "reward": 1.7471970319747925, "reward_std": 0.19717249274253845, "rewards/ROUGEL_entities_reward/mean": 0.5128220319747925, "rewards/ROUGEL_entities_reward/std": 0.2762593626976013, "rewards/answer_correctness_func/mean": 0.03125, "rewards/answer_correctness_func/std": 0.1767766922712326, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.203125, "rewards/f1_entities_exact_reward/std": 0.27995896339416504, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 90 }, { "completion_length": 905.125, "completions/clipped_ratio": 0.03125, "completions/max_length": 2042.0, "completions/max_terminated_length": 1974.0, "completions/mean_length": 906.09375, "completions/mean_terminated_length": 869.4515991210938, "completions/min_length": 374.0, "completions/min_terminated_length": 374.0, "epoch": 0.35546875, "frac_reward_zero_std": 0.25, "grad_norm": 1.1816883087158203, "kl": 0.044529864564538, "learning_rate": 4.997620553954645e-06, "loss": 0.0, "num_tokens": 4804178.0, "reward": 1.4783854484558105, "reward_std": 0.3672109842300415, "rewards/ROUGEL_entities_reward/mean": 0.40026041865348816, "rewards/ROUGEL_entities_reward/std": 0.23726356029510498, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.171875, "rewards/f1_entities_exact_reward/std": 0.24127934873104095, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 91 }, { "completion_length": 1095.4375, "completions/clipped_ratio": 0.0, "completions/max_length": 1853.0, "completions/max_terminated_length": 1853.0, "completions/mean_length": 1096.4375, "completions/mean_terminated_length": 1096.4375, "completions/min_length": 384.0, "completions/min_terminated_length": 384.0, "epoch": 0.359375, "frac_reward_zero_std": 0.25, "grad_norm": 0.0298001766204834, "kl": 0.0007554437761427835, "learning_rate": 4.9971209662123774e-06, "loss": 0.0, "num_tokens": 4864664.0, "reward": 1.6353673934936523, "reward_std": 0.12443146109580994, "rewards/ROUGEL_entities_reward/mean": 0.40099239349365234, "rewards/ROUGEL_entities_reward/std": 0.2766393721103668, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.234375, "rewards/f1_entities_exact_reward/std": 0.253503680229187, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 92 }, { "completion_length": 730.5, "completions/clipped_ratio": 0.03125, "completions/max_length": 2036.0, "completions/max_terminated_length": 1719.0, "completions/mean_length": 731.46875, "completions/mean_terminated_length": 689.3870849609375, "completions/min_length": 352.0, "completions/min_terminated_length": 352.0, "epoch": 0.36328125, "frac_reward_zero_std": 0.25, "grad_norm": 1.3264824151992798, "kl": 0.05570895969867706, "learning_rate": 4.9965738368864345e-06, "loss": 0.0001, "num_tokens": 4913231.0, "reward": 1.7316737174987793, "reward_std": 0.19201873242855072, "rewards/ROUGEL_entities_reward/mean": 0.4504236876964569, "rewards/ROUGEL_entities_reward/std": 0.32061126828193665, "rewards/answer_correctness_func/mean": 0.09375, "rewards/answer_correctness_func/std": 0.2961445748806, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.1875, "rewards/f1_entities_exact_reward/std": 0.3299559950828552, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 93 }, { "completion_length": 1029.375, "completions/clipped_ratio": 0.09375, "completions/max_length": 1992.0, "completions/max_terminated_length": 1818.0, "completions/mean_length": 1030.28125, "completions/mean_terminated_length": 930.7930908203125, "completions/min_length": 472.0, "completions/min_terminated_length": 472.0, "epoch": 0.3671875, "frac_reward_zero_std": 0.25, "grad_norm": 1.0809646844863892, "kl": 0.04943352658301592, "learning_rate": 4.995979176393372e-06, "loss": 0.0, "num_tokens": 4971056.0, "reward": 1.286555290222168, "reward_std": 0.18572980165481567, "rewards/ROUGEL_entities_reward/mean": 0.3178052306175232, "rewards/ROUGEL_entities_reward/std": 0.2090727686882019, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.90625, "rewards/answer_format_func/std": 0.2961445748806, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 94 }, { "completion_length": 775.21875, "completions/clipped_ratio": 0.03125, "completions/max_length": 1960.0, "completions/max_terminated_length": 1870.0, "completions/mean_length": 776.1875, "completions/mean_terminated_length": 738.0, "completions/min_length": 375.0, "completions/min_terminated_length": 375.0, "epoch": 0.37109375, "frac_reward_zero_std": 0.5, "grad_norm": 0.027799174189567566, "kl": 0.000922409410122782, "learning_rate": 4.995336996054668e-06, "loss": 0.0, "num_tokens": 5021574.0, "reward": 1.3551305532455444, "reward_std": 0.035699695348739624, "rewards/ROUGEL_entities_reward/mean": 0.2926305830478668, "rewards/ROUGEL_entities_reward/std": 0.1515231877565384, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.0625, "rewards/f1_entities_exact_reward/std": 0.16800537705421448, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 95 }, { "completion_length": 754.03125, "completions/clipped_ratio": 0.0625, "completions/max_length": 2021.0, "completions/max_terminated_length": 1719.0, "completions/mean_length": 754.96875, "completions/mean_terminated_length": 670.5667114257812, "completions/min_length": 332.0, "completions/min_terminated_length": 332.0, "epoch": 0.375, "frac_reward_zero_std": 0.625, "grad_norm": 0.7481793761253357, "kl": 0.05968023743480444, "learning_rate": 4.994647308096509e-06, "loss": 0.0001, "num_tokens": 5071297.0, "reward": 1.4473375082015991, "reward_std": 0.11887349933385849, "rewards/ROUGEL_entities_reward/mean": 0.3379625082015991, "rewards/ROUGEL_entities_reward/std": 0.2742195427417755, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.96875, "rewards/answer_format_func/std": 0.1767766922712326, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.22840170562267303, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 96 }, { "completion_length": 756.8125, "completions/clipped_ratio": 0.0, "completions/max_length": 1560.0, "completions/max_terminated_length": 1560.0, "completions/mean_length": 757.8125, "completions/mean_terminated_length": 757.8125, "completions/min_length": 414.0, "completions/min_terminated_length": 414.0, "epoch": 0.37890625, "frac_reward_zero_std": 0.375, "grad_norm": 0.029540961608290672, "kl": 0.0009005384054034948, "learning_rate": 4.993910125649561e-06, "loss": -0.0, "num_tokens": 5120135.0, "reward": 1.629094123840332, "reward_std": 0.03689418360590935, "rewards/ROUGEL_entities_reward/mean": 0.3790941834449768, "rewards/ROUGEL_entities_reward/std": 0.31832432746887207, "rewards/answer_correctness_func/mean": 0.125, "rewards/answer_correctness_func/std": 0.33601075410842896, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.125, "rewards/f1_entities_exact_reward/std": 0.33601075410842896, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 97 }, { "completion_length": 936.9375, "completions/clipped_ratio": 0.03125, "completions/max_length": 1903.0, "completions/max_terminated_length": 1723.0, "completions/mean_length": 937.90625, "completions/mean_terminated_length": 906.774169921875, "completions/min_length": 419.0, "completions/min_terminated_length": 419.0, "epoch": 0.3828125, "frac_reward_zero_std": 0.0, "grad_norm": 0.03625582158565521, "kl": 0.0008680867176735774, "learning_rate": 4.993125462748714e-06, "loss": 0.0, "num_tokens": 5176528.0, "reward": 1.5279531478881836, "reward_std": 0.277273029088974, "rewards/ROUGEL_entities_reward/mean": 0.4498281478881836, "rewards/ROUGEL_entities_reward/std": 0.24050240218639374, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.22840170562267303, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 98 }, { "completion_length": 794.09375, "completions/clipped_ratio": 0.0, "completions/max_length": 1443.0, "completions/max_terminated_length": 1443.0, "completions/mean_length": 795.09375, "completions/mean_terminated_length": 795.09375, "completions/min_length": 339.0, "completions/min_terminated_length": 339.0, "epoch": 0.38671875, "frac_reward_zero_std": 0.0, "grad_norm": 0.044495273381471634, "kl": 0.0009377674432471395, "learning_rate": 4.992293334332821e-06, "loss": 0.0, "num_tokens": 5227423.0, "reward": 1.5689302682876587, "reward_std": 0.16798686981201172, "rewards/ROUGEL_entities_reward/mean": 0.4283052682876587, "rewards/ROUGEL_entities_reward/std": 0.24358195066452026, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 1.0, "rewards/answer_format_func/std": 0.0, "rewards/f1_entities_exact_reward/mean": 0.140625, "rewards/f1_entities_exact_reward/std": 0.22840170562267303, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 99 }, { "completion_length": 807.0625, "completions/clipped_ratio": 0.03125, "completions/max_length": 2048.0, "completions/max_terminated_length": 2017.0, "completions/mean_length": 808.03125, "completions/mean_terminated_length": 768.0322265625, "completions/min_length": 379.0, "completions/min_terminated_length": 379.0, "epoch": 0.390625, "frac_reward_zero_std": 0.25, "grad_norm": 1.4681968688964844, "kl": 0.09113121591508389, "learning_rate": 4.991413756244404e-06, "loss": 0.0001, "num_tokens": 5278544.0, "reward": 1.6429879665374756, "reward_std": 0.30271971225738525, "rewards/ROUGEL_entities_reward/mean": 0.4711129069328308, "rewards/ROUGEL_entities_reward/std": 0.23452715575695038, "rewards/answer_correctness_func/mean": 0.0, "rewards/answer_correctness_func/std": 0.0, "rewards/answer_format_func/mean": 0.9375, "rewards/answer_format_func/std": 0.24593468010425568, "rewards/f1_entities_exact_reward/mean": 0.234375, "rewards/f1_entities_exact_reward/std": 0.253503680229187, "rewards/generation_reward_func/mean": 0.0, "rewards/generation_reward_func/std": 0.0, "rewards/reasoning_equal_answer_reward/mean": 0.0, "rewards/reasoning_equal_answer_reward/std": 0.0, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "step": 100 } ], "logging_steps": 1, "max_steps": 800, "num_input_tokens_seen": 5278544, "num_train_epochs": 4, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }