Instructions to use Weisly/Qwen3-8b-grpo with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use Weisly/Qwen3-8b-grpo with Transformers:
# Load model directly from transformers import AutoModel model = AutoModel.from_pretrained("Weisly/Qwen3-8b-grpo", device_map="auto") - Notebooks
- Google Colab
- Kaggle
- Local Apps Settings
- Unsloth Desktop
| { | |
| "best_global_step": null, | |
| "best_metric": null, | |
| "best_model_checkpoint": null, | |
| "epoch": 0.390625, | |
| "eval_steps": 500, | |
| "global_step": 100, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "completion_length": 773.71875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1684.0, | |
| "completions/max_terminated_length": 1684.0, | |
| "completions/mean_length": 774.71875, | |
| "completions/mean_terminated_length": 774.71875, | |
| "completions/min_length": 389.0, | |
| "completions/min_terminated_length": 389.0, | |
| "epoch": 0.00390625, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 0.031107431277632713, | |
| "kl": 0.0, | |
| "learning_rate": 0.0, | |
| "loss": 0.0, | |
| "num_tokens": 49271.0, | |
| "reward": 1.4142889976501465, | |
| "reward_std": 0.05336200073361397, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3361639976501465, | |
| "rewards/ROUGEL_entities_reward/std": 0.24250923097133636, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 1 | |
| }, | |
| { | |
| "completion_length": 829.5, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1716.0, | |
| "completions/max_terminated_length": 1716.0, | |
| "completions/mean_length": 830.5, | |
| "completions/mean_terminated_length": 830.5, | |
| "completions/min_length": 353.0, | |
| "completions/min_terminated_length": 353.0, | |
| "epoch": 0.0078125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.032838013023138046, | |
| "kl": 0.0, | |
| "learning_rate": 6.250000000000001e-08, | |
| "loss": 0.0, | |
| "num_tokens": 101031.0, | |
| "reward": 1.6849710941314697, | |
| "reward_std": 0.07849985361099243, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4505961537361145, | |
| "rewards/ROUGEL_entities_reward/std": 0.17492875456809998, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.234375, | |
| "rewards/f1_entities_exact_reward/std": 0.253503680229187, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 2 | |
| }, | |
| { | |
| "completion_length": 858.21875, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1491.0, | |
| "completions/mean_length": 859.15625, | |
| "completions/mean_terminated_length": 779.9000244140625, | |
| "completions/min_length": 390.0, | |
| "completions/min_terminated_length": 390.0, | |
| "epoch": 0.01171875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.0946029424667358, | |
| "kl": 0.04924837779253721, | |
| "learning_rate": 1.2500000000000002e-07, | |
| "loss": 0.0, | |
| "num_tokens": 154252.0, | |
| "reward": 1.7309010028839111, | |
| "reward_std": 0.20555105805397034, | |
| "rewards/ROUGEL_entities_reward/mean": 0.46527600288391113, | |
| "rewards/ROUGEL_entities_reward/std": 0.34173816442489624, | |
| "rewards/answer_correctness_func/mean": 0.09375, | |
| "rewards/answer_correctness_func/std": 0.2961445748806, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.234375, | |
| "rewards/f1_entities_exact_reward/std": 0.3356355130672455, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 3 | |
| }, | |
| { | |
| "completion_length": 750.09375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1529.0, | |
| "completions/max_terminated_length": 1529.0, | |
| "completions/mean_length": 751.09375, | |
| "completions/mean_terminated_length": 751.09375, | |
| "completions/min_length": 365.0, | |
| "completions/min_terminated_length": 365.0, | |
| "epoch": 0.015625, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.03853773698210716, | |
| "kl": 0.0008064582070801407, | |
| "learning_rate": 1.875e-07, | |
| "loss": 0.0, | |
| "num_tokens": 203603.0, | |
| "reward": 1.3999865055084229, | |
| "reward_std": 0.06636261940002441, | |
| "rewards/ROUGEL_entities_reward/mean": 0.33748650550842285, | |
| "rewards/ROUGEL_entities_reward/std": 0.24072480201721191, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 4 | |
| }, | |
| { | |
| "completion_length": 894.84375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1776.0, | |
| "completions/max_terminated_length": 1776.0, | |
| "completions/mean_length": 895.84375, | |
| "completions/mean_terminated_length": 895.84375, | |
| "completions/min_length": 439.0, | |
| "completions/min_terminated_length": 439.0, | |
| "epoch": 0.01953125, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.035162024199962616, | |
| "kl": 0.0008056848309934139, | |
| "learning_rate": 2.5000000000000004e-07, | |
| "loss": 0.0, | |
| "num_tokens": 257926.0, | |
| "reward": 1.6901798248291016, | |
| "reward_std": 0.2885170876979828, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5026798844337463, | |
| "rewards/ROUGEL_entities_reward/std": 0.2995758056640625, | |
| "rewards/answer_correctness_func/mean": 0.03125, | |
| "rewards/answer_correctness_func/std": 0.1767766922712326, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.26753053069114685, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 5 | |
| }, | |
| { | |
| "completion_length": 964.28125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1814.0, | |
| "completions/max_terminated_length": 1814.0, | |
| "completions/mean_length": 965.28125, | |
| "completions/mean_terminated_length": 965.28125, | |
| "completions/min_length": 482.0, | |
| "completions/min_terminated_length": 482.0, | |
| "epoch": 0.0234375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.030356423929333687, | |
| "kl": 0.000767507852287963, | |
| "learning_rate": 3.125e-07, | |
| "loss": 0.0, | |
| "num_tokens": 314519.0, | |
| "reward": 1.4136323928833008, | |
| "reward_std": 0.25806623697280884, | |
| "rewards/ROUGEL_entities_reward/mean": 0.39800751209259033, | |
| "rewards/ROUGEL_entities_reward/std": 0.27216652035713196, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.046875, | |
| "rewards/f1_entities_exact_reward/std": 0.1480722874403, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 6 | |
| }, | |
| { | |
| "completion_length": 737.40625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1714.0, | |
| "completions/max_terminated_length": 1714.0, | |
| "completions/mean_length": 738.40625, | |
| "completions/mean_terminated_length": 738.40625, | |
| "completions/min_length": 271.0, | |
| "completions/min_terminated_length": 271.0, | |
| "epoch": 0.02734375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.04363395646214485, | |
| "kl": 0.000862537999637425, | |
| "learning_rate": 3.75e-07, | |
| "loss": -0.0, | |
| "num_tokens": 363764.0, | |
| "reward": 1.5545895099639893, | |
| "reward_std": 0.1157001405954361, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3827144205570221, | |
| "rewards/ROUGEL_entities_reward/std": 0.2522861063480377, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.171875, | |
| "rewards/f1_entities_exact_reward/std": 0.24127934873104095, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 7 | |
| }, | |
| { | |
| "completion_length": 739.125, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1440.0, | |
| "completions/mean_length": 740.09375, | |
| "completions/mean_terminated_length": 697.9031982421875, | |
| "completions/min_length": 383.0, | |
| "completions/min_terminated_length": 383.0, | |
| "epoch": 0.03125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.2299633026123047, | |
| "kl": 0.03398810001090169, | |
| "learning_rate": 4.375e-07, | |
| "loss": 0.0, | |
| "num_tokens": 412659.0, | |
| "reward": 1.513428807258606, | |
| "reward_std": 0.2709747552871704, | |
| "rewards/ROUGEL_entities_reward/mean": 0.38842886686325073, | |
| "rewards/ROUGEL_entities_reward/std": 0.25137466192245483, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.23546454310417175, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 8 | |
| }, | |
| { | |
| "completion_length": 832.1875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1915.0, | |
| "completions/max_terminated_length": 1915.0, | |
| "completions/mean_length": 833.1875, | |
| "completions/mean_terminated_length": 833.1875, | |
| "completions/min_length": 432.0, | |
| "completions/min_terminated_length": 432.0, | |
| "epoch": 0.03515625, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.0308236014097929, | |
| "kl": 0.0008265759242931381, | |
| "learning_rate": 5.000000000000001e-07, | |
| "loss": 0.0, | |
| "num_tokens": 465181.0, | |
| "reward": 1.492291808128357, | |
| "reward_std": 0.1271674633026123, | |
| "rewards/ROUGEL_entities_reward/mean": 0.38291680812835693, | |
| "rewards/ROUGEL_entities_reward/std": 0.16038332879543304, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 9 | |
| }, | |
| { | |
| "completion_length": 788.78125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1711.0, | |
| "completions/max_terminated_length": 1711.0, | |
| "completions/mean_length": 789.78125, | |
| "completions/mean_terminated_length": 789.78125, | |
| "completions/min_length": 344.0, | |
| "completions/min_terminated_length": 344.0, | |
| "epoch": 0.0390625, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.04289854317903519, | |
| "kl": 0.0008371344592887908, | |
| "learning_rate": 5.625e-07, | |
| "loss": -0.0, | |
| "num_tokens": 515798.0, | |
| "reward": 1.7426328659057617, | |
| "reward_std": 0.1278819590806961, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4457578659057617, | |
| "rewards/ROUGEL_entities_reward/std": 0.29676324129104614, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.3463519513607025, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 10 | |
| }, | |
| { | |
| "completion_length": 947.84375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1947.0, | |
| "completions/max_terminated_length": 1625.0, | |
| "completions/mean_length": 948.8125, | |
| "completions/mean_terminated_length": 916.6128540039062, | |
| "completions/min_length": 368.0, | |
| "completions/min_terminated_length": 368.0, | |
| "epoch": 0.04296875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.031256962567567825, | |
| "kl": 0.0008525731100235134, | |
| "learning_rate": 6.25e-07, | |
| "loss": 0.0, | |
| "num_tokens": 571372.0, | |
| "reward": 1.6054279804229736, | |
| "reward_std": 0.2585637867450714, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4491780400276184, | |
| "rewards/ROUGEL_entities_reward/std": 0.21337461471557617, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.23546454310417175, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 11 | |
| }, | |
| { | |
| "completion_length": 796.375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1783.0, | |
| "completions/max_terminated_length": 1783.0, | |
| "completions/mean_length": 797.375, | |
| "completions/mean_terminated_length": 797.375, | |
| "completions/min_length": 379.0, | |
| "completions/min_terminated_length": 379.0, | |
| "epoch": 0.046875, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 0.03451008349657059, | |
| "kl": 0.0008439397643087432, | |
| "learning_rate": 6.875000000000001e-07, | |
| "loss": 0.0, | |
| "num_tokens": 622380.0, | |
| "reward": 1.8003621101379395, | |
| "reward_std": 0.09649848937988281, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5503621101379395, | |
| "rewards/ROUGEL_entities_reward/std": 0.24412204325199127, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.234375, | |
| "rewards/f1_entities_exact_reward/std": 0.253503680229187, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 12 | |
| }, | |
| { | |
| "completion_length": 827.34375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2047.0, | |
| "completions/max_terminated_length": 1974.0, | |
| "completions/mean_length": 828.3125, | |
| "completions/mean_terminated_length": 789.0, | |
| "completions/min_length": 342.0, | |
| "completions/min_terminated_length": 342.0, | |
| "epoch": 0.05078125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.4412877559661865, | |
| "kl": 0.03177165426313877, | |
| "learning_rate": 7.5e-07, | |
| "loss": 0.0, | |
| "num_tokens": 673534.0, | |
| "reward": 1.4974217414855957, | |
| "reward_std": 0.1358407884836197, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4661717712879181, | |
| "rewards/ROUGEL_entities_reward/std": 0.28460103273391724, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 13 | |
| }, | |
| { | |
| "completion_length": 951.6875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1936.0, | |
| "completions/max_terminated_length": 1936.0, | |
| "completions/mean_length": 952.6875, | |
| "completions/mean_terminated_length": 952.6875, | |
| "completions/min_length": 360.0, | |
| "completions/min_terminated_length": 360.0, | |
| "epoch": 0.0546875, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.047750119119882584, | |
| "kl": 0.0008222978794947267, | |
| "learning_rate": 8.125000000000001e-07, | |
| "loss": 0.0, | |
| "num_tokens": 728552.0, | |
| "reward": 1.4253430366516113, | |
| "reward_std": 0.107511967420578, | |
| "rewards/ROUGEL_entities_reward/mean": 0.40971803665161133, | |
| "rewards/ROUGEL_entities_reward/std": 0.2035004198551178, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.015625, | |
| "rewards/f1_entities_exact_reward/std": 0.0883883461356163, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 14 | |
| }, | |
| { | |
| "completion_length": 796.71875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1999.0, | |
| "completions/max_terminated_length": 1728.0, | |
| "completions/mean_length": 797.6875, | |
| "completions/mean_terminated_length": 758.9354858398438, | |
| "completions/min_length": 447.0, | |
| "completions/min_terminated_length": 447.0, | |
| "epoch": 0.05859375, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 1.1840251684188843, | |
| "kl": 0.035019629169255495, | |
| "learning_rate": 8.75e-07, | |
| "loss": 0.0, | |
| "num_tokens": 779450.0, | |
| "reward": 1.8847320079803467, | |
| "reward_std": 0.18553508818149567, | |
| "rewards/ROUGEL_entities_reward/mean": 0.6347318887710571, | |
| "rewards/ROUGEL_entities_reward/std": 0.24349310994148254, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.28125, | |
| "rewards/f1_entities_exact_reward/std": 0.2520080506801605, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 15 | |
| }, | |
| { | |
| "completion_length": 825.9375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1966.0, | |
| "completions/max_terminated_length": 1966.0, | |
| "completions/mean_length": 826.9375, | |
| "completions/mean_terminated_length": 826.9375, | |
| "completions/min_length": 346.0, | |
| "completions/min_terminated_length": 346.0, | |
| "epoch": 0.0625, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.03686046227812767, | |
| "kl": 0.0009055825939867646, | |
| "learning_rate": 9.375000000000001e-07, | |
| "loss": 0.0, | |
| "num_tokens": 830168.0, | |
| "reward": 1.503725290298462, | |
| "reward_std": 0.03653297573328018, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4412252902984619, | |
| "rewards/ROUGEL_entities_reward/std": 0.18260407447814941, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 16 | |
| }, | |
| { | |
| "completion_length": 831.65625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1710.0, | |
| "completions/mean_length": 832.625, | |
| "completions/mean_terminated_length": 793.4193115234375, | |
| "completions/min_length": 442.0, | |
| "completions/min_terminated_length": 442.0, | |
| "epoch": 0.06640625, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 11960.408203125, | |
| "kl": 91286.23423358332, | |
| "learning_rate": 1.0000000000000002e-06, | |
| "loss": 91.2862, | |
| "num_tokens": 882112.0, | |
| "reward": 1.9998295307159424, | |
| "reward_std": 0.1716785728931427, | |
| "rewards/ROUGEL_entities_reward/mean": 0.6092044115066528, | |
| "rewards/ROUGEL_entities_reward/std": 0.2381805032491684, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.265625, | |
| "rewards/f1_entities_exact_reward/std": 0.3588596284389496, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 17 | |
| }, | |
| { | |
| "completion_length": 735.09375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1963.0, | |
| "completions/max_terminated_length": 1963.0, | |
| "completions/mean_length": 736.09375, | |
| "completions/mean_terminated_length": 736.09375, | |
| "completions/min_length": 304.0, | |
| "completions/min_terminated_length": 304.0, | |
| "epoch": 0.0703125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.035265810787677765, | |
| "kl": 0.0008649405790492892, | |
| "learning_rate": 1.0625e-06, | |
| "loss": 0.0, | |
| "num_tokens": 930435.0, | |
| "reward": 1.6111576557159424, | |
| "reward_std": 0.2122671902179718, | |
| "rewards/ROUGEL_entities_reward/mean": 0.39240762591362, | |
| "rewards/ROUGEL_entities_reward/std": 0.2360842227935791, | |
| "rewards/answer_correctness_func/mean": 0.0625, | |
| "rewards/answer_correctness_func/std": 0.24593468010425568, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.2961445748806, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 18 | |
| }, | |
| { | |
| "completion_length": 929.3125, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 2029.0, | |
| "completions/mean_length": 930.28125, | |
| "completions/mean_terminated_length": 894.2257690429688, | |
| "completions/min_length": 385.0, | |
| "completions/min_terminated_length": 385.0, | |
| "epoch": 0.07421875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.1916157007217407, | |
| "kl": 0.026040656957775354, | |
| "learning_rate": 1.125e-06, | |
| "loss": 0.0, | |
| "num_tokens": 986084.0, | |
| "reward": 1.4042803049087524, | |
| "reward_std": 0.2482759654521942, | |
| "rewards/ROUGEL_entities_reward/mean": 0.40428024530410767, | |
| "rewards/ROUGEL_entities_reward/std": 0.2555541396141052, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.03125, | |
| "rewards/f1_entities_exact_reward/std": 0.12296734005212784, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 19 | |
| }, | |
| { | |
| "completion_length": 858.53125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1999.0, | |
| "completions/max_terminated_length": 1999.0, | |
| "completions/mean_length": 859.53125, | |
| "completions/mean_terminated_length": 859.53125, | |
| "completions/min_length": 327.0, | |
| "completions/min_terminated_length": 327.0, | |
| "epoch": 0.078125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.2272316217422485, | |
| "kl": 0.04151263926178217, | |
| "learning_rate": 1.1875e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1038577.0, | |
| "reward": 1.4781588315963745, | |
| "reward_std": 0.09865100681781769, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3687838315963745, | |
| "rewards/ROUGEL_entities_reward/std": 0.25713229179382324, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 20 | |
| }, | |
| { | |
| "completion_length": 735.03125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1646.0, | |
| "completions/max_terminated_length": 1646.0, | |
| "completions/mean_length": 736.03125, | |
| "completions/mean_terminated_length": 736.03125, | |
| "completions/min_length": 370.0, | |
| "completions/min_terminated_length": 370.0, | |
| "epoch": 0.08203125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.03574994206428528, | |
| "kl": 0.0008639947773190215, | |
| "learning_rate": 1.25e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1087414.0, | |
| "reward": 1.7493736743927002, | |
| "reward_std": 0.3073810338973999, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5149986743927002, | |
| "rewards/ROUGEL_entities_reward/std": 0.2595096230506897, | |
| "rewards/answer_correctness_func/mean": 0.0625, | |
| "rewards/answer_correctness_func/std": 0.24593468010425568, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.171875, | |
| "rewards/f1_entities_exact_reward/std": 0.30078861117362976, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 21 | |
| }, | |
| { | |
| "completion_length": 936.125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1829.0, | |
| "completions/max_terminated_length": 1829.0, | |
| "completions/mean_length": 937.125, | |
| "completions/mean_terminated_length": 937.125, | |
| "completions/min_length": 387.0, | |
| "completions/min_terminated_length": 387.0, | |
| "epoch": 0.0859375, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 0.030881009995937347, | |
| "kl": 0.0008643228356959298, | |
| "learning_rate": 1.3125000000000001e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1142902.0, | |
| "reward": 1.4245872497558594, | |
| "reward_std": 0.05940890312194824, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3933371901512146, | |
| "rewards/ROUGEL_entities_reward/std": 0.23100200295448303, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.03125, | |
| "rewards/f1_entities_exact_reward/std": 0.12296734005212784, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 22 | |
| }, | |
| { | |
| "completion_length": 949.09375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1974.0, | |
| "completions/max_terminated_length": 1957.0, | |
| "completions/mean_length": 950.0625, | |
| "completions/mean_terminated_length": 917.0322265625, | |
| "completions/min_length": 358.0, | |
| "completions/min_terminated_length": 358.0, | |
| "epoch": 0.08984375, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.360364317893982, | |
| "kl": 0.03316311351954937, | |
| "learning_rate": 1.3750000000000002e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1198068.0, | |
| "reward": 1.4728868007659912, | |
| "reward_std": 0.2027805596590042, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4260118901729584, | |
| "rewards/ROUGEL_entities_reward/std": 0.26421165466308594, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 23 | |
| }, | |
| { | |
| "completion_length": 983.4375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2043.0, | |
| "completions/max_terminated_length": 2041.0, | |
| "completions/mean_length": 984.40625, | |
| "completions/mean_terminated_length": 950.258056640625, | |
| "completions/min_length": 350.0, | |
| "completions/min_terminated_length": 350.0, | |
| "epoch": 0.09375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.449867844581604, | |
| "kl": 0.03517508413642645, | |
| "learning_rate": 1.4375e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1254353.0, | |
| "reward": 1.5606844425201416, | |
| "reward_std": 0.34358131885528564, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5138094425201416, | |
| "rewards/ROUGEL_entities_reward/std": 0.24284419417381287, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.22840170562267303, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 24 | |
| }, | |
| { | |
| "completion_length": 986.0625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1981.0, | |
| "completions/max_terminated_length": 1877.0, | |
| "completions/mean_length": 987.03125, | |
| "completions/mean_terminated_length": 954.9677124023438, | |
| "completions/min_length": 385.0, | |
| "completions/min_terminated_length": 385.0, | |
| "epoch": 0.09765625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.7202436923980713, | |
| "kl": 0.03029360854998231, | |
| "learning_rate": 1.5e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1311054.0, | |
| "reward": 1.5542736053466797, | |
| "reward_std": 0.2044057995080948, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4292736053466797, | |
| "rewards/ROUGEL_entities_reward/std": 0.187626451253891, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.23546454310417175, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 25 | |
| }, | |
| { | |
| "completion_length": 719.875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1817.0, | |
| "completions/max_terminated_length": 1817.0, | |
| "completions/mean_length": 720.875, | |
| "completions/mean_terminated_length": 720.875, | |
| "completions/min_length": 332.0, | |
| "completions/min_terminated_length": 332.0, | |
| "epoch": 0.1015625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.04885788634419441, | |
| "kl": 0.0009195755264954641, | |
| "learning_rate": 1.5625e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1359150.0, | |
| "reward": 1.3275928497314453, | |
| "reward_std": 0.05572877824306488, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3275929093360901, | |
| "rewards/ROUGEL_entities_reward/std": 0.2175500988960266, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0, | |
| "rewards/f1_entities_exact_reward/std": 0.0, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 26 | |
| }, | |
| { | |
| "completion_length": 787.3125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1927.0, | |
| "completions/max_terminated_length": 1927.0, | |
| "completions/mean_length": 788.3125, | |
| "completions/mean_terminated_length": 788.3125, | |
| "completions/min_length": 346.0, | |
| "completions/min_terminated_length": 346.0, | |
| "epoch": 0.10546875, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.047234393656253815, | |
| "kl": 0.0008445628191111609, | |
| "learning_rate": 1.6250000000000001e-06, | |
| "loss": -0.0, | |
| "num_tokens": 1409184.0, | |
| "reward": 1.6741223335266113, | |
| "reward_std": 0.17429909110069275, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4397473633289337, | |
| "rewards/ROUGEL_entities_reward/std": 0.2606096565723419, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.234375, | |
| "rewards/f1_entities_exact_reward/std": 0.253503680229187, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 27 | |
| }, | |
| { | |
| "completion_length": 908.09375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2037.0, | |
| "completions/max_terminated_length": 1410.0, | |
| "completions/mean_length": 909.0625, | |
| "completions/mean_terminated_length": 872.6773681640625, | |
| "completions/min_length": 436.0, | |
| "completions/min_terminated_length": 436.0, | |
| "epoch": 0.109375, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.1578987836837769, | |
| "kl": 0.029024578165262938, | |
| "learning_rate": 1.6875000000000001e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1463198.0, | |
| "reward": 1.3360178470611572, | |
| "reward_std": 0.194834902882576, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3516428768634796, | |
| "rewards/ROUGEL_entities_reward/std": 0.20796751976013184, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.015625, | |
| "rewards/f1_entities_exact_reward/std": 0.0883883461356163, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 28 | |
| }, | |
| { | |
| "completion_length": 877.6875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1722.0, | |
| "completions/max_terminated_length": 1722.0, | |
| "completions/mean_length": 878.6875, | |
| "completions/mean_terminated_length": 878.6875, | |
| "completions/min_length": 400.0, | |
| "completions/min_terminated_length": 400.0, | |
| "epoch": 0.11328125, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.036818020045757294, | |
| "kl": 0.0008321568457176909, | |
| "learning_rate": 1.75e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1516328.0, | |
| "reward": 1.284515619277954, | |
| "reward_std": 0.10075192153453827, | |
| "rewards/ROUGEL_entities_reward/mean": 0.2845155596733093, | |
| "rewards/ROUGEL_entities_reward/std": 0.20700469613075256, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0, | |
| "rewards/f1_entities_exact_reward/std": 0.0, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 29 | |
| }, | |
| { | |
| "completion_length": 801.90625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1763.0, | |
| "completions/max_terminated_length": 1763.0, | |
| "completions/mean_length": 802.90625, | |
| "completions/mean_terminated_length": 802.90625, | |
| "completions/min_length": 354.0, | |
| "completions/min_terminated_length": 354.0, | |
| "epoch": 0.1171875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.038571011275053024, | |
| "kl": 0.0008754348091315478, | |
| "learning_rate": 1.8125e-06, | |
| "loss": -0.0, | |
| "num_tokens": 1568001.0, | |
| "reward": 1.3216490745544434, | |
| "reward_std": 0.0878436490893364, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3216490149497986, | |
| "rewards/ROUGEL_entities_reward/std": 0.12796050310134888, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0, | |
| "rewards/f1_entities_exact_reward/std": 0.0, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 30 | |
| }, | |
| { | |
| "completion_length": 1019.875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1994.0, | |
| "completions/max_terminated_length": 1994.0, | |
| "completions/mean_length": 1020.875, | |
| "completions/mean_terminated_length": 1020.875, | |
| "completions/min_length": 317.0, | |
| "completions/min_terminated_length": 317.0, | |
| "epoch": 0.12109375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.9888184070587158, | |
| "kl": 0.030457815155386925, | |
| "learning_rate": 1.8750000000000003e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1625681.0, | |
| "reward": 1.6338975429534912, | |
| "reward_std": 0.0996546596288681, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5245225429534912, | |
| "rewards/ROUGEL_entities_reward/std": 0.1336575746536255, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 31 | |
| }, | |
| { | |
| "completion_length": 778.8125, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1987.0, | |
| "completions/max_terminated_length": 1386.0, | |
| "completions/mean_length": 779.78125, | |
| "completions/mean_terminated_length": 740.8386840820312, | |
| "completions/min_length": 448.0, | |
| "completions/min_terminated_length": 448.0, | |
| "epoch": 0.125, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.4051024913787842, | |
| "kl": 0.07832266436889768, | |
| "learning_rate": 1.9375e-06, | |
| "loss": 0.0001, | |
| "num_tokens": 1676698.0, | |
| "reward": 1.6515867710113525, | |
| "reward_std": 0.36416906118392944, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4640866816043854, | |
| "rewards/ROUGEL_entities_reward/std": 0.2700716555118561, | |
| "rewards/answer_correctness_func/mean": 0.03125, | |
| "rewards/answer_correctness_func/std": 0.1767766922712326, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.1875, | |
| "rewards/f1_entities_exact_reward/std": 0.2767903506755829, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 32 | |
| }, | |
| { | |
| "completion_length": 864.90625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2033.0, | |
| "completions/max_terminated_length": 1989.0, | |
| "completions/mean_length": 865.875, | |
| "completions/mean_terminated_length": 828.2257690429688, | |
| "completions/min_length": 376.0, | |
| "completions/min_terminated_length": 376.0, | |
| "epoch": 0.12890625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.8691290616989136, | |
| "kl": 0.03025655262172222, | |
| "learning_rate": 2.0000000000000003e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1729458.0, | |
| "reward": 2.1252987384796143, | |
| "reward_std": 0.5289393663406372, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5627987384796143, | |
| "rewards/ROUGEL_entities_reward/std": 0.3745800256729126, | |
| "rewards/answer_correctness_func/mean": 0.21875, | |
| "rewards/answer_correctness_func/std": 0.420013427734375, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.40625, | |
| "rewards/f1_entities_exact_reward/std": 0.39015090465545654, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.03125, | |
| "rewards/reasoning_equal_answer_reward/std": 0.1767766922712326, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 33 | |
| }, | |
| { | |
| "completion_length": 879.28125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1759.0, | |
| "completions/max_terminated_length": 1759.0, | |
| "completions/mean_length": 880.28125, | |
| "completions/mean_terminated_length": 880.28125, | |
| "completions/min_length": 382.0, | |
| "completions/min_terminated_length": 382.0, | |
| "epoch": 0.1328125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.03191771358251572, | |
| "kl": 0.0008378682687180117, | |
| "learning_rate": 2.0625e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1782827.0, | |
| "reward": 1.4557617902755737, | |
| "reward_std": 0.16580641269683838, | |
| "rewards/ROUGEL_entities_reward/mean": 0.34638676047325134, | |
| "rewards/ROUGEL_entities_reward/std": 0.18016280233860016, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 34 | |
| }, | |
| { | |
| "completion_length": 895.1875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1836.0, | |
| "completions/max_terminated_length": 1836.0, | |
| "completions/mean_length": 896.1875, | |
| "completions/mean_terminated_length": 896.1875, | |
| "completions/min_length": 386.0, | |
| "completions/min_terminated_length": 386.0, | |
| "epoch": 0.13671875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.0351351797580719, | |
| "kl": 0.0007743473688606173, | |
| "learning_rate": 2.125e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1836317.0, | |
| "reward": 1.3723011016845703, | |
| "reward_std": 0.15460538864135742, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3410511016845703, | |
| "rewards/ROUGEL_entities_reward/std": 0.2375221699476242, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.03125, | |
| "rewards/f1_entities_exact_reward/std": 0.12296734005212784, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 35 | |
| }, | |
| { | |
| "completion_length": 814.5625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1464.0, | |
| "completions/max_terminated_length": 1464.0, | |
| "completions/mean_length": 815.5625, | |
| "completions/mean_terminated_length": 815.5625, | |
| "completions/min_length": 358.0, | |
| "completions/min_terminated_length": 358.0, | |
| "epoch": 0.140625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.03838350996375084, | |
| "kl": 0.0008724646613700315, | |
| "learning_rate": 2.1875000000000002e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1887779.0, | |
| "reward": 1.421027660369873, | |
| "reward_std": 0.08938203752040863, | |
| "rewards/ROUGEL_entities_reward/mean": 0.35852763056755066, | |
| "rewards/ROUGEL_entities_reward/std": 0.1610291451215744, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 36 | |
| }, | |
| { | |
| "completion_length": 1043.9375, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 1966.0, | |
| "completions/max_terminated_length": 1925.0, | |
| "completions/mean_length": 1044.84375, | |
| "completions/mean_terminated_length": 949.5516967773438, | |
| "completions/min_length": 361.0, | |
| "completions/min_terminated_length": 361.0, | |
| "epoch": 0.14453125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.3164830207824707, | |
| "kl": 0.036185771226882935, | |
| "learning_rate": 2.25e-06, | |
| "loss": 0.0, | |
| "num_tokens": 1946890.0, | |
| "reward": 1.2239865064620972, | |
| "reward_std": 0.13413795828819275, | |
| "rewards/ROUGEL_entities_reward/mean": 0.25523650646209717, | |
| "rewards/ROUGEL_entities_reward/std": 0.20075830817222595, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 37 | |
| }, | |
| { | |
| "completion_length": 1095.15625, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2012.0, | |
| "completions/max_terminated_length": 1988.0, | |
| "completions/mean_length": 1096.09375, | |
| "completions/mean_terminated_length": 1035.033447265625, | |
| "completions/min_length": 349.0, | |
| "completions/min_terminated_length": 349.0, | |
| "epoch": 0.1484375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.7715964317321777, | |
| "kl": 0.047803448513150215, | |
| "learning_rate": 2.3125000000000003e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2007529.0, | |
| "reward": 1.219300389289856, | |
| "reward_std": 0.209647536277771, | |
| "rewards/ROUGEL_entities_reward/mean": 0.26617541909217834, | |
| "rewards/ROUGEL_entities_reward/std": 0.19572654366493225, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.015625, | |
| "rewards/f1_entities_exact_reward/std": 0.0883883461356163, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 38 | |
| }, | |
| { | |
| "completion_length": 875.125, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2025.0, | |
| "completions/max_terminated_length": 1905.0, | |
| "completions/mean_length": 876.0625, | |
| "completions/mean_terminated_length": 799.4667358398438, | |
| "completions/min_length": 383.0, | |
| "completions/min_terminated_length": 383.0, | |
| "epoch": 0.15234375, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.2576082944869995, | |
| "kl": 0.028566114604473114, | |
| "learning_rate": 2.375e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2061255.0, | |
| "reward": 1.543312430381775, | |
| "reward_std": 0.20425739884376526, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4026874303817749, | |
| "rewards/ROUGEL_entities_reward/std": 0.3158787488937378, | |
| "rewards/answer_correctness_func/mean": 0.03125, | |
| "rewards/answer_correctness_func/std": 0.1767766922712326, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.24542178213596344, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 39 | |
| }, | |
| { | |
| "completion_length": 868.09375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1850.0, | |
| "completions/max_terminated_length": 1850.0, | |
| "completions/mean_length": 869.09375, | |
| "completions/mean_terminated_length": 869.09375, | |
| "completions/min_length": 423.0, | |
| "completions/min_terminated_length": 423.0, | |
| "epoch": 0.15625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.04050038754940033, | |
| "kl": 0.0008488351159030572, | |
| "learning_rate": 2.4375e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2114910.0, | |
| "reward": 1.5773019790649414, | |
| "reward_std": 0.2809327244758606, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4054270386695862, | |
| "rewards/ROUGEL_entities_reward/std": 0.21998822689056396, | |
| "rewards/answer_correctness_func/mean": 0.03125, | |
| "rewards/answer_correctness_func/std": 0.1767766922712326, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.26133573055267334, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 40 | |
| }, | |
| { | |
| "completion_length": 746.125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1475.0, | |
| "completions/max_terminated_length": 1475.0, | |
| "completions/mean_length": 747.125, | |
| "completions/mean_terminated_length": 747.125, | |
| "completions/min_length": 311.0, | |
| "completions/min_terminated_length": 311.0, | |
| "epoch": 0.16015625, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.0397828109562397, | |
| "kl": 0.0009731970203574747, | |
| "learning_rate": 2.5e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2164246.0, | |
| "reward": 1.9008541107177734, | |
| "reward_std": 0.07794724404811859, | |
| "rewards/ROUGEL_entities_reward/mean": 0.525854229927063, | |
| "rewards/ROUGEL_entities_reward/std": 0.27729788422584534, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.25, | |
| "rewards/f1_entities_exact_reward/std": 0.3592106103897095, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 41 | |
| }, | |
| { | |
| "completion_length": 960.84375, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 1977.0, | |
| "completions/max_terminated_length": 1768.0, | |
| "completions/mean_length": 961.78125, | |
| "completions/mean_terminated_length": 894.1000366210938, | |
| "completions/min_length": 357.0, | |
| "completions/min_terminated_length": 357.0, | |
| "epoch": 0.1640625, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 1.2776288986206055, | |
| "kl": 0.0984850749373436, | |
| "learning_rate": 2.5625e-06, | |
| "loss": 0.0001, | |
| "num_tokens": 2220687.0, | |
| "reward": 1.3761751651763916, | |
| "reward_std": 0.03425034135580063, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3136751055717468, | |
| "rewards/ROUGEL_entities_reward/std": 0.21004539728164673, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 42 | |
| }, | |
| { | |
| "completion_length": 781.8125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1453.0, | |
| "completions/max_terminated_length": 1453.0, | |
| "completions/mean_length": 782.8125, | |
| "completions/mean_terminated_length": 782.8125, | |
| "completions/min_length": 352.0, | |
| "completions/min_terminated_length": 352.0, | |
| "epoch": 0.16796875, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.04102746397256851, | |
| "kl": 0.0008047504670685157, | |
| "learning_rate": 2.6250000000000003e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2271929.0, | |
| "reward": 1.3647174835205078, | |
| "reward_std": 0.1334415078163147, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3334674835205078, | |
| "rewards/ROUGEL_entities_reward/std": 0.18400724232196808, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.03125, | |
| "rewards/f1_entities_exact_reward/std": 0.12296734005212784, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 43 | |
| }, | |
| { | |
| "completion_length": 866.65625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1973.0, | |
| "completions/max_terminated_length": 1473.0, | |
| "completions/mean_length": 867.625, | |
| "completions/mean_terminated_length": 831.9677124023438, | |
| "completions/min_length": 309.0, | |
| "completions/min_terminated_length": 309.0, | |
| "epoch": 0.171875, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.03564456105232239, | |
| "kl": 0.0008104472508421168, | |
| "learning_rate": 2.6875e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2324513.0, | |
| "reward": 1.3380478620529175, | |
| "reward_std": 0.16338998079299927, | |
| "rewards/ROUGEL_entities_reward/mean": 0.35367289185523987, | |
| "rewards/ROUGEL_entities_reward/std": 0.2080492079257965, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.015625, | |
| "rewards/f1_entities_exact_reward/std": 0.0883883461356163, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 44 | |
| }, | |
| { | |
| "completion_length": 988.65625, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 2024.0, | |
| "completions/mean_length": 989.59375, | |
| "completions/mean_terminated_length": 919.0333862304688, | |
| "completions/min_length": 364.0, | |
| "completions/min_terminated_length": 364.0, | |
| "epoch": 0.17578125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.3289203643798828, | |
| "kl": 0.05466066673398018, | |
| "learning_rate": 2.7500000000000004e-06, | |
| "loss": 0.0001, | |
| "num_tokens": 2380596.0, | |
| "reward": 1.4342949390411377, | |
| "reward_std": 0.20128795504570007, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4030449390411377, | |
| "rewards/ROUGEL_entities_reward/std": 0.30489441752433777, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.125, | |
| "rewards/f1_entities_exact_reward/std": 0.2199706733226776, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 45 | |
| }, | |
| { | |
| "completion_length": 777.96875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1422.0, | |
| "completions/max_terminated_length": 1422.0, | |
| "completions/mean_length": 778.96875, | |
| "completions/mean_terminated_length": 778.96875, | |
| "completions/min_length": 333.0, | |
| "completions/min_terminated_length": 333.0, | |
| "epoch": 0.1796875, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.029138894751667976, | |
| "kl": 0.0008950835035648197, | |
| "learning_rate": 2.8125e-06, | |
| "loss": -0.0, | |
| "num_tokens": 2430763.0, | |
| "reward": 1.6776609420776367, | |
| "reward_std": 0.07827550172805786, | |
| "rewards/ROUGEL_entities_reward/mean": 0.39641106128692627, | |
| "rewards/ROUGEL_entities_reward/std": 0.31618690490722656, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.3463519513607025, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 46 | |
| }, | |
| { | |
| "completion_length": 902.59375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1909.0, | |
| "completions/max_terminated_length": 1909.0, | |
| "completions/mean_length": 903.59375, | |
| "completions/mean_terminated_length": 903.59375, | |
| "completions/min_length": 351.0, | |
| "completions/min_terminated_length": 351.0, | |
| "epoch": 0.18359375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.03316575661301613, | |
| "kl": 0.00084034533938393, | |
| "learning_rate": 2.875e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2484606.0, | |
| "reward": 1.7022205591201782, | |
| "reward_std": 0.11596342921257019, | |
| "rewards/ROUGEL_entities_reward/mean": 0.48347052931785583, | |
| "rewards/ROUGEL_entities_reward/std": 0.2657451033592224, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.21875, | |
| "rewards/f1_entities_exact_reward/std": 0.2520080506801605, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 47 | |
| }, | |
| { | |
| "completion_length": 1063.3125, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2045.0, | |
| "completions/max_terminated_length": 2010.0, | |
| "completions/mean_length": 1064.28125, | |
| "completions/mean_terminated_length": 1032.6451416015625, | |
| "completions/min_length": 400.0, | |
| "completions/min_terminated_length": 400.0, | |
| "epoch": 0.1875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.315568208694458, | |
| "kl": 0.024940223898738623, | |
| "learning_rate": 2.9375000000000003e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2543507.0, | |
| "reward": 1.312612771987915, | |
| "reward_std": 0.3253900706768036, | |
| "rewards/ROUGEL_entities_reward/mean": 0.37511277198791504, | |
| "rewards/ROUGEL_entities_reward/std": 0.2815242409706116, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.875, | |
| "rewards/answer_format_func/std": 0.33601075410842896, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 48 | |
| }, | |
| { | |
| "completion_length": 790.40625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1731.0, | |
| "completions/max_terminated_length": 1731.0, | |
| "completions/mean_length": 791.40625, | |
| "completions/mean_terminated_length": 791.40625, | |
| "completions/min_length": 364.0, | |
| "completions/min_terminated_length": 364.0, | |
| "epoch": 0.19140625, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.035357240587472916, | |
| "kl": 0.0008986674947664142, | |
| "learning_rate": 3e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2593784.0, | |
| "reward": 1.768296718597412, | |
| "reward_std": 0.20734211802482605, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5182968378067017, | |
| "rewards/ROUGEL_entities_reward/std": 0.13581332564353943, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.234375, | |
| "rewards/f1_entities_exact_reward/std": 0.253503680229187, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 49 | |
| }, | |
| { | |
| "completion_length": 876.4375, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 1978.0, | |
| "completions/max_terminated_length": 1407.0, | |
| "completions/mean_length": 877.375, | |
| "completions/mean_terminated_length": 804.0000610351562, | |
| "completions/min_length": 455.0, | |
| "completions/min_terminated_length": 455.0, | |
| "epoch": 0.1953125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.03194103017449379, | |
| "kl": 0.0008543854783056304, | |
| "learning_rate": 3.0625000000000003e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2646016.0, | |
| "reward": 1.638135313987732, | |
| "reward_std": 0.2261456400156021, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5443853735923767, | |
| "rewards/ROUGEL_entities_reward/std": 0.273754358291626, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.23546454310417175, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 50 | |
| }, | |
| { | |
| "completion_length": 1074.90625, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1955.0, | |
| "completions/mean_length": 1075.84375, | |
| "completions/mean_terminated_length": 1011.0333862304688, | |
| "completions/min_length": 381.0, | |
| "completions/min_terminated_length": 381.0, | |
| "epoch": 0.19921875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.0201319456100464, | |
| "kl": 0.022831523790955544, | |
| "learning_rate": 3.125e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2706399.0, | |
| "reward": 1.462364673614502, | |
| "reward_std": 0.28029900789260864, | |
| "rewards/ROUGEL_entities_reward/mean": 0.43111473321914673, | |
| "rewards/ROUGEL_entities_reward/std": 0.30877652764320374, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.125, | |
| "rewards/f1_entities_exact_reward/std": 0.2199706733226776, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 51 | |
| }, | |
| { | |
| "completion_length": 780.90625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1876.0, | |
| "completions/max_terminated_length": 1876.0, | |
| "completions/mean_length": 781.90625, | |
| "completions/mean_terminated_length": 781.90625, | |
| "completions/min_length": 334.0, | |
| "completions/min_terminated_length": 334.0, | |
| "epoch": 0.203125, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 0.02633880078792572, | |
| "kl": 0.0008717684831935912, | |
| "learning_rate": 3.1875e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2757124.0, | |
| "reward": 1.4692744016647339, | |
| "reward_std": 0.10760265588760376, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3911494016647339, | |
| "rewards/ROUGEL_entities_reward/std": 0.3299289047718048, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.078125, | |
| "rewards/f1_entities_exact_reward/std": 0.18445101380348206, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 52 | |
| }, | |
| { | |
| "completion_length": 1000.21875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2009.0, | |
| "completions/max_terminated_length": 1990.0, | |
| "completions/mean_length": 1001.1875, | |
| "completions/mean_terminated_length": 968.6773681640625, | |
| "completions/min_length": 390.0, | |
| "completions/min_terminated_length": 390.0, | |
| "epoch": 0.20703125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 43595.1640625, | |
| "kl": 663661.0216736235, | |
| "learning_rate": 3.2500000000000002e-06, | |
| "loss": 663.6611, | |
| "num_tokens": 2814698.0, | |
| "reward": 1.6129716634750366, | |
| "reward_std": 0.34194862842559814, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4723466634750366, | |
| "rewards/ROUGEL_entities_reward/std": 0.20310600101947784, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.203125, | |
| "rewards/f1_entities_exact_reward/std": 0.24949544668197632, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 53 | |
| }, | |
| { | |
| "completion_length": 788.65625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1430.0, | |
| "completions/max_terminated_length": 1430.0, | |
| "completions/mean_length": 789.65625, | |
| "completions/mean_terminated_length": 789.65625, | |
| "completions/min_length": 357.0, | |
| "completions/min_terminated_length": 357.0, | |
| "epoch": 0.2109375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.04156388342380524, | |
| "kl": 0.0008590234210714698, | |
| "learning_rate": 3.3125e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2864779.0, | |
| "reward": 1.5036687850952148, | |
| "reward_std": 0.18333800137043, | |
| "rewards/ROUGEL_entities_reward/mean": 0.37866872549057007, | |
| "rewards/ROUGEL_entities_reward/std": 0.2451113909482956, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 54 | |
| }, | |
| { | |
| "completion_length": 878.78125, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1694.0, | |
| "completions/mean_length": 879.71875, | |
| "completions/mean_terminated_length": 801.8333740234375, | |
| "completions/min_length": 381.0, | |
| "completions/min_terminated_length": 381.0, | |
| "epoch": 0.21484375, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.253060221672058, | |
| "kl": 0.028678589966148138, | |
| "learning_rate": 3.3750000000000003e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2917394.0, | |
| "reward": 1.5075453519821167, | |
| "reward_std": 0.21901844441890717, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4137953519821167, | |
| "rewards/ROUGEL_entities_reward/std": 0.25585466623306274, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.23546454310417175, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 55 | |
| }, | |
| { | |
| "completion_length": 881.03125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1655.0, | |
| "completions/max_terminated_length": 1655.0, | |
| "completions/mean_length": 882.03125, | |
| "completions/mean_terminated_length": 882.03125, | |
| "completions/min_length": 391.0, | |
| "completions/min_terminated_length": 391.0, | |
| "epoch": 0.21875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.031581878662109375, | |
| "kl": 0.0007841893821023405, | |
| "learning_rate": 3.4375e-06, | |
| "loss": 0.0, | |
| "num_tokens": 2970251.0, | |
| "reward": 1.5474133491516113, | |
| "reward_std": 0.11733610183000565, | |
| "rewards/ROUGEL_entities_reward/mean": 0.39116325974464417, | |
| "rewards/ROUGEL_entities_reward/std": 0.24231143295764923, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.22840170562267303, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 56 | |
| }, | |
| { | |
| "completion_length": 745.90625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1596.0, | |
| "completions/max_terminated_length": 1596.0, | |
| "completions/mean_length": 746.90625, | |
| "completions/mean_terminated_length": 746.90625, | |
| "completions/min_length": 392.0, | |
| "completions/min_terminated_length": 392.0, | |
| "epoch": 0.22265625, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 0.031546663492918015, | |
| "kl": 0.0008624131296528503, | |
| "learning_rate": 3.5e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3018128.0, | |
| "reward": 1.8776674270629883, | |
| "reward_std": 0.16294483840465546, | |
| "rewards/ROUGEL_entities_reward/mean": 0.44016748666763306, | |
| "rewards/ROUGEL_entities_reward/std": 0.273531973361969, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.328125, | |
| "rewards/f1_entities_exact_reward/std": 0.35033106803894043, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 57 | |
| }, | |
| { | |
| "completion_length": 946.9375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1982.0, | |
| "completions/mean_length": 947.90625, | |
| "completions/mean_terminated_length": 912.4193115234375, | |
| "completions/min_length": 423.0, | |
| "completions/min_terminated_length": 423.0, | |
| "epoch": 0.2265625, | |
| "frac_reward_zero_std": 0.5, | |
| "grad_norm": 1.0758155584335327, | |
| "kl": 0.02901648124679923, | |
| "learning_rate": 3.5625e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3073333.0, | |
| "reward": 1.6864192485809326, | |
| "reward_std": 0.24523183703422546, | |
| "rewards/ROUGEL_entities_reward/mean": 0.46766918897628784, | |
| "rewards/ROUGEL_entities_reward/std": 0.30791956186294556, | |
| "rewards/answer_correctness_func/mean": 0.03125, | |
| "rewards/answer_correctness_func/std": 0.1767766922712326, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.21875, | |
| "rewards/f1_entities_exact_reward/std": 0.2822004556655884, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 58 | |
| }, | |
| { | |
| "completion_length": 844.34375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1750.0, | |
| "completions/mean_length": 845.3125, | |
| "completions/mean_terminated_length": 806.51611328125, | |
| "completions/min_length": 381.0, | |
| "completions/min_terminated_length": 381.0, | |
| "epoch": 0.23046875, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.611671805381775, | |
| "kl": 0.027586993295699358, | |
| "learning_rate": 3.625e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3125323.0, | |
| "reward": 1.3790805339813232, | |
| "reward_std": 0.17383891344070435, | |
| "rewards/ROUGEL_entities_reward/mean": 0.36345553398132324, | |
| "rewards/ROUGEL_entities_reward/std": 0.22647835314273834, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.046875, | |
| "rewards/f1_entities_exact_reward/std": 0.1480722874403, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 59 | |
| }, | |
| { | |
| "completion_length": 788.65625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2002.0, | |
| "completions/max_terminated_length": 1931.0, | |
| "completions/mean_length": 789.625, | |
| "completions/mean_terminated_length": 750.51611328125, | |
| "completions/min_length": 318.0, | |
| "completions/min_terminated_length": 318.0, | |
| "epoch": 0.234375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.4535969495773315, | |
| "kl": 0.2797043500468135, | |
| "learning_rate": 3.6875000000000007e-06, | |
| "loss": 0.0003, | |
| "num_tokens": 3175763.0, | |
| "reward": 1.3903493881225586, | |
| "reward_std": 0.27898839116096497, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4215993881225586, | |
| "rewards/ROUGEL_entities_reward/std": 0.2551148533821106, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.015625, | |
| "rewards/f1_entities_exact_reward/std": 0.0883883461356163, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 60 | |
| }, | |
| { | |
| "completion_length": 792.71875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1667.0, | |
| "completions/max_terminated_length": 1667.0, | |
| "completions/mean_length": 793.71875, | |
| "completions/mean_terminated_length": 793.71875, | |
| "completions/min_length": 384.0, | |
| "completions/min_terminated_length": 384.0, | |
| "epoch": 0.23828125, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.04302690178155899, | |
| "kl": 0.0008610641962150112, | |
| "learning_rate": 3.7500000000000005e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3225790.0, | |
| "reward": 1.4344795942306519, | |
| "reward_std": 0.1498142033815384, | |
| "rewards/ROUGEL_entities_reward/mean": 0.37197959423065186, | |
| "rewards/ROUGEL_entities_reward/std": 0.15754859149456024, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 61 | |
| }, | |
| { | |
| "completion_length": 933.84375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1850.0, | |
| "completions/max_terminated_length": 1850.0, | |
| "completions/mean_length": 934.84375, | |
| "completions/mean_terminated_length": 934.84375, | |
| "completions/min_length": 319.0, | |
| "completions/min_terminated_length": 319.0, | |
| "epoch": 0.2421875, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.0374126136302948, | |
| "kl": 0.0008230292587541044, | |
| "learning_rate": 3.8125e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3281141.0, | |
| "reward": 1.545864462852478, | |
| "reward_std": 0.2267509251832962, | |
| "rewards/ROUGEL_entities_reward/mean": 0.436489462852478, | |
| "rewards/ROUGEL_entities_reward/std": 0.22274264693260193, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 62 | |
| }, | |
| { | |
| "completion_length": 726.625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1713.0, | |
| "completions/max_terminated_length": 1713.0, | |
| "completions/mean_length": 727.625, | |
| "completions/mean_terminated_length": 727.625, | |
| "completions/min_length": 424.0, | |
| "completions/min_terminated_length": 424.0, | |
| "epoch": 0.24609375, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.036695897579193115, | |
| "kl": 0.0008863469702191651, | |
| "learning_rate": 3.875e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3329261.0, | |
| "reward": 1.291222095489502, | |
| "reward_std": 0.0680345669388771, | |
| "rewards/ROUGEL_entities_reward/mean": 0.29122209548950195, | |
| "rewards/ROUGEL_entities_reward/std": 0.18511660397052765, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0, | |
| "rewards/f1_entities_exact_reward/std": 0.0, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 63 | |
| }, | |
| { | |
| "completion_length": 770.03125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1912.0, | |
| "completions/max_terminated_length": 1912.0, | |
| "completions/mean_length": 771.03125, | |
| "completions/mean_terminated_length": 771.03125, | |
| "completions/min_length": 407.0, | |
| "completions/min_terminated_length": 407.0, | |
| "epoch": 0.25, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.3695529699325562, | |
| "kl": 0.027544385753571987, | |
| "learning_rate": 3.9375e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3380906.0, | |
| "reward": 1.7645435333251953, | |
| "reward_std": 0.2773824632167816, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4520435929298401, | |
| "rewards/ROUGEL_entities_reward/std": 0.3055833876132965, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.1875, | |
| "rewards/f1_entities_exact_reward/std": 0.3535533845424652, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 64 | |
| }, | |
| { | |
| "completion_length": 1081.59375, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 2006.0, | |
| "completions/mean_length": 1082.53125, | |
| "completions/mean_terminated_length": 1018.166748046875, | |
| "completions/min_length": 408.0, | |
| "completions/min_terminated_length": 408.0, | |
| "epoch": 0.25390625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.2219723463058472, | |
| "kl": 0.02520414860919118, | |
| "learning_rate": 4.000000000000001e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3440707.0, | |
| "reward": 1.6349719762802124, | |
| "reward_std": 0.21872639656066895, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3849719166755676, | |
| "rewards/ROUGEL_entities_reward/std": 0.29507917165756226, | |
| "rewards/answer_correctness_func/mean": 0.09375, | |
| "rewards/answer_correctness_func/std": 0.2961445748806, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.15625, | |
| "rewards/f1_entities_exact_reward/std": 0.3222276270389557, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 65 | |
| }, | |
| { | |
| "completion_length": 845.25, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1681.0, | |
| "completions/max_terminated_length": 1681.0, | |
| "completions/mean_length": 846.25, | |
| "completions/mean_terminated_length": 846.25, | |
| "completions/min_length": 424.0, | |
| "completions/min_terminated_length": 424.0, | |
| "epoch": 0.2578125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.03518102690577507, | |
| "kl": 0.0008721806952962652, | |
| "learning_rate": 4.0625000000000005e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3491951.0, | |
| "reward": 1.4318032264709473, | |
| "reward_std": 0.09064435213804245, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3380531668663025, | |
| "rewards/ROUGEL_entities_reward/std": 0.1920674592256546, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.09375, | |
| "rewards/f1_entities_exact_reward/std": 0.19827888906002045, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 66 | |
| }, | |
| { | |
| "completion_length": 765.75, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2019.0, | |
| "completions/max_terminated_length": 1752.0, | |
| "completions/mean_length": 766.71875, | |
| "completions/mean_terminated_length": 726.3225708007812, | |
| "completions/min_length": 420.0, | |
| "completions/min_terminated_length": 420.0, | |
| "epoch": 0.26171875, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.3443408012390137, | |
| "kl": 0.02946723997592926, | |
| "learning_rate": 4.125e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3540814.0, | |
| "reward": 1.4851843118667603, | |
| "reward_std": 0.2511700689792633, | |
| "rewards/ROUGEL_entities_reward/mean": 0.39143434166908264, | |
| "rewards/ROUGEL_entities_reward/std": 0.2150370329618454, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 67 | |
| }, | |
| { | |
| "completion_length": 735.9375, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 1953.0, | |
| "completions/max_terminated_length": 1662.0, | |
| "completions/mean_length": 736.875, | |
| "completions/mean_terminated_length": 655.800048828125, | |
| "completions/min_length": 288.0, | |
| "completions/min_terminated_length": 288.0, | |
| "epoch": 0.265625, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.547475814819336, | |
| "kl": 0.08277505822479725, | |
| "learning_rate": 4.1875e-06, | |
| "loss": 0.0001, | |
| "num_tokens": 3590206.0, | |
| "reward": 1.3710753917694092, | |
| "reward_std": 0.2990349233150482, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3710753619670868, | |
| "rewards/ROUGEL_entities_reward/std": 0.2627098858356476, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 68 | |
| }, | |
| { | |
| "completion_length": 855.09375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2037.0, | |
| "completions/max_terminated_length": 1856.0, | |
| "completions/mean_length": 856.0625, | |
| "completions/mean_terminated_length": 817.9677124023438, | |
| "completions/min_length": 355.0, | |
| "completions/min_terminated_length": 355.0, | |
| "epoch": 0.26953125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.1259685754776, | |
| "kl": 0.035014061257243156, | |
| "learning_rate": 4.25e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3642256.0, | |
| "reward": 1.4482572078704834, | |
| "reward_std": 0.20823946595191956, | |
| "rewards/ROUGEL_entities_reward/mean": 0.401382178068161, | |
| "rewards/ROUGEL_entities_reward/std": 0.30484357476234436, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 69 | |
| }, | |
| { | |
| "completion_length": 891.4375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1997.0, | |
| "completions/mean_length": 892.40625, | |
| "completions/mean_terminated_length": 855.1290283203125, | |
| "completions/min_length": 381.0, | |
| "completions/min_terminated_length": 381.0, | |
| "epoch": 0.2734375, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.9959722757339478, | |
| "kl": 0.0265270434319973, | |
| "learning_rate": 4.312500000000001e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3695461.0, | |
| "reward": 1.6611111164093018, | |
| "reward_std": 0.3453267514705658, | |
| "rewards/ROUGEL_entities_reward/mean": 0.47361117601394653, | |
| "rewards/ROUGEL_entities_reward/std": 0.28843188285827637, | |
| "rewards/answer_correctness_func/mean": 0.03125, | |
| "rewards/answer_correctness_func/std": 0.1767766922712326, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.1875, | |
| "rewards/f1_entities_exact_reward/std": 0.2767903506755829, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 70 | |
| }, | |
| { | |
| "completion_length": 982.875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1874.0, | |
| "completions/max_terminated_length": 1648.0, | |
| "completions/mean_length": 983.84375, | |
| "completions/mean_terminated_length": 955.1290283203125, | |
| "completions/min_length": 416.0, | |
| "completions/min_terminated_length": 416.0, | |
| "epoch": 0.27734375, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.029792383313179016, | |
| "kl": 0.0008207843056879938, | |
| "learning_rate": 4.3750000000000005e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3752536.0, | |
| "reward": 1.3520866632461548, | |
| "reward_std": 0.18100523948669434, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3364616632461548, | |
| "rewards/ROUGEL_entities_reward/std": 0.24795283377170563, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.046875, | |
| "rewards/f1_entities_exact_reward/std": 0.1480722874403, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 71 | |
| }, | |
| { | |
| "completion_length": 850.21875, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 1926.0, | |
| "completions/max_terminated_length": 1693.0, | |
| "completions/mean_length": 851.125, | |
| "completions/mean_terminated_length": 739.9310302734375, | |
| "completions/min_length": 361.0, | |
| "completions/min_terminated_length": 361.0, | |
| "epoch": 0.28125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.03854809328913689, | |
| "kl": 0.0008960039122030139, | |
| "learning_rate": 4.4375e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3805416.0, | |
| "reward": 1.6687471866607666, | |
| "reward_std": 0.14818844199180603, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4656221270561218, | |
| "rewards/ROUGEL_entities_reward/std": 0.2874893844127655, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.3415895998477936, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 72 | |
| }, | |
| { | |
| "completion_length": 988.78125, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2010.0, | |
| "completions/max_terminated_length": 1971.0, | |
| "completions/mean_length": 989.75, | |
| "completions/mean_terminated_length": 956.8386840820312, | |
| "completions/min_length": 362.0, | |
| "completions/min_terminated_length": 362.0, | |
| "epoch": 0.28515625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 4.410595893859863, | |
| "kl": 1.133633098565042, | |
| "learning_rate": 4.5e-06, | |
| "loss": 0.0011, | |
| "num_tokens": 3862068.0, | |
| "reward": 1.9691169261932373, | |
| "reward_std": 0.5512886643409729, | |
| "rewards/ROUGEL_entities_reward/mean": 0.6253669261932373, | |
| "rewards/ROUGEL_entities_reward/std": 0.2584879398345947, | |
| "rewards/answer_correctness_func/mean": 0.0625, | |
| "rewards/answer_correctness_func/std": 0.24593468010425568, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.3125, | |
| "rewards/f1_entities_exact_reward/std": 0.3045355975627899, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 73 | |
| }, | |
| { | |
| "completion_length": 775.59375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1774.0, | |
| "completions/max_terminated_length": 1774.0, | |
| "completions/mean_length": 776.59375, | |
| "completions/mean_terminated_length": 776.59375, | |
| "completions/min_length": 398.0, | |
| "completions/min_terminated_length": 398.0, | |
| "epoch": 0.2890625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.040159571915864944, | |
| "kl": 0.0008282668277388439, | |
| "learning_rate": 4.5625e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3911955.0, | |
| "reward": 1.3375033140182495, | |
| "reward_std": 0.1888979822397232, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3375033736228943, | |
| "rewards/ROUGEL_entities_reward/std": 0.24318675696849823, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.03125, | |
| "rewards/f1_entities_exact_reward/std": 0.12296734005212784, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 74 | |
| }, | |
| { | |
| "completion_length": 897.1875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2032.0, | |
| "completions/max_terminated_length": 1929.0, | |
| "completions/mean_length": 898.15625, | |
| "completions/mean_terminated_length": 861.5806274414062, | |
| "completions/min_length": 332.0, | |
| "completions/min_terminated_length": 332.0, | |
| "epoch": 0.29296875, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 1.2010027170181274, | |
| "kl": 0.024983107578009367, | |
| "learning_rate": 4.625000000000001e-06, | |
| "loss": 0.0, | |
| "num_tokens": 3965664.0, | |
| "reward": 1.5350582599639893, | |
| "reward_std": 0.11854691803455353, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4413083791732788, | |
| "rewards/ROUGEL_entities_reward/std": 0.26900914311408997, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.125, | |
| "rewards/f1_entities_exact_reward/std": 0.2199706733226776, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 75 | |
| }, | |
| { | |
| "completion_length": 752.875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1311.0, | |
| "completions/mean_length": 753.84375, | |
| "completions/mean_terminated_length": 712.0967407226562, | |
| "completions/min_length": 415.0, | |
| "completions/min_terminated_length": 415.0, | |
| "epoch": 0.296875, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 1.3387047052383423, | |
| "kl": 0.027603973634541035, | |
| "learning_rate": 4.6875000000000004e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4014499.0, | |
| "reward": 1.4758903980255127, | |
| "reward_std": 0.1006816178560257, | |
| "rewards/ROUGEL_entities_reward/mean": 0.36651527881622314, | |
| "rewards/ROUGEL_entities_reward/std": 0.25629162788391113, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 76 | |
| }, | |
| { | |
| "completion_length": 687.625, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1556.0, | |
| "completions/max_terminated_length": 1556.0, | |
| "completions/mean_length": 688.625, | |
| "completions/mean_terminated_length": 688.625, | |
| "completions/min_length": 360.0, | |
| "completions/min_terminated_length": 360.0, | |
| "epoch": 0.30078125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.04233290255069733, | |
| "kl": 0.0008787867118371651, | |
| "learning_rate": 4.75e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4062459.0, | |
| "reward": 1.5820362567901611, | |
| "reward_std": 0.13097786903381348, | |
| "rewards/ROUGEL_entities_reward/mean": 0.45703619718551636, | |
| "rewards/ROUGEL_entities_reward/std": 0.1624954342842102, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.125, | |
| "rewards/f1_entities_exact_reward/std": 0.2199706733226776, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 77 | |
| }, | |
| { | |
| "completion_length": 903.1875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1803.0, | |
| "completions/mean_length": 904.15625, | |
| "completions/mean_terminated_length": 867.258056640625, | |
| "completions/min_length": 432.0, | |
| "completions/min_terminated_length": 432.0, | |
| "epoch": 0.3046875, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.5431634187698364, | |
| "kl": 0.029040120542049408, | |
| "learning_rate": 4.8125e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4116424.0, | |
| "reward": 1.3482718467712402, | |
| "reward_std": 0.0755050778388977, | |
| "rewards/ROUGEL_entities_reward/mean": 0.285771906375885, | |
| "rewards/ROUGEL_entities_reward/std": 0.2148081213235855, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 78 | |
| }, | |
| { | |
| "completion_length": 971.6875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2025.0, | |
| "completions/max_terminated_length": 2020.0, | |
| "completions/mean_length": 972.65625, | |
| "completions/mean_terminated_length": 938.7096557617188, | |
| "completions/min_length": 306.0, | |
| "completions/min_terminated_length": 306.0, | |
| "epoch": 0.30859375, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.578683614730835, | |
| "kl": 0.02796661714091897, | |
| "learning_rate": 4.875e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4173029.0, | |
| "reward": 1.6396772861480713, | |
| "reward_std": 0.513664960861206, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4365522861480713, | |
| "rewards/ROUGEL_entities_reward/std": 0.2955634593963623, | |
| "rewards/answer_correctness_func/mean": 0.0625, | |
| "rewards/answer_correctness_func/std": 0.24593468010425568, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.1875, | |
| "rewards/f1_entities_exact_reward/std": 0.3045355975627899, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 79 | |
| }, | |
| { | |
| "completion_length": 735.53125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1546.0, | |
| "completions/max_terminated_length": 1546.0, | |
| "completions/mean_length": 736.53125, | |
| "completions/mean_terminated_length": 736.53125, | |
| "completions/min_length": 329.0, | |
| "completions/min_terminated_length": 329.0, | |
| "epoch": 0.3125, | |
| "frac_reward_zero_std": 0.5, | |
| "grad_norm": 0.035579681396484375, | |
| "kl": 0.0008356323232874274, | |
| "learning_rate": 4.937500000000001e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4221334.0, | |
| "reward": 1.6618772745132446, | |
| "reward_std": 0.08351492881774902, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5212522745132446, | |
| "rewards/ROUGEL_entities_reward/std": 0.21072913706302643, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.22840170562267303, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 80 | |
| }, | |
| { | |
| "completion_length": 875.875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2027.0, | |
| "completions/max_terminated_length": 1542.0, | |
| "completions/mean_length": 876.84375, | |
| "completions/mean_terminated_length": 839.7418823242188, | |
| "completions/min_length": 447.0, | |
| "completions/min_terminated_length": 447.0, | |
| "epoch": 0.31640625, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.0496132373809814, | |
| "kl": 0.02937435731291771, | |
| "learning_rate": 5e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4273549.0, | |
| "reward": 1.2269667387008667, | |
| "reward_std": 0.07633554935455322, | |
| "rewards/ROUGEL_entities_reward/mean": 0.22696669399738312, | |
| "rewards/ROUGEL_entities_reward/std": 0.1473868191242218, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0, | |
| "rewards/f1_entities_exact_reward/std": 0.0, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 81 | |
| }, | |
| { | |
| "completion_length": 773.4375, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 1445.0, | |
| "completions/mean_length": 774.375, | |
| "completions/mean_terminated_length": 689.4666748046875, | |
| "completions/min_length": 373.0, | |
| "completions/min_terminated_length": 373.0, | |
| "epoch": 0.3203125, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 1.8092247247695923, | |
| "kl": 0.03204902959987521, | |
| "learning_rate": 4.999976201801837e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4322861.0, | |
| "reward": 1.5633201599121094, | |
| "reward_std": 0.2757198214530945, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4070702791213989, | |
| "rewards/ROUGEL_entities_reward/std": 0.3196541965007782, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.203125, | |
| "rewards/f1_entities_exact_reward/std": 0.24949544668197632, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 82 | |
| }, | |
| { | |
| "completion_length": 811.1875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1739.0, | |
| "completions/max_terminated_length": 1739.0, | |
| "completions/mean_length": 812.1875, | |
| "completions/mean_terminated_length": 812.1875, | |
| "completions/min_length": 395.0, | |
| "completions/min_terminated_length": 395.0, | |
| "epoch": 0.32421875, | |
| "frac_reward_zero_std": 0.125, | |
| "grad_norm": 0.03791806846857071, | |
| "kl": 0.0008129881898639724, | |
| "learning_rate": 4.9999048076604286e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4374903.0, | |
| "reward": 1.2671880722045898, | |
| "reward_std": 0.08097401261329651, | |
| "rewards/ROUGEL_entities_reward/mean": 0.2515629827976227, | |
| "rewards/ROUGEL_entities_reward/std": 0.1857381910085678, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0, | |
| "rewards/f1_entities_exact_reward/std": 0.0, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 83 | |
| }, | |
| { | |
| "completion_length": 945.21875, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1902.0, | |
| "completions/max_terminated_length": 1902.0, | |
| "completions/mean_length": 946.21875, | |
| "completions/mean_terminated_length": 946.21875, | |
| "completions/min_length": 390.0, | |
| "completions/min_terminated_length": 390.0, | |
| "epoch": 0.328125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.0345589853823185, | |
| "kl": 0.0008043982816161588, | |
| "learning_rate": 4.999785818935018e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4430606.0, | |
| "reward": 1.539707899093628, | |
| "reward_std": 0.1531979739665985, | |
| "rewards/ROUGEL_entities_reward/mean": 0.41470780968666077, | |
| "rewards/ROUGEL_entities_reward/std": 0.16835904121398926, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.109375, | |
| "rewards/f1_entities_exact_reward/std": 0.2100067138671875, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 84 | |
| }, | |
| { | |
| "completion_length": 919.6875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1972.0, | |
| "completions/max_terminated_length": 1955.0, | |
| "completions/mean_length": 920.65625, | |
| "completions/mean_terminated_length": 886.7418823242188, | |
| "completions/min_length": 353.0, | |
| "completions/min_terminated_length": 353.0, | |
| "epoch": 0.33203125, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 0.876036524772644, | |
| "kl": 0.029854314867407084, | |
| "learning_rate": 4.9996192378909785e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4485207.0, | |
| "reward": 1.4873874187469482, | |
| "reward_std": 0.1799616515636444, | |
| "rewards/ROUGEL_entities_reward/mean": 0.33113738894462585, | |
| "rewards/ROUGEL_entities_reward/std": 0.3323952555656433, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.125, | |
| "rewards/f1_entities_exact_reward/std": 0.33601075410842896, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 85 | |
| }, | |
| { | |
| "completion_length": 883.5625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1960.0, | |
| "completions/max_terminated_length": 1853.0, | |
| "completions/mean_length": 884.53125, | |
| "completions/mean_terminated_length": 849.8386840820312, | |
| "completions/min_length": 370.0, | |
| "completions/min_terminated_length": 370.0, | |
| "epoch": 0.3359375, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.041625738143921, | |
| "kl": 0.03574475646018982, | |
| "learning_rate": 4.999405067699773e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4539352.0, | |
| "reward": 1.9239509105682373, | |
| "reward_std": 0.3379821181297302, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5802007913589478, | |
| "rewards/ROUGEL_entities_reward/std": 0.26507386565208435, | |
| "rewards/answer_correctness_func/mean": 0.09375, | |
| "rewards/answer_correctness_func/std": 0.2961445748806, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.265625, | |
| "rewards/f1_entities_exact_reward/std": 0.3356355130672455, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.015625, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0883883461356163, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 86 | |
| }, | |
| { | |
| "completion_length": 967.25, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1601.0, | |
| "completions/max_terminated_length": 1601.0, | |
| "completions/mean_length": 968.25, | |
| "completions/mean_terminated_length": 968.25, | |
| "completions/min_length": 363.0, | |
| "completions/min_terminated_length": 363.0, | |
| "epoch": 0.33984375, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.0337342731654644, | |
| "kl": 0.0008577157859690487, | |
| "learning_rate": 4.999143312438893e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4595608.0, | |
| "reward": 1.3930331468582153, | |
| "reward_std": 0.08991193026304245, | |
| "rewards/ROUGEL_entities_reward/mean": 0.37740814685821533, | |
| "rewards/ROUGEL_entities_reward/std": 0.262632817029953, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.015625, | |
| "rewards/f1_entities_exact_reward/std": 0.0883883461356163, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 87 | |
| }, | |
| { | |
| "completion_length": 930.5625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2034.0, | |
| "completions/max_terminated_length": 1869.0, | |
| "completions/mean_length": 931.53125, | |
| "completions/mean_terminated_length": 895.9677124023438, | |
| "completions/min_length": 393.0, | |
| "completions/min_terminated_length": 393.0, | |
| "epoch": 0.34375, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 4106.8095703125, | |
| "kl": 248.08653182303533, | |
| "learning_rate": 4.998833977091783e-06, | |
| "loss": 0.2481, | |
| "num_tokens": 4650097.0, | |
| "reward": 1.2493809461593628, | |
| "reward_std": 0.22820821404457092, | |
| "rewards/ROUGEL_entities_reward/mean": 0.23375599086284637, | |
| "rewards/ROUGEL_entities_reward/std": 0.2611769437789917, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.046875, | |
| "rewards/f1_entities_exact_reward/std": 0.1480722874403, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 88 | |
| }, | |
| { | |
| "completion_length": 769.15625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1983.0, | |
| "completions/max_terminated_length": 1426.0, | |
| "completions/mean_length": 770.125, | |
| "completions/mean_terminated_length": 731.0, | |
| "completions/min_length": 370.0, | |
| "completions/min_terminated_length": 370.0, | |
| "epoch": 0.34765625, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 1.7972824573516846, | |
| "kl": 0.0501269455999136, | |
| "learning_rate": 4.99847706754774e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4699553.0, | |
| "reward": 1.381695032119751, | |
| "reward_std": 0.22855672240257263, | |
| "rewards/ROUGEL_entities_reward/mean": 0.33482009172439575, | |
| "rewards/ROUGEL_entities_reward/std": 0.16944284737110138, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.078125, | |
| "rewards/f1_entities_exact_reward/std": 0.18445101380348206, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 89 | |
| }, | |
| { | |
| "completion_length": 793.9375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1948.0, | |
| "completions/max_terminated_length": 1948.0, | |
| "completions/mean_length": 794.9375, | |
| "completions/mean_terminated_length": 794.9375, | |
| "completions/min_length": 344.0, | |
| "completions/min_terminated_length": 344.0, | |
| "epoch": 0.3515625, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 9.503633499145508, | |
| "kl": 28.800375290215015, | |
| "learning_rate": 4.998072590601808e-06, | |
| "loss": 0.0288, | |
| "num_tokens": 4750315.0, | |
| "reward": 1.7471970319747925, | |
| "reward_std": 0.19717249274253845, | |
| "rewards/ROUGEL_entities_reward/mean": 0.5128220319747925, | |
| "rewards/ROUGEL_entities_reward/std": 0.2762593626976013, | |
| "rewards/answer_correctness_func/mean": 0.03125, | |
| "rewards/answer_correctness_func/std": 0.1767766922712326, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.203125, | |
| "rewards/f1_entities_exact_reward/std": 0.27995896339416504, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 90 | |
| }, | |
| { | |
| "completion_length": 905.125, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2042.0, | |
| "completions/max_terminated_length": 1974.0, | |
| "completions/mean_length": 906.09375, | |
| "completions/mean_terminated_length": 869.4515991210938, | |
| "completions/min_length": 374.0, | |
| "completions/min_terminated_length": 374.0, | |
| "epoch": 0.35546875, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.1816883087158203, | |
| "kl": 0.044529864564538, | |
| "learning_rate": 4.997620553954645e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4804178.0, | |
| "reward": 1.4783854484558105, | |
| "reward_std": 0.3672109842300415, | |
| "rewards/ROUGEL_entities_reward/mean": 0.40026041865348816, | |
| "rewards/ROUGEL_entities_reward/std": 0.23726356029510498, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.171875, | |
| "rewards/f1_entities_exact_reward/std": 0.24127934873104095, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 91 | |
| }, | |
| { | |
| "completion_length": 1095.4375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1853.0, | |
| "completions/max_terminated_length": 1853.0, | |
| "completions/mean_length": 1096.4375, | |
| "completions/mean_terminated_length": 1096.4375, | |
| "completions/min_length": 384.0, | |
| "completions/min_terminated_length": 384.0, | |
| "epoch": 0.359375, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 0.0298001766204834, | |
| "kl": 0.0007554437761427835, | |
| "learning_rate": 4.9971209662123774e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4864664.0, | |
| "reward": 1.6353673934936523, | |
| "reward_std": 0.12443146109580994, | |
| "rewards/ROUGEL_entities_reward/mean": 0.40099239349365234, | |
| "rewards/ROUGEL_entities_reward/std": 0.2766393721103668, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.234375, | |
| "rewards/f1_entities_exact_reward/std": 0.253503680229187, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 92 | |
| }, | |
| { | |
| "completion_length": 730.5, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2036.0, | |
| "completions/max_terminated_length": 1719.0, | |
| "completions/mean_length": 731.46875, | |
| "completions/mean_terminated_length": 689.3870849609375, | |
| "completions/min_length": 352.0, | |
| "completions/min_terminated_length": 352.0, | |
| "epoch": 0.36328125, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.3264824151992798, | |
| "kl": 0.05570895969867706, | |
| "learning_rate": 4.9965738368864345e-06, | |
| "loss": 0.0001, | |
| "num_tokens": 4913231.0, | |
| "reward": 1.7316737174987793, | |
| "reward_std": 0.19201873242855072, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4504236876964569, | |
| "rewards/ROUGEL_entities_reward/std": 0.32061126828193665, | |
| "rewards/answer_correctness_func/mean": 0.09375, | |
| "rewards/answer_correctness_func/std": 0.2961445748806, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.1875, | |
| "rewards/f1_entities_exact_reward/std": 0.3299559950828552, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 93 | |
| }, | |
| { | |
| "completion_length": 1029.375, | |
| "completions/clipped_ratio": 0.09375, | |
| "completions/max_length": 1992.0, | |
| "completions/max_terminated_length": 1818.0, | |
| "completions/mean_length": 1030.28125, | |
| "completions/mean_terminated_length": 930.7930908203125, | |
| "completions/min_length": 472.0, | |
| "completions/min_terminated_length": 472.0, | |
| "epoch": 0.3671875, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.0809646844863892, | |
| "kl": 0.04943352658301592, | |
| "learning_rate": 4.995979176393372e-06, | |
| "loss": 0.0, | |
| "num_tokens": 4971056.0, | |
| "reward": 1.286555290222168, | |
| "reward_std": 0.18572980165481567, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3178052306175232, | |
| "rewards/ROUGEL_entities_reward/std": 0.2090727686882019, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.90625, | |
| "rewards/answer_format_func/std": 0.2961445748806, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 94 | |
| }, | |
| { | |
| "completion_length": 775.21875, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1960.0, | |
| "completions/max_terminated_length": 1870.0, | |
| "completions/mean_length": 776.1875, | |
| "completions/mean_terminated_length": 738.0, | |
| "completions/min_length": 375.0, | |
| "completions/min_terminated_length": 375.0, | |
| "epoch": 0.37109375, | |
| "frac_reward_zero_std": 0.5, | |
| "grad_norm": 0.027799174189567566, | |
| "kl": 0.000922409410122782, | |
| "learning_rate": 4.995336996054668e-06, | |
| "loss": 0.0, | |
| "num_tokens": 5021574.0, | |
| "reward": 1.3551305532455444, | |
| "reward_std": 0.035699695348739624, | |
| "rewards/ROUGEL_entities_reward/mean": 0.2926305830478668, | |
| "rewards/ROUGEL_entities_reward/std": 0.1515231877565384, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.0625, | |
| "rewards/f1_entities_exact_reward/std": 0.16800537705421448, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 95 | |
| }, | |
| { | |
| "completion_length": 754.03125, | |
| "completions/clipped_ratio": 0.0625, | |
| "completions/max_length": 2021.0, | |
| "completions/max_terminated_length": 1719.0, | |
| "completions/mean_length": 754.96875, | |
| "completions/mean_terminated_length": 670.5667114257812, | |
| "completions/min_length": 332.0, | |
| "completions/min_terminated_length": 332.0, | |
| "epoch": 0.375, | |
| "frac_reward_zero_std": 0.625, | |
| "grad_norm": 0.7481793761253357, | |
| "kl": 0.05968023743480444, | |
| "learning_rate": 4.994647308096509e-06, | |
| "loss": 0.0001, | |
| "num_tokens": 5071297.0, | |
| "reward": 1.4473375082015991, | |
| "reward_std": 0.11887349933385849, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3379625082015991, | |
| "rewards/ROUGEL_entities_reward/std": 0.2742195427417755, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.96875, | |
| "rewards/answer_format_func/std": 0.1767766922712326, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.22840170562267303, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 96 | |
| }, | |
| { | |
| "completion_length": 756.8125, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1560.0, | |
| "completions/max_terminated_length": 1560.0, | |
| "completions/mean_length": 757.8125, | |
| "completions/mean_terminated_length": 757.8125, | |
| "completions/min_length": 414.0, | |
| "completions/min_terminated_length": 414.0, | |
| "epoch": 0.37890625, | |
| "frac_reward_zero_std": 0.375, | |
| "grad_norm": 0.029540961608290672, | |
| "kl": 0.0009005384054034948, | |
| "learning_rate": 4.993910125649561e-06, | |
| "loss": -0.0, | |
| "num_tokens": 5120135.0, | |
| "reward": 1.629094123840332, | |
| "reward_std": 0.03689418360590935, | |
| "rewards/ROUGEL_entities_reward/mean": 0.3790941834449768, | |
| "rewards/ROUGEL_entities_reward/std": 0.31832432746887207, | |
| "rewards/answer_correctness_func/mean": 0.125, | |
| "rewards/answer_correctness_func/std": 0.33601075410842896, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.125, | |
| "rewards/f1_entities_exact_reward/std": 0.33601075410842896, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 97 | |
| }, | |
| { | |
| "completion_length": 936.9375, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 1903.0, | |
| "completions/max_terminated_length": 1723.0, | |
| "completions/mean_length": 937.90625, | |
| "completions/mean_terminated_length": 906.774169921875, | |
| "completions/min_length": 419.0, | |
| "completions/min_terminated_length": 419.0, | |
| "epoch": 0.3828125, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.03625582158565521, | |
| "kl": 0.0008680867176735774, | |
| "learning_rate": 4.993125462748714e-06, | |
| "loss": 0.0, | |
| "num_tokens": 5176528.0, | |
| "reward": 1.5279531478881836, | |
| "reward_std": 0.277273029088974, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4498281478881836, | |
| "rewards/ROUGEL_entities_reward/std": 0.24050240218639374, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.22840170562267303, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 98 | |
| }, | |
| { | |
| "completion_length": 794.09375, | |
| "completions/clipped_ratio": 0.0, | |
| "completions/max_length": 1443.0, | |
| "completions/max_terminated_length": 1443.0, | |
| "completions/mean_length": 795.09375, | |
| "completions/mean_terminated_length": 795.09375, | |
| "completions/min_length": 339.0, | |
| "completions/min_terminated_length": 339.0, | |
| "epoch": 0.38671875, | |
| "frac_reward_zero_std": 0.0, | |
| "grad_norm": 0.044495273381471634, | |
| "kl": 0.0009377674432471395, | |
| "learning_rate": 4.992293334332821e-06, | |
| "loss": 0.0, | |
| "num_tokens": 5227423.0, | |
| "reward": 1.5689302682876587, | |
| "reward_std": 0.16798686981201172, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4283052682876587, | |
| "rewards/ROUGEL_entities_reward/std": 0.24358195066452026, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 1.0, | |
| "rewards/answer_format_func/std": 0.0, | |
| "rewards/f1_entities_exact_reward/mean": 0.140625, | |
| "rewards/f1_entities_exact_reward/std": 0.22840170562267303, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 99 | |
| }, | |
| { | |
| "completion_length": 807.0625, | |
| "completions/clipped_ratio": 0.03125, | |
| "completions/max_length": 2048.0, | |
| "completions/max_terminated_length": 2017.0, | |
| "completions/mean_length": 808.03125, | |
| "completions/mean_terminated_length": 768.0322265625, | |
| "completions/min_length": 379.0, | |
| "completions/min_terminated_length": 379.0, | |
| "epoch": 0.390625, | |
| "frac_reward_zero_std": 0.25, | |
| "grad_norm": 1.4681968688964844, | |
| "kl": 0.09113121591508389, | |
| "learning_rate": 4.991413756244404e-06, | |
| "loss": 0.0001, | |
| "num_tokens": 5278544.0, | |
| "reward": 1.6429879665374756, | |
| "reward_std": 0.30271971225738525, | |
| "rewards/ROUGEL_entities_reward/mean": 0.4711129069328308, | |
| "rewards/ROUGEL_entities_reward/std": 0.23452715575695038, | |
| "rewards/answer_correctness_func/mean": 0.0, | |
| "rewards/answer_correctness_func/std": 0.0, | |
| "rewards/answer_format_func/mean": 0.9375, | |
| "rewards/answer_format_func/std": 0.24593468010425568, | |
| "rewards/f1_entities_exact_reward/mean": 0.234375, | |
| "rewards/f1_entities_exact_reward/std": 0.253503680229187, | |
| "rewards/generation_reward_func/mean": 0.0, | |
| "rewards/generation_reward_func/std": 0.0, | |
| "rewards/reasoning_equal_answer_reward/mean": 0.0, | |
| "rewards/reasoning_equal_answer_reward/std": 0.0, | |
| "rewards/soft_format_reward_func/mean": 0.0, | |
| "rewards/soft_format_reward_func/std": 0.0, | |
| "step": 100 | |
| } | |
| ], | |
| "logging_steps": 1, | |
| "max_steps": 800, | |
| "num_input_tokens_seen": 5278544, | |
| "num_train_epochs": 4, | |
| "save_steps": 100, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": false | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 0.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |