{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.8275862068965516, "eval_steps": 500, "global_step": 20, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 750.0, "completions/max_terminated_length": 750.0, "completions/mean_length": 208.6875, "completions/mean_terminated_length": 208.6875, "completions/min_length": 19.5, "completions/min_terminated_length": 19.5, "epoch": 0.27586206896551724, "grad_norm": 18.433101654052734, "kl": 0.0, "learning_rate": 5e-07, "loss": -0.1616, "num_tokens": 7435.0, "reward": 0.05778068071231246, "reward_std": 0.013260316103696823, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.05778068397194147, "rewards/question_recreation_reward_func/std": 0.03348450642079115, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 2 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 415.5, "completions/max_terminated_length": 415.5, "completions/mean_length": 130.5625, "completions/mean_terminated_length": 130.5625, "completions/min_length": 13.5, "completions/min_terminated_length": 13.5, "epoch": 0.5517241379310345, "grad_norm": 8.727158546447754, "kl": 0.0008754075024626218, "learning_rate": 4.864543104251586e-07, "loss": 0.0809, "num_tokens": 13620.0, "reward": 0.10532870702445507, "reward_std": 0.024424075847491622, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.10532871540635824, "rewards/question_recreation_reward_func/std": 0.03869475517421961, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 4 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 669.5, "completions/max_terminated_length": 507.5, "completions/mean_length": 312.6875, "completions/mean_terminated_length": 273.9107208251953, "completions/min_length": 44.0, "completions/min_terminated_length": 44.0, "epoch": 0.8275862068965517, "grad_norm": 10.41586971282959, "kl": 0.0009672067608335055, "learning_rate": 4.472851273490984e-07, "loss": 0.2478, "num_tokens": 22719.0, "reward": 0.2098427265882492, "reward_std": 0.2130617438815534, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.125, "rewards/final_correctness_reward_func/std": 0.3535533845424652, "rewards/question_recreation_reward_func/mean": 0.07696773111820221, "rewards/question_recreation_reward_func/std": 0.04010230861604214, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.00787500012665987, "rewards/xmlcount_reward_func/std": 0.022273864597082138, "step": 6 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.125, "completions/max_length": 873.5, "completions/max_terminated_length": 632.0, "completions/mean_length": 329.5, "completions/mean_terminated_length": 224.16666412353516, "completions/min_length": 30.5, "completions/min_terminated_length": 30.5, "epoch": 1.1379310344827587, "grad_norm": 4.472732067108154, "kl": 0.0007184029036579886, "learning_rate": 3.867370395306068e-07, "loss": 0.0869, "num_tokens": 32190.0, "reward": 0.19183985888957977, "reward_std": 0.2473740577697754, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.125, "rewards/final_correctness_reward_func/std": 0.3535533845424652, "rewards/question_recreation_reward_func/mean": 0.019964855164289474, "rewards/question_recreation_reward_func/std": 0.012113618198782206, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.046875, "rewards/xmlcount_reward_func/std": 0.13258251547813416, "step": 8 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 718.5, "completions/max_terminated_length": 718.5, "completions/mean_length": 255.0, "completions/mean_terminated_length": 255.0, "completions/min_length": 6.0, "completions/min_terminated_length": 6.0, "epoch": 1.4137931034482758, "grad_norm": 14.328417778015137, "kl": 0.001265099534066394, "learning_rate": 3.1137137178519977e-07, "loss": 0.182, "num_tokens": 40366.0, "reward": 1.4011108474805951, "reward_std": 1.9615169735625386, "rewards/concensus_correctness_reward_func/mean": 1.25, "rewards/concensus_correctness_reward_func/std": 3.535534143447876, "rewards/consensus_reward_func/mean": 0.125, "rewards/consensus_reward_func/std": 0.3535533845424652, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.0182358892634511, "rewards/question_recreation_reward_func/std": 0.014001987874507904, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.00787500012665987, "rewards/xmlcount_reward_func/std": 0.022273864597082138, "step": 10 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 522.5, "completions/max_terminated_length": 522.5, "completions/mean_length": 172.0, "completions/mean_terminated_length": 172.0, "completions/min_length": 7.5, "completions/min_terminated_length": 7.5, "epoch": 1.6896551724137931, "grad_norm": 8.893263816833496, "kl": 0.0011968070393777452, "learning_rate": 2.2935516363191693e-07, "loss": 0.3234, "num_tokens": 47214.0, "reward": 0.023529402911663055, "reward_std": 0.014957319013774395, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.02352940198034048, "rewards/question_recreation_reward_func/std": 0.020326449535787106, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 12 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 614.0, "completions/max_terminated_length": 614.0, "completions/mean_length": 354.4000015258789, "completions/mean_terminated_length": 354.4000015258789, "completions/min_length": 96.5, "completions/min_terminated_length": 96.5, "epoch": 1.9655172413793105, "grad_norm": 7.406893730163574, "kl": 0.0008268929668702185, "learning_rate": 1.4957614383675767e-07, "loss": 0.1587, "num_tokens": 57685.0, "reward": 0.01602007821202278, "reward_std": 0.007509211776778102, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.016020076349377632, "rewards/question_recreation_reward_func/std": 0.009688148740679026, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 14 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 659.5, "completions/max_terminated_length": 355.0, "completions/mean_length": 197.125, "completions/mean_terminated_length": 141.28571319580078, "completions/min_length": 7.5, "completions/min_terminated_length": 7.5, "epoch": 2.2758620689655173, "grad_norm": 9.953104972839355, "kl": 0.0009395094821229577, "learning_rate": 8.067960709356478e-08, "loss": 0.1676, "num_tokens": 64935.0, "reward": 0.2408544309437275, "reward_std": 0.3167252861894667, "rewards/concensus_correctness_reward_func/mean": 0.21975000202655792, "rewards/concensus_correctness_reward_func/std": 0.6215468645095825, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.02110444661229849, "rewards/question_recreation_reward_func/std": 0.01698118494823575, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 16 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0625, "completions/max_length": 743.5, "completions/max_terminated_length": 467.0, "completions/mean_length": 253.125, "completions/mean_terminated_length": 204.83928680419922, "completions/min_length": 15.0, "completions/min_terminated_length": 15.0, "epoch": 2.5517241379310347, "grad_norm": 7.2750020027160645, "kl": 0.0010990903319907375, "learning_rate": 3.013156219837776e-08, "loss": 0.369, "num_tokens": 73081.0, "reward": 0.02212073840200901, "reward_std": 0.015308489557355642, "rewards/concensus_correctness_reward_func/mean": 0.0, "rewards/concensus_correctness_reward_func/std": 0.0, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.022120739333331585, "rewards/question_recreation_reward_func/std": 0.0167312603443861, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 18 }, { "clip_ratio/high_max": 0.0, "clip_ratio/high_mean": 0.0, "clip_ratio/low_mean": 0.0, "clip_ratio/low_min": 0.0, "clip_ratio/region_mean": 0.0, "completions/clipped_ratio": 0.0, "completions/max_length": 358.0, "completions/max_terminated_length": 358.0, "completions/mean_length": 135.75, "completions/mean_terminated_length": 135.75, "completions/min_length": 13.5, "completions/min_terminated_length": 13.5, "epoch": 2.8275862068965516, "grad_norm": 15.697056770324707, "kl": 0.001014976151054725, "learning_rate": 3.4096741493194193e-09, "loss": 0.2045, "num_tokens": 79349.0, "reward": 0.24373424425721169, "reward_std": 0.3253984763287008, "rewards/concensus_correctness_reward_func/mean": 0.22374999523162842, "rewards/concensus_correctness_reward_func/std": 0.6328606009483337, "rewards/consensus_reward_func/mean": 0.0, "rewards/consensus_reward_func/std": 0.0, "rewards/cumulative_reward_2/mean": 0.0, "rewards/cumulative_reward_2/std": 0.0, "rewards/final_correctness_reward_func/mean": 0.0, "rewards/final_correctness_reward_func/std": 0.0, "rewards/question_recreation_reward_func/mean": 0.019984250888228416, "rewards/question_recreation_reward_func/std": 0.009346078149974346, "rewards/soft_format_reward_func/mean": 0.0, "rewards/soft_format_reward_func/std": 0.0, "rewards/strict_format_reward_func/mean": 0.0, "rewards/strict_format_reward_func/std": 0.0, "rewards/xmlcount_reward_func/mean": 0.0, "rewards/xmlcount_reward_func/std": 0.0, "step": 20 }, { "epoch": 2.8275862068965516, "step": 20, "total_flos": 0.0, "train_loss": 0.16590909510850907, "train_runtime": 553528.733, "train_samples_per_second": 0.0, "train_steps_per_second": 0.0 } ], "logging_steps": 2, "max_steps": 20, "num_input_tokens_seen": 79349, "num_train_epochs": 3, "save_steps": 25, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }