0xOzii's picture
End of training
ff45b84 verified
Raw History Blame Contribute Delete
8.29 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 500,
"global_step": 20,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 638.71875,
"epoch": 0.5714285714285714,
"grad_norm": 0.38374558091163635,
"kl": 0.0009654578389017843,
"learning_rate": 5e-07,
"loss": 0.0,
"reward": 2.6174719631671906,
"reward_std": 0.9517780635505915,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.5,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.4375,
"rewards/question_recreation_reward_func": 0.9712532758712769,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.29128124192357063,
"step": 2
},
{
"completion_length": 720.7083333333334,
"epoch": 1.0,
"grad_norm": 0.24735885858535767,
"kl": 0.0009645834603967766,
"learning_rate": 4.864543104251586e-07,
"loss": 0.0,
"reward": 2.694145619869232,
"reward_std": 0.739270132733509,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.75,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.25,
"rewards/question_recreation_reward_func": 0.9238538940747579,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.22970833691457906,
"step": 4
},
{
"completion_length": 655.90625,
"epoch": 1.5714285714285714,
"grad_norm": 0.2403717339038849,
"kl": 0.0009067438877536915,
"learning_rate": 4.472851273490984e-07,
"loss": 0.0,
"reward": 2.52608260512352,
"reward_std": 0.7863902058452368,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.5,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.25,
"rewards/question_recreation_reward_func": 0.9529263749718666,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.17684375261887908,
"step": 6
},
{
"completion_length": 643.875,
"epoch": 2.0,
"grad_norm": 0.120332270860672,
"kl": 0.0010642353493797903,
"learning_rate": 3.867370395306068e-07,
"loss": 0.0,
"reward": 2.9124013980229697,
"reward_std": 0.7194343196849028,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.75,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.5,
"rewards/question_recreation_reward_func": 0.9007347027460734,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.23833331791684031,
"step": 8
},
{
"completion_length": 528.03125,
"epoch": 2.571428571428571,
"grad_norm": 0.3127322196960449,
"kl": 0.0011082601922680624,
"learning_rate": 3.1137137178519977e-07,
"loss": 0.0,
"reward": 2.595315456390381,
"reward_std": 0.9942259974777699,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.25,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.6875,
"rewards/question_recreation_reward_func": 0.9626591950654984,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.3048437596298754,
"step": 10
},
{
"completion_length": 809.75,
"epoch": 3.0,
"grad_norm": 0.22717513144016266,
"kl": 0.0007695318054175004,
"learning_rate": 2.2935516363191693e-07,
"loss": 0.0,
"reward": 2.790837605794271,
"reward_std": 0.6141482169429461,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 2.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.08333333333333333,
"rewards/question_recreation_reward_func": 0.9246709446112314,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.21716668208440146,
"step": 12
},
{
"completion_length": 610.09375,
"epoch": 3.571428571428571,
"grad_norm": 0.3834904134273529,
"kl": 0.0010239674520562403,
"learning_rate": 1.4957614383675767e-07,
"loss": 0.0,
"reward": 2.812987893819809,
"reward_std": 0.8699007257819176,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.3125,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.6875,
"rewards/question_recreation_reward_func": 0.9098628908395767,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.09687499329447746,
"step": 14
},
{
"completion_length": 676.375,
"epoch": 4.0,
"grad_norm": 0.21810463070869446,
"kl": 0.0010542051847248028,
"learning_rate": 8.067960709356478e-08,
"loss": 0.0,
"reward": 2.669045388698578,
"reward_std": 0.4530413995186488,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 2.0,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.4166666666666667,
"rewards/question_recreation_reward_func": 0.9392953912417094,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.6869166592756907,
"step": 16
},
{
"completion_length": 700.25,
"epoch": 4.571428571428571,
"grad_norm": 0.2315680980682373,
"kl": 0.000864378635014873,
"learning_rate": 3.013156219837776e-08,
"loss": 0.0,
"reward": 2.9789403527975082,
"reward_std": 1.1692956015467644,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.4375,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.875,
"rewards/question_recreation_reward_func": 0.9160966128110886,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.24965623021125793,
"step": 18
},
{
"completion_length": 590.0416666666666,
"epoch": 5.0,
"grad_norm": 0.26396167278289795,
"kl": 0.0011462939631504316,
"learning_rate": 3.4096741493194193e-09,
"loss": 0.0,
"reward": 2.3803677956263223,
"reward_std": 0.7875129493574301,
"rewards/concensus_correctness_reward_func": 0.0,
"rewards/consensus_reward_func": 1.75,
"rewards/cumulative_reward_2": 0.0,
"rewards/final_correctness_reward_func": 0.0,
"rewards/question_recreation_reward_func": 0.9779927929242452,
"rewards/soft_format_reward_func": 0.0,
"rewards/strict_format_reward_func": 0.0,
"rewards/xmlcount_reward_func": -0.3476250000918905,
"step": 20
},
{
"epoch": 5.0,
"step": 20,
"total_flos": 0.0,
"train_loss": 1.06198954199499e-06,
"train_runtime": 2218.5211,
"train_samples_per_second": 0.144,
"train_steps_per_second": 0.009
}
],
"logging_steps": 2,
"max_steps": 20,
"num_input_tokens_seen": 0,
"num_train_epochs": 7,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}