Incomple's picture
End of training
d51cff1 verified
Raw
History Blame Contribute Delete
5.38 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.9996440014239943,
"eval_steps": 250,
"global_step": 1404,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.05055179779280883,
"grad_norm": 0.6696942448616028,
"learning_rate": 5.0354609929078e-07,
"loss": 0.436,
"step": 71
},
{
"epoch": 0.10110359558561766,
"grad_norm": 1.0538969039916992,
"learning_rate": 9.992082343626285e-07,
"loss": 0.4702,
"step": 142
},
{
"epoch": 0.15165539337842648,
"grad_norm": 4.0300822257995605,
"learning_rate": 9.429928741092636e-07,
"loss": 0.3861,
"step": 213
},
{
"epoch": 0.17799928800284798,
"eval_loss": 0.33530548214912415,
"eval_runtime": 28.7859,
"eval_samples_per_second": 17.37,
"eval_steps_per_second": 8.685,
"step": 250
},
{
"epoch": 0.2022071911712353,
"grad_norm": 1.1703342199325562,
"learning_rate": 8.867775138558986e-07,
"loss": 0.3824,
"step": 284
},
{
"epoch": 0.25275898896404414,
"grad_norm": 1.0430041551589966,
"learning_rate": 8.305621536025336e-07,
"loss": 0.3494,
"step": 355
},
{
"epoch": 0.30331078675685297,
"grad_norm": 1.1387194395065308,
"learning_rate": 7.743467933491686e-07,
"loss": 0.3172,
"step": 426
},
{
"epoch": 0.3538625845496618,
"grad_norm": 1.7634204626083374,
"learning_rate": 7.181314330958036e-07,
"loss": 0.3075,
"step": 497
},
{
"epoch": 0.35599857600569595,
"eval_loss": 0.21360304951667786,
"eval_runtime": 28.7874,
"eval_samples_per_second": 17.369,
"eval_steps_per_second": 8.684,
"step": 500
},
{
"epoch": 0.4044143823424706,
"grad_norm": 2.539411783218384,
"learning_rate": 6.619160728424386e-07,
"loss": 0.2562,
"step": 568
},
{
"epoch": 0.45496618013527945,
"grad_norm": 1.2169667482376099,
"learning_rate": 6.057007125890736e-07,
"loss": 0.2832,
"step": 639
},
{
"epoch": 0.5055179779280883,
"grad_norm": 1.549967646598816,
"learning_rate": 5.494853523357086e-07,
"loss": 0.2606,
"step": 710
},
{
"epoch": 0.533997864008544,
"eval_loss": 0.1820104718208313,
"eval_runtime": 28.7804,
"eval_samples_per_second": 17.373,
"eval_steps_per_second": 8.686,
"step": 750
},
{
"epoch": 0.5560697757208971,
"grad_norm": 1.2805540561676025,
"learning_rate": 4.932699920823436e-07,
"loss": 0.2443,
"step": 781
},
{
"epoch": 0.6066215735137059,
"grad_norm": 2.841620683670044,
"learning_rate": 4.3705463182897863e-07,
"loss": 0.2421,
"step": 852
},
{
"epoch": 0.6571733713065148,
"grad_norm": 1.1338871717453003,
"learning_rate": 3.808392715756136e-07,
"loss": 0.2301,
"step": 923
},
{
"epoch": 0.7077251690993236,
"grad_norm": 2.319748878479004,
"learning_rate": 3.246239113222486e-07,
"loss": 0.2404,
"step": 994
},
{
"epoch": 0.7119971520113919,
"eval_loss": 0.16689015924930573,
"eval_runtime": 28.7832,
"eval_samples_per_second": 17.371,
"eval_steps_per_second": 8.686,
"step": 1000
},
{
"epoch": 0.7582769668921324,
"grad_norm": 1.218746542930603,
"learning_rate": 2.684085510688836e-07,
"loss": 0.2535,
"step": 1065
},
{
"epoch": 0.8088287646849412,
"grad_norm": 3.11279296875,
"learning_rate": 2.1219319081551858e-07,
"loss": 0.2323,
"step": 1136
},
{
"epoch": 0.8593805624777501,
"grad_norm": 2.013932704925537,
"learning_rate": 1.559778305621536e-07,
"loss": 0.257,
"step": 1207
},
{
"epoch": 0.8899964400142399,
"eval_loss": 0.16124244034290314,
"eval_runtime": 28.7354,
"eval_samples_per_second": 17.4,
"eval_steps_per_second": 8.7,
"step": 1250
},
{
"epoch": 0.9099323602705589,
"grad_norm": 1.400206446647644,
"learning_rate": 9.976247030878859e-08,
"loss": 0.2368,
"step": 1278
},
{
"epoch": 0.9604841580633677,
"grad_norm": 3.216315984725952,
"learning_rate": 4.35471100554236e-08,
"loss": 0.217,
"step": 1349
},
{
"epoch": 0.9996440014239943,
"step": 1404,
"total_flos": 1.0823852276239565e+17,
"train_loss": 0.2917507768016935,
"train_runtime": 2474.252,
"train_samples_per_second": 4.541,
"train_steps_per_second": 0.567
}
],
"logging_steps": 71,
"max_steps": 1404,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.0823852276239565e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}