{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9996440014239943, "eval_steps": 250, "global_step": 1404, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.05055179779280883, "grad_norm": 0.6696942448616028, "learning_rate": 5.0354609929078e-07, "loss": 0.436, "step": 71 }, { "epoch": 0.10110359558561766, "grad_norm": 1.0538969039916992, "learning_rate": 9.992082343626285e-07, "loss": 0.4702, "step": 142 }, { "epoch": 0.15165539337842648, "grad_norm": 4.0300822257995605, "learning_rate": 9.429928741092636e-07, "loss": 0.3861, "step": 213 }, { "epoch": 0.17799928800284798, "eval_loss": 0.33530548214912415, "eval_runtime": 28.7859, "eval_samples_per_second": 17.37, "eval_steps_per_second": 8.685, "step": 250 }, { "epoch": 0.2022071911712353, "grad_norm": 1.1703342199325562, "learning_rate": 8.867775138558986e-07, "loss": 0.3824, "step": 284 }, { "epoch": 0.25275898896404414, "grad_norm": 1.0430041551589966, "learning_rate": 8.305621536025336e-07, "loss": 0.3494, "step": 355 }, { "epoch": 0.30331078675685297, "grad_norm": 1.1387194395065308, "learning_rate": 7.743467933491686e-07, "loss": 0.3172, "step": 426 }, { "epoch": 0.3538625845496618, "grad_norm": 1.7634204626083374, "learning_rate": 7.181314330958036e-07, "loss": 0.3075, "step": 497 }, { "epoch": 0.35599857600569595, "eval_loss": 0.21360304951667786, "eval_runtime": 28.7874, "eval_samples_per_second": 17.369, "eval_steps_per_second": 8.684, "step": 500 }, { "epoch": 0.4044143823424706, "grad_norm": 2.539411783218384, "learning_rate": 6.619160728424386e-07, "loss": 0.2562, "step": 568 }, { "epoch": 0.45496618013527945, "grad_norm": 1.2169667482376099, "learning_rate": 6.057007125890736e-07, "loss": 0.2832, "step": 639 }, { "epoch": 0.5055179779280883, "grad_norm": 1.549967646598816, "learning_rate": 5.494853523357086e-07, "loss": 0.2606, "step": 710 }, { "epoch": 0.533997864008544, "eval_loss": 0.1820104718208313, "eval_runtime": 28.7804, "eval_samples_per_second": 17.373, "eval_steps_per_second": 8.686, "step": 750 }, { "epoch": 0.5560697757208971, "grad_norm": 1.2805540561676025, "learning_rate": 4.932699920823436e-07, "loss": 0.2443, "step": 781 }, { "epoch": 0.6066215735137059, "grad_norm": 2.841620683670044, "learning_rate": 4.3705463182897863e-07, "loss": 0.2421, "step": 852 }, { "epoch": 0.6571733713065148, "grad_norm": 1.1338871717453003, "learning_rate": 3.808392715756136e-07, "loss": 0.2301, "step": 923 }, { "epoch": 0.7077251690993236, "grad_norm": 2.319748878479004, "learning_rate": 3.246239113222486e-07, "loss": 0.2404, "step": 994 }, { "epoch": 0.7119971520113919, "eval_loss": 0.16689015924930573, "eval_runtime": 28.7832, "eval_samples_per_second": 17.371, "eval_steps_per_second": 8.686, "step": 1000 }, { "epoch": 0.7582769668921324, "grad_norm": 1.218746542930603, "learning_rate": 2.684085510688836e-07, "loss": 0.2535, "step": 1065 }, { "epoch": 0.8088287646849412, "grad_norm": 3.11279296875, "learning_rate": 2.1219319081551858e-07, "loss": 0.2323, "step": 1136 }, { "epoch": 0.8593805624777501, "grad_norm": 2.013932704925537, "learning_rate": 1.559778305621536e-07, "loss": 0.257, "step": 1207 }, { "epoch": 0.8899964400142399, "eval_loss": 0.16124244034290314, "eval_runtime": 28.7354, "eval_samples_per_second": 17.4, "eval_steps_per_second": 8.7, "step": 1250 }, { "epoch": 0.9099323602705589, "grad_norm": 1.400206446647644, "learning_rate": 9.976247030878859e-08, "loss": 0.2368, "step": 1278 }, { "epoch": 0.9604841580633677, "grad_norm": 3.216315984725952, "learning_rate": 4.35471100554236e-08, "loss": 0.217, "step": 1349 }, { "epoch": 0.9996440014239943, "step": 1404, "total_flos": 1.0823852276239565e+17, "train_loss": 0.2917507768016935, "train_runtime": 2474.252, "train_samples_per_second": 4.541, "train_steps_per_second": 0.567 } ], "logging_steps": 71, "max_steps": 1404, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.0823852276239565e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }