{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0030440473653770054, "eval_steps": 10, "global_step": 50, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 6.08809473075401e-05, "eval_loss": 6.931131362915039, "eval_runtime": 656.8644, "eval_samples_per_second": 10.529, "eval_steps_per_second": 5.264, "step": 1 }, { "epoch": 0.00030440473653770055, "grad_norm": 45.05469512939453, "learning_rate": 5e-05, "loss": 27.2097, "step": 5 }, { "epoch": 0.0006088094730754011, "grad_norm": 40.21764373779297, "learning_rate": 0.0001, "loss": 19.0893, "step": 10 }, { "epoch": 0.0006088094730754011, "eval_loss": 2.306489944458008, "eval_runtime": 658.2084, "eval_samples_per_second": 10.507, "eval_steps_per_second": 5.254, "step": 10 }, { "epoch": 0.0009132142096131016, "grad_norm": 13.2877779006958, "learning_rate": 9.619397662556435e-05, "loss": 3.675, "step": 15 }, { "epoch": 0.0012176189461508022, "grad_norm": 7.806561470031738, "learning_rate": 8.535533905932738e-05, "loss": 0.4316, "step": 20 }, { "epoch": 0.0012176189461508022, "eval_loss": 0.07837376743555069, "eval_runtime": 656.503, "eval_samples_per_second": 10.535, "eval_steps_per_second": 5.267, "step": 20 }, { "epoch": 0.0015220236826885027, "grad_norm": 2.9194090366363525, "learning_rate": 6.91341716182545e-05, "loss": 0.9073, "step": 25 }, { "epoch": 0.0018264284192262032, "grad_norm": 23.289958953857422, "learning_rate": 5e-05, "loss": 0.6673, "step": 30 }, { "epoch": 0.0018264284192262032, "eval_loss": 0.07907278090715408, "eval_runtime": 658.9663, "eval_samples_per_second": 10.495, "eval_steps_per_second": 5.248, "step": 30 }, { "epoch": 0.002130833155763904, "grad_norm": 13.350411415100098, "learning_rate": 3.086582838174551e-05, "loss": 0.3659, "step": 35 }, { "epoch": 0.0024352378923016044, "grad_norm": 2.5347867012023926, "learning_rate": 1.4644660940672627e-05, "loss": 0.2356, "step": 40 }, { "epoch": 0.0024352378923016044, "eval_loss": 0.0975862666964531, "eval_runtime": 658.7808, "eval_samples_per_second": 10.498, "eval_steps_per_second": 5.249, "step": 40 }, { "epoch": 0.002739642628839305, "grad_norm": 1.3288694620132446, "learning_rate": 3.8060233744356633e-06, "loss": 0.2834, "step": 45 }, { "epoch": 0.0030440473653770054, "grad_norm": 12.975996971130371, "learning_rate": 0.0, "loss": 0.3669, "step": 50 }, { "epoch": 0.0030440473653770054, "eval_loss": 0.07795499265193939, "eval_runtime": 657.4379, "eval_samples_per_second": 10.52, "eval_steps_per_second": 5.26, "step": 50 } ], "logging_steps": 5, "max_steps": 50, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 13, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.4260472119296e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }