{ "best_metric": 0.16098131239414215, "best_model_checkpoint": "distilbert-base-uncased-finetuned-clinc-oos-plus/run-3/checkpoint-1547", "epoch": 12.891666666666667, "eval_steps": 119, "global_step": 1547, "is_hyper_param_search": true, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.9916666666666667, "grad_norm": 0.8229151964187622, "learning_rate": 1.8474358974358976e-05, "loss": 0.7547, "step": 119 }, { "epoch": 0.9916666666666667, "eval_accuracy": 0.05806451612903226, "eval_loss": 0.6397132277488708, "eval_runtime": 5.2726, "eval_samples_per_second": 587.944, "eval_steps_per_second": 4.741, "step": 119 }, { "epoch": 1.9833333333333334, "grad_norm": 0.8302074074745178, "learning_rate": 1.694871794871795e-05, "loss": 0.5809, "step": 238 }, { "epoch": 1.9833333333333334, "eval_accuracy": 0.2719354838709677, "eval_loss": 0.4648343324661255, "eval_runtime": 5.2864, "eval_samples_per_second": 586.41, "eval_steps_per_second": 4.729, "step": 238 }, { "epoch": 2.975, "grad_norm": 0.9633338451385498, "learning_rate": 1.5423076923076925e-05, "loss": 0.439, "step": 357 }, { "epoch": 2.975, "eval_accuracy": 0.5116129032258064, "eval_loss": 0.34660565853118896, "eval_runtime": 5.2338, "eval_samples_per_second": 592.302, "eval_steps_per_second": 4.777, "step": 357 }, { "epoch": 3.966666666666667, "grad_norm": 0.9026358723640442, "learning_rate": 1.3897435897435898e-05, "loss": 0.3438, "step": 476 }, { "epoch": 3.966666666666667, "eval_accuracy": 0.6358064516129033, "eval_loss": 0.27853256464004517, "eval_runtime": 5.3024, "eval_samples_per_second": 584.642, "eval_steps_per_second": 4.715, "step": 476 }, { "epoch": 4.958333333333333, "grad_norm": 0.9341942667961121, "learning_rate": 1.2371794871794874e-05, "loss": 0.2875, "step": 595 }, { "epoch": 4.958333333333333, "eval_accuracy": 0.7029032258064516, "eval_loss": 0.23647043108940125, "eval_runtime": 5.2502, "eval_samples_per_second": 590.453, "eval_steps_per_second": 4.762, "step": 595 }, { "epoch": 5.95, "grad_norm": 0.9973844289779663, "learning_rate": 1.0846153846153847e-05, "loss": 0.2494, "step": 714 }, { "epoch": 5.95, "eval_accuracy": 0.7335483870967742, "eval_loss": 0.21039870381355286, "eval_runtime": 5.252, "eval_samples_per_second": 590.253, "eval_steps_per_second": 4.76, "step": 714 }, { "epoch": 6.941666666666666, "grad_norm": 0.6948856115341187, "learning_rate": 9.320512820512821e-06, "loss": 0.2245, "step": 833 }, { "epoch": 6.941666666666666, "eval_accuracy": 0.7548387096774194, "eval_loss": 0.19484896957874298, "eval_runtime": 5.252, "eval_samples_per_second": 590.25, "eval_steps_per_second": 4.76, "step": 833 }, { "epoch": 7.933333333333334, "grad_norm": 0.8398630619049072, "learning_rate": 7.794871794871796e-06, "loss": 0.2056, "step": 952 }, { "epoch": 7.933333333333334, "eval_accuracy": 0.7638709677419355, "eval_loss": 0.1842084378004074, "eval_runtime": 5.2457, "eval_samples_per_second": 590.959, "eval_steps_per_second": 4.766, "step": 952 }, { "epoch": 8.925, "grad_norm": 0.6326949596405029, "learning_rate": 6.26923076923077e-06, "loss": 0.1936, "step": 1071 }, { "epoch": 8.925, "eval_accuracy": 0.7748387096774193, "eval_loss": 0.17528517544269562, "eval_runtime": 5.2596, "eval_samples_per_second": 589.395, "eval_steps_per_second": 4.753, "step": 1071 }, { "epoch": 9.916666666666666, "grad_norm": 0.953779935836792, "learning_rate": 4.743589743589744e-06, "loss": 0.183, "step": 1190 }, { "epoch": 9.916666666666666, "eval_accuracy": 0.7806451612903226, "eval_loss": 0.16899022459983826, "eval_runtime": 5.2384, "eval_samples_per_second": 591.781, "eval_steps_per_second": 4.772, "step": 1190 }, { "epoch": 10.908333333333333, "grad_norm": 0.7265395522117615, "learning_rate": 3.2179487179487186e-06, "loss": 0.1746, "step": 1309 }, { "epoch": 10.908333333333333, "eval_accuracy": 0.785483870967742, "eval_loss": 0.16413316130638123, "eval_runtime": 5.2583, "eval_samples_per_second": 589.547, "eval_steps_per_second": 4.754, "step": 1309 }, { "epoch": 11.9, "grad_norm": 0.70655357837677, "learning_rate": 1.6923076923076926e-06, "loss": 0.1714, "step": 1428 }, { "epoch": 11.9, "eval_accuracy": 0.7838709677419354, "eval_loss": 0.16201290488243103, "eval_runtime": 5.2735, "eval_samples_per_second": 587.849, "eval_steps_per_second": 4.741, "step": 1428 }, { "epoch": 12.891666666666667, "grad_norm": 0.671647310256958, "learning_rate": 1.6666666666666668e-07, "loss": 0.1687, "step": 1547 }, { "epoch": 12.891666666666667, "eval_accuracy": 0.7870967741935484, "eval_loss": 0.16098131239414215, "eval_runtime": 5.3094, "eval_samples_per_second": 583.865, "eval_steps_per_second": 4.709, "step": 1547 } ], "logging_steps": 119, "max_steps": 1560, "num_input_tokens_seen": 0, "num_train_epochs": 13, "save_steps": 119, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1176872678392572.0, "train_batch_size": 128, "trial_name": null, "trial_params": { "alpha": 0.147000328655721, "num_train_epochs": 13, "temperature": 6 } }