{ "best_metric": 0.19450587034225464, "best_model_checkpoint": "distilbert-base-uncased-finetuned-clinc-oos-plus/run-12/checkpoint-1785", "epoch": 14.875, "eval_steps": 119, "global_step": 1785, "is_hyper_param_search": true, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.9916666666666667, "grad_norm": 0.8180056214332581, "learning_rate": 1.8677777777777778e-05, "loss": 1.5139, "step": 119 }, { "epoch": 0.9916666666666667, "eval_accuracy": 0.1396774193548387, "eval_loss": 1.2963447570800781, "eval_runtime": 5.2191, "eval_samples_per_second": 593.972, "eval_steps_per_second": 4.79, "step": 119 }, { "epoch": 1.9833333333333334, "grad_norm": 1.3891874551773071, "learning_rate": 1.7355555555555558e-05, "loss": 1.1785, "step": 238 }, { "epoch": 1.9833333333333334, "eval_accuracy": 0.5116129032258064, "eval_loss": 0.8595607280731201, "eval_runtime": 5.2576, "eval_samples_per_second": 589.624, "eval_steps_per_second": 4.755, "step": 238 }, { "epoch": 2.975, "grad_norm": 1.339552640914917, "learning_rate": 1.6033333333333335e-05, "loss": 0.7933, "step": 357 }, { "epoch": 2.975, "eval_accuracy": 0.6690322580645162, "eval_loss": 0.5503354668617249, "eval_runtime": 5.2604, "eval_samples_per_second": 589.305, "eval_steps_per_second": 4.752, "step": 357 }, { "epoch": 3.966666666666667, "grad_norm": 1.4430162906646729, "learning_rate": 1.4711111111111111e-05, "loss": 0.5499, "step": 476 }, { "epoch": 3.966666666666667, "eval_accuracy": 0.734516129032258, "eval_loss": 0.3985496759414673, "eval_runtime": 5.2888, "eval_samples_per_second": 586.14, "eval_steps_per_second": 4.727, "step": 476 }, { "epoch": 4.958333333333333, "grad_norm": 1.265928864479065, "learning_rate": 1.338888888888889e-05, "loss": 0.4226, "step": 595 }, { "epoch": 4.958333333333333, "eval_accuracy": 0.7641935483870967, "eval_loss": 0.3224957585334778, "eval_runtime": 5.2387, "eval_samples_per_second": 591.752, "eval_steps_per_second": 4.772, "step": 595 }, { "epoch": 5.95, "grad_norm": 1.514481544494629, "learning_rate": 1.206666666666667e-05, "loss": 0.3466, "step": 714 }, { "epoch": 5.95, "eval_accuracy": 0.7909677419354839, "eval_loss": 0.2790695130825043, "eval_runtime": 5.2618, "eval_samples_per_second": 589.147, "eval_steps_per_second": 4.751, "step": 714 }, { "epoch": 6.941666666666666, "grad_norm": 1.1318318843841553, "learning_rate": 1.0744444444444446e-05, "loss": 0.3007, "step": 833 }, { "epoch": 6.941666666666666, "eval_accuracy": 0.805483870967742, "eval_loss": 0.2540387809276581, "eval_runtime": 5.309, "eval_samples_per_second": 583.91, "eval_steps_per_second": 4.709, "step": 833 }, { "epoch": 7.933333333333334, "grad_norm": 1.1625335216522217, "learning_rate": 9.422222222222222e-06, "loss": 0.2646, "step": 952 }, { "epoch": 7.933333333333334, "eval_accuracy": 0.8080645161290323, "eval_loss": 0.23807008564472198, "eval_runtime": 5.6673, "eval_samples_per_second": 546.998, "eval_steps_per_second": 4.411, "step": 952 }, { "epoch": 8.925, "grad_norm": 0.9929422736167908, "learning_rate": 8.1e-06, "loss": 0.2418, "step": 1071 }, { "epoch": 8.925, "eval_accuracy": 0.8241935483870968, "eval_loss": 0.2234683483839035, "eval_runtime": 5.2893, "eval_samples_per_second": 586.085, "eval_steps_per_second": 4.726, "step": 1071 }, { "epoch": 9.916666666666666, "grad_norm": 1.3932344913482666, "learning_rate": 6.777777777777779e-06, "loss": 0.2228, "step": 1190 }, { "epoch": 9.916666666666666, "eval_accuracy": 0.8296774193548387, "eval_loss": 0.21503257751464844, "eval_runtime": 5.2284, "eval_samples_per_second": 592.916, "eval_steps_per_second": 4.782, "step": 1190 }, { "epoch": 10.908333333333333, "grad_norm": 1.1120707988739014, "learning_rate": 5.455555555555556e-06, "loss": 0.2071, "step": 1309 }, { "epoch": 10.908333333333333, "eval_accuracy": 0.832258064516129, "eval_loss": 0.20633584260940552, "eval_runtime": 5.269, "eval_samples_per_second": 588.344, "eval_steps_per_second": 4.745, "step": 1309 }, { "epoch": 11.9, "grad_norm": 1.1221190690994263, "learning_rate": 4.133333333333333e-06, "loss": 0.1991, "step": 1428 }, { "epoch": 11.9, "eval_accuracy": 0.834516129032258, "eval_loss": 0.20154178142547607, "eval_runtime": 5.2955, "eval_samples_per_second": 585.399, "eval_steps_per_second": 4.721, "step": 1428 }, { "epoch": 12.891666666666667, "grad_norm": 0.9445534348487854, "learning_rate": 2.811111111111111e-06, "loss": 0.1911, "step": 1547 }, { "epoch": 12.891666666666667, "eval_accuracy": 0.837741935483871, "eval_loss": 0.19792121648788452, "eval_runtime": 5.2725, "eval_samples_per_second": 587.958, "eval_steps_per_second": 4.742, "step": 1547 }, { "epoch": 13.883333333333333, "grad_norm": 0.9927912950515747, "learning_rate": 1.4888888888888888e-06, "loss": 0.1855, "step": 1666 }, { "epoch": 13.883333333333333, "eval_accuracy": 0.8403225806451613, "eval_loss": 0.1957916021347046, "eval_runtime": 5.2457, "eval_samples_per_second": 590.96, "eval_steps_per_second": 4.766, "step": 1666 }, { "epoch": 14.875, "grad_norm": 0.9268798828125, "learning_rate": 1.6666666666666668e-07, "loss": 0.1824, "step": 1785 }, { "epoch": 14.875, "eval_accuracy": 0.8403225806451613, "eval_loss": 0.19450587034225464, "eval_runtime": 5.2577, "eval_samples_per_second": 589.606, "eval_steps_per_second": 4.755, "step": 1785 } ], "logging_steps": 119, "max_steps": 1800, "num_input_tokens_seen": 0, "num_train_epochs": 15, "save_steps": 119, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1358349105005256.0, "train_batch_size": 128, "trial_name": null, "trial_params": { "alpha": 0.502732251510764, "num_train_epochs": 15, "temperature": 2 } }