| { |
| "best_metric": 0.19450587034225464, |
| "best_model_checkpoint": "distilbert-base-uncased-finetuned-clinc-oos-plus/run-12/checkpoint-1785", |
| "epoch": 14.875, |
| "eval_steps": 119, |
| "global_step": 1785, |
| "is_hyper_param_search": true, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.9916666666666667, |
| "grad_norm": 0.8180056214332581, |
| "learning_rate": 1.8677777777777778e-05, |
| "loss": 1.5139, |
| "step": 119 |
| }, |
| { |
| "epoch": 0.9916666666666667, |
| "eval_accuracy": 0.1396774193548387, |
| "eval_loss": 1.2963447570800781, |
| "eval_runtime": 5.2191, |
| "eval_samples_per_second": 593.972, |
| "eval_steps_per_second": 4.79, |
| "step": 119 |
| }, |
| { |
| "epoch": 1.9833333333333334, |
| "grad_norm": 1.3891874551773071, |
| "learning_rate": 1.7355555555555558e-05, |
| "loss": 1.1785, |
| "step": 238 |
| }, |
| { |
| "epoch": 1.9833333333333334, |
| "eval_accuracy": 0.5116129032258064, |
| "eval_loss": 0.8595607280731201, |
| "eval_runtime": 5.2576, |
| "eval_samples_per_second": 589.624, |
| "eval_steps_per_second": 4.755, |
| "step": 238 |
| }, |
| { |
| "epoch": 2.975, |
| "grad_norm": 1.339552640914917, |
| "learning_rate": 1.6033333333333335e-05, |
| "loss": 0.7933, |
| "step": 357 |
| }, |
| { |
| "epoch": 2.975, |
| "eval_accuracy": 0.6690322580645162, |
| "eval_loss": 0.5503354668617249, |
| "eval_runtime": 5.2604, |
| "eval_samples_per_second": 589.305, |
| "eval_steps_per_second": 4.752, |
| "step": 357 |
| }, |
| { |
| "epoch": 3.966666666666667, |
| "grad_norm": 1.4430162906646729, |
| "learning_rate": 1.4711111111111111e-05, |
| "loss": 0.5499, |
| "step": 476 |
| }, |
| { |
| "epoch": 3.966666666666667, |
| "eval_accuracy": 0.734516129032258, |
| "eval_loss": 0.3985496759414673, |
| "eval_runtime": 5.2888, |
| "eval_samples_per_second": 586.14, |
| "eval_steps_per_second": 4.727, |
| "step": 476 |
| }, |
| { |
| "epoch": 4.958333333333333, |
| "grad_norm": 1.265928864479065, |
| "learning_rate": 1.338888888888889e-05, |
| "loss": 0.4226, |
| "step": 595 |
| }, |
| { |
| "epoch": 4.958333333333333, |
| "eval_accuracy": 0.7641935483870967, |
| "eval_loss": 0.3224957585334778, |
| "eval_runtime": 5.2387, |
| "eval_samples_per_second": 591.752, |
| "eval_steps_per_second": 4.772, |
| "step": 595 |
| }, |
| { |
| "epoch": 5.95, |
| "grad_norm": 1.514481544494629, |
| "learning_rate": 1.206666666666667e-05, |
| "loss": 0.3466, |
| "step": 714 |
| }, |
| { |
| "epoch": 5.95, |
| "eval_accuracy": 0.7909677419354839, |
| "eval_loss": 0.2790695130825043, |
| "eval_runtime": 5.2618, |
| "eval_samples_per_second": 589.147, |
| "eval_steps_per_second": 4.751, |
| "step": 714 |
| }, |
| { |
| "epoch": 6.941666666666666, |
| "grad_norm": 1.1318318843841553, |
| "learning_rate": 1.0744444444444446e-05, |
| "loss": 0.3007, |
| "step": 833 |
| }, |
| { |
| "epoch": 6.941666666666666, |
| "eval_accuracy": 0.805483870967742, |
| "eval_loss": 0.2540387809276581, |
| "eval_runtime": 5.309, |
| "eval_samples_per_second": 583.91, |
| "eval_steps_per_second": 4.709, |
| "step": 833 |
| }, |
| { |
| "epoch": 7.933333333333334, |
| "grad_norm": 1.1625335216522217, |
| "learning_rate": 9.422222222222222e-06, |
| "loss": 0.2646, |
| "step": 952 |
| }, |
| { |
| "epoch": 7.933333333333334, |
| "eval_accuracy": 0.8080645161290323, |
| "eval_loss": 0.23807008564472198, |
| "eval_runtime": 5.6673, |
| "eval_samples_per_second": 546.998, |
| "eval_steps_per_second": 4.411, |
| "step": 952 |
| }, |
| { |
| "epoch": 8.925, |
| "grad_norm": 0.9929422736167908, |
| "learning_rate": 8.1e-06, |
| "loss": 0.2418, |
| "step": 1071 |
| }, |
| { |
| "epoch": 8.925, |
| "eval_accuracy": 0.8241935483870968, |
| "eval_loss": 0.2234683483839035, |
| "eval_runtime": 5.2893, |
| "eval_samples_per_second": 586.085, |
| "eval_steps_per_second": 4.726, |
| "step": 1071 |
| }, |
| { |
| "epoch": 9.916666666666666, |
| "grad_norm": 1.3932344913482666, |
| "learning_rate": 6.777777777777779e-06, |
| "loss": 0.2228, |
| "step": 1190 |
| }, |
| { |
| "epoch": 9.916666666666666, |
| "eval_accuracy": 0.8296774193548387, |
| "eval_loss": 0.21503257751464844, |
| "eval_runtime": 5.2284, |
| "eval_samples_per_second": 592.916, |
| "eval_steps_per_second": 4.782, |
| "step": 1190 |
| }, |
| { |
| "epoch": 10.908333333333333, |
| "grad_norm": 1.1120707988739014, |
| "learning_rate": 5.455555555555556e-06, |
| "loss": 0.2071, |
| "step": 1309 |
| }, |
| { |
| "epoch": 10.908333333333333, |
| "eval_accuracy": 0.832258064516129, |
| "eval_loss": 0.20633584260940552, |
| "eval_runtime": 5.269, |
| "eval_samples_per_second": 588.344, |
| "eval_steps_per_second": 4.745, |
| "step": 1309 |
| }, |
| { |
| "epoch": 11.9, |
| "grad_norm": 1.1221190690994263, |
| "learning_rate": 4.133333333333333e-06, |
| "loss": 0.1991, |
| "step": 1428 |
| }, |
| { |
| "epoch": 11.9, |
| "eval_accuracy": 0.834516129032258, |
| "eval_loss": 0.20154178142547607, |
| "eval_runtime": 5.2955, |
| "eval_samples_per_second": 585.399, |
| "eval_steps_per_second": 4.721, |
| "step": 1428 |
| }, |
| { |
| "epoch": 12.891666666666667, |
| "grad_norm": 0.9445534348487854, |
| "learning_rate": 2.811111111111111e-06, |
| "loss": 0.1911, |
| "step": 1547 |
| }, |
| { |
| "epoch": 12.891666666666667, |
| "eval_accuracy": 0.837741935483871, |
| "eval_loss": 0.19792121648788452, |
| "eval_runtime": 5.2725, |
| "eval_samples_per_second": 587.958, |
| "eval_steps_per_second": 4.742, |
| "step": 1547 |
| }, |
| { |
| "epoch": 13.883333333333333, |
| "grad_norm": 0.9927912950515747, |
| "learning_rate": 1.4888888888888888e-06, |
| "loss": 0.1855, |
| "step": 1666 |
| }, |
| { |
| "epoch": 13.883333333333333, |
| "eval_accuracy": 0.8403225806451613, |
| "eval_loss": 0.1957916021347046, |
| "eval_runtime": 5.2457, |
| "eval_samples_per_second": 590.96, |
| "eval_steps_per_second": 4.766, |
| "step": 1666 |
| }, |
| { |
| "epoch": 14.875, |
| "grad_norm": 0.9268798828125, |
| "learning_rate": 1.6666666666666668e-07, |
| "loss": 0.1824, |
| "step": 1785 |
| }, |
| { |
| "epoch": 14.875, |
| "eval_accuracy": 0.8403225806451613, |
| "eval_loss": 0.19450587034225464, |
| "eval_runtime": 5.2577, |
| "eval_samples_per_second": 589.606, |
| "eval_steps_per_second": 4.755, |
| "step": 1785 |
| } |
| ], |
| "logging_steps": 119, |
| "max_steps": 1800, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 15, |
| "save_steps": 119, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": false |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 1358349105005256.0, |
| "train_batch_size": 128, |
| "trial_name": null, |
| "trial_params": { |
| "alpha": 0.502732251510764, |
| "num_train_epochs": 15, |
| "temperature": 2 |
| } |
| } |
|
|