{ "best_metric": 0.2736915647983551, "best_model_checkpoint": "distilbert-base-uncased-finetuned-clinc-oos-plus/run-2/checkpoint-714", "epoch": 5.95, "eval_steps": 119, "global_step": 714, "is_hyper_param_search": true, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.9916666666666667, "grad_norm": 0.698729932308197, "learning_rate": 1.6694444444444446e-05, "loss": 0.6622, "step": 119 }, { "epoch": 0.9916666666666667, "eval_accuracy": 0.05806451612903226, "eval_loss": 0.5631250739097595, "eval_runtime": 5.3039, "eval_samples_per_second": 584.478, "eval_steps_per_second": 4.714, "step": 119 }, { "epoch": 1.9833333333333334, "grad_norm": 0.9459291696548462, "learning_rate": 1.338888888888889e-05, "loss": 0.5163, "step": 238 }, { "epoch": 1.9833333333333334, "eval_accuracy": 0.18161290322580645, "eval_loss": 0.4296840727329254, "eval_runtime": 5.2697, "eval_samples_per_second": 588.274, "eval_steps_per_second": 4.744, "step": 238 }, { "epoch": 2.975, "grad_norm": 1.3281234502792358, "learning_rate": 1.0083333333333334e-05, "loss": 0.4171, "step": 357 }, { "epoch": 2.975, "eval_accuracy": 0.3574193548387097, "eval_loss": 0.35349318385124207, "eval_runtime": 5.1875, "eval_samples_per_second": 597.596, "eval_steps_per_second": 4.819, "step": 357 }, { "epoch": 3.966666666666667, "grad_norm": 0.7127528786659241, "learning_rate": 6.777777777777779e-06, "loss": 0.3534, "step": 476 }, { "epoch": 3.966666666666667, "eval_accuracy": 0.46774193548387094, "eval_loss": 0.3053215444087982, "eval_runtime": 5.2822, "eval_samples_per_second": 586.875, "eval_steps_per_second": 4.733, "step": 476 }, { "epoch": 4.958333333333333, "grad_norm": 0.6603091359138489, "learning_rate": 3.4722222222222224e-06, "loss": 0.3177, "step": 595 }, { "epoch": 4.958333333333333, "eval_accuracy": 0.5312903225806451, "eval_loss": 0.2807427644729614, "eval_runtime": 5.2469, "eval_samples_per_second": 590.829, "eval_steps_per_second": 4.765, "step": 595 }, { "epoch": 5.95, "grad_norm": 0.7326369881629944, "learning_rate": 1.6666666666666668e-07, "loss": 0.2997, "step": 714 }, { "epoch": 5.95, "eval_accuracy": 0.5503225806451613, "eval_loss": 0.2736915647983551, "eval_runtime": 5.2539, "eval_samples_per_second": 590.035, "eval_steps_per_second": 4.758, "step": 714 } ], "logging_steps": 119, "max_steps": 720, "num_input_tokens_seen": 0, "num_train_epochs": 6, "save_steps": 119, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 545563432923180.0, "train_batch_size": 128, "trial_name": null, "trial_params": { "alpha": 0.29553321059794946, "num_train_epochs": 6, "temperature": 14 } }