HuggingPanda's picture
Training in progress, step 119
c03c81f verified
Raw
History Blame
7.24 kB
{
"best_metric": 0.19450587034225464,
"best_model_checkpoint": "distilbert-base-uncased-finetuned-clinc-oos-plus/run-12/checkpoint-1785",
"epoch": 14.875,
"eval_steps": 119,
"global_step": 1785,
"is_hyper_param_search": true,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.9916666666666667,
"grad_norm": 0.8180056214332581,
"learning_rate": 1.8677777777777778e-05,
"loss": 1.5139,
"step": 119
},
{
"epoch": 0.9916666666666667,
"eval_accuracy": 0.1396774193548387,
"eval_loss": 1.2963447570800781,
"eval_runtime": 5.2191,
"eval_samples_per_second": 593.972,
"eval_steps_per_second": 4.79,
"step": 119
},
{
"epoch": 1.9833333333333334,
"grad_norm": 1.3891874551773071,
"learning_rate": 1.7355555555555558e-05,
"loss": 1.1785,
"step": 238
},
{
"epoch": 1.9833333333333334,
"eval_accuracy": 0.5116129032258064,
"eval_loss": 0.8595607280731201,
"eval_runtime": 5.2576,
"eval_samples_per_second": 589.624,
"eval_steps_per_second": 4.755,
"step": 238
},
{
"epoch": 2.975,
"grad_norm": 1.339552640914917,
"learning_rate": 1.6033333333333335e-05,
"loss": 0.7933,
"step": 357
},
{
"epoch": 2.975,
"eval_accuracy": 0.6690322580645162,
"eval_loss": 0.5503354668617249,
"eval_runtime": 5.2604,
"eval_samples_per_second": 589.305,
"eval_steps_per_second": 4.752,
"step": 357
},
{
"epoch": 3.966666666666667,
"grad_norm": 1.4430162906646729,
"learning_rate": 1.4711111111111111e-05,
"loss": 0.5499,
"step": 476
},
{
"epoch": 3.966666666666667,
"eval_accuracy": 0.734516129032258,
"eval_loss": 0.3985496759414673,
"eval_runtime": 5.2888,
"eval_samples_per_second": 586.14,
"eval_steps_per_second": 4.727,
"step": 476
},
{
"epoch": 4.958333333333333,
"grad_norm": 1.265928864479065,
"learning_rate": 1.338888888888889e-05,
"loss": 0.4226,
"step": 595
},
{
"epoch": 4.958333333333333,
"eval_accuracy": 0.7641935483870967,
"eval_loss": 0.3224957585334778,
"eval_runtime": 5.2387,
"eval_samples_per_second": 591.752,
"eval_steps_per_second": 4.772,
"step": 595
},
{
"epoch": 5.95,
"grad_norm": 1.514481544494629,
"learning_rate": 1.206666666666667e-05,
"loss": 0.3466,
"step": 714
},
{
"epoch": 5.95,
"eval_accuracy": 0.7909677419354839,
"eval_loss": 0.2790695130825043,
"eval_runtime": 5.2618,
"eval_samples_per_second": 589.147,
"eval_steps_per_second": 4.751,
"step": 714
},
{
"epoch": 6.941666666666666,
"grad_norm": 1.1318318843841553,
"learning_rate": 1.0744444444444446e-05,
"loss": 0.3007,
"step": 833
},
{
"epoch": 6.941666666666666,
"eval_accuracy": 0.805483870967742,
"eval_loss": 0.2540387809276581,
"eval_runtime": 5.309,
"eval_samples_per_second": 583.91,
"eval_steps_per_second": 4.709,
"step": 833
},
{
"epoch": 7.933333333333334,
"grad_norm": 1.1625335216522217,
"learning_rate": 9.422222222222222e-06,
"loss": 0.2646,
"step": 952
},
{
"epoch": 7.933333333333334,
"eval_accuracy": 0.8080645161290323,
"eval_loss": 0.23807008564472198,
"eval_runtime": 5.6673,
"eval_samples_per_second": 546.998,
"eval_steps_per_second": 4.411,
"step": 952
},
{
"epoch": 8.925,
"grad_norm": 0.9929422736167908,
"learning_rate": 8.1e-06,
"loss": 0.2418,
"step": 1071
},
{
"epoch": 8.925,
"eval_accuracy": 0.8241935483870968,
"eval_loss": 0.2234683483839035,
"eval_runtime": 5.2893,
"eval_samples_per_second": 586.085,
"eval_steps_per_second": 4.726,
"step": 1071
},
{
"epoch": 9.916666666666666,
"grad_norm": 1.3932344913482666,
"learning_rate": 6.777777777777779e-06,
"loss": 0.2228,
"step": 1190
},
{
"epoch": 9.916666666666666,
"eval_accuracy": 0.8296774193548387,
"eval_loss": 0.21503257751464844,
"eval_runtime": 5.2284,
"eval_samples_per_second": 592.916,
"eval_steps_per_second": 4.782,
"step": 1190
},
{
"epoch": 10.908333333333333,
"grad_norm": 1.1120707988739014,
"learning_rate": 5.455555555555556e-06,
"loss": 0.2071,
"step": 1309
},
{
"epoch": 10.908333333333333,
"eval_accuracy": 0.832258064516129,
"eval_loss": 0.20633584260940552,
"eval_runtime": 5.269,
"eval_samples_per_second": 588.344,
"eval_steps_per_second": 4.745,
"step": 1309
},
{
"epoch": 11.9,
"grad_norm": 1.1221190690994263,
"learning_rate": 4.133333333333333e-06,
"loss": 0.1991,
"step": 1428
},
{
"epoch": 11.9,
"eval_accuracy": 0.834516129032258,
"eval_loss": 0.20154178142547607,
"eval_runtime": 5.2955,
"eval_samples_per_second": 585.399,
"eval_steps_per_second": 4.721,
"step": 1428
},
{
"epoch": 12.891666666666667,
"grad_norm": 0.9445534348487854,
"learning_rate": 2.811111111111111e-06,
"loss": 0.1911,
"step": 1547
},
{
"epoch": 12.891666666666667,
"eval_accuracy": 0.837741935483871,
"eval_loss": 0.19792121648788452,
"eval_runtime": 5.2725,
"eval_samples_per_second": 587.958,
"eval_steps_per_second": 4.742,
"step": 1547
},
{
"epoch": 13.883333333333333,
"grad_norm": 0.9927912950515747,
"learning_rate": 1.4888888888888888e-06,
"loss": 0.1855,
"step": 1666
},
{
"epoch": 13.883333333333333,
"eval_accuracy": 0.8403225806451613,
"eval_loss": 0.1957916021347046,
"eval_runtime": 5.2457,
"eval_samples_per_second": 590.96,
"eval_steps_per_second": 4.766,
"step": 1666
},
{
"epoch": 14.875,
"grad_norm": 0.9268798828125,
"learning_rate": 1.6666666666666668e-07,
"loss": 0.1824,
"step": 1785
},
{
"epoch": 14.875,
"eval_accuracy": 0.8403225806451613,
"eval_loss": 0.19450587034225464,
"eval_runtime": 5.2577,
"eval_samples_per_second": 589.606,
"eval_steps_per_second": 4.755,
"step": 1785
}
],
"logging_steps": 119,
"max_steps": 1800,
"num_input_tokens_seen": 0,
"num_train_epochs": 15,
"save_steps": 119,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1358349105005256.0,
"train_batch_size": 128,
"trial_name": null,
"trial_params": {
"alpha": 0.502732251510764,
"num_train_epochs": 15,
"temperature": 2
}
}