HuggingPanda's picture
Training in progress, step 119
95a0dd0 verified
Raw
History Blame Contribute Delete
4.69 kB
{
"best_metric": 0.19915683567523956,
"best_model_checkpoint": "distilbert-base-uncased-finetuned-clinc-oos-plus/run-0/checkpoint-1071",
"epoch": 8.925,
"eval_steps": 119,
"global_step": 1071,
"is_hyper_param_search": true,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.9916666666666667,
"grad_norm": 0.7661037445068359,
"learning_rate": 1.77962962962963e-05,
"loss": 0.6655,
"step": 119
},
{
"epoch": 0.9916666666666667,
"eval_accuracy": 0.05709677419354839,
"eval_loss": 0.5611550807952881,
"eval_runtime": 5.2298,
"eval_samples_per_second": 592.757,
"eval_steps_per_second": 4.78,
"step": 119
},
{
"epoch": 1.9833333333333334,
"grad_norm": 1.0290801525115967,
"learning_rate": 1.5592592592592593e-05,
"loss": 0.5116,
"step": 238
},
{
"epoch": 1.9833333333333334,
"eval_accuracy": 0.2,
"eval_loss": 0.42120361328125,
"eval_runtime": 5.3353,
"eval_samples_per_second": 581.039,
"eval_steps_per_second": 4.686,
"step": 238
},
{
"epoch": 2.975,
"grad_norm": 0.851043164730072,
"learning_rate": 1.338888888888889e-05,
"loss": 0.402,
"step": 357
},
{
"epoch": 2.975,
"eval_accuracy": 0.41838709677419356,
"eval_loss": 0.3284984827041626,
"eval_runtime": 5.283,
"eval_samples_per_second": 586.785,
"eval_steps_per_second": 4.732,
"step": 357
},
{
"epoch": 3.966666666666667,
"grad_norm": 0.7865561246871948,
"learning_rate": 1.1185185185185185e-05,
"loss": 0.3261,
"step": 476
},
{
"epoch": 3.966666666666667,
"eval_accuracy": 0.5587096774193548,
"eval_loss": 0.2734394669532776,
"eval_runtime": 5.255,
"eval_samples_per_second": 589.91,
"eval_steps_per_second": 4.757,
"step": 476
},
{
"epoch": 4.958333333333333,
"grad_norm": 0.7745070457458496,
"learning_rate": 8.981481481481483e-06,
"loss": 0.282,
"step": 595
},
{
"epoch": 4.958333333333333,
"eval_accuracy": 0.6261290322580645,
"eval_loss": 0.23937486112117767,
"eval_runtime": 5.2704,
"eval_samples_per_second": 588.194,
"eval_steps_per_second": 4.743,
"step": 595
},
{
"epoch": 5.95,
"grad_norm": 0.9656067490577698,
"learning_rate": 6.777777777777779e-06,
"loss": 0.2523,
"step": 714
},
{
"epoch": 5.95,
"eval_accuracy": 0.6803225806451613,
"eval_loss": 0.21992823481559753,
"eval_runtime": 5.241,
"eval_samples_per_second": 591.487,
"eval_steps_per_second": 4.77,
"step": 714
},
{
"epoch": 6.941666666666666,
"grad_norm": 0.6306410431861877,
"learning_rate": 4.5740740740740745e-06,
"loss": 0.235,
"step": 833
},
{
"epoch": 6.941666666666666,
"eval_accuracy": 0.6967741935483871,
"eval_loss": 0.20852065086364746,
"eval_runtime": 5.2518,
"eval_samples_per_second": 590.271,
"eval_steps_per_second": 4.76,
"step": 833
},
{
"epoch": 7.933333333333334,
"grad_norm": 0.6096643805503845,
"learning_rate": 2.3703703703703707e-06,
"loss": 0.2228,
"step": 952
},
{
"epoch": 7.933333333333334,
"eval_accuracy": 0.7103225806451613,
"eval_loss": 0.20159533619880676,
"eval_runtime": 5.2662,
"eval_samples_per_second": 588.662,
"eval_steps_per_second": 4.747,
"step": 952
},
{
"epoch": 8.925,
"grad_norm": 0.5338801145553589,
"learning_rate": 1.6666666666666668e-07,
"loss": 0.2174,
"step": 1071
},
{
"epoch": 8.925,
"eval_accuracy": 0.714516129032258,
"eval_loss": 0.19915683567523956,
"eval_runtime": 5.2762,
"eval_samples_per_second": 587.546,
"eval_steps_per_second": 4.738,
"step": 1071
}
],
"logging_steps": 119,
"max_steps": 1080,
"num_input_tokens_seen": 0,
"num_train_epochs": 9,
"save_steps": 119,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 816805015151832.0,
"train_batch_size": 128,
"trial_name": null,
"trial_params": {
"alpha": 0.7937035517473829,
"num_train_epochs": 9,
"temperature": 13
}
}