pankajrudra's picture
Auto-upload after training: banglabert (Context_Aware)
0d84a24 verified
Raw
History Blame
6.31 kB
{
"best_global_step": 1750,
"best_metric": 0.9882060831781502,
"best_model_checkpoint": "./res_Context_Aware_banglabert/checkpoint-1750",
"epoch": 1.9294377067254684,
"eval_steps": 250,
"global_step": 1750,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.11025358324145534,
"grad_norm": 7.18897819519043,
"learning_rate": 4.9315259921744e-05,
"loss": 0.9709719848632813,
"step": 100
},
{
"epoch": 0.2205071664829107,
"grad_norm": 24.766324996948242,
"learning_rate": 4.791783119060928e-05,
"loss": 0.29621694564819334,
"step": 200
},
{
"epoch": 0.2756339581036384,
"eval_accuracy": 0.9683426443202979,
"eval_f1": 0.9683463785279671,
"eval_loss": 0.20300516486167908,
"eval_runtime": 14.8466,
"eval_samples_per_second": 108.509,
"eval_steps_per_second": 0.876,
"step": 250
},
{
"epoch": 0.33076074972436603,
"grad_norm": 8.417747497558594,
"learning_rate": 4.652040245947457e-05,
"loss": 0.21852529525756836,
"step": 300
},
{
"epoch": 0.4410143329658214,
"grad_norm": 0.17437691986560822,
"learning_rate": 4.5122973728339854e-05,
"loss": 0.16434497833251954,
"step": 400
},
{
"epoch": 0.5512679162072768,
"grad_norm": 0.2854061424732208,
"learning_rate": 4.372554499720514e-05,
"loss": 0.1867336082458496,
"step": 500
},
{
"epoch": 0.5512679162072768,
"eval_accuracy": 0.9819987585350713,
"eval_f1": 0.981997092407178,
"eval_loss": 0.13372504711151123,
"eval_runtime": 14.7675,
"eval_samples_per_second": 109.091,
"eval_steps_per_second": 0.88,
"step": 500
},
{
"epoch": 0.6615214994487321,
"grad_norm": 6.816864967346191,
"learning_rate": 4.232811626607043e-05,
"loss": 0.1479694938659668,
"step": 600
},
{
"epoch": 0.7717750826901875,
"grad_norm": 3.9543874263763428,
"learning_rate": 4.093068753493572e-05,
"loss": 0.12706973075866698,
"step": 700
},
{
"epoch": 0.8269018743109151,
"eval_accuracy": 0.9757914338919925,
"eval_f1": 0.975795221254004,
"eval_loss": 0.1680639237165451,
"eval_runtime": 14.8766,
"eval_samples_per_second": 108.291,
"eval_steps_per_second": 0.874,
"step": 750
},
{
"epoch": 0.8820286659316428,
"grad_norm": 20.209442138671875,
"learning_rate": 3.953325880380101e-05,
"loss": 0.1331749153137207,
"step": 800
},
{
"epoch": 0.9922822491730982,
"grad_norm": 12.12065315246582,
"learning_rate": 3.8135830072666296e-05,
"loss": 0.11961593627929687,
"step": 900
},
{
"epoch": 1.1025358324145536,
"grad_norm": 12.230631828308105,
"learning_rate": 3.673840134153159e-05,
"loss": 0.07725512027740479,
"step": 1000
},
{
"epoch": 1.1025358324145536,
"eval_accuracy": 0.9869646182495344,
"eval_f1": 0.986966155864457,
"eval_loss": 0.12348104268312454,
"eval_runtime": 14.7668,
"eval_samples_per_second": 109.096,
"eval_steps_per_second": 0.88,
"step": 1000
},
{
"epoch": 1.2127894156560088,
"grad_norm": 0.5774375200271606,
"learning_rate": 3.5340972610396874e-05,
"loss": 0.09056113243103027,
"step": 1100
},
{
"epoch": 1.3230429988974641,
"grad_norm": 0.11910726875066757,
"learning_rate": 3.394354387926216e-05,
"loss": 0.042015490531921384,
"step": 1200
},
{
"epoch": 1.3781697905181918,
"eval_accuracy": 0.9807572936064556,
"eval_f1": 0.9807604085886992,
"eval_loss": 0.21958932280540466,
"eval_runtime": 14.8453,
"eval_samples_per_second": 108.519,
"eval_steps_per_second": 0.876,
"step": 1250
},
{
"epoch": 1.4332965821389196,
"grad_norm": 0.11699436604976654,
"learning_rate": 3.2546115148127446e-05,
"loss": 0.0719094467163086,
"step": 1300
},
{
"epoch": 1.543550165380375,
"grad_norm": 38.42552947998047,
"learning_rate": 3.114868641699273e-05,
"loss": 0.07558716773986816,
"step": 1400
},
{
"epoch": 1.6538037486218302,
"grad_norm": 0.032679472118616104,
"learning_rate": 2.9751257685858024e-05,
"loss": 0.06970895767211914,
"step": 1500
},
{
"epoch": 1.6538037486218302,
"eval_accuracy": 0.9875853507138423,
"eval_f1": 0.9875857432128944,
"eval_loss": 0.1186099499464035,
"eval_runtime": 14.8369,
"eval_samples_per_second": 108.581,
"eval_steps_per_second": 0.876,
"step": 1500
},
{
"epoch": 1.7640573318632855,
"grad_norm": 0.039428263902664185,
"learning_rate": 2.835382895472331e-05,
"loss": 0.0635060977935791,
"step": 1600
},
{
"epoch": 1.8743109151047408,
"grad_norm": 28.317384719848633,
"learning_rate": 2.6956400223588595e-05,
"loss": 0.06392403602600098,
"step": 1700
},
{
"epoch": 1.9294377067254684,
"eval_accuracy": 0.9882060831781502,
"eval_f1": 0.9882049915771167,
"eval_loss": 0.11401514708995819,
"eval_runtime": 14.8202,
"eval_samples_per_second": 108.703,
"eval_steps_per_second": 0.877,
"step": 1750
}
],
"logging_steps": 100,
"max_steps": 3628,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 250,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 2,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 7363294439777280.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}