{ "best_global_step": 1750, "best_metric": 0.9882060831781502, "best_model_checkpoint": "./res_Context_Aware_banglabert/checkpoint-1750", "epoch": 1.9294377067254684, "eval_steps": 250, "global_step": 1750, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.11025358324145534, "grad_norm": 7.18897819519043, "learning_rate": 4.9315259921744e-05, "loss": 0.9709719848632813, "step": 100 }, { "epoch": 0.2205071664829107, "grad_norm": 24.766324996948242, "learning_rate": 4.791783119060928e-05, "loss": 0.29621694564819334, "step": 200 }, { "epoch": 0.2756339581036384, "eval_accuracy": 0.9683426443202979, "eval_f1": 0.9683463785279671, "eval_loss": 0.20300516486167908, "eval_runtime": 14.8466, "eval_samples_per_second": 108.509, "eval_steps_per_second": 0.876, "step": 250 }, { "epoch": 0.33076074972436603, "grad_norm": 8.417747497558594, "learning_rate": 4.652040245947457e-05, "loss": 0.21852529525756836, "step": 300 }, { "epoch": 0.4410143329658214, "grad_norm": 0.17437691986560822, "learning_rate": 4.5122973728339854e-05, "loss": 0.16434497833251954, "step": 400 }, { "epoch": 0.5512679162072768, "grad_norm": 0.2854061424732208, "learning_rate": 4.372554499720514e-05, "loss": 0.1867336082458496, "step": 500 }, { "epoch": 0.5512679162072768, "eval_accuracy": 0.9819987585350713, "eval_f1": 0.981997092407178, "eval_loss": 0.13372504711151123, "eval_runtime": 14.7675, "eval_samples_per_second": 109.091, "eval_steps_per_second": 0.88, "step": 500 }, { "epoch": 0.6615214994487321, "grad_norm": 6.816864967346191, "learning_rate": 4.232811626607043e-05, "loss": 0.1479694938659668, "step": 600 }, { "epoch": 0.7717750826901875, "grad_norm": 3.9543874263763428, "learning_rate": 4.093068753493572e-05, "loss": 0.12706973075866698, "step": 700 }, { "epoch": 0.8269018743109151, "eval_accuracy": 0.9757914338919925, "eval_f1": 0.975795221254004, "eval_loss": 0.1680639237165451, "eval_runtime": 14.8766, "eval_samples_per_second": 108.291, "eval_steps_per_second": 0.874, "step": 750 }, { "epoch": 0.8820286659316428, "grad_norm": 20.209442138671875, "learning_rate": 3.953325880380101e-05, "loss": 0.1331749153137207, "step": 800 }, { "epoch": 0.9922822491730982, "grad_norm": 12.12065315246582, "learning_rate": 3.8135830072666296e-05, "loss": 0.11961593627929687, "step": 900 }, { "epoch": 1.1025358324145536, "grad_norm": 12.230631828308105, "learning_rate": 3.673840134153159e-05, "loss": 0.07725512027740479, "step": 1000 }, { "epoch": 1.1025358324145536, "eval_accuracy": 0.9869646182495344, "eval_f1": 0.986966155864457, "eval_loss": 0.12348104268312454, "eval_runtime": 14.7668, "eval_samples_per_second": 109.096, "eval_steps_per_second": 0.88, "step": 1000 }, { "epoch": 1.2127894156560088, "grad_norm": 0.5774375200271606, "learning_rate": 3.5340972610396874e-05, "loss": 0.09056113243103027, "step": 1100 }, { "epoch": 1.3230429988974641, "grad_norm": 0.11910726875066757, "learning_rate": 3.394354387926216e-05, "loss": 0.042015490531921384, "step": 1200 }, { "epoch": 1.3781697905181918, "eval_accuracy": 0.9807572936064556, "eval_f1": 0.9807604085886992, "eval_loss": 0.21958932280540466, "eval_runtime": 14.8453, "eval_samples_per_second": 108.519, "eval_steps_per_second": 0.876, "step": 1250 }, { "epoch": 1.4332965821389196, "grad_norm": 0.11699436604976654, "learning_rate": 3.2546115148127446e-05, "loss": 0.0719094467163086, "step": 1300 }, { "epoch": 1.543550165380375, "grad_norm": 38.42552947998047, "learning_rate": 3.114868641699273e-05, "loss": 0.07558716773986816, "step": 1400 }, { "epoch": 1.6538037486218302, "grad_norm": 0.032679472118616104, "learning_rate": 2.9751257685858024e-05, "loss": 0.06970895767211914, "step": 1500 }, { "epoch": 1.6538037486218302, "eval_accuracy": 0.9875853507138423, "eval_f1": 0.9875857432128944, "eval_loss": 0.1186099499464035, "eval_runtime": 14.8369, "eval_samples_per_second": 108.581, "eval_steps_per_second": 0.876, "step": 1500 }, { "epoch": 1.7640573318632855, "grad_norm": 0.039428263902664185, "learning_rate": 2.835382895472331e-05, "loss": 0.0635060977935791, "step": 1600 }, { "epoch": 1.8743109151047408, "grad_norm": 28.317384719848633, "learning_rate": 2.6956400223588595e-05, "loss": 0.06392403602600098, "step": 1700 }, { "epoch": 1.9294377067254684, "eval_accuracy": 0.9882060831781502, "eval_f1": 0.9882049915771167, "eval_loss": 0.11401514708995819, "eval_runtime": 14.8202, "eval_samples_per_second": 108.703, "eval_steps_per_second": 0.877, "step": 1750 } ], "logging_steps": 100, "max_steps": 3628, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 250, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 2, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 7363294439777280.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }