{ "best_global_step": 2250, "best_metric": 0.9931719428926132, "best_model_checkpoint": "./res_Context_Aware_banglabert/checkpoint-2250", "epoch": 2.4807056229327453, "eval_steps": 250, "global_step": 2250, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.11025358324145534, "grad_norm": 9.02037239074707, "learning_rate": 4.9315259921744e-05, "loss": 0.8721378326416016, "step": 100 }, { "epoch": 0.2205071664829107, "grad_norm": 2.885241985321045, "learning_rate": 4.791783119060928e-05, "loss": 0.35012786865234374, "step": 200 }, { "epoch": 0.2756339581036384, "eval_accuracy": 0.9776536312849162, "eval_f1": 0.9776510975266813, "eval_loss": 0.15934747457504272, "eval_runtime": 14.0961, "eval_samples_per_second": 114.287, "eval_steps_per_second": 0.922, "step": 250 }, { "epoch": 0.33076074972436603, "grad_norm": 6.377964496612549, "learning_rate": 4.652040245947457e-05, "loss": 0.2049967384338379, "step": 300 }, { "epoch": 0.4410143329658214, "grad_norm": 0.08052965253591537, "learning_rate": 4.5122973728339854e-05, "loss": 0.1924136734008789, "step": 400 }, { "epoch": 0.5512679162072768, "grad_norm": 6.491593837738037, "learning_rate": 4.372554499720514e-05, "loss": 0.20583047866821289, "step": 500 }, { "epoch": 0.5512679162072768, "eval_accuracy": 0.9745499689633768, "eval_f1": 0.9745495371719669, "eval_loss": 0.18327105045318604, "eval_runtime": 14.1562, "eval_samples_per_second": 113.802, "eval_steps_per_second": 0.918, "step": 500 }, { "epoch": 0.6615214994487321, "grad_norm": 3.80802059173584, "learning_rate": 4.232811626607043e-05, "loss": 0.15363896369934082, "step": 600 }, { "epoch": 0.7717750826901875, "grad_norm": 3.48689603805542, "learning_rate": 4.093068753493572e-05, "loss": 0.1443716526031494, "step": 700 }, { "epoch": 0.8269018743109151, "eval_accuracy": 0.978274363749224, "eval_f1": 0.978278215038984, "eval_loss": 0.20134644210338593, "eval_runtime": 14.1783, "eval_samples_per_second": 113.624, "eval_steps_per_second": 0.917, "step": 750 }, { "epoch": 0.8820286659316428, "grad_norm": 32.31780242919922, "learning_rate": 3.953325880380101e-05, "loss": 0.1432034492492676, "step": 800 }, { "epoch": 0.9922822491730982, "grad_norm": 26.723928451538086, "learning_rate": 3.8135830072666296e-05, "loss": 0.12749279975891115, "step": 900 }, { "epoch": 1.1025358324145536, "grad_norm": 6.3086957931518555, "learning_rate": 3.673840134153159e-05, "loss": 0.07981213569641113, "step": 1000 }, { "epoch": 1.1025358324145536, "eval_accuracy": 0.9869646182495344, "eval_f1": 0.9869655730837585, "eval_loss": 0.13266624510288239, "eval_runtime": 14.2074, "eval_samples_per_second": 113.391, "eval_steps_per_second": 0.915, "step": 1000 }, { "epoch": 1.2127894156560088, "grad_norm": 46.10914611816406, "learning_rate": 3.5340972610396874e-05, "loss": 0.08848725318908691, "step": 1100 }, { "epoch": 1.3230429988974641, "grad_norm": 0.05402166396379471, "learning_rate": 3.394354387926216e-05, "loss": 0.07142821311950684, "step": 1200 }, { "epoch": 1.3781697905181918, "eval_accuracy": 0.9807572936064556, "eval_f1": 0.9807591629646968, "eval_loss": 0.1913502961397171, "eval_runtime": 14.1881, "eval_samples_per_second": 113.546, "eval_steps_per_second": 0.916, "step": 1250 }, { "epoch": 1.4332965821389196, "grad_norm": 0.089525505900383, "learning_rate": 3.2546115148127446e-05, "loss": 0.0875068473815918, "step": 1300 }, { "epoch": 1.543550165380375, "grad_norm": 0.06809459626674652, "learning_rate": 3.114868641699273e-05, "loss": 0.07411887168884278, "step": 1400 }, { "epoch": 1.6538037486218302, "grad_norm": 0.7647103071212769, "learning_rate": 2.9751257685858024e-05, "loss": 0.0676584243774414, "step": 1500 }, { "epoch": 1.6538037486218302, "eval_accuracy": 0.9882060831781502, "eval_f1": 0.9882039542277219, "eval_loss": 0.10057985037565231, "eval_runtime": 14.2098, "eval_samples_per_second": 113.372, "eval_steps_per_second": 0.915, "step": 1500 }, { "epoch": 1.7640573318632855, "grad_norm": 0.023145318031311035, "learning_rate": 2.835382895472331e-05, "loss": 0.053038196563720705, "step": 1600 }, { "epoch": 1.8743109151047408, "grad_norm": 3.5554888248443604, "learning_rate": 2.6956400223588595e-05, "loss": 0.08461674690246582, "step": 1700 }, { "epoch": 1.9294377067254684, "eval_accuracy": 0.9900682805710739, "eval_f1": 0.9900675605237899, "eval_loss": 0.07765113562345505, "eval_runtime": 14.2432, "eval_samples_per_second": 113.106, "eval_steps_per_second": 0.913, "step": 1750 }, { "epoch": 1.9845644983461963, "grad_norm": 0.14184314012527466, "learning_rate": 2.5558971492453888e-05, "loss": 0.06337377548217774, "step": 1800 }, { "epoch": 2.0948180815876514, "grad_norm": 0.011256121098995209, "learning_rate": 2.4161542761319173e-05, "loss": 0.023933162689208986, "step": 1900 }, { "epoch": 2.205071664829107, "grad_norm": 0.014097367413341999, "learning_rate": 2.2764114030184462e-05, "loss": 0.030810904502868653, "step": 2000 }, { "epoch": 2.205071664829107, "eval_accuracy": 0.9919304779639975, "eval_f1": 0.9919293886744892, "eval_loss": 0.11332618445158005, "eval_runtime": 14.1841, "eval_samples_per_second": 113.578, "eval_steps_per_second": 0.917, "step": 2000 }, { "epoch": 2.3153252480705624, "grad_norm": 0.010986179113388062, "learning_rate": 2.1366685299049748e-05, "loss": 0.029725773334503172, "step": 2100 }, { "epoch": 2.4255788313120177, "grad_norm": 10.8602876663208, "learning_rate": 1.9969256567915037e-05, "loss": 0.041701827049255374, "step": 2200 }, { "epoch": 2.4807056229327453, "eval_accuracy": 0.9931719428926132, "eval_f1": 0.9931703783739821, "eval_loss": 0.08890443295240402, "eval_runtime": 14.1525, "eval_samples_per_second": 113.831, "eval_steps_per_second": 0.919, "step": 2250 } ], "logging_steps": 100, "max_steps": 3628, "num_input_tokens_seen": 0, "num_train_epochs": 4, "save_steps": 250, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 2, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 9464367772354560.0, "train_batch_size": 32, "trial_name": null, "trial_params": null }