{ "best_global_step": 1500, "best_metric": 0.9925512104283054, "best_model_checkpoint": "./res_Context_Aware_banglabert/checkpoint-1500", "epoch": 3.303964757709251, "eval_steps": 250, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.11013215859030837, "grad_norm": 25.462419509887695, "learning_rate": 4.9e-05, "loss": 1.1988423156738282, "step": 50 }, { "epoch": 0.22026431718061673, "grad_norm": 6.222968101501465, "learning_rate": 4.88963963963964e-05, "loss": 0.4401987075805664, "step": 100 }, { "epoch": 0.3303964757709251, "grad_norm": 4.529721736907959, "learning_rate": 4.7770270270270274e-05, "loss": 0.22516624450683595, "step": 150 }, { "epoch": 0.44052863436123346, "grad_norm": 14.54383659362793, "learning_rate": 4.664414414414415e-05, "loss": 0.19179162979125977, "step": 200 }, { "epoch": 0.5506607929515418, "grad_norm": 2.3169732093811035, "learning_rate": 4.551801801801802e-05, "loss": 0.18978879928588868, "step": 250 }, { "epoch": 0.5506607929515418, "eval_accuracy": 0.9826194909993793, "eval_f1": 0.98261752029853, "eval_loss": 0.12076283246278763, "eval_runtime": 15.2108, "eval_samples_per_second": 105.912, "eval_steps_per_second": 0.855, "step": 250 }, { "epoch": 0.6607929515418502, "grad_norm": 0.8863422274589539, "learning_rate": 4.439189189189189e-05, "loss": 0.13721893310546876, "step": 300 }, { "epoch": 0.7709251101321586, "grad_norm": 0.7998637557029724, "learning_rate": 4.326576576576577e-05, "loss": 0.12599869728088378, "step": 350 }, { "epoch": 0.8810572687224669, "grad_norm": 7.37066650390625, "learning_rate": 4.2139639639639646e-05, "loss": 0.11998005867004395, "step": 400 }, { "epoch": 0.9911894273127754, "grad_norm": 0.12422619014978409, "learning_rate": 4.101351351351351e-05, "loss": 0.1296429443359375, "step": 450 }, { "epoch": 1.1013215859030836, "grad_norm": 0.6420861482620239, "learning_rate": 3.9887387387387386e-05, "loss": 0.06252753257751464, "step": 500 }, { "epoch": 1.1013215859030836, "eval_accuracy": 0.9844816883923029, "eval_f1": 0.9844755809919153, "eval_loss": 0.13376149535179138, "eval_runtime": 15.1806, "eval_samples_per_second": 106.122, "eval_steps_per_second": 0.856, "step": 500 }, { "epoch": 1.2114537444933922, "grad_norm": 1.574205756187439, "learning_rate": 3.876126126126126e-05, "loss": 0.091258544921875, "step": 550 }, { "epoch": 1.3215859030837005, "grad_norm": 0.36328908801078796, "learning_rate": 3.763513513513513e-05, "loss": 0.06470813274383545, "step": 600 }, { "epoch": 1.4317180616740088, "grad_norm": 3.5949654579162598, "learning_rate": 3.650900900900901e-05, "loss": 0.07118824481964112, "step": 650 }, { "epoch": 1.5418502202643172, "grad_norm": 18.810028076171875, "learning_rate": 3.5382882882882885e-05, "loss": 0.04942235469818115, "step": 700 }, { "epoch": 1.6519823788546255, "grad_norm": 1.473706603050232, "learning_rate": 3.425675675675676e-05, "loss": 0.06424750804901123, "step": 750 }, { "epoch": 1.6519823788546255, "eval_accuracy": 0.9875853507138423, "eval_f1": 0.9875866907189155, "eval_loss": 0.0764322504401207, "eval_runtime": 15.2295, "eval_samples_per_second": 105.782, "eval_steps_per_second": 0.854, "step": 750 }, { "epoch": 1.7621145374449338, "grad_norm": 2.166792869567871, "learning_rate": 3.313063063063063e-05, "loss": 0.05474145412445068, "step": 800 }, { "epoch": 1.8722466960352424, "grad_norm": 10.277437210083008, "learning_rate": 3.2004504504504505e-05, "loss": 0.06158576011657715, "step": 850 }, { "epoch": 1.9823788546255505, "grad_norm": 16.316560745239258, "learning_rate": 3.087837837837838e-05, "loss": 0.03567867040634155, "step": 900 }, { "epoch": 2.092511013215859, "grad_norm": 0.021065015345811844, "learning_rate": 2.9752252252252255e-05, "loss": 0.017343584299087524, "step": 950 }, { "epoch": 2.202643171806167, "grad_norm": 6.482810974121094, "learning_rate": 2.8626126126126128e-05, "loss": 0.03294461965560913, "step": 1000 }, { "epoch": 2.202643171806167, "eval_accuracy": 0.9894475481067659, "eval_f1": 0.9894451302143361, "eval_loss": 0.10190387815237045, "eval_runtime": 15.171, "eval_samples_per_second": 106.19, "eval_steps_per_second": 0.857, "step": 1000 }, { "epoch": 2.3127753303964758, "grad_norm": 0.015216778963804245, "learning_rate": 2.7500000000000004e-05, "loss": 0.034067885875701906, "step": 1050 }, { "epoch": 2.4229074889867843, "grad_norm": 0.2629091143608093, "learning_rate": 2.6373873873873878e-05, "loss": 0.03687331676483154, "step": 1100 }, { "epoch": 2.5330396475770924, "grad_norm": 0.015911059454083443, "learning_rate": 2.5247747747747747e-05, "loss": 0.03307219266891479, "step": 1150 }, { "epoch": 2.643171806167401, "grad_norm": 0.5511289238929749, "learning_rate": 2.4121621621621624e-05, "loss": 0.0193754243850708, "step": 1200 }, { "epoch": 2.753303964757709, "grad_norm": 1.5788966417312622, "learning_rate": 2.2995495495495497e-05, "loss": 0.019393556118011475, "step": 1250 }, { "epoch": 2.753303964757709, "eval_accuracy": 0.9900682805710739, "eval_f1": 0.990065222973868, "eval_loss": 0.11733845621347427, "eval_runtime": 15.2803, "eval_samples_per_second": 105.43, "eval_steps_per_second": 0.851, "step": 1250 }, { "epoch": 2.8634361233480177, "grad_norm": 0.007190010976046324, "learning_rate": 2.186936936936937e-05, "loss": 0.012289742231369019, "step": 1300 }, { "epoch": 2.9735682819383262, "grad_norm": 0.007357372902333736, "learning_rate": 2.0743243243243243e-05, "loss": 0.016530017852783203, "step": 1350 }, { "epoch": 3.0837004405286343, "grad_norm": 0.02660430781543255, "learning_rate": 1.9617117117117117e-05, "loss": 0.01394943118095398, "step": 1400 }, { "epoch": 3.193832599118943, "grad_norm": 0.007937883026897907, "learning_rate": 1.8490990990990993e-05, "loss": 0.010230660438537598, "step": 1450 }, { "epoch": 3.303964757709251, "grad_norm": 0.009734545834362507, "learning_rate": 1.7364864864864866e-05, "loss": 0.023434817790985107, "step": 1500 }, { "epoch": 3.303964757709251, "eval_accuracy": 0.9925512104283054, "eval_f1": 0.9925496876355572, "eval_loss": 0.09795740991830826, "eval_runtime": 15.1562, "eval_samples_per_second": 106.293, "eval_steps_per_second": 0.858, "step": 1500 } ], "logging_steps": 50, "max_steps": 2270, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 250, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 3, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.260525599571456e+16, "train_batch_size": 64, "trial_name": null, "trial_params": null }