pankajrudra's picture
Auto-upload after training: banglabert (Context_Aware)
bb6a417 verified
Raw
History Blame Contribute Delete
8.44 kB
{
"best_global_step": 1500,
"best_metric": 0.9925512104283054,
"best_model_checkpoint": "./res_Context_Aware_banglabert/checkpoint-1500",
"epoch": 3.303964757709251,
"eval_steps": 250,
"global_step": 1500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.11013215859030837,
"grad_norm": 25.462419509887695,
"learning_rate": 4.9e-05,
"loss": 1.1988423156738282,
"step": 50
},
{
"epoch": 0.22026431718061673,
"grad_norm": 6.222968101501465,
"learning_rate": 4.88963963963964e-05,
"loss": 0.4401987075805664,
"step": 100
},
{
"epoch": 0.3303964757709251,
"grad_norm": 4.529721736907959,
"learning_rate": 4.7770270270270274e-05,
"loss": 0.22516624450683595,
"step": 150
},
{
"epoch": 0.44052863436123346,
"grad_norm": 14.54383659362793,
"learning_rate": 4.664414414414415e-05,
"loss": 0.19179162979125977,
"step": 200
},
{
"epoch": 0.5506607929515418,
"grad_norm": 2.3169732093811035,
"learning_rate": 4.551801801801802e-05,
"loss": 0.18978879928588868,
"step": 250
},
{
"epoch": 0.5506607929515418,
"eval_accuracy": 0.9826194909993793,
"eval_f1": 0.98261752029853,
"eval_loss": 0.12076283246278763,
"eval_runtime": 15.2108,
"eval_samples_per_second": 105.912,
"eval_steps_per_second": 0.855,
"step": 250
},
{
"epoch": 0.6607929515418502,
"grad_norm": 0.8863422274589539,
"learning_rate": 4.439189189189189e-05,
"loss": 0.13721893310546876,
"step": 300
},
{
"epoch": 0.7709251101321586,
"grad_norm": 0.7998637557029724,
"learning_rate": 4.326576576576577e-05,
"loss": 0.12599869728088378,
"step": 350
},
{
"epoch": 0.8810572687224669,
"grad_norm": 7.37066650390625,
"learning_rate": 4.2139639639639646e-05,
"loss": 0.11998005867004395,
"step": 400
},
{
"epoch": 0.9911894273127754,
"grad_norm": 0.12422619014978409,
"learning_rate": 4.101351351351351e-05,
"loss": 0.1296429443359375,
"step": 450
},
{
"epoch": 1.1013215859030836,
"grad_norm": 0.6420861482620239,
"learning_rate": 3.9887387387387386e-05,
"loss": 0.06252753257751464,
"step": 500
},
{
"epoch": 1.1013215859030836,
"eval_accuracy": 0.9844816883923029,
"eval_f1": 0.9844755809919153,
"eval_loss": 0.13376149535179138,
"eval_runtime": 15.1806,
"eval_samples_per_second": 106.122,
"eval_steps_per_second": 0.856,
"step": 500
},
{
"epoch": 1.2114537444933922,
"grad_norm": 1.574205756187439,
"learning_rate": 3.876126126126126e-05,
"loss": 0.091258544921875,
"step": 550
},
{
"epoch": 1.3215859030837005,
"grad_norm": 0.36328908801078796,
"learning_rate": 3.763513513513513e-05,
"loss": 0.06470813274383545,
"step": 600
},
{
"epoch": 1.4317180616740088,
"grad_norm": 3.5949654579162598,
"learning_rate": 3.650900900900901e-05,
"loss": 0.07118824481964112,
"step": 650
},
{
"epoch": 1.5418502202643172,
"grad_norm": 18.810028076171875,
"learning_rate": 3.5382882882882885e-05,
"loss": 0.04942235469818115,
"step": 700
},
{
"epoch": 1.6519823788546255,
"grad_norm": 1.473706603050232,
"learning_rate": 3.425675675675676e-05,
"loss": 0.06424750804901123,
"step": 750
},
{
"epoch": 1.6519823788546255,
"eval_accuracy": 0.9875853507138423,
"eval_f1": 0.9875866907189155,
"eval_loss": 0.0764322504401207,
"eval_runtime": 15.2295,
"eval_samples_per_second": 105.782,
"eval_steps_per_second": 0.854,
"step": 750
},
{
"epoch": 1.7621145374449338,
"grad_norm": 2.166792869567871,
"learning_rate": 3.313063063063063e-05,
"loss": 0.05474145412445068,
"step": 800
},
{
"epoch": 1.8722466960352424,
"grad_norm": 10.277437210083008,
"learning_rate": 3.2004504504504505e-05,
"loss": 0.06158576011657715,
"step": 850
},
{
"epoch": 1.9823788546255505,
"grad_norm": 16.316560745239258,
"learning_rate": 3.087837837837838e-05,
"loss": 0.03567867040634155,
"step": 900
},
{
"epoch": 2.092511013215859,
"grad_norm": 0.021065015345811844,
"learning_rate": 2.9752252252252255e-05,
"loss": 0.017343584299087524,
"step": 950
},
{
"epoch": 2.202643171806167,
"grad_norm": 6.482810974121094,
"learning_rate": 2.8626126126126128e-05,
"loss": 0.03294461965560913,
"step": 1000
},
{
"epoch": 2.202643171806167,
"eval_accuracy": 0.9894475481067659,
"eval_f1": 0.9894451302143361,
"eval_loss": 0.10190387815237045,
"eval_runtime": 15.171,
"eval_samples_per_second": 106.19,
"eval_steps_per_second": 0.857,
"step": 1000
},
{
"epoch": 2.3127753303964758,
"grad_norm": 0.015216778963804245,
"learning_rate": 2.7500000000000004e-05,
"loss": 0.034067885875701906,
"step": 1050
},
{
"epoch": 2.4229074889867843,
"grad_norm": 0.2629091143608093,
"learning_rate": 2.6373873873873878e-05,
"loss": 0.03687331676483154,
"step": 1100
},
{
"epoch": 2.5330396475770924,
"grad_norm": 0.015911059454083443,
"learning_rate": 2.5247747747747747e-05,
"loss": 0.03307219266891479,
"step": 1150
},
{
"epoch": 2.643171806167401,
"grad_norm": 0.5511289238929749,
"learning_rate": 2.4121621621621624e-05,
"loss": 0.0193754243850708,
"step": 1200
},
{
"epoch": 2.753303964757709,
"grad_norm": 1.5788966417312622,
"learning_rate": 2.2995495495495497e-05,
"loss": 0.019393556118011475,
"step": 1250
},
{
"epoch": 2.753303964757709,
"eval_accuracy": 0.9900682805710739,
"eval_f1": 0.990065222973868,
"eval_loss": 0.11733845621347427,
"eval_runtime": 15.2803,
"eval_samples_per_second": 105.43,
"eval_steps_per_second": 0.851,
"step": 1250
},
{
"epoch": 2.8634361233480177,
"grad_norm": 0.007190010976046324,
"learning_rate": 2.186936936936937e-05,
"loss": 0.012289742231369019,
"step": 1300
},
{
"epoch": 2.9735682819383262,
"grad_norm": 0.007357372902333736,
"learning_rate": 2.0743243243243243e-05,
"loss": 0.016530017852783203,
"step": 1350
},
{
"epoch": 3.0837004405286343,
"grad_norm": 0.02660430781543255,
"learning_rate": 1.9617117117117117e-05,
"loss": 0.01394943118095398,
"step": 1400
},
{
"epoch": 3.193832599118943,
"grad_norm": 0.007937883026897907,
"learning_rate": 1.8490990990990993e-05,
"loss": 0.010230660438537598,
"step": 1450
},
{
"epoch": 3.303964757709251,
"grad_norm": 0.009734545834362507,
"learning_rate": 1.7364864864864866e-05,
"loss": 0.023434817790985107,
"step": 1500
},
{
"epoch": 3.303964757709251,
"eval_accuracy": 0.9925512104283054,
"eval_f1": 0.9925496876355572,
"eval_loss": 0.09795740991830826,
"eval_runtime": 15.1562,
"eval_samples_per_second": 106.293,
"eval_steps_per_second": 0.858,
"step": 1500
}
],
"logging_steps": 50,
"max_steps": 2270,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 250,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 1.260525599571456e+16,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}