mms_eng_yor / checkpoint-3300 /trainer_state.json
oluwagbotty's picture
Training in progress, step 3300, checkpoint
864d5d7 verified
Raw
History Blame Contribute Delete
14.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 8.02923264311815,
"eval_steps": 100,
"global_step": 3300,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.243605359317905,
"grad_norm": 33.11063766479492,
"learning_rate": 4.8844282238442824e-05,
"loss": 10.7343,
"step": 100
},
{
"epoch": 0.243605359317905,
"eval_loss": 4.385446548461914,
"eval_runtime": 206.0799,
"eval_samples_per_second": 7.992,
"eval_steps_per_second": 1.0,
"eval_wer": 1.0,
"step": 100
},
{
"epoch": 0.48721071863581,
"grad_norm": 2.508547067642212,
"learning_rate": 4.762773722627738e-05,
"loss": 3.1325,
"step": 200
},
{
"epoch": 0.48721071863581,
"eval_loss": 2.1581695079803467,
"eval_runtime": 206.4525,
"eval_samples_per_second": 7.978,
"eval_steps_per_second": 0.998,
"eval_wer": 0.9690996270644646,
"step": 200
},
{
"epoch": 0.730816077953715,
"grad_norm": 1.2504737377166748,
"learning_rate": 4.641119221411192e-05,
"loss": 1.6166,
"step": 300
},
{
"epoch": 0.730816077953715,
"eval_loss": 1.1347323656082153,
"eval_runtime": 206.3117,
"eval_samples_per_second": 7.983,
"eval_steps_per_second": 0.998,
"eval_wer": 0.7188184455099745,
"step": 300
},
{
"epoch": 0.97442143727162,
"grad_norm": 1.3984403610229492,
"learning_rate": 4.520681265206813e-05,
"loss": 1.1808,
"step": 400
},
{
"epoch": 0.97442143727162,
"eval_loss": 0.9792075157165527,
"eval_runtime": 206.2345,
"eval_samples_per_second": 7.986,
"eval_steps_per_second": 0.999,
"eval_wer": 0.6746581424258569,
"step": 400
},
{
"epoch": 1.2168087697929355,
"grad_norm": 10.769020080566406,
"learning_rate": 4.3990267639902676e-05,
"loss": 1.0459,
"step": 500
},
{
"epoch": 1.2168087697929355,
"eval_loss": 0.9049620032310486,
"eval_runtime": 208.2322,
"eval_samples_per_second": 7.909,
"eval_steps_per_second": 0.989,
"eval_wer": 0.6494405966968567,
"step": 500
},
{
"epoch": 1.4604141291108403,
"grad_norm": 0.8941505551338196,
"learning_rate": 4.277372262773723e-05,
"loss": 1.0317,
"step": 600
},
{
"epoch": 1.4604141291108403,
"eval_loss": 0.8543379306793213,
"eval_runtime": 205.6459,
"eval_samples_per_second": 8.009,
"eval_steps_per_second": 1.002,
"eval_wer": 0.6338128218788848,
"step": 600
},
{
"epoch": 1.7040194884287454,
"grad_norm": 0.9768113493919373,
"learning_rate": 4.1569343065693435e-05,
"loss": 0.9836,
"step": 700
},
{
"epoch": 1.7040194884287454,
"eval_loss": 0.8191400766372681,
"eval_runtime": 207.1525,
"eval_samples_per_second": 7.951,
"eval_steps_per_second": 0.994,
"eval_wer": 0.6251701888356124,
"step": 700
},
{
"epoch": 1.9476248477466505,
"grad_norm": 0.9090480208396912,
"learning_rate": 4.035279805352798e-05,
"loss": 0.9567,
"step": 800
},
{
"epoch": 1.9476248477466505,
"eval_loss": 0.7955169081687927,
"eval_runtime": 206.8205,
"eval_samples_per_second": 7.963,
"eval_steps_per_second": 0.996,
"eval_wer": 0.6124430237376428,
"step": 800
},
{
"epoch": 2.1900121802679657,
"grad_norm": 0.6563196778297424,
"learning_rate": 3.913625304136253e-05,
"loss": 0.9354,
"step": 900
},
{
"epoch": 2.1900121802679657,
"eval_loss": 0.7705180644989014,
"eval_runtime": 206.4429,
"eval_samples_per_second": 7.978,
"eval_steps_per_second": 0.998,
"eval_wer": 0.6046291363286569,
"step": 900
},
{
"epoch": 2.433617539585871,
"grad_norm": 0.8123560547828674,
"learning_rate": 3.791970802919708e-05,
"loss": 0.9037,
"step": 1000
},
{
"epoch": 2.433617539585871,
"eval_loss": 0.75263512134552,
"eval_runtime": 206.6571,
"eval_samples_per_second": 7.97,
"eval_steps_per_second": 0.997,
"eval_wer": 0.5982359557213047,
"step": 1000
},
{
"epoch": 2.677222898903776,
"grad_norm": 0.8349791169166565,
"learning_rate": 3.6703163017031634e-05,
"loss": 0.901,
"step": 1100
},
{
"epoch": 2.677222898903776,
"eval_loss": 0.7370020747184753,
"eval_runtime": 207.9183,
"eval_samples_per_second": 7.921,
"eval_steps_per_second": 0.991,
"eval_wer": 0.5959865032853845,
"step": 1100
},
{
"epoch": 2.9208282582216807,
"grad_norm": 2.0188732147216797,
"learning_rate": 3.549878345498784e-05,
"loss": 0.8888,
"step": 1200
},
{
"epoch": 2.9208282582216807,
"eval_loss": 0.7251046895980835,
"eval_runtime": 208.4027,
"eval_samples_per_second": 7.903,
"eval_steps_per_second": 0.988,
"eval_wer": 0.58781743917599,
"step": 1200
},
{
"epoch": 3.1632155907429964,
"grad_norm": 0.4746805429458618,
"learning_rate": 3.4282238442822386e-05,
"loss": 0.8686,
"step": 1300
},
{
"epoch": 3.1632155907429964,
"eval_loss": 0.7125080823898315,
"eval_runtime": 206.121,
"eval_samples_per_second": 7.99,
"eval_steps_per_second": 0.999,
"eval_wer": 0.5834369265376191,
"step": 1300
},
{
"epoch": 3.4068209500609012,
"grad_norm": 1.0152044296264648,
"learning_rate": 3.306569343065693e-05,
"loss": 0.8681,
"step": 1400
},
{
"epoch": 3.4068209500609012,
"eval_loss": 0.7029690742492676,
"eval_runtime": 206.1729,
"eval_samples_per_second": 7.988,
"eval_steps_per_second": 0.999,
"eval_wer": 0.577043745930267,
"step": 1400
},
{
"epoch": 3.6504263093788065,
"grad_norm": 0.5681760907173157,
"learning_rate": 3.1849148418491486e-05,
"loss": 0.8428,
"step": 1500
},
{
"epoch": 3.6504263093788065,
"eval_loss": 0.6939159035682678,
"eval_runtime": 206.9126,
"eval_samples_per_second": 7.96,
"eval_steps_per_second": 0.996,
"eval_wer": 0.572900017758835,
"step": 1500
},
{
"epoch": 3.8940316686967114,
"grad_norm": 0.535625159740448,
"learning_rate": 3.064476885644769e-05,
"loss": 0.8372,
"step": 1600
},
{
"epoch": 3.8940316686967114,
"eval_loss": 0.6848719716072083,
"eval_runtime": 206.7992,
"eval_samples_per_second": 7.964,
"eval_steps_per_second": 0.996,
"eval_wer": 0.5706505653229148,
"step": 1600
},
{
"epoch": 4.136419001218027,
"grad_norm": 1.2212234735488892,
"learning_rate": 2.942822384428224e-05,
"loss": 0.8388,
"step": 1700
},
{
"epoch": 4.136419001218027,
"eval_loss": 0.6779345870018005,
"eval_runtime": 206.7198,
"eval_samples_per_second": 7.967,
"eval_steps_per_second": 0.997,
"eval_wer": 0.5667436216184218,
"step": 1700
},
{
"epoch": 4.3800243605359315,
"grad_norm": 0.515786349773407,
"learning_rate": 2.8211678832116788e-05,
"loss": 0.8222,
"step": 1800
},
{
"epoch": 4.3800243605359315,
"eval_loss": 0.6726759672164917,
"eval_runtime": 206.3937,
"eval_samples_per_second": 7.98,
"eval_steps_per_second": 0.998,
"eval_wer": 0.5620671283963772,
"step": 1800
},
{
"epoch": 4.623629719853836,
"grad_norm": 2.3206946849823,
"learning_rate": 2.699513381995134e-05,
"loss": 0.8289,
"step": 1900
},
{
"epoch": 4.623629719853836,
"eval_loss": 0.6664962768554688,
"eval_runtime": 206.3925,
"eval_samples_per_second": 7.98,
"eval_steps_per_second": 0.998,
"eval_wer": 0.5570354584739241,
"step": 1900
},
{
"epoch": 4.867235079171742,
"grad_norm": 2.1069090366363525,
"learning_rate": 2.5790754257907544e-05,
"loss": 0.8189,
"step": 2000
},
{
"epoch": 4.867235079171742,
"eval_loss": 0.6623280048370361,
"eval_runtime": 208.1032,
"eval_samples_per_second": 7.914,
"eval_steps_per_second": 0.99,
"eval_wer": 0.5564434973065767,
"step": 2000
},
{
"epoch": 5.109622411693057,
"grad_norm": 1.1477903127670288,
"learning_rate": 2.4574209245742094e-05,
"loss": 0.8073,
"step": 2100
},
{
"epoch": 5.109622411693057,
"eval_loss": 0.6582257151603699,
"eval_runtime": 206.4132,
"eval_samples_per_second": 7.979,
"eval_steps_per_second": 0.998,
"eval_wer": 0.5535428875865743,
"step": 2100
},
{
"epoch": 5.353227771010962,
"grad_norm": 1.1735588312149048,
"learning_rate": 2.3357664233576643e-05,
"loss": 0.8,
"step": 2200
},
{
"epoch": 5.353227771010962,
"eval_loss": 0.6531500816345215,
"eval_runtime": 206.8033,
"eval_samples_per_second": 7.964,
"eval_steps_per_second": 0.996,
"eval_wer": 0.5504646895163677,
"step": 2200
},
{
"epoch": 5.596833130328867,
"grad_norm": 0.8227632641792297,
"learning_rate": 2.2141119221411193e-05,
"loss": 0.8051,
"step": 2300
},
{
"epoch": 5.596833130328867,
"eval_loss": 0.648690402507782,
"eval_runtime": 208.3131,
"eval_samples_per_second": 7.906,
"eval_steps_per_second": 0.989,
"eval_wer": 0.5461433729947316,
"step": 2300
},
{
"epoch": 5.840438489646772,
"grad_norm": 1.5486682653427124,
"learning_rate": 2.0936739659367396e-05,
"loss": 0.7897,
"step": 2400
},
{
"epoch": 5.840438489646772,
"eval_loss": 0.6454324126243591,
"eval_runtime": 207.86,
"eval_samples_per_second": 7.924,
"eval_steps_per_second": 0.991,
"eval_wer": 0.5443674894926893,
"step": 2400
},
{
"epoch": 6.082825822168088,
"grad_norm": 0.9000282287597656,
"learning_rate": 1.972019464720195e-05,
"loss": 0.7723,
"step": 2500
},
{
"epoch": 6.082825822168088,
"eval_loss": 0.6421072483062744,
"eval_runtime": 208.0417,
"eval_samples_per_second": 7.917,
"eval_steps_per_second": 0.99,
"eval_wer": 0.5446042739596283,
"step": 2500
},
{
"epoch": 6.326431181485993,
"grad_norm": 1.1051301956176758,
"learning_rate": 1.8515815085158152e-05,
"loss": 0.7805,
"step": 2600
},
{
"epoch": 6.326431181485993,
"eval_loss": 0.6392606496810913,
"eval_runtime": 207.7887,
"eval_samples_per_second": 7.926,
"eval_steps_per_second": 0.991,
"eval_wer": 0.5412892914224827,
"step": 2600
},
{
"epoch": 6.570036540803898,
"grad_norm": 0.7573370337486267,
"learning_rate": 1.7299270072992702e-05,
"loss": 0.7974,
"step": 2700
},
{
"epoch": 6.570036540803898,
"eval_loss": 0.6364970803260803,
"eval_runtime": 207.756,
"eval_samples_per_second": 7.928,
"eval_steps_per_second": 0.992,
"eval_wer": 0.5396318001539099,
"step": 2700
},
{
"epoch": 6.8136419001218025,
"grad_norm": 1.2818819284439087,
"learning_rate": 1.608272506082725e-05,
"loss": 0.7794,
"step": 2800
},
{
"epoch": 6.8136419001218025,
"eval_loss": 0.6344229578971863,
"eval_runtime": 207.1477,
"eval_samples_per_second": 7.951,
"eval_steps_per_second": 0.994,
"eval_wer": 0.5391582312200319,
"step": 2800
},
{
"epoch": 7.056029232643118,
"grad_norm": 1.371817708015442,
"learning_rate": 1.4866180048661801e-05,
"loss": 0.7676,
"step": 2900
},
{
"epoch": 7.056029232643118,
"eval_loss": 0.6325829029083252,
"eval_runtime": 207.5164,
"eval_samples_per_second": 7.937,
"eval_steps_per_second": 0.993,
"eval_wer": 0.5388622506363583,
"step": 2900
},
{
"epoch": 7.2996345919610235,
"grad_norm": 0.6480887532234192,
"learning_rate": 1.364963503649635e-05,
"loss": 0.7627,
"step": 3000
},
{
"epoch": 7.2996345919610235,
"eval_loss": 0.6304593682289124,
"eval_runtime": 206.7906,
"eval_samples_per_second": 7.965,
"eval_steps_per_second": 0.996,
"eval_wer": 0.5392766234535015,
"step": 3000
},
{
"epoch": 7.543239951278928,
"grad_norm": 0.8857569694519043,
"learning_rate": 1.2445255474452555e-05,
"loss": 0.7881,
"step": 3100
},
{
"epoch": 7.543239951278928,
"eval_loss": 0.6281934976577759,
"eval_runtime": 207.7645,
"eval_samples_per_second": 7.927,
"eval_steps_per_second": 0.992,
"eval_wer": 0.5379151127686024,
"step": 3100
},
{
"epoch": 7.786845310596833,
"grad_norm": 3.5432286262512207,
"learning_rate": 1.1228710462287105e-05,
"loss": 0.7689,
"step": 3200
},
{
"epoch": 7.786845310596833,
"eval_loss": 0.6266854405403137,
"eval_runtime": 209.1578,
"eval_samples_per_second": 7.874,
"eval_steps_per_second": 0.985,
"eval_wer": 0.5341857574143136,
"step": 3200
},
{
"epoch": 8.02923264311815,
"grad_norm": 0.5050083994865417,
"learning_rate": 1.0012165450121655e-05,
"loss": 0.7784,
"step": 3300
},
{
"epoch": 8.02923264311815,
"eval_loss": 0.6252668499946594,
"eval_runtime": 208.1091,
"eval_samples_per_second": 7.914,
"eval_steps_per_second": 0.99,
"eval_wer": 0.5369679749008465,
"step": 3300
}
],
"logging_steps": 100,
"max_steps": 4110,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.631639647448512e+19,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}