whisper-small-br_260315 / trainer_state.json
gweltou's picture
Upload 16 files
1fce701 verified
Raw
History Blame Contribute Delete
26.3 kB
{
"best_global_step": 10500,
"best_metric": 40.10271240526526,
"best_model_checkpoint": "whisper-small-br/checkpoint-10500",
"epoch": 1.4972097454743434,
"eval_steps": 500,
"global_step": 11000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.013610997686130393,
"grad_norm": 22.095027923583984,
"learning_rate": 9.9e-06,
"loss": 4.058,
"step": 100
},
{
"epoch": 0.027221995372260787,
"grad_norm": 18.20777702331543,
"learning_rate": 1.9900000000000003e-05,
"loss": 2.0289,
"step": 200
},
{
"epoch": 0.04083299305839118,
"grad_norm": 17.343502044677734,
"learning_rate": 1.9909344810219313e-05,
"loss": 1.5023,
"step": 300
},
{
"epoch": 0.054443990744521574,
"grad_norm": 12.90123462677002,
"learning_rate": 1.9817773911450943e-05,
"loss": 1.3212,
"step": 400
},
{
"epoch": 0.06805498843065197,
"grad_norm": 12.617008209228516,
"learning_rate": 1.9726203012682573e-05,
"loss": 1.2295,
"step": 500
},
{
"epoch": 0.06805498843065197,
"eval_cer": 44.18141757235164,
"eval_loss": 1.1764613389968872,
"eval_runtime": 1019.3249,
"eval_samples_per_second": 3.035,
"eval_steps_per_second": 0.38,
"eval_wer": 82.73583964898285,
"step": 500
},
{
"epoch": 0.08166598611678236,
"grad_norm": 11.933979034423828,
"learning_rate": 1.96346321139142e-05,
"loss": 1.1777,
"step": 600
},
{
"epoch": 0.09527698380291276,
"grad_norm": 12.346055030822754,
"learning_rate": 1.954306121514583e-05,
"loss": 1.1195,
"step": 700
},
{
"epoch": 0.10888798148904315,
"grad_norm": 11.624801635742188,
"learning_rate": 1.9451490316377456e-05,
"loss": 1.0431,
"step": 800
},
{
"epoch": 0.12249897917517354,
"grad_norm": 11.907363891601562,
"learning_rate": 1.9359919417609086e-05,
"loss": 0.9826,
"step": 900
},
{
"epoch": 0.13610997686130394,
"grad_norm": 11.434345245361328,
"learning_rate": 1.9268348518840712e-05,
"loss": 1.0302,
"step": 1000
},
{
"epoch": 0.13610997686130394,
"eval_cer": 33.54789196147848,
"eval_loss": 0.9722283482551575,
"eval_runtime": 946.305,
"eval_samples_per_second": 3.27,
"eval_steps_per_second": 0.409,
"eval_wer": 66.64339848424412,
"step": 1000
},
{
"epoch": 0.14972097454743433,
"grad_norm": 9.866198539733887,
"learning_rate": 1.9176777620072342e-05,
"loss": 0.9639,
"step": 1100
},
{
"epoch": 0.16333197223356472,
"grad_norm": 12.207975387573242,
"learning_rate": 1.9085206721303972e-05,
"loss": 0.9652,
"step": 1200
},
{
"epoch": 0.1769429699196951,
"grad_norm": 13.966451644897461,
"learning_rate": 1.89936358225356e-05,
"loss": 0.9003,
"step": 1300
},
{
"epoch": 0.19055396760582552,
"grad_norm": 11.561500549316406,
"learning_rate": 1.890206492376723e-05,
"loss": 0.8899,
"step": 1400
},
{
"epoch": 0.2041649652919559,
"grad_norm": 10.504300117492676,
"learning_rate": 1.881049402499886e-05,
"loss": 0.8969,
"step": 1500
},
{
"epoch": 0.2041649652919559,
"eval_cer": 27.465649988859457,
"eval_loss": 0.860107421875,
"eval_runtime": 893.0785,
"eval_samples_per_second": 3.464,
"eval_steps_per_second": 0.433,
"eval_wer": 56.55165536497806,
"step": 1500
},
{
"epoch": 0.2177759629780863,
"grad_norm": 14.605524063110352,
"learning_rate": 1.8718923126230485e-05,
"loss": 0.8828,
"step": 1600
},
{
"epoch": 0.23138696066421668,
"grad_norm": 10.524106979370117,
"learning_rate": 1.8627352227462115e-05,
"loss": 0.8459,
"step": 1700
},
{
"epoch": 0.24499795835034707,
"grad_norm": 11.29123306274414,
"learning_rate": 1.853578132869374e-05,
"loss": 0.8757,
"step": 1800
},
{
"epoch": 0.2586089560364775,
"grad_norm": 9.073974609375,
"learning_rate": 1.844421042992537e-05,
"loss": 0.8445,
"step": 1900
},
{
"epoch": 0.2722199537226079,
"grad_norm": 11.95883846282959,
"learning_rate": 1.8352639531156998e-05,
"loss": 0.817,
"step": 2000
},
{
"epoch": 0.2722199537226079,
"eval_cer": 27.33939048845097,
"eval_loss": 0.7963160872459412,
"eval_runtime": 929.7295,
"eval_samples_per_second": 3.328,
"eval_steps_per_second": 0.416,
"eval_wer": 55.73145193458316,
"step": 2000
},
{
"epoch": 0.28583095140873827,
"grad_norm": 13.961465835571289,
"learning_rate": 1.8261068632388628e-05,
"loss": 0.8128,
"step": 2100
},
{
"epoch": 0.29944194909486865,
"grad_norm": 11.061758041381836,
"learning_rate": 1.8169497733620255e-05,
"loss": 0.7818,
"step": 2200
},
{
"epoch": 0.31305294678099904,
"grad_norm": 8.439574241638184,
"learning_rate": 1.8077926834851888e-05,
"loss": 0.7794,
"step": 2300
},
{
"epoch": 0.32666394446712943,
"grad_norm": 8.946911811828613,
"learning_rate": 1.7986355936083515e-05,
"loss": 0.8061,
"step": 2400
},
{
"epoch": 0.3402749421532598,
"grad_norm": 13.243382453918457,
"learning_rate": 1.7894785037315145e-05,
"loss": 0.7967,
"step": 2500
},
{
"epoch": 0.3402749421532598,
"eval_cer": 27.54091055380883,
"eval_loss": 0.7550674676895142,
"eval_runtime": 929.7973,
"eval_samples_per_second": 3.328,
"eval_steps_per_second": 0.416,
"eval_wer": 56.20761866773035,
"step": 2500
},
{
"epoch": 0.3538859398393902,
"grad_norm": 9.587485313415527,
"learning_rate": 1.780321413854677e-05,
"loss": 0.7408,
"step": 2600
},
{
"epoch": 0.3674969375255206,
"grad_norm": 10.000493049621582,
"learning_rate": 1.77116432397784e-05,
"loss": 0.7568,
"step": 2700
},
{
"epoch": 0.38110793521165104,
"grad_norm": 8.778080940246582,
"learning_rate": 1.7620072341010028e-05,
"loss": 0.7346,
"step": 2800
},
{
"epoch": 0.3947189328977814,
"grad_norm": 11.506646156311035,
"learning_rate": 1.7528501442241658e-05,
"loss": 0.7681,
"step": 2900
},
{
"epoch": 0.4083299305839118,
"grad_norm": 10.7967529296875,
"learning_rate": 1.7436930543473284e-05,
"loss": 0.7216,
"step": 3000
},
{
"epoch": 0.4083299305839118,
"eval_cer": 25.7019780655064,
"eval_loss": 0.721060574054718,
"eval_runtime": 897.2936,
"eval_samples_per_second": 3.448,
"eval_steps_per_second": 0.431,
"eval_wer": 52.54786597526925,
"step": 3000
},
{
"epoch": 0.4219409282700422,
"grad_norm": 10.669580459594727,
"learning_rate": 1.7345359644704914e-05,
"loss": 0.7571,
"step": 3100
},
{
"epoch": 0.4355519259561726,
"grad_norm": 11.027612686157227,
"learning_rate": 1.7253788745936544e-05,
"loss": 0.7199,
"step": 3200
},
{
"epoch": 0.449162923642303,
"grad_norm": 10.802726745605469,
"learning_rate": 1.716221784716817e-05,
"loss": 0.7132,
"step": 3300
},
{
"epoch": 0.46277392132843337,
"grad_norm": 8.402053833007812,
"learning_rate": 1.70706469483998e-05,
"loss": 0.7173,
"step": 3400
},
{
"epoch": 0.47638491901456376,
"grad_norm": 9.13488483428955,
"learning_rate": 1.697907604963143e-05,
"loss": 0.7426,
"step": 3500
},
{
"epoch": 0.47638491901456376,
"eval_cer": 27.62013220112396,
"eval_loss": 0.6920907497406006,
"eval_runtime": 936.9738,
"eval_samples_per_second": 3.302,
"eval_steps_per_second": 0.413,
"eval_wer": 54.05364978061428,
"step": 3500
},
{
"epoch": 0.48999591670069415,
"grad_norm": 10.873909950256348,
"learning_rate": 1.6887505150863057e-05,
"loss": 0.6771,
"step": 3600
},
{
"epoch": 0.5036069143868246,
"grad_norm": 12.089336395263672,
"learning_rate": 1.6795934252094687e-05,
"loss": 0.7418,
"step": 3700
},
{
"epoch": 0.517217912072955,
"grad_norm": 7.360589027404785,
"learning_rate": 1.6704363353326314e-05,
"loss": 0.6805,
"step": 3800
},
{
"epoch": 0.5308289097590854,
"grad_norm": 10.794859886169434,
"learning_rate": 1.6612792454557944e-05,
"loss": 0.7006,
"step": 3900
},
{
"epoch": 0.5444399074452158,
"grad_norm": 8.446488380432129,
"learning_rate": 1.652122155578957e-05,
"loss": 0.6652,
"step": 4000
},
{
"epoch": 0.5444399074452158,
"eval_cer": 31.48466318421509,
"eval_loss": 0.6702451705932617,
"eval_runtime": 981.908,
"eval_samples_per_second": 3.151,
"eval_steps_per_second": 0.394,
"eval_wer": 57.81810929397686,
"step": 4000
},
{
"epoch": 0.5580509051313461,
"grad_norm": 11.135995864868164,
"learning_rate": 1.64296506570212e-05,
"loss": 0.6538,
"step": 4100
},
{
"epoch": 0.5716619028174765,
"grad_norm": 13.993082046508789,
"learning_rate": 1.633807975825283e-05,
"loss": 0.657,
"step": 4200
},
{
"epoch": 0.5852729005036069,
"grad_norm": 10.156628608703613,
"learning_rate": 1.6246508859484457e-05,
"loss": 0.6605,
"step": 4300
},
{
"epoch": 0.5988838981897373,
"grad_norm": 10.285860061645508,
"learning_rate": 1.6154937960716086e-05,
"loss": 0.6817,
"step": 4400
},
{
"epoch": 0.6124948958758677,
"grad_norm": 6.604043960571289,
"learning_rate": 1.6063367061947713e-05,
"loss": 0.666,
"step": 4500
},
{
"epoch": 0.6124948958758677,
"eval_cer": 26.41299235015968,
"eval_loss": 0.6442458033561707,
"eval_runtime": 951.5023,
"eval_samples_per_second": 3.252,
"eval_steps_per_second": 0.407,
"eval_wer": 52.4406661348225,
"step": 4500
},
{
"epoch": 0.6261058935619981,
"grad_norm": 10.028115272521973,
"learning_rate": 1.5971796163179343e-05,
"loss": 0.6739,
"step": 4600
},
{
"epoch": 0.6397168912481285,
"grad_norm": 12.291666984558105,
"learning_rate": 1.588022526441097e-05,
"loss": 0.6252,
"step": 4700
},
{
"epoch": 0.6533278889342589,
"grad_norm": 8.521187782287598,
"learning_rate": 1.57886543656426e-05,
"loss": 0.6351,
"step": 4800
},
{
"epoch": 0.6669388866203892,
"grad_norm": 7.403680324554443,
"learning_rate": 1.569708346687423e-05,
"loss": 0.6406,
"step": 4900
},
{
"epoch": 0.6805498843065196,
"grad_norm": 7.44627046585083,
"learning_rate": 1.5605512568105856e-05,
"loss": 0.6574,
"step": 5000
},
{
"epoch": 0.6805498843065196,
"eval_cer": 26.51697076226079,
"eval_loss": 0.6287782192230225,
"eval_runtime": 964.4487,
"eval_samples_per_second": 3.208,
"eval_steps_per_second": 0.401,
"eval_wer": 52.03928998803351,
"step": 5000
},
{
"epoch": 0.69416088199265,
"grad_norm": 12.659337997436523,
"learning_rate": 1.5513941669337486e-05,
"loss": 0.6263,
"step": 5100
},
{
"epoch": 0.7077718796787804,
"grad_norm": 10.218366622924805,
"learning_rate": 1.5422370770569116e-05,
"loss": 0.6441,
"step": 5200
},
{
"epoch": 0.7213828773649108,
"grad_norm": 8.07555866241455,
"learning_rate": 1.5330799871800742e-05,
"loss": 0.6436,
"step": 5300
},
{
"epoch": 0.7349938750510412,
"grad_norm": 8.196616172790527,
"learning_rate": 1.5239228973032372e-05,
"loss": 0.6254,
"step": 5400
},
{
"epoch": 0.7486048727371717,
"grad_norm": 7.4557085037231445,
"learning_rate": 1.5147658074264e-05,
"loss": 0.6161,
"step": 5500
},
{
"epoch": 0.7486048727371717,
"eval_cer": 22.99655880969475,
"eval_loss": 0.6194547414779663,
"eval_runtime": 930.6325,
"eval_samples_per_second": 3.325,
"eval_steps_per_second": 0.416,
"eval_wer": 47.23274830474671,
"step": 5500
},
{
"epoch": 0.7622158704233021,
"grad_norm": 8.781782150268555,
"learning_rate": 1.5056087175495629e-05,
"loss": 0.6144,
"step": 5600
},
{
"epoch": 0.7758268681094325,
"grad_norm": 11.802079200744629,
"learning_rate": 1.4964516276727257e-05,
"loss": 0.6012,
"step": 5700
},
{
"epoch": 0.7894378657955629,
"grad_norm": 9.713030815124512,
"learning_rate": 1.4872945377958885e-05,
"loss": 0.6244,
"step": 5800
},
{
"epoch": 0.8030488634816932,
"grad_norm": 11.544571876525879,
"learning_rate": 1.4781374479190514e-05,
"loss": 0.6248,
"step": 5900
},
{
"epoch": 0.8166598611678236,
"grad_norm": 9.622050285339355,
"learning_rate": 1.4689803580422144e-05,
"loss": 0.6335,
"step": 6000
},
{
"epoch": 0.8166598611678236,
"eval_cer": 27.483474859505357,
"eval_loss": 0.6030585169792175,
"eval_runtime": 979.4668,
"eval_samples_per_second": 3.159,
"eval_steps_per_second": 0.395,
"eval_wer": 52.93927004387714,
"step": 6000
},
{
"epoch": 0.830270858853954,
"grad_norm": 5.885132312774658,
"learning_rate": 1.4598232681653772e-05,
"loss": 0.5996,
"step": 6100
},
{
"epoch": 0.8438818565400844,
"grad_norm": 10.961427688598633,
"learning_rate": 1.45066617828854e-05,
"loss": 0.5984,
"step": 6200
},
{
"epoch": 0.8574928542262148,
"grad_norm": 8.962092399597168,
"learning_rate": 1.4415090884117028e-05,
"loss": 0.5831,
"step": 6300
},
{
"epoch": 0.8711038519123452,
"grad_norm": 8.857563018798828,
"learning_rate": 1.4323519985348657e-05,
"loss": 0.6214,
"step": 6400
},
{
"epoch": 0.8847148495984756,
"grad_norm": 8.55826187133789,
"learning_rate": 1.4231949086580285e-05,
"loss": 0.6063,
"step": 6500
},
{
"epoch": 0.8847148495984756,
"eval_cer": 26.41299235015968,
"eval_loss": 0.5897173285484314,
"eval_runtime": 961.8494,
"eval_samples_per_second": 3.217,
"eval_steps_per_second": 0.402,
"eval_wer": 51.50827682489031,
"step": 6500
},
{
"epoch": 0.898325847284606,
"grad_norm": 9.004158020019531,
"learning_rate": 1.4140378187811913e-05,
"loss": 0.5816,
"step": 6600
},
{
"epoch": 0.9119368449707363,
"grad_norm": 10.888954162597656,
"learning_rate": 1.4048807289043541e-05,
"loss": 0.5822,
"step": 6700
},
{
"epoch": 0.9255478426568667,
"grad_norm": 7.482538223266602,
"learning_rate": 1.3957236390275171e-05,
"loss": 0.596,
"step": 6800
},
{
"epoch": 0.9391588403429971,
"grad_norm": 9.417503356933594,
"learning_rate": 1.3865665491506801e-05,
"loss": 0.5702,
"step": 6900
},
{
"epoch": 0.9527698380291275,
"grad_norm": 6.990769863128662,
"learning_rate": 1.377409459273843e-05,
"loss": 0.5917,
"step": 7000
},
{
"epoch": 0.9527698380291275,
"eval_cer": 23.621914688188546,
"eval_loss": 0.5820683240890503,
"eval_runtime": 940.7788,
"eval_samples_per_second": 3.289,
"eval_steps_per_second": 0.411,
"eval_wer": 46.91114878340647,
"step": 7000
},
{
"epoch": 0.9663808357152579,
"grad_norm": 7.560977935791016,
"learning_rate": 1.3682523693970058e-05,
"loss": 0.583,
"step": 7100
},
{
"epoch": 0.9799918334013883,
"grad_norm": 10.802068710327148,
"learning_rate": 1.3590952795201686e-05,
"loss": 0.6026,
"step": 7200
},
{
"epoch": 0.9936028310875187,
"grad_norm": 11.21953010559082,
"learning_rate": 1.3499381896433314e-05,
"loss": 0.5949,
"step": 7300
},
{
"epoch": 1.0072138287736492,
"grad_norm": 7.203009128570557,
"learning_rate": 1.3407810997664943e-05,
"loss": 0.4813,
"step": 7400
},
{
"epoch": 1.0208248264597795,
"grad_norm": 6.168055057525635,
"learning_rate": 1.3316240098896571e-05,
"loss": 0.3952,
"step": 7500
},
{
"epoch": 1.0208248264597795,
"eval_cer": 21.952813606317925,
"eval_loss": 0.5695406794548035,
"eval_runtime": 912.4196,
"eval_samples_per_second": 3.391,
"eval_steps_per_second": 0.424,
"eval_wer": 45.213402473075384,
"step": 7500
},
{
"epoch": 1.03443582414591,
"grad_norm": 8.780722618103027,
"learning_rate": 1.3224669200128199e-05,
"loss": 0.3778,
"step": 7600
},
{
"epoch": 1.0480468218320402,
"grad_norm": 6.931602954864502,
"learning_rate": 1.3133098301359827e-05,
"loss": 0.3839,
"step": 7700
},
{
"epoch": 1.0616578195181707,
"grad_norm": 7.048837661743164,
"learning_rate": 1.3041527402591459e-05,
"loss": 0.3773,
"step": 7800
},
{
"epoch": 1.075268817204301,
"grad_norm": 7.898579120635986,
"learning_rate": 1.2949956503823087e-05,
"loss": 0.3894,
"step": 7900
},
{
"epoch": 1.0888798148904315,
"grad_norm": 7.919825553894043,
"learning_rate": 1.2858385605054716e-05,
"loss": 0.3882,
"step": 8000
},
{
"epoch": 1.0888798148904315,
"eval_cer": 21.941425494516377,
"eval_loss": 0.5697298049926758,
"eval_runtime": 926.3774,
"eval_samples_per_second": 3.34,
"eval_steps_per_second": 0.418,
"eval_wer": 44.32090147586757,
"step": 8000
},
{
"epoch": 1.1024908125765618,
"grad_norm": 8.552074432373047,
"learning_rate": 1.2766814706286344e-05,
"loss": 0.3829,
"step": 8100
},
{
"epoch": 1.1161018102626923,
"grad_norm": 7.923656463623047,
"learning_rate": 1.2675243807517972e-05,
"loss": 0.3868,
"step": 8200
},
{
"epoch": 1.1297128079488226,
"grad_norm": 7.2799530029296875,
"learning_rate": 1.25836729087496e-05,
"loss": 0.3878,
"step": 8300
},
{
"epoch": 1.143323805634953,
"grad_norm": 6.550467491149902,
"learning_rate": 1.2492102009981229e-05,
"loss": 0.3888,
"step": 8400
},
{
"epoch": 1.1569348033210836,
"grad_norm": 7.603492259979248,
"learning_rate": 1.2400531111212857e-05,
"loss": 0.3817,
"step": 8500
},
{
"epoch": 1.1569348033210836,
"eval_cer": 20.560988290050254,
"eval_loss": 0.5587778091430664,
"eval_runtime": 913.5504,
"eval_samples_per_second": 3.387,
"eval_steps_per_second": 0.424,
"eval_wer": 43.44834463502194,
"step": 8500
},
{
"epoch": 1.1705458010072138,
"grad_norm": 8.294718742370605,
"learning_rate": 1.2308960212444485e-05,
"loss": 0.3732,
"step": 8600
},
{
"epoch": 1.1841567986933441,
"grad_norm": 9.819673538208008,
"learning_rate": 1.2217389313676115e-05,
"loss": 0.3886,
"step": 8700
},
{
"epoch": 1.1977677963794746,
"grad_norm": 7.964117527008057,
"learning_rate": 1.2125818414907743e-05,
"loss": 0.3816,
"step": 8800
},
{
"epoch": 1.2113787940656051,
"grad_norm": 5.106940269470215,
"learning_rate": 1.2034247516139372e-05,
"loss": 0.3689,
"step": 8900
},
{
"epoch": 1.2249897917517354,
"grad_norm": 6.9468231201171875,
"learning_rate": 1.1942676617371001e-05,
"loss": 0.3791,
"step": 9000
},
{
"epoch": 1.2249897917517354,
"eval_cer": 21.8027876117149,
"eval_loss": 0.5529155135154724,
"eval_runtime": 914.3402,
"eval_samples_per_second": 3.384,
"eval_steps_per_second": 0.423,
"eval_wer": 44.63751495811727,
"step": 9000
},
{
"epoch": 1.238600789437866,
"grad_norm": 6.808917999267578,
"learning_rate": 1.185110571860263e-05,
"loss": 0.3768,
"step": 9100
},
{
"epoch": 1.2522117871239962,
"grad_norm": 9.738892555236816,
"learning_rate": 1.1759534819834258e-05,
"loss": 0.376,
"step": 9200
},
{
"epoch": 1.2658227848101267,
"grad_norm": 8.172088623046875,
"learning_rate": 1.1667963921065886e-05,
"loss": 0.3928,
"step": 9300
},
{
"epoch": 1.279433782496257,
"grad_norm": 6.819339275360107,
"learning_rate": 1.1576393022297515e-05,
"loss": 0.3902,
"step": 9400
},
{
"epoch": 1.2930447801823874,
"grad_norm": 7.440240859985352,
"learning_rate": 1.1484822123529143e-05,
"loss": 0.3849,
"step": 9500
},
{
"epoch": 1.2930447801823874,
"eval_cer": 21.664644864209144,
"eval_loss": 0.5443253517150879,
"eval_runtime": 938.2102,
"eval_samples_per_second": 3.298,
"eval_steps_per_second": 0.412,
"eval_wer": 43.96190666134822,
"step": 9500
},
{
"epoch": 1.3066557778685177,
"grad_norm": 7.373666286468506,
"learning_rate": 1.1393251224760773e-05,
"loss": 0.3755,
"step": 9600
},
{
"epoch": 1.3202667755546482,
"grad_norm": 8.251206398010254,
"learning_rate": 1.1301680325992401e-05,
"loss": 0.3785,
"step": 9700
},
{
"epoch": 1.3338777732407785,
"grad_norm": 5.46920919418335,
"learning_rate": 1.121010942722403e-05,
"loss": 0.3764,
"step": 9800
},
{
"epoch": 1.347488770926909,
"grad_norm": 8.345499992370605,
"learning_rate": 1.1118538528455657e-05,
"loss": 0.3849,
"step": 9900
},
{
"epoch": 1.3610997686130393,
"grad_norm": 5.544594764709473,
"learning_rate": 1.1026967629687286e-05,
"loss": 0.3903,
"step": 10000
},
{
"epoch": 1.3610997686130393,
"eval_cer": 21.089792785878743,
"eval_loss": 0.5430769324302673,
"eval_runtime": 921.5241,
"eval_samples_per_second": 3.357,
"eval_steps_per_second": 0.42,
"eval_wer": 43.48075388911049,
"step": 10000
},
{
"epoch": 1.3747107662991698,
"grad_norm": 6.338021755218506,
"learning_rate": 1.0935396730918914e-05,
"loss": 0.3883,
"step": 10100
},
{
"epoch": 1.3883217639853,
"grad_norm": 8.008199691772461,
"learning_rate": 1.0843825832150542e-05,
"loss": 0.3963,
"step": 10200
},
{
"epoch": 1.4019327616714305,
"grad_norm": 6.975709438323975,
"learning_rate": 1.075225493338217e-05,
"loss": 0.3934,
"step": 10300
},
{
"epoch": 1.4155437593575608,
"grad_norm": 8.565428733825684,
"learning_rate": 1.06606840346138e-05,
"loss": 0.3879,
"step": 10400
},
{
"epoch": 1.4291547570436913,
"grad_norm": 6.089544296264648,
"learning_rate": 1.056911313584543e-05,
"loss": 0.3708,
"step": 10500
},
{
"epoch": 1.4291547570436913,
"eval_cer": 18.837422325650486,
"eval_loss": 0.5384772419929504,
"eval_runtime": 891.4907,
"eval_samples_per_second": 3.471,
"eval_steps_per_second": 0.434,
"eval_wer": 40.10271240526526,
"step": 10500
},
{
"epoch": 1.4427657547298218,
"grad_norm": 7.494001388549805,
"learning_rate": 1.0477542237077059e-05,
"loss": 0.3734,
"step": 10600
},
{
"epoch": 1.456376752415952,
"grad_norm": 4.784611701965332,
"learning_rate": 1.0385971338308687e-05,
"loss": 0.3804,
"step": 10700
},
{
"epoch": 1.4699877501020824,
"grad_norm": 8.518943786621094,
"learning_rate": 1.0294400439540315e-05,
"loss": 0.372,
"step": 10800
},
{
"epoch": 1.4835987477882129,
"grad_norm": 7.112024784088135,
"learning_rate": 1.0202829540771943e-05,
"loss": 0.3837,
"step": 10900
},
{
"epoch": 1.4972097454743434,
"grad_norm": 7.3742218017578125,
"learning_rate": 1.0111258642003572e-05,
"loss": 0.3664,
"step": 11000
},
{
"epoch": 1.4972097454743434,
"eval_cer": 19.681628004852325,
"eval_loss": 0.5333254337310791,
"eval_runtime": 915.2281,
"eval_samples_per_second": 3.381,
"eval_steps_per_second": 0.423,
"eval_wer": 41.19465496609494,
"step": 11000
}
],
"logging_steps": 100,
"max_steps": 22041,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.539464947195904e+19,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}