aleegis12's picture
Training in progress, step 350, checkpoint
79bdad7 verified
Raw History Blame
63.4 kB
{
"best_metric": 1.3468055725097656,
"best_model_checkpoint": "miner_id_24/checkpoint-350",
"epoch": 0.0827178729689808,
"eval_steps": 50,
"global_step": 350,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0002363367799113737,
"grad_norm": 0.962568998336792,
"learning_rate": 1e-05,
"loss": 1.5766,
"step": 1
},
{
"epoch": 0.0002363367799113737,
"eval_loss": 2.307421922683716,
"eval_runtime": 544.1619,
"eval_samples_per_second": 13.097,
"eval_steps_per_second": 3.275,
"step": 1
},
{
"epoch": 0.0004726735598227474,
"grad_norm": 0.836689829826355,
"learning_rate": 2e-05,
"loss": 1.3413,
"step": 2
},
{
"epoch": 0.0007090103397341211,
"grad_norm": 0.9246699213981628,
"learning_rate": 3e-05,
"loss": 1.4062,
"step": 3
},
{
"epoch": 0.0009453471196454948,
"grad_norm": 1.0338189601898193,
"learning_rate": 4e-05,
"loss": 1.5972,
"step": 4
},
{
"epoch": 0.0011816838995568684,
"grad_norm": 0.7805269956588745,
"learning_rate": 5e-05,
"loss": 1.8295,
"step": 5
},
{
"epoch": 0.0014180206794682422,
"grad_norm": 0.7270001173019409,
"learning_rate": 6e-05,
"loss": 1.5079,
"step": 6
},
{
"epoch": 0.001654357459379616,
"grad_norm": 1.0106533765792847,
"learning_rate": 7e-05,
"loss": 1.452,
"step": 7
},
{
"epoch": 0.0018906942392909896,
"grad_norm": 0.8681199550628662,
"learning_rate": 8e-05,
"loss": 1.7515,
"step": 8
},
{
"epoch": 0.0021270310192023634,
"grad_norm": 0.9652785658836365,
"learning_rate": 9e-05,
"loss": 1.6405,
"step": 9
},
{
"epoch": 0.002363367799113737,
"grad_norm": 0.8977751135826111,
"learning_rate": 0.0001,
"loss": 1.7423,
"step": 10
},
{
"epoch": 0.002599704579025111,
"grad_norm": 0.8928416967391968,
"learning_rate": 9.99983777858264e-05,
"loss": 1.5599,
"step": 11
},
{
"epoch": 0.0028360413589364844,
"grad_norm": 1.0562834739685059,
"learning_rate": 9.999351124856874e-05,
"loss": 1.8838,
"step": 12
},
{
"epoch": 0.0030723781388478583,
"grad_norm": 1.0885255336761475,
"learning_rate": 9.998540070400966e-05,
"loss": 1.6491,
"step": 13
},
{
"epoch": 0.003308714918759232,
"grad_norm": 1.4191340208053589,
"learning_rate": 9.997404667843075e-05,
"loss": 1.3198,
"step": 14
},
{
"epoch": 0.0035450516986706058,
"grad_norm": 1.09172523021698,
"learning_rate": 9.995944990857849e-05,
"loss": 1.553,
"step": 15
},
{
"epoch": 0.0037813884785819793,
"grad_norm": 1.0828980207443237,
"learning_rate": 9.994161134161634e-05,
"loss": 1.5503,
"step": 16
},
{
"epoch": 0.004017725258493353,
"grad_norm": 1.0516393184661865,
"learning_rate": 9.992053213506334e-05,
"loss": 1.6532,
"step": 17
},
{
"epoch": 0.004254062038404727,
"grad_norm": 1.0532169342041016,
"learning_rate": 9.989621365671902e-05,
"loss": 1.363,
"step": 18
},
{
"epoch": 0.0044903988183161,
"grad_norm": 0.8288836479187012,
"learning_rate": 9.986865748457457e-05,
"loss": 1.3737,
"step": 19
},
{
"epoch": 0.004726735598227474,
"grad_norm": 1.2724401950836182,
"learning_rate": 9.983786540671051e-05,
"loss": 1.4115,
"step": 20
},
{
"epoch": 0.004963072378138848,
"grad_norm": 1.1288785934448242,
"learning_rate": 9.980383942118066e-05,
"loss": 1.5479,
"step": 21
},
{
"epoch": 0.005199409158050222,
"grad_norm": 0.9786710739135742,
"learning_rate": 9.976658173588244e-05,
"loss": 1.634,
"step": 22
},
{
"epoch": 0.005435745937961595,
"grad_norm": 0.9771286845207214,
"learning_rate": 9.972609476841367e-05,
"loss": 1.4783,
"step": 23
},
{
"epoch": 0.005672082717872969,
"grad_norm": 1.1386462450027466,
"learning_rate": 9.968238114591566e-05,
"loss": 1.3894,
"step": 24
},
{
"epoch": 0.005908419497784343,
"grad_norm": 0.932101845741272,
"learning_rate": 9.96354437049027e-05,
"loss": 1.7236,
"step": 25
},
{
"epoch": 0.006144756277695717,
"grad_norm": 0.9714637994766235,
"learning_rate": 9.95852854910781e-05,
"loss": 1.4703,
"step": 26
},
{
"epoch": 0.00638109305760709,
"grad_norm": 1.0149480104446411,
"learning_rate": 9.953190975913647e-05,
"loss": 1.5565,
"step": 27
},
{
"epoch": 0.006617429837518464,
"grad_norm": 1.1948692798614502,
"learning_rate": 9.947531997255256e-05,
"loss": 1.3331,
"step": 28
},
{
"epoch": 0.006853766617429837,
"grad_norm": 0.9405235052108765,
"learning_rate": 9.941551980335652e-05,
"loss": 1.5302,
"step": 29
},
{
"epoch": 0.0070901033973412115,
"grad_norm": 0.8745080828666687,
"learning_rate": 9.935251313189564e-05,
"loss": 1.5957,
"step": 30
},
{
"epoch": 0.007326440177252585,
"grad_norm": 0.8737711310386658,
"learning_rate": 9.928630404658255e-05,
"loss": 1.3771,
"step": 31
},
{
"epoch": 0.0075627769571639586,
"grad_norm": 0.940108597278595,
"learning_rate": 9.921689684362989e-05,
"loss": 1.6437,
"step": 32
},
{
"epoch": 0.007799113737075332,
"grad_norm": 0.8977481722831726,
"learning_rate": 9.914429602677162e-05,
"loss": 1.4883,
"step": 33
},
{
"epoch": 0.008035450516986706,
"grad_norm": 1.0117844343185425,
"learning_rate": 9.906850630697068e-05,
"loss": 1.3731,
"step": 34
},
{
"epoch": 0.00827178729689808,
"grad_norm": 1.182795524597168,
"learning_rate": 9.898953260211338e-05,
"loss": 1.5906,
"step": 35
},
{
"epoch": 0.008508124076809453,
"grad_norm": 0.8277016282081604,
"learning_rate": 9.890738003669029e-05,
"loss": 1.3558,
"step": 36
},
{
"epoch": 0.008744460856720827,
"grad_norm": 0.8979318737983704,
"learning_rate": 9.882205394146361e-05,
"loss": 1.6458,
"step": 37
},
{
"epoch": 0.0089807976366322,
"grad_norm": 0.9339172840118408,
"learning_rate": 9.87335598531214e-05,
"loss": 1.4363,
"step": 38
},
{
"epoch": 0.009217134416543574,
"grad_norm": 0.9349825382232666,
"learning_rate": 9.864190351391822e-05,
"loss": 1.5653,
"step": 39
},
{
"epoch": 0.009453471196454948,
"grad_norm": 0.9626030325889587,
"learning_rate": 9.85470908713026e-05,
"loss": 1.5098,
"step": 40
},
{
"epoch": 0.009689807976366323,
"grad_norm": 0.9268250465393066,
"learning_rate": 9.844912807753104e-05,
"loss": 1.5328,
"step": 41
},
{
"epoch": 0.009926144756277696,
"grad_norm": 0.9651059508323669,
"learning_rate": 9.834802148926882e-05,
"loss": 1.7049,
"step": 42
},
{
"epoch": 0.01016248153618907,
"grad_norm": 0.9303879737854004,
"learning_rate": 9.824377766717759e-05,
"loss": 1.6356,
"step": 43
},
{
"epoch": 0.010398818316100443,
"grad_norm": 0.8670615553855896,
"learning_rate": 9.813640337548954e-05,
"loss": 1.7882,
"step": 44
},
{
"epoch": 0.010635155096011817,
"grad_norm": 0.8428188562393188,
"learning_rate": 9.802590558156862e-05,
"loss": 1.6789,
"step": 45
},
{
"epoch": 0.01087149187592319,
"grad_norm": 0.8441392779350281,
"learning_rate": 9.791229145545831e-05,
"loss": 1.621,
"step": 46
},
{
"epoch": 0.011107828655834564,
"grad_norm": 1.016707181930542,
"learning_rate": 9.779556836941645e-05,
"loss": 1.6904,
"step": 47
},
{
"epoch": 0.011344165435745937,
"grad_norm": 1.208844780921936,
"learning_rate": 9.767574389743682e-05,
"loss": 1.7754,
"step": 48
},
{
"epoch": 0.011580502215657311,
"grad_norm": 1.6422576904296875,
"learning_rate": 9.755282581475769e-05,
"loss": 1.756,
"step": 49
},
{
"epoch": 0.011816838995568686,
"grad_norm": 1.860146403312683,
"learning_rate": 9.742682209735727e-05,
"loss": 1.7089,
"step": 50
},
{
"epoch": 0.011816838995568686,
"eval_loss": 1.5719951391220093,
"eval_runtime": 546.3214,
"eval_samples_per_second": 13.045,
"eval_steps_per_second": 3.262,
"step": 50
},
{
"epoch": 0.01205317577548006,
"grad_norm": 1.3921040296554565,
"learning_rate": 9.729774092143627e-05,
"loss": 1.2475,
"step": 51
},
{
"epoch": 0.012289512555391433,
"grad_norm": 1.468597650527954,
"learning_rate": 9.716559066288715e-05,
"loss": 1.5212,
"step": 52
},
{
"epoch": 0.012525849335302807,
"grad_norm": 0.9106165170669556,
"learning_rate": 9.703037989675087e-05,
"loss": 1.3007,
"step": 53
},
{
"epoch": 0.01276218611521418,
"grad_norm": 0.7389653325080872,
"learning_rate": 9.689211739666023e-05,
"loss": 1.7474,
"step": 54
},
{
"epoch": 0.012998522895125554,
"grad_norm": 0.5950703620910645,
"learning_rate": 9.675081213427076e-05,
"loss": 1.447,
"step": 55
},
{
"epoch": 0.013234859675036927,
"grad_norm": 0.7542724609375,
"learning_rate": 9.66064732786784e-05,
"loss": 1.2154,
"step": 56
},
{
"epoch": 0.0134711964549483,
"grad_norm": 0.615863025188446,
"learning_rate": 9.645911019582467e-05,
"loss": 1.4581,
"step": 57
},
{
"epoch": 0.013707533234859674,
"grad_norm": 0.6719561815261841,
"learning_rate": 9.630873244788883e-05,
"loss": 1.7195,
"step": 58
},
{
"epoch": 0.01394387001477105,
"grad_norm": 0.8025861978530884,
"learning_rate": 9.615534979266745e-05,
"loss": 1.4424,
"step": 59
},
{
"epoch": 0.014180206794682423,
"grad_norm": 0.8593571186065674,
"learning_rate": 9.599897218294122e-05,
"loss": 1.2772,
"step": 60
},
{
"epoch": 0.014416543574593797,
"grad_norm": 0.8140683174133301,
"learning_rate": 9.583960976582913e-05,
"loss": 1.2782,
"step": 61
},
{
"epoch": 0.01465288035450517,
"grad_norm": 0.8652300834655762,
"learning_rate": 9.567727288213005e-05,
"loss": 1.2384,
"step": 62
},
{
"epoch": 0.014889217134416544,
"grad_norm": 0.9477348327636719,
"learning_rate": 9.551197206565173e-05,
"loss": 1.1725,
"step": 63
},
{
"epoch": 0.015125553914327917,
"grad_norm": 0.7401777505874634,
"learning_rate": 9.534371804252728e-05,
"loss": 1.339,
"step": 64
},
{
"epoch": 0.01536189069423929,
"grad_norm": 0.8628498315811157,
"learning_rate": 9.517252173051911e-05,
"loss": 1.354,
"step": 65
},
{
"epoch": 0.015598227474150664,
"grad_norm": 0.858137309551239,
"learning_rate": 9.49983942383106e-05,
"loss": 1.4769,
"step": 66
},
{
"epoch": 0.015834564254062038,
"grad_norm": 0.7888755798339844,
"learning_rate": 9.482134686478519e-05,
"loss": 1.457,
"step": 67
},
{
"epoch": 0.016070901033973413,
"grad_norm": 0.796262264251709,
"learning_rate": 9.464139109829321e-05,
"loss": 1.1534,
"step": 68
},
{
"epoch": 0.016307237813884785,
"grad_norm": 0.9140974879264832,
"learning_rate": 9.445853861590647e-05,
"loss": 1.3714,
"step": 69
},
{
"epoch": 0.01654357459379616,
"grad_norm": 0.7814958095550537,
"learning_rate": 9.42728012826605e-05,
"loss": 1.2061,
"step": 70
},
{
"epoch": 0.01677991137370753,
"grad_norm": 0.7970321178436279,
"learning_rate": 9.408419115078471e-05,
"loss": 1.3835,
"step": 71
},
{
"epoch": 0.017016248153618907,
"grad_norm": 0.7458755970001221,
"learning_rate": 9.389272045892024e-05,
"loss": 1.3189,
"step": 72
},
{
"epoch": 0.017252584933530282,
"grad_norm": 0.8076595664024353,
"learning_rate": 9.36984016313259e-05,
"loss": 1.3228,
"step": 73
},
{
"epoch": 0.017488921713441654,
"grad_norm": 0.8528698086738586,
"learning_rate": 9.350124727707197e-05,
"loss": 1.2153,
"step": 74
},
{
"epoch": 0.01772525849335303,
"grad_norm": 0.8382695317268372,
"learning_rate": 9.330127018922194e-05,
"loss": 1.3955,
"step": 75
},
{
"epoch": 0.0179615952732644,
"grad_norm": 0.8453637957572937,
"learning_rate": 9.309848334400246e-05,
"loss": 1.2161,
"step": 76
},
{
"epoch": 0.018197932053175776,
"grad_norm": 0.8528453707695007,
"learning_rate": 9.289289989996133e-05,
"loss": 1.3031,
"step": 77
},
{
"epoch": 0.018434268833087148,
"grad_norm": 0.8365333676338196,
"learning_rate": 9.268453319711363e-05,
"loss": 1.5613,
"step": 78
},
{
"epoch": 0.018670605612998523,
"grad_norm": 0.7652196884155273,
"learning_rate": 9.247339675607605e-05,
"loss": 1.2893,
"step": 79
},
{
"epoch": 0.018906942392909895,
"grad_norm": 0.8892850875854492,
"learning_rate": 9.225950427718975e-05,
"loss": 1.291,
"step": 80
},
{
"epoch": 0.01914327917282127,
"grad_norm": 0.7519558668136597,
"learning_rate": 9.204286963963111e-05,
"loss": 1.306,
"step": 81
},
{
"epoch": 0.019379615952732646,
"grad_norm": 0.7413076758384705,
"learning_rate": 9.182350690051133e-05,
"loss": 1.3465,
"step": 82
},
{
"epoch": 0.019615952732644017,
"grad_norm": 0.8368196487426758,
"learning_rate": 9.160143029396422e-05,
"loss": 1.377,
"step": 83
},
{
"epoch": 0.019852289512555393,
"grad_norm": 0.7968633770942688,
"learning_rate": 9.13766542302225e-05,
"loss": 1.428,
"step": 84
},
{
"epoch": 0.020088626292466764,
"grad_norm": 1.0490226745605469,
"learning_rate": 9.114919329468282e-05,
"loss": 1.6381,
"step": 85
},
{
"epoch": 0.02032496307237814,
"grad_norm": 0.8110454678535461,
"learning_rate": 9.091906224695935e-05,
"loss": 1.6322,
"step": 86
},
{
"epoch": 0.02056129985228951,
"grad_norm": 0.9556715488433838,
"learning_rate": 9.068627601992598e-05,
"loss": 1.6105,
"step": 87
},
{
"epoch": 0.020797636632200887,
"grad_norm": 0.7827744483947754,
"learning_rate": 9.045084971874738e-05,
"loss": 1.6826,
"step": 88
},
{
"epoch": 0.02103397341211226,
"grad_norm": 0.9120392799377441,
"learning_rate": 9.021279861989885e-05,
"loss": 1.6796,
"step": 89
},
{
"epoch": 0.021270310192023634,
"grad_norm": 0.8531889915466309,
"learning_rate": 8.997213817017507e-05,
"loss": 1.5029,
"step": 90
},
{
"epoch": 0.02150664697193501,
"grad_norm": 0.8959422707557678,
"learning_rate": 8.972888398568772e-05,
"loss": 1.6082,
"step": 91
},
{
"epoch": 0.02174298375184638,
"grad_norm": 0.8365451693534851,
"learning_rate": 8.948305185085225e-05,
"loss": 1.637,
"step": 92
},
{
"epoch": 0.021979320531757756,
"grad_norm": 0.8199298977851868,
"learning_rate": 8.92346577173636e-05,
"loss": 1.7106,
"step": 93
},
{
"epoch": 0.022215657311669128,
"grad_norm": 0.8373245596885681,
"learning_rate": 8.898371770316111e-05,
"loss": 1.7262,
"step": 94
},
{
"epoch": 0.022451994091580503,
"grad_norm": 0.9236546158790588,
"learning_rate": 8.873024809138272e-05,
"loss": 1.6798,
"step": 95
},
{
"epoch": 0.022688330871491875,
"grad_norm": 0.8642488718032837,
"learning_rate": 8.847426532930831e-05,
"loss": 1.6958,
"step": 96
},
{
"epoch": 0.02292466765140325,
"grad_norm": 1.0294744968414307,
"learning_rate": 8.821578602729242e-05,
"loss": 1.6575,
"step": 97
},
{
"epoch": 0.023161004431314622,
"grad_norm": 1.3789857625961304,
"learning_rate": 8.795482695768658e-05,
"loss": 1.7238,
"step": 98
},
{
"epoch": 0.023397341211225997,
"grad_norm": 1.3623933792114258,
"learning_rate": 8.769140505375085e-05,
"loss": 1.4895,
"step": 99
},
{
"epoch": 0.023633677991137372,
"grad_norm": 2.5840892791748047,
"learning_rate": 8.742553740855506e-05,
"loss": 1.5329,
"step": 100
},
{
"epoch": 0.023633677991137372,
"eval_loss": 1.501173734664917,
"eval_runtime": 546.1114,
"eval_samples_per_second": 13.05,
"eval_steps_per_second": 3.263,
"step": 100
},
{
"epoch": 0.023870014771048744,
"grad_norm": 0.8037025332450867,
"learning_rate": 8.715724127386972e-05,
"loss": 1.6607,
"step": 101
},
{
"epoch": 0.02410635155096012,
"grad_norm": 0.872471034526825,
"learning_rate": 8.688653405904652e-05,
"loss": 1.4072,
"step": 102
},
{
"epoch": 0.02434268833087149,
"grad_norm": 0.8332801461219788,
"learning_rate": 8.661343332988869e-05,
"loss": 1.7243,
"step": 103
},
{
"epoch": 0.024579025110782866,
"grad_norm": 0.7240092754364014,
"learning_rate": 8.633795680751116e-05,
"loss": 1.5283,
"step": 104
},
{
"epoch": 0.024815361890694238,
"grad_norm": 0.7378276586532593,
"learning_rate": 8.606012236719073e-05,
"loss": 1.9285,
"step": 105
},
{
"epoch": 0.025051698670605613,
"grad_norm": 0.6166480183601379,
"learning_rate": 8.577994803720606e-05,
"loss": 1.5375,
"step": 106
},
{
"epoch": 0.025288035450516985,
"grad_norm": 0.5955683588981628,
"learning_rate": 8.549745199766792e-05,
"loss": 1.4995,
"step": 107
},
{
"epoch": 0.02552437223042836,
"grad_norm": 0.6268562078475952,
"learning_rate": 8.521265257933948e-05,
"loss": 1.4955,
"step": 108
},
{
"epoch": 0.025760709010339736,
"grad_norm": 0.6342216730117798,
"learning_rate": 8.492556826244687e-05,
"loss": 1.6321,
"step": 109
},
{
"epoch": 0.025997045790251107,
"grad_norm": 0.6816225051879883,
"learning_rate": 8.463621767547998e-05,
"loss": 1.4456,
"step": 110
},
{
"epoch": 0.026233382570162483,
"grad_norm": 0.6341848373413086,
"learning_rate": 8.434461959398376e-05,
"loss": 1.5821,
"step": 111
},
{
"epoch": 0.026469719350073855,
"grad_norm": 0.7276953458786011,
"learning_rate": 8.405079293933986e-05,
"loss": 1.6067,
"step": 112
},
{
"epoch": 0.02670605612998523,
"grad_norm": 0.770680844783783,
"learning_rate": 8.375475677753881e-05,
"loss": 1.3039,
"step": 113
},
{
"epoch": 0.0269423929098966,
"grad_norm": 0.7676824927330017,
"learning_rate": 8.345653031794292e-05,
"loss": 1.6077,
"step": 114
},
{
"epoch": 0.027178729689807977,
"grad_norm": 0.795630931854248,
"learning_rate": 8.315613291203976e-05,
"loss": 1.287,
"step": 115
},
{
"epoch": 0.02741506646971935,
"grad_norm": 0.8530545830726624,
"learning_rate": 8.285358405218655e-05,
"loss": 1.1443,
"step": 116
},
{
"epoch": 0.027651403249630724,
"grad_norm": 0.8104541301727295,
"learning_rate": 8.25489033703452e-05,
"loss": 1.2917,
"step": 117
},
{
"epoch": 0.0278877400295421,
"grad_norm": 0.8394821286201477,
"learning_rate": 8.224211063680853e-05,
"loss": 1.499,
"step": 118
},
{
"epoch": 0.02812407680945347,
"grad_norm": 0.8282003402709961,
"learning_rate": 8.19332257589174e-05,
"loss": 1.4619,
"step": 119
},
{
"epoch": 0.028360413589364846,
"grad_norm": 0.8042457103729248,
"learning_rate": 8.162226877976887e-05,
"loss": 1.2362,
"step": 120
},
{
"epoch": 0.028596750369276218,
"grad_norm": 0.7527115345001221,
"learning_rate": 8.130925987691569e-05,
"loss": 1.3841,
"step": 121
},
{
"epoch": 0.028833087149187593,
"grad_norm": 0.7210351228713989,
"learning_rate": 8.099421936105702e-05,
"loss": 1.6026,
"step": 122
},
{
"epoch": 0.029069423929098965,
"grad_norm": 0.7347239255905151,
"learning_rate": 8.067716767472045e-05,
"loss": 1.4895,
"step": 123
},
{
"epoch": 0.02930576070901034,
"grad_norm": 0.7784380316734314,
"learning_rate": 8.035812539093557e-05,
"loss": 1.3074,
"step": 124
},
{
"epoch": 0.029542097488921712,
"grad_norm": 0.7604086995124817,
"learning_rate": 8.003711321189895e-05,
"loss": 1.2598,
"step": 125
},
{
"epoch": 0.029778434268833087,
"grad_norm": 0.7531232237815857,
"learning_rate": 7.971415196763088e-05,
"loss": 1.4353,
"step": 126
},
{
"epoch": 0.030014771048744462,
"grad_norm": 0.8189026117324829,
"learning_rate": 7.938926261462366e-05,
"loss": 1.1932,
"step": 127
},
{
"epoch": 0.030251107828655834,
"grad_norm": 0.7173908352851868,
"learning_rate": 7.906246623448183e-05,
"loss": 1.2883,
"step": 128
},
{
"epoch": 0.03048744460856721,
"grad_norm": 0.7799598574638367,
"learning_rate": 7.873378403255419e-05,
"loss": 1.4449,
"step": 129
},
{
"epoch": 0.03072378138847858,
"grad_norm": 0.7680227756500244,
"learning_rate": 7.840323733655778e-05,
"loss": 1.4208,
"step": 130
},
{
"epoch": 0.030960118168389957,
"grad_norm": 1.027715802192688,
"learning_rate": 7.807084759519405e-05,
"loss": 1.4461,
"step": 131
},
{
"epoch": 0.03119645494830133,
"grad_norm": 0.7231760025024414,
"learning_rate": 7.773663637675694e-05,
"loss": 1.2763,
"step": 132
},
{
"epoch": 0.0314327917282127,
"grad_norm": 0.8921284079551697,
"learning_rate": 7.740062536773352e-05,
"loss": 1.3582,
"step": 133
},
{
"epoch": 0.031669128508124075,
"grad_norm": 0.7310764789581299,
"learning_rate": 7.706283637139658e-05,
"loss": 1.3699,
"step": 134
},
{
"epoch": 0.03190546528803545,
"grad_norm": 0.8492346405982971,
"learning_rate": 7.672329130639005e-05,
"loss": 1.4663,
"step": 135
},
{
"epoch": 0.032141802067946826,
"grad_norm": 0.9474092721939087,
"learning_rate": 7.638201220530665e-05,
"loss": 1.5147,
"step": 136
},
{
"epoch": 0.0323781388478582,
"grad_norm": 0.7737847566604614,
"learning_rate": 7.603902121325813e-05,
"loss": 1.4654,
"step": 137
},
{
"epoch": 0.03261447562776957,
"grad_norm": 0.7279232740402222,
"learning_rate": 7.569434058643844e-05,
"loss": 1.5139,
"step": 138
},
{
"epoch": 0.032850812407680945,
"grad_norm": 0.842126727104187,
"learning_rate": 7.534799269067953e-05,
"loss": 1.4975,
"step": 139
},
{
"epoch": 0.03308714918759232,
"grad_norm": 0.8013493418693542,
"learning_rate": 7.500000000000001e-05,
"loss": 1.3718,
"step": 140
},
{
"epoch": 0.033323485967503695,
"grad_norm": 0.9007391929626465,
"learning_rate": 7.465038509514688e-05,
"loss": 1.5933,
"step": 141
},
{
"epoch": 0.03355982274741506,
"grad_norm": 0.7821772694587708,
"learning_rate": 7.42991706621303e-05,
"loss": 1.6399,
"step": 142
},
{
"epoch": 0.03379615952732644,
"grad_norm": 0.8712095618247986,
"learning_rate": 7.394637949075154e-05,
"loss": 1.6031,
"step": 143
},
{
"epoch": 0.034032496307237814,
"grad_norm": 0.8085826635360718,
"learning_rate": 7.35920344731241e-05,
"loss": 1.6938,
"step": 144
},
{
"epoch": 0.03426883308714919,
"grad_norm": 0.8882783651351929,
"learning_rate": 7.323615860218843e-05,
"loss": 1.7896,
"step": 145
},
{
"epoch": 0.034505169867060564,
"grad_norm": 0.9685528874397278,
"learning_rate": 7.287877497021978e-05,
"loss": 1.5817,
"step": 146
},
{
"epoch": 0.03474150664697193,
"grad_norm": 0.9416519999504089,
"learning_rate": 7.251990676732984e-05,
"loss": 1.6405,
"step": 147
},
{
"epoch": 0.03497784342688331,
"grad_norm": 1.1194108724594116,
"learning_rate": 7.215957727996207e-05,
"loss": 1.5226,
"step": 148
},
{
"epoch": 0.03521418020679468,
"grad_norm": 1.6036629676818848,
"learning_rate": 7.179780988938051e-05,
"loss": 1.7582,
"step": 149
},
{
"epoch": 0.03545051698670606,
"grad_norm": 2.10256028175354,
"learning_rate": 7.143462807015271e-05,
"loss": 1.3764,
"step": 150
},
{
"epoch": 0.03545051698670606,
"eval_loss": 1.4293397665023804,
"eval_runtime": 545.786,
"eval_samples_per_second": 13.058,
"eval_steps_per_second": 3.265,
"step": 150
},
{
"epoch": 0.03568685376661743,
"grad_norm": 0.5102832317352295,
"learning_rate": 7.107005538862646e-05,
"loss": 1.0989,
"step": 151
},
{
"epoch": 0.0359231905465288,
"grad_norm": 0.5750204920768738,
"learning_rate": 7.07041155014006e-05,
"loss": 1.2694,
"step": 152
},
{
"epoch": 0.03615952732644018,
"grad_norm": 0.656173586845398,
"learning_rate": 7.033683215379002e-05,
"loss": 1.3851,
"step": 153
},
{
"epoch": 0.03639586410635155,
"grad_norm": 0.6856642365455627,
"learning_rate": 6.996822917828477e-05,
"loss": 1.5173,
"step": 154
},
{
"epoch": 0.03663220088626293,
"grad_norm": 0.7456484436988831,
"learning_rate": 6.959833049300377e-05,
"loss": 1.5841,
"step": 155
},
{
"epoch": 0.036868537666174296,
"grad_norm": 0.7046188116073608,
"learning_rate": 6.922716010014255e-05,
"loss": 1.5951,
"step": 156
},
{
"epoch": 0.03710487444608567,
"grad_norm": 0.5908671617507935,
"learning_rate": 6.885474208441603e-05,
"loss": 1.3802,
"step": 157
},
{
"epoch": 0.03734121122599705,
"grad_norm": 0.820754885673523,
"learning_rate": 6.848110061149556e-05,
"loss": 1.6758,
"step": 158
},
{
"epoch": 0.03757754800590842,
"grad_norm": 0.684035062789917,
"learning_rate": 6.810625992644085e-05,
"loss": 1.3755,
"step": 159
},
{
"epoch": 0.03781388478581979,
"grad_norm": 0.6925457119941711,
"learning_rate": 6.773024435212678e-05,
"loss": 1.2663,
"step": 160
},
{
"epoch": 0.038050221565731165,
"grad_norm": 0.6184958815574646,
"learning_rate": 6.735307828766515e-05,
"loss": 1.2938,
"step": 161
},
{
"epoch": 0.03828655834564254,
"grad_norm": 0.6940076351165771,
"learning_rate": 6.697478620682137e-05,
"loss": 1.4158,
"step": 162
},
{
"epoch": 0.038522895125553916,
"grad_norm": 0.8101726174354553,
"learning_rate": 6.659539265642643e-05,
"loss": 1.4058,
"step": 163
},
{
"epoch": 0.03875923190546529,
"grad_norm": 0.7321621179580688,
"learning_rate": 6.621492225478414e-05,
"loss": 1.3675,
"step": 164
},
{
"epoch": 0.03899556868537666,
"grad_norm": 0.661636233329773,
"learning_rate": 6.583339969007363e-05,
"loss": 1.4018,
"step": 165
},
{
"epoch": 0.039231905465288035,
"grad_norm": 0.8307713866233826,
"learning_rate": 6.545084971874738e-05,
"loss": 1.2124,
"step": 166
},
{
"epoch": 0.03946824224519941,
"grad_norm": 0.6810014843940735,
"learning_rate": 6.506729716392481e-05,
"loss": 1.396,
"step": 167
},
{
"epoch": 0.039704579025110785,
"grad_norm": 1.1103947162628174,
"learning_rate": 6.468276691378155e-05,
"loss": 1.1694,
"step": 168
},
{
"epoch": 0.039940915805022154,
"grad_norm": 1.0087090730667114,
"learning_rate": 6.429728391993446e-05,
"loss": 1.1331,
"step": 169
},
{
"epoch": 0.04017725258493353,
"grad_norm": 0.7625798583030701,
"learning_rate": 6.391087319582264e-05,
"loss": 1.0443,
"step": 170
},
{
"epoch": 0.040413589364844904,
"grad_norm": 0.9178735613822937,
"learning_rate": 6.35235598150842e-05,
"loss": 0.9701,
"step": 171
},
{
"epoch": 0.04064992614475628,
"grad_norm": 0.7063561081886292,
"learning_rate": 6.313536890992935e-05,
"loss": 1.2148,
"step": 172
},
{
"epoch": 0.040886262924667655,
"grad_norm": 0.865037202835083,
"learning_rate": 6.274632566950967e-05,
"loss": 1.1229,
"step": 173
},
{
"epoch": 0.04112259970457902,
"grad_norm": 0.8387466073036194,
"learning_rate": 6.235645533828349e-05,
"loss": 1.1997,
"step": 174
},
{
"epoch": 0.0413589364844904,
"grad_norm": 0.8075777888298035,
"learning_rate": 6.19657832143779e-05,
"loss": 1.4105,
"step": 175
},
{
"epoch": 0.04159527326440177,
"grad_norm": 0.7226337194442749,
"learning_rate": 6.157433464794716e-05,
"loss": 1.2907,
"step": 176
},
{
"epoch": 0.04183161004431315,
"grad_norm": 0.8077397346496582,
"learning_rate": 6.118213503952779e-05,
"loss": 1.2005,
"step": 177
},
{
"epoch": 0.04206794682422452,
"grad_norm": 0.6361984014511108,
"learning_rate": 6.078920983839031e-05,
"loss": 1.4436,
"step": 178
},
{
"epoch": 0.04230428360413589,
"grad_norm": 0.7160913944244385,
"learning_rate": 6.0395584540887963e-05,
"loss": 1.3491,
"step": 179
},
{
"epoch": 0.04254062038404727,
"grad_norm": 0.7092442512512207,
"learning_rate": 6.0001284688802226e-05,
"loss": 1.4114,
"step": 180
},
{
"epoch": 0.04277695716395864,
"grad_norm": 0.6893870830535889,
"learning_rate": 5.960633586768543e-05,
"loss": 1.2432,
"step": 181
},
{
"epoch": 0.04301329394387002,
"grad_norm": 0.701185405254364,
"learning_rate": 5.921076370520058e-05,
"loss": 1.555,
"step": 182
},
{
"epoch": 0.043249630723781386,
"grad_norm": 0.7154824733734131,
"learning_rate": 5.8814593869458455e-05,
"loss": 1.4316,
"step": 183
},
{
"epoch": 0.04348596750369276,
"grad_norm": 0.7668738961219788,
"learning_rate": 5.841785206735192e-05,
"loss": 1.3753,
"step": 184
},
{
"epoch": 0.04372230428360414,
"grad_norm": 0.6547796726226807,
"learning_rate": 5.8020564042888015e-05,
"loss": 1.309,
"step": 185
},
{
"epoch": 0.04395864106351551,
"grad_norm": 0.7471556663513184,
"learning_rate": 5.762275557551727e-05,
"loss": 1.4151,
"step": 186
},
{
"epoch": 0.04419497784342688,
"grad_norm": 0.8444517254829407,
"learning_rate": 5.7224452478461064e-05,
"loss": 1.5483,
"step": 187
},
{
"epoch": 0.044431314623338256,
"grad_norm": 0.7207075357437134,
"learning_rate": 5.682568059703659e-05,
"loss": 1.3984,
"step": 188
},
{
"epoch": 0.04466765140324963,
"grad_norm": 0.7106743454933167,
"learning_rate": 5.642646580697973e-05,
"loss": 1.6566,
"step": 189
},
{
"epoch": 0.044903988183161006,
"grad_norm": 0.7666814923286438,
"learning_rate": 5.602683401276615e-05,
"loss": 1.5597,
"step": 190
},
{
"epoch": 0.04514032496307238,
"grad_norm": 0.8037781715393066,
"learning_rate": 5.562681114593028e-05,
"loss": 1.2949,
"step": 191
},
{
"epoch": 0.04537666174298375,
"grad_norm": 0.8395581245422363,
"learning_rate": 5.522642316338268e-05,
"loss": 1.6436,
"step": 192
},
{
"epoch": 0.045612998522895125,
"grad_norm": 0.7195446491241455,
"learning_rate": 5.482569604572576e-05,
"loss": 1.5842,
"step": 193
},
{
"epoch": 0.0458493353028065,
"grad_norm": 0.7659729719161987,
"learning_rate": 5.442465579556793e-05,
"loss": 1.6308,
"step": 194
},
{
"epoch": 0.046085672082717875,
"grad_norm": 0.8340838551521301,
"learning_rate": 5.402332843583631e-05,
"loss": 1.6474,
"step": 195
},
{
"epoch": 0.046322008862629244,
"grad_norm": 1.0423740148544312,
"learning_rate": 5.3621740008088126e-05,
"loss": 1.8423,
"step": 196
},
{
"epoch": 0.04655834564254062,
"grad_norm": 0.9392973780632019,
"learning_rate": 5.321991657082097e-05,
"loss": 1.716,
"step": 197
},
{
"epoch": 0.046794682422451994,
"grad_norm": 1.356037974357605,
"learning_rate": 5.281788419778187e-05,
"loss": 1.6955,
"step": 198
},
{
"epoch": 0.04703101920236337,
"grad_norm": 1.3172742128372192,
"learning_rate": 5.2415668976275355e-05,
"loss": 1.5057,
"step": 199
},
{
"epoch": 0.047267355982274745,
"grad_norm": 2.301046133041382,
"learning_rate": 5.201329700547076e-05,
"loss": 1.4726,
"step": 200
},
{
"epoch": 0.047267355982274745,
"eval_loss": 1.3950382471084595,
"eval_runtime": 546.6233,
"eval_samples_per_second": 13.038,
"eval_steps_per_second": 3.26,
"step": 200
},
{
"epoch": 0.04750369276218611,
"grad_norm": 0.5470572710037231,
"learning_rate": 5.161079439470866e-05,
"loss": 0.833,
"step": 201
},
{
"epoch": 0.04774002954209749,
"grad_norm": 0.5119298696517944,
"learning_rate": 5.1208187261806615e-05,
"loss": 1.2667,
"step": 202
},
{
"epoch": 0.047976366322008863,
"grad_norm": 0.5891231894493103,
"learning_rate": 5.080550173136457e-05,
"loss": 1.6066,
"step": 203
},
{
"epoch": 0.04821270310192024,
"grad_norm": 0.5852164626121521,
"learning_rate": 5.0402763933069496e-05,
"loss": 1.4913,
"step": 204
},
{
"epoch": 0.04844903988183161,
"grad_norm": 0.5890781283378601,
"learning_rate": 5e-05,
"loss": 1.5169,
"step": 205
},
{
"epoch": 0.04868537666174298,
"grad_norm": 0.6997533440589905,
"learning_rate": 4.9597236066930516e-05,
"loss": 1.3982,
"step": 206
},
{
"epoch": 0.04892171344165436,
"grad_norm": 0.6835668087005615,
"learning_rate": 4.919449826863544e-05,
"loss": 1.4295,
"step": 207
},
{
"epoch": 0.04915805022156573,
"grad_norm": 0.6673969626426697,
"learning_rate": 4.87918127381934e-05,
"loss": 1.5904,
"step": 208
},
{
"epoch": 0.04939438700147711,
"grad_norm": 0.8849208950996399,
"learning_rate": 4.8389205605291365e-05,
"loss": 1.2838,
"step": 209
},
{
"epoch": 0.049630723781388476,
"grad_norm": 0.7788513898849487,
"learning_rate": 4.798670299452926e-05,
"loss": 1.0962,
"step": 210
},
{
"epoch": 0.04986706056129985,
"grad_norm": 0.8474761247634888,
"learning_rate": 4.758433102372466e-05,
"loss": 1.3638,
"step": 211
},
{
"epoch": 0.05010339734121123,
"grad_norm": 0.6527062058448792,
"learning_rate": 4.7182115802218126e-05,
"loss": 1.3278,
"step": 212
},
{
"epoch": 0.0503397341211226,
"grad_norm": 0.9855383038520813,
"learning_rate": 4.678008342917903e-05,
"loss": 0.9405,
"step": 213
},
{
"epoch": 0.05057607090103397,
"grad_norm": 0.6667340993881226,
"learning_rate": 4.6378259991911886e-05,
"loss": 1.3972,
"step": 214
},
{
"epoch": 0.050812407680945346,
"grad_norm": 0.9174965620040894,
"learning_rate": 4.597667156416371e-05,
"loss": 1.3544,
"step": 215
},
{
"epoch": 0.05104874446085672,
"grad_norm": 0.8398842215538025,
"learning_rate": 4.5575344204432084e-05,
"loss": 1.3297,
"step": 216
},
{
"epoch": 0.051285081240768096,
"grad_norm": 0.7070477604866028,
"learning_rate": 4.5174303954274244e-05,
"loss": 1.1856,
"step": 217
},
{
"epoch": 0.05152141802067947,
"grad_norm": 0.7112593650817871,
"learning_rate": 4.477357683661734e-05,
"loss": 1.1494,
"step": 218
},
{
"epoch": 0.05175775480059084,
"grad_norm": 0.6220516562461853,
"learning_rate": 4.437318885406973e-05,
"loss": 1.1729,
"step": 219
},
{
"epoch": 0.051994091580502215,
"grad_norm": 0.7269288301467896,
"learning_rate": 4.397316598723385e-05,
"loss": 1.2121,
"step": 220
},
{
"epoch": 0.05223042836041359,
"grad_norm": 0.6351245641708374,
"learning_rate": 4.3573534193020274e-05,
"loss": 1.0508,
"step": 221
},
{
"epoch": 0.052466765140324965,
"grad_norm": 0.6852203011512756,
"learning_rate": 4.317431940296343e-05,
"loss": 1.6863,
"step": 222
},
{
"epoch": 0.052703101920236334,
"grad_norm": 0.8352505564689636,
"learning_rate": 4.277554752153895e-05,
"loss": 1.3719,
"step": 223
},
{
"epoch": 0.05293943870014771,
"grad_norm": 0.8485846519470215,
"learning_rate": 4.237724442448273e-05,
"loss": 1.0385,
"step": 224
},
{
"epoch": 0.053175775480059084,
"grad_norm": 0.771316647529602,
"learning_rate": 4.197943595711198e-05,
"loss": 1.1393,
"step": 225
},
{
"epoch": 0.05341211225997046,
"grad_norm": 0.6911978721618652,
"learning_rate": 4.1582147932648074e-05,
"loss": 1.2856,
"step": 226
},
{
"epoch": 0.053648449039881835,
"grad_norm": 0.7352108955383301,
"learning_rate": 4.118540613054156e-05,
"loss": 0.9995,
"step": 227
},
{
"epoch": 0.0538847858197932,
"grad_norm": 0.6404459476470947,
"learning_rate": 4.078923629479943e-05,
"loss": 1.3882,
"step": 228
},
{
"epoch": 0.05412112259970458,
"grad_norm": 0.6022409200668335,
"learning_rate": 4.039366413231458e-05,
"loss": 1.3075,
"step": 229
},
{
"epoch": 0.054357459379615954,
"grad_norm": 0.713438868522644,
"learning_rate": 3.9998715311197785e-05,
"loss": 1.2688,
"step": 230
},
{
"epoch": 0.05459379615952733,
"grad_norm": 0.699632465839386,
"learning_rate": 3.960441545911204e-05,
"loss": 1.418,
"step": 231
},
{
"epoch": 0.0548301329394387,
"grad_norm": 0.6836651563644409,
"learning_rate": 3.92107901616097e-05,
"loss": 1.3571,
"step": 232
},
{
"epoch": 0.05506646971935007,
"grad_norm": 0.672203779220581,
"learning_rate": 3.8817864960472236e-05,
"loss": 1.4165,
"step": 233
},
{
"epoch": 0.05530280649926145,
"grad_norm": 0.6799800992012024,
"learning_rate": 3.842566535205286e-05,
"loss": 1.2292,
"step": 234
},
{
"epoch": 0.05553914327917282,
"grad_norm": 0.677742600440979,
"learning_rate": 3.803421678562213e-05,
"loss": 1.3764,
"step": 235
},
{
"epoch": 0.0557754800590842,
"grad_norm": 0.6180285215377808,
"learning_rate": 3.764354466171652e-05,
"loss": 1.3424,
"step": 236
},
{
"epoch": 0.056011816838995566,
"grad_norm": 0.6665123105049133,
"learning_rate": 3.725367433049033e-05,
"loss": 1.1586,
"step": 237
},
{
"epoch": 0.05624815361890694,
"grad_norm": 0.7062758207321167,
"learning_rate": 3.6864631090070655e-05,
"loss": 1.2893,
"step": 238
},
{
"epoch": 0.05648449039881832,
"grad_norm": 0.707490861415863,
"learning_rate": 3.6476440184915815e-05,
"loss": 1.4726,
"step": 239
},
{
"epoch": 0.05672082717872969,
"grad_norm": 0.7802096605300903,
"learning_rate": 3.608912680417737e-05,
"loss": 1.6563,
"step": 240
},
{
"epoch": 0.05695716395864106,
"grad_norm": 0.7431864738464355,
"learning_rate": 3.570271608006555e-05,
"loss": 1.6515,
"step": 241
},
{
"epoch": 0.057193500738552436,
"grad_norm": 0.8141834139823914,
"learning_rate": 3.531723308621847e-05,
"loss": 1.5237,
"step": 242
},
{
"epoch": 0.05742983751846381,
"grad_norm": 0.7511299848556519,
"learning_rate": 3.493270283607522e-05,
"loss": 1.5226,
"step": 243
},
{
"epoch": 0.057666174298375186,
"grad_norm": 0.7921032905578613,
"learning_rate": 3.4549150281252636e-05,
"loss": 1.6995,
"step": 244
},
{
"epoch": 0.05790251107828656,
"grad_norm": 0.7483624815940857,
"learning_rate": 3.4166600309926387e-05,
"loss": 1.5628,
"step": 245
},
{
"epoch": 0.05813884785819793,
"grad_norm": 0.8765662312507629,
"learning_rate": 3.3785077745215873e-05,
"loss": 1.7283,
"step": 246
},
{
"epoch": 0.058375184638109305,
"grad_norm": 0.9644213318824768,
"learning_rate": 3.340460734357359e-05,
"loss": 1.7183,
"step": 247
},
{
"epoch": 0.05861152141802068,
"grad_norm": 1.148491621017456,
"learning_rate": 3.3025213793178646e-05,
"loss": 1.7021,
"step": 248
},
{
"epoch": 0.058847858197932056,
"grad_norm": 1.2919323444366455,
"learning_rate": 3.264692171233485e-05,
"loss": 1.5816,
"step": 249
},
{
"epoch": 0.059084194977843424,
"grad_norm": 1.6092400550842285,
"learning_rate": 3.226975564787322e-05,
"loss": 1.498,
"step": 250
},
{
"epoch": 0.059084194977843424,
"eval_loss": 1.3724737167358398,
"eval_runtime": 546.408,
"eval_samples_per_second": 13.043,
"eval_steps_per_second": 3.261,
"step": 250
},
{
"epoch": 0.0593205317577548,
"grad_norm": 0.5109966993331909,
"learning_rate": 3.189374007355917e-05,
"loss": 1.4638,
"step": 251
},
{
"epoch": 0.059556868537666174,
"grad_norm": 0.6506799459457397,
"learning_rate": 3.151889938850445e-05,
"loss": 1.0217,
"step": 252
},
{
"epoch": 0.05979320531757755,
"grad_norm": 0.515404999256134,
"learning_rate": 3.114525791558398e-05,
"loss": 1.2415,
"step": 253
},
{
"epoch": 0.060029542097488925,
"grad_norm": 0.4935321807861328,
"learning_rate": 3.0772839899857464e-05,
"loss": 1.6383,
"step": 254
},
{
"epoch": 0.06026587887740029,
"grad_norm": 0.4957164227962494,
"learning_rate": 3.0401669506996256e-05,
"loss": 1.6438,
"step": 255
},
{
"epoch": 0.06050221565731167,
"grad_norm": 0.5981006026268005,
"learning_rate": 3.003177082171523e-05,
"loss": 1.3765,
"step": 256
},
{
"epoch": 0.060738552437223044,
"grad_norm": 0.5776561498641968,
"learning_rate": 2.9663167846209998e-05,
"loss": 1.6361,
"step": 257
},
{
"epoch": 0.06097488921713442,
"grad_norm": 0.5799050331115723,
"learning_rate": 2.9295884498599414e-05,
"loss": 1.284,
"step": 258
},
{
"epoch": 0.06121122599704579,
"grad_norm": 0.5518852472305298,
"learning_rate": 2.8929944611373554e-05,
"loss": 1.5062,
"step": 259
},
{
"epoch": 0.06144756277695716,
"grad_norm": 0.6372984647750854,
"learning_rate": 2.8565371929847284e-05,
"loss": 1.4555,
"step": 260
},
{
"epoch": 0.06168389955686854,
"grad_norm": 0.6874483227729797,
"learning_rate": 2.8202190110619493e-05,
"loss": 1.416,
"step": 261
},
{
"epoch": 0.06192023633677991,
"grad_norm": 0.7429825663566589,
"learning_rate": 2.784042272003794e-05,
"loss": 1.3298,
"step": 262
},
{
"epoch": 0.06215657311669129,
"grad_norm": 0.7798938751220703,
"learning_rate": 2.7480093232670158e-05,
"loss": 1.2861,
"step": 263
},
{
"epoch": 0.06239290989660266,
"grad_norm": 0.6920987367630005,
"learning_rate": 2.712122502978024e-05,
"loss": 1.3256,
"step": 264
},
{
"epoch": 0.06262924667651404,
"grad_norm": 0.8484948873519897,
"learning_rate": 2.6763841397811573e-05,
"loss": 1.1311,
"step": 265
},
{
"epoch": 0.0628655834564254,
"grad_norm": 0.7573161721229553,
"learning_rate": 2.64079655268759e-05,
"loss": 1.1854,
"step": 266
},
{
"epoch": 0.06310192023633678,
"grad_norm": 0.6577363610267639,
"learning_rate": 2.605362050924848e-05,
"loss": 1.1889,
"step": 267
},
{
"epoch": 0.06333825701624815,
"grad_norm": 0.7484895586967468,
"learning_rate": 2.57008293378697e-05,
"loss": 1.1099,
"step": 268
},
{
"epoch": 0.06357459379615953,
"grad_norm": 0.7348273992538452,
"learning_rate": 2.534961490485313e-05,
"loss": 1.3144,
"step": 269
},
{
"epoch": 0.0638109305760709,
"grad_norm": 0.6651597619056702,
"learning_rate": 2.500000000000001e-05,
"loss": 1.3081,
"step": 270
},
{
"epoch": 0.06404726735598228,
"grad_norm": 0.9223187565803528,
"learning_rate": 2.4652007309320498e-05,
"loss": 1.0502,
"step": 271
},
{
"epoch": 0.06428360413589365,
"grad_norm": 0.701023280620575,
"learning_rate": 2.430565941356157e-05,
"loss": 1.0347,
"step": 272
},
{
"epoch": 0.06451994091580503,
"grad_norm": 0.754749596118927,
"learning_rate": 2.3960978786741877e-05,
"loss": 0.8906,
"step": 273
},
{
"epoch": 0.0647562776957164,
"grad_norm": 0.6555619835853577,
"learning_rate": 2.361798779469336e-05,
"loss": 1.2904,
"step": 274
},
{
"epoch": 0.06499261447562776,
"grad_norm": 0.679719090461731,
"learning_rate": 2.3276708693609943e-05,
"loss": 1.3425,
"step": 275
},
{
"epoch": 0.06522895125553914,
"grad_norm": 0.7636399269104004,
"learning_rate": 2.2937163628603435e-05,
"loss": 1.5006,
"step": 276
},
{
"epoch": 0.06546528803545051,
"grad_norm": 0.8542468547821045,
"learning_rate": 2.259937463226651e-05,
"loss": 1.3895,
"step": 277
},
{
"epoch": 0.06570162481536189,
"grad_norm": 0.712738037109375,
"learning_rate": 2.2263363623243054e-05,
"loss": 1.3828,
"step": 278
},
{
"epoch": 0.06593796159527326,
"grad_norm": 0.7575670480728149,
"learning_rate": 2.192915240480596e-05,
"loss": 1.1332,
"step": 279
},
{
"epoch": 0.06617429837518464,
"grad_norm": 0.8040823936462402,
"learning_rate": 2.1596762663442218e-05,
"loss": 1.3518,
"step": 280
},
{
"epoch": 0.06641063515509602,
"grad_norm": 0.7066543698310852,
"learning_rate": 2.1266215967445824e-05,
"loss": 1.4215,
"step": 281
},
{
"epoch": 0.06664697193500739,
"grad_norm": 0.6851208209991455,
"learning_rate": 2.0937533765518187e-05,
"loss": 1.3533,
"step": 282
},
{
"epoch": 0.06688330871491877,
"grad_norm": 0.7184422016143799,
"learning_rate": 2.061073738537635e-05,
"loss": 1.366,
"step": 283
},
{
"epoch": 0.06711964549483013,
"grad_norm": 0.7543905973434448,
"learning_rate": 2.0285848032369137e-05,
"loss": 1.2897,
"step": 284
},
{
"epoch": 0.0673559822747415,
"grad_norm": 0.7322332262992859,
"learning_rate": 1.996288678810105e-05,
"loss": 1.3138,
"step": 285
},
{
"epoch": 0.06759231905465288,
"grad_norm": 0.7079530954360962,
"learning_rate": 1.9641874609064443e-05,
"loss": 1.2877,
"step": 286
},
{
"epoch": 0.06782865583456425,
"grad_norm": 0.6339015960693359,
"learning_rate": 1.932283232527956e-05,
"loss": 1.4494,
"step": 287
},
{
"epoch": 0.06806499261447563,
"grad_norm": 0.6862327456474304,
"learning_rate": 1.9005780638942982e-05,
"loss": 1.3859,
"step": 288
},
{
"epoch": 0.068301329394387,
"grad_norm": 0.6487401723861694,
"learning_rate": 1.8690740123084316e-05,
"loss": 1.4005,
"step": 289
},
{
"epoch": 0.06853766617429838,
"grad_norm": 0.69569331407547,
"learning_rate": 1.837773122023114e-05,
"loss": 1.4787,
"step": 290
},
{
"epoch": 0.06877400295420975,
"grad_norm": 0.7482574582099915,
"learning_rate": 1.8066774241082612e-05,
"loss": 1.6109,
"step": 291
},
{
"epoch": 0.06901033973412113,
"grad_norm": 0.7999292016029358,
"learning_rate": 1.7757889363191483e-05,
"loss": 1.3041,
"step": 292
},
{
"epoch": 0.06924667651403249,
"grad_norm": 0.8274068236351013,
"learning_rate": 1.745109662965481e-05,
"loss": 1.5867,
"step": 293
},
{
"epoch": 0.06948301329394387,
"grad_norm": 0.6892622709274292,
"learning_rate": 1.714641594781347e-05,
"loss": 1.662,
"step": 294
},
{
"epoch": 0.06971935007385524,
"grad_norm": 0.7591934204101562,
"learning_rate": 1.684386708796025e-05,
"loss": 1.6833,
"step": 295
},
{
"epoch": 0.06995568685376662,
"grad_norm": 0.8044524192810059,
"learning_rate": 1.6543469682057106e-05,
"loss": 1.707,
"step": 296
},
{
"epoch": 0.07019202363367799,
"grad_norm": 0.8446269035339355,
"learning_rate": 1.62452432224612e-05,
"loss": 1.7677,
"step": 297
},
{
"epoch": 0.07042836041358937,
"grad_norm": 0.9677338004112244,
"learning_rate": 1.5949207060660138e-05,
"loss": 1.6272,
"step": 298
},
{
"epoch": 0.07066469719350074,
"grad_norm": 1.271749496459961,
"learning_rate": 1.5655380406016235e-05,
"loss": 1.5857,
"step": 299
},
{
"epoch": 0.07090103397341212,
"grad_norm": 1.752280831336975,
"learning_rate": 1.536378232452003e-05,
"loss": 1.4372,
"step": 300
},
{
"epoch": 0.07090103397341212,
"eval_loss": 1.3569902181625366,
"eval_runtime": 547.1469,
"eval_samples_per_second": 13.026,
"eval_steps_per_second": 3.257,
"step": 300
},
{
"epoch": 0.07113737075332349,
"grad_norm": 0.5056349039077759,
"learning_rate": 1.5074431737553157e-05,
"loss": 0.909,
"step": 301
},
{
"epoch": 0.07137370753323485,
"grad_norm": 0.6225544214248657,
"learning_rate": 1.4787347420660541e-05,
"loss": 1.0927,
"step": 302
},
{
"epoch": 0.07161004431314623,
"grad_norm": 0.451829195022583,
"learning_rate": 1.4502548002332088e-05,
"loss": 1.2154,
"step": 303
},
{
"epoch": 0.0718463810930576,
"grad_norm": 0.46706512570381165,
"learning_rate": 1.422005196279395e-05,
"loss": 1.5182,
"step": 304
},
{
"epoch": 0.07208271787296898,
"grad_norm": 0.45082706212997437,
"learning_rate": 1.3939877632809278e-05,
"loss": 1.5319,
"step": 305
},
{
"epoch": 0.07231905465288035,
"grad_norm": 0.45447584986686707,
"learning_rate": 1.3662043192488849e-05,
"loss": 1.4201,
"step": 306
},
{
"epoch": 0.07255539143279173,
"grad_norm": 0.4832976758480072,
"learning_rate": 1.338656667011134e-05,
"loss": 1.1821,
"step": 307
},
{
"epoch": 0.0727917282127031,
"grad_norm": 0.5570776462554932,
"learning_rate": 1.3113465940953495e-05,
"loss": 1.4962,
"step": 308
},
{
"epoch": 0.07302806499261448,
"grad_norm": 0.6216040849685669,
"learning_rate": 1.2842758726130283e-05,
"loss": 1.4007,
"step": 309
},
{
"epoch": 0.07326440177252586,
"grad_norm": 0.6087969541549683,
"learning_rate": 1.257446259144494e-05,
"loss": 1.468,
"step": 310
},
{
"epoch": 0.07350073855243722,
"grad_norm": 0.6260071396827698,
"learning_rate": 1.2308594946249163e-05,
"loss": 1.4255,
"step": 311
},
{
"epoch": 0.07373707533234859,
"grad_norm": 0.6277833580970764,
"learning_rate": 1.204517304231343e-05,
"loss": 1.3669,
"step": 312
},
{
"epoch": 0.07397341211225997,
"grad_norm": 0.6244453191757202,
"learning_rate": 1.178421397270758e-05,
"loss": 1.1709,
"step": 313
},
{
"epoch": 0.07420974889217134,
"grad_norm": 0.5879858136177063,
"learning_rate": 1.1525734670691701e-05,
"loss": 1.3037,
"step": 314
},
{
"epoch": 0.07444608567208272,
"grad_norm": 0.8364067077636719,
"learning_rate": 1.1269751908617277e-05,
"loss": 1.1557,
"step": 315
},
{
"epoch": 0.0746824224519941,
"grad_norm": 0.7973691821098328,
"learning_rate": 1.1016282296838887e-05,
"loss": 1.195,
"step": 316
},
{
"epoch": 0.07491875923190547,
"grad_norm": 0.6769034266471863,
"learning_rate": 1.0765342282636416e-05,
"loss": 1.4524,
"step": 317
},
{
"epoch": 0.07515509601181684,
"grad_norm": 0.6845118403434753,
"learning_rate": 1.0516948149147754e-05,
"loss": 1.1724,
"step": 318
},
{
"epoch": 0.07539143279172822,
"grad_norm": 0.6323385238647461,
"learning_rate": 1.0271116014312293e-05,
"loss": 1.3095,
"step": 319
},
{
"epoch": 0.07562776957163958,
"grad_norm": 0.686935544013977,
"learning_rate": 1.0027861829824952e-05,
"loss": 1.2477,
"step": 320
},
{
"epoch": 0.07586410635155096,
"grad_norm": 0.7167879939079285,
"learning_rate": 9.787201380101157e-06,
"loss": 1.4439,
"step": 321
},
{
"epoch": 0.07610044313146233,
"grad_norm": 0.7184543609619141,
"learning_rate": 9.549150281252633e-06,
"loss": 1.4287,
"step": 322
},
{
"epoch": 0.0763367799113737,
"grad_norm": 0.7863267064094543,
"learning_rate": 9.313723980074018e-06,
"loss": 1.0322,
"step": 323
},
{
"epoch": 0.07657311669128508,
"grad_norm": 0.6955685615539551,
"learning_rate": 9.080937753040646e-06,
"loss": 0.968,
"step": 324
},
{
"epoch": 0.07680945347119646,
"grad_norm": 0.6205272674560547,
"learning_rate": 8.850806705317183e-06,
"loss": 1.346,
"step": 325
},
{
"epoch": 0.07704579025110783,
"grad_norm": 0.6382667422294617,
"learning_rate": 8.623345769777514e-06,
"loss": 1.5221,
"step": 326
},
{
"epoch": 0.07728212703101921,
"grad_norm": 0.6864624619483948,
"learning_rate": 8.398569706035792e-06,
"loss": 1.4055,
"step": 327
},
{
"epoch": 0.07751846381093058,
"grad_norm": 0.9323960542678833,
"learning_rate": 8.176493099488663e-06,
"loss": 1.2108,
"step": 328
},
{
"epoch": 0.07775480059084194,
"grad_norm": 0.6769596934318542,
"learning_rate": 7.957130360368898e-06,
"loss": 1.3255,
"step": 329
},
{
"epoch": 0.07799113737075332,
"grad_norm": 0.7400510907173157,
"learning_rate": 7.740495722810271e-06,
"loss": 1.1148,
"step": 330
},
{
"epoch": 0.0782274741506647,
"grad_norm": 0.650111734867096,
"learning_rate": 7.526603243923957e-06,
"loss": 1.2401,
"step": 331
},
{
"epoch": 0.07846381093057607,
"grad_norm": 0.6910921335220337,
"learning_rate": 7.315466802886401e-06,
"loss": 1.4438,
"step": 332
},
{
"epoch": 0.07870014771048744,
"grad_norm": 0.6273283958435059,
"learning_rate": 7.107100100038671e-06,
"loss": 1.3027,
"step": 333
},
{
"epoch": 0.07893648449039882,
"grad_norm": 0.7488106489181519,
"learning_rate": 6.901516655997536e-06,
"loss": 1.5159,
"step": 334
},
{
"epoch": 0.0791728212703102,
"grad_norm": 0.6988032460212708,
"learning_rate": 6.698729810778065e-06,
"loss": 1.3121,
"step": 335
},
{
"epoch": 0.07940915805022157,
"grad_norm": 0.8176699876785278,
"learning_rate": 6.498752722928042e-06,
"loss": 1.3366,
"step": 336
},
{
"epoch": 0.07964549483013295,
"grad_norm": 0.7137824892997742,
"learning_rate": 6.301598368674105e-06,
"loss": 1.4861,
"step": 337
},
{
"epoch": 0.07988183161004431,
"grad_norm": 0.8342055678367615,
"learning_rate": 6.107279541079769e-06,
"loss": 1.4292,
"step": 338
},
{
"epoch": 0.08011816838995568,
"grad_norm": 0.7024268507957458,
"learning_rate": 5.915808849215304e-06,
"loss": 1.4164,
"step": 339
},
{
"epoch": 0.08035450516986706,
"grad_norm": 0.7405518293380737,
"learning_rate": 5.727198717339511e-06,
"loss": 1.4451,
"step": 340
},
{
"epoch": 0.08059084194977843,
"grad_norm": 0.8962257504463196,
"learning_rate": 5.54146138409355e-06,
"loss": 1.285,
"step": 341
},
{
"epoch": 0.08082717872968981,
"grad_norm": 0.7109900712966919,
"learning_rate": 5.358608901706802e-06,
"loss": 1.4931,
"step": 342
},
{
"epoch": 0.08106351550960118,
"grad_norm": 0.8523017168045044,
"learning_rate": 5.178653135214812e-06,
"loss": 1.4101,
"step": 343
},
{
"epoch": 0.08129985228951256,
"grad_norm": 0.6992009878158569,
"learning_rate": 5.001605761689398e-06,
"loss": 1.7812,
"step": 344
},
{
"epoch": 0.08153618906942393,
"grad_norm": 0.7525827288627625,
"learning_rate": 4.827478269480895e-06,
"loss": 1.6047,
"step": 345
},
{
"epoch": 0.08177252584933531,
"grad_norm": 0.7274166345596313,
"learning_rate": 4.65628195747273e-06,
"loss": 1.655,
"step": 346
},
{
"epoch": 0.08200886262924667,
"grad_norm": 0.8694523572921753,
"learning_rate": 4.488027934348271e-06,
"loss": 1.6647,
"step": 347
},
{
"epoch": 0.08224519940915805,
"grad_norm": 0.977834165096283,
"learning_rate": 4.322727117869951e-06,
"loss": 1.6009,
"step": 348
},
{
"epoch": 0.08248153618906942,
"grad_norm": 1.1253348588943481,
"learning_rate": 4.16039023417088e-06,
"loss": 1.6383,
"step": 349
},
{
"epoch": 0.0827178729689808,
"grad_norm": 1.2942062616348267,
"learning_rate": 4.001027817058789e-06,
"loss": 1.4725,
"step": 350
},
{
"epoch": 0.0827178729689808,
"eval_loss": 1.3468055725097656,
"eval_runtime": 546.0894,
"eval_samples_per_second": 13.051,
"eval_steps_per_second": 3.263,
"step": 350
}
],
"logging_steps": 1,
"max_steps": 400,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.321281649026007e+17,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}