abaddon182's picture
Training in progress, step 200, checkpoint
2ae0827 verified
Raw History Blame
36.9 kB
{
"best_metric": 0.3646468222141266,
"best_model_checkpoint": "miner_id_24/checkpoint-200",
"epoch": 0.008380122349786306,
"eval_steps": 50,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 4.1900611748931536e-05,
"grad_norm": 12.401717185974121,
"learning_rate": 1e-05,
"loss": 2.061,
"step": 1
},
{
"epoch": 4.1900611748931536e-05,
"eval_loss": 2.11004638671875,
"eval_runtime": 692.2473,
"eval_samples_per_second": 58.066,
"eval_steps_per_second": 14.516,
"step": 1
},
{
"epoch": 8.380122349786307e-05,
"grad_norm": 12.52931022644043,
"learning_rate": 2e-05,
"loss": 2.0749,
"step": 2
},
{
"epoch": 0.00012570183524679462,
"grad_norm": 11.506692886352539,
"learning_rate": 3e-05,
"loss": 2.0324,
"step": 3
},
{
"epoch": 0.00016760244699572614,
"grad_norm": 8.164826393127441,
"learning_rate": 4e-05,
"loss": 1.7553,
"step": 4
},
{
"epoch": 0.00020950305874465767,
"grad_norm": 6.681891441345215,
"learning_rate": 5e-05,
"loss": 1.4661,
"step": 5
},
{
"epoch": 0.00025140367049358923,
"grad_norm": 4.889027118682861,
"learning_rate": 6e-05,
"loss": 1.2743,
"step": 6
},
{
"epoch": 0.00029330428224252073,
"grad_norm": 3.842980146408081,
"learning_rate": 7e-05,
"loss": 1.1415,
"step": 7
},
{
"epoch": 0.0003352048939914523,
"grad_norm": 2.804058313369751,
"learning_rate": 8e-05,
"loss": 1.0483,
"step": 8
},
{
"epoch": 0.0003771055057403838,
"grad_norm": 3.046818971633911,
"learning_rate": 9e-05,
"loss": 0.938,
"step": 9
},
{
"epoch": 0.00041900611748931535,
"grad_norm": 4.104994773864746,
"learning_rate": 0.0001,
"loss": 0.9117,
"step": 10
},
{
"epoch": 0.0004609067292382469,
"grad_norm": 2.3753490447998047,
"learning_rate": 9.999316524962345e-05,
"loss": 0.866,
"step": 11
},
{
"epoch": 0.0005028073409871785,
"grad_norm": 2.4568893909454346,
"learning_rate": 9.997266286704631e-05,
"loss": 0.8204,
"step": 12
},
{
"epoch": 0.0005447079527361099,
"grad_norm": 1.7458099126815796,
"learning_rate": 9.993849845741524e-05,
"loss": 0.7604,
"step": 13
},
{
"epoch": 0.0005866085644850415,
"grad_norm": 6.724311351776123,
"learning_rate": 9.989068136093873e-05,
"loss": 0.8606,
"step": 14
},
{
"epoch": 0.000628509176233973,
"grad_norm": 4.7568159103393555,
"learning_rate": 9.98292246503335e-05,
"loss": 0.7796,
"step": 15
},
{
"epoch": 0.0006704097879829046,
"grad_norm": 1.8319369554519653,
"learning_rate": 9.975414512725057e-05,
"loss": 0.7134,
"step": 16
},
{
"epoch": 0.0007123103997318361,
"grad_norm": 2.7333900928497314,
"learning_rate": 9.966546331768191e-05,
"loss": 0.705,
"step": 17
},
{
"epoch": 0.0007542110114807676,
"grad_norm": 2.1540844440460205,
"learning_rate": 9.956320346634876e-05,
"loss": 0.7115,
"step": 18
},
{
"epoch": 0.0007961116232296991,
"grad_norm": 1.64785635471344,
"learning_rate": 9.944739353007344e-05,
"loss": 0.6477,
"step": 19
},
{
"epoch": 0.0008380122349786307,
"grad_norm": 2.0590991973876953,
"learning_rate": 9.931806517013612e-05,
"loss": 0.626,
"step": 20
},
{
"epoch": 0.0008799128467275623,
"grad_norm": 2.685298442840576,
"learning_rate": 9.917525374361912e-05,
"loss": 0.6309,
"step": 21
},
{
"epoch": 0.0009218134584764938,
"grad_norm": 1.4915673732757568,
"learning_rate": 9.901899829374047e-05,
"loss": 0.6027,
"step": 22
},
{
"epoch": 0.0009637140702254253,
"grad_norm": 1.5001156330108643,
"learning_rate": 9.884934153917997e-05,
"loss": 0.6043,
"step": 23
},
{
"epoch": 0.001005614681974357,
"grad_norm": 1.620923399925232,
"learning_rate": 9.86663298624003e-05,
"loss": 0.5616,
"step": 24
},
{
"epoch": 0.0010475152937232883,
"grad_norm": 1.9177049398422241,
"learning_rate": 9.847001329696653e-05,
"loss": 0.5861,
"step": 25
},
{
"epoch": 0.0010894159054722198,
"grad_norm": 2.3297927379608154,
"learning_rate": 9.826044551386744e-05,
"loss": 0.5632,
"step": 26
},
{
"epoch": 0.0011313165172211514,
"grad_norm": 1.8214315176010132,
"learning_rate": 9.803768380684242e-05,
"loss": 0.5403,
"step": 27
},
{
"epoch": 0.001173217128970083,
"grad_norm": 1.155811071395874,
"learning_rate": 9.780178907671789e-05,
"loss": 0.4964,
"step": 28
},
{
"epoch": 0.0012151177407190145,
"grad_norm": 1.4073199033737183,
"learning_rate": 9.755282581475769e-05,
"loss": 0.4767,
"step": 29
},
{
"epoch": 0.001257018352467946,
"grad_norm": 1.3528127670288086,
"learning_rate": 9.729086208503174e-05,
"loss": 0.4711,
"step": 30
},
{
"epoch": 0.0012989189642168776,
"grad_norm": 1.9988888502120972,
"learning_rate": 9.701596950580806e-05,
"loss": 0.5098,
"step": 31
},
{
"epoch": 0.0013408195759658092,
"grad_norm": 1.3981701135635376,
"learning_rate": 9.672822322997305e-05,
"loss": 0.457,
"step": 32
},
{
"epoch": 0.0013827201877147407,
"grad_norm": 1.3816455602645874,
"learning_rate": 9.642770192448536e-05,
"loss": 0.4554,
"step": 33
},
{
"epoch": 0.0014246207994636723,
"grad_norm": 1.7540465593338013,
"learning_rate": 9.611448774886924e-05,
"loss": 0.4801,
"step": 34
},
{
"epoch": 0.0014665214112126036,
"grad_norm": 1.3476214408874512,
"learning_rate": 9.578866633275288e-05,
"loss": 0.4531,
"step": 35
},
{
"epoch": 0.0015084220229615352,
"grad_norm": 1.5144597291946411,
"learning_rate": 9.545032675245813e-05,
"loss": 0.455,
"step": 36
},
{
"epoch": 0.0015503226347104667,
"grad_norm": 1.5056521892547607,
"learning_rate": 9.509956150664796e-05,
"loss": 0.4432,
"step": 37
},
{
"epoch": 0.0015922232464593983,
"grad_norm": 0.9943171143531799,
"learning_rate": 9.473646649103818e-05,
"loss": 0.4233,
"step": 38
},
{
"epoch": 0.0016341238582083298,
"grad_norm": 1.269155740737915,
"learning_rate": 9.43611409721806e-05,
"loss": 0.4383,
"step": 39
},
{
"epoch": 0.0016760244699572614,
"grad_norm": 0.78570556640625,
"learning_rate": 9.397368756032445e-05,
"loss": 0.4268,
"step": 40
},
{
"epoch": 0.001717925081706193,
"grad_norm": 1.1826995611190796,
"learning_rate": 9.357421218136386e-05,
"loss": 0.4396,
"step": 41
},
{
"epoch": 0.0017598256934551245,
"grad_norm": 1.1438935995101929,
"learning_rate": 9.316282404787871e-05,
"loss": 0.4056,
"step": 42
},
{
"epoch": 0.001801726305204056,
"grad_norm": 1.2345468997955322,
"learning_rate": 9.273963562927695e-05,
"loss": 0.4194,
"step": 43
},
{
"epoch": 0.0018436269169529876,
"grad_norm": 0.8941552042961121,
"learning_rate": 9.230476262104677e-05,
"loss": 0.3862,
"step": 44
},
{
"epoch": 0.001885527528701919,
"grad_norm": 0.8636603355407715,
"learning_rate": 9.185832391312644e-05,
"loss": 0.4137,
"step": 45
},
{
"epoch": 0.0019274281404508505,
"grad_norm": 1.251181721687317,
"learning_rate": 9.140044155740101e-05,
"loss": 0.416,
"step": 46
},
{
"epoch": 0.0019693287521997823,
"grad_norm": 1.2790541648864746,
"learning_rate": 9.093124073433463e-05,
"loss": 0.3989,
"step": 47
},
{
"epoch": 0.002011229363948714,
"grad_norm": 0.7371829152107239,
"learning_rate": 9.045084971874738e-05,
"loss": 0.4066,
"step": 48
},
{
"epoch": 0.0020531299756976454,
"grad_norm": 0.8136070966720581,
"learning_rate": 8.995939984474624e-05,
"loss": 0.4134,
"step": 49
},
{
"epoch": 0.0020950305874465765,
"grad_norm": 1.1840046644210815,
"learning_rate": 8.945702546981969e-05,
"loss": 0.4251,
"step": 50
},
{
"epoch": 0.0020950305874465765,
"eval_loss": 0.4079367518424988,
"eval_runtime": 692.3157,
"eval_samples_per_second": 58.06,
"eval_steps_per_second": 14.515,
"step": 50
},
{
"epoch": 0.002136931199195508,
"grad_norm": 1.161297082901001,
"learning_rate": 8.894386393810563e-05,
"loss": 0.4142,
"step": 51
},
{
"epoch": 0.0021788318109444396,
"grad_norm": 1.1976879835128784,
"learning_rate": 8.842005554284296e-05,
"loss": 0.4044,
"step": 52
},
{
"epoch": 0.002220732422693371,
"grad_norm": 0.7049624919891357,
"learning_rate": 8.788574348801675e-05,
"loss": 0.3883,
"step": 53
},
{
"epoch": 0.0022626330344423027,
"grad_norm": 0.7691147327423096,
"learning_rate": 8.73410738492077e-05,
"loss": 0.4064,
"step": 54
},
{
"epoch": 0.0023045336461912343,
"grad_norm": 1.1453278064727783,
"learning_rate": 8.678619553365659e-05,
"loss": 0.4126,
"step": 55
},
{
"epoch": 0.002346434257940166,
"grad_norm": 0.7199950218200684,
"learning_rate": 8.622126023955446e-05,
"loss": 0.3924,
"step": 56
},
{
"epoch": 0.0023883348696890974,
"grad_norm": 0.9202678203582764,
"learning_rate": 8.564642241456986e-05,
"loss": 0.3932,
"step": 57
},
{
"epoch": 0.002430235481438029,
"grad_norm": 0.7786675095558167,
"learning_rate": 8.506183921362443e-05,
"loss": 0.3985,
"step": 58
},
{
"epoch": 0.0024721360931869605,
"grad_norm": 0.7222663164138794,
"learning_rate": 8.44676704559283e-05,
"loss": 0.3705,
"step": 59
},
{
"epoch": 0.002514036704935892,
"grad_norm": 1.0414471626281738,
"learning_rate": 8.386407858128706e-05,
"loss": 0.3923,
"step": 60
},
{
"epoch": 0.0025559373166848236,
"grad_norm": 0.953230082988739,
"learning_rate": 8.32512286056924e-05,
"loss": 0.3928,
"step": 61
},
{
"epoch": 0.002597837928433755,
"grad_norm": 0.7045029997825623,
"learning_rate": 8.262928807620843e-05,
"loss": 0.3899,
"step": 62
},
{
"epoch": 0.0026397385401826868,
"grad_norm": 0.5819854140281677,
"learning_rate": 8.199842702516583e-05,
"loss": 0.3722,
"step": 63
},
{
"epoch": 0.0026816391519316183,
"grad_norm": 0.6675421595573425,
"learning_rate": 8.135881792367686e-05,
"loss": 0.3885,
"step": 64
},
{
"epoch": 0.00272353976368055,
"grad_norm": 0.5888473987579346,
"learning_rate": 8.07106356344834e-05,
"loss": 0.3793,
"step": 65
},
{
"epoch": 0.0027654403754294814,
"grad_norm": 0.6285983920097351,
"learning_rate": 8.005405736415126e-05,
"loss": 0.3713,
"step": 66
},
{
"epoch": 0.002807340987178413,
"grad_norm": 0.5629648566246033,
"learning_rate": 7.938926261462366e-05,
"loss": 0.3762,
"step": 67
},
{
"epoch": 0.0028492415989273445,
"grad_norm": 0.8168434500694275,
"learning_rate": 7.871643313414718e-05,
"loss": 0.3882,
"step": 68
},
{
"epoch": 0.0028911422106762757,
"grad_norm": 0.8386833071708679,
"learning_rate": 7.803575286758364e-05,
"loss": 0.3925,
"step": 69
},
{
"epoch": 0.0029330428224252072,
"grad_norm": 0.6754161715507507,
"learning_rate": 7.734740790612136e-05,
"loss": 0.3858,
"step": 70
},
{
"epoch": 0.0029749434341741388,
"grad_norm": 0.5120207667350769,
"learning_rate": 7.66515864363997e-05,
"loss": 0.3717,
"step": 71
},
{
"epoch": 0.0030168440459230703,
"grad_norm": 0.5557418465614319,
"learning_rate": 7.594847868906076e-05,
"loss": 0.3718,
"step": 72
},
{
"epoch": 0.003058744657672002,
"grad_norm": 0.8242805004119873,
"learning_rate": 7.52382768867422e-05,
"loss": 0.378,
"step": 73
},
{
"epoch": 0.0031006452694209334,
"grad_norm": 0.5544095635414124,
"learning_rate": 7.452117519152542e-05,
"loss": 0.3855,
"step": 74
},
{
"epoch": 0.003142545881169865,
"grad_norm": 0.46886885166168213,
"learning_rate": 7.379736965185368e-05,
"loss": 0.381,
"step": 75
},
{
"epoch": 0.0031844464929187966,
"grad_norm": 0.46993863582611084,
"learning_rate": 7.30670581489344e-05,
"loss": 0.3642,
"step": 76
},
{
"epoch": 0.003226347104667728,
"grad_norm": 0.48749837279319763,
"learning_rate": 7.233044034264034e-05,
"loss": 0.365,
"step": 77
},
{
"epoch": 0.0032682477164166597,
"grad_norm": 0.6306229829788208,
"learning_rate": 7.158771761692464e-05,
"loss": 0.3683,
"step": 78
},
{
"epoch": 0.0033101483281655912,
"grad_norm": 0.8397689461708069,
"learning_rate": 7.083909302476453e-05,
"loss": 0.3828,
"step": 79
},
{
"epoch": 0.0033520489399145228,
"grad_norm": 0.614453136920929,
"learning_rate": 7.008477123264848e-05,
"loss": 0.3867,
"step": 80
},
{
"epoch": 0.0033939495516634543,
"grad_norm": 0.49757665395736694,
"learning_rate": 6.932495846462261e-05,
"loss": 0.3801,
"step": 81
},
{
"epoch": 0.003435850163412386,
"grad_norm": 0.4922657310962677,
"learning_rate": 6.855986244591104e-05,
"loss": 0.3729,
"step": 82
},
{
"epoch": 0.0034777507751613175,
"grad_norm": 0.5341781377792358,
"learning_rate": 6.778969234612584e-05,
"loss": 0.3788,
"step": 83
},
{
"epoch": 0.003519651386910249,
"grad_norm": 0.5263535380363464,
"learning_rate": 6.701465872208216e-05,
"loss": 0.3688,
"step": 84
},
{
"epoch": 0.0035615519986591806,
"grad_norm": 0.49736541509628296,
"learning_rate": 6.623497346023418e-05,
"loss": 0.3621,
"step": 85
},
{
"epoch": 0.003603452610408112,
"grad_norm": 0.6529773473739624,
"learning_rate": 6.545084971874738e-05,
"loss": 0.377,
"step": 86
},
{
"epoch": 0.0036453532221570437,
"grad_norm": 0.5781784653663635,
"learning_rate": 6.466250186922325e-05,
"loss": 0.3622,
"step": 87
},
{
"epoch": 0.0036872538339059752,
"grad_norm": 0.46664315462112427,
"learning_rate": 6.387014543809223e-05,
"loss": 0.3768,
"step": 88
},
{
"epoch": 0.0037291544456549064,
"grad_norm": 0.40756192803382874,
"learning_rate": 6.307399704769099e-05,
"loss": 0.3637,
"step": 89
},
{
"epoch": 0.003771055057403838,
"grad_norm": 0.3784383237361908,
"learning_rate": 6.227427435703997e-05,
"loss": 0.3657,
"step": 90
},
{
"epoch": 0.0038129556691527695,
"grad_norm": 0.8758529424667358,
"learning_rate": 6.147119600233758e-05,
"loss": 0.3745,
"step": 91
},
{
"epoch": 0.003854856280901701,
"grad_norm": 0.3926626741886139,
"learning_rate": 6.066498153718735e-05,
"loss": 0.37,
"step": 92
},
{
"epoch": 0.0038967568926506326,
"grad_norm": 0.3462725579738617,
"learning_rate": 5.985585137257401e-05,
"loss": 0.374,
"step": 93
},
{
"epoch": 0.003938657504399565,
"grad_norm": 0.39854007959365845,
"learning_rate": 5.90440267166055e-05,
"loss": 0.3665,
"step": 94
},
{
"epoch": 0.003980558116148496,
"grad_norm": 1.051824688911438,
"learning_rate": 5.8229729514036705e-05,
"loss": 0.4037,
"step": 95
},
{
"epoch": 0.004022458727897428,
"grad_norm": 0.41116276383399963,
"learning_rate": 5.74131823855921e-05,
"loss": 0.3734,
"step": 96
},
{
"epoch": 0.004064359339646359,
"grad_norm": 0.6195436120033264,
"learning_rate": 5.6594608567103456e-05,
"loss": 0.3706,
"step": 97
},
{
"epoch": 0.004106259951395291,
"grad_norm": 0.42274677753448486,
"learning_rate": 5.577423184847932e-05,
"loss": 0.3623,
"step": 98
},
{
"epoch": 0.004148160563144222,
"grad_norm": 0.5260018706321716,
"learning_rate": 5.495227651252315e-05,
"loss": 0.3814,
"step": 99
},
{
"epoch": 0.004190061174893153,
"grad_norm": 0.5149572491645813,
"learning_rate": 5.4128967273616625e-05,
"loss": 0.385,
"step": 100
},
{
"epoch": 0.004190061174893153,
"eval_loss": 0.3764027953147888,
"eval_runtime": 692.9373,
"eval_samples_per_second": 58.008,
"eval_steps_per_second": 14.502,
"step": 100
},
{
"epoch": 0.004231961786642085,
"grad_norm": 0.6027266383171082,
"learning_rate": 5.330452921628497e-05,
"loss": 0.3808,
"step": 101
},
{
"epoch": 0.004273862398391016,
"grad_norm": 0.4798916280269623,
"learning_rate": 5.247918773366112e-05,
"loss": 0.3603,
"step": 102
},
{
"epoch": 0.004315763010139948,
"grad_norm": 0.7150884866714478,
"learning_rate": 5.165316846586541e-05,
"loss": 0.3881,
"step": 103
},
{
"epoch": 0.004357663621888879,
"grad_norm": 0.3941900432109833,
"learning_rate": 5.0826697238317935e-05,
"loss": 0.3736,
"step": 104
},
{
"epoch": 0.004399564233637811,
"grad_norm": 0.46804314851760864,
"learning_rate": 5e-05,
"loss": 0.3802,
"step": 105
},
{
"epoch": 0.004441464845386742,
"grad_norm": 0.3976142108440399,
"learning_rate": 4.917330276168208e-05,
"loss": 0.3802,
"step": 106
},
{
"epoch": 0.004483365457135674,
"grad_norm": 0.47338852286338806,
"learning_rate": 4.834683153413459e-05,
"loss": 0.3784,
"step": 107
},
{
"epoch": 0.0045252660688846055,
"grad_norm": 0.4946283996105194,
"learning_rate": 4.7520812266338885e-05,
"loss": 0.3702,
"step": 108
},
{
"epoch": 0.0045671666806335375,
"grad_norm": 0.46376827359199524,
"learning_rate": 4.669547078371504e-05,
"loss": 0.3723,
"step": 109
},
{
"epoch": 0.004609067292382469,
"grad_norm": 0.4808342754840851,
"learning_rate": 4.5871032726383386e-05,
"loss": 0.362,
"step": 110
},
{
"epoch": 0.004650967904131401,
"grad_norm": 0.41980302333831787,
"learning_rate": 4.504772348747687e-05,
"loss": 0.3745,
"step": 111
},
{
"epoch": 0.004692868515880332,
"grad_norm": 0.41989701986312866,
"learning_rate": 4.4225768151520694e-05,
"loss": 0.3772,
"step": 112
},
{
"epoch": 0.004734769127629264,
"grad_norm": 0.44435012340545654,
"learning_rate": 4.3405391432896555e-05,
"loss": 0.3841,
"step": 113
},
{
"epoch": 0.004776669739378195,
"grad_norm": 0.4629721939563751,
"learning_rate": 4.2586817614407895e-05,
"loss": 0.3728,
"step": 114
},
{
"epoch": 0.004818570351127127,
"grad_norm": 0.42354342341423035,
"learning_rate": 4.17702704859633e-05,
"loss": 0.36,
"step": 115
},
{
"epoch": 0.004860470962876058,
"grad_norm": 0.44069820642471313,
"learning_rate": 4.095597328339452e-05,
"loss": 0.3694,
"step": 116
},
{
"epoch": 0.00490237157462499,
"grad_norm": 0.3773685693740845,
"learning_rate": 4.0144148627425993e-05,
"loss": 0.3663,
"step": 117
},
{
"epoch": 0.004944272186373921,
"grad_norm": 0.4707624018192291,
"learning_rate": 3.933501846281267e-05,
"loss": 0.3601,
"step": 118
},
{
"epoch": 0.004986172798122852,
"grad_norm": 0.45369499921798706,
"learning_rate": 3.852880399766243e-05,
"loss": 0.3699,
"step": 119
},
{
"epoch": 0.005028073409871784,
"grad_norm": 0.4905252158641815,
"learning_rate": 3.772572564296005e-05,
"loss": 0.3649,
"step": 120
},
{
"epoch": 0.005069974021620715,
"grad_norm": 0.4178149104118347,
"learning_rate": 3.6926002952309016e-05,
"loss": 0.3607,
"step": 121
},
{
"epoch": 0.005111874633369647,
"grad_norm": 0.7921212315559387,
"learning_rate": 3.612985456190778e-05,
"loss": 0.3804,
"step": 122
},
{
"epoch": 0.005153775245118578,
"grad_norm": 0.4230062663555145,
"learning_rate": 3.533749813077677e-05,
"loss": 0.3662,
"step": 123
},
{
"epoch": 0.00519567585686751,
"grad_norm": 0.3610653281211853,
"learning_rate": 3.4549150281252636e-05,
"loss": 0.365,
"step": 124
},
{
"epoch": 0.0052375764686164415,
"grad_norm": 0.37206318974494934,
"learning_rate": 3.3765026539765834e-05,
"loss": 0.3642,
"step": 125
},
{
"epoch": 0.0052794770803653735,
"grad_norm": 0.3862723708152771,
"learning_rate": 3.298534127791785e-05,
"loss": 0.3688,
"step": 126
},
{
"epoch": 0.005321377692114305,
"grad_norm": 0.6313711404800415,
"learning_rate": 3.221030765387417e-05,
"loss": 0.3804,
"step": 127
},
{
"epoch": 0.005363278303863237,
"grad_norm": 0.3333760201931,
"learning_rate": 3.144013755408895e-05,
"loss": 0.3583,
"step": 128
},
{
"epoch": 0.005405178915612168,
"grad_norm": 0.3670137822628021,
"learning_rate": 3.0675041535377405e-05,
"loss": 0.3686,
"step": 129
},
{
"epoch": 0.0054470795273611,
"grad_norm": 0.3866000175476074,
"learning_rate": 2.991522876735154e-05,
"loss": 0.363,
"step": 130
},
{
"epoch": 0.005488980139110031,
"grad_norm": 0.45716607570648193,
"learning_rate": 2.916090697523549e-05,
"loss": 0.3602,
"step": 131
},
{
"epoch": 0.005530880750858963,
"grad_norm": 0.38701626658439636,
"learning_rate": 2.8412282383075363e-05,
"loss": 0.3688,
"step": 132
},
{
"epoch": 0.005572781362607894,
"grad_norm": 0.3579891324043274,
"learning_rate": 2.766955965735968e-05,
"loss": 0.3595,
"step": 133
},
{
"epoch": 0.005614681974356826,
"grad_norm": 0.4002384841442108,
"learning_rate": 2.693294185106562e-05,
"loss": 0.3617,
"step": 134
},
{
"epoch": 0.005656582586105757,
"grad_norm": 0.3796548843383789,
"learning_rate": 2.6202630348146324e-05,
"loss": 0.3752,
"step": 135
},
{
"epoch": 0.005698483197854689,
"grad_norm": 0.3744058907032013,
"learning_rate": 2.547882480847461e-05,
"loss": 0.3697,
"step": 136
},
{
"epoch": 0.00574038380960362,
"grad_norm": 0.3978886306285858,
"learning_rate": 2.476172311325783e-05,
"loss": 0.3671,
"step": 137
},
{
"epoch": 0.005782284421352551,
"grad_norm": 0.36514753103256226,
"learning_rate": 2.405152131093926e-05,
"loss": 0.3698,
"step": 138
},
{
"epoch": 0.005824185033101483,
"grad_norm": 0.4446398913860321,
"learning_rate": 2.3348413563600325e-05,
"loss": 0.3562,
"step": 139
},
{
"epoch": 0.0058660856448504144,
"grad_norm": 0.6335402727127075,
"learning_rate": 2.2652592093878666e-05,
"loss": 0.3711,
"step": 140
},
{
"epoch": 0.005907986256599346,
"grad_norm": 0.39303654432296753,
"learning_rate": 2.196424713241637e-05,
"loss": 0.3612,
"step": 141
},
{
"epoch": 0.0059498868683482775,
"grad_norm": 0.458608478307724,
"learning_rate": 2.128356686585282e-05,
"loss": 0.3657,
"step": 142
},
{
"epoch": 0.0059917874800972095,
"grad_norm": 0.33949828147888184,
"learning_rate": 2.061073738537635e-05,
"loss": 0.3651,
"step": 143
},
{
"epoch": 0.006033688091846141,
"grad_norm": 0.41564124822616577,
"learning_rate": 1.9945942635848748e-05,
"loss": 0.3564,
"step": 144
},
{
"epoch": 0.006075588703595073,
"grad_norm": 0.4284324049949646,
"learning_rate": 1.928936436551661e-05,
"loss": 0.3699,
"step": 145
},
{
"epoch": 0.006117489315344004,
"grad_norm": 0.5253200531005859,
"learning_rate": 1.8641182076323148e-05,
"loss": 0.3781,
"step": 146
},
{
"epoch": 0.006159389927092936,
"grad_norm": 0.3606500029563904,
"learning_rate": 1.800157297483417e-05,
"loss": 0.3694,
"step": 147
},
{
"epoch": 0.006201290538841867,
"grad_norm": 0.32398709654808044,
"learning_rate": 1.7370711923791567e-05,
"loss": 0.3786,
"step": 148
},
{
"epoch": 0.006243191150590799,
"grad_norm": 0.4401916265487671,
"learning_rate": 1.6748771394307585e-05,
"loss": 0.3932,
"step": 149
},
{
"epoch": 0.00628509176233973,
"grad_norm": 0.48635241389274597,
"learning_rate": 1.6135921418712956e-05,
"loss": 0.3987,
"step": 150
},
{
"epoch": 0.00628509176233973,
"eval_loss": 0.36657968163490295,
"eval_runtime": 692.7293,
"eval_samples_per_second": 58.026,
"eval_steps_per_second": 14.506,
"step": 150
},
{
"epoch": 0.006326992374088662,
"grad_norm": 0.3790470063686371,
"learning_rate": 1.553232954407171e-05,
"loss": 0.3643,
"step": 151
},
{
"epoch": 0.006368892985837593,
"grad_norm": 0.4393303692340851,
"learning_rate": 1.4938160786375572e-05,
"loss": 0.3707,
"step": 152
},
{
"epoch": 0.006410793597586525,
"grad_norm": 0.3993956446647644,
"learning_rate": 1.435357758543015e-05,
"loss": 0.3618,
"step": 153
},
{
"epoch": 0.006452694209335456,
"grad_norm": 0.3912157118320465,
"learning_rate": 1.3778739760445552e-05,
"loss": 0.3621,
"step": 154
},
{
"epoch": 0.006494594821084388,
"grad_norm": 0.40146297216415405,
"learning_rate": 1.3213804466343421e-05,
"loss": 0.3607,
"step": 155
},
{
"epoch": 0.006536495432833319,
"grad_norm": 0.3602310121059418,
"learning_rate": 1.2658926150792322e-05,
"loss": 0.3631,
"step": 156
},
{
"epoch": 0.006578396044582251,
"grad_norm": 0.35525843501091003,
"learning_rate": 1.2114256511983274e-05,
"loss": 0.3577,
"step": 157
},
{
"epoch": 0.0066202966563311825,
"grad_norm": 0.518125057220459,
"learning_rate": 1.157994445715706e-05,
"loss": 0.3728,
"step": 158
},
{
"epoch": 0.006662197268080114,
"grad_norm": 0.38681668043136597,
"learning_rate": 1.1056136061894384e-05,
"loss": 0.3642,
"step": 159
},
{
"epoch": 0.0067040978798290456,
"grad_norm": 0.7894763946533203,
"learning_rate": 1.0542974530180327e-05,
"loss": 0.3822,
"step": 160
},
{
"epoch": 0.006745998491577977,
"grad_norm": 0.4261036515235901,
"learning_rate": 1.0040600155253765e-05,
"loss": 0.3767,
"step": 161
},
{
"epoch": 0.006787899103326909,
"grad_norm": 0.37567344307899475,
"learning_rate": 9.549150281252633e-06,
"loss": 0.3727,
"step": 162
},
{
"epoch": 0.00682979971507584,
"grad_norm": 0.37848037481307983,
"learning_rate": 9.068759265665384e-06,
"loss": 0.3578,
"step": 163
},
{
"epoch": 0.006871700326824772,
"grad_norm": 0.3375943601131439,
"learning_rate": 8.599558442598998e-06,
"loss": 0.3659,
"step": 164
},
{
"epoch": 0.006913600938573703,
"grad_norm": 0.3530254364013672,
"learning_rate": 8.141676086873572e-06,
"loss": 0.3587,
"step": 165
},
{
"epoch": 0.006955501550322635,
"grad_norm": 0.3661386966705322,
"learning_rate": 7.695237378953223e-06,
"loss": 0.3707,
"step": 166
},
{
"epoch": 0.006997402162071566,
"grad_norm": 0.3463679254055023,
"learning_rate": 7.260364370723044e-06,
"loss": 0.3644,
"step": 167
},
{
"epoch": 0.007039302773820498,
"grad_norm": 0.3842766582965851,
"learning_rate": 6.837175952121306e-06,
"loss": 0.3617,
"step": 168
},
{
"epoch": 0.007081203385569429,
"grad_norm": 0.44086405634880066,
"learning_rate": 6.425787818636131e-06,
"loss": 0.3583,
"step": 169
},
{
"epoch": 0.007123103997318361,
"grad_norm": 0.5864846110343933,
"learning_rate": 6.026312439675552e-06,
"loss": 0.3706,
"step": 170
},
{
"epoch": 0.007165004609067292,
"grad_norm": 0.3484610319137573,
"learning_rate": 5.6388590278194096e-06,
"loss": 0.3537,
"step": 171
},
{
"epoch": 0.007206905220816224,
"grad_norm": 0.34717440605163574,
"learning_rate": 5.263533508961827e-06,
"loss": 0.3597,
"step": 172
},
{
"epoch": 0.007248805832565155,
"grad_norm": 0.4218187630176544,
"learning_rate": 4.900438493352055e-06,
"loss": 0.3615,
"step": 173
},
{
"epoch": 0.007290706444314087,
"grad_norm": 0.36104816198349,
"learning_rate": 4.549673247541875e-06,
"loss": 0.3697,
"step": 174
},
{
"epoch": 0.0073326070560630185,
"grad_norm": 0.36783576011657715,
"learning_rate": 4.2113336672471245e-06,
"loss": 0.3634,
"step": 175
},
{
"epoch": 0.0073745076678119505,
"grad_norm": 0.3596624433994293,
"learning_rate": 3.885512251130763e-06,
"loss": 0.3654,
"step": 176
},
{
"epoch": 0.007416408279560882,
"grad_norm": 0.3116663098335266,
"learning_rate": 3.5722980755146517e-06,
"loss": 0.3628,
"step": 177
},
{
"epoch": 0.007458308891309813,
"grad_norm": 0.3371797204017639,
"learning_rate": 3.271776770026963e-06,
"loss": 0.3681,
"step": 178
},
{
"epoch": 0.007500209503058745,
"grad_norm": 0.374452143907547,
"learning_rate": 2.9840304941919415e-06,
"loss": 0.3543,
"step": 179
},
{
"epoch": 0.007542110114807676,
"grad_norm": 0.3471692204475403,
"learning_rate": 2.7091379149682685e-06,
"loss": 0.3588,
"step": 180
},
{
"epoch": 0.007584010726556608,
"grad_norm": 0.37220466136932373,
"learning_rate": 2.4471741852423237e-06,
"loss": 0.3689,
"step": 181
},
{
"epoch": 0.007625911338305539,
"grad_norm": 0.39862167835235596,
"learning_rate": 2.1982109232821178e-06,
"loss": 0.367,
"step": 182
},
{
"epoch": 0.007667811950054471,
"grad_norm": 0.37802115082740784,
"learning_rate": 1.962316193157593e-06,
"loss": 0.3578,
"step": 183
},
{
"epoch": 0.007709712561803402,
"grad_norm": 0.3749293386936188,
"learning_rate": 1.7395544861325718e-06,
"loss": 0.3645,
"step": 184
},
{
"epoch": 0.007751613173552334,
"grad_norm": 0.3764847218990326,
"learning_rate": 1.5299867030334814e-06,
"loss": 0.3627,
"step": 185
},
{
"epoch": 0.007793513785301265,
"grad_norm": 0.39325788617134094,
"learning_rate": 1.333670137599713e-06,
"loss": 0.3637,
"step": 186
},
{
"epoch": 0.007835414397050197,
"grad_norm": 0.41122153401374817,
"learning_rate": 1.1506584608200367e-06,
"loss": 0.3675,
"step": 187
},
{
"epoch": 0.00787731500879913,
"grad_norm": 0.4208770990371704,
"learning_rate": 9.810017062595322e-07,
"loss": 0.3705,
"step": 188
},
{
"epoch": 0.00791921562054806,
"grad_norm": 0.3626030683517456,
"learning_rate": 8.247462563808817e-07,
"loss": 0.3595,
"step": 189
},
{
"epoch": 0.007961116232296991,
"grad_norm": 0.36591896414756775,
"learning_rate": 6.819348298638839e-07,
"loss": 0.3608,
"step": 190
},
{
"epoch": 0.008003016844045923,
"grad_norm": 0.365206241607666,
"learning_rate": 5.526064699265753e-07,
"loss": 0.3729,
"step": 191
},
{
"epoch": 0.008044917455794855,
"grad_norm": 0.394902765750885,
"learning_rate": 4.367965336512403e-07,
"loss": 0.3681,
"step": 192
},
{
"epoch": 0.008086818067543786,
"grad_norm": 0.4147816300392151,
"learning_rate": 3.3453668231809286e-07,
"loss": 0.3744,
"step": 193
},
{
"epoch": 0.008128718679292718,
"grad_norm": 0.4281652569770813,
"learning_rate": 2.458548727494292e-07,
"loss": 0.3683,
"step": 194
},
{
"epoch": 0.00817061929104165,
"grad_norm": 0.4012470841407776,
"learning_rate": 1.7077534966650766e-07,
"loss": 0.3723,
"step": 195
},
{
"epoch": 0.008212519902790582,
"grad_norm": 0.3961266279220581,
"learning_rate": 1.0931863906127327e-07,
"loss": 0.3677,
"step": 196
},
{
"epoch": 0.008254420514539512,
"grad_norm": 0.4153655767440796,
"learning_rate": 6.150154258476315e-08,
"loss": 0.3827,
"step": 197
},
{
"epoch": 0.008296321126288444,
"grad_norm": 0.4204557240009308,
"learning_rate": 2.7337132953697554e-08,
"loss": 0.3799,
"step": 198
},
{
"epoch": 0.008338221738037376,
"grad_norm": 0.43716534972190857,
"learning_rate": 6.834750376549792e-09,
"loss": 0.3762,
"step": 199
},
{
"epoch": 0.008380122349786306,
"grad_norm": 0.5038236975669861,
"learning_rate": 0.0,
"loss": 0.3883,
"step": 200
},
{
"epoch": 0.008380122349786306,
"eval_loss": 0.3646468222141266,
"eval_runtime": 694.3148,
"eval_samples_per_second": 57.893,
"eval_steps_per_second": 14.473,
"step": 200
}
],
"logging_steps": 1,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.5476286069669888e+16,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}