aleegis10's picture
Training in progress, step 150, checkpoint
09f6382 verified
Raw History Blame
27.5 kB
{
"best_metric": 0.9148275852203369,
"best_model_checkpoint": "miner_id_24/checkpoint-150",
"epoch": 2.542372881355932,
"eval_steps": 50,
"global_step": 150,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.01694915254237288,
"grad_norm": 0.9787123203277588,
"learning_rate": 1e-05,
"loss": 3.0209,
"step": 1
},
{
"epoch": 0.01694915254237288,
"eval_loss": 4.1999897956848145,
"eval_runtime": 1.4503,
"eval_samples_per_second": 68.951,
"eval_steps_per_second": 17.238,
"step": 1
},
{
"epoch": 0.03389830508474576,
"grad_norm": 2.4502038955688477,
"learning_rate": 2e-05,
"loss": 4.4497,
"step": 2
},
{
"epoch": 0.05084745762711865,
"grad_norm": 2.665430784225464,
"learning_rate": 3e-05,
"loss": 4.639,
"step": 3
},
{
"epoch": 0.06779661016949153,
"grad_norm": 2.4935710430145264,
"learning_rate": 4e-05,
"loss": 4.4997,
"step": 4
},
{
"epoch": 0.0847457627118644,
"grad_norm": 2.3885178565979004,
"learning_rate": 5e-05,
"loss": 4.3788,
"step": 5
},
{
"epoch": 0.1016949152542373,
"grad_norm": 2.521230459213257,
"learning_rate": 6e-05,
"loss": 4.4601,
"step": 6
},
{
"epoch": 0.11864406779661017,
"grad_norm": 2.408069133758545,
"learning_rate": 7e-05,
"loss": 4.3255,
"step": 7
},
{
"epoch": 0.13559322033898305,
"grad_norm": 1.1387848854064941,
"learning_rate": 8e-05,
"loss": 3.355,
"step": 8
},
{
"epoch": 0.15254237288135594,
"grad_norm": 1.0923254489898682,
"learning_rate": 9e-05,
"loss": 3.0777,
"step": 9
},
{
"epoch": 0.1694915254237288,
"grad_norm": 1.489324688911438,
"learning_rate": 0.0001,
"loss": 3.4978,
"step": 10
},
{
"epoch": 0.1864406779661017,
"grad_norm": 1.415766716003418,
"learning_rate": 9.999115304121457e-05,
"loss": 3.4619,
"step": 11
},
{
"epoch": 0.2033898305084746,
"grad_norm": 1.4508241415023804,
"learning_rate": 9.996461529560553e-05,
"loss": 3.2672,
"step": 12
},
{
"epoch": 0.22033898305084745,
"grad_norm": 1.6372668743133545,
"learning_rate": 9.992039615430648e-05,
"loss": 3.3624,
"step": 13
},
{
"epoch": 0.23728813559322035,
"grad_norm": 2.086595296859741,
"learning_rate": 9.985851126551428e-05,
"loss": 3.8379,
"step": 14
},
{
"epoch": 0.2542372881355932,
"grad_norm": 1.075448751449585,
"learning_rate": 9.977898252895134e-05,
"loss": 2.6479,
"step": 15
},
{
"epoch": 0.2711864406779661,
"grad_norm": 2.2425975799560547,
"learning_rate": 9.968183808811586e-05,
"loss": 2.9848,
"step": 16
},
{
"epoch": 0.288135593220339,
"grad_norm": 2.2366819381713867,
"learning_rate": 9.95671123203224e-05,
"loss": 2.818,
"step": 17
},
{
"epoch": 0.3050847457627119,
"grad_norm": 2.1117076873779297,
"learning_rate": 9.943484582453653e-05,
"loss": 2.6075,
"step": 18
},
{
"epoch": 0.3220338983050847,
"grad_norm": 2.0897672176361084,
"learning_rate": 9.928508540700774e-05,
"loss": 2.5123,
"step": 19
},
{
"epoch": 0.3389830508474576,
"grad_norm": 1.8737945556640625,
"learning_rate": 9.911788406470569e-05,
"loss": 2.3475,
"step": 20
},
{
"epoch": 0.3559322033898305,
"grad_norm": 1.7135223150253296,
"learning_rate": 9.893330096656574e-05,
"loss": 2.2067,
"step": 21
},
{
"epoch": 0.3728813559322034,
"grad_norm": 0.705153226852417,
"learning_rate": 9.873140143255036e-05,
"loss": 2.1873,
"step": 22
},
{
"epoch": 0.3898305084745763,
"grad_norm": 0.7329670190811157,
"learning_rate": 9.85122569105338e-05,
"loss": 2.6215,
"step": 23
},
{
"epoch": 0.4067796610169492,
"grad_norm": 1.136795163154602,
"learning_rate": 9.827594495101823e-05,
"loss": 2.8488,
"step": 24
},
{
"epoch": 0.423728813559322,
"grad_norm": 1.0769141912460327,
"learning_rate": 9.802254917969032e-05,
"loss": 2.8395,
"step": 25
},
{
"epoch": 0.4406779661016949,
"grad_norm": 1.4403115510940552,
"learning_rate": 9.775215926782788e-05,
"loss": 2.6802,
"step": 26
},
{
"epoch": 0.4576271186440678,
"grad_norm": 1.4279862642288208,
"learning_rate": 9.746487090056713e-05,
"loss": 2.7192,
"step": 27
},
{
"epoch": 0.4745762711864407,
"grad_norm": 1.699432611465454,
"learning_rate": 9.716078574304189e-05,
"loss": 2.8853,
"step": 28
},
{
"epoch": 0.4915254237288136,
"grad_norm": 1.4521034955978394,
"learning_rate": 9.684001140440639e-05,
"loss": 1.9164,
"step": 29
},
{
"epoch": 0.5084745762711864,
"grad_norm": 2.434119939804077,
"learning_rate": 9.650266139975474e-05,
"loss": 1.3542,
"step": 30
},
{
"epoch": 0.5254237288135594,
"grad_norm": 1.6792948246002197,
"learning_rate": 9.614885510995047e-05,
"loss": 1.3436,
"step": 31
},
{
"epoch": 0.5423728813559322,
"grad_norm": 1.6474392414093018,
"learning_rate": 9.577871773938011e-05,
"loss": 1.1094,
"step": 32
},
{
"epoch": 0.559322033898305,
"grad_norm": 1.6065335273742676,
"learning_rate": 9.539238027164619e-05,
"loss": 0.9116,
"step": 33
},
{
"epoch": 0.576271186440678,
"grad_norm": 1.514753818511963,
"learning_rate": 9.498997942321483e-05,
"loss": 0.8389,
"step": 34
},
{
"epoch": 0.5932203389830508,
"grad_norm": 1.2533358335494995,
"learning_rate": 9.457165759503493e-05,
"loss": 0.9727,
"step": 35
},
{
"epoch": 0.6101694915254238,
"grad_norm": 0.8802417516708374,
"learning_rate": 9.413756282214537e-05,
"loss": 1.7009,
"step": 36
},
{
"epoch": 0.6271186440677966,
"grad_norm": 1.1750346422195435,
"learning_rate": 9.368784872128878e-05,
"loss": 2.5651,
"step": 37
},
{
"epoch": 0.6440677966101694,
"grad_norm": 1.331346035003662,
"learning_rate": 9.322267443654972e-05,
"loss": 2.5368,
"step": 38
},
{
"epoch": 0.6610169491525424,
"grad_norm": 1.1209417581558228,
"learning_rate": 9.274220458303727e-05,
"loss": 2.8612,
"step": 39
},
{
"epoch": 0.6779661016949152,
"grad_norm": 1.2335385084152222,
"learning_rate": 9.224660918863104e-05,
"loss": 2.6824,
"step": 40
},
{
"epoch": 0.6949152542372882,
"grad_norm": 1.1797600984573364,
"learning_rate": 9.173606363381219e-05,
"loss": 2.4775,
"step": 41
},
{
"epoch": 0.711864406779661,
"grad_norm": 1.6770628690719604,
"learning_rate": 9.121074858959997e-05,
"loss": 2.7293,
"step": 42
},
{
"epoch": 0.7288135593220338,
"grad_norm": 1.0169050693511963,
"learning_rate": 9.067084995361623e-05,
"loss": 1.3915,
"step": 43
},
{
"epoch": 0.7457627118644068,
"grad_norm": 1.1066895723342896,
"learning_rate": 9.011655878430019e-05,
"loss": 0.5636,
"step": 44
},
{
"epoch": 0.7627118644067796,
"grad_norm": 0.9063847661018372,
"learning_rate": 8.954807123329704e-05,
"loss": 0.1767,
"step": 45
},
{
"epoch": 0.7796610169491526,
"grad_norm": 0.5006846189498901,
"learning_rate": 8.896558847604414e-05,
"loss": 0.3629,
"step": 46
},
{
"epoch": 0.7966101694915254,
"grad_norm": 0.42200618982315063,
"learning_rate": 8.836931664057935e-05,
"loss": 0.2745,
"step": 47
},
{
"epoch": 0.8135593220338984,
"grad_norm": 0.3802186846733093,
"learning_rate": 8.775946673459681e-05,
"loss": 0.1882,
"step": 48
},
{
"epoch": 0.8305084745762712,
"grad_norm": 0.3861039876937866,
"learning_rate": 8.713625457077585e-05,
"loss": 0.4487,
"step": 49
},
{
"epoch": 0.847457627118644,
"grad_norm": 0.9502959847450256,
"learning_rate": 8.649990069040961e-05,
"loss": 2.1698,
"step": 50
},
{
"epoch": 0.847457627118644,
"eval_loss": 1.0403923988342285,
"eval_runtime": 1.442,
"eval_samples_per_second": 69.349,
"eval_steps_per_second": 17.337,
"step": 50
},
{
"epoch": 0.864406779661017,
"grad_norm": 1.0427058935165405,
"learning_rate": 8.585063028536016e-05,
"loss": 2.4816,
"step": 51
},
{
"epoch": 0.8813559322033898,
"grad_norm": 0.9536698460578918,
"learning_rate": 8.518867311836808e-05,
"loss": 2.379,
"step": 52
},
{
"epoch": 0.8983050847457628,
"grad_norm": 1.1528958082199097,
"learning_rate": 8.451426344174433e-05,
"loss": 2.5705,
"step": 53
},
{
"epoch": 0.9152542372881356,
"grad_norm": 1.075803518295288,
"learning_rate": 8.382763991447344e-05,
"loss": 2.3945,
"step": 54
},
{
"epoch": 0.9322033898305084,
"grad_norm": 1.1288622617721558,
"learning_rate": 8.312904551775731e-05,
"loss": 2.536,
"step": 55
},
{
"epoch": 0.9491525423728814,
"grad_norm": 1.494862675666809,
"learning_rate": 8.241872746902935e-05,
"loss": 2.5827,
"step": 56
},
{
"epoch": 0.9661016949152542,
"grad_norm": 0.41931426525115967,
"learning_rate": 8.169693713446959e-05,
"loss": 0.7727,
"step": 57
},
{
"epoch": 0.9830508474576272,
"grad_norm": 0.464871883392334,
"learning_rate": 8.096392994005177e-05,
"loss": 1.2605,
"step": 58
},
{
"epoch": 1.0,
"grad_norm": 1.0274232625961304,
"learning_rate": 8.021996528115335e-05,
"loss": 2.5275,
"step": 59
},
{
"epoch": 1.0169491525423728,
"grad_norm": 0.5695710182189941,
"learning_rate": 7.946530643076138e-05,
"loss": 1.3716,
"step": 60
},
{
"epoch": 1.0338983050847457,
"grad_norm": 0.29576823115348816,
"learning_rate": 7.870022044630569e-05,
"loss": 0.3392,
"step": 61
},
{
"epoch": 1.0508474576271187,
"grad_norm": 0.29110977053642273,
"learning_rate": 7.792497807515317e-05,
"loss": 0.3041,
"step": 62
},
{
"epoch": 1.0677966101694916,
"grad_norm": 0.27382704615592957,
"learning_rate": 7.713985365879606e-05,
"loss": 0.4193,
"step": 63
},
{
"epoch": 1.0847457627118644,
"grad_norm": 0.19342516362667084,
"learning_rate": 7.63451250357685e-05,
"loss": 0.1109,
"step": 64
},
{
"epoch": 1.1016949152542372,
"grad_norm": 0.1454094499349594,
"learning_rate": 7.55410734433254e-05,
"loss": 0.0198,
"step": 65
},
{
"epoch": 1.11864406779661,
"grad_norm": 0.23074690997600555,
"learning_rate": 7.472798341791877e-05,
"loss": 0.1309,
"step": 66
},
{
"epoch": 1.1355932203389831,
"grad_norm": 0.47609075903892517,
"learning_rate": 7.390614269450634e-05,
"loss": 1.3382,
"step": 67
},
{
"epoch": 1.152542372881356,
"grad_norm": 0.7256209254264832,
"learning_rate": 7.307584210472844e-05,
"loss": 2.2253,
"step": 68
},
{
"epoch": 1.1694915254237288,
"grad_norm": 0.7721383571624756,
"learning_rate": 7.223737547398898e-05,
"loss": 2.1726,
"step": 69
},
{
"epoch": 1.1864406779661016,
"grad_norm": 0.8785566091537476,
"learning_rate": 7.139103951747695e-05,
"loss": 2.4489,
"step": 70
},
{
"epoch": 1.2033898305084745,
"grad_norm": 0.797492265701294,
"learning_rate": 7.053713373516538e-05,
"loss": 2.2085,
"step": 71
},
{
"epoch": 1.2203389830508475,
"grad_norm": 0.8545417785644531,
"learning_rate": 6.967596030582478e-05,
"loss": 2.4864,
"step": 72
},
{
"epoch": 1.2372881355932204,
"grad_norm": 1.2952442169189453,
"learning_rate": 6.880782398008862e-05,
"loss": 2.3607,
"step": 73
},
{
"epoch": 1.2542372881355932,
"grad_norm": 0.4277438223361969,
"learning_rate": 6.793303197260864e-05,
"loss": 1.2012,
"step": 74
},
{
"epoch": 1.271186440677966,
"grad_norm": 0.23187437653541565,
"learning_rate": 6.70518938533383e-05,
"loss": 0.1912,
"step": 75
},
{
"epoch": 1.288135593220339,
"grad_norm": 0.13725751638412476,
"learning_rate": 6.616472143798261e-05,
"loss": 0.1406,
"step": 76
},
{
"epoch": 1.305084745762712,
"grad_norm": 0.23800960183143616,
"learning_rate": 6.527182867765332e-05,
"loss": 0.0717,
"step": 77
},
{
"epoch": 1.3220338983050848,
"grad_norm": 0.16830310225486755,
"learning_rate": 6.437353154776849e-05,
"loss": 0.1892,
"step": 78
},
{
"epoch": 1.3389830508474576,
"grad_norm": 0.05917459353804588,
"learning_rate": 6.347014793623547e-05,
"loss": 0.0077,
"step": 79
},
{
"epoch": 1.3559322033898304,
"grad_norm": 0.17031961679458618,
"learning_rate": 6.256199753095745e-05,
"loss": 0.2442,
"step": 80
},
{
"epoch": 1.3728813559322033,
"grad_norm": 0.603077232837677,
"learning_rate": 6.164940170670266e-05,
"loss": 1.8995,
"step": 81
},
{
"epoch": 1.3898305084745763,
"grad_norm": 0.6798323392868042,
"learning_rate": 6.0732683411376935e-05,
"loss": 2.2423,
"step": 82
},
{
"epoch": 1.4067796610169492,
"grad_norm": 0.8995802998542786,
"learning_rate": 5.98121670517393e-05,
"loss": 2.1578,
"step": 83
},
{
"epoch": 1.423728813559322,
"grad_norm": 0.7790073752403259,
"learning_rate": 5.8888178378601565e-05,
"loss": 2.3126,
"step": 84
},
{
"epoch": 1.4406779661016949,
"grad_norm": 0.9033922553062439,
"learning_rate": 5.796104437155213e-05,
"loss": 2.207,
"step": 85
},
{
"epoch": 1.457627118644068,
"grad_norm": 0.8630293607711792,
"learning_rate": 5.7031093123244925e-05,
"loss": 2.1339,
"step": 86
},
{
"epoch": 1.4745762711864407,
"grad_norm": 1.140993595123291,
"learning_rate": 5.6098653723294604e-05,
"loss": 2.2742,
"step": 87
},
{
"epoch": 1.4915254237288136,
"grad_norm": 0.5041856169700623,
"learning_rate": 5.516405614181883e-05,
"loss": 1.2441,
"step": 88
},
{
"epoch": 1.5084745762711864,
"grad_norm": 0.0990825667977333,
"learning_rate": 5.4227631112668955e-05,
"loss": 0.0708,
"step": 89
},
{
"epoch": 1.5254237288135593,
"grad_norm": 0.1579853743314743,
"learning_rate": 5.3289710016390535e-05,
"loss": 0.2237,
"step": 90
},
{
"epoch": 1.542372881355932,
"grad_norm": 0.1326770782470703,
"learning_rate": 5.2350624762954884e-05,
"loss": 0.1283,
"step": 91
},
{
"epoch": 1.559322033898305,
"grad_norm": 0.13696810603141785,
"learning_rate": 5.14107076743033e-05,
"loss": 0.1354,
"step": 92
},
{
"epoch": 1.576271186440678,
"grad_norm": 0.039330050349235535,
"learning_rate": 5.047029136674563e-05,
"loss": 0.0049,
"step": 93
},
{
"epoch": 1.5932203389830508,
"grad_norm": 0.17127054929733276,
"learning_rate": 4.95297086332544e-05,
"loss": 0.2072,
"step": 94
},
{
"epoch": 1.6101694915254239,
"grad_norm": 0.502240777015686,
"learning_rate": 4.858929232569671e-05,
"loss": 1.5421,
"step": 95
},
{
"epoch": 1.6271186440677967,
"grad_norm": 0.7475689053535461,
"learning_rate": 4.7649375237045135e-05,
"loss": 2.2061,
"step": 96
},
{
"epoch": 1.6440677966101696,
"grad_norm": 0.7506973743438721,
"learning_rate": 4.671028998360947e-05,
"loss": 2.0706,
"step": 97
},
{
"epoch": 1.6610169491525424,
"grad_norm": 0.8322485685348511,
"learning_rate": 4.577236888733105e-05,
"loss": 2.3213,
"step": 98
},
{
"epoch": 1.6779661016949152,
"grad_norm": 0.8912888765335083,
"learning_rate": 4.483594385818118e-05,
"loss": 2.2682,
"step": 99
},
{
"epoch": 1.694915254237288,
"grad_norm": 0.9926512241363525,
"learning_rate": 4.39013462767054e-05,
"loss": 2.2907,
"step": 100
},
{
"epoch": 1.694915254237288,
"eval_loss": 0.9476182460784912,
"eval_runtime": 1.4397,
"eval_samples_per_second": 69.46,
"eval_steps_per_second": 17.365,
"step": 100
},
{
"epoch": 1.711864406779661,
"grad_norm": 1.0757006406784058,
"learning_rate": 4.29689068767551e-05,
"loss": 2.3057,
"step": 101
},
{
"epoch": 1.7288135593220337,
"grad_norm": 0.5664078593254089,
"learning_rate": 4.203895562844789e-05,
"loss": 1.469,
"step": 102
},
{
"epoch": 1.7457627118644068,
"grad_norm": 0.09226689487695694,
"learning_rate": 4.1111821621398446e-05,
"loss": 0.0674,
"step": 103
},
{
"epoch": 1.7627118644067796,
"grad_norm": 0.07321758568286896,
"learning_rate": 4.0187832948260705e-05,
"loss": 0.0404,
"step": 104
},
{
"epoch": 1.7796610169491527,
"grad_norm": 0.24070608615875244,
"learning_rate": 3.926731658862307e-05,
"loss": 0.2084,
"step": 105
},
{
"epoch": 1.7966101694915255,
"grad_norm": 0.027658900246024132,
"learning_rate": 3.835059829329735e-05,
"loss": 0.0039,
"step": 106
},
{
"epoch": 1.8135593220338984,
"grad_norm": 0.07214166969060898,
"learning_rate": 3.7438002469042565e-05,
"loss": 0.0415,
"step": 107
},
{
"epoch": 1.8305084745762712,
"grad_norm": 0.22489815950393677,
"learning_rate": 3.6529852063764545e-05,
"loss": 0.3323,
"step": 108
},
{
"epoch": 1.847457627118644,
"grad_norm": 0.525007963180542,
"learning_rate": 3.562646845223153e-05,
"loss": 1.4499,
"step": 109
},
{
"epoch": 1.8644067796610169,
"grad_norm": 0.7562161684036255,
"learning_rate": 3.4728171322346694e-05,
"loss": 2.1267,
"step": 110
},
{
"epoch": 1.8813559322033897,
"grad_norm": 0.7749287486076355,
"learning_rate": 3.38352785620174e-05,
"loss": 2.1855,
"step": 111
},
{
"epoch": 1.8983050847457628,
"grad_norm": 0.8717202544212341,
"learning_rate": 3.29481061466617e-05,
"loss": 2.2716,
"step": 112
},
{
"epoch": 1.9152542372881356,
"grad_norm": 0.990043580532074,
"learning_rate": 3.2066968027391374e-05,
"loss": 2.1828,
"step": 113
},
{
"epoch": 1.9322033898305084,
"grad_norm": 0.9501929879188538,
"learning_rate": 3.119217601991139e-05,
"loss": 1.9919,
"step": 114
},
{
"epoch": 1.9491525423728815,
"grad_norm": 1.3463528156280518,
"learning_rate": 3.0324039694175233e-05,
"loss": 2.3176,
"step": 115
},
{
"epoch": 1.9661016949152543,
"grad_norm": 0.2480294406414032,
"learning_rate": 2.946286626483463e-05,
"loss": 0.4455,
"step": 116
},
{
"epoch": 1.9830508474576272,
"grad_norm": 0.5426979660987854,
"learning_rate": 2.8608960482523056e-05,
"loss": 1.2601,
"step": 117
},
{
"epoch": 2.0,
"grad_norm": 0.9084144234657288,
"learning_rate": 2.7762624526011038e-05,
"loss": 2.1384,
"step": 118
},
{
"epoch": 2.016949152542373,
"grad_norm": 0.38337242603302,
"learning_rate": 2.6924157895271563e-05,
"loss": 0.9181,
"step": 119
},
{
"epoch": 2.0338983050847457,
"grad_norm": 0.09438680857419968,
"learning_rate": 2.6093857305493664e-05,
"loss": 0.064,
"step": 120
},
{
"epoch": 2.0508474576271185,
"grad_norm": 0.025368427857756615,
"learning_rate": 2.5272016582081236e-05,
"loss": 0.0037,
"step": 121
},
{
"epoch": 2.0677966101694913,
"grad_norm": 0.22418174147605896,
"learning_rate": 2.4458926556674615e-05,
"loss": 0.3752,
"step": 122
},
{
"epoch": 2.084745762711864,
"grad_norm": 0.029728621244430542,
"learning_rate": 2.3654874964231518e-05,
"loss": 0.0035,
"step": 123
},
{
"epoch": 2.1016949152542375,
"grad_norm": 0.07155339419841766,
"learning_rate": 2.2860146341203937e-05,
"loss": 0.0405,
"step": 124
},
{
"epoch": 2.1186440677966103,
"grad_norm": 0.08262301981449127,
"learning_rate": 2.207502192484685e-05,
"loss": 0.0428,
"step": 125
},
{
"epoch": 2.135593220338983,
"grad_norm": 0.5090848803520203,
"learning_rate": 2.1299779553694323e-05,
"loss": 1.3961,
"step": 126
},
{
"epoch": 2.152542372881356,
"grad_norm": 0.6652891635894775,
"learning_rate": 2.053469356923865e-05,
"loss": 2.0337,
"step": 127
},
{
"epoch": 2.169491525423729,
"grad_norm": 0.7932724356651306,
"learning_rate": 1.978003471884665e-05,
"loss": 2.2015,
"step": 128
},
{
"epoch": 2.1864406779661016,
"grad_norm": 0.828244686126709,
"learning_rate": 1.9036070059948252e-05,
"loss": 2.0406,
"step": 129
},
{
"epoch": 2.2033898305084745,
"grad_norm": 0.8815770149230957,
"learning_rate": 1.8303062865530406e-05,
"loss": 2.0167,
"step": 130
},
{
"epoch": 2.2203389830508473,
"grad_norm": 0.9002049565315247,
"learning_rate": 1.7581272530970667e-05,
"loss": 2.0821,
"step": 131
},
{
"epoch": 2.23728813559322,
"grad_norm": 1.0344882011413574,
"learning_rate": 1.6870954482242707e-05,
"loss": 2.0685,
"step": 132
},
{
"epoch": 2.2542372881355934,
"grad_norm": 0.44666269421577454,
"learning_rate": 1.6172360085526565e-05,
"loss": 1.1569,
"step": 133
},
{
"epoch": 2.2711864406779663,
"grad_norm": 0.09210528433322906,
"learning_rate": 1.5485736558255697e-05,
"loss": 0.0479,
"step": 134
},
{
"epoch": 2.288135593220339,
"grad_norm": 0.038695137947797775,
"learning_rate": 1.4811326881631937e-05,
"loss": 0.0034,
"step": 135
},
{
"epoch": 2.305084745762712,
"grad_norm": 0.1461106240749359,
"learning_rate": 1.4149369714639853e-05,
"loss": 0.1391,
"step": 136
},
{
"epoch": 2.3220338983050848,
"grad_norm": 0.16508442163467407,
"learning_rate": 1.3500099309590397e-05,
"loss": 0.1813,
"step": 137
},
{
"epoch": 2.3389830508474576,
"grad_norm": 0.12389306724071503,
"learning_rate": 1.2863745429224144e-05,
"loss": 0.097,
"step": 138
},
{
"epoch": 2.3559322033898304,
"grad_norm": 0.2678169012069702,
"learning_rate": 1.2240533265403198e-05,
"loss": 0.4644,
"step": 139
},
{
"epoch": 2.3728813559322033,
"grad_norm": 0.6074098348617554,
"learning_rate": 1.1630683359420652e-05,
"loss": 2.0744,
"step": 140
},
{
"epoch": 2.389830508474576,
"grad_norm": 0.7297008633613586,
"learning_rate": 1.103441152395588e-05,
"loss": 2.0194,
"step": 141
},
{
"epoch": 2.406779661016949,
"grad_norm": 0.7776730060577393,
"learning_rate": 1.0451928766702979e-05,
"loss": 2.083,
"step": 142
},
{
"epoch": 2.423728813559322,
"grad_norm": 0.8881759643554688,
"learning_rate": 9.883441215699823e-06,
"loss": 2.5883,
"step": 143
},
{
"epoch": 2.440677966101695,
"grad_norm": 0.8794331550598145,
"learning_rate": 9.329150046383772e-06,
"loss": 2.0489,
"step": 144
},
{
"epoch": 2.457627118644068,
"grad_norm": 0.8844050765037537,
"learning_rate": 8.789251410400023e-06,
"loss": 2.1398,
"step": 145
},
{
"epoch": 2.4745762711864407,
"grad_norm": 1.1741251945495605,
"learning_rate": 8.263936366187824e-06,
"loss": 2.1663,
"step": 146
},
{
"epoch": 2.4915254237288136,
"grad_norm": 0.4704148471355438,
"learning_rate": 7.753390811368971e-06,
"loss": 1.4645,
"step": 147
},
{
"epoch": 2.5084745762711864,
"grad_norm": 0.20011013746261597,
"learning_rate": 7.257795416962753e-06,
"loss": 0.308,
"step": 148
},
{
"epoch": 2.5254237288135593,
"grad_norm": 0.19620303809642792,
"learning_rate": 6.777325563450282e-06,
"loss": 0.1889,
"step": 149
},
{
"epoch": 2.542372881355932,
"grad_norm": 0.022152384743094444,
"learning_rate": 6.312151278711237e-06,
"loss": 0.0033,
"step": 150
},
{
"epoch": 2.542372881355932,
"eval_loss": 0.9148275852203369,
"eval_runtime": 1.4467,
"eval_samples_per_second": 69.125,
"eval_steps_per_second": 17.281,
"step": 150
}
],
"logging_steps": 1,
"max_steps": 177,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3702083627778048.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}