infinitylogesh's picture
Upload folder using huggingface_hub
a2f7974 verified
Raw
History Blame Contribute Delete
64.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.2,
"eval_steps": 500,
"global_step": 400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.008,
"grad_norm": 0.09337692707777023,
"learning_rate": 2e-05,
"loss": 0.015294969081878662,
"step": 1
},
{
"epoch": 0.016,
"grad_norm": 0.07111852616071701,
"learning_rate": 2e-05,
"loss": 0.007340883836150169,
"step": 2
},
{
"epoch": 0.024,
"grad_norm": 0.07195291668176651,
"learning_rate": 2e-05,
"loss": 0.0077208466827869415,
"step": 3
},
{
"epoch": 0.032,
"grad_norm": 0.09681837260723114,
"learning_rate": 2e-05,
"loss": 0.008473804220557213,
"step": 4
},
{
"epoch": 0.04,
"grad_norm": 0.06043309345841408,
"learning_rate": 2e-05,
"loss": 0.006642022170126438,
"step": 5
},
{
"epoch": 0.048,
"grad_norm": 0.05604363605380058,
"learning_rate": 2e-05,
"loss": 0.003878322197124362,
"step": 6
},
{
"epoch": 0.056,
"grad_norm": 0.06847543269395828,
"learning_rate": 2e-05,
"loss": 0.011454813182353973,
"step": 7
},
{
"epoch": 0.064,
"grad_norm": 0.05413937568664551,
"learning_rate": 2e-05,
"loss": 0.005098872818052769,
"step": 8
},
{
"epoch": 0.072,
"grad_norm": 0.04113985598087311,
"learning_rate": 2e-05,
"loss": 0.0072427294217050076,
"step": 9
},
{
"epoch": 0.08,
"grad_norm": 0.06007072329521179,
"learning_rate": 2e-05,
"loss": 0.005184551235288382,
"step": 10
},
{
"epoch": 0.088,
"grad_norm": 0.05269957333803177,
"learning_rate": 2e-05,
"loss": 0.006402506493031979,
"step": 11
},
{
"epoch": 0.096,
"grad_norm": 0.07171762734651566,
"learning_rate": 2e-05,
"loss": 0.006807660683989525,
"step": 12
},
{
"epoch": 0.104,
"grad_norm": 0.04405634105205536,
"learning_rate": 2e-05,
"loss": 0.0049944375641644,
"step": 13
},
{
"epoch": 0.112,
"grad_norm": 0.04304119199514389,
"learning_rate": 2e-05,
"loss": 0.005410908255726099,
"step": 14
},
{
"epoch": 0.12,
"grad_norm": 0.057690370827913284,
"learning_rate": 2e-05,
"loss": 0.007783032953739166,
"step": 15
},
{
"epoch": 0.128,
"grad_norm": 0.04541298747062683,
"learning_rate": 2e-05,
"loss": 0.004243949428200722,
"step": 16
},
{
"epoch": 0.136,
"grad_norm": 0.06319569051265717,
"learning_rate": 2e-05,
"loss": 0.005336169619113207,
"step": 17
},
{
"epoch": 0.144,
"grad_norm": 0.03583596274256706,
"learning_rate": 2e-05,
"loss": 0.004895349964499474,
"step": 18
},
{
"epoch": 0.152,
"grad_norm": 0.05986885726451874,
"learning_rate": 2e-05,
"loss": 0.006950004491955042,
"step": 19
},
{
"epoch": 0.16,
"grad_norm": 0.08991007506847382,
"learning_rate": 2e-05,
"loss": 0.00810159184038639,
"step": 20
},
{
"epoch": 0.168,
"grad_norm": 0.05890341475605965,
"learning_rate": 2e-05,
"loss": 0.006250896491110325,
"step": 21
},
{
"epoch": 0.176,
"grad_norm": 0.04574795812368393,
"learning_rate": 2e-05,
"loss": 0.005519284401088953,
"step": 22
},
{
"epoch": 0.184,
"grad_norm": 0.05631595849990845,
"learning_rate": 2e-05,
"loss": 0.00560405757278204,
"step": 23
},
{
"epoch": 0.192,
"grad_norm": 0.06935696303844452,
"learning_rate": 2e-05,
"loss": 0.00864097848534584,
"step": 24
},
{
"epoch": 0.2,
"grad_norm": 0.04360036551952362,
"learning_rate": 2e-05,
"loss": 0.003752000629901886,
"step": 25
},
{
"epoch": 0.208,
"grad_norm": 0.05469367280602455,
"learning_rate": 2e-05,
"loss": 0.0067576696164906025,
"step": 26
},
{
"epoch": 0.216,
"grad_norm": 0.06384038180112839,
"learning_rate": 2e-05,
"loss": 0.004895553924143314,
"step": 27
},
{
"epoch": 0.224,
"grad_norm": 0.06384114921092987,
"learning_rate": 2e-05,
"loss": 0.005900057964026928,
"step": 28
},
{
"epoch": 0.232,
"grad_norm": 0.0655912533402443,
"learning_rate": 2e-05,
"loss": 0.005855287425220013,
"step": 29
},
{
"epoch": 0.24,
"grad_norm": 0.04619958996772766,
"learning_rate": 2e-05,
"loss": 0.005466114729642868,
"step": 30
},
{
"epoch": 0.248,
"grad_norm": 0.04525391384959221,
"learning_rate": 2e-05,
"loss": 0.004368640948086977,
"step": 31
},
{
"epoch": 0.256,
"grad_norm": 0.04429985210299492,
"learning_rate": 2e-05,
"loss": 0.005769067443907261,
"step": 32
},
{
"epoch": 0.264,
"grad_norm": 0.03835798799991608,
"learning_rate": 2e-05,
"loss": 0.004946814849972725,
"step": 33
},
{
"epoch": 0.272,
"grad_norm": 0.06351771950721741,
"learning_rate": 2e-05,
"loss": 0.005820239428430796,
"step": 34
},
{
"epoch": 0.28,
"grad_norm": 0.05175631865859032,
"learning_rate": 2e-05,
"loss": 0.007221951149404049,
"step": 35
},
{
"epoch": 0.288,
"grad_norm": 0.031039636582136154,
"learning_rate": 2e-05,
"loss": 0.0024754288606345654,
"step": 36
},
{
"epoch": 0.296,
"grad_norm": 0.04708324000239372,
"learning_rate": 2e-05,
"loss": 0.002840370638296008,
"step": 37
},
{
"epoch": 0.304,
"grad_norm": 0.06475556641817093,
"learning_rate": 2e-05,
"loss": 0.0077974689193069935,
"step": 38
},
{
"epoch": 0.312,
"grad_norm": 0.048895902931690216,
"learning_rate": 2e-05,
"loss": 0.0040883091278374195,
"step": 39
},
{
"epoch": 0.32,
"grad_norm": 0.058496665209531784,
"learning_rate": 2e-05,
"loss": 0.004431126173585653,
"step": 40
},
{
"epoch": 0.328,
"grad_norm": 0.0752127543091774,
"learning_rate": 2e-05,
"loss": 0.009588265791535378,
"step": 41
},
{
"epoch": 0.336,
"grad_norm": 0.029396817088127136,
"learning_rate": 2e-05,
"loss": 0.004547424148768187,
"step": 42
},
{
"epoch": 0.344,
"grad_norm": 0.10113711655139923,
"learning_rate": 2e-05,
"loss": 0.00836176797747612,
"step": 43
},
{
"epoch": 0.352,
"grad_norm": 0.04212963953614235,
"learning_rate": 2e-05,
"loss": 0.004907882306724787,
"step": 44
},
{
"epoch": 0.36,
"grad_norm": 0.02902965061366558,
"learning_rate": 2e-05,
"loss": 0.002945390995591879,
"step": 45
},
{
"epoch": 0.368,
"grad_norm": 0.05033962428569794,
"learning_rate": 2e-05,
"loss": 0.005018638446927071,
"step": 46
},
{
"epoch": 0.376,
"grad_norm": 0.034906402230262756,
"learning_rate": 2e-05,
"loss": 0.0026375213637948036,
"step": 47
},
{
"epoch": 0.384,
"grad_norm": 0.03871266171336174,
"learning_rate": 2e-05,
"loss": 0.004687938839197159,
"step": 48
},
{
"epoch": 0.392,
"grad_norm": 0.040328506380319595,
"learning_rate": 2e-05,
"loss": 0.006280779838562012,
"step": 49
},
{
"epoch": 0.4,
"grad_norm": 0.04712209478020668,
"learning_rate": 2e-05,
"loss": 0.0031323714647442102,
"step": 50
},
{
"epoch": 0.408,
"grad_norm": 0.045797791332006454,
"learning_rate": 2e-05,
"loss": 0.004443546291440725,
"step": 51
},
{
"epoch": 0.416,
"grad_norm": 0.06185959652066231,
"learning_rate": 2e-05,
"loss": 0.008573911152780056,
"step": 52
},
{
"epoch": 0.424,
"grad_norm": 0.059398140758275986,
"learning_rate": 2e-05,
"loss": 0.00942009873688221,
"step": 53
},
{
"epoch": 0.432,
"grad_norm": 0.07633177191019058,
"learning_rate": 2e-05,
"loss": 0.009616912342607975,
"step": 54
},
{
"epoch": 0.44,
"grad_norm": 0.053814005106687546,
"learning_rate": 2e-05,
"loss": 0.007603101897984743,
"step": 55
},
{
"epoch": 0.448,
"grad_norm": 0.05707194656133652,
"learning_rate": 2e-05,
"loss": 0.005355853587388992,
"step": 56
},
{
"epoch": 0.456,
"grad_norm": 0.04392722621560097,
"learning_rate": 2e-05,
"loss": 0.003092748112976551,
"step": 57
},
{
"epoch": 0.464,
"grad_norm": 0.027375129982829094,
"learning_rate": 2e-05,
"loss": 0.003245085943490267,
"step": 58
},
{
"epoch": 0.472,
"grad_norm": 0.05855637416243553,
"learning_rate": 2e-05,
"loss": 0.006621942389756441,
"step": 59
},
{
"epoch": 0.48,
"grad_norm": 0.040302883833646774,
"learning_rate": 2e-05,
"loss": 0.004884965717792511,
"step": 60
},
{
"epoch": 0.488,
"grad_norm": 0.038790635764598846,
"learning_rate": 2e-05,
"loss": 0.0041805170476436615,
"step": 61
},
{
"epoch": 0.496,
"grad_norm": 0.059503670781850815,
"learning_rate": 2e-05,
"loss": 0.0071491943672299385,
"step": 62
},
{
"epoch": 0.504,
"grad_norm": 0.059957440942525864,
"learning_rate": 2e-05,
"loss": 0.006595572456717491,
"step": 63
},
{
"epoch": 0.512,
"grad_norm": 0.05570148676633835,
"learning_rate": 2e-05,
"loss": 0.007463263813406229,
"step": 64
},
{
"epoch": 0.52,
"grad_norm": 0.056187067180871964,
"learning_rate": 2e-05,
"loss": 0.004543005023151636,
"step": 65
},
{
"epoch": 0.528,
"grad_norm": 0.04404418170452118,
"learning_rate": 2e-05,
"loss": 0.006366059184074402,
"step": 66
},
{
"epoch": 0.536,
"grad_norm": 0.049447719007730484,
"learning_rate": 2e-05,
"loss": 0.006581606809049845,
"step": 67
},
{
"epoch": 0.544,
"grad_norm": 0.03419354185461998,
"learning_rate": 2e-05,
"loss": 0.0035948362201452255,
"step": 68
},
{
"epoch": 0.552,
"grad_norm": 0.05780700221657753,
"learning_rate": 2e-05,
"loss": 0.005125825759023428,
"step": 69
},
{
"epoch": 0.56,
"grad_norm": 0.06544717401266098,
"learning_rate": 2e-05,
"loss": 0.006060135085135698,
"step": 70
},
{
"epoch": 0.568,
"grad_norm": 0.04413054138422012,
"learning_rate": 2e-05,
"loss": 0.003213978838175535,
"step": 71
},
{
"epoch": 0.576,
"grad_norm": 0.039240192621946335,
"learning_rate": 2e-05,
"loss": 0.004292209167033434,
"step": 72
},
{
"epoch": 0.584,
"grad_norm": 0.060329239815473557,
"learning_rate": 2e-05,
"loss": 0.006161934696137905,
"step": 73
},
{
"epoch": 0.592,
"grad_norm": 0.06489120423793793,
"learning_rate": 2e-05,
"loss": 0.0032440992072224617,
"step": 74
},
{
"epoch": 0.6,
"grad_norm": 0.04400647059082985,
"learning_rate": 2e-05,
"loss": 0.004546411335468292,
"step": 75
},
{
"epoch": 0.608,
"grad_norm": 0.046490587294101715,
"learning_rate": 2e-05,
"loss": 0.00506614800542593,
"step": 76
},
{
"epoch": 0.616,
"grad_norm": 0.03474031388759613,
"learning_rate": 2e-05,
"loss": 0.003143966430798173,
"step": 77
},
{
"epoch": 0.624,
"grad_norm": 0.04975699633359909,
"learning_rate": 2e-05,
"loss": 0.004066984634846449,
"step": 78
},
{
"epoch": 0.632,
"grad_norm": 0.06441677361726761,
"learning_rate": 2e-05,
"loss": 0.007056248374283314,
"step": 79
},
{
"epoch": 0.64,
"grad_norm": 0.05794770270586014,
"learning_rate": 2e-05,
"loss": 0.0037886211648583412,
"step": 80
},
{
"epoch": 0.648,
"grad_norm": 0.06725575029850006,
"learning_rate": 2e-05,
"loss": 0.005529267713427544,
"step": 81
},
{
"epoch": 0.656,
"grad_norm": 0.05235245078802109,
"learning_rate": 2e-05,
"loss": 0.0031472702976316214,
"step": 82
},
{
"epoch": 0.664,
"grad_norm": 0.0473208874464035,
"learning_rate": 2e-05,
"loss": 0.004731162916868925,
"step": 83
},
{
"epoch": 0.672,
"grad_norm": 0.05135403573513031,
"learning_rate": 2e-05,
"loss": 0.005146307405084372,
"step": 84
},
{
"epoch": 0.68,
"grad_norm": 0.04229608178138733,
"learning_rate": 2e-05,
"loss": 0.004758044611662626,
"step": 85
},
{
"epoch": 0.688,
"grad_norm": 0.04035644605755806,
"learning_rate": 2e-05,
"loss": 0.0043296488001942635,
"step": 86
},
{
"epoch": 0.696,
"grad_norm": 0.060147274285554886,
"learning_rate": 2e-05,
"loss": 0.008551320061087608,
"step": 87
},
{
"epoch": 0.704,
"grad_norm": 0.0395248718559742,
"learning_rate": 2e-05,
"loss": 0.0024903551675379276,
"step": 88
},
{
"epoch": 0.712,
"grad_norm": 0.071822389960289,
"learning_rate": 2e-05,
"loss": 0.008494703099131584,
"step": 89
},
{
"epoch": 0.72,
"grad_norm": 0.058960266411304474,
"learning_rate": 2e-05,
"loss": 0.006603310350328684,
"step": 90
},
{
"epoch": 0.728,
"grad_norm": 0.05052534490823746,
"learning_rate": 2e-05,
"loss": 0.0058289458975195885,
"step": 91
},
{
"epoch": 0.736,
"grad_norm": 0.049510154873132706,
"learning_rate": 2e-05,
"loss": 0.003644926007837057,
"step": 92
},
{
"epoch": 0.744,
"grad_norm": 0.0739966556429863,
"learning_rate": 2e-05,
"loss": 0.0028007840737700462,
"step": 93
},
{
"epoch": 0.752,
"grad_norm": 0.07646612823009491,
"learning_rate": 2e-05,
"loss": 0.010534452274441719,
"step": 94
},
{
"epoch": 0.76,
"grad_norm": 0.05939766764640808,
"learning_rate": 2e-05,
"loss": 0.004194422625005245,
"step": 95
},
{
"epoch": 0.768,
"grad_norm": 0.049664683640003204,
"learning_rate": 2e-05,
"loss": 0.003597400849685073,
"step": 96
},
{
"epoch": 0.776,
"grad_norm": 0.13988253474235535,
"learning_rate": 2e-05,
"loss": 0.006600011605769396,
"step": 97
},
{
"epoch": 0.784,
"grad_norm": 0.06141381338238716,
"learning_rate": 2e-05,
"loss": 0.004176464397460222,
"step": 98
},
{
"epoch": 0.792,
"grad_norm": 0.040125612169504166,
"learning_rate": 2e-05,
"loss": 0.0029954789206385612,
"step": 99
},
{
"epoch": 0.8,
"grad_norm": 0.05379870533943176,
"learning_rate": 2e-05,
"loss": 0.005120614543557167,
"step": 100
},
{
"epoch": 0.808,
"grad_norm": 0.04878966137766838,
"learning_rate": 2e-05,
"loss": 0.0049518863670527935,
"step": 101
},
{
"epoch": 0.816,
"grad_norm": 0.0832071602344513,
"learning_rate": 2e-05,
"loss": 0.003636852605268359,
"step": 102
},
{
"epoch": 0.824,
"grad_norm": 0.1109263077378273,
"learning_rate": 2e-05,
"loss": 0.011921115219593048,
"step": 103
},
{
"epoch": 0.832,
"grad_norm": 0.037266287952661514,
"learning_rate": 2e-05,
"loss": 0.002762642689049244,
"step": 104
},
{
"epoch": 0.84,
"grad_norm": 0.044354166835546494,
"learning_rate": 2e-05,
"loss": 0.004988430067896843,
"step": 105
},
{
"epoch": 0.848,
"grad_norm": 0.03570897877216339,
"learning_rate": 2e-05,
"loss": 0.002259196015074849,
"step": 106
},
{
"epoch": 0.856,
"grad_norm": 0.059259530156850815,
"learning_rate": 2e-05,
"loss": 0.006721946410834789,
"step": 107
},
{
"epoch": 0.864,
"grad_norm": 0.05184999480843544,
"learning_rate": 2e-05,
"loss": 0.005531419534236193,
"step": 108
},
{
"epoch": 0.872,
"grad_norm": 0.08037418127059937,
"learning_rate": 2e-05,
"loss": 0.006799847353249788,
"step": 109
},
{
"epoch": 0.88,
"grad_norm": 0.039056453853845596,
"learning_rate": 2e-05,
"loss": 0.00481954962015152,
"step": 110
},
{
"epoch": 0.888,
"grad_norm": 0.05626671388745308,
"learning_rate": 2e-05,
"loss": 0.0032779546454548836,
"step": 111
},
{
"epoch": 0.896,
"grad_norm": 0.05177405849099159,
"learning_rate": 2e-05,
"loss": 0.004294276237487793,
"step": 112
},
{
"epoch": 0.904,
"grad_norm": 0.029522892087697983,
"learning_rate": 2e-05,
"loss": 0.0030598388984799385,
"step": 113
},
{
"epoch": 0.912,
"grad_norm": 0.05130866542458534,
"learning_rate": 2e-05,
"loss": 0.005800556857138872,
"step": 114
},
{
"epoch": 0.92,
"grad_norm": 0.021749891340732574,
"learning_rate": 2e-05,
"loss": 0.001492157345637679,
"step": 115
},
{
"epoch": 0.928,
"grad_norm": 0.0728369727730751,
"learning_rate": 2e-05,
"loss": 0.008168019354343414,
"step": 116
},
{
"epoch": 0.936,
"grad_norm": 0.051655277609825134,
"learning_rate": 2e-05,
"loss": 0.004517991095781326,
"step": 117
},
{
"epoch": 0.944,
"grad_norm": 0.028527911752462387,
"learning_rate": 2e-05,
"loss": 0.004356182646006346,
"step": 118
},
{
"epoch": 0.952,
"grad_norm": 0.04092099890112877,
"learning_rate": 2e-05,
"loss": 0.0035778400488197803,
"step": 119
},
{
"epoch": 0.96,
"grad_norm": 0.06751365959644318,
"learning_rate": 2e-05,
"loss": 0.006765933241695166,
"step": 120
},
{
"epoch": 0.968,
"grad_norm": 0.06141749769449234,
"learning_rate": 2e-05,
"loss": 0.010381967760622501,
"step": 121
},
{
"epoch": 0.976,
"grad_norm": 0.0584125854074955,
"learning_rate": 2e-05,
"loss": 0.0059956214390695095,
"step": 122
},
{
"epoch": 0.984,
"grad_norm": 0.06699343770742416,
"learning_rate": 2e-05,
"loss": 0.006007581949234009,
"step": 123
},
{
"epoch": 0.992,
"grad_norm": 0.04457642510533333,
"learning_rate": 2e-05,
"loss": 0.00433978158980608,
"step": 124
},
{
"epoch": 1.0,
"grad_norm": 0.0724361315369606,
"learning_rate": 2e-05,
"loss": 0.009294194169342518,
"step": 125
},
{
"epoch": 1.008,
"grad_norm": 0.041911620646715164,
"learning_rate": 2e-05,
"loss": 0.0031240973621606827,
"step": 126
},
{
"epoch": 1.016,
"grad_norm": 0.03944513201713562,
"learning_rate": 2e-05,
"loss": 0.005666844546794891,
"step": 127
},
{
"epoch": 1.024,
"grad_norm": 0.024236207827925682,
"learning_rate": 2e-05,
"loss": 0.002599143423140049,
"step": 128
},
{
"epoch": 1.032,
"grad_norm": 0.02648847922682762,
"learning_rate": 2e-05,
"loss": 0.002489139325916767,
"step": 129
},
{
"epoch": 1.04,
"grad_norm": 0.03522297367453575,
"learning_rate": 2e-05,
"loss": 0.0031560207717120647,
"step": 130
},
{
"epoch": 1.048,
"grad_norm": 0.03963733837008476,
"learning_rate": 2e-05,
"loss": 0.002944512525573373,
"step": 131
},
{
"epoch": 1.056,
"grad_norm": 0.043245717883110046,
"learning_rate": 2e-05,
"loss": 0.005929629784077406,
"step": 132
},
{
"epoch": 1.064,
"grad_norm": 0.04024028778076172,
"learning_rate": 2e-05,
"loss": 0.0028088355902582407,
"step": 133
},
{
"epoch": 1.072,
"grad_norm": 0.03739921376109123,
"learning_rate": 2e-05,
"loss": 0.0025795348919928074,
"step": 134
},
{
"epoch": 1.08,
"grad_norm": 0.053612496703863144,
"learning_rate": 2e-05,
"loss": 0.0051528215408325195,
"step": 135
},
{
"epoch": 1.088,
"grad_norm": 0.03874121978878975,
"learning_rate": 2e-05,
"loss": 0.0029356672894209623,
"step": 136
},
{
"epoch": 1.096,
"grad_norm": 0.04209478199481964,
"learning_rate": 2e-05,
"loss": 0.004753364250063896,
"step": 137
},
{
"epoch": 1.104,
"grad_norm": 0.032321907579898834,
"learning_rate": 2e-05,
"loss": 0.002570532029494643,
"step": 138
},
{
"epoch": 1.112,
"grad_norm": 0.03770575299859047,
"learning_rate": 2e-05,
"loss": 0.0032067985739558935,
"step": 139
},
{
"epoch": 1.12,
"grad_norm": 0.042145032435655594,
"learning_rate": 2e-05,
"loss": 0.004715348593890667,
"step": 140
},
{
"epoch": 1.1280000000000001,
"grad_norm": 0.04259483888745308,
"learning_rate": 2e-05,
"loss": 0.0040532853454351425,
"step": 141
},
{
"epoch": 1.1360000000000001,
"grad_norm": 0.04432355985045433,
"learning_rate": 2e-05,
"loss": 0.004878481850028038,
"step": 142
},
{
"epoch": 1.144,
"grad_norm": 0.04144922271370888,
"learning_rate": 2e-05,
"loss": 0.0035966027062386274,
"step": 143
},
{
"epoch": 1.152,
"grad_norm": 0.034188415855169296,
"learning_rate": 2e-05,
"loss": 0.0035179737024009228,
"step": 144
},
{
"epoch": 1.16,
"grad_norm": 0.04314472898840904,
"learning_rate": 2e-05,
"loss": 0.00275869807228446,
"step": 145
},
{
"epoch": 1.168,
"grad_norm": 0.03345927596092224,
"learning_rate": 2e-05,
"loss": 0.004454055335372686,
"step": 146
},
{
"epoch": 1.176,
"grad_norm": 0.032709989696741104,
"learning_rate": 2e-05,
"loss": 0.002561516361311078,
"step": 147
},
{
"epoch": 1.184,
"grad_norm": 0.037629563361406326,
"learning_rate": 2e-05,
"loss": 0.002726494800299406,
"step": 148
},
{
"epoch": 1.192,
"grad_norm": 0.03565853834152222,
"learning_rate": 2e-05,
"loss": 0.005714224185794592,
"step": 149
},
{
"epoch": 1.2,
"grad_norm": 0.04101553559303284,
"learning_rate": 2e-05,
"loss": 0.00477135693654418,
"step": 150
},
{
"epoch": 1.208,
"grad_norm": 0.02103736251592636,
"learning_rate": 2e-05,
"loss": 0.00214054505340755,
"step": 151
},
{
"epoch": 1.216,
"grad_norm": 0.038353558629751205,
"learning_rate": 2e-05,
"loss": 0.0023091635666787624,
"step": 152
},
{
"epoch": 1.224,
"grad_norm": 0.03039981611073017,
"learning_rate": 2e-05,
"loss": 0.002429583575576544,
"step": 153
},
{
"epoch": 1.232,
"grad_norm": 0.038060858845710754,
"learning_rate": 2e-05,
"loss": 0.0024876513052731752,
"step": 154
},
{
"epoch": 1.24,
"grad_norm": 0.10335491597652435,
"learning_rate": 2e-05,
"loss": 0.0025280544068664312,
"step": 155
},
{
"epoch": 1.248,
"grad_norm": 0.040877990424633026,
"learning_rate": 2e-05,
"loss": 0.004313280805945396,
"step": 156
},
{
"epoch": 1.256,
"grad_norm": 0.05562249571084976,
"learning_rate": 2e-05,
"loss": 0.0048119621351361275,
"step": 157
},
{
"epoch": 1.264,
"grad_norm": 0.05108984187245369,
"learning_rate": 2e-05,
"loss": 0.00518863694742322,
"step": 158
},
{
"epoch": 1.272,
"grad_norm": 0.05357106775045395,
"learning_rate": 2e-05,
"loss": 0.0024496042169630527,
"step": 159
},
{
"epoch": 1.28,
"grad_norm": 0.037901945412158966,
"learning_rate": 2e-05,
"loss": 0.002475207205861807,
"step": 160
},
{
"epoch": 1.288,
"grad_norm": 0.0420001782476902,
"learning_rate": 2e-05,
"loss": 0.0058222366496920586,
"step": 161
},
{
"epoch": 1.296,
"grad_norm": 0.05443611368536949,
"learning_rate": 2e-05,
"loss": 0.0052161430940032005,
"step": 162
},
{
"epoch": 1.304,
"grad_norm": 0.05211922898888588,
"learning_rate": 2e-05,
"loss": 0.004603986628353596,
"step": 163
},
{
"epoch": 1.312,
"grad_norm": 0.04726783558726311,
"learning_rate": 2e-05,
"loss": 0.004252967424690723,
"step": 164
},
{
"epoch": 1.32,
"grad_norm": 0.07070634514093399,
"learning_rate": 2e-05,
"loss": 0.006596374791115522,
"step": 165
},
{
"epoch": 1.328,
"grad_norm": 0.05988767370581627,
"learning_rate": 2e-05,
"loss": 0.006062244065105915,
"step": 166
},
{
"epoch": 1.336,
"grad_norm": 0.06943166255950928,
"learning_rate": 2e-05,
"loss": 0.007745644543319941,
"step": 167
},
{
"epoch": 1.3439999999999999,
"grad_norm": 0.03787314146757126,
"learning_rate": 2e-05,
"loss": 0.003922807518392801,
"step": 168
},
{
"epoch": 1.3519999999999999,
"grad_norm": 0.02878367155790329,
"learning_rate": 2e-05,
"loss": 0.0019241905538365245,
"step": 169
},
{
"epoch": 1.3599999999999999,
"grad_norm": 0.05218566954135895,
"learning_rate": 2e-05,
"loss": 0.0058232140727341175,
"step": 170
},
{
"epoch": 1.3679999999999999,
"grad_norm": 0.06744556874036789,
"learning_rate": 2e-05,
"loss": 0.004936105106025934,
"step": 171
},
{
"epoch": 1.376,
"grad_norm": 0.04349220544099808,
"learning_rate": 2e-05,
"loss": 0.003136698855087161,
"step": 172
},
{
"epoch": 1.384,
"grad_norm": 0.046757787466049194,
"learning_rate": 2e-05,
"loss": 0.004662223160266876,
"step": 173
},
{
"epoch": 1.392,
"grad_norm": 0.03483404964208603,
"learning_rate": 2e-05,
"loss": 0.007330790627747774,
"step": 174
},
{
"epoch": 1.4,
"grad_norm": 0.050741445273160934,
"learning_rate": 2e-05,
"loss": 0.005321471951901913,
"step": 175
},
{
"epoch": 1.408,
"grad_norm": 0.06053789332509041,
"learning_rate": 2e-05,
"loss": 0.007614850997924805,
"step": 176
},
{
"epoch": 1.416,
"grad_norm": 0.045350395143032074,
"learning_rate": 2e-05,
"loss": 0.003982958849519491,
"step": 177
},
{
"epoch": 1.424,
"grad_norm": 0.04105447977781296,
"learning_rate": 2e-05,
"loss": 0.0032091487664729357,
"step": 178
},
{
"epoch": 1.432,
"grad_norm": 0.03485438972711563,
"learning_rate": 2e-05,
"loss": 0.0034181310329586267,
"step": 179
},
{
"epoch": 1.44,
"grad_norm": 0.0427364781498909,
"learning_rate": 2e-05,
"loss": 0.005363878328353167,
"step": 180
},
{
"epoch": 1.448,
"grad_norm": 0.031005240976810455,
"learning_rate": 2e-05,
"loss": 0.003898187540471554,
"step": 181
},
{
"epoch": 1.456,
"grad_norm": 0.030742423608899117,
"learning_rate": 2e-05,
"loss": 0.0026354389265179634,
"step": 182
},
{
"epoch": 1.464,
"grad_norm": 0.04213688522577286,
"learning_rate": 2e-05,
"loss": 0.003235624171793461,
"step": 183
},
{
"epoch": 1.472,
"grad_norm": 0.06017177179455757,
"learning_rate": 2e-05,
"loss": 0.004921246785670519,
"step": 184
},
{
"epoch": 1.48,
"grad_norm": 0.05274427682161331,
"learning_rate": 2e-05,
"loss": 0.006431959569454193,
"step": 185
},
{
"epoch": 1.488,
"grad_norm": 0.03465743735432625,
"learning_rate": 2e-05,
"loss": 0.0017982947174459696,
"step": 186
},
{
"epoch": 1.496,
"grad_norm": 0.031407665461301804,
"learning_rate": 2e-05,
"loss": 0.002308888593688607,
"step": 187
},
{
"epoch": 1.504,
"grad_norm": 0.04751557856798172,
"learning_rate": 2e-05,
"loss": 0.0022526727989315987,
"step": 188
},
{
"epoch": 1.512,
"grad_norm": 0.03473098948597908,
"learning_rate": 2e-05,
"loss": 0.0023300114553421736,
"step": 189
},
{
"epoch": 1.52,
"grad_norm": 0.02745967172086239,
"learning_rate": 2e-05,
"loss": 0.002407602034509182,
"step": 190
},
{
"epoch": 1.528,
"grad_norm": 0.05958602949976921,
"learning_rate": 2e-05,
"loss": 0.007107679732143879,
"step": 191
},
{
"epoch": 1.536,
"grad_norm": 0.05794493481516838,
"learning_rate": 2e-05,
"loss": 0.006767779588699341,
"step": 192
},
{
"epoch": 1.544,
"grad_norm": 0.037513379007577896,
"learning_rate": 2e-05,
"loss": 0.003455360187217593,
"step": 193
},
{
"epoch": 1.552,
"grad_norm": 0.03977490961551666,
"learning_rate": 2e-05,
"loss": 0.004349147900938988,
"step": 194
},
{
"epoch": 1.56,
"grad_norm": 0.03297000005841255,
"learning_rate": 2e-05,
"loss": 0.004090302158147097,
"step": 195
},
{
"epoch": 1.568,
"grad_norm": 0.03089851886034012,
"learning_rate": 2e-05,
"loss": 0.0032683194149285555,
"step": 196
},
{
"epoch": 1.576,
"grad_norm": 0.03224420174956322,
"learning_rate": 2e-05,
"loss": 0.0024244794622063637,
"step": 197
},
{
"epoch": 1.584,
"grad_norm": 0.030442802235484123,
"learning_rate": 2e-05,
"loss": 0.0014301001792773604,
"step": 198
},
{
"epoch": 1.592,
"grad_norm": 0.05126398056745529,
"learning_rate": 2e-05,
"loss": 0.0027298659551888704,
"step": 199
},
{
"epoch": 1.6,
"grad_norm": 0.05423342436552048,
"learning_rate": 2e-05,
"loss": 0.006995318457484245,
"step": 200
},
{
"epoch": 1.608,
"grad_norm": 0.02536446414887905,
"learning_rate": 2e-05,
"loss": 0.0029984633438289165,
"step": 201
},
{
"epoch": 1.616,
"grad_norm": 0.03072509542107582,
"learning_rate": 2e-05,
"loss": 0.0033400985412299633,
"step": 202
},
{
"epoch": 1.624,
"grad_norm": 0.055368877947330475,
"learning_rate": 2e-05,
"loss": 0.004085185006260872,
"step": 203
},
{
"epoch": 1.6320000000000001,
"grad_norm": 0.03939943388104439,
"learning_rate": 2e-05,
"loss": 0.003322000615298748,
"step": 204
},
{
"epoch": 1.6400000000000001,
"grad_norm": 0.044486552476882935,
"learning_rate": 2e-05,
"loss": 0.002586575224995613,
"step": 205
},
{
"epoch": 1.6480000000000001,
"grad_norm": 0.05059683322906494,
"learning_rate": 2e-05,
"loss": 0.010476172901690006,
"step": 206
},
{
"epoch": 1.6560000000000001,
"grad_norm": 0.04618003964424133,
"learning_rate": 2e-05,
"loss": 0.004687571432441473,
"step": 207
},
{
"epoch": 1.6640000000000001,
"grad_norm": 0.03308900445699692,
"learning_rate": 2e-05,
"loss": 0.004028619267046452,
"step": 208
},
{
"epoch": 1.6720000000000002,
"grad_norm": 0.038209252059459686,
"learning_rate": 2e-05,
"loss": 0.0027929157949984074,
"step": 209
},
{
"epoch": 1.6800000000000002,
"grad_norm": 0.034491200000047684,
"learning_rate": 2e-05,
"loss": 0.001778338453732431,
"step": 210
},
{
"epoch": 1.688,
"grad_norm": 0.07821262627840042,
"learning_rate": 2e-05,
"loss": 0.005375068634748459,
"step": 211
},
{
"epoch": 1.696,
"grad_norm": 0.04657049477100372,
"learning_rate": 2e-05,
"loss": 0.003136474872007966,
"step": 212
},
{
"epoch": 1.704,
"grad_norm": 0.05357731506228447,
"learning_rate": 2e-05,
"loss": 0.006239030975848436,
"step": 213
},
{
"epoch": 1.712,
"grad_norm": 0.04918161407113075,
"learning_rate": 2e-05,
"loss": 0.004385227337479591,
"step": 214
},
{
"epoch": 1.72,
"grad_norm": 0.04051123186945915,
"learning_rate": 2e-05,
"loss": 0.0024626629892736673,
"step": 215
},
{
"epoch": 1.728,
"grad_norm": 0.034734904766082764,
"learning_rate": 2e-05,
"loss": 0.0024731624871492386,
"step": 216
},
{
"epoch": 1.736,
"grad_norm": 0.06079041212797165,
"learning_rate": 2e-05,
"loss": 0.004821632523089647,
"step": 217
},
{
"epoch": 1.744,
"grad_norm": 0.04052048176527023,
"learning_rate": 2e-05,
"loss": 0.003583197481930256,
"step": 218
},
{
"epoch": 1.752,
"grad_norm": 0.03803209960460663,
"learning_rate": 2e-05,
"loss": 0.0032860925421118736,
"step": 219
},
{
"epoch": 1.76,
"grad_norm": 0.03718697279691696,
"learning_rate": 2e-05,
"loss": 0.0028506568633019924,
"step": 220
},
{
"epoch": 1.768,
"grad_norm": 0.020328527316451073,
"learning_rate": 2e-05,
"loss": 0.0030127556528896093,
"step": 221
},
{
"epoch": 1.776,
"grad_norm": 0.03647777810692787,
"learning_rate": 2e-05,
"loss": 0.0029757029842585325,
"step": 222
},
{
"epoch": 1.784,
"grad_norm": 0.03103819489479065,
"learning_rate": 2e-05,
"loss": 0.002474813023582101,
"step": 223
},
{
"epoch": 1.792,
"grad_norm": 0.031560298055410385,
"learning_rate": 2e-05,
"loss": 0.002314931945875287,
"step": 224
},
{
"epoch": 1.8,
"grad_norm": 0.03549206256866455,
"learning_rate": 2e-05,
"loss": 0.0032754004932940006,
"step": 225
},
{
"epoch": 1.808,
"grad_norm": 0.03429936245083809,
"learning_rate": 2e-05,
"loss": 0.003921601455658674,
"step": 226
},
{
"epoch": 1.8159999999999998,
"grad_norm": 0.06855639815330505,
"learning_rate": 2e-05,
"loss": 0.006101913750171661,
"step": 227
},
{
"epoch": 1.8239999999999998,
"grad_norm": 0.08064403384923935,
"learning_rate": 2e-05,
"loss": 0.004588215611875057,
"step": 228
},
{
"epoch": 1.8319999999999999,
"grad_norm": 0.03363880142569542,
"learning_rate": 2e-05,
"loss": 0.001759383245371282,
"step": 229
},
{
"epoch": 1.8399999999999999,
"grad_norm": 0.04351300746202469,
"learning_rate": 2e-05,
"loss": 0.0032918578945100307,
"step": 230
},
{
"epoch": 1.8479999999999999,
"grad_norm": 0.024159353226423264,
"learning_rate": 2e-05,
"loss": 0.0019000337924808264,
"step": 231
},
{
"epoch": 1.8559999999999999,
"grad_norm": 0.04056349769234657,
"learning_rate": 2e-05,
"loss": 0.003138928906992078,
"step": 232
},
{
"epoch": 1.8639999999999999,
"grad_norm": 0.026023566722869873,
"learning_rate": 2e-05,
"loss": 0.0033341734670102596,
"step": 233
},
{
"epoch": 1.8719999999999999,
"grad_norm": 0.06581102311611176,
"learning_rate": 2e-05,
"loss": 0.0065653664059937,
"step": 234
},
{
"epoch": 1.88,
"grad_norm": 0.04903842508792877,
"learning_rate": 2e-05,
"loss": 0.005071278661489487,
"step": 235
},
{
"epoch": 1.888,
"grad_norm": 0.09484432637691498,
"learning_rate": 2e-05,
"loss": 0.0026917962823063135,
"step": 236
},
{
"epoch": 1.896,
"grad_norm": 0.029802817851305008,
"learning_rate": 2e-05,
"loss": 0.0020737922750413418,
"step": 237
},
{
"epoch": 1.904,
"grad_norm": 0.030020302161574364,
"learning_rate": 2e-05,
"loss": 0.001601328724063933,
"step": 238
},
{
"epoch": 1.912,
"grad_norm": 0.023855257779359818,
"learning_rate": 2e-05,
"loss": 0.002171756699681282,
"step": 239
},
{
"epoch": 1.92,
"grad_norm": 0.04743681848049164,
"learning_rate": 2e-05,
"loss": 0.005675522144883871,
"step": 240
},
{
"epoch": 1.928,
"grad_norm": 0.05006203055381775,
"learning_rate": 2e-05,
"loss": 0.005861939862370491,
"step": 241
},
{
"epoch": 1.936,
"grad_norm": 0.04128265008330345,
"learning_rate": 2e-05,
"loss": 0.005003426223993301,
"step": 242
},
{
"epoch": 1.944,
"grad_norm": 0.06207670643925667,
"learning_rate": 2e-05,
"loss": 0.004483950790017843,
"step": 243
},
{
"epoch": 1.952,
"grad_norm": 0.07824505865573883,
"learning_rate": 2e-05,
"loss": 0.004859112203121185,
"step": 244
},
{
"epoch": 1.96,
"grad_norm": 0.04579395800828934,
"learning_rate": 2e-05,
"loss": 0.004692354239523411,
"step": 245
},
{
"epoch": 1.968,
"grad_norm": 0.04180062189698219,
"learning_rate": 2e-05,
"loss": 0.00455811619758606,
"step": 246
},
{
"epoch": 1.976,
"grad_norm": 0.03964953497052193,
"learning_rate": 2e-05,
"loss": 0.0028610117733478546,
"step": 247
},
{
"epoch": 1.984,
"grad_norm": 0.03513772413134575,
"learning_rate": 2e-05,
"loss": 0.0025510897394269705,
"step": 248
},
{
"epoch": 1.992,
"grad_norm": 0.030972128733992577,
"learning_rate": 2e-05,
"loss": 0.00266153528355062,
"step": 249
},
{
"epoch": 2.0,
"grad_norm": 0.06495940685272217,
"learning_rate": 2e-05,
"loss": 0.005316338501870632,
"step": 250
},
{
"epoch": 2.008,
"grad_norm": 0.03911746293306351,
"learning_rate": 2e-05,
"loss": 0.003454022342339158,
"step": 251
},
{
"epoch": 2.016,
"grad_norm": 0.03907843679189682,
"learning_rate": 2e-05,
"loss": 0.002617109566926956,
"step": 252
},
{
"epoch": 2.024,
"grad_norm": 0.0325784757733345,
"learning_rate": 2e-05,
"loss": 0.003027692437171936,
"step": 253
},
{
"epoch": 2.032,
"grad_norm": 0.04280916228890419,
"learning_rate": 2e-05,
"loss": 0.003725123591721058,
"step": 254
},
{
"epoch": 2.04,
"grad_norm": 0.03285227715969086,
"learning_rate": 2e-05,
"loss": 0.002418406307697296,
"step": 255
},
{
"epoch": 2.048,
"grad_norm": 0.04505843669176102,
"learning_rate": 2e-05,
"loss": 0.0030923697631806135,
"step": 256
},
{
"epoch": 2.056,
"grad_norm": 0.02693861722946167,
"learning_rate": 2e-05,
"loss": 0.0029823114164173603,
"step": 257
},
{
"epoch": 2.064,
"grad_norm": 0.03501451015472412,
"learning_rate": 2e-05,
"loss": 0.0022289499174803495,
"step": 258
},
{
"epoch": 2.072,
"grad_norm": 0.04407954588532448,
"learning_rate": 2e-05,
"loss": 0.005173118785023689,
"step": 259
},
{
"epoch": 2.08,
"grad_norm": 0.03353921324014664,
"learning_rate": 2e-05,
"loss": 0.003529382636770606,
"step": 260
},
{
"epoch": 2.088,
"grad_norm": 0.03029395453631878,
"learning_rate": 2e-05,
"loss": 0.0025696109514683485,
"step": 261
},
{
"epoch": 2.096,
"grad_norm": 0.043411292135715485,
"learning_rate": 2e-05,
"loss": 0.0032275894191116095,
"step": 262
},
{
"epoch": 2.104,
"grad_norm": 0.025156555697321892,
"learning_rate": 2e-05,
"loss": 0.0019941977225244045,
"step": 263
},
{
"epoch": 2.112,
"grad_norm": 0.05474105849862099,
"learning_rate": 2e-05,
"loss": 0.006130381021648645,
"step": 264
},
{
"epoch": 2.12,
"grad_norm": 0.026152821257710457,
"learning_rate": 2e-05,
"loss": 0.0037242607213556767,
"step": 265
},
{
"epoch": 2.128,
"grad_norm": 0.04658479988574982,
"learning_rate": 2e-05,
"loss": 0.0027500735595822334,
"step": 266
},
{
"epoch": 2.136,
"grad_norm": 0.04310692846775055,
"learning_rate": 2e-05,
"loss": 0.0021111357491463423,
"step": 267
},
{
"epoch": 2.144,
"grad_norm": 0.03860605135560036,
"learning_rate": 2e-05,
"loss": 0.004491395782679319,
"step": 268
},
{
"epoch": 2.152,
"grad_norm": 0.019513150677084923,
"learning_rate": 2e-05,
"loss": 0.0019580726511776447,
"step": 269
},
{
"epoch": 2.16,
"grad_norm": 0.03170303627848625,
"learning_rate": 2e-05,
"loss": 0.001965203322470188,
"step": 270
},
{
"epoch": 2.168,
"grad_norm": 0.02094845101237297,
"learning_rate": 2e-05,
"loss": 0.001287441118620336,
"step": 271
},
{
"epoch": 2.176,
"grad_norm": 0.03304935246706009,
"learning_rate": 2e-05,
"loss": 0.0032492834143340588,
"step": 272
},
{
"epoch": 2.184,
"grad_norm": 0.03120725229382515,
"learning_rate": 2e-05,
"loss": 0.0029026831034570932,
"step": 273
},
{
"epoch": 2.192,
"grad_norm": 0.03816477581858635,
"learning_rate": 2e-05,
"loss": 0.0024198577739298344,
"step": 274
},
{
"epoch": 2.2,
"grad_norm": 0.039687663316726685,
"learning_rate": 2e-05,
"loss": 0.0031529159750789404,
"step": 275
},
{
"epoch": 2.208,
"grad_norm": 0.026106711477041245,
"learning_rate": 2e-05,
"loss": 0.002224068157374859,
"step": 276
},
{
"epoch": 2.216,
"grad_norm": 0.027437372133135796,
"learning_rate": 2e-05,
"loss": 0.0014647672651335597,
"step": 277
},
{
"epoch": 2.224,
"grad_norm": 0.05910545587539673,
"learning_rate": 2e-05,
"loss": 0.00243214494548738,
"step": 278
},
{
"epoch": 2.232,
"grad_norm": 0.02404620312154293,
"learning_rate": 2e-05,
"loss": 0.00222192844375968,
"step": 279
},
{
"epoch": 2.24,
"grad_norm": 0.03369680047035217,
"learning_rate": 2e-05,
"loss": 0.001881018397398293,
"step": 280
},
{
"epoch": 2.248,
"grad_norm": 0.039129581302404404,
"learning_rate": 2e-05,
"loss": 0.0031921733170747757,
"step": 281
},
{
"epoch": 2.2560000000000002,
"grad_norm": 0.026752755045890808,
"learning_rate": 2e-05,
"loss": 0.0027538840658962727,
"step": 282
},
{
"epoch": 2.2640000000000002,
"grad_norm": 0.07003916054964066,
"learning_rate": 2e-05,
"loss": 0.005947021301835775,
"step": 283
},
{
"epoch": 2.2720000000000002,
"grad_norm": 0.031368181109428406,
"learning_rate": 2e-05,
"loss": 0.0035742626059800386,
"step": 284
},
{
"epoch": 2.2800000000000002,
"grad_norm": 0.027074171230196953,
"learning_rate": 2e-05,
"loss": 0.0021643084473907948,
"step": 285
},
{
"epoch": 2.288,
"grad_norm": 0.023025641217827797,
"learning_rate": 2e-05,
"loss": 0.0017899582162499428,
"step": 286
},
{
"epoch": 2.296,
"grad_norm": 0.03725794330239296,
"learning_rate": 2e-05,
"loss": 0.0034590037539601326,
"step": 287
},
{
"epoch": 2.304,
"grad_norm": 0.04669518023729324,
"learning_rate": 2e-05,
"loss": 0.003809502115473151,
"step": 288
},
{
"epoch": 2.312,
"grad_norm": 0.031050648540258408,
"learning_rate": 2e-05,
"loss": 0.003041312098503113,
"step": 289
},
{
"epoch": 2.32,
"grad_norm": 0.03626548871397972,
"learning_rate": 2e-05,
"loss": 0.0024002999998629093,
"step": 290
},
{
"epoch": 2.328,
"grad_norm": 0.06315096467733383,
"learning_rate": 2e-05,
"loss": 0.006624164525419474,
"step": 291
},
{
"epoch": 2.336,
"grad_norm": 0.04203896224498749,
"learning_rate": 2e-05,
"loss": 0.0019566724076867104,
"step": 292
},
{
"epoch": 2.344,
"grad_norm": 0.04634423181414604,
"learning_rate": 2e-05,
"loss": 0.0032502529211342335,
"step": 293
},
{
"epoch": 2.352,
"grad_norm": 0.04237474128603935,
"learning_rate": 2e-05,
"loss": 0.0031427519861608744,
"step": 294
},
{
"epoch": 2.36,
"grad_norm": 0.04034377261996269,
"learning_rate": 2e-05,
"loss": 0.00422636279836297,
"step": 295
},
{
"epoch": 2.368,
"grad_norm": 0.044460564851760864,
"learning_rate": 2e-05,
"loss": 0.0028524911031126976,
"step": 296
},
{
"epoch": 2.376,
"grad_norm": 0.0697890892624855,
"learning_rate": 2e-05,
"loss": 0.0036988966166973114,
"step": 297
},
{
"epoch": 2.384,
"grad_norm": 0.04324623942375183,
"learning_rate": 2e-05,
"loss": 0.0037890365347266197,
"step": 298
},
{
"epoch": 2.392,
"grad_norm": 0.02138633094727993,
"learning_rate": 2e-05,
"loss": 0.0021952460519969463,
"step": 299
},
{
"epoch": 2.4,
"grad_norm": 0.03607005998492241,
"learning_rate": 2e-05,
"loss": 0.002349622081965208,
"step": 300
},
{
"epoch": 2.408,
"grad_norm": 0.039072196930646896,
"learning_rate": 2e-05,
"loss": 0.0035770011600106955,
"step": 301
},
{
"epoch": 2.416,
"grad_norm": 0.02861890196800232,
"learning_rate": 2e-05,
"loss": 0.002283460693433881,
"step": 302
},
{
"epoch": 2.424,
"grad_norm": 0.035563308745622635,
"learning_rate": 2e-05,
"loss": 0.0026536290533840656,
"step": 303
},
{
"epoch": 2.432,
"grad_norm": 0.03916006535291672,
"learning_rate": 2e-05,
"loss": 0.003950632177293301,
"step": 304
},
{
"epoch": 2.44,
"grad_norm": 0.039335884153842926,
"learning_rate": 2e-05,
"loss": 0.003372431267052889,
"step": 305
},
{
"epoch": 2.448,
"grad_norm": 0.045527540147304535,
"learning_rate": 2e-05,
"loss": 0.0030923227313905954,
"step": 306
},
{
"epoch": 2.456,
"grad_norm": 0.04456671327352524,
"learning_rate": 2e-05,
"loss": 0.004458888433873653,
"step": 307
},
{
"epoch": 2.464,
"grad_norm": 0.03560574725270271,
"learning_rate": 2e-05,
"loss": 0.003171511460095644,
"step": 308
},
{
"epoch": 2.472,
"grad_norm": 0.036603160202503204,
"learning_rate": 2e-05,
"loss": 0.0028585128020495176,
"step": 309
},
{
"epoch": 2.48,
"grad_norm": 0.03335639089345932,
"learning_rate": 2e-05,
"loss": 0.0023816449102014303,
"step": 310
},
{
"epoch": 2.488,
"grad_norm": 0.030154302716255188,
"learning_rate": 2e-05,
"loss": 0.00486906711012125,
"step": 311
},
{
"epoch": 2.496,
"grad_norm": 0.040795303881168365,
"learning_rate": 2e-05,
"loss": 0.003139256499707699,
"step": 312
},
{
"epoch": 2.504,
"grad_norm": 0.04953761771321297,
"learning_rate": 2e-05,
"loss": 0.0039007822051644325,
"step": 313
},
{
"epoch": 2.512,
"grad_norm": 0.12026029080152512,
"learning_rate": 2e-05,
"loss": 0.0038295963313430548,
"step": 314
},
{
"epoch": 2.52,
"grad_norm": 0.057940348982810974,
"learning_rate": 2e-05,
"loss": 0.0033367923460900784,
"step": 315
},
{
"epoch": 2.528,
"grad_norm": 0.028937026858329773,
"learning_rate": 2e-05,
"loss": 0.001545312232337892,
"step": 316
},
{
"epoch": 2.536,
"grad_norm": 0.03167141228914261,
"learning_rate": 2e-05,
"loss": 0.0028309039771556854,
"step": 317
},
{
"epoch": 2.544,
"grad_norm": 0.04004928842186928,
"learning_rate": 2e-05,
"loss": 0.002698655240237713,
"step": 318
},
{
"epoch": 2.552,
"grad_norm": 0.02045566588640213,
"learning_rate": 2e-05,
"loss": 0.0012601229827851057,
"step": 319
},
{
"epoch": 2.56,
"grad_norm": 0.03342553600668907,
"learning_rate": 2e-05,
"loss": 0.001859499723650515,
"step": 320
},
{
"epoch": 2.568,
"grad_norm": 0.025396211072802544,
"learning_rate": 2e-05,
"loss": 0.0020996080711483955,
"step": 321
},
{
"epoch": 2.576,
"grad_norm": 0.03771315887570381,
"learning_rate": 2e-05,
"loss": 0.005717152263969183,
"step": 322
},
{
"epoch": 2.584,
"grad_norm": 0.02477932535111904,
"learning_rate": 2e-05,
"loss": 0.0024716444313526154,
"step": 323
},
{
"epoch": 2.592,
"grad_norm": 0.031247377395629883,
"learning_rate": 2e-05,
"loss": 0.00390324997715652,
"step": 324
},
{
"epoch": 2.6,
"grad_norm": 0.04134252667427063,
"learning_rate": 2e-05,
"loss": 0.003920188173651695,
"step": 325
},
{
"epoch": 2.608,
"grad_norm": 0.02774622291326523,
"learning_rate": 2e-05,
"loss": 0.0022154548205435276,
"step": 326
},
{
"epoch": 2.616,
"grad_norm": 0.03957367688417435,
"learning_rate": 2e-05,
"loss": 0.0023058855440467596,
"step": 327
},
{
"epoch": 2.624,
"grad_norm": 0.04483708739280701,
"learning_rate": 2e-05,
"loss": 0.002552008954808116,
"step": 328
},
{
"epoch": 2.632,
"grad_norm": 0.02093776874244213,
"learning_rate": 2e-05,
"loss": 0.0027019393164664507,
"step": 329
},
{
"epoch": 2.64,
"grad_norm": 0.06742503494024277,
"learning_rate": 2e-05,
"loss": 0.008755444549024105,
"step": 330
},
{
"epoch": 2.648,
"grad_norm": 0.038483329117298126,
"learning_rate": 2e-05,
"loss": 0.0028858440928161144,
"step": 331
},
{
"epoch": 2.656,
"grad_norm": 0.0329829640686512,
"learning_rate": 2e-05,
"loss": 0.0024300175718963146,
"step": 332
},
{
"epoch": 2.664,
"grad_norm": 0.051471542567014694,
"learning_rate": 2e-05,
"loss": 0.003998158499598503,
"step": 333
},
{
"epoch": 2.672,
"grad_norm": 0.04422187805175781,
"learning_rate": 2e-05,
"loss": 0.004651157651096582,
"step": 334
},
{
"epoch": 2.68,
"grad_norm": 0.02528465911746025,
"learning_rate": 2e-05,
"loss": 0.0021933559328317642,
"step": 335
},
{
"epoch": 2.6879999999999997,
"grad_norm": 0.030596323311328888,
"learning_rate": 2e-05,
"loss": 0.003947809804230928,
"step": 336
},
{
"epoch": 2.6959999999999997,
"grad_norm": 0.04210244491696358,
"learning_rate": 2e-05,
"loss": 0.003154753241688013,
"step": 337
},
{
"epoch": 2.7039999999999997,
"grad_norm": 0.06121843308210373,
"learning_rate": 2e-05,
"loss": 0.0029088810551911592,
"step": 338
},
{
"epoch": 2.7119999999999997,
"grad_norm": 0.03322814777493477,
"learning_rate": 2e-05,
"loss": 0.0026830481365323067,
"step": 339
},
{
"epoch": 2.7199999999999998,
"grad_norm": 0.03890882432460785,
"learning_rate": 2e-05,
"loss": 0.002993557136505842,
"step": 340
},
{
"epoch": 2.7279999999999998,
"grad_norm": 0.03936028108000755,
"learning_rate": 2e-05,
"loss": 0.0023103575222194195,
"step": 341
},
{
"epoch": 2.7359999999999998,
"grad_norm": 0.03645415976643562,
"learning_rate": 2e-05,
"loss": 0.0036545468028634787,
"step": 342
},
{
"epoch": 2.7439999999999998,
"grad_norm": 0.04062900319695473,
"learning_rate": 2e-05,
"loss": 0.0036479239352047443,
"step": 343
},
{
"epoch": 2.752,
"grad_norm": 0.049033768475055695,
"learning_rate": 2e-05,
"loss": 0.0034971858840435743,
"step": 344
},
{
"epoch": 2.76,
"grad_norm": 0.03926759585738182,
"learning_rate": 2e-05,
"loss": 0.0031690222676843405,
"step": 345
},
{
"epoch": 2.768,
"grad_norm": 0.06413634121417999,
"learning_rate": 2e-05,
"loss": 0.004980374127626419,
"step": 346
},
{
"epoch": 2.776,
"grad_norm": 0.04801516979932785,
"learning_rate": 2e-05,
"loss": 0.0037698009982705116,
"step": 347
},
{
"epoch": 2.784,
"grad_norm": 0.03702208027243614,
"learning_rate": 2e-05,
"loss": 0.001877334201708436,
"step": 348
},
{
"epoch": 2.792,
"grad_norm": 0.03120242804288864,
"learning_rate": 2e-05,
"loss": 0.0022658274974673986,
"step": 349
},
{
"epoch": 2.8,
"grad_norm": 0.048766590654850006,
"learning_rate": 2e-05,
"loss": 0.00202578236348927,
"step": 350
},
{
"epoch": 2.808,
"grad_norm": 0.029100535437464714,
"learning_rate": 2e-05,
"loss": 0.004179732408374548,
"step": 351
},
{
"epoch": 2.816,
"grad_norm": 0.04512881860136986,
"learning_rate": 2e-05,
"loss": 0.002607448725029826,
"step": 352
},
{
"epoch": 2.824,
"grad_norm": 0.07799641042947769,
"learning_rate": 2e-05,
"loss": 0.004347057081758976,
"step": 353
},
{
"epoch": 2.832,
"grad_norm": 0.04792260378599167,
"learning_rate": 2e-05,
"loss": 0.003629413666203618,
"step": 354
},
{
"epoch": 2.84,
"grad_norm": 0.11515104025602341,
"learning_rate": 2e-05,
"loss": 0.006446151994168758,
"step": 355
},
{
"epoch": 2.848,
"grad_norm": 0.023408330976963043,
"learning_rate": 2e-05,
"loss": 0.0017018368234857917,
"step": 356
},
{
"epoch": 2.856,
"grad_norm": 0.03008626215159893,
"learning_rate": 2e-05,
"loss": 0.002287666779011488,
"step": 357
},
{
"epoch": 2.864,
"grad_norm": 0.03706612437963486,
"learning_rate": 2e-05,
"loss": 0.0028982325457036495,
"step": 358
},
{
"epoch": 2.872,
"grad_norm": 0.020318036898970604,
"learning_rate": 2e-05,
"loss": 0.0018703520763665438,
"step": 359
},
{
"epoch": 2.88,
"grad_norm": 0.06123220548033714,
"learning_rate": 2e-05,
"loss": 0.0029717511497437954,
"step": 360
},
{
"epoch": 2.888,
"grad_norm": 0.055422086268663406,
"learning_rate": 2e-05,
"loss": 0.004031006712466478,
"step": 361
},
{
"epoch": 2.896,
"grad_norm": 0.036786146461963654,
"learning_rate": 2e-05,
"loss": 0.003937885165214539,
"step": 362
},
{
"epoch": 2.904,
"grad_norm": 0.038341671228408813,
"learning_rate": 2e-05,
"loss": 0.002436596667394042,
"step": 363
},
{
"epoch": 2.912,
"grad_norm": 0.03609547019004822,
"learning_rate": 2e-05,
"loss": 0.004547444172203541,
"step": 364
},
{
"epoch": 2.92,
"grad_norm": 0.06485926359891891,
"learning_rate": 2e-05,
"loss": 0.003946429584175348,
"step": 365
},
{
"epoch": 2.928,
"grad_norm": 0.04949840530753136,
"learning_rate": 2e-05,
"loss": 0.00502239353954792,
"step": 366
},
{
"epoch": 2.936,
"grad_norm": 0.0354098416864872,
"learning_rate": 2e-05,
"loss": 0.002601196290925145,
"step": 367
},
{
"epoch": 2.944,
"grad_norm": 0.025988208130002022,
"learning_rate": 2e-05,
"loss": 0.0036114591639488935,
"step": 368
},
{
"epoch": 2.952,
"grad_norm": 0.034603431820869446,
"learning_rate": 2e-05,
"loss": 0.0026605837047100067,
"step": 369
},
{
"epoch": 2.96,
"grad_norm": 0.045072562992572784,
"learning_rate": 2e-05,
"loss": 0.002992109628394246,
"step": 370
},
{
"epoch": 2.968,
"grad_norm": 0.07029342651367188,
"learning_rate": 2e-05,
"loss": 0.004379983991384506,
"step": 371
},
{
"epoch": 2.976,
"grad_norm": 0.013431387022137642,
"learning_rate": 2e-05,
"loss": 0.0030165393836796284,
"step": 372
},
{
"epoch": 2.984,
"grad_norm": 0.046111706644296646,
"learning_rate": 2e-05,
"loss": 0.0029378868639469147,
"step": 373
},
{
"epoch": 2.992,
"grad_norm": 0.05583514645695686,
"learning_rate": 2e-05,
"loss": 0.0040816557593643665,
"step": 374
},
{
"epoch": 3.0,
"grad_norm": 0.03255736827850342,
"learning_rate": 2e-05,
"loss": 0.0035074178595095873,
"step": 375
},
{
"epoch": 3.008,
"grad_norm": 0.03124692291021347,
"learning_rate": 2e-05,
"loss": 0.0031269516330212355,
"step": 376
},
{
"epoch": 3.016,
"grad_norm": 0.05301191285252571,
"learning_rate": 2e-05,
"loss": 0.004872915334999561,
"step": 377
},
{
"epoch": 3.024,
"grad_norm": 0.037463486194610596,
"learning_rate": 2e-05,
"loss": 0.0030003672000020742,
"step": 378
},
{
"epoch": 3.032,
"grad_norm": 0.03362922742962837,
"learning_rate": 2e-05,
"loss": 0.0018557708244770765,
"step": 379
},
{
"epoch": 3.04,
"grad_norm": 0.042213547974824905,
"learning_rate": 2e-05,
"loss": 0.0038657563272863626,
"step": 380
},
{
"epoch": 3.048,
"grad_norm": 0.020529089495539665,
"learning_rate": 2e-05,
"loss": 0.0015072536189109087,
"step": 381
},
{
"epoch": 3.056,
"grad_norm": 0.07512009888887405,
"learning_rate": 2e-05,
"loss": 0.004759274888783693,
"step": 382
},
{
"epoch": 3.064,
"grad_norm": 0.03783705085515976,
"learning_rate": 2e-05,
"loss": 0.0032726821955293417,
"step": 383
},
{
"epoch": 3.072,
"grad_norm": 0.04495864734053612,
"learning_rate": 2e-05,
"loss": 0.003068119753152132,
"step": 384
},
{
"epoch": 3.08,
"grad_norm": 0.03879435732960701,
"learning_rate": 2e-05,
"loss": 0.0027257727924734354,
"step": 385
},
{
"epoch": 3.088,
"grad_norm": 0.049851685762405396,
"learning_rate": 2e-05,
"loss": 0.004501521587371826,
"step": 386
},
{
"epoch": 3.096,
"grad_norm": 0.037314675748348236,
"learning_rate": 2e-05,
"loss": 0.0031016827560961246,
"step": 387
},
{
"epoch": 3.104,
"grad_norm": 0.032761648297309875,
"learning_rate": 2e-05,
"loss": 0.0029233950190246105,
"step": 388
},
{
"epoch": 3.112,
"grad_norm": 0.0324791744351387,
"learning_rate": 2e-05,
"loss": 0.0026512390468269587,
"step": 389
},
{
"epoch": 3.12,
"grad_norm": 0.03452916815876961,
"learning_rate": 2e-05,
"loss": 0.003484592540189624,
"step": 390
},
{
"epoch": 3.128,
"grad_norm": 0.04120925813913345,
"learning_rate": 2e-05,
"loss": 0.0027602710761129856,
"step": 391
},
{
"epoch": 3.136,
"grad_norm": 0.03730145841836929,
"learning_rate": 2e-05,
"loss": 0.003531615249812603,
"step": 392
},
{
"epoch": 3.144,
"grad_norm": 0.03210754320025444,
"learning_rate": 2e-05,
"loss": 0.0023888859432190657,
"step": 393
},
{
"epoch": 3.152,
"grad_norm": 0.036783989518880844,
"learning_rate": 2e-05,
"loss": 0.0027839350514113903,
"step": 394
},
{
"epoch": 3.16,
"grad_norm": 0.03480631858110428,
"learning_rate": 2e-05,
"loss": 0.0027098648715764284,
"step": 395
},
{
"epoch": 3.168,
"grad_norm": 0.03560803085565567,
"learning_rate": 2e-05,
"loss": 0.003286743303760886,
"step": 396
},
{
"epoch": 3.176,
"grad_norm": 0.02866840735077858,
"learning_rate": 2e-05,
"loss": 0.0024349656887352467,
"step": 397
},
{
"epoch": 3.184,
"grad_norm": 0.025658991187810898,
"learning_rate": 2e-05,
"loss": 0.0043978262692689896,
"step": 398
},
{
"epoch": 3.192,
"grad_norm": 0.030603215098381042,
"learning_rate": 2e-05,
"loss": 0.0023162788711488247,
"step": 399
},
{
"epoch": 3.2,
"grad_norm": 0.05031350627541542,
"learning_rate": 2e-05,
"loss": 0.0037095744628459215,
"step": 400
}
],
"logging_steps": 1,
"max_steps": 400,
"num_input_tokens_seen": 0,
"num_train_epochs": 4,
"save_steps": 200,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}