lykycy123's picture
Upload folder using huggingface_hub
8552947 verified
Raw
History Blame Contribute Delete
118 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 8.626887131560029,
"eval_steps": 200,
"global_step": 12000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.014378145219266714,
"grad_norm": 13.937178004920169,
"learning_rate": 1e-05,
"loss": 18.6782,
"step": 20
},
{
"epoch": 0.02875629043853343,
"grad_norm": 20.49830614432723,
"learning_rate": 2e-05,
"loss": 8.8375,
"step": 40
},
{
"epoch": 0.043134435657800146,
"grad_norm": 10.509818823590434,
"learning_rate": 3e-05,
"loss": 5.0096,
"step": 60
},
{
"epoch": 0.05751258087706686,
"grad_norm": 13.333465056972562,
"learning_rate": 4e-05,
"loss": 4.6984,
"step": 80
},
{
"epoch": 0.07189072609633357,
"grad_norm": 13.540983325678864,
"learning_rate": 5e-05,
"loss": 4.427,
"step": 100
},
{
"epoch": 0.08626887131560029,
"grad_norm": 15.962923973587186,
"learning_rate": 4.9999686370195435e-05,
"loss": 4.2845,
"step": 120
},
{
"epoch": 0.100647016534867,
"grad_norm": 11.92374627236117,
"learning_rate": 4.999874548952517e-05,
"loss": 4.1259,
"step": 140
},
{
"epoch": 0.11502516175413371,
"grad_norm": 14.900646876279996,
"learning_rate": 4.9997177384219275e-05,
"loss": 3.8399,
"step": 160
},
{
"epoch": 0.12940330697340044,
"grad_norm": 14.115020370573196,
"learning_rate": 4.9994982097993705e-05,
"loss": 3.7164,
"step": 180
},
{
"epoch": 0.14378145219266714,
"grad_norm": 13.842427549451594,
"learning_rate": 4.9992159692049106e-05,
"loss": 3.6876,
"step": 200
},
{
"epoch": 0.14378145219266714,
"eval_loss": 3.6155073642730713,
"eval_runtime": 95.5893,
"eval_samples_per_second": 7.428,
"eval_steps_per_second": 1.862,
"step": 200
},
{
"epoch": 0.15815959741193386,
"grad_norm": 10.199143919340026,
"learning_rate": 4.998871024506907e-05,
"loss": 3.6115,
"step": 220
},
{
"epoch": 0.17253774263120059,
"grad_norm": 9.516108728115162,
"learning_rate": 4.998463385321802e-05,
"loss": 3.5405,
"step": 240
},
{
"epoch": 0.18691588785046728,
"grad_norm": 9.609898798360511,
"learning_rate": 4.997993063013842e-05,
"loss": 3.5089,
"step": 260
},
{
"epoch": 0.201294033069734,
"grad_norm": 11.18927433524985,
"learning_rate": 4.9974600706947685e-05,
"loss": 3.5087,
"step": 280
},
{
"epoch": 0.21567217828900073,
"grad_norm": 14.617569385949311,
"learning_rate": 4.9968644232234515e-05,
"loss": 3.4338,
"step": 300
},
{
"epoch": 0.23005032350826743,
"grad_norm": 10.794051016445927,
"learning_rate": 4.9962061372054716e-05,
"loss": 3.4752,
"step": 320
},
{
"epoch": 0.24442846872753415,
"grad_norm": 9.000217292113932,
"learning_rate": 4.995485230992664e-05,
"loss": 3.3947,
"step": 340
},
{
"epoch": 0.2588066139468009,
"grad_norm": 9.266337425892882,
"learning_rate": 4.9947017246825985e-05,
"loss": 3.3028,
"step": 360
},
{
"epoch": 0.2731847591660676,
"grad_norm": 8.423464250163468,
"learning_rate": 4.993855640118024e-05,
"loss": 3.3037,
"step": 380
},
{
"epoch": 0.2875629043853343,
"grad_norm": 8.272065753761918,
"learning_rate": 4.992947000886259e-05,
"loss": 3.2657,
"step": 400
},
{
"epoch": 0.2875629043853343,
"eval_loss": 3.230403423309326,
"eval_runtime": 95.1984,
"eval_samples_per_second": 7.458,
"eval_steps_per_second": 1.87,
"step": 400
},
{
"epoch": 0.301941049604601,
"grad_norm": 8.839983816131488,
"learning_rate": 4.991975832318535e-05,
"loss": 3.1932,
"step": 420
},
{
"epoch": 0.3163191948238677,
"grad_norm": 8.856492618425404,
"learning_rate": 4.990942161489288e-05,
"loss": 3.1429,
"step": 440
},
{
"epoch": 0.33069734004313445,
"grad_norm": 9.670041618980777,
"learning_rate": 4.989846017215405e-05,
"loss": 3.1421,
"step": 460
},
{
"epoch": 0.34507548526240117,
"grad_norm": 6.904135887349451,
"learning_rate": 4.988687430055421e-05,
"loss": 3.1368,
"step": 480
},
{
"epoch": 0.35945363048166784,
"grad_norm": 6.888500849133581,
"learning_rate": 4.9874664323086664e-05,
"loss": 3.0697,
"step": 500
},
{
"epoch": 0.37383177570093457,
"grad_norm": 8.164493023374266,
"learning_rate": 4.9861830580143667e-05,
"loss": 3.0454,
"step": 520
},
{
"epoch": 0.3882099209202013,
"grad_norm": 6.1924738330609435,
"learning_rate": 4.984837342950691e-05,
"loss": 2.9824,
"step": 540
},
{
"epoch": 0.402588066139468,
"grad_norm": 8.330870217150185,
"learning_rate": 4.9834293246337624e-05,
"loss": 2.9539,
"step": 560
},
{
"epoch": 0.41696621135873474,
"grad_norm": 7.244659927731791,
"learning_rate": 4.9819590423166025e-05,
"loss": 2.9438,
"step": 580
},
{
"epoch": 0.43134435657800146,
"grad_norm": 7.623837159975234,
"learning_rate": 4.980426536988043e-05,
"loss": 2.9326,
"step": 600
},
{
"epoch": 0.43134435657800146,
"eval_loss": 2.913550853729248,
"eval_runtime": 95.0135,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.873,
"step": 600
},
{
"epoch": 0.44572250179726813,
"grad_norm": 6.237340146754397,
"learning_rate": 4.978831851371582e-05,
"loss": 2.871,
"step": 620
},
{
"epoch": 0.46010064701653486,
"grad_norm": 7.573306240835855,
"learning_rate": 4.977175029924191e-05,
"loss": 2.8492,
"step": 640
},
{
"epoch": 0.4744787922358016,
"grad_norm": 7.724747647956487,
"learning_rate": 4.975456118835079e-05,
"loss": 2.8832,
"step": 660
},
{
"epoch": 0.4888569374550683,
"grad_norm": 6.727877105924332,
"learning_rate": 4.9736751660243995e-05,
"loss": 2.8508,
"step": 680
},
{
"epoch": 0.503235082674335,
"grad_norm": 7.036877939774848,
"learning_rate": 4.971832221141922e-05,
"loss": 2.7735,
"step": 700
},
{
"epoch": 0.5176132278936018,
"grad_norm": 6.425217642566599,
"learning_rate": 4.9699273355656395e-05,
"loss": 2.8373,
"step": 720
},
{
"epoch": 0.5319913731128685,
"grad_norm": 7.139491878078851,
"learning_rate": 4.967960562400343e-05,
"loss": 2.8005,
"step": 740
},
{
"epoch": 0.5463695183321352,
"grad_norm": 6.962818464552354,
"learning_rate": 4.965931956476139e-05,
"loss": 2.7754,
"step": 760
},
{
"epoch": 0.5607476635514018,
"grad_norm": 6.130103303233823,
"learning_rate": 4.9638415743469166e-05,
"loss": 2.7736,
"step": 780
},
{
"epoch": 0.5751258087706685,
"grad_norm": 6.386819454037992,
"learning_rate": 4.961689474288779e-05,
"loss": 2.7793,
"step": 800
},
{
"epoch": 0.5751258087706685,
"eval_loss": 2.709056854248047,
"eval_runtime": 95.0293,
"eval_samples_per_second": 7.471,
"eval_steps_per_second": 1.873,
"step": 800
},
{
"epoch": 0.5895039539899353,
"grad_norm": 5.813420223779441,
"learning_rate": 4.9594757162984125e-05,
"loss": 2.6778,
"step": 820
},
{
"epoch": 0.603882099209202,
"grad_norm": 6.505329742987656,
"learning_rate": 4.9572003620914135e-05,
"loss": 2.6418,
"step": 840
},
{
"epoch": 0.6182602444284687,
"grad_norm": 6.617793894804718,
"learning_rate": 4.954863475100575e-05,
"loss": 2.705,
"step": 860
},
{
"epoch": 0.6326383896477354,
"grad_norm": 5.6982849971736735,
"learning_rate": 4.952465120474111e-05,
"loss": 2.6715,
"step": 880
},
{
"epoch": 0.6470165348670022,
"grad_norm": 5.245475499523757,
"learning_rate": 4.9500053650738424e-05,
"loss": 2.6979,
"step": 900
},
{
"epoch": 0.6613946800862689,
"grad_norm": 6.518600695845765,
"learning_rate": 4.947484277473333e-05,
"loss": 2.6556,
"step": 920
},
{
"epoch": 0.6757728253055356,
"grad_norm": 6.574489220293872,
"learning_rate": 4.944901927955983e-05,
"loss": 2.5944,
"step": 940
},
{
"epoch": 0.6901509705248023,
"grad_norm": 5.826636755254408,
"learning_rate": 4.942258388513058e-05,
"loss": 2.6557,
"step": 960
},
{
"epoch": 0.7045291157440691,
"grad_norm": 6.035387909646663,
"learning_rate": 4.9395537328416926e-05,
"loss": 2.5915,
"step": 980
},
{
"epoch": 0.7189072609633357,
"grad_norm": 6.506861395374483,
"learning_rate": 4.9367880363428326e-05,
"loss": 2.5252,
"step": 1000
},
{
"epoch": 0.7189072609633357,
"eval_loss": 2.5883359909057617,
"eval_runtime": 95.0936,
"eval_samples_per_second": 7.466,
"eval_steps_per_second": 1.872,
"step": 1000
},
{
"epoch": 0.7332854061826024,
"grad_norm": 5.796511184070567,
"learning_rate": 4.933961376119131e-05,
"loss": 2.5934,
"step": 1020
},
{
"epoch": 0.7476635514018691,
"grad_norm": 5.718979865140408,
"learning_rate": 4.9310738309728005e-05,
"loss": 2.5455,
"step": 1040
},
{
"epoch": 0.7620416966211359,
"grad_norm": 6.548958558102242,
"learning_rate": 4.928125481403416e-05,
"loss": 2.5356,
"step": 1060
},
{
"epoch": 0.7764198418404026,
"grad_norm": 5.969122402157584,
"learning_rate": 4.9251164096056716e-05,
"loss": 2.5008,
"step": 1080
},
{
"epoch": 0.7907979870596693,
"grad_norm": 6.006148622274345,
"learning_rate": 4.922046699467087e-05,
"loss": 2.5651,
"step": 1100
},
{
"epoch": 0.805176132278936,
"grad_norm": 5.329905924324714,
"learning_rate": 4.91891643656567e-05,
"loss": 2.5288,
"step": 1120
},
{
"epoch": 0.8195542774982028,
"grad_norm": 5.829019019143035,
"learning_rate": 4.9157257081675315e-05,
"loss": 2.5328,
"step": 1140
},
{
"epoch": 0.8339324227174695,
"grad_norm": 5.3120393934176615,
"learning_rate": 4.91247460322445e-05,
"loss": 2.5215,
"step": 1160
},
{
"epoch": 0.8483105679367362,
"grad_norm": 5.290424926561275,
"learning_rate": 4.909163212371396e-05,
"loss": 2.4913,
"step": 1180
},
{
"epoch": 0.8626887131560029,
"grad_norm": 6.150607558485341,
"learning_rate": 4.905791627924003e-05,
"loss": 2.4608,
"step": 1200
},
{
"epoch": 0.8626887131560029,
"eval_loss": 2.4695942401885986,
"eval_runtime": 95.1459,
"eval_samples_per_second": 7.462,
"eval_steps_per_second": 1.871,
"step": 1200
},
{
"epoch": 0.8770668583752695,
"grad_norm": 6.051042465807221,
"learning_rate": 4.902359943875992e-05,
"loss": 2.5229,
"step": 1220
},
{
"epoch": 0.8914450035945363,
"grad_norm": 5.702742394427446,
"learning_rate": 4.898868255896554e-05,
"loss": 2.4682,
"step": 1240
},
{
"epoch": 0.905823148813803,
"grad_norm": 6.148635539706346,
"learning_rate": 4.895316661327681e-05,
"loss": 2.4568,
"step": 1260
},
{
"epoch": 0.9202012940330697,
"grad_norm": 5.878117654483529,
"learning_rate": 4.891705259181454e-05,
"loss": 2.4841,
"step": 1280
},
{
"epoch": 0.9345794392523364,
"grad_norm": 5.955112078722722,
"learning_rate": 4.888034150137284e-05,
"loss": 2.4454,
"step": 1300
},
{
"epoch": 0.9489575844716032,
"grad_norm": 5.377448785428115,
"learning_rate": 4.8843034365390985e-05,
"loss": 2.4895,
"step": 1320
},
{
"epoch": 0.9633357296908699,
"grad_norm": 5.491843912580674,
"learning_rate": 4.880513222392496e-05,
"loss": 2.4557,
"step": 1340
},
{
"epoch": 0.9777138749101366,
"grad_norm": 5.476777480493853,
"learning_rate": 4.8766636133618445e-05,
"loss": 2.4179,
"step": 1360
},
{
"epoch": 0.9920920201294033,
"grad_norm": 5.378173923329988,
"learning_rate": 4.87275471676733e-05,
"loss": 2.4075,
"step": 1380
},
{
"epoch": 1.00647016534867,
"grad_norm": 5.596761747726064,
"learning_rate": 4.868786641581976e-05,
"loss": 2.3865,
"step": 1400
},
{
"epoch": 1.00647016534867,
"eval_loss": 2.3786544799804688,
"eval_runtime": 94.8751,
"eval_samples_per_second": 7.484,
"eval_steps_per_second": 1.876,
"step": 1400
},
{
"epoch": 1.0208483105679367,
"grad_norm": 5.326022614677014,
"learning_rate": 4.864759498428593e-05,
"loss": 2.327,
"step": 1420
},
{
"epoch": 1.0352264557872035,
"grad_norm": 6.495868359551248,
"learning_rate": 4.860673399576704e-05,
"loss": 2.3197,
"step": 1440
},
{
"epoch": 1.0496046010064701,
"grad_norm": 5.462694782280911,
"learning_rate": 4.856528458939409e-05,
"loss": 2.3436,
"step": 1460
},
{
"epoch": 1.063982746225737,
"grad_norm": 5.384927039412702,
"learning_rate": 4.8523247920702125e-05,
"loss": 2.3136,
"step": 1480
},
{
"epoch": 1.0783608914450036,
"grad_norm": 5.090764977050729,
"learning_rate": 4.8480625161598e-05,
"loss": 2.3654,
"step": 1500
},
{
"epoch": 1.0927390366642702,
"grad_norm": 5.309844430144479,
"learning_rate": 4.8437417500327743e-05,
"loss": 2.3043,
"step": 1520
},
{
"epoch": 1.107117181883537,
"grad_norm": 4.924758754588879,
"learning_rate": 4.839362614144337e-05,
"loss": 2.3204,
"step": 1540
},
{
"epoch": 1.1214953271028036,
"grad_norm": 5.288805304382869,
"learning_rate": 4.834925230576936e-05,
"loss": 2.2613,
"step": 1560
},
{
"epoch": 1.1358734723220705,
"grad_norm": 5.040956404855601,
"learning_rate": 4.830429723036859e-05,
"loss": 2.3143,
"step": 1580
},
{
"epoch": 1.150251617541337,
"grad_norm": 5.305191213745783,
"learning_rate": 4.825876216850786e-05,
"loss": 2.3042,
"step": 1600
},
{
"epoch": 1.150251617541337,
"eval_loss": 2.3024840354919434,
"eval_runtime": 94.9448,
"eval_samples_per_second": 7.478,
"eval_steps_per_second": 1.875,
"step": 1600
},
{
"epoch": 1.164629762760604,
"grad_norm": 5.542476079404831,
"learning_rate": 4.821264838962297e-05,
"loss": 2.2448,
"step": 1620
},
{
"epoch": 1.1790079079798705,
"grad_norm": 4.977786731713276,
"learning_rate": 4.816595717928327e-05,
"loss": 2.2687,
"step": 1640
},
{
"epoch": 1.1933860531991374,
"grad_norm": 4.860822092234981,
"learning_rate": 4.81186898391559e-05,
"loss": 2.296,
"step": 1660
},
{
"epoch": 1.207764198418404,
"grad_norm": 4.996822570004754,
"learning_rate": 4.8070847686969445e-05,
"loss": 2.3022,
"step": 1680
},
{
"epoch": 1.2221423436376708,
"grad_norm": 5.428353577618062,
"learning_rate": 4.8022432056477227e-05,
"loss": 2.2673,
"step": 1700
},
{
"epoch": 1.2365204888569374,
"grad_norm": 5.143612704057496,
"learning_rate": 4.797344429742011e-05,
"loss": 2.1917,
"step": 1720
},
{
"epoch": 1.2508986340762043,
"grad_norm": 5.578333721803896,
"learning_rate": 4.792388577548888e-05,
"loss": 2.2253,
"step": 1740
},
{
"epoch": 1.2652767792954709,
"grad_norm": 5.247867553076536,
"learning_rate": 4.7873757872286155e-05,
"loss": 2.2293,
"step": 1760
},
{
"epoch": 1.2796549245147375,
"grad_norm": 4.72091682638746,
"learning_rate": 4.78230619852879e-05,
"loss": 2.2164,
"step": 1780
},
{
"epoch": 1.2940330697340043,
"grad_norm": 5.133994887533224,
"learning_rate": 4.777179952780443e-05,
"loss": 2.1816,
"step": 1800
},
{
"epoch": 1.2940330697340043,
"eval_loss": 2.2219223976135254,
"eval_runtime": 95.1892,
"eval_samples_per_second": 7.459,
"eval_steps_per_second": 1.87,
"step": 1800
},
{
"epoch": 1.308411214953271,
"grad_norm": 4.730535398567502,
"learning_rate": 4.7719971928941045e-05,
"loss": 2.1896,
"step": 1820
},
{
"epoch": 1.3227893601725378,
"grad_norm": 4.672694454266816,
"learning_rate": 4.766758063355815e-05,
"loss": 2.1846,
"step": 1840
},
{
"epoch": 1.3371675053918044,
"grad_norm": 4.7523968527644325,
"learning_rate": 4.761462710223101e-05,
"loss": 2.2532,
"step": 1860
},
{
"epoch": 1.3515456506110712,
"grad_norm": 4.516026828742153,
"learning_rate": 4.756111281120904e-05,
"loss": 2.2534,
"step": 1880
},
{
"epoch": 1.3659237958303379,
"grad_norm": 4.432300805541551,
"learning_rate": 4.750703925237458e-05,
"loss": 2.2089,
"step": 1900
},
{
"epoch": 1.3803019410496047,
"grad_norm": 4.795880373336302,
"learning_rate": 4.745240793320139e-05,
"loss": 2.2101,
"step": 1920
},
{
"epoch": 1.3946800862688713,
"grad_norm": 4.8910070970343185,
"learning_rate": 4.739722037671259e-05,
"loss": 2.1776,
"step": 1940
},
{
"epoch": 1.409058231488138,
"grad_norm": 4.46472714877697,
"learning_rate": 4.734147812143818e-05,
"loss": 2.2407,
"step": 1960
},
{
"epoch": 1.4234363767074047,
"grad_norm": 4.902232368473849,
"learning_rate": 4.728518272137216e-05,
"loss": 2.1787,
"step": 1980
},
{
"epoch": 1.4378145219266716,
"grad_norm": 4.819924921281692,
"learning_rate": 4.722833574592922e-05,
"loss": 2.1519,
"step": 2000
},
{
"epoch": 1.4378145219266716,
"eval_loss": 2.1631219387054443,
"eval_runtime": 95.0925,
"eval_samples_per_second": 7.466,
"eval_steps_per_second": 1.872,
"step": 2000
},
{
"epoch": 1.4521926671459382,
"grad_norm": 4.672668068479392,
"learning_rate": 4.7170938779901015e-05,
"loss": 2.1637,
"step": 2020
},
{
"epoch": 1.4665708123652048,
"grad_norm": 5.388392208921704,
"learning_rate": 4.711299342341189e-05,
"loss": 2.1336,
"step": 2040
},
{
"epoch": 1.4809489575844716,
"grad_norm": 4.79200407089135,
"learning_rate": 4.7054501291874385e-05,
"loss": 2.1339,
"step": 2060
},
{
"epoch": 1.4953271028037383,
"grad_norm": 4.606110348514495,
"learning_rate": 4.6995464015944124e-05,
"loss": 2.1594,
"step": 2080
},
{
"epoch": 1.509705248023005,
"grad_norm": 5.142696896062446,
"learning_rate": 4.693588324147437e-05,
"loss": 2.105,
"step": 2100
},
{
"epoch": 1.5240833932422717,
"grad_norm": 4.933737837357054,
"learning_rate": 4.6875760629470156e-05,
"loss": 2.2051,
"step": 2120
},
{
"epoch": 1.5384615384615383,
"grad_norm": 4.728725090484288,
"learning_rate": 4.6815097856041986e-05,
"loss": 2.0752,
"step": 2140
},
{
"epoch": 1.5528396836808052,
"grad_norm": 5.1965116031535,
"learning_rate": 4.675389661235908e-05,
"loss": 2.1272,
"step": 2160
},
{
"epoch": 1.567217828900072,
"grad_norm": 5.020583160820166,
"learning_rate": 4.669215860460226e-05,
"loss": 2.21,
"step": 2180
},
{
"epoch": 1.5815959741193386,
"grad_norm": 5.290821603607888,
"learning_rate": 4.662988555391632e-05,
"loss": 2.0615,
"step": 2200
},
{
"epoch": 1.5815959741193386,
"eval_loss": 2.1068339347839355,
"eval_runtime": 94.9668,
"eval_samples_per_second": 7.476,
"eval_steps_per_second": 1.874,
"step": 2200
},
{
"epoch": 1.5959741193386052,
"grad_norm": 5.335021892876329,
"learning_rate": 4.656707919636215e-05,
"loss": 2.1474,
"step": 2220
},
{
"epoch": 1.610352264557872,
"grad_norm": 4.7933400957844166,
"learning_rate": 4.650374128286825e-05,
"loss": 2.0574,
"step": 2240
},
{
"epoch": 1.624730409777139,
"grad_norm": 4.44113623853496,
"learning_rate": 4.6439873579181934e-05,
"loss": 2.1114,
"step": 2260
},
{
"epoch": 1.6391085549964055,
"grad_norm": 4.801726947544004,
"learning_rate": 4.637547786582015e-05,
"loss": 2.0935,
"step": 2280
},
{
"epoch": 1.6534867002156721,
"grad_norm": 5.024585732302448,
"learning_rate": 4.631055593801977e-05,
"loss": 2.0816,
"step": 2300
},
{
"epoch": 1.6678648454349387,
"grad_norm": 4.832470978945399,
"learning_rate": 4.624510960568759e-05,
"loss": 2.0396,
"step": 2320
},
{
"epoch": 1.6822429906542056,
"grad_norm": 5.0661313073550485,
"learning_rate": 4.6179140693349894e-05,
"loss": 2.097,
"step": 2340
},
{
"epoch": 1.6966211358734724,
"grad_norm": 4.679601946091209,
"learning_rate": 4.611265104010151e-05,
"loss": 2.0873,
"step": 2360
},
{
"epoch": 1.710999281092739,
"grad_norm": 4.889181786497249,
"learning_rate": 4.604564249955463e-05,
"loss": 2.0261,
"step": 2380
},
{
"epoch": 1.7253774263120056,
"grad_norm": 4.897204874625993,
"learning_rate": 4.5978116939787056e-05,
"loss": 2.0731,
"step": 2400
},
{
"epoch": 1.7253774263120056,
"eval_loss": 2.059098482131958,
"eval_runtime": 95.0053,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.874,
"step": 2400
},
{
"epoch": 1.7397555715312725,
"grad_norm": 4.603182673966091,
"learning_rate": 4.591007624329019e-05,
"loss": 2.0747,
"step": 2420
},
{
"epoch": 1.7541337167505393,
"grad_norm": 4.598991169459091,
"learning_rate": 4.5841522306916505e-05,
"loss": 2.0311,
"step": 2440
},
{
"epoch": 1.768511861969806,
"grad_norm": 4.561405494146018,
"learning_rate": 4.5772457041826675e-05,
"loss": 2.0028,
"step": 2460
},
{
"epoch": 1.7828900071890725,
"grad_norm": 4.993259426284276,
"learning_rate": 4.570288237343632e-05,
"loss": 2.0612,
"step": 2480
},
{
"epoch": 1.7972681524083394,
"grad_norm": 4.501150725728268,
"learning_rate": 4.563280024136229e-05,
"loss": 2.0074,
"step": 2500
},
{
"epoch": 1.811646297627606,
"grad_norm": 4.720772032659857,
"learning_rate": 4.556221259936861e-05,
"loss": 2.056,
"step": 2520
},
{
"epoch": 1.8260244428468728,
"grad_norm": 4.473775141788649,
"learning_rate": 4.5491121415312044e-05,
"loss": 2.0502,
"step": 2540
},
{
"epoch": 1.8404025880661394,
"grad_norm": 5.039191205621526,
"learning_rate": 4.541952867108717e-05,
"loss": 2.0809,
"step": 2560
},
{
"epoch": 1.854780733285406,
"grad_norm": 5.3961805133059,
"learning_rate": 4.534743636257119e-05,
"loss": 2.0731,
"step": 2580
},
{
"epoch": 1.8691588785046729,
"grad_norm": 4.296361775627171,
"learning_rate": 4.527484649956823e-05,
"loss": 2.0112,
"step": 2600
},
{
"epoch": 1.8691588785046729,
"eval_loss": 1.99062979221344,
"eval_runtime": 95.2886,
"eval_samples_per_second": 7.451,
"eval_steps_per_second": 1.868,
"step": 2600
},
{
"epoch": 1.8835370237239397,
"grad_norm": 4.526885996691755,
"learning_rate": 4.5201761105753376e-05,
"loss": 1.9847,
"step": 2620
},
{
"epoch": 1.8979151689432063,
"grad_norm": 4.859991156903426,
"learning_rate": 4.5128182218616205e-05,
"loss": 1.9462,
"step": 2640
},
{
"epoch": 1.912293314162473,
"grad_norm": 4.092328382365213,
"learning_rate": 4.505411188940399e-05,
"loss": 2.0464,
"step": 2660
},
{
"epoch": 1.9266714593817398,
"grad_norm": 4.354116826358398,
"learning_rate": 4.4979552183064576e-05,
"loss": 1.9533,
"step": 2680
},
{
"epoch": 1.9410496046010066,
"grad_norm": 4.5449032544302455,
"learning_rate": 4.490450517818869e-05,
"loss": 1.9692,
"step": 2700
},
{
"epoch": 1.9554277498202732,
"grad_norm": 5.280719397936687,
"learning_rate": 4.482897296695215e-05,
"loss": 1.9458,
"step": 2720
},
{
"epoch": 1.9698058950395398,
"grad_norm": 4.7994470248138805,
"learning_rate": 4.475295765505737e-05,
"loss": 1.9615,
"step": 2740
},
{
"epoch": 1.9841840402588065,
"grad_norm": 4.8825903622988385,
"learning_rate": 4.467646136167482e-05,
"loss": 1.9826,
"step": 2760
},
{
"epoch": 1.9985621854780733,
"grad_norm": 4.813498307403933,
"learning_rate": 4.459948621938382e-05,
"loss": 1.9427,
"step": 2780
},
{
"epoch": 2.01294033069734,
"grad_norm": 5.60375996728684,
"learning_rate": 4.4522034374113166e-05,
"loss": 1.8399,
"step": 2800
},
{
"epoch": 2.01294033069734,
"eval_loss": 1.9351197481155396,
"eval_runtime": 95.1114,
"eval_samples_per_second": 7.465,
"eval_steps_per_second": 1.871,
"step": 2800
},
{
"epoch": 2.0273184759166067,
"grad_norm": 5.2880499867239195,
"learning_rate": 4.444410798508125e-05,
"loss": 1.7887,
"step": 2820
},
{
"epoch": 2.0416966211358734,
"grad_norm": 4.66223325046561,
"learning_rate": 4.4365709224735926e-05,
"loss": 1.711,
"step": 2840
},
{
"epoch": 2.05607476635514,
"grad_norm": 5.318429023225783,
"learning_rate": 4.4286840278693884e-05,
"loss": 1.79,
"step": 2860
},
{
"epoch": 2.070452911574407,
"grad_norm": 5.292683858994409,
"learning_rate": 4.4207503345679765e-05,
"loss": 1.6474,
"step": 2880
},
{
"epoch": 2.0848310567936736,
"grad_norm": 5.296677049826025,
"learning_rate": 4.4127700637464834e-05,
"loss": 1.7384,
"step": 2900
},
{
"epoch": 2.0992092020129403,
"grad_norm": 5.28280964549333,
"learning_rate": 4.404743437880534e-05,
"loss": 1.7859,
"step": 2920
},
{
"epoch": 2.113587347232207,
"grad_norm": 4.748113798023336,
"learning_rate": 4.3966706807380486e-05,
"loss": 1.7709,
"step": 2940
},
{
"epoch": 2.127965492451474,
"grad_norm": 5.529063322247205,
"learning_rate": 4.388552017373005e-05,
"loss": 1.7184,
"step": 2960
},
{
"epoch": 2.1423436376707405,
"grad_norm": 4.730553126339451,
"learning_rate": 4.380387674119163e-05,
"loss": 1.7068,
"step": 2980
},
{
"epoch": 2.156721782890007,
"grad_norm": 5.36722220081261,
"learning_rate": 4.3721778785837567e-05,
"loss": 1.7063,
"step": 3000
},
{
"epoch": 2.156721782890007,
"eval_loss": 1.8719093799591064,
"eval_runtime": 95.4773,
"eval_samples_per_second": 7.436,
"eval_steps_per_second": 1.864,
"step": 3000
},
{
"epoch": 2.1710999281092738,
"grad_norm": 5.37541384535542,
"learning_rate": 4.363922859641147e-05,
"loss": 1.7258,
"step": 3020
},
{
"epoch": 2.1854780733285404,
"grad_norm": 5.131778163059225,
"learning_rate": 4.355622847426443e-05,
"loss": 1.7558,
"step": 3040
},
{
"epoch": 2.1998562185478074,
"grad_norm": 4.967901836712549,
"learning_rate": 4.347278073329086e-05,
"loss": 1.7162,
"step": 3060
},
{
"epoch": 2.214234363767074,
"grad_norm": 5.404165339373527,
"learning_rate": 4.3388887699863986e-05,
"loss": 1.6724,
"step": 3080
},
{
"epoch": 2.2286125089863407,
"grad_norm": 5.130803952362976,
"learning_rate": 4.3304551712770966e-05,
"loss": 1.7449,
"step": 3100
},
{
"epoch": 2.2429906542056073,
"grad_norm": 4.664864170941625,
"learning_rate": 4.321977512314773e-05,
"loss": 1.6572,
"step": 3120
},
{
"epoch": 2.2573687994248743,
"grad_norm": 4.6543357676765105,
"learning_rate": 4.3134560294413415e-05,
"loss": 1.7188,
"step": 3140
},
{
"epoch": 2.271746944644141,
"grad_norm": 4.870392255731223,
"learning_rate": 4.3048909602204455e-05,
"loss": 1.6856,
"step": 3160
},
{
"epoch": 2.2861250898634076,
"grad_norm": 4.555840542123253,
"learning_rate": 4.2962825434308415e-05,
"loss": 1.6203,
"step": 3180
},
{
"epoch": 2.300503235082674,
"grad_norm": 4.999945556053941,
"learning_rate": 4.2876310190597343e-05,
"loss": 1.6595,
"step": 3200
},
{
"epoch": 2.300503235082674,
"eval_loss": 1.8157068490982056,
"eval_runtime": 95.0201,
"eval_samples_per_second": 7.472,
"eval_steps_per_second": 1.873,
"step": 3200
},
{
"epoch": 2.3148813803019412,
"grad_norm": 4.420391622563157,
"learning_rate": 4.2789366282960945e-05,
"loss": 1.6973,
"step": 3220
},
{
"epoch": 2.329259525521208,
"grad_norm": 4.900419834684209,
"learning_rate": 4.270199613523927e-05,
"loss": 1.6974,
"step": 3240
},
{
"epoch": 2.3436376707404745,
"grad_norm": 5.46657776801936,
"learning_rate": 4.26142021831552e-05,
"loss": 1.6299,
"step": 3260
},
{
"epoch": 2.358015815959741,
"grad_norm": 4.788517218174894,
"learning_rate": 4.252598687424653e-05,
"loss": 1.6057,
"step": 3280
},
{
"epoch": 2.372393961179008,
"grad_norm": 5.2836220827409965,
"learning_rate": 4.243735266779769e-05,
"loss": 1.601,
"step": 3300
},
{
"epoch": 2.3867721063982748,
"grad_norm": 4.668058236987495,
"learning_rate": 4.2348302034771266e-05,
"loss": 1.6659,
"step": 3320
},
{
"epoch": 2.4011502516175414,
"grad_norm": 5.336205272825928,
"learning_rate": 4.225883745773903e-05,
"loss": 1.6947,
"step": 3340
},
{
"epoch": 2.415528396836808,
"grad_norm": 4.98177891344483,
"learning_rate": 4.2168961430812784e-05,
"loss": 1.601,
"step": 3360
},
{
"epoch": 2.4299065420560746,
"grad_norm": 5.336376016887355,
"learning_rate": 4.207867645957484e-05,
"loss": 1.6144,
"step": 3380
},
{
"epoch": 2.4442846872753416,
"grad_norm": 5.533501299379357,
"learning_rate": 4.19879850610081e-05,
"loss": 1.6488,
"step": 3400
},
{
"epoch": 2.4442846872753416,
"eval_loss": 1.744245171546936,
"eval_runtime": 95.0078,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.874,
"step": 3400
},
{
"epoch": 2.4586628324946083,
"grad_norm": 5.033513775688983,
"learning_rate": 4.1896889763425976e-05,
"loss": 1.6188,
"step": 3420
},
{
"epoch": 2.473040977713875,
"grad_norm": 5.302823160144624,
"learning_rate": 4.1805393106401804e-05,
"loss": 1.6533,
"step": 3440
},
{
"epoch": 2.4874191229331415,
"grad_norm": 5.626811550605517,
"learning_rate": 4.1713497640698145e-05,
"loss": 1.5243,
"step": 3460
},
{
"epoch": 2.5017972681524085,
"grad_norm": 5.433250478973138,
"learning_rate": 4.162120592819563e-05,
"loss": 1.6433,
"step": 3480
},
{
"epoch": 2.516175413371675,
"grad_norm": 4.356579185845903,
"learning_rate": 4.1528520541821506e-05,
"loss": 1.5712,
"step": 3500
},
{
"epoch": 2.5305535585909418,
"grad_norm": 4.606446520762733,
"learning_rate": 4.143544406547797e-05,
"loss": 1.5558,
"step": 3520
},
{
"epoch": 2.5449317038102084,
"grad_norm": 5.022208262407065,
"learning_rate": 4.13419790939701e-05,
"loss": 1.53,
"step": 3540
},
{
"epoch": 2.559309849029475,
"grad_norm": 4.389342822675082,
"learning_rate": 4.124812823293351e-05,
"loss": 1.5554,
"step": 3560
},
{
"epoch": 2.573687994248742,
"grad_norm": 5.267458390782124,
"learning_rate": 4.1153894098761734e-05,
"loss": 1.5747,
"step": 3580
},
{
"epoch": 2.5880661394680087,
"grad_norm": 4.91610950762306,
"learning_rate": 4.105927931853327e-05,
"loss": 1.5857,
"step": 3600
},
{
"epoch": 2.5880661394680087,
"eval_loss": 1.6660903692245483,
"eval_runtime": 95.1538,
"eval_samples_per_second": 7.462,
"eval_steps_per_second": 1.871,
"step": 3600
},
{
"epoch": 2.6024442846872753,
"grad_norm": 4.623110605534604,
"learning_rate": 4.096428652993834e-05,
"loss": 1.6156,
"step": 3620
},
{
"epoch": 2.616822429906542,
"grad_norm": 5.285826831072292,
"learning_rate": 4.086891838120536e-05,
"loss": 1.5897,
"step": 3640
},
{
"epoch": 2.631200575125809,
"grad_norm": 5.036548928146315,
"learning_rate": 4.077317753102712e-05,
"loss": 1.5116,
"step": 3660
},
{
"epoch": 2.6455787203450756,
"grad_norm": 4.864592432779376,
"learning_rate": 4.067706664848667e-05,
"loss": 1.5118,
"step": 3680
},
{
"epoch": 2.659956865564342,
"grad_norm": 5.5690416036717965,
"learning_rate": 4.058058841298285e-05,
"loss": 1.4525,
"step": 3700
},
{
"epoch": 2.674335010783609,
"grad_norm": 5.266841922019754,
"learning_rate": 4.048374551415569e-05,
"loss": 1.5286,
"step": 3720
},
{
"epoch": 2.6887131560028754,
"grad_norm": 4.627025718960161,
"learning_rate": 4.038654065181137e-05,
"loss": 1.5993,
"step": 3740
},
{
"epoch": 2.7030913012221425,
"grad_norm": 5.147857938923495,
"learning_rate": 4.028897653584694e-05,
"loss": 1.5422,
"step": 3760
},
{
"epoch": 2.717469446441409,
"grad_norm": 5.053721024209507,
"learning_rate": 4.019105588617482e-05,
"loss": 1.4778,
"step": 3780
},
{
"epoch": 2.7318475916606757,
"grad_norm": 5.131739605647034,
"learning_rate": 4.009278143264694e-05,
"loss": 1.4596,
"step": 3800
},
{
"epoch": 2.7318475916606757,
"eval_loss": 1.5976985692977905,
"eval_runtime": 95.1934,
"eval_samples_per_second": 7.459,
"eval_steps_per_second": 1.87,
"step": 3800
},
{
"epoch": 2.7462257368799428,
"grad_norm": 4.895509789688502,
"learning_rate": 3.999415591497864e-05,
"loss": 1.4485,
"step": 3820
},
{
"epoch": 2.7606038820992094,
"grad_norm": 5.0799875433342825,
"learning_rate": 3.9895182082672314e-05,
"loss": 1.4502,
"step": 3840
},
{
"epoch": 2.774982027318476,
"grad_norm": 5.0584022395815005,
"learning_rate": 3.979586269494072e-05,
"loss": 1.4323,
"step": 3860
},
{
"epoch": 2.7893601725377426,
"grad_norm": 5.101741306521932,
"learning_rate": 3.969620052063012e-05,
"loss": 1.4622,
"step": 3880
},
{
"epoch": 2.803738317757009,
"grad_norm": 4.765857819060766,
"learning_rate": 3.959619833814299e-05,
"loss": 1.4433,
"step": 3900
},
{
"epoch": 2.818116462976276,
"grad_norm": 4.875737592080101,
"learning_rate": 3.949585893536069e-05,
"loss": 1.4394,
"step": 3920
},
{
"epoch": 2.832494608195543,
"grad_norm": 4.9864521901230265,
"learning_rate": 3.9395185109565634e-05,
"loss": 1.4302,
"step": 3940
},
{
"epoch": 2.8468727534148095,
"grad_norm": 5.28389537523971,
"learning_rate": 3.9294179667363364e-05,
"loss": 1.4103,
"step": 3960
},
{
"epoch": 2.861250898634076,
"grad_norm": 4.929220150481026,
"learning_rate": 3.919284542460427e-05,
"loss": 1.4318,
"step": 3980
},
{
"epoch": 2.875629043853343,
"grad_norm": 4.886618764152419,
"learning_rate": 3.9091185206305156e-05,
"loss": 1.4393,
"step": 4000
},
{
"epoch": 2.875629043853343,
"eval_loss": 1.502436637878418,
"eval_runtime": 95.3353,
"eval_samples_per_second": 7.447,
"eval_steps_per_second": 1.867,
"step": 4000
},
{
"epoch": 2.89000718907261,
"grad_norm": 4.775846915898877,
"learning_rate": 3.8989201846570405e-05,
"loss": 1.3976,
"step": 4020
},
{
"epoch": 2.9043853342918764,
"grad_norm": 4.765274471722679,
"learning_rate": 3.888689818851301e-05,
"loss": 1.4515,
"step": 4040
},
{
"epoch": 2.918763479511143,
"grad_norm": 4.8233456855111765,
"learning_rate": 3.87842770841753e-05,
"loss": 1.3637,
"step": 4060
},
{
"epoch": 2.9331416247304096,
"grad_norm": 4.716409537564854,
"learning_rate": 3.868134139444945e-05,
"loss": 1.4691,
"step": 4080
},
{
"epoch": 2.9475197699496762,
"grad_norm": 5.100153466739594,
"learning_rate": 3.85780939889977e-05,
"loss": 1.386,
"step": 4100
},
{
"epoch": 2.9618979151689433,
"grad_norm": 4.588464493898721,
"learning_rate": 3.847453774617238e-05,
"loss": 1.371,
"step": 4120
},
{
"epoch": 2.97627606038821,
"grad_norm": 5.2951877031362,
"learning_rate": 3.837067555293562e-05,
"loss": 1.4062,
"step": 4140
},
{
"epoch": 2.9906542056074765,
"grad_norm": 5.073352596381499,
"learning_rate": 3.8266510304778945e-05,
"loss": 1.3603,
"step": 4160
},
{
"epoch": 3.005032350826743,
"grad_norm": 4.216009222448274,
"learning_rate": 3.816204490564247e-05,
"loss": 1.2376,
"step": 4180
},
{
"epoch": 3.01941049604601,
"grad_norm": 4.654382088054549,
"learning_rate": 3.8057282267833996e-05,
"loss": 0.9292,
"step": 4200
},
{
"epoch": 3.01941049604601,
"eval_loss": 1.4160563945770264,
"eval_runtime": 95.0513,
"eval_samples_per_second": 7.47,
"eval_steps_per_second": 1.873,
"step": 4200
},
{
"epoch": 3.033788641265277,
"grad_norm": 5.890773249177552,
"learning_rate": 3.795222531194778e-05,
"loss": 0.9939,
"step": 4220
},
{
"epoch": 3.0481667864845434,
"grad_norm": 5.273040812138102,
"learning_rate": 3.784687696678319e-05,
"loss": 0.9692,
"step": 4240
},
{
"epoch": 3.06254493170381,
"grad_norm": 4.617434722391141,
"learning_rate": 3.774124016926295e-05,
"loss": 0.9423,
"step": 4260
},
{
"epoch": 3.076923076923077,
"grad_norm": 4.794825322123316,
"learning_rate": 3.763531786435136e-05,
"loss": 0.9553,
"step": 4280
},
{
"epoch": 3.0913012221423437,
"grad_norm": 4.612416905686019,
"learning_rate": 3.752911300497212e-05,
"loss": 1.0468,
"step": 4300
},
{
"epoch": 3.1056793673616103,
"grad_norm": 4.807421016950355,
"learning_rate": 3.7422628551926045e-05,
"loss": 0.9755,
"step": 4320
},
{
"epoch": 3.120057512580877,
"grad_norm": 5.330376372980625,
"learning_rate": 3.7315867473808556e-05,
"loss": 0.995,
"step": 4340
},
{
"epoch": 3.134435657800144,
"grad_norm": 5.173638877055289,
"learning_rate": 3.7208832746926856e-05,
"loss": 0.8955,
"step": 4360
},
{
"epoch": 3.1488138030194106,
"grad_norm": 4.337797150987041,
"learning_rate": 3.710152735521697e-05,
"loss": 0.9392,
"step": 4380
},
{
"epoch": 3.163191948238677,
"grad_norm": 4.7087288476465385,
"learning_rate": 3.6993954290160595e-05,
"loss": 0.8507,
"step": 4400
},
{
"epoch": 3.163191948238677,
"eval_loss": 1.3944473266601562,
"eval_runtime": 95.1428,
"eval_samples_per_second": 7.462,
"eval_steps_per_second": 1.871,
"step": 4400
},
{
"epoch": 3.177570093457944,
"grad_norm": 4.385026398896629,
"learning_rate": 3.6886116550701686e-05,
"loss": 0.9656,
"step": 4420
},
{
"epoch": 3.1919482386772104,
"grad_norm": 5.060518593348969,
"learning_rate": 3.677801714316283e-05,
"loss": 0.9374,
"step": 4440
},
{
"epoch": 3.2063263838964775,
"grad_norm": 4.963676634667283,
"learning_rate": 3.666965908116145e-05,
"loss": 1.0603,
"step": 4460
},
{
"epoch": 3.220704529115744,
"grad_norm": 5.537695202590892,
"learning_rate": 3.656104538552579e-05,
"loss": 0.9251,
"step": 4480
},
{
"epoch": 3.2350826743350107,
"grad_norm": 5.159238562381511,
"learning_rate": 3.645217908421072e-05,
"loss": 0.9029,
"step": 4500
},
{
"epoch": 3.2494608195542773,
"grad_norm": 4.583487471613817,
"learning_rate": 3.634306321221328e-05,
"loss": 0.9456,
"step": 4520
},
{
"epoch": 3.2638389647735444,
"grad_norm": 4.743610746700115,
"learning_rate": 3.623370081148811e-05,
"loss": 0.9517,
"step": 4540
},
{
"epoch": 3.278217109992811,
"grad_norm": 4.820931354676504,
"learning_rate": 3.612409493086261e-05,
"loss": 0.8897,
"step": 4560
},
{
"epoch": 3.2925952552120776,
"grad_norm": 4.644390057678307,
"learning_rate": 3.6014248625951984e-05,
"loss": 0.8988,
"step": 4580
},
{
"epoch": 3.3069734004313442,
"grad_norm": 4.199864500637539,
"learning_rate": 3.590416495907401e-05,
"loss": 0.8764,
"step": 4600
},
{
"epoch": 3.3069734004313442,
"eval_loss": 1.2968120574951172,
"eval_runtime": 94.9563,
"eval_samples_per_second": 7.477,
"eval_steps_per_second": 1.875,
"step": 4600
},
{
"epoch": 3.321351545650611,
"grad_norm": 4.8933319942452735,
"learning_rate": 3.579384699916372e-05,
"loss": 0.9392,
"step": 4620
},
{
"epoch": 3.335729690869878,
"grad_norm": 5.539372627833398,
"learning_rate": 3.5683297821687786e-05,
"loss": 0.9456,
"step": 4640
},
{
"epoch": 3.3501078360891445,
"grad_norm": 4.440124319383781,
"learning_rate": 3.557252050855882e-05,
"loss": 0.8985,
"step": 4660
},
{
"epoch": 3.364485981308411,
"grad_norm": 4.51905807949511,
"learning_rate": 3.546151814804947e-05,
"loss": 0.894,
"step": 4680
},
{
"epoch": 3.3788641265276778,
"grad_norm": 4.821926801095058,
"learning_rate": 3.535029383470625e-05,
"loss": 0.8877,
"step": 4700
},
{
"epoch": 3.393242271746945,
"grad_norm": 4.9545904090849096,
"learning_rate": 3.523885066926339e-05,
"loss": 0.8563,
"step": 4720
},
{
"epoch": 3.4076204169662114,
"grad_norm": 4.894310928975366,
"learning_rate": 3.512719175855625e-05,
"loss": 0.9125,
"step": 4740
},
{
"epoch": 3.421998562185478,
"grad_norm": 4.878217385051204,
"learning_rate": 3.5015320215434846e-05,
"loss": 0.8506,
"step": 4760
},
{
"epoch": 3.4363767074047447,
"grad_norm": 5.063687633092487,
"learning_rate": 3.4903239158676954e-05,
"loss": 0.8756,
"step": 4780
},
{
"epoch": 3.4507548526240113,
"grad_norm": 4.673136695418736,
"learning_rate": 3.479095171290124e-05,
"loss": 0.8721,
"step": 4800
},
{
"epoch": 3.4507548526240113,
"eval_loss": 1.2097233533859253,
"eval_runtime": 94.9642,
"eval_samples_per_second": 7.477,
"eval_steps_per_second": 1.874,
"step": 4800
},
{
"epoch": 3.4651329978432783,
"grad_norm": 5.195670176766828,
"learning_rate": 3.467846100848011e-05,
"loss": 0.863,
"step": 4820
},
{
"epoch": 3.479511143062545,
"grad_norm": 5.299015192713523,
"learning_rate": 3.456577018145249e-05,
"loss": 0.8514,
"step": 4840
},
{
"epoch": 3.4938892882818116,
"grad_norm": 5.076570824919959,
"learning_rate": 3.4452882373436316e-05,
"loss": 0.8804,
"step": 4860
},
{
"epoch": 3.5082674335010786,
"grad_norm": 5.458489723441928,
"learning_rate": 3.433980073154104e-05,
"loss": 0.8449,
"step": 4880
},
{
"epoch": 3.5226455787203452,
"grad_norm": 5.124610831012214,
"learning_rate": 3.422652840827983e-05,
"loss": 0.8071,
"step": 4900
},
{
"epoch": 3.537023723939612,
"grad_norm": 4.568932253998444,
"learning_rate": 3.411306856148173e-05,
"loss": 0.7761,
"step": 4920
},
{
"epoch": 3.5514018691588785,
"grad_norm": 5.145433589411428,
"learning_rate": 3.399942435420358e-05,
"loss": 0.8594,
"step": 4940
},
{
"epoch": 3.565780014378145,
"grad_norm": 4.760657828130472,
"learning_rate": 3.388559895464187e-05,
"loss": 0.8927,
"step": 4960
},
{
"epoch": 3.5801581595974117,
"grad_norm": 3.820560651004478,
"learning_rate": 3.3771595536044414e-05,
"loss": 0.8388,
"step": 4980
},
{
"epoch": 3.5945363048166787,
"grad_norm": 5.68396222586338,
"learning_rate": 3.365741727662187e-05,
"loss": 0.8046,
"step": 5000
},
{
"epoch": 3.5945363048166787,
"eval_loss": 1.1343132257461548,
"eval_runtime": 94.9046,
"eval_samples_per_second": 7.481,
"eval_steps_per_second": 1.876,
"step": 5000
},
{
"epoch": 3.6089144500359454,
"grad_norm": 5.325125464111565,
"learning_rate": 3.3543067359459137e-05,
"loss": 0.8037,
"step": 5020
},
{
"epoch": 3.623292595255212,
"grad_norm": 4.863903982548437,
"learning_rate": 3.342854897242662e-05,
"loss": 0.8368,
"step": 5040
},
{
"epoch": 3.637670740474479,
"grad_norm": 4.881874458955767,
"learning_rate": 3.33138653080914e-05,
"loss": 0.8125,
"step": 5060
},
{
"epoch": 3.6520488856937456,
"grad_norm": 5.3439550891850365,
"learning_rate": 3.3199019563628134e-05,
"loss": 0.7565,
"step": 5080
},
{
"epoch": 3.6664270309130123,
"grad_norm": 4.84296449431872,
"learning_rate": 3.308401494073004e-05,
"loss": 0.834,
"step": 5100
},
{
"epoch": 3.680805176132279,
"grad_norm": 5.110097802059874,
"learning_rate": 3.296885464551953e-05,
"loss": 0.7868,
"step": 5120
},
{
"epoch": 3.6951833213515455,
"grad_norm": 4.929559008914251,
"learning_rate": 3.285354188845892e-05,
"loss": 0.7911,
"step": 5140
},
{
"epoch": 3.709561466570812,
"grad_norm": 5.054253010860754,
"learning_rate": 3.273807988426087e-05,
"loss": 0.7886,
"step": 5160
},
{
"epoch": 3.723939611790079,
"grad_norm": 4.61684551923686,
"learning_rate": 3.262247185179879e-05,
"loss": 0.7813,
"step": 5180
},
{
"epoch": 3.7383177570093458,
"grad_norm": 4.353723945187912,
"learning_rate": 3.250672101401707e-05,
"loss": 0.736,
"step": 5200
},
{
"epoch": 3.7383177570093458,
"eval_loss": 1.0338796377182007,
"eval_runtime": 94.9478,
"eval_samples_per_second": 7.478,
"eval_steps_per_second": 1.875,
"step": 5200
},
{
"epoch": 3.7526959022286124,
"grad_norm": 5.703808944893645,
"learning_rate": 3.2390830597841306e-05,
"loss": 0.7881,
"step": 5220
},
{
"epoch": 3.7670740474478794,
"grad_norm": 4.541111143609565,
"learning_rate": 3.2274803834088244e-05,
"loss": 0.7216,
"step": 5240
},
{
"epoch": 3.781452192667146,
"grad_norm": 5.185866482725821,
"learning_rate": 3.215864395737577e-05,
"loss": 0.7323,
"step": 5260
},
{
"epoch": 3.7958303378864127,
"grad_norm": 4.309899151553392,
"learning_rate": 3.204235420603273e-05,
"loss": 0.7352,
"step": 5280
},
{
"epoch": 3.8102084831056793,
"grad_norm": 4.794889232835026,
"learning_rate": 3.192593782200863e-05,
"loss": 0.7682,
"step": 5300
},
{
"epoch": 3.824586628324946,
"grad_norm": 4.620050702309508,
"learning_rate": 3.180939805078328e-05,
"loss": 0.7158,
"step": 5320
},
{
"epoch": 3.838964773544213,
"grad_norm": 4.789174643783679,
"learning_rate": 3.169273814127629e-05,
"loss": 0.7224,
"step": 5340
},
{
"epoch": 3.8533429187634796,
"grad_norm": 4.470710040748567,
"learning_rate": 3.15759613457565e-05,
"loss": 0.7606,
"step": 5360
},
{
"epoch": 3.867721063982746,
"grad_norm": 4.200672286876548,
"learning_rate": 3.145907091975136e-05,
"loss": 0.7342,
"step": 5380
},
{
"epoch": 3.882099209202013,
"grad_norm": 4.651034024184218,
"learning_rate": 3.134207012195609e-05,
"loss": 0.6963,
"step": 5400
},
{
"epoch": 3.882099209202013,
"eval_loss": 0.9063346982002258,
"eval_runtime": 95.1402,
"eval_samples_per_second": 7.463,
"eval_steps_per_second": 1.871,
"step": 5400
},
{
"epoch": 3.89647735442128,
"grad_norm": 5.251836684504766,
"learning_rate": 3.122496221414293e-05,
"loss": 0.6979,
"step": 5420
},
{
"epoch": 3.9108554996405465,
"grad_norm": 4.501970989039771,
"learning_rate": 3.110775046107009e-05,
"loss": 0.6784,
"step": 5440
},
{
"epoch": 3.925233644859813,
"grad_norm": 4.383276146435303,
"learning_rate": 3.0990438130390854e-05,
"loss": 0.705,
"step": 5460
},
{
"epoch": 3.9396117900790797,
"grad_norm": 4.909739674989457,
"learning_rate": 3.0873028492562395e-05,
"loss": 0.6692,
"step": 5480
},
{
"epoch": 3.9539899352983463,
"grad_norm": 4.386911467650432,
"learning_rate": 3.075552482075466e-05,
"loss": 0.6622,
"step": 5500
},
{
"epoch": 3.9683680805176134,
"grad_norm": 5.143117323784103,
"learning_rate": 3.0637930390759076e-05,
"loss": 0.6242,
"step": 5520
},
{
"epoch": 3.98274622573688,
"grad_norm": 5.035434062806972,
"learning_rate": 3.052024848089725e-05,
"loss": 0.6244,
"step": 5540
},
{
"epoch": 3.9971243709561466,
"grad_norm": 4.838730604347607,
"learning_rate": 3.0402482371929582e-05,
"loss": 0.7241,
"step": 5560
},
{
"epoch": 4.011502516175414,
"grad_norm": 3.7762087987736335,
"learning_rate": 3.0284635346963764e-05,
"loss": 0.4018,
"step": 5580
},
{
"epoch": 4.02588066139468,
"grad_norm": 3.8053820101683766,
"learning_rate": 3.0166710691363316e-05,
"loss": 0.346,
"step": 5600
},
{
"epoch": 4.02588066139468,
"eval_loss": 0.8031301498413086,
"eval_runtime": 95.0025,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.874,
"step": 5600
},
{
"epoch": 4.040258806613947,
"grad_norm": 3.633422578478027,
"learning_rate": 3.004871169265593e-05,
"loss": 0.3547,
"step": 5620
},
{
"epoch": 4.0546369518332135,
"grad_norm": 3.8811754142736605,
"learning_rate": 2.9930641640441876e-05,
"loss": 0.3161,
"step": 5640
},
{
"epoch": 4.06901509705248,
"grad_norm": 3.5964575085704666,
"learning_rate": 2.9812503826302257e-05,
"loss": 0.3407,
"step": 5660
},
{
"epoch": 4.083393242271747,
"grad_norm": 3.3163513924241355,
"learning_rate": 2.9694301543707255e-05,
"loss": 0.3307,
"step": 5680
},
{
"epoch": 4.097771387491013,
"grad_norm": 3.5339198445026714,
"learning_rate": 2.9576038087924297e-05,
"loss": 0.3412,
"step": 5700
},
{
"epoch": 4.11214953271028,
"grad_norm": 3.7886609523702752,
"learning_rate": 2.9457716755926258e-05,
"loss": 0.3365,
"step": 5720
},
{
"epoch": 4.126527677929547,
"grad_norm": 3.4940816712487224,
"learning_rate": 2.9339340846299456e-05,
"loss": 0.359,
"step": 5740
},
{
"epoch": 4.140905823148814,
"grad_norm": 3.8228147601492424,
"learning_rate": 2.9220913659151748e-05,
"loss": 0.3539,
"step": 5760
},
{
"epoch": 4.155283968368081,
"grad_norm": 4.777444368973502,
"learning_rate": 2.9102438496020524e-05,
"loss": 0.3696,
"step": 5780
},
{
"epoch": 4.169662113587347,
"grad_norm": 4.24172355984632,
"learning_rate": 2.8983918659780646e-05,
"loss": 0.3342,
"step": 5800
},
{
"epoch": 4.169662113587347,
"eval_loss": 0.7978797554969788,
"eval_runtime": 95.1128,
"eval_samples_per_second": 7.465,
"eval_steps_per_second": 1.871,
"step": 5800
},
{
"epoch": 4.184040258806614,
"grad_norm": 3.4399861307887463,
"learning_rate": 2.8865357454552393e-05,
"loss": 0.3617,
"step": 5820
},
{
"epoch": 4.1984184040258805,
"grad_norm": 3.9247967710302105,
"learning_rate": 2.874675818560933e-05,
"loss": 0.3352,
"step": 5840
},
{
"epoch": 4.212796549245147,
"grad_norm": 4.206719908492779,
"learning_rate": 2.8628124159286162e-05,
"loss": 0.343,
"step": 5860
},
{
"epoch": 4.227174694464414,
"grad_norm": 3.579153737863472,
"learning_rate": 2.8509458682886592e-05,
"loss": 0.3365,
"step": 5880
},
{
"epoch": 4.241552839683681,
"grad_norm": 4.485756832244402,
"learning_rate": 2.8390765064591067e-05,
"loss": 0.3563,
"step": 5900
},
{
"epoch": 4.255930984902948,
"grad_norm": 3.601421123305685,
"learning_rate": 2.82720466133646e-05,
"loss": 0.3689,
"step": 5920
},
{
"epoch": 4.2703091301222145,
"grad_norm": 3.381444289556178,
"learning_rate": 2.815330663886449e-05,
"loss": 0.3655,
"step": 5940
},
{
"epoch": 4.284687275341481,
"grad_norm": 4.260575686248021,
"learning_rate": 2.803454845134807e-05,
"loss": 0.313,
"step": 5960
},
{
"epoch": 4.299065420560748,
"grad_norm": 4.020678447213185,
"learning_rate": 2.7915775361580428e-05,
"loss": 0.3273,
"step": 5980
},
{
"epoch": 4.313443565780014,
"grad_norm": 4.218502841035936,
"learning_rate": 2.779699068074208e-05,
"loss": 0.3426,
"step": 6000
},
{
"epoch": 4.313443565780014,
"eval_loss": 0.7659556865692139,
"eval_runtime": 95.1822,
"eval_samples_per_second": 7.459,
"eval_steps_per_second": 1.87,
"step": 6000
},
{
"epoch": 4.327821710999281,
"grad_norm": 4.242124083199349,
"learning_rate": 2.767819772033669e-05,
"loss": 0.3092,
"step": 6020
},
{
"epoch": 4.3421998562185475,
"grad_norm": 3.603338153962201,
"learning_rate": 2.7559399792098757e-05,
"loss": 0.3351,
"step": 6040
},
{
"epoch": 4.356578001437814,
"grad_norm": 4.09219396831434,
"learning_rate": 2.744060020790125e-05,
"loss": 0.358,
"step": 6060
},
{
"epoch": 4.370956146657081,
"grad_norm": 4.240093061951673,
"learning_rate": 2.7321802279663315e-05,
"loss": 0.3422,
"step": 6080
},
{
"epoch": 4.385334291876348,
"grad_norm": 3.9048915638391763,
"learning_rate": 2.7203009319257927e-05,
"loss": 0.3397,
"step": 6100
},
{
"epoch": 4.399712437095615,
"grad_norm": 4.07320075881977,
"learning_rate": 2.708422463841958e-05,
"loss": 0.3315,
"step": 6120
},
{
"epoch": 4.4140905823148815,
"grad_norm": 3.32557552519866,
"learning_rate": 2.6965451548651938e-05,
"loss": 0.3131,
"step": 6140
},
{
"epoch": 4.428468727534148,
"grad_norm": 4.675885110169447,
"learning_rate": 2.6846693361135522e-05,
"loss": 0.315,
"step": 6160
},
{
"epoch": 4.442846872753415,
"grad_norm": 3.7485615134459405,
"learning_rate": 2.6727953386635406e-05,
"loss": 0.311,
"step": 6180
},
{
"epoch": 4.457225017972681,
"grad_norm": 3.8879166393703533,
"learning_rate": 2.6609234935408945e-05,
"loss": 0.3388,
"step": 6200
},
{
"epoch": 4.457225017972681,
"eval_loss": 0.7081239223480225,
"eval_runtime": 95.4928,
"eval_samples_per_second": 7.435,
"eval_steps_per_second": 1.864,
"step": 6200
},
{
"epoch": 4.471603163191948,
"grad_norm": 3.5820375915220644,
"learning_rate": 2.6490541317113427e-05,
"loss": 0.3427,
"step": 6220
},
{
"epoch": 4.485981308411215,
"grad_norm": 3.6407271030099215,
"learning_rate": 2.637187584071384e-05,
"loss": 0.3051,
"step": 6240
},
{
"epoch": 4.500359453630482,
"grad_norm": 3.726385171500585,
"learning_rate": 2.6253241814390676e-05,
"loss": 0.2748,
"step": 6260
},
{
"epoch": 4.514737598849749,
"grad_norm": 3.5020005944474732,
"learning_rate": 2.613464254544761e-05,
"loss": 0.3514,
"step": 6280
},
{
"epoch": 4.529115744069015,
"grad_norm": 3.2090288253309716,
"learning_rate": 2.6016081340219356e-05,
"loss": 0.3388,
"step": 6300
},
{
"epoch": 4.543493889288282,
"grad_norm": 3.2198075509902986,
"learning_rate": 2.5897561503979478e-05,
"loss": 0.3057,
"step": 6320
},
{
"epoch": 4.5578720345075485,
"grad_norm": 3.5752578196627094,
"learning_rate": 2.5779086340848257e-05,
"loss": 0.2949,
"step": 6340
},
{
"epoch": 4.572250179726815,
"grad_norm": 3.8552778688461116,
"learning_rate": 2.566065915370055e-05,
"loss": 0.3529,
"step": 6360
},
{
"epoch": 4.586628324946082,
"grad_norm": 4.500361755745332,
"learning_rate": 2.554228324407375e-05,
"loss": 0.2893,
"step": 6380
},
{
"epoch": 4.601006470165348,
"grad_norm": 2.9143489664656492,
"learning_rate": 2.5423961912075712e-05,
"loss": 0.3169,
"step": 6400
},
{
"epoch": 4.601006470165348,
"eval_loss": 0.647361159324646,
"eval_runtime": 95.0975,
"eval_samples_per_second": 7.466,
"eval_steps_per_second": 1.872,
"step": 6400
},
{
"epoch": 4.615384615384615,
"grad_norm": 3.711342895438154,
"learning_rate": 2.5305698456292758e-05,
"loss": 0.2876,
"step": 6420
},
{
"epoch": 4.6297627606038825,
"grad_norm": 3.7020282599564,
"learning_rate": 2.518749617369775e-05,
"loss": 0.2987,
"step": 6440
},
{
"epoch": 4.644140905823149,
"grad_norm": 3.3242662861554155,
"learning_rate": 2.5069358359558126e-05,
"loss": 0.3331,
"step": 6460
},
{
"epoch": 4.658519051042416,
"grad_norm": 3.924698535818125,
"learning_rate": 2.495128830734408e-05,
"loss": 0.2991,
"step": 6480
},
{
"epoch": 4.672897196261682,
"grad_norm": 4.090313400971172,
"learning_rate": 2.4833289308636693e-05,
"loss": 0.2732,
"step": 6500
},
{
"epoch": 4.687275341480949,
"grad_norm": 3.7716729841694505,
"learning_rate": 2.4715364653036245e-05,
"loss": 0.2656,
"step": 6520
},
{
"epoch": 4.7016534867002155,
"grad_norm": 3.8130653011051745,
"learning_rate": 2.4597517628070434e-05,
"loss": 0.3101,
"step": 6540
},
{
"epoch": 4.716031631919482,
"grad_norm": 3.6664917416085823,
"learning_rate": 2.447975151910276e-05,
"loss": 0.2918,
"step": 6560
},
{
"epoch": 4.730409777138749,
"grad_norm": 3.5206854492391315,
"learning_rate": 2.4362069609240933e-05,
"loss": 0.2752,
"step": 6580
},
{
"epoch": 4.744787922358016,
"grad_norm": 3.36674316245278,
"learning_rate": 2.4244475179245348e-05,
"loss": 0.2788,
"step": 6600
},
{
"epoch": 4.744787922358016,
"eval_loss": 0.5831869840621948,
"eval_runtime": 94.9797,
"eval_samples_per_second": 7.475,
"eval_steps_per_second": 1.874,
"step": 6600
},
{
"epoch": 4.759166067577283,
"grad_norm": 3.501678635535513,
"learning_rate": 2.41269715074376e-05,
"loss": 0.2487,
"step": 6620
},
{
"epoch": 4.7735442127965495,
"grad_norm": 3.128846435349539,
"learning_rate": 2.4009561869609148e-05,
"loss": 0.2725,
"step": 6640
},
{
"epoch": 4.787922358015816,
"grad_norm": 3.5356811979056113,
"learning_rate": 2.3892249538929912e-05,
"loss": 0.3208,
"step": 6660
},
{
"epoch": 4.802300503235083,
"grad_norm": 4.5315327649915575,
"learning_rate": 2.3775037785857073e-05,
"loss": 0.272,
"step": 6680
},
{
"epoch": 4.816678648454349,
"grad_norm": 3.5524117779614643,
"learning_rate": 2.3657929878043906e-05,
"loss": 0.2696,
"step": 6700
},
{
"epoch": 4.831056793673616,
"grad_norm": 3.824091251673855,
"learning_rate": 2.3540929080248646e-05,
"loss": 0.2944,
"step": 6720
},
{
"epoch": 4.845434938892883,
"grad_norm": 3.292419610880534,
"learning_rate": 2.3424038654243507e-05,
"loss": 0.2432,
"step": 6740
},
{
"epoch": 4.859813084112149,
"grad_norm": 3.4159645581237656,
"learning_rate": 2.3307261858723723e-05,
"loss": 0.2444,
"step": 6760
},
{
"epoch": 4.874191229331416,
"grad_norm": 4.084161850857968,
"learning_rate": 2.319060194921673e-05,
"loss": 0.2622,
"step": 6780
},
{
"epoch": 4.888569374550683,
"grad_norm": 2.4534341246257227,
"learning_rate": 2.3074062177991373e-05,
"loss": 0.2326,
"step": 6800
},
{
"epoch": 4.888569374550683,
"eval_loss": 0.5214605331420898,
"eval_runtime": 95.3983,
"eval_samples_per_second": 7.442,
"eval_steps_per_second": 1.866,
"step": 6800
},
{
"epoch": 4.90294751976995,
"grad_norm": 3.2607272502878315,
"learning_rate": 2.2957645793967277e-05,
"loss": 0.2746,
"step": 6820
},
{
"epoch": 4.9173256649892165,
"grad_norm": 3.322757677302258,
"learning_rate": 2.2841356042624234e-05,
"loss": 0.2437,
"step": 6840
},
{
"epoch": 4.931703810208483,
"grad_norm": 2.8800141239102737,
"learning_rate": 2.2725196165911765e-05,
"loss": 0.2671,
"step": 6860
},
{
"epoch": 4.94608195542775,
"grad_norm": 2.958452590637205,
"learning_rate": 2.2609169402158696e-05,
"loss": 0.2275,
"step": 6880
},
{
"epoch": 4.960460100647016,
"grad_norm": 3.8035839747048974,
"learning_rate": 2.249327898598293e-05,
"loss": 0.2366,
"step": 6900
},
{
"epoch": 4.974838245866283,
"grad_norm": 3.7602185439564364,
"learning_rate": 2.237752814820122e-05,
"loss": 0.241,
"step": 6920
},
{
"epoch": 4.98921639108555,
"grad_norm": 3.6449337323487727,
"learning_rate": 2.2261920115739137e-05,
"loss": 0.2338,
"step": 6940
},
{
"epoch": 5.003594536304817,
"grad_norm": 2.899402463401305,
"learning_rate": 2.2146458111541084e-05,
"loss": 0.2363,
"step": 6960
},
{
"epoch": 5.017972681524084,
"grad_norm": 2.179657035418109,
"learning_rate": 2.203114535448047e-05,
"loss": 0.1179,
"step": 6980
},
{
"epoch": 5.03235082674335,
"grad_norm": 2.9206861319741524,
"learning_rate": 2.1915985059269966e-05,
"loss": 0.1096,
"step": 7000
},
{
"epoch": 5.03235082674335,
"eval_loss": 0.48705199360847473,
"eval_runtime": 95.0343,
"eval_samples_per_second": 7.471,
"eval_steps_per_second": 1.873,
"step": 7000
},
{
"epoch": 5.046728971962617,
"grad_norm": 3.3343151915634057,
"learning_rate": 2.1800980436371864e-05,
"loss": 0.1179,
"step": 7020
},
{
"epoch": 5.0611071171818836,
"grad_norm": 3.4978232084767558,
"learning_rate": 2.1686134691908606e-05,
"loss": 0.1254,
"step": 7040
},
{
"epoch": 5.07548526240115,
"grad_norm": 2.628073375097494,
"learning_rate": 2.157145102757338e-05,
"loss": 0.1238,
"step": 7060
},
{
"epoch": 5.089863407620417,
"grad_norm": 3.511922564055676,
"learning_rate": 2.1456932640540872e-05,
"loss": 0.1286,
"step": 7080
},
{
"epoch": 5.104241552839683,
"grad_norm": 3.2038916584161496,
"learning_rate": 2.134258272337814e-05,
"loss": 0.1208,
"step": 7100
},
{
"epoch": 5.11861969805895,
"grad_norm": 2.9186195372093806,
"learning_rate": 2.1228404463955588e-05,
"loss": 0.1334,
"step": 7120
},
{
"epoch": 5.1329978432782175,
"grad_norm": 2.4964992425737775,
"learning_rate": 2.1114401045358135e-05,
"loss": 0.1145,
"step": 7140
},
{
"epoch": 5.147375988497484,
"grad_norm": 2.746919975951301,
"learning_rate": 2.1000575645796427e-05,
"loss": 0.1205,
"step": 7160
},
{
"epoch": 5.161754133716751,
"grad_norm": 3.186604464709822,
"learning_rate": 2.0886931438518277e-05,
"loss": 0.1415,
"step": 7180
},
{
"epoch": 5.176132278936017,
"grad_norm": 3.791723952579076,
"learning_rate": 2.0773471591720172e-05,
"loss": 0.1374,
"step": 7200
},
{
"epoch": 5.176132278936017,
"eval_loss": 0.4873916804790497,
"eval_runtime": 95.0401,
"eval_samples_per_second": 7.471,
"eval_steps_per_second": 1.873,
"step": 7200
},
{
"epoch": 5.190510424155284,
"grad_norm": 3.194914429367862,
"learning_rate": 2.0660199268458968e-05,
"loss": 0.1356,
"step": 7220
},
{
"epoch": 5.204888569374551,
"grad_norm": 3.3264271128825778,
"learning_rate": 2.054711762656369e-05,
"loss": 0.1168,
"step": 7240
},
{
"epoch": 5.219266714593817,
"grad_norm": 2.0686564494935897,
"learning_rate": 2.0434229818547518e-05,
"loss": 0.1166,
"step": 7260
},
{
"epoch": 5.233644859813084,
"grad_norm": 2.586191401181996,
"learning_rate": 2.0321538991519894e-05,
"loss": 0.1239,
"step": 7280
},
{
"epoch": 5.24802300503235,
"grad_norm": 3.270832885346811,
"learning_rate": 2.0209048287098775e-05,
"loss": 0.1286,
"step": 7300
},
{
"epoch": 5.262401150251618,
"grad_norm": 3.0199641036649854,
"learning_rate": 2.009676084132306e-05,
"loss": 0.1319,
"step": 7320
},
{
"epoch": 5.2767792954708845,
"grad_norm": 3.3684801678974967,
"learning_rate": 1.998467978456517e-05,
"loss": 0.1253,
"step": 7340
},
{
"epoch": 5.291157440690151,
"grad_norm": 3.3671249178043916,
"learning_rate": 1.9872808241443746e-05,
"loss": 0.1338,
"step": 7360
},
{
"epoch": 5.305535585909418,
"grad_norm": 2.114863221347381,
"learning_rate": 1.976114933073662e-05,
"loss": 0.112,
"step": 7380
},
{
"epoch": 5.319913731128684,
"grad_norm": 2.5441440040049432,
"learning_rate": 1.9649706165293752e-05,
"loss": 0.1262,
"step": 7400
},
{
"epoch": 5.319913731128684,
"eval_loss": 0.47789904475212097,
"eval_runtime": 95.2624,
"eval_samples_per_second": 7.453,
"eval_steps_per_second": 1.869,
"step": 7400
},
{
"epoch": 5.334291876347951,
"grad_norm": 2.7965885056997237,
"learning_rate": 1.953848185195054e-05,
"loss": 0.1154,
"step": 7420
},
{
"epoch": 5.348670021567218,
"grad_norm": 2.789354945166839,
"learning_rate": 1.9427479491441187e-05,
"loss": 0.1223,
"step": 7440
},
{
"epoch": 5.363048166786484,
"grad_norm": 2.7352578201417757,
"learning_rate": 1.9316702178312222e-05,
"loss": 0.1218,
"step": 7460
},
{
"epoch": 5.377426312005751,
"grad_norm": 3.3030746857296767,
"learning_rate": 1.9206153000836286e-05,
"loss": 0.1159,
"step": 7480
},
{
"epoch": 5.391804457225018,
"grad_norm": 3.1497321141106784,
"learning_rate": 1.9095835040925993e-05,
"loss": 0.1201,
"step": 7500
},
{
"epoch": 5.406182602444285,
"grad_norm": 2.506232679868558,
"learning_rate": 1.898575137404802e-05,
"loss": 0.1169,
"step": 7520
},
{
"epoch": 5.420560747663552,
"grad_norm": 2.597488885298759,
"learning_rate": 1.8875905069137394e-05,
"loss": 0.1029,
"step": 7540
},
{
"epoch": 5.434938892882818,
"grad_norm": 3.634018210562274,
"learning_rate": 1.8766299188511893e-05,
"loss": 0.1162,
"step": 7560
},
{
"epoch": 5.449317038102085,
"grad_norm": 3.190319282933517,
"learning_rate": 1.8656936787786722e-05,
"loss": 0.1178,
"step": 7580
},
{
"epoch": 5.463695183321351,
"grad_norm": 2.978731316866819,
"learning_rate": 1.854782091578928e-05,
"loss": 0.118,
"step": 7600
},
{
"epoch": 5.463695183321351,
"eval_loss": 0.4637151062488556,
"eval_runtime": 95.0051,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.874,
"step": 7600
},
{
"epoch": 5.478073328540618,
"grad_norm": 2.5062315663221026,
"learning_rate": 1.843895461447422e-05,
"loss": 0.1288,
"step": 7620
},
{
"epoch": 5.492451473759885,
"grad_norm": 2.3614369968744735,
"learning_rate": 1.8330340918838555e-05,
"loss": 0.1193,
"step": 7640
},
{
"epoch": 5.506829618979152,
"grad_norm": 3.032991410827681,
"learning_rate": 1.8221982856837178e-05,
"loss": 0.1126,
"step": 7660
},
{
"epoch": 5.521207764198419,
"grad_norm": 3.13450270361195,
"learning_rate": 1.8113883449298313e-05,
"loss": 0.1163,
"step": 7680
},
{
"epoch": 5.535585909417685,
"grad_norm": 2.380694703132617,
"learning_rate": 1.8006045709839403e-05,
"loss": 0.1121,
"step": 7700
},
{
"epoch": 5.549964054636952,
"grad_norm": 2.8074346598017987,
"learning_rate": 1.7898472644783036e-05,
"loss": 0.118,
"step": 7720
},
{
"epoch": 5.564342199856219,
"grad_norm": 3.025154606533116,
"learning_rate": 1.779116725307315e-05,
"loss": 0.114,
"step": 7740
},
{
"epoch": 5.578720345075485,
"grad_norm": 2.8464120898483274,
"learning_rate": 1.768413252619144e-05,
"loss": 0.0938,
"step": 7760
},
{
"epoch": 5.593098490294752,
"grad_norm": 3.329076081813931,
"learning_rate": 1.7577371448073954e-05,
"loss": 0.1147,
"step": 7780
},
{
"epoch": 5.607476635514018,
"grad_norm": 3.3855825431806728,
"learning_rate": 1.747088699502789e-05,
"loss": 0.1132,
"step": 7800
},
{
"epoch": 5.607476635514018,
"eval_loss": 0.4415024518966675,
"eval_runtime": 94.9693,
"eval_samples_per_second": 7.476,
"eval_steps_per_second": 1.874,
"step": 7800
},
{
"epoch": 5.621854780733285,
"grad_norm": 2.280082024927034,
"learning_rate": 1.736468213564865e-05,
"loss": 0.1006,
"step": 7820
},
{
"epoch": 5.636232925952552,
"grad_norm": 2.7694351541766715,
"learning_rate": 1.7258759830737053e-05,
"loss": 0.1049,
"step": 7840
},
{
"epoch": 5.650611071171819,
"grad_norm": 2.4638616875501302,
"learning_rate": 1.715312303321681e-05,
"loss": 0.1005,
"step": 7860
},
{
"epoch": 5.664989216391086,
"grad_norm": 3.348672704671524,
"learning_rate": 1.7047774688052214e-05,
"loss": 0.0978,
"step": 7880
},
{
"epoch": 5.679367361610352,
"grad_norm": 2.8361860977720914,
"learning_rate": 1.6942717732166012e-05,
"loss": 0.1131,
"step": 7900
},
{
"epoch": 5.693745506829619,
"grad_norm": 2.4999676935988506,
"learning_rate": 1.6837955094357533e-05,
"loss": 0.0978,
"step": 7920
},
{
"epoch": 5.708123652048886,
"grad_norm": 2.592222956022343,
"learning_rate": 1.6733489695221056e-05,
"loss": 0.0933,
"step": 7940
},
{
"epoch": 5.722501797268152,
"grad_norm": 2.5417501039040817,
"learning_rate": 1.6629324447064382e-05,
"loss": 0.0983,
"step": 7960
},
{
"epoch": 5.736879942487419,
"grad_norm": 2.9569161814117177,
"learning_rate": 1.6525462253827635e-05,
"loss": 0.111,
"step": 7980
},
{
"epoch": 5.7512580877066855,
"grad_norm": 2.8690761611304563,
"learning_rate": 1.6421906011002303e-05,
"loss": 0.0878,
"step": 8000
},
{
"epoch": 5.7512580877066855,
"eval_loss": 0.4342060685157776,
"eval_runtime": 95.1626,
"eval_samples_per_second": 7.461,
"eval_steps_per_second": 1.87,
"step": 8000
},
{
"epoch": 5.765636232925953,
"grad_norm": 2.4652579987277106,
"learning_rate": 1.6318658605550558e-05,
"loss": 0.0899,
"step": 8020
},
{
"epoch": 5.78001437814522,
"grad_norm": 2.3034322695637983,
"learning_rate": 1.6215722915824706e-05,
"loss": 0.1106,
"step": 8040
},
{
"epoch": 5.794392523364486,
"grad_norm": 3.0714869632720356,
"learning_rate": 1.6113101811487e-05,
"loss": 0.117,
"step": 8060
},
{
"epoch": 5.808770668583753,
"grad_norm": 2.835102568851034,
"learning_rate": 1.60107981534296e-05,
"loss": 0.0846,
"step": 8080
},
{
"epoch": 5.823148813803019,
"grad_norm": 2.6019714042610858,
"learning_rate": 1.5908814793694836e-05,
"loss": 0.1078,
"step": 8100
},
{
"epoch": 5.837526959022286,
"grad_norm": 3.3335326564208057,
"learning_rate": 1.5807154575395723e-05,
"loss": 0.0971,
"step": 8120
},
{
"epoch": 5.851905104241553,
"grad_norm": 2.8097835934118875,
"learning_rate": 1.570582033263664e-05,
"loss": 0.0955,
"step": 8140
},
{
"epoch": 5.866283249460819,
"grad_norm": 2.6728932570052493,
"learning_rate": 1.5604814890434372e-05,
"loss": 0.0916,
"step": 8160
},
{
"epoch": 5.880661394680086,
"grad_norm": 3.126298026998104,
"learning_rate": 1.550414106463931e-05,
"loss": 0.0936,
"step": 8180
},
{
"epoch": 5.895039539899353,
"grad_norm": 2.7557809744743023,
"learning_rate": 1.540380166185701e-05,
"loss": 0.0892,
"step": 8200
},
{
"epoch": 5.895039539899353,
"eval_loss": 0.4105762243270874,
"eval_runtime": 95.0063,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.874,
"step": 8200
},
{
"epoch": 5.90941768511862,
"grad_norm": 1.9079860771700334,
"learning_rate": 1.5303799479369892e-05,
"loss": 0.0904,
"step": 8220
},
{
"epoch": 5.923795830337887,
"grad_norm": 3.018761093125342,
"learning_rate": 1.5204137305059285e-05,
"loss": 0.0784,
"step": 8240
},
{
"epoch": 5.938173975557153,
"grad_norm": 2.7323274227768466,
"learning_rate": 1.5104817917327696e-05,
"loss": 0.0869,
"step": 8260
},
{
"epoch": 5.95255212077642,
"grad_norm": 2.557181835107203,
"learning_rate": 1.500584408502137e-05,
"loss": 0.0874,
"step": 8280
},
{
"epoch": 5.966930265995686,
"grad_norm": 2.9046628608147302,
"learning_rate": 1.490721856735307e-05,
"loss": 0.0986,
"step": 8300
},
{
"epoch": 5.981308411214953,
"grad_norm": 3.0430167079500055,
"learning_rate": 1.4808944113825187e-05,
"loss": 0.0944,
"step": 8320
},
{
"epoch": 5.99568655643422,
"grad_norm": 2.688293101397761,
"learning_rate": 1.4711023464153062e-05,
"loss": 0.0944,
"step": 8340
},
{
"epoch": 6.010064701653486,
"grad_norm": 2.403540313386648,
"learning_rate": 1.4613459348188635e-05,
"loss": 0.0626,
"step": 8360
},
{
"epoch": 6.024442846872754,
"grad_norm": 1.7893928939003836,
"learning_rate": 1.451625448584431e-05,
"loss": 0.042,
"step": 8380
},
{
"epoch": 6.03882099209202,
"grad_norm": 1.305324698496704,
"learning_rate": 1.4419411587017156e-05,
"loss": 0.0406,
"step": 8400
},
{
"epoch": 6.03882099209202,
"eval_loss": 0.4040509760379791,
"eval_runtime": 95.0585,
"eval_samples_per_second": 7.469,
"eval_steps_per_second": 1.873,
"step": 8400
},
{
"epoch": 6.053199137311287,
"grad_norm": 2.0565200444393406,
"learning_rate": 1.4322933351513345e-05,
"loss": 0.0426,
"step": 8420
},
{
"epoch": 6.067577282530554,
"grad_norm": 1.8144225644755438,
"learning_rate": 1.4226822468972884e-05,
"loss": 0.0448,
"step": 8440
},
{
"epoch": 6.08195542774982,
"grad_norm": 1.9690181852930055,
"learning_rate": 1.413108161879465e-05,
"loss": 0.0475,
"step": 8460
},
{
"epoch": 6.096333572969087,
"grad_norm": 2.242285489402514,
"learning_rate": 1.4035713470061665e-05,
"loss": 0.0517,
"step": 8480
},
{
"epoch": 6.1107117181883535,
"grad_norm": 1.7382682176041153,
"learning_rate": 1.3940720681466734e-05,
"loss": 0.0531,
"step": 8500
},
{
"epoch": 6.12508986340762,
"grad_norm": 2.040489012914858,
"learning_rate": 1.3846105901238263e-05,
"loss": 0.044,
"step": 8520
},
{
"epoch": 6.139468008626887,
"grad_norm": 2.564781396939368,
"learning_rate": 1.3751871767066488e-05,
"loss": 0.0477,
"step": 8540
},
{
"epoch": 6.153846153846154,
"grad_norm": 1.9424649593388863,
"learning_rate": 1.36580209060299e-05,
"loss": 0.0384,
"step": 8560
},
{
"epoch": 6.168224299065421,
"grad_norm": 1.9743827811413817,
"learning_rate": 1.356455593452203e-05,
"loss": 0.0489,
"step": 8580
},
{
"epoch": 6.182602444284687,
"grad_norm": 2.3565443666297767,
"learning_rate": 1.3471479458178499e-05,
"loss": 0.0542,
"step": 8600
},
{
"epoch": 6.182602444284687,
"eval_loss": 0.4080147445201874,
"eval_runtime": 94.9121,
"eval_samples_per_second": 7.481,
"eval_steps_per_second": 1.875,
"step": 8600
},
{
"epoch": 6.196980589503954,
"grad_norm": 1.9059653193210089,
"learning_rate": 1.3378794071804379e-05,
"loss": 0.0474,
"step": 8620
},
{
"epoch": 6.211358734723221,
"grad_norm": 2.288105600592541,
"learning_rate": 1.3286502359301862e-05,
"loss": 0.0491,
"step": 8640
},
{
"epoch": 6.225736879942487,
"grad_norm": 1.577712318070443,
"learning_rate": 1.31946068935982e-05,
"loss": 0.0506,
"step": 8660
},
{
"epoch": 6.240115025161754,
"grad_norm": 1.6142136972859515,
"learning_rate": 1.3103110236574031e-05,
"loss": 0.0502,
"step": 8680
},
{
"epoch": 6.2544931703810205,
"grad_norm": 2.028384534392485,
"learning_rate": 1.3012014938991901e-05,
"loss": 0.0535,
"step": 8700
},
{
"epoch": 6.268871315600288,
"grad_norm": 2.0724853034000144,
"learning_rate": 1.2921323540425168e-05,
"loss": 0.0534,
"step": 8720
},
{
"epoch": 6.283249460819555,
"grad_norm": 2.032233873511292,
"learning_rate": 1.283103856918722e-05,
"loss": 0.0437,
"step": 8740
},
{
"epoch": 6.297627606038821,
"grad_norm": 1.0581865301271611,
"learning_rate": 1.2741162542260988e-05,
"loss": 0.0495,
"step": 8760
},
{
"epoch": 6.312005751258088,
"grad_norm": 1.6262102226401502,
"learning_rate": 1.2651697965228748e-05,
"loss": 0.0434,
"step": 8780
},
{
"epoch": 6.326383896477354,
"grad_norm": 2.2940213673402905,
"learning_rate": 1.2562647332202318e-05,
"loss": 0.054,
"step": 8800
},
{
"epoch": 6.326383896477354,
"eval_loss": 0.4028961956501007,
"eval_runtime": 95.252,
"eval_samples_per_second": 7.454,
"eval_steps_per_second": 1.869,
"step": 8800
},
{
"epoch": 6.340762041696621,
"grad_norm": 2.2268698305742634,
"learning_rate": 1.2474013125753476e-05,
"loss": 0.0511,
"step": 8820
},
{
"epoch": 6.355140186915888,
"grad_norm": 1.266932927067602,
"learning_rate": 1.2385797816844794e-05,
"loss": 0.0508,
"step": 8840
},
{
"epoch": 6.369518332135154,
"grad_norm": 1.76685733894469,
"learning_rate": 1.229800386476073e-05,
"loss": 0.0463,
"step": 8860
},
{
"epoch": 6.383896477354421,
"grad_norm": 2.6377860948914345,
"learning_rate": 1.2210633717039058e-05,
"loss": 0.0451,
"step": 8880
},
{
"epoch": 6.398274622573688,
"grad_norm": 1.9332109634225647,
"learning_rate": 1.2123689809402657e-05,
"loss": 0.054,
"step": 8900
},
{
"epoch": 6.412652767792955,
"grad_norm": 2.394643424907749,
"learning_rate": 1.203717456569159e-05,
"loss": 0.0497,
"step": 8920
},
{
"epoch": 6.427030913012222,
"grad_norm": 1.3393226122146238,
"learning_rate": 1.1951090397795546e-05,
"loss": 0.0487,
"step": 8940
},
{
"epoch": 6.441409058231488,
"grad_norm": 1.7991220659514533,
"learning_rate": 1.1865439705586595e-05,
"loss": 0.0478,
"step": 8960
},
{
"epoch": 6.455787203450755,
"grad_norm": 1.5432278174120821,
"learning_rate": 1.1780224876852276e-05,
"loss": 0.0546,
"step": 8980
},
{
"epoch": 6.4701653486700215,
"grad_norm": 1.646415229262288,
"learning_rate": 1.1695448287229035e-05,
"loss": 0.0424,
"step": 9000
},
{
"epoch": 6.4701653486700215,
"eval_loss": 0.3961636424064636,
"eval_runtime": 95.6131,
"eval_samples_per_second": 7.426,
"eval_steps_per_second": 1.862,
"step": 9000
},
{
"epoch": 6.484543493889288,
"grad_norm": 2.1052529823888904,
"learning_rate": 1.1611112300136017e-05,
"loss": 0.0489,
"step": 9020
},
{
"epoch": 6.498921639108555,
"grad_norm": 2.200144761571743,
"learning_rate": 1.1527219266709139e-05,
"loss": 0.0458,
"step": 9040
},
{
"epoch": 6.513299784327822,
"grad_norm": 2.3077280833331106,
"learning_rate": 1.1443771525735576e-05,
"loss": 0.0454,
"step": 9060
},
{
"epoch": 6.527677929547089,
"grad_norm": 2.0193684546512114,
"learning_rate": 1.1360771403588542e-05,
"loss": 0.048,
"step": 9080
},
{
"epoch": 6.542056074766355,
"grad_norm": 2.083046117268407,
"learning_rate": 1.1278221214162447e-05,
"loss": 0.0426,
"step": 9100
},
{
"epoch": 6.556434219985622,
"grad_norm": 2.03139384196266,
"learning_rate": 1.119612325880838e-05,
"loss": 0.0424,
"step": 9120
},
{
"epoch": 6.570812365204889,
"grad_norm": 1.8265385457361556,
"learning_rate": 1.1114479826269953e-05,
"loss": 0.0444,
"step": 9140
},
{
"epoch": 6.585190510424155,
"grad_norm": 1.8432060989003027,
"learning_rate": 1.1033293192619513e-05,
"loss": 0.0356,
"step": 9160
},
{
"epoch": 6.599568655643422,
"grad_norm": 2.312564665153471,
"learning_rate": 1.0952565621194663e-05,
"loss": 0.0421,
"step": 9180
},
{
"epoch": 6.6139468008626885,
"grad_norm": 1.8681935486387307,
"learning_rate": 1.0872299362535173e-05,
"loss": 0.0384,
"step": 9200
},
{
"epoch": 6.6139468008626885,
"eval_loss": 0.3963512182235718,
"eval_runtime": 95.1527,
"eval_samples_per_second": 7.462,
"eval_steps_per_second": 1.871,
"step": 9200
},
{
"epoch": 6.628324946081955,
"grad_norm": 2.074836002665286,
"learning_rate": 1.0792496654320239e-05,
"loss": 0.0411,
"step": 9220
},
{
"epoch": 6.642703091301222,
"grad_norm": 2.0901956376878306,
"learning_rate": 1.0713159721306121e-05,
"loss": 0.0373,
"step": 9240
},
{
"epoch": 6.657081236520489,
"grad_norm": 1.6049808069580456,
"learning_rate": 1.0634290775264081e-05,
"loss": 0.0397,
"step": 9260
},
{
"epoch": 6.671459381739756,
"grad_norm": 1.7205102620710606,
"learning_rate": 1.0555892014918756e-05,
"loss": 0.0387,
"step": 9280
},
{
"epoch": 6.6858375269590224,
"grad_norm": 1.284670202192714,
"learning_rate": 1.0477965625886846e-05,
"loss": 0.0386,
"step": 9300
},
{
"epoch": 6.700215672178289,
"grad_norm": 1.7601605414086903,
"learning_rate": 1.0400513780616183e-05,
"loss": 0.0361,
"step": 9320
},
{
"epoch": 6.714593817397556,
"grad_norm": 1.508024311857419,
"learning_rate": 1.0323538638325184e-05,
"loss": 0.0385,
"step": 9340
},
{
"epoch": 6.728971962616822,
"grad_norm": 1.2736928874847193,
"learning_rate": 1.024704234494263e-05,
"loss": 0.0378,
"step": 9360
},
{
"epoch": 6.743350107836089,
"grad_norm": 2.276762382653448,
"learning_rate": 1.0171027033047858e-05,
"loss": 0.0418,
"step": 9380
},
{
"epoch": 6.7577282530553555,
"grad_norm": 1.9756333626219476,
"learning_rate": 1.0095494821811307e-05,
"loss": 0.042,
"step": 9400
},
{
"epoch": 6.7577282530553555,
"eval_loss": 0.3885059654712677,
"eval_runtime": 95.0146,
"eval_samples_per_second": 7.473,
"eval_steps_per_second": 1.873,
"step": 9400
},
{
"epoch": 6.772106398274623,
"grad_norm": 1.6635017813830535,
"learning_rate": 1.0020447816935432e-05,
"loss": 0.0403,
"step": 9420
},
{
"epoch": 6.78648454349389,
"grad_norm": 2.4347755605676613,
"learning_rate": 9.94588811059601e-06,
"loss": 0.0345,
"step": 9440
},
{
"epoch": 6.800862688713156,
"grad_norm": 1.5001412711677446,
"learning_rate": 9.871817781383807e-06,
"loss": 0.0374,
"step": 9460
},
{
"epoch": 6.815240833932423,
"grad_norm": 1.2180198693862079,
"learning_rate": 9.798238894246628e-06,
"loss": 0.0341,
"step": 9480
},
{
"epoch": 6.8296189791516895,
"grad_norm": 1.9033420390343725,
"learning_rate": 9.725153500431772e-06,
"loss": 0.0353,
"step": 9500
},
{
"epoch": 6.843997124370956,
"grad_norm": 1.9777690237993284,
"learning_rate": 9.652563637428819e-06,
"loss": 0.0326,
"step": 9520
},
{
"epoch": 6.858375269590223,
"grad_norm": 1.2065488175251857,
"learning_rate": 9.58047132891283e-06,
"loss": 0.0312,
"step": 9540
},
{
"epoch": 6.872753414809489,
"grad_norm": 1.4742126064108851,
"learning_rate": 9.50887858468796e-06,
"loss": 0.0323,
"step": 9560
},
{
"epoch": 6.887131560028756,
"grad_norm": 1.69677437323119,
"learning_rate": 9.437787400631392e-06,
"loss": 0.0332,
"step": 9580
},
{
"epoch": 6.9015097052480225,
"grad_norm": 2.2511817026968886,
"learning_rate": 9.367199758637717e-06,
"loss": 0.0392,
"step": 9600
},
{
"epoch": 6.9015097052480225,
"eval_loss": 0.3916057348251343,
"eval_runtime": 95.174,
"eval_samples_per_second": 7.46,
"eval_steps_per_second": 1.87,
"step": 9600
},
{
"epoch": 6.91588785046729,
"grad_norm": 1.8826049956281836,
"learning_rate": 9.297117626563687e-06,
"loss": 0.0306,
"step": 9620
},
{
"epoch": 6.930265995686557,
"grad_norm": 1.577108574612817,
"learning_rate": 9.227542958173327e-06,
"loss": 0.0306,
"step": 9640
},
{
"epoch": 6.944644140905823,
"grad_norm": 1.508628096504469,
"learning_rate": 9.158477693083497e-06,
"loss": 0.0288,
"step": 9660
},
{
"epoch": 6.95902228612509,
"grad_norm": 1.1579037037168847,
"learning_rate": 9.08992375670981e-06,
"loss": 0.0351,
"step": 9680
},
{
"epoch": 6.9734004313443565,
"grad_norm": 2.28433845291912,
"learning_rate": 9.021883060212944e-06,
"loss": 0.0343,
"step": 9700
},
{
"epoch": 6.987778576563623,
"grad_norm": 1.6582119852169708,
"learning_rate": 8.954357500445376e-06,
"loss": 0.0342,
"step": 9720
},
{
"epoch": 7.00215672178289,
"grad_norm": 2.0137432403466153,
"learning_rate": 8.887348959898492e-06,
"loss": 0.0338,
"step": 9740
},
{
"epoch": 7.016534867002156,
"grad_norm": 1.1323939925336342,
"learning_rate": 8.820859306650115e-06,
"loss": 0.0205,
"step": 9760
},
{
"epoch": 7.030913012221424,
"grad_norm": 1.9568018303100587,
"learning_rate": 8.754890394312411e-06,
"loss": 0.0192,
"step": 9780
},
{
"epoch": 7.0452911574406905,
"grad_norm": 1.580803975278475,
"learning_rate": 8.689444061980237e-06,
"loss": 0.0198,
"step": 9800
},
{
"epoch": 7.0452911574406905,
"eval_loss": 0.3936446011066437,
"eval_runtime": 95.1027,
"eval_samples_per_second": 7.466,
"eval_steps_per_second": 1.872,
"step": 9800
},
{
"epoch": 7.059669302659957,
"grad_norm": 1.269414708765558,
"learning_rate": 8.624522134179853e-06,
"loss": 0.0208,
"step": 9820
},
{
"epoch": 7.074047447879224,
"grad_norm": 1.1909485029965123,
"learning_rate": 8.560126420818065e-06,
"loss": 0.0162,
"step": 9840
},
{
"epoch": 7.08842559309849,
"grad_norm": 0.9472456509832501,
"learning_rate": 8.496258717131755e-06,
"loss": 0.0197,
"step": 9860
},
{
"epoch": 7.102803738317757,
"grad_norm": 1.15937612014724,
"learning_rate": 8.432920803637853e-06,
"loss": 0.0181,
"step": 9880
},
{
"epoch": 7.1171818835370235,
"grad_norm": 1.2302945840584336,
"learning_rate": 8.370114446083686e-06,
"loss": 0.0173,
"step": 9900
},
{
"epoch": 7.13156002875629,
"grad_norm": 1.0966008465338752,
"learning_rate": 8.307841395397755e-06,
"loss": 0.0186,
"step": 9920
},
{
"epoch": 7.145938173975557,
"grad_norm": 1.0474780469073595,
"learning_rate": 8.246103387640924e-06,
"loss": 0.023,
"step": 9940
},
{
"epoch": 7.160316319194824,
"grad_norm": 1.4160374929009303,
"learning_rate": 8.184902143958014e-06,
"loss": 0.0191,
"step": 9960
},
{
"epoch": 7.174694464414091,
"grad_norm": 1.6554397458972328,
"learning_rate": 8.12423937052984e-06,
"loss": 0.0194,
"step": 9980
},
{
"epoch": 7.1890726096333575,
"grad_norm": 1.888593206414827,
"learning_rate": 8.064116758525633e-06,
"loss": 0.0153,
"step": 10000
},
{
"epoch": 7.1890726096333575,
"eval_loss": 0.40147149562835693,
"eval_runtime": 95.303,
"eval_samples_per_second": 7.45,
"eval_steps_per_second": 1.868,
"step": 10000
},
{
"epoch": 7.203450754852624,
"grad_norm": 0.9118239442800974,
"learning_rate": 8.004535984055878e-06,
"loss": 0.0169,
"step": 10020
},
{
"epoch": 7.217828900071891,
"grad_norm": 2.0210540104944186,
"learning_rate": 7.945498708125612e-06,
"loss": 0.0166,
"step": 10040
},
{
"epoch": 7.232207045291157,
"grad_norm": 1.3499252206465502,
"learning_rate": 7.88700657658811e-06,
"loss": 0.0176,
"step": 10060
},
{
"epoch": 7.246585190510424,
"grad_norm": 1.2359261548111957,
"learning_rate": 7.829061220098995e-06,
"loss": 0.0189,
"step": 10080
},
{
"epoch": 7.2609633357296905,
"grad_norm": 1.7393774829143234,
"learning_rate": 7.771664254070782e-06,
"loss": 0.0186,
"step": 10100
},
{
"epoch": 7.275341480948958,
"grad_norm": 1.5390533548289986,
"learning_rate": 7.714817278627853e-06,
"loss": 0.0182,
"step": 10120
},
{
"epoch": 7.289719626168225,
"grad_norm": 2.3702304034936983,
"learning_rate": 7.658521878561828e-06,
"loss": 0.0189,
"step": 10140
},
{
"epoch": 7.304097771387491,
"grad_norm": 1.6524039313763748,
"learning_rate": 7.602779623287411e-06,
"loss": 0.0188,
"step": 10160
},
{
"epoch": 7.318475916606758,
"grad_norm": 1.9409229151245628,
"learning_rate": 7.547592066798609e-06,
"loss": 0.0203,
"step": 10180
},
{
"epoch": 7.3328540618260245,
"grad_norm": 1.7777378379460687,
"learning_rate": 7.4929607476254255e-06,
"loss": 0.0169,
"step": 10200
},
{
"epoch": 7.3328540618260245,
"eval_loss": 0.3997386693954468,
"eval_runtime": 95.0487,
"eval_samples_per_second": 7.47,
"eval_steps_per_second": 1.873,
"step": 10200
},
{
"epoch": 7.347232207045291,
"grad_norm": 1.6320188009060124,
"learning_rate": 7.43888718879097e-06,
"loss": 0.0195,
"step": 10220
},
{
"epoch": 7.361610352264558,
"grad_norm": 1.4169963868246045,
"learning_rate": 7.385372897768994e-06,
"loss": 0.0183,
"step": 10240
},
{
"epoch": 7.375988497483824,
"grad_norm": 2.4501686205974282,
"learning_rate": 7.33241936644186e-06,
"loss": 0.02,
"step": 10260
},
{
"epoch": 7.390366642703091,
"grad_norm": 0.8131283011796112,
"learning_rate": 7.280028071058962e-06,
"loss": 0.0184,
"step": 10280
},
{
"epoch": 7.404744787922358,
"grad_norm": 1.5326273738705627,
"learning_rate": 7.228200472195573e-06,
"loss": 0.0184,
"step": 10300
},
{
"epoch": 7.419122933141625,
"grad_norm": 1.6650139588585309,
"learning_rate": 7.176938014712102e-06,
"loss": 0.0176,
"step": 10320
},
{
"epoch": 7.433501078360892,
"grad_norm": 2.058348145844132,
"learning_rate": 7.1262421277138435e-06,
"loss": 0.0206,
"step": 10340
},
{
"epoch": 7.447879223580158,
"grad_norm": 1.3240541233196081,
"learning_rate": 7.0761142245111215e-06,
"loss": 0.0161,
"step": 10360
},
{
"epoch": 7.462257368799425,
"grad_norm": 1.500950346915735,
"learning_rate": 7.026555702579892e-06,
"loss": 0.02,
"step": 10380
},
{
"epoch": 7.4766355140186915,
"grad_norm": 1.609316067517177,
"learning_rate": 6.977567943522777e-06,
"loss": 0.0184,
"step": 10400
},
{
"epoch": 7.4766355140186915,
"eval_loss": 0.39625024795532227,
"eval_runtime": 95.1609,
"eval_samples_per_second": 7.461,
"eval_steps_per_second": 1.871,
"step": 10400
},
{
"epoch": 7.491013659237958,
"grad_norm": 1.183992892677314,
"learning_rate": 6.929152313030561e-06,
"loss": 0.0144,
"step": 10420
},
{
"epoch": 7.505391804457225,
"grad_norm": 1.7195803593830006,
"learning_rate": 6.8813101608441065e-06,
"loss": 0.0194,
"step": 10440
},
{
"epoch": 7.519769949676491,
"grad_norm": 1.126818407417103,
"learning_rate": 6.834042820716732e-06,
"loss": 0.0184,
"step": 10460
},
{
"epoch": 7.534148094895759,
"grad_norm": 1.276782350410165,
"learning_rate": 6.787351610377034e-06,
"loss": 0.015,
"step": 10480
},
{
"epoch": 7.5485262401150255,
"grad_norm": 1.0056068452477964,
"learning_rate": 6.741237831492137e-06,
"loss": 0.0145,
"step": 10500
},
{
"epoch": 7.562904385334292,
"grad_norm": 1.0608691112870612,
"learning_rate": 6.695702769631409e-06,
"loss": 0.0147,
"step": 10520
},
{
"epoch": 7.577282530553559,
"grad_norm": 1.6567064615333376,
"learning_rate": 6.650747694230644e-06,
"loss": 0.0143,
"step": 10540
},
{
"epoch": 7.591660675772825,
"grad_norm": 0.9633373509647803,
"learning_rate": 6.6063738585566334e-06,
"loss": 0.0174,
"step": 10560
},
{
"epoch": 7.606038820992092,
"grad_norm": 1.6724192740016677,
"learning_rate": 6.562582499672259e-06,
"loss": 0.0148,
"step": 10580
},
{
"epoch": 7.620416966211359,
"grad_norm": 1.4737757756806527,
"learning_rate": 6.519374838401997e-06,
"loss": 0.0132,
"step": 10600
},
{
"epoch": 7.620416966211359,
"eval_loss": 0.4044211506843567,
"eval_runtime": 95.1224,
"eval_samples_per_second": 7.464,
"eval_steps_per_second": 1.871,
"step": 10600
},
{
"epoch": 7.634795111430625,
"grad_norm": 1.44792121731242,
"learning_rate": 6.476752079297877e-06,
"loss": 0.0147,
"step": 10620
},
{
"epoch": 7.649173256649892,
"grad_norm": 0.8542174536442156,
"learning_rate": 6.434715410605914e-06,
"loss": 0.015,
"step": 10640
},
{
"epoch": 7.663551401869158,
"grad_norm": 1.2004595402459013,
"learning_rate": 6.393266004232965e-06,
"loss": 0.016,
"step": 10660
},
{
"epoch": 7.677929547088426,
"grad_norm": 1.313220137555986,
"learning_rate": 6.352405015714072e-06,
"loss": 0.0145,
"step": 10680
},
{
"epoch": 7.6923076923076925,
"grad_norm": 0.8959587868362879,
"learning_rate": 6.312133584180239e-06,
"loss": 0.0134,
"step": 10700
},
{
"epoch": 7.706685837526959,
"grad_norm": 1.3455234829958131,
"learning_rate": 6.272452832326696e-06,
"loss": 0.0147,
"step": 10720
},
{
"epoch": 7.721063982746226,
"grad_norm": 1.8174610789832277,
"learning_rate": 6.233363866381562e-06,
"loss": 0.0187,
"step": 10740
},
{
"epoch": 7.735442127965492,
"grad_norm": 0.6828069910344805,
"learning_rate": 6.194867776075039e-06,
"loss": 0.0145,
"step": 10760
},
{
"epoch": 7.749820273184759,
"grad_norm": 1.3227119421926283,
"learning_rate": 6.1569656346090185e-06,
"loss": 0.0162,
"step": 10780
},
{
"epoch": 7.764198418404026,
"grad_norm": 1.2902629205133838,
"learning_rate": 6.1196584986271636e-06,
"loss": 0.0162,
"step": 10800
},
{
"epoch": 7.764198418404026,
"eval_loss": 0.4048987627029419,
"eval_runtime": 95.1917,
"eval_samples_per_second": 7.459,
"eval_steps_per_second": 1.87,
"step": 10800
},
{
"epoch": 7.778576563623293,
"grad_norm": 0.7136241493173114,
"learning_rate": 6.082947408185455e-06,
"loss": 0.0158,
"step": 10820
},
{
"epoch": 7.79295470884256,
"grad_norm": 0.49866968120190425,
"learning_rate": 6.046833386723195e-06,
"loss": 0.0159,
"step": 10840
},
{
"epoch": 7.807332854061826,
"grad_norm": 1.3502312726254562,
"learning_rate": 6.011317441034468e-06,
"loss": 0.0118,
"step": 10860
},
{
"epoch": 7.821710999281093,
"grad_norm": 1.4794974446045654,
"learning_rate": 5.976400561240085e-06,
"loss": 0.0134,
"step": 10880
},
{
"epoch": 7.8360891445003595,
"grad_norm": 1.2545840858710269,
"learning_rate": 5.942083720759971e-06,
"loss": 0.0137,
"step": 10900
},
{
"epoch": 7.850467289719626,
"grad_norm": 1.19167981333869,
"learning_rate": 5.908367876286038e-06,
"loss": 0.0135,
"step": 10920
},
{
"epoch": 7.864845434938893,
"grad_norm": 1.065250267629664,
"learning_rate": 5.875253967755501e-06,
"loss": 0.0122,
"step": 10940
},
{
"epoch": 7.879223580158159,
"grad_norm": 0.7229967990726404,
"learning_rate": 5.842742918324692e-06,
"loss": 0.0134,
"step": 10960
},
{
"epoch": 7.893601725377426,
"grad_norm": 1.1617877671550005,
"learning_rate": 5.810835634343303e-06,
"loss": 0.0122,
"step": 10980
},
{
"epoch": 7.907979870596693,
"grad_norm": 1.4616928888976464,
"learning_rate": 5.779533005329131e-06,
"loss": 0.0122,
"step": 11000
},
{
"epoch": 7.907979870596693,
"eval_loss": 0.4029586911201477,
"eval_runtime": 95.2694,
"eval_samples_per_second": 7.453,
"eval_steps_per_second": 1.868,
"step": 11000
},
{
"epoch": 7.92235801581596,
"grad_norm": 1.0917614152587496,
"learning_rate": 5.748835903943284e-06,
"loss": 0.0123,
"step": 11020
},
{
"epoch": 7.936736161035227,
"grad_norm": 0.5451280512121102,
"learning_rate": 5.718745185965842e-06,
"loss": 0.0128,
"step": 11040
},
{
"epoch": 7.951114306254493,
"grad_norm": 1.356846718427562,
"learning_rate": 5.689261690272e-06,
"loss": 0.0148,
"step": 11060
},
{
"epoch": 7.96549245147376,
"grad_norm": 1.8573474867415383,
"learning_rate": 5.6603862388086966e-06,
"loss": 0.0131,
"step": 11080
},
{
"epoch": 7.979870596693027,
"grad_norm": 0.9417837862898252,
"learning_rate": 5.632119636571678e-06,
"loss": 0.0136,
"step": 11100
},
{
"epoch": 7.994248741912293,
"grad_norm": 1.4310126705230264,
"learning_rate": 5.604462671583076e-06,
"loss": 0.012,
"step": 11120
},
{
"epoch": 8.00862688713156,
"grad_norm": 1.676187572676756,
"learning_rate": 5.577416114869428e-06,
"loss": 0.0091,
"step": 11140
},
{
"epoch": 8.023005032350827,
"grad_norm": 0.8937409038970547,
"learning_rate": 5.550980720440177e-06,
"loss": 0.009,
"step": 11160
},
{
"epoch": 8.037383177570094,
"grad_norm": 1.149688547723477,
"learning_rate": 5.525157225266666e-06,
"loss": 0.0097,
"step": 11180
},
{
"epoch": 8.05176132278936,
"grad_norm": 0.902795246825878,
"learning_rate": 5.499946349261585e-06,
"loss": 0.0088,
"step": 11200
},
{
"epoch": 8.05176132278936,
"eval_loss": 0.4079127311706543,
"eval_runtime": 95.2052,
"eval_samples_per_second": 7.458,
"eval_steps_per_second": 1.87,
"step": 11200
},
{
"epoch": 8.066139468008627,
"grad_norm": 1.3152839283646323,
"learning_rate": 5.475348795258895e-06,
"loss": 0.0077,
"step": 11220
},
{
"epoch": 8.080517613227894,
"grad_norm": 0.516162093883063,
"learning_rate": 5.4513652489942525e-06,
"loss": 0.0077,
"step": 11240
},
{
"epoch": 8.09489575844716,
"grad_norm": 1.5494413714180322,
"learning_rate": 5.427996379085868e-06,
"loss": 0.0076,
"step": 11260
},
{
"epoch": 8.109273903666427,
"grad_norm": 0.811835227943074,
"learning_rate": 5.405242837015884e-06,
"loss": 0.0103,
"step": 11280
},
{
"epoch": 8.123652048885694,
"grad_norm": 0.7766429516281889,
"learning_rate": 5.38310525711221e-06,
"loss": 0.008,
"step": 11300
},
{
"epoch": 8.13803019410496,
"grad_norm": 1.4067431703535396,
"learning_rate": 5.361584256530833e-06,
"loss": 0.0077,
"step": 11320
},
{
"epoch": 8.152408339324227,
"grad_norm": 1.291173175444956,
"learning_rate": 5.340680435238616e-06,
"loss": 0.0079,
"step": 11340
},
{
"epoch": 8.166786484543493,
"grad_norm": 1.349771672968205,
"learning_rate": 5.320394375996568e-06,
"loss": 0.0096,
"step": 11360
},
{
"epoch": 8.18116462976276,
"grad_norm": 1.0559431628395084,
"learning_rate": 5.300726644343609e-06,
"loss": 0.0089,
"step": 11380
},
{
"epoch": 8.195542774982027,
"grad_norm": 1.7592306087280705,
"learning_rate": 5.2816777885807885e-06,
"loss": 0.0097,
"step": 11400
},
{
"epoch": 8.195542774982027,
"eval_loss": 0.41447505354881287,
"eval_runtime": 95.0961,
"eval_samples_per_second": 7.466,
"eval_steps_per_second": 1.872,
"step": 11400
},
{
"epoch": 8.209920920201293,
"grad_norm": 0.5685228696858917,
"learning_rate": 5.2632483397560065e-06,
"loss": 0.0103,
"step": 11420
},
{
"epoch": 8.22429906542056,
"grad_norm": 1.2788596898252633,
"learning_rate": 5.245438811649216e-06,
"loss": 0.0086,
"step": 11440
},
{
"epoch": 8.238677210639828,
"grad_norm": 0.6947794845611549,
"learning_rate": 5.228249700758091e-06,
"loss": 0.0071,
"step": 11460
},
{
"epoch": 8.253055355859095,
"grad_norm": 0.6087586668339728,
"learning_rate": 5.211681486284183e-06,
"loss": 0.0072,
"step": 11480
},
{
"epoch": 8.267433501078362,
"grad_norm": 1.103810484585872,
"learning_rate": 5.195734630119573e-06,
"loss": 0.009,
"step": 11500
},
{
"epoch": 8.281811646297628,
"grad_norm": 0.8700111892647913,
"learning_rate": 5.180409576833982e-06,
"loss": 0.0092,
"step": 11520
},
{
"epoch": 8.296189791516895,
"grad_norm": 1.2281180519183952,
"learning_rate": 5.165706753662381e-06,
"loss": 0.0099,
"step": 11540
},
{
"epoch": 8.310567936736161,
"grad_norm": 1.0420912684858186,
"learning_rate": 5.151626570493093e-06,
"loss": 0.0085,
"step": 11560
},
{
"epoch": 8.324946081955428,
"grad_norm": 1.0182028541004855,
"learning_rate": 5.138169419856345e-06,
"loss": 0.0072,
"step": 11580
},
{
"epoch": 8.339324227174695,
"grad_norm": 0.7367050500271004,
"learning_rate": 5.125335676913335e-06,
"loss": 0.0073,
"step": 11600
},
{
"epoch": 8.339324227174695,
"eval_loss": 0.41657283902168274,
"eval_runtime": 95.1277,
"eval_samples_per_second": 7.464,
"eval_steps_per_second": 1.871,
"step": 11600
},
{
"epoch": 8.353702372393961,
"grad_norm": 0.45884793559048515,
"learning_rate": 5.113125699445789e-06,
"loss": 0.0073,
"step": 11620
},
{
"epoch": 8.368080517613228,
"grad_norm": 1.4599632400117197,
"learning_rate": 5.1015398278459495e-06,
"loss": 0.0089,
"step": 11640
},
{
"epoch": 8.382458662832494,
"grad_norm": 0.6194729001217548,
"learning_rate": 5.0905783851071216e-06,
"loss": 0.0082,
"step": 11660
},
{
"epoch": 8.396836808051761,
"grad_norm": 0.9431964849978874,
"learning_rate": 5.080241676814656e-06,
"loss": 0.0067,
"step": 11680
},
{
"epoch": 8.411214953271028,
"grad_norm": 1.6284024601141414,
"learning_rate": 5.070529991137416e-06,
"loss": 0.007,
"step": 11700
},
{
"epoch": 8.425593098490294,
"grad_norm": 1.0543826842218091,
"learning_rate": 5.06144359881977e-06,
"loss": 0.007,
"step": 11720
},
{
"epoch": 8.43997124370956,
"grad_norm": 1.0304860278963826,
"learning_rate": 5.052982753174023e-06,
"loss": 0.0087,
"step": 11740
},
{
"epoch": 8.454349388928827,
"grad_norm": 0.3890943761716781,
"learning_rate": 5.045147690073362e-06,
"loss": 0.0072,
"step": 11760
},
{
"epoch": 8.468727534148094,
"grad_norm": 0.5658622370613433,
"learning_rate": 5.037938627945281e-06,
"loss": 0.0082,
"step": 11780
},
{
"epoch": 8.483105679367362,
"grad_norm": 1.3906978664783356,
"learning_rate": 5.031355767765493e-06,
"loss": 0.008,
"step": 11800
},
{
"epoch": 8.483105679367362,
"eval_loss": 0.4241388142108917,
"eval_runtime": 95.2265,
"eval_samples_per_second": 7.456,
"eval_steps_per_second": 1.869,
"step": 11800
},
{
"epoch": 8.497483824586629,
"grad_norm": 0.9375345966413335,
"learning_rate": 5.025399293052321e-06,
"loss": 0.0052,
"step": 11820
},
{
"epoch": 8.511861969805896,
"grad_norm": 1.1002252857639097,
"learning_rate": 5.02006936986159e-06,
"loss": 0.0063,
"step": 11840
},
{
"epoch": 8.526240115025162,
"grad_norm": 0.6208438364734209,
"learning_rate": 5.015366146781985e-06,
"loss": 0.0095,
"step": 11860
},
{
"epoch": 8.540618260244429,
"grad_norm": 0.8897303749534691,
"learning_rate": 5.011289754930926e-06,
"loss": 0.0095,
"step": 11880
},
{
"epoch": 8.554996405463696,
"grad_norm": 1.1347852329310684,
"learning_rate": 5.0078403079509016e-06,
"loss": 0.0078,
"step": 11900
},
{
"epoch": 8.569374550682962,
"grad_norm": 0.6303434992335293,
"learning_rate": 5.005017902006298e-06,
"loss": 0.01,
"step": 11920
},
{
"epoch": 8.583752695902229,
"grad_norm": 0.8925353812282399,
"learning_rate": 5.002822615780729e-06,
"loss": 0.0056,
"step": 11940
},
{
"epoch": 8.598130841121495,
"grad_norm": 1.061748591660371,
"learning_rate": 5.0012545104748325e-06,
"loss": 0.008,
"step": 11960
},
{
"epoch": 8.612508986340762,
"grad_norm": 0.5128451242135531,
"learning_rate": 5.000313629804567e-06,
"loss": 0.0062,
"step": 11980
},
{
"epoch": 8.626887131560029,
"grad_norm": 0.8684045848139531,
"learning_rate": 5e-06,
"loss": 0.0075,
"step": 12000
},
{
"epoch": 8.626887131560029,
"eval_loss": 0.42346227169036865,
"eval_runtime": 95.1147,
"eval_samples_per_second": 7.465,
"eval_steps_per_second": 1.871,
"step": 12000
},
{
"epoch": 8.626887131560029,
"step": 12000,
"total_flos": 782041448448000.0,
"train_loss": 0.04361448099526266,
"train_runtime": 28916.5377,
"train_samples_per_second": 3.32,
"train_steps_per_second": 0.415
}
],
"logging_steps": 20,
"max_steps": 12000,
"num_input_tokens_seen": 0,
"num_train_epochs": 9,
"save_steps": 2000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 782041448448000.0,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}