{ "best_metric": null, "best_model_checkpoint": null, "epoch": 8.626887131560029, "eval_steps": 200, "global_step": 12000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.014378145219266714, "grad_norm": 13.937178004920169, "learning_rate": 1e-05, "loss": 18.6782, "step": 20 }, { "epoch": 0.02875629043853343, "grad_norm": 20.49830614432723, "learning_rate": 2e-05, "loss": 8.8375, "step": 40 }, { "epoch": 0.043134435657800146, "grad_norm": 10.509818823590434, "learning_rate": 3e-05, "loss": 5.0096, "step": 60 }, { "epoch": 0.05751258087706686, "grad_norm": 13.333465056972562, "learning_rate": 4e-05, "loss": 4.6984, "step": 80 }, { "epoch": 0.07189072609633357, "grad_norm": 13.540983325678864, "learning_rate": 5e-05, "loss": 4.427, "step": 100 }, { "epoch": 0.08626887131560029, "grad_norm": 15.962923973587186, "learning_rate": 4.9999686370195435e-05, "loss": 4.2845, "step": 120 }, { "epoch": 0.100647016534867, "grad_norm": 11.92374627236117, "learning_rate": 4.999874548952517e-05, "loss": 4.1259, "step": 140 }, { "epoch": 0.11502516175413371, "grad_norm": 14.900646876279996, "learning_rate": 4.9997177384219275e-05, "loss": 3.8399, "step": 160 }, { "epoch": 0.12940330697340044, "grad_norm": 14.115020370573196, "learning_rate": 4.9994982097993705e-05, "loss": 3.7164, "step": 180 }, { "epoch": 0.14378145219266714, "grad_norm": 13.842427549451594, "learning_rate": 4.9992159692049106e-05, "loss": 3.6876, "step": 200 }, { "epoch": 0.14378145219266714, "eval_loss": 3.6155073642730713, "eval_runtime": 95.5893, "eval_samples_per_second": 7.428, "eval_steps_per_second": 1.862, "step": 200 }, { "epoch": 0.15815959741193386, "grad_norm": 10.199143919340026, "learning_rate": 4.998871024506907e-05, "loss": 3.6115, "step": 220 }, { "epoch": 0.17253774263120059, "grad_norm": 9.516108728115162, "learning_rate": 4.998463385321802e-05, "loss": 3.5405, "step": 240 }, { "epoch": 0.18691588785046728, "grad_norm": 9.609898798360511, "learning_rate": 4.997993063013842e-05, "loss": 3.5089, "step": 260 }, { "epoch": 0.201294033069734, "grad_norm": 11.18927433524985, "learning_rate": 4.9974600706947685e-05, "loss": 3.5087, "step": 280 }, { "epoch": 0.21567217828900073, "grad_norm": 14.617569385949311, "learning_rate": 4.9968644232234515e-05, "loss": 3.4338, "step": 300 }, { "epoch": 0.23005032350826743, "grad_norm": 10.794051016445927, "learning_rate": 4.9962061372054716e-05, "loss": 3.4752, "step": 320 }, { "epoch": 0.24442846872753415, "grad_norm": 9.000217292113932, "learning_rate": 4.995485230992664e-05, "loss": 3.3947, "step": 340 }, { "epoch": 0.2588066139468009, "grad_norm": 9.266337425892882, "learning_rate": 4.9947017246825985e-05, "loss": 3.3028, "step": 360 }, { "epoch": 0.2731847591660676, "grad_norm": 8.423464250163468, "learning_rate": 4.993855640118024e-05, "loss": 3.3037, "step": 380 }, { "epoch": 0.2875629043853343, "grad_norm": 8.272065753761918, "learning_rate": 4.992947000886259e-05, "loss": 3.2657, "step": 400 }, { "epoch": 0.2875629043853343, "eval_loss": 3.230403423309326, "eval_runtime": 95.1984, "eval_samples_per_second": 7.458, "eval_steps_per_second": 1.87, "step": 400 }, { "epoch": 0.301941049604601, "grad_norm": 8.839983816131488, "learning_rate": 4.991975832318535e-05, "loss": 3.1932, "step": 420 }, { "epoch": 0.3163191948238677, "grad_norm": 8.856492618425404, "learning_rate": 4.990942161489288e-05, "loss": 3.1429, "step": 440 }, { "epoch": 0.33069734004313445, "grad_norm": 9.670041618980777, "learning_rate": 4.989846017215405e-05, "loss": 3.1421, "step": 460 }, { "epoch": 0.34507548526240117, "grad_norm": 6.904135887349451, "learning_rate": 4.988687430055421e-05, "loss": 3.1368, "step": 480 }, { "epoch": 0.35945363048166784, "grad_norm": 6.888500849133581, "learning_rate": 4.9874664323086664e-05, "loss": 3.0697, "step": 500 }, { "epoch": 0.37383177570093457, "grad_norm": 8.164493023374266, "learning_rate": 4.9861830580143667e-05, "loss": 3.0454, "step": 520 }, { "epoch": 0.3882099209202013, "grad_norm": 6.1924738330609435, "learning_rate": 4.984837342950691e-05, "loss": 2.9824, "step": 540 }, { "epoch": 0.402588066139468, "grad_norm": 8.330870217150185, "learning_rate": 4.9834293246337624e-05, "loss": 2.9539, "step": 560 }, { "epoch": 0.41696621135873474, "grad_norm": 7.244659927731791, "learning_rate": 4.9819590423166025e-05, "loss": 2.9438, "step": 580 }, { "epoch": 0.43134435657800146, "grad_norm": 7.623837159975234, "learning_rate": 4.980426536988043e-05, "loss": 2.9326, "step": 600 }, { "epoch": 0.43134435657800146, "eval_loss": 2.913550853729248, "eval_runtime": 95.0135, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.873, "step": 600 }, { "epoch": 0.44572250179726813, "grad_norm": 6.237340146754397, "learning_rate": 4.978831851371582e-05, "loss": 2.871, "step": 620 }, { "epoch": 0.46010064701653486, "grad_norm": 7.573306240835855, "learning_rate": 4.977175029924191e-05, "loss": 2.8492, "step": 640 }, { "epoch": 0.4744787922358016, "grad_norm": 7.724747647956487, "learning_rate": 4.975456118835079e-05, "loss": 2.8832, "step": 660 }, { "epoch": 0.4888569374550683, "grad_norm": 6.727877105924332, "learning_rate": 4.9736751660243995e-05, "loss": 2.8508, "step": 680 }, { "epoch": 0.503235082674335, "grad_norm": 7.036877939774848, "learning_rate": 4.971832221141922e-05, "loss": 2.7735, "step": 700 }, { "epoch": 0.5176132278936018, "grad_norm": 6.425217642566599, "learning_rate": 4.9699273355656395e-05, "loss": 2.8373, "step": 720 }, { "epoch": 0.5319913731128685, "grad_norm": 7.139491878078851, "learning_rate": 4.967960562400343e-05, "loss": 2.8005, "step": 740 }, { "epoch": 0.5463695183321352, "grad_norm": 6.962818464552354, "learning_rate": 4.965931956476139e-05, "loss": 2.7754, "step": 760 }, { "epoch": 0.5607476635514018, "grad_norm": 6.130103303233823, "learning_rate": 4.9638415743469166e-05, "loss": 2.7736, "step": 780 }, { "epoch": 0.5751258087706685, "grad_norm": 6.386819454037992, "learning_rate": 4.961689474288779e-05, "loss": 2.7793, "step": 800 }, { "epoch": 0.5751258087706685, "eval_loss": 2.709056854248047, "eval_runtime": 95.0293, "eval_samples_per_second": 7.471, "eval_steps_per_second": 1.873, "step": 800 }, { "epoch": 0.5895039539899353, "grad_norm": 5.813420223779441, "learning_rate": 4.9594757162984125e-05, "loss": 2.6778, "step": 820 }, { "epoch": 0.603882099209202, "grad_norm": 6.505329742987656, "learning_rate": 4.9572003620914135e-05, "loss": 2.6418, "step": 840 }, { "epoch": 0.6182602444284687, "grad_norm": 6.617793894804718, "learning_rate": 4.954863475100575e-05, "loss": 2.705, "step": 860 }, { "epoch": 0.6326383896477354, "grad_norm": 5.6982849971736735, "learning_rate": 4.952465120474111e-05, "loss": 2.6715, "step": 880 }, { "epoch": 0.6470165348670022, "grad_norm": 5.245475499523757, "learning_rate": 4.9500053650738424e-05, "loss": 2.6979, "step": 900 }, { "epoch": 0.6613946800862689, "grad_norm": 6.518600695845765, "learning_rate": 4.947484277473333e-05, "loss": 2.6556, "step": 920 }, { "epoch": 0.6757728253055356, "grad_norm": 6.574489220293872, "learning_rate": 4.944901927955983e-05, "loss": 2.5944, "step": 940 }, { "epoch": 0.6901509705248023, "grad_norm": 5.826636755254408, "learning_rate": 4.942258388513058e-05, "loss": 2.6557, "step": 960 }, { "epoch": 0.7045291157440691, "grad_norm": 6.035387909646663, "learning_rate": 4.9395537328416926e-05, "loss": 2.5915, "step": 980 }, { "epoch": 0.7189072609633357, "grad_norm": 6.506861395374483, "learning_rate": 4.9367880363428326e-05, "loss": 2.5252, "step": 1000 }, { "epoch": 0.7189072609633357, "eval_loss": 2.5883359909057617, "eval_runtime": 95.0936, "eval_samples_per_second": 7.466, "eval_steps_per_second": 1.872, "step": 1000 }, { "epoch": 0.7332854061826024, "grad_norm": 5.796511184070567, "learning_rate": 4.933961376119131e-05, "loss": 2.5934, "step": 1020 }, { "epoch": 0.7476635514018691, "grad_norm": 5.718979865140408, "learning_rate": 4.9310738309728005e-05, "loss": 2.5455, "step": 1040 }, { "epoch": 0.7620416966211359, "grad_norm": 6.548958558102242, "learning_rate": 4.928125481403416e-05, "loss": 2.5356, "step": 1060 }, { "epoch": 0.7764198418404026, "grad_norm": 5.969122402157584, "learning_rate": 4.9251164096056716e-05, "loss": 2.5008, "step": 1080 }, { "epoch": 0.7907979870596693, "grad_norm": 6.006148622274345, "learning_rate": 4.922046699467087e-05, "loss": 2.5651, "step": 1100 }, { "epoch": 0.805176132278936, "grad_norm": 5.329905924324714, "learning_rate": 4.91891643656567e-05, "loss": 2.5288, "step": 1120 }, { "epoch": 0.8195542774982028, "grad_norm": 5.829019019143035, "learning_rate": 4.9157257081675315e-05, "loss": 2.5328, "step": 1140 }, { "epoch": 0.8339324227174695, "grad_norm": 5.3120393934176615, "learning_rate": 4.91247460322445e-05, "loss": 2.5215, "step": 1160 }, { "epoch": 0.8483105679367362, "grad_norm": 5.290424926561275, "learning_rate": 4.909163212371396e-05, "loss": 2.4913, "step": 1180 }, { "epoch": 0.8626887131560029, "grad_norm": 6.150607558485341, "learning_rate": 4.905791627924003e-05, "loss": 2.4608, "step": 1200 }, { "epoch": 0.8626887131560029, "eval_loss": 2.4695942401885986, "eval_runtime": 95.1459, "eval_samples_per_second": 7.462, "eval_steps_per_second": 1.871, "step": 1200 }, { "epoch": 0.8770668583752695, "grad_norm": 6.051042465807221, "learning_rate": 4.902359943875992e-05, "loss": 2.5229, "step": 1220 }, { "epoch": 0.8914450035945363, "grad_norm": 5.702742394427446, "learning_rate": 4.898868255896554e-05, "loss": 2.4682, "step": 1240 }, { "epoch": 0.905823148813803, "grad_norm": 6.148635539706346, "learning_rate": 4.895316661327681e-05, "loss": 2.4568, "step": 1260 }, { "epoch": 0.9202012940330697, "grad_norm": 5.878117654483529, "learning_rate": 4.891705259181454e-05, "loss": 2.4841, "step": 1280 }, { "epoch": 0.9345794392523364, "grad_norm": 5.955112078722722, "learning_rate": 4.888034150137284e-05, "loss": 2.4454, "step": 1300 }, { "epoch": 0.9489575844716032, "grad_norm": 5.377448785428115, "learning_rate": 4.8843034365390985e-05, "loss": 2.4895, "step": 1320 }, { "epoch": 0.9633357296908699, "grad_norm": 5.491843912580674, "learning_rate": 4.880513222392496e-05, "loss": 2.4557, "step": 1340 }, { "epoch": 0.9777138749101366, "grad_norm": 5.476777480493853, "learning_rate": 4.8766636133618445e-05, "loss": 2.4179, "step": 1360 }, { "epoch": 0.9920920201294033, "grad_norm": 5.378173923329988, "learning_rate": 4.87275471676733e-05, "loss": 2.4075, "step": 1380 }, { "epoch": 1.00647016534867, "grad_norm": 5.596761747726064, "learning_rate": 4.868786641581976e-05, "loss": 2.3865, "step": 1400 }, { "epoch": 1.00647016534867, "eval_loss": 2.3786544799804688, "eval_runtime": 94.8751, "eval_samples_per_second": 7.484, "eval_steps_per_second": 1.876, "step": 1400 }, { "epoch": 1.0208483105679367, "grad_norm": 5.326022614677014, "learning_rate": 4.864759498428593e-05, "loss": 2.327, "step": 1420 }, { "epoch": 1.0352264557872035, "grad_norm": 6.495868359551248, "learning_rate": 4.860673399576704e-05, "loss": 2.3197, "step": 1440 }, { "epoch": 1.0496046010064701, "grad_norm": 5.462694782280911, "learning_rate": 4.856528458939409e-05, "loss": 2.3436, "step": 1460 }, { "epoch": 1.063982746225737, "grad_norm": 5.384927039412702, "learning_rate": 4.8523247920702125e-05, "loss": 2.3136, "step": 1480 }, { "epoch": 1.0783608914450036, "grad_norm": 5.090764977050729, "learning_rate": 4.8480625161598e-05, "loss": 2.3654, "step": 1500 }, { "epoch": 1.0927390366642702, "grad_norm": 5.309844430144479, "learning_rate": 4.8437417500327743e-05, "loss": 2.3043, "step": 1520 }, { "epoch": 1.107117181883537, "grad_norm": 4.924758754588879, "learning_rate": 4.839362614144337e-05, "loss": 2.3204, "step": 1540 }, { "epoch": 1.1214953271028036, "grad_norm": 5.288805304382869, "learning_rate": 4.834925230576936e-05, "loss": 2.2613, "step": 1560 }, { "epoch": 1.1358734723220705, "grad_norm": 5.040956404855601, "learning_rate": 4.830429723036859e-05, "loss": 2.3143, "step": 1580 }, { "epoch": 1.150251617541337, "grad_norm": 5.305191213745783, "learning_rate": 4.825876216850786e-05, "loss": 2.3042, "step": 1600 }, { "epoch": 1.150251617541337, "eval_loss": 2.3024840354919434, "eval_runtime": 94.9448, "eval_samples_per_second": 7.478, "eval_steps_per_second": 1.875, "step": 1600 }, { "epoch": 1.164629762760604, "grad_norm": 5.542476079404831, "learning_rate": 4.821264838962297e-05, "loss": 2.2448, "step": 1620 }, { "epoch": 1.1790079079798705, "grad_norm": 4.977786731713276, "learning_rate": 4.816595717928327e-05, "loss": 2.2687, "step": 1640 }, { "epoch": 1.1933860531991374, "grad_norm": 4.860822092234981, "learning_rate": 4.81186898391559e-05, "loss": 2.296, "step": 1660 }, { "epoch": 1.207764198418404, "grad_norm": 4.996822570004754, "learning_rate": 4.8070847686969445e-05, "loss": 2.3022, "step": 1680 }, { "epoch": 1.2221423436376708, "grad_norm": 5.428353577618062, "learning_rate": 4.8022432056477227e-05, "loss": 2.2673, "step": 1700 }, { "epoch": 1.2365204888569374, "grad_norm": 5.143612704057496, "learning_rate": 4.797344429742011e-05, "loss": 2.1917, "step": 1720 }, { "epoch": 1.2508986340762043, "grad_norm": 5.578333721803896, "learning_rate": 4.792388577548888e-05, "loss": 2.2253, "step": 1740 }, { "epoch": 1.2652767792954709, "grad_norm": 5.247867553076536, "learning_rate": 4.7873757872286155e-05, "loss": 2.2293, "step": 1760 }, { "epoch": 1.2796549245147375, "grad_norm": 4.72091682638746, "learning_rate": 4.78230619852879e-05, "loss": 2.2164, "step": 1780 }, { "epoch": 1.2940330697340043, "grad_norm": 5.133994887533224, "learning_rate": 4.777179952780443e-05, "loss": 2.1816, "step": 1800 }, { "epoch": 1.2940330697340043, "eval_loss": 2.2219223976135254, "eval_runtime": 95.1892, "eval_samples_per_second": 7.459, "eval_steps_per_second": 1.87, "step": 1800 }, { "epoch": 1.308411214953271, "grad_norm": 4.730535398567502, "learning_rate": 4.7719971928941045e-05, "loss": 2.1896, "step": 1820 }, { "epoch": 1.3227893601725378, "grad_norm": 4.672694454266816, "learning_rate": 4.766758063355815e-05, "loss": 2.1846, "step": 1840 }, { "epoch": 1.3371675053918044, "grad_norm": 4.7523968527644325, "learning_rate": 4.761462710223101e-05, "loss": 2.2532, "step": 1860 }, { "epoch": 1.3515456506110712, "grad_norm": 4.516026828742153, "learning_rate": 4.756111281120904e-05, "loss": 2.2534, "step": 1880 }, { "epoch": 1.3659237958303379, "grad_norm": 4.432300805541551, "learning_rate": 4.750703925237458e-05, "loss": 2.2089, "step": 1900 }, { "epoch": 1.3803019410496047, "grad_norm": 4.795880373336302, "learning_rate": 4.745240793320139e-05, "loss": 2.2101, "step": 1920 }, { "epoch": 1.3946800862688713, "grad_norm": 4.8910070970343185, "learning_rate": 4.739722037671259e-05, "loss": 2.1776, "step": 1940 }, { "epoch": 1.409058231488138, "grad_norm": 4.46472714877697, "learning_rate": 4.734147812143818e-05, "loss": 2.2407, "step": 1960 }, { "epoch": 1.4234363767074047, "grad_norm": 4.902232368473849, "learning_rate": 4.728518272137216e-05, "loss": 2.1787, "step": 1980 }, { "epoch": 1.4378145219266716, "grad_norm": 4.819924921281692, "learning_rate": 4.722833574592922e-05, "loss": 2.1519, "step": 2000 }, { "epoch": 1.4378145219266716, "eval_loss": 2.1631219387054443, "eval_runtime": 95.0925, "eval_samples_per_second": 7.466, "eval_steps_per_second": 1.872, "step": 2000 }, { "epoch": 1.4521926671459382, "grad_norm": 4.672668068479392, "learning_rate": 4.7170938779901015e-05, "loss": 2.1637, "step": 2020 }, { "epoch": 1.4665708123652048, "grad_norm": 5.388392208921704, "learning_rate": 4.711299342341189e-05, "loss": 2.1336, "step": 2040 }, { "epoch": 1.4809489575844716, "grad_norm": 4.79200407089135, "learning_rate": 4.7054501291874385e-05, "loss": 2.1339, "step": 2060 }, { "epoch": 1.4953271028037383, "grad_norm": 4.606110348514495, "learning_rate": 4.6995464015944124e-05, "loss": 2.1594, "step": 2080 }, { "epoch": 1.509705248023005, "grad_norm": 5.142696896062446, "learning_rate": 4.693588324147437e-05, "loss": 2.105, "step": 2100 }, { "epoch": 1.5240833932422717, "grad_norm": 4.933737837357054, "learning_rate": 4.6875760629470156e-05, "loss": 2.2051, "step": 2120 }, { "epoch": 1.5384615384615383, "grad_norm": 4.728725090484288, "learning_rate": 4.6815097856041986e-05, "loss": 2.0752, "step": 2140 }, { "epoch": 1.5528396836808052, "grad_norm": 5.1965116031535, "learning_rate": 4.675389661235908e-05, "loss": 2.1272, "step": 2160 }, { "epoch": 1.567217828900072, "grad_norm": 5.020583160820166, "learning_rate": 4.669215860460226e-05, "loss": 2.21, "step": 2180 }, { "epoch": 1.5815959741193386, "grad_norm": 5.290821603607888, "learning_rate": 4.662988555391632e-05, "loss": 2.0615, "step": 2200 }, { "epoch": 1.5815959741193386, "eval_loss": 2.1068339347839355, "eval_runtime": 94.9668, "eval_samples_per_second": 7.476, "eval_steps_per_second": 1.874, "step": 2200 }, { "epoch": 1.5959741193386052, "grad_norm": 5.335021892876329, "learning_rate": 4.656707919636215e-05, "loss": 2.1474, "step": 2220 }, { "epoch": 1.610352264557872, "grad_norm": 4.7933400957844166, "learning_rate": 4.650374128286825e-05, "loss": 2.0574, "step": 2240 }, { "epoch": 1.624730409777139, "grad_norm": 4.44113623853496, "learning_rate": 4.6439873579181934e-05, "loss": 2.1114, "step": 2260 }, { "epoch": 1.6391085549964055, "grad_norm": 4.801726947544004, "learning_rate": 4.637547786582015e-05, "loss": 2.0935, "step": 2280 }, { "epoch": 1.6534867002156721, "grad_norm": 5.024585732302448, "learning_rate": 4.631055593801977e-05, "loss": 2.0816, "step": 2300 }, { "epoch": 1.6678648454349387, "grad_norm": 4.832470978945399, "learning_rate": 4.624510960568759e-05, "loss": 2.0396, "step": 2320 }, { "epoch": 1.6822429906542056, "grad_norm": 5.0661313073550485, "learning_rate": 4.6179140693349894e-05, "loss": 2.097, "step": 2340 }, { "epoch": 1.6966211358734724, "grad_norm": 4.679601946091209, "learning_rate": 4.611265104010151e-05, "loss": 2.0873, "step": 2360 }, { "epoch": 1.710999281092739, "grad_norm": 4.889181786497249, "learning_rate": 4.604564249955463e-05, "loss": 2.0261, "step": 2380 }, { "epoch": 1.7253774263120056, "grad_norm": 4.897204874625993, "learning_rate": 4.5978116939787056e-05, "loss": 2.0731, "step": 2400 }, { "epoch": 1.7253774263120056, "eval_loss": 2.059098482131958, "eval_runtime": 95.0053, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.874, "step": 2400 }, { "epoch": 1.7397555715312725, "grad_norm": 4.603182673966091, "learning_rate": 4.591007624329019e-05, "loss": 2.0747, "step": 2420 }, { "epoch": 1.7541337167505393, "grad_norm": 4.598991169459091, "learning_rate": 4.5841522306916505e-05, "loss": 2.0311, "step": 2440 }, { "epoch": 1.768511861969806, "grad_norm": 4.561405494146018, "learning_rate": 4.5772457041826675e-05, "loss": 2.0028, "step": 2460 }, { "epoch": 1.7828900071890725, "grad_norm": 4.993259426284276, "learning_rate": 4.570288237343632e-05, "loss": 2.0612, "step": 2480 }, { "epoch": 1.7972681524083394, "grad_norm": 4.501150725728268, "learning_rate": 4.563280024136229e-05, "loss": 2.0074, "step": 2500 }, { "epoch": 1.811646297627606, "grad_norm": 4.720772032659857, "learning_rate": 4.556221259936861e-05, "loss": 2.056, "step": 2520 }, { "epoch": 1.8260244428468728, "grad_norm": 4.473775141788649, "learning_rate": 4.5491121415312044e-05, "loss": 2.0502, "step": 2540 }, { "epoch": 1.8404025880661394, "grad_norm": 5.039191205621526, "learning_rate": 4.541952867108717e-05, "loss": 2.0809, "step": 2560 }, { "epoch": 1.854780733285406, "grad_norm": 5.3961805133059, "learning_rate": 4.534743636257119e-05, "loss": 2.0731, "step": 2580 }, { "epoch": 1.8691588785046729, "grad_norm": 4.296361775627171, "learning_rate": 4.527484649956823e-05, "loss": 2.0112, "step": 2600 }, { "epoch": 1.8691588785046729, "eval_loss": 1.99062979221344, "eval_runtime": 95.2886, "eval_samples_per_second": 7.451, "eval_steps_per_second": 1.868, "step": 2600 }, { "epoch": 1.8835370237239397, "grad_norm": 4.526885996691755, "learning_rate": 4.5201761105753376e-05, "loss": 1.9847, "step": 2620 }, { "epoch": 1.8979151689432063, "grad_norm": 4.859991156903426, "learning_rate": 4.5128182218616205e-05, "loss": 1.9462, "step": 2640 }, { "epoch": 1.912293314162473, "grad_norm": 4.092328382365213, "learning_rate": 4.505411188940399e-05, "loss": 2.0464, "step": 2660 }, { "epoch": 1.9266714593817398, "grad_norm": 4.354116826358398, "learning_rate": 4.4979552183064576e-05, "loss": 1.9533, "step": 2680 }, { "epoch": 1.9410496046010066, "grad_norm": 4.5449032544302455, "learning_rate": 4.490450517818869e-05, "loss": 1.9692, "step": 2700 }, { "epoch": 1.9554277498202732, "grad_norm": 5.280719397936687, "learning_rate": 4.482897296695215e-05, "loss": 1.9458, "step": 2720 }, { "epoch": 1.9698058950395398, "grad_norm": 4.7994470248138805, "learning_rate": 4.475295765505737e-05, "loss": 1.9615, "step": 2740 }, { "epoch": 1.9841840402588065, "grad_norm": 4.8825903622988385, "learning_rate": 4.467646136167482e-05, "loss": 1.9826, "step": 2760 }, { "epoch": 1.9985621854780733, "grad_norm": 4.813498307403933, "learning_rate": 4.459948621938382e-05, "loss": 1.9427, "step": 2780 }, { "epoch": 2.01294033069734, "grad_norm": 5.60375996728684, "learning_rate": 4.4522034374113166e-05, "loss": 1.8399, "step": 2800 }, { "epoch": 2.01294033069734, "eval_loss": 1.9351197481155396, "eval_runtime": 95.1114, "eval_samples_per_second": 7.465, "eval_steps_per_second": 1.871, "step": 2800 }, { "epoch": 2.0273184759166067, "grad_norm": 5.2880499867239195, "learning_rate": 4.444410798508125e-05, "loss": 1.7887, "step": 2820 }, { "epoch": 2.0416966211358734, "grad_norm": 4.66223325046561, "learning_rate": 4.4365709224735926e-05, "loss": 1.711, "step": 2840 }, { "epoch": 2.05607476635514, "grad_norm": 5.318429023225783, "learning_rate": 4.4286840278693884e-05, "loss": 1.79, "step": 2860 }, { "epoch": 2.070452911574407, "grad_norm": 5.292683858994409, "learning_rate": 4.4207503345679765e-05, "loss": 1.6474, "step": 2880 }, { "epoch": 2.0848310567936736, "grad_norm": 5.296677049826025, "learning_rate": 4.4127700637464834e-05, "loss": 1.7384, "step": 2900 }, { "epoch": 2.0992092020129403, "grad_norm": 5.28280964549333, "learning_rate": 4.404743437880534e-05, "loss": 1.7859, "step": 2920 }, { "epoch": 2.113587347232207, "grad_norm": 4.748113798023336, "learning_rate": 4.3966706807380486e-05, "loss": 1.7709, "step": 2940 }, { "epoch": 2.127965492451474, "grad_norm": 5.529063322247205, "learning_rate": 4.388552017373005e-05, "loss": 1.7184, "step": 2960 }, { "epoch": 2.1423436376707405, "grad_norm": 4.730553126339451, "learning_rate": 4.380387674119163e-05, "loss": 1.7068, "step": 2980 }, { "epoch": 2.156721782890007, "grad_norm": 5.36722220081261, "learning_rate": 4.3721778785837567e-05, "loss": 1.7063, "step": 3000 }, { "epoch": 2.156721782890007, "eval_loss": 1.8719093799591064, "eval_runtime": 95.4773, "eval_samples_per_second": 7.436, "eval_steps_per_second": 1.864, "step": 3000 }, { "epoch": 2.1710999281092738, "grad_norm": 5.37541384535542, "learning_rate": 4.363922859641147e-05, "loss": 1.7258, "step": 3020 }, { "epoch": 2.1854780733285404, "grad_norm": 5.131778163059225, "learning_rate": 4.355622847426443e-05, "loss": 1.7558, "step": 3040 }, { "epoch": 2.1998562185478074, "grad_norm": 4.967901836712549, "learning_rate": 4.347278073329086e-05, "loss": 1.7162, "step": 3060 }, { "epoch": 2.214234363767074, "grad_norm": 5.404165339373527, "learning_rate": 4.3388887699863986e-05, "loss": 1.6724, "step": 3080 }, { "epoch": 2.2286125089863407, "grad_norm": 5.130803952362976, "learning_rate": 4.3304551712770966e-05, "loss": 1.7449, "step": 3100 }, { "epoch": 2.2429906542056073, "grad_norm": 4.664864170941625, "learning_rate": 4.321977512314773e-05, "loss": 1.6572, "step": 3120 }, { "epoch": 2.2573687994248743, "grad_norm": 4.6543357676765105, "learning_rate": 4.3134560294413415e-05, "loss": 1.7188, "step": 3140 }, { "epoch": 2.271746944644141, "grad_norm": 4.870392255731223, "learning_rate": 4.3048909602204455e-05, "loss": 1.6856, "step": 3160 }, { "epoch": 2.2861250898634076, "grad_norm": 4.555840542123253, "learning_rate": 4.2962825434308415e-05, "loss": 1.6203, "step": 3180 }, { "epoch": 2.300503235082674, "grad_norm": 4.999945556053941, "learning_rate": 4.2876310190597343e-05, "loss": 1.6595, "step": 3200 }, { "epoch": 2.300503235082674, "eval_loss": 1.8157068490982056, "eval_runtime": 95.0201, "eval_samples_per_second": 7.472, "eval_steps_per_second": 1.873, "step": 3200 }, { "epoch": 2.3148813803019412, "grad_norm": 4.420391622563157, "learning_rate": 4.2789366282960945e-05, "loss": 1.6973, "step": 3220 }, { "epoch": 2.329259525521208, "grad_norm": 4.900419834684209, "learning_rate": 4.270199613523927e-05, "loss": 1.6974, "step": 3240 }, { "epoch": 2.3436376707404745, "grad_norm": 5.46657776801936, "learning_rate": 4.26142021831552e-05, "loss": 1.6299, "step": 3260 }, { "epoch": 2.358015815959741, "grad_norm": 4.788517218174894, "learning_rate": 4.252598687424653e-05, "loss": 1.6057, "step": 3280 }, { "epoch": 2.372393961179008, "grad_norm": 5.2836220827409965, "learning_rate": 4.243735266779769e-05, "loss": 1.601, "step": 3300 }, { "epoch": 2.3867721063982748, "grad_norm": 4.668058236987495, "learning_rate": 4.2348302034771266e-05, "loss": 1.6659, "step": 3320 }, { "epoch": 2.4011502516175414, "grad_norm": 5.336205272825928, "learning_rate": 4.225883745773903e-05, "loss": 1.6947, "step": 3340 }, { "epoch": 2.415528396836808, "grad_norm": 4.98177891344483, "learning_rate": 4.2168961430812784e-05, "loss": 1.601, "step": 3360 }, { "epoch": 2.4299065420560746, "grad_norm": 5.336376016887355, "learning_rate": 4.207867645957484e-05, "loss": 1.6144, "step": 3380 }, { "epoch": 2.4442846872753416, "grad_norm": 5.533501299379357, "learning_rate": 4.19879850610081e-05, "loss": 1.6488, "step": 3400 }, { "epoch": 2.4442846872753416, "eval_loss": 1.744245171546936, "eval_runtime": 95.0078, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.874, "step": 3400 }, { "epoch": 2.4586628324946083, "grad_norm": 5.033513775688983, "learning_rate": 4.1896889763425976e-05, "loss": 1.6188, "step": 3420 }, { "epoch": 2.473040977713875, "grad_norm": 5.302823160144624, "learning_rate": 4.1805393106401804e-05, "loss": 1.6533, "step": 3440 }, { "epoch": 2.4874191229331415, "grad_norm": 5.626811550605517, "learning_rate": 4.1713497640698145e-05, "loss": 1.5243, "step": 3460 }, { "epoch": 2.5017972681524085, "grad_norm": 5.433250478973138, "learning_rate": 4.162120592819563e-05, "loss": 1.6433, "step": 3480 }, { "epoch": 2.516175413371675, "grad_norm": 4.356579185845903, "learning_rate": 4.1528520541821506e-05, "loss": 1.5712, "step": 3500 }, { "epoch": 2.5305535585909418, "grad_norm": 4.606446520762733, "learning_rate": 4.143544406547797e-05, "loss": 1.5558, "step": 3520 }, { "epoch": 2.5449317038102084, "grad_norm": 5.022208262407065, "learning_rate": 4.13419790939701e-05, "loss": 1.53, "step": 3540 }, { "epoch": 2.559309849029475, "grad_norm": 4.389342822675082, "learning_rate": 4.124812823293351e-05, "loss": 1.5554, "step": 3560 }, { "epoch": 2.573687994248742, "grad_norm": 5.267458390782124, "learning_rate": 4.1153894098761734e-05, "loss": 1.5747, "step": 3580 }, { "epoch": 2.5880661394680087, "grad_norm": 4.91610950762306, "learning_rate": 4.105927931853327e-05, "loss": 1.5857, "step": 3600 }, { "epoch": 2.5880661394680087, "eval_loss": 1.6660903692245483, "eval_runtime": 95.1538, "eval_samples_per_second": 7.462, "eval_steps_per_second": 1.871, "step": 3600 }, { "epoch": 2.6024442846872753, "grad_norm": 4.623110605534604, "learning_rate": 4.096428652993834e-05, "loss": 1.6156, "step": 3620 }, { "epoch": 2.616822429906542, "grad_norm": 5.285826831072292, "learning_rate": 4.086891838120536e-05, "loss": 1.5897, "step": 3640 }, { "epoch": 2.631200575125809, "grad_norm": 5.036548928146315, "learning_rate": 4.077317753102712e-05, "loss": 1.5116, "step": 3660 }, { "epoch": 2.6455787203450756, "grad_norm": 4.864592432779376, "learning_rate": 4.067706664848667e-05, "loss": 1.5118, "step": 3680 }, { "epoch": 2.659956865564342, "grad_norm": 5.5690416036717965, "learning_rate": 4.058058841298285e-05, "loss": 1.4525, "step": 3700 }, { "epoch": 2.674335010783609, "grad_norm": 5.266841922019754, "learning_rate": 4.048374551415569e-05, "loss": 1.5286, "step": 3720 }, { "epoch": 2.6887131560028754, "grad_norm": 4.627025718960161, "learning_rate": 4.038654065181137e-05, "loss": 1.5993, "step": 3740 }, { "epoch": 2.7030913012221425, "grad_norm": 5.147857938923495, "learning_rate": 4.028897653584694e-05, "loss": 1.5422, "step": 3760 }, { "epoch": 2.717469446441409, "grad_norm": 5.053721024209507, "learning_rate": 4.019105588617482e-05, "loss": 1.4778, "step": 3780 }, { "epoch": 2.7318475916606757, "grad_norm": 5.131739605647034, "learning_rate": 4.009278143264694e-05, "loss": 1.4596, "step": 3800 }, { "epoch": 2.7318475916606757, "eval_loss": 1.5976985692977905, "eval_runtime": 95.1934, "eval_samples_per_second": 7.459, "eval_steps_per_second": 1.87, "step": 3800 }, { "epoch": 2.7462257368799428, "grad_norm": 4.895509789688502, "learning_rate": 3.999415591497864e-05, "loss": 1.4485, "step": 3820 }, { "epoch": 2.7606038820992094, "grad_norm": 5.0799875433342825, "learning_rate": 3.9895182082672314e-05, "loss": 1.4502, "step": 3840 }, { "epoch": 2.774982027318476, "grad_norm": 5.0584022395815005, "learning_rate": 3.979586269494072e-05, "loss": 1.4323, "step": 3860 }, { "epoch": 2.7893601725377426, "grad_norm": 5.101741306521932, "learning_rate": 3.969620052063012e-05, "loss": 1.4622, "step": 3880 }, { "epoch": 2.803738317757009, "grad_norm": 4.765857819060766, "learning_rate": 3.959619833814299e-05, "loss": 1.4433, "step": 3900 }, { "epoch": 2.818116462976276, "grad_norm": 4.875737592080101, "learning_rate": 3.949585893536069e-05, "loss": 1.4394, "step": 3920 }, { "epoch": 2.832494608195543, "grad_norm": 4.9864521901230265, "learning_rate": 3.9395185109565634e-05, "loss": 1.4302, "step": 3940 }, { "epoch": 2.8468727534148095, "grad_norm": 5.28389537523971, "learning_rate": 3.9294179667363364e-05, "loss": 1.4103, "step": 3960 }, { "epoch": 2.861250898634076, "grad_norm": 4.929220150481026, "learning_rate": 3.919284542460427e-05, "loss": 1.4318, "step": 3980 }, { "epoch": 2.875629043853343, "grad_norm": 4.886618764152419, "learning_rate": 3.9091185206305156e-05, "loss": 1.4393, "step": 4000 }, { "epoch": 2.875629043853343, "eval_loss": 1.502436637878418, "eval_runtime": 95.3353, "eval_samples_per_second": 7.447, "eval_steps_per_second": 1.867, "step": 4000 }, { "epoch": 2.89000718907261, "grad_norm": 4.775846915898877, "learning_rate": 3.8989201846570405e-05, "loss": 1.3976, "step": 4020 }, { "epoch": 2.9043853342918764, "grad_norm": 4.765274471722679, "learning_rate": 3.888689818851301e-05, "loss": 1.4515, "step": 4040 }, { "epoch": 2.918763479511143, "grad_norm": 4.8233456855111765, "learning_rate": 3.87842770841753e-05, "loss": 1.3637, "step": 4060 }, { "epoch": 2.9331416247304096, "grad_norm": 4.716409537564854, "learning_rate": 3.868134139444945e-05, "loss": 1.4691, "step": 4080 }, { "epoch": 2.9475197699496762, "grad_norm": 5.100153466739594, "learning_rate": 3.85780939889977e-05, "loss": 1.386, "step": 4100 }, { "epoch": 2.9618979151689433, "grad_norm": 4.588464493898721, "learning_rate": 3.847453774617238e-05, "loss": 1.371, "step": 4120 }, { "epoch": 2.97627606038821, "grad_norm": 5.2951877031362, "learning_rate": 3.837067555293562e-05, "loss": 1.4062, "step": 4140 }, { "epoch": 2.9906542056074765, "grad_norm": 5.073352596381499, "learning_rate": 3.8266510304778945e-05, "loss": 1.3603, "step": 4160 }, { "epoch": 3.005032350826743, "grad_norm": 4.216009222448274, "learning_rate": 3.816204490564247e-05, "loss": 1.2376, "step": 4180 }, { "epoch": 3.01941049604601, "grad_norm": 4.654382088054549, "learning_rate": 3.8057282267833996e-05, "loss": 0.9292, "step": 4200 }, { "epoch": 3.01941049604601, "eval_loss": 1.4160563945770264, "eval_runtime": 95.0513, "eval_samples_per_second": 7.47, "eval_steps_per_second": 1.873, "step": 4200 }, { "epoch": 3.033788641265277, "grad_norm": 5.890773249177552, "learning_rate": 3.795222531194778e-05, "loss": 0.9939, "step": 4220 }, { "epoch": 3.0481667864845434, "grad_norm": 5.273040812138102, "learning_rate": 3.784687696678319e-05, "loss": 0.9692, "step": 4240 }, { "epoch": 3.06254493170381, "grad_norm": 4.617434722391141, "learning_rate": 3.774124016926295e-05, "loss": 0.9423, "step": 4260 }, { "epoch": 3.076923076923077, "grad_norm": 4.794825322123316, "learning_rate": 3.763531786435136e-05, "loss": 0.9553, "step": 4280 }, { "epoch": 3.0913012221423437, "grad_norm": 4.612416905686019, "learning_rate": 3.752911300497212e-05, "loss": 1.0468, "step": 4300 }, { "epoch": 3.1056793673616103, "grad_norm": 4.807421016950355, "learning_rate": 3.7422628551926045e-05, "loss": 0.9755, "step": 4320 }, { "epoch": 3.120057512580877, "grad_norm": 5.330376372980625, "learning_rate": 3.7315867473808556e-05, "loss": 0.995, "step": 4340 }, { "epoch": 3.134435657800144, "grad_norm": 5.173638877055289, "learning_rate": 3.7208832746926856e-05, "loss": 0.8955, "step": 4360 }, { "epoch": 3.1488138030194106, "grad_norm": 4.337797150987041, "learning_rate": 3.710152735521697e-05, "loss": 0.9392, "step": 4380 }, { "epoch": 3.163191948238677, "grad_norm": 4.7087288476465385, "learning_rate": 3.6993954290160595e-05, "loss": 0.8507, "step": 4400 }, { "epoch": 3.163191948238677, "eval_loss": 1.3944473266601562, "eval_runtime": 95.1428, "eval_samples_per_second": 7.462, "eval_steps_per_second": 1.871, "step": 4400 }, { "epoch": 3.177570093457944, "grad_norm": 4.385026398896629, "learning_rate": 3.6886116550701686e-05, "loss": 0.9656, "step": 4420 }, { "epoch": 3.1919482386772104, "grad_norm": 5.060518593348969, "learning_rate": 3.677801714316283e-05, "loss": 0.9374, "step": 4440 }, { "epoch": 3.2063263838964775, "grad_norm": 4.963676634667283, "learning_rate": 3.666965908116145e-05, "loss": 1.0603, "step": 4460 }, { "epoch": 3.220704529115744, "grad_norm": 5.537695202590892, "learning_rate": 3.656104538552579e-05, "loss": 0.9251, "step": 4480 }, { "epoch": 3.2350826743350107, "grad_norm": 5.159238562381511, "learning_rate": 3.645217908421072e-05, "loss": 0.9029, "step": 4500 }, { "epoch": 3.2494608195542773, "grad_norm": 4.583487471613817, "learning_rate": 3.634306321221328e-05, "loss": 0.9456, "step": 4520 }, { "epoch": 3.2638389647735444, "grad_norm": 4.743610746700115, "learning_rate": 3.623370081148811e-05, "loss": 0.9517, "step": 4540 }, { "epoch": 3.278217109992811, "grad_norm": 4.820931354676504, "learning_rate": 3.612409493086261e-05, "loss": 0.8897, "step": 4560 }, { "epoch": 3.2925952552120776, "grad_norm": 4.644390057678307, "learning_rate": 3.6014248625951984e-05, "loss": 0.8988, "step": 4580 }, { "epoch": 3.3069734004313442, "grad_norm": 4.199864500637539, "learning_rate": 3.590416495907401e-05, "loss": 0.8764, "step": 4600 }, { "epoch": 3.3069734004313442, "eval_loss": 1.2968120574951172, "eval_runtime": 94.9563, "eval_samples_per_second": 7.477, "eval_steps_per_second": 1.875, "step": 4600 }, { "epoch": 3.321351545650611, "grad_norm": 4.8933319942452735, "learning_rate": 3.579384699916372e-05, "loss": 0.9392, "step": 4620 }, { "epoch": 3.335729690869878, "grad_norm": 5.539372627833398, "learning_rate": 3.5683297821687786e-05, "loss": 0.9456, "step": 4640 }, { "epoch": 3.3501078360891445, "grad_norm": 4.440124319383781, "learning_rate": 3.557252050855882e-05, "loss": 0.8985, "step": 4660 }, { "epoch": 3.364485981308411, "grad_norm": 4.51905807949511, "learning_rate": 3.546151814804947e-05, "loss": 0.894, "step": 4680 }, { "epoch": 3.3788641265276778, "grad_norm": 4.821926801095058, "learning_rate": 3.535029383470625e-05, "loss": 0.8877, "step": 4700 }, { "epoch": 3.393242271746945, "grad_norm": 4.9545904090849096, "learning_rate": 3.523885066926339e-05, "loss": 0.8563, "step": 4720 }, { "epoch": 3.4076204169662114, "grad_norm": 4.894310928975366, "learning_rate": 3.512719175855625e-05, "loss": 0.9125, "step": 4740 }, { "epoch": 3.421998562185478, "grad_norm": 4.878217385051204, "learning_rate": 3.5015320215434846e-05, "loss": 0.8506, "step": 4760 }, { "epoch": 3.4363767074047447, "grad_norm": 5.063687633092487, "learning_rate": 3.4903239158676954e-05, "loss": 0.8756, "step": 4780 }, { "epoch": 3.4507548526240113, "grad_norm": 4.673136695418736, "learning_rate": 3.479095171290124e-05, "loss": 0.8721, "step": 4800 }, { "epoch": 3.4507548526240113, "eval_loss": 1.2097233533859253, "eval_runtime": 94.9642, "eval_samples_per_second": 7.477, "eval_steps_per_second": 1.874, "step": 4800 }, { "epoch": 3.4651329978432783, "grad_norm": 5.195670176766828, "learning_rate": 3.467846100848011e-05, "loss": 0.863, "step": 4820 }, { "epoch": 3.479511143062545, "grad_norm": 5.299015192713523, "learning_rate": 3.456577018145249e-05, "loss": 0.8514, "step": 4840 }, { "epoch": 3.4938892882818116, "grad_norm": 5.076570824919959, "learning_rate": 3.4452882373436316e-05, "loss": 0.8804, "step": 4860 }, { "epoch": 3.5082674335010786, "grad_norm": 5.458489723441928, "learning_rate": 3.433980073154104e-05, "loss": 0.8449, "step": 4880 }, { "epoch": 3.5226455787203452, "grad_norm": 5.124610831012214, "learning_rate": 3.422652840827983e-05, "loss": 0.8071, "step": 4900 }, { "epoch": 3.537023723939612, "grad_norm": 4.568932253998444, "learning_rate": 3.411306856148173e-05, "loss": 0.7761, "step": 4920 }, { "epoch": 3.5514018691588785, "grad_norm": 5.145433589411428, "learning_rate": 3.399942435420358e-05, "loss": 0.8594, "step": 4940 }, { "epoch": 3.565780014378145, "grad_norm": 4.760657828130472, "learning_rate": 3.388559895464187e-05, "loss": 0.8927, "step": 4960 }, { "epoch": 3.5801581595974117, "grad_norm": 3.820560651004478, "learning_rate": 3.3771595536044414e-05, "loss": 0.8388, "step": 4980 }, { "epoch": 3.5945363048166787, "grad_norm": 5.68396222586338, "learning_rate": 3.365741727662187e-05, "loss": 0.8046, "step": 5000 }, { "epoch": 3.5945363048166787, "eval_loss": 1.1343132257461548, "eval_runtime": 94.9046, "eval_samples_per_second": 7.481, "eval_steps_per_second": 1.876, "step": 5000 }, { "epoch": 3.6089144500359454, "grad_norm": 5.325125464111565, "learning_rate": 3.3543067359459137e-05, "loss": 0.8037, "step": 5020 }, { "epoch": 3.623292595255212, "grad_norm": 4.863903982548437, "learning_rate": 3.342854897242662e-05, "loss": 0.8368, "step": 5040 }, { "epoch": 3.637670740474479, "grad_norm": 4.881874458955767, "learning_rate": 3.33138653080914e-05, "loss": 0.8125, "step": 5060 }, { "epoch": 3.6520488856937456, "grad_norm": 5.3439550891850365, "learning_rate": 3.3199019563628134e-05, "loss": 0.7565, "step": 5080 }, { "epoch": 3.6664270309130123, "grad_norm": 4.84296449431872, "learning_rate": 3.308401494073004e-05, "loss": 0.834, "step": 5100 }, { "epoch": 3.680805176132279, "grad_norm": 5.110097802059874, "learning_rate": 3.296885464551953e-05, "loss": 0.7868, "step": 5120 }, { "epoch": 3.6951833213515455, "grad_norm": 4.929559008914251, "learning_rate": 3.285354188845892e-05, "loss": 0.7911, "step": 5140 }, { "epoch": 3.709561466570812, "grad_norm": 5.054253010860754, "learning_rate": 3.273807988426087e-05, "loss": 0.7886, "step": 5160 }, { "epoch": 3.723939611790079, "grad_norm": 4.61684551923686, "learning_rate": 3.262247185179879e-05, "loss": 0.7813, "step": 5180 }, { "epoch": 3.7383177570093458, "grad_norm": 4.353723945187912, "learning_rate": 3.250672101401707e-05, "loss": 0.736, "step": 5200 }, { "epoch": 3.7383177570093458, "eval_loss": 1.0338796377182007, "eval_runtime": 94.9478, "eval_samples_per_second": 7.478, "eval_steps_per_second": 1.875, "step": 5200 }, { "epoch": 3.7526959022286124, "grad_norm": 5.703808944893645, "learning_rate": 3.2390830597841306e-05, "loss": 0.7881, "step": 5220 }, { "epoch": 3.7670740474478794, "grad_norm": 4.541111143609565, "learning_rate": 3.2274803834088244e-05, "loss": 0.7216, "step": 5240 }, { "epoch": 3.781452192667146, "grad_norm": 5.185866482725821, "learning_rate": 3.215864395737577e-05, "loss": 0.7323, "step": 5260 }, { "epoch": 3.7958303378864127, "grad_norm": 4.309899151553392, "learning_rate": 3.204235420603273e-05, "loss": 0.7352, "step": 5280 }, { "epoch": 3.8102084831056793, "grad_norm": 4.794889232835026, "learning_rate": 3.192593782200863e-05, "loss": 0.7682, "step": 5300 }, { "epoch": 3.824586628324946, "grad_norm": 4.620050702309508, "learning_rate": 3.180939805078328e-05, "loss": 0.7158, "step": 5320 }, { "epoch": 3.838964773544213, "grad_norm": 4.789174643783679, "learning_rate": 3.169273814127629e-05, "loss": 0.7224, "step": 5340 }, { "epoch": 3.8533429187634796, "grad_norm": 4.470710040748567, "learning_rate": 3.15759613457565e-05, "loss": 0.7606, "step": 5360 }, { "epoch": 3.867721063982746, "grad_norm": 4.200672286876548, "learning_rate": 3.145907091975136e-05, "loss": 0.7342, "step": 5380 }, { "epoch": 3.882099209202013, "grad_norm": 4.651034024184218, "learning_rate": 3.134207012195609e-05, "loss": 0.6963, "step": 5400 }, { "epoch": 3.882099209202013, "eval_loss": 0.9063346982002258, "eval_runtime": 95.1402, "eval_samples_per_second": 7.463, "eval_steps_per_second": 1.871, "step": 5400 }, { "epoch": 3.89647735442128, "grad_norm": 5.251836684504766, "learning_rate": 3.122496221414293e-05, "loss": 0.6979, "step": 5420 }, { "epoch": 3.9108554996405465, "grad_norm": 4.501970989039771, "learning_rate": 3.110775046107009e-05, "loss": 0.6784, "step": 5440 }, { "epoch": 3.925233644859813, "grad_norm": 4.383276146435303, "learning_rate": 3.0990438130390854e-05, "loss": 0.705, "step": 5460 }, { "epoch": 3.9396117900790797, "grad_norm": 4.909739674989457, "learning_rate": 3.0873028492562395e-05, "loss": 0.6692, "step": 5480 }, { "epoch": 3.9539899352983463, "grad_norm": 4.386911467650432, "learning_rate": 3.075552482075466e-05, "loss": 0.6622, "step": 5500 }, { "epoch": 3.9683680805176134, "grad_norm": 5.143117323784103, "learning_rate": 3.0637930390759076e-05, "loss": 0.6242, "step": 5520 }, { "epoch": 3.98274622573688, "grad_norm": 5.035434062806972, "learning_rate": 3.052024848089725e-05, "loss": 0.6244, "step": 5540 }, { "epoch": 3.9971243709561466, "grad_norm": 4.838730604347607, "learning_rate": 3.0402482371929582e-05, "loss": 0.7241, "step": 5560 }, { "epoch": 4.011502516175414, "grad_norm": 3.7762087987736335, "learning_rate": 3.0284635346963764e-05, "loss": 0.4018, "step": 5580 }, { "epoch": 4.02588066139468, "grad_norm": 3.8053820101683766, "learning_rate": 3.0166710691363316e-05, "loss": 0.346, "step": 5600 }, { "epoch": 4.02588066139468, "eval_loss": 0.8031301498413086, "eval_runtime": 95.0025, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.874, "step": 5600 }, { "epoch": 4.040258806613947, "grad_norm": 3.633422578478027, "learning_rate": 3.004871169265593e-05, "loss": 0.3547, "step": 5620 }, { "epoch": 4.0546369518332135, "grad_norm": 3.8811754142736605, "learning_rate": 2.9930641640441876e-05, "loss": 0.3161, "step": 5640 }, { "epoch": 4.06901509705248, "grad_norm": 3.5964575085704666, "learning_rate": 2.9812503826302257e-05, "loss": 0.3407, "step": 5660 }, { "epoch": 4.083393242271747, "grad_norm": 3.3163513924241355, "learning_rate": 2.9694301543707255e-05, "loss": 0.3307, "step": 5680 }, { "epoch": 4.097771387491013, "grad_norm": 3.5339198445026714, "learning_rate": 2.9576038087924297e-05, "loss": 0.3412, "step": 5700 }, { "epoch": 4.11214953271028, "grad_norm": 3.7886609523702752, "learning_rate": 2.9457716755926258e-05, "loss": 0.3365, "step": 5720 }, { "epoch": 4.126527677929547, "grad_norm": 3.4940816712487224, "learning_rate": 2.9339340846299456e-05, "loss": 0.359, "step": 5740 }, { "epoch": 4.140905823148814, "grad_norm": 3.8228147601492424, "learning_rate": 2.9220913659151748e-05, "loss": 0.3539, "step": 5760 }, { "epoch": 4.155283968368081, "grad_norm": 4.777444368973502, "learning_rate": 2.9102438496020524e-05, "loss": 0.3696, "step": 5780 }, { "epoch": 4.169662113587347, "grad_norm": 4.24172355984632, "learning_rate": 2.8983918659780646e-05, "loss": 0.3342, "step": 5800 }, { "epoch": 4.169662113587347, "eval_loss": 0.7978797554969788, "eval_runtime": 95.1128, "eval_samples_per_second": 7.465, "eval_steps_per_second": 1.871, "step": 5800 }, { "epoch": 4.184040258806614, "grad_norm": 3.4399861307887463, "learning_rate": 2.8865357454552393e-05, "loss": 0.3617, "step": 5820 }, { "epoch": 4.1984184040258805, "grad_norm": 3.9247967710302105, "learning_rate": 2.874675818560933e-05, "loss": 0.3352, "step": 5840 }, { "epoch": 4.212796549245147, "grad_norm": 4.206719908492779, "learning_rate": 2.8628124159286162e-05, "loss": 0.343, "step": 5860 }, { "epoch": 4.227174694464414, "grad_norm": 3.579153737863472, "learning_rate": 2.8509458682886592e-05, "loss": 0.3365, "step": 5880 }, { "epoch": 4.241552839683681, "grad_norm": 4.485756832244402, "learning_rate": 2.8390765064591067e-05, "loss": 0.3563, "step": 5900 }, { "epoch": 4.255930984902948, "grad_norm": 3.601421123305685, "learning_rate": 2.82720466133646e-05, "loss": 0.3689, "step": 5920 }, { "epoch": 4.2703091301222145, "grad_norm": 3.381444289556178, "learning_rate": 2.815330663886449e-05, "loss": 0.3655, "step": 5940 }, { "epoch": 4.284687275341481, "grad_norm": 4.260575686248021, "learning_rate": 2.803454845134807e-05, "loss": 0.313, "step": 5960 }, { "epoch": 4.299065420560748, "grad_norm": 4.020678447213185, "learning_rate": 2.7915775361580428e-05, "loss": 0.3273, "step": 5980 }, { "epoch": 4.313443565780014, "grad_norm": 4.218502841035936, "learning_rate": 2.779699068074208e-05, "loss": 0.3426, "step": 6000 }, { "epoch": 4.313443565780014, "eval_loss": 0.7659556865692139, "eval_runtime": 95.1822, "eval_samples_per_second": 7.459, "eval_steps_per_second": 1.87, "step": 6000 }, { "epoch": 4.327821710999281, "grad_norm": 4.242124083199349, "learning_rate": 2.767819772033669e-05, "loss": 0.3092, "step": 6020 }, { "epoch": 4.3421998562185475, "grad_norm": 3.603338153962201, "learning_rate": 2.7559399792098757e-05, "loss": 0.3351, "step": 6040 }, { "epoch": 4.356578001437814, "grad_norm": 4.09219396831434, "learning_rate": 2.744060020790125e-05, "loss": 0.358, "step": 6060 }, { "epoch": 4.370956146657081, "grad_norm": 4.240093061951673, "learning_rate": 2.7321802279663315e-05, "loss": 0.3422, "step": 6080 }, { "epoch": 4.385334291876348, "grad_norm": 3.9048915638391763, "learning_rate": 2.7203009319257927e-05, "loss": 0.3397, "step": 6100 }, { "epoch": 4.399712437095615, "grad_norm": 4.07320075881977, "learning_rate": 2.708422463841958e-05, "loss": 0.3315, "step": 6120 }, { "epoch": 4.4140905823148815, "grad_norm": 3.32557552519866, "learning_rate": 2.6965451548651938e-05, "loss": 0.3131, "step": 6140 }, { "epoch": 4.428468727534148, "grad_norm": 4.675885110169447, "learning_rate": 2.6846693361135522e-05, "loss": 0.315, "step": 6160 }, { "epoch": 4.442846872753415, "grad_norm": 3.7485615134459405, "learning_rate": 2.6727953386635406e-05, "loss": 0.311, "step": 6180 }, { "epoch": 4.457225017972681, "grad_norm": 3.8879166393703533, "learning_rate": 2.6609234935408945e-05, "loss": 0.3388, "step": 6200 }, { "epoch": 4.457225017972681, "eval_loss": 0.7081239223480225, "eval_runtime": 95.4928, "eval_samples_per_second": 7.435, "eval_steps_per_second": 1.864, "step": 6200 }, { "epoch": 4.471603163191948, "grad_norm": 3.5820375915220644, "learning_rate": 2.6490541317113427e-05, "loss": 0.3427, "step": 6220 }, { "epoch": 4.485981308411215, "grad_norm": 3.6407271030099215, "learning_rate": 2.637187584071384e-05, "loss": 0.3051, "step": 6240 }, { "epoch": 4.500359453630482, "grad_norm": 3.726385171500585, "learning_rate": 2.6253241814390676e-05, "loss": 0.2748, "step": 6260 }, { "epoch": 4.514737598849749, "grad_norm": 3.5020005944474732, "learning_rate": 2.613464254544761e-05, "loss": 0.3514, "step": 6280 }, { "epoch": 4.529115744069015, "grad_norm": 3.2090288253309716, "learning_rate": 2.6016081340219356e-05, "loss": 0.3388, "step": 6300 }, { "epoch": 4.543493889288282, "grad_norm": 3.2198075509902986, "learning_rate": 2.5897561503979478e-05, "loss": 0.3057, "step": 6320 }, { "epoch": 4.5578720345075485, "grad_norm": 3.5752578196627094, "learning_rate": 2.5779086340848257e-05, "loss": 0.2949, "step": 6340 }, { "epoch": 4.572250179726815, "grad_norm": 3.8552778688461116, "learning_rate": 2.566065915370055e-05, "loss": 0.3529, "step": 6360 }, { "epoch": 4.586628324946082, "grad_norm": 4.500361755745332, "learning_rate": 2.554228324407375e-05, "loss": 0.2893, "step": 6380 }, { "epoch": 4.601006470165348, "grad_norm": 2.9143489664656492, "learning_rate": 2.5423961912075712e-05, "loss": 0.3169, "step": 6400 }, { "epoch": 4.601006470165348, "eval_loss": 0.647361159324646, "eval_runtime": 95.0975, "eval_samples_per_second": 7.466, "eval_steps_per_second": 1.872, "step": 6400 }, { "epoch": 4.615384615384615, "grad_norm": 3.711342895438154, "learning_rate": 2.5305698456292758e-05, "loss": 0.2876, "step": 6420 }, { "epoch": 4.6297627606038825, "grad_norm": 3.7020282599564, "learning_rate": 2.518749617369775e-05, "loss": 0.2987, "step": 6440 }, { "epoch": 4.644140905823149, "grad_norm": 3.3242662861554155, "learning_rate": 2.5069358359558126e-05, "loss": 0.3331, "step": 6460 }, { "epoch": 4.658519051042416, "grad_norm": 3.924698535818125, "learning_rate": 2.495128830734408e-05, "loss": 0.2991, "step": 6480 }, { "epoch": 4.672897196261682, "grad_norm": 4.090313400971172, "learning_rate": 2.4833289308636693e-05, "loss": 0.2732, "step": 6500 }, { "epoch": 4.687275341480949, "grad_norm": 3.7716729841694505, "learning_rate": 2.4715364653036245e-05, "loss": 0.2656, "step": 6520 }, { "epoch": 4.7016534867002155, "grad_norm": 3.8130653011051745, "learning_rate": 2.4597517628070434e-05, "loss": 0.3101, "step": 6540 }, { "epoch": 4.716031631919482, "grad_norm": 3.6664917416085823, "learning_rate": 2.447975151910276e-05, "loss": 0.2918, "step": 6560 }, { "epoch": 4.730409777138749, "grad_norm": 3.5206854492391315, "learning_rate": 2.4362069609240933e-05, "loss": 0.2752, "step": 6580 }, { "epoch": 4.744787922358016, "grad_norm": 3.36674316245278, "learning_rate": 2.4244475179245348e-05, "loss": 0.2788, "step": 6600 }, { "epoch": 4.744787922358016, "eval_loss": 0.5831869840621948, "eval_runtime": 94.9797, "eval_samples_per_second": 7.475, "eval_steps_per_second": 1.874, "step": 6600 }, { "epoch": 4.759166067577283, "grad_norm": 3.501678635535513, "learning_rate": 2.41269715074376e-05, "loss": 0.2487, "step": 6620 }, { "epoch": 4.7735442127965495, "grad_norm": 3.128846435349539, "learning_rate": 2.4009561869609148e-05, "loss": 0.2725, "step": 6640 }, { "epoch": 4.787922358015816, "grad_norm": 3.5356811979056113, "learning_rate": 2.3892249538929912e-05, "loss": 0.3208, "step": 6660 }, { "epoch": 4.802300503235083, "grad_norm": 4.5315327649915575, "learning_rate": 2.3775037785857073e-05, "loss": 0.272, "step": 6680 }, { "epoch": 4.816678648454349, "grad_norm": 3.5524117779614643, "learning_rate": 2.3657929878043906e-05, "loss": 0.2696, "step": 6700 }, { "epoch": 4.831056793673616, "grad_norm": 3.824091251673855, "learning_rate": 2.3540929080248646e-05, "loss": 0.2944, "step": 6720 }, { "epoch": 4.845434938892883, "grad_norm": 3.292419610880534, "learning_rate": 2.3424038654243507e-05, "loss": 0.2432, "step": 6740 }, { "epoch": 4.859813084112149, "grad_norm": 3.4159645581237656, "learning_rate": 2.3307261858723723e-05, "loss": 0.2444, "step": 6760 }, { "epoch": 4.874191229331416, "grad_norm": 4.084161850857968, "learning_rate": 2.319060194921673e-05, "loss": 0.2622, "step": 6780 }, { "epoch": 4.888569374550683, "grad_norm": 2.4534341246257227, "learning_rate": 2.3074062177991373e-05, "loss": 0.2326, "step": 6800 }, { "epoch": 4.888569374550683, "eval_loss": 0.5214605331420898, "eval_runtime": 95.3983, "eval_samples_per_second": 7.442, "eval_steps_per_second": 1.866, "step": 6800 }, { "epoch": 4.90294751976995, "grad_norm": 3.2607272502878315, "learning_rate": 2.2957645793967277e-05, "loss": 0.2746, "step": 6820 }, { "epoch": 4.9173256649892165, "grad_norm": 3.322757677302258, "learning_rate": 2.2841356042624234e-05, "loss": 0.2437, "step": 6840 }, { "epoch": 4.931703810208483, "grad_norm": 2.8800141239102737, "learning_rate": 2.2725196165911765e-05, "loss": 0.2671, "step": 6860 }, { "epoch": 4.94608195542775, "grad_norm": 2.958452590637205, "learning_rate": 2.2609169402158696e-05, "loss": 0.2275, "step": 6880 }, { "epoch": 4.960460100647016, "grad_norm": 3.8035839747048974, "learning_rate": 2.249327898598293e-05, "loss": 0.2366, "step": 6900 }, { "epoch": 4.974838245866283, "grad_norm": 3.7602185439564364, "learning_rate": 2.237752814820122e-05, "loss": 0.241, "step": 6920 }, { "epoch": 4.98921639108555, "grad_norm": 3.6449337323487727, "learning_rate": 2.2261920115739137e-05, "loss": 0.2338, "step": 6940 }, { "epoch": 5.003594536304817, "grad_norm": 2.899402463401305, "learning_rate": 2.2146458111541084e-05, "loss": 0.2363, "step": 6960 }, { "epoch": 5.017972681524084, "grad_norm": 2.179657035418109, "learning_rate": 2.203114535448047e-05, "loss": 0.1179, "step": 6980 }, { "epoch": 5.03235082674335, "grad_norm": 2.9206861319741524, "learning_rate": 2.1915985059269966e-05, "loss": 0.1096, "step": 7000 }, { "epoch": 5.03235082674335, "eval_loss": 0.48705199360847473, "eval_runtime": 95.0343, "eval_samples_per_second": 7.471, "eval_steps_per_second": 1.873, "step": 7000 }, { "epoch": 5.046728971962617, "grad_norm": 3.3343151915634057, "learning_rate": 2.1800980436371864e-05, "loss": 0.1179, "step": 7020 }, { "epoch": 5.0611071171818836, "grad_norm": 3.4978232084767558, "learning_rate": 2.1686134691908606e-05, "loss": 0.1254, "step": 7040 }, { "epoch": 5.07548526240115, "grad_norm": 2.628073375097494, "learning_rate": 2.157145102757338e-05, "loss": 0.1238, "step": 7060 }, { "epoch": 5.089863407620417, "grad_norm": 3.511922564055676, "learning_rate": 2.1456932640540872e-05, "loss": 0.1286, "step": 7080 }, { "epoch": 5.104241552839683, "grad_norm": 3.2038916584161496, "learning_rate": 2.134258272337814e-05, "loss": 0.1208, "step": 7100 }, { "epoch": 5.11861969805895, "grad_norm": 2.9186195372093806, "learning_rate": 2.1228404463955588e-05, "loss": 0.1334, "step": 7120 }, { "epoch": 5.1329978432782175, "grad_norm": 2.4964992425737775, "learning_rate": 2.1114401045358135e-05, "loss": 0.1145, "step": 7140 }, { "epoch": 5.147375988497484, "grad_norm": 2.746919975951301, "learning_rate": 2.1000575645796427e-05, "loss": 0.1205, "step": 7160 }, { "epoch": 5.161754133716751, "grad_norm": 3.186604464709822, "learning_rate": 2.0886931438518277e-05, "loss": 0.1415, "step": 7180 }, { "epoch": 5.176132278936017, "grad_norm": 3.791723952579076, "learning_rate": 2.0773471591720172e-05, "loss": 0.1374, "step": 7200 }, { "epoch": 5.176132278936017, "eval_loss": 0.4873916804790497, "eval_runtime": 95.0401, "eval_samples_per_second": 7.471, "eval_steps_per_second": 1.873, "step": 7200 }, { "epoch": 5.190510424155284, "grad_norm": 3.194914429367862, "learning_rate": 2.0660199268458968e-05, "loss": 0.1356, "step": 7220 }, { "epoch": 5.204888569374551, "grad_norm": 3.3264271128825778, "learning_rate": 2.054711762656369e-05, "loss": 0.1168, "step": 7240 }, { "epoch": 5.219266714593817, "grad_norm": 2.0686564494935897, "learning_rate": 2.0434229818547518e-05, "loss": 0.1166, "step": 7260 }, { "epoch": 5.233644859813084, "grad_norm": 2.586191401181996, "learning_rate": 2.0321538991519894e-05, "loss": 0.1239, "step": 7280 }, { "epoch": 5.24802300503235, "grad_norm": 3.270832885346811, "learning_rate": 2.0209048287098775e-05, "loss": 0.1286, "step": 7300 }, { "epoch": 5.262401150251618, "grad_norm": 3.0199641036649854, "learning_rate": 2.009676084132306e-05, "loss": 0.1319, "step": 7320 }, { "epoch": 5.2767792954708845, "grad_norm": 3.3684801678974967, "learning_rate": 1.998467978456517e-05, "loss": 0.1253, "step": 7340 }, { "epoch": 5.291157440690151, "grad_norm": 3.3671249178043916, "learning_rate": 1.9872808241443746e-05, "loss": 0.1338, "step": 7360 }, { "epoch": 5.305535585909418, "grad_norm": 2.114863221347381, "learning_rate": 1.976114933073662e-05, "loss": 0.112, "step": 7380 }, { "epoch": 5.319913731128684, "grad_norm": 2.5441440040049432, "learning_rate": 1.9649706165293752e-05, "loss": 0.1262, "step": 7400 }, { "epoch": 5.319913731128684, "eval_loss": 0.47789904475212097, "eval_runtime": 95.2624, "eval_samples_per_second": 7.453, "eval_steps_per_second": 1.869, "step": 7400 }, { "epoch": 5.334291876347951, "grad_norm": 2.7965885056997237, "learning_rate": 1.953848185195054e-05, "loss": 0.1154, "step": 7420 }, { "epoch": 5.348670021567218, "grad_norm": 2.789354945166839, "learning_rate": 1.9427479491441187e-05, "loss": 0.1223, "step": 7440 }, { "epoch": 5.363048166786484, "grad_norm": 2.7352578201417757, "learning_rate": 1.9316702178312222e-05, "loss": 0.1218, "step": 7460 }, { "epoch": 5.377426312005751, "grad_norm": 3.3030746857296767, "learning_rate": 1.9206153000836286e-05, "loss": 0.1159, "step": 7480 }, { "epoch": 5.391804457225018, "grad_norm": 3.1497321141106784, "learning_rate": 1.9095835040925993e-05, "loss": 0.1201, "step": 7500 }, { "epoch": 5.406182602444285, "grad_norm": 2.506232679868558, "learning_rate": 1.898575137404802e-05, "loss": 0.1169, "step": 7520 }, { "epoch": 5.420560747663552, "grad_norm": 2.597488885298759, "learning_rate": 1.8875905069137394e-05, "loss": 0.1029, "step": 7540 }, { "epoch": 5.434938892882818, "grad_norm": 3.634018210562274, "learning_rate": 1.8766299188511893e-05, "loss": 0.1162, "step": 7560 }, { "epoch": 5.449317038102085, "grad_norm": 3.190319282933517, "learning_rate": 1.8656936787786722e-05, "loss": 0.1178, "step": 7580 }, { "epoch": 5.463695183321351, "grad_norm": 2.978731316866819, "learning_rate": 1.854782091578928e-05, "loss": 0.118, "step": 7600 }, { "epoch": 5.463695183321351, "eval_loss": 0.4637151062488556, "eval_runtime": 95.0051, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.874, "step": 7600 }, { "epoch": 5.478073328540618, "grad_norm": 2.5062315663221026, "learning_rate": 1.843895461447422e-05, "loss": 0.1288, "step": 7620 }, { "epoch": 5.492451473759885, "grad_norm": 2.3614369968744735, "learning_rate": 1.8330340918838555e-05, "loss": 0.1193, "step": 7640 }, { "epoch": 5.506829618979152, "grad_norm": 3.032991410827681, "learning_rate": 1.8221982856837178e-05, "loss": 0.1126, "step": 7660 }, { "epoch": 5.521207764198419, "grad_norm": 3.13450270361195, "learning_rate": 1.8113883449298313e-05, "loss": 0.1163, "step": 7680 }, { "epoch": 5.535585909417685, "grad_norm": 2.380694703132617, "learning_rate": 1.8006045709839403e-05, "loss": 0.1121, "step": 7700 }, { "epoch": 5.549964054636952, "grad_norm": 2.8074346598017987, "learning_rate": 1.7898472644783036e-05, "loss": 0.118, "step": 7720 }, { "epoch": 5.564342199856219, "grad_norm": 3.025154606533116, "learning_rate": 1.779116725307315e-05, "loss": 0.114, "step": 7740 }, { "epoch": 5.578720345075485, "grad_norm": 2.8464120898483274, "learning_rate": 1.768413252619144e-05, "loss": 0.0938, "step": 7760 }, { "epoch": 5.593098490294752, "grad_norm": 3.329076081813931, "learning_rate": 1.7577371448073954e-05, "loss": 0.1147, "step": 7780 }, { "epoch": 5.607476635514018, "grad_norm": 3.3855825431806728, "learning_rate": 1.747088699502789e-05, "loss": 0.1132, "step": 7800 }, { "epoch": 5.607476635514018, "eval_loss": 0.4415024518966675, "eval_runtime": 94.9693, "eval_samples_per_second": 7.476, "eval_steps_per_second": 1.874, "step": 7800 }, { "epoch": 5.621854780733285, "grad_norm": 2.280082024927034, "learning_rate": 1.736468213564865e-05, "loss": 0.1006, "step": 7820 }, { "epoch": 5.636232925952552, "grad_norm": 2.7694351541766715, "learning_rate": 1.7258759830737053e-05, "loss": 0.1049, "step": 7840 }, { "epoch": 5.650611071171819, "grad_norm": 2.4638616875501302, "learning_rate": 1.715312303321681e-05, "loss": 0.1005, "step": 7860 }, { "epoch": 5.664989216391086, "grad_norm": 3.348672704671524, "learning_rate": 1.7047774688052214e-05, "loss": 0.0978, "step": 7880 }, { "epoch": 5.679367361610352, "grad_norm": 2.8361860977720914, "learning_rate": 1.6942717732166012e-05, "loss": 0.1131, "step": 7900 }, { "epoch": 5.693745506829619, "grad_norm": 2.4999676935988506, "learning_rate": 1.6837955094357533e-05, "loss": 0.0978, "step": 7920 }, { "epoch": 5.708123652048886, "grad_norm": 2.592222956022343, "learning_rate": 1.6733489695221056e-05, "loss": 0.0933, "step": 7940 }, { "epoch": 5.722501797268152, "grad_norm": 2.5417501039040817, "learning_rate": 1.6629324447064382e-05, "loss": 0.0983, "step": 7960 }, { "epoch": 5.736879942487419, "grad_norm": 2.9569161814117177, "learning_rate": 1.6525462253827635e-05, "loss": 0.111, "step": 7980 }, { "epoch": 5.7512580877066855, "grad_norm": 2.8690761611304563, "learning_rate": 1.6421906011002303e-05, "loss": 0.0878, "step": 8000 }, { "epoch": 5.7512580877066855, "eval_loss": 0.4342060685157776, "eval_runtime": 95.1626, "eval_samples_per_second": 7.461, "eval_steps_per_second": 1.87, "step": 8000 }, { "epoch": 5.765636232925953, "grad_norm": 2.4652579987277106, "learning_rate": 1.6318658605550558e-05, "loss": 0.0899, "step": 8020 }, { "epoch": 5.78001437814522, "grad_norm": 2.3034322695637983, "learning_rate": 1.6215722915824706e-05, "loss": 0.1106, "step": 8040 }, { "epoch": 5.794392523364486, "grad_norm": 3.0714869632720356, "learning_rate": 1.6113101811487e-05, "loss": 0.117, "step": 8060 }, { "epoch": 5.808770668583753, "grad_norm": 2.835102568851034, "learning_rate": 1.60107981534296e-05, "loss": 0.0846, "step": 8080 }, { "epoch": 5.823148813803019, "grad_norm": 2.6019714042610858, "learning_rate": 1.5908814793694836e-05, "loss": 0.1078, "step": 8100 }, { "epoch": 5.837526959022286, "grad_norm": 3.3335326564208057, "learning_rate": 1.5807154575395723e-05, "loss": 0.0971, "step": 8120 }, { "epoch": 5.851905104241553, "grad_norm": 2.8097835934118875, "learning_rate": 1.570582033263664e-05, "loss": 0.0955, "step": 8140 }, { "epoch": 5.866283249460819, "grad_norm": 2.6728932570052493, "learning_rate": 1.5604814890434372e-05, "loss": 0.0916, "step": 8160 }, { "epoch": 5.880661394680086, "grad_norm": 3.126298026998104, "learning_rate": 1.550414106463931e-05, "loss": 0.0936, "step": 8180 }, { "epoch": 5.895039539899353, "grad_norm": 2.7557809744743023, "learning_rate": 1.540380166185701e-05, "loss": 0.0892, "step": 8200 }, { "epoch": 5.895039539899353, "eval_loss": 0.4105762243270874, "eval_runtime": 95.0063, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.874, "step": 8200 }, { "epoch": 5.90941768511862, "grad_norm": 1.9079860771700334, "learning_rate": 1.5303799479369892e-05, "loss": 0.0904, "step": 8220 }, { "epoch": 5.923795830337887, "grad_norm": 3.018761093125342, "learning_rate": 1.5204137305059285e-05, "loss": 0.0784, "step": 8240 }, { "epoch": 5.938173975557153, "grad_norm": 2.7323274227768466, "learning_rate": 1.5104817917327696e-05, "loss": 0.0869, "step": 8260 }, { "epoch": 5.95255212077642, "grad_norm": 2.557181835107203, "learning_rate": 1.500584408502137e-05, "loss": 0.0874, "step": 8280 }, { "epoch": 5.966930265995686, "grad_norm": 2.9046628608147302, "learning_rate": 1.490721856735307e-05, "loss": 0.0986, "step": 8300 }, { "epoch": 5.981308411214953, "grad_norm": 3.0430167079500055, "learning_rate": 1.4808944113825187e-05, "loss": 0.0944, "step": 8320 }, { "epoch": 5.99568655643422, "grad_norm": 2.688293101397761, "learning_rate": 1.4711023464153062e-05, "loss": 0.0944, "step": 8340 }, { "epoch": 6.010064701653486, "grad_norm": 2.403540313386648, "learning_rate": 1.4613459348188635e-05, "loss": 0.0626, "step": 8360 }, { "epoch": 6.024442846872754, "grad_norm": 1.7893928939003836, "learning_rate": 1.451625448584431e-05, "loss": 0.042, "step": 8380 }, { "epoch": 6.03882099209202, "grad_norm": 1.305324698496704, "learning_rate": 1.4419411587017156e-05, "loss": 0.0406, "step": 8400 }, { "epoch": 6.03882099209202, "eval_loss": 0.4040509760379791, "eval_runtime": 95.0585, "eval_samples_per_second": 7.469, "eval_steps_per_second": 1.873, "step": 8400 }, { "epoch": 6.053199137311287, "grad_norm": 2.0565200444393406, "learning_rate": 1.4322933351513345e-05, "loss": 0.0426, "step": 8420 }, { "epoch": 6.067577282530554, "grad_norm": 1.8144225644755438, "learning_rate": 1.4226822468972884e-05, "loss": 0.0448, "step": 8440 }, { "epoch": 6.08195542774982, "grad_norm": 1.9690181852930055, "learning_rate": 1.413108161879465e-05, "loss": 0.0475, "step": 8460 }, { "epoch": 6.096333572969087, "grad_norm": 2.242285489402514, "learning_rate": 1.4035713470061665e-05, "loss": 0.0517, "step": 8480 }, { "epoch": 6.1107117181883535, "grad_norm": 1.7382682176041153, "learning_rate": 1.3940720681466734e-05, "loss": 0.0531, "step": 8500 }, { "epoch": 6.12508986340762, "grad_norm": 2.040489012914858, "learning_rate": 1.3846105901238263e-05, "loss": 0.044, "step": 8520 }, { "epoch": 6.139468008626887, "grad_norm": 2.564781396939368, "learning_rate": 1.3751871767066488e-05, "loss": 0.0477, "step": 8540 }, { "epoch": 6.153846153846154, "grad_norm": 1.9424649593388863, "learning_rate": 1.36580209060299e-05, "loss": 0.0384, "step": 8560 }, { "epoch": 6.168224299065421, "grad_norm": 1.9743827811413817, "learning_rate": 1.356455593452203e-05, "loss": 0.0489, "step": 8580 }, { "epoch": 6.182602444284687, "grad_norm": 2.3565443666297767, "learning_rate": 1.3471479458178499e-05, "loss": 0.0542, "step": 8600 }, { "epoch": 6.182602444284687, "eval_loss": 0.4080147445201874, "eval_runtime": 94.9121, "eval_samples_per_second": 7.481, "eval_steps_per_second": 1.875, "step": 8600 }, { "epoch": 6.196980589503954, "grad_norm": 1.9059653193210089, "learning_rate": 1.3378794071804379e-05, "loss": 0.0474, "step": 8620 }, { "epoch": 6.211358734723221, "grad_norm": 2.288105600592541, "learning_rate": 1.3286502359301862e-05, "loss": 0.0491, "step": 8640 }, { "epoch": 6.225736879942487, "grad_norm": 1.577712318070443, "learning_rate": 1.31946068935982e-05, "loss": 0.0506, "step": 8660 }, { "epoch": 6.240115025161754, "grad_norm": 1.6142136972859515, "learning_rate": 1.3103110236574031e-05, "loss": 0.0502, "step": 8680 }, { "epoch": 6.2544931703810205, "grad_norm": 2.028384534392485, "learning_rate": 1.3012014938991901e-05, "loss": 0.0535, "step": 8700 }, { "epoch": 6.268871315600288, "grad_norm": 2.0724853034000144, "learning_rate": 1.2921323540425168e-05, "loss": 0.0534, "step": 8720 }, { "epoch": 6.283249460819555, "grad_norm": 2.032233873511292, "learning_rate": 1.283103856918722e-05, "loss": 0.0437, "step": 8740 }, { "epoch": 6.297627606038821, "grad_norm": 1.0581865301271611, "learning_rate": 1.2741162542260988e-05, "loss": 0.0495, "step": 8760 }, { "epoch": 6.312005751258088, "grad_norm": 1.6262102226401502, "learning_rate": 1.2651697965228748e-05, "loss": 0.0434, "step": 8780 }, { "epoch": 6.326383896477354, "grad_norm": 2.2940213673402905, "learning_rate": 1.2562647332202318e-05, "loss": 0.054, "step": 8800 }, { "epoch": 6.326383896477354, "eval_loss": 0.4028961956501007, "eval_runtime": 95.252, "eval_samples_per_second": 7.454, "eval_steps_per_second": 1.869, "step": 8800 }, { "epoch": 6.340762041696621, "grad_norm": 2.2268698305742634, "learning_rate": 1.2474013125753476e-05, "loss": 0.0511, "step": 8820 }, { "epoch": 6.355140186915888, "grad_norm": 1.266932927067602, "learning_rate": 1.2385797816844794e-05, "loss": 0.0508, "step": 8840 }, { "epoch": 6.369518332135154, "grad_norm": 1.76685733894469, "learning_rate": 1.229800386476073e-05, "loss": 0.0463, "step": 8860 }, { "epoch": 6.383896477354421, "grad_norm": 2.6377860948914345, "learning_rate": 1.2210633717039058e-05, "loss": 0.0451, "step": 8880 }, { "epoch": 6.398274622573688, "grad_norm": 1.9332109634225647, "learning_rate": 1.2123689809402657e-05, "loss": 0.054, "step": 8900 }, { "epoch": 6.412652767792955, "grad_norm": 2.394643424907749, "learning_rate": 1.203717456569159e-05, "loss": 0.0497, "step": 8920 }, { "epoch": 6.427030913012222, "grad_norm": 1.3393226122146238, "learning_rate": 1.1951090397795546e-05, "loss": 0.0487, "step": 8940 }, { "epoch": 6.441409058231488, "grad_norm": 1.7991220659514533, "learning_rate": 1.1865439705586595e-05, "loss": 0.0478, "step": 8960 }, { "epoch": 6.455787203450755, "grad_norm": 1.5432278174120821, "learning_rate": 1.1780224876852276e-05, "loss": 0.0546, "step": 8980 }, { "epoch": 6.4701653486700215, "grad_norm": 1.646415229262288, "learning_rate": 1.1695448287229035e-05, "loss": 0.0424, "step": 9000 }, { "epoch": 6.4701653486700215, "eval_loss": 0.3961636424064636, "eval_runtime": 95.6131, "eval_samples_per_second": 7.426, "eval_steps_per_second": 1.862, "step": 9000 }, { "epoch": 6.484543493889288, "grad_norm": 2.1052529823888904, "learning_rate": 1.1611112300136017e-05, "loss": 0.0489, "step": 9020 }, { "epoch": 6.498921639108555, "grad_norm": 2.200144761571743, "learning_rate": 1.1527219266709139e-05, "loss": 0.0458, "step": 9040 }, { "epoch": 6.513299784327822, "grad_norm": 2.3077280833331106, "learning_rate": 1.1443771525735576e-05, "loss": 0.0454, "step": 9060 }, { "epoch": 6.527677929547089, "grad_norm": 2.0193684546512114, "learning_rate": 1.1360771403588542e-05, "loss": 0.048, "step": 9080 }, { "epoch": 6.542056074766355, "grad_norm": 2.083046117268407, "learning_rate": 1.1278221214162447e-05, "loss": 0.0426, "step": 9100 }, { "epoch": 6.556434219985622, "grad_norm": 2.03139384196266, "learning_rate": 1.119612325880838e-05, "loss": 0.0424, "step": 9120 }, { "epoch": 6.570812365204889, "grad_norm": 1.8265385457361556, "learning_rate": 1.1114479826269953e-05, "loss": 0.0444, "step": 9140 }, { "epoch": 6.585190510424155, "grad_norm": 1.8432060989003027, "learning_rate": 1.1033293192619513e-05, "loss": 0.0356, "step": 9160 }, { "epoch": 6.599568655643422, "grad_norm": 2.312564665153471, "learning_rate": 1.0952565621194663e-05, "loss": 0.0421, "step": 9180 }, { "epoch": 6.6139468008626885, "grad_norm": 1.8681935486387307, "learning_rate": 1.0872299362535173e-05, "loss": 0.0384, "step": 9200 }, { "epoch": 6.6139468008626885, "eval_loss": 0.3963512182235718, "eval_runtime": 95.1527, "eval_samples_per_second": 7.462, "eval_steps_per_second": 1.871, "step": 9200 }, { "epoch": 6.628324946081955, "grad_norm": 2.074836002665286, "learning_rate": 1.0792496654320239e-05, "loss": 0.0411, "step": 9220 }, { "epoch": 6.642703091301222, "grad_norm": 2.0901956376878306, "learning_rate": 1.0713159721306121e-05, "loss": 0.0373, "step": 9240 }, { "epoch": 6.657081236520489, "grad_norm": 1.6049808069580456, "learning_rate": 1.0634290775264081e-05, "loss": 0.0397, "step": 9260 }, { "epoch": 6.671459381739756, "grad_norm": 1.7205102620710606, "learning_rate": 1.0555892014918756e-05, "loss": 0.0387, "step": 9280 }, { "epoch": 6.6858375269590224, "grad_norm": 1.284670202192714, "learning_rate": 1.0477965625886846e-05, "loss": 0.0386, "step": 9300 }, { "epoch": 6.700215672178289, "grad_norm": 1.7601605414086903, "learning_rate": 1.0400513780616183e-05, "loss": 0.0361, "step": 9320 }, { "epoch": 6.714593817397556, "grad_norm": 1.508024311857419, "learning_rate": 1.0323538638325184e-05, "loss": 0.0385, "step": 9340 }, { "epoch": 6.728971962616822, "grad_norm": 1.2736928874847193, "learning_rate": 1.024704234494263e-05, "loss": 0.0378, "step": 9360 }, { "epoch": 6.743350107836089, "grad_norm": 2.276762382653448, "learning_rate": 1.0171027033047858e-05, "loss": 0.0418, "step": 9380 }, { "epoch": 6.7577282530553555, "grad_norm": 1.9756333626219476, "learning_rate": 1.0095494821811307e-05, "loss": 0.042, "step": 9400 }, { "epoch": 6.7577282530553555, "eval_loss": 0.3885059654712677, "eval_runtime": 95.0146, "eval_samples_per_second": 7.473, "eval_steps_per_second": 1.873, "step": 9400 }, { "epoch": 6.772106398274623, "grad_norm": 1.6635017813830535, "learning_rate": 1.0020447816935432e-05, "loss": 0.0403, "step": 9420 }, { "epoch": 6.78648454349389, "grad_norm": 2.4347755605676613, "learning_rate": 9.94588811059601e-06, "loss": 0.0345, "step": 9440 }, { "epoch": 6.800862688713156, "grad_norm": 1.5001412711677446, "learning_rate": 9.871817781383807e-06, "loss": 0.0374, "step": 9460 }, { "epoch": 6.815240833932423, "grad_norm": 1.2180198693862079, "learning_rate": 9.798238894246628e-06, "loss": 0.0341, "step": 9480 }, { "epoch": 6.8296189791516895, "grad_norm": 1.9033420390343725, "learning_rate": 9.725153500431772e-06, "loss": 0.0353, "step": 9500 }, { "epoch": 6.843997124370956, "grad_norm": 1.9777690237993284, "learning_rate": 9.652563637428819e-06, "loss": 0.0326, "step": 9520 }, { "epoch": 6.858375269590223, "grad_norm": 1.2065488175251857, "learning_rate": 9.58047132891283e-06, "loss": 0.0312, "step": 9540 }, { "epoch": 6.872753414809489, "grad_norm": 1.4742126064108851, "learning_rate": 9.50887858468796e-06, "loss": 0.0323, "step": 9560 }, { "epoch": 6.887131560028756, "grad_norm": 1.69677437323119, "learning_rate": 9.437787400631392e-06, "loss": 0.0332, "step": 9580 }, { "epoch": 6.9015097052480225, "grad_norm": 2.2511817026968886, "learning_rate": 9.367199758637717e-06, "loss": 0.0392, "step": 9600 }, { "epoch": 6.9015097052480225, "eval_loss": 0.3916057348251343, "eval_runtime": 95.174, "eval_samples_per_second": 7.46, "eval_steps_per_second": 1.87, "step": 9600 }, { "epoch": 6.91588785046729, "grad_norm": 1.8826049956281836, "learning_rate": 9.297117626563687e-06, "loss": 0.0306, "step": 9620 }, { "epoch": 6.930265995686557, "grad_norm": 1.577108574612817, "learning_rate": 9.227542958173327e-06, "loss": 0.0306, "step": 9640 }, { "epoch": 6.944644140905823, "grad_norm": 1.508628096504469, "learning_rate": 9.158477693083497e-06, "loss": 0.0288, "step": 9660 }, { "epoch": 6.95902228612509, "grad_norm": 1.1579037037168847, "learning_rate": 9.08992375670981e-06, "loss": 0.0351, "step": 9680 }, { "epoch": 6.9734004313443565, "grad_norm": 2.28433845291912, "learning_rate": 9.021883060212944e-06, "loss": 0.0343, "step": 9700 }, { "epoch": 6.987778576563623, "grad_norm": 1.6582119852169708, "learning_rate": 8.954357500445376e-06, "loss": 0.0342, "step": 9720 }, { "epoch": 7.00215672178289, "grad_norm": 2.0137432403466153, "learning_rate": 8.887348959898492e-06, "loss": 0.0338, "step": 9740 }, { "epoch": 7.016534867002156, "grad_norm": 1.1323939925336342, "learning_rate": 8.820859306650115e-06, "loss": 0.0205, "step": 9760 }, { "epoch": 7.030913012221424, "grad_norm": 1.9568018303100587, "learning_rate": 8.754890394312411e-06, "loss": 0.0192, "step": 9780 }, { "epoch": 7.0452911574406905, "grad_norm": 1.580803975278475, "learning_rate": 8.689444061980237e-06, "loss": 0.0198, "step": 9800 }, { "epoch": 7.0452911574406905, "eval_loss": 0.3936446011066437, "eval_runtime": 95.1027, "eval_samples_per_second": 7.466, "eval_steps_per_second": 1.872, "step": 9800 }, { "epoch": 7.059669302659957, "grad_norm": 1.269414708765558, "learning_rate": 8.624522134179853e-06, "loss": 0.0208, "step": 9820 }, { "epoch": 7.074047447879224, "grad_norm": 1.1909485029965123, "learning_rate": 8.560126420818065e-06, "loss": 0.0162, "step": 9840 }, { "epoch": 7.08842559309849, "grad_norm": 0.9472456509832501, "learning_rate": 8.496258717131755e-06, "loss": 0.0197, "step": 9860 }, { "epoch": 7.102803738317757, "grad_norm": 1.15937612014724, "learning_rate": 8.432920803637853e-06, "loss": 0.0181, "step": 9880 }, { "epoch": 7.1171818835370235, "grad_norm": 1.2302945840584336, "learning_rate": 8.370114446083686e-06, "loss": 0.0173, "step": 9900 }, { "epoch": 7.13156002875629, "grad_norm": 1.0966008465338752, "learning_rate": 8.307841395397755e-06, "loss": 0.0186, "step": 9920 }, { "epoch": 7.145938173975557, "grad_norm": 1.0474780469073595, "learning_rate": 8.246103387640924e-06, "loss": 0.023, "step": 9940 }, { "epoch": 7.160316319194824, "grad_norm": 1.4160374929009303, "learning_rate": 8.184902143958014e-06, "loss": 0.0191, "step": 9960 }, { "epoch": 7.174694464414091, "grad_norm": 1.6554397458972328, "learning_rate": 8.12423937052984e-06, "loss": 0.0194, "step": 9980 }, { "epoch": 7.1890726096333575, "grad_norm": 1.888593206414827, "learning_rate": 8.064116758525633e-06, "loss": 0.0153, "step": 10000 }, { "epoch": 7.1890726096333575, "eval_loss": 0.40147149562835693, "eval_runtime": 95.303, "eval_samples_per_second": 7.45, "eval_steps_per_second": 1.868, "step": 10000 }, { "epoch": 7.203450754852624, "grad_norm": 0.9118239442800974, "learning_rate": 8.004535984055878e-06, "loss": 0.0169, "step": 10020 }, { "epoch": 7.217828900071891, "grad_norm": 2.0210540104944186, "learning_rate": 7.945498708125612e-06, "loss": 0.0166, "step": 10040 }, { "epoch": 7.232207045291157, "grad_norm": 1.3499252206465502, "learning_rate": 7.88700657658811e-06, "loss": 0.0176, "step": 10060 }, { "epoch": 7.246585190510424, "grad_norm": 1.2359261548111957, "learning_rate": 7.829061220098995e-06, "loss": 0.0189, "step": 10080 }, { "epoch": 7.2609633357296905, "grad_norm": 1.7393774829143234, "learning_rate": 7.771664254070782e-06, "loss": 0.0186, "step": 10100 }, { "epoch": 7.275341480948958, "grad_norm": 1.5390533548289986, "learning_rate": 7.714817278627853e-06, "loss": 0.0182, "step": 10120 }, { "epoch": 7.289719626168225, "grad_norm": 2.3702304034936983, "learning_rate": 7.658521878561828e-06, "loss": 0.0189, "step": 10140 }, { "epoch": 7.304097771387491, "grad_norm": 1.6524039313763748, "learning_rate": 7.602779623287411e-06, "loss": 0.0188, "step": 10160 }, { "epoch": 7.318475916606758, "grad_norm": 1.9409229151245628, "learning_rate": 7.547592066798609e-06, "loss": 0.0203, "step": 10180 }, { "epoch": 7.3328540618260245, "grad_norm": 1.7777378379460687, "learning_rate": 7.4929607476254255e-06, "loss": 0.0169, "step": 10200 }, { "epoch": 7.3328540618260245, "eval_loss": 0.3997386693954468, "eval_runtime": 95.0487, "eval_samples_per_second": 7.47, "eval_steps_per_second": 1.873, "step": 10200 }, { "epoch": 7.347232207045291, "grad_norm": 1.6320188009060124, "learning_rate": 7.43888718879097e-06, "loss": 0.0195, "step": 10220 }, { "epoch": 7.361610352264558, "grad_norm": 1.4169963868246045, "learning_rate": 7.385372897768994e-06, "loss": 0.0183, "step": 10240 }, { "epoch": 7.375988497483824, "grad_norm": 2.4501686205974282, "learning_rate": 7.33241936644186e-06, "loss": 0.02, "step": 10260 }, { "epoch": 7.390366642703091, "grad_norm": 0.8131283011796112, "learning_rate": 7.280028071058962e-06, "loss": 0.0184, "step": 10280 }, { "epoch": 7.404744787922358, "grad_norm": 1.5326273738705627, "learning_rate": 7.228200472195573e-06, "loss": 0.0184, "step": 10300 }, { "epoch": 7.419122933141625, "grad_norm": 1.6650139588585309, "learning_rate": 7.176938014712102e-06, "loss": 0.0176, "step": 10320 }, { "epoch": 7.433501078360892, "grad_norm": 2.058348145844132, "learning_rate": 7.1262421277138435e-06, "loss": 0.0206, "step": 10340 }, { "epoch": 7.447879223580158, "grad_norm": 1.3240541233196081, "learning_rate": 7.0761142245111215e-06, "loss": 0.0161, "step": 10360 }, { "epoch": 7.462257368799425, "grad_norm": 1.500950346915735, "learning_rate": 7.026555702579892e-06, "loss": 0.02, "step": 10380 }, { "epoch": 7.4766355140186915, "grad_norm": 1.609316067517177, "learning_rate": 6.977567943522777e-06, "loss": 0.0184, "step": 10400 }, { "epoch": 7.4766355140186915, "eval_loss": 0.39625024795532227, "eval_runtime": 95.1609, "eval_samples_per_second": 7.461, "eval_steps_per_second": 1.871, "step": 10400 }, { "epoch": 7.491013659237958, "grad_norm": 1.183992892677314, "learning_rate": 6.929152313030561e-06, "loss": 0.0144, "step": 10420 }, { "epoch": 7.505391804457225, "grad_norm": 1.7195803593830006, "learning_rate": 6.8813101608441065e-06, "loss": 0.0194, "step": 10440 }, { "epoch": 7.519769949676491, "grad_norm": 1.126818407417103, "learning_rate": 6.834042820716732e-06, "loss": 0.0184, "step": 10460 }, { "epoch": 7.534148094895759, "grad_norm": 1.276782350410165, "learning_rate": 6.787351610377034e-06, "loss": 0.015, "step": 10480 }, { "epoch": 7.5485262401150255, "grad_norm": 1.0056068452477964, "learning_rate": 6.741237831492137e-06, "loss": 0.0145, "step": 10500 }, { "epoch": 7.562904385334292, "grad_norm": 1.0608691112870612, "learning_rate": 6.695702769631409e-06, "loss": 0.0147, "step": 10520 }, { "epoch": 7.577282530553559, "grad_norm": 1.6567064615333376, "learning_rate": 6.650747694230644e-06, "loss": 0.0143, "step": 10540 }, { "epoch": 7.591660675772825, "grad_norm": 0.9633373509647803, "learning_rate": 6.6063738585566334e-06, "loss": 0.0174, "step": 10560 }, { "epoch": 7.606038820992092, "grad_norm": 1.6724192740016677, "learning_rate": 6.562582499672259e-06, "loss": 0.0148, "step": 10580 }, { "epoch": 7.620416966211359, "grad_norm": 1.4737757756806527, "learning_rate": 6.519374838401997e-06, "loss": 0.0132, "step": 10600 }, { "epoch": 7.620416966211359, "eval_loss": 0.4044211506843567, "eval_runtime": 95.1224, "eval_samples_per_second": 7.464, "eval_steps_per_second": 1.871, "step": 10600 }, { "epoch": 7.634795111430625, "grad_norm": 1.44792121731242, "learning_rate": 6.476752079297877e-06, "loss": 0.0147, "step": 10620 }, { "epoch": 7.649173256649892, "grad_norm": 0.8542174536442156, "learning_rate": 6.434715410605914e-06, "loss": 0.015, "step": 10640 }, { "epoch": 7.663551401869158, "grad_norm": 1.2004595402459013, "learning_rate": 6.393266004232965e-06, "loss": 0.016, "step": 10660 }, { "epoch": 7.677929547088426, "grad_norm": 1.313220137555986, "learning_rate": 6.352405015714072e-06, "loss": 0.0145, "step": 10680 }, { "epoch": 7.6923076923076925, "grad_norm": 0.8959587868362879, "learning_rate": 6.312133584180239e-06, "loss": 0.0134, "step": 10700 }, { "epoch": 7.706685837526959, "grad_norm": 1.3455234829958131, "learning_rate": 6.272452832326696e-06, "loss": 0.0147, "step": 10720 }, { "epoch": 7.721063982746226, "grad_norm": 1.8174610789832277, "learning_rate": 6.233363866381562e-06, "loss": 0.0187, "step": 10740 }, { "epoch": 7.735442127965492, "grad_norm": 0.6828069910344805, "learning_rate": 6.194867776075039e-06, "loss": 0.0145, "step": 10760 }, { "epoch": 7.749820273184759, "grad_norm": 1.3227119421926283, "learning_rate": 6.1569656346090185e-06, "loss": 0.0162, "step": 10780 }, { "epoch": 7.764198418404026, "grad_norm": 1.2902629205133838, "learning_rate": 6.1196584986271636e-06, "loss": 0.0162, "step": 10800 }, { "epoch": 7.764198418404026, "eval_loss": 0.4048987627029419, "eval_runtime": 95.1917, "eval_samples_per_second": 7.459, "eval_steps_per_second": 1.87, "step": 10800 }, { "epoch": 7.778576563623293, "grad_norm": 0.7136241493173114, "learning_rate": 6.082947408185455e-06, "loss": 0.0158, "step": 10820 }, { "epoch": 7.79295470884256, "grad_norm": 0.49866968120190425, "learning_rate": 6.046833386723195e-06, "loss": 0.0159, "step": 10840 }, { "epoch": 7.807332854061826, "grad_norm": 1.3502312726254562, "learning_rate": 6.011317441034468e-06, "loss": 0.0118, "step": 10860 }, { "epoch": 7.821710999281093, "grad_norm": 1.4794974446045654, "learning_rate": 5.976400561240085e-06, "loss": 0.0134, "step": 10880 }, { "epoch": 7.8360891445003595, "grad_norm": 1.2545840858710269, "learning_rate": 5.942083720759971e-06, "loss": 0.0137, "step": 10900 }, { "epoch": 7.850467289719626, "grad_norm": 1.19167981333869, "learning_rate": 5.908367876286038e-06, "loss": 0.0135, "step": 10920 }, { "epoch": 7.864845434938893, "grad_norm": 1.065250267629664, "learning_rate": 5.875253967755501e-06, "loss": 0.0122, "step": 10940 }, { "epoch": 7.879223580158159, "grad_norm": 0.7229967990726404, "learning_rate": 5.842742918324692e-06, "loss": 0.0134, "step": 10960 }, { "epoch": 7.893601725377426, "grad_norm": 1.1617877671550005, "learning_rate": 5.810835634343303e-06, "loss": 0.0122, "step": 10980 }, { "epoch": 7.907979870596693, "grad_norm": 1.4616928888976464, "learning_rate": 5.779533005329131e-06, "loss": 0.0122, "step": 11000 }, { "epoch": 7.907979870596693, "eval_loss": 0.4029586911201477, "eval_runtime": 95.2694, "eval_samples_per_second": 7.453, "eval_steps_per_second": 1.868, "step": 11000 }, { "epoch": 7.92235801581596, "grad_norm": 1.0917614152587496, "learning_rate": 5.748835903943284e-06, "loss": 0.0123, "step": 11020 }, { "epoch": 7.936736161035227, "grad_norm": 0.5451280512121102, "learning_rate": 5.718745185965842e-06, "loss": 0.0128, "step": 11040 }, { "epoch": 7.951114306254493, "grad_norm": 1.356846718427562, "learning_rate": 5.689261690272e-06, "loss": 0.0148, "step": 11060 }, { "epoch": 7.96549245147376, "grad_norm": 1.8573474867415383, "learning_rate": 5.6603862388086966e-06, "loss": 0.0131, "step": 11080 }, { "epoch": 7.979870596693027, "grad_norm": 0.9417837862898252, "learning_rate": 5.632119636571678e-06, "loss": 0.0136, "step": 11100 }, { "epoch": 7.994248741912293, "grad_norm": 1.4310126705230264, "learning_rate": 5.604462671583076e-06, "loss": 0.012, "step": 11120 }, { "epoch": 8.00862688713156, "grad_norm": 1.676187572676756, "learning_rate": 5.577416114869428e-06, "loss": 0.0091, "step": 11140 }, { "epoch": 8.023005032350827, "grad_norm": 0.8937409038970547, "learning_rate": 5.550980720440177e-06, "loss": 0.009, "step": 11160 }, { "epoch": 8.037383177570094, "grad_norm": 1.149688547723477, "learning_rate": 5.525157225266666e-06, "loss": 0.0097, "step": 11180 }, { "epoch": 8.05176132278936, "grad_norm": 0.902795246825878, "learning_rate": 5.499946349261585e-06, "loss": 0.0088, "step": 11200 }, { "epoch": 8.05176132278936, "eval_loss": 0.4079127311706543, "eval_runtime": 95.2052, "eval_samples_per_second": 7.458, "eval_steps_per_second": 1.87, "step": 11200 }, { "epoch": 8.066139468008627, "grad_norm": 1.3152839283646323, "learning_rate": 5.475348795258895e-06, "loss": 0.0077, "step": 11220 }, { "epoch": 8.080517613227894, "grad_norm": 0.516162093883063, "learning_rate": 5.4513652489942525e-06, "loss": 0.0077, "step": 11240 }, { "epoch": 8.09489575844716, "grad_norm": 1.5494413714180322, "learning_rate": 5.427996379085868e-06, "loss": 0.0076, "step": 11260 }, { "epoch": 8.109273903666427, "grad_norm": 0.811835227943074, "learning_rate": 5.405242837015884e-06, "loss": 0.0103, "step": 11280 }, { "epoch": 8.123652048885694, "grad_norm": 0.7766429516281889, "learning_rate": 5.38310525711221e-06, "loss": 0.008, "step": 11300 }, { "epoch": 8.13803019410496, "grad_norm": 1.4067431703535396, "learning_rate": 5.361584256530833e-06, "loss": 0.0077, "step": 11320 }, { "epoch": 8.152408339324227, "grad_norm": 1.291173175444956, "learning_rate": 5.340680435238616e-06, "loss": 0.0079, "step": 11340 }, { "epoch": 8.166786484543493, "grad_norm": 1.349771672968205, "learning_rate": 5.320394375996568e-06, "loss": 0.0096, "step": 11360 }, { "epoch": 8.18116462976276, "grad_norm": 1.0559431628395084, "learning_rate": 5.300726644343609e-06, "loss": 0.0089, "step": 11380 }, { "epoch": 8.195542774982027, "grad_norm": 1.7592306087280705, "learning_rate": 5.2816777885807885e-06, "loss": 0.0097, "step": 11400 }, { "epoch": 8.195542774982027, "eval_loss": 0.41447505354881287, "eval_runtime": 95.0961, "eval_samples_per_second": 7.466, "eval_steps_per_second": 1.872, "step": 11400 }, { "epoch": 8.209920920201293, "grad_norm": 0.5685228696858917, "learning_rate": 5.2632483397560065e-06, "loss": 0.0103, "step": 11420 }, { "epoch": 8.22429906542056, "grad_norm": 1.2788596898252633, "learning_rate": 5.245438811649216e-06, "loss": 0.0086, "step": 11440 }, { "epoch": 8.238677210639828, "grad_norm": 0.6947794845611549, "learning_rate": 5.228249700758091e-06, "loss": 0.0071, "step": 11460 }, { "epoch": 8.253055355859095, "grad_norm": 0.6087586668339728, "learning_rate": 5.211681486284183e-06, "loss": 0.0072, "step": 11480 }, { "epoch": 8.267433501078362, "grad_norm": 1.103810484585872, "learning_rate": 5.195734630119573e-06, "loss": 0.009, "step": 11500 }, { "epoch": 8.281811646297628, "grad_norm": 0.8700111892647913, "learning_rate": 5.180409576833982e-06, "loss": 0.0092, "step": 11520 }, { "epoch": 8.296189791516895, "grad_norm": 1.2281180519183952, "learning_rate": 5.165706753662381e-06, "loss": 0.0099, "step": 11540 }, { "epoch": 8.310567936736161, "grad_norm": 1.0420912684858186, "learning_rate": 5.151626570493093e-06, "loss": 0.0085, "step": 11560 }, { "epoch": 8.324946081955428, "grad_norm": 1.0182028541004855, "learning_rate": 5.138169419856345e-06, "loss": 0.0072, "step": 11580 }, { "epoch": 8.339324227174695, "grad_norm": 0.7367050500271004, "learning_rate": 5.125335676913335e-06, "loss": 0.0073, "step": 11600 }, { "epoch": 8.339324227174695, "eval_loss": 0.41657283902168274, "eval_runtime": 95.1277, "eval_samples_per_second": 7.464, "eval_steps_per_second": 1.871, "step": 11600 }, { "epoch": 8.353702372393961, "grad_norm": 0.45884793559048515, "learning_rate": 5.113125699445789e-06, "loss": 0.0073, "step": 11620 }, { "epoch": 8.368080517613228, "grad_norm": 1.4599632400117197, "learning_rate": 5.1015398278459495e-06, "loss": 0.0089, "step": 11640 }, { "epoch": 8.382458662832494, "grad_norm": 0.6194729001217548, "learning_rate": 5.0905783851071216e-06, "loss": 0.0082, "step": 11660 }, { "epoch": 8.396836808051761, "grad_norm": 0.9431964849978874, "learning_rate": 5.080241676814656e-06, "loss": 0.0067, "step": 11680 }, { "epoch": 8.411214953271028, "grad_norm": 1.6284024601141414, "learning_rate": 5.070529991137416e-06, "loss": 0.007, "step": 11700 }, { "epoch": 8.425593098490294, "grad_norm": 1.0543826842218091, "learning_rate": 5.06144359881977e-06, "loss": 0.007, "step": 11720 }, { "epoch": 8.43997124370956, "grad_norm": 1.0304860278963826, "learning_rate": 5.052982753174023e-06, "loss": 0.0087, "step": 11740 }, { "epoch": 8.454349388928827, "grad_norm": 0.3890943761716781, "learning_rate": 5.045147690073362e-06, "loss": 0.0072, "step": 11760 }, { "epoch": 8.468727534148094, "grad_norm": 0.5658622370613433, "learning_rate": 5.037938627945281e-06, "loss": 0.0082, "step": 11780 }, { "epoch": 8.483105679367362, "grad_norm": 1.3906978664783356, "learning_rate": 5.031355767765493e-06, "loss": 0.008, "step": 11800 }, { "epoch": 8.483105679367362, "eval_loss": 0.4241388142108917, "eval_runtime": 95.2265, "eval_samples_per_second": 7.456, "eval_steps_per_second": 1.869, "step": 11800 }, { "epoch": 8.497483824586629, "grad_norm": 0.9375345966413335, "learning_rate": 5.025399293052321e-06, "loss": 0.0052, "step": 11820 }, { "epoch": 8.511861969805896, "grad_norm": 1.1002252857639097, "learning_rate": 5.02006936986159e-06, "loss": 0.0063, "step": 11840 }, { "epoch": 8.526240115025162, "grad_norm": 0.6208438364734209, "learning_rate": 5.015366146781985e-06, "loss": 0.0095, "step": 11860 }, { "epoch": 8.540618260244429, "grad_norm": 0.8897303749534691, "learning_rate": 5.011289754930926e-06, "loss": 0.0095, "step": 11880 }, { "epoch": 8.554996405463696, "grad_norm": 1.1347852329310684, "learning_rate": 5.0078403079509016e-06, "loss": 0.0078, "step": 11900 }, { "epoch": 8.569374550682962, "grad_norm": 0.6303434992335293, "learning_rate": 5.005017902006298e-06, "loss": 0.01, "step": 11920 }, { "epoch": 8.583752695902229, "grad_norm": 0.8925353812282399, "learning_rate": 5.002822615780729e-06, "loss": 0.0056, "step": 11940 }, { "epoch": 8.598130841121495, "grad_norm": 1.061748591660371, "learning_rate": 5.0012545104748325e-06, "loss": 0.008, "step": 11960 }, { "epoch": 8.612508986340762, "grad_norm": 0.5128451242135531, "learning_rate": 5.000313629804567e-06, "loss": 0.0062, "step": 11980 }, { "epoch": 8.626887131560029, "grad_norm": 0.8684045848139531, "learning_rate": 5e-06, "loss": 0.0075, "step": 12000 }, { "epoch": 8.626887131560029, "eval_loss": 0.42346227169036865, "eval_runtime": 95.1147, "eval_samples_per_second": 7.465, "eval_steps_per_second": 1.871, "step": 12000 }, { "epoch": 8.626887131560029, "step": 12000, "total_flos": 782041448448000.0, "train_loss": 0.04361448099526266, "train_runtime": 28916.5377, "train_samples_per_second": 3.32, "train_steps_per_second": 0.415 } ], "logging_steps": 20, "max_steps": 12000, "num_input_tokens_seen": 0, "num_train_epochs": 9, "save_steps": 2000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 782041448448000.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }