| { |
| "best_metric": null, |
| "best_model_checkpoint": null, |
| "epoch": 8.626887131560029, |
| "eval_steps": 200, |
| "global_step": 12000, |
| "is_hyper_param_search": false, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.014378145219266714, |
| "grad_norm": 13.937178004920169, |
| "learning_rate": 1e-05, |
| "loss": 18.6782, |
| "step": 20 |
| }, |
| { |
| "epoch": 0.02875629043853343, |
| "grad_norm": 20.49830614432723, |
| "learning_rate": 2e-05, |
| "loss": 8.8375, |
| "step": 40 |
| }, |
| { |
| "epoch": 0.043134435657800146, |
| "grad_norm": 10.509818823590434, |
| "learning_rate": 3e-05, |
| "loss": 5.0096, |
| "step": 60 |
| }, |
| { |
| "epoch": 0.05751258087706686, |
| "grad_norm": 13.333465056972562, |
| "learning_rate": 4e-05, |
| "loss": 4.6984, |
| "step": 80 |
| }, |
| { |
| "epoch": 0.07189072609633357, |
| "grad_norm": 13.540983325678864, |
| "learning_rate": 5e-05, |
| "loss": 4.427, |
| "step": 100 |
| }, |
| { |
| "epoch": 0.08626887131560029, |
| "grad_norm": 15.962923973587186, |
| "learning_rate": 4.9999686370195435e-05, |
| "loss": 4.2845, |
| "step": 120 |
| }, |
| { |
| "epoch": 0.100647016534867, |
| "grad_norm": 11.92374627236117, |
| "learning_rate": 4.999874548952517e-05, |
| "loss": 4.1259, |
| "step": 140 |
| }, |
| { |
| "epoch": 0.11502516175413371, |
| "grad_norm": 14.900646876279996, |
| "learning_rate": 4.9997177384219275e-05, |
| "loss": 3.8399, |
| "step": 160 |
| }, |
| { |
| "epoch": 0.12940330697340044, |
| "grad_norm": 14.115020370573196, |
| "learning_rate": 4.9994982097993705e-05, |
| "loss": 3.7164, |
| "step": 180 |
| }, |
| { |
| "epoch": 0.14378145219266714, |
| "grad_norm": 13.842427549451594, |
| "learning_rate": 4.9992159692049106e-05, |
| "loss": 3.6876, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.14378145219266714, |
| "eval_loss": 3.6155073642730713, |
| "eval_runtime": 95.5893, |
| "eval_samples_per_second": 7.428, |
| "eval_steps_per_second": 1.862, |
| "step": 200 |
| }, |
| { |
| "epoch": 0.15815959741193386, |
| "grad_norm": 10.199143919340026, |
| "learning_rate": 4.998871024506907e-05, |
| "loss": 3.6115, |
| "step": 220 |
| }, |
| { |
| "epoch": 0.17253774263120059, |
| "grad_norm": 9.516108728115162, |
| "learning_rate": 4.998463385321802e-05, |
| "loss": 3.5405, |
| "step": 240 |
| }, |
| { |
| "epoch": 0.18691588785046728, |
| "grad_norm": 9.609898798360511, |
| "learning_rate": 4.997993063013842e-05, |
| "loss": 3.5089, |
| "step": 260 |
| }, |
| { |
| "epoch": 0.201294033069734, |
| "grad_norm": 11.18927433524985, |
| "learning_rate": 4.9974600706947685e-05, |
| "loss": 3.5087, |
| "step": 280 |
| }, |
| { |
| "epoch": 0.21567217828900073, |
| "grad_norm": 14.617569385949311, |
| "learning_rate": 4.9968644232234515e-05, |
| "loss": 3.4338, |
| "step": 300 |
| }, |
| { |
| "epoch": 0.23005032350826743, |
| "grad_norm": 10.794051016445927, |
| "learning_rate": 4.9962061372054716e-05, |
| "loss": 3.4752, |
| "step": 320 |
| }, |
| { |
| "epoch": 0.24442846872753415, |
| "grad_norm": 9.000217292113932, |
| "learning_rate": 4.995485230992664e-05, |
| "loss": 3.3947, |
| "step": 340 |
| }, |
| { |
| "epoch": 0.2588066139468009, |
| "grad_norm": 9.266337425892882, |
| "learning_rate": 4.9947017246825985e-05, |
| "loss": 3.3028, |
| "step": 360 |
| }, |
| { |
| "epoch": 0.2731847591660676, |
| "grad_norm": 8.423464250163468, |
| "learning_rate": 4.993855640118024e-05, |
| "loss": 3.3037, |
| "step": 380 |
| }, |
| { |
| "epoch": 0.2875629043853343, |
| "grad_norm": 8.272065753761918, |
| "learning_rate": 4.992947000886259e-05, |
| "loss": 3.2657, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.2875629043853343, |
| "eval_loss": 3.230403423309326, |
| "eval_runtime": 95.1984, |
| "eval_samples_per_second": 7.458, |
| "eval_steps_per_second": 1.87, |
| "step": 400 |
| }, |
| { |
| "epoch": 0.301941049604601, |
| "grad_norm": 8.839983816131488, |
| "learning_rate": 4.991975832318535e-05, |
| "loss": 3.1932, |
| "step": 420 |
| }, |
| { |
| "epoch": 0.3163191948238677, |
| "grad_norm": 8.856492618425404, |
| "learning_rate": 4.990942161489288e-05, |
| "loss": 3.1429, |
| "step": 440 |
| }, |
| { |
| "epoch": 0.33069734004313445, |
| "grad_norm": 9.670041618980777, |
| "learning_rate": 4.989846017215405e-05, |
| "loss": 3.1421, |
| "step": 460 |
| }, |
| { |
| "epoch": 0.34507548526240117, |
| "grad_norm": 6.904135887349451, |
| "learning_rate": 4.988687430055421e-05, |
| "loss": 3.1368, |
| "step": 480 |
| }, |
| { |
| "epoch": 0.35945363048166784, |
| "grad_norm": 6.888500849133581, |
| "learning_rate": 4.9874664323086664e-05, |
| "loss": 3.0697, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.37383177570093457, |
| "grad_norm": 8.164493023374266, |
| "learning_rate": 4.9861830580143667e-05, |
| "loss": 3.0454, |
| "step": 520 |
| }, |
| { |
| "epoch": 0.3882099209202013, |
| "grad_norm": 6.1924738330609435, |
| "learning_rate": 4.984837342950691e-05, |
| "loss": 2.9824, |
| "step": 540 |
| }, |
| { |
| "epoch": 0.402588066139468, |
| "grad_norm": 8.330870217150185, |
| "learning_rate": 4.9834293246337624e-05, |
| "loss": 2.9539, |
| "step": 560 |
| }, |
| { |
| "epoch": 0.41696621135873474, |
| "grad_norm": 7.244659927731791, |
| "learning_rate": 4.9819590423166025e-05, |
| "loss": 2.9438, |
| "step": 580 |
| }, |
| { |
| "epoch": 0.43134435657800146, |
| "grad_norm": 7.623837159975234, |
| "learning_rate": 4.980426536988043e-05, |
| "loss": 2.9326, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.43134435657800146, |
| "eval_loss": 2.913550853729248, |
| "eval_runtime": 95.0135, |
| "eval_samples_per_second": 7.473, |
| "eval_steps_per_second": 1.873, |
| "step": 600 |
| }, |
| { |
| "epoch": 0.44572250179726813, |
| "grad_norm": 6.237340146754397, |
| "learning_rate": 4.978831851371582e-05, |
| "loss": 2.871, |
| "step": 620 |
| }, |
| { |
| "epoch": 0.46010064701653486, |
| "grad_norm": 7.573306240835855, |
| "learning_rate": 4.977175029924191e-05, |
| "loss": 2.8492, |
| "step": 640 |
| }, |
| { |
| "epoch": 0.4744787922358016, |
| "grad_norm": 7.724747647956487, |
| "learning_rate": 4.975456118835079e-05, |
| "loss": 2.8832, |
| "step": 660 |
| }, |
| { |
| "epoch": 0.4888569374550683, |
| "grad_norm": 6.727877105924332, |
| "learning_rate": 4.9736751660243995e-05, |
| "loss": 2.8508, |
| "step": 680 |
| }, |
| { |
| "epoch": 0.503235082674335, |
| "grad_norm": 7.036877939774848, |
| "learning_rate": 4.971832221141922e-05, |
| "loss": 2.7735, |
| "step": 700 |
| }, |
| { |
| "epoch": 0.5176132278936018, |
| "grad_norm": 6.425217642566599, |
| "learning_rate": 4.9699273355656395e-05, |
| "loss": 2.8373, |
| "step": 720 |
| }, |
| { |
| "epoch": 0.5319913731128685, |
| "grad_norm": 7.139491878078851, |
| "learning_rate": 4.967960562400343e-05, |
| "loss": 2.8005, |
| "step": 740 |
| }, |
| { |
| "epoch": 0.5463695183321352, |
| "grad_norm": 6.962818464552354, |
| "learning_rate": 4.965931956476139e-05, |
| "loss": 2.7754, |
| "step": 760 |
| }, |
| { |
| "epoch": 0.5607476635514018, |
| "grad_norm": 6.130103303233823, |
| "learning_rate": 4.9638415743469166e-05, |
| "loss": 2.7736, |
| "step": 780 |
| }, |
| { |
| "epoch": 0.5751258087706685, |
| "grad_norm": 6.386819454037992, |
| "learning_rate": 4.961689474288779e-05, |
| "loss": 2.7793, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.5751258087706685, |
| "eval_loss": 2.709056854248047, |
| "eval_runtime": 95.0293, |
| "eval_samples_per_second": 7.471, |
| "eval_steps_per_second": 1.873, |
| "step": 800 |
| }, |
| { |
| "epoch": 0.5895039539899353, |
| "grad_norm": 5.813420223779441, |
| "learning_rate": 4.9594757162984125e-05, |
| "loss": 2.6778, |
| "step": 820 |
| }, |
| { |
| "epoch": 0.603882099209202, |
| "grad_norm": 6.505329742987656, |
| "learning_rate": 4.9572003620914135e-05, |
| "loss": 2.6418, |
| "step": 840 |
| }, |
| { |
| "epoch": 0.6182602444284687, |
| "grad_norm": 6.617793894804718, |
| "learning_rate": 4.954863475100575e-05, |
| "loss": 2.705, |
| "step": 860 |
| }, |
| { |
| "epoch": 0.6326383896477354, |
| "grad_norm": 5.6982849971736735, |
| "learning_rate": 4.952465120474111e-05, |
| "loss": 2.6715, |
| "step": 880 |
| }, |
| { |
| "epoch": 0.6470165348670022, |
| "grad_norm": 5.245475499523757, |
| "learning_rate": 4.9500053650738424e-05, |
| "loss": 2.6979, |
| "step": 900 |
| }, |
| { |
| "epoch": 0.6613946800862689, |
| "grad_norm": 6.518600695845765, |
| "learning_rate": 4.947484277473333e-05, |
| "loss": 2.6556, |
| "step": 920 |
| }, |
| { |
| "epoch": 0.6757728253055356, |
| "grad_norm": 6.574489220293872, |
| "learning_rate": 4.944901927955983e-05, |
| "loss": 2.5944, |
| "step": 940 |
| }, |
| { |
| "epoch": 0.6901509705248023, |
| "grad_norm": 5.826636755254408, |
| "learning_rate": 4.942258388513058e-05, |
| "loss": 2.6557, |
| "step": 960 |
| }, |
| { |
| "epoch": 0.7045291157440691, |
| "grad_norm": 6.035387909646663, |
| "learning_rate": 4.9395537328416926e-05, |
| "loss": 2.5915, |
| "step": 980 |
| }, |
| { |
| "epoch": 0.7189072609633357, |
| "grad_norm": 6.506861395374483, |
| "learning_rate": 4.9367880363428326e-05, |
| "loss": 2.5252, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.7189072609633357, |
| "eval_loss": 2.5883359909057617, |
| "eval_runtime": 95.0936, |
| "eval_samples_per_second": 7.466, |
| "eval_steps_per_second": 1.872, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.7332854061826024, |
| "grad_norm": 5.796511184070567, |
| "learning_rate": 4.933961376119131e-05, |
| "loss": 2.5934, |
| "step": 1020 |
| }, |
| { |
| "epoch": 0.7476635514018691, |
| "grad_norm": 5.718979865140408, |
| "learning_rate": 4.9310738309728005e-05, |
| "loss": 2.5455, |
| "step": 1040 |
| }, |
| { |
| "epoch": 0.7620416966211359, |
| "grad_norm": 6.548958558102242, |
| "learning_rate": 4.928125481403416e-05, |
| "loss": 2.5356, |
| "step": 1060 |
| }, |
| { |
| "epoch": 0.7764198418404026, |
| "grad_norm": 5.969122402157584, |
| "learning_rate": 4.9251164096056716e-05, |
| "loss": 2.5008, |
| "step": 1080 |
| }, |
| { |
| "epoch": 0.7907979870596693, |
| "grad_norm": 6.006148622274345, |
| "learning_rate": 4.922046699467087e-05, |
| "loss": 2.5651, |
| "step": 1100 |
| }, |
| { |
| "epoch": 0.805176132278936, |
| "grad_norm": 5.329905924324714, |
| "learning_rate": 4.91891643656567e-05, |
| "loss": 2.5288, |
| "step": 1120 |
| }, |
| { |
| "epoch": 0.8195542774982028, |
| "grad_norm": 5.829019019143035, |
| "learning_rate": 4.9157257081675315e-05, |
| "loss": 2.5328, |
| "step": 1140 |
| }, |
| { |
| "epoch": 0.8339324227174695, |
| "grad_norm": 5.3120393934176615, |
| "learning_rate": 4.91247460322445e-05, |
| "loss": 2.5215, |
| "step": 1160 |
| }, |
| { |
| "epoch": 0.8483105679367362, |
| "grad_norm": 5.290424926561275, |
| "learning_rate": 4.909163212371396e-05, |
| "loss": 2.4913, |
| "step": 1180 |
| }, |
| { |
| "epoch": 0.8626887131560029, |
| "grad_norm": 6.150607558485341, |
| "learning_rate": 4.905791627924003e-05, |
| "loss": 2.4608, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.8626887131560029, |
| "eval_loss": 2.4695942401885986, |
| "eval_runtime": 95.1459, |
| "eval_samples_per_second": 7.462, |
| "eval_steps_per_second": 1.871, |
| "step": 1200 |
| }, |
| { |
| "epoch": 0.8770668583752695, |
| "grad_norm": 6.051042465807221, |
| "learning_rate": 4.902359943875992e-05, |
| "loss": 2.5229, |
| "step": 1220 |
| }, |
| { |
| "epoch": 0.8914450035945363, |
| "grad_norm": 5.702742394427446, |
| "learning_rate": 4.898868255896554e-05, |
| "loss": 2.4682, |
| "step": 1240 |
| }, |
| { |
| "epoch": 0.905823148813803, |
| "grad_norm": 6.148635539706346, |
| "learning_rate": 4.895316661327681e-05, |
| "loss": 2.4568, |
| "step": 1260 |
| }, |
| { |
| "epoch": 0.9202012940330697, |
| "grad_norm": 5.878117654483529, |
| "learning_rate": 4.891705259181454e-05, |
| "loss": 2.4841, |
| "step": 1280 |
| }, |
| { |
| "epoch": 0.9345794392523364, |
| "grad_norm": 5.955112078722722, |
| "learning_rate": 4.888034150137284e-05, |
| "loss": 2.4454, |
| "step": 1300 |
| }, |
| { |
| "epoch": 0.9489575844716032, |
| "grad_norm": 5.377448785428115, |
| "learning_rate": 4.8843034365390985e-05, |
| "loss": 2.4895, |
| "step": 1320 |
| }, |
| { |
| "epoch": 0.9633357296908699, |
| "grad_norm": 5.491843912580674, |
| "learning_rate": 4.880513222392496e-05, |
| "loss": 2.4557, |
| "step": 1340 |
| }, |
| { |
| "epoch": 0.9777138749101366, |
| "grad_norm": 5.476777480493853, |
| "learning_rate": 4.8766636133618445e-05, |
| "loss": 2.4179, |
| "step": 1360 |
| }, |
| { |
| "epoch": 0.9920920201294033, |
| "grad_norm": 5.378173923329988, |
| "learning_rate": 4.87275471676733e-05, |
| "loss": 2.4075, |
| "step": 1380 |
| }, |
| { |
| "epoch": 1.00647016534867, |
| "grad_norm": 5.596761747726064, |
| "learning_rate": 4.868786641581976e-05, |
| "loss": 2.3865, |
| "step": 1400 |
| }, |
| { |
| "epoch": 1.00647016534867, |
| "eval_loss": 2.3786544799804688, |
| "eval_runtime": 94.8751, |
| "eval_samples_per_second": 7.484, |
| "eval_steps_per_second": 1.876, |
| "step": 1400 |
| }, |
| { |
| "epoch": 1.0208483105679367, |
| "grad_norm": 5.326022614677014, |
| "learning_rate": 4.864759498428593e-05, |
| "loss": 2.327, |
| "step": 1420 |
| }, |
| { |
| "epoch": 1.0352264557872035, |
| "grad_norm": 6.495868359551248, |
| "learning_rate": 4.860673399576704e-05, |
| "loss": 2.3197, |
| "step": 1440 |
| }, |
| { |
| "epoch": 1.0496046010064701, |
| "grad_norm": 5.462694782280911, |
| "learning_rate": 4.856528458939409e-05, |
| "loss": 2.3436, |
| "step": 1460 |
| }, |
| { |
| "epoch": 1.063982746225737, |
| "grad_norm": 5.384927039412702, |
| "learning_rate": 4.8523247920702125e-05, |
| "loss": 2.3136, |
| "step": 1480 |
| }, |
| { |
| "epoch": 1.0783608914450036, |
| "grad_norm": 5.090764977050729, |
| "learning_rate": 4.8480625161598e-05, |
| "loss": 2.3654, |
| "step": 1500 |
| }, |
| { |
| "epoch": 1.0927390366642702, |
| "grad_norm": 5.309844430144479, |
| "learning_rate": 4.8437417500327743e-05, |
| "loss": 2.3043, |
| "step": 1520 |
| }, |
| { |
| "epoch": 1.107117181883537, |
| "grad_norm": 4.924758754588879, |
| "learning_rate": 4.839362614144337e-05, |
| "loss": 2.3204, |
| "step": 1540 |
| }, |
| { |
| "epoch": 1.1214953271028036, |
| "grad_norm": 5.288805304382869, |
| "learning_rate": 4.834925230576936e-05, |
| "loss": 2.2613, |
| "step": 1560 |
| }, |
| { |
| "epoch": 1.1358734723220705, |
| "grad_norm": 5.040956404855601, |
| "learning_rate": 4.830429723036859e-05, |
| "loss": 2.3143, |
| "step": 1580 |
| }, |
| { |
| "epoch": 1.150251617541337, |
| "grad_norm": 5.305191213745783, |
| "learning_rate": 4.825876216850786e-05, |
| "loss": 2.3042, |
| "step": 1600 |
| }, |
| { |
| "epoch": 1.150251617541337, |
| "eval_loss": 2.3024840354919434, |
| "eval_runtime": 94.9448, |
| "eval_samples_per_second": 7.478, |
| "eval_steps_per_second": 1.875, |
| "step": 1600 |
| }, |
| { |
| "epoch": 1.164629762760604, |
| "grad_norm": 5.542476079404831, |
| "learning_rate": 4.821264838962297e-05, |
| "loss": 2.2448, |
| "step": 1620 |
| }, |
| { |
| "epoch": 1.1790079079798705, |
| "grad_norm": 4.977786731713276, |
| "learning_rate": 4.816595717928327e-05, |
| "loss": 2.2687, |
| "step": 1640 |
| }, |
| { |
| "epoch": 1.1933860531991374, |
| "grad_norm": 4.860822092234981, |
| "learning_rate": 4.81186898391559e-05, |
| "loss": 2.296, |
| "step": 1660 |
| }, |
| { |
| "epoch": 1.207764198418404, |
| "grad_norm": 4.996822570004754, |
| "learning_rate": 4.8070847686969445e-05, |
| "loss": 2.3022, |
| "step": 1680 |
| }, |
| { |
| "epoch": 1.2221423436376708, |
| "grad_norm": 5.428353577618062, |
| "learning_rate": 4.8022432056477227e-05, |
| "loss": 2.2673, |
| "step": 1700 |
| }, |
| { |
| "epoch": 1.2365204888569374, |
| "grad_norm": 5.143612704057496, |
| "learning_rate": 4.797344429742011e-05, |
| "loss": 2.1917, |
| "step": 1720 |
| }, |
| { |
| "epoch": 1.2508986340762043, |
| "grad_norm": 5.578333721803896, |
| "learning_rate": 4.792388577548888e-05, |
| "loss": 2.2253, |
| "step": 1740 |
| }, |
| { |
| "epoch": 1.2652767792954709, |
| "grad_norm": 5.247867553076536, |
| "learning_rate": 4.7873757872286155e-05, |
| "loss": 2.2293, |
| "step": 1760 |
| }, |
| { |
| "epoch": 1.2796549245147375, |
| "grad_norm": 4.72091682638746, |
| "learning_rate": 4.78230619852879e-05, |
| "loss": 2.2164, |
| "step": 1780 |
| }, |
| { |
| "epoch": 1.2940330697340043, |
| "grad_norm": 5.133994887533224, |
| "learning_rate": 4.777179952780443e-05, |
| "loss": 2.1816, |
| "step": 1800 |
| }, |
| { |
| "epoch": 1.2940330697340043, |
| "eval_loss": 2.2219223976135254, |
| "eval_runtime": 95.1892, |
| "eval_samples_per_second": 7.459, |
| "eval_steps_per_second": 1.87, |
| "step": 1800 |
| }, |
| { |
| "epoch": 1.308411214953271, |
| "grad_norm": 4.730535398567502, |
| "learning_rate": 4.7719971928941045e-05, |
| "loss": 2.1896, |
| "step": 1820 |
| }, |
| { |
| "epoch": 1.3227893601725378, |
| "grad_norm": 4.672694454266816, |
| "learning_rate": 4.766758063355815e-05, |
| "loss": 2.1846, |
| "step": 1840 |
| }, |
| { |
| "epoch": 1.3371675053918044, |
| "grad_norm": 4.7523968527644325, |
| "learning_rate": 4.761462710223101e-05, |
| "loss": 2.2532, |
| "step": 1860 |
| }, |
| { |
| "epoch": 1.3515456506110712, |
| "grad_norm": 4.516026828742153, |
| "learning_rate": 4.756111281120904e-05, |
| "loss": 2.2534, |
| "step": 1880 |
| }, |
| { |
| "epoch": 1.3659237958303379, |
| "grad_norm": 4.432300805541551, |
| "learning_rate": 4.750703925237458e-05, |
| "loss": 2.2089, |
| "step": 1900 |
| }, |
| { |
| "epoch": 1.3803019410496047, |
| "grad_norm": 4.795880373336302, |
| "learning_rate": 4.745240793320139e-05, |
| "loss": 2.2101, |
| "step": 1920 |
| }, |
| { |
| "epoch": 1.3946800862688713, |
| "grad_norm": 4.8910070970343185, |
| "learning_rate": 4.739722037671259e-05, |
| "loss": 2.1776, |
| "step": 1940 |
| }, |
| { |
| "epoch": 1.409058231488138, |
| "grad_norm": 4.46472714877697, |
| "learning_rate": 4.734147812143818e-05, |
| "loss": 2.2407, |
| "step": 1960 |
| }, |
| { |
| "epoch": 1.4234363767074047, |
| "grad_norm": 4.902232368473849, |
| "learning_rate": 4.728518272137216e-05, |
| "loss": 2.1787, |
| "step": 1980 |
| }, |
| { |
| "epoch": 1.4378145219266716, |
| "grad_norm": 4.819924921281692, |
| "learning_rate": 4.722833574592922e-05, |
| "loss": 2.1519, |
| "step": 2000 |
| }, |
| { |
| "epoch": 1.4378145219266716, |
| "eval_loss": 2.1631219387054443, |
| "eval_runtime": 95.0925, |
| "eval_samples_per_second": 7.466, |
| "eval_steps_per_second": 1.872, |
| "step": 2000 |
| }, |
| { |
| "epoch": 1.4521926671459382, |
| "grad_norm": 4.672668068479392, |
| "learning_rate": 4.7170938779901015e-05, |
| "loss": 2.1637, |
| "step": 2020 |
| }, |
| { |
| "epoch": 1.4665708123652048, |
| "grad_norm": 5.388392208921704, |
| "learning_rate": 4.711299342341189e-05, |
| "loss": 2.1336, |
| "step": 2040 |
| }, |
| { |
| "epoch": 1.4809489575844716, |
| "grad_norm": 4.79200407089135, |
| "learning_rate": 4.7054501291874385e-05, |
| "loss": 2.1339, |
| "step": 2060 |
| }, |
| { |
| "epoch": 1.4953271028037383, |
| "grad_norm": 4.606110348514495, |
| "learning_rate": 4.6995464015944124e-05, |
| "loss": 2.1594, |
| "step": 2080 |
| }, |
| { |
| "epoch": 1.509705248023005, |
| "grad_norm": 5.142696896062446, |
| "learning_rate": 4.693588324147437e-05, |
| "loss": 2.105, |
| "step": 2100 |
| }, |
| { |
| "epoch": 1.5240833932422717, |
| "grad_norm": 4.933737837357054, |
| "learning_rate": 4.6875760629470156e-05, |
| "loss": 2.2051, |
| "step": 2120 |
| }, |
| { |
| "epoch": 1.5384615384615383, |
| "grad_norm": 4.728725090484288, |
| "learning_rate": 4.6815097856041986e-05, |
| "loss": 2.0752, |
| "step": 2140 |
| }, |
| { |
| "epoch": 1.5528396836808052, |
| "grad_norm": 5.1965116031535, |
| "learning_rate": 4.675389661235908e-05, |
| "loss": 2.1272, |
| "step": 2160 |
| }, |
| { |
| "epoch": 1.567217828900072, |
| "grad_norm": 5.020583160820166, |
| "learning_rate": 4.669215860460226e-05, |
| "loss": 2.21, |
| "step": 2180 |
| }, |
| { |
| "epoch": 1.5815959741193386, |
| "grad_norm": 5.290821603607888, |
| "learning_rate": 4.662988555391632e-05, |
| "loss": 2.0615, |
| "step": 2200 |
| }, |
| { |
| "epoch": 1.5815959741193386, |
| "eval_loss": 2.1068339347839355, |
| "eval_runtime": 94.9668, |
| "eval_samples_per_second": 7.476, |
| "eval_steps_per_second": 1.874, |
| "step": 2200 |
| }, |
| { |
| "epoch": 1.5959741193386052, |
| "grad_norm": 5.335021892876329, |
| "learning_rate": 4.656707919636215e-05, |
| "loss": 2.1474, |
| "step": 2220 |
| }, |
| { |
| "epoch": 1.610352264557872, |
| "grad_norm": 4.7933400957844166, |
| "learning_rate": 4.650374128286825e-05, |
| "loss": 2.0574, |
| "step": 2240 |
| }, |
| { |
| "epoch": 1.624730409777139, |
| "grad_norm": 4.44113623853496, |
| "learning_rate": 4.6439873579181934e-05, |
| "loss": 2.1114, |
| "step": 2260 |
| }, |
| { |
| "epoch": 1.6391085549964055, |
| "grad_norm": 4.801726947544004, |
| "learning_rate": 4.637547786582015e-05, |
| "loss": 2.0935, |
| "step": 2280 |
| }, |
| { |
| "epoch": 1.6534867002156721, |
| "grad_norm": 5.024585732302448, |
| "learning_rate": 4.631055593801977e-05, |
| "loss": 2.0816, |
| "step": 2300 |
| }, |
| { |
| "epoch": 1.6678648454349387, |
| "grad_norm": 4.832470978945399, |
| "learning_rate": 4.624510960568759e-05, |
| "loss": 2.0396, |
| "step": 2320 |
| }, |
| { |
| "epoch": 1.6822429906542056, |
| "grad_norm": 5.0661313073550485, |
| "learning_rate": 4.6179140693349894e-05, |
| "loss": 2.097, |
| "step": 2340 |
| }, |
| { |
| "epoch": 1.6966211358734724, |
| "grad_norm": 4.679601946091209, |
| "learning_rate": 4.611265104010151e-05, |
| "loss": 2.0873, |
| "step": 2360 |
| }, |
| { |
| "epoch": 1.710999281092739, |
| "grad_norm": 4.889181786497249, |
| "learning_rate": 4.604564249955463e-05, |
| "loss": 2.0261, |
| "step": 2380 |
| }, |
| { |
| "epoch": 1.7253774263120056, |
| "grad_norm": 4.897204874625993, |
| "learning_rate": 4.5978116939787056e-05, |
| "loss": 2.0731, |
| "step": 2400 |
| }, |
| { |
| "epoch": 1.7253774263120056, |
| "eval_loss": 2.059098482131958, |
| "eval_runtime": 95.0053, |
| "eval_samples_per_second": 7.473, |
| "eval_steps_per_second": 1.874, |
| "step": 2400 |
| }, |
| { |
| "epoch": 1.7397555715312725, |
| "grad_norm": 4.603182673966091, |
| "learning_rate": 4.591007624329019e-05, |
| "loss": 2.0747, |
| "step": 2420 |
| }, |
| { |
| "epoch": 1.7541337167505393, |
| "grad_norm": 4.598991169459091, |
| "learning_rate": 4.5841522306916505e-05, |
| "loss": 2.0311, |
| "step": 2440 |
| }, |
| { |
| "epoch": 1.768511861969806, |
| "grad_norm": 4.561405494146018, |
| "learning_rate": 4.5772457041826675e-05, |
| "loss": 2.0028, |
| "step": 2460 |
| }, |
| { |
| "epoch": 1.7828900071890725, |
| "grad_norm": 4.993259426284276, |
| "learning_rate": 4.570288237343632e-05, |
| "loss": 2.0612, |
| "step": 2480 |
| }, |
| { |
| "epoch": 1.7972681524083394, |
| "grad_norm": 4.501150725728268, |
| "learning_rate": 4.563280024136229e-05, |
| "loss": 2.0074, |
| "step": 2500 |
| }, |
| { |
| "epoch": 1.811646297627606, |
| "grad_norm": 4.720772032659857, |
| "learning_rate": 4.556221259936861e-05, |
| "loss": 2.056, |
| "step": 2520 |
| }, |
| { |
| "epoch": 1.8260244428468728, |
| "grad_norm": 4.473775141788649, |
| "learning_rate": 4.5491121415312044e-05, |
| "loss": 2.0502, |
| "step": 2540 |
| }, |
| { |
| "epoch": 1.8404025880661394, |
| "grad_norm": 5.039191205621526, |
| "learning_rate": 4.541952867108717e-05, |
| "loss": 2.0809, |
| "step": 2560 |
| }, |
| { |
| "epoch": 1.854780733285406, |
| "grad_norm": 5.3961805133059, |
| "learning_rate": 4.534743636257119e-05, |
| "loss": 2.0731, |
| "step": 2580 |
| }, |
| { |
| "epoch": 1.8691588785046729, |
| "grad_norm": 4.296361775627171, |
| "learning_rate": 4.527484649956823e-05, |
| "loss": 2.0112, |
| "step": 2600 |
| }, |
| { |
| "epoch": 1.8691588785046729, |
| "eval_loss": 1.99062979221344, |
| "eval_runtime": 95.2886, |
| "eval_samples_per_second": 7.451, |
| "eval_steps_per_second": 1.868, |
| "step": 2600 |
| }, |
| { |
| "epoch": 1.8835370237239397, |
| "grad_norm": 4.526885996691755, |
| "learning_rate": 4.5201761105753376e-05, |
| "loss": 1.9847, |
| "step": 2620 |
| }, |
| { |
| "epoch": 1.8979151689432063, |
| "grad_norm": 4.859991156903426, |
| "learning_rate": 4.5128182218616205e-05, |
| "loss": 1.9462, |
| "step": 2640 |
| }, |
| { |
| "epoch": 1.912293314162473, |
| "grad_norm": 4.092328382365213, |
| "learning_rate": 4.505411188940399e-05, |
| "loss": 2.0464, |
| "step": 2660 |
| }, |
| { |
| "epoch": 1.9266714593817398, |
| "grad_norm": 4.354116826358398, |
| "learning_rate": 4.4979552183064576e-05, |
| "loss": 1.9533, |
| "step": 2680 |
| }, |
| { |
| "epoch": 1.9410496046010066, |
| "grad_norm": 4.5449032544302455, |
| "learning_rate": 4.490450517818869e-05, |
| "loss": 1.9692, |
| "step": 2700 |
| }, |
| { |
| "epoch": 1.9554277498202732, |
| "grad_norm": 5.280719397936687, |
| "learning_rate": 4.482897296695215e-05, |
| "loss": 1.9458, |
| "step": 2720 |
| }, |
| { |
| "epoch": 1.9698058950395398, |
| "grad_norm": 4.7994470248138805, |
| "learning_rate": 4.475295765505737e-05, |
| "loss": 1.9615, |
| "step": 2740 |
| }, |
| { |
| "epoch": 1.9841840402588065, |
| "grad_norm": 4.8825903622988385, |
| "learning_rate": 4.467646136167482e-05, |
| "loss": 1.9826, |
| "step": 2760 |
| }, |
| { |
| "epoch": 1.9985621854780733, |
| "grad_norm": 4.813498307403933, |
| "learning_rate": 4.459948621938382e-05, |
| "loss": 1.9427, |
| "step": 2780 |
| }, |
| { |
| "epoch": 2.01294033069734, |
| "grad_norm": 5.60375996728684, |
| "learning_rate": 4.4522034374113166e-05, |
| "loss": 1.8399, |
| "step": 2800 |
| }, |
| { |
| "epoch": 2.01294033069734, |
| "eval_loss": 1.9351197481155396, |
| "eval_runtime": 95.1114, |
| "eval_samples_per_second": 7.465, |
| "eval_steps_per_second": 1.871, |
| "step": 2800 |
| }, |
| { |
| "epoch": 2.0273184759166067, |
| "grad_norm": 5.2880499867239195, |
| "learning_rate": 4.444410798508125e-05, |
| "loss": 1.7887, |
| "step": 2820 |
| }, |
| { |
| "epoch": 2.0416966211358734, |
| "grad_norm": 4.66223325046561, |
| "learning_rate": 4.4365709224735926e-05, |
| "loss": 1.711, |
| "step": 2840 |
| }, |
| { |
| "epoch": 2.05607476635514, |
| "grad_norm": 5.318429023225783, |
| "learning_rate": 4.4286840278693884e-05, |
| "loss": 1.79, |
| "step": 2860 |
| }, |
| { |
| "epoch": 2.070452911574407, |
| "grad_norm": 5.292683858994409, |
| "learning_rate": 4.4207503345679765e-05, |
| "loss": 1.6474, |
| "step": 2880 |
| }, |
| { |
| "epoch": 2.0848310567936736, |
| "grad_norm": 5.296677049826025, |
| "learning_rate": 4.4127700637464834e-05, |
| "loss": 1.7384, |
| "step": 2900 |
| }, |
| { |
| "epoch": 2.0992092020129403, |
| "grad_norm": 5.28280964549333, |
| "learning_rate": 4.404743437880534e-05, |
| "loss": 1.7859, |
| "step": 2920 |
| }, |
| { |
| "epoch": 2.113587347232207, |
| "grad_norm": 4.748113798023336, |
| "learning_rate": 4.3966706807380486e-05, |
| "loss": 1.7709, |
| "step": 2940 |
| }, |
| { |
| "epoch": 2.127965492451474, |
| "grad_norm": 5.529063322247205, |
| "learning_rate": 4.388552017373005e-05, |
| "loss": 1.7184, |
| "step": 2960 |
| }, |
| { |
| "epoch": 2.1423436376707405, |
| "grad_norm": 4.730553126339451, |
| "learning_rate": 4.380387674119163e-05, |
| "loss": 1.7068, |
| "step": 2980 |
| }, |
| { |
| "epoch": 2.156721782890007, |
| "grad_norm": 5.36722220081261, |
| "learning_rate": 4.3721778785837567e-05, |
| "loss": 1.7063, |
| "step": 3000 |
| }, |
| { |
| "epoch": 2.156721782890007, |
| "eval_loss": 1.8719093799591064, |
| "eval_runtime": 95.4773, |
| "eval_samples_per_second": 7.436, |
| "eval_steps_per_second": 1.864, |
| "step": 3000 |
| }, |
| { |
| "epoch": 2.1710999281092738, |
| "grad_norm": 5.37541384535542, |
| "learning_rate": 4.363922859641147e-05, |
| "loss": 1.7258, |
| "step": 3020 |
| }, |
| { |
| "epoch": 2.1854780733285404, |
| "grad_norm": 5.131778163059225, |
| "learning_rate": 4.355622847426443e-05, |
| "loss": 1.7558, |
| "step": 3040 |
| }, |
| { |
| "epoch": 2.1998562185478074, |
| "grad_norm": 4.967901836712549, |
| "learning_rate": 4.347278073329086e-05, |
| "loss": 1.7162, |
| "step": 3060 |
| }, |
| { |
| "epoch": 2.214234363767074, |
| "grad_norm": 5.404165339373527, |
| "learning_rate": 4.3388887699863986e-05, |
| "loss": 1.6724, |
| "step": 3080 |
| }, |
| { |
| "epoch": 2.2286125089863407, |
| "grad_norm": 5.130803952362976, |
| "learning_rate": 4.3304551712770966e-05, |
| "loss": 1.7449, |
| "step": 3100 |
| }, |
| { |
| "epoch": 2.2429906542056073, |
| "grad_norm": 4.664864170941625, |
| "learning_rate": 4.321977512314773e-05, |
| "loss": 1.6572, |
| "step": 3120 |
| }, |
| { |
| "epoch": 2.2573687994248743, |
| "grad_norm": 4.6543357676765105, |
| "learning_rate": 4.3134560294413415e-05, |
| "loss": 1.7188, |
| "step": 3140 |
| }, |
| { |
| "epoch": 2.271746944644141, |
| "grad_norm": 4.870392255731223, |
| "learning_rate": 4.3048909602204455e-05, |
| "loss": 1.6856, |
| "step": 3160 |
| }, |
| { |
| "epoch": 2.2861250898634076, |
| "grad_norm": 4.555840542123253, |
| "learning_rate": 4.2962825434308415e-05, |
| "loss": 1.6203, |
| "step": 3180 |
| }, |
| { |
| "epoch": 2.300503235082674, |
| "grad_norm": 4.999945556053941, |
| "learning_rate": 4.2876310190597343e-05, |
| "loss": 1.6595, |
| "step": 3200 |
| }, |
| { |
| "epoch": 2.300503235082674, |
| "eval_loss": 1.8157068490982056, |
| "eval_runtime": 95.0201, |
| "eval_samples_per_second": 7.472, |
| "eval_steps_per_second": 1.873, |
| "step": 3200 |
| }, |
| { |
| "epoch": 2.3148813803019412, |
| "grad_norm": 4.420391622563157, |
| "learning_rate": 4.2789366282960945e-05, |
| "loss": 1.6973, |
| "step": 3220 |
| }, |
| { |
| "epoch": 2.329259525521208, |
| "grad_norm": 4.900419834684209, |
| "learning_rate": 4.270199613523927e-05, |
| "loss": 1.6974, |
| "step": 3240 |
| }, |
| { |
| "epoch": 2.3436376707404745, |
| "grad_norm": 5.46657776801936, |
| "learning_rate": 4.26142021831552e-05, |
| "loss": 1.6299, |
| "step": 3260 |
| }, |
| { |
| "epoch": 2.358015815959741, |
| "grad_norm": 4.788517218174894, |
| "learning_rate": 4.252598687424653e-05, |
| "loss": 1.6057, |
| "step": 3280 |
| }, |
| { |
| "epoch": 2.372393961179008, |
| "grad_norm": 5.2836220827409965, |
| "learning_rate": 4.243735266779769e-05, |
| "loss": 1.601, |
| "step": 3300 |
| }, |
| { |
| "epoch": 2.3867721063982748, |
| "grad_norm": 4.668058236987495, |
| "learning_rate": 4.2348302034771266e-05, |
| "loss": 1.6659, |
| "step": 3320 |
| }, |
| { |
| "epoch": 2.4011502516175414, |
| "grad_norm": 5.336205272825928, |
| "learning_rate": 4.225883745773903e-05, |
| "loss": 1.6947, |
| "step": 3340 |
| }, |
| { |
| "epoch": 2.415528396836808, |
| "grad_norm": 4.98177891344483, |
| "learning_rate": 4.2168961430812784e-05, |
| "loss": 1.601, |
| "step": 3360 |
| }, |
| { |
| "epoch": 2.4299065420560746, |
| "grad_norm": 5.336376016887355, |
| "learning_rate": 4.207867645957484e-05, |
| "loss": 1.6144, |
| "step": 3380 |
| }, |
| { |
| "epoch": 2.4442846872753416, |
| "grad_norm": 5.533501299379357, |
| "learning_rate": 4.19879850610081e-05, |
| "loss": 1.6488, |
| "step": 3400 |
| }, |
| { |
| "epoch": 2.4442846872753416, |
| "eval_loss": 1.744245171546936, |
| "eval_runtime": 95.0078, |
| "eval_samples_per_second": 7.473, |
| "eval_steps_per_second": 1.874, |
| "step": 3400 |
| }, |
| { |
| "epoch": 2.4586628324946083, |
| "grad_norm": 5.033513775688983, |
| "learning_rate": 4.1896889763425976e-05, |
| "loss": 1.6188, |
| "step": 3420 |
| }, |
| { |
| "epoch": 2.473040977713875, |
| "grad_norm": 5.302823160144624, |
| "learning_rate": 4.1805393106401804e-05, |
| "loss": 1.6533, |
| "step": 3440 |
| }, |
| { |
| "epoch": 2.4874191229331415, |
| "grad_norm": 5.626811550605517, |
| "learning_rate": 4.1713497640698145e-05, |
| "loss": 1.5243, |
| "step": 3460 |
| }, |
| { |
| "epoch": 2.5017972681524085, |
| "grad_norm": 5.433250478973138, |
| "learning_rate": 4.162120592819563e-05, |
| "loss": 1.6433, |
| "step": 3480 |
| }, |
| { |
| "epoch": 2.516175413371675, |
| "grad_norm": 4.356579185845903, |
| "learning_rate": 4.1528520541821506e-05, |
| "loss": 1.5712, |
| "step": 3500 |
| }, |
| { |
| "epoch": 2.5305535585909418, |
| "grad_norm": 4.606446520762733, |
| "learning_rate": 4.143544406547797e-05, |
| "loss": 1.5558, |
| "step": 3520 |
| }, |
| { |
| "epoch": 2.5449317038102084, |
| "grad_norm": 5.022208262407065, |
| "learning_rate": 4.13419790939701e-05, |
| "loss": 1.53, |
| "step": 3540 |
| }, |
| { |
| "epoch": 2.559309849029475, |
| "grad_norm": 4.389342822675082, |
| "learning_rate": 4.124812823293351e-05, |
| "loss": 1.5554, |
| "step": 3560 |
| }, |
| { |
| "epoch": 2.573687994248742, |
| "grad_norm": 5.267458390782124, |
| "learning_rate": 4.1153894098761734e-05, |
| "loss": 1.5747, |
| "step": 3580 |
| }, |
| { |
| "epoch": 2.5880661394680087, |
| "grad_norm": 4.91610950762306, |
| "learning_rate": 4.105927931853327e-05, |
| "loss": 1.5857, |
| "step": 3600 |
| }, |
| { |
| "epoch": 2.5880661394680087, |
| "eval_loss": 1.6660903692245483, |
| "eval_runtime": 95.1538, |
| "eval_samples_per_second": 7.462, |
| "eval_steps_per_second": 1.871, |
| "step": 3600 |
| }, |
| { |
| "epoch": 2.6024442846872753, |
| "grad_norm": 4.623110605534604, |
| "learning_rate": 4.096428652993834e-05, |
| "loss": 1.6156, |
| "step": 3620 |
| }, |
| { |
| "epoch": 2.616822429906542, |
| "grad_norm": 5.285826831072292, |
| "learning_rate": 4.086891838120536e-05, |
| "loss": 1.5897, |
| "step": 3640 |
| }, |
| { |
| "epoch": 2.631200575125809, |
| "grad_norm": 5.036548928146315, |
| "learning_rate": 4.077317753102712e-05, |
| "loss": 1.5116, |
| "step": 3660 |
| }, |
| { |
| "epoch": 2.6455787203450756, |
| "grad_norm": 4.864592432779376, |
| "learning_rate": 4.067706664848667e-05, |
| "loss": 1.5118, |
| "step": 3680 |
| }, |
| { |
| "epoch": 2.659956865564342, |
| "grad_norm": 5.5690416036717965, |
| "learning_rate": 4.058058841298285e-05, |
| "loss": 1.4525, |
| "step": 3700 |
| }, |
| { |
| "epoch": 2.674335010783609, |
| "grad_norm": 5.266841922019754, |
| "learning_rate": 4.048374551415569e-05, |
| "loss": 1.5286, |
| "step": 3720 |
| }, |
| { |
| "epoch": 2.6887131560028754, |
| "grad_norm": 4.627025718960161, |
| "learning_rate": 4.038654065181137e-05, |
| "loss": 1.5993, |
| "step": 3740 |
| }, |
| { |
| "epoch": 2.7030913012221425, |
| "grad_norm": 5.147857938923495, |
| "learning_rate": 4.028897653584694e-05, |
| "loss": 1.5422, |
| "step": 3760 |
| }, |
| { |
| "epoch": 2.717469446441409, |
| "grad_norm": 5.053721024209507, |
| "learning_rate": 4.019105588617482e-05, |
| "loss": 1.4778, |
| "step": 3780 |
| }, |
| { |
| "epoch": 2.7318475916606757, |
| "grad_norm": 5.131739605647034, |
| "learning_rate": 4.009278143264694e-05, |
| "loss": 1.4596, |
| "step": 3800 |
| }, |
| { |
| "epoch": 2.7318475916606757, |
| "eval_loss": 1.5976985692977905, |
| "eval_runtime": 95.1934, |
| "eval_samples_per_second": 7.459, |
| "eval_steps_per_second": 1.87, |
| "step": 3800 |
| }, |
| { |
| "epoch": 2.7462257368799428, |
| "grad_norm": 4.895509789688502, |
| "learning_rate": 3.999415591497864e-05, |
| "loss": 1.4485, |
| "step": 3820 |
| }, |
| { |
| "epoch": 2.7606038820992094, |
| "grad_norm": 5.0799875433342825, |
| "learning_rate": 3.9895182082672314e-05, |
| "loss": 1.4502, |
| "step": 3840 |
| }, |
| { |
| "epoch": 2.774982027318476, |
| "grad_norm": 5.0584022395815005, |
| "learning_rate": 3.979586269494072e-05, |
| "loss": 1.4323, |
| "step": 3860 |
| }, |
| { |
| "epoch": 2.7893601725377426, |
| "grad_norm": 5.101741306521932, |
| "learning_rate": 3.969620052063012e-05, |
| "loss": 1.4622, |
| "step": 3880 |
| }, |
| { |
| "epoch": 2.803738317757009, |
| "grad_norm": 4.765857819060766, |
| "learning_rate": 3.959619833814299e-05, |
| "loss": 1.4433, |
| "step": 3900 |
| }, |
| { |
| "epoch": 2.818116462976276, |
| "grad_norm": 4.875737592080101, |
| "learning_rate": 3.949585893536069e-05, |
| "loss": 1.4394, |
| "step": 3920 |
| }, |
| { |
| "epoch": 2.832494608195543, |
| "grad_norm": 4.9864521901230265, |
| "learning_rate": 3.9395185109565634e-05, |
| "loss": 1.4302, |
| "step": 3940 |
| }, |
| { |
| "epoch": 2.8468727534148095, |
| "grad_norm": 5.28389537523971, |
| "learning_rate": 3.9294179667363364e-05, |
| "loss": 1.4103, |
| "step": 3960 |
| }, |
| { |
| "epoch": 2.861250898634076, |
| "grad_norm": 4.929220150481026, |
| "learning_rate": 3.919284542460427e-05, |
| "loss": 1.4318, |
| "step": 3980 |
| }, |
| { |
| "epoch": 2.875629043853343, |
| "grad_norm": 4.886618764152419, |
| "learning_rate": 3.9091185206305156e-05, |
| "loss": 1.4393, |
| "step": 4000 |
| }, |
| { |
| "epoch": 2.875629043853343, |
| "eval_loss": 1.502436637878418, |
| "eval_runtime": 95.3353, |
| "eval_samples_per_second": 7.447, |
| "eval_steps_per_second": 1.867, |
| "step": 4000 |
| }, |
| { |
| "epoch": 2.89000718907261, |
| "grad_norm": 4.775846915898877, |
| "learning_rate": 3.8989201846570405e-05, |
| "loss": 1.3976, |
| "step": 4020 |
| }, |
| { |
| "epoch": 2.9043853342918764, |
| "grad_norm": 4.765274471722679, |
| "learning_rate": 3.888689818851301e-05, |
| "loss": 1.4515, |
| "step": 4040 |
| }, |
| { |
| "epoch": 2.918763479511143, |
| "grad_norm": 4.8233456855111765, |
| "learning_rate": 3.87842770841753e-05, |
| "loss": 1.3637, |
| "step": 4060 |
| }, |
| { |
| "epoch": 2.9331416247304096, |
| "grad_norm": 4.716409537564854, |
| "learning_rate": 3.868134139444945e-05, |
| "loss": 1.4691, |
| "step": 4080 |
| }, |
| { |
| "epoch": 2.9475197699496762, |
| "grad_norm": 5.100153466739594, |
| "learning_rate": 3.85780939889977e-05, |
| "loss": 1.386, |
| "step": 4100 |
| }, |
| { |
| "epoch": 2.9618979151689433, |
| "grad_norm": 4.588464493898721, |
| "learning_rate": 3.847453774617238e-05, |
| "loss": 1.371, |
| "step": 4120 |
| }, |
| { |
| "epoch": 2.97627606038821, |
| "grad_norm": 5.2951877031362, |
| "learning_rate": 3.837067555293562e-05, |
| "loss": 1.4062, |
| "step": 4140 |
| }, |
| { |
| "epoch": 2.9906542056074765, |
| "grad_norm": 5.073352596381499, |
| "learning_rate": 3.8266510304778945e-05, |
| "loss": 1.3603, |
| "step": 4160 |
| }, |
| { |
| "epoch": 3.005032350826743, |
| "grad_norm": 4.216009222448274, |
| "learning_rate": 3.816204490564247e-05, |
| "loss": 1.2376, |
| "step": 4180 |
| }, |
| { |
| "epoch": 3.01941049604601, |
| "grad_norm": 4.654382088054549, |
| "learning_rate": 3.8057282267833996e-05, |
| "loss": 0.9292, |
| "step": 4200 |
| }, |
| { |
| "epoch": 3.01941049604601, |
| "eval_loss": 1.4160563945770264, |
| "eval_runtime": 95.0513, |
| "eval_samples_per_second": 7.47, |
| "eval_steps_per_second": 1.873, |
| "step": 4200 |
| }, |
| { |
| "epoch": 3.033788641265277, |
| "grad_norm": 5.890773249177552, |
| "learning_rate": 3.795222531194778e-05, |
| "loss": 0.9939, |
| "step": 4220 |
| }, |
| { |
| "epoch": 3.0481667864845434, |
| "grad_norm": 5.273040812138102, |
| "learning_rate": 3.784687696678319e-05, |
| "loss": 0.9692, |
| "step": 4240 |
| }, |
| { |
| "epoch": 3.06254493170381, |
| "grad_norm": 4.617434722391141, |
| "learning_rate": 3.774124016926295e-05, |
| "loss": 0.9423, |
| "step": 4260 |
| }, |
| { |
| "epoch": 3.076923076923077, |
| "grad_norm": 4.794825322123316, |
| "learning_rate": 3.763531786435136e-05, |
| "loss": 0.9553, |
| "step": 4280 |
| }, |
| { |
| "epoch": 3.0913012221423437, |
| "grad_norm": 4.612416905686019, |
| "learning_rate": 3.752911300497212e-05, |
| "loss": 1.0468, |
| "step": 4300 |
| }, |
| { |
| "epoch": 3.1056793673616103, |
| "grad_norm": 4.807421016950355, |
| "learning_rate": 3.7422628551926045e-05, |
| "loss": 0.9755, |
| "step": 4320 |
| }, |
| { |
| "epoch": 3.120057512580877, |
| "grad_norm": 5.330376372980625, |
| "learning_rate": 3.7315867473808556e-05, |
| "loss": 0.995, |
| "step": 4340 |
| }, |
| { |
| "epoch": 3.134435657800144, |
| "grad_norm": 5.173638877055289, |
| "learning_rate": 3.7208832746926856e-05, |
| "loss": 0.8955, |
| "step": 4360 |
| }, |
| { |
| "epoch": 3.1488138030194106, |
| "grad_norm": 4.337797150987041, |
| "learning_rate": 3.710152735521697e-05, |
| "loss": 0.9392, |
| "step": 4380 |
| }, |
| { |
| "epoch": 3.163191948238677, |
| "grad_norm": 4.7087288476465385, |
| "learning_rate": 3.6993954290160595e-05, |
| "loss": 0.8507, |
| "step": 4400 |
| }, |
| { |
| "epoch": 3.163191948238677, |
| "eval_loss": 1.3944473266601562, |
| "eval_runtime": 95.1428, |
| "eval_samples_per_second": 7.462, |
| "eval_steps_per_second": 1.871, |
| "step": 4400 |
| }, |
| { |
| "epoch": 3.177570093457944, |
| "grad_norm": 4.385026398896629, |
| "learning_rate": 3.6886116550701686e-05, |
| "loss": 0.9656, |
| "step": 4420 |
| }, |
| { |
| "epoch": 3.1919482386772104, |
| "grad_norm": 5.060518593348969, |
| "learning_rate": 3.677801714316283e-05, |
| "loss": 0.9374, |
| "step": 4440 |
| }, |
| { |
| "epoch": 3.2063263838964775, |
| "grad_norm": 4.963676634667283, |
| "learning_rate": 3.666965908116145e-05, |
| "loss": 1.0603, |
| "step": 4460 |
| }, |
| { |
| "epoch": 3.220704529115744, |
| "grad_norm": 5.537695202590892, |
| "learning_rate": 3.656104538552579e-05, |
| "loss": 0.9251, |
| "step": 4480 |
| }, |
| { |
| "epoch": 3.2350826743350107, |
| "grad_norm": 5.159238562381511, |
| "learning_rate": 3.645217908421072e-05, |
| "loss": 0.9029, |
| "step": 4500 |
| }, |
| { |
| "epoch": 3.2494608195542773, |
| "grad_norm": 4.583487471613817, |
| "learning_rate": 3.634306321221328e-05, |
| "loss": 0.9456, |
| "step": 4520 |
| }, |
| { |
| "epoch": 3.2638389647735444, |
| "grad_norm": 4.743610746700115, |
| "learning_rate": 3.623370081148811e-05, |
| "loss": 0.9517, |
| "step": 4540 |
| }, |
| { |
| "epoch": 3.278217109992811, |
| "grad_norm": 4.820931354676504, |
| "learning_rate": 3.612409493086261e-05, |
| "loss": 0.8897, |
| "step": 4560 |
| }, |
| { |
| "epoch": 3.2925952552120776, |
| "grad_norm": 4.644390057678307, |
| "learning_rate": 3.6014248625951984e-05, |
| "loss": 0.8988, |
| "step": 4580 |
| }, |
| { |
| "epoch": 3.3069734004313442, |
| "grad_norm": 4.199864500637539, |
| "learning_rate": 3.590416495907401e-05, |
| "loss": 0.8764, |
| "step": 4600 |
| }, |
| { |
| "epoch": 3.3069734004313442, |
| "eval_loss": 1.2968120574951172, |
| "eval_runtime": 94.9563, |
| "eval_samples_per_second": 7.477, |
| "eval_steps_per_second": 1.875, |
| "step": 4600 |
| }, |
| { |
| "epoch": 3.321351545650611, |
| "grad_norm": 4.8933319942452735, |
| "learning_rate": 3.579384699916372e-05, |
| "loss": 0.9392, |
| "step": 4620 |
| }, |
| { |
| "epoch": 3.335729690869878, |
| "grad_norm": 5.539372627833398, |
| "learning_rate": 3.5683297821687786e-05, |
| "loss": 0.9456, |
| "step": 4640 |
| }, |
| { |
| "epoch": 3.3501078360891445, |
| "grad_norm": 4.440124319383781, |
| "learning_rate": 3.557252050855882e-05, |
| "loss": 0.8985, |
| "step": 4660 |
| }, |
| { |
| "epoch": 3.364485981308411, |
| "grad_norm": 4.51905807949511, |
| "learning_rate": 3.546151814804947e-05, |
| "loss": 0.894, |
| "step": 4680 |
| }, |
| { |
| "epoch": 3.3788641265276778, |
| "grad_norm": 4.821926801095058, |
| "learning_rate": 3.535029383470625e-05, |
| "loss": 0.8877, |
| "step": 4700 |
| }, |
| { |
| "epoch": 3.393242271746945, |
| "grad_norm": 4.9545904090849096, |
| "learning_rate": 3.523885066926339e-05, |
| "loss": 0.8563, |
| "step": 4720 |
| }, |
| { |
| "epoch": 3.4076204169662114, |
| "grad_norm": 4.894310928975366, |
| "learning_rate": 3.512719175855625e-05, |
| "loss": 0.9125, |
| "step": 4740 |
| }, |
| { |
| "epoch": 3.421998562185478, |
| "grad_norm": 4.878217385051204, |
| "learning_rate": 3.5015320215434846e-05, |
| "loss": 0.8506, |
| "step": 4760 |
| }, |
| { |
| "epoch": 3.4363767074047447, |
| "grad_norm": 5.063687633092487, |
| "learning_rate": 3.4903239158676954e-05, |
| "loss": 0.8756, |
| "step": 4780 |
| }, |
| { |
| "epoch": 3.4507548526240113, |
| "grad_norm": 4.673136695418736, |
| "learning_rate": 3.479095171290124e-05, |
| "loss": 0.8721, |
| "step": 4800 |
| }, |
| { |
| "epoch": 3.4507548526240113, |
| "eval_loss": 1.2097233533859253, |
| "eval_runtime": 94.9642, |
| "eval_samples_per_second": 7.477, |
| "eval_steps_per_second": 1.874, |
| "step": 4800 |
| }, |
| { |
| "epoch": 3.4651329978432783, |
| "grad_norm": 5.195670176766828, |
| "learning_rate": 3.467846100848011e-05, |
| "loss": 0.863, |
| "step": 4820 |
| }, |
| { |
| "epoch": 3.479511143062545, |
| "grad_norm": 5.299015192713523, |
| "learning_rate": 3.456577018145249e-05, |
| "loss": 0.8514, |
| "step": 4840 |
| }, |
| { |
| "epoch": 3.4938892882818116, |
| "grad_norm": 5.076570824919959, |
| "learning_rate": 3.4452882373436316e-05, |
| "loss": 0.8804, |
| "step": 4860 |
| }, |
| { |
| "epoch": 3.5082674335010786, |
| "grad_norm": 5.458489723441928, |
| "learning_rate": 3.433980073154104e-05, |
| "loss": 0.8449, |
| "step": 4880 |
| }, |
| { |
| "epoch": 3.5226455787203452, |
| "grad_norm": 5.124610831012214, |
| "learning_rate": 3.422652840827983e-05, |
| "loss": 0.8071, |
| "step": 4900 |
| }, |
| { |
| "epoch": 3.537023723939612, |
| "grad_norm": 4.568932253998444, |
| "learning_rate": 3.411306856148173e-05, |
| "loss": 0.7761, |
| "step": 4920 |
| }, |
| { |
| "epoch": 3.5514018691588785, |
| "grad_norm": 5.145433589411428, |
| "learning_rate": 3.399942435420358e-05, |
| "loss": 0.8594, |
| "step": 4940 |
| }, |
| { |
| "epoch": 3.565780014378145, |
| "grad_norm": 4.760657828130472, |
| "learning_rate": 3.388559895464187e-05, |
| "loss": 0.8927, |
| "step": 4960 |
| }, |
| { |
| "epoch": 3.5801581595974117, |
| "grad_norm": 3.820560651004478, |
| "learning_rate": 3.3771595536044414e-05, |
| "loss": 0.8388, |
| "step": 4980 |
| }, |
| { |
| "epoch": 3.5945363048166787, |
| "grad_norm": 5.68396222586338, |
| "learning_rate": 3.365741727662187e-05, |
| "loss": 0.8046, |
| "step": 5000 |
| }, |
| { |
| "epoch": 3.5945363048166787, |
| "eval_loss": 1.1343132257461548, |
| "eval_runtime": 94.9046, |
| "eval_samples_per_second": 7.481, |
| "eval_steps_per_second": 1.876, |
| "step": 5000 |
| }, |
| { |
| "epoch": 3.6089144500359454, |
| "grad_norm": 5.325125464111565, |
| "learning_rate": 3.3543067359459137e-05, |
| "loss": 0.8037, |
| "step": 5020 |
| }, |
| { |
| "epoch": 3.623292595255212, |
| "grad_norm": 4.863903982548437, |
| "learning_rate": 3.342854897242662e-05, |
| "loss": 0.8368, |
| "step": 5040 |
| }, |
| { |
| "epoch": 3.637670740474479, |
| "grad_norm": 4.881874458955767, |
| "learning_rate": 3.33138653080914e-05, |
| "loss": 0.8125, |
| "step": 5060 |
| }, |
| { |
| "epoch": 3.6520488856937456, |
| "grad_norm": 5.3439550891850365, |
| "learning_rate": 3.3199019563628134e-05, |
| "loss": 0.7565, |
| "step": 5080 |
| }, |
| { |
| "epoch": 3.6664270309130123, |
| "grad_norm": 4.84296449431872, |
| "learning_rate": 3.308401494073004e-05, |
| "loss": 0.834, |
| "step": 5100 |
| }, |
| { |
| "epoch": 3.680805176132279, |
| "grad_norm": 5.110097802059874, |
| "learning_rate": 3.296885464551953e-05, |
| "loss": 0.7868, |
| "step": 5120 |
| }, |
| { |
| "epoch": 3.6951833213515455, |
| "grad_norm": 4.929559008914251, |
| "learning_rate": 3.285354188845892e-05, |
| "loss": 0.7911, |
| "step": 5140 |
| }, |
| { |
| "epoch": 3.709561466570812, |
| "grad_norm": 5.054253010860754, |
| "learning_rate": 3.273807988426087e-05, |
| "loss": 0.7886, |
| "step": 5160 |
| }, |
| { |
| "epoch": 3.723939611790079, |
| "grad_norm": 4.61684551923686, |
| "learning_rate": 3.262247185179879e-05, |
| "loss": 0.7813, |
| "step": 5180 |
| }, |
| { |
| "epoch": 3.7383177570093458, |
| "grad_norm": 4.353723945187912, |
| "learning_rate": 3.250672101401707e-05, |
| "loss": 0.736, |
| "step": 5200 |
| }, |
| { |
| "epoch": 3.7383177570093458, |
| "eval_loss": 1.0338796377182007, |
| "eval_runtime": 94.9478, |
| "eval_samples_per_second": 7.478, |
| "eval_steps_per_second": 1.875, |
| "step": 5200 |
| }, |
| { |
| "epoch": 3.7526959022286124, |
| "grad_norm": 5.703808944893645, |
| "learning_rate": 3.2390830597841306e-05, |
| "loss": 0.7881, |
| "step": 5220 |
| }, |
| { |
| "epoch": 3.7670740474478794, |
| "grad_norm": 4.541111143609565, |
| "learning_rate": 3.2274803834088244e-05, |
| "loss": 0.7216, |
| "step": 5240 |
| }, |
| { |
| "epoch": 3.781452192667146, |
| "grad_norm": 5.185866482725821, |
| "learning_rate": 3.215864395737577e-05, |
| "loss": 0.7323, |
| "step": 5260 |
| }, |
| { |
| "epoch": 3.7958303378864127, |
| "grad_norm": 4.309899151553392, |
| "learning_rate": 3.204235420603273e-05, |
| "loss": 0.7352, |
| "step": 5280 |
| }, |
| { |
| "epoch": 3.8102084831056793, |
| "grad_norm": 4.794889232835026, |
| "learning_rate": 3.192593782200863e-05, |
| "loss": 0.7682, |
| "step": 5300 |
| }, |
| { |
| "epoch": 3.824586628324946, |
| "grad_norm": 4.620050702309508, |
| "learning_rate": 3.180939805078328e-05, |
| "loss": 0.7158, |
| "step": 5320 |
| }, |
| { |
| "epoch": 3.838964773544213, |
| "grad_norm": 4.789174643783679, |
| "learning_rate": 3.169273814127629e-05, |
| "loss": 0.7224, |
| "step": 5340 |
| }, |
| { |
| "epoch": 3.8533429187634796, |
| "grad_norm": 4.470710040748567, |
| "learning_rate": 3.15759613457565e-05, |
| "loss": 0.7606, |
| "step": 5360 |
| }, |
| { |
| "epoch": 3.867721063982746, |
| "grad_norm": 4.200672286876548, |
| "learning_rate": 3.145907091975136e-05, |
| "loss": 0.7342, |
| "step": 5380 |
| }, |
| { |
| "epoch": 3.882099209202013, |
| "grad_norm": 4.651034024184218, |
| "learning_rate": 3.134207012195609e-05, |
| "loss": 0.6963, |
| "step": 5400 |
| }, |
| { |
| "epoch": 3.882099209202013, |
| "eval_loss": 0.9063346982002258, |
| "eval_runtime": 95.1402, |
| "eval_samples_per_second": 7.463, |
| "eval_steps_per_second": 1.871, |
| "step": 5400 |
| }, |
| { |
| "epoch": 3.89647735442128, |
| "grad_norm": 5.251836684504766, |
| "learning_rate": 3.122496221414293e-05, |
| "loss": 0.6979, |
| "step": 5420 |
| }, |
| { |
| "epoch": 3.9108554996405465, |
| "grad_norm": 4.501970989039771, |
| "learning_rate": 3.110775046107009e-05, |
| "loss": 0.6784, |
| "step": 5440 |
| }, |
| { |
| "epoch": 3.925233644859813, |
| "grad_norm": 4.383276146435303, |
| "learning_rate": 3.0990438130390854e-05, |
| "loss": 0.705, |
| "step": 5460 |
| }, |
| { |
| "epoch": 3.9396117900790797, |
| "grad_norm": 4.909739674989457, |
| "learning_rate": 3.0873028492562395e-05, |
| "loss": 0.6692, |
| "step": 5480 |
| }, |
| { |
| "epoch": 3.9539899352983463, |
| "grad_norm": 4.386911467650432, |
| "learning_rate": 3.075552482075466e-05, |
| "loss": 0.6622, |
| "step": 5500 |
| }, |
| { |
| "epoch": 3.9683680805176134, |
| "grad_norm": 5.143117323784103, |
| "learning_rate": 3.0637930390759076e-05, |
| "loss": 0.6242, |
| "step": 5520 |
| }, |
| { |
| "epoch": 3.98274622573688, |
| "grad_norm": 5.035434062806972, |
| "learning_rate": 3.052024848089725e-05, |
| "loss": 0.6244, |
| "step": 5540 |
| }, |
| { |
| "epoch": 3.9971243709561466, |
| "grad_norm": 4.838730604347607, |
| "learning_rate": 3.0402482371929582e-05, |
| "loss": 0.7241, |
| "step": 5560 |
| }, |
| { |
| "epoch": 4.011502516175414, |
| "grad_norm": 3.7762087987736335, |
| "learning_rate": 3.0284635346963764e-05, |
| "loss": 0.4018, |
| "step": 5580 |
| }, |
| { |
| "epoch": 4.02588066139468, |
| "grad_norm": 3.8053820101683766, |
| "learning_rate": 3.0166710691363316e-05, |
| "loss": 0.346, |
| "step": 5600 |
| }, |
| { |
| "epoch": 4.02588066139468, |
| "eval_loss": 0.8031301498413086, |
| "eval_runtime": 95.0025, |
| "eval_samples_per_second": 7.473, |
| "eval_steps_per_second": 1.874, |
| "step": 5600 |
| }, |
| { |
| "epoch": 4.040258806613947, |
| "grad_norm": 3.633422578478027, |
| "learning_rate": 3.004871169265593e-05, |
| "loss": 0.3547, |
| "step": 5620 |
| }, |
| { |
| "epoch": 4.0546369518332135, |
| "grad_norm": 3.8811754142736605, |
| "learning_rate": 2.9930641640441876e-05, |
| "loss": 0.3161, |
| "step": 5640 |
| }, |
| { |
| "epoch": 4.06901509705248, |
| "grad_norm": 3.5964575085704666, |
| "learning_rate": 2.9812503826302257e-05, |
| "loss": 0.3407, |
| "step": 5660 |
| }, |
| { |
| "epoch": 4.083393242271747, |
| "grad_norm": 3.3163513924241355, |
| "learning_rate": 2.9694301543707255e-05, |
| "loss": 0.3307, |
| "step": 5680 |
| }, |
| { |
| "epoch": 4.097771387491013, |
| "grad_norm": 3.5339198445026714, |
| "learning_rate": 2.9576038087924297e-05, |
| "loss": 0.3412, |
| "step": 5700 |
| }, |
| { |
| "epoch": 4.11214953271028, |
| "grad_norm": 3.7886609523702752, |
| "learning_rate": 2.9457716755926258e-05, |
| "loss": 0.3365, |
| "step": 5720 |
| }, |
| { |
| "epoch": 4.126527677929547, |
| "grad_norm": 3.4940816712487224, |
| "learning_rate": 2.9339340846299456e-05, |
| "loss": 0.359, |
| "step": 5740 |
| }, |
| { |
| "epoch": 4.140905823148814, |
| "grad_norm": 3.8228147601492424, |
| "learning_rate": 2.9220913659151748e-05, |
| "loss": 0.3539, |
| "step": 5760 |
| }, |
| { |
| "epoch": 4.155283968368081, |
| "grad_norm": 4.777444368973502, |
| "learning_rate": 2.9102438496020524e-05, |
| "loss": 0.3696, |
| "step": 5780 |
| }, |
| { |
| "epoch": 4.169662113587347, |
| "grad_norm": 4.24172355984632, |
| "learning_rate": 2.8983918659780646e-05, |
| "loss": 0.3342, |
| "step": 5800 |
| }, |
| { |
| "epoch": 4.169662113587347, |
| "eval_loss": 0.7978797554969788, |
| "eval_runtime": 95.1128, |
| "eval_samples_per_second": 7.465, |
| "eval_steps_per_second": 1.871, |
| "step": 5800 |
| }, |
| { |
| "epoch": 4.184040258806614, |
| "grad_norm": 3.4399861307887463, |
| "learning_rate": 2.8865357454552393e-05, |
| "loss": 0.3617, |
| "step": 5820 |
| }, |
| { |
| "epoch": 4.1984184040258805, |
| "grad_norm": 3.9247967710302105, |
| "learning_rate": 2.874675818560933e-05, |
| "loss": 0.3352, |
| "step": 5840 |
| }, |
| { |
| "epoch": 4.212796549245147, |
| "grad_norm": 4.206719908492779, |
| "learning_rate": 2.8628124159286162e-05, |
| "loss": 0.343, |
| "step": 5860 |
| }, |
| { |
| "epoch": 4.227174694464414, |
| "grad_norm": 3.579153737863472, |
| "learning_rate": 2.8509458682886592e-05, |
| "loss": 0.3365, |
| "step": 5880 |
| }, |
| { |
| "epoch": 4.241552839683681, |
| "grad_norm": 4.485756832244402, |
| "learning_rate": 2.8390765064591067e-05, |
| "loss": 0.3563, |
| "step": 5900 |
| }, |
| { |
| "epoch": 4.255930984902948, |
| "grad_norm": 3.601421123305685, |
| "learning_rate": 2.82720466133646e-05, |
| "loss": 0.3689, |
| "step": 5920 |
| }, |
| { |
| "epoch": 4.2703091301222145, |
| "grad_norm": 3.381444289556178, |
| "learning_rate": 2.815330663886449e-05, |
| "loss": 0.3655, |
| "step": 5940 |
| }, |
| { |
| "epoch": 4.284687275341481, |
| "grad_norm": 4.260575686248021, |
| "learning_rate": 2.803454845134807e-05, |
| "loss": 0.313, |
| "step": 5960 |
| }, |
| { |
| "epoch": 4.299065420560748, |
| "grad_norm": 4.020678447213185, |
| "learning_rate": 2.7915775361580428e-05, |
| "loss": 0.3273, |
| "step": 5980 |
| }, |
| { |
| "epoch": 4.313443565780014, |
| "grad_norm": 4.218502841035936, |
| "learning_rate": 2.779699068074208e-05, |
| "loss": 0.3426, |
| "step": 6000 |
| }, |
| { |
| "epoch": 4.313443565780014, |
| "eval_loss": 0.7659556865692139, |
| "eval_runtime": 95.1822, |
| "eval_samples_per_second": 7.459, |
| "eval_steps_per_second": 1.87, |
| "step": 6000 |
| }, |
| { |
| "epoch": 4.327821710999281, |
| "grad_norm": 4.242124083199349, |
| "learning_rate": 2.767819772033669e-05, |
| "loss": 0.3092, |
| "step": 6020 |
| }, |
| { |
| "epoch": 4.3421998562185475, |
| "grad_norm": 3.603338153962201, |
| "learning_rate": 2.7559399792098757e-05, |
| "loss": 0.3351, |
| "step": 6040 |
| }, |
| { |
| "epoch": 4.356578001437814, |
| "grad_norm": 4.09219396831434, |
| "learning_rate": 2.744060020790125e-05, |
| "loss": 0.358, |
| "step": 6060 |
| }, |
| { |
| "epoch": 4.370956146657081, |
| "grad_norm": 4.240093061951673, |
| "learning_rate": 2.7321802279663315e-05, |
| "loss": 0.3422, |
| "step": 6080 |
| }, |
| { |
| "epoch": 4.385334291876348, |
| "grad_norm": 3.9048915638391763, |
| "learning_rate": 2.7203009319257927e-05, |
| "loss": 0.3397, |
| "step": 6100 |
| }, |
| { |
| "epoch": 4.399712437095615, |
| "grad_norm": 4.07320075881977, |
| "learning_rate": 2.708422463841958e-05, |
| "loss": 0.3315, |
| "step": 6120 |
| }, |
| { |
| "epoch": 4.4140905823148815, |
| "grad_norm": 3.32557552519866, |
| "learning_rate": 2.6965451548651938e-05, |
| "loss": 0.3131, |
| "step": 6140 |
| }, |
| { |
| "epoch": 4.428468727534148, |
| "grad_norm": 4.675885110169447, |
| "learning_rate": 2.6846693361135522e-05, |
| "loss": 0.315, |
| "step": 6160 |
| }, |
| { |
| "epoch": 4.442846872753415, |
| "grad_norm": 3.7485615134459405, |
| "learning_rate": 2.6727953386635406e-05, |
| "loss": 0.311, |
| "step": 6180 |
| }, |
| { |
| "epoch": 4.457225017972681, |
| "grad_norm": 3.8879166393703533, |
| "learning_rate": 2.6609234935408945e-05, |
| "loss": 0.3388, |
| "step": 6200 |
| }, |
| { |
| "epoch": 4.457225017972681, |
| "eval_loss": 0.7081239223480225, |
| "eval_runtime": 95.4928, |
| "eval_samples_per_second": 7.435, |
| "eval_steps_per_second": 1.864, |
| "step": 6200 |
| }, |
| { |
| "epoch": 4.471603163191948, |
| "grad_norm": 3.5820375915220644, |
| "learning_rate": 2.6490541317113427e-05, |
| "loss": 0.3427, |
| "step": 6220 |
| }, |
| { |
| "epoch": 4.485981308411215, |
| "grad_norm": 3.6407271030099215, |
| "learning_rate": 2.637187584071384e-05, |
| "loss": 0.3051, |
| "step": 6240 |
| }, |
| { |
| "epoch": 4.500359453630482, |
| "grad_norm": 3.726385171500585, |
| "learning_rate": 2.6253241814390676e-05, |
| "loss": 0.2748, |
| "step": 6260 |
| }, |
| { |
| "epoch": 4.514737598849749, |
| "grad_norm": 3.5020005944474732, |
| "learning_rate": 2.613464254544761e-05, |
| "loss": 0.3514, |
| "step": 6280 |
| }, |
| { |
| "epoch": 4.529115744069015, |
| "grad_norm": 3.2090288253309716, |
| "learning_rate": 2.6016081340219356e-05, |
| "loss": 0.3388, |
| "step": 6300 |
| }, |
| { |
| "epoch": 4.543493889288282, |
| "grad_norm": 3.2198075509902986, |
| "learning_rate": 2.5897561503979478e-05, |
| "loss": 0.3057, |
| "step": 6320 |
| }, |
| { |
| "epoch": 4.5578720345075485, |
| "grad_norm": 3.5752578196627094, |
| "learning_rate": 2.5779086340848257e-05, |
| "loss": 0.2949, |
| "step": 6340 |
| }, |
| { |
| "epoch": 4.572250179726815, |
| "grad_norm": 3.8552778688461116, |
| "learning_rate": 2.566065915370055e-05, |
| "loss": 0.3529, |
| "step": 6360 |
| }, |
| { |
| "epoch": 4.586628324946082, |
| "grad_norm": 4.500361755745332, |
| "learning_rate": 2.554228324407375e-05, |
| "loss": 0.2893, |
| "step": 6380 |
| }, |
| { |
| "epoch": 4.601006470165348, |
| "grad_norm": 2.9143489664656492, |
| "learning_rate": 2.5423961912075712e-05, |
| "loss": 0.3169, |
| "step": 6400 |
| }, |
| { |
| "epoch": 4.601006470165348, |
| "eval_loss": 0.647361159324646, |
| "eval_runtime": 95.0975, |
| "eval_samples_per_second": 7.466, |
| "eval_steps_per_second": 1.872, |
| "step": 6400 |
| }, |
| { |
| "epoch": 4.615384615384615, |
| "grad_norm": 3.711342895438154, |
| "learning_rate": 2.5305698456292758e-05, |
| "loss": 0.2876, |
| "step": 6420 |
| }, |
| { |
| "epoch": 4.6297627606038825, |
| "grad_norm": 3.7020282599564, |
| "learning_rate": 2.518749617369775e-05, |
| "loss": 0.2987, |
| "step": 6440 |
| }, |
| { |
| "epoch": 4.644140905823149, |
| "grad_norm": 3.3242662861554155, |
| "learning_rate": 2.5069358359558126e-05, |
| "loss": 0.3331, |
| "step": 6460 |
| }, |
| { |
| "epoch": 4.658519051042416, |
| "grad_norm": 3.924698535818125, |
| "learning_rate": 2.495128830734408e-05, |
| "loss": 0.2991, |
| "step": 6480 |
| }, |
| { |
| "epoch": 4.672897196261682, |
| "grad_norm": 4.090313400971172, |
| "learning_rate": 2.4833289308636693e-05, |
| "loss": 0.2732, |
| "step": 6500 |
| }, |
| { |
| "epoch": 4.687275341480949, |
| "grad_norm": 3.7716729841694505, |
| "learning_rate": 2.4715364653036245e-05, |
| "loss": 0.2656, |
| "step": 6520 |
| }, |
| { |
| "epoch": 4.7016534867002155, |
| "grad_norm": 3.8130653011051745, |
| "learning_rate": 2.4597517628070434e-05, |
| "loss": 0.3101, |
| "step": 6540 |
| }, |
| { |
| "epoch": 4.716031631919482, |
| "grad_norm": 3.6664917416085823, |
| "learning_rate": 2.447975151910276e-05, |
| "loss": 0.2918, |
| "step": 6560 |
| }, |
| { |
| "epoch": 4.730409777138749, |
| "grad_norm": 3.5206854492391315, |
| "learning_rate": 2.4362069609240933e-05, |
| "loss": 0.2752, |
| "step": 6580 |
| }, |
| { |
| "epoch": 4.744787922358016, |
| "grad_norm": 3.36674316245278, |
| "learning_rate": 2.4244475179245348e-05, |
| "loss": 0.2788, |
| "step": 6600 |
| }, |
| { |
| "epoch": 4.744787922358016, |
| "eval_loss": 0.5831869840621948, |
| "eval_runtime": 94.9797, |
| "eval_samples_per_second": 7.475, |
| "eval_steps_per_second": 1.874, |
| "step": 6600 |
| }, |
| { |
| "epoch": 4.759166067577283, |
| "grad_norm": 3.501678635535513, |
| "learning_rate": 2.41269715074376e-05, |
| "loss": 0.2487, |
| "step": 6620 |
| }, |
| { |
| "epoch": 4.7735442127965495, |
| "grad_norm": 3.128846435349539, |
| "learning_rate": 2.4009561869609148e-05, |
| "loss": 0.2725, |
| "step": 6640 |
| }, |
| { |
| "epoch": 4.787922358015816, |
| "grad_norm": 3.5356811979056113, |
| "learning_rate": 2.3892249538929912e-05, |
| "loss": 0.3208, |
| "step": 6660 |
| }, |
| { |
| "epoch": 4.802300503235083, |
| "grad_norm": 4.5315327649915575, |
| "learning_rate": 2.3775037785857073e-05, |
| "loss": 0.272, |
| "step": 6680 |
| }, |
| { |
| "epoch": 4.816678648454349, |
| "grad_norm": 3.5524117779614643, |
| "learning_rate": 2.3657929878043906e-05, |
| "loss": 0.2696, |
| "step": 6700 |
| }, |
| { |
| "epoch": 4.831056793673616, |
| "grad_norm": 3.824091251673855, |
| "learning_rate": 2.3540929080248646e-05, |
| "loss": 0.2944, |
| "step": 6720 |
| }, |
| { |
| "epoch": 4.845434938892883, |
| "grad_norm": 3.292419610880534, |
| "learning_rate": 2.3424038654243507e-05, |
| "loss": 0.2432, |
| "step": 6740 |
| }, |
| { |
| "epoch": 4.859813084112149, |
| "grad_norm": 3.4159645581237656, |
| "learning_rate": 2.3307261858723723e-05, |
| "loss": 0.2444, |
| "step": 6760 |
| }, |
| { |
| "epoch": 4.874191229331416, |
| "grad_norm": 4.084161850857968, |
| "learning_rate": 2.319060194921673e-05, |
| "loss": 0.2622, |
| "step": 6780 |
| }, |
| { |
| "epoch": 4.888569374550683, |
| "grad_norm": 2.4534341246257227, |
| "learning_rate": 2.3074062177991373e-05, |
| "loss": 0.2326, |
| "step": 6800 |
| }, |
| { |
| "epoch": 4.888569374550683, |
| "eval_loss": 0.5214605331420898, |
| "eval_runtime": 95.3983, |
| "eval_samples_per_second": 7.442, |
| "eval_steps_per_second": 1.866, |
| "step": 6800 |
| }, |
| { |
| "epoch": 4.90294751976995, |
| "grad_norm": 3.2607272502878315, |
| "learning_rate": 2.2957645793967277e-05, |
| "loss": 0.2746, |
| "step": 6820 |
| }, |
| { |
| "epoch": 4.9173256649892165, |
| "grad_norm": 3.322757677302258, |
| "learning_rate": 2.2841356042624234e-05, |
| "loss": 0.2437, |
| "step": 6840 |
| }, |
| { |
| "epoch": 4.931703810208483, |
| "grad_norm": 2.8800141239102737, |
| "learning_rate": 2.2725196165911765e-05, |
| "loss": 0.2671, |
| "step": 6860 |
| }, |
| { |
| "epoch": 4.94608195542775, |
| "grad_norm": 2.958452590637205, |
| "learning_rate": 2.2609169402158696e-05, |
| "loss": 0.2275, |
| "step": 6880 |
| }, |
| { |
| "epoch": 4.960460100647016, |
| "grad_norm": 3.8035839747048974, |
| "learning_rate": 2.249327898598293e-05, |
| "loss": 0.2366, |
| "step": 6900 |
| }, |
| { |
| "epoch": 4.974838245866283, |
| "grad_norm": 3.7602185439564364, |
| "learning_rate": 2.237752814820122e-05, |
| "loss": 0.241, |
| "step": 6920 |
| }, |
| { |
| "epoch": 4.98921639108555, |
| "grad_norm": 3.6449337323487727, |
| "learning_rate": 2.2261920115739137e-05, |
| "loss": 0.2338, |
| "step": 6940 |
| }, |
| { |
| "epoch": 5.003594536304817, |
| "grad_norm": 2.899402463401305, |
| "learning_rate": 2.2146458111541084e-05, |
| "loss": 0.2363, |
| "step": 6960 |
| }, |
| { |
| "epoch": 5.017972681524084, |
| "grad_norm": 2.179657035418109, |
| "learning_rate": 2.203114535448047e-05, |
| "loss": 0.1179, |
| "step": 6980 |
| }, |
| { |
| "epoch": 5.03235082674335, |
| "grad_norm": 2.9206861319741524, |
| "learning_rate": 2.1915985059269966e-05, |
| "loss": 0.1096, |
| "step": 7000 |
| }, |
| { |
| "epoch": 5.03235082674335, |
| "eval_loss": 0.48705199360847473, |
| "eval_runtime": 95.0343, |
| "eval_samples_per_second": 7.471, |
| "eval_steps_per_second": 1.873, |
| "step": 7000 |
| }, |
| { |
| "epoch": 5.046728971962617, |
| "grad_norm": 3.3343151915634057, |
| "learning_rate": 2.1800980436371864e-05, |
| "loss": 0.1179, |
| "step": 7020 |
| }, |
| { |
| "epoch": 5.0611071171818836, |
| "grad_norm": 3.4978232084767558, |
| "learning_rate": 2.1686134691908606e-05, |
| "loss": 0.1254, |
| "step": 7040 |
| }, |
| { |
| "epoch": 5.07548526240115, |
| "grad_norm": 2.628073375097494, |
| "learning_rate": 2.157145102757338e-05, |
| "loss": 0.1238, |
| "step": 7060 |
| }, |
| { |
| "epoch": 5.089863407620417, |
| "grad_norm": 3.511922564055676, |
| "learning_rate": 2.1456932640540872e-05, |
| "loss": 0.1286, |
| "step": 7080 |
| }, |
| { |
| "epoch": 5.104241552839683, |
| "grad_norm": 3.2038916584161496, |
| "learning_rate": 2.134258272337814e-05, |
| "loss": 0.1208, |
| "step": 7100 |
| }, |
| { |
| "epoch": 5.11861969805895, |
| "grad_norm": 2.9186195372093806, |
| "learning_rate": 2.1228404463955588e-05, |
| "loss": 0.1334, |
| "step": 7120 |
| }, |
| { |
| "epoch": 5.1329978432782175, |
| "grad_norm": 2.4964992425737775, |
| "learning_rate": 2.1114401045358135e-05, |
| "loss": 0.1145, |
| "step": 7140 |
| }, |
| { |
| "epoch": 5.147375988497484, |
| "grad_norm": 2.746919975951301, |
| "learning_rate": 2.1000575645796427e-05, |
| "loss": 0.1205, |
| "step": 7160 |
| }, |
| { |
| "epoch": 5.161754133716751, |
| "grad_norm": 3.186604464709822, |
| "learning_rate": 2.0886931438518277e-05, |
| "loss": 0.1415, |
| "step": 7180 |
| }, |
| { |
| "epoch": 5.176132278936017, |
| "grad_norm": 3.791723952579076, |
| "learning_rate": 2.0773471591720172e-05, |
| "loss": 0.1374, |
| "step": 7200 |
| }, |
| { |
| "epoch": 5.176132278936017, |
| "eval_loss": 0.4873916804790497, |
| "eval_runtime": 95.0401, |
| "eval_samples_per_second": 7.471, |
| "eval_steps_per_second": 1.873, |
| "step": 7200 |
| }, |
| { |
| "epoch": 5.190510424155284, |
| "grad_norm": 3.194914429367862, |
| "learning_rate": 2.0660199268458968e-05, |
| "loss": 0.1356, |
| "step": 7220 |
| }, |
| { |
| "epoch": 5.204888569374551, |
| "grad_norm": 3.3264271128825778, |
| "learning_rate": 2.054711762656369e-05, |
| "loss": 0.1168, |
| "step": 7240 |
| }, |
| { |
| "epoch": 5.219266714593817, |
| "grad_norm": 2.0686564494935897, |
| "learning_rate": 2.0434229818547518e-05, |
| "loss": 0.1166, |
| "step": 7260 |
| }, |
| { |
| "epoch": 5.233644859813084, |
| "grad_norm": 2.586191401181996, |
| "learning_rate": 2.0321538991519894e-05, |
| "loss": 0.1239, |
| "step": 7280 |
| }, |
| { |
| "epoch": 5.24802300503235, |
| "grad_norm": 3.270832885346811, |
| "learning_rate": 2.0209048287098775e-05, |
| "loss": 0.1286, |
| "step": 7300 |
| }, |
| { |
| "epoch": 5.262401150251618, |
| "grad_norm": 3.0199641036649854, |
| "learning_rate": 2.009676084132306e-05, |
| "loss": 0.1319, |
| "step": 7320 |
| }, |
| { |
| "epoch": 5.2767792954708845, |
| "grad_norm": 3.3684801678974967, |
| "learning_rate": 1.998467978456517e-05, |
| "loss": 0.1253, |
| "step": 7340 |
| }, |
| { |
| "epoch": 5.291157440690151, |
| "grad_norm": 3.3671249178043916, |
| "learning_rate": 1.9872808241443746e-05, |
| "loss": 0.1338, |
| "step": 7360 |
| }, |
| { |
| "epoch": 5.305535585909418, |
| "grad_norm": 2.114863221347381, |
| "learning_rate": 1.976114933073662e-05, |
| "loss": 0.112, |
| "step": 7380 |
| }, |
| { |
| "epoch": 5.319913731128684, |
| "grad_norm": 2.5441440040049432, |
| "learning_rate": 1.9649706165293752e-05, |
| "loss": 0.1262, |
| "step": 7400 |
| }, |
| { |
| "epoch": 5.319913731128684, |
| "eval_loss": 0.47789904475212097, |
| "eval_runtime": 95.2624, |
| "eval_samples_per_second": 7.453, |
| "eval_steps_per_second": 1.869, |
| "step": 7400 |
| }, |
| { |
| "epoch": 5.334291876347951, |
| "grad_norm": 2.7965885056997237, |
| "learning_rate": 1.953848185195054e-05, |
| "loss": 0.1154, |
| "step": 7420 |
| }, |
| { |
| "epoch": 5.348670021567218, |
| "grad_norm": 2.789354945166839, |
| "learning_rate": 1.9427479491441187e-05, |
| "loss": 0.1223, |
| "step": 7440 |
| }, |
| { |
| "epoch": 5.363048166786484, |
| "grad_norm": 2.7352578201417757, |
| "learning_rate": 1.9316702178312222e-05, |
| "loss": 0.1218, |
| "step": 7460 |
| }, |
| { |
| "epoch": 5.377426312005751, |
| "grad_norm": 3.3030746857296767, |
| "learning_rate": 1.9206153000836286e-05, |
| "loss": 0.1159, |
| "step": 7480 |
| }, |
| { |
| "epoch": 5.391804457225018, |
| "grad_norm": 3.1497321141106784, |
| "learning_rate": 1.9095835040925993e-05, |
| "loss": 0.1201, |
| "step": 7500 |
| }, |
| { |
| "epoch": 5.406182602444285, |
| "grad_norm": 2.506232679868558, |
| "learning_rate": 1.898575137404802e-05, |
| "loss": 0.1169, |
| "step": 7520 |
| }, |
| { |
| "epoch": 5.420560747663552, |
| "grad_norm": 2.597488885298759, |
| "learning_rate": 1.8875905069137394e-05, |
| "loss": 0.1029, |
| "step": 7540 |
| }, |
| { |
| "epoch": 5.434938892882818, |
| "grad_norm": 3.634018210562274, |
| "learning_rate": 1.8766299188511893e-05, |
| "loss": 0.1162, |
| "step": 7560 |
| }, |
| { |
| "epoch": 5.449317038102085, |
| "grad_norm": 3.190319282933517, |
| "learning_rate": 1.8656936787786722e-05, |
| "loss": 0.1178, |
| "step": 7580 |
| }, |
| { |
| "epoch": 5.463695183321351, |
| "grad_norm": 2.978731316866819, |
| "learning_rate": 1.854782091578928e-05, |
| "loss": 0.118, |
| "step": 7600 |
| }, |
| { |
| "epoch": 5.463695183321351, |
| "eval_loss": 0.4637151062488556, |
| "eval_runtime": 95.0051, |
| "eval_samples_per_second": 7.473, |
| "eval_steps_per_second": 1.874, |
| "step": 7600 |
| }, |
| { |
| "epoch": 5.478073328540618, |
| "grad_norm": 2.5062315663221026, |
| "learning_rate": 1.843895461447422e-05, |
| "loss": 0.1288, |
| "step": 7620 |
| }, |
| { |
| "epoch": 5.492451473759885, |
| "grad_norm": 2.3614369968744735, |
| "learning_rate": 1.8330340918838555e-05, |
| "loss": 0.1193, |
| "step": 7640 |
| }, |
| { |
| "epoch": 5.506829618979152, |
| "grad_norm": 3.032991410827681, |
| "learning_rate": 1.8221982856837178e-05, |
| "loss": 0.1126, |
| "step": 7660 |
| }, |
| { |
| "epoch": 5.521207764198419, |
| "grad_norm": 3.13450270361195, |
| "learning_rate": 1.8113883449298313e-05, |
| "loss": 0.1163, |
| "step": 7680 |
| }, |
| { |
| "epoch": 5.535585909417685, |
| "grad_norm": 2.380694703132617, |
| "learning_rate": 1.8006045709839403e-05, |
| "loss": 0.1121, |
| "step": 7700 |
| }, |
| { |
| "epoch": 5.549964054636952, |
| "grad_norm": 2.8074346598017987, |
| "learning_rate": 1.7898472644783036e-05, |
| "loss": 0.118, |
| "step": 7720 |
| }, |
| { |
| "epoch": 5.564342199856219, |
| "grad_norm": 3.025154606533116, |
| "learning_rate": 1.779116725307315e-05, |
| "loss": 0.114, |
| "step": 7740 |
| }, |
| { |
| "epoch": 5.578720345075485, |
| "grad_norm": 2.8464120898483274, |
| "learning_rate": 1.768413252619144e-05, |
| "loss": 0.0938, |
| "step": 7760 |
| }, |
| { |
| "epoch": 5.593098490294752, |
| "grad_norm": 3.329076081813931, |
| "learning_rate": 1.7577371448073954e-05, |
| "loss": 0.1147, |
| "step": 7780 |
| }, |
| { |
| "epoch": 5.607476635514018, |
| "grad_norm": 3.3855825431806728, |
| "learning_rate": 1.747088699502789e-05, |
| "loss": 0.1132, |
| "step": 7800 |
| }, |
| { |
| "epoch": 5.607476635514018, |
| "eval_loss": 0.4415024518966675, |
| "eval_runtime": 94.9693, |
| "eval_samples_per_second": 7.476, |
| "eval_steps_per_second": 1.874, |
| "step": 7800 |
| }, |
| { |
| "epoch": 5.621854780733285, |
| "grad_norm": 2.280082024927034, |
| "learning_rate": 1.736468213564865e-05, |
| "loss": 0.1006, |
| "step": 7820 |
| }, |
| { |
| "epoch": 5.636232925952552, |
| "grad_norm": 2.7694351541766715, |
| "learning_rate": 1.7258759830737053e-05, |
| "loss": 0.1049, |
| "step": 7840 |
| }, |
| { |
| "epoch": 5.650611071171819, |
| "grad_norm": 2.4638616875501302, |
| "learning_rate": 1.715312303321681e-05, |
| "loss": 0.1005, |
| "step": 7860 |
| }, |
| { |
| "epoch": 5.664989216391086, |
| "grad_norm": 3.348672704671524, |
| "learning_rate": 1.7047774688052214e-05, |
| "loss": 0.0978, |
| "step": 7880 |
| }, |
| { |
| "epoch": 5.679367361610352, |
| "grad_norm": 2.8361860977720914, |
| "learning_rate": 1.6942717732166012e-05, |
| "loss": 0.1131, |
| "step": 7900 |
| }, |
| { |
| "epoch": 5.693745506829619, |
| "grad_norm": 2.4999676935988506, |
| "learning_rate": 1.6837955094357533e-05, |
| "loss": 0.0978, |
| "step": 7920 |
| }, |
| { |
| "epoch": 5.708123652048886, |
| "grad_norm": 2.592222956022343, |
| "learning_rate": 1.6733489695221056e-05, |
| "loss": 0.0933, |
| "step": 7940 |
| }, |
| { |
| "epoch": 5.722501797268152, |
| "grad_norm": 2.5417501039040817, |
| "learning_rate": 1.6629324447064382e-05, |
| "loss": 0.0983, |
| "step": 7960 |
| }, |
| { |
| "epoch": 5.736879942487419, |
| "grad_norm": 2.9569161814117177, |
| "learning_rate": 1.6525462253827635e-05, |
| "loss": 0.111, |
| "step": 7980 |
| }, |
| { |
| "epoch": 5.7512580877066855, |
| "grad_norm": 2.8690761611304563, |
| "learning_rate": 1.6421906011002303e-05, |
| "loss": 0.0878, |
| "step": 8000 |
| }, |
| { |
| "epoch": 5.7512580877066855, |
| "eval_loss": 0.4342060685157776, |
| "eval_runtime": 95.1626, |
| "eval_samples_per_second": 7.461, |
| "eval_steps_per_second": 1.87, |
| "step": 8000 |
| }, |
| { |
| "epoch": 5.765636232925953, |
| "grad_norm": 2.4652579987277106, |
| "learning_rate": 1.6318658605550558e-05, |
| "loss": 0.0899, |
| "step": 8020 |
| }, |
| { |
| "epoch": 5.78001437814522, |
| "grad_norm": 2.3034322695637983, |
| "learning_rate": 1.6215722915824706e-05, |
| "loss": 0.1106, |
| "step": 8040 |
| }, |
| { |
| "epoch": 5.794392523364486, |
| "grad_norm": 3.0714869632720356, |
| "learning_rate": 1.6113101811487e-05, |
| "loss": 0.117, |
| "step": 8060 |
| }, |
| { |
| "epoch": 5.808770668583753, |
| "grad_norm": 2.835102568851034, |
| "learning_rate": 1.60107981534296e-05, |
| "loss": 0.0846, |
| "step": 8080 |
| }, |
| { |
| "epoch": 5.823148813803019, |
| "grad_norm": 2.6019714042610858, |
| "learning_rate": 1.5908814793694836e-05, |
| "loss": 0.1078, |
| "step": 8100 |
| }, |
| { |
| "epoch": 5.837526959022286, |
| "grad_norm": 3.3335326564208057, |
| "learning_rate": 1.5807154575395723e-05, |
| "loss": 0.0971, |
| "step": 8120 |
| }, |
| { |
| "epoch": 5.851905104241553, |
| "grad_norm": 2.8097835934118875, |
| "learning_rate": 1.570582033263664e-05, |
| "loss": 0.0955, |
| "step": 8140 |
| }, |
| { |
| "epoch": 5.866283249460819, |
| "grad_norm": 2.6728932570052493, |
| "learning_rate": 1.5604814890434372e-05, |
| "loss": 0.0916, |
| "step": 8160 |
| }, |
| { |
| "epoch": 5.880661394680086, |
| "grad_norm": 3.126298026998104, |
| "learning_rate": 1.550414106463931e-05, |
| "loss": 0.0936, |
| "step": 8180 |
| }, |
| { |
| "epoch": 5.895039539899353, |
| "grad_norm": 2.7557809744743023, |
| "learning_rate": 1.540380166185701e-05, |
| "loss": 0.0892, |
| "step": 8200 |
| }, |
| { |
| "epoch": 5.895039539899353, |
| "eval_loss": 0.4105762243270874, |
| "eval_runtime": 95.0063, |
| "eval_samples_per_second": 7.473, |
| "eval_steps_per_second": 1.874, |
| "step": 8200 |
| }, |
| { |
| "epoch": 5.90941768511862, |
| "grad_norm": 1.9079860771700334, |
| "learning_rate": 1.5303799479369892e-05, |
| "loss": 0.0904, |
| "step": 8220 |
| }, |
| { |
| "epoch": 5.923795830337887, |
| "grad_norm": 3.018761093125342, |
| "learning_rate": 1.5204137305059285e-05, |
| "loss": 0.0784, |
| "step": 8240 |
| }, |
| { |
| "epoch": 5.938173975557153, |
| "grad_norm": 2.7323274227768466, |
| "learning_rate": 1.5104817917327696e-05, |
| "loss": 0.0869, |
| "step": 8260 |
| }, |
| { |
| "epoch": 5.95255212077642, |
| "grad_norm": 2.557181835107203, |
| "learning_rate": 1.500584408502137e-05, |
| "loss": 0.0874, |
| "step": 8280 |
| }, |
| { |
| "epoch": 5.966930265995686, |
| "grad_norm": 2.9046628608147302, |
| "learning_rate": 1.490721856735307e-05, |
| "loss": 0.0986, |
| "step": 8300 |
| }, |
| { |
| "epoch": 5.981308411214953, |
| "grad_norm": 3.0430167079500055, |
| "learning_rate": 1.4808944113825187e-05, |
| "loss": 0.0944, |
| "step": 8320 |
| }, |
| { |
| "epoch": 5.99568655643422, |
| "grad_norm": 2.688293101397761, |
| "learning_rate": 1.4711023464153062e-05, |
| "loss": 0.0944, |
| "step": 8340 |
| }, |
| { |
| "epoch": 6.010064701653486, |
| "grad_norm": 2.403540313386648, |
| "learning_rate": 1.4613459348188635e-05, |
| "loss": 0.0626, |
| "step": 8360 |
| }, |
| { |
| "epoch": 6.024442846872754, |
| "grad_norm": 1.7893928939003836, |
| "learning_rate": 1.451625448584431e-05, |
| "loss": 0.042, |
| "step": 8380 |
| }, |
| { |
| "epoch": 6.03882099209202, |
| "grad_norm": 1.305324698496704, |
| "learning_rate": 1.4419411587017156e-05, |
| "loss": 0.0406, |
| "step": 8400 |
| }, |
| { |
| "epoch": 6.03882099209202, |
| "eval_loss": 0.4040509760379791, |
| "eval_runtime": 95.0585, |
| "eval_samples_per_second": 7.469, |
| "eval_steps_per_second": 1.873, |
| "step": 8400 |
| }, |
| { |
| "epoch": 6.053199137311287, |
| "grad_norm": 2.0565200444393406, |
| "learning_rate": 1.4322933351513345e-05, |
| "loss": 0.0426, |
| "step": 8420 |
| }, |
| { |
| "epoch": 6.067577282530554, |
| "grad_norm": 1.8144225644755438, |
| "learning_rate": 1.4226822468972884e-05, |
| "loss": 0.0448, |
| "step": 8440 |
| }, |
| { |
| "epoch": 6.08195542774982, |
| "grad_norm": 1.9690181852930055, |
| "learning_rate": 1.413108161879465e-05, |
| "loss": 0.0475, |
| "step": 8460 |
| }, |
| { |
| "epoch": 6.096333572969087, |
| "grad_norm": 2.242285489402514, |
| "learning_rate": 1.4035713470061665e-05, |
| "loss": 0.0517, |
| "step": 8480 |
| }, |
| { |
| "epoch": 6.1107117181883535, |
| "grad_norm": 1.7382682176041153, |
| "learning_rate": 1.3940720681466734e-05, |
| "loss": 0.0531, |
| "step": 8500 |
| }, |
| { |
| "epoch": 6.12508986340762, |
| "grad_norm": 2.040489012914858, |
| "learning_rate": 1.3846105901238263e-05, |
| "loss": 0.044, |
| "step": 8520 |
| }, |
| { |
| "epoch": 6.139468008626887, |
| "grad_norm": 2.564781396939368, |
| "learning_rate": 1.3751871767066488e-05, |
| "loss": 0.0477, |
| "step": 8540 |
| }, |
| { |
| "epoch": 6.153846153846154, |
| "grad_norm": 1.9424649593388863, |
| "learning_rate": 1.36580209060299e-05, |
| "loss": 0.0384, |
| "step": 8560 |
| }, |
| { |
| "epoch": 6.168224299065421, |
| "grad_norm": 1.9743827811413817, |
| "learning_rate": 1.356455593452203e-05, |
| "loss": 0.0489, |
| "step": 8580 |
| }, |
| { |
| "epoch": 6.182602444284687, |
| "grad_norm": 2.3565443666297767, |
| "learning_rate": 1.3471479458178499e-05, |
| "loss": 0.0542, |
| "step": 8600 |
| }, |
| { |
| "epoch": 6.182602444284687, |
| "eval_loss": 0.4080147445201874, |
| "eval_runtime": 94.9121, |
| "eval_samples_per_second": 7.481, |
| "eval_steps_per_second": 1.875, |
| "step": 8600 |
| }, |
| { |
| "epoch": 6.196980589503954, |
| "grad_norm": 1.9059653193210089, |
| "learning_rate": 1.3378794071804379e-05, |
| "loss": 0.0474, |
| "step": 8620 |
| }, |
| { |
| "epoch": 6.211358734723221, |
| "grad_norm": 2.288105600592541, |
| "learning_rate": 1.3286502359301862e-05, |
| "loss": 0.0491, |
| "step": 8640 |
| }, |
| { |
| "epoch": 6.225736879942487, |
| "grad_norm": 1.577712318070443, |
| "learning_rate": 1.31946068935982e-05, |
| "loss": 0.0506, |
| "step": 8660 |
| }, |
| { |
| "epoch": 6.240115025161754, |
| "grad_norm": 1.6142136972859515, |
| "learning_rate": 1.3103110236574031e-05, |
| "loss": 0.0502, |
| "step": 8680 |
| }, |
| { |
| "epoch": 6.2544931703810205, |
| "grad_norm": 2.028384534392485, |
| "learning_rate": 1.3012014938991901e-05, |
| "loss": 0.0535, |
| "step": 8700 |
| }, |
| { |
| "epoch": 6.268871315600288, |
| "grad_norm": 2.0724853034000144, |
| "learning_rate": 1.2921323540425168e-05, |
| "loss": 0.0534, |
| "step": 8720 |
| }, |
| { |
| "epoch": 6.283249460819555, |
| "grad_norm": 2.032233873511292, |
| "learning_rate": 1.283103856918722e-05, |
| "loss": 0.0437, |
| "step": 8740 |
| }, |
| { |
| "epoch": 6.297627606038821, |
| "grad_norm": 1.0581865301271611, |
| "learning_rate": 1.2741162542260988e-05, |
| "loss": 0.0495, |
| "step": 8760 |
| }, |
| { |
| "epoch": 6.312005751258088, |
| "grad_norm": 1.6262102226401502, |
| "learning_rate": 1.2651697965228748e-05, |
| "loss": 0.0434, |
| "step": 8780 |
| }, |
| { |
| "epoch": 6.326383896477354, |
| "grad_norm": 2.2940213673402905, |
| "learning_rate": 1.2562647332202318e-05, |
| "loss": 0.054, |
| "step": 8800 |
| }, |
| { |
| "epoch": 6.326383896477354, |
| "eval_loss": 0.4028961956501007, |
| "eval_runtime": 95.252, |
| "eval_samples_per_second": 7.454, |
| "eval_steps_per_second": 1.869, |
| "step": 8800 |
| }, |
| { |
| "epoch": 6.340762041696621, |
| "grad_norm": 2.2268698305742634, |
| "learning_rate": 1.2474013125753476e-05, |
| "loss": 0.0511, |
| "step": 8820 |
| }, |
| { |
| "epoch": 6.355140186915888, |
| "grad_norm": 1.266932927067602, |
| "learning_rate": 1.2385797816844794e-05, |
| "loss": 0.0508, |
| "step": 8840 |
| }, |
| { |
| "epoch": 6.369518332135154, |
| "grad_norm": 1.76685733894469, |
| "learning_rate": 1.229800386476073e-05, |
| "loss": 0.0463, |
| "step": 8860 |
| }, |
| { |
| "epoch": 6.383896477354421, |
| "grad_norm": 2.6377860948914345, |
| "learning_rate": 1.2210633717039058e-05, |
| "loss": 0.0451, |
| "step": 8880 |
| }, |
| { |
| "epoch": 6.398274622573688, |
| "grad_norm": 1.9332109634225647, |
| "learning_rate": 1.2123689809402657e-05, |
| "loss": 0.054, |
| "step": 8900 |
| }, |
| { |
| "epoch": 6.412652767792955, |
| "grad_norm": 2.394643424907749, |
| "learning_rate": 1.203717456569159e-05, |
| "loss": 0.0497, |
| "step": 8920 |
| }, |
| { |
| "epoch": 6.427030913012222, |
| "grad_norm": 1.3393226122146238, |
| "learning_rate": 1.1951090397795546e-05, |
| "loss": 0.0487, |
| "step": 8940 |
| }, |
| { |
| "epoch": 6.441409058231488, |
| "grad_norm": 1.7991220659514533, |
| "learning_rate": 1.1865439705586595e-05, |
| "loss": 0.0478, |
| "step": 8960 |
| }, |
| { |
| "epoch": 6.455787203450755, |
| "grad_norm": 1.5432278174120821, |
| "learning_rate": 1.1780224876852276e-05, |
| "loss": 0.0546, |
| "step": 8980 |
| }, |
| { |
| "epoch": 6.4701653486700215, |
| "grad_norm": 1.646415229262288, |
| "learning_rate": 1.1695448287229035e-05, |
| "loss": 0.0424, |
| "step": 9000 |
| }, |
| { |
| "epoch": 6.4701653486700215, |
| "eval_loss": 0.3961636424064636, |
| "eval_runtime": 95.6131, |
| "eval_samples_per_second": 7.426, |
| "eval_steps_per_second": 1.862, |
| "step": 9000 |
| }, |
| { |
| "epoch": 6.484543493889288, |
| "grad_norm": 2.1052529823888904, |
| "learning_rate": 1.1611112300136017e-05, |
| "loss": 0.0489, |
| "step": 9020 |
| }, |
| { |
| "epoch": 6.498921639108555, |
| "grad_norm": 2.200144761571743, |
| "learning_rate": 1.1527219266709139e-05, |
| "loss": 0.0458, |
| "step": 9040 |
| }, |
| { |
| "epoch": 6.513299784327822, |
| "grad_norm": 2.3077280833331106, |
| "learning_rate": 1.1443771525735576e-05, |
| "loss": 0.0454, |
| "step": 9060 |
| }, |
| { |
| "epoch": 6.527677929547089, |
| "grad_norm": 2.0193684546512114, |
| "learning_rate": 1.1360771403588542e-05, |
| "loss": 0.048, |
| "step": 9080 |
| }, |
| { |
| "epoch": 6.542056074766355, |
| "grad_norm": 2.083046117268407, |
| "learning_rate": 1.1278221214162447e-05, |
| "loss": 0.0426, |
| "step": 9100 |
| }, |
| { |
| "epoch": 6.556434219985622, |
| "grad_norm": 2.03139384196266, |
| "learning_rate": 1.119612325880838e-05, |
| "loss": 0.0424, |
| "step": 9120 |
| }, |
| { |
| "epoch": 6.570812365204889, |
| "grad_norm": 1.8265385457361556, |
| "learning_rate": 1.1114479826269953e-05, |
| "loss": 0.0444, |
| "step": 9140 |
| }, |
| { |
| "epoch": 6.585190510424155, |
| "grad_norm": 1.8432060989003027, |
| "learning_rate": 1.1033293192619513e-05, |
| "loss": 0.0356, |
| "step": 9160 |
| }, |
| { |
| "epoch": 6.599568655643422, |
| "grad_norm": 2.312564665153471, |
| "learning_rate": 1.0952565621194663e-05, |
| "loss": 0.0421, |
| "step": 9180 |
| }, |
| { |
| "epoch": 6.6139468008626885, |
| "grad_norm": 1.8681935486387307, |
| "learning_rate": 1.0872299362535173e-05, |
| "loss": 0.0384, |
| "step": 9200 |
| }, |
| { |
| "epoch": 6.6139468008626885, |
| "eval_loss": 0.3963512182235718, |
| "eval_runtime": 95.1527, |
| "eval_samples_per_second": 7.462, |
| "eval_steps_per_second": 1.871, |
| "step": 9200 |
| }, |
| { |
| "epoch": 6.628324946081955, |
| "grad_norm": 2.074836002665286, |
| "learning_rate": 1.0792496654320239e-05, |
| "loss": 0.0411, |
| "step": 9220 |
| }, |
| { |
| "epoch": 6.642703091301222, |
| "grad_norm": 2.0901956376878306, |
| "learning_rate": 1.0713159721306121e-05, |
| "loss": 0.0373, |
| "step": 9240 |
| }, |
| { |
| "epoch": 6.657081236520489, |
| "grad_norm": 1.6049808069580456, |
| "learning_rate": 1.0634290775264081e-05, |
| "loss": 0.0397, |
| "step": 9260 |
| }, |
| { |
| "epoch": 6.671459381739756, |
| "grad_norm": 1.7205102620710606, |
| "learning_rate": 1.0555892014918756e-05, |
| "loss": 0.0387, |
| "step": 9280 |
| }, |
| { |
| "epoch": 6.6858375269590224, |
| "grad_norm": 1.284670202192714, |
| "learning_rate": 1.0477965625886846e-05, |
| "loss": 0.0386, |
| "step": 9300 |
| }, |
| { |
| "epoch": 6.700215672178289, |
| "grad_norm": 1.7601605414086903, |
| "learning_rate": 1.0400513780616183e-05, |
| "loss": 0.0361, |
| "step": 9320 |
| }, |
| { |
| "epoch": 6.714593817397556, |
| "grad_norm": 1.508024311857419, |
| "learning_rate": 1.0323538638325184e-05, |
| "loss": 0.0385, |
| "step": 9340 |
| }, |
| { |
| "epoch": 6.728971962616822, |
| "grad_norm": 1.2736928874847193, |
| "learning_rate": 1.024704234494263e-05, |
| "loss": 0.0378, |
| "step": 9360 |
| }, |
| { |
| "epoch": 6.743350107836089, |
| "grad_norm": 2.276762382653448, |
| "learning_rate": 1.0171027033047858e-05, |
| "loss": 0.0418, |
| "step": 9380 |
| }, |
| { |
| "epoch": 6.7577282530553555, |
| "grad_norm": 1.9756333626219476, |
| "learning_rate": 1.0095494821811307e-05, |
| "loss": 0.042, |
| "step": 9400 |
| }, |
| { |
| "epoch": 6.7577282530553555, |
| "eval_loss": 0.3885059654712677, |
| "eval_runtime": 95.0146, |
| "eval_samples_per_second": 7.473, |
| "eval_steps_per_second": 1.873, |
| "step": 9400 |
| }, |
| { |
| "epoch": 6.772106398274623, |
| "grad_norm": 1.6635017813830535, |
| "learning_rate": 1.0020447816935432e-05, |
| "loss": 0.0403, |
| "step": 9420 |
| }, |
| { |
| "epoch": 6.78648454349389, |
| "grad_norm": 2.4347755605676613, |
| "learning_rate": 9.94588811059601e-06, |
| "loss": 0.0345, |
| "step": 9440 |
| }, |
| { |
| "epoch": 6.800862688713156, |
| "grad_norm": 1.5001412711677446, |
| "learning_rate": 9.871817781383807e-06, |
| "loss": 0.0374, |
| "step": 9460 |
| }, |
| { |
| "epoch": 6.815240833932423, |
| "grad_norm": 1.2180198693862079, |
| "learning_rate": 9.798238894246628e-06, |
| "loss": 0.0341, |
| "step": 9480 |
| }, |
| { |
| "epoch": 6.8296189791516895, |
| "grad_norm": 1.9033420390343725, |
| "learning_rate": 9.725153500431772e-06, |
| "loss": 0.0353, |
| "step": 9500 |
| }, |
| { |
| "epoch": 6.843997124370956, |
| "grad_norm": 1.9777690237993284, |
| "learning_rate": 9.652563637428819e-06, |
| "loss": 0.0326, |
| "step": 9520 |
| }, |
| { |
| "epoch": 6.858375269590223, |
| "grad_norm": 1.2065488175251857, |
| "learning_rate": 9.58047132891283e-06, |
| "loss": 0.0312, |
| "step": 9540 |
| }, |
| { |
| "epoch": 6.872753414809489, |
| "grad_norm": 1.4742126064108851, |
| "learning_rate": 9.50887858468796e-06, |
| "loss": 0.0323, |
| "step": 9560 |
| }, |
| { |
| "epoch": 6.887131560028756, |
| "grad_norm": 1.69677437323119, |
| "learning_rate": 9.437787400631392e-06, |
| "loss": 0.0332, |
| "step": 9580 |
| }, |
| { |
| "epoch": 6.9015097052480225, |
| "grad_norm": 2.2511817026968886, |
| "learning_rate": 9.367199758637717e-06, |
| "loss": 0.0392, |
| "step": 9600 |
| }, |
| { |
| "epoch": 6.9015097052480225, |
| "eval_loss": 0.3916057348251343, |
| "eval_runtime": 95.174, |
| "eval_samples_per_second": 7.46, |
| "eval_steps_per_second": 1.87, |
| "step": 9600 |
| }, |
| { |
| "epoch": 6.91588785046729, |
| "grad_norm": 1.8826049956281836, |
| "learning_rate": 9.297117626563687e-06, |
| "loss": 0.0306, |
| "step": 9620 |
| }, |
| { |
| "epoch": 6.930265995686557, |
| "grad_norm": 1.577108574612817, |
| "learning_rate": 9.227542958173327e-06, |
| "loss": 0.0306, |
| "step": 9640 |
| }, |
| { |
| "epoch": 6.944644140905823, |
| "grad_norm": 1.508628096504469, |
| "learning_rate": 9.158477693083497e-06, |
| "loss": 0.0288, |
| "step": 9660 |
| }, |
| { |
| "epoch": 6.95902228612509, |
| "grad_norm": 1.1579037037168847, |
| "learning_rate": 9.08992375670981e-06, |
| "loss": 0.0351, |
| "step": 9680 |
| }, |
| { |
| "epoch": 6.9734004313443565, |
| "grad_norm": 2.28433845291912, |
| "learning_rate": 9.021883060212944e-06, |
| "loss": 0.0343, |
| "step": 9700 |
| }, |
| { |
| "epoch": 6.987778576563623, |
| "grad_norm": 1.6582119852169708, |
| "learning_rate": 8.954357500445376e-06, |
| "loss": 0.0342, |
| "step": 9720 |
| }, |
| { |
| "epoch": 7.00215672178289, |
| "grad_norm": 2.0137432403466153, |
| "learning_rate": 8.887348959898492e-06, |
| "loss": 0.0338, |
| "step": 9740 |
| }, |
| { |
| "epoch": 7.016534867002156, |
| "grad_norm": 1.1323939925336342, |
| "learning_rate": 8.820859306650115e-06, |
| "loss": 0.0205, |
| "step": 9760 |
| }, |
| { |
| "epoch": 7.030913012221424, |
| "grad_norm": 1.9568018303100587, |
| "learning_rate": 8.754890394312411e-06, |
| "loss": 0.0192, |
| "step": 9780 |
| }, |
| { |
| "epoch": 7.0452911574406905, |
| "grad_norm": 1.580803975278475, |
| "learning_rate": 8.689444061980237e-06, |
| "loss": 0.0198, |
| "step": 9800 |
| }, |
| { |
| "epoch": 7.0452911574406905, |
| "eval_loss": 0.3936446011066437, |
| "eval_runtime": 95.1027, |
| "eval_samples_per_second": 7.466, |
| "eval_steps_per_second": 1.872, |
| "step": 9800 |
| }, |
| { |
| "epoch": 7.059669302659957, |
| "grad_norm": 1.269414708765558, |
| "learning_rate": 8.624522134179853e-06, |
| "loss": 0.0208, |
| "step": 9820 |
| }, |
| { |
| "epoch": 7.074047447879224, |
| "grad_norm": 1.1909485029965123, |
| "learning_rate": 8.560126420818065e-06, |
| "loss": 0.0162, |
| "step": 9840 |
| }, |
| { |
| "epoch": 7.08842559309849, |
| "grad_norm": 0.9472456509832501, |
| "learning_rate": 8.496258717131755e-06, |
| "loss": 0.0197, |
| "step": 9860 |
| }, |
| { |
| "epoch": 7.102803738317757, |
| "grad_norm": 1.15937612014724, |
| "learning_rate": 8.432920803637853e-06, |
| "loss": 0.0181, |
| "step": 9880 |
| }, |
| { |
| "epoch": 7.1171818835370235, |
| "grad_norm": 1.2302945840584336, |
| "learning_rate": 8.370114446083686e-06, |
| "loss": 0.0173, |
| "step": 9900 |
| }, |
| { |
| "epoch": 7.13156002875629, |
| "grad_norm": 1.0966008465338752, |
| "learning_rate": 8.307841395397755e-06, |
| "loss": 0.0186, |
| "step": 9920 |
| }, |
| { |
| "epoch": 7.145938173975557, |
| "grad_norm": 1.0474780469073595, |
| "learning_rate": 8.246103387640924e-06, |
| "loss": 0.023, |
| "step": 9940 |
| }, |
| { |
| "epoch": 7.160316319194824, |
| "grad_norm": 1.4160374929009303, |
| "learning_rate": 8.184902143958014e-06, |
| "loss": 0.0191, |
| "step": 9960 |
| }, |
| { |
| "epoch": 7.174694464414091, |
| "grad_norm": 1.6554397458972328, |
| "learning_rate": 8.12423937052984e-06, |
| "loss": 0.0194, |
| "step": 9980 |
| }, |
| { |
| "epoch": 7.1890726096333575, |
| "grad_norm": 1.888593206414827, |
| "learning_rate": 8.064116758525633e-06, |
| "loss": 0.0153, |
| "step": 10000 |
| }, |
| { |
| "epoch": 7.1890726096333575, |
| "eval_loss": 0.40147149562835693, |
| "eval_runtime": 95.303, |
| "eval_samples_per_second": 7.45, |
| "eval_steps_per_second": 1.868, |
| "step": 10000 |
| }, |
| { |
| "epoch": 7.203450754852624, |
| "grad_norm": 0.9118239442800974, |
| "learning_rate": 8.004535984055878e-06, |
| "loss": 0.0169, |
| "step": 10020 |
| }, |
| { |
| "epoch": 7.217828900071891, |
| "grad_norm": 2.0210540104944186, |
| "learning_rate": 7.945498708125612e-06, |
| "loss": 0.0166, |
| "step": 10040 |
| }, |
| { |
| "epoch": 7.232207045291157, |
| "grad_norm": 1.3499252206465502, |
| "learning_rate": 7.88700657658811e-06, |
| "loss": 0.0176, |
| "step": 10060 |
| }, |
| { |
| "epoch": 7.246585190510424, |
| "grad_norm": 1.2359261548111957, |
| "learning_rate": 7.829061220098995e-06, |
| "loss": 0.0189, |
| "step": 10080 |
| }, |
| { |
| "epoch": 7.2609633357296905, |
| "grad_norm": 1.7393774829143234, |
| "learning_rate": 7.771664254070782e-06, |
| "loss": 0.0186, |
| "step": 10100 |
| }, |
| { |
| "epoch": 7.275341480948958, |
| "grad_norm": 1.5390533548289986, |
| "learning_rate": 7.714817278627853e-06, |
| "loss": 0.0182, |
| "step": 10120 |
| }, |
| { |
| "epoch": 7.289719626168225, |
| "grad_norm": 2.3702304034936983, |
| "learning_rate": 7.658521878561828e-06, |
| "loss": 0.0189, |
| "step": 10140 |
| }, |
| { |
| "epoch": 7.304097771387491, |
| "grad_norm": 1.6524039313763748, |
| "learning_rate": 7.602779623287411e-06, |
| "loss": 0.0188, |
| "step": 10160 |
| }, |
| { |
| "epoch": 7.318475916606758, |
| "grad_norm": 1.9409229151245628, |
| "learning_rate": 7.547592066798609e-06, |
| "loss": 0.0203, |
| "step": 10180 |
| }, |
| { |
| "epoch": 7.3328540618260245, |
| "grad_norm": 1.7777378379460687, |
| "learning_rate": 7.4929607476254255e-06, |
| "loss": 0.0169, |
| "step": 10200 |
| }, |
| { |
| "epoch": 7.3328540618260245, |
| "eval_loss": 0.3997386693954468, |
| "eval_runtime": 95.0487, |
| "eval_samples_per_second": 7.47, |
| "eval_steps_per_second": 1.873, |
| "step": 10200 |
| }, |
| { |
| "epoch": 7.347232207045291, |
| "grad_norm": 1.6320188009060124, |
| "learning_rate": 7.43888718879097e-06, |
| "loss": 0.0195, |
| "step": 10220 |
| }, |
| { |
| "epoch": 7.361610352264558, |
| "grad_norm": 1.4169963868246045, |
| "learning_rate": 7.385372897768994e-06, |
| "loss": 0.0183, |
| "step": 10240 |
| }, |
| { |
| "epoch": 7.375988497483824, |
| "grad_norm": 2.4501686205974282, |
| "learning_rate": 7.33241936644186e-06, |
| "loss": 0.02, |
| "step": 10260 |
| }, |
| { |
| "epoch": 7.390366642703091, |
| "grad_norm": 0.8131283011796112, |
| "learning_rate": 7.280028071058962e-06, |
| "loss": 0.0184, |
| "step": 10280 |
| }, |
| { |
| "epoch": 7.404744787922358, |
| "grad_norm": 1.5326273738705627, |
| "learning_rate": 7.228200472195573e-06, |
| "loss": 0.0184, |
| "step": 10300 |
| }, |
| { |
| "epoch": 7.419122933141625, |
| "grad_norm": 1.6650139588585309, |
| "learning_rate": 7.176938014712102e-06, |
| "loss": 0.0176, |
| "step": 10320 |
| }, |
| { |
| "epoch": 7.433501078360892, |
| "grad_norm": 2.058348145844132, |
| "learning_rate": 7.1262421277138435e-06, |
| "loss": 0.0206, |
| "step": 10340 |
| }, |
| { |
| "epoch": 7.447879223580158, |
| "grad_norm": 1.3240541233196081, |
| "learning_rate": 7.0761142245111215e-06, |
| "loss": 0.0161, |
| "step": 10360 |
| }, |
| { |
| "epoch": 7.462257368799425, |
| "grad_norm": 1.500950346915735, |
| "learning_rate": 7.026555702579892e-06, |
| "loss": 0.02, |
| "step": 10380 |
| }, |
| { |
| "epoch": 7.4766355140186915, |
| "grad_norm": 1.609316067517177, |
| "learning_rate": 6.977567943522777e-06, |
| "loss": 0.0184, |
| "step": 10400 |
| }, |
| { |
| "epoch": 7.4766355140186915, |
| "eval_loss": 0.39625024795532227, |
| "eval_runtime": 95.1609, |
| "eval_samples_per_second": 7.461, |
| "eval_steps_per_second": 1.871, |
| "step": 10400 |
| }, |
| { |
| "epoch": 7.491013659237958, |
| "grad_norm": 1.183992892677314, |
| "learning_rate": 6.929152313030561e-06, |
| "loss": 0.0144, |
| "step": 10420 |
| }, |
| { |
| "epoch": 7.505391804457225, |
| "grad_norm": 1.7195803593830006, |
| "learning_rate": 6.8813101608441065e-06, |
| "loss": 0.0194, |
| "step": 10440 |
| }, |
| { |
| "epoch": 7.519769949676491, |
| "grad_norm": 1.126818407417103, |
| "learning_rate": 6.834042820716732e-06, |
| "loss": 0.0184, |
| "step": 10460 |
| }, |
| { |
| "epoch": 7.534148094895759, |
| "grad_norm": 1.276782350410165, |
| "learning_rate": 6.787351610377034e-06, |
| "loss": 0.015, |
| "step": 10480 |
| }, |
| { |
| "epoch": 7.5485262401150255, |
| "grad_norm": 1.0056068452477964, |
| "learning_rate": 6.741237831492137e-06, |
| "loss": 0.0145, |
| "step": 10500 |
| }, |
| { |
| "epoch": 7.562904385334292, |
| "grad_norm": 1.0608691112870612, |
| "learning_rate": 6.695702769631409e-06, |
| "loss": 0.0147, |
| "step": 10520 |
| }, |
| { |
| "epoch": 7.577282530553559, |
| "grad_norm": 1.6567064615333376, |
| "learning_rate": 6.650747694230644e-06, |
| "loss": 0.0143, |
| "step": 10540 |
| }, |
| { |
| "epoch": 7.591660675772825, |
| "grad_norm": 0.9633373509647803, |
| "learning_rate": 6.6063738585566334e-06, |
| "loss": 0.0174, |
| "step": 10560 |
| }, |
| { |
| "epoch": 7.606038820992092, |
| "grad_norm": 1.6724192740016677, |
| "learning_rate": 6.562582499672259e-06, |
| "loss": 0.0148, |
| "step": 10580 |
| }, |
| { |
| "epoch": 7.620416966211359, |
| "grad_norm": 1.4737757756806527, |
| "learning_rate": 6.519374838401997e-06, |
| "loss": 0.0132, |
| "step": 10600 |
| }, |
| { |
| "epoch": 7.620416966211359, |
| "eval_loss": 0.4044211506843567, |
| "eval_runtime": 95.1224, |
| "eval_samples_per_second": 7.464, |
| "eval_steps_per_second": 1.871, |
| "step": 10600 |
| }, |
| { |
| "epoch": 7.634795111430625, |
| "grad_norm": 1.44792121731242, |
| "learning_rate": 6.476752079297877e-06, |
| "loss": 0.0147, |
| "step": 10620 |
| }, |
| { |
| "epoch": 7.649173256649892, |
| "grad_norm": 0.8542174536442156, |
| "learning_rate": 6.434715410605914e-06, |
| "loss": 0.015, |
| "step": 10640 |
| }, |
| { |
| "epoch": 7.663551401869158, |
| "grad_norm": 1.2004595402459013, |
| "learning_rate": 6.393266004232965e-06, |
| "loss": 0.016, |
| "step": 10660 |
| }, |
| { |
| "epoch": 7.677929547088426, |
| "grad_norm": 1.313220137555986, |
| "learning_rate": 6.352405015714072e-06, |
| "loss": 0.0145, |
| "step": 10680 |
| }, |
| { |
| "epoch": 7.6923076923076925, |
| "grad_norm": 0.8959587868362879, |
| "learning_rate": 6.312133584180239e-06, |
| "loss": 0.0134, |
| "step": 10700 |
| }, |
| { |
| "epoch": 7.706685837526959, |
| "grad_norm": 1.3455234829958131, |
| "learning_rate": 6.272452832326696e-06, |
| "loss": 0.0147, |
| "step": 10720 |
| }, |
| { |
| "epoch": 7.721063982746226, |
| "grad_norm": 1.8174610789832277, |
| "learning_rate": 6.233363866381562e-06, |
| "loss": 0.0187, |
| "step": 10740 |
| }, |
| { |
| "epoch": 7.735442127965492, |
| "grad_norm": 0.6828069910344805, |
| "learning_rate": 6.194867776075039e-06, |
| "loss": 0.0145, |
| "step": 10760 |
| }, |
| { |
| "epoch": 7.749820273184759, |
| "grad_norm": 1.3227119421926283, |
| "learning_rate": 6.1569656346090185e-06, |
| "loss": 0.0162, |
| "step": 10780 |
| }, |
| { |
| "epoch": 7.764198418404026, |
| "grad_norm": 1.2902629205133838, |
| "learning_rate": 6.1196584986271636e-06, |
| "loss": 0.0162, |
| "step": 10800 |
| }, |
| { |
| "epoch": 7.764198418404026, |
| "eval_loss": 0.4048987627029419, |
| "eval_runtime": 95.1917, |
| "eval_samples_per_second": 7.459, |
| "eval_steps_per_second": 1.87, |
| "step": 10800 |
| }, |
| { |
| "epoch": 7.778576563623293, |
| "grad_norm": 0.7136241493173114, |
| "learning_rate": 6.082947408185455e-06, |
| "loss": 0.0158, |
| "step": 10820 |
| }, |
| { |
| "epoch": 7.79295470884256, |
| "grad_norm": 0.49866968120190425, |
| "learning_rate": 6.046833386723195e-06, |
| "loss": 0.0159, |
| "step": 10840 |
| }, |
| { |
| "epoch": 7.807332854061826, |
| "grad_norm": 1.3502312726254562, |
| "learning_rate": 6.011317441034468e-06, |
| "loss": 0.0118, |
| "step": 10860 |
| }, |
| { |
| "epoch": 7.821710999281093, |
| "grad_norm": 1.4794974446045654, |
| "learning_rate": 5.976400561240085e-06, |
| "loss": 0.0134, |
| "step": 10880 |
| }, |
| { |
| "epoch": 7.8360891445003595, |
| "grad_norm": 1.2545840858710269, |
| "learning_rate": 5.942083720759971e-06, |
| "loss": 0.0137, |
| "step": 10900 |
| }, |
| { |
| "epoch": 7.850467289719626, |
| "grad_norm": 1.19167981333869, |
| "learning_rate": 5.908367876286038e-06, |
| "loss": 0.0135, |
| "step": 10920 |
| }, |
| { |
| "epoch": 7.864845434938893, |
| "grad_norm": 1.065250267629664, |
| "learning_rate": 5.875253967755501e-06, |
| "loss": 0.0122, |
| "step": 10940 |
| }, |
| { |
| "epoch": 7.879223580158159, |
| "grad_norm": 0.7229967990726404, |
| "learning_rate": 5.842742918324692e-06, |
| "loss": 0.0134, |
| "step": 10960 |
| }, |
| { |
| "epoch": 7.893601725377426, |
| "grad_norm": 1.1617877671550005, |
| "learning_rate": 5.810835634343303e-06, |
| "loss": 0.0122, |
| "step": 10980 |
| }, |
| { |
| "epoch": 7.907979870596693, |
| "grad_norm": 1.4616928888976464, |
| "learning_rate": 5.779533005329131e-06, |
| "loss": 0.0122, |
| "step": 11000 |
| }, |
| { |
| "epoch": 7.907979870596693, |
| "eval_loss": 0.4029586911201477, |
| "eval_runtime": 95.2694, |
| "eval_samples_per_second": 7.453, |
| "eval_steps_per_second": 1.868, |
| "step": 11000 |
| }, |
| { |
| "epoch": 7.92235801581596, |
| "grad_norm": 1.0917614152587496, |
| "learning_rate": 5.748835903943284e-06, |
| "loss": 0.0123, |
| "step": 11020 |
| }, |
| { |
| "epoch": 7.936736161035227, |
| "grad_norm": 0.5451280512121102, |
| "learning_rate": 5.718745185965842e-06, |
| "loss": 0.0128, |
| "step": 11040 |
| }, |
| { |
| "epoch": 7.951114306254493, |
| "grad_norm": 1.356846718427562, |
| "learning_rate": 5.689261690272e-06, |
| "loss": 0.0148, |
| "step": 11060 |
| }, |
| { |
| "epoch": 7.96549245147376, |
| "grad_norm": 1.8573474867415383, |
| "learning_rate": 5.6603862388086966e-06, |
| "loss": 0.0131, |
| "step": 11080 |
| }, |
| { |
| "epoch": 7.979870596693027, |
| "grad_norm": 0.9417837862898252, |
| "learning_rate": 5.632119636571678e-06, |
| "loss": 0.0136, |
| "step": 11100 |
| }, |
| { |
| "epoch": 7.994248741912293, |
| "grad_norm": 1.4310126705230264, |
| "learning_rate": 5.604462671583076e-06, |
| "loss": 0.012, |
| "step": 11120 |
| }, |
| { |
| "epoch": 8.00862688713156, |
| "grad_norm": 1.676187572676756, |
| "learning_rate": 5.577416114869428e-06, |
| "loss": 0.0091, |
| "step": 11140 |
| }, |
| { |
| "epoch": 8.023005032350827, |
| "grad_norm": 0.8937409038970547, |
| "learning_rate": 5.550980720440177e-06, |
| "loss": 0.009, |
| "step": 11160 |
| }, |
| { |
| "epoch": 8.037383177570094, |
| "grad_norm": 1.149688547723477, |
| "learning_rate": 5.525157225266666e-06, |
| "loss": 0.0097, |
| "step": 11180 |
| }, |
| { |
| "epoch": 8.05176132278936, |
| "grad_norm": 0.902795246825878, |
| "learning_rate": 5.499946349261585e-06, |
| "loss": 0.0088, |
| "step": 11200 |
| }, |
| { |
| "epoch": 8.05176132278936, |
| "eval_loss": 0.4079127311706543, |
| "eval_runtime": 95.2052, |
| "eval_samples_per_second": 7.458, |
| "eval_steps_per_second": 1.87, |
| "step": 11200 |
| }, |
| { |
| "epoch": 8.066139468008627, |
| "grad_norm": 1.3152839283646323, |
| "learning_rate": 5.475348795258895e-06, |
| "loss": 0.0077, |
| "step": 11220 |
| }, |
| { |
| "epoch": 8.080517613227894, |
| "grad_norm": 0.516162093883063, |
| "learning_rate": 5.4513652489942525e-06, |
| "loss": 0.0077, |
| "step": 11240 |
| }, |
| { |
| "epoch": 8.09489575844716, |
| "grad_norm": 1.5494413714180322, |
| "learning_rate": 5.427996379085868e-06, |
| "loss": 0.0076, |
| "step": 11260 |
| }, |
| { |
| "epoch": 8.109273903666427, |
| "grad_norm": 0.811835227943074, |
| "learning_rate": 5.405242837015884e-06, |
| "loss": 0.0103, |
| "step": 11280 |
| }, |
| { |
| "epoch": 8.123652048885694, |
| "grad_norm": 0.7766429516281889, |
| "learning_rate": 5.38310525711221e-06, |
| "loss": 0.008, |
| "step": 11300 |
| }, |
| { |
| "epoch": 8.13803019410496, |
| "grad_norm": 1.4067431703535396, |
| "learning_rate": 5.361584256530833e-06, |
| "loss": 0.0077, |
| "step": 11320 |
| }, |
| { |
| "epoch": 8.152408339324227, |
| "grad_norm": 1.291173175444956, |
| "learning_rate": 5.340680435238616e-06, |
| "loss": 0.0079, |
| "step": 11340 |
| }, |
| { |
| "epoch": 8.166786484543493, |
| "grad_norm": 1.349771672968205, |
| "learning_rate": 5.320394375996568e-06, |
| "loss": 0.0096, |
| "step": 11360 |
| }, |
| { |
| "epoch": 8.18116462976276, |
| "grad_norm": 1.0559431628395084, |
| "learning_rate": 5.300726644343609e-06, |
| "loss": 0.0089, |
| "step": 11380 |
| }, |
| { |
| "epoch": 8.195542774982027, |
| "grad_norm": 1.7592306087280705, |
| "learning_rate": 5.2816777885807885e-06, |
| "loss": 0.0097, |
| "step": 11400 |
| }, |
| { |
| "epoch": 8.195542774982027, |
| "eval_loss": 0.41447505354881287, |
| "eval_runtime": 95.0961, |
| "eval_samples_per_second": 7.466, |
| "eval_steps_per_second": 1.872, |
| "step": 11400 |
| }, |
| { |
| "epoch": 8.209920920201293, |
| "grad_norm": 0.5685228696858917, |
| "learning_rate": 5.2632483397560065e-06, |
| "loss": 0.0103, |
| "step": 11420 |
| }, |
| { |
| "epoch": 8.22429906542056, |
| "grad_norm": 1.2788596898252633, |
| "learning_rate": 5.245438811649216e-06, |
| "loss": 0.0086, |
| "step": 11440 |
| }, |
| { |
| "epoch": 8.238677210639828, |
| "grad_norm": 0.6947794845611549, |
| "learning_rate": 5.228249700758091e-06, |
| "loss": 0.0071, |
| "step": 11460 |
| }, |
| { |
| "epoch": 8.253055355859095, |
| "grad_norm": 0.6087586668339728, |
| "learning_rate": 5.211681486284183e-06, |
| "loss": 0.0072, |
| "step": 11480 |
| }, |
| { |
| "epoch": 8.267433501078362, |
| "grad_norm": 1.103810484585872, |
| "learning_rate": 5.195734630119573e-06, |
| "loss": 0.009, |
| "step": 11500 |
| }, |
| { |
| "epoch": 8.281811646297628, |
| "grad_norm": 0.8700111892647913, |
| "learning_rate": 5.180409576833982e-06, |
| "loss": 0.0092, |
| "step": 11520 |
| }, |
| { |
| "epoch": 8.296189791516895, |
| "grad_norm": 1.2281180519183952, |
| "learning_rate": 5.165706753662381e-06, |
| "loss": 0.0099, |
| "step": 11540 |
| }, |
| { |
| "epoch": 8.310567936736161, |
| "grad_norm": 1.0420912684858186, |
| "learning_rate": 5.151626570493093e-06, |
| "loss": 0.0085, |
| "step": 11560 |
| }, |
| { |
| "epoch": 8.324946081955428, |
| "grad_norm": 1.0182028541004855, |
| "learning_rate": 5.138169419856345e-06, |
| "loss": 0.0072, |
| "step": 11580 |
| }, |
| { |
| "epoch": 8.339324227174695, |
| "grad_norm": 0.7367050500271004, |
| "learning_rate": 5.125335676913335e-06, |
| "loss": 0.0073, |
| "step": 11600 |
| }, |
| { |
| "epoch": 8.339324227174695, |
| "eval_loss": 0.41657283902168274, |
| "eval_runtime": 95.1277, |
| "eval_samples_per_second": 7.464, |
| "eval_steps_per_second": 1.871, |
| "step": 11600 |
| }, |
| { |
| "epoch": 8.353702372393961, |
| "grad_norm": 0.45884793559048515, |
| "learning_rate": 5.113125699445789e-06, |
| "loss": 0.0073, |
| "step": 11620 |
| }, |
| { |
| "epoch": 8.368080517613228, |
| "grad_norm": 1.4599632400117197, |
| "learning_rate": 5.1015398278459495e-06, |
| "loss": 0.0089, |
| "step": 11640 |
| }, |
| { |
| "epoch": 8.382458662832494, |
| "grad_norm": 0.6194729001217548, |
| "learning_rate": 5.0905783851071216e-06, |
| "loss": 0.0082, |
| "step": 11660 |
| }, |
| { |
| "epoch": 8.396836808051761, |
| "grad_norm": 0.9431964849978874, |
| "learning_rate": 5.080241676814656e-06, |
| "loss": 0.0067, |
| "step": 11680 |
| }, |
| { |
| "epoch": 8.411214953271028, |
| "grad_norm": 1.6284024601141414, |
| "learning_rate": 5.070529991137416e-06, |
| "loss": 0.007, |
| "step": 11700 |
| }, |
| { |
| "epoch": 8.425593098490294, |
| "grad_norm": 1.0543826842218091, |
| "learning_rate": 5.06144359881977e-06, |
| "loss": 0.007, |
| "step": 11720 |
| }, |
| { |
| "epoch": 8.43997124370956, |
| "grad_norm": 1.0304860278963826, |
| "learning_rate": 5.052982753174023e-06, |
| "loss": 0.0087, |
| "step": 11740 |
| }, |
| { |
| "epoch": 8.454349388928827, |
| "grad_norm": 0.3890943761716781, |
| "learning_rate": 5.045147690073362e-06, |
| "loss": 0.0072, |
| "step": 11760 |
| }, |
| { |
| "epoch": 8.468727534148094, |
| "grad_norm": 0.5658622370613433, |
| "learning_rate": 5.037938627945281e-06, |
| "loss": 0.0082, |
| "step": 11780 |
| }, |
| { |
| "epoch": 8.483105679367362, |
| "grad_norm": 1.3906978664783356, |
| "learning_rate": 5.031355767765493e-06, |
| "loss": 0.008, |
| "step": 11800 |
| }, |
| { |
| "epoch": 8.483105679367362, |
| "eval_loss": 0.4241388142108917, |
| "eval_runtime": 95.2265, |
| "eval_samples_per_second": 7.456, |
| "eval_steps_per_second": 1.869, |
| "step": 11800 |
| }, |
| { |
| "epoch": 8.497483824586629, |
| "grad_norm": 0.9375345966413335, |
| "learning_rate": 5.025399293052321e-06, |
| "loss": 0.0052, |
| "step": 11820 |
| }, |
| { |
| "epoch": 8.511861969805896, |
| "grad_norm": 1.1002252857639097, |
| "learning_rate": 5.02006936986159e-06, |
| "loss": 0.0063, |
| "step": 11840 |
| }, |
| { |
| "epoch": 8.526240115025162, |
| "grad_norm": 0.6208438364734209, |
| "learning_rate": 5.015366146781985e-06, |
| "loss": 0.0095, |
| "step": 11860 |
| }, |
| { |
| "epoch": 8.540618260244429, |
| "grad_norm": 0.8897303749534691, |
| "learning_rate": 5.011289754930926e-06, |
| "loss": 0.0095, |
| "step": 11880 |
| }, |
| { |
| "epoch": 8.554996405463696, |
| "grad_norm": 1.1347852329310684, |
| "learning_rate": 5.0078403079509016e-06, |
| "loss": 0.0078, |
| "step": 11900 |
| }, |
| { |
| "epoch": 8.569374550682962, |
| "grad_norm": 0.6303434992335293, |
| "learning_rate": 5.005017902006298e-06, |
| "loss": 0.01, |
| "step": 11920 |
| }, |
| { |
| "epoch": 8.583752695902229, |
| "grad_norm": 0.8925353812282399, |
| "learning_rate": 5.002822615780729e-06, |
| "loss": 0.0056, |
| "step": 11940 |
| }, |
| { |
| "epoch": 8.598130841121495, |
| "grad_norm": 1.061748591660371, |
| "learning_rate": 5.0012545104748325e-06, |
| "loss": 0.008, |
| "step": 11960 |
| }, |
| { |
| "epoch": 8.612508986340762, |
| "grad_norm": 0.5128451242135531, |
| "learning_rate": 5.000313629804567e-06, |
| "loss": 0.0062, |
| "step": 11980 |
| }, |
| { |
| "epoch": 8.626887131560029, |
| "grad_norm": 0.8684045848139531, |
| "learning_rate": 5e-06, |
| "loss": 0.0075, |
| "step": 12000 |
| }, |
| { |
| "epoch": 8.626887131560029, |
| "eval_loss": 0.42346227169036865, |
| "eval_runtime": 95.1147, |
| "eval_samples_per_second": 7.465, |
| "eval_steps_per_second": 1.871, |
| "step": 12000 |
| }, |
| { |
| "epoch": 8.626887131560029, |
| "step": 12000, |
| "total_flos": 782041448448000.0, |
| "train_loss": 0.04361448099526266, |
| "train_runtime": 28916.5377, |
| "train_samples_per_second": 3.32, |
| "train_steps_per_second": 0.415 |
| } |
| ], |
| "logging_steps": 20, |
| "max_steps": 12000, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 9, |
| "save_steps": 2000, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 782041448448000.0, |
| "train_batch_size": 1, |
| "trial_name": null, |
| "trial_params": null |
| } |
|
|