{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 10.17094017094017, "eval_steps": 25, "global_step": 600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.08547008547008547, "grad_norm": 32.45793533325195, "learning_rate": 5e-06, "loss": 4.3981, "step": 5 }, { "epoch": 0.17094017094017094, "grad_norm": 19.99646759033203, "learning_rate": 1e-05, "loss": 3.809, "step": 10 }, { "epoch": 0.2564102564102564, "grad_norm": 10.912039756774902, "learning_rate": 1.5000000000000002e-05, "loss": 2.9424, "step": 15 }, { "epoch": 0.3418803418803419, "grad_norm": 6.190257549285889, "learning_rate": 2e-05, "loss": 2.2027, "step": 20 }, { "epoch": 0.42735042735042733, "grad_norm": 4.5474066734313965, "learning_rate": 1.9996332862232843e-05, "loss": 1.6336, "step": 25 }, { "epoch": 0.42735042735042733, "eval_loss": 1.4425157308578491, "eval_runtime": 2.8029, "eval_samples_per_second": 37.105, "eval_steps_per_second": 9.276, "step": 25 }, { "epoch": 0.5128205128205128, "grad_norm": 3.2563352584838867, "learning_rate": 1.998533413851124e-05, "loss": 1.2988, "step": 30 }, { "epoch": 0.5982905982905983, "grad_norm": 2.3913843631744385, "learning_rate": 1.996701189560223e-05, "loss": 1.0025, "step": 35 }, { "epoch": 0.6837606837606838, "grad_norm": 1.783568263053894, "learning_rate": 1.9941379571543597e-05, "loss": 0.8304, "step": 40 }, { "epoch": 0.7692307692307693, "grad_norm": 1.4403300285339355, "learning_rate": 1.990845596578807e-05, "loss": 0.7449, "step": 45 }, { "epoch": 0.8547008547008547, "grad_norm": 1.1698269844055176, "learning_rate": 1.9868265225415263e-05, "loss": 0.6516, "step": 50 }, { "epoch": 0.8547008547008547, "eval_loss": 0.624435305595398, "eval_runtime": 2.8155, "eval_samples_per_second": 36.938, "eval_steps_per_second": 9.235, "step": 50 }, { "epoch": 0.9401709401709402, "grad_norm": 1.210651159286499, "learning_rate": 1.982083682742156e-05, "loss": 0.5538, "step": 55 }, { "epoch": 1.017094017094017, "grad_norm": 1.0749378204345703, "learning_rate": 1.976620555710087e-05, "loss": 0.5287, "step": 60 }, { "epoch": 1.1025641025641026, "grad_norm": 0.9600836634635925, "learning_rate": 1.9704411482532116e-05, "loss": 0.4221, "step": 65 }, { "epoch": 1.188034188034188, "grad_norm": 0.8946885466575623, "learning_rate": 1.963549992519223e-05, "loss": 0.4017, "step": 70 }, { "epoch": 1.2735042735042734, "grad_norm": 1.0423543453216553, "learning_rate": 1.955952142671612e-05, "loss": 0.3492, "step": 75 }, { "epoch": 1.2735042735042734, "eval_loss": 0.3717593550682068, "eval_runtime": 2.8255, "eval_samples_per_second": 36.808, "eval_steps_per_second": 9.202, "step": 75 }, { "epoch": 1.358974358974359, "grad_norm": 1.1442183256149292, "learning_rate": 1.9476531711828027e-05, "loss": 0.3272, "step": 80 }, { "epoch": 1.4444444444444444, "grad_norm": 1.044005036354065, "learning_rate": 1.9386591647471508e-05, "loss": 0.3404, "step": 85 }, { "epoch": 1.5299145299145298, "grad_norm": 0.9060975909233093, "learning_rate": 1.9289767198167918e-05, "loss": 0.2949, "step": 90 }, { "epoch": 1.6153846153846154, "grad_norm": 0.8754892349243164, "learning_rate": 1.918612937763622e-05, "loss": 0.2891, "step": 95 }, { "epoch": 1.7008547008547008, "grad_norm": 0.800922155380249, "learning_rate": 1.9075754196709574e-05, "loss": 0.2856, "step": 100 }, { "epoch": 1.7008547008547008, "eval_loss": 0.2841126620769501, "eval_runtime": 2.8509, "eval_samples_per_second": 36.48, "eval_steps_per_second": 9.12, "step": 100 }, { "epoch": 1.7863247863247862, "grad_norm": 0.5995078086853027, "learning_rate": 1.8958722607586883e-05, "loss": 0.2723, "step": 105 }, { "epoch": 1.8717948717948718, "grad_norm": 0.853714108467102, "learning_rate": 1.883512044446023e-05, "loss": 0.2603, "step": 110 }, { "epoch": 1.9572649572649574, "grad_norm": 0.7114328145980835, "learning_rate": 1.8705038360561724e-05, "loss": 0.242, "step": 115 }, { "epoch": 2.034188034188034, "grad_norm": 0.6991967558860779, "learning_rate": 1.8568571761675893e-05, "loss": 0.2516, "step": 120 }, { "epoch": 2.1196581196581197, "grad_norm": 0.6714396476745605, "learning_rate": 1.8425820736166492e-05, "loss": 0.2498, "step": 125 }, { "epoch": 2.1196581196581197, "eval_loss": 0.24386820197105408, "eval_runtime": 2.863, "eval_samples_per_second": 36.325, "eval_steps_per_second": 9.081, "step": 125 }, { "epoch": 2.2051282051282053, "grad_norm": 0.8048965930938721, "learning_rate": 1.827688998156891e-05, "loss": 0.2227, "step": 130 }, { "epoch": 2.2905982905982905, "grad_norm": 0.6397609710693359, "learning_rate": 1.8121888727802113e-05, "loss": 0.2229, "step": 135 }, { "epoch": 2.376068376068376, "grad_norm": 0.7434533834457397, "learning_rate": 1.796093065705644e-05, "loss": 0.2352, "step": 140 }, { "epoch": 2.4615384615384617, "grad_norm": 0.8520599603652954, "learning_rate": 1.7794133820415916e-05, "loss": 0.2134, "step": 145 }, { "epoch": 2.547008547008547, "grad_norm": 0.6550760269165039, "learning_rate": 1.7621620551276366e-05, "loss": 0.2088, "step": 150 }, { "epoch": 2.547008547008547, "eval_loss": 0.22272011637687683, "eval_runtime": 2.8848, "eval_samples_per_second": 36.051, "eval_steps_per_second": 9.013, "step": 150 }, { "epoch": 2.6324786324786325, "grad_norm": 0.6515322923660278, "learning_rate": 1.7443517375622706e-05, "loss": 0.2042, "step": 155 }, { "epoch": 2.717948717948718, "grad_norm": 0.7250323295593262, "learning_rate": 1.725995491923131e-05, "loss": 0.1992, "step": 160 }, { "epoch": 2.8034188034188032, "grad_norm": 0.6800098419189453, "learning_rate": 1.7071067811865477e-05, "loss": 0.1989, "step": 165 }, { "epoch": 2.888888888888889, "grad_norm": 0.6262602806091309, "learning_rate": 1.6876994588534234e-05, "loss": 0.181, "step": 170 }, { "epoch": 2.9743589743589745, "grad_norm": 0.6131544709205627, "learning_rate": 1.6677877587886956e-05, "loss": 0.1943, "step": 175 }, { "epoch": 2.9743589743589745, "eval_loss": 0.21058152616024017, "eval_runtime": 2.8948, "eval_samples_per_second": 35.926, "eval_steps_per_second": 8.982, "step": 175 }, { "epoch": 3.051282051282051, "grad_norm": 0.8641460537910461, "learning_rate": 1.647386284781828e-05, "loss": 0.2097, "step": 180 }, { "epoch": 3.1367521367521367, "grad_norm": 0.6487774848937988, "learning_rate": 1.6265099998359868e-05, "loss": 0.1946, "step": 185 }, { "epoch": 3.2222222222222223, "grad_norm": 0.46343570947647095, "learning_rate": 1.6051742151937655e-05, "loss": 0.1822, "step": 190 }, { "epoch": 3.3076923076923075, "grad_norm": 0.6039112210273743, "learning_rate": 1.5833945791074943e-05, "loss": 0.1835, "step": 195 }, { "epoch": 3.393162393162393, "grad_norm": 0.6336061954498291, "learning_rate": 1.5611870653623826e-05, "loss": 0.1809, "step": 200 }, { "epoch": 3.393162393162393, "eval_loss": 0.19848760962486267, "eval_runtime": 2.9181, "eval_samples_per_second": 35.639, "eval_steps_per_second": 8.91, "step": 200 }, { "epoch": 3.4786324786324787, "grad_norm": 0.5978764891624451, "learning_rate": 1.5385679615609045e-05, "loss": 0.1861, "step": 205 }, { "epoch": 3.564102564102564, "grad_norm": 0.6086897253990173, "learning_rate": 1.515553857177022e-05, "loss": 0.1848, "step": 210 }, { "epoch": 3.6495726495726495, "grad_norm": 0.6077982783317566, "learning_rate": 1.4921616313890073e-05, "loss": 0.1705, "step": 215 }, { "epoch": 3.735042735042735, "grad_norm": 0.5378933548927307, "learning_rate": 1.4684084406997903e-05, "loss": 0.1905, "step": 220 }, { "epoch": 3.8205128205128203, "grad_norm": 0.6793361306190491, "learning_rate": 1.4443117063539039e-05, "loss": 0.1801, "step": 225 }, { "epoch": 3.8205128205128203, "eval_loss": 0.19124998152256012, "eval_runtime": 2.947, "eval_samples_per_second": 35.29, "eval_steps_per_second": 8.823, "step": 225 }, { "epoch": 3.905982905982906, "grad_norm": 0.6194397807121277, "learning_rate": 1.4198891015602648e-05, "loss": 0.1766, "step": 230 }, { "epoch": 3.9914529914529915, "grad_norm": 0.5509461760520935, "learning_rate": 1.3951585385301557e-05, "loss": 0.1882, "step": 235 }, { "epoch": 4.068376068376068, "grad_norm": 0.7895352840423584, "learning_rate": 1.3701381553399147e-05, "loss": 0.1846, "step": 240 }, { "epoch": 4.153846153846154, "grad_norm": 0.6293951272964478, "learning_rate": 1.3448463026279706e-05, "loss": 0.1788, "step": 245 }, { "epoch": 4.239316239316239, "grad_norm": 0.5566557049751282, "learning_rate": 1.31930153013598e-05, "loss": 0.159, "step": 250 }, { "epoch": 4.239316239316239, "eval_loss": 0.1850532740354538, "eval_runtime": 2.9696, "eval_samples_per_second": 35.021, "eval_steps_per_second": 8.755, "step": 250 }, { "epoch": 4.3247863247863245, "grad_norm": 0.5719231367111206, "learning_rate": 1.2935225731039349e-05, "loss": 0.1846, "step": 255 }, { "epoch": 4.410256410256411, "grad_norm": 0.5705691576004028, "learning_rate": 1.2675283385292212e-05, "loss": 0.1711, "step": 260 }, { "epoch": 4.495726495726496, "grad_norm": 0.6631448268890381, "learning_rate": 1.2413378912997058e-05, "loss": 0.1633, "step": 265 }, { "epoch": 4.581196581196581, "grad_norm": 0.4862598478794098, "learning_rate": 1.2149704402110243e-05, "loss": 0.167, "step": 270 }, { "epoch": 4.666666666666667, "grad_norm": 0.5664910674095154, "learning_rate": 1.1884453238783185e-05, "loss": 0.1703, "step": 275 }, { "epoch": 4.666666666666667, "eval_loss": 0.1804552972316742, "eval_runtime": 2.9573, "eval_samples_per_second": 35.168, "eval_steps_per_second": 8.792, "step": 275 }, { "epoch": 4.752136752136752, "grad_norm": 0.5878341197967529, "learning_rate": 1.161781996552765e-05, "loss": 0.1742, "step": 280 }, { "epoch": 4.837606837606837, "grad_norm": 0.6206562519073486, "learning_rate": 1.1350000138532902e-05, "loss": 0.171, "step": 285 }, { "epoch": 4.923076923076923, "grad_norm": 0.48724639415740967, "learning_rate": 1.1081190184239418e-05, "loss": 0.1621, "step": 290 }, { "epoch": 5.0, "grad_norm": 0.9257501363754272, "learning_rate": 1.0811587255274313e-05, "loss": 0.1698, "step": 295 }, { "epoch": 5.085470085470085, "grad_norm": 0.5715455412864685, "learning_rate": 1.0541389085854177e-05, "loss": 0.1696, "step": 300 }, { "epoch": 5.085470085470085, "eval_loss": 0.1769082248210907, "eval_runtime": 2.9677, "eval_samples_per_second": 35.043, "eval_steps_per_second": 8.761, "step": 300 }, { "epoch": 5.170940170940171, "grad_norm": 0.4863035976886749, "learning_rate": 1.0270793846761347e-05, "loss": 0.158, "step": 305 }, { "epoch": 5.256410256410256, "grad_norm": 0.39815396070480347, "learning_rate": 1e-05, "loss": 0.1557, "step": 310 }, { "epoch": 5.3418803418803416, "grad_norm": 0.560039222240448, "learning_rate": 9.729206153238658e-06, "loss": 0.1731, "step": 315 }, { "epoch": 5.427350427350428, "grad_norm": 0.4191257953643799, "learning_rate": 9.458610914145826e-06, "loss": 0.1565, "step": 320 }, { "epoch": 5.512820512820513, "grad_norm": 0.7958483099937439, "learning_rate": 9.18841274472569e-06, "loss": 0.1673, "step": 325 }, { "epoch": 5.512820512820513, "eval_loss": 0.1737748235464096, "eval_runtime": 2.9693, "eval_samples_per_second": 35.025, "eval_steps_per_second": 8.756, "step": 325 }, { "epoch": 5.598290598290598, "grad_norm": 0.46690189838409424, "learning_rate": 8.918809815760585e-06, "loss": 0.1623, "step": 330 }, { "epoch": 5.683760683760684, "grad_norm": 0.553860068321228, "learning_rate": 8.6499998614671e-06, "loss": 0.1592, "step": 335 }, { "epoch": 5.769230769230769, "grad_norm": 0.38637080788612366, "learning_rate": 8.382180034472353e-06, "loss": 0.1571, "step": 340 }, { "epoch": 5.854700854700854, "grad_norm": 0.5259572267532349, "learning_rate": 8.115546761216822e-06, "loss": 0.1703, "step": 345 }, { "epoch": 5.94017094017094, "grad_norm": 0.5691083073616028, "learning_rate": 7.85029559788976e-06, "loss": 0.1644, "step": 350 }, { "epoch": 5.94017094017094, "eval_loss": 0.1712963730096817, "eval_runtime": 2.9593, "eval_samples_per_second": 35.144, "eval_steps_per_second": 8.786, "step": 350 }, { "epoch": 6.017094017094017, "grad_norm": 0.5517910122871399, "learning_rate": 7.586621087002945e-06, "loss": 0.1697, "step": 355 }, { "epoch": 6.102564102564102, "grad_norm": 0.49558934569358826, "learning_rate": 7.324716614707794e-06, "loss": 0.1576, "step": 360 }, { "epoch": 6.188034188034188, "grad_norm": 0.5838133096694946, "learning_rate": 7.064774268960654e-06, "loss": 0.1658, "step": 365 }, { "epoch": 6.273504273504273, "grad_norm": 0.48898056149482727, "learning_rate": 6.806984698640202e-06, "loss": 0.1635, "step": 370 }, { "epoch": 6.358974358974359, "grad_norm": 0.5615982413291931, "learning_rate": 6.551536973720298e-06, "loss": 0.1524, "step": 375 }, { "epoch": 6.358974358974359, "eval_loss": 0.17055413126945496, "eval_runtime": 2.9555, "eval_samples_per_second": 35.188, "eval_steps_per_second": 8.797, "step": 375 }, { "epoch": 6.444444444444445, "grad_norm": 0.4189331829547882, "learning_rate": 6.298618446600856e-06, "loss": 0.1621, "step": 380 }, { "epoch": 6.52991452991453, "grad_norm": 0.6043363809585571, "learning_rate": 6.0484146146984475e-06, "loss": 0.1656, "step": 385 }, { "epoch": 6.615384615384615, "grad_norm": 0.5410465598106384, "learning_rate": 5.801108984397355e-06, "loss": 0.1716, "step": 390 }, { "epoch": 6.700854700854701, "grad_norm": 0.49519532918930054, "learning_rate": 5.556882936460966e-06, "loss": 0.1632, "step": 395 }, { "epoch": 6.786324786324786, "grad_norm": 0.5701279640197754, "learning_rate": 5.3159155930021e-06, "loss": 0.1546, "step": 400 }, { "epoch": 6.786324786324786, "eval_loss": 0.16907724738121033, "eval_runtime": 2.9509, "eval_samples_per_second": 35.244, "eval_steps_per_second": 8.811, "step": 400 }, { "epoch": 6.871794871794872, "grad_norm": 0.6066329479217529, "learning_rate": 5.078383686109927e-06, "loss": 0.1508, "step": 405 }, { "epoch": 6.957264957264957, "grad_norm": 0.43724945187568665, "learning_rate": 4.844461428229782e-06, "loss": 0.1596, "step": 410 }, { "epoch": 7.034188034188034, "grad_norm": 0.3817615509033203, "learning_rate": 4.614320384390959e-06, "loss": 0.1442, "step": 415 }, { "epoch": 7.119658119658119, "grad_norm": 0.4554646611213684, "learning_rate": 4.388129346376177e-06, "loss": 0.1582, "step": 420 }, { "epoch": 7.205128205128205, "grad_norm": 0.4925171136856079, "learning_rate": 4.16605420892506e-06, "loss": 0.1592, "step": 425 }, { "epoch": 7.205128205128205, "eval_loss": 0.16841334104537964, "eval_runtime": 2.9605, "eval_samples_per_second": 35.13, "eval_steps_per_second": 8.782, "step": 425 }, { "epoch": 7.2905982905982905, "grad_norm": 0.5007475018501282, "learning_rate": 3.948257848062351e-06, "loss": 0.1621, "step": 430 }, { "epoch": 7.3760683760683765, "grad_norm": 0.5269553065299988, "learning_rate": 3.734900001640135e-06, "loss": 0.148, "step": 435 }, { "epoch": 7.461538461538462, "grad_norm": 0.5234923362731934, "learning_rate": 3.5261371521817247e-06, "loss": 0.1606, "step": 440 }, { "epoch": 7.547008547008547, "grad_norm": 0.4035094976425171, "learning_rate": 3.322122412113047e-06, "loss": 0.1556, "step": 445 }, { "epoch": 7.632478632478632, "grad_norm": 0.45483818650245667, "learning_rate": 3.123005411465766e-06, "loss": 0.1598, "step": 450 }, { "epoch": 7.632478632478632, "eval_loss": 0.16744433343410492, "eval_runtime": 2.9512, "eval_samples_per_second": 35.24, "eval_steps_per_second": 8.81, "step": 450 }, { "epoch": 7.717948717948718, "grad_norm": 0.45279672741889954, "learning_rate": 2.9289321881345257e-06, "loss": 0.1495, "step": 455 }, { "epoch": 7.803418803418803, "grad_norm": 0.5406824946403503, "learning_rate": 2.740045080768694e-06, "loss": 0.1601, "step": 460 }, { "epoch": 7.888888888888889, "grad_norm": 0.5257072448730469, "learning_rate": 2.5564826243772965e-06, "loss": 0.1593, "step": 465 }, { "epoch": 7.9743589743589745, "grad_norm": 0.5503476858139038, "learning_rate": 2.3783794487236367e-06, "loss": 0.16, "step": 470 }, { "epoch": 8.051282051282051, "grad_norm": 0.5466392040252686, "learning_rate": 2.205866179584084e-06, "loss": 0.1615, "step": 475 }, { "epoch": 8.051282051282051, "eval_loss": 0.16703671216964722, "eval_runtime": 2.9533, "eval_samples_per_second": 35.215, "eval_steps_per_second": 8.804, "step": 475 }, { "epoch": 8.136752136752136, "grad_norm": 0.5129823088645935, "learning_rate": 2.0390693429435626e-06, "loss": 0.1584, "step": 480 }, { "epoch": 8.222222222222221, "grad_norm": 0.6289273500442505, "learning_rate": 1.87811127219789e-06, "loss": 0.1592, "step": 485 }, { "epoch": 8.307692307692308, "grad_norm": 0.44773322343826294, "learning_rate": 1.7231100184310955e-06, "loss": 0.152, "step": 490 }, { "epoch": 8.393162393162394, "grad_norm": 0.44763079285621643, "learning_rate": 1.5741792638335096e-06, "loss": 0.159, "step": 495 }, { "epoch": 8.478632478632479, "grad_norm": 0.5403873920440674, "learning_rate": 1.4314282383241097e-06, "loss": 0.1471, "step": 500 }, { "epoch": 8.478632478632479, "eval_loss": 0.16682063043117523, "eval_runtime": 2.9444, "eval_samples_per_second": 35.321, "eval_steps_per_second": 8.83, "step": 500 }, { "epoch": 8.564102564102564, "grad_norm": 0.4975205361843109, "learning_rate": 1.2949616394382802e-06, "loss": 0.1546, "step": 505 }, { "epoch": 8.649572649572649, "grad_norm": 0.4314480721950531, "learning_rate": 1.1648795555397719e-06, "loss": 0.1495, "step": 510 }, { "epoch": 8.735042735042736, "grad_norm": 0.4307732880115509, "learning_rate": 1.0412773924131202e-06, "loss": 0.1516, "step": 515 }, { "epoch": 8.820512820512821, "grad_norm": 0.7880775332450867, "learning_rate": 9.242458032904311e-07, "loss": 0.1691, "step": 520 }, { "epoch": 8.905982905982906, "grad_norm": 0.3903237283229828, "learning_rate": 8.138706223637827e-07, "loss": 0.1564, "step": 525 }, { "epoch": 8.905982905982906, "eval_loss": 0.16660818457603455, "eval_runtime": 2.9675, "eval_samples_per_second": 35.047, "eval_steps_per_second": 8.762, "step": 525 }, { "epoch": 8.991452991452991, "grad_norm": 0.5438657999038696, "learning_rate": 7.102328018320859e-07, "loss": 0.1605, "step": 530 }, { "epoch": 9.068376068376068, "grad_norm": 0.3905521333217621, "learning_rate": 6.13408352528495e-07, "loss": 0.1579, "step": 535 }, { "epoch": 9.153846153846153, "grad_norm": 0.5689241886138916, "learning_rate": 5.234682881719766e-07, "loss": 0.1571, "step": 540 }, { "epoch": 9.239316239316238, "grad_norm": 0.5273411273956299, "learning_rate": 4.4047857328388457e-07, "loss": 0.151, "step": 545 }, { "epoch": 9.324786324786325, "grad_norm": 0.6550098061561584, "learning_rate": 3.645000748077709e-07, "loss": 0.1557, "step": 550 }, { "epoch": 9.324786324786325, "eval_loss": 0.16643913090229034, "eval_runtime": 2.9714, "eval_samples_per_second": 35.001, "eval_steps_per_second": 8.75, "step": 550 }, { "epoch": 9.41025641025641, "grad_norm": 0.5939171314239502, "learning_rate": 2.955885174678852e-07, "loss": 0.1542, "step": 555 }, { "epoch": 9.495726495726496, "grad_norm": 0.448629230260849, "learning_rate": 2.3379444289913344e-07, "loss": 0.1614, "step": 560 }, { "epoch": 9.581196581196581, "grad_norm": 0.47190573811531067, "learning_rate": 1.791631725784404e-07, "loss": 0.1453, "step": 565 }, { "epoch": 9.666666666666666, "grad_norm": 0.519051730632782, "learning_rate": 1.317347745847386e-07, "loss": 0.1565, "step": 570 }, { "epoch": 9.752136752136753, "grad_norm": 0.46918535232543945, "learning_rate": 9.154403421193226e-08, "loss": 0.164, "step": 575 }, { "epoch": 9.752136752136753, "eval_loss": 0.16634653508663177, "eval_runtime": 2.9178, "eval_samples_per_second": 35.643, "eval_steps_per_second": 8.911, "step": 575 }, { "epoch": 9.837606837606838, "grad_norm": 0.3677942752838135, "learning_rate": 5.862042845640403e-08, "loss": 0.159, "step": 580 }, { "epoch": 9.923076923076923, "grad_norm": 0.5101422667503357, "learning_rate": 3.2988104397773115e-08, "loss": 0.1554, "step": 585 }, { "epoch": 10.0, "grad_norm": 0.49817174673080444, "learning_rate": 1.4665861488761813e-08, "loss": 0.1596, "step": 590 }, { "epoch": 10.085470085470085, "grad_norm": 0.3656047582626343, "learning_rate": 3.6671377671604337e-09, "loss": 0.1528, "step": 595 }, { "epoch": 10.17094017094017, "grad_norm": 0.5075839161872864, "learning_rate": 0.0, "loss": 0.1591, "step": 600 }, { "epoch": 10.17094017094017, "eval_loss": 0.1664964258670807, "eval_runtime": 2.9425, "eval_samples_per_second": 35.345, "eval_steps_per_second": 8.836, "step": 600 } ], "logging_steps": 5, "max_steps": 600, "num_input_tokens_seen": 0, "num_train_epochs": 11, "save_steps": 25, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 9098325346882560.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }