{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.8, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.008, "grad_norm": 166.17074584960938, "learning_rate": 2.6666666666666667e-05, "loss": 11.9701, "step": 20 }, { "epoch": 0.016, "grad_norm": 79.01113891601562, "learning_rate": 5.333333333333333e-05, "loss": 9.669, "step": 40 }, { "epoch": 0.024, "grad_norm": 85.70152282714844, "learning_rate": 8e-05, "loss": 6.905, "step": 60 }, { "epoch": 0.032, "grad_norm": 106.15095520019531, "learning_rate": 9.999895105006994e-05, "loss": 3.7532, "step": 80 }, { "epoch": 0.04, "grad_norm": 138.3174285888672, "learning_rate": 9.997377845227576e-05, "loss": 4.0354, "step": 100 }, { "epoch": 0.048, "grad_norm": 57.63945770263672, "learning_rate": 9.991505881949837e-05, "loss": 3.5036, "step": 120 }, { "epoch": 0.056, "grad_norm": 163.03395080566406, "learning_rate": 9.982283156980132e-05, "loss": 2.5848, "step": 140 }, { "epoch": 0.064, "grad_norm": 63.67021942138672, "learning_rate": 9.96971586146684e-05, "loss": 1.9652, "step": 160 }, { "epoch": 0.072, "grad_norm": 79.90151977539062, "learning_rate": 9.953812431744276e-05, "loss": 1.6136, "step": 180 }, { "epoch": 0.08, "grad_norm": 69.72734069824219, "learning_rate": 9.934583543669453e-05, "loss": 1.4255, "step": 200 }, { "epoch": 0.088, "grad_norm": 114.95301055908203, "learning_rate": 9.912042105455463e-05, "loss": 1.1624, "step": 220 }, { "epoch": 0.096, "grad_norm": 136.07012939453125, "learning_rate": 9.886203249006265e-05, "loss": 1.7055, "step": 240 }, { "epoch": 0.104, "grad_norm": 68.01107025146484, "learning_rate": 9.857084319758772e-05, "loss": 1.9069, "step": 260 }, { "epoch": 0.112, "grad_norm": 55.16877746582031, "learning_rate": 9.824704865038968e-05, "loss": 1.6613, "step": 280 }, { "epoch": 0.12, "grad_norm": 148.36671447753906, "learning_rate": 9.789086620939936e-05, "loss": 1.0507, "step": 300 }, { "epoch": 0.128, "grad_norm": 45.765541076660156, "learning_rate": 9.75025349773058e-05, "loss": 1.076, "step": 320 }, { "epoch": 0.136, "grad_norm": 29.589893341064453, "learning_rate": 9.708231563804828e-05, "loss": 1.1486, "step": 340 }, { "epoch": 0.144, "grad_norm": 101.57962799072266, "learning_rate": 9.663049028182111e-05, "loss": 0.9937, "step": 360 }, { "epoch": 0.152, "grad_norm": 67.2091293334961, "learning_rate": 9.61473622157086e-05, "loss": 0.7819, "step": 380 }, { "epoch": 0.16, "grad_norm": 142.623291015625, "learning_rate": 9.563325576007701e-05, "loss": 1.1036, "step": 400 }, { "epoch": 0.168, "grad_norm": 99.56015014648438, "learning_rate": 9.508851603086093e-05, "loss": 0.9757, "step": 420 }, { "epoch": 0.176, "grad_norm": 76.89378356933594, "learning_rate": 9.45135087078892e-05, "loss": 0.8925, "step": 440 }, { "epoch": 0.184, "grad_norm": 61.822608947753906, "learning_rate": 9.390861978940686e-05, "loss": 0.9001, "step": 460 }, { "epoch": 0.192, "grad_norm": 97.94097900390625, "learning_rate": 9.327425533295724e-05, "loss": 0.9383, "step": 480 }, { "epoch": 0.2, "grad_norm": 94.21862030029297, "learning_rate": 9.261084118279847e-05, "loss": 1.1101, "step": 500 }, { "epoch": 0.208, "grad_norm": 99.49618530273438, "learning_rate": 9.191882268403743e-05, "loss": 0.8639, "step": 520 }, { "epoch": 0.216, "grad_norm": 91.68159484863281, "learning_rate": 9.119866438367263e-05, "loss": 1.1308, "step": 540 }, { "epoch": 0.224, "grad_norm": 88.58736419677734, "learning_rate": 9.045084971874738e-05, "loss": 1.0318, "step": 560 }, { "epoch": 0.232, "grad_norm": 74.4514389038086, "learning_rate": 8.967588069182185e-05, "loss": 0.7682, "step": 580 }, { "epoch": 0.24, "grad_norm": 132.3037872314453, "learning_rate": 8.887427753398248e-05, "loss": 1.0116, "step": 600 }, { "epoch": 0.248, "grad_norm": 93.67770385742188, "learning_rate": 8.804657835561456e-05, "loss": 0.8581, "step": 620 }, { "epoch": 0.256, "grad_norm": 167.17413330078125, "learning_rate": 8.719333878517273e-05, "loss": 0.8944, "step": 640 }, { "epoch": 0.264, "grad_norm": 80.31649017333984, "learning_rate": 8.631513159619151e-05, "loss": 1.1003, "step": 660 }, { "epoch": 0.272, "grad_norm": 91.23484802246094, "learning_rate": 8.541254632278665e-05, "loss": 0.5505, "step": 680 }, { "epoch": 0.28, "grad_norm": 111.9620361328125, "learning_rate": 8.448618886390522e-05, "loss": 0.7148, "step": 700 }, { "epoch": 0.288, "grad_norm": 64.58492279052734, "learning_rate": 8.353668107658984e-05, "loss": 0.5565, "step": 720 }, { "epoch": 0.296, "grad_norm": 161.78875732421875, "learning_rate": 8.256466035853076e-05, "loss": 0.8629, "step": 740 }, { "epoch": 0.304, "grad_norm": 61.221771240234375, "learning_rate": 8.157077922018537e-05, "loss": 0.7266, "step": 760 }, { "epoch": 0.312, "grad_norm": 153.8072052001953, "learning_rate": 8.055570484675251e-05, "loss": 0.8071, "step": 780 }, { "epoch": 0.32, "grad_norm": 159.62533569335938, "learning_rate": 7.952011865029614e-05, "loss": 0.6098, "step": 800 }, { "epoch": 0.328, "grad_norm": 174.14382934570312, "learning_rate": 7.846471581231814e-05, "loss": 0.8592, "step": 820 }, { "epoch": 0.336, "grad_norm": 42.97473907470703, "learning_rate": 7.739020481708815e-05, "loss": 0.6594, "step": 840 }, { "epoch": 0.344, "grad_norm": 62.19815444946289, "learning_rate": 7.629730697604314e-05, "loss": 0.5692, "step": 860 }, { "epoch": 0.352, "grad_norm": 112.52002716064453, "learning_rate": 7.518675594357633e-05, "loss": 0.6515, "step": 880 }, { "epoch": 0.36, "grad_norm": 71.151611328125, "learning_rate": 7.405929722454026e-05, "loss": 0.6949, "step": 900 }, { "epoch": 0.368, "grad_norm": 82.4411392211914, "learning_rate": 7.291568767379484e-05, "loss": 0.688, "step": 920 }, { "epoch": 0.376, "grad_norm": 53.197975158691406, "learning_rate": 7.175669498813617e-05, "loss": 0.5941, "step": 940 }, { "epoch": 0.384, "grad_norm": 96.15673828125, "learning_rate": 7.05830971909472e-05, "loss": 0.7445, "step": 960 }, { "epoch": 0.392, "grad_norm": 71.28498077392578, "learning_rate": 6.939568210991633e-05, "loss": 0.7837, "step": 980 }, { "epoch": 0.4, "grad_norm": 98.7578353881836, "learning_rate": 6.819524684817438e-05, "loss": 0.867, "step": 1000 }, { "epoch": 0.408, "grad_norm": 34.90584945678711, "learning_rate": 6.698259724920502e-05, "loss": 0.5197, "step": 1020 }, { "epoch": 0.416, "grad_norm": 106.12273406982422, "learning_rate": 6.575854735588794e-05, "loss": 0.6065, "step": 1040 }, { "epoch": 0.424, "grad_norm": 74.21955871582031, "learning_rate": 6.452391886403767e-05, "loss": 0.5775, "step": 1060 }, { "epoch": 0.432, "grad_norm": 56.11361312866211, "learning_rate": 6.327954057080526e-05, "loss": 0.4924, "step": 1080 }, { "epoch": 0.44, "grad_norm": 51.63819122314453, "learning_rate": 6.202624781831268e-05, "loss": 0.6356, "step": 1100 }, { "epoch": 0.448, "grad_norm": 51.09682083129883, "learning_rate": 6.076488193289375e-05, "loss": 0.4962, "step": 1120 }, { "epoch": 0.456, "grad_norm": 48.28594970703125, "learning_rate": 5.949628966031785e-05, "loss": 0.4634, "step": 1140 }, { "epoch": 0.464, "grad_norm": 50.485267639160156, "learning_rate": 5.822132259737565e-05, "loss": 0.4791, "step": 1160 }, { "epoch": 0.472, "grad_norm": 158.87379455566406, "learning_rate": 5.6940836620208346e-05, "loss": 0.5748, "step": 1180 }, { "epoch": 0.48, "grad_norm": 75.37374877929688, "learning_rate": 5.565569130976422e-05, "loss": 0.5684, "step": 1200 }, { "epoch": 0.488, "grad_norm": 118.30435180664062, "learning_rate": 5.43667493747682e-05, "loss": 0.6176, "step": 1220 }, { "epoch": 0.496, "grad_norm": 86.57565307617188, "learning_rate": 5.307487607259175e-05, "loss": 0.6251, "step": 1240 }, { "epoch": 0.504, "grad_norm": 98.3755874633789, "learning_rate": 5.1780938628411794e-05, "loss": 0.5336, "step": 1260 }, { "epoch": 0.512, "grad_norm": 116.37334442138672, "learning_rate": 5.048580565304887e-05, "loss": 0.6277, "step": 1280 }, { "epoch": 0.52, "grad_norm": 66.12716674804688, "learning_rate": 4.919034655987493e-05, "loss": 0.4566, "step": 1300 }, { "epoch": 0.528, "grad_norm": 114.47698211669922, "learning_rate": 4.789543098118241e-05, "loss": 0.4926, "step": 1320 }, { "epoch": 0.536, "grad_norm": 32.51777648925781, "learning_rate": 4.660192818440641e-05, "loss": 0.5048, "step": 1340 }, { "epoch": 0.544, "grad_norm": 59.64183807373047, "learning_rate": 4.5310706488591856e-05, "loss": 0.4574, "step": 1360 }, { "epoch": 0.552, "grad_norm": 113.23239135742188, "learning_rate": 4.402263268149706e-05, "loss": 0.5314, "step": 1380 }, { "epoch": 0.56, "grad_norm": 51.29038619995117, "learning_rate": 4.27385714377255e-05, "loss": 0.4766, "step": 1400 }, { "epoch": 0.568, "grad_norm": 54.05197525024414, "learning_rate": 4.145938473827598e-05, "loss": 0.5337, "step": 1420 }, { "epoch": 0.576, "grad_norm": 105.83946990966797, "learning_rate": 4.018593129190113e-05, "loss": 0.4519, "step": 1440 }, { "epoch": 0.584, "grad_norm": 36.12518310546875, "learning_rate": 3.89190659586623e-05, "loss": 0.3604, "step": 1460 }, { "epoch": 0.592, "grad_norm": 46.54783248901367, "learning_rate": 3.765963917606828e-05, "loss": 0.381, "step": 1480 }, { "epoch": 0.6, "grad_norm": 68.79725646972656, "learning_rate": 3.640849638818286e-05, "loss": 0.4085, "step": 1500 }, { "epoch": 0.608, "grad_norm": 44.10316848754883, "learning_rate": 3.516647747808417e-05, "loss": 0.3213, "step": 1520 }, { "epoch": 0.616, "grad_norm": 75.88388061523438, "learning_rate": 3.3934416204057395e-05, "loss": 0.469, "step": 1540 }, { "epoch": 0.624, "grad_norm": 65.06538391113281, "learning_rate": 3.271313963989886e-05, "loss": 0.4438, "step": 1560 }, { "epoch": 0.632, "grad_norm": 62.845802307128906, "learning_rate": 3.150346761970741e-05, "loss": 0.4573, "step": 1580 }, { "epoch": 0.64, "grad_norm": 92.78313446044922, "learning_rate": 3.0306212187535653e-05, "loss": 0.4057, "step": 1600 }, { "epoch": 0.648, "grad_norm": 56.57185745239258, "learning_rate": 2.912217705227075e-05, "loss": 0.3921, "step": 1620 }, { "epoch": 0.656, "grad_norm": 37.49650192260742, "learning_rate": 2.7952157048110406e-05, "loss": 0.4174, "step": 1640 }, { "epoch": 0.664, "grad_norm": 41.775672912597656, "learning_rate": 2.6796937600996587e-05, "loss": 0.443, "step": 1660 }, { "epoch": 0.672, "grad_norm": 34.62808609008789, "learning_rate": 2.5657294201364522e-05, "loss": 0.4454, "step": 1680 }, { "epoch": 0.68, "grad_norm": 22.669153213500977, "learning_rate": 2.4533991883561868e-05, "loss": 0.384, "step": 1700 }, { "epoch": 0.688, "grad_norm": 73.54237365722656, "learning_rate": 2.3427784712286478e-05, "loss": 0.4722, "step": 1720 }, { "epoch": 0.696, "grad_norm": 91.86062622070312, "learning_rate": 2.2339415276388476e-05, "loss": 0.3731, "step": 1740 }, { "epoch": 0.704, "grad_norm": 70.42198181152344, "learning_rate": 2.1269614190375475e-05, "loss": 0.3745, "step": 1760 }, { "epoch": 0.712, "grad_norm": 66.34053039550781, "learning_rate": 2.021909960395661e-05, "loss": 0.3536, "step": 1780 }, { "epoch": 0.72, "grad_norm": 70.81706237792969, "learning_rate": 1.9188576719953633e-05, "loss": 0.3935, "step": 1800 }, { "epoch": 0.728, "grad_norm": 59.28203201293945, "learning_rate": 1.81787373209036e-05, "loss": 0.419, "step": 1820 }, { "epoch": 0.736, "grad_norm": 80.54914093017578, "learning_rate": 1.7190259304670038e-05, "loss": 0.3998, "step": 1840 }, { "epoch": 0.744, "grad_norm": 54.67918395996094, "learning_rate": 1.6223806229375182e-05, "loss": 0.3775, "step": 1860 }, { "epoch": 0.752, "grad_norm": 65.14604949951172, "learning_rate": 1.5280026867958185e-05, "loss": 0.3423, "step": 1880 }, { "epoch": 0.76, "grad_norm": 79.72464752197266, "learning_rate": 1.4359554772658552e-05, "loss": 0.4525, "step": 1900 }, { "epoch": 0.768, "grad_norm": 34.39617919921875, "learning_rate": 1.3463007849717036e-05, "loss": 0.2967, "step": 1920 }, { "epoch": 0.776, "grad_norm": 56.02670669555664, "learning_rate": 1.2590987944579807e-05, "loss": 0.362, "step": 1940 }, { "epoch": 0.784, "grad_norm": 77.49681091308594, "learning_rate": 1.1744080437883859e-05, "loss": 0.3531, "step": 1960 }, { "epoch": 0.792, "grad_norm": 61.57918930053711, "learning_rate": 1.092285385249528e-05, "loss": 0.3696, "step": 1980 }, { "epoch": 0.8, "grad_norm": 31.039453506469727, "learning_rate": 1.012785947186397e-05, "loss": 0.356, "step": 2000 } ], "logging_steps": 20, "max_steps": 2500, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.2090517618564096e+16, "train_batch_size": 1, "trial_name": null, "trial_params": null }