{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 6.41334768568353, "eval_steps": 500, "global_step": 750, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0861141011840689, "grad_norm": 21.438983917236328, "learning_rate": 6.749999999999999e-06, "loss": 5.3584, "num_input_tokens_seen": 106432, "step": 10, "train_runtime": 108.6693, "train_tokens_per_second": 979.412 }, { "epoch": 0.1722282023681378, "grad_norm": 8.519647598266602, "learning_rate": 1.4249999999999999e-05, "loss": 4.8538, "num_input_tokens_seen": 213216, "step": 20, "train_runtime": 186.9434, "train_tokens_per_second": 1140.538 }, { "epoch": 0.25834230355220666, "grad_norm": 18.737985610961914, "learning_rate": 2.1749999999999997e-05, "loss": 3.6236, "num_input_tokens_seen": 319264, "step": 30, "train_runtime": 265.2215, "train_tokens_per_second": 1203.763 }, { "epoch": 0.3444564047362756, "grad_norm": 4.311729431152344, "learning_rate": 2.925e-05, "loss": 2.4654, "num_input_tokens_seen": 426464, "step": 40, "train_runtime": 343.9109, "train_tokens_per_second": 1240.042 }, { "epoch": 0.43057050592034446, "grad_norm": 2.5902934074401855, "learning_rate": 3.675e-05, "loss": 2.0086, "num_input_tokens_seen": 532576, "step": 50, "train_runtime": 421.9835, "train_tokens_per_second": 1262.078 }, { "epoch": 0.5166846071044133, "grad_norm": 3.0768535137176514, "learning_rate": 4.424999999999999e-05, "loss": 1.878, "num_input_tokens_seen": 639584, "step": 60, "train_runtime": 500.5067, "train_tokens_per_second": 1277.873 }, { "epoch": 0.6027987082884823, "grad_norm": 2.4493396282196045, "learning_rate": 5.174999999999999e-05, "loss": 1.8546, "num_input_tokens_seen": 747360, "step": 70, "train_runtime": 579.1392, "train_tokens_per_second": 1290.467 }, { "epoch": 0.6889128094725512, "grad_norm": 2.146406650543213, "learning_rate": 5.925e-05, "loss": 1.8364, "num_input_tokens_seen": 854304, "step": 80, "train_runtime": 657.8931, "train_tokens_per_second": 1298.545 }, { "epoch": 0.77502691065662, "grad_norm": 2.2075250148773193, "learning_rate": 6.675e-05, "loss": 1.8027, "num_input_tokens_seen": 962816, "step": 90, "train_runtime": 737.8649, "train_tokens_per_second": 1304.868 }, { "epoch": 0.8611410118406889, "grad_norm": 0.9837085008621216, "learning_rate": 7.424999999999999e-05, "loss": 1.7782, "num_input_tokens_seen": 1070240, "step": 100, "train_runtime": 817.3738, "train_tokens_per_second": 1309.364 }, { "epoch": 0.9472551130247578, "grad_norm": 3.0224859714508057, "learning_rate": 8.175e-05, "loss": 1.7681, "num_input_tokens_seen": 1175840, "step": 110, "train_runtime": 895.639, "train_tokens_per_second": 1312.85 }, { "epoch": 1.0258342303552206, "grad_norm": 1.015479326248169, "learning_rate": 8.924999999999999e-05, "loss": 1.5944, "num_input_tokens_seen": 1273184, "step": 120, "train_runtime": 967.2081, "train_tokens_per_second": 1316.35 }, { "epoch": 1.1119483315392895, "grad_norm": 1.2177729606628418, "learning_rate": 9.675e-05, "loss": 1.7489, "num_input_tokens_seen": 1380480, "step": 130, "train_runtime": 1045.876, "train_tokens_per_second": 1319.927 }, { "epoch": 1.1980624327233584, "grad_norm": 1.6441470384597778, "learning_rate": 0.00010424999999999999, "loss": 1.7265, "num_input_tokens_seen": 1487520, "step": 140, "train_runtime": 1124.3621, "train_tokens_per_second": 1322.99 }, { "epoch": 1.2841765339074274, "grad_norm": 1.1657848358154297, "learning_rate": 0.00011174999999999999, "loss": 1.7386, "num_input_tokens_seen": 1593472, "step": 150, "train_runtime": 1202.4025, "train_tokens_per_second": 1325.24 }, { "epoch": 1.3702906350914963, "grad_norm": 1.1126108169555664, "learning_rate": 0.00011925, "loss": 1.7229, "num_input_tokens_seen": 1700288, "step": 160, "train_runtime": 1280.6844, "train_tokens_per_second": 1327.64 }, { "epoch": 1.456404736275565, "grad_norm": 1.3799711465835571, "learning_rate": 0.00012675, "loss": 1.7513, "num_input_tokens_seen": 1807488, "step": 170, "train_runtime": 1359.2569, "train_tokens_per_second": 1329.762 }, { "epoch": 1.542518837459634, "grad_norm": 1.2127066850662231, "learning_rate": 0.00013424999999999998, "loss": 1.7105, "num_input_tokens_seen": 1914272, "step": 180, "train_runtime": 1437.7985, "train_tokens_per_second": 1331.391 }, { "epoch": 1.6286329386437028, "grad_norm": 1.4629660844802856, "learning_rate": 0.00014174999999999998, "loss": 1.7081, "num_input_tokens_seen": 2019584, "step": 190, "train_runtime": 1515.7685, "train_tokens_per_second": 1332.383 }, { "epoch": 1.7147470398277718, "grad_norm": 0.9486769437789917, "learning_rate": 0.00014925, "loss": 1.7133, "num_input_tokens_seen": 2126016, "step": 200, "train_runtime": 1593.9754, "train_tokens_per_second": 1333.782 }, { "epoch": 1.8008611410118407, "grad_norm": 1.6725178956985474, "learning_rate": 0.00014992177254124345, "loss": 1.7217, "num_input_tokens_seen": 2233824, "step": 210, "train_runtime": 1672.6238, "train_tokens_per_second": 1335.521 }, { "epoch": 1.8869752421959096, "grad_norm": 1.5028326511383057, "learning_rate": 0.00014965156613602355, "loss": 1.7094, "num_input_tokens_seen": 2341536, "step": 220, "train_runtime": 1751.4804, "train_tokens_per_second": 1336.89 }, { "epoch": 1.9730893433799785, "grad_norm": 1.0816280841827393, "learning_rate": 0.0001491891107057639, "loss": 1.7178, "num_input_tokens_seen": 2447072, "step": 230, "train_runtime": 1829.8444, "train_tokens_per_second": 1337.312 }, { "epoch": 2.051668460710441, "grad_norm": 0.8403604030609131, "learning_rate": 0.00014853559720478995, "loss": 1.5203, "num_input_tokens_seen": 2544928, "step": 240, "train_runtime": 1901.5872, "train_tokens_per_second": 1338.318 }, { "epoch": 2.13778256189451, "grad_norm": 0.805606484413147, "learning_rate": 0.00014769270861632517, "loss": 1.684, "num_input_tokens_seen": 2652064, "step": 250, "train_runtime": 1980.3904, "train_tokens_per_second": 1339.162 }, { "epoch": 2.223896663078579, "grad_norm": 0.7405467629432678, "learning_rate": 0.00014666261561833036, "loss": 1.6749, "num_input_tokens_seen": 2759904, "step": 260, "train_runtime": 2065.3272, "train_tokens_per_second": 1336.304 }, { "epoch": 2.310010764262648, "grad_norm": 0.8861342668533325, "learning_rate": 0.00014544797099339018, "loss": 1.6585, "num_input_tokens_seen": 2865952, "step": 270, "train_runtime": 2143.4821, "train_tokens_per_second": 1337.054 }, { "epoch": 2.396124865446717, "grad_norm": 1.0403251647949219, "learning_rate": 0.0001440519027970432, "loss": 1.6736, "num_input_tokens_seen": 2972928, "step": 280, "train_runtime": 2222.3903, "train_tokens_per_second": 1337.716 }, { "epoch": 2.482238966630786, "grad_norm": 2.1221981048583984, "learning_rate": 0.0001424780063021488, "loss": 1.6969, "num_input_tokens_seen": 3080512, "step": 290, "train_runtime": 2301.0804, "train_tokens_per_second": 1338.724 }, { "epoch": 2.5683530678148547, "grad_norm": 0.7471824884414673, "learning_rate": 0.00014073033474003643, "loss": 1.6699, "num_input_tokens_seen": 3187712, "step": 300, "train_runtime": 2379.4634, "train_tokens_per_second": 1339.677 }, { "epoch": 2.6544671689989237, "grad_norm": 0.7120847702026367, "learning_rate": 0.00013881338886228165, "loss": 1.6843, "num_input_tokens_seen": 3293920, "step": 310, "train_runtime": 2457.8176, "train_tokens_per_second": 1340.181 }, { "epoch": 2.7405812701829926, "grad_norm": 0.7970668077468872, "learning_rate": 0.00013673210534999016, "loss": 1.6693, "num_input_tokens_seen": 3400960, "step": 320, "train_runtime": 2536.9062, "train_tokens_per_second": 1340.594 }, { "epoch": 2.8266953713670615, "grad_norm": 0.6767310500144958, "learning_rate": 0.0001344918441004391, "loss": 1.6793, "num_input_tokens_seen": 3508032, "step": 330, "train_runtime": 2615.7057, "train_tokens_per_second": 1341.142 }, { "epoch": 2.91280947255113, "grad_norm": 0.9333407282829285, "learning_rate": 0.00013209837442381653, "loss": 1.6769, "num_input_tokens_seen": 3614176, "step": 340, "train_runtime": 2694.0699, "train_tokens_per_second": 1341.53 }, { "epoch": 2.9989235737351994, "grad_norm": 0.6378505229949951, "learning_rate": 0.0001295578601856059, "loss": 1.6701, "num_input_tokens_seen": 3721088, "step": 350, "train_runtime": 2772.4192, "train_tokens_per_second": 1342.181 }, { "epoch": 3.077502691065662, "grad_norm": 0.7191705107688904, "learning_rate": 0.0001268768439328786, "loss": 1.4983, "num_input_tokens_seen": 3819168, "step": 360, "train_runtime": 2844.1855, "train_tokens_per_second": 1342.798 }, { "epoch": 3.163616792249731, "grad_norm": 0.8273401856422424, "learning_rate": 0.0001240622300453734, "loss": 1.6384, "num_input_tokens_seen": 3925184, "step": 370, "train_runtime": 2922.2231, "train_tokens_per_second": 1343.218 }, { "epoch": 3.2497308934338, "grad_norm": 1.5716602802276611, "learning_rate": 0.00012112126695475425, "loss": 1.6345, "num_input_tokens_seen": 4032864, "step": 380, "train_runtime": 3000.8862, "train_tokens_per_second": 1343.891 }, { "epoch": 3.3358449946178688, "grad_norm": 0.6344667077064514, "learning_rate": 0.00011806152847783581, "loss": 1.6347, "num_input_tokens_seen": 4140288, "step": 390, "train_runtime": 3079.5638, "train_tokens_per_second": 1344.44 }, { "epoch": 3.4219590958019377, "grad_norm": 0.45537635684013367, "learning_rate": 0.0001148908943118504, "loss": 1.621, "num_input_tokens_seen": 4247264, "step": 400, "train_runtime": 3158.1824, "train_tokens_per_second": 1344.844 }, { "epoch": 3.5080731969860066, "grad_norm": 0.9383829832077026, "learning_rate": 0.00011161752974198511, "loss": 1.64, "num_input_tokens_seen": 4354272, "step": 410, "train_runtime": 3236.6237, "train_tokens_per_second": 1345.313 }, { "epoch": 3.594187298170075, "grad_norm": 0.704737663269043, "learning_rate": 0.00010824986461344928, "loss": 1.6314, "num_input_tokens_seen": 4462208, "step": 420, "train_runtime": 3315.3543, "train_tokens_per_second": 1345.922 }, { "epoch": 3.6803013993541445, "grad_norm": 0.6594169735908508, "learning_rate": 0.00010479657162222409, "loss": 1.6498, "num_input_tokens_seen": 4569632, "step": 430, "train_runtime": 3393.6946, "train_tokens_per_second": 1346.507 }, { "epoch": 3.766415500538213, "grad_norm": 0.6667532324790955, "learning_rate": 0.00010126654398040281, "loss": 1.633, "num_input_tokens_seen": 4676736, "step": 440, "train_runtime": 3472.7969, "train_tokens_per_second": 1346.677 }, { "epoch": 3.852529601722282, "grad_norm": 0.6092108488082886, "learning_rate": 9.766887251363892e-05, "loss": 1.6256, "num_input_tokens_seen": 4783264, "step": 450, "train_runtime": 3551.4865, "train_tokens_per_second": 1346.834 }, { "epoch": 3.938643702906351, "grad_norm": 0.9420148730278015, "learning_rate": 9.401282224968333e-05, "loss": 1.6179, "num_input_tokens_seen": 4890112, "step": 460, "train_runtime": 3630.0806, "train_tokens_per_second": 1347.108 }, { "epoch": 4.017222820236814, "grad_norm": 0.6568248867988586, "learning_rate": 9.030780855830153e-05, "loss": 1.4804, "num_input_tokens_seen": 4987136, "step": 470, "train_runtime": 3701.7389, "train_tokens_per_second": 1347.241 }, { "epoch": 4.103336921420882, "grad_norm": 0.46975892782211304, "learning_rate": 8.65633729040172e-05, "loss": 1.5986, "num_input_tokens_seen": 5092896, "step": 480, "train_runtime": 3780.0642, "train_tokens_per_second": 1347.304 }, { "epoch": 4.189451022604952, "grad_norm": 0.17200271785259247, "learning_rate": 8.278915827412616e-05, "loss": 1.603, "num_input_tokens_seen": 5200416, "step": 490, "train_runtime": 3859.043, "train_tokens_per_second": 1347.592 }, { "epoch": 4.27556512378902, "grad_norm": 1.3012012243270874, "learning_rate": 7.899488434526004e-05, "loss": 1.5983, "num_input_tokens_seen": 5306976, "step": 500, "train_runtime": 3937.2348, "train_tokens_per_second": 1347.894 }, { "epoch": 4.36167922497309, "grad_norm": 0.780907392501831, "learning_rate": 7.51903224524532e-05, "loss": 1.5965, "num_input_tokens_seen": 5414464, "step": 510, "train_runtime": 4022.017, "train_tokens_per_second": 1346.206 }, { "epoch": 4.447793326157158, "grad_norm": 0.6589680910110474, "learning_rate": 7.138527042517471e-05, "loss": 1.603, "num_input_tokens_seen": 5520224, "step": 520, "train_runtime": 4100.3341, "train_tokens_per_second": 1346.286 }, { "epoch": 4.533907427341227, "grad_norm": 0.5304105877876282, "learning_rate": 6.758952735512931e-05, "loss": 1.6065, "num_input_tokens_seen": 5628224, "step": 530, "train_runtime": 4179.0731, "train_tokens_per_second": 1346.764 }, { "epoch": 4.620021528525296, "grad_norm": 0.2885695695877075, "learning_rate": 6.381286836080796e-05, "loss": 1.6024, "num_input_tokens_seen": 5734816, "step": 540, "train_runtime": 4257.2922, "train_tokens_per_second": 1347.057 }, { "epoch": 4.706135629709365, "grad_norm": 0.3303077816963196, "learning_rate": 6.006501941377631e-05, "loss": 1.597, "num_input_tokens_seen": 5842240, "step": 550, "train_runtime": 4336.3619, "train_tokens_per_second": 1347.268 }, { "epoch": 4.792249730893434, "grad_norm": 0.4729728102684021, "learning_rate": 5.635563229153013e-05, "loss": 1.6005, "num_input_tokens_seen": 5950688, "step": 560, "train_runtime": 4415.38, "train_tokens_per_second": 1347.718 }, { "epoch": 4.878363832077502, "grad_norm": 0.6590526103973389, "learning_rate": 5.2694259721422185e-05, "loss": 1.6081, "num_input_tokens_seen": 6056416, "step": 570, "train_runtime": 4493.6142, "train_tokens_per_second": 1347.783 }, { "epoch": 4.964477933261572, "grad_norm": 0.5510996580123901, "learning_rate": 4.90903307796707e-05, "loss": 1.6024, "num_input_tokens_seen": 6163968, "step": 580, "train_runtime": 4572.3588, "train_tokens_per_second": 1348.094 }, { "epoch": 5.043057050592035, "grad_norm": 0.4095686376094818, "learning_rate": 4.555312660880527e-05, "loss": 1.4538, "num_input_tokens_seen": 6262560, "step": 590, "train_runtime": 4644.1546, "train_tokens_per_second": 1348.482 }, { "epoch": 5.129171151776103, "grad_norm": 0.17324793338775635, "learning_rate": 4.209175651608374e-05, "loss": 1.586, "num_input_tokens_seen": 6369280, "step": 600, "train_runtime": 4722.7601, "train_tokens_per_second": 1348.635 }, { "epoch": 5.2152852529601725, "grad_norm": 0.6640817523002625, "learning_rate": 3.871513451443412e-05, "loss": 1.5876, "num_input_tokens_seen": 6475072, "step": 610, "train_runtime": 4800.8785, "train_tokens_per_second": 1348.726 }, { "epoch": 5.301399354144241, "grad_norm": 0.17123615741729736, "learning_rate": 3.5431956366334576e-05, "loss": 1.587, "num_input_tokens_seen": 6582240, "step": 620, "train_runtime": 4879.5207, "train_tokens_per_second": 1348.952 }, { "epoch": 5.38751345532831, "grad_norm": 0.051739007234573364, "learning_rate": 3.225067718975078e-05, "loss": 1.5812, "num_input_tokens_seen": 6690496, "step": 630, "train_runtime": 4959.3413, "train_tokens_per_second": 1349.069 }, { "epoch": 5.473627556512379, "grad_norm": 0.889016330242157, "learning_rate": 2.917948968380125e-05, "loss": 1.5828, "num_input_tokens_seen": 6797088, "step": 640, "train_runtime": 5037.9025, "train_tokens_per_second": 1349.19 }, { "epoch": 5.559741657696447, "grad_norm": 0.20981049537658691, "learning_rate": 2.622630303022586e-05, "loss": 1.5837, "num_input_tokens_seen": 6904160, "step": 650, "train_runtime": 5116.2831, "train_tokens_per_second": 1349.448 }, { "epoch": 5.645855758880517, "grad_norm": 0.4966135621070862, "learning_rate": 2.3398722524992193e-05, "loss": 1.5806, "num_input_tokens_seen": 7011264, "step": 660, "train_runtime": 5194.5897, "train_tokens_per_second": 1349.724 }, { "epoch": 5.731969860064585, "grad_norm": 0.0645381435751915, "learning_rate": 2.0704029992494413e-05, "loss": 1.5831, "num_input_tokens_seen": 7117600, "step": 670, "train_runtime": 5272.7715, "train_tokens_per_second": 1349.878 }, { "epoch": 5.818083961248655, "grad_norm": 0.03474411740899086, "learning_rate": 1.8149165032783373e-05, "loss": 1.5842, "num_input_tokens_seen": 7223968, "step": 680, "train_runtime": 5351.0243, "train_tokens_per_second": 1350.016 }, { "epoch": 5.904198062432723, "grad_norm": 0.1602916270494461, "learning_rate": 1.574070715012184e-05, "loss": 1.5803, "num_input_tokens_seen": 7330624, "step": 690, "train_runtime": 5429.4442, "train_tokens_per_second": 1350.161 }, { "epoch": 5.990312163616792, "grad_norm": 0.6672658920288086, "learning_rate": 1.3484858808888777e-05, "loss": 1.5828, "num_input_tokens_seen": 7437664, "step": 700, "train_runtime": 5507.9983, "train_tokens_per_second": 1350.339 }, { "epoch": 6.0688912809472555, "grad_norm": 0.053765423595905304, "learning_rate": 1.1387429460468603e-05, "loss": 1.4417, "num_input_tokens_seen": 7535744, "step": 710, "train_runtime": 5579.9255, "train_tokens_per_second": 1350.51 }, { "epoch": 6.155005382131324, "grad_norm": 0.029805637896060944, "learning_rate": 9.453820582260826e-06, "loss": 1.5799, "num_input_tokens_seen": 7642368, "step": 720, "train_runtime": 5657.9716, "train_tokens_per_second": 1350.726 }, { "epoch": 6.2411194833153925, "grad_norm": 0.04558693990111351, "learning_rate": 7.689011767338823e-06, "loss": 1.5799, "num_input_tokens_seen": 7748992, "step": 730, "train_runtime": 5736.181, "train_tokens_per_second": 1350.897 }, { "epoch": 6.327233584499462, "grad_norm": 0.03208324313163757, "learning_rate": 6.097547900580538e-06, "loss": 1.5796, "num_input_tokens_seen": 7856928, "step": 740, "train_runtime": 5814.8518, "train_tokens_per_second": 1351.183 }, { "epoch": 6.41334768568353, "grad_norm": 0.03971538320183754, "learning_rate": 4.68352745429686e-06, "loss": 1.5801, "num_input_tokens_seen": 7964064, "step": 750, "train_runtime": 5893.167, "train_tokens_per_second": 1351.406 } ], "logging_steps": 10, "max_steps": 819, "num_input_tokens_seen": 7964064, "num_train_epochs": 7, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.3558949813041664e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }