{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 3.0, "eval_steps": 500, "global_step": 351, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0861141011840689, "grad_norm": 333.3435363769531, "learning_rate": 9e-07, "loss": 9.803564453125, "num_input_tokens_seen": 90208, "step": 10, "train_runtime": 96.6186, "train_tokens_per_second": 933.651 }, { "epoch": 0.1722282023681378, "grad_norm": 63.6615104675293, "learning_rate": 1.9e-06, "loss": 7.278943634033203, "num_input_tokens_seen": 180128, "step": 20, "train_runtime": 161.1293, "train_tokens_per_second": 1117.909 }, { "epoch": 0.25834230355220666, "grad_norm": 49.02418899536133, "learning_rate": 2.9e-06, "loss": 4.277183914184571, "num_input_tokens_seen": 270720, "step": 30, "train_runtime": 225.3607, "train_tokens_per_second": 1201.274 }, { "epoch": 0.3444564047362756, "grad_norm": 17.75627326965332, "learning_rate": 3.9e-06, "loss": 1.295894241333008, "num_input_tokens_seen": 361952, "step": 40, "train_runtime": 289.3937, "train_tokens_per_second": 1250.725 }, { "epoch": 0.43057050592034446, "grad_norm": 20.77004051208496, "learning_rate": 4.9000000000000005e-06, "loss": 0.3324465751647949, "num_input_tokens_seen": 452352, "step": 50, "train_runtime": 353.7775, "train_tokens_per_second": 1278.634 }, { "epoch": 0.5166846071044133, "grad_norm": 11.49393081665039, "learning_rate": 5.9e-06, "loss": 0.257261061668396, "num_input_tokens_seen": 542400, "step": 60, "train_runtime": 417.9525, "train_tokens_per_second": 1297.755 }, { "epoch": 0.6027987082884823, "grad_norm": 7.95831298828125, "learning_rate": 6.900000000000001e-06, "loss": 0.22105672359466552, "num_input_tokens_seen": 633504, "step": 70, "train_runtime": 481.94, "train_tokens_per_second": 1314.487 }, { "epoch": 0.6889128094725512, "grad_norm": 11.869803428649902, "learning_rate": 7.9e-06, "loss": 0.21478445529937745, "num_input_tokens_seen": 723808, "step": 80, "train_runtime": 545.4453, "train_tokens_per_second": 1327.004 }, { "epoch": 0.77502691065662, "grad_norm": 5.659975051879883, "learning_rate": 8.9e-06, "loss": 0.18611286878585814, "num_input_tokens_seen": 815392, "step": 90, "train_runtime": 609.3714, "train_tokens_per_second": 1338.087 }, { "epoch": 0.8611410118406889, "grad_norm": 4.791771411895752, "learning_rate": 9.900000000000002e-06, "loss": 0.1616648554801941, "num_input_tokens_seen": 905760, "step": 100, "train_runtime": 673.6631, "train_tokens_per_second": 1344.53 }, { "epoch": 0.9472551130247578, "grad_norm": 5.305026054382324, "learning_rate": 1.09e-05, "loss": 0.16810319423675538, "num_input_tokens_seen": 995392, "step": 110, "train_runtime": 738.0244, "train_tokens_per_second": 1348.725 }, { "epoch": 1.0258342303552206, "grad_norm": 10.043594360351562, "learning_rate": 1.19e-05, "loss": 0.15800862312316893, "num_input_tokens_seen": 1077536, "step": 120, "train_runtime": 796.8721, "train_tokens_per_second": 1352.207 }, { "epoch": 1.1119483315392895, "grad_norm": 3.663066864013672, "learning_rate": 1.29e-05, "loss": 0.1582618236541748, "num_input_tokens_seen": 1168640, "step": 130, "train_runtime": 861.0741, "train_tokens_per_second": 1357.189 }, { "epoch": 1.1980624327233584, "grad_norm": 2.456631898880005, "learning_rate": 1.3900000000000002e-05, "loss": 0.14071855545043946, "num_input_tokens_seen": 1259296, "step": 140, "train_runtime": 925.3123, "train_tokens_per_second": 1360.942 }, { "epoch": 1.2841765339074274, "grad_norm": 5.205492973327637, "learning_rate": 1.49e-05, "loss": 0.15321035385131837, "num_input_tokens_seen": 1348864, "step": 150, "train_runtime": 989.3708, "train_tokens_per_second": 1363.355 }, { "epoch": 1.3702906350914963, "grad_norm": 6.281779766082764, "learning_rate": 1.59e-05, "loss": 0.1474855661392212, "num_input_tokens_seen": 1438816, "step": 160, "train_runtime": 1053.5038, "train_tokens_per_second": 1365.744 }, { "epoch": 1.456404736275565, "grad_norm": 4.965813159942627, "learning_rate": 1.69e-05, "loss": 0.1475322961807251, "num_input_tokens_seen": 1529472, "step": 170, "train_runtime": 1117.898, "train_tokens_per_second": 1368.168 }, { "epoch": 1.542518837459634, "grad_norm": 2.566067695617676, "learning_rate": 1.79e-05, "loss": 0.13842158317565917, "num_input_tokens_seen": 1619680, "step": 180, "train_runtime": 1182.1227, "train_tokens_per_second": 1370.145 }, { "epoch": 1.6286329386437028, "grad_norm": 2.7559897899627686, "learning_rate": 1.8900000000000002e-05, "loss": 0.14058760404586793, "num_input_tokens_seen": 1708512, "step": 190, "train_runtime": 1245.9096, "train_tokens_per_second": 1371.297 }, { "epoch": 1.7147470398277718, "grad_norm": 2.7535946369171143, "learning_rate": 1.9900000000000003e-05, "loss": 0.14503936767578124, "num_input_tokens_seen": 1799360, "step": 200, "train_runtime": 1310.3896, "train_tokens_per_second": 1373.149 }, { "epoch": 1.8008611410118407, "grad_norm": 2.8212454319000244, "learning_rate": 2.09e-05, "loss": 0.14306368827819824, "num_input_tokens_seen": 1890528, "step": 210, "train_runtime": 1374.3589, "train_tokens_per_second": 1375.571 }, { "epoch": 1.8869752421959096, "grad_norm": 3.7724499702453613, "learning_rate": 2.19e-05, "loss": 0.1484434723854065, "num_input_tokens_seen": 1981440, "step": 220, "train_runtime": 1438.735, "train_tokens_per_second": 1377.21 }, { "epoch": 1.9730893433799785, "grad_norm": 4.947230815887451, "learning_rate": 2.29e-05, "loss": 0.1293976902961731, "num_input_tokens_seen": 2070560, "step": 230, "train_runtime": 1502.503, "train_tokens_per_second": 1378.074 }, { "epoch": 2.051668460710441, "grad_norm": 2.538516044616699, "learning_rate": 2.39e-05, "loss": 0.0999522089958191, "num_input_tokens_seen": 2153312, "step": 240, "train_runtime": 1561.7539, "train_tokens_per_second": 1378.778 }, { "epoch": 2.13778256189451, "grad_norm": 3.129701614379883, "learning_rate": 2.4900000000000002e-05, "loss": 0.08672967553138733, "num_input_tokens_seen": 2243680, "step": 250, "train_runtime": 1626.1253, "train_tokens_per_second": 1379.771 }, { "epoch": 2.223896663078579, "grad_norm": 1.4860609769821167, "learning_rate": 2.5900000000000003e-05, "loss": 0.08354443907737732, "num_input_tokens_seen": 2335520, "step": 260, "train_runtime": 1690.2808, "train_tokens_per_second": 1381.735 }, { "epoch": 2.310010764262648, "grad_norm": 4.073873043060303, "learning_rate": 2.6900000000000003e-05, "loss": 0.09892970323562622, "num_input_tokens_seen": 2425280, "step": 270, "train_runtime": 1754.0051, "train_tokens_per_second": 1382.71 }, { "epoch": 2.396124865446717, "grad_norm": 1.3554434776306152, "learning_rate": 2.7900000000000004e-05, "loss": 0.11728144884109497, "num_input_tokens_seen": 2516192, "step": 280, "train_runtime": 1818.4362, "train_tokens_per_second": 1383.712 }, { "epoch": 2.482238966630786, "grad_norm": 2.801039218902588, "learning_rate": 2.8899999999999998e-05, "loss": 0.10752675533294678, "num_input_tokens_seen": 2606944, "step": 290, "train_runtime": 1882.8892, "train_tokens_per_second": 1384.545 }, { "epoch": 2.5683530678148547, "grad_norm": 3.3027260303497314, "learning_rate": 2.9900000000000002e-05, "loss": 0.09044331908226014, "num_input_tokens_seen": 2697472, "step": 300, "train_runtime": 1946.9576, "train_tokens_per_second": 1385.481 }, { "epoch": 2.6544671689989237, "grad_norm": 2.025606393814087, "learning_rate": 3.09e-05, "loss": 0.11651453971862794, "num_input_tokens_seen": 2788032, "step": 310, "train_runtime": 2011.3616, "train_tokens_per_second": 1386.142 }, { "epoch": 2.7405812701829926, "grad_norm": 1.6964479684829712, "learning_rate": 3.19e-05, "loss": 0.0845784842967987, "num_input_tokens_seen": 2878336, "step": 320, "train_runtime": 2075.4824, "train_tokens_per_second": 1386.827 }, { "epoch": 2.8266953713670615, "grad_norm": 1.75762140750885, "learning_rate": 3.29e-05, "loss": 0.094532310962677, "num_input_tokens_seen": 2968768, "step": 330, "train_runtime": 2139.8459, "train_tokens_per_second": 1387.375 }, { "epoch": 2.91280947255113, "grad_norm": 4.5564165115356445, "learning_rate": 3.3900000000000004e-05, "loss": 0.10398908853530883, "num_input_tokens_seen": 3058112, "step": 340, "train_runtime": 2203.6666, "train_tokens_per_second": 1387.738 }, { "epoch": 2.9989235737351994, "grad_norm": 1.972362756729126, "learning_rate": 3.49e-05, "loss": 0.0984138309955597, "num_input_tokens_seen": 3148448, "step": 350, "train_runtime": 2267.9059, "train_tokens_per_second": 1388.262 }, { "epoch": 3.0, "num_input_tokens_seen": 3149504, "step": 351, "total_flos": 1.677056662170501e+17, "train_loss": 0.7731951655782865, "train_runtime": 2270.5085, "train_samples_per_second": 4.91, "train_steps_per_second": 0.155 } ], "logging_steps": 10, "max_steps": 351, "num_input_tokens_seen": 3149504, "num_train_epochs": 3, "save_steps": 1000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.677056662170501e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }