{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.13778256189451, "eval_steps": 500, "global_step": 250, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0861141011840689, "grad_norm": 21.438983917236328, "learning_rate": 6.749999999999999e-06, "loss": 5.3584, "num_input_tokens_seen": 106432, "step": 10, "train_runtime": 108.6693, "train_tokens_per_second": 979.412 }, { "epoch": 0.1722282023681378, "grad_norm": 8.519647598266602, "learning_rate": 1.4249999999999999e-05, "loss": 4.8538, "num_input_tokens_seen": 213216, "step": 20, "train_runtime": 186.9434, "train_tokens_per_second": 1140.538 }, { "epoch": 0.25834230355220666, "grad_norm": 18.737985610961914, "learning_rate": 2.1749999999999997e-05, "loss": 3.6236, "num_input_tokens_seen": 319264, "step": 30, "train_runtime": 265.2215, "train_tokens_per_second": 1203.763 }, { "epoch": 0.3444564047362756, "grad_norm": 4.311729431152344, "learning_rate": 2.925e-05, "loss": 2.4654, "num_input_tokens_seen": 426464, "step": 40, "train_runtime": 343.9109, "train_tokens_per_second": 1240.042 }, { "epoch": 0.43057050592034446, "grad_norm": 2.5902934074401855, "learning_rate": 3.675e-05, "loss": 2.0086, "num_input_tokens_seen": 532576, "step": 50, "train_runtime": 421.9835, "train_tokens_per_second": 1262.078 }, { "epoch": 0.5166846071044133, "grad_norm": 3.0768535137176514, "learning_rate": 4.424999999999999e-05, "loss": 1.878, "num_input_tokens_seen": 639584, "step": 60, "train_runtime": 500.5067, "train_tokens_per_second": 1277.873 }, { "epoch": 0.6027987082884823, "grad_norm": 2.4493396282196045, "learning_rate": 5.174999999999999e-05, "loss": 1.8546, "num_input_tokens_seen": 747360, "step": 70, "train_runtime": 579.1392, "train_tokens_per_second": 1290.467 }, { "epoch": 0.6889128094725512, "grad_norm": 2.146406650543213, "learning_rate": 5.925e-05, "loss": 1.8364, "num_input_tokens_seen": 854304, "step": 80, "train_runtime": 657.8931, "train_tokens_per_second": 1298.545 }, { "epoch": 0.77502691065662, "grad_norm": 2.2075250148773193, "learning_rate": 6.675e-05, "loss": 1.8027, "num_input_tokens_seen": 962816, "step": 90, "train_runtime": 737.8649, "train_tokens_per_second": 1304.868 }, { "epoch": 0.8611410118406889, "grad_norm": 0.9837085008621216, "learning_rate": 7.424999999999999e-05, "loss": 1.7782, "num_input_tokens_seen": 1070240, "step": 100, "train_runtime": 817.3738, "train_tokens_per_second": 1309.364 }, { "epoch": 0.9472551130247578, "grad_norm": 3.0224859714508057, "learning_rate": 8.175e-05, "loss": 1.7681, "num_input_tokens_seen": 1175840, "step": 110, "train_runtime": 895.639, "train_tokens_per_second": 1312.85 }, { "epoch": 1.0258342303552206, "grad_norm": 1.015479326248169, "learning_rate": 8.924999999999999e-05, "loss": 1.5944, "num_input_tokens_seen": 1273184, "step": 120, "train_runtime": 967.2081, "train_tokens_per_second": 1316.35 }, { "epoch": 1.1119483315392895, "grad_norm": 1.2177729606628418, "learning_rate": 9.675e-05, "loss": 1.7489, "num_input_tokens_seen": 1380480, "step": 130, "train_runtime": 1045.876, "train_tokens_per_second": 1319.927 }, { "epoch": 1.1980624327233584, "grad_norm": 1.6441470384597778, "learning_rate": 0.00010424999999999999, "loss": 1.7265, "num_input_tokens_seen": 1487520, "step": 140, "train_runtime": 1124.3621, "train_tokens_per_second": 1322.99 }, { "epoch": 1.2841765339074274, "grad_norm": 1.1657848358154297, "learning_rate": 0.00011174999999999999, "loss": 1.7386, "num_input_tokens_seen": 1593472, "step": 150, "train_runtime": 1202.4025, "train_tokens_per_second": 1325.24 }, { "epoch": 1.3702906350914963, "grad_norm": 1.1126108169555664, "learning_rate": 0.00011925, "loss": 1.7229, "num_input_tokens_seen": 1700288, "step": 160, "train_runtime": 1280.6844, "train_tokens_per_second": 1327.64 }, { "epoch": 1.456404736275565, "grad_norm": 1.3799711465835571, "learning_rate": 0.00012675, "loss": 1.7513, "num_input_tokens_seen": 1807488, "step": 170, "train_runtime": 1359.2569, "train_tokens_per_second": 1329.762 }, { "epoch": 1.542518837459634, "grad_norm": 1.2127066850662231, "learning_rate": 0.00013424999999999998, "loss": 1.7105, "num_input_tokens_seen": 1914272, "step": 180, "train_runtime": 1437.7985, "train_tokens_per_second": 1331.391 }, { "epoch": 1.6286329386437028, "grad_norm": 1.4629660844802856, "learning_rate": 0.00014174999999999998, "loss": 1.7081, "num_input_tokens_seen": 2019584, "step": 190, "train_runtime": 1515.7685, "train_tokens_per_second": 1332.383 }, { "epoch": 1.7147470398277718, "grad_norm": 0.9486769437789917, "learning_rate": 0.00014925, "loss": 1.7133, "num_input_tokens_seen": 2126016, "step": 200, "train_runtime": 1593.9754, "train_tokens_per_second": 1333.782 }, { "epoch": 1.8008611410118407, "grad_norm": 1.6725178956985474, "learning_rate": 0.00014992177254124345, "loss": 1.7217, "num_input_tokens_seen": 2233824, "step": 210, "train_runtime": 1672.6238, "train_tokens_per_second": 1335.521 }, { "epoch": 1.8869752421959096, "grad_norm": 1.5028326511383057, "learning_rate": 0.00014965156613602355, "loss": 1.7094, "num_input_tokens_seen": 2341536, "step": 220, "train_runtime": 1751.4804, "train_tokens_per_second": 1336.89 }, { "epoch": 1.9730893433799785, "grad_norm": 1.0816280841827393, "learning_rate": 0.0001491891107057639, "loss": 1.7178, "num_input_tokens_seen": 2447072, "step": 230, "train_runtime": 1829.8444, "train_tokens_per_second": 1337.312 }, { "epoch": 2.051668460710441, "grad_norm": 0.8403604030609131, "learning_rate": 0.00014853559720478995, "loss": 1.5203, "num_input_tokens_seen": 2544928, "step": 240, "train_runtime": 1901.5872, "train_tokens_per_second": 1338.318 }, { "epoch": 2.13778256189451, "grad_norm": 0.805606484413147, "learning_rate": 0.00014769270861632517, "loss": 1.684, "num_input_tokens_seen": 2652064, "step": 250, "train_runtime": 1980.3904, "train_tokens_per_second": 1339.162 } ], "logging_steps": 10, "max_steps": 819, "num_input_tokens_seen": 2652064, "num_train_epochs": 7, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.7835336666929664e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }