{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 29, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.034482758620689655, "grad_norm": 3.9996883869171143, "learning_rate": 3.333333333333333e-07, "loss": 1.4892, "mean_token_accuracy": 0.6603646278381348, "step": 1 }, { "epoch": 0.06896551724137931, "grad_norm": 4.237244606018066, "learning_rate": 6.666666666666666e-07, "loss": 1.4666, "mean_token_accuracy": 0.7045964002609253, "step": 2 }, { "epoch": 0.10344827586206896, "grad_norm": 4.874926567077637, "learning_rate": 1e-06, "loss": 1.7228, "mean_token_accuracy": 0.6302095651626587, "step": 3 }, { "epoch": 0.13793103448275862, "grad_norm": 4.235203266143799, "learning_rate": 9.963544370490268e-07, "loss": 1.4493, "mean_token_accuracy": 0.6814345717430115, "step": 4 }, { "epoch": 0.1724137931034483, "grad_norm": 7.380453109741211, "learning_rate": 9.85470908713026e-07, "loss": 2.0416, "mean_token_accuracy": 0.6577650904655457, "step": 5 }, { "epoch": 0.20689655172413793, "grad_norm": 3.541438341140747, "learning_rate": 9.675081213427074e-07, "loss": 1.2546, "mean_token_accuracy": 0.7483809590339661, "step": 6 }, { "epoch": 0.2413793103448276, "grad_norm": 3.448702812194824, "learning_rate": 9.427280128266049e-07, "loss": 1.3896, "mean_token_accuracy": 0.6593328714370728, "step": 7 }, { "epoch": 0.27586206896551724, "grad_norm": 3.706294298171997, "learning_rate": 9.114919329468282e-07, "loss": 1.4015, "mean_token_accuracy": 0.6922000646591187, "step": 8 }, { "epoch": 0.3103448275862069, "grad_norm": 4.539882659912109, "learning_rate": 8.742553740855505e-07, "loss": 1.7425, "mean_token_accuracy": 0.5878053307533264, "step": 9 }, { "epoch": 0.3448275862068966, "grad_norm": 3.8082709312438965, "learning_rate": 8.315613291203976e-07, "loss": 1.4157, "mean_token_accuracy": 0.6789916157722473, "step": 10 }, { "epoch": 0.3793103448275862, "grad_norm": 5.028677940368652, "learning_rate": 7.840323733655778e-07, "loss": 1.755, "mean_token_accuracy": 0.6366782188415527, "step": 11 }, { "epoch": 0.41379310344827586, "grad_norm": 5.152957439422607, "learning_rate": 7.323615860218842e-07, "loss": 1.7695, "mean_token_accuracy": 0.6314002275466919, "step": 12 }, { "epoch": 0.4482758620689655, "grad_norm": 3.268697738647461, "learning_rate": 6.773024435212677e-07, "loss": 1.4895, "mean_token_accuracy": 0.6149526834487915, "step": 13 }, { "epoch": 0.4827586206896552, "grad_norm": 3.3466408252716064, "learning_rate": 6.196578321437789e-07, "loss": 1.1299, "mean_token_accuracy": 0.7559174299240112, "step": 14 }, { "epoch": 0.5172413793103449, "grad_norm": 4.494246482849121, "learning_rate": 5.602683401276614e-07, "loss": 1.5723, "mean_token_accuracy": 0.6703522801399231, "step": 15 }, { "epoch": 0.5517241379310345, "grad_norm": 2.2075376510620117, "learning_rate": 5e-07, "loss": 1.0356, "mean_token_accuracy": 0.7093867063522339, "step": 16 }, { "epoch": 0.5862068965517241, "grad_norm": 2.7901251316070557, "learning_rate": 4.397316598723385e-07, "loss": 1.1132, "mean_token_accuracy": 0.7466140985488892, "step": 17 }, { "epoch": 0.6206896551724138, "grad_norm": 3.604022979736328, "learning_rate": 3.8034216785622125e-07, "loss": 1.3046, "mean_token_accuracy": 0.7072184681892395, "step": 18 }, { "epoch": 0.6551724137931034, "grad_norm": 3.637402057647705, "learning_rate": 3.2269755647873214e-07, "loss": 1.5471, "mean_token_accuracy": 0.6090646386146545, "step": 19 }, { "epoch": 0.6896551724137931, "grad_norm": 3.484041452407837, "learning_rate": 2.676384139781157e-07, "loss": 1.4808, "mean_token_accuracy": 0.6458947658538818, "step": 20 }, { "epoch": 0.7241379310344828, "grad_norm": 4.93519926071167, "learning_rate": 2.1596762663442213e-07, "loss": 1.853, "mean_token_accuracy": 0.6095913648605347, "step": 21 }, { "epoch": 0.7586206896551724, "grad_norm": 6.128385543823242, "learning_rate": 1.6843867087960251e-07, "loss": 1.552, "mean_token_accuracy": 0.6161980032920837, "step": 22 }, { "epoch": 0.7931034482758621, "grad_norm": 5.635701656341553, "learning_rate": 1.257446259144494e-07, "loss": 1.5498, "mean_token_accuracy": 0.7546396851539612, "step": 23 }, { "epoch": 0.8275862068965517, "grad_norm": 3.2936410903930664, "learning_rate": 8.850806705317182e-08, "loss": 1.542, "mean_token_accuracy": 0.5884397029876709, "step": 24 }, { "epoch": 0.8620689655172413, "grad_norm": 3.3056509494781494, "learning_rate": 5.72719871733951e-08, "loss": 1.4571, "mean_token_accuracy": 0.677709698677063, "step": 25 }, { "epoch": 0.896551724137931, "grad_norm": 3.8348419666290283, "learning_rate": 3.2491878657292635e-08, "loss": 1.5325, "mean_token_accuracy": 0.6370223760604858, "step": 26 }, { "epoch": 0.9310344827586207, "grad_norm": 3.4010775089263916, "learning_rate": 1.4529091286973993e-08, "loss": 1.3759, "mean_token_accuracy": 0.6779050230979919, "step": 27 }, { "epoch": 0.9655172413793104, "grad_norm": 3.990252733230591, "learning_rate": 3.6455629509730135e-09, "loss": 1.4335, "mean_token_accuracy": 0.688022255897522, "step": 28 }, { "epoch": 1.0, "grad_norm": 4.286991596221924, "learning_rate": 0.0, "loss": 1.5531, "mean_token_accuracy": 0.6274685859680176, "step": 29 }, { "epoch": 1.0, "step": 29, "total_flos": 978754951168.0, "train_loss": 1.4972400459749946, "train_runtime": 1197.8134, "train_samples_per_second": 0.095, "train_steps_per_second": 0.024 } ], "logging_steps": 1, "max_steps": 29, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 978754951168.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }