{ "best_metric": null, "best_model_checkpoint": null, "epoch": 0.000169891366606153, "eval_steps": 10, "global_step": 70, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 2.4270195229450424e-06, "grad_norm": 1.988567590713501, "learning_rate": 6.666666649834951e-06, "loss": 2.6244, "step": 1 }, { "epoch": 2.4270195229450424e-06, "eval_loss": 3.429434299468994, "eval_runtime": 46.9267, "eval_samples_per_second": 0.448, "eval_steps_per_second": 0.448, "step": 1 }, { "epoch": 4.854039045890085e-06, "grad_norm": 3.1377198696136475, "learning_rate": 1.3333333299669903e-05, "loss": 3.3996, "step": 2 }, { "epoch": 7.281058568835128e-06, "grad_norm": 2.6447088718414307, "learning_rate": 1.9999999494757503e-05, "loss": 3.4643, "step": 3 }, { "epoch": 9.70807809178017e-06, "grad_norm": 2.257084369659424, "learning_rate": 2.6666666599339806e-05, "loss": 3.1453, "step": 4 }, { "epoch": 1.2135097614725214e-05, "grad_norm": 2.7705202102661133, "learning_rate": 3.333333370392211e-05, "loss": 3.69, "step": 5 }, { "epoch": 1.4562117137670256e-05, "grad_norm": 2.6461124420166016, "learning_rate": 3.9999998989515007e-05, "loss": 3.7107, "step": 6 }, { "epoch": 1.69891366606153e-05, "grad_norm": 3.9613280296325684, "learning_rate": 4.6666664275107905e-05, "loss": 4.2353, "step": 7 }, { "epoch": 1.941615618356034e-05, "grad_norm": 2.75366473197937, "learning_rate": 5.333333319867961e-05, "loss": 2.5853, "step": 8 }, { "epoch": 2.1843175706505383e-05, "grad_norm": 2.350839853286743, "learning_rate": 6.000000212225132e-05, "loss": 3.4014, "step": 9 }, { "epoch": 2.4270195229450427e-05, "grad_norm": 2.133833169937134, "learning_rate": 6.666666740784422e-05, "loss": 3.0469, "step": 10 }, { "epoch": 2.4270195229450427e-05, "eval_loss": 3.3984174728393555, "eval_runtime": 47.0885, "eval_samples_per_second": 0.446, "eval_steps_per_second": 0.446, "step": 10 }, { "epoch": 2.6697214752395468e-05, "grad_norm": 4.320294380187988, "learning_rate": 7.333333633141592e-05, "loss": 3.1139, "step": 11 }, { "epoch": 2.9124234275340512e-05, "grad_norm": 2.433712959289551, "learning_rate": 7.999999797903001e-05, "loss": 3.3114, "step": 12 }, { "epoch": 3.155125379828555e-05, "grad_norm": 2.948375701904297, "learning_rate": 8.666666690260172e-05, "loss": 3.4952, "step": 13 }, { "epoch": 3.39782733212306e-05, "grad_norm": 3.58933424949646, "learning_rate": 9.333332855021581e-05, "loss": 3.791, "step": 14 }, { "epoch": 3.640529284417564e-05, "grad_norm": 3.299588918685913, "learning_rate": 9.999999747378752e-05, "loss": 4.9645, "step": 15 }, { "epoch": 3.883231236712068e-05, "grad_norm": 2.313577890396118, "learning_rate": 0.00010666666639735922, "loss": 1.6593, "step": 16 }, { "epoch": 4.125933189006572e-05, "grad_norm": 2.2489659786224365, "learning_rate": 0.00011333332804497331, "loss": 1.8195, "step": 17 }, { "epoch": 4.3686351413010766e-05, "grad_norm": 2.143282175064087, "learning_rate": 0.00012000000424450263, "loss": 2.8584, "step": 18 }, { "epoch": 4.611337093595581e-05, "grad_norm": 6.221863746643066, "learning_rate": 0.00012666666589211673, "loss": 5.1277, "step": 19 }, { "epoch": 4.8540390458900854e-05, "grad_norm": 4.732879638671875, "learning_rate": 0.00013333333481568843, "loss": 3.8138, "step": 20 }, { "epoch": 4.8540390458900854e-05, "eval_loss": 3.1118509769439697, "eval_runtime": 47.1901, "eval_samples_per_second": 0.445, "eval_steps_per_second": 0.445, "step": 20 }, { "epoch": 5.096740998184589e-05, "grad_norm": 4.0478925704956055, "learning_rate": 0.0001399999891873449, "loss": 1.6834, "step": 21 }, { "epoch": 5.3394429504790936e-05, "grad_norm": 3.7350783348083496, "learning_rate": 0.00014666667266283184, "loss": 2.5659, "step": 22 }, { "epoch": 5.582144902773598e-05, "grad_norm": 3.017839193344116, "learning_rate": 0.00015333332703448832, "loss": 2.5162, "step": 23 }, { "epoch": 5.8248468550681024e-05, "grad_norm": 4.125138759613037, "learning_rate": 0.00015999999595806003, "loss": 3.7915, "step": 24 }, { "epoch": 6.067548807362606e-05, "grad_norm": 2.2610907554626465, "learning_rate": 0.00016666666488163173, "loss": 1.2178, "step": 25 }, { "epoch": 6.31025075965711e-05, "grad_norm": 4.597209453582764, "learning_rate": 0.00017333333380520344, "loss": 2.5644, "step": 26 }, { "epoch": 6.552952711951614e-05, "grad_norm": 3.9226925373077393, "learning_rate": 0.00017999998817685992, "loss": 2.5344, "step": 27 }, { "epoch": 6.79565466424612e-05, "grad_norm": 3.756793260574341, "learning_rate": 0.00018666665710043162, "loss": 2.3925, "step": 28 }, { "epoch": 7.038356616540623e-05, "grad_norm": 3.9993410110473633, "learning_rate": 0.00019333332602400333, "loss": 1.8358, "step": 29 }, { "epoch": 7.281058568835128e-05, "grad_norm": 6.380167484283447, "learning_rate": 0.00019999999494757503, "loss": 3.9897, "step": 30 }, { "epoch": 7.281058568835128e-05, "eval_loss": 2.611670970916748, "eval_runtime": 46.9072, "eval_samples_per_second": 0.448, "eval_steps_per_second": 0.448, "step": 30 }, { "epoch": 7.523760521129632e-05, "grad_norm": 4.4075164794921875, "learning_rate": 0.00019999999494757503, "loss": 2.755, "step": 31 }, { "epoch": 7.766462473424136e-05, "grad_norm": 5.7215046882629395, "learning_rate": 0.00019999999494757503, "loss": 3.0434, "step": 32 }, { "epoch": 8.009164425718641e-05, "grad_norm": 4.067835330963135, "learning_rate": 0.00019999999494757503, "loss": 2.2226, "step": 33 }, { "epoch": 8.251866378013144e-05, "grad_norm": 4.797438621520996, "learning_rate": 0.00019999999494757503, "loss": 1.5217, "step": 34 }, { "epoch": 8.49456833030765e-05, "grad_norm": 10.192020416259766, "learning_rate": 0.00019999999494757503, "loss": 2.7074, "step": 35 }, { "epoch": 8.737270282602153e-05, "grad_norm": 4.287100791931152, "learning_rate": 0.00019999999494757503, "loss": 1.7217, "step": 36 }, { "epoch": 8.979972234896657e-05, "grad_norm": 5.257225513458252, "learning_rate": 0.00019999999494757503, "loss": 2.0953, "step": 37 }, { "epoch": 9.222674187191162e-05, "grad_norm": 8.44377613067627, "learning_rate": 0.00019999999494757503, "loss": 2.3192, "step": 38 }, { "epoch": 9.465376139485666e-05, "grad_norm": 6.8432297706604, "learning_rate": 0.00019999999494757503, "loss": 2.459, "step": 39 }, { "epoch": 9.708078091780171e-05, "grad_norm": 5.657060623168945, "learning_rate": 0.00019999999494757503, "loss": 2.0209, "step": 40 }, { "epoch": 9.708078091780171e-05, "eval_loss": 2.3423023223876953, "eval_runtime": 46.9221, "eval_samples_per_second": 0.448, "eval_steps_per_second": 0.448, "step": 40 }, { "epoch": 9.950780044074675e-05, "grad_norm": 6.757113456726074, "learning_rate": 0.00019999999494757503, "loss": 3.2373, "step": 41 }, { "epoch": 0.00010193481996369178, "grad_norm": 3.9233195781707764, "learning_rate": 0.00019999999494757503, "loss": 1.269, "step": 42 }, { "epoch": 0.00010436183948663683, "grad_norm": 4.863090991973877, "learning_rate": 0.00019999999494757503, "loss": 2.1246, "step": 43 }, { "epoch": 0.00010678885900958187, "grad_norm": 5.010152816772461, "learning_rate": 0.00019999999494757503, "loss": 2.4953, "step": 44 }, { "epoch": 0.00010921587853252691, "grad_norm": 5.084195613861084, "learning_rate": 0.00019999999494757503, "loss": 2.3639, "step": 45 }, { "epoch": 0.00011164289805547196, "grad_norm": 4.2990193367004395, "learning_rate": 0.00019999999494757503, "loss": 1.5201, "step": 46 }, { "epoch": 0.000114069917578417, "grad_norm": 3.991379976272583, "learning_rate": 0.00019999999494757503, "loss": 1.3434, "step": 47 }, { "epoch": 0.00011649693710136205, "grad_norm": 3.651796579360962, "learning_rate": 0.00019999999494757503, "loss": 0.9977, "step": 48 }, { "epoch": 0.00011892395662430709, "grad_norm": 3.8026585578918457, "learning_rate": 0.00019999999494757503, "loss": 1.662, "step": 49 }, { "epoch": 0.00012135097614725212, "grad_norm": 4.1620612144470215, "learning_rate": 0.00019999999494757503, "loss": 2.3788, "step": 50 }, { "epoch": 0.00012135097614725212, "eval_loss": 2.2624521255493164, "eval_runtime": 46.8803, "eval_samples_per_second": 0.448, "eval_steps_per_second": 0.448, "step": 50 }, { "epoch": 0.00012377799567019716, "grad_norm": 3.4755067825317383, "learning_rate": 0.00019999999494757503, "loss": 1.2644, "step": 51 }, { "epoch": 0.0001262050151931422, "grad_norm": 3.064790725708008, "learning_rate": 0.00019999999494757503, "loss": 0.816, "step": 52 }, { "epoch": 0.00012863203471608726, "grad_norm": 6.472192764282227, "learning_rate": 0.00019999999494757503, "loss": 3.0402, "step": 53 }, { "epoch": 0.00013105905423903229, "grad_norm": 6.017213821411133, "learning_rate": 0.00019999999494757503, "loss": 1.9637, "step": 54 }, { "epoch": 0.00013348607376197734, "grad_norm": 2.969481945037842, "learning_rate": 0.00019999999494757503, "loss": 1.0158, "step": 55 }, { "epoch": 0.0001359130932849224, "grad_norm": 4.294132709503174, "learning_rate": 0.00019999999494757503, "loss": 2.329, "step": 56 }, { "epoch": 0.00013834011280786744, "grad_norm": 2.0407297611236572, "learning_rate": 0.00019999999494757503, "loss": 0.8446, "step": 57 }, { "epoch": 0.00014076713233081246, "grad_norm": 6.152376174926758, "learning_rate": 0.00019999999494757503, "loss": 1.7769, "step": 58 }, { "epoch": 0.0001431941518537575, "grad_norm": 5.564684867858887, "learning_rate": 0.00019999999494757503, "loss": 1.8718, "step": 59 }, { "epoch": 0.00014562117137670256, "grad_norm": 3.1191859245300293, "learning_rate": 0.00019999999494757503, "loss": 1.1267, "step": 60 }, { "epoch": 0.00014562117137670256, "eval_loss": 2.2274293899536133, "eval_runtime": 46.8696, "eval_samples_per_second": 0.448, "eval_steps_per_second": 0.448, "step": 60 }, { "epoch": 0.0001480481908996476, "grad_norm": 2.424983024597168, "learning_rate": 0.00019999999494757503, "loss": 1.631, "step": 61 }, { "epoch": 0.00015047521042259264, "grad_norm": 6.923261642456055, "learning_rate": 0.00019999999494757503, "loss": 3.3649, "step": 62 }, { "epoch": 0.0001529022299455377, "grad_norm": 3.311091184616089, "learning_rate": 0.00019999999494757503, "loss": 2.1499, "step": 63 }, { "epoch": 0.0001553292494684827, "grad_norm": 4.510260581970215, "learning_rate": 0.00019999999494757503, "loss": 1.5414, "step": 64 }, { "epoch": 0.00015775626899142776, "grad_norm": 4.838099956512451, "learning_rate": 0.00019999999494757503, "loss": 2.9635, "step": 65 }, { "epoch": 0.00016018328851437281, "grad_norm": 3.5294570922851562, "learning_rate": 0.00019999999494757503, "loss": 1.4734, "step": 66 }, { "epoch": 0.00016261030803731787, "grad_norm": 3.9977903366088867, "learning_rate": 0.00019999999494757503, "loss": 1.6908, "step": 67 }, { "epoch": 0.0001650373275602629, "grad_norm": 4.988344192504883, "learning_rate": 0.00019999999494757503, "loss": 0.6794, "step": 68 }, { "epoch": 0.00016746434708320794, "grad_norm": 1.6817117929458618, "learning_rate": 0.00019999999494757503, "loss": 1.4359, "step": 69 }, { "epoch": 0.000169891366606153, "grad_norm": 5.336698532104492, "learning_rate": 0.00019999999494757503, "loss": 3.0466, "step": 70 }, { "epoch": 0.000169891366606153, "eval_loss": 2.2040059566497803, "eval_runtime": 47.1606, "eval_samples_per_second": 0.445, "eval_steps_per_second": 0.445, "step": 70 } ], "logging_steps": 1, "max_steps": 1236084, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 10, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1528526725447680.0, "train_batch_size": 1, "trial_name": null, "trial_params": null }