{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 215, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004662004662004662, "grad_norm": 106.21962531797728, "learning_rate": 0.0, "loss": 2.739, "mean_token_accuracy": 0.5701408684253693, "num_tokens": 9481.0, "step": 1 }, { "epoch": 0.009324009324009324, "grad_norm": 113.36914382118674, "learning_rate": 4.5454545454545457e-07, "loss": 2.82, "mean_token_accuracy": 0.56001877784729, "num_tokens": 18486.0, "step": 2 }, { "epoch": 0.013986013986013986, "grad_norm": 106.50317238622108, "learning_rate": 9.090909090909091e-07, "loss": 2.6926, "mean_token_accuracy": 0.5815096497535706, "num_tokens": 28054.0, "step": 3 }, { "epoch": 0.018648018648018648, "grad_norm": 90.02623522903296, "learning_rate": 1.3636363636363636e-06, "loss": 2.5138, "mean_token_accuracy": 0.5946728587150574, "num_tokens": 38100.0, "step": 4 }, { "epoch": 0.023310023310023312, "grad_norm": 77.42719349366115, "learning_rate": 1.8181818181818183e-06, "loss": 2.581, "mean_token_accuracy": 0.5861297249794006, "num_tokens": 46674.0, "step": 5 }, { "epoch": 0.027972027972027972, "grad_norm": 51.84205661670952, "learning_rate": 2.2727272727272728e-06, "loss": 2.0848, "mean_token_accuracy": 0.6379857063293457, "num_tokens": 55892.0, "step": 6 }, { "epoch": 0.03263403263403263, "grad_norm": 47.88064411349626, "learning_rate": 2.7272727272727272e-06, "loss": 1.9382, "mean_token_accuracy": 0.6385776698589325, "num_tokens": 64557.0, "step": 7 }, { "epoch": 0.037296037296037296, "grad_norm": 31.663436012051196, "learning_rate": 3.181818181818182e-06, "loss": 1.4512, "mean_token_accuracy": 0.7073646187782288, "num_tokens": 74534.0, "step": 8 }, { "epoch": 0.04195804195804196, "grad_norm": 28.379675867254864, "learning_rate": 3.6363636363636366e-06, "loss": 1.273, "mean_token_accuracy": 0.7217381000518799, "num_tokens": 84839.0, "step": 9 }, { "epoch": 0.046620046620046623, "grad_norm": 22.05633895747606, "learning_rate": 4.0909090909090915e-06, "loss": 0.9671, "mean_token_accuracy": 0.7773665189743042, "num_tokens": 94486.0, "step": 10 }, { "epoch": 0.05128205128205128, "grad_norm": 12.286554458797058, "learning_rate": 4.5454545454545455e-06, "loss": 0.7773, "mean_token_accuracy": 0.8185156285762787, "num_tokens": 103901.0, "step": 11 }, { "epoch": 0.055944055944055944, "grad_norm": 8.71894709105133, "learning_rate": 5e-06, "loss": 0.7136, "mean_token_accuracy": 0.8239960074424744, "num_tokens": 113421.0, "step": 12 }, { "epoch": 0.06060606060606061, "grad_norm": 7.079633705012988, "learning_rate": 5.4545454545454545e-06, "loss": 0.6871, "mean_token_accuracy": 0.8277380168437958, "num_tokens": 122888.0, "step": 13 }, { "epoch": 0.06526806526806526, "grad_norm": 5.438376413266983, "learning_rate": 5.90909090909091e-06, "loss": 0.6091, "mean_token_accuracy": 0.8382397592067719, "num_tokens": 132046.0, "step": 14 }, { "epoch": 0.06993006993006994, "grad_norm": 3.3812206364126145, "learning_rate": 6.363636363636364e-06, "loss": 0.5661, "mean_token_accuracy": 0.854902058839798, "num_tokens": 141586.0, "step": 15 }, { "epoch": 0.07459207459207459, "grad_norm": 3.456199391812718, "learning_rate": 6.818181818181818e-06, "loss": 0.5344, "mean_token_accuracy": 0.8581095337867737, "num_tokens": 151366.0, "step": 16 }, { "epoch": 0.07925407925407925, "grad_norm": 4.262280791274996, "learning_rate": 7.272727272727273e-06, "loss": 0.5444, "mean_token_accuracy": 0.8576282858848572, "num_tokens": 160361.0, "step": 17 }, { "epoch": 0.08391608391608392, "grad_norm": 3.50951187171187, "learning_rate": 7.727272727272727e-06, "loss": 0.5512, "mean_token_accuracy": 0.8535145223140717, "num_tokens": 170716.0, "step": 18 }, { "epoch": 0.08857808857808858, "grad_norm": 3.1077568547014907, "learning_rate": 8.181818181818183e-06, "loss": 0.564, "mean_token_accuracy": 0.8447403013706207, "num_tokens": 179378.0, "step": 19 }, { "epoch": 0.09324009324009325, "grad_norm": 2.9392782111385554, "learning_rate": 8.636363636363637e-06, "loss": 0.4988, "mean_token_accuracy": 0.8656269907951355, "num_tokens": 189155.0, "step": 20 }, { "epoch": 0.0979020979020979, "grad_norm": 3.014369371976925, "learning_rate": 9.090909090909091e-06, "loss": 0.5534, "mean_token_accuracy": 0.8481437265872955, "num_tokens": 198128.0, "step": 21 }, { "epoch": 0.10256410256410256, "grad_norm": 3.2412985537099632, "learning_rate": 9.545454545454547e-06, "loss": 0.536, "mean_token_accuracy": 0.855196475982666, "num_tokens": 207526.0, "step": 22 }, { "epoch": 0.10722610722610723, "grad_norm": 2.8906738942062002, "learning_rate": 1e-05, "loss": 0.5493, "mean_token_accuracy": 0.8555976152420044, "num_tokens": 217437.0, "step": 23 }, { "epoch": 0.11188811188811189, "grad_norm": 2.8480052706011234, "learning_rate": 9.999403846557509e-06, "loss": 0.5421, "mean_token_accuracy": 0.8500343859195709, "num_tokens": 226725.0, "step": 24 }, { "epoch": 0.11655011655011654, "grad_norm": 2.7151330990573572, "learning_rate": 9.99761554418511e-06, "loss": 0.4959, "mean_token_accuracy": 0.8620002269744873, "num_tokens": 235721.0, "step": 25 }, { "epoch": 0.12121212121212122, "grad_norm": 2.9193258742656867, "learning_rate": 9.99463556670619e-06, "loss": 0.5549, "mean_token_accuracy": 0.8563002645969391, "num_tokens": 244662.0, "step": 26 }, { "epoch": 0.1258741258741259, "grad_norm": 2.9856041530329422, "learning_rate": 9.990464703686895e-06, "loss": 0.5182, "mean_token_accuracy": 0.858866274356842, "num_tokens": 254047.0, "step": 27 }, { "epoch": 0.13053613053613053, "grad_norm": 2.931527022702967, "learning_rate": 9.985104060226937e-06, "loss": 0.5415, "mean_token_accuracy": 0.8544901311397552, "num_tokens": 262770.0, "step": 28 }, { "epoch": 0.1351981351981352, "grad_norm": 2.913225747288928, "learning_rate": 9.978555056666784e-06, "loss": 0.519, "mean_token_accuracy": 0.8577743768692017, "num_tokens": 272936.0, "step": 29 }, { "epoch": 0.13986013986013987, "grad_norm": 3.1388325596538524, "learning_rate": 9.97081942821133e-06, "loss": 0.5488, "mean_token_accuracy": 0.8508030474185944, "num_tokens": 282677.0, "step": 30 }, { "epoch": 0.1445221445221445, "grad_norm": 2.8336187119045966, "learning_rate": 9.961899224470146e-06, "loss": 0.5551, "mean_token_accuracy": 0.8455260097980499, "num_tokens": 291851.0, "step": 31 }, { "epoch": 0.14918414918414918, "grad_norm": 2.8464196245759834, "learning_rate": 9.95179680891442e-06, "loss": 0.5215, "mean_token_accuracy": 0.8570860624313354, "num_tokens": 300775.0, "step": 32 }, { "epoch": 0.15384615384615385, "grad_norm": 3.1695581640338353, "learning_rate": 9.940514858250736e-06, "loss": 0.5782, "mean_token_accuracy": 0.843131422996521, "num_tokens": 309003.0, "step": 33 }, { "epoch": 0.1585081585081585, "grad_norm": 2.648702859970465, "learning_rate": 9.928056361711854e-06, "loss": 0.5384, "mean_token_accuracy": 0.8559990227222443, "num_tokens": 318722.0, "step": 34 }, { "epoch": 0.16317016317016317, "grad_norm": 2.959958214770934, "learning_rate": 9.914424620264714e-06, "loss": 0.5722, "mean_token_accuracy": 0.842935174703598, "num_tokens": 328363.0, "step": 35 }, { "epoch": 0.16783216783216784, "grad_norm": 2.8111816604022652, "learning_rate": 9.899623245735798e-06, "loss": 0.5593, "mean_token_accuracy": 0.848853588104248, "num_tokens": 337298.0, "step": 36 }, { "epoch": 0.17249417249417248, "grad_norm": 2.689318326683542, "learning_rate": 9.883656159854166e-06, "loss": 0.514, "mean_token_accuracy": 0.8601629137992859, "num_tokens": 346068.0, "step": 37 }, { "epoch": 0.17715617715617715, "grad_norm": 2.6642622973952856, "learning_rate": 9.866527593212355e-06, "loss": 0.5347, "mean_token_accuracy": 0.85555499792099, "num_tokens": 354566.0, "step": 38 }, { "epoch": 0.18181818181818182, "grad_norm": 2.4952746525538556, "learning_rate": 9.848242084145462e-06, "loss": 0.4753, "mean_token_accuracy": 0.8724182546138763, "num_tokens": 363662.0, "step": 39 }, { "epoch": 0.1864801864801865, "grad_norm": 2.844156691505105, "learning_rate": 9.82880447752868e-06, "loss": 0.5545, "mean_token_accuracy": 0.8522640764713287, "num_tokens": 372778.0, "step": 40 }, { "epoch": 0.19114219114219114, "grad_norm": 2.830813192153553, "learning_rate": 9.808219923493606e-06, "loss": 0.5447, "mean_token_accuracy": 0.8559394776821136, "num_tokens": 381990.0, "step": 41 }, { "epoch": 0.1958041958041958, "grad_norm": 2.9359560870526633, "learning_rate": 9.786493876063685e-06, "loss": 0.5475, "mean_token_accuracy": 0.8542667627334595, "num_tokens": 390764.0, "step": 42 }, { "epoch": 0.20046620046620048, "grad_norm": 2.6640953874089237, "learning_rate": 9.763632091709125e-06, "loss": 0.5008, "mean_token_accuracy": 0.8638215363025665, "num_tokens": 399544.0, "step": 43 }, { "epoch": 0.20512820512820512, "grad_norm": 2.734444501240376, "learning_rate": 9.739640627821678e-06, "loss": 0.5612, "mean_token_accuracy": 0.8510912954807281, "num_tokens": 408895.0, "step": 44 }, { "epoch": 0.2097902097902098, "grad_norm": 2.656700776297115, "learning_rate": 9.714525841109697e-06, "loss": 0.5091, "mean_token_accuracy": 0.8665460348129272, "num_tokens": 417528.0, "step": 45 }, { "epoch": 0.21445221445221446, "grad_norm": 3.373802699282139, "learning_rate": 9.68829438591387e-06, "loss": 0.5306, "mean_token_accuracy": 0.8545205891132355, "num_tokens": 426632.0, "step": 46 }, { "epoch": 0.2191142191142191, "grad_norm": 2.8176592854523705, "learning_rate": 9.660953212444116e-06, "loss": 0.5676, "mean_token_accuracy": 0.8484572172164917, "num_tokens": 435698.0, "step": 47 }, { "epoch": 0.22377622377622378, "grad_norm": 2.5757476610659764, "learning_rate": 9.632509564938073e-06, "loss": 0.5128, "mean_token_accuracy": 0.8621232509613037, "num_tokens": 444865.0, "step": 48 }, { "epoch": 0.22843822843822845, "grad_norm": 2.636964562018401, "learning_rate": 9.60297097974169e-06, "loss": 0.5074, "mean_token_accuracy": 0.8599043786525726, "num_tokens": 454293.0, "step": 49 }, { "epoch": 0.2331002331002331, "grad_norm": 2.4595885234667842, "learning_rate": 9.572345283312407e-06, "loss": 0.5375, "mean_token_accuracy": 0.8563795983791351, "num_tokens": 463669.0, "step": 50 }, { "epoch": 0.23776223776223776, "grad_norm": 2.9425482274953807, "learning_rate": 9.540640590145496e-06, "loss": 0.5524, "mean_token_accuracy": 0.8539282977581024, "num_tokens": 472913.0, "step": 51 }, { "epoch": 0.24242424242424243, "grad_norm": 2.6095415458131836, "learning_rate": 9.507865300624057e-06, "loss": 0.5173, "mean_token_accuracy": 0.8600243926048279, "num_tokens": 482966.0, "step": 52 }, { "epoch": 0.24708624708624707, "grad_norm": 2.681507115816294, "learning_rate": 9.474028098793277e-06, "loss": 0.5332, "mean_token_accuracy": 0.8583089411258698, "num_tokens": 491361.0, "step": 53 }, { "epoch": 0.2517482517482518, "grad_norm": 2.385759042200182, "learning_rate": 9.439137950059539e-06, "loss": 0.5163, "mean_token_accuracy": 0.8575912415981293, "num_tokens": 500582.0, "step": 54 }, { "epoch": 0.2564102564102564, "grad_norm": 2.5465629384343944, "learning_rate": 9.403204098814965e-06, "loss": 0.5137, "mean_token_accuracy": 0.8564550578594208, "num_tokens": 510444.0, "step": 55 }, { "epoch": 0.26107226107226106, "grad_norm": 2.638187444461748, "learning_rate": 9.366236065988053e-06, "loss": 0.5207, "mean_token_accuracy": 0.8607774972915649, "num_tokens": 519595.0, "step": 56 }, { "epoch": 0.26573426573426573, "grad_norm": 2.625983528806919, "learning_rate": 9.32824364652104e-06, "loss": 0.505, "mean_token_accuracy": 0.861905574798584, "num_tokens": 529256.0, "step": 57 }, { "epoch": 0.2703962703962704, "grad_norm": 2.352386778290299, "learning_rate": 9.289236906774663e-06, "loss": 0.5261, "mean_token_accuracy": 0.8581192195415497, "num_tokens": 538883.0, "step": 58 }, { "epoch": 0.27505827505827507, "grad_norm": 2.513629377813567, "learning_rate": 9.249226181861e-06, "loss": 0.5102, "mean_token_accuracy": 0.8652426302433014, "num_tokens": 547820.0, "step": 59 }, { "epoch": 0.27972027972027974, "grad_norm": 2.5518094476836115, "learning_rate": 9.208222072905113e-06, "loss": 0.5169, "mean_token_accuracy": 0.8610005676746368, "num_tokens": 556572.0, "step": 60 }, { "epoch": 0.28438228438228436, "grad_norm": 2.6584992361477977, "learning_rate": 9.166235444236209e-06, "loss": 0.5414, "mean_token_accuracy": 0.8505589067935944, "num_tokens": 565988.0, "step": 61 }, { "epoch": 0.289044289044289, "grad_norm": 2.6790070596686415, "learning_rate": 9.123277420509053e-06, "loss": 0.5421, "mean_token_accuracy": 0.853904128074646, "num_tokens": 575388.0, "step": 62 }, { "epoch": 0.2937062937062937, "grad_norm": 2.645384290880974, "learning_rate": 9.079359383756411e-06, "loss": 0.5758, "mean_token_accuracy": 0.8486554026603699, "num_tokens": 584991.0, "step": 63 }, { "epoch": 0.29836829836829837, "grad_norm": 2.5250430356867466, "learning_rate": 9.034492970373305e-06, "loss": 0.5289, "mean_token_accuracy": 0.8559047877788544, "num_tokens": 594666.0, "step": 64 }, { "epoch": 0.30303030303030304, "grad_norm": 2.4921775989926704, "learning_rate": 8.988690068033864e-06, "loss": 0.5389, "mean_token_accuracy": 0.8566691875457764, "num_tokens": 603192.0, "step": 65 }, { "epoch": 0.3076923076923077, "grad_norm": 2.5475631559795113, "learning_rate": 8.941962812541604e-06, "loss": 0.5219, "mean_token_accuracy": 0.8545815050601959, "num_tokens": 612501.0, "step": 66 }, { "epoch": 0.3123543123543124, "grad_norm": 2.7404611663741187, "learning_rate": 8.894323584613951e-06, "loss": 0.5343, "mean_token_accuracy": 0.8563965559005737, "num_tokens": 621564.0, "step": 67 }, { "epoch": 0.317016317016317, "grad_norm": 2.5161087036718213, "learning_rate": 8.845785006601898e-06, "loss": 0.4811, "mean_token_accuracy": 0.8693608343601227, "num_tokens": 630726.0, "step": 68 }, { "epoch": 0.32167832167832167, "grad_norm": 2.373054960197776, "learning_rate": 8.796359939145614e-06, "loss": 0.4981, "mean_token_accuracy": 0.864752858877182, "num_tokens": 639950.0, "step": 69 }, { "epoch": 0.32634032634032634, "grad_norm": 2.5926555831182303, "learning_rate": 8.74606147776692e-06, "loss": 0.5095, "mean_token_accuracy": 0.8598109483718872, "num_tokens": 649402.0, "step": 70 }, { "epoch": 0.331002331002331, "grad_norm": 2.5261642541122638, "learning_rate": 8.694902949399555e-06, "loss": 0.4848, "mean_token_accuracy": 0.8674550652503967, "num_tokens": 658474.0, "step": 71 }, { "epoch": 0.3356643356643357, "grad_norm": 2.552689438449325, "learning_rate": 8.642897908858096e-06, "loss": 0.5244, "mean_token_accuracy": 0.8566029667854309, "num_tokens": 667908.0, "step": 72 }, { "epoch": 0.34032634032634035, "grad_norm": 2.366696196458211, "learning_rate": 8.590060135246516e-06, "loss": 0.4982, "mean_token_accuracy": 0.8606800734996796, "num_tokens": 677532.0, "step": 73 }, { "epoch": 0.34498834498834496, "grad_norm": 2.4483720564534113, "learning_rate": 8.53640362830732e-06, "loss": 0.4972, "mean_token_accuracy": 0.8640582263469696, "num_tokens": 686796.0, "step": 74 }, { "epoch": 0.34965034965034963, "grad_norm": 2.4220030766893217, "learning_rate": 8.481942604712209e-06, "loss": 0.5144, "mean_token_accuracy": 0.8601466417312622, "num_tokens": 695776.0, "step": 75 }, { "epoch": 0.3543123543123543, "grad_norm": 2.4508536566710126, "learning_rate": 8.426691494295269e-06, "loss": 0.5292, "mean_token_accuracy": 0.8619424700737, "num_tokens": 704530.0, "step": 76 }, { "epoch": 0.358974358974359, "grad_norm": 2.3974226437864568, "learning_rate": 8.370664936229688e-06, "loss": 0.5145, "mean_token_accuracy": 0.8591651022434235, "num_tokens": 714123.0, "step": 77 }, { "epoch": 0.36363636363636365, "grad_norm": 2.6397896175282898, "learning_rate": 8.313877775149009e-06, "loss": 0.5124, "mean_token_accuracy": 0.8615582883358002, "num_tokens": 723719.0, "step": 78 }, { "epoch": 0.3682983682983683, "grad_norm": 2.6678029454235683, "learning_rate": 8.256345057213925e-06, "loss": 0.5372, "mean_token_accuracy": 0.8539088070392609, "num_tokens": 733447.0, "step": 79 }, { "epoch": 0.372960372960373, "grad_norm": 2.481956729573453, "learning_rate": 8.198082026125707e-06, "loss": 0.522, "mean_token_accuracy": 0.8558786809444427, "num_tokens": 742567.0, "step": 80 }, { "epoch": 0.3776223776223776, "grad_norm": 2.4651078936200856, "learning_rate": 8.139104119087265e-06, "loss": 0.5201, "mean_token_accuracy": 0.8631138801574707, "num_tokens": 751488.0, "step": 81 }, { "epoch": 0.3822843822843823, "grad_norm": 2.342231108488541, "learning_rate": 8.07942696271296e-06, "loss": 0.5112, "mean_token_accuracy": 0.8625693023204803, "num_tokens": 760518.0, "step": 82 }, { "epoch": 0.38694638694638694, "grad_norm": 2.407011283493592, "learning_rate": 8.019066368888222e-06, "loss": 0.4843, "mean_token_accuracy": 0.870231568813324, "num_tokens": 769855.0, "step": 83 }, { "epoch": 0.3916083916083916, "grad_norm": 2.72264066945379, "learning_rate": 7.958038330580067e-06, "loss": 0.5248, "mean_token_accuracy": 0.8568205535411835, "num_tokens": 780309.0, "step": 84 }, { "epoch": 0.3962703962703963, "grad_norm": 2.4515654207303332, "learning_rate": 7.89635901759967e-06, "loss": 0.4773, "mean_token_accuracy": 0.8676798641681671, "num_tokens": 790560.0, "step": 85 }, { "epoch": 0.40093240093240096, "grad_norm": 2.324209463411181, "learning_rate": 7.834044772318033e-06, "loss": 0.4696, "mean_token_accuracy": 0.8676293790340424, "num_tokens": 799972.0, "step": 86 }, { "epoch": 0.40559440559440557, "grad_norm": 2.4053156103185707, "learning_rate": 7.77111210533597e-06, "loss": 0.4985, "mean_token_accuracy": 0.8621641099452972, "num_tokens": 808998.0, "step": 87 }, { "epoch": 0.41025641025641024, "grad_norm": 2.520429601720593, "learning_rate": 7.707577691109519e-06, "loss": 0.5451, "mean_token_accuracy": 0.8532876372337341, "num_tokens": 818322.0, "step": 88 }, { "epoch": 0.4149184149184149, "grad_norm": 2.3400797394939, "learning_rate": 7.6434583635319e-06, "loss": 0.5222, "mean_token_accuracy": 0.8569265902042389, "num_tokens": 828468.0, "step": 89 }, { "epoch": 0.4195804195804196, "grad_norm": 2.3525161266543506, "learning_rate": 7.578771111473276e-06, "loss": 0.5352, "mean_token_accuracy": 0.8604429662227631, "num_tokens": 836909.0, "step": 90 }, { "epoch": 0.42424242424242425, "grad_norm": 2.2935148218456, "learning_rate": 7.513533074279427e-06, "loss": 0.4879, "mean_token_accuracy": 0.8654824793338776, "num_tokens": 845651.0, "step": 91 }, { "epoch": 0.4289044289044289, "grad_norm": 2.5471532688977283, "learning_rate": 7.4477615372305545e-06, "loss": 0.5336, "mean_token_accuracy": 0.8556940853595734, "num_tokens": 854858.0, "step": 92 }, { "epoch": 0.43356643356643354, "grad_norm": 2.3196850637517596, "learning_rate": 7.3814739269614265e-06, "loss": 0.4961, "mean_token_accuracy": 0.8647399842739105, "num_tokens": 863666.0, "step": 93 }, { "epoch": 0.4382284382284382, "grad_norm": 2.347290187249456, "learning_rate": 7.314687806844067e-06, "loss": 0.4886, "mean_token_accuracy": 0.8647028505802155, "num_tokens": 873307.0, "step": 94 }, { "epoch": 0.4428904428904429, "grad_norm": 2.2978535803132463, "learning_rate": 7.247420872334221e-06, "loss": 0.5159, "mean_token_accuracy": 0.8561632037162781, "num_tokens": 882337.0, "step": 95 }, { "epoch": 0.44755244755244755, "grad_norm": 2.2774719947241446, "learning_rate": 7.179690946282808e-06, "loss": 0.5066, "mean_token_accuracy": 0.8596616089344025, "num_tokens": 891528.0, "step": 96 }, { "epoch": 0.4522144522144522, "grad_norm": 2.334129070588941, "learning_rate": 7.111515974213639e-06, "loss": 0.4908, "mean_token_accuracy": 0.8704478442668915, "num_tokens": 900782.0, "step": 97 }, { "epoch": 0.4568764568764569, "grad_norm": 2.293727169950069, "learning_rate": 7.042914019568621e-06, "loss": 0.5212, "mean_token_accuracy": 0.8585403263568878, "num_tokens": 909811.0, "step": 98 }, { "epoch": 0.46153846153846156, "grad_norm": 2.1851004012786155, "learning_rate": 6.973903258921719e-06, "loss": 0.4606, "mean_token_accuracy": 0.8743224740028381, "num_tokens": 919377.0, "step": 99 }, { "epoch": 0.4662004662004662, "grad_norm": 2.325923644586097, "learning_rate": 6.904501977162949e-06, "loss": 0.5284, "mean_token_accuracy": 0.8553546667098999, "num_tokens": 929132.0, "step": 100 }, { "epoch": 0.47086247086247085, "grad_norm": 2.30316408858216, "learning_rate": 6.834728562653659e-06, "loss": 0.5216, "mean_token_accuracy": 0.8589284718036652, "num_tokens": 938942.0, "step": 101 }, { "epoch": 0.4755244755244755, "grad_norm": 2.277086694075995, "learning_rate": 6.764601502354403e-06, "loss": 0.5454, "mean_token_accuracy": 0.8548184633255005, "num_tokens": 948271.0, "step": 102 }, { "epoch": 0.4801864801864802, "grad_norm": 2.229671537868369, "learning_rate": 6.6941393769266995e-06, "loss": 0.4982, "mean_token_accuracy": 0.8633026480674744, "num_tokens": 957852.0, "step": 103 }, { "epoch": 0.48484848484848486, "grad_norm": 2.3287711507436546, "learning_rate": 6.6233608558099405e-06, "loss": 0.4835, "mean_token_accuracy": 0.8708520531654358, "num_tokens": 967455.0, "step": 104 }, { "epoch": 0.48951048951048953, "grad_norm": 2.3590620863308183, "learning_rate": 6.552284692274803e-06, "loss": 0.5271, "mean_token_accuracy": 0.8547607064247131, "num_tokens": 977978.0, "step": 105 }, { "epoch": 0.49417249417249415, "grad_norm": 2.4007057469187916, "learning_rate": 6.48092971845443e-06, "loss": 0.4918, "mean_token_accuracy": 0.8645793497562408, "num_tokens": 987423.0, "step": 106 }, { "epoch": 0.4988344988344988, "grad_norm": 2.4631312633850024, "learning_rate": 6.409314840354724e-06, "loss": 0.5325, "mean_token_accuracy": 0.8552180528640747, "num_tokens": 996656.0, "step": 107 }, { "epoch": 0.5034965034965035, "grad_norm": 2.4910422631378495, "learning_rate": 6.337459032845068e-06, "loss": 0.5376, "mean_token_accuracy": 0.8569700121879578, "num_tokens": 1005952.0, "step": 108 }, { "epoch": 0.5081585081585082, "grad_norm": 2.4102272333499637, "learning_rate": 6.2653813346308e-06, "loss": 0.507, "mean_token_accuracy": 0.8648414313793182, "num_tokens": 1015020.0, "step": 109 }, { "epoch": 0.5128205128205128, "grad_norm": 2.51736810310206, "learning_rate": 6.193100843208772e-06, "loss": 0.523, "mean_token_accuracy": 0.858431875705719, "num_tokens": 1023815.0, "step": 110 }, { "epoch": 0.5174825174825175, "grad_norm": 2.483927792491334, "learning_rate": 6.120636709807334e-06, "loss": 0.5181, "mean_token_accuracy": 0.8595193028450012, "num_tokens": 1032375.0, "step": 111 }, { "epoch": 0.5221445221445221, "grad_norm": 2.323963414867168, "learning_rate": 6.048008134312078e-06, "loss": 0.5038, "mean_token_accuracy": 0.8612522780895233, "num_tokens": 1041287.0, "step": 112 }, { "epoch": 0.5268065268065268, "grad_norm": 2.276747105471765, "learning_rate": 5.975234360178698e-06, "loss": 0.5316, "mean_token_accuracy": 0.8504720032215118, "num_tokens": 1052277.0, "step": 113 }, { "epoch": 0.5314685314685315, "grad_norm": 2.3768143861528803, "learning_rate": 5.902334669334287e-06, "loss": 0.5386, "mean_token_accuracy": 0.8551481366157532, "num_tokens": 1061624.0, "step": 114 }, { "epoch": 0.5361305361305362, "grad_norm": 2.4165115581800736, "learning_rate": 5.829328377068476e-06, "loss": 0.5038, "mean_token_accuracy": 0.8618453145027161, "num_tokens": 1070577.0, "step": 115 }, { "epoch": 0.5407925407925408, "grad_norm": 2.248719282657741, "learning_rate": 5.756234826915686e-06, "loss": 0.4713, "mean_token_accuracy": 0.8681885600090027, "num_tokens": 1080819.0, "step": 116 }, { "epoch": 0.5454545454545454, "grad_norm": 2.469628095969479, "learning_rate": 5.683073385529938e-06, "loss": 0.547, "mean_token_accuracy": 0.8538036346435547, "num_tokens": 1089899.0, "step": 117 }, { "epoch": 0.5501165501165501, "grad_norm": 2.2615322633589248, "learning_rate": 5.60986343755352e-06, "loss": 0.5377, "mean_token_accuracy": 0.8561292290687561, "num_tokens": 1099422.0, "step": 118 }, { "epoch": 0.5547785547785548, "grad_norm": 2.32979977164617, "learning_rate": 5.536624380480878e-06, "loss": 0.5034, "mean_token_accuracy": 0.8641898036003113, "num_tokens": 1108059.0, "step": 119 }, { "epoch": 0.5594405594405595, "grad_norm": 2.144339147442312, "learning_rate": 5.4633756195191235e-06, "loss": 0.485, "mean_token_accuracy": 0.870248019695282, "num_tokens": 1117344.0, "step": 120 }, { "epoch": 0.5641025641025641, "grad_norm": 2.011386160487392, "learning_rate": 5.390136562446482e-06, "loss": 0.4382, "mean_token_accuracy": 0.8803732097148895, "num_tokens": 1126493.0, "step": 121 }, { "epoch": 0.5687645687645687, "grad_norm": 2.286718045896851, "learning_rate": 5.316926614470063e-06, "loss": 0.512, "mean_token_accuracy": 0.8614423274993896, "num_tokens": 1135454.0, "step": 122 }, { "epoch": 0.5734265734265734, "grad_norm": 2.537037105358323, "learning_rate": 5.2437651730843165e-06, "loss": 0.5284, "mean_token_accuracy": 0.8529851138591766, "num_tokens": 1145120.0, "step": 123 }, { "epoch": 0.578088578088578, "grad_norm": 2.3343300964068625, "learning_rate": 5.170671622931527e-06, "loss": 0.4929, "mean_token_accuracy": 0.8647054135799408, "num_tokens": 1154569.0, "step": 124 }, { "epoch": 0.5827505827505828, "grad_norm": 2.097642279394774, "learning_rate": 5.097665330665714e-06, "loss": 0.4827, "mean_token_accuracy": 0.8696144223213196, "num_tokens": 1163964.0, "step": 125 }, { "epoch": 0.5874125874125874, "grad_norm": 2.398628734873881, "learning_rate": 5.024765639821305e-06, "loss": 0.5155, "mean_token_accuracy": 0.8605919480323792, "num_tokens": 1172705.0, "step": 126 }, { "epoch": 0.5920745920745921, "grad_norm": 2.0632119490542307, "learning_rate": 4.951991865687923e-06, "loss": 0.4514, "mean_token_accuracy": 0.872063010931015, "num_tokens": 1182428.0, "step": 127 }, { "epoch": 0.5967365967365967, "grad_norm": 2.2492976140784595, "learning_rate": 4.879363290192667e-06, "loss": 0.4992, "mean_token_accuracy": 0.8648842573165894, "num_tokens": 1191692.0, "step": 128 }, { "epoch": 0.6013986013986014, "grad_norm": 2.4763737198121976, "learning_rate": 4.806899156791231e-06, "loss": 0.5611, "mean_token_accuracy": 0.8499232232570648, "num_tokens": 1200804.0, "step": 129 }, { "epoch": 0.6060606060606061, "grad_norm": 2.3126829795227586, "learning_rate": 4.734618665369202e-06, "loss": 0.4903, "mean_token_accuracy": 0.8685189485549927, "num_tokens": 1209500.0, "step": 130 }, { "epoch": 0.6107226107226107, "grad_norm": 2.273459277732645, "learning_rate": 4.662540967154934e-06, "loss": 0.5257, "mean_token_accuracy": 0.8602505624294281, "num_tokens": 1218360.0, "step": 131 }, { "epoch": 0.6153846153846154, "grad_norm": 2.2496659663705834, "learning_rate": 4.5906851596452765e-06, "loss": 0.4955, "mean_token_accuracy": 0.8618595600128174, "num_tokens": 1227995.0, "step": 132 }, { "epoch": 0.62004662004662, "grad_norm": 2.259941152926795, "learning_rate": 4.519070281545571e-06, "loss": 0.5093, "mean_token_accuracy": 0.8600056171417236, "num_tokens": 1237369.0, "step": 133 }, { "epoch": 0.6247086247086248, "grad_norm": 2.439872298070353, "learning_rate": 4.447715307725197e-06, "loss": 0.5109, "mean_token_accuracy": 0.8662848472595215, "num_tokens": 1246811.0, "step": 134 }, { "epoch": 0.6293706293706294, "grad_norm": 2.3217691889727323, "learning_rate": 4.376639144190061e-06, "loss": 0.5308, "mean_token_accuracy": 0.856608659029007, "num_tokens": 1257728.0, "step": 135 }, { "epoch": 0.634032634032634, "grad_norm": 2.5154363333312952, "learning_rate": 4.305860623073304e-06, "loss": 0.5282, "mean_token_accuracy": 0.8532958924770355, "num_tokens": 1267082.0, "step": 136 }, { "epoch": 0.6386946386946387, "grad_norm": 2.150749527440618, "learning_rate": 4.2353984976456e-06, "loss": 0.4847, "mean_token_accuracy": 0.8674114644527435, "num_tokens": 1276457.0, "step": 137 }, { "epoch": 0.6433566433566433, "grad_norm": 2.4004488123223395, "learning_rate": 4.1652714373463435e-06, "loss": 0.5119, "mean_token_accuracy": 0.8605488240718842, "num_tokens": 1285816.0, "step": 138 }, { "epoch": 0.6480186480186481, "grad_norm": 2.309626827806937, "learning_rate": 4.095498022837051e-06, "loss": 0.4974, "mean_token_accuracy": 0.864313542842865, "num_tokens": 1294833.0, "step": 139 }, { "epoch": 0.6526806526806527, "grad_norm": 2.3480241095920302, "learning_rate": 4.026096741078281e-06, "loss": 0.4916, "mean_token_accuracy": 0.8628659248352051, "num_tokens": 1304626.0, "step": 140 }, { "epoch": 0.6573426573426573, "grad_norm": 2.30703663882747, "learning_rate": 3.957085980431382e-06, "loss": 0.505, "mean_token_accuracy": 0.8645538091659546, "num_tokens": 1314352.0, "step": 141 }, { "epoch": 0.662004662004662, "grad_norm": 2.3462321603678236, "learning_rate": 3.888484025786364e-06, "loss": 0.5181, "mean_token_accuracy": 0.8561761677265167, "num_tokens": 1323815.0, "step": 142 }, { "epoch": 0.6666666666666666, "grad_norm": 2.1292499679236774, "learning_rate": 3.820309053717195e-06, "loss": 0.5081, "mean_token_accuracy": 0.8614768087863922, "num_tokens": 1333085.0, "step": 143 }, { "epoch": 0.6713286713286714, "grad_norm": 2.378840264366356, "learning_rate": 3.75257912766578e-06, "loss": 0.557, "mean_token_accuracy": 0.8496690094470978, "num_tokens": 1342490.0, "step": 144 }, { "epoch": 0.675990675990676, "grad_norm": 2.4574932080087577, "learning_rate": 3.6853121931559334e-06, "loss": 0.5412, "mean_token_accuracy": 0.8501175343990326, "num_tokens": 1351579.0, "step": 145 }, { "epoch": 0.6806526806526807, "grad_norm": 2.174435905448035, "learning_rate": 3.618526073038574e-06, "loss": 0.5034, "mean_token_accuracy": 0.8580139875411987, "num_tokens": 1363017.0, "step": 146 }, { "epoch": 0.6853146853146853, "grad_norm": 2.3281070276733042, "learning_rate": 3.552238462769446e-06, "loss": 0.4875, "mean_token_accuracy": 0.864938497543335, "num_tokens": 1372276.0, "step": 147 }, { "epoch": 0.6899766899766899, "grad_norm": 2.21912732761688, "learning_rate": 3.4864669257205745e-06, "loss": 0.497, "mean_token_accuracy": 0.8623648881912231, "num_tokens": 1381474.0, "step": 148 }, { "epoch": 0.6946386946386947, "grad_norm": 2.381930397952038, "learning_rate": 3.4212288885267246e-06, "loss": 0.5307, "mean_token_accuracy": 0.8609063029289246, "num_tokens": 1390844.0, "step": 149 }, { "epoch": 0.6993006993006993, "grad_norm": 2.2973850752876053, "learning_rate": 3.3565416364681016e-06, "loss": 0.4724, "mean_token_accuracy": 0.8680506646633148, "num_tokens": 1399649.0, "step": 150 }, { "epoch": 0.703962703962704, "grad_norm": 2.4752144217262906, "learning_rate": 3.2924223088904816e-06, "loss": 0.5534, "mean_token_accuracy": 0.8529053032398224, "num_tokens": 1409096.0, "step": 151 }, { "epoch": 0.7086247086247086, "grad_norm": 2.4697356748705404, "learning_rate": 3.228887894664029e-06, "loss": 0.5833, "mean_token_accuracy": 0.8456442058086395, "num_tokens": 1417944.0, "step": 152 }, { "epoch": 0.7132867132867133, "grad_norm": 2.2561615402124398, "learning_rate": 3.1659552276819693e-06, "loss": 0.5316, "mean_token_accuracy": 0.8573636114597321, "num_tokens": 1427079.0, "step": 153 }, { "epoch": 0.717948717948718, "grad_norm": 2.2330254659734594, "learning_rate": 3.1036409824003324e-06, "loss": 0.5144, "mean_token_accuracy": 0.861716091632843, "num_tokens": 1436521.0, "step": 154 }, { "epoch": 0.7226107226107226, "grad_norm": 2.2412294204365333, "learning_rate": 3.0419616694199327e-06, "loss": 0.5027, "mean_token_accuracy": 0.8678925633430481, "num_tokens": 1445553.0, "step": 155 }, { "epoch": 0.7272727272727273, "grad_norm": 2.259593929352767, "learning_rate": 2.98093363111178e-06, "loss": 0.5135, "mean_token_accuracy": 0.8669766783714294, "num_tokens": 1453774.0, "step": 156 }, { "epoch": 0.7319347319347319, "grad_norm": 2.4594381420216607, "learning_rate": 2.92057303728704e-06, "loss": 0.539, "mean_token_accuracy": 0.855047732591629, "num_tokens": 1462611.0, "step": 157 }, { "epoch": 0.7365967365967366, "grad_norm": 2.316483487426212, "learning_rate": 2.860895880912735e-06, "loss": 0.4671, "mean_token_accuracy": 0.8716062903404236, "num_tokens": 1471736.0, "step": 158 }, { "epoch": 0.7412587412587412, "grad_norm": 2.3177493374035256, "learning_rate": 2.801917973874294e-06, "loss": 0.5158, "mean_token_accuracy": 0.8569830656051636, "num_tokens": 1482117.0, "step": 159 }, { "epoch": 0.745920745920746, "grad_norm": 2.3971972763371077, "learning_rate": 2.7436549427860766e-06, "loss": 0.5361, "mean_token_accuracy": 0.8565348982810974, "num_tokens": 1491292.0, "step": 160 }, { "epoch": 0.7505827505827506, "grad_norm": 2.1411052658171426, "learning_rate": 2.6861222248509926e-06, "loss": 0.4865, "mean_token_accuracy": 0.8685896992683411, "num_tokens": 1500735.0, "step": 161 }, { "epoch": 0.7552447552447552, "grad_norm": 2.276293848116446, "learning_rate": 2.6293350637703123e-06, "loss": 0.4799, "mean_token_accuracy": 0.8709887862205505, "num_tokens": 1510190.0, "step": 162 }, { "epoch": 0.7599067599067599, "grad_norm": 2.4261320460180955, "learning_rate": 2.5733085057047325e-06, "loss": 0.5242, "mean_token_accuracy": 0.857810914516449, "num_tokens": 1519207.0, "step": 163 }, { "epoch": 0.7645687645687645, "grad_norm": 2.324362641758302, "learning_rate": 2.518057395287792e-06, "loss": 0.4984, "mean_token_accuracy": 0.8615204393863678, "num_tokens": 1528808.0, "step": 164 }, { "epoch": 0.7692307692307693, "grad_norm": 2.3529932795802018, "learning_rate": 2.463596371692681e-06, "loss": 0.4868, "mean_token_accuracy": 0.867795467376709, "num_tokens": 1537765.0, "step": 165 }, { "epoch": 0.7738927738927739, "grad_norm": 2.419146597375076, "learning_rate": 2.409939864753487e-06, "loss": 0.505, "mean_token_accuracy": 0.8625264167785645, "num_tokens": 1547822.0, "step": 166 }, { "epoch": 0.7785547785547785, "grad_norm": 2.116381511893311, "learning_rate": 2.3571020911419067e-06, "loss": 0.463, "mean_token_accuracy": 0.8741449117660522, "num_tokens": 1557620.0, "step": 167 }, { "epoch": 0.7832167832167832, "grad_norm": 2.3300308626713195, "learning_rate": 2.3050970506004463e-06, "loss": 0.4853, "mean_token_accuracy": 0.8641858994960785, "num_tokens": 1567111.0, "step": 168 }, { "epoch": 0.7878787878787878, "grad_norm": 2.2767831001273713, "learning_rate": 2.2539385222330797e-06, "loss": 0.4728, "mean_token_accuracy": 0.8725703656673431, "num_tokens": 1575836.0, "step": 169 }, { "epoch": 0.7925407925407926, "grad_norm": 2.334989006961217, "learning_rate": 2.203640060854387e-06, "loss": 0.504, "mean_token_accuracy": 0.8669374287128448, "num_tokens": 1584822.0, "step": 170 }, { "epoch": 0.7972027972027972, "grad_norm": 2.2738559617797303, "learning_rate": 2.1542149933981014e-06, "loss": 0.5421, "mean_token_accuracy": 0.8533051311969757, "num_tokens": 1594428.0, "step": 171 }, { "epoch": 0.8018648018648019, "grad_norm": 2.312827620699107, "learning_rate": 2.10567641538605e-06, "loss": 0.5151, "mean_token_accuracy": 0.8604055345058441, "num_tokens": 1603786.0, "step": 172 }, { "epoch": 0.8065268065268065, "grad_norm": 2.1729722956072837, "learning_rate": 2.058037187458398e-06, "loss": 0.4768, "mean_token_accuracy": 0.8706162571907043, "num_tokens": 1612747.0, "step": 173 }, { "epoch": 0.8111888111888111, "grad_norm": 2.1288452988785256, "learning_rate": 2.011309931966136e-06, "loss": 0.4729, "mean_token_accuracy": 0.8719466626644135, "num_tokens": 1621819.0, "step": 174 }, { "epoch": 0.8158508158508159, "grad_norm": 2.664000380251652, "learning_rate": 1.965507029626695e-06, "loss": 0.5164, "mean_token_accuracy": 0.8638178110122681, "num_tokens": 1631685.0, "step": 175 }, { "epoch": 0.8205128205128205, "grad_norm": 2.1258796541566043, "learning_rate": 1.920640616243589e-06, "loss": 0.4603, "mean_token_accuracy": 0.877100944519043, "num_tokens": 1640794.0, "step": 176 }, { "epoch": 0.8251748251748252, "grad_norm": 2.3499685441879845, "learning_rate": 1.8767225794909484e-06, "loss": 0.4905, "mean_token_accuracy": 0.8642638325691223, "num_tokens": 1650186.0, "step": 177 }, { "epoch": 0.8298368298368298, "grad_norm": 2.2575222389518976, "learning_rate": 1.8337645557637929e-06, "loss": 0.4977, "mean_token_accuracy": 0.8628556430339813, "num_tokens": 1659577.0, "step": 178 }, { "epoch": 0.8344988344988346, "grad_norm": 2.2749724550879358, "learning_rate": 1.7917779270948887e-06, "loss": 0.4978, "mean_token_accuracy": 0.8586052358150482, "num_tokens": 1669821.0, "step": 179 }, { "epoch": 0.8391608391608392, "grad_norm": 2.503216275614053, "learning_rate": 1.7507738181390027e-06, "loss": 0.542, "mean_token_accuracy": 0.8548881709575653, "num_tokens": 1679579.0, "step": 180 }, { "epoch": 0.8438228438228438, "grad_norm": 2.309496420384001, "learning_rate": 1.7107630932253383e-06, "loss": 0.4992, "mean_token_accuracy": 0.866202175617218, "num_tokens": 1688922.0, "step": 181 }, { "epoch": 0.8484848484848485, "grad_norm": 2.2088000893568274, "learning_rate": 1.6717563534789594e-06, "loss": 0.5042, "mean_token_accuracy": 0.8664792478084564, "num_tokens": 1697949.0, "step": 182 }, { "epoch": 0.8531468531468531, "grad_norm": 2.1790077110948243, "learning_rate": 1.6337639340119476e-06, "loss": 0.5049, "mean_token_accuracy": 0.8635801076889038, "num_tokens": 1708365.0, "step": 183 }, { "epoch": 0.8578088578088578, "grad_norm": 2.322644087839244, "learning_rate": 1.596795901185037e-06, "loss": 0.5093, "mean_token_accuracy": 0.8596910536289215, "num_tokens": 1717340.0, "step": 184 }, { "epoch": 0.8624708624708625, "grad_norm": 2.153623703135592, "learning_rate": 1.5608620499404628e-06, "loss": 0.5136, "mean_token_accuracy": 0.8647525906562805, "num_tokens": 1727305.0, "step": 185 }, { "epoch": 0.8671328671328671, "grad_norm": 2.4051184830525516, "learning_rate": 1.5259719012067249e-06, "loss": 0.5403, "mean_token_accuracy": 0.8549070060253143, "num_tokens": 1737093.0, "step": 186 }, { "epoch": 0.8717948717948718, "grad_norm": 2.2034389449217735, "learning_rate": 1.4921346993759453e-06, "loss": 0.5071, "mean_token_accuracy": 0.8640574812889099, "num_tokens": 1746772.0, "step": 187 }, { "epoch": 0.8764568764568764, "grad_norm": 2.106806136374632, "learning_rate": 1.459359409854505e-06, "loss": 0.4552, "mean_token_accuracy": 0.8732733726501465, "num_tokens": 1756307.0, "step": 188 }, { "epoch": 0.8811188811188811, "grad_norm": 2.3203500819249596, "learning_rate": 1.4276547166875946e-06, "loss": 0.5126, "mean_token_accuracy": 0.8606568872928619, "num_tokens": 1766010.0, "step": 189 }, { "epoch": 0.8857808857808858, "grad_norm": 2.258227696938333, "learning_rate": 1.397029020258313e-06, "loss": 0.5263, "mean_token_accuracy": 0.8579614460468292, "num_tokens": 1774885.0, "step": 190 }, { "epoch": 0.8904428904428905, "grad_norm": 2.2257353197975673, "learning_rate": 1.367490435061928e-06, "loss": 0.4885, "mean_token_accuracy": 0.8630119860172272, "num_tokens": 1785248.0, "step": 191 }, { "epoch": 0.8951048951048951, "grad_norm": 2.1640943197597413, "learning_rate": 1.3390467875558855e-06, "loss": 0.4807, "mean_token_accuracy": 0.869134396314621, "num_tokens": 1794525.0, "step": 192 }, { "epoch": 0.8997668997668997, "grad_norm": 2.1326960666576587, "learning_rate": 1.3117056140861317e-06, "loss": 0.5064, "mean_token_accuracy": 0.8599035441875458, "num_tokens": 1804413.0, "step": 193 }, { "epoch": 0.9044289044289044, "grad_norm": 2.1347319106028224, "learning_rate": 1.285474158890304e-06, "loss": 0.4704, "mean_token_accuracy": 0.8728452920913696, "num_tokens": 1813695.0, "step": 194 }, { "epoch": 0.9090909090909091, "grad_norm": 2.020006943601936, "learning_rate": 1.2603593721783219e-06, "loss": 0.4503, "mean_token_accuracy": 0.8767442107200623, "num_tokens": 1823851.0, "step": 195 }, { "epoch": 0.9137529137529138, "grad_norm": 2.1574624570969947, "learning_rate": 1.2363679082908766e-06, "loss": 0.4805, "mean_token_accuracy": 0.8633581399917603, "num_tokens": 1833828.0, "step": 196 }, { "epoch": 0.9184149184149184, "grad_norm": 2.3395117245082657, "learning_rate": 1.2135061239363161e-06, "loss": 0.5083, "mean_token_accuracy": 0.863542228937149, "num_tokens": 1842998.0, "step": 197 }, { "epoch": 0.9230769230769231, "grad_norm": 2.28472593102768, "learning_rate": 1.1917800765063954e-06, "loss": 0.5163, "mean_token_accuracy": 0.8649951219558716, "num_tokens": 1851919.0, "step": 198 }, { "epoch": 0.9277389277389277, "grad_norm": 2.364467187406286, "learning_rate": 1.1711955224713209e-06, "loss": 0.5198, "mean_token_accuracy": 0.8597099781036377, "num_tokens": 1860906.0, "step": 199 }, { "epoch": 0.9324009324009324, "grad_norm": 2.3628488712143807, "learning_rate": 1.1517579158545386e-06, "loss": 0.5204, "mean_token_accuracy": 0.8572766482830048, "num_tokens": 1870470.0, "step": 200 }, { "epoch": 0.9370629370629371, "grad_norm": 2.3509216737104297, "learning_rate": 1.1334724067876463e-06, "loss": 0.5263, "mean_token_accuracy": 0.857895165681839, "num_tokens": 1879984.0, "step": 201 }, { "epoch": 0.9417249417249417, "grad_norm": 2.27625332892735, "learning_rate": 1.1163438401458358e-06, "loss": 0.4761, "mean_token_accuracy": 0.8712551891803741, "num_tokens": 1889348.0, "step": 202 }, { "epoch": 0.9463869463869464, "grad_norm": 2.2664430838438303, "learning_rate": 1.1003767542642021e-06, "loss": 0.518, "mean_token_accuracy": 0.8641975820064545, "num_tokens": 1898543.0, "step": 203 }, { "epoch": 0.951048951048951, "grad_norm": 2.154720441862823, "learning_rate": 1.0855753797352868e-06, "loss": 0.4834, "mean_token_accuracy": 0.8657752573490143, "num_tokens": 1908052.0, "step": 204 }, { "epoch": 0.9557109557109557, "grad_norm": 2.184478724115355, "learning_rate": 1.0719436382881466e-06, "loss": 0.4846, "mean_token_accuracy": 0.8683419525623322, "num_tokens": 1917592.0, "step": 205 }, { "epoch": 0.9603729603729604, "grad_norm": 2.218994175211714, "learning_rate": 1.0594851417492665e-06, "loss": 0.5136, "mean_token_accuracy": 0.8631373941898346, "num_tokens": 1927404.0, "step": 206 }, { "epoch": 0.965034965034965, "grad_norm": 2.38088407847355, "learning_rate": 1.0482031910855804e-06, "loss": 0.5129, "mean_token_accuracy": 0.857024222612381, "num_tokens": 1936273.0, "step": 207 }, { "epoch": 0.9696969696969697, "grad_norm": 2.2270852636684437, "learning_rate": 1.0381007755298547e-06, "loss": 0.4865, "mean_token_accuracy": 0.8681848645210266, "num_tokens": 1944830.0, "step": 208 }, { "epoch": 0.9743589743589743, "grad_norm": 2.269354458552895, "learning_rate": 1.029180571788672e-06, "loss": 0.5067, "mean_token_accuracy": 0.8632671236991882, "num_tokens": 1954306.0, "step": 209 }, { "epoch": 0.9790209790209791, "grad_norm": 2.1740483509672273, "learning_rate": 1.021444943333218e-06, "loss": 0.4961, "mean_token_accuracy": 0.8667227923870087, "num_tokens": 1964061.0, "step": 210 }, { "epoch": 0.9836829836829837, "grad_norm": 2.1697738914903746, "learning_rate": 1.0148959397730637e-06, "loss": 0.4679, "mean_token_accuracy": 0.8761565685272217, "num_tokens": 1973286.0, "step": 211 }, { "epoch": 0.9883449883449883, "grad_norm": 2.241781686365417, "learning_rate": 1.0095352963131057e-06, "loss": 0.4946, "mean_token_accuracy": 0.8629972040653229, "num_tokens": 1983373.0, "step": 212 }, { "epoch": 0.993006993006993, "grad_norm": 2.126258981095298, "learning_rate": 1.0053644332938118e-06, "loss": 0.4272, "mean_token_accuracy": 0.8793900609016418, "num_tokens": 1992207.0, "step": 213 }, { "epoch": 0.9976689976689976, "grad_norm": 2.3561589852941816, "learning_rate": 1.0023844558148912e-06, "loss": 0.4912, "mean_token_accuracy": 0.8664555549621582, "num_tokens": 2001400.0, "step": 214 }, { "epoch": 1.0, "grad_norm": 2.3561589852941816, "learning_rate": 1.0005961534424925e-06, "loss": 0.467, "mean_token_accuracy": 0.8875675797462463, "num_tokens": 2003256.0, "step": 215 }, { "epoch": 1.0, "step": 215, "total_flos": 64885863989248.0, "train_loss": 0.5904712042143179, "train_runtime": 1997.1704, "train_samples_per_second": 3.43, "train_steps_per_second": 0.108 } ], "logging_steps": 1, "max_steps": 215, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 64885863989248.0, "train_batch_size": 2, "trial_name": null, "trial_params": null }