{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 215, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004651162790697674, "grad_norm": 19.55866050720215, "learning_rate": 0.0, "loss": 0.842, "mean_token_accuracy": 0.8234314918518066, "step": 1 }, { "epoch": 0.009302325581395349, "grad_norm": 21.536800384521484, "learning_rate": 4.5454545454545457e-07, "loss": 0.8778, "mean_token_accuracy": 0.8231534361839294, "step": 2 }, { "epoch": 0.013953488372093023, "grad_norm": 19.168481826782227, "learning_rate": 9.090909090909091e-07, "loss": 0.8515, "mean_token_accuracy": 0.834034264087677, "step": 3 }, { "epoch": 0.018604651162790697, "grad_norm": 18.268512725830078, "learning_rate": 1.3636363636363636e-06, "loss": 0.8173, "mean_token_accuracy": 0.8309476971626282, "step": 4 }, { "epoch": 0.023255813953488372, "grad_norm": 21.269716262817383, "learning_rate": 1.8181818181818183e-06, "loss": 0.9329, "mean_token_accuracy": 0.8118487000465393, "step": 5 }, { "epoch": 0.027906976744186046, "grad_norm": 18.460010528564453, "learning_rate": 2.2727272727272728e-06, "loss": 0.7823, "mean_token_accuracy": 0.828855574131012, "step": 6 }, { "epoch": 0.03255813953488372, "grad_norm": 16.87262535095215, "learning_rate": 2.7272727272727272e-06, "loss": 0.8115, "mean_token_accuracy": 0.8283237814903259, "step": 7 }, { "epoch": 0.037209302325581395, "grad_norm": 10.028908729553223, "learning_rate": 3.181818181818182e-06, "loss": 0.6377, "mean_token_accuracy": 0.8507297039031982, "step": 8 }, { "epoch": 0.04186046511627907, "grad_norm": 8.71435260772705, "learning_rate": 3.6363636363636366e-06, "loss": 0.5643, "mean_token_accuracy": 0.8626564145088196, "step": 9 }, { "epoch": 0.046511627906976744, "grad_norm": 9.083198547363281, "learning_rate": 4.0909090909090915e-06, "loss": 0.4923, "mean_token_accuracy": 0.8710644841194153, "step": 10 }, { "epoch": 0.05116279069767442, "grad_norm": 8.942933082580566, "learning_rate": 4.5454545454545455e-06, "loss": 0.4216, "mean_token_accuracy": 0.8911864161491394, "step": 11 }, { "epoch": 0.05581395348837209, "grad_norm": 7.374241352081299, "learning_rate": 5e-06, "loss": 0.4411, "mean_token_accuracy": 0.880411684513092, "step": 12 }, { "epoch": 0.06046511627906977, "grad_norm": 4.179415225982666, "learning_rate": 5.4545454545454545e-06, "loss": 0.4198, "mean_token_accuracy": 0.8751418590545654, "step": 13 }, { "epoch": 0.06511627906976744, "grad_norm": 6.282081127166748, "learning_rate": 5.90909090909091e-06, "loss": 0.3647, "mean_token_accuracy": 0.888242781162262, "step": 14 }, { "epoch": 0.06976744186046512, "grad_norm": 3.4604814052581787, "learning_rate": 6.363636363636364e-06, "loss": 0.3436, "mean_token_accuracy": 0.8959692120552063, "step": 15 }, { "epoch": 0.07441860465116279, "grad_norm": 3.8495290279388428, "learning_rate": 6.818181818181818e-06, "loss": 0.3812, "mean_token_accuracy": 0.8860718607902527, "step": 16 }, { "epoch": 0.07906976744186046, "grad_norm": 3.0891449451446533, "learning_rate": 7.272727272727273e-06, "loss": 0.3327, "mean_token_accuracy": 0.902336597442627, "step": 17 }, { "epoch": 0.08372093023255814, "grad_norm": 3.0708651542663574, "learning_rate": 7.727272727272727e-06, "loss": 0.378, "mean_token_accuracy": 0.8839461207389832, "step": 18 }, { "epoch": 0.08837209302325581, "grad_norm": 3.3477752208709717, "learning_rate": 8.181818181818183e-06, "loss": 0.3839, "mean_token_accuracy": 0.8838277459144592, "step": 19 }, { "epoch": 0.09302325581395349, "grad_norm": 2.875257730484009, "learning_rate": 8.636363636363637e-06, "loss": 0.3514, "mean_token_accuracy": 0.8934681415557861, "step": 20 }, { "epoch": 0.09767441860465116, "grad_norm": 3.16715407371521, "learning_rate": 9.090909090909091e-06, "loss": 0.3999, "mean_token_accuracy": 0.8770043849945068, "step": 21 }, { "epoch": 0.10232558139534884, "grad_norm": 3.1992924213409424, "learning_rate": 9.545454545454547e-06, "loss": 0.3521, "mean_token_accuracy": 0.8836778998374939, "step": 22 }, { "epoch": 0.10697674418604651, "grad_norm": 3.009352207183838, "learning_rate": 1e-05, "loss": 0.3456, "mean_token_accuracy": 0.8959909677505493, "step": 23 }, { "epoch": 0.11162790697674418, "grad_norm": 3.262113332748413, "learning_rate": 9.999403846557509e-06, "loss": 0.371, "mean_token_accuracy": 0.8816819787025452, "step": 24 }, { "epoch": 0.11627906976744186, "grad_norm": 3.021036386489868, "learning_rate": 9.99761554418511e-06, "loss": 0.3332, "mean_token_accuracy": 0.8965391516685486, "step": 25 }, { "epoch": 0.12093023255813953, "grad_norm": 3.030052423477173, "learning_rate": 9.99463556670619e-06, "loss": 0.3347, "mean_token_accuracy": 0.897846519947052, "step": 26 }, { "epoch": 0.12558139534883722, "grad_norm": 3.1143341064453125, "learning_rate": 9.990464703686895e-06, "loss": 0.3637, "mean_token_accuracy": 0.8905608654022217, "step": 27 }, { "epoch": 0.13023255813953488, "grad_norm": 3.077057361602783, "learning_rate": 9.985104060226937e-06, "loss": 0.353, "mean_token_accuracy": 0.89174485206604, "step": 28 }, { "epoch": 0.13488372093023257, "grad_norm": 2.9094748497009277, "learning_rate": 9.978555056666784e-06, "loss": 0.3761, "mean_token_accuracy": 0.879203736782074, "step": 29 }, { "epoch": 0.13953488372093023, "grad_norm": 3.0645463466644287, "learning_rate": 9.97081942821133e-06, "loss": 0.3706, "mean_token_accuracy": 0.8864420652389526, "step": 30 }, { "epoch": 0.14418604651162792, "grad_norm": 3.4396867752075195, "learning_rate": 9.961899224470146e-06, "loss": 0.3953, "mean_token_accuracy": 0.8805042505264282, "step": 31 }, { "epoch": 0.14883720930232558, "grad_norm": 3.069671154022217, "learning_rate": 9.95179680891442e-06, "loss": 0.3193, "mean_token_accuracy": 0.9063922762870789, "step": 32 }, { "epoch": 0.15348837209302327, "grad_norm": 3.6594560146331787, "learning_rate": 9.940514858250736e-06, "loss": 0.3566, "mean_token_accuracy": 0.8930913805961609, "step": 33 }, { "epoch": 0.15813953488372093, "grad_norm": 2.9152355194091797, "learning_rate": 9.928056361711854e-06, "loss": 0.3036, "mean_token_accuracy": 0.9053435325622559, "step": 34 }, { "epoch": 0.16279069767441862, "grad_norm": 2.9640631675720215, "learning_rate": 9.914424620264714e-06, "loss": 0.3576, "mean_token_accuracy": 0.8916776776313782, "step": 35 }, { "epoch": 0.16744186046511628, "grad_norm": 3.0034019947052, "learning_rate": 9.899623245735798e-06, "loss": 0.3279, "mean_token_accuracy": 0.8988348245620728, "step": 36 }, { "epoch": 0.17209302325581396, "grad_norm": 3.011780261993408, "learning_rate": 9.883656159854166e-06, "loss": 0.3172, "mean_token_accuracy": 0.9021276831626892, "step": 37 }, { "epoch": 0.17674418604651163, "grad_norm": 3.0025713443756104, "learning_rate": 9.866527593212355e-06, "loss": 0.3317, "mean_token_accuracy": 0.8996185660362244, "step": 38 }, { "epoch": 0.1813953488372093, "grad_norm": 3.0028834342956543, "learning_rate": 9.848242084145462e-06, "loss": 0.3201, "mean_token_accuracy": 0.901199221611023, "step": 39 }, { "epoch": 0.18604651162790697, "grad_norm": 2.8766064643859863, "learning_rate": 9.82880447752868e-06, "loss": 0.3381, "mean_token_accuracy": 0.892432451248169, "step": 40 }, { "epoch": 0.19069767441860466, "grad_norm": 2.992506742477417, "learning_rate": 9.808219923493606e-06, "loss": 0.3319, "mean_token_accuracy": 0.8978930115699768, "step": 41 }, { "epoch": 0.19534883720930232, "grad_norm": 3.164189577102661, "learning_rate": 9.786493876063685e-06, "loss": 0.3297, "mean_token_accuracy": 0.8960608243942261, "step": 42 }, { "epoch": 0.2, "grad_norm": 3.040355920791626, "learning_rate": 9.763632091709125e-06, "loss": 0.3098, "mean_token_accuracy": 0.8975339531898499, "step": 43 }, { "epoch": 0.20465116279069767, "grad_norm": 2.8777122497558594, "learning_rate": 9.739640627821678e-06, "loss": 0.3361, "mean_token_accuracy": 0.8984333872795105, "step": 44 }, { "epoch": 0.20930232558139536, "grad_norm": 3.248021125793457, "learning_rate": 9.714525841109697e-06, "loss": 0.2949, "mean_token_accuracy": 0.9033872485160828, "step": 45 }, { "epoch": 0.21395348837209302, "grad_norm": 3.1287307739257812, "learning_rate": 9.68829438591387e-06, "loss": 0.3029, "mean_token_accuracy": 0.899856686592102, "step": 46 }, { "epoch": 0.2186046511627907, "grad_norm": 3.0051000118255615, "learning_rate": 9.660953212444116e-06, "loss": 0.3143, "mean_token_accuracy": 0.8984231948852539, "step": 47 }, { "epoch": 0.22325581395348837, "grad_norm": 2.8489224910736084, "learning_rate": 9.632509564938073e-06, "loss": 0.3202, "mean_token_accuracy": 0.895948588848114, "step": 48 }, { "epoch": 0.22790697674418606, "grad_norm": 2.9875705242156982, "learning_rate": 9.60297097974169e-06, "loss": 0.3149, "mean_token_accuracy": 0.8959664106369019, "step": 49 }, { "epoch": 0.23255813953488372, "grad_norm": 2.847587823867798, "learning_rate": 9.572345283312407e-06, "loss": 0.316, "mean_token_accuracy": 0.8969941735267639, "step": 50 }, { "epoch": 0.2372093023255814, "grad_norm": 3.1370949745178223, "learning_rate": 9.540640590145496e-06, "loss": 0.3341, "mean_token_accuracy": 0.881118893623352, "step": 51 }, { "epoch": 0.24186046511627907, "grad_norm": 2.850233554840088, "learning_rate": 9.507865300624057e-06, "loss": 0.3356, "mean_token_accuracy": 0.887252688407898, "step": 52 }, { "epoch": 0.24651162790697675, "grad_norm": 2.9406354427337646, "learning_rate": 9.474028098793277e-06, "loss": 0.3124, "mean_token_accuracy": 0.8950287103652954, "step": 53 }, { "epoch": 0.25116279069767444, "grad_norm": 2.7969465255737305, "learning_rate": 9.439137950059539e-06, "loss": 0.3279, "mean_token_accuracy": 0.8895781636238098, "step": 54 }, { "epoch": 0.2558139534883721, "grad_norm": 2.7251291275024414, "learning_rate": 9.403204098814965e-06, "loss": 0.3283, "mean_token_accuracy": 0.8901644349098206, "step": 55 }, { "epoch": 0.26046511627906976, "grad_norm": 2.7642579078674316, "learning_rate": 9.366236065988053e-06, "loss": 0.3221, "mean_token_accuracy": 0.8957247138023376, "step": 56 }, { "epoch": 0.2651162790697674, "grad_norm": 2.3894405364990234, "learning_rate": 9.32824364652104e-06, "loss": 0.281, "mean_token_accuracy": 0.9091808199882507, "step": 57 }, { "epoch": 0.26976744186046514, "grad_norm": 2.4891464710235596, "learning_rate": 9.289236906774663e-06, "loss": 0.3109, "mean_token_accuracy": 0.8954732418060303, "step": 58 }, { "epoch": 0.2744186046511628, "grad_norm": 2.790039539337158, "learning_rate": 9.249226181861e-06, "loss": 0.2908, "mean_token_accuracy": 0.9037843346595764, "step": 59 }, { "epoch": 0.27906976744186046, "grad_norm": 2.580768585205078, "learning_rate": 9.208222072905113e-06, "loss": 0.3069, "mean_token_accuracy": 0.8923306465148926, "step": 60 }, { "epoch": 0.2837209302325581, "grad_norm": 2.7456512451171875, "learning_rate": 9.166235444236209e-06, "loss": 0.3416, "mean_token_accuracy": 0.8841578960418701, "step": 61 }, { "epoch": 0.28837209302325584, "grad_norm": 2.709031105041504, "learning_rate": 9.123277420509053e-06, "loss": 0.3347, "mean_token_accuracy": 0.8882771134376526, "step": 62 }, { "epoch": 0.2930232558139535, "grad_norm": 2.523022413253784, "learning_rate": 9.079359383756411e-06, "loss": 0.3129, "mean_token_accuracy": 0.8984159827232361, "step": 63 }, { "epoch": 0.29767441860465116, "grad_norm": 2.5372958183288574, "learning_rate": 9.034492970373305e-06, "loss": 0.309, "mean_token_accuracy": 0.8964273929595947, "step": 64 }, { "epoch": 0.3023255813953488, "grad_norm": 2.61922025680542, "learning_rate": 8.988690068033864e-06, "loss": 0.3333, "mean_token_accuracy": 0.890192985534668, "step": 65 }, { "epoch": 0.30697674418604654, "grad_norm": 2.3186187744140625, "learning_rate": 8.941962812541604e-06, "loss": 0.2997, "mean_token_accuracy": 0.894925057888031, "step": 66 }, { "epoch": 0.3116279069767442, "grad_norm": 2.499758005142212, "learning_rate": 8.894323584613951e-06, "loss": 0.3195, "mean_token_accuracy": 0.888198733329773, "step": 67 }, { "epoch": 0.31627906976744186, "grad_norm": 2.4142322540283203, "learning_rate": 8.845785006601898e-06, "loss": 0.2809, "mean_token_accuracy": 0.9037378430366516, "step": 68 }, { "epoch": 0.3209302325581395, "grad_norm": 2.5113420486450195, "learning_rate": 8.796359939145614e-06, "loss": 0.3085, "mean_token_accuracy": 0.8951073288917542, "step": 69 }, { "epoch": 0.32558139534883723, "grad_norm": 2.663149833679199, "learning_rate": 8.74606147776692e-06, "loss": 0.3094, "mean_token_accuracy": 0.8915014863014221, "step": 70 }, { "epoch": 0.3302325581395349, "grad_norm": 2.501584768295288, "learning_rate": 8.694902949399555e-06, "loss": 0.3077, "mean_token_accuracy": 0.8995984196662903, "step": 71 }, { "epoch": 0.33488372093023255, "grad_norm": 2.545039176940918, "learning_rate": 8.642897908858096e-06, "loss": 0.3109, "mean_token_accuracy": 0.8962626457214355, "step": 72 }, { "epoch": 0.3395348837209302, "grad_norm": 2.6288673877716064, "learning_rate": 8.590060135246516e-06, "loss": 0.3337, "mean_token_accuracy": 0.8833979368209839, "step": 73 }, { "epoch": 0.34418604651162793, "grad_norm": 2.310521125793457, "learning_rate": 8.53640362830732e-06, "loss": 0.2889, "mean_token_accuracy": 0.8993450403213501, "step": 74 }, { "epoch": 0.3488372093023256, "grad_norm": 2.6337504386901855, "learning_rate": 8.481942604712209e-06, "loss": 0.3167, "mean_token_accuracy": 0.8929409384727478, "step": 75 }, { "epoch": 0.35348837209302325, "grad_norm": 2.338621139526367, "learning_rate": 8.426691494295269e-06, "loss": 0.2867, "mean_token_accuracy": 0.9040859341621399, "step": 76 }, { "epoch": 0.3581395348837209, "grad_norm": 2.469846725463867, "learning_rate": 8.370664936229688e-06, "loss": 0.3127, "mean_token_accuracy": 0.8935756087303162, "step": 77 }, { "epoch": 0.3627906976744186, "grad_norm": 2.4656858444213867, "learning_rate": 8.313877775149009e-06, "loss": 0.2733, "mean_token_accuracy": 0.9058647155761719, "step": 78 }, { "epoch": 0.3674418604651163, "grad_norm": 2.7528796195983887, "learning_rate": 8.256345057213925e-06, "loss": 0.3141, "mean_token_accuracy": 0.8913813233375549, "step": 79 }, { "epoch": 0.37209302325581395, "grad_norm": 2.343507766723633, "learning_rate": 8.198082026125707e-06, "loss": 0.328, "mean_token_accuracy": 0.8872765898704529, "step": 80 }, { "epoch": 0.3767441860465116, "grad_norm": 2.487946033477783, "learning_rate": 8.139104119087265e-06, "loss": 0.2837, "mean_token_accuracy": 0.9029180407524109, "step": 81 }, { "epoch": 0.3813953488372093, "grad_norm": 2.4490132331848145, "learning_rate": 8.07942696271296e-06, "loss": 0.2809, "mean_token_accuracy": 0.9013158082962036, "step": 82 }, { "epoch": 0.386046511627907, "grad_norm": 2.332151174545288, "learning_rate": 8.019066368888222e-06, "loss": 0.2873, "mean_token_accuracy": 0.9034554362297058, "step": 83 }, { "epoch": 0.39069767441860465, "grad_norm": 2.451125383377075, "learning_rate": 7.958038330580067e-06, "loss": 0.3295, "mean_token_accuracy": 0.8829941749572754, "step": 84 }, { "epoch": 0.3953488372093023, "grad_norm": 2.379772186279297, "learning_rate": 7.89635901759967e-06, "loss": 0.297, "mean_token_accuracy": 0.8926709294319153, "step": 85 }, { "epoch": 0.4, "grad_norm": 2.7636427879333496, "learning_rate": 7.834044772318033e-06, "loss": 0.3275, "mean_token_accuracy": 0.8930240273475647, "step": 86 }, { "epoch": 0.4046511627906977, "grad_norm": 2.4831793308258057, "learning_rate": 7.77111210533597e-06, "loss": 0.3006, "mean_token_accuracy": 0.8901177048683167, "step": 87 }, { "epoch": 0.40930232558139534, "grad_norm": 2.845695972442627, "learning_rate": 7.707577691109519e-06, "loss": 0.3559, "mean_token_accuracy": 0.8793193101882935, "step": 88 }, { "epoch": 0.413953488372093, "grad_norm": 2.25897479057312, "learning_rate": 7.6434583635319e-06, "loss": 0.3002, "mean_token_accuracy": 0.9035753011703491, "step": 89 }, { "epoch": 0.4186046511627907, "grad_norm": 2.267224073410034, "learning_rate": 7.578771111473276e-06, "loss": 0.2581, "mean_token_accuracy": 0.9115538001060486, "step": 90 }, { "epoch": 0.4232558139534884, "grad_norm": 2.3631324768066406, "learning_rate": 7.513533074279427e-06, "loss": 0.2676, "mean_token_accuracy": 0.9085960984230042, "step": 91 }, { "epoch": 0.42790697674418604, "grad_norm": 2.47088360786438, "learning_rate": 7.4477615372305545e-06, "loss": 0.3212, "mean_token_accuracy": 0.8931205868721008, "step": 92 }, { "epoch": 0.4325581395348837, "grad_norm": 2.367776393890381, "learning_rate": 7.3814739269614265e-06, "loss": 0.292, "mean_token_accuracy": 0.9006222486495972, "step": 93 }, { "epoch": 0.4372093023255814, "grad_norm": 2.3810348510742188, "learning_rate": 7.314687806844067e-06, "loss": 0.3059, "mean_token_accuracy": 0.8974854946136475, "step": 94 }, { "epoch": 0.4418604651162791, "grad_norm": 2.423929452896118, "learning_rate": 7.247420872334221e-06, "loss": 0.3003, "mean_token_accuracy": 0.8948303461074829, "step": 95 }, { "epoch": 0.44651162790697674, "grad_norm": 2.218552589416504, "learning_rate": 7.179690946282808e-06, "loss": 0.2809, "mean_token_accuracy": 0.9024173617362976, "step": 96 }, { "epoch": 0.4511627906976744, "grad_norm": 2.2407336235046387, "learning_rate": 7.111515974213639e-06, "loss": 0.2469, "mean_token_accuracy": 0.9117849469184875, "step": 97 }, { "epoch": 0.4558139534883721, "grad_norm": 2.3287737369537354, "learning_rate": 7.042914019568621e-06, "loss": 0.302, "mean_token_accuracy": 0.8931969404220581, "step": 98 }, { "epoch": 0.4604651162790698, "grad_norm": 2.180527687072754, "learning_rate": 6.973903258921719e-06, "loss": 0.2553, "mean_token_accuracy": 0.909423291683197, "step": 99 }, { "epoch": 0.46511627906976744, "grad_norm": 2.3433878421783447, "learning_rate": 6.904501977162949e-06, "loss": 0.3257, "mean_token_accuracy": 0.8879437446594238, "step": 100 }, { "epoch": 0.4697674418604651, "grad_norm": 2.3647921085357666, "learning_rate": 6.834728562653659e-06, "loss": 0.3094, "mean_token_accuracy": 0.8909768462181091, "step": 101 }, { "epoch": 0.4744186046511628, "grad_norm": 2.434654951095581, "learning_rate": 6.764601502354403e-06, "loss": 0.3045, "mean_token_accuracy": 0.8957603573799133, "step": 102 }, { "epoch": 0.4790697674418605, "grad_norm": 2.213092088699341, "learning_rate": 6.6941393769266995e-06, "loss": 0.2953, "mean_token_accuracy": 0.8990439176559448, "step": 103 }, { "epoch": 0.48372093023255813, "grad_norm": 2.135453701019287, "learning_rate": 6.6233608558099405e-06, "loss": 0.2752, "mean_token_accuracy": 0.9063274264335632, "step": 104 }, { "epoch": 0.4883720930232558, "grad_norm": 2.2655882835388184, "learning_rate": 6.552284692274803e-06, "loss": 0.3077, "mean_token_accuracy": 0.8922848701477051, "step": 105 }, { "epoch": 0.4930232558139535, "grad_norm": 2.3760480880737305, "learning_rate": 6.48092971845443e-06, "loss": 0.2796, "mean_token_accuracy": 0.9028503894805908, "step": 106 }, { "epoch": 0.49767441860465117, "grad_norm": 2.3789312839508057, "learning_rate": 6.409314840354724e-06, "loss": 0.3371, "mean_token_accuracy": 0.889424741268158, "step": 107 }, { "epoch": 0.5023255813953489, "grad_norm": 2.499450445175171, "learning_rate": 6.337459032845068e-06, "loss": 0.3151, "mean_token_accuracy": 0.8880661129951477, "step": 108 }, { "epoch": 0.5069767441860465, "grad_norm": 2.3901238441467285, "learning_rate": 6.2653813346308e-06, "loss": 0.2715, "mean_token_accuracy": 0.9052498936653137, "step": 109 }, { "epoch": 0.5116279069767442, "grad_norm": 2.2736220359802246, "learning_rate": 6.193100843208772e-06, "loss": 0.2802, "mean_token_accuracy": 0.8982987403869629, "step": 110 }, { "epoch": 0.5162790697674419, "grad_norm": 2.339315176010132, "learning_rate": 6.120636709807334e-06, "loss": 0.3087, "mean_token_accuracy": 0.8898224234580994, "step": 111 }, { "epoch": 0.5209302325581395, "grad_norm": 2.381701707839966, "learning_rate": 6.048008134312078e-06, "loss": 0.2888, "mean_token_accuracy": 0.8999055624008179, "step": 112 }, { "epoch": 0.5255813953488372, "grad_norm": 2.3778223991394043, "learning_rate": 5.975234360178698e-06, "loss": 0.3245, "mean_token_accuracy": 0.8921954035758972, "step": 113 }, { "epoch": 0.5302325581395348, "grad_norm": 2.1973538398742676, "learning_rate": 5.902334669334287e-06, "loss": 0.299, "mean_token_accuracy": 0.9011526107788086, "step": 114 }, { "epoch": 0.5348837209302325, "grad_norm": 2.4363880157470703, "learning_rate": 5.829328377068476e-06, "loss": 0.295, "mean_token_accuracy": 0.8934922218322754, "step": 115 }, { "epoch": 0.5395348837209303, "grad_norm": 2.4742653369903564, "learning_rate": 5.756234826915686e-06, "loss": 0.2994, "mean_token_accuracy": 0.9003058075904846, "step": 116 }, { "epoch": 0.5441860465116279, "grad_norm": 2.5611572265625, "learning_rate": 5.683073385529938e-06, "loss": 0.3118, "mean_token_accuracy": 0.8888066411018372, "step": 117 }, { "epoch": 0.5488372093023256, "grad_norm": 2.1916542053222656, "learning_rate": 5.60986343755352e-06, "loss": 0.2611, "mean_token_accuracy": 0.907447338104248, "step": 118 }, { "epoch": 0.5534883720930233, "grad_norm": 2.4621665477752686, "learning_rate": 5.536624380480878e-06, "loss": 0.2504, "mean_token_accuracy": 0.9125564694404602, "step": 119 }, { "epoch": 0.5581395348837209, "grad_norm": 2.305725336074829, "learning_rate": 5.4633756195191235e-06, "loss": 0.2594, "mean_token_accuracy": 0.909368097782135, "step": 120 }, { "epoch": 0.5627906976744186, "grad_norm": 2.0305423736572266, "learning_rate": 5.390136562446482e-06, "loss": 0.2259, "mean_token_accuracy": 0.9176449775695801, "step": 121 }, { "epoch": 0.5674418604651162, "grad_norm": 2.3692667484283447, "learning_rate": 5.316926614470063e-06, "loss": 0.3034, "mean_token_accuracy": 0.8940587043762207, "step": 122 }, { "epoch": 0.5720930232558139, "grad_norm": 2.6239306926727295, "learning_rate": 5.2437651730843165e-06, "loss": 0.3362, "mean_token_accuracy": 0.8789413571357727, "step": 123 }, { "epoch": 0.5767441860465117, "grad_norm": 2.5017409324645996, "learning_rate": 5.170671622931527e-06, "loss": 0.3094, "mean_token_accuracy": 0.8925363421440125, "step": 124 }, { "epoch": 0.5813953488372093, "grad_norm": 2.0600509643554688, "learning_rate": 5.097665330665714e-06, "loss": 0.2368, "mean_token_accuracy": 0.916695237159729, "step": 125 }, { "epoch": 0.586046511627907, "grad_norm": 2.5883283615112305, "learning_rate": 5.024765639821305e-06, "loss": 0.3191, "mean_token_accuracy": 0.894444465637207, "step": 126 }, { "epoch": 0.5906976744186047, "grad_norm": 2.050201654434204, "learning_rate": 4.951991865687923e-06, "loss": 0.2501, "mean_token_accuracy": 0.9178641438484192, "step": 127 }, { "epoch": 0.5953488372093023, "grad_norm": 2.357882499694824, "learning_rate": 4.879363290192667e-06, "loss": 0.2938, "mean_token_accuracy": 0.9023271799087524, "step": 128 }, { "epoch": 0.6, "grad_norm": 2.713916063308716, "learning_rate": 4.806899156791231e-06, "loss": 0.3558, "mean_token_accuracy": 0.8827831745147705, "step": 129 }, { "epoch": 0.6046511627906976, "grad_norm": 2.365781307220459, "learning_rate": 4.734618665369202e-06, "loss": 0.2804, "mean_token_accuracy": 0.8971909284591675, "step": 130 }, { "epoch": 0.6093023255813953, "grad_norm": 2.310689926147461, "learning_rate": 4.662540967154934e-06, "loss": 0.2656, "mean_token_accuracy": 0.9065172076225281, "step": 131 }, { "epoch": 0.6139534883720931, "grad_norm": 2.114121913909912, "learning_rate": 4.5906851596452765e-06, "loss": 0.2685, "mean_token_accuracy": 0.9042183756828308, "step": 132 }, { "epoch": 0.6186046511627907, "grad_norm": 2.287637948989868, "learning_rate": 4.519070281545571e-06, "loss": 0.3034, "mean_token_accuracy": 0.8936946392059326, "step": 133 }, { "epoch": 0.6232558139534884, "grad_norm": 2.266719341278076, "learning_rate": 4.447715307725197e-06, "loss": 0.3081, "mean_token_accuracy": 0.8978622555732727, "step": 134 }, { "epoch": 0.627906976744186, "grad_norm": 2.2800838947296143, "learning_rate": 4.376639144190061e-06, "loss": 0.2984, "mean_token_accuracy": 0.8969523310661316, "step": 135 }, { "epoch": 0.6325581395348837, "grad_norm": 2.5165393352508545, "learning_rate": 4.305860623073304e-06, "loss": 0.2959, "mean_token_accuracy": 0.898727536201477, "step": 136 }, { "epoch": 0.6372093023255814, "grad_norm": 2.1377274990081787, "learning_rate": 4.2353984976456e-06, "loss": 0.2779, "mean_token_accuracy": 0.9044293165206909, "step": 137 }, { "epoch": 0.641860465116279, "grad_norm": 2.179332971572876, "learning_rate": 4.1652714373463435e-06, "loss": 0.2864, "mean_token_accuracy": 0.9005101919174194, "step": 138 }, { "epoch": 0.6465116279069767, "grad_norm": 2.23024320602417, "learning_rate": 4.095498022837051e-06, "loss": 0.2712, "mean_token_accuracy": 0.9082063436508179, "step": 139 }, { "epoch": 0.6511627906976745, "grad_norm": 2.311195135116577, "learning_rate": 4.026096741078281e-06, "loss": 0.3099, "mean_token_accuracy": 0.8930677175521851, "step": 140 }, { "epoch": 0.6558139534883721, "grad_norm": 2.3037424087524414, "learning_rate": 3.957085980431382e-06, "loss": 0.3041, "mean_token_accuracy": 0.8964273929595947, "step": 141 }, { "epoch": 0.6604651162790698, "grad_norm": 2.166527509689331, "learning_rate": 3.888484025786364e-06, "loss": 0.2771, "mean_token_accuracy": 0.9047784209251404, "step": 142 }, { "epoch": 0.6651162790697674, "grad_norm": 2.092200756072998, "learning_rate": 3.820309053717195e-06, "loss": 0.2628, "mean_token_accuracy": 0.9099807739257812, "step": 143 }, { "epoch": 0.6697674418604651, "grad_norm": 2.402787446975708, "learning_rate": 3.75257912766578e-06, "loss": 0.3491, "mean_token_accuracy": 0.8836612701416016, "step": 144 }, { "epoch": 0.6744186046511628, "grad_norm": 2.40132737159729, "learning_rate": 3.6853121931559334e-06, "loss": 0.3185, "mean_token_accuracy": 0.8895066976547241, "step": 145 }, { "epoch": 0.6790697674418604, "grad_norm": 2.2350831031799316, "learning_rate": 3.618526073038574e-06, "loss": 0.3344, "mean_token_accuracy": 0.8823676109313965, "step": 146 }, { "epoch": 0.6837209302325581, "grad_norm": 2.335584878921509, "learning_rate": 3.552238462769446e-06, "loss": 0.2788, "mean_token_accuracy": 0.8992438912391663, "step": 147 }, { "epoch": 0.6883720930232559, "grad_norm": 2.4658241271972656, "learning_rate": 3.4864669257205745e-06, "loss": 0.2697, "mean_token_accuracy": 0.9067319631576538, "step": 148 }, { "epoch": 0.6930232558139535, "grad_norm": 2.318817377090454, "learning_rate": 3.4212288885267246e-06, "loss": 0.3142, "mean_token_accuracy": 0.8924602270126343, "step": 149 }, { "epoch": 0.6976744186046512, "grad_norm": 2.45670223236084, "learning_rate": 3.3565416364681016e-06, "loss": 0.2819, "mean_token_accuracy": 0.8985480070114136, "step": 150 }, { "epoch": 0.7023255813953488, "grad_norm": 2.082231044769287, "learning_rate": 3.2924223088904816e-06, "loss": 0.2731, "mean_token_accuracy": 0.9048190712928772, "step": 151 }, { "epoch": 0.7069767441860465, "grad_norm": 2.509894847869873, "learning_rate": 3.228887894664029e-06, "loss": 0.3314, "mean_token_accuracy": 0.8872409462928772, "step": 152 }, { "epoch": 0.7116279069767442, "grad_norm": 2.383643388748169, "learning_rate": 3.1659552276819693e-06, "loss": 0.3066, "mean_token_accuracy": 0.892098069190979, "step": 153 }, { "epoch": 0.7162790697674418, "grad_norm": 2.2269604206085205, "learning_rate": 3.1036409824003324e-06, "loss": 0.2792, "mean_token_accuracy": 0.9020003080368042, "step": 154 }, { "epoch": 0.7209302325581395, "grad_norm": 2.065215826034546, "learning_rate": 3.0419616694199327e-06, "loss": 0.2585, "mean_token_accuracy": 0.9109966158866882, "step": 155 }, { "epoch": 0.7255813953488373, "grad_norm": 2.148339033126831, "learning_rate": 2.98093363111178e-06, "loss": 0.236, "mean_token_accuracy": 0.9179540872573853, "step": 156 }, { "epoch": 0.7302325581395349, "grad_norm": 2.51432204246521, "learning_rate": 2.92057303728704e-06, "loss": 0.2938, "mean_token_accuracy": 0.8990790247917175, "step": 157 }, { "epoch": 0.7348837209302326, "grad_norm": 2.2039244174957275, "learning_rate": 2.860895880912735e-06, "loss": 0.279, "mean_token_accuracy": 0.9065436720848083, "step": 158 }, { "epoch": 0.7395348837209302, "grad_norm": 2.268071174621582, "learning_rate": 2.801917973874294e-06, "loss": 0.2978, "mean_token_accuracy": 0.8923124074935913, "step": 159 }, { "epoch": 0.7441860465116279, "grad_norm": 2.350569248199463, "learning_rate": 2.7436549427860766e-06, "loss": 0.3165, "mean_token_accuracy": 0.8912504315376282, "step": 160 }, { "epoch": 0.7488372093023256, "grad_norm": 2.0372023582458496, "learning_rate": 2.6861222248509926e-06, "loss": 0.2444, "mean_token_accuracy": 0.9146341681480408, "step": 161 }, { "epoch": 0.7534883720930232, "grad_norm": 2.0885045528411865, "learning_rate": 2.6293350637703123e-06, "loss": 0.2747, "mean_token_accuracy": 0.9104732871055603, "step": 162 }, { "epoch": 0.7581395348837209, "grad_norm": 2.4233343601226807, "learning_rate": 2.5733085057047325e-06, "loss": 0.2845, "mean_token_accuracy": 0.9028448462486267, "step": 163 }, { "epoch": 0.7627906976744186, "grad_norm": 2.1531500816345215, "learning_rate": 2.518057395287792e-06, "loss": 0.2964, "mean_token_accuracy": 0.8945344090461731, "step": 164 }, { "epoch": 0.7674418604651163, "grad_norm": 2.34539532661438, "learning_rate": 2.463596371692681e-06, "loss": 0.2939, "mean_token_accuracy": 0.8953551650047302, "step": 165 }, { "epoch": 0.772093023255814, "grad_norm": 2.0955286026000977, "learning_rate": 2.409939864753487e-06, "loss": 0.2916, "mean_token_accuracy": 0.898024320602417, "step": 166 }, { "epoch": 0.7767441860465116, "grad_norm": 2.1634206771850586, "learning_rate": 2.3571020911419067e-06, "loss": 0.2789, "mean_token_accuracy": 0.9082539677619934, "step": 167 }, { "epoch": 0.7813953488372093, "grad_norm": 2.386928081512451, "learning_rate": 2.3050970506004463e-06, "loss": 0.3075, "mean_token_accuracy": 0.8937572240829468, "step": 168 }, { "epoch": 0.786046511627907, "grad_norm": 2.380465030670166, "learning_rate": 2.2539385222330797e-06, "loss": 0.2494, "mean_token_accuracy": 0.9121189117431641, "step": 169 }, { "epoch": 0.7906976744186046, "grad_norm": 2.232485055923462, "learning_rate": 2.203640060854387e-06, "loss": 0.2626, "mean_token_accuracy": 0.9113078117370605, "step": 170 }, { "epoch": 0.7953488372093023, "grad_norm": 2.1620066165924072, "learning_rate": 2.1542149933981014e-06, "loss": 0.2955, "mean_token_accuracy": 0.899713933467865, "step": 171 }, { "epoch": 0.8, "grad_norm": 2.135443925857544, "learning_rate": 2.10567641538605e-06, "loss": 0.2718, "mean_token_accuracy": 0.9112734794616699, "step": 172 }, { "epoch": 0.8046511627906977, "grad_norm": 2.0903422832489014, "learning_rate": 2.058037187458398e-06, "loss": 0.285, "mean_token_accuracy": 0.9051055312156677, "step": 173 }, { "epoch": 0.8093023255813954, "grad_norm": 2.3708086013793945, "learning_rate": 2.011309931966136e-06, "loss": 0.2787, "mean_token_accuracy": 0.904355525970459, "step": 174 }, { "epoch": 0.813953488372093, "grad_norm": 2.1600074768066406, "learning_rate": 1.965507029626695e-06, "loss": 0.2869, "mean_token_accuracy": 0.8876973390579224, "step": 175 }, { "epoch": 0.8186046511627907, "grad_norm": 2.169403314590454, "learning_rate": 1.920640616243589e-06, "loss": 0.2556, "mean_token_accuracy": 0.9110191464424133, "step": 176 }, { "epoch": 0.8232558139534883, "grad_norm": 2.4098989963531494, "learning_rate": 1.8767225794909484e-06, "loss": 0.3099, "mean_token_accuracy": 0.8926380276679993, "step": 177 }, { "epoch": 0.827906976744186, "grad_norm": 2.0924203395843506, "learning_rate": 1.8337645557637929e-06, "loss": 0.2685, "mean_token_accuracy": 0.9054539203643799, "step": 178 }, { "epoch": 0.8325581395348837, "grad_norm": 2.10318660736084, "learning_rate": 1.7917779270948887e-06, "loss": 0.287, "mean_token_accuracy": 0.9022500514984131, "step": 179 }, { "epoch": 0.8372093023255814, "grad_norm": 2.266540288925171, "learning_rate": 1.7507738181390027e-06, "loss": 0.2751, "mean_token_accuracy": 0.9026884436607361, "step": 180 }, { "epoch": 0.8418604651162791, "grad_norm": 2.2889575958251953, "learning_rate": 1.7107630932253383e-06, "loss": 0.2791, "mean_token_accuracy": 0.9028925895690918, "step": 181 }, { "epoch": 0.8465116279069768, "grad_norm": 2.204096555709839, "learning_rate": 1.6717563534789594e-06, "loss": 0.2856, "mean_token_accuracy": 0.9041808843612671, "step": 182 }, { "epoch": 0.8511627906976744, "grad_norm": 2.236905097961426, "learning_rate": 1.6337639340119476e-06, "loss": 0.2896, "mean_token_accuracy": 0.8966881632804871, "step": 183 }, { "epoch": 0.8558139534883721, "grad_norm": 2.307908296585083, "learning_rate": 1.596795901185037e-06, "loss": 0.2973, "mean_token_accuracy": 0.8991920948028564, "step": 184 }, { "epoch": 0.8604651162790697, "grad_norm": 1.9844419956207275, "learning_rate": 1.5608620499404628e-06, "loss": 0.2689, "mean_token_accuracy": 0.9050772786140442, "step": 185 }, { "epoch": 0.8651162790697674, "grad_norm": 2.2421247959136963, "learning_rate": 1.5259719012067249e-06, "loss": 0.299, "mean_token_accuracy": 0.8975785374641418, "step": 186 }, { "epoch": 0.8697674418604651, "grad_norm": 2.2404239177703857, "learning_rate": 1.4921346993759453e-06, "loss": 0.2618, "mean_token_accuracy": 0.905358612537384, "step": 187 }, { "epoch": 0.8744186046511628, "grad_norm": 2.1030170917510986, "learning_rate": 1.459359409854505e-06, "loss": 0.2777, "mean_token_accuracy": 0.9086073637008667, "step": 188 }, { "epoch": 0.8790697674418605, "grad_norm": 2.15631365776062, "learning_rate": 1.4276547166875946e-06, "loss": 0.2572, "mean_token_accuracy": 0.9099292159080505, "step": 189 }, { "epoch": 0.8837209302325582, "grad_norm": 2.330944299697876, "learning_rate": 1.397029020258313e-06, "loss": 0.2763, "mean_token_accuracy": 0.8994728922843933, "step": 190 }, { "epoch": 0.8883720930232558, "grad_norm": 2.309465169906616, "learning_rate": 1.367490435061928e-06, "loss": 0.3225, "mean_token_accuracy": 0.886062741279602, "step": 191 }, { "epoch": 0.8930232558139535, "grad_norm": 2.127525806427002, "learning_rate": 1.3390467875558855e-06, "loss": 0.2417, "mean_token_accuracy": 0.9141114950180054, "step": 192 }, { "epoch": 0.8976744186046511, "grad_norm": 2.108126640319824, "learning_rate": 1.3117056140861317e-06, "loss": 0.2816, "mean_token_accuracy": 0.9047395586967468, "step": 193 }, { "epoch": 0.9023255813953488, "grad_norm": 2.094708204269409, "learning_rate": 1.285474158890304e-06, "loss": 0.2558, "mean_token_accuracy": 0.9168649911880493, "step": 194 }, { "epoch": 0.9069767441860465, "grad_norm": 2.037085771560669, "learning_rate": 1.2603593721783219e-06, "loss": 0.2597, "mean_token_accuracy": 0.9116804599761963, "step": 195 }, { "epoch": 0.9116279069767442, "grad_norm": 2.141491413116455, "learning_rate": 1.2363679082908766e-06, "loss": 0.2917, "mean_token_accuracy": 0.9007202982902527, "step": 196 }, { "epoch": 0.9162790697674419, "grad_norm": 2.208596706390381, "learning_rate": 1.2135061239363161e-06, "loss": 0.2499, "mean_token_accuracy": 0.9134494662284851, "step": 197 }, { "epoch": 0.9209302325581395, "grad_norm": 2.2450554370880127, "learning_rate": 1.1917800765063954e-06, "loss": 0.2626, "mean_token_accuracy": 0.9065197706222534, "step": 198 }, { "epoch": 0.9255813953488372, "grad_norm": 2.408583879470825, "learning_rate": 1.1711955224713209e-06, "loss": 0.2875, "mean_token_accuracy": 0.9005586504936218, "step": 199 }, { "epoch": 0.9302325581395349, "grad_norm": 2.1336426734924316, "learning_rate": 1.1517579158545386e-06, "loss": 0.2615, "mean_token_accuracy": 0.9102848172187805, "step": 200 }, { "epoch": 0.9348837209302325, "grad_norm": 2.3364694118499756, "learning_rate": 1.1334724067876463e-06, "loss": 0.2908, "mean_token_accuracy": 0.9005729556083679, "step": 201 }, { "epoch": 0.9395348837209302, "grad_norm": 2.078341007232666, "learning_rate": 1.1163438401458358e-06, "loss": 0.2576, "mean_token_accuracy": 0.9106926918029785, "step": 202 }, { "epoch": 0.9441860465116279, "grad_norm": 2.2890896797180176, "learning_rate": 1.1003767542642021e-06, "loss": 0.2759, "mean_token_accuracy": 0.9083694219589233, "step": 203 }, { "epoch": 0.9488372093023256, "grad_norm": 2.0735230445861816, "learning_rate": 1.0855753797352868e-06, "loss": 0.2423, "mean_token_accuracy": 0.9119083881378174, "step": 204 }, { "epoch": 0.9534883720930233, "grad_norm": 2.030658006668091, "learning_rate": 1.0719436382881466e-06, "loss": 0.2534, "mean_token_accuracy": 0.9100484848022461, "step": 205 }, { "epoch": 0.958139534883721, "grad_norm": 2.127164363861084, "learning_rate": 1.0594851417492665e-06, "loss": 0.2728, "mean_token_accuracy": 0.9037346839904785, "step": 206 }, { "epoch": 0.9627906976744186, "grad_norm": 2.3576440811157227, "learning_rate": 1.0482031910855804e-06, "loss": 0.293, "mean_token_accuracy": 0.8944464921951294, "step": 207 }, { "epoch": 0.9674418604651163, "grad_norm": 2.2039594650268555, "learning_rate": 1.0381007755298547e-06, "loss": 0.2671, "mean_token_accuracy": 0.9105979800224304, "step": 208 }, { "epoch": 0.9720930232558139, "grad_norm": 2.1151583194732666, "learning_rate": 1.029180571788672e-06, "loss": 0.2481, "mean_token_accuracy": 0.9147457480430603, "step": 209 }, { "epoch": 0.9767441860465116, "grad_norm": 1.9925205707550049, "learning_rate": 1.021444943333218e-06, "loss": 0.2566, "mean_token_accuracy": 0.9106199145317078, "step": 210 }, { "epoch": 0.9813953488372092, "grad_norm": 2.154791831970215, "learning_rate": 1.0148959397730637e-06, "loss": 0.2524, "mean_token_accuracy": 0.9126606583595276, "step": 211 }, { "epoch": 0.986046511627907, "grad_norm": 2.046583890914917, "learning_rate": 1.0095352963131057e-06, "loss": 0.2764, "mean_token_accuracy": 0.9061299562454224, "step": 212 }, { "epoch": 0.9906976744186047, "grad_norm": 2.164486885070801, "learning_rate": 1.0053644332938118e-06, "loss": 0.2457, "mean_token_accuracy": 0.9103270769119263, "step": 213 }, { "epoch": 0.9953488372093023, "grad_norm": 2.152712345123291, "learning_rate": 1.0023844558148912e-06, "loss": 0.2898, "mean_token_accuracy": 0.8999999761581421, "step": 214 }, { "epoch": 1.0, "grad_norm": 1.9525059461593628, "learning_rate": 1.0005961534424925e-06, "loss": 0.2203, "mean_token_accuracy": 0.9142746329307556, "step": 215 }, { "epoch": 1.0, "step": 215, "total_flos": 2.0144468407196058e+17, "train_loss": 0.32296112443125524, "train_runtime": 757.3407, "train_samples_per_second": 9.046, "train_steps_per_second": 0.284 } ], "logging_steps": 1, "max_steps": 215, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2.0144468407196058e+17, "train_batch_size": 4, "trial_name": null, "trial_params": null }