HectorHe's picture
Model save
2f097a0 verified
Raw
History Blame Contribute Delete
144 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 645,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.004651162790697674,
"grad_norm": 19.568607330322266,
"learning_rate": 0.0,
"loss": 0.842,
"mean_token_accuracy": 0.8234314918518066,
"step": 1
},
{
"epoch": 0.009302325581395349,
"grad_norm": 21.537723541259766,
"learning_rate": 1.5384615384615387e-07,
"loss": 0.8778,
"mean_token_accuracy": 0.8231534361839294,
"step": 2
},
{
"epoch": 0.013953488372093023,
"grad_norm": 19.284854888916016,
"learning_rate": 3.0769230769230774e-07,
"loss": 0.8509,
"mean_token_accuracy": 0.8327401876449585,
"step": 3
},
{
"epoch": 0.018604651162790697,
"grad_norm": 18.94418716430664,
"learning_rate": 4.615384615384616e-07,
"loss": 0.8236,
"mean_token_accuracy": 0.8300436735153198,
"step": 4
},
{
"epoch": 0.023255813953488372,
"grad_norm": 22.949390411376953,
"learning_rate": 6.153846153846155e-07,
"loss": 0.9618,
"mean_token_accuracy": 0.8052875399589539,
"step": 5
},
{
"epoch": 0.027906976744186046,
"grad_norm": 22.52558135986328,
"learning_rate": 7.692307692307694e-07,
"loss": 0.8629,
"mean_token_accuracy": 0.8194347620010376,
"step": 6
},
{
"epoch": 0.03255813953488372,
"grad_norm": 21.534772872924805,
"learning_rate": 9.230769230769232e-07,
"loss": 0.9071,
"mean_token_accuracy": 0.8167065978050232,
"step": 7
},
{
"epoch": 0.037209302325581395,
"grad_norm": 15.813007354736328,
"learning_rate": 1.076923076923077e-06,
"loss": 0.8068,
"mean_token_accuracy": 0.8270938992500305,
"step": 8
},
{
"epoch": 0.04186046511627907,
"grad_norm": 14.425293922424316,
"learning_rate": 1.230769230769231e-06,
"loss": 0.7203,
"mean_token_accuracy": 0.8420020937919617,
"step": 9
},
{
"epoch": 0.046511627906976744,
"grad_norm": 15.85297966003418,
"learning_rate": 1.3846153846153848e-06,
"loss": 0.7537,
"mean_token_accuracy": 0.8397467732429504,
"step": 10
},
{
"epoch": 0.05116279069767442,
"grad_norm": 15.877695083618164,
"learning_rate": 1.5384615384615387e-06,
"loss": 0.7201,
"mean_token_accuracy": 0.8532203435897827,
"step": 11
},
{
"epoch": 0.05581395348837209,
"grad_norm": 11.435991287231445,
"learning_rate": 1.6923076923076926e-06,
"loss": 0.6885,
"mean_token_accuracy": 0.8493710160255432,
"step": 12
},
{
"epoch": 0.06046511627906977,
"grad_norm": 11.014802932739258,
"learning_rate": 1.8461538461538465e-06,
"loss": 0.6633,
"mean_token_accuracy": 0.8415761590003967,
"step": 13
},
{
"epoch": 0.06511627906976744,
"grad_norm": 9.7716064453125,
"learning_rate": 2.0000000000000003e-06,
"loss": 0.6095,
"mean_token_accuracy": 0.8588042855262756,
"step": 14
},
{
"epoch": 0.06976744186046512,
"grad_norm": 9.165430068969727,
"learning_rate": 2.153846153846154e-06,
"loss": 0.5607,
"mean_token_accuracy": 0.8693761229515076,
"step": 15
},
{
"epoch": 0.07441860465116279,
"grad_norm": 10.080243110656738,
"learning_rate": 2.307692307692308e-06,
"loss": 0.5113,
"mean_token_accuracy": 0.8672978281974792,
"step": 16
},
{
"epoch": 0.07906976744186046,
"grad_norm": 10.527639389038086,
"learning_rate": 2.461538461538462e-06,
"loss": 0.4415,
"mean_token_accuracy": 0.8862723708152771,
"step": 17
},
{
"epoch": 0.08372093023255814,
"grad_norm": 7.268032073974609,
"learning_rate": 2.615384615384616e-06,
"loss": 0.4505,
"mean_token_accuracy": 0.8736571073532104,
"step": 18
},
{
"epoch": 0.08837209302325581,
"grad_norm": 7.092712879180908,
"learning_rate": 2.7692307692307697e-06,
"loss": 0.4496,
"mean_token_accuracy": 0.8755980730056763,
"step": 19
},
{
"epoch": 0.09302325581395349,
"grad_norm": 4.317747592926025,
"learning_rate": 2.9230769230769236e-06,
"loss": 0.3947,
"mean_token_accuracy": 0.8856920599937439,
"step": 20
},
{
"epoch": 0.09767441860465116,
"grad_norm": 4.245256423950195,
"learning_rate": 3.0769230769230774e-06,
"loss": 0.4397,
"mean_token_accuracy": 0.8684402108192444,
"step": 21
},
{
"epoch": 0.10232558139534884,
"grad_norm": 3.8611507415771484,
"learning_rate": 3.2307692307692313e-06,
"loss": 0.3792,
"mean_token_accuracy": 0.8823331594467163,
"step": 22
},
{
"epoch": 0.10697674418604651,
"grad_norm": 4.211703300476074,
"learning_rate": 3.384615384615385e-06,
"loss": 0.3552,
"mean_token_accuracy": 0.8943809270858765,
"step": 23
},
{
"epoch": 0.11162790697674418,
"grad_norm": 3.5800399780273438,
"learning_rate": 3.538461538461539e-06,
"loss": 0.3806,
"mean_token_accuracy": 0.8816819787025452,
"step": 24
},
{
"epoch": 0.11627906976744186,
"grad_norm": 3.5746443271636963,
"learning_rate": 3.692307692307693e-06,
"loss": 0.3583,
"mean_token_accuracy": 0.8919854164123535,
"step": 25
},
{
"epoch": 0.12093023255813953,
"grad_norm": 3.409257411956787,
"learning_rate": 3.846153846153847e-06,
"loss": 0.343,
"mean_token_accuracy": 0.8980305790901184,
"step": 26
},
{
"epoch": 0.12558139534883722,
"grad_norm": 3.196232318878174,
"learning_rate": 4.000000000000001e-06,
"loss": 0.3653,
"mean_token_accuracy": 0.8912448883056641,
"step": 27
},
{
"epoch": 0.13023255813953488,
"grad_norm": 3.6028528213500977,
"learning_rate": 4.1538461538461545e-06,
"loss": 0.3653,
"mean_token_accuracy": 0.8908067345619202,
"step": 28
},
{
"epoch": 0.13488372093023257,
"grad_norm": 3.0673670768737793,
"learning_rate": 4.307692307692308e-06,
"loss": 0.3824,
"mean_token_accuracy": 0.8820690512657166,
"step": 29
},
{
"epoch": 0.13953488372093023,
"grad_norm": 3.353994369506836,
"learning_rate": 4.461538461538462e-06,
"loss": 0.3762,
"mean_token_accuracy": 0.881018877029419,
"step": 30
},
{
"epoch": 0.14418604651162792,
"grad_norm": 3.5132193565368652,
"learning_rate": 4.615384615384616e-06,
"loss": 0.3993,
"mean_token_accuracy": 0.8744673132896423,
"step": 31
},
{
"epoch": 0.14883720930232558,
"grad_norm": 3.0335817337036133,
"learning_rate": 4.76923076923077e-06,
"loss": 0.3241,
"mean_token_accuracy": 0.8991076350212097,
"step": 32
},
{
"epoch": 0.15348837209302327,
"grad_norm": 3.8447790145874023,
"learning_rate": 4.923076923076924e-06,
"loss": 0.356,
"mean_token_accuracy": 0.8917796015739441,
"step": 33
},
{
"epoch": 0.15813953488372093,
"grad_norm": 2.874586820602417,
"learning_rate": 5.076923076923077e-06,
"loss": 0.3098,
"mean_token_accuracy": 0.903138279914856,
"step": 34
},
{
"epoch": 0.16279069767441862,
"grad_norm": 3.0539486408233643,
"learning_rate": 5.230769230769232e-06,
"loss": 0.3544,
"mean_token_accuracy": 0.8905218243598938,
"step": 35
},
{
"epoch": 0.16744186046511628,
"grad_norm": 2.976952314376831,
"learning_rate": 5.384615384615385e-06,
"loss": 0.3361,
"mean_token_accuracy": 0.8934714198112488,
"step": 36
},
{
"epoch": 0.17209302325581396,
"grad_norm": 3.0622878074645996,
"learning_rate": 5.538461538461539e-06,
"loss": 0.3236,
"mean_token_accuracy": 0.8999074697494507,
"step": 37
},
{
"epoch": 0.17674418604651163,
"grad_norm": 3.257957935333252,
"learning_rate": 5.692307692307692e-06,
"loss": 0.343,
"mean_token_accuracy": 0.8923910856246948,
"step": 38
},
{
"epoch": 0.1813953488372093,
"grad_norm": 3.007553815841675,
"learning_rate": 5.846153846153847e-06,
"loss": 0.3164,
"mean_token_accuracy": 0.9010202288627625,
"step": 39
},
{
"epoch": 0.18604651162790697,
"grad_norm": 2.944952964782715,
"learning_rate": 6e-06,
"loss": 0.3467,
"mean_token_accuracy": 0.8913513422012329,
"step": 40
},
{
"epoch": 0.19069767441860466,
"grad_norm": 2.9425339698791504,
"learning_rate": 6.153846153846155e-06,
"loss": 0.338,
"mean_token_accuracy": 0.9000540375709534,
"step": 41
},
{
"epoch": 0.19534883720930232,
"grad_norm": 3.1975269317626953,
"learning_rate": 6.307692307692308e-06,
"loss": 0.3408,
"mean_token_accuracy": 0.898595929145813,
"step": 42
},
{
"epoch": 0.2,
"grad_norm": 3.0284111499786377,
"learning_rate": 6.461538461538463e-06,
"loss": 0.3112,
"mean_token_accuracy": 0.9032689929008484,
"step": 43
},
{
"epoch": 0.20465116279069767,
"grad_norm": 2.8465347290039062,
"learning_rate": 6.615384615384616e-06,
"loss": 0.3387,
"mean_token_accuracy": 0.9016018509864807,
"step": 44
},
{
"epoch": 0.20930232558139536,
"grad_norm": 3.0937321186065674,
"learning_rate": 6.76923076923077e-06,
"loss": 0.3037,
"mean_token_accuracy": 0.906658947467804,
"step": 45
},
{
"epoch": 0.21395348837209302,
"grad_norm": 2.862903118133545,
"learning_rate": 6.923076923076923e-06,
"loss": 0.3115,
"mean_token_accuracy": 0.9050519466400146,
"step": 46
},
{
"epoch": 0.2186046511627907,
"grad_norm": 2.914771318435669,
"learning_rate": 7.076923076923078e-06,
"loss": 0.317,
"mean_token_accuracy": 0.9020901918411255,
"step": 47
},
{
"epoch": 0.22325581395348837,
"grad_norm": 2.9237124919891357,
"learning_rate": 7.230769230769231e-06,
"loss": 0.3292,
"mean_token_accuracy": 0.9041584730148315,
"step": 48
},
{
"epoch": 0.22790697674418606,
"grad_norm": 2.9312398433685303,
"learning_rate": 7.384615384615386e-06,
"loss": 0.3202,
"mean_token_accuracy": 0.9016806483268738,
"step": 49
},
{
"epoch": 0.23255813953488372,
"grad_norm": 2.9532058238983154,
"learning_rate": 7.538461538461539e-06,
"loss": 0.3293,
"mean_token_accuracy": 0.9001582264900208,
"step": 50
},
{
"epoch": 0.2372093023255814,
"grad_norm": 3.0990428924560547,
"learning_rate": 7.692307692307694e-06,
"loss": 0.3411,
"mean_token_accuracy": 0.8866774439811707,
"step": 51
},
{
"epoch": 0.24186046511627907,
"grad_norm": 2.87052059173584,
"learning_rate": 7.846153846153847e-06,
"loss": 0.3395,
"mean_token_accuracy": 0.8905250430107117,
"step": 52
},
{
"epoch": 0.24651162790697675,
"grad_norm": 3.011493682861328,
"learning_rate": 8.000000000000001e-06,
"loss": 0.3261,
"mean_token_accuracy": 0.899782121181488,
"step": 53
},
{
"epoch": 0.25116279069767444,
"grad_norm": 2.943223237991333,
"learning_rate": 8.153846153846154e-06,
"loss": 0.3414,
"mean_token_accuracy": 0.8933002352714539,
"step": 54
},
{
"epoch": 0.2558139534883721,
"grad_norm": 2.8687915802001953,
"learning_rate": 8.307692307692309e-06,
"loss": 0.3425,
"mean_token_accuracy": 0.8924914598464966,
"step": 55
},
{
"epoch": 0.26046511627906976,
"grad_norm": 2.947930335998535,
"learning_rate": 8.461538461538462e-06,
"loss": 0.3338,
"mean_token_accuracy": 0.8992005586624146,
"step": 56
},
{
"epoch": 0.2651162790697674,
"grad_norm": 2.625805616378784,
"learning_rate": 8.615384615384617e-06,
"loss": 0.2921,
"mean_token_accuracy": 0.9067084193229675,
"step": 57
},
{
"epoch": 0.26976744186046514,
"grad_norm": 2.7415740489959717,
"learning_rate": 8.76923076923077e-06,
"loss": 0.3208,
"mean_token_accuracy": 0.8967901468276978,
"step": 58
},
{
"epoch": 0.2744186046511628,
"grad_norm": 3.0610153675079346,
"learning_rate": 8.923076923076925e-06,
"loss": 0.3079,
"mean_token_accuracy": 0.9053909182548523,
"step": 59
},
{
"epoch": 0.27906976744186046,
"grad_norm": 2.8837437629699707,
"learning_rate": 9.076923076923078e-06,
"loss": 0.3223,
"mean_token_accuracy": 0.8960626721382141,
"step": 60
},
{
"epoch": 0.2837209302325581,
"grad_norm": 3.0495381355285645,
"learning_rate": 9.230769230769232e-06,
"loss": 0.3543,
"mean_token_accuracy": 0.8843302726745605,
"step": 61
},
{
"epoch": 0.28837209302325584,
"grad_norm": 3.0705480575561523,
"learning_rate": 9.384615384615385e-06,
"loss": 0.3536,
"mean_token_accuracy": 0.8863232731819153,
"step": 62
},
{
"epoch": 0.2930232558139535,
"grad_norm": 2.8244340419769287,
"learning_rate": 9.53846153846154e-06,
"loss": 0.3214,
"mean_token_accuracy": 0.900137722492218,
"step": 63
},
{
"epoch": 0.29767441860465116,
"grad_norm": 2.8263750076293945,
"learning_rate": 9.692307692307693e-06,
"loss": 0.3219,
"mean_token_accuracy": 0.8964273929595947,
"step": 64
},
{
"epoch": 0.3023255813953488,
"grad_norm": 3.0754854679107666,
"learning_rate": 9.846153846153848e-06,
"loss": 0.3427,
"mean_token_accuracy": 0.8874080181121826,
"step": 65
},
{
"epoch": 0.30697674418604654,
"grad_norm": 2.6351478099823,
"learning_rate": 1e-05,
"loss": 0.3105,
"mean_token_accuracy": 0.8933923840522766,
"step": 66
},
{
"epoch": 0.3116279069767442,
"grad_norm": 2.8327081203460693,
"learning_rate": 9.999933987646821e-06,
"loss": 0.3296,
"mean_token_accuracy": 0.8912156224250793,
"step": 67
},
{
"epoch": 0.31627906976744186,
"grad_norm": 2.7764129638671875,
"learning_rate": 9.99973595252401e-06,
"loss": 0.2963,
"mean_token_accuracy": 0.9016897082328796,
"step": 68
},
{
"epoch": 0.3209302325581395,
"grad_norm": 2.8871490955352783,
"learning_rate": 9.999405900441683e-06,
"loss": 0.3152,
"mean_token_accuracy": 0.8972193002700806,
"step": 69
},
{
"epoch": 0.32558139534883723,
"grad_norm": 2.9388067722320557,
"learning_rate": 9.998943841083179e-06,
"loss": 0.3187,
"mean_token_accuracy": 0.8915014863014221,
"step": 70
},
{
"epoch": 0.3302325581395349,
"grad_norm": 2.861207962036133,
"learning_rate": 9.99834978800478e-06,
"loss": 0.3152,
"mean_token_accuracy": 0.8957569599151611,
"step": 71
},
{
"epoch": 0.33488372093023255,
"grad_norm": 2.725429058074951,
"learning_rate": 9.997623758635298e-06,
"loss": 0.3155,
"mean_token_accuracy": 0.8980090618133545,
"step": 72
},
{
"epoch": 0.3395348837209302,
"grad_norm": 2.838580369949341,
"learning_rate": 9.996765774275587e-06,
"loss": 0.3398,
"mean_token_accuracy": 0.8817829489707947,
"step": 73
},
{
"epoch": 0.34418604651162793,
"grad_norm": 2.6265110969543457,
"learning_rate": 9.995775860097897e-06,
"loss": 0.2922,
"mean_token_accuracy": 0.8991727232933044,
"step": 74
},
{
"epoch": 0.3488372093023256,
"grad_norm": 2.9625837802886963,
"learning_rate": 9.994654045145142e-06,
"loss": 0.3265,
"mean_token_accuracy": 0.8913161158561707,
"step": 75
},
{
"epoch": 0.35348837209302325,
"grad_norm": 2.6737451553344727,
"learning_rate": 9.993400362330058e-06,
"loss": 0.293,
"mean_token_accuracy": 0.9017840027809143,
"step": 76
},
{
"epoch": 0.3581395348837209,
"grad_norm": 2.600137710571289,
"learning_rate": 9.992014848434221e-06,
"loss": 0.3134,
"mean_token_accuracy": 0.8939000368118286,
"step": 77
},
{
"epoch": 0.3627906976744186,
"grad_norm": 2.5492331981658936,
"learning_rate": 9.990497544106981e-06,
"loss": 0.278,
"mean_token_accuracy": 0.905031681060791,
"step": 78
},
{
"epoch": 0.3674418604651163,
"grad_norm": 2.828934669494629,
"learning_rate": 9.988848493864259e-06,
"loss": 0.3139,
"mean_token_accuracy": 0.8893573880195618,
"step": 79
},
{
"epoch": 0.37209302325581395,
"grad_norm": 2.4408745765686035,
"learning_rate": 9.987067746087251e-06,
"loss": 0.3349,
"mean_token_accuracy": 0.8832064867019653,
"step": 80
},
{
"epoch": 0.3767441860465116,
"grad_norm": 2.7932300567626953,
"learning_rate": 9.985155353021004e-06,
"loss": 0.2888,
"mean_token_accuracy": 0.9002993106842041,
"step": 81
},
{
"epoch": 0.3813953488372093,
"grad_norm": 2.693359613418579,
"learning_rate": 9.983111370772877e-06,
"loss": 0.2828,
"mean_token_accuracy": 0.9031432867050171,
"step": 82
},
{
"epoch": 0.386046511627907,
"grad_norm": 2.4886722564697266,
"learning_rate": 9.980935859310907e-06,
"loss": 0.2906,
"mean_token_accuracy": 0.9039763808250427,
"step": 83
},
{
"epoch": 0.39069767441860465,
"grad_norm": 2.453582525253296,
"learning_rate": 9.97862888246204e-06,
"loss": 0.3303,
"mean_token_accuracy": 0.8835755586624146,
"step": 84
},
{
"epoch": 0.3953488372093023,
"grad_norm": 2.423192024230957,
"learning_rate": 9.976190507910265e-06,
"loss": 0.3036,
"mean_token_accuracy": 0.8907879590988159,
"step": 85
},
{
"epoch": 0.4,
"grad_norm": 2.716904878616333,
"learning_rate": 9.97362080719462e-06,
"loss": 0.333,
"mean_token_accuracy": 0.8917351365089417,
"step": 86
},
{
"epoch": 0.4046511627906977,
"grad_norm": 2.4398062229156494,
"learning_rate": 9.970919855707103e-06,
"loss": 0.3071,
"mean_token_accuracy": 0.8877987861633301,
"step": 87
},
{
"epoch": 0.40930232558139534,
"grad_norm": 2.614738941192627,
"learning_rate": 9.968087732690452e-06,
"loss": 0.3566,
"mean_token_accuracy": 0.8800138831138611,
"step": 88
},
{
"epoch": 0.413953488372093,
"grad_norm": 2.467711925506592,
"learning_rate": 9.965124521235827e-06,
"loss": 0.305,
"mean_token_accuracy": 0.9028013944625854,
"step": 89
},
{
"epoch": 0.4186046511627907,
"grad_norm": 2.5902044773101807,
"learning_rate": 9.962030308280363e-06,
"loss": 0.2639,
"mean_token_accuracy": 0.9111554026603699,
"step": 90
},
{
"epoch": 0.4232558139534884,
"grad_norm": 2.4866185188293457,
"learning_rate": 9.958805184604631e-06,
"loss": 0.2698,
"mean_token_accuracy": 0.9070945978164673,
"step": 91
},
{
"epoch": 0.42790697674418604,
"grad_norm": 2.5046956539154053,
"learning_rate": 9.955449244829966e-06,
"loss": 0.322,
"mean_token_accuracy": 0.8915765881538391,
"step": 92
},
{
"epoch": 0.4325581395348837,
"grad_norm": 2.4573545455932617,
"learning_rate": 9.95196258741569e-06,
"loss": 0.2948,
"mean_token_accuracy": 0.898975133895874,
"step": 93
},
{
"epoch": 0.4372093023255814,
"grad_norm": 2.4542694091796875,
"learning_rate": 9.948345314656234e-06,
"loss": 0.3093,
"mean_token_accuracy": 0.896518349647522,
"step": 94
},
{
"epoch": 0.4418604651162791,
"grad_norm": 2.5495047569274902,
"learning_rate": 9.94459753267812e-06,
"loss": 0.3092,
"mean_token_accuracy": 0.8926985263824463,
"step": 95
},
{
"epoch": 0.44651162790697674,
"grad_norm": 2.413846015930176,
"learning_rate": 9.94071935143687e-06,
"loss": 0.292,
"mean_token_accuracy": 0.9006398916244507,
"step": 96
},
{
"epoch": 0.4511627906976744,
"grad_norm": 2.5379788875579834,
"learning_rate": 9.936710884713752e-06,
"loss": 0.2552,
"mean_token_accuracy": 0.9097174406051636,
"step": 97
},
{
"epoch": 0.4558139534883721,
"grad_norm": 2.4800572395324707,
"learning_rate": 9.932572250112469e-06,
"loss": 0.3124,
"mean_token_accuracy": 0.8870939016342163,
"step": 98
},
{
"epoch": 0.4604651162790698,
"grad_norm": 2.299506425857544,
"learning_rate": 9.92830356905569e-06,
"loss": 0.2613,
"mean_token_accuracy": 0.9084261059761047,
"step": 99
},
{
"epoch": 0.46511627906976744,
"grad_norm": 2.372338056564331,
"learning_rate": 9.923904966781496e-06,
"loss": 0.3313,
"mean_token_accuracy": 0.8863078951835632,
"step": 100
},
{
"epoch": 0.4697674418604651,
"grad_norm": 2.4246954917907715,
"learning_rate": 9.919376572339703e-06,
"loss": 0.3164,
"mean_token_accuracy": 0.8909768462181091,
"step": 101
},
{
"epoch": 0.4744186046511628,
"grad_norm": 2.382747173309326,
"learning_rate": 9.914718518588076e-06,
"loss": 0.312,
"mean_token_accuracy": 0.8973370790481567,
"step": 102
},
{
"epoch": 0.4790697674418605,
"grad_norm": 2.20865797996521,
"learning_rate": 9.909930942188436e-06,
"loss": 0.3017,
"mean_token_accuracy": 0.8977475166320801,
"step": 103
},
{
"epoch": 0.48372093023255813,
"grad_norm": 2.2108991146087646,
"learning_rate": 9.905013983602639e-06,
"loss": 0.2822,
"mean_token_accuracy": 0.9046753644943237,
"step": 104
},
{
"epoch": 0.4883720930232558,
"grad_norm": 2.45776104927063,
"learning_rate": 9.899967787088468e-06,
"loss": 0.3172,
"mean_token_accuracy": 0.8890208005905151,
"step": 105
},
{
"epoch": 0.4930232558139535,
"grad_norm": 2.4246809482574463,
"learning_rate": 9.89479250069539e-06,
"loss": 0.2847,
"mean_token_accuracy": 0.9031876921653748,
"step": 106
},
{
"epoch": 0.49767441860465117,
"grad_norm": 2.4469594955444336,
"learning_rate": 9.889488276260222e-06,
"loss": 0.3474,
"mean_token_accuracy": 0.8859800100326538,
"step": 107
},
{
"epoch": 0.5023255813953489,
"grad_norm": 2.5260751247406006,
"learning_rate": 9.88405526940267e-06,
"loss": 0.3265,
"mean_token_accuracy": 0.884105384349823,
"step": 108
},
{
"epoch": 0.5069767441860465,
"grad_norm": 2.5180299282073975,
"learning_rate": 9.87849363952076e-06,
"loss": 0.2824,
"mean_token_accuracy": 0.9007551074028015,
"step": 109
},
{
"epoch": 0.5116279069767442,
"grad_norm": 2.5075199604034424,
"learning_rate": 9.872803549786177e-06,
"loss": 0.2946,
"mean_token_accuracy": 0.8951205611228943,
"step": 110
},
{
"epoch": 0.5162790697674419,
"grad_norm": 2.4692704677581787,
"learning_rate": 9.866985167139453e-06,
"loss": 0.3182,
"mean_token_accuracy": 0.8877219557762146,
"step": 111
},
{
"epoch": 0.5209302325581395,
"grad_norm": 2.3963942527770996,
"learning_rate": 9.861038662285093e-06,
"loss": 0.2969,
"mean_token_accuracy": 0.8966950178146362,
"step": 112
},
{
"epoch": 0.5255813953488372,
"grad_norm": 2.3317747116088867,
"learning_rate": 9.854964209686555e-06,
"loss": 0.3333,
"mean_token_accuracy": 0.891633927822113,
"step": 113
},
{
"epoch": 0.5302325581395348,
"grad_norm": 2.317647933959961,
"learning_rate": 9.848761987561132e-06,
"loss": 0.3076,
"mean_token_accuracy": 0.8995808362960815,
"step": 114
},
{
"epoch": 0.5348837209302325,
"grad_norm": 2.637216567993164,
"learning_rate": 9.842432177874725e-06,
"loss": 0.3078,
"mean_token_accuracy": 0.8890925645828247,
"step": 115
},
{
"epoch": 0.5395348837209303,
"grad_norm": 2.7842369079589844,
"learning_rate": 9.835974966336504e-06,
"loss": 0.3121,
"mean_token_accuracy": 0.8958715796470642,
"step": 116
},
{
"epoch": 0.5441860465116279,
"grad_norm": 2.725388288497925,
"learning_rate": 9.82939054239346e-06,
"loss": 0.3233,
"mean_token_accuracy": 0.8867715001106262,
"step": 117
},
{
"epoch": 0.5488372093023256,
"grad_norm": 2.2746381759643555,
"learning_rate": 9.822679099224844e-06,
"loss": 0.2699,
"mean_token_accuracy": 0.9086083769798279,
"step": 118
},
{
"epoch": 0.5534883720930233,
"grad_norm": 2.4101691246032715,
"learning_rate": 9.815840833736508e-06,
"loss": 0.26,
"mean_token_accuracy": 0.9082334637641907,
"step": 119
},
{
"epoch": 0.5581395348837209,
"grad_norm": 2.3375160694122314,
"learning_rate": 9.808875946555109e-06,
"loss": 0.2658,
"mean_token_accuracy": 0.9081822633743286,
"step": 120
},
{
"epoch": 0.5627906976744186,
"grad_norm": 2.2656409740448,
"learning_rate": 9.801784642022254e-06,
"loss": 0.2374,
"mean_token_accuracy": 0.9136148691177368,
"step": 121
},
{
"epoch": 0.5674418604651162,
"grad_norm": 2.5492942333221436,
"learning_rate": 9.794567128188466e-06,
"loss": 0.3194,
"mean_token_accuracy": 0.8901216983795166,
"step": 122
},
{
"epoch": 0.5720930232558139,
"grad_norm": 2.8390772342681885,
"learning_rate": 9.787223616807118e-06,
"loss": 0.3522,
"mean_token_accuracy": 0.8756738901138306,
"step": 123
},
{
"epoch": 0.5767441860465117,
"grad_norm": 2.3636889457702637,
"learning_rate": 9.779754323328192e-06,
"loss": 0.3166,
"mean_token_accuracy": 0.8895965814590454,
"step": 124
},
{
"epoch": 0.5813953488372093,
"grad_norm": 2.4303550720214844,
"learning_rate": 9.772159466891971e-06,
"loss": 0.2507,
"mean_token_accuracy": 0.9103531241416931,
"step": 125
},
{
"epoch": 0.586046511627907,
"grad_norm": 3.1228110790252686,
"learning_rate": 9.764439270322612e-06,
"loss": 0.3337,
"mean_token_accuracy": 0.8896551728248596,
"step": 126
},
{
"epoch": 0.5906976744186047,
"grad_norm": 2.389329433441162,
"learning_rate": 9.756593960121598e-06,
"loss": 0.2601,
"mean_token_accuracy": 0.912638783454895,
"step": 127
},
{
"epoch": 0.5953488372093023,
"grad_norm": 2.473677635192871,
"learning_rate": 9.748623766461101e-06,
"loss": 0.3098,
"mean_token_accuracy": 0.89825040102005,
"step": 128
},
{
"epoch": 0.6,
"grad_norm": 2.882704973220825,
"learning_rate": 9.740528923177227e-06,
"loss": 0.3681,
"mean_token_accuracy": 0.8829707503318787,
"step": 129
},
{
"epoch": 0.6046511627906976,
"grad_norm": 2.7584638595581055,
"learning_rate": 9.732309667763158e-06,
"loss": 0.295,
"mean_token_accuracy": 0.8920313119888306,
"step": 130
},
{
"epoch": 0.6093023255813953,
"grad_norm": 2.507779121398926,
"learning_rate": 9.723966241362178e-06,
"loss": 0.2819,
"mean_token_accuracy": 0.9021470546722412,
"step": 131
},
{
"epoch": 0.6139534883720931,
"grad_norm": 2.3873088359832764,
"learning_rate": 9.7154988887606e-06,
"loss": 0.2841,
"mean_token_accuracy": 0.8999173045158386,
"step": 132
},
{
"epoch": 0.6186046511627907,
"grad_norm": 2.327904224395752,
"learning_rate": 9.706907858380593e-06,
"loss": 0.3182,
"mean_token_accuracy": 0.8869202733039856,
"step": 133
},
{
"epoch": 0.6232558139534884,
"grad_norm": 2.4665448665618896,
"learning_rate": 9.69819340227288e-06,
"loss": 0.3211,
"mean_token_accuracy": 0.8939599394798279,
"step": 134
},
{
"epoch": 0.627906976744186,
"grad_norm": 2.293694019317627,
"learning_rate": 9.68935577610935e-06,
"loss": 0.3098,
"mean_token_accuracy": 0.8957222700119019,
"step": 135
},
{
"epoch": 0.6325581395348837,
"grad_norm": 2.5069773197174072,
"learning_rate": 9.680395239175563e-06,
"loss": 0.3054,
"mean_token_accuracy": 0.8952414393424988,
"step": 136
},
{
"epoch": 0.6372093023255814,
"grad_norm": 2.3153645992279053,
"learning_rate": 9.671312054363126e-06,
"loss": 0.2976,
"mean_token_accuracy": 0.899829626083374,
"step": 137
},
{
"epoch": 0.641860465116279,
"grad_norm": 2.233323812484741,
"learning_rate": 9.662106488162001e-06,
"loss": 0.3034,
"mean_token_accuracy": 0.8928571343421936,
"step": 138
},
{
"epoch": 0.6465116279069767,
"grad_norm": 2.3756513595581055,
"learning_rate": 9.652778810652669e-06,
"loss": 0.284,
"mean_token_accuracy": 0.9001284837722778,
"step": 139
},
{
"epoch": 0.6511627906976745,
"grad_norm": 2.373886823654175,
"learning_rate": 9.643329295498215e-06,
"loss": 0.3215,
"mean_token_accuracy": 0.890358567237854,
"step": 140
},
{
"epoch": 0.6558139534883721,
"grad_norm": 2.4615867137908936,
"learning_rate": 9.633758219936299e-06,
"loss": 0.3237,
"mean_token_accuracy": 0.8895444273948669,
"step": 141
},
{
"epoch": 0.6604651162790698,
"grad_norm": 2.5071775913238525,
"learning_rate": 9.624065864771017e-06,
"loss": 0.2943,
"mean_token_accuracy": 0.9009695053100586,
"step": 142
},
{
"epoch": 0.6651162790697674,
"grad_norm": 2.4051311016082764,
"learning_rate": 9.614252514364671e-06,
"loss": 0.282,
"mean_token_accuracy": 0.8996679186820984,
"step": 143
},
{
"epoch": 0.6697674418604651,
"grad_norm": 2.5493178367614746,
"learning_rate": 9.604318456629415e-06,
"loss": 0.363,
"mean_token_accuracy": 0.8800684213638306,
"step": 144
},
{
"epoch": 0.6744186046511628,
"grad_norm": 2.582982301712036,
"learning_rate": 9.594263983018818e-06,
"loss": 0.3378,
"mean_token_accuracy": 0.8826906085014343,
"step": 145
},
{
"epoch": 0.6790697674418604,
"grad_norm": 2.471052885055542,
"learning_rate": 9.584089388519307e-06,
"loss": 0.3545,
"mean_token_accuracy": 0.8743756413459778,
"step": 146
},
{
"epoch": 0.6837209302325581,
"grad_norm": 2.5069751739501953,
"learning_rate": 9.573794971641518e-06,
"loss": 0.2964,
"mean_token_accuracy": 0.8944962024688721,
"step": 147
},
{
"epoch": 0.6883720930232559,
"grad_norm": 2.7452809810638428,
"learning_rate": 9.563381034411529e-06,
"loss": 0.2885,
"mean_token_accuracy": 0.9012883305549622,
"step": 148
},
{
"epoch": 0.6930232558139535,
"grad_norm": 2.500969886779785,
"learning_rate": 9.55284788236201e-06,
"loss": 0.3279,
"mean_token_accuracy": 0.8895537853240967,
"step": 149
},
{
"epoch": 0.6976744186046512,
"grad_norm": 2.6518476009368896,
"learning_rate": 9.542195824523251e-06,
"loss": 0.2993,
"mean_token_accuracy": 0.895342230796814,
"step": 150
},
{
"epoch": 0.7023255813953488,
"grad_norm": 2.216704845428467,
"learning_rate": 9.531425173414095e-06,
"loss": 0.2912,
"mean_token_accuracy": 0.8971017003059387,
"step": 151
},
{
"epoch": 0.7069767441860465,
"grad_norm": 2.8981404304504395,
"learning_rate": 9.520536245032783e-06,
"loss": 0.3483,
"mean_token_accuracy": 0.8798250555992126,
"step": 152
},
{
"epoch": 0.7116279069767442,
"grad_norm": 2.808007001876831,
"learning_rate": 9.509529358847655e-06,
"loss": 0.3235,
"mean_token_accuracy": 0.8890100121498108,
"step": 153
},
{
"epoch": 0.7162790697674418,
"grad_norm": 2.2912731170654297,
"learning_rate": 9.498404837787811e-06,
"loss": 0.2957,
"mean_token_accuracy": 0.8959488868713379,
"step": 154
},
{
"epoch": 0.7209302325581395,
"grad_norm": 2.1323370933532715,
"learning_rate": 9.48716300823361e-06,
"loss": 0.2722,
"mean_token_accuracy": 0.9088647961616516,
"step": 155
},
{
"epoch": 0.7255813953488373,
"grad_norm": 2.3741555213928223,
"learning_rate": 9.475804200007104e-06,
"loss": 0.2523,
"mean_token_accuracy": 0.9077244400978088,
"step": 156
},
{
"epoch": 0.7302325581395349,
"grad_norm": 2.571829080581665,
"learning_rate": 9.464328746362367e-06,
"loss": 0.3139,
"mean_token_accuracy": 0.8919800519943237,
"step": 157
},
{
"epoch": 0.7348837209302326,
"grad_norm": 2.3718228340148926,
"learning_rate": 9.452736983975708e-06,
"loss": 0.3006,
"mean_token_accuracy": 0.9011486172676086,
"step": 158
},
{
"epoch": 0.7395348837209302,
"grad_norm": 2.3102355003356934,
"learning_rate": 9.441029252935804e-06,
"loss": 0.3169,
"mean_token_accuracy": 0.8904637098312378,
"step": 159
},
{
"epoch": 0.7441860465116279,
"grad_norm": 2.3063647747039795,
"learning_rate": 9.429205896733705e-06,
"loss": 0.3344,
"mean_token_accuracy": 0.885936975479126,
"step": 160
},
{
"epoch": 0.7488372093023256,
"grad_norm": 2.2388534545898438,
"learning_rate": 9.417267262252775e-06,
"loss": 0.2618,
"mean_token_accuracy": 0.9093095064163208,
"step": 161
},
{
"epoch": 0.7534883720930232,
"grad_norm": 2.311589241027832,
"learning_rate": 9.405213699758507e-06,
"loss": 0.2951,
"mean_token_accuracy": 0.9044934511184692,
"step": 162
},
{
"epoch": 0.7581395348837209,
"grad_norm": 2.6392147541046143,
"learning_rate": 9.393045562888245e-06,
"loss": 0.3072,
"mean_token_accuracy": 0.8980139493942261,
"step": 163
},
{
"epoch": 0.7627906976744186,
"grad_norm": 2.4263360500335693,
"learning_rate": 9.380763208640809e-06,
"loss": 0.3182,
"mean_token_accuracy": 0.89084792137146,
"step": 164
},
{
"epoch": 0.7674418604651163,
"grad_norm": 2.5029895305633545,
"learning_rate": 9.368366997366027e-06,
"loss": 0.3163,
"mean_token_accuracy": 0.8866799473762512,
"step": 165
},
{
"epoch": 0.772093023255814,
"grad_norm": 2.336146593093872,
"learning_rate": 9.355857292754152e-06,
"loss": 0.3092,
"mean_token_accuracy": 0.8928571343421936,
"step": 166
},
{
"epoch": 0.7767441860465116,
"grad_norm": 2.218172550201416,
"learning_rate": 9.343234461825204e-06,
"loss": 0.2906,
"mean_token_accuracy": 0.9058730006217957,
"step": 167
},
{
"epoch": 0.7813953488372093,
"grad_norm": 2.5669257640838623,
"learning_rate": 9.330498874918191e-06,
"loss": 0.3321,
"mean_token_accuracy": 0.8863449096679688,
"step": 168
},
{
"epoch": 0.786046511627907,
"grad_norm": 2.513970136642456,
"learning_rate": 9.317650905680254e-06,
"loss": 0.2676,
"mean_token_accuracy": 0.9085434675216675,
"step": 169
},
{
"epoch": 0.7906976744186046,
"grad_norm": 2.1640465259552,
"learning_rate": 9.304690931055694e-06,
"loss": 0.274,
"mean_token_accuracy": 0.9004696607589722,
"step": 170
},
{
"epoch": 0.7953488372093023,
"grad_norm": 2.511218547821045,
"learning_rate": 9.29161933127492e-06,
"loss": 0.3194,
"mean_token_accuracy": 0.8944977521896362,
"step": 171
},
{
"epoch": 0.8,
"grad_norm": 2.421499252319336,
"learning_rate": 9.278436489843298e-06,
"loss": 0.2887,
"mean_token_accuracy": 0.9034446477890015,
"step": 172
},
{
"epoch": 0.8046511627906977,
"grad_norm": 2.588841199874878,
"learning_rate": 9.265142793529883e-06,
"loss": 0.3064,
"mean_token_accuracy": 0.8959047198295593,
"step": 173
},
{
"epoch": 0.8093023255813954,
"grad_norm": 2.45721435546875,
"learning_rate": 9.251738632356086e-06,
"loss": 0.2945,
"mean_token_accuracy": 0.8972444534301758,
"step": 174
},
{
"epoch": 0.813953488372093,
"grad_norm": 2.337759256362915,
"learning_rate": 9.238224399584232e-06,
"loss": 0.3035,
"mean_token_accuracy": 0.8876973390579224,
"step": 175
},
{
"epoch": 0.8186046511627907,
"grad_norm": 2.4137725830078125,
"learning_rate": 9.224600491706009e-06,
"loss": 0.2831,
"mean_token_accuracy": 0.9046387076377869,
"step": 176
},
{
"epoch": 0.8232558139534883,
"grad_norm": 2.3806352615356445,
"learning_rate": 9.210867308430847e-06,
"loss": 0.3307,
"mean_token_accuracy": 0.8875255584716797,
"step": 177
},
{
"epoch": 0.827906976744186,
"grad_norm": 2.5038254261016846,
"learning_rate": 9.197025252674192e-06,
"loss": 0.2855,
"mean_token_accuracy": 0.9022055268287659,
"step": 178
},
{
"epoch": 0.8325581395348837,
"grad_norm": 2.2400872707366943,
"learning_rate": 9.183074730545674e-06,
"loss": 0.3032,
"mean_token_accuracy": 0.8980777859687805,
"step": 179
},
{
"epoch": 0.8372093023255814,
"grad_norm": 2.3404793739318848,
"learning_rate": 9.169016151337202e-06,
"loss": 0.2941,
"mean_token_accuracy": 0.8985650539398193,
"step": 180
},
{
"epoch": 0.8418604651162791,
"grad_norm": 2.398179769515991,
"learning_rate": 9.15484992751095e-06,
"loss": 0.2971,
"mean_token_accuracy": 0.8980716466903687,
"step": 181
},
{
"epoch": 0.8465116279069768,
"grad_norm": 2.3488447666168213,
"learning_rate": 9.140576474687263e-06,
"loss": 0.3054,
"mean_token_accuracy": 0.897182822227478,
"step": 182
},
{
"epoch": 0.8511627906976744,
"grad_norm": 2.7520530223846436,
"learning_rate": 9.126196211632456e-06,
"loss": 0.3154,
"mean_token_accuracy": 0.8900938034057617,
"step": 183
},
{
"epoch": 0.8558139534883721,
"grad_norm": 2.515666961669922,
"learning_rate": 9.11170956024653e-06,
"loss": 0.3116,
"mean_token_accuracy": 0.8922144770622253,
"step": 184
},
{
"epoch": 0.8604651162790697,
"grad_norm": 2.2675559520721436,
"learning_rate": 9.097116945550794e-06,
"loss": 0.2906,
"mean_token_accuracy": 0.8984547257423401,
"step": 185
},
{
"epoch": 0.8651162790697674,
"grad_norm": 2.3091530799865723,
"learning_rate": 9.082418795675397e-06,
"loss": 0.3165,
"mean_token_accuracy": 0.8925065398216248,
"step": 186
},
{
"epoch": 0.8697674418604651,
"grad_norm": 2.641993284225464,
"learning_rate": 9.067615541846768e-06,
"loss": 0.2755,
"mean_token_accuracy": 0.8972795009613037,
"step": 187
},
{
"epoch": 0.8744186046511628,
"grad_norm": 2.2171666622161865,
"learning_rate": 9.052707618374958e-06,
"loss": 0.2995,
"mean_token_accuracy": 0.8997421264648438,
"step": 188
},
{
"epoch": 0.8790697674418605,
"grad_norm": 2.160520553588867,
"learning_rate": 9.037695462640908e-06,
"loss": 0.2758,
"mean_token_accuracy": 0.9074592590332031,
"step": 189
},
{
"epoch": 0.8837209302325582,
"grad_norm": 2.49261212348938,
"learning_rate": 9.022579515083601e-06,
"loss": 0.2951,
"mean_token_accuracy": 0.8942018151283264,
"step": 190
},
{
"epoch": 0.8883720930232558,
"grad_norm": 2.5129523277282715,
"learning_rate": 9.007360219187163e-06,
"loss": 0.3419,
"mean_token_accuracy": 0.8804105520248413,
"step": 191
},
{
"epoch": 0.8930232558139535,
"grad_norm": 2.299142360687256,
"learning_rate": 8.99203802146783e-06,
"loss": 0.254,
"mean_token_accuracy": 0.9106271862983704,
"step": 192
},
{
"epoch": 0.8976744186046511,
"grad_norm": 2.291740655899048,
"learning_rate": 8.976613371460856e-06,
"loss": 0.3024,
"mean_token_accuracy": 0.8975442051887512,
"step": 193
},
{
"epoch": 0.9023255813953488,
"grad_norm": 2.278927803039551,
"learning_rate": 8.961086721707331e-06,
"loss": 0.2812,
"mean_token_accuracy": 0.9085345268249512,
"step": 194
},
{
"epoch": 0.9069767441860465,
"grad_norm": 2.2824349403381348,
"learning_rate": 8.945458527740892e-06,
"loss": 0.2813,
"mean_token_accuracy": 0.9089676141738892,
"step": 195
},
{
"epoch": 0.9116279069767442,
"grad_norm": 2.3400731086730957,
"learning_rate": 8.929729248074364e-06,
"loss": 0.3127,
"mean_token_accuracy": 0.8936736583709717,
"step": 196
},
{
"epoch": 0.9162790697674419,
"grad_norm": 2.4384615421295166,
"learning_rate": 8.913899344186312e-06,
"loss": 0.2703,
"mean_token_accuracy": 0.9109355211257935,
"step": 197
},
{
"epoch": 0.9209302325581395,
"grad_norm": 2.4058189392089844,
"learning_rate": 8.897969280507494e-06,
"loss": 0.2786,
"mean_token_accuracy": 0.9076216816902161,
"step": 198
},
{
"epoch": 0.9255813953488372,
"grad_norm": 2.4712047576904297,
"learning_rate": 8.881939524407238e-06,
"loss": 0.3093,
"mean_token_accuracy": 0.8929236531257629,
"step": 199
},
{
"epoch": 0.9302325581395349,
"grad_norm": 2.4457972049713135,
"learning_rate": 8.86581054617973e-06,
"loss": 0.2869,
"mean_token_accuracy": 0.9015862345695496,
"step": 200
},
{
"epoch": 0.9348837209302325,
"grad_norm": 2.3394265174865723,
"learning_rate": 8.849582819030217e-06,
"loss": 0.3105,
"mean_token_accuracy": 0.8978766202926636,
"step": 201
},
{
"epoch": 0.9395348837209302,
"grad_norm": 2.4344286918640137,
"learning_rate": 8.833256819061126e-06,
"loss": 0.2751,
"mean_token_accuracy": 0.9041284918785095,
"step": 202
},
{
"epoch": 0.9441860465116279,
"grad_norm": 2.8893260955810547,
"learning_rate": 8.81683302525809e-06,
"loss": 0.2994,
"mean_token_accuracy": 0.8973665237426758,
"step": 203
},
{
"epoch": 0.9488372093023256,
"grad_norm": 2.1813788414001465,
"learning_rate": 8.800311919475902e-06,
"loss": 0.2622,
"mean_token_accuracy": 0.9018022418022156,
"step": 204
},
{
"epoch": 0.9534883720930233,
"grad_norm": 2.0994787216186523,
"learning_rate": 8.783693986424365e-06,
"loss": 0.2628,
"mean_token_accuracy": 0.9057013988494873,
"step": 205
},
{
"epoch": 0.958139534883721,
"grad_norm": 2.2232422828674316,
"learning_rate": 8.76697971365409e-06,
"loss": 0.2909,
"mean_token_accuracy": 0.8990663290023804,
"step": 206
},
{
"epoch": 0.9627906976744186,
"grad_norm": 2.5452654361724854,
"learning_rate": 8.750169591542177e-06,
"loss": 0.3163,
"mean_token_accuracy": 0.8898491859436035,
"step": 207
},
{
"epoch": 0.9674418604651163,
"grad_norm": 2.470062017440796,
"learning_rate": 8.733264113277832e-06,
"loss": 0.2819,
"mean_token_accuracy": 0.9040852785110474,
"step": 208
},
{
"epoch": 0.9720930232558139,
"grad_norm": 2.2468132972717285,
"learning_rate": 8.716263774847902e-06,
"loss": 0.2656,
"mean_token_accuracy": 0.9133898019790649,
"step": 209
},
{
"epoch": 0.9767441860465116,
"grad_norm": 2.0833487510681152,
"learning_rate": 8.69916907502232e-06,
"loss": 0.2786,
"mean_token_accuracy": 0.9064552187919617,
"step": 210
},
{
"epoch": 0.9813953488372092,
"grad_norm": 2.21199369430542,
"learning_rate": 8.681980515339464e-06,
"loss": 0.2723,
"mean_token_accuracy": 0.906145453453064,
"step": 211
},
{
"epoch": 0.986046511627907,
"grad_norm": 2.214639663696289,
"learning_rate": 8.664698600091462e-06,
"loss": 0.2998,
"mean_token_accuracy": 0.897372841835022,
"step": 212
},
{
"epoch": 0.9906976744186047,
"grad_norm": 2.201284408569336,
"learning_rate": 8.64732383630937e-06,
"loss": 0.2632,
"mean_token_accuracy": 0.9081220030784607,
"step": 213
},
{
"epoch": 0.9953488372093023,
"grad_norm": 2.226452112197876,
"learning_rate": 8.629856733748325e-06,
"loss": 0.3033,
"mean_token_accuracy": 0.8968695402145386,
"step": 214
},
{
"epoch": 1.0,
"grad_norm": 2.1136155128479004,
"learning_rate": 8.612297804872562e-06,
"loss": 0.2636,
"mean_token_accuracy": 0.9030256271362305,
"step": 215
},
{
"epoch": 1.0046511627906978,
"grad_norm": 3.3606746196746826,
"learning_rate": 8.594647564840407e-06,
"loss": 0.1513,
"mean_token_accuracy": 0.9528185129165649,
"step": 216
},
{
"epoch": 1.0093023255813953,
"grad_norm": 2.7589690685272217,
"learning_rate": 8.57690653148913e-06,
"loss": 0.1725,
"mean_token_accuracy": 0.938120424747467,
"step": 217
},
{
"epoch": 1.013953488372093,
"grad_norm": 2.593282461166382,
"learning_rate": 8.559075225319786e-06,
"loss": 0.1453,
"mean_token_accuracy": 0.9510069489479065,
"step": 218
},
{
"epoch": 1.0186046511627906,
"grad_norm": 2.1907403469085693,
"learning_rate": 8.54115416948192e-06,
"loss": 0.1453,
"mean_token_accuracy": 0.9506734013557434,
"step": 219
},
{
"epoch": 1.0232558139534884,
"grad_norm": 2.0132081508636475,
"learning_rate": 8.523143889758228e-06,
"loss": 0.1195,
"mean_token_accuracy": 0.9594102501869202,
"step": 220
},
{
"epoch": 1.027906976744186,
"grad_norm": 1.8184553384780884,
"learning_rate": 8.505044914549131e-06,
"loss": 0.1504,
"mean_token_accuracy": 0.945387601852417,
"step": 221
},
{
"epoch": 1.0325581395348837,
"grad_norm": 2.0166773796081543,
"learning_rate": 8.48685777485727e-06,
"loss": 0.1271,
"mean_token_accuracy": 0.95333331823349,
"step": 222
},
{
"epoch": 1.0372093023255813,
"grad_norm": 2.1910595893859863,
"learning_rate": 8.46858300427193e-06,
"loss": 0.1377,
"mean_token_accuracy": 0.954576849937439,
"step": 223
},
{
"epoch": 1.041860465116279,
"grad_norm": 2.6961281299591064,
"learning_rate": 8.450221138953383e-06,
"loss": 0.128,
"mean_token_accuracy": 0.951163649559021,
"step": 224
},
{
"epoch": 1.0465116279069768,
"grad_norm": 2.3894295692443848,
"learning_rate": 8.431772717617154e-06,
"loss": 0.1398,
"mean_token_accuracy": 0.9508081674575806,
"step": 225
},
{
"epoch": 1.0511627906976744,
"grad_norm": 2.134735345840454,
"learning_rate": 8.413238281518225e-06,
"loss": 0.1235,
"mean_token_accuracy": 0.9533866047859192,
"step": 226
},
{
"epoch": 1.0558139534883721,
"grad_norm": 2.099576711654663,
"learning_rate": 8.394618374435148e-06,
"loss": 0.1474,
"mean_token_accuracy": 0.9495023488998413,
"step": 227
},
{
"epoch": 1.0604651162790697,
"grad_norm": 2.013437509536743,
"learning_rate": 8.375913542654093e-06,
"loss": 0.1406,
"mean_token_accuracy": 0.9510268568992615,
"step": 228
},
{
"epoch": 1.0651162790697675,
"grad_norm": 2.3148350715637207,
"learning_rate": 8.357124334952818e-06,
"loss": 0.1454,
"mean_token_accuracy": 0.9502067565917969,
"step": 229
},
{
"epoch": 1.069767441860465,
"grad_norm": 1.961985468864441,
"learning_rate": 8.33825130258458e-06,
"loss": 0.1278,
"mean_token_accuracy": 0.9549334645271301,
"step": 230
},
{
"epoch": 1.0744186046511628,
"grad_norm": 1.8867031335830688,
"learning_rate": 8.319294999261941e-06,
"loss": 0.1226,
"mean_token_accuracy": 0.9560340046882629,
"step": 231
},
{
"epoch": 1.0790697674418606,
"grad_norm": 1.8320002555847168,
"learning_rate": 8.300255981140544e-06,
"loss": 0.1202,
"mean_token_accuracy": 0.9573019742965698,
"step": 232
},
{
"epoch": 1.083720930232558,
"grad_norm": 2.1686620712280273,
"learning_rate": 8.281134806802783e-06,
"loss": 0.1502,
"mean_token_accuracy": 0.9432587027549744,
"step": 233
},
{
"epoch": 1.0883720930232559,
"grad_norm": 1.9972004890441895,
"learning_rate": 8.261932037241418e-06,
"loss": 0.1627,
"mean_token_accuracy": 0.94051593542099,
"step": 234
},
{
"epoch": 1.0930232558139534,
"grad_norm": 2.0510964393615723,
"learning_rate": 8.242648235843123e-06,
"loss": 0.1557,
"mean_token_accuracy": 0.9502580761909485,
"step": 235
},
{
"epoch": 1.0976744186046512,
"grad_norm": 1.992247462272644,
"learning_rate": 8.223283968371945e-06,
"loss": 0.1296,
"mean_token_accuracy": 0.9547486305236816,
"step": 236
},
{
"epoch": 1.1023255813953488,
"grad_norm": 2.0515332221984863,
"learning_rate": 8.203839802952708e-06,
"loss": 0.1311,
"mean_token_accuracy": 0.9554937481880188,
"step": 237
},
{
"epoch": 1.1069767441860465,
"grad_norm": 1.8534224033355713,
"learning_rate": 8.184316310054355e-06,
"loss": 0.1354,
"mean_token_accuracy": 0.9514824748039246,
"step": 238
},
{
"epoch": 1.1116279069767443,
"grad_norm": 2.0729804039001465,
"learning_rate": 8.164714062473201e-06,
"loss": 0.1397,
"mean_token_accuracy": 0.9531170129776001,
"step": 239
},
{
"epoch": 1.1162790697674418,
"grad_norm": 1.9124263525009155,
"learning_rate": 8.14503363531613e-06,
"loss": 0.1197,
"mean_token_accuracy": 0.9569715857505798,
"step": 240
},
{
"epoch": 1.1209302325581396,
"grad_norm": 1.9606989622116089,
"learning_rate": 8.125275605983725e-06,
"loss": 0.1273,
"mean_token_accuracy": 0.9557822942733765,
"step": 241
},
{
"epoch": 1.1255813953488372,
"grad_norm": 2.081315755844116,
"learning_rate": 8.10544055415332e-06,
"loss": 0.1401,
"mean_token_accuracy": 0.9516574740409851,
"step": 242
},
{
"epoch": 1.130232558139535,
"grad_norm": 1.9782904386520386,
"learning_rate": 8.085529061762007e-06,
"loss": 0.1328,
"mean_token_accuracy": 0.9561711549758911,
"step": 243
},
{
"epoch": 1.1348837209302325,
"grad_norm": 2.144768238067627,
"learning_rate": 8.065541712989546e-06,
"loss": 0.1337,
"mean_token_accuracy": 0.9531194567680359,
"step": 244
},
{
"epoch": 1.1395348837209303,
"grad_norm": 1.9130630493164062,
"learning_rate": 8.04547909424124e-06,
"loss": 0.1402,
"mean_token_accuracy": 0.9525547623634338,
"step": 245
},
{
"epoch": 1.1441860465116278,
"grad_norm": 2.034174919128418,
"learning_rate": 8.025341794130722e-06,
"loss": 0.1402,
"mean_token_accuracy": 0.947668731212616,
"step": 246
},
{
"epoch": 1.1488372093023256,
"grad_norm": 1.8769278526306152,
"learning_rate": 8.005130403462687e-06,
"loss": 0.12,
"mean_token_accuracy": 0.9560899138450623,
"step": 247
},
{
"epoch": 1.1534883720930234,
"grad_norm": 1.8356506824493408,
"learning_rate": 7.98484551521556e-06,
"loss": 0.1351,
"mean_token_accuracy": 0.9524879455566406,
"step": 248
},
{
"epoch": 1.158139534883721,
"grad_norm": 2.1841554641723633,
"learning_rate": 7.964487724524105e-06,
"loss": 0.1522,
"mean_token_accuracy": 0.9461566209793091,
"step": 249
},
{
"epoch": 1.1627906976744187,
"grad_norm": 1.7897896766662598,
"learning_rate": 7.944057628661948e-06,
"loss": 0.1304,
"mean_token_accuracy": 0.9538383483886719,
"step": 250
},
{
"epoch": 1.1674418604651162,
"grad_norm": 1.7146762609481812,
"learning_rate": 7.923555827024069e-06,
"loss": 0.1236,
"mean_token_accuracy": 0.9551189541816711,
"step": 251
},
{
"epoch": 1.172093023255814,
"grad_norm": 1.9337011575698853,
"learning_rate": 7.902982921109215e-06,
"loss": 0.1395,
"mean_token_accuracy": 0.950564980506897,
"step": 252
},
{
"epoch": 1.1767441860465115,
"grad_norm": 2.312887668609619,
"learning_rate": 7.882339514502236e-06,
"loss": 0.1599,
"mean_token_accuracy": 0.9496940970420837,
"step": 253
},
{
"epoch": 1.1813953488372093,
"grad_norm": 2.0187339782714844,
"learning_rate": 7.861626212856404e-06,
"loss": 0.1197,
"mean_token_accuracy": 0.9586181640625,
"step": 254
},
{
"epoch": 1.1860465116279069,
"grad_norm": 1.9361454248428345,
"learning_rate": 7.840843623875621e-06,
"loss": 0.1398,
"mean_token_accuracy": 0.9482730031013489,
"step": 255
},
{
"epoch": 1.1906976744186046,
"grad_norm": 1.932745099067688,
"learning_rate": 7.8199923572966e-06,
"loss": 0.137,
"mean_token_accuracy": 0.9541915655136108,
"step": 256
},
{
"epoch": 1.1953488372093024,
"grad_norm": 1.8732504844665527,
"learning_rate": 7.799073024870972e-06,
"loss": 0.1311,
"mean_token_accuracy": 0.9530263543128967,
"step": 257
},
{
"epoch": 1.2,
"grad_norm": 1.8641448020935059,
"learning_rate": 7.778086240347343e-06,
"loss": 0.1301,
"mean_token_accuracy": 0.9536779522895813,
"step": 258
},
{
"epoch": 1.2046511627906977,
"grad_norm": 1.8090254068374634,
"learning_rate": 7.757032619453285e-06,
"loss": 0.1179,
"mean_token_accuracy": 0.9588613510131836,
"step": 259
},
{
"epoch": 1.2093023255813953,
"grad_norm": 1.9466335773468018,
"learning_rate": 7.735912779877266e-06,
"loss": 0.1432,
"mean_token_accuracy": 0.9497014880180359,
"step": 260
},
{
"epoch": 1.213953488372093,
"grad_norm": 2.1102936267852783,
"learning_rate": 7.714727341250533e-06,
"loss": 0.1516,
"mean_token_accuracy": 0.9480257034301758,
"step": 261
},
{
"epoch": 1.2186046511627908,
"grad_norm": 1.830043911933899,
"learning_rate": 7.693476925128937e-06,
"loss": 0.1471,
"mean_token_accuracy": 0.9475498795509338,
"step": 262
},
{
"epoch": 1.2232558139534884,
"grad_norm": 1.9706553220748901,
"learning_rate": 7.672162154974686e-06,
"loss": 0.1441,
"mean_token_accuracy": 0.9502365589141846,
"step": 263
},
{
"epoch": 1.2279069767441861,
"grad_norm": 1.7491787672042847,
"learning_rate": 7.650783656138065e-06,
"loss": 0.1379,
"mean_token_accuracy": 0.9508991241455078,
"step": 264
},
{
"epoch": 1.2325581395348837,
"grad_norm": 1.9815034866333008,
"learning_rate": 7.629342055839077e-06,
"loss": 0.1638,
"mean_token_accuracy": 0.9426482915878296,
"step": 265
},
{
"epoch": 1.2372093023255815,
"grad_norm": 2.0385522842407227,
"learning_rate": 7.607837983149057e-06,
"loss": 0.1593,
"mean_token_accuracy": 0.9459502696990967,
"step": 266
},
{
"epoch": 1.241860465116279,
"grad_norm": 2.1366653442382812,
"learning_rate": 7.586272068972196e-06,
"loss": 0.1831,
"mean_token_accuracy": 0.9355138540267944,
"step": 267
},
{
"epoch": 1.2465116279069768,
"grad_norm": 1.7888002395629883,
"learning_rate": 7.564644946027049e-06,
"loss": 0.1226,
"mean_token_accuracy": 0.9529392123222351,
"step": 268
},
{
"epoch": 1.2511627906976743,
"grad_norm": 2.0460989475250244,
"learning_rate": 7.5429572488279615e-06,
"loss": 0.1344,
"mean_token_accuracy": 0.9502557516098022,
"step": 269
},
{
"epoch": 1.255813953488372,
"grad_norm": 1.8217569589614868,
"learning_rate": 7.521209613666457e-06,
"loss": 0.1224,
"mean_token_accuracy": 0.9609270095825195,
"step": 270
},
{
"epoch": 1.2604651162790699,
"grad_norm": 1.8216779232025146,
"learning_rate": 7.499402678592568e-06,
"loss": 0.1362,
"mean_token_accuracy": 0.9506351351737976,
"step": 271
},
{
"epoch": 1.2651162790697674,
"grad_norm": 1.7524104118347168,
"learning_rate": 7.477537083396114e-06,
"loss": 0.1204,
"mean_token_accuracy": 0.9553118348121643,
"step": 272
},
{
"epoch": 1.2697674418604652,
"grad_norm": 1.975805640220642,
"learning_rate": 7.45561346958794e-06,
"loss": 0.1201,
"mean_token_accuracy": 0.9567315578460693,
"step": 273
},
{
"epoch": 1.2744186046511627,
"grad_norm": 1.6656185388565063,
"learning_rate": 7.433632480381083e-06,
"loss": 0.1097,
"mean_token_accuracy": 0.9608015418052673,
"step": 274
},
{
"epoch": 1.2790697674418605,
"grad_norm": 1.9660391807556152,
"learning_rate": 7.4115947606719105e-06,
"loss": 0.136,
"mean_token_accuracy": 0.9484320282936096,
"step": 275
},
{
"epoch": 1.283720930232558,
"grad_norm": 1.9652019739151,
"learning_rate": 7.389500957021192e-06,
"loss": 0.1188,
"mean_token_accuracy": 0.9587832689285278,
"step": 276
},
{
"epoch": 1.2883720930232558,
"grad_norm": 2.1324007511138916,
"learning_rate": 7.367351717635136e-06,
"loss": 0.1426,
"mean_token_accuracy": 0.9486826062202454,
"step": 277
},
{
"epoch": 1.2930232558139534,
"grad_norm": 2.0965774059295654,
"learning_rate": 7.345147692346373e-06,
"loss": 0.1353,
"mean_token_accuracy": 0.9534883499145508,
"step": 278
},
{
"epoch": 1.2976744186046512,
"grad_norm": 1.8807930946350098,
"learning_rate": 7.3228895325948835e-06,
"loss": 0.1245,
"mean_token_accuracy": 0.9569152593612671,
"step": 279
},
{
"epoch": 1.302325581395349,
"grad_norm": 1.9116649627685547,
"learning_rate": 7.3005778914088895e-06,
"loss": 0.1232,
"mean_token_accuracy": 0.9569117426872253,
"step": 280
},
{
"epoch": 1.3069767441860465,
"grad_norm": 2.0371623039245605,
"learning_rate": 7.278213423385701e-06,
"loss": 0.146,
"mean_token_accuracy": 0.9478211998939514,
"step": 281
},
{
"epoch": 1.3116279069767443,
"grad_norm": 2.396204710006714,
"learning_rate": 7.255796784672496e-06,
"loss": 0.1844,
"mean_token_accuracy": 0.9387242794036865,
"step": 282
},
{
"epoch": 1.3162790697674418,
"grad_norm": 1.8520818948745728,
"learning_rate": 7.233328632947087e-06,
"loss": 0.1248,
"mean_token_accuracy": 0.9575390219688416,
"step": 283
},
{
"epoch": 1.3209302325581396,
"grad_norm": 4.048036575317383,
"learning_rate": 7.210809627398615e-06,
"loss": 0.1537,
"mean_token_accuracy": 0.9447412490844727,
"step": 284
},
{
"epoch": 1.3255813953488373,
"grad_norm": 1.67165207862854,
"learning_rate": 7.188240428708211e-06,
"loss": 0.1078,
"mean_token_accuracy": 0.9622266292572021,
"step": 285
},
{
"epoch": 1.330232558139535,
"grad_norm": 1.8730194568634033,
"learning_rate": 7.165621699029615e-06,
"loss": 0.1453,
"mean_token_accuracy": 0.9500071406364441,
"step": 286
},
{
"epoch": 1.3348837209302324,
"grad_norm": 1.767138123512268,
"learning_rate": 7.1429541019697505e-06,
"loss": 0.1418,
"mean_token_accuracy": 0.9493996500968933,
"step": 287
},
{
"epoch": 1.3395348837209302,
"grad_norm": 2.1134703159332275,
"learning_rate": 7.120238302569245e-06,
"loss": 0.1547,
"mean_token_accuracy": 0.9479333758354187,
"step": 288
},
{
"epoch": 1.344186046511628,
"grad_norm": 2.0318989753723145,
"learning_rate": 7.097474967282936e-06,
"loss": 0.1399,
"mean_token_accuracy": 0.9505158066749573,
"step": 289
},
{
"epoch": 1.3488372093023255,
"grad_norm": 2.1438822746276855,
"learning_rate": 7.0746647639602994e-06,
"loss": 0.146,
"mean_token_accuracy": 0.9493649005889893,
"step": 290
},
{
"epoch": 1.3534883720930233,
"grad_norm": 2.045762777328491,
"learning_rate": 7.051808361825867e-06,
"loss": 0.1546,
"mean_token_accuracy": 0.9482935070991516,
"step": 291
},
{
"epoch": 1.3581395348837209,
"grad_norm": 2.4444692134857178,
"learning_rate": 7.028906431459593e-06,
"loss": 0.163,
"mean_token_accuracy": 0.9413919448852539,
"step": 292
},
{
"epoch": 1.3627906976744186,
"grad_norm": 2.065103769302368,
"learning_rate": 7.0059596447771714e-06,
"loss": 0.1445,
"mean_token_accuracy": 0.9467507600784302,
"step": 293
},
{
"epoch": 1.3674418604651164,
"grad_norm": 1.9953572750091553,
"learning_rate": 6.982968675010332e-06,
"loss": 0.1237,
"mean_token_accuracy": 0.9579423666000366,
"step": 294
},
{
"epoch": 1.372093023255814,
"grad_norm": 1.9525924921035767,
"learning_rate": 6.959934196687079e-06,
"loss": 0.1462,
"mean_token_accuracy": 0.9512315988540649,
"step": 295
},
{
"epoch": 1.3767441860465115,
"grad_norm": 2.0204193592071533,
"learning_rate": 6.93685688561191e-06,
"loss": 0.147,
"mean_token_accuracy": 0.9485055804252625,
"step": 296
},
{
"epoch": 1.3813953488372093,
"grad_norm": 2.029042959213257,
"learning_rate": 6.913737418845985e-06,
"loss": 0.1403,
"mean_token_accuracy": 0.9497275352478027,
"step": 297
},
{
"epoch": 1.386046511627907,
"grad_norm": 1.9784486293792725,
"learning_rate": 6.890576474687264e-06,
"loss": 0.1365,
"mean_token_accuracy": 0.9519021511077881,
"step": 298
},
{
"epoch": 1.3906976744186046,
"grad_norm": 1.9087692499160767,
"learning_rate": 6.8673747326506e-06,
"loss": 0.1382,
"mean_token_accuracy": 0.9500246644020081,
"step": 299
},
{
"epoch": 1.3953488372093024,
"grad_norm": 1.8645182847976685,
"learning_rate": 6.8441328734478115e-06,
"loss": 0.133,
"mean_token_accuracy": 0.9523329734802246,
"step": 300
},
{
"epoch": 1.4,
"grad_norm": 1.7279090881347656,
"learning_rate": 6.820851578967708e-06,
"loss": 0.1288,
"mean_token_accuracy": 0.9540249109268188,
"step": 301
},
{
"epoch": 1.4046511627906977,
"grad_norm": 1.8317281007766724,
"learning_rate": 6.797531532256079e-06,
"loss": 0.1435,
"mean_token_accuracy": 0.947135865688324,
"step": 302
},
{
"epoch": 1.4093023255813955,
"grad_norm": 1.9698084592819214,
"learning_rate": 6.774173417495667e-06,
"loss": 0.1512,
"mean_token_accuracy": 0.9412643313407898,
"step": 303
},
{
"epoch": 1.413953488372093,
"grad_norm": 1.7703008651733398,
"learning_rate": 6.750777919986075e-06,
"loss": 0.1383,
"mean_token_accuracy": 0.9496229290962219,
"step": 304
},
{
"epoch": 1.4186046511627908,
"grad_norm": 1.9811159372329712,
"learning_rate": 6.727345726123684e-06,
"loss": 0.1715,
"mean_token_accuracy": 0.9391480684280396,
"step": 305
},
{
"epoch": 1.4232558139534883,
"grad_norm": 1.7490876913070679,
"learning_rate": 6.703877523381495e-06,
"loss": 0.1267,
"mean_token_accuracy": 0.9528796076774597,
"step": 306
},
{
"epoch": 1.427906976744186,
"grad_norm": 1.9982609748840332,
"learning_rate": 6.680374000288968e-06,
"loss": 0.1325,
"mean_token_accuracy": 0.9569318890571594,
"step": 307
},
{
"epoch": 1.4325581395348836,
"grad_norm": 1.940192461013794,
"learning_rate": 6.656835846411824e-06,
"loss": 0.1466,
"mean_token_accuracy": 0.9504638314247131,
"step": 308
},
{
"epoch": 1.4372093023255814,
"grad_norm": 2.010435104370117,
"learning_rate": 6.633263752331808e-06,
"loss": 0.1462,
"mean_token_accuracy": 0.9526048302650452,
"step": 309
},
{
"epoch": 1.441860465116279,
"grad_norm": 1.848711371421814,
"learning_rate": 6.609658409626431e-06,
"loss": 0.1356,
"mean_token_accuracy": 0.9486258625984192,
"step": 310
},
{
"epoch": 1.4465116279069767,
"grad_norm": 1.9631938934326172,
"learning_rate": 6.586020510848676e-06,
"loss": 0.1161,
"mean_token_accuracy": 0.9588515162467957,
"step": 311
},
{
"epoch": 1.4511627906976745,
"grad_norm": 2.154928207397461,
"learning_rate": 6.562350749506691e-06,
"loss": 0.1685,
"mean_token_accuracy": 0.9434839487075806,
"step": 312
},
{
"epoch": 1.455813953488372,
"grad_norm": 1.8358088731765747,
"learning_rate": 6.538649820043427e-06,
"loss": 0.1409,
"mean_token_accuracy": 0.9509722590446472,
"step": 313
},
{
"epoch": 1.4604651162790698,
"grad_norm": 1.9285755157470703,
"learning_rate": 6.514918417816275e-06,
"loss": 0.1319,
"mean_token_accuracy": 0.9517412781715393,
"step": 314
},
{
"epoch": 1.4651162790697674,
"grad_norm": 1.847544550895691,
"learning_rate": 6.4911572390766575e-06,
"loss": 0.1345,
"mean_token_accuracy": 0.9501661062240601,
"step": 315
},
{
"epoch": 1.4697674418604652,
"grad_norm": 2.1781485080718994,
"learning_rate": 6.46736698094961e-06,
"loss": 0.165,
"mean_token_accuracy": 0.9442425966262817,
"step": 316
},
{
"epoch": 1.474418604651163,
"grad_norm": 2.6374707221984863,
"learning_rate": 6.443548341413316e-06,
"loss": 0.1405,
"mean_token_accuracy": 0.948967695236206,
"step": 317
},
{
"epoch": 1.4790697674418605,
"grad_norm": 1.8847520351409912,
"learning_rate": 6.419702019278643e-06,
"loss": 0.1415,
"mean_token_accuracy": 0.9527637958526611,
"step": 318
},
{
"epoch": 1.483720930232558,
"grad_norm": 2.0058882236480713,
"learning_rate": 6.3958287141686294e-06,
"loss": 0.1419,
"mean_token_accuracy": 0.948972225189209,
"step": 319
},
{
"epoch": 1.4883720930232558,
"grad_norm": 1.837763786315918,
"learning_rate": 6.371929126497963e-06,
"loss": 0.119,
"mean_token_accuracy": 0.9574694037437439,
"step": 320
},
{
"epoch": 1.4930232558139536,
"grad_norm": 1.9148606061935425,
"learning_rate": 6.348003957452433e-06,
"loss": 0.1352,
"mean_token_accuracy": 0.9492248296737671,
"step": 321
},
{
"epoch": 1.4976744186046511,
"grad_norm": 1.9753315448760986,
"learning_rate": 6.324053908968353e-06,
"loss": 0.1364,
"mean_token_accuracy": 0.9513832330703735,
"step": 322
},
{
"epoch": 1.5023255813953489,
"grad_norm": 1.8429263830184937,
"learning_rate": 6.300079683711973e-06,
"loss": 0.1237,
"mean_token_accuracy": 0.9562457203865051,
"step": 323
},
{
"epoch": 1.5069767441860464,
"grad_norm": 1.7931606769561768,
"learning_rate": 6.276081985058857e-06,
"loss": 0.1089,
"mean_token_accuracy": 0.9609548449516296,
"step": 324
},
{
"epoch": 1.5116279069767442,
"grad_norm": 1.9909682273864746,
"learning_rate": 6.2520615170732555e-06,
"loss": 0.1365,
"mean_token_accuracy": 0.9544373154640198,
"step": 325
},
{
"epoch": 1.516279069767442,
"grad_norm": 2.083770990371704,
"learning_rate": 6.228018984487443e-06,
"loss": 0.1527,
"mean_token_accuracy": 0.9463026523590088,
"step": 326
},
{
"epoch": 1.5209302325581395,
"grad_norm": 2.060635805130005,
"learning_rate": 6.20395509268104e-06,
"loss": 0.1416,
"mean_token_accuracy": 0.9506000876426697,
"step": 327
},
{
"epoch": 1.525581395348837,
"grad_norm": 2.266390323638916,
"learning_rate": 6.179870547660326e-06,
"loss": 0.1769,
"mean_token_accuracy": 0.9442271590232849,
"step": 328
},
{
"epoch": 1.5302325581395348,
"grad_norm": 1.9692381620407104,
"learning_rate": 6.15576605603752e-06,
"loss": 0.1344,
"mean_token_accuracy": 0.9521507024765015,
"step": 329
},
{
"epoch": 1.5348837209302326,
"grad_norm": 1.6992781162261963,
"learning_rate": 6.13164232501005e-06,
"loss": 0.1169,
"mean_token_accuracy": 0.9589894413948059,
"step": 330
},
{
"epoch": 1.5395348837209304,
"grad_norm": 1.78009831905365,
"learning_rate": 6.107500062339806e-06,
"loss": 0.1232,
"mean_token_accuracy": 0.9531930088996887,
"step": 331
},
{
"epoch": 1.544186046511628,
"grad_norm": 1.8769017457962036,
"learning_rate": 6.083339976332375e-06,
"loss": 0.1308,
"mean_token_accuracy": 0.9528769850730896,
"step": 332
},
{
"epoch": 1.5488372093023255,
"grad_norm": 1.9236352443695068,
"learning_rate": 6.05916277581626e-06,
"loss": 0.1425,
"mean_token_accuracy": 0.9482171535491943,
"step": 333
},
{
"epoch": 1.5534883720930233,
"grad_norm": 1.9040541648864746,
"learning_rate": 6.034969170122079e-06,
"loss": 0.1294,
"mean_token_accuracy": 0.9605388045310974,
"step": 334
},
{
"epoch": 1.558139534883721,
"grad_norm": 1.9620603322982788,
"learning_rate": 6.010759869061768e-06,
"loss": 0.1617,
"mean_token_accuracy": 0.9422249794006348,
"step": 335
},
{
"epoch": 1.5627906976744186,
"grad_norm": 1.784496784210205,
"learning_rate": 5.986535582907739e-06,
"loss": 0.1198,
"mean_token_accuracy": 0.957058310508728,
"step": 336
},
{
"epoch": 1.5674418604651161,
"grad_norm": 1.819798231124878,
"learning_rate": 5.96229702237205e-06,
"loss": 0.1157,
"mean_token_accuracy": 0.9596412777900696,
"step": 337
},
{
"epoch": 1.572093023255814,
"grad_norm": 1.9021272659301758,
"learning_rate": 5.938044898585555e-06,
"loss": 0.1374,
"mean_token_accuracy": 0.9488742351531982,
"step": 338
},
{
"epoch": 1.5767441860465117,
"grad_norm": 1.9908572435379028,
"learning_rate": 5.913779923077035e-06,
"loss": 0.1597,
"mean_token_accuracy": 0.9456487894058228,
"step": 339
},
{
"epoch": 1.5813953488372094,
"grad_norm": 1.9344072341918945,
"learning_rate": 5.889502807752329e-06,
"loss": 0.152,
"mean_token_accuracy": 0.9439780712127686,
"step": 340
},
{
"epoch": 1.586046511627907,
"grad_norm": 1.9438843727111816,
"learning_rate": 5.865214264873441e-06,
"loss": 0.1355,
"mean_token_accuracy": 0.9536268711090088,
"step": 341
},
{
"epoch": 1.5906976744186045,
"grad_norm": 1.8337723016738892,
"learning_rate": 5.840915007037648e-06,
"loss": 0.1248,
"mean_token_accuracy": 0.9561098217964172,
"step": 342
},
{
"epoch": 1.5953488372093023,
"grad_norm": 2.127720594406128,
"learning_rate": 5.816605747156588e-06,
"loss": 0.1514,
"mean_token_accuracy": 0.9452188014984131,
"step": 343
},
{
"epoch": 1.6,
"grad_norm": 1.8010351657867432,
"learning_rate": 5.792287198435349e-06,
"loss": 0.1372,
"mean_token_accuracy": 0.9540988802909851,
"step": 344
},
{
"epoch": 1.6046511627906976,
"grad_norm": 1.8526756763458252,
"learning_rate": 5.767960074351545e-06,
"loss": 0.1394,
"mean_token_accuracy": 0.953599214553833,
"step": 345
},
{
"epoch": 1.6093023255813952,
"grad_norm": 1.8736450672149658,
"learning_rate": 5.74362508863438e-06,
"loss": 0.1274,
"mean_token_accuracy": 0.953865110874176,
"step": 346
},
{
"epoch": 1.613953488372093,
"grad_norm": 2.073957920074463,
"learning_rate": 5.719282955243705e-06,
"loss": 0.1559,
"mean_token_accuracy": 0.9409741163253784,
"step": 347
},
{
"epoch": 1.6186046511627907,
"grad_norm": 2.255732536315918,
"learning_rate": 5.69493438834908e-06,
"loss": 0.1601,
"mean_token_accuracy": 0.9462425708770752,
"step": 348
},
{
"epoch": 1.6232558139534885,
"grad_norm": 2.0009047985076904,
"learning_rate": 5.670580102308816e-06,
"loss": 0.1326,
"mean_token_accuracy": 0.9542755484580994,
"step": 349
},
{
"epoch": 1.627906976744186,
"grad_norm": 1.8203014135360718,
"learning_rate": 5.646220811649013e-06,
"loss": 0.1201,
"mean_token_accuracy": 0.9584925174713135,
"step": 350
},
{
"epoch": 1.6325581395348836,
"grad_norm": 2.1540281772613525,
"learning_rate": 5.6218572310426065e-06,
"loss": 0.1561,
"mean_token_accuracy": 0.9470699429512024,
"step": 351
},
{
"epoch": 1.6372093023255814,
"grad_norm": 1.8674291372299194,
"learning_rate": 5.59749007528839e-06,
"loss": 0.1381,
"mean_token_accuracy": 0.9516509175300598,
"step": 352
},
{
"epoch": 1.6418604651162791,
"grad_norm": 1.9634373188018799,
"learning_rate": 5.573120059290047e-06,
"loss": 0.142,
"mean_token_accuracy": 0.9484654664993286,
"step": 353
},
{
"epoch": 1.6465116279069767,
"grad_norm": 1.9212641716003418,
"learning_rate": 5.5487478980351805e-06,
"loss": 0.1452,
"mean_token_accuracy": 0.9457268714904785,
"step": 354
},
{
"epoch": 1.6511627906976745,
"grad_norm": 1.8786492347717285,
"learning_rate": 5.524374306574331e-06,
"loss": 0.1186,
"mean_token_accuracy": 0.9576781392097473,
"step": 355
},
{
"epoch": 1.655813953488372,
"grad_norm": 1.8229862451553345,
"learning_rate": 5.500000000000001e-06,
"loss": 0.1398,
"mean_token_accuracy": 0.9506021738052368,
"step": 356
},
{
"epoch": 1.6604651162790698,
"grad_norm": 1.99154531955719,
"learning_rate": 5.47562569342567e-06,
"loss": 0.1332,
"mean_token_accuracy": 0.9508275985717773,
"step": 357
},
{
"epoch": 1.6651162790697676,
"grad_norm": 1.8731307983398438,
"learning_rate": 5.451252101964821e-06,
"loss": 0.1318,
"mean_token_accuracy": 0.9521738886833191,
"step": 358
},
{
"epoch": 1.669767441860465,
"grad_norm": 2.3059403896331787,
"learning_rate": 5.426879940709956e-06,
"loss": 0.1782,
"mean_token_accuracy": 0.9378255605697632,
"step": 359
},
{
"epoch": 1.6744186046511627,
"grad_norm": 1.8346630334854126,
"learning_rate": 5.402509924711612e-06,
"loss": 0.1248,
"mean_token_accuracy": 0.9567375779151917,
"step": 360
},
{
"epoch": 1.6790697674418604,
"grad_norm": 2.249401569366455,
"learning_rate": 5.378142768957396e-06,
"loss": 0.165,
"mean_token_accuracy": 0.9445608258247375,
"step": 361
},
{
"epoch": 1.6837209302325582,
"grad_norm": 2.1428322792053223,
"learning_rate": 5.353779188350989e-06,
"loss": 0.1536,
"mean_token_accuracy": 0.9398339986801147,
"step": 362
},
{
"epoch": 1.688372093023256,
"grad_norm": 1.8637951612472534,
"learning_rate": 5.329419897691187e-06,
"loss": 0.1284,
"mean_token_accuracy": 0.9572995901107788,
"step": 363
},
{
"epoch": 1.6930232558139535,
"grad_norm": 2.081277847290039,
"learning_rate": 5.305065611650921e-06,
"loss": 0.1269,
"mean_token_accuracy": 0.9535707831382751,
"step": 364
},
{
"epoch": 1.697674418604651,
"grad_norm": 1.8109171390533447,
"learning_rate": 5.280717044756298e-06,
"loss": 0.1332,
"mean_token_accuracy": 0.9521582722663879,
"step": 365
},
{
"epoch": 1.7023255813953488,
"grad_norm": 1.8539905548095703,
"learning_rate": 5.256374911365621e-06,
"loss": 0.141,
"mean_token_accuracy": 0.948835015296936,
"step": 366
},
{
"epoch": 1.7069767441860466,
"grad_norm": 1.6707813739776611,
"learning_rate": 5.232039925648457e-06,
"loss": 0.1112,
"mean_token_accuracy": 0.9606493711471558,
"step": 367
},
{
"epoch": 1.7116279069767442,
"grad_norm": 1.7835884094238281,
"learning_rate": 5.207712801564652e-06,
"loss": 0.1217,
"mean_token_accuracy": 0.9547820687294006,
"step": 368
},
{
"epoch": 1.7162790697674417,
"grad_norm": 1.926405668258667,
"learning_rate": 5.1833942528434145e-06,
"loss": 0.1283,
"mean_token_accuracy": 0.954860508441925,
"step": 369
},
{
"epoch": 1.7209302325581395,
"grad_norm": 1.9628880023956299,
"learning_rate": 5.159084992962354e-06,
"loss": 0.1176,
"mean_token_accuracy": 0.9579154849052429,
"step": 370
},
{
"epoch": 1.7255813953488373,
"grad_norm": 1.838537335395813,
"learning_rate": 5.13478573512656e-06,
"loss": 0.1516,
"mean_token_accuracy": 0.9484519958496094,
"step": 371
},
{
"epoch": 1.730232558139535,
"grad_norm": 1.7399450540542603,
"learning_rate": 5.110497192247671e-06,
"loss": 0.1274,
"mean_token_accuracy": 0.9532235264778137,
"step": 372
},
{
"epoch": 1.7348837209302326,
"grad_norm": 1.798194169998169,
"learning_rate": 5.086220076922965e-06,
"loss": 0.1225,
"mean_token_accuracy": 0.9570792317390442,
"step": 373
},
{
"epoch": 1.7395348837209301,
"grad_norm": 2.0451667308807373,
"learning_rate": 5.061955101414448e-06,
"loss": 0.1517,
"mean_token_accuracy": 0.9501442909240723,
"step": 374
},
{
"epoch": 1.744186046511628,
"grad_norm": 1.874577522277832,
"learning_rate": 5.0377029776279514e-06,
"loss": 0.1227,
"mean_token_accuracy": 0.9561297297477722,
"step": 375
},
{
"epoch": 1.7488372093023257,
"grad_norm": 1.733536958694458,
"learning_rate": 5.013464417092263e-06,
"loss": 0.1146,
"mean_token_accuracy": 0.9611798524856567,
"step": 376
},
{
"epoch": 1.7534883720930232,
"grad_norm": 1.8131812810897827,
"learning_rate": 4.989240130938232e-06,
"loss": 0.1218,
"mean_token_accuracy": 0.9619940519332886,
"step": 377
},
{
"epoch": 1.7581395348837208,
"grad_norm": 1.9327350854873657,
"learning_rate": 4.9650308298779215e-06,
"loss": 0.1452,
"mean_token_accuracy": 0.9495870471000671,
"step": 378
},
{
"epoch": 1.7627906976744185,
"grad_norm": 1.914912223815918,
"learning_rate": 4.940837224183742e-06,
"loss": 0.1221,
"mean_token_accuracy": 0.956214189529419,
"step": 379
},
{
"epoch": 1.7674418604651163,
"grad_norm": 1.8603955507278442,
"learning_rate": 4.916660023667627e-06,
"loss": 0.1394,
"mean_token_accuracy": 0.9508364796638489,
"step": 380
},
{
"epoch": 1.772093023255814,
"grad_norm": 2.003020763397217,
"learning_rate": 4.892499937660195e-06,
"loss": 0.1318,
"mean_token_accuracy": 0.951373815536499,
"step": 381
},
{
"epoch": 1.7767441860465116,
"grad_norm": 2.2919867038726807,
"learning_rate": 4.8683576749899505e-06,
"loss": 0.1521,
"mean_token_accuracy": 0.9484791159629822,
"step": 382
},
{
"epoch": 1.7813953488372092,
"grad_norm": 1.9706724882125854,
"learning_rate": 4.844233943962481e-06,
"loss": 0.1103,
"mean_token_accuracy": 0.9585579037666321,
"step": 383
},
{
"epoch": 1.786046511627907,
"grad_norm": 1.9017114639282227,
"learning_rate": 4.820129452339676e-06,
"loss": 0.1439,
"mean_token_accuracy": 0.9472662806510925,
"step": 384
},
{
"epoch": 1.7906976744186047,
"grad_norm": 1.9794905185699463,
"learning_rate": 4.796044907318961e-06,
"loss": 0.137,
"mean_token_accuracy": 0.9533417224884033,
"step": 385
},
{
"epoch": 1.7953488372093023,
"grad_norm": 2.379739284515381,
"learning_rate": 4.771981015512559e-06,
"loss": 0.1763,
"mean_token_accuracy": 0.9416927695274353,
"step": 386
},
{
"epoch": 1.8,
"grad_norm": 1.9658362865447998,
"learning_rate": 4.747938482926746e-06,
"loss": 0.1481,
"mean_token_accuracy": 0.9476566314697266,
"step": 387
},
{
"epoch": 1.8046511627906976,
"grad_norm": 1.9675973653793335,
"learning_rate": 4.723918014941144e-06,
"loss": 0.1353,
"mean_token_accuracy": 0.9520778656005859,
"step": 388
},
{
"epoch": 1.8093023255813954,
"grad_norm": 1.9576362371444702,
"learning_rate": 4.69992031628803e-06,
"loss": 0.1286,
"mean_token_accuracy": 0.9561353921890259,
"step": 389
},
{
"epoch": 1.8139534883720931,
"grad_norm": 1.9920960664749146,
"learning_rate": 4.675946091031648e-06,
"loss": 0.1359,
"mean_token_accuracy": 0.9533660411834717,
"step": 390
},
{
"epoch": 1.8186046511627907,
"grad_norm": 1.902557134628296,
"learning_rate": 4.65199604254757e-06,
"loss": 0.13,
"mean_token_accuracy": 0.9536868929862976,
"step": 391
},
{
"epoch": 1.8232558139534882,
"grad_norm": 1.7443137168884277,
"learning_rate": 4.628070873502038e-06,
"loss": 0.1346,
"mean_token_accuracy": 0.9529221057891846,
"step": 392
},
{
"epoch": 1.827906976744186,
"grad_norm": 1.5767067670822144,
"learning_rate": 4.604171285831373e-06,
"loss": 0.1128,
"mean_token_accuracy": 0.9544422626495361,
"step": 393
},
{
"epoch": 1.8325581395348838,
"grad_norm": 2.047105312347412,
"learning_rate": 4.5802979807213585e-06,
"loss": 0.1516,
"mean_token_accuracy": 0.9372674226760864,
"step": 394
},
{
"epoch": 1.8372093023255816,
"grad_norm": 1.8142563104629517,
"learning_rate": 4.556451658586687e-06,
"loss": 0.1226,
"mean_token_accuracy": 0.9564979076385498,
"step": 395
},
{
"epoch": 1.841860465116279,
"grad_norm": 1.9213443994522095,
"learning_rate": 4.532633019050392e-06,
"loss": 0.1438,
"mean_token_accuracy": 0.9534309506416321,
"step": 396
},
{
"epoch": 1.8465116279069766,
"grad_norm": 1.772811770439148,
"learning_rate": 4.508842760923344e-06,
"loss": 0.1358,
"mean_token_accuracy": 0.9528013467788696,
"step": 397
},
{
"epoch": 1.8511627906976744,
"grad_norm": 1.880860447883606,
"learning_rate": 4.4850815821837265e-06,
"loss": 0.1345,
"mean_token_accuracy": 0.9486945271492004,
"step": 398
},
{
"epoch": 1.8558139534883722,
"grad_norm": 2.0496411323547363,
"learning_rate": 4.4613501799565755e-06,
"loss": 0.1429,
"mean_token_accuracy": 0.9489778876304626,
"step": 399
},
{
"epoch": 1.8604651162790697,
"grad_norm": 1.9374741315841675,
"learning_rate": 4.43764925049331e-06,
"loss": 0.131,
"mean_token_accuracy": 0.9518900513648987,
"step": 400
},
{
"epoch": 1.8651162790697673,
"grad_norm": 1.947840929031372,
"learning_rate": 4.413979489151326e-06,
"loss": 0.1399,
"mean_token_accuracy": 0.9489177465438843,
"step": 401
},
{
"epoch": 1.869767441860465,
"grad_norm": 2.468381643295288,
"learning_rate": 4.3903415903735725e-06,
"loss": 0.1656,
"mean_token_accuracy": 0.9420523643493652,
"step": 402
},
{
"epoch": 1.8744186046511628,
"grad_norm": 1.9637192487716675,
"learning_rate": 4.366736247668194e-06,
"loss": 0.1214,
"mean_token_accuracy": 0.9539300203323364,
"step": 403
},
{
"epoch": 1.8790697674418606,
"grad_norm": 1.993908405303955,
"learning_rate": 4.343164153588176e-06,
"loss": 0.1413,
"mean_token_accuracy": 0.95000821352005,
"step": 404
},
{
"epoch": 1.8837209302325582,
"grad_norm": 2.0856027603149414,
"learning_rate": 4.3196259997110326e-06,
"loss": 0.142,
"mean_token_accuracy": 0.949593186378479,
"step": 405
},
{
"epoch": 1.8883720930232557,
"grad_norm": 1.7070889472961426,
"learning_rate": 4.296122476618507e-06,
"loss": 0.1247,
"mean_token_accuracy": 0.9530761241912842,
"step": 406
},
{
"epoch": 1.8930232558139535,
"grad_norm": 1.9810974597930908,
"learning_rate": 4.2726542738763185e-06,
"loss": 0.1164,
"mean_token_accuracy": 0.9563318490982056,
"step": 407
},
{
"epoch": 1.8976744186046512,
"grad_norm": 2.0617589950561523,
"learning_rate": 4.249222080013927e-06,
"loss": 0.1543,
"mean_token_accuracy": 0.9469596743583679,
"step": 408
},
{
"epoch": 1.9023255813953488,
"grad_norm": 1.9862779378890991,
"learning_rate": 4.2258265825043365e-06,
"loss": 0.1297,
"mean_token_accuracy": 0.9529111385345459,
"step": 409
},
{
"epoch": 1.9069767441860463,
"grad_norm": 1.9495517015457153,
"learning_rate": 4.202468467743922e-06,
"loss": 0.1348,
"mean_token_accuracy": 0.9511424899101257,
"step": 410
},
{
"epoch": 1.9116279069767441,
"grad_norm": 1.9612817764282227,
"learning_rate": 4.1791484210322945e-06,
"loss": 0.1424,
"mean_token_accuracy": 0.9513311982154846,
"step": 411
},
{
"epoch": 1.916279069767442,
"grad_norm": 1.9220209121704102,
"learning_rate": 4.15586712655219e-06,
"loss": 0.1338,
"mean_token_accuracy": 0.9528619647026062,
"step": 412
},
{
"epoch": 1.9209302325581397,
"grad_norm": 1.9853949546813965,
"learning_rate": 4.1326252673494006e-06,
"loss": 0.1367,
"mean_token_accuracy": 0.9542078971862793,
"step": 413
},
{
"epoch": 1.9255813953488372,
"grad_norm": 1.8623827695846558,
"learning_rate": 4.109423525312738e-06,
"loss": 0.1306,
"mean_token_accuracy": 0.9558945298194885,
"step": 414
},
{
"epoch": 1.9302325581395348,
"grad_norm": 2.083481550216675,
"learning_rate": 4.086262581154015e-06,
"loss": 0.1253,
"mean_token_accuracy": 0.9526870846748352,
"step": 415
},
{
"epoch": 1.9348837209302325,
"grad_norm": 1.816807508468628,
"learning_rate": 4.0631431143880915e-06,
"loss": 0.1352,
"mean_token_accuracy": 0.9498327970504761,
"step": 416
},
{
"epoch": 1.9395348837209303,
"grad_norm": 1.9113500118255615,
"learning_rate": 4.040065803312921e-06,
"loss": 0.1358,
"mean_token_accuracy": 0.948095440864563,
"step": 417
},
{
"epoch": 1.9441860465116279,
"grad_norm": 1.7576724290847778,
"learning_rate": 4.017031324989669e-06,
"loss": 0.1135,
"mean_token_accuracy": 0.9590513706207275,
"step": 418
},
{
"epoch": 1.9488372093023256,
"grad_norm": 2.2163145542144775,
"learning_rate": 3.994040355222828e-06,
"loss": 0.1438,
"mean_token_accuracy": 0.9499019384384155,
"step": 419
},
{
"epoch": 1.9534883720930232,
"grad_norm": 1.9273474216461182,
"learning_rate": 3.971093568540408e-06,
"loss": 0.1365,
"mean_token_accuracy": 0.9528368711471558,
"step": 420
},
{
"epoch": 1.958139534883721,
"grad_norm": 1.855919361114502,
"learning_rate": 3.948191638174135e-06,
"loss": 0.1321,
"mean_token_accuracy": 0.9499024152755737,
"step": 421
},
{
"epoch": 1.9627906976744187,
"grad_norm": 2.040865659713745,
"learning_rate": 3.925335236039702e-06,
"loss": 0.1394,
"mean_token_accuracy": 0.9538987874984741,
"step": 422
},
{
"epoch": 1.9674418604651163,
"grad_norm": 1.827325701713562,
"learning_rate": 3.902525032717067e-06,
"loss": 0.1056,
"mean_token_accuracy": 0.9614977240562439,
"step": 423
},
{
"epoch": 1.9720930232558138,
"grad_norm": 1.778291940689087,
"learning_rate": 3.879761697430756e-06,
"loss": 0.1247,
"mean_token_accuracy": 0.9552616477012634,
"step": 424
},
{
"epoch": 1.9767441860465116,
"grad_norm": 1.7589936256408691,
"learning_rate": 3.8570458980302526e-06,
"loss": 0.1262,
"mean_token_accuracy": 0.9544051885604858,
"step": 425
},
{
"epoch": 1.9813953488372094,
"grad_norm": 1.8840413093566895,
"learning_rate": 3.834378300970385e-06,
"loss": 0.1317,
"mean_token_accuracy": 0.9542329907417297,
"step": 426
},
{
"epoch": 1.9860465116279071,
"grad_norm": 2.0406875610351562,
"learning_rate": 3.811759571291792e-06,
"loss": 0.1298,
"mean_token_accuracy": 0.9538700580596924,
"step": 427
},
{
"epoch": 1.9906976744186047,
"grad_norm": 1.8465980291366577,
"learning_rate": 3.789190372601387e-06,
"loss": 0.1456,
"mean_token_accuracy": 0.9468926787376404,
"step": 428
},
{
"epoch": 1.9953488372093022,
"grad_norm": 1.9541380405426025,
"learning_rate": 3.7666713670529153e-06,
"loss": 0.1409,
"mean_token_accuracy": 0.9509699940681458,
"step": 429
},
{
"epoch": 2.0,
"grad_norm": 1.4541330337524414,
"learning_rate": 3.7442032153275053e-06,
"loss": 0.0761,
"mean_token_accuracy": 0.9719982743263245,
"step": 430
},
{
"epoch": 2.0046511627906978,
"grad_norm": 1.672062635421753,
"learning_rate": 3.7217865766143014e-06,
"loss": 0.0524,
"mean_token_accuracy": 0.984748363494873,
"step": 431
},
{
"epoch": 2.0093023255813955,
"grad_norm": 1.4939134120941162,
"learning_rate": 3.6994221085911107e-06,
"loss": 0.0544,
"mean_token_accuracy": 0.9857293963432312,
"step": 432
},
{
"epoch": 2.013953488372093,
"grad_norm": 1.3394852876663208,
"learning_rate": 3.6771104674051184e-06,
"loss": 0.0461,
"mean_token_accuracy": 0.9873949289321899,
"step": 433
},
{
"epoch": 2.0186046511627906,
"grad_norm": 1.4517439603805542,
"learning_rate": 3.654852307653628e-06,
"loss": 0.048,
"mean_token_accuracy": 0.9845333099365234,
"step": 434
},
{
"epoch": 2.0232558139534884,
"grad_norm": 1.157000184059143,
"learning_rate": 3.6326482823648656e-06,
"loss": 0.0412,
"mean_token_accuracy": 0.9895949363708496,
"step": 435
},
{
"epoch": 2.027906976744186,
"grad_norm": 1.5402953624725342,
"learning_rate": 3.6104990429788102e-06,
"loss": 0.0387,
"mean_token_accuracy": 0.9885908365249634,
"step": 436
},
{
"epoch": 2.0325581395348835,
"grad_norm": 1.3295921087265015,
"learning_rate": 3.588405239328091e-06,
"loss": 0.0485,
"mean_token_accuracy": 0.9842379093170166,
"step": 437
},
{
"epoch": 2.0372093023255813,
"grad_norm": 1.5409480333328247,
"learning_rate": 3.5663675196189184e-06,
"loss": 0.0452,
"mean_token_accuracy": 0.9862408638000488,
"step": 438
},
{
"epoch": 2.041860465116279,
"grad_norm": 1.2995237112045288,
"learning_rate": 3.5443865304120607e-06,
"loss": 0.0361,
"mean_token_accuracy": 0.9853552579879761,
"step": 439
},
{
"epoch": 2.046511627906977,
"grad_norm": 1.1838889122009277,
"learning_rate": 3.522462916603887e-06,
"loss": 0.0394,
"mean_token_accuracy": 0.9879562258720398,
"step": 440
},
{
"epoch": 2.0511627906976746,
"grad_norm": 1.304025411605835,
"learning_rate": 3.500597321407435e-06,
"loss": 0.0313,
"mean_token_accuracy": 0.9885208010673523,
"step": 441
},
{
"epoch": 2.055813953488372,
"grad_norm": 1.6431220769882202,
"learning_rate": 3.478790386333546e-06,
"loss": 0.0471,
"mean_token_accuracy": 0.9840630292892456,
"step": 442
},
{
"epoch": 2.0604651162790697,
"grad_norm": 2.0246262550354004,
"learning_rate": 3.45704275117204e-06,
"loss": 0.0614,
"mean_token_accuracy": 0.9822935461997986,
"step": 443
},
{
"epoch": 2.0651162790697675,
"grad_norm": 1.8200246095657349,
"learning_rate": 3.435355053972953e-06,
"loss": 0.0488,
"mean_token_accuracy": 0.9845336079597473,
"step": 444
},
{
"epoch": 2.0697674418604652,
"grad_norm": 2.0698256492614746,
"learning_rate": 3.4137279310278054e-06,
"loss": 0.0624,
"mean_token_accuracy": 0.9742683172225952,
"step": 445
},
{
"epoch": 2.0744186046511626,
"grad_norm": 1.9601695537567139,
"learning_rate": 3.392162016850945e-06,
"loss": 0.054,
"mean_token_accuracy": 0.9828470945358276,
"step": 446
},
{
"epoch": 2.0790697674418603,
"grad_norm": 1.7648512125015259,
"learning_rate": 3.3706579441609224e-06,
"loss": 0.0512,
"mean_token_accuracy": 0.9847809672355652,
"step": 447
},
{
"epoch": 2.083720930232558,
"grad_norm": 2.1309351921081543,
"learning_rate": 3.3492163438619362e-06,
"loss": 0.0499,
"mean_token_accuracy": 0.9843156933784485,
"step": 448
},
{
"epoch": 2.088372093023256,
"grad_norm": 1.4552912712097168,
"learning_rate": 3.327837845025315e-06,
"loss": 0.0471,
"mean_token_accuracy": 0.9860197305679321,
"step": 449
},
{
"epoch": 2.0930232558139537,
"grad_norm": 1.743163824081421,
"learning_rate": 3.3065230748710646e-06,
"loss": 0.0502,
"mean_token_accuracy": 0.984899640083313,
"step": 450
},
{
"epoch": 2.097674418604651,
"grad_norm": 1.6881510019302368,
"learning_rate": 3.2852726587494673e-06,
"loss": 0.0457,
"mean_token_accuracy": 0.9868685007095337,
"step": 451
},
{
"epoch": 2.1023255813953488,
"grad_norm": 1.7363135814666748,
"learning_rate": 3.2640872201227364e-06,
"loss": 0.053,
"mean_token_accuracy": 0.9822916388511658,
"step": 452
},
{
"epoch": 2.1069767441860465,
"grad_norm": 1.500846266746521,
"learning_rate": 3.242967380546717e-06,
"loss": 0.047,
"mean_token_accuracy": 0.9842950105667114,
"step": 453
},
{
"epoch": 2.1116279069767443,
"grad_norm": 1.7576566934585571,
"learning_rate": 3.221913759652657e-06,
"loss": 0.0488,
"mean_token_accuracy": 0.9847888350486755,
"step": 454
},
{
"epoch": 2.116279069767442,
"grad_norm": 1.6291195154190063,
"learning_rate": 3.20092697512903e-06,
"loss": 0.0483,
"mean_token_accuracy": 0.9865509271621704,
"step": 455
},
{
"epoch": 2.1209302325581394,
"grad_norm": 1.565114974975586,
"learning_rate": 3.180007642703402e-06,
"loss": 0.0439,
"mean_token_accuracy": 0.9828610420227051,
"step": 456
},
{
"epoch": 2.125581395348837,
"grad_norm": 1.3543715476989746,
"learning_rate": 3.1591563761243816e-06,
"loss": 0.0406,
"mean_token_accuracy": 0.9870887994766235,
"step": 457
},
{
"epoch": 2.130232558139535,
"grad_norm": 1.4812368154525757,
"learning_rate": 3.138373787143598e-06,
"loss": 0.0424,
"mean_token_accuracy": 0.9881157279014587,
"step": 458
},
{
"epoch": 2.1348837209302327,
"grad_norm": 1.2913554906845093,
"learning_rate": 3.1176604854977665e-06,
"loss": 0.0393,
"mean_token_accuracy": 0.988473653793335,
"step": 459
},
{
"epoch": 2.13953488372093,
"grad_norm": 1.317392349243164,
"learning_rate": 3.0970170788907878e-06,
"loss": 0.0388,
"mean_token_accuracy": 0.9886342883110046,
"step": 460
},
{
"epoch": 2.144186046511628,
"grad_norm": 1.1565263271331787,
"learning_rate": 3.076444172975932e-06,
"loss": 0.0383,
"mean_token_accuracy": 0.9860601425170898,
"step": 461
},
{
"epoch": 2.1488372093023256,
"grad_norm": 1.3981534242630005,
"learning_rate": 3.055942371338052e-06,
"loss": 0.0473,
"mean_token_accuracy": 0.9850096106529236,
"step": 462
},
{
"epoch": 2.1534883720930234,
"grad_norm": 1.1593438386917114,
"learning_rate": 3.035512275475896e-06,
"loss": 0.038,
"mean_token_accuracy": 0.987267017364502,
"step": 463
},
{
"epoch": 2.158139534883721,
"grad_norm": 1.4584743976593018,
"learning_rate": 3.0151544847844385e-06,
"loss": 0.0457,
"mean_token_accuracy": 0.9883371591567993,
"step": 464
},
{
"epoch": 2.1627906976744184,
"grad_norm": 1.349255084991455,
"learning_rate": 2.994869596537316e-06,
"loss": 0.0386,
"mean_token_accuracy": 0.9858284592628479,
"step": 465
},
{
"epoch": 2.167441860465116,
"grad_norm": 1.4808646440505981,
"learning_rate": 2.9746582058692803e-06,
"loss": 0.0419,
"mean_token_accuracy": 0.9876099228858948,
"step": 466
},
{
"epoch": 2.172093023255814,
"grad_norm": 1.5003681182861328,
"learning_rate": 2.954520905758762e-06,
"loss": 0.0437,
"mean_token_accuracy": 0.9860689640045166,
"step": 467
},
{
"epoch": 2.1767441860465118,
"grad_norm": 1.2506943941116333,
"learning_rate": 2.934458287010455e-06,
"loss": 0.0327,
"mean_token_accuracy": 0.9890545606613159,
"step": 468
},
{
"epoch": 2.181395348837209,
"grad_norm": 1.4070329666137695,
"learning_rate": 2.9144709382379955e-06,
"loss": 0.0429,
"mean_token_accuracy": 0.9838380813598633,
"step": 469
},
{
"epoch": 2.186046511627907,
"grad_norm": 1.844129204750061,
"learning_rate": 2.894559445846682e-06,
"loss": 0.0488,
"mean_token_accuracy": 0.9844542741775513,
"step": 470
},
{
"epoch": 2.1906976744186046,
"grad_norm": 1.729974389076233,
"learning_rate": 2.8747243940162774e-06,
"loss": 0.0565,
"mean_token_accuracy": 0.9824362397193909,
"step": 471
},
{
"epoch": 2.1953488372093024,
"grad_norm": 1.6033308506011963,
"learning_rate": 2.854966364683872e-06,
"loss": 0.0338,
"mean_token_accuracy": 0.9885597825050354,
"step": 472
},
{
"epoch": 2.2,
"grad_norm": 1.332747459411621,
"learning_rate": 2.835285937526801e-06,
"loss": 0.044,
"mean_token_accuracy": 0.9859412908554077,
"step": 473
},
{
"epoch": 2.2046511627906975,
"grad_norm": 1.7800264358520508,
"learning_rate": 2.8156836899456475e-06,
"loss": 0.0487,
"mean_token_accuracy": 0.9829608201980591,
"step": 474
},
{
"epoch": 2.2093023255813953,
"grad_norm": 1.664980173110962,
"learning_rate": 2.796160197047294e-06,
"loss": 0.0464,
"mean_token_accuracy": 0.9837183952331543,
"step": 475
},
{
"epoch": 2.213953488372093,
"grad_norm": 1.2077975273132324,
"learning_rate": 2.7767160316280583e-06,
"loss": 0.0303,
"mean_token_accuracy": 0.9894075989723206,
"step": 476
},
{
"epoch": 2.218604651162791,
"grad_norm": 1.418182373046875,
"learning_rate": 2.757351764156877e-06,
"loss": 0.0395,
"mean_token_accuracy": 0.9862279891967773,
"step": 477
},
{
"epoch": 2.2232558139534886,
"grad_norm": 1.4983257055282593,
"learning_rate": 2.7380679627585817e-06,
"loss": 0.0444,
"mean_token_accuracy": 0.9853575825691223,
"step": 478
},
{
"epoch": 2.227906976744186,
"grad_norm": 1.423553466796875,
"learning_rate": 2.718865193197218e-06,
"loss": 0.0409,
"mean_token_accuracy": 0.9856008887290955,
"step": 479
},
{
"epoch": 2.2325581395348837,
"grad_norm": 1.4247428178787231,
"learning_rate": 2.699744018859457e-06,
"loss": 0.0462,
"mean_token_accuracy": 0.9839481115341187,
"step": 480
},
{
"epoch": 2.2372093023255815,
"grad_norm": 1.2295563220977783,
"learning_rate": 2.680705000738061e-06,
"loss": 0.0368,
"mean_token_accuracy": 0.9896710515022278,
"step": 481
},
{
"epoch": 2.2418604651162792,
"grad_norm": 1.374080777168274,
"learning_rate": 2.661748697415423e-06,
"loss": 0.0409,
"mean_token_accuracy": 0.9884670972824097,
"step": 482
},
{
"epoch": 2.2465116279069766,
"grad_norm": 1.4290623664855957,
"learning_rate": 2.642875665047182e-06,
"loss": 0.049,
"mean_token_accuracy": 0.9858566522598267,
"step": 483
},
{
"epoch": 2.2511627906976743,
"grad_norm": 1.8040648698806763,
"learning_rate": 2.6240864573459095e-06,
"loss": 0.053,
"mean_token_accuracy": 0.9802747368812561,
"step": 484
},
{
"epoch": 2.255813953488372,
"grad_norm": 1.3592660427093506,
"learning_rate": 2.6053816255648543e-06,
"loss": 0.0326,
"mean_token_accuracy": 0.9880083203315735,
"step": 485
},
{
"epoch": 2.26046511627907,
"grad_norm": 1.4660333395004272,
"learning_rate": 2.586761718481776e-06,
"loss": 0.0431,
"mean_token_accuracy": 0.9855907559394836,
"step": 486
},
{
"epoch": 2.265116279069767,
"grad_norm": 1.5499329566955566,
"learning_rate": 2.5682272823828474e-06,
"loss": 0.0447,
"mean_token_accuracy": 0.9844789505004883,
"step": 487
},
{
"epoch": 2.269767441860465,
"grad_norm": 1.3596184253692627,
"learning_rate": 2.5497788610466177e-06,
"loss": 0.0372,
"mean_token_accuracy": 0.9874828457832336,
"step": 488
},
{
"epoch": 2.2744186046511627,
"grad_norm": 1.2610822916030884,
"learning_rate": 2.53141699572807e-06,
"loss": 0.038,
"mean_token_accuracy": 0.9895055294036865,
"step": 489
},
{
"epoch": 2.2790697674418605,
"grad_norm": 1.4940454959869385,
"learning_rate": 2.5131422251427313e-06,
"loss": 0.043,
"mean_token_accuracy": 0.986737847328186,
"step": 490
},
{
"epoch": 2.2837209302325583,
"grad_norm": 1.3737494945526123,
"learning_rate": 2.4949550854508713e-06,
"loss": 0.0368,
"mean_token_accuracy": 0.9881452918052673,
"step": 491
},
{
"epoch": 2.2883720930232556,
"grad_norm": 1.7707860469818115,
"learning_rate": 2.476856110241773e-06,
"loss": 0.0394,
"mean_token_accuracy": 0.9883301854133606,
"step": 492
},
{
"epoch": 2.2930232558139534,
"grad_norm": 1.5083131790161133,
"learning_rate": 2.458845830518082e-06,
"loss": 0.0469,
"mean_token_accuracy": 0.9832764863967896,
"step": 493
},
{
"epoch": 2.297674418604651,
"grad_norm": 1.5373071432113647,
"learning_rate": 2.440924774680215e-06,
"loss": 0.0469,
"mean_token_accuracy": 0.9855247139930725,
"step": 494
},
{
"epoch": 2.302325581395349,
"grad_norm": 1.5899007320404053,
"learning_rate": 2.4230934685108707e-06,
"loss": 0.0445,
"mean_token_accuracy": 0.9864286780357361,
"step": 495
},
{
"epoch": 2.3069767441860467,
"grad_norm": 1.281482219696045,
"learning_rate": 2.405352435159595e-06,
"loss": 0.0404,
"mean_token_accuracy": 0.985908567905426,
"step": 496
},
{
"epoch": 2.311627906976744,
"grad_norm": 1.8610132932662964,
"learning_rate": 2.3877021951274374e-06,
"loss": 0.0598,
"mean_token_accuracy": 0.9820767641067505,
"step": 497
},
{
"epoch": 2.316279069767442,
"grad_norm": 1.4103353023529053,
"learning_rate": 2.3701432662516772e-06,
"loss": 0.0396,
"mean_token_accuracy": 0.9848379492759705,
"step": 498
},
{
"epoch": 2.3209302325581396,
"grad_norm": 1.7032541036605835,
"learning_rate": 2.3526761636906313e-06,
"loss": 0.0436,
"mean_token_accuracy": 0.9844515919685364,
"step": 499
},
{
"epoch": 2.3255813953488373,
"grad_norm": 1.4253147840499878,
"learning_rate": 2.3353013999085402e-06,
"loss": 0.0452,
"mean_token_accuracy": 0.9855325818061829,
"step": 500
},
{
"epoch": 2.330232558139535,
"grad_norm": 1.3063850402832031,
"learning_rate": 2.3180194846605367e-06,
"loss": 0.0353,
"mean_token_accuracy": 0.9888969659805298,
"step": 501
},
{
"epoch": 2.3348837209302324,
"grad_norm": 1.183137059211731,
"learning_rate": 2.300830924977683e-06,
"loss": 0.03,
"mean_token_accuracy": 0.9909448623657227,
"step": 502
},
{
"epoch": 2.33953488372093,
"grad_norm": 1.4097849130630493,
"learning_rate": 2.283736225152099e-06,
"loss": 0.0404,
"mean_token_accuracy": 0.9841188788414001,
"step": 503
},
{
"epoch": 2.344186046511628,
"grad_norm": 1.1793756484985352,
"learning_rate": 2.26673588672217e-06,
"loss": 0.0299,
"mean_token_accuracy": 0.9909354448318481,
"step": 504
},
{
"epoch": 2.3488372093023258,
"grad_norm": 1.328304648399353,
"learning_rate": 2.249830408457826e-06,
"loss": 0.0384,
"mean_token_accuracy": 0.9873096346855164,
"step": 505
},
{
"epoch": 2.353488372093023,
"grad_norm": 1.3120323419570923,
"learning_rate": 2.2330202863459123e-06,
"loss": 0.0375,
"mean_token_accuracy": 0.9867841601371765,
"step": 506
},
{
"epoch": 2.358139534883721,
"grad_norm": 1.3818902969360352,
"learning_rate": 2.2163060135756364e-06,
"loss": 0.0459,
"mean_token_accuracy": 0.985027551651001,
"step": 507
},
{
"epoch": 2.3627906976744186,
"grad_norm": 1.4502382278442383,
"learning_rate": 2.1996880805241e-06,
"loss": 0.0504,
"mean_token_accuracy": 0.9835244417190552,
"step": 508
},
{
"epoch": 2.3674418604651164,
"grad_norm": 1.435464859008789,
"learning_rate": 2.1831669747419093e-06,
"loss": 0.0442,
"mean_token_accuracy": 0.9855555295944214,
"step": 509
},
{
"epoch": 2.3720930232558137,
"grad_norm": 1.2933567762374878,
"learning_rate": 2.166743180938875e-06,
"loss": 0.0392,
"mean_token_accuracy": 0.9858629703521729,
"step": 510
},
{
"epoch": 2.3767441860465115,
"grad_norm": 1.3595428466796875,
"learning_rate": 2.150417180969784e-06,
"loss": 0.0466,
"mean_token_accuracy": 0.9843334555625916,
"step": 511
},
{
"epoch": 2.3813953488372093,
"grad_norm": 1.5175772905349731,
"learning_rate": 2.1341894538202726e-06,
"loss": 0.0469,
"mean_token_accuracy": 0.9825721979141235,
"step": 512
},
{
"epoch": 2.386046511627907,
"grad_norm": 1.3737074136734009,
"learning_rate": 2.1180604755927646e-06,
"loss": 0.0452,
"mean_token_accuracy": 0.9853906631469727,
"step": 513
},
{
"epoch": 2.390697674418605,
"grad_norm": 1.5613442659378052,
"learning_rate": 2.102030719492508e-06,
"loss": 0.0404,
"mean_token_accuracy": 0.9870796799659729,
"step": 514
},
{
"epoch": 2.395348837209302,
"grad_norm": 1.5499093532562256,
"learning_rate": 2.086100655813688e-06,
"loss": 0.0497,
"mean_token_accuracy": 0.9838182330131531,
"step": 515
},
{
"epoch": 2.4,
"grad_norm": 1.4529976844787598,
"learning_rate": 2.0702707519256365e-06,
"loss": 0.038,
"mean_token_accuracy": 0.9871166944503784,
"step": 516
},
{
"epoch": 2.4046511627906977,
"grad_norm": 1.3648254871368408,
"learning_rate": 2.0545414722591096e-06,
"loss": 0.0282,
"mean_token_accuracy": 0.9895697236061096,
"step": 517
},
{
"epoch": 2.4093023255813955,
"grad_norm": 1.286002278327942,
"learning_rate": 2.03891327829267e-06,
"loss": 0.0362,
"mean_token_accuracy": 0.9883317351341248,
"step": 518
},
{
"epoch": 2.4139534883720932,
"grad_norm": 1.480312705039978,
"learning_rate": 2.0233866285391455e-06,
"loss": 0.0402,
"mean_token_accuracy": 0.9887310266494751,
"step": 519
},
{
"epoch": 2.4186046511627906,
"grad_norm": 1.3333568572998047,
"learning_rate": 2.0079619785321713e-06,
"loss": 0.0376,
"mean_token_accuracy": 0.9858761429786682,
"step": 520
},
{
"epoch": 2.4232558139534883,
"grad_norm": 1.8251371383666992,
"learning_rate": 1.992639780812838e-06,
"loss": 0.0496,
"mean_token_accuracy": 0.9830413460731506,
"step": 521
},
{
"epoch": 2.427906976744186,
"grad_norm": 1.3543392419815063,
"learning_rate": 1.9774204849164004e-06,
"loss": 0.0388,
"mean_token_accuracy": 0.9868179559707642,
"step": 522
},
{
"epoch": 2.432558139534884,
"grad_norm": 1.6293071508407593,
"learning_rate": 1.9623045373590955e-06,
"loss": 0.0474,
"mean_token_accuracy": 0.98483806848526,
"step": 523
},
{
"epoch": 2.4372093023255816,
"grad_norm": 1.60429048538208,
"learning_rate": 1.9472923816250427e-06,
"loss": 0.0543,
"mean_token_accuracy": 0.9808722138404846,
"step": 524
},
{
"epoch": 2.441860465116279,
"grad_norm": 1.6416536569595337,
"learning_rate": 1.9323844581532334e-06,
"loss": 0.053,
"mean_token_accuracy": 0.982349157333374,
"step": 525
},
{
"epoch": 2.4465116279069767,
"grad_norm": 1.429345965385437,
"learning_rate": 1.9175812043246034e-06,
"loss": 0.0446,
"mean_token_accuracy": 0.9842494130134583,
"step": 526
},
{
"epoch": 2.4511627906976745,
"grad_norm": 1.3102144002914429,
"learning_rate": 1.9028830544492074e-06,
"loss": 0.0468,
"mean_token_accuracy": 0.986748218536377,
"step": 527
},
{
"epoch": 2.4558139534883723,
"grad_norm": 1.4732224941253662,
"learning_rate": 1.8882904397534705e-06,
"loss": 0.0498,
"mean_token_accuracy": 0.9829692840576172,
"step": 528
},
{
"epoch": 2.4604651162790696,
"grad_norm": 1.5619550943374634,
"learning_rate": 1.8738037883675445e-06,
"loss": 0.0437,
"mean_token_accuracy": 0.985709011554718,
"step": 529
},
{
"epoch": 2.4651162790697674,
"grad_norm": 1.7753974199295044,
"learning_rate": 1.8594235253127373e-06,
"loss": 0.0456,
"mean_token_accuracy": 0.9833365678787231,
"step": 530
},
{
"epoch": 2.469767441860465,
"grad_norm": 2.730788230895996,
"learning_rate": 1.8451500724890509e-06,
"loss": 0.0539,
"mean_token_accuracy": 0.9825479984283447,
"step": 531
},
{
"epoch": 2.474418604651163,
"grad_norm": 1.3585683107376099,
"learning_rate": 1.8309838486627995e-06,
"loss": 0.0382,
"mean_token_accuracy": 0.9866841435432434,
"step": 532
},
{
"epoch": 2.4790697674418603,
"grad_norm": 1.2621618509292603,
"learning_rate": 1.816925269454327e-06,
"loss": 0.036,
"mean_token_accuracy": 0.9900875687599182,
"step": 533
},
{
"epoch": 2.483720930232558,
"grad_norm": 1.179105281829834,
"learning_rate": 1.8029747473258092e-06,
"loss": 0.0375,
"mean_token_accuracy": 0.9860317707061768,
"step": 534
},
{
"epoch": 2.488372093023256,
"grad_norm": 1.4229761362075806,
"learning_rate": 1.789132691569153e-06,
"loss": 0.044,
"mean_token_accuracy": 0.9868127703666687,
"step": 535
},
{
"epoch": 2.4930232558139536,
"grad_norm": 1.4325740337371826,
"learning_rate": 1.7753995082939932e-06,
"loss": 0.0396,
"mean_token_accuracy": 0.9883702397346497,
"step": 536
},
{
"epoch": 2.4976744186046513,
"grad_norm": 1.7136763334274292,
"learning_rate": 1.7617756004157693e-06,
"loss": 0.0449,
"mean_token_accuracy": 0.9851675629615784,
"step": 537
},
{
"epoch": 2.5023255813953487,
"grad_norm": 1.3397361040115356,
"learning_rate": 1.7482613676439153e-06,
"loss": 0.0332,
"mean_token_accuracy": 0.9883018136024475,
"step": 538
},
{
"epoch": 2.5069767441860464,
"grad_norm": 1.3754647970199585,
"learning_rate": 1.7348572064701188e-06,
"loss": 0.0408,
"mean_token_accuracy": 0.9865552186965942,
"step": 539
},
{
"epoch": 2.511627906976744,
"grad_norm": 1.7942336797714233,
"learning_rate": 1.721563510156704e-06,
"loss": 0.0473,
"mean_token_accuracy": 0.9843230247497559,
"step": 540
},
{
"epoch": 2.516279069767442,
"grad_norm": 1.3669971227645874,
"learning_rate": 1.7083806687250795e-06,
"loss": 0.0397,
"mean_token_accuracy": 0.9862712621688843,
"step": 541
},
{
"epoch": 2.5209302325581397,
"grad_norm": 1.8536146879196167,
"learning_rate": 1.6953090689443074e-06,
"loss": 0.0508,
"mean_token_accuracy": 0.9839886426925659,
"step": 542
},
{
"epoch": 2.525581395348837,
"grad_norm": 1.4202018976211548,
"learning_rate": 1.6823490943197473e-06,
"loss": 0.043,
"mean_token_accuracy": 0.9865095615386963,
"step": 543
},
{
"epoch": 2.530232558139535,
"grad_norm": 1.3330633640289307,
"learning_rate": 1.6695011250818094e-06,
"loss": 0.0366,
"mean_token_accuracy": 0.9892926812171936,
"step": 544
},
{
"epoch": 2.5348837209302326,
"grad_norm": 1.459529995918274,
"learning_rate": 1.6567655381747976e-06,
"loss": 0.0358,
"mean_token_accuracy": 0.9880861043930054,
"step": 545
},
{
"epoch": 2.5395348837209304,
"grad_norm": 1.371484637260437,
"learning_rate": 1.6441427072458493e-06,
"loss": 0.0362,
"mean_token_accuracy": 0.986931324005127,
"step": 546
},
{
"epoch": 2.544186046511628,
"grad_norm": 1.6280467510223389,
"learning_rate": 1.6316330026339743e-06,
"loss": 0.0513,
"mean_token_accuracy": 0.9837538599967957,
"step": 547
},
{
"epoch": 2.5488372093023255,
"grad_norm": 1.2390743494033813,
"learning_rate": 1.6192367913591916e-06,
"loss": 0.043,
"mean_token_accuracy": 0.9854939579963684,
"step": 548
},
{
"epoch": 2.5534883720930233,
"grad_norm": 1.5508155822753906,
"learning_rate": 1.6069544371117556e-06,
"loss": 0.0441,
"mean_token_accuracy": 0.9845935702323914,
"step": 549
},
{
"epoch": 2.558139534883721,
"grad_norm": 1.206674575805664,
"learning_rate": 1.5947863002414938e-06,
"loss": 0.0374,
"mean_token_accuracy": 0.9881819486618042,
"step": 550
},
{
"epoch": 2.5627906976744184,
"grad_norm": 1.4385532140731812,
"learning_rate": 1.5827327377472262e-06,
"loss": 0.0393,
"mean_token_accuracy": 0.9884690642356873,
"step": 551
},
{
"epoch": 2.567441860465116,
"grad_norm": 1.3227328062057495,
"learning_rate": 1.5707941032662967e-06,
"loss": 0.0433,
"mean_token_accuracy": 0.9855563640594482,
"step": 552
},
{
"epoch": 2.572093023255814,
"grad_norm": 1.3581526279449463,
"learning_rate": 1.558970747064198e-06,
"loss": 0.0414,
"mean_token_accuracy": 0.9869475960731506,
"step": 553
},
{
"epoch": 2.5767441860465117,
"grad_norm": 1.4792921543121338,
"learning_rate": 1.5472630160242921e-06,
"loss": 0.0434,
"mean_token_accuracy": 0.9850654602050781,
"step": 554
},
{
"epoch": 2.5813953488372094,
"grad_norm": 1.4469318389892578,
"learning_rate": 1.5356712536376345e-06,
"loss": 0.0451,
"mean_token_accuracy": 0.9870730638504028,
"step": 555
},
{
"epoch": 2.5860465116279068,
"grad_norm": 1.2094733715057373,
"learning_rate": 1.5241957999928974e-06,
"loss": 0.0324,
"mean_token_accuracy": 0.9892438054084778,
"step": 556
},
{
"epoch": 2.5906976744186045,
"grad_norm": 1.3837049007415771,
"learning_rate": 1.5128369917663924e-06,
"loss": 0.0358,
"mean_token_accuracy": 0.9864327311515808,
"step": 557
},
{
"epoch": 2.5953488372093023,
"grad_norm": 1.5193039178848267,
"learning_rate": 1.5015951622121896e-06,
"loss": 0.0435,
"mean_token_accuracy": 0.9854939579963684,
"step": 558
},
{
"epoch": 2.6,
"grad_norm": 1.5376842021942139,
"learning_rate": 1.490470641152345e-06,
"loss": 0.0397,
"mean_token_accuracy": 0.9855803847312927,
"step": 559
},
{
"epoch": 2.604651162790698,
"grad_norm": 1.2507169246673584,
"learning_rate": 1.4794637549672182e-06,
"loss": 0.0394,
"mean_token_accuracy": 0.9875136017799377,
"step": 560
},
{
"epoch": 2.609302325581395,
"grad_norm": 2.15098237991333,
"learning_rate": 1.4685748265859043e-06,
"loss": 0.0272,
"mean_token_accuracy": 0.9911127090454102,
"step": 561
},
{
"epoch": 2.613953488372093,
"grad_norm": 1.8859761953353882,
"learning_rate": 1.457804175476751e-06,
"loss": 0.0417,
"mean_token_accuracy": 0.9860853552818298,
"step": 562
},
{
"epoch": 2.6186046511627907,
"grad_norm": 1.0621025562286377,
"learning_rate": 1.447152117637992e-06,
"loss": 0.029,
"mean_token_accuracy": 0.9893219470977783,
"step": 563
},
{
"epoch": 2.6232558139534885,
"grad_norm": 1.4596385955810547,
"learning_rate": 1.436618965588472e-06,
"loss": 0.0362,
"mean_token_accuracy": 0.9889196753501892,
"step": 564
},
{
"epoch": 2.6279069767441863,
"grad_norm": 1.2926936149597168,
"learning_rate": 1.4262050283584836e-06,
"loss": 0.0339,
"mean_token_accuracy": 0.9875206351280212,
"step": 565
},
{
"epoch": 2.6325581395348836,
"grad_norm": 1.6519856452941895,
"learning_rate": 1.4159106114806943e-06,
"loss": 0.0417,
"mean_token_accuracy": 0.9887183308601379,
"step": 566
},
{
"epoch": 2.6372093023255814,
"grad_norm": 1.3822687864303589,
"learning_rate": 1.4057360169811832e-06,
"loss": 0.0434,
"mean_token_accuracy": 0.9820433259010315,
"step": 567
},
{
"epoch": 2.641860465116279,
"grad_norm": 1.1875125169754028,
"learning_rate": 1.3956815433705861e-06,
"loss": 0.0314,
"mean_token_accuracy": 0.9890307784080505,
"step": 568
},
{
"epoch": 2.6465116279069765,
"grad_norm": 1.4650956392288208,
"learning_rate": 1.3857474856353299e-06,
"loss": 0.0386,
"mean_token_accuracy": 0.9873239398002625,
"step": 569
},
{
"epoch": 2.6511627906976747,
"grad_norm": 1.372135043144226,
"learning_rate": 1.3759341352289832e-06,
"loss": 0.04,
"mean_token_accuracy": 0.986075758934021,
"step": 570
},
{
"epoch": 2.655813953488372,
"grad_norm": 1.750218391418457,
"learning_rate": 1.3662417800637023e-06,
"loss": 0.045,
"mean_token_accuracy": 0.983469545841217,
"step": 571
},
{
"epoch": 2.66046511627907,
"grad_norm": 1.452467679977417,
"learning_rate": 1.3566707045017867e-06,
"loss": 0.0419,
"mean_token_accuracy": 0.9870980978012085,
"step": 572
},
{
"epoch": 2.6651162790697676,
"grad_norm": 1.6090556383132935,
"learning_rate": 1.3472211893473327e-06,
"loss": 0.0424,
"mean_token_accuracy": 0.9856728315353394,
"step": 573
},
{
"epoch": 2.669767441860465,
"grad_norm": 1.2582389116287231,
"learning_rate": 1.3378935118380004e-06,
"loss": 0.0362,
"mean_token_accuracy": 0.9885410070419312,
"step": 574
},
{
"epoch": 2.6744186046511627,
"grad_norm": 1.1907209157943726,
"learning_rate": 1.3286879456368746e-06,
"loss": 0.0362,
"mean_token_accuracy": 0.9901633858680725,
"step": 575
},
{
"epoch": 2.6790697674418604,
"grad_norm": 1.3772821426391602,
"learning_rate": 1.319604760824439e-06,
"loss": 0.0359,
"mean_token_accuracy": 0.9875583052635193,
"step": 576
},
{
"epoch": 2.683720930232558,
"grad_norm": 1.8042019605636597,
"learning_rate": 1.31064422389065e-06,
"loss": 0.0427,
"mean_token_accuracy": 0.9862815737724304,
"step": 577
},
{
"epoch": 2.688372093023256,
"grad_norm": 1.514086127281189,
"learning_rate": 1.3018065977271215e-06,
"loss": 0.04,
"mean_token_accuracy": 0.9870296120643616,
"step": 578
},
{
"epoch": 2.6930232558139533,
"grad_norm": 1.702939510345459,
"learning_rate": 1.293092141619407e-06,
"loss": 0.0425,
"mean_token_accuracy": 0.9871666431427002,
"step": 579
},
{
"epoch": 2.697674418604651,
"grad_norm": 1.2727701663970947,
"learning_rate": 1.2845011112394e-06,
"loss": 0.0283,
"mean_token_accuracy": 0.9897069334983826,
"step": 580
},
{
"epoch": 2.702325581395349,
"grad_norm": 1.6455163955688477,
"learning_rate": 1.276033758637823e-06,
"loss": 0.0434,
"mean_token_accuracy": 0.9873374104499817,
"step": 581
},
{
"epoch": 2.7069767441860466,
"grad_norm": 1.336192011833191,
"learning_rate": 1.2676903322368423e-06,
"loss": 0.0396,
"mean_token_accuracy": 0.9881370067596436,
"step": 582
},
{
"epoch": 2.7116279069767444,
"grad_norm": 1.4228109121322632,
"learning_rate": 1.2594710768227734e-06,
"loss": 0.0382,
"mean_token_accuracy": 0.9871864318847656,
"step": 583
},
{
"epoch": 2.7162790697674417,
"grad_norm": 1.6291853189468384,
"learning_rate": 1.2513762335389004e-06,
"loss": 0.0449,
"mean_token_accuracy": 0.9863990545272827,
"step": 584
},
{
"epoch": 2.7209302325581395,
"grad_norm": 1.453303337097168,
"learning_rate": 1.2434060398784039e-06,
"loss": 0.0382,
"mean_token_accuracy": 0.9885407090187073,
"step": 585
},
{
"epoch": 2.7255813953488373,
"grad_norm": 1.9516953229904175,
"learning_rate": 1.2355607296773896e-06,
"loss": 0.0518,
"mean_token_accuracy": 0.9837234616279602,
"step": 586
},
{
"epoch": 2.730232558139535,
"grad_norm": 1.5732613801956177,
"learning_rate": 1.2278405331080296e-06,
"loss": 0.0454,
"mean_token_accuracy": 0.9859471321105957,
"step": 587
},
{
"epoch": 2.734883720930233,
"grad_norm": 1.4327545166015625,
"learning_rate": 1.2202456766718092e-06,
"loss": 0.0406,
"mean_token_accuracy": 0.9854802489280701,
"step": 588
},
{
"epoch": 2.73953488372093,
"grad_norm": 1.2686004638671875,
"learning_rate": 1.212776383192883e-06,
"loss": 0.0377,
"mean_token_accuracy": 0.9876318573951721,
"step": 589
},
{
"epoch": 2.744186046511628,
"grad_norm": 1.2385032176971436,
"learning_rate": 1.2054328718115336e-06,
"loss": 0.0358,
"mean_token_accuracy": 0.9881836175918579,
"step": 590
},
{
"epoch": 2.7488372093023257,
"grad_norm": 1.3771368265151978,
"learning_rate": 1.1982153579777483e-06,
"loss": 0.0311,
"mean_token_accuracy": 0.9888147115707397,
"step": 591
},
{
"epoch": 2.753488372093023,
"grad_norm": 1.4716222286224365,
"learning_rate": 1.1911240534448899e-06,
"loss": 0.0415,
"mean_token_accuracy": 0.9859079718589783,
"step": 592
},
{
"epoch": 2.7581395348837208,
"grad_norm": 1.3605318069458008,
"learning_rate": 1.1841591662634943e-06,
"loss": 0.0387,
"mean_token_accuracy": 0.9877007007598877,
"step": 593
},
{
"epoch": 2.7627906976744185,
"grad_norm": 1.2023953199386597,
"learning_rate": 1.1773209007751562e-06,
"loss": 0.0356,
"mean_token_accuracy": 0.9872262477874756,
"step": 594
},
{
"epoch": 2.7674418604651163,
"grad_norm": 1.6226835250854492,
"learning_rate": 1.1706094576065416e-06,
"loss": 0.0532,
"mean_token_accuracy": 0.9829424023628235,
"step": 595
},
{
"epoch": 2.772093023255814,
"grad_norm": 1.4002608060836792,
"learning_rate": 1.164025033663497e-06,
"loss": 0.0353,
"mean_token_accuracy": 0.9847367405891418,
"step": 596
},
{
"epoch": 2.7767441860465114,
"grad_norm": 1.3633453845977783,
"learning_rate": 1.1575678221252763e-06,
"loss": 0.0438,
"mean_token_accuracy": 0.9867115020751953,
"step": 597
},
{
"epoch": 2.781395348837209,
"grad_norm": 1.5677367448806763,
"learning_rate": 1.1512380124388695e-06,
"loss": 0.0463,
"mean_token_accuracy": 0.9877669811248779,
"step": 598
},
{
"epoch": 2.786046511627907,
"grad_norm": 1.2627447843551636,
"learning_rate": 1.1450357903134463e-06,
"loss": 0.0335,
"mean_token_accuracy": 0.9894976615905762,
"step": 599
},
{
"epoch": 2.7906976744186047,
"grad_norm": 1.5455451011657715,
"learning_rate": 1.1389613377149086e-06,
"loss": 0.0386,
"mean_token_accuracy": 0.9879539012908936,
"step": 600
},
{
"epoch": 2.7953488372093025,
"grad_norm": 1.4009506702423096,
"learning_rate": 1.1330148328605484e-06,
"loss": 0.0427,
"mean_token_accuracy": 0.9870668053627014,
"step": 601
},
{
"epoch": 2.8,
"grad_norm": 1.3464657068252563,
"learning_rate": 1.127196450213825e-06,
"loss": 0.0365,
"mean_token_accuracy": 0.987594485282898,
"step": 602
},
{
"epoch": 2.8046511627906976,
"grad_norm": 1.0960040092468262,
"learning_rate": 1.1215063604792396e-06,
"loss": 0.029,
"mean_token_accuracy": 0.9886877536773682,
"step": 603
},
{
"epoch": 2.8093023255813954,
"grad_norm": 1.5224353075027466,
"learning_rate": 1.1159447305973313e-06,
"loss": 0.0325,
"mean_token_accuracy": 0.9881473183631897,
"step": 604
},
{
"epoch": 2.813953488372093,
"grad_norm": 1.3734958171844482,
"learning_rate": 1.1105117237397777e-06,
"loss": 0.0353,
"mean_token_accuracy": 0.9883147478103638,
"step": 605
},
{
"epoch": 2.818604651162791,
"grad_norm": 1.2656145095825195,
"learning_rate": 1.1052074993046102e-06,
"loss": 0.0295,
"mean_token_accuracy": 0.9899190068244934,
"step": 606
},
{
"epoch": 2.8232558139534882,
"grad_norm": 1.465860366821289,
"learning_rate": 1.100032212911533e-06,
"loss": 0.0337,
"mean_token_accuracy": 0.9888620972633362,
"step": 607
},
{
"epoch": 2.827906976744186,
"grad_norm": 1.199744701385498,
"learning_rate": 1.0949860163973616e-06,
"loss": 0.0362,
"mean_token_accuracy": 0.9871125817298889,
"step": 608
},
{
"epoch": 2.832558139534884,
"grad_norm": 1.412898302078247,
"learning_rate": 1.0900690578115643e-06,
"loss": 0.039,
"mean_token_accuracy": 0.9859204888343811,
"step": 609
},
{
"epoch": 2.8372093023255816,
"grad_norm": 1.5508508682250977,
"learning_rate": 1.0852814814119238e-06,
"loss": 0.0381,
"mean_token_accuracy": 0.9879411458969116,
"step": 610
},
{
"epoch": 2.8418604651162793,
"grad_norm": 1.1056880950927734,
"learning_rate": 1.0806234276602984e-06,
"loss": 0.0256,
"mean_token_accuracy": 0.9905292391777039,
"step": 611
},
{
"epoch": 2.8465116279069766,
"grad_norm": 1.3313640356063843,
"learning_rate": 1.0760950332185055e-06,
"loss": 0.0396,
"mean_token_accuracy": 0.9873005747795105,
"step": 612
},
{
"epoch": 2.8511627906976744,
"grad_norm": 1.2394826412200928,
"learning_rate": 1.071696430944311e-06,
"loss": 0.0377,
"mean_token_accuracy": 0.9883508086204529,
"step": 613
},
{
"epoch": 2.855813953488372,
"grad_norm": 1.625504732131958,
"learning_rate": 1.0674277498875325e-06,
"loss": 0.0412,
"mean_token_accuracy": 0.9862161874771118,
"step": 614
},
{
"epoch": 2.8604651162790695,
"grad_norm": 1.3687355518341064,
"learning_rate": 1.0632891152862493e-06,
"loss": 0.0366,
"mean_token_accuracy": 0.9883472919464111,
"step": 615
},
{
"epoch": 2.8651162790697673,
"grad_norm": 1.2722115516662598,
"learning_rate": 1.0592806485631326e-06,
"loss": 0.0398,
"mean_token_accuracy": 0.98876953125,
"step": 616
},
{
"epoch": 2.869767441860465,
"grad_norm": 1.371472716331482,
"learning_rate": 1.0554024673218808e-06,
"loss": 0.038,
"mean_token_accuracy": 0.988584041595459,
"step": 617
},
{
"epoch": 2.874418604651163,
"grad_norm": 1.2753393650054932,
"learning_rate": 1.0516546853437686e-06,
"loss": 0.034,
"mean_token_accuracy": 0.9887096881866455,
"step": 618
},
{
"epoch": 2.8790697674418606,
"grad_norm": 1.1802083253860474,
"learning_rate": 1.0480374125843114e-06,
"loss": 0.0309,
"mean_token_accuracy": 0.9907568693161011,
"step": 619
},
{
"epoch": 2.883720930232558,
"grad_norm": 1.4220918416976929,
"learning_rate": 1.0445507551700356e-06,
"loss": 0.0351,
"mean_token_accuracy": 0.9894335865974426,
"step": 620
},
{
"epoch": 2.8883720930232557,
"grad_norm": 1.5494638681411743,
"learning_rate": 1.0411948153953696e-06,
"loss": 0.0432,
"mean_token_accuracy": 0.9865436553955078,
"step": 621
},
{
"epoch": 2.8930232558139535,
"grad_norm": 1.4016937017440796,
"learning_rate": 1.0379696917196378e-06,
"loss": 0.0437,
"mean_token_accuracy": 0.9852824807167053,
"step": 622
},
{
"epoch": 2.8976744186046512,
"grad_norm": 1.4522273540496826,
"learning_rate": 1.0348754787641751e-06,
"loss": 0.0327,
"mean_token_accuracy": 0.990084171295166,
"step": 623
},
{
"epoch": 2.902325581395349,
"grad_norm": 1.0468897819519043,
"learning_rate": 1.031912267309549e-06,
"loss": 0.028,
"mean_token_accuracy": 0.9912704825401306,
"step": 624
},
{
"epoch": 2.9069767441860463,
"grad_norm": 1.261525273323059,
"learning_rate": 1.029080144292899e-06,
"loss": 0.0305,
"mean_token_accuracy": 0.9909120202064514,
"step": 625
},
{
"epoch": 2.911627906976744,
"grad_norm": 1.5641429424285889,
"learning_rate": 1.026379192805382e-06,
"loss": 0.0392,
"mean_token_accuracy": 0.988041341304779,
"step": 626
},
{
"epoch": 2.916279069767442,
"grad_norm": 1.3897089958190918,
"learning_rate": 1.0238094920897374e-06,
"loss": 0.0376,
"mean_token_accuracy": 0.9882210493087769,
"step": 627
},
{
"epoch": 2.9209302325581397,
"grad_norm": 1.2228623628616333,
"learning_rate": 1.0213711175379614e-06,
"loss": 0.0319,
"mean_token_accuracy": 0.9905972480773926,
"step": 628
},
{
"epoch": 2.9255813953488374,
"grad_norm": 1.4966614246368408,
"learning_rate": 1.0190641406890946e-06,
"loss": 0.0329,
"mean_token_accuracy": 0.9902123808860779,
"step": 629
},
{
"epoch": 2.9302325581395348,
"grad_norm": 1.29335355758667,
"learning_rate": 1.0168886292271246e-06,
"loss": 0.0286,
"mean_token_accuracy": 0.9905264973640442,
"step": 630
},
{
"epoch": 2.9348837209302325,
"grad_norm": 1.2947627305984497,
"learning_rate": 1.0148446469789979e-06,
"loss": 0.0302,
"mean_token_accuracy": 0.9908397197723389,
"step": 631
},
{
"epoch": 2.9395348837209303,
"grad_norm": 1.5221575498580933,
"learning_rate": 1.0129322539127494e-06,
"loss": 0.0436,
"mean_token_accuracy": 0.9851784706115723,
"step": 632
},
{
"epoch": 2.9441860465116276,
"grad_norm": 1.3887416124343872,
"learning_rate": 1.011151506135742e-06,
"loss": 0.0351,
"mean_token_accuracy": 0.9892547726631165,
"step": 633
},
{
"epoch": 2.948837209302326,
"grad_norm": 1.3253393173217773,
"learning_rate": 1.0095024558930204e-06,
"loss": 0.04,
"mean_token_accuracy": 0.9875065088272095,
"step": 634
},
{
"epoch": 2.953488372093023,
"grad_norm": 1.4894226789474487,
"learning_rate": 1.0079851515657794e-06,
"loss": 0.0497,
"mean_token_accuracy": 0.9831249713897705,
"step": 635
},
{
"epoch": 2.958139534883721,
"grad_norm": 1.3437986373901367,
"learning_rate": 1.006599637669943e-06,
"loss": 0.0414,
"mean_token_accuracy": 0.9876566529273987,
"step": 636
},
{
"epoch": 2.9627906976744187,
"grad_norm": 1.0954073667526245,
"learning_rate": 1.0053459548548582e-06,
"loss": 0.0305,
"mean_token_accuracy": 0.9911620020866394,
"step": 637
},
{
"epoch": 2.967441860465116,
"grad_norm": 1.5746396780014038,
"learning_rate": 1.004224139902105e-06,
"loss": 0.0437,
"mean_token_accuracy": 0.9854601621627808,
"step": 638
},
{
"epoch": 2.972093023255814,
"grad_norm": 1.400350570678711,
"learning_rate": 1.0032342257244139e-06,
"loss": 0.0383,
"mean_token_accuracy": 0.9862048029899597,
"step": 639
},
{
"epoch": 2.9767441860465116,
"grad_norm": 1.3652901649475098,
"learning_rate": 1.0023762413647023e-06,
"loss": 0.039,
"mean_token_accuracy": 0.9866381883621216,
"step": 640
},
{
"epoch": 2.9813953488372094,
"grad_norm": 1.742617130279541,
"learning_rate": 1.0016502119952224e-06,
"loss": 0.0574,
"mean_token_accuracy": 0.9840995669364929,
"step": 641
},
{
"epoch": 2.986046511627907,
"grad_norm": 1.3435075283050537,
"learning_rate": 1.0010561589168217e-06,
"loss": 0.0363,
"mean_token_accuracy": 0.9854980111122131,
"step": 642
},
{
"epoch": 2.9906976744186045,
"grad_norm": 1.7960363626480103,
"learning_rate": 1.0005940995583183e-06,
"loss": 0.0452,
"mean_token_accuracy": 0.9852866530418396,
"step": 643
},
{
"epoch": 2.9953488372093022,
"grad_norm": 1.5572556257247925,
"learning_rate": 1.0002640474759911e-06,
"loss": 0.0327,
"mean_token_accuracy": 0.9882596731185913,
"step": 644
},
{
"epoch": 3.0,
"grad_norm": 0.6895026564598083,
"learning_rate": 1.0000660123531788e-06,
"loss": 0.0115,
"mean_token_accuracy": 0.997201144695282,
"step": 645
},
{
"epoch": 3.0,
"step": 645,
"total_flos": 6.064391158811853e+17,
"train_loss": 0.013678103204556676,
"train_runtime": 808.3613,
"train_samples_per_second": 25.426,
"train_steps_per_second": 0.798
}
],
"logging_steps": 1,
"max_steps": 645,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 6.064391158811853e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}