Qwen1.5-MOE-sft-coommonsense15k / trainer_state.json
HectorHe's picture
Model save
50a9445 verified
Raw
History Blame
79.8 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 3.0,
"eval_steps": 500,
"global_step": 357,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.008403361344537815,
"grad_norm": 104.4372376808565,
"learning_rate": 0.0,
"loss": 3.9089,
"mean_token_accuracy": 0.45122942328453064,
"step": 1
},
{
"epoch": 0.01680672268907563,
"grad_norm": 98.10999336930358,
"learning_rate": 2.7777777777777776e-07,
"loss": 3.8963,
"mean_token_accuracy": 0.44380152225494385,
"step": 2
},
{
"epoch": 0.025210084033613446,
"grad_norm": 92.87120481263348,
"learning_rate": 5.555555555555555e-07,
"loss": 3.7997,
"mean_token_accuracy": 0.4492985010147095,
"step": 3
},
{
"epoch": 0.03361344537815126,
"grad_norm": 110.57230858204892,
"learning_rate": 8.333333333333333e-07,
"loss": 3.928,
"mean_token_accuracy": 0.460836261510849,
"step": 4
},
{
"epoch": 0.04201680672268908,
"grad_norm": 90.06819058581009,
"learning_rate": 1.111111111111111e-06,
"loss": 3.8577,
"mean_token_accuracy": 0.4474605321884155,
"step": 5
},
{
"epoch": 0.05042016806722689,
"grad_norm": 75.40855511519277,
"learning_rate": 1.3888888888888892e-06,
"loss": 3.6608,
"mean_token_accuracy": 0.4779656231403351,
"step": 6
},
{
"epoch": 0.058823529411764705,
"grad_norm": 73.89732588358957,
"learning_rate": 1.6666666666666667e-06,
"loss": 3.5469,
"mean_token_accuracy": 0.47866302728652954,
"step": 7
},
{
"epoch": 0.06722689075630252,
"grad_norm": 82.73222876396211,
"learning_rate": 1.944444444444445e-06,
"loss": 3.5171,
"mean_token_accuracy": 0.5113741159439087,
"step": 8
},
{
"epoch": 0.07563025210084033,
"grad_norm": 63.249017072704156,
"learning_rate": 2.222222222222222e-06,
"loss": 3.1294,
"mean_token_accuracy": 0.5332269072532654,
"step": 9
},
{
"epoch": 0.08403361344537816,
"grad_norm": 68.85631329508037,
"learning_rate": 2.5e-06,
"loss": 3.0802,
"mean_token_accuracy": 0.5294961929321289,
"step": 10
},
{
"epoch": 0.09243697478991597,
"grad_norm": 63.64196255828432,
"learning_rate": 2.7777777777777783e-06,
"loss": 2.8732,
"mean_token_accuracy": 0.560966968536377,
"step": 11
},
{
"epoch": 0.10084033613445378,
"grad_norm": 49.122370073792986,
"learning_rate": 3.055555555555556e-06,
"loss": 2.6325,
"mean_token_accuracy": 0.601875364780426,
"step": 12
},
{
"epoch": 0.1092436974789916,
"grad_norm": 49.70719812298082,
"learning_rate": 3.3333333333333333e-06,
"loss": 2.3901,
"mean_token_accuracy": 0.6398412585258484,
"step": 13
},
{
"epoch": 0.11764705882352941,
"grad_norm": 35.41862792612833,
"learning_rate": 3.6111111111111115e-06,
"loss": 2.3466,
"mean_token_accuracy": 0.6401209831237793,
"step": 14
},
{
"epoch": 0.12605042016806722,
"grad_norm": 23.460448508418253,
"learning_rate": 3.88888888888889e-06,
"loss": 2.1613,
"mean_token_accuracy": 0.6581956148147583,
"step": 15
},
{
"epoch": 0.13445378151260504,
"grad_norm": 15.423461248854473,
"learning_rate": 4.166666666666667e-06,
"loss": 2.06,
"mean_token_accuracy": 0.6584842205047607,
"step": 16
},
{
"epoch": 0.14285714285714285,
"grad_norm": 21.841734671506178,
"learning_rate": 4.444444444444444e-06,
"loss": 1.9113,
"mean_token_accuracy": 0.6887879371643066,
"step": 17
},
{
"epoch": 0.15126050420168066,
"grad_norm": 15.39983628389419,
"learning_rate": 4.722222222222222e-06,
"loss": 1.8525,
"mean_token_accuracy": 0.673430860042572,
"step": 18
},
{
"epoch": 0.15966386554621848,
"grad_norm": 11.345224686864404,
"learning_rate": 5e-06,
"loss": 1.8167,
"mean_token_accuracy": 0.6806354522705078,
"step": 19
},
{
"epoch": 0.16806722689075632,
"grad_norm": 11.383664059901358,
"learning_rate": 5.2777777777777785e-06,
"loss": 1.7013,
"mean_token_accuracy": 0.701542854309082,
"step": 20
},
{
"epoch": 0.17647058823529413,
"grad_norm": 11.159627826273717,
"learning_rate": 5.555555555555557e-06,
"loss": 1.7317,
"mean_token_accuracy": 0.7015882730484009,
"step": 21
},
{
"epoch": 0.18487394957983194,
"grad_norm": 8.698161210836846,
"learning_rate": 5.833333333333334e-06,
"loss": 1.6502,
"mean_token_accuracy": 0.6944286823272705,
"step": 22
},
{
"epoch": 0.19327731092436976,
"grad_norm": 8.203426143652768,
"learning_rate": 6.111111111111112e-06,
"loss": 1.6564,
"mean_token_accuracy": 0.689929723739624,
"step": 23
},
{
"epoch": 0.20168067226890757,
"grad_norm": 8.72947231703438,
"learning_rate": 6.3888888888888885e-06,
"loss": 1.6837,
"mean_token_accuracy": 0.6912056803703308,
"step": 24
},
{
"epoch": 0.21008403361344538,
"grad_norm": 10.019554814681394,
"learning_rate": 6.666666666666667e-06,
"loss": 1.6172,
"mean_token_accuracy": 0.7055233716964722,
"step": 25
},
{
"epoch": 0.2184873949579832,
"grad_norm": 8.762233964431482,
"learning_rate": 6.944444444444445e-06,
"loss": 1.735,
"mean_token_accuracy": 0.6735965609550476,
"step": 26
},
{
"epoch": 0.226890756302521,
"grad_norm": 9.496890907951315,
"learning_rate": 7.222222222222223e-06,
"loss": 1.5669,
"mean_token_accuracy": 0.7112628221511841,
"step": 27
},
{
"epoch": 0.23529411764705882,
"grad_norm": 8.640365266893888,
"learning_rate": 7.500000000000001e-06,
"loss": 1.5914,
"mean_token_accuracy": 0.6973623037338257,
"step": 28
},
{
"epoch": 0.24369747899159663,
"grad_norm": 8.935200690656034,
"learning_rate": 7.77777777777778e-06,
"loss": 1.5966,
"mean_token_accuracy": 0.6914668083190918,
"step": 29
},
{
"epoch": 0.25210084033613445,
"grad_norm": 9.84167532128932,
"learning_rate": 8.055555555555557e-06,
"loss": 1.5734,
"mean_token_accuracy": 0.7058435678482056,
"step": 30
},
{
"epoch": 0.2605042016806723,
"grad_norm": 10.013168019527438,
"learning_rate": 8.333333333333334e-06,
"loss": 1.572,
"mean_token_accuracy": 0.7126001715660095,
"step": 31
},
{
"epoch": 0.2689075630252101,
"grad_norm": 9.112923015452898,
"learning_rate": 8.611111111111112e-06,
"loss": 1.5385,
"mean_token_accuracy": 0.7096664905548096,
"step": 32
},
{
"epoch": 0.2773109243697479,
"grad_norm": 9.793020899518824,
"learning_rate": 8.888888888888888e-06,
"loss": 1.518,
"mean_token_accuracy": 0.7187545895576477,
"step": 33
},
{
"epoch": 0.2857142857142857,
"grad_norm": 9.628147058943762,
"learning_rate": 9.166666666666666e-06,
"loss": 1.5619,
"mean_token_accuracy": 0.7068073749542236,
"step": 34
},
{
"epoch": 0.29411764705882354,
"grad_norm": 9.322487467869243,
"learning_rate": 9.444444444444445e-06,
"loss": 1.5095,
"mean_token_accuracy": 0.7060914635658264,
"step": 35
},
{
"epoch": 0.3025210084033613,
"grad_norm": 10.594179592003238,
"learning_rate": 9.722222222222223e-06,
"loss": 1.4832,
"mean_token_accuracy": 0.7262417078018188,
"step": 36
},
{
"epoch": 0.31092436974789917,
"grad_norm": 10.083169080805554,
"learning_rate": 1e-05,
"loss": 1.4928,
"mean_token_accuracy": 0.7256395220756531,
"step": 37
},
{
"epoch": 0.31932773109243695,
"grad_norm": 9.92763598568147,
"learning_rate": 9.999784489352286e-06,
"loss": 1.3933,
"mean_token_accuracy": 0.7489925026893616,
"step": 38
},
{
"epoch": 0.3277310924369748,
"grad_norm": 11.057230462379247,
"learning_rate": 9.999137978051292e-06,
"loss": 1.3839,
"mean_token_accuracy": 0.7571026086807251,
"step": 39
},
{
"epoch": 0.33613445378151263,
"grad_norm": 10.082650172151949,
"learning_rate": 9.998060528021493e-06,
"loss": 1.4143,
"mean_token_accuracy": 0.7438783645629883,
"step": 40
},
{
"epoch": 0.3445378151260504,
"grad_norm": 9.30493256103091,
"learning_rate": 9.99655224246376e-06,
"loss": 1.3787,
"mean_token_accuracy": 0.7577965259552002,
"step": 41
},
{
"epoch": 0.35294117647058826,
"grad_norm": 9.743435910238581,
"learning_rate": 9.994613265845468e-06,
"loss": 1.3323,
"mean_token_accuracy": 0.7646293640136719,
"step": 42
},
{
"epoch": 0.36134453781512604,
"grad_norm": 9.969788801557407,
"learning_rate": 9.992243783886663e-06,
"loss": 1.404,
"mean_token_accuracy": 0.7562830448150635,
"step": 43
},
{
"epoch": 0.3697478991596639,
"grad_norm": 9.82178466303166,
"learning_rate": 9.989444023542278e-06,
"loss": 1.3116,
"mean_token_accuracy": 0.769361138343811,
"step": 44
},
{
"epoch": 0.37815126050420167,
"grad_norm": 9.678366165178637,
"learning_rate": 9.986214252980384e-06,
"loss": 1.365,
"mean_token_accuracy": 0.7564687728881836,
"step": 45
},
{
"epoch": 0.3865546218487395,
"grad_norm": 9.818428882137175,
"learning_rate": 9.982554781556512e-06,
"loss": 1.2655,
"mean_token_accuracy": 0.7726576924324036,
"step": 46
},
{
"epoch": 0.3949579831932773,
"grad_norm": 9.835594218628971,
"learning_rate": 9.978465959784022e-06,
"loss": 1.3105,
"mean_token_accuracy": 0.7650916576385498,
"step": 47
},
{
"epoch": 0.40336134453781514,
"grad_norm": 9.914615259627901,
"learning_rate": 9.973948179300528e-06,
"loss": 1.2849,
"mean_token_accuracy": 0.7597100138664246,
"step": 48
},
{
"epoch": 0.4117647058823529,
"grad_norm": 9.536239789922774,
"learning_rate": 9.969001872830383e-06,
"loss": 1.2684,
"mean_token_accuracy": 0.7620344758033752,
"step": 49
},
{
"epoch": 0.42016806722689076,
"grad_norm": 9.149544132237768,
"learning_rate": 9.963627514143235e-06,
"loss": 1.2362,
"mean_token_accuracy": 0.7652192711830139,
"step": 50
},
{
"epoch": 0.42857142857142855,
"grad_norm": 8.919296728152334,
"learning_rate": 9.957825618008653e-06,
"loss": 1.2549,
"mean_token_accuracy": 0.7582887411117554,
"step": 51
},
{
"epoch": 0.4369747899159664,
"grad_norm": 8.368972719074613,
"learning_rate": 9.951596740146809e-06,
"loss": 1.3071,
"mean_token_accuracy": 0.7387862801551819,
"step": 52
},
{
"epoch": 0.44537815126050423,
"grad_norm": 8.317783553834479,
"learning_rate": 9.944941477175258e-06,
"loss": 1.2612,
"mean_token_accuracy": 0.7465383410453796,
"step": 53
},
{
"epoch": 0.453781512605042,
"grad_norm": 8.35597079044532,
"learning_rate": 9.9378604665518e-06,
"loss": 1.2092,
"mean_token_accuracy": 0.7614982724189758,
"step": 54
},
{
"epoch": 0.46218487394957986,
"grad_norm": 7.956620910361454,
"learning_rate": 9.930354386513399e-06,
"loss": 1.1718,
"mean_token_accuracy": 0.7644634246826172,
"step": 55
},
{
"epoch": 0.47058823529411764,
"grad_norm": 7.2835787111036865,
"learning_rate": 9.922423956011245e-06,
"loss": 1.1805,
"mean_token_accuracy": 0.7627302408218384,
"step": 56
},
{
"epoch": 0.4789915966386555,
"grad_norm": 6.932403381323147,
"learning_rate": 9.914069934641877e-06,
"loss": 1.2061,
"mean_token_accuracy": 0.752274751663208,
"step": 57
},
{
"epoch": 0.48739495798319327,
"grad_norm": 6.343299562405531,
"learning_rate": 9.905293122574433e-06,
"loss": 1.12,
"mean_token_accuracy": 0.7687320709228516,
"step": 58
},
{
"epoch": 0.4957983193277311,
"grad_norm": 5.543396984847555,
"learning_rate": 9.896094360474e-06,
"loss": 1.1802,
"mean_token_accuracy": 0.7473610639572144,
"step": 59
},
{
"epoch": 0.5042016806722689,
"grad_norm": 5.121375049126032,
"learning_rate": 9.886474529421108e-06,
"loss": 1.1593,
"mean_token_accuracy": 0.7524569034576416,
"step": 60
},
{
"epoch": 0.5126050420168067,
"grad_norm": 5.031005200717522,
"learning_rate": 9.876434550827315e-06,
"loss": 1.1189,
"mean_token_accuracy": 0.7657356858253479,
"step": 61
},
{
"epoch": 0.5210084033613446,
"grad_norm": 4.373010543661186,
"learning_rate": 9.865975386346977e-06,
"loss": 1.1085,
"mean_token_accuracy": 0.7596036195755005,
"step": 62
},
{
"epoch": 0.5294117647058824,
"grad_norm": 3.661434030339827,
"learning_rate": 9.855098037785118e-06,
"loss": 1.1622,
"mean_token_accuracy": 0.7517811059951782,
"step": 63
},
{
"epoch": 0.5378151260504201,
"grad_norm": 3.078839220181403,
"learning_rate": 9.843803547001487e-06,
"loss": 1.2342,
"mean_token_accuracy": 0.7375519275665283,
"step": 64
},
{
"epoch": 0.5462184873949579,
"grad_norm": 3.3400715637598446,
"learning_rate": 9.832092995810763e-06,
"loss": 1.0596,
"mean_token_accuracy": 0.780117928981781,
"step": 65
},
{
"epoch": 0.5546218487394958,
"grad_norm": 2.8550783454393773,
"learning_rate": 9.819967505878932e-06,
"loss": 1.0918,
"mean_token_accuracy": 0.7683150172233582,
"step": 66
},
{
"epoch": 0.5630252100840336,
"grad_norm": 3.093651064477546,
"learning_rate": 9.807428238615858e-06,
"loss": 1.0957,
"mean_token_accuracy": 0.7789058089256287,
"step": 67
},
{
"epoch": 0.5714285714285714,
"grad_norm": 2.960983075251036,
"learning_rate": 9.794476395064032e-06,
"loss": 1.1268,
"mean_token_accuracy": 0.7565435767173767,
"step": 68
},
{
"epoch": 0.5798319327731093,
"grad_norm": 2.8817853958410145,
"learning_rate": 9.781113215783541e-06,
"loss": 1.1262,
"mean_token_accuracy": 0.7553396821022034,
"step": 69
},
{
"epoch": 0.5882352941176471,
"grad_norm": 2.850151755259942,
"learning_rate": 9.76733998073324e-06,
"loss": 1.137,
"mean_token_accuracy": 0.7587066292762756,
"step": 70
},
{
"epoch": 0.5966386554621849,
"grad_norm": 2.992963756739842,
"learning_rate": 9.75315800914815e-06,
"loss": 1.11,
"mean_token_accuracy": 0.7620386481285095,
"step": 71
},
{
"epoch": 0.6050420168067226,
"grad_norm": 3.1922451576730735,
"learning_rate": 9.738568659413116e-06,
"loss": 1.114,
"mean_token_accuracy": 0.7604764103889465,
"step": 72
},
{
"epoch": 0.6134453781512605,
"grad_norm": 3.2221397960034266,
"learning_rate": 9.723573328932669e-06,
"loss": 1.1063,
"mean_token_accuracy": 0.7661125063896179,
"step": 73
},
{
"epoch": 0.6218487394957983,
"grad_norm": 3.048363865232976,
"learning_rate": 9.708173453997202e-06,
"loss": 1.1882,
"mean_token_accuracy": 0.7403683066368103,
"step": 74
},
{
"epoch": 0.6302521008403361,
"grad_norm": 3.0892769258313533,
"learning_rate": 9.692370509645396e-06,
"loss": 1.0613,
"mean_token_accuracy": 0.7737182974815369,
"step": 75
},
{
"epoch": 0.6386554621848739,
"grad_norm": 2.9578404772617675,
"learning_rate": 9.676166009522925e-06,
"loss": 1.116,
"mean_token_accuracy": 0.7655495405197144,
"step": 76
},
{
"epoch": 0.6470588235294118,
"grad_norm": 3.1583547042694926,
"learning_rate": 9.659561505737486e-06,
"loss": 1.1386,
"mean_token_accuracy": 0.7496492862701416,
"step": 77
},
{
"epoch": 0.6554621848739496,
"grad_norm": 3.17445671844221,
"learning_rate": 9.64255858871013e-06,
"loss": 0.9822,
"mean_token_accuracy": 0.7807889580726624,
"step": 78
},
{
"epoch": 0.6638655462184874,
"grad_norm": 3.004016438011611,
"learning_rate": 9.62515888702293e-06,
"loss": 1.017,
"mean_token_accuracy": 0.7823821902275085,
"step": 79
},
{
"epoch": 0.6722689075630253,
"grad_norm": 2.9647806910582504,
"learning_rate": 9.607364067262988e-06,
"loss": 1.0829,
"mean_token_accuracy": 0.7621784806251526,
"step": 80
},
{
"epoch": 0.680672268907563,
"grad_norm": 2.740020920509613,
"learning_rate": 9.58917583386281e-06,
"loss": 1.2256,
"mean_token_accuracy": 0.733435332775116,
"step": 81
},
{
"epoch": 0.6890756302521008,
"grad_norm": 2.546166061674224,
"learning_rate": 9.57059592893704e-06,
"loss": 1.0641,
"mean_token_accuracy": 0.764522910118103,
"step": 82
},
{
"epoch": 0.6974789915966386,
"grad_norm": 2.5362939949339114,
"learning_rate": 9.55162613211561e-06,
"loss": 1.0637,
"mean_token_accuracy": 0.766620934009552,
"step": 83
},
{
"epoch": 0.7058823529411765,
"grad_norm": 2.672979034931999,
"learning_rate": 9.53226826037328e-06,
"loss": 0.9843,
"mean_token_accuracy": 0.7884352207183838,
"step": 84
},
{
"epoch": 0.7142857142857143,
"grad_norm": 2.455065490024706,
"learning_rate": 9.51252416785559e-06,
"loss": 1.0195,
"mean_token_accuracy": 0.7825503349304199,
"step": 85
},
{
"epoch": 0.7226890756302521,
"grad_norm": 2.3693414239443897,
"learning_rate": 9.492395745701287e-06,
"loss": 1.1646,
"mean_token_accuracy": 0.7410282492637634,
"step": 86
},
{
"epoch": 0.7310924369747899,
"grad_norm": 2.458895527399391,
"learning_rate": 9.471884921861165e-06,
"loss": 1.1175,
"mean_token_accuracy": 0.7548961043357849,
"step": 87
},
{
"epoch": 0.7394957983193278,
"grad_norm": 2.3848761193475587,
"learning_rate": 9.450993660913418e-06,
"loss": 1.0716,
"mean_token_accuracy": 0.759257972240448,
"step": 88
},
{
"epoch": 0.7478991596638656,
"grad_norm": 2.2417278733421995,
"learning_rate": 9.429723963875454e-06,
"loss": 1.0341,
"mean_token_accuracy": 0.773446261882782,
"step": 89
},
{
"epoch": 0.7563025210084033,
"grad_norm": 2.224722679174331,
"learning_rate": 9.408077868012248e-06,
"loss": 1.064,
"mean_token_accuracy": 0.7724658250808716,
"step": 90
},
{
"epoch": 0.7647058823529411,
"grad_norm": 2.302623362463434,
"learning_rate": 9.386057446641195e-06,
"loss": 0.9708,
"mean_token_accuracy": 0.7837342619895935,
"step": 91
},
{
"epoch": 0.773109243697479,
"grad_norm": 2.131194431916736,
"learning_rate": 9.363664808933529e-06,
"loss": 1.1295,
"mean_token_accuracy": 0.753643810749054,
"step": 92
},
{
"epoch": 0.7815126050420168,
"grad_norm": 2.4261127329171117,
"learning_rate": 9.340902099712294e-06,
"loss": 1.1255,
"mean_token_accuracy": 0.7631184458732605,
"step": 93
},
{
"epoch": 0.7899159663865546,
"grad_norm": 2.1187942609232526,
"learning_rate": 9.317771499246918e-06,
"loss": 1.0471,
"mean_token_accuracy": 0.7643110156059265,
"step": 94
},
{
"epoch": 0.7983193277310925,
"grad_norm": 1.9980151763738605,
"learning_rate": 9.294275223044372e-06,
"loss": 1.0263,
"mean_token_accuracy": 0.7738521099090576,
"step": 95
},
{
"epoch": 0.8067226890756303,
"grad_norm": 2.033786742643822,
"learning_rate": 9.270415521636971e-06,
"loss": 1.084,
"mean_token_accuracy": 0.7599940896034241,
"step": 96
},
{
"epoch": 0.8151260504201681,
"grad_norm": 2.168443561732016,
"learning_rate": 9.246194680366802e-06,
"loss": 1.047,
"mean_token_accuracy": 0.7660160660743713,
"step": 97
},
{
"epoch": 0.8235294117647058,
"grad_norm": 1.998790146565347,
"learning_rate": 9.221615019166844e-06,
"loss": 1.1367,
"mean_token_accuracy": 0.7494749426841736,
"step": 98
},
{
"epoch": 0.8319327731092437,
"grad_norm": 1.9129114293452298,
"learning_rate": 9.19667889233874e-06,
"loss": 1.098,
"mean_token_accuracy": 0.7525637745857239,
"step": 99
},
{
"epoch": 0.8403361344537815,
"grad_norm": 1.9382375740584845,
"learning_rate": 9.171388688327307e-06,
"loss": 1.0382,
"mean_token_accuracy": 0.7737355828285217,
"step": 100
},
{
"epoch": 0.8487394957983193,
"grad_norm": 2.012931555112626,
"learning_rate": 9.145746829491775e-06,
"loss": 1.0205,
"mean_token_accuracy": 0.7717574834823608,
"step": 101
},
{
"epoch": 0.8571428571428571,
"grad_norm": 1.9857323536700038,
"learning_rate": 9.119755771873737e-06,
"loss": 1.1345,
"mean_token_accuracy": 0.7516574859619141,
"step": 102
},
{
"epoch": 0.865546218487395,
"grad_norm": 2.0206369529828723,
"learning_rate": 9.093418004961939e-06,
"loss": 1.0117,
"mean_token_accuracy": 0.7809069156646729,
"step": 103
},
{
"epoch": 0.8739495798319328,
"grad_norm": 1.9912220371473022,
"learning_rate": 9.066736051453802e-06,
"loss": 1.1656,
"mean_token_accuracy": 0.7395861148834229,
"step": 104
},
{
"epoch": 0.8823529411764706,
"grad_norm": 2.1335788688419135,
"learning_rate": 9.039712467013808e-06,
"loss": 1.1239,
"mean_token_accuracy": 0.7545720934867859,
"step": 105
},
{
"epoch": 0.8907563025210085,
"grad_norm": 2.272579879171099,
"learning_rate": 9.012349840028707e-06,
"loss": 1.0229,
"mean_token_accuracy": 0.7670172452926636,
"step": 106
},
{
"epoch": 0.8991596638655462,
"grad_norm": 2.0353968319884834,
"learning_rate": 8.984650791359596e-06,
"loss": 1.077,
"mean_token_accuracy": 0.7584921717643738,
"step": 107
},
{
"epoch": 0.907563025210084,
"grad_norm": 1.9860241702061474,
"learning_rate": 8.956617974090879e-06,
"loss": 1.138,
"mean_token_accuracy": 0.7530872821807861,
"step": 108
},
{
"epoch": 0.9159663865546218,
"grad_norm": 1.8039419277889777,
"learning_rate": 8.928254073276166e-06,
"loss": 1.1177,
"mean_token_accuracy": 0.755870521068573,
"step": 109
},
{
"epoch": 0.9243697478991597,
"grad_norm": 1.9777313920085413,
"learning_rate": 8.899561805681067e-06,
"loss": 1.0633,
"mean_token_accuracy": 0.7670658826828003,
"step": 110
},
{
"epoch": 0.9327731092436975,
"grad_norm": 1.9837274369580524,
"learning_rate": 8.870543919522996e-06,
"loss": 1.0557,
"mean_token_accuracy": 0.7702457904815674,
"step": 111
},
{
"epoch": 0.9411764705882353,
"grad_norm": 1.8612596386033633,
"learning_rate": 8.841203194207925e-06,
"loss": 0.9907,
"mean_token_accuracy": 0.7775035500526428,
"step": 112
},
{
"epoch": 0.9495798319327731,
"grad_norm": 2.034853673482078,
"learning_rate": 8.811542440064174e-06,
"loss": 1.2261,
"mean_token_accuracy": 0.7283035516738892,
"step": 113
},
{
"epoch": 0.957983193277311,
"grad_norm": 1.9548359467744874,
"learning_rate": 8.781564498073226e-06,
"loss": 1.0533,
"mean_token_accuracy": 0.7671497464179993,
"step": 114
},
{
"epoch": 0.9663865546218487,
"grad_norm": 1.9022866929004814,
"learning_rate": 8.751272239597612e-06,
"loss": 1.0574,
"mean_token_accuracy": 0.7680447697639465,
"step": 115
},
{
"epoch": 0.9747899159663865,
"grad_norm": 1.8866837322531922,
"learning_rate": 8.720668566105883e-06,
"loss": 1.1859,
"mean_token_accuracy": 0.7381235957145691,
"step": 116
},
{
"epoch": 0.9831932773109243,
"grad_norm": 1.8348643484595748,
"learning_rate": 8.689756408894709e-06,
"loss": 1.0349,
"mean_token_accuracy": 0.7731918692588806,
"step": 117
},
{
"epoch": 0.9915966386554622,
"grad_norm": 2.0203019049012094,
"learning_rate": 8.658538728808097e-06,
"loss": 0.9747,
"mean_token_accuracy": 0.7861313819885254,
"step": 118
},
{
"epoch": 1.0,
"grad_norm": 1.8151270192332218,
"learning_rate": 8.627018515953807e-06,
"loss": 1.0169,
"mean_token_accuracy": 0.7644779682159424,
"step": 119
},
{
"epoch": 1.0084033613445378,
"grad_norm": 2.858568409053351,
"learning_rate": 8.595198789416943e-06,
"loss": 0.8765,
"mean_token_accuracy": 0.8038392066955566,
"step": 120
},
{
"epoch": 1.0168067226890756,
"grad_norm": 2.563535999934096,
"learning_rate": 8.563082596970785e-06,
"loss": 0.8011,
"mean_token_accuracy": 0.8078204989433289,
"step": 121
},
{
"epoch": 1.0252100840336134,
"grad_norm": 2.2281587546425365,
"learning_rate": 8.530673014784857e-06,
"loss": 0.9006,
"mean_token_accuracy": 0.7865578532218933,
"step": 122
},
{
"epoch": 1.0336134453781514,
"grad_norm": 1.8772863169719356,
"learning_rate": 8.497973147130296e-06,
"loss": 0.8306,
"mean_token_accuracy": 0.8074118494987488,
"step": 123
},
{
"epoch": 1.0420168067226891,
"grad_norm": 1.8041988985955282,
"learning_rate": 8.4649861260825e-06,
"loss": 0.8681,
"mean_token_accuracy": 0.796225368976593,
"step": 124
},
{
"epoch": 1.050420168067227,
"grad_norm": 2.320587748605426,
"learning_rate": 8.431715111221152e-06,
"loss": 0.8577,
"mean_token_accuracy": 0.7973388433456421,
"step": 125
},
{
"epoch": 1.0588235294117647,
"grad_norm": 3.390802826249011,
"learning_rate": 8.398163289327568e-06,
"loss": 0.8007,
"mean_token_accuracy": 0.8107035756111145,
"step": 126
},
{
"epoch": 1.0672268907563025,
"grad_norm": 2.500716325470751,
"learning_rate": 8.364333874079462e-06,
"loss": 0.8029,
"mean_token_accuracy": 0.810440182685852,
"step": 127
},
{
"epoch": 1.0756302521008403,
"grad_norm": 1.9737423505205354,
"learning_rate": 8.330230105743147e-06,
"loss": 0.8521,
"mean_token_accuracy": 0.7987682223320007,
"step": 128
},
{
"epoch": 1.084033613445378,
"grad_norm": 1.8133876990453317,
"learning_rate": 8.295855250863156e-06,
"loss": 0.7874,
"mean_token_accuracy": 0.8133313655853271,
"step": 129
},
{
"epoch": 1.092436974789916,
"grad_norm": 1.7704884430147076,
"learning_rate": 8.261212601949374e-06,
"loss": 0.8614,
"mean_token_accuracy": 0.7912753224372864,
"step": 130
},
{
"epoch": 1.1008403361344539,
"grad_norm": 1.9029134321486696,
"learning_rate": 8.226305477161669e-06,
"loss": 0.9127,
"mean_token_accuracy": 0.7861339449882507,
"step": 131
},
{
"epoch": 1.1092436974789917,
"grad_norm": 1.9422789961546394,
"learning_rate": 8.191137219992073e-06,
"loss": 0.8379,
"mean_token_accuracy": 0.8037659525871277,
"step": 132
},
{
"epoch": 1.1176470588235294,
"grad_norm": 1.836152314149856,
"learning_rate": 8.155711198944536e-06,
"loss": 0.8096,
"mean_token_accuracy": 0.8135814666748047,
"step": 133
},
{
"epoch": 1.1260504201680672,
"grad_norm": 1.9512642996739955,
"learning_rate": 8.120030807212276e-06,
"loss": 0.805,
"mean_token_accuracy": 0.8122808337211609,
"step": 134
},
{
"epoch": 1.134453781512605,
"grad_norm": 1.7415637300579179,
"learning_rate": 8.084099462352772e-06,
"loss": 0.8007,
"mean_token_accuracy": 0.8150731921195984,
"step": 135
},
{
"epoch": 1.1428571428571428,
"grad_norm": 1.8482338825609754,
"learning_rate": 8.047920605960428e-06,
"loss": 0.7917,
"mean_token_accuracy": 0.8171132206916809,
"step": 136
},
{
"epoch": 1.1512605042016806,
"grad_norm": 1.884493107778714,
"learning_rate": 8.011497703336921e-06,
"loss": 0.898,
"mean_token_accuracy": 0.7803546190261841,
"step": 137
},
{
"epoch": 1.1596638655462184,
"grad_norm": 1.746134878476434,
"learning_rate": 7.974834243159288e-06,
"loss": 0.8086,
"mean_token_accuracy": 0.8132433891296387,
"step": 138
},
{
"epoch": 1.1680672268907564,
"grad_norm": 1.81867124622388,
"learning_rate": 7.937933737145777e-06,
"loss": 0.889,
"mean_token_accuracy": 0.7920069098472595,
"step": 139
},
{
"epoch": 1.1764705882352942,
"grad_norm": 1.8766821031228575,
"learning_rate": 7.900799719719473e-06,
"loss": 0.8136,
"mean_token_accuracy": 0.8072178959846497,
"step": 140
},
{
"epoch": 1.184873949579832,
"grad_norm": 2.0915138411757592,
"learning_rate": 7.863435747669781e-06,
"loss": 0.7758,
"mean_token_accuracy": 0.816449761390686,
"step": 141
},
{
"epoch": 1.1932773109243697,
"grad_norm": 1.9258493343252368,
"learning_rate": 7.825845399811723e-06,
"loss": 0.8785,
"mean_token_accuracy": 0.7919079065322876,
"step": 142
},
{
"epoch": 1.2016806722689075,
"grad_norm": 1.79704777405251,
"learning_rate": 7.788032276643181e-06,
"loss": 0.8391,
"mean_token_accuracy": 0.805074155330658,
"step": 143
},
{
"epoch": 1.2100840336134453,
"grad_norm": 1.8565096562958643,
"learning_rate": 7.75e-06,
"loss": 0.8627,
"mean_token_accuracy": 0.7953042984008789,
"step": 144
},
{
"epoch": 1.2184873949579833,
"grad_norm": 1.7568303758649213,
"learning_rate": 7.711752212709106e-06,
"loss": 0.7859,
"mean_token_accuracy": 0.8123944997787476,
"step": 145
},
{
"epoch": 1.226890756302521,
"grad_norm": 1.769664699980329,
"learning_rate": 7.673292578239569e-06,
"loss": 0.8927,
"mean_token_accuracy": 0.7881185412406921,
"step": 146
},
{
"epoch": 1.2352941176470589,
"grad_norm": 1.7762583026108316,
"learning_rate": 7.634624780351715e-06,
"loss": 0.7979,
"mean_token_accuracy": 0.8104432821273804,
"step": 147
},
{
"epoch": 1.2436974789915967,
"grad_norm": 1.8444818695347533,
"learning_rate": 7.595752522744287e-06,
"loss": 0.685,
"mean_token_accuracy": 0.8296918869018555,
"step": 148
},
{
"epoch": 1.2521008403361344,
"grad_norm": 1.6589733125236013,
"learning_rate": 7.556679528699692e-06,
"loss": 0.7998,
"mean_token_accuracy": 0.8100078701972961,
"step": 149
},
{
"epoch": 1.2605042016806722,
"grad_norm": 1.8160364471890191,
"learning_rate": 7.5174095407273765e-06,
"loss": 0.6939,
"mean_token_accuracy": 0.8351863622665405,
"step": 150
},
{
"epoch": 1.26890756302521,
"grad_norm": 1.8158422888302235,
"learning_rate": 7.477946320205358e-06,
"loss": 0.7705,
"mean_token_accuracy": 0.8159504532814026,
"step": 151
},
{
"epoch": 1.2773109243697478,
"grad_norm": 1.88868521231513,
"learning_rate": 7.438293647019958e-06,
"loss": 0.786,
"mean_token_accuracy": 0.817752480506897,
"step": 152
},
{
"epoch": 1.2857142857142856,
"grad_norm": 1.669440069435849,
"learning_rate": 7.398455319203741e-06,
"loss": 0.7114,
"mean_token_accuracy": 0.8334900736808777,
"step": 153
},
{
"epoch": 1.2941176470588236,
"grad_norm": 1.8859412020788646,
"learning_rate": 7.358435152571749e-06,
"loss": 0.7507,
"mean_token_accuracy": 0.820056140422821,
"step": 154
},
{
"epoch": 1.3025210084033614,
"grad_norm": 1.8440185592893792,
"learning_rate": 7.318236980355993e-06,
"loss": 0.7795,
"mean_token_accuracy": 0.8169759511947632,
"step": 155
},
{
"epoch": 1.3109243697478992,
"grad_norm": 1.7904168122577475,
"learning_rate": 7.2778646528383105e-06,
"loss": 0.7735,
"mean_token_accuracy": 0.8180586099624634,
"step": 156
},
{
"epoch": 1.319327731092437,
"grad_norm": 1.765680038172988,
"learning_rate": 7.237322036981568e-06,
"loss": 0.834,
"mean_token_accuracy": 0.8086110949516296,
"step": 157
},
{
"epoch": 1.3277310924369747,
"grad_norm": 1.8167654523320387,
"learning_rate": 7.196613016059281e-06,
"loss": 0.7641,
"mean_token_accuracy": 0.8251628875732422,
"step": 158
},
{
"epoch": 1.3361344537815127,
"grad_norm": 1.7892540373408776,
"learning_rate": 7.155741489283653e-06,
"loss": 0.7715,
"mean_token_accuracy": 0.815371036529541,
"step": 159
},
{
"epoch": 1.3445378151260505,
"grad_norm": 2.0679437530612765,
"learning_rate": 7.114711371432113e-06,
"loss": 0.892,
"mean_token_accuracy": 0.7930935621261597,
"step": 160
},
{
"epoch": 1.3529411764705883,
"grad_norm": 1.9245059782180325,
"learning_rate": 7.073526592472337e-06,
"loss": 0.8448,
"mean_token_accuracy": 0.8044028282165527,
"step": 161
},
{
"epoch": 1.361344537815126,
"grad_norm": 1.9104553151840824,
"learning_rate": 7.032191097185832e-06,
"loss": 0.7271,
"mean_token_accuracy": 0.8310403227806091,
"step": 162
},
{
"epoch": 1.3697478991596639,
"grad_norm": 1.798136465856472,
"learning_rate": 6.990708844790093e-06,
"loss": 0.8835,
"mean_token_accuracy": 0.7889003753662109,
"step": 163
},
{
"epoch": 1.3781512605042017,
"grad_norm": 1.7234505675114578,
"learning_rate": 6.949083808559378e-06,
"loss": 0.8402,
"mean_token_accuracy": 0.8051289319992065,
"step": 164
},
{
"epoch": 1.3865546218487395,
"grad_norm": 1.7897230878472068,
"learning_rate": 6.90731997544414e-06,
"loss": 0.8286,
"mean_token_accuracy": 0.8056466579437256,
"step": 165
},
{
"epoch": 1.3949579831932772,
"grad_norm": 1.849230508051203,
"learning_rate": 6.865421345689147e-06,
"loss": 0.8297,
"mean_token_accuracy": 0.8059335947036743,
"step": 166
},
{
"epoch": 1.403361344537815,
"grad_norm": 1.7845120726376866,
"learning_rate": 6.8233919324503265e-06,
"loss": 0.8854,
"mean_token_accuracy": 0.7944253087043762,
"step": 167
},
{
"epoch": 1.4117647058823528,
"grad_norm": 1.8294086172402824,
"learning_rate": 6.781235761410374e-06,
"loss": 0.8595,
"mean_token_accuracy": 0.8054335117340088,
"step": 168
},
{
"epoch": 1.4201680672268908,
"grad_norm": 1.8052234917818033,
"learning_rate": 6.73895687039317e-06,
"loss": 0.8036,
"mean_token_accuracy": 0.8146604299545288,
"step": 169
},
{
"epoch": 1.4285714285714286,
"grad_norm": 1.7998277689388709,
"learning_rate": 6.696559308977021e-06,
"loss": 0.735,
"mean_token_accuracy": 0.8271728754043579,
"step": 170
},
{
"epoch": 1.4369747899159664,
"grad_norm": 1.7330715976428295,
"learning_rate": 6.6540471381067785e-06,
"loss": 0.8224,
"mean_token_accuracy": 0.80235755443573,
"step": 171
},
{
"epoch": 1.4453781512605042,
"grad_norm": 1.876207322246444,
"learning_rate": 6.611424429704879e-06,
"loss": 0.8064,
"mean_token_accuracy": 0.8060723543167114,
"step": 172
},
{
"epoch": 1.453781512605042,
"grad_norm": 1.826777321537923,
"learning_rate": 6.5686952662813215e-06,
"loss": 0.7626,
"mean_token_accuracy": 0.8241952657699585,
"step": 173
},
{
"epoch": 1.46218487394958,
"grad_norm": 1.9309690813658709,
"learning_rate": 6.525863740542633e-06,
"loss": 0.8768,
"mean_token_accuracy": 0.7913132905960083,
"step": 174
},
{
"epoch": 1.4705882352941178,
"grad_norm": 1.9363389825762378,
"learning_rate": 6.482933954999858e-06,
"loss": 0.742,
"mean_token_accuracy": 0.8222526907920837,
"step": 175
},
{
"epoch": 1.4789915966386555,
"grad_norm": 1.7340115535262608,
"learning_rate": 6.439910021575617e-06,
"loss": 0.8238,
"mean_token_accuracy": 0.8056747913360596,
"step": 176
},
{
"epoch": 1.4873949579831933,
"grad_norm": 1.7607961684480655,
"learning_rate": 6.396796061210245e-06,
"loss": 0.8639,
"mean_token_accuracy": 0.7974097728729248,
"step": 177
},
{
"epoch": 1.495798319327731,
"grad_norm": 1.912300447750382,
"learning_rate": 6.353596203467085e-06,
"loss": 0.8516,
"mean_token_accuracy": 0.7965307235717773,
"step": 178
},
{
"epoch": 1.504201680672269,
"grad_norm": 1.9148975976568732,
"learning_rate": 6.3103145861369505e-06,
"loss": 0.8007,
"mean_token_accuracy": 0.8129093050956726,
"step": 179
},
{
"epoch": 1.5126050420168067,
"grad_norm": 1.8491807086301022,
"learning_rate": 6.266955354841788e-06,
"loss": 0.7817,
"mean_token_accuracy": 0.8149424195289612,
"step": 180
},
{
"epoch": 1.5210084033613445,
"grad_norm": 1.8115593786268498,
"learning_rate": 6.2235226626376075e-06,
"loss": 0.7714,
"mean_token_accuracy": 0.8186544179916382,
"step": 181
},
{
"epoch": 1.5294117647058822,
"grad_norm": 1.8341527270888607,
"learning_rate": 6.180020669616689e-06,
"loss": 0.791,
"mean_token_accuracy": 0.8164339661598206,
"step": 182
},
{
"epoch": 1.53781512605042,
"grad_norm": 1.7479348310610867,
"learning_rate": 6.1364535425091175e-06,
"loss": 0.8119,
"mean_token_accuracy": 0.8093591332435608,
"step": 183
},
{
"epoch": 1.5462184873949578,
"grad_norm": 1.748030323352481,
"learning_rate": 6.0928254542836855e-06,
"loss": 0.7798,
"mean_token_accuracy": 0.8146873712539673,
"step": 184
},
{
"epoch": 1.5546218487394958,
"grad_norm": 1.7171481257834251,
"learning_rate": 6.049140583748193e-06,
"loss": 0.7612,
"mean_token_accuracy": 0.8190532326698303,
"step": 185
},
{
"epoch": 1.5630252100840336,
"grad_norm": 1.8479808075500652,
"learning_rate": 6.005403115149194e-06,
"loss": 0.6937,
"mean_token_accuracy": 0.838882565498352,
"step": 186
},
{
"epoch": 1.5714285714285714,
"grad_norm": 2.117162630613232,
"learning_rate": 5.961617237771217e-06,
"loss": 0.9241,
"mean_token_accuracy": 0.7848495244979858,
"step": 187
},
{
"epoch": 1.5798319327731094,
"grad_norm": 1.750486932166757,
"learning_rate": 5.917787145535502e-06,
"loss": 0.7778,
"mean_token_accuracy": 0.8146782517433167,
"step": 188
},
{
"epoch": 1.5882352941176472,
"grad_norm": 1.8908131914774162,
"learning_rate": 5.873917036598301e-06,
"loss": 0.8392,
"mean_token_accuracy": 0.7985531687736511,
"step": 189
},
{
"epoch": 1.596638655462185,
"grad_norm": 1.8273639504026071,
"learning_rate": 5.830011112948768e-06,
"loss": 0.7724,
"mean_token_accuracy": 0.81374192237854,
"step": 190
},
{
"epoch": 1.6050420168067228,
"grad_norm": 1.828941646368098,
"learning_rate": 5.786073580006478e-06,
"loss": 0.785,
"mean_token_accuracy": 0.8174896240234375,
"step": 191
},
{
"epoch": 1.6134453781512605,
"grad_norm": 1.7330730222271304,
"learning_rate": 5.742108646218622e-06,
"loss": 0.8689,
"mean_token_accuracy": 0.7993961572647095,
"step": 192
},
{
"epoch": 1.6218487394957983,
"grad_norm": 1.7144231122228817,
"learning_rate": 5.698120522656916e-06,
"loss": 0.7063,
"mean_token_accuracy": 0.830324649810791,
"step": 193
},
{
"epoch": 1.6302521008403361,
"grad_norm": 1.9817707355442309,
"learning_rate": 5.654113422614249e-06,
"loss": 0.9405,
"mean_token_accuracy": 0.779734194278717,
"step": 194
},
{
"epoch": 1.638655462184874,
"grad_norm": 1.8152467597722433,
"learning_rate": 5.610091561201123e-06,
"loss": 0.8376,
"mean_token_accuracy": 0.8002806305885315,
"step": 195
},
{
"epoch": 1.6470588235294117,
"grad_norm": 1.7562031104736542,
"learning_rate": 5.566059154941925e-06,
"loss": 0.8001,
"mean_token_accuracy": 0.8095415234565735,
"step": 196
},
{
"epoch": 1.6554621848739495,
"grad_norm": 1.7465382260554791,
"learning_rate": 5.522020421371053e-06,
"loss": 0.7886,
"mean_token_accuracy": 0.8145126104354858,
"step": 197
},
{
"epoch": 1.6638655462184873,
"grad_norm": 1.8000228189517324,
"learning_rate": 5.477979578628949e-06,
"loss": 0.8073,
"mean_token_accuracy": 0.8087124228477478,
"step": 198
},
{
"epoch": 1.6722689075630253,
"grad_norm": 1.7127026839600348,
"learning_rate": 5.433940845058076e-06,
"loss": 0.7923,
"mean_token_accuracy": 0.8146789073944092,
"step": 199
},
{
"epoch": 1.680672268907563,
"grad_norm": 1.7481710683580405,
"learning_rate": 5.38990843879888e-06,
"loss": 0.7628,
"mean_token_accuracy": 0.8225399255752563,
"step": 200
},
{
"epoch": 1.6890756302521008,
"grad_norm": 1.7370632838141555,
"learning_rate": 5.345886577385754e-06,
"loss": 0.7968,
"mean_token_accuracy": 0.8118207454681396,
"step": 201
},
{
"epoch": 1.6974789915966386,
"grad_norm": 1.788668828544874,
"learning_rate": 5.301879477343086e-06,
"loss": 0.9275,
"mean_token_accuracy": 0.7842003703117371,
"step": 202
},
{
"epoch": 1.7058823529411766,
"grad_norm": 1.7557341503386812,
"learning_rate": 5.257891353781381e-06,
"loss": 0.8115,
"mean_token_accuracy": 0.8065828680992126,
"step": 203
},
{
"epoch": 1.7142857142857144,
"grad_norm": 1.8266761935083635,
"learning_rate": 5.213926419993524e-06,
"loss": 0.8503,
"mean_token_accuracy": 0.8006482720375061,
"step": 204
},
{
"epoch": 1.7226890756302522,
"grad_norm": 1.8318814439021893,
"learning_rate": 5.169988887051234e-06,
"loss": 0.8397,
"mean_token_accuracy": 0.800042450428009,
"step": 205
},
{
"epoch": 1.73109243697479,
"grad_norm": 1.7950366268900575,
"learning_rate": 5.1260829634017e-06,
"loss": 0.8816,
"mean_token_accuracy": 0.7939304709434509,
"step": 206
},
{
"epoch": 1.7394957983193278,
"grad_norm": 1.7097851307871237,
"learning_rate": 5.0822128544645015e-06,
"loss": 0.7794,
"mean_token_accuracy": 0.8178083300590515,
"step": 207
},
{
"epoch": 1.7478991596638656,
"grad_norm": 1.7248899218784792,
"learning_rate": 5.038382762228786e-06,
"loss": 0.8302,
"mean_token_accuracy": 0.8006280660629272,
"step": 208
},
{
"epoch": 1.7563025210084033,
"grad_norm": 1.7624161921422554,
"learning_rate": 4.994596884850809e-06,
"loss": 0.8145,
"mean_token_accuracy": 0.8077849745750427,
"step": 209
},
{
"epoch": 1.7647058823529411,
"grad_norm": 1.772558161317811,
"learning_rate": 4.95085941625181e-06,
"loss": 0.7222,
"mean_token_accuracy": 0.8232572078704834,
"step": 210
},
{
"epoch": 1.773109243697479,
"grad_norm": 1.7357919073002692,
"learning_rate": 4.907174545716317e-06,
"loss": 0.7584,
"mean_token_accuracy": 0.8207970857620239,
"step": 211
},
{
"epoch": 1.7815126050420167,
"grad_norm": 1.7737912355330372,
"learning_rate": 4.863546457490886e-06,
"loss": 0.8097,
"mean_token_accuracy": 0.8093906044960022,
"step": 212
},
{
"epoch": 1.7899159663865545,
"grad_norm": 1.7882219588273116,
"learning_rate": 4.8199793303833135e-06,
"loss": 0.8145,
"mean_token_accuracy": 0.807731568813324,
"step": 213
},
{
"epoch": 1.7983193277310925,
"grad_norm": 1.8477432032889956,
"learning_rate": 4.776477337362394e-06,
"loss": 0.801,
"mean_token_accuracy": 0.8072378635406494,
"step": 214
},
{
"epoch": 1.8067226890756303,
"grad_norm": 1.7882807024631573,
"learning_rate": 4.733044645158214e-06,
"loss": 0.8694,
"mean_token_accuracy": 0.7961673736572266,
"step": 215
},
{
"epoch": 1.815126050420168,
"grad_norm": 1.7813429615618168,
"learning_rate": 4.689685413863052e-06,
"loss": 0.7709,
"mean_token_accuracy": 0.8158525228500366,
"step": 216
},
{
"epoch": 1.8235294117647058,
"grad_norm": 1.7685865694472525,
"learning_rate": 4.646403796532916e-06,
"loss": 0.8273,
"mean_token_accuracy": 0.8055749535560608,
"step": 217
},
{
"epoch": 1.8319327731092439,
"grad_norm": 1.765292271683428,
"learning_rate": 4.603203938789757e-06,
"loss": 0.6773,
"mean_token_accuracy": 0.8375442624092102,
"step": 218
},
{
"epoch": 1.8403361344537816,
"grad_norm": 1.8827516407913738,
"learning_rate": 4.560089978424384e-06,
"loss": 0.685,
"mean_token_accuracy": 0.8397190570831299,
"step": 219
},
{
"epoch": 1.8487394957983194,
"grad_norm": 1.894159185774351,
"learning_rate": 4.517066045000142e-06,
"loss": 0.7897,
"mean_token_accuracy": 0.8115262389183044,
"step": 220
},
{
"epoch": 1.8571428571428572,
"grad_norm": 1.8084889223361214,
"learning_rate": 4.4741362594573686e-06,
"loss": 0.7753,
"mean_token_accuracy": 0.8194411993026733,
"step": 221
},
{
"epoch": 1.865546218487395,
"grad_norm": 1.7599399933691897,
"learning_rate": 4.43130473371868e-06,
"loss": 0.7357,
"mean_token_accuracy": 0.8300382494926453,
"step": 222
},
{
"epoch": 1.8739495798319328,
"grad_norm": 1.9796797707154894,
"learning_rate": 4.388575570295123e-06,
"loss": 0.9223,
"mean_token_accuracy": 0.7812479734420776,
"step": 223
},
{
"epoch": 1.8823529411764706,
"grad_norm": 1.6759722598102358,
"learning_rate": 4.345952861893225e-06,
"loss": 0.7815,
"mean_token_accuracy": 0.8141289353370667,
"step": 224
},
{
"epoch": 1.8907563025210083,
"grad_norm": 1.9173489384782079,
"learning_rate": 4.303440691022982e-06,
"loss": 0.7538,
"mean_token_accuracy": 0.8243086338043213,
"step": 225
},
{
"epoch": 1.8991596638655461,
"grad_norm": 1.8207386221911352,
"learning_rate": 4.261043129606832e-06,
"loss": 0.8646,
"mean_token_accuracy": 0.7935149073600769,
"step": 226
},
{
"epoch": 1.907563025210084,
"grad_norm": 1.7872281900341995,
"learning_rate": 4.218764238589629e-06,
"loss": 0.7669,
"mean_token_accuracy": 0.8217418193817139,
"step": 227
},
{
"epoch": 1.9159663865546217,
"grad_norm": 1.788744931311787,
"learning_rate": 4.176608067549677e-06,
"loss": 0.8866,
"mean_token_accuracy": 0.7902339696884155,
"step": 228
},
{
"epoch": 1.9243697478991597,
"grad_norm": 1.8110709612539386,
"learning_rate": 4.134578654310854e-06,
"loss": 0.7914,
"mean_token_accuracy": 0.8136367201805115,
"step": 229
},
{
"epoch": 1.9327731092436975,
"grad_norm": 1.8112670191684481,
"learning_rate": 4.092680024555862e-06,
"loss": 0.8218,
"mean_token_accuracy": 0.8051120638847351,
"step": 230
},
{
"epoch": 1.9411764705882353,
"grad_norm": 1.7458590334496111,
"learning_rate": 4.0509161914406244e-06,
"loss": 0.8198,
"mean_token_accuracy": 0.8071305155754089,
"step": 231
},
{
"epoch": 1.949579831932773,
"grad_norm": 1.8175887274370786,
"learning_rate": 4.009291155209909e-06,
"loss": 0.7585,
"mean_token_accuracy": 0.8226490616798401,
"step": 232
},
{
"epoch": 1.957983193277311,
"grad_norm": 1.8094467781021035,
"learning_rate": 3.9678089028141704e-06,
"loss": 0.7939,
"mean_token_accuracy": 0.817867636680603,
"step": 233
},
{
"epoch": 1.9663865546218489,
"grad_norm": 1.7690996396224505,
"learning_rate": 3.926473407527665e-06,
"loss": 0.7872,
"mean_token_accuracy": 0.8126543760299683,
"step": 234
},
{
"epoch": 1.9747899159663866,
"grad_norm": 1.7966623405063749,
"learning_rate": 3.8852886285678896e-06,
"loss": 0.73,
"mean_token_accuracy": 0.8237267732620239,
"step": 235
},
{
"epoch": 1.9831932773109244,
"grad_norm": 1.8277505004778425,
"learning_rate": 3.8442585107163496e-06,
"loss": 0.814,
"mean_token_accuracy": 0.8057609796524048,
"step": 236
},
{
"epoch": 1.9915966386554622,
"grad_norm": 1.8613824843405602,
"learning_rate": 3.803386983940722e-06,
"loss": 0.8278,
"mean_token_accuracy": 0.8035258650779724,
"step": 237
},
{
"epoch": 2.0,
"grad_norm": 1.9832090535001756,
"learning_rate": 3.762677963018433e-06,
"loss": 0.6424,
"mean_token_accuracy": 0.8467904329299927,
"step": 238
},
{
"epoch": 2.008403361344538,
"grad_norm": 3.3844194174357805,
"learning_rate": 3.722135347161693e-06,
"loss": 0.5364,
"mean_token_accuracy": 0.8735464215278625,
"step": 239
},
{
"epoch": 2.0168067226890756,
"grad_norm": 2.960796922058979,
"learning_rate": 3.681763019644009e-06,
"loss": 0.5647,
"mean_token_accuracy": 0.8627821803092957,
"step": 240
},
{
"epoch": 2.0252100840336134,
"grad_norm": 2.73404749939346,
"learning_rate": 3.641564847428254e-06,
"loss": 0.4946,
"mean_token_accuracy": 0.8812078237533569,
"step": 241
},
{
"epoch": 2.033613445378151,
"grad_norm": 2.276716264454592,
"learning_rate": 3.6015446807962597e-06,
"loss": 0.4616,
"mean_token_accuracy": 0.8877162337303162,
"step": 242
},
{
"epoch": 2.042016806722689,
"grad_norm": 1.8253957145676258,
"learning_rate": 3.5617063529800467e-06,
"loss": 0.496,
"mean_token_accuracy": 0.8811616897583008,
"step": 243
},
{
"epoch": 2.0504201680672267,
"grad_norm": 1.7915842293074373,
"learning_rate": 3.5220536797946447e-06,
"loss": 0.4918,
"mean_token_accuracy": 0.8797276616096497,
"step": 244
},
{
"epoch": 2.0588235294117645,
"grad_norm": 2.546532003908193,
"learning_rate": 3.4825904592726266e-06,
"loss": 0.4841,
"mean_token_accuracy": 0.8803112506866455,
"step": 245
},
{
"epoch": 2.0672268907563027,
"grad_norm": 3.478981600558786,
"learning_rate": 3.44332047130031e-06,
"loss": 0.5142,
"mean_token_accuracy": 0.8750914335250854,
"step": 246
},
{
"epoch": 2.0756302521008405,
"grad_norm": 2.5707840642456103,
"learning_rate": 3.4042474772557143e-06,
"loss": 0.4965,
"mean_token_accuracy": 0.876130998134613,
"step": 247
},
{
"epoch": 2.0840336134453783,
"grad_norm": 3.1381820065412027,
"learning_rate": 3.3653752196482864e-06,
"loss": 0.5625,
"mean_token_accuracy": 0.8635848760604858,
"step": 248
},
{
"epoch": 2.092436974789916,
"grad_norm": 2.599264595056195,
"learning_rate": 3.3267074217604344e-06,
"loss": 0.4363,
"mean_token_accuracy": 0.8929134011268616,
"step": 249
},
{
"epoch": 2.100840336134454,
"grad_norm": 2.6170150441013,
"learning_rate": 3.2882477872908965e-06,
"loss": 0.4978,
"mean_token_accuracy": 0.8795924186706543,
"step": 250
},
{
"epoch": 2.1092436974789917,
"grad_norm": 4.701829999902318,
"learning_rate": 3.2500000000000015e-06,
"loss": 0.4867,
"mean_token_accuracy": 0.8780362606048584,
"step": 251
},
{
"epoch": 2.1176470588235294,
"grad_norm": 2.3010791433576583,
"learning_rate": 3.2119677233568213e-06,
"loss": 0.4875,
"mean_token_accuracy": 0.8787326812744141,
"step": 252
},
{
"epoch": 2.1260504201680672,
"grad_norm": 2.988123689093377,
"learning_rate": 3.1741546001882773e-06,
"loss": 0.4386,
"mean_token_accuracy": 0.8922126889228821,
"step": 253
},
{
"epoch": 2.134453781512605,
"grad_norm": 1.8808088041609694,
"learning_rate": 3.1365642523302214e-06,
"loss": 0.4819,
"mean_token_accuracy": 0.881823718547821,
"step": 254
},
{
"epoch": 2.142857142857143,
"grad_norm": 1.8516453219973752,
"learning_rate": 3.099200280280529e-06,
"loss": 0.532,
"mean_token_accuracy": 0.8674002885818481,
"step": 255
},
{
"epoch": 2.1512605042016806,
"grad_norm": 1.8121229898589075,
"learning_rate": 3.0620662628542256e-06,
"loss": 0.5078,
"mean_token_accuracy": 0.8735317587852478,
"step": 256
},
{
"epoch": 2.1596638655462184,
"grad_norm": 2.0979951074315366,
"learning_rate": 3.0251657568407134e-06,
"loss": 0.5357,
"mean_token_accuracy": 0.867943286895752,
"step": 257
},
{
"epoch": 2.168067226890756,
"grad_norm": 1.7941659597404156,
"learning_rate": 2.9885022966630812e-06,
"loss": 0.535,
"mean_token_accuracy": 0.8686414361000061,
"step": 258
},
{
"epoch": 2.176470588235294,
"grad_norm": 1.8274634030738992,
"learning_rate": 2.9520793940395735e-06,
"loss": 0.4964,
"mean_token_accuracy": 0.8770714402198792,
"step": 259
},
{
"epoch": 2.184873949579832,
"grad_norm": 1.7677515796991008,
"learning_rate": 2.9159005376472294e-06,
"loss": 0.4821,
"mean_token_accuracy": 0.8821917772293091,
"step": 260
},
{
"epoch": 2.19327731092437,
"grad_norm": 1.7394663644514425,
"learning_rate": 2.879969192787727e-06,
"loss": 0.5063,
"mean_token_accuracy": 0.8776208758354187,
"step": 261
},
{
"epoch": 2.2016806722689077,
"grad_norm": 1.7434272641018915,
"learning_rate": 2.8442888010554658e-06,
"loss": 0.4933,
"mean_token_accuracy": 0.8733060359954834,
"step": 262
},
{
"epoch": 2.2100840336134455,
"grad_norm": 1.8237732843940058,
"learning_rate": 2.8088627800079282e-06,
"loss": 0.5022,
"mean_token_accuracy": 0.8763316869735718,
"step": 263
},
{
"epoch": 2.2184873949579833,
"grad_norm": 1.7684491855815565,
"learning_rate": 2.773694522838333e-06,
"loss": 0.5956,
"mean_token_accuracy": 0.8532027006149292,
"step": 264
},
{
"epoch": 2.226890756302521,
"grad_norm": 1.698245931367799,
"learning_rate": 2.7387873980506286e-06,
"loss": 0.5113,
"mean_token_accuracy": 0.8779188394546509,
"step": 265
},
{
"epoch": 2.235294117647059,
"grad_norm": 1.7603718021061416,
"learning_rate": 2.7041447491368455e-06,
"loss": 0.4722,
"mean_token_accuracy": 0.8837765455245972,
"step": 266
},
{
"epoch": 2.2436974789915967,
"grad_norm": 1.7942983338768146,
"learning_rate": 2.6697698942568552e-06,
"loss": 0.5117,
"mean_token_accuracy": 0.8737485408782959,
"step": 267
},
{
"epoch": 2.2521008403361344,
"grad_norm": 1.7621204272017936,
"learning_rate": 2.6356661259205396e-06,
"loss": 0.495,
"mean_token_accuracy": 0.8756034970283508,
"step": 268
},
{
"epoch": 2.2605042016806722,
"grad_norm": 1.7768174505264556,
"learning_rate": 2.601836710672435e-06,
"loss": 0.4538,
"mean_token_accuracy": 0.8886755108833313,
"step": 269
},
{
"epoch": 2.26890756302521,
"grad_norm": 1.8376489221725794,
"learning_rate": 2.568284888778849e-06,
"loss": 0.5373,
"mean_token_accuracy": 0.8677133321762085,
"step": 270
},
{
"epoch": 2.277310924369748,
"grad_norm": 1.7356483601315353,
"learning_rate": 2.535013873917501e-06,
"loss": 0.4766,
"mean_token_accuracy": 0.8781722187995911,
"step": 271
},
{
"epoch": 2.2857142857142856,
"grad_norm": 1.8378248814183524,
"learning_rate": 2.5020268528697067e-06,
"loss": 0.5831,
"mean_token_accuracy": 0.8570009469985962,
"step": 272
},
{
"epoch": 2.2941176470588234,
"grad_norm": 1.7493303613971574,
"learning_rate": 2.469326985215146e-06,
"loss": 0.5094,
"mean_token_accuracy": 0.8769955635070801,
"step": 273
},
{
"epoch": 2.302521008403361,
"grad_norm": 1.7748047104815001,
"learning_rate": 2.436917403029219e-06,
"loss": 0.5089,
"mean_token_accuracy": 0.8757727742195129,
"step": 274
},
{
"epoch": 2.310924369747899,
"grad_norm": 1.7897596864764491,
"learning_rate": 2.404801210583059e-06,
"loss": 0.5097,
"mean_token_accuracy": 0.8774615526199341,
"step": 275
},
{
"epoch": 2.3193277310924367,
"grad_norm": 1.7651576671680917,
"learning_rate": 2.3729814840461944e-06,
"loss": 0.494,
"mean_token_accuracy": 0.8773323893547058,
"step": 276
},
{
"epoch": 2.327731092436975,
"grad_norm": 1.740295851487235,
"learning_rate": 2.341461271191903e-06,
"loss": 0.4865,
"mean_token_accuracy": 0.8756646513938904,
"step": 277
},
{
"epoch": 2.3361344537815127,
"grad_norm": 1.8654150960642903,
"learning_rate": 2.3102435911052915e-06,
"loss": 0.5036,
"mean_token_accuracy": 0.8760148286819458,
"step": 278
},
{
"epoch": 2.3445378151260505,
"grad_norm": 1.7800155124407253,
"learning_rate": 2.279331433894118e-06,
"loss": 0.546,
"mean_token_accuracy": 0.8608104586601257,
"step": 279
},
{
"epoch": 2.3529411764705883,
"grad_norm": 1.768664170523609,
"learning_rate": 2.248727760402391e-06,
"loss": 0.4948,
"mean_token_accuracy": 0.8780577182769775,
"step": 280
},
{
"epoch": 2.361344537815126,
"grad_norm": 1.770469552181129,
"learning_rate": 2.2184355019267766e-06,
"loss": 0.4778,
"mean_token_accuracy": 0.8816194534301758,
"step": 281
},
{
"epoch": 2.369747899159664,
"grad_norm": 1.6852781922022526,
"learning_rate": 2.1884575599358276e-06,
"loss": 0.4861,
"mean_token_accuracy": 0.8807989358901978,
"step": 282
},
{
"epoch": 2.3781512605042017,
"grad_norm": 1.744755572820875,
"learning_rate": 2.158796805792076e-06,
"loss": 0.4576,
"mean_token_accuracy": 0.887958288192749,
"step": 283
},
{
"epoch": 2.3865546218487395,
"grad_norm": 1.7018336172367803,
"learning_rate": 2.1294560804770066e-06,
"loss": 0.5494,
"mean_token_accuracy": 0.8622578978538513,
"step": 284
},
{
"epoch": 2.3949579831932772,
"grad_norm": 1.7837096796158942,
"learning_rate": 2.1004381943189347e-06,
"loss": 0.4585,
"mean_token_accuracy": 0.8856400847434998,
"step": 285
},
{
"epoch": 2.403361344537815,
"grad_norm": 1.8096225018522962,
"learning_rate": 2.071745926723836e-06,
"loss": 0.4728,
"mean_token_accuracy": 0.8849493861198425,
"step": 286
},
{
"epoch": 2.411764705882353,
"grad_norm": 1.7226922737142318,
"learning_rate": 2.043382025909121e-06,
"loss": 0.4401,
"mean_token_accuracy": 0.8929994702339172,
"step": 287
},
{
"epoch": 2.4201680672268906,
"grad_norm": 1.7381932608091253,
"learning_rate": 2.015349208640406e-06,
"loss": 0.4559,
"mean_token_accuracy": 0.8868588805198669,
"step": 288
},
{
"epoch": 2.4285714285714284,
"grad_norm": 1.785216301732934,
"learning_rate": 1.9876501599712933e-06,
"loss": 0.537,
"mean_token_accuracy": 0.8654530048370361,
"step": 289
},
{
"epoch": 2.4369747899159666,
"grad_norm": 1.676413871744692,
"learning_rate": 1.9602875329861943e-06,
"loss": 0.4562,
"mean_token_accuracy": 0.8863703012466431,
"step": 290
},
{
"epoch": 2.4453781512605044,
"grad_norm": 1.7379682976536965,
"learning_rate": 1.9332639485462006e-06,
"loss": 0.4977,
"mean_token_accuracy": 0.8756354451179504,
"step": 291
},
{
"epoch": 2.453781512605042,
"grad_norm": 1.789857023158383,
"learning_rate": 1.9065819950380634e-06,
"loss": 0.4762,
"mean_token_accuracy": 0.8814483284950256,
"step": 292
},
{
"epoch": 2.46218487394958,
"grad_norm": 1.6577735082283171,
"learning_rate": 1.880244228126264e-06,
"loss": 0.4476,
"mean_token_accuracy": 0.8910816311836243,
"step": 293
},
{
"epoch": 2.4705882352941178,
"grad_norm": 1.6927936102476582,
"learning_rate": 1.8542531705082275e-06,
"loss": 0.4893,
"mean_token_accuracy": 0.8814150094985962,
"step": 294
},
{
"epoch": 2.4789915966386555,
"grad_norm": 1.8054159398941678,
"learning_rate": 1.8286113116726928e-06,
"loss": 0.5264,
"mean_token_accuracy": 0.8734607100486755,
"step": 295
},
{
"epoch": 2.4873949579831933,
"grad_norm": 1.8000374925757012,
"learning_rate": 1.803321107661264e-06,
"loss": 0.5714,
"mean_token_accuracy": 0.8573963046073914,
"step": 296
},
{
"epoch": 2.495798319327731,
"grad_norm": 1.749129571326899,
"learning_rate": 1.7783849808331585e-06,
"loss": 0.488,
"mean_token_accuracy": 0.882330060005188,
"step": 297
},
{
"epoch": 2.504201680672269,
"grad_norm": 1.7434863893866612,
"learning_rate": 1.7538053196331988e-06,
"loss": 0.4528,
"mean_token_accuracy": 0.8885789513587952,
"step": 298
},
{
"epoch": 2.5126050420168067,
"grad_norm": 1.8268657961411574,
"learning_rate": 1.729584478363031e-06,
"loss": 0.5059,
"mean_token_accuracy": 0.8760490417480469,
"step": 299
},
{
"epoch": 2.5210084033613445,
"grad_norm": 1.7966988339135452,
"learning_rate": 1.705724776955629e-06,
"loss": 0.5497,
"mean_token_accuracy": 0.8659508228302002,
"step": 300
},
{
"epoch": 2.5294117647058822,
"grad_norm": 1.6853755248345623,
"learning_rate": 1.682228500753083e-06,
"loss": 0.4493,
"mean_token_accuracy": 0.8905779719352722,
"step": 301
},
{
"epoch": 2.53781512605042,
"grad_norm": 1.7040165346823453,
"learning_rate": 1.6590979002877076e-06,
"loss": 0.4613,
"mean_token_accuracy": 0.8883019089698792,
"step": 302
},
{
"epoch": 2.546218487394958,
"grad_norm": 1.6968001110057345,
"learning_rate": 1.636335191066473e-06,
"loss": 0.4533,
"mean_token_accuracy": 0.8894676566123962,
"step": 303
},
{
"epoch": 2.5546218487394956,
"grad_norm": 1.8088482407470852,
"learning_rate": 1.6139425533588055e-06,
"loss": 0.4755,
"mean_token_accuracy": 0.8818231821060181,
"step": 304
},
{
"epoch": 2.5630252100840334,
"grad_norm": 1.8080423623957333,
"learning_rate": 1.591922131987753e-06,
"loss": 0.5279,
"mean_token_accuracy": 0.8711415529251099,
"step": 305
},
{
"epoch": 2.571428571428571,
"grad_norm": 1.6807675642589819,
"learning_rate": 1.5702760361245472e-06,
"loss": 0.5431,
"mean_token_accuracy": 0.8634845614433289,
"step": 306
},
{
"epoch": 2.5798319327731094,
"grad_norm": 1.7843878630443717,
"learning_rate": 1.5490063390865845e-06,
"loss": 0.5302,
"mean_token_accuracy": 0.87076336145401,
"step": 307
},
{
"epoch": 2.588235294117647,
"grad_norm": 1.8299228807610584,
"learning_rate": 1.5281150781388362e-06,
"loss": 0.4958,
"mean_token_accuracy": 0.879771888256073,
"step": 308
},
{
"epoch": 2.596638655462185,
"grad_norm": 1.7345499313976294,
"learning_rate": 1.507604254298714e-06,
"loss": 0.4688,
"mean_token_accuracy": 0.8848387002944946,
"step": 309
},
{
"epoch": 2.6050420168067228,
"grad_norm": 1.7440085831923724,
"learning_rate": 1.4874758321444091e-06,
"loss": 0.5557,
"mean_token_accuracy": 0.8678417205810547,
"step": 310
},
{
"epoch": 2.6134453781512605,
"grad_norm": 1.7622118867050525,
"learning_rate": 1.467731739626721e-06,
"loss": 0.4711,
"mean_token_accuracy": 0.8795005679130554,
"step": 311
},
{
"epoch": 2.6218487394957983,
"grad_norm": 1.7408285994608907,
"learning_rate": 1.44837386788439e-06,
"loss": 0.4393,
"mean_token_accuracy": 0.89531010389328,
"step": 312
},
{
"epoch": 2.630252100840336,
"grad_norm": 1.6936183271117475,
"learning_rate": 1.4294040710629617e-06,
"loss": 0.5008,
"mean_token_accuracy": 0.8742570877075195,
"step": 313
},
{
"epoch": 2.638655462184874,
"grad_norm": 1.7686735948043326,
"learning_rate": 1.410824166137193e-06,
"loss": 0.5115,
"mean_token_accuracy": 0.8729111552238464,
"step": 314
},
{
"epoch": 2.6470588235294117,
"grad_norm": 1.6467546945232723,
"learning_rate": 1.392635932737012e-06,
"loss": 0.4889,
"mean_token_accuracy": 0.876711368560791,
"step": 315
},
{
"epoch": 2.6554621848739495,
"grad_norm": 1.732864583611146,
"learning_rate": 1.3748411129770703e-06,
"loss": 0.5009,
"mean_token_accuracy": 0.8752124905586243,
"step": 316
},
{
"epoch": 2.6638655462184873,
"grad_norm": 1.7439183506320681,
"learning_rate": 1.3574414112898707e-06,
"loss": 0.4682,
"mean_token_accuracy": 0.8827528953552246,
"step": 317
},
{
"epoch": 2.6722689075630255,
"grad_norm": 1.8227721928870744,
"learning_rate": 1.3404384942625152e-06,
"loss": 0.5204,
"mean_token_accuracy": 0.8724432587623596,
"step": 318
},
{
"epoch": 2.6806722689075633,
"grad_norm": 1.7373528828791687,
"learning_rate": 1.323833990477076e-06,
"loss": 0.4701,
"mean_token_accuracy": 0.8856019973754883,
"step": 319
},
{
"epoch": 2.689075630252101,
"grad_norm": 1.7468852153995695,
"learning_rate": 1.3076294903546057e-06,
"loss": 0.5016,
"mean_token_accuracy": 0.8778213858604431,
"step": 320
},
{
"epoch": 2.697478991596639,
"grad_norm": 1.817280481287246,
"learning_rate": 1.2918265460027988e-06,
"loss": 0.4422,
"mean_token_accuracy": 0.893291711807251,
"step": 321
},
{
"epoch": 2.7058823529411766,
"grad_norm": 1.6954515135011916,
"learning_rate": 1.2764266710673335e-06,
"loss": 0.4258,
"mean_token_accuracy": 0.8955129981040955,
"step": 322
},
{
"epoch": 2.7142857142857144,
"grad_norm": 1.7738375580958614,
"learning_rate": 1.261431340586886e-06,
"loss": 0.536,
"mean_token_accuracy": 0.866767942905426,
"step": 323
},
{
"epoch": 2.722689075630252,
"grad_norm": 1.7778545981105411,
"learning_rate": 1.2468419908518489e-06,
"loss": 0.5557,
"mean_token_accuracy": 0.863368809223175,
"step": 324
},
{
"epoch": 2.73109243697479,
"grad_norm": 1.7511974755151039,
"learning_rate": 1.2326600192667612e-06,
"loss": 0.569,
"mean_token_accuracy": 0.8578982949256897,
"step": 325
},
{
"epoch": 2.7394957983193278,
"grad_norm": 1.7650614934750701,
"learning_rate": 1.2188867842164597e-06,
"loss": 0.4642,
"mean_token_accuracy": 0.8880206346511841,
"step": 326
},
{
"epoch": 2.7478991596638656,
"grad_norm": 1.7295018909117994,
"learning_rate": 1.2055236049359689e-06,
"loss": 0.4866,
"mean_token_accuracy": 0.8756598830223083,
"step": 327
},
{
"epoch": 2.7563025210084033,
"grad_norm": 1.715068147392596,
"learning_rate": 1.1925717613841432e-06,
"loss": 0.5014,
"mean_token_accuracy": 0.8752623200416565,
"step": 328
},
{
"epoch": 2.764705882352941,
"grad_norm": 1.7238361196149397,
"learning_rate": 1.1800324941210686e-06,
"loss": 0.4965,
"mean_token_accuracy": 0.8757110834121704,
"step": 329
},
{
"epoch": 2.773109243697479,
"grad_norm": 1.833231298436174,
"learning_rate": 1.1679070041892387e-06,
"loss": 0.4842,
"mean_token_accuracy": 0.8799470067024231,
"step": 330
},
{
"epoch": 2.7815126050420167,
"grad_norm": 1.740678169112491,
"learning_rate": 1.1561964529985143e-06,
"loss": 0.4907,
"mean_token_accuracy": 0.8828567266464233,
"step": 331
},
{
"epoch": 2.7899159663865545,
"grad_norm": 1.8309652165832162,
"learning_rate": 1.1449019622148842e-06,
"loss": 0.5389,
"mean_token_accuracy": 0.869530975818634,
"step": 332
},
{
"epoch": 2.7983193277310923,
"grad_norm": 1.894304195634988,
"learning_rate": 1.134024613653025e-06,
"loss": 0.566,
"mean_token_accuracy": 0.8650041818618774,
"step": 333
},
{
"epoch": 2.80672268907563,
"grad_norm": 1.761316482336543,
"learning_rate": 1.1235654491726853e-06,
"loss": 0.529,
"mean_token_accuracy": 0.868781566619873,
"step": 334
},
{
"epoch": 2.815126050420168,
"grad_norm": 1.8000544542443722,
"learning_rate": 1.1135254705788933e-06,
"loss": 0.5494,
"mean_token_accuracy": 0.8643285036087036,
"step": 335
},
{
"epoch": 2.8235294117647056,
"grad_norm": 1.7905406066253629,
"learning_rate": 1.1039056395259991e-06,
"loss": 0.5052,
"mean_token_accuracy": 0.8782471418380737,
"step": 336
},
{
"epoch": 2.831932773109244,
"grad_norm": 1.7722042771606428,
"learning_rate": 1.0947068774255675e-06,
"loss": 0.4977,
"mean_token_accuracy": 0.875531017780304,
"step": 337
},
{
"epoch": 2.8403361344537816,
"grad_norm": 1.9973830902031495,
"learning_rate": 1.085930065358124e-06,
"loss": 0.4324,
"mean_token_accuracy": 0.8934433460235596,
"step": 338
},
{
"epoch": 2.8487394957983194,
"grad_norm": 1.6896484708992687,
"learning_rate": 1.0775760439887567e-06,
"loss": 0.4953,
"mean_token_accuracy": 0.8801694512367249,
"step": 339
},
{
"epoch": 2.857142857142857,
"grad_norm": 1.7595624086770811,
"learning_rate": 1.0696456134866027e-06,
"loss": 0.5703,
"mean_token_accuracy": 0.8666946291923523,
"step": 340
},
{
"epoch": 2.865546218487395,
"grad_norm": 1.7324834152474125,
"learning_rate": 1.0621395334482023e-06,
"loss": 0.501,
"mean_token_accuracy": 0.8782939910888672,
"step": 341
},
{
"epoch": 2.8739495798319328,
"grad_norm": 1.7494633234405406,
"learning_rate": 1.055058522824742e-06,
"loss": 0.5414,
"mean_token_accuracy": 0.867946207523346,
"step": 342
},
{
"epoch": 2.8823529411764706,
"grad_norm": 1.7043979501327688,
"learning_rate": 1.0484032598531933e-06,
"loss": 0.4072,
"mean_token_accuracy": 0.9014019966125488,
"step": 343
},
{
"epoch": 2.8907563025210083,
"grad_norm": 1.7718012344425826,
"learning_rate": 1.042174381991349e-06,
"loss": 0.4649,
"mean_token_accuracy": 0.8876906037330627,
"step": 344
},
{
"epoch": 2.899159663865546,
"grad_norm": 1.8014581956296338,
"learning_rate": 1.0363724858567655e-06,
"loss": 0.5118,
"mean_token_accuracy": 0.8747749924659729,
"step": 345
},
{
"epoch": 2.907563025210084,
"grad_norm": 1.7277581616143525,
"learning_rate": 1.0309981271696186e-06,
"loss": 0.497,
"mean_token_accuracy": 0.8768202066421509,
"step": 346
},
{
"epoch": 2.9159663865546217,
"grad_norm": 1.6173184552284654,
"learning_rate": 1.0260518206994732e-06,
"loss": 0.5029,
"mean_token_accuracy": 0.8765256404876709,
"step": 347
},
{
"epoch": 2.92436974789916,
"grad_norm": 1.8049758496648165,
"learning_rate": 1.021534040215978e-06,
"loss": 0.5257,
"mean_token_accuracy": 0.8693103790283203,
"step": 348
},
{
"epoch": 2.9327731092436977,
"grad_norm": 1.7473323800131928,
"learning_rate": 1.0174452184434888e-06,
"loss": 0.4879,
"mean_token_accuracy": 0.8786296844482422,
"step": 349
},
{
"epoch": 2.9411764705882355,
"grad_norm": 1.744414604472958,
"learning_rate": 1.0137857470196177e-06,
"loss": 0.4312,
"mean_token_accuracy": 0.8908872008323669,
"step": 350
},
{
"epoch": 2.9495798319327733,
"grad_norm": 1.7551567310461849,
"learning_rate": 1.0105559764577236e-06,
"loss": 0.462,
"mean_token_accuracy": 0.8851808309555054,
"step": 351
},
{
"epoch": 2.957983193277311,
"grad_norm": 1.696209846178712,
"learning_rate": 1.0077562161133376e-06,
"loss": 0.4247,
"mean_token_accuracy": 0.896420955657959,
"step": 352
},
{
"epoch": 2.966386554621849,
"grad_norm": 1.7889797242427938,
"learning_rate": 1.005386734154534e-06,
"loss": 0.4947,
"mean_token_accuracy": 0.8767175078392029,
"step": 353
},
{
"epoch": 2.9747899159663866,
"grad_norm": 1.7759605744443523,
"learning_rate": 1.0034477575362412e-06,
"loss": 0.455,
"mean_token_accuracy": 0.8875412344932556,
"step": 354
},
{
"epoch": 2.9831932773109244,
"grad_norm": 1.7992397002954914,
"learning_rate": 1.0019394719785073e-06,
"loss": 0.4586,
"mean_token_accuracy": 0.8864205479621887,
"step": 355
},
{
"epoch": 2.991596638655462,
"grad_norm": 1.7245167657524767,
"learning_rate": 1.000862021948709e-06,
"loss": 0.4852,
"mean_token_accuracy": 0.8800389766693115,
"step": 356
},
{
"epoch": 3.0,
"grad_norm": 1.5906696719690108,
"learning_rate": 1.0002155106477152e-06,
"loss": 0.4201,
"mean_token_accuracy": 0.8944628834724426,
"step": 357
},
{
"epoch": 3.0,
"step": 357,
"total_flos": 21584411688960.0,
"train_loss": 0.9353465321017247,
"train_runtime": 6466.1821,
"train_samples_per_second": 7.014,
"train_steps_per_second": 0.055
}
],
"logging_steps": 1,
"max_steps": 357,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 21584411688960.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}