error577's picture
Training in progress, step 600, checkpoint
cfc2196 verified
Raw History Blame
107 kB
{
"best_metric": 0.8067082166671753,
"best_model_checkpoint": "miner_id_24/checkpoint-400",
"epoch": 0.06562397462539647,
"eval_steps": 200,
"global_step": 600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00010937329104232747,
"grad_norm": 1.0359435081481934,
"learning_rate": 6.666666666666667e-06,
"loss": 0.7552,
"step": 1
},
{
"epoch": 0.00010937329104232747,
"eval_loss": 0.7747385501861572,
"eval_runtime": 40.8616,
"eval_samples_per_second": 18.012,
"eval_steps_per_second": 4.503,
"step": 1
},
{
"epoch": 0.00021874658208465494,
"grad_norm": 0.957185685634613,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.4443,
"step": 2
},
{
"epoch": 0.00032811987312698237,
"grad_norm": 1.1346784830093384,
"learning_rate": 2e-05,
"loss": 0.8643,
"step": 3
},
{
"epoch": 0.0004374931641693099,
"grad_norm": 0.9469565749168396,
"learning_rate": 2.6666666666666667e-05,
"loss": 0.7323,
"step": 4
},
{
"epoch": 0.0005468664552116373,
"grad_norm": 0.7470714449882507,
"learning_rate": 3.3333333333333335e-05,
"loss": 0.7802,
"step": 5
},
{
"epoch": 0.0006562397462539647,
"grad_norm": 0.9336181282997131,
"learning_rate": 4e-05,
"loss": 0.7257,
"step": 6
},
{
"epoch": 0.0007656130372962922,
"grad_norm": 1.0791195631027222,
"learning_rate": 4.666666666666667e-05,
"loss": 0.8429,
"step": 7
},
{
"epoch": 0.0008749863283386198,
"grad_norm": 0.7835611701011658,
"learning_rate": 5.333333333333333e-05,
"loss": 0.6867,
"step": 8
},
{
"epoch": 0.0009843596193809471,
"grad_norm": 0.97986900806427,
"learning_rate": 6e-05,
"loss": 1.344,
"step": 9
},
{
"epoch": 0.0010937329104232746,
"grad_norm": 0.7541531920433044,
"learning_rate": 6.666666666666667e-05,
"loss": 1.0589,
"step": 10
},
{
"epoch": 0.001203106201465602,
"grad_norm": 0.9011327624320984,
"learning_rate": 7.333333333333333e-05,
"loss": 0.9204,
"step": 11
},
{
"epoch": 0.0013124794925079295,
"grad_norm": 0.73972088098526,
"learning_rate": 8e-05,
"loss": 0.5648,
"step": 12
},
{
"epoch": 0.001421852783550257,
"grad_norm": 0.8409032225608826,
"learning_rate": 8.666666666666667e-05,
"loss": 0.7085,
"step": 13
},
{
"epoch": 0.0015312260745925844,
"grad_norm": 0.7147814035415649,
"learning_rate": 9.333333333333334e-05,
"loss": 0.5697,
"step": 14
},
{
"epoch": 0.0016405993656349119,
"grad_norm": 1.2943480014801025,
"learning_rate": 0.0001,
"loss": 0.5326,
"step": 15
},
{
"epoch": 0.0017499726566772395,
"grad_norm": 1.0381604433059692,
"learning_rate": 0.00010666666666666667,
"loss": 0.6035,
"step": 16
},
{
"epoch": 0.001859345947719567,
"grad_norm": 1.241224765777588,
"learning_rate": 0.00011333333333333334,
"loss": 0.8444,
"step": 17
},
{
"epoch": 0.0019687192387618942,
"grad_norm": 1.2240588665008545,
"learning_rate": 0.00012,
"loss": 1.2189,
"step": 18
},
{
"epoch": 0.002078092529804222,
"grad_norm": 0.6758236885070801,
"learning_rate": 0.00012666666666666666,
"loss": 0.8096,
"step": 19
},
{
"epoch": 0.002187465820846549,
"grad_norm": 0.9755652546882629,
"learning_rate": 0.00013333333333333334,
"loss": 0.7745,
"step": 20
},
{
"epoch": 0.002296839111888877,
"grad_norm": 0.9789362549781799,
"learning_rate": 0.00014,
"loss": 0.8419,
"step": 21
},
{
"epoch": 0.002406212402931204,
"grad_norm": 1.243459939956665,
"learning_rate": 0.00014666666666666666,
"loss": 0.6975,
"step": 22
},
{
"epoch": 0.0025155856939735317,
"grad_norm": 1.1147222518920898,
"learning_rate": 0.00015333333333333334,
"loss": 1.0447,
"step": 23
},
{
"epoch": 0.002624958985015859,
"grad_norm": 0.7549237012863159,
"learning_rate": 0.00016,
"loss": 0.8227,
"step": 24
},
{
"epoch": 0.0027343322760581866,
"grad_norm": 0.9991783499717712,
"learning_rate": 0.0001666666666666667,
"loss": 0.7753,
"step": 25
},
{
"epoch": 0.002843705567100514,
"grad_norm": 0.8530986309051514,
"learning_rate": 0.00017333333333333334,
"loss": 1.0104,
"step": 26
},
{
"epoch": 0.0029530788581428415,
"grad_norm": 1.0823960304260254,
"learning_rate": 0.00018,
"loss": 0.6805,
"step": 27
},
{
"epoch": 0.003062452149185169,
"grad_norm": 1.1649422645568848,
"learning_rate": 0.0001866666666666667,
"loss": 0.651,
"step": 28
},
{
"epoch": 0.0031718254402274965,
"grad_norm": 1.153540849685669,
"learning_rate": 0.00019333333333333333,
"loss": 0.6845,
"step": 29
},
{
"epoch": 0.0032811987312698237,
"grad_norm": 1.0849957466125488,
"learning_rate": 0.0002,
"loss": 0.843,
"step": 30
},
{
"epoch": 0.0033905720223121514,
"grad_norm": 1.088346242904663,
"learning_rate": 0.00019999999934264446,
"loss": 0.7297,
"step": 31
},
{
"epoch": 0.003499945313354479,
"grad_norm": 0.8655444979667664,
"learning_rate": 0.00019999999737057786,
"loss": 0.8366,
"step": 32
},
{
"epoch": 0.0036093186043968063,
"grad_norm": 0.9512057900428772,
"learning_rate": 0.00019999999408380027,
"loss": 0.5827,
"step": 33
},
{
"epoch": 0.003718691895439134,
"grad_norm": 0.9010905623435974,
"learning_rate": 0.0001999999894823116,
"loss": 0.9626,
"step": 34
},
{
"epoch": 0.003828065186481461,
"grad_norm": 0.8122968077659607,
"learning_rate": 0.00019999998356611204,
"loss": 0.9244,
"step": 35
},
{
"epoch": 0.0039374384775237884,
"grad_norm": 1.0451189279556274,
"learning_rate": 0.00019999997633520162,
"loss": 0.8667,
"step": 36
},
{
"epoch": 0.004046811768566116,
"grad_norm": 0.9873628616333008,
"learning_rate": 0.00019999996778958046,
"loss": 0.6803,
"step": 37
},
{
"epoch": 0.004156185059608444,
"grad_norm": 0.9295932650566101,
"learning_rate": 0.00019999995792924864,
"loss": 0.6587,
"step": 38
},
{
"epoch": 0.0042655583506507715,
"grad_norm": 0.9532923102378845,
"learning_rate": 0.00019999994675420628,
"loss": 0.7123,
"step": 39
},
{
"epoch": 0.004374931641693098,
"grad_norm": 0.8833261132240295,
"learning_rate": 0.00019999993426445358,
"loss": 0.6655,
"step": 40
},
{
"epoch": 0.004484304932735426,
"grad_norm": 0.7765618562698364,
"learning_rate": 0.00019999992045999067,
"loss": 0.6227,
"step": 41
},
{
"epoch": 0.004593678223777754,
"grad_norm": 1.0266915559768677,
"learning_rate": 0.0001999999053408177,
"loss": 0.9985,
"step": 42
},
{
"epoch": 0.004703051514820081,
"grad_norm": 0.7699204683303833,
"learning_rate": 0.00019999988890693492,
"loss": 0.8645,
"step": 43
},
{
"epoch": 0.004812424805862408,
"grad_norm": 1.003393292427063,
"learning_rate": 0.00019999987115834253,
"loss": 0.8971,
"step": 44
},
{
"epoch": 0.004921798096904736,
"grad_norm": 0.8142101168632507,
"learning_rate": 0.0001999998520950408,
"loss": 0.7234,
"step": 45
},
{
"epoch": 0.0050311713879470634,
"grad_norm": 1.3098042011260986,
"learning_rate": 0.0001999998317170299,
"loss": 0.8737,
"step": 46
},
{
"epoch": 0.005140544678989391,
"grad_norm": 0.8643680214881897,
"learning_rate": 0.00019999981002431015,
"loss": 0.8877,
"step": 47
},
{
"epoch": 0.005249917970031718,
"grad_norm": 0.873254120349884,
"learning_rate": 0.00019999978701688183,
"loss": 0.6834,
"step": 48
},
{
"epoch": 0.005359291261074046,
"grad_norm": 0.8523358106613159,
"learning_rate": 0.00019999976269474522,
"loss": 0.887,
"step": 49
},
{
"epoch": 0.005468664552116373,
"grad_norm": 1.0463756322860718,
"learning_rate": 0.00019999973705790068,
"loss": 0.6026,
"step": 50
},
{
"epoch": 0.005578037843158701,
"grad_norm": 0.9958584308624268,
"learning_rate": 0.00019999971010634853,
"loss": 0.8893,
"step": 51
},
{
"epoch": 0.005687411134201028,
"grad_norm": 1.0434130430221558,
"learning_rate": 0.0001999996818400891,
"loss": 0.8421,
"step": 52
},
{
"epoch": 0.005796784425243355,
"grad_norm": 0.917728841304779,
"learning_rate": 0.0001999996522591228,
"loss": 0.6586,
"step": 53
},
{
"epoch": 0.005906157716285683,
"grad_norm": 0.8328091502189636,
"learning_rate": 0.00019999962136345,
"loss": 0.8971,
"step": 54
},
{
"epoch": 0.006015531007328011,
"grad_norm": 1.2430554628372192,
"learning_rate": 0.0001999995891530711,
"loss": 1.0108,
"step": 55
},
{
"epoch": 0.006124904298370338,
"grad_norm": 0.9426673054695129,
"learning_rate": 0.00019999955562798654,
"loss": 0.9291,
"step": 56
},
{
"epoch": 0.006234277589412665,
"grad_norm": 1.0275059938430786,
"learning_rate": 0.00019999952078819674,
"loss": 1.0881,
"step": 57
},
{
"epoch": 0.006343650880454993,
"grad_norm": 1.0648664236068726,
"learning_rate": 0.00019999948463370217,
"loss": 0.7744,
"step": 58
},
{
"epoch": 0.006453024171497321,
"grad_norm": 0.9224843382835388,
"learning_rate": 0.00019999944716450328,
"loss": 0.8151,
"step": 59
},
{
"epoch": 0.006562397462539647,
"grad_norm": 0.9548549652099609,
"learning_rate": 0.00019999940838060062,
"loss": 0.8695,
"step": 60
},
{
"epoch": 0.006671770753581975,
"grad_norm": 0.9503769874572754,
"learning_rate": 0.00019999936828199468,
"loss": 0.7061,
"step": 61
},
{
"epoch": 0.006781144044624303,
"grad_norm": 1.0756902694702148,
"learning_rate": 0.00019999932686868595,
"loss": 0.5131,
"step": 62
},
{
"epoch": 0.00689051733566663,
"grad_norm": 0.9061060547828674,
"learning_rate": 0.00019999928414067499,
"loss": 1.0903,
"step": 63
},
{
"epoch": 0.006999890626708958,
"grad_norm": 1.2045193910598755,
"learning_rate": 0.0001999992400979624,
"loss": 0.7959,
"step": 64
},
{
"epoch": 0.007109263917751285,
"grad_norm": 0.785504162311554,
"learning_rate": 0.0001999991947405487,
"loss": 1.067,
"step": 65
},
{
"epoch": 0.007218637208793613,
"grad_norm": 0.8506015539169312,
"learning_rate": 0.00019999914806843454,
"loss": 1.0416,
"step": 66
},
{
"epoch": 0.00732801049983594,
"grad_norm": 1.103265404701233,
"learning_rate": 0.00019999910008162048,
"loss": 0.5667,
"step": 67
},
{
"epoch": 0.007437383790878268,
"grad_norm": 0.9666427969932556,
"learning_rate": 0.0001999990507801072,
"loss": 0.7017,
"step": 68
},
{
"epoch": 0.007546757081920595,
"grad_norm": 0.7427759170532227,
"learning_rate": 0.0001999990001638953,
"loss": 1.0521,
"step": 69
},
{
"epoch": 0.007656130372962922,
"grad_norm": 1.2603650093078613,
"learning_rate": 0.00019999894823298552,
"loss": 0.7703,
"step": 70
},
{
"epoch": 0.00776550366400525,
"grad_norm": 1.3171355724334717,
"learning_rate": 0.00019999889498737848,
"loss": 0.7608,
"step": 71
},
{
"epoch": 0.007874876955047577,
"grad_norm": 0.9187859892845154,
"learning_rate": 0.0001999988404270749,
"loss": 0.9708,
"step": 72
},
{
"epoch": 0.007984250246089905,
"grad_norm": 0.8871030807495117,
"learning_rate": 0.0001999987845520755,
"loss": 0.8331,
"step": 73
},
{
"epoch": 0.008093623537132232,
"grad_norm": 0.8429688811302185,
"learning_rate": 0.00019999872736238097,
"loss": 1.0762,
"step": 74
},
{
"epoch": 0.008202996828174559,
"grad_norm": 0.8408651351928711,
"learning_rate": 0.0001999986688579921,
"loss": 0.6704,
"step": 75
},
{
"epoch": 0.008312370119216888,
"grad_norm": 0.7103726267814636,
"learning_rate": 0.0001999986090389097,
"loss": 0.8437,
"step": 76
},
{
"epoch": 0.008421743410259214,
"grad_norm": 1.084578275680542,
"learning_rate": 0.00019999854790513452,
"loss": 0.7259,
"step": 77
},
{
"epoch": 0.008531116701301543,
"grad_norm": 0.8537347316741943,
"learning_rate": 0.0001999984854566673,
"loss": 0.8551,
"step": 78
},
{
"epoch": 0.00864048999234387,
"grad_norm": 1.005993366241455,
"learning_rate": 0.00019999842169350897,
"loss": 0.9122,
"step": 79
},
{
"epoch": 0.008749863283386197,
"grad_norm": 1.0594606399536133,
"learning_rate": 0.00019999835661566032,
"loss": 0.7878,
"step": 80
},
{
"epoch": 0.008859236574428525,
"grad_norm": 0.9891486763954163,
"learning_rate": 0.00019999829022312218,
"loss": 0.9339,
"step": 81
},
{
"epoch": 0.008968609865470852,
"grad_norm": 1.752136468887329,
"learning_rate": 0.00019999822251589547,
"loss": 0.637,
"step": 82
},
{
"epoch": 0.009077983156513179,
"grad_norm": 1.3982586860656738,
"learning_rate": 0.00019999815349398104,
"loss": 0.8485,
"step": 83
},
{
"epoch": 0.009187356447555507,
"grad_norm": 1.1201657056808472,
"learning_rate": 0.00019999808315737983,
"loss": 0.8483,
"step": 84
},
{
"epoch": 0.009296729738597834,
"grad_norm": 1.1798042058944702,
"learning_rate": 0.00019999801150609271,
"loss": 1.1654,
"step": 85
},
{
"epoch": 0.009406103029640163,
"grad_norm": 1.119722843170166,
"learning_rate": 0.00019999793854012072,
"loss": 0.9427,
"step": 86
},
{
"epoch": 0.00951547632068249,
"grad_norm": 1.9652173519134521,
"learning_rate": 0.0001999978642594647,
"loss": 1.0173,
"step": 87
},
{
"epoch": 0.009624849611724816,
"grad_norm": 0.8673993349075317,
"learning_rate": 0.00019999778866412572,
"loss": 0.843,
"step": 88
},
{
"epoch": 0.009734222902767145,
"grad_norm": 0.9615687727928162,
"learning_rate": 0.00019999771175410475,
"loss": 1.0409,
"step": 89
},
{
"epoch": 0.009843596193809472,
"grad_norm": 0.9303264021873474,
"learning_rate": 0.00019999763352940278,
"loss": 1.0045,
"step": 90
},
{
"epoch": 0.009952969484851798,
"grad_norm": 1.1048322916030884,
"learning_rate": 0.00019999755399002087,
"loss": 0.9833,
"step": 91
},
{
"epoch": 0.010062342775894127,
"grad_norm": 0.7181215286254883,
"learning_rate": 0.00019999747313596003,
"loss": 0.8382,
"step": 92
},
{
"epoch": 0.010171716066936454,
"grad_norm": 1.0009384155273438,
"learning_rate": 0.00019999739096722134,
"loss": 0.8917,
"step": 93
},
{
"epoch": 0.010281089357978782,
"grad_norm": 0.7550287842750549,
"learning_rate": 0.00019999730748380588,
"loss": 0.9104,
"step": 94
},
{
"epoch": 0.010390462649021109,
"grad_norm": 1.126756191253662,
"learning_rate": 0.00019999722268571475,
"loss": 0.8792,
"step": 95
},
{
"epoch": 0.010499835940063436,
"grad_norm": 1.0714164972305298,
"learning_rate": 0.00019999713657294907,
"loss": 0.9516,
"step": 96
},
{
"epoch": 0.010609209231105764,
"grad_norm": 1.324127197265625,
"learning_rate": 0.00019999704914550997,
"loss": 0.997,
"step": 97
},
{
"epoch": 0.010718582522148091,
"grad_norm": 0.8866165280342102,
"learning_rate": 0.00019999696040339857,
"loss": 0.7956,
"step": 98
},
{
"epoch": 0.01082795581319042,
"grad_norm": 0.9012518525123596,
"learning_rate": 0.00019999687034661607,
"loss": 0.9225,
"step": 99
},
{
"epoch": 0.010937329104232747,
"grad_norm": 0.7945853471755981,
"learning_rate": 0.00019999677897516364,
"loss": 1.1462,
"step": 100
},
{
"epoch": 0.011046702395275073,
"grad_norm": 1.0762516260147095,
"learning_rate": 0.0001999966862890425,
"loss": 0.8994,
"step": 101
},
{
"epoch": 0.011156075686317402,
"grad_norm": 0.872011661529541,
"learning_rate": 0.00019999659228825384,
"loss": 1.169,
"step": 102
},
{
"epoch": 0.011265448977359729,
"grad_norm": 1.1329362392425537,
"learning_rate": 0.0001999964969727989,
"loss": 0.6135,
"step": 103
},
{
"epoch": 0.011374822268402056,
"grad_norm": 1.047389268875122,
"learning_rate": 0.00019999640034267898,
"loss": 1.0515,
"step": 104
},
{
"epoch": 0.011484195559444384,
"grad_norm": 1.3864418268203735,
"learning_rate": 0.00019999630239789527,
"loss": 0.6238,
"step": 105
},
{
"epoch": 0.01159356885048671,
"grad_norm": 0.9831883311271667,
"learning_rate": 0.00019999620313844915,
"loss": 1.1318,
"step": 106
},
{
"epoch": 0.01170294214152904,
"grad_norm": 1.0314894914627075,
"learning_rate": 0.00019999610256434184,
"loss": 0.7566,
"step": 107
},
{
"epoch": 0.011812315432571366,
"grad_norm": 1.4733610153198242,
"learning_rate": 0.00019999600067557472,
"loss": 0.7978,
"step": 108
},
{
"epoch": 0.011921688723613693,
"grad_norm": 0.9159018993377686,
"learning_rate": 0.0001999958974721491,
"loss": 0.8544,
"step": 109
},
{
"epoch": 0.012031062014656022,
"grad_norm": 0.8146981596946716,
"learning_rate": 0.00019999579295406635,
"loss": 0.5639,
"step": 110
},
{
"epoch": 0.012140435305698348,
"grad_norm": 0.8243168592453003,
"learning_rate": 0.0001999956871213278,
"loss": 0.7903,
"step": 111
},
{
"epoch": 0.012249808596740675,
"grad_norm": 0.980814516544342,
"learning_rate": 0.00019999557997393494,
"loss": 1.01,
"step": 112
},
{
"epoch": 0.012359181887783004,
"grad_norm": 1.437961459159851,
"learning_rate": 0.0001999954715118891,
"loss": 0.8245,
"step": 113
},
{
"epoch": 0.01246855517882533,
"grad_norm": 1.483574390411377,
"learning_rate": 0.0001999953617351917,
"loss": 0.9152,
"step": 114
},
{
"epoch": 0.012577928469867659,
"grad_norm": 0.9745296835899353,
"learning_rate": 0.00019999525064384423,
"loss": 0.7377,
"step": 115
},
{
"epoch": 0.012687301760909986,
"grad_norm": 1.2854357957839966,
"learning_rate": 0.00019999513823784813,
"loss": 1.0215,
"step": 116
},
{
"epoch": 0.012796675051952313,
"grad_norm": 1.4880210161209106,
"learning_rate": 0.00019999502451720487,
"loss": 0.6604,
"step": 117
},
{
"epoch": 0.012906048342994641,
"grad_norm": 1.0523297786712646,
"learning_rate": 0.00019999490948191594,
"loss": 0.8873,
"step": 118
},
{
"epoch": 0.013015421634036968,
"grad_norm": 1.0283764600753784,
"learning_rate": 0.0001999947931319829,
"loss": 0.8407,
"step": 119
},
{
"epoch": 0.013124794925079295,
"grad_norm": 1.0384728908538818,
"learning_rate": 0.0001999946754674072,
"loss": 0.9039,
"step": 120
},
{
"epoch": 0.013234168216121623,
"grad_norm": 0.8750423789024353,
"learning_rate": 0.00019999455648819049,
"loss": 1.0058,
"step": 121
},
{
"epoch": 0.01334354150716395,
"grad_norm": 0.8427900075912476,
"learning_rate": 0.00019999443619433423,
"loss": 1.0078,
"step": 122
},
{
"epoch": 0.013452914798206279,
"grad_norm": 1.3203353881835938,
"learning_rate": 0.00019999431458584004,
"loss": 0.8924,
"step": 123
},
{
"epoch": 0.013562288089248606,
"grad_norm": 0.7723014950752258,
"learning_rate": 0.00019999419166270954,
"loss": 0.8432,
"step": 124
},
{
"epoch": 0.013671661380290932,
"grad_norm": 0.9909713864326477,
"learning_rate": 0.00019999406742494434,
"loss": 0.8528,
"step": 125
},
{
"epoch": 0.01378103467133326,
"grad_norm": 1.0303891897201538,
"learning_rate": 0.00019999394187254606,
"loss": 0.6699,
"step": 126
},
{
"epoch": 0.013890407962375588,
"grad_norm": 0.8098687529563904,
"learning_rate": 0.00019999381500551632,
"loss": 1.0615,
"step": 127
},
{
"epoch": 0.013999781253417916,
"grad_norm": 0.8698800206184387,
"learning_rate": 0.00019999368682385686,
"loss": 0.7004,
"step": 128
},
{
"epoch": 0.014109154544460243,
"grad_norm": 1.163340449333191,
"learning_rate": 0.00019999355732756936,
"loss": 0.7752,
"step": 129
},
{
"epoch": 0.01421852783550257,
"grad_norm": 1.1491297483444214,
"learning_rate": 0.00019999342651665542,
"loss": 1.0112,
"step": 130
},
{
"epoch": 0.014327901126544898,
"grad_norm": 0.7571056485176086,
"learning_rate": 0.00019999329439111688,
"loss": 1.0722,
"step": 131
},
{
"epoch": 0.014437274417587225,
"grad_norm": 1.1919002532958984,
"learning_rate": 0.00019999316095095542,
"loss": 0.7939,
"step": 132
},
{
"epoch": 0.014546647708629552,
"grad_norm": 1.0839415788650513,
"learning_rate": 0.0001999930261961728,
"loss": 0.7247,
"step": 133
},
{
"epoch": 0.01465602099967188,
"grad_norm": 1.123969316482544,
"learning_rate": 0.00019999289012677079,
"loss": 0.7543,
"step": 134
},
{
"epoch": 0.014765394290714207,
"grad_norm": 1.1143224239349365,
"learning_rate": 0.0001999927527427512,
"loss": 1.0124,
"step": 135
},
{
"epoch": 0.014874767581756536,
"grad_norm": 1.0003845691680908,
"learning_rate": 0.00019999261404411579,
"loss": 0.7766,
"step": 136
},
{
"epoch": 0.014984140872798863,
"grad_norm": 1.154555082321167,
"learning_rate": 0.00019999247403086642,
"loss": 0.8062,
"step": 137
},
{
"epoch": 0.01509351416384119,
"grad_norm": 1.1724870204925537,
"learning_rate": 0.00019999233270300492,
"loss": 0.7935,
"step": 138
},
{
"epoch": 0.015202887454883518,
"grad_norm": 0.812342643737793,
"learning_rate": 0.00019999219006053317,
"loss": 0.7218,
"step": 139
},
{
"epoch": 0.015312260745925845,
"grad_norm": 1.1357048749923706,
"learning_rate": 0.00019999204610345302,
"loss": 0.7117,
"step": 140
},
{
"epoch": 0.015421634036968172,
"grad_norm": 0.9869748950004578,
"learning_rate": 0.0001999919008317664,
"loss": 0.9765,
"step": 141
},
{
"epoch": 0.0155310073280105,
"grad_norm": 0.977894127368927,
"learning_rate": 0.00019999175424547513,
"loss": 0.7474,
"step": 142
},
{
"epoch": 0.01564038061905283,
"grad_norm": 0.9802875518798828,
"learning_rate": 0.00019999160634458124,
"loss": 0.7464,
"step": 143
},
{
"epoch": 0.015749753910095154,
"grad_norm": 0.8524045348167419,
"learning_rate": 0.0001999914571290866,
"loss": 0.7183,
"step": 144
},
{
"epoch": 0.015859127201137482,
"grad_norm": 1.2041178941726685,
"learning_rate": 0.0001999913065989932,
"loss": 0.8245,
"step": 145
},
{
"epoch": 0.01596850049217981,
"grad_norm": 1.451375126838684,
"learning_rate": 0.00019999115475430304,
"loss": 0.8932,
"step": 146
},
{
"epoch": 0.016077873783222136,
"grad_norm": 0.8621544241905212,
"learning_rate": 0.00019999100159501812,
"loss": 1.1615,
"step": 147
},
{
"epoch": 0.016187247074264464,
"grad_norm": 1.1287329196929932,
"learning_rate": 0.00019999084712114042,
"loss": 1.1429,
"step": 148
},
{
"epoch": 0.016296620365306793,
"grad_norm": 1.1720576286315918,
"learning_rate": 0.00019999069133267195,
"loss": 0.5356,
"step": 149
},
{
"epoch": 0.016405993656349118,
"grad_norm": 0.7974927425384521,
"learning_rate": 0.00019999053422961482,
"loss": 1.082,
"step": 150
},
{
"epoch": 0.016515366947391447,
"grad_norm": 0.86858731508255,
"learning_rate": 0.00019999037581197108,
"loss": 0.7021,
"step": 151
},
{
"epoch": 0.016624740238433775,
"grad_norm": 0.8884678483009338,
"learning_rate": 0.00019999021607974276,
"loss": 0.8077,
"step": 152
},
{
"epoch": 0.0167341135294761,
"grad_norm": 1.3161729574203491,
"learning_rate": 0.00019999005503293203,
"loss": 0.6789,
"step": 153
},
{
"epoch": 0.01684348682051843,
"grad_norm": 1.1194474697113037,
"learning_rate": 0.00019998989267154093,
"loss": 0.8708,
"step": 154
},
{
"epoch": 0.016952860111560757,
"grad_norm": 1.1400177478790283,
"learning_rate": 0.0001999897289955717,
"loss": 0.8416,
"step": 155
},
{
"epoch": 0.017062233402603086,
"grad_norm": 1.155961513519287,
"learning_rate": 0.0001999895640050264,
"loss": 0.9628,
"step": 156
},
{
"epoch": 0.01717160669364541,
"grad_norm": 1.5118356943130493,
"learning_rate": 0.00019998939769990727,
"loss": 0.9591,
"step": 157
},
{
"epoch": 0.01728097998468774,
"grad_norm": 1.029440999031067,
"learning_rate": 0.0001999892300802164,
"loss": 0.5659,
"step": 158
},
{
"epoch": 0.017390353275730068,
"grad_norm": 1.3784666061401367,
"learning_rate": 0.00019998906114595608,
"loss": 1.018,
"step": 159
},
{
"epoch": 0.017499726566772393,
"grad_norm": 0.9848626852035522,
"learning_rate": 0.00019998889089712849,
"loss": 0.8016,
"step": 160
},
{
"epoch": 0.01760909985781472,
"grad_norm": 1.188879132270813,
"learning_rate": 0.0001999887193337359,
"loss": 1.2011,
"step": 161
},
{
"epoch": 0.01771847314885705,
"grad_norm": 0.9314888119697571,
"learning_rate": 0.00019998854645578057,
"loss": 0.7455,
"step": 162
},
{
"epoch": 0.017827846439899375,
"grad_norm": 1.001659870147705,
"learning_rate": 0.00019998837226326469,
"loss": 1.033,
"step": 163
},
{
"epoch": 0.017937219730941704,
"grad_norm": 1.4195637702941895,
"learning_rate": 0.00019998819675619064,
"loss": 0.8527,
"step": 164
},
{
"epoch": 0.018046593021984032,
"grad_norm": 0.8885000944137573,
"learning_rate": 0.00019998801993456069,
"loss": 0.6358,
"step": 165
},
{
"epoch": 0.018155966313026357,
"grad_norm": 1.070360779762268,
"learning_rate": 0.0001999878417983772,
"loss": 0.7843,
"step": 166
},
{
"epoch": 0.018265339604068686,
"grad_norm": 1.1388875246047974,
"learning_rate": 0.00019998766234764247,
"loss": 0.9364,
"step": 167
},
{
"epoch": 0.018374712895111014,
"grad_norm": 2.4844179153442383,
"learning_rate": 0.00019998748158235884,
"loss": 0.6608,
"step": 168
},
{
"epoch": 0.018484086186153343,
"grad_norm": 1.0103005170822144,
"learning_rate": 0.00019998729950252876,
"loss": 0.7691,
"step": 169
},
{
"epoch": 0.018593459477195668,
"grad_norm": 0.9184209704399109,
"learning_rate": 0.00019998711610815458,
"loss": 0.914,
"step": 170
},
{
"epoch": 0.018702832768237997,
"grad_norm": 1.0094612836837769,
"learning_rate": 0.00019998693139923867,
"loss": 0.9174,
"step": 171
},
{
"epoch": 0.018812206059280325,
"grad_norm": 0.7898897528648376,
"learning_rate": 0.00019998674537578353,
"loss": 0.9579,
"step": 172
},
{
"epoch": 0.01892157935032265,
"grad_norm": 1.0184580087661743,
"learning_rate": 0.00019998655803779163,
"loss": 0.8242,
"step": 173
},
{
"epoch": 0.01903095264136498,
"grad_norm": 1.002568244934082,
"learning_rate": 0.00019998636938526533,
"loss": 0.9002,
"step": 174
},
{
"epoch": 0.019140325932407307,
"grad_norm": 0.7966347932815552,
"learning_rate": 0.00019998617941820716,
"loss": 1.0177,
"step": 175
},
{
"epoch": 0.019249699223449632,
"grad_norm": 1.333112359046936,
"learning_rate": 0.00019998598813661964,
"loss": 0.6221,
"step": 176
},
{
"epoch": 0.01935907251449196,
"grad_norm": 1.2348626852035522,
"learning_rate": 0.00019998579554050526,
"loss": 0.6833,
"step": 177
},
{
"epoch": 0.01946844580553429,
"grad_norm": 1.1256965398788452,
"learning_rate": 0.00019998560162986655,
"loss": 0.9427,
"step": 178
},
{
"epoch": 0.019577819096576615,
"grad_norm": 1.006744146347046,
"learning_rate": 0.00019998540640470608,
"loss": 0.8733,
"step": 179
},
{
"epoch": 0.019687192387618943,
"grad_norm": 0.9952765107154846,
"learning_rate": 0.00019998520986502636,
"loss": 0.8656,
"step": 180
},
{
"epoch": 0.01979656567866127,
"grad_norm": 0.9037217497825623,
"learning_rate": 0.00019998501201083004,
"loss": 0.9612,
"step": 181
},
{
"epoch": 0.019905938969703597,
"grad_norm": 1.0065454244613647,
"learning_rate": 0.0001999848128421197,
"loss": 0.7898,
"step": 182
},
{
"epoch": 0.020015312260745925,
"grad_norm": 1.0890108346939087,
"learning_rate": 0.00019998461235889797,
"loss": 0.7269,
"step": 183
},
{
"epoch": 0.020124685551788254,
"grad_norm": 1.2539864778518677,
"learning_rate": 0.00019998441056116745,
"loss": 0.7934,
"step": 184
},
{
"epoch": 0.020234058842830582,
"grad_norm": 0.9602129459381104,
"learning_rate": 0.00019998420744893084,
"loss": 0.549,
"step": 185
},
{
"epoch": 0.020343432133872907,
"grad_norm": 1.4105061292648315,
"learning_rate": 0.00019998400302219076,
"loss": 1.005,
"step": 186
},
{
"epoch": 0.020452805424915236,
"grad_norm": 1.430650234222412,
"learning_rate": 0.0001999837972809499,
"loss": 0.7051,
"step": 187
},
{
"epoch": 0.020562178715957564,
"grad_norm": 1.191211223602295,
"learning_rate": 0.00019998359022521106,
"loss": 0.7129,
"step": 188
},
{
"epoch": 0.02067155200699989,
"grad_norm": 0.9433074593544006,
"learning_rate": 0.00019998338185497682,
"loss": 0.7383,
"step": 189
},
{
"epoch": 0.020780925298042218,
"grad_norm": 1.2458714246749878,
"learning_rate": 0.00019998317217025005,
"loss": 0.7533,
"step": 190
},
{
"epoch": 0.020890298589084547,
"grad_norm": 1.443598747253418,
"learning_rate": 0.00019998296117103341,
"loss": 0.7505,
"step": 191
},
{
"epoch": 0.02099967188012687,
"grad_norm": 0.9617491364479065,
"learning_rate": 0.00019998274885732971,
"loss": 0.8154,
"step": 192
},
{
"epoch": 0.0211090451711692,
"grad_norm": 1.0256359577178955,
"learning_rate": 0.00019998253522914174,
"loss": 0.8709,
"step": 193
},
{
"epoch": 0.02121841846221153,
"grad_norm": 1.1407520771026611,
"learning_rate": 0.0001999823202864723,
"loss": 1.0066,
"step": 194
},
{
"epoch": 0.021327791753253854,
"grad_norm": 0.9075395464897156,
"learning_rate": 0.00019998210402932424,
"loss": 0.7433,
"step": 195
},
{
"epoch": 0.021437165044296182,
"grad_norm": 1.1892637014389038,
"learning_rate": 0.0001999818864577004,
"loss": 0.6049,
"step": 196
},
{
"epoch": 0.02154653833533851,
"grad_norm": 1.0141085386276245,
"learning_rate": 0.0001999816675716036,
"loss": 1.0684,
"step": 197
},
{
"epoch": 0.02165591162638084,
"grad_norm": 1.0636556148529053,
"learning_rate": 0.00019998144737103682,
"loss": 1.0034,
"step": 198
},
{
"epoch": 0.021765284917423165,
"grad_norm": 0.9643628597259521,
"learning_rate": 0.0001999812258560028,
"loss": 0.9938,
"step": 199
},
{
"epoch": 0.021874658208465493,
"grad_norm": 0.9733682870864868,
"learning_rate": 0.00019998100302650457,
"loss": 1.0145,
"step": 200
},
{
"epoch": 0.021874658208465493,
"eval_loss": 0.8068432807922363,
"eval_runtime": 40.9547,
"eval_samples_per_second": 17.971,
"eval_steps_per_second": 4.493,
"step": 200
},
{
"epoch": 0.02198403149950782,
"grad_norm": 0.89620041847229,
"learning_rate": 0.00019998077888254501,
"loss": 0.8309,
"step": 201
},
{
"epoch": 0.022093404790550147,
"grad_norm": 1.041070580482483,
"learning_rate": 0.0001999805534241271,
"loss": 0.8251,
"step": 202
},
{
"epoch": 0.022202778081592475,
"grad_norm": 0.8770344853401184,
"learning_rate": 0.00019998032665125378,
"loss": 0.9149,
"step": 203
},
{
"epoch": 0.022312151372634804,
"grad_norm": 0.9978107810020447,
"learning_rate": 0.000199980098563928,
"loss": 0.8845,
"step": 204
},
{
"epoch": 0.02242152466367713,
"grad_norm": 1.1167197227478027,
"learning_rate": 0.00019997986916215284,
"loss": 0.9254,
"step": 205
},
{
"epoch": 0.022530897954719457,
"grad_norm": 1.0514531135559082,
"learning_rate": 0.00019997963844593127,
"loss": 0.8273,
"step": 206
},
{
"epoch": 0.022640271245761786,
"grad_norm": 1.027596116065979,
"learning_rate": 0.0001999794064152663,
"loss": 0.867,
"step": 207
},
{
"epoch": 0.02274964453680411,
"grad_norm": 1.3077362775802612,
"learning_rate": 0.00019997917307016102,
"loss": 0.9528,
"step": 208
},
{
"epoch": 0.02285901782784644,
"grad_norm": 1.2617202997207642,
"learning_rate": 0.0001999789384106185,
"loss": 0.4163,
"step": 209
},
{
"epoch": 0.022968391118888768,
"grad_norm": 1.9169830083847046,
"learning_rate": 0.00019997870243664177,
"loss": 0.8746,
"step": 210
},
{
"epoch": 0.023077764409931093,
"grad_norm": 0.9455872774124146,
"learning_rate": 0.00019997846514823396,
"loss": 0.9282,
"step": 211
},
{
"epoch": 0.02318713770097342,
"grad_norm": 1.0044574737548828,
"learning_rate": 0.00019997822654539826,
"loss": 0.8485,
"step": 212
},
{
"epoch": 0.02329651099201575,
"grad_norm": 0.9601938128471375,
"learning_rate": 0.00019997798662813772,
"loss": 0.6501,
"step": 213
},
{
"epoch": 0.02340588428305808,
"grad_norm": 0.7503620982170105,
"learning_rate": 0.0001999777453964555,
"loss": 0.9953,
"step": 214
},
{
"epoch": 0.023515257574100404,
"grad_norm": 0.8733282685279846,
"learning_rate": 0.0001999775028503548,
"loss": 0.7488,
"step": 215
},
{
"epoch": 0.023624630865142732,
"grad_norm": 1.1373885869979858,
"learning_rate": 0.00019997725898983883,
"loss": 0.8603,
"step": 216
},
{
"epoch": 0.02373400415618506,
"grad_norm": 1.1404668092727661,
"learning_rate": 0.00019997701381491072,
"loss": 0.8454,
"step": 217
},
{
"epoch": 0.023843377447227386,
"grad_norm": 0.7852329015731812,
"learning_rate": 0.00019997676732557378,
"loss": 0.5155,
"step": 218
},
{
"epoch": 0.023952750738269715,
"grad_norm": 0.6994953751564026,
"learning_rate": 0.0001999765195218312,
"loss": 0.8015,
"step": 219
},
{
"epoch": 0.024062124029312043,
"grad_norm": 1.1219515800476074,
"learning_rate": 0.00019997627040368622,
"loss": 0.94,
"step": 220
},
{
"epoch": 0.024171497320354368,
"grad_norm": 1.3120551109313965,
"learning_rate": 0.00019997601997114218,
"loss": 0.9221,
"step": 221
},
{
"epoch": 0.024280870611396697,
"grad_norm": 1.1464701890945435,
"learning_rate": 0.00019997576822420232,
"loss": 0.6533,
"step": 222
},
{
"epoch": 0.024390243902439025,
"grad_norm": 0.9645900726318359,
"learning_rate": 0.00019997551516286999,
"loss": 1.0048,
"step": 223
},
{
"epoch": 0.02449961719348135,
"grad_norm": 0.811614990234375,
"learning_rate": 0.0001999752607871485,
"loss": 1.1218,
"step": 224
},
{
"epoch": 0.02460899048452368,
"grad_norm": 1.0914621353149414,
"learning_rate": 0.0001999750050970411,
"loss": 0.765,
"step": 225
},
{
"epoch": 0.024718363775566007,
"grad_norm": 1.0596243143081665,
"learning_rate": 0.00019997474809255135,
"loss": 1.0341,
"step": 226
},
{
"epoch": 0.024827737066608336,
"grad_norm": 1.055033564567566,
"learning_rate": 0.00019997448977368247,
"loss": 0.6386,
"step": 227
},
{
"epoch": 0.02493711035765066,
"grad_norm": 0.9922929406166077,
"learning_rate": 0.0001999742301404379,
"loss": 0.7942,
"step": 228
},
{
"epoch": 0.02504648364869299,
"grad_norm": 1.2093638181686401,
"learning_rate": 0.00019997396919282107,
"loss": 0.8164,
"step": 229
},
{
"epoch": 0.025155856939735318,
"grad_norm": 1.3952484130859375,
"learning_rate": 0.0001999737069308354,
"loss": 0.8928,
"step": 230
},
{
"epoch": 0.025265230230777643,
"grad_norm": 0.9438846707344055,
"learning_rate": 0.00019997344335448433,
"loss": 0.6457,
"step": 231
},
{
"epoch": 0.02537460352181997,
"grad_norm": 0.7343907952308655,
"learning_rate": 0.00019997317846377134,
"loss": 0.8762,
"step": 232
},
{
"epoch": 0.0254839768128623,
"grad_norm": 1.0288769006729126,
"learning_rate": 0.00019997291225869987,
"loss": 0.7636,
"step": 233
},
{
"epoch": 0.025593350103904625,
"grad_norm": 1.232852578163147,
"learning_rate": 0.00019997264473927347,
"loss": 0.6876,
"step": 234
},
{
"epoch": 0.025702723394946954,
"grad_norm": 1.0084220170974731,
"learning_rate": 0.00019997237590549567,
"loss": 0.8275,
"step": 235
},
{
"epoch": 0.025812096685989282,
"grad_norm": 1.7499910593032837,
"learning_rate": 0.00019997210575736999,
"loss": 1.1544,
"step": 236
},
{
"epoch": 0.025921469977031607,
"grad_norm": 0.9005192518234253,
"learning_rate": 0.00019997183429489992,
"loss": 0.9512,
"step": 237
},
{
"epoch": 0.026030843268073936,
"grad_norm": 1.054895281791687,
"learning_rate": 0.0001999715615180891,
"loss": 0.7701,
"step": 238
},
{
"epoch": 0.026140216559116265,
"grad_norm": 0.9881554245948792,
"learning_rate": 0.00019997128742694107,
"loss": 0.9372,
"step": 239
},
{
"epoch": 0.02624958985015859,
"grad_norm": 0.9707517027854919,
"learning_rate": 0.00019997101202145947,
"loss": 0.978,
"step": 240
},
{
"epoch": 0.026358963141200918,
"grad_norm": 1.2869802713394165,
"learning_rate": 0.0001999707353016479,
"loss": 1.1234,
"step": 241
},
{
"epoch": 0.026468336432243247,
"grad_norm": 1.2063279151916504,
"learning_rate": 0.00019997045726751001,
"loss": 0.7118,
"step": 242
},
{
"epoch": 0.026577709723285575,
"grad_norm": 0.9686263799667358,
"learning_rate": 0.00019997017791904947,
"loss": 0.8869,
"step": 243
},
{
"epoch": 0.0266870830143279,
"grad_norm": 0.963753342628479,
"learning_rate": 0.00019996989725626992,
"loss": 0.8479,
"step": 244
},
{
"epoch": 0.02679645630537023,
"grad_norm": 0.8817402720451355,
"learning_rate": 0.00019996961527917506,
"loss": 0.5295,
"step": 245
},
{
"epoch": 0.026905829596412557,
"grad_norm": 1.706606149673462,
"learning_rate": 0.00019996933198776858,
"loss": 0.7777,
"step": 246
},
{
"epoch": 0.027015202887454882,
"grad_norm": 0.8349090814590454,
"learning_rate": 0.00019996904738205426,
"loss": 0.836,
"step": 247
},
{
"epoch": 0.02712457617849721,
"grad_norm": 0.9602643251419067,
"learning_rate": 0.00019996876146203578,
"loss": 1.0578,
"step": 248
},
{
"epoch": 0.02723394946953954,
"grad_norm": 0.8937216401100159,
"learning_rate": 0.00019996847422771693,
"loss": 0.8529,
"step": 249
},
{
"epoch": 0.027343322760581865,
"grad_norm": 0.9380630254745483,
"learning_rate": 0.00019996818567910148,
"loss": 0.8573,
"step": 250
},
{
"epoch": 0.027452696051624193,
"grad_norm": 1.332655668258667,
"learning_rate": 0.00019996789581619323,
"loss": 0.629,
"step": 251
},
{
"epoch": 0.02756206934266652,
"grad_norm": 1.4816393852233887,
"learning_rate": 0.000199967604638996,
"loss": 0.7475,
"step": 252
},
{
"epoch": 0.027671442633708847,
"grad_norm": 1.049055814743042,
"learning_rate": 0.0001999673121475136,
"loss": 0.7129,
"step": 253
},
{
"epoch": 0.027780815924751175,
"grad_norm": 1.3890293836593628,
"learning_rate": 0.00019996701834174986,
"loss": 1.0256,
"step": 254
},
{
"epoch": 0.027890189215793504,
"grad_norm": 1.0529813766479492,
"learning_rate": 0.00019996672322170867,
"loss": 1.0666,
"step": 255
},
{
"epoch": 0.027999562506835832,
"grad_norm": 0.8624351024627686,
"learning_rate": 0.0001999664267873939,
"loss": 0.6948,
"step": 256
},
{
"epoch": 0.028108935797878157,
"grad_norm": 0.8577688336372375,
"learning_rate": 0.00019996612903880947,
"loss": 0.82,
"step": 257
},
{
"epoch": 0.028218309088920486,
"grad_norm": 0.8573757410049438,
"learning_rate": 0.00019996582997595924,
"loss": 0.8273,
"step": 258
},
{
"epoch": 0.028327682379962815,
"grad_norm": 1.2395519018173218,
"learning_rate": 0.0001999655295988472,
"loss": 0.8064,
"step": 259
},
{
"epoch": 0.02843705567100514,
"grad_norm": 0.8964936137199402,
"learning_rate": 0.00019996522790747726,
"loss": 0.7224,
"step": 260
},
{
"epoch": 0.028546428962047468,
"grad_norm": 0.9282931685447693,
"learning_rate": 0.00019996492490185341,
"loss": 0.9585,
"step": 261
},
{
"epoch": 0.028655802253089797,
"grad_norm": 1.1618013381958008,
"learning_rate": 0.00019996462058197962,
"loss": 0.7717,
"step": 262
},
{
"epoch": 0.028765175544132122,
"grad_norm": 0.9413585662841797,
"learning_rate": 0.00019996431494785993,
"loss": 0.7748,
"step": 263
},
{
"epoch": 0.02887454883517445,
"grad_norm": 1.3444674015045166,
"learning_rate": 0.0001999640079994983,
"loss": 1.0287,
"step": 264
},
{
"epoch": 0.02898392212621678,
"grad_norm": 1.3082046508789062,
"learning_rate": 0.00019996369973689876,
"loss": 0.7817,
"step": 265
},
{
"epoch": 0.029093295417259104,
"grad_norm": 1.4798815250396729,
"learning_rate": 0.0001999633901600654,
"loss": 0.791,
"step": 266
},
{
"epoch": 0.029202668708301432,
"grad_norm": 1.3128074407577515,
"learning_rate": 0.00019996307926900233,
"loss": 0.9972,
"step": 267
},
{
"epoch": 0.02931204199934376,
"grad_norm": 1.3363100290298462,
"learning_rate": 0.00019996276706371355,
"loss": 0.7227,
"step": 268
},
{
"epoch": 0.029421415290386086,
"grad_norm": 1.2146847248077393,
"learning_rate": 0.00019996245354420323,
"loss": 0.7839,
"step": 269
},
{
"epoch": 0.029530788581428415,
"grad_norm": 1.0506778955459595,
"learning_rate": 0.00019996213871047543,
"loss": 0.8816,
"step": 270
},
{
"epoch": 0.029640161872470743,
"grad_norm": 1.0352805852890015,
"learning_rate": 0.00019996182256253435,
"loss": 0.9029,
"step": 271
},
{
"epoch": 0.02974953516351307,
"grad_norm": 1.319678544998169,
"learning_rate": 0.00019996150510038412,
"loss": 1.0377,
"step": 272
},
{
"epoch": 0.029858908454555397,
"grad_norm": 1.0857889652252197,
"learning_rate": 0.00019996118632402892,
"loss": 0.8303,
"step": 273
},
{
"epoch": 0.029968281745597725,
"grad_norm": 1.0412633419036865,
"learning_rate": 0.00019996086623347292,
"loss": 0.7897,
"step": 274
},
{
"epoch": 0.030077655036640054,
"grad_norm": 0.9532299637794495,
"learning_rate": 0.00019996054482872036,
"loss": 0.834,
"step": 275
},
{
"epoch": 0.03018702832768238,
"grad_norm": 1.0339388847351074,
"learning_rate": 0.00019996022210977543,
"loss": 0.8657,
"step": 276
},
{
"epoch": 0.030296401618724707,
"grad_norm": 0.7535502910614014,
"learning_rate": 0.00019995989807664242,
"loss": 0.8136,
"step": 277
},
{
"epoch": 0.030405774909767036,
"grad_norm": 1.1453170776367188,
"learning_rate": 0.00019995957272932554,
"loss": 0.6857,
"step": 278
},
{
"epoch": 0.03051514820080936,
"grad_norm": 1.1806614398956299,
"learning_rate": 0.0001999592460678291,
"loss": 0.9984,
"step": 279
},
{
"epoch": 0.03062452149185169,
"grad_norm": 1.112640142440796,
"learning_rate": 0.0001999589180921574,
"loss": 0.761,
"step": 280
},
{
"epoch": 0.030733894782894018,
"grad_norm": 1.4966400861740112,
"learning_rate": 0.0001999585888023147,
"loss": 0.8953,
"step": 281
},
{
"epoch": 0.030843268073936343,
"grad_norm": 1.293006420135498,
"learning_rate": 0.0001999582581983054,
"loss": 1.0241,
"step": 282
},
{
"epoch": 0.030952641364978672,
"grad_norm": 1.177804946899414,
"learning_rate": 0.0001999579262801338,
"loss": 0.5965,
"step": 283
},
{
"epoch": 0.031062014656021,
"grad_norm": 0.9398424029350281,
"learning_rate": 0.0001999575930478043,
"loss": 1.0178,
"step": 284
},
{
"epoch": 0.03117138794706333,
"grad_norm": 1.0919867753982544,
"learning_rate": 0.00019995725850132122,
"loss": 0.9371,
"step": 285
},
{
"epoch": 0.03128076123810566,
"grad_norm": 1.0972379446029663,
"learning_rate": 0.000199956922640689,
"loss": 0.962,
"step": 286
},
{
"epoch": 0.03139013452914798,
"grad_norm": 1.2337533235549927,
"learning_rate": 0.00019995658546591205,
"loss": 1.1587,
"step": 287
},
{
"epoch": 0.03149950782019031,
"grad_norm": 0.93784499168396,
"learning_rate": 0.00019995624697699484,
"loss": 0.7551,
"step": 288
},
{
"epoch": 0.03160888111123264,
"grad_norm": 0.9531101584434509,
"learning_rate": 0.00019995590717394177,
"loss": 0.8181,
"step": 289
},
{
"epoch": 0.031718254402274965,
"grad_norm": 1.0460001230239868,
"learning_rate": 0.00019995556605675733,
"loss": 1.0045,
"step": 290
},
{
"epoch": 0.03182762769331729,
"grad_norm": 1.0514802932739258,
"learning_rate": 0.00019995522362544597,
"loss": 0.6646,
"step": 291
},
{
"epoch": 0.03193700098435962,
"grad_norm": 1.0225249528884888,
"learning_rate": 0.0001999548798800122,
"loss": 0.8103,
"step": 292
},
{
"epoch": 0.03204637427540195,
"grad_norm": 0.8883015513420105,
"learning_rate": 0.0001999545348204606,
"loss": 1.0488,
"step": 293
},
{
"epoch": 0.03215574756644427,
"grad_norm": 0.8221065998077393,
"learning_rate": 0.00019995418844679565,
"loss": 0.7915,
"step": 294
},
{
"epoch": 0.032265120857486604,
"grad_norm": 0.8032001852989197,
"learning_rate": 0.00019995384075902192,
"loss": 0.7785,
"step": 295
},
{
"epoch": 0.03237449414852893,
"grad_norm": 1.0787360668182373,
"learning_rate": 0.00019995349175714399,
"loss": 0.6105,
"step": 296
},
{
"epoch": 0.032483867439571254,
"grad_norm": 1.3346359729766846,
"learning_rate": 0.00019995314144116642,
"loss": 0.8981,
"step": 297
},
{
"epoch": 0.032593240730613586,
"grad_norm": 1.1637407541275024,
"learning_rate": 0.00019995278981109382,
"loss": 0.6765,
"step": 298
},
{
"epoch": 0.03270261402165591,
"grad_norm": 1.3199541568756104,
"learning_rate": 0.00019995243686693085,
"loss": 0.896,
"step": 299
},
{
"epoch": 0.032811987312698236,
"grad_norm": 1.139554738998413,
"learning_rate": 0.00019995208260868211,
"loss": 0.865,
"step": 300
},
{
"epoch": 0.03292136060374057,
"grad_norm": 1.1647419929504395,
"learning_rate": 0.00019995172703635232,
"loss": 0.7797,
"step": 301
},
{
"epoch": 0.03303073389478289,
"grad_norm": 0.7142788767814636,
"learning_rate": 0.00019995137014994606,
"loss": 0.8755,
"step": 302
},
{
"epoch": 0.03314010718582522,
"grad_norm": 0.908873438835144,
"learning_rate": 0.00019995101194946808,
"loss": 0.9655,
"step": 303
},
{
"epoch": 0.03324948047686755,
"grad_norm": 1.0069727897644043,
"learning_rate": 0.0001999506524349231,
"loss": 0.9139,
"step": 304
},
{
"epoch": 0.033358853767909875,
"grad_norm": 0.8300521373748779,
"learning_rate": 0.0001999502916063158,
"loss": 0.9362,
"step": 305
},
{
"epoch": 0.0334682270589522,
"grad_norm": 1.2162195444107056,
"learning_rate": 0.00019994992946365098,
"loss": 0.7641,
"step": 306
},
{
"epoch": 0.03357760034999453,
"grad_norm": 0.970177173614502,
"learning_rate": 0.00019994956600693335,
"loss": 0.9676,
"step": 307
},
{
"epoch": 0.03368697364103686,
"grad_norm": 0.9938404560089111,
"learning_rate": 0.00019994920123616772,
"loss": 0.8936,
"step": 308
},
{
"epoch": 0.03379634693207919,
"grad_norm": 1.2428972721099854,
"learning_rate": 0.00019994883515135888,
"loss": 0.885,
"step": 309
},
{
"epoch": 0.033905720223121515,
"grad_norm": 0.8554952144622803,
"learning_rate": 0.00019994846775251161,
"loss": 1.0265,
"step": 310
},
{
"epoch": 0.03401509351416384,
"grad_norm": 0.9248100519180298,
"learning_rate": 0.00019994809903963078,
"loss": 0.9309,
"step": 311
},
{
"epoch": 0.03412446680520617,
"grad_norm": 1.1711786985397339,
"learning_rate": 0.00019994772901272124,
"loss": 0.867,
"step": 312
},
{
"epoch": 0.0342338400962485,
"grad_norm": 1.6409622430801392,
"learning_rate": 0.00019994735767178785,
"loss": 1.0833,
"step": 313
},
{
"epoch": 0.03434321338729082,
"grad_norm": 1.0994210243225098,
"learning_rate": 0.00019994698501683546,
"loss": 0.9876,
"step": 314
},
{
"epoch": 0.034452586678333154,
"grad_norm": 1.307111144065857,
"learning_rate": 0.00019994661104786901,
"loss": 1.1115,
"step": 315
},
{
"epoch": 0.03456195996937548,
"grad_norm": 1.2924015522003174,
"learning_rate": 0.0001999462357648934,
"loss": 0.7232,
"step": 316
},
{
"epoch": 0.034671333260417804,
"grad_norm": 0.8390319347381592,
"learning_rate": 0.00019994585916791353,
"loss": 0.8054,
"step": 317
},
{
"epoch": 0.034780706551460136,
"grad_norm": 1.4466496706008911,
"learning_rate": 0.0001999454812569344,
"loss": 0.8531,
"step": 318
},
{
"epoch": 0.03489007984250246,
"grad_norm": 0.805334746837616,
"learning_rate": 0.000199945102031961,
"loss": 0.7877,
"step": 319
},
{
"epoch": 0.034999453133544786,
"grad_norm": 0.8856577277183533,
"learning_rate": 0.00019994472149299823,
"loss": 1.0711,
"step": 320
},
{
"epoch": 0.03510882642458712,
"grad_norm": 1.0543880462646484,
"learning_rate": 0.00019994433964005116,
"loss": 0.6526,
"step": 321
},
{
"epoch": 0.03521819971562944,
"grad_norm": 0.9808034896850586,
"learning_rate": 0.0001999439564731248,
"loss": 0.6553,
"step": 322
},
{
"epoch": 0.03532757300667177,
"grad_norm": 1.1530299186706543,
"learning_rate": 0.00019994357199222418,
"loss": 0.8814,
"step": 323
},
{
"epoch": 0.0354369462977141,
"grad_norm": 1.1313234567642212,
"learning_rate": 0.00019994318619735434,
"loss": 0.73,
"step": 324
},
{
"epoch": 0.035546319588756425,
"grad_norm": 1.1225991249084473,
"learning_rate": 0.00019994279908852036,
"loss": 0.8988,
"step": 325
},
{
"epoch": 0.03565569287979875,
"grad_norm": 1.2102971076965332,
"learning_rate": 0.00019994241066572735,
"loss": 0.6714,
"step": 326
},
{
"epoch": 0.03576506617084108,
"grad_norm": 1.3862812519073486,
"learning_rate": 0.0001999420209289804,
"loss": 0.6208,
"step": 327
},
{
"epoch": 0.03587443946188341,
"grad_norm": 1.3298919200897217,
"learning_rate": 0.00019994162987828465,
"loss": 0.9615,
"step": 328
},
{
"epoch": 0.03598381275292573,
"grad_norm": 1.1198225021362305,
"learning_rate": 0.00019994123751364523,
"loss": 0.8243,
"step": 329
},
{
"epoch": 0.036093186043968065,
"grad_norm": 1.2356019020080566,
"learning_rate": 0.00019994084383506726,
"loss": 0.9731,
"step": 330
},
{
"epoch": 0.03620255933501039,
"grad_norm": 1.9511923789978027,
"learning_rate": 0.00019994044884255596,
"loss": 0.8388,
"step": 331
},
{
"epoch": 0.036311932626052715,
"grad_norm": 0.8875001072883606,
"learning_rate": 0.00019994005253611653,
"loss": 1.0167,
"step": 332
},
{
"epoch": 0.03642130591709505,
"grad_norm": 1.0356827974319458,
"learning_rate": 0.00019993965491575414,
"loss": 0.7601,
"step": 333
},
{
"epoch": 0.03653067920813737,
"grad_norm": 1.9006911516189575,
"learning_rate": 0.00019993925598147408,
"loss": 0.8644,
"step": 334
},
{
"epoch": 0.0366400524991797,
"grad_norm": 1.149804711341858,
"learning_rate": 0.00019993885573328153,
"loss": 0.7937,
"step": 335
},
{
"epoch": 0.03674942579022203,
"grad_norm": 1.0978573560714722,
"learning_rate": 0.00019993845417118176,
"loss": 0.9806,
"step": 336
},
{
"epoch": 0.036858799081264354,
"grad_norm": 1.353148341178894,
"learning_rate": 0.0001999380512951801,
"loss": 0.6028,
"step": 337
},
{
"epoch": 0.036968172372306686,
"grad_norm": 1.0444083213806152,
"learning_rate": 0.00019993764710528184,
"loss": 0.674,
"step": 338
},
{
"epoch": 0.03707754566334901,
"grad_norm": 0.7757420539855957,
"learning_rate": 0.00019993724160149222,
"loss": 0.937,
"step": 339
},
{
"epoch": 0.037186918954391336,
"grad_norm": 0.8659959435462952,
"learning_rate": 0.00019993683478381665,
"loss": 1.0106,
"step": 340
},
{
"epoch": 0.03729629224543367,
"grad_norm": 0.8398618698120117,
"learning_rate": 0.00019993642665226046,
"loss": 0.7869,
"step": 341
},
{
"epoch": 0.03740566553647599,
"grad_norm": 0.8791778087615967,
"learning_rate": 0.00019993601720682898,
"loss": 0.903,
"step": 342
},
{
"epoch": 0.03751503882751832,
"grad_norm": 1.330810785293579,
"learning_rate": 0.0001999356064475276,
"loss": 0.6288,
"step": 343
},
{
"epoch": 0.03762441211856065,
"grad_norm": 1.0563044548034668,
"learning_rate": 0.00019993519437436176,
"loss": 0.5645,
"step": 344
},
{
"epoch": 0.037733785409602975,
"grad_norm": 1.2644983530044556,
"learning_rate": 0.00019993478098733687,
"loss": 0.8415,
"step": 345
},
{
"epoch": 0.0378431587006453,
"grad_norm": 0.8137854337692261,
"learning_rate": 0.00019993436628645833,
"loss": 1.0094,
"step": 346
},
{
"epoch": 0.03795253199168763,
"grad_norm": 1.2424585819244385,
"learning_rate": 0.0001999339502717316,
"loss": 0.7191,
"step": 347
},
{
"epoch": 0.03806190528272996,
"grad_norm": 1.3705171346664429,
"learning_rate": 0.0001999335329431622,
"loss": 0.5286,
"step": 348
},
{
"epoch": 0.03817127857377228,
"grad_norm": 1.1841068267822266,
"learning_rate": 0.00019993311430075553,
"loss": 0.5205,
"step": 349
},
{
"epoch": 0.038280651864814615,
"grad_norm": 1.2048940658569336,
"learning_rate": 0.00019993269434451718,
"loss": 0.9276,
"step": 350
},
{
"epoch": 0.03839002515585694,
"grad_norm": 1.2034653425216675,
"learning_rate": 0.0001999322730744526,
"loss": 0.7758,
"step": 351
},
{
"epoch": 0.038499398446899265,
"grad_norm": 1.435682773590088,
"learning_rate": 0.00019993185049056738,
"loss": 0.8242,
"step": 352
},
{
"epoch": 0.0386087717379416,
"grad_norm": 1.1770561933517456,
"learning_rate": 0.0001999314265928671,
"loss": 0.9822,
"step": 353
},
{
"epoch": 0.03871814502898392,
"grad_norm": 0.7326700687408447,
"learning_rate": 0.00019993100138135725,
"loss": 0.8557,
"step": 354
},
{
"epoch": 0.03882751832002625,
"grad_norm": 1.003616213798523,
"learning_rate": 0.00019993057485604348,
"loss": 0.6837,
"step": 355
},
{
"epoch": 0.03893689161106858,
"grad_norm": 1.0169602632522583,
"learning_rate": 0.00019993014701693134,
"loss": 0.9012,
"step": 356
},
{
"epoch": 0.039046264902110904,
"grad_norm": 1.0350092649459839,
"learning_rate": 0.00019992971786402653,
"loss": 0.867,
"step": 357
},
{
"epoch": 0.03915563819315323,
"grad_norm": 1.0841048955917358,
"learning_rate": 0.00019992928739733464,
"loss": 0.4754,
"step": 358
},
{
"epoch": 0.03926501148419556,
"grad_norm": 1.2736769914627075,
"learning_rate": 0.00019992885561686134,
"loss": 0.9531,
"step": 359
},
{
"epoch": 0.039374384775237886,
"grad_norm": 0.9346782565116882,
"learning_rate": 0.00019992842252261232,
"loss": 0.6625,
"step": 360
},
{
"epoch": 0.03948375806628021,
"grad_norm": 0.9822466373443604,
"learning_rate": 0.00019992798811459327,
"loss": 0.9554,
"step": 361
},
{
"epoch": 0.03959313135732254,
"grad_norm": 1.0642709732055664,
"learning_rate": 0.0001999275523928099,
"loss": 0.8168,
"step": 362
},
{
"epoch": 0.03970250464836487,
"grad_norm": 1.0021849870681763,
"learning_rate": 0.00019992711535726793,
"loss": 0.7259,
"step": 363
},
{
"epoch": 0.03981187793940719,
"grad_norm": 1.1150245666503906,
"learning_rate": 0.00019992667700797313,
"loss": 1.01,
"step": 364
},
{
"epoch": 0.039921251230449525,
"grad_norm": 1.0754119157791138,
"learning_rate": 0.00019992623734493118,
"loss": 1.0127,
"step": 365
},
{
"epoch": 0.04003062452149185,
"grad_norm": 0.9095409512519836,
"learning_rate": 0.000199925796368148,
"loss": 0.818,
"step": 366
},
{
"epoch": 0.04013999781253418,
"grad_norm": 1.5074443817138672,
"learning_rate": 0.00019992535407762927,
"loss": 0.7231,
"step": 367
},
{
"epoch": 0.04024937110357651,
"grad_norm": 1.306563377380371,
"learning_rate": 0.00019992491047338086,
"loss": 0.8003,
"step": 368
},
{
"epoch": 0.04035874439461883,
"grad_norm": 1.491228699684143,
"learning_rate": 0.00019992446555540857,
"loss": 0.9417,
"step": 369
},
{
"epoch": 0.040468117685661165,
"grad_norm": 1.25246262550354,
"learning_rate": 0.0001999240193237183,
"loss": 0.6386,
"step": 370
},
{
"epoch": 0.04057749097670349,
"grad_norm": 0.9611380100250244,
"learning_rate": 0.00019992357177831587,
"loss": 1.0323,
"step": 371
},
{
"epoch": 0.040686864267745815,
"grad_norm": 0.857864260673523,
"learning_rate": 0.00019992312291920716,
"loss": 1.1258,
"step": 372
},
{
"epoch": 0.04079623755878815,
"grad_norm": 0.9377604722976685,
"learning_rate": 0.00019992267274639814,
"loss": 0.9012,
"step": 373
},
{
"epoch": 0.04090561084983047,
"grad_norm": 1.0209131240844727,
"learning_rate": 0.0001999222212598946,
"loss": 0.8956,
"step": 374
},
{
"epoch": 0.0410149841408728,
"grad_norm": 0.9510963559150696,
"learning_rate": 0.00019992176845970262,
"loss": 0.7232,
"step": 375
},
{
"epoch": 0.04112435743191513,
"grad_norm": 1.049834132194519,
"learning_rate": 0.00019992131434582808,
"loss": 0.9097,
"step": 376
},
{
"epoch": 0.041233730722957454,
"grad_norm": 1.051466464996338,
"learning_rate": 0.00019992085891827694,
"loss": 0.8074,
"step": 377
},
{
"epoch": 0.04134310401399978,
"grad_norm": 1.0262120962142944,
"learning_rate": 0.00019992040217705525,
"loss": 0.8217,
"step": 378
},
{
"epoch": 0.04145247730504211,
"grad_norm": 0.8663240075111389,
"learning_rate": 0.0001999199441221689,
"loss": 0.8464,
"step": 379
},
{
"epoch": 0.041561850596084436,
"grad_norm": 0.9827305674552917,
"learning_rate": 0.000199919484753624,
"loss": 0.6206,
"step": 380
},
{
"epoch": 0.04167122388712676,
"grad_norm": 1.5495073795318604,
"learning_rate": 0.0001999190240714266,
"loss": 1.0151,
"step": 381
},
{
"epoch": 0.04178059717816909,
"grad_norm": 1.396231770515442,
"learning_rate": 0.0001999185620755827,
"loss": 0.8768,
"step": 382
},
{
"epoch": 0.04188997046921142,
"grad_norm": 1.0921934843063354,
"learning_rate": 0.00019991809876609843,
"loss": 0.8875,
"step": 383
},
{
"epoch": 0.04199934376025374,
"grad_norm": 1.064682126045227,
"learning_rate": 0.00019991763414297983,
"loss": 0.6536,
"step": 384
},
{
"epoch": 0.042108717051296075,
"grad_norm": 1.0808131694793701,
"learning_rate": 0.00019991716820623304,
"loss": 0.785,
"step": 385
},
{
"epoch": 0.0422180903423384,
"grad_norm": 1.0913347005844116,
"learning_rate": 0.0001999167009558642,
"loss": 0.6544,
"step": 386
},
{
"epoch": 0.042327463633380726,
"grad_norm": 1.3865599632263184,
"learning_rate": 0.0001999162323918794,
"loss": 0.8173,
"step": 387
},
{
"epoch": 0.04243683692442306,
"grad_norm": 1.3333287239074707,
"learning_rate": 0.00019991576251428487,
"loss": 0.9835,
"step": 388
},
{
"epoch": 0.04254621021546538,
"grad_norm": 0.8037435412406921,
"learning_rate": 0.0001999152913230867,
"loss": 0.931,
"step": 389
},
{
"epoch": 0.04265558350650771,
"grad_norm": 0.8408225774765015,
"learning_rate": 0.00019991481881829115,
"loss": 0.88,
"step": 390
},
{
"epoch": 0.04276495679755004,
"grad_norm": 1.035088062286377,
"learning_rate": 0.00019991434499990442,
"loss": 0.9706,
"step": 391
},
{
"epoch": 0.042874330088592365,
"grad_norm": 1.2629435062408447,
"learning_rate": 0.00019991386986793273,
"loss": 0.7752,
"step": 392
},
{
"epoch": 0.04298370337963469,
"grad_norm": 1.078934669494629,
"learning_rate": 0.00019991339342238234,
"loss": 0.4815,
"step": 393
},
{
"epoch": 0.04309307667067702,
"grad_norm": 0.8836020231246948,
"learning_rate": 0.0001999129156632595,
"loss": 0.9411,
"step": 394
},
{
"epoch": 0.04320244996171935,
"grad_norm": 1.166883945465088,
"learning_rate": 0.00019991243659057045,
"loss": 0.6927,
"step": 395
},
{
"epoch": 0.04331182325276168,
"grad_norm": 1.344340443611145,
"learning_rate": 0.0001999119562043216,
"loss": 0.9603,
"step": 396
},
{
"epoch": 0.043421196543804004,
"grad_norm": 0.9963370561599731,
"learning_rate": 0.0001999114745045192,
"loss": 1.0529,
"step": 397
},
{
"epoch": 0.04353056983484633,
"grad_norm": 1.1938830614089966,
"learning_rate": 0.00019991099149116955,
"loss": 0.9239,
"step": 398
},
{
"epoch": 0.04363994312588866,
"grad_norm": 1.109154462814331,
"learning_rate": 0.00019991050716427903,
"loss": 1.0685,
"step": 399
},
{
"epoch": 0.043749316416930986,
"grad_norm": 0.9188171625137329,
"learning_rate": 0.00019991002152385402,
"loss": 1.0147,
"step": 400
},
{
"epoch": 0.043749316416930986,
"eval_loss": 0.8067082166671753,
"eval_runtime": 40.9342,
"eval_samples_per_second": 17.98,
"eval_steps_per_second": 4.495,
"step": 400
},
{
"epoch": 0.04385868970797331,
"grad_norm": 0.9638638496398926,
"learning_rate": 0.00019990953456990092,
"loss": 0.9062,
"step": 401
},
{
"epoch": 0.04396806299901564,
"grad_norm": 1.0281591415405273,
"learning_rate": 0.00019990904630242607,
"loss": 0.9666,
"step": 402
},
{
"epoch": 0.04407743629005797,
"grad_norm": 1.0092509984970093,
"learning_rate": 0.00019990855672143596,
"loss": 0.6308,
"step": 403
},
{
"epoch": 0.04418680958110029,
"grad_norm": 0.9775615334510803,
"learning_rate": 0.00019990806582693697,
"loss": 0.7727,
"step": 404
},
{
"epoch": 0.044296182872142625,
"grad_norm": 1.1057891845703125,
"learning_rate": 0.0001999075736189356,
"loss": 1.2195,
"step": 405
},
{
"epoch": 0.04440555616318495,
"grad_norm": 1.8804906606674194,
"learning_rate": 0.0001999070800974383,
"loss": 0.9471,
"step": 406
},
{
"epoch": 0.044514929454227276,
"grad_norm": 0.916015088558197,
"learning_rate": 0.00019990658526245153,
"loss": 0.7251,
"step": 407
},
{
"epoch": 0.04462430274526961,
"grad_norm": 1.1240051984786987,
"learning_rate": 0.00019990608911398184,
"loss": 1.0191,
"step": 408
},
{
"epoch": 0.04473367603631193,
"grad_norm": 0.9934580326080322,
"learning_rate": 0.00019990559165203572,
"loss": 1.0016,
"step": 409
},
{
"epoch": 0.04484304932735426,
"grad_norm": 0.9659127593040466,
"learning_rate": 0.00019990509287661973,
"loss": 1.0285,
"step": 410
},
{
"epoch": 0.04495242261839659,
"grad_norm": 0.8822170495986938,
"learning_rate": 0.00019990459278774046,
"loss": 1.0685,
"step": 411
},
{
"epoch": 0.045061795909438915,
"grad_norm": 1.0471923351287842,
"learning_rate": 0.00019990409138540441,
"loss": 0.8328,
"step": 412
},
{
"epoch": 0.04517116920048124,
"grad_norm": 1.1356496810913086,
"learning_rate": 0.0001999035886696182,
"loss": 0.9262,
"step": 413
},
{
"epoch": 0.04528054249152357,
"grad_norm": 0.9098622798919678,
"learning_rate": 0.00019990308464038848,
"loss": 0.6382,
"step": 414
},
{
"epoch": 0.0453899157825659,
"grad_norm": 1.1171592473983765,
"learning_rate": 0.00019990257929772184,
"loss": 0.746,
"step": 415
},
{
"epoch": 0.04549928907360822,
"grad_norm": 0.9921464920043945,
"learning_rate": 0.0001999020726416249,
"loss": 0.7603,
"step": 416
},
{
"epoch": 0.045608662364650554,
"grad_norm": 1.0106383562088013,
"learning_rate": 0.0001999015646721044,
"loss": 0.7964,
"step": 417
},
{
"epoch": 0.04571803565569288,
"grad_norm": 1.3405063152313232,
"learning_rate": 0.00019990105538916694,
"loss": 0.807,
"step": 418
},
{
"epoch": 0.045827408946735204,
"grad_norm": 1.180208683013916,
"learning_rate": 0.00019990054479281924,
"loss": 0.9172,
"step": 419
},
{
"epoch": 0.045936782237777536,
"grad_norm": 1.1107349395751953,
"learning_rate": 0.00019990003288306802,
"loss": 0.9676,
"step": 420
},
{
"epoch": 0.04604615552881986,
"grad_norm": 0.8224467635154724,
"learning_rate": 0.00019989951965991999,
"loss": 0.811,
"step": 421
},
{
"epoch": 0.046155528819862186,
"grad_norm": 1.0547099113464355,
"learning_rate": 0.00019989900512338196,
"loss": 0.9228,
"step": 422
},
{
"epoch": 0.04626490211090452,
"grad_norm": 1.2838783264160156,
"learning_rate": 0.0001998984892734606,
"loss": 0.6898,
"step": 423
},
{
"epoch": 0.04637427540194684,
"grad_norm": 1.7018957138061523,
"learning_rate": 0.00019989797211016278,
"loss": 0.8091,
"step": 424
},
{
"epoch": 0.046483648692989175,
"grad_norm": 1.207707405090332,
"learning_rate": 0.00019989745363349526,
"loss": 0.6146,
"step": 425
},
{
"epoch": 0.0465930219840315,
"grad_norm": 1.4657715559005737,
"learning_rate": 0.00019989693384346482,
"loss": 0.9031,
"step": 426
},
{
"epoch": 0.046702395275073826,
"grad_norm": 1.3541256189346313,
"learning_rate": 0.0001998964127400784,
"loss": 0.6766,
"step": 427
},
{
"epoch": 0.04681176856611616,
"grad_norm": 0.9115450382232666,
"learning_rate": 0.00019989589032334268,
"loss": 0.9605,
"step": 428
},
{
"epoch": 0.04692114185715848,
"grad_norm": 0.9539338946342468,
"learning_rate": 0.0001998953665932647,
"loss": 1.0472,
"step": 429
},
{
"epoch": 0.04703051514820081,
"grad_norm": 0.9659996628761292,
"learning_rate": 0.00019989484154985126,
"loss": 0.7071,
"step": 430
},
{
"epoch": 0.04713988843924314,
"grad_norm": 1.097551703453064,
"learning_rate": 0.0001998943151931093,
"loss": 0.4573,
"step": 431
},
{
"epoch": 0.047249261730285465,
"grad_norm": 1.287800908088684,
"learning_rate": 0.0001998937875230457,
"loss": 0.7062,
"step": 432
},
{
"epoch": 0.04735863502132779,
"grad_norm": 0.9104124307632446,
"learning_rate": 0.0001998932585396674,
"loss": 0.5085,
"step": 433
},
{
"epoch": 0.04746800831237012,
"grad_norm": 0.8423514366149902,
"learning_rate": 0.0001998927282429814,
"loss": 0.7665,
"step": 434
},
{
"epoch": 0.04757738160341245,
"grad_norm": 1.021085500717163,
"learning_rate": 0.0001998921966329946,
"loss": 0.6975,
"step": 435
},
{
"epoch": 0.04768675489445477,
"grad_norm": 1.40684175491333,
"learning_rate": 0.0001998916637097141,
"loss": 0.7913,
"step": 436
},
{
"epoch": 0.047796128185497104,
"grad_norm": 1.0347301959991455,
"learning_rate": 0.00019989112947314678,
"loss": 0.7172,
"step": 437
},
{
"epoch": 0.04790550147653943,
"grad_norm": 1.0268831253051758,
"learning_rate": 0.00019989059392329974,
"loss": 0.7212,
"step": 438
},
{
"epoch": 0.048014874767581754,
"grad_norm": 1.0991255044937134,
"learning_rate": 0.00019989005706018,
"loss": 0.7781,
"step": 439
},
{
"epoch": 0.048124248058624086,
"grad_norm": 1.0303900241851807,
"learning_rate": 0.00019988951888379462,
"loss": 0.8743,
"step": 440
},
{
"epoch": 0.04823362134966641,
"grad_norm": 1.1497889757156372,
"learning_rate": 0.0001998889793941507,
"loss": 0.8768,
"step": 441
},
{
"epoch": 0.048342994640708736,
"grad_norm": 1.1906489133834839,
"learning_rate": 0.00019988843859125528,
"loss": 0.7988,
"step": 442
},
{
"epoch": 0.04845236793175107,
"grad_norm": 0.9526726603507996,
"learning_rate": 0.0001998878964751155,
"loss": 0.9272,
"step": 443
},
{
"epoch": 0.04856174122279339,
"grad_norm": 1.0579299926757812,
"learning_rate": 0.0001998873530457385,
"loss": 0.7917,
"step": 444
},
{
"epoch": 0.04867111451383572,
"grad_norm": 1.2798495292663574,
"learning_rate": 0.0001998868083031314,
"loss": 0.8362,
"step": 445
},
{
"epoch": 0.04878048780487805,
"grad_norm": 1.187063217163086,
"learning_rate": 0.00019988626224730135,
"loss": 0.6954,
"step": 446
},
{
"epoch": 0.048889861095920376,
"grad_norm": 0.8720710873603821,
"learning_rate": 0.0001998857148782556,
"loss": 0.6788,
"step": 447
},
{
"epoch": 0.0489992343869627,
"grad_norm": 1.2096325159072876,
"learning_rate": 0.00019988516619600128,
"loss": 0.7242,
"step": 448
},
{
"epoch": 0.04910860767800503,
"grad_norm": 0.9759934544563293,
"learning_rate": 0.0001998846162005456,
"loss": 0.82,
"step": 449
},
{
"epoch": 0.04921798096904736,
"grad_norm": 0.9307674169540405,
"learning_rate": 0.00019988406489189584,
"loss": 1.0253,
"step": 450
},
{
"epoch": 0.04932735426008968,
"grad_norm": 1.079480767250061,
"learning_rate": 0.00019988351227005923,
"loss": 0.7901,
"step": 451
},
{
"epoch": 0.049436727551132015,
"grad_norm": 0.9951292276382446,
"learning_rate": 0.000199882958335043,
"loss": 0.8101,
"step": 452
},
{
"epoch": 0.04954610084217434,
"grad_norm": 1.5982356071472168,
"learning_rate": 0.00019988240308685447,
"loss": 0.7624,
"step": 453
},
{
"epoch": 0.04965547413321667,
"grad_norm": 1.5702210664749146,
"learning_rate": 0.0001998818465255009,
"loss": 1.0113,
"step": 454
},
{
"epoch": 0.049764847424259,
"grad_norm": 0.8995147347450256,
"learning_rate": 0.00019988128865098967,
"loss": 0.8003,
"step": 455
},
{
"epoch": 0.04987422071530132,
"grad_norm": 1.0795233249664307,
"learning_rate": 0.00019988072946332808,
"loss": 0.7688,
"step": 456
},
{
"epoch": 0.049983594006343654,
"grad_norm": 1.1191943883895874,
"learning_rate": 0.00019988016896252346,
"loss": 0.8913,
"step": 457
},
{
"epoch": 0.05009296729738598,
"grad_norm": 1.089416265487671,
"learning_rate": 0.0001998796071485832,
"loss": 0.6705,
"step": 458
},
{
"epoch": 0.050202340588428304,
"grad_norm": 0.9763931632041931,
"learning_rate": 0.0001998790440215147,
"loss": 0.6319,
"step": 459
},
{
"epoch": 0.050311713879470636,
"grad_norm": 1.4132522344589233,
"learning_rate": 0.00019987847958132535,
"loss": 0.7966,
"step": 460
},
{
"epoch": 0.05042108717051296,
"grad_norm": 1.5261541604995728,
"learning_rate": 0.00019987791382802255,
"loss": 0.6739,
"step": 461
},
{
"epoch": 0.050530460461555286,
"grad_norm": 1.1543093919754028,
"learning_rate": 0.00019987734676161378,
"loss": 1.3043,
"step": 462
},
{
"epoch": 0.05063983375259762,
"grad_norm": 1.311062216758728,
"learning_rate": 0.0001998767783821065,
"loss": 0.8772,
"step": 463
},
{
"epoch": 0.05074920704363994,
"grad_norm": 1.5114765167236328,
"learning_rate": 0.00019987620868950812,
"loss": 0.8614,
"step": 464
},
{
"epoch": 0.05085858033468227,
"grad_norm": 1.1269599199295044,
"learning_rate": 0.00019987563768382617,
"loss": 0.9356,
"step": 465
},
{
"epoch": 0.0509679536257246,
"grad_norm": 1.285370945930481,
"learning_rate": 0.00019987506536506814,
"loss": 0.6714,
"step": 466
},
{
"epoch": 0.051077326916766926,
"grad_norm": 1.137934923171997,
"learning_rate": 0.0001998744917332416,
"loss": 0.5941,
"step": 467
},
{
"epoch": 0.05118670020780925,
"grad_norm": 1.1598773002624512,
"learning_rate": 0.00019987391678835404,
"loss": 0.9834,
"step": 468
},
{
"epoch": 0.05129607349885158,
"grad_norm": 1.5532463788986206,
"learning_rate": 0.00019987334053041307,
"loss": 0.8427,
"step": 469
},
{
"epoch": 0.05140544678989391,
"grad_norm": 1.0216114521026611,
"learning_rate": 0.00019987276295942621,
"loss": 0.8592,
"step": 470
},
{
"epoch": 0.05151482008093623,
"grad_norm": 1.5978375673294067,
"learning_rate": 0.00019987218407540108,
"loss": 0.6453,
"step": 471
},
{
"epoch": 0.051624193371978565,
"grad_norm": 1.022755742073059,
"learning_rate": 0.0001998716038783453,
"loss": 0.9352,
"step": 472
},
{
"epoch": 0.05173356666302089,
"grad_norm": 1.1233989000320435,
"learning_rate": 0.00019987102236826646,
"loss": 0.7528,
"step": 473
},
{
"epoch": 0.051842939954063215,
"grad_norm": 1.0236766338348389,
"learning_rate": 0.00019987043954517223,
"loss": 0.7504,
"step": 474
},
{
"epoch": 0.05195231324510555,
"grad_norm": 0.9642089009284973,
"learning_rate": 0.0001998698554090703,
"loss": 0.7342,
"step": 475
},
{
"epoch": 0.05206168653614787,
"grad_norm": 1.0298606157302856,
"learning_rate": 0.00019986926995996834,
"loss": 0.9943,
"step": 476
},
{
"epoch": 0.0521710598271902,
"grad_norm": 0.9320874214172363,
"learning_rate": 0.000199868683197874,
"loss": 1.1226,
"step": 477
},
{
"epoch": 0.05228043311823253,
"grad_norm": 0.8626863956451416,
"learning_rate": 0.000199868095122795,
"loss": 1.0293,
"step": 478
},
{
"epoch": 0.052389806409274854,
"grad_norm": 1.0206810235977173,
"learning_rate": 0.00019986750573473914,
"loss": 1.0032,
"step": 479
},
{
"epoch": 0.05249917970031718,
"grad_norm": 1.1447771787643433,
"learning_rate": 0.0001998669150337141,
"loss": 0.8816,
"step": 480
},
{
"epoch": 0.05260855299135951,
"grad_norm": 1.1172994375228882,
"learning_rate": 0.0001998663230197277,
"loss": 0.8034,
"step": 481
},
{
"epoch": 0.052717926282401836,
"grad_norm": 1.1175955533981323,
"learning_rate": 0.00019986572969278766,
"loss": 0.9391,
"step": 482
},
{
"epoch": 0.05282729957344417,
"grad_norm": 1.279219388961792,
"learning_rate": 0.00019986513505290186,
"loss": 0.7481,
"step": 483
},
{
"epoch": 0.05293667286448649,
"grad_norm": 0.9596846103668213,
"learning_rate": 0.00019986453910007806,
"loss": 0.7093,
"step": 484
},
{
"epoch": 0.05304604615552882,
"grad_norm": 1.5974267721176147,
"learning_rate": 0.0001998639418343241,
"loss": 0.9337,
"step": 485
},
{
"epoch": 0.05315541944657115,
"grad_norm": 0.9189580678939819,
"learning_rate": 0.0001998633432556478,
"loss": 1.042,
"step": 486
},
{
"epoch": 0.053264792737613476,
"grad_norm": 1.3200494050979614,
"learning_rate": 0.00019986274336405714,
"loss": 0.8717,
"step": 487
},
{
"epoch": 0.0533741660286558,
"grad_norm": 1.514082431793213,
"learning_rate": 0.0001998621421595599,
"loss": 0.9438,
"step": 488
},
{
"epoch": 0.05348353931969813,
"grad_norm": 1.1798110008239746,
"learning_rate": 0.000199861539642164,
"loss": 0.8857,
"step": 489
},
{
"epoch": 0.05359291261074046,
"grad_norm": 1.3705772161483765,
"learning_rate": 0.00019986093581187743,
"loss": 0.7876,
"step": 490
},
{
"epoch": 0.05370228590178278,
"grad_norm": 1.0883309841156006,
"learning_rate": 0.00019986033066870805,
"loss": 0.7006,
"step": 491
},
{
"epoch": 0.053811659192825115,
"grad_norm": 1.2093448638916016,
"learning_rate": 0.00019985972421266386,
"loss": 0.8158,
"step": 492
},
{
"epoch": 0.05392103248386744,
"grad_norm": 1.2223838567733765,
"learning_rate": 0.00019985911644375282,
"loss": 0.9867,
"step": 493
},
{
"epoch": 0.054030405774909765,
"grad_norm": 1.2985742092132568,
"learning_rate": 0.00019985850736198294,
"loss": 0.7929,
"step": 494
},
{
"epoch": 0.0541397790659521,
"grad_norm": 1.0266704559326172,
"learning_rate": 0.00019985789696736215,
"loss": 0.7462,
"step": 495
},
{
"epoch": 0.05424915235699442,
"grad_norm": 1.272060513496399,
"learning_rate": 0.00019985728525989858,
"loss": 0.78,
"step": 496
},
{
"epoch": 0.05435852564803675,
"grad_norm": 0.8229413032531738,
"learning_rate": 0.00019985667223960021,
"loss": 1.0024,
"step": 497
},
{
"epoch": 0.05446789893907908,
"grad_norm": 1.0643401145935059,
"learning_rate": 0.00019985605790647513,
"loss": 0.8547,
"step": 498
},
{
"epoch": 0.054577272230121404,
"grad_norm": 0.9842153787612915,
"learning_rate": 0.00019985544226053137,
"loss": 1.0151,
"step": 499
},
{
"epoch": 0.05468664552116373,
"grad_norm": 1.050392508506775,
"learning_rate": 0.00019985482530177707,
"loss": 0.7329,
"step": 500
},
{
"epoch": 0.05479601881220606,
"grad_norm": 1.1385303735733032,
"learning_rate": 0.00019985420703022032,
"loss": 0.8524,
"step": 501
},
{
"epoch": 0.054905392103248386,
"grad_norm": 1.0153578519821167,
"learning_rate": 0.0001998535874458693,
"loss": 0.9798,
"step": 502
},
{
"epoch": 0.05501476539429071,
"grad_norm": 0.8864844441413879,
"learning_rate": 0.00019985296654873204,
"loss": 0.8962,
"step": 503
},
{
"epoch": 0.05512413868533304,
"grad_norm": 0.8665205836296082,
"learning_rate": 0.0001998523443388168,
"loss": 1.1352,
"step": 504
},
{
"epoch": 0.05523351197637537,
"grad_norm": 1.2367112636566162,
"learning_rate": 0.00019985172081613177,
"loss": 0.9921,
"step": 505
},
{
"epoch": 0.055342885267417694,
"grad_norm": 1.02898108959198,
"learning_rate": 0.00019985109598068506,
"loss": 0.9123,
"step": 506
},
{
"epoch": 0.055452258558460026,
"grad_norm": 0.9751277565956116,
"learning_rate": 0.000199850469832485,
"loss": 1.0117,
"step": 507
},
{
"epoch": 0.05556163184950235,
"grad_norm": 1.1283056735992432,
"learning_rate": 0.00019984984237153973,
"loss": 0.7363,
"step": 508
},
{
"epoch": 0.055671005140544676,
"grad_norm": 1.480178952217102,
"learning_rate": 0.0001998492135978575,
"loss": 1.0154,
"step": 509
},
{
"epoch": 0.05578037843158701,
"grad_norm": 1.3893234729766846,
"learning_rate": 0.00019984858351144663,
"loss": 0.6876,
"step": 510
},
{
"epoch": 0.05588975172262933,
"grad_norm": 1.0186976194381714,
"learning_rate": 0.00019984795211231535,
"loss": 0.7121,
"step": 511
},
{
"epoch": 0.055999125013671665,
"grad_norm": 1.1589125394821167,
"learning_rate": 0.000199847319400472,
"loss": 0.7955,
"step": 512
},
{
"epoch": 0.05610849830471399,
"grad_norm": 1.0086039304733276,
"learning_rate": 0.0001998466853759249,
"loss": 0.8957,
"step": 513
},
{
"epoch": 0.056217871595756315,
"grad_norm": 1.2082234621047974,
"learning_rate": 0.00019984605003868237,
"loss": 0.931,
"step": 514
},
{
"epoch": 0.05632724488679865,
"grad_norm": 1.0067565441131592,
"learning_rate": 0.0001998454133887528,
"loss": 0.731,
"step": 515
},
{
"epoch": 0.05643661817784097,
"grad_norm": 0.8393429517745972,
"learning_rate": 0.00019984477542614446,
"loss": 0.8231,
"step": 516
},
{
"epoch": 0.0565459914688833,
"grad_norm": 0.9679846167564392,
"learning_rate": 0.00019984413615086583,
"loss": 1.0243,
"step": 517
},
{
"epoch": 0.05665536475992563,
"grad_norm": 1.0620890855789185,
"learning_rate": 0.0001998434955629253,
"loss": 0.8942,
"step": 518
},
{
"epoch": 0.056764738050967954,
"grad_norm": 0.8497173190116882,
"learning_rate": 0.00019984285366233127,
"loss": 0.8808,
"step": 519
},
{
"epoch": 0.05687411134201028,
"grad_norm": 1.210013508796692,
"learning_rate": 0.0001998422104490922,
"loss": 0.6953,
"step": 520
},
{
"epoch": 0.05698348463305261,
"grad_norm": 0.8720889091491699,
"learning_rate": 0.00019984156592321652,
"loss": 0.9666,
"step": 521
},
{
"epoch": 0.057092857924094936,
"grad_norm": 1.122982144355774,
"learning_rate": 0.00019984092008471272,
"loss": 0.8495,
"step": 522
},
{
"epoch": 0.05720223121513726,
"grad_norm": 1.1690536737442017,
"learning_rate": 0.00019984027293358931,
"loss": 1.202,
"step": 523
},
{
"epoch": 0.05731160450617959,
"grad_norm": 1.0106743574142456,
"learning_rate": 0.00019983962446985476,
"loss": 0.9893,
"step": 524
},
{
"epoch": 0.05742097779722192,
"grad_norm": 1.8566340208053589,
"learning_rate": 0.0001998389746935176,
"loss": 1.3652,
"step": 525
},
{
"epoch": 0.057530351088264244,
"grad_norm": 0.9694240689277649,
"learning_rate": 0.00019983832360458644,
"loss": 0.6753,
"step": 526
},
{
"epoch": 0.057639724379306576,
"grad_norm": 1.099011778831482,
"learning_rate": 0.00019983767120306973,
"loss": 1.549,
"step": 527
},
{
"epoch": 0.0577490976703489,
"grad_norm": 1.0495198965072632,
"learning_rate": 0.00019983701748897613,
"loss": 1.1807,
"step": 528
},
{
"epoch": 0.057858470961391226,
"grad_norm": 0.9285663962364197,
"learning_rate": 0.0001998363624623142,
"loss": 1.0697,
"step": 529
},
{
"epoch": 0.05796784425243356,
"grad_norm": 1.0406607389450073,
"learning_rate": 0.00019983570612309257,
"loss": 1.0355,
"step": 530
},
{
"epoch": 0.05807721754347588,
"grad_norm": 0.9569828510284424,
"learning_rate": 0.00019983504847131985,
"loss": 0.7724,
"step": 531
},
{
"epoch": 0.05818659083451821,
"grad_norm": 1.041804313659668,
"learning_rate": 0.0001998343895070047,
"loss": 0.5987,
"step": 532
},
{
"epoch": 0.05829596412556054,
"grad_norm": 1.242843508720398,
"learning_rate": 0.00019983372923015576,
"loss": 1.0367,
"step": 533
},
{
"epoch": 0.058405337416602865,
"grad_norm": 1.2179800271987915,
"learning_rate": 0.00019983306764078174,
"loss": 0.8017,
"step": 534
},
{
"epoch": 0.05851471070764519,
"grad_norm": 1.5981494188308716,
"learning_rate": 0.00019983240473889132,
"loss": 0.8737,
"step": 535
},
{
"epoch": 0.05862408399868752,
"grad_norm": 1.071590781211853,
"learning_rate": 0.00019983174052449324,
"loss": 0.8819,
"step": 536
},
{
"epoch": 0.05873345728972985,
"grad_norm": 0.9891796112060547,
"learning_rate": 0.0001998310749975962,
"loss": 1.1386,
"step": 537
},
{
"epoch": 0.05884283058077217,
"grad_norm": 1.0623862743377686,
"learning_rate": 0.00019983040815820896,
"loss": 0.8083,
"step": 538
},
{
"epoch": 0.058952203871814504,
"grad_norm": 0.9091552495956421,
"learning_rate": 0.0001998297400063403,
"loss": 0.5463,
"step": 539
},
{
"epoch": 0.05906157716285683,
"grad_norm": 1.1463671922683716,
"learning_rate": 0.000199829070541999,
"loss": 0.8651,
"step": 540
},
{
"epoch": 0.05917095045389916,
"grad_norm": 1.4799455404281616,
"learning_rate": 0.00019982839976519386,
"loss": 0.6439,
"step": 541
},
{
"epoch": 0.059280323744941486,
"grad_norm": 1.2554148435592651,
"learning_rate": 0.00019982772767593367,
"loss": 0.9621,
"step": 542
},
{
"epoch": 0.05938969703598381,
"grad_norm": 1.0151816606521606,
"learning_rate": 0.00019982705427422733,
"loss": 0.8456,
"step": 543
},
{
"epoch": 0.05949907032702614,
"grad_norm": 0.9739223122596741,
"learning_rate": 0.00019982637956008362,
"loss": 1.0848,
"step": 544
},
{
"epoch": 0.05960844361806847,
"grad_norm": 1.4318240880966187,
"learning_rate": 0.00019982570353351147,
"loss": 0.4684,
"step": 545
},
{
"epoch": 0.059717816909110794,
"grad_norm": 1.1196770668029785,
"learning_rate": 0.00019982502619451974,
"loss": 0.7739,
"step": 546
},
{
"epoch": 0.059827190200153126,
"grad_norm": 0.9427726864814758,
"learning_rate": 0.00019982434754311733,
"loss": 0.9338,
"step": 547
},
{
"epoch": 0.05993656349119545,
"grad_norm": 1.3539577722549438,
"learning_rate": 0.0001998236675793132,
"loss": 0.9631,
"step": 548
},
{
"epoch": 0.060045936782237776,
"grad_norm": 1.1712934970855713,
"learning_rate": 0.00019982298630311622,
"loss": 0.9422,
"step": 549
},
{
"epoch": 0.06015531007328011,
"grad_norm": 1.177377700805664,
"learning_rate": 0.0001998223037145354,
"loss": 0.9431,
"step": 550
},
{
"epoch": 0.06026468336432243,
"grad_norm": 1.0253443717956543,
"learning_rate": 0.00019982161981357973,
"loss": 1.1583,
"step": 551
},
{
"epoch": 0.06037405665536476,
"grad_norm": 1.0737707614898682,
"learning_rate": 0.00019982093460025815,
"loss": 0.7857,
"step": 552
},
{
"epoch": 0.06048342994640709,
"grad_norm": 1.4929778575897217,
"learning_rate": 0.00019982024807457967,
"loss": 1.0744,
"step": 553
},
{
"epoch": 0.060592803237449415,
"grad_norm": 1.174723744392395,
"learning_rate": 0.00019981956023655336,
"loss": 1.124,
"step": 554
},
{
"epoch": 0.06070217652849174,
"grad_norm": 1.4608044624328613,
"learning_rate": 0.00019981887108618825,
"loss": 0.91,
"step": 555
},
{
"epoch": 0.06081154981953407,
"grad_norm": 1.2418204545974731,
"learning_rate": 0.00019981818062349337,
"loss": 0.6012,
"step": 556
},
{
"epoch": 0.0609209231105764,
"grad_norm": 1.3971385955810547,
"learning_rate": 0.0001998174888484778,
"loss": 0.7114,
"step": 557
},
{
"epoch": 0.06103029640161872,
"grad_norm": 1.189285397529602,
"learning_rate": 0.0001998167957611507,
"loss": 1.3319,
"step": 558
},
{
"epoch": 0.061139669692661054,
"grad_norm": 1.088165521621704,
"learning_rate": 0.0001998161013615211,
"loss": 0.6337,
"step": 559
},
{
"epoch": 0.06124904298370338,
"grad_norm": 1.2663531303405762,
"learning_rate": 0.0001998154056495982,
"loss": 0.7802,
"step": 560
},
{
"epoch": 0.061358416274745704,
"grad_norm": 1.002173900604248,
"learning_rate": 0.00019981470862539107,
"loss": 0.8206,
"step": 561
},
{
"epoch": 0.061467789565788036,
"grad_norm": 1.1963932514190674,
"learning_rate": 0.00019981401028890895,
"loss": 1.1556,
"step": 562
},
{
"epoch": 0.06157716285683036,
"grad_norm": 1.1052930355072021,
"learning_rate": 0.00019981331064016097,
"loss": 0.9486,
"step": 563
},
{
"epoch": 0.061686536147872686,
"grad_norm": 0.9965226054191589,
"learning_rate": 0.00019981260967915634,
"loss": 0.766,
"step": 564
},
{
"epoch": 0.06179590943891502,
"grad_norm": 1.6856166124343872,
"learning_rate": 0.0001998119074059043,
"loss": 0.6992,
"step": 565
},
{
"epoch": 0.061905282729957344,
"grad_norm": 1.4077011346817017,
"learning_rate": 0.00019981120382041404,
"loss": 0.8003,
"step": 566
},
{
"epoch": 0.06201465602099967,
"grad_norm": 1.032565951347351,
"learning_rate": 0.00019981049892269482,
"loss": 0.7922,
"step": 567
},
{
"epoch": 0.062124029312042,
"grad_norm": 1.1922955513000488,
"learning_rate": 0.00019980979271275596,
"loss": 0.7718,
"step": 568
},
{
"epoch": 0.062233402603084326,
"grad_norm": 0.9688342213630676,
"learning_rate": 0.00019980908519060667,
"loss": 0.7989,
"step": 569
},
{
"epoch": 0.06234277589412666,
"grad_norm": 1.5489237308502197,
"learning_rate": 0.00019980837635625632,
"loss": 0.8059,
"step": 570
},
{
"epoch": 0.06245214918516898,
"grad_norm": 1.9893778562545776,
"learning_rate": 0.0001998076662097142,
"loss": 0.8632,
"step": 571
},
{
"epoch": 0.06256152247621131,
"grad_norm": 1.1985156536102295,
"learning_rate": 0.00019980695475098958,
"loss": 1.0229,
"step": 572
},
{
"epoch": 0.06267089576725364,
"grad_norm": 0.994389533996582,
"learning_rate": 0.00019980624198009193,
"loss": 1.1044,
"step": 573
},
{
"epoch": 0.06278026905829596,
"grad_norm": 0.9276033043861389,
"learning_rate": 0.00019980552789703056,
"loss": 0.9062,
"step": 574
},
{
"epoch": 0.06288964234933829,
"grad_norm": 1.2080670595169067,
"learning_rate": 0.00019980481250181487,
"loss": 0.769,
"step": 575
},
{
"epoch": 0.06299901564038062,
"grad_norm": 1.1223119497299194,
"learning_rate": 0.00019980409579445425,
"loss": 1.137,
"step": 576
},
{
"epoch": 0.06310838893142294,
"grad_norm": 1.0903812646865845,
"learning_rate": 0.00019980337777495812,
"loss": 0.9827,
"step": 577
},
{
"epoch": 0.06321776222246528,
"grad_norm": 1.0898516178131104,
"learning_rate": 0.00019980265844333594,
"loss": 0.8881,
"step": 578
},
{
"epoch": 0.0633271355135076,
"grad_norm": 0.9497270584106445,
"learning_rate": 0.00019980193779959717,
"loss": 0.9331,
"step": 579
},
{
"epoch": 0.06343650880454993,
"grad_norm": 1.1686186790466309,
"learning_rate": 0.00019980121584375126,
"loss": 0.8766,
"step": 580
},
{
"epoch": 0.06354588209559225,
"grad_norm": 1.187633991241455,
"learning_rate": 0.00019980049257580773,
"loss": 0.8418,
"step": 581
},
{
"epoch": 0.06365525538663458,
"grad_norm": 1.136193037033081,
"learning_rate": 0.00019979976799577607,
"loss": 0.7776,
"step": 582
},
{
"epoch": 0.0637646286776769,
"grad_norm": 1.1883234977722168,
"learning_rate": 0.0001997990421036658,
"loss": 0.8067,
"step": 583
},
{
"epoch": 0.06387400196871924,
"grad_norm": 1.0206081867218018,
"learning_rate": 0.0001997983148994865,
"loss": 1.0334,
"step": 584
},
{
"epoch": 0.06398337525976157,
"grad_norm": 0.9565343260765076,
"learning_rate": 0.00019979758638324772,
"loss": 0.9657,
"step": 585
},
{
"epoch": 0.0640927485508039,
"grad_norm": 1.2159839868545532,
"learning_rate": 0.00019979685655495896,
"loss": 0.8276,
"step": 586
},
{
"epoch": 0.06420212184184622,
"grad_norm": 1.3924200534820557,
"learning_rate": 0.00019979612541462993,
"loss": 0.8714,
"step": 587
},
{
"epoch": 0.06431149513288854,
"grad_norm": 1.16556978225708,
"learning_rate": 0.00019979539296227018,
"loss": 0.8768,
"step": 588
},
{
"epoch": 0.06442086842393088,
"grad_norm": 1.5815696716308594,
"learning_rate": 0.00019979465919788933,
"loss": 0.8323,
"step": 589
},
{
"epoch": 0.06453024171497321,
"grad_norm": 1.1107839345932007,
"learning_rate": 0.00019979392412149707,
"loss": 0.8951,
"step": 590
},
{
"epoch": 0.06463961500601553,
"grad_norm": 0.9651502966880798,
"learning_rate": 0.00019979318773310302,
"loss": 1.1726,
"step": 591
},
{
"epoch": 0.06474898829705786,
"grad_norm": 1.1854195594787598,
"learning_rate": 0.0001997924500327169,
"loss": 0.7009,
"step": 592
},
{
"epoch": 0.06485836158810018,
"grad_norm": 1.102640986442566,
"learning_rate": 0.0001997917110203484,
"loss": 0.7523,
"step": 593
},
{
"epoch": 0.06496773487914251,
"grad_norm": 1.0900192260742188,
"learning_rate": 0.00019979097069600717,
"loss": 0.6592,
"step": 594
},
{
"epoch": 0.06507710817018485,
"grad_norm": 1.2523647546768188,
"learning_rate": 0.00019979022905970307,
"loss": 0.7598,
"step": 595
},
{
"epoch": 0.06518648146122717,
"grad_norm": 1.1489145755767822,
"learning_rate": 0.00019978948611144574,
"loss": 0.8636,
"step": 596
},
{
"epoch": 0.0652958547522695,
"grad_norm": 1.1444084644317627,
"learning_rate": 0.00019978874185124502,
"loss": 0.8351,
"step": 597
},
{
"epoch": 0.06540522804331182,
"grad_norm": 1.0838830471038818,
"learning_rate": 0.00019978799627911063,
"loss": 0.9453,
"step": 598
},
{
"epoch": 0.06551460133435415,
"grad_norm": 0.9383161067962646,
"learning_rate": 0.00019978724939505242,
"loss": 0.7702,
"step": 599
},
{
"epoch": 0.06562397462539647,
"grad_norm": 1.2142367362976074,
"learning_rate": 0.00019978650119908018,
"loss": 0.7413,
"step": 600
},
{
"epoch": 0.06562397462539647,
"eval_loss": 0.817609429359436,
"eval_runtime": 40.8601,
"eval_samples_per_second": 18.013,
"eval_steps_per_second": 4.503,
"step": 600
}
],
"logging_steps": 1,
"max_steps": 27429,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 200,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 1
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.904615294690918e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}