{ "best_metric": 0.8067082166671753, "best_model_checkpoint": "miner_id_24/checkpoint-400", "epoch": 0.06562397462539647, "eval_steps": 200, "global_step": 600, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00010937329104232747, "grad_norm": 1.0359435081481934, "learning_rate": 6.666666666666667e-06, "loss": 0.7552, "step": 1 }, { "epoch": 0.00010937329104232747, "eval_loss": 0.7747385501861572, "eval_runtime": 40.8616, "eval_samples_per_second": 18.012, "eval_steps_per_second": 4.503, "step": 1 }, { "epoch": 0.00021874658208465494, "grad_norm": 0.957185685634613, "learning_rate": 1.3333333333333333e-05, "loss": 0.4443, "step": 2 }, { "epoch": 0.00032811987312698237, "grad_norm": 1.1346784830093384, "learning_rate": 2e-05, "loss": 0.8643, "step": 3 }, { "epoch": 0.0004374931641693099, "grad_norm": 0.9469565749168396, "learning_rate": 2.6666666666666667e-05, "loss": 0.7323, "step": 4 }, { "epoch": 0.0005468664552116373, "grad_norm": 0.7470714449882507, "learning_rate": 3.3333333333333335e-05, "loss": 0.7802, "step": 5 }, { "epoch": 0.0006562397462539647, "grad_norm": 0.9336181282997131, "learning_rate": 4e-05, "loss": 0.7257, "step": 6 }, { "epoch": 0.0007656130372962922, "grad_norm": 1.0791195631027222, "learning_rate": 4.666666666666667e-05, "loss": 0.8429, "step": 7 }, { "epoch": 0.0008749863283386198, "grad_norm": 0.7835611701011658, "learning_rate": 5.333333333333333e-05, "loss": 0.6867, "step": 8 }, { "epoch": 0.0009843596193809471, "grad_norm": 0.97986900806427, "learning_rate": 6e-05, "loss": 1.344, "step": 9 }, { "epoch": 0.0010937329104232746, "grad_norm": 0.7541531920433044, "learning_rate": 6.666666666666667e-05, "loss": 1.0589, "step": 10 }, { "epoch": 0.001203106201465602, "grad_norm": 0.9011327624320984, "learning_rate": 7.333333333333333e-05, "loss": 0.9204, "step": 11 }, { "epoch": 0.0013124794925079295, "grad_norm": 0.73972088098526, "learning_rate": 8e-05, "loss": 0.5648, "step": 12 }, { "epoch": 0.001421852783550257, "grad_norm": 0.8409032225608826, "learning_rate": 8.666666666666667e-05, "loss": 0.7085, "step": 13 }, { "epoch": 0.0015312260745925844, "grad_norm": 0.7147814035415649, "learning_rate": 9.333333333333334e-05, "loss": 0.5697, "step": 14 }, { "epoch": 0.0016405993656349119, "grad_norm": 1.2943480014801025, "learning_rate": 0.0001, "loss": 0.5326, "step": 15 }, { "epoch": 0.0017499726566772395, "grad_norm": 1.0381604433059692, "learning_rate": 0.00010666666666666667, "loss": 0.6035, "step": 16 }, { "epoch": 0.001859345947719567, "grad_norm": 1.241224765777588, "learning_rate": 0.00011333333333333334, "loss": 0.8444, "step": 17 }, { "epoch": 0.0019687192387618942, "grad_norm": 1.2240588665008545, "learning_rate": 0.00012, "loss": 1.2189, "step": 18 }, { "epoch": 0.002078092529804222, "grad_norm": 0.6758236885070801, "learning_rate": 0.00012666666666666666, "loss": 0.8096, "step": 19 }, { "epoch": 0.002187465820846549, "grad_norm": 0.9755652546882629, "learning_rate": 0.00013333333333333334, "loss": 0.7745, "step": 20 }, { "epoch": 0.002296839111888877, "grad_norm": 0.9789362549781799, "learning_rate": 0.00014, "loss": 0.8419, "step": 21 }, { "epoch": 0.002406212402931204, "grad_norm": 1.243459939956665, "learning_rate": 0.00014666666666666666, "loss": 0.6975, "step": 22 }, { "epoch": 0.0025155856939735317, "grad_norm": 1.1147222518920898, "learning_rate": 0.00015333333333333334, "loss": 1.0447, "step": 23 }, { "epoch": 0.002624958985015859, "grad_norm": 0.7549237012863159, "learning_rate": 0.00016, "loss": 0.8227, "step": 24 }, { "epoch": 0.0027343322760581866, "grad_norm": 0.9991783499717712, "learning_rate": 0.0001666666666666667, "loss": 0.7753, "step": 25 }, { "epoch": 0.002843705567100514, "grad_norm": 0.8530986309051514, "learning_rate": 0.00017333333333333334, "loss": 1.0104, "step": 26 }, { "epoch": 0.0029530788581428415, "grad_norm": 1.0823960304260254, "learning_rate": 0.00018, "loss": 0.6805, "step": 27 }, { "epoch": 0.003062452149185169, "grad_norm": 1.1649422645568848, "learning_rate": 0.0001866666666666667, "loss": 0.651, "step": 28 }, { "epoch": 0.0031718254402274965, "grad_norm": 1.153540849685669, "learning_rate": 0.00019333333333333333, "loss": 0.6845, "step": 29 }, { "epoch": 0.0032811987312698237, "grad_norm": 1.0849957466125488, "learning_rate": 0.0002, "loss": 0.843, "step": 30 }, { "epoch": 0.0033905720223121514, "grad_norm": 1.088346242904663, "learning_rate": 0.00019999999934264446, "loss": 0.7297, "step": 31 }, { "epoch": 0.003499945313354479, "grad_norm": 0.8655444979667664, "learning_rate": 0.00019999999737057786, "loss": 0.8366, "step": 32 }, { "epoch": 0.0036093186043968063, "grad_norm": 0.9512057900428772, "learning_rate": 0.00019999999408380027, "loss": 0.5827, "step": 33 }, { "epoch": 0.003718691895439134, "grad_norm": 0.9010905623435974, "learning_rate": 0.0001999999894823116, "loss": 0.9626, "step": 34 }, { "epoch": 0.003828065186481461, "grad_norm": 0.8122968077659607, "learning_rate": 0.00019999998356611204, "loss": 0.9244, "step": 35 }, { "epoch": 0.0039374384775237884, "grad_norm": 1.0451189279556274, "learning_rate": 0.00019999997633520162, "loss": 0.8667, "step": 36 }, { "epoch": 0.004046811768566116, "grad_norm": 0.9873628616333008, "learning_rate": 0.00019999996778958046, "loss": 0.6803, "step": 37 }, { "epoch": 0.004156185059608444, "grad_norm": 0.9295932650566101, "learning_rate": 0.00019999995792924864, "loss": 0.6587, "step": 38 }, { "epoch": 0.0042655583506507715, "grad_norm": 0.9532923102378845, "learning_rate": 0.00019999994675420628, "loss": 0.7123, "step": 39 }, { "epoch": 0.004374931641693098, "grad_norm": 0.8833261132240295, "learning_rate": 0.00019999993426445358, "loss": 0.6655, "step": 40 }, { "epoch": 0.004484304932735426, "grad_norm": 0.7765618562698364, "learning_rate": 0.00019999992045999067, "loss": 0.6227, "step": 41 }, { "epoch": 0.004593678223777754, "grad_norm": 1.0266915559768677, "learning_rate": 0.0001999999053408177, "loss": 0.9985, "step": 42 }, { "epoch": 0.004703051514820081, "grad_norm": 0.7699204683303833, "learning_rate": 0.00019999988890693492, "loss": 0.8645, "step": 43 }, { "epoch": 0.004812424805862408, "grad_norm": 1.003393292427063, "learning_rate": 0.00019999987115834253, "loss": 0.8971, "step": 44 }, { "epoch": 0.004921798096904736, "grad_norm": 0.8142101168632507, "learning_rate": 0.0001999998520950408, "loss": 0.7234, "step": 45 }, { "epoch": 0.0050311713879470634, "grad_norm": 1.3098042011260986, "learning_rate": 0.0001999998317170299, "loss": 0.8737, "step": 46 }, { "epoch": 0.005140544678989391, "grad_norm": 0.8643680214881897, "learning_rate": 0.00019999981002431015, "loss": 0.8877, "step": 47 }, { "epoch": 0.005249917970031718, "grad_norm": 0.873254120349884, "learning_rate": 0.00019999978701688183, "loss": 0.6834, "step": 48 }, { "epoch": 0.005359291261074046, "grad_norm": 0.8523358106613159, "learning_rate": 0.00019999976269474522, "loss": 0.887, "step": 49 }, { "epoch": 0.005468664552116373, "grad_norm": 1.0463756322860718, "learning_rate": 0.00019999973705790068, "loss": 0.6026, "step": 50 }, { "epoch": 0.005578037843158701, "grad_norm": 0.9958584308624268, "learning_rate": 0.00019999971010634853, "loss": 0.8893, "step": 51 }, { "epoch": 0.005687411134201028, "grad_norm": 1.0434130430221558, "learning_rate": 0.0001999996818400891, "loss": 0.8421, "step": 52 }, { "epoch": 0.005796784425243355, "grad_norm": 0.917728841304779, "learning_rate": 0.0001999996522591228, "loss": 0.6586, "step": 53 }, { "epoch": 0.005906157716285683, "grad_norm": 0.8328091502189636, "learning_rate": 0.00019999962136345, "loss": 0.8971, "step": 54 }, { "epoch": 0.006015531007328011, "grad_norm": 1.2430554628372192, "learning_rate": 0.0001999995891530711, "loss": 1.0108, "step": 55 }, { "epoch": 0.006124904298370338, "grad_norm": 0.9426673054695129, "learning_rate": 0.00019999955562798654, "loss": 0.9291, "step": 56 }, { "epoch": 0.006234277589412665, "grad_norm": 1.0275059938430786, "learning_rate": 0.00019999952078819674, "loss": 1.0881, "step": 57 }, { "epoch": 0.006343650880454993, "grad_norm": 1.0648664236068726, "learning_rate": 0.00019999948463370217, "loss": 0.7744, "step": 58 }, { "epoch": 0.006453024171497321, "grad_norm": 0.9224843382835388, "learning_rate": 0.00019999944716450328, "loss": 0.8151, "step": 59 }, { "epoch": 0.006562397462539647, "grad_norm": 0.9548549652099609, "learning_rate": 0.00019999940838060062, "loss": 0.8695, "step": 60 }, { "epoch": 0.006671770753581975, "grad_norm": 0.9503769874572754, "learning_rate": 0.00019999936828199468, "loss": 0.7061, "step": 61 }, { "epoch": 0.006781144044624303, "grad_norm": 1.0756902694702148, "learning_rate": 0.00019999932686868595, "loss": 0.5131, "step": 62 }, { "epoch": 0.00689051733566663, "grad_norm": 0.9061060547828674, "learning_rate": 0.00019999928414067499, "loss": 1.0903, "step": 63 }, { "epoch": 0.006999890626708958, "grad_norm": 1.2045193910598755, "learning_rate": 0.0001999992400979624, "loss": 0.7959, "step": 64 }, { "epoch": 0.007109263917751285, "grad_norm": 0.785504162311554, "learning_rate": 0.0001999991947405487, "loss": 1.067, "step": 65 }, { "epoch": 0.007218637208793613, "grad_norm": 0.8506015539169312, "learning_rate": 0.00019999914806843454, "loss": 1.0416, "step": 66 }, { "epoch": 0.00732801049983594, "grad_norm": 1.103265404701233, "learning_rate": 0.00019999910008162048, "loss": 0.5667, "step": 67 }, { "epoch": 0.007437383790878268, "grad_norm": 0.9666427969932556, "learning_rate": 0.0001999990507801072, "loss": 0.7017, "step": 68 }, { "epoch": 0.007546757081920595, "grad_norm": 0.7427759170532227, "learning_rate": 0.0001999990001638953, "loss": 1.0521, "step": 69 }, { "epoch": 0.007656130372962922, "grad_norm": 1.2603650093078613, "learning_rate": 0.00019999894823298552, "loss": 0.7703, "step": 70 }, { "epoch": 0.00776550366400525, "grad_norm": 1.3171355724334717, "learning_rate": 0.00019999889498737848, "loss": 0.7608, "step": 71 }, { "epoch": 0.007874876955047577, "grad_norm": 0.9187859892845154, "learning_rate": 0.0001999988404270749, "loss": 0.9708, "step": 72 }, { "epoch": 0.007984250246089905, "grad_norm": 0.8871030807495117, "learning_rate": 0.0001999987845520755, "loss": 0.8331, "step": 73 }, { "epoch": 0.008093623537132232, "grad_norm": 0.8429688811302185, "learning_rate": 0.00019999872736238097, "loss": 1.0762, "step": 74 }, { "epoch": 0.008202996828174559, "grad_norm": 0.8408651351928711, "learning_rate": 0.0001999986688579921, "loss": 0.6704, "step": 75 }, { "epoch": 0.008312370119216888, "grad_norm": 0.7103726267814636, "learning_rate": 0.0001999986090389097, "loss": 0.8437, "step": 76 }, { "epoch": 0.008421743410259214, "grad_norm": 1.084578275680542, "learning_rate": 0.00019999854790513452, "loss": 0.7259, "step": 77 }, { "epoch": 0.008531116701301543, "grad_norm": 0.8537347316741943, "learning_rate": 0.0001999984854566673, "loss": 0.8551, "step": 78 }, { "epoch": 0.00864048999234387, "grad_norm": 1.005993366241455, "learning_rate": 0.00019999842169350897, "loss": 0.9122, "step": 79 }, { "epoch": 0.008749863283386197, "grad_norm": 1.0594606399536133, "learning_rate": 0.00019999835661566032, "loss": 0.7878, "step": 80 }, { "epoch": 0.008859236574428525, "grad_norm": 0.9891486763954163, "learning_rate": 0.00019999829022312218, "loss": 0.9339, "step": 81 }, { "epoch": 0.008968609865470852, "grad_norm": 1.752136468887329, "learning_rate": 0.00019999822251589547, "loss": 0.637, "step": 82 }, { "epoch": 0.009077983156513179, "grad_norm": 1.3982586860656738, "learning_rate": 0.00019999815349398104, "loss": 0.8485, "step": 83 }, { "epoch": 0.009187356447555507, "grad_norm": 1.1201657056808472, "learning_rate": 0.00019999808315737983, "loss": 0.8483, "step": 84 }, { "epoch": 0.009296729738597834, "grad_norm": 1.1798042058944702, "learning_rate": 0.00019999801150609271, "loss": 1.1654, "step": 85 }, { "epoch": 0.009406103029640163, "grad_norm": 1.119722843170166, "learning_rate": 0.00019999793854012072, "loss": 0.9427, "step": 86 }, { "epoch": 0.00951547632068249, "grad_norm": 1.9652173519134521, "learning_rate": 0.0001999978642594647, "loss": 1.0173, "step": 87 }, { "epoch": 0.009624849611724816, "grad_norm": 0.8673993349075317, "learning_rate": 0.00019999778866412572, "loss": 0.843, "step": 88 }, { "epoch": 0.009734222902767145, "grad_norm": 0.9615687727928162, "learning_rate": 0.00019999771175410475, "loss": 1.0409, "step": 89 }, { "epoch": 0.009843596193809472, "grad_norm": 0.9303264021873474, "learning_rate": 0.00019999763352940278, "loss": 1.0045, "step": 90 }, { "epoch": 0.009952969484851798, "grad_norm": 1.1048322916030884, "learning_rate": 0.00019999755399002087, "loss": 0.9833, "step": 91 }, { "epoch": 0.010062342775894127, "grad_norm": 0.7181215286254883, "learning_rate": 0.00019999747313596003, "loss": 0.8382, "step": 92 }, { "epoch": 0.010171716066936454, "grad_norm": 1.0009384155273438, "learning_rate": 0.00019999739096722134, "loss": 0.8917, "step": 93 }, { "epoch": 0.010281089357978782, "grad_norm": 0.7550287842750549, "learning_rate": 0.00019999730748380588, "loss": 0.9104, "step": 94 }, { "epoch": 0.010390462649021109, "grad_norm": 1.126756191253662, "learning_rate": 0.00019999722268571475, "loss": 0.8792, "step": 95 }, { "epoch": 0.010499835940063436, "grad_norm": 1.0714164972305298, "learning_rate": 0.00019999713657294907, "loss": 0.9516, "step": 96 }, { "epoch": 0.010609209231105764, "grad_norm": 1.324127197265625, "learning_rate": 0.00019999704914550997, "loss": 0.997, "step": 97 }, { "epoch": 0.010718582522148091, "grad_norm": 0.8866165280342102, "learning_rate": 0.00019999696040339857, "loss": 0.7956, "step": 98 }, { "epoch": 0.01082795581319042, "grad_norm": 0.9012518525123596, "learning_rate": 0.00019999687034661607, "loss": 0.9225, "step": 99 }, { "epoch": 0.010937329104232747, "grad_norm": 0.7945853471755981, "learning_rate": 0.00019999677897516364, "loss": 1.1462, "step": 100 }, { "epoch": 0.011046702395275073, "grad_norm": 1.0762516260147095, "learning_rate": 0.0001999966862890425, "loss": 0.8994, "step": 101 }, { "epoch": 0.011156075686317402, "grad_norm": 0.872011661529541, "learning_rate": 0.00019999659228825384, "loss": 1.169, "step": 102 }, { "epoch": 0.011265448977359729, "grad_norm": 1.1329362392425537, "learning_rate": 0.0001999964969727989, "loss": 0.6135, "step": 103 }, { "epoch": 0.011374822268402056, "grad_norm": 1.047389268875122, "learning_rate": 0.00019999640034267898, "loss": 1.0515, "step": 104 }, { "epoch": 0.011484195559444384, "grad_norm": 1.3864418268203735, "learning_rate": 0.00019999630239789527, "loss": 0.6238, "step": 105 }, { "epoch": 0.01159356885048671, "grad_norm": 0.9831883311271667, "learning_rate": 0.00019999620313844915, "loss": 1.1318, "step": 106 }, { "epoch": 0.01170294214152904, "grad_norm": 1.0314894914627075, "learning_rate": 0.00019999610256434184, "loss": 0.7566, "step": 107 }, { "epoch": 0.011812315432571366, "grad_norm": 1.4733610153198242, "learning_rate": 0.00019999600067557472, "loss": 0.7978, "step": 108 }, { "epoch": 0.011921688723613693, "grad_norm": 0.9159018993377686, "learning_rate": 0.0001999958974721491, "loss": 0.8544, "step": 109 }, { "epoch": 0.012031062014656022, "grad_norm": 0.8146981596946716, "learning_rate": 0.00019999579295406635, "loss": 0.5639, "step": 110 }, { "epoch": 0.012140435305698348, "grad_norm": 0.8243168592453003, "learning_rate": 0.0001999956871213278, "loss": 0.7903, "step": 111 }, { "epoch": 0.012249808596740675, "grad_norm": 0.980814516544342, "learning_rate": 0.00019999557997393494, "loss": 1.01, "step": 112 }, { "epoch": 0.012359181887783004, "grad_norm": 1.437961459159851, "learning_rate": 0.0001999954715118891, "loss": 0.8245, "step": 113 }, { "epoch": 0.01246855517882533, "grad_norm": 1.483574390411377, "learning_rate": 0.0001999953617351917, "loss": 0.9152, "step": 114 }, { "epoch": 0.012577928469867659, "grad_norm": 0.9745296835899353, "learning_rate": 0.00019999525064384423, "loss": 0.7377, "step": 115 }, { "epoch": 0.012687301760909986, "grad_norm": 1.2854357957839966, "learning_rate": 0.00019999513823784813, "loss": 1.0215, "step": 116 }, { "epoch": 0.012796675051952313, "grad_norm": 1.4880210161209106, "learning_rate": 0.00019999502451720487, "loss": 0.6604, "step": 117 }, { "epoch": 0.012906048342994641, "grad_norm": 1.0523297786712646, "learning_rate": 0.00019999490948191594, "loss": 0.8873, "step": 118 }, { "epoch": 0.013015421634036968, "grad_norm": 1.0283764600753784, "learning_rate": 0.0001999947931319829, "loss": 0.8407, "step": 119 }, { "epoch": 0.013124794925079295, "grad_norm": 1.0384728908538818, "learning_rate": 0.0001999946754674072, "loss": 0.9039, "step": 120 }, { "epoch": 0.013234168216121623, "grad_norm": 0.8750423789024353, "learning_rate": 0.00019999455648819049, "loss": 1.0058, "step": 121 }, { "epoch": 0.01334354150716395, "grad_norm": 0.8427900075912476, "learning_rate": 0.00019999443619433423, "loss": 1.0078, "step": 122 }, { "epoch": 0.013452914798206279, "grad_norm": 1.3203353881835938, "learning_rate": 0.00019999431458584004, "loss": 0.8924, "step": 123 }, { "epoch": 0.013562288089248606, "grad_norm": 0.7723014950752258, "learning_rate": 0.00019999419166270954, "loss": 0.8432, "step": 124 }, { "epoch": 0.013671661380290932, "grad_norm": 0.9909713864326477, "learning_rate": 0.00019999406742494434, "loss": 0.8528, "step": 125 }, { "epoch": 0.01378103467133326, "grad_norm": 1.0303891897201538, "learning_rate": 0.00019999394187254606, "loss": 0.6699, "step": 126 }, { "epoch": 0.013890407962375588, "grad_norm": 0.8098687529563904, "learning_rate": 0.00019999381500551632, "loss": 1.0615, "step": 127 }, { "epoch": 0.013999781253417916, "grad_norm": 0.8698800206184387, "learning_rate": 0.00019999368682385686, "loss": 0.7004, "step": 128 }, { "epoch": 0.014109154544460243, "grad_norm": 1.163340449333191, "learning_rate": 0.00019999355732756936, "loss": 0.7752, "step": 129 }, { "epoch": 0.01421852783550257, "grad_norm": 1.1491297483444214, "learning_rate": 0.00019999342651665542, "loss": 1.0112, "step": 130 }, { "epoch": 0.014327901126544898, "grad_norm": 0.7571056485176086, "learning_rate": 0.00019999329439111688, "loss": 1.0722, "step": 131 }, { "epoch": 0.014437274417587225, "grad_norm": 1.1919002532958984, "learning_rate": 0.00019999316095095542, "loss": 0.7939, "step": 132 }, { "epoch": 0.014546647708629552, "grad_norm": 1.0839415788650513, "learning_rate": 0.0001999930261961728, "loss": 0.7247, "step": 133 }, { "epoch": 0.01465602099967188, "grad_norm": 1.123969316482544, "learning_rate": 0.00019999289012677079, "loss": 0.7543, "step": 134 }, { "epoch": 0.014765394290714207, "grad_norm": 1.1143224239349365, "learning_rate": 0.0001999927527427512, "loss": 1.0124, "step": 135 }, { "epoch": 0.014874767581756536, "grad_norm": 1.0003845691680908, "learning_rate": 0.00019999261404411579, "loss": 0.7766, "step": 136 }, { "epoch": 0.014984140872798863, "grad_norm": 1.154555082321167, "learning_rate": 0.00019999247403086642, "loss": 0.8062, "step": 137 }, { "epoch": 0.01509351416384119, "grad_norm": 1.1724870204925537, "learning_rate": 0.00019999233270300492, "loss": 0.7935, "step": 138 }, { "epoch": 0.015202887454883518, "grad_norm": 0.812342643737793, "learning_rate": 0.00019999219006053317, "loss": 0.7218, "step": 139 }, { "epoch": 0.015312260745925845, "grad_norm": 1.1357048749923706, "learning_rate": 0.00019999204610345302, "loss": 0.7117, "step": 140 }, { "epoch": 0.015421634036968172, "grad_norm": 0.9869748950004578, "learning_rate": 0.0001999919008317664, "loss": 0.9765, "step": 141 }, { "epoch": 0.0155310073280105, "grad_norm": 0.977894127368927, "learning_rate": 0.00019999175424547513, "loss": 0.7474, "step": 142 }, { "epoch": 0.01564038061905283, "grad_norm": 0.9802875518798828, "learning_rate": 0.00019999160634458124, "loss": 0.7464, "step": 143 }, { "epoch": 0.015749753910095154, "grad_norm": 0.8524045348167419, "learning_rate": 0.0001999914571290866, "loss": 0.7183, "step": 144 }, { "epoch": 0.015859127201137482, "grad_norm": 1.2041178941726685, "learning_rate": 0.0001999913065989932, "loss": 0.8245, "step": 145 }, { "epoch": 0.01596850049217981, "grad_norm": 1.451375126838684, "learning_rate": 0.00019999115475430304, "loss": 0.8932, "step": 146 }, { "epoch": 0.016077873783222136, "grad_norm": 0.8621544241905212, "learning_rate": 0.00019999100159501812, "loss": 1.1615, "step": 147 }, { "epoch": 0.016187247074264464, "grad_norm": 1.1287329196929932, "learning_rate": 0.00019999084712114042, "loss": 1.1429, "step": 148 }, { "epoch": 0.016296620365306793, "grad_norm": 1.1720576286315918, "learning_rate": 0.00019999069133267195, "loss": 0.5356, "step": 149 }, { "epoch": 0.016405993656349118, "grad_norm": 0.7974927425384521, "learning_rate": 0.00019999053422961482, "loss": 1.082, "step": 150 }, { "epoch": 0.016515366947391447, "grad_norm": 0.86858731508255, "learning_rate": 0.00019999037581197108, "loss": 0.7021, "step": 151 }, { "epoch": 0.016624740238433775, "grad_norm": 0.8884678483009338, "learning_rate": 0.00019999021607974276, "loss": 0.8077, "step": 152 }, { "epoch": 0.0167341135294761, "grad_norm": 1.3161729574203491, "learning_rate": 0.00019999005503293203, "loss": 0.6789, "step": 153 }, { "epoch": 0.01684348682051843, "grad_norm": 1.1194474697113037, "learning_rate": 0.00019998989267154093, "loss": 0.8708, "step": 154 }, { "epoch": 0.016952860111560757, "grad_norm": 1.1400177478790283, "learning_rate": 0.0001999897289955717, "loss": 0.8416, "step": 155 }, { "epoch": 0.017062233402603086, "grad_norm": 1.155961513519287, "learning_rate": 0.0001999895640050264, "loss": 0.9628, "step": 156 }, { "epoch": 0.01717160669364541, "grad_norm": 1.5118356943130493, "learning_rate": 0.00019998939769990727, "loss": 0.9591, "step": 157 }, { "epoch": 0.01728097998468774, "grad_norm": 1.029440999031067, "learning_rate": 0.0001999892300802164, "loss": 0.5659, "step": 158 }, { "epoch": 0.017390353275730068, "grad_norm": 1.3784666061401367, "learning_rate": 0.00019998906114595608, "loss": 1.018, "step": 159 }, { "epoch": 0.017499726566772393, "grad_norm": 0.9848626852035522, "learning_rate": 0.00019998889089712849, "loss": 0.8016, "step": 160 }, { "epoch": 0.01760909985781472, "grad_norm": 1.188879132270813, "learning_rate": 0.0001999887193337359, "loss": 1.2011, "step": 161 }, { "epoch": 0.01771847314885705, "grad_norm": 0.9314888119697571, "learning_rate": 0.00019998854645578057, "loss": 0.7455, "step": 162 }, { "epoch": 0.017827846439899375, "grad_norm": 1.001659870147705, "learning_rate": 0.00019998837226326469, "loss": 1.033, "step": 163 }, { "epoch": 0.017937219730941704, "grad_norm": 1.4195637702941895, "learning_rate": 0.00019998819675619064, "loss": 0.8527, "step": 164 }, { "epoch": 0.018046593021984032, "grad_norm": 0.8885000944137573, "learning_rate": 0.00019998801993456069, "loss": 0.6358, "step": 165 }, { "epoch": 0.018155966313026357, "grad_norm": 1.070360779762268, "learning_rate": 0.0001999878417983772, "loss": 0.7843, "step": 166 }, { "epoch": 0.018265339604068686, "grad_norm": 1.1388875246047974, "learning_rate": 0.00019998766234764247, "loss": 0.9364, "step": 167 }, { "epoch": 0.018374712895111014, "grad_norm": 2.4844179153442383, "learning_rate": 0.00019998748158235884, "loss": 0.6608, "step": 168 }, { "epoch": 0.018484086186153343, "grad_norm": 1.0103005170822144, "learning_rate": 0.00019998729950252876, "loss": 0.7691, "step": 169 }, { "epoch": 0.018593459477195668, "grad_norm": 0.9184209704399109, "learning_rate": 0.00019998711610815458, "loss": 0.914, "step": 170 }, { "epoch": 0.018702832768237997, "grad_norm": 1.0094612836837769, "learning_rate": 0.00019998693139923867, "loss": 0.9174, "step": 171 }, { "epoch": 0.018812206059280325, "grad_norm": 0.7898897528648376, "learning_rate": 0.00019998674537578353, "loss": 0.9579, "step": 172 }, { "epoch": 0.01892157935032265, "grad_norm": 1.0184580087661743, "learning_rate": 0.00019998655803779163, "loss": 0.8242, "step": 173 }, { "epoch": 0.01903095264136498, "grad_norm": 1.002568244934082, "learning_rate": 0.00019998636938526533, "loss": 0.9002, "step": 174 }, { "epoch": 0.019140325932407307, "grad_norm": 0.7966347932815552, "learning_rate": 0.00019998617941820716, "loss": 1.0177, "step": 175 }, { "epoch": 0.019249699223449632, "grad_norm": 1.333112359046936, "learning_rate": 0.00019998598813661964, "loss": 0.6221, "step": 176 }, { "epoch": 0.01935907251449196, "grad_norm": 1.2348626852035522, "learning_rate": 0.00019998579554050526, "loss": 0.6833, "step": 177 }, { "epoch": 0.01946844580553429, "grad_norm": 1.1256965398788452, "learning_rate": 0.00019998560162986655, "loss": 0.9427, "step": 178 }, { "epoch": 0.019577819096576615, "grad_norm": 1.006744146347046, "learning_rate": 0.00019998540640470608, "loss": 0.8733, "step": 179 }, { "epoch": 0.019687192387618943, "grad_norm": 0.9952765107154846, "learning_rate": 0.00019998520986502636, "loss": 0.8656, "step": 180 }, { "epoch": 0.01979656567866127, "grad_norm": 0.9037217497825623, "learning_rate": 0.00019998501201083004, "loss": 0.9612, "step": 181 }, { "epoch": 0.019905938969703597, "grad_norm": 1.0065454244613647, "learning_rate": 0.0001999848128421197, "loss": 0.7898, "step": 182 }, { "epoch": 0.020015312260745925, "grad_norm": 1.0890108346939087, "learning_rate": 0.00019998461235889797, "loss": 0.7269, "step": 183 }, { "epoch": 0.020124685551788254, "grad_norm": 1.2539864778518677, "learning_rate": 0.00019998441056116745, "loss": 0.7934, "step": 184 }, { "epoch": 0.020234058842830582, "grad_norm": 0.9602129459381104, "learning_rate": 0.00019998420744893084, "loss": 0.549, "step": 185 }, { "epoch": 0.020343432133872907, "grad_norm": 1.4105061292648315, "learning_rate": 0.00019998400302219076, "loss": 1.005, "step": 186 }, { "epoch": 0.020452805424915236, "grad_norm": 1.430650234222412, "learning_rate": 0.0001999837972809499, "loss": 0.7051, "step": 187 }, { "epoch": 0.020562178715957564, "grad_norm": 1.191211223602295, "learning_rate": 0.00019998359022521106, "loss": 0.7129, "step": 188 }, { "epoch": 0.02067155200699989, "grad_norm": 0.9433074593544006, "learning_rate": 0.00019998338185497682, "loss": 0.7383, "step": 189 }, { "epoch": 0.020780925298042218, "grad_norm": 1.2458714246749878, "learning_rate": 0.00019998317217025005, "loss": 0.7533, "step": 190 }, { "epoch": 0.020890298589084547, "grad_norm": 1.443598747253418, "learning_rate": 0.00019998296117103341, "loss": 0.7505, "step": 191 }, { "epoch": 0.02099967188012687, "grad_norm": 0.9617491364479065, "learning_rate": 0.00019998274885732971, "loss": 0.8154, "step": 192 }, { "epoch": 0.0211090451711692, "grad_norm": 1.0256359577178955, "learning_rate": 0.00019998253522914174, "loss": 0.8709, "step": 193 }, { "epoch": 0.02121841846221153, "grad_norm": 1.1407520771026611, "learning_rate": 0.0001999823202864723, "loss": 1.0066, "step": 194 }, { "epoch": 0.021327791753253854, "grad_norm": 0.9075395464897156, "learning_rate": 0.00019998210402932424, "loss": 0.7433, "step": 195 }, { "epoch": 0.021437165044296182, "grad_norm": 1.1892637014389038, "learning_rate": 0.0001999818864577004, "loss": 0.6049, "step": 196 }, { "epoch": 0.02154653833533851, "grad_norm": 1.0141085386276245, "learning_rate": 0.0001999816675716036, "loss": 1.0684, "step": 197 }, { "epoch": 0.02165591162638084, "grad_norm": 1.0636556148529053, "learning_rate": 0.00019998144737103682, "loss": 1.0034, "step": 198 }, { "epoch": 0.021765284917423165, "grad_norm": 0.9643628597259521, "learning_rate": 0.0001999812258560028, "loss": 0.9938, "step": 199 }, { "epoch": 0.021874658208465493, "grad_norm": 0.9733682870864868, "learning_rate": 0.00019998100302650457, "loss": 1.0145, "step": 200 }, { "epoch": 0.021874658208465493, "eval_loss": 0.8068432807922363, "eval_runtime": 40.9547, "eval_samples_per_second": 17.971, "eval_steps_per_second": 4.493, "step": 200 }, { "epoch": 0.02198403149950782, "grad_norm": 0.89620041847229, "learning_rate": 0.00019998077888254501, "loss": 0.8309, "step": 201 }, { "epoch": 0.022093404790550147, "grad_norm": 1.041070580482483, "learning_rate": 0.0001999805534241271, "loss": 0.8251, "step": 202 }, { "epoch": 0.022202778081592475, "grad_norm": 0.8770344853401184, "learning_rate": 0.00019998032665125378, "loss": 0.9149, "step": 203 }, { "epoch": 0.022312151372634804, "grad_norm": 0.9978107810020447, "learning_rate": 0.000199980098563928, "loss": 0.8845, "step": 204 }, { "epoch": 0.02242152466367713, "grad_norm": 1.1167197227478027, "learning_rate": 0.00019997986916215284, "loss": 0.9254, "step": 205 }, { "epoch": 0.022530897954719457, "grad_norm": 1.0514531135559082, "learning_rate": 0.00019997963844593127, "loss": 0.8273, "step": 206 }, { "epoch": 0.022640271245761786, "grad_norm": 1.027596116065979, "learning_rate": 0.0001999794064152663, "loss": 0.867, "step": 207 }, { "epoch": 0.02274964453680411, "grad_norm": 1.3077362775802612, "learning_rate": 0.00019997917307016102, "loss": 0.9528, "step": 208 }, { "epoch": 0.02285901782784644, "grad_norm": 1.2617202997207642, "learning_rate": 0.0001999789384106185, "loss": 0.4163, "step": 209 }, { "epoch": 0.022968391118888768, "grad_norm": 1.9169830083847046, "learning_rate": 0.00019997870243664177, "loss": 0.8746, "step": 210 }, { "epoch": 0.023077764409931093, "grad_norm": 0.9455872774124146, "learning_rate": 0.00019997846514823396, "loss": 0.9282, "step": 211 }, { "epoch": 0.02318713770097342, "grad_norm": 1.0044574737548828, "learning_rate": 0.00019997822654539826, "loss": 0.8485, "step": 212 }, { "epoch": 0.02329651099201575, "grad_norm": 0.9601938128471375, "learning_rate": 0.00019997798662813772, "loss": 0.6501, "step": 213 }, { "epoch": 0.02340588428305808, "grad_norm": 0.7503620982170105, "learning_rate": 0.0001999777453964555, "loss": 0.9953, "step": 214 }, { "epoch": 0.023515257574100404, "grad_norm": 0.8733282685279846, "learning_rate": 0.0001999775028503548, "loss": 0.7488, "step": 215 }, { "epoch": 0.023624630865142732, "grad_norm": 1.1373885869979858, "learning_rate": 0.00019997725898983883, "loss": 0.8603, "step": 216 }, { "epoch": 0.02373400415618506, "grad_norm": 1.1404668092727661, "learning_rate": 0.00019997701381491072, "loss": 0.8454, "step": 217 }, { "epoch": 0.023843377447227386, "grad_norm": 0.7852329015731812, "learning_rate": 0.00019997676732557378, "loss": 0.5155, "step": 218 }, { "epoch": 0.023952750738269715, "grad_norm": 0.6994953751564026, "learning_rate": 0.0001999765195218312, "loss": 0.8015, "step": 219 }, { "epoch": 0.024062124029312043, "grad_norm": 1.1219515800476074, "learning_rate": 0.00019997627040368622, "loss": 0.94, "step": 220 }, { "epoch": 0.024171497320354368, "grad_norm": 1.3120551109313965, "learning_rate": 0.00019997601997114218, "loss": 0.9221, "step": 221 }, { "epoch": 0.024280870611396697, "grad_norm": 1.1464701890945435, "learning_rate": 0.00019997576822420232, "loss": 0.6533, "step": 222 }, { "epoch": 0.024390243902439025, "grad_norm": 0.9645900726318359, "learning_rate": 0.00019997551516286999, "loss": 1.0048, "step": 223 }, { "epoch": 0.02449961719348135, "grad_norm": 0.811614990234375, "learning_rate": 0.0001999752607871485, "loss": 1.1218, "step": 224 }, { "epoch": 0.02460899048452368, "grad_norm": 1.0914621353149414, "learning_rate": 0.0001999750050970411, "loss": 0.765, "step": 225 }, { "epoch": 0.024718363775566007, "grad_norm": 1.0596243143081665, "learning_rate": 0.00019997474809255135, "loss": 1.0341, "step": 226 }, { "epoch": 0.024827737066608336, "grad_norm": 1.055033564567566, "learning_rate": 0.00019997448977368247, "loss": 0.6386, "step": 227 }, { "epoch": 0.02493711035765066, "grad_norm": 0.9922929406166077, "learning_rate": 0.0001999742301404379, "loss": 0.7942, "step": 228 }, { "epoch": 0.02504648364869299, "grad_norm": 1.2093638181686401, "learning_rate": 0.00019997396919282107, "loss": 0.8164, "step": 229 }, { "epoch": 0.025155856939735318, "grad_norm": 1.3952484130859375, "learning_rate": 0.0001999737069308354, "loss": 0.8928, "step": 230 }, { "epoch": 0.025265230230777643, "grad_norm": 0.9438846707344055, "learning_rate": 0.00019997344335448433, "loss": 0.6457, "step": 231 }, { "epoch": 0.02537460352181997, "grad_norm": 0.7343907952308655, "learning_rate": 0.00019997317846377134, "loss": 0.8762, "step": 232 }, { "epoch": 0.0254839768128623, "grad_norm": 1.0288769006729126, "learning_rate": 0.00019997291225869987, "loss": 0.7636, "step": 233 }, { "epoch": 0.025593350103904625, "grad_norm": 1.232852578163147, "learning_rate": 0.00019997264473927347, "loss": 0.6876, "step": 234 }, { "epoch": 0.025702723394946954, "grad_norm": 1.0084220170974731, "learning_rate": 0.00019997237590549567, "loss": 0.8275, "step": 235 }, { "epoch": 0.025812096685989282, "grad_norm": 1.7499910593032837, "learning_rate": 0.00019997210575736999, "loss": 1.1544, "step": 236 }, { "epoch": 0.025921469977031607, "grad_norm": 0.9005192518234253, "learning_rate": 0.00019997183429489992, "loss": 0.9512, "step": 237 }, { "epoch": 0.026030843268073936, "grad_norm": 1.054895281791687, "learning_rate": 0.0001999715615180891, "loss": 0.7701, "step": 238 }, { "epoch": 0.026140216559116265, "grad_norm": 0.9881554245948792, "learning_rate": 0.00019997128742694107, "loss": 0.9372, "step": 239 }, { "epoch": 0.02624958985015859, "grad_norm": 0.9707517027854919, "learning_rate": 0.00019997101202145947, "loss": 0.978, "step": 240 }, { "epoch": 0.026358963141200918, "grad_norm": 1.2869802713394165, "learning_rate": 0.0001999707353016479, "loss": 1.1234, "step": 241 }, { "epoch": 0.026468336432243247, "grad_norm": 1.2063279151916504, "learning_rate": 0.00019997045726751001, "loss": 0.7118, "step": 242 }, { "epoch": 0.026577709723285575, "grad_norm": 0.9686263799667358, "learning_rate": 0.00019997017791904947, "loss": 0.8869, "step": 243 }, { "epoch": 0.0266870830143279, "grad_norm": 0.963753342628479, "learning_rate": 0.00019996989725626992, "loss": 0.8479, "step": 244 }, { "epoch": 0.02679645630537023, "grad_norm": 0.8817402720451355, "learning_rate": 0.00019996961527917506, "loss": 0.5295, "step": 245 }, { "epoch": 0.026905829596412557, "grad_norm": 1.706606149673462, "learning_rate": 0.00019996933198776858, "loss": 0.7777, "step": 246 }, { "epoch": 0.027015202887454882, "grad_norm": 0.8349090814590454, "learning_rate": 0.00019996904738205426, "loss": 0.836, "step": 247 }, { "epoch": 0.02712457617849721, "grad_norm": 0.9602643251419067, "learning_rate": 0.00019996876146203578, "loss": 1.0578, "step": 248 }, { "epoch": 0.02723394946953954, "grad_norm": 0.8937216401100159, "learning_rate": 0.00019996847422771693, "loss": 0.8529, "step": 249 }, { "epoch": 0.027343322760581865, "grad_norm": 0.9380630254745483, "learning_rate": 0.00019996818567910148, "loss": 0.8573, "step": 250 }, { "epoch": 0.027452696051624193, "grad_norm": 1.332655668258667, "learning_rate": 0.00019996789581619323, "loss": 0.629, "step": 251 }, { "epoch": 0.02756206934266652, "grad_norm": 1.4816393852233887, "learning_rate": 0.000199967604638996, "loss": 0.7475, "step": 252 }, { "epoch": 0.027671442633708847, "grad_norm": 1.049055814743042, "learning_rate": 0.0001999673121475136, "loss": 0.7129, "step": 253 }, { "epoch": 0.027780815924751175, "grad_norm": 1.3890293836593628, "learning_rate": 0.00019996701834174986, "loss": 1.0256, "step": 254 }, { "epoch": 0.027890189215793504, "grad_norm": 1.0529813766479492, "learning_rate": 0.00019996672322170867, "loss": 1.0666, "step": 255 }, { "epoch": 0.027999562506835832, "grad_norm": 0.8624351024627686, "learning_rate": 0.0001999664267873939, "loss": 0.6948, "step": 256 }, { "epoch": 0.028108935797878157, "grad_norm": 0.8577688336372375, "learning_rate": 0.00019996612903880947, "loss": 0.82, "step": 257 }, { "epoch": 0.028218309088920486, "grad_norm": 0.8573757410049438, "learning_rate": 0.00019996582997595924, "loss": 0.8273, "step": 258 }, { "epoch": 0.028327682379962815, "grad_norm": 1.2395519018173218, "learning_rate": 0.0001999655295988472, "loss": 0.8064, "step": 259 }, { "epoch": 0.02843705567100514, "grad_norm": 0.8964936137199402, "learning_rate": 0.00019996522790747726, "loss": 0.7224, "step": 260 }, { "epoch": 0.028546428962047468, "grad_norm": 0.9282931685447693, "learning_rate": 0.00019996492490185341, "loss": 0.9585, "step": 261 }, { "epoch": 0.028655802253089797, "grad_norm": 1.1618013381958008, "learning_rate": 0.00019996462058197962, "loss": 0.7717, "step": 262 }, { "epoch": 0.028765175544132122, "grad_norm": 0.9413585662841797, "learning_rate": 0.00019996431494785993, "loss": 0.7748, "step": 263 }, { "epoch": 0.02887454883517445, "grad_norm": 1.3444674015045166, "learning_rate": 0.0001999640079994983, "loss": 1.0287, "step": 264 }, { "epoch": 0.02898392212621678, "grad_norm": 1.3082046508789062, "learning_rate": 0.00019996369973689876, "loss": 0.7817, "step": 265 }, { "epoch": 0.029093295417259104, "grad_norm": 1.4798815250396729, "learning_rate": 0.0001999633901600654, "loss": 0.791, "step": 266 }, { "epoch": 0.029202668708301432, "grad_norm": 1.3128074407577515, "learning_rate": 0.00019996307926900233, "loss": 0.9972, "step": 267 }, { "epoch": 0.02931204199934376, "grad_norm": 1.3363100290298462, "learning_rate": 0.00019996276706371355, "loss": 0.7227, "step": 268 }, { "epoch": 0.029421415290386086, "grad_norm": 1.2146847248077393, "learning_rate": 0.00019996245354420323, "loss": 0.7839, "step": 269 }, { "epoch": 0.029530788581428415, "grad_norm": 1.0506778955459595, "learning_rate": 0.00019996213871047543, "loss": 0.8816, "step": 270 }, { "epoch": 0.029640161872470743, "grad_norm": 1.0352805852890015, "learning_rate": 0.00019996182256253435, "loss": 0.9029, "step": 271 }, { "epoch": 0.02974953516351307, "grad_norm": 1.319678544998169, "learning_rate": 0.00019996150510038412, "loss": 1.0377, "step": 272 }, { "epoch": 0.029858908454555397, "grad_norm": 1.0857889652252197, "learning_rate": 0.00019996118632402892, "loss": 0.8303, "step": 273 }, { "epoch": 0.029968281745597725, "grad_norm": 1.0412633419036865, "learning_rate": 0.00019996086623347292, "loss": 0.7897, "step": 274 }, { "epoch": 0.030077655036640054, "grad_norm": 0.9532299637794495, "learning_rate": 0.00019996054482872036, "loss": 0.834, "step": 275 }, { "epoch": 0.03018702832768238, "grad_norm": 1.0339388847351074, "learning_rate": 0.00019996022210977543, "loss": 0.8657, "step": 276 }, { "epoch": 0.030296401618724707, "grad_norm": 0.7535502910614014, "learning_rate": 0.00019995989807664242, "loss": 0.8136, "step": 277 }, { "epoch": 0.030405774909767036, "grad_norm": 1.1453170776367188, "learning_rate": 0.00019995957272932554, "loss": 0.6857, "step": 278 }, { "epoch": 0.03051514820080936, "grad_norm": 1.1806614398956299, "learning_rate": 0.0001999592460678291, "loss": 0.9984, "step": 279 }, { "epoch": 0.03062452149185169, "grad_norm": 1.112640142440796, "learning_rate": 0.0001999589180921574, "loss": 0.761, "step": 280 }, { "epoch": 0.030733894782894018, "grad_norm": 1.4966400861740112, "learning_rate": 0.0001999585888023147, "loss": 0.8953, "step": 281 }, { "epoch": 0.030843268073936343, "grad_norm": 1.293006420135498, "learning_rate": 0.0001999582581983054, "loss": 1.0241, "step": 282 }, { "epoch": 0.030952641364978672, "grad_norm": 1.177804946899414, "learning_rate": 0.0001999579262801338, "loss": 0.5965, "step": 283 }, { "epoch": 0.031062014656021, "grad_norm": 0.9398424029350281, "learning_rate": 0.0001999575930478043, "loss": 1.0178, "step": 284 }, { "epoch": 0.03117138794706333, "grad_norm": 1.0919867753982544, "learning_rate": 0.00019995725850132122, "loss": 0.9371, "step": 285 }, { "epoch": 0.03128076123810566, "grad_norm": 1.0972379446029663, "learning_rate": 0.000199956922640689, "loss": 0.962, "step": 286 }, { "epoch": 0.03139013452914798, "grad_norm": 1.2337533235549927, "learning_rate": 0.00019995658546591205, "loss": 1.1587, "step": 287 }, { "epoch": 0.03149950782019031, "grad_norm": 0.93784499168396, "learning_rate": 0.00019995624697699484, "loss": 0.7551, "step": 288 }, { "epoch": 0.03160888111123264, "grad_norm": 0.9531101584434509, "learning_rate": 0.00019995590717394177, "loss": 0.8181, "step": 289 }, { "epoch": 0.031718254402274965, "grad_norm": 1.0460001230239868, "learning_rate": 0.00019995556605675733, "loss": 1.0045, "step": 290 }, { "epoch": 0.03182762769331729, "grad_norm": 1.0514802932739258, "learning_rate": 0.00019995522362544597, "loss": 0.6646, "step": 291 }, { "epoch": 0.03193700098435962, "grad_norm": 1.0225249528884888, "learning_rate": 0.0001999548798800122, "loss": 0.8103, "step": 292 }, { "epoch": 0.03204637427540195, "grad_norm": 0.8883015513420105, "learning_rate": 0.0001999545348204606, "loss": 1.0488, "step": 293 }, { "epoch": 0.03215574756644427, "grad_norm": 0.8221065998077393, "learning_rate": 0.00019995418844679565, "loss": 0.7915, "step": 294 }, { "epoch": 0.032265120857486604, "grad_norm": 0.8032001852989197, "learning_rate": 0.00019995384075902192, "loss": 0.7785, "step": 295 }, { "epoch": 0.03237449414852893, "grad_norm": 1.0787360668182373, "learning_rate": 0.00019995349175714399, "loss": 0.6105, "step": 296 }, { "epoch": 0.032483867439571254, "grad_norm": 1.3346359729766846, "learning_rate": 0.00019995314144116642, "loss": 0.8981, "step": 297 }, { "epoch": 0.032593240730613586, "grad_norm": 1.1637407541275024, "learning_rate": 0.00019995278981109382, "loss": 0.6765, "step": 298 }, { "epoch": 0.03270261402165591, "grad_norm": 1.3199541568756104, "learning_rate": 0.00019995243686693085, "loss": 0.896, "step": 299 }, { "epoch": 0.032811987312698236, "grad_norm": 1.139554738998413, "learning_rate": 0.00019995208260868211, "loss": 0.865, "step": 300 }, { "epoch": 0.03292136060374057, "grad_norm": 1.1647419929504395, "learning_rate": 0.00019995172703635232, "loss": 0.7797, "step": 301 }, { "epoch": 0.03303073389478289, "grad_norm": 0.7142788767814636, "learning_rate": 0.00019995137014994606, "loss": 0.8755, "step": 302 }, { "epoch": 0.03314010718582522, "grad_norm": 0.908873438835144, "learning_rate": 0.00019995101194946808, "loss": 0.9655, "step": 303 }, { "epoch": 0.03324948047686755, "grad_norm": 1.0069727897644043, "learning_rate": 0.0001999506524349231, "loss": 0.9139, "step": 304 }, { "epoch": 0.033358853767909875, "grad_norm": 0.8300521373748779, "learning_rate": 0.0001999502916063158, "loss": 0.9362, "step": 305 }, { "epoch": 0.0334682270589522, "grad_norm": 1.2162195444107056, "learning_rate": 0.00019994992946365098, "loss": 0.7641, "step": 306 }, { "epoch": 0.03357760034999453, "grad_norm": 0.970177173614502, "learning_rate": 0.00019994956600693335, "loss": 0.9676, "step": 307 }, { "epoch": 0.03368697364103686, "grad_norm": 0.9938404560089111, "learning_rate": 0.00019994920123616772, "loss": 0.8936, "step": 308 }, { "epoch": 0.03379634693207919, "grad_norm": 1.2428972721099854, "learning_rate": 0.00019994883515135888, "loss": 0.885, "step": 309 }, { "epoch": 0.033905720223121515, "grad_norm": 0.8554952144622803, "learning_rate": 0.00019994846775251161, "loss": 1.0265, "step": 310 }, { "epoch": 0.03401509351416384, "grad_norm": 0.9248100519180298, "learning_rate": 0.00019994809903963078, "loss": 0.9309, "step": 311 }, { "epoch": 0.03412446680520617, "grad_norm": 1.1711786985397339, "learning_rate": 0.00019994772901272124, "loss": 0.867, "step": 312 }, { "epoch": 0.0342338400962485, "grad_norm": 1.6409622430801392, "learning_rate": 0.00019994735767178785, "loss": 1.0833, "step": 313 }, { "epoch": 0.03434321338729082, "grad_norm": 1.0994210243225098, "learning_rate": 0.00019994698501683546, "loss": 0.9876, "step": 314 }, { "epoch": 0.034452586678333154, "grad_norm": 1.307111144065857, "learning_rate": 0.00019994661104786901, "loss": 1.1115, "step": 315 }, { "epoch": 0.03456195996937548, "grad_norm": 1.2924015522003174, "learning_rate": 0.0001999462357648934, "loss": 0.7232, "step": 316 }, { "epoch": 0.034671333260417804, "grad_norm": 0.8390319347381592, "learning_rate": 0.00019994585916791353, "loss": 0.8054, "step": 317 }, { "epoch": 0.034780706551460136, "grad_norm": 1.4466496706008911, "learning_rate": 0.0001999454812569344, "loss": 0.8531, "step": 318 }, { "epoch": 0.03489007984250246, "grad_norm": 0.805334746837616, "learning_rate": 0.000199945102031961, "loss": 0.7877, "step": 319 }, { "epoch": 0.034999453133544786, "grad_norm": 0.8856577277183533, "learning_rate": 0.00019994472149299823, "loss": 1.0711, "step": 320 }, { "epoch": 0.03510882642458712, "grad_norm": 1.0543880462646484, "learning_rate": 0.00019994433964005116, "loss": 0.6526, "step": 321 }, { "epoch": 0.03521819971562944, "grad_norm": 0.9808034896850586, "learning_rate": 0.0001999439564731248, "loss": 0.6553, "step": 322 }, { "epoch": 0.03532757300667177, "grad_norm": 1.1530299186706543, "learning_rate": 0.00019994357199222418, "loss": 0.8814, "step": 323 }, { "epoch": 0.0354369462977141, "grad_norm": 1.1313234567642212, "learning_rate": 0.00019994318619735434, "loss": 0.73, "step": 324 }, { "epoch": 0.035546319588756425, "grad_norm": 1.1225991249084473, "learning_rate": 0.00019994279908852036, "loss": 0.8988, "step": 325 }, { "epoch": 0.03565569287979875, "grad_norm": 1.2102971076965332, "learning_rate": 0.00019994241066572735, "loss": 0.6714, "step": 326 }, { "epoch": 0.03576506617084108, "grad_norm": 1.3862812519073486, "learning_rate": 0.0001999420209289804, "loss": 0.6208, "step": 327 }, { "epoch": 0.03587443946188341, "grad_norm": 1.3298919200897217, "learning_rate": 0.00019994162987828465, "loss": 0.9615, "step": 328 }, { "epoch": 0.03598381275292573, "grad_norm": 1.1198225021362305, "learning_rate": 0.00019994123751364523, "loss": 0.8243, "step": 329 }, { "epoch": 0.036093186043968065, "grad_norm": 1.2356019020080566, "learning_rate": 0.00019994084383506726, "loss": 0.9731, "step": 330 }, { "epoch": 0.03620255933501039, "grad_norm": 1.9511923789978027, "learning_rate": 0.00019994044884255596, "loss": 0.8388, "step": 331 }, { "epoch": 0.036311932626052715, "grad_norm": 0.8875001072883606, "learning_rate": 0.00019994005253611653, "loss": 1.0167, "step": 332 }, { "epoch": 0.03642130591709505, "grad_norm": 1.0356827974319458, "learning_rate": 0.00019993965491575414, "loss": 0.7601, "step": 333 }, { "epoch": 0.03653067920813737, "grad_norm": 1.9006911516189575, "learning_rate": 0.00019993925598147408, "loss": 0.8644, "step": 334 }, { "epoch": 0.0366400524991797, "grad_norm": 1.149804711341858, "learning_rate": 0.00019993885573328153, "loss": 0.7937, "step": 335 }, { "epoch": 0.03674942579022203, "grad_norm": 1.0978573560714722, "learning_rate": 0.00019993845417118176, "loss": 0.9806, "step": 336 }, { "epoch": 0.036858799081264354, "grad_norm": 1.353148341178894, "learning_rate": 0.0001999380512951801, "loss": 0.6028, "step": 337 }, { "epoch": 0.036968172372306686, "grad_norm": 1.0444083213806152, "learning_rate": 0.00019993764710528184, "loss": 0.674, "step": 338 }, { "epoch": 0.03707754566334901, "grad_norm": 0.7757420539855957, "learning_rate": 0.00019993724160149222, "loss": 0.937, "step": 339 }, { "epoch": 0.037186918954391336, "grad_norm": 0.8659959435462952, "learning_rate": 0.00019993683478381665, "loss": 1.0106, "step": 340 }, { "epoch": 0.03729629224543367, "grad_norm": 0.8398618698120117, "learning_rate": 0.00019993642665226046, "loss": 0.7869, "step": 341 }, { "epoch": 0.03740566553647599, "grad_norm": 0.8791778087615967, "learning_rate": 0.00019993601720682898, "loss": 0.903, "step": 342 }, { "epoch": 0.03751503882751832, "grad_norm": 1.330810785293579, "learning_rate": 0.0001999356064475276, "loss": 0.6288, "step": 343 }, { "epoch": 0.03762441211856065, "grad_norm": 1.0563044548034668, "learning_rate": 0.00019993519437436176, "loss": 0.5645, "step": 344 }, { "epoch": 0.037733785409602975, "grad_norm": 1.2644983530044556, "learning_rate": 0.00019993478098733687, "loss": 0.8415, "step": 345 }, { "epoch": 0.0378431587006453, "grad_norm": 0.8137854337692261, "learning_rate": 0.00019993436628645833, "loss": 1.0094, "step": 346 }, { "epoch": 0.03795253199168763, "grad_norm": 1.2424585819244385, "learning_rate": 0.0001999339502717316, "loss": 0.7191, "step": 347 }, { "epoch": 0.03806190528272996, "grad_norm": 1.3705171346664429, "learning_rate": 0.0001999335329431622, "loss": 0.5286, "step": 348 }, { "epoch": 0.03817127857377228, "grad_norm": 1.1841068267822266, "learning_rate": 0.00019993311430075553, "loss": 0.5205, "step": 349 }, { "epoch": 0.038280651864814615, "grad_norm": 1.2048940658569336, "learning_rate": 0.00019993269434451718, "loss": 0.9276, "step": 350 }, { "epoch": 0.03839002515585694, "grad_norm": 1.2034653425216675, "learning_rate": 0.0001999322730744526, "loss": 0.7758, "step": 351 }, { "epoch": 0.038499398446899265, "grad_norm": 1.435682773590088, "learning_rate": 0.00019993185049056738, "loss": 0.8242, "step": 352 }, { "epoch": 0.0386087717379416, "grad_norm": 1.1770561933517456, "learning_rate": 0.0001999314265928671, "loss": 0.9822, "step": 353 }, { "epoch": 0.03871814502898392, "grad_norm": 0.7326700687408447, "learning_rate": 0.00019993100138135725, "loss": 0.8557, "step": 354 }, { "epoch": 0.03882751832002625, "grad_norm": 1.003616213798523, "learning_rate": 0.00019993057485604348, "loss": 0.6837, "step": 355 }, { "epoch": 0.03893689161106858, "grad_norm": 1.0169602632522583, "learning_rate": 0.00019993014701693134, "loss": 0.9012, "step": 356 }, { "epoch": 0.039046264902110904, "grad_norm": 1.0350092649459839, "learning_rate": 0.00019992971786402653, "loss": 0.867, "step": 357 }, { "epoch": 0.03915563819315323, "grad_norm": 1.0841048955917358, "learning_rate": 0.00019992928739733464, "loss": 0.4754, "step": 358 }, { "epoch": 0.03926501148419556, "grad_norm": 1.2736769914627075, "learning_rate": 0.00019992885561686134, "loss": 0.9531, "step": 359 }, { "epoch": 0.039374384775237886, "grad_norm": 0.9346782565116882, "learning_rate": 0.00019992842252261232, "loss": 0.6625, "step": 360 }, { "epoch": 0.03948375806628021, "grad_norm": 0.9822466373443604, "learning_rate": 0.00019992798811459327, "loss": 0.9554, "step": 361 }, { "epoch": 0.03959313135732254, "grad_norm": 1.0642709732055664, "learning_rate": 0.0001999275523928099, "loss": 0.8168, "step": 362 }, { "epoch": 0.03970250464836487, "grad_norm": 1.0021849870681763, "learning_rate": 0.00019992711535726793, "loss": 0.7259, "step": 363 }, { "epoch": 0.03981187793940719, "grad_norm": 1.1150245666503906, "learning_rate": 0.00019992667700797313, "loss": 1.01, "step": 364 }, { "epoch": 0.039921251230449525, "grad_norm": 1.0754119157791138, "learning_rate": 0.00019992623734493118, "loss": 1.0127, "step": 365 }, { "epoch": 0.04003062452149185, "grad_norm": 0.9095409512519836, "learning_rate": 0.000199925796368148, "loss": 0.818, "step": 366 }, { "epoch": 0.04013999781253418, "grad_norm": 1.5074443817138672, "learning_rate": 0.00019992535407762927, "loss": 0.7231, "step": 367 }, { "epoch": 0.04024937110357651, "grad_norm": 1.306563377380371, "learning_rate": 0.00019992491047338086, "loss": 0.8003, "step": 368 }, { "epoch": 0.04035874439461883, "grad_norm": 1.491228699684143, "learning_rate": 0.00019992446555540857, "loss": 0.9417, "step": 369 }, { "epoch": 0.040468117685661165, "grad_norm": 1.25246262550354, "learning_rate": 0.0001999240193237183, "loss": 0.6386, "step": 370 }, { "epoch": 0.04057749097670349, "grad_norm": 0.9611380100250244, "learning_rate": 0.00019992357177831587, "loss": 1.0323, "step": 371 }, { "epoch": 0.040686864267745815, "grad_norm": 0.857864260673523, "learning_rate": 0.00019992312291920716, "loss": 1.1258, "step": 372 }, { "epoch": 0.04079623755878815, "grad_norm": 0.9377604722976685, "learning_rate": 0.00019992267274639814, "loss": 0.9012, "step": 373 }, { "epoch": 0.04090561084983047, "grad_norm": 1.0209131240844727, "learning_rate": 0.0001999222212598946, "loss": 0.8956, "step": 374 }, { "epoch": 0.0410149841408728, "grad_norm": 0.9510963559150696, "learning_rate": 0.00019992176845970262, "loss": 0.7232, "step": 375 }, { "epoch": 0.04112435743191513, "grad_norm": 1.049834132194519, "learning_rate": 0.00019992131434582808, "loss": 0.9097, "step": 376 }, { "epoch": 0.041233730722957454, "grad_norm": 1.051466464996338, "learning_rate": 0.00019992085891827694, "loss": 0.8074, "step": 377 }, { "epoch": 0.04134310401399978, "grad_norm": 1.0262120962142944, "learning_rate": 0.00019992040217705525, "loss": 0.8217, "step": 378 }, { "epoch": 0.04145247730504211, "grad_norm": 0.8663240075111389, "learning_rate": 0.0001999199441221689, "loss": 0.8464, "step": 379 }, { "epoch": 0.041561850596084436, "grad_norm": 0.9827305674552917, "learning_rate": 0.000199919484753624, "loss": 0.6206, "step": 380 }, { "epoch": 0.04167122388712676, "grad_norm": 1.5495073795318604, "learning_rate": 0.0001999190240714266, "loss": 1.0151, "step": 381 }, { "epoch": 0.04178059717816909, "grad_norm": 1.396231770515442, "learning_rate": 0.0001999185620755827, "loss": 0.8768, "step": 382 }, { "epoch": 0.04188997046921142, "grad_norm": 1.0921934843063354, "learning_rate": 0.00019991809876609843, "loss": 0.8875, "step": 383 }, { "epoch": 0.04199934376025374, "grad_norm": 1.064682126045227, "learning_rate": 0.00019991763414297983, "loss": 0.6536, "step": 384 }, { "epoch": 0.042108717051296075, "grad_norm": 1.0808131694793701, "learning_rate": 0.00019991716820623304, "loss": 0.785, "step": 385 }, { "epoch": 0.0422180903423384, "grad_norm": 1.0913347005844116, "learning_rate": 0.0001999167009558642, "loss": 0.6544, "step": 386 }, { "epoch": 0.042327463633380726, "grad_norm": 1.3865599632263184, "learning_rate": 0.0001999162323918794, "loss": 0.8173, "step": 387 }, { "epoch": 0.04243683692442306, "grad_norm": 1.3333287239074707, "learning_rate": 0.00019991576251428487, "loss": 0.9835, "step": 388 }, { "epoch": 0.04254621021546538, "grad_norm": 0.8037435412406921, "learning_rate": 0.0001999152913230867, "loss": 0.931, "step": 389 }, { "epoch": 0.04265558350650771, "grad_norm": 0.8408225774765015, "learning_rate": 0.00019991481881829115, "loss": 0.88, "step": 390 }, { "epoch": 0.04276495679755004, "grad_norm": 1.035088062286377, "learning_rate": 0.00019991434499990442, "loss": 0.9706, "step": 391 }, { "epoch": 0.042874330088592365, "grad_norm": 1.2629435062408447, "learning_rate": 0.00019991386986793273, "loss": 0.7752, "step": 392 }, { "epoch": 0.04298370337963469, "grad_norm": 1.078934669494629, "learning_rate": 0.00019991339342238234, "loss": 0.4815, "step": 393 }, { "epoch": 0.04309307667067702, "grad_norm": 0.8836020231246948, "learning_rate": 0.0001999129156632595, "loss": 0.9411, "step": 394 }, { "epoch": 0.04320244996171935, "grad_norm": 1.166883945465088, "learning_rate": 0.00019991243659057045, "loss": 0.6927, "step": 395 }, { "epoch": 0.04331182325276168, "grad_norm": 1.344340443611145, "learning_rate": 0.0001999119562043216, "loss": 0.9603, "step": 396 }, { "epoch": 0.043421196543804004, "grad_norm": 0.9963370561599731, "learning_rate": 0.0001999114745045192, "loss": 1.0529, "step": 397 }, { "epoch": 0.04353056983484633, "grad_norm": 1.1938830614089966, "learning_rate": 0.00019991099149116955, "loss": 0.9239, "step": 398 }, { "epoch": 0.04363994312588866, "grad_norm": 1.109154462814331, "learning_rate": 0.00019991050716427903, "loss": 1.0685, "step": 399 }, { "epoch": 0.043749316416930986, "grad_norm": 0.9188171625137329, "learning_rate": 0.00019991002152385402, "loss": 1.0147, "step": 400 }, { "epoch": 0.043749316416930986, "eval_loss": 0.8067082166671753, "eval_runtime": 40.9342, "eval_samples_per_second": 17.98, "eval_steps_per_second": 4.495, "step": 400 }, { "epoch": 0.04385868970797331, "grad_norm": 0.9638638496398926, "learning_rate": 0.00019990953456990092, "loss": 0.9062, "step": 401 }, { "epoch": 0.04396806299901564, "grad_norm": 1.0281591415405273, "learning_rate": 0.00019990904630242607, "loss": 0.9666, "step": 402 }, { "epoch": 0.04407743629005797, "grad_norm": 1.0092509984970093, "learning_rate": 0.00019990855672143596, "loss": 0.6308, "step": 403 }, { "epoch": 0.04418680958110029, "grad_norm": 0.9775615334510803, "learning_rate": 0.00019990806582693697, "loss": 0.7727, "step": 404 }, { "epoch": 0.044296182872142625, "grad_norm": 1.1057891845703125, "learning_rate": 0.0001999075736189356, "loss": 1.2195, "step": 405 }, { "epoch": 0.04440555616318495, "grad_norm": 1.8804906606674194, "learning_rate": 0.0001999070800974383, "loss": 0.9471, "step": 406 }, { "epoch": 0.044514929454227276, "grad_norm": 0.916015088558197, "learning_rate": 0.00019990658526245153, "loss": 0.7251, "step": 407 }, { "epoch": 0.04462430274526961, "grad_norm": 1.1240051984786987, "learning_rate": 0.00019990608911398184, "loss": 1.0191, "step": 408 }, { "epoch": 0.04473367603631193, "grad_norm": 0.9934580326080322, "learning_rate": 0.00019990559165203572, "loss": 1.0016, "step": 409 }, { "epoch": 0.04484304932735426, "grad_norm": 0.9659127593040466, "learning_rate": 0.00019990509287661973, "loss": 1.0285, "step": 410 }, { "epoch": 0.04495242261839659, "grad_norm": 0.8822170495986938, "learning_rate": 0.00019990459278774046, "loss": 1.0685, "step": 411 }, { "epoch": 0.045061795909438915, "grad_norm": 1.0471923351287842, "learning_rate": 0.00019990409138540441, "loss": 0.8328, "step": 412 }, { "epoch": 0.04517116920048124, "grad_norm": 1.1356496810913086, "learning_rate": 0.0001999035886696182, "loss": 0.9262, "step": 413 }, { "epoch": 0.04528054249152357, "grad_norm": 0.9098622798919678, "learning_rate": 0.00019990308464038848, "loss": 0.6382, "step": 414 }, { "epoch": 0.0453899157825659, "grad_norm": 1.1171592473983765, "learning_rate": 0.00019990257929772184, "loss": 0.746, "step": 415 }, { "epoch": 0.04549928907360822, "grad_norm": 0.9921464920043945, "learning_rate": 0.0001999020726416249, "loss": 0.7603, "step": 416 }, { "epoch": 0.045608662364650554, "grad_norm": 1.0106383562088013, "learning_rate": 0.0001999015646721044, "loss": 0.7964, "step": 417 }, { "epoch": 0.04571803565569288, "grad_norm": 1.3405063152313232, "learning_rate": 0.00019990105538916694, "loss": 0.807, "step": 418 }, { "epoch": 0.045827408946735204, "grad_norm": 1.180208683013916, "learning_rate": 0.00019990054479281924, "loss": 0.9172, "step": 419 }, { "epoch": 0.045936782237777536, "grad_norm": 1.1107349395751953, "learning_rate": 0.00019990003288306802, "loss": 0.9676, "step": 420 }, { "epoch": 0.04604615552881986, "grad_norm": 0.8224467635154724, "learning_rate": 0.00019989951965991999, "loss": 0.811, "step": 421 }, { "epoch": 0.046155528819862186, "grad_norm": 1.0547099113464355, "learning_rate": 0.00019989900512338196, "loss": 0.9228, "step": 422 }, { "epoch": 0.04626490211090452, "grad_norm": 1.2838783264160156, "learning_rate": 0.0001998984892734606, "loss": 0.6898, "step": 423 }, { "epoch": 0.04637427540194684, "grad_norm": 1.7018957138061523, "learning_rate": 0.00019989797211016278, "loss": 0.8091, "step": 424 }, { "epoch": 0.046483648692989175, "grad_norm": 1.207707405090332, "learning_rate": 0.00019989745363349526, "loss": 0.6146, "step": 425 }, { "epoch": 0.0465930219840315, "grad_norm": 1.4657715559005737, "learning_rate": 0.00019989693384346482, "loss": 0.9031, "step": 426 }, { "epoch": 0.046702395275073826, "grad_norm": 1.3541256189346313, "learning_rate": 0.0001998964127400784, "loss": 0.6766, "step": 427 }, { "epoch": 0.04681176856611616, "grad_norm": 0.9115450382232666, "learning_rate": 0.00019989589032334268, "loss": 0.9605, "step": 428 }, { "epoch": 0.04692114185715848, "grad_norm": 0.9539338946342468, "learning_rate": 0.0001998953665932647, "loss": 1.0472, "step": 429 }, { "epoch": 0.04703051514820081, "grad_norm": 0.9659996628761292, "learning_rate": 0.00019989484154985126, "loss": 0.7071, "step": 430 }, { "epoch": 0.04713988843924314, "grad_norm": 1.097551703453064, "learning_rate": 0.0001998943151931093, "loss": 0.4573, "step": 431 }, { "epoch": 0.047249261730285465, "grad_norm": 1.287800908088684, "learning_rate": 0.0001998937875230457, "loss": 0.7062, "step": 432 }, { "epoch": 0.04735863502132779, "grad_norm": 0.9104124307632446, "learning_rate": 0.0001998932585396674, "loss": 0.5085, "step": 433 }, { "epoch": 0.04746800831237012, "grad_norm": 0.8423514366149902, "learning_rate": 0.0001998927282429814, "loss": 0.7665, "step": 434 }, { "epoch": 0.04757738160341245, "grad_norm": 1.021085500717163, "learning_rate": 0.0001998921966329946, "loss": 0.6975, "step": 435 }, { "epoch": 0.04768675489445477, "grad_norm": 1.40684175491333, "learning_rate": 0.0001998916637097141, "loss": 0.7913, "step": 436 }, { "epoch": 0.047796128185497104, "grad_norm": 1.0347301959991455, "learning_rate": 0.00019989112947314678, "loss": 0.7172, "step": 437 }, { "epoch": 0.04790550147653943, "grad_norm": 1.0268831253051758, "learning_rate": 0.00019989059392329974, "loss": 0.7212, "step": 438 }, { "epoch": 0.048014874767581754, "grad_norm": 1.0991255044937134, "learning_rate": 0.00019989005706018, "loss": 0.7781, "step": 439 }, { "epoch": 0.048124248058624086, "grad_norm": 1.0303900241851807, "learning_rate": 0.00019988951888379462, "loss": 0.8743, "step": 440 }, { "epoch": 0.04823362134966641, "grad_norm": 1.1497889757156372, "learning_rate": 0.0001998889793941507, "loss": 0.8768, "step": 441 }, { "epoch": 0.048342994640708736, "grad_norm": 1.1906489133834839, "learning_rate": 0.00019988843859125528, "loss": 0.7988, "step": 442 }, { "epoch": 0.04845236793175107, "grad_norm": 0.9526726603507996, "learning_rate": 0.0001998878964751155, "loss": 0.9272, "step": 443 }, { "epoch": 0.04856174122279339, "grad_norm": 1.0579299926757812, "learning_rate": 0.0001998873530457385, "loss": 0.7917, "step": 444 }, { "epoch": 0.04867111451383572, "grad_norm": 1.2798495292663574, "learning_rate": 0.0001998868083031314, "loss": 0.8362, "step": 445 }, { "epoch": 0.04878048780487805, "grad_norm": 1.187063217163086, "learning_rate": 0.00019988626224730135, "loss": 0.6954, "step": 446 }, { "epoch": 0.048889861095920376, "grad_norm": 0.8720710873603821, "learning_rate": 0.0001998857148782556, "loss": 0.6788, "step": 447 }, { "epoch": 0.0489992343869627, "grad_norm": 1.2096325159072876, "learning_rate": 0.00019988516619600128, "loss": 0.7242, "step": 448 }, { "epoch": 0.04910860767800503, "grad_norm": 0.9759934544563293, "learning_rate": 0.0001998846162005456, "loss": 0.82, "step": 449 }, { "epoch": 0.04921798096904736, "grad_norm": 0.9307674169540405, "learning_rate": 0.00019988406489189584, "loss": 1.0253, "step": 450 }, { "epoch": 0.04932735426008968, "grad_norm": 1.079480767250061, "learning_rate": 0.00019988351227005923, "loss": 0.7901, "step": 451 }, { "epoch": 0.049436727551132015, "grad_norm": 0.9951292276382446, "learning_rate": 0.000199882958335043, "loss": 0.8101, "step": 452 }, { "epoch": 0.04954610084217434, "grad_norm": 1.5982356071472168, "learning_rate": 0.00019988240308685447, "loss": 0.7624, "step": 453 }, { "epoch": 0.04965547413321667, "grad_norm": 1.5702210664749146, "learning_rate": 0.0001998818465255009, "loss": 1.0113, "step": 454 }, { "epoch": 0.049764847424259, "grad_norm": 0.8995147347450256, "learning_rate": 0.00019988128865098967, "loss": 0.8003, "step": 455 }, { "epoch": 0.04987422071530132, "grad_norm": 1.0795233249664307, "learning_rate": 0.00019988072946332808, "loss": 0.7688, "step": 456 }, { "epoch": 0.049983594006343654, "grad_norm": 1.1191943883895874, "learning_rate": 0.00019988016896252346, "loss": 0.8913, "step": 457 }, { "epoch": 0.05009296729738598, "grad_norm": 1.089416265487671, "learning_rate": 0.0001998796071485832, "loss": 0.6705, "step": 458 }, { "epoch": 0.050202340588428304, "grad_norm": 0.9763931632041931, "learning_rate": 0.0001998790440215147, "loss": 0.6319, "step": 459 }, { "epoch": 0.050311713879470636, "grad_norm": 1.4132522344589233, "learning_rate": 0.00019987847958132535, "loss": 0.7966, "step": 460 }, { "epoch": 0.05042108717051296, "grad_norm": 1.5261541604995728, "learning_rate": 0.00019987791382802255, "loss": 0.6739, "step": 461 }, { "epoch": 0.050530460461555286, "grad_norm": 1.1543093919754028, "learning_rate": 0.00019987734676161378, "loss": 1.3043, "step": 462 }, { "epoch": 0.05063983375259762, "grad_norm": 1.311062216758728, "learning_rate": 0.0001998767783821065, "loss": 0.8772, "step": 463 }, { "epoch": 0.05074920704363994, "grad_norm": 1.5114765167236328, "learning_rate": 0.00019987620868950812, "loss": 0.8614, "step": 464 }, { "epoch": 0.05085858033468227, "grad_norm": 1.1269599199295044, "learning_rate": 0.00019987563768382617, "loss": 0.9356, "step": 465 }, { "epoch": 0.0509679536257246, "grad_norm": 1.285370945930481, "learning_rate": 0.00019987506536506814, "loss": 0.6714, "step": 466 }, { "epoch": 0.051077326916766926, "grad_norm": 1.137934923171997, "learning_rate": 0.0001998744917332416, "loss": 0.5941, "step": 467 }, { "epoch": 0.05118670020780925, "grad_norm": 1.1598773002624512, "learning_rate": 0.00019987391678835404, "loss": 0.9834, "step": 468 }, { "epoch": 0.05129607349885158, "grad_norm": 1.5532463788986206, "learning_rate": 0.00019987334053041307, "loss": 0.8427, "step": 469 }, { "epoch": 0.05140544678989391, "grad_norm": 1.0216114521026611, "learning_rate": 0.00019987276295942621, "loss": 0.8592, "step": 470 }, { "epoch": 0.05151482008093623, "grad_norm": 1.5978375673294067, "learning_rate": 0.00019987218407540108, "loss": 0.6453, "step": 471 }, { "epoch": 0.051624193371978565, "grad_norm": 1.022755742073059, "learning_rate": 0.0001998716038783453, "loss": 0.9352, "step": 472 }, { "epoch": 0.05173356666302089, "grad_norm": 1.1233989000320435, "learning_rate": 0.00019987102236826646, "loss": 0.7528, "step": 473 }, { "epoch": 0.051842939954063215, "grad_norm": 1.0236766338348389, "learning_rate": 0.00019987043954517223, "loss": 0.7504, "step": 474 }, { "epoch": 0.05195231324510555, "grad_norm": 0.9642089009284973, "learning_rate": 0.0001998698554090703, "loss": 0.7342, "step": 475 }, { "epoch": 0.05206168653614787, "grad_norm": 1.0298606157302856, "learning_rate": 0.00019986926995996834, "loss": 0.9943, "step": 476 }, { "epoch": 0.0521710598271902, "grad_norm": 0.9320874214172363, "learning_rate": 0.000199868683197874, "loss": 1.1226, "step": 477 }, { "epoch": 0.05228043311823253, "grad_norm": 0.8626863956451416, "learning_rate": 0.000199868095122795, "loss": 1.0293, "step": 478 }, { "epoch": 0.052389806409274854, "grad_norm": 1.0206810235977173, "learning_rate": 0.00019986750573473914, "loss": 1.0032, "step": 479 }, { "epoch": 0.05249917970031718, "grad_norm": 1.1447771787643433, "learning_rate": 0.0001998669150337141, "loss": 0.8816, "step": 480 }, { "epoch": 0.05260855299135951, "grad_norm": 1.1172994375228882, "learning_rate": 0.0001998663230197277, "loss": 0.8034, "step": 481 }, { "epoch": 0.052717926282401836, "grad_norm": 1.1175955533981323, "learning_rate": 0.00019986572969278766, "loss": 0.9391, "step": 482 }, { "epoch": 0.05282729957344417, "grad_norm": 1.279219388961792, "learning_rate": 0.00019986513505290186, "loss": 0.7481, "step": 483 }, { "epoch": 0.05293667286448649, "grad_norm": 0.9596846103668213, "learning_rate": 0.00019986453910007806, "loss": 0.7093, "step": 484 }, { "epoch": 0.05304604615552882, "grad_norm": 1.5974267721176147, "learning_rate": 0.0001998639418343241, "loss": 0.9337, "step": 485 }, { "epoch": 0.05315541944657115, "grad_norm": 0.9189580678939819, "learning_rate": 0.0001998633432556478, "loss": 1.042, "step": 486 }, { "epoch": 0.053264792737613476, "grad_norm": 1.3200494050979614, "learning_rate": 0.00019986274336405714, "loss": 0.8717, "step": 487 }, { "epoch": 0.0533741660286558, "grad_norm": 1.514082431793213, "learning_rate": 0.0001998621421595599, "loss": 0.9438, "step": 488 }, { "epoch": 0.05348353931969813, "grad_norm": 1.1798110008239746, "learning_rate": 0.000199861539642164, "loss": 0.8857, "step": 489 }, { "epoch": 0.05359291261074046, "grad_norm": 1.3705772161483765, "learning_rate": 0.00019986093581187743, "loss": 0.7876, "step": 490 }, { "epoch": 0.05370228590178278, "grad_norm": 1.0883309841156006, "learning_rate": 0.00019986033066870805, "loss": 0.7006, "step": 491 }, { "epoch": 0.053811659192825115, "grad_norm": 1.2093448638916016, "learning_rate": 0.00019985972421266386, "loss": 0.8158, "step": 492 }, { "epoch": 0.05392103248386744, "grad_norm": 1.2223838567733765, "learning_rate": 0.00019985911644375282, "loss": 0.9867, "step": 493 }, { "epoch": 0.054030405774909765, "grad_norm": 1.2985742092132568, "learning_rate": 0.00019985850736198294, "loss": 0.7929, "step": 494 }, { "epoch": 0.0541397790659521, "grad_norm": 1.0266704559326172, "learning_rate": 0.00019985789696736215, "loss": 0.7462, "step": 495 }, { "epoch": 0.05424915235699442, "grad_norm": 1.272060513496399, "learning_rate": 0.00019985728525989858, "loss": 0.78, "step": 496 }, { "epoch": 0.05435852564803675, "grad_norm": 0.8229413032531738, "learning_rate": 0.00019985667223960021, "loss": 1.0024, "step": 497 }, { "epoch": 0.05446789893907908, "grad_norm": 1.0643401145935059, "learning_rate": 0.00019985605790647513, "loss": 0.8547, "step": 498 }, { "epoch": 0.054577272230121404, "grad_norm": 0.9842153787612915, "learning_rate": 0.00019985544226053137, "loss": 1.0151, "step": 499 }, { "epoch": 0.05468664552116373, "grad_norm": 1.050392508506775, "learning_rate": 0.00019985482530177707, "loss": 0.7329, "step": 500 }, { "epoch": 0.05479601881220606, "grad_norm": 1.1385303735733032, "learning_rate": 0.00019985420703022032, "loss": 0.8524, "step": 501 }, { "epoch": 0.054905392103248386, "grad_norm": 1.0153578519821167, "learning_rate": 0.0001998535874458693, "loss": 0.9798, "step": 502 }, { "epoch": 0.05501476539429071, "grad_norm": 0.8864844441413879, "learning_rate": 0.00019985296654873204, "loss": 0.8962, "step": 503 }, { "epoch": 0.05512413868533304, "grad_norm": 0.8665205836296082, "learning_rate": 0.0001998523443388168, "loss": 1.1352, "step": 504 }, { "epoch": 0.05523351197637537, "grad_norm": 1.2367112636566162, "learning_rate": 0.00019985172081613177, "loss": 0.9921, "step": 505 }, { "epoch": 0.055342885267417694, "grad_norm": 1.02898108959198, "learning_rate": 0.00019985109598068506, "loss": 0.9123, "step": 506 }, { "epoch": 0.055452258558460026, "grad_norm": 0.9751277565956116, "learning_rate": 0.000199850469832485, "loss": 1.0117, "step": 507 }, { "epoch": 0.05556163184950235, "grad_norm": 1.1283056735992432, "learning_rate": 0.00019984984237153973, "loss": 0.7363, "step": 508 }, { "epoch": 0.055671005140544676, "grad_norm": 1.480178952217102, "learning_rate": 0.0001998492135978575, "loss": 1.0154, "step": 509 }, { "epoch": 0.05578037843158701, "grad_norm": 1.3893234729766846, "learning_rate": 0.00019984858351144663, "loss": 0.6876, "step": 510 }, { "epoch": 0.05588975172262933, "grad_norm": 1.0186976194381714, "learning_rate": 0.00019984795211231535, "loss": 0.7121, "step": 511 }, { "epoch": 0.055999125013671665, "grad_norm": 1.1589125394821167, "learning_rate": 0.000199847319400472, "loss": 0.7955, "step": 512 }, { "epoch": 0.05610849830471399, "grad_norm": 1.0086039304733276, "learning_rate": 0.0001998466853759249, "loss": 0.8957, "step": 513 }, { "epoch": 0.056217871595756315, "grad_norm": 1.2082234621047974, "learning_rate": 0.00019984605003868237, "loss": 0.931, "step": 514 }, { "epoch": 0.05632724488679865, "grad_norm": 1.0067565441131592, "learning_rate": 0.0001998454133887528, "loss": 0.731, "step": 515 }, { "epoch": 0.05643661817784097, "grad_norm": 0.8393429517745972, "learning_rate": 0.00019984477542614446, "loss": 0.8231, "step": 516 }, { "epoch": 0.0565459914688833, "grad_norm": 0.9679846167564392, "learning_rate": 0.00019984413615086583, "loss": 1.0243, "step": 517 }, { "epoch": 0.05665536475992563, "grad_norm": 1.0620890855789185, "learning_rate": 0.0001998434955629253, "loss": 0.8942, "step": 518 }, { "epoch": 0.056764738050967954, "grad_norm": 0.8497173190116882, "learning_rate": 0.00019984285366233127, "loss": 0.8808, "step": 519 }, { "epoch": 0.05687411134201028, "grad_norm": 1.210013508796692, "learning_rate": 0.0001998422104490922, "loss": 0.6953, "step": 520 }, { "epoch": 0.05698348463305261, "grad_norm": 0.8720889091491699, "learning_rate": 0.00019984156592321652, "loss": 0.9666, "step": 521 }, { "epoch": 0.057092857924094936, "grad_norm": 1.122982144355774, "learning_rate": 0.00019984092008471272, "loss": 0.8495, "step": 522 }, { "epoch": 0.05720223121513726, "grad_norm": 1.1690536737442017, "learning_rate": 0.00019984027293358931, "loss": 1.202, "step": 523 }, { "epoch": 0.05731160450617959, "grad_norm": 1.0106743574142456, "learning_rate": 0.00019983962446985476, "loss": 0.9893, "step": 524 }, { "epoch": 0.05742097779722192, "grad_norm": 1.8566340208053589, "learning_rate": 0.0001998389746935176, "loss": 1.3652, "step": 525 }, { "epoch": 0.057530351088264244, "grad_norm": 0.9694240689277649, "learning_rate": 0.00019983832360458644, "loss": 0.6753, "step": 526 }, { "epoch": 0.057639724379306576, "grad_norm": 1.099011778831482, "learning_rate": 0.00019983767120306973, "loss": 1.549, "step": 527 }, { "epoch": 0.0577490976703489, "grad_norm": 1.0495198965072632, "learning_rate": 0.00019983701748897613, "loss": 1.1807, "step": 528 }, { "epoch": 0.057858470961391226, "grad_norm": 0.9285663962364197, "learning_rate": 0.0001998363624623142, "loss": 1.0697, "step": 529 }, { "epoch": 0.05796784425243356, "grad_norm": 1.0406607389450073, "learning_rate": 0.00019983570612309257, "loss": 1.0355, "step": 530 }, { "epoch": 0.05807721754347588, "grad_norm": 0.9569828510284424, "learning_rate": 0.00019983504847131985, "loss": 0.7724, "step": 531 }, { "epoch": 0.05818659083451821, "grad_norm": 1.041804313659668, "learning_rate": 0.0001998343895070047, "loss": 0.5987, "step": 532 }, { "epoch": 0.05829596412556054, "grad_norm": 1.242843508720398, "learning_rate": 0.00019983372923015576, "loss": 1.0367, "step": 533 }, { "epoch": 0.058405337416602865, "grad_norm": 1.2179800271987915, "learning_rate": 0.00019983306764078174, "loss": 0.8017, "step": 534 }, { "epoch": 0.05851471070764519, "grad_norm": 1.5981494188308716, "learning_rate": 0.00019983240473889132, "loss": 0.8737, "step": 535 }, { "epoch": 0.05862408399868752, "grad_norm": 1.071590781211853, "learning_rate": 0.00019983174052449324, "loss": 0.8819, "step": 536 }, { "epoch": 0.05873345728972985, "grad_norm": 0.9891796112060547, "learning_rate": 0.0001998310749975962, "loss": 1.1386, "step": 537 }, { "epoch": 0.05884283058077217, "grad_norm": 1.0623862743377686, "learning_rate": 0.00019983040815820896, "loss": 0.8083, "step": 538 }, { "epoch": 0.058952203871814504, "grad_norm": 0.9091552495956421, "learning_rate": 0.0001998297400063403, "loss": 0.5463, "step": 539 }, { "epoch": 0.05906157716285683, "grad_norm": 1.1463671922683716, "learning_rate": 0.000199829070541999, "loss": 0.8651, "step": 540 }, { "epoch": 0.05917095045389916, "grad_norm": 1.4799455404281616, "learning_rate": 0.00019982839976519386, "loss": 0.6439, "step": 541 }, { "epoch": 0.059280323744941486, "grad_norm": 1.2554148435592651, "learning_rate": 0.00019982772767593367, "loss": 0.9621, "step": 542 }, { "epoch": 0.05938969703598381, "grad_norm": 1.0151816606521606, "learning_rate": 0.00019982705427422733, "loss": 0.8456, "step": 543 }, { "epoch": 0.05949907032702614, "grad_norm": 0.9739223122596741, "learning_rate": 0.00019982637956008362, "loss": 1.0848, "step": 544 }, { "epoch": 0.05960844361806847, "grad_norm": 1.4318240880966187, "learning_rate": 0.00019982570353351147, "loss": 0.4684, "step": 545 }, { "epoch": 0.059717816909110794, "grad_norm": 1.1196770668029785, "learning_rate": 0.00019982502619451974, "loss": 0.7739, "step": 546 }, { "epoch": 0.059827190200153126, "grad_norm": 0.9427726864814758, "learning_rate": 0.00019982434754311733, "loss": 0.9338, "step": 547 }, { "epoch": 0.05993656349119545, "grad_norm": 1.3539577722549438, "learning_rate": 0.0001998236675793132, "loss": 0.9631, "step": 548 }, { "epoch": 0.060045936782237776, "grad_norm": 1.1712934970855713, "learning_rate": 0.00019982298630311622, "loss": 0.9422, "step": 549 }, { "epoch": 0.06015531007328011, "grad_norm": 1.177377700805664, "learning_rate": 0.0001998223037145354, "loss": 0.9431, "step": 550 }, { "epoch": 0.06026468336432243, "grad_norm": 1.0253443717956543, "learning_rate": 0.00019982161981357973, "loss": 1.1583, "step": 551 }, { "epoch": 0.06037405665536476, "grad_norm": 1.0737707614898682, "learning_rate": 0.00019982093460025815, "loss": 0.7857, "step": 552 }, { "epoch": 0.06048342994640709, "grad_norm": 1.4929778575897217, "learning_rate": 0.00019982024807457967, "loss": 1.0744, "step": 553 }, { "epoch": 0.060592803237449415, "grad_norm": 1.174723744392395, "learning_rate": 0.00019981956023655336, "loss": 1.124, "step": 554 }, { "epoch": 0.06070217652849174, "grad_norm": 1.4608044624328613, "learning_rate": 0.00019981887108618825, "loss": 0.91, "step": 555 }, { "epoch": 0.06081154981953407, "grad_norm": 1.2418204545974731, "learning_rate": 0.00019981818062349337, "loss": 0.6012, "step": 556 }, { "epoch": 0.0609209231105764, "grad_norm": 1.3971385955810547, "learning_rate": 0.0001998174888484778, "loss": 0.7114, "step": 557 }, { "epoch": 0.06103029640161872, "grad_norm": 1.189285397529602, "learning_rate": 0.0001998167957611507, "loss": 1.3319, "step": 558 }, { "epoch": 0.061139669692661054, "grad_norm": 1.088165521621704, "learning_rate": 0.0001998161013615211, "loss": 0.6337, "step": 559 }, { "epoch": 0.06124904298370338, "grad_norm": 1.2663531303405762, "learning_rate": 0.0001998154056495982, "loss": 0.7802, "step": 560 }, { "epoch": 0.061358416274745704, "grad_norm": 1.002173900604248, "learning_rate": 0.00019981470862539107, "loss": 0.8206, "step": 561 }, { "epoch": 0.061467789565788036, "grad_norm": 1.1963932514190674, "learning_rate": 0.00019981401028890895, "loss": 1.1556, "step": 562 }, { "epoch": 0.06157716285683036, "grad_norm": 1.1052930355072021, "learning_rate": 0.00019981331064016097, "loss": 0.9486, "step": 563 }, { "epoch": 0.061686536147872686, "grad_norm": 0.9965226054191589, "learning_rate": 0.00019981260967915634, "loss": 0.766, "step": 564 }, { "epoch": 0.06179590943891502, "grad_norm": 1.6856166124343872, "learning_rate": 0.0001998119074059043, "loss": 0.6992, "step": 565 }, { "epoch": 0.061905282729957344, "grad_norm": 1.4077011346817017, "learning_rate": 0.00019981120382041404, "loss": 0.8003, "step": 566 }, { "epoch": 0.06201465602099967, "grad_norm": 1.032565951347351, "learning_rate": 0.00019981049892269482, "loss": 0.7922, "step": 567 }, { "epoch": 0.062124029312042, "grad_norm": 1.1922955513000488, "learning_rate": 0.00019980979271275596, "loss": 0.7718, "step": 568 }, { "epoch": 0.062233402603084326, "grad_norm": 0.9688342213630676, "learning_rate": 0.00019980908519060667, "loss": 0.7989, "step": 569 }, { "epoch": 0.06234277589412666, "grad_norm": 1.5489237308502197, "learning_rate": 0.00019980837635625632, "loss": 0.8059, "step": 570 }, { "epoch": 0.06245214918516898, "grad_norm": 1.9893778562545776, "learning_rate": 0.0001998076662097142, "loss": 0.8632, "step": 571 }, { "epoch": 0.06256152247621131, "grad_norm": 1.1985156536102295, "learning_rate": 0.00019980695475098958, "loss": 1.0229, "step": 572 }, { "epoch": 0.06267089576725364, "grad_norm": 0.994389533996582, "learning_rate": 0.00019980624198009193, "loss": 1.1044, "step": 573 }, { "epoch": 0.06278026905829596, "grad_norm": 0.9276033043861389, "learning_rate": 0.00019980552789703056, "loss": 0.9062, "step": 574 }, { "epoch": 0.06288964234933829, "grad_norm": 1.2080670595169067, "learning_rate": 0.00019980481250181487, "loss": 0.769, "step": 575 }, { "epoch": 0.06299901564038062, "grad_norm": 1.1223119497299194, "learning_rate": 0.00019980409579445425, "loss": 1.137, "step": 576 }, { "epoch": 0.06310838893142294, "grad_norm": 1.0903812646865845, "learning_rate": 0.00019980337777495812, "loss": 0.9827, "step": 577 }, { "epoch": 0.06321776222246528, "grad_norm": 1.0898516178131104, "learning_rate": 0.00019980265844333594, "loss": 0.8881, "step": 578 }, { "epoch": 0.0633271355135076, "grad_norm": 0.9497270584106445, "learning_rate": 0.00019980193779959717, "loss": 0.9331, "step": 579 }, { "epoch": 0.06343650880454993, "grad_norm": 1.1686186790466309, "learning_rate": 0.00019980121584375126, "loss": 0.8766, "step": 580 }, { "epoch": 0.06354588209559225, "grad_norm": 1.187633991241455, "learning_rate": 0.00019980049257580773, "loss": 0.8418, "step": 581 }, { "epoch": 0.06365525538663458, "grad_norm": 1.136193037033081, "learning_rate": 0.00019979976799577607, "loss": 0.7776, "step": 582 }, { "epoch": 0.0637646286776769, "grad_norm": 1.1883234977722168, "learning_rate": 0.0001997990421036658, "loss": 0.8067, "step": 583 }, { "epoch": 0.06387400196871924, "grad_norm": 1.0206081867218018, "learning_rate": 0.0001997983148994865, "loss": 1.0334, "step": 584 }, { "epoch": 0.06398337525976157, "grad_norm": 0.9565343260765076, "learning_rate": 0.00019979758638324772, "loss": 0.9657, "step": 585 }, { "epoch": 0.0640927485508039, "grad_norm": 1.2159839868545532, "learning_rate": 0.00019979685655495896, "loss": 0.8276, "step": 586 }, { "epoch": 0.06420212184184622, "grad_norm": 1.3924200534820557, "learning_rate": 0.00019979612541462993, "loss": 0.8714, "step": 587 }, { "epoch": 0.06431149513288854, "grad_norm": 1.16556978225708, "learning_rate": 0.00019979539296227018, "loss": 0.8768, "step": 588 }, { "epoch": 0.06442086842393088, "grad_norm": 1.5815696716308594, "learning_rate": 0.00019979465919788933, "loss": 0.8323, "step": 589 }, { "epoch": 0.06453024171497321, "grad_norm": 1.1107839345932007, "learning_rate": 0.00019979392412149707, "loss": 0.8951, "step": 590 }, { "epoch": 0.06463961500601553, "grad_norm": 0.9651502966880798, "learning_rate": 0.00019979318773310302, "loss": 1.1726, "step": 591 }, { "epoch": 0.06474898829705786, "grad_norm": 1.1854195594787598, "learning_rate": 0.0001997924500327169, "loss": 0.7009, "step": 592 }, { "epoch": 0.06485836158810018, "grad_norm": 1.102640986442566, "learning_rate": 0.0001997917110203484, "loss": 0.7523, "step": 593 }, { "epoch": 0.06496773487914251, "grad_norm": 1.0900192260742188, "learning_rate": 0.00019979097069600717, "loss": 0.6592, "step": 594 }, { "epoch": 0.06507710817018485, "grad_norm": 1.2523647546768188, "learning_rate": 0.00019979022905970307, "loss": 0.7598, "step": 595 }, { "epoch": 0.06518648146122717, "grad_norm": 1.1489145755767822, "learning_rate": 0.00019978948611144574, "loss": 0.8636, "step": 596 }, { "epoch": 0.0652958547522695, "grad_norm": 1.1444084644317627, "learning_rate": 0.00019978874185124502, "loss": 0.8351, "step": 597 }, { "epoch": 0.06540522804331182, "grad_norm": 1.0838830471038818, "learning_rate": 0.00019978799627911063, "loss": 0.9453, "step": 598 }, { "epoch": 0.06551460133435415, "grad_norm": 0.9383161067962646, "learning_rate": 0.00019978724939505242, "loss": 0.7702, "step": 599 }, { "epoch": 0.06562397462539647, "grad_norm": 1.2142367362976074, "learning_rate": 0.00019978650119908018, "loss": 0.7413, "step": 600 }, { "epoch": 0.06562397462539647, "eval_loss": 0.817609429359436, "eval_runtime": 40.8601, "eval_samples_per_second": 18.013, "eval_steps_per_second": 4.503, "step": 600 } ], "logging_steps": 1, "max_steps": 27429, "num_input_tokens_seen": 0, "num_train_epochs": 3, "save_steps": 200, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 5, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 1 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 4.904615294690918e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }