{ "best_metric": 10.34589672088623, "best_model_checkpoint": "miner_id_24/checkpoint-200", "epoch": 0.3386960203217612, "eval_steps": 50, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.001693480101608806, "grad_norm": 0.05767215043306351, "learning_rate": 7e-06, "loss": 10.3761, "step": 1 }, { "epoch": 0.001693480101608806, "eval_loss": 10.376470565795898, "eval_runtime": 2.2633, "eval_samples_per_second": 439.62, "eval_steps_per_second": 110.016, "step": 1 }, { "epoch": 0.003386960203217612, "grad_norm": 0.05682261288166046, "learning_rate": 1.4e-05, "loss": 10.3756, "step": 2 }, { "epoch": 0.005080440304826418, "grad_norm": 0.05533347651362419, "learning_rate": 2.1e-05, "loss": 10.3759, "step": 3 }, { "epoch": 0.006773920406435224, "grad_norm": 0.06400913745164871, "learning_rate": 2.8e-05, "loss": 10.3753, "step": 4 }, { "epoch": 0.00846740050804403, "grad_norm": 0.06217538192868233, "learning_rate": 3.5e-05, "loss": 10.3766, "step": 5 }, { "epoch": 0.010160880609652836, "grad_norm": 0.059953831136226654, "learning_rate": 4.2e-05, "loss": 10.3753, "step": 6 }, { "epoch": 0.011854360711261643, "grad_norm": 0.06322812288999557, "learning_rate": 4.899999999999999e-05, "loss": 10.3751, "step": 7 }, { "epoch": 0.013547840812870448, "grad_norm": 0.06448973715305328, "learning_rate": 5.6e-05, "loss": 10.3755, "step": 8 }, { "epoch": 0.015241320914479255, "grad_norm": 0.06553128361701965, "learning_rate": 6.3e-05, "loss": 10.3754, "step": 9 }, { "epoch": 0.01693480101608806, "grad_norm": 0.06717841327190399, "learning_rate": 7e-05, "loss": 10.3749, "step": 10 }, { "epoch": 0.018628281117696866, "grad_norm": 0.06435838341712952, "learning_rate": 6.999521567473641e-05, "loss": 10.3753, "step": 11 }, { "epoch": 0.02032176121930567, "grad_norm": 0.06390493363142014, "learning_rate": 6.998086400693241e-05, "loss": 10.3744, "step": 12 }, { "epoch": 0.02201524132091448, "grad_norm": 0.06731149554252625, "learning_rate": 6.995694892019065e-05, "loss": 10.3745, "step": 13 }, { "epoch": 0.023708721422523286, "grad_norm": 0.08515335619449615, "learning_rate": 6.99234769526571e-05, "loss": 10.3737, "step": 14 }, { "epoch": 0.02540220152413209, "grad_norm": 0.08068357408046722, "learning_rate": 6.988045725523343e-05, "loss": 10.3727, "step": 15 }, { "epoch": 0.027095681625740897, "grad_norm": 0.08304785192012787, "learning_rate": 6.982790158907539e-05, "loss": 10.3722, "step": 16 }, { "epoch": 0.028789161727349702, "grad_norm": 0.08605454862117767, "learning_rate": 6.976582432237733e-05, "loss": 10.3725, "step": 17 }, { "epoch": 0.03048264182895851, "grad_norm": 0.0890476256608963, "learning_rate": 6.969424242644413e-05, "loss": 10.3728, "step": 18 }, { "epoch": 0.03217612193056731, "grad_norm": 0.09603014588356018, "learning_rate": 6.961317547105138e-05, "loss": 10.3707, "step": 19 }, { "epoch": 0.03386960203217612, "grad_norm": 0.09333094954490662, "learning_rate": 6.952264561909527e-05, "loss": 10.3714, "step": 20 }, { "epoch": 0.03556308213378493, "grad_norm": 0.11809182167053223, "learning_rate": 6.942267762053337e-05, "loss": 10.3699, "step": 21 }, { "epoch": 0.03725656223539373, "grad_norm": 0.12310867756605148, "learning_rate": 6.931329880561832e-05, "loss": 10.3696, "step": 22 }, { "epoch": 0.03895004233700254, "grad_norm": 0.12797869741916656, "learning_rate": 6.919453907742597e-05, "loss": 10.3694, "step": 23 }, { "epoch": 0.04064352243861134, "grad_norm": 0.14211532473564148, "learning_rate": 6.90664309036802e-05, "loss": 10.3684, "step": 24 }, { "epoch": 0.04233700254022015, "grad_norm": 0.13544224202632904, "learning_rate": 6.892900930787656e-05, "loss": 10.3687, "step": 25 }, { "epoch": 0.04403048264182896, "grad_norm": 0.15587803721427917, "learning_rate": 6.87823118597072e-05, "loss": 10.3667, "step": 26 }, { "epoch": 0.04572396274343776, "grad_norm": 0.15392404794692993, "learning_rate": 6.862637866478969e-05, "loss": 10.3679, "step": 27 }, { "epoch": 0.04741744284504657, "grad_norm": 0.15195734798908234, "learning_rate": 6.846125235370252e-05, "loss": 10.3674, "step": 28 }, { "epoch": 0.04911092294665537, "grad_norm": 0.1591203212738037, "learning_rate": 6.828697807033038e-05, "loss": 10.3646, "step": 29 }, { "epoch": 0.05080440304826418, "grad_norm": 0.17264410853385925, "learning_rate": 6.81036034595222e-05, "loss": 10.3642, "step": 30 }, { "epoch": 0.05249788314987299, "grad_norm": 0.1709284484386444, "learning_rate": 6.791117865406564e-05, "loss": 10.3635, "step": 31 }, { "epoch": 0.05419136325148179, "grad_norm": 0.17630036175251007, "learning_rate": 6.770975626098112e-05, "loss": 10.365, "step": 32 }, { "epoch": 0.0558848433530906, "grad_norm": 0.1866825520992279, "learning_rate": 6.749939134713974e-05, "loss": 10.3628, "step": 33 }, { "epoch": 0.057578323454699404, "grad_norm": 0.17809787392616272, "learning_rate": 6.728014142420846e-05, "loss": 10.3629, "step": 34 }, { "epoch": 0.05927180355630821, "grad_norm": 0.20281663537025452, "learning_rate": 6.7052066432927e-05, "loss": 10.3578, "step": 35 }, { "epoch": 0.06096528365791702, "grad_norm": 0.19204723834991455, "learning_rate": 6.681522872672069e-05, "loss": 10.3585, "step": 36 }, { "epoch": 0.06265876375952582, "grad_norm": 0.1810905933380127, "learning_rate": 6.656969305465356e-05, "loss": 10.3592, "step": 37 }, { "epoch": 0.06435224386113463, "grad_norm": 0.19030340015888214, "learning_rate": 6.631552654372672e-05, "loss": 10.3601, "step": 38 }, { "epoch": 0.06604572396274344, "grad_norm": 0.16998638212680817, "learning_rate": 6.60527986805264e-05, "loss": 10.3573, "step": 39 }, { "epoch": 0.06773920406435224, "grad_norm": 0.1517295241355896, "learning_rate": 6.578158129222711e-05, "loss": 10.3549, "step": 40 }, { "epoch": 0.06943268416596104, "grad_norm": 0.15249769389629364, "learning_rate": 6.550194852695469e-05, "loss": 10.3559, "step": 41 }, { "epoch": 0.07112616426756986, "grad_norm": 0.15435636043548584, "learning_rate": 6.521397683351509e-05, "loss": 10.354, "step": 42 }, { "epoch": 0.07281964436917866, "grad_norm": 0.14684386551380157, "learning_rate": 6.491774494049386e-05, "loss": 10.355, "step": 43 }, { "epoch": 0.07451312447078746, "grad_norm": 0.15682685375213623, "learning_rate": 6.461333383473272e-05, "loss": 10.3522, "step": 44 }, { "epoch": 0.07620660457239628, "grad_norm": 0.14739371836185455, "learning_rate": 6.430082673918849e-05, "loss": 10.3518, "step": 45 }, { "epoch": 0.07790008467400508, "grad_norm": 0.14083759486675262, "learning_rate": 6.398030909018069e-05, "loss": 10.3527, "step": 46 }, { "epoch": 0.07959356477561388, "grad_norm": 0.11909397691488266, "learning_rate": 6.365186851403423e-05, "loss": 10.3539, "step": 47 }, { "epoch": 0.08128704487722269, "grad_norm": 0.11432235687971115, "learning_rate": 6.331559480312315e-05, "loss": 10.3531, "step": 48 }, { "epoch": 0.0829805249788315, "grad_norm": 0.13134874403476715, "learning_rate": 6.297157989132236e-05, "loss": 10.3544, "step": 49 }, { "epoch": 0.0846740050804403, "grad_norm": 0.19639384746551514, "learning_rate": 6.261991782887377e-05, "loss": 10.3542, "step": 50 }, { "epoch": 0.0846740050804403, "eval_loss": 10.351482391357422, "eval_runtime": 2.2614, "eval_samples_per_second": 439.995, "eval_steps_per_second": 110.109, "step": 50 }, { "epoch": 0.0863674851820491, "grad_norm": 0.10659899562597275, "learning_rate": 6.226070475667393e-05, "loss": 10.352, "step": 51 }, { "epoch": 0.08806096528365792, "grad_norm": 0.10386061668395996, "learning_rate": 6.189403887999006e-05, "loss": 10.353, "step": 52 }, { "epoch": 0.08975444538526672, "grad_norm": 0.08967398852109909, "learning_rate": 6.152002044161171e-05, "loss": 10.3509, "step": 53 }, { "epoch": 0.09144792548687553, "grad_norm": 0.09589025378227234, "learning_rate": 6.113875169444539e-05, "loss": 10.3516, "step": 54 }, { "epoch": 0.09314140558848434, "grad_norm": 0.08911201357841492, "learning_rate": 6.0750336873559605e-05, "loss": 10.352, "step": 55 }, { "epoch": 0.09483488569009314, "grad_norm": 0.08531937748193741, "learning_rate": 6.035488216768811e-05, "loss": 10.3506, "step": 56 }, { "epoch": 0.09652836579170194, "grad_norm": 0.07509951293468475, "learning_rate": 5.9952495690198894e-05, "loss": 10.3501, "step": 57 }, { "epoch": 0.09822184589331075, "grad_norm": 0.07540036737918854, "learning_rate": 5.954328744953709e-05, "loss": 10.3506, "step": 58 }, { "epoch": 0.09991532599491956, "grad_norm": 0.07696950435638428, "learning_rate": 5.91273693191498e-05, "loss": 10.3511, "step": 59 }, { "epoch": 0.10160880609652836, "grad_norm": 0.0718412697315216, "learning_rate": 5.870485500690094e-05, "loss": 10.3504, "step": 60 }, { "epoch": 0.10330228619813717, "grad_norm": 0.08057332038879395, "learning_rate": 5.827586002398468e-05, "loss": 10.3502, "step": 61 }, { "epoch": 0.10499576629974598, "grad_norm": 0.06910684704780579, "learning_rate": 5.784050165334589e-05, "loss": 10.3511, "step": 62 }, { "epoch": 0.10668924640135478, "grad_norm": 0.06749627739191055, "learning_rate": 5.739889891761608e-05, "loss": 10.3491, "step": 63 }, { "epoch": 0.10838272650296359, "grad_norm": 0.06321804970502853, "learning_rate": 5.6951172546573794e-05, "loss": 10.349, "step": 64 }, { "epoch": 0.1100762066045724, "grad_norm": 0.07615376263856888, "learning_rate": 5.6497444944138376e-05, "loss": 10.3487, "step": 65 }, { "epoch": 0.1117696867061812, "grad_norm": 0.06743479520082474, "learning_rate": 5.603784015490587e-05, "loss": 10.3504, "step": 66 }, { "epoch": 0.11346316680779, "grad_norm": 0.060844793915748596, "learning_rate": 5.557248383023655e-05, "loss": 10.3501, "step": 67 }, { "epoch": 0.11515664690939881, "grad_norm": 0.048706915229558945, "learning_rate": 5.510150319390302e-05, "loss": 10.349, "step": 68 }, { "epoch": 0.11685012701100762, "grad_norm": 0.04675814509391785, "learning_rate": 5.4625027007308546e-05, "loss": 10.3491, "step": 69 }, { "epoch": 0.11854360711261643, "grad_norm": 0.05300172045826912, "learning_rate": 5.414318553428494e-05, "loss": 10.3494, "step": 70 }, { "epoch": 0.12023708721422523, "grad_norm": 0.042747609317302704, "learning_rate": 5.3656110505479776e-05, "loss": 10.3503, "step": 71 }, { "epoch": 0.12193056731583404, "grad_norm": 0.04265451431274414, "learning_rate": 5.316393508234253e-05, "loss": 10.3482, "step": 72 }, { "epoch": 0.12362404741744284, "grad_norm": 0.06077653169631958, "learning_rate": 5.266679382071953e-05, "loss": 10.3482, "step": 73 }, { "epoch": 0.12531752751905165, "grad_norm": 0.05237172171473503, "learning_rate": 5.216482263406778e-05, "loss": 10.3489, "step": 74 }, { "epoch": 0.12701100762066045, "grad_norm": 0.061119917780160904, "learning_rate": 5.1658158756297576e-05, "loss": 10.3472, "step": 75 }, { "epoch": 0.12870448772226925, "grad_norm": 0.03865138441324234, "learning_rate": 5.114694070425407e-05, "loss": 10.3497, "step": 76 }, { "epoch": 0.13039796782387808, "grad_norm": 0.03798210248351097, "learning_rate": 5.063130823984823e-05, "loss": 10.3472, "step": 77 }, { "epoch": 0.13209144792548688, "grad_norm": 0.03693859279155731, "learning_rate": 5.011140233184724e-05, "loss": 10.3487, "step": 78 }, { "epoch": 0.13378492802709568, "grad_norm": 0.0393260158598423, "learning_rate": 4.958736511733516e-05, "loss": 10.3483, "step": 79 }, { "epoch": 0.1354784081287045, "grad_norm": 0.04144861549139023, "learning_rate": 4.905933986285393e-05, "loss": 10.3489, "step": 80 }, { "epoch": 0.1371718882303133, "grad_norm": 0.057905759662389755, "learning_rate": 4.8527470925235824e-05, "loss": 10.3488, "step": 81 }, { "epoch": 0.1388653683319221, "grad_norm": 0.0418972410261631, "learning_rate": 4.799190371213772e-05, "loss": 10.3495, "step": 82 }, { "epoch": 0.14055884843353092, "grad_norm": 0.03675097972154617, "learning_rate": 4.745278464228808e-05, "loss": 10.3468, "step": 83 }, { "epoch": 0.14225232853513972, "grad_norm": 0.05150232091546059, "learning_rate": 4.69102611054575e-05, "loss": 10.347, "step": 84 }, { "epoch": 0.14394580863674852, "grad_norm": 0.05643484368920326, "learning_rate": 4.6364481422163926e-05, "loss": 10.3483, "step": 85 }, { "epoch": 0.14563928873835733, "grad_norm": 0.053120311349630356, "learning_rate": 4.581559480312316e-05, "loss": 10.3476, "step": 86 }, { "epoch": 0.14733276883996613, "grad_norm": 0.03632555529475212, "learning_rate": 4.526375130845627e-05, "loss": 10.3475, "step": 87 }, { "epoch": 0.14902624894157493, "grad_norm": 0.04733320325613022, "learning_rate": 4.4709101806664554e-05, "loss": 10.3487, "step": 88 }, { "epoch": 0.15071972904318373, "grad_norm": 0.03701463341712952, "learning_rate": 4.4151797933383685e-05, "loss": 10.3458, "step": 89 }, { "epoch": 0.15241320914479256, "grad_norm": 0.040851932018995285, "learning_rate": 4.359199204992797e-05, "loss": 10.3481, "step": 90 }, { "epoch": 0.15410668924640136, "grad_norm": 0.04483847692608833, "learning_rate": 4.30298372016363e-05, "loss": 10.3478, "step": 91 }, { "epoch": 0.15580016934801016, "grad_norm": 0.05173524469137192, "learning_rate": 4.246548707603114e-05, "loss": 10.3461, "step": 92 }, { "epoch": 0.15749364944961897, "grad_norm": 0.0741141214966774, "learning_rate": 4.1899095960801805e-05, "loss": 10.345, "step": 93 }, { "epoch": 0.15918712955122777, "grad_norm": 0.052725061774253845, "learning_rate": 4.133081870162385e-05, "loss": 10.3481, "step": 94 }, { "epoch": 0.16088060965283657, "grad_norm": 0.057170942425727844, "learning_rate": 4.076081065982569e-05, "loss": 10.346, "step": 95 }, { "epoch": 0.16257408975444537, "grad_norm": 0.07554444670677185, "learning_rate": 4.018922766991447e-05, "loss": 10.3477, "step": 96 }, { "epoch": 0.1642675698560542, "grad_norm": 0.07930599898099899, "learning_rate": 3.961622599697241e-05, "loss": 10.3516, "step": 97 }, { "epoch": 0.165961049957663, "grad_norm": 0.07189879566431046, "learning_rate": 3.9041962293935516e-05, "loss": 10.3461, "step": 98 }, { "epoch": 0.1676545300592718, "grad_norm": 0.0871279165148735, "learning_rate": 3.84665935587662e-05, "loss": 10.3498, "step": 99 }, { "epoch": 0.1693480101608806, "grad_norm": 0.17175425589084625, "learning_rate": 3.7890277091531636e-05, "loss": 10.3469, "step": 100 }, { "epoch": 0.1693480101608806, "eval_loss": 10.34717845916748, "eval_runtime": 2.3148, "eval_samples_per_second": 429.838, "eval_steps_per_second": 107.568, "step": 100 }, { "epoch": 0.1710414902624894, "grad_norm": 0.04662218317389488, "learning_rate": 3.7313170451399475e-05, "loss": 10.3474, "step": 101 }, { "epoch": 0.1727349703640982, "grad_norm": 0.04416072368621826, "learning_rate": 3.673543141356278e-05, "loss": 10.3473, "step": 102 }, { "epoch": 0.17442845046570704, "grad_norm": 0.039319951087236404, "learning_rate": 3.6157217926105783e-05, "loss": 10.3474, "step": 103 }, { "epoch": 0.17612193056731584, "grad_norm": 0.047466833144426346, "learning_rate": 3.557868806682255e-05, "loss": 10.3483, "step": 104 }, { "epoch": 0.17781541066892464, "grad_norm": 0.04195760190486908, "learning_rate": 3.5e-05, "loss": 10.3475, "step": 105 }, { "epoch": 0.17950889077053345, "grad_norm": 0.052754271775484085, "learning_rate": 3.442131193317745e-05, "loss": 10.348, "step": 106 }, { "epoch": 0.18120237087214225, "grad_norm": 0.03500129655003548, "learning_rate": 3.384278207389421e-05, "loss": 10.3492, "step": 107 }, { "epoch": 0.18289585097375105, "grad_norm": 0.0344226248562336, "learning_rate": 3.3264568586437216e-05, "loss": 10.3483, "step": 108 }, { "epoch": 0.18458933107535985, "grad_norm": 0.0443701297044754, "learning_rate": 3.268682954860052e-05, "loss": 10.3489, "step": 109 }, { "epoch": 0.18628281117696868, "grad_norm": 0.04030259698629379, "learning_rate": 3.210972290846837e-05, "loss": 10.3469, "step": 110 }, { "epoch": 0.18797629127857748, "grad_norm": 0.03760414570569992, "learning_rate": 3.15334064412338e-05, "loss": 10.3481, "step": 111 }, { "epoch": 0.1896697713801863, "grad_norm": 0.0433247834444046, "learning_rate": 3.0958037706064485e-05, "loss": 10.3479, "step": 112 }, { "epoch": 0.1913632514817951, "grad_norm": 0.0393412746489048, "learning_rate": 3.038377400302758e-05, "loss": 10.3459, "step": 113 }, { "epoch": 0.1930567315834039, "grad_norm": 0.0358240120112896, "learning_rate": 2.9810772330085524e-05, "loss": 10.3471, "step": 114 }, { "epoch": 0.1947502116850127, "grad_norm": 0.04923977330327034, "learning_rate": 2.9239189340174306e-05, "loss": 10.349, "step": 115 }, { "epoch": 0.1964436917866215, "grad_norm": 0.03750025853514671, "learning_rate": 2.8669181298376163e-05, "loss": 10.3473, "step": 116 }, { "epoch": 0.19813717188823032, "grad_norm": 0.029165159910917282, "learning_rate": 2.8100904039198193e-05, "loss": 10.3473, "step": 117 }, { "epoch": 0.19983065198983913, "grad_norm": 0.038380276411771774, "learning_rate": 2.7534512923968863e-05, "loss": 10.3476, "step": 118 }, { "epoch": 0.20152413209144793, "grad_norm": 0.03772229328751564, "learning_rate": 2.6970162798363695e-05, "loss": 10.347, "step": 119 }, { "epoch": 0.20321761219305673, "grad_norm": 0.042656853795051575, "learning_rate": 2.640800795007203e-05, "loss": 10.3464, "step": 120 }, { "epoch": 0.20491109229466553, "grad_norm": 0.038278091698884964, "learning_rate": 2.5848202066616305e-05, "loss": 10.3465, "step": 121 }, { "epoch": 0.20660457239627433, "grad_norm": 0.03428620845079422, "learning_rate": 2.5290898193335446e-05, "loss": 10.3461, "step": 122 }, { "epoch": 0.20829805249788316, "grad_norm": 0.038639917969703674, "learning_rate": 2.4736248691543736e-05, "loss": 10.3467, "step": 123 }, { "epoch": 0.20999153259949196, "grad_norm": 0.03810051828622818, "learning_rate": 2.4184405196876842e-05, "loss": 10.347, "step": 124 }, { "epoch": 0.21168501270110077, "grad_norm": 0.03695661202073097, "learning_rate": 2.363551857783608e-05, "loss": 10.3476, "step": 125 }, { "epoch": 0.21337849280270957, "grad_norm": 0.046606481075286865, "learning_rate": 2.308973889454249e-05, "loss": 10.347, "step": 126 }, { "epoch": 0.21507197290431837, "grad_norm": 0.04259473457932472, "learning_rate": 2.2547215357711918e-05, "loss": 10.3466, "step": 127 }, { "epoch": 0.21676545300592717, "grad_norm": 0.034811653196811676, "learning_rate": 2.2008096287862266e-05, "loss": 10.347, "step": 128 }, { "epoch": 0.21845893310753597, "grad_norm": 0.03522142395377159, "learning_rate": 2.1472529074764177e-05, "loss": 10.3465, "step": 129 }, { "epoch": 0.2201524132091448, "grad_norm": 0.030583711341023445, "learning_rate": 2.0940660137146074e-05, "loss": 10.3461, "step": 130 }, { "epoch": 0.2218458933107536, "grad_norm": 0.036702465265989304, "learning_rate": 2.041263488266484e-05, "loss": 10.3487, "step": 131 }, { "epoch": 0.2235393734123624, "grad_norm": 0.03403886407613754, "learning_rate": 1.988859766815275e-05, "loss": 10.3443, "step": 132 }, { "epoch": 0.2252328535139712, "grad_norm": 0.033561062067747116, "learning_rate": 1.9368691760151773e-05, "loss": 10.3463, "step": 133 }, { "epoch": 0.22692633361558, "grad_norm": 0.04279007017612457, "learning_rate": 1.885305929574593e-05, "loss": 10.3474, "step": 134 }, { "epoch": 0.2286198137171888, "grad_norm": 0.03716912120580673, "learning_rate": 1.8341841243702424e-05, "loss": 10.3432, "step": 135 }, { "epoch": 0.23031329381879762, "grad_norm": 0.03685978800058365, "learning_rate": 1.7835177365932225e-05, "loss": 10.3482, "step": 136 }, { "epoch": 0.23200677392040644, "grad_norm": 0.03692598268389702, "learning_rate": 1.7333206179280478e-05, "loss": 10.3452, "step": 137 }, { "epoch": 0.23370025402201525, "grad_norm": 0.05442724749445915, "learning_rate": 1.6836064917657478e-05, "loss": 10.3441, "step": 138 }, { "epoch": 0.23539373412362405, "grad_norm": 0.03732023015618324, "learning_rate": 1.6343889494520224e-05, "loss": 10.346, "step": 139 }, { "epoch": 0.23708721422523285, "grad_norm": 0.041189733892679214, "learning_rate": 1.5856814465715064e-05, "loss": 10.3449, "step": 140 }, { "epoch": 0.23878069432684165, "grad_norm": 0.039623793214559555, "learning_rate": 1.5374972992691458e-05, "loss": 10.3455, "step": 141 }, { "epoch": 0.24047417442845045, "grad_norm": 0.05379751697182655, "learning_rate": 1.4898496806096974e-05, "loss": 10.3445, "step": 142 }, { "epoch": 0.24216765453005928, "grad_norm": 0.04194023460149765, "learning_rate": 1.4427516169763444e-05, "loss": 10.3449, "step": 143 }, { "epoch": 0.2438611346316681, "grad_norm": 0.056030042469501495, "learning_rate": 1.396215984509412e-05, "loss": 10.3429, "step": 144 }, { "epoch": 0.2455546147332769, "grad_norm": 0.0768880546092987, "learning_rate": 1.3502555055861625e-05, "loss": 10.3461, "step": 145 }, { "epoch": 0.2472480948348857, "grad_norm": 0.04330800473690033, "learning_rate": 1.3048827453426203e-05, "loss": 10.3455, "step": 146 }, { "epoch": 0.2489415749364945, "grad_norm": 0.07401636242866516, "learning_rate": 1.2601101082383917e-05, "loss": 10.3477, "step": 147 }, { "epoch": 0.2506350550381033, "grad_norm": 0.07112563401460648, "learning_rate": 1.2159498346654094e-05, "loss": 10.3463, "step": 148 }, { "epoch": 0.2523285351397121, "grad_norm": 0.09609571099281311, "learning_rate": 1.1724139976015306e-05, "loss": 10.3451, "step": 149 }, { "epoch": 0.2540220152413209, "grad_norm": 0.1710243821144104, "learning_rate": 1.1295144993099068e-05, "loss": 10.348, "step": 150 }, { "epoch": 0.2540220152413209, "eval_loss": 10.346138954162598, "eval_runtime": 2.2706, "eval_samples_per_second": 438.212, "eval_steps_per_second": 109.663, "step": 150 }, { "epoch": 0.2557154953429297, "grad_norm": 0.03954402729868889, "learning_rate": 1.0872630680850196e-05, "loss": 10.3483, "step": 151 }, { "epoch": 0.2574089754445385, "grad_norm": 0.0462455190718174, "learning_rate": 1.0456712550462898e-05, "loss": 10.3468, "step": 152 }, { "epoch": 0.25910245554614736, "grad_norm": 0.03721482306718826, "learning_rate": 1.0047504309801104e-05, "loss": 10.3471, "step": 153 }, { "epoch": 0.26079593564775616, "grad_norm": 0.0438302680850029, "learning_rate": 9.645117832311886e-06, "loss": 10.3467, "step": 154 }, { "epoch": 0.26248941574936496, "grad_norm": 0.04052369296550751, "learning_rate": 9.249663126440394e-06, "loss": 10.3475, "step": 155 }, { "epoch": 0.26418289585097376, "grad_norm": 0.0368545800447464, "learning_rate": 8.861248305554624e-06, "loss": 10.3469, "step": 156 }, { "epoch": 0.26587637595258257, "grad_norm": 0.033342041075229645, "learning_rate": 8.47997955838829e-06, "loss": 10.3472, "step": 157 }, { "epoch": 0.26756985605419137, "grad_norm": 0.040352921932935715, "learning_rate": 8.10596112000994e-06, "loss": 10.3476, "step": 158 }, { "epoch": 0.26926333615580017, "grad_norm": 0.045244328677654266, "learning_rate": 7.739295243326067e-06, "loss": 10.3481, "step": 159 }, { "epoch": 0.270956816257409, "grad_norm": 0.03528599813580513, "learning_rate": 7.380082171126228e-06, "loss": 10.3464, "step": 160 }, { "epoch": 0.2726502963590178, "grad_norm": 0.051067374646663666, "learning_rate": 7.028420108677635e-06, "loss": 10.3466, "step": 161 }, { "epoch": 0.2743437764606266, "grad_norm": 0.03743496537208557, "learning_rate": 6.684405196876842e-06, "loss": 10.3461, "step": 162 }, { "epoch": 0.2760372565622354, "grad_norm": 0.03153526782989502, "learning_rate": 6.3481314859657675e-06, "loss": 10.3471, "step": 163 }, { "epoch": 0.2777307366638442, "grad_norm": 0.0363004244863987, "learning_rate": 6.019690909819298e-06, "loss": 10.3473, "step": 164 }, { "epoch": 0.279424216765453, "grad_norm": 0.03496118262410164, "learning_rate": 5.6991732608115e-06, "loss": 10.3472, "step": 165 }, { "epoch": 0.28111769686706184, "grad_norm": 0.04263157397508621, "learning_rate": 5.386666165267256e-06, "loss": 10.3462, "step": 166 }, { "epoch": 0.28281117696867064, "grad_norm": 0.03566034883260727, "learning_rate": 5.08225505950613e-06, "loss": 10.3481, "step": 167 }, { "epoch": 0.28450465707027944, "grad_norm": 0.03986247256398201, "learning_rate": 4.786023166484913e-06, "loss": 10.3463, "step": 168 }, { "epoch": 0.28619813717188824, "grad_norm": 0.039538342505693436, "learning_rate": 4.498051473045291e-06, "loss": 10.3464, "step": 169 }, { "epoch": 0.28789161727349705, "grad_norm": 0.03614843636751175, "learning_rate": 4.218418707772886e-06, "loss": 10.3472, "step": 170 }, { "epoch": 0.28958509737510585, "grad_norm": 0.027718421071767807, "learning_rate": 3.947201319473587e-06, "loss": 10.3445, "step": 171 }, { "epoch": 0.29127857747671465, "grad_norm": 0.04426714777946472, "learning_rate": 3.684473456273278e-06, "loss": 10.3459, "step": 172 }, { "epoch": 0.29297205757832345, "grad_norm": 0.027950307354331017, "learning_rate": 3.4303069453464383e-06, "loss": 10.3464, "step": 173 }, { "epoch": 0.29466553767993225, "grad_norm": 0.03315555676817894, "learning_rate": 3.184771273279312e-06, "loss": 10.3455, "step": 174 }, { "epoch": 0.29635901778154106, "grad_norm": 0.026465769857168198, "learning_rate": 2.947933567072987e-06, "loss": 10.347, "step": 175 }, { "epoch": 0.29805249788314986, "grad_norm": 0.033119168132543564, "learning_rate": 2.719858575791534e-06, "loss": 10.3467, "step": 176 }, { "epoch": 0.29974597798475866, "grad_norm": 0.034391850233078, "learning_rate": 2.500608652860256e-06, "loss": 10.3449, "step": 177 }, { "epoch": 0.30143945808636746, "grad_norm": 0.03679900988936424, "learning_rate": 2.2902437390188737e-06, "loss": 10.3463, "step": 178 }, { "epoch": 0.30313293818797626, "grad_norm": 0.041116807609796524, "learning_rate": 2.0888213459343587e-06, "loss": 10.3455, "step": 179 }, { "epoch": 0.3048264182895851, "grad_norm": 0.03838905692100525, "learning_rate": 1.8963965404777875e-06, "loss": 10.3452, "step": 180 }, { "epoch": 0.3065198983911939, "grad_norm": 0.039337340742349625, "learning_rate": 1.7130219296696263e-06, "loss": 10.3459, "step": 181 }, { "epoch": 0.3082133784928027, "grad_norm": 0.032874945551157, "learning_rate": 1.5387476462974824e-06, "loss": 10.346, "step": 182 }, { "epoch": 0.3099068585944115, "grad_norm": 0.04064587503671646, "learning_rate": 1.3736213352103147e-06, "loss": 10.3462, "step": 183 }, { "epoch": 0.31160033869602033, "grad_norm": 0.03022320568561554, "learning_rate": 1.2176881402928002e-06, "loss": 10.3447, "step": 184 }, { "epoch": 0.31329381879762913, "grad_norm": 0.04129958897829056, "learning_rate": 1.0709906921234367e-06, "loss": 10.344, "step": 185 }, { "epoch": 0.31498729889923793, "grad_norm": 0.04146081581711769, "learning_rate": 9.33569096319799e-07, "loss": 10.3444, "step": 186 }, { "epoch": 0.31668077900084673, "grad_norm": 0.045574747025966644, "learning_rate": 8.054609225740255e-07, "loss": 10.3443, "step": 187 }, { "epoch": 0.31837425910245554, "grad_norm": 0.04817044734954834, "learning_rate": 6.867011943816724e-07, "loss": 10.3444, "step": 188 }, { "epoch": 0.32006773920406434, "grad_norm": 0.04357161372900009, "learning_rate": 5.77322379466617e-07, "loss": 10.3441, "step": 189 }, { "epoch": 0.32176121930567314, "grad_norm": 0.04117486625909805, "learning_rate": 4.773543809047186e-07, "loss": 10.3451, "step": 190 }, { "epoch": 0.32345469940728194, "grad_norm": 0.04571401700377464, "learning_rate": 3.868245289486027e-07, "loss": 10.3444, "step": 191 }, { "epoch": 0.32514817950889074, "grad_norm": 0.0635538250207901, "learning_rate": 3.0575757355586817e-07, "loss": 10.3452, "step": 192 }, { "epoch": 0.3268416596104996, "grad_norm": 0.046295084059238434, "learning_rate": 2.3417567762266497e-07, "loss": 10.3457, "step": 193 }, { "epoch": 0.3285351397121084, "grad_norm": 0.05600731447339058, "learning_rate": 1.7209841092460043e-07, "loss": 10.3441, "step": 194 }, { "epoch": 0.3302286198137172, "grad_norm": 0.05414403975009918, "learning_rate": 1.1954274476655534e-07, "loss": 10.3467, "step": 195 }, { "epoch": 0.331922099915326, "grad_norm": 0.07247443497180939, "learning_rate": 7.652304734289127e-08, "loss": 10.3455, "step": 196 }, { "epoch": 0.3336155800169348, "grad_norm": 0.08474735170602798, "learning_rate": 4.30510798093342e-08, "loss": 10.344, "step": 197 }, { "epoch": 0.3353090601185436, "grad_norm": 0.07254213094711304, "learning_rate": 1.9135993067588284e-08, "loss": 10.3455, "step": 198 }, { "epoch": 0.3370025402201524, "grad_norm": 0.11007220298051834, "learning_rate": 4.784325263584854e-09, "loss": 10.3485, "step": 199 }, { "epoch": 0.3386960203217612, "grad_norm": 0.1537920981645584, "learning_rate": 0.0, "loss": 10.3449, "step": 200 }, { "epoch": 0.3386960203217612, "eval_loss": 10.34589672088623, "eval_runtime": 2.2612, "eval_samples_per_second": 440.04, "eval_steps_per_second": 110.121, "step": 200 } ], "logging_steps": 1, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 4, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 22923660754944.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }