{ "best_metric": 0.9832578301429749, "best_model_checkpoint": "miner_id_24/checkpoint-200", "epoch": 0.015401794309037002, "eval_steps": 50, "global_step": 200, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 7.700897154518502e-05, "grad_norm": 1.8970366716384888, "learning_rate": 7e-06, "loss": 0.8107, "step": 1 }, { "epoch": 7.700897154518502e-05, "eval_loss": 1.603941559791565, "eval_runtime": 844.3836, "eval_samples_per_second": 25.902, "eval_steps_per_second": 6.476, "step": 1 }, { "epoch": 0.00015401794309037004, "grad_norm": 2.7837564945220947, "learning_rate": 1.4e-05, "loss": 1.2198, "step": 2 }, { "epoch": 0.00023102691463555504, "grad_norm": 3.092777729034424, "learning_rate": 2.1e-05, "loss": 1.302, "step": 3 }, { "epoch": 0.0003080358861807401, "grad_norm": 3.1793932914733887, "learning_rate": 2.8e-05, "loss": 1.3824, "step": 4 }, { "epoch": 0.0003850448577259251, "grad_norm": 2.5381124019622803, "learning_rate": 3.5e-05, "loss": 1.3184, "step": 5 }, { "epoch": 0.0004620538292711101, "grad_norm": 1.6639097929000854, "learning_rate": 4.2e-05, "loss": 0.9797, "step": 6 }, { "epoch": 0.0005390628008162951, "grad_norm": 1.49283766746521, "learning_rate": 4.899999999999999e-05, "loss": 0.9926, "step": 7 }, { "epoch": 0.0006160717723614802, "grad_norm": 1.2911243438720703, "learning_rate": 5.6e-05, "loss": 0.9673, "step": 8 }, { "epoch": 0.0006930807439066651, "grad_norm": 1.0811328887939453, "learning_rate": 6.3e-05, "loss": 1.0625, "step": 9 }, { "epoch": 0.0007700897154518502, "grad_norm": 1.1771808862686157, "learning_rate": 7e-05, "loss": 0.9455, "step": 10 }, { "epoch": 0.0008470986869970351, "grad_norm": 1.1715754270553589, "learning_rate": 6.999521567473641e-05, "loss": 0.9732, "step": 11 }, { "epoch": 0.0009241076585422202, "grad_norm": 1.0655852556228638, "learning_rate": 6.998086400693241e-05, "loss": 1.0272, "step": 12 }, { "epoch": 0.0010011166300874052, "grad_norm": 1.2130272388458252, "learning_rate": 6.995694892019065e-05, "loss": 0.9886, "step": 13 }, { "epoch": 0.0010781256016325902, "grad_norm": 0.9644531607627869, "learning_rate": 6.99234769526571e-05, "loss": 1.0628, "step": 14 }, { "epoch": 0.0011551345731777751, "grad_norm": 0.9874843955039978, "learning_rate": 6.988045725523343e-05, "loss": 0.9652, "step": 15 }, { "epoch": 0.0012321435447229603, "grad_norm": 0.887622594833374, "learning_rate": 6.982790158907539e-05, "loss": 0.8977, "step": 16 }, { "epoch": 0.0013091525162681453, "grad_norm": 1.0247609615325928, "learning_rate": 6.976582432237733e-05, "loss": 1.0614, "step": 17 }, { "epoch": 0.0013861614878133302, "grad_norm": 0.8926209211349487, "learning_rate": 6.969424242644413e-05, "loss": 0.9281, "step": 18 }, { "epoch": 0.0014631704593585152, "grad_norm": 0.9736675024032593, "learning_rate": 6.961317547105138e-05, "loss": 1.0557, "step": 19 }, { "epoch": 0.0015401794309037003, "grad_norm": 0.9907094836235046, "learning_rate": 6.952264561909527e-05, "loss": 1.0623, "step": 20 }, { "epoch": 0.0016171884024488853, "grad_norm": 0.9420015811920166, "learning_rate": 6.942267762053337e-05, "loss": 0.9555, "step": 21 }, { "epoch": 0.0016941973739940702, "grad_norm": 0.9477255344390869, "learning_rate": 6.931329880561832e-05, "loss": 0.9083, "step": 22 }, { "epoch": 0.0017712063455392554, "grad_norm": 1.0044710636138916, "learning_rate": 6.919453907742597e-05, "loss": 1.1097, "step": 23 }, { "epoch": 0.0018482153170844404, "grad_norm": 1.058323621749878, "learning_rate": 6.90664309036802e-05, "loss": 1.1576, "step": 24 }, { "epoch": 0.0019252242886296253, "grad_norm": 1.0781478881835938, "learning_rate": 6.892900930787656e-05, "loss": 1.0734, "step": 25 }, { "epoch": 0.0020022332601748105, "grad_norm": 0.9603778719902039, "learning_rate": 6.87823118597072e-05, "loss": 0.9945, "step": 26 }, { "epoch": 0.0020792422317199954, "grad_norm": 1.0233170986175537, "learning_rate": 6.862637866478969e-05, "loss": 1.0557, "step": 27 }, { "epoch": 0.0021562512032651804, "grad_norm": 1.1913679838180542, "learning_rate": 6.846125235370252e-05, "loss": 1.1243, "step": 28 }, { "epoch": 0.0022332601748103653, "grad_norm": 1.0753092765808105, "learning_rate": 6.828697807033038e-05, "loss": 1.2218, "step": 29 }, { "epoch": 0.0023102691463555503, "grad_norm": 1.134995937347412, "learning_rate": 6.81036034595222e-05, "loss": 1.2743, "step": 30 }, { "epoch": 0.0023872781179007352, "grad_norm": 1.2747467756271362, "learning_rate": 6.791117865406564e-05, "loss": 1.4711, "step": 31 }, { "epoch": 0.0024642870894459206, "grad_norm": 1.3587024211883545, "learning_rate": 6.770975626098112e-05, "loss": 1.4346, "step": 32 }, { "epoch": 0.0025412960609911056, "grad_norm": 1.485734224319458, "learning_rate": 6.749939134713974e-05, "loss": 1.2971, "step": 33 }, { "epoch": 0.0026183050325362905, "grad_norm": 1.4099006652832031, "learning_rate": 6.728014142420846e-05, "loss": 1.2941, "step": 34 }, { "epoch": 0.0026953140040814755, "grad_norm": 1.4036692380905151, "learning_rate": 6.7052066432927e-05, "loss": 1.3239, "step": 35 }, { "epoch": 0.0027723229756266604, "grad_norm": 1.4389519691467285, "learning_rate": 6.681522872672069e-05, "loss": 1.3555, "step": 36 }, { "epoch": 0.0028493319471718454, "grad_norm": 1.5032252073287964, "learning_rate": 6.656969305465356e-05, "loss": 1.4509, "step": 37 }, { "epoch": 0.0029263409187170303, "grad_norm": 1.5099583864212036, "learning_rate": 6.631552654372672e-05, "loss": 1.3057, "step": 38 }, { "epoch": 0.0030033498902622157, "grad_norm": 1.5861775875091553, "learning_rate": 6.60527986805264e-05, "loss": 1.2474, "step": 39 }, { "epoch": 0.0030803588618074007, "grad_norm": 1.465627908706665, "learning_rate": 6.578158129222711e-05, "loss": 1.1795, "step": 40 }, { "epoch": 0.0031573678333525856, "grad_norm": 1.4940845966339111, "learning_rate": 6.550194852695469e-05, "loss": 1.1043, "step": 41 }, { "epoch": 0.0032343768048977706, "grad_norm": 1.6645580530166626, "learning_rate": 6.521397683351509e-05, "loss": 1.2097, "step": 42 }, { "epoch": 0.0033113857764429555, "grad_norm": 1.7047836780548096, "learning_rate": 6.491774494049386e-05, "loss": 1.1764, "step": 43 }, { "epoch": 0.0033883947479881405, "grad_norm": 1.7463964223861694, "learning_rate": 6.461333383473272e-05, "loss": 1.1972, "step": 44 }, { "epoch": 0.0034654037195333254, "grad_norm": 1.8505029678344727, "learning_rate": 6.430082673918849e-05, "loss": 1.1955, "step": 45 }, { "epoch": 0.003542412691078511, "grad_norm": 2.208298921585083, "learning_rate": 6.398030909018069e-05, "loss": 1.2783, "step": 46 }, { "epoch": 0.0036194216626236958, "grad_norm": 2.1390464305877686, "learning_rate": 6.365186851403423e-05, "loss": 1.2488, "step": 47 }, { "epoch": 0.0036964306341688807, "grad_norm": 2.516023874282837, "learning_rate": 6.331559480312315e-05, "loss": 1.2666, "step": 48 }, { "epoch": 0.0037734396057140657, "grad_norm": 2.705584764480591, "learning_rate": 6.297157989132236e-05, "loss": 1.1743, "step": 49 }, { "epoch": 0.0038504485772592506, "grad_norm": 3.8397316932678223, "learning_rate": 6.261991782887377e-05, "loss": 0.974, "step": 50 }, { "epoch": 0.0038504485772592506, "eval_loss": 1.1016550064086914, "eval_runtime": 849.689, "eval_samples_per_second": 25.74, "eval_steps_per_second": 6.435, "step": 50 }, { "epoch": 0.003927457548804436, "grad_norm": 0.8057467937469482, "learning_rate": 6.226070475667393e-05, "loss": 0.6987, "step": 51 }, { "epoch": 0.004004466520349621, "grad_norm": 0.9255357384681702, "learning_rate": 6.189403887999006e-05, "loss": 0.7462, "step": 52 }, { "epoch": 0.0040814754918948055, "grad_norm": 1.2753374576568604, "learning_rate": 6.152002044161171e-05, "loss": 1.073, "step": 53 }, { "epoch": 0.004158484463439991, "grad_norm": 0.8313521146774292, "learning_rate": 6.113875169444539e-05, "loss": 0.8174, "step": 54 }, { "epoch": 0.004235493434985175, "grad_norm": 0.7349550127983093, "learning_rate": 6.0750336873559605e-05, "loss": 0.7324, "step": 55 }, { "epoch": 0.004312502406530361, "grad_norm": 0.7651317715644836, "learning_rate": 6.035488216768811e-05, "loss": 0.7832, "step": 56 }, { "epoch": 0.004389511378075546, "grad_norm": 0.7619487643241882, "learning_rate": 5.9952495690198894e-05, "loss": 0.8808, "step": 57 }, { "epoch": 0.004466520349620731, "grad_norm": 0.650001049041748, "learning_rate": 5.954328744953709e-05, "loss": 0.7383, "step": 58 }, { "epoch": 0.004543529321165916, "grad_norm": 0.7676343321800232, "learning_rate": 5.91273693191498e-05, "loss": 0.818, "step": 59 }, { "epoch": 0.004620538292711101, "grad_norm": 0.7854016423225403, "learning_rate": 5.870485500690094e-05, "loss": 0.7568, "step": 60 }, { "epoch": 0.004697547264256286, "grad_norm": 0.7838364243507385, "learning_rate": 5.827586002398468e-05, "loss": 0.855, "step": 61 }, { "epoch": 0.0047745562358014705, "grad_norm": 0.7832164168357849, "learning_rate": 5.784050165334589e-05, "loss": 0.8511, "step": 62 }, { "epoch": 0.004851565207346656, "grad_norm": 0.8185941576957703, "learning_rate": 5.739889891761608e-05, "loss": 0.8786, "step": 63 }, { "epoch": 0.004928574178891841, "grad_norm": 0.7806155681610107, "learning_rate": 5.6951172546573794e-05, "loss": 0.8636, "step": 64 }, { "epoch": 0.005005583150437026, "grad_norm": 0.8430364727973938, "learning_rate": 5.6497444944138376e-05, "loss": 0.8814, "step": 65 }, { "epoch": 0.005082592121982211, "grad_norm": 0.7783248424530029, "learning_rate": 5.603784015490587e-05, "loss": 0.7728, "step": 66 }, { "epoch": 0.005159601093527396, "grad_norm": 0.9018055200576782, "learning_rate": 5.557248383023655e-05, "loss": 0.9196, "step": 67 }, { "epoch": 0.005236610065072581, "grad_norm": 0.7902474999427795, "learning_rate": 5.510150319390302e-05, "loss": 0.8653, "step": 68 }, { "epoch": 0.005313619036617766, "grad_norm": 0.9198923110961914, "learning_rate": 5.4625027007308546e-05, "loss": 0.933, "step": 69 }, { "epoch": 0.005390628008162951, "grad_norm": 0.8455578684806824, "learning_rate": 5.414318553428494e-05, "loss": 0.9384, "step": 70 }, { "epoch": 0.005467636979708136, "grad_norm": 0.9272430539131165, "learning_rate": 5.3656110505479776e-05, "loss": 0.9889, "step": 71 }, { "epoch": 0.005544645951253321, "grad_norm": 0.8100258708000183, "learning_rate": 5.316393508234253e-05, "loss": 0.9286, "step": 72 }, { "epoch": 0.005621654922798506, "grad_norm": 0.9197900295257568, "learning_rate": 5.266679382071953e-05, "loss": 0.9884, "step": 73 }, { "epoch": 0.005698663894343691, "grad_norm": 0.963314414024353, "learning_rate": 5.216482263406778e-05, "loss": 0.9356, "step": 74 }, { "epoch": 0.005775672865888876, "grad_norm": 0.9361957311630249, "learning_rate": 5.1658158756297576e-05, "loss": 1.0434, "step": 75 }, { "epoch": 0.005852681837434061, "grad_norm": 1.0076184272766113, "learning_rate": 5.114694070425407e-05, "loss": 1.0363, "step": 76 }, { "epoch": 0.005929690808979246, "grad_norm": 0.9824795126914978, "learning_rate": 5.063130823984823e-05, "loss": 0.9545, "step": 77 }, { "epoch": 0.0060066997805244314, "grad_norm": 1.093180537223816, "learning_rate": 5.011140233184724e-05, "loss": 1.1371, "step": 78 }, { "epoch": 0.006083708752069616, "grad_norm": 1.108821988105774, "learning_rate": 4.958736511733516e-05, "loss": 1.1152, "step": 79 }, { "epoch": 0.006160717723614801, "grad_norm": 1.167564034461975, "learning_rate": 4.905933986285393e-05, "loss": 1.3036, "step": 80 }, { "epoch": 0.006237726695159986, "grad_norm": 1.169791579246521, "learning_rate": 4.8527470925235824e-05, "loss": 1.3008, "step": 81 }, { "epoch": 0.006314735666705171, "grad_norm": 1.238440990447998, "learning_rate": 4.799190371213772e-05, "loss": 1.3018, "step": 82 }, { "epoch": 0.006391744638250356, "grad_norm": 1.2798845767974854, "learning_rate": 4.745278464228808e-05, "loss": 1.325, "step": 83 }, { "epoch": 0.006468753609795541, "grad_norm": 1.2485350370407104, "learning_rate": 4.69102611054575e-05, "loss": 1.2403, "step": 84 }, { "epoch": 0.0065457625813407265, "grad_norm": 1.3679078817367554, "learning_rate": 4.6364481422163926e-05, "loss": 1.2971, "step": 85 }, { "epoch": 0.006622771552885911, "grad_norm": 1.4008992910385132, "learning_rate": 4.581559480312316e-05, "loss": 1.2184, "step": 86 }, { "epoch": 0.0066997805244310964, "grad_norm": 1.3539499044418335, "learning_rate": 4.526375130845627e-05, "loss": 1.109, "step": 87 }, { "epoch": 0.006776789495976281, "grad_norm": 1.4504971504211426, "learning_rate": 4.4709101806664554e-05, "loss": 1.1855, "step": 88 }, { "epoch": 0.006853798467521466, "grad_norm": 1.5348631143569946, "learning_rate": 4.4151797933383685e-05, "loss": 1.1484, "step": 89 }, { "epoch": 0.006930807439066651, "grad_norm": 1.4527966976165771, "learning_rate": 4.359199204992797e-05, "loss": 1.1442, "step": 90 }, { "epoch": 0.007007816410611836, "grad_norm": 1.5797408819198608, "learning_rate": 4.30298372016363e-05, "loss": 1.1574, "step": 91 }, { "epoch": 0.007084825382157022, "grad_norm": 1.6132049560546875, "learning_rate": 4.246548707603114e-05, "loss": 1.1719, "step": 92 }, { "epoch": 0.007161834353702206, "grad_norm": 1.579073429107666, "learning_rate": 4.1899095960801805e-05, "loss": 1.1875, "step": 93 }, { "epoch": 0.0072388433252473915, "grad_norm": 1.8216954469680786, "learning_rate": 4.133081870162385e-05, "loss": 1.1405, "step": 94 }, { "epoch": 0.007315852296792576, "grad_norm": 1.7299689054489136, "learning_rate": 4.076081065982569e-05, "loss": 1.1056, "step": 95 }, { "epoch": 0.0073928612683377614, "grad_norm": 1.8903682231903076, "learning_rate": 4.018922766991447e-05, "loss": 1.1549, "step": 96 }, { "epoch": 0.007469870239882946, "grad_norm": 1.942421317100525, "learning_rate": 3.961622599697241e-05, "loss": 1.2044, "step": 97 }, { "epoch": 0.007546879211428131, "grad_norm": 2.168710470199585, "learning_rate": 3.9041962293935516e-05, "loss": 1.2094, "step": 98 }, { "epoch": 0.007623888182973317, "grad_norm": 2.435220718383789, "learning_rate": 3.84665935587662e-05, "loss": 1.1325, "step": 99 }, { "epoch": 0.007700897154518501, "grad_norm": 3.049816608428955, "learning_rate": 3.7890277091531636e-05, "loss": 0.9724, "step": 100 }, { "epoch": 0.007700897154518501, "eval_loss": 1.021877646446228, "eval_runtime": 849.5256, "eval_samples_per_second": 25.745, "eval_steps_per_second": 6.437, "step": 100 }, { "epoch": 0.007777906126063687, "grad_norm": 0.6269429922103882, "learning_rate": 3.7313170451399475e-05, "loss": 0.64, "step": 101 }, { "epoch": 0.007854915097608871, "grad_norm": 0.8250545859336853, "learning_rate": 3.673543141356278e-05, "loss": 0.847, "step": 102 }, { "epoch": 0.007931924069154056, "grad_norm": 0.8081998229026794, "learning_rate": 3.6157217926105783e-05, "loss": 0.8148, "step": 103 }, { "epoch": 0.008008933040699242, "grad_norm": 0.7385756373405457, "learning_rate": 3.557868806682255e-05, "loss": 0.6817, "step": 104 }, { "epoch": 0.008085942012244426, "grad_norm": 0.7062004208564758, "learning_rate": 3.5e-05, "loss": 0.6806, "step": 105 }, { "epoch": 0.008162950983789611, "grad_norm": 0.7016987204551697, "learning_rate": 3.442131193317745e-05, "loss": 0.7777, "step": 106 }, { "epoch": 0.008239959955334797, "grad_norm": 0.6682083010673523, "learning_rate": 3.384278207389421e-05, "loss": 0.6737, "step": 107 }, { "epoch": 0.008316968926879982, "grad_norm": 0.7276062369346619, "learning_rate": 3.3264568586437216e-05, "loss": 0.8416, "step": 108 }, { "epoch": 0.008393977898425166, "grad_norm": 0.763378918170929, "learning_rate": 3.268682954860052e-05, "loss": 0.8446, "step": 109 }, { "epoch": 0.00847098686997035, "grad_norm": 0.6761339902877808, "learning_rate": 3.210972290846837e-05, "loss": 0.7728, "step": 110 }, { "epoch": 0.008547995841515537, "grad_norm": 0.7818235754966736, "learning_rate": 3.15334064412338e-05, "loss": 0.8598, "step": 111 }, { "epoch": 0.008625004813060722, "grad_norm": 0.7958978414535522, "learning_rate": 3.0958037706064485e-05, "loss": 0.7948, "step": 112 }, { "epoch": 0.008702013784605906, "grad_norm": 0.7697209715843201, "learning_rate": 3.038377400302758e-05, "loss": 0.7613, "step": 113 }, { "epoch": 0.008779022756151092, "grad_norm": 0.7587650418281555, "learning_rate": 2.9810772330085524e-05, "loss": 0.7683, "step": 114 }, { "epoch": 0.008856031727696277, "grad_norm": 0.879778265953064, "learning_rate": 2.9239189340174306e-05, "loss": 0.8788, "step": 115 }, { "epoch": 0.008933040699241461, "grad_norm": 0.7700604796409607, "learning_rate": 2.8669181298376163e-05, "loss": 0.7829, "step": 116 }, { "epoch": 0.009010049670786646, "grad_norm": 0.8565403819084167, "learning_rate": 2.8100904039198193e-05, "loss": 0.8699, "step": 117 }, { "epoch": 0.009087058642331832, "grad_norm": 0.8874226212501526, "learning_rate": 2.7534512923968863e-05, "loss": 0.8858, "step": 118 }, { "epoch": 0.009164067613877017, "grad_norm": 0.8677376508712769, "learning_rate": 2.6970162798363695e-05, "loss": 0.9841, "step": 119 }, { "epoch": 0.009241076585422201, "grad_norm": 0.9221559762954712, "learning_rate": 2.640800795007203e-05, "loss": 0.9674, "step": 120 }, { "epoch": 0.009318085556967387, "grad_norm": 0.9063008427619934, "learning_rate": 2.5848202066616305e-05, "loss": 0.905, "step": 121 }, { "epoch": 0.009395094528512572, "grad_norm": 0.8666952848434448, "learning_rate": 2.5290898193335446e-05, "loss": 0.863, "step": 122 }, { "epoch": 0.009472103500057756, "grad_norm": 0.9033343195915222, "learning_rate": 2.4736248691543736e-05, "loss": 0.8763, "step": 123 }, { "epoch": 0.009549112471602941, "grad_norm": 0.9079000949859619, "learning_rate": 2.4184405196876842e-05, "loss": 1.0479, "step": 124 }, { "epoch": 0.009626121443148127, "grad_norm": 1.02191960811615, "learning_rate": 2.363551857783608e-05, "loss": 0.9697, "step": 125 }, { "epoch": 0.009703130414693312, "grad_norm": 0.9727286696434021, "learning_rate": 2.308973889454249e-05, "loss": 0.9756, "step": 126 }, { "epoch": 0.009780139386238496, "grad_norm": 1.0556830167770386, "learning_rate": 2.2547215357711918e-05, "loss": 0.9513, "step": 127 }, { "epoch": 0.009857148357783682, "grad_norm": 1.140964150428772, "learning_rate": 2.2008096287862266e-05, "loss": 0.9786, "step": 128 }, { "epoch": 0.009934157329328867, "grad_norm": 1.1108282804489136, "learning_rate": 2.1472529074764177e-05, "loss": 1.156, "step": 129 }, { "epoch": 0.010011166300874052, "grad_norm": 1.1995575428009033, "learning_rate": 2.0940660137146074e-05, "loss": 1.3082, "step": 130 }, { "epoch": 0.010088175272419236, "grad_norm": 1.2283718585968018, "learning_rate": 2.041263488266484e-05, "loss": 1.2607, "step": 131 }, { "epoch": 0.010165184243964422, "grad_norm": 1.3214588165283203, "learning_rate": 1.988859766815275e-05, "loss": 1.366, "step": 132 }, { "epoch": 0.010242193215509607, "grad_norm": 1.266268253326416, "learning_rate": 1.9368691760151773e-05, "loss": 1.2922, "step": 133 }, { "epoch": 0.010319202187054791, "grad_norm": 1.330242395401001, "learning_rate": 1.885305929574593e-05, "loss": 1.2814, "step": 134 }, { "epoch": 0.010396211158599978, "grad_norm": 1.3576722145080566, "learning_rate": 1.8341841243702424e-05, "loss": 1.2609, "step": 135 }, { "epoch": 0.010473220130145162, "grad_norm": 1.4859892129898071, "learning_rate": 1.7835177365932225e-05, "loss": 1.2597, "step": 136 }, { "epoch": 0.010550229101690347, "grad_norm": 1.3510634899139404, "learning_rate": 1.7333206179280478e-05, "loss": 1.1941, "step": 137 }, { "epoch": 0.010627238073235531, "grad_norm": 1.4723690748214722, "learning_rate": 1.6836064917657478e-05, "loss": 1.1697, "step": 138 }, { "epoch": 0.010704247044780717, "grad_norm": 1.5553869009017944, "learning_rate": 1.6343889494520224e-05, "loss": 1.3415, "step": 139 }, { "epoch": 0.010781256016325902, "grad_norm": 1.6149593591690063, "learning_rate": 1.5856814465715064e-05, "loss": 1.176, "step": 140 }, { "epoch": 0.010858264987871086, "grad_norm": 1.5468590259552002, "learning_rate": 1.5374972992691458e-05, "loss": 1.1791, "step": 141 }, { "epoch": 0.010935273959416273, "grad_norm": 1.5676560401916504, "learning_rate": 1.4898496806096974e-05, "loss": 1.1619, "step": 142 }, { "epoch": 0.011012282930961457, "grad_norm": 1.6609135866165161, "learning_rate": 1.4427516169763444e-05, "loss": 1.1721, "step": 143 }, { "epoch": 0.011089291902506642, "grad_norm": 1.7773945331573486, "learning_rate": 1.396215984509412e-05, "loss": 1.1659, "step": 144 }, { "epoch": 0.011166300874051826, "grad_norm": 1.6555438041687012, "learning_rate": 1.3502555055861625e-05, "loss": 1.1051, "step": 145 }, { "epoch": 0.011243309845597012, "grad_norm": 2.021911382675171, "learning_rate": 1.3048827453426203e-05, "loss": 1.06, "step": 146 }, { "epoch": 0.011320318817142197, "grad_norm": 2.1173946857452393, "learning_rate": 1.2601101082383917e-05, "loss": 1.0929, "step": 147 }, { "epoch": 0.011397327788687382, "grad_norm": 2.111060619354248, "learning_rate": 1.2159498346654094e-05, "loss": 1.0685, "step": 148 }, { "epoch": 0.011474336760232568, "grad_norm": 2.7557051181793213, "learning_rate": 1.1724139976015306e-05, "loss": 1.2004, "step": 149 }, { "epoch": 0.011551345731777752, "grad_norm": 3.0773377418518066, "learning_rate": 1.1295144993099068e-05, "loss": 0.894, "step": 150 }, { "epoch": 0.011551345731777752, "eval_loss": 0.989094078540802, "eval_runtime": 848.5025, "eval_samples_per_second": 25.776, "eval_steps_per_second": 6.444, "step": 150 }, { "epoch": 0.011628354703322937, "grad_norm": 0.49048227071762085, "learning_rate": 1.0872630680850196e-05, "loss": 0.5683, "step": 151 }, { "epoch": 0.011705363674868121, "grad_norm": 0.6810614466667175, "learning_rate": 1.0456712550462898e-05, "loss": 0.7572, "step": 152 }, { "epoch": 0.011782372646413308, "grad_norm": 0.7518895268440247, "learning_rate": 1.0047504309801104e-05, "loss": 0.7942, "step": 153 }, { "epoch": 0.011859381617958492, "grad_norm": 0.8100650310516357, "learning_rate": 9.645117832311886e-06, "loss": 0.8327, "step": 154 }, { "epoch": 0.011936390589503677, "grad_norm": 0.8092503547668457, "learning_rate": 9.249663126440394e-06, "loss": 0.829, "step": 155 }, { "epoch": 0.012013399561048863, "grad_norm": 0.6432150602340698, "learning_rate": 8.861248305554624e-06, "loss": 0.6496, "step": 156 }, { "epoch": 0.012090408532594047, "grad_norm": 0.5999425649642944, "learning_rate": 8.47997955838829e-06, "loss": 0.5903, "step": 157 }, { "epoch": 0.012167417504139232, "grad_norm": 0.7111806869506836, "learning_rate": 8.10596112000994e-06, "loss": 0.7107, "step": 158 }, { "epoch": 0.012244426475684416, "grad_norm": 0.7115854620933533, "learning_rate": 7.739295243326067e-06, "loss": 0.7083, "step": 159 }, { "epoch": 0.012321435447229603, "grad_norm": 0.6803847551345825, "learning_rate": 7.380082171126228e-06, "loss": 0.7334, "step": 160 }, { "epoch": 0.012398444418774787, "grad_norm": 0.7553372979164124, "learning_rate": 7.028420108677635e-06, "loss": 0.7847, "step": 161 }, { "epoch": 0.012475453390319972, "grad_norm": 0.7494491934776306, "learning_rate": 6.684405196876842e-06, "loss": 0.8008, "step": 162 }, { "epoch": 0.012552462361865158, "grad_norm": 0.8308342695236206, "learning_rate": 6.3481314859657675e-06, "loss": 0.8929, "step": 163 }, { "epoch": 0.012629471333410342, "grad_norm": 0.7959633469581604, "learning_rate": 6.019690909819298e-06, "loss": 0.9435, "step": 164 }, { "epoch": 0.012706480304955527, "grad_norm": 0.7931632995605469, "learning_rate": 5.6991732608115e-06, "loss": 0.8936, "step": 165 }, { "epoch": 0.012783489276500712, "grad_norm": 0.8373035192489624, "learning_rate": 5.386666165267256e-06, "loss": 0.8984, "step": 166 }, { "epoch": 0.012860498248045898, "grad_norm": 0.8174297213554382, "learning_rate": 5.08225505950613e-06, "loss": 0.9191, "step": 167 }, { "epoch": 0.012937507219591082, "grad_norm": 0.8664717078208923, "learning_rate": 4.786023166484913e-06, "loss": 0.9423, "step": 168 }, { "epoch": 0.013014516191136267, "grad_norm": 0.8544601798057556, "learning_rate": 4.498051473045291e-06, "loss": 0.8387, "step": 169 }, { "epoch": 0.013091525162681453, "grad_norm": 0.8214935660362244, "learning_rate": 4.218418707772886e-06, "loss": 0.8581, "step": 170 }, { "epoch": 0.013168534134226638, "grad_norm": 0.8594068288803101, "learning_rate": 3.947201319473587e-06, "loss": 0.8652, "step": 171 }, { "epoch": 0.013245543105771822, "grad_norm": 0.883743405342102, "learning_rate": 3.684473456273278e-06, "loss": 0.9762, "step": 172 }, { "epoch": 0.013322552077317007, "grad_norm": 0.8632309436798096, "learning_rate": 3.4303069453464383e-06, "loss": 0.9785, "step": 173 }, { "epoch": 0.013399561048862193, "grad_norm": 0.9207712411880493, "learning_rate": 3.184771273279312e-06, "loss": 0.9446, "step": 174 }, { "epoch": 0.013476570020407377, "grad_norm": 1.1362985372543335, "learning_rate": 2.947933567072987e-06, "loss": 1.0367, "step": 175 }, { "epoch": 0.013553578991952562, "grad_norm": 1.0557373762130737, "learning_rate": 2.719858575791534e-06, "loss": 1.0773, "step": 176 }, { "epoch": 0.013630587963497748, "grad_norm": 1.030173420906067, "learning_rate": 2.500608652860256e-06, "loss": 1.0026, "step": 177 }, { "epoch": 0.013707596935042933, "grad_norm": 1.1021617650985718, "learning_rate": 2.2902437390188737e-06, "loss": 1.0793, "step": 178 }, { "epoch": 0.013784605906588117, "grad_norm": 1.0124552249908447, "learning_rate": 2.0888213459343587e-06, "loss": 1.1299, "step": 179 }, { "epoch": 0.013861614878133302, "grad_norm": 1.2554916143417358, "learning_rate": 1.8963965404777875e-06, "loss": 1.1183, "step": 180 }, { "epoch": 0.013938623849678488, "grad_norm": 1.148569107055664, "learning_rate": 1.7130219296696263e-06, "loss": 1.229, "step": 181 }, { "epoch": 0.014015632821223672, "grad_norm": 1.1936874389648438, "learning_rate": 1.5387476462974824e-06, "loss": 1.2108, "step": 182 }, { "epoch": 0.014092641792768857, "grad_norm": 1.2075494527816772, "learning_rate": 1.3736213352103147e-06, "loss": 1.2433, "step": 183 }, { "epoch": 0.014169650764314043, "grad_norm": 1.2774829864501953, "learning_rate": 1.2176881402928002e-06, "loss": 1.2738, "step": 184 }, { "epoch": 0.014246659735859228, "grad_norm": 1.2447525262832642, "learning_rate": 1.0709906921234367e-06, "loss": 1.1435, "step": 185 }, { "epoch": 0.014323668707404412, "grad_norm": 1.3485177755355835, "learning_rate": 9.33569096319799e-07, "loss": 1.1858, "step": 186 }, { "epoch": 0.014400677678949597, "grad_norm": 1.4245103597640991, "learning_rate": 8.054609225740255e-07, "loss": 1.1984, "step": 187 }, { "epoch": 0.014477686650494783, "grad_norm": 1.3392527103424072, "learning_rate": 6.867011943816724e-07, "loss": 1.1286, "step": 188 }, { "epoch": 0.014554695622039968, "grad_norm": 1.5184451341629028, "learning_rate": 5.77322379466617e-07, "loss": 1.1872, "step": 189 }, { "epoch": 0.014631704593585152, "grad_norm": 1.5353091955184937, "learning_rate": 4.773543809047186e-07, "loss": 1.2407, "step": 190 }, { "epoch": 0.014708713565130338, "grad_norm": 1.5289061069488525, "learning_rate": 3.868245289486027e-07, "loss": 1.149, "step": 191 }, { "epoch": 0.014785722536675523, "grad_norm": 1.5167860984802246, "learning_rate": 3.0575757355586817e-07, "loss": 1.0424, "step": 192 }, { "epoch": 0.014862731508220707, "grad_norm": 1.6470500230789185, "learning_rate": 2.3417567762266497e-07, "loss": 1.1479, "step": 193 }, { "epoch": 0.014939740479765892, "grad_norm": 1.915789246559143, "learning_rate": 1.7209841092460043e-07, "loss": 1.1813, "step": 194 }, { "epoch": 0.015016749451311078, "grad_norm": 1.8250898122787476, "learning_rate": 1.1954274476655534e-07, "loss": 1.2852, "step": 195 }, { "epoch": 0.015093758422856263, "grad_norm": 1.7232822179794312, "learning_rate": 7.652304734289127e-08, "loss": 1.012, "step": 196 }, { "epoch": 0.015170767394401447, "grad_norm": 1.8250606060028076, "learning_rate": 4.30510798093342e-08, "loss": 1.1473, "step": 197 }, { "epoch": 0.015247776365946633, "grad_norm": 2.0770554542541504, "learning_rate": 1.9135993067588284e-08, "loss": 1.09, "step": 198 }, { "epoch": 0.015324785337491818, "grad_norm": 2.2757625579833984, "learning_rate": 4.784325263584854e-09, "loss": 1.1364, "step": 199 }, { "epoch": 0.015401794309037002, "grad_norm": 2.7049641609191895, "learning_rate": 0.0, "loss": 0.8939, "step": 200 }, { "epoch": 0.015401794309037002, "eval_loss": 0.9832578301429749, "eval_runtime": 848.8014, "eval_samples_per_second": 25.767, "eval_steps_per_second": 6.442, "step": 200 } ], "logging_steps": 1, "max_steps": 200, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 50, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 4, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 8.972467927882138e+16, "train_batch_size": 8, "trial_name": null, "trial_params": null }