{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.019517030517964842, "eval_steps": 1000, "global_step": 1457, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.00013395353821527004, "grad_norm": 4.978700160980225, "learning_rate": 8.035714285714286e-07, "loss": 1.4198334693908692, "step": 10 }, { "epoch": 0.0002679070764305401, "grad_norm": 3.940929412841797, "learning_rate": 1.6964285714285713e-06, "loss": 1.3955652236938476, "step": 20 }, { "epoch": 0.0004018606146458101, "grad_norm": 2.915323495864868, "learning_rate": 2.5892857142857148e-06, "loss": 1.3398881912231446, "step": 30 }, { "epoch": 0.0005358141528610801, "grad_norm": 2.512028932571411, "learning_rate": 3.4821428571428576e-06, "loss": 1.2956685066223144, "step": 40 }, { "epoch": 0.0006697676910763502, "grad_norm": 2.561004161834717, "learning_rate": 4.375e-06, "loss": 1.2670017242431642, "step": 50 }, { "epoch": 0.0008037212292916202, "grad_norm": 2.296826124191284, "learning_rate": 5.267857142857143e-06, "loss": 1.2354182243347167, "step": 60 }, { "epoch": 0.0009376747675068903, "grad_norm": 2.3733971118927, "learning_rate": 6.160714285714286e-06, "loss": 1.1916924476623536, "step": 70 }, { "epoch": 0.0010716283057221603, "grad_norm": 2.520475387573242, "learning_rate": 7.0535714285714286e-06, "loss": 1.1873969078063964, "step": 80 }, { "epoch": 0.0012055818439374302, "grad_norm": 2.4990739822387695, "learning_rate": 7.946428571428571e-06, "loss": 1.1627039909362793, "step": 90 }, { "epoch": 0.0013395353821527003, "grad_norm": 2.3932080268859863, "learning_rate": 8.839285714285716e-06, "loss": 1.1169233322143555, "step": 100 }, { "epoch": 0.0014734889203679704, "grad_norm": 2.6543712615966797, "learning_rate": 9.732142857142858e-06, "loss": 1.1316115379333496, "step": 110 }, { "epoch": 0.0016074424585832403, "grad_norm": 2.6352458000183105, "learning_rate": 1.0625e-05, "loss": 1.0918511390686034, "step": 120 }, { "epoch": 0.0017413959967985105, "grad_norm": 2.4628708362579346, "learning_rate": 1.1517857142857142e-05, "loss": 1.1151651382446288, "step": 130 }, { "epoch": 0.0018753495350137806, "grad_norm": 2.482074737548828, "learning_rate": 1.2410714285714287e-05, "loss": 1.094371223449707, "step": 140 }, { "epoch": 0.0020093030732290505, "grad_norm": 2.431954860687256, "learning_rate": 1.3303571428571429e-05, "loss": 1.0961938858032227, "step": 150 }, { "epoch": 0.0021432566114443206, "grad_norm": 2.8230552673339844, "learning_rate": 1.4196428571428572e-05, "loss": 1.083104705810547, "step": 160 }, { "epoch": 0.0022772101496595907, "grad_norm": 2.721494436264038, "learning_rate": 1.5089285714285714e-05, "loss": 1.0713379859924317, "step": 170 }, { "epoch": 0.0024111636878748604, "grad_norm": 2.3565499782562256, "learning_rate": 1.5982142857142857e-05, "loss": 1.099677276611328, "step": 180 }, { "epoch": 0.0025451172260901305, "grad_norm": 2.345555543899536, "learning_rate": 1.6875000000000004e-05, "loss": 1.0562498092651367, "step": 190 }, { "epoch": 0.0026790707643054006, "grad_norm": 2.381127119064331, "learning_rate": 1.7767857142857143e-05, "loss": 1.0502027511596679, "step": 200 }, { "epoch": 0.0028130243025206707, "grad_norm": 2.4133875370025635, "learning_rate": 1.8660714285714287e-05, "loss": 1.0681496620178224, "step": 210 }, { "epoch": 0.002946977840735941, "grad_norm": 2.5238466262817383, "learning_rate": 1.955357142857143e-05, "loss": 1.0440272331237792, "step": 220 }, { "epoch": 0.003080931378951211, "grad_norm": 2.7593183517456055, "learning_rate": 2.0446428571428573e-05, "loss": 1.0714456558227539, "step": 230 }, { "epoch": 0.0032148849171664807, "grad_norm": 2.5562100410461426, "learning_rate": 2.1339285714285713e-05, "loss": 1.0298255920410155, "step": 240 }, { "epoch": 0.003348838455381751, "grad_norm": 2.6205103397369385, "learning_rate": 2.2232142857142856e-05, "loss": 1.050998592376709, "step": 250 }, { "epoch": 0.003482791993597021, "grad_norm": 2.5965018272399902, "learning_rate": 2.3125000000000003e-05, "loss": 1.0283641815185547, "step": 260 }, { "epoch": 0.003616745531812291, "grad_norm": 2.3729209899902344, "learning_rate": 2.4017857142857146e-05, "loss": 1.0502397537231445, "step": 270 }, { "epoch": 0.003750699070027561, "grad_norm": 2.378077983856201, "learning_rate": 2.4910714285714286e-05, "loss": 1.0391980171203614, "step": 280 }, { "epoch": 0.003884652608242831, "grad_norm": 2.4107515811920166, "learning_rate": 2.5803571428571433e-05, "loss": 1.0300152778625489, "step": 290 }, { "epoch": 0.004018606146458101, "grad_norm": 2.4866559505462646, "learning_rate": 2.6696428571428573e-05, "loss": 1.0498000144958497, "step": 300 }, { "epoch": 0.004152559684673371, "grad_norm": 2.3568379878997803, "learning_rate": 2.7589285714285716e-05, "loss": 1.0401558876037598, "step": 310 }, { "epoch": 0.004286513222888641, "grad_norm": 2.456519603729248, "learning_rate": 2.8482142857142856e-05, "loss": 1.0105724334716797, "step": 320 }, { "epoch": 0.004420466761103911, "grad_norm": 2.8484723567962646, "learning_rate": 2.9375000000000003e-05, "loss": 1.0271486282348632, "step": 330 }, { "epoch": 0.004554420299319181, "grad_norm": 2.829651117324829, "learning_rate": 3.0267857142857142e-05, "loss": 1.0125882148742675, "step": 340 }, { "epoch": 0.0046883738375344515, "grad_norm": 1.9819118976593018, "learning_rate": 3.116071428571429e-05, "loss": 1.0134092330932618, "step": 350 }, { "epoch": 0.004822327375749721, "grad_norm": 2.5545337200164795, "learning_rate": 3.205357142857143e-05, "loss": 1.006214714050293, "step": 360 }, { "epoch": 0.004956280913964991, "grad_norm": 2.3971850872039795, "learning_rate": 3.2946428571428576e-05, "loss": 1.014259147644043, "step": 370 }, { "epoch": 0.005090234452180261, "grad_norm": 2.188464641571045, "learning_rate": 3.383928571428572e-05, "loss": 1.0164517402648925, "step": 380 }, { "epoch": 0.005224187990395531, "grad_norm": 2.607635021209717, "learning_rate": 3.4732142857142855e-05, "loss": 1.0006816864013672, "step": 390 }, { "epoch": 0.005358141528610801, "grad_norm": 1.9828215837478638, "learning_rate": 3.5625000000000005e-05, "loss": 0.994498348236084, "step": 400 }, { "epoch": 0.005492095066826071, "grad_norm": 2.0254552364349365, "learning_rate": 3.651785714285714e-05, "loss": 1.0143715858459472, "step": 410 }, { "epoch": 0.0056260486050413415, "grad_norm": 2.088826894760132, "learning_rate": 3.7410714285714285e-05, "loss": 1.003225040435791, "step": 420 }, { "epoch": 0.005760002143256612, "grad_norm": 2.4125075340270996, "learning_rate": 3.8303571428571435e-05, "loss": 0.9795364379882813, "step": 430 }, { "epoch": 0.005893955681471882, "grad_norm": 2.0874435901641846, "learning_rate": 3.919642857142857e-05, "loss": 0.9827790260314941, "step": 440 }, { "epoch": 0.006027909219687152, "grad_norm": 1.7993626594543457, "learning_rate": 4.0089285714285715e-05, "loss": 0.992791748046875, "step": 450 }, { "epoch": 0.006161862757902422, "grad_norm": 2.1616885662078857, "learning_rate": 4.098214285714286e-05, "loss": 0.9879550933837891, "step": 460 }, { "epoch": 0.006295816296117691, "grad_norm": 2.0187010765075684, "learning_rate": 4.1875e-05, "loss": 0.9812018394470214, "step": 470 }, { "epoch": 0.006429769834332961, "grad_norm": 2.0268852710723877, "learning_rate": 4.2767857142857145e-05, "loss": 1.017441749572754, "step": 480 }, { "epoch": 0.0065637233725482315, "grad_norm": 2.1466526985168457, "learning_rate": 4.366071428571429e-05, "loss": 0.9769362449645996, "step": 490 }, { "epoch": 0.006697676910763502, "grad_norm": 2.0106499195098877, "learning_rate": 4.455357142857143e-05, "loss": 0.9902260780334473, "step": 500 }, { "epoch": 0.006831630448978772, "grad_norm": 1.843783974647522, "learning_rate": 4.5446428571428574e-05, "loss": 1.0007816314697267, "step": 510 }, { "epoch": 0.006965583987194042, "grad_norm": 1.8174176216125488, "learning_rate": 4.633928571428572e-05, "loss": 0.9792203903198242, "step": 520 }, { "epoch": 0.007099537525409312, "grad_norm": 1.8151051998138428, "learning_rate": 4.723214285714286e-05, "loss": 0.992054557800293, "step": 530 }, { "epoch": 0.007233491063624582, "grad_norm": 1.7471234798431396, "learning_rate": 4.8125000000000004e-05, "loss": 0.9979231834411622, "step": 540 }, { "epoch": 0.007367444601839852, "grad_norm": 1.7692842483520508, "learning_rate": 4.901785714285714e-05, "loss": 0.9751591682434082, "step": 550 }, { "epoch": 0.007501398140055122, "grad_norm": 1.6787338256835938, "learning_rate": 4.991071428571429e-05, "loss": 0.9884813308715821, "step": 560 }, { "epoch": 0.0076353516782703915, "grad_norm": 1.7012407779693604, "learning_rate": 5.080357142857143e-05, "loss": 0.9855763435363769, "step": 570 }, { "epoch": 0.007769305216485662, "grad_norm": 1.915123701095581, "learning_rate": 5.169642857142858e-05, "loss": 0.9511891365051269, "step": 580 }, { "epoch": 0.007903258754700932, "grad_norm": 1.833243727684021, "learning_rate": 5.258928571428572e-05, "loss": 0.9984745025634766, "step": 590 }, { "epoch": 0.008037212292916202, "grad_norm": 1.450955867767334, "learning_rate": 5.348214285714286e-05, "loss": 0.9740289688110352, "step": 600 }, { "epoch": 0.008171165831131472, "grad_norm": 1.7209330797195435, "learning_rate": 5.4375e-05, "loss": 0.9547987937927246, "step": 610 }, { "epoch": 0.008305119369346742, "grad_norm": 1.7298052310943604, "learning_rate": 5.526785714285715e-05, "loss": 0.9855975151062012, "step": 620 }, { "epoch": 0.008439072907562012, "grad_norm": 1.6286202669143677, "learning_rate": 5.616071428571429e-05, "loss": 0.9657292366027832, "step": 630 }, { "epoch": 0.008573026445777282, "grad_norm": 2.2121224403381348, "learning_rate": 5.705357142857143e-05, "loss": 0.9826187133789063, "step": 640 }, { "epoch": 0.008706979983992552, "grad_norm": 1.4359034299850464, "learning_rate": 5.794642857142858e-05, "loss": 0.9880683898925782, "step": 650 }, { "epoch": 0.008840933522207823, "grad_norm": 1.8250757455825806, "learning_rate": 5.883928571428572e-05, "loss": 0.9728729248046875, "step": 660 }, { "epoch": 0.008974887060423093, "grad_norm": 1.6160730123519897, "learning_rate": 5.973214285714286e-05, "loss": 0.9673951148986817, "step": 670 }, { "epoch": 0.009108840598638363, "grad_norm": 1.623353362083435, "learning_rate": 6.0624999999999996e-05, "loss": 0.9910868644714356, "step": 680 }, { "epoch": 0.009242794136853633, "grad_norm": 1.7099947929382324, "learning_rate": 6.151785714285715e-05, "loss": 0.9758204460144043, "step": 690 }, { "epoch": 0.009376747675068903, "grad_norm": 1.6103285551071167, "learning_rate": 6.241071428571428e-05, "loss": 0.9683603286743164, "step": 700 }, { "epoch": 0.009510701213284173, "grad_norm": 1.703170895576477, "learning_rate": 6.330357142857143e-05, "loss": 0.959897232055664, "step": 710 }, { "epoch": 0.009644654751499442, "grad_norm": 1.662630319595337, "learning_rate": 6.419642857142858e-05, "loss": 0.9767607688903809, "step": 720 }, { "epoch": 0.009778608289714712, "grad_norm": 1.5833293199539185, "learning_rate": 6.508928571428571e-05, "loss": 0.9608363151550293, "step": 730 }, { "epoch": 0.009912561827929982, "grad_norm": 1.7040482759475708, "learning_rate": 6.598214285714286e-05, "loss": 0.9693010330200196, "step": 740 }, { "epoch": 0.010046515366145252, "grad_norm": 1.505820393562317, "learning_rate": 6.6875e-05, "loss": 0.9575628280639649, "step": 750 }, { "epoch": 0.010180468904360522, "grad_norm": 1.812294602394104, "learning_rate": 6.776785714285716e-05, "loss": 0.9544397354125976, "step": 760 }, { "epoch": 0.010314422442575792, "grad_norm": 1.6276874542236328, "learning_rate": 6.866071428571429e-05, "loss": 0.9317039489746094, "step": 770 }, { "epoch": 0.010448375980791062, "grad_norm": 1.6243042945861816, "learning_rate": 6.955357142857143e-05, "loss": 0.9851680755615234, "step": 780 }, { "epoch": 0.010582329519006332, "grad_norm": 1.5983399152755737, "learning_rate": 7.044642857142859e-05, "loss": 0.9748747825622559, "step": 790 }, { "epoch": 0.010716283057221603, "grad_norm": 1.7678436040878296, "learning_rate": 7.133928571428572e-05, "loss": 0.9590046882629395, "step": 800 }, { "epoch": 0.010850236595436873, "grad_norm": 1.5059410333633423, "learning_rate": 7.223214285714286e-05, "loss": 0.9823746681213379, "step": 810 }, { "epoch": 0.010984190133652143, "grad_norm": 1.4575616121292114, "learning_rate": 7.3125e-05, "loss": 0.9733425140380859, "step": 820 }, { "epoch": 0.011118143671867413, "grad_norm": 1.6164171695709229, "learning_rate": 7.401785714285715e-05, "loss": 0.927185344696045, "step": 830 }, { "epoch": 0.011252097210082683, "grad_norm": 1.512903094291687, "learning_rate": 7.491071428571429e-05, "loss": 0.9673010826110839, "step": 840 }, { "epoch": 0.011386050748297953, "grad_norm": 1.4509457349777222, "learning_rate": 7.580357142857143e-05, "loss": 0.9444644927978516, "step": 850 }, { "epoch": 0.011520004286513223, "grad_norm": 1.3291261196136475, "learning_rate": 7.669642857142858e-05, "loss": 0.9484622001647949, "step": 860 }, { "epoch": 0.011653957824728493, "grad_norm": 1.6370415687561035, "learning_rate": 7.758928571428572e-05, "loss": 0.9409455299377442, "step": 870 }, { "epoch": 0.011787911362943763, "grad_norm": 1.5580850839614868, "learning_rate": 7.848214285714286e-05, "loss": 0.9556178092956543, "step": 880 }, { "epoch": 0.011921864901159034, "grad_norm": 1.4624580144882202, "learning_rate": 7.9375e-05, "loss": 0.9679806709289551, "step": 890 }, { "epoch": 0.012055818439374304, "grad_norm": 1.5962079763412476, "learning_rate": 8.026785714285715e-05, "loss": 0.9726933479309082, "step": 900 }, { "epoch": 0.012189771977589574, "grad_norm": 1.3573912382125854, "learning_rate": 8.116071428571429e-05, "loss": 0.9682340621948242, "step": 910 }, { "epoch": 0.012323725515804844, "grad_norm": 1.5596022605895996, "learning_rate": 8.205357142857143e-05, "loss": 0.9629892349243164, "step": 920 }, { "epoch": 0.012457679054020112, "grad_norm": 1.730648398399353, "learning_rate": 8.294642857142858e-05, "loss": 0.9566517829895019, "step": 930 }, { "epoch": 0.012591632592235382, "grad_norm": 1.5507956743240356, "learning_rate": 8.383928571428572e-05, "loss": 0.9654373168945313, "step": 940 }, { "epoch": 0.012725586130450653, "grad_norm": 1.4160267114639282, "learning_rate": 8.473214285714286e-05, "loss": 0.9531091690063477, "step": 950 }, { "epoch": 0.012859539668665923, "grad_norm": 1.617100477218628, "learning_rate": 8.5625e-05, "loss": 0.9591686248779296, "step": 960 }, { "epoch": 0.012993493206881193, "grad_norm": 1.296432375907898, "learning_rate": 8.651785714285715e-05, "loss": 0.971707534790039, "step": 970 }, { "epoch": 0.013127446745096463, "grad_norm": 1.402993083000183, "learning_rate": 8.74107142857143e-05, "loss": 0.9584191322326661, "step": 980 }, { "epoch": 0.013261400283311733, "grad_norm": 1.4196568727493286, "learning_rate": 8.830357142857142e-05, "loss": 0.9672185897827148, "step": 990 }, { "epoch": 0.013395353821527003, "grad_norm": 1.3073877096176147, "learning_rate": 8.919642857142858e-05, "loss": 0.9563102722167969, "step": 1000 }, { "epoch": 0.013395353821527003, "eval_loss": 0.9335520267486572, "eval_runtime": 282.864, "eval_samples_per_second": 10.652, "eval_steps_per_second": 10.652, "step": 1000 }, { "epoch": 0.013529307359742273, "grad_norm": 1.2876602411270142, "learning_rate": 9.008928571428572e-05, "loss": 0.9841785430908203, "step": 1010 }, { "epoch": 0.013663260897957543, "grad_norm": 1.302293062210083, "learning_rate": 9.098214285714285e-05, "loss": 0.9624536514282227, "step": 1020 }, { "epoch": 0.013797214436172813, "grad_norm": 1.4643065929412842, "learning_rate": 9.1875e-05, "loss": 0.9604171752929688, "step": 1030 }, { "epoch": 0.013931167974388084, "grad_norm": 1.5588184595108032, "learning_rate": 9.276785714285715e-05, "loss": 0.9482678413391114, "step": 1040 }, { "epoch": 0.014065121512603354, "grad_norm": 1.3061965703964233, "learning_rate": 9.36607142857143e-05, "loss": 0.9968178749084473, "step": 1050 }, { "epoch": 0.014199075050818624, "grad_norm": 1.49628746509552, "learning_rate": 9.455357142857143e-05, "loss": 0.965756893157959, "step": 1060 }, { "epoch": 0.014333028589033894, "grad_norm": 1.5427523851394653, "learning_rate": 9.544642857142858e-05, "loss": 0.9401347160339355, "step": 1070 }, { "epoch": 0.014466982127249164, "grad_norm": 1.44222891330719, "learning_rate": 9.633928571428573e-05, "loss": 0.9700592994689942, "step": 1080 }, { "epoch": 0.014600935665464434, "grad_norm": 1.2180535793304443, "learning_rate": 9.723214285714286e-05, "loss": 0.9597712516784668, "step": 1090 }, { "epoch": 0.014734889203679704, "grad_norm": 1.4644688367843628, "learning_rate": 9.8125e-05, "loss": 0.9620055198669434, "step": 1100 }, { "epoch": 0.014868842741894974, "grad_norm": 1.4942972660064697, "learning_rate": 9.901785714285716e-05, "loss": 0.9615335464477539, "step": 1110 }, { "epoch": 0.015002796280110245, "grad_norm": 1.1068652868270874, "learning_rate": 9.991071428571429e-05, "loss": 0.9622197151184082, "step": 1120 }, { "epoch": 0.015136749818325513, "grad_norm": 1.283275842666626, "learning_rate": 0.00010080357142857144, "loss": 0.9707681655883789, "step": 1130 }, { "epoch": 0.015270703356540783, "grad_norm": 1.197508454322815, "learning_rate": 0.00010169642857142859, "loss": 0.9689389228820801, "step": 1140 }, { "epoch": 0.015404656894756053, "grad_norm": 1.2500603199005127, "learning_rate": 0.00010258928571428572, "loss": 0.9651185035705566, "step": 1150 }, { "epoch": 0.015538610432971323, "grad_norm": 1.6802270412445068, "learning_rate": 0.00010348214285714286, "loss": 0.9665432929992676, "step": 1160 }, { "epoch": 0.015672563971186593, "grad_norm": 1.4018360376358032, "learning_rate": 0.000104375, "loss": 0.9392754554748535, "step": 1170 }, { "epoch": 0.015806517509401864, "grad_norm": 1.5453063249588013, "learning_rate": 0.00010526785714285715, "loss": 0.9618069648742675, "step": 1180 }, { "epoch": 0.015940471047617134, "grad_norm": 1.2306983470916748, "learning_rate": 0.00010616071428571428, "loss": 0.940494441986084, "step": 1190 }, { "epoch": 0.016074424585832404, "grad_norm": 1.1923718452453613, "learning_rate": 0.00010705357142857145, "loss": 0.9696602821350098, "step": 1200 }, { "epoch": 0.016208378124047674, "grad_norm": 1.3687347173690796, "learning_rate": 0.00010794642857142858, "loss": 0.9562197685241699, "step": 1210 }, { "epoch": 0.016342331662262944, "grad_norm": 1.3242262601852417, "learning_rate": 0.00010883928571428572, "loss": 0.941429328918457, "step": 1220 }, { "epoch": 0.016476285200478214, "grad_norm": 1.2945473194122314, "learning_rate": 0.00010973214285714286, "loss": 0.9632730484008789, "step": 1230 }, { "epoch": 0.016610238738693484, "grad_norm": 1.1794791221618652, "learning_rate": 0.000110625, "loss": 0.9528386116027832, "step": 1240 }, { "epoch": 0.016744192276908754, "grad_norm": 1.261305570602417, "learning_rate": 0.00011151785714285714, "loss": 0.945485782623291, "step": 1250 }, { "epoch": 0.016878145815124024, "grad_norm": 1.310412883758545, "learning_rate": 0.00011241071428571428, "loss": 0.9500171661376953, "step": 1260 }, { "epoch": 0.017012099353339295, "grad_norm": 1.4417651891708374, "learning_rate": 0.00011330357142857145, "loss": 0.965580940246582, "step": 1270 }, { "epoch": 0.017146052891554565, "grad_norm": 1.2227723598480225, "learning_rate": 0.00011419642857142858, "loss": 0.9576460838317871, "step": 1280 }, { "epoch": 0.017280006429769835, "grad_norm": 1.278008222579956, "learning_rate": 0.00011508928571428572, "loss": 0.9216486930847168, "step": 1290 }, { "epoch": 0.017413959967985105, "grad_norm": 1.2406392097473145, "learning_rate": 0.00011598214285714287, "loss": 0.9882441520690918, "step": 1300 }, { "epoch": 0.017547913506200375, "grad_norm": 1.2370669841766357, "learning_rate": 0.000116875, "loss": 0.9419057846069336, "step": 1310 }, { "epoch": 0.017681867044415645, "grad_norm": 1.1850550174713135, "learning_rate": 0.00011776785714285714, "loss": 0.976494026184082, "step": 1320 }, { "epoch": 0.017815820582630915, "grad_norm": 1.1672782897949219, "learning_rate": 0.00011866071428571428, "loss": 0.9599658012390136, "step": 1330 }, { "epoch": 0.017949774120846185, "grad_norm": 1.2031351327896118, "learning_rate": 0.00011955357142857144, "loss": 0.9466784477233887, "step": 1340 }, { "epoch": 0.018083727659061456, "grad_norm": 1.423079013824463, "learning_rate": 0.00012044642857142858, "loss": 0.9467257499694824, "step": 1350 }, { "epoch": 0.018217681197276726, "grad_norm": 1.3132128715515137, "learning_rate": 0.00012133928571428572, "loss": 0.95529203414917, "step": 1360 }, { "epoch": 0.018351634735491996, "grad_norm": 1.3859386444091797, "learning_rate": 0.00012223214285714287, "loss": 0.9389223098754883, "step": 1370 }, { "epoch": 0.018485588273707266, "grad_norm": 1.1685659885406494, "learning_rate": 0.000123125, "loss": 0.94387845993042, "step": 1380 }, { "epoch": 0.018619541811922536, "grad_norm": 1.2127257585525513, "learning_rate": 0.00012401785714285715, "loss": 0.918062400817871, "step": 1390 }, { "epoch": 0.018753495350137806, "grad_norm": 1.1995147466659546, "learning_rate": 0.00012491071428571428, "loss": 0.9396192550659179, "step": 1400 }, { "epoch": 0.018887448888353076, "grad_norm": 1.2880109548568726, "learning_rate": 0.00012580357142857144, "loss": 0.9649562835693359, "step": 1410 }, { "epoch": 0.019021402426568346, "grad_norm": 1.2551807165145874, "learning_rate": 0.00012669642857142857, "loss": 0.9511116027832032, "step": 1420 }, { "epoch": 0.019155355964783616, "grad_norm": 1.184615135192871, "learning_rate": 0.00012758928571428573, "loss": 0.9791507720947266, "step": 1430 }, { "epoch": 0.019289309502998883, "grad_norm": 1.1787488460540771, "learning_rate": 0.00012848214285714286, "loss": 0.9635199546813965, "step": 1440 }, { "epoch": 0.019423263041214153, "grad_norm": 1.0999921560287476, "learning_rate": 0.00012937500000000001, "loss": 0.9462879180908204, "step": 1450 } ], "logging_steps": 10, "max_steps": 74653, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 10000000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.1231563344972826e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }