{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9982748706152962, "eval_steps": 500, "global_step": 217, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004600345025876941, "grad_norm": 0.005687589757144451, "learning_rate": 0.0, "loss": 1.2964, "mean_token_accuracy": 0.6567770391702652, "num_tokens": 104794.0, "step": 1 }, { "epoch": 0.009200690051753882, "grad_norm": 0.0055035436525940895, "learning_rate": 2.2727272727272729e-07, "loss": 1.3236, "mean_token_accuracy": 0.6467703059315681, "num_tokens": 198477.0, "step": 2 }, { "epoch": 0.013801035077630822, "grad_norm": 0.00571180647239089, "learning_rate": 4.5454545454545457e-07, "loss": 1.2871, "mean_token_accuracy": 0.655419260263443, "num_tokens": 297137.0, "step": 3 }, { "epoch": 0.018401380103507763, "grad_norm": 0.006776052992790937, "learning_rate": 6.818181818181818e-07, "loss": 1.3236, "mean_token_accuracy": 0.6503552347421646, "num_tokens": 391965.0, "step": 4 }, { "epoch": 0.023001725129384705, "grad_norm": 0.00528043182566762, "learning_rate": 9.090909090909091e-07, "loss": 1.3344, "mean_token_accuracy": 0.6503330767154694, "num_tokens": 487852.0, "step": 5 }, { "epoch": 0.027602070155261643, "grad_norm": 0.005563394166529179, "learning_rate": 1.1363636363636364e-06, "loss": 1.3086, "mean_token_accuracy": 0.654597781598568, "num_tokens": 584002.0, "step": 6 }, { "epoch": 0.03220241518113859, "grad_norm": 0.007420171983540058, "learning_rate": 1.3636363636363636e-06, "loss": 1.3444, "mean_token_accuracy": 0.6459237858653069, "num_tokens": 675831.0, "step": 7 }, { "epoch": 0.03680276020701553, "grad_norm": 0.006749135907739401, "learning_rate": 1.590909090909091e-06, "loss": 1.313, "mean_token_accuracy": 0.6493777111172676, "num_tokens": 773911.0, "step": 8 }, { "epoch": 0.041403105232892465, "grad_norm": 0.00610280130058527, "learning_rate": 1.8181818181818183e-06, "loss": 1.2976, "mean_token_accuracy": 0.657502181828022, "num_tokens": 868063.0, "step": 9 }, { "epoch": 0.04600345025876941, "grad_norm": 0.007394636515527964, "learning_rate": 2.0454545454545457e-06, "loss": 1.291, "mean_token_accuracy": 0.6572054326534271, "num_tokens": 967303.0, "step": 10 }, { "epoch": 0.05060379528464635, "grad_norm": 0.007649592589586973, "learning_rate": 2.2727272727272728e-06, "loss": 1.3437, "mean_token_accuracy": 0.6450314894318581, "num_tokens": 1061613.0, "step": 11 }, { "epoch": 0.055204140310523286, "grad_norm": 0.007066652178764343, "learning_rate": 2.5e-06, "loss": 1.3062, "mean_token_accuracy": 0.6532740890979767, "num_tokens": 1154782.0, "step": 12 }, { "epoch": 0.05980448533640023, "grad_norm": 0.006177663803100586, "learning_rate": 2.7272727272727272e-06, "loss": 1.3027, "mean_token_accuracy": 0.6530071422457695, "num_tokens": 1254453.0, "step": 13 }, { "epoch": 0.06440483036227718, "grad_norm": 0.008032996207475662, "learning_rate": 2.954545454545455e-06, "loss": 1.2904, "mean_token_accuracy": 0.6574910432100296, "num_tokens": 1349953.0, "step": 14 }, { "epoch": 0.06900517538815411, "grad_norm": 0.010039424523711205, "learning_rate": 3.181818181818182e-06, "loss": 1.3105, "mean_token_accuracy": 0.6531528457999229, "num_tokens": 1447847.0, "step": 15 }, { "epoch": 0.07360552041403105, "grad_norm": 0.00691134762018919, "learning_rate": 3.409090909090909e-06, "loss": 1.3162, "mean_token_accuracy": 0.6518233045935631, "num_tokens": 1539663.0, "step": 16 }, { "epoch": 0.078205865439908, "grad_norm": 0.007641863543540239, "learning_rate": 3.6363636363636366e-06, "loss": 1.2965, "mean_token_accuracy": 0.656828798353672, "num_tokens": 1634446.0, "step": 17 }, { "epoch": 0.08280621046578493, "grad_norm": 0.006876361556351185, "learning_rate": 3.863636363636364e-06, "loss": 1.353, "mean_token_accuracy": 0.6474368572235107, "num_tokens": 1729775.0, "step": 18 }, { "epoch": 0.08740655549166187, "grad_norm": 0.00726681761443615, "learning_rate": 4.0909090909090915e-06, "loss": 1.3106, "mean_token_accuracy": 0.6513411849737167, "num_tokens": 1824828.0, "step": 19 }, { "epoch": 0.09200690051753882, "grad_norm": 0.008261698298156261, "learning_rate": 4.3181818181818185e-06, "loss": 1.3019, "mean_token_accuracy": 0.6508027985692024, "num_tokens": 1925138.0, "step": 20 }, { "epoch": 0.09660724554341575, "grad_norm": 0.008603152818977833, "learning_rate": 4.5454545454545455e-06, "loss": 1.2888, "mean_token_accuracy": 0.6574650928378105, "num_tokens": 2024720.0, "step": 21 }, { "epoch": 0.1012075905692927, "grad_norm": 0.011507058516144753, "learning_rate": 4.772727272727273e-06, "loss": 1.3541, "mean_token_accuracy": 0.6430061087012291, "num_tokens": 2115523.0, "step": 22 }, { "epoch": 0.10580793559516964, "grad_norm": 0.011566699482500553, "learning_rate": 5e-06, "loss": 1.2786, "mean_token_accuracy": 0.6559519320726395, "num_tokens": 2211187.0, "step": 23 }, { "epoch": 0.11040828062104657, "grad_norm": 0.011184126138687134, "learning_rate": 5.2272727272727274e-06, "loss": 1.2869, "mean_token_accuracy": 0.6546742096543312, "num_tokens": 2307075.0, "step": 24 }, { "epoch": 0.11500862564692352, "grad_norm": 0.009821473620831966, "learning_rate": 5.4545454545454545e-06, "loss": 1.2486, "mean_token_accuracy": 0.6607496812939644, "num_tokens": 2408388.0, "step": 25 }, { "epoch": 0.11960897067280046, "grad_norm": 0.011240242049098015, "learning_rate": 5.681818181818183e-06, "loss": 1.3021, "mean_token_accuracy": 0.6554695144295692, "num_tokens": 2502118.0, "step": 26 }, { "epoch": 0.1242093156986774, "grad_norm": 0.009518246166408062, "learning_rate": 5.90909090909091e-06, "loss": 1.2953, "mean_token_accuracy": 0.6546049192547798, "num_tokens": 2595264.0, "step": 27 }, { "epoch": 0.12880966072455435, "grad_norm": 0.008872764185070992, "learning_rate": 6.136363636363637e-06, "loss": 1.3026, "mean_token_accuracy": 0.6526112258434296, "num_tokens": 2692102.0, "step": 28 }, { "epoch": 0.13341000575043127, "grad_norm": 0.009111359715461731, "learning_rate": 6.363636363636364e-06, "loss": 1.2366, "mean_token_accuracy": 0.6660361588001251, "num_tokens": 2785080.0, "step": 29 }, { "epoch": 0.13801035077630822, "grad_norm": 0.008477196097373962, "learning_rate": 6.590909090909091e-06, "loss": 1.2575, "mean_token_accuracy": 0.6607440859079361, "num_tokens": 2881020.0, "step": 30 }, { "epoch": 0.14261069580218516, "grad_norm": 0.007433631923049688, "learning_rate": 6.818181818181818e-06, "loss": 1.2407, "mean_token_accuracy": 0.663087397813797, "num_tokens": 2978761.0, "step": 31 }, { "epoch": 0.1472110408280621, "grad_norm": 0.008866243064403534, "learning_rate": 7.045454545454546e-06, "loss": 1.2441, "mean_token_accuracy": 0.6632796227931976, "num_tokens": 3076332.0, "step": 32 }, { "epoch": 0.15181138585393905, "grad_norm": 0.007918394170701504, "learning_rate": 7.272727272727273e-06, "loss": 1.2707, "mean_token_accuracy": 0.661369614303112, "num_tokens": 3174677.0, "step": 33 }, { "epoch": 0.156411730879816, "grad_norm": 0.009430650621652603, "learning_rate": 7.500000000000001e-06, "loss": 1.237, "mean_token_accuracy": 0.6620191782712936, "num_tokens": 3271182.0, "step": 34 }, { "epoch": 0.16101207590569291, "grad_norm": 0.009918849915266037, "learning_rate": 7.727272727272727e-06, "loss": 1.2784, "mean_token_accuracy": 0.6557858139276505, "num_tokens": 3364423.0, "step": 35 }, { "epoch": 0.16561242093156986, "grad_norm": 0.01214979775249958, "learning_rate": 7.954545454545455e-06, "loss": 1.2267, "mean_token_accuracy": 0.665397971868515, "num_tokens": 3458719.0, "step": 36 }, { "epoch": 0.1702127659574468, "grad_norm": 0.0094231516122818, "learning_rate": 8.181818181818183e-06, "loss": 1.2112, "mean_token_accuracy": 0.6734237298369408, "num_tokens": 3549995.0, "step": 37 }, { "epoch": 0.17481311098332375, "grad_norm": 0.008751116693019867, "learning_rate": 8.40909090909091e-06, "loss": 1.2069, "mean_token_accuracy": 0.6694932207465172, "num_tokens": 3643349.0, "step": 38 }, { "epoch": 0.1794134560092007, "grad_norm": 0.008826850913465023, "learning_rate": 8.636363636363637e-06, "loss": 1.2127, "mean_token_accuracy": 0.669578805565834, "num_tokens": 3736816.0, "step": 39 }, { "epoch": 0.18401380103507764, "grad_norm": 0.008413583971560001, "learning_rate": 8.863636363636365e-06, "loss": 1.2028, "mean_token_accuracy": 0.672471858561039, "num_tokens": 3832791.0, "step": 40 }, { "epoch": 0.18861414606095459, "grad_norm": 0.006991323083639145, "learning_rate": 9.090909090909091e-06, "loss": 1.1791, "mean_token_accuracy": 0.6750742718577385, "num_tokens": 3932062.0, "step": 41 }, { "epoch": 0.1932144910868315, "grad_norm": 0.007404603064060211, "learning_rate": 9.318181818181819e-06, "loss": 1.1645, "mean_token_accuracy": 0.6763711273670197, "num_tokens": 4024968.0, "step": 42 }, { "epoch": 0.19781483611270845, "grad_norm": 0.007536900695413351, "learning_rate": 9.545454545454547e-06, "loss": 1.1986, "mean_token_accuracy": 0.6699943095445633, "num_tokens": 4125477.0, "step": 43 }, { "epoch": 0.2024151811385854, "grad_norm": 0.008920799009501934, "learning_rate": 9.772727272727273e-06, "loss": 1.1808, "mean_token_accuracy": 0.6771005317568779, "num_tokens": 4220159.0, "step": 44 }, { "epoch": 0.20701552616446234, "grad_norm": 0.007982825860381126, "learning_rate": 1e-05, "loss": 1.1712, "mean_token_accuracy": 0.6806080117821693, "num_tokens": 4313530.0, "step": 45 }, { "epoch": 0.21161587119033928, "grad_norm": 0.007420428097248077, "learning_rate": 9.999837778582641e-06, "loss": 1.1685, "mean_token_accuracy": 0.6754245385527611, "num_tokens": 4413260.0, "step": 46 }, { "epoch": 0.21621621621621623, "grad_norm": 0.008077534846961498, "learning_rate": 9.999351124856873e-06, "loss": 1.155, "mean_token_accuracy": 0.6799673438072205, "num_tokens": 4511873.0, "step": 47 }, { "epoch": 0.22081656124209315, "grad_norm": 0.008561821654438972, "learning_rate": 9.998540070400966e-06, "loss": 1.171, "mean_token_accuracy": 0.6745180711150169, "num_tokens": 4602762.0, "step": 48 }, { "epoch": 0.2254169062679701, "grad_norm": 0.00783666130155325, "learning_rate": 9.997404667843076e-06, "loss": 1.1694, "mean_token_accuracy": 0.6786425858736038, "num_tokens": 4703481.0, "step": 49 }, { "epoch": 0.23001725129384704, "grad_norm": 0.007960589602589607, "learning_rate": 9.995944990857848e-06, "loss": 1.1707, "mean_token_accuracy": 0.6771489679813385, "num_tokens": 4799562.0, "step": 50 }, { "epoch": 0.23461759631972398, "grad_norm": 0.007685200311243534, "learning_rate": 9.994161134161635e-06, "loss": 1.1846, "mean_token_accuracy": 0.6739635095000267, "num_tokens": 4900840.0, "step": 51 }, { "epoch": 0.23921794134560093, "grad_norm": 0.008777720853686333, "learning_rate": 9.992053213506333e-06, "loss": 1.1876, "mean_token_accuracy": 0.6759511306881905, "num_tokens": 4997883.0, "step": 52 }, { "epoch": 0.24381828637147787, "grad_norm": 0.0073701320216059685, "learning_rate": 9.989621365671902e-06, "loss": 1.1798, "mean_token_accuracy": 0.6745479926466942, "num_tokens": 5094702.0, "step": 53 }, { "epoch": 0.2484186313973548, "grad_norm": 0.0080358712002635, "learning_rate": 9.986865748457457e-06, "loss": 1.1485, "mean_token_accuracy": 0.6811746656894684, "num_tokens": 5189105.0, "step": 54 }, { "epoch": 0.25301897642323173, "grad_norm": 0.008727259002625942, "learning_rate": 9.983786540671052e-06, "loss": 1.193, "mean_token_accuracy": 0.6724725291132927, "num_tokens": 5284168.0, "step": 55 }, { "epoch": 0.2576193214491087, "grad_norm": 0.008287778124213219, "learning_rate": 9.980383942118066e-06, "loss": 1.1849, "mean_token_accuracy": 0.6733070015907288, "num_tokens": 5382877.0, "step": 56 }, { "epoch": 0.2622196664749856, "grad_norm": 0.007565150503069162, "learning_rate": 9.976658173588244e-06, "loss": 1.1741, "mean_token_accuracy": 0.6780361458659172, "num_tokens": 5476577.0, "step": 57 }, { "epoch": 0.26682001150086254, "grad_norm": 0.00806084182113409, "learning_rate": 9.972609476841368e-06, "loss": 1.161, "mean_token_accuracy": 0.6804856136441231, "num_tokens": 5577955.0, "step": 58 }, { "epoch": 0.2714203565267395, "grad_norm": 0.010196089744567871, "learning_rate": 9.968238114591567e-06, "loss": 1.1499, "mean_token_accuracy": 0.6841338276863098, "num_tokens": 5666759.0, "step": 59 }, { "epoch": 0.27602070155261643, "grad_norm": 0.007678396068513393, "learning_rate": 9.96354437049027e-06, "loss": 1.1543, "mean_token_accuracy": 0.6782903298735619, "num_tokens": 5763702.0, "step": 60 }, { "epoch": 0.2806210465784934, "grad_norm": 0.00881399866193533, "learning_rate": 9.958528549107812e-06, "loss": 1.1556, "mean_token_accuracy": 0.6805967539548874, "num_tokens": 5858188.0, "step": 61 }, { "epoch": 0.2852213916043703, "grad_norm": 0.009992823004722595, "learning_rate": 9.953190975913648e-06, "loss": 1.2055, "mean_token_accuracy": 0.668336994946003, "num_tokens": 5953081.0, "step": 62 }, { "epoch": 0.2898217366302473, "grad_norm": 0.008360505104064941, "learning_rate": 9.947531997255256e-06, "loss": 1.1395, "mean_token_accuracy": 0.6817946434020996, "num_tokens": 6054917.0, "step": 63 }, { "epoch": 0.2944220816561242, "grad_norm": 0.00789540633559227, "learning_rate": 9.941551980335653e-06, "loss": 1.1541, "mean_token_accuracy": 0.6804044917225838, "num_tokens": 6151706.0, "step": 64 }, { "epoch": 0.29902242668200113, "grad_norm": 0.010097729973495007, "learning_rate": 9.935251313189564e-06, "loss": 1.1614, "mean_token_accuracy": 0.6784722730517387, "num_tokens": 6248791.0, "step": 65 }, { "epoch": 0.3036227717078781, "grad_norm": 0.009608102962374687, "learning_rate": 9.928630404658255e-06, "loss": 1.1586, "mean_token_accuracy": 0.6793174743652344, "num_tokens": 6342795.0, "step": 66 }, { "epoch": 0.308223116733755, "grad_norm": 0.008577210828661919, "learning_rate": 9.921689684362989e-06, "loss": 1.1543, "mean_token_accuracy": 0.6808740571141243, "num_tokens": 6441301.0, "step": 67 }, { "epoch": 0.312823461759632, "grad_norm": 0.00851823017001152, "learning_rate": 9.914429602677163e-06, "loss": 1.1917, "mean_token_accuracy": 0.6714753583073616, "num_tokens": 6539454.0, "step": 68 }, { "epoch": 0.3174238067855089, "grad_norm": 0.009974654763936996, "learning_rate": 9.906850630697068e-06, "loss": 1.1883, "mean_token_accuracy": 0.6764531210064888, "num_tokens": 6634535.0, "step": 69 }, { "epoch": 0.32202415181138583, "grad_norm": 0.008425155654549599, "learning_rate": 9.89895326021134e-06, "loss": 1.1289, "mean_token_accuracy": 0.6835334897041321, "num_tokens": 6733173.0, "step": 70 }, { "epoch": 0.3266244968372628, "grad_norm": 0.009581580758094788, "learning_rate": 9.890738003669029e-06, "loss": 1.1895, "mean_token_accuracy": 0.6751143932342529, "num_tokens": 6825744.0, "step": 71 }, { "epoch": 0.3312248418631397, "grad_norm": 0.00899854488670826, "learning_rate": 9.882205394146362e-06, "loss": 1.1807, "mean_token_accuracy": 0.6726124361157417, "num_tokens": 6921349.0, "step": 72 }, { "epoch": 0.3358251868890167, "grad_norm": 0.009314511902630329, "learning_rate": 9.873355985312141e-06, "loss": 1.1511, "mean_token_accuracy": 0.6797289550304413, "num_tokens": 7016428.0, "step": 73 }, { "epoch": 0.3404255319148936, "grad_norm": 0.008227611891925335, "learning_rate": 9.864190351391822e-06, "loss": 1.1399, "mean_token_accuracy": 0.680743120610714, "num_tokens": 7116651.0, "step": 74 }, { "epoch": 0.3450258769407706, "grad_norm": 0.009333742782473564, "learning_rate": 9.854709087130261e-06, "loss": 1.1893, "mean_token_accuracy": 0.6743270009756088, "num_tokens": 7214530.0, "step": 75 }, { "epoch": 0.3496262219666475, "grad_norm": 0.008280204609036446, "learning_rate": 9.844912807753105e-06, "loss": 1.1246, "mean_token_accuracy": 0.6881353706121445, "num_tokens": 7314471.0, "step": 76 }, { "epoch": 0.3542265669925244, "grad_norm": 0.009001548402011395, "learning_rate": 9.834802148926883e-06, "loss": 1.1389, "mean_token_accuracy": 0.6820591241121292, "num_tokens": 7411143.0, "step": 77 }, { "epoch": 0.3588269120184014, "grad_norm": 0.008818632923066616, "learning_rate": 9.824377766717758e-06, "loss": 1.1199, "mean_token_accuracy": 0.6870076656341553, "num_tokens": 7505547.0, "step": 78 }, { "epoch": 0.3634272570442783, "grad_norm": 0.009602286852896214, "learning_rate": 9.813640337548955e-06, "loss": 1.1457, "mean_token_accuracy": 0.681760624051094, "num_tokens": 7604105.0, "step": 79 }, { "epoch": 0.3680276020701553, "grad_norm": 0.009009558707475662, "learning_rate": 9.802590558156863e-06, "loss": 1.1536, "mean_token_accuracy": 0.6847949475049973, "num_tokens": 7702689.0, "step": 80 }, { "epoch": 0.3726279470960322, "grad_norm": 0.009743778966367245, "learning_rate": 9.791229145545832e-06, "loss": 1.1386, "mean_token_accuracy": 0.6835950613021851, "num_tokens": 7797600.0, "step": 81 }, { "epoch": 0.37722829212190917, "grad_norm": 0.009100291877985, "learning_rate": 9.779556836941646e-06, "loss": 1.1349, "mean_token_accuracy": 0.6835153922438622, "num_tokens": 7896536.0, "step": 82 }, { "epoch": 0.3818286371477861, "grad_norm": 0.009762028232216835, "learning_rate": 9.767574389743683e-06, "loss": 1.1444, "mean_token_accuracy": 0.6820423156023026, "num_tokens": 7995947.0, "step": 83 }, { "epoch": 0.386428982173663, "grad_norm": 0.00889329332858324, "learning_rate": 9.755282581475769e-06, "loss": 1.1405, "mean_token_accuracy": 0.6851356402039528, "num_tokens": 8094263.0, "step": 84 }, { "epoch": 0.39102932719954, "grad_norm": 0.00981220230460167, "learning_rate": 9.742682209735727e-06, "loss": 1.1735, "mean_token_accuracy": 0.677773728966713, "num_tokens": 8189505.0, "step": 85 }, { "epoch": 0.3956296722254169, "grad_norm": 0.010011876933276653, "learning_rate": 9.729774092143627e-06, "loss": 1.129, "mean_token_accuracy": 0.6852159947156906, "num_tokens": 8293089.0, "step": 86 }, { "epoch": 0.40023001725129387, "grad_norm": 0.010612046346068382, "learning_rate": 9.716559066288716e-06, "loss": 1.1742, "mean_token_accuracy": 0.674958735704422, "num_tokens": 8387541.0, "step": 87 }, { "epoch": 0.4048303622771708, "grad_norm": 0.0103145157918334, "learning_rate": 9.703037989675088e-06, "loss": 1.153, "mean_token_accuracy": 0.6805268451571465, "num_tokens": 8484151.0, "step": 88 }, { "epoch": 0.4094307073030477, "grad_norm": 0.009694715961813927, "learning_rate": 9.689211739666023e-06, "loss": 1.1877, "mean_token_accuracy": 0.6738117784261703, "num_tokens": 8581092.0, "step": 89 }, { "epoch": 0.4140310523289247, "grad_norm": 0.01016835868358612, "learning_rate": 9.675081213427076e-06, "loss": 1.13, "mean_token_accuracy": 0.6874581500887871, "num_tokens": 8679981.0, "step": 90 }, { "epoch": 0.4186313973548016, "grad_norm": 0.008928492665290833, "learning_rate": 9.66064732786784e-06, "loss": 1.1369, "mean_token_accuracy": 0.6865670680999756, "num_tokens": 8779582.0, "step": 91 }, { "epoch": 0.42323174238067857, "grad_norm": 0.009940912947058678, "learning_rate": 9.645911019582467e-06, "loss": 1.1602, "mean_token_accuracy": 0.6783237531781197, "num_tokens": 8875552.0, "step": 92 }, { "epoch": 0.4278320874065555, "grad_norm": 0.011580446735024452, "learning_rate": 9.630873244788884e-06, "loss": 1.139, "mean_token_accuracy": 0.6843747869133949, "num_tokens": 8966375.0, "step": 93 }, { "epoch": 0.43243243243243246, "grad_norm": 0.009115920402109623, "learning_rate": 9.615534979266745e-06, "loss": 1.1646, "mean_token_accuracy": 0.6751029714941978, "num_tokens": 9063222.0, "step": 94 }, { "epoch": 0.4370327774583094, "grad_norm": 0.009414221160113811, "learning_rate": 9.599897218294122e-06, "loss": 1.1572, "mean_token_accuracy": 0.6786936447024345, "num_tokens": 9158240.0, "step": 95 }, { "epoch": 0.4416331224841863, "grad_norm": 0.009733911603689194, "learning_rate": 9.583960976582914e-06, "loss": 1.1106, "mean_token_accuracy": 0.6883520036935806, "num_tokens": 9257427.0, "step": 96 }, { "epoch": 0.44623346751006326, "grad_norm": 0.01011735387146473, "learning_rate": 9.567727288213005e-06, "loss": 1.1555, "mean_token_accuracy": 0.6811134442687035, "num_tokens": 9354084.0, "step": 97 }, { "epoch": 0.4508338125359402, "grad_norm": 0.011312155053019524, "learning_rate": 9.551197206565174e-06, "loss": 1.1386, "mean_token_accuracy": 0.682069718837738, "num_tokens": 9449568.0, "step": 98 }, { "epoch": 0.45543415756181715, "grad_norm": 0.010424958541989326, "learning_rate": 9.534371804252727e-06, "loss": 1.1424, "mean_token_accuracy": 0.6819394826889038, "num_tokens": 9543754.0, "step": 99 }, { "epoch": 0.46003450258769407, "grad_norm": 0.010464823804795742, "learning_rate": 9.517252173051912e-06, "loss": 1.1736, "mean_token_accuracy": 0.6762436330318451, "num_tokens": 9640369.0, "step": 100 }, { "epoch": 0.46463484761357104, "grad_norm": 0.010858048684895039, "learning_rate": 9.499839423831062e-06, "loss": 1.1636, "mean_token_accuracy": 0.6757931411266327, "num_tokens": 9732896.0, "step": 101 }, { "epoch": 0.46923519263944796, "grad_norm": 0.01097831316292286, "learning_rate": 9.48213468647852e-06, "loss": 1.1372, "mean_token_accuracy": 0.6813743412494659, "num_tokens": 9828655.0, "step": 102 }, { "epoch": 0.4738355376653249, "grad_norm": 0.009854613803327084, "learning_rate": 9.46413910982932e-06, "loss": 1.1422, "mean_token_accuracy": 0.6805589944124222, "num_tokens": 9925327.0, "step": 103 }, { "epoch": 0.47843588269120185, "grad_norm": 0.011986501514911652, "learning_rate": 9.445853861590647e-06, "loss": 1.1552, "mean_token_accuracy": 0.6841816902160645, "num_tokens": 10019986.0, "step": 104 }, { "epoch": 0.48303622771707877, "grad_norm": 0.009618732146918774, "learning_rate": 9.427280128266049e-06, "loss": 1.114, "mean_token_accuracy": 0.6898596957325935, "num_tokens": 10120938.0, "step": 105 }, { "epoch": 0.48763657274295574, "grad_norm": 0.011056702584028244, "learning_rate": 9.40841911507847e-06, "loss": 1.1625, "mean_token_accuracy": 0.6775639355182648, "num_tokens": 10216437.0, "step": 106 }, { "epoch": 0.49223691776883266, "grad_norm": 0.01116709690541029, "learning_rate": 9.389272045892023e-06, "loss": 1.145, "mean_token_accuracy": 0.6837708950042725, "num_tokens": 10311173.0, "step": 107 }, { "epoch": 0.4968372627947096, "grad_norm": 0.011039802804589272, "learning_rate": 9.36984016313259e-06, "loss": 1.1417, "mean_token_accuracy": 0.6808711588382721, "num_tokens": 10407597.0, "step": 108 }, { "epoch": 0.5014376078205866, "grad_norm": 0.010891326703131199, "learning_rate": 9.350124727707197e-06, "loss": 1.168, "mean_token_accuracy": 0.6797266602516174, "num_tokens": 10508399.0, "step": 109 }, { "epoch": 0.5060379528464635, "grad_norm": 0.011290277354419231, "learning_rate": 9.330127018922195e-06, "loss": 1.1601, "mean_token_accuracy": 0.6797808483242989, "num_tokens": 10607967.0, "step": 110 }, { "epoch": 0.5106382978723404, "grad_norm": 0.01199404802173376, "learning_rate": 9.309848334400247e-06, "loss": 1.1465, "mean_token_accuracy": 0.6825785636901855, "num_tokens": 10700032.0, "step": 111 }, { "epoch": 0.5152386428982174, "grad_norm": 0.011274462565779686, "learning_rate": 9.289289989996133e-06, "loss": 1.1476, "mean_token_accuracy": 0.6835216283798218, "num_tokens": 10793853.0, "step": 112 }, { "epoch": 0.5198389879240943, "grad_norm": 0.010716607794165611, "learning_rate": 9.268453319711362e-06, "loss": 1.137, "mean_token_accuracy": 0.6838621497154236, "num_tokens": 10893892.0, "step": 113 }, { "epoch": 0.5244393329499712, "grad_norm": 0.011201828718185425, "learning_rate": 9.247339675607606e-06, "loss": 1.1673, "mean_token_accuracy": 0.6785961911082268, "num_tokens": 10990079.0, "step": 114 }, { "epoch": 0.5290396779758482, "grad_norm": 0.012047258205711842, "learning_rate": 9.225950427718974e-06, "loss": 1.141, "mean_token_accuracy": 0.6847905442118645, "num_tokens": 11087797.0, "step": 115 }, { "epoch": 0.5336400230017251, "grad_norm": 0.009881600737571716, "learning_rate": 9.204286963963112e-06, "loss": 1.1815, "mean_token_accuracy": 0.6752007529139519, "num_tokens": 11186382.0, "step": 116 }, { "epoch": 0.5382403680276021, "grad_norm": 0.011906330473721027, "learning_rate": 9.182350690051134e-06, "loss": 1.1841, "mean_token_accuracy": 0.6728686764836311, "num_tokens": 11280569.0, "step": 117 }, { "epoch": 0.542840713053479, "grad_norm": 0.01070008147507906, "learning_rate": 9.160143029396422e-06, "loss": 1.1368, "mean_token_accuracy": 0.6841261833906174, "num_tokens": 11375905.0, "step": 118 }, { "epoch": 0.547441058079356, "grad_norm": 0.01177423819899559, "learning_rate": 9.13766542302225e-06, "loss": 1.1204, "mean_token_accuracy": 0.6871694549918175, "num_tokens": 11469920.0, "step": 119 }, { "epoch": 0.5520414031052329, "grad_norm": 0.011396740563213825, "learning_rate": 9.114919329468283e-06, "loss": 1.1295, "mean_token_accuracy": 0.6842972412705421, "num_tokens": 11566631.0, "step": 120 }, { "epoch": 0.5566417481311098, "grad_norm": 0.011250436305999756, "learning_rate": 9.091906224695935e-06, "loss": 1.1233, "mean_token_accuracy": 0.6875024884939194, "num_tokens": 11663849.0, "step": 121 }, { "epoch": 0.5612420931569868, "grad_norm": 0.01271882839500904, "learning_rate": 9.0686276019926e-06, "loss": 1.1367, "mean_token_accuracy": 0.6822795867919922, "num_tokens": 11758571.0, "step": 122 }, { "epoch": 0.5658424381828637, "grad_norm": 0.01079560723155737, "learning_rate": 9.045084971874738e-06, "loss": 1.1209, "mean_token_accuracy": 0.6869323998689651, "num_tokens": 11858943.0, "step": 123 }, { "epoch": 0.5704427832087406, "grad_norm": 0.010741114616394043, "learning_rate": 9.021279861989884e-06, "loss": 1.1339, "mean_token_accuracy": 0.681599348783493, "num_tokens": 11959125.0, "step": 124 }, { "epoch": 0.5750431282346176, "grad_norm": 0.011083470657467842, "learning_rate": 8.997213817017508e-06, "loss": 1.1707, "mean_token_accuracy": 0.6807960867881775, "num_tokens": 12050647.0, "step": 125 }, { "epoch": 0.5796434732604946, "grad_norm": 0.012295430526137352, "learning_rate": 8.972888398568772e-06, "loss": 1.1365, "mean_token_accuracy": 0.682566873729229, "num_tokens": 12147275.0, "step": 126 }, { "epoch": 0.5842438182863715, "grad_norm": 0.012151171453297138, "learning_rate": 8.948305185085226e-06, "loss": 1.1393, "mean_token_accuracy": 0.6846441850066185, "num_tokens": 12245419.0, "step": 127 }, { "epoch": 0.5888441633122484, "grad_norm": 0.01221384946256876, "learning_rate": 8.923465771736361e-06, "loss": 1.1423, "mean_token_accuracy": 0.6798125579953194, "num_tokens": 12345045.0, "step": 128 }, { "epoch": 0.5934445083381253, "grad_norm": 0.010475218296051025, "learning_rate": 8.898371770316113e-06, "loss": 1.1229, "mean_token_accuracy": 0.6866893246769905, "num_tokens": 12440926.0, "step": 129 }, { "epoch": 0.5980448533640023, "grad_norm": 0.010910892859101295, "learning_rate": 8.873024809138272e-06, "loss": 1.135, "mean_token_accuracy": 0.6809633672237396, "num_tokens": 12538689.0, "step": 130 }, { "epoch": 0.6026451983898793, "grad_norm": 0.012574547901749611, "learning_rate": 8.84742653293083e-06, "loss": 1.1386, "mean_token_accuracy": 0.6841543838381767, "num_tokens": 12633929.0, "step": 131 }, { "epoch": 0.6072455434157562, "grad_norm": 0.0117676155641675, "learning_rate": 8.821578602729242e-06, "loss": 1.1872, "mean_token_accuracy": 0.6732319965958595, "num_tokens": 12730071.0, "step": 132 }, { "epoch": 0.6118458884416331, "grad_norm": 0.01177041232585907, "learning_rate": 8.795482695768658e-06, "loss": 1.1557, "mean_token_accuracy": 0.6811974123120308, "num_tokens": 12827268.0, "step": 133 }, { "epoch": 0.61644623346751, "grad_norm": 0.012073309160768986, "learning_rate": 8.769140505375084e-06, "loss": 1.1482, "mean_token_accuracy": 0.6824083104729652, "num_tokens": 12920648.0, "step": 134 }, { "epoch": 0.621046578493387, "grad_norm": 0.013189052231609821, "learning_rate": 8.742553740855507e-06, "loss": 1.1202, "mean_token_accuracy": 0.6862241849303246, "num_tokens": 13010217.0, "step": 135 }, { "epoch": 0.625646923519264, "grad_norm": 0.017087044194340706, "learning_rate": 8.715724127386971e-06, "loss": 1.1678, "mean_token_accuracy": 0.6766590625047684, "num_tokens": 13108063.0, "step": 136 }, { "epoch": 0.6302472685451409, "grad_norm": 0.013833911158144474, "learning_rate": 8.688653405904653e-06, "loss": 1.139, "mean_token_accuracy": 0.6834281384944916, "num_tokens": 13204017.0, "step": 137 }, { "epoch": 0.6348476135710178, "grad_norm": 0.011891160160303116, "learning_rate": 8.661343332988869e-06, "loss": 1.1432, "mean_token_accuracy": 0.6826580688357353, "num_tokens": 13298917.0, "step": 138 }, { "epoch": 0.6394479585968947, "grad_norm": 0.010969611816108227, "learning_rate": 8.633795680751116e-06, "loss": 1.1384, "mean_token_accuracy": 0.6838229894638062, "num_tokens": 13398469.0, "step": 139 }, { "epoch": 0.6440483036227717, "grad_norm": 0.011026185005903244, "learning_rate": 8.606012236719073e-06, "loss": 1.1356, "mean_token_accuracy": 0.6841299682855606, "num_tokens": 13491680.0, "step": 140 }, { "epoch": 0.6486486486486487, "grad_norm": 0.011263255029916763, "learning_rate": 8.577994803720605e-06, "loss": 1.129, "mean_token_accuracy": 0.6875933781266212, "num_tokens": 13590200.0, "step": 141 }, { "epoch": 0.6532489936745256, "grad_norm": 0.011134397238492966, "learning_rate": 8.549745199766792e-06, "loss": 1.1408, "mean_token_accuracy": 0.682669073343277, "num_tokens": 13687397.0, "step": 142 }, { "epoch": 0.6578493387004025, "grad_norm": 0.012590516358613968, "learning_rate": 8.521265257933948e-06, "loss": 1.1685, "mean_token_accuracy": 0.677878700196743, "num_tokens": 13783952.0, "step": 143 }, { "epoch": 0.6624496837262794, "grad_norm": 0.012606673873960972, "learning_rate": 8.492556826244687e-06, "loss": 1.1415, "mean_token_accuracy": 0.6823642030358315, "num_tokens": 13878727.0, "step": 144 }, { "epoch": 0.6670500287521565, "grad_norm": 0.011452843435108662, "learning_rate": 8.463621767547998e-06, "loss": 1.115, "mean_token_accuracy": 0.6876819431781769, "num_tokens": 13973528.0, "step": 145 }, { "epoch": 0.6716503737780334, "grad_norm": 0.013077128678560257, "learning_rate": 8.434461959398377e-06, "loss": 1.1375, "mean_token_accuracy": 0.6831812486052513, "num_tokens": 14067816.0, "step": 146 }, { "epoch": 0.6762507188039103, "grad_norm": 0.012629431672394276, "learning_rate": 8.405079293933986e-06, "loss": 1.1549, "mean_token_accuracy": 0.6779226139187813, "num_tokens": 14166980.0, "step": 147 }, { "epoch": 0.6808510638297872, "grad_norm": 0.01266096904873848, "learning_rate": 8.375475677753882e-06, "loss": 1.1391, "mean_token_accuracy": 0.6808317601680756, "num_tokens": 14262155.0, "step": 148 }, { "epoch": 0.6854514088556641, "grad_norm": 0.012114723213016987, "learning_rate": 8.345653031794292e-06, "loss": 1.1339, "mean_token_accuracy": 0.6848656088113785, "num_tokens": 14357686.0, "step": 149 }, { "epoch": 0.6900517538815412, "grad_norm": 0.01152091845870018, "learning_rate": 8.315613291203977e-06, "loss": 1.1362, "mean_token_accuracy": 0.6844386830925941, "num_tokens": 14452969.0, "step": 150 }, { "epoch": 0.6946520989074181, "grad_norm": 0.011453399434685707, "learning_rate": 8.285358405218655e-06, "loss": 1.1354, "mean_token_accuracy": 0.6829889118671417, "num_tokens": 14555977.0, "step": 151 }, { "epoch": 0.699252443933295, "grad_norm": 0.01063123345375061, "learning_rate": 8.25489033703452e-06, "loss": 1.1511, "mean_token_accuracy": 0.6795672103762627, "num_tokens": 14656890.0, "step": 152 }, { "epoch": 0.7038527889591719, "grad_norm": 0.01153411716222763, "learning_rate": 8.224211063680854e-06, "loss": 1.1349, "mean_token_accuracy": 0.6822441294789314, "num_tokens": 14756458.0, "step": 153 }, { "epoch": 0.7084531339850488, "grad_norm": 0.012573798187077045, "learning_rate": 8.19332257589174e-06, "loss": 1.1318, "mean_token_accuracy": 0.6857383400201797, "num_tokens": 14847811.0, "step": 154 }, { "epoch": 0.7130534790109259, "grad_norm": 0.015371086075901985, "learning_rate": 8.162226877976886e-06, "loss": 1.1367, "mean_token_accuracy": 0.6819384023547173, "num_tokens": 14944682.0, "step": 155 }, { "epoch": 0.7176538240368028, "grad_norm": 0.012037052772939205, "learning_rate": 8.13092598769157e-06, "loss": 1.0943, "mean_token_accuracy": 0.6912998482584953, "num_tokens": 15044543.0, "step": 156 }, { "epoch": 0.7222541690626797, "grad_norm": 0.012677938677370548, "learning_rate": 8.099421936105702e-06, "loss": 1.1261, "mean_token_accuracy": 0.6894383281469345, "num_tokens": 15135392.0, "step": 157 }, { "epoch": 0.7268545140885566, "grad_norm": 0.013612372800707817, "learning_rate": 8.067716767472045e-06, "loss": 1.1509, "mean_token_accuracy": 0.6794408410787582, "num_tokens": 15230933.0, "step": 158 }, { "epoch": 0.7314548591144335, "grad_norm": 0.012262539006769657, "learning_rate": 8.035812539093557e-06, "loss": 1.1656, "mean_token_accuracy": 0.6754115670919418, "num_tokens": 15326416.0, "step": 159 }, { "epoch": 0.7360552041403106, "grad_norm": 0.014869904145598412, "learning_rate": 8.003711321189895e-06, "loss": 1.1469, "mean_token_accuracy": 0.6832912117242813, "num_tokens": 15418479.0, "step": 160 }, { "epoch": 0.7406555491661875, "grad_norm": 0.011351753026247025, "learning_rate": 7.971415196763088e-06, "loss": 1.1279, "mean_token_accuracy": 0.6886353641748428, "num_tokens": 15518079.0, "step": 161 }, { "epoch": 0.7452558941920644, "grad_norm": 0.011147459968924522, "learning_rate": 7.938926261462366e-06, "loss": 1.0905, "mean_token_accuracy": 0.6901291012763977, "num_tokens": 15611875.0, "step": 162 }, { "epoch": 0.7498562392179413, "grad_norm": 0.013785228133201599, "learning_rate": 7.906246623448184e-06, "loss": 1.1525, "mean_token_accuracy": 0.6813407689332962, "num_tokens": 15707848.0, "step": 163 }, { "epoch": 0.7544565842438183, "grad_norm": 0.01464665774255991, "learning_rate": 7.87337840325542e-06, "loss": 1.1265, "mean_token_accuracy": 0.683470606803894, "num_tokens": 15796371.0, "step": 164 }, { "epoch": 0.7590569292696953, "grad_norm": 0.011676521971821785, "learning_rate": 7.84032373365578e-06, "loss": 1.1639, "mean_token_accuracy": 0.6822836399078369, "num_tokens": 15892440.0, "step": 165 }, { "epoch": 0.7636572742955722, "grad_norm": 0.013809471391141415, "learning_rate": 7.807084759519405e-06, "loss": 1.1393, "mean_token_accuracy": 0.6840439140796661, "num_tokens": 15989888.0, "step": 166 }, { "epoch": 0.7682576193214491, "grad_norm": 0.013256164267659187, "learning_rate": 7.773663637675695e-06, "loss": 1.1323, "mean_token_accuracy": 0.6872632876038551, "num_tokens": 16088051.0, "step": 167 }, { "epoch": 0.772857964347326, "grad_norm": 0.013578861020505428, "learning_rate": 7.740062536773352e-06, "loss": 1.1514, "mean_token_accuracy": 0.6812737733125687, "num_tokens": 16185711.0, "step": 168 }, { "epoch": 0.777458309373203, "grad_norm": 0.012444855645298958, "learning_rate": 7.706283637139658e-06, "loss": 1.1495, "mean_token_accuracy": 0.6834460496902466, "num_tokens": 16280860.0, "step": 169 }, { "epoch": 0.78205865439908, "grad_norm": 0.012594765983521938, "learning_rate": 7.672329130639007e-06, "loss": 1.1296, "mean_token_accuracy": 0.6830948293209076, "num_tokens": 16374245.0, "step": 170 }, { "epoch": 0.7866589994249569, "grad_norm": 0.013151990249752998, "learning_rate": 7.638201220530664e-06, "loss": 1.1253, "mean_token_accuracy": 0.688128337264061, "num_tokens": 16468182.0, "step": 171 }, { "epoch": 0.7912593444508338, "grad_norm": 0.013742980547249317, "learning_rate": 7.603902121325813e-06, "loss": 1.1271, "mean_token_accuracy": 0.6843288838863373, "num_tokens": 16561819.0, "step": 172 }, { "epoch": 0.7958596894767107, "grad_norm": 0.014118033461272717, "learning_rate": 7.5694340586438446e-06, "loss": 1.1218, "mean_token_accuracy": 0.6890603974461555, "num_tokens": 16656202.0, "step": 173 }, { "epoch": 0.8004600345025877, "grad_norm": 0.012105434201657772, "learning_rate": 7.534799269067952e-06, "loss": 1.1091, "mean_token_accuracy": 0.6900731474161148, "num_tokens": 16749603.0, "step": 174 }, { "epoch": 0.8050603795284647, "grad_norm": 0.012348281219601631, "learning_rate": 7.500000000000001e-06, "loss": 1.1282, "mean_token_accuracy": 0.6861552968621254, "num_tokens": 16845665.0, "step": 175 }, { "epoch": 0.8096607245543416, "grad_norm": 0.013485051691532135, "learning_rate": 7.465038509514688e-06, "loss": 1.1042, "mean_token_accuracy": 0.691558264195919, "num_tokens": 16938887.0, "step": 176 }, { "epoch": 0.8142610695802185, "grad_norm": 0.013376619666814804, "learning_rate": 7.42991706621303e-06, "loss": 1.1247, "mean_token_accuracy": 0.6862233057618141, "num_tokens": 17034004.0, "step": 177 }, { "epoch": 0.8188614146060954, "grad_norm": 0.013932105153799057, "learning_rate": 7.3946379490751545e-06, "loss": 1.1544, "mean_token_accuracy": 0.6811259537935257, "num_tokens": 17134895.0, "step": 178 }, { "epoch": 0.8234617596319724, "grad_norm": 0.013256735168397427, "learning_rate": 7.35920344731241e-06, "loss": 1.1575, "mean_token_accuracy": 0.679460808634758, "num_tokens": 17235475.0, "step": 179 }, { "epoch": 0.8280621046578494, "grad_norm": 0.011622334830462933, "learning_rate": 7.323615860218844e-06, "loss": 1.1184, "mean_token_accuracy": 0.6867079436779022, "num_tokens": 17335072.0, "step": 180 }, { "epoch": 0.8326624496837263, "grad_norm": 0.01442211028188467, "learning_rate": 7.287877497021978e-06, "loss": 1.1415, "mean_token_accuracy": 0.6843341290950775, "num_tokens": 17433348.0, "step": 181 }, { "epoch": 0.8372627947096032, "grad_norm": 0.012319355271756649, "learning_rate": 7.251990676732985e-06, "loss": 1.1413, "mean_token_accuracy": 0.6828998699784279, "num_tokens": 17534045.0, "step": 182 }, { "epoch": 0.8418631397354802, "grad_norm": 0.014468186534941196, "learning_rate": 7.215957727996208e-06, "loss": 1.1267, "mean_token_accuracy": 0.6874820590019226, "num_tokens": 17630770.0, "step": 183 }, { "epoch": 0.8464634847613571, "grad_norm": 0.013780116103589535, "learning_rate": 7.179780988938051e-06, "loss": 1.1264, "mean_token_accuracy": 0.6865449622273445, "num_tokens": 17721005.0, "step": 184 }, { "epoch": 0.851063829787234, "grad_norm": 0.013034569099545479, "learning_rate": 7.143462807015271e-06, "loss": 1.1428, "mean_token_accuracy": 0.6805073171854019, "num_tokens": 17818303.0, "step": 185 }, { "epoch": 0.855664174813111, "grad_norm": 0.014521626755595207, "learning_rate": 7.107005538862647e-06, "loss": 1.1435, "mean_token_accuracy": 0.6784381717443466, "num_tokens": 17911334.0, "step": 186 }, { "epoch": 0.8602645198389879, "grad_norm": 0.012255755253136158, "learning_rate": 7.07041155014006e-06, "loss": 1.119, "mean_token_accuracy": 0.6881618723273277, "num_tokens": 18003358.0, "step": 187 }, { "epoch": 0.8648648648648649, "grad_norm": 0.011319384910166264, "learning_rate": 7.033683215379002e-06, "loss": 1.1473, "mean_token_accuracy": 0.6812754571437836, "num_tokens": 18099567.0, "step": 188 }, { "epoch": 0.8694652098907418, "grad_norm": 0.012943817302584648, "learning_rate": 6.9968229178284775e-06, "loss": 1.124, "mean_token_accuracy": 0.6847608834505081, "num_tokens": 18193605.0, "step": 189 }, { "epoch": 0.8740655549166187, "grad_norm": 0.014849803410470486, "learning_rate": 6.959833049300376e-06, "loss": 1.1638, "mean_token_accuracy": 0.6793822422623634, "num_tokens": 18291528.0, "step": 190 }, { "epoch": 0.8786658999424957, "grad_norm": 0.013070415705442429, "learning_rate": 6.922716010014256e-06, "loss": 1.1657, "mean_token_accuracy": 0.6762072518467903, "num_tokens": 18387717.0, "step": 191 }, { "epoch": 0.8832662449683726, "grad_norm": 0.015733331441879272, "learning_rate": 6.885474208441602e-06, "loss": 1.1427, "mean_token_accuracy": 0.6810364499688148, "num_tokens": 18482986.0, "step": 192 }, { "epoch": 0.8878665899942496, "grad_norm": 0.014921659603714943, "learning_rate": 6.848110061149555e-06, "loss": 1.1138, "mean_token_accuracy": 0.686975933611393, "num_tokens": 18578439.0, "step": 193 }, { "epoch": 0.8924669350201265, "grad_norm": 0.012976438738405704, "learning_rate": 6.810625992644085e-06, "loss": 1.136, "mean_token_accuracy": 0.6828045099973679, "num_tokens": 18673147.0, "step": 194 }, { "epoch": 0.8970672800460034, "grad_norm": 0.013467282988131046, "learning_rate": 6.773024435212678e-06, "loss": 1.1548, "mean_token_accuracy": 0.6820717006921768, "num_tokens": 18769013.0, "step": 195 }, { "epoch": 0.9016676250718804, "grad_norm": 0.013113681226968765, "learning_rate": 6.735307828766515e-06, "loss": 1.162, "mean_token_accuracy": 0.6819472461938858, "num_tokens": 18866436.0, "step": 196 }, { "epoch": 0.9062679700977573, "grad_norm": 0.012697749771177769, "learning_rate": 6.697478620682137e-06, "loss": 1.1221, "mean_token_accuracy": 0.6850037425756454, "num_tokens": 18961175.0, "step": 197 }, { "epoch": 0.9108683151236343, "grad_norm": 0.013651424087584019, "learning_rate": 6.659539265642643e-06, "loss": 1.1327, "mean_token_accuracy": 0.683879666030407, "num_tokens": 19053487.0, "step": 198 }, { "epoch": 0.9154686601495112, "grad_norm": 0.01471368595957756, "learning_rate": 6.6214922254784145e-06, "loss": 1.1362, "mean_token_accuracy": 0.6838243156671524, "num_tokens": 19154536.0, "step": 199 }, { "epoch": 0.9200690051753881, "grad_norm": 0.013274794444441795, "learning_rate": 6.583339969007364e-06, "loss": 1.1419, "mean_token_accuracy": 0.6834047809243202, "num_tokens": 19242500.0, "step": 200 }, { "epoch": 0.9246693502012651, "grad_norm": 0.013419239781796932, "learning_rate": 6.545084971874738e-06, "loss": 1.1361, "mean_token_accuracy": 0.6821422278881073, "num_tokens": 19338362.0, "step": 201 }, { "epoch": 0.9292696952271421, "grad_norm": 0.01378414686769247, "learning_rate": 6.50672971639248e-06, "loss": 1.1408, "mean_token_accuracy": 0.680683322250843, "num_tokens": 19430444.0, "step": 202 }, { "epoch": 0.933870040253019, "grad_norm": 0.013185984455049038, "learning_rate": 6.468276691378155e-06, "loss": 1.1471, "mean_token_accuracy": 0.6821170374751091, "num_tokens": 19527300.0, "step": 203 }, { "epoch": 0.9384703852788959, "grad_norm": 0.014027146622538567, "learning_rate": 6.429728391993446e-06, "loss": 1.1402, "mean_token_accuracy": 0.6847390085458755, "num_tokens": 19623076.0, "step": 204 }, { "epoch": 0.9430707303047728, "grad_norm": 0.014988254755735397, "learning_rate": 6.391087319582264e-06, "loss": 1.1237, "mean_token_accuracy": 0.688391737639904, "num_tokens": 19717760.0, "step": 205 }, { "epoch": 0.9476710753306498, "grad_norm": 0.013494355604052544, "learning_rate": 6.35235598150842e-06, "loss": 1.1441, "mean_token_accuracy": 0.6846969500184059, "num_tokens": 19820465.0, "step": 206 }, { "epoch": 0.9522714203565268, "grad_norm": 0.012427960522472858, "learning_rate": 6.313536890992935e-06, "loss": 1.1321, "mean_token_accuracy": 0.6843677386641502, "num_tokens": 19919080.0, "step": 207 }, { "epoch": 0.9568717653824037, "grad_norm": 0.013420927338302135, "learning_rate": 6.274632566950967e-06, "loss": 1.1541, "mean_token_accuracy": 0.6806612834334373, "num_tokens": 20012947.0, "step": 208 }, { "epoch": 0.9614721104082806, "grad_norm": 0.013078980147838593, "learning_rate": 6.235645533828348e-06, "loss": 1.1041, "mean_token_accuracy": 0.6901779100298882, "num_tokens": 20112769.0, "step": 209 }, { "epoch": 0.9660724554341575, "grad_norm": 0.013666641898453236, "learning_rate": 6.1965783214377895e-06, "loss": 1.1299, "mean_token_accuracy": 0.6861997470259666, "num_tokens": 20210131.0, "step": 210 }, { "epoch": 0.9706728004600345, "grad_norm": 0.014031516388058662, "learning_rate": 6.157433464794717e-06, "loss": 1.1481, "mean_token_accuracy": 0.6819183602929115, "num_tokens": 20307517.0, "step": 211 }, { "epoch": 0.9752731454859115, "grad_norm": 0.014556187205016613, "learning_rate": 6.118213503952779e-06, "loss": 1.1727, "mean_token_accuracy": 0.6784057542681694, "num_tokens": 20407086.0, "step": 212 }, { "epoch": 0.9798734905117884, "grad_norm": 0.014544697478413582, "learning_rate": 6.078920983839032e-06, "loss": 1.1414, "mean_token_accuracy": 0.6819159612059593, "num_tokens": 20502784.0, "step": 213 }, { "epoch": 0.9844738355376653, "grad_norm": 0.014732340350747108, "learning_rate": 6.039558454088796e-06, "loss": 1.156, "mean_token_accuracy": 0.6811837628483772, "num_tokens": 20599039.0, "step": 214 }, { "epoch": 0.9890741805635422, "grad_norm": 0.014581098221242428, "learning_rate": 6.000128468880223e-06, "loss": 1.1515, "mean_token_accuracy": 0.6804311126470566, "num_tokens": 20692487.0, "step": 215 }, { "epoch": 0.9936745255894192, "grad_norm": 0.012514597736299038, "learning_rate": 5.9606335867685424e-06, "loss": 1.1308, "mean_token_accuracy": 0.685503862798214, "num_tokens": 20793938.0, "step": 216 }, { "epoch": 0.9982748706152962, "grad_norm": 0.014343786984682083, "learning_rate": 5.921076370520058e-06, "loss": 1.1707, "mean_token_accuracy": 0.6801939308643341, "num_tokens": 20887727.0, "step": 217 } ], "logging_steps": 1, "max_steps": 434, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1.8837930125599703e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }