{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.9982748706152962, "eval_steps": 500, "global_step": 434, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.004600345025876941, "grad_norm": 0.005687589757144451, "learning_rate": 0.0, "loss": 1.2964, "mean_token_accuracy": 0.6567770391702652, "num_tokens": 104794.0, "step": 1 }, { "epoch": 0.009200690051753882, "grad_norm": 0.0055035436525940895, "learning_rate": 2.2727272727272729e-07, "loss": 1.3236, "mean_token_accuracy": 0.6467703059315681, "num_tokens": 198477.0, "step": 2 }, { "epoch": 0.013801035077630822, "grad_norm": 0.00571180647239089, "learning_rate": 4.5454545454545457e-07, "loss": 1.2871, "mean_token_accuracy": 0.655419260263443, "num_tokens": 297137.0, "step": 3 }, { "epoch": 0.018401380103507763, "grad_norm": 0.006776052992790937, "learning_rate": 6.818181818181818e-07, "loss": 1.3236, "mean_token_accuracy": 0.6503552347421646, "num_tokens": 391965.0, "step": 4 }, { "epoch": 0.023001725129384705, "grad_norm": 0.00528043182566762, "learning_rate": 9.090909090909091e-07, "loss": 1.3344, "mean_token_accuracy": 0.6503330767154694, "num_tokens": 487852.0, "step": 5 }, { "epoch": 0.027602070155261643, "grad_norm": 0.005563394166529179, "learning_rate": 1.1363636363636364e-06, "loss": 1.3086, "mean_token_accuracy": 0.654597781598568, "num_tokens": 584002.0, "step": 6 }, { "epoch": 0.03220241518113859, "grad_norm": 0.007420171983540058, "learning_rate": 1.3636363636363636e-06, "loss": 1.3444, "mean_token_accuracy": 0.6459237858653069, "num_tokens": 675831.0, "step": 7 }, { "epoch": 0.03680276020701553, "grad_norm": 0.006749135907739401, "learning_rate": 1.590909090909091e-06, "loss": 1.313, "mean_token_accuracy": 0.6493777111172676, "num_tokens": 773911.0, "step": 8 }, { "epoch": 0.041403105232892465, "grad_norm": 0.00610280130058527, "learning_rate": 1.8181818181818183e-06, "loss": 1.2976, "mean_token_accuracy": 0.657502181828022, "num_tokens": 868063.0, "step": 9 }, { "epoch": 0.04600345025876941, "grad_norm": 0.007394636515527964, "learning_rate": 2.0454545454545457e-06, "loss": 1.291, "mean_token_accuracy": 0.6572054326534271, "num_tokens": 967303.0, "step": 10 }, { "epoch": 0.05060379528464635, "grad_norm": 0.007649592589586973, "learning_rate": 2.2727272727272728e-06, "loss": 1.3437, "mean_token_accuracy": 0.6450314894318581, "num_tokens": 1061613.0, "step": 11 }, { "epoch": 0.055204140310523286, "grad_norm": 0.007066652178764343, "learning_rate": 2.5e-06, "loss": 1.3062, "mean_token_accuracy": 0.6532740890979767, "num_tokens": 1154782.0, "step": 12 }, { "epoch": 0.05980448533640023, "grad_norm": 0.006177663803100586, "learning_rate": 2.7272727272727272e-06, "loss": 1.3027, "mean_token_accuracy": 0.6530071422457695, "num_tokens": 1254453.0, "step": 13 }, { "epoch": 0.06440483036227718, "grad_norm": 0.008032996207475662, "learning_rate": 2.954545454545455e-06, "loss": 1.2904, "mean_token_accuracy": 0.6574910432100296, "num_tokens": 1349953.0, "step": 14 }, { "epoch": 0.06900517538815411, "grad_norm": 0.010039424523711205, "learning_rate": 3.181818181818182e-06, "loss": 1.3105, "mean_token_accuracy": 0.6531528457999229, "num_tokens": 1447847.0, "step": 15 }, { "epoch": 0.07360552041403105, "grad_norm": 0.00691134762018919, "learning_rate": 3.409090909090909e-06, "loss": 1.3162, "mean_token_accuracy": 0.6518233045935631, "num_tokens": 1539663.0, "step": 16 }, { "epoch": 0.078205865439908, "grad_norm": 0.007641863543540239, "learning_rate": 3.6363636363636366e-06, "loss": 1.2965, "mean_token_accuracy": 0.656828798353672, "num_tokens": 1634446.0, "step": 17 }, { "epoch": 0.08280621046578493, "grad_norm": 0.006876361556351185, "learning_rate": 3.863636363636364e-06, "loss": 1.353, "mean_token_accuracy": 0.6474368572235107, "num_tokens": 1729775.0, "step": 18 }, { "epoch": 0.08740655549166187, "grad_norm": 0.00726681761443615, "learning_rate": 4.0909090909090915e-06, "loss": 1.3106, "mean_token_accuracy": 0.6513411849737167, "num_tokens": 1824828.0, "step": 19 }, { "epoch": 0.09200690051753882, "grad_norm": 0.008261698298156261, "learning_rate": 4.3181818181818185e-06, "loss": 1.3019, "mean_token_accuracy": 0.6508027985692024, "num_tokens": 1925138.0, "step": 20 }, { "epoch": 0.09660724554341575, "grad_norm": 0.008603152818977833, "learning_rate": 4.5454545454545455e-06, "loss": 1.2888, "mean_token_accuracy": 0.6574650928378105, "num_tokens": 2024720.0, "step": 21 }, { "epoch": 0.1012075905692927, "grad_norm": 0.011507058516144753, "learning_rate": 4.772727272727273e-06, "loss": 1.3541, "mean_token_accuracy": 0.6430061087012291, "num_tokens": 2115523.0, "step": 22 }, { "epoch": 0.10580793559516964, "grad_norm": 0.011566699482500553, "learning_rate": 5e-06, "loss": 1.2786, "mean_token_accuracy": 0.6559519320726395, "num_tokens": 2211187.0, "step": 23 }, { "epoch": 0.11040828062104657, "grad_norm": 0.011184126138687134, "learning_rate": 5.2272727272727274e-06, "loss": 1.2869, "mean_token_accuracy": 0.6546742096543312, "num_tokens": 2307075.0, "step": 24 }, { "epoch": 0.11500862564692352, "grad_norm": 0.009821473620831966, "learning_rate": 5.4545454545454545e-06, "loss": 1.2486, "mean_token_accuracy": 0.6607496812939644, "num_tokens": 2408388.0, "step": 25 }, { "epoch": 0.11960897067280046, "grad_norm": 0.011240242049098015, "learning_rate": 5.681818181818183e-06, "loss": 1.3021, "mean_token_accuracy": 0.6554695144295692, "num_tokens": 2502118.0, "step": 26 }, { "epoch": 0.1242093156986774, "grad_norm": 0.009518246166408062, "learning_rate": 5.90909090909091e-06, "loss": 1.2953, "mean_token_accuracy": 0.6546049192547798, "num_tokens": 2595264.0, "step": 27 }, { "epoch": 0.12880966072455435, "grad_norm": 0.008872764185070992, "learning_rate": 6.136363636363637e-06, "loss": 1.3026, "mean_token_accuracy": 0.6526112258434296, "num_tokens": 2692102.0, "step": 28 }, { "epoch": 0.13341000575043127, "grad_norm": 0.009111359715461731, "learning_rate": 6.363636363636364e-06, "loss": 1.2366, "mean_token_accuracy": 0.6660361588001251, "num_tokens": 2785080.0, "step": 29 }, { "epoch": 0.13801035077630822, "grad_norm": 0.008477196097373962, "learning_rate": 6.590909090909091e-06, "loss": 1.2575, "mean_token_accuracy": 0.6607440859079361, "num_tokens": 2881020.0, "step": 30 }, { "epoch": 0.14261069580218516, "grad_norm": 0.007433631923049688, "learning_rate": 6.818181818181818e-06, "loss": 1.2407, "mean_token_accuracy": 0.663087397813797, "num_tokens": 2978761.0, "step": 31 }, { "epoch": 0.1472110408280621, "grad_norm": 0.008866243064403534, "learning_rate": 7.045454545454546e-06, "loss": 1.2441, "mean_token_accuracy": 0.6632796227931976, "num_tokens": 3076332.0, "step": 32 }, { "epoch": 0.15181138585393905, "grad_norm": 0.007918394170701504, "learning_rate": 7.272727272727273e-06, "loss": 1.2707, "mean_token_accuracy": 0.661369614303112, "num_tokens": 3174677.0, "step": 33 }, { "epoch": 0.156411730879816, "grad_norm": 0.009430650621652603, "learning_rate": 7.500000000000001e-06, "loss": 1.237, "mean_token_accuracy": 0.6620191782712936, "num_tokens": 3271182.0, "step": 34 }, { "epoch": 0.16101207590569291, "grad_norm": 0.009918849915266037, "learning_rate": 7.727272727272727e-06, "loss": 1.2784, "mean_token_accuracy": 0.6557858139276505, "num_tokens": 3364423.0, "step": 35 }, { "epoch": 0.16561242093156986, "grad_norm": 0.01214979775249958, "learning_rate": 7.954545454545455e-06, "loss": 1.2267, "mean_token_accuracy": 0.665397971868515, "num_tokens": 3458719.0, "step": 36 }, { "epoch": 0.1702127659574468, "grad_norm": 0.0094231516122818, "learning_rate": 8.181818181818183e-06, "loss": 1.2112, "mean_token_accuracy": 0.6734237298369408, "num_tokens": 3549995.0, "step": 37 }, { "epoch": 0.17481311098332375, "grad_norm": 0.008751116693019867, "learning_rate": 8.40909090909091e-06, "loss": 1.2069, "mean_token_accuracy": 0.6694932207465172, "num_tokens": 3643349.0, "step": 38 }, { "epoch": 0.1794134560092007, "grad_norm": 0.008826850913465023, "learning_rate": 8.636363636363637e-06, "loss": 1.2127, "mean_token_accuracy": 0.669578805565834, "num_tokens": 3736816.0, "step": 39 }, { "epoch": 0.18401380103507764, "grad_norm": 0.008413583971560001, "learning_rate": 8.863636363636365e-06, "loss": 1.2028, "mean_token_accuracy": 0.672471858561039, "num_tokens": 3832791.0, "step": 40 }, { "epoch": 0.18861414606095459, "grad_norm": 0.006991323083639145, "learning_rate": 9.090909090909091e-06, "loss": 1.1791, "mean_token_accuracy": 0.6750742718577385, "num_tokens": 3932062.0, "step": 41 }, { "epoch": 0.1932144910868315, "grad_norm": 0.007404603064060211, "learning_rate": 9.318181818181819e-06, "loss": 1.1645, "mean_token_accuracy": 0.6763711273670197, "num_tokens": 4024968.0, "step": 42 }, { "epoch": 0.19781483611270845, "grad_norm": 0.007536900695413351, "learning_rate": 9.545454545454547e-06, "loss": 1.1986, "mean_token_accuracy": 0.6699943095445633, "num_tokens": 4125477.0, "step": 43 }, { "epoch": 0.2024151811385854, "grad_norm": 0.008920799009501934, "learning_rate": 9.772727272727273e-06, "loss": 1.1808, "mean_token_accuracy": 0.6771005317568779, "num_tokens": 4220159.0, "step": 44 }, { "epoch": 0.20701552616446234, "grad_norm": 0.007982825860381126, "learning_rate": 1e-05, "loss": 1.1712, "mean_token_accuracy": 0.6806080117821693, "num_tokens": 4313530.0, "step": 45 }, { "epoch": 0.21161587119033928, "grad_norm": 0.007420428097248077, "learning_rate": 9.999837778582641e-06, "loss": 1.1685, "mean_token_accuracy": 0.6754245385527611, "num_tokens": 4413260.0, "step": 46 }, { "epoch": 0.21621621621621623, "grad_norm": 0.008077534846961498, "learning_rate": 9.999351124856873e-06, "loss": 1.155, "mean_token_accuracy": 0.6799673438072205, "num_tokens": 4511873.0, "step": 47 }, { "epoch": 0.22081656124209315, "grad_norm": 0.008561821654438972, "learning_rate": 9.998540070400966e-06, "loss": 1.171, "mean_token_accuracy": 0.6745180711150169, "num_tokens": 4602762.0, "step": 48 }, { "epoch": 0.2254169062679701, "grad_norm": 0.00783666130155325, "learning_rate": 9.997404667843076e-06, "loss": 1.1694, "mean_token_accuracy": 0.6786425858736038, "num_tokens": 4703481.0, "step": 49 }, { "epoch": 0.23001725129384704, "grad_norm": 0.007960589602589607, "learning_rate": 9.995944990857848e-06, "loss": 1.1707, "mean_token_accuracy": 0.6771489679813385, "num_tokens": 4799562.0, "step": 50 }, { "epoch": 0.23461759631972398, "grad_norm": 0.007685200311243534, "learning_rate": 9.994161134161635e-06, "loss": 1.1846, "mean_token_accuracy": 0.6739635095000267, "num_tokens": 4900840.0, "step": 51 }, { "epoch": 0.23921794134560093, "grad_norm": 0.008777720853686333, "learning_rate": 9.992053213506333e-06, "loss": 1.1876, "mean_token_accuracy": 0.6759511306881905, "num_tokens": 4997883.0, "step": 52 }, { "epoch": 0.24381828637147787, "grad_norm": 0.0073701320216059685, "learning_rate": 9.989621365671902e-06, "loss": 1.1798, "mean_token_accuracy": 0.6745479926466942, "num_tokens": 5094702.0, "step": 53 }, { "epoch": 0.2484186313973548, "grad_norm": 0.0080358712002635, "learning_rate": 9.986865748457457e-06, "loss": 1.1485, "mean_token_accuracy": 0.6811746656894684, "num_tokens": 5189105.0, "step": 54 }, { "epoch": 0.25301897642323173, "grad_norm": 0.008727259002625942, "learning_rate": 9.983786540671052e-06, "loss": 1.193, "mean_token_accuracy": 0.6724725291132927, "num_tokens": 5284168.0, "step": 55 }, { "epoch": 0.2576193214491087, "grad_norm": 0.008287778124213219, "learning_rate": 9.980383942118066e-06, "loss": 1.1849, "mean_token_accuracy": 0.6733070015907288, "num_tokens": 5382877.0, "step": 56 }, { "epoch": 0.2622196664749856, "grad_norm": 0.007565150503069162, "learning_rate": 9.976658173588244e-06, "loss": 1.1741, "mean_token_accuracy": 0.6780361458659172, "num_tokens": 5476577.0, "step": 57 }, { "epoch": 0.26682001150086254, "grad_norm": 0.00806084182113409, "learning_rate": 9.972609476841368e-06, "loss": 1.161, "mean_token_accuracy": 0.6804856136441231, "num_tokens": 5577955.0, "step": 58 }, { "epoch": 0.2714203565267395, "grad_norm": 0.010196089744567871, "learning_rate": 9.968238114591567e-06, "loss": 1.1499, "mean_token_accuracy": 0.6841338276863098, "num_tokens": 5666759.0, "step": 59 }, { "epoch": 0.27602070155261643, "grad_norm": 0.007678396068513393, "learning_rate": 9.96354437049027e-06, "loss": 1.1543, "mean_token_accuracy": 0.6782903298735619, "num_tokens": 5763702.0, "step": 60 }, { "epoch": 0.2806210465784934, "grad_norm": 0.00881399866193533, "learning_rate": 9.958528549107812e-06, "loss": 1.1556, "mean_token_accuracy": 0.6805967539548874, "num_tokens": 5858188.0, "step": 61 }, { "epoch": 0.2852213916043703, "grad_norm": 0.009992823004722595, "learning_rate": 9.953190975913648e-06, "loss": 1.2055, "mean_token_accuracy": 0.668336994946003, "num_tokens": 5953081.0, "step": 62 }, { "epoch": 0.2898217366302473, "grad_norm": 0.008360505104064941, "learning_rate": 9.947531997255256e-06, "loss": 1.1395, "mean_token_accuracy": 0.6817946434020996, "num_tokens": 6054917.0, "step": 63 }, { "epoch": 0.2944220816561242, "grad_norm": 0.00789540633559227, "learning_rate": 9.941551980335653e-06, "loss": 1.1541, "mean_token_accuracy": 0.6804044917225838, "num_tokens": 6151706.0, "step": 64 }, { "epoch": 0.29902242668200113, "grad_norm": 0.010097729973495007, "learning_rate": 9.935251313189564e-06, "loss": 1.1614, "mean_token_accuracy": 0.6784722730517387, "num_tokens": 6248791.0, "step": 65 }, { "epoch": 0.3036227717078781, "grad_norm": 0.009608102962374687, "learning_rate": 9.928630404658255e-06, "loss": 1.1586, "mean_token_accuracy": 0.6793174743652344, "num_tokens": 6342795.0, "step": 66 }, { "epoch": 0.308223116733755, "grad_norm": 0.008577210828661919, "learning_rate": 9.921689684362989e-06, "loss": 1.1543, "mean_token_accuracy": 0.6808740571141243, "num_tokens": 6441301.0, "step": 67 }, { "epoch": 0.312823461759632, "grad_norm": 0.00851823017001152, "learning_rate": 9.914429602677163e-06, "loss": 1.1917, "mean_token_accuracy": 0.6714753583073616, "num_tokens": 6539454.0, "step": 68 }, { "epoch": 0.3174238067855089, "grad_norm": 0.009974654763936996, "learning_rate": 9.906850630697068e-06, "loss": 1.1883, "mean_token_accuracy": 0.6764531210064888, "num_tokens": 6634535.0, "step": 69 }, { "epoch": 0.32202415181138583, "grad_norm": 0.008425155654549599, "learning_rate": 9.89895326021134e-06, "loss": 1.1289, "mean_token_accuracy": 0.6835334897041321, "num_tokens": 6733173.0, "step": 70 }, { "epoch": 0.3266244968372628, "grad_norm": 0.009581580758094788, "learning_rate": 9.890738003669029e-06, "loss": 1.1895, "mean_token_accuracy": 0.6751143932342529, "num_tokens": 6825744.0, "step": 71 }, { "epoch": 0.3312248418631397, "grad_norm": 0.00899854488670826, "learning_rate": 9.882205394146362e-06, "loss": 1.1807, "mean_token_accuracy": 0.6726124361157417, "num_tokens": 6921349.0, "step": 72 }, { "epoch": 0.3358251868890167, "grad_norm": 0.009314511902630329, "learning_rate": 9.873355985312141e-06, "loss": 1.1511, "mean_token_accuracy": 0.6797289550304413, "num_tokens": 7016428.0, "step": 73 }, { "epoch": 0.3404255319148936, "grad_norm": 0.008227611891925335, "learning_rate": 9.864190351391822e-06, "loss": 1.1399, "mean_token_accuracy": 0.680743120610714, "num_tokens": 7116651.0, "step": 74 }, { "epoch": 0.3450258769407706, "grad_norm": 0.009333742782473564, "learning_rate": 9.854709087130261e-06, "loss": 1.1893, "mean_token_accuracy": 0.6743270009756088, "num_tokens": 7214530.0, "step": 75 }, { "epoch": 0.3496262219666475, "grad_norm": 0.008280204609036446, "learning_rate": 9.844912807753105e-06, "loss": 1.1246, "mean_token_accuracy": 0.6881353706121445, "num_tokens": 7314471.0, "step": 76 }, { "epoch": 0.3542265669925244, "grad_norm": 0.009001548402011395, "learning_rate": 9.834802148926883e-06, "loss": 1.1389, "mean_token_accuracy": 0.6820591241121292, "num_tokens": 7411143.0, "step": 77 }, { "epoch": 0.3588269120184014, "grad_norm": 0.008818632923066616, "learning_rate": 9.824377766717758e-06, "loss": 1.1199, "mean_token_accuracy": 0.6870076656341553, "num_tokens": 7505547.0, "step": 78 }, { "epoch": 0.3634272570442783, "grad_norm": 0.009602286852896214, "learning_rate": 9.813640337548955e-06, "loss": 1.1457, "mean_token_accuracy": 0.681760624051094, "num_tokens": 7604105.0, "step": 79 }, { "epoch": 0.3680276020701553, "grad_norm": 0.009009558707475662, "learning_rate": 9.802590558156863e-06, "loss": 1.1536, "mean_token_accuracy": 0.6847949475049973, "num_tokens": 7702689.0, "step": 80 }, { "epoch": 0.3726279470960322, "grad_norm": 0.009743778966367245, "learning_rate": 9.791229145545832e-06, "loss": 1.1386, "mean_token_accuracy": 0.6835950613021851, "num_tokens": 7797600.0, "step": 81 }, { "epoch": 0.37722829212190917, "grad_norm": 0.009100291877985, "learning_rate": 9.779556836941646e-06, "loss": 1.1349, "mean_token_accuracy": 0.6835153922438622, "num_tokens": 7896536.0, "step": 82 }, { "epoch": 0.3818286371477861, "grad_norm": 0.009762028232216835, "learning_rate": 9.767574389743683e-06, "loss": 1.1444, "mean_token_accuracy": 0.6820423156023026, "num_tokens": 7995947.0, "step": 83 }, { "epoch": 0.386428982173663, "grad_norm": 0.00889329332858324, "learning_rate": 9.755282581475769e-06, "loss": 1.1405, "mean_token_accuracy": 0.6851356402039528, "num_tokens": 8094263.0, "step": 84 }, { "epoch": 0.39102932719954, "grad_norm": 0.00981220230460167, "learning_rate": 9.742682209735727e-06, "loss": 1.1735, "mean_token_accuracy": 0.677773728966713, "num_tokens": 8189505.0, "step": 85 }, { "epoch": 0.3956296722254169, "grad_norm": 0.010011876933276653, "learning_rate": 9.729774092143627e-06, "loss": 1.129, "mean_token_accuracy": 0.6852159947156906, "num_tokens": 8293089.0, "step": 86 }, { "epoch": 0.40023001725129387, "grad_norm": 0.010612046346068382, "learning_rate": 9.716559066288716e-06, "loss": 1.1742, "mean_token_accuracy": 0.674958735704422, "num_tokens": 8387541.0, "step": 87 }, { "epoch": 0.4048303622771708, "grad_norm": 0.0103145157918334, "learning_rate": 9.703037989675088e-06, "loss": 1.153, "mean_token_accuracy": 0.6805268451571465, "num_tokens": 8484151.0, "step": 88 }, { "epoch": 0.4094307073030477, "grad_norm": 0.009694715961813927, "learning_rate": 9.689211739666023e-06, "loss": 1.1877, "mean_token_accuracy": 0.6738117784261703, "num_tokens": 8581092.0, "step": 89 }, { "epoch": 0.4140310523289247, "grad_norm": 0.01016835868358612, "learning_rate": 9.675081213427076e-06, "loss": 1.13, "mean_token_accuracy": 0.6874581500887871, "num_tokens": 8679981.0, "step": 90 }, { "epoch": 0.4186313973548016, "grad_norm": 0.008928492665290833, "learning_rate": 9.66064732786784e-06, "loss": 1.1369, "mean_token_accuracy": 0.6865670680999756, "num_tokens": 8779582.0, "step": 91 }, { "epoch": 0.42323174238067857, "grad_norm": 0.009940912947058678, "learning_rate": 9.645911019582467e-06, "loss": 1.1602, "mean_token_accuracy": 0.6783237531781197, "num_tokens": 8875552.0, "step": 92 }, { "epoch": 0.4278320874065555, "grad_norm": 0.011580446735024452, "learning_rate": 9.630873244788884e-06, "loss": 1.139, "mean_token_accuracy": 0.6843747869133949, "num_tokens": 8966375.0, "step": 93 }, { "epoch": 0.43243243243243246, "grad_norm": 0.009115920402109623, "learning_rate": 9.615534979266745e-06, "loss": 1.1646, "mean_token_accuracy": 0.6751029714941978, "num_tokens": 9063222.0, "step": 94 }, { "epoch": 0.4370327774583094, "grad_norm": 0.009414221160113811, "learning_rate": 9.599897218294122e-06, "loss": 1.1572, "mean_token_accuracy": 0.6786936447024345, "num_tokens": 9158240.0, "step": 95 }, { "epoch": 0.4416331224841863, "grad_norm": 0.009733911603689194, "learning_rate": 9.583960976582914e-06, "loss": 1.1106, "mean_token_accuracy": 0.6883520036935806, "num_tokens": 9257427.0, "step": 96 }, { "epoch": 0.44623346751006326, "grad_norm": 0.01011735387146473, "learning_rate": 9.567727288213005e-06, "loss": 1.1555, "mean_token_accuracy": 0.6811134442687035, "num_tokens": 9354084.0, "step": 97 }, { "epoch": 0.4508338125359402, "grad_norm": 0.011312155053019524, "learning_rate": 9.551197206565174e-06, "loss": 1.1386, "mean_token_accuracy": 0.682069718837738, "num_tokens": 9449568.0, "step": 98 }, { "epoch": 0.45543415756181715, "grad_norm": 0.010424958541989326, "learning_rate": 9.534371804252727e-06, "loss": 1.1424, "mean_token_accuracy": 0.6819394826889038, "num_tokens": 9543754.0, "step": 99 }, { "epoch": 0.46003450258769407, "grad_norm": 0.010464823804795742, "learning_rate": 9.517252173051912e-06, "loss": 1.1736, "mean_token_accuracy": 0.6762436330318451, "num_tokens": 9640369.0, "step": 100 }, { "epoch": 0.46463484761357104, "grad_norm": 0.010858048684895039, "learning_rate": 9.499839423831062e-06, "loss": 1.1636, "mean_token_accuracy": 0.6757931411266327, "num_tokens": 9732896.0, "step": 101 }, { "epoch": 0.46923519263944796, "grad_norm": 0.01097831316292286, "learning_rate": 9.48213468647852e-06, "loss": 1.1372, "mean_token_accuracy": 0.6813743412494659, "num_tokens": 9828655.0, "step": 102 }, { "epoch": 0.4738355376653249, "grad_norm": 0.009854613803327084, "learning_rate": 9.46413910982932e-06, "loss": 1.1422, "mean_token_accuracy": 0.6805589944124222, "num_tokens": 9925327.0, "step": 103 }, { "epoch": 0.47843588269120185, "grad_norm": 0.011986501514911652, "learning_rate": 9.445853861590647e-06, "loss": 1.1552, "mean_token_accuracy": 0.6841816902160645, "num_tokens": 10019986.0, "step": 104 }, { "epoch": 0.48303622771707877, "grad_norm": 0.009618732146918774, "learning_rate": 9.427280128266049e-06, "loss": 1.114, "mean_token_accuracy": 0.6898596957325935, "num_tokens": 10120938.0, "step": 105 }, { "epoch": 0.48763657274295574, "grad_norm": 0.011056702584028244, "learning_rate": 9.40841911507847e-06, "loss": 1.1625, "mean_token_accuracy": 0.6775639355182648, "num_tokens": 10216437.0, "step": 106 }, { "epoch": 0.49223691776883266, "grad_norm": 0.01116709690541029, "learning_rate": 9.389272045892023e-06, "loss": 1.145, "mean_token_accuracy": 0.6837708950042725, "num_tokens": 10311173.0, "step": 107 }, { "epoch": 0.4968372627947096, "grad_norm": 0.011039802804589272, "learning_rate": 9.36984016313259e-06, "loss": 1.1417, "mean_token_accuracy": 0.6808711588382721, "num_tokens": 10407597.0, "step": 108 }, { "epoch": 0.5014376078205866, "grad_norm": 0.010891326703131199, "learning_rate": 9.350124727707197e-06, "loss": 1.168, "mean_token_accuracy": 0.6797266602516174, "num_tokens": 10508399.0, "step": 109 }, { "epoch": 0.5060379528464635, "grad_norm": 0.011290277354419231, "learning_rate": 9.330127018922195e-06, "loss": 1.1601, "mean_token_accuracy": 0.6797808483242989, "num_tokens": 10607967.0, "step": 110 }, { "epoch": 0.5106382978723404, "grad_norm": 0.01199404802173376, "learning_rate": 9.309848334400247e-06, "loss": 1.1465, "mean_token_accuracy": 0.6825785636901855, "num_tokens": 10700032.0, "step": 111 }, { "epoch": 0.5152386428982174, "grad_norm": 0.011274462565779686, "learning_rate": 9.289289989996133e-06, "loss": 1.1476, "mean_token_accuracy": 0.6835216283798218, "num_tokens": 10793853.0, "step": 112 }, { "epoch": 0.5198389879240943, "grad_norm": 0.010716607794165611, "learning_rate": 9.268453319711362e-06, "loss": 1.137, "mean_token_accuracy": 0.6838621497154236, "num_tokens": 10893892.0, "step": 113 }, { "epoch": 0.5244393329499712, "grad_norm": 0.011201828718185425, "learning_rate": 9.247339675607606e-06, "loss": 1.1673, "mean_token_accuracy": 0.6785961911082268, "num_tokens": 10990079.0, "step": 114 }, { "epoch": 0.5290396779758482, "grad_norm": 0.012047258205711842, "learning_rate": 9.225950427718974e-06, "loss": 1.141, "mean_token_accuracy": 0.6847905442118645, "num_tokens": 11087797.0, "step": 115 }, { "epoch": 0.5336400230017251, "grad_norm": 0.009881600737571716, "learning_rate": 9.204286963963112e-06, "loss": 1.1815, "mean_token_accuracy": 0.6752007529139519, "num_tokens": 11186382.0, "step": 116 }, { "epoch": 0.5382403680276021, "grad_norm": 0.011906330473721027, "learning_rate": 9.182350690051134e-06, "loss": 1.1841, "mean_token_accuracy": 0.6728686764836311, "num_tokens": 11280569.0, "step": 117 }, { "epoch": 0.542840713053479, "grad_norm": 0.01070008147507906, "learning_rate": 9.160143029396422e-06, "loss": 1.1368, "mean_token_accuracy": 0.6841261833906174, "num_tokens": 11375905.0, "step": 118 }, { "epoch": 0.547441058079356, "grad_norm": 0.01177423819899559, "learning_rate": 9.13766542302225e-06, "loss": 1.1204, "mean_token_accuracy": 0.6871694549918175, "num_tokens": 11469920.0, "step": 119 }, { "epoch": 0.5520414031052329, "grad_norm": 0.011396740563213825, "learning_rate": 9.114919329468283e-06, "loss": 1.1295, "mean_token_accuracy": 0.6842972412705421, "num_tokens": 11566631.0, "step": 120 }, { "epoch": 0.5566417481311098, "grad_norm": 0.011250436305999756, "learning_rate": 9.091906224695935e-06, "loss": 1.1233, "mean_token_accuracy": 0.6875024884939194, "num_tokens": 11663849.0, "step": 121 }, { "epoch": 0.5612420931569868, "grad_norm": 0.01271882839500904, "learning_rate": 9.0686276019926e-06, "loss": 1.1367, "mean_token_accuracy": 0.6822795867919922, "num_tokens": 11758571.0, "step": 122 }, { "epoch": 0.5658424381828637, "grad_norm": 0.01079560723155737, "learning_rate": 9.045084971874738e-06, "loss": 1.1209, "mean_token_accuracy": 0.6869323998689651, "num_tokens": 11858943.0, "step": 123 }, { "epoch": 0.5704427832087406, "grad_norm": 0.010741114616394043, "learning_rate": 9.021279861989884e-06, "loss": 1.1339, "mean_token_accuracy": 0.681599348783493, "num_tokens": 11959125.0, "step": 124 }, { "epoch": 0.5750431282346176, "grad_norm": 0.011083470657467842, "learning_rate": 8.997213817017508e-06, "loss": 1.1707, "mean_token_accuracy": 0.6807960867881775, "num_tokens": 12050647.0, "step": 125 }, { "epoch": 0.5796434732604946, "grad_norm": 0.012295430526137352, "learning_rate": 8.972888398568772e-06, "loss": 1.1365, "mean_token_accuracy": 0.682566873729229, "num_tokens": 12147275.0, "step": 126 }, { "epoch": 0.5842438182863715, "grad_norm": 0.012151171453297138, "learning_rate": 8.948305185085226e-06, "loss": 1.1393, "mean_token_accuracy": 0.6846441850066185, "num_tokens": 12245419.0, "step": 127 }, { "epoch": 0.5888441633122484, "grad_norm": 0.01221384946256876, "learning_rate": 8.923465771736361e-06, "loss": 1.1423, "mean_token_accuracy": 0.6798125579953194, "num_tokens": 12345045.0, "step": 128 }, { "epoch": 0.5934445083381253, "grad_norm": 0.010475218296051025, "learning_rate": 8.898371770316113e-06, "loss": 1.1229, "mean_token_accuracy": 0.6866893246769905, "num_tokens": 12440926.0, "step": 129 }, { "epoch": 0.5980448533640023, "grad_norm": 0.010910892859101295, "learning_rate": 8.873024809138272e-06, "loss": 1.135, "mean_token_accuracy": 0.6809633672237396, "num_tokens": 12538689.0, "step": 130 }, { "epoch": 0.6026451983898793, "grad_norm": 0.012574547901749611, "learning_rate": 8.84742653293083e-06, "loss": 1.1386, "mean_token_accuracy": 0.6841543838381767, "num_tokens": 12633929.0, "step": 131 }, { "epoch": 0.6072455434157562, "grad_norm": 0.0117676155641675, "learning_rate": 8.821578602729242e-06, "loss": 1.1872, "mean_token_accuracy": 0.6732319965958595, "num_tokens": 12730071.0, "step": 132 }, { "epoch": 0.6118458884416331, "grad_norm": 0.01177041232585907, "learning_rate": 8.795482695768658e-06, "loss": 1.1557, "mean_token_accuracy": 0.6811974123120308, "num_tokens": 12827268.0, "step": 133 }, { "epoch": 0.61644623346751, "grad_norm": 0.012073309160768986, "learning_rate": 8.769140505375084e-06, "loss": 1.1482, "mean_token_accuracy": 0.6824083104729652, "num_tokens": 12920648.0, "step": 134 }, { "epoch": 0.621046578493387, "grad_norm": 0.013189052231609821, "learning_rate": 8.742553740855507e-06, "loss": 1.1202, "mean_token_accuracy": 0.6862241849303246, "num_tokens": 13010217.0, "step": 135 }, { "epoch": 0.625646923519264, "grad_norm": 0.017087044194340706, "learning_rate": 8.715724127386971e-06, "loss": 1.1678, "mean_token_accuracy": 0.6766590625047684, "num_tokens": 13108063.0, "step": 136 }, { "epoch": 0.6302472685451409, "grad_norm": 0.013833911158144474, "learning_rate": 8.688653405904653e-06, "loss": 1.139, "mean_token_accuracy": 0.6834281384944916, "num_tokens": 13204017.0, "step": 137 }, { "epoch": 0.6348476135710178, "grad_norm": 0.011891160160303116, "learning_rate": 8.661343332988869e-06, "loss": 1.1432, "mean_token_accuracy": 0.6826580688357353, "num_tokens": 13298917.0, "step": 138 }, { "epoch": 0.6394479585968947, "grad_norm": 0.010969611816108227, "learning_rate": 8.633795680751116e-06, "loss": 1.1384, "mean_token_accuracy": 0.6838229894638062, "num_tokens": 13398469.0, "step": 139 }, { "epoch": 0.6440483036227717, "grad_norm": 0.011026185005903244, "learning_rate": 8.606012236719073e-06, "loss": 1.1356, "mean_token_accuracy": 0.6841299682855606, "num_tokens": 13491680.0, "step": 140 }, { "epoch": 0.6486486486486487, "grad_norm": 0.011263255029916763, "learning_rate": 8.577994803720605e-06, "loss": 1.129, "mean_token_accuracy": 0.6875933781266212, "num_tokens": 13590200.0, "step": 141 }, { "epoch": 0.6532489936745256, "grad_norm": 0.011134397238492966, "learning_rate": 8.549745199766792e-06, "loss": 1.1408, "mean_token_accuracy": 0.682669073343277, "num_tokens": 13687397.0, "step": 142 }, { "epoch": 0.6578493387004025, "grad_norm": 0.012590516358613968, "learning_rate": 8.521265257933948e-06, "loss": 1.1685, "mean_token_accuracy": 0.677878700196743, "num_tokens": 13783952.0, "step": 143 }, { "epoch": 0.6624496837262794, "grad_norm": 0.012606673873960972, "learning_rate": 8.492556826244687e-06, "loss": 1.1415, "mean_token_accuracy": 0.6823642030358315, "num_tokens": 13878727.0, "step": 144 }, { "epoch": 0.6670500287521565, "grad_norm": 0.011452843435108662, "learning_rate": 8.463621767547998e-06, "loss": 1.115, "mean_token_accuracy": 0.6876819431781769, "num_tokens": 13973528.0, "step": 145 }, { "epoch": 0.6716503737780334, "grad_norm": 0.013077128678560257, "learning_rate": 8.434461959398377e-06, "loss": 1.1375, "mean_token_accuracy": 0.6831812486052513, "num_tokens": 14067816.0, "step": 146 }, { "epoch": 0.6762507188039103, "grad_norm": 0.012629431672394276, "learning_rate": 8.405079293933986e-06, "loss": 1.1549, "mean_token_accuracy": 0.6779226139187813, "num_tokens": 14166980.0, "step": 147 }, { "epoch": 0.6808510638297872, "grad_norm": 0.01266096904873848, "learning_rate": 8.375475677753882e-06, "loss": 1.1391, "mean_token_accuracy": 0.6808317601680756, "num_tokens": 14262155.0, "step": 148 }, { "epoch": 0.6854514088556641, "grad_norm": 0.012114723213016987, "learning_rate": 8.345653031794292e-06, "loss": 1.1339, "mean_token_accuracy": 0.6848656088113785, "num_tokens": 14357686.0, "step": 149 }, { "epoch": 0.6900517538815412, "grad_norm": 0.01152091845870018, "learning_rate": 8.315613291203977e-06, "loss": 1.1362, "mean_token_accuracy": 0.6844386830925941, "num_tokens": 14452969.0, "step": 150 }, { "epoch": 0.6946520989074181, "grad_norm": 0.011453399434685707, "learning_rate": 8.285358405218655e-06, "loss": 1.1354, "mean_token_accuracy": 0.6829889118671417, "num_tokens": 14555977.0, "step": 151 }, { "epoch": 0.699252443933295, "grad_norm": 0.01063123345375061, "learning_rate": 8.25489033703452e-06, "loss": 1.1511, "mean_token_accuracy": 0.6795672103762627, "num_tokens": 14656890.0, "step": 152 }, { "epoch": 0.7038527889591719, "grad_norm": 0.01153411716222763, "learning_rate": 8.224211063680854e-06, "loss": 1.1349, "mean_token_accuracy": 0.6822441294789314, "num_tokens": 14756458.0, "step": 153 }, { "epoch": 0.7084531339850488, "grad_norm": 0.012573798187077045, "learning_rate": 8.19332257589174e-06, "loss": 1.1318, "mean_token_accuracy": 0.6857383400201797, "num_tokens": 14847811.0, "step": 154 }, { "epoch": 0.7130534790109259, "grad_norm": 0.015371086075901985, "learning_rate": 8.162226877976886e-06, "loss": 1.1367, "mean_token_accuracy": 0.6819384023547173, "num_tokens": 14944682.0, "step": 155 }, { "epoch": 0.7176538240368028, "grad_norm": 0.012037052772939205, "learning_rate": 8.13092598769157e-06, "loss": 1.0943, "mean_token_accuracy": 0.6912998482584953, "num_tokens": 15044543.0, "step": 156 }, { "epoch": 0.7222541690626797, "grad_norm": 0.012677938677370548, "learning_rate": 8.099421936105702e-06, "loss": 1.1261, "mean_token_accuracy": 0.6894383281469345, "num_tokens": 15135392.0, "step": 157 }, { "epoch": 0.7268545140885566, "grad_norm": 0.013612372800707817, "learning_rate": 8.067716767472045e-06, "loss": 1.1509, "mean_token_accuracy": 0.6794408410787582, "num_tokens": 15230933.0, "step": 158 }, { "epoch": 0.7314548591144335, "grad_norm": 0.012262539006769657, "learning_rate": 8.035812539093557e-06, "loss": 1.1656, "mean_token_accuracy": 0.6754115670919418, "num_tokens": 15326416.0, "step": 159 }, { "epoch": 0.7360552041403106, "grad_norm": 0.014869904145598412, "learning_rate": 8.003711321189895e-06, "loss": 1.1469, "mean_token_accuracy": 0.6832912117242813, "num_tokens": 15418479.0, "step": 160 }, { "epoch": 0.7406555491661875, "grad_norm": 0.011351753026247025, "learning_rate": 7.971415196763088e-06, "loss": 1.1279, "mean_token_accuracy": 0.6886353641748428, "num_tokens": 15518079.0, "step": 161 }, { "epoch": 0.7452558941920644, "grad_norm": 0.011147459968924522, "learning_rate": 7.938926261462366e-06, "loss": 1.0905, "mean_token_accuracy": 0.6901291012763977, "num_tokens": 15611875.0, "step": 162 }, { "epoch": 0.7498562392179413, "grad_norm": 0.013785228133201599, "learning_rate": 7.906246623448184e-06, "loss": 1.1525, "mean_token_accuracy": 0.6813407689332962, "num_tokens": 15707848.0, "step": 163 }, { "epoch": 0.7544565842438183, "grad_norm": 0.01464665774255991, "learning_rate": 7.87337840325542e-06, "loss": 1.1265, "mean_token_accuracy": 0.683470606803894, "num_tokens": 15796371.0, "step": 164 }, { "epoch": 0.7590569292696953, "grad_norm": 0.011676521971821785, "learning_rate": 7.84032373365578e-06, "loss": 1.1639, "mean_token_accuracy": 0.6822836399078369, "num_tokens": 15892440.0, "step": 165 }, { "epoch": 0.7636572742955722, "grad_norm": 0.013809471391141415, "learning_rate": 7.807084759519405e-06, "loss": 1.1393, "mean_token_accuracy": 0.6840439140796661, "num_tokens": 15989888.0, "step": 166 }, { "epoch": 0.7682576193214491, "grad_norm": 0.013256164267659187, "learning_rate": 7.773663637675695e-06, "loss": 1.1323, "mean_token_accuracy": 0.6872632876038551, "num_tokens": 16088051.0, "step": 167 }, { "epoch": 0.772857964347326, "grad_norm": 0.013578861020505428, "learning_rate": 7.740062536773352e-06, "loss": 1.1514, "mean_token_accuracy": 0.6812737733125687, "num_tokens": 16185711.0, "step": 168 }, { "epoch": 0.777458309373203, "grad_norm": 0.012444855645298958, "learning_rate": 7.706283637139658e-06, "loss": 1.1495, "mean_token_accuracy": 0.6834460496902466, "num_tokens": 16280860.0, "step": 169 }, { "epoch": 0.78205865439908, "grad_norm": 0.012594765983521938, "learning_rate": 7.672329130639007e-06, "loss": 1.1296, "mean_token_accuracy": 0.6830948293209076, "num_tokens": 16374245.0, "step": 170 }, { "epoch": 0.7866589994249569, "grad_norm": 0.013151990249752998, "learning_rate": 7.638201220530664e-06, "loss": 1.1253, "mean_token_accuracy": 0.688128337264061, "num_tokens": 16468182.0, "step": 171 }, { "epoch": 0.7912593444508338, "grad_norm": 0.013742980547249317, "learning_rate": 7.603902121325813e-06, "loss": 1.1271, "mean_token_accuracy": 0.6843288838863373, "num_tokens": 16561819.0, "step": 172 }, { "epoch": 0.7958596894767107, "grad_norm": 0.014118033461272717, "learning_rate": 7.5694340586438446e-06, "loss": 1.1218, "mean_token_accuracy": 0.6890603974461555, "num_tokens": 16656202.0, "step": 173 }, { "epoch": 0.8004600345025877, "grad_norm": 0.012105434201657772, "learning_rate": 7.534799269067952e-06, "loss": 1.1091, "mean_token_accuracy": 0.6900731474161148, "num_tokens": 16749603.0, "step": 174 }, { "epoch": 0.8050603795284647, "grad_norm": 0.012348281219601631, "learning_rate": 7.500000000000001e-06, "loss": 1.1282, "mean_token_accuracy": 0.6861552968621254, "num_tokens": 16845665.0, "step": 175 }, { "epoch": 0.8096607245543416, "grad_norm": 0.013485051691532135, "learning_rate": 7.465038509514688e-06, "loss": 1.1042, "mean_token_accuracy": 0.691558264195919, "num_tokens": 16938887.0, "step": 176 }, { "epoch": 0.8142610695802185, "grad_norm": 0.013376619666814804, "learning_rate": 7.42991706621303e-06, "loss": 1.1247, "mean_token_accuracy": 0.6862233057618141, "num_tokens": 17034004.0, "step": 177 }, { "epoch": 0.8188614146060954, "grad_norm": 0.013932105153799057, "learning_rate": 7.3946379490751545e-06, "loss": 1.1544, "mean_token_accuracy": 0.6811259537935257, "num_tokens": 17134895.0, "step": 178 }, { "epoch": 0.8234617596319724, "grad_norm": 0.013256735168397427, "learning_rate": 7.35920344731241e-06, "loss": 1.1575, "mean_token_accuracy": 0.679460808634758, "num_tokens": 17235475.0, "step": 179 }, { "epoch": 0.8280621046578494, "grad_norm": 0.011622334830462933, "learning_rate": 7.323615860218844e-06, "loss": 1.1184, "mean_token_accuracy": 0.6867079436779022, "num_tokens": 17335072.0, "step": 180 }, { "epoch": 0.8326624496837263, "grad_norm": 0.01442211028188467, "learning_rate": 7.287877497021978e-06, "loss": 1.1415, "mean_token_accuracy": 0.6843341290950775, "num_tokens": 17433348.0, "step": 181 }, { "epoch": 0.8372627947096032, "grad_norm": 0.012319355271756649, "learning_rate": 7.251990676732985e-06, "loss": 1.1413, "mean_token_accuracy": 0.6828998699784279, "num_tokens": 17534045.0, "step": 182 }, { "epoch": 0.8418631397354802, "grad_norm": 0.014468186534941196, "learning_rate": 7.215957727996208e-06, "loss": 1.1267, "mean_token_accuracy": 0.6874820590019226, "num_tokens": 17630770.0, "step": 183 }, { "epoch": 0.8464634847613571, "grad_norm": 0.013780116103589535, "learning_rate": 7.179780988938051e-06, "loss": 1.1264, "mean_token_accuracy": 0.6865449622273445, "num_tokens": 17721005.0, "step": 184 }, { "epoch": 0.851063829787234, "grad_norm": 0.013034569099545479, "learning_rate": 7.143462807015271e-06, "loss": 1.1428, "mean_token_accuracy": 0.6805073171854019, "num_tokens": 17818303.0, "step": 185 }, { "epoch": 0.855664174813111, "grad_norm": 0.014521626755595207, "learning_rate": 7.107005538862647e-06, "loss": 1.1435, "mean_token_accuracy": 0.6784381717443466, "num_tokens": 17911334.0, "step": 186 }, { "epoch": 0.8602645198389879, "grad_norm": 0.012255755253136158, "learning_rate": 7.07041155014006e-06, "loss": 1.119, "mean_token_accuracy": 0.6881618723273277, "num_tokens": 18003358.0, "step": 187 }, { "epoch": 0.8648648648648649, "grad_norm": 0.011319384910166264, "learning_rate": 7.033683215379002e-06, "loss": 1.1473, "mean_token_accuracy": 0.6812754571437836, "num_tokens": 18099567.0, "step": 188 }, { "epoch": 0.8694652098907418, "grad_norm": 0.012943817302584648, "learning_rate": 6.9968229178284775e-06, "loss": 1.124, "mean_token_accuracy": 0.6847608834505081, "num_tokens": 18193605.0, "step": 189 }, { "epoch": 0.8740655549166187, "grad_norm": 0.014849803410470486, "learning_rate": 6.959833049300376e-06, "loss": 1.1638, "mean_token_accuracy": 0.6793822422623634, "num_tokens": 18291528.0, "step": 190 }, { "epoch": 0.8786658999424957, "grad_norm": 0.013070415705442429, "learning_rate": 6.922716010014256e-06, "loss": 1.1657, "mean_token_accuracy": 0.6762072518467903, "num_tokens": 18387717.0, "step": 191 }, { "epoch": 0.8832662449683726, "grad_norm": 0.015733331441879272, "learning_rate": 6.885474208441602e-06, "loss": 1.1427, "mean_token_accuracy": 0.6810364499688148, "num_tokens": 18482986.0, "step": 192 }, { "epoch": 0.8878665899942496, "grad_norm": 0.014921659603714943, "learning_rate": 6.848110061149555e-06, "loss": 1.1138, "mean_token_accuracy": 0.686975933611393, "num_tokens": 18578439.0, "step": 193 }, { "epoch": 0.8924669350201265, "grad_norm": 0.012976438738405704, "learning_rate": 6.810625992644085e-06, "loss": 1.136, "mean_token_accuracy": 0.6828045099973679, "num_tokens": 18673147.0, "step": 194 }, { "epoch": 0.8970672800460034, "grad_norm": 0.013467282988131046, "learning_rate": 6.773024435212678e-06, "loss": 1.1548, "mean_token_accuracy": 0.6820717006921768, "num_tokens": 18769013.0, "step": 195 }, { "epoch": 0.9016676250718804, "grad_norm": 0.013113681226968765, "learning_rate": 6.735307828766515e-06, "loss": 1.162, "mean_token_accuracy": 0.6819472461938858, "num_tokens": 18866436.0, "step": 196 }, { "epoch": 0.9062679700977573, "grad_norm": 0.012697749771177769, "learning_rate": 6.697478620682137e-06, "loss": 1.1221, "mean_token_accuracy": 0.6850037425756454, "num_tokens": 18961175.0, "step": 197 }, { "epoch": 0.9108683151236343, "grad_norm": 0.013651424087584019, "learning_rate": 6.659539265642643e-06, "loss": 1.1327, "mean_token_accuracy": 0.683879666030407, "num_tokens": 19053487.0, "step": 198 }, { "epoch": 0.9154686601495112, "grad_norm": 0.01471368595957756, "learning_rate": 6.6214922254784145e-06, "loss": 1.1362, "mean_token_accuracy": 0.6838243156671524, "num_tokens": 19154536.0, "step": 199 }, { "epoch": 0.9200690051753881, "grad_norm": 0.013274794444441795, "learning_rate": 6.583339969007364e-06, "loss": 1.1419, "mean_token_accuracy": 0.6834047809243202, "num_tokens": 19242500.0, "step": 200 }, { "epoch": 0.9246693502012651, "grad_norm": 0.013419239781796932, "learning_rate": 6.545084971874738e-06, "loss": 1.1361, "mean_token_accuracy": 0.6821422278881073, "num_tokens": 19338362.0, "step": 201 }, { "epoch": 0.9292696952271421, "grad_norm": 0.01378414686769247, "learning_rate": 6.50672971639248e-06, "loss": 1.1408, "mean_token_accuracy": 0.680683322250843, "num_tokens": 19430444.0, "step": 202 }, { "epoch": 0.933870040253019, "grad_norm": 0.013185984455049038, "learning_rate": 6.468276691378155e-06, "loss": 1.1471, "mean_token_accuracy": 0.6821170374751091, "num_tokens": 19527300.0, "step": 203 }, { "epoch": 0.9384703852788959, "grad_norm": 0.014027146622538567, "learning_rate": 6.429728391993446e-06, "loss": 1.1402, "mean_token_accuracy": 0.6847390085458755, "num_tokens": 19623076.0, "step": 204 }, { "epoch": 0.9430707303047728, "grad_norm": 0.014988254755735397, "learning_rate": 6.391087319582264e-06, "loss": 1.1237, "mean_token_accuracy": 0.688391737639904, "num_tokens": 19717760.0, "step": 205 }, { "epoch": 0.9476710753306498, "grad_norm": 0.013494355604052544, "learning_rate": 6.35235598150842e-06, "loss": 1.1441, "mean_token_accuracy": 0.6846969500184059, "num_tokens": 19820465.0, "step": 206 }, { "epoch": 0.9522714203565268, "grad_norm": 0.012427960522472858, "learning_rate": 6.313536890992935e-06, "loss": 1.1321, "mean_token_accuracy": 0.6843677386641502, "num_tokens": 19919080.0, "step": 207 }, { "epoch": 0.9568717653824037, "grad_norm": 0.013420927338302135, "learning_rate": 6.274632566950967e-06, "loss": 1.1541, "mean_token_accuracy": 0.6806612834334373, "num_tokens": 20012947.0, "step": 208 }, { "epoch": 0.9614721104082806, "grad_norm": 0.013078980147838593, "learning_rate": 6.235645533828348e-06, "loss": 1.1041, "mean_token_accuracy": 0.6901779100298882, "num_tokens": 20112769.0, "step": 209 }, { "epoch": 0.9660724554341575, "grad_norm": 0.013666641898453236, "learning_rate": 6.1965783214377895e-06, "loss": 1.1299, "mean_token_accuracy": 0.6861997470259666, "num_tokens": 20210131.0, "step": 210 }, { "epoch": 0.9706728004600345, "grad_norm": 0.014031516388058662, "learning_rate": 6.157433464794717e-06, "loss": 1.1481, "mean_token_accuracy": 0.6819183602929115, "num_tokens": 20307517.0, "step": 211 }, { "epoch": 0.9752731454859115, "grad_norm": 0.014556187205016613, "learning_rate": 6.118213503952779e-06, "loss": 1.1727, "mean_token_accuracy": 0.6784057542681694, "num_tokens": 20407086.0, "step": 212 }, { "epoch": 0.9798734905117884, "grad_norm": 0.014544697478413582, "learning_rate": 6.078920983839032e-06, "loss": 1.1414, "mean_token_accuracy": 0.6819159612059593, "num_tokens": 20502784.0, "step": 213 }, { "epoch": 0.9844738355376653, "grad_norm": 0.014732340350747108, "learning_rate": 6.039558454088796e-06, "loss": 1.156, "mean_token_accuracy": 0.6811837628483772, "num_tokens": 20599039.0, "step": 214 }, { "epoch": 0.9890741805635422, "grad_norm": 0.014581098221242428, "learning_rate": 6.000128468880223e-06, "loss": 1.1515, "mean_token_accuracy": 0.6804311126470566, "num_tokens": 20692487.0, "step": 215 }, { "epoch": 0.9936745255894192, "grad_norm": 0.012514597736299038, "learning_rate": 5.9606335867685424e-06, "loss": 1.1308, "mean_token_accuracy": 0.685503862798214, "num_tokens": 20793938.0, "step": 216 }, { "epoch": 0.9982748706152962, "grad_norm": 0.014343786984682083, "learning_rate": 5.921076370520058e-06, "loss": 1.1707, "mean_token_accuracy": 0.6801939308643341, "num_tokens": 20887727.0, "step": 217 }, { "epoch": 1.004600345025877, "grad_norm": 0.016213279217481613, "learning_rate": 5.8814593869458455e-06, "loss": 2.2427, "mean_token_accuracy": 0.6866950869560242, "num_tokens": 21004456.0, "step": 218 }, { "epoch": 1.0092006900517538, "grad_norm": 0.013519300147891045, "learning_rate": 5.841785206735192e-06, "loss": 1.1294, "mean_token_accuracy": 0.6871752962470055, "num_tokens": 21099553.0, "step": 219 }, { "epoch": 1.0138010350776308, "grad_norm": 0.01289405021816492, "learning_rate": 5.8020564042888015e-06, "loss": 1.174, "mean_token_accuracy": 0.6760912984609604, "num_tokens": 21193220.0, "step": 220 }, { "epoch": 1.0184013801035077, "grad_norm": 0.012278413400053978, "learning_rate": 5.762275557551728e-06, "loss": 1.1335, "mean_token_accuracy": 0.6865715309977531, "num_tokens": 21292513.0, "step": 221 }, { "epoch": 1.0230017251293848, "grad_norm": 0.01394630316644907, "learning_rate": 5.722445247846107e-06, "loss": 1.1277, "mean_token_accuracy": 0.6879585757851601, "num_tokens": 21386328.0, "step": 222 }, { "epoch": 1.0276020701552617, "grad_norm": 0.01193606574088335, "learning_rate": 5.682568059703659e-06, "loss": 1.1225, "mean_token_accuracy": 0.6864568889141083, "num_tokens": 21484561.0, "step": 223 }, { "epoch": 1.0322024151811386, "grad_norm": 0.014031891711056232, "learning_rate": 5.642646580697974e-06, "loss": 1.1372, "mean_token_accuracy": 0.6855478435754776, "num_tokens": 21580042.0, "step": 224 }, { "epoch": 1.0368027602070156, "grad_norm": 0.01325292233377695, "learning_rate": 5.6026834012766155e-06, "loss": 1.143, "mean_token_accuracy": 0.6811042875051498, "num_tokens": 21677310.0, "step": 225 }, { "epoch": 1.0414031052328925, "grad_norm": 0.012639901600778103, "learning_rate": 5.562681114593028e-06, "loss": 1.1522, "mean_token_accuracy": 0.6808114796876907, "num_tokens": 21774453.0, "step": 226 }, { "epoch": 1.0460034502587694, "grad_norm": 0.014555993489921093, "learning_rate": 5.522642316338268e-06, "loss": 1.1434, "mean_token_accuracy": 0.6824417561292648, "num_tokens": 21868348.0, "step": 227 }, { "epoch": 1.0506037952846463, "grad_norm": 0.01433889102190733, "learning_rate": 5.482569604572577e-06, "loss": 1.1537, "mean_token_accuracy": 0.6790372729301453, "num_tokens": 21966335.0, "step": 228 }, { "epoch": 1.0552041403105232, "grad_norm": 0.016252966597676277, "learning_rate": 5.442465579556793e-06, "loss": 1.1674, "mean_token_accuracy": 0.6783912926912308, "num_tokens": 22058574.0, "step": 229 }, { "epoch": 1.0598044853364001, "grad_norm": 0.014194665476679802, "learning_rate": 5.402332843583631e-06, "loss": 1.1083, "mean_token_accuracy": 0.6893611028790474, "num_tokens": 22155600.0, "step": 230 }, { "epoch": 1.0644048303622773, "grad_norm": 0.014426385052502155, "learning_rate": 5.362174000808813e-06, "loss": 1.1122, "mean_token_accuracy": 0.6882274597883224, "num_tokens": 22245005.0, "step": 231 }, { "epoch": 1.0690051753881542, "grad_norm": 0.012664509005844593, "learning_rate": 5.3219916570820976e-06, "loss": 1.1259, "mean_token_accuracy": 0.6857394576072693, "num_tokens": 22346244.0, "step": 232 }, { "epoch": 1.0736055204140311, "grad_norm": 0.01445621158927679, "learning_rate": 5.281788419778187e-06, "loss": 1.1699, "mean_token_accuracy": 0.6760598793625832, "num_tokens": 22442082.0, "step": 233 }, { "epoch": 1.078205865439908, "grad_norm": 0.014202049933373928, "learning_rate": 5.241566897627536e-06, "loss": 1.15, "mean_token_accuracy": 0.6811029836535454, "num_tokens": 22535337.0, "step": 234 }, { "epoch": 1.082806210465785, "grad_norm": 0.01301807351410389, "learning_rate": 5.201329700547077e-06, "loss": 1.096, "mean_token_accuracy": 0.6926997303962708, "num_tokens": 22631641.0, "step": 235 }, { "epoch": 1.0874065554916619, "grad_norm": 0.015671228989958763, "learning_rate": 5.1610794394708665e-06, "loss": 1.1017, "mean_token_accuracy": 0.6929657682776451, "num_tokens": 22725983.0, "step": 236 }, { "epoch": 1.0920069005175388, "grad_norm": 0.012980216182768345, "learning_rate": 5.120818726180662e-06, "loss": 1.1607, "mean_token_accuracy": 0.6774906814098358, "num_tokens": 22827099.0, "step": 237 }, { "epoch": 1.0966072455434157, "grad_norm": 0.01648387499153614, "learning_rate": 5.080550173136457e-06, "loss": 1.1342, "mean_token_accuracy": 0.6835969239473343, "num_tokens": 22917405.0, "step": 238 }, { "epoch": 1.1012075905692926, "grad_norm": 0.014721757732331753, "learning_rate": 5.0402763933069496e-06, "loss": 1.1352, "mean_token_accuracy": 0.6829187944531441, "num_tokens": 23015436.0, "step": 239 }, { "epoch": 1.1058079355951695, "grad_norm": 0.014279097318649292, "learning_rate": 5e-06, "loss": 1.1392, "mean_token_accuracy": 0.6804762333631516, "num_tokens": 23111568.0, "step": 240 }, { "epoch": 1.1104082806210465, "grad_norm": 0.014015192165970802, "learning_rate": 4.959723606693051e-06, "loss": 1.1415, "mean_token_accuracy": 0.6824319586157799, "num_tokens": 23206977.0, "step": 241 }, { "epoch": 1.1150086256469236, "grad_norm": 0.014435522258281708, "learning_rate": 4.919449826863544e-06, "loss": 1.1419, "mean_token_accuracy": 0.6825414225459099, "num_tokens": 23303985.0, "step": 242 }, { "epoch": 1.1196089706728005, "grad_norm": 0.014449840411543846, "learning_rate": 4.87918127381934e-06, "loss": 1.1272, "mean_token_accuracy": 0.6874236464500427, "num_tokens": 23402646.0, "step": 243 }, { "epoch": 1.1242093156986774, "grad_norm": 0.012992781586945057, "learning_rate": 4.838920560529137e-06, "loss": 1.1556, "mean_token_accuracy": 0.6821000725030899, "num_tokens": 23501515.0, "step": 244 }, { "epoch": 1.1288096607245544, "grad_norm": 0.01294787134975195, "learning_rate": 4.798670299452926e-06, "loss": 1.1236, "mean_token_accuracy": 0.6848902404308319, "num_tokens": 23599557.0, "step": 245 }, { "epoch": 1.1334100057504313, "grad_norm": 0.014253921806812286, "learning_rate": 4.758433102372466e-06, "loss": 1.1115, "mean_token_accuracy": 0.6874924078583717, "num_tokens": 23692128.0, "step": 246 }, { "epoch": 1.1380103507763082, "grad_norm": 0.014446437358856201, "learning_rate": 4.718211580221813e-06, "loss": 1.0993, "mean_token_accuracy": 0.6906405836343765, "num_tokens": 23783395.0, "step": 247 }, { "epoch": 1.142610695802185, "grad_norm": 0.014871901832520962, "learning_rate": 4.678008342917903e-06, "loss": 1.1617, "mean_token_accuracy": 0.6774732172489166, "num_tokens": 23870895.0, "step": 248 }, { "epoch": 1.147211040828062, "grad_norm": 0.012906315736472607, "learning_rate": 4.637825999191189e-06, "loss": 1.1493, "mean_token_accuracy": 0.6792214959859848, "num_tokens": 23967222.0, "step": 249 }, { "epoch": 1.151811385853939, "grad_norm": 0.01403460931032896, "learning_rate": 4.597667156416371e-06, "loss": 1.1165, "mean_token_accuracy": 0.6873978450894356, "num_tokens": 24065684.0, "step": 250 }, { "epoch": 1.156411730879816, "grad_norm": 0.015156279318034649, "learning_rate": 4.557534420443209e-06, "loss": 1.1243, "mean_token_accuracy": 0.6890147104859352, "num_tokens": 24162258.0, "step": 251 }, { "epoch": 1.161012075905693, "grad_norm": 0.013031619600951672, "learning_rate": 4.517430395427424e-06, "loss": 1.1404, "mean_token_accuracy": 0.6832455694675446, "num_tokens": 24260436.0, "step": 252 }, { "epoch": 1.16561242093157, "grad_norm": 0.012547873891890049, "learning_rate": 4.477357683661734e-06, "loss": 1.1615, "mean_token_accuracy": 0.6788115128874779, "num_tokens": 24359066.0, "step": 253 }, { "epoch": 1.1702127659574468, "grad_norm": 0.012914301827549934, "learning_rate": 4.4373188854069736e-06, "loss": 1.1265, "mean_token_accuracy": 0.685889832675457, "num_tokens": 24455995.0, "step": 254 }, { "epoch": 1.1748131109833237, "grad_norm": 0.013518140651285648, "learning_rate": 4.397316598723385e-06, "loss": 1.1116, "mean_token_accuracy": 0.6878758445382118, "num_tokens": 24552992.0, "step": 255 }, { "epoch": 1.1794134560092007, "grad_norm": 0.014318661764264107, "learning_rate": 4.357353419302028e-06, "loss": 1.1223, "mean_token_accuracy": 0.6877824738621712, "num_tokens": 24650651.0, "step": 256 }, { "epoch": 1.1840138010350776, "grad_norm": 0.01345856860280037, "learning_rate": 4.3174319402963436e-06, "loss": 1.0991, "mean_token_accuracy": 0.6909112930297852, "num_tokens": 24746354.0, "step": 257 }, { "epoch": 1.1886141460609545, "grad_norm": 0.014836768619716167, "learning_rate": 4.277554752153895e-06, "loss": 1.1036, "mean_token_accuracy": 0.688332587480545, "num_tokens": 24839448.0, "step": 258 }, { "epoch": 1.1932144910868314, "grad_norm": 0.016939718276262283, "learning_rate": 4.237724442448273e-06, "loss": 1.1138, "mean_token_accuracy": 0.6888449415564537, "num_tokens": 24940763.0, "step": 259 }, { "epoch": 1.1978148361127086, "grad_norm": 0.014445330947637558, "learning_rate": 4.1979435957111984e-06, "loss": 1.1269, "mean_token_accuracy": 0.6845501437783241, "num_tokens": 25039359.0, "step": 260 }, { "epoch": 1.2024151811385855, "grad_norm": 0.014106119982898235, "learning_rate": 4.158214793264808e-06, "loss": 1.1223, "mean_token_accuracy": 0.6866239085793495, "num_tokens": 25135799.0, "step": 261 }, { "epoch": 1.2070155261644624, "grad_norm": 0.013844680972397327, "learning_rate": 4.118540613054155e-06, "loss": 1.1395, "mean_token_accuracy": 0.6820477023720741, "num_tokens": 25232039.0, "step": 262 }, { "epoch": 1.2116158711903393, "grad_norm": 0.014573228545486927, "learning_rate": 4.0789236294799425e-06, "loss": 1.1059, "mean_token_accuracy": 0.6888193562626839, "num_tokens": 25326856.0, "step": 263 }, { "epoch": 1.2162162162162162, "grad_norm": 0.014026801101863384, "learning_rate": 4.039366413231458e-06, "loss": 1.134, "mean_token_accuracy": 0.686940111219883, "num_tokens": 25422559.0, "step": 264 }, { "epoch": 1.2208165612420931, "grad_norm": 0.014971627853810787, "learning_rate": 3.999871531119779e-06, "loss": 1.111, "mean_token_accuracy": 0.6868948489427567, "num_tokens": 25515580.0, "step": 265 }, { "epoch": 1.22541690626797, "grad_norm": 0.014933711849153042, "learning_rate": 3.960441545911205e-06, "loss": 1.1362, "mean_token_accuracy": 0.6853025332093239, "num_tokens": 25611398.0, "step": 266 }, { "epoch": 1.230017251293847, "grad_norm": 0.014098069630563259, "learning_rate": 3.92107901616097e-06, "loss": 1.1326, "mean_token_accuracy": 0.6831789240241051, "num_tokens": 25703520.0, "step": 267 }, { "epoch": 1.234617596319724, "grad_norm": 0.013797523453831673, "learning_rate": 3.881786496047224e-06, "loss": 1.1414, "mean_token_accuracy": 0.6835273951292038, "num_tokens": 25802295.0, "step": 268 }, { "epoch": 1.239217941345601, "grad_norm": 0.013530906289815903, "learning_rate": 3.842566535205286e-06, "loss": 1.1197, "mean_token_accuracy": 0.68748340010643, "num_tokens": 25898232.0, "step": 269 }, { "epoch": 1.243818286371478, "grad_norm": 0.01218091044574976, "learning_rate": 3.803421678562213e-06, "loss": 1.1028, "mean_token_accuracy": 0.6864416226744652, "num_tokens": 25997971.0, "step": 270 }, { "epoch": 1.2484186313973549, "grad_norm": 0.014679036103188992, "learning_rate": 3.7643544661716518e-06, "loss": 1.1251, "mean_token_accuracy": 0.6866933032870293, "num_tokens": 26097320.0, "step": 271 }, { "epoch": 1.2530189764232318, "grad_norm": 0.013114512898027897, "learning_rate": 3.725367433049033e-06, "loss": 1.1231, "mean_token_accuracy": 0.6846908032894135, "num_tokens": 26193610.0, "step": 272 }, { "epoch": 1.2576193214491087, "grad_norm": 0.014116368256509304, "learning_rate": 3.6864631090070656e-06, "loss": 1.1065, "mean_token_accuracy": 0.6905641108751297, "num_tokens": 26290383.0, "step": 273 }, { "epoch": 1.2622196664749856, "grad_norm": 0.013729719445109367, "learning_rate": 3.6476440184915817e-06, "loss": 1.1274, "mean_token_accuracy": 0.6840422749519348, "num_tokens": 26386071.0, "step": 274 }, { "epoch": 1.2668200115008625, "grad_norm": 0.014113099314272404, "learning_rate": 3.6089126804177373e-06, "loss": 1.1206, "mean_token_accuracy": 0.6884650811553001, "num_tokens": 26480843.0, "step": 275 }, { "epoch": 1.2714203565267395, "grad_norm": 0.014033479616045952, "learning_rate": 3.5702716080065546e-06, "loss": 1.1163, "mean_token_accuracy": 0.6893876194953918, "num_tokens": 26581540.0, "step": 276 }, { "epoch": 1.2760207015526164, "grad_norm": 0.01345459371805191, "learning_rate": 3.5317233086218474e-06, "loss": 1.1634, "mean_token_accuracy": 0.6806627959012985, "num_tokens": 26677681.0, "step": 277 }, { "epoch": 1.2806210465784935, "grad_norm": 0.013448994606733322, "learning_rate": 3.4932702836075216e-06, "loss": 1.1117, "mean_token_accuracy": 0.6878006383776665, "num_tokens": 26776798.0, "step": 278 }, { "epoch": 1.2852213916043702, "grad_norm": 0.013521680608391762, "learning_rate": 3.4549150281252635e-06, "loss": 1.1758, "mean_token_accuracy": 0.6749053597450256, "num_tokens": 26871483.0, "step": 279 }, { "epoch": 1.2898217366302474, "grad_norm": 0.012783129699528217, "learning_rate": 3.416660030992639e-06, "loss": 1.1154, "mean_token_accuracy": 0.6897058337926865, "num_tokens": 26971553.0, "step": 280 }, { "epoch": 1.2944220816561243, "grad_norm": 0.013442179188132286, "learning_rate": 3.378507774521587e-06, "loss": 1.0993, "mean_token_accuracy": 0.6932654827833176, "num_tokens": 27072607.0, "step": 281 }, { "epoch": 1.2990224266820012, "grad_norm": 0.015558043494820595, "learning_rate": 3.340460734357359e-06, "loss": 1.136, "mean_token_accuracy": 0.6847696825861931, "num_tokens": 27166911.0, "step": 282 }, { "epoch": 1.303622771707878, "grad_norm": 0.01596686989068985, "learning_rate": 3.3025213793178647e-06, "loss": 1.1228, "mean_token_accuracy": 0.6864028871059418, "num_tokens": 27259171.0, "step": 283 }, { "epoch": 1.308223116733755, "grad_norm": 0.01548865344375372, "learning_rate": 3.2646921712334854e-06, "loss": 1.1259, "mean_token_accuracy": 0.6838768199086189, "num_tokens": 27355256.0, "step": 284 }, { "epoch": 1.312823461759632, "grad_norm": 0.014444452710449696, "learning_rate": 3.226975564787322e-06, "loss": 1.1387, "mean_token_accuracy": 0.6838934645056725, "num_tokens": 27456222.0, "step": 285 }, { "epoch": 1.3174238067855089, "grad_norm": 0.014634891413152218, "learning_rate": 3.189374007355917e-06, "loss": 1.1166, "mean_token_accuracy": 0.6879652291536331, "num_tokens": 27550974.0, "step": 286 }, { "epoch": 1.3220241518113858, "grad_norm": 0.01424104068428278, "learning_rate": 3.151889938850445e-06, "loss": 1.1484, "mean_token_accuracy": 0.6820650920271873, "num_tokens": 27647575.0, "step": 287 }, { "epoch": 1.3266244968372627, "grad_norm": 0.013483865186572075, "learning_rate": 3.114525791558398e-06, "loss": 1.1251, "mean_token_accuracy": 0.6878606304526329, "num_tokens": 27747320.0, "step": 288 }, { "epoch": 1.3312248418631398, "grad_norm": 0.014904686249792576, "learning_rate": 3.0772839899857465e-06, "loss": 1.1132, "mean_token_accuracy": 0.6881635338068008, "num_tokens": 27842613.0, "step": 289 }, { "epoch": 1.3358251868890167, "grad_norm": 0.013660099357366562, "learning_rate": 3.040166950699626e-06, "loss": 1.1404, "mean_token_accuracy": 0.6817925050854683, "num_tokens": 27940439.0, "step": 290 }, { "epoch": 1.3404255319148937, "grad_norm": 0.01384556945413351, "learning_rate": 3.0031770821715233e-06, "loss": 1.1322, "mean_token_accuracy": 0.681700274348259, "num_tokens": 28033868.0, "step": 291 }, { "epoch": 1.3450258769407706, "grad_norm": 0.015682250261306763, "learning_rate": 2.966316784621e-06, "loss": 1.1612, "mean_token_accuracy": 0.6785846799612045, "num_tokens": 28131730.0, "step": 292 }, { "epoch": 1.3496262219666475, "grad_norm": 0.01346894446760416, "learning_rate": 2.9295884498599415e-06, "loss": 1.0988, "mean_token_accuracy": 0.6885087415575981, "num_tokens": 28225656.0, "step": 293 }, { "epoch": 1.3542265669925244, "grad_norm": 0.013444703072309494, "learning_rate": 2.8929944611373555e-06, "loss": 1.1266, "mean_token_accuracy": 0.688482291996479, "num_tokens": 28317210.0, "step": 294 }, { "epoch": 1.3588269120184013, "grad_norm": 0.015197189524769783, "learning_rate": 2.8565371929847286e-06, "loss": 1.1024, "mean_token_accuracy": 0.6932826340198517, "num_tokens": 28411161.0, "step": 295 }, { "epoch": 1.3634272570442783, "grad_norm": 0.016413524746894836, "learning_rate": 2.820219011061949e-06, "loss": 1.1173, "mean_token_accuracy": 0.6866224035620689, "num_tokens": 28505045.0, "step": 296 }, { "epoch": 1.3680276020701552, "grad_norm": 0.013771053403615952, "learning_rate": 2.7840422720037943e-06, "loss": 1.1429, "mean_token_accuracy": 0.6815031543374062, "num_tokens": 28601874.0, "step": 297 }, { "epoch": 1.3726279470960323, "grad_norm": 0.015113587491214275, "learning_rate": 2.748009323267016e-06, "loss": 1.1238, "mean_token_accuracy": 0.6860849261283875, "num_tokens": 28696440.0, "step": 298 }, { "epoch": 1.3772282921219092, "grad_norm": 0.01364414393901825, "learning_rate": 2.712122502978024e-06, "loss": 1.1429, "mean_token_accuracy": 0.6800694912672043, "num_tokens": 28795256.0, "step": 299 }, { "epoch": 1.3818286371477861, "grad_norm": 0.013928713276982307, "learning_rate": 2.6763841397811576e-06, "loss": 1.1323, "mean_token_accuracy": 0.6844060495495796, "num_tokens": 28891471.0, "step": 300 }, { "epoch": 1.386428982173663, "grad_norm": 0.016008542850613594, "learning_rate": 2.64079655268759e-06, "loss": 1.1386, "mean_token_accuracy": 0.6828343719244003, "num_tokens": 28985187.0, "step": 301 }, { "epoch": 1.39102932719954, "grad_norm": 0.015067597851157188, "learning_rate": 2.605362050924848e-06, "loss": 1.138, "mean_token_accuracy": 0.6833794862031937, "num_tokens": 29077725.0, "step": 302 }, { "epoch": 1.395629672225417, "grad_norm": 0.016080757603049278, "learning_rate": 2.57008293378697e-06, "loss": 1.1304, "mean_token_accuracy": 0.6871781721711159, "num_tokens": 29173318.0, "step": 303 }, { "epoch": 1.4002300172512938, "grad_norm": 0.014263632707297802, "learning_rate": 2.534961490485313e-06, "loss": 1.1578, "mean_token_accuracy": 0.6787764355540276, "num_tokens": 29268879.0, "step": 304 }, { "epoch": 1.4048303622771707, "grad_norm": 0.01258003804832697, "learning_rate": 2.5000000000000015e-06, "loss": 1.1418, "mean_token_accuracy": 0.6824080869555473, "num_tokens": 29365800.0, "step": 305 }, { "epoch": 1.4094307073030476, "grad_norm": 0.015632053837180138, "learning_rate": 2.4652007309320497e-06, "loss": 1.1815, "mean_token_accuracy": 0.673783928155899, "num_tokens": 29460673.0, "step": 306 }, { "epoch": 1.4140310523289248, "grad_norm": 0.014565376564860344, "learning_rate": 2.430565941356157e-06, "loss": 1.1325, "mean_token_accuracy": 0.6849493682384491, "num_tokens": 29561748.0, "step": 307 }, { "epoch": 1.4186313973548015, "grad_norm": 0.013184985145926476, "learning_rate": 2.3960978786741878e-06, "loss": 1.1266, "mean_token_accuracy": 0.6847327277064323, "num_tokens": 29659815.0, "step": 308 }, { "epoch": 1.4232317423806786, "grad_norm": 0.01590883731842041, "learning_rate": 2.3617987794693358e-06, "loss": 1.1284, "mean_token_accuracy": 0.6860458254814148, "num_tokens": 29757215.0, "step": 309 }, { "epoch": 1.4278320874065555, "grad_norm": 0.014524009078741074, "learning_rate": 2.3276708693609947e-06, "loss": 1.1282, "mean_token_accuracy": 0.6843872591853142, "num_tokens": 29852193.0, "step": 310 }, { "epoch": 1.4324324324324325, "grad_norm": 0.014431421644985676, "learning_rate": 2.2937163628603437e-06, "loss": 1.1361, "mean_token_accuracy": 0.6860853359103203, "num_tokens": 29946647.0, "step": 311 }, { "epoch": 1.4370327774583094, "grad_norm": 0.01360079925507307, "learning_rate": 2.2599374632266514e-06, "loss": 1.1366, "mean_token_accuracy": 0.6804769262671471, "num_tokens": 30041785.0, "step": 312 }, { "epoch": 1.4416331224841863, "grad_norm": 0.014270540326833725, "learning_rate": 2.2263363623243058e-06, "loss": 1.1229, "mean_token_accuracy": 0.6883322149515152, "num_tokens": 30141703.0, "step": 313 }, { "epoch": 1.4462334675100632, "grad_norm": 0.01577930524945259, "learning_rate": 2.192915240480596e-06, "loss": 1.1315, "mean_token_accuracy": 0.6846339255571365, "num_tokens": 30236086.0, "step": 314 }, { "epoch": 1.4508338125359401, "grad_norm": 0.01702301762998104, "learning_rate": 2.159676266344222e-06, "loss": 1.1335, "mean_token_accuracy": 0.684619590640068, "num_tokens": 30338166.0, "step": 315 }, { "epoch": 1.4554341575618173, "grad_norm": 0.015012836083769798, "learning_rate": 2.1266215967445823e-06, "loss": 1.1356, "mean_token_accuracy": 0.6858243867754936, "num_tokens": 30435257.0, "step": 316 }, { "epoch": 1.460034502587694, "grad_norm": 0.014962634071707726, "learning_rate": 2.0937533765518187e-06, "loss": 1.1463, "mean_token_accuracy": 0.6821167767047882, "num_tokens": 30532225.0, "step": 317 }, { "epoch": 1.464634847613571, "grad_norm": 0.012999648228287697, "learning_rate": 2.061073738537635e-06, "loss": 1.0992, "mean_token_accuracy": 0.6904957070946693, "num_tokens": 30632883.0, "step": 318 }, { "epoch": 1.469235192639448, "grad_norm": 0.013315939344465733, "learning_rate": 2.028584803236914e-06, "loss": 1.1199, "mean_token_accuracy": 0.689661055803299, "num_tokens": 30728533.0, "step": 319 }, { "epoch": 1.473835537665325, "grad_norm": 0.015063401311635971, "learning_rate": 1.996288678810105e-06, "loss": 1.1339, "mean_token_accuracy": 0.6830965057015419, "num_tokens": 30823487.0, "step": 320 }, { "epoch": 1.4784358826912019, "grad_norm": 0.016178306192159653, "learning_rate": 1.9641874609064443e-06, "loss": 1.1068, "mean_token_accuracy": 0.6887371689081192, "num_tokens": 30916751.0, "step": 321 }, { "epoch": 1.4830362277170788, "grad_norm": 0.015641840174794197, "learning_rate": 1.9322832325279563e-06, "loss": 1.1464, "mean_token_accuracy": 0.6822967156767845, "num_tokens": 31010220.0, "step": 322 }, { "epoch": 1.4876365727429557, "grad_norm": 0.01568695902824402, "learning_rate": 1.9005780638942982e-06, "loss": 1.1169, "mean_token_accuracy": 0.6888584122061729, "num_tokens": 31102774.0, "step": 323 }, { "epoch": 1.4922369177688326, "grad_norm": 0.015229462645947933, "learning_rate": 1.8690740123084316e-06, "loss": 1.1639, "mean_token_accuracy": 0.6777781769633293, "num_tokens": 31197179.0, "step": 324 }, { "epoch": 1.4968372627947095, "grad_norm": 0.014780288562178612, "learning_rate": 1.8377731220231144e-06, "loss": 1.1229, "mean_token_accuracy": 0.6873270496726036, "num_tokens": 31289592.0, "step": 325 }, { "epoch": 1.5014376078205864, "grad_norm": 0.015464117750525475, "learning_rate": 1.8066774241082612e-06, "loss": 1.0989, "mean_token_accuracy": 0.6906232610344887, "num_tokens": 31388081.0, "step": 326 }, { "epoch": 1.5060379528464636, "grad_norm": 0.014275867491960526, "learning_rate": 1.7757889363191484e-06, "loss": 1.1497, "mean_token_accuracy": 0.6790970116853714, "num_tokens": 31482452.0, "step": 327 }, { "epoch": 1.5106382978723403, "grad_norm": 0.014304906129837036, "learning_rate": 1.7451096629654813e-06, "loss": 1.111, "mean_token_accuracy": 0.6866638660430908, "num_tokens": 31581779.0, "step": 328 }, { "epoch": 1.5152386428982174, "grad_norm": 0.014677311293780804, "learning_rate": 1.7146415947813472e-06, "loss": 1.1048, "mean_token_accuracy": 0.6891909688711166, "num_tokens": 31678876.0, "step": 329 }, { "epoch": 1.5198389879240943, "grad_norm": 0.013847602531313896, "learning_rate": 1.6843867087960252e-06, "loss": 1.1727, "mean_token_accuracy": 0.6768988743424416, "num_tokens": 31777929.0, "step": 330 }, { "epoch": 1.5244393329499712, "grad_norm": 0.015412612818181515, "learning_rate": 1.6543469682057105e-06, "loss": 1.1145, "mean_token_accuracy": 0.6917125135660172, "num_tokens": 31876162.0, "step": 331 }, { "epoch": 1.5290396779758482, "grad_norm": 0.012880155816674232, "learning_rate": 1.6245243222461198e-06, "loss": 1.1185, "mean_token_accuracy": 0.6893917471170425, "num_tokens": 31977070.0, "step": 332 }, { "epoch": 1.533640023001725, "grad_norm": 0.014607089571654797, "learning_rate": 1.5949207060660138e-06, "loss": 1.1254, "mean_token_accuracy": 0.6842816695570946, "num_tokens": 32070721.0, "step": 333 }, { "epoch": 1.5382403680276022, "grad_norm": 0.014117407612502575, "learning_rate": 1.5655380406016236e-06, "loss": 1.1336, "mean_token_accuracy": 0.6836338341236115, "num_tokens": 32163042.0, "step": 334 }, { "epoch": 1.542840713053479, "grad_norm": 0.013967139646410942, "learning_rate": 1.5363782324520033e-06, "loss": 1.1209, "mean_token_accuracy": 0.6864241659641266, "num_tokens": 32258782.0, "step": 335 }, { "epoch": 1.547441058079356, "grad_norm": 0.01426258496940136, "learning_rate": 1.5074431737553158e-06, "loss": 1.1433, "mean_token_accuracy": 0.6818135678768158, "num_tokens": 32351941.0, "step": 336 }, { "epoch": 1.5520414031052328, "grad_norm": 0.014212261885404587, "learning_rate": 1.4787347420660541e-06, "loss": 1.1589, "mean_token_accuracy": 0.6766619980335236, "num_tokens": 32447081.0, "step": 337 }, { "epoch": 1.55664174813111, "grad_norm": 0.017143219709396362, "learning_rate": 1.450254800233209e-06, "loss": 1.1048, "mean_token_accuracy": 0.6900773867964745, "num_tokens": 32540969.0, "step": 338 }, { "epoch": 1.5612420931569868, "grad_norm": 0.014866476878523827, "learning_rate": 1.4220051962793952e-06, "loss": 1.1518, "mean_token_accuracy": 0.682394802570343, "num_tokens": 32637119.0, "step": 339 }, { "epoch": 1.5658424381828637, "grad_norm": 0.013940082862973213, "learning_rate": 1.3939877632809279e-06, "loss": 1.1103, "mean_token_accuracy": 0.6884757280349731, "num_tokens": 32733583.0, "step": 340 }, { "epoch": 1.5704427832087406, "grad_norm": 0.01513680163770914, "learning_rate": 1.366204319248885e-06, "loss": 1.1401, "mean_token_accuracy": 0.6841761991381645, "num_tokens": 32831547.0, "step": 341 }, { "epoch": 1.5750431282346176, "grad_norm": 0.01321039255708456, "learning_rate": 1.3386566670111339e-06, "loss": 1.1051, "mean_token_accuracy": 0.6915635168552399, "num_tokens": 32932973.0, "step": 342 }, { "epoch": 1.5796434732604947, "grad_norm": 0.013876788318157196, "learning_rate": 1.3113465940953495e-06, "loss": 1.1363, "mean_token_accuracy": 0.6843502447009087, "num_tokens": 33030925.0, "step": 343 }, { "epoch": 1.5842438182863714, "grad_norm": 0.014943170361220837, "learning_rate": 1.2842758726130283e-06, "loss": 1.1179, "mean_token_accuracy": 0.6865890249609947, "num_tokens": 33125536.0, "step": 344 }, { "epoch": 1.5888441633122485, "grad_norm": 0.013300514779984951, "learning_rate": 1.257446259144494e-06, "loss": 1.1575, "mean_token_accuracy": 0.6767172366380692, "num_tokens": 33225737.0, "step": 345 }, { "epoch": 1.5934445083381252, "grad_norm": 0.01461979653686285, "learning_rate": 1.2308594946249163e-06, "loss": 1.1086, "mean_token_accuracy": 0.6917338967323303, "num_tokens": 33317585.0, "step": 346 }, { "epoch": 1.5980448533640024, "grad_norm": 0.015281404368579388, "learning_rate": 1.2045173042313429e-06, "loss": 1.1211, "mean_token_accuracy": 0.6883839294314384, "num_tokens": 33415173.0, "step": 347 }, { "epoch": 1.6026451983898793, "grad_norm": 0.01422287430614233, "learning_rate": 1.1784213972707581e-06, "loss": 1.125, "mean_token_accuracy": 0.6859614327549934, "num_tokens": 33509461.0, "step": 348 }, { "epoch": 1.6072455434157562, "grad_norm": 0.015178248286247253, "learning_rate": 1.1525734670691702e-06, "loss": 1.1305, "mean_token_accuracy": 0.6844439208507538, "num_tokens": 33603830.0, "step": 349 }, { "epoch": 1.6118458884416331, "grad_norm": 0.015206449665129185, "learning_rate": 1.1269751908617277e-06, "loss": 1.1145, "mean_token_accuracy": 0.6888925060629845, "num_tokens": 33696633.0, "step": 350 }, { "epoch": 1.61644623346751, "grad_norm": 0.014618100598454475, "learning_rate": 1.1016282296838887e-06, "loss": 1.0988, "mean_token_accuracy": 0.6908671483397484, "num_tokens": 33791601.0, "step": 351 }, { "epoch": 1.621046578493387, "grad_norm": 0.01533578522503376, "learning_rate": 1.0765342282636416e-06, "loss": 1.1244, "mean_token_accuracy": 0.6876219883561134, "num_tokens": 33888255.0, "step": 352 }, { "epoch": 1.6256469235192639, "grad_norm": 0.014407423324882984, "learning_rate": 1.0516948149147755e-06, "loss": 1.1467, "mean_token_accuracy": 0.6829477101564407, "num_tokens": 33982641.0, "step": 353 }, { "epoch": 1.630247268545141, "grad_norm": 0.015139218419790268, "learning_rate": 1.0271116014312293e-06, "loss": 1.1447, "mean_token_accuracy": 0.6811694651842117, "num_tokens": 34080372.0, "step": 354 }, { "epoch": 1.6348476135710177, "grad_norm": 0.014464878477156162, "learning_rate": 1.0027861829824953e-06, "loss": 1.1289, "mean_token_accuracy": 0.6872419267892838, "num_tokens": 34177100.0, "step": 355 }, { "epoch": 1.6394479585968948, "grad_norm": 0.013368290849030018, "learning_rate": 9.787201380101157e-07, "loss": 1.1615, "mean_token_accuracy": 0.6785909533500671, "num_tokens": 34277683.0, "step": 356 }, { "epoch": 1.6440483036227715, "grad_norm": 0.014261895790696144, "learning_rate": 9.549150281252633e-07, "loss": 1.13, "mean_token_accuracy": 0.6863186731934547, "num_tokens": 34374641.0, "step": 357 }, { "epoch": 1.6486486486486487, "grad_norm": 0.013263655826449394, "learning_rate": 9.313723980074018e-07, "loss": 1.1045, "mean_token_accuracy": 0.6919630914926529, "num_tokens": 34473009.0, "step": 358 }, { "epoch": 1.6532489936745256, "grad_norm": 0.01498090848326683, "learning_rate": 9.080937753040647e-07, "loss": 1.1229, "mean_token_accuracy": 0.6858481094241142, "num_tokens": 34569063.0, "step": 359 }, { "epoch": 1.6578493387004025, "grad_norm": 0.014527600258588791, "learning_rate": 8.850806705317183e-07, "loss": 1.145, "mean_token_accuracy": 0.6824858039617538, "num_tokens": 34663301.0, "step": 360 }, { "epoch": 1.6624496837262794, "grad_norm": 0.014273539185523987, "learning_rate": 8.623345769777514e-07, "loss": 1.0855, "mean_token_accuracy": 0.6919998005032539, "num_tokens": 34755484.0, "step": 361 }, { "epoch": 1.6670500287521564, "grad_norm": 0.014079663902521133, "learning_rate": 8.398569706035791e-07, "loss": 1.1314, "mean_token_accuracy": 0.685786284506321, "num_tokens": 34850202.0, "step": 362 }, { "epoch": 1.6716503737780335, "grad_norm": 0.015356908552348614, "learning_rate": 8.176493099488664e-07, "loss": 1.1421, "mean_token_accuracy": 0.6809604987502098, "num_tokens": 34946332.0, "step": 363 }, { "epoch": 1.6762507188039102, "grad_norm": 0.015410685911774635, "learning_rate": 7.957130360368898e-07, "loss": 1.1175, "mean_token_accuracy": 0.6878371834754944, "num_tokens": 35041587.0, "step": 364 }, { "epoch": 1.6808510638297873, "grad_norm": 0.016270428895950317, "learning_rate": 7.740495722810271e-07, "loss": 1.1735, "mean_token_accuracy": 0.6750294417142868, "num_tokens": 35139785.0, "step": 365 }, { "epoch": 1.685451408855664, "grad_norm": 0.015215057879686356, "learning_rate": 7.526603243923958e-07, "loss": 1.1524, "mean_token_accuracy": 0.6767367720603943, "num_tokens": 35235093.0, "step": 366 }, { "epoch": 1.6900517538815412, "grad_norm": 0.014159487560391426, "learning_rate": 7.315466802886401e-07, "loss": 1.1088, "mean_token_accuracy": 0.6886250227689743, "num_tokens": 35332416.0, "step": 367 }, { "epoch": 1.694652098907418, "grad_norm": 0.014062878675758839, "learning_rate": 7.107100100038672e-07, "loss": 1.1578, "mean_token_accuracy": 0.6797412261366844, "num_tokens": 35431910.0, "step": 368 }, { "epoch": 1.699252443933295, "grad_norm": 0.014110508374869823, "learning_rate": 6.901516655997536e-07, "loss": 1.1387, "mean_token_accuracy": 0.6830648630857468, "num_tokens": 35529803.0, "step": 369 }, { "epoch": 1.703852788959172, "grad_norm": 0.015163487754762173, "learning_rate": 6.698729810778065e-07, "loss": 1.1303, "mean_token_accuracy": 0.6845860555768013, "num_tokens": 35627791.0, "step": 370 }, { "epoch": 1.7084531339850488, "grad_norm": 0.012958538718521595, "learning_rate": 6.498752722928042e-07, "loss": 1.1231, "mean_token_accuracy": 0.6880553737282753, "num_tokens": 35722436.0, "step": 371 }, { "epoch": 1.713053479010926, "grad_norm": 0.014430136419832706, "learning_rate": 6.301598368674106e-07, "loss": 1.1245, "mean_token_accuracy": 0.6855921223759651, "num_tokens": 35819723.0, "step": 372 }, { "epoch": 1.7176538240368027, "grad_norm": 0.014730778522789478, "learning_rate": 6.107279541079769e-07, "loss": 1.1046, "mean_token_accuracy": 0.6905967816710472, "num_tokens": 35915276.0, "step": 373 }, { "epoch": 1.7222541690626798, "grad_norm": 0.014451798982918262, "learning_rate": 5.915808849215304e-07, "loss": 1.1047, "mean_token_accuracy": 0.6911017447710037, "num_tokens": 36008996.0, "step": 374 }, { "epoch": 1.7268545140885565, "grad_norm": 0.01583203487098217, "learning_rate": 5.727198717339511e-07, "loss": 1.107, "mean_token_accuracy": 0.6893082559108734, "num_tokens": 36103140.0, "step": 375 }, { "epoch": 1.7314548591144336, "grad_norm": 0.013766398653388023, "learning_rate": 5.541461384093549e-07, "loss": 1.1337, "mean_token_accuracy": 0.6845080852508545, "num_tokens": 36201738.0, "step": 376 }, { "epoch": 1.7360552041403106, "grad_norm": 0.0149979954585433, "learning_rate": 5.358608901706802e-07, "loss": 1.1454, "mean_token_accuracy": 0.6823095753788948, "num_tokens": 36300425.0, "step": 377 }, { "epoch": 1.7406555491661875, "grad_norm": 0.014548883773386478, "learning_rate": 5.178653135214811e-07, "loss": 1.1457, "mean_token_accuracy": 0.6806545779109001, "num_tokens": 36391644.0, "step": 378 }, { "epoch": 1.7452558941920644, "grad_norm": 0.013143756426870823, "learning_rate": 5.001605761689399e-07, "loss": 1.1443, "mean_token_accuracy": 0.6823921278119087, "num_tokens": 36492760.0, "step": 379 }, { "epoch": 1.7498562392179413, "grad_norm": 0.014462238177657127, "learning_rate": 4.827478269480895e-07, "loss": 1.1372, "mean_token_accuracy": 0.681210495531559, "num_tokens": 36588188.0, "step": 380 }, { "epoch": 1.7544565842438185, "grad_norm": 0.014685888774693012, "learning_rate": 4.6562819574727304e-07, "loss": 1.138, "mean_token_accuracy": 0.6838786154985428, "num_tokens": 36688704.0, "step": 381 }, { "epoch": 1.7590569292696951, "grad_norm": 0.01780293695628643, "learning_rate": 4.4880279343482713e-07, "loss": 1.1058, "mean_token_accuracy": 0.6894217655062675, "num_tokens": 36783354.0, "step": 382 }, { "epoch": 1.7636572742955723, "grad_norm": 0.014380701817572117, "learning_rate": 4.322727117869951e-07, "loss": 1.1325, "mean_token_accuracy": 0.6812404841184616, "num_tokens": 36883898.0, "step": 383 }, { "epoch": 1.768257619321449, "grad_norm": 0.01344380248337984, "learning_rate": 4.1603902341708804e-07, "loss": 1.1054, "mean_token_accuracy": 0.6925413459539413, "num_tokens": 36981882.0, "step": 384 }, { "epoch": 1.7728579643473261, "grad_norm": 0.0131448432803154, "learning_rate": 4.001027817058789e-07, "loss": 1.1081, "mean_token_accuracy": 0.6875624433159828, "num_tokens": 37079406.0, "step": 385 }, { "epoch": 1.777458309373203, "grad_norm": 0.014320706948637962, "learning_rate": 3.844650207332562e-07, "loss": 1.1185, "mean_token_accuracy": 0.6889297738671303, "num_tokens": 37174074.0, "step": 386 }, { "epoch": 1.78205865439908, "grad_norm": 0.015010056085884571, "learning_rate": 3.691267552111183e-07, "loss": 1.1738, "mean_token_accuracy": 0.6784838512539864, "num_tokens": 37274254.0, "step": 387 }, { "epoch": 1.7866589994249569, "grad_norm": 0.013940027914941311, "learning_rate": 3.54088980417534e-07, "loss": 1.1029, "mean_token_accuracy": 0.6877925917506218, "num_tokens": 37373486.0, "step": 388 }, { "epoch": 1.7912593444508338, "grad_norm": 0.016674095764756203, "learning_rate": 3.3935267213216163e-07, "loss": 1.1333, "mean_token_accuracy": 0.68411485850811, "num_tokens": 37470185.0, "step": 389 }, { "epoch": 1.7958596894767107, "grad_norm": 0.015059294179081917, "learning_rate": 3.2491878657292643e-07, "loss": 1.1164, "mean_token_accuracy": 0.6874109357595444, "num_tokens": 37563960.0, "step": 390 }, { "epoch": 1.8004600345025876, "grad_norm": 0.015169203281402588, "learning_rate": 3.1078826033397845e-07, "loss": 1.1202, "mean_token_accuracy": 0.6886393278837204, "num_tokens": 37662917.0, "step": 391 }, { "epoch": 1.8050603795284648, "grad_norm": 0.013790096156299114, "learning_rate": 2.9696201032491434e-07, "loss": 1.1368, "mean_token_accuracy": 0.6837680712342262, "num_tokens": 37753862.0, "step": 392 }, { "epoch": 1.8096607245543415, "grad_norm": 0.013124031946063042, "learning_rate": 2.834409337112842e-07, "loss": 1.1389, "mean_token_accuracy": 0.6866304948925972, "num_tokens": 37854261.0, "step": 393 }, { "epoch": 1.8142610695802186, "grad_norm": 0.015313307754695415, "learning_rate": 2.7022590785637406e-07, "loss": 1.1293, "mean_token_accuracy": 0.6882248967885971, "num_tokens": 37949798.0, "step": 394 }, { "epoch": 1.8188614146060953, "grad_norm": 0.016208309680223465, "learning_rate": 2.573177902642726e-07, "loss": 1.1332, "mean_token_accuracy": 0.6835260838270187, "num_tokens": 38046730.0, "step": 395 }, { "epoch": 1.8234617596319724, "grad_norm": 0.013482874259352684, "learning_rate": 2.447174185242324e-07, "loss": 1.088, "mean_token_accuracy": 0.6929525211453438, "num_tokens": 38142774.0, "step": 396 }, { "epoch": 1.8280621046578494, "grad_norm": 0.015274173580110073, "learning_rate": 2.3242561025631882e-07, "loss": 1.1542, "mean_token_accuracy": 0.6808317825198174, "num_tokens": 38239269.0, "step": 397 }, { "epoch": 1.8326624496837263, "grad_norm": 0.016665548086166382, "learning_rate": 2.204431630583548e-07, "loss": 1.1181, "mean_token_accuracy": 0.686672255396843, "num_tokens": 38335638.0, "step": 398 }, { "epoch": 1.8372627947096032, "grad_norm": 0.014923077076673508, "learning_rate": 2.0877085445416889e-07, "loss": 1.1016, "mean_token_accuracy": 0.690706379711628, "num_tokens": 38431268.0, "step": 399 }, { "epoch": 1.84186313973548, "grad_norm": 0.014740503393113613, "learning_rate": 1.9740944184313882e-07, "loss": 1.1428, "mean_token_accuracy": 0.6803831607103348, "num_tokens": 38524271.0, "step": 400 }, { "epoch": 1.8464634847613572, "grad_norm": 0.01503705233335495, "learning_rate": 1.8635966245104663e-07, "loss": 1.1378, "mean_token_accuracy": 0.6864303201436996, "num_tokens": 38617153.0, "step": 401 }, { "epoch": 1.851063829787234, "grad_norm": 0.014517681673169136, "learning_rate": 1.7562223328224327e-07, "loss": 1.1266, "mean_token_accuracy": 0.6875582709908485, "num_tokens": 38716205.0, "step": 402 }, { "epoch": 1.855664174813111, "grad_norm": 0.013916529715061188, "learning_rate": 1.651978510731189e-07, "loss": 1.1618, "mean_token_accuracy": 0.680492527782917, "num_tokens": 38816231.0, "step": 403 }, { "epoch": 1.8602645198389878, "grad_norm": 0.01476625818759203, "learning_rate": 1.5508719224689716e-07, "loss": 1.1313, "mean_token_accuracy": 0.6825379431247711, "num_tokens": 38915191.0, "step": 404 }, { "epoch": 1.864864864864865, "grad_norm": 0.01506135892122984, "learning_rate": 1.4529091286973994e-07, "loss": 1.1528, "mean_token_accuracy": 0.6801683902740479, "num_tokens": 39012971.0, "step": 405 }, { "epoch": 1.8694652098907418, "grad_norm": 0.01537392009049654, "learning_rate": 1.358096486081778e-07, "loss": 1.1495, "mean_token_accuracy": 0.6829325184226036, "num_tokens": 39109365.0, "step": 406 }, { "epoch": 1.8740655549166187, "grad_norm": 0.014476312324404716, "learning_rate": 1.2664401468786114e-07, "loss": 1.1271, "mean_token_accuracy": 0.6879825815558434, "num_tokens": 39202764.0, "step": 407 }, { "epoch": 1.8786658999424957, "grad_norm": 0.01422926690429449, "learning_rate": 1.1779460585363945e-07, "loss": 1.1463, "mean_token_accuracy": 0.6799934059381485, "num_tokens": 39297379.0, "step": 408 }, { "epoch": 1.8832662449683726, "grad_norm": 0.014644317328929901, "learning_rate": 1.0926199633097156e-07, "loss": 1.1222, "mean_token_accuracy": 0.6866084560751915, "num_tokens": 39389572.0, "step": 409 }, { "epoch": 1.8878665899942497, "grad_norm": 0.014122752472758293, "learning_rate": 1.0104673978866164e-07, "loss": 1.1297, "mean_token_accuracy": 0.687385693192482, "num_tokens": 39487297.0, "step": 410 }, { "epoch": 1.8924669350201264, "grad_norm": 0.014691289514303207, "learning_rate": 9.314936930293283e-08, "loss": 1.1637, "mean_token_accuracy": 0.6754296645522118, "num_tokens": 39581833.0, "step": 411 }, { "epoch": 1.8970672800460036, "grad_norm": 0.016847725957632065, "learning_rate": 8.557039732283945e-08, "loss": 1.09, "mean_token_accuracy": 0.6946672350168228, "num_tokens": 39678219.0, "step": 412 }, { "epoch": 1.9016676250718803, "grad_norm": 0.014185824431478977, "learning_rate": 7.831031563701131e-08, "loss": 1.1357, "mean_token_accuracy": 0.6832516267895699, "num_tokens": 39774070.0, "step": 413 }, { "epoch": 1.9062679700977574, "grad_norm": 0.01294031459838152, "learning_rate": 7.136959534174592e-08, "loss": 1.115, "mean_token_accuracy": 0.6877038702368736, "num_tokens": 39872679.0, "step": 414 }, { "epoch": 1.9108683151236343, "grad_norm": 0.01454690657556057, "learning_rate": 6.474868681043578e-08, "loss": 1.124, "mean_token_accuracy": 0.6823562011122704, "num_tokens": 39968778.0, "step": 415 }, { "epoch": 1.9154686601495112, "grad_norm": 0.014392836950719357, "learning_rate": 5.844801966434832e-08, "loss": 1.1087, "mean_token_accuracy": 0.6888928934931755, "num_tokens": 40063775.0, "step": 416 }, { "epoch": 1.9200690051753881, "grad_norm": 0.014324750751256943, "learning_rate": 5.246800274474439e-08, "loss": 1.0951, "mean_token_accuracy": 0.6892815381288528, "num_tokens": 40160271.0, "step": 417 }, { "epoch": 1.924669350201265, "grad_norm": 0.014842728152871132, "learning_rate": 4.680902408635335e-08, "loss": 1.1024, "mean_token_accuracy": 0.6918300613760948, "num_tokens": 40261319.0, "step": 418 }, { "epoch": 1.9292696952271422, "grad_norm": 0.014851558022201061, "learning_rate": 4.147145089218985e-08, "loss": 1.1159, "mean_token_accuracy": 0.6875586584210396, "num_tokens": 40358248.0, "step": 419 }, { "epoch": 1.933870040253019, "grad_norm": 0.01473570428788662, "learning_rate": 3.645562950973014e-08, "loss": 1.1382, "mean_token_accuracy": 0.6858562529087067, "num_tokens": 40457606.0, "step": 420 }, { "epoch": 1.938470385278896, "grad_norm": 0.013431058265268803, "learning_rate": 3.1761885408435055e-08, "loss": 1.0909, "mean_token_accuracy": 0.695126011967659, "num_tokens": 40556693.0, "step": 421 }, { "epoch": 1.9430707303047727, "grad_norm": 0.014296426437795162, "learning_rate": 2.7390523158633552e-08, "loss": 1.1435, "mean_token_accuracy": 0.684424415230751, "num_tokens": 40648892.0, "step": 422 }, { "epoch": 1.9476710753306499, "grad_norm": 0.015391189604997635, "learning_rate": 2.3341826411756863e-08, "loss": 1.1361, "mean_token_accuracy": 0.6864252239465714, "num_tokens": 40745057.0, "step": 423 }, { "epoch": 1.9522714203565268, "grad_norm": 0.014759673736989498, "learning_rate": 1.9616057881935436e-08, "loss": 1.1287, "mean_token_accuracy": 0.6864694356918335, "num_tokens": 40840174.0, "step": 424 }, { "epoch": 1.9568717653824037, "grad_norm": 0.014287742786109447, "learning_rate": 1.6213459328950355e-08, "loss": 1.1394, "mean_token_accuracy": 0.6858852058649063, "num_tokens": 40933861.0, "step": 425 }, { "epoch": 1.9614721104082806, "grad_norm": 0.015595638193190098, "learning_rate": 1.3134251542544774e-08, "loss": 1.1298, "mean_token_accuracy": 0.6829616725444794, "num_tokens": 41032425.0, "step": 426 }, { "epoch": 1.9660724554341575, "grad_norm": 0.014190633781254292, "learning_rate": 1.0378634328099268e-08, "loss": 1.1347, "mean_token_accuracy": 0.6856722384691238, "num_tokens": 41127692.0, "step": 427 }, { "epoch": 1.9706728004600345, "grad_norm": 0.016822172328829765, "learning_rate": 7.946786493666647e-09, "loss": 1.123, "mean_token_accuracy": 0.6841925904154778, "num_tokens": 41220510.0, "step": 428 }, { "epoch": 1.9752731454859114, "grad_norm": 0.01764860562980175, "learning_rate": 5.838865838366792e-09, "loss": 1.1343, "mean_token_accuracy": 0.6837752312421799, "num_tokens": 41312473.0, "step": 429 }, { "epoch": 1.9798734905117885, "grad_norm": 0.01497281901538372, "learning_rate": 4.055009142152066e-09, "loss": 1.1392, "mean_token_accuracy": 0.6823102980852127, "num_tokens": 41405730.0, "step": 430 }, { "epoch": 1.9844738355376652, "grad_norm": 0.015005367808043957, "learning_rate": 2.595332156925534e-09, "loss": 1.1139, "mean_token_accuracy": 0.6865201741456985, "num_tokens": 41503861.0, "step": 431 }, { "epoch": 1.9890741805635423, "grad_norm": 0.015820927917957306, "learning_rate": 1.4599295990352924e-09, "loss": 1.1206, "mean_token_accuracy": 0.688090018928051, "num_tokens": 41599729.0, "step": 432 }, { "epoch": 1.993674525589419, "grad_norm": 0.014639221131801605, "learning_rate": 6.488751431266149e-10, "loss": 1.1003, "mean_token_accuracy": 0.6921690627932549, "num_tokens": 41699246.0, "step": 433 }, { "epoch": 1.9982748706152962, "grad_norm": 0.014356461353600025, "learning_rate": 1.622214173602199e-10, "loss": 1.1363, "mean_token_accuracy": 0.6814094483852386, "num_tokens": 41800821.0, "step": 434 } ], "logging_steps": 1, "max_steps": 434, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.765793490454184e+18, "train_batch_size": 8, "trial_name": null, "trial_params": null }