{ "best_global_step": 1600, "best_metric": 0.8140835165977478, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_ours-luca_ffn_only_5ep/checkpoint-1600", "epoch": 5.0, "eval_steps": 100, "global_step": 4280, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.7990853235125541, "epoch": 0.01168736303871439, "grad_norm": 2.2411153316497803, "learning_rate": 1.3953488372093025e-06, "loss": 2.221370887756348, "mean_token_accuracy": 0.4454644417390227, "num_tokens": 90886.0, "step": 10 }, { "entropy": 1.7851194575428964, "epoch": 0.02337472607742878, "grad_norm": 5.774791240692139, "learning_rate": 2.9457364341085276e-06, "loss": 2.287215232849121, "mean_token_accuracy": 0.4802763115614653, "num_tokens": 193261.0, "step": 20 }, { "entropy": 1.8645276561379434, "epoch": 0.03506208911614317, "grad_norm": 1.2933292388916016, "learning_rate": 4.4961240310077525e-06, "loss": 2.0796104431152345, "mean_token_accuracy": 0.5051111107692122, "num_tokens": 311331.0, "step": 30 }, { "entropy": 1.8436205610632896, "epoch": 0.04674945215485756, "grad_norm": 5.532759666442871, "learning_rate": 6.046511627906977e-06, "loss": 2.019709587097168, "mean_token_accuracy": 0.48441268149763345, "num_tokens": 400148.0, "step": 40 }, { "entropy": 1.828799621760845, "epoch": 0.05843681519357195, "grad_norm": 4.328863620758057, "learning_rate": 7.596899224806202e-06, "loss": 1.6759492874145507, "mean_token_accuracy": 0.6234621474519372, "num_tokens": 524126.0, "step": 50 }, { "entropy": 1.9845396891236304, "epoch": 0.07012417823228634, "grad_norm": 4.902604579925537, "learning_rate": 9.147286821705427e-06, "loss": 1.6193151473999023, "mean_token_accuracy": 0.6227478144690395, "num_tokens": 604582.0, "step": 60 }, { "entropy": 2.1635267987847326, "epoch": 0.08181154127100074, "grad_norm": 1.8905808925628662, "learning_rate": 1.0697674418604651e-05, "loss": 1.7636125564575196, "mean_token_accuracy": 0.6229628790169954, "num_tokens": 690297.0, "step": 70 }, { "entropy": 2.20285327732563, "epoch": 0.09349890430971512, "grad_norm": 3.2167978286743164, "learning_rate": 1.2248062015503876e-05, "loss": 1.7089515686035157, "mean_token_accuracy": 0.6355361180379987, "num_tokens": 797131.0, "step": 80 }, { "entropy": 2.164117117226124, "epoch": 0.10518626734842951, "grad_norm": 1.2573010921478271, "learning_rate": 1.3798449612403102e-05, "loss": 1.563762092590332, "mean_token_accuracy": 0.6375745143741369, "num_tokens": 877794.0, "step": 90 }, { "entropy": 2.1955269888043403, "epoch": 0.1168736303871439, "grad_norm": 1.4883538484573364, "learning_rate": 1.5348837209302328e-05, "loss": 1.5268404960632325, "mean_token_accuracy": 0.6866611793637276, "num_tokens": 964357.0, "step": 100 }, { "epoch": 0.1168736303871439, "eval_entropy": 2.211864855606109, "eval_loss": 0.972606360912323, "eval_mean_token_accuracy": 0.7656966285430826, "eval_num_tokens": 964357.0, "eval_runtime": 25.7541, "eval_samples_per_second": 19.88, "eval_steps_per_second": 9.94, "step": 100 }, { "entropy": 2.14595272988081, "epoch": 0.12856099342585828, "grad_norm": 3.258664846420288, "learning_rate": 1.689922480620155e-05, "loss": 1.5449288368225098, "mean_token_accuracy": 0.692005117610097, "num_tokens": 1051056.0, "step": 110 }, { "entropy": 2.13690192848444, "epoch": 0.14024835646457268, "grad_norm": 3.329728841781616, "learning_rate": 1.8449612403100777e-05, "loss": 1.714167022705078, "mean_token_accuracy": 0.6207397798076272, "num_tokens": 1139127.0, "step": 120 }, { "entropy": 2.2397685661911964, "epoch": 0.15193571950328708, "grad_norm": 3.1570706367492676, "learning_rate": 2e-05, "loss": 1.4322842597961425, "mean_token_accuracy": 0.6956309005618095, "num_tokens": 1205809.0, "step": 130 }, { "entropy": 2.1315575197339056, "epoch": 0.16362308254200147, "grad_norm": 1.8168814182281494, "learning_rate": 1.99997136071245e-05, "loss": 1.304494285583496, "mean_token_accuracy": 0.6879714308306575, "num_tokens": 1313591.0, "step": 140 }, { "entropy": 2.2233649238944055, "epoch": 0.17531044558071585, "grad_norm": 0.8144795894622803, "learning_rate": 1.999885444490217e-05, "loss": 1.3845972061157226, "mean_token_accuracy": 0.6910346703603863, "num_tokens": 1412866.0, "step": 150 }, { "entropy": 2.1577580630779267, "epoch": 0.18699780861943024, "grad_norm": 1.940482258796692, "learning_rate": 1.9997422562544592e-05, "loss": 1.390633773803711, "mean_token_accuracy": 0.6759929563850164, "num_tokens": 1508013.0, "step": 160 }, { "entropy": 2.083321948349476, "epoch": 0.19868517165814464, "grad_norm": 3.6317291259765625, "learning_rate": 1.9995418042067957e-05, "loss": 1.2338299751281738, "mean_token_accuracy": 0.7018413636833429, "num_tokens": 1596613.0, "step": 170 }, { "entropy": 2.053264130651951, "epoch": 0.21037253469685901, "grad_norm": 2.9840128421783447, "learning_rate": 1.9992840998288338e-05, "loss": 1.5092729568481444, "mean_token_accuracy": 0.6634657958522439, "num_tokens": 1705162.0, "step": 180 }, { "entropy": 2.105809884518385, "epoch": 0.2220598977355734, "grad_norm": 2.120786428451538, "learning_rate": 1.9989691578815128e-05, "loss": 1.3493456840515137, "mean_token_accuracy": 0.6496284365653991, "num_tokens": 1772797.0, "step": 190 }, { "entropy": 2.2239570677280427, "epoch": 0.2337472607742878, "grad_norm": 0.7451742887496948, "learning_rate": 1.998596996404259e-05, "loss": 1.510793972015381, "mean_token_accuracy": 0.6867920899763703, "num_tokens": 1858310.0, "step": 200 }, { "epoch": 0.2337472607742878, "eval_entropy": 2.113139286637306, "eval_loss": 0.9217231273651123, "eval_mean_token_accuracy": 0.7753882835968398, "eval_num_tokens": 1858310.0, "eval_runtime": 25.7918, "eval_samples_per_second": 19.851, "eval_steps_per_second": 9.926, "step": 200 }, { "entropy": 2.0635509312152864, "epoch": 0.24543462381300218, "grad_norm": 2.845130681991577, "learning_rate": 1.9981676367139516e-05, "loss": 1.42849702835083, "mean_token_accuracy": 0.6870072908699513, "num_tokens": 1949074.0, "step": 210 }, { "entropy": 2.148236308991909, "epoch": 0.25712198685171656, "grad_norm": 1.786993145942688, "learning_rate": 1.9976811034037018e-05, "loss": 1.3782122611999512, "mean_token_accuracy": 0.6854639150202274, "num_tokens": 2034492.0, "step": 220 }, { "entropy": 2.029401682317257, "epoch": 0.268809349890431, "grad_norm": 2.152838706970215, "learning_rate": 1.9971374243414442e-05, "loss": 1.4339065551757812, "mean_token_accuracy": 0.6851927833631635, "num_tokens": 2120329.0, "step": 230 }, { "entropy": 2.187216105312109, "epoch": 0.28049671292914535, "grad_norm": 4.411855220794678, "learning_rate": 1.9965366306683407e-05, "loss": 1.5027010917663575, "mean_token_accuracy": 0.6676396857947111, "num_tokens": 2183929.0, "step": 240 }, { "entropy": 2.066372972726822, "epoch": 0.2921840759678597, "grad_norm": 2.8336033821105957, "learning_rate": 1.995878756796997e-05, "loss": 1.3935389518737793, "mean_token_accuracy": 0.7052215587347745, "num_tokens": 2271714.0, "step": 250 }, { "entropy": 2.146583802998066, "epoch": 0.30387143900657415, "grad_norm": 1.979851245880127, "learning_rate": 1.9951638404094914e-05, "loss": 1.4767843246459962, "mean_token_accuracy": 0.6532610202208161, "num_tokens": 2370958.0, "step": 260 }, { "entropy": 2.0532761082053184, "epoch": 0.3155588020452885, "grad_norm": 2.413297176361084, "learning_rate": 1.9943919224552154e-05, "loss": 1.4167465209960937, "mean_token_accuracy": 0.6672960091382265, "num_tokens": 2489860.0, "step": 270 }, { "entropy": 2.123379871249199, "epoch": 0.32724616508400295, "grad_norm": 3.317007541656494, "learning_rate": 1.9935630471485293e-05, "loss": 1.5103903770446778, "mean_token_accuracy": 0.6566739233210683, "num_tokens": 2582123.0, "step": 280 }, { "entropy": 2.0638687670230866, "epoch": 0.3389335281227173, "grad_norm": 3.5680251121520996, "learning_rate": 1.99267726196623e-05, "loss": 1.6115623474121095, "mean_token_accuracy": 0.6871760074049235, "num_tokens": 2689776.0, "step": 290 }, { "entropy": 2.124503730237484, "epoch": 0.3506208911614317, "grad_norm": 1.3090689182281494, "learning_rate": 1.9917346176448312e-05, "loss": 1.3552765846252441, "mean_token_accuracy": 0.6656280636787415, "num_tokens": 2795637.0, "step": 300 }, { "epoch": 0.3506208911614317, "eval_entropy": 2.1001131371594965, "eval_loss": 0.9286051988601685, "eval_mean_token_accuracy": 0.7654476343886927, "eval_num_tokens": 2795637.0, "eval_runtime": 25.7115, "eval_samples_per_second": 19.913, "eval_steps_per_second": 9.957, "step": 300 }, { "entropy": 2.0987854704260824, "epoch": 0.3623082542001461, "grad_norm": 2.1889779567718506, "learning_rate": 1.990735168177655e-05, "loss": 1.4275793075561523, "mean_token_accuracy": 0.6943906715139747, "num_tokens": 2895858.0, "step": 310 }, { "entropy": 2.1431354597210883, "epoch": 0.3739956172388605, "grad_norm": 3.8745343685150146, "learning_rate": 1.9896789708117442e-05, "loss": 1.5244775772094727, "mean_token_accuracy": 0.6774675730615854, "num_tokens": 2973005.0, "step": 320 }, { "entropy": 2.036357672512531, "epoch": 0.38568298027757486, "grad_norm": 3.4766616821289062, "learning_rate": 1.988566086044578e-05, "loss": 1.2670412063598633, "mean_token_accuracy": 0.6847519468516111, "num_tokens": 3068261.0, "step": 330 }, { "entropy": 2.040398380160332, "epoch": 0.3973703433162893, "grad_norm": 2.0919291973114014, "learning_rate": 1.9873965776206103e-05, "loss": 1.2989651679992675, "mean_token_accuracy": 0.7239908363670111, "num_tokens": 3161452.0, "step": 340 }, { "entropy": 2.0912220269441604, "epoch": 0.40905770635500366, "grad_norm": 2.9482905864715576, "learning_rate": 1.9861705125276173e-05, "loss": 1.5268967628479004, "mean_token_accuracy": 0.6429461358115077, "num_tokens": 3240838.0, "step": 350 }, { "entropy": 2.08566821962595, "epoch": 0.42074506939371803, "grad_norm": 3.328305721282959, "learning_rate": 1.9848879609928606e-05, "loss": 1.4985569953918456, "mean_token_accuracy": 0.6740516029298306, "num_tokens": 3343139.0, "step": 360 }, { "entropy": 2.0485661208629606, "epoch": 0.43243243243243246, "grad_norm": 2.752358913421631, "learning_rate": 1.9835489964790646e-05, "loss": 1.4463869094848634, "mean_token_accuracy": 0.6743310626596213, "num_tokens": 3488879.0, "step": 370 }, { "entropy": 2.098214092850685, "epoch": 0.4441197954711468, "grad_norm": 2.8611302375793457, "learning_rate": 1.9821536956802087e-05, "loss": 1.2331249237060546, "mean_token_accuracy": 0.6835227191448212, "num_tokens": 3580970.0, "step": 380 }, { "entropy": 2.0741601526737212, "epoch": 0.4558071585098612, "grad_norm": 2.8654325008392334, "learning_rate": 1.9807021385171342e-05, "loss": 1.4935486793518067, "mean_token_accuracy": 0.6689293952658772, "num_tokens": 3685521.0, "step": 390 }, { "entropy": 2.0226009979844095, "epoch": 0.4674945215485756, "grad_norm": 2.5369250774383545, "learning_rate": 1.979194408132968e-05, "loss": 1.4667850494384767, "mean_token_accuracy": 0.6739391122013331, "num_tokens": 3777526.0, "step": 400 }, { "epoch": 0.4674945215485756, "eval_entropy": 2.0862251897342503, "eval_loss": 0.8904886841773987, "eval_mean_token_accuracy": 0.7775540838483721, "eval_num_tokens": 3777526.0, "eval_runtime": 25.7601, "eval_samples_per_second": 19.876, "eval_steps_per_second": 9.938, "step": 400 }, { "entropy": 2.0925071969628335, "epoch": 0.47918188458729, "grad_norm": 2.5446367263793945, "learning_rate": 1.977630590888357e-05, "loss": 1.2959745407104493, "mean_token_accuracy": 0.6557210482656955, "num_tokens": 3887532.0, "step": 410 }, { "entropy": 2.0614023089408873, "epoch": 0.49086924762600437, "grad_norm": 2.8507156372070312, "learning_rate": 1.9760107763565253e-05, "loss": 1.6900123596191405, "mean_token_accuracy": 0.6901388188824058, "num_tokens": 3981875.0, "step": 420 }, { "entropy": 2.07640870064497, "epoch": 0.5025566106647188, "grad_norm": 3.148797035217285, "learning_rate": 1.974335057318141e-05, "loss": 1.308906650543213, "mean_token_accuracy": 0.7089092643931508, "num_tokens": 4130771.0, "step": 430 }, { "entropy": 2.093033117055893, "epoch": 0.5142439737034331, "grad_norm": 5.219605445861816, "learning_rate": 1.972603529756003e-05, "loss": 1.4210287094116212, "mean_token_accuracy": 0.6731326477602124, "num_tokens": 4205874.0, "step": 440 }, { "entropy": 2.074295262992382, "epoch": 0.5259313367421475, "grad_norm": 1.5453256368637085, "learning_rate": 1.9708162928495428e-05, "loss": 1.4468173027038573, "mean_token_accuracy": 0.6713122161105275, "num_tokens": 4305278.0, "step": 450 }, { "entropy": 2.07851143181324, "epoch": 0.537618699780862, "grad_norm": 3.1280317306518555, "learning_rate": 1.968973448969144e-05, "loss": 1.5542386054992676, "mean_token_accuracy": 0.6788748688995838, "num_tokens": 4400820.0, "step": 460 }, { "entropy": 2.1338010519742965, "epoch": 0.5493060628195763, "grad_norm": 1.1596672534942627, "learning_rate": 1.967075103670278e-05, "loss": 1.180473232269287, "mean_token_accuracy": 0.7129562532529234, "num_tokens": 4507701.0, "step": 470 }, { "entropy": 2.09687916636467, "epoch": 0.5609934258582907, "grad_norm": 0.918991208076477, "learning_rate": 1.965121365687458e-05, "loss": 1.3882193565368652, "mean_token_accuracy": 0.696927659586072, "num_tokens": 4595440.0, "step": 480 }, { "entropy": 2.0941593036055566, "epoch": 0.5726807888970051, "grad_norm": 5.741567611694336, "learning_rate": 1.9631123469280128e-05, "loss": 1.4642065048217774, "mean_token_accuracy": 0.677471567876637, "num_tokens": 4663837.0, "step": 490 }, { "entropy": 2.0082775235176085, "epoch": 0.5843681519357194, "grad_norm": 2.512613534927368, "learning_rate": 1.9610481624656735e-05, "loss": 1.3735533714294434, "mean_token_accuracy": 0.7022612497210503, "num_tokens": 4763735.0, "step": 500 }, { "epoch": 0.5843681519357194, "eval_entropy": 2.0894607109948993, "eval_loss": 0.8765641450881958, "eval_mean_token_accuracy": 0.7788096551084891, "eval_num_tokens": 4763735.0, "eval_runtime": 25.7469, "eval_samples_per_second": 19.886, "eval_steps_per_second": 9.943, "step": 500 }, { "entropy": 2.1692290902137756, "epoch": 0.5960555149744339, "grad_norm": 6.56488561630249, "learning_rate": 1.9589289305339855e-05, "loss": 1.4895523071289063, "mean_token_accuracy": 0.6608639808371664, "num_tokens": 4844090.0, "step": 510 }, { "entropy": 2.1281642124056814, "epoch": 0.6077428780131483, "grad_norm": 3.018589496612549, "learning_rate": 1.9567547725195332e-05, "loss": 1.4966270446777343, "mean_token_accuracy": 0.6484380099922419, "num_tokens": 4920491.0, "step": 520 }, { "entropy": 2.1243520259857176, "epoch": 0.6194302410518627, "grad_norm": 2.680955171585083, "learning_rate": 1.9545258129549907e-05, "loss": 1.2731698036193848, "mean_token_accuracy": 0.7167170716449618, "num_tokens": 5009099.0, "step": 530 }, { "entropy": 2.12062511742115, "epoch": 0.631117604090577, "grad_norm": 3.617501735687256, "learning_rate": 1.9522421795119855e-05, "loss": 1.3531126022338866, "mean_token_accuracy": 0.6790495140478015, "num_tokens": 5100209.0, "step": 540 }, { "entropy": 2.0695104882121087, "epoch": 0.6428049671292915, "grad_norm": 5.214684963226318, "learning_rate": 1.949904002993787e-05, "loss": 1.3848544120788575, "mean_token_accuracy": 0.7135015401989222, "num_tokens": 5231468.0, "step": 550 }, { "entropy": 2.0666969910264017, "epoch": 0.6544923301680059, "grad_norm": 4.319680213928223, "learning_rate": 1.9475114173278148e-05, "loss": 1.3690484046936036, "mean_token_accuracy": 0.7302774161100387, "num_tokens": 5300693.0, "step": 560 }, { "entropy": 2.1146800026297567, "epoch": 0.6661796932067202, "grad_norm": 3.780644416809082, "learning_rate": 1.9450645595579666e-05, "loss": 1.179710865020752, "mean_token_accuracy": 0.7273235905915498, "num_tokens": 5401557.0, "step": 570 }, { "entropy": 2.043177145719528, "epoch": 0.6778670562454346, "grad_norm": 6.6399455070495605, "learning_rate": 1.942563569836769e-05, "loss": 1.2141715049743653, "mean_token_accuracy": 0.7330090440809727, "num_tokens": 5496384.0, "step": 580 }, { "entropy": 2.010530972480774, "epoch": 0.6895544192841491, "grad_norm": 3.6415085792541504, "learning_rate": 1.940008591417349e-05, "loss": 1.2549325942993164, "mean_token_accuracy": 0.70234549716115, "num_tokens": 5561552.0, "step": 590 }, { "entropy": 1.9972407937049865, "epoch": 0.7012417823228634, "grad_norm": 5.336333751678467, "learning_rate": 1.9373997706452305e-05, "loss": 1.350644016265869, "mean_token_accuracy": 0.6650068024173379, "num_tokens": 5658665.0, "step": 600 }, { "epoch": 0.7012417823228634, "eval_entropy": 2.0355248344130814, "eval_loss": 0.8769533634185791, "eval_mean_token_accuracy": 0.7799202160676941, "eval_num_tokens": 5658665.0, "eval_runtime": 25.7308, "eval_samples_per_second": 19.898, "eval_steps_per_second": 9.949, "step": 600 }, { "entropy": 2.0349276438355446, "epoch": 0.7129291453615778, "grad_norm": 1.1815351247787476, "learning_rate": 1.93473725694995e-05, "loss": 1.2075778007507325, "mean_token_accuracy": 0.6925472240895033, "num_tokens": 5788127.0, "step": 610 }, { "entropy": 2.1003061309456825, "epoch": 0.7246165084002922, "grad_norm": 3.3525731563568115, "learning_rate": 1.9320212028364976e-05, "loss": 1.3541041374206544, "mean_token_accuracy": 0.6942416787147522, "num_tokens": 5869374.0, "step": 620 }, { "entropy": 1.997447171807289, "epoch": 0.7363038714390066, "grad_norm": 4.30350399017334, "learning_rate": 1.9292517638765837e-05, "loss": 1.1078848838806152, "mean_token_accuracy": 0.7255709297955036, "num_tokens": 5986947.0, "step": 630 }, { "entropy": 2.0404550701379778, "epoch": 0.747991234477721, "grad_norm": 3.701443672180176, "learning_rate": 1.926429098699725e-05, "loss": 1.5392901420593261, "mean_token_accuracy": 0.7062803871929646, "num_tokens": 6079821.0, "step": 640 }, { "entropy": 2.0202228128910065, "epoch": 0.7596785975164354, "grad_norm": 6.253220558166504, "learning_rate": 1.9235533689841612e-05, "loss": 1.5730666160583495, "mean_token_accuracy": 0.6577034238725901, "num_tokens": 6159034.0, "step": 650 }, { "entropy": 2.035487785935402, "epoch": 0.7713659605551497, "grad_norm": 4.312775611877441, "learning_rate": 1.9206247394475926e-05, "loss": 1.386094570159912, "mean_token_accuracy": 0.7041108455508948, "num_tokens": 6245774.0, "step": 660 }, { "entropy": 2.051509512960911, "epoch": 0.7830533235938641, "grad_norm": 1.9078806638717651, "learning_rate": 1.9176433778377463e-05, "loss": 1.471836471557617, "mean_token_accuracy": 0.6896713547408581, "num_tokens": 6322635.0, "step": 670 }, { "entropy": 2.0822817206382753, "epoch": 0.7947406866325786, "grad_norm": 4.861499786376953, "learning_rate": 1.9146094549227665e-05, "loss": 1.4575112342834473, "mean_token_accuracy": 0.6978994499891996, "num_tokens": 6408559.0, "step": 680 }, { "entropy": 2.0686106011271477, "epoch": 0.8064280496712929, "grad_norm": 1.1169753074645996, "learning_rate": 1.9115231444814356e-05, "loss": 1.2490267753601074, "mean_token_accuracy": 0.7142957296222449, "num_tokens": 6498026.0, "step": 690 }, { "entropy": 1.9760664150118827, "epoch": 0.8181154127100073, "grad_norm": 1.8441827297210693, "learning_rate": 1.9083846232932174e-05, "loss": 1.4654719352722168, "mean_token_accuracy": 0.7016753869131207, "num_tokens": 6570974.0, "step": 700 }, { "epoch": 0.8181154127100073, "eval_entropy": 2.0254281694069505, "eval_loss": 0.8561184406280518, "eval_mean_token_accuracy": 0.7865645285928622, "eval_num_tokens": 6570974.0, "eval_runtime": 25.7483, "eval_samples_per_second": 19.885, "eval_steps_per_second": 9.942, "step": 700 }, { "entropy": 2.0727786898612974, "epoch": 0.8298027757487217, "grad_norm": 1.2925829887390137, "learning_rate": 1.9051940711281337e-05, "loss": 1.4354880332946778, "mean_token_accuracy": 0.6728816997259855, "num_tokens": 6653552.0, "step": 710 }, { "entropy": 2.0933717772364617, "epoch": 0.8414901387874361, "grad_norm": 2.684811592102051, "learning_rate": 1.9019516707364665e-05, "loss": 1.2576842308044434, "mean_token_accuracy": 0.7233169266954065, "num_tokens": 6763872.0, "step": 720 }, { "entropy": 2.0260725244879723, "epoch": 0.8531775018261505, "grad_norm": 3.0955469608306885, "learning_rate": 1.8986576078382897e-05, "loss": 1.1219220161437988, "mean_token_accuracy": 0.7308994717895985, "num_tokens": 6859512.0, "step": 730 }, { "entropy": 2.0424532502889634, "epoch": 0.8648648648648649, "grad_norm": 2.130910873413086, "learning_rate": 1.8953120711128328e-05, "loss": 1.3845118522644042, "mean_token_accuracy": 0.7046346709132194, "num_tokens": 6955559.0, "step": 740 }, { "entropy": 2.0079129934310913, "epoch": 0.8765522279035792, "grad_norm": 4.160308837890625, "learning_rate": 1.8919152521876723e-05, "loss": 1.374086284637451, "mean_token_accuracy": 0.7193431258201599, "num_tokens": 7043418.0, "step": 750 }, { "entropy": 1.9917357206344604, "epoch": 0.8882395909422937, "grad_norm": 2.2451999187469482, "learning_rate": 1.888467345627756e-05, "loss": 1.494250202178955, "mean_token_accuracy": 0.7015550900250673, "num_tokens": 7132570.0, "step": 760 }, { "entropy": 2.0734104439616203, "epoch": 0.8999269539810081, "grad_norm": 3.7219045162200928, "learning_rate": 1.8849685489242587e-05, "loss": 1.1162896156311035, "mean_token_accuracy": 0.7175393454730511, "num_tokens": 7206183.0, "step": 770 }, { "entropy": 1.945244801044464, "epoch": 0.9116143170197224, "grad_norm": 2.7573325634002686, "learning_rate": 1.88141906248327e-05, "loss": 1.2209875106811523, "mean_token_accuracy": 0.7243857584893704, "num_tokens": 7299435.0, "step": 780 }, { "entropy": 1.964235670864582, "epoch": 0.9233016800584368, "grad_norm": 3.2477715015411377, "learning_rate": 1.877819089614316e-05, "loss": 1.509469699859619, "mean_token_accuracy": 0.7052617512643338, "num_tokens": 7402956.0, "step": 790 }, { "entropy": 1.9679414376616478, "epoch": 0.9349890430971513, "grad_norm": 37.075477600097656, "learning_rate": 1.8741688365187126e-05, "loss": 1.4231921195983888, "mean_token_accuracy": 0.6835801653563977, "num_tokens": 7502241.0, "step": 800 }, { "epoch": 0.9349890430971513, "eval_entropy": 1.9983236375264823, "eval_loss": 0.867080807685852, "eval_mean_token_accuracy": 0.7754522023024037, "eval_num_tokens": 7502241.0, "eval_runtime": 25.7531, "eval_samples_per_second": 19.881, "eval_steps_per_second": 9.941, "step": 800 }, { "entropy": 1.985922822356224, "epoch": 0.9466764061358656, "grad_norm": 3.3656697273254395, "learning_rate": 1.8704685122777564e-05, "loss": 1.2210535049438476, "mean_token_accuracy": 0.7048435021191836, "num_tokens": 7623320.0, "step": 810 }, { "entropy": 2.0612731352448463, "epoch": 0.95836376917458, "grad_norm": 1.0531134605407715, "learning_rate": 1.8667183288407468e-05, "loss": 1.1971052169799805, "mean_token_accuracy": 0.7166136829182506, "num_tokens": 7720440.0, "step": 820 }, { "entropy": 2.0148551099002363, "epoch": 0.9700511322132944, "grad_norm": 4.024211883544922, "learning_rate": 1.8629185010128478e-05, "loss": 1.3127185821533203, "mean_token_accuracy": 0.6342430572956801, "num_tokens": 7816747.0, "step": 830 }, { "entropy": 2.0382406994700433, "epoch": 0.9817384952520087, "grad_norm": 5.8077616691589355, "learning_rate": 1.8590692464427826e-05, "loss": 1.229036808013916, "mean_token_accuracy": 0.692909746337682, "num_tokens": 7911749.0, "step": 840 }, { "entropy": 2.017058402299881, "epoch": 0.9934258582907232, "grad_norm": 3.8182997703552246, "learning_rate": 1.8551707856103687e-05, "loss": 1.408517551422119, "mean_token_accuracy": 0.6882151458412409, "num_tokens": 8010735.0, "step": 850 }, { "entropy": 2.0180568664104905, "epoch": 1.0046749452154857, "grad_norm": 1.599541425704956, "learning_rate": 1.8512233418138874e-05, "loss": 1.306098175048828, "mean_token_accuracy": 0.6780746261794846, "num_tokens": 8118038.0, "step": 860 }, { "entropy": 2.0067124992609022, "epoch": 1.0163623082542002, "grad_norm": 5.67886209487915, "learning_rate": 1.8472271411572947e-05, "loss": 1.1671574592590332, "mean_token_accuracy": 0.713248742185533, "num_tokens": 8200543.0, "step": 870 }, { "entropy": 2.0012906357645988, "epoch": 1.0280496712929146, "grad_norm": 3.1922106742858887, "learning_rate": 1.84318241253727e-05, "loss": 1.4505293846130372, "mean_token_accuracy": 0.6957443349063397, "num_tokens": 8319764.0, "step": 880 }, { "entropy": 2.088476361334324, "epoch": 1.039737034331629, "grad_norm": 3.2191641330718994, "learning_rate": 1.839089387630105e-05, "loss": 1.237698459625244, "mean_token_accuracy": 0.7405852057039738, "num_tokens": 8418280.0, "step": 890 }, { "entropy": 1.9533416509628296, "epoch": 1.0514243973703432, "grad_norm": 4.920682430267334, "learning_rate": 1.8349483008784346e-05, "loss": 1.1894009590148926, "mean_token_accuracy": 0.7420405600219965, "num_tokens": 8537568.0, "step": 900 }, { "epoch": 1.0514243973703432, "eval_entropy": 1.9681994300335646, "eval_loss": 0.8586333394050598, "eval_mean_token_accuracy": 0.7810589795699343, "eval_num_tokens": 8537568.0, "eval_runtime": 25.8055, "eval_samples_per_second": 19.841, "eval_steps_per_second": 9.92, "step": 900 }, { "entropy": 2.0434288874268534, "epoch": 1.0631117604090576, "grad_norm": 1.5615532398223877, "learning_rate": 1.830759389477807e-05, "loss": 1.116469383239746, "mean_token_accuracy": 0.7405070804059506, "num_tokens": 8648085.0, "step": 910 }, { "entropy": 2.041461481153965, "epoch": 1.074799123447772, "grad_norm": 5.930424213409424, "learning_rate": 1.8265228933630993e-05, "loss": 1.157538604736328, "mean_token_accuracy": 0.7226788546890021, "num_tokens": 8725616.0, "step": 920 }, { "entropy": 1.9450246095657349, "epoch": 1.0864864864864865, "grad_norm": 4.664083003997803, "learning_rate": 1.822239055194772e-05, "loss": 0.8936849594116211, "mean_token_accuracy": 0.7802880503237247, "num_tokens": 8832986.0, "step": 930 }, { "entropy": 1.937520469725132, "epoch": 1.098173849525201, "grad_norm": 8.443425178527832, "learning_rate": 1.8179081203449702e-05, "loss": 1.3640972137451173, "mean_token_accuracy": 0.6927296353504062, "num_tokens": 8899400.0, "step": 940 }, { "entropy": 2.0156847476959228, "epoch": 1.1098612125639153, "grad_norm": 1.6205108165740967, "learning_rate": 1.8135303368834724e-05, "loss": 1.4349061965942382, "mean_token_accuracy": 0.7307943589985371, "num_tokens": 8983629.0, "step": 950 }, { "entropy": 2.0066610902547835, "epoch": 1.1215485756026298, "grad_norm": 2.5834603309631348, "learning_rate": 1.8091059555634767e-05, "loss": 1.1831789016723633, "mean_token_accuracy": 0.7173672618344427, "num_tokens": 9075646.0, "step": 960 }, { "entropy": 1.9574484556913376, "epoch": 1.133235938641344, "grad_norm": 3.529022455215454, "learning_rate": 1.8046352298072408e-05, "loss": 1.2099827766418456, "mean_token_accuracy": 0.6975785996764898, "num_tokens": 9172845.0, "step": 970 }, { "entropy": 1.9960552796721458, "epoch": 1.1449233016800584, "grad_norm": 5.0720624923706055, "learning_rate": 1.800118415691566e-05, "loss": 1.5012150764465333, "mean_token_accuracy": 0.6908264242112636, "num_tokens": 9247772.0, "step": 980 }, { "entropy": 2.0457948252558706, "epoch": 1.1566106647187728, "grad_norm": 5.155003070831299, "learning_rate": 1.7955557719331286e-05, "loss": 1.232002353668213, "mean_token_accuracy": 0.7276268910616637, "num_tokens": 9335161.0, "step": 990 }, { "entropy": 1.926890704035759, "epoch": 1.1682980277574873, "grad_norm": 1.4542499780654907, "learning_rate": 1.790947559873662e-05, "loss": 1.5774466514587402, "mean_token_accuracy": 0.7076287779957056, "num_tokens": 9439634.0, "step": 1000 }, { "epoch": 1.1682980277574873, "eval_entropy": 1.9619915070943534, "eval_loss": 0.8459069728851318, "eval_mean_token_accuracy": 0.7854349086992443, "eval_num_tokens": 9439634.0, "eval_runtime": 25.7338, "eval_samples_per_second": 19.896, "eval_steps_per_second": 9.948, "step": 1000 }, { "entropy": 2.044060703366995, "epoch": 1.1799853907962017, "grad_norm": 6.555078506469727, "learning_rate": 1.7862940434649862e-05, "loss": 1.111758041381836, "mean_token_accuracy": 0.7634515274316073, "num_tokens": 9536599.0, "step": 1010 }, { "entropy": 2.0073146775364874, "epoch": 1.1916727538349159, "grad_norm": 5.614148139953613, "learning_rate": 1.7815954892538906e-05, "loss": 1.1583277702331543, "mean_token_accuracy": 0.7569285105913878, "num_tokens": 9624039.0, "step": 1020 }, { "entropy": 1.9390188187360764, "epoch": 1.2033601168736303, "grad_norm": 3.570732831954956, "learning_rate": 1.776852166366866e-05, "loss": 1.2342907905578613, "mean_token_accuracy": 0.7328513782471419, "num_tokens": 9731570.0, "step": 1030 }, { "entropy": 2.007731480896473, "epoch": 1.2150474799123447, "grad_norm": 4.624857425689697, "learning_rate": 1.772064346494688e-05, "loss": 1.1125083923339845, "mean_token_accuracy": 0.7398822195827961, "num_tokens": 9829159.0, "step": 1040 }, { "entropy": 1.95512465685606, "epoch": 1.2267348429510592, "grad_norm": 5.471255779266357, "learning_rate": 1.7672323038768566e-05, "loss": 1.1773574829101563, "mean_token_accuracy": 0.7350184928625823, "num_tokens": 9925525.0, "step": 1050 }, { "entropy": 1.9593760170042516, "epoch": 1.2384222059897736, "grad_norm": 3.174351930618286, "learning_rate": 1.7623563152858883e-05, "loss": 1.1755749702453613, "mean_token_accuracy": 0.7368000335991383, "num_tokens": 10010547.0, "step": 1060 }, { "entropy": 2.0089882522821427, "epoch": 1.250109569028488, "grad_norm": 3.5962374210357666, "learning_rate": 1.7574366600114613e-05, "loss": 1.5100272178649903, "mean_token_accuracy": 0.7163063116371632, "num_tokens": 10101289.0, "step": 1070 }, { "entropy": 2.0140527084469797, "epoch": 1.2617969320672024, "grad_norm": 4.1162309646606445, "learning_rate": 1.7524736198444197e-05, "loss": 1.170853614807129, "mean_token_accuracy": 0.7263667859137058, "num_tokens": 10233321.0, "step": 1080 }, { "entropy": 1.9484913617372512, "epoch": 1.2734842951059167, "grad_norm": 6.536661624908447, "learning_rate": 1.747467479060633e-05, "loss": 1.1337247848510743, "mean_token_accuracy": 0.7735978152602911, "num_tokens": 10303009.0, "step": 1090 }, { "entropy": 2.0198730982840063, "epoch": 1.285171658144631, "grad_norm": 3.4061622619628906, "learning_rate": 1.7424185244047116e-05, "loss": 1.0629566192626954, "mean_token_accuracy": 0.7369117736816406, "num_tokens": 10438680.0, "step": 1100 }, { "epoch": 1.285171658144631, "eval_entropy": 1.9863552912138402, "eval_loss": 0.8380774855613708, "eval_mean_token_accuracy": 0.7885139010613784, "eval_num_tokens": 10438680.0, "eval_runtime": 25.7827, "eval_samples_per_second": 19.858, "eval_steps_per_second": 9.929, "step": 1100 }, { "entropy": 1.9853825107216836, "epoch": 1.2968590211833455, "grad_norm": 1.8975157737731934, "learning_rate": 1.737327045073584e-05, "loss": 1.2073594093322755, "mean_token_accuracy": 0.7203539207577705, "num_tokens": 10535626.0, "step": 1110 }, { "entropy": 1.9051698848605156, "epoch": 1.30854638422206, "grad_norm": 4.080144882202148, "learning_rate": 1.7321933326999313e-05, "loss": 1.0707772254943848, "mean_token_accuracy": 0.7556315153837204, "num_tokens": 10653815.0, "step": 1120 }, { "entropy": 2.0398276120424272, "epoch": 1.3202337472607744, "grad_norm": 4.169946670532227, "learning_rate": 1.7270176813354836e-05, "loss": 1.1661772727966309, "mean_token_accuracy": 0.7467184342443943, "num_tokens": 10716426.0, "step": 1130 }, { "entropy": 1.9850704297423363, "epoch": 1.3319211102994886, "grad_norm": 4.181504726409912, "learning_rate": 1.7218003874341762e-05, "loss": 0.9917153358459473, "mean_token_accuracy": 0.7495910193771124, "num_tokens": 10814456.0, "step": 1140 }, { "entropy": 1.9728952266275883, "epoch": 1.343608473338203, "grad_norm": 1.9582622051239014, "learning_rate": 1.7165417498351695e-05, "loss": 1.1698190689086914, "mean_token_accuracy": 0.7205928053706885, "num_tokens": 10930887.0, "step": 1150 }, { "entropy": 1.9699254363775254, "epoch": 1.3552958363769174, "grad_norm": 2.080578327178955, "learning_rate": 1.711242069745732e-05, "loss": 1.0921939849853515, "mean_token_accuracy": 0.7728059090673923, "num_tokens": 11008746.0, "step": 1160 }, { "entropy": 1.9688927009701729, "epoch": 1.3669831994156318, "grad_norm": 9.23663330078125, "learning_rate": 1.705901650723988e-05, "loss": 1.3214816093444823, "mean_token_accuracy": 0.7266499204561114, "num_tokens": 11081881.0, "step": 1170 }, { "entropy": 1.9373602516949178, "epoch": 1.3786705624543463, "grad_norm": 3.493316173553467, "learning_rate": 1.7005207986615293e-05, "loss": 1.2887114524841308, "mean_token_accuracy": 0.7301527475938201, "num_tokens": 11170839.0, "step": 1180 }, { "entropy": 1.937132966518402, "epoch": 1.3903579254930607, "grad_norm": 3.835472583770752, "learning_rate": 1.6950998217658948e-05, "loss": 1.1458003997802735, "mean_token_accuracy": 0.7413250353187323, "num_tokens": 11265564.0, "step": 1190 }, { "entropy": 1.9563957542181014, "epoch": 1.4020452885317751, "grad_norm": 2.9280080795288086, "learning_rate": 1.6896390305429173e-05, "loss": 1.0155451774597168, "mean_token_accuracy": 0.7335030514746904, "num_tokens": 11345666.0, "step": 1200 }, { "epoch": 1.4020452885317751, "eval_entropy": 1.9168102419935167, "eval_loss": 0.8464275598526001, "eval_mean_token_accuracy": 0.7816579656209797, "eval_num_tokens": 11345666.0, "eval_runtime": 25.7925, "eval_samples_per_second": 19.851, "eval_steps_per_second": 9.925, "step": 1200 }, { "entropy": 1.9489586815237998, "epoch": 1.4137326515704893, "grad_norm": 4.470329284667969, "learning_rate": 1.6841387377789365e-05, "loss": 1.0874253273010255, "mean_token_accuracy": 0.7266624689102172, "num_tokens": 11441947.0, "step": 1210 }, { "entropy": 1.9251106187701226, "epoch": 1.4254200146092038, "grad_norm": 8.1526460647583, "learning_rate": 1.6785992585228842e-05, "loss": 1.1446887969970703, "mean_token_accuracy": 0.7407740101218223, "num_tokens": 11512448.0, "step": 1220 }, { "entropy": 1.8829301849007607, "epoch": 1.4371073776479182, "grad_norm": 3.5247323513031006, "learning_rate": 1.6730209100682398e-05, "loss": 1.1706348419189454, "mean_token_accuracy": 0.7307471681386233, "num_tokens": 11599060.0, "step": 1230 }, { "entropy": 1.8378908082842826, "epoch": 1.4487947406866326, "grad_norm": 5.84583854675293, "learning_rate": 1.6674040119348534e-05, "loss": 1.3138227462768555, "mean_token_accuracy": 0.7309050619602203, "num_tokens": 11696606.0, "step": 1240 }, { "entropy": 1.9146908812224865, "epoch": 1.460482103725347, "grad_norm": 3.2844982147216797, "learning_rate": 1.6617488858506478e-05, "loss": 1.1646804809570312, "mean_token_accuracy": 0.7578974604606629, "num_tokens": 11794942.0, "step": 1250 }, { "entropy": 1.9918838322162629, "epoch": 1.4721694667640612, "grad_norm": 4.6135406494140625, "learning_rate": 1.6560558557331857e-05, "loss": 1.2325959205627441, "mean_token_accuracy": 0.7542553246021271, "num_tokens": 11879297.0, "step": 1260 }, { "entropy": 1.9307655103504657, "epoch": 1.4838568298027757, "grad_norm": 3.894841194152832, "learning_rate": 1.6503252476711207e-05, "loss": 1.2438136100769044, "mean_token_accuracy": 0.7178509555757046, "num_tokens": 11956740.0, "step": 1270 }, { "entropy": 1.908846166729927, "epoch": 1.49554419284149, "grad_norm": 5.166774749755859, "learning_rate": 1.6445573899055173e-05, "loss": 1.2256482124328614, "mean_token_accuracy": 0.6992226783186197, "num_tokens": 12046253.0, "step": 1280 }, { "entropy": 1.8920038990676402, "epoch": 1.5072315558802045, "grad_norm": 6.3578901290893555, "learning_rate": 1.6387526128110497e-05, "loss": 1.1908625602722167, "mean_token_accuracy": 0.7180704873055219, "num_tokens": 12138688.0, "step": 1290 }, { "entropy": 1.8648209869861603, "epoch": 1.518918918918919, "grad_norm": 4.01393461227417, "learning_rate": 1.6329112488770783e-05, "loss": 0.9572369575500488, "mean_token_accuracy": 0.7382893675938249, "num_tokens": 12236933.0, "step": 1300 }, { "epoch": 1.518918918918919, "eval_entropy": 1.838359854184091, "eval_loss": 0.8447912931442261, "eval_mean_token_accuracy": 0.7861243971856311, "eval_num_tokens": 12236933.0, "eval_runtime": 25.7812, "eval_samples_per_second": 19.859, "eval_steps_per_second": 9.93, "step": 1300 }, { "entropy": 1.8808407828211784, "epoch": 1.5306062819576334, "grad_norm": 5.479897975921631, "learning_rate": 1.627033632688606e-05, "loss": 1.1945793151855468, "mean_token_accuracy": 0.7323504503816366, "num_tokens": 12323027.0, "step": 1310 }, { "entropy": 1.8892016053199767, "epoch": 1.5422936449963478, "grad_norm": 4.85045862197876, "learning_rate": 1.6211201009071134e-05, "loss": 1.0658716201782226, "mean_token_accuracy": 0.73037389498204, "num_tokens": 12412760.0, "step": 1320 }, { "entropy": 1.9150678791105746, "epoch": 1.5539810080350622, "grad_norm": 3.739926338195801, "learning_rate": 1.615170992251275e-05, "loss": 1.2553756713867188, "mean_token_accuracy": 0.7565023884177208, "num_tokens": 12499002.0, "step": 1330 }, { "entropy": 1.827857257425785, "epoch": 1.5656683710737764, "grad_norm": 1.824333667755127, "learning_rate": 1.6091866474775565e-05, "loss": 1.216816520690918, "mean_token_accuracy": 0.7362237356603145, "num_tokens": 12620786.0, "step": 1340 }, { "entropy": 1.9286083355545998, "epoch": 1.5773557341124909, "grad_norm": 4.209549903869629, "learning_rate": 1.6031674093607003e-05, "loss": 1.5620033264160156, "mean_token_accuracy": 0.7155494146049023, "num_tokens": 12694076.0, "step": 1350 }, { "entropy": 1.9999349035322667, "epoch": 1.5890430971512053, "grad_norm": 3.89644193649292, "learning_rate": 1.597113622674089e-05, "loss": 1.466843032836914, "mean_token_accuracy": 0.7301654836162925, "num_tokens": 12797729.0, "step": 1360 }, { "entropy": 1.928144982457161, "epoch": 1.6007304601899195, "grad_norm": 2.602468967437744, "learning_rate": 1.5910256341699978e-05, "loss": 0.9804810523986817, "mean_token_accuracy": 0.7682306554168463, "num_tokens": 12877532.0, "step": 1370 }, { "entropy": 1.9351914629340172, "epoch": 1.612417823228634, "grad_norm": 4.436489105224609, "learning_rate": 1.584903792559733e-05, "loss": 1.1732940673828125, "mean_token_accuracy": 0.7697132367640733, "num_tokens": 12954415.0, "step": 1380 }, { "entropy": 1.8640065513551236, "epoch": 1.6241051862673483, "grad_norm": 6.866170883178711, "learning_rate": 1.57874844849366e-05, "loss": 1.1950453758239745, "mean_token_accuracy": 0.7020724691450596, "num_tokens": 13092979.0, "step": 1390 }, { "entropy": 1.8486135482788086, "epoch": 1.6357925493060628, "grad_norm": 4.1101393699646, "learning_rate": 1.5725599545411157e-05, "loss": 1.1412214279174804, "mean_token_accuracy": 0.727515947446227, "num_tokens": 13217902.0, "step": 1400 }, { "epoch": 1.6357925493060628, "eval_entropy": 1.8418370359577239, "eval_loss": 0.845252513885498, "eval_mean_token_accuracy": 0.7928508168552071, "eval_num_tokens": 13217902.0, "eval_runtime": 25.7728, "eval_samples_per_second": 19.866, "eval_steps_per_second": 9.933, "step": 1400 }, { "entropy": 1.8421028837561608, "epoch": 1.6474799123447772, "grad_norm": 7.405350685119629, "learning_rate": 1.5663386651702154e-05, "loss": 1.2713269233703612, "mean_token_accuracy": 0.7393627911806107, "num_tokens": 13294277.0, "step": 1410 }, { "entropy": 1.9373707726597786, "epoch": 1.6591672753834916, "grad_norm": 7.983404159545898, "learning_rate": 1.5600849367275497e-05, "loss": 1.2371453285217284, "mean_token_accuracy": 0.7312075588852167, "num_tokens": 13384052.0, "step": 1420 }, { "entropy": 1.8757845029234885, "epoch": 1.670854638422206, "grad_norm": 3.276104688644409, "learning_rate": 1.553799127417773e-05, "loss": 0.8122424125671387, "mean_token_accuracy": 0.7491487618535757, "num_tokens": 13482557.0, "step": 1430 }, { "entropy": 1.8658230647444725, "epoch": 1.6825420014609205, "grad_norm": 3.2975077629089355, "learning_rate": 1.5474815972830863e-05, "loss": 1.08724946975708, "mean_token_accuracy": 0.7675337288528681, "num_tokens": 13588999.0, "step": 1440 }, { "entropy": 1.8781310148537158, "epoch": 1.694229364499635, "grad_norm": 4.919190883636475, "learning_rate": 1.5411327081826127e-05, "loss": 1.0564030647277831, "mean_token_accuracy": 0.7417909545823932, "num_tokens": 13672070.0, "step": 1450 }, { "entropy": 1.8797260642051696, "epoch": 1.705916727538349, "grad_norm": 5.827484607696533, "learning_rate": 1.5347528237716742e-05, "loss": 1.1392526626586914, "mean_token_accuracy": 0.7560544963926077, "num_tokens": 13768344.0, "step": 1460 }, { "entropy": 1.8342829935252667, "epoch": 1.7176040905770635, "grad_norm": 2.148158073425293, "learning_rate": 1.5283423094809597e-05, "loss": 1.4184009552001953, "mean_token_accuracy": 0.6963153561577201, "num_tokens": 13893709.0, "step": 1470 }, { "entropy": 1.9475776053965093, "epoch": 1.729291453615778, "grad_norm": 5.127400875091553, "learning_rate": 1.5219015324955924e-05, "loss": 1.114856243133545, "mean_token_accuracy": 0.7408701498061419, "num_tokens": 13993373.0, "step": 1480 }, { "entropy": 1.8672847002744675, "epoch": 1.7409788166544922, "grad_norm": 6.511949062347412, "learning_rate": 1.5154308617341007e-05, "loss": 1.3385598182678222, "mean_token_accuracy": 0.7226239118725062, "num_tokens": 14101381.0, "step": 1490 }, { "entropy": 1.8440473534166812, "epoch": 1.7526661796932066, "grad_norm": 4.361108303070068, "learning_rate": 1.5089306678272864e-05, "loss": 1.3698930740356445, "mean_token_accuracy": 0.7481454864144326, "num_tokens": 14191846.0, "step": 1500 }, { "epoch": 1.7526661796932066, "eval_entropy": 1.817938992753625, "eval_loss": 0.8368152379989624, "eval_mean_token_accuracy": 0.7905413492117077, "eval_num_tokens": 14191846.0, "eval_runtime": 25.7676, "eval_samples_per_second": 19.87, "eval_steps_per_second": 9.935, "step": 1500 }, { "entropy": 1.863508278131485, "epoch": 1.764353542731921, "grad_norm": 4.527868270874023, "learning_rate": 1.5024013230969936e-05, "loss": 1.376086139678955, "mean_token_accuracy": 0.7072158310562372, "num_tokens": 14263729.0, "step": 1510 }, { "entropy": 1.859600581228733, "epoch": 1.7760409057706354, "grad_norm": 4.358312606811523, "learning_rate": 1.4958432015347852e-05, "loss": 1.2642126083374023, "mean_token_accuracy": 0.7176427299156785, "num_tokens": 14339743.0, "step": 1520 }, { "entropy": 1.9863651104271411, "epoch": 1.7877282688093499, "grad_norm": 1.4887659549713135, "learning_rate": 1.48925667878052e-05, "loss": 1.329563045501709, "mean_token_accuracy": 0.6955630304291844, "num_tokens": 14424090.0, "step": 1530 }, { "entropy": 1.912637159973383, "epoch": 1.7994156318480643, "grad_norm": 6.545175552368164, "learning_rate": 1.4826421321008355e-05, "loss": 1.0352179527282714, "mean_token_accuracy": 0.746459336578846, "num_tokens": 14553405.0, "step": 1540 }, { "entropy": 1.8355502478778363, "epoch": 1.8111029948867787, "grad_norm": 6.896246433258057, "learning_rate": 1.475999940367541e-05, "loss": 1.0201452255249024, "mean_token_accuracy": 0.749504017457366, "num_tokens": 14622999.0, "step": 1550 }, { "entropy": 1.8898384764790535, "epoch": 1.8227903579254932, "grad_norm": 1.8590527772903442, "learning_rate": 1.4693304840359139e-05, "loss": 1.162650966644287, "mean_token_accuracy": 0.7342435199767351, "num_tokens": 14728271.0, "step": 1560 }, { "entropy": 1.9078960753977299, "epoch": 1.8344777209642076, "grad_norm": 1.8502728939056396, "learning_rate": 1.4626341451229103e-05, "loss": 1.347366714477539, "mean_token_accuracy": 0.7131027575582266, "num_tokens": 14823353.0, "step": 1570 }, { "entropy": 1.935336910188198, "epoch": 1.8461650840029218, "grad_norm": 5.908510208129883, "learning_rate": 1.455911307185281e-05, "loss": 1.2870336532592774, "mean_token_accuracy": 0.7339887302368879, "num_tokens": 14919875.0, "step": 1580 }, { "entropy": 1.9448796108365058, "epoch": 1.8578524470416362, "grad_norm": 2.0281429290771484, "learning_rate": 1.4491623552976042e-05, "loss": 1.3380470275878906, "mean_token_accuracy": 0.7136711545288563, "num_tokens": 15037434.0, "step": 1590 }, { "entropy": 1.9401104234158992, "epoch": 1.8695398100803506, "grad_norm": 2.0017759799957275, "learning_rate": 1.4423876760302266e-05, "loss": 1.1158767700195313, "mean_token_accuracy": 0.7537970876321196, "num_tokens": 15140025.0, "step": 1600 }, { "epoch": 1.8695398100803506, "eval_entropy": 1.9083105023019016, "eval_loss": 0.8140835165977478, "eval_mean_token_accuracy": 0.7952790177660063, "eval_num_tokens": 15140025.0, "eval_runtime": 25.7537, "eval_samples_per_second": 19.881, "eval_steps_per_second": 9.94, "step": 1600 }, { "entropy": 1.9709449693560601, "epoch": 1.881227173119065, "grad_norm": 7.711117267608643, "learning_rate": 1.4355876574271244e-05, "loss": 1.158623218536377, "mean_token_accuracy": 0.7596531298011542, "num_tokens": 15218216.0, "step": 1610 }, { "entropy": 1.8394018054008483, "epoch": 1.8929145361577793, "grad_norm": 2.468035936355591, "learning_rate": 1.4287626889836732e-05, "loss": 1.1825003623962402, "mean_token_accuracy": 0.7871152412146329, "num_tokens": 15306237.0, "step": 1620 }, { "entropy": 1.9042728692293167, "epoch": 1.9046018991964937, "grad_norm": 4.42598295211792, "learning_rate": 1.4219131616243407e-05, "loss": 1.2511362075805663, "mean_token_accuracy": 0.7355523742735386, "num_tokens": 15379172.0, "step": 1630 }, { "entropy": 1.8815034471452237, "epoch": 1.9162892622352081, "grad_norm": 5.948218822479248, "learning_rate": 1.4150394676802943e-05, "loss": 1.1002138137817383, "mean_token_accuracy": 0.7342391200363636, "num_tokens": 15466384.0, "step": 1640 }, { "entropy": 1.8593804724514484, "epoch": 1.9279766252739226, "grad_norm": 4.394277572631836, "learning_rate": 1.4081420008669286e-05, "loss": 1.074215030670166, "mean_token_accuracy": 0.7129569197073579, "num_tokens": 15567955.0, "step": 1650 }, { "entropy": 1.8384671002626418, "epoch": 1.939663988312637, "grad_norm": 4.205284118652344, "learning_rate": 1.4012211562613146e-05, "loss": 1.2773515701293945, "mean_token_accuracy": 0.7548876103013754, "num_tokens": 15670309.0, "step": 1660 }, { "entropy": 1.950037308782339, "epoch": 1.9513513513513514, "grad_norm": 4.259429931640625, "learning_rate": 1.3942773302795697e-05, "loss": 1.1189401626586915, "mean_token_accuracy": 0.7264496970921754, "num_tokens": 15759555.0, "step": 1670 }, { "entropy": 1.9171560436487198, "epoch": 1.9630387143900658, "grad_norm": 2.5676069259643555, "learning_rate": 1.3873109206541517e-05, "loss": 1.2681930541992188, "mean_token_accuracy": 0.727923545613885, "num_tokens": 15860587.0, "step": 1680 }, { "entropy": 1.9435059279203415, "epoch": 1.9747260774287803, "grad_norm": 4.799222469329834, "learning_rate": 1.3803223264110778e-05, "loss": 1.1749539375305176, "mean_token_accuracy": 0.7340441212058068, "num_tokens": 15960701.0, "step": 1690 }, { "entropy": 1.8940155997872352, "epoch": 1.9864134404674947, "grad_norm": 8.058248519897461, "learning_rate": 1.3733119478470685e-05, "loss": 1.1425342559814453, "mean_token_accuracy": 0.7671079862862825, "num_tokens": 16032922.0, "step": 1700 }, { "epoch": 1.9864134404674947, "eval_entropy": 1.8137257536873221, "eval_loss": 0.8239699602127075, "eval_mean_token_accuracy": 0.7964722405886278, "eval_num_tokens": 16032922.0, "eval_runtime": 25.7276, "eval_samples_per_second": 19.901, "eval_steps_per_second": 9.95, "step": 1700 }, { "entropy": 1.8432495191693306, "epoch": 1.998100803506209, "grad_norm": 4.412881374359131, "learning_rate": 1.3662801865066184e-05, "loss": 1.1190563201904298, "mean_token_accuracy": 0.7641295533627271, "num_tokens": 16127646.0, "step": 1710 }, { "entropy": 1.8858589382914754, "epoch": 2.0093498904309715, "grad_norm": 3.5278728008270264, "learning_rate": 1.3592274451589975e-05, "loss": 1.116040325164795, "mean_token_accuracy": 0.7860435471906291, "num_tokens": 16200737.0, "step": 1720 }, { "entropy": 1.862286825478077, "epoch": 2.021037253469686, "grad_norm": 3.7581899166107178, "learning_rate": 1.3521541277751808e-05, "loss": 1.330660915374756, "mean_token_accuracy": 0.7701560672372579, "num_tokens": 16288394.0, "step": 1730 }, { "entropy": 1.7247032955288888, "epoch": 2.0327246165084003, "grad_norm": 8.733301162719727, "learning_rate": 1.3450606395047094e-05, "loss": 1.012979507446289, "mean_token_accuracy": 0.7894353784620762, "num_tokens": 16414668.0, "step": 1740 }, { "entropy": 1.7075838804244996, "epoch": 2.0444119795471147, "grad_norm": 5.654486656188965, "learning_rate": 1.3379473866524841e-05, "loss": 0.8867033004760743, "mean_token_accuracy": 0.7954851593822241, "num_tokens": 16507494.0, "step": 1750 }, { "entropy": 1.69541003331542, "epoch": 2.056099342585829, "grad_norm": 3.9094533920288086, "learning_rate": 1.3308147766554921e-05, "loss": 1.1834484100341798, "mean_token_accuracy": 0.7346009539440275, "num_tokens": 16603593.0, "step": 1760 }, { "entropy": 1.776332788169384, "epoch": 2.0677867056245436, "grad_norm": 3.306637763977051, "learning_rate": 1.3236632180594713e-05, "loss": 0.9489650726318359, "mean_token_accuracy": 0.7801664341241121, "num_tokens": 16687410.0, "step": 1770 }, { "entropy": 1.7943820096552372, "epoch": 2.079474068663258, "grad_norm": 7.184858322143555, "learning_rate": 1.3164931204955073e-05, "loss": 1.0698629379272462, "mean_token_accuracy": 0.7857415523380041, "num_tokens": 16773739.0, "step": 1780 }, { "entropy": 1.7151453040540219, "epoch": 2.0911614317019724, "grad_norm": 7.096766471862793, "learning_rate": 1.3093048946565725e-05, "loss": 1.1096179008483886, "mean_token_accuracy": 0.7684622058644891, "num_tokens": 16871746.0, "step": 1790 }, { "entropy": 1.6890972763299943, "epoch": 2.1028487947406864, "grad_norm": 7.44707727432251, "learning_rate": 1.3020989522740001e-05, "loss": 1.0414841651916504, "mean_token_accuracy": 0.767111336812377, "num_tokens": 16942698.0, "step": 1800 }, { "epoch": 2.1028487947406864, "eval_entropy": 1.7094805547967553, "eval_loss": 0.8579376935958862, "eval_mean_token_accuracy": 0.7887821523472667, "eval_num_tokens": 16942698.0, "eval_runtime": 25.7606, "eval_samples_per_second": 19.875, "eval_steps_per_second": 9.938, "step": 1800 }, { "entropy": 1.7290698282420636, "epoch": 2.114536157779401, "grad_norm": 8.56005573272705, "learning_rate": 1.2948757060939019e-05, "loss": 0.8826337814331054, "mean_token_accuracy": 0.7914221476763487, "num_tokens": 17027656.0, "step": 1810 }, { "entropy": 1.8097689680755138, "epoch": 2.1262235208181153, "grad_norm": 4.438044548034668, "learning_rate": 1.2876355698535267e-05, "loss": 0.9441690444946289, "mean_token_accuracy": 0.7696551516652107, "num_tokens": 17153253.0, "step": 1820 }, { "entropy": 1.7344063587486744, "epoch": 2.1379108838568297, "grad_norm": 7.4073662757873535, "learning_rate": 1.2803789582575625e-05, "loss": 0.8094770431518554, "mean_token_accuracy": 0.8328897904604673, "num_tokens": 17238499.0, "step": 1830 }, { "entropy": 1.8003332495689393, "epoch": 2.149598246895544, "grad_norm": 2.58811354637146, "learning_rate": 1.2731062869543809e-05, "loss": 0.9070839881896973, "mean_token_accuracy": 0.7932946987450122, "num_tokens": 17315238.0, "step": 1840 }, { "entropy": 1.6319862693548202, "epoch": 2.1612856099342586, "grad_norm": 9.18846607208252, "learning_rate": 1.2658179725122315e-05, "loss": 0.8181050300598145, "mean_token_accuracy": 0.7743474829941988, "num_tokens": 17396825.0, "step": 1850 }, { "entropy": 1.6712466433644295, "epoch": 2.172972972972973, "grad_norm": 5.17325496673584, "learning_rate": 1.2585144323953806e-05, "loss": 1.1065648078918457, "mean_token_accuracy": 0.794865146651864, "num_tokens": 17477721.0, "step": 1860 }, { "entropy": 1.705952302366495, "epoch": 2.1846603360116874, "grad_norm": 3.063406467437744, "learning_rate": 1.2511960849401992e-05, "loss": 0.8904474258422852, "mean_token_accuracy": 0.8052191570401191, "num_tokens": 17574912.0, "step": 1870 }, { "entropy": 1.7243479125201702, "epoch": 2.196347699050402, "grad_norm": 4.745734691619873, "learning_rate": 1.2438633493312016e-05, "loss": 1.018042755126953, "mean_token_accuracy": 0.7697376435622573, "num_tokens": 17675398.0, "step": 1880 }, { "entropy": 1.7214707762002945, "epoch": 2.2080350620891163, "grad_norm": 7.520652770996094, "learning_rate": 1.2365166455770348e-05, "loss": 0.9177331924438477, "mean_token_accuracy": 0.8383358910679817, "num_tokens": 17774695.0, "step": 1890 }, { "entropy": 1.7210143111646174, "epoch": 2.2197224251278307, "grad_norm": 2.2790050506591797, "learning_rate": 1.2291563944864217e-05, "loss": 0.8777865409851074, "mean_token_accuracy": 0.7956211164593696, "num_tokens": 17846709.0, "step": 1900 }, { "epoch": 2.2197224251278307, "eval_entropy": 1.6415179804898798, "eval_loss": 0.8887978196144104, "eval_mean_token_accuracy": 0.7851445563137531, "eval_num_tokens": 17846709.0, "eval_runtime": 25.7621, "eval_samples_per_second": 19.874, "eval_steps_per_second": 9.937, "step": 1900 }, { "entropy": 1.766159813851118, "epoch": 2.231409788166545, "grad_norm": 8.775179862976074, "learning_rate": 1.2217830176440575e-05, "loss": 1.0922087669372558, "mean_token_accuracy": 0.8075018189847469, "num_tokens": 17942084.0, "step": 1910 }, { "entropy": 1.726970161497593, "epoch": 2.2430971512052595, "grad_norm": 8.528240203857422, "learning_rate": 1.2143969373864613e-05, "loss": 1.0563692092895507, "mean_token_accuracy": 0.8228851705789566, "num_tokens": 18034282.0, "step": 1920 }, { "entropy": 1.7479791216552258, "epoch": 2.2547845142439735, "grad_norm": 2.704474925994873, "learning_rate": 1.2069985767777853e-05, "loss": 1.0553196907043456, "mean_token_accuracy": 0.815582574903965, "num_tokens": 18155409.0, "step": 1930 }, { "entropy": 1.6536244474351407, "epoch": 2.266471877282688, "grad_norm": 10.785659790039062, "learning_rate": 1.199588359585584e-05, "loss": 0.9583339691162109, "mean_token_accuracy": 0.7827083263546228, "num_tokens": 18237737.0, "step": 1940 }, { "entropy": 1.7370208583772182, "epoch": 2.2781592403214024, "grad_norm": 6.897886276245117, "learning_rate": 1.1921667102565384e-05, "loss": 0.9463368415832519, "mean_token_accuracy": 0.7997389893978835, "num_tokens": 18327930.0, "step": 1950 }, { "entropy": 1.720282246917486, "epoch": 2.289846603360117, "grad_norm": 3.996598958969116, "learning_rate": 1.184734053892148e-05, "loss": 1.1193174362182616, "mean_token_accuracy": 0.7657456273213029, "num_tokens": 18423648.0, "step": 1960 }, { "entropy": 1.835063375532627, "epoch": 2.3015339663988312, "grad_norm": 5.055246829986572, "learning_rate": 1.1772908162243781e-05, "loss": 1.2491262435913086, "mean_token_accuracy": 0.76466054469347, "num_tokens": 18512229.0, "step": 1970 }, { "entropy": 1.7106602311134338, "epoch": 2.3132213294375457, "grad_norm": 5.09481954574585, "learning_rate": 1.1698374235912764e-05, "loss": 0.8167672157287598, "mean_token_accuracy": 0.815067458152771, "num_tokens": 18607065.0, "step": 1980 }, { "entropy": 1.7944564908742904, "epoch": 2.32490869247626, "grad_norm": 6.0724077224731445, "learning_rate": 1.1623743029125526e-05, "loss": 0.8526260375976562, "mean_token_accuracy": 0.774313784390688, "num_tokens": 18704091.0, "step": 1990 }, { "entropy": 1.6470934957265855, "epoch": 2.3365960555149745, "grad_norm": 10.5629301071167, "learning_rate": 1.154901881665125e-05, "loss": 0.9478482246398926, "mean_token_accuracy": 0.7888395514339208, "num_tokens": 18809808.0, "step": 2000 }, { "epoch": 2.3365960555149745, "eval_entropy": 1.664865046273917, "eval_loss": 0.8846761584281921, "eval_mean_token_accuracy": 0.7874117845203727, "eval_num_tokens": 18809808.0, "eval_runtime": 25.7239, "eval_samples_per_second": 19.904, "eval_steps_per_second": 9.952, "step": 2000 }, { "entropy": 1.688171324878931, "epoch": 2.348283418553689, "grad_norm": 9.02729606628418, "learning_rate": 1.1474205878586352e-05, "loss": 1.2155604362487793, "mean_token_accuracy": 0.7553981574252248, "num_tokens": 18897217.0, "step": 2010 }, { "entropy": 1.7721660077571868, "epoch": 2.3599707815924034, "grad_norm": 5.854802131652832, "learning_rate": 1.1399308500109326e-05, "loss": 0.8131728172302246, "mean_token_accuracy": 0.8193537637591362, "num_tokens": 18975705.0, "step": 2020 }, { "entropy": 1.7412988483905791, "epoch": 2.371658144631118, "grad_norm": 3.150503158569336, "learning_rate": 1.1324330971235284e-05, "loss": 1.047701072692871, "mean_token_accuracy": 0.800437244027853, "num_tokens": 19074509.0, "step": 2030 }, { "entropy": 1.7724151745438577, "epoch": 2.3833455076698318, "grad_norm": 4.939846038818359, "learning_rate": 1.1249277586570253e-05, "loss": 0.8570194244384766, "mean_token_accuracy": 0.8104645885527134, "num_tokens": 19213193.0, "step": 2040 }, { "entropy": 1.7081391178071499, "epoch": 2.395032870708546, "grad_norm": 13.442591667175293, "learning_rate": 1.1174152645065155e-05, "loss": 0.9962297439575195, "mean_token_accuracy": 0.7721560131758451, "num_tokens": 19318056.0, "step": 2050 }, { "entropy": 1.6723031967878341, "epoch": 2.4067202337472606, "grad_norm": 9.592318534851074, "learning_rate": 1.1098960449769596e-05, "loss": 1.1704561233520507, "mean_token_accuracy": 0.7990097958594561, "num_tokens": 19434190.0, "step": 2060 }, { "entropy": 1.6864351846277714, "epoch": 2.418407596785975, "grad_norm": 8.074052810668945, "learning_rate": 1.1023705307585381e-05, "loss": 0.9592673301696777, "mean_token_accuracy": 0.7668116193264722, "num_tokens": 19529901.0, "step": 2070 }, { "entropy": 1.7490323051810264, "epoch": 2.4300949598246895, "grad_norm": 2.452920436859131, "learning_rate": 1.0948391529019828e-05, "loss": 1.0507227897644043, "mean_token_accuracy": 0.8073636274784803, "num_tokens": 19623791.0, "step": 2080 }, { "entropy": 1.7456448063254357, "epoch": 2.441782322863404, "grad_norm": 7.240609645843506, "learning_rate": 1.0873023427938855e-05, "loss": 1.1253956794738769, "mean_token_accuracy": 0.7867503479123116, "num_tokens": 19713956.0, "step": 2090 }, { "entropy": 1.6924543783068657, "epoch": 2.4534696859021183, "grad_norm": 4.209897041320801, "learning_rate": 1.0797605321319899e-05, "loss": 0.868558406829834, "mean_token_accuracy": 0.7648149125277997, "num_tokens": 19808455.0, "step": 2100 }, { "epoch": 2.4534696859021183, "eval_entropy": 1.663283203728497, "eval_loss": 0.8835537433624268, "eval_mean_token_accuracy": 0.7884463180089369, "eval_num_tokens": 19808455.0, "eval_runtime": 25.7995, "eval_samples_per_second": 19.845, "eval_steps_per_second": 9.923, "step": 2100 }, { "entropy": 1.7139657579362393, "epoch": 2.4651570489408328, "grad_norm": 10.666122436523438, "learning_rate": 1.0722141529004646e-05, "loss": 0.9679533958435058, "mean_token_accuracy": 0.7547157764434814, "num_tokens": 19905431.0, "step": 2110 }, { "entropy": 1.718270693719387, "epoch": 2.476844411979547, "grad_norm": 7.6248908042907715, "learning_rate": 1.0646636373451593e-05, "loss": 1.0984148025512694, "mean_token_accuracy": 0.7684399399906396, "num_tokens": 19986159.0, "step": 2120 }, { "entropy": 1.7120233535766602, "epoch": 2.4885317750182616, "grad_norm": 2.2815515995025635, "learning_rate": 1.0571094179488456e-05, "loss": 0.988497257232666, "mean_token_accuracy": 0.8124069195240736, "num_tokens": 20060814.0, "step": 2130 }, { "entropy": 1.7328252077102662, "epoch": 2.500219138056976, "grad_norm": 4.041893482208252, "learning_rate": 1.0495519274064471e-05, "loss": 1.126350212097168, "mean_token_accuracy": 0.7363353008404374, "num_tokens": 20150562.0, "step": 2140 }, { "entropy": 1.6000701755285263, "epoch": 2.51190650109569, "grad_norm": 7.912816524505615, "learning_rate": 1.0419915986002534e-05, "loss": 1.274219799041748, "mean_token_accuracy": 0.7821881119161844, "num_tokens": 20263300.0, "step": 2150 }, { "entropy": 1.7800101920962335, "epoch": 2.523593864134405, "grad_norm": 4.959470272064209, "learning_rate": 1.0344288645751257e-05, "loss": 0.9354647636413574, "mean_token_accuracy": 0.7791614972054959, "num_tokens": 20340797.0, "step": 2160 }, { "entropy": 1.7066360771656037, "epoch": 2.535281227173119, "grad_norm": 3.610182523727417, "learning_rate": 1.0268641585136927e-05, "loss": 0.728416919708252, "mean_token_accuracy": 0.8194401554763318, "num_tokens": 20434070.0, "step": 2170 }, { "entropy": 1.780417773872614, "epoch": 2.5469685902118333, "grad_norm": 6.358795166015625, "learning_rate": 1.019297913711539e-05, "loss": 1.0019350051879883, "mean_token_accuracy": 0.7575782489031553, "num_tokens": 20518809.0, "step": 2180 }, { "entropy": 1.7431005448102952, "epoch": 2.5586559532505477, "grad_norm": 10.635919570922852, "learning_rate": 1.0117305635523849e-05, "loss": 1.125741958618164, "mean_token_accuracy": 0.7842472262680531, "num_tokens": 20640413.0, "step": 2190 }, { "entropy": 1.7685076668858528, "epoch": 2.570343316289262, "grad_norm": 10.567401885986328, "learning_rate": 1.0041625414832659e-05, "loss": 1.029182529449463, "mean_token_accuracy": 0.7735146172344685, "num_tokens": 20719301.0, "step": 2200 }, { "epoch": 2.570343316289262, "eval_entropy": 1.6802399228326976, "eval_loss": 0.8806448578834534, "eval_mean_token_accuracy": 0.7880933153210208, "eval_num_tokens": 20719301.0, "eval_runtime": 25.7639, "eval_samples_per_second": 19.873, "eval_steps_per_second": 9.936, "step": 2200 }, { "entropy": 1.7429690331220626, "epoch": 2.5820306793279766, "grad_norm": 4.979848861694336, "learning_rate": 9.965942809897021e-06, "loss": 1.078941535949707, "mean_token_accuracy": 0.8028537411242723, "num_tokens": 20814629.0, "step": 2210 }, { "entropy": 1.7465707987546921, "epoch": 2.593718042366691, "grad_norm": 2.9227752685546875, "learning_rate": 9.890262155708696e-06, "loss": 1.261153221130371, "mean_token_accuracy": 0.7378072213381529, "num_tokens": 20937052.0, "step": 2220 }, { "entropy": 1.7786902643740177, "epoch": 2.6054054054054054, "grad_norm": 7.268579959869385, "learning_rate": 9.814587787147735e-06, "loss": 0.8818110466003418, "mean_token_accuracy": 0.7982126645743847, "num_tokens": 21017553.0, "step": 2230 }, { "entropy": 1.7861275777220726, "epoch": 2.61709276844412, "grad_norm": 10.696455955505371, "learning_rate": 9.738924038734129e-06, "loss": 1.100949192047119, "mean_token_accuracy": 0.7710029076784849, "num_tokens": 21095809.0, "step": 2240 }, { "entropy": 1.7052608147263526, "epoch": 2.6287801314828343, "grad_norm": 10.710509300231934, "learning_rate": 9.663275244379576e-06, "loss": 0.953674030303955, "mean_token_accuracy": 0.7945627331733703, "num_tokens": 21189013.0, "step": 2250 }, { "entropy": 1.7925067514181137, "epoch": 2.6404674945215487, "grad_norm": 5.928650379180908, "learning_rate": 9.587645737139229e-06, "loss": 0.9999592781066895, "mean_token_accuracy": 0.7624824114143849, "num_tokens": 21268694.0, "step": 2260 }, { "entropy": 1.6451317243278027, "epoch": 2.652154857560263, "grad_norm": 7.02318000793457, "learning_rate": 9.512039848963494e-06, "loss": 0.8141751289367676, "mean_token_accuracy": 0.8069352146238089, "num_tokens": 21369367.0, "step": 2270 }, { "entropy": 1.6899416998028756, "epoch": 2.663842220598977, "grad_norm": 3.720379114151001, "learning_rate": 9.436461910449915e-06, "loss": 0.775752067565918, "mean_token_accuracy": 0.7989593021571636, "num_tokens": 21465668.0, "step": 2280 }, { "entropy": 1.6926493354141712, "epoch": 2.675529583637692, "grad_norm": 5.736570835113525, "learning_rate": 9.360916250595124e-06, "loss": 1.0607316970825196, "mean_token_accuracy": 0.739141751639545, "num_tokens": 21541115.0, "step": 2290 }, { "entropy": 1.713230238854885, "epoch": 2.687216946676406, "grad_norm": 5.054290294647217, "learning_rate": 9.285407196546862e-06, "loss": 0.9530890464782715, "mean_token_accuracy": 0.7673216979950667, "num_tokens": 21650967.0, "step": 2300 }, { "epoch": 2.687216946676406, "eval_entropy": 1.70094374101609, "eval_loss": 0.8739476799964905, "eval_mean_token_accuracy": 0.7821284044766799, "eval_num_tokens": 21650967.0, "eval_runtime": 25.7817, "eval_samples_per_second": 19.859, "eval_steps_per_second": 9.93, "step": 2300 }, { "entropy": 1.719686582684517, "epoch": 2.6989043097151204, "grad_norm": 3.380436897277832, "learning_rate": 9.209939073356165e-06, "loss": 0.8329605102539063, "mean_token_accuracy": 0.7897226478904485, "num_tokens": 21762612.0, "step": 2310 }, { "entropy": 1.699085582792759, "epoch": 2.710591672753835, "grad_norm": 6.518524646759033, "learning_rate": 9.134516203729588e-06, "loss": 1.0498428344726562, "mean_token_accuracy": 0.7732686188071967, "num_tokens": 21856022.0, "step": 2320 }, { "entropy": 1.7256886586546898, "epoch": 2.7222790357925493, "grad_norm": 7.4789910316467285, "learning_rate": 9.059142907781631e-06, "loss": 1.083822536468506, "mean_token_accuracy": 0.7466625854372978, "num_tokens": 21949955.0, "step": 2330 }, { "entropy": 1.6915680393576622, "epoch": 2.7339663988312637, "grad_norm": 12.511588096618652, "learning_rate": 8.983823502787294e-06, "loss": 0.9861274719238281, "mean_token_accuracy": 0.7604979265481233, "num_tokens": 22044621.0, "step": 2340 }, { "entropy": 1.6975976377725601, "epoch": 2.745653761869978, "grad_norm": 6.881553649902344, "learning_rate": 8.908562302934763e-06, "loss": 0.9918970108032227, "mean_token_accuracy": 0.8150558684021234, "num_tokens": 22167524.0, "step": 2350 }, { "entropy": 1.7521183386445045, "epoch": 2.7573411249086925, "grad_norm": 10.453824043273926, "learning_rate": 8.833363619078334e-06, "loss": 0.9284152030944824, "mean_token_accuracy": 0.7743912402540445, "num_tokens": 22247235.0, "step": 2360 }, { "entropy": 1.6890988066792487, "epoch": 2.769028487947407, "grad_norm": 8.435256004333496, "learning_rate": 8.758231758491467e-06, "loss": 0.9447514533996582, "mean_token_accuracy": 0.7803891401737928, "num_tokens": 22342825.0, "step": 2370 }, { "entropy": 1.7029536984860898, "epoch": 2.7807158509861214, "grad_norm": 5.541050910949707, "learning_rate": 8.683171024620072e-06, "loss": 0.8100149154663085, "mean_token_accuracy": 0.775150940194726, "num_tokens": 22438854.0, "step": 2380 }, { "entropy": 1.7363984808325768, "epoch": 2.7924032140248354, "grad_norm": 12.861689567565918, "learning_rate": 8.608185716836044e-06, "loss": 0.9886090278625488, "mean_token_accuracy": 0.8351553939282894, "num_tokens": 22547516.0, "step": 2390 }, { "entropy": 1.7828427016735078, "epoch": 2.8040905770635502, "grad_norm": 8.309239387512207, "learning_rate": 8.533280130190958e-06, "loss": 1.0228120803833007, "mean_token_accuracy": 0.7845853284001351, "num_tokens": 22633376.0, "step": 2400 }, { "epoch": 2.8040905770635502, "eval_entropy": 1.6970421387813985, "eval_loss": 0.8869515061378479, "eval_mean_token_accuracy": 0.7793418756918982, "eval_num_tokens": 22633376.0, "eval_runtime": 25.7702, "eval_samples_per_second": 19.868, "eval_steps_per_second": 9.934, "step": 2400 }, { "entropy": 1.7268100760877132, "epoch": 2.8157779401022642, "grad_norm": 5.987215995788574, "learning_rate": 8.458458555170085e-06, "loss": 1.002350425720215, "mean_token_accuracy": 0.7662376806139946, "num_tokens": 22735672.0, "step": 2410 }, { "entropy": 1.7254829376935958, "epoch": 2.8274653031409787, "grad_norm": 6.598609447479248, "learning_rate": 8.383725277446634e-06, "loss": 1.0801855087280274, "mean_token_accuracy": 0.769980538636446, "num_tokens": 22804845.0, "step": 2420 }, { "entropy": 1.7012818068265916, "epoch": 2.839152666179693, "grad_norm": 8.625926971435547, "learning_rate": 8.309084577636257e-06, "loss": 1.1284662246704102, "mean_token_accuracy": 0.7693151874467731, "num_tokens": 22904012.0, "step": 2430 }, { "entropy": 1.7061614483594894, "epoch": 2.8508400292184075, "grad_norm": 8.639177322387695, "learning_rate": 8.234540731051892e-06, "loss": 1.002232265472412, "mean_token_accuracy": 0.7625796541571617, "num_tokens": 23003911.0, "step": 2440 }, { "entropy": 1.7662774667143821, "epoch": 2.862527392257122, "grad_norm": 6.118652820587158, "learning_rate": 8.160098007458851e-06, "loss": 0.9007489204406738, "mean_token_accuracy": 0.8074061691761016, "num_tokens": 23096511.0, "step": 2450 }, { "entropy": 1.7794369161128998, "epoch": 2.8742147552958364, "grad_norm": 10.20056438446045, "learning_rate": 8.085760670830262e-06, "loss": 0.8909171104431153, "mean_token_accuracy": 0.7755695793777704, "num_tokens": 23195819.0, "step": 2460 }, { "entropy": 1.7722439236938954, "epoch": 2.885902118334551, "grad_norm": 8.229257583618164, "learning_rate": 8.011532979102857e-06, "loss": 0.9046154975891113, "mean_token_accuracy": 0.7934059891849756, "num_tokens": 23274150.0, "step": 2470 }, { "entropy": 1.6098609887063504, "epoch": 2.897589481373265, "grad_norm": 15.409244537353516, "learning_rate": 7.93741918393304e-06, "loss": 0.908391284942627, "mean_token_accuracy": 0.7439465187489986, "num_tokens": 23380413.0, "step": 2480 }, { "entropy": 1.730226568132639, "epoch": 2.9092768444119796, "grad_norm": 12.290626525878906, "learning_rate": 7.863423530453395e-06, "loss": 0.9404394149780273, "mean_token_accuracy": 0.7837304372340441, "num_tokens": 23487027.0, "step": 2490 }, { "entropy": 1.6866980507969855, "epoch": 2.920964207450694, "grad_norm": 5.37745475769043, "learning_rate": 7.789550257029523e-06, "loss": 1.0467060089111329, "mean_token_accuracy": 0.7495848417282105, "num_tokens": 23590403.0, "step": 2500 }, { "epoch": 2.920964207450694, "eval_entropy": 1.68139323964715, "eval_loss": 0.8828441500663757, "eval_mean_token_accuracy": 0.7800040470901877, "eval_num_tokens": 23590403.0, "eval_runtime": 25.7987, "eval_samples_per_second": 19.846, "eval_steps_per_second": 9.923, "step": 2500 }, { "entropy": 1.7866614565253258, "epoch": 2.9326515704894085, "grad_norm": 2.2976484298706055, "learning_rate": 7.715803595017257e-06, "loss": 1.1191862106323243, "mean_token_accuracy": 0.782800105586648, "num_tokens": 23680505.0, "step": 2510 }, { "entropy": 1.7942629598081112, "epoch": 2.9443389335281225, "grad_norm": 13.736532211303711, "learning_rate": 7.642187768520319e-06, "loss": 1.0881122589111327, "mean_token_accuracy": 0.7522706456482411, "num_tokens": 23766263.0, "step": 2520 }, { "entropy": 1.7226313956081867, "epoch": 2.9560262965668374, "grad_norm": 10.570932388305664, "learning_rate": 7.5687069941483585e-06, "loss": 1.1148384094238282, "mean_token_accuracy": 0.7997437044978142, "num_tokens": 23894715.0, "step": 2530 }, { "entropy": 1.6955727070569993, "epoch": 2.9677136596055513, "grad_norm": 8.713987350463867, "learning_rate": 7.495365480775416e-06, "loss": 1.1579767227172852, "mean_token_accuracy": 0.7260787479579449, "num_tokens": 23990029.0, "step": 2540 }, { "entropy": 1.733625952899456, "epoch": 2.9794010226442658, "grad_norm": 11.137775421142578, "learning_rate": 7.422167429298891e-06, "loss": 0.7303710460662842, "mean_token_accuracy": 0.7830865511670708, "num_tokens": 24052733.0, "step": 2550 }, { "entropy": 1.7853002369403839, "epoch": 2.99108838568298, "grad_norm": 8.832341194152832, "learning_rate": 7.349117032398861e-06, "loss": 1.0320300102233886, "mean_token_accuracy": 0.7854295775294304, "num_tokens": 24131387.0, "step": 2560 }, { "entropy": 1.680047945542769, "epoch": 3.002337472607743, "grad_norm": 3.1155483722686768, "learning_rate": 7.2762184742979716e-06, "loss": 0.981098747253418, "mean_token_accuracy": 0.7597046676394227, "num_tokens": 24225471.0, "step": 2570 }, { "entropy": 1.6457124210894107, "epoch": 3.0140248356464574, "grad_norm": 6.733229637145996, "learning_rate": 7.203475930521764e-06, "loss": 0.7696227073669434, "mean_token_accuracy": 0.8114039119333029, "num_tokens": 24337229.0, "step": 2580 }, { "entropy": 1.6516721569001676, "epoch": 3.025712198685172, "grad_norm": 12.687271118164062, "learning_rate": 7.1308935676594844e-06, "loss": 1.002864933013916, "mean_token_accuracy": 0.8272962253540754, "num_tokens": 24426815.0, "step": 2590 }, { "entropy": 1.5764148704707623, "epoch": 3.0373995617238863, "grad_norm": 4.2337965965271, "learning_rate": 7.058475543125464e-06, "loss": 0.9950182914733887, "mean_token_accuracy": 0.8472901705652476, "num_tokens": 24518098.0, "step": 2600 }, { "epoch": 3.0373995617238863, "eval_entropy": 1.5192026905715466, "eval_loss": 0.9768570065498352, "eval_mean_token_accuracy": 0.7759581801947206, "eval_num_tokens": 24518098.0, "eval_runtime": 25.8115, "eval_samples_per_second": 19.836, "eval_steps_per_second": 9.918, "step": 2600 }, { "entropy": 1.4608647428452968, "epoch": 3.0490869247626002, "grad_norm": 7.60485315322876, "learning_rate": 6.986226004920962e-06, "loss": 0.3722125768661499, "mean_token_accuracy": 0.8802612498402596, "num_tokens": 24614212.0, "step": 2610 }, { "entropy": 1.5466793723404408, "epoch": 3.0607742878013147, "grad_norm": 14.492239952087402, "learning_rate": 6.914149091396564e-06, "loss": 0.9616324424743652, "mean_token_accuracy": 0.8387265991419554, "num_tokens": 24717871.0, "step": 2620 }, { "entropy": 1.5104636751115321, "epoch": 3.072461650840029, "grad_norm": 8.65507984161377, "learning_rate": 6.84224893101519e-06, "loss": 0.8227140426635742, "mean_token_accuracy": 0.8016497645527124, "num_tokens": 24813638.0, "step": 2630 }, { "entropy": 1.680018126219511, "epoch": 3.0841490138787435, "grad_norm": 18.573421478271484, "learning_rate": 6.770529642115566e-06, "loss": 0.8232023239135742, "mean_token_accuracy": 0.8430277239531279, "num_tokens": 24889113.0, "step": 2640 }, { "entropy": 1.6211387872695924, "epoch": 3.095836376917458, "grad_norm": 3.3432164192199707, "learning_rate": 6.698995332676375e-06, "loss": 0.6491162776947021, "mean_token_accuracy": 0.8263424597680569, "num_tokens": 24965540.0, "step": 2650 }, { "entropy": 1.57953934520483, "epoch": 3.1075237399561724, "grad_norm": 3.0218794345855713, "learning_rate": 6.627650100080928e-06, "loss": 0.6824802398681641, "mean_token_accuracy": 0.8291381094604731, "num_tokens": 25071267.0, "step": 2660 }, { "entropy": 1.4782447293400764, "epoch": 3.119211102994887, "grad_norm": 13.621418952941895, "learning_rate": 6.556498030882485e-06, "loss": 0.6709208965301514, "mean_token_accuracy": 0.8171975061297416, "num_tokens": 25201220.0, "step": 2670 }, { "entropy": 1.5655394241213798, "epoch": 3.1308984660336012, "grad_norm": 6.171270847320557, "learning_rate": 6.485543200570192e-06, "loss": 0.6699509620666504, "mean_token_accuracy": 0.8511052500456572, "num_tokens": 25283391.0, "step": 2680 }, { "entropy": 1.5742544181644917, "epoch": 3.1425858290723157, "grad_norm": 4.907659530639648, "learning_rate": 6.414789673335626e-06, "loss": 1.000911808013916, "mean_token_accuracy": 0.8191284120082856, "num_tokens": 25385011.0, "step": 2690 }, { "entropy": 1.5648961946368218, "epoch": 3.15427319211103, "grad_norm": 12.09859848022461, "learning_rate": 6.344241501839999e-06, "loss": 0.8705298423767089, "mean_token_accuracy": 0.8365528151392937, "num_tokens": 25474280.0, "step": 2700 }, { "epoch": 3.15427319211103, "eval_entropy": 1.568035047966987, "eval_loss": 0.9648519158363342, "eval_mean_token_accuracy": 0.7773856642888859, "eval_num_tokens": 25474280.0, "eval_runtime": 25.7826, "eval_samples_per_second": 19.858, "eval_steps_per_second": 9.929, "step": 2700 }, { "entropy": 1.6122384697198868, "epoch": 3.1659605551497445, "grad_norm": 12.385276794433594, "learning_rate": 6.273902726982066e-06, "loss": 0.7094444751739502, "mean_token_accuracy": 0.8283845584839582, "num_tokens": 25574873.0, "step": 2710 }, { "entropy": 1.641030441969633, "epoch": 3.177647918188459, "grad_norm": 10.179749488830566, "learning_rate": 6.2037773776666134e-06, "loss": 0.8775361061096192, "mean_token_accuracy": 0.8321642322465778, "num_tokens": 25667810.0, "step": 2720 }, { "entropy": 1.5741927064955235, "epoch": 3.189335281227173, "grad_norm": 11.339288711547852, "learning_rate": 6.133869470573735e-06, "loss": 0.7079936981201171, "mean_token_accuracy": 0.8223622243851423, "num_tokens": 25750418.0, "step": 2730 }, { "entropy": 1.590510404109955, "epoch": 3.2010226442658873, "grad_norm": 12.17235279083252, "learning_rate": 6.064183009928734e-06, "loss": 0.5684170722961426, "mean_token_accuracy": 0.8493764363229275, "num_tokens": 25875234.0, "step": 2740 }, { "entropy": 1.6075891435146332, "epoch": 3.2127100073046018, "grad_norm": 6.357970714569092, "learning_rate": 5.99472198727278e-06, "loss": 0.7294750690460206, "mean_token_accuracy": 0.7975887570530176, "num_tokens": 25973055.0, "step": 2750 }, { "entropy": 1.5885420821607112, "epoch": 3.224397370343316, "grad_norm": 4.168971061706543, "learning_rate": 5.925490381234278e-06, "loss": 0.8555428504943847, "mean_token_accuracy": 0.8222704697400331, "num_tokens": 26065681.0, "step": 2760 }, { "entropy": 1.5862157940864563, "epoch": 3.2360847333820306, "grad_norm": 6.020169258117676, "learning_rate": 5.856492157300974e-06, "loss": 0.8058023452758789, "mean_token_accuracy": 0.8149345409125089, "num_tokens": 26174598.0, "step": 2770 }, { "entropy": 1.5975151896476745, "epoch": 3.247772096420745, "grad_norm": 5.6602559089660645, "learning_rate": 5.7877312675928135e-06, "loss": 1.0201630592346191, "mean_token_accuracy": 0.8364724058657884, "num_tokens": 26256744.0, "step": 2780 }, { "entropy": 1.503919642418623, "epoch": 3.2594594594594595, "grad_norm": 4.924138069152832, "learning_rate": 5.719211650635586e-06, "loss": 0.6068850994110108, "mean_token_accuracy": 0.8476374715566635, "num_tokens": 26346815.0, "step": 2790 }, { "entropy": 1.5372531875967979, "epoch": 3.271146822498174, "grad_norm": 4.390224933624268, "learning_rate": 5.650937231135318e-06, "loss": 0.46883220672607423, "mean_token_accuracy": 0.8634121883660555, "num_tokens": 26468118.0, "step": 2800 }, { "epoch": 3.271146822498174, "eval_entropy": 1.5128659757319838, "eval_loss": 0.9976800680160522, "eval_mean_token_accuracy": 0.7753782341023907, "eval_num_tokens": 26468118.0, "eval_runtime": 25.7109, "eval_samples_per_second": 19.914, "eval_steps_per_second": 9.957, "step": 2800 }, { "entropy": 1.605018461495638, "epoch": 3.2828341855368883, "grad_norm": 7.420022487640381, "learning_rate": 5.582911919753477e-06, "loss": 1.0460566520690917, "mean_token_accuracy": 0.8201792851090431, "num_tokens": 26567024.0, "step": 2810 }, { "entropy": 1.508357545733452, "epoch": 3.2945215485756028, "grad_norm": 12.932101249694824, "learning_rate": 5.515139612882967e-06, "loss": 0.6858778953552246, "mean_token_accuracy": 0.8464779894798994, "num_tokens": 26660259.0, "step": 2820 }, { "entropy": 1.598171342909336, "epoch": 3.306208911614317, "grad_norm": 4.748000144958496, "learning_rate": 5.447624192424952e-06, "loss": 0.8176912307739258, "mean_token_accuracy": 0.8116229582577944, "num_tokens": 26730113.0, "step": 2830 }, { "entropy": 1.588581071048975, "epoch": 3.317896274653031, "grad_norm": 5.392555236816406, "learning_rate": 5.38036952556652e-06, "loss": 0.6881934642791748, "mean_token_accuracy": 0.8470692213624715, "num_tokens": 26802049.0, "step": 2840 }, { "entropy": 1.5943341687321664, "epoch": 3.329583637691746, "grad_norm": 7.3894500732421875, "learning_rate": 5.313379464559152e-06, "loss": 0.7837345600128174, "mean_token_accuracy": 0.8450327418744564, "num_tokens": 26880166.0, "step": 2850 }, { "entropy": 1.587635388225317, "epoch": 3.34127100073046, "grad_norm": 10.771740913391113, "learning_rate": 5.24665784649809e-06, "loss": 0.5940907955169678, "mean_token_accuracy": 0.8424886263906955, "num_tokens": 27008877.0, "step": 2860 }, { "entropy": 1.560003275424242, "epoch": 3.3529583637691744, "grad_norm": 12.674657821655273, "learning_rate": 5.18020849310255e-06, "loss": 0.6514994144439697, "mean_token_accuracy": 0.866674953326583, "num_tokens": 27077965.0, "step": 2870 }, { "entropy": 1.5951070837676524, "epoch": 3.364645726807889, "grad_norm": 5.081298351287842, "learning_rate": 5.1140352104968036e-06, "loss": 0.7107437133789063, "mean_token_accuracy": 0.8551860637962818, "num_tokens": 27180562.0, "step": 2880 }, { "entropy": 1.6164423182606698, "epoch": 3.3763330898466033, "grad_norm": 9.870444297790527, "learning_rate": 5.048141788992196e-06, "loss": 0.7967389106750489, "mean_token_accuracy": 0.853261298686266, "num_tokens": 27282879.0, "step": 2890 }, { "entropy": 1.6636493735015392, "epoch": 3.3880204528853177, "grad_norm": 6.572866439819336, "learning_rate": 4.9825320028700095e-06, "loss": 0.9500320434570313, "mean_token_accuracy": 0.8208385236561299, "num_tokens": 27380404.0, "step": 2900 }, { "epoch": 3.3880204528853177, "eval_entropy": 1.5524416451808065, "eval_loss": 0.9850968718528748, "eval_mean_token_accuracy": 0.7797762223053724, "eval_num_tokens": 27380404.0, "eval_runtime": 25.7175, "eval_samples_per_second": 19.909, "eval_steps_per_second": 9.954, "step": 2900 }, { "entropy": 1.602518045157194, "epoch": 3.399707815924032, "grad_norm": 12.991669654846191, "learning_rate": 4.917209610165313e-06, "loss": 0.8542160987854004, "mean_token_accuracy": 0.8111366737633944, "num_tokens": 27466267.0, "step": 2910 }, { "entropy": 1.61616507768631, "epoch": 3.4113951789627466, "grad_norm": 16.112041473388672, "learning_rate": 4.852178352451684e-06, "loss": 0.7797205448150635, "mean_token_accuracy": 0.8485843721777201, "num_tokens": 27531040.0, "step": 2920 }, { "entropy": 1.6173233568668366, "epoch": 3.423082542001461, "grad_norm": 10.032934188842773, "learning_rate": 4.787441954626895e-06, "loss": 0.9266670227050782, "mean_token_accuracy": 0.8322351593524218, "num_tokens": 27633161.0, "step": 2930 }, { "entropy": 1.6111929923295976, "epoch": 3.4347699050401754, "grad_norm": 9.466462135314941, "learning_rate": 4.723004124699577e-06, "loss": 0.8797435760498047, "mean_token_accuracy": 0.8217988926917315, "num_tokens": 27736153.0, "step": 2940 }, { "entropy": 1.5657838113605975, "epoch": 3.44645726807889, "grad_norm": 15.69760799407959, "learning_rate": 4.658868553576805e-06, "loss": 0.9593112945556641, "mean_token_accuracy": 0.8162898249924183, "num_tokens": 27844716.0, "step": 2950 }, { "entropy": 1.6370114475488662, "epoch": 3.4581446311176043, "grad_norm": 4.239508628845215, "learning_rate": 4.5950389148527085e-06, "loss": 0.6190831184387207, "mean_token_accuracy": 0.8207410082221032, "num_tokens": 27938760.0, "step": 2960 }, { "entropy": 1.566064177453518, "epoch": 3.4698319941563183, "grad_norm": 8.937148094177246, "learning_rate": 4.531518864598047e-06, "loss": 0.9580602645874023, "mean_token_accuracy": 0.8286993879824877, "num_tokens": 28026597.0, "step": 2970 }, { "entropy": 1.5721587441861629, "epoch": 3.4815193571950327, "grad_norm": 6.707186222076416, "learning_rate": 4.468312041150786e-06, "loss": 0.7670645236968994, "mean_token_accuracy": 0.8451792266219854, "num_tokens": 28109861.0, "step": 2980 }, { "entropy": 1.6193489938974381, "epoch": 3.493206720233747, "grad_norm": 10.167534828186035, "learning_rate": 4.405422064907705e-06, "loss": 0.7182933807373046, "mean_token_accuracy": 0.8424388956278562, "num_tokens": 28174568.0, "step": 2990 }, { "entropy": 1.5938150033354759, "epoch": 3.5048940832724615, "grad_norm": 13.018750190734863, "learning_rate": 4.342852538117039e-06, "loss": 0.7092568874359131, "mean_token_accuracy": 0.79365440197289, "num_tokens": 28270921.0, "step": 3000 }, { "epoch": 3.5048940832724615, "eval_entropy": 1.5361103469040245, "eval_loss": 0.9802736639976501, "eval_mean_token_accuracy": 0.7784652556874789, "eval_num_tokens": 28270921.0, "eval_runtime": 25.7697, "eval_samples_per_second": 19.868, "eval_steps_per_second": 9.934, "step": 3000 }, { "entropy": 1.5311009913682938, "epoch": 3.516581446311176, "grad_norm": 7.245090961456299, "learning_rate": 4.28060704467212e-06, "loss": 0.7434425830841065, "mean_token_accuracy": 0.8339184015989304, "num_tokens": 28378122.0, "step": 3010 }, { "entropy": 1.4980362571775914, "epoch": 3.5282688093498904, "grad_norm": 17.133398056030273, "learning_rate": 4.218689149906121e-06, "loss": 0.8883539199829101, "mean_token_accuracy": 0.817000538855791, "num_tokens": 28529232.0, "step": 3020 }, { "entropy": 1.5714292883872987, "epoch": 3.539956172388605, "grad_norm": 19.717315673828125, "learning_rate": 4.157102400387833e-06, "loss": 0.7529812812805176, "mean_token_accuracy": 0.8267618060112, "num_tokens": 28635466.0, "step": 3030 }, { "entropy": 1.5960691340267659, "epoch": 3.5516435354273193, "grad_norm": 6.638236045837402, "learning_rate": 4.095850323718506e-06, "loss": 0.9807650566101074, "mean_token_accuracy": 0.7975058563053607, "num_tokens": 28713584.0, "step": 3040 }, { "entropy": 1.6240007340908051, "epoch": 3.5633308984660337, "grad_norm": 15.817234992980957, "learning_rate": 4.034936428329821e-06, "loss": 0.7442534923553467, "mean_token_accuracy": 0.8348729437217116, "num_tokens": 28786109.0, "step": 3050 }, { "entropy": 1.619672079384327, "epoch": 3.575018261504748, "grad_norm": 15.655887603759766, "learning_rate": 3.9743642032829025e-06, "loss": 0.6672632217407226, "mean_token_accuracy": 0.8341505564749241, "num_tokens": 28885318.0, "step": 3060 }, { "entropy": 1.57230226919055, "epoch": 3.5867056245434625, "grad_norm": 11.126214981079102, "learning_rate": 3.9141371180684925e-06, "loss": 0.7392642974853516, "mean_token_accuracy": 0.8424083676189185, "num_tokens": 29001941.0, "step": 3070 }, { "entropy": 1.6307076066732407, "epoch": 3.5983929875821765, "grad_norm": 18.03298568725586, "learning_rate": 3.854258622408224e-06, "loss": 0.7791270732879638, "mean_token_accuracy": 0.8376510888338089, "num_tokens": 29091052.0, "step": 3080 }, { "entropy": 1.626028150320053, "epoch": 3.6100803506208914, "grad_norm": 10.079829216003418, "learning_rate": 3.794732146056994e-06, "loss": 0.8839334487915039, "mean_token_accuracy": 0.8311299357563258, "num_tokens": 29176529.0, "step": 3090 }, { "entropy": 1.5933189503848553, "epoch": 3.6217677136596054, "grad_norm": 5.836792469024658, "learning_rate": 3.7355610986065603e-06, "loss": 0.8301555633544921, "mean_token_accuracy": 0.8122006464749575, "num_tokens": 29273688.0, "step": 3100 }, { "epoch": 3.6217677136596054, "eval_entropy": 1.5353019393514842, "eval_loss": 0.9783096313476562, "eval_mean_token_accuracy": 0.7775824166019447, "eval_num_tokens": 29273688.0, "eval_runtime": 25.7699, "eval_samples_per_second": 19.868, "eval_steps_per_second": 9.934, "step": 3100 }, { "entropy": 1.5506984524428844, "epoch": 3.63345507669832, "grad_norm": 13.009007453918457, "learning_rate": 3.6767488692901986e-06, "loss": 1.003788948059082, "mean_token_accuracy": 0.8538006644695997, "num_tokens": 29369843.0, "step": 3110 }, { "entropy": 1.6343820162117482, "epoch": 3.6451424397370342, "grad_norm": 12.708909034729004, "learning_rate": 3.6182988267886075e-06, "loss": 0.8828207015991211, "mean_token_accuracy": 0.8102234560996294, "num_tokens": 29472323.0, "step": 3120 }, { "entropy": 1.6717104703187942, "epoch": 3.6568298027757487, "grad_norm": 5.6012372970581055, "learning_rate": 3.560214319036939e-06, "loss": 0.9180915832519532, "mean_token_accuracy": 0.8062344901263714, "num_tokens": 29553235.0, "step": 3130 }, { "entropy": 1.6026974506676197, "epoch": 3.668517165814463, "grad_norm": 4.241550922393799, "learning_rate": 3.502498673033026e-06, "loss": 0.9951177597045898, "mean_token_accuracy": 0.8040497414767742, "num_tokens": 29657479.0, "step": 3140 }, { "entropy": 1.5968347743153573, "epoch": 3.6802045288531775, "grad_norm": 2.9298970699310303, "learning_rate": 3.4451551946468388e-06, "loss": 0.9118948936462402, "mean_token_accuracy": 0.8074416333809495, "num_tokens": 29761255.0, "step": 3150 }, { "entropy": 1.6103530064225198, "epoch": 3.691891891891892, "grad_norm": 9.836130142211914, "learning_rate": 3.3881871684311072e-06, "loss": 0.7951117992401123, "mean_token_accuracy": 0.8442521400749683, "num_tokens": 29834342.0, "step": 3160 }, { "entropy": 1.5771130241453648, "epoch": 3.7035792549306064, "grad_norm": 18.111557006835938, "learning_rate": 3.3315978574331965e-06, "loss": 0.835960865020752, "mean_token_accuracy": 0.8475918430835009, "num_tokens": 29913123.0, "step": 3170 }, { "entropy": 1.5974742673337459, "epoch": 3.715266617969321, "grad_norm": 4.7492356300354, "learning_rate": 3.27539050300821e-06, "loss": 0.5852916717529297, "mean_token_accuracy": 0.8310256112366915, "num_tokens": 30019110.0, "step": 3180 }, { "entropy": 1.572141046077013, "epoch": 3.726953981008035, "grad_norm": 16.682342529296875, "learning_rate": 3.2195683246333222e-06, "loss": 0.6440595626831055, "mean_token_accuracy": 0.8504274129867554, "num_tokens": 30130813.0, "step": 3190 }, { "entropy": 1.5826921932399274, "epoch": 3.7386413440467496, "grad_norm": 9.478453636169434, "learning_rate": 3.164134519723363e-06, "loss": 0.7726956367492676, "mean_token_accuracy": 0.8257674686610699, "num_tokens": 30213017.0, "step": 3200 }, { "epoch": 3.7386413440467496, "eval_entropy": 1.5459002966526896, "eval_loss": 0.986714243888855, "eval_mean_token_accuracy": 0.7754447851912118, "eval_num_tokens": 30213017.0, "eval_runtime": 25.7116, "eval_samples_per_second": 19.913, "eval_steps_per_second": 9.957, "step": 3200 }, { "entropy": 1.6052772656083107, "epoch": 3.7503287070854636, "grad_norm": 9.236588478088379, "learning_rate": 3.1090922634476963e-06, "loss": 0.9195019721984863, "mean_token_accuracy": 0.8050499334931374, "num_tokens": 30299301.0, "step": 3210 }, { "entropy": 1.641640916466713, "epoch": 3.7620160701241785, "grad_norm": 4.644353866577148, "learning_rate": 3.0544447085483254e-06, "loss": 0.8934274673461914, "mean_token_accuracy": 0.8232223711907863, "num_tokens": 30411060.0, "step": 3220 }, { "entropy": 1.654336377978325, "epoch": 3.7737034331628925, "grad_norm": 16.278533935546875, "learning_rate": 3.0001949851593303e-06, "loss": 0.5742102146148682, "mean_token_accuracy": 0.8475374035537243, "num_tokens": 30516903.0, "step": 3230 }, { "entropy": 1.616222647577524, "epoch": 3.785390796201607, "grad_norm": 8.386667251586914, "learning_rate": 2.9463462006275713e-06, "loss": 0.8853543281555176, "mean_token_accuracy": 0.8166571896523237, "num_tokens": 30604895.0, "step": 3240 }, { "entropy": 1.6252083383500575, "epoch": 3.7970781592403213, "grad_norm": 8.474164009094238, "learning_rate": 2.89290143933469e-06, "loss": 0.8446044921875, "mean_token_accuracy": 0.8179089311510325, "num_tokens": 30701843.0, "step": 3250 }, { "entropy": 1.5914750188589095, "epoch": 3.8087655222790358, "grad_norm": 18.274063110351562, "learning_rate": 2.839863762520465e-06, "loss": 0.949248218536377, "mean_token_accuracy": 0.8415104635059834, "num_tokens": 30818695.0, "step": 3260 }, { "entropy": 1.5075955897569657, "epoch": 3.82045288531775, "grad_norm": 13.18472957611084, "learning_rate": 2.787236208107447e-06, "loss": 0.7748193264007568, "mean_token_accuracy": 0.8260310523211956, "num_tokens": 30903136.0, "step": 3270 }, { "entropy": 1.5381855167448522, "epoch": 3.8321402483564646, "grad_norm": 9.492990493774414, "learning_rate": 2.7350217905269647e-06, "loss": 0.8508004188537598, "mean_token_accuracy": 0.8153258223086596, "num_tokens": 30996158.0, "step": 3280 }, { "entropy": 1.5866551384329797, "epoch": 3.843827611395179, "grad_norm": 2.584268093109131, "learning_rate": 2.6832235005464613e-06, "loss": 0.9541184425354003, "mean_token_accuracy": 0.8241108991205692, "num_tokens": 31110506.0, "step": 3290 }, { "entropy": 1.5242624171078205, "epoch": 3.8555149744338935, "grad_norm": 3.608710765838623, "learning_rate": 2.6318443050981724e-06, "loss": 0.7596922397613526, "mean_token_accuracy": 0.8370095491409302, "num_tokens": 31189416.0, "step": 3300 }, { "epoch": 3.8555149744338935, "eval_entropy": 1.5232528802007437, "eval_loss": 1.001417636871338, "eval_mean_token_accuracy": 0.7767663078266196, "eval_num_tokens": 31189416.0, "eval_runtime": 25.7771, "eval_samples_per_second": 19.863, "eval_steps_per_second": 9.931, "step": 3300 }, { "entropy": 1.6016543589532375, "epoch": 3.867202337472608, "grad_norm": 14.472838401794434, "learning_rate": 2.58088714710921e-06, "loss": 0.8808462142944335, "mean_token_accuracy": 0.8050676196813583, "num_tokens": 31281413.0, "step": 3310 }, { "entropy": 1.6534620575606822, "epoch": 3.878889700511322, "grad_norm": 9.369660377502441, "learning_rate": 2.530354945332971e-06, "loss": 0.9108871459960938, "mean_token_accuracy": 0.7937086772173643, "num_tokens": 31358593.0, "step": 3320 }, { "entropy": 1.5693632565438747, "epoch": 3.8905770635500367, "grad_norm": 13.68409538269043, "learning_rate": 2.4802505941819676e-06, "loss": 0.830049705505371, "mean_token_accuracy": 0.8499936047941447, "num_tokens": 31423709.0, "step": 3330 }, { "entropy": 1.662206082046032, "epoch": 3.9022644265887507, "grad_norm": 12.3108549118042, "learning_rate": 2.4305769635620437e-06, "loss": 0.8518457412719727, "mean_token_accuracy": 0.8457265257835388, "num_tokens": 31492140.0, "step": 3340 }, { "entropy": 1.598170468211174, "epoch": 3.913951789627465, "grad_norm": 10.65058422088623, "learning_rate": 2.38133689870798e-06, "loss": 0.8946051597595215, "mean_token_accuracy": 0.8331818394362926, "num_tokens": 31608730.0, "step": 3350 }, { "entropy": 1.5221158944070339, "epoch": 3.9256391526661796, "grad_norm": 14.990571975708008, "learning_rate": 2.332533220020532e-06, "loss": 0.740440034866333, "mean_token_accuracy": 0.8109488438814878, "num_tokens": 31699928.0, "step": 3360 }, { "entropy": 1.6108482152223587, "epoch": 3.937326515704894, "grad_norm": 8.693507194519043, "learning_rate": 2.2841687229048725e-06, "loss": 0.9768977165222168, "mean_token_accuracy": 0.7872534088790417, "num_tokens": 31780388.0, "step": 3370 }, { "entropy": 1.6088899463415145, "epoch": 3.9490138787436084, "grad_norm": 8.17825698852539, "learning_rate": 2.2362461776104782e-06, "loss": 0.7007026195526123, "mean_token_accuracy": 0.8478230189532041, "num_tokens": 31865549.0, "step": 3380 }, { "entropy": 1.6720139175653457, "epoch": 3.960701241782323, "grad_norm": 8.937295913696289, "learning_rate": 2.1887683290724614e-06, "loss": 0.9712643623352051, "mean_token_accuracy": 0.8152873106300831, "num_tokens": 31982142.0, "step": 3390 }, { "entropy": 1.5667199984192848, "epoch": 3.9723886048210373, "grad_norm": 14.313366889953613, "learning_rate": 2.14173789675434e-06, "loss": 0.6438870906829834, "mean_token_accuracy": 0.8526704031974077, "num_tokens": 32065588.0, "step": 3400 }, { "epoch": 3.9723886048210373, "eval_entropy": 1.5291059061419219, "eval_loss": 0.9952678084373474, "eval_mean_token_accuracy": 0.7729721296927892, "eval_num_tokens": 32065588.0, "eval_runtime": 25.733, "eval_samples_per_second": 19.897, "eval_steps_per_second": 9.948, "step": 3400 }, { "entropy": 1.6004819676280022, "epoch": 3.9840759678597517, "grad_norm": 6.698596477508545, "learning_rate": 2.095157574492256e-06, "loss": 0.7810785293579101, "mean_token_accuracy": 0.8351054944097995, "num_tokens": 32149132.0, "step": 3410 }, { "entropy": 1.585545502603054, "epoch": 3.995763330898466, "grad_norm": 11.226009368896484, "learning_rate": 2.0490300303407017e-06, "loss": 0.7629546165466309, "mean_token_accuracy": 0.8441075064241886, "num_tokens": 32236727.0, "step": 3420 }, { "entropy": 1.6049067532861387, "epoch": 4.007012417823229, "grad_norm": 12.657943725585938, "learning_rate": 2.003357906419675e-06, "loss": 0.9035828590393067, "mean_token_accuracy": 0.849897534429253, "num_tokens": 32332063.0, "step": 3430 }, { "entropy": 1.6062161587178707, "epoch": 4.018699780861943, "grad_norm": 5.047912120819092, "learning_rate": 1.9581438187633574e-06, "loss": 0.7564874649047851, "mean_token_accuracy": 0.8432585556060076, "num_tokens": 32435755.0, "step": 3440 }, { "entropy": 1.5072905823588372, "epoch": 4.030387143900658, "grad_norm": 9.871566772460938, "learning_rate": 1.9133903571702683e-06, "loss": 0.6225325584411621, "mean_token_accuracy": 0.8637531939893961, "num_tokens": 32562287.0, "step": 3450 }, { "entropy": 1.537027009576559, "epoch": 4.042074506939372, "grad_norm": 8.626612663269043, "learning_rate": 1.8691000850549113e-06, "loss": 0.8337360382080078, "mean_token_accuracy": 0.8501617223024368, "num_tokens": 32671873.0, "step": 3460 }, { "entropy": 1.51291029676795, "epoch": 4.053761869978087, "grad_norm": 9.0525541305542, "learning_rate": 1.8252755393009703e-06, "loss": 0.7315142631530762, "mean_token_accuracy": 0.8678522855043411, "num_tokens": 32758685.0, "step": 3470 }, { "entropy": 1.4968296751379966, "epoch": 4.065449233016801, "grad_norm": 17.39091682434082, "learning_rate": 1.781919230115976e-06, "loss": 0.7731627464294434, "mean_token_accuracy": 0.8328946858644486, "num_tokens": 32891368.0, "step": 3480 }, { "entropy": 1.5203113228082656, "epoch": 4.077136596055515, "grad_norm": 16.395082473754883, "learning_rate": 1.739033640887544e-06, "loss": 0.8280654907226562, "mean_token_accuracy": 0.85667341388762, "num_tokens": 32957112.0, "step": 3490 }, { "entropy": 1.482571394741535, "epoch": 4.0888239590942295, "grad_norm": 12.730628967285156, "learning_rate": 1.6966212280411132e-06, "loss": 0.631969404220581, "mean_token_accuracy": 0.8859272848814725, "num_tokens": 33043416.0, "step": 3500 }, { "epoch": 4.0888239590942295, "eval_entropy": 1.4247404006309807, "eval_loss": 1.082817792892456, "eval_mean_token_accuracy": 0.7681574639282189, "eval_num_tokens": 33043416.0, "eval_runtime": 25.7662, "eval_samples_per_second": 19.871, "eval_steps_per_second": 9.935, "step": 3500 }, { "entropy": 1.4882067143917084, "epoch": 4.1005113221329434, "grad_norm": 6.573575019836426, "learning_rate": 1.6546844208992608e-06, "loss": 0.5050776481628418, "mean_token_accuracy": 0.889410063624382, "num_tokens": 33130484.0, "step": 3510 }, { "entropy": 1.4168844483792782, "epoch": 4.112198685171658, "grad_norm": 6.81123685836792, "learning_rate": 1.6132256215425468e-06, "loss": 0.6945844173431397, "mean_token_accuracy": 0.847281289473176, "num_tokens": 33248127.0, "step": 3520 }, { "entropy": 1.4985774755477905, "epoch": 4.123886048210372, "grad_norm": 10.758625984191895, "learning_rate": 1.5722472046719206e-06, "loss": 0.6711455345153808, "mean_token_accuracy": 0.8636624123901129, "num_tokens": 33336070.0, "step": 3530 }, { "entropy": 1.4610992252826691, "epoch": 4.135573411249087, "grad_norm": 15.049446105957031, "learning_rate": 1.5317515174727072e-06, "loss": 0.802742862701416, "mean_token_accuracy": 0.8524734176695347, "num_tokens": 33453623.0, "step": 3540 }, { "entropy": 1.5617326445877553, "epoch": 4.147260774287801, "grad_norm": 11.841690063476562, "learning_rate": 1.4917408794801713e-06, "loss": 1.0538336753845214, "mean_token_accuracy": 0.855667357891798, "num_tokens": 33556725.0, "step": 3550 }, { "entropy": 1.4895190350711345, "epoch": 4.158948137326516, "grad_norm": 11.605788230895996, "learning_rate": 1.4522175824466456e-06, "loss": 0.410538911819458, "mean_token_accuracy": 0.8785954911261797, "num_tokens": 33640487.0, "step": 3560 }, { "entropy": 1.5349566243588924, "epoch": 4.17063550036523, "grad_norm": 9.695292472839355, "learning_rate": 1.413183890210269e-06, "loss": 0.7333604335784912, "mean_token_accuracy": 0.8444879058748483, "num_tokens": 33728729.0, "step": 3570 }, { "entropy": 1.5703273810446263, "epoch": 4.182322863403945, "grad_norm": 17.130413055419922, "learning_rate": 1.3746420385653114e-06, "loss": 0.8191527366638184, "mean_token_accuracy": 0.8597231294959784, "num_tokens": 33822770.0, "step": 3580 }, { "entropy": 1.4822659127414226, "epoch": 4.194010226442659, "grad_norm": 11.312241554260254, "learning_rate": 1.3365942351341154e-06, "loss": 0.6811165332794189, "mean_token_accuracy": 0.8470007635653019, "num_tokens": 33903162.0, "step": 3590 }, { "entropy": 1.4625447377562524, "epoch": 4.205697589481373, "grad_norm": 11.12173080444336, "learning_rate": 1.299042659240649e-06, "loss": 0.48247838020324707, "mean_token_accuracy": 0.8694281630218029, "num_tokens": 33985395.0, "step": 3600 }, { "epoch": 4.205697589481373, "eval_entropy": 1.4456222346052527, "eval_loss": 1.081959843635559, "eval_mean_token_accuracy": 0.7688928706920706, "eval_num_tokens": 33985395.0, "eval_runtime": 25.7644, "eval_samples_per_second": 19.872, "eval_steps_per_second": 9.936, "step": 3600 }, { "entropy": 1.4896874025464057, "epoch": 4.217384952520088, "grad_norm": 9.842438697814941, "learning_rate": 1.2619894617856742e-06, "loss": 0.4823128700256348, "mean_token_accuracy": 0.8850070510059596, "num_tokens": 34119058.0, "step": 3610 }, { "entropy": 1.509472121298313, "epoch": 4.229072315558802, "grad_norm": 7.054241180419922, "learning_rate": 1.22543676512354e-06, "loss": 0.455275821685791, "mean_token_accuracy": 0.8764534253627062, "num_tokens": 34204674.0, "step": 3620 }, { "entropy": 1.4993307389318944, "epoch": 4.240759678597517, "grad_norm": 13.102241516113281, "learning_rate": 1.1893866629406315e-06, "loss": 0.7743210792541504, "mean_token_accuracy": 0.8474247772246599, "num_tokens": 34306251.0, "step": 3630 }, { "entropy": 1.5021223098039627, "epoch": 4.2524470416362306, "grad_norm": 4.396280288696289, "learning_rate": 1.1538412201354288e-06, "loss": 0.8427865028381347, "mean_token_accuracy": 0.8311354946345091, "num_tokens": 34404230.0, "step": 3640 }, { "entropy": 1.4618444450199604, "epoch": 4.264134404674945, "grad_norm": 7.301538944244385, "learning_rate": 1.1188024727002534e-06, "loss": 0.47443537712097167, "mean_token_accuracy": 0.8778236124664545, "num_tokens": 34522556.0, "step": 3650 }, { "entropy": 1.5191793739795685, "epoch": 4.275821767713659, "grad_norm": 9.962055206298828, "learning_rate": 1.0842724276046256e-06, "loss": 0.7483959674835206, "mean_token_accuracy": 0.8579721502959728, "num_tokens": 34609804.0, "step": 3660 }, { "entropy": 1.5157171241939067, "epoch": 4.287509130752374, "grad_norm": 18.916194915771484, "learning_rate": 1.0502530626803298e-06, "loss": 0.9998998641967773, "mean_token_accuracy": 0.8502737872302533, "num_tokens": 34703516.0, "step": 3670 }, { "entropy": 1.4906326524913311, "epoch": 4.299196493791088, "grad_norm": 12.003247261047363, "learning_rate": 1.0167463265081167e-06, "loss": 0.5675338745117188, "mean_token_accuracy": 0.8700988806784153, "num_tokens": 34819893.0, "step": 3680 }, { "entropy": 1.4966869540512562, "epoch": 4.310883856829803, "grad_norm": 10.846487045288086, "learning_rate": 9.837541383060856e-07, "loss": 0.6726597785949707, "mean_token_accuracy": 0.8683340221643447, "num_tokens": 34895479.0, "step": 3690 }, { "entropy": 1.5521662652492523, "epoch": 4.322571219868517, "grad_norm": 3.344892740249634, "learning_rate": 9.512783878197706e-07, "loss": 0.9508964538574218, "mean_token_accuracy": 0.8919697389006614, "num_tokens": 34984093.0, "step": 3700 }, { "epoch": 4.322571219868517, "eval_entropy": 1.4454550298396498, "eval_loss": 1.091646432876587, "eval_mean_token_accuracy": 0.7666249158210121, "eval_num_tokens": 34984093.0, "eval_runtime": 25.7364, "eval_samples_per_second": 19.894, "eval_steps_per_second": 9.947, "step": 3700 }, { "entropy": 1.5254233829677104, "epoch": 4.334258582907232, "grad_norm": 14.212644577026367, "learning_rate": 9.193209352138821e-07, "loss": 0.7793136596679687, "mean_token_accuracy": 0.8753752745687962, "num_tokens": 35068569.0, "step": 3710 }, { "entropy": 1.5292565569281578, "epoch": 4.345945945945946, "grad_norm": 4.882772445678711, "learning_rate": 8.878836109657695e-07, "loss": 0.7594774723052978, "mean_token_accuracy": 0.862102884426713, "num_tokens": 35171062.0, "step": 3720 }, { "entropy": 1.5290693864226341, "epoch": 4.35763330898466, "grad_norm": 6.212003231048584, "learning_rate": 8.56968215760573e-07, "loss": 0.6331298828125, "mean_token_accuracy": 0.8548883602023125, "num_tokens": 35247873.0, "step": 3730 }, { "entropy": 1.5127065040171146, "epoch": 4.369320672023375, "grad_norm": 17.832643508911133, "learning_rate": 8.265765203880772e-07, "loss": 0.5699717998504639, "mean_token_accuracy": 0.8602051839232445, "num_tokens": 35348167.0, "step": 3740 }, { "entropy": 1.4995207540690898, "epoch": 4.381008035062089, "grad_norm": 5.200070381164551, "learning_rate": 7.967102656412862e-07, "loss": 0.8409076690673828, "mean_token_accuracy": 0.8699726138263941, "num_tokens": 35462236.0, "step": 3750 }, { "entropy": 1.5289938576519488, "epoch": 4.392695398100804, "grad_norm": 19.55994415283203, "learning_rate": 7.673711622167157e-07, "loss": 0.6666640758514404, "mean_token_accuracy": 0.859628439322114, "num_tokens": 35550776.0, "step": 3760 }, { "entropy": 1.5315737001597882, "epoch": 4.404382761139518, "grad_norm": 12.47616195678711, "learning_rate": 7.385608906164077e-07, "loss": 0.6564251899719238, "mean_token_accuracy": 0.8807011146098376, "num_tokens": 35638550.0, "step": 3770 }, { "entropy": 1.476715262979269, "epoch": 4.4160701241782325, "grad_norm": 7.14960241317749, "learning_rate": 7.102811010516664e-07, "loss": 0.757103967666626, "mean_token_accuracy": 0.8514522429555654, "num_tokens": 35754784.0, "step": 3780 }, { "entropy": 1.4561194486916065, "epoch": 4.4277574872169465, "grad_norm": 11.394071578979492, "learning_rate": 6.825334133485418e-07, "loss": 0.6637251853942872, "mean_token_accuracy": 0.8669286124408245, "num_tokens": 35867378.0, "step": 3790 }, { "entropy": 1.4877830192446708, "epoch": 4.439444850255661, "grad_norm": 15.398336410522461, "learning_rate": 6.553194168550459e-07, "loss": 0.690100908279419, "mean_token_accuracy": 0.8517809867858886, "num_tokens": 35952362.0, "step": 3800 }, { "epoch": 4.439444850255661, "eval_entropy": 1.4464607145637274, "eval_loss": 1.0888185501098633, "eval_mean_token_accuracy": 0.769485326425638, "eval_num_tokens": 35952362.0, "eval_runtime": 25.7253, "eval_samples_per_second": 19.903, "eval_steps_per_second": 9.951, "step": 3800 }, { "entropy": 1.5209308765828609, "epoch": 4.451132213294375, "grad_norm": 8.16495418548584, "learning_rate": 6.286406703501246e-07, "loss": 0.7843871593475342, "mean_token_accuracy": 0.8423004079610109, "num_tokens": 36016101.0, "step": 3810 }, { "entropy": 1.5262306325137616, "epoch": 4.46281957633309, "grad_norm": 18.60768699645996, "learning_rate": 6.024987019543593e-07, "loss": 0.8075613975524902, "mean_token_accuracy": 0.8136255025863648, "num_tokens": 36106339.0, "step": 3820 }, { "entropy": 1.5524603478610515, "epoch": 4.474506939371804, "grad_norm": 13.132192611694336, "learning_rate": 5.768950090424518e-07, "loss": 0.8062433242797852, "mean_token_accuracy": 0.8343270730227232, "num_tokens": 36203691.0, "step": 3830 }, { "entropy": 1.474081838876009, "epoch": 4.486194302410519, "grad_norm": 14.549166679382324, "learning_rate": 5.518310581574515e-07, "loss": 0.5784972667694092, "mean_token_accuracy": 0.8847128123044967, "num_tokens": 36274772.0, "step": 3840 }, { "entropy": 1.5090869426727296, "epoch": 4.497881665449233, "grad_norm": 11.738391876220703, "learning_rate": 5.273082849267474e-07, "loss": 0.9710038185119629, "mean_token_accuracy": 0.8665750682353973, "num_tokens": 36364248.0, "step": 3850 }, { "entropy": 1.575214620679617, "epoch": 4.509569028487947, "grad_norm": 12.552297592163086, "learning_rate": 5.033280939798502e-07, "loss": 0.6691967487335205, "mean_token_accuracy": 0.8502339717000723, "num_tokens": 36454192.0, "step": 3860 }, { "entropy": 1.540502169728279, "epoch": 4.521256391526662, "grad_norm": 10.250284194946289, "learning_rate": 4.798918588679269e-07, "loss": 0.7413430213928223, "mean_token_accuracy": 0.8937609244138003, "num_tokens": 36545450.0, "step": 3870 }, { "entropy": 1.4876162141561509, "epoch": 4.532943754565376, "grad_norm": 5.206379413604736, "learning_rate": 4.570009219851312e-07, "loss": 0.7229172229766846, "mean_token_accuracy": 0.8560761611908674, "num_tokens": 36647090.0, "step": 3880 }, { "entropy": 1.505126003175974, "epoch": 4.544631117604091, "grad_norm": 10.110809326171875, "learning_rate": 4.346565944917114e-07, "loss": 0.7667391777038575, "mean_token_accuracy": 0.8541755691170693, "num_tokens": 36758188.0, "step": 3890 }, { "entropy": 1.4865600690245628, "epoch": 4.556318480642805, "grad_norm": 4.7262043952941895, "learning_rate": 4.1286015623890674e-07, "loss": 0.5576696872711182, "mean_token_accuracy": 0.8558296959847211, "num_tokens": 36850488.0, "step": 3900 }, { "epoch": 4.556318480642805, "eval_entropy": 1.4396855637896806, "eval_loss": 1.0947682857513428, "eval_mean_token_accuracy": 0.7694231180357747, "eval_num_tokens": 36850488.0, "eval_runtime": 25.6913, "eval_samples_per_second": 19.929, "eval_steps_per_second": 9.964, "step": 3900 }, { "entropy": 1.4926868014037609, "epoch": 4.56800584368152, "grad_norm": 8.493346214294434, "learning_rate": 3.9161285569564114e-07, "loss": 0.4650919437408447, "mean_token_accuracy": 0.8972312148660422, "num_tokens": 36923777.0, "step": 3910 }, { "entropy": 1.522305753827095, "epoch": 4.579693206720234, "grad_norm": 16.466768264770508, "learning_rate": 3.709159098770165e-07, "loss": 0.7419657230377197, "mean_token_accuracy": 0.8645104166120291, "num_tokens": 37010882.0, "step": 3920 }, { "entropy": 1.5289164453744888, "epoch": 4.5913805697589485, "grad_norm": 5.047861099243164, "learning_rate": 3.507705042745979e-07, "loss": 0.7584509372711181, "mean_token_accuracy": 0.857337387278676, "num_tokens": 37082099.0, "step": 3930 }, { "entropy": 1.4429242953658103, "epoch": 4.6030679327976625, "grad_norm": 8.835667610168457, "learning_rate": 3.3117779278851294e-07, "loss": 0.4135472297668457, "mean_token_accuracy": 0.8845292035490274, "num_tokens": 37179248.0, "step": 3940 }, { "entropy": 1.5127482995390893, "epoch": 4.6147552958363764, "grad_norm": 8.691869735717773, "learning_rate": 3.121388976613582e-07, "loss": 0.5384024143218994, "mean_token_accuracy": 0.8384344112128019, "num_tokens": 37287234.0, "step": 3950 }, { "entropy": 1.4824551120400429, "epoch": 4.626442658875091, "grad_norm": 10.049670219421387, "learning_rate": 2.9365490941391626e-07, "loss": 0.754266881942749, "mean_token_accuracy": 0.8504394836723804, "num_tokens": 37395872.0, "step": 3960 }, { "entropy": 1.452832967787981, "epoch": 4.638130021913806, "grad_norm": 4.427601337432861, "learning_rate": 2.7572688678269897e-07, "loss": 0.5318255424499512, "mean_token_accuracy": 0.8919252689927817, "num_tokens": 37476568.0, "step": 3970 }, { "entropy": 1.5254285097122193, "epoch": 4.64981738495252, "grad_norm": 7.1622490882873535, "learning_rate": 2.5835585665929365e-07, "loss": 0.848170280456543, "mean_token_accuracy": 0.8709424588829279, "num_tokens": 37576587.0, "step": 3980 }, { "entropy": 1.561382431536913, "epoch": 4.661504747991234, "grad_norm": 6.549232482910156, "learning_rate": 2.415428140315579e-07, "loss": 0.6186144351959229, "mean_token_accuracy": 0.8826206211000681, "num_tokens": 37676313.0, "step": 3990 }, { "entropy": 1.4810091137886048, "epoch": 4.673192111029949, "grad_norm": 20.657800674438477, "learning_rate": 2.2528872192661312e-07, "loss": 0.5842293262481689, "mean_token_accuracy": 0.8619752835482359, "num_tokens": 37750057.0, "step": 4000 }, { "epoch": 4.673192111029949, "eval_entropy": 1.4375433966051787, "eval_loss": 1.097025990486145, "eval_mean_token_accuracy": 0.7680731810978614, "eval_num_tokens": 37750057.0, "eval_runtime": 25.7161, "eval_samples_per_second": 19.91, "eval_steps_per_second": 9.955, "step": 4000 }, { "entropy": 1.5436802476644516, "epoch": 4.684879474068663, "grad_norm": 6.413429260253906, "learning_rate": 2.095945113556963e-07, "loss": 0.7302318572998047, "mean_token_accuracy": 0.8568271558731795, "num_tokens": 37856446.0, "step": 4010 }, { "entropy": 1.4901932425796987, "epoch": 4.696566837107378, "grad_norm": 19.987340927124023, "learning_rate": 1.9446108126082607e-07, "loss": 0.6349533081054688, "mean_token_accuracy": 0.8936959408223629, "num_tokens": 37930806.0, "step": 4020 }, { "entropy": 1.4795681625604629, "epoch": 4.708254200146092, "grad_norm": 11.290853500366211, "learning_rate": 1.798892984633138e-07, "loss": 0.7728898525238037, "mean_token_accuracy": 0.8658060751855373, "num_tokens": 38020835.0, "step": 4030 }, { "entropy": 1.5635792575776577, "epoch": 4.719941563184807, "grad_norm": 10.672747611999512, "learning_rate": 1.6587999761411455e-07, "loss": 0.5687346458435059, "mean_token_accuracy": 0.8528085239231586, "num_tokens": 38104374.0, "step": 4040 }, { "entropy": 1.4602154590189458, "epoch": 4.731628926223521, "grad_norm": 23.16471290588379, "learning_rate": 1.5243398114602182e-07, "loss": 0.5822049140930176, "mean_token_accuracy": 0.8367134757339955, "num_tokens": 38222689.0, "step": 4050 }, { "entropy": 1.5052896670997142, "epoch": 4.743316289262236, "grad_norm": 16.241004943847656, "learning_rate": 1.395520192276967e-07, "loss": 0.8418606758117676, "mean_token_accuracy": 0.8202387966215611, "num_tokens": 38316782.0, "step": 4060 }, { "entropy": 1.531810101866722, "epoch": 4.75500365230095, "grad_norm": 7.349140644073486, "learning_rate": 1.2723484971956412e-07, "loss": 0.755488920211792, "mean_token_accuracy": 0.8450414523482322, "num_tokens": 38423124.0, "step": 4070 }, { "entropy": 1.584228988736868, "epoch": 4.7666910153396636, "grad_norm": 9.823003768920898, "learning_rate": 1.154831781315413e-07, "loss": 0.968692684173584, "mean_token_accuracy": 0.8501280307769775, "num_tokens": 38521407.0, "step": 4080 }, { "entropy": 1.5390350714325904, "epoch": 4.778378378378378, "grad_norm": 18.232288360595703, "learning_rate": 1.042976775826332e-07, "loss": 0.61814284324646, "mean_token_accuracy": 0.872353944554925, "num_tokens": 38624893.0, "step": 4090 }, { "entropy": 1.4646945357322694, "epoch": 4.790065741417092, "grad_norm": 15.621621131896973, "learning_rate": 9.367898876237347e-08, "loss": 0.6843422889709473, "mean_token_accuracy": 0.8493800751864911, "num_tokens": 38706684.0, "step": 4100 }, { "epoch": 4.790065741417092, "eval_entropy": 1.4424911779351532, "eval_loss": 1.0918210744857788, "eval_mean_token_accuracy": 0.7697787257493474, "eval_num_tokens": 38706684.0, "eval_runtime": 25.6921, "eval_samples_per_second": 19.928, "eval_steps_per_second": 9.964, "step": 4100 }, { "entropy": 1.4517256565392018, "epoch": 4.801753104455807, "grad_norm": 7.361289978027344, "learning_rate": 8.362771989412488e-08, "loss": 0.7133095264434814, "mean_token_accuracy": 0.8632656030356884, "num_tokens": 38787460.0, "step": 4110 }, { "entropy": 1.5199289210140705, "epoch": 4.813440467494521, "grad_norm": 3.967174768447876, "learning_rate": 7.414444670024834e-08, "loss": 0.9737075805664063, "mean_token_accuracy": 0.8513060834258794, "num_tokens": 38894866.0, "step": 4120 }, { "entropy": 1.5039781682193278, "epoch": 4.825127830533236, "grad_norm": 9.782380104064941, "learning_rate": 6.522971236911923e-08, "loss": 0.6163204193115235, "mean_token_accuracy": 0.8985051784664393, "num_tokens": 38997595.0, "step": 4130 }, { "entropy": 1.5199985206127167, "epoch": 4.83681519357195, "grad_norm": 3.506466865539551, "learning_rate": 5.688402752401567e-08, "loss": 0.9050114631652832, "mean_token_accuracy": 0.8055482944473624, "num_tokens": 39087395.0, "step": 4140 }, { "entropy": 1.4977469891309738, "epoch": 4.848502556610665, "grad_norm": 6.047015190124512, "learning_rate": 4.91078701938763e-08, "loss": 0.5338590145111084, "mean_token_accuracy": 0.8793411515653133, "num_tokens": 39189114.0, "step": 4150 }, { "entropy": 1.5504455424845218, "epoch": 4.860189919649379, "grad_norm": 16.04572105407715, "learning_rate": 4.190168578591114e-08, "loss": 0.8087006568908691, "mean_token_accuracy": 0.8372783213853836, "num_tokens": 39287245.0, "step": 4160 }, { "entropy": 1.4528725862503051, "epoch": 4.871877282688094, "grad_norm": 16.02657127380371, "learning_rate": 3.526588706009637e-08, "loss": 0.514737892150879, "mean_token_accuracy": 0.8511596038937569, "num_tokens": 39354897.0, "step": 4170 }, { "entropy": 1.4478582091629506, "epoch": 4.883564645726808, "grad_norm": 7.557652950286865, "learning_rate": 2.9200854105526645e-08, "loss": 0.6200026512145996, "mean_token_accuracy": 0.865429537370801, "num_tokens": 39418694.0, "step": 4180 }, { "entropy": 1.4812394805252551, "epoch": 4.895252008765523, "grad_norm": 4.643852710723877, "learning_rate": 2.37069343186469e-08, "loss": 0.8050068855285645, "mean_token_accuracy": 0.8574969913810492, "num_tokens": 39504790.0, "step": 4190 }, { "entropy": 1.4632190234959126, "epoch": 4.906939371804237, "grad_norm": 17.43656349182129, "learning_rate": 1.8784442383354972e-08, "loss": 0.579356050491333, "mean_token_accuracy": 0.8364833440631628, "num_tokens": 39588583.0, "step": 4200 }, { "epoch": 4.906939371804237, "eval_entropy": 1.4423961690627038, "eval_loss": 1.094377040863037, "eval_mean_token_accuracy": 0.7712554379249923, "eval_num_tokens": 39588583.0, "eval_runtime": 25.7381, "eval_samples_per_second": 19.893, "eval_steps_per_second": 9.946, "step": 4200 }, { "entropy": 1.4858237937092782, "epoch": 4.918626734842951, "grad_norm": 12.429141998291016, "learning_rate": 1.443366025297599e-08, "loss": 0.5480079650878906, "mean_token_accuracy": 0.8573607705533505, "num_tokens": 39691380.0, "step": 4210 }, { "entropy": 1.5240480951964854, "epoch": 4.9303140978816655, "grad_norm": 6.490242958068848, "learning_rate": 1.0654837134109752e-08, "loss": 0.557542085647583, "mean_token_accuracy": 0.8416418630629778, "num_tokens": 39792494.0, "step": 4220 }, { "entropy": 1.5179505512118339, "epoch": 4.9420014609203795, "grad_norm": 13.937246322631836, "learning_rate": 7.4481894723599236e-09, "loss": 0.6862639427185059, "mean_token_accuracy": 0.8709760889410972, "num_tokens": 39875847.0, "step": 4230 }, { "entropy": 1.5092324443161487, "epoch": 4.953688823959094, "grad_norm": 11.903735160827637, "learning_rate": 4.813900939936167e-09, "loss": 0.48588266372680666, "mean_token_accuracy": 0.8748119071125984, "num_tokens": 39982678.0, "step": 4240 }, { "entropy": 1.4981704361736774, "epoch": 4.965376186997808, "grad_norm": 9.157793045043945, "learning_rate": 2.7521224251303436e-09, "loss": 0.5891988754272461, "mean_token_accuracy": 0.8549117844551801, "num_tokens": 40075794.0, "step": 4250 }, { "entropy": 1.5046925134956837, "epoch": 4.977063550036523, "grad_norm": 4.12293815612793, "learning_rate": 1.2629720236800868e-09, "loss": 0.6233686447143555, "mean_token_accuracy": 0.8813595429062844, "num_tokens": 40165956.0, "step": 4260 }, { "entropy": 1.5573359951376915, "epoch": 4.988750913075237, "grad_norm": 12.11980152130127, "learning_rate": 3.4653503199866266e-10, "loss": 0.7357488155364991, "mean_token_accuracy": 0.8814769674092531, "num_tokens": 40246684.0, "step": 4270 }, { "entropy": 1.5398043293457526, "epoch": 5.0, "grad_norm": 5.443117618560791, "learning_rate": 2.8639422888776525e-12, "loss": 0.952604866027832, "mean_token_accuracy": 0.8546050163832578, "num_tokens": 40341950.0, "step": 4280 }, { "epoch": 5.0, "eval_entropy": 1.4426328076515347, "eval_loss": 1.0950794219970703, "eval_mean_token_accuracy": 0.7698450249736197, "eval_num_tokens": 40341950.0, "eval_runtime": 25.6899, "eval_samples_per_second": 19.93, "eval_steps_per_second": 9.965, "step": 4280 }, { "epoch": 5.0, "step": 4280, "total_flos": 1.8234326345207808e+18, "train_loss": 1.0279761601274258, "train_runtime": 15113.9351, "train_samples_per_second": 2.264, "train_steps_per_second": 0.283 } ], "logging_steps": 10, "max_steps": 4280, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.8234326345207808e+18, "train_batch_size": 1, "trial_name": null, "trial_params": null }