{ "best_global_step": 400, "best_metric": 0.9433377981185913, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_ours-c_61797_ffn_only_5ep/checkpoint-400", "epoch": 5.0, "eval_steps": 100, "global_step": 2290, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.8063647478818894, "epoch": 0.02185792349726776, "grad_norm": 3.423154830932617, "learning_rate": 2.6086956521739132e-06, "loss": 1.4558660507202148, "mean_token_accuracy": 0.47703990414738656, "num_tokens": 35903.0, "step": 10 }, { "entropy": 1.75661009401083, "epoch": 0.04371584699453552, "grad_norm": 5.560386657714844, "learning_rate": 5.507246376811595e-06, "loss": 1.4596789360046387, "mean_token_accuracy": 0.49832420609891415, "num_tokens": 73449.0, "step": 20 }, { "entropy": 1.7712477460503577, "epoch": 0.06557377049180328, "grad_norm": 10.560691833496094, "learning_rate": 8.405797101449275e-06, "loss": 1.3317112922668457, "mean_token_accuracy": 0.5486307129263878, "num_tokens": 110133.0, "step": 30 }, { "entropy": 1.7841636031866073, "epoch": 0.08743169398907104, "grad_norm": 2.2995595932006836, "learning_rate": 1.1304347826086957e-05, "loss": 1.2257501602172851, "mean_token_accuracy": 0.6805846616625786, "num_tokens": 145855.0, "step": 40 }, { "entropy": 1.8792877070605756, "epoch": 0.1092896174863388, "grad_norm": 5.942349910736084, "learning_rate": 1.420289855072464e-05, "loss": 1.1201908111572265, "mean_token_accuracy": 0.6831882126629353, "num_tokens": 184759.0, "step": 50 }, { "entropy": 2.0755775086581707, "epoch": 0.13114754098360656, "grad_norm": 2.814479112625122, "learning_rate": 1.710144927536232e-05, "loss": 0.8766800880432128, "mean_token_accuracy": 0.72079848498106, "num_tokens": 221627.0, "step": 60 }, { "entropy": 2.1253911912441255, "epoch": 0.15300546448087432, "grad_norm": 3.9029574394226074, "learning_rate": 2e-05, "loss": 1.0101543426513673, "mean_token_accuracy": 0.6912351328879595, "num_tokens": 255149.0, "step": 70 }, { "entropy": 2.175362668186426, "epoch": 0.17486338797814208, "grad_norm": 0.565113365650177, "learning_rate": 1.9998999619099485e-05, "loss": 0.9229906082153321, "mean_token_accuracy": 0.7883817024528981, "num_tokens": 301738.0, "step": 80 }, { "entropy": 2.2245839439332484, "epoch": 0.19672131147540983, "grad_norm": 1.5411109924316406, "learning_rate": 1.999599867655032e-05, "loss": 0.7247772216796875, "mean_token_accuracy": 0.7564309105277062, "num_tokens": 343764.0, "step": 90 }, { "entropy": 2.2699677906930447, "epoch": 0.2185792349726776, "grad_norm": 0.1435852348804474, "learning_rate": 1.9990997772769632e-05, "loss": 0.7856242656707764, "mean_token_accuracy": 0.6836250949651003, "num_tokens": 379571.0, "step": 100 }, { "epoch": 0.2185792349726776, "eval_entropy": 2.2037881575524807, "eval_loss": 0.9982572793960571, "eval_mean_token_accuracy": 0.757006504223682, "eval_num_tokens": 379571.0, "eval_runtime": 25.2898, "eval_samples_per_second": 20.245, "eval_steps_per_second": 10.123, "step": 100 }, { "entropy": 2.1564709596335887, "epoch": 0.24043715846994534, "grad_norm": 2.1890692710876465, "learning_rate": 1.9983997908319148e-05, "loss": 0.7731066703796386, "mean_token_accuracy": 0.7627312574535609, "num_tokens": 433289.0, "step": 110 }, { "entropy": 2.247432677447796, "epoch": 0.26229508196721313, "grad_norm": 1.639736294746399, "learning_rate": 1.9975000483705003e-05, "loss": 0.6999035835266113, "mean_token_accuracy": 0.789754918217659, "num_tokens": 471536.0, "step": 120 }, { "entropy": 2.159890849888325, "epoch": 0.28415300546448086, "grad_norm": 6.709820747375488, "learning_rate": 1.9964007299097545e-05, "loss": 0.7218995094299316, "mean_token_accuracy": 0.7591581210494042, "num_tokens": 506833.0, "step": 130 }, { "entropy": 2.2273385375738144, "epoch": 0.30601092896174864, "grad_norm": 4.0001444816589355, "learning_rate": 1.9951020553971163e-05, "loss": 0.5942524909973145, "mean_token_accuracy": 0.7525342235341668, "num_tokens": 544522.0, "step": 140 }, { "entropy": 2.1546551048755647, "epoch": 0.32786885245901637, "grad_norm": 2.4917547702789307, "learning_rate": 1.9936042846664212e-05, "loss": 0.9668840408325196, "mean_token_accuracy": 0.7837827190756798, "num_tokens": 585059.0, "step": 150 }, { "entropy": 2.1303168818354608, "epoch": 0.34972677595628415, "grad_norm": 4.402857780456543, "learning_rate": 1.991907717385915e-05, "loss": 0.6431563377380372, "mean_token_accuracy": 0.7454070471227169, "num_tokens": 616372.0, "step": 160 }, { "entropy": 2.197571408748627, "epoch": 0.37158469945355194, "grad_norm": 2.195585012435913, "learning_rate": 1.9900126929982996e-05, "loss": 0.8557025909423828, "mean_token_accuracy": 0.7525063119828701, "num_tokens": 651102.0, "step": 170 }, { "entropy": 2.107708531618118, "epoch": 0.39344262295081966, "grad_norm": 3.916335105895996, "learning_rate": 1.987919590652815e-05, "loss": 0.8322604179382325, "mean_token_accuracy": 0.7549931760877371, "num_tokens": 688543.0, "step": 180 }, { "entropy": 2.118951064348221, "epoch": 0.41530054644808745, "grad_norm": 2.6407856941223145, "learning_rate": 1.985628829129383e-05, "loss": 0.7598269939422607, "mean_token_accuracy": 0.7544480536133051, "num_tokens": 722067.0, "step": 190 }, { "entropy": 2.0949587907642124, "epoch": 0.4371584699453552, "grad_norm": 3.0593597888946533, "learning_rate": 1.983140866754819e-05, "loss": 0.627412748336792, "mean_token_accuracy": 0.7927730124443769, "num_tokens": 760510.0, "step": 200 }, { "epoch": 0.4371584699453552, "eval_entropy": 2.1543811270967126, "eval_loss": 0.9629567861557007, "eval_mean_token_accuracy": 0.7506587785901502, "eval_num_tokens": 760510.0, "eval_runtime": 25.2887, "eval_samples_per_second": 20.246, "eval_steps_per_second": 10.123, "step": 200 }, { "entropy": 2.0893077090382577, "epoch": 0.45901639344262296, "grad_norm": 5.467627048492432, "learning_rate": 1.9804562013111307e-05, "loss": 0.7501600742340088, "mean_token_accuracy": 0.7809621814638377, "num_tokens": 800890.0, "step": 210 }, { "entropy": 2.1575353160500526, "epoch": 0.4808743169398907, "grad_norm": 3.708895683288574, "learning_rate": 1.9775753699359254e-05, "loss": 0.7001654624938964, "mean_token_accuracy": 0.8030995633453131, "num_tokens": 841418.0, "step": 220 }, { "entropy": 2.1907149985432626, "epoch": 0.5027322404371585, "grad_norm": 5.7744269371032715, "learning_rate": 1.9744989490149403e-05, "loss": 0.9803537368774414, "mean_token_accuracy": 0.7649548169225454, "num_tokens": 876345.0, "step": 230 }, { "entropy": 2.1935453712940216, "epoch": 0.5245901639344263, "grad_norm": 1.9867186546325684, "learning_rate": 1.971227554066721e-05, "loss": 0.9978780746459961, "mean_token_accuracy": 0.74650296010077, "num_tokens": 911261.0, "step": 240 }, { "entropy": 2.1268230110406874, "epoch": 0.546448087431694, "grad_norm": 5.917712211608887, "learning_rate": 1.967761839619473e-05, "loss": 0.8284941673278808, "mean_token_accuracy": 0.8314751997590065, "num_tokens": 946757.0, "step": 250 }, { "entropy": 2.0225247129797936, "epoch": 0.5683060109289617, "grad_norm": 4.7960052490234375, "learning_rate": 1.964102499080104e-05, "loss": 0.6664062023162842, "mean_token_accuracy": 0.7690637439489365, "num_tokens": 986979.0, "step": 260 }, { "entropy": 2.0265661850571632, "epoch": 0.5901639344262295, "grad_norm": 5.520472049713135, "learning_rate": 1.9602502645954908e-05, "loss": 0.6990304470062256, "mean_token_accuracy": 0.7301983077079057, "num_tokens": 1030774.0, "step": 270 }, { "entropy": 2.1217927753925325, "epoch": 0.6120218579234973, "grad_norm": 2.748990535736084, "learning_rate": 1.9562059069059936e-05, "loss": 0.6773673057556152, "mean_token_accuracy": 0.7711487539112568, "num_tokens": 1074459.0, "step": 280 }, { "entropy": 1.9649823542684317, "epoch": 0.6338797814207651, "grad_norm": 2.781599283218384, "learning_rate": 1.9519702351912504e-05, "loss": 0.7069565773010253, "mean_token_accuracy": 0.7780966762453317, "num_tokens": 1119672.0, "step": 290 }, { "entropy": 2.0320102006196974, "epoch": 0.6557377049180327, "grad_norm": 1.9452710151672363, "learning_rate": 1.9475440969082778e-05, "loss": 0.6044183254241944, "mean_token_accuracy": 0.8210622433573007, "num_tokens": 1154144.0, "step": 300 }, { "epoch": 0.6557377049180327, "eval_entropy": 2.0770468888804317, "eval_loss": 0.9566176533699036, "eval_mean_token_accuracy": 0.7631950126960874, "eval_num_tokens": 1154144.0, "eval_runtime": 25.2625, "eval_samples_per_second": 20.267, "eval_steps_per_second": 10.134, "step": 300 }, { "entropy": 2.0678520128130913, "epoch": 0.6775956284153005, "grad_norm": 1.895296335220337, "learning_rate": 1.9429283776219164e-05, "loss": 0.7932215213775635, "mean_token_accuracy": 0.7864639211446047, "num_tokens": 1184770.0, "step": 310 }, { "entropy": 2.160663002729416, "epoch": 0.6994535519125683, "grad_norm": 2.3100788593292236, "learning_rate": 1.938124000827649e-05, "loss": 0.9294171333312988, "mean_token_accuracy": 0.7919486667960882, "num_tokens": 1216799.0, "step": 320 }, { "entropy": 2.1491317108273504, "epoch": 0.7213114754098361, "grad_norm": 3.916989803314209, "learning_rate": 1.9331319277668324e-05, "loss": 0.5258510112762451, "mean_token_accuracy": 0.7600123845040798, "num_tokens": 1255660.0, "step": 330 }, { "entropy": 2.070452833175659, "epoch": 0.7431693989071039, "grad_norm": 3.346385955810547, "learning_rate": 1.927953157234376e-05, "loss": 0.698235559463501, "mean_token_accuracy": 0.796322438493371, "num_tokens": 1292285.0, "step": 340 }, { "entropy": 2.0435832902789115, "epoch": 0.7650273224043715, "grad_norm": 1.684852123260498, "learning_rate": 1.9225887253789048e-05, "loss": 0.5733598709106446, "mean_token_accuracy": 0.8418302100151778, "num_tokens": 1344845.0, "step": 350 }, { "entropy": 2.1818724423646927, "epoch": 0.7868852459016393, "grad_norm": 3.2415714263916016, "learning_rate": 1.9170397054954532e-05, "loss": 0.8297238349914551, "mean_token_accuracy": 0.7598258547484875, "num_tokens": 1376803.0, "step": 360 }, { "entropy": 2.1174234583973885, "epoch": 0.8087431693989071, "grad_norm": 6.760610580444336, "learning_rate": 1.9113072078107227e-05, "loss": 0.7774213790893555, "mean_token_accuracy": 0.7755776561796666, "num_tokens": 1416000.0, "step": 370 }, { "entropy": 2.0920872397720816, "epoch": 0.8306010928961749, "grad_norm": 1.603777289390564, "learning_rate": 1.905392379260953e-05, "loss": 0.6159489631652832, "mean_token_accuracy": 0.8068475790321827, "num_tokens": 1456210.0, "step": 380 }, { "entropy": 2.0747187957167625, "epoch": 0.8524590163934426, "grad_norm": 11.510518074035645, "learning_rate": 1.899296403262446e-05, "loss": 0.7138397216796875, "mean_token_accuracy": 0.7663105923682452, "num_tokens": 1493407.0, "step": 390 }, { "entropy": 1.9438473023474216, "epoch": 0.8743169398907104, "grad_norm": 3.9798667430877686, "learning_rate": 1.893020499474793e-05, "loss": 0.5529248237609863, "mean_token_accuracy": 0.7778996028006077, "num_tokens": 1533619.0, "step": 400 }, { "epoch": 0.8743169398907104, "eval_entropy": 2.032593308482319, "eval_loss": 0.9433377981185913, "eval_mean_token_accuracy": 0.7655589742353186, "eval_num_tokens": 1533619.0, "eval_runtime": 25.276, "eval_samples_per_second": 20.256, "eval_steps_per_second": 10.128, "step": 400 }, { "entropy": 1.9707405015826225, "epoch": 0.8961748633879781, "grad_norm": 1.7734041213989258, "learning_rate": 1.8865659235568508e-05, "loss": 1.0756511688232422, "mean_token_accuracy": 0.7205761078745127, "num_tokens": 1575976.0, "step": 410 }, { "entropy": 1.9950819492340088, "epoch": 0.9180327868852459, "grad_norm": 1.9045618772506714, "learning_rate": 1.879933966915514e-05, "loss": 0.663206148147583, "mean_token_accuracy": 0.7859252873808146, "num_tokens": 1621647.0, "step": 420 }, { "entropy": 2.0255909264087677, "epoch": 0.9398907103825137, "grad_norm": 6.2514214515686035, "learning_rate": 1.873125956447333e-05, "loss": 0.6743417263031006, "mean_token_accuracy": 0.8094865296036005, "num_tokens": 1658612.0, "step": 430 }, { "entropy": 2.109029750525951, "epoch": 0.9617486338797814, "grad_norm": 5.623356342315674, "learning_rate": 1.8661432542730365e-05, "loss": 0.7329175472259521, "mean_token_accuracy": 0.74499936029315, "num_tokens": 1691663.0, "step": 440 }, { "entropy": 2.137598206847906, "epoch": 0.9836065573770492, "grad_norm": 3.081730842590332, "learning_rate": 1.858987257465003e-05, "loss": 0.6648739814758301, "mean_token_accuracy": 0.8063705991953611, "num_tokens": 1735524.0, "step": 450 }, { "entropy": 2.1458014014520144, "epoch": 1.0043715846994536, "grad_norm": 3.006117105484009, "learning_rate": 1.8516593977677384e-05, "loss": 0.6919145584106445, "mean_token_accuracy": 0.8407357433124593, "num_tokens": 1768193.0, "step": 460 }, { "entropy": 2.110413059592247, "epoch": 1.0262295081967212, "grad_norm": 0.3206161856651306, "learning_rate": 1.8441611413114187e-05, "loss": 0.5173742294311523, "mean_token_accuracy": 0.8401550747454166, "num_tokens": 1804593.0, "step": 470 }, { "entropy": 2.0955183535814284, "epoch": 1.048087431693989, "grad_norm": 3.1438255310058594, "learning_rate": 1.836493988318554e-05, "loss": 0.5835023880004883, "mean_token_accuracy": 0.8145145986229181, "num_tokens": 1837965.0, "step": 480 }, { "entropy": 2.0786552384495733, "epoch": 1.0699453551912568, "grad_norm": 5.301725387573242, "learning_rate": 1.8286594728038268e-05, "loss": 0.5727744102478027, "mean_token_accuracy": 0.8251623082906008, "num_tokens": 1897279.0, "step": 490 }, { "entropy": 2.0536697883158923, "epoch": 1.0918032786885246, "grad_norm": 1.8960548639297485, "learning_rate": 1.8206591622671746e-05, "loss": 0.4378913402557373, "mean_token_accuracy": 0.8633764263242483, "num_tokens": 1936074.0, "step": 500 }, { "epoch": 1.0918032786885246, "eval_entropy": 2.0147718605585396, "eval_loss": 1.0390677452087402, "eval_mean_token_accuracy": 0.730600222479552, "eval_num_tokens": 1936074.0, "eval_runtime": 25.2597, "eval_samples_per_second": 20.269, "eval_steps_per_second": 10.135, "step": 500 }, { "entropy": 2.032060332596302, "epoch": 1.1136612021857923, "grad_norm": 10.848620414733887, "learning_rate": 1.8124946573801686e-05, "loss": 0.6254462718963623, "mean_token_accuracy": 0.8352152071893215, "num_tokens": 1970651.0, "step": 510 }, { "entropy": 1.856139574199915, "epoch": 1.1355191256830601, "grad_norm": 4.950552463531494, "learning_rate": 1.8041675916657597e-05, "loss": 0.5790982723236084, "mean_token_accuracy": 0.8180347349494695, "num_tokens": 2013248.0, "step": 520 }, { "entropy": 1.9065284475684166, "epoch": 1.157377049180328, "grad_norm": 4.5021891593933105, "learning_rate": 1.7956796311714474e-05, "loss": 0.564539098739624, "mean_token_accuracy": 0.8569660175591707, "num_tokens": 2052332.0, "step": 530 }, { "entropy": 1.9384179085493087, "epoch": 1.1792349726775957, "grad_norm": 13.089709281921387, "learning_rate": 1.787032474135944e-05, "loss": 0.7635960578918457, "mean_token_accuracy": 0.7828190468251706, "num_tokens": 2088694.0, "step": 540 }, { "entropy": 1.9600365862250329, "epoch": 1.2010928961748635, "grad_norm": 2.0104820728302, "learning_rate": 1.778227850649398e-05, "loss": 0.6327505588531495, "mean_token_accuracy": 0.7942470081150532, "num_tokens": 2125379.0, "step": 550 }, { "entropy": 1.9059402167797088, "epoch": 1.222950819672131, "grad_norm": 2.1560399532318115, "learning_rate": 1.769267522307244e-05, "loss": 0.6111732959747315, "mean_token_accuracy": 0.8242439936846495, "num_tokens": 2165069.0, "step": 560 }, { "entropy": 1.946674208343029, "epoch": 1.2448087431693988, "grad_norm": 0.47851449251174927, "learning_rate": 1.760153281857749e-05, "loss": 0.4375136852264404, "mean_token_accuracy": 0.8364114321768283, "num_tokens": 2202898.0, "step": 570 }, { "entropy": 2.031615723669529, "epoch": 1.2666666666666666, "grad_norm": 6.617761135101318, "learning_rate": 1.7508869528433264e-05, "loss": 0.829713249206543, "mean_token_accuracy": 0.7643794182687997, "num_tokens": 2240453.0, "step": 580 }, { "entropy": 1.9364936739206313, "epoch": 1.2885245901639344, "grad_norm": 7.973677158355713, "learning_rate": 1.74147038923569e-05, "loss": 0.437787389755249, "mean_token_accuracy": 0.8334135215729475, "num_tokens": 2282118.0, "step": 590 }, { "entropy": 1.994447159767151, "epoch": 1.3103825136612022, "grad_norm": 3.4388744831085205, "learning_rate": 1.731905475064915e-05, "loss": 0.5179662704467773, "mean_token_accuracy": 0.8467293042689562, "num_tokens": 2320520.0, "step": 600 }, { "epoch": 1.3103825136612022, "eval_entropy": 1.9500198299065232, "eval_loss": 1.0030851364135742, "eval_mean_token_accuracy": 0.757350493222475, "eval_num_tokens": 2320520.0, "eval_runtime": 25.2503, "eval_samples_per_second": 20.277, "eval_steps_per_second": 10.138, "step": 600 }, { "entropy": 1.907582050561905, "epoch": 1.33224043715847, "grad_norm": 3.3789825439453125, "learning_rate": 1.7221941240424922e-05, "loss": 0.4778538703918457, "mean_token_accuracy": 0.8434304721653462, "num_tokens": 2355096.0, "step": 610 }, { "entropy": 1.8661066718399524, "epoch": 1.3540983606557377, "grad_norm": 2.7720794677734375, "learning_rate": 1.7123382791784376e-05, "loss": 0.4396005630493164, "mean_token_accuracy": 0.8284852344542741, "num_tokens": 2409391.0, "step": 620 }, { "entropy": 1.806156025826931, "epoch": 1.3759562841530055, "grad_norm": 3.8762011528015137, "learning_rate": 1.7023399123925438e-05, "loss": 0.5669230461120606, "mean_token_accuracy": 0.828336314111948, "num_tokens": 2452196.0, "step": 630 }, { "entropy": 1.8862054750323296, "epoch": 1.3978142076502733, "grad_norm": 3.880317211151123, "learning_rate": 1.6922010241198445e-05, "loss": 0.4151432514190674, "mean_token_accuracy": 0.8618706040084362, "num_tokens": 2484719.0, "step": 640 }, { "entropy": 1.901587300747633, "epoch": 1.419672131147541, "grad_norm": 5.403715133666992, "learning_rate": 1.681923642910375e-05, "loss": 0.5961950778961181, "mean_token_accuracy": 0.8228115990757943, "num_tokens": 2523804.0, "step": 650 }, { "entropy": 1.8603504352271556, "epoch": 1.4415300546448089, "grad_norm": 2.0737757682800293, "learning_rate": 1.6715098250233095e-05, "loss": 0.5909753799438476, "mean_token_accuracy": 0.8104891542345285, "num_tokens": 2565708.0, "step": 660 }, { "entropy": 2.000732755661011, "epoch": 1.4633879781420764, "grad_norm": 4.641599655151367, "learning_rate": 1.660961654015552e-05, "loss": 0.5969127655029297, "mean_token_accuracy": 0.8471055120229721, "num_tokens": 2600157.0, "step": 670 }, { "entropy": 1.9003810167312623, "epoch": 1.4852459016393442, "grad_norm": 2.3957788944244385, "learning_rate": 1.650281240324864e-05, "loss": 0.4810887336730957, "mean_token_accuracy": 0.8310797978192568, "num_tokens": 2634747.0, "step": 680 }, { "entropy": 2.019043204188347, "epoch": 1.507103825136612, "grad_norm": 5.3165059089660645, "learning_rate": 1.6394707208476184e-05, "loss": 0.657526683807373, "mean_token_accuracy": 0.7817666057497263, "num_tokens": 2669560.0, "step": 690 }, { "entropy": 1.939988984167576, "epoch": 1.5289617486338798, "grad_norm": 3.616457462310791, "learning_rate": 1.6285322585112577e-05, "loss": 0.8010999679565429, "mean_token_accuracy": 0.7895378671586514, "num_tokens": 2712811.0, "step": 700 }, { "epoch": 1.5289617486338798, "eval_entropy": 1.9267194443382323, "eval_loss": 1.0051671266555786, "eval_mean_token_accuracy": 0.7411219369969331, "eval_num_tokens": 2712811.0, "eval_runtime": 25.2755, "eval_samples_per_second": 20.257, "eval_steps_per_second": 10.128, "step": 700 }, { "entropy": 1.9218722447752952, "epoch": 1.5508196721311476, "grad_norm": 3.080705165863037, "learning_rate": 1.6174680418415426e-05, "loss": 0.6289849758148194, "mean_token_accuracy": 0.882987642288208, "num_tokens": 2746923.0, "step": 710 }, { "entropy": 1.8692668572068214, "epoch": 1.5726775956284151, "grad_norm": 8.707109451293945, "learning_rate": 1.6062802845246796e-05, "loss": 0.5447452068328857, "mean_token_accuracy": 0.8194241803139448, "num_tokens": 2782316.0, "step": 720 }, { "entropy": 1.9840392470359802, "epoch": 1.594535519125683, "grad_norm": 5.839150428771973, "learning_rate": 1.5949712249644168e-05, "loss": 0.5748161792755127, "mean_token_accuracy": 0.8199563117697835, "num_tokens": 2812008.0, "step": 730 }, { "entropy": 1.877804670482874, "epoch": 1.6163934426229507, "grad_norm": 2.8095271587371826, "learning_rate": 1.5835431258341914e-05, "loss": 0.3862598896026611, "mean_token_accuracy": 0.8174357455223799, "num_tokens": 2851938.0, "step": 740 }, { "entropy": 1.8835655882954598, "epoch": 1.6382513661202185, "grad_norm": 11.515563011169434, "learning_rate": 1.571998273624424e-05, "loss": 0.5016937732696534, "mean_token_accuracy": 0.849822697788477, "num_tokens": 2885244.0, "step": 750 }, { "entropy": 1.7773355908691884, "epoch": 1.6601092896174863, "grad_norm": 6.528411388397217, "learning_rate": 1.5603389781850435e-05, "loss": 0.3264592170715332, "mean_token_accuracy": 0.8357654266059399, "num_tokens": 2926241.0, "step": 760 }, { "entropy": 1.8843942552804946, "epoch": 1.681967213114754, "grad_norm": 6.097729682922363, "learning_rate": 1.5485675722633445e-05, "loss": 0.6704532623291015, "mean_token_accuracy": 0.7745772052556277, "num_tokens": 2958842.0, "step": 770 }, { "entropy": 1.8674893841147422, "epoch": 1.7038251366120218, "grad_norm": 5.29870080947876, "learning_rate": 1.5366864110372586e-05, "loss": 0.6037456512451171, "mean_token_accuracy": 0.8349868554621935, "num_tokens": 2995790.0, "step": 780 }, { "entropy": 1.9335614942014216, "epoch": 1.7256830601092896, "grad_norm": 7.609033584594727, "learning_rate": 1.5246978716441392e-05, "loss": 0.478175687789917, "mean_token_accuracy": 0.8572088401764631, "num_tokens": 3034539.0, "step": 790 }, { "entropy": 1.9231948465108872, "epoch": 1.7475409836065574, "grad_norm": 3.5952892303466797, "learning_rate": 1.5126043527051523e-05, "loss": 0.5622974872589112, "mean_token_accuracy": 0.8431862521916628, "num_tokens": 3070216.0, "step": 800 }, { "epoch": 1.7475409836065574, "eval_entropy": 1.9174917968921363, "eval_loss": 0.9968341588973999, "eval_mean_token_accuracy": 0.7547392580891028, "eval_num_tokens": 3070216.0, "eval_runtime": 25.2412, "eval_samples_per_second": 20.284, "eval_steps_per_second": 10.142, "step": 800 }, { "entropy": 2.000046853721142, "epoch": 1.7693989071038252, "grad_norm": 5.004440784454346, "learning_rate": 1.5004082738453723e-05, "loss": 0.5045398235321045, "mean_token_accuracy": 0.8353351525962353, "num_tokens": 3104720.0, "step": 810 }, { "entropy": 1.932582141458988, "epoch": 1.791256830601093, "grad_norm": 4.402656555175781, "learning_rate": 1.4881120752096685e-05, "loss": 0.5935905933380127, "mean_token_accuracy": 0.7998956862837077, "num_tokens": 3142794.0, "step": 820 }, { "entropy": 1.9920608803629876, "epoch": 1.8131147540983608, "grad_norm": 10.046414375305176, "learning_rate": 1.4757182169744948e-05, "loss": 0.6299263000488281, "mean_token_accuracy": 0.824649827927351, "num_tokens": 3178323.0, "step": 830 }, { "entropy": 2.0002417393028735, "epoch": 1.8349726775956285, "grad_norm": 2.1592979431152344, "learning_rate": 1.463229178855663e-05, "loss": 0.42464284896850585, "mean_token_accuracy": 0.8876678507775069, "num_tokens": 3210741.0, "step": 840 }, { "entropy": 1.9218681126832962, "epoch": 1.8568306010928963, "grad_norm": 3.5906593799591064, "learning_rate": 1.4506474596122132e-05, "loss": 0.5482982635498047, "mean_token_accuracy": 0.8235908593982458, "num_tokens": 3253021.0, "step": 850 }, { "entropy": 1.8942916221916675, "epoch": 1.8786885245901639, "grad_norm": 2.9451968669891357, "learning_rate": 1.4379755765464709e-05, "loss": 0.6192903995513916, "mean_token_accuracy": 0.8629166536033154, "num_tokens": 3292097.0, "step": 860 }, { "entropy": 1.9666990574449301, "epoch": 1.9005464480874317, "grad_norm": 3.6715590953826904, "learning_rate": 1.4252160650003944e-05, "loss": 0.47508945465087893, "mean_token_accuracy": 0.8053756408393383, "num_tokens": 3330520.0, "step": 870 }, { "entropy": 1.9449772492051125, "epoch": 1.9224043715846995, "grad_norm": 6.027235507965088, "learning_rate": 1.4123714778483142e-05, "loss": 0.5430461883544921, "mean_token_accuracy": 0.8390930660068989, "num_tokens": 3367361.0, "step": 880 }, { "entropy": 1.9635326191782951, "epoch": 1.9442622950819672, "grad_norm": 3.413417100906372, "learning_rate": 1.3994443849861623e-05, "loss": 0.6275568962097168, "mean_token_accuracy": 0.8400135699659586, "num_tokens": 3410634.0, "step": 890 }, { "entropy": 1.899067870527506, "epoch": 1.966120218579235, "grad_norm": 4.991271018981934, "learning_rate": 1.3864373728172986e-05, "loss": 0.4935734272003174, "mean_token_accuracy": 0.8543500185012818, "num_tokens": 3461846.0, "step": 900 }, { "epoch": 1.966120218579235, "eval_entropy": 1.9543956331908703, "eval_loss": 0.9799688458442688, "eval_mean_token_accuracy": 0.7691519922809675, "eval_num_tokens": 3461846.0, "eval_runtime": 25.2895, "eval_samples_per_second": 20.246, "eval_steps_per_second": 10.123, "step": 900 }, { "entropy": 1.932174527645111, "epoch": 1.9879781420765026, "grad_norm": 4.647815227508545, "learning_rate": 1.3733530437350324e-05, "loss": 0.5729746341705322, "mean_token_accuracy": 0.8431255351752043, "num_tokens": 3508119.0, "step": 910 }, { "entropy": 1.9605209450972707, "epoch": 2.0087431693989073, "grad_norm": 5.845576763153076, "learning_rate": 1.3601940156019456e-05, "loss": 0.4193246364593506, "mean_token_accuracy": 0.8327035539244351, "num_tokens": 3539359.0, "step": 920 }, { "entropy": 2.0226026967167856, "epoch": 2.030601092896175, "grad_norm": 2.6995978355407715, "learning_rate": 1.346962921226121e-05, "loss": 0.37759575843811033, "mean_token_accuracy": 0.8809590727090836, "num_tokens": 3568555.0, "step": 930 }, { "entropy": 1.8960323825478553, "epoch": 2.0524590163934424, "grad_norm": 2.899524450302124, "learning_rate": 1.3336624078343801e-05, "loss": 0.5012131214141846, "mean_token_accuracy": 0.877274863421917, "num_tokens": 3602954.0, "step": 940 }, { "entropy": 1.7720212742686272, "epoch": 2.07431693989071, "grad_norm": 1.3420737981796265, "learning_rate": 1.3202951365426352e-05, "loss": 0.2880971908569336, "mean_token_accuracy": 0.8983731687068939, "num_tokens": 3641856.0, "step": 950 }, { "entropy": 1.7504506237804889, "epoch": 2.096174863387978, "grad_norm": 6.308726787567139, "learning_rate": 1.3068637818234652e-05, "loss": 0.5575133323669433, "mean_token_accuracy": 0.8421003326773644, "num_tokens": 3680686.0, "step": 960 }, { "entropy": 1.7622926771640777, "epoch": 2.1180327868852458, "grad_norm": 6.427295684814453, "learning_rate": 1.2933710309710162e-05, "loss": 0.37821121215820314, "mean_token_accuracy": 0.9191356211900711, "num_tokens": 3723403.0, "step": 970 }, { "entropy": 1.7686702385544777, "epoch": 2.1398907103825136, "grad_norm": 6.796016693115234, "learning_rate": 1.2798195835633373e-05, "loss": 0.45128607749938965, "mean_token_accuracy": 0.906242086738348, "num_tokens": 3756322.0, "step": 980 }, { "entropy": 1.7671647615730763, "epoch": 2.1617486338797813, "grad_norm": 4.9459733963012695, "learning_rate": 1.2662121509222607e-05, "loss": 0.36589665412902833, "mean_token_accuracy": 0.8796804122626781, "num_tokens": 3794193.0, "step": 990 }, { "entropy": 1.7161696419119834, "epoch": 2.183606557377049, "grad_norm": 9.006570816040039, "learning_rate": 1.2525514555709308e-05, "loss": 0.5742815971374512, "mean_token_accuracy": 0.8753333643078804, "num_tokens": 3830821.0, "step": 1000 }, { "epoch": 2.183606557377049, "eval_entropy": 1.743996654637158, "eval_loss": 1.1557646989822388, "eval_mean_token_accuracy": 0.7421538368216716, "eval_num_tokens": 3830821.0, "eval_runtime": 25.2766, "eval_samples_per_second": 20.256, "eval_steps_per_second": 10.128, "step": 1000 }, { "entropy": 1.7266477182507516, "epoch": 2.205464480874317, "grad_norm": 0.14489249885082245, "learning_rate": 1.2388402306890903e-05, "loss": 0.41260638236999514, "mean_token_accuracy": 0.9061720766127109, "num_tokens": 3874976.0, "step": 1010 }, { "entropy": 1.7216939367353916, "epoch": 2.2273224043715847, "grad_norm": 1.9707283973693848, "learning_rate": 1.2250812195662387e-05, "loss": 0.35822205543518065, "mean_token_accuracy": 0.8634335152804852, "num_tokens": 3905246.0, "step": 1020 }, { "entropy": 1.6640645649284125, "epoch": 2.2491803278688525, "grad_norm": 5.178168296813965, "learning_rate": 1.2112771750527632e-05, "loss": 0.40171108245849607, "mean_token_accuracy": 0.8396187137812376, "num_tokens": 3942601.0, "step": 1030 }, { "entropy": 1.7783586084842682, "epoch": 2.2710382513661203, "grad_norm": 11.327513694763184, "learning_rate": 1.1974308590091601e-05, "loss": 0.2785263299942017, "mean_token_accuracy": 0.870139553397894, "num_tokens": 3984000.0, "step": 1040 }, { "entropy": 1.6852504387497902, "epoch": 2.292896174863388, "grad_norm": 9.063831329345703, "learning_rate": 1.1835450417534517e-05, "loss": 0.5509501934051514, "mean_token_accuracy": 0.8589577071368695, "num_tokens": 4019526.0, "step": 1050 }, { "entropy": 1.6793502882122993, "epoch": 2.314754098360656, "grad_norm": 2.575770378112793, "learning_rate": 1.1696225015069128e-05, "loss": 0.3649094343185425, "mean_token_accuracy": 0.8885138727724552, "num_tokens": 4057765.0, "step": 1060 }, { "entropy": 1.7490564540028573, "epoch": 2.3366120218579236, "grad_norm": 14.544415473937988, "learning_rate": 1.1556660238382125e-05, "loss": 0.4366298675537109, "mean_token_accuracy": 0.8778704255819321, "num_tokens": 4093759.0, "step": 1070 }, { "entropy": 1.7166971430182456, "epoch": 2.3584699453551914, "grad_norm": 10.271318435668945, "learning_rate": 1.1416784011060904e-05, "loss": 0.25078210830688474, "mean_token_accuracy": 0.903883146867156, "num_tokens": 4127540.0, "step": 1080 }, { "entropy": 1.6313612181693316, "epoch": 2.380327868852459, "grad_norm": 3.0819733142852783, "learning_rate": 1.1276624319006722e-05, "loss": 0.33878474235534667, "mean_token_accuracy": 0.8705951869487762, "num_tokens": 4167769.0, "step": 1090 }, { "entropy": 1.6783426776528358, "epoch": 2.402185792349727, "grad_norm": 8.976804733276367, "learning_rate": 1.1136209204835364e-05, "loss": 0.33856441974639895, "mean_token_accuracy": 0.8913385391235351, "num_tokens": 4212055.0, "step": 1100 }, { "epoch": 2.402185792349727, "eval_entropy": 1.7138912174850702, "eval_loss": 1.1432414054870605, "eval_mean_token_accuracy": 0.7529156694072299, "eval_num_tokens": 4212055.0, "eval_runtime": 25.2663, "eval_samples_per_second": 20.264, "eval_steps_per_second": 10.132, "step": 1100 }, { "entropy": 1.676077627390623, "epoch": 2.4240437158469943, "grad_norm": 3.6485555171966553, "learning_rate": 1.0995566762266505e-05, "loss": 0.43614993095397947, "mean_token_accuracy": 0.8534008748829365, "num_tokens": 4253039.0, "step": 1110 }, { "entropy": 1.785607959330082, "epoch": 2.445901639344262, "grad_norm": 5.675464630126953, "learning_rate": 1.0854725130502815e-05, "loss": 0.4932537078857422, "mean_token_accuracy": 0.8849537067115307, "num_tokens": 4289265.0, "step": 1120 }, { "entropy": 1.6909036561846733, "epoch": 2.46775956284153, "grad_norm": 2.5323069095611572, "learning_rate": 1.0713712488599975e-05, "loss": 0.29662504196166994, "mean_token_accuracy": 0.906553142517805, "num_tokens": 4330290.0, "step": 1130 }, { "entropy": 1.7376374121755362, "epoch": 2.4896174863387976, "grad_norm": 8.417685508728027, "learning_rate": 1.057255704982872e-05, "loss": 0.2720386505126953, "mean_token_accuracy": 0.9060880910605192, "num_tokens": 4374908.0, "step": 1140 }, { "entropy": 1.8001229599118234, "epoch": 2.5114754098360654, "grad_norm": 5.350477695465088, "learning_rate": 1.0431287056030048e-05, "loss": 0.3160851240158081, "mean_token_accuracy": 0.9162062905728817, "num_tokens": 4415082.0, "step": 1150 }, { "entropy": 1.796884122490883, "epoch": 2.533333333333333, "grad_norm": 6.009316444396973, "learning_rate": 1.0289930771964678e-05, "loss": 0.34149200916290284, "mean_token_accuracy": 0.8666319936513901, "num_tokens": 4451123.0, "step": 1160 }, { "entropy": 1.7506244897842407, "epoch": 2.555191256830601, "grad_norm": 4.113317966461182, "learning_rate": 1.0148516479657955e-05, "loss": 0.46685094833374025, "mean_token_accuracy": 0.8790101282298565, "num_tokens": 4490088.0, "step": 1170 }, { "entropy": 1.745325656235218, "epoch": 2.577049180327869, "grad_norm": 0.6159476637840271, "learning_rate": 1.0007072472741303e-05, "loss": 0.45745162963867186, "mean_token_accuracy": 0.8782992571592331, "num_tokens": 4531211.0, "step": 1180 }, { "entropy": 1.755560566484928, "epoch": 2.5989071038251366, "grad_norm": 8.604616165161133, "learning_rate": 9.865627050791319e-06, "loss": 0.47327699661254885, "mean_token_accuracy": 0.8790083147585392, "num_tokens": 4573006.0, "step": 1190 }, { "entropy": 1.7254169069230556, "epoch": 2.6207650273224044, "grad_norm": 4.2413859367370605, "learning_rate": 9.724208513667723e-06, "loss": 0.39214675426483153, "mean_token_accuracy": 0.8431641358882189, "num_tokens": 4618083.0, "step": 1200 }, { "epoch": 2.6207650273224044, "eval_entropy": 1.7866586744785309, "eval_loss": 1.0981754064559937, "eval_mean_token_accuracy": 0.7460045842453837, "eval_num_tokens": 4618083.0, "eval_runtime": 25.3227, "eval_samples_per_second": 20.219, "eval_steps_per_second": 10.109, "step": 1200 }, { "entropy": 1.7824625477194787, "epoch": 2.642622950819672, "grad_norm": 7.563173294067383, "learning_rate": 9.582845155851219e-06, "loss": 0.5630898475646973, "mean_token_accuracy": 0.8865630835294723, "num_tokens": 4657609.0, "step": 1210 }, { "entropy": 1.7146922402083873, "epoch": 2.66448087431694, "grad_norm": 9.422724723815918, "learning_rate": 9.441565260782441e-06, "loss": 0.5290060997009277, "mean_token_accuracy": 0.8360320836305618, "num_tokens": 4697085.0, "step": 1220 }, { "entropy": 1.806973297894001, "epoch": 2.6863387978142077, "grad_norm": 4.4218854904174805, "learning_rate": 9.300397095203124e-06, "loss": 0.22829580307006836, "mean_token_accuracy": 0.9107354000210762, "num_tokens": 4728928.0, "step": 1230 }, { "entropy": 1.7696783646941185, "epoch": 2.7081967213114755, "grad_norm": 3.3204195499420166, "learning_rate": 9.15936890350059e-06, "loss": 0.34404170513153076, "mean_token_accuracy": 0.8584935840219259, "num_tokens": 4759301.0, "step": 1240 }, { "entropy": 1.7514332398772239, "epoch": 2.7300546448087433, "grad_norm": 4.120963096618652, "learning_rate": 9.018508902056716e-06, "loss": 0.42660813331604003, "mean_token_accuracy": 0.8891314808279276, "num_tokens": 4792127.0, "step": 1250 }, { "entropy": 1.7041171003133058, "epoch": 2.751912568306011, "grad_norm": 6.271151542663574, "learning_rate": 8.877845273602526e-06, "loss": 0.4269681930541992, "mean_token_accuracy": 0.8639719765633345, "num_tokens": 4840954.0, "step": 1260 }, { "entropy": 1.7781821444630623, "epoch": 2.773770491803279, "grad_norm": 9.52706527709961, "learning_rate": 8.737406161579478e-06, "loss": 0.4761667251586914, "mean_token_accuracy": 0.8543274749070406, "num_tokens": 4878725.0, "step": 1270 }, { "entropy": 1.7140948161482812, "epoch": 2.7956284153005466, "grad_norm": 7.590384006500244, "learning_rate": 8.597219664508646e-06, "loss": 0.3446077346801758, "mean_token_accuracy": 0.8726995788514614, "num_tokens": 4919138.0, "step": 1280 }, { "entropy": 1.8007852733135223, "epoch": 2.8174863387978144, "grad_norm": 3.562910795211792, "learning_rate": 8.457313830368862e-06, "loss": 0.43190617561340333, "mean_token_accuracy": 0.8488910354673862, "num_tokens": 4962188.0, "step": 1290 }, { "entropy": 1.7394358351826669, "epoch": 2.839344262295082, "grad_norm": 4.378752708435059, "learning_rate": 8.317716650984997e-06, "loss": 0.3554516315460205, "mean_token_accuracy": 0.900595785677433, "num_tokens": 5003129.0, "step": 1300 }, { "epoch": 2.839344262295082, "eval_entropy": 1.7719783522188663, "eval_loss": 1.0918433666229248, "eval_mean_token_accuracy": 0.7487576644634828, "eval_num_tokens": 5003129.0, "eval_runtime": 25.2737, "eval_samples_per_second": 20.258, "eval_steps_per_second": 10.129, "step": 1300 }, { "entropy": 1.697381130978465, "epoch": 2.86120218579235, "grad_norm": 5.49855375289917, "learning_rate": 8.17845605642745e-06, "loss": 0.2979349374771118, "mean_token_accuracy": 0.8746489737182855, "num_tokens": 5047985.0, "step": 1310 }, { "entropy": 1.7068176820874215, "epoch": 2.8830601092896178, "grad_norm": 4.538719654083252, "learning_rate": 8.039559909424028e-06, "loss": 0.4271398067474365, "mean_token_accuracy": 0.8372387941926718, "num_tokens": 5086478.0, "step": 1320 }, { "entropy": 1.7037811130285263, "epoch": 2.904918032786885, "grad_norm": 8.465956687927246, "learning_rate": 7.901055999785251e-06, "loss": 0.5102831840515136, "mean_token_accuracy": 0.8660007566213608, "num_tokens": 5125267.0, "step": 1330 }, { "entropy": 1.683811515569687, "epoch": 2.926775956284153, "grad_norm": 11.026825904846191, "learning_rate": 7.762972038844287e-06, "loss": 0.453878116607666, "mean_token_accuracy": 0.8719288915395736, "num_tokens": 5160129.0, "step": 1340 }, { "entropy": 1.712484674155712, "epoch": 2.9486338797814207, "grad_norm": 7.742736339569092, "learning_rate": 7.625335653912578e-06, "loss": 0.34582009315490725, "mean_token_accuracy": 0.8842464782297611, "num_tokens": 5194331.0, "step": 1350 }, { "entropy": 1.7974103182554244, "epoch": 2.9704918032786884, "grad_norm": 16.226985931396484, "learning_rate": 7.488174382752256e-06, "loss": 0.5330884456634521, "mean_token_accuracy": 0.8534679703414441, "num_tokens": 5244510.0, "step": 1360 }, { "entropy": 1.7614209264516831, "epoch": 2.9923497267759562, "grad_norm": 3.4853780269622803, "learning_rate": 7.351515668066524e-06, "loss": 0.353696346282959, "mean_token_accuracy": 0.9209138300269842, "num_tokens": 5280186.0, "step": 1370 }, { "entropy": 1.6901170454527203, "epoch": 3.0131147540983605, "grad_norm": 3.082343339920044, "learning_rate": 7.2153868520089884e-06, "loss": 0.46216726303100586, "mean_token_accuracy": 0.9046591481095866, "num_tokens": 5312685.0, "step": 1380 }, { "entropy": 1.6913618817925453, "epoch": 3.0349726775956283, "grad_norm": 3.6766366958618164, "learning_rate": 7.0798151707131705e-06, "loss": 0.31811132431030276, "mean_token_accuracy": 0.9293436668813229, "num_tokens": 5355921.0, "step": 1390 }, { "entropy": 1.6231368098407983, "epoch": 3.056830601092896, "grad_norm": 5.460843086242676, "learning_rate": 6.944827748843187e-06, "loss": 0.2959195613861084, "mean_token_accuracy": 0.9214666485786438, "num_tokens": 5396513.0, "step": 1400 }, { "epoch": 3.056830601092896, "eval_entropy": 1.6358041786588728, "eval_loss": 1.2711889743804932, "eval_mean_token_accuracy": 0.7361913194181398, "eval_num_tokens": 5396513.0, "eval_runtime": 25.2843, "eval_samples_per_second": 20.25, "eval_steps_per_second": 10.125, "step": 1400 }, { "entropy": 1.6227923020720483, "epoch": 3.078688524590164, "grad_norm": 5.745507717132568, "learning_rate": 6.810451594166778e-06, "loss": 0.3128030776977539, "mean_token_accuracy": 0.923306229710579, "num_tokens": 5439874.0, "step": 1410 }, { "entropy": 1.5370216600596904, "epoch": 3.1005464480874316, "grad_norm": 3.301435708999634, "learning_rate": 6.676713592151663e-06, "loss": 0.1619083046913147, "mean_token_accuracy": 0.9161941222846508, "num_tokens": 5482643.0, "step": 1420 }, { "entropy": 1.5821660324931144, "epoch": 3.1224043715846994, "grad_norm": 6.687673568725586, "learning_rate": 6.5436405005864215e-06, "loss": 0.2582197666168213, "mean_token_accuracy": 0.9377869054675102, "num_tokens": 5520901.0, "step": 1430 }, { "entropy": 1.598063986003399, "epoch": 3.144262295081967, "grad_norm": 1.1611300706863403, "learning_rate": 6.4112589442268855e-06, "loss": 0.22129406929016113, "mean_token_accuracy": 0.9037676326930523, "num_tokens": 5554607.0, "step": 1440 }, { "entropy": 1.5651034712791443, "epoch": 3.166120218579235, "grad_norm": 14.291632652282715, "learning_rate": 6.279595409469169e-06, "loss": 0.2598989963531494, "mean_token_accuracy": 0.9124826833605766, "num_tokens": 5597787.0, "step": 1450 }, { "entropy": 1.6206938516348601, "epoch": 3.1879781420765028, "grad_norm": 2.9516093730926514, "learning_rate": 6.148676239050366e-06, "loss": 0.3642241954803467, "mean_token_accuracy": 0.9069154664874077, "num_tokens": 5637024.0, "step": 1460 }, { "entropy": 1.551618180796504, "epoch": 3.2098360655737705, "grad_norm": 7.661910533905029, "learning_rate": 6.0185276267779965e-06, "loss": 0.19039158821105956, "mean_token_accuracy": 0.9062366366386414, "num_tokens": 5677024.0, "step": 1470 }, { "entropy": 1.5639437273144723, "epoch": 3.2316939890710383, "grad_norm": 5.479608058929443, "learning_rate": 5.889175612289251e-06, "loss": 0.29235665798187255, "mean_token_accuracy": 0.9100384078919888, "num_tokens": 5717446.0, "step": 1480 }, { "entropy": 1.5362057872116566, "epoch": 3.253551912568306, "grad_norm": 10.538714408874512, "learning_rate": 5.7606460758410655e-06, "loss": 0.26177852153778075, "mean_token_accuracy": 0.9071271993219853, "num_tokens": 5760098.0, "step": 1490 }, { "entropy": 1.5072948724031447, "epoch": 3.275409836065574, "grad_norm": 10.498205184936523, "learning_rate": 5.632964733132142e-06, "loss": 0.3608083724975586, "mean_token_accuracy": 0.9086304809898138, "num_tokens": 5794405.0, "step": 1500 }, { "epoch": 3.275409836065574, "eval_entropy": 1.5782789755612612, "eval_loss": 1.2997822761535645, "eval_mean_token_accuracy": 0.74409809790086, "eval_num_tokens": 5794405.0, "eval_runtime": 25.2677, "eval_samples_per_second": 20.263, "eval_steps_per_second": 10.131, "step": 1500 }, { "entropy": 1.5180404711514712, "epoch": 3.2972677595628417, "grad_norm": 3.2218379974365234, "learning_rate": 5.506157130157788e-06, "loss": 0.17872884273529052, "mean_token_accuracy": 0.9064229533076287, "num_tokens": 5834688.0, "step": 1510 }, { "entropy": 1.534475613385439, "epoch": 3.3191256830601095, "grad_norm": 11.32108211517334, "learning_rate": 5.380248638098821e-06, "loss": 0.286358642578125, "mean_token_accuracy": 0.9199724584817887, "num_tokens": 5878545.0, "step": 1520 }, { "entropy": 1.6077978804707527, "epoch": 3.3409836065573773, "grad_norm": 6.171378135681152, "learning_rate": 5.255264448245366e-06, "loss": 0.2198193073272705, "mean_token_accuracy": 0.9341178297996521, "num_tokens": 5918379.0, "step": 1530 }, { "entropy": 1.6092828884720802, "epoch": 3.362841530054645, "grad_norm": 5.977477550506592, "learning_rate": 5.1312295669567085e-06, "loss": 0.3700289487838745, "mean_token_accuracy": 0.8991808846592904, "num_tokens": 5950574.0, "step": 1540 }, { "entropy": 1.5695540212094783, "epoch": 3.384699453551913, "grad_norm": 0.7643852829933167, "learning_rate": 5.0081688106581e-06, "loss": 0.19067635536193847, "mean_token_accuracy": 0.9202431552112103, "num_tokens": 5987585.0, "step": 1550 }, { "entropy": 1.5746611192822457, "epoch": 3.40655737704918, "grad_norm": 5.357200622558594, "learning_rate": 4.886106800875572e-06, "loss": 0.26554481983184813, "mean_token_accuracy": 0.8943272069096565, "num_tokens": 6024581.0, "step": 1560 }, { "entropy": 1.591781959682703, "epoch": 3.428415300546448, "grad_norm": 11.075048446655273, "learning_rate": 4.765067959309782e-06, "loss": 0.2532616138458252, "mean_token_accuracy": 0.9050811067223549, "num_tokens": 6054472.0, "step": 1570 }, { "entropy": 1.6494382977485658, "epoch": 3.4502732240437157, "grad_norm": 6.1315693855285645, "learning_rate": 4.6450765029497945e-06, "loss": 0.2048194408416748, "mean_token_accuracy": 0.9233898296952248, "num_tokens": 6092006.0, "step": 1580 }, { "entropy": 1.5534474547952413, "epoch": 3.4721311475409835, "grad_norm": 4.249480724334717, "learning_rate": 4.526156439227848e-06, "loss": 0.3019617795944214, "mean_token_accuracy": 0.9094546407461166, "num_tokens": 6130677.0, "step": 1590 }, { "entropy": 1.616061332821846, "epoch": 3.4939890710382513, "grad_norm": 15.559029579162598, "learning_rate": 4.408331561216022e-06, "loss": 0.15720347166061402, "mean_token_accuracy": 0.9568640798330307, "num_tokens": 6168361.0, "step": 1600 }, { "epoch": 3.4939890710382513, "eval_entropy": 1.5903846183791757, "eval_loss": 1.3212494850158691, "eval_mean_token_accuracy": 0.7415331557858735, "eval_num_tokens": 6168361.0, "eval_runtime": 25.2585, "eval_samples_per_second": 20.27, "eval_steps_per_second": 10.135, "step": 1600 }, { "entropy": 1.5285045128315686, "epoch": 3.515846994535519, "grad_norm": 7.225104331970215, "learning_rate": 4.291625442865836e-06, "loss": 0.27741916179656984, "mean_token_accuracy": 0.9309419341385364, "num_tokens": 6217528.0, "step": 1610 }, { "entropy": 1.5996034383773803, "epoch": 3.537704918032787, "grad_norm": 8.290458679199219, "learning_rate": 4.176061434291637e-06, "loss": 0.3423781156539917, "mean_token_accuracy": 0.8994432087987662, "num_tokens": 6253094.0, "step": 1620 }, { "entropy": 1.6044300124049187, "epoch": 3.5595628415300546, "grad_norm": 7.356506824493408, "learning_rate": 4.061662657098824e-06, "loss": 0.3168341875076294, "mean_token_accuracy": 0.9347146339714527, "num_tokens": 6292894.0, "step": 1630 }, { "entropy": 1.5532973259687424, "epoch": 3.5814207650273224, "grad_norm": 10.509337425231934, "learning_rate": 3.948451999757744e-06, "loss": 0.3533791542053223, "mean_token_accuracy": 0.9503577001392841, "num_tokens": 6329002.0, "step": 1640 }, { "entropy": 1.5191884014755488, "epoch": 3.60327868852459, "grad_norm": 4.559752941131592, "learning_rate": 3.836452113024271e-06, "loss": 0.22230336666107178, "mean_token_accuracy": 0.9372093766927719, "num_tokens": 6368568.0, "step": 1650 }, { "entropy": 1.6334565032273531, "epoch": 3.625136612021858, "grad_norm": 8.851140975952148, "learning_rate": 3.725685405407904e-06, "loss": 0.18717575073242188, "mean_token_accuracy": 0.9109462410211563, "num_tokens": 6400868.0, "step": 1660 }, { "entropy": 1.5916602939367295, "epoch": 3.646994535519126, "grad_norm": 3.6515164375305176, "learning_rate": 3.6161740386883916e-06, "loss": 0.29880824089050295, "mean_token_accuracy": 0.8781519372016191, "num_tokens": 6434878.0, "step": 1670 }, { "entropy": 1.5508679054677486, "epoch": 3.6688524590163936, "grad_norm": 5.768099784851074, "learning_rate": 3.5079399234816636e-06, "loss": 0.34449656009674073, "mean_token_accuracy": 0.9187621869146824, "num_tokens": 6482039.0, "step": 1680 }, { "entropy": 1.6093040138483048, "epoch": 3.6907103825136613, "grad_norm": 10.039252281188965, "learning_rate": 3.4010047148560522e-06, "loss": 0.3076228141784668, "mean_token_accuracy": 0.9134237676858902, "num_tokens": 6519513.0, "step": 1690 }, { "entropy": 1.5371469020843507, "epoch": 3.7125683060109287, "grad_norm": 4.985898971557617, "learning_rate": 3.2953898079996092e-06, "loss": 0.35710718631744387, "mean_token_accuracy": 0.922921521216631, "num_tokens": 6556344.0, "step": 1700 }, { "epoch": 3.7125683060109287, "eval_entropy": 1.5996102751232684, "eval_loss": 1.310859203338623, "eval_mean_token_accuracy": 0.7403237737016752, "eval_num_tokens": 6556344.0, "eval_runtime": 25.2734, "eval_samples_per_second": 20.258, "eval_steps_per_second": 10.129, "step": 1700 }, { "entropy": 1.5552573069930076, "epoch": 3.7344262295081965, "grad_norm": 5.772418975830078, "learning_rate": 3.191116333939469e-06, "loss": 0.18078577518463135, "mean_token_accuracy": 0.9119489409029484, "num_tokens": 6593300.0, "step": 1710 }, { "entropy": 1.5171513885259629, "epoch": 3.7562841530054643, "grad_norm": 14.933680534362793, "learning_rate": 3.088205155313997e-06, "loss": 0.21673390865325928, "mean_token_accuracy": 0.9187557071447372, "num_tokens": 6640279.0, "step": 1720 }, { "entropy": 1.6221169739961625, "epoch": 3.778142076502732, "grad_norm": 3.3472113609313965, "learning_rate": 2.986676862198714e-06, "loss": 0.17331513166427612, "mean_token_accuracy": 0.928995156288147, "num_tokens": 6676193.0, "step": 1730 }, { "entropy": 1.6270448446273804, "epoch": 3.8, "grad_norm": 6.625114440917969, "learning_rate": 2.8865517679866728e-06, "loss": 0.28036065101623536, "mean_token_accuracy": 0.8961473934352397, "num_tokens": 6714066.0, "step": 1740 }, { "entropy": 1.5236708283424378, "epoch": 3.8218579234972676, "grad_norm": 8.20154094696045, "learning_rate": 2.7878499053242593e-06, "loss": 0.3181121826171875, "mean_token_accuracy": 0.9385631062090397, "num_tokens": 6754143.0, "step": 1750 }, { "entropy": 1.548745909333229, "epoch": 3.8437158469945354, "grad_norm": 8.136096000671387, "learning_rate": 2.6905910221031186e-06, "loss": 0.14712284803390502, "mean_token_accuracy": 0.9373674474656581, "num_tokens": 6789949.0, "step": 1760 }, { "entropy": 1.6179724402725697, "epoch": 3.865573770491803, "grad_norm": 8.492207527160645, "learning_rate": 2.59479457750909e-06, "loss": 0.22144730091094972, "mean_token_accuracy": 0.9098515301942826, "num_tokens": 6823239.0, "step": 1770 }, { "entropy": 1.5828871674835683, "epoch": 3.887431693989071, "grad_norm": 4.814517021179199, "learning_rate": 2.500479738128879e-06, "loss": 0.19235601425170898, "mean_token_accuracy": 0.9154853902757167, "num_tokens": 6864003.0, "step": 1780 }, { "entropy": 1.5566079840064049, "epoch": 3.9092896174863387, "grad_norm": 1.330918550491333, "learning_rate": 2.4076653741152687e-06, "loss": 0.1576427102088928, "mean_token_accuracy": 0.9358552634716034, "num_tokens": 6893305.0, "step": 1790 }, { "entropy": 1.5818458020687103, "epoch": 3.9311475409836065, "grad_norm": 7.912631511688232, "learning_rate": 2.3163700554116765e-06, "loss": 0.3152014255523682, "mean_token_accuracy": 0.9117202915251255, "num_tokens": 6931798.0, "step": 1800 }, { "epoch": 3.9311475409836065, "eval_entropy": 1.5581459198147058, "eval_loss": 1.3899604082107544, "eval_mean_token_accuracy": 0.7383179743774235, "eval_num_tokens": 6931798.0, "eval_runtime": 25.2597, "eval_samples_per_second": 20.269, "eval_steps_per_second": 10.135, "step": 1800 }, { "entropy": 1.522872880101204, "epoch": 3.9530054644808743, "grad_norm": 9.055262565612793, "learning_rate": 2.2266120480367202e-06, "loss": 0.15156043767929078, "mean_token_accuracy": 0.9299404136836529, "num_tokens": 6966554.0, "step": 1810 }, { "entropy": 1.6150698214769363, "epoch": 3.974863387978142, "grad_norm": 3.513589859008789, "learning_rate": 2.1384093104296624e-06, "loss": 0.32263479232788084, "mean_token_accuracy": 0.9067349448800087, "num_tokens": 7000411.0, "step": 1820 }, { "entropy": 1.5076138753443957, "epoch": 3.99672131147541, "grad_norm": 4.524299144744873, "learning_rate": 2.0517794898573075e-06, "loss": 0.21262218952178955, "mean_token_accuracy": 0.9192514590919018, "num_tokens": 7047052.0, "step": 1830 }, { "entropy": 1.5324510986867703, "epoch": 4.017486338797815, "grad_norm": 11.481642723083496, "learning_rate": 1.9667399188832448e-06, "loss": 0.11275914907455445, "mean_token_accuracy": 0.9351930963365656, "num_tokens": 7078248.0, "step": 1840 }, { "entropy": 1.548930251598358, "epoch": 4.039344262295082, "grad_norm": 3.9623751640319824, "learning_rate": 1.883307611899986e-06, "loss": 0.15659793615341186, "mean_token_accuracy": 0.9287457197904587, "num_tokens": 7124139.0, "step": 1850 }, { "entropy": 1.4768053125590086, "epoch": 4.06120218579235, "grad_norm": 4.408417701721191, "learning_rate": 1.8014992617248184e-06, "loss": 0.12531669139862062, "mean_token_accuracy": 0.9682689242064952, "num_tokens": 7164293.0, "step": 1860 }, { "entropy": 1.4974569860845803, "epoch": 4.083060109289617, "grad_norm": 6.734787464141846, "learning_rate": 1.7213312362599376e-06, "loss": 0.09787633419036865, "mean_token_accuracy": 0.9446013942360878, "num_tokens": 7205071.0, "step": 1870 }, { "entropy": 1.4866872608661652, "epoch": 4.104918032786885, "grad_norm": 1.529787540435791, "learning_rate": 1.6428195752176512e-06, "loss": 0.21155085563659667, "mean_token_accuracy": 0.9456927172839642, "num_tokens": 7236779.0, "step": 1880 }, { "entropy": 1.467564422264695, "epoch": 4.126775956284153, "grad_norm": 10.446721076965332, "learning_rate": 1.565979986911189e-06, "loss": 0.30939359664916993, "mean_token_accuracy": 0.90986697524786, "num_tokens": 7272026.0, "step": 1890 }, { "entropy": 1.4936597064137458, "epoch": 4.14863387978142, "grad_norm": 1.104892373085022, "learning_rate": 1.4908278451118629e-06, "loss": 0.24086241722106932, "mean_token_accuracy": 0.9398242756724358, "num_tokens": 7310448.0, "step": 1900 }, { "epoch": 4.14863387978142, "eval_entropy": 1.508402063511312, "eval_loss": 1.5420618057250977, "eval_mean_token_accuracy": 0.7262968142749742, "eval_num_tokens": 7310448.0, "eval_runtime": 25.2826, "eval_samples_per_second": 20.251, "eval_steps_per_second": 10.126, "step": 1900 }, { "entropy": 1.526249935477972, "epoch": 4.170491803278688, "grad_norm": 7.124038219451904, "learning_rate": 1.4173781859731294e-06, "loss": 0.20966436862945556, "mean_token_accuracy": 0.9498579859733581, "num_tokens": 7349305.0, "step": 1910 }, { "entropy": 1.5114058703184128, "epoch": 4.192349726775956, "grad_norm": 5.5153279304504395, "learning_rate": 1.3456457050222227e-06, "loss": 0.13045576810836793, "mean_token_accuracy": 0.9261387333273887, "num_tokens": 7378315.0, "step": 1920 }, { "entropy": 1.5217763639986515, "epoch": 4.214207650273224, "grad_norm": 10.250426292419434, "learning_rate": 1.2756447542199146e-06, "loss": 0.16847167015075684, "mean_token_accuracy": 0.9444297157227993, "num_tokens": 7416219.0, "step": 1930 }, { "entropy": 1.4267330523580313, "epoch": 4.2360655737704915, "grad_norm": 1.7956056594848633, "learning_rate": 1.207389339089049e-06, "loss": 0.14541631937026978, "mean_token_accuracy": 0.9462509617209435, "num_tokens": 7455837.0, "step": 1940 }, { "entropy": 1.4471466541290283, "epoch": 4.257923497267759, "grad_norm": 12.950838088989258, "learning_rate": 1.140893115912358e-06, "loss": 0.25396480560302737, "mean_token_accuracy": 0.9296876281499863, "num_tokens": 7491173.0, "step": 1950 }, { "entropy": 1.480190312117338, "epoch": 4.279781420765027, "grad_norm": 18.943504333496094, "learning_rate": 1.0761693890001624e-06, "loss": 0.12710440158843994, "mean_token_accuracy": 0.9423264317214489, "num_tokens": 7532165.0, "step": 1960 }, { "entropy": 1.4895855821669102, "epoch": 4.301639344262295, "grad_norm": 15.379076957702637, "learning_rate": 1.0132311080285061e-06, "loss": 0.13325932025909423, "mean_token_accuracy": 0.9429835468530655, "num_tokens": 7578121.0, "step": 1970 }, { "entropy": 1.4661264941096306, "epoch": 4.323497267759563, "grad_norm": 9.257176399230957, "learning_rate": 9.520908654482308e-07, "loss": 0.18194167613983153, "mean_token_accuracy": 0.9348225675523281, "num_tokens": 7615493.0, "step": 1980 }, { "entropy": 1.487341583520174, "epoch": 4.3453551912568305, "grad_norm": 8.9894380569458, "learning_rate": 8.927608939655185e-07, "loss": 0.28666565418243406, "mean_token_accuracy": 0.9525417745113373, "num_tokens": 7657601.0, "step": 1990 }, { "entropy": 1.4775039009749888, "epoch": 4.367213114754098, "grad_norm": 6.236198902130127, "learning_rate": 8.352530640944312e-07, "loss": 0.3593610286712646, "mean_token_accuracy": 0.9542292051017285, "num_tokens": 7695168.0, "step": 2000 }, { "epoch": 4.367213114754098, "eval_entropy": 1.4882210597861558, "eval_loss": 1.5714366436004639, "eval_mean_token_accuracy": 0.7317562090465799, "eval_num_tokens": 7695168.0, "eval_runtime": 25.2945, "eval_samples_per_second": 20.242, "eval_steps_per_second": 10.121, "step": 2000 }, { "entropy": 1.4730473149567842, "epoch": 4.389071038251366, "grad_norm": 12.652424812316895, "learning_rate": 7.795788817818972e-07, "loss": 0.0923178493976593, "mean_token_accuracy": 0.9668491549789906, "num_tokens": 7733619.0, "step": 2010 }, { "entropy": 1.5186619710177183, "epoch": 4.410928961748634, "grad_norm": 1.527182698249817, "learning_rate": 7.257494861056402e-07, "loss": 0.23416218757629395, "mean_token_accuracy": 0.9748448759317399, "num_tokens": 7771339.0, "step": 2020 }, { "entropy": 1.4672299686819315, "epoch": 4.432786885245902, "grad_norm": 10.213470458984375, "learning_rate": 6.737756470455259e-07, "loss": 0.20572996139526367, "mean_token_accuracy": 0.9412943184375763, "num_tokens": 7814745.0, "step": 2030 }, { "entropy": 1.4385718286037446, "epoch": 4.454644808743169, "grad_norm": 6.762119293212891, "learning_rate": 6.236677633287403e-07, "loss": 0.2968504190444946, "mean_token_accuracy": 0.945137070864439, "num_tokens": 7850365.0, "step": 2040 }, { "entropy": 1.48858273178339, "epoch": 4.476502732240437, "grad_norm": 1.248301386833191, "learning_rate": 5.754358603492505e-07, "loss": 0.08900911211967469, "mean_token_accuracy": 0.9440581537783146, "num_tokens": 7892276.0, "step": 2050 }, { "entropy": 1.439606611058116, "epoch": 4.498360655737705, "grad_norm": 6.034962177276611, "learning_rate": 5.290895881619618e-07, "loss": 0.17720189094543456, "mean_token_accuracy": 0.951624260097742, "num_tokens": 7930929.0, "step": 2060 }, { "entropy": 1.4914564713835716, "epoch": 4.520218579234973, "grad_norm": 10.574368476867676, "learning_rate": 4.846382195519772e-07, "loss": 0.10065207481384278, "mean_token_accuracy": 0.9822921209037304, "num_tokens": 7971276.0, "step": 2070 }, { "entropy": 1.4798044867813587, "epoch": 4.5420765027322405, "grad_norm": 1.7470002174377441, "learning_rate": 4.420906481793252e-07, "loss": 0.0717387318611145, "mean_token_accuracy": 0.9487549245357514, "num_tokens": 8004006.0, "step": 2080 }, { "entropy": 1.513572445511818, "epoch": 4.563934426229508, "grad_norm": 8.526530265808105, "learning_rate": 4.014553867995641e-07, "loss": 0.17615694999694825, "mean_token_accuracy": 0.9310802616178989, "num_tokens": 8042109.0, "step": 2090 }, { "entropy": 1.4915996737778188, "epoch": 4.585792349726776, "grad_norm": 3.867147207260132, "learning_rate": 3.6274056556056425e-07, "loss": 0.38680167198181153, "mean_token_accuracy": 0.9497635766863823, "num_tokens": 8079012.0, "step": 2100 }, { "epoch": 4.585792349726776, "eval_entropy": 1.4877252136357129, "eval_loss": 1.5858014822006226, "eval_mean_token_accuracy": 0.730545868864283, "eval_num_tokens": 8079012.0, "eval_runtime": 25.2797, "eval_samples_per_second": 20.253, "eval_steps_per_second": 10.127, "step": 2100 }, { "entropy": 1.5772681519389153, "epoch": 4.607650273224044, "grad_norm": 8.74162769317627, "learning_rate": 3.259539303758752e-07, "loss": 0.17112650871276855, "mean_token_accuracy": 0.9037679031491279, "num_tokens": 8113891.0, "step": 2110 }, { "entropy": 1.450429831445217, "epoch": 4.629508196721312, "grad_norm": 3.486109972000122, "learning_rate": 2.911028413749395e-07, "loss": 0.12542186975479125, "mean_token_accuracy": 0.9641172751784325, "num_tokens": 8158656.0, "step": 2120 }, { "entropy": 1.457353810966015, "epoch": 4.651366120218579, "grad_norm": 5.5825090408325195, "learning_rate": 2.581942714305219e-07, "loss": 0.11810015439987183, "mean_token_accuracy": 0.9155681878328323, "num_tokens": 8208969.0, "step": 2130 }, { "entropy": 1.4100075215101242, "epoch": 4.673224043715847, "grad_norm": 10.298120498657227, "learning_rate": 2.2723480476358529e-07, "loss": 0.20408346652984619, "mean_token_accuracy": 0.9427890285849572, "num_tokens": 8248876.0, "step": 2140 }, { "entropy": 1.4350176867097617, "epoch": 4.695081967213115, "grad_norm": 1.2466769218444824, "learning_rate": 1.9823063562596224e-07, "loss": 0.07048531770706176, "mean_token_accuracy": 0.9548317432403565, "num_tokens": 8284270.0, "step": 2150 }, { "entropy": 1.4886561691761018, "epoch": 4.716939890710383, "grad_norm": 7.229863166809082, "learning_rate": 1.7118756706101748e-07, "loss": 0.1607893705368042, "mean_token_accuracy": 0.9643361568450928, "num_tokens": 8317245.0, "step": 2160 }, { "entropy": 1.4858718007802962, "epoch": 4.738797814207651, "grad_norm": 7.945173740386963, "learning_rate": 1.4611100974260994e-07, "loss": 0.2605283737182617, "mean_token_accuracy": 0.9339787639677525, "num_tokens": 8359492.0, "step": 2170 }, { "entropy": 1.4697067685425282, "epoch": 4.760655737704918, "grad_norm": 2.577718496322632, "learning_rate": 1.230059808925377e-07, "loss": 0.23986785411834716, "mean_token_accuracy": 0.9224813591688872, "num_tokens": 8392450.0, "step": 2180 }, { "entropy": 1.4250585563480853, "epoch": 4.782513661202186, "grad_norm": 3.4977567195892334, "learning_rate": 1.0187710327671297e-07, "loss": 0.1858036160469055, "mean_token_accuracy": 0.9554606847465038, "num_tokens": 8436208.0, "step": 2190 }, { "entropy": 1.4355518952012063, "epoch": 4.804371584699454, "grad_norm": 2.248436450958252, "learning_rate": 8.272860428026108e-08, "loss": 0.27360637187957765, "mean_token_accuracy": 0.9597639583051205, "num_tokens": 8474217.0, "step": 2200 }, { "epoch": 4.804371584699454, "eval_entropy": 1.48676719609648, "eval_loss": 1.57476806640625, "eval_mean_token_accuracy": 0.733519333647564, "eval_num_tokens": 8474217.0, "eval_runtime": 25.278, "eval_samples_per_second": 20.255, "eval_steps_per_second": 10.127, "step": 2200 }, { "entropy": 1.4184951461851596, "epoch": 4.826229508196722, "grad_norm": 3.388068675994873, "learning_rate": 6.556431506171357e-08, "loss": 0.2510469198226929, "mean_token_accuracy": 0.9551761075854301, "num_tokens": 8512910.0, "step": 2210 }, { "entropy": 1.5154303699731826, "epoch": 4.848087431693989, "grad_norm": 8.467205047607422, "learning_rate": 5.038766978649356e-08, "loss": 0.1511959910392761, "mean_token_accuracy": 0.9454753026366234, "num_tokens": 8550362.0, "step": 2220 }, { "entropy": 1.474125138297677, "epoch": 4.869945355191257, "grad_norm": 4.428479194641113, "learning_rate": 3.7201704939813233e-08, "loss": 0.1717713952064514, "mean_token_accuracy": 0.9650007724761963, "num_tokens": 8593901.0, "step": 2230 }, { "entropy": 1.507462577521801, "epoch": 4.891803278688524, "grad_norm": 4.86669921875, "learning_rate": 2.6009058719150825e-08, "loss": 0.15636818408966063, "mean_token_accuracy": 0.9328071504831315, "num_tokens": 8632919.0, "step": 2240 }, { "entropy": 1.5307415947318077, "epoch": 4.913661202185793, "grad_norm": 14.530187606811523, "learning_rate": 1.681197050640626e-08, "loss": 0.3196465730667114, "mean_token_accuracy": 0.9131122671067715, "num_tokens": 8672929.0, "step": 2250 }, { "entropy": 1.4384046517312528, "epoch": 4.93551912568306, "grad_norm": 8.218527793884277, "learning_rate": 9.61228041985951e-09, "loss": 0.21683952808380128, "mean_token_accuracy": 0.9353933550417424, "num_tokens": 8713146.0, "step": 2260 }, { "entropy": 1.4315903328359127, "epoch": 4.9573770491803275, "grad_norm": 16.356935501098633, "learning_rate": 4.411428945998442e-09, "loss": 0.11141870021820069, "mean_token_accuracy": 0.9473440609872341, "num_tokens": 8743042.0, "step": 2270 }, { "entropy": 1.508497305959463, "epoch": 4.979234972677595, "grad_norm": 4.874918460845947, "learning_rate": 1.2104566513204685e-09, "loss": 0.281640362739563, "mean_token_accuracy": 0.919170456379652, "num_tokens": 8781700.0, "step": 2280 }, { "entropy": 1.4428076344101053, "epoch": 5.0, "grad_norm": 6.22572660446167, "learning_rate": 1.0003974135752715e-11, "loss": 0.1342082738876343, "mean_token_accuracy": 0.9626582837418506, "num_tokens": 8817875.0, "step": 2290 }, { "epoch": 5.0, "eval_entropy": 1.4876198212150484, "eval_loss": 1.570472002029419, "eval_mean_token_accuracy": 0.7331945998594165, "eval_num_tokens": 8817875.0, "eval_runtime": 25.2565, "eval_samples_per_second": 20.272, "eval_steps_per_second": 10.136, "step": 2290 }, { "epoch": 5.0, "step": 2290, "total_flos": 3.98562812212224e+17, "train_loss": 0.445265986773645, "train_runtime": 5773.6536, "train_samples_per_second": 3.17, "train_steps_per_second": 0.397 } ], "logging_steps": 10, "max_steps": 2290, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 100, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3.98562812212224e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }