Jongbin-kr's picture
End of training: best validation-loss checkpoint
54a3dc2 verified
Raw
History Blame Contribute Delete
145 kB
{
"best_global_step": 1600,
"best_metric": 0.8140835165977478,
"best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_sni_ours-luca_ffn_only_5ep/checkpoint-1600",
"epoch": 5.0,
"eval_steps": 100,
"global_step": 4280,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.7990853235125541,
"epoch": 0.01168736303871439,
"grad_norm": 2.2411153316497803,
"learning_rate": 1.3953488372093025e-06,
"loss": 2.221370887756348,
"mean_token_accuracy": 0.4454644417390227,
"num_tokens": 90886.0,
"step": 10
},
{
"entropy": 1.7851194575428964,
"epoch": 0.02337472607742878,
"grad_norm": 5.774791240692139,
"learning_rate": 2.9457364341085276e-06,
"loss": 2.287215232849121,
"mean_token_accuracy": 0.4802763115614653,
"num_tokens": 193261.0,
"step": 20
},
{
"entropy": 1.8645276561379434,
"epoch": 0.03506208911614317,
"grad_norm": 1.2933292388916016,
"learning_rate": 4.4961240310077525e-06,
"loss": 2.0796104431152345,
"mean_token_accuracy": 0.5051111107692122,
"num_tokens": 311331.0,
"step": 30
},
{
"entropy": 1.8436205610632896,
"epoch": 0.04674945215485756,
"grad_norm": 5.532759666442871,
"learning_rate": 6.046511627906977e-06,
"loss": 2.019709587097168,
"mean_token_accuracy": 0.48441268149763345,
"num_tokens": 400148.0,
"step": 40
},
{
"entropy": 1.828799621760845,
"epoch": 0.05843681519357195,
"grad_norm": 4.328863620758057,
"learning_rate": 7.596899224806202e-06,
"loss": 1.6759492874145507,
"mean_token_accuracy": 0.6234621474519372,
"num_tokens": 524126.0,
"step": 50
},
{
"entropy": 1.9845396891236304,
"epoch": 0.07012417823228634,
"grad_norm": 4.902604579925537,
"learning_rate": 9.147286821705427e-06,
"loss": 1.6193151473999023,
"mean_token_accuracy": 0.6227478144690395,
"num_tokens": 604582.0,
"step": 60
},
{
"entropy": 2.1635267987847326,
"epoch": 0.08181154127100074,
"grad_norm": 1.8905808925628662,
"learning_rate": 1.0697674418604651e-05,
"loss": 1.7636125564575196,
"mean_token_accuracy": 0.6229628790169954,
"num_tokens": 690297.0,
"step": 70
},
{
"entropy": 2.20285327732563,
"epoch": 0.09349890430971512,
"grad_norm": 3.2167978286743164,
"learning_rate": 1.2248062015503876e-05,
"loss": 1.7089515686035157,
"mean_token_accuracy": 0.6355361180379987,
"num_tokens": 797131.0,
"step": 80
},
{
"entropy": 2.164117117226124,
"epoch": 0.10518626734842951,
"grad_norm": 1.2573010921478271,
"learning_rate": 1.3798449612403102e-05,
"loss": 1.563762092590332,
"mean_token_accuracy": 0.6375745143741369,
"num_tokens": 877794.0,
"step": 90
},
{
"entropy": 2.1955269888043403,
"epoch": 0.1168736303871439,
"grad_norm": 1.4883538484573364,
"learning_rate": 1.5348837209302328e-05,
"loss": 1.5268404960632325,
"mean_token_accuracy": 0.6866611793637276,
"num_tokens": 964357.0,
"step": 100
},
{
"epoch": 0.1168736303871439,
"eval_entropy": 2.211864855606109,
"eval_loss": 0.972606360912323,
"eval_mean_token_accuracy": 0.7656966285430826,
"eval_num_tokens": 964357.0,
"eval_runtime": 25.7541,
"eval_samples_per_second": 19.88,
"eval_steps_per_second": 9.94,
"step": 100
},
{
"entropy": 2.14595272988081,
"epoch": 0.12856099342585828,
"grad_norm": 3.258664846420288,
"learning_rate": 1.689922480620155e-05,
"loss": 1.5449288368225098,
"mean_token_accuracy": 0.692005117610097,
"num_tokens": 1051056.0,
"step": 110
},
{
"entropy": 2.13690192848444,
"epoch": 0.14024835646457268,
"grad_norm": 3.329728841781616,
"learning_rate": 1.8449612403100777e-05,
"loss": 1.714167022705078,
"mean_token_accuracy": 0.6207397798076272,
"num_tokens": 1139127.0,
"step": 120
},
{
"entropy": 2.2397685661911964,
"epoch": 0.15193571950328708,
"grad_norm": 3.1570706367492676,
"learning_rate": 2e-05,
"loss": 1.4322842597961425,
"mean_token_accuracy": 0.6956309005618095,
"num_tokens": 1205809.0,
"step": 130
},
{
"entropy": 2.1315575197339056,
"epoch": 0.16362308254200147,
"grad_norm": 1.8168814182281494,
"learning_rate": 1.99997136071245e-05,
"loss": 1.304494285583496,
"mean_token_accuracy": 0.6879714308306575,
"num_tokens": 1313591.0,
"step": 140
},
{
"entropy": 2.2233649238944055,
"epoch": 0.17531044558071585,
"grad_norm": 0.8144795894622803,
"learning_rate": 1.999885444490217e-05,
"loss": 1.3845972061157226,
"mean_token_accuracy": 0.6910346703603863,
"num_tokens": 1412866.0,
"step": 150
},
{
"entropy": 2.1577580630779267,
"epoch": 0.18699780861943024,
"grad_norm": 1.940482258796692,
"learning_rate": 1.9997422562544592e-05,
"loss": 1.390633773803711,
"mean_token_accuracy": 0.6759929563850164,
"num_tokens": 1508013.0,
"step": 160
},
{
"entropy": 2.083321948349476,
"epoch": 0.19868517165814464,
"grad_norm": 3.6317291259765625,
"learning_rate": 1.9995418042067957e-05,
"loss": 1.2338299751281738,
"mean_token_accuracy": 0.7018413636833429,
"num_tokens": 1596613.0,
"step": 170
},
{
"entropy": 2.053264130651951,
"epoch": 0.21037253469685901,
"grad_norm": 2.9840128421783447,
"learning_rate": 1.9992840998288338e-05,
"loss": 1.5092729568481444,
"mean_token_accuracy": 0.6634657958522439,
"num_tokens": 1705162.0,
"step": 180
},
{
"entropy": 2.105809884518385,
"epoch": 0.2220598977355734,
"grad_norm": 2.120786428451538,
"learning_rate": 1.9989691578815128e-05,
"loss": 1.3493456840515137,
"mean_token_accuracy": 0.6496284365653991,
"num_tokens": 1772797.0,
"step": 190
},
{
"entropy": 2.2239570677280427,
"epoch": 0.2337472607742878,
"grad_norm": 0.7451742887496948,
"learning_rate": 1.998596996404259e-05,
"loss": 1.510793972015381,
"mean_token_accuracy": 0.6867920899763703,
"num_tokens": 1858310.0,
"step": 200
},
{
"epoch": 0.2337472607742878,
"eval_entropy": 2.113139286637306,
"eval_loss": 0.9217231273651123,
"eval_mean_token_accuracy": 0.7753882835968398,
"eval_num_tokens": 1858310.0,
"eval_runtime": 25.7918,
"eval_samples_per_second": 19.851,
"eval_steps_per_second": 9.926,
"step": 200
},
{
"entropy": 2.0635509312152864,
"epoch": 0.24543462381300218,
"grad_norm": 2.845130681991577,
"learning_rate": 1.9981676367139516e-05,
"loss": 1.42849702835083,
"mean_token_accuracy": 0.6870072908699513,
"num_tokens": 1949074.0,
"step": 210
},
{
"entropy": 2.148236308991909,
"epoch": 0.25712198685171656,
"grad_norm": 1.786993145942688,
"learning_rate": 1.9976811034037018e-05,
"loss": 1.3782122611999512,
"mean_token_accuracy": 0.6854639150202274,
"num_tokens": 2034492.0,
"step": 220
},
{
"entropy": 2.029401682317257,
"epoch": 0.268809349890431,
"grad_norm": 2.152838706970215,
"learning_rate": 1.9971374243414442e-05,
"loss": 1.4339065551757812,
"mean_token_accuracy": 0.6851927833631635,
"num_tokens": 2120329.0,
"step": 230
},
{
"entropy": 2.187216105312109,
"epoch": 0.28049671292914535,
"grad_norm": 4.411855220794678,
"learning_rate": 1.9965366306683407e-05,
"loss": 1.5027010917663575,
"mean_token_accuracy": 0.6676396857947111,
"num_tokens": 2183929.0,
"step": 240
},
{
"entropy": 2.066372972726822,
"epoch": 0.2921840759678597,
"grad_norm": 2.8336033821105957,
"learning_rate": 1.995878756796997e-05,
"loss": 1.3935389518737793,
"mean_token_accuracy": 0.7052215587347745,
"num_tokens": 2271714.0,
"step": 250
},
{
"entropy": 2.146583802998066,
"epoch": 0.30387143900657415,
"grad_norm": 1.979851245880127,
"learning_rate": 1.9951638404094914e-05,
"loss": 1.4767843246459962,
"mean_token_accuracy": 0.6532610202208161,
"num_tokens": 2370958.0,
"step": 260
},
{
"entropy": 2.0532761082053184,
"epoch": 0.3155588020452885,
"grad_norm": 2.413297176361084,
"learning_rate": 1.9943919224552154e-05,
"loss": 1.4167465209960937,
"mean_token_accuracy": 0.6672960091382265,
"num_tokens": 2489860.0,
"step": 270
},
{
"entropy": 2.123379871249199,
"epoch": 0.32724616508400295,
"grad_norm": 3.317007541656494,
"learning_rate": 1.9935630471485293e-05,
"loss": 1.5103903770446778,
"mean_token_accuracy": 0.6566739233210683,
"num_tokens": 2582123.0,
"step": 280
},
{
"entropy": 2.0638687670230866,
"epoch": 0.3389335281227173,
"grad_norm": 3.5680251121520996,
"learning_rate": 1.99267726196623e-05,
"loss": 1.6115623474121095,
"mean_token_accuracy": 0.6871760074049235,
"num_tokens": 2689776.0,
"step": 290
},
{
"entropy": 2.124503730237484,
"epoch": 0.3506208911614317,
"grad_norm": 1.3090689182281494,
"learning_rate": 1.9917346176448312e-05,
"loss": 1.3552765846252441,
"mean_token_accuracy": 0.6656280636787415,
"num_tokens": 2795637.0,
"step": 300
},
{
"epoch": 0.3506208911614317,
"eval_entropy": 2.1001131371594965,
"eval_loss": 0.9286051988601685,
"eval_mean_token_accuracy": 0.7654476343886927,
"eval_num_tokens": 2795637.0,
"eval_runtime": 25.7115,
"eval_samples_per_second": 19.913,
"eval_steps_per_second": 9.957,
"step": 300
},
{
"entropy": 2.0987854704260824,
"epoch": 0.3623082542001461,
"grad_norm": 2.1889779567718506,
"learning_rate": 1.990735168177655e-05,
"loss": 1.4275793075561523,
"mean_token_accuracy": 0.6943906715139747,
"num_tokens": 2895858.0,
"step": 310
},
{
"entropy": 2.1431354597210883,
"epoch": 0.3739956172388605,
"grad_norm": 3.8745343685150146,
"learning_rate": 1.9896789708117442e-05,
"loss": 1.5244775772094727,
"mean_token_accuracy": 0.6774675730615854,
"num_tokens": 2973005.0,
"step": 320
},
{
"entropy": 2.036357672512531,
"epoch": 0.38568298027757486,
"grad_norm": 3.4766616821289062,
"learning_rate": 1.988566086044578e-05,
"loss": 1.2670412063598633,
"mean_token_accuracy": 0.6847519468516111,
"num_tokens": 3068261.0,
"step": 330
},
{
"entropy": 2.040398380160332,
"epoch": 0.3973703433162893,
"grad_norm": 2.0919291973114014,
"learning_rate": 1.9873965776206103e-05,
"loss": 1.2989651679992675,
"mean_token_accuracy": 0.7239908363670111,
"num_tokens": 3161452.0,
"step": 340
},
{
"entropy": 2.0912220269441604,
"epoch": 0.40905770635500366,
"grad_norm": 2.9482905864715576,
"learning_rate": 1.9861705125276173e-05,
"loss": 1.5268967628479004,
"mean_token_accuracy": 0.6429461358115077,
"num_tokens": 3240838.0,
"step": 350
},
{
"entropy": 2.08566821962595,
"epoch": 0.42074506939371803,
"grad_norm": 3.328305721282959,
"learning_rate": 1.9848879609928606e-05,
"loss": 1.4985569953918456,
"mean_token_accuracy": 0.6740516029298306,
"num_tokens": 3343139.0,
"step": 360
},
{
"entropy": 2.0485661208629606,
"epoch": 0.43243243243243246,
"grad_norm": 2.752358913421631,
"learning_rate": 1.9835489964790646e-05,
"loss": 1.4463869094848634,
"mean_token_accuracy": 0.6743310626596213,
"num_tokens": 3488879.0,
"step": 370
},
{
"entropy": 2.098214092850685,
"epoch": 0.4441197954711468,
"grad_norm": 2.8611302375793457,
"learning_rate": 1.9821536956802087e-05,
"loss": 1.2331249237060546,
"mean_token_accuracy": 0.6835227191448212,
"num_tokens": 3580970.0,
"step": 380
},
{
"entropy": 2.0741601526737212,
"epoch": 0.4558071585098612,
"grad_norm": 2.8654325008392334,
"learning_rate": 1.9807021385171342e-05,
"loss": 1.4935486793518067,
"mean_token_accuracy": 0.6689293952658772,
"num_tokens": 3685521.0,
"step": 390
},
{
"entropy": 2.0226009979844095,
"epoch": 0.4674945215485756,
"grad_norm": 2.5369250774383545,
"learning_rate": 1.979194408132968e-05,
"loss": 1.4667850494384767,
"mean_token_accuracy": 0.6739391122013331,
"num_tokens": 3777526.0,
"step": 400
},
{
"epoch": 0.4674945215485756,
"eval_entropy": 2.0862251897342503,
"eval_loss": 0.8904886841773987,
"eval_mean_token_accuracy": 0.7775540838483721,
"eval_num_tokens": 3777526.0,
"eval_runtime": 25.7601,
"eval_samples_per_second": 19.876,
"eval_steps_per_second": 9.938,
"step": 400
},
{
"entropy": 2.0925071969628335,
"epoch": 0.47918188458729,
"grad_norm": 2.5446367263793945,
"learning_rate": 1.977630590888357e-05,
"loss": 1.2959745407104493,
"mean_token_accuracy": 0.6557210482656955,
"num_tokens": 3887532.0,
"step": 410
},
{
"entropy": 2.0614023089408873,
"epoch": 0.49086924762600437,
"grad_norm": 2.8507156372070312,
"learning_rate": 1.9760107763565253e-05,
"loss": 1.6900123596191405,
"mean_token_accuracy": 0.6901388188824058,
"num_tokens": 3981875.0,
"step": 420
},
{
"entropy": 2.07640870064497,
"epoch": 0.5025566106647188,
"grad_norm": 3.148797035217285,
"learning_rate": 1.974335057318141e-05,
"loss": 1.308906650543213,
"mean_token_accuracy": 0.7089092643931508,
"num_tokens": 4130771.0,
"step": 430
},
{
"entropy": 2.093033117055893,
"epoch": 0.5142439737034331,
"grad_norm": 5.219605445861816,
"learning_rate": 1.972603529756003e-05,
"loss": 1.4210287094116212,
"mean_token_accuracy": 0.6731326477602124,
"num_tokens": 4205874.0,
"step": 440
},
{
"entropy": 2.074295262992382,
"epoch": 0.5259313367421475,
"grad_norm": 1.5453256368637085,
"learning_rate": 1.9708162928495428e-05,
"loss": 1.4468173027038573,
"mean_token_accuracy": 0.6713122161105275,
"num_tokens": 4305278.0,
"step": 450
},
{
"entropy": 2.07851143181324,
"epoch": 0.537618699780862,
"grad_norm": 3.1280317306518555,
"learning_rate": 1.968973448969144e-05,
"loss": 1.5542386054992676,
"mean_token_accuracy": 0.6788748688995838,
"num_tokens": 4400820.0,
"step": 460
},
{
"entropy": 2.1338010519742965,
"epoch": 0.5493060628195763,
"grad_norm": 1.1596672534942627,
"learning_rate": 1.967075103670278e-05,
"loss": 1.180473232269287,
"mean_token_accuracy": 0.7129562532529234,
"num_tokens": 4507701.0,
"step": 470
},
{
"entropy": 2.09687916636467,
"epoch": 0.5609934258582907,
"grad_norm": 0.918991208076477,
"learning_rate": 1.965121365687458e-05,
"loss": 1.3882193565368652,
"mean_token_accuracy": 0.696927659586072,
"num_tokens": 4595440.0,
"step": 480
},
{
"entropy": 2.0941593036055566,
"epoch": 0.5726807888970051,
"grad_norm": 5.741567611694336,
"learning_rate": 1.9631123469280128e-05,
"loss": 1.4642065048217774,
"mean_token_accuracy": 0.677471567876637,
"num_tokens": 4663837.0,
"step": 490
},
{
"entropy": 2.0082775235176085,
"epoch": 0.5843681519357194,
"grad_norm": 2.512613534927368,
"learning_rate": 1.9610481624656735e-05,
"loss": 1.3735533714294434,
"mean_token_accuracy": 0.7022612497210503,
"num_tokens": 4763735.0,
"step": 500
},
{
"epoch": 0.5843681519357194,
"eval_entropy": 2.0894607109948993,
"eval_loss": 0.8765641450881958,
"eval_mean_token_accuracy": 0.7788096551084891,
"eval_num_tokens": 4763735.0,
"eval_runtime": 25.7469,
"eval_samples_per_second": 19.886,
"eval_steps_per_second": 9.943,
"step": 500
},
{
"entropy": 2.1692290902137756,
"epoch": 0.5960555149744339,
"grad_norm": 6.56488561630249,
"learning_rate": 1.9589289305339855e-05,
"loss": 1.4895523071289063,
"mean_token_accuracy": 0.6608639808371664,
"num_tokens": 4844090.0,
"step": 510
},
{
"entropy": 2.1281642124056814,
"epoch": 0.6077428780131483,
"grad_norm": 3.018589496612549,
"learning_rate": 1.9567547725195332e-05,
"loss": 1.4966270446777343,
"mean_token_accuracy": 0.6484380099922419,
"num_tokens": 4920491.0,
"step": 520
},
{
"entropy": 2.1243520259857176,
"epoch": 0.6194302410518627,
"grad_norm": 2.680955171585083,
"learning_rate": 1.9545258129549907e-05,
"loss": 1.2731698036193848,
"mean_token_accuracy": 0.7167170716449618,
"num_tokens": 5009099.0,
"step": 530
},
{
"entropy": 2.12062511742115,
"epoch": 0.631117604090577,
"grad_norm": 3.617501735687256,
"learning_rate": 1.9522421795119855e-05,
"loss": 1.3531126022338866,
"mean_token_accuracy": 0.6790495140478015,
"num_tokens": 5100209.0,
"step": 540
},
{
"entropy": 2.0695104882121087,
"epoch": 0.6428049671292915,
"grad_norm": 5.214684963226318,
"learning_rate": 1.949904002993787e-05,
"loss": 1.3848544120788575,
"mean_token_accuracy": 0.7135015401989222,
"num_tokens": 5231468.0,
"step": 550
},
{
"entropy": 2.0666969910264017,
"epoch": 0.6544923301680059,
"grad_norm": 4.319680213928223,
"learning_rate": 1.9475114173278148e-05,
"loss": 1.3690484046936036,
"mean_token_accuracy": 0.7302774161100387,
"num_tokens": 5300693.0,
"step": 560
},
{
"entropy": 2.1146800026297567,
"epoch": 0.6661796932067202,
"grad_norm": 3.780644416809082,
"learning_rate": 1.9450645595579666e-05,
"loss": 1.179710865020752,
"mean_token_accuracy": 0.7273235905915498,
"num_tokens": 5401557.0,
"step": 570
},
{
"entropy": 2.043177145719528,
"epoch": 0.6778670562454346,
"grad_norm": 6.6399455070495605,
"learning_rate": 1.942563569836769e-05,
"loss": 1.2141715049743653,
"mean_token_accuracy": 0.7330090440809727,
"num_tokens": 5496384.0,
"step": 580
},
{
"entropy": 2.010530972480774,
"epoch": 0.6895544192841491,
"grad_norm": 3.6415085792541504,
"learning_rate": 1.940008591417349e-05,
"loss": 1.2549325942993164,
"mean_token_accuracy": 0.70234549716115,
"num_tokens": 5561552.0,
"step": 590
},
{
"entropy": 1.9972407937049865,
"epoch": 0.7012417823228634,
"grad_norm": 5.336333751678467,
"learning_rate": 1.9373997706452305e-05,
"loss": 1.350644016265869,
"mean_token_accuracy": 0.6650068024173379,
"num_tokens": 5658665.0,
"step": 600
},
{
"epoch": 0.7012417823228634,
"eval_entropy": 2.0355248344130814,
"eval_loss": 0.8769533634185791,
"eval_mean_token_accuracy": 0.7799202160676941,
"eval_num_tokens": 5658665.0,
"eval_runtime": 25.7308,
"eval_samples_per_second": 19.898,
"eval_steps_per_second": 9.949,
"step": 600
},
{
"entropy": 2.0349276438355446,
"epoch": 0.7129291453615778,
"grad_norm": 1.1815351247787476,
"learning_rate": 1.93473725694995e-05,
"loss": 1.2075778007507325,
"mean_token_accuracy": 0.6925472240895033,
"num_tokens": 5788127.0,
"step": 610
},
{
"entropy": 2.1003061309456825,
"epoch": 0.7246165084002922,
"grad_norm": 3.3525731563568115,
"learning_rate": 1.9320212028364976e-05,
"loss": 1.3541041374206544,
"mean_token_accuracy": 0.6942416787147522,
"num_tokens": 5869374.0,
"step": 620
},
{
"entropy": 1.997447171807289,
"epoch": 0.7363038714390066,
"grad_norm": 4.30350399017334,
"learning_rate": 1.9292517638765837e-05,
"loss": 1.1078848838806152,
"mean_token_accuracy": 0.7255709297955036,
"num_tokens": 5986947.0,
"step": 630
},
{
"entropy": 2.0404550701379778,
"epoch": 0.747991234477721,
"grad_norm": 3.701443672180176,
"learning_rate": 1.926429098699725e-05,
"loss": 1.5392901420593261,
"mean_token_accuracy": 0.7062803871929646,
"num_tokens": 6079821.0,
"step": 640
},
{
"entropy": 2.0202228128910065,
"epoch": 0.7596785975164354,
"grad_norm": 6.253220558166504,
"learning_rate": 1.9235533689841612e-05,
"loss": 1.5730666160583495,
"mean_token_accuracy": 0.6577034238725901,
"num_tokens": 6159034.0,
"step": 650
},
{
"entropy": 2.035487785935402,
"epoch": 0.7713659605551497,
"grad_norm": 4.312775611877441,
"learning_rate": 1.9206247394475926e-05,
"loss": 1.386094570159912,
"mean_token_accuracy": 0.7041108455508948,
"num_tokens": 6245774.0,
"step": 660
},
{
"entropy": 2.051509512960911,
"epoch": 0.7830533235938641,
"grad_norm": 1.9078806638717651,
"learning_rate": 1.9176433778377463e-05,
"loss": 1.471836471557617,
"mean_token_accuracy": 0.6896713547408581,
"num_tokens": 6322635.0,
"step": 670
},
{
"entropy": 2.0822817206382753,
"epoch": 0.7947406866325786,
"grad_norm": 4.861499786376953,
"learning_rate": 1.9146094549227665e-05,
"loss": 1.4575112342834473,
"mean_token_accuracy": 0.6978994499891996,
"num_tokens": 6408559.0,
"step": 680
},
{
"entropy": 2.0686106011271477,
"epoch": 0.8064280496712929,
"grad_norm": 1.1169753074645996,
"learning_rate": 1.9115231444814356e-05,
"loss": 1.2490267753601074,
"mean_token_accuracy": 0.7142957296222449,
"num_tokens": 6498026.0,
"step": 690
},
{
"entropy": 1.9760664150118827,
"epoch": 0.8181154127100073,
"grad_norm": 1.8441827297210693,
"learning_rate": 1.9083846232932174e-05,
"loss": 1.4654719352722168,
"mean_token_accuracy": 0.7016753869131207,
"num_tokens": 6570974.0,
"step": 700
},
{
"epoch": 0.8181154127100073,
"eval_entropy": 2.0254281694069505,
"eval_loss": 0.8561184406280518,
"eval_mean_token_accuracy": 0.7865645285928622,
"eval_num_tokens": 6570974.0,
"eval_runtime": 25.7483,
"eval_samples_per_second": 19.885,
"eval_steps_per_second": 9.942,
"step": 700
},
{
"entropy": 2.0727786898612974,
"epoch": 0.8298027757487217,
"grad_norm": 1.2925829887390137,
"learning_rate": 1.9051940711281337e-05,
"loss": 1.4354880332946778,
"mean_token_accuracy": 0.6728816997259855,
"num_tokens": 6653552.0,
"step": 710
},
{
"entropy": 2.0933717772364617,
"epoch": 0.8414901387874361,
"grad_norm": 2.684811592102051,
"learning_rate": 1.9019516707364665e-05,
"loss": 1.2576842308044434,
"mean_token_accuracy": 0.7233169266954065,
"num_tokens": 6763872.0,
"step": 720
},
{
"entropy": 2.0260725244879723,
"epoch": 0.8531775018261505,
"grad_norm": 3.0955469608306885,
"learning_rate": 1.8986576078382897e-05,
"loss": 1.1219220161437988,
"mean_token_accuracy": 0.7308994717895985,
"num_tokens": 6859512.0,
"step": 730
},
{
"entropy": 2.0424532502889634,
"epoch": 0.8648648648648649,
"grad_norm": 2.130910873413086,
"learning_rate": 1.8953120711128328e-05,
"loss": 1.3845118522644042,
"mean_token_accuracy": 0.7046346709132194,
"num_tokens": 6955559.0,
"step": 740
},
{
"entropy": 2.0079129934310913,
"epoch": 0.8765522279035792,
"grad_norm": 4.160308837890625,
"learning_rate": 1.8919152521876723e-05,
"loss": 1.374086284637451,
"mean_token_accuracy": 0.7193431258201599,
"num_tokens": 7043418.0,
"step": 750
},
{
"entropy": 1.9917357206344604,
"epoch": 0.8882395909422937,
"grad_norm": 2.2451999187469482,
"learning_rate": 1.888467345627756e-05,
"loss": 1.494250202178955,
"mean_token_accuracy": 0.7015550900250673,
"num_tokens": 7132570.0,
"step": 760
},
{
"entropy": 2.0734104439616203,
"epoch": 0.8999269539810081,
"grad_norm": 3.7219045162200928,
"learning_rate": 1.8849685489242587e-05,
"loss": 1.1162896156311035,
"mean_token_accuracy": 0.7175393454730511,
"num_tokens": 7206183.0,
"step": 770
},
{
"entropy": 1.945244801044464,
"epoch": 0.9116143170197224,
"grad_norm": 2.7573325634002686,
"learning_rate": 1.88141906248327e-05,
"loss": 1.2209875106811523,
"mean_token_accuracy": 0.7243857584893704,
"num_tokens": 7299435.0,
"step": 780
},
{
"entropy": 1.964235670864582,
"epoch": 0.9233016800584368,
"grad_norm": 3.2477715015411377,
"learning_rate": 1.877819089614316e-05,
"loss": 1.509469699859619,
"mean_token_accuracy": 0.7052617512643338,
"num_tokens": 7402956.0,
"step": 790
},
{
"entropy": 1.9679414376616478,
"epoch": 0.9349890430971513,
"grad_norm": 37.075477600097656,
"learning_rate": 1.8741688365187126e-05,
"loss": 1.4231921195983888,
"mean_token_accuracy": 0.6835801653563977,
"num_tokens": 7502241.0,
"step": 800
},
{
"epoch": 0.9349890430971513,
"eval_entropy": 1.9983236375264823,
"eval_loss": 0.867080807685852,
"eval_mean_token_accuracy": 0.7754522023024037,
"eval_num_tokens": 7502241.0,
"eval_runtime": 25.7531,
"eval_samples_per_second": 19.881,
"eval_steps_per_second": 9.941,
"step": 800
},
{
"entropy": 1.985922822356224,
"epoch": 0.9466764061358656,
"grad_norm": 3.3656697273254395,
"learning_rate": 1.8704685122777564e-05,
"loss": 1.2210535049438476,
"mean_token_accuracy": 0.7048435021191836,
"num_tokens": 7623320.0,
"step": 810
},
{
"entropy": 2.0612731352448463,
"epoch": 0.95836376917458,
"grad_norm": 1.0531134605407715,
"learning_rate": 1.8667183288407468e-05,
"loss": 1.1971052169799805,
"mean_token_accuracy": 0.7166136829182506,
"num_tokens": 7720440.0,
"step": 820
},
{
"entropy": 2.0148551099002363,
"epoch": 0.9700511322132944,
"grad_norm": 4.024211883544922,
"learning_rate": 1.8629185010128478e-05,
"loss": 1.3127185821533203,
"mean_token_accuracy": 0.6342430572956801,
"num_tokens": 7816747.0,
"step": 830
},
{
"entropy": 2.0382406994700433,
"epoch": 0.9817384952520087,
"grad_norm": 5.8077616691589355,
"learning_rate": 1.8590692464427826e-05,
"loss": 1.229036808013916,
"mean_token_accuracy": 0.692909746337682,
"num_tokens": 7911749.0,
"step": 840
},
{
"entropy": 2.017058402299881,
"epoch": 0.9934258582907232,
"grad_norm": 3.8182997703552246,
"learning_rate": 1.8551707856103687e-05,
"loss": 1.408517551422119,
"mean_token_accuracy": 0.6882151458412409,
"num_tokens": 8010735.0,
"step": 850
},
{
"entropy": 2.0180568664104905,
"epoch": 1.0046749452154857,
"grad_norm": 1.599541425704956,
"learning_rate": 1.8512233418138874e-05,
"loss": 1.306098175048828,
"mean_token_accuracy": 0.6780746261794846,
"num_tokens": 8118038.0,
"step": 860
},
{
"entropy": 2.0067124992609022,
"epoch": 1.0163623082542002,
"grad_norm": 5.67886209487915,
"learning_rate": 1.8472271411572947e-05,
"loss": 1.1671574592590332,
"mean_token_accuracy": 0.713248742185533,
"num_tokens": 8200543.0,
"step": 870
},
{
"entropy": 2.0012906357645988,
"epoch": 1.0280496712929146,
"grad_norm": 3.1922106742858887,
"learning_rate": 1.84318241253727e-05,
"loss": 1.4505293846130372,
"mean_token_accuracy": 0.6957443349063397,
"num_tokens": 8319764.0,
"step": 880
},
{
"entropy": 2.088476361334324,
"epoch": 1.039737034331629,
"grad_norm": 3.2191641330718994,
"learning_rate": 1.839089387630105e-05,
"loss": 1.237698459625244,
"mean_token_accuracy": 0.7405852057039738,
"num_tokens": 8418280.0,
"step": 890
},
{
"entropy": 1.9533416509628296,
"epoch": 1.0514243973703432,
"grad_norm": 4.920682430267334,
"learning_rate": 1.8349483008784346e-05,
"loss": 1.1894009590148926,
"mean_token_accuracy": 0.7420405600219965,
"num_tokens": 8537568.0,
"step": 900
},
{
"epoch": 1.0514243973703432,
"eval_entropy": 1.9681994300335646,
"eval_loss": 0.8586333394050598,
"eval_mean_token_accuracy": 0.7810589795699343,
"eval_num_tokens": 8537568.0,
"eval_runtime": 25.8055,
"eval_samples_per_second": 19.841,
"eval_steps_per_second": 9.92,
"step": 900
},
{
"entropy": 2.0434288874268534,
"epoch": 1.0631117604090576,
"grad_norm": 1.5615532398223877,
"learning_rate": 1.830759389477807e-05,
"loss": 1.116469383239746,
"mean_token_accuracy": 0.7405070804059506,
"num_tokens": 8648085.0,
"step": 910
},
{
"entropy": 2.041461481153965,
"epoch": 1.074799123447772,
"grad_norm": 5.930424213409424,
"learning_rate": 1.8265228933630993e-05,
"loss": 1.157538604736328,
"mean_token_accuracy": 0.7226788546890021,
"num_tokens": 8725616.0,
"step": 920
},
{
"entropy": 1.9450246095657349,
"epoch": 1.0864864864864865,
"grad_norm": 4.664083003997803,
"learning_rate": 1.822239055194772e-05,
"loss": 0.8936849594116211,
"mean_token_accuracy": 0.7802880503237247,
"num_tokens": 8832986.0,
"step": 930
},
{
"entropy": 1.937520469725132,
"epoch": 1.098173849525201,
"grad_norm": 8.443425178527832,
"learning_rate": 1.8179081203449702e-05,
"loss": 1.3640972137451173,
"mean_token_accuracy": 0.6927296353504062,
"num_tokens": 8899400.0,
"step": 940
},
{
"entropy": 2.0156847476959228,
"epoch": 1.1098612125639153,
"grad_norm": 1.6205108165740967,
"learning_rate": 1.8135303368834724e-05,
"loss": 1.4349061965942382,
"mean_token_accuracy": 0.7307943589985371,
"num_tokens": 8983629.0,
"step": 950
},
{
"entropy": 2.0066610902547835,
"epoch": 1.1215485756026298,
"grad_norm": 2.5834603309631348,
"learning_rate": 1.8091059555634767e-05,
"loss": 1.1831789016723633,
"mean_token_accuracy": 0.7173672618344427,
"num_tokens": 9075646.0,
"step": 960
},
{
"entropy": 1.9574484556913376,
"epoch": 1.133235938641344,
"grad_norm": 3.529022455215454,
"learning_rate": 1.8046352298072408e-05,
"loss": 1.2099827766418456,
"mean_token_accuracy": 0.6975785996764898,
"num_tokens": 9172845.0,
"step": 970
},
{
"entropy": 1.9960552796721458,
"epoch": 1.1449233016800584,
"grad_norm": 5.0720624923706055,
"learning_rate": 1.800118415691566e-05,
"loss": 1.5012150764465333,
"mean_token_accuracy": 0.6908264242112636,
"num_tokens": 9247772.0,
"step": 980
},
{
"entropy": 2.0457948252558706,
"epoch": 1.1566106647187728,
"grad_norm": 5.155003070831299,
"learning_rate": 1.7955557719331286e-05,
"loss": 1.232002353668213,
"mean_token_accuracy": 0.7276268910616637,
"num_tokens": 9335161.0,
"step": 990
},
{
"entropy": 1.926890704035759,
"epoch": 1.1682980277574873,
"grad_norm": 1.4542499780654907,
"learning_rate": 1.790947559873662e-05,
"loss": 1.5774466514587402,
"mean_token_accuracy": 0.7076287779957056,
"num_tokens": 9439634.0,
"step": 1000
},
{
"epoch": 1.1682980277574873,
"eval_entropy": 1.9619915070943534,
"eval_loss": 0.8459069728851318,
"eval_mean_token_accuracy": 0.7854349086992443,
"eval_num_tokens": 9439634.0,
"eval_runtime": 25.7338,
"eval_samples_per_second": 19.896,
"eval_steps_per_second": 9.948,
"step": 1000
},
{
"entropy": 2.044060703366995,
"epoch": 1.1799853907962017,
"grad_norm": 6.555078506469727,
"learning_rate": 1.7862940434649862e-05,
"loss": 1.111758041381836,
"mean_token_accuracy": 0.7634515274316073,
"num_tokens": 9536599.0,
"step": 1010
},
{
"entropy": 2.0073146775364874,
"epoch": 1.1916727538349159,
"grad_norm": 5.614148139953613,
"learning_rate": 1.7815954892538906e-05,
"loss": 1.1583277702331543,
"mean_token_accuracy": 0.7569285105913878,
"num_tokens": 9624039.0,
"step": 1020
},
{
"entropy": 1.9390188187360764,
"epoch": 1.2033601168736303,
"grad_norm": 3.570732831954956,
"learning_rate": 1.776852166366866e-05,
"loss": 1.2342907905578613,
"mean_token_accuracy": 0.7328513782471419,
"num_tokens": 9731570.0,
"step": 1030
},
{
"entropy": 2.007731480896473,
"epoch": 1.2150474799123447,
"grad_norm": 4.624857425689697,
"learning_rate": 1.772064346494688e-05,
"loss": 1.1125083923339845,
"mean_token_accuracy": 0.7398822195827961,
"num_tokens": 9829159.0,
"step": 1040
},
{
"entropy": 1.95512465685606,
"epoch": 1.2267348429510592,
"grad_norm": 5.471255779266357,
"learning_rate": 1.7672323038768566e-05,
"loss": 1.1773574829101563,
"mean_token_accuracy": 0.7350184928625823,
"num_tokens": 9925525.0,
"step": 1050
},
{
"entropy": 1.9593760170042516,
"epoch": 1.2384222059897736,
"grad_norm": 3.174351930618286,
"learning_rate": 1.7623563152858883e-05,
"loss": 1.1755749702453613,
"mean_token_accuracy": 0.7368000335991383,
"num_tokens": 10010547.0,
"step": 1060
},
{
"entropy": 2.0089882522821427,
"epoch": 1.250109569028488,
"grad_norm": 3.5962374210357666,
"learning_rate": 1.7574366600114613e-05,
"loss": 1.5100272178649903,
"mean_token_accuracy": 0.7163063116371632,
"num_tokens": 10101289.0,
"step": 1070
},
{
"entropy": 2.0140527084469797,
"epoch": 1.2617969320672024,
"grad_norm": 4.1162309646606445,
"learning_rate": 1.7524736198444197e-05,
"loss": 1.170853614807129,
"mean_token_accuracy": 0.7263667859137058,
"num_tokens": 10233321.0,
"step": 1080
},
{
"entropy": 1.9484913617372512,
"epoch": 1.2734842951059167,
"grad_norm": 6.536661624908447,
"learning_rate": 1.747467479060633e-05,
"loss": 1.1337247848510743,
"mean_token_accuracy": 0.7735978152602911,
"num_tokens": 10303009.0,
"step": 1090
},
{
"entropy": 2.0198730982840063,
"epoch": 1.285171658144631,
"grad_norm": 3.4061622619628906,
"learning_rate": 1.7424185244047116e-05,
"loss": 1.0629566192626954,
"mean_token_accuracy": 0.7369117736816406,
"num_tokens": 10438680.0,
"step": 1100
},
{
"epoch": 1.285171658144631,
"eval_entropy": 1.9863552912138402,
"eval_loss": 0.8380774855613708,
"eval_mean_token_accuracy": 0.7885139010613784,
"eval_num_tokens": 10438680.0,
"eval_runtime": 25.7827,
"eval_samples_per_second": 19.858,
"eval_steps_per_second": 9.929,
"step": 1100
},
{
"entropy": 1.9853825107216836,
"epoch": 1.2968590211833455,
"grad_norm": 1.8975157737731934,
"learning_rate": 1.737327045073584e-05,
"loss": 1.2073594093322755,
"mean_token_accuracy": 0.7203539207577705,
"num_tokens": 10535626.0,
"step": 1110
},
{
"entropy": 1.9051698848605156,
"epoch": 1.30854638422206,
"grad_norm": 4.080144882202148,
"learning_rate": 1.7321933326999313e-05,
"loss": 1.0707772254943848,
"mean_token_accuracy": 0.7556315153837204,
"num_tokens": 10653815.0,
"step": 1120
},
{
"entropy": 2.0398276120424272,
"epoch": 1.3202337472607744,
"grad_norm": 4.169946670532227,
"learning_rate": 1.7270176813354836e-05,
"loss": 1.1661772727966309,
"mean_token_accuracy": 0.7467184342443943,
"num_tokens": 10716426.0,
"step": 1130
},
{
"entropy": 1.9850704297423363,
"epoch": 1.3319211102994886,
"grad_norm": 4.181504726409912,
"learning_rate": 1.7218003874341762e-05,
"loss": 0.9917153358459473,
"mean_token_accuracy": 0.7495910193771124,
"num_tokens": 10814456.0,
"step": 1140
},
{
"entropy": 1.9728952266275883,
"epoch": 1.343608473338203,
"grad_norm": 1.9582622051239014,
"learning_rate": 1.7165417498351695e-05,
"loss": 1.1698190689086914,
"mean_token_accuracy": 0.7205928053706885,
"num_tokens": 10930887.0,
"step": 1150
},
{
"entropy": 1.9699254363775254,
"epoch": 1.3552958363769174,
"grad_norm": 2.080578327178955,
"learning_rate": 1.711242069745732e-05,
"loss": 1.0921939849853515,
"mean_token_accuracy": 0.7728059090673923,
"num_tokens": 11008746.0,
"step": 1160
},
{
"entropy": 1.9688927009701729,
"epoch": 1.3669831994156318,
"grad_norm": 9.23663330078125,
"learning_rate": 1.705901650723988e-05,
"loss": 1.3214816093444823,
"mean_token_accuracy": 0.7266499204561114,
"num_tokens": 11081881.0,
"step": 1170
},
{
"entropy": 1.9373602516949178,
"epoch": 1.3786705624543463,
"grad_norm": 3.493316173553467,
"learning_rate": 1.7005207986615293e-05,
"loss": 1.2887114524841308,
"mean_token_accuracy": 0.7301527475938201,
"num_tokens": 11170839.0,
"step": 1180
},
{
"entropy": 1.937132966518402,
"epoch": 1.3903579254930607,
"grad_norm": 3.835472583770752,
"learning_rate": 1.6950998217658948e-05,
"loss": 1.1458003997802735,
"mean_token_accuracy": 0.7413250353187323,
"num_tokens": 11265564.0,
"step": 1190
},
{
"entropy": 1.9563957542181014,
"epoch": 1.4020452885317751,
"grad_norm": 2.9280080795288086,
"learning_rate": 1.6896390305429173e-05,
"loss": 1.0155451774597168,
"mean_token_accuracy": 0.7335030514746904,
"num_tokens": 11345666.0,
"step": 1200
},
{
"epoch": 1.4020452885317751,
"eval_entropy": 1.9168102419935167,
"eval_loss": 0.8464275598526001,
"eval_mean_token_accuracy": 0.7816579656209797,
"eval_num_tokens": 11345666.0,
"eval_runtime": 25.7925,
"eval_samples_per_second": 19.851,
"eval_steps_per_second": 9.925,
"step": 1200
},
{
"entropy": 1.9489586815237998,
"epoch": 1.4137326515704893,
"grad_norm": 4.470329284667969,
"learning_rate": 1.6841387377789365e-05,
"loss": 1.0874253273010255,
"mean_token_accuracy": 0.7266624689102172,
"num_tokens": 11441947.0,
"step": 1210
},
{
"entropy": 1.9251106187701226,
"epoch": 1.4254200146092038,
"grad_norm": 8.1526460647583,
"learning_rate": 1.6785992585228842e-05,
"loss": 1.1446887969970703,
"mean_token_accuracy": 0.7407740101218223,
"num_tokens": 11512448.0,
"step": 1220
},
{
"entropy": 1.8829301849007607,
"epoch": 1.4371073776479182,
"grad_norm": 3.5247323513031006,
"learning_rate": 1.6730209100682398e-05,
"loss": 1.1706348419189454,
"mean_token_accuracy": 0.7307471681386233,
"num_tokens": 11599060.0,
"step": 1230
},
{
"entropy": 1.8378908082842826,
"epoch": 1.4487947406866326,
"grad_norm": 5.84583854675293,
"learning_rate": 1.6674040119348534e-05,
"loss": 1.3138227462768555,
"mean_token_accuracy": 0.7309050619602203,
"num_tokens": 11696606.0,
"step": 1240
},
{
"entropy": 1.9146908812224865,
"epoch": 1.460482103725347,
"grad_norm": 3.2844982147216797,
"learning_rate": 1.6617488858506478e-05,
"loss": 1.1646804809570312,
"mean_token_accuracy": 0.7578974604606629,
"num_tokens": 11794942.0,
"step": 1250
},
{
"entropy": 1.9918838322162629,
"epoch": 1.4721694667640612,
"grad_norm": 4.6135406494140625,
"learning_rate": 1.6560558557331857e-05,
"loss": 1.2325959205627441,
"mean_token_accuracy": 0.7542553246021271,
"num_tokens": 11879297.0,
"step": 1260
},
{
"entropy": 1.9307655103504657,
"epoch": 1.4838568298027757,
"grad_norm": 3.894841194152832,
"learning_rate": 1.6503252476711207e-05,
"loss": 1.2438136100769044,
"mean_token_accuracy": 0.7178509555757046,
"num_tokens": 11956740.0,
"step": 1270
},
{
"entropy": 1.908846166729927,
"epoch": 1.49554419284149,
"grad_norm": 5.166774749755859,
"learning_rate": 1.6445573899055173e-05,
"loss": 1.2256482124328614,
"mean_token_accuracy": 0.6992226783186197,
"num_tokens": 12046253.0,
"step": 1280
},
{
"entropy": 1.8920038990676402,
"epoch": 1.5072315558802045,
"grad_norm": 6.3578901290893555,
"learning_rate": 1.6387526128110497e-05,
"loss": 1.1908625602722167,
"mean_token_accuracy": 0.7180704873055219,
"num_tokens": 12138688.0,
"step": 1290
},
{
"entropy": 1.8648209869861603,
"epoch": 1.518918918918919,
"grad_norm": 4.01393461227417,
"learning_rate": 1.6329112488770783e-05,
"loss": 0.9572369575500488,
"mean_token_accuracy": 0.7382893675938249,
"num_tokens": 12236933.0,
"step": 1300
},
{
"epoch": 1.518918918918919,
"eval_entropy": 1.838359854184091,
"eval_loss": 0.8447912931442261,
"eval_mean_token_accuracy": 0.7861243971856311,
"eval_num_tokens": 12236933.0,
"eval_runtime": 25.7812,
"eval_samples_per_second": 19.859,
"eval_steps_per_second": 9.93,
"step": 1300
},
{
"entropy": 1.8808407828211784,
"epoch": 1.5306062819576334,
"grad_norm": 5.479897975921631,
"learning_rate": 1.627033632688606e-05,
"loss": 1.1945793151855468,
"mean_token_accuracy": 0.7323504503816366,
"num_tokens": 12323027.0,
"step": 1310
},
{
"entropy": 1.8892016053199767,
"epoch": 1.5422936449963478,
"grad_norm": 4.85045862197876,
"learning_rate": 1.6211201009071134e-05,
"loss": 1.0658716201782226,
"mean_token_accuracy": 0.73037389498204,
"num_tokens": 12412760.0,
"step": 1320
},
{
"entropy": 1.9150678791105746,
"epoch": 1.5539810080350622,
"grad_norm": 3.739926338195801,
"learning_rate": 1.615170992251275e-05,
"loss": 1.2553756713867188,
"mean_token_accuracy": 0.7565023884177208,
"num_tokens": 12499002.0,
"step": 1330
},
{
"entropy": 1.827857257425785,
"epoch": 1.5656683710737764,
"grad_norm": 1.824333667755127,
"learning_rate": 1.6091866474775565e-05,
"loss": 1.216816520690918,
"mean_token_accuracy": 0.7362237356603145,
"num_tokens": 12620786.0,
"step": 1340
},
{
"entropy": 1.9286083355545998,
"epoch": 1.5773557341124909,
"grad_norm": 4.209549903869629,
"learning_rate": 1.6031674093607003e-05,
"loss": 1.5620033264160156,
"mean_token_accuracy": 0.7155494146049023,
"num_tokens": 12694076.0,
"step": 1350
},
{
"entropy": 1.9999349035322667,
"epoch": 1.5890430971512053,
"grad_norm": 3.89644193649292,
"learning_rate": 1.597113622674089e-05,
"loss": 1.466843032836914,
"mean_token_accuracy": 0.7301654836162925,
"num_tokens": 12797729.0,
"step": 1360
},
{
"entropy": 1.928144982457161,
"epoch": 1.6007304601899195,
"grad_norm": 2.602468967437744,
"learning_rate": 1.5910256341699978e-05,
"loss": 0.9804810523986817,
"mean_token_accuracy": 0.7682306554168463,
"num_tokens": 12877532.0,
"step": 1370
},
{
"entropy": 1.9351914629340172,
"epoch": 1.612417823228634,
"grad_norm": 4.436489105224609,
"learning_rate": 1.584903792559733e-05,
"loss": 1.1732940673828125,
"mean_token_accuracy": 0.7697132367640733,
"num_tokens": 12954415.0,
"step": 1380
},
{
"entropy": 1.8640065513551236,
"epoch": 1.6241051862673483,
"grad_norm": 6.866170883178711,
"learning_rate": 1.57874844849366e-05,
"loss": 1.1950453758239745,
"mean_token_accuracy": 0.7020724691450596,
"num_tokens": 13092979.0,
"step": 1390
},
{
"entropy": 1.8486135482788086,
"epoch": 1.6357925493060628,
"grad_norm": 4.1101393699646,
"learning_rate": 1.5725599545411157e-05,
"loss": 1.1412214279174804,
"mean_token_accuracy": 0.727515947446227,
"num_tokens": 13217902.0,
"step": 1400
},
{
"epoch": 1.6357925493060628,
"eval_entropy": 1.8418370359577239,
"eval_loss": 0.845252513885498,
"eval_mean_token_accuracy": 0.7928508168552071,
"eval_num_tokens": 13217902.0,
"eval_runtime": 25.7728,
"eval_samples_per_second": 19.866,
"eval_steps_per_second": 9.933,
"step": 1400
},
{
"entropy": 1.8421028837561608,
"epoch": 1.6474799123447772,
"grad_norm": 7.405350685119629,
"learning_rate": 1.5663386651702154e-05,
"loss": 1.2713269233703612,
"mean_token_accuracy": 0.7393627911806107,
"num_tokens": 13294277.0,
"step": 1410
},
{
"entropy": 1.9373707726597786,
"epoch": 1.6591672753834916,
"grad_norm": 7.983404159545898,
"learning_rate": 1.5600849367275497e-05,
"loss": 1.2371453285217284,
"mean_token_accuracy": 0.7312075588852167,
"num_tokens": 13384052.0,
"step": 1420
},
{
"entropy": 1.8757845029234885,
"epoch": 1.670854638422206,
"grad_norm": 3.276104688644409,
"learning_rate": 1.553799127417773e-05,
"loss": 0.8122424125671387,
"mean_token_accuracy": 0.7491487618535757,
"num_tokens": 13482557.0,
"step": 1430
},
{
"entropy": 1.8658230647444725,
"epoch": 1.6825420014609205,
"grad_norm": 3.2975077629089355,
"learning_rate": 1.5474815972830863e-05,
"loss": 1.08724946975708,
"mean_token_accuracy": 0.7675337288528681,
"num_tokens": 13588999.0,
"step": 1440
},
{
"entropy": 1.8781310148537158,
"epoch": 1.694229364499635,
"grad_norm": 4.919190883636475,
"learning_rate": 1.5411327081826127e-05,
"loss": 1.0564030647277831,
"mean_token_accuracy": 0.7417909545823932,
"num_tokens": 13672070.0,
"step": 1450
},
{
"entropy": 1.8797260642051696,
"epoch": 1.705916727538349,
"grad_norm": 5.827484607696533,
"learning_rate": 1.5347528237716742e-05,
"loss": 1.1392526626586914,
"mean_token_accuracy": 0.7560544963926077,
"num_tokens": 13768344.0,
"step": 1460
},
{
"entropy": 1.8342829935252667,
"epoch": 1.7176040905770635,
"grad_norm": 2.148158073425293,
"learning_rate": 1.5283423094809597e-05,
"loss": 1.4184009552001953,
"mean_token_accuracy": 0.6963153561577201,
"num_tokens": 13893709.0,
"step": 1470
},
{
"entropy": 1.9475776053965093,
"epoch": 1.729291453615778,
"grad_norm": 5.127400875091553,
"learning_rate": 1.5219015324955924e-05,
"loss": 1.114856243133545,
"mean_token_accuracy": 0.7408701498061419,
"num_tokens": 13993373.0,
"step": 1480
},
{
"entropy": 1.8672847002744675,
"epoch": 1.7409788166544922,
"grad_norm": 6.511949062347412,
"learning_rate": 1.5154308617341007e-05,
"loss": 1.3385598182678222,
"mean_token_accuracy": 0.7226239118725062,
"num_tokens": 14101381.0,
"step": 1490
},
{
"entropy": 1.8440473534166812,
"epoch": 1.7526661796932066,
"grad_norm": 4.361108303070068,
"learning_rate": 1.5089306678272864e-05,
"loss": 1.3698930740356445,
"mean_token_accuracy": 0.7481454864144326,
"num_tokens": 14191846.0,
"step": 1500
},
{
"epoch": 1.7526661796932066,
"eval_entropy": 1.817938992753625,
"eval_loss": 0.8368152379989624,
"eval_mean_token_accuracy": 0.7905413492117077,
"eval_num_tokens": 14191846.0,
"eval_runtime": 25.7676,
"eval_samples_per_second": 19.87,
"eval_steps_per_second": 9.935,
"step": 1500
},
{
"entropy": 1.863508278131485,
"epoch": 1.764353542731921,
"grad_norm": 4.527868270874023,
"learning_rate": 1.5024013230969936e-05,
"loss": 1.376086139678955,
"mean_token_accuracy": 0.7072158310562372,
"num_tokens": 14263729.0,
"step": 1510
},
{
"entropy": 1.859600581228733,
"epoch": 1.7760409057706354,
"grad_norm": 4.358312606811523,
"learning_rate": 1.4958432015347852e-05,
"loss": 1.2642126083374023,
"mean_token_accuracy": 0.7176427299156785,
"num_tokens": 14339743.0,
"step": 1520
},
{
"entropy": 1.9863651104271411,
"epoch": 1.7877282688093499,
"grad_norm": 1.4887659549713135,
"learning_rate": 1.48925667878052e-05,
"loss": 1.329563045501709,
"mean_token_accuracy": 0.6955630304291844,
"num_tokens": 14424090.0,
"step": 1530
},
{
"entropy": 1.912637159973383,
"epoch": 1.7994156318480643,
"grad_norm": 6.545175552368164,
"learning_rate": 1.4826421321008355e-05,
"loss": 1.0352179527282714,
"mean_token_accuracy": 0.746459336578846,
"num_tokens": 14553405.0,
"step": 1540
},
{
"entropy": 1.8355502478778363,
"epoch": 1.8111029948867787,
"grad_norm": 6.896246433258057,
"learning_rate": 1.475999940367541e-05,
"loss": 1.0201452255249024,
"mean_token_accuracy": 0.749504017457366,
"num_tokens": 14622999.0,
"step": 1550
},
{
"entropy": 1.8898384764790535,
"epoch": 1.8227903579254932,
"grad_norm": 1.8590527772903442,
"learning_rate": 1.4693304840359139e-05,
"loss": 1.162650966644287,
"mean_token_accuracy": 0.7342435199767351,
"num_tokens": 14728271.0,
"step": 1560
},
{
"entropy": 1.9078960753977299,
"epoch": 1.8344777209642076,
"grad_norm": 1.8502728939056396,
"learning_rate": 1.4626341451229103e-05,
"loss": 1.347366714477539,
"mean_token_accuracy": 0.7131027575582266,
"num_tokens": 14823353.0,
"step": 1570
},
{
"entropy": 1.935336910188198,
"epoch": 1.8461650840029218,
"grad_norm": 5.908510208129883,
"learning_rate": 1.455911307185281e-05,
"loss": 1.2870336532592774,
"mean_token_accuracy": 0.7339887302368879,
"num_tokens": 14919875.0,
"step": 1580
},
{
"entropy": 1.9448796108365058,
"epoch": 1.8578524470416362,
"grad_norm": 2.0281429290771484,
"learning_rate": 1.4491623552976042e-05,
"loss": 1.3380470275878906,
"mean_token_accuracy": 0.7136711545288563,
"num_tokens": 15037434.0,
"step": 1590
},
{
"entropy": 1.9401104234158992,
"epoch": 1.8695398100803506,
"grad_norm": 2.0017759799957275,
"learning_rate": 1.4423876760302266e-05,
"loss": 1.1158767700195313,
"mean_token_accuracy": 0.7537970876321196,
"num_tokens": 15140025.0,
"step": 1600
},
{
"epoch": 1.8695398100803506,
"eval_entropy": 1.9083105023019016,
"eval_loss": 0.8140835165977478,
"eval_mean_token_accuracy": 0.7952790177660063,
"eval_num_tokens": 15140025.0,
"eval_runtime": 25.7537,
"eval_samples_per_second": 19.881,
"eval_steps_per_second": 9.94,
"step": 1600
},
{
"entropy": 1.9709449693560601,
"epoch": 1.881227173119065,
"grad_norm": 7.711117267608643,
"learning_rate": 1.4355876574271244e-05,
"loss": 1.158623218536377,
"mean_token_accuracy": 0.7596531298011542,
"num_tokens": 15218216.0,
"step": 1610
},
{
"entropy": 1.8394018054008483,
"epoch": 1.8929145361577793,
"grad_norm": 2.468035936355591,
"learning_rate": 1.4287626889836732e-05,
"loss": 1.1825003623962402,
"mean_token_accuracy": 0.7871152412146329,
"num_tokens": 15306237.0,
"step": 1620
},
{
"entropy": 1.9042728692293167,
"epoch": 1.9046018991964937,
"grad_norm": 4.42598295211792,
"learning_rate": 1.4219131616243407e-05,
"loss": 1.2511362075805663,
"mean_token_accuracy": 0.7355523742735386,
"num_tokens": 15379172.0,
"step": 1630
},
{
"entropy": 1.8815034471452237,
"epoch": 1.9162892622352081,
"grad_norm": 5.948218822479248,
"learning_rate": 1.4150394676802943e-05,
"loss": 1.1002138137817383,
"mean_token_accuracy": 0.7342391200363636,
"num_tokens": 15466384.0,
"step": 1640
},
{
"entropy": 1.8593804724514484,
"epoch": 1.9279766252739226,
"grad_norm": 4.394277572631836,
"learning_rate": 1.4081420008669286e-05,
"loss": 1.074215030670166,
"mean_token_accuracy": 0.7129569197073579,
"num_tokens": 15567955.0,
"step": 1650
},
{
"entropy": 1.8384671002626418,
"epoch": 1.939663988312637,
"grad_norm": 4.205284118652344,
"learning_rate": 1.4012211562613146e-05,
"loss": 1.2773515701293945,
"mean_token_accuracy": 0.7548876103013754,
"num_tokens": 15670309.0,
"step": 1660
},
{
"entropy": 1.950037308782339,
"epoch": 1.9513513513513514,
"grad_norm": 4.259429931640625,
"learning_rate": 1.3942773302795697e-05,
"loss": 1.1189401626586915,
"mean_token_accuracy": 0.7264496970921754,
"num_tokens": 15759555.0,
"step": 1670
},
{
"entropy": 1.9171560436487198,
"epoch": 1.9630387143900658,
"grad_norm": 2.5676069259643555,
"learning_rate": 1.3873109206541517e-05,
"loss": 1.2681930541992188,
"mean_token_accuracy": 0.727923545613885,
"num_tokens": 15860587.0,
"step": 1680
},
{
"entropy": 1.9435059279203415,
"epoch": 1.9747260774287803,
"grad_norm": 4.799222469329834,
"learning_rate": 1.3803223264110778e-05,
"loss": 1.1749539375305176,
"mean_token_accuracy": 0.7340441212058068,
"num_tokens": 15960701.0,
"step": 1690
},
{
"entropy": 1.8940155997872352,
"epoch": 1.9864134404674947,
"grad_norm": 8.058248519897461,
"learning_rate": 1.3733119478470685e-05,
"loss": 1.1425342559814453,
"mean_token_accuracy": 0.7671079862862825,
"num_tokens": 16032922.0,
"step": 1700
},
{
"epoch": 1.9864134404674947,
"eval_entropy": 1.8137257536873221,
"eval_loss": 0.8239699602127075,
"eval_mean_token_accuracy": 0.7964722405886278,
"eval_num_tokens": 16032922.0,
"eval_runtime": 25.7276,
"eval_samples_per_second": 19.901,
"eval_steps_per_second": 9.95,
"step": 1700
},
{
"entropy": 1.8432495191693306,
"epoch": 1.998100803506209,
"grad_norm": 4.412881374359131,
"learning_rate": 1.3662801865066184e-05,
"loss": 1.1190563201904298,
"mean_token_accuracy": 0.7641295533627271,
"num_tokens": 16127646.0,
"step": 1710
},
{
"entropy": 1.8858589382914754,
"epoch": 2.0093498904309715,
"grad_norm": 3.5278728008270264,
"learning_rate": 1.3592274451589975e-05,
"loss": 1.116040325164795,
"mean_token_accuracy": 0.7860435471906291,
"num_tokens": 16200737.0,
"step": 1720
},
{
"entropy": 1.862286825478077,
"epoch": 2.021037253469686,
"grad_norm": 3.7581899166107178,
"learning_rate": 1.3521541277751808e-05,
"loss": 1.330660915374756,
"mean_token_accuracy": 0.7701560672372579,
"num_tokens": 16288394.0,
"step": 1730
},
{
"entropy": 1.7247032955288888,
"epoch": 2.0327246165084003,
"grad_norm": 8.733301162719727,
"learning_rate": 1.3450606395047094e-05,
"loss": 1.012979507446289,
"mean_token_accuracy": 0.7894353784620762,
"num_tokens": 16414668.0,
"step": 1740
},
{
"entropy": 1.7075838804244996,
"epoch": 2.0444119795471147,
"grad_norm": 5.654486656188965,
"learning_rate": 1.3379473866524841e-05,
"loss": 0.8867033004760743,
"mean_token_accuracy": 0.7954851593822241,
"num_tokens": 16507494.0,
"step": 1750
},
{
"entropy": 1.69541003331542,
"epoch": 2.056099342585829,
"grad_norm": 3.9094533920288086,
"learning_rate": 1.3308147766554921e-05,
"loss": 1.1834484100341798,
"mean_token_accuracy": 0.7346009539440275,
"num_tokens": 16603593.0,
"step": 1760
},
{
"entropy": 1.776332788169384,
"epoch": 2.0677867056245436,
"grad_norm": 3.306637763977051,
"learning_rate": 1.3236632180594713e-05,
"loss": 0.9489650726318359,
"mean_token_accuracy": 0.7801664341241121,
"num_tokens": 16687410.0,
"step": 1770
},
{
"entropy": 1.7943820096552372,
"epoch": 2.079474068663258,
"grad_norm": 7.184858322143555,
"learning_rate": 1.3164931204955073e-05,
"loss": 1.0698629379272462,
"mean_token_accuracy": 0.7857415523380041,
"num_tokens": 16773739.0,
"step": 1780
},
{
"entropy": 1.7151453040540219,
"epoch": 2.0911614317019724,
"grad_norm": 7.096766471862793,
"learning_rate": 1.3093048946565725e-05,
"loss": 1.1096179008483886,
"mean_token_accuracy": 0.7684622058644891,
"num_tokens": 16871746.0,
"step": 1790
},
{
"entropy": 1.6890972763299943,
"epoch": 2.1028487947406864,
"grad_norm": 7.44707727432251,
"learning_rate": 1.3020989522740001e-05,
"loss": 1.0414841651916504,
"mean_token_accuracy": 0.767111336812377,
"num_tokens": 16942698.0,
"step": 1800
},
{
"epoch": 2.1028487947406864,
"eval_entropy": 1.7094805547967553,
"eval_loss": 0.8579376935958862,
"eval_mean_token_accuracy": 0.7887821523472667,
"eval_num_tokens": 16942698.0,
"eval_runtime": 25.7606,
"eval_samples_per_second": 19.875,
"eval_steps_per_second": 9.938,
"step": 1800
},
{
"entropy": 1.7290698282420636,
"epoch": 2.114536157779401,
"grad_norm": 8.56005573272705,
"learning_rate": 1.2948757060939019e-05,
"loss": 0.8826337814331054,
"mean_token_accuracy": 0.7914221476763487,
"num_tokens": 17027656.0,
"step": 1810
},
{
"entropy": 1.8097689680755138,
"epoch": 2.1262235208181153,
"grad_norm": 4.438044548034668,
"learning_rate": 1.2876355698535267e-05,
"loss": 0.9441690444946289,
"mean_token_accuracy": 0.7696551516652107,
"num_tokens": 17153253.0,
"step": 1820
},
{
"entropy": 1.7344063587486744,
"epoch": 2.1379108838568297,
"grad_norm": 7.4073662757873535,
"learning_rate": 1.2803789582575625e-05,
"loss": 0.8094770431518554,
"mean_token_accuracy": 0.8328897904604673,
"num_tokens": 17238499.0,
"step": 1830
},
{
"entropy": 1.8003332495689393,
"epoch": 2.149598246895544,
"grad_norm": 2.58811354637146,
"learning_rate": 1.2731062869543809e-05,
"loss": 0.9070839881896973,
"mean_token_accuracy": 0.7932946987450122,
"num_tokens": 17315238.0,
"step": 1840
},
{
"entropy": 1.6319862693548202,
"epoch": 2.1612856099342586,
"grad_norm": 9.18846607208252,
"learning_rate": 1.2658179725122315e-05,
"loss": 0.8181050300598145,
"mean_token_accuracy": 0.7743474829941988,
"num_tokens": 17396825.0,
"step": 1850
},
{
"entropy": 1.6712466433644295,
"epoch": 2.172972972972973,
"grad_norm": 5.17325496673584,
"learning_rate": 1.2585144323953806e-05,
"loss": 1.1065648078918457,
"mean_token_accuracy": 0.794865146651864,
"num_tokens": 17477721.0,
"step": 1860
},
{
"entropy": 1.705952302366495,
"epoch": 2.1846603360116874,
"grad_norm": 3.063406467437744,
"learning_rate": 1.2511960849401992e-05,
"loss": 0.8904474258422852,
"mean_token_accuracy": 0.8052191570401191,
"num_tokens": 17574912.0,
"step": 1870
},
{
"entropy": 1.7243479125201702,
"epoch": 2.196347699050402,
"grad_norm": 4.745734691619873,
"learning_rate": 1.2438633493312016e-05,
"loss": 1.018042755126953,
"mean_token_accuracy": 0.7697376435622573,
"num_tokens": 17675398.0,
"step": 1880
},
{
"entropy": 1.7214707762002945,
"epoch": 2.2080350620891163,
"grad_norm": 7.520652770996094,
"learning_rate": 1.2365166455770348e-05,
"loss": 0.9177331924438477,
"mean_token_accuracy": 0.8383358910679817,
"num_tokens": 17774695.0,
"step": 1890
},
{
"entropy": 1.7210143111646174,
"epoch": 2.2197224251278307,
"grad_norm": 2.2790050506591797,
"learning_rate": 1.2291563944864217e-05,
"loss": 0.8777865409851074,
"mean_token_accuracy": 0.7956211164593696,
"num_tokens": 17846709.0,
"step": 1900
},
{
"epoch": 2.2197224251278307,
"eval_entropy": 1.6415179804898798,
"eval_loss": 0.8887978196144104,
"eval_mean_token_accuracy": 0.7851445563137531,
"eval_num_tokens": 17846709.0,
"eval_runtime": 25.7621,
"eval_samples_per_second": 19.874,
"eval_steps_per_second": 9.937,
"step": 1900
},
{
"entropy": 1.766159813851118,
"epoch": 2.231409788166545,
"grad_norm": 8.775179862976074,
"learning_rate": 1.2217830176440575e-05,
"loss": 1.0922087669372558,
"mean_token_accuracy": 0.8075018189847469,
"num_tokens": 17942084.0,
"step": 1910
},
{
"entropy": 1.726970161497593,
"epoch": 2.2430971512052595,
"grad_norm": 8.528240203857422,
"learning_rate": 1.2143969373864613e-05,
"loss": 1.0563692092895507,
"mean_token_accuracy": 0.8228851705789566,
"num_tokens": 18034282.0,
"step": 1920
},
{
"entropy": 1.7479791216552258,
"epoch": 2.2547845142439735,
"grad_norm": 2.704474925994873,
"learning_rate": 1.2069985767777853e-05,
"loss": 1.0553196907043456,
"mean_token_accuracy": 0.815582574903965,
"num_tokens": 18155409.0,
"step": 1930
},
{
"entropy": 1.6536244474351407,
"epoch": 2.266471877282688,
"grad_norm": 10.785659790039062,
"learning_rate": 1.199588359585584e-05,
"loss": 0.9583339691162109,
"mean_token_accuracy": 0.7827083263546228,
"num_tokens": 18237737.0,
"step": 1940
},
{
"entropy": 1.7370208583772182,
"epoch": 2.2781592403214024,
"grad_norm": 6.897886276245117,
"learning_rate": 1.1921667102565384e-05,
"loss": 0.9463368415832519,
"mean_token_accuracy": 0.7997389893978835,
"num_tokens": 18327930.0,
"step": 1950
},
{
"entropy": 1.720282246917486,
"epoch": 2.289846603360117,
"grad_norm": 3.996598958969116,
"learning_rate": 1.184734053892148e-05,
"loss": 1.1193174362182616,
"mean_token_accuracy": 0.7657456273213029,
"num_tokens": 18423648.0,
"step": 1960
},
{
"entropy": 1.835063375532627,
"epoch": 2.3015339663988312,
"grad_norm": 5.055246829986572,
"learning_rate": 1.1772908162243781e-05,
"loss": 1.2491262435913086,
"mean_token_accuracy": 0.76466054469347,
"num_tokens": 18512229.0,
"step": 1970
},
{
"entropy": 1.7106602311134338,
"epoch": 2.3132213294375457,
"grad_norm": 5.09481954574585,
"learning_rate": 1.1698374235912764e-05,
"loss": 0.8167672157287598,
"mean_token_accuracy": 0.815067458152771,
"num_tokens": 18607065.0,
"step": 1980
},
{
"entropy": 1.7944564908742904,
"epoch": 2.32490869247626,
"grad_norm": 6.0724077224731445,
"learning_rate": 1.1623743029125526e-05,
"loss": 0.8526260375976562,
"mean_token_accuracy": 0.774313784390688,
"num_tokens": 18704091.0,
"step": 1990
},
{
"entropy": 1.6470934957265855,
"epoch": 2.3365960555149745,
"grad_norm": 10.5629301071167,
"learning_rate": 1.154901881665125e-05,
"loss": 0.9478482246398926,
"mean_token_accuracy": 0.7888395514339208,
"num_tokens": 18809808.0,
"step": 2000
},
{
"epoch": 2.3365960555149745,
"eval_entropy": 1.664865046273917,
"eval_loss": 0.8846761584281921,
"eval_mean_token_accuracy": 0.7874117845203727,
"eval_num_tokens": 18809808.0,
"eval_runtime": 25.7239,
"eval_samples_per_second": 19.904,
"eval_steps_per_second": 9.952,
"step": 2000
},
{
"entropy": 1.688171324878931,
"epoch": 2.348283418553689,
"grad_norm": 9.02729606628418,
"learning_rate": 1.1474205878586352e-05,
"loss": 1.2155604362487793,
"mean_token_accuracy": 0.7553981574252248,
"num_tokens": 18897217.0,
"step": 2010
},
{
"entropy": 1.7721660077571868,
"epoch": 2.3599707815924034,
"grad_norm": 5.854802131652832,
"learning_rate": 1.1399308500109326e-05,
"loss": 0.8131728172302246,
"mean_token_accuracy": 0.8193537637591362,
"num_tokens": 18975705.0,
"step": 2020
},
{
"entropy": 1.7412988483905791,
"epoch": 2.371658144631118,
"grad_norm": 3.150503158569336,
"learning_rate": 1.1324330971235284e-05,
"loss": 1.047701072692871,
"mean_token_accuracy": 0.800437244027853,
"num_tokens": 19074509.0,
"step": 2030
},
{
"entropy": 1.7724151745438577,
"epoch": 2.3833455076698318,
"grad_norm": 4.939846038818359,
"learning_rate": 1.1249277586570253e-05,
"loss": 0.8570194244384766,
"mean_token_accuracy": 0.8104645885527134,
"num_tokens": 19213193.0,
"step": 2040
},
{
"entropy": 1.7081391178071499,
"epoch": 2.395032870708546,
"grad_norm": 13.442591667175293,
"learning_rate": 1.1174152645065155e-05,
"loss": 0.9962297439575195,
"mean_token_accuracy": 0.7721560131758451,
"num_tokens": 19318056.0,
"step": 2050
},
{
"entropy": 1.6723031967878341,
"epoch": 2.4067202337472606,
"grad_norm": 9.592318534851074,
"learning_rate": 1.1098960449769596e-05,
"loss": 1.1704561233520507,
"mean_token_accuracy": 0.7990097958594561,
"num_tokens": 19434190.0,
"step": 2060
},
{
"entropy": 1.6864351846277714,
"epoch": 2.418407596785975,
"grad_norm": 8.074052810668945,
"learning_rate": 1.1023705307585381e-05,
"loss": 0.9592673301696777,
"mean_token_accuracy": 0.7668116193264722,
"num_tokens": 19529901.0,
"step": 2070
},
{
"entropy": 1.7490323051810264,
"epoch": 2.4300949598246895,
"grad_norm": 2.452920436859131,
"learning_rate": 1.0948391529019828e-05,
"loss": 1.0507227897644043,
"mean_token_accuracy": 0.8073636274784803,
"num_tokens": 19623791.0,
"step": 2080
},
{
"entropy": 1.7456448063254357,
"epoch": 2.441782322863404,
"grad_norm": 7.240609645843506,
"learning_rate": 1.0873023427938855e-05,
"loss": 1.1253956794738769,
"mean_token_accuracy": 0.7867503479123116,
"num_tokens": 19713956.0,
"step": 2090
},
{
"entropy": 1.6924543783068657,
"epoch": 2.4534696859021183,
"grad_norm": 4.209897041320801,
"learning_rate": 1.0797605321319899e-05,
"loss": 0.868558406829834,
"mean_token_accuracy": 0.7648149125277997,
"num_tokens": 19808455.0,
"step": 2100
},
{
"epoch": 2.4534696859021183,
"eval_entropy": 1.663283203728497,
"eval_loss": 0.8835537433624268,
"eval_mean_token_accuracy": 0.7884463180089369,
"eval_num_tokens": 19808455.0,
"eval_runtime": 25.7995,
"eval_samples_per_second": 19.845,
"eval_steps_per_second": 9.923,
"step": 2100
},
{
"entropy": 1.7139657579362393,
"epoch": 2.4651570489408328,
"grad_norm": 10.666122436523438,
"learning_rate": 1.0722141529004646e-05,
"loss": 0.9679533958435058,
"mean_token_accuracy": 0.7547157764434814,
"num_tokens": 19905431.0,
"step": 2110
},
{
"entropy": 1.718270693719387,
"epoch": 2.476844411979547,
"grad_norm": 7.6248908042907715,
"learning_rate": 1.0646636373451593e-05,
"loss": 1.0984148025512694,
"mean_token_accuracy": 0.7684399399906396,
"num_tokens": 19986159.0,
"step": 2120
},
{
"entropy": 1.7120233535766602,
"epoch": 2.4885317750182616,
"grad_norm": 2.2815515995025635,
"learning_rate": 1.0571094179488456e-05,
"loss": 0.988497257232666,
"mean_token_accuracy": 0.8124069195240736,
"num_tokens": 20060814.0,
"step": 2130
},
{
"entropy": 1.7328252077102662,
"epoch": 2.500219138056976,
"grad_norm": 4.041893482208252,
"learning_rate": 1.0495519274064471e-05,
"loss": 1.126350212097168,
"mean_token_accuracy": 0.7363353008404374,
"num_tokens": 20150562.0,
"step": 2140
},
{
"entropy": 1.6000701755285263,
"epoch": 2.51190650109569,
"grad_norm": 7.912816524505615,
"learning_rate": 1.0419915986002534e-05,
"loss": 1.274219799041748,
"mean_token_accuracy": 0.7821881119161844,
"num_tokens": 20263300.0,
"step": 2150
},
{
"entropy": 1.7800101920962335,
"epoch": 2.523593864134405,
"grad_norm": 4.959470272064209,
"learning_rate": 1.0344288645751257e-05,
"loss": 0.9354647636413574,
"mean_token_accuracy": 0.7791614972054959,
"num_tokens": 20340797.0,
"step": 2160
},
{
"entropy": 1.7066360771656037,
"epoch": 2.535281227173119,
"grad_norm": 3.610182523727417,
"learning_rate": 1.0268641585136927e-05,
"loss": 0.728416919708252,
"mean_token_accuracy": 0.8194401554763318,
"num_tokens": 20434070.0,
"step": 2170
},
{
"entropy": 1.780417773872614,
"epoch": 2.5469685902118333,
"grad_norm": 6.358795166015625,
"learning_rate": 1.019297913711539e-05,
"loss": 1.0019350051879883,
"mean_token_accuracy": 0.7575782489031553,
"num_tokens": 20518809.0,
"step": 2180
},
{
"entropy": 1.7431005448102952,
"epoch": 2.5586559532505477,
"grad_norm": 10.635919570922852,
"learning_rate": 1.0117305635523849e-05,
"loss": 1.125741958618164,
"mean_token_accuracy": 0.7842472262680531,
"num_tokens": 20640413.0,
"step": 2190
},
{
"entropy": 1.7685076668858528,
"epoch": 2.570343316289262,
"grad_norm": 10.567401885986328,
"learning_rate": 1.0041625414832659e-05,
"loss": 1.029182529449463,
"mean_token_accuracy": 0.7735146172344685,
"num_tokens": 20719301.0,
"step": 2200
},
{
"epoch": 2.570343316289262,
"eval_entropy": 1.6802399228326976,
"eval_loss": 0.8806448578834534,
"eval_mean_token_accuracy": 0.7880933153210208,
"eval_num_tokens": 20719301.0,
"eval_runtime": 25.7639,
"eval_samples_per_second": 19.873,
"eval_steps_per_second": 9.936,
"step": 2200
},
{
"entropy": 1.7429690331220626,
"epoch": 2.5820306793279766,
"grad_norm": 4.979848861694336,
"learning_rate": 9.965942809897021e-06,
"loss": 1.078941535949707,
"mean_token_accuracy": 0.8028537411242723,
"num_tokens": 20814629.0,
"step": 2210
},
{
"entropy": 1.7465707987546921,
"epoch": 2.593718042366691,
"grad_norm": 2.9227752685546875,
"learning_rate": 9.890262155708696e-06,
"loss": 1.261153221130371,
"mean_token_accuracy": 0.7378072213381529,
"num_tokens": 20937052.0,
"step": 2220
},
{
"entropy": 1.7786902643740177,
"epoch": 2.6054054054054054,
"grad_norm": 7.268579959869385,
"learning_rate": 9.814587787147735e-06,
"loss": 0.8818110466003418,
"mean_token_accuracy": 0.7982126645743847,
"num_tokens": 21017553.0,
"step": 2230
},
{
"entropy": 1.7861275777220726,
"epoch": 2.61709276844412,
"grad_norm": 10.696455955505371,
"learning_rate": 9.738924038734129e-06,
"loss": 1.100949192047119,
"mean_token_accuracy": 0.7710029076784849,
"num_tokens": 21095809.0,
"step": 2240
},
{
"entropy": 1.7052608147263526,
"epoch": 2.6287801314828343,
"grad_norm": 10.710509300231934,
"learning_rate": 9.663275244379576e-06,
"loss": 0.953674030303955,
"mean_token_accuracy": 0.7945627331733703,
"num_tokens": 21189013.0,
"step": 2250
},
{
"entropy": 1.7925067514181137,
"epoch": 2.6404674945215487,
"grad_norm": 5.928650379180908,
"learning_rate": 9.587645737139229e-06,
"loss": 0.9999592781066895,
"mean_token_accuracy": 0.7624824114143849,
"num_tokens": 21268694.0,
"step": 2260
},
{
"entropy": 1.6451317243278027,
"epoch": 2.652154857560263,
"grad_norm": 7.02318000793457,
"learning_rate": 9.512039848963494e-06,
"loss": 0.8141751289367676,
"mean_token_accuracy": 0.8069352146238089,
"num_tokens": 21369367.0,
"step": 2270
},
{
"entropy": 1.6899416998028756,
"epoch": 2.663842220598977,
"grad_norm": 3.720379114151001,
"learning_rate": 9.436461910449915e-06,
"loss": 0.775752067565918,
"mean_token_accuracy": 0.7989593021571636,
"num_tokens": 21465668.0,
"step": 2280
},
{
"entropy": 1.6926493354141712,
"epoch": 2.675529583637692,
"grad_norm": 5.736570835113525,
"learning_rate": 9.360916250595124e-06,
"loss": 1.0607316970825196,
"mean_token_accuracy": 0.739141751639545,
"num_tokens": 21541115.0,
"step": 2290
},
{
"entropy": 1.713230238854885,
"epoch": 2.687216946676406,
"grad_norm": 5.054290294647217,
"learning_rate": 9.285407196546862e-06,
"loss": 0.9530890464782715,
"mean_token_accuracy": 0.7673216979950667,
"num_tokens": 21650967.0,
"step": 2300
},
{
"epoch": 2.687216946676406,
"eval_entropy": 1.70094374101609,
"eval_loss": 0.8739476799964905,
"eval_mean_token_accuracy": 0.7821284044766799,
"eval_num_tokens": 21650967.0,
"eval_runtime": 25.7817,
"eval_samples_per_second": 19.859,
"eval_steps_per_second": 9.93,
"step": 2300
},
{
"entropy": 1.719686582684517,
"epoch": 2.6989043097151204,
"grad_norm": 3.380436897277832,
"learning_rate": 9.209939073356165e-06,
"loss": 0.8329605102539063,
"mean_token_accuracy": 0.7897226478904485,
"num_tokens": 21762612.0,
"step": 2310
},
{
"entropy": 1.699085582792759,
"epoch": 2.710591672753835,
"grad_norm": 6.518524646759033,
"learning_rate": 9.134516203729588e-06,
"loss": 1.0498428344726562,
"mean_token_accuracy": 0.7732686188071967,
"num_tokens": 21856022.0,
"step": 2320
},
{
"entropy": 1.7256886586546898,
"epoch": 2.7222790357925493,
"grad_norm": 7.4789910316467285,
"learning_rate": 9.059142907781631e-06,
"loss": 1.083822536468506,
"mean_token_accuracy": 0.7466625854372978,
"num_tokens": 21949955.0,
"step": 2330
},
{
"entropy": 1.6915680393576622,
"epoch": 2.7339663988312637,
"grad_norm": 12.511588096618652,
"learning_rate": 8.983823502787294e-06,
"loss": 0.9861274719238281,
"mean_token_accuracy": 0.7604979265481233,
"num_tokens": 22044621.0,
"step": 2340
},
{
"entropy": 1.6975976377725601,
"epoch": 2.745653761869978,
"grad_norm": 6.881553649902344,
"learning_rate": 8.908562302934763e-06,
"loss": 0.9918970108032227,
"mean_token_accuracy": 0.8150558684021234,
"num_tokens": 22167524.0,
"step": 2350
},
{
"entropy": 1.7521183386445045,
"epoch": 2.7573411249086925,
"grad_norm": 10.453824043273926,
"learning_rate": 8.833363619078334e-06,
"loss": 0.9284152030944824,
"mean_token_accuracy": 0.7743912402540445,
"num_tokens": 22247235.0,
"step": 2360
},
{
"entropy": 1.6890988066792487,
"epoch": 2.769028487947407,
"grad_norm": 8.435256004333496,
"learning_rate": 8.758231758491467e-06,
"loss": 0.9447514533996582,
"mean_token_accuracy": 0.7803891401737928,
"num_tokens": 22342825.0,
"step": 2370
},
{
"entropy": 1.7029536984860898,
"epoch": 2.7807158509861214,
"grad_norm": 5.541050910949707,
"learning_rate": 8.683171024620072e-06,
"loss": 0.8100149154663085,
"mean_token_accuracy": 0.775150940194726,
"num_tokens": 22438854.0,
"step": 2380
},
{
"entropy": 1.7363984808325768,
"epoch": 2.7924032140248354,
"grad_norm": 12.861689567565918,
"learning_rate": 8.608185716836044e-06,
"loss": 0.9886090278625488,
"mean_token_accuracy": 0.8351553939282894,
"num_tokens": 22547516.0,
"step": 2390
},
{
"entropy": 1.7828427016735078,
"epoch": 2.8040905770635502,
"grad_norm": 8.309239387512207,
"learning_rate": 8.533280130190958e-06,
"loss": 1.0228120803833007,
"mean_token_accuracy": 0.7845853284001351,
"num_tokens": 22633376.0,
"step": 2400
},
{
"epoch": 2.8040905770635502,
"eval_entropy": 1.6970421387813985,
"eval_loss": 0.8869515061378479,
"eval_mean_token_accuracy": 0.7793418756918982,
"eval_num_tokens": 22633376.0,
"eval_runtime": 25.7702,
"eval_samples_per_second": 19.868,
"eval_steps_per_second": 9.934,
"step": 2400
},
{
"entropy": 1.7268100760877132,
"epoch": 2.8157779401022642,
"grad_norm": 5.987215995788574,
"learning_rate": 8.458458555170085e-06,
"loss": 1.002350425720215,
"mean_token_accuracy": 0.7662376806139946,
"num_tokens": 22735672.0,
"step": 2410
},
{
"entropy": 1.7254829376935958,
"epoch": 2.8274653031409787,
"grad_norm": 6.598609447479248,
"learning_rate": 8.383725277446634e-06,
"loss": 1.0801855087280274,
"mean_token_accuracy": 0.769980538636446,
"num_tokens": 22804845.0,
"step": 2420
},
{
"entropy": 1.7012818068265916,
"epoch": 2.839152666179693,
"grad_norm": 8.625926971435547,
"learning_rate": 8.309084577636257e-06,
"loss": 1.1284662246704102,
"mean_token_accuracy": 0.7693151874467731,
"num_tokens": 22904012.0,
"step": 2430
},
{
"entropy": 1.7061614483594894,
"epoch": 2.8508400292184075,
"grad_norm": 8.639177322387695,
"learning_rate": 8.234540731051892e-06,
"loss": 1.002232265472412,
"mean_token_accuracy": 0.7625796541571617,
"num_tokens": 23003911.0,
"step": 2440
},
{
"entropy": 1.7662774667143821,
"epoch": 2.862527392257122,
"grad_norm": 6.118652820587158,
"learning_rate": 8.160098007458851e-06,
"loss": 0.9007489204406738,
"mean_token_accuracy": 0.8074061691761016,
"num_tokens": 23096511.0,
"step": 2450
},
{
"entropy": 1.7794369161128998,
"epoch": 2.8742147552958364,
"grad_norm": 10.20056438446045,
"learning_rate": 8.085760670830262e-06,
"loss": 0.8909171104431153,
"mean_token_accuracy": 0.7755695793777704,
"num_tokens": 23195819.0,
"step": 2460
},
{
"entropy": 1.7722439236938954,
"epoch": 2.885902118334551,
"grad_norm": 8.229257583618164,
"learning_rate": 8.011532979102857e-06,
"loss": 0.9046154975891113,
"mean_token_accuracy": 0.7934059891849756,
"num_tokens": 23274150.0,
"step": 2470
},
{
"entropy": 1.6098609887063504,
"epoch": 2.897589481373265,
"grad_norm": 15.409244537353516,
"learning_rate": 7.93741918393304e-06,
"loss": 0.908391284942627,
"mean_token_accuracy": 0.7439465187489986,
"num_tokens": 23380413.0,
"step": 2480
},
{
"entropy": 1.730226568132639,
"epoch": 2.9092768444119796,
"grad_norm": 12.290626525878906,
"learning_rate": 7.863423530453395e-06,
"loss": 0.9404394149780273,
"mean_token_accuracy": 0.7837304372340441,
"num_tokens": 23487027.0,
"step": 2490
},
{
"entropy": 1.6866980507969855,
"epoch": 2.920964207450694,
"grad_norm": 5.37745475769043,
"learning_rate": 7.789550257029523e-06,
"loss": 1.0467060089111329,
"mean_token_accuracy": 0.7495848417282105,
"num_tokens": 23590403.0,
"step": 2500
},
{
"epoch": 2.920964207450694,
"eval_entropy": 1.68139323964715,
"eval_loss": 0.8828441500663757,
"eval_mean_token_accuracy": 0.7800040470901877,
"eval_num_tokens": 23590403.0,
"eval_runtime": 25.7987,
"eval_samples_per_second": 19.846,
"eval_steps_per_second": 9.923,
"step": 2500
},
{
"entropy": 1.7866614565253258,
"epoch": 2.9326515704894085,
"grad_norm": 2.2976484298706055,
"learning_rate": 7.715803595017257e-06,
"loss": 1.1191862106323243,
"mean_token_accuracy": 0.782800105586648,
"num_tokens": 23680505.0,
"step": 2510
},
{
"entropy": 1.7942629598081112,
"epoch": 2.9443389335281225,
"grad_norm": 13.736532211303711,
"learning_rate": 7.642187768520319e-06,
"loss": 1.0881122589111327,
"mean_token_accuracy": 0.7522706456482411,
"num_tokens": 23766263.0,
"step": 2520
},
{
"entropy": 1.7226313956081867,
"epoch": 2.9560262965668374,
"grad_norm": 10.570932388305664,
"learning_rate": 7.5687069941483585e-06,
"loss": 1.1148384094238282,
"mean_token_accuracy": 0.7997437044978142,
"num_tokens": 23894715.0,
"step": 2530
},
{
"entropy": 1.6955727070569993,
"epoch": 2.9677136596055513,
"grad_norm": 8.713987350463867,
"learning_rate": 7.495365480775416e-06,
"loss": 1.1579767227172852,
"mean_token_accuracy": 0.7260787479579449,
"num_tokens": 23990029.0,
"step": 2540
},
{
"entropy": 1.733625952899456,
"epoch": 2.9794010226442658,
"grad_norm": 11.137775421142578,
"learning_rate": 7.422167429298891e-06,
"loss": 0.7303710460662842,
"mean_token_accuracy": 0.7830865511670708,
"num_tokens": 24052733.0,
"step": 2550
},
{
"entropy": 1.7853002369403839,
"epoch": 2.99108838568298,
"grad_norm": 8.832341194152832,
"learning_rate": 7.349117032398861e-06,
"loss": 1.0320300102233886,
"mean_token_accuracy": 0.7854295775294304,
"num_tokens": 24131387.0,
"step": 2560
},
{
"entropy": 1.680047945542769,
"epoch": 3.002337472607743,
"grad_norm": 3.1155483722686768,
"learning_rate": 7.2762184742979716e-06,
"loss": 0.981098747253418,
"mean_token_accuracy": 0.7597046676394227,
"num_tokens": 24225471.0,
"step": 2570
},
{
"entropy": 1.6457124210894107,
"epoch": 3.0140248356464574,
"grad_norm": 6.733229637145996,
"learning_rate": 7.203475930521764e-06,
"loss": 0.7696227073669434,
"mean_token_accuracy": 0.8114039119333029,
"num_tokens": 24337229.0,
"step": 2580
},
{
"entropy": 1.6516721569001676,
"epoch": 3.025712198685172,
"grad_norm": 12.687271118164062,
"learning_rate": 7.1308935676594844e-06,
"loss": 1.002864933013916,
"mean_token_accuracy": 0.8272962253540754,
"num_tokens": 24426815.0,
"step": 2590
},
{
"entropy": 1.5764148704707623,
"epoch": 3.0373995617238863,
"grad_norm": 4.2337965965271,
"learning_rate": 7.058475543125464e-06,
"loss": 0.9950182914733887,
"mean_token_accuracy": 0.8472901705652476,
"num_tokens": 24518098.0,
"step": 2600
},
{
"epoch": 3.0373995617238863,
"eval_entropy": 1.5192026905715466,
"eval_loss": 0.9768570065498352,
"eval_mean_token_accuracy": 0.7759581801947206,
"eval_num_tokens": 24518098.0,
"eval_runtime": 25.8115,
"eval_samples_per_second": 19.836,
"eval_steps_per_second": 9.918,
"step": 2600
},
{
"entropy": 1.4608647428452968,
"epoch": 3.0490869247626002,
"grad_norm": 7.60485315322876,
"learning_rate": 6.986226004920962e-06,
"loss": 0.3722125768661499,
"mean_token_accuracy": 0.8802612498402596,
"num_tokens": 24614212.0,
"step": 2610
},
{
"entropy": 1.5466793723404408,
"epoch": 3.0607742878013147,
"grad_norm": 14.492239952087402,
"learning_rate": 6.914149091396564e-06,
"loss": 0.9616324424743652,
"mean_token_accuracy": 0.8387265991419554,
"num_tokens": 24717871.0,
"step": 2620
},
{
"entropy": 1.5104636751115321,
"epoch": 3.072461650840029,
"grad_norm": 8.65507984161377,
"learning_rate": 6.84224893101519e-06,
"loss": 0.8227140426635742,
"mean_token_accuracy": 0.8016497645527124,
"num_tokens": 24813638.0,
"step": 2630
},
{
"entropy": 1.680018126219511,
"epoch": 3.0841490138787435,
"grad_norm": 18.573421478271484,
"learning_rate": 6.770529642115566e-06,
"loss": 0.8232023239135742,
"mean_token_accuracy": 0.8430277239531279,
"num_tokens": 24889113.0,
"step": 2640
},
{
"entropy": 1.6211387872695924,
"epoch": 3.095836376917458,
"grad_norm": 3.3432164192199707,
"learning_rate": 6.698995332676375e-06,
"loss": 0.6491162776947021,
"mean_token_accuracy": 0.8263424597680569,
"num_tokens": 24965540.0,
"step": 2650
},
{
"entropy": 1.57953934520483,
"epoch": 3.1075237399561724,
"grad_norm": 3.0218794345855713,
"learning_rate": 6.627650100080928e-06,
"loss": 0.6824802398681641,
"mean_token_accuracy": 0.8291381094604731,
"num_tokens": 25071267.0,
"step": 2660
},
{
"entropy": 1.4782447293400764,
"epoch": 3.119211102994887,
"grad_norm": 13.621418952941895,
"learning_rate": 6.556498030882485e-06,
"loss": 0.6709208965301514,
"mean_token_accuracy": 0.8171975061297416,
"num_tokens": 25201220.0,
"step": 2670
},
{
"entropy": 1.5655394241213798,
"epoch": 3.1308984660336012,
"grad_norm": 6.171270847320557,
"learning_rate": 6.485543200570192e-06,
"loss": 0.6699509620666504,
"mean_token_accuracy": 0.8511052500456572,
"num_tokens": 25283391.0,
"step": 2680
},
{
"entropy": 1.5742544181644917,
"epoch": 3.1425858290723157,
"grad_norm": 4.907659530639648,
"learning_rate": 6.414789673335626e-06,
"loss": 1.000911808013916,
"mean_token_accuracy": 0.8191284120082856,
"num_tokens": 25385011.0,
"step": 2690
},
{
"entropy": 1.5648961946368218,
"epoch": 3.15427319211103,
"grad_norm": 12.09859848022461,
"learning_rate": 6.344241501839999e-06,
"loss": 0.8705298423767089,
"mean_token_accuracy": 0.8365528151392937,
"num_tokens": 25474280.0,
"step": 2700
},
{
"epoch": 3.15427319211103,
"eval_entropy": 1.568035047966987,
"eval_loss": 0.9648519158363342,
"eval_mean_token_accuracy": 0.7773856642888859,
"eval_num_tokens": 25474280.0,
"eval_runtime": 25.7826,
"eval_samples_per_second": 19.858,
"eval_steps_per_second": 9.929,
"step": 2700
},
{
"entropy": 1.6122384697198868,
"epoch": 3.1659605551497445,
"grad_norm": 12.385276794433594,
"learning_rate": 6.273902726982066e-06,
"loss": 0.7094444751739502,
"mean_token_accuracy": 0.8283845584839582,
"num_tokens": 25574873.0,
"step": 2710
},
{
"entropy": 1.641030441969633,
"epoch": 3.177647918188459,
"grad_norm": 10.179749488830566,
"learning_rate": 6.2037773776666134e-06,
"loss": 0.8775361061096192,
"mean_token_accuracy": 0.8321642322465778,
"num_tokens": 25667810.0,
"step": 2720
},
{
"entropy": 1.5741927064955235,
"epoch": 3.189335281227173,
"grad_norm": 11.339288711547852,
"learning_rate": 6.133869470573735e-06,
"loss": 0.7079936981201171,
"mean_token_accuracy": 0.8223622243851423,
"num_tokens": 25750418.0,
"step": 2730
},
{
"entropy": 1.590510404109955,
"epoch": 3.2010226442658873,
"grad_norm": 12.17235279083252,
"learning_rate": 6.064183009928734e-06,
"loss": 0.5684170722961426,
"mean_token_accuracy": 0.8493764363229275,
"num_tokens": 25875234.0,
"step": 2740
},
{
"entropy": 1.6075891435146332,
"epoch": 3.2127100073046018,
"grad_norm": 6.357970714569092,
"learning_rate": 5.99472198727278e-06,
"loss": 0.7294750690460206,
"mean_token_accuracy": 0.7975887570530176,
"num_tokens": 25973055.0,
"step": 2750
},
{
"entropy": 1.5885420821607112,
"epoch": 3.224397370343316,
"grad_norm": 4.168971061706543,
"learning_rate": 5.925490381234278e-06,
"loss": 0.8555428504943847,
"mean_token_accuracy": 0.8222704697400331,
"num_tokens": 26065681.0,
"step": 2760
},
{
"entropy": 1.5862157940864563,
"epoch": 3.2360847333820306,
"grad_norm": 6.020169258117676,
"learning_rate": 5.856492157300974e-06,
"loss": 0.8058023452758789,
"mean_token_accuracy": 0.8149345409125089,
"num_tokens": 26174598.0,
"step": 2770
},
{
"entropy": 1.5975151896476745,
"epoch": 3.247772096420745,
"grad_norm": 5.6602559089660645,
"learning_rate": 5.7877312675928135e-06,
"loss": 1.0201630592346191,
"mean_token_accuracy": 0.8364724058657884,
"num_tokens": 26256744.0,
"step": 2780
},
{
"entropy": 1.503919642418623,
"epoch": 3.2594594594594595,
"grad_norm": 4.924138069152832,
"learning_rate": 5.719211650635586e-06,
"loss": 0.6068850994110108,
"mean_token_accuracy": 0.8476374715566635,
"num_tokens": 26346815.0,
"step": 2790
},
{
"entropy": 1.5372531875967979,
"epoch": 3.271146822498174,
"grad_norm": 4.390224933624268,
"learning_rate": 5.650937231135318e-06,
"loss": 0.46883220672607423,
"mean_token_accuracy": 0.8634121883660555,
"num_tokens": 26468118.0,
"step": 2800
},
{
"epoch": 3.271146822498174,
"eval_entropy": 1.5128659757319838,
"eval_loss": 0.9976800680160522,
"eval_mean_token_accuracy": 0.7753782341023907,
"eval_num_tokens": 26468118.0,
"eval_runtime": 25.7109,
"eval_samples_per_second": 19.914,
"eval_steps_per_second": 9.957,
"step": 2800
},
{
"entropy": 1.605018461495638,
"epoch": 3.2828341855368883,
"grad_norm": 7.420022487640381,
"learning_rate": 5.582911919753477e-06,
"loss": 1.0460566520690917,
"mean_token_accuracy": 0.8201792851090431,
"num_tokens": 26567024.0,
"step": 2810
},
{
"entropy": 1.508357545733452,
"epoch": 3.2945215485756028,
"grad_norm": 12.932101249694824,
"learning_rate": 5.515139612882967e-06,
"loss": 0.6858778953552246,
"mean_token_accuracy": 0.8464779894798994,
"num_tokens": 26660259.0,
"step": 2820
},
{
"entropy": 1.598171342909336,
"epoch": 3.306208911614317,
"grad_norm": 4.748000144958496,
"learning_rate": 5.447624192424952e-06,
"loss": 0.8176912307739258,
"mean_token_accuracy": 0.8116229582577944,
"num_tokens": 26730113.0,
"step": 2830
},
{
"entropy": 1.588581071048975,
"epoch": 3.317896274653031,
"grad_norm": 5.392555236816406,
"learning_rate": 5.38036952556652e-06,
"loss": 0.6881934642791748,
"mean_token_accuracy": 0.8470692213624715,
"num_tokens": 26802049.0,
"step": 2840
},
{
"entropy": 1.5943341687321664,
"epoch": 3.329583637691746,
"grad_norm": 7.3894500732421875,
"learning_rate": 5.313379464559152e-06,
"loss": 0.7837345600128174,
"mean_token_accuracy": 0.8450327418744564,
"num_tokens": 26880166.0,
"step": 2850
},
{
"entropy": 1.587635388225317,
"epoch": 3.34127100073046,
"grad_norm": 10.771740913391113,
"learning_rate": 5.24665784649809e-06,
"loss": 0.5940907955169678,
"mean_token_accuracy": 0.8424886263906955,
"num_tokens": 27008877.0,
"step": 2860
},
{
"entropy": 1.560003275424242,
"epoch": 3.3529583637691744,
"grad_norm": 12.674657821655273,
"learning_rate": 5.18020849310255e-06,
"loss": 0.6514994144439697,
"mean_token_accuracy": 0.866674953326583,
"num_tokens": 27077965.0,
"step": 2870
},
{
"entropy": 1.5951070837676524,
"epoch": 3.364645726807889,
"grad_norm": 5.081298351287842,
"learning_rate": 5.1140352104968036e-06,
"loss": 0.7107437133789063,
"mean_token_accuracy": 0.8551860637962818,
"num_tokens": 27180562.0,
"step": 2880
},
{
"entropy": 1.6164423182606698,
"epoch": 3.3763330898466033,
"grad_norm": 9.870444297790527,
"learning_rate": 5.048141788992196e-06,
"loss": 0.7967389106750489,
"mean_token_accuracy": 0.853261298686266,
"num_tokens": 27282879.0,
"step": 2890
},
{
"entropy": 1.6636493735015392,
"epoch": 3.3880204528853177,
"grad_norm": 6.572866439819336,
"learning_rate": 4.9825320028700095e-06,
"loss": 0.9500320434570313,
"mean_token_accuracy": 0.8208385236561299,
"num_tokens": 27380404.0,
"step": 2900
},
{
"epoch": 3.3880204528853177,
"eval_entropy": 1.5524416451808065,
"eval_loss": 0.9850968718528748,
"eval_mean_token_accuracy": 0.7797762223053724,
"eval_num_tokens": 27380404.0,
"eval_runtime": 25.7175,
"eval_samples_per_second": 19.909,
"eval_steps_per_second": 9.954,
"step": 2900
},
{
"entropy": 1.602518045157194,
"epoch": 3.399707815924032,
"grad_norm": 12.991669654846191,
"learning_rate": 4.917209610165313e-06,
"loss": 0.8542160987854004,
"mean_token_accuracy": 0.8111366737633944,
"num_tokens": 27466267.0,
"step": 2910
},
{
"entropy": 1.61616507768631,
"epoch": 3.4113951789627466,
"grad_norm": 16.112041473388672,
"learning_rate": 4.852178352451684e-06,
"loss": 0.7797205448150635,
"mean_token_accuracy": 0.8485843721777201,
"num_tokens": 27531040.0,
"step": 2920
},
{
"entropy": 1.6173233568668366,
"epoch": 3.423082542001461,
"grad_norm": 10.032934188842773,
"learning_rate": 4.787441954626895e-06,
"loss": 0.9266670227050782,
"mean_token_accuracy": 0.8322351593524218,
"num_tokens": 27633161.0,
"step": 2930
},
{
"entropy": 1.6111929923295976,
"epoch": 3.4347699050401754,
"grad_norm": 9.466462135314941,
"learning_rate": 4.723004124699577e-06,
"loss": 0.8797435760498047,
"mean_token_accuracy": 0.8217988926917315,
"num_tokens": 27736153.0,
"step": 2940
},
{
"entropy": 1.5657838113605975,
"epoch": 3.44645726807889,
"grad_norm": 15.69760799407959,
"learning_rate": 4.658868553576805e-06,
"loss": 0.9593112945556641,
"mean_token_accuracy": 0.8162898249924183,
"num_tokens": 27844716.0,
"step": 2950
},
{
"entropy": 1.6370114475488662,
"epoch": 3.4581446311176043,
"grad_norm": 4.239508628845215,
"learning_rate": 4.5950389148527085e-06,
"loss": 0.6190831184387207,
"mean_token_accuracy": 0.8207410082221032,
"num_tokens": 27938760.0,
"step": 2960
},
{
"entropy": 1.566064177453518,
"epoch": 3.4698319941563183,
"grad_norm": 8.937148094177246,
"learning_rate": 4.531518864598047e-06,
"loss": 0.9580602645874023,
"mean_token_accuracy": 0.8286993879824877,
"num_tokens": 28026597.0,
"step": 2970
},
{
"entropy": 1.5721587441861629,
"epoch": 3.4815193571950327,
"grad_norm": 6.707186222076416,
"learning_rate": 4.468312041150786e-06,
"loss": 0.7670645236968994,
"mean_token_accuracy": 0.8451792266219854,
"num_tokens": 28109861.0,
"step": 2980
},
{
"entropy": 1.6193489938974381,
"epoch": 3.493206720233747,
"grad_norm": 10.167534828186035,
"learning_rate": 4.405422064907705e-06,
"loss": 0.7182933807373046,
"mean_token_accuracy": 0.8424388956278562,
"num_tokens": 28174568.0,
"step": 2990
},
{
"entropy": 1.5938150033354759,
"epoch": 3.5048940832724615,
"grad_norm": 13.018750190734863,
"learning_rate": 4.342852538117039e-06,
"loss": 0.7092568874359131,
"mean_token_accuracy": 0.79365440197289,
"num_tokens": 28270921.0,
"step": 3000
},
{
"epoch": 3.5048940832724615,
"eval_entropy": 1.5361103469040245,
"eval_loss": 0.9802736639976501,
"eval_mean_token_accuracy": 0.7784652556874789,
"eval_num_tokens": 28270921.0,
"eval_runtime": 25.7697,
"eval_samples_per_second": 19.868,
"eval_steps_per_second": 9.934,
"step": 3000
},
{
"entropy": 1.5311009913682938,
"epoch": 3.516581446311176,
"grad_norm": 7.245090961456299,
"learning_rate": 4.28060704467212e-06,
"loss": 0.7434425830841065,
"mean_token_accuracy": 0.8339184015989304,
"num_tokens": 28378122.0,
"step": 3010
},
{
"entropy": 1.4980362571775914,
"epoch": 3.5282688093498904,
"grad_norm": 17.133398056030273,
"learning_rate": 4.218689149906121e-06,
"loss": 0.8883539199829101,
"mean_token_accuracy": 0.817000538855791,
"num_tokens": 28529232.0,
"step": 3020
},
{
"entropy": 1.5714292883872987,
"epoch": 3.539956172388605,
"grad_norm": 19.717315673828125,
"learning_rate": 4.157102400387833e-06,
"loss": 0.7529812812805176,
"mean_token_accuracy": 0.8267618060112,
"num_tokens": 28635466.0,
"step": 3030
},
{
"entropy": 1.5960691340267659,
"epoch": 3.5516435354273193,
"grad_norm": 6.638236045837402,
"learning_rate": 4.095850323718506e-06,
"loss": 0.9807650566101074,
"mean_token_accuracy": 0.7975058563053607,
"num_tokens": 28713584.0,
"step": 3040
},
{
"entropy": 1.6240007340908051,
"epoch": 3.5633308984660337,
"grad_norm": 15.817234992980957,
"learning_rate": 4.034936428329821e-06,
"loss": 0.7442534923553467,
"mean_token_accuracy": 0.8348729437217116,
"num_tokens": 28786109.0,
"step": 3050
},
{
"entropy": 1.619672079384327,
"epoch": 3.575018261504748,
"grad_norm": 15.655887603759766,
"learning_rate": 3.9743642032829025e-06,
"loss": 0.6672632217407226,
"mean_token_accuracy": 0.8341505564749241,
"num_tokens": 28885318.0,
"step": 3060
},
{
"entropy": 1.57230226919055,
"epoch": 3.5867056245434625,
"grad_norm": 11.126214981079102,
"learning_rate": 3.9141371180684925e-06,
"loss": 0.7392642974853516,
"mean_token_accuracy": 0.8424083676189185,
"num_tokens": 29001941.0,
"step": 3070
},
{
"entropy": 1.6307076066732407,
"epoch": 3.5983929875821765,
"grad_norm": 18.03298568725586,
"learning_rate": 3.854258622408224e-06,
"loss": 0.7791270732879638,
"mean_token_accuracy": 0.8376510888338089,
"num_tokens": 29091052.0,
"step": 3080
},
{
"entropy": 1.626028150320053,
"epoch": 3.6100803506208914,
"grad_norm": 10.079829216003418,
"learning_rate": 3.794732146056994e-06,
"loss": 0.8839334487915039,
"mean_token_accuracy": 0.8311299357563258,
"num_tokens": 29176529.0,
"step": 3090
},
{
"entropy": 1.5933189503848553,
"epoch": 3.6217677136596054,
"grad_norm": 5.836792469024658,
"learning_rate": 3.7355610986065603e-06,
"loss": 0.8301555633544921,
"mean_token_accuracy": 0.8122006464749575,
"num_tokens": 29273688.0,
"step": 3100
},
{
"epoch": 3.6217677136596054,
"eval_entropy": 1.5353019393514842,
"eval_loss": 0.9783096313476562,
"eval_mean_token_accuracy": 0.7775824166019447,
"eval_num_tokens": 29273688.0,
"eval_runtime": 25.7699,
"eval_samples_per_second": 19.868,
"eval_steps_per_second": 9.934,
"step": 3100
},
{
"entropy": 1.5506984524428844,
"epoch": 3.63345507669832,
"grad_norm": 13.009007453918457,
"learning_rate": 3.6767488692901986e-06,
"loss": 1.003788948059082,
"mean_token_accuracy": 0.8538006644695997,
"num_tokens": 29369843.0,
"step": 3110
},
{
"entropy": 1.6343820162117482,
"epoch": 3.6451424397370342,
"grad_norm": 12.708909034729004,
"learning_rate": 3.6182988267886075e-06,
"loss": 0.8828207015991211,
"mean_token_accuracy": 0.8102234560996294,
"num_tokens": 29472323.0,
"step": 3120
},
{
"entropy": 1.6717104703187942,
"epoch": 3.6568298027757487,
"grad_norm": 5.6012372970581055,
"learning_rate": 3.560214319036939e-06,
"loss": 0.9180915832519532,
"mean_token_accuracy": 0.8062344901263714,
"num_tokens": 29553235.0,
"step": 3130
},
{
"entropy": 1.6026974506676197,
"epoch": 3.668517165814463,
"grad_norm": 4.241550922393799,
"learning_rate": 3.502498673033026e-06,
"loss": 0.9951177597045898,
"mean_token_accuracy": 0.8040497414767742,
"num_tokens": 29657479.0,
"step": 3140
},
{
"entropy": 1.5968347743153573,
"epoch": 3.6802045288531775,
"grad_norm": 2.9298970699310303,
"learning_rate": 3.4451551946468388e-06,
"loss": 0.9118948936462402,
"mean_token_accuracy": 0.8074416333809495,
"num_tokens": 29761255.0,
"step": 3150
},
{
"entropy": 1.6103530064225198,
"epoch": 3.691891891891892,
"grad_norm": 9.836130142211914,
"learning_rate": 3.3881871684311072e-06,
"loss": 0.7951117992401123,
"mean_token_accuracy": 0.8442521400749683,
"num_tokens": 29834342.0,
"step": 3160
},
{
"entropy": 1.5771130241453648,
"epoch": 3.7035792549306064,
"grad_norm": 18.111557006835938,
"learning_rate": 3.3315978574331965e-06,
"loss": 0.835960865020752,
"mean_token_accuracy": 0.8475918430835009,
"num_tokens": 29913123.0,
"step": 3170
},
{
"entropy": 1.5974742673337459,
"epoch": 3.715266617969321,
"grad_norm": 4.7492356300354,
"learning_rate": 3.27539050300821e-06,
"loss": 0.5852916717529297,
"mean_token_accuracy": 0.8310256112366915,
"num_tokens": 30019110.0,
"step": 3180
},
{
"entropy": 1.572141046077013,
"epoch": 3.726953981008035,
"grad_norm": 16.682342529296875,
"learning_rate": 3.2195683246333222e-06,
"loss": 0.6440595626831055,
"mean_token_accuracy": 0.8504274129867554,
"num_tokens": 30130813.0,
"step": 3190
},
{
"entropy": 1.5826921932399274,
"epoch": 3.7386413440467496,
"grad_norm": 9.478453636169434,
"learning_rate": 3.164134519723363e-06,
"loss": 0.7726956367492676,
"mean_token_accuracy": 0.8257674686610699,
"num_tokens": 30213017.0,
"step": 3200
},
{
"epoch": 3.7386413440467496,
"eval_entropy": 1.5459002966526896,
"eval_loss": 0.986714243888855,
"eval_mean_token_accuracy": 0.7754447851912118,
"eval_num_tokens": 30213017.0,
"eval_runtime": 25.7116,
"eval_samples_per_second": 19.913,
"eval_steps_per_second": 9.957,
"step": 3200
},
{
"entropy": 1.6052772656083107,
"epoch": 3.7503287070854636,
"grad_norm": 9.236588478088379,
"learning_rate": 3.1090922634476963e-06,
"loss": 0.9195019721984863,
"mean_token_accuracy": 0.8050499334931374,
"num_tokens": 30299301.0,
"step": 3210
},
{
"entropy": 1.641640916466713,
"epoch": 3.7620160701241785,
"grad_norm": 4.644353866577148,
"learning_rate": 3.0544447085483254e-06,
"loss": 0.8934274673461914,
"mean_token_accuracy": 0.8232223711907863,
"num_tokens": 30411060.0,
"step": 3220
},
{
"entropy": 1.654336377978325,
"epoch": 3.7737034331628925,
"grad_norm": 16.278533935546875,
"learning_rate": 3.0001949851593303e-06,
"loss": 0.5742102146148682,
"mean_token_accuracy": 0.8475374035537243,
"num_tokens": 30516903.0,
"step": 3230
},
{
"entropy": 1.616222647577524,
"epoch": 3.785390796201607,
"grad_norm": 8.386667251586914,
"learning_rate": 2.9463462006275713e-06,
"loss": 0.8853543281555176,
"mean_token_accuracy": 0.8166571896523237,
"num_tokens": 30604895.0,
"step": 3240
},
{
"entropy": 1.6252083383500575,
"epoch": 3.7970781592403213,
"grad_norm": 8.474164009094238,
"learning_rate": 2.89290143933469e-06,
"loss": 0.8446044921875,
"mean_token_accuracy": 0.8179089311510325,
"num_tokens": 30701843.0,
"step": 3250
},
{
"entropy": 1.5914750188589095,
"epoch": 3.8087655222790358,
"grad_norm": 18.274063110351562,
"learning_rate": 2.839863762520465e-06,
"loss": 0.949248218536377,
"mean_token_accuracy": 0.8415104635059834,
"num_tokens": 30818695.0,
"step": 3260
},
{
"entropy": 1.5075955897569657,
"epoch": 3.82045288531775,
"grad_norm": 13.18472957611084,
"learning_rate": 2.787236208107447e-06,
"loss": 0.7748193264007568,
"mean_token_accuracy": 0.8260310523211956,
"num_tokens": 30903136.0,
"step": 3270
},
{
"entropy": 1.5381855167448522,
"epoch": 3.8321402483564646,
"grad_norm": 9.492990493774414,
"learning_rate": 2.7350217905269647e-06,
"loss": 0.8508004188537598,
"mean_token_accuracy": 0.8153258223086596,
"num_tokens": 30996158.0,
"step": 3280
},
{
"entropy": 1.5866551384329797,
"epoch": 3.843827611395179,
"grad_norm": 2.584268093109131,
"learning_rate": 2.6832235005464613e-06,
"loss": 0.9541184425354003,
"mean_token_accuracy": 0.8241108991205692,
"num_tokens": 31110506.0,
"step": 3290
},
{
"entropy": 1.5242624171078205,
"epoch": 3.8555149744338935,
"grad_norm": 3.608710765838623,
"learning_rate": 2.6318443050981724e-06,
"loss": 0.7596922397613526,
"mean_token_accuracy": 0.8370095491409302,
"num_tokens": 31189416.0,
"step": 3300
},
{
"epoch": 3.8555149744338935,
"eval_entropy": 1.5232528802007437,
"eval_loss": 1.001417636871338,
"eval_mean_token_accuracy": 0.7767663078266196,
"eval_num_tokens": 31189416.0,
"eval_runtime": 25.7771,
"eval_samples_per_second": 19.863,
"eval_steps_per_second": 9.931,
"step": 3300
},
{
"entropy": 1.6016543589532375,
"epoch": 3.867202337472608,
"grad_norm": 14.472838401794434,
"learning_rate": 2.58088714710921e-06,
"loss": 0.8808462142944335,
"mean_token_accuracy": 0.8050676196813583,
"num_tokens": 31281413.0,
"step": 3310
},
{
"entropy": 1.6534620575606822,
"epoch": 3.878889700511322,
"grad_norm": 9.369660377502441,
"learning_rate": 2.530354945332971e-06,
"loss": 0.9108871459960938,
"mean_token_accuracy": 0.7937086772173643,
"num_tokens": 31358593.0,
"step": 3320
},
{
"entropy": 1.5693632565438747,
"epoch": 3.8905770635500367,
"grad_norm": 13.68409538269043,
"learning_rate": 2.4802505941819676e-06,
"loss": 0.830049705505371,
"mean_token_accuracy": 0.8499936047941447,
"num_tokens": 31423709.0,
"step": 3330
},
{
"entropy": 1.662206082046032,
"epoch": 3.9022644265887507,
"grad_norm": 12.3108549118042,
"learning_rate": 2.4305769635620437e-06,
"loss": 0.8518457412719727,
"mean_token_accuracy": 0.8457265257835388,
"num_tokens": 31492140.0,
"step": 3340
},
{
"entropy": 1.598170468211174,
"epoch": 3.913951789627465,
"grad_norm": 10.65058422088623,
"learning_rate": 2.38133689870798e-06,
"loss": 0.8946051597595215,
"mean_token_accuracy": 0.8331818394362926,
"num_tokens": 31608730.0,
"step": 3350
},
{
"entropy": 1.5221158944070339,
"epoch": 3.9256391526661796,
"grad_norm": 14.990571975708008,
"learning_rate": 2.332533220020532e-06,
"loss": 0.740440034866333,
"mean_token_accuracy": 0.8109488438814878,
"num_tokens": 31699928.0,
"step": 3360
},
{
"entropy": 1.6108482152223587,
"epoch": 3.937326515704894,
"grad_norm": 8.693507194519043,
"learning_rate": 2.2841687229048725e-06,
"loss": 0.9768977165222168,
"mean_token_accuracy": 0.7872534088790417,
"num_tokens": 31780388.0,
"step": 3370
},
{
"entropy": 1.6088899463415145,
"epoch": 3.9490138787436084,
"grad_norm": 8.17825698852539,
"learning_rate": 2.2362461776104782e-06,
"loss": 0.7007026195526123,
"mean_token_accuracy": 0.8478230189532041,
"num_tokens": 31865549.0,
"step": 3380
},
{
"entropy": 1.6720139175653457,
"epoch": 3.960701241782323,
"grad_norm": 8.937295913696289,
"learning_rate": 2.1887683290724614e-06,
"loss": 0.9712643623352051,
"mean_token_accuracy": 0.8152873106300831,
"num_tokens": 31982142.0,
"step": 3390
},
{
"entropy": 1.5667199984192848,
"epoch": 3.9723886048210373,
"grad_norm": 14.313366889953613,
"learning_rate": 2.14173789675434e-06,
"loss": 0.6438870906829834,
"mean_token_accuracy": 0.8526704031974077,
"num_tokens": 32065588.0,
"step": 3400
},
{
"epoch": 3.9723886048210373,
"eval_entropy": 1.5291059061419219,
"eval_loss": 0.9952678084373474,
"eval_mean_token_accuracy": 0.7729721296927892,
"eval_num_tokens": 32065588.0,
"eval_runtime": 25.733,
"eval_samples_per_second": 19.897,
"eval_steps_per_second": 9.948,
"step": 3400
},
{
"entropy": 1.6004819676280022,
"epoch": 3.9840759678597517,
"grad_norm": 6.698596477508545,
"learning_rate": 2.095157574492256e-06,
"loss": 0.7810785293579101,
"mean_token_accuracy": 0.8351054944097995,
"num_tokens": 32149132.0,
"step": 3410
},
{
"entropy": 1.585545502603054,
"epoch": 3.995763330898466,
"grad_norm": 11.226009368896484,
"learning_rate": 2.0490300303407017e-06,
"loss": 0.7629546165466309,
"mean_token_accuracy": 0.8441075064241886,
"num_tokens": 32236727.0,
"step": 3420
},
{
"entropy": 1.6049067532861387,
"epoch": 4.007012417823229,
"grad_norm": 12.657943725585938,
"learning_rate": 2.003357906419675e-06,
"loss": 0.9035828590393067,
"mean_token_accuracy": 0.849897534429253,
"num_tokens": 32332063.0,
"step": 3430
},
{
"entropy": 1.6062161587178707,
"epoch": 4.018699780861943,
"grad_norm": 5.047912120819092,
"learning_rate": 1.9581438187633574e-06,
"loss": 0.7564874649047851,
"mean_token_accuracy": 0.8432585556060076,
"num_tokens": 32435755.0,
"step": 3440
},
{
"entropy": 1.5072905823588372,
"epoch": 4.030387143900658,
"grad_norm": 9.871566772460938,
"learning_rate": 1.9133903571702683e-06,
"loss": 0.6225325584411621,
"mean_token_accuracy": 0.8637531939893961,
"num_tokens": 32562287.0,
"step": 3450
},
{
"entropy": 1.537027009576559,
"epoch": 4.042074506939372,
"grad_norm": 8.626612663269043,
"learning_rate": 1.8691000850549113e-06,
"loss": 0.8337360382080078,
"mean_token_accuracy": 0.8501617223024368,
"num_tokens": 32671873.0,
"step": 3460
},
{
"entropy": 1.51291029676795,
"epoch": 4.053761869978087,
"grad_norm": 9.0525541305542,
"learning_rate": 1.8252755393009703e-06,
"loss": 0.7315142631530762,
"mean_token_accuracy": 0.8678522855043411,
"num_tokens": 32758685.0,
"step": 3470
},
{
"entropy": 1.4968296751379966,
"epoch": 4.065449233016801,
"grad_norm": 17.39091682434082,
"learning_rate": 1.781919230115976e-06,
"loss": 0.7731627464294434,
"mean_token_accuracy": 0.8328946858644486,
"num_tokens": 32891368.0,
"step": 3480
},
{
"entropy": 1.5203113228082656,
"epoch": 4.077136596055515,
"grad_norm": 16.395082473754883,
"learning_rate": 1.739033640887544e-06,
"loss": 0.8280654907226562,
"mean_token_accuracy": 0.85667341388762,
"num_tokens": 32957112.0,
"step": 3490
},
{
"entropy": 1.482571394741535,
"epoch": 4.0888239590942295,
"grad_norm": 12.730628967285156,
"learning_rate": 1.6966212280411132e-06,
"loss": 0.631969404220581,
"mean_token_accuracy": 0.8859272848814725,
"num_tokens": 33043416.0,
"step": 3500
},
{
"epoch": 4.0888239590942295,
"eval_entropy": 1.4247404006309807,
"eval_loss": 1.082817792892456,
"eval_mean_token_accuracy": 0.7681574639282189,
"eval_num_tokens": 33043416.0,
"eval_runtime": 25.7662,
"eval_samples_per_second": 19.871,
"eval_steps_per_second": 9.935,
"step": 3500
},
{
"entropy": 1.4882067143917084,
"epoch": 4.1005113221329434,
"grad_norm": 6.573575019836426,
"learning_rate": 1.6546844208992608e-06,
"loss": 0.5050776481628418,
"mean_token_accuracy": 0.889410063624382,
"num_tokens": 33130484.0,
"step": 3510
},
{
"entropy": 1.4168844483792782,
"epoch": 4.112198685171658,
"grad_norm": 6.81123685836792,
"learning_rate": 1.6132256215425468e-06,
"loss": 0.6945844173431397,
"mean_token_accuracy": 0.847281289473176,
"num_tokens": 33248127.0,
"step": 3520
},
{
"entropy": 1.4985774755477905,
"epoch": 4.123886048210372,
"grad_norm": 10.758625984191895,
"learning_rate": 1.5722472046719206e-06,
"loss": 0.6711455345153808,
"mean_token_accuracy": 0.8636624123901129,
"num_tokens": 33336070.0,
"step": 3530
},
{
"entropy": 1.4610992252826691,
"epoch": 4.135573411249087,
"grad_norm": 15.049446105957031,
"learning_rate": 1.5317515174727072e-06,
"loss": 0.802742862701416,
"mean_token_accuracy": 0.8524734176695347,
"num_tokens": 33453623.0,
"step": 3540
},
{
"entropy": 1.5617326445877553,
"epoch": 4.147260774287801,
"grad_norm": 11.841690063476562,
"learning_rate": 1.4917408794801713e-06,
"loss": 1.0538336753845214,
"mean_token_accuracy": 0.855667357891798,
"num_tokens": 33556725.0,
"step": 3550
},
{
"entropy": 1.4895190350711345,
"epoch": 4.158948137326516,
"grad_norm": 11.605788230895996,
"learning_rate": 1.4522175824466456e-06,
"loss": 0.410538911819458,
"mean_token_accuracy": 0.8785954911261797,
"num_tokens": 33640487.0,
"step": 3560
},
{
"entropy": 1.5349566243588924,
"epoch": 4.17063550036523,
"grad_norm": 9.695292472839355,
"learning_rate": 1.413183890210269e-06,
"loss": 0.7333604335784912,
"mean_token_accuracy": 0.8444879058748483,
"num_tokens": 33728729.0,
"step": 3570
},
{
"entropy": 1.5703273810446263,
"epoch": 4.182322863403945,
"grad_norm": 17.130413055419922,
"learning_rate": 1.3746420385653114e-06,
"loss": 0.8191527366638184,
"mean_token_accuracy": 0.8597231294959784,
"num_tokens": 33822770.0,
"step": 3580
},
{
"entropy": 1.4822659127414226,
"epoch": 4.194010226442659,
"grad_norm": 11.312241554260254,
"learning_rate": 1.3365942351341154e-06,
"loss": 0.6811165332794189,
"mean_token_accuracy": 0.8470007635653019,
"num_tokens": 33903162.0,
"step": 3590
},
{
"entropy": 1.4625447377562524,
"epoch": 4.205697589481373,
"grad_norm": 11.12173080444336,
"learning_rate": 1.299042659240649e-06,
"loss": 0.48247838020324707,
"mean_token_accuracy": 0.8694281630218029,
"num_tokens": 33985395.0,
"step": 3600
},
{
"epoch": 4.205697589481373,
"eval_entropy": 1.4456222346052527,
"eval_loss": 1.081959843635559,
"eval_mean_token_accuracy": 0.7688928706920706,
"eval_num_tokens": 33985395.0,
"eval_runtime": 25.7644,
"eval_samples_per_second": 19.872,
"eval_steps_per_second": 9.936,
"step": 3600
},
{
"entropy": 1.4896874025464057,
"epoch": 4.217384952520088,
"grad_norm": 9.842438697814941,
"learning_rate": 1.2619894617856742e-06,
"loss": 0.4823128700256348,
"mean_token_accuracy": 0.8850070510059596,
"num_tokens": 34119058.0,
"step": 3610
},
{
"entropy": 1.509472121298313,
"epoch": 4.229072315558802,
"grad_norm": 7.054241180419922,
"learning_rate": 1.22543676512354e-06,
"loss": 0.455275821685791,
"mean_token_accuracy": 0.8764534253627062,
"num_tokens": 34204674.0,
"step": 3620
},
{
"entropy": 1.4993307389318944,
"epoch": 4.240759678597517,
"grad_norm": 13.102241516113281,
"learning_rate": 1.1893866629406315e-06,
"loss": 0.7743210792541504,
"mean_token_accuracy": 0.8474247772246599,
"num_tokens": 34306251.0,
"step": 3630
},
{
"entropy": 1.5021223098039627,
"epoch": 4.2524470416362306,
"grad_norm": 4.396280288696289,
"learning_rate": 1.1538412201354288e-06,
"loss": 0.8427865028381347,
"mean_token_accuracy": 0.8311354946345091,
"num_tokens": 34404230.0,
"step": 3640
},
{
"entropy": 1.4618444450199604,
"epoch": 4.264134404674945,
"grad_norm": 7.301538944244385,
"learning_rate": 1.1188024727002534e-06,
"loss": 0.47443537712097167,
"mean_token_accuracy": 0.8778236124664545,
"num_tokens": 34522556.0,
"step": 3650
},
{
"entropy": 1.5191793739795685,
"epoch": 4.275821767713659,
"grad_norm": 9.962055206298828,
"learning_rate": 1.0842724276046256e-06,
"loss": 0.7483959674835206,
"mean_token_accuracy": 0.8579721502959728,
"num_tokens": 34609804.0,
"step": 3660
},
{
"entropy": 1.5157171241939067,
"epoch": 4.287509130752374,
"grad_norm": 18.916194915771484,
"learning_rate": 1.0502530626803298e-06,
"loss": 0.9998998641967773,
"mean_token_accuracy": 0.8502737872302533,
"num_tokens": 34703516.0,
"step": 3670
},
{
"entropy": 1.4906326524913311,
"epoch": 4.299196493791088,
"grad_norm": 12.003247261047363,
"learning_rate": 1.0167463265081167e-06,
"loss": 0.5675338745117188,
"mean_token_accuracy": 0.8700988806784153,
"num_tokens": 34819893.0,
"step": 3680
},
{
"entropy": 1.4966869540512562,
"epoch": 4.310883856829803,
"grad_norm": 10.846487045288086,
"learning_rate": 9.837541383060856e-07,
"loss": 0.6726597785949707,
"mean_token_accuracy": 0.8683340221643447,
"num_tokens": 34895479.0,
"step": 3690
},
{
"entropy": 1.5521662652492523,
"epoch": 4.322571219868517,
"grad_norm": 3.344892740249634,
"learning_rate": 9.512783878197706e-07,
"loss": 0.9508964538574218,
"mean_token_accuracy": 0.8919697389006614,
"num_tokens": 34984093.0,
"step": 3700
},
{
"epoch": 4.322571219868517,
"eval_entropy": 1.4454550298396498,
"eval_loss": 1.091646432876587,
"eval_mean_token_accuracy": 0.7666249158210121,
"eval_num_tokens": 34984093.0,
"eval_runtime": 25.7364,
"eval_samples_per_second": 19.894,
"eval_steps_per_second": 9.947,
"step": 3700
},
{
"entropy": 1.5254233829677104,
"epoch": 4.334258582907232,
"grad_norm": 14.212644577026367,
"learning_rate": 9.193209352138821e-07,
"loss": 0.7793136596679687,
"mean_token_accuracy": 0.8753752745687962,
"num_tokens": 35068569.0,
"step": 3710
},
{
"entropy": 1.5292565569281578,
"epoch": 4.345945945945946,
"grad_norm": 4.882772445678711,
"learning_rate": 8.878836109657695e-07,
"loss": 0.7594774723052978,
"mean_token_accuracy": 0.862102884426713,
"num_tokens": 35171062.0,
"step": 3720
},
{
"entropy": 1.5290693864226341,
"epoch": 4.35763330898466,
"grad_norm": 6.212003231048584,
"learning_rate": 8.56968215760573e-07,
"loss": 0.6331298828125,
"mean_token_accuracy": 0.8548883602023125,
"num_tokens": 35247873.0,
"step": 3730
},
{
"entropy": 1.5127065040171146,
"epoch": 4.369320672023375,
"grad_norm": 17.832643508911133,
"learning_rate": 8.265765203880772e-07,
"loss": 0.5699717998504639,
"mean_token_accuracy": 0.8602051839232445,
"num_tokens": 35348167.0,
"step": 3740
},
{
"entropy": 1.4995207540690898,
"epoch": 4.381008035062089,
"grad_norm": 5.200070381164551,
"learning_rate": 7.967102656412862e-07,
"loss": 0.8409076690673828,
"mean_token_accuracy": 0.8699726138263941,
"num_tokens": 35462236.0,
"step": 3750
},
{
"entropy": 1.5289938576519488,
"epoch": 4.392695398100804,
"grad_norm": 19.55994415283203,
"learning_rate": 7.673711622167157e-07,
"loss": 0.6666640758514404,
"mean_token_accuracy": 0.859628439322114,
"num_tokens": 35550776.0,
"step": 3760
},
{
"entropy": 1.5315737001597882,
"epoch": 4.404382761139518,
"grad_norm": 12.47616195678711,
"learning_rate": 7.385608906164077e-07,
"loss": 0.6564251899719238,
"mean_token_accuracy": 0.8807011146098376,
"num_tokens": 35638550.0,
"step": 3770
},
{
"entropy": 1.476715262979269,
"epoch": 4.4160701241782325,
"grad_norm": 7.14960241317749,
"learning_rate": 7.102811010516664e-07,
"loss": 0.757103967666626,
"mean_token_accuracy": 0.8514522429555654,
"num_tokens": 35754784.0,
"step": 3780
},
{
"entropy": 1.4561194486916065,
"epoch": 4.4277574872169465,
"grad_norm": 11.394071578979492,
"learning_rate": 6.825334133485418e-07,
"loss": 0.6637251853942872,
"mean_token_accuracy": 0.8669286124408245,
"num_tokens": 35867378.0,
"step": 3790
},
{
"entropy": 1.4877830192446708,
"epoch": 4.439444850255661,
"grad_norm": 15.398336410522461,
"learning_rate": 6.553194168550459e-07,
"loss": 0.690100908279419,
"mean_token_accuracy": 0.8517809867858886,
"num_tokens": 35952362.0,
"step": 3800
},
{
"epoch": 4.439444850255661,
"eval_entropy": 1.4464607145637274,
"eval_loss": 1.0888185501098633,
"eval_mean_token_accuracy": 0.769485326425638,
"eval_num_tokens": 35952362.0,
"eval_runtime": 25.7253,
"eval_samples_per_second": 19.903,
"eval_steps_per_second": 9.951,
"step": 3800
},
{
"entropy": 1.5209308765828609,
"epoch": 4.451132213294375,
"grad_norm": 8.16495418548584,
"learning_rate": 6.286406703501246e-07,
"loss": 0.7843871593475342,
"mean_token_accuracy": 0.8423004079610109,
"num_tokens": 36016101.0,
"step": 3810
},
{
"entropy": 1.5262306325137616,
"epoch": 4.46281957633309,
"grad_norm": 18.60768699645996,
"learning_rate": 6.024987019543593e-07,
"loss": 0.8075613975524902,
"mean_token_accuracy": 0.8136255025863648,
"num_tokens": 36106339.0,
"step": 3820
},
{
"entropy": 1.5524603478610515,
"epoch": 4.474506939371804,
"grad_norm": 13.132192611694336,
"learning_rate": 5.768950090424518e-07,
"loss": 0.8062433242797852,
"mean_token_accuracy": 0.8343270730227232,
"num_tokens": 36203691.0,
"step": 3830
},
{
"entropy": 1.474081838876009,
"epoch": 4.486194302410519,
"grad_norm": 14.549166679382324,
"learning_rate": 5.518310581574515e-07,
"loss": 0.5784972667694092,
"mean_token_accuracy": 0.8847128123044967,
"num_tokens": 36274772.0,
"step": 3840
},
{
"entropy": 1.5090869426727296,
"epoch": 4.497881665449233,
"grad_norm": 11.738391876220703,
"learning_rate": 5.273082849267474e-07,
"loss": 0.9710038185119629,
"mean_token_accuracy": 0.8665750682353973,
"num_tokens": 36364248.0,
"step": 3850
},
{
"entropy": 1.575214620679617,
"epoch": 4.509569028487947,
"grad_norm": 12.552297592163086,
"learning_rate": 5.033280939798502e-07,
"loss": 0.6691967487335205,
"mean_token_accuracy": 0.8502339717000723,
"num_tokens": 36454192.0,
"step": 3860
},
{
"entropy": 1.540502169728279,
"epoch": 4.521256391526662,
"grad_norm": 10.250284194946289,
"learning_rate": 4.798918588679269e-07,
"loss": 0.7413430213928223,
"mean_token_accuracy": 0.8937609244138003,
"num_tokens": 36545450.0,
"step": 3870
},
{
"entropy": 1.4876162141561509,
"epoch": 4.532943754565376,
"grad_norm": 5.206379413604736,
"learning_rate": 4.570009219851312e-07,
"loss": 0.7229172229766846,
"mean_token_accuracy": 0.8560761611908674,
"num_tokens": 36647090.0,
"step": 3880
},
{
"entropy": 1.505126003175974,
"epoch": 4.544631117604091,
"grad_norm": 10.110809326171875,
"learning_rate": 4.346565944917114e-07,
"loss": 0.7667391777038575,
"mean_token_accuracy": 0.8541755691170693,
"num_tokens": 36758188.0,
"step": 3890
},
{
"entropy": 1.4865600690245628,
"epoch": 4.556318480642805,
"grad_norm": 4.7262043952941895,
"learning_rate": 4.1286015623890674e-07,
"loss": 0.5576696872711182,
"mean_token_accuracy": 0.8558296959847211,
"num_tokens": 36850488.0,
"step": 3900
},
{
"epoch": 4.556318480642805,
"eval_entropy": 1.4396855637896806,
"eval_loss": 1.0947682857513428,
"eval_mean_token_accuracy": 0.7694231180357747,
"eval_num_tokens": 36850488.0,
"eval_runtime": 25.6913,
"eval_samples_per_second": 19.929,
"eval_steps_per_second": 9.964,
"step": 3900
},
{
"entropy": 1.4926868014037609,
"epoch": 4.56800584368152,
"grad_norm": 8.493346214294434,
"learning_rate": 3.9161285569564114e-07,
"loss": 0.4650919437408447,
"mean_token_accuracy": 0.8972312148660422,
"num_tokens": 36923777.0,
"step": 3910
},
{
"entropy": 1.522305753827095,
"epoch": 4.579693206720234,
"grad_norm": 16.466768264770508,
"learning_rate": 3.709159098770165e-07,
"loss": 0.7419657230377197,
"mean_token_accuracy": 0.8645104166120291,
"num_tokens": 37010882.0,
"step": 3920
},
{
"entropy": 1.5289164453744888,
"epoch": 4.5913805697589485,
"grad_norm": 5.047861099243164,
"learning_rate": 3.507705042745979e-07,
"loss": 0.7584509372711181,
"mean_token_accuracy": 0.857337387278676,
"num_tokens": 37082099.0,
"step": 3930
},
{
"entropy": 1.4429242953658103,
"epoch": 4.6030679327976625,
"grad_norm": 8.835667610168457,
"learning_rate": 3.3117779278851294e-07,
"loss": 0.4135472297668457,
"mean_token_accuracy": 0.8845292035490274,
"num_tokens": 37179248.0,
"step": 3940
},
{
"entropy": 1.5127482995390893,
"epoch": 4.6147552958363764,
"grad_norm": 8.691869735717773,
"learning_rate": 3.121388976613582e-07,
"loss": 0.5384024143218994,
"mean_token_accuracy": 0.8384344112128019,
"num_tokens": 37287234.0,
"step": 3950
},
{
"entropy": 1.4824551120400429,
"epoch": 4.626442658875091,
"grad_norm": 10.049670219421387,
"learning_rate": 2.9365490941391626e-07,
"loss": 0.754266881942749,
"mean_token_accuracy": 0.8504394836723804,
"num_tokens": 37395872.0,
"step": 3960
},
{
"entropy": 1.452832967787981,
"epoch": 4.638130021913806,
"grad_norm": 4.427601337432861,
"learning_rate": 2.7572688678269897e-07,
"loss": 0.5318255424499512,
"mean_token_accuracy": 0.8919252689927817,
"num_tokens": 37476568.0,
"step": 3970
},
{
"entropy": 1.5254285097122193,
"epoch": 4.64981738495252,
"grad_norm": 7.1622490882873535,
"learning_rate": 2.5835585665929365e-07,
"loss": 0.848170280456543,
"mean_token_accuracy": 0.8709424588829279,
"num_tokens": 37576587.0,
"step": 3980
},
{
"entropy": 1.561382431536913,
"epoch": 4.661504747991234,
"grad_norm": 6.549232482910156,
"learning_rate": 2.415428140315579e-07,
"loss": 0.6186144351959229,
"mean_token_accuracy": 0.8826206211000681,
"num_tokens": 37676313.0,
"step": 3990
},
{
"entropy": 1.4810091137886048,
"epoch": 4.673192111029949,
"grad_norm": 20.657800674438477,
"learning_rate": 2.2528872192661312e-07,
"loss": 0.5842293262481689,
"mean_token_accuracy": 0.8619752835482359,
"num_tokens": 37750057.0,
"step": 4000
},
{
"epoch": 4.673192111029949,
"eval_entropy": 1.4375433966051787,
"eval_loss": 1.097025990486145,
"eval_mean_token_accuracy": 0.7680731810978614,
"eval_num_tokens": 37750057.0,
"eval_runtime": 25.7161,
"eval_samples_per_second": 19.91,
"eval_steps_per_second": 9.955,
"step": 4000
},
{
"entropy": 1.5436802476644516,
"epoch": 4.684879474068663,
"grad_norm": 6.413429260253906,
"learning_rate": 2.095945113556963e-07,
"loss": 0.7302318572998047,
"mean_token_accuracy": 0.8568271558731795,
"num_tokens": 37856446.0,
"step": 4010
},
{
"entropy": 1.4901932425796987,
"epoch": 4.696566837107378,
"grad_norm": 19.987340927124023,
"learning_rate": 1.9446108126082607e-07,
"loss": 0.6349533081054688,
"mean_token_accuracy": 0.8936959408223629,
"num_tokens": 37930806.0,
"step": 4020
},
{
"entropy": 1.4795681625604629,
"epoch": 4.708254200146092,
"grad_norm": 11.290853500366211,
"learning_rate": 1.798892984633138e-07,
"loss": 0.7728898525238037,
"mean_token_accuracy": 0.8658060751855373,
"num_tokens": 38020835.0,
"step": 4030
},
{
"entropy": 1.5635792575776577,
"epoch": 4.719941563184807,
"grad_norm": 10.672747611999512,
"learning_rate": 1.6587999761411455e-07,
"loss": 0.5687346458435059,
"mean_token_accuracy": 0.8528085239231586,
"num_tokens": 38104374.0,
"step": 4040
},
{
"entropy": 1.4602154590189458,
"epoch": 4.731628926223521,
"grad_norm": 23.16471290588379,
"learning_rate": 1.5243398114602182e-07,
"loss": 0.5822049140930176,
"mean_token_accuracy": 0.8367134757339955,
"num_tokens": 38222689.0,
"step": 4050
},
{
"entropy": 1.5052896670997142,
"epoch": 4.743316289262236,
"grad_norm": 16.241004943847656,
"learning_rate": 1.395520192276967e-07,
"loss": 0.8418606758117676,
"mean_token_accuracy": 0.8202387966215611,
"num_tokens": 38316782.0,
"step": 4060
},
{
"entropy": 1.531810101866722,
"epoch": 4.75500365230095,
"grad_norm": 7.349140644073486,
"learning_rate": 1.2723484971956412e-07,
"loss": 0.755488920211792,
"mean_token_accuracy": 0.8450414523482322,
"num_tokens": 38423124.0,
"step": 4070
},
{
"entropy": 1.584228988736868,
"epoch": 4.7666910153396636,
"grad_norm": 9.823003768920898,
"learning_rate": 1.154831781315413e-07,
"loss": 0.968692684173584,
"mean_token_accuracy": 0.8501280307769775,
"num_tokens": 38521407.0,
"step": 4080
},
{
"entropy": 1.5390350714325904,
"epoch": 4.778378378378378,
"grad_norm": 18.232288360595703,
"learning_rate": 1.042976775826332e-07,
"loss": 0.61814284324646,
"mean_token_accuracy": 0.872353944554925,
"num_tokens": 38624893.0,
"step": 4090
},
{
"entropy": 1.4646945357322694,
"epoch": 4.790065741417092,
"grad_norm": 15.621621131896973,
"learning_rate": 9.367898876237347e-08,
"loss": 0.6843422889709473,
"mean_token_accuracy": 0.8493800751864911,
"num_tokens": 38706684.0,
"step": 4100
},
{
"epoch": 4.790065741417092,
"eval_entropy": 1.4424911779351532,
"eval_loss": 1.0918210744857788,
"eval_mean_token_accuracy": 0.7697787257493474,
"eval_num_tokens": 38706684.0,
"eval_runtime": 25.6921,
"eval_samples_per_second": 19.928,
"eval_steps_per_second": 9.964,
"step": 4100
},
{
"entropy": 1.4517256565392018,
"epoch": 4.801753104455807,
"grad_norm": 7.361289978027344,
"learning_rate": 8.362771989412488e-08,
"loss": 0.7133095264434814,
"mean_token_accuracy": 0.8632656030356884,
"num_tokens": 38787460.0,
"step": 4110
},
{
"entropy": 1.5199289210140705,
"epoch": 4.813440467494521,
"grad_norm": 3.967174768447876,
"learning_rate": 7.414444670024834e-08,
"loss": 0.9737075805664063,
"mean_token_accuracy": 0.8513060834258794,
"num_tokens": 38894866.0,
"step": 4120
},
{
"entropy": 1.5039781682193278,
"epoch": 4.825127830533236,
"grad_norm": 9.782380104064941,
"learning_rate": 6.522971236911923e-08,
"loss": 0.6163204193115235,
"mean_token_accuracy": 0.8985051784664393,
"num_tokens": 38997595.0,
"step": 4130
},
{
"entropy": 1.5199985206127167,
"epoch": 4.83681519357195,
"grad_norm": 3.506466865539551,
"learning_rate": 5.688402752401567e-08,
"loss": 0.9050114631652832,
"mean_token_accuracy": 0.8055482944473624,
"num_tokens": 39087395.0,
"step": 4140
},
{
"entropy": 1.4977469891309738,
"epoch": 4.848502556610665,
"grad_norm": 6.047015190124512,
"learning_rate": 4.91078701938763e-08,
"loss": 0.5338590145111084,
"mean_token_accuracy": 0.8793411515653133,
"num_tokens": 39189114.0,
"step": 4150
},
{
"entropy": 1.5504455424845218,
"epoch": 4.860189919649379,
"grad_norm": 16.04572105407715,
"learning_rate": 4.190168578591114e-08,
"loss": 0.8087006568908691,
"mean_token_accuracy": 0.8372783213853836,
"num_tokens": 39287245.0,
"step": 4160
},
{
"entropy": 1.4528725862503051,
"epoch": 4.871877282688094,
"grad_norm": 16.02657127380371,
"learning_rate": 3.526588706009637e-08,
"loss": 0.514737892150879,
"mean_token_accuracy": 0.8511596038937569,
"num_tokens": 39354897.0,
"step": 4170
},
{
"entropy": 1.4478582091629506,
"epoch": 4.883564645726808,
"grad_norm": 7.557652950286865,
"learning_rate": 2.9200854105526645e-08,
"loss": 0.6200026512145996,
"mean_token_accuracy": 0.865429537370801,
"num_tokens": 39418694.0,
"step": 4180
},
{
"entropy": 1.4812394805252551,
"epoch": 4.895252008765523,
"grad_norm": 4.643852710723877,
"learning_rate": 2.37069343186469e-08,
"loss": 0.8050068855285645,
"mean_token_accuracy": 0.8574969913810492,
"num_tokens": 39504790.0,
"step": 4190
},
{
"entropy": 1.4632190234959126,
"epoch": 4.906939371804237,
"grad_norm": 17.43656349182129,
"learning_rate": 1.8784442383354972e-08,
"loss": 0.579356050491333,
"mean_token_accuracy": 0.8364833440631628,
"num_tokens": 39588583.0,
"step": 4200
},
{
"epoch": 4.906939371804237,
"eval_entropy": 1.4423961690627038,
"eval_loss": 1.094377040863037,
"eval_mean_token_accuracy": 0.7712554379249923,
"eval_num_tokens": 39588583.0,
"eval_runtime": 25.7381,
"eval_samples_per_second": 19.893,
"eval_steps_per_second": 9.946,
"step": 4200
},
{
"entropy": 1.4858237937092782,
"epoch": 4.918626734842951,
"grad_norm": 12.429141998291016,
"learning_rate": 1.443366025297599e-08,
"loss": 0.5480079650878906,
"mean_token_accuracy": 0.8573607705533505,
"num_tokens": 39691380.0,
"step": 4210
},
{
"entropy": 1.5240480951964854,
"epoch": 4.9303140978816655,
"grad_norm": 6.490242958068848,
"learning_rate": 1.0654837134109752e-08,
"loss": 0.557542085647583,
"mean_token_accuracy": 0.8416418630629778,
"num_tokens": 39792494.0,
"step": 4220
},
{
"entropy": 1.5179505512118339,
"epoch": 4.9420014609203795,
"grad_norm": 13.937246322631836,
"learning_rate": 7.4481894723599236e-09,
"loss": 0.6862639427185059,
"mean_token_accuracy": 0.8709760889410972,
"num_tokens": 39875847.0,
"step": 4230
},
{
"entropy": 1.5092324443161487,
"epoch": 4.953688823959094,
"grad_norm": 11.903735160827637,
"learning_rate": 4.813900939936167e-09,
"loss": 0.48588266372680666,
"mean_token_accuracy": 0.8748119071125984,
"num_tokens": 39982678.0,
"step": 4240
},
{
"entropy": 1.4981704361736774,
"epoch": 4.965376186997808,
"grad_norm": 9.157793045043945,
"learning_rate": 2.7521224251303436e-09,
"loss": 0.5891988754272461,
"mean_token_accuracy": 0.8549117844551801,
"num_tokens": 40075794.0,
"step": 4250
},
{
"entropy": 1.5046925134956837,
"epoch": 4.977063550036523,
"grad_norm": 4.12293815612793,
"learning_rate": 1.2629720236800868e-09,
"loss": 0.6233686447143555,
"mean_token_accuracy": 0.8813595429062844,
"num_tokens": 40165956.0,
"step": 4260
},
{
"entropy": 1.5573359951376915,
"epoch": 4.988750913075237,
"grad_norm": 12.11980152130127,
"learning_rate": 3.4653503199866266e-10,
"loss": 0.7357488155364991,
"mean_token_accuracy": 0.8814769674092531,
"num_tokens": 40246684.0,
"step": 4270
},
{
"entropy": 1.5398043293457526,
"epoch": 5.0,
"grad_norm": 5.443117618560791,
"learning_rate": 2.8639422888776525e-12,
"loss": 0.952604866027832,
"mean_token_accuracy": 0.8546050163832578,
"num_tokens": 40341950.0,
"step": 4280
},
{
"epoch": 5.0,
"eval_entropy": 1.4426328076515347,
"eval_loss": 1.0950794219970703,
"eval_mean_token_accuracy": 0.7698450249736197,
"eval_num_tokens": 40341950.0,
"eval_runtime": 25.6899,
"eval_samples_per_second": 19.93,
"eval_steps_per_second": 9.965,
"step": 4280
},
{
"epoch": 5.0,
"step": 4280,
"total_flos": 1.8234326345207808e+18,
"train_loss": 1.0279761601274258,
"train_runtime": 15113.9351,
"train_samples_per_second": 2.264,
"train_steps_per_second": 0.283
}
],
"logging_steps": 10,
"max_steps": 4280,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 100,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.8234326345207808e+18,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}