Jongbin-kr's picture
End of training: best validation-loss checkpoint
a996ee1 verified
Raw
History Blame Contribute Delete
125 kB
{
"best_global_step": 1500,
"best_metric": 0.6151674389839172,
"best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_legal-nomenclature-purist_ffn_only_5ep_eval500/checkpoint-1500",
"epoch": 5.0,
"eval_steps": 500,
"global_step": 4025,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.2218834400177,
"epoch": 0.012422360248447204,
"grad_norm": 5.412133693695068,
"learning_rate": 1.4876033057851241e-06,
"loss": 1.720897102355957,
"mean_token_accuracy": 0.6472304485738277,
"num_tokens": 45328.0,
"step": 10
},
{
"entropy": 2.2021790027618406,
"epoch": 0.024844720496894408,
"grad_norm": 6.844479084014893,
"learning_rate": 3.1404958677685953e-06,
"loss": 2.003491973876953,
"mean_token_accuracy": 0.613143677636981,
"num_tokens": 90713.0,
"step": 20
},
{
"entropy": 2.260706987977028,
"epoch": 0.037267080745341616,
"grad_norm": 8.312433242797852,
"learning_rate": 4.793388429752067e-06,
"loss": 1.9829626083374023,
"mean_token_accuracy": 0.5876670200377703,
"num_tokens": 133436.0,
"step": 30
},
{
"entropy": 2.277198740839958,
"epoch": 0.049689440993788817,
"grad_norm": 4.128373622894287,
"learning_rate": 6.446280991735537e-06,
"loss": 1.683332633972168,
"mean_token_accuracy": 0.6403063053265214,
"num_tokens": 173768.0,
"step": 40
},
{
"entropy": 2.275305709242821,
"epoch": 0.062111801242236024,
"grad_norm": 3.860987424850464,
"learning_rate": 8.099173553719009e-06,
"loss": 1.4613001823425293,
"mean_token_accuracy": 0.6954401664435863,
"num_tokens": 216454.0,
"step": 50
},
{
"entropy": 2.226709768176079,
"epoch": 0.07453416149068323,
"grad_norm": 3.2089221477508545,
"learning_rate": 9.75206611570248e-06,
"loss": 1.0452740669250489,
"mean_token_accuracy": 0.8045810982584953,
"num_tokens": 261427.0,
"step": 60
},
{
"entropy": 2.293886032700539,
"epoch": 0.08695652173913043,
"grad_norm": 6.784758567810059,
"learning_rate": 1.1404958677685952e-05,
"loss": 0.9967960357666016,
"mean_token_accuracy": 0.7896769121289253,
"num_tokens": 303808.0,
"step": 70
},
{
"entropy": 2.306024971604347,
"epoch": 0.09937888198757763,
"grad_norm": 6.519183158874512,
"learning_rate": 1.3057851239669424e-05,
"loss": 0.8302921295166016,
"mean_token_accuracy": 0.7989890590310097,
"num_tokens": 350862.0,
"step": 80
},
{
"entropy": 2.2958358585834504,
"epoch": 0.11180124223602485,
"grad_norm": 3.592912197113037,
"learning_rate": 1.4710743801652893e-05,
"loss": 0.639973497390747,
"mean_token_accuracy": 0.8467254146933556,
"num_tokens": 395570.0,
"step": 90
},
{
"entropy": 2.326699784398079,
"epoch": 0.12422360248447205,
"grad_norm": 4.474846839904785,
"learning_rate": 1.6363636363636366e-05,
"loss": 0.6599883079528809,
"mean_token_accuracy": 0.8683099627494812,
"num_tokens": 433623.0,
"step": 100
},
{
"entropy": 2.1977039337158204,
"epoch": 0.13664596273291926,
"grad_norm": 3.3706459999084473,
"learning_rate": 1.8016528925619837e-05,
"loss": 0.4734317779541016,
"mean_token_accuracy": 0.8930498465895653,
"num_tokens": 482905.0,
"step": 110
},
{
"entropy": 2.1412303030490873,
"epoch": 0.14906832298136646,
"grad_norm": 7.407418251037598,
"learning_rate": 1.9669421487603307e-05,
"loss": 0.49360313415527346,
"mean_token_accuracy": 0.880374065041542,
"num_tokens": 530860.0,
"step": 120
},
{
"entropy": 2.1529846519231794,
"epoch": 0.16149068322981366,
"grad_norm": 4.532316207885742,
"learning_rate": 1.9999792781461744e-05,
"loss": 0.3332545757293701,
"mean_token_accuracy": 0.9231329143047333,
"num_tokens": 573626.0,
"step": 130
},
{
"entropy": 2.164460891485214,
"epoch": 0.17391304347826086,
"grad_norm": 4.046708583831787,
"learning_rate": 1.9998950970868584e-05,
"loss": 0.353117036819458,
"mean_token_accuracy": 0.9148650147020817,
"num_tokens": 615581.0,
"step": 140
},
{
"entropy": 2.0522007673978804,
"epoch": 0.18633540372670807,
"grad_norm": 6.083385944366455,
"learning_rate": 1.9997461671531945e-05,
"loss": 0.29966306686401367,
"mean_token_accuracy": 0.9333024516701698,
"num_tokens": 667334.0,
"step": 150
},
{
"entropy": 2.215573158860207,
"epoch": 0.19875776397515527,
"grad_norm": 5.368868827819824,
"learning_rate": 1.9995324979892407e-05,
"loss": 0.39634816646575927,
"mean_token_accuracy": 0.8946829706430435,
"num_tokens": 705094.0,
"step": 160
},
{
"entropy": 2.1504065871238707,
"epoch": 0.2111801242236025,
"grad_norm": 1.7437018156051636,
"learning_rate": 1.9992541034312862e-05,
"loss": 0.2833492517471313,
"mean_token_accuracy": 0.9131577238440514,
"num_tokens": 752206.0,
"step": 170
},
{
"entropy": 2.067841339111328,
"epoch": 0.2236024844720497,
"grad_norm": 7.387396812438965,
"learning_rate": 1.9989110015069562e-05,
"loss": 0.2200930118560791,
"mean_token_accuracy": 0.9420874312520027,
"num_tokens": 802186.0,
"step": 180
},
{
"entropy": 2.022136354446411,
"epoch": 0.2360248447204969,
"grad_norm": 5.731217861175537,
"learning_rate": 1.9985032144340452e-05,
"loss": 0.30328352451324464,
"mean_token_accuracy": 0.9335977420210838,
"num_tokens": 849350.0,
"step": 190
},
{
"entropy": 2.0770725339651106,
"epoch": 0.2484472049689441,
"grad_norm": 3.3734312057495117,
"learning_rate": 1.9980307686190764e-05,
"loss": 0.2324429988861084,
"mean_token_accuracy": 0.9344113290309906,
"num_tokens": 896011.0,
"step": 200
},
{
"entropy": 2.0887098640203474,
"epoch": 0.2608695652173913,
"grad_norm": 4.338788032531738,
"learning_rate": 1.997493694655595e-05,
"loss": 0.2637628078460693,
"mean_token_accuracy": 0.9405189320445061,
"num_tokens": 938272.0,
"step": 210
},
{
"entropy": 2.057726114988327,
"epoch": 0.2732919254658385,
"grad_norm": 7.423470973968506,
"learning_rate": 1.9968920273221833e-05,
"loss": 0.245102596282959,
"mean_token_accuracy": 0.934748524427414,
"num_tokens": 985910.0,
"step": 220
},
{
"entropy": 2.0852247208356856,
"epoch": 0.2857142857142857,
"grad_norm": 4.9054999351501465,
"learning_rate": 1.996225805580211e-05,
"loss": 0.16561169624328614,
"mean_token_accuracy": 0.9549386024475097,
"num_tokens": 1026611.0,
"step": 230
},
{
"entropy": 2.1346270740032196,
"epoch": 0.2981366459627329,
"grad_norm": 0.8074743151664734,
"learning_rate": 1.9954950725713117e-05,
"loss": 0.2407538890838623,
"mean_token_accuracy": 0.944537715613842,
"num_tokens": 1071660.0,
"step": 240
},
{
"entropy": 2.122556984424591,
"epoch": 0.3105590062111801,
"grad_norm": 0.8064472079277039,
"learning_rate": 1.9946998756145894e-05,
"loss": 0.14700745344161986,
"mean_token_accuracy": 0.968578913807869,
"num_tokens": 1120556.0,
"step": 250
},
{
"entropy": 2.107454228401184,
"epoch": 0.32298136645962733,
"grad_norm": 4.961323261260986,
"learning_rate": 1.993840266203553e-05,
"loss": 0.19659453630447388,
"mean_token_accuracy": 0.9422186747193336,
"num_tokens": 1162755.0,
"step": 260
},
{
"entropy": 2.1008795320987703,
"epoch": 0.33540372670807456,
"grad_norm": 4.268195152282715,
"learning_rate": 1.9929163000027848e-05,
"loss": 0.19777419567108154,
"mean_token_accuracy": 0.9608424186706543,
"num_tokens": 1212228.0,
"step": 270
},
{
"entropy": 2.0714638978242874,
"epoch": 0.34782608695652173,
"grad_norm": 4.130878925323486,
"learning_rate": 1.9919280368443316e-05,
"loss": 0.1941136121749878,
"mean_token_accuracy": 0.9510379567742347,
"num_tokens": 1258377.0,
"step": 280
},
{
"entropy": 2.146782675385475,
"epoch": 0.36024844720496896,
"grad_norm": 8.89709758758545,
"learning_rate": 1.9908755407238342e-05,
"loss": 0.175544273853302,
"mean_token_accuracy": 0.9587054386734962,
"num_tokens": 1298826.0,
"step": 290
},
{
"entropy": 2.1432328313589095,
"epoch": 0.37267080745341613,
"grad_norm": 2.826094150543213,
"learning_rate": 1.9897588797963818e-05,
"loss": 0.19219242334365844,
"mean_token_accuracy": 0.9561588227748871,
"num_tokens": 1339864.0,
"step": 300
},
{
"entropy": 2.1786401599645613,
"epoch": 0.38509316770186336,
"grad_norm": 2.988393545150757,
"learning_rate": 1.9885781263720977e-05,
"loss": 0.15490752458572388,
"mean_token_accuracy": 0.952945676445961,
"num_tokens": 1382819.0,
"step": 310
},
{
"entropy": 2.150338906049728,
"epoch": 0.39751552795031053,
"grad_norm": 3.8469715118408203,
"learning_rate": 1.9873333569114578e-05,
"loss": 0.11064722537994384,
"mean_token_accuracy": 0.9639346539974213,
"num_tokens": 1428235.0,
"step": 320
},
{
"entropy": 2.0485803872346877,
"epoch": 0.40993788819875776,
"grad_norm": 3.4940409660339355,
"learning_rate": 1.9860246520203393e-05,
"loss": 0.12654770612716676,
"mean_token_accuracy": 0.9720151156187058,
"num_tokens": 1475653.0,
"step": 330
},
{
"entropy": 2.0982570886611938,
"epoch": 0.422360248447205,
"grad_norm": 9.01036262512207,
"learning_rate": 1.984652096444801e-05,
"loss": 0.17338567972183228,
"mean_token_accuracy": 0.9567379966378212,
"num_tokens": 1522587.0,
"step": 340
},
{
"entropy": 2.037535387277603,
"epoch": 0.43478260869565216,
"grad_norm": 6.306981563568115,
"learning_rate": 1.9832157790655947e-05,
"loss": 0.15461095571517944,
"mean_token_accuracy": 0.9642502069473267,
"num_tokens": 1570146.0,
"step": 350
},
{
"entropy": 2.0148197203874587,
"epoch": 0.4472049689440994,
"grad_norm": 5.378430366516113,
"learning_rate": 1.9817157928924123e-05,
"loss": 0.10572208166122436,
"mean_token_accuracy": 0.9662203952670098,
"num_tokens": 1619006.0,
"step": 360
},
{
"entropy": 2.1017101377248766,
"epoch": 0.45962732919254656,
"grad_norm": 4.263245582580566,
"learning_rate": 1.980152235057858e-05,
"loss": 0.2266246795654297,
"mean_token_accuracy": 0.9508525714278221,
"num_tokens": 1666344.0,
"step": 370
},
{
"entropy": 2.1142481714487076,
"epoch": 0.4720496894409938,
"grad_norm": 1.6734673976898193,
"learning_rate": 1.9785252068111634e-05,
"loss": 0.141499662399292,
"mean_token_accuracy": 0.9647441744804383,
"num_tokens": 1707202.0,
"step": 380
},
{
"entropy": 2.0245371520519257,
"epoch": 0.484472049689441,
"grad_norm": 1.1180492639541626,
"learning_rate": 1.976834813511629e-05,
"loss": 0.07580887675285339,
"mean_token_accuracy": 0.9793496742844582,
"num_tokens": 1752612.0,
"step": 390
},
{
"entropy": 2.174392205476761,
"epoch": 0.4968944099378882,
"grad_norm": 6.994105815887451,
"learning_rate": 1.9750811646218008e-05,
"loss": 0.11529726982116699,
"mean_token_accuracy": 0.9770008429884911,
"num_tokens": 1787340.0,
"step": 400
},
{
"entropy": 2.093138635158539,
"epoch": 0.5093167701863354,
"grad_norm": 6.234873294830322,
"learning_rate": 1.9732643737003827e-05,
"loss": 0.1870105028152466,
"mean_token_accuracy": 0.9562314331531525,
"num_tokens": 1832755.0,
"step": 410
},
{
"entropy": 2.0406362146139143,
"epoch": 0.5217391304347826,
"grad_norm": 6.59069299697876,
"learning_rate": 1.9713845583948838e-05,
"loss": 0.12588831186294555,
"mean_token_accuracy": 0.9748386725783348,
"num_tokens": 1877258.0,
"step": 420
},
{
"entropy": 2.0712024956941604,
"epoch": 0.5341614906832298,
"grad_norm": 1.3715144395828247,
"learning_rate": 1.9694418404339985e-05,
"loss": 0.14443048238754272,
"mean_token_accuracy": 0.96854527592659,
"num_tokens": 1926633.0,
"step": 430
},
{
"entropy": 2.120563179254532,
"epoch": 0.546583850931677,
"grad_norm": 0.8505068421363831,
"learning_rate": 1.9674363456197252e-05,
"loss": 0.10405553579330444,
"mean_token_accuracy": 0.9761933490633965,
"num_tokens": 1968058.0,
"step": 440
},
{
"entropy": 2.1187560498714446,
"epoch": 0.5590062111801242,
"grad_norm": 0.2388964146375656,
"learning_rate": 1.965368203819219e-05,
"loss": 0.12412438392639161,
"mean_token_accuracy": 0.9798449590802193,
"num_tokens": 2011757.0,
"step": 450
},
{
"entropy": 2.079404717683792,
"epoch": 0.5714285714285714,
"grad_norm": 6.426936149597168,
"learning_rate": 1.963237548956382e-05,
"loss": 0.13763257265090942,
"mean_token_accuracy": 0.9699526458978653,
"num_tokens": 2056687.0,
"step": 460
},
{
"entropy": 2.1087421059608458,
"epoch": 0.5838509316770186,
"grad_norm": 5.350924968719482,
"learning_rate": 1.9610445190031927e-05,
"loss": 0.17600059509277344,
"mean_token_accuracy": 0.9602105036377907,
"num_tokens": 2107909.0,
"step": 470
},
{
"entropy": 2.1104681938886642,
"epoch": 0.5962732919254659,
"grad_norm": 4.915591239929199,
"learning_rate": 1.9587892559707687e-05,
"loss": 0.14593877792358398,
"mean_token_accuracy": 0.9634651705622673,
"num_tokens": 2152714.0,
"step": 480
},
{
"entropy": 2.0843971610069274,
"epoch": 0.6086956521739131,
"grad_norm": 5.020099639892578,
"learning_rate": 1.9564719059001735e-05,
"loss": 0.09503247737884521,
"mean_token_accuracy": 0.9802449300885201,
"num_tokens": 2199372.0,
"step": 490
},
{
"entropy": 2.117968979477882,
"epoch": 0.6211180124223602,
"grad_norm": 6.113184928894043,
"learning_rate": 1.9540926188529567e-05,
"loss": 0.06596333384513856,
"mean_token_accuracy": 0.9794966623187065,
"num_tokens": 2240337.0,
"step": 500
},
{
"epoch": 0.6211180124223602,
"eval_entropy": 1.9857167843865502,
"eval_loss": 0.6501790285110474,
"eval_mean_token_accuracy": 0.8782477229366482,
"eval_num_tokens": 2240337.0,
"eval_runtime": 1016.9781,
"eval_samples_per_second": 7.523,
"eval_steps_per_second": 0.941,
"step": 500
},
{
"entropy": 2.1537328869104386,
"epoch": 0.6335403726708074,
"grad_norm": 1.456288456916809,
"learning_rate": 1.9516515489014394e-05,
"loss": 0.13476414680480958,
"mean_token_accuracy": 0.9724704563617707,
"num_tokens": 2278433.0,
"step": 510
},
{
"entropy": 2.1237567752599715,
"epoch": 0.6459627329192547,
"grad_norm": 7.178049564361572,
"learning_rate": 1.9491488541187356e-05,
"loss": 0.14870620965957643,
"mean_token_accuracy": 0.9673199355602264,
"num_tokens": 2325326.0,
"step": 520
},
{
"entropy": 2.0662467658519743,
"epoch": 0.6583850931677019,
"grad_norm": 4.662649154663086,
"learning_rate": 1.946584696568516e-05,
"loss": 0.06994055509567261,
"mean_token_accuracy": 0.9829941034317017,
"num_tokens": 2369447.0,
"step": 530
},
{
"entropy": 2.123342525959015,
"epoch": 0.6708074534161491,
"grad_norm": 3.5230398178100586,
"learning_rate": 1.9439592422945147e-05,
"loss": 0.12530711889266968,
"mean_token_accuracy": 0.968981710076332,
"num_tokens": 2414329.0,
"step": 540
},
{
"entropy": 2.109190860390663,
"epoch": 0.6832298136645962,
"grad_norm": 5.585573673248291,
"learning_rate": 1.9412726613097747e-05,
"loss": 0.07817915678024293,
"mean_token_accuracy": 0.9775777757167816,
"num_tokens": 2460847.0,
"step": 550
},
{
"entropy": 2.144969728589058,
"epoch": 0.6956521739130435,
"grad_norm": 4.607976913452148,
"learning_rate": 1.9385251275856413e-05,
"loss": 0.08262240886688232,
"mean_token_accuracy": 0.9754370078444481,
"num_tokens": 2501095.0,
"step": 560
},
{
"entropy": 2.1769137263298033,
"epoch": 0.7080745341614907,
"grad_norm": 1.4531834125518799,
"learning_rate": 1.9357168190404937e-05,
"loss": 0.08149978518486023,
"mean_token_accuracy": 0.9809109061956406,
"num_tokens": 2545700.0,
"step": 570
},
{
"entropy": 2.121944713592529,
"epoch": 0.7204968944099379,
"grad_norm": 0.1272820085287094,
"learning_rate": 1.932847917528227e-05,
"loss": 0.09725183248519897,
"mean_token_accuracy": 0.9799433529376984,
"num_tokens": 2587599.0,
"step": 580
},
{
"entropy": 2.0991091817617415,
"epoch": 0.7329192546583851,
"grad_norm": 4.6163530349731445,
"learning_rate": 1.9299186088264728e-05,
"loss": 0.07552647590637207,
"mean_token_accuracy": 0.9778737679123879,
"num_tokens": 2632497.0,
"step": 590
},
{
"entropy": 2.1005853712558746,
"epoch": 0.7453416149068323,
"grad_norm": 4.137128829956055,
"learning_rate": 1.9269290826245713e-05,
"loss": 0.09553526043891906,
"mean_token_accuracy": 0.9701759338378906,
"num_tokens": 2677204.0,
"step": 600
},
{
"entropy": 2.1062012016773224,
"epoch": 0.7577639751552795,
"grad_norm": 1.1038886308670044,
"learning_rate": 1.9238795325112867e-05,
"loss": 0.08808867931365967,
"mean_token_accuracy": 0.9731768816709518,
"num_tokens": 2726745.0,
"step": 610
},
{
"entropy": 2.1135039806365965,
"epoch": 0.7701863354037267,
"grad_norm": 2.838488817214966,
"learning_rate": 1.9207701559622724e-05,
"loss": 0.05545814037322998,
"mean_token_accuracy": 0.9834772542119026,
"num_tokens": 2767898.0,
"step": 620
},
{
"entropy": 2.056372728943825,
"epoch": 0.782608695652174,
"grad_norm": 7.393406391143799,
"learning_rate": 1.9176011543272815e-05,
"loss": 0.11480764150619507,
"mean_token_accuracy": 0.9796148985624313,
"num_tokens": 2812697.0,
"step": 630
},
{
"entropy": 2.0691574245691298,
"epoch": 0.7950310559006211,
"grad_norm": 6.208304405212402,
"learning_rate": 1.91437273281713e-05,
"loss": 0.11305643320083618,
"mean_token_accuracy": 0.974467147886753,
"num_tokens": 2855947.0,
"step": 640
},
{
"entropy": 2.0940282166004183,
"epoch": 0.8074534161490683,
"grad_norm": 1.7314088344573975,
"learning_rate": 1.9110851004904076e-05,
"loss": 0.13724110126495362,
"mean_token_accuracy": 0.9700473248958588,
"num_tokens": 2906029.0,
"step": 650
},
{
"entropy": 2.0931085854768754,
"epoch": 0.8198757763975155,
"grad_norm": 2.535383939743042,
"learning_rate": 1.9077384702399396e-05,
"loss": 0.06062517762184143,
"mean_token_accuracy": 0.9809448182582855,
"num_tokens": 2952756.0,
"step": 660
},
{
"entropy": 2.0389942497015,
"epoch": 0.8322981366459627,
"grad_norm": 2.38712739944458,
"learning_rate": 1.9043330587790016e-05,
"loss": 0.07465954422950745,
"mean_token_accuracy": 0.9777025073766709,
"num_tokens": 2996532.0,
"step": 670
},
{
"entropy": 2.017015664279461,
"epoch": 0.84472049689441,
"grad_norm": 2.4707024097442627,
"learning_rate": 1.9008690866272856e-05,
"loss": 0.09084809422492982,
"mean_token_accuracy": 0.9794181376695633,
"num_tokens": 3043785.0,
"step": 680
},
{
"entropy": 2.059348088502884,
"epoch": 0.8571428571428571,
"grad_norm": 5.584771156311035,
"learning_rate": 1.89734677809662e-05,
"loss": 0.04494470953941345,
"mean_token_accuracy": 0.9811143398284912,
"num_tokens": 3087397.0,
"step": 690
},
{
"entropy": 2.100178116559982,
"epoch": 0.8695652173913043,
"grad_norm": 9.014580726623535,
"learning_rate": 1.8937663612764446e-05,
"loss": 0.05163530111312866,
"mean_token_accuracy": 0.9877288997173309,
"num_tokens": 3132304.0,
"step": 700
},
{
"entropy": 2.0874249041080475,
"epoch": 0.8819875776397516,
"grad_norm": 3.579822540283203,
"learning_rate": 1.8901280680190405e-05,
"loss": 0.3258012533187866,
"mean_token_accuracy": 0.955612650513649,
"num_tokens": 3174559.0,
"step": 710
},
{
"entropy": 2.0551782071590425,
"epoch": 0.8944099378881988,
"grad_norm": 4.217214107513428,
"learning_rate": 1.8864321339245148e-05,
"loss": 0.10493965148925781,
"mean_token_accuracy": 0.9790847629308701,
"num_tokens": 3218648.0,
"step": 720
},
{
"entropy": 2.1269098341465,
"epoch": 0.906832298136646,
"grad_norm": 3.0778424739837646,
"learning_rate": 1.8826787983255474e-05,
"loss": 0.07121096849441529,
"mean_token_accuracy": 0.9841245651245117,
"num_tokens": 3258619.0,
"step": 730
},
{
"entropy": 2.196052446961403,
"epoch": 0.9192546583850931,
"grad_norm": 1.9955366849899292,
"learning_rate": 1.87886830427189e-05,
"loss": 0.07663369774818421,
"mean_token_accuracy": 0.9771979004144669,
"num_tokens": 3299305.0,
"step": 740
},
{
"entropy": 2.1504336088895797,
"epoch": 0.9316770186335404,
"grad_norm": 0.28726229071617126,
"learning_rate": 1.8750008985146277e-05,
"loss": 0.09686735272407532,
"mean_token_accuracy": 0.9818914562463761,
"num_tokens": 3341352.0,
"step": 750
},
{
"entropy": 2.124210861325264,
"epoch": 0.9440993788819876,
"grad_norm": 0.5584977269172668,
"learning_rate": 1.8710768314902018e-05,
"loss": 0.041911613941192624,
"mean_token_accuracy": 0.9888250693678856,
"num_tokens": 3388572.0,
"step": 760
},
{
"entropy": 2.162134176492691,
"epoch": 0.9565217391304348,
"grad_norm": 0.7624562382698059,
"learning_rate": 1.867096357304191e-05,
"loss": 0.06633872389793397,
"mean_token_accuracy": 0.9857817873358726,
"num_tokens": 3431740.0,
"step": 770
},
{
"entropy": 2.1005555152893067,
"epoch": 0.968944099378882,
"grad_norm": 2.72621750831604,
"learning_rate": 1.8630597337148582e-05,
"loss": 0.04687671065330505,
"mean_token_accuracy": 0.9858215063810348,
"num_tokens": 3483799.0,
"step": 780
},
{
"entropy": 2.0882847398519515,
"epoch": 0.9813664596273292,
"grad_norm": 1.5134168863296509,
"learning_rate": 1.8589672221164578e-05,
"loss": 0.05004507303237915,
"mean_token_accuracy": 0.9874317914247512,
"num_tokens": 3530053.0,
"step": 790
},
{
"entropy": 2.097977989912033,
"epoch": 0.9937888198757764,
"grad_norm": 0.2564803659915924,
"learning_rate": 1.85481908752231e-05,
"loss": 0.0792747676372528,
"mean_token_accuracy": 0.9824414849281311,
"num_tokens": 3581288.0,
"step": 800
},
{
"entropy": 2.081494650244713,
"epoch": 1.0062111801242235,
"grad_norm": 1.7785015106201172,
"learning_rate": 1.8506155985476386e-05,
"loss": 0.058735990524291994,
"mean_token_accuracy": 0.9833749994635582,
"num_tokens": 3629656.0,
"step": 810
},
{
"entropy": 2.0798818826675416,
"epoch": 1.0186335403726707,
"grad_norm": 0.17327219247817993,
"learning_rate": 1.8463570273921777e-05,
"loss": 0.012010685354471206,
"mean_token_accuracy": 0.9959963768720627,
"num_tokens": 3676785.0,
"step": 820
},
{
"entropy": 2.0705758064985273,
"epoch": 1.031055900621118,
"grad_norm": 0.6708211898803711,
"learning_rate": 1.8420436498225446e-05,
"loss": 0.029526194930076598,
"mean_token_accuracy": 0.9904356062412262,
"num_tokens": 3719647.0,
"step": 830
},
{
"entropy": 2.083918330073357,
"epoch": 1.0434782608695652,
"grad_norm": 0.1544179767370224,
"learning_rate": 1.8376757451543827e-05,
"loss": 0.05709845423698425,
"mean_token_accuracy": 0.9897336810827255,
"num_tokens": 3762547.0,
"step": 840
},
{
"entropy": 2.110027256608009,
"epoch": 1.0559006211180124,
"grad_norm": 4.642289161682129,
"learning_rate": 1.8332535962342738e-05,
"loss": 0.03640684187412262,
"mean_token_accuracy": 0.9888481795787811,
"num_tokens": 3804605.0,
"step": 850
},
{
"entropy": 2.0938026130199434,
"epoch": 1.0683229813664596,
"grad_norm": 0.21419347822666168,
"learning_rate": 1.828777489421423e-05,
"loss": 0.03816946446895599,
"mean_token_accuracy": 0.9911127641797066,
"num_tokens": 3848041.0,
"step": 860
},
{
"entropy": 2.024568662047386,
"epoch": 1.0807453416149069,
"grad_norm": 3.198349952697754,
"learning_rate": 1.824247714569114e-05,
"loss": 0.10569311380386352,
"mean_token_accuracy": 0.9802387565374374,
"num_tokens": 3892052.0,
"step": 870
},
{
"entropy": 2.046171006560326,
"epoch": 1.093167701863354,
"grad_norm": 3.6660497188568115,
"learning_rate": 1.8196645650059407e-05,
"loss": 0.03053833544254303,
"mean_token_accuracy": 0.9916201144456863,
"num_tokens": 3940927.0,
"step": 880
},
{
"entropy": 2.0361697018146514,
"epoch": 1.1055900621118013,
"grad_norm": 1.2115179300308228,
"learning_rate": 1.8150283375168112e-05,
"loss": 0.08387028574943542,
"mean_token_accuracy": 0.9851482644677162,
"num_tokens": 3985643.0,
"step": 890
},
{
"entropy": 2.06917799115181,
"epoch": 1.1180124223602483,
"grad_norm": 1.0747365951538086,
"learning_rate": 1.810339332323732e-05,
"loss": 0.030901220440864564,
"mean_token_accuracy": 0.9925313547253609,
"num_tokens": 4026723.0,
"step": 900
},
{
"entropy": 2.0700403451919556,
"epoch": 1.1304347826086956,
"grad_norm": 2.125000238418579,
"learning_rate": 1.8055978530663632e-05,
"loss": 0.06523830890655517,
"mean_token_accuracy": 0.9856161668896675,
"num_tokens": 4068487.0,
"step": 910
},
{
"entropy": 2.0906931340694426,
"epoch": 1.1428571428571428,
"grad_norm": 0.4668339788913727,
"learning_rate": 1.8008042067823584e-05,
"loss": 0.020703746378421782,
"mean_token_accuracy": 0.9917388156056404,
"num_tokens": 4111658.0,
"step": 920
},
{
"entropy": 2.04544812142849,
"epoch": 1.15527950310559,
"grad_norm": 0.5313199758529663,
"learning_rate": 1.7959587038874826e-05,
"loss": 0.05440770983695984,
"mean_token_accuracy": 0.9829235851764679,
"num_tokens": 4155785.0,
"step": 930
},
{
"entropy": 2.0342077732086183,
"epoch": 1.1677018633540373,
"grad_norm": 6.212786674499512,
"learning_rate": 1.791061658155509e-05,
"loss": 0.04542175531387329,
"mean_token_accuracy": 0.9873297110199928,
"num_tokens": 4203227.0,
"step": 940
},
{
"entropy": 2.063344043493271,
"epoch": 1.1801242236024845,
"grad_norm": 2.8781256675720215,
"learning_rate": 1.786113386697903e-05,
"loss": 0.02678465247154236,
"mean_token_accuracy": 0.9917070686817169,
"num_tokens": 4246203.0,
"step": 950
},
{
"entropy": 2.0039207309484484,
"epoch": 1.1925465838509317,
"grad_norm": 4.898998737335205,
"learning_rate": 1.7811142099432847e-05,
"loss": 0.03269885778427124,
"mean_token_accuracy": 0.9882596805691719,
"num_tokens": 4293923.0,
"step": 960
},
{
"entropy": 2.1546689569950104,
"epoch": 1.204968944099379,
"grad_norm": 0.16982388496398926,
"learning_rate": 1.7760644516166815e-05,
"loss": 0.01413324624300003,
"mean_token_accuracy": 0.9912873223423958,
"num_tokens": 4329772.0,
"step": 970
},
{
"entropy": 2.052805933356285,
"epoch": 1.2173913043478262,
"grad_norm": 7.0196027755737305,
"learning_rate": 1.7709644387185646e-05,
"loss": 0.05414450168609619,
"mean_token_accuracy": 0.9854385688900947,
"num_tokens": 4377093.0,
"step": 980
},
{
"entropy": 1.9994864210486412,
"epoch": 1.2298136645962732,
"grad_norm": 3.947655439376831,
"learning_rate": 1.765814501503672e-05,
"loss": 0.05991327166557312,
"mean_token_accuracy": 0.9902179941534996,
"num_tokens": 4424964.0,
"step": 990
},
{
"entropy": 2.0789844542741776,
"epoch": 1.2422360248447206,
"grad_norm": 0.5713167786598206,
"learning_rate": 1.760614973459626e-05,
"loss": 0.016869233548641206,
"mean_token_accuracy": 0.9927510812878608,
"num_tokens": 4470312.0,
"step": 1000
},
{
"epoch": 1.2422360248447206,
"eval_entropy": 1.93758956541462,
"eval_loss": 0.6518564820289612,
"eval_mean_token_accuracy": 0.8916452462894914,
"eval_num_tokens": 4470312.0,
"eval_runtime": 1016.5304,
"eval_samples_per_second": 7.527,
"eval_steps_per_second": 0.941,
"step": 1000
},
{
"entropy": 2.0249680817127227,
"epoch": 1.2546583850931676,
"grad_norm": 0.23046031594276428,
"learning_rate": 1.7553661912853348e-05,
"loss": 0.1257791757583618,
"mean_token_accuracy": 0.9823350816965103,
"num_tokens": 4514663.0,
"step": 1010
},
{
"entropy": 2.073505198955536,
"epoch": 1.2670807453416149,
"grad_norm": 1.52617609500885,
"learning_rate": 1.7500684948691917e-05,
"loss": 0.058462345600128175,
"mean_token_accuracy": 0.9881463676691056,
"num_tokens": 4556354.0,
"step": 1020
},
{
"entropy": 2.068504738807678,
"epoch": 1.279503105590062,
"grad_norm": 4.715869426727295,
"learning_rate": 1.7447222272670634e-05,
"loss": 0.07855769991874695,
"mean_token_accuracy": 0.9773707166314125,
"num_tokens": 4598771.0,
"step": 1030
},
{
"entropy": 2.019624277949333,
"epoch": 1.2919254658385093,
"grad_norm": 0.7180259227752686,
"learning_rate": 1.7393277346800766e-05,
"loss": 0.03097618222236633,
"mean_token_accuracy": 0.9947341948747634,
"num_tokens": 4645010.0,
"step": 1040
},
{
"entropy": 2.0088700890541076,
"epoch": 1.3043478260869565,
"grad_norm": 1.9578375816345215,
"learning_rate": 1.7338853664321993e-05,
"loss": 0.02723775804042816,
"mean_token_accuracy": 0.9935153171420097,
"num_tokens": 4694582.0,
"step": 1050
},
{
"entropy": 1.9856946557760238,
"epoch": 1.3167701863354038,
"grad_norm": 5.278125286102295,
"learning_rate": 1.7283954749476195e-05,
"loss": 0.11669650077819824,
"mean_token_accuracy": 0.9793488040566445,
"num_tokens": 4751436.0,
"step": 1060
},
{
"entropy": 1.9670168876647949,
"epoch": 1.329192546583851,
"grad_norm": 0.20898965001106262,
"learning_rate": 1.7228584157279242e-05,
"loss": 0.08815430998802185,
"mean_token_accuracy": 0.9805598288774491,
"num_tokens": 4798385.0,
"step": 1070
},
{
"entropy": 1.9559540659189225,
"epoch": 1.341614906832298,
"grad_norm": 8.317994117736816,
"learning_rate": 1.7172745473290788e-05,
"loss": 0.08126496076583863,
"mean_token_accuracy": 0.9816830947995185,
"num_tokens": 4848403.0,
"step": 1080
},
{
"entropy": 2.0961306214332582,
"epoch": 1.3540372670807455,
"grad_norm": 6.840373516082764,
"learning_rate": 1.711644231338208e-05,
"loss": 0.07558760643005372,
"mean_token_accuracy": 0.9923902451992035,
"num_tokens": 4892092.0,
"step": 1090
},
{
"entropy": 2.113238129019737,
"epoch": 1.3664596273291925,
"grad_norm": 0.18261918425559998,
"learning_rate": 1.705967832350182e-05,
"loss": 0.060640227794647214,
"mean_token_accuracy": 0.9944021731615067,
"num_tokens": 4934584.0,
"step": 1100
},
{
"entropy": 2.1218963980674745,
"epoch": 1.3788819875776397,
"grad_norm": 0.24410933256149292,
"learning_rate": 1.700245717944005e-05,
"loss": 0.034927898645401,
"mean_token_accuracy": 0.9925606638193131,
"num_tokens": 4970933.0,
"step": 1110
},
{
"entropy": 2.0433398693799973,
"epoch": 1.391304347826087,
"grad_norm": 1.8514246940612793,
"learning_rate": 1.6944782586590148e-05,
"loss": 0.028316974639892578,
"mean_token_accuracy": 0.9947910204529762,
"num_tokens": 5016657.0,
"step": 1120
},
{
"entropy": 2.041057598590851,
"epoch": 1.4037267080745341,
"grad_norm": 4.287439823150635,
"learning_rate": 1.6886658279708867e-05,
"loss": 0.062076061964035034,
"mean_token_accuracy": 0.9811025738716126,
"num_tokens": 5056567.0,
"step": 1130
},
{
"entropy": 2.054543226957321,
"epoch": 1.4161490683229814,
"grad_norm": 0.31882035732269287,
"learning_rate": 1.682808802267449e-05,
"loss": 0.019540122151374816,
"mean_token_accuracy": 0.9918297097086907,
"num_tokens": 5103165.0,
"step": 1140
},
{
"entropy": 2.054564669728279,
"epoch": 1.4285714285714286,
"grad_norm": 3.7651987075805664,
"learning_rate": 1.6769075608243097e-05,
"loss": 0.04563193917274475,
"mean_token_accuracy": 0.9891414448618889,
"num_tokens": 5146669.0,
"step": 1150
},
{
"entropy": 2.067859849333763,
"epoch": 1.4409937888198758,
"grad_norm": 3.467146158218384,
"learning_rate": 1.6709624857802977e-05,
"loss": 0.02285553514957428,
"mean_token_accuracy": 0.989309212565422,
"num_tokens": 5185720.0,
"step": 1160
},
{
"entropy": 2.080258083343506,
"epoch": 1.453416149068323,
"grad_norm": 2.778151273727417,
"learning_rate": 1.6649739621127147e-05,
"loss": 0.09717610478401184,
"mean_token_accuracy": 0.9798510074615479,
"num_tokens": 5227106.0,
"step": 1170
},
{
"entropy": 2.0795232325792314,
"epoch": 1.4658385093167703,
"grad_norm": 2.489095449447632,
"learning_rate": 1.658942377612408e-05,
"loss": 0.036468693614006044,
"mean_token_accuracy": 0.9870076581835747,
"num_tokens": 5275477.0,
"step": 1180
},
{
"entropy": 2.0572758257389068,
"epoch": 1.4782608695652173,
"grad_norm": 4.842057228088379,
"learning_rate": 1.6528681228586574e-05,
"loss": 0.04591853022575378,
"mean_token_accuracy": 0.9935535579919815,
"num_tokens": 5317541.0,
"step": 1190
},
{
"entropy": 2.0386213317513464,
"epoch": 1.4906832298136645,
"grad_norm": 0.03853341192007065,
"learning_rate": 1.646751591193883e-05,
"loss": 0.04719167649745941,
"mean_token_accuracy": 0.9895795121788978,
"num_tokens": 5364639.0,
"step": 1200
},
{
"entropy": 2.109779354929924,
"epoch": 1.5031055900621118,
"grad_norm": 0.3504042327404022,
"learning_rate": 1.6405931786981753e-05,
"loss": 0.01679493337869644,
"mean_token_accuracy": 0.9948511898517609,
"num_tokens": 5411310.0,
"step": 1210
},
{
"entropy": 2.0733531206846236,
"epoch": 1.515527950310559,
"grad_norm": 0.05558984726667404,
"learning_rate": 1.6343932841636455e-05,
"loss": 0.021465454995632172,
"mean_token_accuracy": 0.9935497388243675,
"num_tokens": 5453104.0,
"step": 1220
},
{
"entropy": 2.010223825275898,
"epoch": 1.5279503105590062,
"grad_norm": 0.0882689356803894,
"learning_rate": 1.6281523090686023e-05,
"loss": 0.045790371298789975,
"mean_token_accuracy": 0.99332015812397,
"num_tokens": 5504433.0,
"step": 1230
},
{
"entropy": 2.0213984131813048,
"epoch": 1.5403726708074534,
"grad_norm": 8.743528366088867,
"learning_rate": 1.6218706575515534e-05,
"loss": 0.03466806411743164,
"mean_token_accuracy": 0.9918604284524918,
"num_tokens": 5549172.0,
"step": 1240
},
{
"entropy": 2.0573623061180113,
"epoch": 1.5527950310559007,
"grad_norm": 0.21996565163135529,
"learning_rate": 1.615548736385034e-05,
"loss": 0.024254243075847625,
"mean_token_accuracy": 0.9923801437020302,
"num_tokens": 5595856.0,
"step": 1250
},
{
"entropy": 1.9642501085996629,
"epoch": 1.5652173913043477,
"grad_norm": 2.733859062194824,
"learning_rate": 1.6091869549492702e-05,
"loss": 0.050705951452255246,
"mean_token_accuracy": 0.9870995670557022,
"num_tokens": 5645176.0,
"step": 1260
},
{
"entropy": 2.0747433573007585,
"epoch": 1.5776397515527951,
"grad_norm": 1.6149920225143433,
"learning_rate": 1.602785725205663e-05,
"loss": 0.06673233509063721,
"mean_token_accuracy": 0.9812404677271843,
"num_tokens": 5690486.0,
"step": 1270
},
{
"entropy": 2.0146251261234283,
"epoch": 1.5900621118012421,
"grad_norm": 3.433781623840332,
"learning_rate": 1.5963454616701187e-05,
"loss": 0.04578670859336853,
"mean_token_accuracy": 0.989951391518116,
"num_tokens": 5735853.0,
"step": 1280
},
{
"entropy": 1.9809163212776184,
"epoch": 1.6024844720496896,
"grad_norm": 0.1651136875152588,
"learning_rate": 1.589866581386199e-05,
"loss": 0.009565576910972595,
"mean_token_accuracy": 0.9978349670767784,
"num_tokens": 5782323.0,
"step": 1290
},
{
"entropy": 2.0274841606616976,
"epoch": 1.6149068322981366,
"grad_norm": 1.8124768733978271,
"learning_rate": 1.5833495038981215e-05,
"loss": 0.019991911947727203,
"mean_token_accuracy": 0.9955646678805351,
"num_tokens": 5827941.0,
"step": 1300
},
{
"entropy": 2.0407049506902695,
"epoch": 1.6273291925465838,
"grad_norm": 5.722525119781494,
"learning_rate": 1.5767946512235885e-05,
"loss": 0.06694766879081726,
"mean_token_accuracy": 0.9827992141246795,
"num_tokens": 5869720.0,
"step": 1310
},
{
"entropy": 2.054254913330078,
"epoch": 1.639751552795031,
"grad_norm": 0.08413979411125183,
"learning_rate": 1.5702024478264596e-05,
"loss": 0.02567650079727173,
"mean_token_accuracy": 0.9888634070754051,
"num_tokens": 5915859.0,
"step": 1320
},
{
"entropy": 1.986069232225418,
"epoch": 1.6521739130434783,
"grad_norm": 3.2810375690460205,
"learning_rate": 1.5635733205892653e-05,
"loss": 0.028512659668922424,
"mean_token_accuracy": 0.9913915023207664,
"num_tokens": 5962619.0,
"step": 1330
},
{
"entropy": 2.0707494646310804,
"epoch": 1.6645962732919255,
"grad_norm": 0.07080954313278198,
"learning_rate": 1.5569076987855645e-05,
"loss": 0.022223152220249176,
"mean_token_accuracy": 0.9936053708195687,
"num_tokens": 6005344.0,
"step": 1340
},
{
"entropy": 2.025489088892937,
"epoch": 1.6770186335403725,
"grad_norm": 5.966955661773682,
"learning_rate": 1.5502060140521454e-05,
"loss": 0.02077590525150299,
"mean_token_accuracy": 0.9918732196092606,
"num_tokens": 6048095.0,
"step": 1350
},
{
"entropy": 2.0773544281721117,
"epoch": 1.68944099378882,
"grad_norm": 3.3871872425079346,
"learning_rate": 1.543468700361076e-05,
"loss": 0.05042000412940979,
"mean_token_accuracy": 0.9922097563743592,
"num_tokens": 6091599.0,
"step": 1360
},
{
"entropy": 2.0988358676433565,
"epoch": 1.701863354037267,
"grad_norm": 2.538235902786255,
"learning_rate": 1.536696193991601e-05,
"loss": 0.03595686256885529,
"mean_token_accuracy": 0.9918700397014618,
"num_tokens": 6130885.0,
"step": 1370
},
{
"entropy": 2.120113742351532,
"epoch": 1.7142857142857144,
"grad_norm": 1.560457706451416,
"learning_rate": 1.5298889335018895e-05,
"loss": 0.007060723751783371,
"mean_token_accuracy": 0.9989130437374115,
"num_tokens": 6177827.0,
"step": 1380
},
{
"entropy": 2.1228767782449722,
"epoch": 1.7267080745341614,
"grad_norm": 0.20773983001708984,
"learning_rate": 1.5230473597006384e-05,
"loss": 0.0372874915599823,
"mean_token_accuracy": 0.9817194625735283,
"num_tokens": 6219816.0,
"step": 1390
},
{
"entropy": 2.0721586614847185,
"epoch": 1.7391304347826086,
"grad_norm": 0.2652308940887451,
"learning_rate": 1.5161719156185253e-05,
"loss": 0.04619762003421783,
"mean_token_accuracy": 0.9939772725105286,
"num_tokens": 6267673.0,
"step": 1400
},
{
"entropy": 2.052675449848175,
"epoch": 1.7515527950310559,
"grad_norm": 0.06336406618356705,
"learning_rate": 1.5092630464795202e-05,
"loss": 0.03301122784614563,
"mean_token_accuracy": 0.9891937226057053,
"num_tokens": 6314073.0,
"step": 1410
},
{
"entropy": 2.1229291677474977,
"epoch": 1.763975155279503,
"grad_norm": 2.1714088916778564,
"learning_rate": 1.5023211996720558e-05,
"loss": 0.008769268542528153,
"mean_token_accuracy": 0.9979967936873436,
"num_tokens": 6352274.0,
"step": 1420
},
{
"entropy": 2.1219181925058366,
"epoch": 1.7763975155279503,
"grad_norm": 2.3357884883880615,
"learning_rate": 1.4953468247200542e-05,
"loss": 0.031093907356262208,
"mean_token_accuracy": 0.9895014673471451,
"num_tokens": 6393662.0,
"step": 1430
},
{
"entropy": 2.0373534232378008,
"epoch": 1.7888198757763976,
"grad_norm": 0.3844815790653229,
"learning_rate": 1.4883403732538208e-05,
"loss": 0.026946166157722475,
"mean_token_accuracy": 0.9952634528279305,
"num_tokens": 6445853.0,
"step": 1440
},
{
"entropy": 2.100069361925125,
"epoch": 1.8012422360248448,
"grad_norm": 5.393243789672852,
"learning_rate": 1.4813022989807964e-05,
"loss": 0.061344707012176515,
"mean_token_accuracy": 0.9873241350054741,
"num_tokens": 6491025.0,
"step": 1450
},
{
"entropy": 2.137248122692108,
"epoch": 1.8136645962732918,
"grad_norm": 0.07023269683122635,
"learning_rate": 1.4742330576561776e-05,
"loss": 0.06469428539276123,
"mean_token_accuracy": 0.9903487995266914,
"num_tokens": 6530707.0,
"step": 1460
},
{
"entropy": 2.121686002612114,
"epoch": 1.8260869565217392,
"grad_norm": 4.548147201538086,
"learning_rate": 1.4671331070534046e-05,
"loss": 0.01620122790336609,
"mean_token_accuracy": 0.9988372087478637,
"num_tokens": 6576494.0,
"step": 1470
},
{
"entropy": 2.0570311337709426,
"epoch": 1.8385093167701863,
"grad_norm": 0.04442490264773369,
"learning_rate": 1.4600029069345171e-05,
"loss": 0.013120083510875702,
"mean_token_accuracy": 0.9956349208950996,
"num_tokens": 6619890.0,
"step": 1480
},
{
"entropy": 2.1113452911376953,
"epoch": 1.8509316770186337,
"grad_norm": 1.212381362915039,
"learning_rate": 1.4528429190203826e-05,
"loss": 0.04590463638305664,
"mean_token_accuracy": 0.9906466111540795,
"num_tokens": 6662456.0,
"step": 1490
},
{
"entropy": 2.039040079712868,
"epoch": 1.8633540372670807,
"grad_norm": 0.4518345594406128,
"learning_rate": 1.445653606960797e-05,
"loss": 0.022520086169242857,
"mean_token_accuracy": 0.9937344387173652,
"num_tokens": 6709587.0,
"step": 1500
},
{
"epoch": 1.8633540372670807,
"eval_entropy": 1.9391227429937046,
"eval_loss": 0.6151674389839172,
"eval_mean_token_accuracy": 0.9007952373976992,
"eval_num_tokens": 6709587.0,
"eval_runtime": 1015.8442,
"eval_samples_per_second": 7.532,
"eval_steps_per_second": 0.942,
"step": 1500
},
{
"entropy": 2.117081579566002,
"epoch": 1.875776397515528,
"grad_norm": 0.06551311165094376,
"learning_rate": 1.4384354363044611e-05,
"loss": 0.051976734399795534,
"mean_token_accuracy": 0.9881994038820267,
"num_tokens": 6750511.0,
"step": 1510
},
{
"entropy": 2.098040521144867,
"epoch": 1.8881987577639752,
"grad_norm": 0.423195481300354,
"learning_rate": 1.4311888744688331e-05,
"loss": 0.023100055754184723,
"mean_token_accuracy": 0.996203102171421,
"num_tokens": 6789920.0,
"step": 1520
},
{
"entropy": 2.061115252971649,
"epoch": 1.9006211180124224,
"grad_norm": 6.247063636779785,
"learning_rate": 1.423914390709861e-05,
"loss": 0.0642433762550354,
"mean_token_accuracy": 0.9834059119224549,
"num_tokens": 6832649.0,
"step": 1530
},
{
"entropy": 2.0606234312057494,
"epoch": 1.9130434782608696,
"grad_norm": 0.05942244082689285,
"learning_rate": 1.4166124560915957e-05,
"loss": 0.015473641455173492,
"mean_token_accuracy": 0.9945833340287209,
"num_tokens": 6877860.0,
"step": 1540
},
{
"entropy": 2.1109096825122835,
"epoch": 1.9254658385093166,
"grad_norm": 3.235588788986206,
"learning_rate": 1.4092835434556866e-05,
"loss": 0.043846017122268675,
"mean_token_accuracy": 0.9893042847514153,
"num_tokens": 6928094.0,
"step": 1550
},
{
"entropy": 2.012011078000069,
"epoch": 1.937888198757764,
"grad_norm": 3.570309638977051,
"learning_rate": 1.4019281273907627e-05,
"loss": 0.010611482709646226,
"mean_token_accuracy": 0.9952083334326745,
"num_tokens": 6978174.0,
"step": 1560
},
{
"entropy": 2.0667447626590727,
"epoch": 1.950310559006211,
"grad_norm": 2.992898464202881,
"learning_rate": 1.394546684201701e-05,
"loss": 0.020136520266532898,
"mean_token_accuracy": 0.9959304377436637,
"num_tokens": 7027412.0,
"step": 1570
},
{
"entropy": 2.1080401957035066,
"epoch": 1.9627329192546585,
"grad_norm": 0.05407049506902695,
"learning_rate": 1.3871396918787812e-05,
"loss": 0.016931670904159545,
"mean_token_accuracy": 0.9919893622398377,
"num_tokens": 7074053.0,
"step": 1580
},
{
"entropy": 2.0816223949193953,
"epoch": 1.9751552795031055,
"grad_norm": 0.11757466942071915,
"learning_rate": 1.3797076300667345e-05,
"loss": 0.02696256935596466,
"mean_token_accuracy": 0.9966979950666428,
"num_tokens": 7119277.0,
"step": 1590
},
{
"entropy": 2.0723426222801207,
"epoch": 1.9875776397515528,
"grad_norm": 0.9365509748458862,
"learning_rate": 1.3722509800336838e-05,
"loss": 0.012552569806575774,
"mean_token_accuracy": 0.9961967542767525,
"num_tokens": 7168606.0,
"step": 1600
},
{
"entropy": 2.086591383814812,
"epoch": 2.0,
"grad_norm": 0.20105956494808197,
"learning_rate": 1.3647702246399787e-05,
"loss": 0.02122708112001419,
"mean_token_accuracy": 0.9936253562569618,
"num_tokens": 7207712.0,
"step": 1610
},
{
"entropy": 2.0814583867788317,
"epoch": 2.012422360248447,
"grad_norm": 3.1069884300231934,
"learning_rate": 1.3572658483069275e-05,
"loss": 0.023302927613258362,
"mean_token_accuracy": 0.9970308855175972,
"num_tokens": 7254589.0,
"step": 1620
},
{
"entropy": 2.125543528795242,
"epoch": 2.0248447204968945,
"grad_norm": 0.14501716196537018,
"learning_rate": 1.3497383369854277e-05,
"loss": 0.02721119225025177,
"mean_token_accuracy": 0.9959090918302536,
"num_tokens": 7295210.0,
"step": 1630
},
{
"entropy": 2.0380464106798173,
"epoch": 2.0372670807453415,
"grad_norm": 0.07213692367076874,
"learning_rate": 1.3421881781244995e-05,
"loss": 0.0014440644532442092,
"mean_token_accuracy": 1.0,
"num_tokens": 7343229.0,
"step": 1640
},
{
"entropy": 2.0552190840244293,
"epoch": 2.049689440993789,
"grad_norm": 0.29290318489074707,
"learning_rate": 1.3346158606397182e-05,
"loss": 0.024383768439292908,
"mean_token_accuracy": 0.9936682999134063,
"num_tokens": 7388308.0,
"step": 1650
},
{
"entropy": 1.9938734024763107,
"epoch": 2.062111801242236,
"grad_norm": 0.05942467227578163,
"learning_rate": 1.327021874881557e-05,
"loss": 0.0024633878841996194,
"mean_token_accuracy": 1.0,
"num_tokens": 7439948.0,
"step": 1660
},
{
"entropy": 2.086641189455986,
"epoch": 2.0745341614906834,
"grad_norm": 1.3043140172958374,
"learning_rate": 1.3194067126036317e-05,
"loss": 0.02244780957698822,
"mean_token_accuracy": 0.9969155848026275,
"num_tokens": 7486497.0,
"step": 1670
},
{
"entropy": 2.07209207713604,
"epoch": 2.0869565217391304,
"grad_norm": 0.6853761672973633,
"learning_rate": 1.3117708669308577e-05,
"loss": 0.013260528445243835,
"mean_token_accuracy": 0.9945779204368591,
"num_tokens": 7527807.0,
"step": 1680
},
{
"entropy": 2.0046075344085694,
"epoch": 2.099378881987578,
"grad_norm": 0.18696783483028412,
"learning_rate": 1.3041148323275182e-05,
"loss": 0.0024597344920039175,
"mean_token_accuracy": 1.0,
"num_tokens": 7583037.0,
"step": 1690
},
{
"entropy": 2.011264589428902,
"epoch": 2.111801242236025,
"grad_norm": 3.760758399963379,
"learning_rate": 1.2964391045652431e-05,
"loss": 0.024358910322189332,
"mean_token_accuracy": 0.9940446645021439,
"num_tokens": 7627313.0,
"step": 1700
},
{
"entropy": 2.1516319900751113,
"epoch": 2.124223602484472,
"grad_norm": 4.213773250579834,
"learning_rate": 1.2887441806909071e-05,
"loss": 0.008242494612932205,
"mean_token_accuracy": 0.9970352560281753,
"num_tokens": 7665191.0,
"step": 1710
},
{
"entropy": 2.134421792626381,
"epoch": 2.1366459627329193,
"grad_norm": 0.34656691551208496,
"learning_rate": 1.281030558994441e-05,
"loss": 0.003566844016313553,
"mean_token_accuracy": 0.9993055552244187,
"num_tokens": 7704708.0,
"step": 1720
},
{
"entropy": 2.086806279420853,
"epoch": 2.1490683229813663,
"grad_norm": 0.5496445298194885,
"learning_rate": 1.2732987389765659e-05,
"loss": 0.011695029586553574,
"mean_token_accuracy": 0.9959415584802628,
"num_tokens": 7750499.0,
"step": 1730
},
{
"entropy": 2.025625595450401,
"epoch": 2.1614906832298137,
"grad_norm": 4.21989631652832,
"learning_rate": 1.2655492213164468e-05,
"loss": 0.00867307037115097,
"mean_token_accuracy": 0.9970328286290169,
"num_tokens": 7797939.0,
"step": 1740
},
{
"entropy": 2.0385482728481295,
"epoch": 2.1739130434782608,
"grad_norm": 0.4632386565208435,
"learning_rate": 1.2577825078392727e-05,
"loss": 0.02321777492761612,
"mean_token_accuracy": 0.992535850405693,
"num_tokens": 7849330.0,
"step": 1750
},
{
"entropy": 1.9963646829128265,
"epoch": 2.186335403726708,
"grad_norm": 0.42986103892326355,
"learning_rate": 1.249999101483758e-05,
"loss": 0.005663960799574852,
"mean_token_accuracy": 0.997916667163372,
"num_tokens": 7896007.0,
"step": 1760
},
{
"entropy": 2.06232088804245,
"epoch": 2.198757763975155,
"grad_norm": 1.872363567352295,
"learning_rate": 1.2421995062695758e-05,
"loss": 0.004401819780468941,
"mean_token_accuracy": 1.0,
"num_tokens": 7940343.0,
"step": 1770
},
{
"entropy": 2.102313169836998,
"epoch": 2.2111801242236027,
"grad_norm": 0.025104807689785957,
"learning_rate": 1.2343842272647202e-05,
"loss": 0.005491552874445915,
"mean_token_accuracy": 0.9980357140302658,
"num_tokens": 7986234.0,
"step": 1780
},
{
"entropy": 2.112947568297386,
"epoch": 2.2236024844720497,
"grad_norm": 2.1959307193756104,
"learning_rate": 1.2265537705527983e-05,
"loss": 0.026379427313804625,
"mean_token_accuracy": 0.9976111099123954,
"num_tokens": 8026988.0,
"step": 1790
},
{
"entropy": 2.0979381293058394,
"epoch": 2.2360248447204967,
"grad_norm": 1.1758487224578857,
"learning_rate": 1.2187086432002614e-05,
"loss": 0.03560973107814789,
"mean_token_accuracy": 0.9908891677856445,
"num_tokens": 8066827.0,
"step": 1800
},
{
"entropy": 2.054467257857323,
"epoch": 2.248447204968944,
"grad_norm": 2.9439423084259033,
"learning_rate": 1.2108493532235665e-05,
"loss": 0.011456061899662019,
"mean_token_accuracy": 0.9971509978175164,
"num_tokens": 8111916.0,
"step": 1810
},
{
"entropy": 2.1217318147420885,
"epoch": 2.260869565217391,
"grad_norm": 0.04024887830018997,
"learning_rate": 1.2029764095562817e-05,
"loss": 0.006869207322597504,
"mean_token_accuracy": 0.9985430747270584,
"num_tokens": 8150510.0,
"step": 1820
},
{
"entropy": 2.039259508252144,
"epoch": 2.2732919254658386,
"grad_norm": 0.028114071115851402,
"learning_rate": 1.1950903220161286e-05,
"loss": 0.012260539829730988,
"mean_token_accuracy": 0.996547618508339,
"num_tokens": 8201549.0,
"step": 1830
},
{
"entropy": 2.029066079854965,
"epoch": 2.2857142857142856,
"grad_norm": 0.17401359975337982,
"learning_rate": 1.1871916012719686e-05,
"loss": 0.005470449849963188,
"mean_token_accuracy": 0.9954545453190804,
"num_tokens": 8246986.0,
"step": 1840
},
{
"entropy": 2.0671174854040144,
"epoch": 2.298136645962733,
"grad_norm": 0.01771964691579342,
"learning_rate": 1.1792807588107358e-05,
"loss": 0.008678821474313736,
"mean_token_accuracy": 0.9980823859572411,
"num_tokens": 8293655.0,
"step": 1850
},
{
"entropy": 2.044488273561001,
"epoch": 2.31055900621118,
"grad_norm": 0.19449250400066376,
"learning_rate": 1.1713583069043134e-05,
"loss": 0.00978265181183815,
"mean_token_accuracy": 0.9980962634086609,
"num_tokens": 8340795.0,
"step": 1860
},
{
"entropy": 2.060883978009224,
"epoch": 2.3229813664596275,
"grad_norm": 0.533935010433197,
"learning_rate": 1.1634247585763617e-05,
"loss": 0.020505291223526,
"mean_token_accuracy": 0.996217104792595,
"num_tokens": 8381916.0,
"step": 1870
},
{
"entropy": 2.085965710878372,
"epoch": 2.3354037267080745,
"grad_norm": 0.0371839813888073,
"learning_rate": 1.1554806275690977e-05,
"loss": 0.04419526159763336,
"mean_token_accuracy": 0.9922267541289329,
"num_tokens": 8426453.0,
"step": 1880
},
{
"entropy": 2.062951362133026,
"epoch": 2.3478260869565215,
"grad_norm": 0.05953945219516754,
"learning_rate": 1.1475264283100271e-05,
"loss": 0.0023886462673544883,
"mean_token_accuracy": 1.0,
"num_tokens": 8474710.0,
"step": 1890
},
{
"entropy": 2.0459433823823927,
"epoch": 2.360248447204969,
"grad_norm": 2.6267354488372803,
"learning_rate": 1.1395626758786311e-05,
"loss": 0.0284033864736557,
"mean_token_accuracy": 0.9925563052296639,
"num_tokens": 8523232.0,
"step": 1900
},
{
"entropy": 2.0337260574102403,
"epoch": 2.372670807453416,
"grad_norm": 0.008924540132284164,
"learning_rate": 1.131589885973014e-05,
"loss": 0.02596815228462219,
"mean_token_accuracy": 0.9954166665673256,
"num_tokens": 8567783.0,
"step": 1910
},
{
"entropy": 2.083550325036049,
"epoch": 2.3850931677018634,
"grad_norm": 3.9523518085479736,
"learning_rate": 1.1236085748765065e-05,
"loss": 0.021181216835975646,
"mean_token_accuracy": 0.9891853407025337,
"num_tokens": 8609451.0,
"step": 1920
},
{
"entropy": 2.1075416803359985,
"epoch": 2.3975155279503104,
"grad_norm": 5.226478576660156,
"learning_rate": 1.1156192594242359e-05,
"loss": 0.029014191031455992,
"mean_token_accuracy": 0.9930989995598793,
"num_tokens": 8650617.0,
"step": 1930
},
{
"entropy": 2.074365347623825,
"epoch": 2.409937888198758,
"grad_norm": 0.37940314412117004,
"learning_rate": 1.1076224569696566e-05,
"loss": 0.008748483657836915,
"mean_token_accuracy": 0.9977179482579231,
"num_tokens": 8693151.0,
"step": 1940
},
{
"entropy": 2.066782546043396,
"epoch": 2.422360248447205,
"grad_norm": 1.8503516912460327,
"learning_rate": 1.0996186853510483e-05,
"loss": 0.02327302247285843,
"mean_token_accuracy": 0.995456175506115,
"num_tokens": 8736089.0,
"step": 1950
},
{
"entropy": 2.0815196603536608,
"epoch": 2.4347826086956523,
"grad_norm": 0.10152150690555573,
"learning_rate": 1.091608462857984e-05,
"loss": 0.01696925759315491,
"mean_token_accuracy": 0.9941277459263802,
"num_tokens": 8779773.0,
"step": 1960
},
{
"entropy": 2.0931368678808213,
"epoch": 2.4472049689440993,
"grad_norm": 0.5757278800010681,
"learning_rate": 1.0835923081977673e-05,
"loss": 0.008439820259809494,
"mean_token_accuracy": 0.9977225676178932,
"num_tokens": 8824281.0,
"step": 1970
},
{
"entropy": 2.092051011323929,
"epoch": 2.4596273291925463,
"grad_norm": 2.9547672271728516,
"learning_rate": 1.0755707404618432e-05,
"loss": 0.014160393178462983,
"mean_token_accuracy": 0.9984834551811218,
"num_tokens": 8871263.0,
"step": 1980
},
{
"entropy": 2.1631635636091233,
"epoch": 2.472049689440994,
"grad_norm": 0.1473511904478073,
"learning_rate": 1.0675442790921845e-05,
"loss": 0.004312780871987343,
"mean_token_accuracy": 0.9966666668653488,
"num_tokens": 8912516.0,
"step": 1990
},
{
"entropy": 2.0735503882169724,
"epoch": 2.4844720496894412,
"grad_norm": 0.07361020892858505,
"learning_rate": 1.0595134438476535e-05,
"loss": 0.009844847768545151,
"mean_token_accuracy": 0.9948893085122108,
"num_tokens": 8957449.0,
"step": 2000
},
{
"epoch": 2.4844720496894412,
"eval_entropy": 1.9350422568455758,
"eval_loss": 0.6755263209342957,
"eval_mean_token_accuracy": 0.900690189349614,
"eval_num_tokens": 8957449.0,
"eval_runtime": 1016.7085,
"eval_samples_per_second": 7.525,
"eval_steps_per_second": 0.941,
"step": 2000
},
{
"entropy": 1.9889907732605934,
"epoch": 2.4968944099378882,
"grad_norm": 0.042838554829359055,
"learning_rate": 1.0514787547703466e-05,
"loss": 0.003820537030696869,
"mean_token_accuracy": 0.9974747464060784,
"num_tokens": 9004148.0,
"step": 2010
},
{
"entropy": 1.994002103805542,
"epoch": 2.5093167701863353,
"grad_norm": 0.008305537514388561,
"learning_rate": 1.0434407321519174e-05,
"loss": 0.00935748741030693,
"mean_token_accuracy": 0.9960200980305671,
"num_tokens": 9052196.0,
"step": 2020
},
{
"entropy": 2.0162607550621034,
"epoch": 2.5217391304347827,
"grad_norm": 1.709023118019104,
"learning_rate": 1.0353998964998852e-05,
"loss": 0.01086588203907013,
"mean_token_accuracy": 0.9958574876189232,
"num_tokens": 9095641.0,
"step": 2030
},
{
"entropy": 2.0208642780780792,
"epoch": 2.5341614906832297,
"grad_norm": 1.5418806076049805,
"learning_rate": 1.027356768503929e-05,
"loss": 0.0025530509650707246,
"mean_token_accuracy": 1.0,
"num_tokens": 9142325.0,
"step": 2040
},
{
"entropy": 1.988822239637375,
"epoch": 2.546583850931677,
"grad_norm": 0.02914745733141899,
"learning_rate": 1.0193118690021699e-05,
"loss": 0.01600893437862396,
"mean_token_accuracy": 0.9974712640047073,
"num_tokens": 9187635.0,
"step": 2050
},
{
"entropy": 2.1130143284797667,
"epoch": 2.559006211180124,
"grad_norm": 0.18256570398807526,
"learning_rate": 1.0112657189474453e-05,
"loss": 0.005916472524404526,
"mean_token_accuracy": 0.9978422611951828,
"num_tokens": 9230956.0,
"step": 2060
},
{
"entropy": 2.0859414279460906,
"epoch": 2.571428571428571,
"grad_norm": 0.028967536985874176,
"learning_rate": 1.003218839373571e-05,
"loss": 0.013482299447059632,
"mean_token_accuracy": 0.9957247704267502,
"num_tokens": 9272039.0,
"step": 2070
},
{
"entropy": 2.018462461233139,
"epoch": 2.5838509316770186,
"grad_norm": 0.3704102337360382,
"learning_rate": 9.95171751361605e-06,
"loss": 0.01167006641626358,
"mean_token_accuracy": 0.9949074074625969,
"num_tokens": 9316072.0,
"step": 2080
},
{
"entropy": 2.115574726462364,
"epoch": 2.596273291925466,
"grad_norm": 0.4194943904876709,
"learning_rate": 9.87124976006102e-06,
"loss": 0.0006253823637962341,
"mean_token_accuracy": 1.0,
"num_tokens": 9354792.0,
"step": 2090
},
{
"entropy": 2.0909915775060655,
"epoch": 2.608695652173913,
"grad_norm": 0.0066429125145077705,
"learning_rate": 9.790790343813704e-06,
"loss": 0.003978141024708748,
"mean_token_accuracy": 1.0,
"num_tokens": 9396911.0,
"step": 2100
},
{
"entropy": 2.0067518442869186,
"epoch": 2.62111801242236,
"grad_norm": 0.008789177983999252,
"learning_rate": 9.710344475077305e-06,
"loss": 0.01789900064468384,
"mean_token_accuracy": 0.9949579834938049,
"num_tokens": 9442756.0,
"step": 2110
},
{
"entropy": 2.0730466544628143,
"epoch": 2.6335403726708075,
"grad_norm": 1.8757554292678833,
"learning_rate": 9.629917363177737e-06,
"loss": 0.005894383788108826,
"mean_token_accuracy": 0.9960317462682724,
"num_tokens": 9488065.0,
"step": 2120
},
{
"entropy": 2.007842016220093,
"epoch": 2.6459627329192545,
"grad_norm": 3.2601473331451416,
"learning_rate": 9.549514216226312e-06,
"loss": 0.009530902653932572,
"mean_token_accuracy": 0.994273892045021,
"num_tokens": 9537549.0,
"step": 2130
},
{
"entropy": 2.005715015530586,
"epoch": 2.658385093167702,
"grad_norm": 0.08396615087985992,
"learning_rate": 9.469140240782478e-06,
"loss": 0.015502755343914033,
"mean_token_accuracy": 0.995985135436058,
"num_tokens": 9583324.0,
"step": 2140
},
{
"entropy": 2.0230127543210985,
"epoch": 2.670807453416149,
"grad_norm": 0.5364155173301697,
"learning_rate": 9.388800641516644e-06,
"loss": 0.011524485051631927,
"mean_token_accuracy": 0.996875,
"num_tokens": 9631667.0,
"step": 2150
},
{
"entropy": 2.0623193353414537,
"epoch": 2.683229813664596,
"grad_norm": 0.01238600630313158,
"learning_rate": 9.308500620873188e-06,
"loss": 0.005700193718075753,
"mean_token_accuracy": 0.999074074625969,
"num_tokens": 9675409.0,
"step": 2160
},
{
"entropy": 2.082617163658142,
"epoch": 2.6956521739130435,
"grad_norm": 0.019543716683983803,
"learning_rate": 9.228245378733537e-06,
"loss": 0.0012947741895914077,
"mean_token_accuracy": 1.0,
"num_tokens": 9715733.0,
"step": 2170
},
{
"entropy": 2.0438971281051637,
"epoch": 2.708074534161491,
"grad_norm": 0.23991966247558594,
"learning_rate": 9.14804011207946e-06,
"loss": 0.019262537360191345,
"mean_token_accuracy": 0.9976934522390366,
"num_tokens": 9758850.0,
"step": 2180
},
{
"entropy": 2.0186645179986953,
"epoch": 2.720496894409938,
"grad_norm": 0.11839921772480011,
"learning_rate": 9.067890014656532e-06,
"loss": 0.0051767569035291675,
"mean_token_accuracy": 0.9959722220897674,
"num_tokens": 9802740.0,
"step": 2190
},
{
"entropy": 2.072070962190628,
"epoch": 2.732919254658385,
"grad_norm": 0.22388368844985962,
"learning_rate": 8.987800276637797e-06,
"loss": 0.001911316066980362,
"mean_token_accuracy": 1.0,
"num_tokens": 9842183.0,
"step": 2200
},
{
"entropy": 2.036952206492424,
"epoch": 2.7453416149068324,
"grad_norm": 0.08417179435491562,
"learning_rate": 8.907776084287694e-06,
"loss": 0.00783902257680893,
"mean_token_accuracy": 0.9991071432828903,
"num_tokens": 9884991.0,
"step": 2210
},
{
"entropy": 2.0813712805509565,
"epoch": 2.7577639751552794,
"grad_norm": 0.24930235743522644,
"learning_rate": 8.82782261962621e-06,
"loss": 0.006542463600635528,
"mean_token_accuracy": 0.996547618508339,
"num_tokens": 9931116.0,
"step": 2220
},
{
"entropy": 2.0320400312542914,
"epoch": 2.770186335403727,
"grad_norm": 0.013318363577127457,
"learning_rate": 8.747945060093314e-06,
"loss": 0.032293641567230226,
"mean_token_accuracy": 0.9961111098527908,
"num_tokens": 9980491.0,
"step": 2230
},
{
"entropy": 2.023380008339882,
"epoch": 2.782608695652174,
"grad_norm": 0.011369063518941402,
"learning_rate": 8.668148578213676e-06,
"loss": 0.00727204903960228,
"mean_token_accuracy": 0.9980769231915474,
"num_tokens": 10024209.0,
"step": 2240
},
{
"entropy": 2.031138223409653,
"epoch": 2.795031055900621,
"grad_norm": 0.004001646768301725,
"learning_rate": 8.58843834126174e-06,
"loss": 0.003158881887793541,
"mean_token_accuracy": 0.9983333334326744,
"num_tokens": 10071568.0,
"step": 2250
},
{
"entropy": 2.1424681723117827,
"epoch": 2.8074534161490683,
"grad_norm": 0.030468905344605446,
"learning_rate": 8.508819510927102e-06,
"loss": 0.015948720276355743,
"mean_token_accuracy": 0.9942139357328414,
"num_tokens": 10114689.0,
"step": 2260
},
{
"entropy": 2.0369500696659086,
"epoch": 2.8198757763975157,
"grad_norm": 2.443307638168335,
"learning_rate": 8.429297242980255e-06,
"loss": 0.011675138771533967,
"mean_token_accuracy": 0.9984375,
"num_tokens": 10160564.0,
"step": 2270
},
{
"entropy": 2.0784898310899735,
"epoch": 2.8322981366459627,
"grad_norm": 0.014572578482329845,
"learning_rate": 8.349876686938735e-06,
"loss": 0.001237300131469965,
"mean_token_accuracy": 1.0,
"num_tokens": 10202481.0,
"step": 2280
},
{
"entropy": 2.0724748879671098,
"epoch": 2.8447204968944098,
"grad_norm": 0.029409846290946007,
"learning_rate": 8.270562985733652e-06,
"loss": 0.04003585875034332,
"mean_token_accuracy": 0.9918279573321342,
"num_tokens": 10250012.0,
"step": 2290
},
{
"entropy": 2.0165867626667024,
"epoch": 2.857142857142857,
"grad_norm": 0.36708053946495056,
"learning_rate": 8.191361275376665e-06,
"loss": 0.02690470814704895,
"mean_token_accuracy": 0.9901388883590698,
"num_tokens": 10298016.0,
"step": 2300
},
{
"entropy": 2.0692808449268343,
"epoch": 2.869565217391304,
"grad_norm": 0.198243647813797,
"learning_rate": 8.112276684627385e-06,
"loss": 0.0325189471244812,
"mean_token_accuracy": 0.9981678783893585,
"num_tokens": 10340662.0,
"step": 2310
},
{
"entropy": 2.0979644536972044,
"epoch": 2.8819875776397517,
"grad_norm": 0.03836897015571594,
"learning_rate": 8.033314334661269e-06,
"loss": 0.002577725984156132,
"mean_token_accuracy": 0.9991379305720329,
"num_tokens": 10381673.0,
"step": 2320
},
{
"entropy": 2.0282706737518312,
"epoch": 2.8944099378881987,
"grad_norm": 0.22129732370376587,
"learning_rate": 7.954479338737995e-06,
"loss": 0.000719859404489398,
"mean_token_accuracy": 1.0,
"num_tokens": 10426947.0,
"step": 2330
},
{
"entropy": 2.023343104124069,
"epoch": 2.906832298136646,
"grad_norm": 0.00921141728758812,
"learning_rate": 7.875776801870326e-06,
"loss": 0.005170207470655441,
"mean_token_accuracy": 0.9991935476660728,
"num_tokens": 10473441.0,
"step": 2340
},
{
"entropy": 2.061341863870621,
"epoch": 2.919254658385093,
"grad_norm": 0.01563173718750477,
"learning_rate": 7.797211820493573e-06,
"loss": 0.004035498574376106,
"mean_token_accuracy": 0.999074074625969,
"num_tokens": 10516464.0,
"step": 2350
},
{
"entropy": 2.0794942557811735,
"epoch": 2.9316770186335406,
"grad_norm": 0.9282295107841492,
"learning_rate": 7.718789482135534e-06,
"loss": 0.0026351150125265123,
"mean_token_accuracy": 0.9982142850756646,
"num_tokens": 10557903.0,
"step": 2360
},
{
"entropy": 2.0855711489915847,
"epoch": 2.9440993788819876,
"grad_norm": 0.0810675099492073,
"learning_rate": 7.640514865087078e-06,
"loss": 0.01579228788614273,
"mean_token_accuracy": 0.9981518805027008,
"num_tokens": 10602244.0,
"step": 2370
},
{
"entropy": 2.053683337569237,
"epoch": 2.9565217391304346,
"grad_norm": 0.029188042506575584,
"learning_rate": 7.562393038073261e-06,
"loss": 0.008064876496791839,
"mean_token_accuracy": 0.9988095238804817,
"num_tokens": 10649252.0,
"step": 2380
},
{
"entropy": 2.056939309835434,
"epoch": 2.968944099378882,
"grad_norm": 0.6217600703239441,
"learning_rate": 7.484429059925136e-06,
"loss": 0.015889519453048707,
"mean_token_accuracy": 0.9950148805975914,
"num_tokens": 10691331.0,
"step": 2390
},
{
"entropy": 2.070336791872978,
"epoch": 2.981366459627329,
"grad_norm": 0.006842709146440029,
"learning_rate": 7.4066279792521426e-06,
"loss": 0.02249635010957718,
"mean_token_accuracy": 0.9986013993620872,
"num_tokens": 10740010.0,
"step": 2400
},
{
"entropy": 2.008762276172638,
"epoch": 2.9937888198757765,
"grad_norm": 0.22063793241977692,
"learning_rate": 7.328994834115181e-06,
"loss": 0.0008781224489212037,
"mean_token_accuracy": 1.0,
"num_tokens": 10791873.0,
"step": 2410
},
{
"entropy": 2.039086303114891,
"epoch": 3.0062111801242235,
"grad_norm": 0.1856115162372589,
"learning_rate": 7.251534651700385e-06,
"loss": 0.0043528910726308824,
"mean_token_accuracy": 0.998863635957241,
"num_tokens": 10833476.0,
"step": 2420
},
{
"entropy": 2.07568744122982,
"epoch": 3.018633540372671,
"grad_norm": 0.6048936247825623,
"learning_rate": 7.174252447993556e-06,
"loss": 0.0008312862366437912,
"mean_token_accuracy": 1.0,
"num_tokens": 10873478.0,
"step": 2430
},
{
"entropy": 2.0069006264209746,
"epoch": 3.031055900621118,
"grad_norm": 0.08963524550199509,
"learning_rate": 7.097153227455379e-06,
"loss": 0.002857883274555206,
"mean_token_accuracy": 0.9964460790157318,
"num_tokens": 10922316.0,
"step": 2440
},
{
"entropy": 2.0665270179510116,
"epoch": 3.0434782608695654,
"grad_norm": 0.07428019493818283,
"learning_rate": 7.020241982697331e-06,
"loss": 0.0018186111003160477,
"mean_token_accuracy": 1.0,
"num_tokens": 10970389.0,
"step": 2450
},
{
"entropy": 2.030388182401657,
"epoch": 3.0559006211180124,
"grad_norm": 0.049276646226644516,
"learning_rate": 6.9435236941584005e-06,
"loss": 0.003922026976943016,
"mean_token_accuracy": 0.998863635957241,
"num_tokens": 11020380.0,
"step": 2460
},
{
"entropy": 2.117271861433983,
"epoch": 3.0683229813664594,
"grad_norm": 0.027438754215836525,
"learning_rate": 6.867003329782566e-06,
"loss": 0.00299711711704731,
"mean_token_accuracy": 0.9977272734045982,
"num_tokens": 11063998.0,
"step": 2470
},
{
"entropy": 2.1177933365106583,
"epoch": 3.080745341614907,
"grad_norm": 0.22324837744235992,
"learning_rate": 6.7906858446970894e-06,
"loss": 0.0014256440103054047,
"mean_token_accuracy": 1.0,
"num_tokens": 11107505.0,
"step": 2480
},
{
"entropy": 2.1208660274744036,
"epoch": 3.093167701863354,
"grad_norm": 0.13765057921409607,
"learning_rate": 6.714576180891653e-06,
"loss": 0.002962992340326309,
"mean_token_accuracy": 0.9984375,
"num_tokens": 11150906.0,
"step": 2490
},
{
"entropy": 2.096135729551315,
"epoch": 3.1055900621118013,
"grad_norm": 0.0484640933573246,
"learning_rate": 6.638679266898334e-06,
"loss": 0.0032801639288663866,
"mean_token_accuracy": 0.9989583328366279,
"num_tokens": 11190221.0,
"step": 2500
},
{
"epoch": 3.1055900621118013,
"eval_entropy": 1.9245576005246074,
"eval_loss": 0.7179387211799622,
"eval_mean_token_accuracy": 0.903106996071376,
"eval_num_tokens": 11190221.0,
"eval_runtime": 1015.9223,
"eval_samples_per_second": 7.531,
"eval_steps_per_second": 0.942,
"step": 2500
},
{
"entropy": 2.065633365511894,
"epoch": 3.1180124223602483,
"grad_norm": 0.004022596403956413,
"learning_rate": 6.56300001747245e-06,
"loss": 0.011902575939893722,
"mean_token_accuracy": 0.9991935476660728,
"num_tokens": 11233858.0,
"step": 2510
},
{
"entropy": 2.0493174642324448,
"epoch": 3.130434782608696,
"grad_norm": 0.004140094853937626,
"learning_rate": 6.48754333327431e-06,
"loss": 0.011013699322938919,
"mean_token_accuracy": 0.9991935476660728,
"num_tokens": 11278738.0,
"step": 2520
},
{
"entropy": 2.1025405555963514,
"epoch": 3.142857142857143,
"grad_norm": 0.008452140726149082,
"learning_rate": 6.412314100551854e-06,
"loss": 0.004581971466541291,
"mean_token_accuracy": 0.9978349670767784,
"num_tokens": 11318888.0,
"step": 2530
},
{
"entropy": 1.9467100128531456,
"epoch": 3.1552795031055902,
"grad_norm": 0.04429563507437706,
"learning_rate": 6.337317190824257e-06,
"loss": 0.00039558070711791514,
"mean_token_accuracy": 1.0,
"num_tokens": 11369254.0,
"step": 2540
},
{
"entropy": 2.0959424555301664,
"epoch": 3.1677018633540373,
"grad_norm": 0.08045872300863266,
"learning_rate": 6.262557460566465e-06,
"loss": 0.014682823419570923,
"mean_token_accuracy": 0.9972435891628265,
"num_tokens": 11409789.0,
"step": 2550
},
{
"entropy": 2.1395619392395018,
"epoch": 3.1801242236024843,
"grad_norm": 0.009005514904856682,
"learning_rate": 6.188039750894707e-06,
"loss": 0.0013207459822297096,
"mean_token_accuracy": 1.0,
"num_tokens": 11448078.0,
"step": 2560
},
{
"entropy": 1.9897212505340576,
"epoch": 3.1925465838509317,
"grad_norm": 0.06040625274181366,
"learning_rate": 6.113768887252998e-06,
"loss": 0.00110345296561718,
"mean_token_accuracy": 1.0,
"num_tokens": 11495538.0,
"step": 2570
},
{
"entropy": 2.042201852798462,
"epoch": 3.2049689440993787,
"grad_norm": 3.705784559249878,
"learning_rate": 6.039749679100688e-06,
"loss": 0.005044905096292495,
"mean_token_accuracy": 0.998863635957241,
"num_tokens": 11541174.0,
"step": 2580
},
{
"entropy": 2.0282586336135866,
"epoch": 3.217391304347826,
"grad_norm": 0.07588481903076172,
"learning_rate": 5.965986919601e-06,
"loss": 0.013422471284866334,
"mean_token_accuracy": 0.9941584974527359,
"num_tokens": 11588423.0,
"step": 2590
},
{
"entropy": 2.0026851534843444,
"epoch": 3.229813664596273,
"grad_norm": 0.08241789042949677,
"learning_rate": 5.892485385310656e-06,
"loss": 0.0002885764231905341,
"mean_token_accuracy": 1.0,
"num_tokens": 11634579.0,
"step": 2600
},
{
"entropy": 2.003785479068756,
"epoch": 3.2422360248447206,
"grad_norm": 0.049002643674612045,
"learning_rate": 5.819249835870567e-06,
"loss": 0.0014354961924254895,
"mean_token_accuracy": 1.0,
"num_tokens": 11680204.0,
"step": 2610
},
{
"entropy": 2.040288230776787,
"epoch": 3.2546583850931676,
"grad_norm": 0.01789112761616707,
"learning_rate": 5.746285013697608e-06,
"loss": 0.002602299861609936,
"mean_token_accuracy": 0.999285714328289,
"num_tokens": 11725405.0,
"step": 2620
},
{
"entropy": 2.039785459637642,
"epoch": 3.267080745341615,
"grad_norm": 0.004627231974154711,
"learning_rate": 5.6735956436775405e-06,
"loss": 0.0003787399735301733,
"mean_token_accuracy": 1.0,
"num_tokens": 11775017.0,
"step": 2630
},
{
"entropy": 2.0185125142335893,
"epoch": 3.279503105590062,
"grad_norm": 0.016168462112545967,
"learning_rate": 5.6011864328590335e-06,
"loss": 0.008351743221282959,
"mean_token_accuracy": 0.9994186043739319,
"num_tokens": 11823310.0,
"step": 2640
},
{
"entropy": 2.0066159784793856,
"epoch": 3.291925465838509,
"grad_norm": 0.03235394135117531,
"learning_rate": 5.529062070148859e-06,
"loss": 0.005417406931519509,
"mean_token_accuracy": 0.9986842110753059,
"num_tokens": 11871941.0,
"step": 2650
},
{
"entropy": 2.051735845208168,
"epoch": 3.3043478260869565,
"grad_norm": 0.003987879958003759,
"learning_rate": 5.457227226008265e-06,
"loss": 0.0012644742615520953,
"mean_token_accuracy": 1.0,
"num_tokens": 11917677.0,
"step": 2660
},
{
"entropy": 2.0791384488344193,
"epoch": 3.3167701863354035,
"grad_norm": 0.013546639122068882,
"learning_rate": 5.385686552150517e-06,
"loss": 0.0003978293854743242,
"mean_token_accuracy": 1.0,
"num_tokens": 11962426.0,
"step": 2670
},
{
"entropy": 2.1187647074460982,
"epoch": 3.329192546583851,
"grad_norm": 2.911365509033203,
"learning_rate": 5.3144446812397045e-06,
"loss": 0.0044805873185396194,
"mean_token_accuracy": 0.9989583328366279,
"num_tokens": 12002806.0,
"step": 2680
},
{
"entropy": 2.085233438014984,
"epoch": 3.341614906832298,
"grad_norm": 0.021008091047406197,
"learning_rate": 5.243506226590722e-06,
"loss": 0.0006675105541944504,
"mean_token_accuracy": 1.0,
"num_tokens": 12043773.0,
"step": 2690
},
{
"entropy": 2.0027647256851195,
"epoch": 3.3540372670807455,
"grad_norm": 0.011667752638459206,
"learning_rate": 5.172875781870552e-06,
"loss": 0.014550222456455231,
"mean_token_accuracy": 0.9954166665673256,
"num_tokens": 12087817.0,
"step": 2700
},
{
"entropy": 2.0871587693691254,
"epoch": 3.3664596273291925,
"grad_norm": 0.00429825484752655,
"learning_rate": 5.102557920800772e-06,
"loss": 0.016400189697742464,
"mean_token_accuracy": 0.997826087474823,
"num_tokens": 12130292.0,
"step": 2710
},
{
"entropy": 2.058573919534683,
"epoch": 3.37888198757764,
"grad_norm": 0.013374663889408112,
"learning_rate": 5.0325571968614105e-06,
"loss": 0.0003040991257876158,
"mean_token_accuracy": 1.0,
"num_tokens": 12174087.0,
"step": 2720
},
{
"entropy": 1.9985705226659776,
"epoch": 3.391304347826087,
"grad_norm": 0.0736985132098198,
"learning_rate": 4.962878142996065e-06,
"loss": 0.0008327001705765724,
"mean_token_accuracy": 1.0,
"num_tokens": 12217953.0,
"step": 2730
},
{
"entropy": 2.071951040625572,
"epoch": 3.403726708074534,
"grad_norm": 0.2610735297203064,
"learning_rate": 4.893525271318372e-06,
"loss": 0.001319923996925354,
"mean_token_accuracy": 1.0,
"num_tokens": 12257621.0,
"step": 2740
},
{
"entropy": 2.0868619114160536,
"epoch": 3.4161490683229814,
"grad_norm": 0.004669727757573128,
"learning_rate": 4.824503072819828e-06,
"loss": 0.003249622881412506,
"mean_token_accuracy": 0.9991666659712791,
"num_tokens": 12296512.0,
"step": 2750
},
{
"entropy": 2.0636314779520033,
"epoch": 3.4285714285714284,
"grad_norm": 0.09974928945302963,
"learning_rate": 4.755816017078956e-06,
"loss": 0.0005484614055603742,
"mean_token_accuracy": 1.0,
"num_tokens": 12341650.0,
"step": 2760
},
{
"entropy": 2.1476096123456956,
"epoch": 3.440993788819876,
"grad_norm": 0.0051970030181109905,
"learning_rate": 4.6874685519718945e-06,
"loss": 0.00029311692342162134,
"mean_token_accuracy": 1.0,
"num_tokens": 12382945.0,
"step": 2770
},
{
"entropy": 2.146159088611603,
"epoch": 3.453416149068323,
"grad_norm": 0.0212989691644907,
"learning_rate": 4.619465103384363e-06,
"loss": 0.0007739394437521696,
"mean_token_accuracy": 1.0,
"num_tokens": 12417675.0,
"step": 2780
},
{
"entropy": 2.021345466375351,
"epoch": 3.4658385093167703,
"grad_norm": 0.01701529510319233,
"learning_rate": 4.55181007492506e-06,
"loss": 0.0006289692129939795,
"mean_token_accuracy": 1.0,
"num_tokens": 12462562.0,
"step": 2790
},
{
"entropy": 1.9724286824464798,
"epoch": 3.4782608695652173,
"grad_norm": 0.010893910191953182,
"learning_rate": 4.484507847640511e-06,
"loss": 0.0014305679127573968,
"mean_token_accuracy": 1.0,
"num_tokens": 12517887.0,
"step": 2800
},
{
"entropy": 2.0382672011852265,
"epoch": 3.4906832298136647,
"grad_norm": 0.0061012133955955505,
"learning_rate": 4.417562779731355e-06,
"loss": 0.00024020741693675518,
"mean_token_accuracy": 1.0,
"num_tokens": 12563405.0,
"step": 2810
},
{
"entropy": 2.004192039370537,
"epoch": 3.5031055900621118,
"grad_norm": 0.00254402169957757,
"learning_rate": 4.3509792062701464e-06,
"loss": 0.0012421167455613613,
"mean_token_accuracy": 1.0,
"num_tokens": 12612757.0,
"step": 2820
},
{
"entropy": 2.0766816467046736,
"epoch": 3.5155279503105588,
"grad_norm": 0.01933353766798973,
"learning_rate": 4.284761438920624e-06,
"loss": 0.001632862538099289,
"mean_token_accuracy": 0.998863635957241,
"num_tokens": 12659014.0,
"step": 2830
},
{
"entropy": 2.03719719350338,
"epoch": 3.527950310559006,
"grad_norm": 0.16155198216438293,
"learning_rate": 4.218913765658507e-06,
"loss": 0.006846483051776886,
"mean_token_accuracy": 0.996354167163372,
"num_tokens": 12705485.0,
"step": 2840
},
{
"entropy": 2.0722499549388886,
"epoch": 3.5403726708074537,
"grad_norm": 0.00480568828061223,
"learning_rate": 4.153440450493823e-06,
"loss": 0.0002258694963529706,
"mean_token_accuracy": 1.0,
"num_tokens": 12749166.0,
"step": 2850
},
{
"entropy": 2.076261229813099,
"epoch": 3.5527950310559007,
"grad_norm": 0.0019834646955132484,
"learning_rate": 4.088345733194793e-06,
"loss": 0.005384958907961845,
"mean_token_accuracy": 0.9977272734045982,
"num_tokens": 12791428.0,
"step": 2860
},
{
"entropy": 2.0420318722724913,
"epoch": 3.5652173913043477,
"grad_norm": 0.022317076101899147,
"learning_rate": 4.0236338290132795e-06,
"loss": 0.0007763313595205545,
"mean_token_accuracy": 1.0,
"num_tokens": 12836185.0,
"step": 2870
},
{
"entropy": 2.111663815379143,
"epoch": 3.577639751552795,
"grad_norm": 0.05490420013666153,
"learning_rate": 3.959308928411828e-06,
"loss": 0.0033809009939432142,
"mean_token_accuracy": 1.0,
"num_tokens": 12876251.0,
"step": 2880
},
{
"entropy": 2.06292268037796,
"epoch": 3.590062111801242,
"grad_norm": 0.024032561108469963,
"learning_rate": 3.895375196792308e-06,
"loss": 0.0003204423002898693,
"mean_token_accuracy": 1.0,
"num_tokens": 12921471.0,
"step": 2890
},
{
"entropy": 2.058139744400978,
"epoch": 3.6024844720496896,
"grad_norm": 0.08312931656837463,
"learning_rate": 3.83183677422618e-06,
"loss": 0.004134120792150498,
"mean_token_accuracy": 0.9991935476660728,
"num_tokens": 12963024.0,
"step": 2900
},
{
"entropy": 2.0561121970415117,
"epoch": 3.6149068322981366,
"grad_norm": 0.007939224131405354,
"learning_rate": 3.768697775186403e-06,
"loss": 0.003024405241012573,
"mean_token_accuracy": 0.99921875,
"num_tokens": 13006957.0,
"step": 2910
},
{
"entropy": 1.9855820834636688,
"epoch": 3.6273291925465836,
"grad_norm": 0.04352085292339325,
"learning_rate": 3.705962288281e-06,
"loss": 0.0003980351146310568,
"mean_token_accuracy": 1.0,
"num_tokens": 13062006.0,
"step": 2920
},
{
"entropy": 2.038356375694275,
"epoch": 3.639751552795031,
"grad_norm": 1.2225877046585083,
"learning_rate": 3.643634375988293e-06,
"loss": 0.008960984647274017,
"mean_token_accuracy": 0.997916667163372,
"num_tokens": 13105926.0,
"step": 2930
},
{
"entropy": 1.966392880678177,
"epoch": 3.6521739130434785,
"grad_norm": 3.6292645931243896,
"learning_rate": 3.5817180743938475e-06,
"loss": 0.02723119258880615,
"mean_token_accuracy": 0.9982826575636864,
"num_tokens": 13155505.0,
"step": 2940
},
{
"entropy": 2.0349768072366716,
"epoch": 3.6645962732919255,
"grad_norm": 0.004916434641927481,
"learning_rate": 3.5202173929290873e-06,
"loss": 0.0003408062970265746,
"mean_token_accuracy": 1.0,
"num_tokens": 13200787.0,
"step": 2950
},
{
"entropy": 2.0228754550218584,
"epoch": 3.6770186335403725,
"grad_norm": 0.005172870121896267,
"learning_rate": 3.459136314111691e-06,
"loss": 0.007737810164690018,
"mean_token_accuracy": 0.9944444447755814,
"num_tokens": 13250267.0,
"step": 2960
},
{
"entropy": 1.975671073794365,
"epoch": 3.68944099378882,
"grad_norm": 0.013639900833368301,
"learning_rate": 3.398478793287682e-06,
"loss": 0.0017875196412205697,
"mean_token_accuracy": 1.0,
"num_tokens": 13291524.0,
"step": 2970
},
{
"entropy": 2.1133328646421434,
"epoch": 3.701863354037267,
"grad_norm": 0.16240786015987396,
"learning_rate": 3.3382487583753086e-06,
"loss": 0.0020084600895643235,
"mean_token_accuracy": 1.0,
"num_tokens": 13330874.0,
"step": 2980
},
{
"entropy": 2.015983095765114,
"epoch": 3.7142857142857144,
"grad_norm": 0.005457151681184769,
"learning_rate": 3.2784501096106737e-06,
"loss": 0.0006346395704895258,
"mean_token_accuracy": 1.0,
"num_tokens": 13376639.0,
"step": 2990
},
{
"entropy": 2.1352883040905,
"epoch": 3.7267080745341614,
"grad_norm": 0.026707326993346214,
"learning_rate": 3.2190867192951893e-06,
"loss": 0.0002277535619214177,
"mean_token_accuracy": 1.0,
"num_tokens": 13416860.0,
"step": 3000
},
{
"epoch": 3.7267080745341614,
"eval_entropy": 1.915783873296955,
"eval_loss": 0.7208165526390076,
"eval_mean_token_accuracy": 0.9051754110908309,
"eval_num_tokens": 13416860.0,
"eval_runtime": 1014.7668,
"eval_samples_per_second": 7.54,
"eval_steps_per_second": 0.943,
"step": 3000
},
{
"entropy": 2.035184735059738,
"epoch": 3.7391304347826084,
"grad_norm": 0.012916711159050465,
"learning_rate": 3.1601624315448167e-06,
"loss": 0.00808061882853508,
"mean_token_accuracy": 0.9990384608507157,
"num_tokens": 13462523.0,
"step": 3010
},
{
"entropy": 2.057391199469566,
"epoch": 3.751552795031056,
"grad_norm": 0.15162841975688934,
"learning_rate": 3.101681062041134e-06,
"loss": 0.00021725615952163934,
"mean_token_accuracy": 1.0,
"num_tokens": 13511406.0,
"step": 3020
},
{
"entropy": 1.9883357465267182,
"epoch": 3.7639751552795033,
"grad_norm": 0.015947408974170685,
"learning_rate": 3.043646397784259e-06,
"loss": 0.0025760218501091003,
"mean_token_accuracy": 0.9993243247270585,
"num_tokens": 13557519.0,
"step": 3030
},
{
"entropy": 2.048056635260582,
"epoch": 3.7763975155279503,
"grad_norm": 0.03572254627943039,
"learning_rate": 2.9860621968476002e-06,
"loss": 0.005737992003560066,
"mean_token_accuracy": 0.9991071432828903,
"num_tokens": 13603619.0,
"step": 3040
},
{
"entropy": 2.0730544537305833,
"epoch": 3.7888198757763973,
"grad_norm": 0.03662121668457985,
"learning_rate": 2.9289321881345257e-06,
"loss": 0.005768216773867607,
"mean_token_accuracy": 0.9980555549263954,
"num_tokens": 13645212.0,
"step": 3050
},
{
"entropy": 2.042172911763191,
"epoch": 3.801242236024845,
"grad_norm": 0.0020903616677969694,
"learning_rate": 2.8722600711368777e-06,
"loss": 0.006000512093305588,
"mean_token_accuracy": 0.9989130437374115,
"num_tokens": 13691056.0,
"step": 3060
},
{
"entropy": 2.059427934885025,
"epoch": 3.813664596273292,
"grad_norm": 0.002584670437499881,
"learning_rate": 2.816049515695417e-06,
"loss": 0.00038500460796058177,
"mean_token_accuracy": 1.0,
"num_tokens": 13737184.0,
"step": 3070
},
{
"entropy": 2.03760521709919,
"epoch": 3.8260869565217392,
"grad_norm": 0.0522318035364151,
"learning_rate": 2.7603041617621783e-06,
"loss": 0.0009485245682299137,
"mean_token_accuracy": 1.0,
"num_tokens": 13783959.0,
"step": 3080
},
{
"entropy": 2.054546761512756,
"epoch": 3.8385093167701863,
"grad_norm": 0.009271272458136082,
"learning_rate": 2.705027619164754e-06,
"loss": 0.015048840641975402,
"mean_token_accuracy": 0.9980769231915474,
"num_tokens": 13829252.0,
"step": 3090
},
{
"entropy": 2.0164424657821653,
"epoch": 3.8509316770186337,
"grad_norm": 0.059004366397857666,
"learning_rate": 2.6502234673725557e-06,
"loss": 0.003549148514866829,
"mean_token_accuracy": 0.9986111104488373,
"num_tokens": 13877928.0,
"step": 3100
},
{
"entropy": 2.0387689799070357,
"epoch": 3.8633540372670807,
"grad_norm": 0.025626162067055702,
"learning_rate": 2.5958952552650098e-06,
"loss": 0.007682383060455322,
"mean_token_accuracy": 0.9977481618523598,
"num_tokens": 13922021.0,
"step": 3110
},
{
"entropy": 2.0456499844789504,
"epoch": 3.875776397515528,
"grad_norm": 2.543144702911377,
"learning_rate": 2.542046500901748e-06,
"loss": 0.0031697705388069155,
"mean_token_accuracy": 0.9987499997019768,
"num_tokens": 13962985.0,
"step": 3120
},
{
"entropy": 2.001152551174164,
"epoch": 3.888198757763975,
"grad_norm": 0.009251217357814312,
"learning_rate": 2.4886806912948034e-06,
"loss": 0.00028319426346570256,
"mean_token_accuracy": 1.0,
"num_tokens": 14005018.0,
"step": 3130
},
{
"entropy": 2.0633739441633225,
"epoch": 3.900621118012422,
"grad_norm": 0.005275467410683632,
"learning_rate": 2.435801282182787e-06,
"loss": 0.000858756247907877,
"mean_token_accuracy": 1.0,
"num_tokens": 14050239.0,
"step": 3140
},
{
"entropy": 1.9629602044820786,
"epoch": 3.9130434782608696,
"grad_norm": 0.004018905572593212,
"learning_rate": 2.383411697807131e-06,
"loss": 0.01187501847743988,
"mean_token_accuracy": 0.9989999994635582,
"num_tokens": 14099540.0,
"step": 3150
},
{
"entropy": 2.03657703101635,
"epoch": 3.9254658385093166,
"grad_norm": 0.01581091806292534,
"learning_rate": 2.331515330690336e-06,
"loss": 0.0036426626145839693,
"mean_token_accuracy": 0.9983574882149696,
"num_tokens": 14143941.0,
"step": 3160
},
{
"entropy": 2.0609166443347933,
"epoch": 3.937888198757764,
"grad_norm": 0.07055187225341797,
"learning_rate": 2.2801155414162933e-06,
"loss": 0.0006878064014017582,
"mean_token_accuracy": 1.0,
"num_tokens": 14183855.0,
"step": 3170
},
{
"entropy": 2.039751389622688,
"epoch": 3.950310559006211,
"grad_norm": 0.015817873179912567,
"learning_rate": 2.229215658412658e-06,
"loss": 0.011930423974990844,
"mean_token_accuracy": 0.9987499997019768,
"num_tokens": 14230427.0,
"step": 3180
},
{
"entropy": 2.013304165005684,
"epoch": 3.9627329192546585,
"grad_norm": 0.010246982797980309,
"learning_rate": 2.178818977735326e-06,
"loss": 0.0027476778253912927,
"mean_token_accuracy": 0.9993902444839478,
"num_tokens": 14280167.0,
"step": 3190
},
{
"entropy": 2.027267241477966,
"epoch": 3.9751552795031055,
"grad_norm": 0.009065949358046055,
"learning_rate": 2.1289287628549904e-06,
"loss": 0.003876122832298279,
"mean_token_accuracy": 0.9989583328366279,
"num_tokens": 14327872.0,
"step": 3200
},
{
"entropy": 2.0841051936149597,
"epoch": 3.987577639751553,
"grad_norm": 0.2582933306694031,
"learning_rate": 2.0795482444458115e-06,
"loss": 0.0015949519351124764,
"mean_token_accuracy": 1.0,
"num_tokens": 14374685.0,
"step": 3210
},
{
"entropy": 2.077771583199501,
"epoch": 4.0,
"grad_norm": 0.056201014667749405,
"learning_rate": 2.0306806201762175e-06,
"loss": 0.0005105304066091776,
"mean_token_accuracy": 1.0,
"num_tokens": 14415424.0,
"step": 3220
},
{
"entropy": 2.032339036464691,
"epoch": 4.012422360248447,
"grad_norm": 0.16235826909542084,
"learning_rate": 1.9823290545018312e-06,
"loss": 0.0008465294726192951,
"mean_token_accuracy": 1.0,
"num_tokens": 14462619.0,
"step": 3230
},
{
"entropy": 1.992909598350525,
"epoch": 4.024844720496894,
"grad_norm": 0.0017087548039853573,
"learning_rate": 1.934496678460559e-06,
"loss": 0.0006027131807059049,
"mean_token_accuracy": 1.0,
"num_tokens": 14507986.0,
"step": 3240
},
{
"entropy": 2.0650244295597076,
"epoch": 4.037267080745342,
"grad_norm": 0.0353049673140049,
"learning_rate": 1.8871865894698338e-06,
"loss": 0.00022105511743575335,
"mean_token_accuracy": 1.0,
"num_tokens": 14549567.0,
"step": 3250
},
{
"entropy": 2.0139154732227325,
"epoch": 4.049689440993789,
"grad_norm": 0.021216459572315216,
"learning_rate": 1.8404018511260447e-06,
"loss": 0.001208197418600321,
"mean_token_accuracy": 1.0,
"num_tokens": 14596321.0,
"step": 3260
},
{
"entropy": 2.0900548338890075,
"epoch": 4.062111801242236,
"grad_norm": 0.04834829643368721,
"learning_rate": 1.7941454930061487e-06,
"loss": 0.00025239353999495506,
"mean_token_accuracy": 1.0,
"num_tokens": 14638834.0,
"step": 3270
},
{
"entropy": 2.0481355130672454,
"epoch": 4.074534161490683,
"grad_norm": 0.0905168354511261,
"learning_rate": 1.7484205104714824e-06,
"loss": 0.004746239632368088,
"mean_token_accuracy": 0.9990384608507157,
"num_tokens": 14681585.0,
"step": 3280
},
{
"entropy": 2.0373184353113176,
"epoch": 4.086956521739131,
"grad_norm": 0.03823855146765709,
"learning_rate": 1.703229864473811e-06,
"loss": 0.00025348488707095386,
"mean_token_accuracy": 1.0,
"num_tokens": 14730043.0,
"step": 3290
},
{
"entropy": 2.0669949412345887,
"epoch": 4.099378881987578,
"grad_norm": 0.030003461986780167,
"learning_rate": 1.6585764813635751e-06,
"loss": 0.00018225166713818907,
"mean_token_accuracy": 1.0,
"num_tokens": 14772600.0,
"step": 3300
},
{
"entropy": 2.0379785656929017,
"epoch": 4.111801242236025,
"grad_norm": 0.005713196471333504,
"learning_rate": 1.6144632527004033e-06,
"loss": 0.0003649190068244934,
"mean_token_accuracy": 1.0,
"num_tokens": 14819632.0,
"step": 3310
},
{
"entropy": 2.0793015539646147,
"epoch": 4.124223602484472,
"grad_norm": 0.022466011345386505,
"learning_rate": 1.5708930350658535e-06,
"loss": 0.0008130665868520736,
"mean_token_accuracy": 1.0,
"num_tokens": 14866352.0,
"step": 3320
},
{
"entropy": 2.0861439973115923,
"epoch": 4.136645962732919,
"grad_norm": 0.04154065251350403,
"learning_rate": 1.5278686498784512e-06,
"loss": 0.0001728469622321427,
"mean_token_accuracy": 1.0,
"num_tokens": 14907444.0,
"step": 3330
},
{
"entropy": 1.9659110337495804,
"epoch": 4.149068322981367,
"grad_norm": 0.004008583724498749,
"learning_rate": 1.4853928832109732e-06,
"loss": 0.0005395710468292236,
"mean_token_accuracy": 1.0,
"num_tokens": 14958978.0,
"step": 3340
},
{
"entropy": 2.025330847501755,
"epoch": 4.161490683229814,
"grad_norm": 0.01808677799999714,
"learning_rate": 1.4434684856100377e-06,
"loss": 0.00026113332714885475,
"mean_token_accuracy": 1.0,
"num_tokens": 15001022.0,
"step": 3350
},
{
"entropy": 2.077262428402901,
"epoch": 4.173913043478261,
"grad_norm": 0.05431155487895012,
"learning_rate": 1.402098171917996e-06,
"loss": 0.0004729252308607101,
"mean_token_accuracy": 1.0,
"num_tokens": 15045200.0,
"step": 3360
},
{
"entropy": 2.028971680998802,
"epoch": 4.186335403726708,
"grad_norm": 0.03370862826704979,
"learning_rate": 1.3612846210971153e-06,
"loss": 0.0006381514482200146,
"mean_token_accuracy": 1.0,
"num_tokens": 15087961.0,
"step": 3370
},
{
"entropy": 2.0537871956825255,
"epoch": 4.198757763975156,
"grad_norm": 0.007738613057881594,
"learning_rate": 1.3210304760561233e-06,
"loss": 0.00116888377815485,
"mean_token_accuracy": 1.0,
"num_tokens": 15130072.0,
"step": 3380
},
{
"entropy": 2.092353865504265,
"epoch": 4.211180124223603,
"grad_norm": 0.049626674503088,
"learning_rate": 1.281338343479045e-06,
"loss": 0.00019769035279750823,
"mean_token_accuracy": 1.0,
"num_tokens": 15172731.0,
"step": 3390
},
{
"entropy": 2.024295452237129,
"epoch": 4.22360248447205,
"grad_norm": 0.0875379741191864,
"learning_rate": 1.2422107936564175e-06,
"loss": 0.0004914845339953899,
"mean_token_accuracy": 1.0,
"num_tokens": 15218529.0,
"step": 3400
},
{
"entropy": 2.0535459727048875,
"epoch": 4.236024844720497,
"grad_norm": 0.015673642978072166,
"learning_rate": 1.2036503603188464e-06,
"loss": 0.0002709951251745224,
"mean_token_accuracy": 1.0,
"num_tokens": 15262145.0,
"step": 3410
},
{
"entropy": 2.0593578845262526,
"epoch": 4.248447204968944,
"grad_norm": 0.045476797968149185,
"learning_rate": 1.1656595404729232e-06,
"loss": 0.0018097426742315291,
"mean_token_accuracy": 0.9991666659712791,
"num_tokens": 15312132.0,
"step": 3420
},
{
"entropy": 1.9848116040229797,
"epoch": 4.260869565217392,
"grad_norm": 0.0017723346827551723,
"learning_rate": 1.1282407942395435e-06,
"loss": 0.00026819088961929085,
"mean_token_accuracy": 1.0,
"num_tokens": 15355648.0,
"step": 3430
},
{
"entropy": 2.0672077775001525,
"epoch": 4.273291925465839,
"grad_norm": 0.01810125634074211,
"learning_rate": 1.091396544694594e-06,
"loss": 0.001546621322631836,
"mean_token_accuracy": 1.0,
"num_tokens": 15402566.0,
"step": 3440
},
{
"entropy": 2.103651860356331,
"epoch": 4.285714285714286,
"grad_norm": 0.013126119039952755,
"learning_rate": 1.0551291777120465e-06,
"loss": 0.0008613715879619121,
"mean_token_accuracy": 1.0,
"num_tokens": 15445576.0,
"step": 3450
},
{
"entropy": 2.0706649154424666,
"epoch": 4.298136645962733,
"grad_norm": 0.013539963401854038,
"learning_rate": 1.019441041809449e-06,
"loss": 0.00020982269197702407,
"mean_token_accuracy": 1.0,
"num_tokens": 15491988.0,
"step": 3460
},
{
"entropy": 2.0074143022298814,
"epoch": 4.3105590062111805,
"grad_norm": 0.005376921966671944,
"learning_rate": 9.84334447995865e-07,
"loss": 0.0008014158345758915,
"mean_token_accuracy": 1.0,
"num_tokens": 15536316.0,
"step": 3470
},
{
"entropy": 1.9699030220508575,
"epoch": 4.3229813664596275,
"grad_norm": 0.2335580438375473,
"learning_rate": 9.498116696222049e-07,
"loss": 0.0008583088405430317,
"mean_token_accuracy": 1.0,
"num_tokens": 15586522.0,
"step": 3480
},
{
"entropy": 2.0634532988071443,
"epoch": 4.3354037267080745,
"grad_norm": 0.07481986284255981,
"learning_rate": 9.15874942234024e-07,
"loss": 0.00037952899001538756,
"mean_token_accuracy": 1.0,
"num_tokens": 15630922.0,
"step": 3490
},
{
"entropy": 2.027003452181816,
"epoch": 4.3478260869565215,
"grad_norm": 0.004738735035061836,
"learning_rate": 8.82526463426756e-07,
"loss": 0.00023144190199673176,
"mean_token_accuracy": 1.0,
"num_tokens": 15676612.0,
"step": 3500
},
{
"epoch": 4.3478260869565215,
"eval_entropy": 1.9058150294681577,
"eval_loss": 0.7377180457115173,
"eval_mean_token_accuracy": 0.9048938154551427,
"eval_num_tokens": 15676612.0,
"eval_runtime": 1014.9198,
"eval_samples_per_second": 7.539,
"eval_steps_per_second": 0.943,
"step": 3500
},
{
"entropy": 2.028341743350029,
"epoch": 4.3602484472049685,
"grad_norm": 0.33282777667045593,
"learning_rate": 8.497683927033995e-07,
"loss": 0.0004219844937324524,
"mean_token_accuracy": 1.0,
"num_tokens": 15725206.0,
"step": 3510
},
{
"entropy": 2.0083132714033125,
"epoch": 4.372670807453416,
"grad_norm": 0.007023821119219065,
"learning_rate": 8.176028513346879e-07,
"loss": 0.002606554329395294,
"mean_token_accuracy": 0.9994897961616516,
"num_tokens": 15770344.0,
"step": 3520
},
{
"entropy": 2.085210156440735,
"epoch": 4.385093167701863,
"grad_norm": 0.009783482179045677,
"learning_rate": 7.860319222217206e-07,
"loss": 0.0017641620710492135,
"mean_token_accuracy": 0.9994565218687057,
"num_tokens": 15811072.0,
"step": 3530
},
{
"entropy": 2.037967327237129,
"epoch": 4.39751552795031,
"grad_norm": 0.011295588687062263,
"learning_rate": 7.550576497610829e-07,
"loss": 0.00024796819780021907,
"mean_token_accuracy": 1.0,
"num_tokens": 15858282.0,
"step": 3540
},
{
"entropy": 2.0281506925821304,
"epoch": 4.409937888198757,
"grad_norm": 0.015403630211949348,
"learning_rate": 7.246820397124598e-07,
"loss": 0.0002571480348706245,
"mean_token_accuracy": 1.0,
"num_tokens": 15901251.0,
"step": 3550
},
{
"entropy": 2.0923985958099367,
"epoch": 4.422360248447205,
"grad_norm": 0.005905622150748968,
"learning_rate": 6.949070590687567e-07,
"loss": 0.0010250438004732131,
"mean_token_accuracy": 0.997916667163372,
"num_tokens": 15942361.0,
"step": 3560
},
{
"entropy": 2.0730757504701613,
"epoch": 4.434782608695652,
"grad_norm": 0.007940849289298058,
"learning_rate": 6.65734635928711e-07,
"loss": 0.00019977029878646136,
"mean_token_accuracy": 1.0,
"num_tokens": 15990201.0,
"step": 3570
},
{
"entropy": 1.9941458642482757,
"epoch": 4.447204968944099,
"grad_norm": 0.005438764579594135,
"learning_rate": 6.37166659372056e-07,
"loss": 0.0002368162851780653,
"mean_token_accuracy": 1.0,
"num_tokens": 16034717.0,
"step": 3580
},
{
"entropy": 2.049195554852486,
"epoch": 4.459627329192546,
"grad_norm": 0.003918728791177273,
"learning_rate": 6.092049793371802e-07,
"loss": 0.00024126945063471795,
"mean_token_accuracy": 1.0,
"num_tokens": 16077494.0,
"step": 3590
},
{
"entropy": 2.0372196793556214,
"epoch": 4.472049689440993,
"grad_norm": 0.007525778375566006,
"learning_rate": 5.818514065013358e-07,
"loss": 0.00033768313005566597,
"mean_token_accuracy": 1.0,
"num_tokens": 16121475.0,
"step": 3600
},
{
"entropy": 2.013162526488304,
"epoch": 4.484472049689441,
"grad_norm": 0.010637825354933739,
"learning_rate": 5.551077121633875e-07,
"loss": 0.00017051056493073703,
"mean_token_accuracy": 1.0,
"num_tokens": 16161482.0,
"step": 3610
},
{
"entropy": 2.000212600827217,
"epoch": 4.496894409937888,
"grad_norm": 0.007012031972408295,
"learning_rate": 5.289756281291114e-07,
"loss": 0.001262835692614317,
"mean_token_accuracy": 1.0,
"num_tokens": 16203394.0,
"step": 3620
},
{
"entropy": 2.066090244054794,
"epoch": 4.509316770186335,
"grad_norm": 0.01005527563393116,
"learning_rate": 5.034568465990497e-07,
"loss": 0.00016053561121225356,
"mean_token_accuracy": 1.0,
"num_tokens": 16243079.0,
"step": 3630
},
{
"entropy": 2.080022472143173,
"epoch": 4.521739130434782,
"grad_norm": 0.02030208148062229,
"learning_rate": 4.785530200589327e-07,
"loss": 0.0015855986624956132,
"mean_token_accuracy": 0.9983333334326744,
"num_tokens": 16289416.0,
"step": 3640
},
{
"entropy": 2.0235850870609284,
"epoch": 4.53416149068323,
"grad_norm": 0.017586492002010345,
"learning_rate": 4.5426576117266643e-07,
"loss": 0.00019510933198034762,
"mean_token_accuracy": 1.0,
"num_tokens": 16337150.0,
"step": 3650
},
{
"entropy": 2.036457586288452,
"epoch": 4.546583850931677,
"grad_norm": 0.003649574238806963,
"learning_rate": 4.305966426779118e-07,
"loss": 0.013864995539188385,
"mean_token_accuracy": 0.997054597735405,
"num_tokens": 16382104.0,
"step": 3660
},
{
"entropy": 2.098330682516098,
"epoch": 4.559006211180124,
"grad_norm": 0.010212893597781658,
"learning_rate": 4.0754719728423267e-07,
"loss": 0.0013746877200901508,
"mean_token_accuracy": 0.9991379305720329,
"num_tokens": 16422099.0,
"step": 3670
},
{
"entropy": 2.076760244369507,
"epoch": 4.571428571428571,
"grad_norm": 0.25979042053222656,
"learning_rate": 3.85118917573849e-07,
"loss": 0.000352576794102788,
"mean_token_accuracy": 1.0,
"num_tokens": 16463092.0,
"step": 3680
},
{
"entropy": 2.0827836245298386,
"epoch": 4.583850931677018,
"grad_norm": 0.02301006019115448,
"learning_rate": 3.6331325590498344e-07,
"loss": 0.0007054576650261879,
"mean_token_accuracy": 1.0,
"num_tokens": 16505380.0,
"step": 3690
},
{
"entropy": 2.047082948684692,
"epoch": 4.596273291925466,
"grad_norm": 0.004036522004753351,
"learning_rate": 3.4213162431780964e-07,
"loss": 0.00014299721224233508,
"mean_token_accuracy": 1.0,
"num_tokens": 16551379.0,
"step": 3700
},
{
"entropy": 2.0353837430477144,
"epoch": 4.608695652173913,
"grad_norm": 0.015464823693037033,
"learning_rate": 3.2157539444301667e-07,
"loss": 0.00044039799831807613,
"mean_token_accuracy": 1.0,
"num_tokens": 16590736.0,
"step": 3710
},
{
"entropy": 2.035485503077507,
"epoch": 4.62111801242236,
"grad_norm": 0.023447539657354355,
"learning_rate": 3.0164589741298986e-07,
"loss": 0.0002818571170791984,
"mean_token_accuracy": 1.0,
"num_tokens": 16633530.0,
"step": 3720
},
{
"entropy": 2.044951635599136,
"epoch": 4.633540372670807,
"grad_norm": 0.0037932603154331446,
"learning_rate": 2.823444237756123e-07,
"loss": 0.00026586204767227174,
"mean_token_accuracy": 1.0,
"num_tokens": 16678584.0,
"step": 3730
},
{
"entropy": 2.0412946969270704,
"epoch": 4.645962732919255,
"grad_norm": 0.04193413257598877,
"learning_rate": 2.636722234106903e-07,
"loss": 0.00031464963685721157,
"mean_token_accuracy": 1.0,
"num_tokens": 16723346.0,
"step": 3740
},
{
"entropy": 2.037806236743927,
"epoch": 4.658385093167702,
"grad_norm": 0.008879466913640499,
"learning_rate": 2.4563050544901935e-07,
"loss": 0.0008394073694944382,
"mean_token_accuracy": 1.0,
"num_tokens": 16766309.0,
"step": 3750
},
{
"entropy": 2.0403653383255005,
"epoch": 4.670807453416149,
"grad_norm": 0.004407000727951527,
"learning_rate": 2.282204381940889e-07,
"loss": 0.000280851754359901,
"mean_token_accuracy": 1.0,
"num_tokens": 16809072.0,
"step": 3760
},
{
"entropy": 2.0514664113521577,
"epoch": 4.683229813664596,
"grad_norm": 2.2006642818450928,
"learning_rate": 2.1144314904642194e-07,
"loss": 0.007948150485754013,
"mean_token_accuracy": 0.9976576581597328,
"num_tokens": 16851980.0,
"step": 3770
},
{
"entropy": 2.1021973162889482,
"epoch": 4.695652173913043,
"grad_norm": 0.0551968514919281,
"learning_rate": 1.9529972443057542e-07,
"loss": 0.00034392224624753,
"mean_token_accuracy": 1.0,
"num_tokens": 16893309.0,
"step": 3780
},
{
"entropy": 2.0802121639251707,
"epoch": 4.708074534161491,
"grad_norm": 0.022165654227137566,
"learning_rate": 1.7979120972478448e-07,
"loss": 0.0012221145443618298,
"mean_token_accuracy": 0.9989130437374115,
"num_tokens": 16936398.0,
"step": 3790
},
{
"entropy": 1.9913864940404893,
"epoch": 4.720496894409938,
"grad_norm": 0.0038369097746908665,
"learning_rate": 1.6491860919326863e-07,
"loss": 0.0035387083888053896,
"mean_token_accuracy": 0.9991935476660728,
"num_tokens": 16983474.0,
"step": 3800
},
{
"entropy": 2.0697665393352507,
"epoch": 4.732919254658385,
"grad_norm": 0.10980178415775299,
"learning_rate": 1.5068288592120284e-07,
"loss": 0.0024135053157806397,
"mean_token_accuracy": 0.9986111104488373,
"num_tokens": 17023077.0,
"step": 3810
},
{
"entropy": 2.023961767554283,
"epoch": 4.745341614906832,
"grad_norm": 0.016840871423482895,
"learning_rate": 1.3708496175234732e-07,
"loss": 0.00022674815263599158,
"mean_token_accuracy": 1.0,
"num_tokens": 17071372.0,
"step": 3820
},
{
"entropy": 2.021743801236153,
"epoch": 4.75776397515528,
"grad_norm": 0.019546369090676308,
"learning_rate": 1.241257172293575e-07,
"loss": 0.0004151566419750452,
"mean_token_accuracy": 1.0,
"num_tokens": 17118417.0,
"step": 3830
},
{
"entropy": 1.9979822367429734,
"epoch": 4.770186335403727,
"grad_norm": 0.012950404547154903,
"learning_rate": 1.1180599153676086e-07,
"loss": 0.0011697439476847649,
"mean_token_accuracy": 1.0,
"num_tokens": 17165083.0,
"step": 3840
},
{
"entropy": 2.03771687746048,
"epoch": 4.782608695652174,
"grad_norm": 0.002949357498437166,
"learning_rate": 1.0012658244661799e-07,
"loss": 0.0001900658942759037,
"mean_token_accuracy": 1.0,
"num_tokens": 17210230.0,
"step": 3850
},
{
"entropy": 2.0459833204746247,
"epoch": 4.795031055900621,
"grad_norm": 0.02009522169828415,
"learning_rate": 8.908824626685853e-08,
"loss": 0.001738494448363781,
"mean_token_accuracy": 0.9992424249649048,
"num_tokens": 17257379.0,
"step": 3860
},
{
"entropy": 2.0705668896436693,
"epoch": 4.807453416149068,
"grad_norm": 0.06382288783788681,
"learning_rate": 7.869169779230911e-08,
"loss": 0.0019037414342164994,
"mean_token_accuracy": 0.9986111104488373,
"num_tokens": 17303678.0,
"step": 3870
},
{
"entropy": 2.0258702844381333,
"epoch": 4.819875776397516,
"grad_norm": 0.012522595003247261,
"learning_rate": 6.893761025840607e-08,
"loss": 0.003264884650707245,
"mean_token_accuracy": 0.9989130437374115,
"num_tokens": 17353254.0,
"step": 3880
},
{
"entropy": 2.001204323768616,
"epoch": 4.832298136645963,
"grad_norm": 0.0486503429710865,
"learning_rate": 5.982661529759459e-08,
"loss": 0.002944428473711014,
"mean_token_accuracy": 0.9977272734045982,
"num_tokens": 17395502.0,
"step": 3890
},
{
"entropy": 1.9402426928281784,
"epoch": 4.84472049689441,
"grad_norm": 0.004425989929586649,
"learning_rate": 5.135930289843716e-08,
"loss": 0.0007586335297673941,
"mean_token_accuracy": 1.0,
"num_tokens": 17449789.0,
"step": 3900
},
{
"entropy": 2.047208711504936,
"epoch": 4.857142857142857,
"grad_norm": 0.4375987946987152,
"learning_rate": 4.353622136739844e-08,
"loss": 0.0035171639174222946,
"mean_token_accuracy": 0.9985294118523598,
"num_tokens": 17494196.0,
"step": 3910
},
{
"entropy": 2.005463221669197,
"epoch": 4.869565217391305,
"grad_norm": 0.02442975342273712,
"learning_rate": 3.6357877293342615e-08,
"loss": 0.0002247157972306013,
"mean_token_accuracy": 1.0,
"num_tokens": 17540344.0,
"step": 3920
},
{
"entropy": 2.066293877363205,
"epoch": 4.881987577639752,
"grad_norm": 0.038806382566690445,
"learning_rate": 2.982473551473297e-08,
"loss": 0.0010721116326749326,
"mean_token_accuracy": 1.0,
"num_tokens": 17579881.0,
"step": 3930
},
{
"entropy": 1.9953967750072479,
"epoch": 4.894409937888199,
"grad_norm": 0.030400315299630165,
"learning_rate": 2.3937219089524843e-08,
"loss": 0.0002892194781452417,
"mean_token_accuracy": 1.0,
"num_tokens": 17628781.0,
"step": 3940
},
{
"entropy": 2.031711795926094,
"epoch": 4.906832298136646,
"grad_norm": 0.037453047931194305,
"learning_rate": 1.8695709267774197e-08,
"loss": 0.00017593621741980315,
"mean_token_accuracy": 1.0,
"num_tokens": 17676511.0,
"step": 3950
},
{
"entropy": 2.035673101246357,
"epoch": 4.919254658385093,
"grad_norm": 0.12591120600700378,
"learning_rate": 1.410054546694739e-08,
"loss": 0.006961337476968765,
"mean_token_accuracy": 0.9986842110753059,
"num_tokens": 17715980.0,
"step": 3960
},
{
"entropy": 2.0690086662769316,
"epoch": 4.931677018633541,
"grad_norm": 0.00455585028976202,
"learning_rate": 1.0152025249943187e-08,
"loss": 0.0008870340883731842,
"mean_token_accuracy": 1.0,
"num_tokens": 17757285.0,
"step": 3970
},
{
"entropy": 1.9871522605419158,
"epoch": 4.944099378881988,
"grad_norm": 0.04197465628385544,
"learning_rate": 6.850404305823732e-09,
"loss": 0.0005288542248308659,
"mean_token_accuracy": 1.0,
"num_tokens": 17806632.0,
"step": 3980
},
{
"entropy": 2.0136446237564085,
"epoch": 4.956521739130435,
"grad_norm": 0.00905593391507864,
"learning_rate": 4.195896433255575e-09,
"loss": 0.0002543700160458684,
"mean_token_accuracy": 1.0,
"num_tokens": 17857937.0,
"step": 3990
},
{
"entropy": 2.014116221666336,
"epoch": 4.9689440993788825,
"grad_norm": 0.1457187533378601,
"learning_rate": 2.1886735266696268e-09,
"loss": 0.00390925370156765,
"mean_token_accuracy": 0.9984375,
"num_tokens": 17901151.0,
"step": 4000
},
{
"epoch": 4.9689440993788825,
"eval_entropy": 1.9050748003189342,
"eval_loss": 0.7378253936767578,
"eval_mean_token_accuracy": 0.9051745814838629,
"eval_num_tokens": 17901151.0,
"eval_runtime": 1014.6596,
"eval_samples_per_second": 7.54,
"eval_steps_per_second": 0.943,
"step": 4000
},
{
"entropy": 2.0390416413545607,
"epoch": 4.9813664596273295,
"grad_norm": 0.013149413280189037,
"learning_rate": 8.288655651234045e-10,
"loss": 0.0001981796929612756,
"mean_token_accuracy": 1.0,
"num_tokens": 17946275.0,
"step": 4010
},
{
"entropy": 2.0683668941259383,
"epoch": 4.9937888198757765,
"grad_norm": 0.027039172127842903,
"learning_rate": 1.1656060388998136e-10,
"loss": 0.0002283555455505848,
"mean_token_accuracy": 1.0,
"num_tokens": 17994096.0,
"step": 4020
},
{
"epoch": 5.0,
"eval_entropy": 1.9048992476368647,
"eval_loss": 0.7375593781471252,
"eval_mean_token_accuracy": 0.9050571202235287,
"eval_num_tokens": 18019280.0,
"eval_runtime": 1015.1336,
"eval_samples_per_second": 7.537,
"eval_steps_per_second": 0.943,
"step": 4025
},
{
"epoch": 5.0,
"step": 4025,
"total_flos": 1.0590717965324943e+18,
"train_loss": 0.07133869599467085,
"train_runtime": 16940.0407,
"train_samples_per_second": 1.901,
"train_steps_per_second": 0.238
}
],
"logging_steps": 10,
"max_steps": 4025,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.0590717965324943e+18,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}