{ "best_global_step": 1500, "best_metric": 0.6151674389839172, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_legal-nomenclature-purist_ffn_only_5ep_eval500/checkpoint-1500", "epoch": 5.0, "eval_steps": 500, "global_step": 4025, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.2218834400177, "epoch": 0.012422360248447204, "grad_norm": 5.412133693695068, "learning_rate": 1.4876033057851241e-06, "loss": 1.720897102355957, "mean_token_accuracy": 0.6472304485738277, "num_tokens": 45328.0, "step": 10 }, { "entropy": 2.2021790027618406, "epoch": 0.024844720496894408, "grad_norm": 6.844479084014893, "learning_rate": 3.1404958677685953e-06, "loss": 2.003491973876953, "mean_token_accuracy": 0.613143677636981, "num_tokens": 90713.0, "step": 20 }, { "entropy": 2.260706987977028, "epoch": 0.037267080745341616, "grad_norm": 8.312433242797852, "learning_rate": 4.793388429752067e-06, "loss": 1.9829626083374023, "mean_token_accuracy": 0.5876670200377703, "num_tokens": 133436.0, "step": 30 }, { "entropy": 2.277198740839958, "epoch": 0.049689440993788817, "grad_norm": 4.128373622894287, "learning_rate": 6.446280991735537e-06, "loss": 1.683332633972168, "mean_token_accuracy": 0.6403063053265214, "num_tokens": 173768.0, "step": 40 }, { "entropy": 2.275305709242821, "epoch": 0.062111801242236024, "grad_norm": 3.860987424850464, "learning_rate": 8.099173553719009e-06, "loss": 1.4613001823425293, "mean_token_accuracy": 0.6954401664435863, "num_tokens": 216454.0, "step": 50 }, { "entropy": 2.226709768176079, "epoch": 0.07453416149068323, "grad_norm": 3.2089221477508545, "learning_rate": 9.75206611570248e-06, "loss": 1.0452740669250489, "mean_token_accuracy": 0.8045810982584953, "num_tokens": 261427.0, "step": 60 }, { "entropy": 2.293886032700539, "epoch": 0.08695652173913043, "grad_norm": 6.784758567810059, "learning_rate": 1.1404958677685952e-05, "loss": 0.9967960357666016, "mean_token_accuracy": 0.7896769121289253, "num_tokens": 303808.0, "step": 70 }, { "entropy": 2.306024971604347, "epoch": 0.09937888198757763, "grad_norm": 6.519183158874512, "learning_rate": 1.3057851239669424e-05, "loss": 0.8302921295166016, "mean_token_accuracy": 0.7989890590310097, "num_tokens": 350862.0, "step": 80 }, { "entropy": 2.2958358585834504, "epoch": 0.11180124223602485, "grad_norm": 3.592912197113037, "learning_rate": 1.4710743801652893e-05, "loss": 0.639973497390747, "mean_token_accuracy": 0.8467254146933556, "num_tokens": 395570.0, "step": 90 }, { "entropy": 2.326699784398079, "epoch": 0.12422360248447205, "grad_norm": 4.474846839904785, "learning_rate": 1.6363636363636366e-05, "loss": 0.6599883079528809, "mean_token_accuracy": 0.8683099627494812, "num_tokens": 433623.0, "step": 100 }, { "entropy": 2.1977039337158204, "epoch": 0.13664596273291926, "grad_norm": 3.3706459999084473, "learning_rate": 1.8016528925619837e-05, "loss": 0.4734317779541016, "mean_token_accuracy": 0.8930498465895653, "num_tokens": 482905.0, "step": 110 }, { "entropy": 2.1412303030490873, "epoch": 0.14906832298136646, "grad_norm": 7.407418251037598, "learning_rate": 1.9669421487603307e-05, "loss": 0.49360313415527346, "mean_token_accuracy": 0.880374065041542, "num_tokens": 530860.0, "step": 120 }, { "entropy": 2.1529846519231794, "epoch": 0.16149068322981366, "grad_norm": 4.532316207885742, "learning_rate": 1.9999792781461744e-05, "loss": 0.3332545757293701, "mean_token_accuracy": 0.9231329143047333, "num_tokens": 573626.0, "step": 130 }, { "entropy": 2.164460891485214, "epoch": 0.17391304347826086, "grad_norm": 4.046708583831787, "learning_rate": 1.9998950970868584e-05, "loss": 0.353117036819458, "mean_token_accuracy": 0.9148650147020817, "num_tokens": 615581.0, "step": 140 }, { "entropy": 2.0522007673978804, "epoch": 0.18633540372670807, "grad_norm": 6.083385944366455, "learning_rate": 1.9997461671531945e-05, "loss": 0.29966306686401367, "mean_token_accuracy": 0.9333024516701698, "num_tokens": 667334.0, "step": 150 }, { "entropy": 2.215573158860207, "epoch": 0.19875776397515527, "grad_norm": 5.368868827819824, "learning_rate": 1.9995324979892407e-05, "loss": 0.39634816646575927, "mean_token_accuracy": 0.8946829706430435, "num_tokens": 705094.0, "step": 160 }, { "entropy": 2.1504065871238707, "epoch": 0.2111801242236025, "grad_norm": 1.7437018156051636, "learning_rate": 1.9992541034312862e-05, "loss": 0.2833492517471313, "mean_token_accuracy": 0.9131577238440514, "num_tokens": 752206.0, "step": 170 }, { "entropy": 2.067841339111328, "epoch": 0.2236024844720497, "grad_norm": 7.387396812438965, "learning_rate": 1.9989110015069562e-05, "loss": 0.2200930118560791, "mean_token_accuracy": 0.9420874312520027, "num_tokens": 802186.0, "step": 180 }, { "entropy": 2.022136354446411, "epoch": 0.2360248447204969, "grad_norm": 5.731217861175537, "learning_rate": 1.9985032144340452e-05, "loss": 0.30328352451324464, "mean_token_accuracy": 0.9335977420210838, "num_tokens": 849350.0, "step": 190 }, { "entropy": 2.0770725339651106, "epoch": 0.2484472049689441, "grad_norm": 3.3734312057495117, "learning_rate": 1.9980307686190764e-05, "loss": 0.2324429988861084, "mean_token_accuracy": 0.9344113290309906, "num_tokens": 896011.0, "step": 200 }, { "entropy": 2.0887098640203474, "epoch": 0.2608695652173913, "grad_norm": 4.338788032531738, "learning_rate": 1.997493694655595e-05, "loss": 0.2637628078460693, "mean_token_accuracy": 0.9405189320445061, "num_tokens": 938272.0, "step": 210 }, { "entropy": 2.057726114988327, "epoch": 0.2732919254658385, "grad_norm": 7.423470973968506, "learning_rate": 1.9968920273221833e-05, "loss": 0.245102596282959, "mean_token_accuracy": 0.934748524427414, "num_tokens": 985910.0, "step": 220 }, { "entropy": 2.0852247208356856, "epoch": 0.2857142857142857, "grad_norm": 4.9054999351501465, "learning_rate": 1.996225805580211e-05, "loss": 0.16561169624328614, "mean_token_accuracy": 0.9549386024475097, "num_tokens": 1026611.0, "step": 230 }, { "entropy": 2.1346270740032196, "epoch": 0.2981366459627329, "grad_norm": 0.8074743151664734, "learning_rate": 1.9954950725713117e-05, "loss": 0.2407538890838623, "mean_token_accuracy": 0.944537715613842, "num_tokens": 1071660.0, "step": 240 }, { "entropy": 2.122556984424591, "epoch": 0.3105590062111801, "grad_norm": 0.8064472079277039, "learning_rate": 1.9946998756145894e-05, "loss": 0.14700745344161986, "mean_token_accuracy": 0.968578913807869, "num_tokens": 1120556.0, "step": 250 }, { "entropy": 2.107454228401184, "epoch": 0.32298136645962733, "grad_norm": 4.961323261260986, "learning_rate": 1.993840266203553e-05, "loss": 0.19659453630447388, "mean_token_accuracy": 0.9422186747193336, "num_tokens": 1162755.0, "step": 260 }, { "entropy": 2.1008795320987703, "epoch": 0.33540372670807456, "grad_norm": 4.268195152282715, "learning_rate": 1.9929163000027848e-05, "loss": 0.19777419567108154, "mean_token_accuracy": 0.9608424186706543, "num_tokens": 1212228.0, "step": 270 }, { "entropy": 2.0714638978242874, "epoch": 0.34782608695652173, "grad_norm": 4.130878925323486, "learning_rate": 1.9919280368443316e-05, "loss": 0.1941136121749878, "mean_token_accuracy": 0.9510379567742347, "num_tokens": 1258377.0, "step": 280 }, { "entropy": 2.146782675385475, "epoch": 0.36024844720496896, "grad_norm": 8.89709758758545, "learning_rate": 1.9908755407238342e-05, "loss": 0.175544273853302, "mean_token_accuracy": 0.9587054386734962, "num_tokens": 1298826.0, "step": 290 }, { "entropy": 2.1432328313589095, "epoch": 0.37267080745341613, "grad_norm": 2.826094150543213, "learning_rate": 1.9897588797963818e-05, "loss": 0.19219242334365844, "mean_token_accuracy": 0.9561588227748871, "num_tokens": 1339864.0, "step": 300 }, { "entropy": 2.1786401599645613, "epoch": 0.38509316770186336, "grad_norm": 2.988393545150757, "learning_rate": 1.9885781263720977e-05, "loss": 0.15490752458572388, "mean_token_accuracy": 0.952945676445961, "num_tokens": 1382819.0, "step": 310 }, { "entropy": 2.150338906049728, "epoch": 0.39751552795031053, "grad_norm": 3.8469715118408203, "learning_rate": 1.9873333569114578e-05, "loss": 0.11064722537994384, "mean_token_accuracy": 0.9639346539974213, "num_tokens": 1428235.0, "step": 320 }, { "entropy": 2.0485803872346877, "epoch": 0.40993788819875776, "grad_norm": 3.4940409660339355, "learning_rate": 1.9860246520203393e-05, "loss": 0.12654770612716676, "mean_token_accuracy": 0.9720151156187058, "num_tokens": 1475653.0, "step": 330 }, { "entropy": 2.0982570886611938, "epoch": 0.422360248447205, "grad_norm": 9.01036262512207, "learning_rate": 1.984652096444801e-05, "loss": 0.17338567972183228, "mean_token_accuracy": 0.9567379966378212, "num_tokens": 1522587.0, "step": 340 }, { "entropy": 2.037535387277603, "epoch": 0.43478260869565216, "grad_norm": 6.306981563568115, "learning_rate": 1.9832157790655947e-05, "loss": 0.15461095571517944, "mean_token_accuracy": 0.9642502069473267, "num_tokens": 1570146.0, "step": 350 }, { "entropy": 2.0148197203874587, "epoch": 0.4472049689440994, "grad_norm": 5.378430366516113, "learning_rate": 1.9817157928924123e-05, "loss": 0.10572208166122436, "mean_token_accuracy": 0.9662203952670098, "num_tokens": 1619006.0, "step": 360 }, { "entropy": 2.1017101377248766, "epoch": 0.45962732919254656, "grad_norm": 4.263245582580566, "learning_rate": 1.980152235057858e-05, "loss": 0.2266246795654297, "mean_token_accuracy": 0.9508525714278221, "num_tokens": 1666344.0, "step": 370 }, { "entropy": 2.1142481714487076, "epoch": 0.4720496894409938, "grad_norm": 1.6734673976898193, "learning_rate": 1.9785252068111634e-05, "loss": 0.141499662399292, "mean_token_accuracy": 0.9647441744804383, "num_tokens": 1707202.0, "step": 380 }, { "entropy": 2.0245371520519257, "epoch": 0.484472049689441, "grad_norm": 1.1180492639541626, "learning_rate": 1.976834813511629e-05, "loss": 0.07580887675285339, "mean_token_accuracy": 0.9793496742844582, "num_tokens": 1752612.0, "step": 390 }, { "entropy": 2.174392205476761, "epoch": 0.4968944099378882, "grad_norm": 6.994105815887451, "learning_rate": 1.9750811646218008e-05, "loss": 0.11529726982116699, "mean_token_accuracy": 0.9770008429884911, "num_tokens": 1787340.0, "step": 400 }, { "entropy": 2.093138635158539, "epoch": 0.5093167701863354, "grad_norm": 6.234873294830322, "learning_rate": 1.9732643737003827e-05, "loss": 0.1870105028152466, "mean_token_accuracy": 0.9562314331531525, "num_tokens": 1832755.0, "step": 410 }, { "entropy": 2.0406362146139143, "epoch": 0.5217391304347826, "grad_norm": 6.59069299697876, "learning_rate": 1.9713845583948838e-05, "loss": 0.12588831186294555, "mean_token_accuracy": 0.9748386725783348, "num_tokens": 1877258.0, "step": 420 }, { "entropy": 2.0712024956941604, "epoch": 0.5341614906832298, "grad_norm": 1.3715144395828247, "learning_rate": 1.9694418404339985e-05, "loss": 0.14443048238754272, "mean_token_accuracy": 0.96854527592659, "num_tokens": 1926633.0, "step": 430 }, { "entropy": 2.120563179254532, "epoch": 0.546583850931677, "grad_norm": 0.8505068421363831, "learning_rate": 1.9674363456197252e-05, "loss": 0.10405553579330444, "mean_token_accuracy": 0.9761933490633965, "num_tokens": 1968058.0, "step": 440 }, { "entropy": 2.1187560498714446, "epoch": 0.5590062111801242, "grad_norm": 0.2388964146375656, "learning_rate": 1.965368203819219e-05, "loss": 0.12412438392639161, "mean_token_accuracy": 0.9798449590802193, "num_tokens": 2011757.0, "step": 450 }, { "entropy": 2.079404717683792, "epoch": 0.5714285714285714, "grad_norm": 6.426936149597168, "learning_rate": 1.963237548956382e-05, "loss": 0.13763257265090942, "mean_token_accuracy": 0.9699526458978653, "num_tokens": 2056687.0, "step": 460 }, { "entropy": 2.1087421059608458, "epoch": 0.5838509316770186, "grad_norm": 5.350924968719482, "learning_rate": 1.9610445190031927e-05, "loss": 0.17600059509277344, "mean_token_accuracy": 0.9602105036377907, "num_tokens": 2107909.0, "step": 470 }, { "entropy": 2.1104681938886642, "epoch": 0.5962732919254659, "grad_norm": 4.915591239929199, "learning_rate": 1.9587892559707687e-05, "loss": 0.14593877792358398, "mean_token_accuracy": 0.9634651705622673, "num_tokens": 2152714.0, "step": 480 }, { "entropy": 2.0843971610069274, "epoch": 0.6086956521739131, "grad_norm": 5.020099639892578, "learning_rate": 1.9564719059001735e-05, "loss": 0.09503247737884521, "mean_token_accuracy": 0.9802449300885201, "num_tokens": 2199372.0, "step": 490 }, { "entropy": 2.117968979477882, "epoch": 0.6211180124223602, "grad_norm": 6.113184928894043, "learning_rate": 1.9540926188529567e-05, "loss": 0.06596333384513856, "mean_token_accuracy": 0.9794966623187065, "num_tokens": 2240337.0, "step": 500 }, { "epoch": 0.6211180124223602, "eval_entropy": 1.9857167843865502, "eval_loss": 0.6501790285110474, "eval_mean_token_accuracy": 0.8782477229366482, "eval_num_tokens": 2240337.0, "eval_runtime": 1016.9781, "eval_samples_per_second": 7.523, "eval_steps_per_second": 0.941, "step": 500 }, { "entropy": 2.1537328869104386, "epoch": 0.6335403726708074, "grad_norm": 1.456288456916809, "learning_rate": 1.9516515489014394e-05, "loss": 0.13476414680480958, "mean_token_accuracy": 0.9724704563617707, "num_tokens": 2278433.0, "step": 510 }, { "entropy": 2.1237567752599715, "epoch": 0.6459627329192547, "grad_norm": 7.178049564361572, "learning_rate": 1.9491488541187356e-05, "loss": 0.14870620965957643, "mean_token_accuracy": 0.9673199355602264, "num_tokens": 2325326.0, "step": 520 }, { "entropy": 2.0662467658519743, "epoch": 0.6583850931677019, "grad_norm": 4.662649154663086, "learning_rate": 1.946584696568516e-05, "loss": 0.06994055509567261, "mean_token_accuracy": 0.9829941034317017, "num_tokens": 2369447.0, "step": 530 }, { "entropy": 2.123342525959015, "epoch": 0.6708074534161491, "grad_norm": 3.5230398178100586, "learning_rate": 1.9439592422945147e-05, "loss": 0.12530711889266968, "mean_token_accuracy": 0.968981710076332, "num_tokens": 2414329.0, "step": 540 }, { "entropy": 2.109190860390663, "epoch": 0.6832298136645962, "grad_norm": 5.585573673248291, "learning_rate": 1.9412726613097747e-05, "loss": 0.07817915678024293, "mean_token_accuracy": 0.9775777757167816, "num_tokens": 2460847.0, "step": 550 }, { "entropy": 2.144969728589058, "epoch": 0.6956521739130435, "grad_norm": 4.607976913452148, "learning_rate": 1.9385251275856413e-05, "loss": 0.08262240886688232, "mean_token_accuracy": 0.9754370078444481, "num_tokens": 2501095.0, "step": 560 }, { "entropy": 2.1769137263298033, "epoch": 0.7080745341614907, "grad_norm": 1.4531834125518799, "learning_rate": 1.9357168190404937e-05, "loss": 0.08149978518486023, "mean_token_accuracy": 0.9809109061956406, "num_tokens": 2545700.0, "step": 570 }, { "entropy": 2.121944713592529, "epoch": 0.7204968944099379, "grad_norm": 0.1272820085287094, "learning_rate": 1.932847917528227e-05, "loss": 0.09725183248519897, "mean_token_accuracy": 0.9799433529376984, "num_tokens": 2587599.0, "step": 580 }, { "entropy": 2.0991091817617415, "epoch": 0.7329192546583851, "grad_norm": 4.6163530349731445, "learning_rate": 1.9299186088264728e-05, "loss": 0.07552647590637207, "mean_token_accuracy": 0.9778737679123879, "num_tokens": 2632497.0, "step": 590 }, { "entropy": 2.1005853712558746, "epoch": 0.7453416149068323, "grad_norm": 4.137128829956055, "learning_rate": 1.9269290826245713e-05, "loss": 0.09553526043891906, "mean_token_accuracy": 0.9701759338378906, "num_tokens": 2677204.0, "step": 600 }, { "entropy": 2.1062012016773224, "epoch": 0.7577639751552795, "grad_norm": 1.1038886308670044, "learning_rate": 1.9238795325112867e-05, "loss": 0.08808867931365967, "mean_token_accuracy": 0.9731768816709518, "num_tokens": 2726745.0, "step": 610 }, { "entropy": 2.1135039806365965, "epoch": 0.7701863354037267, "grad_norm": 2.838488817214966, "learning_rate": 1.9207701559622724e-05, "loss": 0.05545814037322998, "mean_token_accuracy": 0.9834772542119026, "num_tokens": 2767898.0, "step": 620 }, { "entropy": 2.056372728943825, "epoch": 0.782608695652174, "grad_norm": 7.393406391143799, "learning_rate": 1.9176011543272815e-05, "loss": 0.11480764150619507, "mean_token_accuracy": 0.9796148985624313, "num_tokens": 2812697.0, "step": 630 }, { "entropy": 2.0691574245691298, "epoch": 0.7950310559006211, "grad_norm": 6.208304405212402, "learning_rate": 1.91437273281713e-05, "loss": 0.11305643320083618, "mean_token_accuracy": 0.974467147886753, "num_tokens": 2855947.0, "step": 640 }, { "entropy": 2.0940282166004183, "epoch": 0.8074534161490683, "grad_norm": 1.7314088344573975, "learning_rate": 1.9110851004904076e-05, "loss": 0.13724110126495362, "mean_token_accuracy": 0.9700473248958588, "num_tokens": 2906029.0, "step": 650 }, { "entropy": 2.0931085854768754, "epoch": 0.8198757763975155, "grad_norm": 2.535383939743042, "learning_rate": 1.9077384702399396e-05, "loss": 0.06062517762184143, "mean_token_accuracy": 0.9809448182582855, "num_tokens": 2952756.0, "step": 660 }, { "entropy": 2.0389942497015, "epoch": 0.8322981366459627, "grad_norm": 2.38712739944458, "learning_rate": 1.9043330587790016e-05, "loss": 0.07465954422950745, "mean_token_accuracy": 0.9777025073766709, "num_tokens": 2996532.0, "step": 670 }, { "entropy": 2.017015664279461, "epoch": 0.84472049689441, "grad_norm": 2.4707024097442627, "learning_rate": 1.9008690866272856e-05, "loss": 0.09084809422492982, "mean_token_accuracy": 0.9794181376695633, "num_tokens": 3043785.0, "step": 680 }, { "entropy": 2.059348088502884, "epoch": 0.8571428571428571, "grad_norm": 5.584771156311035, "learning_rate": 1.89734677809662e-05, "loss": 0.04494470953941345, "mean_token_accuracy": 0.9811143398284912, "num_tokens": 3087397.0, "step": 690 }, { "entropy": 2.100178116559982, "epoch": 0.8695652173913043, "grad_norm": 9.014580726623535, "learning_rate": 1.8937663612764446e-05, "loss": 0.05163530111312866, "mean_token_accuracy": 0.9877288997173309, "num_tokens": 3132304.0, "step": 700 }, { "entropy": 2.0874249041080475, "epoch": 0.8819875776397516, "grad_norm": 3.579822540283203, "learning_rate": 1.8901280680190405e-05, "loss": 0.3258012533187866, "mean_token_accuracy": 0.955612650513649, "num_tokens": 3174559.0, "step": 710 }, { "entropy": 2.0551782071590425, "epoch": 0.8944099378881988, "grad_norm": 4.217214107513428, "learning_rate": 1.8864321339245148e-05, "loss": 0.10493965148925781, "mean_token_accuracy": 0.9790847629308701, "num_tokens": 3218648.0, "step": 720 }, { "entropy": 2.1269098341465, "epoch": 0.906832298136646, "grad_norm": 3.0778424739837646, "learning_rate": 1.8826787983255474e-05, "loss": 0.07121096849441529, "mean_token_accuracy": 0.9841245651245117, "num_tokens": 3258619.0, "step": 730 }, { "entropy": 2.196052446961403, "epoch": 0.9192546583850931, "grad_norm": 1.9955366849899292, "learning_rate": 1.87886830427189e-05, "loss": 0.07663369774818421, "mean_token_accuracy": 0.9771979004144669, "num_tokens": 3299305.0, "step": 740 }, { "entropy": 2.1504336088895797, "epoch": 0.9316770186335404, "grad_norm": 0.28726229071617126, "learning_rate": 1.8750008985146277e-05, "loss": 0.09686735272407532, "mean_token_accuracy": 0.9818914562463761, "num_tokens": 3341352.0, "step": 750 }, { "entropy": 2.124210861325264, "epoch": 0.9440993788819876, "grad_norm": 0.5584977269172668, "learning_rate": 1.8710768314902018e-05, "loss": 0.041911613941192624, "mean_token_accuracy": 0.9888250693678856, "num_tokens": 3388572.0, "step": 760 }, { "entropy": 2.162134176492691, "epoch": 0.9565217391304348, "grad_norm": 0.7624562382698059, "learning_rate": 1.867096357304191e-05, "loss": 0.06633872389793397, "mean_token_accuracy": 0.9857817873358726, "num_tokens": 3431740.0, "step": 770 }, { "entropy": 2.1005555152893067, "epoch": 0.968944099378882, "grad_norm": 2.72621750831604, "learning_rate": 1.8630597337148582e-05, "loss": 0.04687671065330505, "mean_token_accuracy": 0.9858215063810348, "num_tokens": 3483799.0, "step": 780 }, { "entropy": 2.0882847398519515, "epoch": 0.9813664596273292, "grad_norm": 1.5134168863296509, "learning_rate": 1.8589672221164578e-05, "loss": 0.05004507303237915, "mean_token_accuracy": 0.9874317914247512, "num_tokens": 3530053.0, "step": 790 }, { "entropy": 2.097977989912033, "epoch": 0.9937888198757764, "grad_norm": 0.2564803659915924, "learning_rate": 1.85481908752231e-05, "loss": 0.0792747676372528, "mean_token_accuracy": 0.9824414849281311, "num_tokens": 3581288.0, "step": 800 }, { "entropy": 2.081494650244713, "epoch": 1.0062111801242235, "grad_norm": 1.7785015106201172, "learning_rate": 1.8506155985476386e-05, "loss": 0.058735990524291994, "mean_token_accuracy": 0.9833749994635582, "num_tokens": 3629656.0, "step": 810 }, { "entropy": 2.0798818826675416, "epoch": 1.0186335403726707, "grad_norm": 0.17327219247817993, "learning_rate": 1.8463570273921777e-05, "loss": 0.012010685354471206, "mean_token_accuracy": 0.9959963768720627, "num_tokens": 3676785.0, "step": 820 }, { "entropy": 2.0705758064985273, "epoch": 1.031055900621118, "grad_norm": 0.6708211898803711, "learning_rate": 1.8420436498225446e-05, "loss": 0.029526194930076598, "mean_token_accuracy": 0.9904356062412262, "num_tokens": 3719647.0, "step": 830 }, { "entropy": 2.083918330073357, "epoch": 1.0434782608695652, "grad_norm": 0.1544179767370224, "learning_rate": 1.8376757451543827e-05, "loss": 0.05709845423698425, "mean_token_accuracy": 0.9897336810827255, "num_tokens": 3762547.0, "step": 840 }, { "entropy": 2.110027256608009, "epoch": 1.0559006211180124, "grad_norm": 4.642289161682129, "learning_rate": 1.8332535962342738e-05, "loss": 0.03640684187412262, "mean_token_accuracy": 0.9888481795787811, "num_tokens": 3804605.0, "step": 850 }, { "entropy": 2.0938026130199434, "epoch": 1.0683229813664596, "grad_norm": 0.21419347822666168, "learning_rate": 1.828777489421423e-05, "loss": 0.03816946446895599, "mean_token_accuracy": 0.9911127641797066, "num_tokens": 3848041.0, "step": 860 }, { "entropy": 2.024568662047386, "epoch": 1.0807453416149069, "grad_norm": 3.198349952697754, "learning_rate": 1.824247714569114e-05, "loss": 0.10569311380386352, "mean_token_accuracy": 0.9802387565374374, "num_tokens": 3892052.0, "step": 870 }, { "entropy": 2.046171006560326, "epoch": 1.093167701863354, "grad_norm": 3.6660497188568115, "learning_rate": 1.8196645650059407e-05, "loss": 0.03053833544254303, "mean_token_accuracy": 0.9916201144456863, "num_tokens": 3940927.0, "step": 880 }, { "entropy": 2.0361697018146514, "epoch": 1.1055900621118013, "grad_norm": 1.2115179300308228, "learning_rate": 1.8150283375168112e-05, "loss": 0.08387028574943542, "mean_token_accuracy": 0.9851482644677162, "num_tokens": 3985643.0, "step": 890 }, { "entropy": 2.06917799115181, "epoch": 1.1180124223602483, "grad_norm": 1.0747365951538086, "learning_rate": 1.810339332323732e-05, "loss": 0.030901220440864564, "mean_token_accuracy": 0.9925313547253609, "num_tokens": 4026723.0, "step": 900 }, { "entropy": 2.0700403451919556, "epoch": 1.1304347826086956, "grad_norm": 2.125000238418579, "learning_rate": 1.8055978530663632e-05, "loss": 0.06523830890655517, "mean_token_accuracy": 0.9856161668896675, "num_tokens": 4068487.0, "step": 910 }, { "entropy": 2.0906931340694426, "epoch": 1.1428571428571428, "grad_norm": 0.4668339788913727, "learning_rate": 1.8008042067823584e-05, "loss": 0.020703746378421782, "mean_token_accuracy": 0.9917388156056404, "num_tokens": 4111658.0, "step": 920 }, { "entropy": 2.04544812142849, "epoch": 1.15527950310559, "grad_norm": 0.5313199758529663, "learning_rate": 1.7959587038874826e-05, "loss": 0.05440770983695984, "mean_token_accuracy": 0.9829235851764679, "num_tokens": 4155785.0, "step": 930 }, { "entropy": 2.0342077732086183, "epoch": 1.1677018633540373, "grad_norm": 6.212786674499512, "learning_rate": 1.791061658155509e-05, "loss": 0.04542175531387329, "mean_token_accuracy": 0.9873297110199928, "num_tokens": 4203227.0, "step": 940 }, { "entropy": 2.063344043493271, "epoch": 1.1801242236024845, "grad_norm": 2.8781256675720215, "learning_rate": 1.786113386697903e-05, "loss": 0.02678465247154236, "mean_token_accuracy": 0.9917070686817169, "num_tokens": 4246203.0, "step": 950 }, { "entropy": 2.0039207309484484, "epoch": 1.1925465838509317, "grad_norm": 4.898998737335205, "learning_rate": 1.7811142099432847e-05, "loss": 0.03269885778427124, "mean_token_accuracy": 0.9882596805691719, "num_tokens": 4293923.0, "step": 960 }, { "entropy": 2.1546689569950104, "epoch": 1.204968944099379, "grad_norm": 0.16982388496398926, "learning_rate": 1.7760644516166815e-05, "loss": 0.01413324624300003, "mean_token_accuracy": 0.9912873223423958, "num_tokens": 4329772.0, "step": 970 }, { "entropy": 2.052805933356285, "epoch": 1.2173913043478262, "grad_norm": 7.0196027755737305, "learning_rate": 1.7709644387185646e-05, "loss": 0.05414450168609619, "mean_token_accuracy": 0.9854385688900947, "num_tokens": 4377093.0, "step": 980 }, { "entropy": 1.9994864210486412, "epoch": 1.2298136645962732, "grad_norm": 3.947655439376831, "learning_rate": 1.765814501503672e-05, "loss": 0.05991327166557312, "mean_token_accuracy": 0.9902179941534996, "num_tokens": 4424964.0, "step": 990 }, { "entropy": 2.0789844542741776, "epoch": 1.2422360248447206, "grad_norm": 0.5713167786598206, "learning_rate": 1.760614973459626e-05, "loss": 0.016869233548641206, "mean_token_accuracy": 0.9927510812878608, "num_tokens": 4470312.0, "step": 1000 }, { "epoch": 1.2422360248447206, "eval_entropy": 1.93758956541462, "eval_loss": 0.6518564820289612, "eval_mean_token_accuracy": 0.8916452462894914, "eval_num_tokens": 4470312.0, "eval_runtime": 1016.5304, "eval_samples_per_second": 7.527, "eval_steps_per_second": 0.941, "step": 1000 }, { "entropy": 2.0249680817127227, "epoch": 1.2546583850931676, "grad_norm": 0.23046031594276428, "learning_rate": 1.7553661912853348e-05, "loss": 0.1257791757583618, "mean_token_accuracy": 0.9823350816965103, "num_tokens": 4514663.0, "step": 1010 }, { "entropy": 2.073505198955536, "epoch": 1.2670807453416149, "grad_norm": 1.52617609500885, "learning_rate": 1.7500684948691917e-05, "loss": 0.058462345600128175, "mean_token_accuracy": 0.9881463676691056, "num_tokens": 4556354.0, "step": 1020 }, { "entropy": 2.068504738807678, "epoch": 1.279503105590062, "grad_norm": 4.715869426727295, "learning_rate": 1.7447222272670634e-05, "loss": 0.07855769991874695, "mean_token_accuracy": 0.9773707166314125, "num_tokens": 4598771.0, "step": 1030 }, { "entropy": 2.019624277949333, "epoch": 1.2919254658385093, "grad_norm": 0.7180259227752686, "learning_rate": 1.7393277346800766e-05, "loss": 0.03097618222236633, "mean_token_accuracy": 0.9947341948747634, "num_tokens": 4645010.0, "step": 1040 }, { "entropy": 2.0088700890541076, "epoch": 1.3043478260869565, "grad_norm": 1.9578375816345215, "learning_rate": 1.7338853664321993e-05, "loss": 0.02723775804042816, "mean_token_accuracy": 0.9935153171420097, "num_tokens": 4694582.0, "step": 1050 }, { "entropy": 1.9856946557760238, "epoch": 1.3167701863354038, "grad_norm": 5.278125286102295, "learning_rate": 1.7283954749476195e-05, "loss": 0.11669650077819824, "mean_token_accuracy": 0.9793488040566445, "num_tokens": 4751436.0, "step": 1060 }, { "entropy": 1.9670168876647949, "epoch": 1.329192546583851, "grad_norm": 0.20898965001106262, "learning_rate": 1.7228584157279242e-05, "loss": 0.08815430998802185, "mean_token_accuracy": 0.9805598288774491, "num_tokens": 4798385.0, "step": 1070 }, { "entropy": 1.9559540659189225, "epoch": 1.341614906832298, "grad_norm": 8.317994117736816, "learning_rate": 1.7172745473290788e-05, "loss": 0.08126496076583863, "mean_token_accuracy": 0.9816830947995185, "num_tokens": 4848403.0, "step": 1080 }, { "entropy": 2.0961306214332582, "epoch": 1.3540372670807455, "grad_norm": 6.840373516082764, "learning_rate": 1.711644231338208e-05, "loss": 0.07558760643005372, "mean_token_accuracy": 0.9923902451992035, "num_tokens": 4892092.0, "step": 1090 }, { "entropy": 2.113238129019737, "epoch": 1.3664596273291925, "grad_norm": 0.18261918425559998, "learning_rate": 1.705967832350182e-05, "loss": 0.060640227794647214, "mean_token_accuracy": 0.9944021731615067, "num_tokens": 4934584.0, "step": 1100 }, { "entropy": 2.1218963980674745, "epoch": 1.3788819875776397, "grad_norm": 0.24410933256149292, "learning_rate": 1.700245717944005e-05, "loss": 0.034927898645401, "mean_token_accuracy": 0.9925606638193131, "num_tokens": 4970933.0, "step": 1110 }, { "entropy": 2.0433398693799973, "epoch": 1.391304347826087, "grad_norm": 1.8514246940612793, "learning_rate": 1.6944782586590148e-05, "loss": 0.028316974639892578, "mean_token_accuracy": 0.9947910204529762, "num_tokens": 5016657.0, "step": 1120 }, { "entropy": 2.041057598590851, "epoch": 1.4037267080745341, "grad_norm": 4.287439823150635, "learning_rate": 1.6886658279708867e-05, "loss": 0.062076061964035034, "mean_token_accuracy": 0.9811025738716126, "num_tokens": 5056567.0, "step": 1130 }, { "entropy": 2.054543226957321, "epoch": 1.4161490683229814, "grad_norm": 0.31882035732269287, "learning_rate": 1.682808802267449e-05, "loss": 0.019540122151374816, "mean_token_accuracy": 0.9918297097086907, "num_tokens": 5103165.0, "step": 1140 }, { "entropy": 2.054564669728279, "epoch": 1.4285714285714286, "grad_norm": 3.7651987075805664, "learning_rate": 1.6769075608243097e-05, "loss": 0.04563193917274475, "mean_token_accuracy": 0.9891414448618889, "num_tokens": 5146669.0, "step": 1150 }, { "entropy": 2.067859849333763, "epoch": 1.4409937888198758, "grad_norm": 3.467146158218384, "learning_rate": 1.6709624857802977e-05, "loss": 0.02285553514957428, "mean_token_accuracy": 0.989309212565422, "num_tokens": 5185720.0, "step": 1160 }, { "entropy": 2.080258083343506, "epoch": 1.453416149068323, "grad_norm": 2.778151273727417, "learning_rate": 1.6649739621127147e-05, "loss": 0.09717610478401184, "mean_token_accuracy": 0.9798510074615479, "num_tokens": 5227106.0, "step": 1170 }, { "entropy": 2.0795232325792314, "epoch": 1.4658385093167703, "grad_norm": 2.489095449447632, "learning_rate": 1.658942377612408e-05, "loss": 0.036468693614006044, "mean_token_accuracy": 0.9870076581835747, "num_tokens": 5275477.0, "step": 1180 }, { "entropy": 2.0572758257389068, "epoch": 1.4782608695652173, "grad_norm": 4.842057228088379, "learning_rate": 1.6528681228586574e-05, "loss": 0.04591853022575378, "mean_token_accuracy": 0.9935535579919815, "num_tokens": 5317541.0, "step": 1190 }, { "entropy": 2.0386213317513464, "epoch": 1.4906832298136645, "grad_norm": 0.03853341192007065, "learning_rate": 1.646751591193883e-05, "loss": 0.04719167649745941, "mean_token_accuracy": 0.9895795121788978, "num_tokens": 5364639.0, "step": 1200 }, { "entropy": 2.109779354929924, "epoch": 1.5031055900621118, "grad_norm": 0.3504042327404022, "learning_rate": 1.6405931786981753e-05, "loss": 0.01679493337869644, "mean_token_accuracy": 0.9948511898517609, "num_tokens": 5411310.0, "step": 1210 }, { "entropy": 2.0733531206846236, "epoch": 1.515527950310559, "grad_norm": 0.05558984726667404, "learning_rate": 1.6343932841636455e-05, "loss": 0.021465454995632172, "mean_token_accuracy": 0.9935497388243675, "num_tokens": 5453104.0, "step": 1220 }, { "entropy": 2.010223825275898, "epoch": 1.5279503105590062, "grad_norm": 0.0882689356803894, "learning_rate": 1.6281523090686023e-05, "loss": 0.045790371298789975, "mean_token_accuracy": 0.99332015812397, "num_tokens": 5504433.0, "step": 1230 }, { "entropy": 2.0213984131813048, "epoch": 1.5403726708074534, "grad_norm": 8.743528366088867, "learning_rate": 1.6218706575515534e-05, "loss": 0.03466806411743164, "mean_token_accuracy": 0.9918604284524918, "num_tokens": 5549172.0, "step": 1240 }, { "entropy": 2.0573623061180113, "epoch": 1.5527950310559007, "grad_norm": 0.21996565163135529, "learning_rate": 1.615548736385034e-05, "loss": 0.024254243075847625, "mean_token_accuracy": 0.9923801437020302, "num_tokens": 5595856.0, "step": 1250 }, { "entropy": 1.9642501085996629, "epoch": 1.5652173913043477, "grad_norm": 2.733859062194824, "learning_rate": 1.6091869549492702e-05, "loss": 0.050705951452255246, "mean_token_accuracy": 0.9870995670557022, "num_tokens": 5645176.0, "step": 1260 }, { "entropy": 2.0747433573007585, "epoch": 1.5776397515527951, "grad_norm": 1.6149920225143433, "learning_rate": 1.602785725205663e-05, "loss": 0.06673233509063721, "mean_token_accuracy": 0.9812404677271843, "num_tokens": 5690486.0, "step": 1270 }, { "entropy": 2.0146251261234283, "epoch": 1.5900621118012421, "grad_norm": 3.433781623840332, "learning_rate": 1.5963454616701187e-05, "loss": 0.04578670859336853, "mean_token_accuracy": 0.989951391518116, "num_tokens": 5735853.0, "step": 1280 }, { "entropy": 1.9809163212776184, "epoch": 1.6024844720496896, "grad_norm": 0.1651136875152588, "learning_rate": 1.589866581386199e-05, "loss": 0.009565576910972595, "mean_token_accuracy": 0.9978349670767784, "num_tokens": 5782323.0, "step": 1290 }, { "entropy": 2.0274841606616976, "epoch": 1.6149068322981366, "grad_norm": 1.8124768733978271, "learning_rate": 1.5833495038981215e-05, "loss": 0.019991911947727203, "mean_token_accuracy": 0.9955646678805351, "num_tokens": 5827941.0, "step": 1300 }, { "entropy": 2.0407049506902695, "epoch": 1.6273291925465838, "grad_norm": 5.722525119781494, "learning_rate": 1.5767946512235885e-05, "loss": 0.06694766879081726, "mean_token_accuracy": 0.9827992141246795, "num_tokens": 5869720.0, "step": 1310 }, { "entropy": 2.054254913330078, "epoch": 1.639751552795031, "grad_norm": 0.08413979411125183, "learning_rate": 1.5702024478264596e-05, "loss": 0.02567650079727173, "mean_token_accuracy": 0.9888634070754051, "num_tokens": 5915859.0, "step": 1320 }, { "entropy": 1.986069232225418, "epoch": 1.6521739130434783, "grad_norm": 3.2810375690460205, "learning_rate": 1.5635733205892653e-05, "loss": 0.028512659668922424, "mean_token_accuracy": 0.9913915023207664, "num_tokens": 5962619.0, "step": 1330 }, { "entropy": 2.0707494646310804, "epoch": 1.6645962732919255, "grad_norm": 0.07080954313278198, "learning_rate": 1.5569076987855645e-05, "loss": 0.022223152220249176, "mean_token_accuracy": 0.9936053708195687, "num_tokens": 6005344.0, "step": 1340 }, { "entropy": 2.025489088892937, "epoch": 1.6770186335403725, "grad_norm": 5.966955661773682, "learning_rate": 1.5502060140521454e-05, "loss": 0.02077590525150299, "mean_token_accuracy": 0.9918732196092606, "num_tokens": 6048095.0, "step": 1350 }, { "entropy": 2.0773544281721117, "epoch": 1.68944099378882, "grad_norm": 3.3871872425079346, "learning_rate": 1.543468700361076e-05, "loss": 0.05042000412940979, "mean_token_accuracy": 0.9922097563743592, "num_tokens": 6091599.0, "step": 1360 }, { "entropy": 2.0988358676433565, "epoch": 1.701863354037267, "grad_norm": 2.538235902786255, "learning_rate": 1.536696193991601e-05, "loss": 0.03595686256885529, "mean_token_accuracy": 0.9918700397014618, "num_tokens": 6130885.0, "step": 1370 }, { "entropy": 2.120113742351532, "epoch": 1.7142857142857144, "grad_norm": 1.560457706451416, "learning_rate": 1.5298889335018895e-05, "loss": 0.007060723751783371, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 6177827.0, "step": 1380 }, { "entropy": 2.1228767782449722, "epoch": 1.7267080745341614, "grad_norm": 0.20773983001708984, "learning_rate": 1.5230473597006384e-05, "loss": 0.0372874915599823, "mean_token_accuracy": 0.9817194625735283, "num_tokens": 6219816.0, "step": 1390 }, { "entropy": 2.0721586614847185, "epoch": 1.7391304347826086, "grad_norm": 0.2652308940887451, "learning_rate": 1.5161719156185253e-05, "loss": 0.04619762003421783, "mean_token_accuracy": 0.9939772725105286, "num_tokens": 6267673.0, "step": 1400 }, { "entropy": 2.052675449848175, "epoch": 1.7515527950310559, "grad_norm": 0.06336406618356705, "learning_rate": 1.5092630464795202e-05, "loss": 0.03301122784614563, "mean_token_accuracy": 0.9891937226057053, "num_tokens": 6314073.0, "step": 1410 }, { "entropy": 2.1229291677474977, "epoch": 1.763975155279503, "grad_norm": 2.1714088916778564, "learning_rate": 1.5023211996720558e-05, "loss": 0.008769268542528153, "mean_token_accuracy": 0.9979967936873436, "num_tokens": 6352274.0, "step": 1420 }, { "entropy": 2.1219181925058366, "epoch": 1.7763975155279503, "grad_norm": 2.3357884883880615, "learning_rate": 1.4953468247200542e-05, "loss": 0.031093907356262208, "mean_token_accuracy": 0.9895014673471451, "num_tokens": 6393662.0, "step": 1430 }, { "entropy": 2.0373534232378008, "epoch": 1.7888198757763976, "grad_norm": 0.3844815790653229, "learning_rate": 1.4883403732538208e-05, "loss": 0.026946166157722475, "mean_token_accuracy": 0.9952634528279305, "num_tokens": 6445853.0, "step": 1440 }, { "entropy": 2.100069361925125, "epoch": 1.8012422360248448, "grad_norm": 5.393243789672852, "learning_rate": 1.4813022989807964e-05, "loss": 0.061344707012176515, "mean_token_accuracy": 0.9873241350054741, "num_tokens": 6491025.0, "step": 1450 }, { "entropy": 2.137248122692108, "epoch": 1.8136645962732918, "grad_norm": 0.07023269683122635, "learning_rate": 1.4742330576561776e-05, "loss": 0.06469428539276123, "mean_token_accuracy": 0.9903487995266914, "num_tokens": 6530707.0, "step": 1460 }, { "entropy": 2.121686002612114, "epoch": 1.8260869565217392, "grad_norm": 4.548147201538086, "learning_rate": 1.4671331070534046e-05, "loss": 0.01620122790336609, "mean_token_accuracy": 0.9988372087478637, "num_tokens": 6576494.0, "step": 1470 }, { "entropy": 2.0570311337709426, "epoch": 1.8385093167701863, "grad_norm": 0.04442490264773369, "learning_rate": 1.4600029069345171e-05, "loss": 0.013120083510875702, "mean_token_accuracy": 0.9956349208950996, "num_tokens": 6619890.0, "step": 1480 }, { "entropy": 2.1113452911376953, "epoch": 1.8509316770186337, "grad_norm": 1.212381362915039, "learning_rate": 1.4528429190203826e-05, "loss": 0.04590463638305664, "mean_token_accuracy": 0.9906466111540795, "num_tokens": 6662456.0, "step": 1490 }, { "entropy": 2.039040079712868, "epoch": 1.8633540372670807, "grad_norm": 0.4518345594406128, "learning_rate": 1.445653606960797e-05, "loss": 0.022520086169242857, "mean_token_accuracy": 0.9937344387173652, "num_tokens": 6709587.0, "step": 1500 }, { "epoch": 1.8633540372670807, "eval_entropy": 1.9391227429937046, "eval_loss": 0.6151674389839172, "eval_mean_token_accuracy": 0.9007952373976992, "eval_num_tokens": 6709587.0, "eval_runtime": 1015.8442, "eval_samples_per_second": 7.532, "eval_steps_per_second": 0.942, "step": 1500 }, { "entropy": 2.117081579566002, "epoch": 1.875776397515528, "grad_norm": 0.06551311165094376, "learning_rate": 1.4384354363044611e-05, "loss": 0.051976734399795534, "mean_token_accuracy": 0.9881994038820267, "num_tokens": 6750511.0, "step": 1510 }, { "entropy": 2.098040521144867, "epoch": 1.8881987577639752, "grad_norm": 0.423195481300354, "learning_rate": 1.4311888744688331e-05, "loss": 0.023100055754184723, "mean_token_accuracy": 0.996203102171421, "num_tokens": 6789920.0, "step": 1520 }, { "entropy": 2.061115252971649, "epoch": 1.9006211180124224, "grad_norm": 6.247063636779785, "learning_rate": 1.423914390709861e-05, "loss": 0.0642433762550354, "mean_token_accuracy": 0.9834059119224549, "num_tokens": 6832649.0, "step": 1530 }, { "entropy": 2.0606234312057494, "epoch": 1.9130434782608696, "grad_norm": 0.05942244082689285, "learning_rate": 1.4166124560915957e-05, "loss": 0.015473641455173492, "mean_token_accuracy": 0.9945833340287209, "num_tokens": 6877860.0, "step": 1540 }, { "entropy": 2.1109096825122835, "epoch": 1.9254658385093166, "grad_norm": 3.235588788986206, "learning_rate": 1.4092835434556866e-05, "loss": 0.043846017122268675, "mean_token_accuracy": 0.9893042847514153, "num_tokens": 6928094.0, "step": 1550 }, { "entropy": 2.012011078000069, "epoch": 1.937888198757764, "grad_norm": 3.570309638977051, "learning_rate": 1.4019281273907627e-05, "loss": 0.010611482709646226, "mean_token_accuracy": 0.9952083334326745, "num_tokens": 6978174.0, "step": 1560 }, { "entropy": 2.0667447626590727, "epoch": 1.950310559006211, "grad_norm": 2.992898464202881, "learning_rate": 1.394546684201701e-05, "loss": 0.020136520266532898, "mean_token_accuracy": 0.9959304377436637, "num_tokens": 7027412.0, "step": 1570 }, { "entropy": 2.1080401957035066, "epoch": 1.9627329192546585, "grad_norm": 0.05407049506902695, "learning_rate": 1.3871396918787812e-05, "loss": 0.016931670904159545, "mean_token_accuracy": 0.9919893622398377, "num_tokens": 7074053.0, "step": 1580 }, { "entropy": 2.0816223949193953, "epoch": 1.9751552795031055, "grad_norm": 0.11757466942071915, "learning_rate": 1.3797076300667345e-05, "loss": 0.02696256935596466, "mean_token_accuracy": 0.9966979950666428, "num_tokens": 7119277.0, "step": 1590 }, { "entropy": 2.0723426222801207, "epoch": 1.9875776397515528, "grad_norm": 0.9365509748458862, "learning_rate": 1.3722509800336838e-05, "loss": 0.012552569806575774, "mean_token_accuracy": 0.9961967542767525, "num_tokens": 7168606.0, "step": 1600 }, { "entropy": 2.086591383814812, "epoch": 2.0, "grad_norm": 0.20105956494808197, "learning_rate": 1.3647702246399787e-05, "loss": 0.02122708112001419, "mean_token_accuracy": 0.9936253562569618, "num_tokens": 7207712.0, "step": 1610 }, { "entropy": 2.0814583867788317, "epoch": 2.012422360248447, "grad_norm": 3.1069884300231934, "learning_rate": 1.3572658483069275e-05, "loss": 0.023302927613258362, "mean_token_accuracy": 0.9970308855175972, "num_tokens": 7254589.0, "step": 1620 }, { "entropy": 2.125543528795242, "epoch": 2.0248447204968945, "grad_norm": 0.14501716196537018, "learning_rate": 1.3497383369854277e-05, "loss": 0.02721119225025177, "mean_token_accuracy": 0.9959090918302536, "num_tokens": 7295210.0, "step": 1630 }, { "entropy": 2.0380464106798173, "epoch": 2.0372670807453415, "grad_norm": 0.07213692367076874, "learning_rate": 1.3421881781244995e-05, "loss": 0.0014440644532442092, "mean_token_accuracy": 1.0, "num_tokens": 7343229.0, "step": 1640 }, { "entropy": 2.0552190840244293, "epoch": 2.049689440993789, "grad_norm": 0.29290318489074707, "learning_rate": 1.3346158606397182e-05, "loss": 0.024383768439292908, "mean_token_accuracy": 0.9936682999134063, "num_tokens": 7388308.0, "step": 1650 }, { "entropy": 1.9938734024763107, "epoch": 2.062111801242236, "grad_norm": 0.05942467227578163, "learning_rate": 1.327021874881557e-05, "loss": 0.0024633878841996194, "mean_token_accuracy": 1.0, "num_tokens": 7439948.0, "step": 1660 }, { "entropy": 2.086641189455986, "epoch": 2.0745341614906834, "grad_norm": 1.3043140172958374, "learning_rate": 1.3194067126036317e-05, "loss": 0.02244780957698822, "mean_token_accuracy": 0.9969155848026275, "num_tokens": 7486497.0, "step": 1670 }, { "entropy": 2.07209207713604, "epoch": 2.0869565217391304, "grad_norm": 0.6853761672973633, "learning_rate": 1.3117708669308577e-05, "loss": 0.013260528445243835, "mean_token_accuracy": 0.9945779204368591, "num_tokens": 7527807.0, "step": 1680 }, { "entropy": 2.0046075344085694, "epoch": 2.099378881987578, "grad_norm": 0.18696783483028412, "learning_rate": 1.3041148323275182e-05, "loss": 0.0024597344920039175, "mean_token_accuracy": 1.0, "num_tokens": 7583037.0, "step": 1690 }, { "entropy": 2.011264589428902, "epoch": 2.111801242236025, "grad_norm": 3.760758399963379, "learning_rate": 1.2964391045652431e-05, "loss": 0.024358910322189332, "mean_token_accuracy": 0.9940446645021439, "num_tokens": 7627313.0, "step": 1700 }, { "entropy": 2.1516319900751113, "epoch": 2.124223602484472, "grad_norm": 4.213773250579834, "learning_rate": 1.2887441806909071e-05, "loss": 0.008242494612932205, "mean_token_accuracy": 0.9970352560281753, "num_tokens": 7665191.0, "step": 1710 }, { "entropy": 2.134421792626381, "epoch": 2.1366459627329193, "grad_norm": 0.34656691551208496, "learning_rate": 1.281030558994441e-05, "loss": 0.003566844016313553, "mean_token_accuracy": 0.9993055552244187, "num_tokens": 7704708.0, "step": 1720 }, { "entropy": 2.086806279420853, "epoch": 2.1490683229813663, "grad_norm": 0.5496445298194885, "learning_rate": 1.2732987389765659e-05, "loss": 0.011695029586553574, "mean_token_accuracy": 0.9959415584802628, "num_tokens": 7750499.0, "step": 1730 }, { "entropy": 2.025625595450401, "epoch": 2.1614906832298137, "grad_norm": 4.21989631652832, "learning_rate": 1.2655492213164468e-05, "loss": 0.00867307037115097, "mean_token_accuracy": 0.9970328286290169, "num_tokens": 7797939.0, "step": 1740 }, { "entropy": 2.0385482728481295, "epoch": 2.1739130434782608, "grad_norm": 0.4632386565208435, "learning_rate": 1.2577825078392727e-05, "loss": 0.02321777492761612, "mean_token_accuracy": 0.992535850405693, "num_tokens": 7849330.0, "step": 1750 }, { "entropy": 1.9963646829128265, "epoch": 2.186335403726708, "grad_norm": 0.42986103892326355, "learning_rate": 1.249999101483758e-05, "loss": 0.005663960799574852, "mean_token_accuracy": 0.997916667163372, "num_tokens": 7896007.0, "step": 1760 }, { "entropy": 2.06232088804245, "epoch": 2.198757763975155, "grad_norm": 1.872363567352295, "learning_rate": 1.2421995062695758e-05, "loss": 0.004401819780468941, "mean_token_accuracy": 1.0, "num_tokens": 7940343.0, "step": 1770 }, { "entropy": 2.102313169836998, "epoch": 2.2111801242236027, "grad_norm": 0.025104807689785957, "learning_rate": 1.2343842272647202e-05, "loss": 0.005491552874445915, "mean_token_accuracy": 0.9980357140302658, "num_tokens": 7986234.0, "step": 1780 }, { "entropy": 2.112947568297386, "epoch": 2.2236024844720497, "grad_norm": 2.1959307193756104, "learning_rate": 1.2265537705527983e-05, "loss": 0.026379427313804625, "mean_token_accuracy": 0.9976111099123954, "num_tokens": 8026988.0, "step": 1790 }, { "entropy": 2.0979381293058394, "epoch": 2.2360248447204967, "grad_norm": 1.1758487224578857, "learning_rate": 1.2187086432002614e-05, "loss": 0.03560973107814789, "mean_token_accuracy": 0.9908891677856445, "num_tokens": 8066827.0, "step": 1800 }, { "entropy": 2.054467257857323, "epoch": 2.248447204968944, "grad_norm": 2.9439423084259033, "learning_rate": 1.2108493532235665e-05, "loss": 0.011456061899662019, "mean_token_accuracy": 0.9971509978175164, "num_tokens": 8111916.0, "step": 1810 }, { "entropy": 2.1217318147420885, "epoch": 2.260869565217391, "grad_norm": 0.04024887830018997, "learning_rate": 1.2029764095562817e-05, "loss": 0.006869207322597504, "mean_token_accuracy": 0.9985430747270584, "num_tokens": 8150510.0, "step": 1820 }, { "entropy": 2.039259508252144, "epoch": 2.2732919254658386, "grad_norm": 0.028114071115851402, "learning_rate": 1.1950903220161286e-05, "loss": 0.012260539829730988, "mean_token_accuracy": 0.996547618508339, "num_tokens": 8201549.0, "step": 1830 }, { "entropy": 2.029066079854965, "epoch": 2.2857142857142856, "grad_norm": 0.17401359975337982, "learning_rate": 1.1871916012719686e-05, "loss": 0.005470449849963188, "mean_token_accuracy": 0.9954545453190804, "num_tokens": 8246986.0, "step": 1840 }, { "entropy": 2.0671174854040144, "epoch": 2.298136645962733, "grad_norm": 0.01771964691579342, "learning_rate": 1.1792807588107358e-05, "loss": 0.008678821474313736, "mean_token_accuracy": 0.9980823859572411, "num_tokens": 8293655.0, "step": 1850 }, { "entropy": 2.044488273561001, "epoch": 2.31055900621118, "grad_norm": 0.19449250400066376, "learning_rate": 1.1713583069043134e-05, "loss": 0.00978265181183815, "mean_token_accuracy": 0.9980962634086609, "num_tokens": 8340795.0, "step": 1860 }, { "entropy": 2.060883978009224, "epoch": 2.3229813664596275, "grad_norm": 0.533935010433197, "learning_rate": 1.1634247585763617e-05, "loss": 0.020505291223526, "mean_token_accuracy": 0.996217104792595, "num_tokens": 8381916.0, "step": 1870 }, { "entropy": 2.085965710878372, "epoch": 2.3354037267080745, "grad_norm": 0.0371839813888073, "learning_rate": 1.1554806275690977e-05, "loss": 0.04419526159763336, "mean_token_accuracy": 0.9922267541289329, "num_tokens": 8426453.0, "step": 1880 }, { "entropy": 2.062951362133026, "epoch": 2.3478260869565215, "grad_norm": 0.05953945219516754, "learning_rate": 1.1475264283100271e-05, "loss": 0.0023886462673544883, "mean_token_accuracy": 1.0, "num_tokens": 8474710.0, "step": 1890 }, { "entropy": 2.0459433823823927, "epoch": 2.360248447204969, "grad_norm": 2.6267354488372803, "learning_rate": 1.1395626758786311e-05, "loss": 0.0284033864736557, "mean_token_accuracy": 0.9925563052296639, "num_tokens": 8523232.0, "step": 1900 }, { "entropy": 2.0337260574102403, "epoch": 2.372670807453416, "grad_norm": 0.008924540132284164, "learning_rate": 1.131589885973014e-05, "loss": 0.02596815228462219, "mean_token_accuracy": 0.9954166665673256, "num_tokens": 8567783.0, "step": 1910 }, { "entropy": 2.083550325036049, "epoch": 2.3850931677018634, "grad_norm": 3.9523518085479736, "learning_rate": 1.1236085748765065e-05, "loss": 0.021181216835975646, "mean_token_accuracy": 0.9891853407025337, "num_tokens": 8609451.0, "step": 1920 }, { "entropy": 2.1075416803359985, "epoch": 2.3975155279503104, "grad_norm": 5.226478576660156, "learning_rate": 1.1156192594242359e-05, "loss": 0.029014191031455992, "mean_token_accuracy": 0.9930989995598793, "num_tokens": 8650617.0, "step": 1930 }, { "entropy": 2.074365347623825, "epoch": 2.409937888198758, "grad_norm": 0.37940314412117004, "learning_rate": 1.1076224569696566e-05, "loss": 0.008748483657836915, "mean_token_accuracy": 0.9977179482579231, "num_tokens": 8693151.0, "step": 1940 }, { "entropy": 2.066782546043396, "epoch": 2.422360248447205, "grad_norm": 1.8503516912460327, "learning_rate": 1.0996186853510483e-05, "loss": 0.02327302247285843, "mean_token_accuracy": 0.995456175506115, "num_tokens": 8736089.0, "step": 1950 }, { "entropy": 2.0815196603536608, "epoch": 2.4347826086956523, "grad_norm": 0.10152150690555573, "learning_rate": 1.091608462857984e-05, "loss": 0.01696925759315491, "mean_token_accuracy": 0.9941277459263802, "num_tokens": 8779773.0, "step": 1960 }, { "entropy": 2.0931368678808213, "epoch": 2.4472049689440993, "grad_norm": 0.5757278800010681, "learning_rate": 1.0835923081977673e-05, "loss": 0.008439820259809494, "mean_token_accuracy": 0.9977225676178932, "num_tokens": 8824281.0, "step": 1970 }, { "entropy": 2.092051011323929, "epoch": 2.4596273291925463, "grad_norm": 2.9547672271728516, "learning_rate": 1.0755707404618432e-05, "loss": 0.014160393178462983, "mean_token_accuracy": 0.9984834551811218, "num_tokens": 8871263.0, "step": 1980 }, { "entropy": 2.1631635636091233, "epoch": 2.472049689440994, "grad_norm": 0.1473511904478073, "learning_rate": 1.0675442790921845e-05, "loss": 0.004312780871987343, "mean_token_accuracy": 0.9966666668653488, "num_tokens": 8912516.0, "step": 1990 }, { "entropy": 2.0735503882169724, "epoch": 2.4844720496894412, "grad_norm": 0.07361020892858505, "learning_rate": 1.0595134438476535e-05, "loss": 0.009844847768545151, "mean_token_accuracy": 0.9948893085122108, "num_tokens": 8957449.0, "step": 2000 }, { "epoch": 2.4844720496894412, "eval_entropy": 1.9350422568455758, "eval_loss": 0.6755263209342957, "eval_mean_token_accuracy": 0.900690189349614, "eval_num_tokens": 8957449.0, "eval_runtime": 1016.7085, "eval_samples_per_second": 7.525, "eval_steps_per_second": 0.941, "step": 2000 }, { "entropy": 1.9889907732605934, "epoch": 2.4968944099378882, "grad_norm": 0.042838554829359055, "learning_rate": 1.0514787547703466e-05, "loss": 0.003820537030696869, "mean_token_accuracy": 0.9974747464060784, "num_tokens": 9004148.0, "step": 2010 }, { "entropy": 1.994002103805542, "epoch": 2.5093167701863353, "grad_norm": 0.008305537514388561, "learning_rate": 1.0434407321519174e-05, "loss": 0.00935748741030693, "mean_token_accuracy": 0.9960200980305671, "num_tokens": 9052196.0, "step": 2020 }, { "entropy": 2.0162607550621034, "epoch": 2.5217391304347827, "grad_norm": 1.709023118019104, "learning_rate": 1.0353998964998852e-05, "loss": 0.01086588203907013, "mean_token_accuracy": 0.9958574876189232, "num_tokens": 9095641.0, "step": 2030 }, { "entropy": 2.0208642780780792, "epoch": 2.5341614906832297, "grad_norm": 1.5418806076049805, "learning_rate": 1.027356768503929e-05, "loss": 0.0025530509650707246, "mean_token_accuracy": 1.0, "num_tokens": 9142325.0, "step": 2040 }, { "entropy": 1.988822239637375, "epoch": 2.546583850931677, "grad_norm": 0.02914745733141899, "learning_rate": 1.0193118690021699e-05, "loss": 0.01600893437862396, "mean_token_accuracy": 0.9974712640047073, "num_tokens": 9187635.0, "step": 2050 }, { "entropy": 2.1130143284797667, "epoch": 2.559006211180124, "grad_norm": 0.18256570398807526, "learning_rate": 1.0112657189474453e-05, "loss": 0.005916472524404526, "mean_token_accuracy": 0.9978422611951828, "num_tokens": 9230956.0, "step": 2060 }, { "entropy": 2.0859414279460906, "epoch": 2.571428571428571, "grad_norm": 0.028967536985874176, "learning_rate": 1.003218839373571e-05, "loss": 0.013482299447059632, "mean_token_accuracy": 0.9957247704267502, "num_tokens": 9272039.0, "step": 2070 }, { "entropy": 2.018462461233139, "epoch": 2.5838509316770186, "grad_norm": 0.3704102337360382, "learning_rate": 9.95171751361605e-06, "loss": 0.01167006641626358, "mean_token_accuracy": 0.9949074074625969, "num_tokens": 9316072.0, "step": 2080 }, { "entropy": 2.115574726462364, "epoch": 2.596273291925466, "grad_norm": 0.4194943904876709, "learning_rate": 9.87124976006102e-06, "loss": 0.0006253823637962341, "mean_token_accuracy": 1.0, "num_tokens": 9354792.0, "step": 2090 }, { "entropy": 2.0909915775060655, "epoch": 2.608695652173913, "grad_norm": 0.0066429125145077705, "learning_rate": 9.790790343813704e-06, "loss": 0.003978141024708748, "mean_token_accuracy": 1.0, "num_tokens": 9396911.0, "step": 2100 }, { "entropy": 2.0067518442869186, "epoch": 2.62111801242236, "grad_norm": 0.008789177983999252, "learning_rate": 9.710344475077305e-06, "loss": 0.01789900064468384, "mean_token_accuracy": 0.9949579834938049, "num_tokens": 9442756.0, "step": 2110 }, { "entropy": 2.0730466544628143, "epoch": 2.6335403726708075, "grad_norm": 1.8757554292678833, "learning_rate": 9.629917363177737e-06, "loss": 0.005894383788108826, "mean_token_accuracy": 0.9960317462682724, "num_tokens": 9488065.0, "step": 2120 }, { "entropy": 2.007842016220093, "epoch": 2.6459627329192545, "grad_norm": 3.2601473331451416, "learning_rate": 9.549514216226312e-06, "loss": 0.009530902653932572, "mean_token_accuracy": 0.994273892045021, "num_tokens": 9537549.0, "step": 2130 }, { "entropy": 2.005715015530586, "epoch": 2.658385093167702, "grad_norm": 0.08396615087985992, "learning_rate": 9.469140240782478e-06, "loss": 0.015502755343914033, "mean_token_accuracy": 0.995985135436058, "num_tokens": 9583324.0, "step": 2140 }, { "entropy": 2.0230127543210985, "epoch": 2.670807453416149, "grad_norm": 0.5364155173301697, "learning_rate": 9.388800641516644e-06, "loss": 0.011524485051631927, "mean_token_accuracy": 0.996875, "num_tokens": 9631667.0, "step": 2150 }, { "entropy": 2.0623193353414537, "epoch": 2.683229813664596, "grad_norm": 0.01238600630313158, "learning_rate": 9.308500620873188e-06, "loss": 0.005700193718075753, "mean_token_accuracy": 0.999074074625969, "num_tokens": 9675409.0, "step": 2160 }, { "entropy": 2.082617163658142, "epoch": 2.6956521739130435, "grad_norm": 0.019543716683983803, "learning_rate": 9.228245378733537e-06, "loss": 0.0012947741895914077, "mean_token_accuracy": 1.0, "num_tokens": 9715733.0, "step": 2170 }, { "entropy": 2.0438971281051637, "epoch": 2.708074534161491, "grad_norm": 0.23991966247558594, "learning_rate": 9.14804011207946e-06, "loss": 0.019262537360191345, "mean_token_accuracy": 0.9976934522390366, "num_tokens": 9758850.0, "step": 2180 }, { "entropy": 2.0186645179986953, "epoch": 2.720496894409938, "grad_norm": 0.11839921772480011, "learning_rate": 9.067890014656532e-06, "loss": 0.0051767569035291675, "mean_token_accuracy": 0.9959722220897674, "num_tokens": 9802740.0, "step": 2190 }, { "entropy": 2.072070962190628, "epoch": 2.732919254658385, "grad_norm": 0.22388368844985962, "learning_rate": 8.987800276637797e-06, "loss": 0.001911316066980362, "mean_token_accuracy": 1.0, "num_tokens": 9842183.0, "step": 2200 }, { "entropy": 2.036952206492424, "epoch": 2.7453416149068324, "grad_norm": 0.08417179435491562, "learning_rate": 8.907776084287694e-06, "loss": 0.00783902257680893, "mean_token_accuracy": 0.9991071432828903, "num_tokens": 9884991.0, "step": 2210 }, { "entropy": 2.0813712805509565, "epoch": 2.7577639751552794, "grad_norm": 0.24930235743522644, "learning_rate": 8.82782261962621e-06, "loss": 0.006542463600635528, "mean_token_accuracy": 0.996547618508339, "num_tokens": 9931116.0, "step": 2220 }, { "entropy": 2.0320400312542914, "epoch": 2.770186335403727, "grad_norm": 0.013318363577127457, "learning_rate": 8.747945060093314e-06, "loss": 0.032293641567230226, "mean_token_accuracy": 0.9961111098527908, "num_tokens": 9980491.0, "step": 2230 }, { "entropy": 2.023380008339882, "epoch": 2.782608695652174, "grad_norm": 0.011369063518941402, "learning_rate": 8.668148578213676e-06, "loss": 0.00727204903960228, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 10024209.0, "step": 2240 }, { "entropy": 2.031138223409653, "epoch": 2.795031055900621, "grad_norm": 0.004001646768301725, "learning_rate": 8.58843834126174e-06, "loss": 0.003158881887793541, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 10071568.0, "step": 2250 }, { "entropy": 2.1424681723117827, "epoch": 2.8074534161490683, "grad_norm": 0.030468905344605446, "learning_rate": 8.508819510927102e-06, "loss": 0.015948720276355743, "mean_token_accuracy": 0.9942139357328414, "num_tokens": 10114689.0, "step": 2260 }, { "entropy": 2.0369500696659086, "epoch": 2.8198757763975157, "grad_norm": 2.443307638168335, "learning_rate": 8.429297242980255e-06, "loss": 0.011675138771533967, "mean_token_accuracy": 0.9984375, "num_tokens": 10160564.0, "step": 2270 }, { "entropy": 2.0784898310899735, "epoch": 2.8322981366459627, "grad_norm": 0.014572578482329845, "learning_rate": 8.349876686938735e-06, "loss": 0.001237300131469965, "mean_token_accuracy": 1.0, "num_tokens": 10202481.0, "step": 2280 }, { "entropy": 2.0724748879671098, "epoch": 2.8447204968944098, "grad_norm": 0.029409846290946007, "learning_rate": 8.270562985733652e-06, "loss": 0.04003585875034332, "mean_token_accuracy": 0.9918279573321342, "num_tokens": 10250012.0, "step": 2290 }, { "entropy": 2.0165867626667024, "epoch": 2.857142857142857, "grad_norm": 0.36708053946495056, "learning_rate": 8.191361275376665e-06, "loss": 0.02690470814704895, "mean_token_accuracy": 0.9901388883590698, "num_tokens": 10298016.0, "step": 2300 }, { "entropy": 2.0692808449268343, "epoch": 2.869565217391304, "grad_norm": 0.198243647813797, "learning_rate": 8.112276684627385e-06, "loss": 0.0325189471244812, "mean_token_accuracy": 0.9981678783893585, "num_tokens": 10340662.0, "step": 2310 }, { "entropy": 2.0979644536972044, "epoch": 2.8819875776397517, "grad_norm": 0.03836897015571594, "learning_rate": 8.033314334661269e-06, "loss": 0.002577725984156132, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 10381673.0, "step": 2320 }, { "entropy": 2.0282706737518312, "epoch": 2.8944099378881987, "grad_norm": 0.22129732370376587, "learning_rate": 7.954479338737995e-06, "loss": 0.000719859404489398, "mean_token_accuracy": 1.0, "num_tokens": 10426947.0, "step": 2330 }, { "entropy": 2.023343104124069, "epoch": 2.906832298136646, "grad_norm": 0.00921141728758812, "learning_rate": 7.875776801870326e-06, "loss": 0.005170207470655441, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 10473441.0, "step": 2340 }, { "entropy": 2.061341863870621, "epoch": 2.919254658385093, "grad_norm": 0.01563173718750477, "learning_rate": 7.797211820493573e-06, "loss": 0.004035498574376106, "mean_token_accuracy": 0.999074074625969, "num_tokens": 10516464.0, "step": 2350 }, { "entropy": 2.0794942557811735, "epoch": 2.9316770186335406, "grad_norm": 0.9282295107841492, "learning_rate": 7.718789482135534e-06, "loss": 0.0026351150125265123, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 10557903.0, "step": 2360 }, { "entropy": 2.0855711489915847, "epoch": 2.9440993788819876, "grad_norm": 0.0810675099492073, "learning_rate": 7.640514865087078e-06, "loss": 0.01579228788614273, "mean_token_accuracy": 0.9981518805027008, "num_tokens": 10602244.0, "step": 2370 }, { "entropy": 2.053683337569237, "epoch": 2.9565217391304346, "grad_norm": 0.029188042506575584, "learning_rate": 7.562393038073261e-06, "loss": 0.008064876496791839, "mean_token_accuracy": 0.9988095238804817, "num_tokens": 10649252.0, "step": 2380 }, { "entropy": 2.056939309835434, "epoch": 2.968944099378882, "grad_norm": 0.6217600703239441, "learning_rate": 7.484429059925136e-06, "loss": 0.015889519453048707, "mean_token_accuracy": 0.9950148805975914, "num_tokens": 10691331.0, "step": 2390 }, { "entropy": 2.070336791872978, "epoch": 2.981366459627329, "grad_norm": 0.006842709146440029, "learning_rate": 7.4066279792521426e-06, "loss": 0.02249635010957718, "mean_token_accuracy": 0.9986013993620872, "num_tokens": 10740010.0, "step": 2400 }, { "entropy": 2.008762276172638, "epoch": 2.9937888198757765, "grad_norm": 0.22063793241977692, "learning_rate": 7.328994834115181e-06, "loss": 0.0008781224489212037, "mean_token_accuracy": 1.0, "num_tokens": 10791873.0, "step": 2410 }, { "entropy": 2.039086303114891, "epoch": 3.0062111801242235, "grad_norm": 0.1856115162372589, "learning_rate": 7.251534651700385e-06, "loss": 0.0043528910726308824, "mean_token_accuracy": 0.998863635957241, "num_tokens": 10833476.0, "step": 2420 }, { "entropy": 2.07568744122982, "epoch": 3.018633540372671, "grad_norm": 0.6048936247825623, "learning_rate": 7.174252447993556e-06, "loss": 0.0008312862366437912, "mean_token_accuracy": 1.0, "num_tokens": 10873478.0, "step": 2430 }, { "entropy": 2.0069006264209746, "epoch": 3.031055900621118, "grad_norm": 0.08963524550199509, "learning_rate": 7.097153227455379e-06, "loss": 0.002857883274555206, "mean_token_accuracy": 0.9964460790157318, "num_tokens": 10922316.0, "step": 2440 }, { "entropy": 2.0665270179510116, "epoch": 3.0434782608695654, "grad_norm": 0.07428019493818283, "learning_rate": 7.020241982697331e-06, "loss": 0.0018186111003160477, "mean_token_accuracy": 1.0, "num_tokens": 10970389.0, "step": 2450 }, { "entropy": 2.030388182401657, "epoch": 3.0559006211180124, "grad_norm": 0.049276646226644516, "learning_rate": 6.9435236941584005e-06, "loss": 0.003922026976943016, "mean_token_accuracy": 0.998863635957241, "num_tokens": 11020380.0, "step": 2460 }, { "entropy": 2.117271861433983, "epoch": 3.0683229813664594, "grad_norm": 0.027438754215836525, "learning_rate": 6.867003329782566e-06, "loss": 0.00299711711704731, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 11063998.0, "step": 2470 }, { "entropy": 2.1177933365106583, "epoch": 3.080745341614907, "grad_norm": 0.22324837744235992, "learning_rate": 6.7906858446970894e-06, "loss": 0.0014256440103054047, "mean_token_accuracy": 1.0, "num_tokens": 11107505.0, "step": 2480 }, { "entropy": 2.1208660274744036, "epoch": 3.093167701863354, "grad_norm": 0.13765057921409607, "learning_rate": 6.714576180891653e-06, "loss": 0.002962992340326309, "mean_token_accuracy": 0.9984375, "num_tokens": 11150906.0, "step": 2490 }, { "entropy": 2.096135729551315, "epoch": 3.1055900621118013, "grad_norm": 0.0484640933573246, "learning_rate": 6.638679266898334e-06, "loss": 0.0032801639288663866, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 11190221.0, "step": 2500 }, { "epoch": 3.1055900621118013, "eval_entropy": 1.9245576005246074, "eval_loss": 0.7179387211799622, "eval_mean_token_accuracy": 0.903106996071376, "eval_num_tokens": 11190221.0, "eval_runtime": 1015.9223, "eval_samples_per_second": 7.531, "eval_steps_per_second": 0.942, "step": 2500 }, { "entropy": 2.065633365511894, "epoch": 3.1180124223602483, "grad_norm": 0.004022596403956413, "learning_rate": 6.56300001747245e-06, "loss": 0.011902575939893722, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 11233858.0, "step": 2510 }, { "entropy": 2.0493174642324448, "epoch": 3.130434782608696, "grad_norm": 0.004140094853937626, "learning_rate": 6.48754333327431e-06, "loss": 0.011013699322938919, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 11278738.0, "step": 2520 }, { "entropy": 2.1025405555963514, "epoch": 3.142857142857143, "grad_norm": 0.008452140726149082, "learning_rate": 6.412314100551854e-06, "loss": 0.004581971466541291, "mean_token_accuracy": 0.9978349670767784, "num_tokens": 11318888.0, "step": 2530 }, { "entropy": 1.9467100128531456, "epoch": 3.1552795031055902, "grad_norm": 0.04429563507437706, "learning_rate": 6.337317190824257e-06, "loss": 0.00039558070711791514, "mean_token_accuracy": 1.0, "num_tokens": 11369254.0, "step": 2540 }, { "entropy": 2.0959424555301664, "epoch": 3.1677018633540373, "grad_norm": 0.08045872300863266, "learning_rate": 6.262557460566465e-06, "loss": 0.014682823419570923, "mean_token_accuracy": 0.9972435891628265, "num_tokens": 11409789.0, "step": 2550 }, { "entropy": 2.1395619392395018, "epoch": 3.1801242236024843, "grad_norm": 0.009005514904856682, "learning_rate": 6.188039750894707e-06, "loss": 0.0013207459822297096, "mean_token_accuracy": 1.0, "num_tokens": 11448078.0, "step": 2560 }, { "entropy": 1.9897212505340576, "epoch": 3.1925465838509317, "grad_norm": 0.06040625274181366, "learning_rate": 6.113768887252998e-06, "loss": 0.00110345296561718, "mean_token_accuracy": 1.0, "num_tokens": 11495538.0, "step": 2570 }, { "entropy": 2.042201852798462, "epoch": 3.2049689440993787, "grad_norm": 3.705784559249878, "learning_rate": 6.039749679100688e-06, "loss": 0.005044905096292495, "mean_token_accuracy": 0.998863635957241, "num_tokens": 11541174.0, "step": 2580 }, { "entropy": 2.0282586336135866, "epoch": 3.217391304347826, "grad_norm": 0.07588481903076172, "learning_rate": 5.965986919601e-06, "loss": 0.013422471284866334, "mean_token_accuracy": 0.9941584974527359, "num_tokens": 11588423.0, "step": 2590 }, { "entropy": 2.0026851534843444, "epoch": 3.229813664596273, "grad_norm": 0.08241789042949677, "learning_rate": 5.892485385310656e-06, "loss": 0.0002885764231905341, "mean_token_accuracy": 1.0, "num_tokens": 11634579.0, "step": 2600 }, { "entropy": 2.003785479068756, "epoch": 3.2422360248447206, "grad_norm": 0.049002643674612045, "learning_rate": 5.819249835870567e-06, "loss": 0.0014354961924254895, "mean_token_accuracy": 1.0, "num_tokens": 11680204.0, "step": 2610 }, { "entropy": 2.040288230776787, "epoch": 3.2546583850931676, "grad_norm": 0.01789112761616707, "learning_rate": 5.746285013697608e-06, "loss": 0.002602299861609936, "mean_token_accuracy": 0.999285714328289, "num_tokens": 11725405.0, "step": 2620 }, { "entropy": 2.039785459637642, "epoch": 3.267080745341615, "grad_norm": 0.004627231974154711, "learning_rate": 5.6735956436775405e-06, "loss": 0.0003787399735301733, "mean_token_accuracy": 1.0, "num_tokens": 11775017.0, "step": 2630 }, { "entropy": 2.0185125142335893, "epoch": 3.279503105590062, "grad_norm": 0.016168462112545967, "learning_rate": 5.6011864328590335e-06, "loss": 0.008351743221282959, "mean_token_accuracy": 0.9994186043739319, "num_tokens": 11823310.0, "step": 2640 }, { "entropy": 2.0066159784793856, "epoch": 3.291925465838509, "grad_norm": 0.03235394135117531, "learning_rate": 5.529062070148859e-06, "loss": 0.005417406931519509, "mean_token_accuracy": 0.9986842110753059, "num_tokens": 11871941.0, "step": 2650 }, { "entropy": 2.051735845208168, "epoch": 3.3043478260869565, "grad_norm": 0.003987879958003759, "learning_rate": 5.457227226008265e-06, "loss": 0.0012644742615520953, "mean_token_accuracy": 1.0, "num_tokens": 11917677.0, "step": 2660 }, { "entropy": 2.0791384488344193, "epoch": 3.3167701863354035, "grad_norm": 0.013546639122068882, "learning_rate": 5.385686552150517e-06, "loss": 0.0003978293854743242, "mean_token_accuracy": 1.0, "num_tokens": 11962426.0, "step": 2670 }, { "entropy": 2.1187647074460982, "epoch": 3.329192546583851, "grad_norm": 2.911365509033203, "learning_rate": 5.3144446812397045e-06, "loss": 0.0044805873185396194, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 12002806.0, "step": 2680 }, { "entropy": 2.085233438014984, "epoch": 3.341614906832298, "grad_norm": 0.021008091047406197, "learning_rate": 5.243506226590722e-06, "loss": 0.0006675105541944504, "mean_token_accuracy": 1.0, "num_tokens": 12043773.0, "step": 2690 }, { "entropy": 2.0027647256851195, "epoch": 3.3540372670807455, "grad_norm": 0.011667752638459206, "learning_rate": 5.172875781870552e-06, "loss": 0.014550222456455231, "mean_token_accuracy": 0.9954166665673256, "num_tokens": 12087817.0, "step": 2700 }, { "entropy": 2.0871587693691254, "epoch": 3.3664596273291925, "grad_norm": 0.00429825484752655, "learning_rate": 5.102557920800772e-06, "loss": 0.016400189697742464, "mean_token_accuracy": 0.997826087474823, "num_tokens": 12130292.0, "step": 2710 }, { "entropy": 2.058573919534683, "epoch": 3.37888198757764, "grad_norm": 0.013374663889408112, "learning_rate": 5.0325571968614105e-06, "loss": 0.0003040991257876158, "mean_token_accuracy": 1.0, "num_tokens": 12174087.0, "step": 2720 }, { "entropy": 1.9985705226659776, "epoch": 3.391304347826087, "grad_norm": 0.0736985132098198, "learning_rate": 4.962878142996065e-06, "loss": 0.0008327001705765724, "mean_token_accuracy": 1.0, "num_tokens": 12217953.0, "step": 2730 }, { "entropy": 2.071951040625572, "epoch": 3.403726708074534, "grad_norm": 0.2610735297203064, "learning_rate": 4.893525271318372e-06, "loss": 0.001319923996925354, "mean_token_accuracy": 1.0, "num_tokens": 12257621.0, "step": 2740 }, { "entropy": 2.0868619114160536, "epoch": 3.4161490683229814, "grad_norm": 0.004669727757573128, "learning_rate": 4.824503072819828e-06, "loss": 0.003249622881412506, "mean_token_accuracy": 0.9991666659712791, "num_tokens": 12296512.0, "step": 2750 }, { "entropy": 2.0636314779520033, "epoch": 3.4285714285714284, "grad_norm": 0.09974928945302963, "learning_rate": 4.755816017078956e-06, "loss": 0.0005484614055603742, "mean_token_accuracy": 1.0, "num_tokens": 12341650.0, "step": 2760 }, { "entropy": 2.1476096123456956, "epoch": 3.440993788819876, "grad_norm": 0.0051970030181109905, "learning_rate": 4.6874685519718945e-06, "loss": 0.00029311692342162134, "mean_token_accuracy": 1.0, "num_tokens": 12382945.0, "step": 2770 }, { "entropy": 2.146159088611603, "epoch": 3.453416149068323, "grad_norm": 0.0212989691644907, "learning_rate": 4.619465103384363e-06, "loss": 0.0007739394437521696, "mean_token_accuracy": 1.0, "num_tokens": 12417675.0, "step": 2780 }, { "entropy": 2.021345466375351, "epoch": 3.4658385093167703, "grad_norm": 0.01701529510319233, "learning_rate": 4.55181007492506e-06, "loss": 0.0006289692129939795, "mean_token_accuracy": 1.0, "num_tokens": 12462562.0, "step": 2790 }, { "entropy": 1.9724286824464798, "epoch": 3.4782608695652173, "grad_norm": 0.010893910191953182, "learning_rate": 4.484507847640511e-06, "loss": 0.0014305679127573968, "mean_token_accuracy": 1.0, "num_tokens": 12517887.0, "step": 2800 }, { "entropy": 2.0382672011852265, "epoch": 3.4906832298136647, "grad_norm": 0.0061012133955955505, "learning_rate": 4.417562779731355e-06, "loss": 0.00024020741693675518, "mean_token_accuracy": 1.0, "num_tokens": 12563405.0, "step": 2810 }, { "entropy": 2.004192039370537, "epoch": 3.5031055900621118, "grad_norm": 0.00254402169957757, "learning_rate": 4.3509792062701464e-06, "loss": 0.0012421167455613613, "mean_token_accuracy": 1.0, "num_tokens": 12612757.0, "step": 2820 }, { "entropy": 2.0766816467046736, "epoch": 3.5155279503105588, "grad_norm": 0.01933353766798973, "learning_rate": 4.284761438920624e-06, "loss": 0.001632862538099289, "mean_token_accuracy": 0.998863635957241, "num_tokens": 12659014.0, "step": 2830 }, { "entropy": 2.03719719350338, "epoch": 3.527950310559006, "grad_norm": 0.16155198216438293, "learning_rate": 4.218913765658507e-06, "loss": 0.006846483051776886, "mean_token_accuracy": 0.996354167163372, "num_tokens": 12705485.0, "step": 2840 }, { "entropy": 2.0722499549388886, "epoch": 3.5403726708074537, "grad_norm": 0.00480568828061223, "learning_rate": 4.153440450493823e-06, "loss": 0.0002258694963529706, "mean_token_accuracy": 1.0, "num_tokens": 12749166.0, "step": 2850 }, { "entropy": 2.076261229813099, "epoch": 3.5527950310559007, "grad_norm": 0.0019834646955132484, "learning_rate": 4.088345733194793e-06, "loss": 0.005384958907961845, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 12791428.0, "step": 2860 }, { "entropy": 2.0420318722724913, "epoch": 3.5652173913043477, "grad_norm": 0.022317076101899147, "learning_rate": 4.0236338290132795e-06, "loss": 0.0007763313595205545, "mean_token_accuracy": 1.0, "num_tokens": 12836185.0, "step": 2870 }, { "entropy": 2.111663815379143, "epoch": 3.577639751552795, "grad_norm": 0.05490420013666153, "learning_rate": 3.959308928411828e-06, "loss": 0.0033809009939432142, "mean_token_accuracy": 1.0, "num_tokens": 12876251.0, "step": 2880 }, { "entropy": 2.06292268037796, "epoch": 3.590062111801242, "grad_norm": 0.024032561108469963, "learning_rate": 3.895375196792308e-06, "loss": 0.0003204423002898693, "mean_token_accuracy": 1.0, "num_tokens": 12921471.0, "step": 2890 }, { "entropy": 2.058139744400978, "epoch": 3.6024844720496896, "grad_norm": 0.08312931656837463, "learning_rate": 3.83183677422618e-06, "loss": 0.004134120792150498, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 12963024.0, "step": 2900 }, { "entropy": 2.0561121970415117, "epoch": 3.6149068322981366, "grad_norm": 0.007939224131405354, "learning_rate": 3.768697775186403e-06, "loss": 0.003024405241012573, "mean_token_accuracy": 0.99921875, "num_tokens": 13006957.0, "step": 2910 }, { "entropy": 1.9855820834636688, "epoch": 3.6273291925465836, "grad_norm": 0.04352085292339325, "learning_rate": 3.705962288281e-06, "loss": 0.0003980351146310568, "mean_token_accuracy": 1.0, "num_tokens": 13062006.0, "step": 2920 }, { "entropy": 2.038356375694275, "epoch": 3.639751552795031, "grad_norm": 1.2225877046585083, "learning_rate": 3.643634375988293e-06, "loss": 0.008960984647274017, "mean_token_accuracy": 0.997916667163372, "num_tokens": 13105926.0, "step": 2930 }, { "entropy": 1.966392880678177, "epoch": 3.6521739130434785, "grad_norm": 3.6292645931243896, "learning_rate": 3.5817180743938475e-06, "loss": 0.02723119258880615, "mean_token_accuracy": 0.9982826575636864, "num_tokens": 13155505.0, "step": 2940 }, { "entropy": 2.0349768072366716, "epoch": 3.6645962732919255, "grad_norm": 0.004916434641927481, "learning_rate": 3.5202173929290873e-06, "loss": 0.0003408062970265746, "mean_token_accuracy": 1.0, "num_tokens": 13200787.0, "step": 2950 }, { "entropy": 2.0228754550218584, "epoch": 3.6770186335403725, "grad_norm": 0.005172870121896267, "learning_rate": 3.459136314111691e-06, "loss": 0.007737810164690018, "mean_token_accuracy": 0.9944444447755814, "num_tokens": 13250267.0, "step": 2960 }, { "entropy": 1.975671073794365, "epoch": 3.68944099378882, "grad_norm": 0.013639900833368301, "learning_rate": 3.398478793287682e-06, "loss": 0.0017875196412205697, "mean_token_accuracy": 1.0, "num_tokens": 13291524.0, "step": 2970 }, { "entropy": 2.1133328646421434, "epoch": 3.701863354037267, "grad_norm": 0.16240786015987396, "learning_rate": 3.3382487583753086e-06, "loss": 0.0020084600895643235, "mean_token_accuracy": 1.0, "num_tokens": 13330874.0, "step": 2980 }, { "entropy": 2.015983095765114, "epoch": 3.7142857142857144, "grad_norm": 0.005457151681184769, "learning_rate": 3.2784501096106737e-06, "loss": 0.0006346395704895258, "mean_token_accuracy": 1.0, "num_tokens": 13376639.0, "step": 2990 }, { "entropy": 2.1352883040905, "epoch": 3.7267080745341614, "grad_norm": 0.026707326993346214, "learning_rate": 3.2190867192951893e-06, "loss": 0.0002277535619214177, "mean_token_accuracy": 1.0, "num_tokens": 13416860.0, "step": 3000 }, { "epoch": 3.7267080745341614, "eval_entropy": 1.915783873296955, "eval_loss": 0.7208165526390076, "eval_mean_token_accuracy": 0.9051754110908309, "eval_num_tokens": 13416860.0, "eval_runtime": 1014.7668, "eval_samples_per_second": 7.54, "eval_steps_per_second": 0.943, "step": 3000 }, { "entropy": 2.035184735059738, "epoch": 3.7391304347826084, "grad_norm": 0.012916711159050465, "learning_rate": 3.1601624315448167e-06, "loss": 0.00808061882853508, "mean_token_accuracy": 0.9990384608507157, "num_tokens": 13462523.0, "step": 3010 }, { "entropy": 2.057391199469566, "epoch": 3.751552795031056, "grad_norm": 0.15162841975688934, "learning_rate": 3.101681062041134e-06, "loss": 0.00021725615952163934, "mean_token_accuracy": 1.0, "num_tokens": 13511406.0, "step": 3020 }, { "entropy": 1.9883357465267182, "epoch": 3.7639751552795033, "grad_norm": 0.015947408974170685, "learning_rate": 3.043646397784259e-06, "loss": 0.0025760218501091003, "mean_token_accuracy": 0.9993243247270585, "num_tokens": 13557519.0, "step": 3030 }, { "entropy": 2.048056635260582, "epoch": 3.7763975155279503, "grad_norm": 0.03572254627943039, "learning_rate": 2.9860621968476002e-06, "loss": 0.005737992003560066, "mean_token_accuracy": 0.9991071432828903, "num_tokens": 13603619.0, "step": 3040 }, { "entropy": 2.0730544537305833, "epoch": 3.7888198757763973, "grad_norm": 0.03662121668457985, "learning_rate": 2.9289321881345257e-06, "loss": 0.005768216773867607, "mean_token_accuracy": 0.9980555549263954, "num_tokens": 13645212.0, "step": 3050 }, { "entropy": 2.042172911763191, "epoch": 3.801242236024845, "grad_norm": 0.0020903616677969694, "learning_rate": 2.8722600711368777e-06, "loss": 0.006000512093305588, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 13691056.0, "step": 3060 }, { "entropy": 2.059427934885025, "epoch": 3.813664596273292, "grad_norm": 0.002584670437499881, "learning_rate": 2.816049515695417e-06, "loss": 0.00038500460796058177, "mean_token_accuracy": 1.0, "num_tokens": 13737184.0, "step": 3070 }, { "entropy": 2.03760521709919, "epoch": 3.8260869565217392, "grad_norm": 0.0522318035364151, "learning_rate": 2.7603041617621783e-06, "loss": 0.0009485245682299137, "mean_token_accuracy": 1.0, "num_tokens": 13783959.0, "step": 3080 }, { "entropy": 2.054546761512756, "epoch": 3.8385093167701863, "grad_norm": 0.009271272458136082, "learning_rate": 2.705027619164754e-06, "loss": 0.015048840641975402, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 13829252.0, "step": 3090 }, { "entropy": 2.0164424657821653, "epoch": 3.8509316770186337, "grad_norm": 0.059004366397857666, "learning_rate": 2.6502234673725557e-06, "loss": 0.003549148514866829, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 13877928.0, "step": 3100 }, { "entropy": 2.0387689799070357, "epoch": 3.8633540372670807, "grad_norm": 0.025626162067055702, "learning_rate": 2.5958952552650098e-06, "loss": 0.007682383060455322, "mean_token_accuracy": 0.9977481618523598, "num_tokens": 13922021.0, "step": 3110 }, { "entropy": 2.0456499844789504, "epoch": 3.875776397515528, "grad_norm": 2.543144702911377, "learning_rate": 2.542046500901748e-06, "loss": 0.0031697705388069155, "mean_token_accuracy": 0.9987499997019768, "num_tokens": 13962985.0, "step": 3120 }, { "entropy": 2.001152551174164, "epoch": 3.888198757763975, "grad_norm": 0.009251217357814312, "learning_rate": 2.4886806912948034e-06, "loss": 0.00028319426346570256, "mean_token_accuracy": 1.0, "num_tokens": 14005018.0, "step": 3130 }, { "entropy": 2.0633739441633225, "epoch": 3.900621118012422, "grad_norm": 0.005275467410683632, "learning_rate": 2.435801282182787e-06, "loss": 0.000858756247907877, "mean_token_accuracy": 1.0, "num_tokens": 14050239.0, "step": 3140 }, { "entropy": 1.9629602044820786, "epoch": 3.9130434782608696, "grad_norm": 0.004018905572593212, "learning_rate": 2.383411697807131e-06, "loss": 0.01187501847743988, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 14099540.0, "step": 3150 }, { "entropy": 2.03657703101635, "epoch": 3.9254658385093166, "grad_norm": 0.01581091806292534, "learning_rate": 2.331515330690336e-06, "loss": 0.0036426626145839693, "mean_token_accuracy": 0.9983574882149696, "num_tokens": 14143941.0, "step": 3160 }, { "entropy": 2.0609166443347933, "epoch": 3.937888198757764, "grad_norm": 0.07055187225341797, "learning_rate": 2.2801155414162933e-06, "loss": 0.0006878064014017582, "mean_token_accuracy": 1.0, "num_tokens": 14183855.0, "step": 3170 }, { "entropy": 2.039751389622688, "epoch": 3.950310559006211, "grad_norm": 0.015817873179912567, "learning_rate": 2.229215658412658e-06, "loss": 0.011930423974990844, "mean_token_accuracy": 0.9987499997019768, "num_tokens": 14230427.0, "step": 3180 }, { "entropy": 2.013304165005684, "epoch": 3.9627329192546585, "grad_norm": 0.010246982797980309, "learning_rate": 2.178818977735326e-06, "loss": 0.0027476778253912927, "mean_token_accuracy": 0.9993902444839478, "num_tokens": 14280167.0, "step": 3190 }, { "entropy": 2.027267241477966, "epoch": 3.9751552795031055, "grad_norm": 0.009065949358046055, "learning_rate": 2.1289287628549904e-06, "loss": 0.003876122832298279, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 14327872.0, "step": 3200 }, { "entropy": 2.0841051936149597, "epoch": 3.987577639751553, "grad_norm": 0.2582933306694031, "learning_rate": 2.0795482444458115e-06, "loss": 0.0015949519351124764, "mean_token_accuracy": 1.0, "num_tokens": 14374685.0, "step": 3210 }, { "entropy": 2.077771583199501, "epoch": 4.0, "grad_norm": 0.056201014667749405, "learning_rate": 2.0306806201762175e-06, "loss": 0.0005105304066091776, "mean_token_accuracy": 1.0, "num_tokens": 14415424.0, "step": 3220 }, { "entropy": 2.032339036464691, "epoch": 4.012422360248447, "grad_norm": 0.16235826909542084, "learning_rate": 1.9823290545018312e-06, "loss": 0.0008465294726192951, "mean_token_accuracy": 1.0, "num_tokens": 14462619.0, "step": 3230 }, { "entropy": 1.992909598350525, "epoch": 4.024844720496894, "grad_norm": 0.0017087548039853573, "learning_rate": 1.934496678460559e-06, "loss": 0.0006027131807059049, "mean_token_accuracy": 1.0, "num_tokens": 14507986.0, "step": 3240 }, { "entropy": 2.0650244295597076, "epoch": 4.037267080745342, "grad_norm": 0.0353049673140049, "learning_rate": 1.8871865894698338e-06, "loss": 0.00022105511743575335, "mean_token_accuracy": 1.0, "num_tokens": 14549567.0, "step": 3250 }, { "entropy": 2.0139154732227325, "epoch": 4.049689440993789, "grad_norm": 0.021216459572315216, "learning_rate": 1.8404018511260447e-06, "loss": 0.001208197418600321, "mean_token_accuracy": 1.0, "num_tokens": 14596321.0, "step": 3260 }, { "entropy": 2.0900548338890075, "epoch": 4.062111801242236, "grad_norm": 0.04834829643368721, "learning_rate": 1.7941454930061487e-06, "loss": 0.00025239353999495506, "mean_token_accuracy": 1.0, "num_tokens": 14638834.0, "step": 3270 }, { "entropy": 2.0481355130672454, "epoch": 4.074534161490683, "grad_norm": 0.0905168354511261, "learning_rate": 1.7484205104714824e-06, "loss": 0.004746239632368088, "mean_token_accuracy": 0.9990384608507157, "num_tokens": 14681585.0, "step": 3280 }, { "entropy": 2.0373184353113176, "epoch": 4.086956521739131, "grad_norm": 0.03823855146765709, "learning_rate": 1.703229864473811e-06, "loss": 0.00025348488707095386, "mean_token_accuracy": 1.0, "num_tokens": 14730043.0, "step": 3290 }, { "entropy": 2.0669949412345887, "epoch": 4.099378881987578, "grad_norm": 0.030003461986780167, "learning_rate": 1.6585764813635751e-06, "loss": 0.00018225166713818907, "mean_token_accuracy": 1.0, "num_tokens": 14772600.0, "step": 3300 }, { "entropy": 2.0379785656929017, "epoch": 4.111801242236025, "grad_norm": 0.005713196471333504, "learning_rate": 1.6144632527004033e-06, "loss": 0.0003649190068244934, "mean_token_accuracy": 1.0, "num_tokens": 14819632.0, "step": 3310 }, { "entropy": 2.0793015539646147, "epoch": 4.124223602484472, "grad_norm": 0.022466011345386505, "learning_rate": 1.5708930350658535e-06, "loss": 0.0008130665868520736, "mean_token_accuracy": 1.0, "num_tokens": 14866352.0, "step": 3320 }, { "entropy": 2.0861439973115923, "epoch": 4.136645962732919, "grad_norm": 0.04154065251350403, "learning_rate": 1.5278686498784512e-06, "loss": 0.0001728469622321427, "mean_token_accuracy": 1.0, "num_tokens": 14907444.0, "step": 3330 }, { "entropy": 1.9659110337495804, "epoch": 4.149068322981367, "grad_norm": 0.004008583724498749, "learning_rate": 1.4853928832109732e-06, "loss": 0.0005395710468292236, "mean_token_accuracy": 1.0, "num_tokens": 14958978.0, "step": 3340 }, { "entropy": 2.025330847501755, "epoch": 4.161490683229814, "grad_norm": 0.01808677799999714, "learning_rate": 1.4434684856100377e-06, "loss": 0.00026113332714885475, "mean_token_accuracy": 1.0, "num_tokens": 15001022.0, "step": 3350 }, { "entropy": 2.077262428402901, "epoch": 4.173913043478261, "grad_norm": 0.05431155487895012, "learning_rate": 1.402098171917996e-06, "loss": 0.0004729252308607101, "mean_token_accuracy": 1.0, "num_tokens": 15045200.0, "step": 3360 }, { "entropy": 2.028971680998802, "epoch": 4.186335403726708, "grad_norm": 0.03370862826704979, "learning_rate": 1.3612846210971153e-06, "loss": 0.0006381514482200146, "mean_token_accuracy": 1.0, "num_tokens": 15087961.0, "step": 3370 }, { "entropy": 2.0537871956825255, "epoch": 4.198757763975156, "grad_norm": 0.007738613057881594, "learning_rate": 1.3210304760561233e-06, "loss": 0.00116888377815485, "mean_token_accuracy": 1.0, "num_tokens": 15130072.0, "step": 3380 }, { "entropy": 2.092353865504265, "epoch": 4.211180124223603, "grad_norm": 0.049626674503088, "learning_rate": 1.281338343479045e-06, "loss": 0.00019769035279750823, "mean_token_accuracy": 1.0, "num_tokens": 15172731.0, "step": 3390 }, { "entropy": 2.024295452237129, "epoch": 4.22360248447205, "grad_norm": 0.0875379741191864, "learning_rate": 1.2422107936564175e-06, "loss": 0.0004914845339953899, "mean_token_accuracy": 1.0, "num_tokens": 15218529.0, "step": 3400 }, { "entropy": 2.0535459727048875, "epoch": 4.236024844720497, "grad_norm": 0.015673642978072166, "learning_rate": 1.2036503603188464e-06, "loss": 0.0002709951251745224, "mean_token_accuracy": 1.0, "num_tokens": 15262145.0, "step": 3410 }, { "entropy": 2.0593578845262526, "epoch": 4.248447204968944, "grad_norm": 0.045476797968149185, "learning_rate": 1.1656595404729232e-06, "loss": 0.0018097426742315291, "mean_token_accuracy": 0.9991666659712791, "num_tokens": 15312132.0, "step": 3420 }, { "entropy": 1.9848116040229797, "epoch": 4.260869565217392, "grad_norm": 0.0017723346827551723, "learning_rate": 1.1282407942395435e-06, "loss": 0.00026819088961929085, "mean_token_accuracy": 1.0, "num_tokens": 15355648.0, "step": 3430 }, { "entropy": 2.0672077775001525, "epoch": 4.273291925465839, "grad_norm": 0.01810125634074211, "learning_rate": 1.091396544694594e-06, "loss": 0.001546621322631836, "mean_token_accuracy": 1.0, "num_tokens": 15402566.0, "step": 3440 }, { "entropy": 2.103651860356331, "epoch": 4.285714285714286, "grad_norm": 0.013126119039952755, "learning_rate": 1.0551291777120465e-06, "loss": 0.0008613715879619121, "mean_token_accuracy": 1.0, "num_tokens": 15445576.0, "step": 3450 }, { "entropy": 2.0706649154424666, "epoch": 4.298136645962733, "grad_norm": 0.013539963401854038, "learning_rate": 1.019441041809449e-06, "loss": 0.00020982269197702407, "mean_token_accuracy": 1.0, "num_tokens": 15491988.0, "step": 3460 }, { "entropy": 2.0074143022298814, "epoch": 4.3105590062111805, "grad_norm": 0.005376921966671944, "learning_rate": 9.84334447995865e-07, "loss": 0.0008014158345758915, "mean_token_accuracy": 1.0, "num_tokens": 15536316.0, "step": 3470 }, { "entropy": 1.9699030220508575, "epoch": 4.3229813664596275, "grad_norm": 0.2335580438375473, "learning_rate": 9.498116696222049e-07, "loss": 0.0008583088405430317, "mean_token_accuracy": 1.0, "num_tokens": 15586522.0, "step": 3480 }, { "entropy": 2.0634532988071443, "epoch": 4.3354037267080745, "grad_norm": 0.07481986284255981, "learning_rate": 9.15874942234024e-07, "loss": 0.00037952899001538756, "mean_token_accuracy": 1.0, "num_tokens": 15630922.0, "step": 3490 }, { "entropy": 2.027003452181816, "epoch": 4.3478260869565215, "grad_norm": 0.004738735035061836, "learning_rate": 8.82526463426756e-07, "loss": 0.00023144190199673176, "mean_token_accuracy": 1.0, "num_tokens": 15676612.0, "step": 3500 }, { "epoch": 4.3478260869565215, "eval_entropy": 1.9058150294681577, "eval_loss": 0.7377180457115173, "eval_mean_token_accuracy": 0.9048938154551427, "eval_num_tokens": 15676612.0, "eval_runtime": 1014.9198, "eval_samples_per_second": 7.539, "eval_steps_per_second": 0.943, "step": 3500 }, { "entropy": 2.028341743350029, "epoch": 4.3602484472049685, "grad_norm": 0.33282777667045593, "learning_rate": 8.497683927033995e-07, "loss": 0.0004219844937324524, "mean_token_accuracy": 1.0, "num_tokens": 15725206.0, "step": 3510 }, { "entropy": 2.0083132714033125, "epoch": 4.372670807453416, "grad_norm": 0.007023821119219065, "learning_rate": 8.176028513346879e-07, "loss": 0.002606554329395294, "mean_token_accuracy": 0.9994897961616516, "num_tokens": 15770344.0, "step": 3520 }, { "entropy": 2.085210156440735, "epoch": 4.385093167701863, "grad_norm": 0.009783482179045677, "learning_rate": 7.860319222217206e-07, "loss": 0.0017641620710492135, "mean_token_accuracy": 0.9994565218687057, "num_tokens": 15811072.0, "step": 3530 }, { "entropy": 2.037967327237129, "epoch": 4.39751552795031, "grad_norm": 0.011295588687062263, "learning_rate": 7.550576497610829e-07, "loss": 0.00024796819780021907, "mean_token_accuracy": 1.0, "num_tokens": 15858282.0, "step": 3540 }, { "entropy": 2.0281506925821304, "epoch": 4.409937888198757, "grad_norm": 0.015403630211949348, "learning_rate": 7.246820397124598e-07, "loss": 0.0002571480348706245, "mean_token_accuracy": 1.0, "num_tokens": 15901251.0, "step": 3550 }, { "entropy": 2.0923985958099367, "epoch": 4.422360248447205, "grad_norm": 0.005905622150748968, "learning_rate": 6.949070590687567e-07, "loss": 0.0010250438004732131, "mean_token_accuracy": 0.997916667163372, "num_tokens": 15942361.0, "step": 3560 }, { "entropy": 2.0730757504701613, "epoch": 4.434782608695652, "grad_norm": 0.007940849289298058, "learning_rate": 6.65734635928711e-07, "loss": 0.00019977029878646136, "mean_token_accuracy": 1.0, "num_tokens": 15990201.0, "step": 3570 }, { "entropy": 1.9941458642482757, "epoch": 4.447204968944099, "grad_norm": 0.005438764579594135, "learning_rate": 6.37166659372056e-07, "loss": 0.0002368162851780653, "mean_token_accuracy": 1.0, "num_tokens": 16034717.0, "step": 3580 }, { "entropy": 2.049195554852486, "epoch": 4.459627329192546, "grad_norm": 0.003918728791177273, "learning_rate": 6.092049793371802e-07, "loss": 0.00024126945063471795, "mean_token_accuracy": 1.0, "num_tokens": 16077494.0, "step": 3590 }, { "entropy": 2.0372196793556214, "epoch": 4.472049689440993, "grad_norm": 0.007525778375566006, "learning_rate": 5.818514065013358e-07, "loss": 0.00033768313005566597, "mean_token_accuracy": 1.0, "num_tokens": 16121475.0, "step": 3600 }, { "entropy": 2.013162526488304, "epoch": 4.484472049689441, "grad_norm": 0.010637825354933739, "learning_rate": 5.551077121633875e-07, "loss": 0.00017051056493073703, "mean_token_accuracy": 1.0, "num_tokens": 16161482.0, "step": 3610 }, { "entropy": 2.000212600827217, "epoch": 4.496894409937888, "grad_norm": 0.007012031972408295, "learning_rate": 5.289756281291114e-07, "loss": 0.001262835692614317, "mean_token_accuracy": 1.0, "num_tokens": 16203394.0, "step": 3620 }, { "entropy": 2.066090244054794, "epoch": 4.509316770186335, "grad_norm": 0.01005527563393116, "learning_rate": 5.034568465990497e-07, "loss": 0.00016053561121225356, "mean_token_accuracy": 1.0, "num_tokens": 16243079.0, "step": 3630 }, { "entropy": 2.080022472143173, "epoch": 4.521739130434782, "grad_norm": 0.02030208148062229, "learning_rate": 4.785530200589327e-07, "loss": 0.0015855986624956132, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 16289416.0, "step": 3640 }, { "entropy": 2.0235850870609284, "epoch": 4.53416149068323, "grad_norm": 0.017586492002010345, "learning_rate": 4.5426576117266643e-07, "loss": 0.00019510933198034762, "mean_token_accuracy": 1.0, "num_tokens": 16337150.0, "step": 3650 }, { "entropy": 2.036457586288452, "epoch": 4.546583850931677, "grad_norm": 0.003649574238806963, "learning_rate": 4.305966426779118e-07, "loss": 0.013864995539188385, "mean_token_accuracy": 0.997054597735405, "num_tokens": 16382104.0, "step": 3660 }, { "entropy": 2.098330682516098, "epoch": 4.559006211180124, "grad_norm": 0.010212893597781658, "learning_rate": 4.0754719728423267e-07, "loss": 0.0013746877200901508, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 16422099.0, "step": 3670 }, { "entropy": 2.076760244369507, "epoch": 4.571428571428571, "grad_norm": 0.25979042053222656, "learning_rate": 3.85118917573849e-07, "loss": 0.000352576794102788, "mean_token_accuracy": 1.0, "num_tokens": 16463092.0, "step": 3680 }, { "entropy": 2.0827836245298386, "epoch": 4.583850931677018, "grad_norm": 0.02301006019115448, "learning_rate": 3.6331325590498344e-07, "loss": 0.0007054576650261879, "mean_token_accuracy": 1.0, "num_tokens": 16505380.0, "step": 3690 }, { "entropy": 2.047082948684692, "epoch": 4.596273291925466, "grad_norm": 0.004036522004753351, "learning_rate": 3.4213162431780964e-07, "loss": 0.00014299721224233508, "mean_token_accuracy": 1.0, "num_tokens": 16551379.0, "step": 3700 }, { "entropy": 2.0353837430477144, "epoch": 4.608695652173913, "grad_norm": 0.015464823693037033, "learning_rate": 3.2157539444301667e-07, "loss": 0.00044039799831807613, "mean_token_accuracy": 1.0, "num_tokens": 16590736.0, "step": 3710 }, { "entropy": 2.035485503077507, "epoch": 4.62111801242236, "grad_norm": 0.023447539657354355, "learning_rate": 3.0164589741298986e-07, "loss": 0.0002818571170791984, "mean_token_accuracy": 1.0, "num_tokens": 16633530.0, "step": 3720 }, { "entropy": 2.044951635599136, "epoch": 4.633540372670807, "grad_norm": 0.0037932603154331446, "learning_rate": 2.823444237756123e-07, "loss": 0.00026586204767227174, "mean_token_accuracy": 1.0, "num_tokens": 16678584.0, "step": 3730 }, { "entropy": 2.0412946969270704, "epoch": 4.645962732919255, "grad_norm": 0.04193413257598877, "learning_rate": 2.636722234106903e-07, "loss": 0.00031464963685721157, "mean_token_accuracy": 1.0, "num_tokens": 16723346.0, "step": 3740 }, { "entropy": 2.037806236743927, "epoch": 4.658385093167702, "grad_norm": 0.008879466913640499, "learning_rate": 2.4563050544901935e-07, "loss": 0.0008394073694944382, "mean_token_accuracy": 1.0, "num_tokens": 16766309.0, "step": 3750 }, { "entropy": 2.0403653383255005, "epoch": 4.670807453416149, "grad_norm": 0.004407000727951527, "learning_rate": 2.282204381940889e-07, "loss": 0.000280851754359901, "mean_token_accuracy": 1.0, "num_tokens": 16809072.0, "step": 3760 }, { "entropy": 2.0514664113521577, "epoch": 4.683229813664596, "grad_norm": 2.2006642818450928, "learning_rate": 2.1144314904642194e-07, "loss": 0.007948150485754013, "mean_token_accuracy": 0.9976576581597328, "num_tokens": 16851980.0, "step": 3770 }, { "entropy": 2.1021973162889482, "epoch": 4.695652173913043, "grad_norm": 0.0551968514919281, "learning_rate": 1.9529972443057542e-07, "loss": 0.00034392224624753, "mean_token_accuracy": 1.0, "num_tokens": 16893309.0, "step": 3780 }, { "entropy": 2.0802121639251707, "epoch": 4.708074534161491, "grad_norm": 0.022165654227137566, "learning_rate": 1.7979120972478448e-07, "loss": 0.0012221145443618298, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 16936398.0, "step": 3790 }, { "entropy": 1.9913864940404893, "epoch": 4.720496894409938, "grad_norm": 0.0038369097746908665, "learning_rate": 1.6491860919326863e-07, "loss": 0.0035387083888053896, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 16983474.0, "step": 3800 }, { "entropy": 2.0697665393352507, "epoch": 4.732919254658385, "grad_norm": 0.10980178415775299, "learning_rate": 1.5068288592120284e-07, "loss": 0.0024135053157806397, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 17023077.0, "step": 3810 }, { "entropy": 2.023961767554283, "epoch": 4.745341614906832, "grad_norm": 0.016840871423482895, "learning_rate": 1.3708496175234732e-07, "loss": 0.00022674815263599158, "mean_token_accuracy": 1.0, "num_tokens": 17071372.0, "step": 3820 }, { "entropy": 2.021743801236153, "epoch": 4.75776397515528, "grad_norm": 0.019546369090676308, "learning_rate": 1.241257172293575e-07, "loss": 0.0004151566419750452, "mean_token_accuracy": 1.0, "num_tokens": 17118417.0, "step": 3830 }, { "entropy": 1.9979822367429734, "epoch": 4.770186335403727, "grad_norm": 0.012950404547154903, "learning_rate": 1.1180599153676086e-07, "loss": 0.0011697439476847649, "mean_token_accuracy": 1.0, "num_tokens": 17165083.0, "step": 3840 }, { "entropy": 2.03771687746048, "epoch": 4.782608695652174, "grad_norm": 0.002949357498437166, "learning_rate": 1.0012658244661799e-07, "loss": 0.0001900658942759037, "mean_token_accuracy": 1.0, "num_tokens": 17210230.0, "step": 3850 }, { "entropy": 2.0459833204746247, "epoch": 4.795031055900621, "grad_norm": 0.02009522169828415, "learning_rate": 8.908824626685853e-08, "loss": 0.001738494448363781, "mean_token_accuracy": 0.9992424249649048, "num_tokens": 17257379.0, "step": 3860 }, { "entropy": 2.0705668896436693, "epoch": 4.807453416149068, "grad_norm": 0.06382288783788681, "learning_rate": 7.869169779230911e-08, "loss": 0.0019037414342164994, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 17303678.0, "step": 3870 }, { "entropy": 2.0258702844381333, "epoch": 4.819875776397516, "grad_norm": 0.012522595003247261, "learning_rate": 6.893761025840607e-08, "loss": 0.003264884650707245, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 17353254.0, "step": 3880 }, { "entropy": 2.001204323768616, "epoch": 4.832298136645963, "grad_norm": 0.0486503429710865, "learning_rate": 5.982661529759459e-08, "loss": 0.002944428473711014, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 17395502.0, "step": 3890 }, { "entropy": 1.9402426928281784, "epoch": 4.84472049689441, "grad_norm": 0.004425989929586649, "learning_rate": 5.135930289843716e-08, "loss": 0.0007586335297673941, "mean_token_accuracy": 1.0, "num_tokens": 17449789.0, "step": 3900 }, { "entropy": 2.047208711504936, "epoch": 4.857142857142857, "grad_norm": 0.4375987946987152, "learning_rate": 4.353622136739844e-08, "loss": 0.0035171639174222946, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 17494196.0, "step": 3910 }, { "entropy": 2.005463221669197, "epoch": 4.869565217391305, "grad_norm": 0.02442975342273712, "learning_rate": 3.6357877293342615e-08, "loss": 0.0002247157972306013, "mean_token_accuracy": 1.0, "num_tokens": 17540344.0, "step": 3920 }, { "entropy": 2.066293877363205, "epoch": 4.881987577639752, "grad_norm": 0.038806382566690445, "learning_rate": 2.982473551473297e-08, "loss": 0.0010721116326749326, "mean_token_accuracy": 1.0, "num_tokens": 17579881.0, "step": 3930 }, { "entropy": 1.9953967750072479, "epoch": 4.894409937888199, "grad_norm": 0.030400315299630165, "learning_rate": 2.3937219089524843e-08, "loss": 0.0002892194781452417, "mean_token_accuracy": 1.0, "num_tokens": 17628781.0, "step": 3940 }, { "entropy": 2.031711795926094, "epoch": 4.906832298136646, "grad_norm": 0.037453047931194305, "learning_rate": 1.8695709267774197e-08, "loss": 0.00017593621741980315, "mean_token_accuracy": 1.0, "num_tokens": 17676511.0, "step": 3950 }, { "entropy": 2.035673101246357, "epoch": 4.919254658385093, "grad_norm": 0.12591120600700378, "learning_rate": 1.410054546694739e-08, "loss": 0.006961337476968765, "mean_token_accuracy": 0.9986842110753059, "num_tokens": 17715980.0, "step": 3960 }, { "entropy": 2.0690086662769316, "epoch": 4.931677018633541, "grad_norm": 0.00455585028976202, "learning_rate": 1.0152025249943187e-08, "loss": 0.0008870340883731842, "mean_token_accuracy": 1.0, "num_tokens": 17757285.0, "step": 3970 }, { "entropy": 1.9871522605419158, "epoch": 4.944099378881988, "grad_norm": 0.04197465628385544, "learning_rate": 6.850404305823732e-09, "loss": 0.0005288542248308659, "mean_token_accuracy": 1.0, "num_tokens": 17806632.0, "step": 3980 }, { "entropy": 2.0136446237564085, "epoch": 4.956521739130435, "grad_norm": 0.00905593391507864, "learning_rate": 4.195896433255575e-09, "loss": 0.0002543700160458684, "mean_token_accuracy": 1.0, "num_tokens": 17857937.0, "step": 3990 }, { "entropy": 2.014116221666336, "epoch": 4.9689440993788825, "grad_norm": 0.1457187533378601, "learning_rate": 2.1886735266696268e-09, "loss": 0.00390925370156765, "mean_token_accuracy": 0.9984375, "num_tokens": 17901151.0, "step": 4000 }, { "epoch": 4.9689440993788825, "eval_entropy": 1.9050748003189342, "eval_loss": 0.7378253936767578, "eval_mean_token_accuracy": 0.9051745814838629, "eval_num_tokens": 17901151.0, "eval_runtime": 1014.6596, "eval_samples_per_second": 7.54, "eval_steps_per_second": 0.943, "step": 4000 }, { "entropy": 2.0390416413545607, "epoch": 4.9813664596273295, "grad_norm": 0.013149413280189037, "learning_rate": 8.288655651234045e-10, "loss": 0.0001981796929612756, "mean_token_accuracy": 1.0, "num_tokens": 17946275.0, "step": 4010 }, { "entropy": 2.0683668941259383, "epoch": 4.9937888198757765, "grad_norm": 0.027039172127842903, "learning_rate": 1.1656060388998136e-10, "loss": 0.0002283555455505848, "mean_token_accuracy": 1.0, "num_tokens": 17994096.0, "step": 4020 }, { "epoch": 5.0, "eval_entropy": 1.9048992476368647, "eval_loss": 0.7375593781471252, "eval_mean_token_accuracy": 0.9050571202235287, "eval_num_tokens": 18019280.0, "eval_runtime": 1015.1336, "eval_samples_per_second": 7.537, "eval_steps_per_second": 0.943, "step": 4025 }, { "epoch": 5.0, "step": 4025, "total_flos": 1.0590717965324943e+18, "train_loss": 0.07133869599467085, "train_runtime": 16940.0407, "train_samples_per_second": 1.901, "train_steps_per_second": 0.238 } ], "logging_steps": 10, "max_steps": 4025, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.0590717965324943e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }