{ "best_global_step": 2000, "best_metric": 0.44610196352005005, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_statutory-element-matcher_fallback_ffn_only_5ep_eval500/checkpoint-2000", "epoch": 5.0, "eval_steps": 500, "global_step": 6480, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.256485325098038, "epoch": 0.007720517274657402, "grad_norm": 7.307734489440918, "learning_rate": 9.230769230769232e-07, "loss": 2.06158504486084, "mean_token_accuracy": 0.6090951159596443, "num_tokens": 32810.0, "step": 10 }, { "entropy": 2.284497153759003, "epoch": 0.015441034549314805, "grad_norm": 8.211675643920898, "learning_rate": 1.948717948717949e-06, "loss": 1.9772743225097655, "mean_token_accuracy": 0.6226175807416439, "num_tokens": 67674.0, "step": 20 }, { "entropy": 2.2925585120916367, "epoch": 0.023161551823972205, "grad_norm": 14.34852123260498, "learning_rate": 2.9743589743589746e-06, "loss": 1.8409126281738282, "mean_token_accuracy": 0.6243047766387463, "num_tokens": 105820.0, "step": 30 }, { "entropy": 2.257777214050293, "epoch": 0.03088206909862961, "grad_norm": 9.495259284973145, "learning_rate": 4.000000000000001e-06, "loss": 1.7386272430419922, "mean_token_accuracy": 0.6371752314269543, "num_tokens": 142765.0, "step": 40 }, { "entropy": 2.2558146893978117, "epoch": 0.038602586373287014, "grad_norm": 4.8525285720825195, "learning_rate": 5.025641025641026e-06, "loss": 1.5439723968505858, "mean_token_accuracy": 0.6804775930941105, "num_tokens": 179804.0, "step": 50 }, { "entropy": 2.3024860441684725, "epoch": 0.04632310364794441, "grad_norm": 4.64549446105957, "learning_rate": 6.051282051282051e-06, "loss": 1.251286220550537, "mean_token_accuracy": 0.7414289742708207, "num_tokens": 212054.0, "step": 60 }, { "entropy": 2.3543750554323197, "epoch": 0.054043620922601815, "grad_norm": 3.5757696628570557, "learning_rate": 7.076923076923078e-06, "loss": 0.9379256248474122, "mean_token_accuracy": 0.7693132214248181, "num_tokens": 245935.0, "step": 70 }, { "entropy": 2.3174787133932115, "epoch": 0.06176413819725922, "grad_norm": 4.677041530609131, "learning_rate": 8.102564102564103e-06, "loss": 1.0049633979797363, "mean_token_accuracy": 0.770514677464962, "num_tokens": 283556.0, "step": 80 }, { "entropy": 2.358958587050438, "epoch": 0.06948465547191662, "grad_norm": 3.2004008293151855, "learning_rate": 9.128205128205129e-06, "loss": 0.966558837890625, "mean_token_accuracy": 0.7766762919723987, "num_tokens": 319043.0, "step": 90 }, { "entropy": 2.3884228974580766, "epoch": 0.07720517274657403, "grad_norm": 4.562836647033691, "learning_rate": 1.0153846153846154e-05, "loss": 0.8094841003417969, "mean_token_accuracy": 0.8071015253663063, "num_tokens": 352565.0, "step": 100 }, { "entropy": 2.367259520292282, "epoch": 0.08492569002123142, "grad_norm": 4.451163291931152, "learning_rate": 1.117948717948718e-05, "loss": 0.6964176177978516, "mean_token_accuracy": 0.829041276872158, "num_tokens": 385068.0, "step": 110 }, { "entropy": 2.348944702744484, "epoch": 0.09264620729588882, "grad_norm": 3.5486667156219482, "learning_rate": 1.2205128205128208e-05, "loss": 0.5524073600769043, "mean_token_accuracy": 0.8610983595252037, "num_tokens": 417434.0, "step": 120 }, { "entropy": 2.362921339273453, "epoch": 0.10036672457054623, "grad_norm": 3.7314867973327637, "learning_rate": 1.3230769230769231e-05, "loss": 0.524355697631836, "mean_token_accuracy": 0.862143586575985, "num_tokens": 451513.0, "step": 130 }, { "entropy": 2.3315255403518678, "epoch": 0.10808724184520363, "grad_norm": 3.9957523345947266, "learning_rate": 1.4256410256410258e-05, "loss": 0.5264537334442139, "mean_token_accuracy": 0.8657179176807404, "num_tokens": 488960.0, "step": 140 }, { "entropy": 2.272639125585556, "epoch": 0.11580775911986103, "grad_norm": 6.005861759185791, "learning_rate": 1.5282051282051282e-05, "loss": 0.5440045833587647, "mean_token_accuracy": 0.846938057243824, "num_tokens": 522139.0, "step": 150 }, { "entropy": 2.355533537268639, "epoch": 0.12352827639451844, "grad_norm": 6.817739009857178, "learning_rate": 1.630769230769231e-05, "loss": 0.39336931705474854, "mean_token_accuracy": 0.9171057492494583, "num_tokens": 554659.0, "step": 160 }, { "entropy": 2.1675438672304153, "epoch": 0.13124879366917583, "grad_norm": 4.914283275604248, "learning_rate": 1.7333333333333336e-05, "loss": 0.49741554260253906, "mean_token_accuracy": 0.8793981537222862, "num_tokens": 595435.0, "step": 170 }, { "entropy": 2.2984329521656037, "epoch": 0.13896931094383325, "grad_norm": 6.025143623352051, "learning_rate": 1.835897435897436e-05, "loss": 0.3462223529815674, "mean_token_accuracy": 0.8944209352135658, "num_tokens": 628526.0, "step": 180 }, { "entropy": 2.3169893980026246, "epoch": 0.14668982821849064, "grad_norm": 5.91893196105957, "learning_rate": 1.9384615384615386e-05, "loss": 0.31524474620819093, "mean_token_accuracy": 0.9156093567609787, "num_tokens": 665610.0, "step": 190 }, { "entropy": 2.301328441500664, "epoch": 0.15441034549314805, "grad_norm": 3.231717109680176, "learning_rate": 1.9999980011554353e-05, "loss": 0.32752580642700196, "mean_token_accuracy": 0.910846720635891, "num_tokens": 706015.0, "step": 200 }, { "entropy": 2.273413100838661, "epoch": 0.16213086276780544, "grad_norm": 3.171372652053833, "learning_rate": 1.9999755142458468e-05, "loss": 0.37491621971130373, "mean_token_accuracy": 0.9038208425045013, "num_tokens": 742435.0, "step": 210 }, { "entropy": 2.2427696734666824, "epoch": 0.16985138004246284, "grad_norm": 6.08746337890625, "learning_rate": 1.9999280424346836e-05, "loss": 0.2458643436431885, "mean_token_accuracy": 0.9297083392739296, "num_tokens": 774452.0, "step": 220 }, { "entropy": 2.315064123272896, "epoch": 0.17757189731712025, "grad_norm": 6.792384147644043, "learning_rate": 1.9998555869080533e-05, "loss": 0.3388651132583618, "mean_token_accuracy": 0.9051751494407654, "num_tokens": 804925.0, "step": 230 }, { "entropy": 2.299090850353241, "epoch": 0.18529241459177764, "grad_norm": 6.4787468910217285, "learning_rate": 1.999758149476294e-05, "loss": 0.339692497253418, "mean_token_accuracy": 0.9080843642354012, "num_tokens": 845968.0, "step": 240 }, { "entropy": 2.280930459499359, "epoch": 0.19301293186643506, "grad_norm": 5.793071746826172, "learning_rate": 1.9996357325739306e-05, "loss": 0.27950329780578614, "mean_token_accuracy": 0.9254253804683685, "num_tokens": 879844.0, "step": 250 }, { "entropy": 2.2729754209518434, "epoch": 0.20073344914109245, "grad_norm": 7.555527687072754, "learning_rate": 1.999488339259612e-05, "loss": 0.30706956386566164, "mean_token_accuracy": 0.9272728309035301, "num_tokens": 913158.0, "step": 260 }, { "entropy": 2.267097595334053, "epoch": 0.20845396641574984, "grad_norm": 2.7754158973693848, "learning_rate": 1.9993159732160353e-05, "loss": 0.2901525735855103, "mean_token_accuracy": 0.9153242215514183, "num_tokens": 952998.0, "step": 270 }, { "entropy": 2.2886367619037626, "epoch": 0.21617448369040726, "grad_norm": 5.025292873382568, "learning_rate": 1.999118638749855e-05, "loss": 0.23909380435943603, "mean_token_accuracy": 0.9286381289362907, "num_tokens": 988029.0, "step": 280 }, { "entropy": 2.215249925851822, "epoch": 0.22389500096506465, "grad_norm": 2.3225855827331543, "learning_rate": 1.9988963407915743e-05, "loss": 0.24327101707458496, "mean_token_accuracy": 0.9352555975317955, "num_tokens": 1023017.0, "step": 290 }, { "entropy": 2.231352314352989, "epoch": 0.23161551823972207, "grad_norm": 3.9783694744110107, "learning_rate": 1.9986490848954213e-05, "loss": 0.28902668952941896, "mean_token_accuracy": 0.9245402902364731, "num_tokens": 1058144.0, "step": 300 }, { "entropy": 2.283156764507294, "epoch": 0.23933603551437946, "grad_norm": 4.462434768676758, "learning_rate": 1.9983768772392122e-05, "loss": 0.34264867305755614, "mean_token_accuracy": 0.9317045152187348, "num_tokens": 1089081.0, "step": 310 }, { "entropy": 2.184281289577484, "epoch": 0.24705655278903688, "grad_norm": 4.392584800720215, "learning_rate": 1.998079724624194e-05, "loss": 0.21626288890838624, "mean_token_accuracy": 0.9372277542948723, "num_tokens": 1128469.0, "step": 320 }, { "entropy": 2.2497308939695357, "epoch": 0.25477707006369427, "grad_norm": 4.71306848526001, "learning_rate": 1.997757634474878e-05, "loss": 0.18063234090805053, "mean_token_accuracy": 0.9538213908672333, "num_tokens": 1164636.0, "step": 330 }, { "entropy": 2.2387163996696473, "epoch": 0.26249758733835166, "grad_norm": 1.666062831878662, "learning_rate": 1.997410614838852e-05, "loss": 0.1772278666496277, "mean_token_accuracy": 0.9541213810443878, "num_tokens": 1198253.0, "step": 340 }, { "entropy": 2.2753040075302122, "epoch": 0.27021810461300905, "grad_norm": 3.6660280227661133, "learning_rate": 1.9970386743865794e-05, "loss": 0.191804039478302, "mean_token_accuracy": 0.9456240653991699, "num_tokens": 1230490.0, "step": 350 }, { "entropy": 2.2174918383359907, "epoch": 0.2779386218876665, "grad_norm": 6.83668851852417, "learning_rate": 1.9966418224111838e-05, "loss": 0.20989911556243895, "mean_token_accuracy": 0.9410885244607925, "num_tokens": 1267745.0, "step": 360 }, { "entropy": 2.219417518377304, "epoch": 0.2856591391623239, "grad_norm": 3.405336618423462, "learning_rate": 1.996220068828215e-05, "loss": 0.12719086408615113, "mean_token_accuracy": 0.9730818659067154, "num_tokens": 1303473.0, "step": 370 }, { "entropy": 2.2125363498926163, "epoch": 0.2933796564369813, "grad_norm": 4.977858066558838, "learning_rate": 1.995773424175403e-05, "loss": 0.23458333015441896, "mean_token_accuracy": 0.9394760414958, "num_tokens": 1338018.0, "step": 380 }, { "entropy": 2.2556005716323853, "epoch": 0.30110017371163866, "grad_norm": 4.019962787628174, "learning_rate": 1.9953018996123942e-05, "loss": 0.20530598163604735, "mean_token_accuracy": 0.9385380610823632, "num_tokens": 1373244.0, "step": 390 }, { "entropy": 2.2015073150396347, "epoch": 0.3088206909862961, "grad_norm": 2.728677749633789, "learning_rate": 1.9948055069204716e-05, "loss": 0.2082897901535034, "mean_token_accuracy": 0.9512322708964348, "num_tokens": 1407807.0, "step": 400 }, { "entropy": 2.273113363981247, "epoch": 0.3165412082609535, "grad_norm": 5.641965866088867, "learning_rate": 1.9942842585022607e-05, "loss": 0.16474014520645142, "mean_token_accuracy": 0.9578953236341476, "num_tokens": 1439941.0, "step": 410 }, { "entropy": 2.233418434858322, "epoch": 0.3242617255356109, "grad_norm": 1.6350418329238892, "learning_rate": 1.993738167381422e-05, "loss": 0.2152254104614258, "mean_token_accuracy": 0.9460450857877731, "num_tokens": 1476301.0, "step": 420 }, { "entropy": 2.2233593642711638, "epoch": 0.3319822428102683, "grad_norm": 5.32601261138916, "learning_rate": 1.9931672472023212e-05, "loss": 0.18065141439437865, "mean_token_accuracy": 0.9680908665060997, "num_tokens": 1514277.0, "step": 430 }, { "entropy": 2.13372061252594, "epoch": 0.33970276008492567, "grad_norm": 2.3526391983032227, "learning_rate": 1.992571512229693e-05, "loss": 0.19432415962219238, "mean_token_accuracy": 0.957370612025261, "num_tokens": 1552244.0, "step": 440 }, { "entropy": 2.2559954702854155, "epoch": 0.3474232773595831, "grad_norm": 4.275816440582275, "learning_rate": 1.9919509773482816e-05, "loss": 0.1578107237815857, "mean_token_accuracy": 0.9568435192108155, "num_tokens": 1589032.0, "step": 450 }, { "entropy": 2.1852520048618316, "epoch": 0.3551437946342405, "grad_norm": 4.293900489807129, "learning_rate": 1.991305658062469e-05, "loss": 0.23177709579467773, "mean_token_accuracy": 0.9536217465996742, "num_tokens": 1623926.0, "step": 460 }, { "entropy": 2.2606248050928115, "epoch": 0.3628643119088979, "grad_norm": 2.29001784324646, "learning_rate": 1.9906355704958895e-05, "loss": 0.17753545045852662, "mean_token_accuracy": 0.9497943684458733, "num_tokens": 1660932.0, "step": 470 }, { "entropy": 2.240851789712906, "epoch": 0.3705848291835553, "grad_norm": 6.091527462005615, "learning_rate": 1.989940731391024e-05, "loss": 0.1601572871208191, "mean_token_accuracy": 0.9648889541625977, "num_tokens": 1699168.0, "step": 480 }, { "entropy": 2.2124760150909424, "epoch": 0.3783053464582127, "grad_norm": 1.9111343622207642, "learning_rate": 1.9892211581087854e-05, "loss": 0.18850926160812378, "mean_token_accuracy": 0.950583329796791, "num_tokens": 1732169.0, "step": 490 }, { "entropy": 2.1586394786834715, "epoch": 0.3860258637328701, "grad_norm": 2.544804573059082, "learning_rate": 1.9884768686280807e-05, "loss": 0.16971189975738527, "mean_token_accuracy": 0.9592921108007431, "num_tokens": 1765074.0, "step": 500 }, { "epoch": 0.3860258637328701, "eval_entropy": 2.1075005949851486, "eval_loss": 0.5422846674919128, "eval_mean_token_accuracy": 0.8941449357922673, "eval_num_tokens": 1765074.0, "eval_runtime": 988.7029, "eval_samples_per_second": 7.738, "eval_steps_per_second": 0.968, "step": 500 }, { "entropy": 2.2212108463048934, "epoch": 0.3937463810075275, "grad_norm": 5.165001392364502, "learning_rate": 1.9877078815453648e-05, "loss": 0.2070312023162842, "mean_token_accuracy": 0.9447736650705337, "num_tokens": 1803147.0, "step": 510 }, { "entropy": 2.1793356448411942, "epoch": 0.4014668982821849, "grad_norm": 3.1133415699005127, "learning_rate": 1.9869142160741748e-05, "loss": 0.15652704238891602, "mean_token_accuracy": 0.9599319085478782, "num_tokens": 1836681.0, "step": 520 }, { "entropy": 2.1871384173631667, "epoch": 0.4091874155568423, "grad_norm": 2.828554153442383, "learning_rate": 1.9860958920446503e-05, "loss": 0.18446458578109742, "mean_token_accuracy": 0.9459314718842506, "num_tokens": 1872127.0, "step": 530 }, { "entropy": 2.2149875700473785, "epoch": 0.4169079328314997, "grad_norm": 1.8423798084259033, "learning_rate": 1.985252929903037e-05, "loss": 0.1715518832206726, "mean_token_accuracy": 0.9680211797356606, "num_tokens": 1905318.0, "step": 540 }, { "entropy": 2.2457988798618316, "epoch": 0.42462845010615713, "grad_norm": 0.8942133188247681, "learning_rate": 1.9843853507111764e-05, "loss": 0.19799450635910035, "mean_token_accuracy": 0.954279862344265, "num_tokens": 1942161.0, "step": 550 }, { "entropy": 2.2178206920623778, "epoch": 0.4323489673808145, "grad_norm": 4.0149455070495605, "learning_rate": 1.9834931761459804e-05, "loss": 0.16577671766281127, "mean_token_accuracy": 0.9597131043672562, "num_tokens": 1977752.0, "step": 560 }, { "entropy": 2.2375432044267654, "epoch": 0.4400694846554719, "grad_norm": 2.153841495513916, "learning_rate": 1.9825764284988884e-05, "loss": 0.17870255708694457, "mean_token_accuracy": 0.9546808168292046, "num_tokens": 2012513.0, "step": 570 }, { "entropy": 2.25352583527565, "epoch": 0.4477900019301293, "grad_norm": 5.3909592628479, "learning_rate": 1.9816351306753112e-05, "loss": 0.10405315160751342, "mean_token_accuracy": 0.965131339430809, "num_tokens": 2046420.0, "step": 580 }, { "entropy": 2.154633605480194, "epoch": 0.45551051920478675, "grad_norm": 3.521245002746582, "learning_rate": 1.980669306194058e-05, "loss": 0.20279982089996337, "mean_token_accuracy": 0.9519533723592758, "num_tokens": 2084016.0, "step": 590 }, { "entropy": 2.186835992336273, "epoch": 0.46323103647944414, "grad_norm": 2.632781982421875, "learning_rate": 1.979678979186749e-05, "loss": 0.18113456964492797, "mean_token_accuracy": 0.9502775952219963, "num_tokens": 2117364.0, "step": 600 }, { "entropy": 2.189032417535782, "epoch": 0.4709515537541015, "grad_norm": 3.7245187759399414, "learning_rate": 1.9786641743972135e-05, "loss": 0.17686980962753296, "mean_token_accuracy": 0.9488097980618477, "num_tokens": 2151634.0, "step": 610 }, { "entropy": 2.2037782222032547, "epoch": 0.4786720710287589, "grad_norm": 4.016031742095947, "learning_rate": 1.9776249171808693e-05, "loss": 0.15398112535476685, "mean_token_accuracy": 0.9585451945662499, "num_tokens": 2187502.0, "step": 620 }, { "entropy": 2.124007895588875, "epoch": 0.4863925883034163, "grad_norm": 0.7118439078330994, "learning_rate": 1.9765612335040923e-05, "loss": 0.1368114948272705, "mean_token_accuracy": 0.9596732050180435, "num_tokens": 2219123.0, "step": 630 }, { "entropy": 2.1975839883089066, "epoch": 0.49411310557807375, "grad_norm": 7.007303714752197, "learning_rate": 1.9754731499435648e-05, "loss": 0.1872836470603943, "mean_token_accuracy": 0.953962279856205, "num_tokens": 2249877.0, "step": 640 }, { "entropy": 2.152134519815445, "epoch": 0.5018336228527311, "grad_norm": 5.597184658050537, "learning_rate": 1.9743606936856134e-05, "loss": 0.12075231075286866, "mean_token_accuracy": 0.9612849146127701, "num_tokens": 2290176.0, "step": 650 }, { "entropy": 2.168921798467636, "epoch": 0.5095541401273885, "grad_norm": 2.507140636444092, "learning_rate": 1.9732238925255282e-05, "loss": 0.17506990432739258, "mean_token_accuracy": 0.9573684856295586, "num_tokens": 2326102.0, "step": 660 }, { "entropy": 2.2062420308589936, "epoch": 0.5172746574020459, "grad_norm": 0.6417449116706848, "learning_rate": 1.9720627748668705e-05, "loss": 0.13540934324264525, "mean_token_accuracy": 0.9623032554984092, "num_tokens": 2360241.0, "step": 670 }, { "entropy": 2.078236073255539, "epoch": 0.5249951746767033, "grad_norm": 6.3616623878479, "learning_rate": 1.9708773697207608e-05, "loss": 0.15398894548416137, "mean_token_accuracy": 0.9607418894767761, "num_tokens": 2404406.0, "step": 680 }, { "entropy": 2.111809679865837, "epoch": 0.5327156919513607, "grad_norm": 6.101365089416504, "learning_rate": 1.969667706705155e-05, "loss": 0.21354906558990477, "mean_token_accuracy": 0.9489550918340683, "num_tokens": 2440018.0, "step": 690 }, { "entropy": 2.1686588764190673, "epoch": 0.5404362092260181, "grad_norm": 3.270843982696533, "learning_rate": 1.9684338160441045e-05, "loss": 0.14644697904586793, "mean_token_accuracy": 0.9603226110339165, "num_tokens": 2476784.0, "step": 700 }, { "entropy": 2.166987511515617, "epoch": 0.5481567265006756, "grad_norm": 4.874166965484619, "learning_rate": 1.9671757285670013e-05, "loss": 0.16295208930969238, "mean_token_accuracy": 0.9569882333278656, "num_tokens": 2512350.0, "step": 710 }, { "entropy": 2.252730244398117, "epoch": 0.555877243775333, "grad_norm": 3.095005512237549, "learning_rate": 1.9658934757078067e-05, "loss": 0.11499756574630737, "mean_token_accuracy": 0.9637171044945717, "num_tokens": 2541581.0, "step": 720 }, { "entropy": 2.1925143748521805, "epoch": 0.5635977610499904, "grad_norm": 2.961524486541748, "learning_rate": 1.9645870895042665e-05, "loss": 0.0865030288696289, "mean_token_accuracy": 0.9704707160592079, "num_tokens": 2575015.0, "step": 730 }, { "entropy": 2.1793641477823256, "epoch": 0.5713182783246478, "grad_norm": 3.9880712032318115, "learning_rate": 1.9632566025971114e-05, "loss": 0.1488552212715149, "mean_token_accuracy": 0.9751747816801071, "num_tokens": 2610061.0, "step": 740 }, { "entropy": 2.172965335845947, "epoch": 0.5790387955993052, "grad_norm": 5.618796348571777, "learning_rate": 1.9619020482292386e-05, "loss": 0.11244801282882691, "mean_token_accuracy": 0.9690556541085243, "num_tokens": 2645126.0, "step": 750 }, { "entropy": 2.114529776573181, "epoch": 0.5867593128739625, "grad_norm": 4.01426362991333, "learning_rate": 1.960523460244885e-05, "loss": 0.14911041259765626, "mean_token_accuracy": 0.9594126790761948, "num_tokens": 2683118.0, "step": 760 }, { "entropy": 2.2817918568849564, "epoch": 0.5944798301486199, "grad_norm": 3.577343225479126, "learning_rate": 1.959120873088779e-05, "loss": 0.17379360198974608, "mean_token_accuracy": 0.958151726424694, "num_tokens": 2717012.0, "step": 770 }, { "entropy": 2.2415023863315584, "epoch": 0.6022003474232773, "grad_norm": 0.9728232622146606, "learning_rate": 1.9576943218052813e-05, "loss": 0.16758315563201903, "mean_token_accuracy": 0.9584022372961044, "num_tokens": 2750233.0, "step": 780 }, { "entropy": 2.2567327469587326, "epoch": 0.6099208646979347, "grad_norm": 4.933441638946533, "learning_rate": 1.956243842037507e-05, "loss": 0.1237065315246582, "mean_token_accuracy": 0.9687949195504189, "num_tokens": 2784593.0, "step": 790 }, { "entropy": 2.1688129603862762, "epoch": 0.6176413819725922, "grad_norm": 0.3439030349254608, "learning_rate": 1.9547694700264387e-05, "loss": 0.12909990549087524, "mean_token_accuracy": 0.963108229637146, "num_tokens": 2828912.0, "step": 800 }, { "entropy": 2.2464480668306352, "epoch": 0.6253618992472496, "grad_norm": 1.731982946395874, "learning_rate": 1.953271242610017e-05, "loss": 0.13596073389053345, "mean_token_accuracy": 0.974192063510418, "num_tokens": 2864199.0, "step": 810 }, { "entropy": 2.2575213581323625, "epoch": 0.633082416521907, "grad_norm": 2.722280263900757, "learning_rate": 1.951749197222224e-05, "loss": 0.12859855890274047, "mean_token_accuracy": 0.9683046102523803, "num_tokens": 2902141.0, "step": 820 }, { "entropy": 2.182758465409279, "epoch": 0.6408029337965644, "grad_norm": 2.9258344173431396, "learning_rate": 1.9502033718921444e-05, "loss": 0.09067170023918152, "mean_token_accuracy": 0.9700423076748848, "num_tokens": 2941709.0, "step": 830 }, { "entropy": 2.1869940221309663, "epoch": 0.6485234510712218, "grad_norm": 1.2507781982421875, "learning_rate": 1.948633805243018e-05, "loss": 0.06829038262367249, "mean_token_accuracy": 0.9780937045812607, "num_tokens": 2976754.0, "step": 840 }, { "entropy": 2.240604591369629, "epoch": 0.6562439683458792, "grad_norm": 6.191175937652588, "learning_rate": 1.9470405364912737e-05, "loss": 0.1681974411010742, "mean_token_accuracy": 0.962010458111763, "num_tokens": 3013223.0, "step": 850 }, { "entropy": 2.1933089971542357, "epoch": 0.6639644856205366, "grad_norm": 3.580299139022827, "learning_rate": 1.945423605445548e-05, "loss": 0.14260369539260864, "mean_token_accuracy": 0.9581344783306122, "num_tokens": 3051770.0, "step": 860 }, { "entropy": 2.2846630066633224, "epoch": 0.671685002895194, "grad_norm": 0.303085058927536, "learning_rate": 1.943783052505694e-05, "loss": 0.10166503190994262, "mean_token_accuracy": 0.9790826007723809, "num_tokens": 3086529.0, "step": 870 }, { "entropy": 2.229181852936745, "epoch": 0.6794055201698513, "grad_norm": 3.7699837684631348, "learning_rate": 1.9421189186617692e-05, "loss": 0.09227925539016724, "mean_token_accuracy": 0.9764371633529663, "num_tokens": 3132264.0, "step": 880 }, { "entropy": 2.2480290710926054, "epoch": 0.6871260374445087, "grad_norm": 1.3305270671844482, "learning_rate": 1.9404312454930116e-05, "loss": 0.13547370433807374, "mean_token_accuracy": 0.9761623114347457, "num_tokens": 3168569.0, "step": 890 }, { "entropy": 2.174534446001053, "epoch": 0.6948465547191662, "grad_norm": 0.882283627986908, "learning_rate": 1.9387200751668018e-05, "loss": 0.12927967309951782, "mean_token_accuracy": 0.9645377054810524, "num_tokens": 3203700.0, "step": 900 }, { "entropy": 2.1783421456813814, "epoch": 0.7025670719938236, "grad_norm": 3.659027099609375, "learning_rate": 1.9369854504376092e-05, "loss": 0.08977473378181458, "mean_token_accuracy": 0.9750412046909332, "num_tokens": 3244225.0, "step": 910 }, { "entropy": 2.2626183718442916, "epoch": 0.710287589268481, "grad_norm": 0.5882543921470642, "learning_rate": 1.9352274146459223e-05, "loss": 0.13526970148086548, "mean_token_accuracy": 0.9642464354634285, "num_tokens": 3282163.0, "step": 920 }, { "entropy": 2.2082873970270156, "epoch": 0.7180081065431384, "grad_norm": 3.8217687606811523, "learning_rate": 1.9334460117171687e-05, "loss": 0.10937002897262574, "mean_token_accuracy": 0.9754633396863938, "num_tokens": 3316191.0, "step": 930 }, { "entropy": 2.177019494771957, "epoch": 0.7257286238177958, "grad_norm": 0.9711639881134033, "learning_rate": 1.931641286160615e-05, "loss": 0.12394155263900757, "mean_token_accuracy": 0.9672280788421631, "num_tokens": 3353504.0, "step": 940 }, { "entropy": 2.159817245602608, "epoch": 0.7334491410924532, "grad_norm": 3.0002224445343018, "learning_rate": 1.9298132830682553e-05, "loss": 0.07563741207122802, "mean_token_accuracy": 0.9817924559116363, "num_tokens": 3390473.0, "step": 950 }, { "entropy": 2.1697775393724443, "epoch": 0.7411696583671106, "grad_norm": 4.114264965057373, "learning_rate": 1.9279620481136854e-05, "loss": 0.10978723764419555, "mean_token_accuracy": 0.9763004094362259, "num_tokens": 3429080.0, "step": 960 }, { "entropy": 2.154700428247452, "epoch": 0.748890175641768, "grad_norm": 2.0637450218200684, "learning_rate": 1.9260876275509614e-05, "loss": 0.12881894111633302, "mean_token_accuracy": 0.9691078916192055, "num_tokens": 3472222.0, "step": 970 }, { "entropy": 2.1561296582221985, "epoch": 0.7566106929164254, "grad_norm": 5.698066711425781, "learning_rate": 1.924190068213443e-05, "loss": 0.12960790395736693, "mean_token_accuracy": 0.97647725045681, "num_tokens": 3517841.0, "step": 980 }, { "entropy": 2.2234013736248017, "epoch": 0.7643312101910829, "grad_norm": 2.6206040382385254, "learning_rate": 1.9222694175126242e-05, "loss": 0.09993091225624084, "mean_token_accuracy": 0.9791779488325119, "num_tokens": 3554442.0, "step": 990 }, { "entropy": 2.180557644367218, "epoch": 0.7720517274657402, "grad_norm": 0.4288350045681, "learning_rate": 1.920325723436949e-05, "loss": 0.18079398870468139, "mean_token_accuracy": 0.9695220619440079, "num_tokens": 3589489.0, "step": 1000 }, { "epoch": 0.7720517274657402, "eval_entropy": 2.093520096975185, "eval_loss": 0.45434409379959106, "eval_mean_token_accuracy": 0.9182380637155929, "eval_num_tokens": 3589489.0, "eval_runtime": 990.2181, "eval_samples_per_second": 7.727, "eval_steps_per_second": 0.966, "step": 1000 }, { "entropy": 2.2155666559934617, "epoch": 0.7797722447403976, "grad_norm": 2.715181589126587, "learning_rate": 1.9183590345506115e-05, "loss": 0.07064727544784546, "mean_token_accuracy": 0.9841662392020225, "num_tokens": 3622362.0, "step": 1010 }, { "entropy": 2.1746787667274474, "epoch": 0.787492762015055, "grad_norm": 3.680882692337036, "learning_rate": 1.916369399992344e-05, "loss": 0.06015622615814209, "mean_token_accuracy": 0.9877562940120697, "num_tokens": 3656283.0, "step": 1020 }, { "entropy": 2.174808195233345, "epoch": 0.7952132792897124, "grad_norm": 0.3832246959209442, "learning_rate": 1.9143568694741858e-05, "loss": 0.11039963960647584, "mean_token_accuracy": 0.9725030601024628, "num_tokens": 3695042.0, "step": 1030 }, { "entropy": 2.2529222846031187, "epoch": 0.8029337965643698, "grad_norm": 3.5047266483306885, "learning_rate": 1.9123214932802465e-05, "loss": 0.11572520732879639, "mean_token_accuracy": 0.9776080340147019, "num_tokens": 3730250.0, "step": 1040 }, { "entropy": 2.1754327774047852, "epoch": 0.8106543138390272, "grad_norm": 3.506120204925537, "learning_rate": 1.9102633222654444e-05, "loss": 0.11624773740768432, "mean_token_accuracy": 0.9673858731985092, "num_tokens": 3767790.0, "step": 1050 }, { "entropy": 2.2163166791200637, "epoch": 0.8183748311136846, "grad_norm": 1.1102652549743652, "learning_rate": 1.9081824078542394e-05, "loss": 0.07758398056030273, "mean_token_accuracy": 0.9816681414842605, "num_tokens": 3803270.0, "step": 1060 }, { "entropy": 2.25885391831398, "epoch": 0.826095348388342, "grad_norm": 0.5661072134971619, "learning_rate": 1.9060788020393456e-05, "loss": 0.0615719735622406, "mean_token_accuracy": 0.9828296527266502, "num_tokens": 3834164.0, "step": 1070 }, { "entropy": 2.1803546130657194, "epoch": 0.8338158656629994, "grad_norm": 2.040249824523926, "learning_rate": 1.903952557380435e-05, "loss": 0.11473102569580078, "mean_token_accuracy": 0.9657544881105423, "num_tokens": 3871534.0, "step": 1080 }, { "entropy": 2.1811802864074705, "epoch": 0.8415363829376569, "grad_norm": 1.413288950920105, "learning_rate": 1.9018037270028213e-05, "loss": 0.07572046518325806, "mean_token_accuracy": 0.9782123982906341, "num_tokens": 3910887.0, "step": 1090 }, { "entropy": 2.23103586435318, "epoch": 0.8492569002123143, "grad_norm": 2.4706242084503174, "learning_rate": 1.8996323645961352e-05, "loss": 0.04151468873023987, "mean_token_accuracy": 0.9870179295539856, "num_tokens": 3943008.0, "step": 1100 }, { "entropy": 2.227116122841835, "epoch": 0.8569774174869716, "grad_norm": 2.6038529872894287, "learning_rate": 1.8974385244129805e-05, "loss": 0.0946826159954071, "mean_token_accuracy": 0.9796450510621071, "num_tokens": 3976668.0, "step": 1110 }, { "entropy": 2.208661425113678, "epoch": 0.864697934761629, "grad_norm": 5.780674457550049, "learning_rate": 1.8952222612675812e-05, "loss": 0.10974045991897582, "mean_token_accuracy": 0.9706292197108268, "num_tokens": 4012874.0, "step": 1120 }, { "entropy": 2.23996858894825, "epoch": 0.8724184520362864, "grad_norm": 1.2360124588012695, "learning_rate": 1.892983630534409e-05, "loss": 0.08555867075920105, "mean_token_accuracy": 0.9800435766577721, "num_tokens": 4044180.0, "step": 1130 }, { "entropy": 2.2110779762268065, "epoch": 0.8801389693109438, "grad_norm": 0.4163481891155243, "learning_rate": 1.890722688146802e-05, "loss": 0.07701975107192993, "mean_token_accuracy": 0.9780819907784462, "num_tokens": 4081151.0, "step": 1140 }, { "entropy": 2.226836398243904, "epoch": 0.8878594865856012, "grad_norm": 2.713832378387451, "learning_rate": 1.888439490595567e-05, "loss": 0.08010860681533813, "mean_token_accuracy": 0.9822189897298813, "num_tokens": 4116353.0, "step": 1150 }, { "entropy": 2.27404500246048, "epoch": 0.8955800038602586, "grad_norm": 0.15923215448856354, "learning_rate": 1.886134094927567e-05, "loss": 0.059002858400344846, "mean_token_accuracy": 0.9816316947340965, "num_tokens": 4148097.0, "step": 1160 }, { "entropy": 2.2260487526655197, "epoch": 0.903300521134916, "grad_norm": 3.0013537406921387, "learning_rate": 1.8838065587442956e-05, "loss": 0.08235616087913514, "mean_token_accuracy": 0.9715940162539483, "num_tokens": 4180489.0, "step": 1170 }, { "entropy": 2.124008280038834, "epoch": 0.9110210384095735, "grad_norm": 1.1767276525497437, "learning_rate": 1.8814569402004394e-05, "loss": 0.1106486201286316, "mean_token_accuracy": 0.9688979595899582, "num_tokens": 4220747.0, "step": 1180 }, { "entropy": 2.221278077363968, "epoch": 0.9187415556842309, "grad_norm": 1.546454906463623, "learning_rate": 1.8790852980024244e-05, "loss": 0.1707722783088684, "mean_token_accuracy": 0.9663840562105179, "num_tokens": 4259405.0, "step": 1190 }, { "entropy": 2.204825773835182, "epoch": 0.9264620729588883, "grad_norm": 2.0527737140655518, "learning_rate": 1.876691691406948e-05, "loss": 0.08684939742088318, "mean_token_accuracy": 0.9769035264849663, "num_tokens": 4292496.0, "step": 1200 }, { "entropy": 2.208803045749664, "epoch": 0.9341825902335457, "grad_norm": 4.592103481292725, "learning_rate": 1.8742761802194997e-05, "loss": 0.06823323369026184, "mean_token_accuracy": 0.9814566165208817, "num_tokens": 4325427.0, "step": 1210 }, { "entropy": 2.1777720004320145, "epoch": 0.941903107508203, "grad_norm": 3.140316963195801, "learning_rate": 1.871838824792867e-05, "loss": 0.16060715913772583, "mean_token_accuracy": 0.9660079538822174, "num_tokens": 4360480.0, "step": 1220 }, { "entropy": 2.2344942808151247, "epoch": 0.9496236247828604, "grad_norm": 4.9994001388549805, "learning_rate": 1.869379686025626e-05, "loss": 0.12226022481918335, "mean_token_accuracy": 0.9707063496112823, "num_tokens": 4392487.0, "step": 1230 }, { "entropy": 2.1433703660964967, "epoch": 0.9573441420575178, "grad_norm": 3.475524425506592, "learning_rate": 1.8668988253606212e-05, "loss": 0.12414617538452148, "mean_token_accuracy": 0.9741201639175415, "num_tokens": 4431701.0, "step": 1240 }, { "entropy": 2.190104368329048, "epoch": 0.9650646593321752, "grad_norm": 3.5840330123901367, "learning_rate": 1.8643963047834307e-05, "loss": 0.08782102465629578, "mean_token_accuracy": 0.9735233366489411, "num_tokens": 4467444.0, "step": 1250 }, { "entropy": 2.2168781042098997, "epoch": 0.9727851766068326, "grad_norm": 3.597426176071167, "learning_rate": 1.861872186820815e-05, "loss": 0.14496043920516968, "mean_token_accuracy": 0.9721528425812721, "num_tokens": 4496929.0, "step": 1260 }, { "entropy": 2.2057291209697723, "epoch": 0.9805056938814901, "grad_norm": 2.3206138610839844, "learning_rate": 1.8593265345391577e-05, "loss": 0.10822974443435669, "mean_token_accuracy": 0.9689827769994735, "num_tokens": 4531085.0, "step": 1270 }, { "entropy": 2.1946437865495683, "epoch": 0.9882262111561475, "grad_norm": 0.37915700674057007, "learning_rate": 1.8567594115428875e-05, "loss": 0.11415959596633911, "mean_token_accuracy": 0.9744870230555535, "num_tokens": 4569312.0, "step": 1280 }, { "entropy": 2.2317381650209427, "epoch": 0.9959467284308049, "grad_norm": 3.852874279022217, "learning_rate": 1.8541708819728902e-05, "loss": 0.06760208606719971, "mean_token_accuracy": 0.9818901315331459, "num_tokens": 4605253.0, "step": 1290 }, { "entropy": 2.1512465928051925, "epoch": 1.003088206909863, "grad_norm": 1.6707713603973389, "learning_rate": 1.8515610105049067e-05, "loss": 0.07693768739700317, "mean_token_accuracy": 0.9778838012669537, "num_tokens": 4643503.0, "step": 1300 }, { "entropy": 2.1755835592746733, "epoch": 1.0108087241845203, "grad_norm": 2.118502378463745, "learning_rate": 1.8489298623479147e-05, "loss": 0.07816660404205322, "mean_token_accuracy": 0.9813061475753784, "num_tokens": 4675662.0, "step": 1310 }, { "entropy": 2.1576342791318894, "epoch": 1.0185292414591778, "grad_norm": 5.421299934387207, "learning_rate": 1.846277503242502e-05, "loss": 0.09433794617652894, "mean_token_accuracy": 0.9725943058729172, "num_tokens": 4712787.0, "step": 1320 }, { "entropy": 2.1679455935955048, "epoch": 1.026249758733835, "grad_norm": 3.022178888320923, "learning_rate": 1.8436039994592224e-05, "loss": 0.08787925839424134, "mean_token_accuracy": 0.9729105263948441, "num_tokens": 4755527.0, "step": 1330 }, { "entropy": 2.146326667070389, "epoch": 1.0339702760084926, "grad_norm": 4.420295715332031, "learning_rate": 1.8409094177969408e-05, "loss": 0.09245921969413758, "mean_token_accuracy": 0.9803972214460372, "num_tokens": 4793692.0, "step": 1340 }, { "entropy": 2.125700297951698, "epoch": 1.04169079328315, "grad_norm": 0.7011611461639404, "learning_rate": 1.8381938255811626e-05, "loss": 0.04192873239517212, "mean_token_accuracy": 0.9881086781620979, "num_tokens": 4825139.0, "step": 1350 }, { "entropy": 2.265898513793945, "epoch": 1.0494113105578073, "grad_norm": 2.0361523628234863, "learning_rate": 1.8354572906623537e-05, "loss": 0.05326482057571411, "mean_token_accuracy": 0.9820634126663208, "num_tokens": 4860219.0, "step": 1360 }, { "entropy": 2.249096092581749, "epoch": 1.0571318278324648, "grad_norm": 2.0669565200805664, "learning_rate": 1.832699881414244e-05, "loss": 0.07189119458198548, "mean_token_accuracy": 0.9756469547748565, "num_tokens": 4895924.0, "step": 1370 }, { "entropy": 2.136953499913216, "epoch": 1.0648523451071221, "grad_norm": 3.7083239555358887, "learning_rate": 1.8299216667321192e-05, "loss": 0.0377763956785202, "mean_token_accuracy": 0.993205739557743, "num_tokens": 4932774.0, "step": 1380 }, { "entropy": 2.1725950062274935, "epoch": 1.0725728623817796, "grad_norm": 3.3318490982055664, "learning_rate": 1.827122716031099e-05, "loss": 0.03515214920043945, "mean_token_accuracy": 0.9864067286252975, "num_tokens": 4968312.0, "step": 1390 }, { "entropy": 2.171587583422661, "epoch": 1.080293379656437, "grad_norm": 1.3849668502807617, "learning_rate": 1.8243030992444042e-05, "loss": 0.033025556802749635, "mean_token_accuracy": 0.9898627385497093, "num_tokens": 5005630.0, "step": 1400 }, { "entropy": 2.123317489027977, "epoch": 1.0880138969310944, "grad_norm": 3.8918912410736084, "learning_rate": 1.821462886821607e-05, "loss": 0.06294504404067994, "mean_token_accuracy": 0.9815075367689132, "num_tokens": 5045736.0, "step": 1410 }, { "entropy": 2.1403660237789155, "epoch": 1.0957344142057517, "grad_norm": 3.85695219039917, "learning_rate": 1.8186021497268733e-05, "loss": 0.06816688179969788, "mean_token_accuracy": 0.9811367645859719, "num_tokens": 5087978.0, "step": 1420 }, { "entropy": 2.1448576182126997, "epoch": 1.1034549314804092, "grad_norm": 4.700116157531738, "learning_rate": 1.8157209594371873e-05, "loss": 0.06470519304275513, "mean_token_accuracy": 0.9794086501002311, "num_tokens": 5123611.0, "step": 1430 }, { "entropy": 2.246442288160324, "epoch": 1.1111754487550667, "grad_norm": 0.8788654208183289, "learning_rate": 1.8128193879405684e-05, "loss": 0.06699486970901489, "mean_token_accuracy": 0.9850307568907738, "num_tokens": 5156527.0, "step": 1440 }, { "entropy": 2.0466793209314345, "epoch": 1.118895966029724, "grad_norm": 2.6347248554229736, "learning_rate": 1.8098975077342696e-05, "loss": 0.05093771815299988, "mean_token_accuracy": 0.9866293117403984, "num_tokens": 5194973.0, "step": 1450 }, { "entropy": 2.175449812412262, "epoch": 1.1266164833043815, "grad_norm": 3.3113977909088135, "learning_rate": 1.806955391822968e-05, "loss": 0.07722722887992858, "mean_token_accuracy": 0.9812873587012291, "num_tokens": 5232238.0, "step": 1460 }, { "entropy": 2.1114370614290237, "epoch": 1.1343370005790387, "grad_norm": 6.0895538330078125, "learning_rate": 1.8039931137169398e-05, "loss": 0.10581094026565552, "mean_token_accuracy": 0.9739348217844963, "num_tokens": 5269462.0, "step": 1470 }, { "entropy": 2.057721531391144, "epoch": 1.1420575178536962, "grad_norm": 2.163757085800171, "learning_rate": 1.801010747430224e-05, "loss": 0.08237841129302978, "mean_token_accuracy": 0.9800081118941307, "num_tokens": 5312511.0, "step": 1480 }, { "entropy": 2.2099882423877717, "epoch": 1.1497780351283535, "grad_norm": 2.940668821334839, "learning_rate": 1.798008367478774e-05, "loss": 0.09443849325180054, "mean_token_accuracy": 0.9783109456300736, "num_tokens": 5347633.0, "step": 1490 }, { "entropy": 2.179814171791077, "epoch": 1.157498552403011, "grad_norm": 5.941656589508057, "learning_rate": 1.7949860488785935e-05, "loss": 0.11362334489822387, "mean_token_accuracy": 0.9784113153815269, "num_tokens": 5382716.0, "step": 1500 }, { "epoch": 1.157498552403011, "eval_entropy": 2.067308218003316, "eval_loss": 0.4690878093242645, "eval_mean_token_accuracy": 0.9239271352283633, "eval_num_tokens": 5382716.0, "eval_runtime": 987.4621, "eval_samples_per_second": 7.748, "eval_steps_per_second": 0.969, "step": 1500 }, { "entropy": 2.1574917674064635, "epoch": 1.1652190696776685, "grad_norm": 2.5012035369873047, "learning_rate": 1.7919438671438647e-05, "loss": 0.05635004043579102, "mean_token_accuracy": 0.9867865487933158, "num_tokens": 5427436.0, "step": 1510 }, { "entropy": 2.1504832983016966, "epoch": 1.1729395869523258, "grad_norm": 1.0461984872817993, "learning_rate": 1.78888189828506e-05, "loss": 0.06930508613586425, "mean_token_accuracy": 0.9815816029906272, "num_tokens": 5465521.0, "step": 1520 }, { "entropy": 2.201800489425659, "epoch": 1.180660104226983, "grad_norm": 3.5174059867858887, "learning_rate": 1.7858002188070428e-05, "loss": 0.06647626757621765, "mean_token_accuracy": 0.9884074360132218, "num_tokens": 5503228.0, "step": 1530 }, { "entropy": 2.1449740499258043, "epoch": 1.1883806215016406, "grad_norm": 2.1373608112335205, "learning_rate": 1.7826989057071576e-05, "loss": 0.08340185880661011, "mean_token_accuracy": 0.9833342641592026, "num_tokens": 5538689.0, "step": 1540 }, { "entropy": 2.1393818974494936, "epoch": 1.196101138776298, "grad_norm": 1.0357944965362549, "learning_rate": 1.779578036473304e-05, "loss": 0.06295200586318969, "mean_token_accuracy": 0.9850618243217468, "num_tokens": 5576456.0, "step": 1550 }, { "entropy": 2.1823107868433, "epoch": 1.2038216560509554, "grad_norm": 4.965859413146973, "learning_rate": 1.7764376890820014e-05, "loss": 0.09606855511665344, "mean_token_accuracy": 0.9736377954483032, "num_tokens": 5612953.0, "step": 1560 }, { "entropy": 2.1806869179010393, "epoch": 1.2115421733256129, "grad_norm": 0.8930599093437195, "learning_rate": 1.773277941996442e-05, "loss": 0.10148507356643677, "mean_token_accuracy": 0.9760855048894882, "num_tokens": 5649420.0, "step": 1570 }, { "entropy": 2.153961244225502, "epoch": 1.2192626906002701, "grad_norm": 5.579773426055908, "learning_rate": 1.770098874164529e-05, "loss": 0.0607684850692749, "mean_token_accuracy": 0.9863114863634109, "num_tokens": 5684144.0, "step": 1580 }, { "entropy": 2.1722445487976074, "epoch": 1.2269832078749277, "grad_norm": 6.017771244049072, "learning_rate": 1.7669005650169036e-05, "loss": 0.09015928506851197, "mean_token_accuracy": 0.9817434221506118, "num_tokens": 5720234.0, "step": 1590 }, { "entropy": 2.2104188591241836, "epoch": 1.234703725149585, "grad_norm": 3.4765541553497314, "learning_rate": 1.7636830944649628e-05, "loss": 0.06509234309196472, "mean_token_accuracy": 0.9830342516303062, "num_tokens": 5757637.0, "step": 1600 }, { "entropy": 2.198525631427765, "epoch": 1.2424242424242424, "grad_norm": 3.086829662322998, "learning_rate": 1.760446542898859e-05, "loss": 0.08481130599975586, "mean_token_accuracy": 0.9725503459572792, "num_tokens": 5792399.0, "step": 1610 }, { "entropy": 2.157542425394058, "epoch": 1.2501447596989, "grad_norm": 3.6862778663635254, "learning_rate": 1.757190991185495e-05, "loss": 0.02577916383743286, "mean_token_accuracy": 0.9937169313430786, "num_tokens": 5830379.0, "step": 1620 }, { "entropy": 2.2169549256563186, "epoch": 1.2578652769735572, "grad_norm": 6.9190192222595215, "learning_rate": 1.7539165206665018e-05, "loss": 0.11887587308883667, "mean_token_accuracy": 0.9760968968272209, "num_tokens": 5863578.0, "step": 1630 }, { "entropy": 2.173180091381073, "epoch": 1.2655857942482147, "grad_norm": 1.0279117822647095, "learning_rate": 1.750623213156206e-05, "loss": 0.03408839702606201, "mean_token_accuracy": 0.9902668550610543, "num_tokens": 5899214.0, "step": 1640 }, { "entropy": 2.155381426215172, "epoch": 1.273306311522872, "grad_norm": 0.8708764910697937, "learning_rate": 1.747311150939587e-05, "loss": 0.05587180852890015, "mean_token_accuracy": 0.9896471053361893, "num_tokens": 5935324.0, "step": 1650 }, { "entropy": 2.2335609972476957, "epoch": 1.2810268287975295, "grad_norm": 0.13011370599269867, "learning_rate": 1.743980416770219e-05, "loss": 0.035541835427284243, "mean_token_accuracy": 0.9919782534241677, "num_tokens": 5966942.0, "step": 1660 }, { "entropy": 2.1988327890634536, "epoch": 1.2887473460721868, "grad_norm": 0.10344131290912628, "learning_rate": 1.7406310938682048e-05, "loss": 0.046973693370819095, "mean_token_accuracy": 0.9925320342183113, "num_tokens": 6008187.0, "step": 1670 }, { "entropy": 2.23958740234375, "epoch": 1.2964678633468443, "grad_norm": 0.11602122336626053, "learning_rate": 1.7372632659180973e-05, "loss": 0.07079730033874512, "mean_token_accuracy": 0.9836244836449624, "num_tokens": 6041987.0, "step": 1680 }, { "entropy": 2.216384118795395, "epoch": 1.3041883806215018, "grad_norm": 2.2172930240631104, "learning_rate": 1.7338770170668067e-05, "loss": 0.03326311707496643, "mean_token_accuracy": 0.9883291959762573, "num_tokens": 6075157.0, "step": 1690 }, { "entropy": 2.1252345502376557, "epoch": 1.311908897896159, "grad_norm": 5.477461338043213, "learning_rate": 1.7304724319214984e-05, "loss": 0.06135511994361877, "mean_token_accuracy": 0.9845748677849769, "num_tokens": 6109370.0, "step": 1700 }, { "entropy": 2.1932441532611846, "epoch": 1.3196294151708163, "grad_norm": 1.0600680112838745, "learning_rate": 1.7270495955474804e-05, "loss": 0.06867148280143738, "mean_token_accuracy": 0.9842336073517799, "num_tokens": 6145950.0, "step": 1710 }, { "entropy": 2.228517660498619, "epoch": 1.3273499324454738, "grad_norm": 5.043092727661133, "learning_rate": 1.7236085934660767e-05, "loss": 0.06131213903427124, "mean_token_accuracy": 0.9860150918364525, "num_tokens": 6179698.0, "step": 1720 }, { "entropy": 2.147132176160812, "epoch": 1.3350704497201313, "grad_norm": 5.398331642150879, "learning_rate": 1.7201495116524904e-05, "loss": 0.06988582611083985, "mean_token_accuracy": 0.981314155459404, "num_tokens": 6217407.0, "step": 1730 }, { "entropy": 2.1961726933717727, "epoch": 1.3427909669947886, "grad_norm": 0.382192462682724, "learning_rate": 1.7166724365336567e-05, "loss": 0.04062625765800476, "mean_token_accuracy": 0.990032197535038, "num_tokens": 6254526.0, "step": 1740 }, { "entropy": 2.1768340557813644, "epoch": 1.3505114842694461, "grad_norm": 0.16774038970470428, "learning_rate": 1.7131774549860826e-05, "loss": 0.04462065696716309, "mean_token_accuracy": 0.9879740357398987, "num_tokens": 6291562.0, "step": 1750 }, { "entropy": 2.2020132303237916, "epoch": 1.3582320015441034, "grad_norm": 0.23544009029865265, "learning_rate": 1.7096646543336762e-05, "loss": 0.06595144867897033, "mean_token_accuracy": 0.9833995521068573, "num_tokens": 6325477.0, "step": 1760 }, { "entropy": 2.2006499111652373, "epoch": 1.365952518818761, "grad_norm": 4.985975742340088, "learning_rate": 1.7061341223455644e-05, "loss": 0.05818561315536499, "mean_token_accuracy": 0.9816210448741913, "num_tokens": 6362473.0, "step": 1770 }, { "entropy": 2.243510177731514, "epoch": 1.3736730360934182, "grad_norm": 1.5532886981964111, "learning_rate": 1.7025859472339026e-05, "loss": 0.04559597373008728, "mean_token_accuracy": 0.9878525719046592, "num_tokens": 6397995.0, "step": 1780 }, { "entropy": 2.2276618093252183, "epoch": 1.3813935533680757, "grad_norm": 5.254858493804932, "learning_rate": 1.699020217651667e-05, "loss": 0.07693036198616028, "mean_token_accuracy": 0.9713233038783073, "num_tokens": 6435700.0, "step": 1790 }, { "entropy": 2.214624211192131, "epoch": 1.3891140706427332, "grad_norm": 1.3537747859954834, "learning_rate": 1.695437022690441e-05, "loss": 0.0476935863494873, "mean_token_accuracy": 0.9899505183100701, "num_tokens": 6470710.0, "step": 1800 }, { "entropy": 2.2236395120620727, "epoch": 1.3968345879173905, "grad_norm": 2.256129741668701, "learning_rate": 1.691836451878191e-05, "loss": 0.057245922088623044, "mean_token_accuracy": 0.9842681303620339, "num_tokens": 6504059.0, "step": 1810 }, { "entropy": 2.194809466600418, "epoch": 1.4045551051920477, "grad_norm": 2.1219875812530518, "learning_rate": 1.688218595177027e-05, "loss": 0.095030015707016, "mean_token_accuracy": 0.977275763452053, "num_tokens": 6544244.0, "step": 1820 }, { "entropy": 2.189770597219467, "epoch": 1.4122756224667052, "grad_norm": 2.9641566276550293, "learning_rate": 1.6845835429809555e-05, "loss": 0.03089151084423065, "mean_token_accuracy": 0.9881447196006775, "num_tokens": 6575887.0, "step": 1830 }, { "entropy": 2.275960248708725, "epoch": 1.4199961397413627, "grad_norm": 3.321671724319458, "learning_rate": 1.6809313861136226e-05, "loss": 0.07831167578697204, "mean_token_accuracy": 0.9799184516072273, "num_tokens": 6604723.0, "step": 1840 }, { "entropy": 2.126830631494522, "epoch": 1.42771665701602, "grad_norm": 2.0569241046905518, "learning_rate": 1.6772622158260418e-05, "loss": 0.06082758903503418, "mean_token_accuracy": 0.9850939080119133, "num_tokens": 6642777.0, "step": 1850 }, { "entropy": 2.176947274804115, "epoch": 1.4354371742906775, "grad_norm": 0.6401554346084595, "learning_rate": 1.6735761237943166e-05, "loss": 0.06684135794639587, "mean_token_accuracy": 0.987571682035923, "num_tokens": 6682558.0, "step": 1860 }, { "entropy": 2.2031300246715544, "epoch": 1.4431576915653348, "grad_norm": 2.8854594230651855, "learning_rate": 1.6698732021173487e-05, "loss": 0.09527165293693543, "mean_token_accuracy": 0.9732189521193504, "num_tokens": 6717269.0, "step": 1870 }, { "entropy": 2.1681358337402346, "epoch": 1.4508782088399923, "grad_norm": 2.4058427810668945, "learning_rate": 1.666153543314537e-05, "loss": 0.048515334725379944, "mean_token_accuracy": 0.9848218783736229, "num_tokens": 6750783.0, "step": 1880 }, { "entropy": 2.209766998887062, "epoch": 1.4585987261146496, "grad_norm": 2.2834815979003906, "learning_rate": 1.6624172403234665e-05, "loss": 0.10613754987716675, "mean_token_accuracy": 0.9813075616955758, "num_tokens": 6784045.0, "step": 1890 }, { "entropy": 2.160476252436638, "epoch": 1.466319243389307, "grad_norm": 3.1155428886413574, "learning_rate": 1.6586643864975855e-05, "loss": 0.07376494407653808, "mean_token_accuracy": 0.9834692224860191, "num_tokens": 6824477.0, "step": 1900 }, { "entropy": 2.1634534388780593, "epoch": 1.4740397606639646, "grad_norm": 0.3001392185688019, "learning_rate": 1.6548950756038732e-05, "loss": 0.02613011598587036, "mean_token_accuracy": 0.9920083448290825, "num_tokens": 6864508.0, "step": 1910 }, { "entropy": 2.2088223576545714, "epoch": 1.4817602779386219, "grad_norm": 0.03745020180940628, "learning_rate": 1.6511094018204973e-05, "loss": 0.04845433235168457, "mean_token_accuracy": 0.9827080830931664, "num_tokens": 6902920.0, "step": 1920 }, { "entropy": 2.2410172671079636, "epoch": 1.4894807952132794, "grad_norm": 4.202921390533447, "learning_rate": 1.6473074597344608e-05, "loss": 0.07904167175292968, "mean_token_accuracy": 0.9802842602133751, "num_tokens": 6934196.0, "step": 1930 }, { "entropy": 2.2144098430871964, "epoch": 1.4972013124879366, "grad_norm": 3.0965535640716553, "learning_rate": 1.6434893443392388e-05, "loss": 0.06525328755378723, "mean_token_accuracy": 0.9790870904922485, "num_tokens": 6975432.0, "step": 1940 }, { "entropy": 2.210488173365593, "epoch": 1.5049218297625941, "grad_norm": 1.5190048217773438, "learning_rate": 1.6396551510324043e-05, "loss": 0.048443767428398135, "mean_token_accuracy": 0.9841597318649292, "num_tokens": 7014183.0, "step": 1950 }, { "entropy": 2.2083949983119964, "epoch": 1.5126423470372514, "grad_norm": 3.4382431507110596, "learning_rate": 1.6358049756132447e-05, "loss": 0.050505822896957396, "mean_token_accuracy": 0.98332499563694, "num_tokens": 7048113.0, "step": 1960 }, { "entropy": 2.1718403518199922, "epoch": 1.520362864311909, "grad_norm": 4.148841381072998, "learning_rate": 1.6319389142803705e-05, "loss": 0.08080021142959595, "mean_token_accuracy": 0.9764597907662391, "num_tokens": 7082017.0, "step": 1970 }, { "entropy": 2.202728974819183, "epoch": 1.5280833815865664, "grad_norm": 1.0588070154190063, "learning_rate": 1.6280570636293084e-05, "loss": 0.06684384942054748, "mean_token_accuracy": 0.9894752979278565, "num_tokens": 7117299.0, "step": 1980 }, { "entropy": 2.1958726704120637, "epoch": 1.5358038988612237, "grad_norm": 1.6634799242019653, "learning_rate": 1.6241595206500897e-05, "loss": 0.06764208674430847, "mean_token_accuracy": 0.984419621527195, "num_tokens": 7153932.0, "step": 1990 }, { "entropy": 2.207414472103119, "epoch": 1.543524416135881, "grad_norm": 3.5081145763397217, "learning_rate": 1.6202463827248265e-05, "loss": 0.06235606074333191, "mean_token_accuracy": 0.9850886449217796, "num_tokens": 7187474.0, "step": 2000 }, { "epoch": 1.543524416135881, "eval_entropy": 2.09292504755058, "eval_loss": 0.44610196352005005, "eval_mean_token_accuracy": 0.9292889271036584, "eval_num_tokens": 7187474.0, "eval_runtime": 987.9783, "eval_samples_per_second": 7.744, "eval_steps_per_second": 0.969, "step": 2000 }, { "entropy": 2.1876722425222397, "epoch": 1.5512449334105385, "grad_norm": 2.9447176456451416, "learning_rate": 1.6163177476252787e-05, "loss": 0.1231013298034668, "mean_token_accuracy": 0.9771831795573235, "num_tokens": 7224686.0, "step": 2010 }, { "entropy": 2.2381023466587067, "epoch": 1.558965450685196, "grad_norm": 4.822196006774902, "learning_rate": 1.612373713510411e-05, "loss": 0.03697749674320221, "mean_token_accuracy": 0.9885532259941101, "num_tokens": 7259356.0, "step": 2020 }, { "entropy": 2.2796195298433304, "epoch": 1.5666859679598533, "grad_norm": 1.0182671546936035, "learning_rate": 1.608414378923941e-05, "loss": 0.05077391862869263, "mean_token_accuracy": 0.988129609823227, "num_tokens": 7289152.0, "step": 2030 }, { "entropy": 2.2358617722988128, "epoch": 1.5744064852345108, "grad_norm": 2.3968863487243652, "learning_rate": 1.6044398427918754e-05, "loss": 0.06050935983657837, "mean_token_accuracy": 0.9812897890806198, "num_tokens": 7325050.0, "step": 2040 }, { "entropy": 2.174675610661507, "epoch": 1.5821270025091683, "grad_norm": 0.130416139960289, "learning_rate": 1.60045020442004e-05, "loss": 0.057877928018569946, "mean_token_accuracy": 0.9885829269886017, "num_tokens": 7361592.0, "step": 2050 }, { "entropy": 2.2293392330408097, "epoch": 1.5898475197838255, "grad_norm": 1.2082692384719849, "learning_rate": 1.5964455634915975e-05, "loss": 0.07877171635627747, "mean_token_accuracy": 0.9803994312882424, "num_tokens": 7394992.0, "step": 2060 }, { "entropy": 2.1638178408145903, "epoch": 1.5975680370584828, "grad_norm": 0.13079890608787537, "learning_rate": 1.5924260200645574e-05, "loss": 0.03450520932674408, "mean_token_accuracy": 0.993475878238678, "num_tokens": 7426832.0, "step": 2070 }, { "entropy": 2.31286364197731, "epoch": 1.6052885543331403, "grad_norm": 1.7269318103790283, "learning_rate": 1.5883916745692766e-05, "loss": 0.04786880314350128, "mean_token_accuracy": 0.9854305148124695, "num_tokens": 7459101.0, "step": 2080 }, { "entropy": 2.181331729888916, "epoch": 1.6130090716077978, "grad_norm": 2.854979991912842, "learning_rate": 1.584342627805947e-05, "loss": 0.04439874291419983, "mean_token_accuracy": 0.9889310583472252, "num_tokens": 7498208.0, "step": 2090 }, { "entropy": 2.201298424601555, "epoch": 1.620729588882455, "grad_norm": 3.3388164043426514, "learning_rate": 1.5802789809420812e-05, "loss": 0.057651227712631224, "mean_token_accuracy": 0.9866861075162887, "num_tokens": 7531350.0, "step": 2100 }, { "entropy": 2.1975525587797167, "epoch": 1.6284501061571124, "grad_norm": 1.4861758947372437, "learning_rate": 1.5762008355099824e-05, "loss": 0.04551325440406799, "mean_token_accuracy": 0.9858617588877678, "num_tokens": 7571182.0, "step": 2110 }, { "entropy": 2.2160713732242585, "epoch": 1.6361706234317699, "grad_norm": 2.163928985595703, "learning_rate": 1.5721082934042077e-05, "loss": 0.055477970838546754, "mean_token_accuracy": 0.9858786046504975, "num_tokens": 7602483.0, "step": 2120 }, { "entropy": 2.2408920913934707, "epoch": 1.6438911407064274, "grad_norm": 0.31985145807266235, "learning_rate": 1.5680014568790224e-05, "loss": 0.04159039855003357, "mean_token_accuracy": 0.9852373600006104, "num_tokens": 7637929.0, "step": 2130 }, { "entropy": 2.2200376480817794, "epoch": 1.6516116579810847, "grad_norm": 0.9541903734207153, "learning_rate": 1.5638804285458453e-05, "loss": 0.08421515226364136, "mean_token_accuracy": 0.980931767821312, "num_tokens": 7672999.0, "step": 2140 }, { "entropy": 2.203143599629402, "epoch": 1.6593321752557422, "grad_norm": 1.1459593772888184, "learning_rate": 1.5597453113706854e-05, "loss": 0.06661672592163086, "mean_token_accuracy": 0.9839463055133819, "num_tokens": 7709356.0, "step": 2150 }, { "entropy": 2.1805380463600157, "epoch": 1.6670526925303997, "grad_norm": 1.9122540950775146, "learning_rate": 1.555596208671568e-05, "loss": 0.07211873531341553, "mean_token_accuracy": 0.9839503139257431, "num_tokens": 7743958.0, "step": 2160 }, { "entropy": 2.2309546947479246, "epoch": 1.674773209805057, "grad_norm": 0.19467999041080475, "learning_rate": 1.5514332241159535e-05, "loss": 0.02178901433944702, "mean_token_accuracy": 0.9955803573131561, "num_tokens": 7781564.0, "step": 2170 }, { "entropy": 2.212314310669899, "epoch": 1.6824937270797142, "grad_norm": 7.478359222412109, "learning_rate": 1.5472564617181487e-05, "loss": 0.0869008719921112, "mean_token_accuracy": 0.9849289789795875, "num_tokens": 7819885.0, "step": 2180 }, { "entropy": 2.2491566449403764, "epoch": 1.6902142443543717, "grad_norm": 6.772735118865967, "learning_rate": 1.543066025836706e-05, "loss": 0.07113047838211059, "mean_token_accuracy": 0.982619047164917, "num_tokens": 7851412.0, "step": 2190 }, { "entropy": 2.213401734828949, "epoch": 1.6979347616290292, "grad_norm": 4.968042373657227, "learning_rate": 1.5388620211718174e-05, "loss": 0.04826553165912628, "mean_token_accuracy": 0.9854778051376343, "num_tokens": 7887905.0, "step": 2200 }, { "entropy": 2.296232557296753, "epoch": 1.7056552789036865, "grad_norm": 1.3846877813339233, "learning_rate": 1.5346445527626973e-05, "loss": 0.07143614888191223, "mean_token_accuracy": 0.9899365901947021, "num_tokens": 7917823.0, "step": 2210 }, { "entropy": 2.150168251991272, "epoch": 1.7133757961783438, "grad_norm": 0.08897116035223007, "learning_rate": 1.5304137259849596e-05, "loss": 0.03860937356948853, "mean_token_accuracy": 0.98958979845047, "num_tokens": 7957105.0, "step": 2220 }, { "entropy": 2.1939960032701493, "epoch": 1.7210963134530015, "grad_norm": 1.8421629667282104, "learning_rate": 1.5261696465479823e-05, "loss": 0.034920766949653625, "mean_token_accuracy": 0.9868922352790832, "num_tokens": 7990604.0, "step": 2230 }, { "entropy": 2.248343914747238, "epoch": 1.7288168307276588, "grad_norm": 0.1955411583185196, "learning_rate": 1.52191242049227e-05, "loss": 0.026687222719192504, "mean_token_accuracy": 0.9909184098243713, "num_tokens": 8025473.0, "step": 2240 }, { "entropy": 2.176126691699028, "epoch": 1.736537348002316, "grad_norm": 3.4646553993225098, "learning_rate": 1.5176421541868003e-05, "loss": 0.041455024480819704, "mean_token_accuracy": 0.987688897550106, "num_tokens": 8063276.0, "step": 2250 }, { "entropy": 2.2357524156570436, "epoch": 1.7442578652769736, "grad_norm": 2.85046124458313, "learning_rate": 1.5133589543263693e-05, "loss": 0.029646474123001098, "mean_token_accuracy": 0.9920761302113533, "num_tokens": 8095731.0, "step": 2260 }, { "entropy": 2.230524700880051, "epoch": 1.751978382551631, "grad_norm": 0.2627425789833069, "learning_rate": 1.5090629279289247e-05, "loss": 0.05477217435836792, "mean_token_accuracy": 0.9860235080122948, "num_tokens": 8134788.0, "step": 2270 }, { "entropy": 2.232674279808998, "epoch": 1.7596988998262884, "grad_norm": 5.077950477600098, "learning_rate": 1.5047541823328913e-05, "loss": 0.039683285355567935, "mean_token_accuracy": 0.9911200389266014, "num_tokens": 8168847.0, "step": 2280 }, { "entropy": 2.1635669827461244, "epoch": 1.7674194171009456, "grad_norm": 5.3769731521606445, "learning_rate": 1.5004328251944898e-05, "loss": 0.06116831302642822, "mean_token_accuracy": 0.9856468245387078, "num_tokens": 8203225.0, "step": 2290 }, { "entropy": 2.2570940554142, "epoch": 1.7751399343756031, "grad_norm": 1.6257141828536987, "learning_rate": 1.4960989644850461e-05, "loss": 0.06121355891227722, "mean_token_accuracy": 0.9865431234240531, "num_tokens": 8235676.0, "step": 2300 }, { "entropy": 2.148748704791069, "epoch": 1.7828604516502606, "grad_norm": 1.410240650177002, "learning_rate": 1.4917527084882962e-05, "loss": 0.060073697566986085, "mean_token_accuracy": 0.9826793894171715, "num_tokens": 8271787.0, "step": 2310 }, { "entropy": 2.259695219993591, "epoch": 1.790580968924918, "grad_norm": 0.7643431425094604, "learning_rate": 1.4873941657976758e-05, "loss": 0.045375460386276247, "mean_token_accuracy": 0.991543410718441, "num_tokens": 8305741.0, "step": 2320 }, { "entropy": 2.2634156942367554, "epoch": 1.7983014861995754, "grad_norm": 1.8315523862838745, "learning_rate": 1.483023445313613e-05, "loss": 0.06367403268814087, "mean_token_accuracy": 0.9873386204242707, "num_tokens": 8339552.0, "step": 2330 }, { "entropy": 2.2267695903778075, "epoch": 1.806022003474233, "grad_norm": 0.7167631387710571, "learning_rate": 1.4786406562408018e-05, "loss": 0.04319778382778168, "mean_token_accuracy": 0.9907146960496902, "num_tokens": 8373748.0, "step": 2340 }, { "entropy": 2.2331454545259475, "epoch": 1.8137425207488902, "grad_norm": 0.07811649143695831, "learning_rate": 1.4742459080854776e-05, "loss": 0.07732252478599548, "mean_token_accuracy": 0.9835749432444573, "num_tokens": 8405602.0, "step": 2350 }, { "entropy": 2.206145229935646, "epoch": 1.8214630380235475, "grad_norm": 2.4456584453582764, "learning_rate": 1.4698393106526794e-05, "loss": 0.04599563479423523, "mean_token_accuracy": 0.9887336835265159, "num_tokens": 8440623.0, "step": 2360 }, { "entropy": 2.185474079847336, "epoch": 1.829183555298205, "grad_norm": 2.7905468940734863, "learning_rate": 1.4654209740435058e-05, "loss": 0.10312718152999878, "mean_token_accuracy": 0.9773416921496392, "num_tokens": 8478808.0, "step": 2370 }, { "entropy": 2.1824015408754347, "epoch": 1.8369040725728625, "grad_norm": 3.6272330284118652, "learning_rate": 1.4609910086523656e-05, "loss": 0.03959389925003052, "mean_token_accuracy": 0.988817447423935, "num_tokens": 8518513.0, "step": 2380 }, { "entropy": 2.2420704424381257, "epoch": 1.8446245898475198, "grad_norm": 2.7875003814697266, "learning_rate": 1.4565495251642177e-05, "loss": 0.03577028214931488, "mean_token_accuracy": 0.9905984789133072, "num_tokens": 8551680.0, "step": 2390 }, { "entropy": 2.2019168078899383, "epoch": 1.852345107122177, "grad_norm": 1.5845329761505127, "learning_rate": 1.4520966345518076e-05, "loss": 0.032679545879364016, "mean_token_accuracy": 0.9905828937888146, "num_tokens": 8586760.0, "step": 2400 }, { "entropy": 2.1899552077054976, "epoch": 1.8600656243968345, "grad_norm": 2.2608611583709717, "learning_rate": 1.447632448072893e-05, "loss": 0.06101080775260925, "mean_token_accuracy": 0.9878913164138794, "num_tokens": 8623094.0, "step": 2410 }, { "entropy": 2.147029626369476, "epoch": 1.867786141671492, "grad_norm": 5.116804122924805, "learning_rate": 1.443157077267465e-05, "loss": 0.06001234650611877, "mean_token_accuracy": 0.9865107357501983, "num_tokens": 8661163.0, "step": 2420 }, { "entropy": 2.226870185136795, "epoch": 1.8755066589461493, "grad_norm": 0.31566572189331055, "learning_rate": 1.4386706339549608e-05, "loss": 0.04123932719230652, "mean_token_accuracy": 0.9899785459041596, "num_tokens": 8692034.0, "step": 2430 }, { "entropy": 2.1588668793439867, "epoch": 1.8832271762208068, "grad_norm": 0.9417765140533447, "learning_rate": 1.4341732302314695e-05, "loss": 0.06338693499565125, "mean_token_accuracy": 0.9791759848594666, "num_tokens": 8727679.0, "step": 2440 }, { "entropy": 2.2481164067983626, "epoch": 1.8909476934954643, "grad_norm": 2.853949785232544, "learning_rate": 1.4296649784669317e-05, "loss": 0.040822142362594606, "mean_token_accuracy": 0.9924886748194695, "num_tokens": 8765739.0, "step": 2450 }, { "entropy": 2.16390860080719, "epoch": 1.8986682107701216, "grad_norm": 0.7499203681945801, "learning_rate": 1.4251459913023326e-05, "loss": 0.03524640500545502, "mean_token_accuracy": 0.9882998391985893, "num_tokens": 8800881.0, "step": 2460 }, { "entropy": 2.2302677065134047, "epoch": 1.9063887280447789, "grad_norm": 2.2339160442352295, "learning_rate": 1.4206163816468861e-05, "loss": 0.05475660562515259, "mean_token_accuracy": 0.9859271243214607, "num_tokens": 8831211.0, "step": 2470 }, { "entropy": 2.176157131791115, "epoch": 1.9141092453194364, "grad_norm": 2.105004072189331, "learning_rate": 1.416076262675215e-05, "loss": 0.054158592224121095, "mean_token_accuracy": 0.9859476014971733, "num_tokens": 8870055.0, "step": 2480 }, { "entropy": 2.1534419268369676, "epoch": 1.9218297625940939, "grad_norm": 1.5954450368881226, "learning_rate": 1.4115257478245223e-05, "loss": 0.03219989836215973, "mean_token_accuracy": 0.9903153285384179, "num_tokens": 8906260.0, "step": 2490 }, { "entropy": 2.219716268777847, "epoch": 1.9295502798687512, "grad_norm": 6.508073329925537, "learning_rate": 1.4069649507917578e-05, "loss": 0.08166940808296204, "mean_token_accuracy": 0.9832880064845085, "num_tokens": 8938492.0, "step": 2500 }, { "epoch": 1.9295502798687512, "eval_entropy": 2.09807589759149, "eval_loss": 0.4539739787578583, "eval_mean_token_accuracy": 0.9317483626687539, "eval_num_tokens": 8938492.0, "eval_runtime": 988.2689, "eval_samples_per_second": 7.742, "eval_steps_per_second": 0.968, "step": 2500 }, { "entropy": 2.234724909067154, "epoch": 1.9372707971434087, "grad_norm": 1.7193647623062134, "learning_rate": 1.4023939855307764e-05, "loss": 0.04806544184684754, "mean_token_accuracy": 0.9910022959113121, "num_tokens": 8972850.0, "step": 2510 }, { "entropy": 2.198562887310982, "epoch": 1.9449913144180662, "grad_norm": 2.7927255630493164, "learning_rate": 1.397812966249492e-05, "loss": 0.06402395963668824, "mean_token_accuracy": 0.9840932011604309, "num_tokens": 9012403.0, "step": 2520 }, { "entropy": 2.2336697190999986, "epoch": 1.9527118316927234, "grad_norm": 5.629129886627197, "learning_rate": 1.3932220074070236e-05, "loss": 0.052779823541641235, "mean_token_accuracy": 0.9856812432408333, "num_tokens": 9049223.0, "step": 2530 }, { "entropy": 2.1691229969263075, "epoch": 1.9604323489673807, "grad_norm": 0.12791520357131958, "learning_rate": 1.3886212237108334e-05, "loss": 0.040309852361679076, "mean_token_accuracy": 0.9888273656368256, "num_tokens": 9086187.0, "step": 2540 }, { "entropy": 2.2491596221923826, "epoch": 1.9681528662420382, "grad_norm": 0.4085298478603363, "learning_rate": 1.384010730113865e-05, "loss": 0.02160833030939102, "mean_token_accuracy": 0.9909946650266648, "num_tokens": 9121957.0, "step": 2550 }, { "entropy": 2.1770587384700777, "epoch": 1.9758733835166957, "grad_norm": 0.27961045503616333, "learning_rate": 1.3793906418116674e-05, "loss": 0.07575550675392151, "mean_token_accuracy": 0.9829989477992058, "num_tokens": 9154073.0, "step": 2560 }, { "entropy": 2.262489286065102, "epoch": 1.983593900791353, "grad_norm": 0.30133992433547974, "learning_rate": 1.3747610742395185e-05, "loss": 0.049575185775756835, "mean_token_accuracy": 0.9877225264906884, "num_tokens": 9184603.0, "step": 2570 }, { "entropy": 2.157144469022751, "epoch": 1.9913144180660103, "grad_norm": 1.7762395143508911, "learning_rate": 1.3701221430695411e-05, "loss": 0.07316330075263977, "mean_token_accuracy": 0.9852767020463944, "num_tokens": 9220584.0, "step": 2580 }, { "entropy": 2.183892551064491, "epoch": 1.9990349353406678, "grad_norm": 0.4974443316459656, "learning_rate": 1.3654739642078115e-05, "loss": 0.030621829628944396, "mean_token_accuracy": 0.9909188866615295, "num_tokens": 9257900.0, "step": 2590 }, { "entropy": 2.1523505900357223, "epoch": 2.006176413819726, "grad_norm": 1.002280354499817, "learning_rate": 1.3608166537914653e-05, "loss": 0.03308936357498169, "mean_token_accuracy": 0.9905776703679884, "num_tokens": 9287566.0, "step": 2600 }, { "entropy": 2.1786624640226364, "epoch": 2.0138969310943833, "grad_norm": 1.7228094339370728, "learning_rate": 1.3561503281857935e-05, "loss": 0.024886465072631835, "mean_token_accuracy": 0.9927895620465279, "num_tokens": 9322676.0, "step": 2610 }, { "entropy": 2.1957814037799834, "epoch": 2.0216174483690406, "grad_norm": 1.4911882877349854, "learning_rate": 1.3514751039813373e-05, "loss": 0.02856048047542572, "mean_token_accuracy": 0.9912378385663032, "num_tokens": 9355944.0, "step": 2620 }, { "entropy": 2.2170669615268705, "epoch": 2.0293379656436983, "grad_norm": 2.101999282836914, "learning_rate": 1.3467910979909737e-05, "loss": 0.02958173453807831, "mean_token_accuracy": 0.9899841129779816, "num_tokens": 9388310.0, "step": 2630 }, { "entropy": 2.2836335778236387, "epoch": 2.0370584829183556, "grad_norm": 1.5629916191101074, "learning_rate": 1.3420984272469966e-05, "loss": 0.024695934355258943, "mean_token_accuracy": 0.9935079053044319, "num_tokens": 9421384.0, "step": 2640 }, { "entropy": 2.1128551036119463, "epoch": 2.044779000193013, "grad_norm": 0.04739844426512718, "learning_rate": 1.337397208998194e-05, "loss": 0.008467760682106019, "mean_token_accuracy": 0.9983387798070907, "num_tokens": 9458111.0, "step": 2650 }, { "entropy": 2.1693550407886506, "epoch": 2.05249951746767, "grad_norm": 0.9237629771232605, "learning_rate": 1.3326875607069167e-05, "loss": 0.030665600299835206, "mean_token_accuracy": 0.9918258935213089, "num_tokens": 9496587.0, "step": 2660 }, { "entropy": 2.15002136528492, "epoch": 2.060220034742328, "grad_norm": 4.3934807777404785, "learning_rate": 1.3279696000461453e-05, "loss": 0.06771356463432313, "mean_token_accuracy": 0.9814038887619972, "num_tokens": 9533430.0, "step": 2670 }, { "entropy": 2.2125822573900225, "epoch": 2.067940552016985, "grad_norm": 0.43496638536453247, "learning_rate": 1.3232434448965492e-05, "loss": 0.020783789455890656, "mean_token_accuracy": 0.9934862002730369, "num_tokens": 9569158.0, "step": 2680 }, { "entropy": 2.1923176765441896, "epoch": 2.0756610692916424, "grad_norm": 0.4592268466949463, "learning_rate": 1.318509213343541e-05, "loss": 0.02032013237476349, "mean_token_accuracy": 0.996187499165535, "num_tokens": 9605532.0, "step": 2690 }, { "entropy": 2.2375913679599764, "epoch": 2.0833815865663, "grad_norm": 3.984872579574585, "learning_rate": 1.3137670236743258e-05, "loss": 0.05714105367660523, "mean_token_accuracy": 0.984250420331955, "num_tokens": 9637666.0, "step": 2700 }, { "entropy": 2.2166593253612517, "epoch": 2.0911021038409574, "grad_norm": 1.2222201824188232, "learning_rate": 1.3090169943749475e-05, "loss": 0.01319773644208908, "mean_token_accuracy": 0.9959829047322273, "num_tokens": 9671041.0, "step": 2710 }, { "entropy": 2.207410234212875, "epoch": 2.0988226211156147, "grad_norm": 2.778895139694214, "learning_rate": 1.3042592441273265e-05, "loss": 0.0495807558298111, "mean_token_accuracy": 0.9841275036334991, "num_tokens": 9709462.0, "step": 2720 }, { "entropy": 2.240642195940018, "epoch": 2.106543138390272, "grad_norm": 0.054825589060783386, "learning_rate": 1.2994938918062956e-05, "loss": 0.02018197178840637, "mean_token_accuracy": 0.9940782889723778, "num_tokens": 9743175.0, "step": 2730 }, { "entropy": 2.1023289799690246, "epoch": 2.1142636556649297, "grad_norm": 1.3066190481185913, "learning_rate": 1.2947210564766285e-05, "loss": 0.029668596386909486, "mean_token_accuracy": 0.9919564932584762, "num_tokens": 9780470.0, "step": 2740 }, { "entropy": 2.194093734025955, "epoch": 2.121984172939587, "grad_norm": 1.0239670276641846, "learning_rate": 1.289940857390066e-05, "loss": 0.031669008731842044, "mean_token_accuracy": 0.9926641970872879, "num_tokens": 9817526.0, "step": 2750 }, { "entropy": 2.2564922988414766, "epoch": 2.1297046902142442, "grad_norm": 1.27794349193573, "learning_rate": 1.2851534139823363e-05, "loss": 0.019582782685756684, "mean_token_accuracy": 0.995488366484642, "num_tokens": 9852050.0, "step": 2760 }, { "entropy": 2.185793325304985, "epoch": 2.137425207488902, "grad_norm": 0.7653716206550598, "learning_rate": 1.280358845870171e-05, "loss": 0.02054794430732727, "mean_token_accuracy": 0.9923271596431732, "num_tokens": 9892115.0, "step": 2770 }, { "entropy": 2.2001701056957246, "epoch": 2.1451457247635592, "grad_norm": 0.39544498920440674, "learning_rate": 1.2755572728483155e-05, "loss": 0.023257075250148772, "mean_token_accuracy": 0.9951051697134972, "num_tokens": 9931964.0, "step": 2780 }, { "entropy": 2.240946352481842, "epoch": 2.1528662420382165, "grad_norm": 0.26407626271247864, "learning_rate": 1.2707488148865363e-05, "loss": 0.013235661387443542, "mean_token_accuracy": 0.9952550038695336, "num_tokens": 9966565.0, "step": 2790 }, { "entropy": 2.2113855719566344, "epoch": 2.160586759312874, "grad_norm": 3.220576047897339, "learning_rate": 1.265933592126625e-05, "loss": 0.036707454919815065, "mean_token_accuracy": 0.991096867620945, "num_tokens": 9998961.0, "step": 2800 }, { "entropy": 2.190717473626137, "epoch": 2.1683072765875315, "grad_norm": 2.822577476501465, "learning_rate": 1.2611117248793936e-05, "loss": 0.03832524418830872, "mean_token_accuracy": 0.9897032305598259, "num_tokens": 10033957.0, "step": 2810 }, { "entropy": 2.14252789914608, "epoch": 2.176027793862189, "grad_norm": 1.2037594318389893, "learning_rate": 1.2562833336216706e-05, "loss": 0.030560973286628722, "mean_token_accuracy": 0.9927359268069267, "num_tokens": 10067990.0, "step": 2820 }, { "entropy": 2.169364756345749, "epoch": 2.183748311136846, "grad_norm": 0.36512044072151184, "learning_rate": 1.2514485389932904e-05, "loss": 0.024552282691001893, "mean_token_accuracy": 0.9914642333984375, "num_tokens": 10107375.0, "step": 2830 }, { "entropy": 2.215904402732849, "epoch": 2.1914688284115034, "grad_norm": 1.6125507354736328, "learning_rate": 1.2466074617940789e-05, "loss": 0.04732250571250916, "mean_token_accuracy": 0.9921780049800872, "num_tokens": 10141732.0, "step": 2840 }, { "entropy": 2.2249450385570526, "epoch": 2.199189345686161, "grad_norm": 1.7302135229110718, "learning_rate": 1.2417602229808351e-05, "loss": 0.017911496758460998, "mean_token_accuracy": 0.995235213637352, "num_tokens": 10178996.0, "step": 2850 }, { "entropy": 2.2548143804073333, "epoch": 2.2069098629608184, "grad_norm": 0.04718457907438278, "learning_rate": 1.236906943664309e-05, "loss": 0.047148984670639035, "mean_token_accuracy": 0.992178562283516, "num_tokens": 10214640.0, "step": 2860 }, { "entropy": 2.2417348712682723, "epoch": 2.2146303802354756, "grad_norm": 0.028584061190485954, "learning_rate": 1.2320477451061764e-05, "loss": 0.019759944081306456, "mean_token_accuracy": 0.9941247820854187, "num_tokens": 10251016.0, "step": 2870 }, { "entropy": 2.2414058953523637, "epoch": 2.2223508975101334, "grad_norm": 0.14690132439136505, "learning_rate": 1.227182748716007e-05, "loss": 0.02443784922361374, "mean_token_accuracy": 0.995506352186203, "num_tokens": 10292140.0, "step": 2880 }, { "entropy": 2.161432334780693, "epoch": 2.2300714147847907, "grad_norm": 1.1667348146438599, "learning_rate": 1.2223120760482334e-05, "loss": 0.059571588039398195, "mean_token_accuracy": 0.9856904774904252, "num_tokens": 10332661.0, "step": 2890 }, { "entropy": 2.201232245564461, "epoch": 2.237791932059448, "grad_norm": 0.03672393038868904, "learning_rate": 1.217435848799113e-05, "loss": 0.014521844685077667, "mean_token_accuracy": 0.9963999673724174, "num_tokens": 10369258.0, "step": 2900 }, { "entropy": 2.2226219087839127, "epoch": 2.245512449334105, "grad_norm": 0.8930593729019165, "learning_rate": 1.2125541888036865e-05, "loss": 0.022989581525325774, "mean_token_accuracy": 0.9940146535634995, "num_tokens": 10401439.0, "step": 2910 }, { "entropy": 2.2541381388902666, "epoch": 2.253232966608763, "grad_norm": 1.267367959022522, "learning_rate": 1.2076672180327354e-05, "loss": 0.04482119679450989, "mean_token_accuracy": 0.9880507871508598, "num_tokens": 10436132.0, "step": 2920 }, { "entropy": 2.254253861308098, "epoch": 2.26095348388342, "grad_norm": 2.6567845344543457, "learning_rate": 1.2027750585897325e-05, "loss": 0.03449807465076447, "mean_token_accuracy": 0.9864874675869941, "num_tokens": 10470241.0, "step": 2930 }, { "entropy": 2.1793852925300596, "epoch": 2.2686740011580775, "grad_norm": 0.10617174953222275, "learning_rate": 1.1978778327077932e-05, "loss": 0.01429850161075592, "mean_token_accuracy": 0.9945758923888206, "num_tokens": 10501127.0, "step": 2940 }, { "entropy": 2.1325310707092284, "epoch": 2.2763945184327348, "grad_norm": 1.1946356296539307, "learning_rate": 1.1929756627466207e-05, "loss": 0.05270189046859741, "mean_token_accuracy": 0.9898444160819053, "num_tokens": 10541230.0, "step": 2950 }, { "entropy": 2.1456130146980286, "epoch": 2.2841150357073925, "grad_norm": 0.13995744287967682, "learning_rate": 1.1880686711894476e-05, "loss": 0.02509075403213501, "mean_token_accuracy": 0.9976190477609634, "num_tokens": 10573896.0, "step": 2960 }, { "entropy": 2.2185772597789764, "epoch": 2.2918355529820498, "grad_norm": 0.05365545675158501, "learning_rate": 1.1831569806399773e-05, "loss": 0.06382806301116943, "mean_token_accuracy": 0.9850220456719398, "num_tokens": 10608069.0, "step": 2970 }, { "entropy": 2.2425498723983766, "epoch": 2.299556070256707, "grad_norm": 0.649382472038269, "learning_rate": 1.178240713819319e-05, "loss": 0.01412668377161026, "mean_token_accuracy": 0.994785113632679, "num_tokens": 10646749.0, "step": 2980 }, { "entropy": 2.191881862282753, "epoch": 2.3072765875313648, "grad_norm": 5.6314496994018555, "learning_rate": 1.173319993562924e-05, "loss": 0.04553419649600983, "mean_token_accuracy": 0.9872561976313591, "num_tokens": 10688044.0, "step": 2990 }, { "entropy": 2.15625539124012, "epoch": 2.314997104806022, "grad_norm": 1.1487791538238525, "learning_rate": 1.1683949428175137e-05, "loss": 0.03611789345741272, "mean_token_accuracy": 0.9944777116179466, "num_tokens": 10723778.0, "step": 3000 }, { "epoch": 2.314997104806022, "eval_entropy": 2.0888531302708193, "eval_loss": 0.46160778403282166, "eval_mean_token_accuracy": 0.9338101559671862, "eval_num_tokens": 10723778.0, "eval_runtime": 988.0337, "eval_samples_per_second": 7.744, "eval_steps_per_second": 0.969, "step": 3000 }, { "entropy": 2.217298111319542, "epoch": 2.3227176220806793, "grad_norm": 0.7061363458633423, "learning_rate": 1.1634656846380088e-05, "loss": 0.02380364537239075, "mean_token_accuracy": 0.9964717343449593, "num_tokens": 10761784.0, "step": 3010 }, { "entropy": 2.2075847864151, "epoch": 2.330438139355337, "grad_norm": 5.256769180297852, "learning_rate": 1.1585323421844563e-05, "loss": 0.020036756992340088, "mean_token_accuracy": 0.9942559063434601, "num_tokens": 10799548.0, "step": 3020 }, { "entropy": 2.2639325708150864, "epoch": 2.3381586566299943, "grad_norm": 1.2079206705093384, "learning_rate": 1.1535950387189491e-05, "loss": 0.026534247398376464, "mean_token_accuracy": 0.9935628846287727, "num_tokens": 10834454.0, "step": 3030 }, { "entropy": 2.2246354073286057, "epoch": 2.3458791739046516, "grad_norm": 4.4090070724487305, "learning_rate": 1.1486538976025494e-05, "loss": 0.03687326312065124, "mean_token_accuracy": 0.9897530093789101, "num_tokens": 10870495.0, "step": 3040 }, { "entropy": 2.264278048276901, "epoch": 2.353599691179309, "grad_norm": 1.5192763805389404, "learning_rate": 1.1437090422922048e-05, "loss": 0.03048618733882904, "mean_token_accuracy": 0.9923379093408584, "num_tokens": 10905172.0, "step": 3050 }, { "entropy": 2.2067640751600264, "epoch": 2.361320208453966, "grad_norm": 3.1806492805480957, "learning_rate": 1.1387605963376634e-05, "loss": 0.026115420460700988, "mean_token_accuracy": 0.993264289200306, "num_tokens": 10944797.0, "step": 3060 }, { "entropy": 2.191044235229492, "epoch": 2.369040725728624, "grad_norm": 0.313163161277771, "learning_rate": 1.1338086833783879e-05, "loss": 0.022575947642326354, "mean_token_accuracy": 0.9924851134419441, "num_tokens": 10981103.0, "step": 3070 }, { "entropy": 2.2448153853416444, "epoch": 2.376761243003281, "grad_norm": 0.07588159292936325, "learning_rate": 1.1288534271404654e-05, "loss": 0.02497773468494415, "mean_token_accuracy": 0.9956817016005516, "num_tokens": 11012602.0, "step": 3080 }, { "entropy": 2.1922047078609466, "epoch": 2.3844817602779385, "grad_norm": 4.014681339263916, "learning_rate": 1.1238949514335171e-05, "loss": 0.04230898320674896, "mean_token_accuracy": 0.9890714272856712, "num_tokens": 11049617.0, "step": 3090 }, { "entropy": 2.2160174280405043, "epoch": 2.392202277552596, "grad_norm": 0.2612691819667816, "learning_rate": 1.1189333801476043e-05, "loss": 0.027991071343421936, "mean_token_accuracy": 0.9910157874226571, "num_tokens": 11083167.0, "step": 3100 }, { "entropy": 2.1471309036016466, "epoch": 2.3999227948272535, "grad_norm": 0.20606683194637299, "learning_rate": 1.1139688372501322e-05, "loss": 0.008393615484237671, "mean_token_accuracy": 0.9982551485300064, "num_tokens": 11120707.0, "step": 3110 }, { "entropy": 2.2330644577741623, "epoch": 2.4076433121019107, "grad_norm": 3.892418622970581, "learning_rate": 1.109001446782754e-05, "loss": 0.0618414044380188, "mean_token_accuracy": 0.9849733024835586, "num_tokens": 11152504.0, "step": 3120 }, { "entropy": 2.1754608184099196, "epoch": 2.4153638293765685, "grad_norm": 2.0742340087890625, "learning_rate": 1.1040313328582704e-05, "loss": 0.04327288269996643, "mean_token_accuracy": 0.9893003240227699, "num_tokens": 11186267.0, "step": 3130 }, { "entropy": 2.1819115340709687, "epoch": 2.4230843466512257, "grad_norm": 0.9018492102622986, "learning_rate": 1.0990586196575294e-05, "loss": 0.02030205577611923, "mean_token_accuracy": 0.9951718047261238, "num_tokens": 11221627.0, "step": 3140 }, { "entropy": 2.2373082458972933, "epoch": 2.430804863925883, "grad_norm": 0.7242811918258667, "learning_rate": 1.0940834314263233e-05, "loss": 0.030833426117897033, "mean_token_accuracy": 0.9951138079166413, "num_tokens": 11257677.0, "step": 3150 }, { "entropy": 2.2836509525775908, "epoch": 2.4385253812005403, "grad_norm": 0.30014318227767944, "learning_rate": 1.089105892472284e-05, "loss": 0.02001524865627289, "mean_token_accuracy": 0.9914347141981125, "num_tokens": 11292106.0, "step": 3160 }, { "entropy": 2.139942041039467, "epoch": 2.446245898475198, "grad_norm": 0.8197279572486877, "learning_rate": 1.0841261271617773e-05, "loss": 0.06748307943344116, "mean_token_accuracy": 0.988334609568119, "num_tokens": 11327418.0, "step": 3170 }, { "entropy": 2.213589632511139, "epoch": 2.4539664157498553, "grad_norm": 0.3989240229129791, "learning_rate": 1.0791442599167962e-05, "loss": 0.023147647082805634, "mean_token_accuracy": 0.9967875018715858, "num_tokens": 11361726.0, "step": 3180 }, { "entropy": 2.256254014372826, "epoch": 2.4616869330245126, "grad_norm": 1.1078554391860962, "learning_rate": 1.0741604152118515e-05, "loss": 0.029124677181243896, "mean_token_accuracy": 0.9931992501020431, "num_tokens": 11398586.0, "step": 3190 }, { "entropy": 2.165381821990013, "epoch": 2.46940745029917, "grad_norm": 1.1475622653961182, "learning_rate": 1.0691747175708611e-05, "loss": 0.028723520040512086, "mean_token_accuracy": 0.990369887650013, "num_tokens": 11432096.0, "step": 3200 }, { "entropy": 2.222157561779022, "epoch": 2.4771279675738276, "grad_norm": 0.06832505017518997, "learning_rate": 1.0641872915640406e-05, "loss": 0.04921720027923584, "mean_token_accuracy": 0.9877250343561172, "num_tokens": 11470784.0, "step": 3210 }, { "entropy": 2.2426993161439897, "epoch": 2.484848484848485, "grad_norm": 4.916550159454346, "learning_rate": 1.0591982618047889e-05, "loss": 0.06242421865463257, "mean_token_accuracy": 0.9849206641316414, "num_tokens": 11502948.0, "step": 3220 }, { "entropy": 2.197218120098114, "epoch": 2.492569002123142, "grad_norm": 2.124483346939087, "learning_rate": 1.0542077529465758e-05, "loss": 0.016325852274894713, "mean_token_accuracy": 0.9951209232211113, "num_tokens": 11539468.0, "step": 3230 }, { "entropy": 2.2902637124061584, "epoch": 2.5002895193978, "grad_norm": 0.08580861240625381, "learning_rate": 1.049215889679827e-05, "loss": 0.015471380949020386, "mean_token_accuracy": 0.9910388752818108, "num_tokens": 11569402.0, "step": 3240 }, { "entropy": 2.218478021025658, "epoch": 2.508010036672457, "grad_norm": 3.2291533946990967, "learning_rate": 1.0442227967288087e-05, "loss": 0.023704257607460023, "mean_token_accuracy": 0.9939404681324959, "num_tokens": 11605925.0, "step": 3250 }, { "entropy": 2.1201782315969466, "epoch": 2.5157305539471144, "grad_norm": 2.169576406478882, "learning_rate": 1.0392285988485118e-05, "loss": 0.032733604311943054, "mean_token_accuracy": 0.9920709192752838, "num_tokens": 11643802.0, "step": 3260 }, { "entropy": 2.2365442246198652, "epoch": 2.5234510712217717, "grad_norm": 0.022659538313746452, "learning_rate": 1.0342334208215343e-05, "loss": 0.019719691574573518, "mean_token_accuracy": 0.9956497728824616, "num_tokens": 11678574.0, "step": 3270 }, { "entropy": 2.258416032791138, "epoch": 2.5311715884964294, "grad_norm": 1.1894478797912598, "learning_rate": 1.0292373874549632e-05, "loss": 0.027323293685913085, "mean_token_accuracy": 0.9939205542206764, "num_tokens": 11709479.0, "step": 3280 }, { "entropy": 2.2412182718515394, "epoch": 2.5388921057710867, "grad_norm": 0.7658277153968811, "learning_rate": 1.0242406235772573e-05, "loss": 0.036611801385879515, "mean_token_accuracy": 0.9948377966880798, "num_tokens": 11747308.0, "step": 3290 }, { "entropy": 2.206353172659874, "epoch": 2.546612623045744, "grad_norm": 4.169549942016602, "learning_rate": 1.0192432540351269e-05, "loss": 0.023987260460853577, "mean_token_accuracy": 0.992442001402378, "num_tokens": 11779775.0, "step": 3300 }, { "entropy": 2.174012392759323, "epoch": 2.5543331403204013, "grad_norm": 1.4817591905593872, "learning_rate": 1.0142454036904154e-05, "loss": 0.014469130337238312, "mean_token_accuracy": 0.997749999165535, "num_tokens": 11813976.0, "step": 3310 }, { "entropy": 2.1796777188777923, "epoch": 2.562053657595059, "grad_norm": 0.08421381562948227, "learning_rate": 1.0092471974169802e-05, "loss": 0.02185429334640503, "mean_token_accuracy": 0.9927170544862747, "num_tokens": 11849438.0, "step": 3320 }, { "entropy": 2.2282682776451113, "epoch": 2.5697741748697163, "grad_norm": 0.30909499526023865, "learning_rate": 1.0042487600975699e-05, "loss": 0.03119277358055115, "mean_token_accuracy": 0.9929424881935119, "num_tokens": 11883486.0, "step": 3330 }, { "entropy": 2.2394611954689028, "epoch": 2.5774946921443735, "grad_norm": 0.10575172305107117, "learning_rate": 9.992502166207077e-06, "loss": 0.009619663655757903, "mean_token_accuracy": 0.9981060609221458, "num_tokens": 11920020.0, "step": 3340 }, { "entropy": 2.201454371213913, "epoch": 2.5852152094190313, "grad_norm": 5.886312484741211, "learning_rate": 9.94251691877568e-06, "loss": 0.025818082690238952, "mean_token_accuracy": 0.9924077332019806, "num_tokens": 11955168.0, "step": 3350 }, { "entropy": 2.1938006192445756, "epoch": 2.5929357266936885, "grad_norm": 0.12290452420711517, "learning_rate": 9.892533107588577e-06, "loss": 0.01246689334511757, "mean_token_accuracy": 0.9964157700538635, "num_tokens": 11994023.0, "step": 3360 }, { "entropy": 2.192418694496155, "epoch": 2.600656243968346, "grad_norm": 0.488265722990036, "learning_rate": 9.842551981516952e-06, "loss": 0.018000373244285585, "mean_token_accuracy": 0.9964497670531273, "num_tokens": 12028712.0, "step": 3370 }, { "entropy": 2.268085116147995, "epoch": 2.6083767612430035, "grad_norm": 0.14518892765045166, "learning_rate": 9.792574789364893e-06, "loss": 0.020170669257640838, "mean_token_accuracy": 0.9963870957493782, "num_tokens": 12059526.0, "step": 3380 }, { "entropy": 2.2167040795087813, "epoch": 2.616097278517661, "grad_norm": 1.522740125656128, "learning_rate": 9.742602779838209e-06, "loss": 0.016399385035037996, "mean_token_accuracy": 0.9955128505825996, "num_tokens": 12097085.0, "step": 3390 }, { "entropy": 2.295898801088333, "epoch": 2.623817795792318, "grad_norm": 4.225417613983154, "learning_rate": 9.69263720151321e-06, "loss": 0.029479607939720154, "mean_token_accuracy": 0.9938596487045288, "num_tokens": 12129924.0, "step": 3400 }, { "entropy": 2.280335706472397, "epoch": 2.6315383130669754, "grad_norm": 1.20139741897583, "learning_rate": 9.64267930280552e-06, "loss": 0.050666403770446775, "mean_token_accuracy": 0.9906869053840637, "num_tokens": 12161521.0, "step": 3410 }, { "entropy": 2.224092537164688, "epoch": 2.6392588303416327, "grad_norm": 1.7901499271392822, "learning_rate": 9.592730331938882e-06, "loss": 0.03357548415660858, "mean_token_accuracy": 0.9925102308392525, "num_tokens": 12197782.0, "step": 3420 }, { "entropy": 2.2111442536115646, "epoch": 2.6469793476162904, "grad_norm": 1.5995413064956665, "learning_rate": 9.542791536913985e-06, "loss": 0.027673259377479553, "mean_token_accuracy": 0.9946150794625283, "num_tokens": 12233888.0, "step": 3430 }, { "entropy": 2.2556965053081512, "epoch": 2.6546998648909477, "grad_norm": 3.171156644821167, "learning_rate": 9.492864165477246e-06, "loss": 0.019532108306884767, "mean_token_accuracy": 0.9935697302222252, "num_tokens": 12267840.0, "step": 3440 }, { "entropy": 2.1733025908470154, "epoch": 2.662420382165605, "grad_norm": 0.10952026396989822, "learning_rate": 9.442949465089679e-06, "loss": 0.04825982451438904, "mean_token_accuracy": 0.9895769953727722, "num_tokens": 12303601.0, "step": 3450 }, { "entropy": 2.239233008027077, "epoch": 2.6701408994402627, "grad_norm": 0.07487324625253677, "learning_rate": 9.393048682895698e-06, "loss": 0.051196861267089847, "mean_token_accuracy": 0.983622993528843, "num_tokens": 12340150.0, "step": 3460 }, { "entropy": 2.2360308557748794, "epoch": 2.67786141671492, "grad_norm": 2.012169122695923, "learning_rate": 9.34316306569196e-06, "loss": 0.01992444396018982, "mean_token_accuracy": 0.9927385210990906, "num_tokens": 12380777.0, "step": 3470 }, { "entropy": 2.235995998978615, "epoch": 2.6855819339895772, "grad_norm": 0.08367231488227844, "learning_rate": 9.293293859896224e-06, "loss": 0.018683603405952452, "mean_token_accuracy": 0.9944416150450707, "num_tokens": 12424408.0, "step": 3480 }, { "entropy": 2.202517831325531, "epoch": 2.693302451264235, "grad_norm": 0.12537157535552979, "learning_rate": 9.243442311516194e-06, "loss": 0.035655727982521056, "mean_token_accuracy": 0.9909148395061493, "num_tokens": 12459199.0, "step": 3490 }, { "entropy": 2.216241243481636, "epoch": 2.7010229685388922, "grad_norm": 2.079157590866089, "learning_rate": 9.193609666118403e-06, "loss": 0.02550240755081177, "mean_token_accuracy": 0.9924755334854126, "num_tokens": 12492382.0, "step": 3500 }, { "epoch": 2.7010229685388922, "eval_entropy": 2.08757205492775, "eval_loss": 0.46482330560684204, "eval_mean_token_accuracy": 0.9347644107593389, "eval_num_tokens": 12492382.0, "eval_runtime": 987.4485, "eval_samples_per_second": 7.748, "eval_steps_per_second": 0.969, "step": 3500 }, { "entropy": 2.1927063912153244, "epoch": 2.7087434858135495, "grad_norm": 4.612570285797119, "learning_rate": 9.143797168797074e-06, "loss": 0.020228767395019533, "mean_token_accuracy": 0.9914082810282707, "num_tokens": 12530445.0, "step": 3510 }, { "entropy": 2.2404502600431444, "epoch": 2.716464003088207, "grad_norm": 2.8573319911956787, "learning_rate": 9.094006064143023e-06, "loss": 0.031410235166549685, "mean_token_accuracy": 0.9914770245552063, "num_tokens": 12564152.0, "step": 3520 }, { "entropy": 2.1382099032402038, "epoch": 2.724184520362864, "grad_norm": 3.369036912918091, "learning_rate": 9.04423759621257e-06, "loss": 0.048682579398155214, "mean_token_accuracy": 0.9871285542845726, "num_tokens": 12601866.0, "step": 3530 }, { "entropy": 2.2182486951351166, "epoch": 2.731905037637522, "grad_norm": 0.04350515827536583, "learning_rate": 8.994493008496426e-06, "loss": 0.037138843536376955, "mean_token_accuracy": 0.9921187847852707, "num_tokens": 12636504.0, "step": 3540 }, { "entropy": 2.238505133986473, "epoch": 2.739625554912179, "grad_norm": 0.463403582572937, "learning_rate": 8.944773543888657e-06, "loss": 0.017538127303123475, "mean_token_accuracy": 0.9944233506917953, "num_tokens": 12671889.0, "step": 3550 }, { "entropy": 2.2769761711359022, "epoch": 2.7473460721868364, "grad_norm": 1.676416277885437, "learning_rate": 8.895080444655606e-06, "loss": 0.028448593616485596, "mean_token_accuracy": 0.9939671754837036, "num_tokens": 12707437.0, "step": 3560 }, { "entropy": 2.2299616605043413, "epoch": 2.755066589461494, "grad_norm": 0.42011213302612305, "learning_rate": 8.845414952404878e-06, "loss": 0.022680895030498506, "mean_token_accuracy": 0.9940501064062118, "num_tokens": 12741280.0, "step": 3570 }, { "entropy": 2.1800275564193727, "epoch": 2.7627871067361514, "grad_norm": 3.0085341930389404, "learning_rate": 8.79577830805428e-06, "loss": 0.04312008917331696, "mean_token_accuracy": 0.9904634907841683, "num_tokens": 12777520.0, "step": 3580 }, { "entropy": 2.121428969502449, "epoch": 2.7705076240108086, "grad_norm": 0.18500223755836487, "learning_rate": 8.746171751800862e-06, "loss": 0.010257864743471146, "mean_token_accuracy": 0.9983589738607407, "num_tokens": 12811089.0, "step": 3590 }, { "entropy": 2.1989814430475234, "epoch": 2.7782281412854664, "grad_norm": 0.542945146560669, "learning_rate": 8.696596523089897e-06, "loss": 0.00803714692592621, "mean_token_accuracy": 0.998145604133606, "num_tokens": 12846203.0, "step": 3600 }, { "entropy": 2.231951543688774, "epoch": 2.7859486585601236, "grad_norm": 0.2957513928413391, "learning_rate": 8.647053860583921e-06, "loss": 0.020568850636482238, "mean_token_accuracy": 0.9942832916975022, "num_tokens": 12881146.0, "step": 3610 }, { "entropy": 2.2153997004032133, "epoch": 2.793669175834781, "grad_norm": 4.239973545074463, "learning_rate": 8.597545002131792e-06, "loss": 0.01559099406003952, "mean_token_accuracy": 0.99518121778965, "num_tokens": 12920233.0, "step": 3620 }, { "entropy": 2.257417145371437, "epoch": 2.801389693109438, "grad_norm": 3.4071872234344482, "learning_rate": 8.548071184737756e-06, "loss": 0.020855729281902314, "mean_token_accuracy": 0.9936988726258278, "num_tokens": 12952742.0, "step": 3630 }, { "entropy": 2.1990304440259933, "epoch": 2.8091102103840955, "grad_norm": 6.179783344268799, "learning_rate": 8.498633644530535e-06, "loss": 0.03551109731197357, "mean_token_accuracy": 0.9895797207951545, "num_tokens": 12987526.0, "step": 3640 }, { "entropy": 2.2407626271247865, "epoch": 2.816830727658753, "grad_norm": 2.062673568725586, "learning_rate": 8.449233616732453e-06, "loss": 0.026538869738578795, "mean_token_accuracy": 0.9921577915549278, "num_tokens": 13025654.0, "step": 3650 }, { "entropy": 2.234692195057869, "epoch": 2.8245512449334105, "grad_norm": 2.2553117275238037, "learning_rate": 8.399872335628564e-06, "loss": 0.017977765202522276, "mean_token_accuracy": 0.9920303016901016, "num_tokens": 13062506.0, "step": 3660 }, { "entropy": 2.2229584991931914, "epoch": 2.8322717622080678, "grad_norm": 2.068716287612915, "learning_rate": 8.35055103453582e-06, "loss": 0.026064303517341614, "mean_token_accuracy": 0.9947251975536346, "num_tokens": 13097457.0, "step": 3670 }, { "entropy": 2.1777986973524093, "epoch": 2.8399922794827255, "grad_norm": 0.49508559703826904, "learning_rate": 8.301270945772245e-06, "loss": 0.01860121488571167, "mean_token_accuracy": 0.9952414557337761, "num_tokens": 13132851.0, "step": 3680 }, { "entropy": 2.233269226551056, "epoch": 2.8477127967573828, "grad_norm": 0.03142388164997101, "learning_rate": 8.252033300626154e-06, "loss": 0.03146423697471619, "mean_token_accuracy": 0.9943786114454269, "num_tokens": 13165995.0, "step": 3690 }, { "entropy": 2.2296706050634385, "epoch": 2.85543331403204, "grad_norm": 0.21639715135097504, "learning_rate": 8.202839329325396e-06, "loss": 0.019184540212154388, "mean_token_accuracy": 0.9943373009562493, "num_tokens": 13203076.0, "step": 3700 }, { "entropy": 2.196987953782082, "epoch": 2.8631538313066978, "grad_norm": 0.4990762770175934, "learning_rate": 8.153690261006586e-06, "loss": 0.025900739431381225, "mean_token_accuracy": 0.9961180582642555, "num_tokens": 13242240.0, "step": 3710 }, { "entropy": 2.2462848991155626, "epoch": 2.870874348581355, "grad_norm": 2.7010302543640137, "learning_rate": 8.104587323684435e-06, "loss": 0.03213064074516296, "mean_token_accuracy": 0.9937118411064148, "num_tokens": 13278586.0, "step": 3720 }, { "entropy": 2.2904939532279966, "epoch": 2.8785948658560123, "grad_norm": 0.5824764370918274, "learning_rate": 8.05553174422104e-06, "loss": 0.04053815901279449, "mean_token_accuracy": 0.9919193282723426, "num_tokens": 13313746.0, "step": 3730 }, { "entropy": 2.2101560860872267, "epoch": 2.8863153831306696, "grad_norm": 0.2210099995136261, "learning_rate": 8.006524748295234e-06, "loss": 0.01130208745598793, "mean_token_accuracy": 0.998863635957241, "num_tokens": 13354478.0, "step": 3740 }, { "entropy": 2.2668700993061064, "epoch": 2.8940359004053273, "grad_norm": 0.10139039158821106, "learning_rate": 7.95756756037197e-06, "loss": 0.030500581860542296, "mean_token_accuracy": 0.992310605943203, "num_tokens": 13386730.0, "step": 3750 }, { "entropy": 2.3063734799623488, "epoch": 2.9017564176799846, "grad_norm": 1.5737172365188599, "learning_rate": 7.908661403671721e-06, "loss": 0.04344950020313263, "mean_token_accuracy": 0.9915585055947304, "num_tokens": 13418333.0, "step": 3760 }, { "entropy": 2.1441037923097612, "epoch": 2.909476934954642, "grad_norm": 0.03719672933220863, "learning_rate": 7.859807500139922e-06, "loss": 0.02446196973323822, "mean_token_accuracy": 0.9906012058258057, "num_tokens": 13457112.0, "step": 3770 }, { "entropy": 2.2902497231960295, "epoch": 2.917197452229299, "grad_norm": 4.060549736022949, "learning_rate": 7.811007070416425e-06, "loss": 0.03251109719276428, "mean_token_accuracy": 0.987868283689022, "num_tokens": 13492524.0, "step": 3780 }, { "entropy": 2.2127520233392715, "epoch": 2.924917969503957, "grad_norm": 0.7151080369949341, "learning_rate": 7.762261333805026e-06, "loss": 0.029196158051490784, "mean_token_accuracy": 0.9946857452392578, "num_tokens": 13528544.0, "step": 3790 }, { "entropy": 2.162434884905815, "epoch": 2.932638486778614, "grad_norm": 0.06961432099342346, "learning_rate": 7.713571508242981e-06, "loss": 0.026906999945640563, "mean_token_accuracy": 0.9946787610650063, "num_tokens": 13567498.0, "step": 3800 }, { "entropy": 2.246299198269844, "epoch": 2.9403590040532714, "grad_norm": 3.7265074253082275, "learning_rate": 7.664938810270566e-06, "loss": 0.029045966267585755, "mean_token_accuracy": 0.9936078891158104, "num_tokens": 13602625.0, "step": 3810 }, { "entropy": 2.2388866275548933, "epoch": 2.948079521327929, "grad_norm": 0.24144315719604492, "learning_rate": 7.616364455000714e-06, "loss": 0.014337979257106781, "mean_token_accuracy": 0.9960026681423187, "num_tokens": 13641679.0, "step": 3820 }, { "entropy": 2.188111361861229, "epoch": 2.9558000386025864, "grad_norm": 6.046823501586914, "learning_rate": 7.567849656088628e-06, "loss": 0.03005032241344452, "mean_token_accuracy": 0.9918044999241828, "num_tokens": 13683014.0, "step": 3830 }, { "entropy": 2.204224619269371, "epoch": 2.9635205558772437, "grad_norm": 5.8294453620910645, "learning_rate": 7.519395625701462e-06, "loss": 0.038737067580223085, "mean_token_accuracy": 0.9885923460125923, "num_tokens": 13718071.0, "step": 3840 }, { "entropy": 2.2484711676836016, "epoch": 2.9712410731519014, "grad_norm": 9.640524864196777, "learning_rate": 7.471003574488041e-06, "loss": 0.028097692131996154, "mean_token_accuracy": 0.9957665964961052, "num_tokens": 13751151.0, "step": 3850 }, { "entropy": 2.2508881419897078, "epoch": 2.9789615904265587, "grad_norm": 0.10017109662294388, "learning_rate": 7.422674711548605e-06, "loss": 0.01202818676829338, "mean_token_accuracy": 0.9953813180327415, "num_tokens": 13791068.0, "step": 3860 }, { "entropy": 2.2337160974740984, "epoch": 2.986682107701216, "grad_norm": 0.043931517750024796, "learning_rate": 7.374410244404613e-06, "loss": 0.009058024734258652, "mean_token_accuracy": 0.9986373543739319, "num_tokens": 13829239.0, "step": 3870 }, { "entropy": 2.1862533658742906, "epoch": 2.9944026249758733, "grad_norm": 0.072396419942379, "learning_rate": 7.326211378968542e-06, "loss": 0.012882831692695617, "mean_token_accuracy": 0.9978046581149101, "num_tokens": 13868022.0, "step": 3880 }, { "entropy": 2.1555983053671346, "epoch": 3.0015441034549313, "grad_norm": 0.04370846599340439, "learning_rate": 7.278079319513793e-06, "loss": 0.03105989098548889, "mean_token_accuracy": 0.9914975681820432, "num_tokens": 13899213.0, "step": 3890 }, { "entropy": 2.2709316343069075, "epoch": 3.009264620729589, "grad_norm": 0.431661456823349, "learning_rate": 7.230015268644588e-06, "loss": 0.015339791774749756, "mean_token_accuracy": 0.9981125354766845, "num_tokens": 13935501.0, "step": 3900 }, { "entropy": 2.1740885227918625, "epoch": 3.0169851380042463, "grad_norm": 0.2746732234954834, "learning_rate": 7.182020427265902e-06, "loss": 0.0041766297072172165, "mean_token_accuracy": 1.0, "num_tokens": 13974859.0, "step": 3910 }, { "entropy": 2.2257029473781587, "epoch": 3.0247056552789036, "grad_norm": 2.3247573375701904, "learning_rate": 7.134095994553489e-06, "loss": 0.01182505115866661, "mean_token_accuracy": 0.9958305478096008, "num_tokens": 14011902.0, "step": 3920 }, { "entropy": 2.198028963804245, "epoch": 3.0324261725535613, "grad_norm": 0.07981577515602112, "learning_rate": 7.086243167923905e-06, "loss": 0.022176089882850646, "mean_token_accuracy": 0.9963392838835716, "num_tokens": 14046566.0, "step": 3930 }, { "entropy": 2.242706462740898, "epoch": 3.0401466898282186, "grad_norm": 0.02186143584549427, "learning_rate": 7.038463143004591e-06, "loss": 0.012292072176933289, "mean_token_accuracy": 0.9961706340312958, "num_tokens": 14079313.0, "step": 3940 }, { "entropy": 2.241307318210602, "epoch": 3.047867207102876, "grad_norm": 0.0767030119895935, "learning_rate": 6.990757113603992e-06, "loss": 0.007230133563280105, "mean_token_accuracy": 0.9980000004172325, "num_tokens": 14117695.0, "step": 3950 }, { "entropy": 2.210197499394417, "epoch": 3.055587724377533, "grad_norm": 0.13448522984981537, "learning_rate": 6.943126271681747e-06, "loss": 0.018068452179431916, "mean_token_accuracy": 0.9969620048999787, "num_tokens": 14153987.0, "step": 3960 }, { "entropy": 2.253513675928116, "epoch": 3.063308241652191, "grad_norm": 3.672414541244507, "learning_rate": 6.895571807318897e-06, "loss": 0.023470789194107056, "mean_token_accuracy": 0.9966314926743507, "num_tokens": 14185621.0, "step": 3970 }, { "entropy": 2.2444525837898253, "epoch": 3.071028758926848, "grad_norm": 0.12743113934993744, "learning_rate": 6.848094908688139e-06, "loss": 0.012810063362121583, "mean_token_accuracy": 0.9977913543581962, "num_tokens": 14219216.0, "step": 3980 }, { "entropy": 2.2262933045625686, "epoch": 3.0787492762015054, "grad_norm": 3.4074060916900635, "learning_rate": 6.8006967620241615e-06, "loss": 0.025683704018592834, "mean_token_accuracy": 0.9924832716584205, "num_tokens": 14257742.0, "step": 3990 }, { "entropy": 2.261911395192146, "epoch": 3.086469793476163, "grad_norm": 0.056527040898799896, "learning_rate": 6.753378551593992e-06, "loss": 0.003825421258807182, "mean_token_accuracy": 0.9986842110753059, "num_tokens": 14291203.0, "step": 4000 }, { "epoch": 3.086469793476163, "eval_entropy": 2.1145772489260732, "eval_loss": 0.4855208396911621, "eval_mean_token_accuracy": 0.9354811434088082, "eval_num_tokens": 14291203.0, "eval_runtime": 989.2063, "eval_samples_per_second": 7.734, "eval_steps_per_second": 0.967, "step": 4000 }, { "entropy": 2.2831456065177917, "epoch": 3.0941903107508204, "grad_norm": 0.058800771832466125, "learning_rate": 6.70614145966741e-06, "loss": 0.013551701605319978, "mean_token_accuracy": 0.9963570073246956, "num_tokens": 14322403.0, "step": 4010 }, { "entropy": 2.2009116262197495, "epoch": 3.1019108280254777, "grad_norm": 0.09004119783639908, "learning_rate": 6.658986666487406e-06, "loss": 0.012571512162685395, "mean_token_accuracy": 0.9967614203691483, "num_tokens": 14363415.0, "step": 4020 }, { "entropy": 2.183881738781929, "epoch": 3.109631345300135, "grad_norm": 0.030173663049936295, "learning_rate": 6.611915350240694e-06, "loss": 0.006261659413576126, "mean_token_accuracy": 0.9986278191208839, "num_tokens": 14402620.0, "step": 4030 }, { "entropy": 2.2086421698331833, "epoch": 3.1173518625747927, "grad_norm": 0.12183760106563568, "learning_rate": 6.56492868702828e-06, "loss": 0.013231892883777619, "mean_token_accuracy": 0.995246222615242, "num_tokens": 14436242.0, "step": 4040 }, { "entropy": 2.1381252884864805, "epoch": 3.12507237984945, "grad_norm": 2.105003833770752, "learning_rate": 6.51802785083606e-06, "loss": 0.025765135884284973, "mean_token_accuracy": 0.9932129815220833, "num_tokens": 14476123.0, "step": 4050 }, { "entropy": 2.22107275724411, "epoch": 3.1327928971241072, "grad_norm": 0.8158308863639832, "learning_rate": 6.471214013505507e-06, "loss": 0.01576409637928009, "mean_token_accuracy": 0.9953061327338218, "num_tokens": 14507443.0, "step": 4060 }, { "entropy": 2.2192520588636397, "epoch": 3.1405134143987645, "grad_norm": 4.943661212921143, "learning_rate": 6.42448834470438e-06, "loss": 0.013656246662139892, "mean_token_accuracy": 0.9962772980332375, "num_tokens": 14540908.0, "step": 4070 }, { "entropy": 2.2019663602113724, "epoch": 3.1482339316734222, "grad_norm": 0.011873590759932995, "learning_rate": 6.3778520118974975e-06, "loss": 0.004965296760201454, "mean_token_accuracy": 0.99921875, "num_tokens": 14577340.0, "step": 4080 }, { "entropy": 2.2791995286941527, "epoch": 3.1559544489480795, "grad_norm": 0.24833594262599945, "learning_rate": 6.331306180317577e-06, "loss": 0.016860713064670563, "mean_token_accuracy": 0.9945571333169937, "num_tokens": 14612020.0, "step": 4090 }, { "entropy": 2.2642083793878554, "epoch": 3.163674966222737, "grad_norm": 4.699156284332275, "learning_rate": 6.284852012936118e-06, "loss": 0.01841319501399994, "mean_token_accuracy": 0.9952612414956092, "num_tokens": 14641945.0, "step": 4100 }, { "entropy": 2.2173303991556166, "epoch": 3.1713954834973945, "grad_norm": 3.3025972843170166, "learning_rate": 6.238490670434338e-06, "loss": 0.019408072531223296, "mean_token_accuracy": 0.9971791654825211, "num_tokens": 14675381.0, "step": 4110 }, { "entropy": 2.1818405985832214, "epoch": 3.179116000772052, "grad_norm": 0.2685317099094391, "learning_rate": 6.192223311174179e-06, "loss": 0.02000413089990616, "mean_token_accuracy": 0.9951157197356224, "num_tokens": 14713258.0, "step": 4120 }, { "entropy": 2.2165157198905945, "epoch": 3.186836518046709, "grad_norm": 3.8232998847961426, "learning_rate": 6.146051091169367e-06, "loss": 0.01722181886434555, "mean_token_accuracy": 0.9972248584032058, "num_tokens": 14749403.0, "step": 4130 }, { "entropy": 2.2096123516559603, "epoch": 3.1945570353213664, "grad_norm": 0.10278035700321198, "learning_rate": 6.099975164056524e-06, "loss": 0.006322793662548065, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 14785151.0, "step": 4140 }, { "entropy": 2.1967154651880265, "epoch": 3.202277552596024, "grad_norm": 1.6875110864639282, "learning_rate": 6.053996681066334e-06, "loss": 0.02624501585960388, "mean_token_accuracy": 0.9960680216550827, "num_tokens": 14819187.0, "step": 4150 }, { "entropy": 2.2883317291736605, "epoch": 3.2099980698706814, "grad_norm": 0.17266136407852173, "learning_rate": 6.008116790994805e-06, "loss": 0.01184847354888916, "mean_token_accuracy": 0.9966648116707801, "num_tokens": 14851008.0, "step": 4160 }, { "entropy": 2.185150256752968, "epoch": 3.2177185871453386, "grad_norm": 1.444366693496704, "learning_rate": 5.962336640174545e-06, "loss": 0.015763652324676514, "mean_token_accuracy": 0.9958777576684952, "num_tokens": 14887540.0, "step": 4170 }, { "entropy": 2.2751846730709078, "epoch": 3.225439104419996, "grad_norm": 0.21020469069480896, "learning_rate": 5.916657372446117e-06, "loss": 0.006749919056892395, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 14922146.0, "step": 4180 }, { "entropy": 2.1631966710090635, "epoch": 3.2331596216946537, "grad_norm": 0.33755046129226685, "learning_rate": 5.8710801291294815e-06, "loss": 0.03264306783676148, "mean_token_accuracy": 0.9941071435809136, "num_tokens": 14958922.0, "step": 4190 }, { "entropy": 2.2516215592622757, "epoch": 3.240880138969311, "grad_norm": 0.3011329174041748, "learning_rate": 5.825606048995459e-06, "loss": 0.008013246208429336, "mean_token_accuracy": 0.9982007578015327, "num_tokens": 14995286.0, "step": 4200 }, { "entropy": 2.231572899222374, "epoch": 3.248600656243968, "grad_norm": 2.2834465503692627, "learning_rate": 5.780236268237286e-06, "loss": 0.015553775429725646, "mean_token_accuracy": 0.9944224849343299, "num_tokens": 15031929.0, "step": 4210 }, { "entropy": 2.2093691408634184, "epoch": 3.256321173518626, "grad_norm": 0.22805458307266235, "learning_rate": 5.7349719204422214e-06, "loss": 0.011248494684696197, "mean_token_accuracy": 0.9973071217536926, "num_tokens": 15072819.0, "step": 4220 }, { "entropy": 2.22184799015522, "epoch": 3.264041690793283, "grad_norm": 0.4345404803752899, "learning_rate": 5.689814136563241e-06, "loss": 0.006262413412332535, "mean_token_accuracy": 0.998863635957241, "num_tokens": 15108990.0, "step": 4230 }, { "entropy": 2.2079828560352324, "epoch": 3.2717622080679405, "grad_norm": 0.5222209095954895, "learning_rate": 5.644764044890752e-06, "loss": 0.013622181117534637, "mean_token_accuracy": 0.9969899669289589, "num_tokens": 15141615.0, "step": 4240 }, { "entropy": 2.149238818883896, "epoch": 3.2794827253425978, "grad_norm": 2.1469385623931885, "learning_rate": 5.599822771024419e-06, "loss": 0.015719014406204223, "mean_token_accuracy": 0.9969118013978004, "num_tokens": 15180770.0, "step": 4250 }, { "entropy": 2.241379123926163, "epoch": 3.2872032426172555, "grad_norm": 0.027104590088129044, "learning_rate": 5.554991437845048e-06, "loss": 0.0024414468556642533, "mean_token_accuracy": 1.0, "num_tokens": 15211585.0, "step": 4260 }, { "entropy": 2.1398084282875063, "epoch": 3.2949237598919128, "grad_norm": 0.11109408736228943, "learning_rate": 5.510271165486509e-06, "loss": 0.006358934193849563, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 15248698.0, "step": 4270 }, { "entropy": 2.2906727343797684, "epoch": 3.30264427716657, "grad_norm": 0.28413844108581543, "learning_rate": 5.465663071307762e-06, "loss": 0.012974724173545837, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 15280972.0, "step": 4280 }, { "entropy": 2.236059454083443, "epoch": 3.3103647944412273, "grad_norm": 0.6353345513343811, "learning_rate": 5.421168269864947e-06, "loss": 0.010030826926231385, "mean_token_accuracy": 0.9976310476660728, "num_tokens": 15318573.0, "step": 4290 }, { "entropy": 2.277936393022537, "epoch": 3.318085311715885, "grad_norm": 0.15945784747600555, "learning_rate": 5.376787872883518e-06, "loss": 0.02424613982439041, "mean_token_accuracy": 0.9960007324814797, "num_tokens": 15349593.0, "step": 4300 }, { "entropy": 2.1999513030052187, "epoch": 3.3258058289905423, "grad_norm": 0.8073568344116211, "learning_rate": 5.332522989230474e-06, "loss": 0.014913980662822724, "mean_token_accuracy": 0.9958407923579216, "num_tokens": 15384204.0, "step": 4310 }, { "entropy": 2.273113438487053, "epoch": 3.3335263462651996, "grad_norm": 0.010039719752967358, "learning_rate": 5.288374724886656e-06, "loss": 0.008377297222614289, "mean_token_accuracy": 0.9974475517868996, "num_tokens": 15419086.0, "step": 4320 }, { "entropy": 2.123158890008926, "epoch": 3.3412468635398573, "grad_norm": 0.423715204000473, "learning_rate": 5.2443441829191175e-06, "loss": 0.018509870767593382, "mean_token_accuracy": 0.9957080200314522, "num_tokens": 15456863.0, "step": 4330 }, { "entropy": 2.177235481142998, "epoch": 3.3489673808145146, "grad_norm": 0.035253945738077164, "learning_rate": 5.200432463453552e-06, "loss": 0.012387002259492874, "mean_token_accuracy": 0.9969292849302291, "num_tokens": 15494675.0, "step": 4340 }, { "entropy": 2.1819762349128724, "epoch": 3.356687898089172, "grad_norm": 0.7576441764831543, "learning_rate": 5.1566406636468085e-06, "loss": 0.028994646668434144, "mean_token_accuracy": 0.9916816547513008, "num_tokens": 15529963.0, "step": 4350 }, { "entropy": 2.1758675992488863, "epoch": 3.3644084153638296, "grad_norm": 0.2250443994998932, "learning_rate": 5.112969877659493e-06, "loss": 0.004997969418764114, "mean_token_accuracy": 0.9987468659877777, "num_tokens": 15564461.0, "step": 4360 }, { "entropy": 2.239803743362427, "epoch": 3.372128932638487, "grad_norm": 0.1805865317583084, "learning_rate": 5.06942119662861e-06, "loss": 0.005810170248150825, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 15598051.0, "step": 4370 }, { "entropy": 2.125052031874657, "epoch": 3.379849449913144, "grad_norm": 4.371738433837891, "learning_rate": 5.02599570864031e-06, "loss": 0.015517064929008484, "mean_token_accuracy": 0.9934965163469315, "num_tokens": 15637669.0, "step": 4380 }, { "entropy": 2.2460622638463974, "epoch": 3.3875699671878015, "grad_norm": 0.18027924001216888, "learning_rate": 4.982694498702702e-06, "loss": 0.005739504098892212, "mean_token_accuracy": 0.9993750005960464, "num_tokens": 15670862.0, "step": 4390 }, { "entropy": 2.213028836250305, "epoch": 3.3952904844624587, "grad_norm": 1.9674371480941772, "learning_rate": 4.939518648718746e-06, "loss": 0.012049780786037445, "mean_token_accuracy": 0.9981812179088593, "num_tokens": 15706922.0, "step": 4400 }, { "entropy": 2.2505041897296905, "epoch": 3.4030110017371165, "grad_norm": 1.6243531703948975, "learning_rate": 4.896469237459228e-06, "loss": 0.003813191503286362, "mean_token_accuracy": 0.999074074625969, "num_tokens": 15745049.0, "step": 4410 }, { "entropy": 2.102014201879501, "epoch": 3.4107315190117737, "grad_norm": 2.138728618621826, "learning_rate": 4.853547340535775e-06, "loss": 0.014606839418411255, "mean_token_accuracy": 0.998145604133606, "num_tokens": 15782169.0, "step": 4420 }, { "entropy": 2.166767033934593, "epoch": 3.418452036286431, "grad_norm": 0.09994740039110184, "learning_rate": 4.810754030374024e-06, "loss": 0.022449350357055663, "mean_token_accuracy": 0.9930004492402077, "num_tokens": 15819096.0, "step": 4430 }, { "entropy": 2.1858236521482466, "epoch": 3.4261725535610887, "grad_norm": 0.3162212073802948, "learning_rate": 4.768090376186797e-06, "loss": 0.023777911067008974, "mean_token_accuracy": 0.9946548566222191, "num_tokens": 15862846.0, "step": 4440 }, { "entropy": 2.189643532037735, "epoch": 3.433893070835746, "grad_norm": 0.39837151765823364, "learning_rate": 4.72555744394739e-06, "loss": 0.018805976212024688, "mean_token_accuracy": 0.9932140588760376, "num_tokens": 15904709.0, "step": 4450 }, { "entropy": 2.2112290412187576, "epoch": 3.4416135881104033, "grad_norm": 0.025752931833267212, "learning_rate": 4.68315629636296e-06, "loss": 0.0037055592983961105, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 15940870.0, "step": 4460 }, { "entropy": 2.195486468076706, "epoch": 3.449334105385061, "grad_norm": 3.4531970024108887, "learning_rate": 4.64088799284794e-06, "loss": 0.009186282008886337, "mean_token_accuracy": 0.996559077501297, "num_tokens": 15977007.0, "step": 4470 }, { "entropy": 2.2477256029844286, "epoch": 3.4570546226597183, "grad_norm": 0.017128420993685722, "learning_rate": 4.598753589497595e-06, "loss": 0.034723791480064395, "mean_token_accuracy": 0.990346123278141, "num_tokens": 16010302.0, "step": 4480 }, { "entropy": 2.266435816884041, "epoch": 3.4647751399343756, "grad_norm": 0.011056693270802498, "learning_rate": 4.5567541390616165e-06, "loss": 0.020518609881401063, "mean_token_accuracy": 0.994847884774208, "num_tokens": 16045264.0, "step": 4490 }, { "entropy": 2.2363200038671494, "epoch": 3.472495657209033, "grad_norm": 0.28764382004737854, "learning_rate": 4.514890690917844e-06, "loss": 0.030601662397384644, "mean_token_accuracy": 0.9958360910415649, "num_tokens": 16084354.0, "step": 4500 }, { "epoch": 3.472495657209033, "eval_entropy": 2.094737304290883, "eval_loss": 0.49774986505508423, "eval_mean_token_accuracy": 0.9358505434127935, "eval_num_tokens": 16084354.0, "eval_runtime": 987.909, "eval_samples_per_second": 7.745, "eval_steps_per_second": 0.969, "step": 4500 }, { "entropy": 2.167369270324707, "epoch": 3.4802161744836906, "grad_norm": 0.8214945793151855, "learning_rate": 4.473164291046016e-06, "loss": 0.0059088427573442456, "mean_token_accuracy": 0.9981317937374115, "num_tokens": 16120147.0, "step": 4510 }, { "entropy": 2.227228084206581, "epoch": 3.487936691758348, "grad_norm": 0.32604676485061646, "learning_rate": 4.431575982001651e-06, "loss": 0.011142008751630784, "mean_token_accuracy": 0.9969166651368141, "num_tokens": 16153451.0, "step": 4520 }, { "entropy": 2.2228987962007523, "epoch": 3.495657209033005, "grad_norm": 4.1868085861206055, "learning_rate": 4.390126802890008e-06, "loss": 0.021856479346752167, "mean_token_accuracy": 0.9982320085167885, "num_tokens": 16189202.0, "step": 4530 }, { "entropy": 2.173022910952568, "epoch": 3.5033777263076624, "grad_norm": 1.626468539237976, "learning_rate": 4.348817789340102e-06, "loss": 0.006640783697366715, "mean_token_accuracy": 0.9993055552244187, "num_tokens": 16229153.0, "step": 4540 }, { "entropy": 2.2181044608354568, "epoch": 3.51109824358232, "grad_norm": 0.957091748714447, "learning_rate": 4.307649973478838e-06, "loss": 0.021261365711688997, "mean_token_accuracy": 0.9973930478096008, "num_tokens": 16261419.0, "step": 4550 }, { "entropy": 2.163629150390625, "epoch": 3.5188187608569774, "grad_norm": 3.54240083694458, "learning_rate": 4.266624383905238e-06, "loss": 0.014290031790733338, "mean_token_accuracy": 0.9942340418696404, "num_tokens": 16297418.0, "step": 4560 }, { "entropy": 2.165030711889267, "epoch": 3.5265392781316347, "grad_norm": 0.8268080353736877, "learning_rate": 4.225742045664713e-06, "loss": 0.013842463493347168, "mean_token_accuracy": 0.9971296295523644, "num_tokens": 16333646.0, "step": 4570 }, { "entropy": 2.2287199676036833, "epoch": 3.5342597954062924, "grad_norm": 0.16437366604804993, "learning_rate": 4.1850039802234754e-06, "loss": 0.0037029199302196503, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 16367085.0, "step": 4580 }, { "entropy": 2.2051072388887407, "epoch": 3.5419803126809497, "grad_norm": 0.2944578528404236, "learning_rate": 4.144411205442996e-06, "loss": 0.022799597680568696, "mean_token_accuracy": 0.995043994486332, "num_tokens": 16403393.0, "step": 4590 }, { "entropy": 2.192304465174675, "epoch": 3.549700829955607, "grad_norm": 3.0054590702056885, "learning_rate": 4.103964735554602e-06, "loss": 0.031678736209869385, "mean_token_accuracy": 0.9951188251376152, "num_tokens": 16438181.0, "step": 4600 }, { "entropy": 2.24237465262413, "epoch": 3.5574213472302643, "grad_norm": 3.488093376159668, "learning_rate": 4.063665581134101e-06, "loss": 0.016337577998638154, "mean_token_accuracy": 0.9961950778961182, "num_tokens": 16474359.0, "step": 4610 }, { "entropy": 2.1587339490652084, "epoch": 3.565141864504922, "grad_norm": 0.4733858108520508, "learning_rate": 4.023514749076553e-06, "loss": 0.022992467880249022, "mean_token_accuracy": 0.9947966426610947, "num_tokens": 16508074.0, "step": 4620 }, { "entropy": 2.2088340640068056, "epoch": 3.5728623817795793, "grad_norm": 0.09064114093780518, "learning_rate": 3.983513242571113e-06, "loss": 0.024549849331378937, "mean_token_accuracy": 0.9951631486415863, "num_tokens": 16545666.0, "step": 4630 }, { "entropy": 2.1512410193681717, "epoch": 3.5805828990542365, "grad_norm": 0.4027511179447174, "learning_rate": 3.943662061075957e-06, "loss": 0.008296293765306472, "mean_token_accuracy": 0.9972971126437187, "num_tokens": 16582524.0, "step": 4640 }, { "entropy": 2.2184607803821565, "epoch": 3.588303416328894, "grad_norm": 0.21228182315826416, "learning_rate": 3.903962200293305e-06, "loss": 0.006698296964168548, "mean_token_accuracy": 0.9988095238804817, "num_tokens": 16619971.0, "step": 4650 }, { "entropy": 2.1930524677038195, "epoch": 3.5960239336035515, "grad_norm": 0.12852530181407928, "learning_rate": 3.86441465214457e-06, "loss": 0.019022318720817565, "mean_token_accuracy": 0.9959166675806046, "num_tokens": 16655670.0, "step": 4660 }, { "entropy": 2.2068610817193983, "epoch": 3.603744450878209, "grad_norm": 0.11005378514528275, "learning_rate": 3.825020404745539e-06, "loss": 0.02366378754377365, "mean_token_accuracy": 0.9947434559464454, "num_tokens": 16692946.0, "step": 4670 }, { "entropy": 2.158995199203491, "epoch": 3.611464968152866, "grad_norm": 0.06957825273275375, "learning_rate": 3.785780442381708e-06, "loss": 0.006554947793483734, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 16728342.0, "step": 4680 }, { "entropy": 2.201757091283798, "epoch": 3.619185485427524, "grad_norm": 0.013743036426603794, "learning_rate": 3.746695745483676e-06, "loss": 0.022013702988624574, "mean_token_accuracy": 0.9964899107813835, "num_tokens": 16765997.0, "step": 4690 }, { "entropy": 2.189955911040306, "epoch": 3.626906002702181, "grad_norm": 1.3227832317352295, "learning_rate": 3.7077672906026674e-06, "loss": 0.009854133427143096, "mean_token_accuracy": 0.9972507312893868, "num_tokens": 16806476.0, "step": 4700 }, { "entropy": 2.2155461460351944, "epoch": 3.6346265199768384, "grad_norm": 0.07080277055501938, "learning_rate": 3.66899605038611e-06, "loss": 0.018130703270435332, "mean_token_accuracy": 0.9930429771542549, "num_tokens": 16839996.0, "step": 4710 }, { "entropy": 2.2547535479068754, "epoch": 3.642347037251496, "grad_norm": 0.03352458029985428, "learning_rate": 3.6303829935533387e-06, "loss": 0.023316796123981475, "mean_token_accuracy": 0.9934576332569123, "num_tokens": 16870710.0, "step": 4720 }, { "entropy": 2.2180339872837065, "epoch": 3.6500675545261534, "grad_norm": 0.08932402729988098, "learning_rate": 3.5919290848714083e-06, "loss": 0.019556549191474915, "mean_token_accuracy": 0.9943825855851174, "num_tokens": 16905867.0, "step": 4730 }, { "entropy": 2.25754671394825, "epoch": 3.6577880718008107, "grad_norm": 0.36979636549949646, "learning_rate": 3.5536352851309654e-06, "loss": 0.010746852308511735, "mean_token_accuracy": 0.9972794115543365, "num_tokens": 16942946.0, "step": 4740 }, { "entropy": 2.173688989877701, "epoch": 3.665508589075468, "grad_norm": 0.9019256830215454, "learning_rate": 3.5155025511222553e-06, "loss": 0.013900287449359894, "mean_token_accuracy": 0.9956018269062042, "num_tokens": 16982691.0, "step": 4750 }, { "entropy": 2.186745339632034, "epoch": 3.6732291063501252, "grad_norm": 1.9558967351913452, "learning_rate": 3.4775318356112085e-06, "loss": 0.0026500292122364046, "mean_token_accuracy": 0.9984375, "num_tokens": 17014619.0, "step": 4760 }, { "entropy": 2.190760698914528, "epoch": 3.680949623624783, "grad_norm": 0.6850957274436951, "learning_rate": 3.439724087315649e-06, "loss": 0.008563292026519776, "mean_token_accuracy": 0.997857142984867, "num_tokens": 17049479.0, "step": 4770 }, { "entropy": 2.2078921467065813, "epoch": 3.6886701408994402, "grad_norm": 0.48178425431251526, "learning_rate": 3.4020802508815844e-06, "loss": 0.00671912282705307, "mean_token_accuracy": 0.9985702604055404, "num_tokens": 17084774.0, "step": 4780 }, { "entropy": 2.199252927303314, "epoch": 3.6963906581740975, "grad_norm": 3.1879372596740723, "learning_rate": 3.3646012668595797e-06, "loss": 0.012920960783958435, "mean_token_accuracy": 0.9954613089561463, "num_tokens": 17118756.0, "step": 4790 }, { "entropy": 2.192939519882202, "epoch": 3.7041111754487552, "grad_norm": 3.9493212699890137, "learning_rate": 3.3272880716812994e-06, "loss": 0.010051518678665161, "mean_token_accuracy": 0.996506179869175, "num_tokens": 17151694.0, "step": 4800 }, { "entropy": 2.2035789877176284, "epoch": 3.7118316927234125, "grad_norm": 0.0355636328458786, "learning_rate": 3.2901415976360773e-06, "loss": 0.012046564370393753, "mean_token_accuracy": 0.9979532152414322, "num_tokens": 17188300.0, "step": 4810 }, { "entropy": 2.265298753976822, "epoch": 3.71955220999807, "grad_norm": 0.5305169224739075, "learning_rate": 3.2531627728476357e-06, "loss": 0.015401627123355865, "mean_token_accuracy": 0.9960317447781563, "num_tokens": 17226628.0, "step": 4820 }, { "entropy": 2.235144093632698, "epoch": 3.7272727272727275, "grad_norm": 1.9314122200012207, "learning_rate": 3.2163525212509008e-06, "loss": 0.012413406372070312, "mean_token_accuracy": 0.9970962628722191, "num_tokens": 17261288.0, "step": 4830 }, { "entropy": 2.1957934617996218, "epoch": 3.734993244547385, "grad_norm": 0.05546269565820694, "learning_rate": 3.1797117625689024e-06, "loss": 0.00331185944378376, "mean_token_accuracy": 1.0, "num_tokens": 17296586.0, "step": 4840 }, { "entropy": 2.2121754467487333, "epoch": 3.742713761822042, "grad_norm": 0.16634555160999298, "learning_rate": 3.1432414122898057e-06, "loss": 0.01630573719739914, "mean_token_accuracy": 0.99408238530159, "num_tokens": 17330163.0, "step": 4850 }, { "entropy": 2.2177652209997176, "epoch": 3.7504342790966994, "grad_norm": 0.054232124239206314, "learning_rate": 3.1069423816440324e-06, "loss": 0.005872461199760437, "mean_token_accuracy": 0.9970823854207993, "num_tokens": 17364167.0, "step": 4860 }, { "entropy": 2.2218244522809982, "epoch": 3.7581547963713566, "grad_norm": 0.05728960037231445, "learning_rate": 3.070815577581505e-06, "loss": 0.023728246986865997, "mean_token_accuracy": 0.994246032834053, "num_tokens": 17396732.0, "step": 4870 }, { "entropy": 2.270163568854332, "epoch": 3.7658753136460144, "grad_norm": 2.1181461811065674, "learning_rate": 3.0348619027489656e-06, "loss": 0.013901802897453307, "mean_token_accuracy": 0.9959643810987473, "num_tokens": 17433024.0, "step": 4880 }, { "entropy": 2.194043418765068, "epoch": 3.7735958309206716, "grad_norm": 0.1262357532978058, "learning_rate": 2.9990822554674325e-06, "loss": 0.009613892436027527, "mean_token_accuracy": 0.9968301028013229, "num_tokens": 17472584.0, "step": 4890 }, { "entropy": 2.2226660668849947, "epoch": 3.781316348195329, "grad_norm": 0.12729032337665558, "learning_rate": 2.9634775297097693e-06, "loss": 0.0013892247341573238, "mean_token_accuracy": 1.0, "num_tokens": 17509334.0, "step": 4900 }, { "entropy": 2.2277002543210984, "epoch": 3.7890368654699866, "grad_norm": 0.04032934457063675, "learning_rate": 2.928048615078324e-06, "loss": 0.008014556765556336, "mean_token_accuracy": 0.9958013474941254, "num_tokens": 17551004.0, "step": 4910 }, { "entropy": 2.23101692199707, "epoch": 3.796757382744644, "grad_norm": 0.05918664112687111, "learning_rate": 2.8927963967827124e-06, "loss": 0.011012130230665208, "mean_token_accuracy": 0.9966880336403847, "num_tokens": 17590813.0, "step": 4920 }, { "entropy": 2.309200382232666, "epoch": 3.804477900019301, "grad_norm": 0.039273522794246674, "learning_rate": 2.8577217556177115e-06, "loss": 0.010339566320180894, "mean_token_accuracy": 0.9992424249649048, "num_tokens": 17622252.0, "step": 4930 }, { "entropy": 2.2433013200759886, "epoch": 3.812198417293959, "grad_norm": 0.3272627294063568, "learning_rate": 2.8228255679412353e-06, "loss": 0.009843137860298157, "mean_token_accuracy": 0.99921875, "num_tokens": 17662561.0, "step": 4940 }, { "entropy": 2.2392791122198106, "epoch": 3.819918934568616, "grad_norm": 0.038887813687324524, "learning_rate": 2.7881087056524468e-06, "loss": 0.008080794662237167, "mean_token_accuracy": 0.9986842110753059, "num_tokens": 17694695.0, "step": 4950 }, { "entropy": 2.2464512795209886, "epoch": 3.8276394518432735, "grad_norm": 0.4352750778198242, "learning_rate": 2.7535720361699703e-06, "loss": 0.006981483101844788, "mean_token_accuracy": 0.9978636354207993, "num_tokens": 17726808.0, "step": 4960 }, { "entropy": 2.2429711014032363, "epoch": 3.8353599691179308, "grad_norm": 3.1303551197052, "learning_rate": 2.7192164224102267e-06, "loss": 0.009275702387094497, "mean_token_accuracy": 0.9982230380177498, "num_tokens": 17763685.0, "step": 4970 }, { "entropy": 2.167110252380371, "epoch": 3.843080486392588, "grad_norm": 3.1086466312408447, "learning_rate": 2.6850427227658625e-06, "loss": 0.01786840558052063, "mean_token_accuracy": 0.9957186207175255, "num_tokens": 17800532.0, "step": 4980 }, { "entropy": 2.202439108490944, "epoch": 3.8508010036672458, "grad_norm": 0.03255437687039375, "learning_rate": 2.6510517910843014e-06, "loss": 0.014580619335174561, "mean_token_accuracy": 0.9978412076830864, "num_tokens": 17836043.0, "step": 4990 }, { "entropy": 2.2670375287532805, "epoch": 3.858521520941903, "grad_norm": 0.09342753142118454, "learning_rate": 2.617244476646429e-06, "loss": 0.01826583743095398, "mean_token_accuracy": 0.9961647734045982, "num_tokens": 17872352.0, "step": 5000 }, { "epoch": 3.858521520941903, "eval_entropy": 2.0908612560951845, "eval_loss": 0.507649302482605, "eval_mean_token_accuracy": 0.9354228066551025, "eval_num_tokens": 17872352.0, "eval_runtime": 987.5554, "eval_samples_per_second": 7.747, "eval_steps_per_second": 0.969, "step": 5000 }, { "entropy": 2.1657870292663572, "epoch": 3.8662420382165603, "grad_norm": 0.19421711564064026, "learning_rate": 2.5836216241453473e-06, "loss": 0.014168056845664977, "mean_token_accuracy": 0.9971320345997811, "num_tokens": 17912375.0, "step": 5010 }, { "entropy": 2.1820801228284834, "epoch": 3.873962555491218, "grad_norm": 1.4638241529464722, "learning_rate": 2.5501840736652884e-06, "loss": 0.008419310301542282, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 17950474.0, "step": 5020 }, { "entropy": 2.2266716092824934, "epoch": 3.8816830727658753, "grad_norm": 0.12025623768568039, "learning_rate": 2.5169326606606127e-06, "loss": 0.004219979792833328, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 17983123.0, "step": 5030 }, { "entropy": 2.23225157558918, "epoch": 3.8894035900405326, "grad_norm": 2.4465901851654053, "learning_rate": 2.4838682159349504e-06, "loss": 0.01536642462015152, "mean_token_accuracy": 0.9948759660124779, "num_tokens": 18016866.0, "step": 5040 }, { "entropy": 2.2503413647413253, "epoch": 3.8971241073151903, "grad_norm": 0.26093390583992004, "learning_rate": 2.4509915656204242e-06, "loss": 0.018379612267017363, "mean_token_accuracy": 0.9953591957688331, "num_tokens": 18050369.0, "step": 5050 }, { "entropy": 2.346876162290573, "epoch": 3.9048446245898476, "grad_norm": 0.04715586453676224, "learning_rate": 2.418303531157017e-06, "loss": 0.006166347116231918, "mean_token_accuracy": 0.9976365551352501, "num_tokens": 18085766.0, "step": 5060 }, { "entropy": 2.2075785368680956, "epoch": 3.912565141864505, "grad_norm": 0.06558074057102203, "learning_rate": 2.3858049292720565e-06, "loss": 0.010641612112522125, "mean_token_accuracy": 0.9973457798361778, "num_tokens": 18118325.0, "step": 5070 }, { "entropy": 2.1510800033807755, "epoch": 3.920285659139162, "grad_norm": 2.4715569019317627, "learning_rate": 2.353496571959791e-06, "loss": 0.008443721383810044, "mean_token_accuracy": 0.9969614043831825, "num_tokens": 18155458.0, "step": 5080 }, { "entropy": 2.219439336657524, "epoch": 3.92800617641382, "grad_norm": 0.02134764939546585, "learning_rate": 2.3213792664611123e-06, "loss": 0.020188172161579133, "mean_token_accuracy": 0.9954755708575249, "num_tokens": 18188388.0, "step": 5090 }, { "entropy": 2.1883194625377653, "epoch": 3.935726693688477, "grad_norm": 0.009646475315093994, "learning_rate": 2.289453815243391e-06, "loss": 0.009002915769815444, "mean_token_accuracy": 0.9987499997019768, "num_tokens": 18228648.0, "step": 5100 }, { "entropy": 2.1794584810733797, "epoch": 3.9434472109631344, "grad_norm": 0.06897470355033875, "learning_rate": 2.2577210159804107e-06, "loss": 0.01597502678632736, "mean_token_accuracy": 0.9932748913764954, "num_tokens": 18267139.0, "step": 5110 }, { "entropy": 2.217776373028755, "epoch": 3.9511677282377917, "grad_norm": 3.1233739852905273, "learning_rate": 2.226181661532455e-06, "loss": 0.02588752806186676, "mean_token_accuracy": 0.993584081530571, "num_tokens": 18305735.0, "step": 5120 }, { "entropy": 2.188844358921051, "epoch": 3.9588882455124494, "grad_norm": 0.6708783507347107, "learning_rate": 2.1948365399264802e-06, "loss": 0.014759351313114167, "mean_token_accuracy": 0.9980769217014313, "num_tokens": 18339445.0, "step": 5130 }, { "entropy": 2.1940950095653533, "epoch": 3.9666087627871067, "grad_norm": 0.0733635202050209, "learning_rate": 2.163686434336448e-06, "loss": 0.015484817326068878, "mean_token_accuracy": 0.9958730831742286, "num_tokens": 18372350.0, "step": 5140 }, { "entropy": 2.249452704191208, "epoch": 3.974329280061764, "grad_norm": 0.0156388096511364, "learning_rate": 2.1327321230637355e-06, "loss": 0.02897282540798187, "mean_token_accuracy": 0.994414983689785, "num_tokens": 18408315.0, "step": 5150 }, { "entropy": 2.2180632591247558, "epoch": 3.9820497973364217, "grad_norm": 0.5558152794837952, "learning_rate": 2.101974379517697e-06, "loss": 0.0015709832310676574, "mean_token_accuracy": 1.0, "num_tokens": 18441147.0, "step": 5160 }, { "entropy": 2.251400685310364, "epoch": 3.989770314611079, "grad_norm": 0.07538606226444244, "learning_rate": 2.071413972196351e-06, "loss": 0.010088697820901871, "mean_token_accuracy": 0.9971969693899154, "num_tokens": 18477218.0, "step": 5170 }, { "entropy": 2.265915700793266, "epoch": 3.9974908318857363, "grad_norm": 0.07861519604921341, "learning_rate": 2.04105166466716e-06, "loss": 0.013128484785556793, "mean_token_accuracy": 0.9976960763335228, "num_tokens": 18513822.0, "step": 5180 }, { "entropy": 2.2155757626971684, "epoch": 4.004632310364794, "grad_norm": 0.15793584287166595, "learning_rate": 2.0108882155479602e-06, "loss": 0.014671583473682404, "mean_token_accuracy": 0.9959569025684047, "num_tokens": 18544084.0, "step": 5190 }, { "entropy": 2.216670718789101, "epoch": 4.012352827639452, "grad_norm": 0.10165757685899734, "learning_rate": 1.9809243784880215e-06, "loss": 0.001284267660230398, "mean_token_accuracy": 1.0, "num_tokens": 18579882.0, "step": 5200 }, { "entropy": 2.1769883900880815, "epoch": 4.020073344914109, "grad_norm": 0.02957017533481121, "learning_rate": 1.9511609021491895e-06, "loss": 0.003650863468647003, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 18615819.0, "step": 5210 }, { "entropy": 2.237304484844208, "epoch": 4.027793862188767, "grad_norm": 0.22377407550811768, "learning_rate": 1.921598530187202e-06, "loss": 0.0013460190035402774, "mean_token_accuracy": 1.0, "num_tokens": 18649294.0, "step": 5220 }, { "entropy": 2.2296341180801393, "epoch": 4.035514379463424, "grad_norm": 0.028993308544158936, "learning_rate": 1.8922380012330943e-06, "loss": 0.001667243242263794, "mean_token_accuracy": 1.0, "num_tokens": 18686007.0, "step": 5230 }, { "entropy": 2.258844423294067, "epoch": 4.043234896738081, "grad_norm": 0.047745853662490845, "learning_rate": 1.8630800488747625e-06, "loss": 0.005907272547483444, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 18718290.0, "step": 5240 }, { "entropy": 2.2396200627088545, "epoch": 4.050955414012739, "grad_norm": 0.11687777936458588, "learning_rate": 1.8341254016386102e-06, "loss": 0.011040620505809784, "mean_token_accuracy": 0.9929608583450318, "num_tokens": 18758891.0, "step": 5250 }, { "entropy": 2.2722030729055405, "epoch": 4.058675931287397, "grad_norm": 1.0893008708953857, "learning_rate": 1.8053747829713618e-06, "loss": 0.0026631668210029603, "mean_token_accuracy": 0.998863635957241, "num_tokens": 18791486.0, "step": 5260 }, { "entropy": 2.2243568778038023, "epoch": 4.066396448562053, "grad_norm": 0.028796734288334846, "learning_rate": 1.7768289112219883e-06, "loss": 0.005374731123447418, "mean_token_accuracy": 0.9990384608507157, "num_tokens": 18825388.0, "step": 5270 }, { "entropy": 2.172247883677483, "epoch": 4.074116965836711, "grad_norm": 0.03655334934592247, "learning_rate": 1.7484884996237472e-06, "loss": 0.0015311230905354022, "mean_token_accuracy": 1.0, "num_tokens": 18863479.0, "step": 5280 }, { "entropy": 2.1923954993486405, "epoch": 4.081837483111369, "grad_norm": 0.11251391470432281, "learning_rate": 1.7203542562763699e-06, "loss": 0.0013637151569128036, "mean_token_accuracy": 1.0, "num_tokens": 18899886.0, "step": 5290 }, { "entropy": 2.1101179629564286, "epoch": 4.089558000386026, "grad_norm": 0.019721994176506996, "learning_rate": 1.6924268841283731e-06, "loss": 0.005000091716647148, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 18943812.0, "step": 5300 }, { "entropy": 2.2096335530281066, "epoch": 4.097278517660683, "grad_norm": 0.3568638563156128, "learning_rate": 1.6647070809594846e-06, "loss": 0.010236522555351258, "mean_token_accuracy": 0.99627845287323, "num_tokens": 18976301.0, "step": 5310 }, { "entropy": 2.2267425060272217, "epoch": 4.10499903493534, "grad_norm": 0.1415398120880127, "learning_rate": 1.6371955393632177e-06, "loss": 0.012716498970985413, "mean_token_accuracy": 0.997547847032547, "num_tokens": 19015300.0, "step": 5320 }, { "entropy": 2.2259861052036287, "epoch": 4.112719552209998, "grad_norm": 0.0552356131374836, "learning_rate": 1.60989294672956e-06, "loss": 0.00908339098095894, "mean_token_accuracy": 0.9977884605526924, "num_tokens": 19051745.0, "step": 5330 }, { "entropy": 2.2949888169765473, "epoch": 4.120440069484656, "grad_norm": 0.13113631308078766, "learning_rate": 1.5827999852278097e-06, "loss": 0.0018477724865078927, "mean_token_accuracy": 1.0, "num_tokens": 19083371.0, "step": 5340 }, { "entropy": 2.2030975073575974, "epoch": 4.1281605867593125, "grad_norm": 2.422152280807495, "learning_rate": 1.5559173317895148e-06, "loss": 0.005163485929369926, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 19119667.0, "step": 5350 }, { "entropy": 2.203478366136551, "epoch": 4.13588110403397, "grad_norm": 0.4935871362686157, "learning_rate": 1.5292456580915703e-06, "loss": 0.0074889764189720156, "mean_token_accuracy": 0.9986068099737168, "num_tokens": 19158058.0, "step": 5360 }, { "entropy": 2.176115852594376, "epoch": 4.143601621308628, "grad_norm": 0.047461602836847305, "learning_rate": 1.5027856305394416e-06, "loss": 0.01174907609820366, "mean_token_accuracy": 0.9964136898517608, "num_tokens": 19191330.0, "step": 5370 }, { "entropy": 2.3252247244119646, "epoch": 4.151322138583285, "grad_norm": 0.07587450742721558, "learning_rate": 1.4765379102504973e-06, "loss": 0.004352330043911934, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 19223065.0, "step": 5380 }, { "entropy": 2.2030561834573748, "epoch": 4.1590426558579425, "grad_norm": 0.0413011871278286, "learning_rate": 1.4505031530375024e-06, "loss": 0.0010141530074179173, "mean_token_accuracy": 1.0, "num_tokens": 19258355.0, "step": 5390 }, { "entropy": 2.172553300857544, "epoch": 4.1667631731326, "grad_norm": 0.016729436814785004, "learning_rate": 1.424682009392232e-06, "loss": 0.008941520750522614, "mean_token_accuracy": 0.997578963637352, "num_tokens": 19293261.0, "step": 5400 }, { "entropy": 2.225874611735344, "epoch": 4.174483690407257, "grad_norm": 0.11103388667106628, "learning_rate": 1.399075124469217e-06, "loss": 0.004546413570642472, "mean_token_accuracy": 0.99921875, "num_tokens": 19327624.0, "step": 5410 }, { "entropy": 2.167690780758858, "epoch": 4.182204207681915, "grad_norm": 2.885631799697876, "learning_rate": 1.3736831380696224e-06, "loss": 0.01201588660478592, "mean_token_accuracy": 0.9971944436430931, "num_tokens": 19362087.0, "step": 5420 }, { "entropy": 2.269624611735344, "epoch": 4.1899247249565725, "grad_norm": 0.44468164443969727, "learning_rate": 1.3485066846252615e-06, "loss": 0.009978090226650239, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 19396605.0, "step": 5430 }, { "entropy": 2.2737204790115357, "epoch": 4.197645242231229, "grad_norm": 0.1409270316362381, "learning_rate": 1.323546393182752e-06, "loss": 0.008260860294103622, "mean_token_accuracy": 0.9979480162262917, "num_tokens": 19434246.0, "step": 5440 }, { "entropy": 2.2025551408529283, "epoch": 4.205365759505887, "grad_norm": 2.0743470191955566, "learning_rate": 1.2988028873877867e-06, "loss": 0.007827727496623993, "mean_token_accuracy": 0.9981812179088593, "num_tokens": 19472258.0, "step": 5450 }, { "entropy": 2.0870246827602386, "epoch": 4.213086276780544, "grad_norm": 0.0854920968413353, "learning_rate": 1.2742767854695603e-06, "loss": 0.001750888116657734, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 19515091.0, "step": 5460 }, { "entropy": 2.2541315644979476, "epoch": 4.220806794055202, "grad_norm": 0.050843846052885056, "learning_rate": 1.2499687002253214e-06, "loss": 0.012310877442359924, "mean_token_accuracy": 0.9966666668653488, "num_tokens": 19550438.0, "step": 5470 }, { "entropy": 2.281228691339493, "epoch": 4.228527311329859, "grad_norm": 0.10463957488536835, "learning_rate": 1.2258792390050589e-06, "loss": 0.009670499712228775, "mean_token_accuracy": 0.9984359726309776, "num_tokens": 19587460.0, "step": 5480 }, { "entropy": 2.19995211660862, "epoch": 4.236247828604516, "grad_norm": 0.029270397499203682, "learning_rate": 1.2020090036963272e-06, "loss": 0.0012936697341501713, "mean_token_accuracy": 1.0, "num_tokens": 19622266.0, "step": 5490 }, { "entropy": 2.2033345282077788, "epoch": 4.243968345879174, "grad_norm": 0.2233721911907196, "learning_rate": 1.1783585907092077e-06, "loss": 0.011895059794187545, "mean_token_accuracy": 0.9973854154348374, "num_tokens": 19661206.0, "step": 5500 }, { "epoch": 4.243968345879174, "eval_entropy": 2.1031606457699303, "eval_loss": 0.5105812549591064, "eval_mean_token_accuracy": 0.93590848367416, "eval_num_tokens": 19661206.0, "eval_runtime": 987.4206, "eval_samples_per_second": 7.748, "eval_steps_per_second": 0.969, "step": 5500 }, { "entropy": 2.166568320989609, "epoch": 4.251688863153832, "grad_norm": 0.06564086675643921, "learning_rate": 1.1549285909614138e-06, "loss": 0.0009026847779750824, "mean_token_accuracy": 1.0, "num_tokens": 19698305.0, "step": 5510 }, { "entropy": 2.2002768576145173, "epoch": 4.2594093804284885, "grad_norm": 0.12140869349241257, "learning_rate": 1.131719589863516e-06, "loss": 0.0019102182239294052, "mean_token_accuracy": 1.0, "num_tokens": 19734728.0, "step": 5520 }, { "entropy": 2.2461003422737122, "epoch": 4.267129897703146, "grad_norm": 0.06065747141838074, "learning_rate": 1.1087321673043184e-06, "loss": 0.010919121652841568, "mean_token_accuracy": 0.9966435179114341, "num_tokens": 19766601.0, "step": 5530 }, { "entropy": 2.21742702126503, "epoch": 4.274850414977804, "grad_norm": 0.31923985481262207, "learning_rate": 1.0859668976363802e-06, "loss": 0.004073232784867287, "mean_token_accuracy": 0.9993055552244187, "num_tokens": 19799159.0, "step": 5540 }, { "entropy": 2.195229309797287, "epoch": 4.282570932252461, "grad_norm": 0.03684071823954582, "learning_rate": 1.063424349661647e-06, "loss": 0.0008944393135607243, "mean_token_accuracy": 1.0, "num_tokens": 19833600.0, "step": 5550 }, { "entropy": 2.204106843471527, "epoch": 4.2902914495271185, "grad_norm": 0.054600995033979416, "learning_rate": 1.0411050866172512e-06, "loss": 0.013252517580986023, "mean_token_accuracy": 0.9959087640047073, "num_tokens": 19878221.0, "step": 5560 }, { "entropy": 2.2110326796770097, "epoch": 4.298011966801775, "grad_norm": 1.9496335983276367, "learning_rate": 1.0190096661614424e-06, "loss": 0.019130887091159822, "mean_token_accuracy": 0.9931336134672165, "num_tokens": 19907682.0, "step": 5570 }, { "entropy": 2.2047807425260544, "epoch": 4.305732484076433, "grad_norm": 0.13513988256454468, "learning_rate": 9.971386403596417e-07, "loss": 0.008160575479269027, "mean_token_accuracy": 0.9981125354766845, "num_tokens": 19942095.0, "step": 5580 }, { "entropy": 2.188329595327377, "epoch": 4.313453001351091, "grad_norm": 1.0191106796264648, "learning_rate": 9.75492555670655e-07, "loss": 0.0053262699395418165, "mean_token_accuracy": 0.9979999989271164, "num_tokens": 19984249.0, "step": 5590 }, { "entropy": 2.2830605089664457, "epoch": 4.321173518625748, "grad_norm": 0.13544659316539764, "learning_rate": 9.540719529330212e-07, "loss": 0.007930701971054077, "mean_token_accuracy": 0.9986089944839478, "num_tokens": 20016851.0, "step": 5600 }, { "entropy": 2.222521474957466, "epoch": 4.328894035900405, "grad_norm": 0.042033832520246506, "learning_rate": 9.328773673514979e-07, "loss": 0.009003970026969909, "mean_token_accuracy": 0.9984122976660729, "num_tokens": 20049220.0, "step": 5610 }, { "entropy": 2.2348962247371675, "epoch": 4.336614553175063, "grad_norm": 0.030303576961159706, "learning_rate": 9.119093284836855e-07, "loss": 0.008937902003526687, "mean_token_accuracy": 0.9973191484808922, "num_tokens": 20082476.0, "step": 5620 }, { "entropy": 2.1816387206315992, "epoch": 4.34433507044972, "grad_norm": 0.06456495821475983, "learning_rate": 8.911683602267973e-07, "loss": 0.012813526391983032, "mean_token_accuracy": 0.9954789370298386, "num_tokens": 20120303.0, "step": 5630 }, { "entropy": 2.1896758466959, "epoch": 4.352055587724378, "grad_norm": 0.10599888116121292, "learning_rate": 8.706549808045761e-07, "loss": 0.02139887660741806, "mean_token_accuracy": 0.9958462625741958, "num_tokens": 20156756.0, "step": 5640 }, { "entropy": 2.2255977392196655, "epoch": 4.359776104999035, "grad_norm": 0.27150967717170715, "learning_rate": 8.503697027543368e-07, "loss": 0.004352736845612526, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 20192296.0, "step": 5650 }, { "entropy": 2.22255657017231, "epoch": 4.367496622273692, "grad_norm": 0.11026787757873535, "learning_rate": 8.303130329141629e-07, "loss": 0.0016281832009553908, "mean_token_accuracy": 1.0, "num_tokens": 20226479.0, "step": 5660 }, { "entropy": 2.246255025267601, "epoch": 4.37521713954835, "grad_norm": 0.46250292658805847, "learning_rate": 8.104854724102495e-07, "loss": 0.011007238179445267, "mean_token_accuracy": 0.9953571423888207, "num_tokens": 20270096.0, "step": 5670 }, { "entropy": 2.1503868639469146, "epoch": 4.382937656823007, "grad_norm": 0.04919159784913063, "learning_rate": 7.908875166443741e-07, "loss": 0.004710817709565163, "mean_token_accuracy": 0.9985272988677025, "num_tokens": 20305299.0, "step": 5680 }, { "entropy": 2.2465969413518905, "epoch": 4.3906581740976645, "grad_norm": 0.17782022058963776, "learning_rate": 7.715196552815219e-07, "loss": 0.003526587411761284, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 20342660.0, "step": 5690 }, { "entropy": 2.197134277224541, "epoch": 4.398378691372322, "grad_norm": 0.2121172547340393, "learning_rate": 7.5238237223765e-07, "loss": 0.004980428516864777, "mean_token_accuracy": 0.9987499997019768, "num_tokens": 20375889.0, "step": 5700 }, { "entropy": 2.220217686891556, "epoch": 4.406099208646979, "grad_norm": 0.34957343339920044, "learning_rate": 7.334761456676021e-07, "loss": 0.004869958385825157, "mean_token_accuracy": 0.9981249988079071, "num_tokens": 20410586.0, "step": 5710 }, { "entropy": 2.244478589296341, "epoch": 4.413819725921637, "grad_norm": 0.10005008429288864, "learning_rate": 7.148014479531551e-07, "loss": 0.003159433975815773, "mean_token_accuracy": 0.998863635957241, "num_tokens": 20445560.0, "step": 5720 }, { "entropy": 2.2202999114990236, "epoch": 4.4215402431962945, "grad_norm": 0.05696292221546173, "learning_rate": 6.963587456912157e-07, "loss": 0.003368407115340233, "mean_token_accuracy": 0.99921875, "num_tokens": 20479977.0, "step": 5730 }, { "entropy": 2.2504466265439986, "epoch": 4.429260760470951, "grad_norm": 0.15865400433540344, "learning_rate": 6.781484996821697e-07, "loss": 0.003355879709124565, "mean_token_accuracy": 0.9971590921282768, "num_tokens": 20515597.0, "step": 5740 }, { "entropy": 2.2659272760152818, "epoch": 4.436981277745609, "grad_norm": 0.07037786394357681, "learning_rate": 6.601711649183628e-07, "loss": 0.0016187068074941635, "mean_token_accuracy": 1.0, "num_tokens": 20552502.0, "step": 5750 }, { "entropy": 2.3120163559913633, "epoch": 4.444701795020267, "grad_norm": 0.19772270321846008, "learning_rate": 6.42427190572732e-07, "loss": 0.0062440957874059675, "mean_token_accuracy": 0.9991666659712791, "num_tokens": 20586728.0, "step": 5760 }, { "entropy": 2.258056941628456, "epoch": 4.452422312294924, "grad_norm": 0.2031521052122116, "learning_rate": 6.249170199875832e-07, "loss": 0.006161601468920708, "mean_token_accuracy": 0.9992647051811219, "num_tokens": 20620711.0, "step": 5770 }, { "entropy": 2.259738165140152, "epoch": 4.460142829569581, "grad_norm": 0.02412845566868782, "learning_rate": 6.07641090663521e-07, "loss": 0.0021015578880906106, "mean_token_accuracy": 0.9991071432828903, "num_tokens": 20651230.0, "step": 5780 }, { "entropy": 2.247869810461998, "epoch": 4.467863346844238, "grad_norm": 0.11743807792663574, "learning_rate": 5.905998342485086e-07, "loss": 0.008077496290206909, "mean_token_accuracy": 0.998356680572033, "num_tokens": 20683130.0, "step": 5790 }, { "entropy": 2.249860090017319, "epoch": 4.475583864118896, "grad_norm": 4.197149276733398, "learning_rate": 5.737936765270813e-07, "loss": 0.011671672016382218, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 20722216.0, "step": 5800 }, { "entropy": 2.2498649269342423, "epoch": 4.483304381393554, "grad_norm": 0.130318745970726, "learning_rate": 5.572230374097231e-07, "loss": 0.004165193811058998, "mean_token_accuracy": 0.9988095238804817, "num_tokens": 20758556.0, "step": 5810 }, { "entropy": 2.172873851656914, "epoch": 4.49102489866821, "grad_norm": 0.1512354016304016, "learning_rate": 5.408883309223556e-07, "loss": 0.010192253440618516, "mean_token_accuracy": 0.997826087474823, "num_tokens": 20797172.0, "step": 5820 }, { "entropy": 2.2314586699008943, "epoch": 4.498745415942868, "grad_norm": 0.23559877276420593, "learning_rate": 5.247899651960064e-07, "loss": 0.009908857196569443, "mean_token_accuracy": 0.9950735285878182, "num_tokens": 20832728.0, "step": 5830 }, { "entropy": 2.219519907236099, "epoch": 4.506465933217526, "grad_norm": 0.054366808384656906, "learning_rate": 5.089283424566094e-07, "loss": 0.016809307038784027, "mean_token_accuracy": 0.9969444438815117, "num_tokens": 20868737.0, "step": 5840 }, { "entropy": 2.258474165201187, "epoch": 4.514186450492183, "grad_norm": 0.20110376179218292, "learning_rate": 4.933038590149508e-07, "loss": 0.0023351117968559267, "mean_token_accuracy": 1.0, "num_tokens": 20904237.0, "step": 5850 }, { "entropy": 2.2490910053253175, "epoch": 4.52190696776684, "grad_norm": 0.06749659776687622, "learning_rate": 4.77916905256769e-07, "loss": 0.0015241201967000962, "mean_token_accuracy": 1.0, "num_tokens": 20938015.0, "step": 5860 }, { "entropy": 2.2541816264390944, "epoch": 4.529627485041498, "grad_norm": 0.07041777670383453, "learning_rate": 4.627678656330026e-07, "loss": 0.003881530836224556, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 20971752.0, "step": 5870 }, { "entropy": 2.225889188051224, "epoch": 4.537348002316155, "grad_norm": 0.04327480122447014, "learning_rate": 4.478571186501857e-07, "loss": 0.013946136832237244, "mean_token_accuracy": 0.9973797842860221, "num_tokens": 21005854.0, "step": 5880 }, { "entropy": 2.2675861060619353, "epoch": 4.545068519590813, "grad_norm": 1.7059868574142456, "learning_rate": 4.3318503686098577e-07, "loss": 0.0015708981081843376, "mean_token_accuracy": 1.0, "num_tokens": 21041256.0, "step": 5890 }, { "entropy": 2.2442140936851502, "epoch": 4.5527890368654695, "grad_norm": 0.06668271869421005, "learning_rate": 4.1875198685489613e-07, "loss": 0.0081165112555027, "mean_token_accuracy": 0.9988095238804817, "num_tokens": 21073826.0, "step": 5900 }, { "entropy": 2.238309305906296, "epoch": 4.560509554140127, "grad_norm": 0.022307725623250008, "learning_rate": 4.04558329249084e-07, "loss": 0.006697001308202744, "mean_token_accuracy": 0.998863635957241, "num_tokens": 21110342.0, "step": 5910 }, { "entropy": 2.200860995054245, "epoch": 4.568230071414785, "grad_norm": 0.17545939981937408, "learning_rate": 3.906044186793689e-07, "loss": 0.004396386817097664, "mean_token_accuracy": 0.9992647051811219, "num_tokens": 21147596.0, "step": 5920 }, { "entropy": 2.24030060172081, "epoch": 4.575950588689442, "grad_norm": 0.06349517405033112, "learning_rate": 3.768906037913689e-07, "loss": 0.010619433969259262, "mean_token_accuracy": 0.9960175439715385, "num_tokens": 21181840.0, "step": 5930 }, { "entropy": 2.1731992214918137, "epoch": 4.5836711059640995, "grad_norm": 0.07084771990776062, "learning_rate": 3.6341722723179264e-07, "loss": 0.007943939417600632, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 21215224.0, "step": 5940 }, { "entropy": 2.2863466501235963, "epoch": 4.591391623238757, "grad_norm": 0.044842347502708435, "learning_rate": 3.501846256398689e-07, "loss": 0.013139717280864716, "mean_token_accuracy": 0.9968560606241226, "num_tokens": 21248186.0, "step": 5950 }, { "entropy": 2.208678925037384, "epoch": 4.599112140513414, "grad_norm": 0.14837071299552917, "learning_rate": 3.371931296389397e-07, "loss": 0.0007539391051977872, "mean_token_accuracy": 1.0, "num_tokens": 21282267.0, "step": 5960 }, { "entropy": 2.2153519988059998, "epoch": 4.606832657788072, "grad_norm": 2.5055654048919678, "learning_rate": 3.2444306382820256e-07, "loss": 0.03023122251033783, "mean_token_accuracy": 0.9947824060916901, "num_tokens": 21315323.0, "step": 5970 }, { "entropy": 2.2592311084270476, "epoch": 4.6145531750627296, "grad_norm": 0.1265610009431839, "learning_rate": 3.119347467745992e-07, "loss": 0.001410143543034792, "mean_token_accuracy": 1.0, "num_tokens": 21353041.0, "step": 5980 }, { "entropy": 2.2527008682489393, "epoch": 4.622273692337386, "grad_norm": 0.589449405670166, "learning_rate": 2.99668491004852e-07, "loss": 0.005680891871452332, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 21386776.0, "step": 5990 }, { "entropy": 2.2103109836578367, "epoch": 4.629994209612044, "grad_norm": 1.9735628366470337, "learning_rate": 2.876446029976554e-07, "loss": 0.005637718737125397, "mean_token_accuracy": 0.9986278191208839, "num_tokens": 21422729.0, "step": 6000 }, { "epoch": 4.629994209612044, "eval_entropy": 2.1154677377100897, "eval_loss": 0.5169965028762817, "eval_mean_token_accuracy": 0.9358510735640332, "eval_num_tokens": 21422729.0, "eval_runtime": 988.4165, "eval_samples_per_second": 7.741, "eval_steps_per_second": 0.968, "step": 6000 }, { "entropy": 2.227972522377968, "epoch": 4.637714726886701, "grad_norm": 1.7792558670043945, "learning_rate": 2.7586338317602713e-07, "loss": 0.006323382258415222, "mean_token_accuracy": 0.99921875, "num_tokens": 21457481.0, "step": 6010 }, { "entropy": 2.286092558503151, "epoch": 4.645435244161359, "grad_norm": 0.7590512037277222, "learning_rate": 2.6432512589979144e-07, "loss": 0.006863045692443848, "mean_token_accuracy": 0.998242424428463, "num_tokens": 21491657.0, "step": 6020 }, { "entropy": 2.1695028364658357, "epoch": 4.653155761436016, "grad_norm": 3.8523592948913574, "learning_rate": 2.530301194582296e-07, "loss": 0.005904960632324219, "mean_token_accuracy": 0.9977777764201164, "num_tokens": 21531112.0, "step": 6030 }, { "entropy": 2.2056106328964233, "epoch": 4.660876278710674, "grad_norm": 0.10862927883863449, "learning_rate": 2.41978646062877e-07, "loss": 0.0022114580497145653, "mean_token_accuracy": 1.0, "num_tokens": 21567253.0, "step": 6040 }, { "entropy": 2.2164981573820115, "epoch": 4.668596795985331, "grad_norm": 0.3193495273590088, "learning_rate": 2.3117098184046837e-07, "loss": 0.007381512224674225, "mean_token_accuracy": 0.9967272713780403, "num_tokens": 21608628.0, "step": 6050 }, { "entropy": 2.1946250647306442, "epoch": 4.676317313259989, "grad_norm": 0.02586934342980385, "learning_rate": 2.206073968260436e-07, "loss": 0.006831285357475281, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 21644056.0, "step": 6060 }, { "entropy": 2.2137088149785997, "epoch": 4.6840378305346455, "grad_norm": 0.05132552608847618, "learning_rate": 2.1028815495619526e-07, "loss": 0.0044960763305425646, "mean_token_accuracy": 0.999074074625969, "num_tokens": 21681633.0, "step": 6070 }, { "entropy": 2.2435118734836577, "epoch": 4.691758347809303, "grad_norm": 0.0880841463804245, "learning_rate": 2.002135140624828e-07, "loss": 0.010966504365205765, "mean_token_accuracy": 0.9978095233440399, "num_tokens": 21720250.0, "step": 6080 }, { "entropy": 2.2539133608341215, "epoch": 4.699478865083961, "grad_norm": 0.03336416557431221, "learning_rate": 1.9038372586497766e-07, "loss": 0.0027033800259232523, "mean_token_accuracy": 0.9980000004172325, "num_tokens": 21756172.0, "step": 6090 }, { "entropy": 2.171377721428871, "epoch": 4.707199382358618, "grad_norm": 0.02603979967534542, "learning_rate": 1.8079903596598504e-07, "loss": 0.015214832127094268, "mean_token_accuracy": 0.9969905868172646, "num_tokens": 21797144.0, "step": 6100 }, { "entropy": 2.2282418727874758, "epoch": 4.7149198996332755, "grad_norm": 0.02482684515416622, "learning_rate": 1.714596838439031e-07, "loss": 0.0006937965285032987, "mean_token_accuracy": 1.0, "num_tokens": 21833771.0, "step": 6110 }, { "entropy": 2.271139058470726, "epoch": 4.722640416907932, "grad_norm": 0.041452571749687195, "learning_rate": 1.6236590284723796e-07, "loss": 0.0011482076719403268, "mean_token_accuracy": 1.0, "num_tokens": 21866597.0, "step": 6120 }, { "entropy": 2.179414650797844, "epoch": 4.73036093418259, "grad_norm": 0.09968980401754379, "learning_rate": 1.535179201887782e-07, "loss": 0.008539145439863205, "mean_token_accuracy": 0.9981481477618217, "num_tokens": 21901353.0, "step": 6130 }, { "entropy": 2.2338360488414764, "epoch": 4.738081451457248, "grad_norm": 3.942858934402466, "learning_rate": 1.4491595693991056e-07, "loss": 0.008534059673547745, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 21936884.0, "step": 6140 }, { "entropy": 2.24261232316494, "epoch": 4.7458019687319055, "grad_norm": 0.16906267404556274, "learning_rate": 1.3656022802510326e-07, "loss": 0.018931737542152403, "mean_token_accuracy": 0.9983006909489631, "num_tokens": 21971041.0, "step": 6150 }, { "entropy": 2.305382552742958, "epoch": 4.753522486006562, "grad_norm": 0.04022558033466339, "learning_rate": 1.2845094221653475e-07, "loss": 0.006191138923168182, "mean_token_accuracy": 0.9983004376292228, "num_tokens": 22001583.0, "step": 6160 }, { "entropy": 2.304952707886696, "epoch": 4.76124300328122, "grad_norm": 0.0716034322977066, "learning_rate": 1.2058830212887117e-07, "loss": 0.014426815509796142, "mean_token_accuracy": 0.9962768808007241, "num_tokens": 22036327.0, "step": 6170 }, { "entropy": 2.2286325991153717, "epoch": 4.768963520555877, "grad_norm": 0.08237482607364655, "learning_rate": 1.129725042142138e-07, "loss": 0.006697164475917816, "mean_token_accuracy": 0.9982928246259689, "num_tokens": 22071393.0, "step": 6180 }, { "entropy": 2.2289715498685836, "epoch": 4.776684037830535, "grad_norm": 0.09096929430961609, "learning_rate": 1.0560373875718177e-07, "loss": 0.0037596296519041062, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 22105599.0, "step": 6190 }, { "entropy": 2.226081871986389, "epoch": 4.784404555105192, "grad_norm": 1.364410400390625, "learning_rate": 9.848218987016267e-08, "loss": 0.004093809798359871, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 22144292.0, "step": 6200 }, { "entropy": 2.3211822539567946, "epoch": 4.792125072379849, "grad_norm": 0.08333883434534073, "learning_rate": 9.160803548871277e-08, "loss": 0.0013872952200472354, "mean_token_accuracy": 1.0, "num_tokens": 22173297.0, "step": 6210 }, { "entropy": 2.181807669997215, "epoch": 4.799845589654507, "grad_norm": 0.08239463716745377, "learning_rate": 8.498144736710734e-08, "loss": 0.024519316852092743, "mean_token_accuracy": 0.99544607847929, "num_tokens": 22213011.0, "step": 6220 }, { "entropy": 2.1619095504283905, "epoch": 4.807566106929165, "grad_norm": 0.39841601252555847, "learning_rate": 7.860259107405288e-08, "loss": 0.0010081185027956963, "mean_token_accuracy": 1.0, "num_tokens": 22247236.0, "step": 6230 }, { "entropy": 2.2368269830942156, "epoch": 4.8152866242038215, "grad_norm": 0.07764973491430283, "learning_rate": 7.24716259885483e-08, "loss": 0.026798546314239502, "mean_token_accuracy": 0.9924574360251427, "num_tokens": 22288494.0, "step": 6240 }, { "entropy": 2.245153045654297, "epoch": 4.823007141478479, "grad_norm": 0.26748162508010864, "learning_rate": 6.658870529590355e-08, "loss": 0.00493730865418911, "mean_token_accuracy": 0.999074074625969, "num_tokens": 22326075.0, "step": 6250 }, { "entropy": 2.219322806596756, "epoch": 4.830727658753137, "grad_norm": 0.04285896196961403, "learning_rate": 6.095397598391284e-08, "loss": 0.008515120297670365, "mean_token_accuracy": 0.9957702025771141, "num_tokens": 22368028.0, "step": 6260 }, { "entropy": 2.247615697979927, "epoch": 4.838448176027794, "grad_norm": 1.9107056856155396, "learning_rate": 5.556757883917851e-08, "loss": 0.0032505668699741364, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 22406097.0, "step": 6270 }, { "entropy": 2.205378809571266, "epoch": 4.8461686933024515, "grad_norm": 2.558126211166382, "learning_rate": 5.0429648443601765e-08, "loss": 0.01382438838481903, "mean_token_accuracy": 0.9963152587413788, "num_tokens": 22447091.0, "step": 6280 }, { "entropy": 2.1460685402154924, "epoch": 4.853889210577108, "grad_norm": 0.6871592998504639, "learning_rate": 4.55403131710086e-08, "loss": 0.0034082386642694472, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 22482163.0, "step": 6290 }, { "entropy": 2.1781392335891723, "epoch": 4.861609727851766, "grad_norm": 0.03307396173477173, "learning_rate": 4.089969518395243e-08, "loss": 0.0009966903366148473, "mean_token_accuracy": 1.0, "num_tokens": 22521045.0, "step": 6300 }, { "entropy": 2.276013654470444, "epoch": 4.869330245126424, "grad_norm": 0.35160934925079346, "learning_rate": 3.650791043065427e-08, "loss": 0.0020426543429493903, "mean_token_accuracy": 0.999074074625969, "num_tokens": 22554853.0, "step": 6310 }, { "entropy": 2.253162696957588, "epoch": 4.877050762401081, "grad_norm": 0.1488099992275238, "learning_rate": 3.236506864211286e-08, "loss": 0.007266855984926224, "mean_token_accuracy": 0.9969222694635391, "num_tokens": 22590884.0, "step": 6320 }, { "entropy": 2.27145434319973, "epoch": 4.884771279675738, "grad_norm": 3.7629544734954834, "learning_rate": 2.847127332935573e-08, "loss": 0.01586032509803772, "mean_token_accuracy": 0.995819628238678, "num_tokens": 22623671.0, "step": 6330 }, { "entropy": 2.236271634697914, "epoch": 4.892491796950396, "grad_norm": 0.6222274303436279, "learning_rate": 2.482662178085682e-08, "loss": 0.012338303774595261, "mean_token_accuracy": 0.9965226069092751, "num_tokens": 22658331.0, "step": 6340 }, { "entropy": 2.197663214802742, "epoch": 4.900212314225053, "grad_norm": 0.11816233396530151, "learning_rate": 2.143120506010843e-08, "loss": 0.008864825218915939, "mean_token_accuracy": 0.9983317211270333, "num_tokens": 22697599.0, "step": 6350 }, { "entropy": 2.2309891253709795, "epoch": 4.907932831499711, "grad_norm": 1.5716471672058105, "learning_rate": 1.8285108003338603e-08, "loss": 0.007599858939647675, "mean_token_accuracy": 0.9981518805027008, "num_tokens": 22730261.0, "step": 6360 }, { "entropy": 2.225965863466263, "epoch": 4.915653348774368, "grad_norm": 0.03380768746137619, "learning_rate": 1.538840921739837e-08, "loss": 0.0017374027520418167, "mean_token_accuracy": 1.0, "num_tokens": 22768240.0, "step": 6370 }, { "entropy": 2.2355996876955033, "epoch": 4.923373866049025, "grad_norm": 0.04010441154241562, "learning_rate": 1.2741181077793319e-08, "loss": 0.0016989083960652351, "mean_token_accuracy": 1.0, "num_tokens": 22803213.0, "step": 6380 }, { "entropy": 2.2543944001197813, "epoch": 4.931094383323683, "grad_norm": 0.22062981128692627, "learning_rate": 1.0343489726878375e-08, "loss": 0.008954495936632157, "mean_token_accuracy": 0.9964285716414452, "num_tokens": 22833895.0, "step": 6390 }, { "entropy": 2.2120563268661497, "epoch": 4.93881490059834, "grad_norm": 0.09145352989435196, "learning_rate": 8.195395072201352e-09, "loss": 0.0006910903844982386, "mean_token_accuracy": 1.0, "num_tokens": 22872270.0, "step": 6400 }, { "entropy": 2.263408675789833, "epoch": 4.946535417872997, "grad_norm": 0.17131362855434418, "learning_rate": 6.2969507850108025e-09, "loss": 0.007691174000501633, "mean_token_accuracy": 0.998504464328289, "num_tokens": 22906940.0, "step": 6410 }, { "entropy": 2.201318547129631, "epoch": 4.954255935147655, "grad_norm": 2.934361696243286, "learning_rate": 4.648204298912662e-09, "loss": 0.005105702206492424, "mean_token_accuracy": 0.9974216759204865, "num_tokens": 22943748.0, "step": 6420 }, { "entropy": 2.2332019776105883, "epoch": 4.961976452422312, "grad_norm": 0.023339014500379562, "learning_rate": 3.249196808683408e-09, "loss": 0.008095689117908478, "mean_token_accuracy": 0.9983243241906166, "num_tokens": 22977903.0, "step": 6430 }, { "entropy": 2.242179808020592, "epoch": 4.96969696969697, "grad_norm": 0.043394219130277634, "learning_rate": 2.0999632692431104e-09, "loss": 0.0013438466936349868, "mean_token_accuracy": 1.0, "num_tokens": 23011768.0, "step": 6440 }, { "entropy": 2.2419181168079376, "epoch": 4.9774174869716274, "grad_norm": 0.046509750187397, "learning_rate": 1.2005323947816839e-09, "loss": 0.008913324773311615, "mean_token_accuracy": 0.9981812179088593, "num_tokens": 23047974.0, "step": 6450 }, { "entropy": 2.259080970287323, "epoch": 4.985138004246284, "grad_norm": 2.01216197013855, "learning_rate": 5.509266580416839e-10, "loss": 0.0047379877418279644, "mean_token_accuracy": 0.9958045974373817, "num_tokens": 23081068.0, "step": 6460 }, { "entropy": 2.214487534761429, "epoch": 4.992858521520942, "grad_norm": 1.7724125385284424, "learning_rate": 1.5116228975653457e-10, "loss": 0.007440639287233352, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 23120802.0, "step": 6470 }, { "entropy": 2.282172141848384, "epoch": 5.0, "grad_norm": 0.03656819462776184, "learning_rate": 1.2492782430761908e-12, "loss": 0.006634878367185593, "mean_token_accuracy": 0.9977477482847266, "num_tokens": 23154615.0, "step": 6480 }, { "epoch": 5.0, "eval_entropy": 2.1159368567830468, "eval_loss": 0.517891526222229, "eval_mean_token_accuracy": 0.9358265156407092, "eval_num_tokens": 23154615.0, "eval_runtime": 988.2948, "eval_samples_per_second": 7.742, "eval_steps_per_second": 0.968, "step": 6480 }, { "epoch": 5.0, "step": 6480, "total_flos": 1.3561958615698637e+18, "train_loss": 0.07709400485848927, "train_runtime": 23143.6512, "train_samples_per_second": 2.239, "train_steps_per_second": 0.28 } ], "logging_steps": 10, "max_steps": 6480, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.3561958615698637e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }