{ "best_global_step": 1000, "best_metric": 0.9796417355537415, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_shared-generalist_fallback_ffn_only_5ep_eval500/checkpoint-1000", "epoch": 5.0, "eval_steps": 500, "global_step": 6925, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.3488953799009322, "epoch": 0.007224128589488893, "grad_norm": 12.38263988494873, "learning_rate": 8.653846153846154e-07, "loss": 1.2809778213500977, "mean_token_accuracy": 0.7182683728635311, "num_tokens": 29664.0, "step": 10 }, { "entropy": 2.2779021948575973, "epoch": 0.014448257178977787, "grad_norm": 6.46359395980835, "learning_rate": 1.826923076923077e-06, "loss": 1.4152549743652343, "mean_token_accuracy": 0.7039315856993198, "num_tokens": 65995.0, "step": 20 }, { "entropy": 2.2851940393447876, "epoch": 0.021672385768466678, "grad_norm": 7.5366010665893555, "learning_rate": 2.7884615384615386e-06, "loss": 1.3896544456481934, "mean_token_accuracy": 0.7117640927433968, "num_tokens": 99531.0, "step": 30 }, { "entropy": 2.295980241894722, "epoch": 0.028896514357955573, "grad_norm": 3.707631826400757, "learning_rate": 3.7500000000000005e-06, "loss": 1.3731188774108887, "mean_token_accuracy": 0.7028925865888596, "num_tokens": 135081.0, "step": 40 }, { "entropy": 2.38641714155674, "epoch": 0.036120642947444465, "grad_norm": 4.440042495727539, "learning_rate": 4.711538461538462e-06, "loss": 1.3516225814819336, "mean_token_accuracy": 0.704179621487856, "num_tokens": 168474.0, "step": 50 }, { "entropy": 2.3031668663024902, "epoch": 0.043344771536933356, "grad_norm": 3.3444595336914062, "learning_rate": 5.6730769230769235e-06, "loss": 0.7931435108184814, "mean_token_accuracy": 0.8210788562893867, "num_tokens": 199656.0, "step": 60 }, { "entropy": 2.2916590481996537, "epoch": 0.05056890012642225, "grad_norm": 3.439544439315796, "learning_rate": 6.6346153846153846e-06, "loss": 0.8380290985107421, "mean_token_accuracy": 0.8113071389496327, "num_tokens": 237137.0, "step": 70 }, { "entropy": 2.3342412978410723, "epoch": 0.057793028715911146, "grad_norm": 3.820638656616211, "learning_rate": 7.5961538461538465e-06, "loss": 0.5829432487487793, "mean_token_accuracy": 0.8551584139466286, "num_tokens": 269916.0, "step": 80 }, { "entropy": 2.3470212489366533, "epoch": 0.06501715730540003, "grad_norm": 5.16990852355957, "learning_rate": 8.557692307692308e-06, "loss": 0.7105390548706054, "mean_token_accuracy": 0.8280642315745353, "num_tokens": 302577.0, "step": 90 }, { "entropy": 2.3362986624240873, "epoch": 0.07224128589488893, "grad_norm": 5.412623405456543, "learning_rate": 9.51923076923077e-06, "loss": 0.5351422786712646, "mean_token_accuracy": 0.8582781746983528, "num_tokens": 333925.0, "step": 100 }, { "entropy": 2.3203985303640366, "epoch": 0.07946541448437783, "grad_norm": 5.008820056915283, "learning_rate": 1.0480769230769232e-05, "loss": 0.42360854148864746, "mean_token_accuracy": 0.8884407944977284, "num_tokens": 366680.0, "step": 110 }, { "entropy": 2.3535674154758452, "epoch": 0.08668954307386671, "grad_norm": 3.0379772186279297, "learning_rate": 1.1442307692307693e-05, "loss": 0.41391968727111816, "mean_token_accuracy": 0.9000807195901871, "num_tokens": 397501.0, "step": 120 }, { "entropy": 2.324735555052757, "epoch": 0.09391367166335561, "grad_norm": 3.118257761001587, "learning_rate": 1.2403846153846156e-05, "loss": 0.3381591558456421, "mean_token_accuracy": 0.9182203456759452, "num_tokens": 429067.0, "step": 130 }, { "entropy": 2.3521973222494124, "epoch": 0.1011378002528445, "grad_norm": 4.433260917663574, "learning_rate": 1.3365384615384615e-05, "loss": 0.3163116931915283, "mean_token_accuracy": 0.9162691205739975, "num_tokens": 458216.0, "step": 140 }, { "entropy": 2.2347404181957247, "epoch": 0.1083619288423334, "grad_norm": 1.7790768146514893, "learning_rate": 1.4326923076923078e-05, "loss": 0.19349080324172974, "mean_token_accuracy": 0.9514048635959625, "num_tokens": 495714.0, "step": 150 }, { "entropy": 2.21967813372612, "epoch": 0.11558605743182229, "grad_norm": 5.751720905303955, "learning_rate": 1.528846153846154e-05, "loss": 0.3013446569442749, "mean_token_accuracy": 0.927564126253128, "num_tokens": 532706.0, "step": 160 }, { "entropy": 2.209682157635689, "epoch": 0.12281018602131118, "grad_norm": 4.959426403045654, "learning_rate": 1.6250000000000002e-05, "loss": 0.15157370567321776, "mean_token_accuracy": 0.9651991903781891, "num_tokens": 569522.0, "step": 170 }, { "entropy": 2.2797712594270707, "epoch": 0.13003431461080006, "grad_norm": 5.981288433074951, "learning_rate": 1.7211538461538465e-05, "loss": 0.19515550136566162, "mean_token_accuracy": 0.9430472493171692, "num_tokens": 600249.0, "step": 180 }, { "entropy": 2.282535618543625, "epoch": 0.13725844320028896, "grad_norm": 2.61159348487854, "learning_rate": 1.8173076923076924e-05, "loss": 0.12393771409988404, "mean_token_accuracy": 0.9631432116031646, "num_tokens": 633357.0, "step": 190 }, { "entropy": 2.1924006402492524, "epoch": 0.14448257178977786, "grad_norm": 2.5875096321105957, "learning_rate": 1.9134615384615387e-05, "loss": 0.1760977864265442, "mean_token_accuracy": 0.9507284834980965, "num_tokens": 669069.0, "step": 200 }, { "entropy": 2.210735687613487, "epoch": 0.15170670037926676, "grad_norm": 1.9026196002960205, "learning_rate": 1.9999998906247536e-05, "loss": 0.13357192277908325, "mean_token_accuracy": 0.9658363074064255, "num_tokens": 702442.0, "step": 210 }, { "entropy": 2.1797422796487806, "epoch": 0.15893082896875566, "grad_norm": 7.958958148956299, "learning_rate": 1.9999867656241115e-05, "loss": 0.1266096353530884, "mean_token_accuracy": 0.960417041182518, "num_tokens": 734380.0, "step": 220 }, { "entropy": 2.2051376909017564, "epoch": 0.16615495755824453, "grad_norm": 6.823901176452637, "learning_rate": 1.999951765903129e-05, "loss": 0.1252610445022583, "mean_token_accuracy": 0.9647611796855926, "num_tokens": 771815.0, "step": 230 }, { "entropy": 2.2458199709653854, "epoch": 0.17337908614773342, "grad_norm": 4.231349945068359, "learning_rate": 1.9998948922274254e-05, "loss": 0.19357305765151978, "mean_token_accuracy": 0.9423901841044426, "num_tokens": 801392.0, "step": 240 }, { "entropy": 2.2267865359783174, "epoch": 0.18060321473722232, "grad_norm": 4.5076093673706055, "learning_rate": 1.9998161458411122e-05, "loss": 0.1421981930732727, "mean_token_accuracy": 0.9549527898430824, "num_tokens": 835126.0, "step": 250 }, { "entropy": 2.2681135296821595, "epoch": 0.18782734332671122, "grad_norm": 4.918508529663086, "learning_rate": 1.9997155284667678e-05, "loss": 0.11410770416259766, "mean_token_accuracy": 0.9669175207614898, "num_tokens": 865543.0, "step": 260 }, { "entropy": 2.1435286939144134, "epoch": 0.19505147191620012, "grad_norm": 3.8047282695770264, "learning_rate": 1.9995930423053985e-05, "loss": 0.16196959018707274, "mean_token_accuracy": 0.9546934857964515, "num_tokens": 905535.0, "step": 270 }, { "entropy": 2.221021184325218, "epoch": 0.202275600505689, "grad_norm": 4.958682060241699, "learning_rate": 1.9994486900363898e-05, "loss": 0.15060049295425415, "mean_token_accuracy": 0.9543882220983505, "num_tokens": 942677.0, "step": 280 }, { "entropy": 2.188411471247673, "epoch": 0.2094997290951779, "grad_norm": 2.7439119815826416, "learning_rate": 1.9992824748174494e-05, "loss": 0.09933483004570007, "mean_token_accuracy": 0.969770023226738, "num_tokens": 976377.0, "step": 290 }, { "entropy": 2.2444622576236726, "epoch": 0.2167238576846668, "grad_norm": 5.669027328491211, "learning_rate": 1.9990944002845366e-05, "loss": 0.08762626647949219, "mean_token_accuracy": 0.9665105521678925, "num_tokens": 1008228.0, "step": 300 }, { "entropy": 2.157886192202568, "epoch": 0.22394798627415569, "grad_norm": 3.5573644638061523, "learning_rate": 1.9988844705517843e-05, "loss": 0.07699022889137268, "mean_token_accuracy": 0.9739585548639298, "num_tokens": 1038551.0, "step": 310 }, { "entropy": 2.131389778852463, "epoch": 0.23117211486364458, "grad_norm": 1.3280601501464844, "learning_rate": 1.9986526902114064e-05, "loss": 0.09419863224029541, "mean_token_accuracy": 0.9755162551999093, "num_tokens": 1071092.0, "step": 320 }, { "entropy": 2.16340401917696, "epoch": 0.23839624345313346, "grad_norm": 0.6447048783302307, "learning_rate": 1.9983990643336007e-05, "loss": 0.10957064628601074, "mean_token_accuracy": 0.9793596610426902, "num_tokens": 1110011.0, "step": 330 }, { "entropy": 2.1304306954145433, "epoch": 0.24562037204262235, "grad_norm": 5.598320007324219, "learning_rate": 1.9981235984664363e-05, "loss": 0.07113409042358398, "mean_token_accuracy": 0.9785689562559128, "num_tokens": 1145119.0, "step": 340 }, { "entropy": 2.156084191799164, "epoch": 0.2528445006321112, "grad_norm": 0.9510290026664734, "learning_rate": 1.9978262986357305e-05, "loss": 0.1030649185180664, "mean_token_accuracy": 0.9748681783676147, "num_tokens": 1178189.0, "step": 350 }, { "entropy": 2.195864510536194, "epoch": 0.2600686292216001, "grad_norm": 4.438415050506592, "learning_rate": 1.997507171344921e-05, "loss": 0.07983499765396118, "mean_token_accuracy": 0.9773692816495896, "num_tokens": 1211561.0, "step": 360 }, { "entropy": 2.2007741034030914, "epoch": 0.267292757811089, "grad_norm": 0.4064837396144867, "learning_rate": 1.99716622357492e-05, "loss": 0.060518258810043336, "mean_token_accuracy": 0.9889198035001755, "num_tokens": 1240872.0, "step": 370 }, { "entropy": 2.1124327674508097, "epoch": 0.2745168864005779, "grad_norm": 1.925007939338684, "learning_rate": 1.9968034627839637e-05, "loss": 0.07150581479072571, "mean_token_accuracy": 0.9760589763522148, "num_tokens": 1276234.0, "step": 380 }, { "entropy": 2.139196202158928, "epoch": 0.2817410149900668, "grad_norm": 2.570542335510254, "learning_rate": 1.996418896907448e-05, "loss": 0.08276339173316956, "mean_token_accuracy": 0.9852717742323875, "num_tokens": 1309890.0, "step": 390 }, { "entropy": 2.1617587089538572, "epoch": 0.2889651435795557, "grad_norm": 4.684780120849609, "learning_rate": 1.9960125343577547e-05, "loss": 0.06835437417030335, "mean_token_accuracy": 0.9801086381077766, "num_tokens": 1343597.0, "step": 400 }, { "entropy": 2.117720311880112, "epoch": 0.2961892721690446, "grad_norm": 0.42047184705734253, "learning_rate": 1.995584384024069e-05, "loss": 0.06545560359954834, "mean_token_accuracy": 0.9876575991511345, "num_tokens": 1377821.0, "step": 410 }, { "entropy": 2.1088694870471953, "epoch": 0.3034134007585335, "grad_norm": 3.0441112518310547, "learning_rate": 1.995134455272183e-05, "loss": 0.04034406542778015, "mean_token_accuracy": 0.9879964560270309, "num_tokens": 1412577.0, "step": 420 }, { "entropy": 2.1040756702423096, "epoch": 0.3106375293480224, "grad_norm": 1.2212275266647339, "learning_rate": 1.994662757944293e-05, "loss": 0.05455552339553833, "mean_token_accuracy": 0.981954412162304, "num_tokens": 1449199.0, "step": 430 }, { "entropy": 2.1250744581222536, "epoch": 0.3178616579375113, "grad_norm": 1.0598998069763184, "learning_rate": 1.9941693023587835e-05, "loss": 0.06651412844657897, "mean_token_accuracy": 0.9793136209249497, "num_tokens": 1481363.0, "step": 440 }, { "entropy": 2.1289766818284988, "epoch": 0.32508578652700015, "grad_norm": 1.3468321561813354, "learning_rate": 1.9936540993099992e-05, "loss": 0.02549194097518921, "mean_token_accuracy": 0.9882893145084382, "num_tokens": 1511239.0, "step": 450 }, { "entropy": 2.148378947377205, "epoch": 0.33230991511648905, "grad_norm": 0.3286466896533966, "learning_rate": 1.9931171600680127e-05, "loss": 0.05644198060035706, "mean_token_accuracy": 0.9872142806649208, "num_tokens": 1547292.0, "step": 460 }, { "entropy": 2.106003427505493, "epoch": 0.33953404370597795, "grad_norm": 0.10986531525850296, "learning_rate": 1.992558496378374e-05, "loss": 0.08314967751502991, "mean_token_accuracy": 0.9774487376213074, "num_tokens": 1581706.0, "step": 470 }, { "entropy": 2.180526411533356, "epoch": 0.34675817229546685, "grad_norm": 4.3229169845581055, "learning_rate": 1.991978120461858e-05, "loss": 0.055954158306121826, "mean_token_accuracy": 0.9919549554586411, "num_tokens": 1612881.0, "step": 480 }, { "entropy": 2.1669235289096833, "epoch": 0.35398230088495575, "grad_norm": 1.8098896741867065, "learning_rate": 1.9913760450141934e-05, "loss": 0.079369056224823, "mean_token_accuracy": 0.9778457656502724, "num_tokens": 1642879.0, "step": 490 }, { "entropy": 2.1620357751846315, "epoch": 0.36120642947444465, "grad_norm": 0.16477970778942108, "learning_rate": 1.9907522832057858e-05, "loss": 0.06561388969421386, "mean_token_accuracy": 0.9901054993271827, "num_tokens": 1676452.0, "step": 500 }, { "epoch": 0.36120642947444465, "eval_entropy": 2.0017294202354137, "eval_loss": 1.0213959217071533, "eval_mean_token_accuracy": 0.843235912928387, "eval_num_tokens": 1676452.0, "eval_runtime": 1007.0825, "eval_samples_per_second": 7.597, "eval_steps_per_second": 0.95, "step": 500 }, { "entropy": 2.121370476484299, "epoch": 0.36843055806393354, "grad_norm": 5.161382675170898, "learning_rate": 1.9901068486814315e-05, "loss": 0.09131132364273072, "mean_token_accuracy": 0.9809340670704841, "num_tokens": 1711347.0, "step": 510 }, { "entropy": 2.1376258194446565, "epoch": 0.37565468665342244, "grad_norm": 0.20808692276477814, "learning_rate": 1.9894397555600168e-05, "loss": 0.05019047260284424, "mean_token_accuracy": 0.9852594628930091, "num_tokens": 1748117.0, "step": 520 }, { "entropy": 2.1469887882471084, "epoch": 0.38287881524291134, "grad_norm": 0.4585625231266022, "learning_rate": 1.9887510184342108e-05, "loss": 0.021144218742847443, "mean_token_accuracy": 0.9943749994039536, "num_tokens": 1779161.0, "step": 530 }, { "entropy": 2.1128806680440904, "epoch": 0.39010294383240024, "grad_norm": 0.17531993985176086, "learning_rate": 1.9880406523701444e-05, "loss": 0.037897059321403505, "mean_token_accuracy": 0.9935355380177497, "num_tokens": 1817476.0, "step": 540 }, { "entropy": 2.1039916306734083, "epoch": 0.3973270724218891, "grad_norm": 12.807392120361328, "learning_rate": 1.9873086729070822e-05, "loss": 0.04961663484573364, "mean_token_accuracy": 0.9899179771542549, "num_tokens": 1850699.0, "step": 550 }, { "entropy": 2.08780357837677, "epoch": 0.404551201011378, "grad_norm": 1.5689797401428223, "learning_rate": 1.9865550960570824e-05, "loss": 0.09309354424476624, "mean_token_accuracy": 0.9854865536093712, "num_tokens": 1880712.0, "step": 560 }, { "entropy": 2.079355040192604, "epoch": 0.4117753296008669, "grad_norm": 1.0645219087600708, "learning_rate": 1.9857799383046465e-05, "loss": 0.035767218470573424, "mean_token_accuracy": 0.9891987189650535, "num_tokens": 1919614.0, "step": 570 }, { "entropy": 2.1122144132852556, "epoch": 0.4189994581903558, "grad_norm": 0.2414686679840088, "learning_rate": 1.984983216606357e-05, "loss": 0.03828282654285431, "mean_token_accuracy": 0.9935470074415207, "num_tokens": 1950236.0, "step": 580 }, { "entropy": 2.1520024478435515, "epoch": 0.4262235867798447, "grad_norm": 0.025072164833545685, "learning_rate": 1.9841649483905092e-05, "loss": 0.026039117574691774, "mean_token_accuracy": 0.9961486741900444, "num_tokens": 1979716.0, "step": 590 }, { "entropy": 2.1203277856111526, "epoch": 0.4334477153693336, "grad_norm": 0.03449135646224022, "learning_rate": 1.983325151556729e-05, "loss": 0.06812232732772827, "mean_token_accuracy": 0.9831810146570206, "num_tokens": 2014478.0, "step": 600 }, { "entropy": 2.0620292097330095, "epoch": 0.4406718439588225, "grad_norm": 1.8488832712173462, "learning_rate": 1.9824638444755795e-05, "loss": 0.012539258599281311, "mean_token_accuracy": 0.9972435891628265, "num_tokens": 2051436.0, "step": 610 }, { "entropy": 2.1081482648849486, "epoch": 0.44789597254831137, "grad_norm": 0.1524757593870163, "learning_rate": 1.981581045988162e-05, "loss": 0.061668336391448975, "mean_token_accuracy": 0.9885178819298744, "num_tokens": 2086848.0, "step": 620 }, { "entropy": 2.153286537528038, "epoch": 0.45512010113780027, "grad_norm": 0.20357979834079742, "learning_rate": 1.9806767754057022e-05, "loss": 0.024441687762737273, "mean_token_accuracy": 0.9957340195775032, "num_tokens": 2119688.0, "step": 630 }, { "entropy": 2.109396052360535, "epoch": 0.46234422972728917, "grad_norm": 0.03233234956860542, "learning_rate": 1.9797510525091278e-05, "loss": 0.004525944963097573, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 2155633.0, "step": 640 }, { "entropy": 2.1455644100904463, "epoch": 0.469568358316778, "grad_norm": 0.5513462424278259, "learning_rate": 1.9788038975486363e-05, "loss": 0.018023833632469177, "mean_token_accuracy": 0.9958193480968476, "num_tokens": 2190543.0, "step": 650 }, { "entropy": 2.0951803505420683, "epoch": 0.4767924869062669, "grad_norm": 0.05144621431827545, "learning_rate": 1.977835331243252e-05, "loss": 0.011193668842315674, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 2225664.0, "step": 660 }, { "entropy": 2.05837681889534, "epoch": 0.4840166154957558, "grad_norm": 1.9019652605056763, "learning_rate": 1.9768453747803722e-05, "loss": 0.045949330925941466, "mean_token_accuracy": 0.9922287076711654, "num_tokens": 2263929.0, "step": 670 }, { "entropy": 2.1198449566960336, "epoch": 0.4912407440852447, "grad_norm": 2.392086982727051, "learning_rate": 1.975834049815304e-05, "loss": 0.04401857256889343, "mean_token_accuracy": 0.9881693422794342, "num_tokens": 2300646.0, "step": 680 }, { "entropy": 2.137920472025871, "epoch": 0.4984648726747336, "grad_norm": 0.7350146770477295, "learning_rate": 1.9748013784707914e-05, "loss": 0.04097718000411987, "mean_token_accuracy": 0.9914300963282585, "num_tokens": 2337419.0, "step": 690 }, { "entropy": 2.152908131480217, "epoch": 0.5056890012642224, "grad_norm": 2.7877094745635986, "learning_rate": 1.9737473833365303e-05, "loss": 0.06197558641433716, "mean_token_accuracy": 0.9885002598166466, "num_tokens": 2370156.0, "step": 700 }, { "entropy": 2.114130911231041, "epoch": 0.5129131298537114, "grad_norm": 4.815999984741211, "learning_rate": 1.972672087468674e-05, "loss": 0.036697188019752504, "mean_token_accuracy": 0.9890773802995682, "num_tokens": 2403350.0, "step": 710 }, { "entropy": 2.1276988863945006, "epoch": 0.5201372584432002, "grad_norm": 0.09675746411085129, "learning_rate": 1.971575514389331e-05, "loss": 0.025695490837097167, "mean_token_accuracy": 0.9903780594468117, "num_tokens": 2439829.0, "step": 720 }, { "entropy": 2.1967761904001235, "epoch": 0.5273613870326892, "grad_norm": 0.11605588346719742, "learning_rate": 1.9704576880860474e-05, "loss": 0.03519304394721985, "mean_token_accuracy": 0.9883782863616943, "num_tokens": 2474018.0, "step": 730 }, { "entropy": 2.1506566435098646, "epoch": 0.534585515622178, "grad_norm": 2.496562957763672, "learning_rate": 1.969318633011285e-05, "loss": 0.02293294370174408, "mean_token_accuracy": 0.9894841268658638, "num_tokens": 2511615.0, "step": 740 }, { "entropy": 2.1656083434820177, "epoch": 0.541809644211667, "grad_norm": 0.48594969511032104, "learning_rate": 1.968158374081885e-05, "loss": 0.05291303396224976, "mean_token_accuracy": 0.9936918020248413, "num_tokens": 2546286.0, "step": 750 }, { "entropy": 2.2043658822774885, "epoch": 0.5490337728011558, "grad_norm": 6.537981986999512, "learning_rate": 1.9669769366785223e-05, "loss": 0.026339799165725708, "mean_token_accuracy": 0.9959500461816788, "num_tokens": 2579815.0, "step": 760 }, { "entropy": 2.187710216641426, "epoch": 0.5562579013906448, "grad_norm": 0.06361158192157745, "learning_rate": 1.9657743466451524e-05, "loss": 0.03191069066524506, "mean_token_accuracy": 0.9880474433302879, "num_tokens": 2608498.0, "step": 770 }, { "entropy": 2.130194824934006, "epoch": 0.5634820299801336, "grad_norm": 5.55103063583374, "learning_rate": 1.964550630288444e-05, "loss": 0.0548154354095459, "mean_token_accuracy": 0.986955127120018, "num_tokens": 2642930.0, "step": 780 }, { "entropy": 2.127747783064842, "epoch": 0.5707061585696226, "grad_norm": 2.8869001865386963, "learning_rate": 1.9633058143772037e-05, "loss": 0.016472166776657103, "mean_token_accuracy": 0.9959523811936378, "num_tokens": 2672358.0, "step": 790 }, { "entropy": 2.1343603670597076, "epoch": 0.5779302871591114, "grad_norm": 6.028234481811523, "learning_rate": 1.9620399261417925e-05, "loss": 0.0534799337387085, "mean_token_accuracy": 0.9870725125074387, "num_tokens": 2712309.0, "step": 800 }, { "entropy": 2.1584979057312013, "epoch": 0.5851544157486003, "grad_norm": 0.13096173107624054, "learning_rate": 1.960752993273528e-05, "loss": 0.039956134557723996, "mean_token_accuracy": 0.9930102661252022, "num_tokens": 2750765.0, "step": 810 }, { "entropy": 2.0611986249685286, "epoch": 0.5923785443380892, "grad_norm": 0.45354947447776794, "learning_rate": 1.9594450439240793e-05, "loss": 0.049787935614585874, "mean_token_accuracy": 0.9887179493904114, "num_tokens": 2787510.0, "step": 820 }, { "entropy": 2.092721477150917, "epoch": 0.5996026729275781, "grad_norm": 0.033594291657209396, "learning_rate": 1.958116106704851e-05, "loss": 0.013710010051727294, "mean_token_accuracy": 0.9969642847776413, "num_tokens": 2820507.0, "step": 830 }, { "entropy": 2.110324975848198, "epoch": 0.606826801517067, "grad_norm": 1.94284987449646, "learning_rate": 1.9567662106863583e-05, "loss": 0.05006279349327088, "mean_token_accuracy": 0.9929195806384087, "num_tokens": 2856832.0, "step": 840 }, { "entropy": 2.146149677038193, "epoch": 0.6140509301065559, "grad_norm": 0.025745930150151253, "learning_rate": 1.9553953853975894e-05, "loss": 0.049893584847450254, "mean_token_accuracy": 0.9861560463905334, "num_tokens": 2886911.0, "step": 850 }, { "entropy": 2.2159456998109817, "epoch": 0.6212750586960448, "grad_norm": 0.22102245688438416, "learning_rate": 1.9540036608253615e-05, "loss": 0.011719506233930588, "mean_token_accuracy": 0.9975980386137963, "num_tokens": 2918768.0, "step": 860 }, { "entropy": 2.240058869123459, "epoch": 0.6284991872855337, "grad_norm": 3.7185215950012207, "learning_rate": 1.952591067413663e-05, "loss": 0.02348371744155884, "mean_token_accuracy": 0.9929980143904686, "num_tokens": 2951922.0, "step": 870 }, { "entropy": 2.1650724798440932, "epoch": 0.6357233158750226, "grad_norm": 0.26696911454200745, "learning_rate": 1.9511576360629884e-05, "loss": 0.013108362257480622, "mean_token_accuracy": 0.9952360153198242, "num_tokens": 2980067.0, "step": 880 }, { "entropy": 2.1337937146425245, "epoch": 0.6429474444645115, "grad_norm": 0.017593568190932274, "learning_rate": 1.9497033981296635e-05, "loss": 0.0056190770119428635, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 3011282.0, "step": 890 }, { "entropy": 2.104154738783836, "epoch": 0.6501715730540003, "grad_norm": 0.03523773327469826, "learning_rate": 1.9482283854251564e-05, "loss": 0.05853831768035889, "mean_token_accuracy": 0.988778468966484, "num_tokens": 3046943.0, "step": 900 }, { "entropy": 2.071388727426529, "epoch": 0.6573957016434893, "grad_norm": 2.63916015625, "learning_rate": 1.9467326302153854e-05, "loss": 0.015439648926258088, "mean_token_accuracy": 0.9967436969280243, "num_tokens": 3086686.0, "step": 910 }, { "entropy": 2.1768156826496123, "epoch": 0.6646198302329781, "grad_norm": 7.410099029541016, "learning_rate": 1.9452161652200096e-05, "loss": 0.035445448756217954, "mean_token_accuracy": 0.9946778699755668, "num_tokens": 3116964.0, "step": 920 }, { "entropy": 2.113570731878281, "epoch": 0.6718439588224671, "grad_norm": 12.763428688049316, "learning_rate": 1.9436790236117162e-05, "loss": 0.05357277989387512, "mean_token_accuracy": 0.989736121892929, "num_tokens": 3151640.0, "step": 930 }, { "entropy": 2.151062309741974, "epoch": 0.6790680874119559, "grad_norm": 4.3073811531066895, "learning_rate": 1.942121239015493e-05, "loss": 0.02954191863536835, "mean_token_accuracy": 0.9931784182786941, "num_tokens": 3183172.0, "step": 940 }, { "entropy": 2.140563413500786, "epoch": 0.6862922160014449, "grad_norm": 0.015436495654284954, "learning_rate": 1.9405428455078933e-05, "loss": 0.021537141501903535, "mean_token_accuracy": 0.9967385903000832, "num_tokens": 3215196.0, "step": 950 }, { "entropy": 2.1755530834198, "epoch": 0.6935163445909337, "grad_norm": 0.1176186203956604, "learning_rate": 1.938943877616291e-05, "loss": 0.041554605960845946, "mean_token_accuracy": 0.9923611104488372, "num_tokens": 3250033.0, "step": 960 }, { "entropy": 2.160807254910469, "epoch": 0.7007404731804227, "grad_norm": 0.4536968469619751, "learning_rate": 1.9373243703181234e-05, "loss": 0.022222673892974852, "mean_token_accuracy": 0.9943934962153435, "num_tokens": 3284275.0, "step": 970 }, { "entropy": 2.118019551038742, "epoch": 0.7079646017699115, "grad_norm": 0.028539419174194336, "learning_rate": 1.9356843590401295e-05, "loss": 0.03024633228778839, "mean_token_accuracy": 0.993554450571537, "num_tokens": 3318920.0, "step": 980 }, { "entropy": 2.115340527892113, "epoch": 0.7151887303594004, "grad_norm": 0.022816361859440804, "learning_rate": 1.9340238796575722e-05, "loss": 0.029753103852272034, "mean_token_accuracy": 0.991157278418541, "num_tokens": 3355066.0, "step": 990 }, { "entropy": 2.0531561613082885, "epoch": 0.7224128589488893, "grad_norm": 5.430459499359131, "learning_rate": 1.932342968493454e-05, "loss": 0.03846350014209747, "mean_token_accuracy": 0.9928767189383507, "num_tokens": 3396801.0, "step": 1000 }, { "epoch": 0.7224128589488893, "eval_entropy": 2.015599282557688, "eval_loss": 0.9796417355537415, "eval_mean_token_accuracy": 0.8523120447261455, "eval_num_tokens": 3396801.0, "eval_runtime": 1007.5014, "eval_samples_per_second": 7.594, "eval_steps_per_second": 0.95, "step": 1000 }, { "entropy": 2.2311429172754287, "epoch": 0.7296369875383781, "grad_norm": 0.3221210539340973, "learning_rate": 1.9306416623177233e-05, "loss": 0.02508760690689087, "mean_token_accuracy": 0.9961589574813843, "num_tokens": 3424673.0, "step": 1010 }, { "entropy": 2.1565969973802566, "epoch": 0.7368611161278671, "grad_norm": 0.07839540392160416, "learning_rate": 1.928919998346469e-05, "loss": 0.02089208662509918, "mean_token_accuracy": 0.9951127827167511, "num_tokens": 3460589.0, "step": 1020 }, { "entropy": 2.1316963762044905, "epoch": 0.7440852447173559, "grad_norm": 2.571152925491333, "learning_rate": 1.927178014241108e-05, "loss": 0.01810687780380249, "mean_token_accuracy": 0.9948151633143425, "num_tokens": 3492356.0, "step": 1030 }, { "entropy": 2.131281113624573, "epoch": 0.7513093733068449, "grad_norm": 1.0611048936843872, "learning_rate": 1.9254157481075593e-05, "loss": 0.011593367159366607, "mean_token_accuracy": 0.9969405591487884, "num_tokens": 3528933.0, "step": 1040 }, { "entropy": 2.1135970920324327, "epoch": 0.7585335018963337, "grad_norm": 0.06862345337867737, "learning_rate": 1.923633238495412e-05, "loss": 0.03084944188594818, "mean_token_accuracy": 0.9917931839823723, "num_tokens": 3562754.0, "step": 1050 }, { "entropy": 2.135847768187523, "epoch": 0.7657576304858227, "grad_norm": 3.3710029125213623, "learning_rate": 1.9218305243970824e-05, "loss": 0.03355285227298736, "mean_token_accuracy": 0.9917197063565254, "num_tokens": 3596291.0, "step": 1060 }, { "entropy": 2.115863263607025, "epoch": 0.7729817590753115, "grad_norm": 1.0154095888137817, "learning_rate": 1.9200076452469575e-05, "loss": 0.027915269136428833, "mean_token_accuracy": 0.9920019909739495, "num_tokens": 3634202.0, "step": 1070 }, { "entropy": 2.180663511157036, "epoch": 0.7802058876648005, "grad_norm": 0.008630992844700813, "learning_rate": 1.9181646409205376e-05, "loss": 0.01911990940570831, "mean_token_accuracy": 0.9977481618523598, "num_tokens": 3665654.0, "step": 1080 }, { "entropy": 2.066094806790352, "epoch": 0.7874300162542893, "grad_norm": 0.016932925209403038, "learning_rate": 1.9163015517335605e-05, "loss": 0.0038531143218278885, "mean_token_accuracy": 0.9984375, "num_tokens": 3701414.0, "step": 1090 }, { "entropy": 2.0516481667757036, "epoch": 0.7946541448437782, "grad_norm": 0.9654312133789062, "learning_rate": 1.9144184184411204e-05, "loss": 0.023603864014148712, "mean_token_accuracy": 0.9940719693899155, "num_tokens": 3738650.0, "step": 1100 }, { "entropy": 2.1311365902423858, "epoch": 0.8018782734332671, "grad_norm": 0.07597270607948303, "learning_rate": 1.9125152822367764e-05, "loss": 0.008270335197448731, "mean_token_accuracy": 0.997916667163372, "num_tokens": 3769387.0, "step": 1110 }, { "entropy": 2.1482642620801924, "epoch": 0.809102402022756, "grad_norm": 0.05144130066037178, "learning_rate": 1.910592184751652e-05, "loss": 0.008368145674467087, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 3795728.0, "step": 1120 }, { "entropy": 2.1289342790842056, "epoch": 0.8163265306122449, "grad_norm": 4.872783660888672, "learning_rate": 1.908649168053523e-05, "loss": 0.043704470992088316, "mean_token_accuracy": 0.9917654454708099, "num_tokens": 3824859.0, "step": 1130 }, { "entropy": 2.0587215080857275, "epoch": 0.8235506592017338, "grad_norm": 0.3473055064678192, "learning_rate": 1.9066862746458998e-05, "loss": 0.01864089071750641, "mean_token_accuracy": 0.9959340661764144, "num_tokens": 3860239.0, "step": 1140 }, { "entropy": 2.077919548749924, "epoch": 0.8307747877912227, "grad_norm": 1.1250643730163574, "learning_rate": 1.904703547467094e-05, "loss": 0.047300055623054504, "mean_token_accuracy": 0.9930105939507484, "num_tokens": 3893211.0, "step": 1150 }, { "entropy": 2.1111993461847307, "epoch": 0.8379989163807116, "grad_norm": 0.04652652144432068, "learning_rate": 1.902701029889283e-05, "loss": 0.042614486813545224, "mean_token_accuracy": 0.9891733899712563, "num_tokens": 3923474.0, "step": 1160 }, { "entropy": 2.133824098110199, "epoch": 0.8452230449702005, "grad_norm": 4.08588981628418, "learning_rate": 1.900678765717558e-05, "loss": 0.03261755108833313, "mean_token_accuracy": 0.9877159208059311, "num_tokens": 3952262.0, "step": 1170 }, { "entropy": 2.1812889873981476, "epoch": 0.8524471735596894, "grad_norm": 0.01818382926285267, "learning_rate": 1.8986367991889677e-05, "loss": 0.004279704764485359, "mean_token_accuracy": 0.9988872766494751, "num_tokens": 3982302.0, "step": 1180 }, { "entropy": 2.111463187634945, "epoch": 0.8596713021491783, "grad_norm": 3.6590194702148438, "learning_rate": 1.8965751749715502e-05, "loss": 0.04557798206806183, "mean_token_accuracy": 0.9872519835829735, "num_tokens": 4017674.0, "step": 1190 }, { "entropy": 2.1546395272016525, "epoch": 0.8668954307386671, "grad_norm": 0.011192182078957558, "learning_rate": 1.8944939381633553e-05, "loss": 0.015546497702598572, "mean_token_accuracy": 0.9963636353611947, "num_tokens": 4049489.0, "step": 1200 }, { "entropy": 2.061059150099754, "epoch": 0.874119559328156, "grad_norm": 0.2434389889240265, "learning_rate": 1.8923931342914592e-05, "loss": 0.0059484150260686874, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 4085651.0, "step": 1210 }, { "entropy": 2.11140855550766, "epoch": 0.881343687917645, "grad_norm": 5.586461544036865, "learning_rate": 1.8902728093109668e-05, "loss": 0.018709875643253326, "mean_token_accuracy": 0.9961805552244186, "num_tokens": 4115626.0, "step": 1220 }, { "entropy": 2.0685029208660124, "epoch": 0.8885678165071338, "grad_norm": 6.326735973358154, "learning_rate": 1.888133009604008e-05, "loss": 0.024366311728954315, "mean_token_accuracy": 0.9944709703326226, "num_tokens": 4148992.0, "step": 1230 }, { "entropy": 2.104837965965271, "epoch": 0.8957919450966227, "grad_norm": 14.592947006225586, "learning_rate": 1.8859737819787224e-05, "loss": 0.023436115682125093, "mean_token_accuracy": 0.9899750709533691, "num_tokens": 4181714.0, "step": 1240 }, { "entropy": 2.055359047651291, "epoch": 0.9030160736861116, "grad_norm": 0.028958171606063843, "learning_rate": 1.8837951736682353e-05, "loss": 0.0017842631787061691, "mean_token_accuracy": 1.0, "num_tokens": 4220903.0, "step": 1250 }, { "entropy": 2.0872839361429216, "epoch": 0.9102402022756005, "grad_norm": 0.036007024347782135, "learning_rate": 1.8815972323296258e-05, "loss": 0.01379597932100296, "mean_token_accuracy": 0.9942857146263122, "num_tokens": 4251549.0, "step": 1260 }, { "entropy": 2.0923456490039825, "epoch": 0.9174643308650894, "grad_norm": 0.7058573365211487, "learning_rate": 1.8793800060428814e-05, "loss": 0.02520722448825836, "mean_token_accuracy": 0.9965818896889687, "num_tokens": 4287420.0, "step": 1270 }, { "entropy": 2.1157235205173492, "epoch": 0.9246884594545783, "grad_norm": 0.39984047412872314, "learning_rate": 1.8771435433098493e-05, "loss": 0.03538358211517334, "mean_token_accuracy": 0.9956959694623947, "num_tokens": 4318898.0, "step": 1280 }, { "entropy": 2.108782610297203, "epoch": 0.9319125880440672, "grad_norm": 0.09862552583217621, "learning_rate": 1.8748878930531743e-05, "loss": 0.033087140321731566, "mean_token_accuracy": 0.9920297145843506, "num_tokens": 4351356.0, "step": 1290 }, { "entropy": 2.093110492825508, "epoch": 0.939136716633556, "grad_norm": 0.00461851991713047, "learning_rate": 1.8726131046152272e-05, "loss": 0.010160531848669052, "mean_token_accuracy": 0.996524153649807, "num_tokens": 4384553.0, "step": 1300 }, { "entropy": 2.032593864202499, "epoch": 0.946360845223045, "grad_norm": 0.5353080034255981, "learning_rate": 1.8703192277570277e-05, "loss": 0.013478608429431915, "mean_token_accuracy": 0.996477273106575, "num_tokens": 4418996.0, "step": 1310 }, { "entropy": 2.1145312935113907, "epoch": 0.9535849738125338, "grad_norm": 0.10275590419769287, "learning_rate": 1.8680063126571547e-05, "loss": 0.002380320429801941, "mean_token_accuracy": 1.0, "num_tokens": 4450751.0, "step": 1320 }, { "entropy": 2.1038990378379823, "epoch": 0.9608091024020228, "grad_norm": 2.1970865726470947, "learning_rate": 1.865674409910649e-05, "loss": 0.01084609180688858, "mean_token_accuracy": 0.9984375, "num_tokens": 4481621.0, "step": 1330 }, { "entropy": 2.012085109949112, "epoch": 0.9680332309915116, "grad_norm": 0.035805828869342804, "learning_rate": 1.863323570527906e-05, "loss": 0.0015195850282907486, "mean_token_accuracy": 1.0, "num_tokens": 4518380.0, "step": 1340 }, { "entropy": 2.0171980261802673, "epoch": 0.9752573595810006, "grad_norm": 0.13926967978477478, "learning_rate": 1.8609538459335595e-05, "loss": 0.03831966817378998, "mean_token_accuracy": 0.9956393390893936, "num_tokens": 4553464.0, "step": 1350 }, { "entropy": 2.0884960144758224, "epoch": 0.9824814881704894, "grad_norm": 0.05643892660737038, "learning_rate": 1.8585652879653598e-05, "loss": 0.003447505459189415, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 4585078.0, "step": 1360 }, { "entropy": 2.0204695969820023, "epoch": 0.9897056167599784, "grad_norm": 0.152903750538826, "learning_rate": 1.856157948873035e-05, "loss": 0.008481259644031524, "mean_token_accuracy": 0.9986805558204651, "num_tokens": 4620089.0, "step": 1370 }, { "entropy": 2.0601888835430144, "epoch": 0.9969297453494672, "grad_norm": 5.249927997589111, "learning_rate": 1.8537318813171516e-05, "loss": 0.014892134070396423, "mean_token_accuracy": 0.9947420626878738, "num_tokens": 4653211.0, "step": 1380 }, { "entropy": 2.111465578143661, "epoch": 1.0036120642947444, "grad_norm": 0.030989494174718857, "learning_rate": 1.8512871383679617e-05, "loss": 0.02316879332065582, "mean_token_accuracy": 0.9923184062983539, "num_tokens": 4684069.0, "step": 1390 }, { "entropy": 2.1355521261692045, "epoch": 1.0108361928842333, "grad_norm": 0.013790454715490341, "learning_rate": 1.8488237735042406e-05, "loss": 0.0007782953325659037, "mean_token_accuracy": 1.0, "num_tokens": 4716475.0, "step": 1400 }, { "entropy": 2.0239915043115615, "epoch": 1.0180603214737223, "grad_norm": 0.015894528478384018, "learning_rate": 1.8463418406121198e-05, "loss": 0.008045677840709687, "mean_token_accuracy": 0.9967708334326744, "num_tokens": 4754383.0, "step": 1410 }, { "entropy": 1.9871837973594666, "epoch": 1.0252844500632112, "grad_norm": 0.017707591876387596, "learning_rate": 1.843841393983905e-05, "loss": 0.02116468399763107, "mean_token_accuracy": 0.995119047164917, "num_tokens": 4794361.0, "step": 1420 }, { "entropy": 2.0534275233745576, "epoch": 1.0325085786527, "grad_norm": 0.20345048606395721, "learning_rate": 1.8413224883168912e-05, "loss": 0.0025019023567438127, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 4836053.0, "step": 1430 }, { "entropy": 2.057610747218132, "epoch": 1.039732707242189, "grad_norm": 0.009533772245049477, "learning_rate": 1.8387851787121646e-05, "loss": 0.021535003185272218, "mean_token_accuracy": 0.9924398139119148, "num_tokens": 4868865.0, "step": 1440 }, { "entropy": 2.119044467806816, "epoch": 1.0469568358316779, "grad_norm": 2.236619472503662, "learning_rate": 1.8362295206733978e-05, "loss": 0.017270827293395997, "mean_token_accuracy": 0.9924002185463905, "num_tokens": 4904908.0, "step": 1450 }, { "entropy": 2.06851644217968, "epoch": 1.0541809644211666, "grad_norm": 0.06309136003255844, "learning_rate": 1.833655570105635e-05, "loss": 0.0062024291604757305, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 4938538.0, "step": 1460 }, { "entropy": 2.0950154691934584, "epoch": 1.0614050930106556, "grad_norm": 0.18221551179885864, "learning_rate": 1.8310633833140713e-05, "loss": 0.021643282473087312, "mean_token_accuracy": 0.9981763914227486, "num_tokens": 4971145.0, "step": 1470 }, { "entropy": 2.0922484278678892, "epoch": 1.0686292216001445, "grad_norm": 0.05216178297996521, "learning_rate": 1.8284530170028176e-05, "loss": 0.0033873818814754487, "mean_token_accuracy": 0.9992424249649048, "num_tokens": 4999892.0, "step": 1480 }, { "entropy": 2.0764939337968826, "epoch": 1.0758533501896335, "grad_norm": 0.025218123570084572, "learning_rate": 1.8258245282736627e-05, "loss": 0.02744237780570984, "mean_token_accuracy": 0.9955294117331505, "num_tokens": 5034282.0, "step": 1490 }, { "entropy": 2.0980449438095095, "epoch": 1.0830774787791222, "grad_norm": 0.0042065721936523914, "learning_rate": 1.8231779746248234e-05, "loss": 0.018268114328384398, "mean_token_accuracy": 0.9975520834326744, "num_tokens": 5064549.0, "step": 1500 }, { "epoch": 1.0830774787791222, "eval_entropy": 1.9504261345698917, "eval_loss": 1.0086095333099365, "eval_mean_token_accuracy": 0.8621797298189241, "eval_num_tokens": 5064549.0, "eval_runtime": 1006.9488, "eval_samples_per_second": 7.598, "eval_steps_per_second": 0.95, "step": 1500 }, { "entropy": 2.0826266705989838, "epoch": 1.0903016073686111, "grad_norm": 0.23226939141750336, "learning_rate": 1.8205134139496866e-05, "loss": 0.0053476162254810335, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 5098381.0, "step": 1510 }, { "entropy": 2.1424541413784026, "epoch": 1.0975257359581, "grad_norm": 0.005317744333297014, "learning_rate": 1.817830904535544e-05, "loss": 0.005732352659106254, "mean_token_accuracy": 0.996690820157528, "num_tokens": 5128572.0, "step": 1520 }, { "entropy": 2.1302927315235136, "epoch": 1.104749864547589, "grad_norm": 0.02699355222284794, "learning_rate": 1.8151305050623148e-05, "loss": 0.011630669981241227, "mean_token_accuracy": 0.9959165081381798, "num_tokens": 5162862.0, "step": 1530 }, { "entropy": 2.103237381577492, "epoch": 1.1119739931370778, "grad_norm": 0.010451219044625759, "learning_rate": 1.8124122746012642e-05, "loss": 0.012390993535518646, "mean_token_accuracy": 0.9969166666269302, "num_tokens": 5195249.0, "step": 1540 }, { "entropy": 2.134079247713089, "epoch": 1.1191981217265667, "grad_norm": 1.3870619535446167, "learning_rate": 1.8096762726137106e-05, "loss": 0.0017786189913749696, "mean_token_accuracy": 1.0, "num_tokens": 5226438.0, "step": 1550 }, { "entropy": 2.117493250966072, "epoch": 1.1264222503160557, "grad_norm": 1.1784181594848633, "learning_rate": 1.806922558949724e-05, "loss": 0.005632025003433227, "mean_token_accuracy": 0.9968269228935241, "num_tokens": 5260179.0, "step": 1560 }, { "entropy": 2.1169673800468445, "epoch": 1.1336463789055444, "grad_norm": 0.005867530591785908, "learning_rate": 1.804151193846818e-05, "loss": 0.0018024042248725892, "mean_token_accuracy": 1.0, "num_tokens": 5295898.0, "step": 1570 }, { "entropy": 2.154021382331848, "epoch": 1.1408705074950334, "grad_norm": 2.601689577102661, "learning_rate": 1.8013622379286317e-05, "loss": 0.02105346620082855, "mean_token_accuracy": 0.9956855490803719, "num_tokens": 5327650.0, "step": 1580 }, { "entropy": 2.041078993678093, "epoch": 1.1480946360845223, "grad_norm": 0.16076812148094177, "learning_rate": 1.798555752203603e-05, "loss": 0.0056386619806289675, "mean_token_accuracy": 0.9974999994039535, "num_tokens": 5365261.0, "step": 1590 }, { "entropy": 2.1064918786287308, "epoch": 1.1553187646740113, "grad_norm": 0.13275979459285736, "learning_rate": 1.795731798063635e-05, "loss": 0.0002915527205914259, "mean_token_accuracy": 1.0, "num_tokens": 5395638.0, "step": 1600 }, { "entropy": 2.1877143383026123, "epoch": 1.1625428932635, "grad_norm": 0.021166006103157997, "learning_rate": 1.7928904372827523e-05, "loss": 0.002695506438612938, "mean_token_accuracy": 0.999074074625969, "num_tokens": 5427822.0, "step": 1610 }, { "entropy": 2.1708212316036226, "epoch": 1.169767021852989, "grad_norm": 0.012815513648092747, "learning_rate": 1.7900317320157497e-05, "loss": 0.012587207555770873, "mean_token_accuracy": 0.999074074625969, "num_tokens": 5457509.0, "step": 1620 }, { "entropy": 2.1449846118688582, "epoch": 1.176991150442478, "grad_norm": 0.1441592127084732, "learning_rate": 1.7871557447968332e-05, "loss": 0.014236865937709809, "mean_token_accuracy": 0.9972222223877907, "num_tokens": 5497324.0, "step": 1630 }, { "entropy": 2.148208647966385, "epoch": 1.1842152790319669, "grad_norm": 0.0048500122502446175, "learning_rate": 1.7842625385382514e-05, "loss": 0.00042399438098073006, "mean_token_accuracy": 1.0, "num_tokens": 5530447.0, "step": 1640 }, { "entropy": 2.20017766058445, "epoch": 1.1914394076214556, "grad_norm": 0.011082557030022144, "learning_rate": 1.78135217652892e-05, "loss": 0.02469281405210495, "mean_token_accuracy": 0.9926190480589867, "num_tokens": 5559519.0, "step": 1650 }, { "entropy": 2.181740128993988, "epoch": 1.1986635362109446, "grad_norm": 0.13058708608150482, "learning_rate": 1.7784247224330364e-05, "loss": 0.002104618772864342, "mean_token_accuracy": 1.0, "num_tokens": 5590509.0, "step": 1660 }, { "entropy": 2.1344178140163423, "epoch": 1.2058876648004335, "grad_norm": 3.456376075744629, "learning_rate": 1.7754802402886878e-05, "loss": 0.005177551507949829, "mean_token_accuracy": 0.9957516342401505, "num_tokens": 5624522.0, "step": 1670 }, { "entropy": 2.199016976356506, "epoch": 1.2131117933899223, "grad_norm": 0.011777219362556934, "learning_rate": 1.77251879450645e-05, "loss": 0.0028427716344594954, "mean_token_accuracy": 0.9994565218687057, "num_tokens": 5655676.0, "step": 1680 }, { "entropy": 2.232581838965416, "epoch": 1.2203359219794112, "grad_norm": 7.441551208496094, "learning_rate": 1.7695404498679783e-05, "loss": 0.016997954249382018, "mean_token_accuracy": 0.9984375, "num_tokens": 5690286.0, "step": 1690 }, { "entropy": 2.197023203969002, "epoch": 1.2275600505689002, "grad_norm": 0.01528174802660942, "learning_rate": 1.7665452715245918e-05, "loss": 0.020658569037914278, "mean_token_accuracy": 0.9934895828366279, "num_tokens": 5720068.0, "step": 1700 }, { "entropy": 2.1230575770139692, "epoch": 1.234784179158389, "grad_norm": 0.012365175411105156, "learning_rate": 1.7635333249958458e-05, "loss": 0.006468945741653442, "mean_token_accuracy": 0.998863635957241, "num_tokens": 5752141.0, "step": 1710 }, { "entropy": 2.1280272156000137, "epoch": 1.2420083077478778, "grad_norm": 0.07447945326566696, "learning_rate": 1.7605046761681e-05, "loss": 0.009069929271936417, "mean_token_accuracy": 0.998504464328289, "num_tokens": 5784292.0, "step": 1720 }, { "entropy": 2.049823743104935, "epoch": 1.2492324363373668, "grad_norm": 0.010746085084974766, "learning_rate": 1.757459391293078e-05, "loss": 0.00027041586581617595, "mean_token_accuracy": 1.0, "num_tokens": 5822036.0, "step": 1730 }, { "entropy": 2.197540044784546, "epoch": 1.2564565649268558, "grad_norm": 0.2788766026496887, "learning_rate": 1.7543975369864158e-05, "loss": 0.012624423205852508, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 5857543.0, "step": 1740 }, { "entropy": 2.1441560611128807, "epoch": 1.2636806935163447, "grad_norm": 0.07280537486076355, "learning_rate": 1.7513191802262068e-05, "loss": 0.0011107440106570721, "mean_token_accuracy": 1.0, "num_tokens": 5890577.0, "step": 1750 }, { "entropy": 2.144422373175621, "epoch": 1.2709048221058334, "grad_norm": 0.0037534120492637157, "learning_rate": 1.7482243883515352e-05, "loss": 0.00637623593211174, "mean_token_accuracy": 0.9977481618523598, "num_tokens": 5926746.0, "step": 1760 }, { "entropy": 2.105022558569908, "epoch": 1.2781289506953224, "grad_norm": 0.6015522480010986, "learning_rate": 1.7451132290610035e-05, "loss": 0.0020936239510774613, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 5958942.0, "step": 1770 }, { "entropy": 2.161861351132393, "epoch": 1.2853530792848114, "grad_norm": 0.014276999980211258, "learning_rate": 1.7419857704112527e-05, "loss": 0.0010045192204415799, "mean_token_accuracy": 1.0, "num_tokens": 5989151.0, "step": 1780 }, { "entropy": 1.981706216931343, "epoch": 1.2925772078743, "grad_norm": 5.441474437713623, "learning_rate": 1.738842080815471e-05, "loss": 0.0060867641121149065, "mean_token_accuracy": 0.9974999994039535, "num_tokens": 6026197.0, "step": 1790 }, { "entropy": 2.1758767783641817, "epoch": 1.299801336463789, "grad_norm": 2.714914083480835, "learning_rate": 1.735682229041899e-05, "loss": 0.012385857105255128, "mean_token_accuracy": 0.9976098895072937, "num_tokens": 6061662.0, "step": 1800 }, { "entropy": 2.1634930104017256, "epoch": 1.307025465053278, "grad_norm": 0.019172759726643562, "learning_rate": 1.7325062842123257e-05, "loss": 0.0014975195750594138, "mean_token_accuracy": 1.0, "num_tokens": 6094422.0, "step": 1810 }, { "entropy": 2.1602396339178087, "epoch": 1.3142495936427667, "grad_norm": 0.007157791871577501, "learning_rate": 1.7293143158005753e-05, "loss": 0.002255440875887871, "mean_token_accuracy": 1.0, "num_tokens": 6124176.0, "step": 1820 }, { "entropy": 2.1500022053718566, "epoch": 1.3214737222322557, "grad_norm": 0.03131004422903061, "learning_rate": 1.7261063936309886e-05, "loss": 0.0033995889127254484, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 6158848.0, "step": 1830 }, { "entropy": 2.1492036104202272, "epoch": 1.3286978508217446, "grad_norm": 0.061348363757133484, "learning_rate": 1.722882587876894e-05, "loss": 0.007053826749324798, "mean_token_accuracy": 0.9971022740006447, "num_tokens": 6191610.0, "step": 1840 }, { "entropy": 2.182556915283203, "epoch": 1.3359219794112336, "grad_norm": 0.00448696780949831, "learning_rate": 1.7196429690590745e-05, "loss": 0.0005504220258444548, "mean_token_accuracy": 1.0, "num_tokens": 6220927.0, "step": 1850 }, { "entropy": 2.105365613102913, "epoch": 1.3431461080007225, "grad_norm": 0.04105228930711746, "learning_rate": 1.7163876080442236e-05, "loss": 0.0006919845938682557, "mean_token_accuracy": 1.0, "num_tokens": 6253925.0, "step": 1860 }, { "entropy": 2.1027141720056535, "epoch": 1.3503702365902113, "grad_norm": 0.003532874397933483, "learning_rate": 1.713116576043396e-05, "loss": 0.00023068697191774845, "mean_token_accuracy": 1.0, "num_tokens": 6286725.0, "step": 1870 }, { "entropy": 2.059778553247452, "epoch": 1.3575943651797002, "grad_norm": 0.004922214429825544, "learning_rate": 1.709829944610448e-05, "loss": 0.00023504530545324088, "mean_token_accuracy": 1.0, "num_tokens": 6326607.0, "step": 1880 }, { "entropy": 2.213117519021034, "epoch": 1.3648184937691892, "grad_norm": 0.005468189250677824, "learning_rate": 1.706527785640475e-05, "loss": 0.007529944181442261, "mean_token_accuracy": 0.9987499997019768, "num_tokens": 6363050.0, "step": 1890 }, { "entropy": 2.1393338203430177, "epoch": 1.372042622358678, "grad_norm": 0.013368732295930386, "learning_rate": 1.703210171368237e-05, "loss": 0.00037029776722192765, "mean_token_accuracy": 1.0, "num_tokens": 6394373.0, "step": 1900 }, { "entropy": 2.0972392201423644, "epoch": 1.3792667509481669, "grad_norm": 0.0500776469707489, "learning_rate": 1.699877174366579e-05, "loss": 0.0019076000899076462, "mean_token_accuracy": 1.0, "num_tokens": 6430285.0, "step": 1910 }, { "entropy": 2.116664645075798, "epoch": 1.3864908795376558, "grad_norm": 2.305840492248535, "learning_rate": 1.696528867544843e-05, "loss": 0.026842620968818665, "mean_token_accuracy": 0.9895500689744949, "num_tokens": 6464191.0, "step": 1920 }, { "entropy": 2.1112887859344482, "epoch": 1.3937150081271446, "grad_norm": 0.027304597198963165, "learning_rate": 1.6931653241472736e-05, "loss": 0.0007224025204777718, "mean_token_accuracy": 1.0, "num_tokens": 6503510.0, "step": 1930 }, { "entropy": 2.1380940586328507, "epoch": 1.4009391367166335, "grad_norm": 0.012063352391123772, "learning_rate": 1.689786617751416e-05, "loss": 0.0008827324956655503, "mean_token_accuracy": 1.0, "num_tokens": 6536930.0, "step": 1940 }, { "entropy": 2.0396142452955246, "epoch": 1.4081632653061225, "grad_norm": 0.001350369886495173, "learning_rate": 1.6863928222665053e-05, "loss": 0.004736289381980896, "mean_token_accuracy": 0.999074074625969, "num_tokens": 6572556.0, "step": 1950 }, { "entropy": 2.072943928837776, "epoch": 1.4153873938956114, "grad_norm": 0.5194405913352966, "learning_rate": 1.6829840119318518e-05, "loss": 0.0009896421805024147, "mean_token_accuracy": 1.0, "num_tokens": 6604208.0, "step": 1960 }, { "entropy": 2.130077823996544, "epoch": 1.4226115224851004, "grad_norm": 2.9718973636627197, "learning_rate": 1.6795602613152152e-05, "loss": 0.025895681977272034, "mean_token_accuracy": 0.9964082792401314, "num_tokens": 6635729.0, "step": 1970 }, { "entropy": 2.0558677911758423, "epoch": 1.429835651074589, "grad_norm": 0.01987330988049507, "learning_rate": 1.6761216453111732e-05, "loss": 0.005741150304675102, "mean_token_accuracy": 0.9987557873129844, "num_tokens": 6671807.0, "step": 1980 }, { "entropy": 2.1100833773612977, "epoch": 1.437059779664078, "grad_norm": 0.0030209566466510296, "learning_rate": 1.6726682391394854e-05, "loss": 0.0012206203304231168, "mean_token_accuracy": 1.0, "num_tokens": 6701449.0, "step": 1990 }, { "entropy": 2.119494986534119, "epoch": 1.444283908253567, "grad_norm": 0.0030340475495904684, "learning_rate": 1.6692001183434453e-05, "loss": 0.007272050529718399, "mean_token_accuracy": 0.9970016330480576, "num_tokens": 6736102.0, "step": 2000 }, { "epoch": 1.444283908253567, "eval_entropy": 1.9451654732165042, "eval_loss": 1.0858334302902222, "eval_mean_token_accuracy": 0.8618772350633157, "eval_num_tokens": 6736102.0, "eval_runtime": 1006.5211, "eval_samples_per_second": 7.601, "eval_steps_per_second": 0.951, "step": 2000 }, { "entropy": 2.159361606836319, "epoch": 1.4515080368430557, "grad_norm": 0.003348611295223236, "learning_rate": 1.66571735878823e-05, "loss": 0.008503157645463943, "mean_token_accuracy": 0.9962714686989784, "num_tokens": 6765417.0, "step": 2010 }, { "entropy": 2.082682377099991, "epoch": 1.4587321654325447, "grad_norm": 0.45656055212020874, "learning_rate": 1.6622200366592385e-05, "loss": 0.002443484589457512, "mean_token_accuracy": 1.0, "num_tokens": 6802913.0, "step": 2020 }, { "entropy": 2.0617480158805845, "epoch": 1.4659562940220336, "grad_norm": 0.006900084670633078, "learning_rate": 1.658708228460427e-05, "loss": 0.0298701673746109, "mean_token_accuracy": 0.997139498591423, "num_tokens": 6835849.0, "step": 2030 }, { "entropy": 2.1594283044338227, "epoch": 1.4731804226115224, "grad_norm": 0.29801133275032043, "learning_rate": 1.6551820110126346e-05, "loss": 0.0018545888364315034, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 6866237.0, "step": 2040 }, { "entropy": 2.069524332880974, "epoch": 1.4804045512010113, "grad_norm": 0.017278041690587997, "learning_rate": 1.6516414614519023e-05, "loss": 0.003127451241016388, "mean_token_accuracy": 0.9973416283726693, "num_tokens": 6905968.0, "step": 2050 }, { "entropy": 2.027516800165176, "epoch": 1.4876286797905003, "grad_norm": 6.259517669677734, "learning_rate": 1.6480866572277875e-05, "loss": 0.003948203101754188, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 6937825.0, "step": 2060 }, { "entropy": 2.1773772150278092, "epoch": 1.4948528083799892, "grad_norm": 0.426023006439209, "learning_rate": 1.6445176761016664e-05, "loss": 0.009390848875045776, "mean_token_accuracy": 0.9991666659712791, "num_tokens": 6965652.0, "step": 2070 }, { "entropy": 2.128205436468124, "epoch": 1.5020769369694782, "grad_norm": 0.014904591254889965, "learning_rate": 1.6409345961450366e-05, "loss": 0.00557580292224884, "mean_token_accuracy": 0.9975241541862487, "num_tokens": 6999159.0, "step": 2080 }, { "entropy": 2.0940597355365753, "epoch": 1.509301065558967, "grad_norm": 0.025805262848734856, "learning_rate": 1.6373374957378078e-05, "loss": 0.0005395350977778435, "mean_token_accuracy": 1.0, "num_tokens": 7032483.0, "step": 2090 }, { "entropy": 2.1171302914619448, "epoch": 1.5165251941484559, "grad_norm": 3.1691181659698486, "learning_rate": 1.6337264535665864e-05, "loss": 0.006728671491146088, "mean_token_accuracy": 0.9943749994039536, "num_tokens": 7065864.0, "step": 2100 }, { "entropy": 2.122132509946823, "epoch": 1.5237493227379448, "grad_norm": 3.207775115966797, "learning_rate": 1.630101548622956e-05, "loss": 0.042887577414512636, "mean_token_accuracy": 0.994207875430584, "num_tokens": 7099331.0, "step": 2110 }, { "entropy": 2.1320498794317246, "epoch": 1.5309734513274336, "grad_norm": 0.05691314488649368, "learning_rate": 1.6264628602017473e-05, "loss": 0.04059517979621887, "mean_token_accuracy": 0.9966666668653488, "num_tokens": 7134548.0, "step": 2120 }, { "entropy": 2.0526298761367796, "epoch": 1.5381975799169225, "grad_norm": 0.032850734889507294, "learning_rate": 1.6228104678993055e-05, "loss": 0.012917523086071015, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 7167221.0, "step": 2130 }, { "entropy": 2.0888993412256243, "epoch": 1.5454217085064115, "grad_norm": 0.03867359459400177, "learning_rate": 1.6191444516117486e-05, "loss": 0.01570902019739151, "mean_token_accuracy": 0.9949736505746841, "num_tokens": 7201449.0, "step": 2140 }, { "entropy": 2.079554834961891, "epoch": 1.5526458370959002, "grad_norm": 0.08862973004579544, "learning_rate": 1.6154648915332183e-05, "loss": 0.02136228382587433, "mean_token_accuracy": 0.9924007937312126, "num_tokens": 7234108.0, "step": 2150 }, { "entropy": 2.0425251334905625, "epoch": 1.5598699656853892, "grad_norm": 0.01745772175490856, "learning_rate": 1.6117718681541282e-05, "loss": 0.007442861795425415, "mean_token_accuracy": 0.9947222217917442, "num_tokens": 7267952.0, "step": 2160 }, { "entropy": 2.0624156802892686, "epoch": 1.5670940942748781, "grad_norm": 0.012653755955398083, "learning_rate": 1.6080654622594005e-05, "loss": 0.0031592480838298796, "mean_token_accuracy": 0.9984375, "num_tokens": 7302191.0, "step": 2170 }, { "entropy": 2.0713628053665163, "epoch": 1.5743182228643668, "grad_norm": 0.17270442843437195, "learning_rate": 1.6043457549267008e-05, "loss": 0.000261211208999157, "mean_token_accuracy": 1.0, "num_tokens": 7333553.0, "step": 2180 }, { "entropy": 2.0779812574386596, "epoch": 1.581542351453856, "grad_norm": 0.11458373814821243, "learning_rate": 1.600612827524664e-05, "loss": 0.01028701737523079, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 7364794.0, "step": 2190 }, { "entropy": 2.0878961592912675, "epoch": 1.5887664800433448, "grad_norm": 1.063446044921875, "learning_rate": 1.596866761711113e-05, "loss": 0.0034152865409851074, "mean_token_accuracy": 0.9991935476660728, "num_tokens": 7395934.0, "step": 2200 }, { "entropy": 2.160181927680969, "epoch": 1.5959906086328337, "grad_norm": 2.0979878902435303, "learning_rate": 1.593107639431275e-05, "loss": 0.016500005125999452, "mean_token_accuracy": 0.9973897039890289, "num_tokens": 7425221.0, "step": 2210 }, { "entropy": 2.0582812547683718, "epoch": 1.6032147372223227, "grad_norm": 0.02503189444541931, "learning_rate": 1.5893355429159867e-05, "loss": 0.006939806044101715, "mean_token_accuracy": 0.9991666659712791, "num_tokens": 7463793.0, "step": 2220 }, { "entropy": 2.062930929660797, "epoch": 1.6104388658118114, "grad_norm": 3.7741119861602783, "learning_rate": 1.5855505546798963e-05, "loss": 0.03627827763557434, "mean_token_accuracy": 0.9965909093618393, "num_tokens": 7500363.0, "step": 2230 }, { "entropy": 2.1142319977283477, "epoch": 1.6176629944013003, "grad_norm": 0.14156651496887207, "learning_rate": 1.581752757519659e-05, "loss": 0.0020683687180280685, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 7532751.0, "step": 2240 }, { "entropy": 2.047053983807564, "epoch": 1.6248871229907893, "grad_norm": 0.05737530440092087, "learning_rate": 1.577942234512125e-05, "loss": 0.0005965373944491148, "mean_token_accuracy": 1.0, "num_tokens": 7571820.0, "step": 2250 }, { "entropy": 2.068295753002167, "epoch": 1.632111251580278, "grad_norm": 0.0038673433009535074, "learning_rate": 1.5741190690125224e-05, "loss": 0.03620594441890716, "mean_token_accuracy": 0.9943652525544167, "num_tokens": 7605275.0, "step": 2260 }, { "entropy": 2.135337767004967, "epoch": 1.639335380169767, "grad_norm": 0.007885460741817951, "learning_rate": 1.5702833446526342e-05, "loss": 0.0054336290806531904, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 7635492.0, "step": 2270 }, { "entropy": 2.1049996852874755, "epoch": 1.646559508759256, "grad_norm": 0.12335117161273956, "learning_rate": 1.5664351453389687e-05, "loss": 0.00200213510543108, "mean_token_accuracy": 0.995833332836628, "num_tokens": 7671880.0, "step": 2280 }, { "entropy": 2.091116154193878, "epoch": 1.6537836373487447, "grad_norm": 0.0021040288265794516, "learning_rate": 1.5625745552509236e-05, "loss": 0.002798403427004814, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 7705881.0, "step": 2290 }, { "entropy": 2.1217050731182097, "epoch": 1.6610077659382338, "grad_norm": 0.014709223993122578, "learning_rate": 1.558701658838945e-05, "loss": 0.005910974368453026, "mean_token_accuracy": 0.9959374994039536, "num_tokens": 7739861.0, "step": 2300 }, { "entropy": 2.0269686609506605, "epoch": 1.6682318945277226, "grad_norm": 0.015317005105316639, "learning_rate": 1.5548165408226806e-05, "loss": 0.014388790726661682, "mean_token_accuracy": 0.995833332836628, "num_tokens": 7774542.0, "step": 2310 }, { "entropy": 2.013978272676468, "epoch": 1.6754560231172115, "grad_norm": 0.0025651876349002123, "learning_rate": 1.5509192861891245e-05, "loss": 0.011645805835723878, "mean_token_accuracy": 0.9984375, "num_tokens": 7811748.0, "step": 2320 }, { "entropy": 2.104548341035843, "epoch": 1.6826801517067005, "grad_norm": 0.2633267641067505, "learning_rate": 1.5470099801907603e-05, "loss": 0.01602161079645157, "mean_token_accuracy": 0.9939585506916047, "num_tokens": 7846954.0, "step": 2330 }, { "entropy": 2.1113144189119337, "epoch": 1.6899042802961892, "grad_norm": 0.010862859897315502, "learning_rate": 1.543088708343696e-05, "loss": 0.0021166058257222177, "mean_token_accuracy": 1.0, "num_tokens": 7880033.0, "step": 2340 }, { "entropy": 2.1317659109830855, "epoch": 1.6971284088856782, "grad_norm": 0.0034101735800504684, "learning_rate": 1.5391555564257907e-05, "loss": 0.0007758287712931633, "mean_token_accuracy": 1.0, "num_tokens": 7914051.0, "step": 2350 }, { "entropy": 2.08573197722435, "epoch": 1.7043525374751671, "grad_norm": 0.00433329539373517, "learning_rate": 1.5352106104747816e-05, "loss": 0.005741733685135841, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 7950879.0, "step": 2360 }, { "entropy": 2.145374095439911, "epoch": 1.7115766660646559, "grad_norm": 1.4243534803390503, "learning_rate": 1.531253956786401e-05, "loss": 0.001701824553310871, "mean_token_accuracy": 1.0, "num_tokens": 7983672.0, "step": 2370 }, { "entropy": 2.154380649328232, "epoch": 1.7188007946541448, "grad_norm": 0.0023556272499263287, "learning_rate": 1.5272856819124862e-05, "loss": 0.008817800879478454, "mean_token_accuracy": 0.9947222217917442, "num_tokens": 8012964.0, "step": 2380 }, { "entropy": 2.031127080321312, "epoch": 1.7260249232436338, "grad_norm": 0.004914262797683477, "learning_rate": 1.5233058726590896e-05, "loss": 0.0030698470771312715, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 8049896.0, "step": 2390 }, { "entropy": 2.0777418464422226, "epoch": 1.7332490518331225, "grad_norm": 0.0020385284442454576, "learning_rate": 1.5193146160845783e-05, "loss": 0.00504988357424736, "mean_token_accuracy": 0.9974358975887299, "num_tokens": 8080833.0, "step": 2400 }, { "entropy": 2.0629676073789596, "epoch": 1.7404731804226117, "grad_norm": 0.004871215671300888, "learning_rate": 1.5153119994977286e-05, "loss": 0.006580570340156555, "mean_token_accuracy": 0.9984375, "num_tokens": 8115944.0, "step": 2410 }, { "entropy": 2.146797752380371, "epoch": 1.7476973090121004, "grad_norm": 0.005745346192270517, "learning_rate": 1.5112981104558176e-05, "loss": 0.011366159468889237, "mean_token_accuracy": 0.9981481477618217, "num_tokens": 8146140.0, "step": 2420 }, { "entropy": 2.124235710501671, "epoch": 1.7549214376015894, "grad_norm": 0.05242975428700447, "learning_rate": 1.5072730367627079e-05, "loss": 0.011133132874965668, "mean_token_accuracy": 0.9965277776122093, "num_tokens": 8178690.0, "step": 2430 }, { "entropy": 2.0248345702886583, "epoch": 1.7621455661910783, "grad_norm": 0.032173994928598404, "learning_rate": 1.5032368664669262e-05, "loss": 0.019655060768127442, "mean_token_accuracy": 0.9976576581597328, "num_tokens": 8215889.0, "step": 2440 }, { "entropy": 2.077134358882904, "epoch": 1.769369694780567, "grad_norm": 0.029686057940125465, "learning_rate": 1.4991896878597371e-05, "loss": 0.00024895952083170414, "mean_token_accuracy": 1.0, "num_tokens": 8252786.0, "step": 2450 }, { "entropy": 2.0941765367984773, "epoch": 1.776593823370056, "grad_norm": 0.0018677343614399433, "learning_rate": 1.4951315894732128e-05, "loss": 0.0016262145712971688, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 8285439.0, "step": 2460 }, { "entropy": 2.0770112931728364, "epoch": 1.783817951959545, "grad_norm": 0.030317634344100952, "learning_rate": 1.4910626600782953e-05, "loss": 0.021285098791122437, "mean_token_accuracy": 0.9956127449870109, "num_tokens": 8320214.0, "step": 2470 }, { "entropy": 2.1631770461797712, "epoch": 1.7910420805490337, "grad_norm": 0.0071309832856059074, "learning_rate": 1.4869829886828555e-05, "loss": 0.0012782313860952854, "mean_token_accuracy": 1.0, "num_tokens": 8351086.0, "step": 2480 }, { "entropy": 2.08559827208519, "epoch": 1.7982662091385226, "grad_norm": 0.009854475036263466, "learning_rate": 1.4828926645297447e-05, "loss": 0.0008186939172446728, "mean_token_accuracy": 1.0, "num_tokens": 8385744.0, "step": 2490 }, { "entropy": 2.1026084780693055, "epoch": 1.8054903377280116, "grad_norm": 0.07382749766111374, "learning_rate": 1.4787917770948444e-05, "loss": 0.0014898085966706276, "mean_token_accuracy": 1.0, "num_tokens": 8421729.0, "step": 2500 }, { "epoch": 1.8054903377280116, "eval_entropy": 1.9514784755627066, "eval_loss": 0.9975342750549316, "eval_mean_token_accuracy": 0.8620556939233682, "eval_num_tokens": 8421729.0, "eval_runtime": 1006.2961, "eval_samples_per_second": 7.603, "eval_steps_per_second": 0.951, "step": 2500 }, { "entropy": 2.1760506868362426, "epoch": 1.8127144663175003, "grad_norm": 0.006193229462951422, "learning_rate": 1.4746804160851076e-05, "loss": 0.011964889615774155, "mean_token_accuracy": 0.9964714959263802, "num_tokens": 8455688.0, "step": 2510 }, { "entropy": 2.0681952387094498, "epoch": 1.8199385949069895, "grad_norm": 0.011737292632460594, "learning_rate": 1.4705586714365967e-05, "loss": 0.0016200032085180282, "mean_token_accuracy": 1.0, "num_tokens": 8489613.0, "step": 2520 }, { "entropy": 2.083423137664795, "epoch": 1.8271627234964782, "grad_norm": 0.0025027799420058727, "learning_rate": 1.4664266333125166e-05, "loss": 0.0005176069214940071, "mean_token_accuracy": 1.0, "num_tokens": 8520801.0, "step": 2530 }, { "entropy": 2.1015573650598527, "epoch": 1.834386852085967, "grad_norm": 0.005616495851427317, "learning_rate": 1.4622843921012418e-05, "loss": 0.0005612615030258894, "mean_token_accuracy": 1.0, "num_tokens": 8552679.0, "step": 2540 }, { "entropy": 2.0993423074483872, "epoch": 1.8416109806754561, "grad_norm": 0.013693253509700298, "learning_rate": 1.4581320384143397e-05, "loss": 0.029371032118797304, "mean_token_accuracy": 0.9958041965961456, "num_tokens": 8585601.0, "step": 2550 }, { "entropy": 2.134834015369415, "epoch": 1.8488351092649449, "grad_norm": 0.004303743597120047, "learning_rate": 1.4539696630845882e-05, "loss": 0.001381959579885006, "mean_token_accuracy": 1.0, "num_tokens": 8614091.0, "step": 2560 }, { "entropy": 2.08456112742424, "epoch": 1.8560592378544338, "grad_norm": 5.2712721824646, "learning_rate": 1.4497973571639883e-05, "loss": 0.003928203508257866, "mean_token_accuracy": 0.997916667163372, "num_tokens": 8647175.0, "step": 2570 }, { "entropy": 2.019808714091778, "epoch": 1.8632833664439228, "grad_norm": 0.046853918582201004, "learning_rate": 1.4456152119217732e-05, "loss": 0.0012758148834109307, "mean_token_accuracy": 1.0, "num_tokens": 8689485.0, "step": 2580 }, { "entropy": 2.084204414486885, "epoch": 1.8705074950334115, "grad_norm": 0.06356920301914215, "learning_rate": 1.441423318842411e-05, "loss": 0.009153851121664048, "mean_token_accuracy": 0.9972222223877907, "num_tokens": 8727433.0, "step": 2590 }, { "entropy": 2.1179255068302156, "epoch": 1.8777316236229005, "grad_norm": 1.0097019672393799, "learning_rate": 1.4372217696236045e-05, "loss": 0.030431166291236877, "mean_token_accuracy": 0.9957663685083389, "num_tokens": 8757201.0, "step": 2600 }, { "entropy": 2.073572924733162, "epoch": 1.8849557522123894, "grad_norm": 0.18690069019794464, "learning_rate": 1.4330106561742842e-05, "loss": 0.0184125691652298, "mean_token_accuracy": 0.9870535716414451, "num_tokens": 8788479.0, "step": 2610 }, { "entropy": 2.077366715669632, "epoch": 1.8921798808018782, "grad_norm": 0.005627399776130915, "learning_rate": 1.4287900706125982e-05, "loss": 0.0002856994513422251, "mean_token_accuracy": 1.0, "num_tokens": 8823250.0, "step": 2620 }, { "entropy": 2.1045290410518644, "epoch": 1.8994040093913673, "grad_norm": 0.019973022863268852, "learning_rate": 1.4245601052638967e-05, "loss": 0.0014879602007567883, "mean_token_accuracy": 1.0, "num_tokens": 8859128.0, "step": 2630 }, { "entropy": 2.088423106074333, "epoch": 1.906628137980856, "grad_norm": 0.00223484612070024, "learning_rate": 1.4203208526587137e-05, "loss": 0.002584621496498585, "mean_token_accuracy": 0.9993055552244187, "num_tokens": 8898952.0, "step": 2640 }, { "entropy": 2.06300730407238, "epoch": 1.9138522665703448, "grad_norm": 0.2910439074039459, "learning_rate": 1.416072405530742e-05, "loss": 0.0012499621137976647, "mean_token_accuracy": 1.0, "num_tokens": 8932753.0, "step": 2650 }, { "entropy": 2.0773635655641556, "epoch": 1.921076395159834, "grad_norm": 0.0037493736017495394, "learning_rate": 1.4118148568148038e-05, "loss": 0.010332270711660384, "mean_token_accuracy": 0.9993243247270585, "num_tokens": 8961577.0, "step": 2660 }, { "entropy": 2.1508059173822405, "epoch": 1.9283005237493227, "grad_norm": 0.009645289741456509, "learning_rate": 1.4075482996448196e-05, "loss": 0.003071390464901924, "mean_token_accuracy": 0.997916667163372, "num_tokens": 8990569.0, "step": 2670 }, { "entropy": 2.1294310480356216, "epoch": 1.9355246523388117, "grad_norm": 5.6811723709106445, "learning_rate": 1.4032728273517693e-05, "loss": 0.011133387684822083, "mean_token_accuracy": 0.9980962634086609, "num_tokens": 9021975.0, "step": 2680 }, { "entropy": 2.03683922290802, "epoch": 1.9427487809283006, "grad_norm": 0.08936524391174316, "learning_rate": 1.398988533461651e-05, "loss": 0.05962691307067871, "mean_token_accuracy": 0.9925133690237999, "num_tokens": 9055502.0, "step": 2690 }, { "entropy": 2.0664506271481513, "epoch": 1.9499729095177893, "grad_norm": 0.09585876017808914, "learning_rate": 1.3946955116934366e-05, "loss": 0.0051217213273048404, "mean_token_accuracy": 0.996875, "num_tokens": 9086035.0, "step": 2700 }, { "entropy": 2.126824939250946, "epoch": 1.9571970381072783, "grad_norm": 0.08990640938282013, "learning_rate": 1.3903938559570187e-05, "loss": 0.0011291544884443282, "mean_token_accuracy": 1.0, "num_tokens": 9116140.0, "step": 2710 }, { "entropy": 2.0418795704841615, "epoch": 1.9644211666967673, "grad_norm": 0.10705948621034622, "learning_rate": 1.3860836603511595e-05, "loss": 0.0012339632026851176, "mean_token_accuracy": 1.0, "num_tokens": 9151933.0, "step": 2720 }, { "entropy": 2.0204968392848968, "epoch": 1.971645295286256, "grad_norm": 0.0022592502646148205, "learning_rate": 1.3817650191614296e-05, "loss": 0.009728147834539413, "mean_token_accuracy": 0.9977865785360336, "num_tokens": 9186649.0, "step": 2730 }, { "entropy": 2.01169753074646, "epoch": 1.978869423875745, "grad_norm": 0.0048128338530659676, "learning_rate": 1.3774380268581483e-05, "loss": 0.0025031518191099165, "mean_token_accuracy": 1.0, "num_tokens": 9220783.0, "step": 2740 }, { "entropy": 1.9962417513132096, "epoch": 1.986093552465234, "grad_norm": 0.008226979523897171, "learning_rate": 1.3731027780943142e-05, "loss": 0.005799595266580582, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 9260611.0, "step": 2750 }, { "entropy": 2.0178030014038084, "epoch": 1.9933176810547226, "grad_norm": 0.05092993378639221, "learning_rate": 1.368759367703537e-05, "loss": 0.009776970744132996, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 9297499.0, "step": 2760 }, { "entropy": 2.0301727668659106, "epoch": 2.0, "grad_norm": 0.0022351753432303667, "learning_rate": 1.3644078906979617e-05, "loss": 0.007662636786699295, "mean_token_accuracy": 0.9968399163838979, "num_tokens": 9331880.0, "step": 2770 }, { "entropy": 1.9933802992105485, "epoch": 2.0072241285894887, "grad_norm": 2.35412335395813, "learning_rate": 1.3600484422661908e-05, "loss": 0.0009718227200210094, "mean_token_accuracy": 1.0, "num_tokens": 9371782.0, "step": 2780 }, { "entropy": 1.9624912858009338, "epoch": 2.014448257178978, "grad_norm": 1.6708158254623413, "learning_rate": 1.3556811177712012e-05, "loss": 0.005323154479265213, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 9410776.0, "step": 2790 }, { "entropy": 2.0888388842344283, "epoch": 2.0216723857684666, "grad_norm": 0.06923649460077286, "learning_rate": 1.3513060127482595e-05, "loss": 0.001955091394484043, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 9442042.0, "step": 2800 }, { "entropy": 2.0619905948638917, "epoch": 2.0288965143579554, "grad_norm": 0.004627038724720478, "learning_rate": 1.3469232229028318e-05, "loss": 0.002406453527510166, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 9479069.0, "step": 2810 }, { "entropy": 2.10693601667881, "epoch": 2.0361206429474445, "grad_norm": 0.16550160944461823, "learning_rate": 1.3425328441084877e-05, "loss": 0.0013710076920688153, "mean_token_accuracy": 1.0, "num_tokens": 9511919.0, "step": 2820 }, { "entropy": 2.0103971630334856, "epoch": 2.0433447715369333, "grad_norm": 0.38094449043273926, "learning_rate": 1.3381349724048074e-05, "loss": 0.00045806909911334516, "mean_token_accuracy": 1.0, "num_tokens": 9545770.0, "step": 2830 }, { "entropy": 2.0798803091049196, "epoch": 2.0505689001264225, "grad_norm": 3.134385108947754, "learning_rate": 1.3337297039952778e-05, "loss": 0.0038271814584732054, "mean_token_accuracy": 0.9950000002980233, "num_tokens": 9578858.0, "step": 2840 }, { "entropy": 2.0519185990095137, "epoch": 2.057793028715911, "grad_norm": 0.0022963378578424454, "learning_rate": 1.329317135245188e-05, "loss": 0.000910833477973938, "mean_token_accuracy": 1.0, "num_tokens": 9611522.0, "step": 2850 }, { "entropy": 2.1064377218484878, "epoch": 2.0650171573054, "grad_norm": 0.06155133619904518, "learning_rate": 1.3248973626795239e-05, "loss": 0.0014734589494764805, "mean_token_accuracy": 1.0, "num_tokens": 9647641.0, "step": 2860 }, { "entropy": 2.083224031329155, "epoch": 2.072241285894889, "grad_norm": 0.005543859675526619, "learning_rate": 1.320470482980853e-05, "loss": 0.004852643609046936, "mean_token_accuracy": 0.999074074625969, "num_tokens": 9680790.0, "step": 2870 }, { "entropy": 2.0704041182994843, "epoch": 2.079465414484378, "grad_norm": 0.005386595148593187, "learning_rate": 1.3160365929872127e-05, "loss": 0.0003251228015869856, "mean_token_accuracy": 1.0, "num_tokens": 9715564.0, "step": 2880 }, { "entropy": 2.0982192888855935, "epoch": 2.0866895430738666, "grad_norm": 0.0017691103275865316, "learning_rate": 1.31159578968999e-05, "loss": 0.004996376112103462, "mean_token_accuracy": 0.9980000004172325, "num_tokens": 9747350.0, "step": 2890 }, { "entropy": 1.9677607417106628, "epoch": 2.0939136716633557, "grad_norm": 0.0013132777530699968, "learning_rate": 1.3071481702318013e-05, "loss": 0.0020328672602772714, "mean_token_accuracy": 0.9994047611951828, "num_tokens": 9777462.0, "step": 2900 }, { "entropy": 2.0211497992277145, "epoch": 2.1011378002528445, "grad_norm": 0.04309982806444168, "learning_rate": 1.3026938319043653e-05, "loss": 0.010742837935686112, "mean_token_accuracy": 0.9973127111792565, "num_tokens": 9810045.0, "step": 2910 }, { "entropy": 2.0541851848363875, "epoch": 2.108361928842333, "grad_norm": 0.8860397934913635, "learning_rate": 1.2982328721463771e-05, "loss": 0.0005173175595700741, "mean_token_accuracy": 1.0, "num_tokens": 9841633.0, "step": 2920 }, { "entropy": 2.0442396640777587, "epoch": 2.1155860574318224, "grad_norm": 0.01298177894204855, "learning_rate": 1.2937653885413753e-05, "loss": 0.0019559381529688836, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 9875065.0, "step": 2930 }, { "entropy": 2.0949876844882964, "epoch": 2.122810186021311, "grad_norm": 0.08153260499238968, "learning_rate": 1.2892914788156077e-05, "loss": 0.011897164583206176, "mean_token_accuracy": 0.9970238104462623, "num_tokens": 9908190.0, "step": 2940 }, { "entropy": 2.068952742218971, "epoch": 2.1300343146108, "grad_norm": 0.0025051895063370466, "learning_rate": 1.2848112408358935e-05, "loss": 0.0026764221489429473, "mean_token_accuracy": 0.995833332836628, "num_tokens": 9940211.0, "step": 2950 }, { "entropy": 2.0292742609977723, "epoch": 2.137258443200289, "grad_norm": 0.0027262514922767878, "learning_rate": 1.2803247726074828e-05, "loss": 0.0006647636648267508, "mean_token_accuracy": 1.0, "num_tokens": 9976844.0, "step": 2960 }, { "entropy": 2.104836627840996, "epoch": 2.1444825717897777, "grad_norm": 0.08476550132036209, "learning_rate": 1.2758321722719121e-05, "loss": 0.0007632578257471323, "mean_token_accuracy": 1.0, "num_tokens": 10009418.0, "step": 2970 }, { "entropy": 2.0324369966983795, "epoch": 2.151706700379267, "grad_norm": 0.016819585114717484, "learning_rate": 1.271333538104858e-05, "loss": 0.00019808937795460225, "mean_token_accuracy": 1.0, "num_tokens": 10044535.0, "step": 2980 }, { "entropy": 2.0965832740068437, "epoch": 2.1589308289687557, "grad_norm": 0.0015572819393128157, "learning_rate": 1.2668289685139872e-05, "loss": 0.00022766462061554193, "mean_token_accuracy": 1.0, "num_tokens": 10075829.0, "step": 2990 }, { "entropy": 2.0006484925746917, "epoch": 2.1661549575582444, "grad_norm": 0.0032824883237481117, "learning_rate": 1.2623185620368039e-05, "loss": 0.00015145333018153905, "mean_token_accuracy": 1.0, "num_tokens": 10112270.0, "step": 3000 }, { "epoch": 2.1661549575582444, "eval_entropy": 1.9313233175247815, "eval_loss": 1.0283830165863037, "eval_mean_token_accuracy": 0.8682382702204625, "eval_num_tokens": 10112270.0, "eval_runtime": 1006.1426, "eval_samples_per_second": 7.604, "eval_steps_per_second": 0.951, "step": 3000 }, { "entropy": 2.071103125810623, "epoch": 2.1733790861477336, "grad_norm": 0.0022774692624807358, "learning_rate": 1.257802417338494e-05, "loss": 0.00011760392226278782, "mean_token_accuracy": 1.0, "num_tokens": 10146218.0, "step": 3010 }, { "entropy": 2.0262765318155287, "epoch": 2.1806032147372223, "grad_norm": 0.06287238746881485, "learning_rate": 1.2532806332097674e-05, "loss": 0.004662457481026649, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 10177685.0, "step": 3020 }, { "entropy": 2.037755089998245, "epoch": 2.187827343326711, "grad_norm": 0.002215301152318716, "learning_rate": 1.2487533085646963e-05, "loss": 0.0005286297295242548, "mean_token_accuracy": 1.0, "num_tokens": 10209037.0, "step": 3030 }, { "entropy": 2.0680573701858522, "epoch": 2.1950514719162, "grad_norm": 0.025813493877649307, "learning_rate": 1.244220542438552e-05, "loss": 0.011255993694067, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 10240793.0, "step": 3040 }, { "entropy": 2.039670634269714, "epoch": 2.202275600505689, "grad_norm": 1.8143988847732544, "learning_rate": 1.2396824339856382e-05, "loss": 0.0010964684188365936, "mean_token_accuracy": 0.9990384608507157, "num_tokens": 10279065.0, "step": 3050 }, { "entropy": 2.144818735122681, "epoch": 2.209499729095178, "grad_norm": 0.006999373901635408, "learning_rate": 1.2351390824771216e-05, "loss": 0.0004216683562844992, "mean_token_accuracy": 1.0, "num_tokens": 10306803.0, "step": 3060 }, { "entropy": 1.9957463964819908, "epoch": 2.216723857684667, "grad_norm": 0.011525344103574753, "learning_rate": 1.2305905872988619e-05, "loss": 0.004228273034095764, "mean_token_accuracy": 0.9991071432828903, "num_tokens": 10343140.0, "step": 3070 }, { "entropy": 2.0431026369333267, "epoch": 2.2239479862741556, "grad_norm": 0.008179805241525173, "learning_rate": 1.226037047949235e-05, "loss": 0.002482306584715843, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 10380486.0, "step": 3080 }, { "entropy": 2.155712330341339, "epoch": 2.2311721148636448, "grad_norm": 0.0033373201731592417, "learning_rate": 1.2214785640369593e-05, "loss": 0.00017562623834237455, "mean_token_accuracy": 1.0, "num_tokens": 10413499.0, "step": 3090 }, { "entropy": 2.0313654780387878, "epoch": 2.2383962434531335, "grad_norm": 0.005848964676260948, "learning_rate": 1.2169152352789155e-05, "loss": 0.0036901481449604034, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 10446135.0, "step": 3100 }, { "entropy": 2.0065710693597794, "epoch": 2.245620372042622, "grad_norm": 0.008071194402873516, "learning_rate": 1.212347161497965e-05, "loss": 0.0026075785979628565, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 10477985.0, "step": 3110 }, { "entropy": 1.9910441845655442, "epoch": 2.2528445006321114, "grad_norm": 0.06832147389650345, "learning_rate": 1.2077744426207665e-05, "loss": 0.0002928957110270858, "mean_token_accuracy": 1.0, "num_tokens": 10514883.0, "step": 3120 }, { "entropy": 2.0544280052185058, "epoch": 2.2600686292216, "grad_norm": 0.0016180315287783742, "learning_rate": 1.2031971786755908e-05, "loss": 0.0034284554421901703, "mean_token_accuracy": 0.997916667163372, "num_tokens": 10547163.0, "step": 3130 }, { "entropy": 2.0648707509040833, "epoch": 2.267292757811089, "grad_norm": 0.002448343439027667, "learning_rate": 1.1986154697901313e-05, "loss": 0.0013522141613066196, "mean_token_accuracy": 0.99921875, "num_tokens": 10583986.0, "step": 3140 }, { "entropy": 2.1439515709877015, "epoch": 2.274516886400578, "grad_norm": 0.006475028581917286, "learning_rate": 1.1940294161893153e-05, "loss": 0.0001555228722281754, "mean_token_accuracy": 1.0, "num_tokens": 10617384.0, "step": 3150 }, { "entropy": 2.0301067173480987, "epoch": 2.2817410149900668, "grad_norm": 0.002055932767689228, "learning_rate": 1.1894391181931104e-05, "loss": 0.00035485513508319854, "mean_token_accuracy": 1.0, "num_tokens": 10649547.0, "step": 3160 }, { "entropy": 2.082839173078537, "epoch": 2.2889651435795555, "grad_norm": 0.0013027176028117537, "learning_rate": 1.1848446762143304e-05, "loss": 0.00797640010714531, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 10682210.0, "step": 3170 }, { "entropy": 2.0413184225559236, "epoch": 2.2961892721690447, "grad_norm": 0.012554303742945194, "learning_rate": 1.180246190756439e-05, "loss": 0.00010339131113141775, "mean_token_accuracy": 1.0, "num_tokens": 10714579.0, "step": 3180 }, { "entropy": 2.1068718791007996, "epoch": 2.3034134007585334, "grad_norm": 0.001185836736112833, "learning_rate": 1.1756437624113506e-05, "loss": 0.00328139141201973, "mean_token_accuracy": 0.9972222223877907, "num_tokens": 10747908.0, "step": 3190 }, { "entropy": 2.050973677635193, "epoch": 2.3106375293480226, "grad_norm": 0.0016986754490062594, "learning_rate": 1.1710374918572308e-05, "loss": 0.005435990169644356, "mean_token_accuracy": 0.9984375, "num_tokens": 10781175.0, "step": 3200 }, { "entropy": 2.0618736773729323, "epoch": 2.3178616579375113, "grad_norm": 0.010860864073038101, "learning_rate": 1.1664274798562927e-05, "loss": 0.011393396556377411, "mean_token_accuracy": 0.9954861104488373, "num_tokens": 10816087.0, "step": 3210 }, { "entropy": 2.156007653474808, "epoch": 2.325085786527, "grad_norm": 0.003099059220403433, "learning_rate": 1.161813827252595e-05, "loss": 0.0001721467007882893, "mean_token_accuracy": 1.0, "num_tokens": 10848858.0, "step": 3220 }, { "entropy": 2.0750046342611315, "epoch": 2.332309915116489, "grad_norm": 0.0023590456694364548, "learning_rate": 1.1571966349698334e-05, "loss": 0.0007454160135239362, "mean_token_accuracy": 1.0, "num_tokens": 10882504.0, "step": 3230 }, { "entropy": 2.155749836564064, "epoch": 2.339534043705978, "grad_norm": 0.007863319478929043, "learning_rate": 1.1525760040091345e-05, "loss": 0.006022463366389274, "mean_token_accuracy": 0.999285714328289, "num_tokens": 10912504.0, "step": 3240 }, { "entropy": 2.0390058249235152, "epoch": 2.3467581722954667, "grad_norm": 0.0026729318778961897, "learning_rate": 1.1479520354468462e-05, "loss": 0.011591699719429017, "mean_token_accuracy": 0.9992424249649048, "num_tokens": 10948673.0, "step": 3250 }, { "entropy": 2.007386389374733, "epoch": 2.353982300884956, "grad_norm": 11.629199981689453, "learning_rate": 1.1433248304323265e-05, "loss": 0.008497416973114014, "mean_token_accuracy": 0.9974519237875938, "num_tokens": 10981856.0, "step": 3260 }, { "entropy": 2.0721147865056992, "epoch": 2.3612064294744446, "grad_norm": 0.0032983580604195595, "learning_rate": 1.1386944901857302e-05, "loss": 0.0001707537448965013, "mean_token_accuracy": 1.0, "num_tokens": 11016701.0, "step": 3270 }, { "entropy": 2.0985424160957336, "epoch": 2.3684305580639338, "grad_norm": 0.028967533260583878, "learning_rate": 1.134061115995796e-05, "loss": 0.001917528174817562, "mean_token_accuracy": 0.9991666659712791, "num_tokens": 11053496.0, "step": 3280 }, { "entropy": 2.109357753396034, "epoch": 2.3756546866534225, "grad_norm": 0.025716641917824745, "learning_rate": 1.1294248092176296e-05, "loss": 0.0006847483571618795, "mean_token_accuracy": 1.0, "num_tokens": 11085915.0, "step": 3290 }, { "entropy": 2.0609450221061705, "epoch": 2.3828788152429112, "grad_norm": 0.012144936248660088, "learning_rate": 1.1247856712704878e-05, "loss": 0.00018151594558730723, "mean_token_accuracy": 1.0, "num_tokens": 11119602.0, "step": 3300 }, { "entropy": 2.1143811851739884, "epoch": 2.3901029438324004, "grad_norm": 0.007466345094144344, "learning_rate": 1.1201438036355589e-05, "loss": 0.003900020942091942, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 11152938.0, "step": 3310 }, { "entropy": 2.0662292540073395, "epoch": 2.397327072421889, "grad_norm": 0.0035816922318190336, "learning_rate": 1.115499307853743e-05, "loss": 0.0002706871833652258, "mean_token_accuracy": 1.0, "num_tokens": 11188975.0, "step": 3320 }, { "entropy": 2.0358931571245193, "epoch": 2.404551201011378, "grad_norm": 0.0022427074145525694, "learning_rate": 1.1108522855234307e-05, "loss": 0.00035625442396849396, "mean_token_accuracy": 1.0, "num_tokens": 11224655.0, "step": 3330 }, { "entropy": 2.1082998305559157, "epoch": 2.411775329600867, "grad_norm": 0.005758251529186964, "learning_rate": 1.1062028382982817e-05, "loss": 0.00044987592846155164, "mean_token_accuracy": 1.0, "num_tokens": 11255165.0, "step": 3340 }, { "entropy": 2.061891108751297, "epoch": 2.418999458190356, "grad_norm": 0.008551395498216152, "learning_rate": 1.1015510678849994e-05, "loss": 0.004435742273926735, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 11291478.0, "step": 3350 }, { "entropy": 2.0787433266639708, "epoch": 2.4262235867798445, "grad_norm": 0.01050745602697134, "learning_rate": 1.0968970760411078e-05, "loss": 0.00033552371896803377, "mean_token_accuracy": 1.0, "num_tokens": 11324107.0, "step": 3360 }, { "entropy": 2.0784036934375765, "epoch": 2.4334477153693337, "grad_norm": 0.003264373168349266, "learning_rate": 1.092240964572724e-05, "loss": 0.00031879942398518326, "mean_token_accuracy": 1.0, "num_tokens": 11355874.0, "step": 3370 }, { "entropy": 2.032439711689949, "epoch": 2.4406718439588224, "grad_norm": 0.013324176892638206, "learning_rate": 1.0875828353323321e-05, "loss": 0.0003661923110485077, "mean_token_accuracy": 1.0, "num_tokens": 11391783.0, "step": 3380 }, { "entropy": 2.0780230134725572, "epoch": 2.447895972548311, "grad_norm": 0.0024669126141816378, "learning_rate": 1.0829227902165553e-05, "loss": 0.0009197730571031571, "mean_token_accuracy": 1.0, "num_tokens": 11425236.0, "step": 3390 }, { "entropy": 2.031269261240959, "epoch": 2.4551201011378003, "grad_norm": 0.004380874801427126, "learning_rate": 1.0782609311639263e-05, "loss": 0.000289306603372097, "mean_token_accuracy": 1.0, "num_tokens": 11458086.0, "step": 3400 }, { "entropy": 2.0453762233257295, "epoch": 2.462344229727289, "grad_norm": 0.24470053613185883, "learning_rate": 1.073597360152658e-05, "loss": 0.0004137265030294657, "mean_token_accuracy": 1.0, "num_tokens": 11493591.0, "step": 3410 }, { "entropy": 2.063965144753456, "epoch": 2.469568358316778, "grad_norm": 0.008266739547252655, "learning_rate": 1.0689321791984117e-05, "loss": 0.00012792153283953668, "mean_token_accuracy": 1.0, "num_tokens": 11526615.0, "step": 3420 }, { "entropy": 2.083864006400108, "epoch": 2.476792486906267, "grad_norm": 0.029528291895985603, "learning_rate": 1.0642654903520671e-05, "loss": 0.004928890988230706, "mean_token_accuracy": 0.999479167163372, "num_tokens": 11560627.0, "step": 3430 }, { "entropy": 2.0178954720497133, "epoch": 2.4840166154957557, "grad_norm": 0.004495162982493639, "learning_rate": 1.0595973956974886e-05, "loss": 0.0003031428437680006, "mean_token_accuracy": 1.0, "num_tokens": 11598679.0, "step": 3440 }, { "entropy": 2.068479546904564, "epoch": 2.491240744085245, "grad_norm": 0.002551234792917967, "learning_rate": 1.0549279973492923e-05, "loss": 0.000176075950730592, "mean_token_accuracy": 1.0, "num_tokens": 11628974.0, "step": 3450 }, { "entropy": 2.120567148923874, "epoch": 2.4984648726747336, "grad_norm": 0.008339786902070045, "learning_rate": 1.0502573974506137e-05, "loss": 0.00029307235963642596, "mean_token_accuracy": 1.0, "num_tokens": 11658626.0, "step": 3460 }, { "entropy": 2.097331014275551, "epoch": 2.5056890012642223, "grad_norm": 0.02314414270222187, "learning_rate": 1.045585698170871e-05, "loss": 0.005216201767325401, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 11697099.0, "step": 3470 }, { "entropy": 2.0958898663520813, "epoch": 2.5129131298537115, "grad_norm": 0.056762658059597015, "learning_rate": 1.040913001703532e-05, "loss": 0.0002604601439088583, "mean_token_accuracy": 1.0, "num_tokens": 11727638.0, "step": 3480 }, { "entropy": 2.055971249938011, "epoch": 2.5201372584432002, "grad_norm": 0.005196870304644108, "learning_rate": 1.0362394102638782e-05, "loss": 0.00024930061772465706, "mean_token_accuracy": 1.0, "num_tokens": 11763716.0, "step": 3490 }, { "entropy": 2.0658002614974977, "epoch": 2.5273613870326894, "grad_norm": 0.002534567378461361, "learning_rate": 1.0315650260867683e-05, "loss": 0.00019605269189924002, "mean_token_accuracy": 1.0, "num_tokens": 11799642.0, "step": 3500 }, { "epoch": 2.5273613870326894, "eval_entropy": 1.9229904009630687, "eval_loss": 1.0553957223892212, "eval_mean_token_accuracy": 0.8690185485215023, "eval_num_tokens": 11799642.0, "eval_runtime": 1006.5888, "eval_samples_per_second": 7.601, "eval_steps_per_second": 0.951, "step": 3500 }, { "entropy": 2.1393352538347243, "epoch": 2.534585515622178, "grad_norm": 0.011761508882045746, "learning_rate": 1.0268899514244019e-05, "loss": 0.0009708752855658531, "mean_token_accuracy": 1.0, "num_tokens": 11829891.0, "step": 3510 }, { "entropy": 2.1366262555122377, "epoch": 2.541809644211667, "grad_norm": 0.0419895239174366, "learning_rate": 1.0222142885440836e-05, "loss": 0.0002197347581386566, "mean_token_accuracy": 1.0, "num_tokens": 11860479.0, "step": 3520 }, { "entropy": 2.0491745442152025, "epoch": 2.549033772801156, "grad_norm": 0.007780018728226423, "learning_rate": 1.0175381397259845e-05, "loss": 0.0007411201484501361, "mean_token_accuracy": 1.0, "num_tokens": 11895990.0, "step": 3530 }, { "entropy": 2.0275103002786636, "epoch": 2.556257901390645, "grad_norm": 0.02360602281987667, "learning_rate": 1.0128616072609064e-05, "loss": 0.005948469042778015, "mean_token_accuracy": 0.997916667163372, "num_tokens": 11931817.0, "step": 3540 }, { "entropy": 2.0498583540320396, "epoch": 2.5634820299801335, "grad_norm": 0.0018535489216446877, "learning_rate": 1.0081847934480428e-05, "loss": 0.00025608809664845467, "mean_token_accuracy": 1.0, "num_tokens": 11965008.0, "step": 3550 }, { "entropy": 2.044562515616417, "epoch": 2.5707061585696227, "grad_norm": 0.002041611587628722, "learning_rate": 1.0035078005927421e-05, "loss": 8.137651020660997e-05, "mean_token_accuracy": 1.0, "num_tokens": 12001243.0, "step": 3560 }, { "entropy": 2.1808446675539015, "epoch": 2.5779302871591114, "grad_norm": 0.0018940613372251391, "learning_rate": 9.98830731004269e-06, "loss": 0.0004888596944510937, "mean_token_accuracy": 1.0, "num_tokens": 12030657.0, "step": 3570 }, { "entropy": 2.029064553976059, "epoch": 2.5851544157486, "grad_norm": 0.3856402039527893, "learning_rate": 9.941536869935666e-06, "loss": 0.0004893512930721044, "mean_token_accuracy": 1.0, "num_tokens": 12070942.0, "step": 3580 }, { "entropy": 2.067329040169716, "epoch": 2.5923785443380893, "grad_norm": 0.011225709691643715, "learning_rate": 9.894767708710187e-06, "loss": 0.0002632188843563199, "mean_token_accuracy": 1.0, "num_tokens": 12103626.0, "step": 3590 }, { "entropy": 2.114652419090271, "epoch": 2.599602672927578, "grad_norm": 0.0012341891415417194, "learning_rate": 9.848000849442115e-06, "loss": 0.00045462558045983315, "mean_token_accuracy": 1.0, "num_tokens": 12140496.0, "step": 3600 }, { "entropy": 1.9965310275554657, "epoch": 2.606826801517067, "grad_norm": 0.0031538368202745914, "learning_rate": 9.801237315156958e-06, "loss": 0.00018033559899777174, "mean_token_accuracy": 1.0, "num_tokens": 12174214.0, "step": 3610 }, { "entropy": 2.0614873960614206, "epoch": 2.614050930106556, "grad_norm": 0.0019219790119677782, "learning_rate": 9.754478128807488e-06, "loss": 0.00020585947204381226, "mean_token_accuracy": 1.0, "num_tokens": 12204992.0, "step": 3620 }, { "entropy": 2.1520297437906266, "epoch": 2.6212750586960447, "grad_norm": 0.003325063269585371, "learning_rate": 9.707724313251367e-06, "loss": 0.0006235354579985142, "mean_token_accuracy": 1.0, "num_tokens": 12236300.0, "step": 3630 }, { "entropy": 1.9406953275203704, "epoch": 2.6284991872855334, "grad_norm": 0.001424752757884562, "learning_rate": 9.660976891228772e-06, "loss": 0.0002312889089807868, "mean_token_accuracy": 1.0, "num_tokens": 12280554.0, "step": 3640 }, { "entropy": 2.05175538957119, "epoch": 2.6357233158750226, "grad_norm": 0.0013753697276115417, "learning_rate": 9.614236885340018e-06, "loss": 0.00021411580964922906, "mean_token_accuracy": 1.0, "num_tokens": 12315314.0, "step": 3650 }, { "entropy": 2.0753579437732697, "epoch": 2.6429474444645114, "grad_norm": 0.030707193538546562, "learning_rate": 9.567505318023192e-06, "loss": 0.00024836480151861905, "mean_token_accuracy": 1.0, "num_tokens": 12350002.0, "step": 3660 }, { "entropy": 2.0509102582931518, "epoch": 2.650171573054, "grad_norm": 0.026452315971255302, "learning_rate": 9.520783211531792e-06, "loss": 0.0026783553883433344, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 12387908.0, "step": 3670 }, { "entropy": 2.0522196829319, "epoch": 2.6573957016434893, "grad_norm": 0.0006438027485273778, "learning_rate": 9.474071587912359e-06, "loss": 5.928742466494441e-05, "mean_token_accuracy": 1.0, "num_tokens": 12420677.0, "step": 3680 }, { "entropy": 2.0196869641542436, "epoch": 2.664619830232978, "grad_norm": 0.0011145708849653602, "learning_rate": 9.427371468982115e-06, "loss": 0.0005806103348731994, "mean_token_accuracy": 1.0, "num_tokens": 12457408.0, "step": 3690 }, { "entropy": 2.0822910487651827, "epoch": 2.671843958822467, "grad_norm": 0.09432120621204376, "learning_rate": 9.380683876306623e-06, "loss": 0.00019203609554097056, "mean_token_accuracy": 1.0, "num_tokens": 12493796.0, "step": 3700 }, { "entropy": 2.031005597114563, "epoch": 2.679068087411956, "grad_norm": 0.3591781556606293, "learning_rate": 9.334009831177433e-06, "loss": 0.014735683798789978, "mean_token_accuracy": 0.9961842104792595, "num_tokens": 12527387.0, "step": 3710 }, { "entropy": 2.040946564078331, "epoch": 2.686292216001445, "grad_norm": 0.0015764066483825445, "learning_rate": 9.287350354589742e-06, "loss": 0.00015463890740647913, "mean_token_accuracy": 1.0, "num_tokens": 12556284.0, "step": 3720 }, { "entropy": 2.0359088510274885, "epoch": 2.693516344590934, "grad_norm": 0.29461848735809326, "learning_rate": 9.240706467220056e-06, "loss": 0.00022188578732311725, "mean_token_accuracy": 1.0, "num_tokens": 12589295.0, "step": 3730 }, { "entropy": 2.060906508564949, "epoch": 2.7007404731804225, "grad_norm": 0.39082056283950806, "learning_rate": 9.194079189403875e-06, "loss": 0.0038298744708299636, "mean_token_accuracy": 0.9986842110753059, "num_tokens": 12627227.0, "step": 3740 }, { "entropy": 1.9807851999998092, "epoch": 2.7079646017699117, "grad_norm": 0.006283764727413654, "learning_rate": 9.147469541113358e-06, "loss": 0.00011564189335331321, "mean_token_accuracy": 1.0, "num_tokens": 12670866.0, "step": 3750 }, { "entropy": 2.022774323821068, "epoch": 2.7151887303594004, "grad_norm": 0.0015482399612665176, "learning_rate": 9.10087854193502e-06, "loss": 7.613286725245416e-05, "mean_token_accuracy": 1.0, "num_tokens": 12706262.0, "step": 3760 }, { "entropy": 2.0236416876316072, "epoch": 2.722412858948889, "grad_norm": 0.0006946782814338803, "learning_rate": 9.054307211047427e-06, "loss": 0.00010619325330480933, "mean_token_accuracy": 1.0, "num_tokens": 12741193.0, "step": 3770 }, { "entropy": 2.1197534084320067, "epoch": 2.7296369875383784, "grad_norm": 0.0009746414725668728, "learning_rate": 9.007756567198901e-06, "loss": 9.164836956188083e-05, "mean_token_accuracy": 1.0, "num_tokens": 12772725.0, "step": 3780 }, { "entropy": 2.100919196009636, "epoch": 2.736861116127867, "grad_norm": 0.06009179726243019, "learning_rate": 8.961227628685233e-06, "loss": 0.0018002629280090333, "mean_token_accuracy": 0.999479167163372, "num_tokens": 12802118.0, "step": 3790 }, { "entropy": 2.085750639438629, "epoch": 2.744085244717356, "grad_norm": 0.012048608623445034, "learning_rate": 8.914721413327413e-06, "loss": 0.00016923286020755767, "mean_token_accuracy": 1.0, "num_tokens": 12836979.0, "step": 3800 }, { "entropy": 2.058210352063179, "epoch": 2.751309373306845, "grad_norm": 0.0028724810108542442, "learning_rate": 8.868238938449359e-06, "loss": 0.0001348356483504176, "mean_token_accuracy": 1.0, "num_tokens": 12870957.0, "step": 3810 }, { "entropy": 2.060334774851799, "epoch": 2.7585335018963337, "grad_norm": 0.008394302800297737, "learning_rate": 8.821781220855664e-06, "loss": 0.004397500678896904, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 12904043.0, "step": 3820 }, { "entropy": 2.094987612962723, "epoch": 2.7657576304858225, "grad_norm": 0.11255097389221191, "learning_rate": 8.775349276809362e-06, "loss": 0.000713779591023922, "mean_token_accuracy": 1.0, "num_tokens": 12935070.0, "step": 3830 }, { "entropy": 2.0855062276124956, "epoch": 2.7729817590753116, "grad_norm": 0.0009015518589876592, "learning_rate": 8.728944122009681e-06, "loss": 0.005582309514284134, "mean_token_accuracy": 0.9984375, "num_tokens": 12967168.0, "step": 3840 }, { "entropy": 2.0803301841020585, "epoch": 2.7802058876648004, "grad_norm": 0.04961608350276947, "learning_rate": 8.682566771569844e-06, "loss": 0.00015667194966226817, "mean_token_accuracy": 1.0, "num_tokens": 12998789.0, "step": 3850 }, { "entropy": 2.0449639528989794, "epoch": 2.787430016254289, "grad_norm": 0.0016990930307656527, "learning_rate": 8.636218239994845e-06, "loss": 0.003403344750404358, "mean_token_accuracy": 0.999285714328289, "num_tokens": 13031593.0, "step": 3860 }, { "entropy": 2.077379512786865, "epoch": 2.7946541448437783, "grad_norm": 0.0010355949634686112, "learning_rate": 8.58989954115927e-06, "loss": 0.0002980584278702736, "mean_token_accuracy": 1.0, "num_tokens": 13065699.0, "step": 3870 }, { "entropy": 2.063441056013107, "epoch": 2.801878273433267, "grad_norm": 0.03642053157091141, "learning_rate": 8.543611688285111e-06, "loss": 9.34006820898503e-05, "mean_token_accuracy": 1.0, "num_tokens": 13092554.0, "step": 3880 }, { "entropy": 2.0276421874761583, "epoch": 2.8091024020227557, "grad_norm": 0.014171849004924297, "learning_rate": 8.497355693919605e-06, "loss": 0.00023828567937016486, "mean_token_accuracy": 1.0, "num_tokens": 13128152.0, "step": 3890 }, { "entropy": 2.05616457760334, "epoch": 2.816326530612245, "grad_norm": 0.011352301575243473, "learning_rate": 8.451132569913085e-06, "loss": 0.00010320036672055722, "mean_token_accuracy": 1.0, "num_tokens": 13156902.0, "step": 3900 }, { "entropy": 2.0568599939346313, "epoch": 2.8235506592017336, "grad_norm": 0.0081400815397501, "learning_rate": 8.404943327396842e-06, "loss": 0.00039729168638587, "mean_token_accuracy": 1.0, "num_tokens": 13193343.0, "step": 3910 }, { "entropy": 2.0809281915426254, "epoch": 2.830774787791223, "grad_norm": 0.0030671602580696344, "learning_rate": 8.358788976761014e-06, "loss": 0.000372506445273757, "mean_token_accuracy": 1.0, "num_tokens": 13228389.0, "step": 3920 }, { "entropy": 2.0903642386198045, "epoch": 2.8379989163807116, "grad_norm": 0.002352460753172636, "learning_rate": 8.312670527632473e-06, "loss": 4.645454173441976e-05, "mean_token_accuracy": 1.0, "num_tokens": 13256457.0, "step": 3930 }, { "entropy": 2.0301788434386254, "epoch": 2.8452230449702007, "grad_norm": 0.0036281412467360497, "learning_rate": 8.266588988852748e-06, "loss": 0.0001243971986696124, "mean_token_accuracy": 1.0, "num_tokens": 13289681.0, "step": 3940 }, { "entropy": 2.029602548480034, "epoch": 2.8524471735596895, "grad_norm": 0.002834299812093377, "learning_rate": 8.220545368455956e-06, "loss": 0.014585791528224945, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 13328416.0, "step": 3950 }, { "entropy": 2.063823339343071, "epoch": 2.859671302149178, "grad_norm": 0.003287531668320298, "learning_rate": 8.17454067364674e-06, "loss": 0.003944706171751022, "mean_token_accuracy": 0.995833332836628, "num_tokens": 13357159.0, "step": 3960 }, { "entropy": 2.078008511662483, "epoch": 2.8668954307386674, "grad_norm": 0.012140554375946522, "learning_rate": 8.128575910778257e-06, "loss": 0.0005927850026637316, "mean_token_accuracy": 1.0, "num_tokens": 13391270.0, "step": 3970 }, { "entropy": 2.0515424638986586, "epoch": 2.874119559328156, "grad_norm": 0.005324928089976311, "learning_rate": 8.082652085330145e-06, "loss": 4.898167098872363e-05, "mean_token_accuracy": 1.0, "num_tokens": 13426130.0, "step": 3980 }, { "entropy": 2.086466285586357, "epoch": 2.881343687917645, "grad_norm": 0.0037718871608376503, "learning_rate": 8.036770201886537e-06, "loss": 9.53549169935286e-05, "mean_token_accuracy": 1.0, "num_tokens": 13457128.0, "step": 3990 }, { "entropy": 2.065127009153366, "epoch": 2.888567816507134, "grad_norm": 0.0024332841858267784, "learning_rate": 7.990931264114087e-06, "loss": 6.472773966379464e-05, "mean_token_accuracy": 1.0, "num_tokens": 13488834.0, "step": 4000 }, { "epoch": 2.888567816507134, "eval_entropy": 1.8939840909455636, "eval_loss": 1.0826828479766846, "eval_mean_token_accuracy": 0.8724846162267862, "eval_num_tokens": 13488834.0, "eval_runtime": 1005.9483, "eval_samples_per_second": 7.606, "eval_steps_per_second": 0.951, "step": 4000 }, { "entropy": 2.081470862030983, "epoch": 2.8957919450966227, "grad_norm": 0.11557070910930634, "learning_rate": 7.94513627474001e-06, "loss": 0.0001834964146837592, "mean_token_accuracy": 1.0, "num_tokens": 13517745.0, "step": 4010 }, { "entropy": 2.0741114974021913, "epoch": 2.9030160736861115, "grad_norm": 0.011433808133006096, "learning_rate": 7.899386235530148e-06, "loss": 7.996972417458891e-05, "mean_token_accuracy": 1.0, "num_tokens": 13545439.0, "step": 4020 }, { "entropy": 2.0428703770041468, "epoch": 2.9102402022756007, "grad_norm": 0.0010173572227358818, "learning_rate": 7.853682147267059e-06, "loss": 0.004161747172474861, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 13582414.0, "step": 4030 }, { "entropy": 1.9939154922962188, "epoch": 2.9174643308650894, "grad_norm": 0.00418558344244957, "learning_rate": 7.808025009728125e-06, "loss": 0.0070745997130870816, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 13612293.0, "step": 4040 }, { "entropy": 2.051701617240906, "epoch": 2.924688459454578, "grad_norm": 0.3029954731464386, "learning_rate": 7.762415821663677e-06, "loss": 0.0010162684135138988, "mean_token_accuracy": 1.0, "num_tokens": 13645598.0, "step": 4050 }, { "entropy": 2.0056424707174303, "epoch": 2.9319125880440673, "grad_norm": 0.35396990180015564, "learning_rate": 7.716855580775155e-06, "loss": 0.0003054623492062092, "mean_token_accuracy": 1.0, "num_tokens": 13677891.0, "step": 4060 }, { "entropy": 2.0558212995529175, "epoch": 2.939136716633556, "grad_norm": 0.014027765952050686, "learning_rate": 7.671345283693274e-06, "loss": 0.00015732048777863383, "mean_token_accuracy": 1.0, "num_tokens": 13713298.0, "step": 4070 }, { "entropy": 2.057107946276665, "epoch": 2.9463608452230448, "grad_norm": 0.0469052754342556, "learning_rate": 7.625885925956235e-06, "loss": 0.00019727607723325492, "mean_token_accuracy": 1.0, "num_tokens": 13741705.0, "step": 4080 }, { "entropy": 1.9607576489448548, "epoch": 2.953584973812534, "grad_norm": 0.00442711403593421, "learning_rate": 7.580478501987932e-06, "loss": 0.00901368036866188, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 13773371.0, "step": 4090 }, { "entropy": 1.98673774600029, "epoch": 2.9608091024020227, "grad_norm": 0.015278922393918037, "learning_rate": 7.535124005076215e-06, "loss": 0.0002138084266334772, "mean_token_accuracy": 1.0, "num_tokens": 13808274.0, "step": 4100 }, { "entropy": 2.096168154478073, "epoch": 2.9680332309915114, "grad_norm": 0.0005756252794526517, "learning_rate": 7.489823427351146e-06, "loss": 0.00018357214285060763, "mean_token_accuracy": 1.0, "num_tokens": 13843522.0, "step": 4110 }, { "entropy": 2.060718294978142, "epoch": 2.9752573595810006, "grad_norm": 0.0011303877690806985, "learning_rate": 7.4445777597633115e-06, "loss": 0.009400687366724014, "mean_token_accuracy": 0.9980592116713524, "num_tokens": 13872279.0, "step": 4120 }, { "entropy": 2.013058941066265, "epoch": 2.9824814881704893, "grad_norm": 0.00043935581925325096, "learning_rate": 7.3993879920621336e-06, "loss": 6.445502513088285e-05, "mean_token_accuracy": 1.0, "num_tokens": 13909552.0, "step": 4130 }, { "entropy": 1.9740059912204742, "epoch": 2.9897056167599785, "grad_norm": 0.0009029169450514019, "learning_rate": 7.354255112774227e-06, "loss": 0.00041622747667133806, "mean_token_accuracy": 1.0, "num_tokens": 13950502.0, "step": 4140 }, { "entropy": 2.062269702553749, "epoch": 2.996929745349467, "grad_norm": 0.002542090369388461, "learning_rate": 7.309180109181769e-06, "loss": 0.0012434286065399647, "mean_token_accuracy": 1.0, "num_tokens": 13985325.0, "step": 4150 }, { "entropy": 2.0545924515337557, "epoch": 3.0036120642947446, "grad_norm": 0.0019471081905066967, "learning_rate": 7.264163967300908e-06, "loss": 6.45760737825185e-05, "mean_token_accuracy": 1.0, "num_tokens": 14020377.0, "step": 4160 }, { "entropy": 2.053666239976883, "epoch": 3.0108361928842333, "grad_norm": 0.01275340560823679, "learning_rate": 7.2192076718601914e-06, "loss": 5.218477454036474e-05, "mean_token_accuracy": 1.0, "num_tokens": 14054964.0, "step": 4170 }, { "entropy": 2.05324681699276, "epoch": 3.018060321473722, "grad_norm": 0.003125807736068964, "learning_rate": 7.174312206279022e-06, "loss": 0.002049664966762066, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 14086930.0, "step": 4180 }, { "entropy": 2.0771075263619423, "epoch": 3.0252844500632112, "grad_norm": 0.0010819229064509273, "learning_rate": 7.129478552646153e-06, "loss": 0.0001039954018779099, "mean_token_accuracy": 1.0, "num_tokens": 14124095.0, "step": 4190 }, { "entropy": 2.0247433304786684, "epoch": 3.0325085786527, "grad_norm": 0.0011280939215794206, "learning_rate": 7.084707691698198e-06, "loss": 7.054000161588192e-05, "mean_token_accuracy": 1.0, "num_tokens": 14159941.0, "step": 4200 }, { "entropy": 2.043915817141533, "epoch": 3.039732707242189, "grad_norm": 0.018443454056978226, "learning_rate": 7.040000602798183e-06, "loss": 0.0099873349070549, "mean_token_accuracy": 0.9983333334326744, "num_tokens": 14192414.0, "step": 4210 }, { "entropy": 2.0046940714120867, "epoch": 3.046956835831678, "grad_norm": 0.0009632164146751165, "learning_rate": 6.995358263914115e-06, "loss": 0.0003674726001918316, "mean_token_accuracy": 1.0, "num_tokens": 14227241.0, "step": 4220 }, { "entropy": 2.033160814642906, "epoch": 3.0541809644211666, "grad_norm": 0.0031618638895452023, "learning_rate": 6.950781651597598e-06, "loss": 4.04816324589774e-05, "mean_token_accuracy": 1.0, "num_tokens": 14256661.0, "step": 4230 }, { "entropy": 2.0661414325237275, "epoch": 3.0614050930106558, "grad_norm": 0.0018059182912111282, "learning_rate": 6.906271740962465e-06, "loss": 0.004481592774391174, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 14292544.0, "step": 4240 }, { "entropy": 2.0076374232769014, "epoch": 3.0686292216001445, "grad_norm": 0.0018631487619131804, "learning_rate": 6.861829505663449e-06, "loss": 5.830081645399332e-05, "mean_token_accuracy": 1.0, "num_tokens": 14324498.0, "step": 4250 }, { "entropy": 2.0799363285303114, "epoch": 3.0758533501896332, "grad_norm": 0.0013724598102271557, "learning_rate": 6.817455917874885e-06, "loss": 0.00023024685215204953, "mean_token_accuracy": 1.0, "num_tokens": 14354881.0, "step": 4260 }, { "entropy": 2.1223824709653853, "epoch": 3.0830774787791224, "grad_norm": 0.0013472167775034904, "learning_rate": 6.773151948269442e-06, "loss": 0.0002774083754047751, "mean_token_accuracy": 1.0, "num_tokens": 14386303.0, "step": 4270 }, { "entropy": 2.040089511871338, "epoch": 3.090301607368611, "grad_norm": 0.0028757641557604074, "learning_rate": 6.728918565996891e-06, "loss": 0.0002688025590032339, "mean_token_accuracy": 1.0, "num_tokens": 14422045.0, "step": 4280 }, { "entropy": 2.03407336473465, "epoch": 3.0975257359581, "grad_norm": 0.0008419603109359741, "learning_rate": 6.684756738662908e-06, "loss": 0.00011189808137714862, "mean_token_accuracy": 1.0, "num_tokens": 14455751.0, "step": 4290 }, { "entropy": 2.0355051040649412, "epoch": 3.104749864547589, "grad_norm": 0.0015740561066195369, "learning_rate": 6.640667432307894e-06, "loss": 5.130659556016326e-05, "mean_token_accuracy": 1.0, "num_tokens": 14493691.0, "step": 4300 }, { "entropy": 2.000814378261566, "epoch": 3.111973993137078, "grad_norm": 0.0007698965491726995, "learning_rate": 6.596651611385865e-06, "loss": 5.027313018217683e-05, "mean_token_accuracy": 1.0, "num_tokens": 14529860.0, "step": 4310 }, { "entropy": 2.077588292956352, "epoch": 3.1191981217265665, "grad_norm": 0.0005067693418823183, "learning_rate": 6.552710238743336e-06, "loss": 0.00013087192783132196, "mean_token_accuracy": 1.0, "num_tokens": 14555834.0, "step": 4320 }, { "entropy": 2.0925796955823897, "epoch": 3.1264222503160557, "grad_norm": 0.006536214146763086, "learning_rate": 6.508844275598263e-06, "loss": 0.00019935504533350468, "mean_token_accuracy": 1.0, "num_tokens": 14587367.0, "step": 4330 }, { "entropy": 2.0527830511331557, "epoch": 3.1336463789055444, "grad_norm": 0.04956198111176491, "learning_rate": 6.465054681519025e-06, "loss": 9.359649848192931e-05, "mean_token_accuracy": 1.0, "num_tokens": 14622396.0, "step": 4340 }, { "entropy": 1.9672885686159134, "epoch": 3.1408705074950336, "grad_norm": 0.0006884578033350408, "learning_rate": 6.421342414403422e-06, "loss": 0.00013261778512969614, "mean_token_accuracy": 1.0, "num_tokens": 14656692.0, "step": 4350 }, { "entropy": 2.072387820482254, "epoch": 3.1480946360845223, "grad_norm": 0.018161380663514137, "learning_rate": 6.377708430457728e-06, "loss": 0.00018474491080269217, "mean_token_accuracy": 1.0, "num_tokens": 14689145.0, "step": 4360 }, { "entropy": 2.024577698111534, "epoch": 3.155318764674011, "grad_norm": 0.0033226576633751392, "learning_rate": 6.334153684175771e-06, "loss": 0.0005758251994848251, "mean_token_accuracy": 1.0, "num_tokens": 14722326.0, "step": 4370 }, { "entropy": 2.049726849794388, "epoch": 3.1625428932635002, "grad_norm": 0.001250626053661108, "learning_rate": 6.290679128318054e-06, "loss": 8.391140145249664e-05, "mean_token_accuracy": 1.0, "num_tokens": 14752330.0, "step": 4380 }, { "entropy": 2.0609421640634538, "epoch": 3.169767021852989, "grad_norm": 0.002631265204399824, "learning_rate": 6.247285713890918e-06, "loss": 0.00014461235841736197, "mean_token_accuracy": 1.0, "num_tokens": 14789123.0, "step": 4390 }, { "entropy": 1.967462283372879, "epoch": 3.1769911504424777, "grad_norm": 0.017055487260222435, "learning_rate": 6.203974390125724e-06, "loss": 9.934637928381563e-05, "mean_token_accuracy": 1.0, "num_tokens": 14824386.0, "step": 4400 }, { "entropy": 1.9794509530067443, "epoch": 3.184215279031967, "grad_norm": 0.011362893506884575, "learning_rate": 6.160746104458111e-06, "loss": 5.548715707845986e-05, "mean_token_accuracy": 1.0, "num_tokens": 14861051.0, "step": 4410 }, { "entropy": 2.071438956260681, "epoch": 3.1914394076214556, "grad_norm": 0.0026533612981438637, "learning_rate": 6.117601802507249e-06, "loss": 0.00016078923363238573, "mean_token_accuracy": 1.0, "num_tokens": 14892203.0, "step": 4420 }, { "entropy": 2.0377372980117796, "epoch": 3.1986635362109443, "grad_norm": 0.01846657320857048, "learning_rate": 6.0745424280551725e-06, "loss": 0.00072297896258533, "mean_token_accuracy": 1.0, "num_tokens": 14924515.0, "step": 4430 }, { "entropy": 2.0567080438137055, "epoch": 3.2058876648004335, "grad_norm": 0.005206569097936153, "learning_rate": 6.031568923026119e-06, "loss": 0.00012273758184164763, "mean_token_accuracy": 1.0, "num_tokens": 14957918.0, "step": 4440 }, { "entropy": 2.028385517001152, "epoch": 3.2131117933899223, "grad_norm": 0.01966731622815132, "learning_rate": 5.988682227465934e-06, "loss": 0.00015165915247052907, "mean_token_accuracy": 1.0, "num_tokens": 14990794.0, "step": 4450 }, { "entropy": 1.9939093351364137, "epoch": 3.2203359219794114, "grad_norm": 0.007970397360622883, "learning_rate": 5.945883279521508e-06, "loss": 0.00010207220911979675, "mean_token_accuracy": 1.0, "num_tokens": 15032262.0, "step": 4460 }, { "entropy": 2.0098903119564056, "epoch": 3.2275600505689, "grad_norm": 0.006879137828946114, "learning_rate": 5.903173015420244e-06, "loss": 8.936674566939473e-05, "mean_token_accuracy": 1.0, "num_tokens": 15064056.0, "step": 4470 }, { "entropy": 2.026275262236595, "epoch": 3.234784179158389, "grad_norm": 0.0008903327980078757, "learning_rate": 5.860552369449591e-06, "loss": 0.00019860574975609778, "mean_token_accuracy": 1.0, "num_tokens": 15101750.0, "step": 4480 }, { "entropy": 2.035792517662048, "epoch": 3.242008307747878, "grad_norm": 0.0385742224752903, "learning_rate": 5.8180222739366014e-06, "loss": 0.00011005952255800366, "mean_token_accuracy": 1.0, "num_tokens": 15132217.0, "step": 4490 }, { "entropy": 2.0055119007825852, "epoch": 3.249232436337367, "grad_norm": 0.014958804473280907, "learning_rate": 5.77558365922753e-06, "loss": 8.74112593010068e-05, "mean_token_accuracy": 1.0, "num_tokens": 15165100.0, "step": 4500 }, { "epoch": 3.249232436337367, "eval_entropy": 1.8884758904436165, "eval_loss": 1.0809279680252075, "eval_mean_token_accuracy": 0.8737331791980388, "eval_num_tokens": 15165100.0, "eval_runtime": 1004.9032, "eval_samples_per_second": 7.614, "eval_steps_per_second": 0.952, "step": 4500 }, { "entropy": 2.0021767020225525, "epoch": 3.2564565649268555, "grad_norm": 0.0017272443510591984, "learning_rate": 5.7332374536674914e-06, "loss": 0.00018979933811351656, "mean_token_accuracy": 1.0, "num_tokens": 15203811.0, "step": 4510 }, { "entropy": 2.0449478060007094, "epoch": 3.2636806935163447, "grad_norm": 0.0016825678758323193, "learning_rate": 5.690984583580155e-06, "loss": 0.0001557380543090403, "mean_token_accuracy": 1.0, "num_tokens": 15235220.0, "step": 4520 }, { "entropy": 2.0222400814294814, "epoch": 3.2709048221058334, "grad_norm": 0.24223871529102325, "learning_rate": 5.648825973247459e-06, "loss": 0.00020689407829195262, "mean_token_accuracy": 1.0, "num_tokens": 15271037.0, "step": 4530 }, { "entropy": 2.000539484620094, "epoch": 3.278128950695322, "grad_norm": 0.0028660078532993793, "learning_rate": 5.60676254488943e-06, "loss": 0.00011368633713573217, "mean_token_accuracy": 1.0, "num_tokens": 15305922.0, "step": 4540 }, { "entropy": 2.029051575064659, "epoch": 3.2853530792848114, "grad_norm": 0.00038728417712263763, "learning_rate": 5.56479521864397e-06, "loss": 7.007254171185196e-05, "mean_token_accuracy": 1.0, "num_tokens": 15337389.0, "step": 4550 }, { "entropy": 2.0867973893880842, "epoch": 3.2925772078743, "grad_norm": 0.0017691091634333134, "learning_rate": 5.522924912546761e-06, "loss": 2.9183743754401804e-05, "mean_token_accuracy": 1.0, "num_tokens": 15367632.0, "step": 4560 }, { "entropy": 2.038247913122177, "epoch": 3.299801336463789, "grad_norm": 0.001519956742413342, "learning_rate": 5.481152542511152e-06, "loss": 6.189012783579529e-05, "mean_token_accuracy": 1.0, "num_tokens": 15398365.0, "step": 4570 }, { "entropy": 2.0492154121398927, "epoch": 3.307025465053278, "grad_norm": 0.05697038024663925, "learning_rate": 5.439479022308156e-06, "loss": 0.00017389660933986306, "mean_token_accuracy": 1.0, "num_tokens": 15429567.0, "step": 4580 }, { "entropy": 1.9483360826969147, "epoch": 3.3142495936427667, "grad_norm": 0.0008817281923256814, "learning_rate": 5.3979052635464325e-06, "loss": 7.576268981210888e-05, "mean_token_accuracy": 1.0, "num_tokens": 15463743.0, "step": 4590 }, { "entropy": 2.0008713573217394, "epoch": 3.321473722232256, "grad_norm": 0.010526027530431747, "learning_rate": 5.35643217565237e-06, "loss": 4.54952591098845e-05, "mean_token_accuracy": 1.0, "num_tokens": 15491685.0, "step": 4600 }, { "entropy": 2.0740255534648897, "epoch": 3.3286978508217446, "grad_norm": 0.0018182476051151752, "learning_rate": 5.315060665850165e-06, "loss": 5.49975608009845e-05, "mean_token_accuracy": 1.0, "num_tokens": 15522064.0, "step": 4610 }, { "entropy": 2.0470830738544463, "epoch": 3.3359219794112334, "grad_norm": 0.0010773467365652323, "learning_rate": 5.273791639142012e-06, "loss": 7.785457419231533e-05, "mean_token_accuracy": 1.0, "num_tokens": 15554349.0, "step": 4620 }, { "entropy": 2.075201654434204, "epoch": 3.3431461080007225, "grad_norm": 0.0010672385105863214, "learning_rate": 5.2326259982882675e-06, "loss": 7.268890622071921e-05, "mean_token_accuracy": 1.0, "num_tokens": 15587755.0, "step": 4630 }, { "entropy": 1.974511331319809, "epoch": 3.3503702365902113, "grad_norm": 0.02245929464697838, "learning_rate": 5.191564643787739e-06, "loss": 8.146609761752188e-05, "mean_token_accuracy": 1.0, "num_tokens": 15619055.0, "step": 4640 }, { "entropy": 2.1137306481599807, "epoch": 3.3575943651797004, "grad_norm": 0.02009975165128708, "learning_rate": 5.150608473857951e-06, "loss": 9.43507591728121e-05, "mean_token_accuracy": 1.0, "num_tokens": 15651956.0, "step": 4650 }, { "entropy": 2.054837018251419, "epoch": 3.364818493769189, "grad_norm": 0.0010314187966287136, "learning_rate": 5.109758384415533e-06, "loss": 0.00012439355487003922, "mean_token_accuracy": 1.0, "num_tokens": 15686287.0, "step": 4660 }, { "entropy": 2.0372716188430786, "epoch": 3.372042622358678, "grad_norm": 0.003698289394378662, "learning_rate": 5.069015269056587e-06, "loss": 9.244094835594296e-05, "mean_token_accuracy": 1.0, "num_tokens": 15719188.0, "step": 4670 }, { "entropy": 2.055976676940918, "epoch": 3.379266750948167, "grad_norm": 0.03741403669118881, "learning_rate": 5.028380019037165e-06, "loss": 0.00013077817857265472, "mean_token_accuracy": 1.0, "num_tokens": 15752790.0, "step": 4680 }, { "entropy": 2.085843190550804, "epoch": 3.386490879537656, "grad_norm": 0.0007527766865678132, "learning_rate": 4.98785352325376e-06, "loss": 5.083156866021454e-05, "mean_token_accuracy": 1.0, "num_tokens": 15787893.0, "step": 4690 }, { "entropy": 2.032337984442711, "epoch": 3.3937150081271446, "grad_norm": 0.001193483010865748, "learning_rate": 4.9474366682238664e-06, "loss": 0.00010785561753436922, "mean_token_accuracy": 1.0, "num_tokens": 15823196.0, "step": 4700 }, { "entropy": 2.017588832974434, "epoch": 3.4009391367166337, "grad_norm": 0.000920341641176492, "learning_rate": 4.907130338066589e-06, "loss": 6.847251788713037e-05, "mean_token_accuracy": 1.0, "num_tokens": 15858171.0, "step": 4710 }, { "entropy": 2.014309874176979, "epoch": 3.4081632653061225, "grad_norm": 0.0028325754683464766, "learning_rate": 4.866935414483291e-06, "loss": 6.0408358694985506e-05, "mean_token_accuracy": 1.0, "num_tokens": 15888184.0, "step": 4720 }, { "entropy": 1.9666501939296723, "epoch": 3.415387393895611, "grad_norm": 0.0004978736978955567, "learning_rate": 4.8268527767383266e-06, "loss": 6.155979936011136e-05, "mean_token_accuracy": 1.0, "num_tokens": 15925857.0, "step": 4730 }, { "entropy": 2.1072573363780975, "epoch": 3.4226115224851004, "grad_norm": 0.0013934965245425701, "learning_rate": 4.786883301639786e-06, "loss": 9.986537043005228e-05, "mean_token_accuracy": 1.0, "num_tokens": 15955224.0, "step": 4740 }, { "entropy": 2.01272608935833, "epoch": 3.429835651074589, "grad_norm": 0.004395121242851019, "learning_rate": 4.747027863520337e-06, "loss": 8.816031040623785e-05, "mean_token_accuracy": 1.0, "num_tokens": 15987442.0, "step": 4750 }, { "entropy": 1.9714742422103881, "epoch": 3.437059779664078, "grad_norm": 0.0011384258978068829, "learning_rate": 4.7072873342180735e-06, "loss": 0.0002765763783827424, "mean_token_accuracy": 1.0, "num_tokens": 16024444.0, "step": 4760 }, { "entropy": 2.0219936460256576, "epoch": 3.444283908253567, "grad_norm": 0.0011205687187612057, "learning_rate": 4.667662583057473e-06, "loss": 5.4150784853845836e-05, "mean_token_accuracy": 1.0, "num_tokens": 16061081.0, "step": 4770 }, { "entropy": 1.9706620872020721, "epoch": 3.4515080368430557, "grad_norm": 0.008661802858114243, "learning_rate": 4.628154476830348e-06, "loss": 5.808487185277045e-05, "mean_token_accuracy": 1.0, "num_tokens": 16101282.0, "step": 4780 }, { "entropy": 2.010636579990387, "epoch": 3.4587321654325445, "grad_norm": 0.016732508316636086, "learning_rate": 4.58876387977692e-06, "loss": 0.00012360099935904145, "mean_token_accuracy": 1.0, "num_tokens": 16138042.0, "step": 4790 }, { "entropy": 2.015199688076973, "epoch": 3.4659562940220336, "grad_norm": 0.0014761262573301792, "learning_rate": 4.549491653566879e-06, "loss": 4.3076850124634804e-05, "mean_token_accuracy": 1.0, "num_tokens": 16171761.0, "step": 4800 }, { "entropy": 1.9639876455068588, "epoch": 3.4731804226115224, "grad_norm": 0.07578303664922714, "learning_rate": 4.5103386572805676e-06, "loss": 0.0001370429410599172, "mean_token_accuracy": 1.0, "num_tokens": 16208331.0, "step": 4810 }, { "entropy": 2.0875407248735427, "epoch": 3.4804045512010116, "grad_norm": 0.0006163098732940853, "learning_rate": 4.471305747390159e-06, "loss": 8.360695792362094e-05, "mean_token_accuracy": 1.0, "num_tokens": 16239154.0, "step": 4820 }, { "entropy": 2.053487077355385, "epoch": 3.4876286797905003, "grad_norm": 0.0032585824374109507, "learning_rate": 4.432393777740945e-06, "loss": 6.120784091763198e-05, "mean_token_accuracy": 1.0, "num_tokens": 16273072.0, "step": 4830 }, { "entropy": 2.1002973705530166, "epoch": 3.494852808379989, "grad_norm": 0.004883012268692255, "learning_rate": 4.393603599532642e-06, "loss": 6.172609282657504e-05, "mean_token_accuracy": 1.0, "num_tokens": 16305328.0, "step": 4840 }, { "entropy": 2.0459698259830477, "epoch": 3.502076936969478, "grad_norm": 0.0010911468416452408, "learning_rate": 4.354936061300784e-06, "loss": 8.416592027060688e-05, "mean_token_accuracy": 1.0, "num_tokens": 16336726.0, "step": 4850 }, { "entropy": 1.9999713480472565, "epoch": 3.509301065558967, "grad_norm": 0.0006581201450899243, "learning_rate": 4.3163920088981434e-06, "loss": 5.7820964138954876e-05, "mean_token_accuracy": 1.0, "num_tokens": 16374779.0, "step": 4860 }, { "entropy": 2.0465083062648772, "epoch": 3.516525194148456, "grad_norm": 0.00047667152830399573, "learning_rate": 4.277972285476255e-06, "loss": 4.597740771714598e-05, "mean_token_accuracy": 1.0, "num_tokens": 16404204.0, "step": 4870 }, { "entropy": 1.9927714973688126, "epoch": 3.523749322737945, "grad_norm": 0.007273843511939049, "learning_rate": 4.239677731466939e-06, "loss": 0.00034961386118084194, "mean_token_accuracy": 1.0, "num_tokens": 16439756.0, "step": 4880 }, { "entropy": 2.025309592485428, "epoch": 3.5309734513274336, "grad_norm": 0.0002263276546727866, "learning_rate": 4.201509184563947e-06, "loss": 8.668734808452428e-05, "mean_token_accuracy": 1.0, "num_tokens": 16475447.0, "step": 4890 }, { "entropy": 2.0977191269397735, "epoch": 3.5381975799169227, "grad_norm": 0.0010200958931818604, "learning_rate": 4.163467479704612e-06, "loss": 4.953600000590086e-05, "mean_token_accuracy": 1.0, "num_tokens": 16504583.0, "step": 4900 }, { "entropy": 2.088295194506645, "epoch": 3.5454217085064115, "grad_norm": 0.0011138464324176311, "learning_rate": 4.1255534490516105e-06, "loss": 4.0841943700797856e-05, "mean_token_accuracy": 1.0, "num_tokens": 16539294.0, "step": 4910 }, { "entropy": 2.0325693815946577, "epoch": 3.5526458370959, "grad_norm": 0.10155083239078522, "learning_rate": 4.087767921974727e-06, "loss": 0.0002867079107090831, "mean_token_accuracy": 1.0, "num_tokens": 16572157.0, "step": 4920 }, { "entropy": 2.084858962893486, "epoch": 3.5598699656853894, "grad_norm": 0.0021113206166774035, "learning_rate": 4.050111725032746e-06, "loss": 5.9655355289578435e-05, "mean_token_accuracy": 1.0, "num_tokens": 16605161.0, "step": 4930 }, { "entropy": 1.975836205482483, "epoch": 3.567094094274878, "grad_norm": 0.0003153013240080327, "learning_rate": 4.012585681955339e-06, "loss": 0.00014247578801587223, "mean_token_accuracy": 1.0, "num_tokens": 16638719.0, "step": 4940 }, { "entropy": 1.9811270862817765, "epoch": 3.574318222864367, "grad_norm": 0.0007030869019217789, "learning_rate": 3.975190613625076e-06, "loss": 0.0007503291126340628, "mean_token_accuracy": 1.0, "num_tokens": 16677651.0, "step": 4950 }, { "entropy": 2.093290412425995, "epoch": 3.581542351453856, "grad_norm": 0.0005874686175957322, "learning_rate": 3.93792733805944e-06, "loss": 8.813977474346757e-05, "mean_token_accuracy": 1.0, "num_tokens": 16710154.0, "step": 4960 }, { "entropy": 2.02408949136734, "epoch": 3.5887664800433448, "grad_norm": 0.0016752072842791677, "learning_rate": 3.900796670392952e-06, "loss": 5.5695866467431185e-05, "mean_token_accuracy": 1.0, "num_tokens": 16744349.0, "step": 4970 }, { "entropy": 2.050968898832798, "epoch": 3.5959906086328335, "grad_norm": 0.0057442523539066315, "learning_rate": 3.863799422859328e-06, "loss": 5.2600842900574206e-05, "mean_token_accuracy": 1.0, "num_tokens": 16779567.0, "step": 4980 }, { "entropy": 2.062971496582031, "epoch": 3.6032147372223227, "grad_norm": 0.01761898770928383, "learning_rate": 3.826936404773729e-06, "loss": 0.00018251293804496526, "mean_token_accuracy": 1.0, "num_tokens": 16814218.0, "step": 4990 }, { "entropy": 2.0626443684101106, "epoch": 3.6104388658118114, "grad_norm": 0.022460924461483955, "learning_rate": 3.7902084225150325e-06, "loss": 0.00012502372264862062, "mean_token_accuracy": 1.0, "num_tokens": 16846468.0, "step": 5000 }, { "epoch": 3.6104388658118114, "eval_entropy": 1.8869691470573688, "eval_loss": 1.1117266416549683, "eval_mean_token_accuracy": 0.8723597162195882, "eval_num_tokens": 16846468.0, "eval_runtime": 1005.0317, "eval_samples_per_second": 7.613, "eval_steps_per_second": 0.952, "step": 5000 }, { "entropy": 2.0077989429235457, "epoch": 3.6176629944013, "grad_norm": 0.0006305546266958117, "learning_rate": 3.7536162795082175e-06, "loss": 5.892690387554467e-05, "mean_token_accuracy": 1.0, "num_tokens": 16878696.0, "step": 5010 }, { "entropy": 2.09415146112442, "epoch": 3.6248871229907893, "grad_norm": 0.0026127202436327934, "learning_rate": 3.7171607762067664e-06, "loss": 3.7291095941327514e-05, "mean_token_accuracy": 1.0, "num_tokens": 16911183.0, "step": 5020 }, { "entropy": 2.0023372024297714, "epoch": 3.632111251580278, "grad_norm": 0.0015028188936412334, "learning_rate": 3.6808427100751785e-06, "loss": 5.9176504146307705e-05, "mean_token_accuracy": 1.0, "num_tokens": 16943059.0, "step": 5030 }, { "entropy": 2.0355609893798827, "epoch": 3.6393353801697668, "grad_norm": 0.0012083424953743815, "learning_rate": 3.644662875571503e-06, "loss": 2.9069939046166837e-05, "mean_token_accuracy": 1.0, "num_tokens": 16973792.0, "step": 5040 }, { "entropy": 2.065312069654465, "epoch": 3.646559508759256, "grad_norm": 0.002507750876247883, "learning_rate": 3.608622064129982e-06, "loss": 4.3749200995080176e-05, "mean_token_accuracy": 1.0, "num_tokens": 17009089.0, "step": 5050 }, { "entropy": 2.0725962966680527, "epoch": 3.6537836373487447, "grad_norm": 0.010749811306595802, "learning_rate": 3.5727210641437126e-06, "loss": 5.394321633502841e-05, "mean_token_accuracy": 1.0, "num_tokens": 17046624.0, "step": 5060 }, { "entropy": 2.055601179599762, "epoch": 3.661007765938234, "grad_norm": 0.021961471065878868, "learning_rate": 3.5369606609474307e-06, "loss": 6.937128491699696e-05, "mean_token_accuracy": 1.0, "num_tokens": 17082420.0, "step": 5070 }, { "entropy": 1.9774365901947022, "epoch": 3.6682318945277226, "grad_norm": 0.004600843880325556, "learning_rate": 3.5013416368003005e-06, "loss": 3.830065543297678e-05, "mean_token_accuracy": 1.0, "num_tokens": 17116764.0, "step": 5080 }, { "entropy": 2.1132187873125075, "epoch": 3.6754560231172118, "grad_norm": 0.0004788452060893178, "learning_rate": 3.465864770868833e-06, "loss": 2.8599039069376886e-05, "mean_token_accuracy": 1.0, "num_tokens": 17144115.0, "step": 5090 }, { "entropy": 1.9877906680107116, "epoch": 3.6826801517067005, "grad_norm": 0.000511924852617085, "learning_rate": 3.430530839209817e-06, "loss": 4.964641411788762e-05, "mean_token_accuracy": 1.0, "num_tokens": 17177077.0, "step": 5100 }, { "entropy": 1.9881062805652618, "epoch": 3.689904280296189, "grad_norm": 0.0019181350944563746, "learning_rate": 3.3953406147533508e-06, "loss": 4.389421083033085e-05, "mean_token_accuracy": 1.0, "num_tokens": 17213359.0, "step": 5110 }, { "entropy": 2.070028159022331, "epoch": 3.6971284088856784, "grad_norm": 0.005504785571247339, "learning_rate": 3.360294867285948e-06, "loss": 4.010663251392543e-05, "mean_token_accuracy": 1.0, "num_tokens": 17244540.0, "step": 5120 }, { "entropy": 1.9767438888549804, "epoch": 3.704352537475167, "grad_norm": 0.0003027736092917621, "learning_rate": 3.325394363433674e-06, "loss": 3.884226316586137e-05, "mean_token_accuracy": 1.0, "num_tokens": 17279513.0, "step": 5130 }, { "entropy": 2.043398728966713, "epoch": 3.711576666064656, "grad_norm": 0.0009300747769884765, "learning_rate": 3.2906398666453975e-06, "loss": 5.342182121239603e-05, "mean_token_accuracy": 1.0, "num_tokens": 17308432.0, "step": 5140 }, { "entropy": 2.0269203215837477, "epoch": 3.718800794654145, "grad_norm": 0.0010025069350376725, "learning_rate": 3.256032137176075e-06, "loss": 4.8141475417651236e-05, "mean_token_accuracy": 1.0, "num_tokens": 17341587.0, "step": 5150 }, { "entropy": 2.045577418804169, "epoch": 3.7260249232436338, "grad_norm": 0.007715600077062845, "learning_rate": 3.2215719320701322e-06, "loss": 0.005004372447729111, "mean_token_accuracy": 0.9984375, "num_tokens": 17373509.0, "step": 5160 }, { "entropy": 2.0684278547763824, "epoch": 3.7332490518331225, "grad_norm": 0.0007976724882610142, "learning_rate": 3.1872600051448922e-06, "loss": 5.152486264705658e-05, "mean_token_accuracy": 1.0, "num_tokens": 17406403.0, "step": 5170 }, { "entropy": 2.023306903243065, "epoch": 3.7404731804226117, "grad_norm": 0.0015424734447151423, "learning_rate": 3.1530971069740966e-06, "loss": 0.00023578524123877287, "mean_token_accuracy": 1.0, "num_tokens": 17443555.0, "step": 5180 }, { "entropy": 1.9953484445810319, "epoch": 3.7476973090121004, "grad_norm": 0.0004028415132779628, "learning_rate": 3.119083984871476e-06, "loss": 0.00022710610646754504, "mean_token_accuracy": 1.0, "num_tokens": 17480119.0, "step": 5190 }, { "entropy": 2.009831804037094, "epoch": 3.754921437601589, "grad_norm": 0.003044330282136798, "learning_rate": 3.085221382874417e-06, "loss": 6.885324837639928e-05, "mean_token_accuracy": 1.0, "num_tokens": 17513720.0, "step": 5200 }, { "entropy": 1.9898712247610093, "epoch": 3.7621455661910783, "grad_norm": 0.0006311017787083983, "learning_rate": 3.0515100417276642e-06, "loss": 0.00010676863603293895, "mean_token_accuracy": 1.0, "num_tokens": 17548810.0, "step": 5210 }, { "entropy": 2.031584769487381, "epoch": 3.769369694780567, "grad_norm": 0.005535018630325794, "learning_rate": 3.0179506988671435e-06, "loss": 0.001260968390852213, "mean_token_accuracy": 1.0, "num_tokens": 17585065.0, "step": 5220 }, { "entropy": 2.011755895614624, "epoch": 3.776593823370056, "grad_norm": 0.0042891171760857105, "learning_rate": 2.9845440884038046e-06, "loss": 0.00010934327729046344, "mean_token_accuracy": 1.0, "num_tokens": 17618270.0, "step": 5230 }, { "entropy": 2.02085902094841, "epoch": 3.783817951959545, "grad_norm": 0.0007354042027145624, "learning_rate": 2.951290941107585e-06, "loss": 0.00011397586204111576, "mean_token_accuracy": 1.0, "num_tokens": 17655698.0, "step": 5240 }, { "entropy": 2.014476954936981, "epoch": 3.7910420805490337, "grad_norm": 0.0014770718989893794, "learning_rate": 2.9181919843914055e-06, "loss": 0.00023540158290416002, "mean_token_accuracy": 1.0, "num_tokens": 17686863.0, "step": 5250 }, { "entropy": 2.0327656120061874, "epoch": 3.7982662091385224, "grad_norm": 0.007617010269314051, "learning_rate": 2.885247942295274e-06, "loss": 9.638697374612094e-05, "mean_token_accuracy": 1.0, "num_tokens": 17724248.0, "step": 5260 }, { "entropy": 1.9850782930850983, "epoch": 3.8054903377280116, "grad_norm": 0.005483856424689293, "learning_rate": 2.852459535470431e-06, "loss": 7.874672883190215e-05, "mean_token_accuracy": 1.0, "num_tokens": 17758437.0, "step": 5270 }, { "entropy": 2.0032659009099008, "epoch": 3.8127144663175003, "grad_norm": 0.00028377847047522664, "learning_rate": 2.819827481163603e-06, "loss": 3.7973991129547355e-05, "mean_token_accuracy": 1.0, "num_tokens": 17790728.0, "step": 5280 }, { "entropy": 1.978261086344719, "epoch": 3.8199385949069895, "grad_norm": 0.0018890398787334561, "learning_rate": 2.787352493201294e-06, "loss": 7.107729325070978e-05, "mean_token_accuracy": 1.0, "num_tokens": 17829297.0, "step": 5290 }, { "entropy": 2.003551349043846, "epoch": 3.8271627234964782, "grad_norm": 0.0006683628889732063, "learning_rate": 2.755035281974191e-06, "loss": 4.195647488813847e-05, "mean_token_accuracy": 1.0, "num_tokens": 17861481.0, "step": 5300 }, { "entropy": 2.0011202305555345, "epoch": 3.834386852085967, "grad_norm": 0.0010510816937312484, "learning_rate": 2.722876554421603e-06, "loss": 0.0023531623184680937, "mean_token_accuracy": 0.9980769231915474, "num_tokens": 17899030.0, "step": 5310 }, { "entropy": 1.981515035033226, "epoch": 3.841610980675456, "grad_norm": 0.0009371911291964352, "learning_rate": 2.6908770140160155e-06, "loss": 3.624772652983665e-05, "mean_token_accuracy": 1.0, "num_tokens": 17936142.0, "step": 5320 }, { "entropy": 1.966176024079323, "epoch": 3.848835109264945, "grad_norm": 0.011589719913899899, "learning_rate": 2.659037360747686e-06, "loss": 4.514714237302542e-05, "mean_token_accuracy": 1.0, "num_tokens": 17969355.0, "step": 5330 }, { "entropy": 1.9954922467470169, "epoch": 3.856059237854434, "grad_norm": 0.0006365366862155497, "learning_rate": 2.6273582911093478e-06, "loss": 5.152818048372865e-05, "mean_token_accuracy": 1.0, "num_tokens": 18006001.0, "step": 5340 }, { "entropy": 2.0939167737960815, "epoch": 3.863283366443923, "grad_norm": 0.0013512835139408708, "learning_rate": 2.5958404980809547e-06, "loss": 0.0001905821030959487, "mean_token_accuracy": 1.0, "num_tokens": 18039417.0, "step": 5350 }, { "entropy": 2.0816452115774156, "epoch": 3.8705074950334115, "grad_norm": 0.004600442014634609, "learning_rate": 2.5644846711145465e-06, "loss": 5.767461261712015e-05, "mean_token_accuracy": 1.0, "num_tokens": 18075820.0, "step": 5360 }, { "entropy": 2.0448678851127626, "epoch": 3.8777316236229007, "grad_norm": 0.0038580053951591253, "learning_rate": 2.533291496119141e-06, "loss": 3.333230270072818e-05, "mean_token_accuracy": 1.0, "num_tokens": 18107244.0, "step": 5370 }, { "entropy": 1.9495148241519928, "epoch": 3.8849557522123894, "grad_norm": 0.008305185474455357, "learning_rate": 2.5022616554457533e-06, "loss": 0.000500003295019269, "mean_token_accuracy": 1.0, "num_tokens": 18146835.0, "step": 5380 }, { "entropy": 2.11137031018734, "epoch": 3.892179880801878, "grad_norm": 0.0028492852579802275, "learning_rate": 2.4713958278724503e-06, "loss": 8.689896203577519e-05, "mean_token_accuracy": 1.0, "num_tokens": 18175825.0, "step": 5390 }, { "entropy": 2.0402226716279985, "epoch": 3.8994040093913673, "grad_norm": 0.008078484795987606, "learning_rate": 2.440694688589512e-06, "loss": 5.0963758258149025e-05, "mean_token_accuracy": 1.0, "num_tokens": 18209999.0, "step": 5400 }, { "entropy": 1.984485951066017, "epoch": 3.906628137980856, "grad_norm": 0.10858892649412155, "learning_rate": 2.4101589091846677e-06, "loss": 6.12112577073276e-05, "mean_token_accuracy": 1.0, "num_tokens": 18244424.0, "step": 5410 }, { "entropy": 2.01485433280468, "epoch": 3.913852266570345, "grad_norm": 0.0008091669878922403, "learning_rate": 2.379789157628387e-06, "loss": 3.532860428094864e-05, "mean_token_accuracy": 1.0, "num_tokens": 18277674.0, "step": 5420 }, { "entropy": 2.0380670696496965, "epoch": 3.921076395159834, "grad_norm": 0.0016133576864376664, "learning_rate": 2.3495860982592887e-06, "loss": 5.4576556431129573e-05, "mean_token_accuracy": 1.0, "num_tokens": 18312666.0, "step": 5430 }, { "entropy": 2.0862816482782365, "epoch": 3.9283005237493227, "grad_norm": 0.0010300560388714075, "learning_rate": 2.3195503917695903e-06, "loss": 0.0007599231321364641, "mean_token_accuracy": 1.0, "num_tokens": 18341922.0, "step": 5440 }, { "entropy": 2.0342622667551042, "epoch": 3.9355246523388114, "grad_norm": 0.0007309906068257987, "learning_rate": 2.2896826951906704e-06, "loss": 6.794939399696886e-05, "mean_token_accuracy": 1.0, "num_tokens": 18373576.0, "step": 5450 }, { "entropy": 2.0291885286569595, "epoch": 3.9427487809283006, "grad_norm": 0.000551744771655649, "learning_rate": 2.259983661878681e-06, "loss": 0.001429925113916397, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 18408254.0, "step": 5460 }, { "entropy": 2.054783394932747, "epoch": 3.9499729095177893, "grad_norm": 0.0015953091206029058, "learning_rate": 2.2304539415002735e-06, "loss": 5.455065984278917e-05, "mean_token_accuracy": 1.0, "num_tokens": 18440474.0, "step": 5470 }, { "entropy": 2.1094057828187944, "epoch": 3.957197038107278, "grad_norm": 0.012093332596123219, "learning_rate": 2.2010941800183692e-06, "loss": 6.816875538788736e-05, "mean_token_accuracy": 1.0, "num_tokens": 18469821.0, "step": 5480 }, { "entropy": 2.0123610883951186, "epoch": 3.9644211666967673, "grad_norm": 0.0009424237650819123, "learning_rate": 2.1719050196780368e-06, "loss": 3.265676496084779e-05, "mean_token_accuracy": 1.0, "num_tokens": 18508180.0, "step": 5490 }, { "entropy": 2.1019891053438187, "epoch": 3.971645295286256, "grad_norm": 0.0016745254397392273, "learning_rate": 2.1428870989924523e-06, "loss": 4.188414022792131e-05, "mean_token_accuracy": 1.0, "num_tokens": 18537306.0, "step": 5500 }, { "epoch": 3.971645295286256, "eval_entropy": 1.8881443387662356, "eval_loss": 1.1148877143859863, "eval_mean_token_accuracy": 0.8733496793634341, "eval_num_tokens": 18537306.0, "eval_runtime": 1003.2062, "eval_samples_per_second": 7.627, "eval_steps_per_second": 0.954, "step": 5500 }, { "entropy": 2.1032094329595568, "epoch": 3.9788694238757447, "grad_norm": 0.006147739477455616, "learning_rate": 2.114041052728911e-06, "loss": 5.7927443413063885e-05, "mean_token_accuracy": 1.0, "num_tokens": 18565742.0, "step": 5510 }, { "entropy": 2.017053109407425, "epoch": 3.986093552465234, "grad_norm": 0.0012200704077258706, "learning_rate": 2.085367511894959e-06, "loss": 3.577861934900284e-05, "mean_token_accuracy": 1.0, "num_tokens": 18599478.0, "step": 5520 }, { "entropy": 2.119554433226585, "epoch": 3.9933176810547226, "grad_norm": 0.0014397584600374103, "learning_rate": 2.056867103724588e-06, "loss": 7.5902248499915e-05, "mean_token_accuracy": 1.0, "num_tokens": 18628278.0, "step": 5530 }, { "entropy": 2.0237791248269983, "epoch": 4.0, "grad_norm": 0.0003623274969868362, "learning_rate": 2.028540451664501e-06, "loss": 3.263393009547144e-05, "mean_token_accuracy": 1.0, "num_tokens": 18663760.0, "step": 5540 }, { "entropy": 2.0520517587661744, "epoch": 4.007224128589489, "grad_norm": 0.005471021868288517, "learning_rate": 2.0003881753604993e-06, "loss": 0.0001229748479090631, "mean_token_accuracy": 1.0, "num_tokens": 18697411.0, "step": 5550 }, { "entropy": 1.9183115169405938, "epoch": 4.0144482571789775, "grad_norm": 0.002424974460154772, "learning_rate": 1.9724108906438965e-06, "loss": 0.00012065081391483545, "mean_token_accuracy": 1.0, "num_tokens": 18738405.0, "step": 5560 }, { "entropy": 1.9771938562393188, "epoch": 4.021672385768467, "grad_norm": 0.01849484071135521, "learning_rate": 1.9446092095180757e-06, "loss": 0.00019705821759998798, "mean_token_accuracy": 1.0, "num_tokens": 18777815.0, "step": 5570 }, { "entropy": 2.000231164693832, "epoch": 4.028896514357956, "grad_norm": 0.0007417634478770196, "learning_rate": 1.916983740145082e-06, "loss": 4.214680520817637e-05, "mean_token_accuracy": 1.0, "num_tokens": 18811678.0, "step": 5580 }, { "entropy": 2.08649323284626, "epoch": 4.036120642947444, "grad_norm": 0.0005442023393698037, "learning_rate": 1.8895350868323336e-06, "loss": 5.348328268155456e-05, "mean_token_accuracy": 1.0, "num_tokens": 18841150.0, "step": 5590 }, { "entropy": 2.052967756986618, "epoch": 4.043344771536933, "grad_norm": 0.029023820534348488, "learning_rate": 1.8622638500193878e-06, "loss": 7.951875450089574e-05, "mean_token_accuracy": 1.0, "num_tokens": 18872327.0, "step": 5600 }, { "entropy": 1.9854425325989724, "epoch": 4.0505689001264225, "grad_norm": 0.001789949252270162, "learning_rate": 1.8351706262648217e-06, "loss": 0.00010194053174927831, "mean_token_accuracy": 1.0, "num_tokens": 18908521.0, "step": 5610 }, { "entropy": 2.0517650842666626, "epoch": 4.057793028715911, "grad_norm": 0.00034689446329139173, "learning_rate": 1.808256008233169e-06, "loss": 3.732289478648454e-05, "mean_token_accuracy": 1.0, "num_tokens": 18942866.0, "step": 5620 }, { "entropy": 2.042857128381729, "epoch": 4.0650171573054, "grad_norm": 0.001570753171108663, "learning_rate": 1.781520584681966e-06, "loss": 8.434284245595336e-05, "mean_token_accuracy": 1.0, "num_tokens": 18978591.0, "step": 5630 }, { "entropy": 2.0445887804031373, "epoch": 4.072241285894889, "grad_norm": 0.002613665768876672, "learning_rate": 1.7549649404488644e-06, "loss": 8.788983686827123e-05, "mean_token_accuracy": 1.0, "num_tokens": 19011261.0, "step": 5640 }, { "entropy": 2.0116062104701995, "epoch": 4.079465414484378, "grad_norm": 0.0019005907233804464, "learning_rate": 1.728589656438846e-06, "loss": 2.841704699676484e-05, "mean_token_accuracy": 1.0, "num_tokens": 19050831.0, "step": 5650 }, { "entropy": 2.0562655299901964, "epoch": 4.086689543073867, "grad_norm": 0.0002598224382381886, "learning_rate": 1.7023953096115032e-06, "loss": 3.73309594579041e-05, "mean_token_accuracy": 1.0, "num_tokens": 19081443.0, "step": 5660 }, { "entropy": 2.0815482050180436, "epoch": 4.093913671663356, "grad_norm": 0.004718273412436247, "learning_rate": 1.6763824729684364e-06, "loss": 6.015845574438572e-05, "mean_token_accuracy": 1.0, "num_tokens": 19116035.0, "step": 5670 }, { "entropy": 2.017623296380043, "epoch": 4.101137800252845, "grad_norm": 0.0005751053686253726, "learning_rate": 1.650551715540698e-06, "loss": 4.4731769594363866e-05, "mean_token_accuracy": 1.0, "num_tokens": 19148343.0, "step": 5680 }, { "entropy": 1.9582554414868354, "epoch": 4.108361928842333, "grad_norm": 0.0016292211366817355, "learning_rate": 1.6249036023763654e-06, "loss": 3.706713323481381e-05, "mean_token_accuracy": 1.0, "num_tokens": 19187626.0, "step": 5690 }, { "entropy": 2.0343296408653258, "epoch": 4.115586057431822, "grad_norm": 0.0009523277985863388, "learning_rate": 1.5994386945281626e-06, "loss": 3.8216341636143625e-05, "mean_token_accuracy": 1.0, "num_tokens": 19221929.0, "step": 5700 }, { "entropy": 2.0681279003620148, "epoch": 4.1228101860213116, "grad_norm": 0.0008883064147084951, "learning_rate": 1.5741575490412043e-06, "loss": 2.718248579185456e-05, "mean_token_accuracy": 1.0, "num_tokens": 19254907.0, "step": 5710 }, { "entropy": 2.011669307947159, "epoch": 4.1300343146108, "grad_norm": 0.0008795072790235281, "learning_rate": 1.5490607189407903e-06, "loss": 3.153630532324314e-05, "mean_token_accuracy": 1.0, "num_tokens": 19287150.0, "step": 5720 }, { "entropy": 2.0814460307359695, "epoch": 4.137258443200289, "grad_norm": 0.001299955532886088, "learning_rate": 1.5241487532203324e-06, "loss": 0.00039165206253528596, "mean_token_accuracy": 1.0, "num_tokens": 19320643.0, "step": 5730 }, { "entropy": 2.053331843018532, "epoch": 4.144482571789778, "grad_norm": 0.003343022894114256, "learning_rate": 1.4994221968293209e-06, "loss": 3.842532460112125e-05, "mean_token_accuracy": 1.0, "num_tokens": 19353163.0, "step": 5740 }, { "entropy": 2.051739862561226, "epoch": 4.1517067003792665, "grad_norm": 0.0025682623963803053, "learning_rate": 1.4748815906614256e-06, "loss": 4.806564247701317e-05, "mean_token_accuracy": 1.0, "num_tokens": 19381773.0, "step": 5750 }, { "entropy": 1.9667051672935485, "epoch": 4.158930828968756, "grad_norm": 0.000453523505711928, "learning_rate": 1.450527471542641e-06, "loss": 7.420713664032518e-05, "mean_token_accuracy": 1.0, "num_tokens": 19417822.0, "step": 5760 }, { "entropy": 2.061727538704872, "epoch": 4.166154957558245, "grad_norm": 0.0005199933657422662, "learning_rate": 1.4263603722195696e-06, "loss": 7.046694518066942e-05, "mean_token_accuracy": 1.0, "num_tokens": 19449523.0, "step": 5770 }, { "entropy": 1.944933032989502, "epoch": 4.173379086147733, "grad_norm": 0.0017413697205483913, "learning_rate": 1.4023808213477419e-06, "loss": 3.615806344896555e-05, "mean_token_accuracy": 1.0, "num_tokens": 19492156.0, "step": 5780 }, { "entropy": 2.0748004257678985, "epoch": 4.180603214737222, "grad_norm": 0.0007003610371612012, "learning_rate": 1.3785893434800735e-06, "loss": 4.728134081233293e-05, "mean_token_accuracy": 1.0, "num_tokens": 19526200.0, "step": 5790 }, { "entropy": 2.0519924253225326, "epoch": 4.1878273433267115, "grad_norm": 0.004808162804692984, "learning_rate": 1.354986459055374e-06, "loss": 5.692571285180748e-05, "mean_token_accuracy": 1.0, "num_tokens": 19556309.0, "step": 5800 }, { "entropy": 2.0686589539051057, "epoch": 4.1950514719162, "grad_norm": 0.005478905979543924, "learning_rate": 1.3315726843869703e-06, "loss": 5.530117196030915e-05, "mean_token_accuracy": 1.0, "num_tokens": 19586633.0, "step": 5810 }, { "entropy": 1.9959229797124862, "epoch": 4.202275600505689, "grad_norm": 0.0006617996259592474, "learning_rate": 1.30834853165142e-06, "loss": 4.879834596067667e-05, "mean_token_accuracy": 1.0, "num_tokens": 19622993.0, "step": 5820 }, { "entropy": 2.063421201705933, "epoch": 4.209499729095178, "grad_norm": 0.0005491877673193812, "learning_rate": 1.2853145088772867e-06, "loss": 3.759705286938697e-05, "mean_token_accuracy": 1.0, "num_tokens": 19650842.0, "step": 5830 }, { "entropy": 2.0779141038656235, "epoch": 4.216723857684666, "grad_norm": 0.0042537664994597435, "learning_rate": 1.26247111993405e-06, "loss": 5.043308483436704e-05, "mean_token_accuracy": 1.0, "num_tokens": 19683451.0, "step": 5840 }, { "entropy": 2.0339601665735243, "epoch": 4.223947986274156, "grad_norm": 0.000250296201556921, "learning_rate": 1.239818864521063e-06, "loss": 3.1771216890774666e-05, "mean_token_accuracy": 1.0, "num_tokens": 19713433.0, "step": 5850 }, { "entropy": 2.0060952216386796, "epoch": 4.231172114863645, "grad_norm": 0.00018487044144421816, "learning_rate": 1.2173582381566406e-06, "loss": 4.990113084204495e-05, "mean_token_accuracy": 1.0, "num_tokens": 19745784.0, "step": 5860 }, { "entropy": 1.9054115578532218, "epoch": 4.238396243453133, "grad_norm": 0.008540745824575424, "learning_rate": 1.1950897321672028e-06, "loss": 3.5091297468170525e-05, "mean_token_accuracy": 1.0, "num_tokens": 19788454.0, "step": 5870 }, { "entropy": 2.07164244055748, "epoch": 4.245620372042622, "grad_norm": 0.005256814416497946, "learning_rate": 1.1730138336765395e-06, "loss": 4.395857686176896e-05, "mean_token_accuracy": 1.0, "num_tokens": 19819428.0, "step": 5880 }, { "entropy": 2.037181797623634, "epoch": 4.252844500632111, "grad_norm": 0.0005752044962719083, "learning_rate": 1.1511310255951436e-06, "loss": 3.161632921546698e-05, "mean_token_accuracy": 1.0, "num_tokens": 19858243.0, "step": 5890 }, { "entropy": 2.064584118127823, "epoch": 4.2600686292216, "grad_norm": 0.002521161688491702, "learning_rate": 1.1294417866096618e-06, "loss": 3.7657920620404185e-05, "mean_token_accuracy": 1.0, "num_tokens": 19889760.0, "step": 5900 }, { "entropy": 2.0095575898885727, "epoch": 4.267292757811089, "grad_norm": 0.0036700242199003696, "learning_rate": 1.1079465911724063e-06, "loss": 4.4873528531752525e-05, "mean_token_accuracy": 1.0, "num_tokens": 19923286.0, "step": 5910 }, { "entropy": 2.090346944332123, "epoch": 4.274516886400578, "grad_norm": 0.008253049105405807, "learning_rate": 1.0866459094909931e-06, "loss": 4.445763770490885e-05, "mean_token_accuracy": 1.0, "num_tokens": 19951812.0, "step": 5920 }, { "entropy": 2.0771326392889025, "epoch": 4.281741014990067, "grad_norm": 0.0017921896651387215, "learning_rate": 1.06554020751804e-06, "loss": 3.478447324596345e-05, "mean_token_accuracy": 1.0, "num_tokens": 19986840.0, "step": 5930 }, { "entropy": 2.088083365559578, "epoch": 4.2889651435795555, "grad_norm": 0.0014664095360785723, "learning_rate": 1.044629946940987e-06, "loss": 4.977693315595388e-05, "mean_token_accuracy": 1.0, "num_tokens": 20027096.0, "step": 5940 }, { "entropy": 2.1036684960126877, "epoch": 4.296189272169045, "grad_norm": 0.0010140404338017106, "learning_rate": 1.0239155851719896e-06, "loss": 2.367785637034103e-05, "mean_token_accuracy": 1.0, "num_tokens": 20059239.0, "step": 5950 }, { "entropy": 2.0400282979011535, "epoch": 4.303413400758534, "grad_norm": 0.0007224315195344388, "learning_rate": 1.0033975753379166e-06, "loss": 3.497881989460439e-05, "mean_token_accuracy": 1.0, "num_tokens": 20096547.0, "step": 5960 }, { "entropy": 1.9657370626926423, "epoch": 4.310637529348022, "grad_norm": 0.011448175646364689, "learning_rate": 9.830763662704345e-07, "loss": 7.57243949919939e-05, "mean_token_accuracy": 1.0, "num_tokens": 20136655.0, "step": 5970 }, { "entropy": 2.081816816329956, "epoch": 4.317861657937511, "grad_norm": 0.0038148025050759315, "learning_rate": 9.629524024961911e-07, "loss": 5.8540661120787264e-05, "mean_token_accuracy": 1.0, "num_tokens": 20170189.0, "step": 5980 }, { "entropy": 2.0057587683200837, "epoch": 4.3250857865270005, "grad_norm": 0.006282564718276262, "learning_rate": 9.4302612422709e-07, "loss": 4.116616037208587e-05, "mean_token_accuracy": 1.0, "num_tokens": 20205120.0, "step": 5990 }, { "entropy": 2.0236620873212816, "epoch": 4.332309915116489, "grad_norm": 0.00033325853291898966, "learning_rate": 9.232979673506693e-07, "loss": 4.479981726035476e-05, "mean_token_accuracy": 1.0, "num_tokens": 20234412.0, "step": 6000 }, { "epoch": 4.332309915116489, "eval_entropy": 1.8867571529549865, "eval_loss": 1.1205323934555054, "eval_mean_token_accuracy": 0.8733835436458249, "eval_num_tokens": 20234412.0, "eval_runtime": 1004.0478, "eval_samples_per_second": 7.62, "eval_steps_per_second": 0.953, "step": 6000 }, { "entropy": 2.038132134079933, "epoch": 4.339534043705978, "grad_norm": 0.0035877148620784283, "learning_rate": 9.037683634205497e-07, "loss": 3.72432143194601e-05, "mean_token_accuracy": 1.0, "num_tokens": 20269947.0, "step": 6010 }, { "entropy": 2.037680074572563, "epoch": 4.346758172295467, "grad_norm": 0.0020296431612223387, "learning_rate": 8.844377396470139e-07, "loss": 5.266892840154469e-05, "mean_token_accuracy": 1.0, "num_tokens": 20302664.0, "step": 6020 }, { "entropy": 2.0102846056222914, "epoch": 4.353982300884955, "grad_norm": 0.001758980448357761, "learning_rate": 8.653065188876442e-07, "loss": 5.401996313594282e-05, "mean_token_accuracy": 1.0, "num_tokens": 20338650.0, "step": 6030 }, { "entropy": 2.0160276383161544, "epoch": 4.361206429474445, "grad_norm": 0.0009282240644097328, "learning_rate": 8.463751196380842e-07, "loss": 0.00013109834399074315, "mean_token_accuracy": 1.0, "num_tokens": 20376622.0, "step": 6040 }, { "entropy": 2.0747092813253403, "epoch": 4.368430558063934, "grad_norm": 0.01705658808350563, "learning_rate": 8.276439560228777e-07, "loss": 4.950579605065286e-05, "mean_token_accuracy": 1.0, "num_tokens": 20410205.0, "step": 6050 }, { "entropy": 1.9550865411758422, "epoch": 4.375654686653422, "grad_norm": 0.0005268985987640917, "learning_rate": 8.091134377864162e-07, "loss": 3.07281588902697e-05, "mean_token_accuracy": 1.0, "num_tokens": 20445702.0, "step": 6060 }, { "entropy": 2.09949953854084, "epoch": 4.382878815242911, "grad_norm": 0.0009493506513535976, "learning_rate": 7.907839702839648e-07, "loss": 5.5659073404967784e-05, "mean_token_accuracy": 1.0, "num_tokens": 20474828.0, "step": 6070 }, { "entropy": 2.0183721661567686, "epoch": 4.3901029438324, "grad_norm": 0.00525283720344305, "learning_rate": 7.726559544728074e-07, "loss": 6.567650707438588e-05, "mean_token_accuracy": 1.0, "num_tokens": 20508159.0, "step": 6080 }, { "entropy": 2.074488589167595, "epoch": 4.397327072421889, "grad_norm": 0.007316200062632561, "learning_rate": 7.547297869034676e-07, "loss": 4.217610985506326e-05, "mean_token_accuracy": 1.0, "num_tokens": 20541886.0, "step": 6090 }, { "entropy": 2.0580724850296974, "epoch": 4.404551201011378, "grad_norm": 0.0010083678644150496, "learning_rate": 7.370058597110397e-07, "loss": 3.816606185864657e-05, "mean_token_accuracy": 1.0, "num_tokens": 20574514.0, "step": 6100 }, { "entropy": 2.1109296530485153, "epoch": 4.411775329600867, "grad_norm": 0.001863549230620265, "learning_rate": 7.194845606066014e-07, "loss": 6.602524663321674e-05, "mean_token_accuracy": 1.0, "num_tokens": 20604343.0, "step": 6110 }, { "entropy": 2.0420098900794983, "epoch": 4.418999458190356, "grad_norm": 0.0010925420792773366, "learning_rate": 7.021662728687472e-07, "loss": 4.863352223765105e-05, "mean_token_accuracy": 1.0, "num_tokens": 20634121.0, "step": 6120 }, { "entropy": 2.092097768187523, "epoch": 4.4262235867798445, "grad_norm": 0.0007851732079870999, "learning_rate": 6.850513753351884e-07, "loss": 0.00010627959854900837, "mean_token_accuracy": 1.0, "num_tokens": 20672421.0, "step": 6130 }, { "entropy": 2.050906154513359, "epoch": 4.433447715369334, "grad_norm": 0.004971630405634642, "learning_rate": 6.681402423944794e-07, "loss": 6.272855098359287e-05, "mean_token_accuracy": 1.0, "num_tokens": 20703713.0, "step": 6140 }, { "entropy": 2.061757782101631, "epoch": 4.440671843958823, "grad_norm": 0.006796205881983042, "learning_rate": 6.514332439778181e-07, "loss": 6.277162465266884e-05, "mean_token_accuracy": 1.0, "num_tokens": 20737059.0, "step": 6150 }, { "entropy": 2.0285993814468384, "epoch": 4.447895972548311, "grad_norm": 0.0004371571121737361, "learning_rate": 6.349307455509612e-07, "loss": 7.777039427310228e-05, "mean_token_accuracy": 1.0, "num_tokens": 20767549.0, "step": 6160 }, { "entropy": 2.0497070878744124, "epoch": 4.4551201011378, "grad_norm": 0.0009208957781083882, "learning_rate": 6.186331081062213e-07, "loss": 4.10045322496444e-05, "mean_token_accuracy": 1.0, "num_tokens": 20802465.0, "step": 6170 }, { "entropy": 2.029895249009132, "epoch": 4.4623442297272895, "grad_norm": 0.004188739228993654, "learning_rate": 6.025406881545825e-07, "loss": 5.5925117339938876e-05, "mean_token_accuracy": 1.0, "num_tokens": 20837550.0, "step": 6180 }, { "entropy": 2.0028230965137483, "epoch": 4.469568358316778, "grad_norm": 0.0003794363292399794, "learning_rate": 5.866538377178843e-07, "loss": 4.9718539230525494e-05, "mean_token_accuracy": 1.0, "num_tokens": 20876929.0, "step": 6190 }, { "entropy": 2.0583949118852614, "epoch": 4.476792486906267, "grad_norm": 0.00045059359399601817, "learning_rate": 5.709729043211398e-07, "loss": 3.476354759186506e-05, "mean_token_accuracy": 1.0, "num_tokens": 20910047.0, "step": 6200 }, { "entropy": 1.9930611312389375, "epoch": 4.484016615495756, "grad_norm": 0.000457485526567325, "learning_rate": 5.554982309849199e-07, "loss": 4.2988642235286534e-05, "mean_token_accuracy": 1.0, "num_tokens": 20943601.0, "step": 6210 }, { "entropy": 2.026224583387375, "epoch": 4.491240744085244, "grad_norm": 0.0005757972248829901, "learning_rate": 5.40230156217858e-07, "loss": 4.6183171798475085e-05, "mean_token_accuracy": 1.0, "num_tokens": 20973770.0, "step": 6220 }, { "entropy": 2.013220492005348, "epoch": 4.498464872674734, "grad_norm": 0.0014384216628968716, "learning_rate": 5.251690140092391e-07, "loss": 4.870914272032678e-05, "mean_token_accuracy": 1.0, "num_tokens": 21011933.0, "step": 6230 }, { "entropy": 2.058389586210251, "epoch": 4.505689001264223, "grad_norm": 0.0012885585892945528, "learning_rate": 5.10315133821695e-07, "loss": 5.40612090844661e-05, "mean_token_accuracy": 1.0, "num_tokens": 21046830.0, "step": 6240 }, { "entropy": 2.0383670747280123, "epoch": 4.512913129853711, "grad_norm": 0.004921869840472937, "learning_rate": 4.956688405840049e-07, "loss": 3.439287829678506e-05, "mean_token_accuracy": 1.0, "num_tokens": 21078696.0, "step": 6250 }, { "entropy": 2.075214546918869, "epoch": 4.5201372584432, "grad_norm": 0.002247129799798131, "learning_rate": 4.81230454683973e-07, "loss": 0.00020004326943308116, "mean_token_accuracy": 1.0, "num_tokens": 21111401.0, "step": 6260 }, { "entropy": 2.0556839615106584, "epoch": 4.527361387032689, "grad_norm": 0.0010530236177146435, "learning_rate": 4.670002919614369e-07, "loss": 3.903879842255264e-05, "mean_token_accuracy": 1.0, "num_tokens": 21142013.0, "step": 6270 }, { "entropy": 2.088409799337387, "epoch": 4.534585515622178, "grad_norm": 0.00486265541985631, "learning_rate": 4.529786637013445e-07, "loss": 7.261448190547526e-05, "mean_token_accuracy": 1.0, "num_tokens": 21173184.0, "step": 6280 }, { "entropy": 2.0148551791906355, "epoch": 4.541809644211667, "grad_norm": 0.0006567241507582366, "learning_rate": 4.391658766269524e-07, "loss": 4.8429635353386405e-05, "mean_token_accuracy": 1.0, "num_tokens": 21204028.0, "step": 6290 }, { "entropy": 2.000632828474045, "epoch": 4.549033772801156, "grad_norm": 0.001035205670632422, "learning_rate": 4.25562232893113e-07, "loss": 8.508394821546972e-05, "mean_token_accuracy": 1.0, "num_tokens": 21237889.0, "step": 6300 }, { "entropy": 1.9882080256938934, "epoch": 4.556257901390644, "grad_norm": 0.00034841979504562914, "learning_rate": 4.1216803007966823e-07, "loss": 0.0003705588635057211, "mean_token_accuracy": 1.0, "num_tokens": 21272623.0, "step": 6310 }, { "entropy": 2.045357859134674, "epoch": 4.5634820299801335, "grad_norm": 0.0020742975175380707, "learning_rate": 3.9898356118493465e-07, "loss": 4.6494670095853506e-05, "mean_token_accuracy": 1.0, "num_tokens": 21305594.0, "step": 6320 }, { "entropy": 1.970546191930771, "epoch": 4.570706158569623, "grad_norm": 0.01608274318277836, "learning_rate": 3.8600911461930233e-07, "loss": 3.988950047641993e-05, "mean_token_accuracy": 1.0, "num_tokens": 21343984.0, "step": 6330 }, { "entropy": 2.0401349663734436, "epoch": 4.577930287159111, "grad_norm": 0.030885402113199234, "learning_rate": 3.7324497419891305e-07, "loss": 0.00012581488117575647, "mean_token_accuracy": 1.0, "num_tokens": 21376303.0, "step": 6340 }, { "entropy": 2.0059654384851457, "epoch": 4.5851544157486, "grad_norm": 0.000837457540910691, "learning_rate": 3.6069141913946836e-07, "loss": 2.7812441112473606e-05, "mean_token_accuracy": 1.0, "num_tokens": 21408533.0, "step": 6350 }, { "entropy": 2.0227129757404327, "epoch": 4.592378544338089, "grad_norm": 0.0016140820225700736, "learning_rate": 3.48348724050106e-07, "loss": 4.559661610983312e-05, "mean_token_accuracy": 1.0, "num_tokens": 21443948.0, "step": 6360 }, { "entropy": 2.042063796520233, "epoch": 4.599602672927578, "grad_norm": 0.002120249206200242, "learning_rate": 3.3621715892740435e-07, "loss": 4.2640851461328566e-05, "mean_token_accuracy": 1.0, "num_tokens": 21473536.0, "step": 6370 }, { "entropy": 1.9752472653985023, "epoch": 4.606826801517067, "grad_norm": 0.002964077051728964, "learning_rate": 3.242969891494685e-07, "loss": 3.5691412631422284e-05, "mean_token_accuracy": 1.0, "num_tokens": 21507221.0, "step": 6380 }, { "entropy": 2.0139128088951113, "epoch": 4.614050930106556, "grad_norm": 0.030351942405104637, "learning_rate": 3.125884754701303e-07, "loss": 7.241095299832523e-05, "mean_token_accuracy": 1.0, "num_tokens": 21541769.0, "step": 6390 }, { "entropy": 2.0333428621292113, "epoch": 4.621275058696045, "grad_norm": 0.000693982932716608, "learning_rate": 3.010918740132407e-07, "loss": 4.2272888822481033e-05, "mean_token_accuracy": 1.0, "num_tokens": 21574865.0, "step": 6400 }, { "entropy": 2.0549756467342375, "epoch": 4.6284991872855334, "grad_norm": 0.0026722848415374756, "learning_rate": 2.898074362670722e-07, "loss": 3.962405025959015e-05, "mean_token_accuracy": 1.0, "num_tokens": 21609017.0, "step": 6410 }, { "entropy": 1.9579277276992797, "epoch": 4.635723315875023, "grad_norm": 0.00036720273783430457, "learning_rate": 2.7873540907880857e-07, "loss": 2.7999217854812743e-05, "mean_token_accuracy": 1.0, "num_tokens": 21645079.0, "step": 6420 }, { "entropy": 2.038615897297859, "epoch": 4.642947444464512, "grad_norm": 0.0006429091445170343, "learning_rate": 2.678760346491571e-07, "loss": 2.7544971089810133e-05, "mean_token_accuracy": 1.0, "num_tokens": 21676845.0, "step": 6430 }, { "entropy": 2.0673672020435334, "epoch": 4.650171573054, "grad_norm": 0.0004574761842377484, "learning_rate": 2.572295505270361e-07, "loss": 4.758274299092591e-05, "mean_token_accuracy": 1.0, "num_tokens": 21708826.0, "step": 6440 }, { "entropy": 2.0488554000854493, "epoch": 4.657395701643489, "grad_norm": 0.002278710948303342, "learning_rate": 2.4679618960439354e-07, "loss": 3.772459167521447e-05, "mean_token_accuracy": 1.0, "num_tokens": 21743886.0, "step": 6450 }, { "entropy": 2.039225164055824, "epoch": 4.664619830232978, "grad_norm": 0.01752655953168869, "learning_rate": 2.3657618011110105e-07, "loss": 5.816233460791409e-05, "mean_token_accuracy": 1.0, "num_tokens": 21775228.0, "step": 6460 }, { "entropy": 2.059047856926918, "epoch": 4.671843958822467, "grad_norm": 0.0005467822193168104, "learning_rate": 2.2656974560996804e-07, "loss": 7.531020673923194e-05, "mean_token_accuracy": 1.0, "num_tokens": 21808593.0, "step": 6470 }, { "entropy": 2.1210929095745086, "epoch": 4.679068087411956, "grad_norm": 0.0012726244749501348, "learning_rate": 2.1677710499184656e-07, "loss": 6.718997610732913e-05, "mean_token_accuracy": 1.0, "num_tokens": 21841076.0, "step": 6480 }, { "entropy": 2.0896143525838853, "epoch": 4.686292216001445, "grad_norm": 0.003853370202705264, "learning_rate": 2.0719847247084755e-07, "loss": 3.789499460253865e-05, "mean_token_accuracy": 1.0, "num_tokens": 21875809.0, "step": 6490 }, { "entropy": 2.037109050154686, "epoch": 4.693516344590933, "grad_norm": 0.00031700858380645514, "learning_rate": 1.9783405757965002e-07, "loss": 3.2565766014158724e-05, "mean_token_accuracy": 1.0, "num_tokens": 21909724.0, "step": 6500 }, { "epoch": 4.693516344590933, "eval_entropy": 1.8861580940125007, "eval_loss": 1.1229685544967651, "eval_mean_token_accuracy": 0.8733846908328177, "eval_num_tokens": 21909724.0, "eval_runtime": 1004.3195, "eval_samples_per_second": 7.618, "eval_steps_per_second": 0.953, "step": 6500 }, { "entropy": 2.0284633457660677, "epoch": 4.7007404731804225, "grad_norm": 0.020248375833034515, "learning_rate": 1.8868406516492244e-07, "loss": 5.51959325093776e-05, "mean_token_accuracy": 1.0, "num_tokens": 21940685.0, "step": 6510 }, { "entropy": 1.9785596251487731, "epoch": 4.707964601769912, "grad_norm": 0.0038106630090624094, "learning_rate": 1.797486953828398e-07, "loss": 4.6884844778105617e-05, "mean_token_accuracy": 1.0, "num_tokens": 21980865.0, "step": 6520 }, { "entropy": 1.988435271382332, "epoch": 4.715188730359401, "grad_norm": 0.0015697875060141087, "learning_rate": 1.7102814369470366e-07, "loss": 3.299066156614572e-05, "mean_token_accuracy": 1.0, "num_tokens": 22015086.0, "step": 6530 }, { "entropy": 1.9778899431228638, "epoch": 4.722412858948889, "grad_norm": 0.00027815153589472175, "learning_rate": 1.6252260086266792e-07, "loss": 2.8657037182711066e-05, "mean_token_accuracy": 1.0, "num_tokens": 22051125.0, "step": 6540 }, { "entropy": 2.040974870324135, "epoch": 4.729636987538378, "grad_norm": 0.003017911920323968, "learning_rate": 1.5423225294556643e-07, "loss": 5.40966575499624e-05, "mean_token_accuracy": 1.0, "num_tokens": 22082404.0, "step": 6550 }, { "entropy": 2.0276382893323897, "epoch": 4.7368611161278675, "grad_norm": 0.0021381389815360308, "learning_rate": 1.4615728129483974e-07, "loss": 5.566022009588778e-05, "mean_token_accuracy": 1.0, "num_tokens": 22115266.0, "step": 6560 }, { "entropy": 2.060152867436409, "epoch": 4.744085244717356, "grad_norm": 0.0016187896253541112, "learning_rate": 1.3829786255057487e-07, "loss": 2.9083571280352772e-05, "mean_token_accuracy": 1.0, "num_tokens": 22149791.0, "step": 6570 }, { "entropy": 2.051058277487755, "epoch": 4.751309373306845, "grad_norm": 0.00024818177917040884, "learning_rate": 1.3065416863763057e-07, "loss": 2.7069501811638474e-05, "mean_token_accuracy": 1.0, "num_tokens": 22179029.0, "step": 6580 }, { "entropy": 2.0647223949432374, "epoch": 4.758533501896334, "grad_norm": 0.0028722593560814857, "learning_rate": 1.232263667618905e-07, "loss": 3.091147227678448e-05, "mean_token_accuracy": 1.0, "num_tokens": 22212576.0, "step": 6590 }, { "entropy": 2.0464107930660247, "epoch": 4.7657576304858225, "grad_norm": 0.0008732263813726604, "learning_rate": 1.1601461940659031e-07, "loss": 5.022935220040381e-05, "mean_token_accuracy": 1.0, "num_tokens": 22242912.0, "step": 6600 }, { "entropy": 2.0649017661809923, "epoch": 4.772981759075312, "grad_norm": 0.0048006330616772175, "learning_rate": 1.0901908432877639e-07, "loss": 5.4197025019675496e-05, "mean_token_accuracy": 1.0, "num_tokens": 22281513.0, "step": 6610 }, { "entropy": 1.984046956896782, "epoch": 4.780205887664801, "grad_norm": 0.0030445149168372154, "learning_rate": 1.0223991455584614e-07, "loss": 2.9524989076890052e-05, "mean_token_accuracy": 1.0, "num_tokens": 22317667.0, "step": 6620 }, { "entropy": 2.0595791935920715, "epoch": 4.787430016254289, "grad_norm": 0.0011976293753832579, "learning_rate": 9.567725838220743e-08, "loss": 3.321574768051505e-05, "mean_token_accuracy": 1.0, "num_tokens": 22346682.0, "step": 6630 }, { "entropy": 2.026864069700241, "epoch": 4.794654144843778, "grad_norm": 0.00043818942504003644, "learning_rate": 8.933125936602671e-08, "loss": 3.484268963802606e-05, "mean_token_accuracy": 1.0, "num_tokens": 22385013.0, "step": 6640 }, { "entropy": 2.046583649516106, "epoch": 4.8018782734332675, "grad_norm": 0.0025603007525205612, "learning_rate": 8.32020563260938e-08, "loss": 5.122844595462084e-05, "mean_token_accuracy": 1.0, "num_tokens": 22418400.0, "step": 6650 }, { "entropy": 1.975029507279396, "epoch": 4.809102402022756, "grad_norm": 0.0005151774967089295, "learning_rate": 7.728978333878867e-08, "loss": 2.6047686696983872e-05, "mean_token_accuracy": 1.0, "num_tokens": 22451151.0, "step": 6660 }, { "entropy": 2.067280852794647, "epoch": 4.816326530612245, "grad_norm": 0.0006476499256677926, "learning_rate": 7.159456973513834e-08, "loss": 3.575811279006302e-05, "mean_token_accuracy": 1.0, "num_tokens": 22478905.0, "step": 6670 }, { "entropy": 2.03638633787632, "epoch": 4.823550659201734, "grad_norm": 0.0013524072710424662, "learning_rate": 6.611654009799795e-08, "loss": 4.682386352214962e-05, "mean_token_accuracy": 1.0, "num_tokens": 22515537.0, "step": 6680 }, { "entropy": 2.051380980014801, "epoch": 4.830774787791222, "grad_norm": 0.0002707350067794323, "learning_rate": 6.085581425931853e-08, "loss": 3.42914805514738e-05, "mean_token_accuracy": 1.0, "num_tokens": 22546886.0, "step": 6690 }, { "entropy": 2.0533095479011534, "epoch": 4.837998916380712, "grad_norm": 0.0015662594232708216, "learning_rate": 5.581250729753129e-08, "loss": 4.324914189055562e-05, "mean_token_accuracy": 1.0, "num_tokens": 22581235.0, "step": 6700 }, { "entropy": 2.029346165060997, "epoch": 4.845223044970201, "grad_norm": 0.001764796208590269, "learning_rate": 5.098672953502415e-08, "loss": 3.3904198789969084e-05, "mean_token_accuracy": 1.0, "num_tokens": 22610108.0, "step": 6710 }, { "entropy": 2.1031780898571015, "epoch": 4.852447173559689, "grad_norm": 0.0018990206299349666, "learning_rate": 4.637858653573468e-08, "loss": 4.420768236741423e-05, "mean_token_accuracy": 1.0, "num_tokens": 22643481.0, "step": 6720 }, { "entropy": 2.064891684055328, "epoch": 4.859671302149178, "grad_norm": 0.0023969768080860376, "learning_rate": 4.198817910283426e-08, "loss": 4.414340655785054e-05, "mean_token_accuracy": 1.0, "num_tokens": 22672931.0, "step": 6730 }, { "entropy": 2.0357902348041534, "epoch": 4.866895430738667, "grad_norm": 0.003920447546988726, "learning_rate": 3.781560327653089e-08, "loss": 5.700000911019742e-05, "mean_token_accuracy": 1.0, "num_tokens": 22705766.0, "step": 6740 }, { "entropy": 2.039839392900467, "epoch": 4.874119559328156, "grad_norm": 0.00022526641259901226, "learning_rate": 3.3860950331959794e-08, "loss": 5.020995740778744e-05, "mean_token_accuracy": 1.0, "num_tokens": 22739415.0, "step": 6750 }, { "entropy": 2.04675834774971, "epoch": 4.881343687917645, "grad_norm": 0.01613064855337143, "learning_rate": 3.0124306777195025e-08, "loss": 5.47548639588058e-05, "mean_token_accuracy": 1.0, "num_tokens": 22770833.0, "step": 6760 }, { "entropy": 1.9878700971603394, "epoch": 4.888567816507134, "grad_norm": 0.0018846408929675817, "learning_rate": 2.660575435134982e-08, "loss": 2.85835936665535e-05, "mean_token_accuracy": 1.0, "num_tokens": 22808032.0, "step": 6770 }, { "entropy": 2.0023221403360365, "epoch": 4.895791945096622, "grad_norm": 0.002222092356532812, "learning_rate": 2.3305370022793648e-08, "loss": 0.00022039401810616254, "mean_token_accuracy": 1.0, "num_tokens": 22841123.0, "step": 6780 }, { "entropy": 2.0070317834615707, "epoch": 4.9030160736861115, "grad_norm": 0.009242741391062737, "learning_rate": 2.022322598746462e-08, "loss": 8.193657849915325e-05, "mean_token_accuracy": 1.0, "num_tokens": 22876442.0, "step": 6790 }, { "entropy": 1.9670007824897766, "epoch": 4.910240202275601, "grad_norm": 0.002695423783734441, "learning_rate": 1.7359389667296333e-08, "loss": 2.583371242508292e-05, "mean_token_accuracy": 1.0, "num_tokens": 22908640.0, "step": 6800 }, { "entropy": 2.0583061963319778, "epoch": 4.917464330865089, "grad_norm": 0.0005823559476993978, "learning_rate": 1.47139237087357e-08, "loss": 3.0780312954448164e-05, "mean_token_accuracy": 1.0, "num_tokens": 22940536.0, "step": 6810 }, { "entropy": 2.0565018385648726, "epoch": 4.924688459454578, "grad_norm": 0.0013910674024373293, "learning_rate": 1.2286885981376284e-08, "loss": 5.821611266583204e-05, "mean_token_accuracy": 1.0, "num_tokens": 22974965.0, "step": 6820 }, { "entropy": 2.0042783856391906, "epoch": 4.931912588044067, "grad_norm": 0.011966842226684093, "learning_rate": 1.0078329576691526e-08, "loss": 0.0006500833202153445, "mean_token_accuracy": 1.0, "num_tokens": 23010525.0, "step": 6830 }, { "entropy": 2.040247473120689, "epoch": 4.939136716633556, "grad_norm": 0.0010858806781470776, "learning_rate": 8.088302806875669e-09, "loss": 5.4765178356319665e-05, "mean_token_accuracy": 1.0, "num_tokens": 23043869.0, "step": 6840 }, { "entropy": 1.992214022576809, "epoch": 4.946360845223045, "grad_norm": 0.01539916917681694, "learning_rate": 6.316849203783504e-09, "loss": 5.2837148541584614e-05, "mean_token_accuracy": 1.0, "num_tokens": 23083979.0, "step": 6850 }, { "entropy": 2.040625846385956, "epoch": 4.953584973812534, "grad_norm": 0.006538680754601955, "learning_rate": 4.764007517978897e-09, "loss": 4.6846986515447496e-05, "mean_token_accuracy": 1.0, "num_tokens": 23114925.0, "step": 6860 }, { "entropy": 2.0183849722146987, "epoch": 4.960809102402023, "grad_norm": 0.01923307776451111, "learning_rate": 3.4298117178910294e-09, "loss": 6.437179399654269e-05, "mean_token_accuracy": 1.0, "num_tokens": 23149219.0, "step": 6870 }, { "entropy": 2.0850543707609175, "epoch": 4.968033230991511, "grad_norm": 0.0006016053375788033, "learning_rate": 2.3142909890661035e-09, "loss": 4.915224853903055e-05, "mean_token_accuracy": 1.0, "num_tokens": 23180291.0, "step": 6880 }, { "entropy": 2.112953135371208, "epoch": 4.975257359581001, "grad_norm": 0.0011069178581237793, "learning_rate": 1.4174697335289644e-09, "loss": 3.848375054076314e-05, "mean_token_accuracy": 1.0, "num_tokens": 23211797.0, "step": 6890 }, { "entropy": 2.022666311264038, "epoch": 4.98248148817049, "grad_norm": 0.0002605836489237845, "learning_rate": 7.393675692546343e-10, "loss": 7.313743117265403e-05, "mean_token_accuracy": 1.0, "num_tokens": 23245939.0, "step": 6900 }, { "entropy": 2.052492305636406, "epoch": 4.989705616759978, "grad_norm": 0.0013098756317049265, "learning_rate": 2.799993297353254e-10, "loss": 2.9006070690229535e-05, "mean_token_accuracy": 1.0, "num_tokens": 23277936.0, "step": 6910 }, { "entropy": 2.017625370621681, "epoch": 4.996929745349467, "grad_norm": 0.0027501226868480444, "learning_rate": 3.9375063654034654e-11, "loss": 3.442804736550897e-05, "mean_token_accuracy": 1.0, "num_tokens": 23314979.0, "step": 6920 }, { "epoch": 5.0, "eval_entropy": 1.8847647032144799, "eval_loss": 1.1231932640075684, "eval_mean_token_accuracy": 0.8734663190512821, "eval_num_tokens": 23329700.0, "eval_runtime": 1004.8237, "eval_samples_per_second": 7.614, "eval_steps_per_second": 0.952, "step": 6925 }, { "epoch": 5.0, "step": 6925, "total_flos": 1.3802440307700695e+18, "train_loss": 0.02861043398070783, "train_runtime": 25037.5703, "train_samples_per_second": 2.211, "train_steps_per_second": 0.277 } ], "logging_steps": 10, "max_steps": 6925, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.3802440307700695e+18, "train_batch_size": 2, "trial_name": null, "trial_params": null }