{ "best_global_step": 1500, "best_metric": 0.4876999855041504, "best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_legal-provision-auditor_fallback_ffn_only_5ep_eval500/checkpoint-1500", "epoch": 5.0, "eval_steps": 500, "global_step": 3520, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 2.302528735995293, "epoch": 0.014214641080312722, "grad_norm": 4.828892707824707, "learning_rate": 1.6981132075471698e-06, "loss": 1.3984100341796875, "mean_token_accuracy": 0.6857675366103649, "num_tokens": 34855.0, "step": 10 }, { "entropy": 2.2492430746555327, "epoch": 0.028429282160625444, "grad_norm": 3.5804924964904785, "learning_rate": 3.5849056603773586e-06, "loss": 1.4428706169128418, "mean_token_accuracy": 0.6913674481213092, "num_tokens": 75959.0, "step": 20 }, { "entropy": 2.3167720407247545, "epoch": 0.042643923240938165, "grad_norm": 8.852733612060547, "learning_rate": 5.4716981132075475e-06, "loss": 1.5378618240356445, "mean_token_accuracy": 0.6808141805231571, "num_tokens": 111800.0, "step": 30 }, { "entropy": 2.233737552165985, "epoch": 0.05685856432125089, "grad_norm": 4.612252712249756, "learning_rate": 7.358490566037736e-06, "loss": 1.1216099739074707, "mean_token_accuracy": 0.7186247147619724, "num_tokens": 147472.0, "step": 40 }, { "entropy": 2.27722809612751, "epoch": 0.07107320540156362, "grad_norm": 3.0993638038635254, "learning_rate": 9.245283018867926e-06, "loss": 1.022943115234375, "mean_token_accuracy": 0.7546420469880104, "num_tokens": 190518.0, "step": 50 }, { "entropy": 2.336320897936821, "epoch": 0.08528784648187633, "grad_norm": 3.466336965560913, "learning_rate": 1.1132075471698115e-05, "loss": 0.9197140693664551, "mean_token_accuracy": 0.7917306423187256, "num_tokens": 226599.0, "step": 60 }, { "entropy": 2.3224798500537873, "epoch": 0.09950248756218906, "grad_norm": 2.5745620727539062, "learning_rate": 1.3018867924528303e-05, "loss": 0.7570995807647705, "mean_token_accuracy": 0.8374421924352646, "num_tokens": 267416.0, "step": 70 }, { "entropy": 2.26705806851387, "epoch": 0.11371712864250177, "grad_norm": 3.452971935272217, "learning_rate": 1.4905660377358491e-05, "loss": 0.5703647136688232, "mean_token_accuracy": 0.8376004211604595, "num_tokens": 306250.0, "step": 80 }, { "entropy": 2.341897654533386, "epoch": 0.1279317697228145, "grad_norm": 4.118662357330322, "learning_rate": 1.679245283018868e-05, "loss": 0.5330170631408692, "mean_token_accuracy": 0.8682203203439712, "num_tokens": 341963.0, "step": 90 }, { "entropy": 2.2404198199510574, "epoch": 0.14214641080312723, "grad_norm": 5.807668209075928, "learning_rate": 1.867924528301887e-05, "loss": 0.40104899406433103, "mean_token_accuracy": 0.8837951421737671, "num_tokens": 378822.0, "step": 100 }, { "entropy": 2.294436663389206, "epoch": 0.15636105188343993, "grad_norm": 4.4703288078308105, "learning_rate": 1.99999618947382e-05, "loss": 0.40310959815979003, "mean_token_accuracy": 0.8891363501548767, "num_tokens": 414530.0, "step": 110 }, { "entropy": 2.2652417331933976, "epoch": 0.17057569296375266, "grad_norm": 3.5225493907928467, "learning_rate": 1.999928447594037e-05, "loss": 0.32140042781829836, "mean_token_accuracy": 0.9204763844609261, "num_tokens": 449719.0, "step": 120 }, { "entropy": 2.1712214767932894, "epoch": 0.1847903340440654, "grad_norm": 4.550766468048096, "learning_rate": 1.999776033957351e-05, "loss": 0.3288241147994995, "mean_token_accuracy": 0.9241611689329148, "num_tokens": 487297.0, "step": 130 }, { "entropy": 2.2248219311237336, "epoch": 0.19900497512437812, "grad_norm": 3.3866801261901855, "learning_rate": 1.999538961469817e-05, "loss": 0.1645406723022461, "mean_token_accuracy": 0.9473418429493904, "num_tokens": 522381.0, "step": 140 }, { "entropy": 2.2194749146699904, "epoch": 0.21321961620469082, "grad_norm": 5.862302303314209, "learning_rate": 1.9992172502062152e-05, "loss": 0.27917327880859377, "mean_token_accuracy": 0.919804471731186, "num_tokens": 561254.0, "step": 150 }, { "entropy": 2.1698070406913756, "epoch": 0.22743425728500355, "grad_norm": 4.744441032409668, "learning_rate": 1.998810927408352e-05, "loss": 0.25531325340270994, "mean_token_accuracy": 0.9192116089165211, "num_tokens": 602617.0, "step": 160 }, { "entropy": 2.2647796124219894, "epoch": 0.24164889836531628, "grad_norm": 7.122901439666748, "learning_rate": 1.9983200274827553e-05, "loss": 0.2522935390472412, "mean_token_accuracy": 0.9494201198220253, "num_tokens": 637932.0, "step": 170 }, { "entropy": 2.1525828033685683, "epoch": 0.255863539445629, "grad_norm": 3.150447130203247, "learning_rate": 1.9977445919977577e-05, "loss": 0.18792203664779664, "mean_token_accuracy": 0.939947709441185, "num_tokens": 675271.0, "step": 180 }, { "entropy": 2.2198438853025437, "epoch": 0.27007818052594174, "grad_norm": 4.385933876037598, "learning_rate": 1.99708466967998e-05, "loss": 0.12581338882446289, "mean_token_accuracy": 0.9572400227189064, "num_tokens": 710422.0, "step": 190 }, { "entropy": 2.2473688989877703, "epoch": 0.28429282160625446, "grad_norm": 0.7782599925994873, "learning_rate": 1.9963403164102023e-05, "loss": 0.16216881275177003, "mean_token_accuracy": 0.9525286003947258, "num_tokens": 746633.0, "step": 200 }, { "entropy": 2.2106005609035493, "epoch": 0.29850746268656714, "grad_norm": 3.868602991104126, "learning_rate": 1.9955115952186337e-05, "loss": 0.32397260665893557, "mean_token_accuracy": 0.9184088215231896, "num_tokens": 780855.0, "step": 210 }, { "entropy": 2.161737409234047, "epoch": 0.31272210376687987, "grad_norm": 6.2161784172058105, "learning_rate": 1.994598576279575e-05, "loss": 0.147584068775177, "mean_token_accuracy": 0.9548472836613655, "num_tokens": 820662.0, "step": 220 }, { "entropy": 2.2137836784124376, "epoch": 0.3269367448471926, "grad_norm": 5.454526901245117, "learning_rate": 1.9936013369054748e-05, "loss": 0.19472339153289794, "mean_token_accuracy": 0.9331202074885369, "num_tokens": 859624.0, "step": 230 }, { "entropy": 2.2511601120233538, "epoch": 0.3411513859275053, "grad_norm": 3.353757381439209, "learning_rate": 1.9925199615403857e-05, "loss": 0.10179495811462402, "mean_token_accuracy": 0.9729527950286865, "num_tokens": 895936.0, "step": 240 }, { "entropy": 2.2046679228544237, "epoch": 0.35536602700781805, "grad_norm": 5.455029487609863, "learning_rate": 1.9913545417528125e-05, "loss": 0.15011273622512816, "mean_token_accuracy": 0.9702284231781959, "num_tokens": 935793.0, "step": 250 }, { "entropy": 2.181716701388359, "epoch": 0.3695806680881308, "grad_norm": 1.6833304166793823, "learning_rate": 1.9901051762279557e-05, "loss": 0.11941384077072144, "mean_token_accuracy": 0.9655464366078377, "num_tokens": 973498.0, "step": 260 }, { "entropy": 2.164376962184906, "epoch": 0.3837953091684435, "grad_norm": 2.3306143283843994, "learning_rate": 1.9887719707593602e-05, "loss": 0.09658043384552002, "mean_token_accuracy": 0.9760609611868858, "num_tokens": 1009556.0, "step": 270 }, { "entropy": 2.087420853972435, "epoch": 0.39800995024875624, "grad_norm": 4.12304162979126, "learning_rate": 1.9873550382399528e-05, "loss": 0.07825971841812134, "mean_token_accuracy": 0.9765635132789612, "num_tokens": 1052914.0, "step": 280 }, { "entropy": 2.1707926601171494, "epoch": 0.41222459132906897, "grad_norm": 3.697993516921997, "learning_rate": 1.985854498652484e-05, "loss": 0.14083361625671387, "mean_token_accuracy": 0.9513696759939194, "num_tokens": 1092296.0, "step": 290 }, { "entropy": 2.1313129723072053, "epoch": 0.42643923240938164, "grad_norm": 3.0543739795684814, "learning_rate": 1.9842704790593695e-05, "loss": 0.12360785007476807, "mean_token_accuracy": 0.9688008055090904, "num_tokens": 1129248.0, "step": 300 }, { "entropy": 2.2083891183137894, "epoch": 0.44065387348969437, "grad_norm": 2.8632559776306152, "learning_rate": 1.982603113591928e-05, "loss": 0.1391190767288208, "mean_token_accuracy": 0.9566407799720764, "num_tokens": 1166255.0, "step": 310 }, { "entropy": 2.2131824254989625, "epoch": 0.4548685145700071, "grad_norm": 3.9666574001312256, "learning_rate": 1.9808525434390253e-05, "loss": 0.11147340536117553, "mean_token_accuracy": 0.9667007446289062, "num_tokens": 1201734.0, "step": 320 }, { "entropy": 2.224493718147278, "epoch": 0.4690831556503198, "grad_norm": 5.834049224853516, "learning_rate": 1.9790189168351185e-05, "loss": 0.17519290447235109, "mean_token_accuracy": 0.9621825873851776, "num_tokens": 1240835.0, "step": 330 }, { "entropy": 2.1801333963871, "epoch": 0.48329779673063256, "grad_norm": 0.8749763369560242, "learning_rate": 1.977102389047704e-05, "loss": 0.10031602382659913, "mean_token_accuracy": 0.9667783200740814, "num_tokens": 1276270.0, "step": 340 }, { "entropy": 2.1437912434339523, "epoch": 0.4975124378109453, "grad_norm": 3.661072254180908, "learning_rate": 1.9751031223641678e-05, "loss": 0.11026780605316162, "mean_token_accuracy": 0.9699726045131684, "num_tokens": 1313238.0, "step": 350 }, { "entropy": 2.1523136287927627, "epoch": 0.511727078891258, "grad_norm": 2.049119472503662, "learning_rate": 1.9730212860780467e-05, "loss": 0.14013859033584594, "mean_token_accuracy": 0.9650743275880813, "num_tokens": 1347519.0, "step": 360 }, { "entropy": 2.145729649066925, "epoch": 0.5259417199715707, "grad_norm": 2.146339178085327, "learning_rate": 1.9708570564746896e-05, "loss": 0.11286178827285767, "mean_token_accuracy": 0.963935986161232, "num_tokens": 1388152.0, "step": 370 }, { "entropy": 2.2653285562992096, "epoch": 0.5401563610518835, "grad_norm": 4.600983619689941, "learning_rate": 1.968610616816333e-05, "loss": 0.11360809803009034, "mean_token_accuracy": 0.9642397537827492, "num_tokens": 1426842.0, "step": 380 }, { "entropy": 2.229273745417595, "epoch": 0.5543710021321961, "grad_norm": 3.0675880908966064, "learning_rate": 1.9662821573265795e-05, "loss": 0.09846517443656921, "mean_token_accuracy": 0.97640630453825, "num_tokens": 1464251.0, "step": 390 }, { "entropy": 2.1834677189588545, "epoch": 0.5685856432125089, "grad_norm": 0.2358260601758957, "learning_rate": 1.9638718751742935e-05, "loss": 0.17364193201065065, "mean_token_accuracy": 0.9615416027605533, "num_tokens": 1500366.0, "step": 400 }, { "entropy": 2.173251363635063, "epoch": 0.5828002842928216, "grad_norm": 2.5061397552490234, "learning_rate": 1.9613799744569034e-05, "loss": 0.06473902463912964, "mean_token_accuracy": 0.9774620115756989, "num_tokens": 1534494.0, "step": 410 }, { "entropy": 2.2588789045810698, "epoch": 0.5970149253731343, "grad_norm": 3.6076488494873047, "learning_rate": 1.9588066661831182e-05, "loss": 0.15726373195648194, "mean_token_accuracy": 0.9641035035252571, "num_tokens": 1567343.0, "step": 420 }, { "entropy": 2.2106437146663667, "epoch": 0.6112295664534471, "grad_norm": 2.65738582611084, "learning_rate": 1.9561521682550628e-05, "loss": 0.09528368711471558, "mean_token_accuracy": 0.9648209795355797, "num_tokens": 1604518.0, "step": 430 }, { "entropy": 2.146402803063393, "epoch": 0.6254442075337597, "grad_norm": 2.8459908962249756, "learning_rate": 1.9534167054498235e-05, "loss": 0.08731676936149597, "mean_token_accuracy": 0.9775180697441102, "num_tokens": 1646302.0, "step": 440 }, { "entropy": 2.2472924411296846, "epoch": 0.6396588486140725, "grad_norm": 3.0984578132629395, "learning_rate": 1.950600509400416e-05, "loss": 0.07982758283615113, "mean_token_accuracy": 0.9743791311979294, "num_tokens": 1680467.0, "step": 450 }, { "entropy": 2.2500401556491854, "epoch": 0.6538734896943852, "grad_norm": 2.5706655979156494, "learning_rate": 1.9477038185761702e-05, "loss": 0.06145578622817993, "mean_token_accuracy": 0.9790576353669167, "num_tokens": 1715967.0, "step": 460 }, { "entropy": 2.2013922423124312, "epoch": 0.668088130774698, "grad_norm": 1.9893447160720825, "learning_rate": 1.9447268782625387e-05, "loss": 0.08759456276893615, "mean_token_accuracy": 0.9817471817135811, "num_tokens": 1750750.0, "step": 470 }, { "entropy": 2.190236097574234, "epoch": 0.6823027718550106, "grad_norm": 4.424774646759033, "learning_rate": 1.941669940540325e-05, "loss": 0.11516692638397216, "mean_token_accuracy": 0.9682943612337113, "num_tokens": 1790273.0, "step": 480 }, { "entropy": 2.19307736158371, "epoch": 0.6965174129353234, "grad_norm": 2.920266628265381, "learning_rate": 1.938533264264338e-05, "loss": 0.15450884103775026, "mean_token_accuracy": 0.9700801074504852, "num_tokens": 1830020.0, "step": 490 }, { "entropy": 2.178431448340416, "epoch": 0.7107320540156361, "grad_norm": 0.9854955673217773, "learning_rate": 1.935317115041474e-05, "loss": 0.12481092214584351, "mean_token_accuracy": 0.9689489394426346, "num_tokens": 1866987.0, "step": 500 }, { "epoch": 0.7107320540156361, "eval_entropy": 2.0971352836056814, "eval_loss": 0.5259134769439697, "eval_mean_token_accuracy": 0.8965634148696373, "eval_num_tokens": 1866987.0, "eval_runtime": 989.6656, "eval_samples_per_second": 7.731, "eval_steps_per_second": 0.967, "step": 500 }, { "entropy": 2.26279539167881, "epoch": 0.7249466950959488, "grad_norm": 1.328014612197876, "learning_rate": 1.932021765208224e-05, "loss": 0.12206135988235474, "mean_token_accuracy": 0.9650760263204574, "num_tokens": 1902204.0, "step": 510 }, { "entropy": 2.2842482030391693, "epoch": 0.7391613361762616, "grad_norm": 0.994979739189148, "learning_rate": 1.9286474938076146e-05, "loss": 0.10036804676055908, "mean_token_accuracy": 0.9778882250189781, "num_tokens": 1934799.0, "step": 520 }, { "entropy": 2.257565715909004, "epoch": 0.7533759772565742, "grad_norm": 2.4604053497314453, "learning_rate": 1.9251945865655784e-05, "loss": 0.1240536093711853, "mean_token_accuracy": 0.9661274179816246, "num_tokens": 1969249.0, "step": 530 }, { "entropy": 2.2129929661750793, "epoch": 0.767590618336887, "grad_norm": 3.858069896697998, "learning_rate": 1.9216633358667582e-05, "loss": 0.06604821681976318, "mean_token_accuracy": 0.9817861035466194, "num_tokens": 2003001.0, "step": 540 }, { "entropy": 2.1791742712259294, "epoch": 0.7818052594171997, "grad_norm": 4.455066204071045, "learning_rate": 1.91805404072975e-05, "loss": 0.14240108728408812, "mean_token_accuracy": 0.9565647065639495, "num_tokens": 2039690.0, "step": 550 }, { "entropy": 2.2445179164409637, "epoch": 0.7960199004975125, "grad_norm": 1.3273934125900269, "learning_rate": 1.914367006781783e-05, "loss": 0.09953938722610474, "mean_token_accuracy": 0.9738000154495239, "num_tokens": 2075587.0, "step": 560 }, { "entropy": 2.201731264591217, "epoch": 0.8102345415778252, "grad_norm": 3.3293604850769043, "learning_rate": 1.9106025462328392e-05, "loss": 0.07859283089637756, "mean_token_accuracy": 0.9805291876196861, "num_tokens": 2108460.0, "step": 570 }, { "entropy": 2.2557914018630982, "epoch": 0.8244491826581379, "grad_norm": 1.1793880462646484, "learning_rate": 1.9067609778492147e-05, "loss": 0.03049740493297577, "mean_token_accuracy": 0.9910580679774285, "num_tokens": 2143684.0, "step": 580 }, { "entropy": 2.159291934967041, "epoch": 0.8386638237384506, "grad_norm": 1.225790023803711, "learning_rate": 1.90284262692653e-05, "loss": 0.06553000211715698, "mean_token_accuracy": 0.9782250091433525, "num_tokens": 2178600.0, "step": 590 }, { "entropy": 2.171927785873413, "epoch": 0.8528784648187633, "grad_norm": 3.7838656902313232, "learning_rate": 1.8988478252621823e-05, "loss": 0.06374742388725281, "mean_token_accuracy": 0.9801983863115311, "num_tokens": 2217809.0, "step": 600 }, { "entropy": 2.1900578796863557, "epoch": 0.8670931058990761, "grad_norm": 2.7667667865753174, "learning_rate": 1.8947769111272513e-05, "loss": 0.07156231999397278, "mean_token_accuracy": 0.9831789165735245, "num_tokens": 2255894.0, "step": 610 }, { "entropy": 2.188087573647499, "epoch": 0.8813077469793887, "grad_norm": 1.352272391319275, "learning_rate": 1.890630229237855e-05, "loss": 0.07383124232292175, "mean_token_accuracy": 0.9796638250350952, "num_tokens": 2290515.0, "step": 620 }, { "entropy": 2.2202280551195144, "epoch": 0.8955223880597015, "grad_norm": 3.82440447807312, "learning_rate": 1.8864081307259575e-05, "loss": 0.07150052189826965, "mean_token_accuracy": 0.9653487637639045, "num_tokens": 2328545.0, "step": 630 }, { "entropy": 2.199204143881798, "epoch": 0.9097370291400142, "grad_norm": 2.0685250759124756, "learning_rate": 1.8821109731096397e-05, "loss": 0.061190438270568845, "mean_token_accuracy": 0.9833000719547271, "num_tokens": 2362975.0, "step": 640 }, { "entropy": 2.2430183798074723, "epoch": 0.923951670220327, "grad_norm": 1.4594024419784546, "learning_rate": 1.877739120262822e-05, "loss": 0.05861002206802368, "mean_token_accuracy": 0.9801960617303849, "num_tokens": 2397300.0, "step": 650 }, { "entropy": 2.2240359395742417, "epoch": 0.9381663113006397, "grad_norm": 3.5333290100097656, "learning_rate": 1.8732929423844554e-05, "loss": 0.05537862181663513, "mean_token_accuracy": 0.9790173918008804, "num_tokens": 2430581.0, "step": 660 }, { "entropy": 2.2369117051362992, "epoch": 0.9523809523809523, "grad_norm": 5.941117286682129, "learning_rate": 1.8687728159671705e-05, "loss": 0.1064723014831543, "mean_token_accuracy": 0.9709701180458069, "num_tokens": 2468425.0, "step": 670 }, { "entropy": 2.2235177606344223, "epoch": 0.9665955934612651, "grad_norm": 1.9442089796066284, "learning_rate": 1.8641791237654e-05, "loss": 0.09505320787429809, "mean_token_accuracy": 0.9777823403477669, "num_tokens": 2506372.0, "step": 680 }, { "entropy": 2.189699539542198, "epoch": 0.9808102345415778, "grad_norm": 1.7199773788452148, "learning_rate": 1.8595122547629654e-05, "loss": 0.08579087853431702, "mean_token_accuracy": 0.981938436627388, "num_tokens": 2544255.0, "step": 690 }, { "entropy": 2.203128972649574, "epoch": 0.9950248756218906, "grad_norm": 1.9164578914642334, "learning_rate": 1.854772604140141e-05, "loss": 0.054469770193099974, "mean_token_accuracy": 0.9730748474597931, "num_tokens": 2584451.0, "step": 700 }, { "entropy": 2.187663435935974, "epoch": 1.0085287846481876, "grad_norm": 2.734229803085327, "learning_rate": 1.8499605732401897e-05, "loss": 0.03613282144069672, "mean_token_accuracy": 0.9859623281579268, "num_tokens": 2618160.0, "step": 710 }, { "entropy": 2.2002769261598587, "epoch": 1.0227434257285004, "grad_norm": 3.451009750366211, "learning_rate": 1.8450765695353765e-05, "loss": 0.05161011219024658, "mean_token_accuracy": 0.9848280772566795, "num_tokens": 2656683.0, "step": 720 }, { "entropy": 2.1792144656181334, "epoch": 1.036958066808813, "grad_norm": 2.6109533309936523, "learning_rate": 1.840121006592468e-05, "loss": 0.05695715546607971, "mean_token_accuracy": 0.9819708660244941, "num_tokens": 2693571.0, "step": 730 }, { "entropy": 2.168749713897705, "epoch": 1.0511727078891258, "grad_norm": 2.983471155166626, "learning_rate": 1.8350943040377104e-05, "loss": 0.04387234449386597, "mean_token_accuracy": 0.9895394578576088, "num_tokens": 2734066.0, "step": 740 }, { "entropy": 2.150976684689522, "epoch": 1.0653873489694385, "grad_norm": 4.730701923370361, "learning_rate": 1.829996887521297e-05, "loss": 0.08097095489501953, "mean_token_accuracy": 0.9824510410428047, "num_tokens": 2773575.0, "step": 750 }, { "entropy": 2.202870362997055, "epoch": 1.0796019900497513, "grad_norm": 0.6767167448997498, "learning_rate": 1.8248291886813245e-05, "loss": 0.045699647068977355, "mean_token_accuracy": 0.9877486750483513, "num_tokens": 2809884.0, "step": 760 }, { "entropy": 2.1357246190309525, "epoch": 1.0938166311300639, "grad_norm": 4.62387752532959, "learning_rate": 1.8195916451072427e-05, "loss": 0.09070175290107726, "mean_token_accuracy": 0.978462915122509, "num_tokens": 2849476.0, "step": 770 }, { "entropy": 2.157443994283676, "epoch": 1.1080312722103767, "grad_norm": 0.9505185484886169, "learning_rate": 1.8142847003028025e-05, "loss": 0.11641521453857422, "mean_token_accuracy": 0.9711179152131081, "num_tokens": 2885597.0, "step": 780 }, { "entropy": 2.19150624871254, "epoch": 1.1222459132906895, "grad_norm": 0.48967626690864563, "learning_rate": 1.8089088036484982e-05, "loss": 0.0332806795835495, "mean_token_accuracy": 0.9921609848737717, "num_tokens": 2921138.0, "step": 790 }, { "entropy": 2.2178327053785325, "epoch": 1.136460554371002, "grad_norm": 1.6019129753112793, "learning_rate": 1.8034644103635168e-05, "loss": 0.044434782862663266, "mean_token_accuracy": 0.9820729941129684, "num_tokens": 2954764.0, "step": 800 }, { "entropy": 2.164334940910339, "epoch": 1.1506751954513148, "grad_norm": 0.8724451661109924, "learning_rate": 1.7979519814671892e-05, "loss": 0.03360059857368469, "mean_token_accuracy": 0.9849594548344612, "num_tokens": 2986877.0, "step": 810 }, { "entropy": 2.1950933396816255, "epoch": 1.1648898365316276, "grad_norm": 4.613320350646973, "learning_rate": 1.7923719837399548e-05, "loss": 0.04860695898532867, "mean_token_accuracy": 0.9842689201235771, "num_tokens": 3022958.0, "step": 820 }, { "entropy": 2.228426894545555, "epoch": 1.1791044776119404, "grad_norm": 3.380880355834961, "learning_rate": 1.786724889683833e-05, "loss": 0.0661603033542633, "mean_token_accuracy": 0.9793119549751281, "num_tokens": 3058741.0, "step": 830 }, { "entropy": 2.1500797808170318, "epoch": 1.193319118692253, "grad_norm": 2.8803505897521973, "learning_rate": 1.7810111774824145e-05, "loss": 0.0518546998500824, "mean_token_accuracy": 0.9858181729912758, "num_tokens": 3097002.0, "step": 840 }, { "entropy": 2.134665223956108, "epoch": 1.2075337597725657, "grad_norm": 1.3723540306091309, "learning_rate": 1.7752313309603686e-05, "loss": 0.0568238615989685, "mean_token_accuracy": 0.9837430208921433, "num_tokens": 3135350.0, "step": 850 }, { "entropy": 2.1059677451848984, "epoch": 1.2217484008528785, "grad_norm": 0.2232239991426468, "learning_rate": 1.7693858395424743e-05, "loss": 0.029073348641395567, "mean_token_accuracy": 0.9910536676645278, "num_tokens": 3175892.0, "step": 860 }, { "entropy": 2.0856614857912064, "epoch": 1.235963041933191, "grad_norm": 3.187932252883911, "learning_rate": 1.7634751982121772e-05, "loss": 0.062130671739578244, "mean_token_accuracy": 0.9819218471646309, "num_tokens": 3218003.0, "step": 870 }, { "entropy": 2.151488536596298, "epoch": 1.2501776830135038, "grad_norm": 1.0572253465652466, "learning_rate": 1.7574999074696747e-05, "loss": 0.024734890460968016, "mean_token_accuracy": 0.9933405518531799, "num_tokens": 3255955.0, "step": 880 }, { "entropy": 2.1391431748867036, "epoch": 1.2643923240938166, "grad_norm": 0.6491001844406128, "learning_rate": 1.7514604732895364e-05, "loss": 0.015290029346942902, "mean_token_accuracy": 0.9944353476166725, "num_tokens": 3290879.0, "step": 890 }, { "entropy": 2.159931790828705, "epoch": 1.2786069651741294, "grad_norm": 0.36106443405151367, "learning_rate": 1.7453574070778572e-05, "loss": 0.023708008229732513, "mean_token_accuracy": 0.9893430173397064, "num_tokens": 3325818.0, "step": 900 }, { "entropy": 2.2356686383485793, "epoch": 1.2928216062544422, "grad_norm": 0.3880334794521332, "learning_rate": 1.7391912256289535e-05, "loss": 0.047500818967819214, "mean_token_accuracy": 0.9906172767281533, "num_tokens": 3361101.0, "step": 910 }, { "entropy": 2.1481542110443117, "epoch": 1.3070362473347548, "grad_norm": 1.1337789297103882, "learning_rate": 1.7329624510816016e-05, "loss": 0.06250383257865906, "mean_token_accuracy": 0.986290380358696, "num_tokens": 3398228.0, "step": 920 }, { "entropy": 2.199899733066559, "epoch": 1.3212508884150675, "grad_norm": 7.506823539733887, "learning_rate": 1.7266716108748265e-05, "loss": 0.05416156649589539, "mean_token_accuracy": 0.9795574441552162, "num_tokens": 3434391.0, "step": 930 }, { "entropy": 2.1505257695913316, "epoch": 1.33546552949538, "grad_norm": 2.8287599086761475, "learning_rate": 1.720319237703236e-05, "loss": 0.03884570896625519, "mean_token_accuracy": 0.9827989488840103, "num_tokens": 3476252.0, "step": 940 }, { "entropy": 2.260223591327667, "epoch": 1.349680170575693, "grad_norm": 4.396107196807861, "learning_rate": 1.713905869471915e-05, "loss": 0.08108161687850952, "mean_token_accuracy": 0.9792245835065841, "num_tokens": 3511513.0, "step": 950 }, { "entropy": 2.1618774831295013, "epoch": 1.3638948116560057, "grad_norm": 2.1915652751922607, "learning_rate": 1.7074320492508776e-05, "loss": 0.03704064786434173, "mean_token_accuracy": 0.9879031211137772, "num_tokens": 3547869.0, "step": 960 }, { "entropy": 2.2029319226741793, "epoch": 1.3781094527363185, "grad_norm": 1.989353060722351, "learning_rate": 1.70089832522908e-05, "loss": 0.04472963809967041, "mean_token_accuracy": 0.9839362189173698, "num_tokens": 3582370.0, "step": 970 }, { "entropy": 2.1237045884132386, "epoch": 1.3923240938166312, "grad_norm": 2.7585880756378174, "learning_rate": 1.6943052506680014e-05, "loss": 0.017387883365154268, "mean_token_accuracy": 0.995327465236187, "num_tokens": 3620986.0, "step": 980 }, { "entropy": 2.1093700736761094, "epoch": 1.4065387348969438, "grad_norm": 0.8583207130432129, "learning_rate": 1.6876533838547954e-05, "loss": 0.04421250224113464, "mean_token_accuracy": 0.9878856271505356, "num_tokens": 3657882.0, "step": 990 }, { "entropy": 2.0695310294628144, "epoch": 1.4207533759772566, "grad_norm": 0.020872101187705994, "learning_rate": 1.6809432880550142e-05, "loss": 0.015215454995632172, "mean_token_accuracy": 0.9934112429618835, "num_tokens": 3694203.0, "step": 1000 }, { "epoch": 1.4207533759772566, "eval_entropy": 1.996728012305193, "eval_loss": 0.5132695436477661, "eval_mean_token_accuracy": 0.912858964382917, "eval_num_tokens": 3694203.0, "eval_runtime": 988.7535, "eval_samples_per_second": 7.738, "eval_steps_per_second": 0.968, "step": 1000 }, { "entropy": 2.193378761410713, "epoch": 1.4349680170575694, "grad_norm": 1.7698736190795898, "learning_rate": 1.6741755314649148e-05, "loss": 0.05021881461143494, "mean_token_accuracy": 0.9833689332008362, "num_tokens": 3727853.0, "step": 1010 }, { "entropy": 2.1755041390657426, "epoch": 1.449182658137882, "grad_norm": 8.36669921875, "learning_rate": 1.6673506871633422e-05, "loss": 0.07425625920295716, "mean_token_accuracy": 0.9873648002743721, "num_tokens": 3761837.0, "step": 1020 }, { "entropy": 2.2001064866781235, "epoch": 1.4633972992181947, "grad_norm": 3.99029278755188, "learning_rate": 1.6604693330632055e-05, "loss": 0.060235065221786496, "mean_token_accuracy": 0.9781348332762718, "num_tokens": 3798914.0, "step": 1030 }, { "entropy": 2.121982756257057, "epoch": 1.4776119402985075, "grad_norm": 0.9836737513542175, "learning_rate": 1.6535320518625394e-05, "loss": 0.02696731984615326, "mean_token_accuracy": 0.9905053526163101, "num_tokens": 3838355.0, "step": 1040 }, { "entropy": 2.170503485202789, "epoch": 1.4918265813788203, "grad_norm": 1.3061282634735107, "learning_rate": 1.6465394309951643e-05, "loss": 0.03811564743518829, "mean_token_accuracy": 0.9868202403187751, "num_tokens": 3873118.0, "step": 1050 }, { "entropy": 2.184956783056259, "epoch": 1.5060412224591329, "grad_norm": 0.16141857206821442, "learning_rate": 1.639492062580941e-05, "loss": 0.02506377696990967, "mean_token_accuracy": 0.9951693743467331, "num_tokens": 3907762.0, "step": 1060 }, { "entropy": 2.2151595264673234, "epoch": 1.5202558635394456, "grad_norm": 1.2822521924972534, "learning_rate": 1.6323905433756348e-05, "loss": 0.04546615481376648, "mean_token_accuracy": 0.9900464177131653, "num_tokens": 3942498.0, "step": 1070 }, { "entropy": 2.2206559479236603, "epoch": 1.5344705046197582, "grad_norm": 1.1591120958328247, "learning_rate": 1.6252354747203804e-05, "loss": 0.0512237548828125, "mean_token_accuracy": 0.9911876812577247, "num_tokens": 3974758.0, "step": 1080 }, { "entropy": 2.1994840264320374, "epoch": 1.548685145700071, "grad_norm": 1.1228119134902954, "learning_rate": 1.6180274624907637e-05, "loss": 0.052582383155822754, "mean_token_accuracy": 0.9877693071961403, "num_tokens": 4010393.0, "step": 1090 }, { "entropy": 2.2292975306510927, "epoch": 1.5628997867803838, "grad_norm": 4.671175479888916, "learning_rate": 1.6107671170455164e-05, "loss": 0.037269750237464906, "mean_token_accuracy": 0.9906544610857964, "num_tokens": 4042491.0, "step": 1100 }, { "entropy": 2.1922069817781447, "epoch": 1.5771144278606966, "grad_norm": 0.815264105796814, "learning_rate": 1.603455053174833e-05, "loss": 0.05773057341575623, "mean_token_accuracy": 0.9827793538570404, "num_tokens": 4082169.0, "step": 1110 }, { "entropy": 2.1343121081590652, "epoch": 1.5913290689410093, "grad_norm": 1.9564604759216309, "learning_rate": 1.5960918900483112e-05, "loss": 0.06395858526229858, "mean_token_accuracy": 0.9741567522287369, "num_tokens": 4120949.0, "step": 1120 }, { "entropy": 2.116546794772148, "epoch": 1.6055437100213221, "grad_norm": 0.6864196062088013, "learning_rate": 1.5886782511625216e-05, "loss": 0.035008615255355834, "mean_token_accuracy": 0.9885725691914559, "num_tokens": 4155338.0, "step": 1130 }, { "entropy": 2.101371333003044, "epoch": 1.6197583511016347, "grad_norm": 2.144096851348877, "learning_rate": 1.5812147642882126e-05, "loss": 0.05081506371498108, "mean_token_accuracy": 0.9900156706571579, "num_tokens": 4193065.0, "step": 1140 }, { "entropy": 2.1167595058679582, "epoch": 1.6339729921819472, "grad_norm": 3.001270055770874, "learning_rate": 1.57370206141715e-05, "loss": 0.029940304160118104, "mean_token_accuracy": 0.9919799283146858, "num_tokens": 4233177.0, "step": 1150 }, { "entropy": 2.1953104764223097, "epoch": 1.64818763326226, "grad_norm": 0.5304042100906372, "learning_rate": 1.5661407787086052e-05, "loss": 0.04557282626628876, "mean_token_accuracy": 0.9914614632725716, "num_tokens": 4270719.0, "step": 1160 }, { "entropy": 2.195063552260399, "epoch": 1.6624022743425728, "grad_norm": 2.064101219177246, "learning_rate": 1.5585315564354816e-05, "loss": 0.02791608273983002, "mean_token_accuracy": 0.9903463527560235, "num_tokens": 4307326.0, "step": 1170 }, { "entropy": 2.160296180844307, "epoch": 1.6766169154228856, "grad_norm": 0.20038703083992004, "learning_rate": 1.5508750389301018e-05, "loss": 0.018147528171539307, "mean_token_accuracy": 0.9959616541862488, "num_tokens": 4342167.0, "step": 1180 }, { "entropy": 2.0997723072767256, "epoch": 1.6908315565031984, "grad_norm": 0.4269106388092041, "learning_rate": 1.5431718745296446e-05, "loss": 0.031970590353012085, "mean_token_accuracy": 0.9925994470715522, "num_tokens": 4378382.0, "step": 1190 }, { "entropy": 2.15362486243248, "epoch": 1.7050461975835112, "grad_norm": 1.4277267456054688, "learning_rate": 1.5354227155212455e-05, "loss": 0.03519009053707123, "mean_token_accuracy": 0.9948211744427681, "num_tokens": 4412402.0, "step": 1200 }, { "entropy": 2.1371404409408568, "epoch": 1.7192608386638237, "grad_norm": 2.0894289016723633, "learning_rate": 1.527628218086765e-05, "loss": 0.05730880498886108, "mean_token_accuracy": 0.9833267420530319, "num_tokens": 4448245.0, "step": 1210 }, { "entropy": 2.1023225128650664, "epoch": 1.7334754797441365, "grad_norm": 3.533341407775879, "learning_rate": 1.5197890422472204e-05, "loss": 0.039241823554039004, "mean_token_accuracy": 0.9856926873326302, "num_tokens": 4483857.0, "step": 1220 }, { "entropy": 2.0918066024780275, "epoch": 1.747690120824449, "grad_norm": 1.4843463897705078, "learning_rate": 1.5119058518068994e-05, "loss": 0.03128263652324677, "mean_token_accuracy": 0.9900650411844254, "num_tokens": 4525449.0, "step": 1230 }, { "entropy": 2.1807575821876526, "epoch": 1.7619047619047619, "grad_norm": 2.492711305618286, "learning_rate": 1.5039793142971501e-05, "loss": 0.061214137077331546, "mean_token_accuracy": 0.9877642571926117, "num_tokens": 4564889.0, "step": 1240 }, { "entropy": 2.13520385324955, "epoch": 1.7761194029850746, "grad_norm": 0.8968533873558044, "learning_rate": 1.496010100919856e-05, "loss": 0.04278126358985901, "mean_token_accuracy": 0.9871073856949806, "num_tokens": 4601655.0, "step": 1250 }, { "entropy": 2.135896974802017, "epoch": 1.7903340440653874, "grad_norm": 0.5659345388412476, "learning_rate": 1.4879988864905992e-05, "loss": 0.039053690433502194, "mean_token_accuracy": 0.990781481564045, "num_tokens": 4637400.0, "step": 1260 }, { "entropy": 2.14559406042099, "epoch": 1.8045486851457002, "grad_norm": 1.262707233428955, "learning_rate": 1.4799463493815199e-05, "loss": 0.05618187189102173, "mean_token_accuracy": 0.9844638153910636, "num_tokens": 4675200.0, "step": 1270 }, { "entropy": 2.130327156186104, "epoch": 1.8187633262260128, "grad_norm": 1.905463457107544, "learning_rate": 1.4718531714638719e-05, "loss": 0.03753847479820251, "mean_token_accuracy": 0.9798910677433014, "num_tokens": 4712415.0, "step": 1280 }, { "entropy": 2.061409738659859, "epoch": 1.8329779673063256, "grad_norm": 2.095902681350708, "learning_rate": 1.4637200380502842e-05, "loss": 0.04141142666339874, "mean_token_accuracy": 0.984546284377575, "num_tokens": 4752936.0, "step": 1290 }, { "entropy": 2.12393804192543, "epoch": 1.8471926083866381, "grad_norm": 2.4633586406707764, "learning_rate": 1.4555476378367304e-05, "loss": 0.03877743482589722, "mean_token_accuracy": 0.98830596357584, "num_tokens": 4789364.0, "step": 1300 }, { "entropy": 2.1741877257823945, "epoch": 1.861407249466951, "grad_norm": 0.22966082394123077, "learning_rate": 1.4473366628442093e-05, "loss": 0.06458597779273986, "mean_token_accuracy": 0.9805670469999314, "num_tokens": 4825122.0, "step": 1310 }, { "entropy": 2.2013738095760345, "epoch": 1.8756218905472637, "grad_norm": 0.31942903995513916, "learning_rate": 1.4390878083601498e-05, "loss": 0.012605372071266174, "mean_token_accuracy": 0.9942255452275276, "num_tokens": 4856314.0, "step": 1320 }, { "entropy": 2.1380729913711547, "epoch": 1.8898365316275765, "grad_norm": 1.0672839879989624, "learning_rate": 1.4308017728795322e-05, "loss": 0.019631707668304445, "mean_token_accuracy": 0.9956912875175477, "num_tokens": 4894480.0, "step": 1330 }, { "entropy": 2.144209420681, "epoch": 1.9040511727078893, "grad_norm": 3.408994674682617, "learning_rate": 1.4224792580457431e-05, "loss": 0.07080478072166443, "mean_token_accuracy": 0.9856290057301521, "num_tokens": 4928079.0, "step": 1340 }, { "entropy": 2.127260631322861, "epoch": 1.9182658137882018, "grad_norm": 1.3405135869979858, "learning_rate": 1.4141209685911603e-05, "loss": 0.03551123440265656, "mean_token_accuracy": 0.9912566438317298, "num_tokens": 4966874.0, "step": 1350 }, { "entropy": 2.057062420248985, "epoch": 1.9324804548685146, "grad_norm": 2.4303998947143555, "learning_rate": 1.4057276122774784e-05, "loss": 0.025794893503189087, "mean_token_accuracy": 0.9910008162260056, "num_tokens": 5014153.0, "step": 1360 }, { "entropy": 2.0976122200489042, "epoch": 1.9466950959488272, "grad_norm": 0.975439727306366, "learning_rate": 1.3972998998357778e-05, "loss": 0.057805228233337405, "mean_token_accuracy": 0.9882346078753471, "num_tokens": 5050370.0, "step": 1370 }, { "entropy": 2.12088503241539, "epoch": 1.96090973702914, "grad_norm": 2.241792917251587, "learning_rate": 1.38883854490634e-05, "loss": 0.02719011902809143, "mean_token_accuracy": 0.9968120694160462, "num_tokens": 5089198.0, "step": 1380 }, { "entropy": 2.186630555987358, "epoch": 1.9751243781094527, "grad_norm": 0.02887093275785446, "learning_rate": 1.380344263978219e-05, "loss": 0.02653237581253052, "mean_token_accuracy": 0.9873360604047775, "num_tokens": 5125154.0, "step": 1390 }, { "entropy": 2.0880779802799223, "epoch": 1.9893390191897655, "grad_norm": 0.06101665645837784, "learning_rate": 1.371817776328571e-05, "loss": 0.017497384548187257, "mean_token_accuracy": 0.9919103473424912, "num_tokens": 5165570.0, "step": 1400 }, { "entropy": 2.1103323039255644, "epoch": 2.0028429282160625, "grad_norm": 2.5834667682647705, "learning_rate": 1.3632598039617459e-05, "loss": 0.028596514463424684, "mean_token_accuracy": 0.9918049009222734, "num_tokens": 5200022.0, "step": 1410 }, { "entropy": 2.080328956246376, "epoch": 2.0170575692963753, "grad_norm": 2.0883054733276367, "learning_rate": 1.3546710715481528e-05, "loss": 0.010676021128892899, "mean_token_accuracy": 0.9944428727030754, "num_tokens": 5239050.0, "step": 1420 }, { "entropy": 2.11694977581501, "epoch": 2.031272210376688, "grad_norm": 0.6384166479110718, "learning_rate": 1.346052306362892e-05, "loss": 0.031712406873703004, "mean_token_accuracy": 0.99215517193079, "num_tokens": 5278603.0, "step": 1430 }, { "entropy": 2.1320772975683213, "epoch": 2.045486851457001, "grad_norm": 0.04183308035135269, "learning_rate": 1.3374042382241743e-05, "loss": 0.024064309895038605, "mean_token_accuracy": 0.9902747467160224, "num_tokens": 5312650.0, "step": 1440 }, { "entropy": 2.133982640504837, "epoch": 2.0597014925373136, "grad_norm": 1.4074985980987549, "learning_rate": 1.3287275994315211e-05, "loss": 0.017666606605052947, "mean_token_accuracy": 0.9940287739038467, "num_tokens": 5346534.0, "step": 1450 }, { "entropy": 2.1367667734622957, "epoch": 2.073916133617626, "grad_norm": 1.0920348167419434, "learning_rate": 1.3200231247037534e-05, "loss": 0.010746689885854721, "mean_token_accuracy": 0.9960371211171151, "num_tokens": 5384670.0, "step": 1460 }, { "entropy": 2.133867809176445, "epoch": 2.0881307746979387, "grad_norm": 1.6067408323287964, "learning_rate": 1.3112915511167792e-05, "loss": 0.036738994717597964, "mean_token_accuracy": 0.988915441930294, "num_tokens": 5420443.0, "step": 1470 }, { "entropy": 2.174367681145668, "epoch": 2.1023454157782515, "grad_norm": 0.5817322134971619, "learning_rate": 1.3025336180411783e-05, "loss": 0.018730011582374573, "mean_token_accuracy": 0.9928426295518875, "num_tokens": 5455408.0, "step": 1480 }, { "entropy": 2.1845018327236176, "epoch": 2.1165600568585643, "grad_norm": 0.9014100432395935, "learning_rate": 1.2937500670795941e-05, "loss": 0.008142998069524765, "mean_token_accuracy": 0.9969136103987694, "num_tokens": 5486597.0, "step": 1490 }, { "entropy": 2.1422977685928344, "epoch": 2.130774697938877, "grad_norm": 0.015557660721242428, "learning_rate": 1.2849416420039378e-05, "loss": 0.029416123032569887, "mean_token_accuracy": 0.9883611053228378, "num_tokens": 5523135.0, "step": 1500 }, { "epoch": 2.130774697938877, "eval_entropy": 2.012462474460263, "eval_loss": 0.4876999855041504, "eval_mean_token_accuracy": 0.9161205261229473, "eval_num_tokens": 5523135.0, "eval_runtime": 989.9438, "eval_samples_per_second": 7.729, "eval_steps_per_second": 0.967, "step": 1500 }, { "entropy": 2.153908830881119, "epoch": 2.14498933901919, "grad_norm": 0.4453883767127991, "learning_rate": 1.276109088692405e-05, "loss": 0.016275449097156523, "mean_token_accuracy": 0.9947501629590988, "num_tokens": 5561113.0, "step": 1510 }, { "entropy": 2.1447213143110275, "epoch": 2.1592039800995027, "grad_norm": 0.09290453791618347, "learning_rate": 1.267253155066318e-05, "loss": 0.0074017919600009915, "mean_token_accuracy": 0.9969444438815117, "num_tokens": 5602031.0, "step": 1520 }, { "entropy": 2.1633759051561356, "epoch": 2.173418621179815, "grad_norm": 0.0523543544113636, "learning_rate": 1.2583745910267935e-05, "loss": 0.010185372829437257, "mean_token_accuracy": 0.9974342107772827, "num_tokens": 5644054.0, "step": 1530 }, { "entropy": 2.1849102139472962, "epoch": 2.1876332622601278, "grad_norm": 1.58631432056427, "learning_rate": 1.2494741483912414e-05, "loss": 0.025118106603622438, "mean_token_accuracy": 0.9866239562630653, "num_tokens": 5679892.0, "step": 1540 }, { "entropy": 2.0871244966983795, "epoch": 2.2018479033404406, "grad_norm": 0.07445530593395233, "learning_rate": 1.2405525808297041e-05, "loss": 0.012176018953323365, "mean_token_accuracy": 0.9966624140739441, "num_tokens": 5719192.0, "step": 1550 }, { "entropy": 2.1434724926948547, "epoch": 2.2160625444207533, "grad_norm": 0.22022129595279694, "learning_rate": 1.2316106438010363e-05, "loss": 0.011503981798887253, "mean_token_accuracy": 0.9932158127427101, "num_tokens": 5754586.0, "step": 1560 }, { "entropy": 2.1378200381994246, "epoch": 2.230277185501066, "grad_norm": 0.2574051022529602, "learning_rate": 1.2226490944889344e-05, "loss": 0.016648434102535248, "mean_token_accuracy": 0.99627845287323, "num_tokens": 5790164.0, "step": 1570 }, { "entropy": 2.1425430297851564, "epoch": 2.244491826581379, "grad_norm": 0.07441271096467972, "learning_rate": 1.2136686917378207e-05, "loss": 0.011707275360822677, "mean_token_accuracy": 0.9969677910208702, "num_tokens": 5826790.0, "step": 1580 }, { "entropy": 2.145805537700653, "epoch": 2.2587064676616917, "grad_norm": 0.025231340900063515, "learning_rate": 1.204670195988585e-05, "loss": 0.015510520339012146, "mean_token_accuracy": 0.9958001673221588, "num_tokens": 5864353.0, "step": 1590 }, { "entropy": 2.12614686191082, "epoch": 2.272921108742004, "grad_norm": 4.177783012390137, "learning_rate": 1.1956543692141925e-05, "loss": 0.02458135187625885, "mean_token_accuracy": 0.994461864233017, "num_tokens": 5901111.0, "step": 1600 }, { "entropy": 2.199042108654976, "epoch": 2.287135749822317, "grad_norm": 0.387260764837265, "learning_rate": 1.1866219748551627e-05, "loss": 0.027851936221122742, "mean_token_accuracy": 0.9944206327199936, "num_tokens": 5938751.0, "step": 1610 }, { "entropy": 2.1385419756174087, "epoch": 2.3013503909026296, "grad_norm": 1.4362543821334839, "learning_rate": 1.177573777754921e-05, "loss": 0.029392656683921815, "mean_token_accuracy": 0.9920833334326744, "num_tokens": 5975587.0, "step": 1620 }, { "entropy": 2.1314716190099716, "epoch": 2.3155650319829424, "grad_norm": 2.3883039951324463, "learning_rate": 1.1685105440950351e-05, "loss": 0.015017279982566833, "mean_token_accuracy": 0.9914116650819779, "num_tokens": 6011431.0, "step": 1630 }, { "entropy": 2.113403910398483, "epoch": 2.329779673063255, "grad_norm": 0.17976875603199005, "learning_rate": 1.1594330413303354e-05, "loss": 0.0052622310817241665, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 6051027.0, "step": 1640 }, { "entropy": 2.1885013312101362, "epoch": 2.343994314143568, "grad_norm": 2.1475982666015625, "learning_rate": 1.1503420381239288e-05, "loss": 0.049869978427886964, "mean_token_accuracy": 0.9862573102116585, "num_tokens": 6086770.0, "step": 1650 }, { "entropy": 2.154399809241295, "epoch": 2.3582089552238807, "grad_norm": 0.7839910984039307, "learning_rate": 1.1412383042821103e-05, "loss": 0.012508201599121093, "mean_token_accuracy": 0.9969967931509018, "num_tokens": 6120066.0, "step": 1660 }, { "entropy": 2.1582394361495973, "epoch": 2.372423596304193, "grad_norm": 0.127841517329216, "learning_rate": 1.1321226106891774e-05, "loss": 0.03399866819381714, "mean_token_accuracy": 0.9926647707819939, "num_tokens": 6155122.0, "step": 1670 }, { "entropy": 2.1920375645160677, "epoch": 2.386638237384506, "grad_norm": 0.5719994306564331, "learning_rate": 1.1229957292421532e-05, "loss": 0.01301535964012146, "mean_token_accuracy": 0.9950501263141632, "num_tokens": 6189949.0, "step": 1680 }, { "entropy": 2.1470602810382844, "epoch": 2.4008528784648187, "grad_norm": 0.01053235400468111, "learning_rate": 1.1138584327854236e-05, "loss": 0.006975927203893661, "mean_token_accuracy": 0.9970934271812439, "num_tokens": 6227742.0, "step": 1690 }, { "entropy": 2.164599558711052, "epoch": 2.4150675195451314, "grad_norm": 4.409539699554443, "learning_rate": 1.1047114950452946e-05, "loss": 0.03146063089370728, "mean_token_accuracy": 0.9898314952850342, "num_tokens": 6261770.0, "step": 1700 }, { "entropy": 2.097541519999504, "epoch": 2.429282160625444, "grad_norm": 0.33211779594421387, "learning_rate": 1.0955556905644758e-05, "loss": 0.015510906279087067, "mean_token_accuracy": 0.9964471086859703, "num_tokens": 6302590.0, "step": 1710 }, { "entropy": 2.110760509967804, "epoch": 2.443496801705757, "grad_norm": 0.07505965232849121, "learning_rate": 1.0863917946364924e-05, "loss": 0.020162013173103333, "mean_token_accuracy": 0.9964295968413353, "num_tokens": 6342274.0, "step": 1720 }, { "entropy": 2.2031593352556227, "epoch": 2.45771144278607, "grad_norm": 0.1552923619747162, "learning_rate": 1.0772205832400357e-05, "loss": 0.021290890872478485, "mean_token_accuracy": 0.9951711297035217, "num_tokens": 6374676.0, "step": 1730 }, { "entropy": 2.1717267662286757, "epoch": 2.471926083866382, "grad_norm": 0.05812852829694748, "learning_rate": 1.0680428329732552e-05, "loss": 0.016620045900344847, "mean_token_accuracy": 0.9949463814496994, "num_tokens": 6411553.0, "step": 1740 }, { "entropy": 2.145307409763336, "epoch": 2.486140724946695, "grad_norm": 0.14837434887886047, "learning_rate": 1.0588593209879973e-05, "loss": 0.01613246649503708, "mean_token_accuracy": 0.9933097556233406, "num_tokens": 6445362.0, "step": 1750 }, { "entropy": 2.1177578270435333, "epoch": 2.5003553660270077, "grad_norm": 0.11420247703790665, "learning_rate": 1.0496708249239988e-05, "loss": 0.01733055114746094, "mean_token_accuracy": 0.9933325245976448, "num_tokens": 6480042.0, "step": 1760 }, { "entropy": 2.0375625282526015, "epoch": 2.5145700071073205, "grad_norm": 1.124937891960144, "learning_rate": 1.0404781228430365e-05, "loss": 0.014401055872440338, "mean_token_accuracy": 0.99840377420187, "num_tokens": 6523509.0, "step": 1770 }, { "entropy": 2.061618319153786, "epoch": 2.5287846481876333, "grad_norm": 2.1306679248809814, "learning_rate": 1.0312819931630438e-05, "loss": 0.011978740990161895, "mean_token_accuracy": 0.9983922109007836, "num_tokens": 6564762.0, "step": 1780 }, { "entropy": 2.144868162274361, "epoch": 2.542999289267946, "grad_norm": 2.329023599624634, "learning_rate": 1.022083214592196e-05, "loss": 0.015902377665042877, "mean_token_accuracy": 0.9979761898517608, "num_tokens": 6604633.0, "step": 1790 }, { "entropy": 2.1159115850925447, "epoch": 2.557213930348259, "grad_norm": 1.4145407676696777, "learning_rate": 1.0128825660629709e-05, "loss": 0.020478679239749907, "mean_token_accuracy": 0.9979009658098221, "num_tokens": 6641133.0, "step": 1800 }, { "entropy": 2.0676650613546372, "epoch": 2.571428571428571, "grad_norm": 0.48140275478363037, "learning_rate": 1.0036808266661893e-05, "loss": 0.022186580300331115, "mean_token_accuracy": 0.9940819069743156, "num_tokens": 6682211.0, "step": 1810 }, { "entropy": 2.12384712100029, "epoch": 2.5856432125088844, "grad_norm": 2.0902743339538574, "learning_rate": 9.944787755850455e-06, "loss": 0.01327282041311264, "mean_token_accuracy": 0.9970363482832909, "num_tokens": 6720217.0, "step": 1820 }, { "entropy": 2.152281162142754, "epoch": 2.5998578535891967, "grad_norm": 0.4297999441623688, "learning_rate": 9.852771920291257e-06, "loss": 0.00764169842004776, "mean_token_accuracy": 0.9964661106467247, "num_tokens": 6755330.0, "step": 1830 }, { "entropy": 2.133743789792061, "epoch": 2.6140724946695095, "grad_norm": 1.7086399793624878, "learning_rate": 9.760768551684272e-06, "loss": 0.014149065315723418, "mean_token_accuracy": 0.9932047992944717, "num_tokens": 6789704.0, "step": 1840 }, { "entropy": 2.220897752046585, "epoch": 2.6282871357498223, "grad_norm": 0.37043172121047974, "learning_rate": 9.668785440673802e-06, "loss": 0.010798779129981995, "mean_token_accuracy": 0.9927522420883179, "num_tokens": 6829906.0, "step": 1850 }, { "entropy": 2.1690511107444763, "epoch": 2.642501776830135, "grad_norm": 3.446093797683716, "learning_rate": 9.576830376188779e-06, "loss": 0.011588881909847259, "mean_token_accuracy": 0.9942647039890289, "num_tokens": 6862241.0, "step": 1860 }, { "entropy": 2.104657456278801, "epoch": 2.656716417910448, "grad_norm": 6.990153789520264, "learning_rate": 9.484911144783216e-06, "loss": 0.031561356782913205, "mean_token_accuracy": 0.9918665274977684, "num_tokens": 6902231.0, "step": 1870 }, { "entropy": 2.099566176533699, "epoch": 2.67093105899076, "grad_norm": 1.5687507390975952, "learning_rate": 9.393035529976857e-06, "loss": 0.03302261531352997, "mean_token_accuracy": 0.994696919620037, "num_tokens": 6943523.0, "step": 1880 }, { "entropy": 2.0341563537716865, "epoch": 2.6851457000710734, "grad_norm": 0.01727372594177723, "learning_rate": 9.301211311596091e-06, "loss": 0.009831630438566209, "mean_token_accuracy": 0.9966520965099335, "num_tokens": 6980909.0, "step": 1890 }, { "entropy": 2.142310842871666, "epoch": 2.699360341151386, "grad_norm": 2.9104232788085938, "learning_rate": 9.209446265115162e-06, "loss": 0.012867218255996704, "mean_token_accuracy": 0.9898214012384414, "num_tokens": 7017337.0, "step": 1900 }, { "entropy": 2.1923003911972048, "epoch": 2.7135749822316986, "grad_norm": 0.02433944121003151, "learning_rate": 9.117748160997786e-06, "loss": 0.006733021140098572, "mean_token_accuracy": 0.9975520834326744, "num_tokens": 7055337.0, "step": 1910 }, { "entropy": 2.1514430910348894, "epoch": 2.7277896233120114, "grad_norm": 0.08054083585739136, "learning_rate": 9.026124764039123e-06, "loss": 0.03414789140224457, "mean_token_accuracy": 0.9952777773141861, "num_tokens": 7091211.0, "step": 1920 }, { "entropy": 2.072894513607025, "epoch": 2.742004264392324, "grad_norm": 1.8925641775131226, "learning_rate": 8.934583832708305e-06, "loss": 0.010989753156900406, "mean_token_accuracy": 0.9934895843267441, "num_tokens": 7126267.0, "step": 1930 }, { "entropy": 2.0974434345960615, "epoch": 2.756218905472637, "grad_norm": 4.07625675201416, "learning_rate": 8.843133118491456e-06, "loss": 0.036723607778549196, "mean_token_accuracy": 0.9936398908495903, "num_tokens": 7162232.0, "step": 1940 }, { "entropy": 2.1628644078969956, "epoch": 2.7704335465529493, "grad_norm": 0.19412127137184143, "learning_rate": 8.751780365235308e-06, "loss": 0.016048797965049745, "mean_token_accuracy": 0.9971778348088265, "num_tokens": 7199909.0, "step": 1950 }, { "entropy": 2.091540029644966, "epoch": 2.7846481876332625, "grad_norm": 3.252357006072998, "learning_rate": 8.660533308491476e-06, "loss": 0.047638151049613955, "mean_token_accuracy": 0.9874005153775215, "num_tokens": 7236809.0, "step": 1960 }, { "entropy": 2.1849084466695787, "epoch": 2.798862828713575, "grad_norm": 0.08695745468139648, "learning_rate": 8.569399674861426e-06, "loss": 0.02756718695163727, "mean_token_accuracy": 0.9911953061819077, "num_tokens": 7274060.0, "step": 1970 }, { "entropy": 2.1544810086488724, "epoch": 2.8130774697938876, "grad_norm": 1.6851823329925537, "learning_rate": 8.478387181342195e-06, "loss": 0.018534281849861146, "mean_token_accuracy": 0.9929023250937462, "num_tokens": 7314220.0, "step": 1980 }, { "entropy": 2.131257200241089, "epoch": 2.8272921108742004, "grad_norm": 2.3103678226470947, "learning_rate": 8.387503534672947e-06, "loss": 0.008499032258987427, "mean_token_accuracy": 0.9965438395738602, "num_tokens": 7345637.0, "step": 1990 }, { "entropy": 2.13298476934433, "epoch": 2.841506751954513, "grad_norm": 0.1992063820362091, "learning_rate": 8.29675643068237e-06, "loss": 0.010052156448364259, "mean_token_accuracy": 0.9935064926743508, "num_tokens": 7381711.0, "step": 2000 }, { "epoch": 2.841506751954513, "eval_entropy": 1.9877975619823331, "eval_loss": 0.5002052187919617, "eval_mean_token_accuracy": 0.917853237257233, "eval_num_tokens": 7381711.0, "eval_runtime": 989.2063, "eval_samples_per_second": 7.734, "eval_steps_per_second": 0.967, "step": 2000 }, { "entropy": 2.1357434511184694, "epoch": 2.855721393034826, "grad_norm": 0.24105560779571533, "learning_rate": 8.206153553637029e-06, "loss": 0.014637093245983123, "mean_token_accuracy": 0.992483814060688, "num_tokens": 7420253.0, "step": 2010 }, { "entropy": 2.0427623748779298, "epoch": 2.8699360341151388, "grad_norm": 0.04688866436481476, "learning_rate": 8.115702575590651e-06, "loss": 0.0197280153632164, "mean_token_accuracy": 0.9940960317850113, "num_tokens": 7459527.0, "step": 2020 }, { "entropy": 2.107358440756798, "epoch": 2.8841506751954515, "grad_norm": 2.001885414123535, "learning_rate": 8.0254111557345e-06, "loss": 0.012085244059562683, "mean_token_accuracy": 0.9920702204108238, "num_tokens": 7492452.0, "step": 2030 }, { "entropy": 2.117280828952789, "epoch": 2.898365316275764, "grad_norm": 1.2196354866027832, "learning_rate": 7.935286939748793e-06, "loss": 0.019286631047725676, "mean_token_accuracy": 0.9929364129900933, "num_tokens": 7527373.0, "step": 2040 }, { "entropy": 2.098222628235817, "epoch": 2.9125799573560767, "grad_norm": 3.9219210147857666, "learning_rate": 7.845337559155285e-06, "loss": 0.01666049212217331, "mean_token_accuracy": 0.9912658214569092, "num_tokens": 7563275.0, "step": 2050 }, { "entropy": 2.1345431208610535, "epoch": 2.9267945984363894, "grad_norm": 0.32143792510032654, "learning_rate": 7.755570630671061e-06, "loss": 0.005718830227851868, "mean_token_accuracy": 0.9963970810174942, "num_tokens": 7597282.0, "step": 2060 }, { "entropy": 2.1360646575689315, "epoch": 2.9410092395167022, "grad_norm": 0.2594122886657715, "learning_rate": 7.665993755563563e-06, "loss": 0.014417172968387603, "mean_token_accuracy": 0.9959156066179276, "num_tokens": 7634208.0, "step": 2070 }, { "entropy": 2.1297189712524416, "epoch": 2.955223880597015, "grad_norm": 0.9254517555236816, "learning_rate": 7.576614519006913e-06, "loss": 0.022011277079582215, "mean_token_accuracy": 0.9956810921430588, "num_tokens": 7671271.0, "step": 2080 }, { "entropy": 2.2322384238243105, "epoch": 2.969438521677328, "grad_norm": 0.7473764419555664, "learning_rate": 7.487440489439646e-06, "loss": 0.010099399834871292, "mean_token_accuracy": 0.9970263168215752, "num_tokens": 7708380.0, "step": 2090 }, { "entropy": 2.11426265835762, "epoch": 2.9836531627576406, "grad_norm": 1.4097167253494263, "learning_rate": 7.39847921792381e-06, "loss": 0.023269766569137575, "mean_token_accuracy": 0.9920061439275741, "num_tokens": 7745868.0, "step": 2100 }, { "entropy": 2.116123300790787, "epoch": 2.997867803837953, "grad_norm": 1.8534623384475708, "learning_rate": 7.3097382375055645e-06, "loss": 0.017223817110061646, "mean_token_accuracy": 0.9949802815914154, "num_tokens": 7784384.0, "step": 2110 }, { "entropy": 2.094560576112647, "epoch": 3.0113717128642503, "grad_norm": 0.17719678580760956, "learning_rate": 7.221225062577313e-06, "loss": 0.0034023601561784743, "mean_token_accuracy": 0.996572312555815, "num_tokens": 7819286.0, "step": 2120 }, { "entropy": 2.0749322682619096, "epoch": 3.025586353944563, "grad_norm": 1.9489033222198486, "learning_rate": 7.13294718824137e-06, "loss": 0.0044484566897153854, "mean_token_accuracy": 0.9989130437374115, "num_tokens": 7856218.0, "step": 2130 }, { "entropy": 2.1713985592126845, "epoch": 3.0398009950248754, "grad_norm": 0.5477708578109741, "learning_rate": 7.0449120896753235e-06, "loss": 0.018094585835933687, "mean_token_accuracy": 0.993584257364273, "num_tokens": 7894029.0, "step": 2140 }, { "entropy": 2.1583692967891692, "epoch": 3.0540156361051882, "grad_norm": 0.023213613778352737, "learning_rate": 6.957127221499028e-06, "loss": 0.0034131985157728195, "mean_token_accuracy": 0.998275862634182, "num_tokens": 7932128.0, "step": 2150 }, { "entropy": 2.0848151594400406, "epoch": 3.068230277185501, "grad_norm": 2.0892016887664795, "learning_rate": 6.8696000171433855e-06, "loss": 0.004784305021166802, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 7970397.0, "step": 2160 }, { "entropy": 2.162716430425644, "epoch": 3.082444918265814, "grad_norm": 0.043601471930742264, "learning_rate": 6.782337888220882e-06, "loss": 0.0022532181814312936, "mean_token_accuracy": 1.0, "num_tokens": 8003756.0, "step": 2170 }, { "entropy": 2.127812659740448, "epoch": 3.0966595593461266, "grad_norm": 2.6567702293395996, "learning_rate": 6.6953482238980025e-06, "loss": 0.01237870380282402, "mean_token_accuracy": 0.9954761907458305, "num_tokens": 8042391.0, "step": 2180 }, { "entropy": 2.146624502539635, "epoch": 3.1108742004264394, "grad_norm": 0.00613620039075613, "learning_rate": 6.608638390269515e-06, "loss": 0.008086169511079789, "mean_token_accuracy": 0.9950213670730591, "num_tokens": 8078287.0, "step": 2190 }, { "entropy": 2.1586718261241913, "epoch": 3.125088841506752, "grad_norm": 0.022575080394744873, "learning_rate": 6.52221572973474e-06, "loss": 0.011718825995922088, "mean_token_accuracy": 0.9970158591866494, "num_tokens": 8114492.0, "step": 2200 }, { "entropy": 2.125586226582527, "epoch": 3.1393034825870645, "grad_norm": 2.4398252964019775, "learning_rate": 6.436087560375803e-06, "loss": 0.013633471727371217, "mean_token_accuracy": 0.9931770831346511, "num_tokens": 8152042.0, "step": 2210 }, { "entropy": 2.1403322517871857, "epoch": 3.1535181236673773, "grad_norm": 0.058475561439991, "learning_rate": 6.350261175337975e-06, "loss": 0.005073773115873337, "mean_token_accuracy": 0.9981249988079071, "num_tokens": 8188952.0, "step": 2220 }, { "entropy": 2.0997527480125426, "epoch": 3.16773276474769, "grad_norm": 0.3422115445137024, "learning_rate": 6.264743842212073e-06, "loss": 0.010538970679044723, "mean_token_accuracy": 0.9965603098273277, "num_tokens": 8230647.0, "step": 2230 }, { "entropy": 2.1392576456069947, "epoch": 3.181947405828003, "grad_norm": 0.07745851576328278, "learning_rate": 6.179542802419079e-06, "loss": 0.007439323514699936, "mean_token_accuracy": 0.9988435551524162, "num_tokens": 8264608.0, "step": 2240 }, { "entropy": 2.190061104297638, "epoch": 3.1961620469083156, "grad_norm": 0.027518633753061295, "learning_rate": 6.094665270596948e-06, "loss": 0.011635781824588775, "mean_token_accuracy": 0.9935132578015328, "num_tokens": 8300407.0, "step": 2250 }, { "entropy": 2.2294768542051315, "epoch": 3.2103766879886284, "grad_norm": 0.0750473290681839, "learning_rate": 6.0101184339896865e-06, "loss": 0.00671888142824173, "mean_token_accuracy": 0.9962439998984337, "num_tokens": 8334944.0, "step": 2260 }, { "entropy": 2.197703164815903, "epoch": 3.224591329068941, "grad_norm": 0.12029851227998734, "learning_rate": 5.925909451838747e-06, "loss": 0.009523383527994155, "mean_token_accuracy": 0.9985777243971825, "num_tokens": 8376905.0, "step": 2270 }, { "entropy": 2.123885232210159, "epoch": 3.2388059701492535, "grad_norm": 0.2749768793582916, "learning_rate": 5.842045454776816e-06, "loss": 0.021079175174236298, "mean_token_accuracy": 0.9924706354737282, "num_tokens": 8416108.0, "step": 2280 }, { "entropy": 2.090131178498268, "epoch": 3.2530206112295663, "grad_norm": 0.14854082465171814, "learning_rate": 5.758533544223986e-06, "loss": 0.007670293003320694, "mean_token_accuracy": 0.99760522544384, "num_tokens": 8454009.0, "step": 2290 }, { "entropy": 2.0772017776966094, "epoch": 3.267235252309879, "grad_norm": 0.08492118865251541, "learning_rate": 5.675380791786435e-06, "loss": 0.0015875270590186119, "mean_token_accuracy": 1.0, "num_tokens": 8497359.0, "step": 2300 }, { "entropy": 2.1499790489673614, "epoch": 3.281449893390192, "grad_norm": 0.8910402059555054, "learning_rate": 5.592594238657621e-06, "loss": 0.0036219201982021334, "mean_token_accuracy": 1.0, "num_tokens": 8535043.0, "step": 2310 }, { "entropy": 2.1721325367689133, "epoch": 3.2956645344705047, "grad_norm": 0.018208418041467667, "learning_rate": 5.510180895022032e-06, "loss": 0.000674342131242156, "mean_token_accuracy": 1.0, "num_tokens": 8572631.0, "step": 2320 }, { "entropy": 2.15026940703392, "epoch": 3.3098791755508175, "grad_norm": 0.008994768373668194, "learning_rate": 5.4281477394616146e-06, "loss": 0.005390065908432007, "mean_token_accuracy": 0.9979166656732559, "num_tokens": 8607328.0, "step": 2330 }, { "entropy": 2.1503446727991102, "epoch": 3.3240938166311302, "grad_norm": 0.19059528410434723, "learning_rate": 5.346501718364793e-06, "loss": 0.011236748844385146, "mean_token_accuracy": 0.9974877446889877, "num_tokens": 8646346.0, "step": 2340 }, { "entropy": 2.2072229474782943, "epoch": 3.3383084577114426, "grad_norm": 0.3965470492839813, "learning_rate": 5.265249745338307e-06, "loss": 0.019204550981521608, "mean_token_accuracy": 0.9955678090453148, "num_tokens": 8679667.0, "step": 2350 }, { "entropy": 2.131696742773056, "epoch": 3.3525230987917554, "grad_norm": 0.028842760249972343, "learning_rate": 5.184398700621765e-06, "loss": 0.002106231637299061, "mean_token_accuracy": 1.0, "num_tokens": 8715830.0, "step": 2360 }, { "entropy": 2.1438046902418137, "epoch": 3.366737739872068, "grad_norm": 0.04236413538455963, "learning_rate": 5.10395543050503e-06, "loss": 0.029832398891448973, "mean_token_accuracy": 0.9930059522390365, "num_tokens": 8753194.0, "step": 2370 }, { "entropy": 2.108007326722145, "epoch": 3.380952380952381, "grad_norm": 0.11014021933078766, "learning_rate": 5.023926746748524e-06, "loss": 0.009075208753347396, "mean_token_accuracy": 0.9928571417927742, "num_tokens": 8792099.0, "step": 2380 }, { "entropy": 2.181051468849182, "epoch": 3.3951670220326937, "grad_norm": 0.0077524553053081036, "learning_rate": 4.944319426006381e-06, "loss": 0.009630301594734192, "mean_token_accuracy": 0.9973286435008049, "num_tokens": 8824763.0, "step": 2390 }, { "entropy": 2.0720641285181047, "epoch": 3.4093816631130065, "grad_norm": 0.05514072626829147, "learning_rate": 4.865140209252649e-06, "loss": 0.013563276827335357, "mean_token_accuracy": 0.9977705627679825, "num_tokens": 8863036.0, "step": 2400 }, { "entropy": 2.13643596470356, "epoch": 3.4235963041933193, "grad_norm": 3.3827261924743652, "learning_rate": 4.786395801210452e-06, "loss": 0.0168175533413887, "mean_token_accuracy": 0.9946783423423767, "num_tokens": 8896699.0, "step": 2410 }, { "entropy": 2.1522935539484025, "epoch": 3.4378109452736316, "grad_norm": 0.06272371113300323, "learning_rate": 4.708092869784273e-06, "loss": 0.006873990595340729, "mean_token_accuracy": 0.9995901644229889, "num_tokens": 8932246.0, "step": 2420 }, { "entropy": 2.127246394753456, "epoch": 3.4520255863539444, "grad_norm": 0.010775122791528702, "learning_rate": 4.630238045495318e-06, "loss": 0.0019115816801786422, "mean_token_accuracy": 0.9992424249649048, "num_tokens": 8968550.0, "step": 2430 }, { "entropy": 2.167269319295883, "epoch": 3.466240227434257, "grad_norm": 0.46379631757736206, "learning_rate": 4.552837920920057e-06, "loss": 0.0013112064450979232, "mean_token_accuracy": 1.0, "num_tokens": 9004264.0, "step": 2440 }, { "entropy": 2.1489324510097503, "epoch": 3.48045486851457, "grad_norm": 0.6207188963890076, "learning_rate": 4.475899050131985e-06, "loss": 0.006231657788157463, "mean_token_accuracy": 0.9964285716414452, "num_tokens": 9040079.0, "step": 2450 }, { "entropy": 2.183499825000763, "epoch": 3.4946695095948828, "grad_norm": 0.07879038900136948, "learning_rate": 4.399427948146624e-06, "loss": 0.020220884680747987, "mean_token_accuracy": 0.9945031389594078, "num_tokens": 9077997.0, "step": 2460 }, { "entropy": 2.211496871709824, "epoch": 3.5088841506751955, "grad_norm": 0.12836432456970215, "learning_rate": 4.3234310903698695e-06, "loss": 0.006491854786872864, "mean_token_accuracy": 0.9995098039507866, "num_tokens": 9115310.0, "step": 2470 }, { "entropy": 2.176717010140419, "epoch": 3.5230987917555083, "grad_norm": 0.8318957090377808, "learning_rate": 4.247914912049635e-06, "loss": 0.0016323558986186982, "mean_token_accuracy": 1.0, "num_tokens": 9152231.0, "step": 2480 }, { "entropy": 2.2198712468147277, "epoch": 3.5373134328358207, "grad_norm": 2.0839056968688965, "learning_rate": 4.172885807730972e-06, "loss": 0.009627557545900344, "mean_token_accuracy": 0.9967328533530235, "num_tokens": 9188384.0, "step": 2490 }, { "entropy": 2.215090864896774, "epoch": 3.5515280739161335, "grad_norm": 0.1644526720046997, "learning_rate": 4.0983501307145466e-06, "loss": 0.007908221334218979, "mean_token_accuracy": 0.996194276213646, "num_tokens": 9225015.0, "step": 2500 }, { "epoch": 3.5515280739161335, "eval_entropy": 2.025349033040811, "eval_loss": 0.543056845664978, "eval_mean_token_accuracy": 0.9176541126509321, "eval_num_tokens": 9225015.0, "eval_runtime": 989.9838, "eval_samples_per_second": 7.728, "eval_steps_per_second": 0.967, "step": 2500 }, { "entropy": 2.1734833300113676, "epoch": 3.5657427149964462, "grad_norm": 0.6722556352615356, "learning_rate": 4.024314192518691e-06, "loss": 0.005212902277708054, "mean_token_accuracy": 0.9996875002980232, "num_tokens": 9260855.0, "step": 2510 }, { "entropy": 2.1916033893823625, "epoch": 3.579957356076759, "grad_norm": 0.46904346346855164, "learning_rate": 3.950784262344947e-06, "loss": 0.005123495310544968, "mean_token_accuracy": 0.996708333492279, "num_tokens": 9300640.0, "step": 2520 }, { "entropy": 2.1783609628677367, "epoch": 3.594171997157072, "grad_norm": 0.6677644848823547, "learning_rate": 3.877766566547186e-06, "loss": 0.008107519149780274, "mean_token_accuracy": 0.9955555558204651, "num_tokens": 9336822.0, "step": 2530 }, { "entropy": 2.1903655380010605, "epoch": 3.6083866382373846, "grad_norm": 0.030927782878279686, "learning_rate": 3.8052672881044173e-06, "loss": 0.005363395810127259, "mean_token_accuracy": 0.9973389357328415, "num_tokens": 9370145.0, "step": 2540 }, { "entropy": 2.136083886027336, "epoch": 3.6226012793176974, "grad_norm": 0.14145703613758087, "learning_rate": 3.7332925660971774e-06, "loss": 0.001963794231414795, "mean_token_accuracy": 0.9993055552244187, "num_tokens": 9405831.0, "step": 2550 }, { "entropy": 2.1727351754903794, "epoch": 3.6368159203980097, "grad_norm": 0.06443420052528381, "learning_rate": 3.661848495187724e-06, "loss": 0.009727256000041961, "mean_token_accuracy": 0.9967490404844284, "num_tokens": 9442595.0, "step": 2560 }, { "entropy": 2.180554246902466, "epoch": 3.651030561478323, "grad_norm": 0.22529654204845428, "learning_rate": 3.5909411251039295e-06, "loss": 0.0030778197571635245, "mean_token_accuracy": 0.9995098039507866, "num_tokens": 9474871.0, "step": 2570 }, { "entropy": 2.1319134652614595, "epoch": 3.6652452025586353, "grad_norm": 0.046728238463401794, "learning_rate": 3.520576460127019e-06, "loss": 0.0027088303118944167, "mean_token_accuracy": 0.9994047611951828, "num_tokens": 9513525.0, "step": 2580 }, { "entropy": 2.1576041877269745, "epoch": 3.679459843638948, "grad_norm": 0.009525112807750702, "learning_rate": 3.450760458583132e-06, "loss": 0.005883176624774933, "mean_token_accuracy": 0.9987936049699784, "num_tokens": 9546650.0, "step": 2590 }, { "entropy": 2.164761394262314, "epoch": 3.693674484719261, "grad_norm": 5.105481147766113, "learning_rate": 3.3814990323387886e-06, "loss": 0.011438134312629699, "mean_token_accuracy": 0.994793213903904, "num_tokens": 9584618.0, "step": 2600 }, { "entropy": 2.212935158610344, "epoch": 3.7078891257995736, "grad_norm": 0.10164128243923187, "learning_rate": 3.3127980463002852e-06, "loss": 0.015480761229991914, "mean_token_accuracy": 0.9978535354137421, "num_tokens": 9621145.0, "step": 2610 }, { "entropy": 2.1630167931318285, "epoch": 3.7221037668798864, "grad_norm": 0.04091818630695343, "learning_rate": 3.244663317917056e-06, "loss": 0.003573558479547501, "mean_token_accuracy": 0.9988095238804817, "num_tokens": 9660623.0, "step": 2620 }, { "entropy": 2.18853420317173, "epoch": 3.7363184079601988, "grad_norm": 0.29761549830436707, "learning_rate": 3.177100616689085e-06, "loss": 0.002430788241326809, "mean_token_accuracy": 0.9977272734045982, "num_tokens": 9693952.0, "step": 2630 }, { "entropy": 2.1519277811050417, "epoch": 3.750533049040512, "grad_norm": 1.4869977235794067, "learning_rate": 3.1101156636783424e-06, "loss": 0.012232684344053269, "mean_token_accuracy": 0.9964350983500481, "num_tokens": 9732781.0, "step": 2640 }, { "entropy": 2.11678723692894, "epoch": 3.7647476901208243, "grad_norm": 0.009623765014111996, "learning_rate": 3.0437141310243436e-06, "loss": 0.004782317578792572, "mean_token_accuracy": 0.9982051268219948, "num_tokens": 9773807.0, "step": 2650 }, { "entropy": 2.177131649851799, "epoch": 3.778962331201137, "grad_norm": 0.05591592937707901, "learning_rate": 2.977901641463833e-06, "loss": 0.0022820821031928062, "mean_token_accuracy": 0.9993243247270585, "num_tokens": 9806829.0, "step": 2660 }, { "entropy": 2.0982068300247194, "epoch": 3.79317697228145, "grad_norm": 0.04154813662171364, "learning_rate": 2.9126837678546814e-06, "loss": 0.003840605542063713, "mean_token_accuracy": 0.9989583343267441, "num_tokens": 9848588.0, "step": 2670 }, { "entropy": 2.177445635199547, "epoch": 3.8073916133617627, "grad_norm": 0.40800824761390686, "learning_rate": 2.8480660327039834e-06, "loss": 0.024874459207057952, "mean_token_accuracy": 0.9968070656061172, "num_tokens": 9882298.0, "step": 2680 }, { "entropy": 2.1979396522045134, "epoch": 3.8216062544420755, "grad_norm": 2.1369435787200928, "learning_rate": 2.7840539077004026e-06, "loss": 0.006149508431553841, "mean_token_accuracy": 0.995833334326744, "num_tokens": 9917403.0, "step": 2690 }, { "entropy": 2.2291352182626722, "epoch": 3.835820895522388, "grad_norm": 0.48058605194091797, "learning_rate": 2.7206528132508813e-06, "loss": 0.012438727915287018, "mean_token_accuracy": 0.9970117837190628, "num_tokens": 9953432.0, "step": 2700 }, { "entropy": 2.148913612961769, "epoch": 3.850035536602701, "grad_norm": 0.5231387615203857, "learning_rate": 2.657868118021608e-06, "loss": 0.002489854209125042, "mean_token_accuracy": 1.0, "num_tokens": 9987465.0, "step": 2710 }, { "entropy": 2.183783236145973, "epoch": 3.8642501776830134, "grad_norm": 0.08354540169239044, "learning_rate": 2.5957051384834443e-06, "loss": 0.025581926107406616, "mean_token_accuracy": 0.9913469970226287, "num_tokens": 10024663.0, "step": 2720 }, { "entropy": 2.206176847219467, "epoch": 3.878464818763326, "grad_norm": 0.09456467628479004, "learning_rate": 2.534169138461725e-06, "loss": 0.0029037076979875564, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 10059420.0, "step": 2730 }, { "entropy": 2.152846413850784, "epoch": 3.892679459843639, "grad_norm": 0.38944724202156067, "learning_rate": 2.473265328690514e-06, "loss": 0.008512056618928909, "mean_token_accuracy": 0.9977964743971824, "num_tokens": 10099303.0, "step": 2740 }, { "entropy": 2.1975372284650803, "epoch": 3.9068941009239517, "grad_norm": 1.185078740119934, "learning_rate": 2.412998866371411e-06, "loss": 0.00427936352789402, "mean_token_accuracy": 0.9974374994635582, "num_tokens": 10135013.0, "step": 2750 }, { "entropy": 2.193510928750038, "epoch": 3.9211087420042645, "grad_norm": 0.5688725709915161, "learning_rate": 2.3533748547368008e-06, "loss": 0.009441718459129333, "mean_token_accuracy": 0.9988095238804817, "num_tokens": 10171217.0, "step": 2760 }, { "entropy": 2.063158482313156, "epoch": 3.935323383084577, "grad_norm": 0.39150136709213257, "learning_rate": 2.294398342617765e-06, "loss": 0.006837107241153717, "mean_token_accuracy": 0.9970514938235283, "num_tokens": 10211084.0, "step": 2770 }, { "entropy": 2.1779229074716566, "epoch": 3.94953802416489, "grad_norm": 0.06802282482385635, "learning_rate": 2.2360743240165283e-06, "loss": 0.0037012625485658645, "mean_token_accuracy": 0.9991379305720329, "num_tokens": 10248579.0, "step": 2780 }, { "entropy": 2.099555331468582, "epoch": 3.9637526652452024, "grad_norm": 0.10486733913421631, "learning_rate": 2.1784077376835964e-06, "loss": 0.0013088119216263295, "mean_token_accuracy": 1.0, "num_tokens": 10288496.0, "step": 2790 }, { "entropy": 2.1688816130161284, "epoch": 3.977967306325515, "grad_norm": 0.016996540129184723, "learning_rate": 2.1214034666995452e-06, "loss": 0.02126392424106598, "mean_token_accuracy": 0.9912162214517594, "num_tokens": 10325933.0, "step": 2800 }, { "entropy": 2.1608937054872515, "epoch": 3.992181947405828, "grad_norm": 0.06427384167909622, "learning_rate": 2.065066338061533e-06, "loss": 0.0059285745024681095, "mean_token_accuracy": 0.9981752723455429, "num_tokens": 10366910.0, "step": 2810 }, { "entropy": 2.196948136153974, "epoch": 4.005685856432125, "grad_norm": 0.11280222237110138, "learning_rate": 2.0094011222745647e-06, "loss": 0.0018585361540317535, "mean_token_accuracy": 1.0, "num_tokens": 10401852.0, "step": 2820 }, { "entropy": 2.1833971083164214, "epoch": 4.019900497512438, "grad_norm": 0.047356266528367996, "learning_rate": 1.9544125329475237e-06, "loss": 0.0012251741252839565, "mean_token_accuracy": 1.0, "num_tokens": 10439032.0, "step": 2830 }, { "entropy": 2.2034851729869844, "epoch": 4.0341151385927505, "grad_norm": 0.20847798883914948, "learning_rate": 1.900105226394051e-06, "loss": 0.004868442937731743, "mean_token_accuracy": 0.9994186043739319, "num_tokens": 10473983.0, "step": 2840 }, { "entropy": 2.17997325360775, "epoch": 4.048329779673063, "grad_norm": 1.2543761730194092, "learning_rate": 1.846483801238248e-06, "loss": 0.000993065070360899, "mean_token_accuracy": 1.0, "num_tokens": 10506963.0, "step": 2850 }, { "entropy": 2.14132858812809, "epoch": 4.062544420753376, "grad_norm": 0.2019268274307251, "learning_rate": 1.7935527980252799e-06, "loss": 0.0016139384359121322, "mean_token_accuracy": 1.0, "num_tokens": 10546928.0, "step": 2860 }, { "entropy": 2.1205300956964495, "epoch": 4.076759061833688, "grad_norm": 0.006392813287675381, "learning_rate": 1.7413166988368802e-06, "loss": 0.005241365730762481, "mean_token_accuracy": 0.99921875, "num_tokens": 10588651.0, "step": 2870 }, { "entropy": 2.1647232592105867, "epoch": 4.090973702914002, "grad_norm": 0.06546484678983688, "learning_rate": 1.6897799269118398e-06, "loss": 0.0012532318010926246, "mean_token_accuracy": 1.0, "num_tokens": 10628469.0, "step": 2880 }, { "entropy": 2.173341378569603, "epoch": 4.105188343994314, "grad_norm": 0.0864807739853859, "learning_rate": 1.6389468462714387e-06, "loss": 0.0024954590946435927, "mean_token_accuracy": 0.9988857284188271, "num_tokens": 10665691.0, "step": 2890 }, { "entropy": 2.0994014710187914, "epoch": 4.119402985074627, "grad_norm": 0.007347598671913147, "learning_rate": 1.5888217613499101e-06, "loss": 0.0006663267500698567, "mean_token_accuracy": 1.0, "num_tokens": 10705041.0, "step": 2900 }, { "entropy": 2.1861185312271116, "epoch": 4.1336176261549396, "grad_norm": 0.1270337551832199, "learning_rate": 1.5394089166299718e-06, "loss": 0.006704054027795792, "mean_token_accuracy": 0.9972916662693023, "num_tokens": 10738994.0, "step": 2910 }, { "entropy": 2.115477886795998, "epoch": 4.147832267235252, "grad_norm": 0.13763725757598877, "learning_rate": 1.4907124962833808e-06, "loss": 0.004347409680485725, "mean_token_accuracy": 0.9986842110753059, "num_tokens": 10776182.0, "step": 2920 }, { "entropy": 2.195647644996643, "epoch": 4.162046908315565, "grad_norm": 0.06850487738847733, "learning_rate": 1.4427366238166517e-06, "loss": 0.004155668616294861, "mean_token_accuracy": 0.9984969049692154, "num_tokens": 10816150.0, "step": 2930 }, { "entropy": 2.1906051248311997, "epoch": 4.1762615493958775, "grad_norm": 0.01908433809876442, "learning_rate": 1.3954853617218745e-06, "loss": 0.013761062920093537, "mean_token_accuracy": 0.9947195380926133, "num_tokens": 10852408.0, "step": 2940 }, { "entropy": 2.1659664869308473, "epoch": 4.190476190476191, "grad_norm": 0.031739577651023865, "learning_rate": 1.3489627111327187e-06, "loss": 0.003443429246544838, "mean_token_accuracy": 0.9993902444839478, "num_tokens": 10887520.0, "step": 2950 }, { "entropy": 2.2092543095350266, "epoch": 4.204690831556503, "grad_norm": 0.048356492072343826, "learning_rate": 1.3031726114856202e-06, "loss": 0.0038285456597805024, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 10921960.0, "step": 2960 }, { "entropy": 2.1533284068107603, "epoch": 4.218905472636816, "grad_norm": 1.2027009725570679, "learning_rate": 1.2581189401862036e-06, "loss": 0.007209320366382599, "mean_token_accuracy": 0.9953348532319068, "num_tokens": 10957277.0, "step": 2970 }, { "entropy": 2.162069135904312, "epoch": 4.233120113717129, "grad_norm": 0.021080689504742622, "learning_rate": 1.2138055122809522e-06, "loss": 0.0012023065239191056, "mean_token_accuracy": 1.0, "num_tokens": 10989161.0, "step": 2980 }, { "entropy": 2.1910412877798082, "epoch": 4.247334754797441, "grad_norm": 0.4471619427204132, "learning_rate": 1.170236080134145e-06, "loss": 0.004197989776730538, "mean_token_accuracy": 0.9975662842392922, "num_tokens": 11024450.0, "step": 2990 }, { "entropy": 2.185595816373825, "epoch": 4.261549395877754, "grad_norm": 0.42085593938827515, "learning_rate": 1.127414333110135e-06, "loss": 0.004017576575279236, "mean_token_accuracy": 0.9978968247771263, "num_tokens": 11059337.0, "step": 3000 }, { "epoch": 4.261549395877754, "eval_entropy": 2.021736085601735, "eval_loss": 0.5579360127449036, "eval_mean_token_accuracy": 0.9177084487309152, "eval_num_tokens": 11059337.0, "eval_runtime": 989.3713, "eval_samples_per_second": 7.733, "eval_steps_per_second": 0.967, "step": 3000 }, { "entropy": 2.087850275635719, "epoch": 4.2757640369580665, "grad_norm": 0.043584469705820084, "learning_rate": 1.0853438972609299e-06, "loss": 0.0032962791621685026, "mean_token_accuracy": 0.9983258932828903, "num_tokens": 11099908.0, "step": 3010 }, { "entropy": 2.217186596989632, "epoch": 4.28997867803838, "grad_norm": 0.0054810852743685246, "learning_rate": 1.0440283350191483e-06, "loss": 0.005877744778990746, "mean_token_accuracy": 0.9971874997019767, "num_tokens": 11137291.0, "step": 3020 }, { "entropy": 2.2094817072153092, "epoch": 4.304193319118692, "grad_norm": 0.06918873637914658, "learning_rate": 1.0034711448963563e-06, "loss": 0.0013420137576758862, "mean_token_accuracy": 1.0, "num_tokens": 11171023.0, "step": 3030 }, { "entropy": 2.2051640689373015, "epoch": 4.318407960199005, "grad_norm": 0.10377147048711777, "learning_rate": 9.636757611868297e-07, "loss": 0.005501218512654305, "mean_token_accuracy": 0.9981210514903068, "num_tokens": 11207280.0, "step": 3040 }, { "entropy": 2.1432130724191665, "epoch": 4.332622601279318, "grad_norm": 0.8852893114089966, "learning_rate": 9.246455536767407e-07, "loss": 0.002229997143149376, "mean_token_accuracy": 1.0, "num_tokens": 11242611.0, "step": 3050 }, { "entropy": 2.118473994731903, "epoch": 4.34683724235963, "grad_norm": 0.2849883735179901, "learning_rate": 8.863838273588121e-07, "loss": 0.004777782037854195, "mean_token_accuracy": 0.9995192304253578, "num_tokens": 11278511.0, "step": 3060 }, { "entropy": 2.1805112212896347, "epoch": 4.361051883439943, "grad_norm": 0.17783457040786743, "learning_rate": 8.48893822152459e-07, "loss": 0.0011253532022237778, "mean_token_accuracy": 1.0, "num_tokens": 11314397.0, "step": 3070 }, { "entropy": 2.1570386826992034, "epoch": 4.3752665245202556, "grad_norm": 2.8052237033843994, "learning_rate": 8.121787126294323e-07, "loss": 0.002880261279642582, "mean_token_accuracy": 0.9989999994635582, "num_tokens": 11350741.0, "step": 3080 }, { "entropy": 2.215659800171852, "epoch": 4.389481165600569, "grad_norm": 0.16840478777885437, "learning_rate": 7.762416077450175e-07, "loss": 0.0009297240525484085, "mean_token_accuracy": 1.0, "num_tokens": 11384917.0, "step": 3090 }, { "entropy": 2.0968218415975572, "epoch": 4.403695806680881, "grad_norm": 0.037575576454401016, "learning_rate": 7.410855505747583e-07, "loss": 0.0018225666135549545, "mean_token_accuracy": 0.9982142850756646, "num_tokens": 11425676.0, "step": 3100 }, { "entropy": 2.1322130650281905, "epoch": 4.417910447761194, "grad_norm": 0.4404691159725189, "learning_rate": 7.067135180567919e-07, "loss": 0.0013419835828244685, "mean_token_accuracy": 1.0, "num_tokens": 11463704.0, "step": 3110 }, { "entropy": 2.2044524610042573, "epoch": 4.432125088841507, "grad_norm": 0.9155864119529724, "learning_rate": 6.731284207397548e-07, "loss": 0.0015116781927645207, "mean_token_accuracy": 1.0, "num_tokens": 11496950.0, "step": 3120 }, { "entropy": 2.161736896634102, "epoch": 4.446339729921819, "grad_norm": 2.8296735286712646, "learning_rate": 6.403331025363312e-07, "loss": 0.0043445445597171785, "mean_token_accuracy": 0.997027014195919, "num_tokens": 11534916.0, "step": 3130 }, { "entropy": 2.123622697591782, "epoch": 4.460554371002132, "grad_norm": 0.8704050183296204, "learning_rate": 6.083303404824381e-07, "loss": 0.00419679544866085, "mean_token_accuracy": 0.9993589743971825, "num_tokens": 11575692.0, "step": 3140 }, { "entropy": 2.1255591422319413, "epoch": 4.474769012082445, "grad_norm": 2.5488767623901367, "learning_rate": 5.771228445020627e-07, "loss": 0.004947403818368912, "mean_token_accuracy": 0.9964460790157318, "num_tokens": 11613906.0, "step": 3150 }, { "entropy": 2.169129991531372, "epoch": 4.488983653162758, "grad_norm": 0.05024200305342674, "learning_rate": 5.467132571778011e-07, "loss": 0.0006448611617088318, "mean_token_accuracy": 1.0, "num_tokens": 11648392.0, "step": 3160 }, { "entropy": 2.103648892045021, "epoch": 4.50319829424307, "grad_norm": 0.018968380987644196, "learning_rate": 5.171041535270894e-07, "loss": 0.0005233283154666424, "mean_token_accuracy": 1.0, "num_tokens": 11691399.0, "step": 3170 }, { "entropy": 2.1431118875741957, "epoch": 4.517412935323383, "grad_norm": 0.0916331559419632, "learning_rate": 4.88298040784152e-07, "loss": 0.004345014318823814, "mean_token_accuracy": 0.9971717178821564, "num_tokens": 11725157.0, "step": 3180 }, { "entropy": 2.1765580475330353, "epoch": 4.531627576403696, "grad_norm": 0.02908848598599434, "learning_rate": 4.6029735818769907e-07, "loss": 0.0040725283324718475, "mean_token_accuracy": 0.9995192304253578, "num_tokens": 11765063.0, "step": 3190 }, { "entropy": 2.199541613459587, "epoch": 4.545842217484008, "grad_norm": 0.5352857708930969, "learning_rate": 4.331044767743708e-07, "loss": 0.0021973950788378716, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 11801966.0, "step": 3200 }, { "entropy": 2.165239670872688, "epoch": 4.560056858564321, "grad_norm": 0.021813327446579933, "learning_rate": 4.067216991779721e-07, "loss": 0.002202248200774193, "mean_token_accuracy": 0.9996031746268272, "num_tokens": 11842437.0, "step": 3210 }, { "entropy": 2.149556291103363, "epoch": 4.574271499644634, "grad_norm": 0.012352075427770615, "learning_rate": 3.811512594344857e-07, "loss": 0.004862933605909348, "mean_token_accuracy": 0.9995098039507866, "num_tokens": 11881004.0, "step": 3220 }, { "entropy": 2.1413369357585905, "epoch": 4.588486140724947, "grad_norm": 0.04668094962835312, "learning_rate": 3.5639532279289845e-07, "loss": 0.003514312207698822, "mean_token_accuracy": 0.9972222223877907, "num_tokens": 11918795.0, "step": 3230 }, { "entropy": 2.1386821925640107, "epoch": 4.602700781805259, "grad_norm": 0.03126770630478859, "learning_rate": 3.3245598553184986e-07, "loss": 0.004513117671012879, "mean_token_accuracy": 0.9995614036917686, "num_tokens": 11952525.0, "step": 3240 }, { "entropy": 2.127019727230072, "epoch": 4.616915422885572, "grad_norm": 0.33939263224601746, "learning_rate": 3.0933527478213545e-07, "loss": 0.005397439002990723, "mean_token_accuracy": 0.9990074694156647, "num_tokens": 11991456.0, "step": 3250 }, { "entropy": 2.2128841817378997, "epoch": 4.631130063965885, "grad_norm": 0.6997547149658203, "learning_rate": 2.870351483550382e-07, "loss": 0.0022805359214544295, "mean_token_accuracy": 1.0, "num_tokens": 12024144.0, "step": 3260 }, { "entropy": 2.096145638823509, "epoch": 4.645344705046197, "grad_norm": 0.11305858194828033, "learning_rate": 2.655574945765571e-07, "loss": 0.012231498956680298, "mean_token_accuracy": 0.9988888889551163, "num_tokens": 12062762.0, "step": 3270 }, { "entropy": 2.0828854560852053, "epoch": 4.65955934612651, "grad_norm": 0.025230111554265022, "learning_rate": 2.4490413212750475e-07, "loss": 0.002871591970324516, "mean_token_accuracy": 0.9985294118523598, "num_tokens": 12100824.0, "step": 3280 }, { "entropy": 2.1890225172042848, "epoch": 4.673773987206823, "grad_norm": 0.08814139664173126, "learning_rate": 2.2507680988949843e-07, "loss": 0.004444138705730438, "mean_token_accuracy": 0.9988095238804817, "num_tokens": 12138713.0, "step": 3290 }, { "entropy": 2.168518990278244, "epoch": 4.687988628287136, "grad_norm": 0.01869502291083336, "learning_rate": 2.0607720679688193e-07, "loss": 0.0033570095896720887, "mean_token_accuracy": 0.9983983993530273, "num_tokens": 12175435.0, "step": 3300 }, { "entropy": 2.165831074118614, "epoch": 4.702203269367448, "grad_norm": 0.10159584879875183, "learning_rate": 1.8790693169454365e-07, "loss": 0.002022952027618885, "mean_token_accuracy": 1.0, "num_tokens": 12211650.0, "step": 3310 }, { "entropy": 2.0869997441768646, "epoch": 4.7164179104477615, "grad_norm": 1.7387880086898804, "learning_rate": 1.7056752320169346e-07, "loss": 0.002982720918953419, "mean_token_accuracy": 0.9994565218687057, "num_tokens": 12249287.0, "step": 3320 }, { "entropy": 2.1755292028188706, "epoch": 4.730632551528074, "grad_norm": 0.04950045421719551, "learning_rate": 1.5406044958156896e-07, "loss": 0.0011815003119409085, "mean_token_accuracy": 1.0, "num_tokens": 12286730.0, "step": 3330 }, { "entropy": 2.1790402829647064, "epoch": 4.744847192608386, "grad_norm": 0.20007754862308502, "learning_rate": 1.383871086171107e-07, "loss": 0.001237096171826124, "mean_token_accuracy": 1.0, "num_tokens": 12322652.0, "step": 3340 }, { "entropy": 2.207217875123024, "epoch": 4.759061833688699, "grad_norm": 1.2678426504135132, "learning_rate": 1.2354882749259778e-07, "loss": 0.012135348469018935, "mean_token_accuracy": 0.9962175503373146, "num_tokens": 12357845.0, "step": 3350 }, { "entropy": 2.1616628229618073, "epoch": 4.773276474769012, "grad_norm": 0.07163197547197342, "learning_rate": 1.0954686268126457e-07, "loss": 0.0008528068661689759, "mean_token_accuracy": 1.0, "num_tokens": 12395670.0, "step": 3360 }, { "entropy": 2.153119242191315, "epoch": 4.787491115849325, "grad_norm": 0.07595377415418625, "learning_rate": 9.638239983890907e-08, "loss": 0.002039765752851963, "mean_token_accuracy": 0.999074074625969, "num_tokens": 12430518.0, "step": 3370 }, { "entropy": 2.1775210916996004, "epoch": 4.801705756929637, "grad_norm": 0.041752155870199203, "learning_rate": 8.405655370349209e-08, "loss": 0.005490196123719216, "mean_token_accuracy": 0.9972794115543365, "num_tokens": 12468421.0, "step": 3380 }, { "entropy": 2.1661739617586138, "epoch": 4.8159203980099505, "grad_norm": 1.1951086521148682, "learning_rate": 7.257036800074169e-08, "loss": 0.004392094537615776, "mean_token_accuracy": 0.9986564621329308, "num_tokens": 12505399.0, "step": 3390 }, { "entropy": 2.1709176123142244, "epoch": 4.830135039090263, "grad_norm": 0.009752362966537476, "learning_rate": 6.192481535577389e-08, "loss": 0.00032480861991643903, "mean_token_accuracy": 1.0, "num_tokens": 12537999.0, "step": 3400 }, { "entropy": 2.0440476834774017, "epoch": 4.844349680170575, "grad_norm": 0.033612970262765884, "learning_rate": 5.2120797210736264e-08, "loss": 0.002183059975504875, "mean_token_accuracy": 0.9984375, "num_tokens": 12580299.0, "step": 3410 }, { "entropy": 2.155395808815956, "epoch": 4.858564321250888, "grad_norm": 0.09350975602865219, "learning_rate": 4.315914374847019e-08, "loss": 0.0005531907547265292, "mean_token_accuracy": 1.0, "num_tokens": 12613080.0, "step": 3420 }, { "entropy": 2.1979628175497057, "epoch": 4.872778962331201, "grad_norm": 0.04874487593770027, "learning_rate": 3.504061382221702e-08, "loss": 0.0024951497092843057, "mean_token_accuracy": 0.9986111104488373, "num_tokens": 12650712.0, "step": 3430 }, { "entropy": 2.1535072445869448, "epoch": 4.886993603411514, "grad_norm": 0.08149798959493637, "learning_rate": 2.776589489136061e-08, "loss": 0.0022866273298859595, "mean_token_accuracy": 0.9977481618523598, "num_tokens": 12686728.0, "step": 3440 }, { "entropy": 2.173008641600609, "epoch": 4.901208244491826, "grad_norm": 0.058297913521528244, "learning_rate": 2.1335602963207247e-08, "loss": 0.0012641225941479207, "mean_token_accuracy": 1.0, "num_tokens": 12724571.0, "step": 3450 }, { "entropy": 2.1928866147994994, "epoch": 4.91542288557214, "grad_norm": 0.05695611238479614, "learning_rate": 1.5750282540835105e-08, "loss": 0.007882739603519439, "mean_token_accuracy": 0.99921875, "num_tokens": 12761233.0, "step": 3460 }, { "entropy": 2.1840217113494873, "epoch": 4.929637526652452, "grad_norm": 0.005757441744208336, "learning_rate": 1.1010406576976718e-08, "loss": 0.0078007526695728305, "mean_token_accuracy": 0.9985565349459649, "num_tokens": 12795491.0, "step": 3470 }, { "entropy": 2.090686786174774, "epoch": 4.943852167732764, "grad_norm": 0.20968373119831085, "learning_rate": 7.116376433975447e-09, "loss": 0.002710508555173874, "mean_token_accuracy": 0.9993243247270585, "num_tokens": 12837878.0, "step": 3480 }, { "entropy": 2.202594816684723, "epoch": 4.9580668088130775, "grad_norm": 0.15738585591316223, "learning_rate": 4.068521849800444e-09, "loss": 0.005096424371004105, "mean_token_accuracy": 0.9977618142962456, "num_tokens": 12872699.0, "step": 3490 }, { "entropy": 2.177238318324089, "epoch": 4.97228144989339, "grad_norm": 0.026785463094711304, "learning_rate": 1.8671009101189908e-09, "loss": 0.0019810071215033533, "mean_token_accuracy": 1.0, "num_tokens": 12909138.0, "step": 3500 }, { "epoch": 4.97228144989339, "eval_entropy": 2.019442914670787, "eval_loss": 0.5660073757171631, "eval_mean_token_accuracy": 0.9171707378534937, "eval_num_tokens": 12909138.0, "eval_runtime": 991.6327, "eval_samples_per_second": 7.716, "eval_steps_per_second": 0.965, "step": 3500 }, { "entropy": 2.0914847373962404, "epoch": 4.986496090973703, "grad_norm": 0.7345014214515686, "learning_rate": 5.123000264484201e-10, "loss": 0.004509637877345085, "mean_token_accuracy": 0.9989583328366279, "num_tokens": 12949603.0, "step": 3510 }, { "entropy": 2.209040698252226, "epoch": 5.0, "grad_norm": 0.0030606593936681747, "learning_rate": 4.233920367635591e-12, "loss": 0.00112865949049592, "mean_token_accuracy": 1.0, "num_tokens": 12980625.0, "step": 3520 }, { "epoch": 5.0, "eval_entropy": 2.0196086888278417, "eval_loss": 0.5659698247909546, "eval_mean_token_accuracy": 0.917177452126765, "eval_num_tokens": 12980625.0, "eval_runtime": 991.6, "eval_samples_per_second": 7.716, "eval_steps_per_second": 0.965, "step": 3520 }, { "epoch": 5.0, "step": 3520, "total_flos": 7.537641057884897e+17, "train_loss": 0.06495461261630144, "train_runtime": 13504.3879, "train_samples_per_second": 2.083, "train_steps_per_second": 0.261 } ], "logging_steps": 10, "max_steps": 3520, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 7.537641057884897e+17, "train_batch_size": 2, "trial_name": null, "trial_params": null }