{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.9605793032105516, "eval_steps": 500, "global_step": 6500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 1.5304893136024476, "epoch": 0.001477814312631618, "grad_norm": 0.11065268516540527, "learning_rate": 9.98670016255357e-05, "loss": 1.2253, "mean_token_accuracy": 0.713296040892601, "num_tokens": 634372.0, "step": 10 }, { "entropy": 1.5232050925493241, "epoch": 0.002955628625263236, "grad_norm": 0.11062215268611908, "learning_rate": 9.971922565390867e-05, "loss": 1.1733, "mean_token_accuracy": 0.7147852033376694, "num_tokens": 1272340.0, "step": 20 }, { "entropy": 1.4792076826095581, "epoch": 0.004433442937894854, "grad_norm": 0.1127617210149765, "learning_rate": 9.957144968228167e-05, "loss": 1.1469, "mean_token_accuracy": 0.7173507429659367, "num_tokens": 1904586.0, "step": 30 }, { "entropy": 1.4591812424361705, "epoch": 0.005911257250526472, "grad_norm": 0.06614726036787033, "learning_rate": 9.942367371065465e-05, "loss": 1.131, "mean_token_accuracy": 0.7204256772994995, "num_tokens": 2533557.0, "step": 40 }, { "entropy": 1.42888495773077, "epoch": 0.007389071563158089, "grad_norm": 0.054086439311504364, "learning_rate": 9.927589773902763e-05, "loss": 1.0564, "mean_token_accuracy": 0.7316170297563076, "num_tokens": 3159795.0, "step": 50 }, { "entropy": 1.3907018028199674, "epoch": 0.008866885875789708, "grad_norm": 0.05579997971653938, "learning_rate": 9.912812176740062e-05, "loss": 1.0595, "mean_token_accuracy": 0.7346745491027832, "num_tokens": 3787086.0, "step": 60 }, { "entropy": 1.4462938398122787, "epoch": 0.010344700188421325, "grad_norm": 0.06100340187549591, "learning_rate": 9.898034579577361e-05, "loss": 1.1241, "mean_token_accuracy": 0.7200969859957695, "num_tokens": 4404928.0, "step": 70 }, { "entropy": 1.443135815113783, "epoch": 0.011822514501052943, "grad_norm": 0.05758308619260788, "learning_rate": 9.88325698241466e-05, "loss": 1.1179, "mean_token_accuracy": 0.7207777500152588, "num_tokens": 5055890.0, "step": 80 }, { "entropy": 1.4378912061452866, "epoch": 0.01330032881368456, "grad_norm": 0.0707370936870575, "learning_rate": 9.868479385251959e-05, "loss": 1.1078, "mean_token_accuracy": 0.7260331742465496, "num_tokens": 5694020.0, "step": 90 }, { "entropy": 1.4321013674139977, "epoch": 0.014778143126316179, "grad_norm": 0.06243390962481499, "learning_rate": 9.853701788089256e-05, "loss": 1.101, "mean_token_accuracy": 0.7271535098552704, "num_tokens": 6330552.0, "step": 100 }, { "entropy": 1.3873297058045864, "epoch": 0.016255957438947796, "grad_norm": 0.06713827699422836, "learning_rate": 9.838924190926556e-05, "loss": 1.0808, "mean_token_accuracy": 0.7296842932701111, "num_tokens": 6969739.0, "step": 110 }, { "entropy": 1.4041674077510833, "epoch": 0.017733771751579416, "grad_norm": 0.06167087331414223, "learning_rate": 9.824146593763854e-05, "loss": 1.0935, "mean_token_accuracy": 0.7287170954048634, "num_tokens": 7599906.0, "step": 120 }, { "entropy": 1.4082320772111416, "epoch": 0.01921158606421103, "grad_norm": 0.06408118456602097, "learning_rate": 9.809368996601153e-05, "loss": 1.0725, "mean_token_accuracy": 0.7312771216034889, "num_tokens": 8240783.0, "step": 130 }, { "entropy": 1.438713125884533, "epoch": 0.02068940037684265, "grad_norm": 0.07518143951892853, "learning_rate": 9.794591399438452e-05, "loss": 1.1073, "mean_token_accuracy": 0.721763364970684, "num_tokens": 8861604.0, "step": 140 }, { "entropy": 1.40254572853446, "epoch": 0.022167214689474267, "grad_norm": 0.07152130454778671, "learning_rate": 9.77981380227575e-05, "loss": 1.0691, "mean_token_accuracy": 0.7301274545490741, "num_tokens": 9519424.0, "step": 150 }, { "entropy": 1.4247990146279335, "epoch": 0.023645029002105886, "grad_norm": 0.06787216663360596, "learning_rate": 9.765036205113049e-05, "loss": 1.1106, "mean_token_accuracy": 0.7254596322774887, "num_tokens": 10149741.0, "step": 160 }, { "entropy": 1.3974801175296307, "epoch": 0.025122843314737502, "grad_norm": 0.07307117432355881, "learning_rate": 9.750258607950348e-05, "loss": 1.0634, "mean_token_accuracy": 0.7332775875926018, "num_tokens": 10782594.0, "step": 170 }, { "entropy": 1.3781036920845509, "epoch": 0.02660065762736912, "grad_norm": 0.07379572093486786, "learning_rate": 9.735481010787646e-05, "loss": 1.06, "mean_token_accuracy": 0.731862985342741, "num_tokens": 11421889.0, "step": 180 }, { "entropy": 1.3866104505956174, "epoch": 0.028078471940000738, "grad_norm": 0.06865496188402176, "learning_rate": 9.720703413624946e-05, "loss": 1.0457, "mean_token_accuracy": 0.7345983348786831, "num_tokens": 12037438.0, "step": 190 }, { "entropy": 1.3649713568389417, "epoch": 0.029556286252632357, "grad_norm": 0.08302357792854309, "learning_rate": 9.705925816462243e-05, "loss": 1.0281, "mean_token_accuracy": 0.7428084775805474, "num_tokens": 12668446.0, "step": 200 }, { "entropy": 1.3744140148162842, "epoch": 0.031034100565263973, "grad_norm": 0.07769942283630371, "learning_rate": 9.691148219299543e-05, "loss": 1.0554, "mean_token_accuracy": 0.734387868642807, "num_tokens": 13293305.0, "step": 210 }, { "entropy": 1.4095868960022926, "epoch": 0.03251191487789559, "grad_norm": 0.06871581077575684, "learning_rate": 9.676370622136841e-05, "loss": 1.074, "mean_token_accuracy": 0.7270821079611778, "num_tokens": 13924324.0, "step": 220 }, { "entropy": 1.3864221736788749, "epoch": 0.03398972919052721, "grad_norm": 0.07095455378293991, "learning_rate": 9.66159302497414e-05, "loss": 1.0347, "mean_token_accuracy": 0.7366894610226155, "num_tokens": 14541764.0, "step": 230 }, { "entropy": 1.4184685163199902, "epoch": 0.03546754350315883, "grad_norm": 0.07504931837320328, "learning_rate": 9.646815427811438e-05, "loss": 1.0532, "mean_token_accuracy": 0.7369042620062828, "num_tokens": 15187630.0, "step": 240 }, { "entropy": 1.4156867913901805, "epoch": 0.03694535781579045, "grad_norm": 0.0802634209394455, "learning_rate": 9.632037830648737e-05, "loss": 1.1036, "mean_token_accuracy": 0.7283115215599537, "num_tokens": 15846809.0, "step": 250 }, { "entropy": 1.4105734363198281, "epoch": 0.03842317212842206, "grad_norm": 0.07708612084388733, "learning_rate": 9.617260233486035e-05, "loss": 1.0768, "mean_token_accuracy": 0.7296842828392982, "num_tokens": 16478085.0, "step": 260 }, { "entropy": 1.382845190167427, "epoch": 0.03990098644105368, "grad_norm": 0.08279397338628769, "learning_rate": 9.602482636323335e-05, "loss": 1.0515, "mean_token_accuracy": 0.7347821459174156, "num_tokens": 17128735.0, "step": 270 }, { "entropy": 1.4158720895648003, "epoch": 0.0413788007536853, "grad_norm": 0.092226542532444, "learning_rate": 9.587705039160632e-05, "loss": 1.0609, "mean_token_accuracy": 0.7326413303613662, "num_tokens": 17746687.0, "step": 280 }, { "entropy": 1.3976521752774715, "epoch": 0.04285661506631692, "grad_norm": 0.08918865770101547, "learning_rate": 9.572927441997933e-05, "loss": 1.0683, "mean_token_accuracy": 0.7294273987412453, "num_tokens": 18363963.0, "step": 290 }, { "entropy": 1.4044050514698028, "epoch": 0.044334429378948534, "grad_norm": 0.08644465357065201, "learning_rate": 9.55814984483523e-05, "loss": 1.0634, "mean_token_accuracy": 0.7320508249104023, "num_tokens": 18993450.0, "step": 300 }, { "entropy": 1.380122570693493, "epoch": 0.04581224369158015, "grad_norm": 0.08921512216329575, "learning_rate": 9.543372247672529e-05, "loss": 1.0261, "mean_token_accuracy": 0.7378858976066113, "num_tokens": 19620523.0, "step": 310 }, { "entropy": 1.3815103709697723, "epoch": 0.04729005800421177, "grad_norm": 0.08035629242658615, "learning_rate": 9.528594650509828e-05, "loss": 1.0659, "mean_token_accuracy": 0.7323430612683296, "num_tokens": 20229672.0, "step": 320 }, { "entropy": 1.4161942921578885, "epoch": 0.04876787231684339, "grad_norm": 0.09145661443471909, "learning_rate": 9.513817053347127e-05, "loss": 1.0993, "mean_token_accuracy": 0.7256109490990639, "num_tokens": 20856211.0, "step": 330 }, { "entropy": 1.3907759122550487, "epoch": 0.050245686629475005, "grad_norm": 0.08255486935377121, "learning_rate": 9.499039456184425e-05, "loss": 1.0525, "mean_token_accuracy": 0.7357108578085899, "num_tokens": 21467622.0, "step": 340 }, { "entropy": 1.375921645760536, "epoch": 0.05172350094210663, "grad_norm": 0.08248364925384521, "learning_rate": 9.484261859021724e-05, "loss": 1.0306, "mean_token_accuracy": 0.7383193828165531, "num_tokens": 22109771.0, "step": 350 }, { "entropy": 1.3706233829259873, "epoch": 0.05320131525473824, "grad_norm": 0.08424954116344452, "learning_rate": 9.469484261859022e-05, "loss": 1.0289, "mean_token_accuracy": 0.7390523985028267, "num_tokens": 22717652.0, "step": 360 }, { "entropy": 1.392815312743187, "epoch": 0.05467912956736986, "grad_norm": 0.09112072736024857, "learning_rate": 9.454706664696322e-05, "loss": 1.0619, "mean_token_accuracy": 0.7333372481167316, "num_tokens": 23324578.0, "step": 370 }, { "entropy": 1.3739952459931373, "epoch": 0.056156943880001475, "grad_norm": 0.08004885166883469, "learning_rate": 9.439929067533619e-05, "loss": 1.0574, "mean_token_accuracy": 0.730328020453453, "num_tokens": 23957383.0, "step": 380 }, { "entropy": 1.3788554146885872, "epoch": 0.0576347581926331, "grad_norm": 0.08307195454835892, "learning_rate": 9.425151470370918e-05, "loss": 1.0637, "mean_token_accuracy": 0.7303956717252731, "num_tokens": 24585296.0, "step": 390 }, { "entropy": 1.4142395369708538, "epoch": 0.059112572505264714, "grad_norm": 0.08236826956272125, "learning_rate": 9.410373873208217e-05, "loss": 1.1018, "mean_token_accuracy": 0.7251050278544426, "num_tokens": 25217211.0, "step": 400 }, { "entropy": 1.3920598179101944, "epoch": 0.06059038681789633, "grad_norm": 0.0988270491361618, "learning_rate": 9.395596276045516e-05, "loss": 1.0377, "mean_token_accuracy": 0.7389338552951813, "num_tokens": 25844862.0, "step": 410 }, { "entropy": 1.3850713059306146, "epoch": 0.062068201130527946, "grad_norm": 0.08349768072366714, "learning_rate": 9.380818678882815e-05, "loss": 1.0655, "mean_token_accuracy": 0.7277355805039406, "num_tokens": 26460555.0, "step": 420 }, { "entropy": 1.3950319290161133, "epoch": 0.06354601544315956, "grad_norm": 0.08391372114419937, "learning_rate": 9.366041081720113e-05, "loss": 1.0581, "mean_token_accuracy": 0.7355390675365925, "num_tokens": 27086147.0, "step": 430 }, { "entropy": 1.4254113271832467, "epoch": 0.06502382975579118, "grad_norm": 0.09792959690093994, "learning_rate": 9.351263484557411e-05, "loss": 1.1253, "mean_token_accuracy": 0.7227410763502121, "num_tokens": 27710680.0, "step": 440 }, { "entropy": 1.3752116419374942, "epoch": 0.06650164406842281, "grad_norm": 0.08181757479906082, "learning_rate": 9.33648588739471e-05, "loss": 1.0463, "mean_token_accuracy": 0.7353246711194515, "num_tokens": 28340440.0, "step": 450 }, { "entropy": 1.3917047053575515, "epoch": 0.06797945838105442, "grad_norm": 0.09203750640153885, "learning_rate": 9.321708290232009e-05, "loss": 1.0624, "mean_token_accuracy": 0.7348892599344253, "num_tokens": 28966719.0, "step": 460 }, { "entropy": 1.3774724885821343, "epoch": 0.06945727269368604, "grad_norm": 0.09953095763921738, "learning_rate": 9.306930693069307e-05, "loss": 1.0465, "mean_token_accuracy": 0.7373659625649452, "num_tokens": 29611234.0, "step": 470 }, { "entropy": 1.3991491951048374, "epoch": 0.07093508700631766, "grad_norm": 0.08594824373722076, "learning_rate": 9.292153095906606e-05, "loss": 1.0644, "mean_token_accuracy": 0.7328724160790443, "num_tokens": 30246408.0, "step": 480 }, { "entropy": 1.373952978104353, "epoch": 0.07241290131894927, "grad_norm": 0.0813300833106041, "learning_rate": 9.277375498743905e-05, "loss": 1.0897, "mean_token_accuracy": 0.7270603954792023, "num_tokens": 30893806.0, "step": 490 }, { "entropy": 1.3723024994134903, "epoch": 0.0738907156315809, "grad_norm": 0.07812219113111496, "learning_rate": 9.262597901581204e-05, "loss": 1.0173, "mean_token_accuracy": 0.7398755483329296, "num_tokens": 31532529.0, "step": 500 }, { "entropy": 1.338401772081852, "epoch": 0.0753685299442125, "grad_norm": 0.08471836894750595, "learning_rate": 9.247820304418501e-05, "loss": 1.0197, "mean_token_accuracy": 0.7419663660228253, "num_tokens": 32174902.0, "step": 510 }, { "entropy": 1.4127553194761275, "epoch": 0.07684634425684413, "grad_norm": 0.09702274203300476, "learning_rate": 9.2330427072558e-05, "loss": 1.0963, "mean_token_accuracy": 0.7259891100227833, "num_tokens": 32792820.0, "step": 520 }, { "entropy": 1.3952218279242516, "epoch": 0.07832415856947575, "grad_norm": 0.08955958485603333, "learning_rate": 9.218265110093099e-05, "loss": 1.0803, "mean_token_accuracy": 0.7294512584805488, "num_tokens": 33434685.0, "step": 530 }, { "entropy": 1.352259347587824, "epoch": 0.07980197288210736, "grad_norm": 0.08365257829427719, "learning_rate": 9.203487512930398e-05, "loss": 1.039, "mean_token_accuracy": 0.7357416793704032, "num_tokens": 34085251.0, "step": 540 }, { "entropy": 1.3604788549244404, "epoch": 0.08127978719473898, "grad_norm": 0.08095045387744904, "learning_rate": 9.188709915767697e-05, "loss": 1.0577, "mean_token_accuracy": 0.7318811133503914, "num_tokens": 34722551.0, "step": 550 }, { "entropy": 1.3773885890841484, "epoch": 0.0827576015073706, "grad_norm": 0.10368340462446213, "learning_rate": 9.173932318604995e-05, "loss": 1.0496, "mean_token_accuracy": 0.7356349483132363, "num_tokens": 35339209.0, "step": 560 }, { "entropy": 1.3895627804100514, "epoch": 0.08423541582000221, "grad_norm": 0.09198153764009476, "learning_rate": 9.159154721442293e-05, "loss": 1.067, "mean_token_accuracy": 0.7346835978329181, "num_tokens": 35979698.0, "step": 570 }, { "entropy": 1.4322662442922591, "epoch": 0.08571323013263384, "grad_norm": 0.09510086476802826, "learning_rate": 9.144377124279593e-05, "loss": 1.0945, "mean_token_accuracy": 0.7262316733598709, "num_tokens": 36595329.0, "step": 580 }, { "entropy": 1.350172371417284, "epoch": 0.08719104444526546, "grad_norm": 0.08246901631355286, "learning_rate": 9.12959952711689e-05, "loss": 0.9963, "mean_token_accuracy": 0.7426011696457863, "num_tokens": 37217852.0, "step": 590 }, { "entropy": 1.3493722938001156, "epoch": 0.08866885875789707, "grad_norm": 0.08438783884048462, "learning_rate": 9.114821929954191e-05, "loss": 1.0137, "mean_token_accuracy": 0.7415332272648811, "num_tokens": 37854800.0, "step": 600 }, { "entropy": 1.389697627723217, "epoch": 0.09014667307052869, "grad_norm": 0.09821821004152298, "learning_rate": 9.100044332791488e-05, "loss": 1.0249, "mean_token_accuracy": 0.7392405845224858, "num_tokens": 38471395.0, "step": 610 }, { "entropy": 1.4111714124679566, "epoch": 0.0916244873831603, "grad_norm": 0.09100645780563354, "learning_rate": 9.085266735628787e-05, "loss": 1.1025, "mean_token_accuracy": 0.7256681717932224, "num_tokens": 39096618.0, "step": 620 }, { "entropy": 1.3662530906498431, "epoch": 0.09310230169579192, "grad_norm": 0.13060341775417328, "learning_rate": 9.070489138466086e-05, "loss": 1.0629, "mean_token_accuracy": 0.7316286444664002, "num_tokens": 39703580.0, "step": 630 }, { "entropy": 1.3668909780681133, "epoch": 0.09458011600842355, "grad_norm": 0.10613272339105606, "learning_rate": 9.055711541303385e-05, "loss": 1.0375, "mean_token_accuracy": 0.7359757006168366, "num_tokens": 40343514.0, "step": 640 }, { "entropy": 1.3518067069351674, "epoch": 0.09605793032105515, "grad_norm": 0.08057314902544022, "learning_rate": 9.040933944140682e-05, "loss": 1.0281, "mean_token_accuracy": 0.7392694905400277, "num_tokens": 40973391.0, "step": 650 }, { "entropy": 1.3239390894770622, "epoch": 0.09753574463368678, "grad_norm": 0.08244802802801132, "learning_rate": 9.026156346977982e-05, "loss": 1.0276, "mean_token_accuracy": 0.7396696552634239, "num_tokens": 41623645.0, "step": 660 }, { "entropy": 1.3552034579217433, "epoch": 0.0990135589463184, "grad_norm": 0.08738582581281662, "learning_rate": 9.01137874981528e-05, "loss": 1.0264, "mean_token_accuracy": 0.7368874847888947, "num_tokens": 42279334.0, "step": 670 }, { "entropy": 1.3737920597195625, "epoch": 0.10049137325895001, "grad_norm": 0.09264443069696426, "learning_rate": 8.99660115265258e-05, "loss": 1.0064, "mean_token_accuracy": 0.7462978705763816, "num_tokens": 42882194.0, "step": 680 }, { "entropy": 1.3388465084135532, "epoch": 0.10196918757158163, "grad_norm": 0.09516231715679169, "learning_rate": 8.981823555489877e-05, "loss": 1.0386, "mean_token_accuracy": 0.7378973692655564, "num_tokens": 43529617.0, "step": 690 }, { "entropy": 1.3471161246299743, "epoch": 0.10344700188421325, "grad_norm": 0.08873550593852997, "learning_rate": 8.967045958327176e-05, "loss": 1.0281, "mean_token_accuracy": 0.7418588995933533, "num_tokens": 44181958.0, "step": 700 }, { "entropy": 1.3766934528946877, "epoch": 0.10492481619684486, "grad_norm": 0.08453412353992462, "learning_rate": 8.952268361164475e-05, "loss": 1.0681, "mean_token_accuracy": 0.729092076420784, "num_tokens": 44820009.0, "step": 710 }, { "entropy": 1.3845791950821877, "epoch": 0.10640263050947649, "grad_norm": 0.09360987693071365, "learning_rate": 8.937490764001774e-05, "loss": 1.0586, "mean_token_accuracy": 0.7347254164516925, "num_tokens": 45452740.0, "step": 720 }, { "entropy": 1.3411042720079422, "epoch": 0.1078804448221081, "grad_norm": 0.09737925231456757, "learning_rate": 8.922713166839073e-05, "loss": 1.0474, "mean_token_accuracy": 0.7368136189877987, "num_tokens": 46073470.0, "step": 730 }, { "entropy": 1.3904819071292878, "epoch": 0.10935825913473972, "grad_norm": 0.09909042716026306, "learning_rate": 8.907935569676372e-05, "loss": 1.0606, "mean_token_accuracy": 0.7374630443751812, "num_tokens": 46711803.0, "step": 740 }, { "entropy": 1.3583513878285884, "epoch": 0.11083607344737134, "grad_norm": 0.09460269659757614, "learning_rate": 8.893157972513669e-05, "loss": 1.0488, "mean_token_accuracy": 0.7376768283545971, "num_tokens": 47331676.0, "step": 750 }, { "entropy": 1.3419748917222023, "epoch": 0.11231388776000295, "grad_norm": 0.09834811091423035, "learning_rate": 8.878380375350969e-05, "loss": 1.008, "mean_token_accuracy": 0.7432084485888482, "num_tokens": 47958777.0, "step": 760 }, { "entropy": 1.3798519670963287, "epoch": 0.11379170207263457, "grad_norm": 0.08785253763198853, "learning_rate": 8.863602778188267e-05, "loss": 1.0598, "mean_token_accuracy": 0.7317903161048889, "num_tokens": 48582722.0, "step": 770 }, { "entropy": 1.3471085391938686, "epoch": 0.1152695163852662, "grad_norm": 0.08993726968765259, "learning_rate": 8.848825181025565e-05, "loss": 1.0392, "mean_token_accuracy": 0.7386498197913169, "num_tokens": 49199116.0, "step": 780 }, { "entropy": 1.3162727653980255, "epoch": 0.1167473306978978, "grad_norm": 0.09954085201025009, "learning_rate": 8.834047583862864e-05, "loss": 1.0419, "mean_token_accuracy": 0.7357384979724884, "num_tokens": 49811957.0, "step": 790 }, { "entropy": 1.383530154824257, "epoch": 0.11822514501052943, "grad_norm": 0.09826408326625824, "learning_rate": 8.819269986700163e-05, "loss": 1.0666, "mean_token_accuracy": 0.7305501982569694, "num_tokens": 50440552.0, "step": 800 }, { "entropy": 1.3697494626045228, "epoch": 0.11970295932316105, "grad_norm": 0.10563326627016068, "learning_rate": 8.804492389537462e-05, "loss": 1.0523, "mean_token_accuracy": 0.7350135810673237, "num_tokens": 51061803.0, "step": 810 }, { "entropy": 1.341452068090439, "epoch": 0.12118077363579266, "grad_norm": 0.09023787081241608, "learning_rate": 8.789714792374761e-05, "loss": 1.0403, "mean_token_accuracy": 0.7364256352186203, "num_tokens": 51701844.0, "step": 820 }, { "entropy": 1.3256843224167825, "epoch": 0.12265858794842428, "grad_norm": 0.10398595035076141, "learning_rate": 8.774937195212058e-05, "loss": 1.0393, "mean_token_accuracy": 0.7345196448266507, "num_tokens": 52321057.0, "step": 830 }, { "entropy": 1.335525282472372, "epoch": 0.12413640226105589, "grad_norm": 0.11134184151887894, "learning_rate": 8.760159598049358e-05, "loss": 1.0162, "mean_token_accuracy": 0.7412177242338658, "num_tokens": 52951518.0, "step": 840 }, { "entropy": 1.336845152825117, "epoch": 0.12561421657368751, "grad_norm": 0.086946502327919, "learning_rate": 8.745382000886656e-05, "loss": 1.0416, "mean_token_accuracy": 0.7366455979645252, "num_tokens": 53573218.0, "step": 850 }, { "entropy": 1.3725450590252877, "epoch": 0.12709203088631912, "grad_norm": 0.09215516597032547, "learning_rate": 8.730604403723956e-05, "loss": 1.0459, "mean_token_accuracy": 0.7342949628829956, "num_tokens": 54222656.0, "step": 860 }, { "entropy": 1.354390736669302, "epoch": 0.12856984519895076, "grad_norm": 0.10038048028945923, "learning_rate": 8.715826806561254e-05, "loss": 1.0333, "mean_token_accuracy": 0.7372442290186882, "num_tokens": 54842980.0, "step": 870 }, { "entropy": 1.3338057577610016, "epoch": 0.13004765951158237, "grad_norm": 0.10332565754652023, "learning_rate": 8.701049209398552e-05, "loss": 1.0016, "mean_token_accuracy": 0.743568442761898, "num_tokens": 55470934.0, "step": 880 }, { "entropy": 1.3483957901597023, "epoch": 0.13152547382421398, "grad_norm": 0.10096542537212372, "learning_rate": 8.686271612235851e-05, "loss": 1.0178, "mean_token_accuracy": 0.7382646299898624, "num_tokens": 56098516.0, "step": 890 }, { "entropy": 1.355156985670328, "epoch": 0.13300328813684562, "grad_norm": 0.09177613258361816, "learning_rate": 8.67149401507315e-05, "loss": 1.0531, "mean_token_accuracy": 0.7352131024003029, "num_tokens": 56730521.0, "step": 900 }, { "entropy": 1.3612438417971133, "epoch": 0.13448110244947722, "grad_norm": 0.10380206257104874, "learning_rate": 8.656716417910447e-05, "loss": 1.0372, "mean_token_accuracy": 0.7388299435377121, "num_tokens": 57365578.0, "step": 910 }, { "entropy": 1.3525446981191636, "epoch": 0.13595891676210883, "grad_norm": 0.1035575270652771, "learning_rate": 8.641938820747746e-05, "loss": 1.0256, "mean_token_accuracy": 0.7397286184132099, "num_tokens": 57981896.0, "step": 920 }, { "entropy": 1.3687459766864776, "epoch": 0.13743673107474047, "grad_norm": 0.11620025336742401, "learning_rate": 8.627161223585045e-05, "loss": 1.0773, "mean_token_accuracy": 0.7295577853918076, "num_tokens": 58623803.0, "step": 930 }, { "entropy": 1.2970949046313762, "epoch": 0.13891454538737208, "grad_norm": 0.12642642855644226, "learning_rate": 8.612383626422344e-05, "loss": 1.0003, "mean_token_accuracy": 0.7444492764770985, "num_tokens": 59257549.0, "step": 940 }, { "entropy": 1.3647193409502507, "epoch": 0.1403923597000037, "grad_norm": 0.09129887074232101, "learning_rate": 8.597606029259643e-05, "loss": 1.0544, "mean_token_accuracy": 0.7329595319926738, "num_tokens": 59904795.0, "step": 950 }, { "entropy": 1.3711084038019181, "epoch": 0.14187017401263533, "grad_norm": 0.09745678305625916, "learning_rate": 8.582828432096942e-05, "loss": 1.0401, "mean_token_accuracy": 0.7385488845407963, "num_tokens": 60540321.0, "step": 960 }, { "entropy": 1.3561458587646484, "epoch": 0.14334798832526693, "grad_norm": 0.08693372458219528, "learning_rate": 8.56805083493424e-05, "loss": 1.0711, "mean_token_accuracy": 0.7356758877635002, "num_tokens": 61168133.0, "step": 970 }, { "entropy": 1.3305564433336259, "epoch": 0.14482580263789854, "grad_norm": 0.10192687809467316, "learning_rate": 8.553273237771538e-05, "loss": 1.0222, "mean_token_accuracy": 0.739366453140974, "num_tokens": 61824608.0, "step": 980 }, { "entropy": 1.3484657399356366, "epoch": 0.14630361695053015, "grad_norm": 0.09656958281993866, "learning_rate": 8.538495640608838e-05, "loss": 1.0313, "mean_token_accuracy": 0.7386878840625286, "num_tokens": 62461355.0, "step": 990 }, { "entropy": 1.3336199022829534, "epoch": 0.1477814312631618, "grad_norm": 0.10654303431510925, "learning_rate": 8.523718043446136e-05, "loss": 1.0015, "mean_token_accuracy": 0.746137623488903, "num_tokens": 63078401.0, "step": 1000 }, { "entropy": 1.3014978118240834, "epoch": 0.1492592455757934, "grad_norm": 0.09964130073785782, "learning_rate": 8.508940446283434e-05, "loss": 1.0191, "mean_token_accuracy": 0.7417861059308052, "num_tokens": 63718537.0, "step": 1010 }, { "entropy": 1.3399860113859177, "epoch": 0.150737059888425, "grad_norm": 0.08968862146139145, "learning_rate": 8.494162849120733e-05, "loss": 1.0047, "mean_token_accuracy": 0.7455361634492874, "num_tokens": 64338633.0, "step": 1020 }, { "entropy": 1.3182545930147171, "epoch": 0.15221487420105664, "grad_norm": 0.0899863988161087, "learning_rate": 8.479385251958032e-05, "loss": 1.0171, "mean_token_accuracy": 0.7432848289608955, "num_tokens": 64961975.0, "step": 1030 }, { "entropy": 1.353651513904333, "epoch": 0.15369268851368825, "grad_norm": 0.09297753125429153, "learning_rate": 8.46460765479533e-05, "loss": 1.0514, "mean_token_accuracy": 0.7368421874940395, "num_tokens": 65609630.0, "step": 1040 }, { "entropy": 1.3273244500160217, "epoch": 0.15517050282631986, "grad_norm": 0.09529486298561096, "learning_rate": 8.44983005763263e-05, "loss": 1.009, "mean_token_accuracy": 0.7426021553575992, "num_tokens": 66245650.0, "step": 1050 }, { "entropy": 1.368097710609436, "epoch": 0.1566483171389515, "grad_norm": 0.09293153882026672, "learning_rate": 8.435052460469927e-05, "loss": 1.0697, "mean_token_accuracy": 0.7321919746696949, "num_tokens": 66863639.0, "step": 1060 }, { "entropy": 1.3512376546859741, "epoch": 0.1581261314515831, "grad_norm": 0.1249411553144455, "learning_rate": 8.420274863307227e-05, "loss": 1.0413, "mean_token_accuracy": 0.7379166707396507, "num_tokens": 67510835.0, "step": 1070 }, { "entropy": 1.361113614588976, "epoch": 0.15960394576421472, "grad_norm": 0.10599677264690399, "learning_rate": 8.405497266144525e-05, "loss": 1.0077, "mean_token_accuracy": 0.7425113163888455, "num_tokens": 68137204.0, "step": 1080 }, { "entropy": 1.3219519801437856, "epoch": 0.16108176007684635, "grad_norm": 0.10219158232212067, "learning_rate": 8.390719668981824e-05, "loss": 0.999, "mean_token_accuracy": 0.7453721314668655, "num_tokens": 68763413.0, "step": 1090 }, { "entropy": 1.3573527745902538, "epoch": 0.16255957438947796, "grad_norm": 0.1045592650771141, "learning_rate": 8.375942071819122e-05, "loss": 1.0636, "mean_token_accuracy": 0.72975370362401, "num_tokens": 69390107.0, "step": 1100 }, { "entropy": 1.3573613107204436, "epoch": 0.16403738870210957, "grad_norm": 0.10745666921138763, "learning_rate": 8.361164474656421e-05, "loss": 1.0349, "mean_token_accuracy": 0.7413250155746937, "num_tokens": 70010525.0, "step": 1110 }, { "entropy": 1.3403134599328042, "epoch": 0.1655152030147412, "grad_norm": 0.0995827317237854, "learning_rate": 8.34638687749372e-05, "loss": 1.0021, "mean_token_accuracy": 0.7438825242221355, "num_tokens": 70632944.0, "step": 1120 }, { "entropy": 1.3671005301177501, "epoch": 0.16699301732737282, "grad_norm": 0.0887172594666481, "learning_rate": 8.331609280331019e-05, "loss": 1.0582, "mean_token_accuracy": 0.7311254240572452, "num_tokens": 71257165.0, "step": 1130 }, { "entropy": 1.3606456398963929, "epoch": 0.16847083164000443, "grad_norm": 0.1006636694073677, "learning_rate": 8.316831683168316e-05, "loss": 1.0574, "mean_token_accuracy": 0.7363891862332821, "num_tokens": 71875620.0, "step": 1140 }, { "entropy": 1.3795763775706291, "epoch": 0.16994864595263606, "grad_norm": 0.09867120534181595, "learning_rate": 8.302054086005617e-05, "loss": 1.0769, "mean_token_accuracy": 0.7298023782670497, "num_tokens": 72504275.0, "step": 1150 }, { "entropy": 1.3562307357788086, "epoch": 0.17142646026526767, "grad_norm": 0.09309513121843338, "learning_rate": 8.287276488842914e-05, "loss": 1.0693, "mean_token_accuracy": 0.7304324097931385, "num_tokens": 73126833.0, "step": 1160 }, { "entropy": 1.3621578849852085, "epoch": 0.17290427457789928, "grad_norm": 0.09566682577133179, "learning_rate": 8.272498891680214e-05, "loss": 1.0251, "mean_token_accuracy": 0.7400626718997956, "num_tokens": 73752404.0, "step": 1170 }, { "entropy": 1.4058452486991881, "epoch": 0.17438208889053092, "grad_norm": 0.11750762909650803, "learning_rate": 8.257721294517512e-05, "loss": 1.0742, "mean_token_accuracy": 0.7272376365959644, "num_tokens": 74362684.0, "step": 1180 }, { "entropy": 1.3896878361701965, "epoch": 0.17585990320316253, "grad_norm": 0.09952221810817719, "learning_rate": 8.24294369735481e-05, "loss": 1.0586, "mean_token_accuracy": 0.7340771615505218, "num_tokens": 75002180.0, "step": 1190 }, { "entropy": 1.3103776380419732, "epoch": 0.17733771751579414, "grad_norm": 0.10058079659938812, "learning_rate": 8.228166100192109e-05, "loss": 1.0286, "mean_token_accuracy": 0.7388425670564175, "num_tokens": 75614482.0, "step": 1200 }, { "entropy": 1.3207942619919777, "epoch": 0.17881553182842574, "grad_norm": 0.10897091031074524, "learning_rate": 8.213388503029408e-05, "loss": 1.0062, "mean_token_accuracy": 0.7426742933690548, "num_tokens": 76233339.0, "step": 1210 }, { "entropy": 1.3723637834191322, "epoch": 0.18029334614105738, "grad_norm": 0.10692214965820312, "learning_rate": 8.198610905866706e-05, "loss": 1.0752, "mean_token_accuracy": 0.7321088790893555, "num_tokens": 76859078.0, "step": 1220 }, { "entropy": 1.3349768593907356, "epoch": 0.181771160453689, "grad_norm": 0.09243787080049515, "learning_rate": 8.183833308704006e-05, "loss": 1.0172, "mean_token_accuracy": 0.7384184874594212, "num_tokens": 77465601.0, "step": 1230 }, { "entropy": 1.3455742478370667, "epoch": 0.1832489747663206, "grad_norm": 0.10957092046737671, "learning_rate": 8.169055711541303e-05, "loss": 1.0392, "mean_token_accuracy": 0.7363815769553185, "num_tokens": 78100003.0, "step": 1240 }, { "entropy": 1.319041520357132, "epoch": 0.18472678907895224, "grad_norm": 0.11203034967184067, "learning_rate": 8.154278114378603e-05, "loss": 0.9958, "mean_token_accuracy": 0.7451054699718952, "num_tokens": 78730233.0, "step": 1250 }, { "entropy": 1.3591867417097092, "epoch": 0.18620460339158384, "grad_norm": 0.09445121139287949, "learning_rate": 8.139500517215901e-05, "loss": 1.0607, "mean_token_accuracy": 0.7338679365813732, "num_tokens": 79369952.0, "step": 1260 }, { "entropy": 1.361959970742464, "epoch": 0.18768241770421545, "grad_norm": 0.10090041160583496, "learning_rate": 8.1247229200532e-05, "loss": 1.033, "mean_token_accuracy": 0.7382201731204987, "num_tokens": 79991924.0, "step": 1270 }, { "entropy": 1.3733899019658566, "epoch": 0.1891602320168471, "grad_norm": 0.11175256967544556, "learning_rate": 8.109945322890499e-05, "loss": 1.0614, "mean_token_accuracy": 0.7336510412395001, "num_tokens": 80624605.0, "step": 1280 }, { "entropy": 1.3171687975525856, "epoch": 0.1906380463294787, "grad_norm": 0.09502006322145462, "learning_rate": 8.095167725727797e-05, "loss": 1.0089, "mean_token_accuracy": 0.7437012106180191, "num_tokens": 81246229.0, "step": 1290 }, { "entropy": 1.3213663816452026, "epoch": 0.1921158606421103, "grad_norm": 0.09498457610607147, "learning_rate": 8.080390128565096e-05, "loss": 1.0026, "mean_token_accuracy": 0.7472335807979107, "num_tokens": 81888427.0, "step": 1300 }, { "entropy": 1.34869996458292, "epoch": 0.19359367495474195, "grad_norm": 0.11866965889930725, "learning_rate": 8.065612531402395e-05, "loss": 1.0224, "mean_token_accuracy": 0.740996740013361, "num_tokens": 82510238.0, "step": 1310 }, { "entropy": 1.3141113609075545, "epoch": 0.19507148926737355, "grad_norm": 0.11258051544427872, "learning_rate": 8.050834934239692e-05, "loss": 0.9994, "mean_token_accuracy": 0.7447339169681072, "num_tokens": 83147811.0, "step": 1320 }, { "entropy": 1.3105146937072276, "epoch": 0.19654930358000516, "grad_norm": 0.1201222687959671, "learning_rate": 8.036057337076993e-05, "loss": 1.015, "mean_token_accuracy": 0.7396009095013142, "num_tokens": 83783269.0, "step": 1330 }, { "entropy": 1.3794904358685016, "epoch": 0.1980271178926368, "grad_norm": 0.11637024581432343, "learning_rate": 8.02127973991429e-05, "loss": 1.0717, "mean_token_accuracy": 0.7308213971555233, "num_tokens": 84434671.0, "step": 1340 }, { "entropy": 1.3391420371830463, "epoch": 0.1995049322052684, "grad_norm": 0.10482585430145264, "learning_rate": 8.006502142751589e-05, "loss": 1.0063, "mean_token_accuracy": 0.7450359672307968, "num_tokens": 85051200.0, "step": 1350 }, { "entropy": 1.3461947545409203, "epoch": 0.20098274651790002, "grad_norm": 0.10634397715330124, "learning_rate": 7.991724545588888e-05, "loss": 1.0521, "mean_token_accuracy": 0.7360609002411366, "num_tokens": 85686910.0, "step": 1360 }, { "entropy": 1.328591948747635, "epoch": 0.20246056083053166, "grad_norm": 0.10722459852695465, "learning_rate": 7.976946948426187e-05, "loss": 1.0035, "mean_token_accuracy": 0.7449103698134423, "num_tokens": 86309849.0, "step": 1370 }, { "entropy": 1.3918874174356461, "epoch": 0.20393837514316326, "grad_norm": 0.1124623566865921, "learning_rate": 7.962169351263485e-05, "loss": 1.0747, "mean_token_accuracy": 0.7297042839229106, "num_tokens": 86946736.0, "step": 1380 }, { "entropy": 1.3307641319930554, "epoch": 0.20541618945579487, "grad_norm": 0.10401839017868042, "learning_rate": 7.947391754100784e-05, "loss": 1.0247, "mean_token_accuracy": 0.7394670993089676, "num_tokens": 87587364.0, "step": 1390 }, { "entropy": 1.3134734809398652, "epoch": 0.2068940037684265, "grad_norm": 0.1127687469124794, "learning_rate": 7.932614156938082e-05, "loss": 0.977, "mean_token_accuracy": 0.7489233329892159, "num_tokens": 88201969.0, "step": 1400 }, { "entropy": 1.321236951649189, "epoch": 0.20837181808105812, "grad_norm": 0.1230587363243103, "learning_rate": 7.91783655977538e-05, "loss": 1.0014, "mean_token_accuracy": 0.7438783705234527, "num_tokens": 88841442.0, "step": 1410 }, { "entropy": 1.3525510422885418, "epoch": 0.20984963239368973, "grad_norm": 0.11645467579364777, "learning_rate": 7.90305896261268e-05, "loss": 1.0365, "mean_token_accuracy": 0.7380785860121251, "num_tokens": 89460444.0, "step": 1420 }, { "entropy": 1.3169463470578193, "epoch": 0.21132744670632134, "grad_norm": 0.09807448834180832, "learning_rate": 7.888281365449978e-05, "loss": 1.0151, "mean_token_accuracy": 0.7428149476647377, "num_tokens": 90085094.0, "step": 1430 }, { "entropy": 1.3019375145435332, "epoch": 0.21280526101895297, "grad_norm": 0.0929834321141243, "learning_rate": 7.873503768287277e-05, "loss": 0.9708, "mean_token_accuracy": 0.7490074157714843, "num_tokens": 90721323.0, "step": 1440 }, { "entropy": 1.3838747300207614, "epoch": 0.21428307533158458, "grad_norm": 0.12123925238847733, "learning_rate": 7.858726171124576e-05, "loss": 1.0593, "mean_token_accuracy": 0.7317282311618328, "num_tokens": 91347998.0, "step": 1450 }, { "entropy": 1.3161128632724286, "epoch": 0.2157608896442162, "grad_norm": 0.0967702642083168, "learning_rate": 7.843948573961875e-05, "loss": 1.0023, "mean_token_accuracy": 0.745752614736557, "num_tokens": 91987480.0, "step": 1460 }, { "entropy": 1.358607316762209, "epoch": 0.21723870395684783, "grad_norm": 0.09103115648031235, "learning_rate": 7.829170976799172e-05, "loss": 1.0225, "mean_token_accuracy": 0.7394160240888595, "num_tokens": 92606958.0, "step": 1470 }, { "entropy": 1.2861947104334832, "epoch": 0.21871651826947944, "grad_norm": 0.09953464567661285, "learning_rate": 7.814393379636471e-05, "loss": 1.0021, "mean_token_accuracy": 0.7471014529466629, "num_tokens": 93241419.0, "step": 1480 }, { "entropy": 1.348529851436615, "epoch": 0.22019433258211105, "grad_norm": 0.11342471837997437, "learning_rate": 7.79961578247377e-05, "loss": 1.0311, "mean_token_accuracy": 0.741535271704197, "num_tokens": 93852674.0, "step": 1490 }, { "entropy": 1.3192447304725647, "epoch": 0.22167214689474268, "grad_norm": 0.09268448501825333, "learning_rate": 7.784838185311069e-05, "loss": 1.0193, "mean_token_accuracy": 0.7420137017965317, "num_tokens": 94457071.0, "step": 1500 }, { "entropy": 1.2933300271630288, "epoch": 0.2231499612073743, "grad_norm": 0.11778298020362854, "learning_rate": 7.770060588148367e-05, "loss": 1.0038, "mean_token_accuracy": 0.7440440624952316, "num_tokens": 95096857.0, "step": 1510 }, { "entropy": 1.3399901308119297, "epoch": 0.2246277755200059, "grad_norm": 0.10314805060625076, "learning_rate": 7.755282990985666e-05, "loss": 1.0432, "mean_token_accuracy": 0.7347467452287674, "num_tokens": 95710251.0, "step": 1520 }, { "entropy": 1.3574152827262878, "epoch": 0.22610558983263754, "grad_norm": 0.09815168380737305, "learning_rate": 7.740505393822964e-05, "loss": 1.0236, "mean_token_accuracy": 0.7383907742798328, "num_tokens": 96349869.0, "step": 1530 }, { "entropy": 1.3190400637686253, "epoch": 0.22758340414526915, "grad_norm": 0.10603173822164536, "learning_rate": 7.725727796660264e-05, "loss": 0.9934, "mean_token_accuracy": 0.7460605546832084, "num_tokens": 96970099.0, "step": 1540 }, { "entropy": 1.3596270292997361, "epoch": 0.22906121845790076, "grad_norm": 0.11921924352645874, "learning_rate": 7.710950199497561e-05, "loss": 1.0268, "mean_token_accuracy": 0.7397349782288074, "num_tokens": 97582834.0, "step": 1550 }, { "entropy": 1.3366517312824726, "epoch": 0.2305390327705324, "grad_norm": 0.09995236247777939, "learning_rate": 7.696172602334862e-05, "loss": 1.0421, "mean_token_accuracy": 0.7388435758650302, "num_tokens": 98206744.0, "step": 1560 }, { "entropy": 1.3542730413377284, "epoch": 0.232016847083164, "grad_norm": 0.11093679815530777, "learning_rate": 7.681395005172159e-05, "loss": 1.0324, "mean_token_accuracy": 0.736759950965643, "num_tokens": 98822084.0, "step": 1570 }, { "entropy": 1.3538315087556838, "epoch": 0.2334946613957956, "grad_norm": 0.10785405337810516, "learning_rate": 7.666617408009458e-05, "loss": 1.0234, "mean_token_accuracy": 0.7402111329138279, "num_tokens": 99448192.0, "step": 1580 }, { "entropy": 1.3442205354571342, "epoch": 0.23497247570842725, "grad_norm": 0.10176731646060944, "learning_rate": 7.651839810846757e-05, "loss": 1.0359, "mean_token_accuracy": 0.7362779274582862, "num_tokens": 100103673.0, "step": 1590 }, { "entropy": 1.3559410147368909, "epoch": 0.23645029002105886, "grad_norm": 0.10286710411310196, "learning_rate": 7.637062213684055e-05, "loss": 1.0519, "mean_token_accuracy": 0.7352492958307266, "num_tokens": 100738247.0, "step": 1600 }, { "entropy": 1.3641400419175624, "epoch": 0.23792810433369047, "grad_norm": 0.10766908526420593, "learning_rate": 7.622284616521353e-05, "loss": 1.0449, "mean_token_accuracy": 0.7377994388341904, "num_tokens": 101354199.0, "step": 1610 }, { "entropy": 1.3450035892426968, "epoch": 0.2394059186463221, "grad_norm": 0.10041961818933487, "learning_rate": 7.607507019358653e-05, "loss": 1.0217, "mean_token_accuracy": 0.7392164841294289, "num_tokens": 101991436.0, "step": 1620 }, { "entropy": 1.3661194667220116, "epoch": 0.2408837329589537, "grad_norm": 0.12022734433412552, "learning_rate": 7.59272942219595e-05, "loss": 1.0655, "mean_token_accuracy": 0.7299047157168388, "num_tokens": 102597689.0, "step": 1630 }, { "entropy": 1.35709098726511, "epoch": 0.24236154727158532, "grad_norm": 0.10375872999429703, "learning_rate": 7.577951825033251e-05, "loss": 1.0283, "mean_token_accuracy": 0.7381139561533928, "num_tokens": 103230722.0, "step": 1640 }, { "entropy": 1.3297756418585778, "epoch": 0.24383936158421693, "grad_norm": 0.10695882141590118, "learning_rate": 7.563174227870548e-05, "loss": 1.0368, "mean_token_accuracy": 0.7364217408001423, "num_tokens": 103860203.0, "step": 1650 }, { "entropy": 1.3703177645802498, "epoch": 0.24531717589684857, "grad_norm": 0.10709354281425476, "learning_rate": 7.548396630707847e-05, "loss": 1.0388, "mean_token_accuracy": 0.7379512034356595, "num_tokens": 104484571.0, "step": 1660 }, { "entropy": 1.3768685176968574, "epoch": 0.24679499020948018, "grad_norm": 0.12744958698749542, "learning_rate": 7.533619033545146e-05, "loss": 1.0563, "mean_token_accuracy": 0.7327473036944866, "num_tokens": 105093868.0, "step": 1670 }, { "entropy": 1.377336809784174, "epoch": 0.24827280452211178, "grad_norm": 0.10518407076597214, "learning_rate": 7.518841436382445e-05, "loss": 1.0808, "mean_token_accuracy": 0.733013579249382, "num_tokens": 105714000.0, "step": 1680 }, { "entropy": 1.3496724091470242, "epoch": 0.24975061883474342, "grad_norm": 0.1317768543958664, "learning_rate": 7.504063839219744e-05, "loss": 0.9933, "mean_token_accuracy": 0.7478909485042096, "num_tokens": 106346942.0, "step": 1690 }, { "entropy": 1.3175810858607293, "epoch": 0.25122843314737503, "grad_norm": 0.11672790348529816, "learning_rate": 7.489286242057042e-05, "loss": 1.0113, "mean_token_accuracy": 0.7453901283442974, "num_tokens": 106981893.0, "step": 1700 }, { "entropy": 1.3557366229593755, "epoch": 0.25270624746000664, "grad_norm": 0.0951073095202446, "learning_rate": 7.47450864489434e-05, "loss": 1.0431, "mean_token_accuracy": 0.7352614618837834, "num_tokens": 107616980.0, "step": 1710 }, { "entropy": 1.3488038405776024, "epoch": 0.25418406177263825, "grad_norm": 0.09690382331609726, "learning_rate": 7.45973104773164e-05, "loss": 1.0433, "mean_token_accuracy": 0.7353552646934987, "num_tokens": 108240730.0, "step": 1720 }, { "entropy": 1.318380505591631, "epoch": 0.2556618760852699, "grad_norm": 0.10357276350259781, "learning_rate": 7.444953450568937e-05, "loss": 1.0115, "mean_token_accuracy": 0.7435870662331581, "num_tokens": 108881320.0, "step": 1730 }, { "entropy": 1.317159901559353, "epoch": 0.2571396903979015, "grad_norm": 0.09926076978445053, "learning_rate": 7.430175853406236e-05, "loss": 0.996, "mean_token_accuracy": 0.7481661081314087, "num_tokens": 109516511.0, "step": 1740 }, { "entropy": 1.3350887671113014, "epoch": 0.25861750471053313, "grad_norm": 0.1110028401017189, "learning_rate": 7.415398256243535e-05, "loss": 1.0047, "mean_token_accuracy": 0.7430928081274033, "num_tokens": 110150208.0, "step": 1750 }, { "entropy": 1.3338087685406208, "epoch": 0.26009531902316474, "grad_norm": 0.1074734628200531, "learning_rate": 7.400620659080834e-05, "loss": 1.0192, "mean_token_accuracy": 0.7407279655337333, "num_tokens": 110778288.0, "step": 1760 }, { "entropy": 1.3606950506567954, "epoch": 0.26157313333579635, "grad_norm": 0.10617410391569138, "learning_rate": 7.385843061918133e-05, "loss": 1.0346, "mean_token_accuracy": 0.7412132248282433, "num_tokens": 111406540.0, "step": 1770 }, { "entropy": 1.3470192208886147, "epoch": 0.26305094764842796, "grad_norm": 0.08930668979883194, "learning_rate": 7.371065464755432e-05, "loss": 1.0349, "mean_token_accuracy": 0.7382924191653728, "num_tokens": 112046988.0, "step": 1780 }, { "entropy": 1.3257930040359498, "epoch": 0.26452876196105957, "grad_norm": 0.11683688312768936, "learning_rate": 7.356287867592729e-05, "loss": 0.9749, "mean_token_accuracy": 0.7466934151947499, "num_tokens": 112662431.0, "step": 1790 }, { "entropy": 1.3634838439524173, "epoch": 0.26600657627369123, "grad_norm": 0.113424152135849, "learning_rate": 7.341510270430029e-05, "loss": 1.0636, "mean_token_accuracy": 0.73306784927845, "num_tokens": 113273230.0, "step": 1800 }, { "entropy": 1.3364275880157948, "epoch": 0.26748439058632284, "grad_norm": 0.09862840175628662, "learning_rate": 7.326732673267327e-05, "loss": 1.0085, "mean_token_accuracy": 0.7427501030266285, "num_tokens": 113909313.0, "step": 1810 }, { "entropy": 1.3659813731908799, "epoch": 0.26896220489895445, "grad_norm": 0.12104249000549316, "learning_rate": 7.311955076104627e-05, "loss": 1.0439, "mean_token_accuracy": 0.7362107425928116, "num_tokens": 114514504.0, "step": 1820 }, { "entropy": 1.328355757892132, "epoch": 0.27044001921158606, "grad_norm": 0.11729808896780014, "learning_rate": 7.297177478941924e-05, "loss": 0.9775, "mean_token_accuracy": 0.7475184448063373, "num_tokens": 115140702.0, "step": 1830 }, { "entropy": 1.3406167194247245, "epoch": 0.27191783352421767, "grad_norm": 0.09913574159145355, "learning_rate": 7.282399881779223e-05, "loss": 1.0179, "mean_token_accuracy": 0.7432191327214241, "num_tokens": 115755068.0, "step": 1840 }, { "entropy": 1.3977623000741004, "epoch": 0.2733956478368493, "grad_norm": 0.0984942838549614, "learning_rate": 7.267622284616522e-05, "loss": 1.0822, "mean_token_accuracy": 0.7289882197976112, "num_tokens": 116354942.0, "step": 1850 }, { "entropy": 1.3664689101278782, "epoch": 0.27487346214948094, "grad_norm": 0.10869049280881882, "learning_rate": 7.252844687453821e-05, "loss": 1.0238, "mean_token_accuracy": 0.7409933775663375, "num_tokens": 116988534.0, "step": 1860 }, { "entropy": 1.315875554829836, "epoch": 0.27635127646211255, "grad_norm": 0.12993551790714264, "learning_rate": 7.238067090291118e-05, "loss": 0.9935, "mean_token_accuracy": 0.7480652235448361, "num_tokens": 117641953.0, "step": 1870 }, { "entropy": 1.2959641508758069, "epoch": 0.27782909077474416, "grad_norm": 0.09623228758573532, "learning_rate": 7.223289493128419e-05, "loss": 0.9943, "mean_token_accuracy": 0.7439824365079403, "num_tokens": 118256692.0, "step": 1880 }, { "entropy": 1.371036985516548, "epoch": 0.27930690508737577, "grad_norm": 0.11579816788434982, "learning_rate": 7.208511895965716e-05, "loss": 1.0556, "mean_token_accuracy": 0.7361032791435719, "num_tokens": 118891210.0, "step": 1890 }, { "entropy": 1.3036040149629116, "epoch": 0.2807847194000074, "grad_norm": 0.12691327929496765, "learning_rate": 7.193734298803015e-05, "loss": 0.9843, "mean_token_accuracy": 0.7478345915675163, "num_tokens": 119504239.0, "step": 1900 }, { "entropy": 1.3748640805482863, "epoch": 0.282262533712639, "grad_norm": 0.10164857655763626, "learning_rate": 7.178956701640314e-05, "loss": 1.0413, "mean_token_accuracy": 0.7376060217618943, "num_tokens": 120143691.0, "step": 1910 }, { "entropy": 1.361726462095976, "epoch": 0.28374034802527065, "grad_norm": 0.14407841861248016, "learning_rate": 7.164179104477612e-05, "loss": 1.0475, "mean_token_accuracy": 0.7337219528853893, "num_tokens": 120768595.0, "step": 1920 }, { "entropy": 1.3406222008168698, "epoch": 0.28521816233790226, "grad_norm": 0.12444034963846207, "learning_rate": 7.149401507314911e-05, "loss": 1.0261, "mean_token_accuracy": 0.7425919137895107, "num_tokens": 121398440.0, "step": 1930 }, { "entropy": 1.3530367895960809, "epoch": 0.28669597665053387, "grad_norm": 0.11323665827512741, "learning_rate": 7.13462391015221e-05, "loss": 1.03, "mean_token_accuracy": 0.7408431887626648, "num_tokens": 122014717.0, "step": 1940 }, { "entropy": 1.3645049922168255, "epoch": 0.2881737909631655, "grad_norm": 0.11987091600894928, "learning_rate": 7.119846312989509e-05, "loss": 1.0452, "mean_token_accuracy": 0.7358455255627632, "num_tokens": 122641856.0, "step": 1950 }, { "entropy": 1.3496552132070065, "epoch": 0.2896516052757971, "grad_norm": 0.11011224240064621, "learning_rate": 7.105068715826806e-05, "loss": 1.0348, "mean_token_accuracy": 0.7365316428244114, "num_tokens": 123259881.0, "step": 1960 }, { "entropy": 1.3554118975996972, "epoch": 0.2911294195884287, "grad_norm": 0.10278936475515366, "learning_rate": 7.090291118664105e-05, "loss": 1.0429, "mean_token_accuracy": 0.734364154189825, "num_tokens": 123883169.0, "step": 1970 }, { "entropy": 1.3658627800643444, "epoch": 0.2926072339010603, "grad_norm": 0.11712102591991425, "learning_rate": 7.075513521501404e-05, "loss": 1.0508, "mean_token_accuracy": 0.7375255465507508, "num_tokens": 124499574.0, "step": 1980 }, { "entropy": 1.3808431923389435, "epoch": 0.29408504821369197, "grad_norm": 0.12582142651081085, "learning_rate": 7.060735924338703e-05, "loss": 1.0752, "mean_token_accuracy": 0.7313126713037491, "num_tokens": 125126498.0, "step": 1990 }, { "entropy": 1.2969964474439621, "epoch": 0.2955628625263236, "grad_norm": 0.10375986248254776, "learning_rate": 7.045958327176002e-05, "loss": 1.0082, "mean_token_accuracy": 0.7448927208781242, "num_tokens": 125753238.0, "step": 2000 }, { "entropy": 1.3703055553138257, "epoch": 0.2970406768389552, "grad_norm": 0.11782936006784439, "learning_rate": 7.0311807300133e-05, "loss": 1.0193, "mean_token_accuracy": 0.7416508063673973, "num_tokens": 126374538.0, "step": 2010 }, { "entropy": 1.3585199259221554, "epoch": 0.2985184911515868, "grad_norm": 0.12770617008209229, "learning_rate": 7.016403132850598e-05, "loss": 1.0288, "mean_token_accuracy": 0.740058358758688, "num_tokens": 126994217.0, "step": 2020 }, { "entropy": 1.3496723629534244, "epoch": 0.2999963054642184, "grad_norm": 0.09809058904647827, "learning_rate": 7.001625535687898e-05, "loss": 1.0035, "mean_token_accuracy": 0.7450730398297309, "num_tokens": 127635972.0, "step": 2030 }, { "entropy": 1.3468332551419735, "epoch": 0.30147411977685, "grad_norm": 0.1129288524389267, "learning_rate": 6.986847938525196e-05, "loss": 1.018, "mean_token_accuracy": 0.7407178491353988, "num_tokens": 128259337.0, "step": 2040 }, { "entropy": 1.3580288112163543, "epoch": 0.3029519340894817, "grad_norm": 0.107613705098629, "learning_rate": 6.972070341362494e-05, "loss": 1.0521, "mean_token_accuracy": 0.7362593986093998, "num_tokens": 128878282.0, "step": 2050 }, { "entropy": 1.3525773376226424, "epoch": 0.3044297484021133, "grad_norm": 0.11789864301681519, "learning_rate": 6.957292744199793e-05, "loss": 1.0227, "mean_token_accuracy": 0.7409359261393547, "num_tokens": 129496376.0, "step": 2060 }, { "entropy": 1.3889159947633742, "epoch": 0.3059075627147449, "grad_norm": 0.10157744586467743, "learning_rate": 6.942515147037092e-05, "loss": 1.0735, "mean_token_accuracy": 0.7293846361339092, "num_tokens": 130133618.0, "step": 2070 }, { "entropy": 1.3392279900610446, "epoch": 0.3073853770273765, "grad_norm": 0.09857992082834244, "learning_rate": 6.927737549874391e-05, "loss": 1.0034, "mean_token_accuracy": 0.7396849572658539, "num_tokens": 130775922.0, "step": 2080 }, { "entropy": 1.354237724840641, "epoch": 0.3088631913400081, "grad_norm": 0.11697685718536377, "learning_rate": 6.91295995271169e-05, "loss": 1.0398, "mean_token_accuracy": 0.7384343758225441, "num_tokens": 131421760.0, "step": 2090 }, { "entropy": 1.3637243047356606, "epoch": 0.3103410056526397, "grad_norm": 0.10802293568849564, "learning_rate": 6.898182355548987e-05, "loss": 1.0496, "mean_token_accuracy": 0.7360463313758373, "num_tokens": 132027760.0, "step": 2100 }, { "entropy": 1.3234611213207246, "epoch": 0.3118188199652714, "grad_norm": 0.11391324549913406, "learning_rate": 6.883404758386287e-05, "loss": 0.9698, "mean_token_accuracy": 0.7520683214068413, "num_tokens": 132638973.0, "step": 2110 }, { "entropy": 1.327374517172575, "epoch": 0.313296634277903, "grad_norm": 0.0961180180311203, "learning_rate": 6.868627161223585e-05, "loss": 0.9911, "mean_token_accuracy": 0.7429872818291188, "num_tokens": 133269852.0, "step": 2120 }, { "entropy": 1.3173839271068573, "epoch": 0.3147744485905346, "grad_norm": 0.10153747349977493, "learning_rate": 6.853849564060884e-05, "loss": 1.0188, "mean_token_accuracy": 0.7429009906947612, "num_tokens": 133902116.0, "step": 2130 }, { "entropy": 1.3764125563204288, "epoch": 0.3162522629031662, "grad_norm": 0.10402517765760422, "learning_rate": 6.839071966898183e-05, "loss": 1.0249, "mean_token_accuracy": 0.7386217057704926, "num_tokens": 134527984.0, "step": 2140 }, { "entropy": 1.3320019409060477, "epoch": 0.3177300772157978, "grad_norm": 0.13321658968925476, "learning_rate": 6.824294369735481e-05, "loss": 1.0181, "mean_token_accuracy": 0.7429975025355816, "num_tokens": 135171015.0, "step": 2150 }, { "entropy": 1.323284325748682, "epoch": 0.31920789152842943, "grad_norm": 0.11596138030290604, "learning_rate": 6.80951677257278e-05, "loss": 0.9763, "mean_token_accuracy": 0.7492162629961967, "num_tokens": 135802769.0, "step": 2160 }, { "entropy": 1.3504845738410949, "epoch": 0.3206857058410611, "grad_norm": 0.11453942209482193, "learning_rate": 6.794739175410079e-05, "loss": 1.0587, "mean_token_accuracy": 0.7336528770625591, "num_tokens": 136428189.0, "step": 2170 }, { "entropy": 1.3354684211313725, "epoch": 0.3221635201536927, "grad_norm": 0.1275642067193985, "learning_rate": 6.779961578247376e-05, "loss": 1.0044, "mean_token_accuracy": 0.7408880606293679, "num_tokens": 137070498.0, "step": 2180 }, { "entropy": 1.368819622695446, "epoch": 0.3236413344663243, "grad_norm": 0.12235371768474579, "learning_rate": 6.765183981084677e-05, "loss": 1.0535, "mean_token_accuracy": 0.7341696232557297, "num_tokens": 137679641.0, "step": 2190 }, { "entropy": 1.3225167870521546, "epoch": 0.3251191487789559, "grad_norm": 0.09812725335359573, "learning_rate": 6.750406383921974e-05, "loss": 1.0252, "mean_token_accuracy": 0.7395187027752399, "num_tokens": 138336216.0, "step": 2200 }, { "entropy": 1.367988857626915, "epoch": 0.32659696309158753, "grad_norm": 0.12514571845531464, "learning_rate": 6.735628786759274e-05, "loss": 1.0716, "mean_token_accuracy": 0.7310583747923374, "num_tokens": 138963175.0, "step": 2210 }, { "entropy": 1.3490555189549922, "epoch": 0.32807477740421914, "grad_norm": 0.12653544545173645, "learning_rate": 6.720851189596572e-05, "loss": 1.063, "mean_token_accuracy": 0.7345262944698334, "num_tokens": 139600194.0, "step": 2220 }, { "entropy": 1.3446317560970784, "epoch": 0.32955259171685075, "grad_norm": 0.10482878983020782, "learning_rate": 6.70607359243387e-05, "loss": 1.0391, "mean_token_accuracy": 0.7383916914463043, "num_tokens": 140237377.0, "step": 2230 }, { "entropy": 1.3320685289800167, "epoch": 0.3310304060294824, "grad_norm": 0.10686700791120529, "learning_rate": 6.69129599527117e-05, "loss": 1.0304, "mean_token_accuracy": 0.737852866947651, "num_tokens": 140853893.0, "step": 2240 }, { "entropy": 1.3207725331187248, "epoch": 0.332508220342114, "grad_norm": 0.10360251367092133, "learning_rate": 6.676518398108468e-05, "loss": 1.0, "mean_token_accuracy": 0.7466425992548466, "num_tokens": 141471387.0, "step": 2250 }, { "entropy": 1.3336294353008271, "epoch": 0.33398603465474563, "grad_norm": 0.12046889215707779, "learning_rate": 6.661740800945766e-05, "loss": 1.0763, "mean_token_accuracy": 0.7299591615796089, "num_tokens": 142102862.0, "step": 2260 }, { "entropy": 1.3241831846535206, "epoch": 0.33546384896737724, "grad_norm": 0.11208558082580566, "learning_rate": 6.646963203783066e-05, "loss": 1.0077, "mean_token_accuracy": 0.7427926994860172, "num_tokens": 142712641.0, "step": 2270 }, { "entropy": 1.2987228810787201, "epoch": 0.33694166328000885, "grad_norm": 0.10891300439834595, "learning_rate": 6.632185606620363e-05, "loss": 1.0021, "mean_token_accuracy": 0.746040652692318, "num_tokens": 143357692.0, "step": 2280 }, { "entropy": 1.3333717592060566, "epoch": 0.33841947759264046, "grad_norm": 0.107634037733078, "learning_rate": 6.617408009457664e-05, "loss": 1.0051, "mean_token_accuracy": 0.7442885607481002, "num_tokens": 143990646.0, "step": 2290 }, { "entropy": 1.370392120629549, "epoch": 0.3398972919052721, "grad_norm": 0.10865243524312973, "learning_rate": 6.602630412294961e-05, "loss": 1.0692, "mean_token_accuracy": 0.7315164700150489, "num_tokens": 144619931.0, "step": 2300 }, { "entropy": 1.3540328681468963, "epoch": 0.34137510621790373, "grad_norm": 0.1158401146531105, "learning_rate": 6.58785281513226e-05, "loss": 1.0555, "mean_token_accuracy": 0.7361217260360717, "num_tokens": 145241748.0, "step": 2310 }, { "entropy": 1.3016823388636112, "epoch": 0.34285292053053534, "grad_norm": 0.11778155714273453, "learning_rate": 6.573075217969559e-05, "loss": 0.9845, "mean_token_accuracy": 0.747497683763504, "num_tokens": 145871775.0, "step": 2320 }, { "entropy": 1.32976598367095, "epoch": 0.34433073484316695, "grad_norm": 0.11029067635536194, "learning_rate": 6.558297620806857e-05, "loss": 1.0369, "mean_token_accuracy": 0.7379365123808383, "num_tokens": 146520142.0, "step": 2330 }, { "entropy": 1.3770955115556718, "epoch": 0.34580854915579856, "grad_norm": 0.15313439071178436, "learning_rate": 6.543520023644156e-05, "loss": 1.0408, "mean_token_accuracy": 0.7377210259437561, "num_tokens": 147155097.0, "step": 2340 }, { "entropy": 1.3539579182863235, "epoch": 0.34728636346843017, "grad_norm": 0.1262284517288208, "learning_rate": 6.528742426481455e-05, "loss": 1.0508, "mean_token_accuracy": 0.7372145742177963, "num_tokens": 147790753.0, "step": 2350 }, { "entropy": 1.3089107267558575, "epoch": 0.34876417778106183, "grad_norm": 0.11003509908914566, "learning_rate": 6.513964829318753e-05, "loss": 0.9973, "mean_token_accuracy": 0.7451998688280582, "num_tokens": 148415446.0, "step": 2360 }, { "entropy": 1.3680420733988286, "epoch": 0.35024199209369344, "grad_norm": 0.11607158184051514, "learning_rate": 6.499187232156051e-05, "loss": 1.0203, "mean_token_accuracy": 0.7391661629080772, "num_tokens": 149047857.0, "step": 2370 }, { "entropy": 1.326318697631359, "epoch": 0.35171980640632505, "grad_norm": 0.1115611344575882, "learning_rate": 6.48440963499335e-05, "loss": 1.0044, "mean_token_accuracy": 0.7440035976469517, "num_tokens": 149677919.0, "step": 2380 }, { "entropy": 1.3716378539800644, "epoch": 0.35319762071895666, "grad_norm": 0.1267595738172531, "learning_rate": 6.469632037830649e-05, "loss": 1.0311, "mean_token_accuracy": 0.7415719844400883, "num_tokens": 150307607.0, "step": 2390 }, { "entropy": 1.3206391848623753, "epoch": 0.35467543503158827, "grad_norm": 0.11261120438575745, "learning_rate": 6.454854440667948e-05, "loss": 0.9928, "mean_token_accuracy": 0.7469543524086475, "num_tokens": 150954542.0, "step": 2400 }, { "entropy": 1.2988264113664627, "epoch": 0.3561532493442199, "grad_norm": 0.10469997674226761, "learning_rate": 6.440076843505247e-05, "loss": 0.9561, "mean_token_accuracy": 0.7532316006720066, "num_tokens": 151578422.0, "step": 2410 }, { "entropy": 1.3059771910309792, "epoch": 0.3576310636568515, "grad_norm": 0.10764110833406448, "learning_rate": 6.425299246342546e-05, "loss": 0.9763, "mean_token_accuracy": 0.74577169790864, "num_tokens": 152201507.0, "step": 2420 }, { "entropy": 1.348013310134411, "epoch": 0.35910887796948315, "grad_norm": 0.11025828123092651, "learning_rate": 6.410521649179843e-05, "loss": 1.0416, "mean_token_accuracy": 0.7364607952535153, "num_tokens": 152826167.0, "step": 2430 }, { "entropy": 1.358570785820484, "epoch": 0.36058669228211476, "grad_norm": 0.11537870019674301, "learning_rate": 6.395744052017142e-05, "loss": 1.0328, "mean_token_accuracy": 0.7381561897695065, "num_tokens": 153452977.0, "step": 2440 }, { "entropy": 1.290497499704361, "epoch": 0.36206450659474637, "grad_norm": 0.11319958418607712, "learning_rate": 6.38096645485444e-05, "loss": 0.9724, "mean_token_accuracy": 0.7475843630731106, "num_tokens": 154081881.0, "step": 2450 }, { "entropy": 1.3434569776058196, "epoch": 0.363542320907378, "grad_norm": 0.11890029907226562, "learning_rate": 6.36618885769174e-05, "loss": 1.0237, "mean_token_accuracy": 0.7408385023474693, "num_tokens": 154696692.0, "step": 2460 }, { "entropy": 1.3663389906287193, "epoch": 0.3650201352200096, "grad_norm": 0.10306631773710251, "learning_rate": 6.351411260529038e-05, "loss": 1.0883, "mean_token_accuracy": 0.7281133748590947, "num_tokens": 155326807.0, "step": 2470 }, { "entropy": 1.3352325096726418, "epoch": 0.3664979495326412, "grad_norm": 0.13469462096691132, "learning_rate": 6.336633663366337e-05, "loss": 1.0129, "mean_token_accuracy": 0.7416555799543858, "num_tokens": 155963544.0, "step": 2480 }, { "entropy": 1.3298554822802544, "epoch": 0.36797576384527286, "grad_norm": 0.13767758011817932, "learning_rate": 6.321856066203635e-05, "loss": 1.0151, "mean_token_accuracy": 0.7417769074440003, "num_tokens": 156583390.0, "step": 2490 }, { "entropy": 1.3384235605597496, "epoch": 0.36945357815790447, "grad_norm": 0.10280942171812057, "learning_rate": 6.307078469040935e-05, "loss": 1.0067, "mean_token_accuracy": 0.7415686272084713, "num_tokens": 157208767.0, "step": 2500 }, { "entropy": 1.3747689306735993, "epoch": 0.3709313924705361, "grad_norm": 0.11320924013853073, "learning_rate": 6.292300871878232e-05, "loss": 1.0687, "mean_token_accuracy": 0.7295591056346893, "num_tokens": 157830935.0, "step": 2510 }, { "entropy": 1.3555556759238243, "epoch": 0.3724092067831677, "grad_norm": 0.11231453716754913, "learning_rate": 6.277523274715531e-05, "loss": 1.0142, "mean_token_accuracy": 0.7398925371468067, "num_tokens": 158458326.0, "step": 2520 }, { "entropy": 1.3142734497785569, "epoch": 0.3738870210957993, "grad_norm": 0.12294314801692963, "learning_rate": 6.26274567755283e-05, "loss": 0.9793, "mean_token_accuracy": 0.7500525377690792, "num_tokens": 159116266.0, "step": 2530 }, { "entropy": 1.3187284499406815, "epoch": 0.3753648354084309, "grad_norm": 0.13975459337234497, "learning_rate": 6.247968080390129e-05, "loss": 0.9913, "mean_token_accuracy": 0.747199397534132, "num_tokens": 159751512.0, "step": 2540 }, { "entropy": 1.3505188934504986, "epoch": 0.3768426497210626, "grad_norm": 0.11873970925807953, "learning_rate": 6.233190483227428e-05, "loss": 1.0392, "mean_token_accuracy": 0.7385047681629657, "num_tokens": 160382970.0, "step": 2550 }, { "entropy": 1.3201254040002823, "epoch": 0.3783204640336942, "grad_norm": 0.14079681038856506, "learning_rate": 6.218412886064726e-05, "loss": 0.9961, "mean_token_accuracy": 0.746822776645422, "num_tokens": 161016940.0, "step": 2560 }, { "entropy": 1.3438078887760638, "epoch": 0.3797982783463258, "grad_norm": 0.10927737504243851, "learning_rate": 6.203635288902024e-05, "loss": 1.0477, "mean_token_accuracy": 0.732993096858263, "num_tokens": 161651492.0, "step": 2570 }, { "entropy": 1.3874997161328793, "epoch": 0.3812760926589574, "grad_norm": 0.11553368717432022, "learning_rate": 6.188857691739324e-05, "loss": 1.0577, "mean_token_accuracy": 0.7329879857599735, "num_tokens": 162317869.0, "step": 2580 }, { "entropy": 1.369983048737049, "epoch": 0.382753906971589, "grad_norm": 0.10490620881319046, "learning_rate": 6.174080094576621e-05, "loss": 1.0611, "mean_token_accuracy": 0.7350798234343529, "num_tokens": 162956671.0, "step": 2590 }, { "entropy": 1.3504191115498543, "epoch": 0.3842317212842206, "grad_norm": 0.12128763645887375, "learning_rate": 6.159302497413922e-05, "loss": 1.0338, "mean_token_accuracy": 0.7371863946318626, "num_tokens": 163576216.0, "step": 2600 }, { "entropy": 1.2979571580886842, "epoch": 0.3857095355968523, "grad_norm": 0.10547712445259094, "learning_rate": 6.144524900251219e-05, "loss": 0.9993, "mean_token_accuracy": 0.7470176264643669, "num_tokens": 164191471.0, "step": 2610 }, { "entropy": 1.299732106924057, "epoch": 0.3871873499094839, "grad_norm": 0.10867074877023697, "learning_rate": 6.129747303088518e-05, "loss": 0.9935, "mean_token_accuracy": 0.7457987800240516, "num_tokens": 164825405.0, "step": 2620 }, { "entropy": 1.347513662278652, "epoch": 0.3886651642221155, "grad_norm": 0.10699914395809174, "learning_rate": 6.114969705925817e-05, "loss": 1.0376, "mean_token_accuracy": 0.7393544964492321, "num_tokens": 165469743.0, "step": 2630 }, { "entropy": 1.3306864887475967, "epoch": 0.3901429785347471, "grad_norm": 0.11511126160621643, "learning_rate": 6.1001921087631156e-05, "loss": 1.019, "mean_token_accuracy": 0.7381970398128033, "num_tokens": 166089598.0, "step": 2640 }, { "entropy": 1.3333285301923752, "epoch": 0.3916207928473787, "grad_norm": 0.11367027461528778, "learning_rate": 6.085414511600414e-05, "loss": 0.997, "mean_token_accuracy": 0.7467053011059761, "num_tokens": 166717021.0, "step": 2650 }, { "entropy": 1.3339226961135864, "epoch": 0.3930986071600103, "grad_norm": 0.11065942049026489, "learning_rate": 6.0706369144377126e-05, "loss": 1.004, "mean_token_accuracy": 0.7448596432805061, "num_tokens": 167341286.0, "step": 2660 }, { "entropy": 1.3062518246471881, "epoch": 0.39457642147264194, "grad_norm": 0.12307227402925491, "learning_rate": 6.0558593172750114e-05, "loss": 0.985, "mean_token_accuracy": 0.7469465628266334, "num_tokens": 167969100.0, "step": 2670 }, { "entropy": 1.3655583813786507, "epoch": 0.3960542357852736, "grad_norm": 0.10138296335935593, "learning_rate": 6.04108172011231e-05, "loss": 1.0372, "mean_token_accuracy": 0.739393538236618, "num_tokens": 168608314.0, "step": 2680 }, { "entropy": 1.2950063794851303, "epoch": 0.3975320500979052, "grad_norm": 0.11317243427038193, "learning_rate": 6.0263041229496084e-05, "loss": 0.9429, "mean_token_accuracy": 0.7571868598461151, "num_tokens": 169227402.0, "step": 2690 }, { "entropy": 1.3435308299958706, "epoch": 0.3990098644105368, "grad_norm": 0.11763688176870346, "learning_rate": 6.011526525786907e-05, "loss": 1.0319, "mean_token_accuracy": 0.739401226490736, "num_tokens": 169846401.0, "step": 2700 }, { "entropy": 1.3442980594933034, "epoch": 0.4004876787231684, "grad_norm": 0.10513842850923538, "learning_rate": 5.996748928624206e-05, "loss": 0.9871, "mean_token_accuracy": 0.7463423803448677, "num_tokens": 170476608.0, "step": 2710 }, { "entropy": 1.343531072884798, "epoch": 0.40196549303580004, "grad_norm": 0.11001633107662201, "learning_rate": 5.981971331461504e-05, "loss": 1.0192, "mean_token_accuracy": 0.7424076452851296, "num_tokens": 171098245.0, "step": 2720 }, { "entropy": 1.3884330071508884, "epoch": 0.40344330734843165, "grad_norm": 0.11198286712169647, "learning_rate": 5.9671937342988037e-05, "loss": 1.0602, "mean_token_accuracy": 0.7355059400200844, "num_tokens": 171723965.0, "step": 2730 }, { "entropy": 1.3671185605227947, "epoch": 0.4049211216610633, "grad_norm": 0.11801856756210327, "learning_rate": 5.952416137136102e-05, "loss": 1.0268, "mean_token_accuracy": 0.7393461734056472, "num_tokens": 172347061.0, "step": 2740 }, { "entropy": 1.323919515311718, "epoch": 0.4063989359736949, "grad_norm": 0.11580619215965271, "learning_rate": 5.9376385399734e-05, "loss": 1.0054, "mean_token_accuracy": 0.7442776501178742, "num_tokens": 172982062.0, "step": 2750 }, { "entropy": 1.3789773643016816, "epoch": 0.40787675028632653, "grad_norm": 0.10008373856544495, "learning_rate": 5.9228609428106994e-05, "loss": 1.0165, "mean_token_accuracy": 0.7394210025668144, "num_tokens": 173615266.0, "step": 2760 }, { "entropy": 1.326123160123825, "epoch": 0.40935456459895814, "grad_norm": 0.12968984246253967, "learning_rate": 5.9080833456479976e-05, "loss": 1.0073, "mean_token_accuracy": 0.7445714198052883, "num_tokens": 174247388.0, "step": 2770 }, { "entropy": 1.3163345210254191, "epoch": 0.41083237891158975, "grad_norm": 0.10620130598545074, "learning_rate": 5.893305748485296e-05, "loss": 1.0153, "mean_token_accuracy": 0.7422694250941276, "num_tokens": 174887319.0, "step": 2780 }, { "entropy": 1.276471631973982, "epoch": 0.41231019322422136, "grad_norm": 0.11546126008033752, "learning_rate": 5.878528151322595e-05, "loss": 0.956, "mean_token_accuracy": 0.7540316492319107, "num_tokens": 175521599.0, "step": 2790 }, { "entropy": 1.3033716894686223, "epoch": 0.413788007536853, "grad_norm": 0.11271125823259354, "learning_rate": 5.8637505541598934e-05, "loss": 0.9837, "mean_token_accuracy": 0.7463239781558514, "num_tokens": 176139684.0, "step": 2800 }, { "entropy": 1.334360421448946, "epoch": 0.41526582184948463, "grad_norm": 0.110804982483387, "learning_rate": 5.848972956997193e-05, "loss": 1.0242, "mean_token_accuracy": 0.7349204763770103, "num_tokens": 176749358.0, "step": 2810 }, { "entropy": 1.3180787444114686, "epoch": 0.41674363616211624, "grad_norm": 0.11518800258636475, "learning_rate": 5.834195359834491e-05, "loss": 0.9923, "mean_token_accuracy": 0.747980859130621, "num_tokens": 177363939.0, "step": 2820 }, { "entropy": 1.3395656317472457, "epoch": 0.41822145047474785, "grad_norm": 0.10945259779691696, "learning_rate": 5.819417762671789e-05, "loss": 1.0213, "mean_token_accuracy": 0.7422494500875473, "num_tokens": 177989786.0, "step": 2830 }, { "entropy": 1.3470888301730155, "epoch": 0.41969926478737946, "grad_norm": 0.14387215673923492, "learning_rate": 5.804640165509089e-05, "loss": 1.0387, "mean_token_accuracy": 0.7359960667788983, "num_tokens": 178631952.0, "step": 2840 }, { "entropy": 1.3248698562383652, "epoch": 0.42117707910001106, "grad_norm": 0.12421754747629166, "learning_rate": 5.789862568346387e-05, "loss": 1.0008, "mean_token_accuracy": 0.7468325570225716, "num_tokens": 179267882.0, "step": 2850 }, { "entropy": 1.3252468392252923, "epoch": 0.4226548934126427, "grad_norm": 0.12913116812705994, "learning_rate": 5.775084971183686e-05, "loss": 0.9956, "mean_token_accuracy": 0.7422256797552109, "num_tokens": 179898670.0, "step": 2860 }, { "entropy": 1.3273553922772408, "epoch": 0.42413270772527434, "grad_norm": 0.1182723343372345, "learning_rate": 5.7603073740209845e-05, "loss": 1.0077, "mean_token_accuracy": 0.745375657826662, "num_tokens": 180555347.0, "step": 2870 }, { "entropy": 1.2914891712367536, "epoch": 0.42561052203790595, "grad_norm": 0.10932762920856476, "learning_rate": 5.7455297768582826e-05, "loss": 1.014, "mean_token_accuracy": 0.7426045201718807, "num_tokens": 181201294.0, "step": 2880 }, { "entropy": 1.3286943525075912, "epoch": 0.42708833635053756, "grad_norm": 0.11981204897165298, "learning_rate": 5.730752179695582e-05, "loss": 1.0206, "mean_token_accuracy": 0.7393959686160088, "num_tokens": 181830863.0, "step": 2890 }, { "entropy": 1.3407499633729458, "epoch": 0.42856615066316917, "grad_norm": 0.10789301991462708, "learning_rate": 5.71597458253288e-05, "loss": 1.018, "mean_token_accuracy": 0.741955791413784, "num_tokens": 182462480.0, "step": 2900 }, { "entropy": 1.3357246771454812, "epoch": 0.4300439649758008, "grad_norm": 0.12831929326057434, "learning_rate": 5.7011969853701784e-05, "loss": 1.0442, "mean_token_accuracy": 0.7360114604234695, "num_tokens": 183084422.0, "step": 2910 }, { "entropy": 1.299278263002634, "epoch": 0.4315217792884324, "grad_norm": 0.1147497147321701, "learning_rate": 5.686419388207478e-05, "loss": 0.9936, "mean_token_accuracy": 0.7489165782928466, "num_tokens": 183718870.0, "step": 2920 }, { "entropy": 1.3196597643196584, "epoch": 0.43299959360106405, "grad_norm": 0.10116377472877502, "learning_rate": 5.671641791044776e-05, "loss": 1.0105, "mean_token_accuracy": 0.7411533951759338, "num_tokens": 184342140.0, "step": 2930 }, { "entropy": 1.34343186840415, "epoch": 0.43447740791369566, "grad_norm": 0.12002977728843689, "learning_rate": 5.6568641938820756e-05, "loss": 1.0508, "mean_token_accuracy": 0.7358109518885613, "num_tokens": 184959915.0, "step": 2940 }, { "entropy": 1.3466629028320312, "epoch": 0.43595522222632727, "grad_norm": 0.10612580180168152, "learning_rate": 5.642086596719374e-05, "loss": 1.0546, "mean_token_accuracy": 0.732919916510582, "num_tokens": 185596121.0, "step": 2950 }, { "entropy": 1.384493639320135, "epoch": 0.4374330365389589, "grad_norm": 0.11402401328086853, "learning_rate": 5.627308999556672e-05, "loss": 1.0618, "mean_token_accuracy": 0.7344385020434856, "num_tokens": 186237747.0, "step": 2960 }, { "entropy": 1.3325828693807125, "epoch": 0.4389108508515905, "grad_norm": 0.11494413763284683, "learning_rate": 5.6125314023939714e-05, "loss": 1.067, "mean_token_accuracy": 0.7311987280845642, "num_tokens": 186859181.0, "step": 2970 }, { "entropy": 1.3028566606342793, "epoch": 0.4403886651642221, "grad_norm": 0.11112917959690094, "learning_rate": 5.5977538052312695e-05, "loss": 0.9694, "mean_token_accuracy": 0.7484906904399395, "num_tokens": 187507475.0, "step": 2980 }, { "entropy": 1.3332383722066878, "epoch": 0.44186647947685376, "grad_norm": 0.12574991583824158, "learning_rate": 5.582976208068569e-05, "loss": 1.0308, "mean_token_accuracy": 0.7397411569952965, "num_tokens": 188138462.0, "step": 2990 }, { "entropy": 1.3662227645516396, "epoch": 0.44334429378948537, "grad_norm": 0.12452980130910873, "learning_rate": 5.568198610905867e-05, "loss": 1.0462, "mean_token_accuracy": 0.7339240312576294, "num_tokens": 188757427.0, "step": 3000 }, { "entropy": 1.3738774508237839, "epoch": 0.444822108102117, "grad_norm": 0.12353511899709702, "learning_rate": 5.553421013743165e-05, "loss": 1.0545, "mean_token_accuracy": 0.7342685110867023, "num_tokens": 189384207.0, "step": 3010 }, { "entropy": 1.3274571530520916, "epoch": 0.4462999224147486, "grad_norm": 0.1116141825914383, "learning_rate": 5.538643416580465e-05, "loss": 0.9787, "mean_token_accuracy": 0.7479172520339489, "num_tokens": 190024832.0, "step": 3020 }, { "entropy": 1.294634611159563, "epoch": 0.4477777367273802, "grad_norm": 0.10204346477985382, "learning_rate": 5.523865819417763e-05, "loss": 0.9898, "mean_token_accuracy": 0.7439772725105286, "num_tokens": 190647129.0, "step": 3030 }, { "entropy": 1.3052165731787682, "epoch": 0.4492555510400118, "grad_norm": 0.11496242135763168, "learning_rate": 5.509088222255061e-05, "loss": 0.9795, "mean_token_accuracy": 0.7487292625010014, "num_tokens": 191248869.0, "step": 3040 }, { "entropy": 1.3516557164490224, "epoch": 0.45073336535264347, "grad_norm": 0.10153250396251678, "learning_rate": 5.4943106250923606e-05, "loss": 1.021, "mean_token_accuracy": 0.7397518754005432, "num_tokens": 191884174.0, "step": 3050 }, { "entropy": 1.3404523707926272, "epoch": 0.4522111796652751, "grad_norm": 0.12902577221393585, "learning_rate": 5.479533027929659e-05, "loss": 1.0308, "mean_token_accuracy": 0.7386652678251266, "num_tokens": 192490961.0, "step": 3060 }, { "entropy": 1.3242835983633996, "epoch": 0.4536889939779067, "grad_norm": 0.11308476328849792, "learning_rate": 5.464755430766958e-05, "loss": 1.0502, "mean_token_accuracy": 0.7358929142355919, "num_tokens": 193087055.0, "step": 3070 }, { "entropy": 1.3779341116547585, "epoch": 0.4551668082905383, "grad_norm": 0.1298595815896988, "learning_rate": 5.4499778336042564e-05, "loss": 1.0506, "mean_token_accuracy": 0.7345085546374321, "num_tokens": 193712926.0, "step": 3080 }, { "entropy": 1.3581049352884293, "epoch": 0.4566446226031699, "grad_norm": 0.11287155002355576, "learning_rate": 5.4352002364415545e-05, "loss": 1.0258, "mean_token_accuracy": 0.737793606519699, "num_tokens": 194352679.0, "step": 3090 }, { "entropy": 1.3133333794772626, "epoch": 0.4581224369158015, "grad_norm": 0.11862477660179138, "learning_rate": 5.420422639278854e-05, "loss": 1.0119, "mean_token_accuracy": 0.742002834379673, "num_tokens": 194979080.0, "step": 3100 }, { "entropy": 1.3262240797281266, "epoch": 0.4596002512284331, "grad_norm": 0.11039308458566666, "learning_rate": 5.405645042116152e-05, "loss": 1.004, "mean_token_accuracy": 0.7448594368994236, "num_tokens": 195599027.0, "step": 3110 }, { "entropy": 1.3526733674108982, "epoch": 0.4610780655410648, "grad_norm": 0.12351663410663605, "learning_rate": 5.390867444953451e-05, "loss": 1.025, "mean_token_accuracy": 0.7385124079883099, "num_tokens": 196222237.0, "step": 3120 }, { "entropy": 1.3755785167217254, "epoch": 0.4625558798536964, "grad_norm": 0.11777998507022858, "learning_rate": 5.37608984779075e-05, "loss": 1.0615, "mean_token_accuracy": 0.7338152408599854, "num_tokens": 196849072.0, "step": 3130 }, { "entropy": 1.2873252600431442, "epoch": 0.464033694166328, "grad_norm": 0.1119779720902443, "learning_rate": 5.361312250628048e-05, "loss": 0.9939, "mean_token_accuracy": 0.7457574985921382, "num_tokens": 197479996.0, "step": 3140 }, { "entropy": 1.3290088526904582, "epoch": 0.4655115084789596, "grad_norm": 0.10185403376817703, "learning_rate": 5.346534653465347e-05, "loss": 0.9982, "mean_token_accuracy": 0.745093023777008, "num_tokens": 198114198.0, "step": 3150 }, { "entropy": 1.3040216162800788, "epoch": 0.4669893227915912, "grad_norm": 0.12758901715278625, "learning_rate": 5.3317570563026456e-05, "loss": 0.9908, "mean_token_accuracy": 0.7469444774091244, "num_tokens": 198744871.0, "step": 3160 }, { "entropy": 1.3350887216627598, "epoch": 0.46846713710422283, "grad_norm": 0.12365201860666275, "learning_rate": 5.316979459139944e-05, "loss": 1.029, "mean_token_accuracy": 0.7377054400742054, "num_tokens": 199368679.0, "step": 3170 }, { "entropy": 1.3086614586412906, "epoch": 0.4699449514168545, "grad_norm": 0.12184581160545349, "learning_rate": 5.3022018619772426e-05, "loss": 1.0208, "mean_token_accuracy": 0.7402149192988873, "num_tokens": 199988730.0, "step": 3180 }, { "entropy": 1.338922818750143, "epoch": 0.4714227657294861, "grad_norm": 0.11584389209747314, "learning_rate": 5.2874242648145414e-05, "loss": 1.0249, "mean_token_accuracy": 0.7406525187194347, "num_tokens": 200601443.0, "step": 3190 }, { "entropy": 1.3665964484214783, "epoch": 0.4729005800421177, "grad_norm": 0.11363598704338074, "learning_rate": 5.27264666765184e-05, "loss": 1.0536, "mean_token_accuracy": 0.7332972958683968, "num_tokens": 201253526.0, "step": 3200 }, { "entropy": 1.363574294000864, "epoch": 0.4743783943547493, "grad_norm": 0.1246991977095604, "learning_rate": 5.2578690704891384e-05, "loss": 1.0539, "mean_token_accuracy": 0.7336206682026386, "num_tokens": 201889341.0, "step": 3210 }, { "entropy": 1.3425316251814365, "epoch": 0.47585620866738093, "grad_norm": 0.11345670372247696, "learning_rate": 5.243091473326437e-05, "loss": 1.036, "mean_token_accuracy": 0.7365034572780133, "num_tokens": 202529041.0, "step": 3220 }, { "entropy": 1.3099669203162194, "epoch": 0.47733402298001254, "grad_norm": 0.11768782883882523, "learning_rate": 5.228313876163736e-05, "loss": 1.0065, "mean_token_accuracy": 0.7445768341422081, "num_tokens": 203154925.0, "step": 3230 }, { "entropy": 1.3240293197333812, "epoch": 0.4788118372926442, "grad_norm": 0.12721501290798187, "learning_rate": 5.213536279001034e-05, "loss": 0.9708, "mean_token_accuracy": 0.7518071658909321, "num_tokens": 203799822.0, "step": 3240 }, { "entropy": 1.3182805471122265, "epoch": 0.4802896516052758, "grad_norm": 0.13314363360404968, "learning_rate": 5.198758681838334e-05, "loss": 0.989, "mean_token_accuracy": 0.7485011011362076, "num_tokens": 204427998.0, "step": 3250 }, { "entropy": 1.3208178155124188, "epoch": 0.4817674659179074, "grad_norm": 0.10576171427965164, "learning_rate": 5.183981084675632e-05, "loss": 1.0116, "mean_token_accuracy": 0.7418395794928074, "num_tokens": 205083218.0, "step": 3260 }, { "entropy": 1.366914363950491, "epoch": 0.48324528023053903, "grad_norm": 0.10938998311758041, "learning_rate": 5.16920348751293e-05, "loss": 1.0495, "mean_token_accuracy": 0.7358329579234123, "num_tokens": 205713942.0, "step": 3270 }, { "entropy": 1.3152115523815155, "epoch": 0.48472309454317064, "grad_norm": 0.1116151288151741, "learning_rate": 5.1544258903502295e-05, "loss": 1.0067, "mean_token_accuracy": 0.7463385559618473, "num_tokens": 206352602.0, "step": 3280 }, { "entropy": 1.34514739215374, "epoch": 0.48620090885580225, "grad_norm": 0.10949606448411942, "learning_rate": 5.1396482931875276e-05, "loss": 1.0212, "mean_token_accuracy": 0.7405461743474007, "num_tokens": 207004780.0, "step": 3290 }, { "entropy": 1.3107164040207864, "epoch": 0.48767872316843386, "grad_norm": 0.12132346630096436, "learning_rate": 5.124870696024826e-05, "loss": 0.9977, "mean_token_accuracy": 0.7398034170269966, "num_tokens": 207631812.0, "step": 3300 }, { "entropy": 1.337456651031971, "epoch": 0.4891565374810655, "grad_norm": 0.10723264515399933, "learning_rate": 5.110093098862125e-05, "loss": 1.0045, "mean_token_accuracy": 0.7424529060721398, "num_tokens": 208270670.0, "step": 3310 }, { "entropy": 1.3590418472886086, "epoch": 0.49063435179369713, "grad_norm": 0.1069742813706398, "learning_rate": 5.0953155016994234e-05, "loss": 1.0674, "mean_token_accuracy": 0.7290687002241611, "num_tokens": 208920781.0, "step": 3320 }, { "entropy": 1.3540847443044186, "epoch": 0.49211216610632874, "grad_norm": 0.11442390084266663, "learning_rate": 5.080537904536723e-05, "loss": 1.0385, "mean_token_accuracy": 0.7392103366553784, "num_tokens": 209536141.0, "step": 3330 }, { "entropy": 1.3643196202814578, "epoch": 0.49358998041896035, "grad_norm": 0.12627092003822327, "learning_rate": 5.065760307374021e-05, "loss": 1.0249, "mean_token_accuracy": 0.7383069723844529, "num_tokens": 210149369.0, "step": 3340 }, { "entropy": 1.3445673748850822, "epoch": 0.49506779473159196, "grad_norm": 0.10701033473014832, "learning_rate": 5.050982710211319e-05, "loss": 1.0357, "mean_token_accuracy": 0.7391380302608013, "num_tokens": 210762484.0, "step": 3350 }, { "entropy": 1.318381641060114, "epoch": 0.49654560904422357, "grad_norm": 0.12191876024007797, "learning_rate": 5.036205113048619e-05, "loss": 0.992, "mean_token_accuracy": 0.7471228286623954, "num_tokens": 211400973.0, "step": 3360 }, { "entropy": 1.3595143400132657, "epoch": 0.49802342335685523, "grad_norm": 0.14100560545921326, "learning_rate": 5.021427515885917e-05, "loss": 1.0524, "mean_token_accuracy": 0.7343139186501503, "num_tokens": 212028494.0, "step": 3370 }, { "entropy": 1.3375087425112724, "epoch": 0.49950123766948684, "grad_norm": 0.11061199009418488, "learning_rate": 5.0066499187232164e-05, "loss": 1.0043, "mean_token_accuracy": 0.7437618337571621, "num_tokens": 212667189.0, "step": 3380 }, { "entropy": 1.3430921614170075, "epoch": 0.5009790519821185, "grad_norm": 0.11417815834283829, "learning_rate": 4.9918723215605145e-05, "loss": 1.0105, "mean_token_accuracy": 0.7393266052007675, "num_tokens": 213296769.0, "step": 3390 }, { "entropy": 1.3418936803936958, "epoch": 0.5024568662947501, "grad_norm": 0.12051557004451752, "learning_rate": 4.9770947243978133e-05, "loss": 1.0411, "mean_token_accuracy": 0.7347103841602802, "num_tokens": 213917765.0, "step": 3400 }, { "entropy": 1.3763892143964767, "epoch": 0.5039346806073817, "grad_norm": 0.1224110797047615, "learning_rate": 4.9623171272351115e-05, "loss": 1.0732, "mean_token_accuracy": 0.7312706559896469, "num_tokens": 214547796.0, "step": 3410 }, { "entropy": 1.332948635518551, "epoch": 0.5054124949200133, "grad_norm": 0.13498088717460632, "learning_rate": 4.94753953007241e-05, "loss": 1.0243, "mean_token_accuracy": 0.7391216315329074, "num_tokens": 215178078.0, "step": 3420 }, { "entropy": 1.3343242034316063, "epoch": 0.5068903092326449, "grad_norm": 0.10605301707983017, "learning_rate": 4.932761932909709e-05, "loss": 1.0012, "mean_token_accuracy": 0.7469499759376049, "num_tokens": 215832232.0, "step": 3430 }, { "entropy": 1.3277502968907355, "epoch": 0.5083681235452765, "grad_norm": 0.130407452583313, "learning_rate": 4.917984335747008e-05, "loss": 1.0263, "mean_token_accuracy": 0.7371391884982585, "num_tokens": 216462370.0, "step": 3440 }, { "entropy": 1.3561268150806427, "epoch": 0.5098459378579081, "grad_norm": 0.11962781101465225, "learning_rate": 4.903206738584307e-05, "loss": 1.0359, "mean_token_accuracy": 0.7392862103879452, "num_tokens": 217087857.0, "step": 3450 }, { "entropy": 1.328464537113905, "epoch": 0.5113237521705398, "grad_norm": 0.12519234418869019, "learning_rate": 4.888429141421605e-05, "loss": 1.0324, "mean_token_accuracy": 0.7398794747889041, "num_tokens": 217708160.0, "step": 3460 }, { "entropy": 1.3790725782513618, "epoch": 0.5128015664831714, "grad_norm": 0.12732987105846405, "learning_rate": 4.873651544258904e-05, "loss": 1.0761, "mean_token_accuracy": 0.7279979415237904, "num_tokens": 218321702.0, "step": 3470 }, { "entropy": 1.4037544824182988, "epoch": 0.514279380795803, "grad_norm": 0.11995565891265869, "learning_rate": 4.8588739470962026e-05, "loss": 1.0948, "mean_token_accuracy": 0.7246852949261665, "num_tokens": 218935590.0, "step": 3480 }, { "entropy": 1.326191857457161, "epoch": 0.5157571951084347, "grad_norm": 0.1153104230761528, "learning_rate": 4.8440963499335014e-05, "loss": 1.0094, "mean_token_accuracy": 0.7434732802212238, "num_tokens": 219569838.0, "step": 3490 }, { "entropy": 1.3592430077493192, "epoch": 0.5172350094210663, "grad_norm": 0.13453197479248047, "learning_rate": 4.8293187527707996e-05, "loss": 1.048, "mean_token_accuracy": 0.7330381028354168, "num_tokens": 220185249.0, "step": 3500 }, { "entropy": 1.3487900651991367, "epoch": 0.5187128237336979, "grad_norm": 0.13040119409561157, "learning_rate": 4.8145411556080984e-05, "loss": 1.0152, "mean_token_accuracy": 0.7400082737207413, "num_tokens": 220811253.0, "step": 3510 }, { "entropy": 1.3602138139307498, "epoch": 0.5201906380463295, "grad_norm": 0.11324775218963623, "learning_rate": 4.799763558445397e-05, "loss": 1.067, "mean_token_accuracy": 0.7322800144553184, "num_tokens": 221436414.0, "step": 3520 }, { "entropy": 1.3038682721555233, "epoch": 0.5216684523589611, "grad_norm": 0.11579470336437225, "learning_rate": 4.784985961282696e-05, "loss": 1.01, "mean_token_accuracy": 0.74277663230896, "num_tokens": 222059865.0, "step": 3530 }, { "entropy": 1.3233835257589817, "epoch": 0.5231462666715927, "grad_norm": 0.1281614601612091, "learning_rate": 4.770208364119994e-05, "loss": 1.0014, "mean_token_accuracy": 0.7457077689468861, "num_tokens": 222689051.0, "step": 3540 }, { "entropy": 1.3150438368320465, "epoch": 0.5246240809842243, "grad_norm": 0.13878072798252106, "learning_rate": 4.755430766957293e-05, "loss": 0.9982, "mean_token_accuracy": 0.7474694885313511, "num_tokens": 223298231.0, "step": 3550 }, { "entropy": 1.32702829092741, "epoch": 0.5261018952968559, "grad_norm": 0.10749702155590057, "learning_rate": 4.740653169794592e-05, "loss": 1.0136, "mean_token_accuracy": 0.7439944848418236, "num_tokens": 223925912.0, "step": 3560 }, { "entropy": 1.3148509785532951, "epoch": 0.5275797096094875, "grad_norm": 0.12064609676599503, "learning_rate": 4.7258755726318906e-05, "loss": 0.9995, "mean_token_accuracy": 0.7481425099074841, "num_tokens": 224571805.0, "step": 3570 }, { "entropy": 1.335060080140829, "epoch": 0.5290575239221191, "grad_norm": 0.13102136552333832, "learning_rate": 4.7110979754691895e-05, "loss": 0.9936, "mean_token_accuracy": 0.7448404133319855, "num_tokens": 225205299.0, "step": 3580 }, { "entropy": 1.3563662871718407, "epoch": 0.5305353382347509, "grad_norm": 0.12292468547821045, "learning_rate": 4.6963203783064876e-05, "loss": 1.0358, "mean_token_accuracy": 0.737770852446556, "num_tokens": 225832363.0, "step": 3590 }, { "entropy": 1.3766466073691845, "epoch": 0.5320131525473825, "grad_norm": 0.12831763923168182, "learning_rate": 4.6815427811437864e-05, "loss": 1.0347, "mean_token_accuracy": 0.7354536131024361, "num_tokens": 226465263.0, "step": 3600 }, { "entropy": 1.3112281516194344, "epoch": 0.5334909668600141, "grad_norm": 0.11866694688796997, "learning_rate": 4.666765183981085e-05, "loss": 0.9589, "mean_token_accuracy": 0.7530772976577282, "num_tokens": 227102673.0, "step": 3610 }, { "entropy": 1.3011863119900227, "epoch": 0.5349687811726457, "grad_norm": 0.1284829080104828, "learning_rate": 4.651987586818384e-05, "loss": 1.0065, "mean_token_accuracy": 0.7439219027757644, "num_tokens": 227738382.0, "step": 3620 }, { "entropy": 1.3390570774674415, "epoch": 0.5364465954852773, "grad_norm": 0.1170494556427002, "learning_rate": 4.637209989655682e-05, "loss": 0.9984, "mean_token_accuracy": 0.7461878538131714, "num_tokens": 228356674.0, "step": 3630 }, { "entropy": 1.3583289809525012, "epoch": 0.5379244097979089, "grad_norm": 0.14735782146453857, "learning_rate": 4.622432392492981e-05, "loss": 1.0268, "mean_token_accuracy": 0.7402130104601383, "num_tokens": 228974148.0, "step": 3640 }, { "entropy": 1.3334741026163102, "epoch": 0.5394022241105405, "grad_norm": 0.12460874766111374, "learning_rate": 4.60765479533028e-05, "loss": 1.0129, "mean_token_accuracy": 0.7437016226351261, "num_tokens": 229613351.0, "step": 3650 }, { "entropy": 1.3233090750873089, "epoch": 0.5408800384231721, "grad_norm": 0.10226025432348251, "learning_rate": 4.592877198167578e-05, "loss": 1.0117, "mean_token_accuracy": 0.7429285898804665, "num_tokens": 230255532.0, "step": 3660 }, { "entropy": 1.3184999868273735, "epoch": 0.5423578527358037, "grad_norm": 0.13753961026668549, "learning_rate": 4.578099601004877e-05, "loss": 1.0017, "mean_token_accuracy": 0.7435905501246453, "num_tokens": 230863024.0, "step": 3670 }, { "entropy": 1.3815899774432183, "epoch": 0.5438356670484353, "grad_norm": 0.12502948939800262, "learning_rate": 4.563322003842175e-05, "loss": 1.0751, "mean_token_accuracy": 0.7307036370038986, "num_tokens": 231506246.0, "step": 3680 }, { "entropy": 1.3200243420898914, "epoch": 0.5453134813610669, "grad_norm": 0.11456853896379471, "learning_rate": 4.548544406679474e-05, "loss": 1.0021, "mean_token_accuracy": 0.7433114424347878, "num_tokens": 232141778.0, "step": 3690 }, { "entropy": 1.297838745266199, "epoch": 0.5467912956736986, "grad_norm": 0.13101966679096222, "learning_rate": 4.5337668095167727e-05, "loss": 0.9982, "mean_token_accuracy": 0.7433498427271843, "num_tokens": 232801815.0, "step": 3700 }, { "entropy": 1.318327071517706, "epoch": 0.5482691099863303, "grad_norm": 0.14819857478141785, "learning_rate": 4.5189892123540715e-05, "loss": 1.0394, "mean_token_accuracy": 0.7365592263638974, "num_tokens": 233411245.0, "step": 3710 }, { "entropy": 1.3289685495197774, "epoch": 0.5497469242989619, "grad_norm": 0.1170542910695076, "learning_rate": 4.5042116151913696e-05, "loss": 0.9804, "mean_token_accuracy": 0.7477963097393513, "num_tokens": 234055712.0, "step": 3720 }, { "entropy": 1.3513706095516682, "epoch": 0.5512247386115935, "grad_norm": 0.1407993584871292, "learning_rate": 4.4894340180286684e-05, "loss": 1.0105, "mean_token_accuracy": 0.7453994438052177, "num_tokens": 234656067.0, "step": 3730 }, { "entropy": 1.3192792139947414, "epoch": 0.5527025529242251, "grad_norm": 0.11902996152639389, "learning_rate": 4.474656420865967e-05, "loss": 1.0293, "mean_token_accuracy": 0.7379258319735527, "num_tokens": 235276644.0, "step": 3740 }, { "entropy": 1.3451191641390323, "epoch": 0.5541803672368567, "grad_norm": 0.1200229600071907, "learning_rate": 4.459878823703266e-05, "loss": 1.0129, "mean_token_accuracy": 0.7419077165424823, "num_tokens": 235915640.0, "step": 3750 }, { "entropy": 1.341741495579481, "epoch": 0.5556581815494883, "grad_norm": 0.10994552075862885, "learning_rate": 4.445101226540564e-05, "loss": 1.051, "mean_token_accuracy": 0.7377764590084552, "num_tokens": 236568402.0, "step": 3760 }, { "entropy": 1.313062135130167, "epoch": 0.5571359958621199, "grad_norm": 0.10962233692407608, "learning_rate": 4.430323629377863e-05, "loss": 1.0147, "mean_token_accuracy": 0.7424600318074226, "num_tokens": 237197416.0, "step": 3770 }, { "entropy": 1.3273049861192703, "epoch": 0.5586138101747515, "grad_norm": 0.12473728507757187, "learning_rate": 4.415546032215162e-05, "loss": 1.0511, "mean_token_accuracy": 0.7336776547133923, "num_tokens": 237829704.0, "step": 3780 }, { "entropy": 1.3306392684578896, "epoch": 0.5600916244873831, "grad_norm": 0.11905784904956818, "learning_rate": 4.400768435052461e-05, "loss": 1.043, "mean_token_accuracy": 0.7365007124841213, "num_tokens": 238457474.0, "step": 3790 }, { "entropy": 1.3824568182229995, "epoch": 0.5615694388000148, "grad_norm": 0.12441007047891617, "learning_rate": 4.385990837889759e-05, "loss": 1.0776, "mean_token_accuracy": 0.7283789575099945, "num_tokens": 239098164.0, "step": 3800 }, { "entropy": 1.3517411895096303, "epoch": 0.5630472531126464, "grad_norm": 0.10452092438936234, "learning_rate": 4.371213240727058e-05, "loss": 1.0472, "mean_token_accuracy": 0.7371180124580861, "num_tokens": 239752501.0, "step": 3810 }, { "entropy": 1.3083030074834823, "epoch": 0.564525067425278, "grad_norm": 0.14152932167053223, "learning_rate": 4.3564356435643565e-05, "loss": 0.995, "mean_token_accuracy": 0.7436737760901451, "num_tokens": 240384011.0, "step": 3820 }, { "entropy": 1.3285958595573901, "epoch": 0.5660028817379096, "grad_norm": 0.11274420469999313, "learning_rate": 4.341658046401655e-05, "loss": 1.0192, "mean_token_accuracy": 0.738641119748354, "num_tokens": 240999874.0, "step": 3830 }, { "entropy": 1.2800329469144345, "epoch": 0.5674806960505413, "grad_norm": 0.11731458455324173, "learning_rate": 4.326880449238954e-05, "loss": 0.9824, "mean_token_accuracy": 0.7487463176250457, "num_tokens": 241640956.0, "step": 3840 }, { "entropy": 1.3452030673623085, "epoch": 0.5689585103631729, "grad_norm": 0.1167834997177124, "learning_rate": 4.312102852076252e-05, "loss": 1.0232, "mean_token_accuracy": 0.7404698729515076, "num_tokens": 242279933.0, "step": 3850 }, { "entropy": 1.3529712542891503, "epoch": 0.5704363246758045, "grad_norm": 0.1278751939535141, "learning_rate": 4.297325254913551e-05, "loss": 0.9995, "mean_token_accuracy": 0.7444183379411697, "num_tokens": 242922498.0, "step": 3860 }, { "entropy": 1.3116788499057292, "epoch": 0.5719141389884361, "grad_norm": 0.10567767918109894, "learning_rate": 4.28254765775085e-05, "loss": 1.0132, "mean_token_accuracy": 0.7404111728072167, "num_tokens": 243533542.0, "step": 3870 }, { "entropy": 1.3166671507060528, "epoch": 0.5733919533010677, "grad_norm": 0.1134534403681755, "learning_rate": 4.267770060588149e-05, "loss": 0.9807, "mean_token_accuracy": 0.7477494470775128, "num_tokens": 244160728.0, "step": 3880 }, { "entropy": 1.2959009833633899, "epoch": 0.5748697676136993, "grad_norm": 0.13303719460964203, "learning_rate": 4.252992463425447e-05, "loss": 0.9538, "mean_token_accuracy": 0.7553890861570836, "num_tokens": 244784452.0, "step": 3890 }, { "entropy": 1.3435784846544265, "epoch": 0.576347581926331, "grad_norm": 0.11970516294240952, "learning_rate": 4.238214866262746e-05, "loss": 1.044, "mean_token_accuracy": 0.7328359387814999, "num_tokens": 245415471.0, "step": 3900 }, { "entropy": 1.3250922329723835, "epoch": 0.5778253962389626, "grad_norm": 0.14801903069019318, "learning_rate": 4.2234372691000446e-05, "loss": 1.0151, "mean_token_accuracy": 0.7450727418065071, "num_tokens": 246051773.0, "step": 3910 }, { "entropy": 1.3530432641506196, "epoch": 0.5793032105515942, "grad_norm": 0.13875193893909454, "learning_rate": 4.2086596719373434e-05, "loss": 1.0107, "mean_token_accuracy": 0.7407213382422924, "num_tokens": 246673030.0, "step": 3920 }, { "entropy": 1.3028004743158816, "epoch": 0.5807810248642258, "grad_norm": 0.12098074704408646, "learning_rate": 4.1938820747746415e-05, "loss": 0.9957, "mean_token_accuracy": 0.7456411838531494, "num_tokens": 247301114.0, "step": 3930 }, { "entropy": 1.3270177111029624, "epoch": 0.5822588391768574, "grad_norm": 0.12103700637817383, "learning_rate": 4.1791044776119404e-05, "loss": 1.0168, "mean_token_accuracy": 0.7393665313720703, "num_tokens": 247925288.0, "step": 3940 }, { "entropy": 1.3316473290324211, "epoch": 0.583736653489489, "grad_norm": 0.11334571242332458, "learning_rate": 4.164326880449239e-05, "loss": 1.0246, "mean_token_accuracy": 0.7398273125290871, "num_tokens": 248563570.0, "step": 3950 }, { "entropy": 1.3447592370212078, "epoch": 0.5852144678021206, "grad_norm": 0.14425861835479736, "learning_rate": 4.149549283286538e-05, "loss": 1.0188, "mean_token_accuracy": 0.7414998419582843, "num_tokens": 249187118.0, "step": 3960 }, { "entropy": 1.3157505065202713, "epoch": 0.5866922821147523, "grad_norm": 0.1253083348274231, "learning_rate": 4.134771686123837e-05, "loss": 1.006, "mean_token_accuracy": 0.7437942959368229, "num_tokens": 249818795.0, "step": 3970 }, { "entropy": 1.3160997398197651, "epoch": 0.5881700964273839, "grad_norm": 0.14071162045001984, "learning_rate": 4.119994088961135e-05, "loss": 0.9944, "mean_token_accuracy": 0.7446533113718032, "num_tokens": 250442743.0, "step": 3980 }, { "entropy": 1.3181477546691895, "epoch": 0.5896479107400155, "grad_norm": 0.11922013759613037, "learning_rate": 4.105216491798434e-05, "loss": 1.0151, "mean_token_accuracy": 0.7434865787625313, "num_tokens": 251070828.0, "step": 3990 }, { "entropy": 1.3841412678360938, "epoch": 0.5911257250526472, "grad_norm": 0.12561756372451782, "learning_rate": 4.0904388946357326e-05, "loss": 1.0471, "mean_token_accuracy": 0.7363124743103981, "num_tokens": 251720365.0, "step": 4000 }, { "entropy": 1.3293801605701447, "epoch": 0.5926035393652788, "grad_norm": 0.12026660889387131, "learning_rate": 4.0756612974730315e-05, "loss": 0.9991, "mean_token_accuracy": 0.7464115582406521, "num_tokens": 252352493.0, "step": 4010 }, { "entropy": 1.3253483653068543, "epoch": 0.5940813536779104, "grad_norm": 0.1290450245141983, "learning_rate": 4.0608837003103296e-05, "loss": 0.9906, "mean_token_accuracy": 0.7443468227982522, "num_tokens": 252987335.0, "step": 4020 }, { "entropy": 1.274603036046028, "epoch": 0.595559167990542, "grad_norm": 0.1409289687871933, "learning_rate": 4.0461061031476284e-05, "loss": 0.9387, "mean_token_accuracy": 0.7586248151957988, "num_tokens": 253608440.0, "step": 4030 }, { "entropy": 1.346203289180994, "epoch": 0.5970369823031736, "grad_norm": 0.1403258740901947, "learning_rate": 4.031328505984927e-05, "loss": 1.0569, "mean_token_accuracy": 0.7334101386368275, "num_tokens": 254234368.0, "step": 4040 }, { "entropy": 1.3868733286857604, "epoch": 0.5985147966158052, "grad_norm": 0.12271698564291, "learning_rate": 4.016550908822226e-05, "loss": 1.0244, "mean_token_accuracy": 0.7363365158438683, "num_tokens": 254853431.0, "step": 4050 }, { "entropy": 1.363221886754036, "epoch": 0.5999926109284368, "grad_norm": 0.12163551896810532, "learning_rate": 4.001773311659525e-05, "loss": 1.074, "mean_token_accuracy": 0.7314470805227756, "num_tokens": 255453933.0, "step": 4060 }, { "entropy": 1.3116975866258145, "epoch": 0.6014704252410684, "grad_norm": 0.13113334774971008, "learning_rate": 3.986995714496823e-05, "loss": 0.9968, "mean_token_accuracy": 0.745627174526453, "num_tokens": 256080906.0, "step": 4070 }, { "entropy": 1.351020661741495, "epoch": 0.6029482395537, "grad_norm": 0.11195094883441925, "learning_rate": 3.972218117334122e-05, "loss": 1.0541, "mean_token_accuracy": 0.7320830643177032, "num_tokens": 256708275.0, "step": 4080 }, { "entropy": 1.306433204561472, "epoch": 0.6044260538663317, "grad_norm": 0.1212775856256485, "learning_rate": 3.957440520171421e-05, "loss": 0.9957, "mean_token_accuracy": 0.745367382466793, "num_tokens": 257354229.0, "step": 4090 }, { "entropy": 1.2912617072463035, "epoch": 0.6059038681789634, "grad_norm": 0.12214183807373047, "learning_rate": 3.9426629230087195e-05, "loss": 0.9587, "mean_token_accuracy": 0.7531531445682049, "num_tokens": 257972018.0, "step": 4100 }, { "entropy": 1.316209364682436, "epoch": 0.607381682491595, "grad_norm": 0.11024002730846405, "learning_rate": 3.927885325846018e-05, "loss": 1.0043, "mean_token_accuracy": 0.7449470959603787, "num_tokens": 258607359.0, "step": 4110 }, { "entropy": 1.2945946514606477, "epoch": 0.6088594968042266, "grad_norm": 0.1317119598388672, "learning_rate": 3.9131077286833165e-05, "loss": 0.9916, "mean_token_accuracy": 0.7498336635529995, "num_tokens": 259236898.0, "step": 4120 }, { "entropy": 1.3261870265007019, "epoch": 0.6103373111168582, "grad_norm": 0.11150126159191132, "learning_rate": 3.898330131520615e-05, "loss": 0.9936, "mean_token_accuracy": 0.7454674303531647, "num_tokens": 259865457.0, "step": 4130 }, { "entropy": 1.3262874715030193, "epoch": 0.6118151254294898, "grad_norm": 0.12116798758506775, "learning_rate": 3.8835525343579135e-05, "loss": 0.9764, "mean_token_accuracy": 0.748883631825447, "num_tokens": 260478748.0, "step": 4140 }, { "entropy": 1.3318323902785778, "epoch": 0.6132929397421214, "grad_norm": 0.11874970048666, "learning_rate": 3.868774937195212e-05, "loss": 0.9869, "mean_token_accuracy": 0.7489691562950611, "num_tokens": 261109091.0, "step": 4150 }, { "entropy": 1.294984768331051, "epoch": 0.614770754054753, "grad_norm": 0.13271567225456238, "learning_rate": 3.853997340032511e-05, "loss": 0.9784, "mean_token_accuracy": 0.7473281040787697, "num_tokens": 261729703.0, "step": 4160 }, { "entropy": 1.3404998533427714, "epoch": 0.6162485683673846, "grad_norm": 0.11501745134592056, "learning_rate": 3.839219742869809e-05, "loss": 1.032, "mean_token_accuracy": 0.7398579135537148, "num_tokens": 262345918.0, "step": 4170 }, { "entropy": 1.2984641678631306, "epoch": 0.6177263826800162, "grad_norm": 0.10657823830842972, "learning_rate": 3.824442145707108e-05, "loss": 0.9972, "mean_token_accuracy": 0.7439127787947655, "num_tokens": 262993350.0, "step": 4180 }, { "entropy": 1.3517408087849616, "epoch": 0.6192041969926478, "grad_norm": 0.13800758123397827, "learning_rate": 3.809664548544407e-05, "loss": 1.033, "mean_token_accuracy": 0.736748181283474, "num_tokens": 263615371.0, "step": 4190 }, { "entropy": 1.3334587171673775, "epoch": 0.6206820113052794, "grad_norm": 0.12172678112983704, "learning_rate": 3.794886951381705e-05, "loss": 1.0111, "mean_token_accuracy": 0.7427098996937275, "num_tokens": 264234097.0, "step": 4200 }, { "entropy": 1.362929881364107, "epoch": 0.622159825617911, "grad_norm": 0.13081179559230804, "learning_rate": 3.780109354219004e-05, "loss": 1.0356, "mean_token_accuracy": 0.7373303383588791, "num_tokens": 264863344.0, "step": 4210 }, { "entropy": 1.315098512172699, "epoch": 0.6236376399305428, "grad_norm": 0.11723612248897552, "learning_rate": 3.765331757056303e-05, "loss": 0.9869, "mean_token_accuracy": 0.7490851148962975, "num_tokens": 265499451.0, "step": 4220 }, { "entropy": 1.3551609128713609, "epoch": 0.6251154542431744, "grad_norm": 0.1283220797777176, "learning_rate": 3.7505541598936015e-05, "loss": 1.0368, "mean_token_accuracy": 0.7416560888290405, "num_tokens": 266130209.0, "step": 4230 }, { "entropy": 1.2948666542768479, "epoch": 0.626593268555806, "grad_norm": 0.13036693632602692, "learning_rate": 3.7357765627309e-05, "loss": 0.9835, "mean_token_accuracy": 0.7474061094224453, "num_tokens": 266763275.0, "step": 4240 }, { "entropy": 1.328162982314825, "epoch": 0.6280710828684376, "grad_norm": 0.12736549973487854, "learning_rate": 3.7209989655681985e-05, "loss": 0.9843, "mean_token_accuracy": 0.746946319192648, "num_tokens": 267392042.0, "step": 4250 }, { "entropy": 1.327622577548027, "epoch": 0.6295488971810692, "grad_norm": 0.13731716573238373, "learning_rate": 3.706221368405497e-05, "loss": 1.021, "mean_token_accuracy": 0.7412622094154357, "num_tokens": 268035196.0, "step": 4260 }, { "entropy": 1.3403167374432088, "epoch": 0.6310267114937008, "grad_norm": 0.1264178305864334, "learning_rate": 3.691443771242796e-05, "loss": 1.0396, "mean_token_accuracy": 0.7385567761957645, "num_tokens": 268641369.0, "step": 4270 }, { "entropy": 1.3581008620560169, "epoch": 0.6325045258063324, "grad_norm": 0.11115839332342148, "learning_rate": 3.676666174080094e-05, "loss": 1.0449, "mean_token_accuracy": 0.7357151411473751, "num_tokens": 269273142.0, "step": 4280 }, { "entropy": 1.2959826327860355, "epoch": 0.633982340118964, "grad_norm": 0.11848369240760803, "learning_rate": 3.661888576917393e-05, "loss": 0.9854, "mean_token_accuracy": 0.7469957664608955, "num_tokens": 269905326.0, "step": 4290 }, { "entropy": 1.3228461749851703, "epoch": 0.6354601544315956, "grad_norm": 0.12460760027170181, "learning_rate": 3.647110979754692e-05, "loss": 1.0073, "mean_token_accuracy": 0.7444317832589149, "num_tokens": 270545604.0, "step": 4300 }, { "entropy": 1.3390370070934297, "epoch": 0.6369379687442273, "grad_norm": 0.12076804786920547, "learning_rate": 3.632333382591991e-05, "loss": 1.0032, "mean_token_accuracy": 0.7412038818001747, "num_tokens": 271168533.0, "step": 4310 }, { "entropy": 1.3059133537113667, "epoch": 0.6384157830568589, "grad_norm": 0.11399949342012405, "learning_rate": 3.6175557854292896e-05, "loss": 0.9894, "mean_token_accuracy": 0.7461211532354355, "num_tokens": 271784029.0, "step": 4320 }, { "entropy": 1.3515030421316623, "epoch": 0.6398935973694905, "grad_norm": 0.15675301849842072, "learning_rate": 3.602778188266588e-05, "loss": 1.0325, "mean_token_accuracy": 0.7383571431040764, "num_tokens": 272407600.0, "step": 4330 }, { "entropy": 1.2898739270865918, "epoch": 0.6413714116821222, "grad_norm": 0.11768002063035965, "learning_rate": 3.5880005911038866e-05, "loss": 0.9787, "mean_token_accuracy": 0.7501869194209576, "num_tokens": 273036432.0, "step": 4340 }, { "entropy": 1.3185631178319455, "epoch": 0.6428492259947538, "grad_norm": 0.13108837604522705, "learning_rate": 3.5732229939411854e-05, "loss": 1.0022, "mean_token_accuracy": 0.7421830080449581, "num_tokens": 273649995.0, "step": 4350 }, { "entropy": 1.3045101426541805, "epoch": 0.6443270403073854, "grad_norm": 0.1088869646191597, "learning_rate": 3.558445396778484e-05, "loss": 0.9989, "mean_token_accuracy": 0.7463624097406865, "num_tokens": 274299257.0, "step": 4360 }, { "entropy": 1.3702871024608612, "epoch": 0.645804854620017, "grad_norm": 0.12465790659189224, "learning_rate": 3.5436677996157824e-05, "loss": 1.016, "mean_token_accuracy": 0.7393311135470867, "num_tokens": 274950163.0, "step": 4370 }, { "entropy": 1.296142727136612, "epoch": 0.6472826689326486, "grad_norm": 0.12053404748439789, "learning_rate": 3.528890202453081e-05, "loss": 0.97, "mean_token_accuracy": 0.749032299220562, "num_tokens": 275586098.0, "step": 4380 }, { "entropy": 1.3169789105653762, "epoch": 0.6487604832452802, "grad_norm": 0.1511235386133194, "learning_rate": 3.51411260529038e-05, "loss": 1.0044, "mean_token_accuracy": 0.7442675150930882, "num_tokens": 276221733.0, "step": 4390 }, { "entropy": 1.3407318077981472, "epoch": 0.6502382975579118, "grad_norm": 0.11825191974639893, "learning_rate": 3.499335008127679e-05, "loss": 1.0401, "mean_token_accuracy": 0.7368831485509872, "num_tokens": 276851809.0, "step": 4400 }, { "entropy": 1.3613334082067012, "epoch": 0.6517161118705435, "grad_norm": 0.12834398448467255, "learning_rate": 3.484557410964977e-05, "loss": 1.0636, "mean_token_accuracy": 0.7363037653267384, "num_tokens": 277486603.0, "step": 4410 }, { "entropy": 1.3078240409493447, "epoch": 0.6531939261831751, "grad_norm": 0.1147545874118805, "learning_rate": 3.469779813802276e-05, "loss": 1.0033, "mean_token_accuracy": 0.745844904333353, "num_tokens": 278106864.0, "step": 4420 }, { "entropy": 1.3462509505450726, "epoch": 0.6546717404958067, "grad_norm": 0.11914671957492828, "learning_rate": 3.4550022166395746e-05, "loss": 1.0053, "mean_token_accuracy": 0.7413943104445935, "num_tokens": 278739591.0, "step": 4430 }, { "entropy": 1.3763988889753818, "epoch": 0.6561495548084383, "grad_norm": 0.13147027790546417, "learning_rate": 3.4402246194768734e-05, "loss": 1.0524, "mean_token_accuracy": 0.7353928349912167, "num_tokens": 279376457.0, "step": 4440 }, { "entropy": 1.3218246966600418, "epoch": 0.6576273691210699, "grad_norm": 0.12028536945581436, "learning_rate": 3.425447022314172e-05, "loss": 1.0124, "mean_token_accuracy": 0.7395353779196739, "num_tokens": 279998105.0, "step": 4450 }, { "entropy": 1.3321923702955245, "epoch": 0.6591051834337015, "grad_norm": 0.13767987489700317, "learning_rate": 3.4106694251514704e-05, "loss": 1.0312, "mean_token_accuracy": 0.7353999748826027, "num_tokens": 280605980.0, "step": 4460 }, { "entropy": 1.338740762323141, "epoch": 0.6605829977463332, "grad_norm": 0.10273656249046326, "learning_rate": 3.395891827988769e-05, "loss": 1.0141, "mean_token_accuracy": 0.74061214402318, "num_tokens": 281240224.0, "step": 4470 }, { "entropy": 1.32241290807724, "epoch": 0.6620608120589648, "grad_norm": 0.142890065908432, "learning_rate": 3.381114230826068e-05, "loss": 0.9966, "mean_token_accuracy": 0.7456200569868088, "num_tokens": 281855831.0, "step": 4480 }, { "entropy": 1.3304771170020104, "epoch": 0.6635386263715964, "grad_norm": 0.1134033054113388, "learning_rate": 3.366336633663367e-05, "loss": 1.0015, "mean_token_accuracy": 0.7453427657485008, "num_tokens": 282485498.0, "step": 4490 }, { "entropy": 1.32518659979105, "epoch": 0.665016440684228, "grad_norm": 0.13597334921360016, "learning_rate": 3.351559036500665e-05, "loss": 1.0019, "mean_token_accuracy": 0.7464072823524475, "num_tokens": 283100980.0, "step": 4500 }, { "entropy": 1.3376376338303089, "epoch": 0.6664942549968597, "grad_norm": 0.12421192973852158, "learning_rate": 3.336781439337964e-05, "loss": 1.0566, "mean_token_accuracy": 0.735713567584753, "num_tokens": 283715839.0, "step": 4510 }, { "entropy": 1.3360460251569748, "epoch": 0.6679720693094913, "grad_norm": 0.1386958807706833, "learning_rate": 3.322003842175263e-05, "loss": 1.0178, "mean_token_accuracy": 0.7404295057058334, "num_tokens": 284345527.0, "step": 4520 }, { "entropy": 1.2704548306763173, "epoch": 0.6694498836221229, "grad_norm": 0.10363002866506577, "learning_rate": 3.3072262450125615e-05, "loss": 0.9487, "mean_token_accuracy": 0.7572251930832863, "num_tokens": 284968115.0, "step": 4530 }, { "entropy": 1.3422211334109306, "epoch": 0.6709276979347545, "grad_norm": 0.14423802495002747, "learning_rate": 3.2924486478498597e-05, "loss": 1.0459, "mean_token_accuracy": 0.7374594822525978, "num_tokens": 285590307.0, "step": 4540 }, { "entropy": 1.371665420383215, "epoch": 0.6724055122473861, "grad_norm": 0.12783068418502808, "learning_rate": 3.2776710506871585e-05, "loss": 1.0502, "mean_token_accuracy": 0.7360943183302879, "num_tokens": 286201394.0, "step": 4550 }, { "entropy": 1.3077406004071235, "epoch": 0.6738833265600177, "grad_norm": 0.12808766961097717, "learning_rate": 3.262893453524457e-05, "loss": 1.0083, "mean_token_accuracy": 0.7429508715867996, "num_tokens": 286835325.0, "step": 4560 }, { "entropy": 1.364883267134428, "epoch": 0.6753611408726493, "grad_norm": 0.1129937618970871, "learning_rate": 3.248115856361756e-05, "loss": 1.0738, "mean_token_accuracy": 0.7299041479825974, "num_tokens": 287480242.0, "step": 4570 }, { "entropy": 1.3169206887483598, "epoch": 0.6768389551852809, "grad_norm": 0.12290552258491516, "learning_rate": 3.233338259199055e-05, "loss": 1.0174, "mean_token_accuracy": 0.7412481807172299, "num_tokens": 288132348.0, "step": 4580 }, { "entropy": 1.3177730686962605, "epoch": 0.6783167694979126, "grad_norm": 0.1399271935224533, "learning_rate": 3.218560662036353e-05, "loss": 1.0184, "mean_token_accuracy": 0.740997476130724, "num_tokens": 288738626.0, "step": 4590 }, { "entropy": 1.331467841565609, "epoch": 0.6797945838105443, "grad_norm": 0.12841732800006866, "learning_rate": 3.203783064873652e-05, "loss": 0.9855, "mean_token_accuracy": 0.7499361656606197, "num_tokens": 289372236.0, "step": 4600 }, { "entropy": 1.3721258901059628, "epoch": 0.6812723981231759, "grad_norm": 0.12660683691501617, "learning_rate": 3.189005467710951e-05, "loss": 1.0779, "mean_token_accuracy": 0.7270358420908452, "num_tokens": 289973137.0, "step": 4610 }, { "entropy": 1.3067141421139241, "epoch": 0.6827502124358075, "grad_norm": 0.11172041296958923, "learning_rate": 3.174227870548249e-05, "loss": 0.9463, "mean_token_accuracy": 0.7545724369585514, "num_tokens": 290621450.0, "step": 4620 }, { "entropy": 1.3762259379029274, "epoch": 0.6842280267484391, "grad_norm": 0.11443869769573212, "learning_rate": 3.159450273385548e-05, "loss": 1.0864, "mean_token_accuracy": 0.7282682999968528, "num_tokens": 291255096.0, "step": 4630 }, { "entropy": 1.354401236027479, "epoch": 0.6857058410610707, "grad_norm": 0.13201551139354706, "learning_rate": 3.1446726762228465e-05, "loss": 1.0235, "mean_token_accuracy": 0.7380030490458012, "num_tokens": 291876041.0, "step": 4640 }, { "entropy": 1.2984419390559196, "epoch": 0.6871836553737023, "grad_norm": 0.11332850158214569, "learning_rate": 3.129895079060145e-05, "loss": 1.0052, "mean_token_accuracy": 0.7450248651206494, "num_tokens": 292514791.0, "step": 4650 }, { "entropy": 1.332960170507431, "epoch": 0.6886614696863339, "grad_norm": 0.13389021158218384, "learning_rate": 3.1151174818974435e-05, "loss": 0.9958, "mean_token_accuracy": 0.7439567111432552, "num_tokens": 293148361.0, "step": 4660 }, { "entropy": 1.3010660000145435, "epoch": 0.6901392839989655, "grad_norm": 0.12451417744159698, "learning_rate": 3.100339884734742e-05, "loss": 0.9849, "mean_token_accuracy": 0.7485992729663848, "num_tokens": 293773190.0, "step": 4670 }, { "entropy": 1.3693323209881783, "epoch": 0.6916170983115971, "grad_norm": 0.14361348748207092, "learning_rate": 3.0855622875720405e-05, "loss": 1.0616, "mean_token_accuracy": 0.7298278719186783, "num_tokens": 294388572.0, "step": 4680 }, { "entropy": 1.3226823516190052, "epoch": 0.6930949126242287, "grad_norm": 0.12352283298969269, "learning_rate": 3.070784690409339e-05, "loss": 1.016, "mean_token_accuracy": 0.739595515280962, "num_tokens": 295015634.0, "step": 4690 }, { "entropy": 1.3062335178256035, "epoch": 0.6945727269368603, "grad_norm": 0.11143922060728073, "learning_rate": 3.056007093246638e-05, "loss": 0.9872, "mean_token_accuracy": 0.7466958984732628, "num_tokens": 295654251.0, "step": 4700 }, { "entropy": 1.2809455893933772, "epoch": 0.696050541249492, "grad_norm": 0.10888683795928955, "learning_rate": 3.0412294960839373e-05, "loss": 0.9587, "mean_token_accuracy": 0.7509395398199559, "num_tokens": 296290910.0, "step": 4710 }, { "entropy": 1.3530108958482743, "epoch": 0.6975283555621237, "grad_norm": 0.1329011619091034, "learning_rate": 3.0264518989212354e-05, "loss": 1.0061, "mean_token_accuracy": 0.7433172650635242, "num_tokens": 296909724.0, "step": 4720 }, { "entropy": 1.3416468262672425, "epoch": 0.6990061698747553, "grad_norm": 0.11271080374717712, "learning_rate": 3.0116743017585343e-05, "loss": 1.0143, "mean_token_accuracy": 0.7415925867855548, "num_tokens": 297535996.0, "step": 4730 }, { "entropy": 1.3463890179991722, "epoch": 0.7004839841873869, "grad_norm": 0.14932890236377716, "learning_rate": 2.996896704595833e-05, "loss": 1.0562, "mean_token_accuracy": 0.732879837602377, "num_tokens": 298163564.0, "step": 4740 }, { "entropy": 1.3371880792081356, "epoch": 0.7019617985000185, "grad_norm": 0.14559057354927063, "learning_rate": 2.9821191074331316e-05, "loss": 1.0516, "mean_token_accuracy": 0.7364227913320065, "num_tokens": 298794213.0, "step": 4750 }, { "entropy": 1.3115318283438682, "epoch": 0.7034396128126501, "grad_norm": 0.12408871203660965, "learning_rate": 2.96734151027043e-05, "loss": 1.011, "mean_token_accuracy": 0.7429202817380428, "num_tokens": 299435315.0, "step": 4760 }, { "entropy": 1.323327000439167, "epoch": 0.7049174271252817, "grad_norm": 0.1299198865890503, "learning_rate": 2.952563913107729e-05, "loss": 1.0114, "mean_token_accuracy": 0.741088104993105, "num_tokens": 300060042.0, "step": 4770 }, { "entropy": 1.3446701981127263, "epoch": 0.7063952414379133, "grad_norm": 0.14076866209506989, "learning_rate": 2.9377863159450274e-05, "loss": 0.9905, "mean_token_accuracy": 0.7466110914945603, "num_tokens": 300651338.0, "step": 4780 }, { "entropy": 1.3259353674948215, "epoch": 0.7078730557505449, "grad_norm": 0.10263624042272568, "learning_rate": 2.9230087187823262e-05, "loss": 1.0346, "mean_token_accuracy": 0.7375701159238816, "num_tokens": 301304034.0, "step": 4790 }, { "entropy": 1.3674908801913261, "epoch": 0.7093508700631765, "grad_norm": 0.12330764532089233, "learning_rate": 2.9082311216196247e-05, "loss": 1.0602, "mean_token_accuracy": 0.7365720339119435, "num_tokens": 301923306.0, "step": 4800 }, { "entropy": 1.3329905986785888, "epoch": 0.7108286843758082, "grad_norm": 0.134576216340065, "learning_rate": 2.893453524456923e-05, "loss": 1.0265, "mean_token_accuracy": 0.7412666134536267, "num_tokens": 302545691.0, "step": 4810 }, { "entropy": 1.3309357464313507, "epoch": 0.7123064986884398, "grad_norm": 0.12007878720760345, "learning_rate": 2.878675927294222e-05, "loss": 0.9783, "mean_token_accuracy": 0.745373184978962, "num_tokens": 303181147.0, "step": 4820 }, { "entropy": 1.3643394075334072, "epoch": 0.7137843130010714, "grad_norm": 0.136694073677063, "learning_rate": 2.8638983301315208e-05, "loss": 1.03, "mean_token_accuracy": 0.7360346958041191, "num_tokens": 303772203.0, "step": 4830 }, { "entropy": 1.2909266255795955, "epoch": 0.715262127313703, "grad_norm": 0.1237269937992096, "learning_rate": 2.8491207329688196e-05, "loss": 0.9847, "mean_token_accuracy": 0.7457400150597095, "num_tokens": 304400205.0, "step": 4840 }, { "entropy": 1.318508828431368, "epoch": 0.7167399416263347, "grad_norm": 0.1296572983264923, "learning_rate": 2.8343431358061178e-05, "loss": 0.9943, "mean_token_accuracy": 0.7424058385193348, "num_tokens": 305034154.0, "step": 4850 }, { "entropy": 1.3280914664268493, "epoch": 0.7182177559389663, "grad_norm": 0.10831849277019501, "learning_rate": 2.8195655386434166e-05, "loss": 1.0024, "mean_token_accuracy": 0.7443806000053883, "num_tokens": 305660112.0, "step": 4860 }, { "entropy": 1.345757918804884, "epoch": 0.7196955702515979, "grad_norm": 0.15830285847187042, "learning_rate": 2.8047879414807154e-05, "loss": 1.0241, "mean_token_accuracy": 0.7413417495787143, "num_tokens": 306284169.0, "step": 4870 }, { "entropy": 1.326023256033659, "epoch": 0.7211733845642295, "grad_norm": 0.12437301874160767, "learning_rate": 2.7900103443180143e-05, "loss": 1.0236, "mean_token_accuracy": 0.7441856421530246, "num_tokens": 306925573.0, "step": 4880 }, { "entropy": 1.3403374791145324, "epoch": 0.7226511988768611, "grad_norm": 0.14862604439258575, "learning_rate": 2.7752327471553124e-05, "loss": 1.0126, "mean_token_accuracy": 0.7417874552309514, "num_tokens": 307552556.0, "step": 4890 }, { "entropy": 1.3029513664543628, "epoch": 0.7241290131894927, "grad_norm": 0.14984281361103058, "learning_rate": 2.7604551499926112e-05, "loss": 0.9913, "mean_token_accuracy": 0.7468802168965339, "num_tokens": 308192975.0, "step": 4900 }, { "entropy": 1.323684511333704, "epoch": 0.7256068275021244, "grad_norm": 0.16719244420528412, "learning_rate": 2.74567755282991e-05, "loss": 1.014, "mean_token_accuracy": 0.7450279243290424, "num_tokens": 308790136.0, "step": 4910 }, { "entropy": 1.3346189700067044, "epoch": 0.727084641814756, "grad_norm": 0.13141213357448578, "learning_rate": 2.730899955667209e-05, "loss": 1.051, "mean_token_accuracy": 0.7325736321508884, "num_tokens": 309412957.0, "step": 4920 }, { "entropy": 1.307160697877407, "epoch": 0.7285624561273876, "grad_norm": 0.1185912936925888, "learning_rate": 2.716122358504507e-05, "loss": 0.9784, "mean_token_accuracy": 0.7491277985274791, "num_tokens": 310040700.0, "step": 4930 }, { "entropy": 1.3605231955647468, "epoch": 0.7300402704400192, "grad_norm": 0.11863730102777481, "learning_rate": 2.701344761341806e-05, "loss": 1.0576, "mean_token_accuracy": 0.7326734766364098, "num_tokens": 310657828.0, "step": 4940 }, { "entropy": 1.299007173627615, "epoch": 0.7315180847526508, "grad_norm": 0.11598937213420868, "learning_rate": 2.6865671641791047e-05, "loss": 0.9913, "mean_token_accuracy": 0.749681244045496, "num_tokens": 311288566.0, "step": 4950 }, { "entropy": 1.2920017048716546, "epoch": 0.7329958990652824, "grad_norm": 0.12922370433807373, "learning_rate": 2.6717895670164035e-05, "loss": 0.9955, "mean_token_accuracy": 0.7468885749578476, "num_tokens": 311933827.0, "step": 4960 }, { "entropy": 1.3599808380007743, "epoch": 0.7344737133779141, "grad_norm": 0.12107284367084503, "learning_rate": 2.6570119698537023e-05, "loss": 1.0425, "mean_token_accuracy": 0.7379572823643684, "num_tokens": 312558228.0, "step": 4970 }, { "entropy": 1.3698449276387692, "epoch": 0.7359515276905457, "grad_norm": 0.11487340927124023, "learning_rate": 2.6422343726910005e-05, "loss": 1.0617, "mean_token_accuracy": 0.7336210198700428, "num_tokens": 313183926.0, "step": 4980 }, { "entropy": 1.346721203625202, "epoch": 0.7374293420031773, "grad_norm": 0.1212073564529419, "learning_rate": 2.6274567755282993e-05, "loss": 1.0296, "mean_token_accuracy": 0.739198499917984, "num_tokens": 313820949.0, "step": 4990 }, { "entropy": 1.3611103758215903, "epoch": 0.7389071563158089, "grad_norm": 0.12863674759864807, "learning_rate": 2.612679178365598e-05, "loss": 1.0377, "mean_token_accuracy": 0.7381574101746082, "num_tokens": 314436283.0, "step": 5000 }, { "entropy": 1.325782622396946, "epoch": 0.7403849706284406, "grad_norm": 0.118117555975914, "learning_rate": 2.5979015812028966e-05, "loss": 1.0518, "mean_token_accuracy": 0.7347126387059688, "num_tokens": 315058652.0, "step": 5010 }, { "entropy": 1.3325309082865715, "epoch": 0.7418627849410722, "grad_norm": 0.12454936653375626, "learning_rate": 2.583123984040195e-05, "loss": 1.0319, "mean_token_accuracy": 0.7397500842809677, "num_tokens": 315701496.0, "step": 5020 }, { "entropy": 1.2837858386337757, "epoch": 0.7433405992537038, "grad_norm": 0.12542617321014404, "learning_rate": 2.568346386877494e-05, "loss": 0.9858, "mean_token_accuracy": 0.7501832038164139, "num_tokens": 316331247.0, "step": 5030 }, { "entropy": 1.3427621588110923, "epoch": 0.7448184135663354, "grad_norm": 0.12836028635501862, "learning_rate": 2.5535687897147924e-05, "loss": 1.038, "mean_token_accuracy": 0.7358950592577458, "num_tokens": 316946786.0, "step": 5040 }, { "entropy": 1.3334973461925983, "epoch": 0.746296227878967, "grad_norm": 0.14334280788898468, "learning_rate": 2.5387911925520912e-05, "loss": 1.0219, "mean_token_accuracy": 0.7420683093369007, "num_tokens": 317590282.0, "step": 5050 }, { "entropy": 1.316165641695261, "epoch": 0.7477740421915986, "grad_norm": 0.1569705754518509, "learning_rate": 2.5240135953893894e-05, "loss": 1.006, "mean_token_accuracy": 0.7437090836465359, "num_tokens": 318210626.0, "step": 5060 }, { "entropy": 1.3033836044371128, "epoch": 0.7492518565042302, "grad_norm": 0.10642680525779724, "learning_rate": 2.5092359982266882e-05, "loss": 0.9893, "mean_token_accuracy": 0.7470180414617061, "num_tokens": 318831662.0, "step": 5070 }, { "entropy": 1.3135450080037117, "epoch": 0.7507296708168618, "grad_norm": 0.1242324709892273, "learning_rate": 2.494458401063987e-05, "loss": 0.9842, "mean_token_accuracy": 0.748679618537426, "num_tokens": 319460678.0, "step": 5080 }, { "entropy": 1.3217751324176787, "epoch": 0.7522074851294934, "grad_norm": 0.1090734452009201, "learning_rate": 2.479680803901286e-05, "loss": 0.9882, "mean_token_accuracy": 0.7465294934809208, "num_tokens": 320080140.0, "step": 5090 }, { "entropy": 1.3406529314815998, "epoch": 0.7536852994421251, "grad_norm": 0.12375643849372864, "learning_rate": 2.4649032067385843e-05, "loss": 1.0267, "mean_token_accuracy": 0.7397718273103238, "num_tokens": 320705386.0, "step": 5100 }, { "entropy": 1.3804366782307624, "epoch": 0.7551631137547568, "grad_norm": 0.13206851482391357, "learning_rate": 2.450125609575883e-05, "loss": 1.0535, "mean_token_accuracy": 0.736749055236578, "num_tokens": 321347044.0, "step": 5110 }, { "entropy": 1.3584469094872476, "epoch": 0.7566409280673884, "grad_norm": 0.10561691224575043, "learning_rate": 2.4353480124131816e-05, "loss": 1.0408, "mean_token_accuracy": 0.7360177867114543, "num_tokens": 321978971.0, "step": 5120 }, { "entropy": 1.306953214108944, "epoch": 0.75811874238002, "grad_norm": 0.12143130600452423, "learning_rate": 2.4205704152504805e-05, "loss": 0.9998, "mean_token_accuracy": 0.7445025816559792, "num_tokens": 322613865.0, "step": 5130 }, { "entropy": 1.3641792319715023, "epoch": 0.7595965566926516, "grad_norm": 0.12223450094461441, "learning_rate": 2.405792818087779e-05, "loss": 1.0387, "mean_token_accuracy": 0.7379502311348916, "num_tokens": 323247464.0, "step": 5140 }, { "entropy": 1.3081051871180533, "epoch": 0.7610743710052832, "grad_norm": 0.13382208347320557, "learning_rate": 2.3910152209250778e-05, "loss": 1.0069, "mean_token_accuracy": 0.742257046699524, "num_tokens": 323867041.0, "step": 5150 }, { "entropy": 1.3398429796099662, "epoch": 0.7625521853179148, "grad_norm": 0.11734897643327713, "learning_rate": 2.3762376237623762e-05, "loss": 1.0501, "mean_token_accuracy": 0.7373069517314434, "num_tokens": 324503667.0, "step": 5160 }, { "entropy": 1.2856581561267375, "epoch": 0.7640299996305464, "grad_norm": 0.11487198621034622, "learning_rate": 2.361460026599675e-05, "loss": 0.9925, "mean_token_accuracy": 0.7459338754415512, "num_tokens": 325152511.0, "step": 5170 }, { "entropy": 1.3095781721174717, "epoch": 0.765507813943178, "grad_norm": 0.11295847594738007, "learning_rate": 2.3466824294369736e-05, "loss": 0.9761, "mean_token_accuracy": 0.7487106472253799, "num_tokens": 325773003.0, "step": 5180 }, { "entropy": 1.3086177356541158, "epoch": 0.7669856282558096, "grad_norm": 0.1418120115995407, "learning_rate": 2.3319048322742724e-05, "loss": 1.009, "mean_token_accuracy": 0.7405801028013229, "num_tokens": 326416846.0, "step": 5190 }, { "entropy": 1.3360229194164277, "epoch": 0.7684634425684412, "grad_norm": 0.1305115967988968, "learning_rate": 2.3171272351115712e-05, "loss": 1.0385, "mean_token_accuracy": 0.7389066144824028, "num_tokens": 327049923.0, "step": 5200 }, { "entropy": 1.3275974862277509, "epoch": 0.7699412568810728, "grad_norm": 0.1303836554288864, "learning_rate": 2.3023496379488697e-05, "loss": 0.9939, "mean_token_accuracy": 0.7476765356957913, "num_tokens": 327690605.0, "step": 5210 }, { "entropy": 1.307869978994131, "epoch": 0.7714190711937046, "grad_norm": 0.12129199504852295, "learning_rate": 2.2875720407861685e-05, "loss": 0.9909, "mean_token_accuracy": 0.7462148115038871, "num_tokens": 328317712.0, "step": 5220 }, { "entropy": 1.3123974323272705, "epoch": 0.7728968855063362, "grad_norm": 0.11937498301267624, "learning_rate": 2.272794443623467e-05, "loss": 1.003, "mean_token_accuracy": 0.7446192368865013, "num_tokens": 328941674.0, "step": 5230 }, { "entropy": 1.3761452838778496, "epoch": 0.7743746998189678, "grad_norm": 0.10988405346870422, "learning_rate": 2.2580168464607658e-05, "loss": 1.0635, "mean_token_accuracy": 0.734012907743454, "num_tokens": 329584137.0, "step": 5240 }, { "entropy": 1.2854306407272815, "epoch": 0.7758525141315994, "grad_norm": 0.1544429361820221, "learning_rate": 2.2432392492980643e-05, "loss": 0.9576, "mean_token_accuracy": 0.7528227671980858, "num_tokens": 330220795.0, "step": 5250 }, { "entropy": 1.304028608649969, "epoch": 0.777330328444231, "grad_norm": 0.12517547607421875, "learning_rate": 2.2284616521353628e-05, "loss": 0.9754, "mean_token_accuracy": 0.7507062517106533, "num_tokens": 330845075.0, "step": 5260 }, { "entropy": 1.3103728748857975, "epoch": 0.7788081427568626, "grad_norm": 0.13300468027591705, "learning_rate": 2.2136840549726616e-05, "loss": 0.9936, "mean_token_accuracy": 0.7502763822674752, "num_tokens": 331461903.0, "step": 5270 }, { "entropy": 1.3418636083602906, "epoch": 0.7802859570694942, "grad_norm": 0.10688610374927521, "learning_rate": 2.19890645780996e-05, "loss": 1.0603, "mean_token_accuracy": 0.7354485787451267, "num_tokens": 332098250.0, "step": 5280 }, { "entropy": 1.3413996249437332, "epoch": 0.7817637713821258, "grad_norm": 0.11547284573316574, "learning_rate": 2.1841288606472586e-05, "loss": 1.0183, "mean_token_accuracy": 0.7401676058769227, "num_tokens": 332738973.0, "step": 5290 }, { "entropy": 1.2956015571951867, "epoch": 0.7832415856947574, "grad_norm": 0.14867275953292847, "learning_rate": 2.1693512634845574e-05, "loss": 0.9968, "mean_token_accuracy": 0.7482645206153393, "num_tokens": 333374842.0, "step": 5300 }, { "entropy": 1.3352750092744827, "epoch": 0.784719400007389, "grad_norm": 0.12308944761753082, "learning_rate": 2.154573666321856e-05, "loss": 1.0076, "mean_token_accuracy": 0.7402734778821468, "num_tokens": 333996081.0, "step": 5310 }, { "entropy": 1.3263126194477082, "epoch": 0.7861972143200207, "grad_norm": 0.12351057678461075, "learning_rate": 2.1397960691591547e-05, "loss": 1.0328, "mean_token_accuracy": 0.7401689246296883, "num_tokens": 334631011.0, "step": 5320 }, { "entropy": 1.3505345225334167, "epoch": 0.7876750286326523, "grad_norm": 0.11376931518316269, "learning_rate": 2.1250184719964535e-05, "loss": 1.0127, "mean_token_accuracy": 0.7426583305001259, "num_tokens": 335261549.0, "step": 5330 }, { "entropy": 1.3594610929489135, "epoch": 0.7891528429452839, "grad_norm": 0.12028499692678452, "learning_rate": 2.110240874833752e-05, "loss": 1.041, "mean_token_accuracy": 0.7349088214337826, "num_tokens": 335894829.0, "step": 5340 }, { "entropy": 1.3063403144478798, "epoch": 0.7906306572579156, "grad_norm": 0.11505310237407684, "learning_rate": 2.095463277671051e-05, "loss": 0.9889, "mean_token_accuracy": 0.7459150403738022, "num_tokens": 336534149.0, "step": 5350 }, { "entropy": 1.2942039281129838, "epoch": 0.7921084715705472, "grad_norm": 0.12102124094963074, "learning_rate": 2.0806856805083493e-05, "loss": 1.0047, "mean_token_accuracy": 0.7467892125248909, "num_tokens": 337167728.0, "step": 5360 }, { "entropy": 1.3099549762904643, "epoch": 0.7935862858831788, "grad_norm": 0.12091784179210663, "learning_rate": 2.065908083345648e-05, "loss": 0.9749, "mean_token_accuracy": 0.7508032590150833, "num_tokens": 337792094.0, "step": 5370 }, { "entropy": 1.3193748205900193, "epoch": 0.7950641001958104, "grad_norm": 0.12178395688533783, "learning_rate": 2.0511304861829467e-05, "loss": 0.9837, "mean_token_accuracy": 0.744479450583458, "num_tokens": 338402403.0, "step": 5380 }, { "entropy": 1.2912467263638974, "epoch": 0.796541914508442, "grad_norm": 0.11095555126667023, "learning_rate": 2.0363528890202455e-05, "loss": 0.9777, "mean_token_accuracy": 0.7510395921766758, "num_tokens": 339051452.0, "step": 5390 }, { "entropy": 1.3539048105478286, "epoch": 0.7980197288210736, "grad_norm": 0.11416377872228622, "learning_rate": 2.021575291857544e-05, "loss": 1.0417, "mean_token_accuracy": 0.7391513310372829, "num_tokens": 339688617.0, "step": 5400 }, { "entropy": 1.3722274094820022, "epoch": 0.7994975431337052, "grad_norm": 0.13663271069526672, "learning_rate": 2.0067976946948428e-05, "loss": 1.0616, "mean_token_accuracy": 0.7323425568640232, "num_tokens": 340327723.0, "step": 5410 }, { "entropy": 1.3680840730667114, "epoch": 0.8009753574463369, "grad_norm": 0.12302777916193008, "learning_rate": 1.9920200975321413e-05, "loss": 1.0086, "mean_token_accuracy": 0.7418931379914284, "num_tokens": 340943329.0, "step": 5420 }, { "entropy": 1.3484257988631725, "epoch": 0.8024531717589685, "grad_norm": 0.14521946012973785, "learning_rate": 1.97724250036944e-05, "loss": 1.0415, "mean_token_accuracy": 0.7372381918132305, "num_tokens": 341583436.0, "step": 5430 }, { "entropy": 1.3435696944594384, "epoch": 0.8039309860716001, "grad_norm": 0.13386188447475433, "learning_rate": 1.962464903206739e-05, "loss": 1.0508, "mean_token_accuracy": 0.7391325704753399, "num_tokens": 342215207.0, "step": 5440 }, { "entropy": 1.3138762816786766, "epoch": 0.8054088003842317, "grad_norm": 0.13170363008975983, "learning_rate": 1.9476873060440374e-05, "loss": 0.9789, "mean_token_accuracy": 0.7494944863021373, "num_tokens": 342842134.0, "step": 5450 }, { "entropy": 1.3419123955070973, "epoch": 0.8068866146968633, "grad_norm": 0.1314888894557953, "learning_rate": 1.9329097088813362e-05, "loss": 1.0312, "mean_token_accuracy": 0.7364721618592739, "num_tokens": 343466230.0, "step": 5460 }, { "entropy": 1.3453618548810482, "epoch": 0.808364429009495, "grad_norm": 0.11651881039142609, "learning_rate": 1.9181321117186347e-05, "loss": 1.0159, "mean_token_accuracy": 0.7454579032957553, "num_tokens": 344096356.0, "step": 5470 }, { "entropy": 1.2968750067055226, "epoch": 0.8098422433221266, "grad_norm": 0.13125477731227875, "learning_rate": 1.9033545145559335e-05, "loss": 0.9813, "mean_token_accuracy": 0.7480554945766926, "num_tokens": 344723865.0, "step": 5480 }, { "entropy": 1.3539662800729275, "epoch": 0.8113200576347582, "grad_norm": 0.11619358509778976, "learning_rate": 1.888576917393232e-05, "loss": 1.0111, "mean_token_accuracy": 0.7425602056086064, "num_tokens": 345334991.0, "step": 5490 }, { "entropy": 1.335629913955927, "epoch": 0.8127978719473898, "grad_norm": 0.14460872113704681, "learning_rate": 1.8737993202305305e-05, "loss": 1.0497, "mean_token_accuracy": 0.7352975860238076, "num_tokens": 345982288.0, "step": 5500 }, { "entropy": 1.3496653221547603, "epoch": 0.8142756862600214, "grad_norm": 0.12175831943750381, "learning_rate": 1.8590217230678293e-05, "loss": 1.0396, "mean_token_accuracy": 0.7365844771265984, "num_tokens": 346595072.0, "step": 5510 }, { "entropy": 1.341681607067585, "epoch": 0.8157535005726531, "grad_norm": 0.12488234788179398, "learning_rate": 1.8442441259051278e-05, "loss": 1.0372, "mean_token_accuracy": 0.7352021165192127, "num_tokens": 347209675.0, "step": 5520 }, { "entropy": 1.337549727410078, "epoch": 0.8172313148852847, "grad_norm": 0.12194401770830154, "learning_rate": 1.8294665287424263e-05, "loss": 1.0578, "mean_token_accuracy": 0.7347122609615326, "num_tokens": 347835705.0, "step": 5530 }, { "entropy": 1.303477893769741, "epoch": 0.8187091291979163, "grad_norm": 0.12405266612768173, "learning_rate": 1.814688931579725e-05, "loss": 0.9994, "mean_token_accuracy": 0.7478441722691059, "num_tokens": 348468668.0, "step": 5540 }, { "entropy": 1.3249061562120914, "epoch": 0.8201869435105479, "grad_norm": 0.12435730546712875, "learning_rate": 1.7999113344170236e-05, "loss": 1.0061, "mean_token_accuracy": 0.7447381973266601, "num_tokens": 349081142.0, "step": 5550 }, { "entropy": 1.35750472843647, "epoch": 0.8216647578231795, "grad_norm": 0.1328584998846054, "learning_rate": 1.7851337372543224e-05, "loss": 1.0088, "mean_token_accuracy": 0.7452337816357613, "num_tokens": 349720126.0, "step": 5560 }, { "entropy": 1.3538759835064411, "epoch": 0.8231425721358111, "grad_norm": 0.14198720455169678, "learning_rate": 1.7703561400916213e-05, "loss": 1.0484, "mean_token_accuracy": 0.7349992088973523, "num_tokens": 350359275.0, "step": 5570 }, { "entropy": 1.311447235196829, "epoch": 0.8246203864484427, "grad_norm": 0.12205838412046432, "learning_rate": 1.7555785429289197e-05, "loss": 0.9965, "mean_token_accuracy": 0.7460118442773819, "num_tokens": 350982085.0, "step": 5580 }, { "entropy": 1.2985078655183315, "epoch": 0.8260982007610743, "grad_norm": 0.13054905831813812, "learning_rate": 1.7408009457662186e-05, "loss": 0.9652, "mean_token_accuracy": 0.750285355746746, "num_tokens": 351617043.0, "step": 5590 }, { "entropy": 1.3172591648995877, "epoch": 0.827576015073706, "grad_norm": 0.12170116603374481, "learning_rate": 1.726023348603517e-05, "loss": 1.0071, "mean_token_accuracy": 0.7436146058142186, "num_tokens": 352229355.0, "step": 5600 }, { "entropy": 1.3304045237600803, "epoch": 0.8290538293863376, "grad_norm": 0.11743824183940887, "learning_rate": 1.711245751440816e-05, "loss": 1.0279, "mean_token_accuracy": 0.7404954940080642, "num_tokens": 352870287.0, "step": 5610 }, { "entropy": 1.3662690348923205, "epoch": 0.8305316436989693, "grad_norm": 0.124085433781147, "learning_rate": 1.6964681542781144e-05, "loss": 1.0623, "mean_token_accuracy": 0.7310058616101742, "num_tokens": 353530069.0, "step": 5620 }, { "entropy": 1.3515878789126874, "epoch": 0.8320094580116009, "grad_norm": 0.13237376511096954, "learning_rate": 1.6816905571154132e-05, "loss": 1.0463, "mean_token_accuracy": 0.7363075397908687, "num_tokens": 354147357.0, "step": 5630 }, { "entropy": 1.3044847965240478, "epoch": 0.8334872723242325, "grad_norm": 0.13815967738628387, "learning_rate": 1.6669129599527117e-05, "loss": 0.9782, "mean_token_accuracy": 0.7475894182920456, "num_tokens": 354795962.0, "step": 5640 }, { "entropy": 1.3666689321398735, "epoch": 0.8349650866368641, "grad_norm": 0.14314478635787964, "learning_rate": 1.6521353627900105e-05, "loss": 1.0065, "mean_token_accuracy": 0.7443801440298558, "num_tokens": 355417931.0, "step": 5650 }, { "entropy": 1.29787110760808, "epoch": 0.8364429009494957, "grad_norm": 0.13985678553581238, "learning_rate": 1.637357765627309e-05, "loss": 1.001, "mean_token_accuracy": 0.7457695990800858, "num_tokens": 356053286.0, "step": 5660 }, { "entropy": 1.341988889873028, "epoch": 0.8379207152621273, "grad_norm": 0.10513360053300858, "learning_rate": 1.6225801684646078e-05, "loss": 1.0067, "mean_token_accuracy": 0.7454051755368709, "num_tokens": 356690487.0, "step": 5670 }, { "entropy": 1.2974316738545895, "epoch": 0.8393985295747589, "grad_norm": 0.12444105744361877, "learning_rate": 1.6078025713019063e-05, "loss": 0.9723, "mean_token_accuracy": 0.7503290168941021, "num_tokens": 357328781.0, "step": 5680 }, { "entropy": 1.3582345850765705, "epoch": 0.8408763438873905, "grad_norm": 0.14589613676071167, "learning_rate": 1.593024974139205e-05, "loss": 1.0331, "mean_token_accuracy": 0.7437467984855175, "num_tokens": 357932412.0, "step": 5690 }, { "entropy": 1.3196044340729713, "epoch": 0.8423541582000221, "grad_norm": 0.11677612364292145, "learning_rate": 1.578247376976504e-05, "loss": 1.0183, "mean_token_accuracy": 0.7420541405677795, "num_tokens": 358551724.0, "step": 5700 }, { "entropy": 1.3120089799165726, "epoch": 0.8438319725126537, "grad_norm": 0.11075033247470856, "learning_rate": 1.5634697798138024e-05, "loss": 1.0223, "mean_token_accuracy": 0.7393298916518688, "num_tokens": 359189473.0, "step": 5710 }, { "entropy": 1.3048913300037384, "epoch": 0.8453097868252853, "grad_norm": 0.11959829181432724, "learning_rate": 1.5486921826511013e-05, "loss": 0.9943, "mean_token_accuracy": 0.7476891838014126, "num_tokens": 359808597.0, "step": 5720 }, { "entropy": 1.319146555662155, "epoch": 0.8467876011379171, "grad_norm": 0.13747940957546234, "learning_rate": 1.5339145854883997e-05, "loss": 0.9898, "mean_token_accuracy": 0.7491352930665016, "num_tokens": 360422994.0, "step": 5730 }, { "entropy": 1.3594556599855423, "epoch": 0.8482654154505487, "grad_norm": 0.1400456726551056, "learning_rate": 1.5191369883256984e-05, "loss": 1.0597, "mean_token_accuracy": 0.7335585907101632, "num_tokens": 361051901.0, "step": 5740 }, { "entropy": 1.3374354548752307, "epoch": 0.8497432297631803, "grad_norm": 0.11757944524288177, "learning_rate": 1.5043593911629969e-05, "loss": 1.0002, "mean_token_accuracy": 0.7453118711709976, "num_tokens": 361656024.0, "step": 5750 }, { "entropy": 1.3467597417533397, "epoch": 0.8512210440758119, "grad_norm": 0.11548870801925659, "learning_rate": 1.4895817940002957e-05, "loss": 0.9984, "mean_token_accuracy": 0.7451724961400032, "num_tokens": 362279059.0, "step": 5760 }, { "entropy": 1.311734914034605, "epoch": 0.8526988583884435, "grad_norm": 0.12405215948820114, "learning_rate": 1.4748041968375942e-05, "loss": 0.9799, "mean_token_accuracy": 0.7475904323160648, "num_tokens": 362895039.0, "step": 5770 }, { "entropy": 1.3386250838637352, "epoch": 0.8541766727010751, "grad_norm": 0.11085474491119385, "learning_rate": 1.460026599674893e-05, "loss": 1.007, "mean_token_accuracy": 0.7426138609647751, "num_tokens": 363529667.0, "step": 5780 }, { "entropy": 1.2939353726804257, "epoch": 0.8556544870137067, "grad_norm": 0.1114809662103653, "learning_rate": 1.4452490025121915e-05, "loss": 0.9734, "mean_token_accuracy": 0.750145249813795, "num_tokens": 364166145.0, "step": 5790 }, { "entropy": 1.3184495568275452, "epoch": 0.8571323013263383, "grad_norm": 0.1334013044834137, "learning_rate": 1.4304714053494903e-05, "loss": 1.0102, "mean_token_accuracy": 0.7411141104996204, "num_tokens": 364793121.0, "step": 5800 }, { "entropy": 1.3013493582606315, "epoch": 0.8586101156389699, "grad_norm": 0.11250706017017365, "learning_rate": 1.4156938081867888e-05, "loss": 0.9828, "mean_token_accuracy": 0.7467548877000809, "num_tokens": 365405557.0, "step": 5810 }, { "entropy": 1.327430461347103, "epoch": 0.8600879299516015, "grad_norm": 0.11568532884120941, "learning_rate": 1.4009162110240875e-05, "loss": 1.0218, "mean_token_accuracy": 0.7415443785488606, "num_tokens": 366044419.0, "step": 5820 }, { "entropy": 1.3481206871569156, "epoch": 0.8615657442642332, "grad_norm": 0.1371099203824997, "learning_rate": 1.3861386138613863e-05, "loss": 1.0439, "mean_token_accuracy": 0.7366217412054539, "num_tokens": 366690356.0, "step": 5830 }, { "entropy": 1.2569597400724888, "epoch": 0.8630435585768648, "grad_norm": 0.12688647210597992, "learning_rate": 1.3713610166986848e-05, "loss": 0.9435, "mean_token_accuracy": 0.7563542760908604, "num_tokens": 367315374.0, "step": 5840 }, { "entropy": 1.3336492694914341, "epoch": 0.8645213728894965, "grad_norm": 0.11842428147792816, "learning_rate": 1.3565834195359836e-05, "loss": 1.0233, "mean_token_accuracy": 0.7392323285341262, "num_tokens": 367958263.0, "step": 5850 }, { "entropy": 1.3464648641645909, "epoch": 0.8659991872021281, "grad_norm": 0.12313079833984375, "learning_rate": 1.341805822373282e-05, "loss": 1.0314, "mean_token_accuracy": 0.7396592818200588, "num_tokens": 368585660.0, "step": 5860 }, { "entropy": 1.3324293851852418, "epoch": 0.8674770015147597, "grad_norm": 0.11911337077617645, "learning_rate": 1.3270282252105809e-05, "loss": 0.9976, "mean_token_accuracy": 0.7445396453142166, "num_tokens": 369187809.0, "step": 5870 }, { "entropy": 1.3276281908154488, "epoch": 0.8689548158273913, "grad_norm": 0.12972944974899292, "learning_rate": 1.3122506280478794e-05, "loss": 1.0233, "mean_token_accuracy": 0.7407662458717823, "num_tokens": 369827636.0, "step": 5880 }, { "entropy": 1.3578208431601524, "epoch": 0.8704326301400229, "grad_norm": 0.1402665674686432, "learning_rate": 1.2974730308851782e-05, "loss": 1.0443, "mean_token_accuracy": 0.737098440527916, "num_tokens": 370449924.0, "step": 5890 }, { "entropy": 1.3040969766676427, "epoch": 0.8719104444526545, "grad_norm": 0.13990390300750732, "learning_rate": 1.2826954337224767e-05, "loss": 0.9881, "mean_token_accuracy": 0.7464100919663906, "num_tokens": 371084999.0, "step": 5900 }, { "entropy": 1.3430166877806187, "epoch": 0.8733882587652861, "grad_norm": 0.12417089194059372, "learning_rate": 1.2679178365597755e-05, "loss": 1.0457, "mean_token_accuracy": 0.7370161950588227, "num_tokens": 371692543.0, "step": 5910 }, { "entropy": 1.290044216811657, "epoch": 0.8748660730779177, "grad_norm": 0.14069810509681702, "learning_rate": 1.253140239397074e-05, "loss": 0.9783, "mean_token_accuracy": 0.7515232928097249, "num_tokens": 372320963.0, "step": 5920 }, { "entropy": 1.3472790539264679, "epoch": 0.8763438873905494, "grad_norm": 0.13290193676948547, "learning_rate": 1.2383626422343728e-05, "loss": 1.0224, "mean_token_accuracy": 0.7405038736760616, "num_tokens": 372949904.0, "step": 5930 }, { "entropy": 1.387679138034582, "epoch": 0.877821701703181, "grad_norm": 0.1314118653535843, "learning_rate": 1.2235850450716715e-05, "loss": 1.0422, "mean_token_accuracy": 0.7353745914995671, "num_tokens": 373573571.0, "step": 5940 }, { "entropy": 1.3165842115879058, "epoch": 0.8792995160158126, "grad_norm": 0.11947722733020782, "learning_rate": 1.20880744790897e-05, "loss": 1.0213, "mean_token_accuracy": 0.7407660990953445, "num_tokens": 374212664.0, "step": 5950 }, { "entropy": 1.3107740238308907, "epoch": 0.8807773303284442, "grad_norm": 0.14857317507266998, "learning_rate": 1.1940298507462686e-05, "loss": 0.9913, "mean_token_accuracy": 0.7447304286062717, "num_tokens": 374849824.0, "step": 5960 }, { "entropy": 1.2946119613945484, "epoch": 0.8822551446410758, "grad_norm": 0.13196992874145508, "learning_rate": 1.1792522535835673e-05, "loss": 0.9996, "mean_token_accuracy": 0.7443319000303745, "num_tokens": 375459391.0, "step": 5970 }, { "entropy": 1.3312421210110188, "epoch": 0.8837329589537075, "grad_norm": 0.12250470370054245, "learning_rate": 1.164474656420866e-05, "loss": 1.0011, "mean_token_accuracy": 0.7444459736347199, "num_tokens": 376092015.0, "step": 5980 }, { "entropy": 1.3092619471251965, "epoch": 0.8852107732663391, "grad_norm": 0.12348251789808273, "learning_rate": 1.1496970592581646e-05, "loss": 0.9884, "mean_token_accuracy": 0.7462313294410705, "num_tokens": 376707987.0, "step": 5990 }, { "entropy": 1.397826074063778, "epoch": 0.8866885875789707, "grad_norm": 0.12798164784908295, "learning_rate": 1.1349194620954632e-05, "loss": 1.0543, "mean_token_accuracy": 0.7346052847802639, "num_tokens": 377331029.0, "step": 6000 }, { "entropy": 1.3334910348057747, "epoch": 0.8881664018916023, "grad_norm": 0.14080867171287537, "learning_rate": 1.120141864932762e-05, "loss": 1.0309, "mean_token_accuracy": 0.7391007460653782, "num_tokens": 377965284.0, "step": 6010 }, { "entropy": 1.3450474232435226, "epoch": 0.889644216204234, "grad_norm": 0.11858553439378738, "learning_rate": 1.1053642677700607e-05, "loss": 1.042, "mean_token_accuracy": 0.7341104723513127, "num_tokens": 378583371.0, "step": 6020 }, { "entropy": 1.3471639886498452, "epoch": 0.8911220305168656, "grad_norm": 0.13958533108234406, "learning_rate": 1.0905866706073594e-05, "loss": 1.0176, "mean_token_accuracy": 0.7405742652714252, "num_tokens": 379206751.0, "step": 6030 }, { "entropy": 1.273489784449339, "epoch": 0.8925998448294972, "grad_norm": 0.12688973546028137, "learning_rate": 1.075809073444658e-05, "loss": 0.9973, "mean_token_accuracy": 0.746940103918314, "num_tokens": 379823103.0, "step": 6040 }, { "entropy": 1.3041085593402386, "epoch": 0.8940776591421288, "grad_norm": 0.14143548905849457, "learning_rate": 1.0610314762819567e-05, "loss": 0.9935, "mean_token_accuracy": 0.7468664824962616, "num_tokens": 380456382.0, "step": 6050 }, { "entropy": 1.3105453439056873, "epoch": 0.8955554734547604, "grad_norm": 0.13660714030265808, "learning_rate": 1.0462538791192553e-05, "loss": 1.0131, "mean_token_accuracy": 0.7412443704903126, "num_tokens": 381085757.0, "step": 6060 }, { "entropy": 1.3188693232834339, "epoch": 0.897033287767392, "grad_norm": 0.11770734935998917, "learning_rate": 1.0314762819565538e-05, "loss": 1.0092, "mean_token_accuracy": 0.7430628970265388, "num_tokens": 381703256.0, "step": 6070 }, { "entropy": 1.3571228340268136, "epoch": 0.8985111020800236, "grad_norm": 0.11014366149902344, "learning_rate": 1.0166986847938525e-05, "loss": 1.0352, "mean_token_accuracy": 0.7394863232970238, "num_tokens": 382342240.0, "step": 6080 }, { "entropy": 1.291709552705288, "epoch": 0.8999889163926552, "grad_norm": 0.1261245310306549, "learning_rate": 1.0019210876311511e-05, "loss": 0.9984, "mean_token_accuracy": 0.7418771781027317, "num_tokens": 382950230.0, "step": 6090 }, { "entropy": 1.3168196886777879, "epoch": 0.9014667307052869, "grad_norm": 0.1314990222454071, "learning_rate": 9.871434904684498e-06, "loss": 0.9979, "mean_token_accuracy": 0.7453989803791046, "num_tokens": 383580783.0, "step": 6100 }, { "entropy": 1.305882962793112, "epoch": 0.9029445450179185, "grad_norm": 0.13268327713012695, "learning_rate": 9.723658933057484e-06, "loss": 0.9762, "mean_token_accuracy": 0.7521377936005592, "num_tokens": 384220360.0, "step": 6110 }, { "entropy": 1.3119835503399373, "epoch": 0.9044223593305502, "grad_norm": 0.11007312685251236, "learning_rate": 9.575882961430471e-06, "loss": 0.992, "mean_token_accuracy": 0.7449328310787677, "num_tokens": 384876317.0, "step": 6120 }, { "entropy": 1.316799872368574, "epoch": 0.9059001736431818, "grad_norm": 0.11126253753900528, "learning_rate": 9.42810698980346e-06, "loss": 1.0005, "mean_token_accuracy": 0.7466472007334233, "num_tokens": 385507421.0, "step": 6130 }, { "entropy": 1.3008616276085376, "epoch": 0.9073779879558134, "grad_norm": 0.15056948363780975, "learning_rate": 9.280331018176446e-06, "loss": 0.9871, "mean_token_accuracy": 0.7503829054534435, "num_tokens": 386141541.0, "step": 6140 }, { "entropy": 1.3190543949604034, "epoch": 0.908855802268445, "grad_norm": 0.13507477939128876, "learning_rate": 9.132555046549432e-06, "loss": 1.0206, "mean_token_accuracy": 0.7397508636116982, "num_tokens": 386770965.0, "step": 6150 }, { "entropy": 1.3303886882960796, "epoch": 0.9103336165810766, "grad_norm": 0.13336560130119324, "learning_rate": 8.984779074922419e-06, "loss": 1.0036, "mean_token_accuracy": 0.7444213129580021, "num_tokens": 387391128.0, "step": 6160 }, { "entropy": 1.34616384729743, "epoch": 0.9118114308937082, "grad_norm": 0.11870578676462173, "learning_rate": 8.837003103295405e-06, "loss": 1.0254, "mean_token_accuracy": 0.7389769002795219, "num_tokens": 388027333.0, "step": 6170 }, { "entropy": 1.3144830591976642, "epoch": 0.9132892452063398, "grad_norm": 0.11620783060789108, "learning_rate": 8.689227131668392e-06, "loss": 0.9837, "mean_token_accuracy": 0.7497315384447575, "num_tokens": 388637565.0, "step": 6180 }, { "entropy": 1.3189754135906697, "epoch": 0.9147670595189714, "grad_norm": 0.12029609084129333, "learning_rate": 8.541451160041377e-06, "loss": 1.0037, "mean_token_accuracy": 0.7476396732032299, "num_tokens": 389268613.0, "step": 6190 }, { "entropy": 1.3421682931482792, "epoch": 0.916244873831603, "grad_norm": 0.14239317178726196, "learning_rate": 8.393675188414363e-06, "loss": 1.0176, "mean_token_accuracy": 0.741797874122858, "num_tokens": 389892611.0, "step": 6200 }, { "entropy": 1.322981870174408, "epoch": 0.9177226881442346, "grad_norm": 0.15327249467372894, "learning_rate": 8.24589921678735e-06, "loss": 1.0255, "mean_token_accuracy": 0.7384318143129349, "num_tokens": 390521207.0, "step": 6210 }, { "entropy": 1.3384942390024661, "epoch": 0.9192005024568662, "grad_norm": 0.12492629140615463, "learning_rate": 8.098123245160337e-06, "loss": 1.0238, "mean_token_accuracy": 0.7415454059839248, "num_tokens": 391153462.0, "step": 6220 }, { "entropy": 1.3131339251995087, "epoch": 0.920678316769498, "grad_norm": 0.12154535204172134, "learning_rate": 7.950347273533323e-06, "loss": 0.9874, "mean_token_accuracy": 0.7472625941038131, "num_tokens": 391788123.0, "step": 6230 }, { "entropy": 1.3672856733202934, "epoch": 0.9221561310821296, "grad_norm": 0.1145540326833725, "learning_rate": 7.80257130190631e-06, "loss": 1.0455, "mean_token_accuracy": 0.7358811512589455, "num_tokens": 392425329.0, "step": 6240 }, { "entropy": 1.326454308629036, "epoch": 0.9236339453947612, "grad_norm": 0.11543665081262589, "learning_rate": 7.654795330279296e-06, "loss": 1.0106, "mean_token_accuracy": 0.7414052963256836, "num_tokens": 393048401.0, "step": 6250 }, { "entropy": 1.315993483364582, "epoch": 0.9251117597073928, "grad_norm": 0.1304856389760971, "learning_rate": 7.507019358652284e-06, "loss": 0.9989, "mean_token_accuracy": 0.7430017247796059, "num_tokens": 393676756.0, "step": 6260 }, { "entropy": 1.3197014026343823, "epoch": 0.9265895740200244, "grad_norm": 0.11181900650262833, "learning_rate": 7.359243387025271e-06, "loss": 0.9951, "mean_token_accuracy": 0.7460963025689125, "num_tokens": 394309847.0, "step": 6270 }, { "entropy": 1.358003605902195, "epoch": 0.928067388332656, "grad_norm": 0.12269277125597, "learning_rate": 7.211467415398257e-06, "loss": 1.0359, "mean_token_accuracy": 0.7356663353741169, "num_tokens": 394936407.0, "step": 6280 }, { "entropy": 1.3280733123421669, "epoch": 0.9295452026452876, "grad_norm": 0.1313636302947998, "learning_rate": 7.063691443771243e-06, "loss": 0.9818, "mean_token_accuracy": 0.7464911125600338, "num_tokens": 395548910.0, "step": 6290 }, { "entropy": 1.3259168773889543, "epoch": 0.9310230169579192, "grad_norm": 0.1302233338356018, "learning_rate": 6.91591547214423e-06, "loss": 1.0413, "mean_token_accuracy": 0.7370544657111168, "num_tokens": 396165852.0, "step": 6300 }, { "entropy": 1.318706451356411, "epoch": 0.9325008312705508, "grad_norm": 0.11792853474617004, "learning_rate": 6.768139500517216e-06, "loss": 1.007, "mean_token_accuracy": 0.7420048147439957, "num_tokens": 396809254.0, "step": 6310 }, { "entropy": 1.2917353048920632, "epoch": 0.9339786455831824, "grad_norm": 0.12031566351652145, "learning_rate": 6.620363528890203e-06, "loss": 1.0291, "mean_token_accuracy": 0.7431467622518539, "num_tokens": 397438624.0, "step": 6320 }, { "entropy": 1.302623900771141, "epoch": 0.935456459895814, "grad_norm": 0.15024085342884064, "learning_rate": 6.472587557263189e-06, "loss": 0.96, "mean_token_accuracy": 0.7524841710925102, "num_tokens": 398058880.0, "step": 6330 }, { "entropy": 1.3265319362282753, "epoch": 0.9369342742084457, "grad_norm": 0.1818179488182068, "learning_rate": 6.324811585636176e-06, "loss": 0.9912, "mean_token_accuracy": 0.7462624236941338, "num_tokens": 398684141.0, "step": 6340 }, { "entropy": 1.3446454957127572, "epoch": 0.9384120885210774, "grad_norm": 0.12499760836362839, "learning_rate": 6.1770356140091625e-06, "loss": 1.0382, "mean_token_accuracy": 0.7400866918265819, "num_tokens": 399325710.0, "step": 6350 }, { "entropy": 1.3342131525278091, "epoch": 0.939889902833709, "grad_norm": 0.1248583048582077, "learning_rate": 6.029259642382149e-06, "loss": 1.0107, "mean_token_accuracy": 0.744459693133831, "num_tokens": 399955089.0, "step": 6360 }, { "entropy": 1.3489103883504867, "epoch": 0.9413677171463406, "grad_norm": 0.1461644023656845, "learning_rate": 5.881483670755136e-06, "loss": 1.0282, "mean_token_accuracy": 0.7392531536519528, "num_tokens": 400551267.0, "step": 6370 }, { "entropy": 1.3305791199207306, "epoch": 0.9428455314589722, "grad_norm": 0.14220687747001648, "learning_rate": 5.733707699128122e-06, "loss": 0.996, "mean_token_accuracy": 0.7464814051985741, "num_tokens": 401184838.0, "step": 6380 }, { "entropy": 1.3437370270490647, "epoch": 0.9443233457716038, "grad_norm": 0.1341477781534195, "learning_rate": 5.585931727501109e-06, "loss": 1.057, "mean_token_accuracy": 0.733926995843649, "num_tokens": 401844712.0, "step": 6390 }, { "entropy": 1.3399671465158463, "epoch": 0.9458011600842354, "grad_norm": 0.15581178665161133, "learning_rate": 5.438155755874095e-06, "loss": 1.0176, "mean_token_accuracy": 0.7400895021855831, "num_tokens": 402467237.0, "step": 6400 }, { "entropy": 1.3379587285220622, "epoch": 0.947278974396867, "grad_norm": 0.12707367539405823, "learning_rate": 5.290379784247081e-06, "loss": 1.0414, "mean_token_accuracy": 0.7374955870211124, "num_tokens": 403090540.0, "step": 6410 }, { "entropy": 1.2975156359374522, "epoch": 0.9487567887094986, "grad_norm": 0.14274674654006958, "learning_rate": 5.142603812620068e-06, "loss": 0.9858, "mean_token_accuracy": 0.746936984360218, "num_tokens": 403728117.0, "step": 6420 }, { "entropy": 1.3399316541850568, "epoch": 0.9502346030221303, "grad_norm": 0.11993175745010376, "learning_rate": 4.994827840993055e-06, "loss": 1.0539, "mean_token_accuracy": 0.7339481048285961, "num_tokens": 404362378.0, "step": 6430 }, { "entropy": 1.3567871250212193, "epoch": 0.9517124173347619, "grad_norm": 0.13137640058994293, "learning_rate": 4.847051869366041e-06, "loss": 1.0134, "mean_token_accuracy": 0.7401178866624832, "num_tokens": 404968979.0, "step": 6440 }, { "entropy": 1.2970522359013557, "epoch": 0.9531902316473935, "grad_norm": 0.1552589386701584, "learning_rate": 4.699275897739028e-06, "loss": 1.0104, "mean_token_accuracy": 0.7441655330359935, "num_tokens": 405603503.0, "step": 6450 }, { "entropy": 1.3546797879040242, "epoch": 0.9546680459600251, "grad_norm": 0.14361603558063507, "learning_rate": 4.5514999261120145e-06, "loss": 1.032, "mean_token_accuracy": 0.7376946985721589, "num_tokens": 406213712.0, "step": 6460 }, { "entropy": 1.3317971237003803, "epoch": 0.9561458602726567, "grad_norm": 0.13018253445625305, "learning_rate": 4.403723954485001e-06, "loss": 1.023, "mean_token_accuracy": 0.7395760633051396, "num_tokens": 406839355.0, "step": 6470 }, { "entropy": 1.320752915740013, "epoch": 0.9576236745852884, "grad_norm": 0.14429272711277008, "learning_rate": 4.255947982857988e-06, "loss": 1.0303, "mean_token_accuracy": 0.7379327312111854, "num_tokens": 407463490.0, "step": 6480 }, { "entropy": 1.3293151132762433, "epoch": 0.95910148889792, "grad_norm": 0.14717073738574982, "learning_rate": 4.108172011230974e-06, "loss": 1.0349, "mean_token_accuracy": 0.7367990806698799, "num_tokens": 408097068.0, "step": 6490 }, { "entropy": 1.331135530769825, "epoch": 0.9605793032105516, "grad_norm": 0.11680871248245239, "learning_rate": 3.960396039603961e-06, "loss": 0.9621, "mean_token_accuracy": 0.7536611042916774, "num_tokens": 408727501.0, "step": 6500 } ], "logging_steps": 10, "max_steps": 6767, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5.45810399001523e+18, "train_batch_size": 4, "trial_name": null, "trial_params": null }