loris3's picture
Upload folder using huggingface_hub
90141a8 verified
Raw
History Blame Contribute Delete
199 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 6767,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 1.5304893136024476,
"epoch": 0.001477814312631618,
"grad_norm": 0.11065268516540527,
"learning_rate": 9.98670016255357e-05,
"loss": 1.2253,
"mean_token_accuracy": 0.713296040892601,
"num_tokens": 634372.0,
"step": 10
},
{
"entropy": 1.5232050925493241,
"epoch": 0.002955628625263236,
"grad_norm": 0.11062215268611908,
"learning_rate": 9.971922565390867e-05,
"loss": 1.1733,
"mean_token_accuracy": 0.7147852033376694,
"num_tokens": 1272340.0,
"step": 20
},
{
"entropy": 1.4792076826095581,
"epoch": 0.004433442937894854,
"grad_norm": 0.1127617210149765,
"learning_rate": 9.957144968228167e-05,
"loss": 1.1469,
"mean_token_accuracy": 0.7173507429659367,
"num_tokens": 1904586.0,
"step": 30
},
{
"entropy": 1.4591812424361705,
"epoch": 0.005911257250526472,
"grad_norm": 0.06614726036787033,
"learning_rate": 9.942367371065465e-05,
"loss": 1.131,
"mean_token_accuracy": 0.7204256772994995,
"num_tokens": 2533557.0,
"step": 40
},
{
"entropy": 1.42888495773077,
"epoch": 0.007389071563158089,
"grad_norm": 0.054086439311504364,
"learning_rate": 9.927589773902763e-05,
"loss": 1.0564,
"mean_token_accuracy": 0.7316170297563076,
"num_tokens": 3159795.0,
"step": 50
},
{
"entropy": 1.3907018028199674,
"epoch": 0.008866885875789708,
"grad_norm": 0.05579997971653938,
"learning_rate": 9.912812176740062e-05,
"loss": 1.0595,
"mean_token_accuracy": 0.7346745491027832,
"num_tokens": 3787086.0,
"step": 60
},
{
"entropy": 1.4462938398122787,
"epoch": 0.010344700188421325,
"grad_norm": 0.06100340187549591,
"learning_rate": 9.898034579577361e-05,
"loss": 1.1241,
"mean_token_accuracy": 0.7200969859957695,
"num_tokens": 4404928.0,
"step": 70
},
{
"entropy": 1.443135815113783,
"epoch": 0.011822514501052943,
"grad_norm": 0.05758308619260788,
"learning_rate": 9.88325698241466e-05,
"loss": 1.1179,
"mean_token_accuracy": 0.7207777500152588,
"num_tokens": 5055890.0,
"step": 80
},
{
"entropy": 1.4378912061452866,
"epoch": 0.01330032881368456,
"grad_norm": 0.0707370936870575,
"learning_rate": 9.868479385251959e-05,
"loss": 1.1078,
"mean_token_accuracy": 0.7260331742465496,
"num_tokens": 5694020.0,
"step": 90
},
{
"entropy": 1.4321013674139977,
"epoch": 0.014778143126316179,
"grad_norm": 0.06243390962481499,
"learning_rate": 9.853701788089256e-05,
"loss": 1.101,
"mean_token_accuracy": 0.7271535098552704,
"num_tokens": 6330552.0,
"step": 100
},
{
"entropy": 1.3873297058045864,
"epoch": 0.016255957438947796,
"grad_norm": 0.06713827699422836,
"learning_rate": 9.838924190926556e-05,
"loss": 1.0808,
"mean_token_accuracy": 0.7296842932701111,
"num_tokens": 6969739.0,
"step": 110
},
{
"entropy": 1.4041674077510833,
"epoch": 0.017733771751579416,
"grad_norm": 0.06167087331414223,
"learning_rate": 9.824146593763854e-05,
"loss": 1.0935,
"mean_token_accuracy": 0.7287170954048634,
"num_tokens": 7599906.0,
"step": 120
},
{
"entropy": 1.4082320772111416,
"epoch": 0.01921158606421103,
"grad_norm": 0.06408118456602097,
"learning_rate": 9.809368996601153e-05,
"loss": 1.0725,
"mean_token_accuracy": 0.7312771216034889,
"num_tokens": 8240783.0,
"step": 130
},
{
"entropy": 1.438713125884533,
"epoch": 0.02068940037684265,
"grad_norm": 0.07518143951892853,
"learning_rate": 9.794591399438452e-05,
"loss": 1.1073,
"mean_token_accuracy": 0.721763364970684,
"num_tokens": 8861604.0,
"step": 140
},
{
"entropy": 1.40254572853446,
"epoch": 0.022167214689474267,
"grad_norm": 0.07152130454778671,
"learning_rate": 9.77981380227575e-05,
"loss": 1.0691,
"mean_token_accuracy": 0.7301274545490741,
"num_tokens": 9519424.0,
"step": 150
},
{
"entropy": 1.4247990146279335,
"epoch": 0.023645029002105886,
"grad_norm": 0.06787216663360596,
"learning_rate": 9.765036205113049e-05,
"loss": 1.1106,
"mean_token_accuracy": 0.7254596322774887,
"num_tokens": 10149741.0,
"step": 160
},
{
"entropy": 1.3974801175296307,
"epoch": 0.025122843314737502,
"grad_norm": 0.07307117432355881,
"learning_rate": 9.750258607950348e-05,
"loss": 1.0634,
"mean_token_accuracy": 0.7332775875926018,
"num_tokens": 10782594.0,
"step": 170
},
{
"entropy": 1.3781036920845509,
"epoch": 0.02660065762736912,
"grad_norm": 0.07379572093486786,
"learning_rate": 9.735481010787646e-05,
"loss": 1.06,
"mean_token_accuracy": 0.731862985342741,
"num_tokens": 11421889.0,
"step": 180
},
{
"entropy": 1.3866104505956174,
"epoch": 0.028078471940000738,
"grad_norm": 0.06865496188402176,
"learning_rate": 9.720703413624946e-05,
"loss": 1.0457,
"mean_token_accuracy": 0.7345983348786831,
"num_tokens": 12037438.0,
"step": 190
},
{
"entropy": 1.3649713568389417,
"epoch": 0.029556286252632357,
"grad_norm": 0.08302357792854309,
"learning_rate": 9.705925816462243e-05,
"loss": 1.0281,
"mean_token_accuracy": 0.7428084775805474,
"num_tokens": 12668446.0,
"step": 200
},
{
"entropy": 1.3744140148162842,
"epoch": 0.031034100565263973,
"grad_norm": 0.07769942283630371,
"learning_rate": 9.691148219299543e-05,
"loss": 1.0554,
"mean_token_accuracy": 0.734387868642807,
"num_tokens": 13293305.0,
"step": 210
},
{
"entropy": 1.4095868960022926,
"epoch": 0.03251191487789559,
"grad_norm": 0.06871581077575684,
"learning_rate": 9.676370622136841e-05,
"loss": 1.074,
"mean_token_accuracy": 0.7270821079611778,
"num_tokens": 13924324.0,
"step": 220
},
{
"entropy": 1.3864221736788749,
"epoch": 0.03398972919052721,
"grad_norm": 0.07095455378293991,
"learning_rate": 9.66159302497414e-05,
"loss": 1.0347,
"mean_token_accuracy": 0.7366894610226155,
"num_tokens": 14541764.0,
"step": 230
},
{
"entropy": 1.4184685163199902,
"epoch": 0.03546754350315883,
"grad_norm": 0.07504931837320328,
"learning_rate": 9.646815427811438e-05,
"loss": 1.0532,
"mean_token_accuracy": 0.7369042620062828,
"num_tokens": 15187630.0,
"step": 240
},
{
"entropy": 1.4156867913901805,
"epoch": 0.03694535781579045,
"grad_norm": 0.0802634209394455,
"learning_rate": 9.632037830648737e-05,
"loss": 1.1036,
"mean_token_accuracy": 0.7283115215599537,
"num_tokens": 15846809.0,
"step": 250
},
{
"entropy": 1.4105734363198281,
"epoch": 0.03842317212842206,
"grad_norm": 0.07708612084388733,
"learning_rate": 9.617260233486035e-05,
"loss": 1.0768,
"mean_token_accuracy": 0.7296842828392982,
"num_tokens": 16478085.0,
"step": 260
},
{
"entropy": 1.382845190167427,
"epoch": 0.03990098644105368,
"grad_norm": 0.08279397338628769,
"learning_rate": 9.602482636323335e-05,
"loss": 1.0515,
"mean_token_accuracy": 0.7347821459174156,
"num_tokens": 17128735.0,
"step": 270
},
{
"entropy": 1.4158720895648003,
"epoch": 0.0413788007536853,
"grad_norm": 0.092226542532444,
"learning_rate": 9.587705039160632e-05,
"loss": 1.0609,
"mean_token_accuracy": 0.7326413303613662,
"num_tokens": 17746687.0,
"step": 280
},
{
"entropy": 1.3976521752774715,
"epoch": 0.04285661506631692,
"grad_norm": 0.08918865770101547,
"learning_rate": 9.572927441997933e-05,
"loss": 1.0683,
"mean_token_accuracy": 0.7294273987412453,
"num_tokens": 18363963.0,
"step": 290
},
{
"entropy": 1.4044050514698028,
"epoch": 0.044334429378948534,
"grad_norm": 0.08644465357065201,
"learning_rate": 9.55814984483523e-05,
"loss": 1.0634,
"mean_token_accuracy": 0.7320508249104023,
"num_tokens": 18993450.0,
"step": 300
},
{
"entropy": 1.380122570693493,
"epoch": 0.04581224369158015,
"grad_norm": 0.08921512216329575,
"learning_rate": 9.543372247672529e-05,
"loss": 1.0261,
"mean_token_accuracy": 0.7378858976066113,
"num_tokens": 19620523.0,
"step": 310
},
{
"entropy": 1.3815103709697723,
"epoch": 0.04729005800421177,
"grad_norm": 0.08035629242658615,
"learning_rate": 9.528594650509828e-05,
"loss": 1.0659,
"mean_token_accuracy": 0.7323430612683296,
"num_tokens": 20229672.0,
"step": 320
},
{
"entropy": 1.4161942921578885,
"epoch": 0.04876787231684339,
"grad_norm": 0.09145661443471909,
"learning_rate": 9.513817053347127e-05,
"loss": 1.0993,
"mean_token_accuracy": 0.7256109490990639,
"num_tokens": 20856211.0,
"step": 330
},
{
"entropy": 1.3907759122550487,
"epoch": 0.050245686629475005,
"grad_norm": 0.08255486935377121,
"learning_rate": 9.499039456184425e-05,
"loss": 1.0525,
"mean_token_accuracy": 0.7357108578085899,
"num_tokens": 21467622.0,
"step": 340
},
{
"entropy": 1.375921645760536,
"epoch": 0.05172350094210663,
"grad_norm": 0.08248364925384521,
"learning_rate": 9.484261859021724e-05,
"loss": 1.0306,
"mean_token_accuracy": 0.7383193828165531,
"num_tokens": 22109771.0,
"step": 350
},
{
"entropy": 1.3706233829259873,
"epoch": 0.05320131525473824,
"grad_norm": 0.08424954116344452,
"learning_rate": 9.469484261859022e-05,
"loss": 1.0289,
"mean_token_accuracy": 0.7390523985028267,
"num_tokens": 22717652.0,
"step": 360
},
{
"entropy": 1.392815312743187,
"epoch": 0.05467912956736986,
"grad_norm": 0.09112072736024857,
"learning_rate": 9.454706664696322e-05,
"loss": 1.0619,
"mean_token_accuracy": 0.7333372481167316,
"num_tokens": 23324578.0,
"step": 370
},
{
"entropy": 1.3739952459931373,
"epoch": 0.056156943880001475,
"grad_norm": 0.08004885166883469,
"learning_rate": 9.439929067533619e-05,
"loss": 1.0574,
"mean_token_accuracy": 0.730328020453453,
"num_tokens": 23957383.0,
"step": 380
},
{
"entropy": 1.3788554146885872,
"epoch": 0.0576347581926331,
"grad_norm": 0.08307195454835892,
"learning_rate": 9.425151470370918e-05,
"loss": 1.0637,
"mean_token_accuracy": 0.7303956717252731,
"num_tokens": 24585296.0,
"step": 390
},
{
"entropy": 1.4142395369708538,
"epoch": 0.059112572505264714,
"grad_norm": 0.08236826956272125,
"learning_rate": 9.410373873208217e-05,
"loss": 1.1018,
"mean_token_accuracy": 0.7251050278544426,
"num_tokens": 25217211.0,
"step": 400
},
{
"entropy": 1.3920598179101944,
"epoch": 0.06059038681789633,
"grad_norm": 0.0988270491361618,
"learning_rate": 9.395596276045516e-05,
"loss": 1.0377,
"mean_token_accuracy": 0.7389338552951813,
"num_tokens": 25844862.0,
"step": 410
},
{
"entropy": 1.3850713059306146,
"epoch": 0.062068201130527946,
"grad_norm": 0.08349768072366714,
"learning_rate": 9.380818678882815e-05,
"loss": 1.0655,
"mean_token_accuracy": 0.7277355805039406,
"num_tokens": 26460555.0,
"step": 420
},
{
"entropy": 1.3950319290161133,
"epoch": 0.06354601544315956,
"grad_norm": 0.08391372114419937,
"learning_rate": 9.366041081720113e-05,
"loss": 1.0581,
"mean_token_accuracy": 0.7355390675365925,
"num_tokens": 27086147.0,
"step": 430
},
{
"entropy": 1.4254113271832467,
"epoch": 0.06502382975579118,
"grad_norm": 0.09792959690093994,
"learning_rate": 9.351263484557411e-05,
"loss": 1.1253,
"mean_token_accuracy": 0.7227410763502121,
"num_tokens": 27710680.0,
"step": 440
},
{
"entropy": 1.3752116419374942,
"epoch": 0.06650164406842281,
"grad_norm": 0.08181757479906082,
"learning_rate": 9.33648588739471e-05,
"loss": 1.0463,
"mean_token_accuracy": 0.7353246711194515,
"num_tokens": 28340440.0,
"step": 450
},
{
"entropy": 1.3917047053575515,
"epoch": 0.06797945838105442,
"grad_norm": 0.09203750640153885,
"learning_rate": 9.321708290232009e-05,
"loss": 1.0624,
"mean_token_accuracy": 0.7348892599344253,
"num_tokens": 28966719.0,
"step": 460
},
{
"entropy": 1.3774724885821343,
"epoch": 0.06945727269368604,
"grad_norm": 0.09953095763921738,
"learning_rate": 9.306930693069307e-05,
"loss": 1.0465,
"mean_token_accuracy": 0.7373659625649452,
"num_tokens": 29611234.0,
"step": 470
},
{
"entropy": 1.3991491951048374,
"epoch": 0.07093508700631766,
"grad_norm": 0.08594824373722076,
"learning_rate": 9.292153095906606e-05,
"loss": 1.0644,
"mean_token_accuracy": 0.7328724160790443,
"num_tokens": 30246408.0,
"step": 480
},
{
"entropy": 1.373952978104353,
"epoch": 0.07241290131894927,
"grad_norm": 0.0813300833106041,
"learning_rate": 9.277375498743905e-05,
"loss": 1.0897,
"mean_token_accuracy": 0.7270603954792023,
"num_tokens": 30893806.0,
"step": 490
},
{
"entropy": 1.3723024994134903,
"epoch": 0.0738907156315809,
"grad_norm": 0.07812219113111496,
"learning_rate": 9.262597901581204e-05,
"loss": 1.0173,
"mean_token_accuracy": 0.7398755483329296,
"num_tokens": 31532529.0,
"step": 500
},
{
"entropy": 1.338401772081852,
"epoch": 0.0753685299442125,
"grad_norm": 0.08471836894750595,
"learning_rate": 9.247820304418501e-05,
"loss": 1.0197,
"mean_token_accuracy": 0.7419663660228253,
"num_tokens": 32174902.0,
"step": 510
},
{
"entropy": 1.4127553194761275,
"epoch": 0.07684634425684413,
"grad_norm": 0.09702274203300476,
"learning_rate": 9.2330427072558e-05,
"loss": 1.0963,
"mean_token_accuracy": 0.7259891100227833,
"num_tokens": 32792820.0,
"step": 520
},
{
"entropy": 1.3952218279242516,
"epoch": 0.07832415856947575,
"grad_norm": 0.08955958485603333,
"learning_rate": 9.218265110093099e-05,
"loss": 1.0803,
"mean_token_accuracy": 0.7294512584805488,
"num_tokens": 33434685.0,
"step": 530
},
{
"entropy": 1.352259347587824,
"epoch": 0.07980197288210736,
"grad_norm": 0.08365257829427719,
"learning_rate": 9.203487512930398e-05,
"loss": 1.039,
"mean_token_accuracy": 0.7357416793704032,
"num_tokens": 34085251.0,
"step": 540
},
{
"entropy": 1.3604788549244404,
"epoch": 0.08127978719473898,
"grad_norm": 0.08095045387744904,
"learning_rate": 9.188709915767697e-05,
"loss": 1.0577,
"mean_token_accuracy": 0.7318811133503914,
"num_tokens": 34722551.0,
"step": 550
},
{
"entropy": 1.3773885890841484,
"epoch": 0.0827576015073706,
"grad_norm": 0.10368340462446213,
"learning_rate": 9.173932318604995e-05,
"loss": 1.0496,
"mean_token_accuracy": 0.7356349483132363,
"num_tokens": 35339209.0,
"step": 560
},
{
"entropy": 1.3895627804100514,
"epoch": 0.08423541582000221,
"grad_norm": 0.09198153764009476,
"learning_rate": 9.159154721442293e-05,
"loss": 1.067,
"mean_token_accuracy": 0.7346835978329181,
"num_tokens": 35979698.0,
"step": 570
},
{
"entropy": 1.4322662442922591,
"epoch": 0.08571323013263384,
"grad_norm": 0.09510086476802826,
"learning_rate": 9.144377124279593e-05,
"loss": 1.0945,
"mean_token_accuracy": 0.7262316733598709,
"num_tokens": 36595329.0,
"step": 580
},
{
"entropy": 1.350172371417284,
"epoch": 0.08719104444526546,
"grad_norm": 0.08246901631355286,
"learning_rate": 9.12959952711689e-05,
"loss": 0.9963,
"mean_token_accuracy": 0.7426011696457863,
"num_tokens": 37217852.0,
"step": 590
},
{
"entropy": 1.3493722938001156,
"epoch": 0.08866885875789707,
"grad_norm": 0.08438783884048462,
"learning_rate": 9.114821929954191e-05,
"loss": 1.0137,
"mean_token_accuracy": 0.7415332272648811,
"num_tokens": 37854800.0,
"step": 600
},
{
"entropy": 1.389697627723217,
"epoch": 0.09014667307052869,
"grad_norm": 0.09821821004152298,
"learning_rate": 9.100044332791488e-05,
"loss": 1.0249,
"mean_token_accuracy": 0.7392405845224858,
"num_tokens": 38471395.0,
"step": 610
},
{
"entropy": 1.4111714124679566,
"epoch": 0.0916244873831603,
"grad_norm": 0.09100645780563354,
"learning_rate": 9.085266735628787e-05,
"loss": 1.1025,
"mean_token_accuracy": 0.7256681717932224,
"num_tokens": 39096618.0,
"step": 620
},
{
"entropy": 1.3662530906498431,
"epoch": 0.09310230169579192,
"grad_norm": 0.13060341775417328,
"learning_rate": 9.070489138466086e-05,
"loss": 1.0629,
"mean_token_accuracy": 0.7316286444664002,
"num_tokens": 39703580.0,
"step": 630
},
{
"entropy": 1.3668909780681133,
"epoch": 0.09458011600842355,
"grad_norm": 0.10613272339105606,
"learning_rate": 9.055711541303385e-05,
"loss": 1.0375,
"mean_token_accuracy": 0.7359757006168366,
"num_tokens": 40343514.0,
"step": 640
},
{
"entropy": 1.3518067069351674,
"epoch": 0.09605793032105515,
"grad_norm": 0.08057314902544022,
"learning_rate": 9.040933944140682e-05,
"loss": 1.0281,
"mean_token_accuracy": 0.7392694905400277,
"num_tokens": 40973391.0,
"step": 650
},
{
"entropy": 1.3239390894770622,
"epoch": 0.09753574463368678,
"grad_norm": 0.08244802802801132,
"learning_rate": 9.026156346977982e-05,
"loss": 1.0276,
"mean_token_accuracy": 0.7396696552634239,
"num_tokens": 41623645.0,
"step": 660
},
{
"entropy": 1.3552034579217433,
"epoch": 0.0990135589463184,
"grad_norm": 0.08738582581281662,
"learning_rate": 9.01137874981528e-05,
"loss": 1.0264,
"mean_token_accuracy": 0.7368874847888947,
"num_tokens": 42279334.0,
"step": 670
},
{
"entropy": 1.3737920597195625,
"epoch": 0.10049137325895001,
"grad_norm": 0.09264443069696426,
"learning_rate": 8.99660115265258e-05,
"loss": 1.0064,
"mean_token_accuracy": 0.7462978705763816,
"num_tokens": 42882194.0,
"step": 680
},
{
"entropy": 1.3388465084135532,
"epoch": 0.10196918757158163,
"grad_norm": 0.09516231715679169,
"learning_rate": 8.981823555489877e-05,
"loss": 1.0386,
"mean_token_accuracy": 0.7378973692655564,
"num_tokens": 43529617.0,
"step": 690
},
{
"entropy": 1.3471161246299743,
"epoch": 0.10344700188421325,
"grad_norm": 0.08873550593852997,
"learning_rate": 8.967045958327176e-05,
"loss": 1.0281,
"mean_token_accuracy": 0.7418588995933533,
"num_tokens": 44181958.0,
"step": 700
},
{
"entropy": 1.3766934528946877,
"epoch": 0.10492481619684486,
"grad_norm": 0.08453412353992462,
"learning_rate": 8.952268361164475e-05,
"loss": 1.0681,
"mean_token_accuracy": 0.729092076420784,
"num_tokens": 44820009.0,
"step": 710
},
{
"entropy": 1.3845791950821877,
"epoch": 0.10640263050947649,
"grad_norm": 0.09360987693071365,
"learning_rate": 8.937490764001774e-05,
"loss": 1.0586,
"mean_token_accuracy": 0.7347254164516925,
"num_tokens": 45452740.0,
"step": 720
},
{
"entropy": 1.3411042720079422,
"epoch": 0.1078804448221081,
"grad_norm": 0.09737925231456757,
"learning_rate": 8.922713166839073e-05,
"loss": 1.0474,
"mean_token_accuracy": 0.7368136189877987,
"num_tokens": 46073470.0,
"step": 730
},
{
"entropy": 1.3904819071292878,
"epoch": 0.10935825913473972,
"grad_norm": 0.09909042716026306,
"learning_rate": 8.907935569676372e-05,
"loss": 1.0606,
"mean_token_accuracy": 0.7374630443751812,
"num_tokens": 46711803.0,
"step": 740
},
{
"entropy": 1.3583513878285884,
"epoch": 0.11083607344737134,
"grad_norm": 0.09460269659757614,
"learning_rate": 8.893157972513669e-05,
"loss": 1.0488,
"mean_token_accuracy": 0.7376768283545971,
"num_tokens": 47331676.0,
"step": 750
},
{
"entropy": 1.3419748917222023,
"epoch": 0.11231388776000295,
"grad_norm": 0.09834811091423035,
"learning_rate": 8.878380375350969e-05,
"loss": 1.008,
"mean_token_accuracy": 0.7432084485888482,
"num_tokens": 47958777.0,
"step": 760
},
{
"entropy": 1.3798519670963287,
"epoch": 0.11379170207263457,
"grad_norm": 0.08785253763198853,
"learning_rate": 8.863602778188267e-05,
"loss": 1.0598,
"mean_token_accuracy": 0.7317903161048889,
"num_tokens": 48582722.0,
"step": 770
},
{
"entropy": 1.3471085391938686,
"epoch": 0.1152695163852662,
"grad_norm": 0.08993726968765259,
"learning_rate": 8.848825181025565e-05,
"loss": 1.0392,
"mean_token_accuracy": 0.7386498197913169,
"num_tokens": 49199116.0,
"step": 780
},
{
"entropy": 1.3162727653980255,
"epoch": 0.1167473306978978,
"grad_norm": 0.09954085201025009,
"learning_rate": 8.834047583862864e-05,
"loss": 1.0419,
"mean_token_accuracy": 0.7357384979724884,
"num_tokens": 49811957.0,
"step": 790
},
{
"entropy": 1.383530154824257,
"epoch": 0.11822514501052943,
"grad_norm": 0.09826408326625824,
"learning_rate": 8.819269986700163e-05,
"loss": 1.0666,
"mean_token_accuracy": 0.7305501982569694,
"num_tokens": 50440552.0,
"step": 800
},
{
"entropy": 1.3697494626045228,
"epoch": 0.11970295932316105,
"grad_norm": 0.10563326627016068,
"learning_rate": 8.804492389537462e-05,
"loss": 1.0523,
"mean_token_accuracy": 0.7350135810673237,
"num_tokens": 51061803.0,
"step": 810
},
{
"entropy": 1.341452068090439,
"epoch": 0.12118077363579266,
"grad_norm": 0.09023787081241608,
"learning_rate": 8.789714792374761e-05,
"loss": 1.0403,
"mean_token_accuracy": 0.7364256352186203,
"num_tokens": 51701844.0,
"step": 820
},
{
"entropy": 1.3256843224167825,
"epoch": 0.12265858794842428,
"grad_norm": 0.10398595035076141,
"learning_rate": 8.774937195212058e-05,
"loss": 1.0393,
"mean_token_accuracy": 0.7345196448266507,
"num_tokens": 52321057.0,
"step": 830
},
{
"entropy": 1.335525282472372,
"epoch": 0.12413640226105589,
"grad_norm": 0.11134184151887894,
"learning_rate": 8.760159598049358e-05,
"loss": 1.0162,
"mean_token_accuracy": 0.7412177242338658,
"num_tokens": 52951518.0,
"step": 840
},
{
"entropy": 1.336845152825117,
"epoch": 0.12561421657368751,
"grad_norm": 0.086946502327919,
"learning_rate": 8.745382000886656e-05,
"loss": 1.0416,
"mean_token_accuracy": 0.7366455979645252,
"num_tokens": 53573218.0,
"step": 850
},
{
"entropy": 1.3725450590252877,
"epoch": 0.12709203088631912,
"grad_norm": 0.09215516597032547,
"learning_rate": 8.730604403723956e-05,
"loss": 1.0459,
"mean_token_accuracy": 0.7342949628829956,
"num_tokens": 54222656.0,
"step": 860
},
{
"entropy": 1.354390736669302,
"epoch": 0.12856984519895076,
"grad_norm": 0.10038048028945923,
"learning_rate": 8.715826806561254e-05,
"loss": 1.0333,
"mean_token_accuracy": 0.7372442290186882,
"num_tokens": 54842980.0,
"step": 870
},
{
"entropy": 1.3338057577610016,
"epoch": 0.13004765951158237,
"grad_norm": 0.10332565754652023,
"learning_rate": 8.701049209398552e-05,
"loss": 1.0016,
"mean_token_accuracy": 0.743568442761898,
"num_tokens": 55470934.0,
"step": 880
},
{
"entropy": 1.3483957901597023,
"epoch": 0.13152547382421398,
"grad_norm": 0.10096542537212372,
"learning_rate": 8.686271612235851e-05,
"loss": 1.0178,
"mean_token_accuracy": 0.7382646299898624,
"num_tokens": 56098516.0,
"step": 890
},
{
"entropy": 1.355156985670328,
"epoch": 0.13300328813684562,
"grad_norm": 0.09177613258361816,
"learning_rate": 8.67149401507315e-05,
"loss": 1.0531,
"mean_token_accuracy": 0.7352131024003029,
"num_tokens": 56730521.0,
"step": 900
},
{
"entropy": 1.3612438417971133,
"epoch": 0.13448110244947722,
"grad_norm": 0.10380206257104874,
"learning_rate": 8.656716417910447e-05,
"loss": 1.0372,
"mean_token_accuracy": 0.7388299435377121,
"num_tokens": 57365578.0,
"step": 910
},
{
"entropy": 1.3525446981191636,
"epoch": 0.13595891676210883,
"grad_norm": 0.1035575270652771,
"learning_rate": 8.641938820747746e-05,
"loss": 1.0256,
"mean_token_accuracy": 0.7397286184132099,
"num_tokens": 57981896.0,
"step": 920
},
{
"entropy": 1.3687459766864776,
"epoch": 0.13743673107474047,
"grad_norm": 0.11620025336742401,
"learning_rate": 8.627161223585045e-05,
"loss": 1.0773,
"mean_token_accuracy": 0.7295577853918076,
"num_tokens": 58623803.0,
"step": 930
},
{
"entropy": 1.2970949046313762,
"epoch": 0.13891454538737208,
"grad_norm": 0.12642642855644226,
"learning_rate": 8.612383626422344e-05,
"loss": 1.0003,
"mean_token_accuracy": 0.7444492764770985,
"num_tokens": 59257549.0,
"step": 940
},
{
"entropy": 1.3647193409502507,
"epoch": 0.1403923597000037,
"grad_norm": 0.09129887074232101,
"learning_rate": 8.597606029259643e-05,
"loss": 1.0544,
"mean_token_accuracy": 0.7329595319926738,
"num_tokens": 59904795.0,
"step": 950
},
{
"entropy": 1.3711084038019181,
"epoch": 0.14187017401263533,
"grad_norm": 0.09745678305625916,
"learning_rate": 8.582828432096942e-05,
"loss": 1.0401,
"mean_token_accuracy": 0.7385488845407963,
"num_tokens": 60540321.0,
"step": 960
},
{
"entropy": 1.3561458587646484,
"epoch": 0.14334798832526693,
"grad_norm": 0.08693372458219528,
"learning_rate": 8.56805083493424e-05,
"loss": 1.0711,
"mean_token_accuracy": 0.7356758877635002,
"num_tokens": 61168133.0,
"step": 970
},
{
"entropy": 1.3305564433336259,
"epoch": 0.14482580263789854,
"grad_norm": 0.10192687809467316,
"learning_rate": 8.553273237771538e-05,
"loss": 1.0222,
"mean_token_accuracy": 0.739366453140974,
"num_tokens": 61824608.0,
"step": 980
},
{
"entropy": 1.3484657399356366,
"epoch": 0.14630361695053015,
"grad_norm": 0.09656958281993866,
"learning_rate": 8.538495640608838e-05,
"loss": 1.0313,
"mean_token_accuracy": 0.7386878840625286,
"num_tokens": 62461355.0,
"step": 990
},
{
"entropy": 1.3336199022829534,
"epoch": 0.1477814312631618,
"grad_norm": 0.10654303431510925,
"learning_rate": 8.523718043446136e-05,
"loss": 1.0015,
"mean_token_accuracy": 0.746137623488903,
"num_tokens": 63078401.0,
"step": 1000
},
{
"entropy": 1.3014978118240834,
"epoch": 0.1492592455757934,
"grad_norm": 0.09964130073785782,
"learning_rate": 8.508940446283434e-05,
"loss": 1.0191,
"mean_token_accuracy": 0.7417861059308052,
"num_tokens": 63718537.0,
"step": 1010
},
{
"entropy": 1.3399860113859177,
"epoch": 0.150737059888425,
"grad_norm": 0.08968862146139145,
"learning_rate": 8.494162849120733e-05,
"loss": 1.0047,
"mean_token_accuracy": 0.7455361634492874,
"num_tokens": 64338633.0,
"step": 1020
},
{
"entropy": 1.3182545930147171,
"epoch": 0.15221487420105664,
"grad_norm": 0.0899863988161087,
"learning_rate": 8.479385251958032e-05,
"loss": 1.0171,
"mean_token_accuracy": 0.7432848289608955,
"num_tokens": 64961975.0,
"step": 1030
},
{
"entropy": 1.353651513904333,
"epoch": 0.15369268851368825,
"grad_norm": 0.09297753125429153,
"learning_rate": 8.46460765479533e-05,
"loss": 1.0514,
"mean_token_accuracy": 0.7368421874940395,
"num_tokens": 65609630.0,
"step": 1040
},
{
"entropy": 1.3273244500160217,
"epoch": 0.15517050282631986,
"grad_norm": 0.09529486298561096,
"learning_rate": 8.44983005763263e-05,
"loss": 1.009,
"mean_token_accuracy": 0.7426021553575992,
"num_tokens": 66245650.0,
"step": 1050
},
{
"entropy": 1.368097710609436,
"epoch": 0.1566483171389515,
"grad_norm": 0.09293153882026672,
"learning_rate": 8.435052460469927e-05,
"loss": 1.0697,
"mean_token_accuracy": 0.7321919746696949,
"num_tokens": 66863639.0,
"step": 1060
},
{
"entropy": 1.3512376546859741,
"epoch": 0.1581261314515831,
"grad_norm": 0.1249411553144455,
"learning_rate": 8.420274863307227e-05,
"loss": 1.0413,
"mean_token_accuracy": 0.7379166707396507,
"num_tokens": 67510835.0,
"step": 1070
},
{
"entropy": 1.361113614588976,
"epoch": 0.15960394576421472,
"grad_norm": 0.10599677264690399,
"learning_rate": 8.405497266144525e-05,
"loss": 1.0077,
"mean_token_accuracy": 0.7425113163888455,
"num_tokens": 68137204.0,
"step": 1080
},
{
"entropy": 1.3219519801437856,
"epoch": 0.16108176007684635,
"grad_norm": 0.10219158232212067,
"learning_rate": 8.390719668981824e-05,
"loss": 0.999,
"mean_token_accuracy": 0.7453721314668655,
"num_tokens": 68763413.0,
"step": 1090
},
{
"entropy": 1.3573527745902538,
"epoch": 0.16255957438947796,
"grad_norm": 0.1045592650771141,
"learning_rate": 8.375942071819122e-05,
"loss": 1.0636,
"mean_token_accuracy": 0.72975370362401,
"num_tokens": 69390107.0,
"step": 1100
},
{
"entropy": 1.3573613107204436,
"epoch": 0.16403738870210957,
"grad_norm": 0.10745666921138763,
"learning_rate": 8.361164474656421e-05,
"loss": 1.0349,
"mean_token_accuracy": 0.7413250155746937,
"num_tokens": 70010525.0,
"step": 1110
},
{
"entropy": 1.3403134599328042,
"epoch": 0.1655152030147412,
"grad_norm": 0.0995827317237854,
"learning_rate": 8.34638687749372e-05,
"loss": 1.0021,
"mean_token_accuracy": 0.7438825242221355,
"num_tokens": 70632944.0,
"step": 1120
},
{
"entropy": 1.3671005301177501,
"epoch": 0.16699301732737282,
"grad_norm": 0.0887172594666481,
"learning_rate": 8.331609280331019e-05,
"loss": 1.0582,
"mean_token_accuracy": 0.7311254240572452,
"num_tokens": 71257165.0,
"step": 1130
},
{
"entropy": 1.3606456398963929,
"epoch": 0.16847083164000443,
"grad_norm": 0.1006636694073677,
"learning_rate": 8.316831683168316e-05,
"loss": 1.0574,
"mean_token_accuracy": 0.7363891862332821,
"num_tokens": 71875620.0,
"step": 1140
},
{
"entropy": 1.3795763775706291,
"epoch": 0.16994864595263606,
"grad_norm": 0.09867120534181595,
"learning_rate": 8.302054086005617e-05,
"loss": 1.0769,
"mean_token_accuracy": 0.7298023782670497,
"num_tokens": 72504275.0,
"step": 1150
},
{
"entropy": 1.3562307357788086,
"epoch": 0.17142646026526767,
"grad_norm": 0.09309513121843338,
"learning_rate": 8.287276488842914e-05,
"loss": 1.0693,
"mean_token_accuracy": 0.7304324097931385,
"num_tokens": 73126833.0,
"step": 1160
},
{
"entropy": 1.3621578849852085,
"epoch": 0.17290427457789928,
"grad_norm": 0.09566682577133179,
"learning_rate": 8.272498891680214e-05,
"loss": 1.0251,
"mean_token_accuracy": 0.7400626718997956,
"num_tokens": 73752404.0,
"step": 1170
},
{
"entropy": 1.4058452486991881,
"epoch": 0.17438208889053092,
"grad_norm": 0.11750762909650803,
"learning_rate": 8.257721294517512e-05,
"loss": 1.0742,
"mean_token_accuracy": 0.7272376365959644,
"num_tokens": 74362684.0,
"step": 1180
},
{
"entropy": 1.3896878361701965,
"epoch": 0.17585990320316253,
"grad_norm": 0.09952221810817719,
"learning_rate": 8.24294369735481e-05,
"loss": 1.0586,
"mean_token_accuracy": 0.7340771615505218,
"num_tokens": 75002180.0,
"step": 1190
},
{
"entropy": 1.3103776380419732,
"epoch": 0.17733771751579414,
"grad_norm": 0.10058079659938812,
"learning_rate": 8.228166100192109e-05,
"loss": 1.0286,
"mean_token_accuracy": 0.7388425670564175,
"num_tokens": 75614482.0,
"step": 1200
},
{
"entropy": 1.3207942619919777,
"epoch": 0.17881553182842574,
"grad_norm": 0.10897091031074524,
"learning_rate": 8.213388503029408e-05,
"loss": 1.0062,
"mean_token_accuracy": 0.7426742933690548,
"num_tokens": 76233339.0,
"step": 1210
},
{
"entropy": 1.3723637834191322,
"epoch": 0.18029334614105738,
"grad_norm": 0.10692214965820312,
"learning_rate": 8.198610905866706e-05,
"loss": 1.0752,
"mean_token_accuracy": 0.7321088790893555,
"num_tokens": 76859078.0,
"step": 1220
},
{
"entropy": 1.3349768593907356,
"epoch": 0.181771160453689,
"grad_norm": 0.09243787080049515,
"learning_rate": 8.183833308704006e-05,
"loss": 1.0172,
"mean_token_accuracy": 0.7384184874594212,
"num_tokens": 77465601.0,
"step": 1230
},
{
"entropy": 1.3455742478370667,
"epoch": 0.1832489747663206,
"grad_norm": 0.10957092046737671,
"learning_rate": 8.169055711541303e-05,
"loss": 1.0392,
"mean_token_accuracy": 0.7363815769553185,
"num_tokens": 78100003.0,
"step": 1240
},
{
"entropy": 1.319041520357132,
"epoch": 0.18472678907895224,
"grad_norm": 0.11203034967184067,
"learning_rate": 8.154278114378603e-05,
"loss": 0.9958,
"mean_token_accuracy": 0.7451054699718952,
"num_tokens": 78730233.0,
"step": 1250
},
{
"entropy": 1.3591867417097092,
"epoch": 0.18620460339158384,
"grad_norm": 0.09445121139287949,
"learning_rate": 8.139500517215901e-05,
"loss": 1.0607,
"mean_token_accuracy": 0.7338679365813732,
"num_tokens": 79369952.0,
"step": 1260
},
{
"entropy": 1.361959970742464,
"epoch": 0.18768241770421545,
"grad_norm": 0.10090041160583496,
"learning_rate": 8.1247229200532e-05,
"loss": 1.033,
"mean_token_accuracy": 0.7382201731204987,
"num_tokens": 79991924.0,
"step": 1270
},
{
"entropy": 1.3733899019658566,
"epoch": 0.1891602320168471,
"grad_norm": 0.11175256967544556,
"learning_rate": 8.109945322890499e-05,
"loss": 1.0614,
"mean_token_accuracy": 0.7336510412395001,
"num_tokens": 80624605.0,
"step": 1280
},
{
"entropy": 1.3171687975525856,
"epoch": 0.1906380463294787,
"grad_norm": 0.09502006322145462,
"learning_rate": 8.095167725727797e-05,
"loss": 1.0089,
"mean_token_accuracy": 0.7437012106180191,
"num_tokens": 81246229.0,
"step": 1290
},
{
"entropy": 1.3213663816452026,
"epoch": 0.1921158606421103,
"grad_norm": 0.09498457610607147,
"learning_rate": 8.080390128565096e-05,
"loss": 1.0026,
"mean_token_accuracy": 0.7472335807979107,
"num_tokens": 81888427.0,
"step": 1300
},
{
"entropy": 1.34869996458292,
"epoch": 0.19359367495474195,
"grad_norm": 0.11866965889930725,
"learning_rate": 8.065612531402395e-05,
"loss": 1.0224,
"mean_token_accuracy": 0.740996740013361,
"num_tokens": 82510238.0,
"step": 1310
},
{
"entropy": 1.3141113609075545,
"epoch": 0.19507148926737355,
"grad_norm": 0.11258051544427872,
"learning_rate": 8.050834934239692e-05,
"loss": 0.9994,
"mean_token_accuracy": 0.7447339169681072,
"num_tokens": 83147811.0,
"step": 1320
},
{
"entropy": 1.3105146937072276,
"epoch": 0.19654930358000516,
"grad_norm": 0.1201222687959671,
"learning_rate": 8.036057337076993e-05,
"loss": 1.015,
"mean_token_accuracy": 0.7396009095013142,
"num_tokens": 83783269.0,
"step": 1330
},
{
"entropy": 1.3794904358685016,
"epoch": 0.1980271178926368,
"grad_norm": 0.11637024581432343,
"learning_rate": 8.02127973991429e-05,
"loss": 1.0717,
"mean_token_accuracy": 0.7308213971555233,
"num_tokens": 84434671.0,
"step": 1340
},
{
"entropy": 1.3391420371830463,
"epoch": 0.1995049322052684,
"grad_norm": 0.10482585430145264,
"learning_rate": 8.006502142751589e-05,
"loss": 1.0063,
"mean_token_accuracy": 0.7450359672307968,
"num_tokens": 85051200.0,
"step": 1350
},
{
"entropy": 1.3461947545409203,
"epoch": 0.20098274651790002,
"grad_norm": 0.10634397715330124,
"learning_rate": 7.991724545588888e-05,
"loss": 1.0521,
"mean_token_accuracy": 0.7360609002411366,
"num_tokens": 85686910.0,
"step": 1360
},
{
"entropy": 1.328591948747635,
"epoch": 0.20246056083053166,
"grad_norm": 0.10722459852695465,
"learning_rate": 7.976946948426187e-05,
"loss": 1.0035,
"mean_token_accuracy": 0.7449103698134423,
"num_tokens": 86309849.0,
"step": 1370
},
{
"entropy": 1.3918874174356461,
"epoch": 0.20393837514316326,
"grad_norm": 0.1124623566865921,
"learning_rate": 7.962169351263485e-05,
"loss": 1.0747,
"mean_token_accuracy": 0.7297042839229106,
"num_tokens": 86946736.0,
"step": 1380
},
{
"entropy": 1.3307641319930554,
"epoch": 0.20541618945579487,
"grad_norm": 0.10401839017868042,
"learning_rate": 7.947391754100784e-05,
"loss": 1.0247,
"mean_token_accuracy": 0.7394670993089676,
"num_tokens": 87587364.0,
"step": 1390
},
{
"entropy": 1.3134734809398652,
"epoch": 0.2068940037684265,
"grad_norm": 0.1127687469124794,
"learning_rate": 7.932614156938082e-05,
"loss": 0.977,
"mean_token_accuracy": 0.7489233329892159,
"num_tokens": 88201969.0,
"step": 1400
},
{
"entropy": 1.321236951649189,
"epoch": 0.20837181808105812,
"grad_norm": 0.1230587363243103,
"learning_rate": 7.91783655977538e-05,
"loss": 1.0014,
"mean_token_accuracy": 0.7438783705234527,
"num_tokens": 88841442.0,
"step": 1410
},
{
"entropy": 1.3525510422885418,
"epoch": 0.20984963239368973,
"grad_norm": 0.11645467579364777,
"learning_rate": 7.90305896261268e-05,
"loss": 1.0365,
"mean_token_accuracy": 0.7380785860121251,
"num_tokens": 89460444.0,
"step": 1420
},
{
"entropy": 1.3169463470578193,
"epoch": 0.21132744670632134,
"grad_norm": 0.09807448834180832,
"learning_rate": 7.888281365449978e-05,
"loss": 1.0151,
"mean_token_accuracy": 0.7428149476647377,
"num_tokens": 90085094.0,
"step": 1430
},
{
"entropy": 1.3019375145435332,
"epoch": 0.21280526101895297,
"grad_norm": 0.0929834321141243,
"learning_rate": 7.873503768287277e-05,
"loss": 0.9708,
"mean_token_accuracy": 0.7490074157714843,
"num_tokens": 90721323.0,
"step": 1440
},
{
"entropy": 1.3838747300207614,
"epoch": 0.21428307533158458,
"grad_norm": 0.12123925238847733,
"learning_rate": 7.858726171124576e-05,
"loss": 1.0593,
"mean_token_accuracy": 0.7317282311618328,
"num_tokens": 91347998.0,
"step": 1450
},
{
"entropy": 1.3161128632724286,
"epoch": 0.2157608896442162,
"grad_norm": 0.0967702642083168,
"learning_rate": 7.843948573961875e-05,
"loss": 1.0023,
"mean_token_accuracy": 0.745752614736557,
"num_tokens": 91987480.0,
"step": 1460
},
{
"entropy": 1.358607316762209,
"epoch": 0.21723870395684783,
"grad_norm": 0.09103115648031235,
"learning_rate": 7.829170976799172e-05,
"loss": 1.0225,
"mean_token_accuracy": 0.7394160240888595,
"num_tokens": 92606958.0,
"step": 1470
},
{
"entropy": 1.2861947104334832,
"epoch": 0.21871651826947944,
"grad_norm": 0.09953464567661285,
"learning_rate": 7.814393379636471e-05,
"loss": 1.0021,
"mean_token_accuracy": 0.7471014529466629,
"num_tokens": 93241419.0,
"step": 1480
},
{
"entropy": 1.348529851436615,
"epoch": 0.22019433258211105,
"grad_norm": 0.11342471837997437,
"learning_rate": 7.79961578247377e-05,
"loss": 1.0311,
"mean_token_accuracy": 0.741535271704197,
"num_tokens": 93852674.0,
"step": 1490
},
{
"entropy": 1.3192447304725647,
"epoch": 0.22167214689474268,
"grad_norm": 0.09268448501825333,
"learning_rate": 7.784838185311069e-05,
"loss": 1.0193,
"mean_token_accuracy": 0.7420137017965317,
"num_tokens": 94457071.0,
"step": 1500
},
{
"entropy": 1.2933300271630288,
"epoch": 0.2231499612073743,
"grad_norm": 0.11778298020362854,
"learning_rate": 7.770060588148367e-05,
"loss": 1.0038,
"mean_token_accuracy": 0.7440440624952316,
"num_tokens": 95096857.0,
"step": 1510
},
{
"entropy": 1.3399901308119297,
"epoch": 0.2246277755200059,
"grad_norm": 0.10314805060625076,
"learning_rate": 7.755282990985666e-05,
"loss": 1.0432,
"mean_token_accuracy": 0.7347467452287674,
"num_tokens": 95710251.0,
"step": 1520
},
{
"entropy": 1.3574152827262878,
"epoch": 0.22610558983263754,
"grad_norm": 0.09815168380737305,
"learning_rate": 7.740505393822964e-05,
"loss": 1.0236,
"mean_token_accuracy": 0.7383907742798328,
"num_tokens": 96349869.0,
"step": 1530
},
{
"entropy": 1.3190400637686253,
"epoch": 0.22758340414526915,
"grad_norm": 0.10603173822164536,
"learning_rate": 7.725727796660264e-05,
"loss": 0.9934,
"mean_token_accuracy": 0.7460605546832084,
"num_tokens": 96970099.0,
"step": 1540
},
{
"entropy": 1.3596270292997361,
"epoch": 0.22906121845790076,
"grad_norm": 0.11921924352645874,
"learning_rate": 7.710950199497561e-05,
"loss": 1.0268,
"mean_token_accuracy": 0.7397349782288074,
"num_tokens": 97582834.0,
"step": 1550
},
{
"entropy": 1.3366517312824726,
"epoch": 0.2305390327705324,
"grad_norm": 0.09995236247777939,
"learning_rate": 7.696172602334862e-05,
"loss": 1.0421,
"mean_token_accuracy": 0.7388435758650302,
"num_tokens": 98206744.0,
"step": 1560
},
{
"entropy": 1.3542730413377284,
"epoch": 0.232016847083164,
"grad_norm": 0.11093679815530777,
"learning_rate": 7.681395005172159e-05,
"loss": 1.0324,
"mean_token_accuracy": 0.736759950965643,
"num_tokens": 98822084.0,
"step": 1570
},
{
"entropy": 1.3538315087556838,
"epoch": 0.2334946613957956,
"grad_norm": 0.10785405337810516,
"learning_rate": 7.666617408009458e-05,
"loss": 1.0234,
"mean_token_accuracy": 0.7402111329138279,
"num_tokens": 99448192.0,
"step": 1580
},
{
"entropy": 1.3442205354571342,
"epoch": 0.23497247570842725,
"grad_norm": 0.10176731646060944,
"learning_rate": 7.651839810846757e-05,
"loss": 1.0359,
"mean_token_accuracy": 0.7362779274582862,
"num_tokens": 100103673.0,
"step": 1590
},
{
"entropy": 1.3559410147368909,
"epoch": 0.23645029002105886,
"grad_norm": 0.10286710411310196,
"learning_rate": 7.637062213684055e-05,
"loss": 1.0519,
"mean_token_accuracy": 0.7352492958307266,
"num_tokens": 100738247.0,
"step": 1600
},
{
"entropy": 1.3641400419175624,
"epoch": 0.23792810433369047,
"grad_norm": 0.10766908526420593,
"learning_rate": 7.622284616521353e-05,
"loss": 1.0449,
"mean_token_accuracy": 0.7377994388341904,
"num_tokens": 101354199.0,
"step": 1610
},
{
"entropy": 1.3450035892426968,
"epoch": 0.2394059186463221,
"grad_norm": 0.10041961818933487,
"learning_rate": 7.607507019358653e-05,
"loss": 1.0217,
"mean_token_accuracy": 0.7392164841294289,
"num_tokens": 101991436.0,
"step": 1620
},
{
"entropy": 1.3661194667220116,
"epoch": 0.2408837329589537,
"grad_norm": 0.12022734433412552,
"learning_rate": 7.59272942219595e-05,
"loss": 1.0655,
"mean_token_accuracy": 0.7299047157168388,
"num_tokens": 102597689.0,
"step": 1630
},
{
"entropy": 1.35709098726511,
"epoch": 0.24236154727158532,
"grad_norm": 0.10375872999429703,
"learning_rate": 7.577951825033251e-05,
"loss": 1.0283,
"mean_token_accuracy": 0.7381139561533928,
"num_tokens": 103230722.0,
"step": 1640
},
{
"entropy": 1.3297756418585778,
"epoch": 0.24383936158421693,
"grad_norm": 0.10695882141590118,
"learning_rate": 7.563174227870548e-05,
"loss": 1.0368,
"mean_token_accuracy": 0.7364217408001423,
"num_tokens": 103860203.0,
"step": 1650
},
{
"entropy": 1.3703177645802498,
"epoch": 0.24531717589684857,
"grad_norm": 0.10709354281425476,
"learning_rate": 7.548396630707847e-05,
"loss": 1.0388,
"mean_token_accuracy": 0.7379512034356595,
"num_tokens": 104484571.0,
"step": 1660
},
{
"entropy": 1.3768685176968574,
"epoch": 0.24679499020948018,
"grad_norm": 0.12744958698749542,
"learning_rate": 7.533619033545146e-05,
"loss": 1.0563,
"mean_token_accuracy": 0.7327473036944866,
"num_tokens": 105093868.0,
"step": 1670
},
{
"entropy": 1.377336809784174,
"epoch": 0.24827280452211178,
"grad_norm": 0.10518407076597214,
"learning_rate": 7.518841436382445e-05,
"loss": 1.0808,
"mean_token_accuracy": 0.733013579249382,
"num_tokens": 105714000.0,
"step": 1680
},
{
"entropy": 1.3496724091470242,
"epoch": 0.24975061883474342,
"grad_norm": 0.1317768543958664,
"learning_rate": 7.504063839219744e-05,
"loss": 0.9933,
"mean_token_accuracy": 0.7478909485042096,
"num_tokens": 106346942.0,
"step": 1690
},
{
"entropy": 1.3175810858607293,
"epoch": 0.25122843314737503,
"grad_norm": 0.11672790348529816,
"learning_rate": 7.489286242057042e-05,
"loss": 1.0113,
"mean_token_accuracy": 0.7453901283442974,
"num_tokens": 106981893.0,
"step": 1700
},
{
"entropy": 1.3557366229593755,
"epoch": 0.25270624746000664,
"grad_norm": 0.0951073095202446,
"learning_rate": 7.47450864489434e-05,
"loss": 1.0431,
"mean_token_accuracy": 0.7352614618837834,
"num_tokens": 107616980.0,
"step": 1710
},
{
"entropy": 1.3488038405776024,
"epoch": 0.25418406177263825,
"grad_norm": 0.09690382331609726,
"learning_rate": 7.45973104773164e-05,
"loss": 1.0433,
"mean_token_accuracy": 0.7353552646934987,
"num_tokens": 108240730.0,
"step": 1720
},
{
"entropy": 1.318380505591631,
"epoch": 0.2556618760852699,
"grad_norm": 0.10357276350259781,
"learning_rate": 7.444953450568937e-05,
"loss": 1.0115,
"mean_token_accuracy": 0.7435870662331581,
"num_tokens": 108881320.0,
"step": 1730
},
{
"entropy": 1.317159901559353,
"epoch": 0.2571396903979015,
"grad_norm": 0.09926076978445053,
"learning_rate": 7.430175853406236e-05,
"loss": 0.996,
"mean_token_accuracy": 0.7481661081314087,
"num_tokens": 109516511.0,
"step": 1740
},
{
"entropy": 1.3350887671113014,
"epoch": 0.25861750471053313,
"grad_norm": 0.1110028401017189,
"learning_rate": 7.415398256243535e-05,
"loss": 1.0047,
"mean_token_accuracy": 0.7430928081274033,
"num_tokens": 110150208.0,
"step": 1750
},
{
"entropy": 1.3338087685406208,
"epoch": 0.26009531902316474,
"grad_norm": 0.1074734628200531,
"learning_rate": 7.400620659080834e-05,
"loss": 1.0192,
"mean_token_accuracy": 0.7407279655337333,
"num_tokens": 110778288.0,
"step": 1760
},
{
"entropy": 1.3606950506567954,
"epoch": 0.26157313333579635,
"grad_norm": 0.10617410391569138,
"learning_rate": 7.385843061918133e-05,
"loss": 1.0346,
"mean_token_accuracy": 0.7412132248282433,
"num_tokens": 111406540.0,
"step": 1770
},
{
"entropy": 1.3470192208886147,
"epoch": 0.26305094764842796,
"grad_norm": 0.08930668979883194,
"learning_rate": 7.371065464755432e-05,
"loss": 1.0349,
"mean_token_accuracy": 0.7382924191653728,
"num_tokens": 112046988.0,
"step": 1780
},
{
"entropy": 1.3257930040359498,
"epoch": 0.26452876196105957,
"grad_norm": 0.11683688312768936,
"learning_rate": 7.356287867592729e-05,
"loss": 0.9749,
"mean_token_accuracy": 0.7466934151947499,
"num_tokens": 112662431.0,
"step": 1790
},
{
"entropy": 1.3634838439524173,
"epoch": 0.26600657627369123,
"grad_norm": 0.113424152135849,
"learning_rate": 7.341510270430029e-05,
"loss": 1.0636,
"mean_token_accuracy": 0.73306784927845,
"num_tokens": 113273230.0,
"step": 1800
},
{
"entropy": 1.3364275880157948,
"epoch": 0.26748439058632284,
"grad_norm": 0.09862840175628662,
"learning_rate": 7.326732673267327e-05,
"loss": 1.0085,
"mean_token_accuracy": 0.7427501030266285,
"num_tokens": 113909313.0,
"step": 1810
},
{
"entropy": 1.3659813731908799,
"epoch": 0.26896220489895445,
"grad_norm": 0.12104249000549316,
"learning_rate": 7.311955076104627e-05,
"loss": 1.0439,
"mean_token_accuracy": 0.7362107425928116,
"num_tokens": 114514504.0,
"step": 1820
},
{
"entropy": 1.328355757892132,
"epoch": 0.27044001921158606,
"grad_norm": 0.11729808896780014,
"learning_rate": 7.297177478941924e-05,
"loss": 0.9775,
"mean_token_accuracy": 0.7475184448063373,
"num_tokens": 115140702.0,
"step": 1830
},
{
"entropy": 1.3406167194247245,
"epoch": 0.27191783352421767,
"grad_norm": 0.09913574159145355,
"learning_rate": 7.282399881779223e-05,
"loss": 1.0179,
"mean_token_accuracy": 0.7432191327214241,
"num_tokens": 115755068.0,
"step": 1840
},
{
"entropy": 1.3977623000741004,
"epoch": 0.2733956478368493,
"grad_norm": 0.0984942838549614,
"learning_rate": 7.267622284616522e-05,
"loss": 1.0822,
"mean_token_accuracy": 0.7289882197976112,
"num_tokens": 116354942.0,
"step": 1850
},
{
"entropy": 1.3664689101278782,
"epoch": 0.27487346214948094,
"grad_norm": 0.10869049280881882,
"learning_rate": 7.252844687453821e-05,
"loss": 1.0238,
"mean_token_accuracy": 0.7409933775663375,
"num_tokens": 116988534.0,
"step": 1860
},
{
"entropy": 1.315875554829836,
"epoch": 0.27635127646211255,
"grad_norm": 0.12993551790714264,
"learning_rate": 7.238067090291118e-05,
"loss": 0.9935,
"mean_token_accuracy": 0.7480652235448361,
"num_tokens": 117641953.0,
"step": 1870
},
{
"entropy": 1.2959641508758069,
"epoch": 0.27782909077474416,
"grad_norm": 0.09623228758573532,
"learning_rate": 7.223289493128419e-05,
"loss": 0.9943,
"mean_token_accuracy": 0.7439824365079403,
"num_tokens": 118256692.0,
"step": 1880
},
{
"entropy": 1.371036985516548,
"epoch": 0.27930690508737577,
"grad_norm": 0.11579816788434982,
"learning_rate": 7.208511895965716e-05,
"loss": 1.0556,
"mean_token_accuracy": 0.7361032791435719,
"num_tokens": 118891210.0,
"step": 1890
},
{
"entropy": 1.3036040149629116,
"epoch": 0.2807847194000074,
"grad_norm": 0.12691327929496765,
"learning_rate": 7.193734298803015e-05,
"loss": 0.9843,
"mean_token_accuracy": 0.7478345915675163,
"num_tokens": 119504239.0,
"step": 1900
},
{
"entropy": 1.3748640805482863,
"epoch": 0.282262533712639,
"grad_norm": 0.10164857655763626,
"learning_rate": 7.178956701640314e-05,
"loss": 1.0413,
"mean_token_accuracy": 0.7376060217618943,
"num_tokens": 120143691.0,
"step": 1910
},
{
"entropy": 1.361726462095976,
"epoch": 0.28374034802527065,
"grad_norm": 0.14407841861248016,
"learning_rate": 7.164179104477612e-05,
"loss": 1.0475,
"mean_token_accuracy": 0.7337219528853893,
"num_tokens": 120768595.0,
"step": 1920
},
{
"entropy": 1.3406222008168698,
"epoch": 0.28521816233790226,
"grad_norm": 0.12444034963846207,
"learning_rate": 7.149401507314911e-05,
"loss": 1.0261,
"mean_token_accuracy": 0.7425919137895107,
"num_tokens": 121398440.0,
"step": 1930
},
{
"entropy": 1.3530367895960809,
"epoch": 0.28669597665053387,
"grad_norm": 0.11323665827512741,
"learning_rate": 7.13462391015221e-05,
"loss": 1.03,
"mean_token_accuracy": 0.7408431887626648,
"num_tokens": 122014717.0,
"step": 1940
},
{
"entropy": 1.3645049922168255,
"epoch": 0.2881737909631655,
"grad_norm": 0.11987091600894928,
"learning_rate": 7.119846312989509e-05,
"loss": 1.0452,
"mean_token_accuracy": 0.7358455255627632,
"num_tokens": 122641856.0,
"step": 1950
},
{
"entropy": 1.3496552132070065,
"epoch": 0.2896516052757971,
"grad_norm": 0.11011224240064621,
"learning_rate": 7.105068715826806e-05,
"loss": 1.0348,
"mean_token_accuracy": 0.7365316428244114,
"num_tokens": 123259881.0,
"step": 1960
},
{
"entropy": 1.3554118975996972,
"epoch": 0.2911294195884287,
"grad_norm": 0.10278936475515366,
"learning_rate": 7.090291118664105e-05,
"loss": 1.0429,
"mean_token_accuracy": 0.734364154189825,
"num_tokens": 123883169.0,
"step": 1970
},
{
"entropy": 1.3658627800643444,
"epoch": 0.2926072339010603,
"grad_norm": 0.11712102591991425,
"learning_rate": 7.075513521501404e-05,
"loss": 1.0508,
"mean_token_accuracy": 0.7375255465507508,
"num_tokens": 124499574.0,
"step": 1980
},
{
"entropy": 1.3808431923389435,
"epoch": 0.29408504821369197,
"grad_norm": 0.12582142651081085,
"learning_rate": 7.060735924338703e-05,
"loss": 1.0752,
"mean_token_accuracy": 0.7313126713037491,
"num_tokens": 125126498.0,
"step": 1990
},
{
"entropy": 1.2969964474439621,
"epoch": 0.2955628625263236,
"grad_norm": 0.10375986248254776,
"learning_rate": 7.045958327176002e-05,
"loss": 1.0082,
"mean_token_accuracy": 0.7448927208781242,
"num_tokens": 125753238.0,
"step": 2000
},
{
"entropy": 1.3703055553138257,
"epoch": 0.2970406768389552,
"grad_norm": 0.11782936006784439,
"learning_rate": 7.0311807300133e-05,
"loss": 1.0193,
"mean_token_accuracy": 0.7416508063673973,
"num_tokens": 126374538.0,
"step": 2010
},
{
"entropy": 1.3585199259221554,
"epoch": 0.2985184911515868,
"grad_norm": 0.12770617008209229,
"learning_rate": 7.016403132850598e-05,
"loss": 1.0288,
"mean_token_accuracy": 0.740058358758688,
"num_tokens": 126994217.0,
"step": 2020
},
{
"entropy": 1.3496723629534244,
"epoch": 0.2999963054642184,
"grad_norm": 0.09809058904647827,
"learning_rate": 7.001625535687898e-05,
"loss": 1.0035,
"mean_token_accuracy": 0.7450730398297309,
"num_tokens": 127635972.0,
"step": 2030
},
{
"entropy": 1.3468332551419735,
"epoch": 0.30147411977685,
"grad_norm": 0.1129288524389267,
"learning_rate": 6.986847938525196e-05,
"loss": 1.018,
"mean_token_accuracy": 0.7407178491353988,
"num_tokens": 128259337.0,
"step": 2040
},
{
"entropy": 1.3580288112163543,
"epoch": 0.3029519340894817,
"grad_norm": 0.107613705098629,
"learning_rate": 6.972070341362494e-05,
"loss": 1.0521,
"mean_token_accuracy": 0.7362593986093998,
"num_tokens": 128878282.0,
"step": 2050
},
{
"entropy": 1.3525773376226424,
"epoch": 0.3044297484021133,
"grad_norm": 0.11789864301681519,
"learning_rate": 6.957292744199793e-05,
"loss": 1.0227,
"mean_token_accuracy": 0.7409359261393547,
"num_tokens": 129496376.0,
"step": 2060
},
{
"entropy": 1.3889159947633742,
"epoch": 0.3059075627147449,
"grad_norm": 0.10157744586467743,
"learning_rate": 6.942515147037092e-05,
"loss": 1.0735,
"mean_token_accuracy": 0.7293846361339092,
"num_tokens": 130133618.0,
"step": 2070
},
{
"entropy": 1.3392279900610446,
"epoch": 0.3073853770273765,
"grad_norm": 0.09857992082834244,
"learning_rate": 6.927737549874391e-05,
"loss": 1.0034,
"mean_token_accuracy": 0.7396849572658539,
"num_tokens": 130775922.0,
"step": 2080
},
{
"entropy": 1.354237724840641,
"epoch": 0.3088631913400081,
"grad_norm": 0.11697685718536377,
"learning_rate": 6.91295995271169e-05,
"loss": 1.0398,
"mean_token_accuracy": 0.7384343758225441,
"num_tokens": 131421760.0,
"step": 2090
},
{
"entropy": 1.3637243047356606,
"epoch": 0.3103410056526397,
"grad_norm": 0.10802293568849564,
"learning_rate": 6.898182355548987e-05,
"loss": 1.0496,
"mean_token_accuracy": 0.7360463313758373,
"num_tokens": 132027760.0,
"step": 2100
},
{
"entropy": 1.3234611213207246,
"epoch": 0.3118188199652714,
"grad_norm": 0.11391324549913406,
"learning_rate": 6.883404758386287e-05,
"loss": 0.9698,
"mean_token_accuracy": 0.7520683214068413,
"num_tokens": 132638973.0,
"step": 2110
},
{
"entropy": 1.327374517172575,
"epoch": 0.313296634277903,
"grad_norm": 0.0961180180311203,
"learning_rate": 6.868627161223585e-05,
"loss": 0.9911,
"mean_token_accuracy": 0.7429872818291188,
"num_tokens": 133269852.0,
"step": 2120
},
{
"entropy": 1.3173839271068573,
"epoch": 0.3147744485905346,
"grad_norm": 0.10153747349977493,
"learning_rate": 6.853849564060884e-05,
"loss": 1.0188,
"mean_token_accuracy": 0.7429009906947612,
"num_tokens": 133902116.0,
"step": 2130
},
{
"entropy": 1.3764125563204288,
"epoch": 0.3162522629031662,
"grad_norm": 0.10402517765760422,
"learning_rate": 6.839071966898183e-05,
"loss": 1.0249,
"mean_token_accuracy": 0.7386217057704926,
"num_tokens": 134527984.0,
"step": 2140
},
{
"entropy": 1.3320019409060477,
"epoch": 0.3177300772157978,
"grad_norm": 0.13321658968925476,
"learning_rate": 6.824294369735481e-05,
"loss": 1.0181,
"mean_token_accuracy": 0.7429975025355816,
"num_tokens": 135171015.0,
"step": 2150
},
{
"entropy": 1.323284325748682,
"epoch": 0.31920789152842943,
"grad_norm": 0.11596138030290604,
"learning_rate": 6.80951677257278e-05,
"loss": 0.9763,
"mean_token_accuracy": 0.7492162629961967,
"num_tokens": 135802769.0,
"step": 2160
},
{
"entropy": 1.3504845738410949,
"epoch": 0.3206857058410611,
"grad_norm": 0.11453942209482193,
"learning_rate": 6.794739175410079e-05,
"loss": 1.0587,
"mean_token_accuracy": 0.7336528770625591,
"num_tokens": 136428189.0,
"step": 2170
},
{
"entropy": 1.3354684211313725,
"epoch": 0.3221635201536927,
"grad_norm": 0.1275642067193985,
"learning_rate": 6.779961578247376e-05,
"loss": 1.0044,
"mean_token_accuracy": 0.7408880606293679,
"num_tokens": 137070498.0,
"step": 2180
},
{
"entropy": 1.368819622695446,
"epoch": 0.3236413344663243,
"grad_norm": 0.12235371768474579,
"learning_rate": 6.765183981084677e-05,
"loss": 1.0535,
"mean_token_accuracy": 0.7341696232557297,
"num_tokens": 137679641.0,
"step": 2190
},
{
"entropy": 1.3225167870521546,
"epoch": 0.3251191487789559,
"grad_norm": 0.09812725335359573,
"learning_rate": 6.750406383921974e-05,
"loss": 1.0252,
"mean_token_accuracy": 0.7395187027752399,
"num_tokens": 138336216.0,
"step": 2200
},
{
"entropy": 1.367988857626915,
"epoch": 0.32659696309158753,
"grad_norm": 0.12514571845531464,
"learning_rate": 6.735628786759274e-05,
"loss": 1.0716,
"mean_token_accuracy": 0.7310583747923374,
"num_tokens": 138963175.0,
"step": 2210
},
{
"entropy": 1.3490555189549922,
"epoch": 0.32807477740421914,
"grad_norm": 0.12653544545173645,
"learning_rate": 6.720851189596572e-05,
"loss": 1.063,
"mean_token_accuracy": 0.7345262944698334,
"num_tokens": 139600194.0,
"step": 2220
},
{
"entropy": 1.3446317560970784,
"epoch": 0.32955259171685075,
"grad_norm": 0.10482878983020782,
"learning_rate": 6.70607359243387e-05,
"loss": 1.0391,
"mean_token_accuracy": 0.7383916914463043,
"num_tokens": 140237377.0,
"step": 2230
},
{
"entropy": 1.3320685289800167,
"epoch": 0.3310304060294824,
"grad_norm": 0.10686700791120529,
"learning_rate": 6.69129599527117e-05,
"loss": 1.0304,
"mean_token_accuracy": 0.737852866947651,
"num_tokens": 140853893.0,
"step": 2240
},
{
"entropy": 1.3207725331187248,
"epoch": 0.332508220342114,
"grad_norm": 0.10360251367092133,
"learning_rate": 6.676518398108468e-05,
"loss": 1.0,
"mean_token_accuracy": 0.7466425992548466,
"num_tokens": 141471387.0,
"step": 2250
},
{
"entropy": 1.3336294353008271,
"epoch": 0.33398603465474563,
"grad_norm": 0.12046889215707779,
"learning_rate": 6.661740800945766e-05,
"loss": 1.0763,
"mean_token_accuracy": 0.7299591615796089,
"num_tokens": 142102862.0,
"step": 2260
},
{
"entropy": 1.3241831846535206,
"epoch": 0.33546384896737724,
"grad_norm": 0.11208558082580566,
"learning_rate": 6.646963203783066e-05,
"loss": 1.0077,
"mean_token_accuracy": 0.7427926994860172,
"num_tokens": 142712641.0,
"step": 2270
},
{
"entropy": 1.2987228810787201,
"epoch": 0.33694166328000885,
"grad_norm": 0.10891300439834595,
"learning_rate": 6.632185606620363e-05,
"loss": 1.0021,
"mean_token_accuracy": 0.746040652692318,
"num_tokens": 143357692.0,
"step": 2280
},
{
"entropy": 1.3333717592060566,
"epoch": 0.33841947759264046,
"grad_norm": 0.107634037733078,
"learning_rate": 6.617408009457664e-05,
"loss": 1.0051,
"mean_token_accuracy": 0.7442885607481002,
"num_tokens": 143990646.0,
"step": 2290
},
{
"entropy": 1.370392120629549,
"epoch": 0.3398972919052721,
"grad_norm": 0.10865243524312973,
"learning_rate": 6.602630412294961e-05,
"loss": 1.0692,
"mean_token_accuracy": 0.7315164700150489,
"num_tokens": 144619931.0,
"step": 2300
},
{
"entropy": 1.3540328681468963,
"epoch": 0.34137510621790373,
"grad_norm": 0.1158401146531105,
"learning_rate": 6.58785281513226e-05,
"loss": 1.0555,
"mean_token_accuracy": 0.7361217260360717,
"num_tokens": 145241748.0,
"step": 2310
},
{
"entropy": 1.3016823388636112,
"epoch": 0.34285292053053534,
"grad_norm": 0.11778155714273453,
"learning_rate": 6.573075217969559e-05,
"loss": 0.9845,
"mean_token_accuracy": 0.747497683763504,
"num_tokens": 145871775.0,
"step": 2320
},
{
"entropy": 1.32976598367095,
"epoch": 0.34433073484316695,
"grad_norm": 0.11029067635536194,
"learning_rate": 6.558297620806857e-05,
"loss": 1.0369,
"mean_token_accuracy": 0.7379365123808383,
"num_tokens": 146520142.0,
"step": 2330
},
{
"entropy": 1.3770955115556718,
"epoch": 0.34580854915579856,
"grad_norm": 0.15313439071178436,
"learning_rate": 6.543520023644156e-05,
"loss": 1.0408,
"mean_token_accuracy": 0.7377210259437561,
"num_tokens": 147155097.0,
"step": 2340
},
{
"entropy": 1.3539579182863235,
"epoch": 0.34728636346843017,
"grad_norm": 0.1262284517288208,
"learning_rate": 6.528742426481455e-05,
"loss": 1.0508,
"mean_token_accuracy": 0.7372145742177963,
"num_tokens": 147790753.0,
"step": 2350
},
{
"entropy": 1.3089107267558575,
"epoch": 0.34876417778106183,
"grad_norm": 0.11003509908914566,
"learning_rate": 6.513964829318753e-05,
"loss": 0.9973,
"mean_token_accuracy": 0.7451998688280582,
"num_tokens": 148415446.0,
"step": 2360
},
{
"entropy": 1.3680420733988286,
"epoch": 0.35024199209369344,
"grad_norm": 0.11607158184051514,
"learning_rate": 6.499187232156051e-05,
"loss": 1.0203,
"mean_token_accuracy": 0.7391661629080772,
"num_tokens": 149047857.0,
"step": 2370
},
{
"entropy": 1.326318697631359,
"epoch": 0.35171980640632505,
"grad_norm": 0.1115611344575882,
"learning_rate": 6.48440963499335e-05,
"loss": 1.0044,
"mean_token_accuracy": 0.7440035976469517,
"num_tokens": 149677919.0,
"step": 2380
},
{
"entropy": 1.3716378539800644,
"epoch": 0.35319762071895666,
"grad_norm": 0.1267595738172531,
"learning_rate": 6.469632037830649e-05,
"loss": 1.0311,
"mean_token_accuracy": 0.7415719844400883,
"num_tokens": 150307607.0,
"step": 2390
},
{
"entropy": 1.3206391848623753,
"epoch": 0.35467543503158827,
"grad_norm": 0.11261120438575745,
"learning_rate": 6.454854440667948e-05,
"loss": 0.9928,
"mean_token_accuracy": 0.7469543524086475,
"num_tokens": 150954542.0,
"step": 2400
},
{
"entropy": 1.2988264113664627,
"epoch": 0.3561532493442199,
"grad_norm": 0.10469997674226761,
"learning_rate": 6.440076843505247e-05,
"loss": 0.9561,
"mean_token_accuracy": 0.7532316006720066,
"num_tokens": 151578422.0,
"step": 2410
},
{
"entropy": 1.3059771910309792,
"epoch": 0.3576310636568515,
"grad_norm": 0.10764110833406448,
"learning_rate": 6.425299246342546e-05,
"loss": 0.9763,
"mean_token_accuracy": 0.74577169790864,
"num_tokens": 152201507.0,
"step": 2420
},
{
"entropy": 1.348013310134411,
"epoch": 0.35910887796948315,
"grad_norm": 0.11025828123092651,
"learning_rate": 6.410521649179843e-05,
"loss": 1.0416,
"mean_token_accuracy": 0.7364607952535153,
"num_tokens": 152826167.0,
"step": 2430
},
{
"entropy": 1.358570785820484,
"epoch": 0.36058669228211476,
"grad_norm": 0.11537870019674301,
"learning_rate": 6.395744052017142e-05,
"loss": 1.0328,
"mean_token_accuracy": 0.7381561897695065,
"num_tokens": 153452977.0,
"step": 2440
},
{
"entropy": 1.290497499704361,
"epoch": 0.36206450659474637,
"grad_norm": 0.11319958418607712,
"learning_rate": 6.38096645485444e-05,
"loss": 0.9724,
"mean_token_accuracy": 0.7475843630731106,
"num_tokens": 154081881.0,
"step": 2450
},
{
"entropy": 1.3434569776058196,
"epoch": 0.363542320907378,
"grad_norm": 0.11890029907226562,
"learning_rate": 6.36618885769174e-05,
"loss": 1.0237,
"mean_token_accuracy": 0.7408385023474693,
"num_tokens": 154696692.0,
"step": 2460
},
{
"entropy": 1.3663389906287193,
"epoch": 0.3650201352200096,
"grad_norm": 0.10306631773710251,
"learning_rate": 6.351411260529038e-05,
"loss": 1.0883,
"mean_token_accuracy": 0.7281133748590947,
"num_tokens": 155326807.0,
"step": 2470
},
{
"entropy": 1.3352325096726418,
"epoch": 0.3664979495326412,
"grad_norm": 0.13469462096691132,
"learning_rate": 6.336633663366337e-05,
"loss": 1.0129,
"mean_token_accuracy": 0.7416555799543858,
"num_tokens": 155963544.0,
"step": 2480
},
{
"entropy": 1.3298554822802544,
"epoch": 0.36797576384527286,
"grad_norm": 0.13767758011817932,
"learning_rate": 6.321856066203635e-05,
"loss": 1.0151,
"mean_token_accuracy": 0.7417769074440003,
"num_tokens": 156583390.0,
"step": 2490
},
{
"entropy": 1.3384235605597496,
"epoch": 0.36945357815790447,
"grad_norm": 0.10280942171812057,
"learning_rate": 6.307078469040935e-05,
"loss": 1.0067,
"mean_token_accuracy": 0.7415686272084713,
"num_tokens": 157208767.0,
"step": 2500
},
{
"entropy": 1.3747689306735993,
"epoch": 0.3709313924705361,
"grad_norm": 0.11320924013853073,
"learning_rate": 6.292300871878232e-05,
"loss": 1.0687,
"mean_token_accuracy": 0.7295591056346893,
"num_tokens": 157830935.0,
"step": 2510
},
{
"entropy": 1.3555556759238243,
"epoch": 0.3724092067831677,
"grad_norm": 0.11231453716754913,
"learning_rate": 6.277523274715531e-05,
"loss": 1.0142,
"mean_token_accuracy": 0.7398925371468067,
"num_tokens": 158458326.0,
"step": 2520
},
{
"entropy": 1.3142734497785569,
"epoch": 0.3738870210957993,
"grad_norm": 0.12294314801692963,
"learning_rate": 6.26274567755283e-05,
"loss": 0.9793,
"mean_token_accuracy": 0.7500525377690792,
"num_tokens": 159116266.0,
"step": 2530
},
{
"entropy": 1.3187284499406815,
"epoch": 0.3753648354084309,
"grad_norm": 0.13975459337234497,
"learning_rate": 6.247968080390129e-05,
"loss": 0.9913,
"mean_token_accuracy": 0.747199397534132,
"num_tokens": 159751512.0,
"step": 2540
},
{
"entropy": 1.3505188934504986,
"epoch": 0.3768426497210626,
"grad_norm": 0.11873970925807953,
"learning_rate": 6.233190483227428e-05,
"loss": 1.0392,
"mean_token_accuracy": 0.7385047681629657,
"num_tokens": 160382970.0,
"step": 2550
},
{
"entropy": 1.3201254040002823,
"epoch": 0.3783204640336942,
"grad_norm": 0.14079681038856506,
"learning_rate": 6.218412886064726e-05,
"loss": 0.9961,
"mean_token_accuracy": 0.746822776645422,
"num_tokens": 161016940.0,
"step": 2560
},
{
"entropy": 1.3438078887760638,
"epoch": 0.3797982783463258,
"grad_norm": 0.10927737504243851,
"learning_rate": 6.203635288902024e-05,
"loss": 1.0477,
"mean_token_accuracy": 0.732993096858263,
"num_tokens": 161651492.0,
"step": 2570
},
{
"entropy": 1.3874997161328793,
"epoch": 0.3812760926589574,
"grad_norm": 0.11553368717432022,
"learning_rate": 6.188857691739324e-05,
"loss": 1.0577,
"mean_token_accuracy": 0.7329879857599735,
"num_tokens": 162317869.0,
"step": 2580
},
{
"entropy": 1.369983048737049,
"epoch": 0.382753906971589,
"grad_norm": 0.10490620881319046,
"learning_rate": 6.174080094576621e-05,
"loss": 1.0611,
"mean_token_accuracy": 0.7350798234343529,
"num_tokens": 162956671.0,
"step": 2590
},
{
"entropy": 1.3504191115498543,
"epoch": 0.3842317212842206,
"grad_norm": 0.12128763645887375,
"learning_rate": 6.159302497413922e-05,
"loss": 1.0338,
"mean_token_accuracy": 0.7371863946318626,
"num_tokens": 163576216.0,
"step": 2600
},
{
"entropy": 1.2979571580886842,
"epoch": 0.3857095355968523,
"grad_norm": 0.10547712445259094,
"learning_rate": 6.144524900251219e-05,
"loss": 0.9993,
"mean_token_accuracy": 0.7470176264643669,
"num_tokens": 164191471.0,
"step": 2610
},
{
"entropy": 1.299732106924057,
"epoch": 0.3871873499094839,
"grad_norm": 0.10867074877023697,
"learning_rate": 6.129747303088518e-05,
"loss": 0.9935,
"mean_token_accuracy": 0.7457987800240516,
"num_tokens": 164825405.0,
"step": 2620
},
{
"entropy": 1.347513662278652,
"epoch": 0.3886651642221155,
"grad_norm": 0.10699914395809174,
"learning_rate": 6.114969705925817e-05,
"loss": 1.0376,
"mean_token_accuracy": 0.7393544964492321,
"num_tokens": 165469743.0,
"step": 2630
},
{
"entropy": 1.3306864887475967,
"epoch": 0.3901429785347471,
"grad_norm": 0.11511126160621643,
"learning_rate": 6.1001921087631156e-05,
"loss": 1.019,
"mean_token_accuracy": 0.7381970398128033,
"num_tokens": 166089598.0,
"step": 2640
},
{
"entropy": 1.3333285301923752,
"epoch": 0.3916207928473787,
"grad_norm": 0.11367027461528778,
"learning_rate": 6.085414511600414e-05,
"loss": 0.997,
"mean_token_accuracy": 0.7467053011059761,
"num_tokens": 166717021.0,
"step": 2650
},
{
"entropy": 1.3339226961135864,
"epoch": 0.3930986071600103,
"grad_norm": 0.11065942049026489,
"learning_rate": 6.0706369144377126e-05,
"loss": 1.004,
"mean_token_accuracy": 0.7448596432805061,
"num_tokens": 167341286.0,
"step": 2660
},
{
"entropy": 1.3062518246471881,
"epoch": 0.39457642147264194,
"grad_norm": 0.12307227402925491,
"learning_rate": 6.0558593172750114e-05,
"loss": 0.985,
"mean_token_accuracy": 0.7469465628266334,
"num_tokens": 167969100.0,
"step": 2670
},
{
"entropy": 1.3655583813786507,
"epoch": 0.3960542357852736,
"grad_norm": 0.10138296335935593,
"learning_rate": 6.04108172011231e-05,
"loss": 1.0372,
"mean_token_accuracy": 0.739393538236618,
"num_tokens": 168608314.0,
"step": 2680
},
{
"entropy": 1.2950063794851303,
"epoch": 0.3975320500979052,
"grad_norm": 0.11317243427038193,
"learning_rate": 6.0263041229496084e-05,
"loss": 0.9429,
"mean_token_accuracy": 0.7571868598461151,
"num_tokens": 169227402.0,
"step": 2690
},
{
"entropy": 1.3435308299958706,
"epoch": 0.3990098644105368,
"grad_norm": 0.11763688176870346,
"learning_rate": 6.011526525786907e-05,
"loss": 1.0319,
"mean_token_accuracy": 0.739401226490736,
"num_tokens": 169846401.0,
"step": 2700
},
{
"entropy": 1.3442980594933034,
"epoch": 0.4004876787231684,
"grad_norm": 0.10513842850923538,
"learning_rate": 5.996748928624206e-05,
"loss": 0.9871,
"mean_token_accuracy": 0.7463423803448677,
"num_tokens": 170476608.0,
"step": 2710
},
{
"entropy": 1.343531072884798,
"epoch": 0.40196549303580004,
"grad_norm": 0.11001633107662201,
"learning_rate": 5.981971331461504e-05,
"loss": 1.0192,
"mean_token_accuracy": 0.7424076452851296,
"num_tokens": 171098245.0,
"step": 2720
},
{
"entropy": 1.3884330071508884,
"epoch": 0.40344330734843165,
"grad_norm": 0.11198286712169647,
"learning_rate": 5.9671937342988037e-05,
"loss": 1.0602,
"mean_token_accuracy": 0.7355059400200844,
"num_tokens": 171723965.0,
"step": 2730
},
{
"entropy": 1.3671185605227947,
"epoch": 0.4049211216610633,
"grad_norm": 0.11801856756210327,
"learning_rate": 5.952416137136102e-05,
"loss": 1.0268,
"mean_token_accuracy": 0.7393461734056472,
"num_tokens": 172347061.0,
"step": 2740
},
{
"entropy": 1.323919515311718,
"epoch": 0.4063989359736949,
"grad_norm": 0.11580619215965271,
"learning_rate": 5.9376385399734e-05,
"loss": 1.0054,
"mean_token_accuracy": 0.7442776501178742,
"num_tokens": 172982062.0,
"step": 2750
},
{
"entropy": 1.3789773643016816,
"epoch": 0.40787675028632653,
"grad_norm": 0.10008373856544495,
"learning_rate": 5.9228609428106994e-05,
"loss": 1.0165,
"mean_token_accuracy": 0.7394210025668144,
"num_tokens": 173615266.0,
"step": 2760
},
{
"entropy": 1.326123160123825,
"epoch": 0.40935456459895814,
"grad_norm": 0.12968984246253967,
"learning_rate": 5.9080833456479976e-05,
"loss": 1.0073,
"mean_token_accuracy": 0.7445714198052883,
"num_tokens": 174247388.0,
"step": 2770
},
{
"entropy": 1.3163345210254191,
"epoch": 0.41083237891158975,
"grad_norm": 0.10620130598545074,
"learning_rate": 5.893305748485296e-05,
"loss": 1.0153,
"mean_token_accuracy": 0.7422694250941276,
"num_tokens": 174887319.0,
"step": 2780
},
{
"entropy": 1.276471631973982,
"epoch": 0.41231019322422136,
"grad_norm": 0.11546126008033752,
"learning_rate": 5.878528151322595e-05,
"loss": 0.956,
"mean_token_accuracy": 0.7540316492319107,
"num_tokens": 175521599.0,
"step": 2790
},
{
"entropy": 1.3033716894686223,
"epoch": 0.413788007536853,
"grad_norm": 0.11271125823259354,
"learning_rate": 5.8637505541598934e-05,
"loss": 0.9837,
"mean_token_accuracy": 0.7463239781558514,
"num_tokens": 176139684.0,
"step": 2800
},
{
"entropy": 1.334360421448946,
"epoch": 0.41526582184948463,
"grad_norm": 0.110804982483387,
"learning_rate": 5.848972956997193e-05,
"loss": 1.0242,
"mean_token_accuracy": 0.7349204763770103,
"num_tokens": 176749358.0,
"step": 2810
},
{
"entropy": 1.3180787444114686,
"epoch": 0.41674363616211624,
"grad_norm": 0.11518800258636475,
"learning_rate": 5.834195359834491e-05,
"loss": 0.9923,
"mean_token_accuracy": 0.747980859130621,
"num_tokens": 177363939.0,
"step": 2820
},
{
"entropy": 1.3395656317472457,
"epoch": 0.41822145047474785,
"grad_norm": 0.10945259779691696,
"learning_rate": 5.819417762671789e-05,
"loss": 1.0213,
"mean_token_accuracy": 0.7422494500875473,
"num_tokens": 177989786.0,
"step": 2830
},
{
"entropy": 1.3470888301730155,
"epoch": 0.41969926478737946,
"grad_norm": 0.14387215673923492,
"learning_rate": 5.804640165509089e-05,
"loss": 1.0387,
"mean_token_accuracy": 0.7359960667788983,
"num_tokens": 178631952.0,
"step": 2840
},
{
"entropy": 1.3248698562383652,
"epoch": 0.42117707910001106,
"grad_norm": 0.12421754747629166,
"learning_rate": 5.789862568346387e-05,
"loss": 1.0008,
"mean_token_accuracy": 0.7468325570225716,
"num_tokens": 179267882.0,
"step": 2850
},
{
"entropy": 1.3252468392252923,
"epoch": 0.4226548934126427,
"grad_norm": 0.12913116812705994,
"learning_rate": 5.775084971183686e-05,
"loss": 0.9956,
"mean_token_accuracy": 0.7422256797552109,
"num_tokens": 179898670.0,
"step": 2860
},
{
"entropy": 1.3273553922772408,
"epoch": 0.42413270772527434,
"grad_norm": 0.1182723343372345,
"learning_rate": 5.7603073740209845e-05,
"loss": 1.0077,
"mean_token_accuracy": 0.745375657826662,
"num_tokens": 180555347.0,
"step": 2870
},
{
"entropy": 1.2914891712367536,
"epoch": 0.42561052203790595,
"grad_norm": 0.10932762920856476,
"learning_rate": 5.7455297768582826e-05,
"loss": 1.014,
"mean_token_accuracy": 0.7426045201718807,
"num_tokens": 181201294.0,
"step": 2880
},
{
"entropy": 1.3286943525075912,
"epoch": 0.42708833635053756,
"grad_norm": 0.11981204897165298,
"learning_rate": 5.730752179695582e-05,
"loss": 1.0206,
"mean_token_accuracy": 0.7393959686160088,
"num_tokens": 181830863.0,
"step": 2890
},
{
"entropy": 1.3407499633729458,
"epoch": 0.42856615066316917,
"grad_norm": 0.10789301991462708,
"learning_rate": 5.71597458253288e-05,
"loss": 1.018,
"mean_token_accuracy": 0.741955791413784,
"num_tokens": 182462480.0,
"step": 2900
},
{
"entropy": 1.3357246771454812,
"epoch": 0.4300439649758008,
"grad_norm": 0.12831929326057434,
"learning_rate": 5.7011969853701784e-05,
"loss": 1.0442,
"mean_token_accuracy": 0.7360114604234695,
"num_tokens": 183084422.0,
"step": 2910
},
{
"entropy": 1.299278263002634,
"epoch": 0.4315217792884324,
"grad_norm": 0.1147497147321701,
"learning_rate": 5.686419388207478e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7489165782928466,
"num_tokens": 183718870.0,
"step": 2920
},
{
"entropy": 1.3196597643196584,
"epoch": 0.43299959360106405,
"grad_norm": 0.10116377472877502,
"learning_rate": 5.671641791044776e-05,
"loss": 1.0105,
"mean_token_accuracy": 0.7411533951759338,
"num_tokens": 184342140.0,
"step": 2930
},
{
"entropy": 1.34343186840415,
"epoch": 0.43447740791369566,
"grad_norm": 0.12002977728843689,
"learning_rate": 5.6568641938820756e-05,
"loss": 1.0508,
"mean_token_accuracy": 0.7358109518885613,
"num_tokens": 184959915.0,
"step": 2940
},
{
"entropy": 1.3466629028320312,
"epoch": 0.43595522222632727,
"grad_norm": 0.10612580180168152,
"learning_rate": 5.642086596719374e-05,
"loss": 1.0546,
"mean_token_accuracy": 0.732919916510582,
"num_tokens": 185596121.0,
"step": 2950
},
{
"entropy": 1.384493639320135,
"epoch": 0.4374330365389589,
"grad_norm": 0.11402401328086853,
"learning_rate": 5.627308999556672e-05,
"loss": 1.0618,
"mean_token_accuracy": 0.7344385020434856,
"num_tokens": 186237747.0,
"step": 2960
},
{
"entropy": 1.3325828693807125,
"epoch": 0.4389108508515905,
"grad_norm": 0.11494413763284683,
"learning_rate": 5.6125314023939714e-05,
"loss": 1.067,
"mean_token_accuracy": 0.7311987280845642,
"num_tokens": 186859181.0,
"step": 2970
},
{
"entropy": 1.3028566606342793,
"epoch": 0.4403886651642221,
"grad_norm": 0.11112917959690094,
"learning_rate": 5.5977538052312695e-05,
"loss": 0.9694,
"mean_token_accuracy": 0.7484906904399395,
"num_tokens": 187507475.0,
"step": 2980
},
{
"entropy": 1.3332383722066878,
"epoch": 0.44186647947685376,
"grad_norm": 0.12574991583824158,
"learning_rate": 5.582976208068569e-05,
"loss": 1.0308,
"mean_token_accuracy": 0.7397411569952965,
"num_tokens": 188138462.0,
"step": 2990
},
{
"entropy": 1.3662227645516396,
"epoch": 0.44334429378948537,
"grad_norm": 0.12452980130910873,
"learning_rate": 5.568198610905867e-05,
"loss": 1.0462,
"mean_token_accuracy": 0.7339240312576294,
"num_tokens": 188757427.0,
"step": 3000
},
{
"entropy": 1.3738774508237839,
"epoch": 0.444822108102117,
"grad_norm": 0.12353511899709702,
"learning_rate": 5.553421013743165e-05,
"loss": 1.0545,
"mean_token_accuracy": 0.7342685110867023,
"num_tokens": 189384207.0,
"step": 3010
},
{
"entropy": 1.3274571530520916,
"epoch": 0.4462999224147486,
"grad_norm": 0.1116141825914383,
"learning_rate": 5.538643416580465e-05,
"loss": 0.9787,
"mean_token_accuracy": 0.7479172520339489,
"num_tokens": 190024832.0,
"step": 3020
},
{
"entropy": 1.294634611159563,
"epoch": 0.4477777367273802,
"grad_norm": 0.10204346477985382,
"learning_rate": 5.523865819417763e-05,
"loss": 0.9898,
"mean_token_accuracy": 0.7439772725105286,
"num_tokens": 190647129.0,
"step": 3030
},
{
"entropy": 1.3052165731787682,
"epoch": 0.4492555510400118,
"grad_norm": 0.11496242135763168,
"learning_rate": 5.509088222255061e-05,
"loss": 0.9795,
"mean_token_accuracy": 0.7487292625010014,
"num_tokens": 191248869.0,
"step": 3040
},
{
"entropy": 1.3516557164490224,
"epoch": 0.45073336535264347,
"grad_norm": 0.10153250396251678,
"learning_rate": 5.4943106250923606e-05,
"loss": 1.021,
"mean_token_accuracy": 0.7397518754005432,
"num_tokens": 191884174.0,
"step": 3050
},
{
"entropy": 1.3404523707926272,
"epoch": 0.4522111796652751,
"grad_norm": 0.12902577221393585,
"learning_rate": 5.479533027929659e-05,
"loss": 1.0308,
"mean_token_accuracy": 0.7386652678251266,
"num_tokens": 192490961.0,
"step": 3060
},
{
"entropy": 1.3242835983633996,
"epoch": 0.4536889939779067,
"grad_norm": 0.11308476328849792,
"learning_rate": 5.464755430766958e-05,
"loss": 1.0502,
"mean_token_accuracy": 0.7358929142355919,
"num_tokens": 193087055.0,
"step": 3070
},
{
"entropy": 1.3779341116547585,
"epoch": 0.4551668082905383,
"grad_norm": 0.1298595815896988,
"learning_rate": 5.4499778336042564e-05,
"loss": 1.0506,
"mean_token_accuracy": 0.7345085546374321,
"num_tokens": 193712926.0,
"step": 3080
},
{
"entropy": 1.3581049352884293,
"epoch": 0.4566446226031699,
"grad_norm": 0.11287155002355576,
"learning_rate": 5.4352002364415545e-05,
"loss": 1.0258,
"mean_token_accuracy": 0.737793606519699,
"num_tokens": 194352679.0,
"step": 3090
},
{
"entropy": 1.3133333794772626,
"epoch": 0.4581224369158015,
"grad_norm": 0.11862477660179138,
"learning_rate": 5.420422639278854e-05,
"loss": 1.0119,
"mean_token_accuracy": 0.742002834379673,
"num_tokens": 194979080.0,
"step": 3100
},
{
"entropy": 1.3262240797281266,
"epoch": 0.4596002512284331,
"grad_norm": 0.11039308458566666,
"learning_rate": 5.405645042116152e-05,
"loss": 1.004,
"mean_token_accuracy": 0.7448594368994236,
"num_tokens": 195599027.0,
"step": 3110
},
{
"entropy": 1.3526733674108982,
"epoch": 0.4610780655410648,
"grad_norm": 0.12351663410663605,
"learning_rate": 5.390867444953451e-05,
"loss": 1.025,
"mean_token_accuracy": 0.7385124079883099,
"num_tokens": 196222237.0,
"step": 3120
},
{
"entropy": 1.3755785167217254,
"epoch": 0.4625558798536964,
"grad_norm": 0.11777998507022858,
"learning_rate": 5.37608984779075e-05,
"loss": 1.0615,
"mean_token_accuracy": 0.7338152408599854,
"num_tokens": 196849072.0,
"step": 3130
},
{
"entropy": 1.2873252600431442,
"epoch": 0.464033694166328,
"grad_norm": 0.1119779720902443,
"learning_rate": 5.361312250628048e-05,
"loss": 0.9939,
"mean_token_accuracy": 0.7457574985921382,
"num_tokens": 197479996.0,
"step": 3140
},
{
"entropy": 1.3290088526904582,
"epoch": 0.4655115084789596,
"grad_norm": 0.10185403376817703,
"learning_rate": 5.346534653465347e-05,
"loss": 0.9982,
"mean_token_accuracy": 0.745093023777008,
"num_tokens": 198114198.0,
"step": 3150
},
{
"entropy": 1.3040216162800788,
"epoch": 0.4669893227915912,
"grad_norm": 0.12758901715278625,
"learning_rate": 5.3317570563026456e-05,
"loss": 0.9908,
"mean_token_accuracy": 0.7469444774091244,
"num_tokens": 198744871.0,
"step": 3160
},
{
"entropy": 1.3350887216627598,
"epoch": 0.46846713710422283,
"grad_norm": 0.12365201860666275,
"learning_rate": 5.316979459139944e-05,
"loss": 1.029,
"mean_token_accuracy": 0.7377054400742054,
"num_tokens": 199368679.0,
"step": 3170
},
{
"entropy": 1.3086614586412906,
"epoch": 0.4699449514168545,
"grad_norm": 0.12184581160545349,
"learning_rate": 5.3022018619772426e-05,
"loss": 1.0208,
"mean_token_accuracy": 0.7402149192988873,
"num_tokens": 199988730.0,
"step": 3180
},
{
"entropy": 1.338922818750143,
"epoch": 0.4714227657294861,
"grad_norm": 0.11584389209747314,
"learning_rate": 5.2874242648145414e-05,
"loss": 1.0249,
"mean_token_accuracy": 0.7406525187194347,
"num_tokens": 200601443.0,
"step": 3190
},
{
"entropy": 1.3665964484214783,
"epoch": 0.4729005800421177,
"grad_norm": 0.11363598704338074,
"learning_rate": 5.27264666765184e-05,
"loss": 1.0536,
"mean_token_accuracy": 0.7332972958683968,
"num_tokens": 201253526.0,
"step": 3200
},
{
"entropy": 1.363574294000864,
"epoch": 0.4743783943547493,
"grad_norm": 0.1246991977095604,
"learning_rate": 5.2578690704891384e-05,
"loss": 1.0539,
"mean_token_accuracy": 0.7336206682026386,
"num_tokens": 201889341.0,
"step": 3210
},
{
"entropy": 1.3425316251814365,
"epoch": 0.47585620866738093,
"grad_norm": 0.11345670372247696,
"learning_rate": 5.243091473326437e-05,
"loss": 1.036,
"mean_token_accuracy": 0.7365034572780133,
"num_tokens": 202529041.0,
"step": 3220
},
{
"entropy": 1.3099669203162194,
"epoch": 0.47733402298001254,
"grad_norm": 0.11768782883882523,
"learning_rate": 5.228313876163736e-05,
"loss": 1.0065,
"mean_token_accuracy": 0.7445768341422081,
"num_tokens": 203154925.0,
"step": 3230
},
{
"entropy": 1.3240293197333812,
"epoch": 0.4788118372926442,
"grad_norm": 0.12721501290798187,
"learning_rate": 5.213536279001034e-05,
"loss": 0.9708,
"mean_token_accuracy": 0.7518071658909321,
"num_tokens": 203799822.0,
"step": 3240
},
{
"entropy": 1.3182805471122265,
"epoch": 0.4802896516052758,
"grad_norm": 0.13314363360404968,
"learning_rate": 5.198758681838334e-05,
"loss": 0.989,
"mean_token_accuracy": 0.7485011011362076,
"num_tokens": 204427998.0,
"step": 3250
},
{
"entropy": 1.3208178155124188,
"epoch": 0.4817674659179074,
"grad_norm": 0.10576171427965164,
"learning_rate": 5.183981084675632e-05,
"loss": 1.0116,
"mean_token_accuracy": 0.7418395794928074,
"num_tokens": 205083218.0,
"step": 3260
},
{
"entropy": 1.366914363950491,
"epoch": 0.48324528023053903,
"grad_norm": 0.10938998311758041,
"learning_rate": 5.16920348751293e-05,
"loss": 1.0495,
"mean_token_accuracy": 0.7358329579234123,
"num_tokens": 205713942.0,
"step": 3270
},
{
"entropy": 1.3152115523815155,
"epoch": 0.48472309454317064,
"grad_norm": 0.1116151288151741,
"learning_rate": 5.1544258903502295e-05,
"loss": 1.0067,
"mean_token_accuracy": 0.7463385559618473,
"num_tokens": 206352602.0,
"step": 3280
},
{
"entropy": 1.34514739215374,
"epoch": 0.48620090885580225,
"grad_norm": 0.10949606448411942,
"learning_rate": 5.1396482931875276e-05,
"loss": 1.0212,
"mean_token_accuracy": 0.7405461743474007,
"num_tokens": 207004780.0,
"step": 3290
},
{
"entropy": 1.3107164040207864,
"epoch": 0.48767872316843386,
"grad_norm": 0.12132346630096436,
"learning_rate": 5.124870696024826e-05,
"loss": 0.9977,
"mean_token_accuracy": 0.7398034170269966,
"num_tokens": 207631812.0,
"step": 3300
},
{
"entropy": 1.337456651031971,
"epoch": 0.4891565374810655,
"grad_norm": 0.10723264515399933,
"learning_rate": 5.110093098862125e-05,
"loss": 1.0045,
"mean_token_accuracy": 0.7424529060721398,
"num_tokens": 208270670.0,
"step": 3310
},
{
"entropy": 1.3590418472886086,
"epoch": 0.49063435179369713,
"grad_norm": 0.1069742813706398,
"learning_rate": 5.0953155016994234e-05,
"loss": 1.0674,
"mean_token_accuracy": 0.7290687002241611,
"num_tokens": 208920781.0,
"step": 3320
},
{
"entropy": 1.3540847443044186,
"epoch": 0.49211216610632874,
"grad_norm": 0.11442390084266663,
"learning_rate": 5.080537904536723e-05,
"loss": 1.0385,
"mean_token_accuracy": 0.7392103366553784,
"num_tokens": 209536141.0,
"step": 3330
},
{
"entropy": 1.3643196202814578,
"epoch": 0.49358998041896035,
"grad_norm": 0.12627092003822327,
"learning_rate": 5.065760307374021e-05,
"loss": 1.0249,
"mean_token_accuracy": 0.7383069723844529,
"num_tokens": 210149369.0,
"step": 3340
},
{
"entropy": 1.3445673748850822,
"epoch": 0.49506779473159196,
"grad_norm": 0.10701033473014832,
"learning_rate": 5.050982710211319e-05,
"loss": 1.0357,
"mean_token_accuracy": 0.7391380302608013,
"num_tokens": 210762484.0,
"step": 3350
},
{
"entropy": 1.318381641060114,
"epoch": 0.49654560904422357,
"grad_norm": 0.12191876024007797,
"learning_rate": 5.036205113048619e-05,
"loss": 0.992,
"mean_token_accuracy": 0.7471228286623954,
"num_tokens": 211400973.0,
"step": 3360
},
{
"entropy": 1.3595143400132657,
"epoch": 0.49802342335685523,
"grad_norm": 0.14100560545921326,
"learning_rate": 5.021427515885917e-05,
"loss": 1.0524,
"mean_token_accuracy": 0.7343139186501503,
"num_tokens": 212028494.0,
"step": 3370
},
{
"entropy": 1.3375087425112724,
"epoch": 0.49950123766948684,
"grad_norm": 0.11061199009418488,
"learning_rate": 5.0066499187232164e-05,
"loss": 1.0043,
"mean_token_accuracy": 0.7437618337571621,
"num_tokens": 212667189.0,
"step": 3380
},
{
"entropy": 1.3430921614170075,
"epoch": 0.5009790519821185,
"grad_norm": 0.11417815834283829,
"learning_rate": 4.9918723215605145e-05,
"loss": 1.0105,
"mean_token_accuracy": 0.7393266052007675,
"num_tokens": 213296769.0,
"step": 3390
},
{
"entropy": 1.3418936803936958,
"epoch": 0.5024568662947501,
"grad_norm": 0.12051557004451752,
"learning_rate": 4.9770947243978133e-05,
"loss": 1.0411,
"mean_token_accuracy": 0.7347103841602802,
"num_tokens": 213917765.0,
"step": 3400
},
{
"entropy": 1.3763892143964767,
"epoch": 0.5039346806073817,
"grad_norm": 0.1224110797047615,
"learning_rate": 4.9623171272351115e-05,
"loss": 1.0732,
"mean_token_accuracy": 0.7312706559896469,
"num_tokens": 214547796.0,
"step": 3410
},
{
"entropy": 1.332948635518551,
"epoch": 0.5054124949200133,
"grad_norm": 0.13498088717460632,
"learning_rate": 4.94753953007241e-05,
"loss": 1.0243,
"mean_token_accuracy": 0.7391216315329074,
"num_tokens": 215178078.0,
"step": 3420
},
{
"entropy": 1.3343242034316063,
"epoch": 0.5068903092326449,
"grad_norm": 0.10605301707983017,
"learning_rate": 4.932761932909709e-05,
"loss": 1.0012,
"mean_token_accuracy": 0.7469499759376049,
"num_tokens": 215832232.0,
"step": 3430
},
{
"entropy": 1.3277502968907355,
"epoch": 0.5083681235452765,
"grad_norm": 0.130407452583313,
"learning_rate": 4.917984335747008e-05,
"loss": 1.0263,
"mean_token_accuracy": 0.7371391884982585,
"num_tokens": 216462370.0,
"step": 3440
},
{
"entropy": 1.3561268150806427,
"epoch": 0.5098459378579081,
"grad_norm": 0.11962781101465225,
"learning_rate": 4.903206738584307e-05,
"loss": 1.0359,
"mean_token_accuracy": 0.7392862103879452,
"num_tokens": 217087857.0,
"step": 3450
},
{
"entropy": 1.328464537113905,
"epoch": 0.5113237521705398,
"grad_norm": 0.12519234418869019,
"learning_rate": 4.888429141421605e-05,
"loss": 1.0324,
"mean_token_accuracy": 0.7398794747889041,
"num_tokens": 217708160.0,
"step": 3460
},
{
"entropy": 1.3790725782513618,
"epoch": 0.5128015664831714,
"grad_norm": 0.12732987105846405,
"learning_rate": 4.873651544258904e-05,
"loss": 1.0761,
"mean_token_accuracy": 0.7279979415237904,
"num_tokens": 218321702.0,
"step": 3470
},
{
"entropy": 1.4037544824182988,
"epoch": 0.514279380795803,
"grad_norm": 0.11995565891265869,
"learning_rate": 4.8588739470962026e-05,
"loss": 1.0948,
"mean_token_accuracy": 0.7246852949261665,
"num_tokens": 218935590.0,
"step": 3480
},
{
"entropy": 1.326191857457161,
"epoch": 0.5157571951084347,
"grad_norm": 0.1153104230761528,
"learning_rate": 4.8440963499335014e-05,
"loss": 1.0094,
"mean_token_accuracy": 0.7434732802212238,
"num_tokens": 219569838.0,
"step": 3490
},
{
"entropy": 1.3592430077493192,
"epoch": 0.5172350094210663,
"grad_norm": 0.13453197479248047,
"learning_rate": 4.8293187527707996e-05,
"loss": 1.048,
"mean_token_accuracy": 0.7330381028354168,
"num_tokens": 220185249.0,
"step": 3500
},
{
"entropy": 1.3487900651991367,
"epoch": 0.5187128237336979,
"grad_norm": 0.13040119409561157,
"learning_rate": 4.8145411556080984e-05,
"loss": 1.0152,
"mean_token_accuracy": 0.7400082737207413,
"num_tokens": 220811253.0,
"step": 3510
},
{
"entropy": 1.3602138139307498,
"epoch": 0.5201906380463295,
"grad_norm": 0.11324775218963623,
"learning_rate": 4.799763558445397e-05,
"loss": 1.067,
"mean_token_accuracy": 0.7322800144553184,
"num_tokens": 221436414.0,
"step": 3520
},
{
"entropy": 1.3038682721555233,
"epoch": 0.5216684523589611,
"grad_norm": 0.11579470336437225,
"learning_rate": 4.784985961282696e-05,
"loss": 1.01,
"mean_token_accuracy": 0.74277663230896,
"num_tokens": 222059865.0,
"step": 3530
},
{
"entropy": 1.3233835257589817,
"epoch": 0.5231462666715927,
"grad_norm": 0.1281614601612091,
"learning_rate": 4.770208364119994e-05,
"loss": 1.0014,
"mean_token_accuracy": 0.7457077689468861,
"num_tokens": 222689051.0,
"step": 3540
},
{
"entropy": 1.3150438368320465,
"epoch": 0.5246240809842243,
"grad_norm": 0.13878072798252106,
"learning_rate": 4.755430766957293e-05,
"loss": 0.9982,
"mean_token_accuracy": 0.7474694885313511,
"num_tokens": 223298231.0,
"step": 3550
},
{
"entropy": 1.32702829092741,
"epoch": 0.5261018952968559,
"grad_norm": 0.10749702155590057,
"learning_rate": 4.740653169794592e-05,
"loss": 1.0136,
"mean_token_accuracy": 0.7439944848418236,
"num_tokens": 223925912.0,
"step": 3560
},
{
"entropy": 1.3148509785532951,
"epoch": 0.5275797096094875,
"grad_norm": 0.12064609676599503,
"learning_rate": 4.7258755726318906e-05,
"loss": 0.9995,
"mean_token_accuracy": 0.7481425099074841,
"num_tokens": 224571805.0,
"step": 3570
},
{
"entropy": 1.335060080140829,
"epoch": 0.5290575239221191,
"grad_norm": 0.13102136552333832,
"learning_rate": 4.7110979754691895e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7448404133319855,
"num_tokens": 225205299.0,
"step": 3580
},
{
"entropy": 1.3563662871718407,
"epoch": 0.5305353382347509,
"grad_norm": 0.12292468547821045,
"learning_rate": 4.6963203783064876e-05,
"loss": 1.0358,
"mean_token_accuracy": 0.737770852446556,
"num_tokens": 225832363.0,
"step": 3590
},
{
"entropy": 1.3766466073691845,
"epoch": 0.5320131525473825,
"grad_norm": 0.12831763923168182,
"learning_rate": 4.6815427811437864e-05,
"loss": 1.0347,
"mean_token_accuracy": 0.7354536131024361,
"num_tokens": 226465263.0,
"step": 3600
},
{
"entropy": 1.3112281516194344,
"epoch": 0.5334909668600141,
"grad_norm": 0.11866694688796997,
"learning_rate": 4.666765183981085e-05,
"loss": 0.9589,
"mean_token_accuracy": 0.7530772976577282,
"num_tokens": 227102673.0,
"step": 3610
},
{
"entropy": 1.3011863119900227,
"epoch": 0.5349687811726457,
"grad_norm": 0.1284829080104828,
"learning_rate": 4.651987586818384e-05,
"loss": 1.0065,
"mean_token_accuracy": 0.7439219027757644,
"num_tokens": 227738382.0,
"step": 3620
},
{
"entropy": 1.3390570774674415,
"epoch": 0.5364465954852773,
"grad_norm": 0.1170494556427002,
"learning_rate": 4.637209989655682e-05,
"loss": 0.9984,
"mean_token_accuracy": 0.7461878538131714,
"num_tokens": 228356674.0,
"step": 3630
},
{
"entropy": 1.3583289809525012,
"epoch": 0.5379244097979089,
"grad_norm": 0.14735782146453857,
"learning_rate": 4.622432392492981e-05,
"loss": 1.0268,
"mean_token_accuracy": 0.7402130104601383,
"num_tokens": 228974148.0,
"step": 3640
},
{
"entropy": 1.3334741026163102,
"epoch": 0.5394022241105405,
"grad_norm": 0.12460874766111374,
"learning_rate": 4.60765479533028e-05,
"loss": 1.0129,
"mean_token_accuracy": 0.7437016226351261,
"num_tokens": 229613351.0,
"step": 3650
},
{
"entropy": 1.3233090750873089,
"epoch": 0.5408800384231721,
"grad_norm": 0.10226025432348251,
"learning_rate": 4.592877198167578e-05,
"loss": 1.0117,
"mean_token_accuracy": 0.7429285898804665,
"num_tokens": 230255532.0,
"step": 3660
},
{
"entropy": 1.3184999868273735,
"epoch": 0.5423578527358037,
"grad_norm": 0.13753961026668549,
"learning_rate": 4.578099601004877e-05,
"loss": 1.0017,
"mean_token_accuracy": 0.7435905501246453,
"num_tokens": 230863024.0,
"step": 3670
},
{
"entropy": 1.3815899774432183,
"epoch": 0.5438356670484353,
"grad_norm": 0.12502948939800262,
"learning_rate": 4.563322003842175e-05,
"loss": 1.0751,
"mean_token_accuracy": 0.7307036370038986,
"num_tokens": 231506246.0,
"step": 3680
},
{
"entropy": 1.3200243420898914,
"epoch": 0.5453134813610669,
"grad_norm": 0.11456853896379471,
"learning_rate": 4.548544406679474e-05,
"loss": 1.0021,
"mean_token_accuracy": 0.7433114424347878,
"num_tokens": 232141778.0,
"step": 3690
},
{
"entropy": 1.297838745266199,
"epoch": 0.5467912956736986,
"grad_norm": 0.13101966679096222,
"learning_rate": 4.5337668095167727e-05,
"loss": 0.9982,
"mean_token_accuracy": 0.7433498427271843,
"num_tokens": 232801815.0,
"step": 3700
},
{
"entropy": 1.318327071517706,
"epoch": 0.5482691099863303,
"grad_norm": 0.14819857478141785,
"learning_rate": 4.5189892123540715e-05,
"loss": 1.0394,
"mean_token_accuracy": 0.7365592263638974,
"num_tokens": 233411245.0,
"step": 3710
},
{
"entropy": 1.3289685495197774,
"epoch": 0.5497469242989619,
"grad_norm": 0.1170542910695076,
"learning_rate": 4.5042116151913696e-05,
"loss": 0.9804,
"mean_token_accuracy": 0.7477963097393513,
"num_tokens": 234055712.0,
"step": 3720
},
{
"entropy": 1.3513706095516682,
"epoch": 0.5512247386115935,
"grad_norm": 0.1407993584871292,
"learning_rate": 4.4894340180286684e-05,
"loss": 1.0105,
"mean_token_accuracy": 0.7453994438052177,
"num_tokens": 234656067.0,
"step": 3730
},
{
"entropy": 1.3192792139947414,
"epoch": 0.5527025529242251,
"grad_norm": 0.11902996152639389,
"learning_rate": 4.474656420865967e-05,
"loss": 1.0293,
"mean_token_accuracy": 0.7379258319735527,
"num_tokens": 235276644.0,
"step": 3740
},
{
"entropy": 1.3451191641390323,
"epoch": 0.5541803672368567,
"grad_norm": 0.1200229600071907,
"learning_rate": 4.459878823703266e-05,
"loss": 1.0129,
"mean_token_accuracy": 0.7419077165424823,
"num_tokens": 235915640.0,
"step": 3750
},
{
"entropy": 1.341741495579481,
"epoch": 0.5556581815494883,
"grad_norm": 0.10994552075862885,
"learning_rate": 4.445101226540564e-05,
"loss": 1.051,
"mean_token_accuracy": 0.7377764590084552,
"num_tokens": 236568402.0,
"step": 3760
},
{
"entropy": 1.313062135130167,
"epoch": 0.5571359958621199,
"grad_norm": 0.10962233692407608,
"learning_rate": 4.430323629377863e-05,
"loss": 1.0147,
"mean_token_accuracy": 0.7424600318074226,
"num_tokens": 237197416.0,
"step": 3770
},
{
"entropy": 1.3273049861192703,
"epoch": 0.5586138101747515,
"grad_norm": 0.12473728507757187,
"learning_rate": 4.415546032215162e-05,
"loss": 1.0511,
"mean_token_accuracy": 0.7336776547133923,
"num_tokens": 237829704.0,
"step": 3780
},
{
"entropy": 1.3306392684578896,
"epoch": 0.5600916244873831,
"grad_norm": 0.11905784904956818,
"learning_rate": 4.400768435052461e-05,
"loss": 1.043,
"mean_token_accuracy": 0.7365007124841213,
"num_tokens": 238457474.0,
"step": 3790
},
{
"entropy": 1.3824568182229995,
"epoch": 0.5615694388000148,
"grad_norm": 0.12441007047891617,
"learning_rate": 4.385990837889759e-05,
"loss": 1.0776,
"mean_token_accuracy": 0.7283789575099945,
"num_tokens": 239098164.0,
"step": 3800
},
{
"entropy": 1.3517411895096303,
"epoch": 0.5630472531126464,
"grad_norm": 0.10452092438936234,
"learning_rate": 4.371213240727058e-05,
"loss": 1.0472,
"mean_token_accuracy": 0.7371180124580861,
"num_tokens": 239752501.0,
"step": 3810
},
{
"entropy": 1.3083030074834823,
"epoch": 0.564525067425278,
"grad_norm": 0.14152932167053223,
"learning_rate": 4.3564356435643565e-05,
"loss": 0.995,
"mean_token_accuracy": 0.7436737760901451,
"num_tokens": 240384011.0,
"step": 3820
},
{
"entropy": 1.3285958595573901,
"epoch": 0.5660028817379096,
"grad_norm": 0.11274420469999313,
"learning_rate": 4.341658046401655e-05,
"loss": 1.0192,
"mean_token_accuracy": 0.738641119748354,
"num_tokens": 240999874.0,
"step": 3830
},
{
"entropy": 1.2800329469144345,
"epoch": 0.5674806960505413,
"grad_norm": 0.11731458455324173,
"learning_rate": 4.326880449238954e-05,
"loss": 0.9824,
"mean_token_accuracy": 0.7487463176250457,
"num_tokens": 241640956.0,
"step": 3840
},
{
"entropy": 1.3452030673623085,
"epoch": 0.5689585103631729,
"grad_norm": 0.1167834997177124,
"learning_rate": 4.312102852076252e-05,
"loss": 1.0232,
"mean_token_accuracy": 0.7404698729515076,
"num_tokens": 242279933.0,
"step": 3850
},
{
"entropy": 1.3529712542891503,
"epoch": 0.5704363246758045,
"grad_norm": 0.1278751939535141,
"learning_rate": 4.297325254913551e-05,
"loss": 0.9995,
"mean_token_accuracy": 0.7444183379411697,
"num_tokens": 242922498.0,
"step": 3860
},
{
"entropy": 1.3116788499057292,
"epoch": 0.5719141389884361,
"grad_norm": 0.10567767918109894,
"learning_rate": 4.28254765775085e-05,
"loss": 1.0132,
"mean_token_accuracy": 0.7404111728072167,
"num_tokens": 243533542.0,
"step": 3870
},
{
"entropy": 1.3166671507060528,
"epoch": 0.5733919533010677,
"grad_norm": 0.1134534403681755,
"learning_rate": 4.267770060588149e-05,
"loss": 0.9807,
"mean_token_accuracy": 0.7477494470775128,
"num_tokens": 244160728.0,
"step": 3880
},
{
"entropy": 1.2959009833633899,
"epoch": 0.5748697676136993,
"grad_norm": 0.13303719460964203,
"learning_rate": 4.252992463425447e-05,
"loss": 0.9538,
"mean_token_accuracy": 0.7553890861570836,
"num_tokens": 244784452.0,
"step": 3890
},
{
"entropy": 1.3435784846544265,
"epoch": 0.576347581926331,
"grad_norm": 0.11970516294240952,
"learning_rate": 4.238214866262746e-05,
"loss": 1.044,
"mean_token_accuracy": 0.7328359387814999,
"num_tokens": 245415471.0,
"step": 3900
},
{
"entropy": 1.3250922329723835,
"epoch": 0.5778253962389626,
"grad_norm": 0.14801903069019318,
"learning_rate": 4.2234372691000446e-05,
"loss": 1.0151,
"mean_token_accuracy": 0.7450727418065071,
"num_tokens": 246051773.0,
"step": 3910
},
{
"entropy": 1.3530432641506196,
"epoch": 0.5793032105515942,
"grad_norm": 0.13875193893909454,
"learning_rate": 4.2086596719373434e-05,
"loss": 1.0107,
"mean_token_accuracy": 0.7407213382422924,
"num_tokens": 246673030.0,
"step": 3920
},
{
"entropy": 1.3028004743158816,
"epoch": 0.5807810248642258,
"grad_norm": 0.12098074704408646,
"learning_rate": 4.1938820747746415e-05,
"loss": 0.9957,
"mean_token_accuracy": 0.7456411838531494,
"num_tokens": 247301114.0,
"step": 3930
},
{
"entropy": 1.3270177111029624,
"epoch": 0.5822588391768574,
"grad_norm": 0.12103700637817383,
"learning_rate": 4.1791044776119404e-05,
"loss": 1.0168,
"mean_token_accuracy": 0.7393665313720703,
"num_tokens": 247925288.0,
"step": 3940
},
{
"entropy": 1.3316473290324211,
"epoch": 0.583736653489489,
"grad_norm": 0.11334571242332458,
"learning_rate": 4.164326880449239e-05,
"loss": 1.0246,
"mean_token_accuracy": 0.7398273125290871,
"num_tokens": 248563570.0,
"step": 3950
},
{
"entropy": 1.3447592370212078,
"epoch": 0.5852144678021206,
"grad_norm": 0.14425861835479736,
"learning_rate": 4.149549283286538e-05,
"loss": 1.0188,
"mean_token_accuracy": 0.7414998419582843,
"num_tokens": 249187118.0,
"step": 3960
},
{
"entropy": 1.3157505065202713,
"epoch": 0.5866922821147523,
"grad_norm": 0.1253083348274231,
"learning_rate": 4.134771686123837e-05,
"loss": 1.006,
"mean_token_accuracy": 0.7437942959368229,
"num_tokens": 249818795.0,
"step": 3970
},
{
"entropy": 1.3160997398197651,
"epoch": 0.5881700964273839,
"grad_norm": 0.14071162045001984,
"learning_rate": 4.119994088961135e-05,
"loss": 0.9944,
"mean_token_accuracy": 0.7446533113718032,
"num_tokens": 250442743.0,
"step": 3980
},
{
"entropy": 1.3181477546691895,
"epoch": 0.5896479107400155,
"grad_norm": 0.11922013759613037,
"learning_rate": 4.105216491798434e-05,
"loss": 1.0151,
"mean_token_accuracy": 0.7434865787625313,
"num_tokens": 251070828.0,
"step": 3990
},
{
"entropy": 1.3841412678360938,
"epoch": 0.5911257250526472,
"grad_norm": 0.12561756372451782,
"learning_rate": 4.0904388946357326e-05,
"loss": 1.0471,
"mean_token_accuracy": 0.7363124743103981,
"num_tokens": 251720365.0,
"step": 4000
},
{
"entropy": 1.3293801605701447,
"epoch": 0.5926035393652788,
"grad_norm": 0.12026660889387131,
"learning_rate": 4.0756612974730315e-05,
"loss": 0.9991,
"mean_token_accuracy": 0.7464115582406521,
"num_tokens": 252352493.0,
"step": 4010
},
{
"entropy": 1.3253483653068543,
"epoch": 0.5940813536779104,
"grad_norm": 0.1290450245141983,
"learning_rate": 4.0608837003103296e-05,
"loss": 0.9906,
"mean_token_accuracy": 0.7443468227982522,
"num_tokens": 252987335.0,
"step": 4020
},
{
"entropy": 1.274603036046028,
"epoch": 0.595559167990542,
"grad_norm": 0.1409289687871933,
"learning_rate": 4.0461061031476284e-05,
"loss": 0.9387,
"mean_token_accuracy": 0.7586248151957988,
"num_tokens": 253608440.0,
"step": 4030
},
{
"entropy": 1.346203289180994,
"epoch": 0.5970369823031736,
"grad_norm": 0.1403258740901947,
"learning_rate": 4.031328505984927e-05,
"loss": 1.0569,
"mean_token_accuracy": 0.7334101386368275,
"num_tokens": 254234368.0,
"step": 4040
},
{
"entropy": 1.3868733286857604,
"epoch": 0.5985147966158052,
"grad_norm": 0.12271698564291,
"learning_rate": 4.016550908822226e-05,
"loss": 1.0244,
"mean_token_accuracy": 0.7363365158438683,
"num_tokens": 254853431.0,
"step": 4050
},
{
"entropy": 1.363221886754036,
"epoch": 0.5999926109284368,
"grad_norm": 0.12163551896810532,
"learning_rate": 4.001773311659525e-05,
"loss": 1.074,
"mean_token_accuracy": 0.7314470805227756,
"num_tokens": 255453933.0,
"step": 4060
},
{
"entropy": 1.3116975866258145,
"epoch": 0.6014704252410684,
"grad_norm": 0.13113334774971008,
"learning_rate": 3.986995714496823e-05,
"loss": 0.9968,
"mean_token_accuracy": 0.745627174526453,
"num_tokens": 256080906.0,
"step": 4070
},
{
"entropy": 1.351020661741495,
"epoch": 0.6029482395537,
"grad_norm": 0.11195094883441925,
"learning_rate": 3.972218117334122e-05,
"loss": 1.0541,
"mean_token_accuracy": 0.7320830643177032,
"num_tokens": 256708275.0,
"step": 4080
},
{
"entropy": 1.306433204561472,
"epoch": 0.6044260538663317,
"grad_norm": 0.1212775856256485,
"learning_rate": 3.957440520171421e-05,
"loss": 0.9957,
"mean_token_accuracy": 0.745367382466793,
"num_tokens": 257354229.0,
"step": 4090
},
{
"entropy": 1.2912617072463035,
"epoch": 0.6059038681789634,
"grad_norm": 0.12214183807373047,
"learning_rate": 3.9426629230087195e-05,
"loss": 0.9587,
"mean_token_accuracy": 0.7531531445682049,
"num_tokens": 257972018.0,
"step": 4100
},
{
"entropy": 1.316209364682436,
"epoch": 0.607381682491595,
"grad_norm": 0.11024002730846405,
"learning_rate": 3.927885325846018e-05,
"loss": 1.0043,
"mean_token_accuracy": 0.7449470959603787,
"num_tokens": 258607359.0,
"step": 4110
},
{
"entropy": 1.2945946514606477,
"epoch": 0.6088594968042266,
"grad_norm": 0.1317119598388672,
"learning_rate": 3.9131077286833165e-05,
"loss": 0.9916,
"mean_token_accuracy": 0.7498336635529995,
"num_tokens": 259236898.0,
"step": 4120
},
{
"entropy": 1.3261870265007019,
"epoch": 0.6103373111168582,
"grad_norm": 0.11150126159191132,
"learning_rate": 3.898330131520615e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7454674303531647,
"num_tokens": 259865457.0,
"step": 4130
},
{
"entropy": 1.3262874715030193,
"epoch": 0.6118151254294898,
"grad_norm": 0.12116798758506775,
"learning_rate": 3.8835525343579135e-05,
"loss": 0.9764,
"mean_token_accuracy": 0.748883631825447,
"num_tokens": 260478748.0,
"step": 4140
},
{
"entropy": 1.3318323902785778,
"epoch": 0.6132929397421214,
"grad_norm": 0.11874970048666,
"learning_rate": 3.868774937195212e-05,
"loss": 0.9869,
"mean_token_accuracy": 0.7489691562950611,
"num_tokens": 261109091.0,
"step": 4150
},
{
"entropy": 1.294984768331051,
"epoch": 0.614770754054753,
"grad_norm": 0.13271567225456238,
"learning_rate": 3.853997340032511e-05,
"loss": 0.9784,
"mean_token_accuracy": 0.7473281040787697,
"num_tokens": 261729703.0,
"step": 4160
},
{
"entropy": 1.3404998533427714,
"epoch": 0.6162485683673846,
"grad_norm": 0.11501745134592056,
"learning_rate": 3.839219742869809e-05,
"loss": 1.032,
"mean_token_accuracy": 0.7398579135537148,
"num_tokens": 262345918.0,
"step": 4170
},
{
"entropy": 1.2984641678631306,
"epoch": 0.6177263826800162,
"grad_norm": 0.10657823830842972,
"learning_rate": 3.824442145707108e-05,
"loss": 0.9972,
"mean_token_accuracy": 0.7439127787947655,
"num_tokens": 262993350.0,
"step": 4180
},
{
"entropy": 1.3517408087849616,
"epoch": 0.6192041969926478,
"grad_norm": 0.13800758123397827,
"learning_rate": 3.809664548544407e-05,
"loss": 1.033,
"mean_token_accuracy": 0.736748181283474,
"num_tokens": 263615371.0,
"step": 4190
},
{
"entropy": 1.3334587171673775,
"epoch": 0.6206820113052794,
"grad_norm": 0.12172678112983704,
"learning_rate": 3.794886951381705e-05,
"loss": 1.0111,
"mean_token_accuracy": 0.7427098996937275,
"num_tokens": 264234097.0,
"step": 4200
},
{
"entropy": 1.362929881364107,
"epoch": 0.622159825617911,
"grad_norm": 0.13081179559230804,
"learning_rate": 3.780109354219004e-05,
"loss": 1.0356,
"mean_token_accuracy": 0.7373303383588791,
"num_tokens": 264863344.0,
"step": 4210
},
{
"entropy": 1.315098512172699,
"epoch": 0.6236376399305428,
"grad_norm": 0.11723612248897552,
"learning_rate": 3.765331757056303e-05,
"loss": 0.9869,
"mean_token_accuracy": 0.7490851148962975,
"num_tokens": 265499451.0,
"step": 4220
},
{
"entropy": 1.3551609128713609,
"epoch": 0.6251154542431744,
"grad_norm": 0.1283220797777176,
"learning_rate": 3.7505541598936015e-05,
"loss": 1.0368,
"mean_token_accuracy": 0.7416560888290405,
"num_tokens": 266130209.0,
"step": 4230
},
{
"entropy": 1.2948666542768479,
"epoch": 0.626593268555806,
"grad_norm": 0.13036693632602692,
"learning_rate": 3.7357765627309e-05,
"loss": 0.9835,
"mean_token_accuracy": 0.7474061094224453,
"num_tokens": 266763275.0,
"step": 4240
},
{
"entropy": 1.328162982314825,
"epoch": 0.6280710828684376,
"grad_norm": 0.12736549973487854,
"learning_rate": 3.7209989655681985e-05,
"loss": 0.9843,
"mean_token_accuracy": 0.746946319192648,
"num_tokens": 267392042.0,
"step": 4250
},
{
"entropy": 1.327622577548027,
"epoch": 0.6295488971810692,
"grad_norm": 0.13731716573238373,
"learning_rate": 3.706221368405497e-05,
"loss": 1.021,
"mean_token_accuracy": 0.7412622094154357,
"num_tokens": 268035196.0,
"step": 4260
},
{
"entropy": 1.3403167374432088,
"epoch": 0.6310267114937008,
"grad_norm": 0.1264178305864334,
"learning_rate": 3.691443771242796e-05,
"loss": 1.0396,
"mean_token_accuracy": 0.7385567761957645,
"num_tokens": 268641369.0,
"step": 4270
},
{
"entropy": 1.3581008620560169,
"epoch": 0.6325045258063324,
"grad_norm": 0.11115839332342148,
"learning_rate": 3.676666174080094e-05,
"loss": 1.0449,
"mean_token_accuracy": 0.7357151411473751,
"num_tokens": 269273142.0,
"step": 4280
},
{
"entropy": 1.2959826327860355,
"epoch": 0.633982340118964,
"grad_norm": 0.11848369240760803,
"learning_rate": 3.661888576917393e-05,
"loss": 0.9854,
"mean_token_accuracy": 0.7469957664608955,
"num_tokens": 269905326.0,
"step": 4290
},
{
"entropy": 1.3228461749851703,
"epoch": 0.6354601544315956,
"grad_norm": 0.12460760027170181,
"learning_rate": 3.647110979754692e-05,
"loss": 1.0073,
"mean_token_accuracy": 0.7444317832589149,
"num_tokens": 270545604.0,
"step": 4300
},
{
"entropy": 1.3390370070934297,
"epoch": 0.6369379687442273,
"grad_norm": 0.12076804786920547,
"learning_rate": 3.632333382591991e-05,
"loss": 1.0032,
"mean_token_accuracy": 0.7412038818001747,
"num_tokens": 271168533.0,
"step": 4310
},
{
"entropy": 1.3059133537113667,
"epoch": 0.6384157830568589,
"grad_norm": 0.11399949342012405,
"learning_rate": 3.6175557854292896e-05,
"loss": 0.9894,
"mean_token_accuracy": 0.7461211532354355,
"num_tokens": 271784029.0,
"step": 4320
},
{
"entropy": 1.3515030421316623,
"epoch": 0.6398935973694905,
"grad_norm": 0.15675301849842072,
"learning_rate": 3.602778188266588e-05,
"loss": 1.0325,
"mean_token_accuracy": 0.7383571431040764,
"num_tokens": 272407600.0,
"step": 4330
},
{
"entropy": 1.2898739270865918,
"epoch": 0.6413714116821222,
"grad_norm": 0.11768002063035965,
"learning_rate": 3.5880005911038866e-05,
"loss": 0.9787,
"mean_token_accuracy": 0.7501869194209576,
"num_tokens": 273036432.0,
"step": 4340
},
{
"entropy": 1.3185631178319455,
"epoch": 0.6428492259947538,
"grad_norm": 0.13108837604522705,
"learning_rate": 3.5732229939411854e-05,
"loss": 1.0022,
"mean_token_accuracy": 0.7421830080449581,
"num_tokens": 273649995.0,
"step": 4350
},
{
"entropy": 1.3045101426541805,
"epoch": 0.6443270403073854,
"grad_norm": 0.1088869646191597,
"learning_rate": 3.558445396778484e-05,
"loss": 0.9989,
"mean_token_accuracy": 0.7463624097406865,
"num_tokens": 274299257.0,
"step": 4360
},
{
"entropy": 1.3702871024608612,
"epoch": 0.645804854620017,
"grad_norm": 0.12465790659189224,
"learning_rate": 3.5436677996157824e-05,
"loss": 1.016,
"mean_token_accuracy": 0.7393311135470867,
"num_tokens": 274950163.0,
"step": 4370
},
{
"entropy": 1.296142727136612,
"epoch": 0.6472826689326486,
"grad_norm": 0.12053404748439789,
"learning_rate": 3.528890202453081e-05,
"loss": 0.97,
"mean_token_accuracy": 0.749032299220562,
"num_tokens": 275586098.0,
"step": 4380
},
{
"entropy": 1.3169789105653762,
"epoch": 0.6487604832452802,
"grad_norm": 0.1511235386133194,
"learning_rate": 3.51411260529038e-05,
"loss": 1.0044,
"mean_token_accuracy": 0.7442675150930882,
"num_tokens": 276221733.0,
"step": 4390
},
{
"entropy": 1.3407318077981472,
"epoch": 0.6502382975579118,
"grad_norm": 0.11825191974639893,
"learning_rate": 3.499335008127679e-05,
"loss": 1.0401,
"mean_token_accuracy": 0.7368831485509872,
"num_tokens": 276851809.0,
"step": 4400
},
{
"entropy": 1.3613334082067012,
"epoch": 0.6517161118705435,
"grad_norm": 0.12834398448467255,
"learning_rate": 3.484557410964977e-05,
"loss": 1.0636,
"mean_token_accuracy": 0.7363037653267384,
"num_tokens": 277486603.0,
"step": 4410
},
{
"entropy": 1.3078240409493447,
"epoch": 0.6531939261831751,
"grad_norm": 0.1147545874118805,
"learning_rate": 3.469779813802276e-05,
"loss": 1.0033,
"mean_token_accuracy": 0.745844904333353,
"num_tokens": 278106864.0,
"step": 4420
},
{
"entropy": 1.3462509505450726,
"epoch": 0.6546717404958067,
"grad_norm": 0.11914671957492828,
"learning_rate": 3.4550022166395746e-05,
"loss": 1.0053,
"mean_token_accuracy": 0.7413943104445935,
"num_tokens": 278739591.0,
"step": 4430
},
{
"entropy": 1.3763988889753818,
"epoch": 0.6561495548084383,
"grad_norm": 0.13147027790546417,
"learning_rate": 3.4402246194768734e-05,
"loss": 1.0524,
"mean_token_accuracy": 0.7353928349912167,
"num_tokens": 279376457.0,
"step": 4440
},
{
"entropy": 1.3218246966600418,
"epoch": 0.6576273691210699,
"grad_norm": 0.12028536945581436,
"learning_rate": 3.425447022314172e-05,
"loss": 1.0124,
"mean_token_accuracy": 0.7395353779196739,
"num_tokens": 279998105.0,
"step": 4450
},
{
"entropy": 1.3321923702955245,
"epoch": 0.6591051834337015,
"grad_norm": 0.13767987489700317,
"learning_rate": 3.4106694251514704e-05,
"loss": 1.0312,
"mean_token_accuracy": 0.7353999748826027,
"num_tokens": 280605980.0,
"step": 4460
},
{
"entropy": 1.338740762323141,
"epoch": 0.6605829977463332,
"grad_norm": 0.10273656249046326,
"learning_rate": 3.395891827988769e-05,
"loss": 1.0141,
"mean_token_accuracy": 0.74061214402318,
"num_tokens": 281240224.0,
"step": 4470
},
{
"entropy": 1.32241290807724,
"epoch": 0.6620608120589648,
"grad_norm": 0.142890065908432,
"learning_rate": 3.381114230826068e-05,
"loss": 0.9966,
"mean_token_accuracy": 0.7456200569868088,
"num_tokens": 281855831.0,
"step": 4480
},
{
"entropy": 1.3304771170020104,
"epoch": 0.6635386263715964,
"grad_norm": 0.1134033054113388,
"learning_rate": 3.366336633663367e-05,
"loss": 1.0015,
"mean_token_accuracy": 0.7453427657485008,
"num_tokens": 282485498.0,
"step": 4490
},
{
"entropy": 1.32518659979105,
"epoch": 0.665016440684228,
"grad_norm": 0.13597334921360016,
"learning_rate": 3.351559036500665e-05,
"loss": 1.0019,
"mean_token_accuracy": 0.7464072823524475,
"num_tokens": 283100980.0,
"step": 4500
},
{
"entropy": 1.3376376338303089,
"epoch": 0.6664942549968597,
"grad_norm": 0.12421192973852158,
"learning_rate": 3.336781439337964e-05,
"loss": 1.0566,
"mean_token_accuracy": 0.735713567584753,
"num_tokens": 283715839.0,
"step": 4510
},
{
"entropy": 1.3360460251569748,
"epoch": 0.6679720693094913,
"grad_norm": 0.1386958807706833,
"learning_rate": 3.322003842175263e-05,
"loss": 1.0178,
"mean_token_accuracy": 0.7404295057058334,
"num_tokens": 284345527.0,
"step": 4520
},
{
"entropy": 1.2704548306763173,
"epoch": 0.6694498836221229,
"grad_norm": 0.10363002866506577,
"learning_rate": 3.3072262450125615e-05,
"loss": 0.9487,
"mean_token_accuracy": 0.7572251930832863,
"num_tokens": 284968115.0,
"step": 4530
},
{
"entropy": 1.3422211334109306,
"epoch": 0.6709276979347545,
"grad_norm": 0.14423802495002747,
"learning_rate": 3.2924486478498597e-05,
"loss": 1.0459,
"mean_token_accuracy": 0.7374594822525978,
"num_tokens": 285590307.0,
"step": 4540
},
{
"entropy": 1.371665420383215,
"epoch": 0.6724055122473861,
"grad_norm": 0.12783068418502808,
"learning_rate": 3.2776710506871585e-05,
"loss": 1.0502,
"mean_token_accuracy": 0.7360943183302879,
"num_tokens": 286201394.0,
"step": 4550
},
{
"entropy": 1.3077406004071235,
"epoch": 0.6738833265600177,
"grad_norm": 0.12808766961097717,
"learning_rate": 3.262893453524457e-05,
"loss": 1.0083,
"mean_token_accuracy": 0.7429508715867996,
"num_tokens": 286835325.0,
"step": 4560
},
{
"entropy": 1.364883267134428,
"epoch": 0.6753611408726493,
"grad_norm": 0.1129937618970871,
"learning_rate": 3.248115856361756e-05,
"loss": 1.0738,
"mean_token_accuracy": 0.7299041479825974,
"num_tokens": 287480242.0,
"step": 4570
},
{
"entropy": 1.3169206887483598,
"epoch": 0.6768389551852809,
"grad_norm": 0.12290552258491516,
"learning_rate": 3.233338259199055e-05,
"loss": 1.0174,
"mean_token_accuracy": 0.7412481807172299,
"num_tokens": 288132348.0,
"step": 4580
},
{
"entropy": 1.3177730686962605,
"epoch": 0.6783167694979126,
"grad_norm": 0.1399271935224533,
"learning_rate": 3.218560662036353e-05,
"loss": 1.0184,
"mean_token_accuracy": 0.740997476130724,
"num_tokens": 288738626.0,
"step": 4590
},
{
"entropy": 1.331467841565609,
"epoch": 0.6797945838105443,
"grad_norm": 0.12841732800006866,
"learning_rate": 3.203783064873652e-05,
"loss": 0.9855,
"mean_token_accuracy": 0.7499361656606197,
"num_tokens": 289372236.0,
"step": 4600
},
{
"entropy": 1.3721258901059628,
"epoch": 0.6812723981231759,
"grad_norm": 0.12660683691501617,
"learning_rate": 3.189005467710951e-05,
"loss": 1.0779,
"mean_token_accuracy": 0.7270358420908452,
"num_tokens": 289973137.0,
"step": 4610
},
{
"entropy": 1.3067141421139241,
"epoch": 0.6827502124358075,
"grad_norm": 0.11172041296958923,
"learning_rate": 3.174227870548249e-05,
"loss": 0.9463,
"mean_token_accuracy": 0.7545724369585514,
"num_tokens": 290621450.0,
"step": 4620
},
{
"entropy": 1.3762259379029274,
"epoch": 0.6842280267484391,
"grad_norm": 0.11443869769573212,
"learning_rate": 3.159450273385548e-05,
"loss": 1.0864,
"mean_token_accuracy": 0.7282682999968528,
"num_tokens": 291255096.0,
"step": 4630
},
{
"entropy": 1.354401236027479,
"epoch": 0.6857058410610707,
"grad_norm": 0.13201551139354706,
"learning_rate": 3.1446726762228465e-05,
"loss": 1.0235,
"mean_token_accuracy": 0.7380030490458012,
"num_tokens": 291876041.0,
"step": 4640
},
{
"entropy": 1.2984419390559196,
"epoch": 0.6871836553737023,
"grad_norm": 0.11332850158214569,
"learning_rate": 3.129895079060145e-05,
"loss": 1.0052,
"mean_token_accuracy": 0.7450248651206494,
"num_tokens": 292514791.0,
"step": 4650
},
{
"entropy": 1.332960170507431,
"epoch": 0.6886614696863339,
"grad_norm": 0.13389021158218384,
"learning_rate": 3.1151174818974435e-05,
"loss": 0.9958,
"mean_token_accuracy": 0.7439567111432552,
"num_tokens": 293148361.0,
"step": 4660
},
{
"entropy": 1.3010660000145435,
"epoch": 0.6901392839989655,
"grad_norm": 0.12451417744159698,
"learning_rate": 3.100339884734742e-05,
"loss": 0.9849,
"mean_token_accuracy": 0.7485992729663848,
"num_tokens": 293773190.0,
"step": 4670
},
{
"entropy": 1.3693323209881783,
"epoch": 0.6916170983115971,
"grad_norm": 0.14361348748207092,
"learning_rate": 3.0855622875720405e-05,
"loss": 1.0616,
"mean_token_accuracy": 0.7298278719186783,
"num_tokens": 294388572.0,
"step": 4680
},
{
"entropy": 1.3226823516190052,
"epoch": 0.6930949126242287,
"grad_norm": 0.12352283298969269,
"learning_rate": 3.070784690409339e-05,
"loss": 1.016,
"mean_token_accuracy": 0.739595515280962,
"num_tokens": 295015634.0,
"step": 4690
},
{
"entropy": 1.3062335178256035,
"epoch": 0.6945727269368603,
"grad_norm": 0.11143922060728073,
"learning_rate": 3.056007093246638e-05,
"loss": 0.9872,
"mean_token_accuracy": 0.7466958984732628,
"num_tokens": 295654251.0,
"step": 4700
},
{
"entropy": 1.2809455893933772,
"epoch": 0.696050541249492,
"grad_norm": 0.10888683795928955,
"learning_rate": 3.0412294960839373e-05,
"loss": 0.9587,
"mean_token_accuracy": 0.7509395398199559,
"num_tokens": 296290910.0,
"step": 4710
},
{
"entropy": 1.3530108958482743,
"epoch": 0.6975283555621237,
"grad_norm": 0.1329011619091034,
"learning_rate": 3.0264518989212354e-05,
"loss": 1.0061,
"mean_token_accuracy": 0.7433172650635242,
"num_tokens": 296909724.0,
"step": 4720
},
{
"entropy": 1.3416468262672425,
"epoch": 0.6990061698747553,
"grad_norm": 0.11271080374717712,
"learning_rate": 3.0116743017585343e-05,
"loss": 1.0143,
"mean_token_accuracy": 0.7415925867855548,
"num_tokens": 297535996.0,
"step": 4730
},
{
"entropy": 1.3463890179991722,
"epoch": 0.7004839841873869,
"grad_norm": 0.14932890236377716,
"learning_rate": 2.996896704595833e-05,
"loss": 1.0562,
"mean_token_accuracy": 0.732879837602377,
"num_tokens": 298163564.0,
"step": 4740
},
{
"entropy": 1.3371880792081356,
"epoch": 0.7019617985000185,
"grad_norm": 0.14559057354927063,
"learning_rate": 2.9821191074331316e-05,
"loss": 1.0516,
"mean_token_accuracy": 0.7364227913320065,
"num_tokens": 298794213.0,
"step": 4750
},
{
"entropy": 1.3115318283438682,
"epoch": 0.7034396128126501,
"grad_norm": 0.12408871203660965,
"learning_rate": 2.96734151027043e-05,
"loss": 1.011,
"mean_token_accuracy": 0.7429202817380428,
"num_tokens": 299435315.0,
"step": 4760
},
{
"entropy": 1.323327000439167,
"epoch": 0.7049174271252817,
"grad_norm": 0.1299198865890503,
"learning_rate": 2.952563913107729e-05,
"loss": 1.0114,
"mean_token_accuracy": 0.741088104993105,
"num_tokens": 300060042.0,
"step": 4770
},
{
"entropy": 1.3446701981127263,
"epoch": 0.7063952414379133,
"grad_norm": 0.14076866209506989,
"learning_rate": 2.9377863159450274e-05,
"loss": 0.9905,
"mean_token_accuracy": 0.7466110914945603,
"num_tokens": 300651338.0,
"step": 4780
},
{
"entropy": 1.3259353674948215,
"epoch": 0.7078730557505449,
"grad_norm": 0.10263624042272568,
"learning_rate": 2.9230087187823262e-05,
"loss": 1.0346,
"mean_token_accuracy": 0.7375701159238816,
"num_tokens": 301304034.0,
"step": 4790
},
{
"entropy": 1.3674908801913261,
"epoch": 0.7093508700631765,
"grad_norm": 0.12330764532089233,
"learning_rate": 2.9082311216196247e-05,
"loss": 1.0602,
"mean_token_accuracy": 0.7365720339119435,
"num_tokens": 301923306.0,
"step": 4800
},
{
"entropy": 1.3329905986785888,
"epoch": 0.7108286843758082,
"grad_norm": 0.134576216340065,
"learning_rate": 2.893453524456923e-05,
"loss": 1.0265,
"mean_token_accuracy": 0.7412666134536267,
"num_tokens": 302545691.0,
"step": 4810
},
{
"entropy": 1.3309357464313507,
"epoch": 0.7123064986884398,
"grad_norm": 0.12007878720760345,
"learning_rate": 2.878675927294222e-05,
"loss": 0.9783,
"mean_token_accuracy": 0.745373184978962,
"num_tokens": 303181147.0,
"step": 4820
},
{
"entropy": 1.3643394075334072,
"epoch": 0.7137843130010714,
"grad_norm": 0.136694073677063,
"learning_rate": 2.8638983301315208e-05,
"loss": 1.03,
"mean_token_accuracy": 0.7360346958041191,
"num_tokens": 303772203.0,
"step": 4830
},
{
"entropy": 1.2909266255795955,
"epoch": 0.715262127313703,
"grad_norm": 0.1237269937992096,
"learning_rate": 2.8491207329688196e-05,
"loss": 0.9847,
"mean_token_accuracy": 0.7457400150597095,
"num_tokens": 304400205.0,
"step": 4840
},
{
"entropy": 1.318508828431368,
"epoch": 0.7167399416263347,
"grad_norm": 0.1296572983264923,
"learning_rate": 2.8343431358061178e-05,
"loss": 0.9943,
"mean_token_accuracy": 0.7424058385193348,
"num_tokens": 305034154.0,
"step": 4850
},
{
"entropy": 1.3280914664268493,
"epoch": 0.7182177559389663,
"grad_norm": 0.10831849277019501,
"learning_rate": 2.8195655386434166e-05,
"loss": 1.0024,
"mean_token_accuracy": 0.7443806000053883,
"num_tokens": 305660112.0,
"step": 4860
},
{
"entropy": 1.345757918804884,
"epoch": 0.7196955702515979,
"grad_norm": 0.15830285847187042,
"learning_rate": 2.8047879414807154e-05,
"loss": 1.0241,
"mean_token_accuracy": 0.7413417495787143,
"num_tokens": 306284169.0,
"step": 4870
},
{
"entropy": 1.326023256033659,
"epoch": 0.7211733845642295,
"grad_norm": 0.12437301874160767,
"learning_rate": 2.7900103443180143e-05,
"loss": 1.0236,
"mean_token_accuracy": 0.7441856421530246,
"num_tokens": 306925573.0,
"step": 4880
},
{
"entropy": 1.3403374791145324,
"epoch": 0.7226511988768611,
"grad_norm": 0.14862604439258575,
"learning_rate": 2.7752327471553124e-05,
"loss": 1.0126,
"mean_token_accuracy": 0.7417874552309514,
"num_tokens": 307552556.0,
"step": 4890
},
{
"entropy": 1.3029513664543628,
"epoch": 0.7241290131894927,
"grad_norm": 0.14984281361103058,
"learning_rate": 2.7604551499926112e-05,
"loss": 0.9913,
"mean_token_accuracy": 0.7468802168965339,
"num_tokens": 308192975.0,
"step": 4900
},
{
"entropy": 1.323684511333704,
"epoch": 0.7256068275021244,
"grad_norm": 0.16719244420528412,
"learning_rate": 2.74567755282991e-05,
"loss": 1.014,
"mean_token_accuracy": 0.7450279243290424,
"num_tokens": 308790136.0,
"step": 4910
},
{
"entropy": 1.3346189700067044,
"epoch": 0.727084641814756,
"grad_norm": 0.13141213357448578,
"learning_rate": 2.730899955667209e-05,
"loss": 1.051,
"mean_token_accuracy": 0.7325736321508884,
"num_tokens": 309412957.0,
"step": 4920
},
{
"entropy": 1.307160697877407,
"epoch": 0.7285624561273876,
"grad_norm": 0.1185912936925888,
"learning_rate": 2.716122358504507e-05,
"loss": 0.9784,
"mean_token_accuracy": 0.7491277985274791,
"num_tokens": 310040700.0,
"step": 4930
},
{
"entropy": 1.3605231955647468,
"epoch": 0.7300402704400192,
"grad_norm": 0.11863730102777481,
"learning_rate": 2.701344761341806e-05,
"loss": 1.0576,
"mean_token_accuracy": 0.7326734766364098,
"num_tokens": 310657828.0,
"step": 4940
},
{
"entropy": 1.299007173627615,
"epoch": 0.7315180847526508,
"grad_norm": 0.11598937213420868,
"learning_rate": 2.6865671641791047e-05,
"loss": 0.9913,
"mean_token_accuracy": 0.749681244045496,
"num_tokens": 311288566.0,
"step": 4950
},
{
"entropy": 1.2920017048716546,
"epoch": 0.7329958990652824,
"grad_norm": 0.12922370433807373,
"learning_rate": 2.6717895670164035e-05,
"loss": 0.9955,
"mean_token_accuracy": 0.7468885749578476,
"num_tokens": 311933827.0,
"step": 4960
},
{
"entropy": 1.3599808380007743,
"epoch": 0.7344737133779141,
"grad_norm": 0.12107284367084503,
"learning_rate": 2.6570119698537023e-05,
"loss": 1.0425,
"mean_token_accuracy": 0.7379572823643684,
"num_tokens": 312558228.0,
"step": 4970
},
{
"entropy": 1.3698449276387692,
"epoch": 0.7359515276905457,
"grad_norm": 0.11487340927124023,
"learning_rate": 2.6422343726910005e-05,
"loss": 1.0617,
"mean_token_accuracy": 0.7336210198700428,
"num_tokens": 313183926.0,
"step": 4980
},
{
"entropy": 1.346721203625202,
"epoch": 0.7374293420031773,
"grad_norm": 0.1212073564529419,
"learning_rate": 2.6274567755282993e-05,
"loss": 1.0296,
"mean_token_accuracy": 0.739198499917984,
"num_tokens": 313820949.0,
"step": 4990
},
{
"entropy": 1.3611103758215903,
"epoch": 0.7389071563158089,
"grad_norm": 0.12863674759864807,
"learning_rate": 2.612679178365598e-05,
"loss": 1.0377,
"mean_token_accuracy": 0.7381574101746082,
"num_tokens": 314436283.0,
"step": 5000
},
{
"entropy": 1.325782622396946,
"epoch": 0.7403849706284406,
"grad_norm": 0.118117555975914,
"learning_rate": 2.5979015812028966e-05,
"loss": 1.0518,
"mean_token_accuracy": 0.7347126387059688,
"num_tokens": 315058652.0,
"step": 5010
},
{
"entropy": 1.3325309082865715,
"epoch": 0.7418627849410722,
"grad_norm": 0.12454936653375626,
"learning_rate": 2.583123984040195e-05,
"loss": 1.0319,
"mean_token_accuracy": 0.7397500842809677,
"num_tokens": 315701496.0,
"step": 5020
},
{
"entropy": 1.2837858386337757,
"epoch": 0.7433405992537038,
"grad_norm": 0.12542617321014404,
"learning_rate": 2.568346386877494e-05,
"loss": 0.9858,
"mean_token_accuracy": 0.7501832038164139,
"num_tokens": 316331247.0,
"step": 5030
},
{
"entropy": 1.3427621588110923,
"epoch": 0.7448184135663354,
"grad_norm": 0.12836028635501862,
"learning_rate": 2.5535687897147924e-05,
"loss": 1.038,
"mean_token_accuracy": 0.7358950592577458,
"num_tokens": 316946786.0,
"step": 5040
},
{
"entropy": 1.3334973461925983,
"epoch": 0.746296227878967,
"grad_norm": 0.14334280788898468,
"learning_rate": 2.5387911925520912e-05,
"loss": 1.0219,
"mean_token_accuracy": 0.7420683093369007,
"num_tokens": 317590282.0,
"step": 5050
},
{
"entropy": 1.316165641695261,
"epoch": 0.7477740421915986,
"grad_norm": 0.1569705754518509,
"learning_rate": 2.5240135953893894e-05,
"loss": 1.006,
"mean_token_accuracy": 0.7437090836465359,
"num_tokens": 318210626.0,
"step": 5060
},
{
"entropy": 1.3033836044371128,
"epoch": 0.7492518565042302,
"grad_norm": 0.10642680525779724,
"learning_rate": 2.5092359982266882e-05,
"loss": 0.9893,
"mean_token_accuracy": 0.7470180414617061,
"num_tokens": 318831662.0,
"step": 5070
},
{
"entropy": 1.3135450080037117,
"epoch": 0.7507296708168618,
"grad_norm": 0.1242324709892273,
"learning_rate": 2.494458401063987e-05,
"loss": 0.9842,
"mean_token_accuracy": 0.748679618537426,
"num_tokens": 319460678.0,
"step": 5080
},
{
"entropy": 1.3217751324176787,
"epoch": 0.7522074851294934,
"grad_norm": 0.1090734452009201,
"learning_rate": 2.479680803901286e-05,
"loss": 0.9882,
"mean_token_accuracy": 0.7465294934809208,
"num_tokens": 320080140.0,
"step": 5090
},
{
"entropy": 1.3406529314815998,
"epoch": 0.7536852994421251,
"grad_norm": 0.12375643849372864,
"learning_rate": 2.4649032067385843e-05,
"loss": 1.0267,
"mean_token_accuracy": 0.7397718273103238,
"num_tokens": 320705386.0,
"step": 5100
},
{
"entropy": 1.3804366782307624,
"epoch": 0.7551631137547568,
"grad_norm": 0.13206851482391357,
"learning_rate": 2.450125609575883e-05,
"loss": 1.0535,
"mean_token_accuracy": 0.736749055236578,
"num_tokens": 321347044.0,
"step": 5110
},
{
"entropy": 1.3584469094872476,
"epoch": 0.7566409280673884,
"grad_norm": 0.10561691224575043,
"learning_rate": 2.4353480124131816e-05,
"loss": 1.0408,
"mean_token_accuracy": 0.7360177867114543,
"num_tokens": 321978971.0,
"step": 5120
},
{
"entropy": 1.306953214108944,
"epoch": 0.75811874238002,
"grad_norm": 0.12143130600452423,
"learning_rate": 2.4205704152504805e-05,
"loss": 0.9998,
"mean_token_accuracy": 0.7445025816559792,
"num_tokens": 322613865.0,
"step": 5130
},
{
"entropy": 1.3641792319715023,
"epoch": 0.7595965566926516,
"grad_norm": 0.12223450094461441,
"learning_rate": 2.405792818087779e-05,
"loss": 1.0387,
"mean_token_accuracy": 0.7379502311348916,
"num_tokens": 323247464.0,
"step": 5140
},
{
"entropy": 1.3081051871180533,
"epoch": 0.7610743710052832,
"grad_norm": 0.13382208347320557,
"learning_rate": 2.3910152209250778e-05,
"loss": 1.0069,
"mean_token_accuracy": 0.742257046699524,
"num_tokens": 323867041.0,
"step": 5150
},
{
"entropy": 1.3398429796099662,
"epoch": 0.7625521853179148,
"grad_norm": 0.11734897643327713,
"learning_rate": 2.3762376237623762e-05,
"loss": 1.0501,
"mean_token_accuracy": 0.7373069517314434,
"num_tokens": 324503667.0,
"step": 5160
},
{
"entropy": 1.2856581561267375,
"epoch": 0.7640299996305464,
"grad_norm": 0.11487198621034622,
"learning_rate": 2.361460026599675e-05,
"loss": 0.9925,
"mean_token_accuracy": 0.7459338754415512,
"num_tokens": 325152511.0,
"step": 5170
},
{
"entropy": 1.3095781721174717,
"epoch": 0.765507813943178,
"grad_norm": 0.11295847594738007,
"learning_rate": 2.3466824294369736e-05,
"loss": 0.9761,
"mean_token_accuracy": 0.7487106472253799,
"num_tokens": 325773003.0,
"step": 5180
},
{
"entropy": 1.3086177356541158,
"epoch": 0.7669856282558096,
"grad_norm": 0.1418120115995407,
"learning_rate": 2.3319048322742724e-05,
"loss": 1.009,
"mean_token_accuracy": 0.7405801028013229,
"num_tokens": 326416846.0,
"step": 5190
},
{
"entropy": 1.3360229194164277,
"epoch": 0.7684634425684412,
"grad_norm": 0.1305115967988968,
"learning_rate": 2.3171272351115712e-05,
"loss": 1.0385,
"mean_token_accuracy": 0.7389066144824028,
"num_tokens": 327049923.0,
"step": 5200
},
{
"entropy": 1.3275974862277509,
"epoch": 0.7699412568810728,
"grad_norm": 0.1303836554288864,
"learning_rate": 2.3023496379488697e-05,
"loss": 0.9939,
"mean_token_accuracy": 0.7476765356957913,
"num_tokens": 327690605.0,
"step": 5210
},
{
"entropy": 1.307869978994131,
"epoch": 0.7714190711937046,
"grad_norm": 0.12129199504852295,
"learning_rate": 2.2875720407861685e-05,
"loss": 0.9909,
"mean_token_accuracy": 0.7462148115038871,
"num_tokens": 328317712.0,
"step": 5220
},
{
"entropy": 1.3123974323272705,
"epoch": 0.7728968855063362,
"grad_norm": 0.11937498301267624,
"learning_rate": 2.272794443623467e-05,
"loss": 1.003,
"mean_token_accuracy": 0.7446192368865013,
"num_tokens": 328941674.0,
"step": 5230
},
{
"entropy": 1.3761452838778496,
"epoch": 0.7743746998189678,
"grad_norm": 0.10988405346870422,
"learning_rate": 2.2580168464607658e-05,
"loss": 1.0635,
"mean_token_accuracy": 0.734012907743454,
"num_tokens": 329584137.0,
"step": 5240
},
{
"entropy": 1.2854306407272815,
"epoch": 0.7758525141315994,
"grad_norm": 0.1544429361820221,
"learning_rate": 2.2432392492980643e-05,
"loss": 0.9576,
"mean_token_accuracy": 0.7528227671980858,
"num_tokens": 330220795.0,
"step": 5250
},
{
"entropy": 1.304028608649969,
"epoch": 0.777330328444231,
"grad_norm": 0.12517547607421875,
"learning_rate": 2.2284616521353628e-05,
"loss": 0.9754,
"mean_token_accuracy": 0.7507062517106533,
"num_tokens": 330845075.0,
"step": 5260
},
{
"entropy": 1.3103728748857975,
"epoch": 0.7788081427568626,
"grad_norm": 0.13300468027591705,
"learning_rate": 2.2136840549726616e-05,
"loss": 0.9936,
"mean_token_accuracy": 0.7502763822674752,
"num_tokens": 331461903.0,
"step": 5270
},
{
"entropy": 1.3418636083602906,
"epoch": 0.7802859570694942,
"grad_norm": 0.10688610374927521,
"learning_rate": 2.19890645780996e-05,
"loss": 1.0603,
"mean_token_accuracy": 0.7354485787451267,
"num_tokens": 332098250.0,
"step": 5280
},
{
"entropy": 1.3413996249437332,
"epoch": 0.7817637713821258,
"grad_norm": 0.11547284573316574,
"learning_rate": 2.1841288606472586e-05,
"loss": 1.0183,
"mean_token_accuracy": 0.7401676058769227,
"num_tokens": 332738973.0,
"step": 5290
},
{
"entropy": 1.2956015571951867,
"epoch": 0.7832415856947574,
"grad_norm": 0.14867275953292847,
"learning_rate": 2.1693512634845574e-05,
"loss": 0.9968,
"mean_token_accuracy": 0.7482645206153393,
"num_tokens": 333374842.0,
"step": 5300
},
{
"entropy": 1.3352750092744827,
"epoch": 0.784719400007389,
"grad_norm": 0.12308944761753082,
"learning_rate": 2.154573666321856e-05,
"loss": 1.0076,
"mean_token_accuracy": 0.7402734778821468,
"num_tokens": 333996081.0,
"step": 5310
},
{
"entropy": 1.3263126194477082,
"epoch": 0.7861972143200207,
"grad_norm": 0.12351057678461075,
"learning_rate": 2.1397960691591547e-05,
"loss": 1.0328,
"mean_token_accuracy": 0.7401689246296883,
"num_tokens": 334631011.0,
"step": 5320
},
{
"entropy": 1.3505345225334167,
"epoch": 0.7876750286326523,
"grad_norm": 0.11376931518316269,
"learning_rate": 2.1250184719964535e-05,
"loss": 1.0127,
"mean_token_accuracy": 0.7426583305001259,
"num_tokens": 335261549.0,
"step": 5330
},
{
"entropy": 1.3594610929489135,
"epoch": 0.7891528429452839,
"grad_norm": 0.12028499692678452,
"learning_rate": 2.110240874833752e-05,
"loss": 1.041,
"mean_token_accuracy": 0.7349088214337826,
"num_tokens": 335894829.0,
"step": 5340
},
{
"entropy": 1.3063403144478798,
"epoch": 0.7906306572579156,
"grad_norm": 0.11505310237407684,
"learning_rate": 2.095463277671051e-05,
"loss": 0.9889,
"mean_token_accuracy": 0.7459150403738022,
"num_tokens": 336534149.0,
"step": 5350
},
{
"entropy": 1.2942039281129838,
"epoch": 0.7921084715705472,
"grad_norm": 0.12102124094963074,
"learning_rate": 2.0806856805083493e-05,
"loss": 1.0047,
"mean_token_accuracy": 0.7467892125248909,
"num_tokens": 337167728.0,
"step": 5360
},
{
"entropy": 1.3099549762904643,
"epoch": 0.7935862858831788,
"grad_norm": 0.12091784179210663,
"learning_rate": 2.065908083345648e-05,
"loss": 0.9749,
"mean_token_accuracy": 0.7508032590150833,
"num_tokens": 337792094.0,
"step": 5370
},
{
"entropy": 1.3193748205900193,
"epoch": 0.7950641001958104,
"grad_norm": 0.12178395688533783,
"learning_rate": 2.0511304861829467e-05,
"loss": 0.9837,
"mean_token_accuracy": 0.744479450583458,
"num_tokens": 338402403.0,
"step": 5380
},
{
"entropy": 1.2912467263638974,
"epoch": 0.796541914508442,
"grad_norm": 0.11095555126667023,
"learning_rate": 2.0363528890202455e-05,
"loss": 0.9777,
"mean_token_accuracy": 0.7510395921766758,
"num_tokens": 339051452.0,
"step": 5390
},
{
"entropy": 1.3539048105478286,
"epoch": 0.7980197288210736,
"grad_norm": 0.11416377872228622,
"learning_rate": 2.021575291857544e-05,
"loss": 1.0417,
"mean_token_accuracy": 0.7391513310372829,
"num_tokens": 339688617.0,
"step": 5400
},
{
"entropy": 1.3722274094820022,
"epoch": 0.7994975431337052,
"grad_norm": 0.13663271069526672,
"learning_rate": 2.0067976946948428e-05,
"loss": 1.0616,
"mean_token_accuracy": 0.7323425568640232,
"num_tokens": 340327723.0,
"step": 5410
},
{
"entropy": 1.3680840730667114,
"epoch": 0.8009753574463369,
"grad_norm": 0.12302777916193008,
"learning_rate": 1.9920200975321413e-05,
"loss": 1.0086,
"mean_token_accuracy": 0.7418931379914284,
"num_tokens": 340943329.0,
"step": 5420
},
{
"entropy": 1.3484257988631725,
"epoch": 0.8024531717589685,
"grad_norm": 0.14521946012973785,
"learning_rate": 1.97724250036944e-05,
"loss": 1.0415,
"mean_token_accuracy": 0.7372381918132305,
"num_tokens": 341583436.0,
"step": 5430
},
{
"entropy": 1.3435696944594384,
"epoch": 0.8039309860716001,
"grad_norm": 0.13386188447475433,
"learning_rate": 1.962464903206739e-05,
"loss": 1.0508,
"mean_token_accuracy": 0.7391325704753399,
"num_tokens": 342215207.0,
"step": 5440
},
{
"entropy": 1.3138762816786766,
"epoch": 0.8054088003842317,
"grad_norm": 0.13170363008975983,
"learning_rate": 1.9476873060440374e-05,
"loss": 0.9789,
"mean_token_accuracy": 0.7494944863021373,
"num_tokens": 342842134.0,
"step": 5450
},
{
"entropy": 1.3419123955070973,
"epoch": 0.8068866146968633,
"grad_norm": 0.1314888894557953,
"learning_rate": 1.9329097088813362e-05,
"loss": 1.0312,
"mean_token_accuracy": 0.7364721618592739,
"num_tokens": 343466230.0,
"step": 5460
},
{
"entropy": 1.3453618548810482,
"epoch": 0.808364429009495,
"grad_norm": 0.11651881039142609,
"learning_rate": 1.9181321117186347e-05,
"loss": 1.0159,
"mean_token_accuracy": 0.7454579032957553,
"num_tokens": 344096356.0,
"step": 5470
},
{
"entropy": 1.2968750067055226,
"epoch": 0.8098422433221266,
"grad_norm": 0.13125477731227875,
"learning_rate": 1.9033545145559335e-05,
"loss": 0.9813,
"mean_token_accuracy": 0.7480554945766926,
"num_tokens": 344723865.0,
"step": 5480
},
{
"entropy": 1.3539662800729275,
"epoch": 0.8113200576347582,
"grad_norm": 0.11619358509778976,
"learning_rate": 1.888576917393232e-05,
"loss": 1.0111,
"mean_token_accuracy": 0.7425602056086064,
"num_tokens": 345334991.0,
"step": 5490
},
{
"entropy": 1.335629913955927,
"epoch": 0.8127978719473898,
"grad_norm": 0.14460872113704681,
"learning_rate": 1.8737993202305305e-05,
"loss": 1.0497,
"mean_token_accuracy": 0.7352975860238076,
"num_tokens": 345982288.0,
"step": 5500
},
{
"entropy": 1.3496653221547603,
"epoch": 0.8142756862600214,
"grad_norm": 0.12175831943750381,
"learning_rate": 1.8590217230678293e-05,
"loss": 1.0396,
"mean_token_accuracy": 0.7365844771265984,
"num_tokens": 346595072.0,
"step": 5510
},
{
"entropy": 1.341681607067585,
"epoch": 0.8157535005726531,
"grad_norm": 0.12488234788179398,
"learning_rate": 1.8442441259051278e-05,
"loss": 1.0372,
"mean_token_accuracy": 0.7352021165192127,
"num_tokens": 347209675.0,
"step": 5520
},
{
"entropy": 1.337549727410078,
"epoch": 0.8172313148852847,
"grad_norm": 0.12194401770830154,
"learning_rate": 1.8294665287424263e-05,
"loss": 1.0578,
"mean_token_accuracy": 0.7347122609615326,
"num_tokens": 347835705.0,
"step": 5530
},
{
"entropy": 1.303477893769741,
"epoch": 0.8187091291979163,
"grad_norm": 0.12405266612768173,
"learning_rate": 1.814688931579725e-05,
"loss": 0.9994,
"mean_token_accuracy": 0.7478441722691059,
"num_tokens": 348468668.0,
"step": 5540
},
{
"entropy": 1.3249061562120914,
"epoch": 0.8201869435105479,
"grad_norm": 0.12435730546712875,
"learning_rate": 1.7999113344170236e-05,
"loss": 1.0061,
"mean_token_accuracy": 0.7447381973266601,
"num_tokens": 349081142.0,
"step": 5550
},
{
"entropy": 1.35750472843647,
"epoch": 0.8216647578231795,
"grad_norm": 0.1328584998846054,
"learning_rate": 1.7851337372543224e-05,
"loss": 1.0088,
"mean_token_accuracy": 0.7452337816357613,
"num_tokens": 349720126.0,
"step": 5560
},
{
"entropy": 1.3538759835064411,
"epoch": 0.8231425721358111,
"grad_norm": 0.14198720455169678,
"learning_rate": 1.7703561400916213e-05,
"loss": 1.0484,
"mean_token_accuracy": 0.7349992088973523,
"num_tokens": 350359275.0,
"step": 5570
},
{
"entropy": 1.311447235196829,
"epoch": 0.8246203864484427,
"grad_norm": 0.12205838412046432,
"learning_rate": 1.7555785429289197e-05,
"loss": 0.9965,
"mean_token_accuracy": 0.7460118442773819,
"num_tokens": 350982085.0,
"step": 5580
},
{
"entropy": 1.2985078655183315,
"epoch": 0.8260982007610743,
"grad_norm": 0.13054905831813812,
"learning_rate": 1.7408009457662186e-05,
"loss": 0.9652,
"mean_token_accuracy": 0.750285355746746,
"num_tokens": 351617043.0,
"step": 5590
},
{
"entropy": 1.3172591648995877,
"epoch": 0.827576015073706,
"grad_norm": 0.12170116603374481,
"learning_rate": 1.726023348603517e-05,
"loss": 1.0071,
"mean_token_accuracy": 0.7436146058142186,
"num_tokens": 352229355.0,
"step": 5600
},
{
"entropy": 1.3304045237600803,
"epoch": 0.8290538293863376,
"grad_norm": 0.11743824183940887,
"learning_rate": 1.711245751440816e-05,
"loss": 1.0279,
"mean_token_accuracy": 0.7404954940080642,
"num_tokens": 352870287.0,
"step": 5610
},
{
"entropy": 1.3662690348923205,
"epoch": 0.8305316436989693,
"grad_norm": 0.124085433781147,
"learning_rate": 1.6964681542781144e-05,
"loss": 1.0623,
"mean_token_accuracy": 0.7310058616101742,
"num_tokens": 353530069.0,
"step": 5620
},
{
"entropy": 1.3515878789126874,
"epoch": 0.8320094580116009,
"grad_norm": 0.13237376511096954,
"learning_rate": 1.6816905571154132e-05,
"loss": 1.0463,
"mean_token_accuracy": 0.7363075397908687,
"num_tokens": 354147357.0,
"step": 5630
},
{
"entropy": 1.3044847965240478,
"epoch": 0.8334872723242325,
"grad_norm": 0.13815967738628387,
"learning_rate": 1.6669129599527117e-05,
"loss": 0.9782,
"mean_token_accuracy": 0.7475894182920456,
"num_tokens": 354795962.0,
"step": 5640
},
{
"entropy": 1.3666689321398735,
"epoch": 0.8349650866368641,
"grad_norm": 0.14314478635787964,
"learning_rate": 1.6521353627900105e-05,
"loss": 1.0065,
"mean_token_accuracy": 0.7443801440298558,
"num_tokens": 355417931.0,
"step": 5650
},
{
"entropy": 1.29787110760808,
"epoch": 0.8364429009494957,
"grad_norm": 0.13985678553581238,
"learning_rate": 1.637357765627309e-05,
"loss": 1.001,
"mean_token_accuracy": 0.7457695990800858,
"num_tokens": 356053286.0,
"step": 5660
},
{
"entropy": 1.341988889873028,
"epoch": 0.8379207152621273,
"grad_norm": 0.10513360053300858,
"learning_rate": 1.6225801684646078e-05,
"loss": 1.0067,
"mean_token_accuracy": 0.7454051755368709,
"num_tokens": 356690487.0,
"step": 5670
},
{
"entropy": 1.2974316738545895,
"epoch": 0.8393985295747589,
"grad_norm": 0.12444105744361877,
"learning_rate": 1.6078025713019063e-05,
"loss": 0.9723,
"mean_token_accuracy": 0.7503290168941021,
"num_tokens": 357328781.0,
"step": 5680
},
{
"entropy": 1.3582345850765705,
"epoch": 0.8408763438873905,
"grad_norm": 0.14589613676071167,
"learning_rate": 1.593024974139205e-05,
"loss": 1.0331,
"mean_token_accuracy": 0.7437467984855175,
"num_tokens": 357932412.0,
"step": 5690
},
{
"entropy": 1.3196044340729713,
"epoch": 0.8423541582000221,
"grad_norm": 0.11677612364292145,
"learning_rate": 1.578247376976504e-05,
"loss": 1.0183,
"mean_token_accuracy": 0.7420541405677795,
"num_tokens": 358551724.0,
"step": 5700
},
{
"entropy": 1.3120089799165726,
"epoch": 0.8438319725126537,
"grad_norm": 0.11075033247470856,
"learning_rate": 1.5634697798138024e-05,
"loss": 1.0223,
"mean_token_accuracy": 0.7393298916518688,
"num_tokens": 359189473.0,
"step": 5710
},
{
"entropy": 1.3048913300037384,
"epoch": 0.8453097868252853,
"grad_norm": 0.11959829181432724,
"learning_rate": 1.5486921826511013e-05,
"loss": 0.9943,
"mean_token_accuracy": 0.7476891838014126,
"num_tokens": 359808597.0,
"step": 5720
},
{
"entropy": 1.319146555662155,
"epoch": 0.8467876011379171,
"grad_norm": 0.13747940957546234,
"learning_rate": 1.5339145854883997e-05,
"loss": 0.9898,
"mean_token_accuracy": 0.7491352930665016,
"num_tokens": 360422994.0,
"step": 5730
},
{
"entropy": 1.3594556599855423,
"epoch": 0.8482654154505487,
"grad_norm": 0.1400456726551056,
"learning_rate": 1.5191369883256984e-05,
"loss": 1.0597,
"mean_token_accuracy": 0.7335585907101632,
"num_tokens": 361051901.0,
"step": 5740
},
{
"entropy": 1.3374354548752307,
"epoch": 0.8497432297631803,
"grad_norm": 0.11757944524288177,
"learning_rate": 1.5043593911629969e-05,
"loss": 1.0002,
"mean_token_accuracy": 0.7453118711709976,
"num_tokens": 361656024.0,
"step": 5750
},
{
"entropy": 1.3467597417533397,
"epoch": 0.8512210440758119,
"grad_norm": 0.11548870801925659,
"learning_rate": 1.4895817940002957e-05,
"loss": 0.9984,
"mean_token_accuracy": 0.7451724961400032,
"num_tokens": 362279059.0,
"step": 5760
},
{
"entropy": 1.311734914034605,
"epoch": 0.8526988583884435,
"grad_norm": 0.12405215948820114,
"learning_rate": 1.4748041968375942e-05,
"loss": 0.9799,
"mean_token_accuracy": 0.7475904323160648,
"num_tokens": 362895039.0,
"step": 5770
},
{
"entropy": 1.3386250838637352,
"epoch": 0.8541766727010751,
"grad_norm": 0.11085474491119385,
"learning_rate": 1.460026599674893e-05,
"loss": 1.007,
"mean_token_accuracy": 0.7426138609647751,
"num_tokens": 363529667.0,
"step": 5780
},
{
"entropy": 1.2939353726804257,
"epoch": 0.8556544870137067,
"grad_norm": 0.1114809662103653,
"learning_rate": 1.4452490025121915e-05,
"loss": 0.9734,
"mean_token_accuracy": 0.750145249813795,
"num_tokens": 364166145.0,
"step": 5790
},
{
"entropy": 1.3184495568275452,
"epoch": 0.8571323013263383,
"grad_norm": 0.1334013044834137,
"learning_rate": 1.4304714053494903e-05,
"loss": 1.0102,
"mean_token_accuracy": 0.7411141104996204,
"num_tokens": 364793121.0,
"step": 5800
},
{
"entropy": 1.3013493582606315,
"epoch": 0.8586101156389699,
"grad_norm": 0.11250706017017365,
"learning_rate": 1.4156938081867888e-05,
"loss": 0.9828,
"mean_token_accuracy": 0.7467548877000809,
"num_tokens": 365405557.0,
"step": 5810
},
{
"entropy": 1.327430461347103,
"epoch": 0.8600879299516015,
"grad_norm": 0.11568532884120941,
"learning_rate": 1.4009162110240875e-05,
"loss": 1.0218,
"mean_token_accuracy": 0.7415443785488606,
"num_tokens": 366044419.0,
"step": 5820
},
{
"entropy": 1.3481206871569156,
"epoch": 0.8615657442642332,
"grad_norm": 0.1371099203824997,
"learning_rate": 1.3861386138613863e-05,
"loss": 1.0439,
"mean_token_accuracy": 0.7366217412054539,
"num_tokens": 366690356.0,
"step": 5830
},
{
"entropy": 1.2569597400724888,
"epoch": 0.8630435585768648,
"grad_norm": 0.12688647210597992,
"learning_rate": 1.3713610166986848e-05,
"loss": 0.9435,
"mean_token_accuracy": 0.7563542760908604,
"num_tokens": 367315374.0,
"step": 5840
},
{
"entropy": 1.3336492694914341,
"epoch": 0.8645213728894965,
"grad_norm": 0.11842428147792816,
"learning_rate": 1.3565834195359836e-05,
"loss": 1.0233,
"mean_token_accuracy": 0.7392323285341262,
"num_tokens": 367958263.0,
"step": 5850
},
{
"entropy": 1.3464648641645909,
"epoch": 0.8659991872021281,
"grad_norm": 0.12313079833984375,
"learning_rate": 1.341805822373282e-05,
"loss": 1.0314,
"mean_token_accuracy": 0.7396592818200588,
"num_tokens": 368585660.0,
"step": 5860
},
{
"entropy": 1.3324293851852418,
"epoch": 0.8674770015147597,
"grad_norm": 0.11911337077617645,
"learning_rate": 1.3270282252105809e-05,
"loss": 0.9976,
"mean_token_accuracy": 0.7445396453142166,
"num_tokens": 369187809.0,
"step": 5870
},
{
"entropy": 1.3276281908154488,
"epoch": 0.8689548158273913,
"grad_norm": 0.12972944974899292,
"learning_rate": 1.3122506280478794e-05,
"loss": 1.0233,
"mean_token_accuracy": 0.7407662458717823,
"num_tokens": 369827636.0,
"step": 5880
},
{
"entropy": 1.3578208431601524,
"epoch": 0.8704326301400229,
"grad_norm": 0.1402665674686432,
"learning_rate": 1.2974730308851782e-05,
"loss": 1.0443,
"mean_token_accuracy": 0.737098440527916,
"num_tokens": 370449924.0,
"step": 5890
},
{
"entropy": 1.3040969766676427,
"epoch": 0.8719104444526545,
"grad_norm": 0.13990390300750732,
"learning_rate": 1.2826954337224767e-05,
"loss": 0.9881,
"mean_token_accuracy": 0.7464100919663906,
"num_tokens": 371084999.0,
"step": 5900
},
{
"entropy": 1.3430166877806187,
"epoch": 0.8733882587652861,
"grad_norm": 0.12417089194059372,
"learning_rate": 1.2679178365597755e-05,
"loss": 1.0457,
"mean_token_accuracy": 0.7370161950588227,
"num_tokens": 371692543.0,
"step": 5910
},
{
"entropy": 1.290044216811657,
"epoch": 0.8748660730779177,
"grad_norm": 0.14069810509681702,
"learning_rate": 1.253140239397074e-05,
"loss": 0.9783,
"mean_token_accuracy": 0.7515232928097249,
"num_tokens": 372320963.0,
"step": 5920
},
{
"entropy": 1.3472790539264679,
"epoch": 0.8763438873905494,
"grad_norm": 0.13290193676948547,
"learning_rate": 1.2383626422343728e-05,
"loss": 1.0224,
"mean_token_accuracy": 0.7405038736760616,
"num_tokens": 372949904.0,
"step": 5930
},
{
"entropy": 1.387679138034582,
"epoch": 0.877821701703181,
"grad_norm": 0.1314118653535843,
"learning_rate": 1.2235850450716715e-05,
"loss": 1.0422,
"mean_token_accuracy": 0.7353745914995671,
"num_tokens": 373573571.0,
"step": 5940
},
{
"entropy": 1.3165842115879058,
"epoch": 0.8792995160158126,
"grad_norm": 0.11947722733020782,
"learning_rate": 1.20880744790897e-05,
"loss": 1.0213,
"mean_token_accuracy": 0.7407660990953445,
"num_tokens": 374212664.0,
"step": 5950
},
{
"entropy": 1.3107740238308907,
"epoch": 0.8807773303284442,
"grad_norm": 0.14857317507266998,
"learning_rate": 1.1940298507462686e-05,
"loss": 0.9913,
"mean_token_accuracy": 0.7447304286062717,
"num_tokens": 374849824.0,
"step": 5960
},
{
"entropy": 1.2946119613945484,
"epoch": 0.8822551446410758,
"grad_norm": 0.13196992874145508,
"learning_rate": 1.1792522535835673e-05,
"loss": 0.9996,
"mean_token_accuracy": 0.7443319000303745,
"num_tokens": 375459391.0,
"step": 5970
},
{
"entropy": 1.3312421210110188,
"epoch": 0.8837329589537075,
"grad_norm": 0.12250470370054245,
"learning_rate": 1.164474656420866e-05,
"loss": 1.0011,
"mean_token_accuracy": 0.7444459736347199,
"num_tokens": 376092015.0,
"step": 5980
},
{
"entropy": 1.3092619471251965,
"epoch": 0.8852107732663391,
"grad_norm": 0.12348251789808273,
"learning_rate": 1.1496970592581646e-05,
"loss": 0.9884,
"mean_token_accuracy": 0.7462313294410705,
"num_tokens": 376707987.0,
"step": 5990
},
{
"entropy": 1.397826074063778,
"epoch": 0.8866885875789707,
"grad_norm": 0.12798164784908295,
"learning_rate": 1.1349194620954632e-05,
"loss": 1.0543,
"mean_token_accuracy": 0.7346052847802639,
"num_tokens": 377331029.0,
"step": 6000
},
{
"entropy": 1.3334910348057747,
"epoch": 0.8881664018916023,
"grad_norm": 0.14080867171287537,
"learning_rate": 1.120141864932762e-05,
"loss": 1.0309,
"mean_token_accuracy": 0.7391007460653782,
"num_tokens": 377965284.0,
"step": 6010
},
{
"entropy": 1.3450474232435226,
"epoch": 0.889644216204234,
"grad_norm": 0.11858553439378738,
"learning_rate": 1.1053642677700607e-05,
"loss": 1.042,
"mean_token_accuracy": 0.7341104723513127,
"num_tokens": 378583371.0,
"step": 6020
},
{
"entropy": 1.3471639886498452,
"epoch": 0.8911220305168656,
"grad_norm": 0.13958533108234406,
"learning_rate": 1.0905866706073594e-05,
"loss": 1.0176,
"mean_token_accuracy": 0.7405742652714252,
"num_tokens": 379206751.0,
"step": 6030
},
{
"entropy": 1.273489784449339,
"epoch": 0.8925998448294972,
"grad_norm": 0.12688973546028137,
"learning_rate": 1.075809073444658e-05,
"loss": 0.9973,
"mean_token_accuracy": 0.746940103918314,
"num_tokens": 379823103.0,
"step": 6040
},
{
"entropy": 1.3041085593402386,
"epoch": 0.8940776591421288,
"grad_norm": 0.14143548905849457,
"learning_rate": 1.0610314762819567e-05,
"loss": 0.9935,
"mean_token_accuracy": 0.7468664824962616,
"num_tokens": 380456382.0,
"step": 6050
},
{
"entropy": 1.3105453439056873,
"epoch": 0.8955554734547604,
"grad_norm": 0.13660714030265808,
"learning_rate": 1.0462538791192553e-05,
"loss": 1.0131,
"mean_token_accuracy": 0.7412443704903126,
"num_tokens": 381085757.0,
"step": 6060
},
{
"entropy": 1.3188693232834339,
"epoch": 0.897033287767392,
"grad_norm": 0.11770734935998917,
"learning_rate": 1.0314762819565538e-05,
"loss": 1.0092,
"mean_token_accuracy": 0.7430628970265388,
"num_tokens": 381703256.0,
"step": 6070
},
{
"entropy": 1.3571228340268136,
"epoch": 0.8985111020800236,
"grad_norm": 0.11014366149902344,
"learning_rate": 1.0166986847938525e-05,
"loss": 1.0352,
"mean_token_accuracy": 0.7394863232970238,
"num_tokens": 382342240.0,
"step": 6080
},
{
"entropy": 1.291709552705288,
"epoch": 0.8999889163926552,
"grad_norm": 0.1261245310306549,
"learning_rate": 1.0019210876311511e-05,
"loss": 0.9984,
"mean_token_accuracy": 0.7418771781027317,
"num_tokens": 382950230.0,
"step": 6090
},
{
"entropy": 1.3168196886777879,
"epoch": 0.9014667307052869,
"grad_norm": 0.1314990222454071,
"learning_rate": 9.871434904684498e-06,
"loss": 0.9979,
"mean_token_accuracy": 0.7453989803791046,
"num_tokens": 383580783.0,
"step": 6100
},
{
"entropy": 1.305882962793112,
"epoch": 0.9029445450179185,
"grad_norm": 0.13268327713012695,
"learning_rate": 9.723658933057484e-06,
"loss": 0.9762,
"mean_token_accuracy": 0.7521377936005592,
"num_tokens": 384220360.0,
"step": 6110
},
{
"entropy": 1.3119835503399373,
"epoch": 0.9044223593305502,
"grad_norm": 0.11007312685251236,
"learning_rate": 9.575882961430471e-06,
"loss": 0.992,
"mean_token_accuracy": 0.7449328310787677,
"num_tokens": 384876317.0,
"step": 6120
},
{
"entropy": 1.316799872368574,
"epoch": 0.9059001736431818,
"grad_norm": 0.11126253753900528,
"learning_rate": 9.42810698980346e-06,
"loss": 1.0005,
"mean_token_accuracy": 0.7466472007334233,
"num_tokens": 385507421.0,
"step": 6130
},
{
"entropy": 1.3008616276085376,
"epoch": 0.9073779879558134,
"grad_norm": 0.15056948363780975,
"learning_rate": 9.280331018176446e-06,
"loss": 0.9871,
"mean_token_accuracy": 0.7503829054534435,
"num_tokens": 386141541.0,
"step": 6140
},
{
"entropy": 1.3190543949604034,
"epoch": 0.908855802268445,
"grad_norm": 0.13507477939128876,
"learning_rate": 9.132555046549432e-06,
"loss": 1.0206,
"mean_token_accuracy": 0.7397508636116982,
"num_tokens": 386770965.0,
"step": 6150
},
{
"entropy": 1.3303886882960796,
"epoch": 0.9103336165810766,
"grad_norm": 0.13336560130119324,
"learning_rate": 8.984779074922419e-06,
"loss": 1.0036,
"mean_token_accuracy": 0.7444213129580021,
"num_tokens": 387391128.0,
"step": 6160
},
{
"entropy": 1.34616384729743,
"epoch": 0.9118114308937082,
"grad_norm": 0.11870578676462173,
"learning_rate": 8.837003103295405e-06,
"loss": 1.0254,
"mean_token_accuracy": 0.7389769002795219,
"num_tokens": 388027333.0,
"step": 6170
},
{
"entropy": 1.3144830591976642,
"epoch": 0.9132892452063398,
"grad_norm": 0.11620783060789108,
"learning_rate": 8.689227131668392e-06,
"loss": 0.9837,
"mean_token_accuracy": 0.7497315384447575,
"num_tokens": 388637565.0,
"step": 6180
},
{
"entropy": 1.3189754135906697,
"epoch": 0.9147670595189714,
"grad_norm": 0.12029609084129333,
"learning_rate": 8.541451160041377e-06,
"loss": 1.0037,
"mean_token_accuracy": 0.7476396732032299,
"num_tokens": 389268613.0,
"step": 6190
},
{
"entropy": 1.3421682931482792,
"epoch": 0.916244873831603,
"grad_norm": 0.14239317178726196,
"learning_rate": 8.393675188414363e-06,
"loss": 1.0176,
"mean_token_accuracy": 0.741797874122858,
"num_tokens": 389892611.0,
"step": 6200
},
{
"entropy": 1.322981870174408,
"epoch": 0.9177226881442346,
"grad_norm": 0.15327249467372894,
"learning_rate": 8.24589921678735e-06,
"loss": 1.0255,
"mean_token_accuracy": 0.7384318143129349,
"num_tokens": 390521207.0,
"step": 6210
},
{
"entropy": 1.3384942390024661,
"epoch": 0.9192005024568662,
"grad_norm": 0.12492629140615463,
"learning_rate": 8.098123245160337e-06,
"loss": 1.0238,
"mean_token_accuracy": 0.7415454059839248,
"num_tokens": 391153462.0,
"step": 6220
},
{
"entropy": 1.3131339251995087,
"epoch": 0.920678316769498,
"grad_norm": 0.12154535204172134,
"learning_rate": 7.950347273533323e-06,
"loss": 0.9874,
"mean_token_accuracy": 0.7472625941038131,
"num_tokens": 391788123.0,
"step": 6230
},
{
"entropy": 1.3672856733202934,
"epoch": 0.9221561310821296,
"grad_norm": 0.1145540326833725,
"learning_rate": 7.80257130190631e-06,
"loss": 1.0455,
"mean_token_accuracy": 0.7358811512589455,
"num_tokens": 392425329.0,
"step": 6240
},
{
"entropy": 1.326454308629036,
"epoch": 0.9236339453947612,
"grad_norm": 0.11543665081262589,
"learning_rate": 7.654795330279296e-06,
"loss": 1.0106,
"mean_token_accuracy": 0.7414052963256836,
"num_tokens": 393048401.0,
"step": 6250
},
{
"entropy": 1.315993483364582,
"epoch": 0.9251117597073928,
"grad_norm": 0.1304856389760971,
"learning_rate": 7.507019358652284e-06,
"loss": 0.9989,
"mean_token_accuracy": 0.7430017247796059,
"num_tokens": 393676756.0,
"step": 6260
},
{
"entropy": 1.3197014026343823,
"epoch": 0.9265895740200244,
"grad_norm": 0.11181900650262833,
"learning_rate": 7.359243387025271e-06,
"loss": 0.9951,
"mean_token_accuracy": 0.7460963025689125,
"num_tokens": 394309847.0,
"step": 6270
},
{
"entropy": 1.358003605902195,
"epoch": 0.928067388332656,
"grad_norm": 0.12269277125597,
"learning_rate": 7.211467415398257e-06,
"loss": 1.0359,
"mean_token_accuracy": 0.7356663353741169,
"num_tokens": 394936407.0,
"step": 6280
},
{
"entropy": 1.3280733123421669,
"epoch": 0.9295452026452876,
"grad_norm": 0.1313636302947998,
"learning_rate": 7.063691443771243e-06,
"loss": 0.9818,
"mean_token_accuracy": 0.7464911125600338,
"num_tokens": 395548910.0,
"step": 6290
},
{
"entropy": 1.3259168773889543,
"epoch": 0.9310230169579192,
"grad_norm": 0.1302233338356018,
"learning_rate": 6.91591547214423e-06,
"loss": 1.0413,
"mean_token_accuracy": 0.7370544657111168,
"num_tokens": 396165852.0,
"step": 6300
},
{
"entropy": 1.318706451356411,
"epoch": 0.9325008312705508,
"grad_norm": 0.11792853474617004,
"learning_rate": 6.768139500517216e-06,
"loss": 1.007,
"mean_token_accuracy": 0.7420048147439957,
"num_tokens": 396809254.0,
"step": 6310
},
{
"entropy": 1.2917353048920632,
"epoch": 0.9339786455831824,
"grad_norm": 0.12031566351652145,
"learning_rate": 6.620363528890203e-06,
"loss": 1.0291,
"mean_token_accuracy": 0.7431467622518539,
"num_tokens": 397438624.0,
"step": 6320
},
{
"entropy": 1.302623900771141,
"epoch": 0.935456459895814,
"grad_norm": 0.15024085342884064,
"learning_rate": 6.472587557263189e-06,
"loss": 0.96,
"mean_token_accuracy": 0.7524841710925102,
"num_tokens": 398058880.0,
"step": 6330
},
{
"entropy": 1.3265319362282753,
"epoch": 0.9369342742084457,
"grad_norm": 0.1818179488182068,
"learning_rate": 6.324811585636176e-06,
"loss": 0.9912,
"mean_token_accuracy": 0.7462624236941338,
"num_tokens": 398684141.0,
"step": 6340
},
{
"entropy": 1.3446454957127572,
"epoch": 0.9384120885210774,
"grad_norm": 0.12499760836362839,
"learning_rate": 6.1770356140091625e-06,
"loss": 1.0382,
"mean_token_accuracy": 0.7400866918265819,
"num_tokens": 399325710.0,
"step": 6350
},
{
"entropy": 1.3342131525278091,
"epoch": 0.939889902833709,
"grad_norm": 0.1248583048582077,
"learning_rate": 6.029259642382149e-06,
"loss": 1.0107,
"mean_token_accuracy": 0.744459693133831,
"num_tokens": 399955089.0,
"step": 6360
},
{
"entropy": 1.3489103883504867,
"epoch": 0.9413677171463406,
"grad_norm": 0.1461644023656845,
"learning_rate": 5.881483670755136e-06,
"loss": 1.0282,
"mean_token_accuracy": 0.7392531536519528,
"num_tokens": 400551267.0,
"step": 6370
},
{
"entropy": 1.3305791199207306,
"epoch": 0.9428455314589722,
"grad_norm": 0.14220687747001648,
"learning_rate": 5.733707699128122e-06,
"loss": 0.996,
"mean_token_accuracy": 0.7464814051985741,
"num_tokens": 401184838.0,
"step": 6380
},
{
"entropy": 1.3437370270490647,
"epoch": 0.9443233457716038,
"grad_norm": 0.1341477781534195,
"learning_rate": 5.585931727501109e-06,
"loss": 1.057,
"mean_token_accuracy": 0.733926995843649,
"num_tokens": 401844712.0,
"step": 6390
},
{
"entropy": 1.3399671465158463,
"epoch": 0.9458011600842354,
"grad_norm": 0.15581178665161133,
"learning_rate": 5.438155755874095e-06,
"loss": 1.0176,
"mean_token_accuracy": 0.7400895021855831,
"num_tokens": 402467237.0,
"step": 6400
},
{
"entropy": 1.3379587285220622,
"epoch": 0.947278974396867,
"grad_norm": 0.12707367539405823,
"learning_rate": 5.290379784247081e-06,
"loss": 1.0414,
"mean_token_accuracy": 0.7374955870211124,
"num_tokens": 403090540.0,
"step": 6410
},
{
"entropy": 1.2975156359374522,
"epoch": 0.9487567887094986,
"grad_norm": 0.14274674654006958,
"learning_rate": 5.142603812620068e-06,
"loss": 0.9858,
"mean_token_accuracy": 0.746936984360218,
"num_tokens": 403728117.0,
"step": 6420
},
{
"entropy": 1.3399316541850568,
"epoch": 0.9502346030221303,
"grad_norm": 0.11993175745010376,
"learning_rate": 4.994827840993055e-06,
"loss": 1.0539,
"mean_token_accuracy": 0.7339481048285961,
"num_tokens": 404362378.0,
"step": 6430
},
{
"entropy": 1.3567871250212193,
"epoch": 0.9517124173347619,
"grad_norm": 0.13137640058994293,
"learning_rate": 4.847051869366041e-06,
"loss": 1.0134,
"mean_token_accuracy": 0.7401178866624832,
"num_tokens": 404968979.0,
"step": 6440
},
{
"entropy": 1.2970522359013557,
"epoch": 0.9531902316473935,
"grad_norm": 0.1552589386701584,
"learning_rate": 4.699275897739028e-06,
"loss": 1.0104,
"mean_token_accuracy": 0.7441655330359935,
"num_tokens": 405603503.0,
"step": 6450
},
{
"entropy": 1.3546797879040242,
"epoch": 0.9546680459600251,
"grad_norm": 0.14361603558063507,
"learning_rate": 4.5514999261120145e-06,
"loss": 1.032,
"mean_token_accuracy": 0.7376946985721589,
"num_tokens": 406213712.0,
"step": 6460
},
{
"entropy": 1.3317971237003803,
"epoch": 0.9561458602726567,
"grad_norm": 0.13018253445625305,
"learning_rate": 4.403723954485001e-06,
"loss": 1.023,
"mean_token_accuracy": 0.7395760633051396,
"num_tokens": 406839355.0,
"step": 6470
},
{
"entropy": 1.320752915740013,
"epoch": 0.9576236745852884,
"grad_norm": 0.14429272711277008,
"learning_rate": 4.255947982857988e-06,
"loss": 1.0303,
"mean_token_accuracy": 0.7379327312111854,
"num_tokens": 407463490.0,
"step": 6480
},
{
"entropy": 1.3293151132762433,
"epoch": 0.95910148889792,
"grad_norm": 0.14717073738574982,
"learning_rate": 4.108172011230974e-06,
"loss": 1.0349,
"mean_token_accuracy": 0.7367990806698799,
"num_tokens": 408097068.0,
"step": 6490
},
{
"entropy": 1.331135530769825,
"epoch": 0.9605793032105516,
"grad_norm": 0.11680871248245239,
"learning_rate": 3.960396039603961e-06,
"loss": 0.9621,
"mean_token_accuracy": 0.7536611042916774,
"num_tokens": 408727501.0,
"step": 6500
},
{
"entropy": 1.3335068613290786,
"epoch": 0.9620571175231832,
"grad_norm": 0.12730862200260162,
"learning_rate": 3.8126200679769472e-06,
"loss": 1.0009,
"mean_token_accuracy": 0.7442542344331742,
"num_tokens": 409342096.0,
"step": 6510
},
{
"entropy": 1.3465422734618187,
"epoch": 0.9635349318358148,
"grad_norm": 0.12591826915740967,
"learning_rate": 3.6648440963499334e-06,
"loss": 1.0322,
"mean_token_accuracy": 0.7379855334758758,
"num_tokens": 409962385.0,
"step": 6520
},
{
"entropy": 1.3209969684481622,
"epoch": 0.9650127461484465,
"grad_norm": 0.15221069753170013,
"learning_rate": 3.51706812472292e-06,
"loss": 1.0181,
"mean_token_accuracy": 0.7421333439648151,
"num_tokens": 410586430.0,
"step": 6530
},
{
"entropy": 1.3481736958026886,
"epoch": 0.9664905604610781,
"grad_norm": 0.13732363283634186,
"learning_rate": 3.369292153095907e-06,
"loss": 1.0244,
"mean_token_accuracy": 0.7434548750519753,
"num_tokens": 411223657.0,
"step": 6540
},
{
"entropy": 1.3392292201519012,
"epoch": 0.9679683747737097,
"grad_norm": 0.12541285157203674,
"learning_rate": 3.2215161814688934e-06,
"loss": 1.0192,
"mean_token_accuracy": 0.7393275678157807,
"num_tokens": 411859272.0,
"step": 6550
},
{
"entropy": 1.3101726002991199,
"epoch": 0.9694461890863413,
"grad_norm": 0.10930298268795013,
"learning_rate": 3.07374020984188e-06,
"loss": 1.0097,
"mean_token_accuracy": 0.7414973556995392,
"num_tokens": 412496331.0,
"step": 6560
},
{
"entropy": 1.3522985130548477,
"epoch": 0.9709240033989729,
"grad_norm": 0.13447479903697968,
"learning_rate": 2.9259642382148665e-06,
"loss": 1.0346,
"mean_token_accuracy": 0.73828229829669,
"num_tokens": 413120546.0,
"step": 6570
},
{
"entropy": 1.2919812560081483,
"epoch": 0.9724018177116045,
"grad_norm": 0.14952851831912994,
"learning_rate": 2.7781882665878527e-06,
"loss": 0.9998,
"mean_token_accuracy": 0.7462430857121944,
"num_tokens": 413742172.0,
"step": 6580
},
{
"entropy": 1.3318934828042983,
"epoch": 0.9738796320242361,
"grad_norm": 0.11794450879096985,
"learning_rate": 2.6304122949608396e-06,
"loss": 0.9887,
"mean_token_accuracy": 0.7482388496398926,
"num_tokens": 414377151.0,
"step": 6590
},
{
"entropy": 1.3362335205078124,
"epoch": 0.9753574463368677,
"grad_norm": 0.12264854460954666,
"learning_rate": 2.482636323333826e-06,
"loss": 1.0208,
"mean_token_accuracy": 0.7401559479534626,
"num_tokens": 415003989.0,
"step": 6600
},
{
"entropy": 1.3305308662354947,
"epoch": 0.9768352606494994,
"grad_norm": 0.12668278813362122,
"learning_rate": 2.3348603517068123e-06,
"loss": 1.0175,
"mean_token_accuracy": 0.7412903062999249,
"num_tokens": 415627030.0,
"step": 6610
},
{
"entropy": 1.3603860966861248,
"epoch": 0.978313074962131,
"grad_norm": 0.1706349104642868,
"learning_rate": 2.1870843800797993e-06,
"loss": 1.0188,
"mean_token_accuracy": 0.7400363579392433,
"num_tokens": 416249214.0,
"step": 6620
},
{
"entropy": 1.2988179348409177,
"epoch": 0.9797908892747627,
"grad_norm": 0.1084231287240982,
"learning_rate": 2.039308408452786e-06,
"loss": 0.9846,
"mean_token_accuracy": 0.7490782260894775,
"num_tokens": 416888232.0,
"step": 6630
},
{
"entropy": 1.3416281372308732,
"epoch": 0.9812687035873943,
"grad_norm": 0.12165848165750504,
"learning_rate": 1.8915324368257721e-06,
"loss": 1.0264,
"mean_token_accuracy": 0.7411201991140842,
"num_tokens": 417532769.0,
"step": 6640
},
{
"entropy": 1.3082506984472275,
"epoch": 0.9827465179000259,
"grad_norm": 0.13222621381282806,
"learning_rate": 1.743756465198759e-06,
"loss": 1.0191,
"mean_token_accuracy": 0.7411255031824112,
"num_tokens": 418139140.0,
"step": 6650
},
{
"entropy": 1.3012041598558426,
"epoch": 0.9842243322126575,
"grad_norm": 0.11624795943498611,
"learning_rate": 1.5959804935717452e-06,
"loss": 0.9675,
"mean_token_accuracy": 0.7475118458271026,
"num_tokens": 418779044.0,
"step": 6660
},
{
"entropy": 1.3229439944028853,
"epoch": 0.9857021465252891,
"grad_norm": 0.11832401156425476,
"learning_rate": 1.448204521944732e-06,
"loss": 1.0234,
"mean_token_accuracy": 0.7409940011799335,
"num_tokens": 419402275.0,
"step": 6670
},
{
"entropy": 1.3145242296159267,
"epoch": 0.9871799608379207,
"grad_norm": 0.1508401483297348,
"learning_rate": 1.3004285503177183e-06,
"loss": 1.0033,
"mean_token_accuracy": 0.7469310745596885,
"num_tokens": 420035670.0,
"step": 6680
},
{
"entropy": 1.3349422916769982,
"epoch": 0.9886577751505523,
"grad_norm": 0.11081361770629883,
"learning_rate": 1.1526525786907049e-06,
"loss": 1.0172,
"mean_token_accuracy": 0.7441619426012039,
"num_tokens": 420664552.0,
"step": 6690
},
{
"entropy": 1.3269589990377426,
"epoch": 0.9901355894631839,
"grad_norm": 0.12207167595624924,
"learning_rate": 1.0048766070636914e-06,
"loss": 0.9956,
"mean_token_accuracy": 0.7472774274647236,
"num_tokens": 421282279.0,
"step": 6700
},
{
"entropy": 1.333425833284855,
"epoch": 0.9916134037758155,
"grad_norm": 0.13097155094146729,
"learning_rate": 8.57100635436678e-07,
"loss": 1.0249,
"mean_token_accuracy": 0.7411559447646141,
"num_tokens": 421937485.0,
"step": 6710
},
{
"entropy": 1.3138896457850933,
"epoch": 0.9930912180884471,
"grad_norm": 0.13285258412361145,
"learning_rate": 7.093246638096645e-07,
"loss": 0.9895,
"mean_token_accuracy": 0.7485101237893105,
"num_tokens": 422571737.0,
"step": 6720
},
{
"entropy": 1.3141452640295028,
"epoch": 0.9945690324010789,
"grad_norm": 0.13225366175174713,
"learning_rate": 5.615486921826512e-07,
"loss": 0.997,
"mean_token_accuracy": 0.7434104166924953,
"num_tokens": 423175530.0,
"step": 6730
},
{
"entropy": 1.3531743980944158,
"epoch": 0.9960468467137105,
"grad_norm": 0.1212967187166214,
"learning_rate": 4.137727205556377e-07,
"loss": 1.0355,
"mean_token_accuracy": 0.7384961448609829,
"num_tokens": 423790165.0,
"step": 6740
},
{
"entropy": 1.3025728791952134,
"epoch": 0.9975246610263421,
"grad_norm": 0.11449871957302094,
"learning_rate": 2.659967489286242e-07,
"loss": 0.9571,
"mean_token_accuracy": 0.7524913243949414,
"num_tokens": 424454409.0,
"step": 6750
},
{
"entropy": 1.3502368345856666,
"epoch": 0.9990024753389737,
"grad_norm": 0.12098908424377441,
"learning_rate": 1.1822077730161076e-07,
"loss": 1.014,
"mean_token_accuracy": 0.7402893081307411,
"num_tokens": 425085104.0,
"step": 6760
},
{
"entropy": 1.3184739925243236,
"epoch": 1.0,
"mean_token_accuracy": 0.742160533313398,
"num_tokens": 425500240.0,
"step": 6767,
"total_flos": 5.682410639176237e+18,
"train_loss": 1.024258090594644,
"train_runtime": 7062.5815,
"train_samples_per_second": 122.638,
"train_steps_per_second": 0.958
}
],
"logging_steps": 10,
"max_steps": 6767,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5.682410639176237e+18,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}