Jongbin-kr's picture
End of training: best validation-loss checkpoint
4864ba8 verified
Raw
History Blame Contribute Delete
110 kB
{
"best_global_step": 1500,
"best_metric": 0.4876999855041504,
"best_model_checkpoint": "/data6/jongbinwon/evolving_MoE/checkpoints/sft_llama31_8b_lbox_legal-provision-auditor_fallback_ffn_only_5ep_eval500/checkpoint-1500",
"epoch": 5.0,
"eval_steps": 500,
"global_step": 3520,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 2.302528735995293,
"epoch": 0.014214641080312722,
"grad_norm": 4.828892707824707,
"learning_rate": 1.6981132075471698e-06,
"loss": 1.3984100341796875,
"mean_token_accuracy": 0.6857675366103649,
"num_tokens": 34855.0,
"step": 10
},
{
"entropy": 2.2492430746555327,
"epoch": 0.028429282160625444,
"grad_norm": 3.5804924964904785,
"learning_rate": 3.5849056603773586e-06,
"loss": 1.4428706169128418,
"mean_token_accuracy": 0.6913674481213092,
"num_tokens": 75959.0,
"step": 20
},
{
"entropy": 2.3167720407247545,
"epoch": 0.042643923240938165,
"grad_norm": 8.852733612060547,
"learning_rate": 5.4716981132075475e-06,
"loss": 1.5378618240356445,
"mean_token_accuracy": 0.6808141805231571,
"num_tokens": 111800.0,
"step": 30
},
{
"entropy": 2.233737552165985,
"epoch": 0.05685856432125089,
"grad_norm": 4.612252712249756,
"learning_rate": 7.358490566037736e-06,
"loss": 1.1216099739074707,
"mean_token_accuracy": 0.7186247147619724,
"num_tokens": 147472.0,
"step": 40
},
{
"entropy": 2.27722809612751,
"epoch": 0.07107320540156362,
"grad_norm": 3.0993638038635254,
"learning_rate": 9.245283018867926e-06,
"loss": 1.022943115234375,
"mean_token_accuracy": 0.7546420469880104,
"num_tokens": 190518.0,
"step": 50
},
{
"entropy": 2.336320897936821,
"epoch": 0.08528784648187633,
"grad_norm": 3.466336965560913,
"learning_rate": 1.1132075471698115e-05,
"loss": 0.9197140693664551,
"mean_token_accuracy": 0.7917306423187256,
"num_tokens": 226599.0,
"step": 60
},
{
"entropy": 2.3224798500537873,
"epoch": 0.09950248756218906,
"grad_norm": 2.5745620727539062,
"learning_rate": 1.3018867924528303e-05,
"loss": 0.7570995807647705,
"mean_token_accuracy": 0.8374421924352646,
"num_tokens": 267416.0,
"step": 70
},
{
"entropy": 2.26705806851387,
"epoch": 0.11371712864250177,
"grad_norm": 3.452971935272217,
"learning_rate": 1.4905660377358491e-05,
"loss": 0.5703647136688232,
"mean_token_accuracy": 0.8376004211604595,
"num_tokens": 306250.0,
"step": 80
},
{
"entropy": 2.341897654533386,
"epoch": 0.1279317697228145,
"grad_norm": 4.118662357330322,
"learning_rate": 1.679245283018868e-05,
"loss": 0.5330170631408692,
"mean_token_accuracy": 0.8682203203439712,
"num_tokens": 341963.0,
"step": 90
},
{
"entropy": 2.2404198199510574,
"epoch": 0.14214641080312723,
"grad_norm": 5.807668209075928,
"learning_rate": 1.867924528301887e-05,
"loss": 0.40104899406433103,
"mean_token_accuracy": 0.8837951421737671,
"num_tokens": 378822.0,
"step": 100
},
{
"entropy": 2.294436663389206,
"epoch": 0.15636105188343993,
"grad_norm": 4.4703288078308105,
"learning_rate": 1.99999618947382e-05,
"loss": 0.40310959815979003,
"mean_token_accuracy": 0.8891363501548767,
"num_tokens": 414530.0,
"step": 110
},
{
"entropy": 2.2652417331933976,
"epoch": 0.17057569296375266,
"grad_norm": 3.5225493907928467,
"learning_rate": 1.999928447594037e-05,
"loss": 0.32140042781829836,
"mean_token_accuracy": 0.9204763844609261,
"num_tokens": 449719.0,
"step": 120
},
{
"entropy": 2.1712214767932894,
"epoch": 0.1847903340440654,
"grad_norm": 4.550766468048096,
"learning_rate": 1.999776033957351e-05,
"loss": 0.3288241147994995,
"mean_token_accuracy": 0.9241611689329148,
"num_tokens": 487297.0,
"step": 130
},
{
"entropy": 2.2248219311237336,
"epoch": 0.19900497512437812,
"grad_norm": 3.3866801261901855,
"learning_rate": 1.999538961469817e-05,
"loss": 0.1645406723022461,
"mean_token_accuracy": 0.9473418429493904,
"num_tokens": 522381.0,
"step": 140
},
{
"entropy": 2.2194749146699904,
"epoch": 0.21321961620469082,
"grad_norm": 5.862302303314209,
"learning_rate": 1.9992172502062152e-05,
"loss": 0.27917327880859377,
"mean_token_accuracy": 0.919804471731186,
"num_tokens": 561254.0,
"step": 150
},
{
"entropy": 2.1698070406913756,
"epoch": 0.22743425728500355,
"grad_norm": 4.744441032409668,
"learning_rate": 1.998810927408352e-05,
"loss": 0.25531325340270994,
"mean_token_accuracy": 0.9192116089165211,
"num_tokens": 602617.0,
"step": 160
},
{
"entropy": 2.2647796124219894,
"epoch": 0.24164889836531628,
"grad_norm": 7.122901439666748,
"learning_rate": 1.9983200274827553e-05,
"loss": 0.2522935390472412,
"mean_token_accuracy": 0.9494201198220253,
"num_tokens": 637932.0,
"step": 170
},
{
"entropy": 2.1525828033685683,
"epoch": 0.255863539445629,
"grad_norm": 3.150447130203247,
"learning_rate": 1.9977445919977577e-05,
"loss": 0.18792203664779664,
"mean_token_accuracy": 0.939947709441185,
"num_tokens": 675271.0,
"step": 180
},
{
"entropy": 2.2198438853025437,
"epoch": 0.27007818052594174,
"grad_norm": 4.385933876037598,
"learning_rate": 1.99708466967998e-05,
"loss": 0.12581338882446289,
"mean_token_accuracy": 0.9572400227189064,
"num_tokens": 710422.0,
"step": 190
},
{
"entropy": 2.2473688989877703,
"epoch": 0.28429282160625446,
"grad_norm": 0.7782599925994873,
"learning_rate": 1.9963403164102023e-05,
"loss": 0.16216881275177003,
"mean_token_accuracy": 0.9525286003947258,
"num_tokens": 746633.0,
"step": 200
},
{
"entropy": 2.2106005609035493,
"epoch": 0.29850746268656714,
"grad_norm": 3.868602991104126,
"learning_rate": 1.9955115952186337e-05,
"loss": 0.32397260665893557,
"mean_token_accuracy": 0.9184088215231896,
"num_tokens": 780855.0,
"step": 210
},
{
"entropy": 2.161737409234047,
"epoch": 0.31272210376687987,
"grad_norm": 6.2161784172058105,
"learning_rate": 1.994598576279575e-05,
"loss": 0.147584068775177,
"mean_token_accuracy": 0.9548472836613655,
"num_tokens": 820662.0,
"step": 220
},
{
"entropy": 2.2137836784124376,
"epoch": 0.3269367448471926,
"grad_norm": 5.454526901245117,
"learning_rate": 1.9936013369054748e-05,
"loss": 0.19472339153289794,
"mean_token_accuracy": 0.9331202074885369,
"num_tokens": 859624.0,
"step": 230
},
{
"entropy": 2.2511601120233538,
"epoch": 0.3411513859275053,
"grad_norm": 3.353757381439209,
"learning_rate": 1.9925199615403857e-05,
"loss": 0.10179495811462402,
"mean_token_accuracy": 0.9729527950286865,
"num_tokens": 895936.0,
"step": 240
},
{
"entropy": 2.2046679228544237,
"epoch": 0.35536602700781805,
"grad_norm": 5.455029487609863,
"learning_rate": 1.9913545417528125e-05,
"loss": 0.15011273622512816,
"mean_token_accuracy": 0.9702284231781959,
"num_tokens": 935793.0,
"step": 250
},
{
"entropy": 2.181716701388359,
"epoch": 0.3695806680881308,
"grad_norm": 1.6833304166793823,
"learning_rate": 1.9901051762279557e-05,
"loss": 0.11941384077072144,
"mean_token_accuracy": 0.9655464366078377,
"num_tokens": 973498.0,
"step": 260
},
{
"entropy": 2.164376962184906,
"epoch": 0.3837953091684435,
"grad_norm": 2.3306143283843994,
"learning_rate": 1.9887719707593602e-05,
"loss": 0.09658043384552002,
"mean_token_accuracy": 0.9760609611868858,
"num_tokens": 1009556.0,
"step": 270
},
{
"entropy": 2.087420853972435,
"epoch": 0.39800995024875624,
"grad_norm": 4.12304162979126,
"learning_rate": 1.9873550382399528e-05,
"loss": 0.07825971841812134,
"mean_token_accuracy": 0.9765635132789612,
"num_tokens": 1052914.0,
"step": 280
},
{
"entropy": 2.1707926601171494,
"epoch": 0.41222459132906897,
"grad_norm": 3.697993516921997,
"learning_rate": 1.985854498652484e-05,
"loss": 0.14083361625671387,
"mean_token_accuracy": 0.9513696759939194,
"num_tokens": 1092296.0,
"step": 290
},
{
"entropy": 2.1313129723072053,
"epoch": 0.42643923240938164,
"grad_norm": 3.0543739795684814,
"learning_rate": 1.9842704790593695e-05,
"loss": 0.12360785007476807,
"mean_token_accuracy": 0.9688008055090904,
"num_tokens": 1129248.0,
"step": 300
},
{
"entropy": 2.2083891183137894,
"epoch": 0.44065387348969437,
"grad_norm": 2.8632559776306152,
"learning_rate": 1.982603113591928e-05,
"loss": 0.1391190767288208,
"mean_token_accuracy": 0.9566407799720764,
"num_tokens": 1166255.0,
"step": 310
},
{
"entropy": 2.2131824254989625,
"epoch": 0.4548685145700071,
"grad_norm": 3.9666574001312256,
"learning_rate": 1.9808525434390253e-05,
"loss": 0.11147340536117553,
"mean_token_accuracy": 0.9667007446289062,
"num_tokens": 1201734.0,
"step": 320
},
{
"entropy": 2.224493718147278,
"epoch": 0.4690831556503198,
"grad_norm": 5.834049224853516,
"learning_rate": 1.9790189168351185e-05,
"loss": 0.17519290447235109,
"mean_token_accuracy": 0.9621825873851776,
"num_tokens": 1240835.0,
"step": 330
},
{
"entropy": 2.1801333963871,
"epoch": 0.48329779673063256,
"grad_norm": 0.8749763369560242,
"learning_rate": 1.977102389047704e-05,
"loss": 0.10031602382659913,
"mean_token_accuracy": 0.9667783200740814,
"num_tokens": 1276270.0,
"step": 340
},
{
"entropy": 2.1437912434339523,
"epoch": 0.4975124378109453,
"grad_norm": 3.661072254180908,
"learning_rate": 1.9751031223641678e-05,
"loss": 0.11026780605316162,
"mean_token_accuracy": 0.9699726045131684,
"num_tokens": 1313238.0,
"step": 350
},
{
"entropy": 2.1523136287927627,
"epoch": 0.511727078891258,
"grad_norm": 2.049119472503662,
"learning_rate": 1.9730212860780467e-05,
"loss": 0.14013859033584594,
"mean_token_accuracy": 0.9650743275880813,
"num_tokens": 1347519.0,
"step": 360
},
{
"entropy": 2.145729649066925,
"epoch": 0.5259417199715707,
"grad_norm": 2.146339178085327,
"learning_rate": 1.9708570564746896e-05,
"loss": 0.11286178827285767,
"mean_token_accuracy": 0.963935986161232,
"num_tokens": 1388152.0,
"step": 370
},
{
"entropy": 2.2653285562992096,
"epoch": 0.5401563610518835,
"grad_norm": 4.600983619689941,
"learning_rate": 1.968610616816333e-05,
"loss": 0.11360809803009034,
"mean_token_accuracy": 0.9642397537827492,
"num_tokens": 1426842.0,
"step": 380
},
{
"entropy": 2.229273745417595,
"epoch": 0.5543710021321961,
"grad_norm": 3.0675880908966064,
"learning_rate": 1.9662821573265795e-05,
"loss": 0.09846517443656921,
"mean_token_accuracy": 0.97640630453825,
"num_tokens": 1464251.0,
"step": 390
},
{
"entropy": 2.1834677189588545,
"epoch": 0.5685856432125089,
"grad_norm": 0.2358260601758957,
"learning_rate": 1.9638718751742935e-05,
"loss": 0.17364193201065065,
"mean_token_accuracy": 0.9615416027605533,
"num_tokens": 1500366.0,
"step": 400
},
{
"entropy": 2.173251363635063,
"epoch": 0.5828002842928216,
"grad_norm": 2.5061397552490234,
"learning_rate": 1.9613799744569034e-05,
"loss": 0.06473902463912964,
"mean_token_accuracy": 0.9774620115756989,
"num_tokens": 1534494.0,
"step": 410
},
{
"entropy": 2.2588789045810698,
"epoch": 0.5970149253731343,
"grad_norm": 3.6076488494873047,
"learning_rate": 1.9588066661831182e-05,
"loss": 0.15726373195648194,
"mean_token_accuracy": 0.9641035035252571,
"num_tokens": 1567343.0,
"step": 420
},
{
"entropy": 2.2106437146663667,
"epoch": 0.6112295664534471,
"grad_norm": 2.65738582611084,
"learning_rate": 1.9561521682550628e-05,
"loss": 0.09528368711471558,
"mean_token_accuracy": 0.9648209795355797,
"num_tokens": 1604518.0,
"step": 430
},
{
"entropy": 2.146402803063393,
"epoch": 0.6254442075337597,
"grad_norm": 2.8459908962249756,
"learning_rate": 1.9534167054498235e-05,
"loss": 0.08731676936149597,
"mean_token_accuracy": 0.9775180697441102,
"num_tokens": 1646302.0,
"step": 440
},
{
"entropy": 2.2472924411296846,
"epoch": 0.6396588486140725,
"grad_norm": 3.0984578132629395,
"learning_rate": 1.950600509400416e-05,
"loss": 0.07982758283615113,
"mean_token_accuracy": 0.9743791311979294,
"num_tokens": 1680467.0,
"step": 450
},
{
"entropy": 2.2500401556491854,
"epoch": 0.6538734896943852,
"grad_norm": 2.5706655979156494,
"learning_rate": 1.9477038185761702e-05,
"loss": 0.06145578622817993,
"mean_token_accuracy": 0.9790576353669167,
"num_tokens": 1715967.0,
"step": 460
},
{
"entropy": 2.2013922423124312,
"epoch": 0.668088130774698,
"grad_norm": 1.9893447160720825,
"learning_rate": 1.9447268782625387e-05,
"loss": 0.08759456276893615,
"mean_token_accuracy": 0.9817471817135811,
"num_tokens": 1750750.0,
"step": 470
},
{
"entropy": 2.190236097574234,
"epoch": 0.6823027718550106,
"grad_norm": 4.424774646759033,
"learning_rate": 1.941669940540325e-05,
"loss": 0.11516692638397216,
"mean_token_accuracy": 0.9682943612337113,
"num_tokens": 1790273.0,
"step": 480
},
{
"entropy": 2.19307736158371,
"epoch": 0.6965174129353234,
"grad_norm": 2.920266628265381,
"learning_rate": 1.938533264264338e-05,
"loss": 0.15450884103775026,
"mean_token_accuracy": 0.9700801074504852,
"num_tokens": 1830020.0,
"step": 490
},
{
"entropy": 2.178431448340416,
"epoch": 0.7107320540156361,
"grad_norm": 0.9854955673217773,
"learning_rate": 1.935317115041474e-05,
"loss": 0.12481092214584351,
"mean_token_accuracy": 0.9689489394426346,
"num_tokens": 1866987.0,
"step": 500
},
{
"epoch": 0.7107320540156361,
"eval_entropy": 2.0971352836056814,
"eval_loss": 0.5259134769439697,
"eval_mean_token_accuracy": 0.8965634148696373,
"eval_num_tokens": 1866987.0,
"eval_runtime": 989.6656,
"eval_samples_per_second": 7.731,
"eval_steps_per_second": 0.967,
"step": 500
},
{
"entropy": 2.26279539167881,
"epoch": 0.7249466950959488,
"grad_norm": 1.328014612197876,
"learning_rate": 1.932021765208224e-05,
"loss": 0.12206135988235474,
"mean_token_accuracy": 0.9650760263204574,
"num_tokens": 1902204.0,
"step": 510
},
{
"entropy": 2.2842482030391693,
"epoch": 0.7391613361762616,
"grad_norm": 0.994979739189148,
"learning_rate": 1.9286474938076146e-05,
"loss": 0.10036804676055908,
"mean_token_accuracy": 0.9778882250189781,
"num_tokens": 1934799.0,
"step": 520
},
{
"entropy": 2.257565715909004,
"epoch": 0.7533759772565742,
"grad_norm": 2.4604053497314453,
"learning_rate": 1.9251945865655784e-05,
"loss": 0.1240536093711853,
"mean_token_accuracy": 0.9661274179816246,
"num_tokens": 1969249.0,
"step": 530
},
{
"entropy": 2.2129929661750793,
"epoch": 0.767590618336887,
"grad_norm": 3.858069896697998,
"learning_rate": 1.9216633358667582e-05,
"loss": 0.06604821681976318,
"mean_token_accuracy": 0.9817861035466194,
"num_tokens": 2003001.0,
"step": 540
},
{
"entropy": 2.1791742712259294,
"epoch": 0.7818052594171997,
"grad_norm": 4.455066204071045,
"learning_rate": 1.91805404072975e-05,
"loss": 0.14240108728408812,
"mean_token_accuracy": 0.9565647065639495,
"num_tokens": 2039690.0,
"step": 550
},
{
"entropy": 2.2445179164409637,
"epoch": 0.7960199004975125,
"grad_norm": 1.3273934125900269,
"learning_rate": 1.914367006781783e-05,
"loss": 0.09953938722610474,
"mean_token_accuracy": 0.9738000154495239,
"num_tokens": 2075587.0,
"step": 560
},
{
"entropy": 2.201731264591217,
"epoch": 0.8102345415778252,
"grad_norm": 3.3293604850769043,
"learning_rate": 1.9106025462328392e-05,
"loss": 0.07859283089637756,
"mean_token_accuracy": 0.9805291876196861,
"num_tokens": 2108460.0,
"step": 570
},
{
"entropy": 2.2557914018630982,
"epoch": 0.8244491826581379,
"grad_norm": 1.1793880462646484,
"learning_rate": 1.9067609778492147e-05,
"loss": 0.03049740493297577,
"mean_token_accuracy": 0.9910580679774285,
"num_tokens": 2143684.0,
"step": 580
},
{
"entropy": 2.159291934967041,
"epoch": 0.8386638237384506,
"grad_norm": 1.225790023803711,
"learning_rate": 1.90284262692653e-05,
"loss": 0.06553000211715698,
"mean_token_accuracy": 0.9782250091433525,
"num_tokens": 2178600.0,
"step": 590
},
{
"entropy": 2.171927785873413,
"epoch": 0.8528784648187633,
"grad_norm": 3.7838656902313232,
"learning_rate": 1.8988478252621823e-05,
"loss": 0.06374742388725281,
"mean_token_accuracy": 0.9801983863115311,
"num_tokens": 2217809.0,
"step": 600
},
{
"entropy": 2.1900578796863557,
"epoch": 0.8670931058990761,
"grad_norm": 2.7667667865753174,
"learning_rate": 1.8947769111272513e-05,
"loss": 0.07156231999397278,
"mean_token_accuracy": 0.9831789165735245,
"num_tokens": 2255894.0,
"step": 610
},
{
"entropy": 2.188087573647499,
"epoch": 0.8813077469793887,
"grad_norm": 1.352272391319275,
"learning_rate": 1.890630229237855e-05,
"loss": 0.07383124232292175,
"mean_token_accuracy": 0.9796638250350952,
"num_tokens": 2290515.0,
"step": 620
},
{
"entropy": 2.2202280551195144,
"epoch": 0.8955223880597015,
"grad_norm": 3.82440447807312,
"learning_rate": 1.8864081307259575e-05,
"loss": 0.07150052189826965,
"mean_token_accuracy": 0.9653487637639045,
"num_tokens": 2328545.0,
"step": 630
},
{
"entropy": 2.199204143881798,
"epoch": 0.9097370291400142,
"grad_norm": 2.0685250759124756,
"learning_rate": 1.8821109731096397e-05,
"loss": 0.061190438270568845,
"mean_token_accuracy": 0.9833000719547271,
"num_tokens": 2362975.0,
"step": 640
},
{
"entropy": 2.2430183798074723,
"epoch": 0.923951670220327,
"grad_norm": 1.4594024419784546,
"learning_rate": 1.877739120262822e-05,
"loss": 0.05861002206802368,
"mean_token_accuracy": 0.9801960617303849,
"num_tokens": 2397300.0,
"step": 650
},
{
"entropy": 2.2240359395742417,
"epoch": 0.9381663113006397,
"grad_norm": 3.5333290100097656,
"learning_rate": 1.8732929423844554e-05,
"loss": 0.05537862181663513,
"mean_token_accuracy": 0.9790173918008804,
"num_tokens": 2430581.0,
"step": 660
},
{
"entropy": 2.2369117051362992,
"epoch": 0.9523809523809523,
"grad_norm": 5.941117286682129,
"learning_rate": 1.8687728159671705e-05,
"loss": 0.1064723014831543,
"mean_token_accuracy": 0.9709701180458069,
"num_tokens": 2468425.0,
"step": 670
},
{
"entropy": 2.2235177606344223,
"epoch": 0.9665955934612651,
"grad_norm": 1.9442089796066284,
"learning_rate": 1.8641791237654e-05,
"loss": 0.09505320787429809,
"mean_token_accuracy": 0.9777823403477669,
"num_tokens": 2506372.0,
"step": 680
},
{
"entropy": 2.189699539542198,
"epoch": 0.9808102345415778,
"grad_norm": 1.7199773788452148,
"learning_rate": 1.8595122547629654e-05,
"loss": 0.08579087853431702,
"mean_token_accuracy": 0.981938436627388,
"num_tokens": 2544255.0,
"step": 690
},
{
"entropy": 2.203128972649574,
"epoch": 0.9950248756218906,
"grad_norm": 1.9164578914642334,
"learning_rate": 1.854772604140141e-05,
"loss": 0.054469770193099974,
"mean_token_accuracy": 0.9730748474597931,
"num_tokens": 2584451.0,
"step": 700
},
{
"entropy": 2.187663435935974,
"epoch": 1.0085287846481876,
"grad_norm": 2.734229803085327,
"learning_rate": 1.8499605732401897e-05,
"loss": 0.03613282144069672,
"mean_token_accuracy": 0.9859623281579268,
"num_tokens": 2618160.0,
"step": 710
},
{
"entropy": 2.2002769261598587,
"epoch": 1.0227434257285004,
"grad_norm": 3.451009750366211,
"learning_rate": 1.8450765695353765e-05,
"loss": 0.05161011219024658,
"mean_token_accuracy": 0.9848280772566795,
"num_tokens": 2656683.0,
"step": 720
},
{
"entropy": 2.1792144656181334,
"epoch": 1.036958066808813,
"grad_norm": 2.6109533309936523,
"learning_rate": 1.840121006592468e-05,
"loss": 0.05695715546607971,
"mean_token_accuracy": 0.9819708660244941,
"num_tokens": 2693571.0,
"step": 730
},
{
"entropy": 2.168749713897705,
"epoch": 1.0511727078891258,
"grad_norm": 2.983471155166626,
"learning_rate": 1.8350943040377104e-05,
"loss": 0.04387234449386597,
"mean_token_accuracy": 0.9895394578576088,
"num_tokens": 2734066.0,
"step": 740
},
{
"entropy": 2.150976684689522,
"epoch": 1.0653873489694385,
"grad_norm": 4.730701923370361,
"learning_rate": 1.829996887521297e-05,
"loss": 0.08097095489501953,
"mean_token_accuracy": 0.9824510410428047,
"num_tokens": 2773575.0,
"step": 750
},
{
"entropy": 2.202870362997055,
"epoch": 1.0796019900497513,
"grad_norm": 0.6767167448997498,
"learning_rate": 1.8248291886813245e-05,
"loss": 0.045699647068977355,
"mean_token_accuracy": 0.9877486750483513,
"num_tokens": 2809884.0,
"step": 760
},
{
"entropy": 2.1357246190309525,
"epoch": 1.0938166311300639,
"grad_norm": 4.62387752532959,
"learning_rate": 1.8195916451072427e-05,
"loss": 0.09070175290107726,
"mean_token_accuracy": 0.978462915122509,
"num_tokens": 2849476.0,
"step": 770
},
{
"entropy": 2.157443994283676,
"epoch": 1.1080312722103767,
"grad_norm": 0.9505185484886169,
"learning_rate": 1.8142847003028025e-05,
"loss": 0.11641521453857422,
"mean_token_accuracy": 0.9711179152131081,
"num_tokens": 2885597.0,
"step": 780
},
{
"entropy": 2.19150624871254,
"epoch": 1.1222459132906895,
"grad_norm": 0.48967626690864563,
"learning_rate": 1.8089088036484982e-05,
"loss": 0.0332806795835495,
"mean_token_accuracy": 0.9921609848737717,
"num_tokens": 2921138.0,
"step": 790
},
{
"entropy": 2.2178327053785325,
"epoch": 1.136460554371002,
"grad_norm": 1.6019129753112793,
"learning_rate": 1.8034644103635168e-05,
"loss": 0.044434782862663266,
"mean_token_accuracy": 0.9820729941129684,
"num_tokens": 2954764.0,
"step": 800
},
{
"entropy": 2.164334940910339,
"epoch": 1.1506751954513148,
"grad_norm": 0.8724451661109924,
"learning_rate": 1.7979519814671892e-05,
"loss": 0.03360059857368469,
"mean_token_accuracy": 0.9849594548344612,
"num_tokens": 2986877.0,
"step": 810
},
{
"entropy": 2.1950933396816255,
"epoch": 1.1648898365316276,
"grad_norm": 4.613320350646973,
"learning_rate": 1.7923719837399548e-05,
"loss": 0.04860695898532867,
"mean_token_accuracy": 0.9842689201235771,
"num_tokens": 3022958.0,
"step": 820
},
{
"entropy": 2.228426894545555,
"epoch": 1.1791044776119404,
"grad_norm": 3.380880355834961,
"learning_rate": 1.786724889683833e-05,
"loss": 0.0661603033542633,
"mean_token_accuracy": 0.9793119549751281,
"num_tokens": 3058741.0,
"step": 830
},
{
"entropy": 2.1500797808170318,
"epoch": 1.193319118692253,
"grad_norm": 2.8803505897521973,
"learning_rate": 1.7810111774824145e-05,
"loss": 0.0518546998500824,
"mean_token_accuracy": 0.9858181729912758,
"num_tokens": 3097002.0,
"step": 840
},
{
"entropy": 2.134665223956108,
"epoch": 1.2075337597725657,
"grad_norm": 1.3723540306091309,
"learning_rate": 1.7752313309603686e-05,
"loss": 0.0568238615989685,
"mean_token_accuracy": 0.9837430208921433,
"num_tokens": 3135350.0,
"step": 850
},
{
"entropy": 2.1059677451848984,
"epoch": 1.2217484008528785,
"grad_norm": 0.2232239991426468,
"learning_rate": 1.7693858395424743e-05,
"loss": 0.029073348641395567,
"mean_token_accuracy": 0.9910536676645278,
"num_tokens": 3175892.0,
"step": 860
},
{
"entropy": 2.0856614857912064,
"epoch": 1.235963041933191,
"grad_norm": 3.187932252883911,
"learning_rate": 1.7634751982121772e-05,
"loss": 0.062130671739578244,
"mean_token_accuracy": 0.9819218471646309,
"num_tokens": 3218003.0,
"step": 870
},
{
"entropy": 2.151488536596298,
"epoch": 1.2501776830135038,
"grad_norm": 1.0572253465652466,
"learning_rate": 1.7574999074696747e-05,
"loss": 0.024734890460968016,
"mean_token_accuracy": 0.9933405518531799,
"num_tokens": 3255955.0,
"step": 880
},
{
"entropy": 2.1391431748867036,
"epoch": 1.2643923240938166,
"grad_norm": 0.6491001844406128,
"learning_rate": 1.7514604732895364e-05,
"loss": 0.015290029346942902,
"mean_token_accuracy": 0.9944353476166725,
"num_tokens": 3290879.0,
"step": 890
},
{
"entropy": 2.159931790828705,
"epoch": 1.2786069651741294,
"grad_norm": 0.36106443405151367,
"learning_rate": 1.7453574070778572e-05,
"loss": 0.023708008229732513,
"mean_token_accuracy": 0.9893430173397064,
"num_tokens": 3325818.0,
"step": 900
},
{
"entropy": 2.2356686383485793,
"epoch": 1.2928216062544422,
"grad_norm": 0.3880334794521332,
"learning_rate": 1.7391912256289535e-05,
"loss": 0.047500818967819214,
"mean_token_accuracy": 0.9906172767281533,
"num_tokens": 3361101.0,
"step": 910
},
{
"entropy": 2.1481542110443117,
"epoch": 1.3070362473347548,
"grad_norm": 1.1337789297103882,
"learning_rate": 1.7329624510816016e-05,
"loss": 0.06250383257865906,
"mean_token_accuracy": 0.986290380358696,
"num_tokens": 3398228.0,
"step": 920
},
{
"entropy": 2.199899733066559,
"epoch": 1.3212508884150675,
"grad_norm": 7.506823539733887,
"learning_rate": 1.7266716108748265e-05,
"loss": 0.05416156649589539,
"mean_token_accuracy": 0.9795574441552162,
"num_tokens": 3434391.0,
"step": 930
},
{
"entropy": 2.1505257695913316,
"epoch": 1.33546552949538,
"grad_norm": 2.8287599086761475,
"learning_rate": 1.720319237703236e-05,
"loss": 0.03884570896625519,
"mean_token_accuracy": 0.9827989488840103,
"num_tokens": 3476252.0,
"step": 940
},
{
"entropy": 2.260223591327667,
"epoch": 1.349680170575693,
"grad_norm": 4.396107196807861,
"learning_rate": 1.713905869471915e-05,
"loss": 0.08108161687850952,
"mean_token_accuracy": 0.9792245835065841,
"num_tokens": 3511513.0,
"step": 950
},
{
"entropy": 2.1618774831295013,
"epoch": 1.3638948116560057,
"grad_norm": 2.1915652751922607,
"learning_rate": 1.7074320492508776e-05,
"loss": 0.03704064786434173,
"mean_token_accuracy": 0.9879031211137772,
"num_tokens": 3547869.0,
"step": 960
},
{
"entropy": 2.2029319226741793,
"epoch": 1.3781094527363185,
"grad_norm": 1.989353060722351,
"learning_rate": 1.70089832522908e-05,
"loss": 0.04472963809967041,
"mean_token_accuracy": 0.9839362189173698,
"num_tokens": 3582370.0,
"step": 970
},
{
"entropy": 2.1237045884132386,
"epoch": 1.3923240938166312,
"grad_norm": 2.7585880756378174,
"learning_rate": 1.6943052506680014e-05,
"loss": 0.017387883365154268,
"mean_token_accuracy": 0.995327465236187,
"num_tokens": 3620986.0,
"step": 980
},
{
"entropy": 2.1093700736761094,
"epoch": 1.4065387348969438,
"grad_norm": 0.8583207130432129,
"learning_rate": 1.6876533838547954e-05,
"loss": 0.04421250224113464,
"mean_token_accuracy": 0.9878856271505356,
"num_tokens": 3657882.0,
"step": 990
},
{
"entropy": 2.0695310294628144,
"epoch": 1.4207533759772566,
"grad_norm": 0.020872101187705994,
"learning_rate": 1.6809432880550142e-05,
"loss": 0.015215454995632172,
"mean_token_accuracy": 0.9934112429618835,
"num_tokens": 3694203.0,
"step": 1000
},
{
"epoch": 1.4207533759772566,
"eval_entropy": 1.996728012305193,
"eval_loss": 0.5132695436477661,
"eval_mean_token_accuracy": 0.912858964382917,
"eval_num_tokens": 3694203.0,
"eval_runtime": 988.7535,
"eval_samples_per_second": 7.738,
"eval_steps_per_second": 0.968,
"step": 1000
},
{
"entropy": 2.193378761410713,
"epoch": 1.4349680170575694,
"grad_norm": 1.7698736190795898,
"learning_rate": 1.6741755314649148e-05,
"loss": 0.05021881461143494,
"mean_token_accuracy": 0.9833689332008362,
"num_tokens": 3727853.0,
"step": 1010
},
{
"entropy": 2.1755041390657426,
"epoch": 1.449182658137882,
"grad_norm": 8.36669921875,
"learning_rate": 1.6673506871633422e-05,
"loss": 0.07425625920295716,
"mean_token_accuracy": 0.9873648002743721,
"num_tokens": 3761837.0,
"step": 1020
},
{
"entropy": 2.2001064866781235,
"epoch": 1.4633972992181947,
"grad_norm": 3.99029278755188,
"learning_rate": 1.6604693330632055e-05,
"loss": 0.060235065221786496,
"mean_token_accuracy": 0.9781348332762718,
"num_tokens": 3798914.0,
"step": 1030
},
{
"entropy": 2.121982756257057,
"epoch": 1.4776119402985075,
"grad_norm": 0.9836737513542175,
"learning_rate": 1.6535320518625394e-05,
"loss": 0.02696731984615326,
"mean_token_accuracy": 0.9905053526163101,
"num_tokens": 3838355.0,
"step": 1040
},
{
"entropy": 2.170503485202789,
"epoch": 1.4918265813788203,
"grad_norm": 1.3061282634735107,
"learning_rate": 1.6465394309951643e-05,
"loss": 0.03811564743518829,
"mean_token_accuracy": 0.9868202403187751,
"num_tokens": 3873118.0,
"step": 1050
},
{
"entropy": 2.184956783056259,
"epoch": 1.5060412224591329,
"grad_norm": 0.16141857206821442,
"learning_rate": 1.639492062580941e-05,
"loss": 0.02506377696990967,
"mean_token_accuracy": 0.9951693743467331,
"num_tokens": 3907762.0,
"step": 1060
},
{
"entropy": 2.2151595264673234,
"epoch": 1.5202558635394456,
"grad_norm": 1.2822521924972534,
"learning_rate": 1.6323905433756348e-05,
"loss": 0.04546615481376648,
"mean_token_accuracy": 0.9900464177131653,
"num_tokens": 3942498.0,
"step": 1070
},
{
"entropy": 2.2206559479236603,
"epoch": 1.5344705046197582,
"grad_norm": 1.1591120958328247,
"learning_rate": 1.6252354747203804e-05,
"loss": 0.0512237548828125,
"mean_token_accuracy": 0.9911876812577247,
"num_tokens": 3974758.0,
"step": 1080
},
{
"entropy": 2.1994840264320374,
"epoch": 1.548685145700071,
"grad_norm": 1.1228119134902954,
"learning_rate": 1.6180274624907637e-05,
"loss": 0.052582383155822754,
"mean_token_accuracy": 0.9877693071961403,
"num_tokens": 4010393.0,
"step": 1090
},
{
"entropy": 2.2292975306510927,
"epoch": 1.5628997867803838,
"grad_norm": 4.671175479888916,
"learning_rate": 1.6107671170455164e-05,
"loss": 0.037269750237464906,
"mean_token_accuracy": 0.9906544610857964,
"num_tokens": 4042491.0,
"step": 1100
},
{
"entropy": 2.1922069817781447,
"epoch": 1.5771144278606966,
"grad_norm": 0.815264105796814,
"learning_rate": 1.603455053174833e-05,
"loss": 0.05773057341575623,
"mean_token_accuracy": 0.9827793538570404,
"num_tokens": 4082169.0,
"step": 1110
},
{
"entropy": 2.1343121081590652,
"epoch": 1.5913290689410093,
"grad_norm": 1.9564604759216309,
"learning_rate": 1.5960918900483112e-05,
"loss": 0.06395858526229858,
"mean_token_accuracy": 0.9741567522287369,
"num_tokens": 4120949.0,
"step": 1120
},
{
"entropy": 2.116546794772148,
"epoch": 1.6055437100213221,
"grad_norm": 0.6864196062088013,
"learning_rate": 1.5886782511625216e-05,
"loss": 0.035008615255355834,
"mean_token_accuracy": 0.9885725691914559,
"num_tokens": 4155338.0,
"step": 1130
},
{
"entropy": 2.101371333003044,
"epoch": 1.6197583511016347,
"grad_norm": 2.144096851348877,
"learning_rate": 1.5812147642882126e-05,
"loss": 0.05081506371498108,
"mean_token_accuracy": 0.9900156706571579,
"num_tokens": 4193065.0,
"step": 1140
},
{
"entropy": 2.1167595058679582,
"epoch": 1.6339729921819472,
"grad_norm": 3.001270055770874,
"learning_rate": 1.57370206141715e-05,
"loss": 0.029940304160118104,
"mean_token_accuracy": 0.9919799283146858,
"num_tokens": 4233177.0,
"step": 1150
},
{
"entropy": 2.1953104764223097,
"epoch": 1.64818763326226,
"grad_norm": 0.5304042100906372,
"learning_rate": 1.5661407787086052e-05,
"loss": 0.04557282626628876,
"mean_token_accuracy": 0.9914614632725716,
"num_tokens": 4270719.0,
"step": 1160
},
{
"entropy": 2.195063552260399,
"epoch": 1.6624022743425728,
"grad_norm": 2.064101219177246,
"learning_rate": 1.5585315564354816e-05,
"loss": 0.02791608273983002,
"mean_token_accuracy": 0.9903463527560235,
"num_tokens": 4307326.0,
"step": 1170
},
{
"entropy": 2.160296180844307,
"epoch": 1.6766169154228856,
"grad_norm": 0.20038703083992004,
"learning_rate": 1.5508750389301018e-05,
"loss": 0.018147528171539307,
"mean_token_accuracy": 0.9959616541862488,
"num_tokens": 4342167.0,
"step": 1180
},
{
"entropy": 2.0997723072767256,
"epoch": 1.6908315565031984,
"grad_norm": 0.4269106388092041,
"learning_rate": 1.5431718745296446e-05,
"loss": 0.031970590353012085,
"mean_token_accuracy": 0.9925994470715522,
"num_tokens": 4378382.0,
"step": 1190
},
{
"entropy": 2.15362486243248,
"epoch": 1.7050461975835112,
"grad_norm": 1.4277267456054688,
"learning_rate": 1.5354227155212455e-05,
"loss": 0.03519009053707123,
"mean_token_accuracy": 0.9948211744427681,
"num_tokens": 4412402.0,
"step": 1200
},
{
"entropy": 2.1371404409408568,
"epoch": 1.7192608386638237,
"grad_norm": 2.0894289016723633,
"learning_rate": 1.527628218086765e-05,
"loss": 0.05730880498886108,
"mean_token_accuracy": 0.9833267420530319,
"num_tokens": 4448245.0,
"step": 1210
},
{
"entropy": 2.1023225128650664,
"epoch": 1.7334754797441365,
"grad_norm": 3.533341407775879,
"learning_rate": 1.5197890422472204e-05,
"loss": 0.039241823554039004,
"mean_token_accuracy": 0.9856926873326302,
"num_tokens": 4483857.0,
"step": 1220
},
{
"entropy": 2.0918066024780275,
"epoch": 1.747690120824449,
"grad_norm": 1.4843463897705078,
"learning_rate": 1.5119058518068994e-05,
"loss": 0.03128263652324677,
"mean_token_accuracy": 0.9900650411844254,
"num_tokens": 4525449.0,
"step": 1230
},
{
"entropy": 2.1807575821876526,
"epoch": 1.7619047619047619,
"grad_norm": 2.492711305618286,
"learning_rate": 1.5039793142971501e-05,
"loss": 0.061214137077331546,
"mean_token_accuracy": 0.9877642571926117,
"num_tokens": 4564889.0,
"step": 1240
},
{
"entropy": 2.13520385324955,
"epoch": 1.7761194029850746,
"grad_norm": 0.8968533873558044,
"learning_rate": 1.496010100919856e-05,
"loss": 0.04278126358985901,
"mean_token_accuracy": 0.9871073856949806,
"num_tokens": 4601655.0,
"step": 1250
},
{
"entropy": 2.135896974802017,
"epoch": 1.7903340440653874,
"grad_norm": 0.5659345388412476,
"learning_rate": 1.4879988864905992e-05,
"loss": 0.039053690433502194,
"mean_token_accuracy": 0.990781481564045,
"num_tokens": 4637400.0,
"step": 1260
},
{
"entropy": 2.14559406042099,
"epoch": 1.8045486851457002,
"grad_norm": 1.262707233428955,
"learning_rate": 1.4799463493815199e-05,
"loss": 0.05618187189102173,
"mean_token_accuracy": 0.9844638153910636,
"num_tokens": 4675200.0,
"step": 1270
},
{
"entropy": 2.130327156186104,
"epoch": 1.8187633262260128,
"grad_norm": 1.905463457107544,
"learning_rate": 1.4718531714638719e-05,
"loss": 0.03753847479820251,
"mean_token_accuracy": 0.9798910677433014,
"num_tokens": 4712415.0,
"step": 1280
},
{
"entropy": 2.061409738659859,
"epoch": 1.8329779673063256,
"grad_norm": 2.095902681350708,
"learning_rate": 1.4637200380502842e-05,
"loss": 0.04141142666339874,
"mean_token_accuracy": 0.984546284377575,
"num_tokens": 4752936.0,
"step": 1290
},
{
"entropy": 2.12393804192543,
"epoch": 1.8471926083866381,
"grad_norm": 2.4633586406707764,
"learning_rate": 1.4555476378367304e-05,
"loss": 0.03877743482589722,
"mean_token_accuracy": 0.98830596357584,
"num_tokens": 4789364.0,
"step": 1300
},
{
"entropy": 2.1741877257823945,
"epoch": 1.861407249466951,
"grad_norm": 0.22966082394123077,
"learning_rate": 1.4473366628442093e-05,
"loss": 0.06458597779273986,
"mean_token_accuracy": 0.9805670469999314,
"num_tokens": 4825122.0,
"step": 1310
},
{
"entropy": 2.2013738095760345,
"epoch": 1.8756218905472637,
"grad_norm": 0.31942903995513916,
"learning_rate": 1.4390878083601498e-05,
"loss": 0.012605372071266174,
"mean_token_accuracy": 0.9942255452275276,
"num_tokens": 4856314.0,
"step": 1320
},
{
"entropy": 2.1380729913711547,
"epoch": 1.8898365316275765,
"grad_norm": 1.0672839879989624,
"learning_rate": 1.4308017728795322e-05,
"loss": 0.019631707668304445,
"mean_token_accuracy": 0.9956912875175477,
"num_tokens": 4894480.0,
"step": 1330
},
{
"entropy": 2.144209420681,
"epoch": 1.9040511727078893,
"grad_norm": 3.408994674682617,
"learning_rate": 1.4224792580457431e-05,
"loss": 0.07080478072166443,
"mean_token_accuracy": 0.9856290057301521,
"num_tokens": 4928079.0,
"step": 1340
},
{
"entropy": 2.127260631322861,
"epoch": 1.9182658137882018,
"grad_norm": 1.3405135869979858,
"learning_rate": 1.4141209685911603e-05,
"loss": 0.03551123440265656,
"mean_token_accuracy": 0.9912566438317298,
"num_tokens": 4966874.0,
"step": 1350
},
{
"entropy": 2.057062420248985,
"epoch": 1.9324804548685146,
"grad_norm": 2.4303998947143555,
"learning_rate": 1.4057276122774784e-05,
"loss": 0.025794893503189087,
"mean_token_accuracy": 0.9910008162260056,
"num_tokens": 5014153.0,
"step": 1360
},
{
"entropy": 2.0976122200489042,
"epoch": 1.9466950959488272,
"grad_norm": 0.975439727306366,
"learning_rate": 1.3972998998357778e-05,
"loss": 0.057805228233337405,
"mean_token_accuracy": 0.9882346078753471,
"num_tokens": 5050370.0,
"step": 1370
},
{
"entropy": 2.12088503241539,
"epoch": 1.96090973702914,
"grad_norm": 2.241792917251587,
"learning_rate": 1.38883854490634e-05,
"loss": 0.02719011902809143,
"mean_token_accuracy": 0.9968120694160462,
"num_tokens": 5089198.0,
"step": 1380
},
{
"entropy": 2.186630555987358,
"epoch": 1.9751243781094527,
"grad_norm": 0.02887093275785446,
"learning_rate": 1.380344263978219e-05,
"loss": 0.02653237581253052,
"mean_token_accuracy": 0.9873360604047775,
"num_tokens": 5125154.0,
"step": 1390
},
{
"entropy": 2.0880779802799223,
"epoch": 1.9893390191897655,
"grad_norm": 0.06101665645837784,
"learning_rate": 1.371817776328571e-05,
"loss": 0.017497384548187257,
"mean_token_accuracy": 0.9919103473424912,
"num_tokens": 5165570.0,
"step": 1400
},
{
"entropy": 2.1103323039255644,
"epoch": 2.0028429282160625,
"grad_norm": 2.5834667682647705,
"learning_rate": 1.3632598039617459e-05,
"loss": 0.028596514463424684,
"mean_token_accuracy": 0.9918049009222734,
"num_tokens": 5200022.0,
"step": 1410
},
{
"entropy": 2.080328956246376,
"epoch": 2.0170575692963753,
"grad_norm": 2.0883054733276367,
"learning_rate": 1.3546710715481528e-05,
"loss": 0.010676021128892899,
"mean_token_accuracy": 0.9944428727030754,
"num_tokens": 5239050.0,
"step": 1420
},
{
"entropy": 2.11694977581501,
"epoch": 2.031272210376688,
"grad_norm": 0.6384166479110718,
"learning_rate": 1.346052306362892e-05,
"loss": 0.031712406873703004,
"mean_token_accuracy": 0.99215517193079,
"num_tokens": 5278603.0,
"step": 1430
},
{
"entropy": 2.1320772975683213,
"epoch": 2.045486851457001,
"grad_norm": 0.04183308035135269,
"learning_rate": 1.3374042382241743e-05,
"loss": 0.024064309895038605,
"mean_token_accuracy": 0.9902747467160224,
"num_tokens": 5312650.0,
"step": 1440
},
{
"entropy": 2.133982640504837,
"epoch": 2.0597014925373136,
"grad_norm": 1.4074985980987549,
"learning_rate": 1.3287275994315211e-05,
"loss": 0.017666606605052947,
"mean_token_accuracy": 0.9940287739038467,
"num_tokens": 5346534.0,
"step": 1450
},
{
"entropy": 2.1367667734622957,
"epoch": 2.073916133617626,
"grad_norm": 1.0920348167419434,
"learning_rate": 1.3200231247037534e-05,
"loss": 0.010746689885854721,
"mean_token_accuracy": 0.9960371211171151,
"num_tokens": 5384670.0,
"step": 1460
},
{
"entropy": 2.133867809176445,
"epoch": 2.0881307746979387,
"grad_norm": 1.6067408323287964,
"learning_rate": 1.3112915511167792e-05,
"loss": 0.036738994717597964,
"mean_token_accuracy": 0.988915441930294,
"num_tokens": 5420443.0,
"step": 1470
},
{
"entropy": 2.174367681145668,
"epoch": 2.1023454157782515,
"grad_norm": 0.5817322134971619,
"learning_rate": 1.3025336180411783e-05,
"loss": 0.018730011582374573,
"mean_token_accuracy": 0.9928426295518875,
"num_tokens": 5455408.0,
"step": 1480
},
{
"entropy": 2.1845018327236176,
"epoch": 2.1165600568585643,
"grad_norm": 0.9014100432395935,
"learning_rate": 1.2937500670795941e-05,
"loss": 0.008142998069524765,
"mean_token_accuracy": 0.9969136103987694,
"num_tokens": 5486597.0,
"step": 1490
},
{
"entropy": 2.1422977685928344,
"epoch": 2.130774697938877,
"grad_norm": 0.015557660721242428,
"learning_rate": 1.2849416420039378e-05,
"loss": 0.029416123032569887,
"mean_token_accuracy": 0.9883611053228378,
"num_tokens": 5523135.0,
"step": 1500
},
{
"epoch": 2.130774697938877,
"eval_entropy": 2.012462474460263,
"eval_loss": 0.4876999855041504,
"eval_mean_token_accuracy": 0.9161205261229473,
"eval_num_tokens": 5523135.0,
"eval_runtime": 989.9438,
"eval_samples_per_second": 7.729,
"eval_steps_per_second": 0.967,
"step": 1500
},
{
"entropy": 2.153908830881119,
"epoch": 2.14498933901919,
"grad_norm": 0.4453883767127991,
"learning_rate": 1.276109088692405e-05,
"loss": 0.016275449097156523,
"mean_token_accuracy": 0.9947501629590988,
"num_tokens": 5561113.0,
"step": 1510
},
{
"entropy": 2.1447213143110275,
"epoch": 2.1592039800995027,
"grad_norm": 0.09290453791618347,
"learning_rate": 1.267253155066318e-05,
"loss": 0.0074017919600009915,
"mean_token_accuracy": 0.9969444438815117,
"num_tokens": 5602031.0,
"step": 1520
},
{
"entropy": 2.1633759051561356,
"epoch": 2.173418621179815,
"grad_norm": 0.0523543544113636,
"learning_rate": 1.2583745910267935e-05,
"loss": 0.010185372829437257,
"mean_token_accuracy": 0.9974342107772827,
"num_tokens": 5644054.0,
"step": 1530
},
{
"entropy": 2.1849102139472962,
"epoch": 2.1876332622601278,
"grad_norm": 1.58631432056427,
"learning_rate": 1.2494741483912414e-05,
"loss": 0.025118106603622438,
"mean_token_accuracy": 0.9866239562630653,
"num_tokens": 5679892.0,
"step": 1540
},
{
"entropy": 2.0871244966983795,
"epoch": 2.2018479033404406,
"grad_norm": 0.07445530593395233,
"learning_rate": 1.2405525808297041e-05,
"loss": 0.012176018953323365,
"mean_token_accuracy": 0.9966624140739441,
"num_tokens": 5719192.0,
"step": 1550
},
{
"entropy": 2.1434724926948547,
"epoch": 2.2160625444207533,
"grad_norm": 0.22022129595279694,
"learning_rate": 1.2316106438010363e-05,
"loss": 0.011503981798887253,
"mean_token_accuracy": 0.9932158127427101,
"num_tokens": 5754586.0,
"step": 1560
},
{
"entropy": 2.1378200381994246,
"epoch": 2.230277185501066,
"grad_norm": 0.2574051022529602,
"learning_rate": 1.2226490944889344e-05,
"loss": 0.016648434102535248,
"mean_token_accuracy": 0.99627845287323,
"num_tokens": 5790164.0,
"step": 1570
},
{
"entropy": 2.1425430297851564,
"epoch": 2.244491826581379,
"grad_norm": 0.07441271096467972,
"learning_rate": 1.2136686917378207e-05,
"loss": 0.011707275360822677,
"mean_token_accuracy": 0.9969677910208702,
"num_tokens": 5826790.0,
"step": 1580
},
{
"entropy": 2.145805537700653,
"epoch": 2.2587064676616917,
"grad_norm": 0.025231340900063515,
"learning_rate": 1.204670195988585e-05,
"loss": 0.015510520339012146,
"mean_token_accuracy": 0.9958001673221588,
"num_tokens": 5864353.0,
"step": 1590
},
{
"entropy": 2.12614686191082,
"epoch": 2.272921108742004,
"grad_norm": 4.177783012390137,
"learning_rate": 1.1956543692141925e-05,
"loss": 0.02458135187625885,
"mean_token_accuracy": 0.994461864233017,
"num_tokens": 5901111.0,
"step": 1600
},
{
"entropy": 2.199042108654976,
"epoch": 2.287135749822317,
"grad_norm": 0.387260764837265,
"learning_rate": 1.1866219748551627e-05,
"loss": 0.027851936221122742,
"mean_token_accuracy": 0.9944206327199936,
"num_tokens": 5938751.0,
"step": 1610
},
{
"entropy": 2.1385419756174087,
"epoch": 2.3013503909026296,
"grad_norm": 1.4362543821334839,
"learning_rate": 1.177573777754921e-05,
"loss": 0.029392656683921815,
"mean_token_accuracy": 0.9920833334326744,
"num_tokens": 5975587.0,
"step": 1620
},
{
"entropy": 2.1314716190099716,
"epoch": 2.3155650319829424,
"grad_norm": 2.3883039951324463,
"learning_rate": 1.1685105440950351e-05,
"loss": 0.015017279982566833,
"mean_token_accuracy": 0.9914116650819779,
"num_tokens": 6011431.0,
"step": 1630
},
{
"entropy": 2.113403910398483,
"epoch": 2.329779673063255,
"grad_norm": 0.17976875603199005,
"learning_rate": 1.1594330413303354e-05,
"loss": 0.0052622310817241665,
"mean_token_accuracy": 0.9989999994635582,
"num_tokens": 6051027.0,
"step": 1640
},
{
"entropy": 2.1885013312101362,
"epoch": 2.343994314143568,
"grad_norm": 2.1475982666015625,
"learning_rate": 1.1503420381239288e-05,
"loss": 0.049869978427886964,
"mean_token_accuracy": 0.9862573102116585,
"num_tokens": 6086770.0,
"step": 1650
},
{
"entropy": 2.154399809241295,
"epoch": 2.3582089552238807,
"grad_norm": 0.7839910984039307,
"learning_rate": 1.1412383042821103e-05,
"loss": 0.012508201599121093,
"mean_token_accuracy": 0.9969967931509018,
"num_tokens": 6120066.0,
"step": 1660
},
{
"entropy": 2.1582394361495973,
"epoch": 2.372423596304193,
"grad_norm": 0.127841517329216,
"learning_rate": 1.1321226106891774e-05,
"loss": 0.03399866819381714,
"mean_token_accuracy": 0.9926647707819939,
"num_tokens": 6155122.0,
"step": 1670
},
{
"entropy": 2.1920375645160677,
"epoch": 2.386638237384506,
"grad_norm": 0.5719994306564331,
"learning_rate": 1.1229957292421532e-05,
"loss": 0.01301535964012146,
"mean_token_accuracy": 0.9950501263141632,
"num_tokens": 6189949.0,
"step": 1680
},
{
"entropy": 2.1470602810382844,
"epoch": 2.4008528784648187,
"grad_norm": 0.01053235400468111,
"learning_rate": 1.1138584327854236e-05,
"loss": 0.006975927203893661,
"mean_token_accuracy": 0.9970934271812439,
"num_tokens": 6227742.0,
"step": 1690
},
{
"entropy": 2.164599558711052,
"epoch": 2.4150675195451314,
"grad_norm": 4.409539699554443,
"learning_rate": 1.1047114950452946e-05,
"loss": 0.03146063089370728,
"mean_token_accuracy": 0.9898314952850342,
"num_tokens": 6261770.0,
"step": 1700
},
{
"entropy": 2.097541519999504,
"epoch": 2.429282160625444,
"grad_norm": 0.33211779594421387,
"learning_rate": 1.0955556905644758e-05,
"loss": 0.015510906279087067,
"mean_token_accuracy": 0.9964471086859703,
"num_tokens": 6302590.0,
"step": 1710
},
{
"entropy": 2.110760509967804,
"epoch": 2.443496801705757,
"grad_norm": 0.07505965232849121,
"learning_rate": 1.0863917946364924e-05,
"loss": 0.020162013173103333,
"mean_token_accuracy": 0.9964295968413353,
"num_tokens": 6342274.0,
"step": 1720
},
{
"entropy": 2.2031593352556227,
"epoch": 2.45771144278607,
"grad_norm": 0.1552923619747162,
"learning_rate": 1.0772205832400357e-05,
"loss": 0.021290890872478485,
"mean_token_accuracy": 0.9951711297035217,
"num_tokens": 6374676.0,
"step": 1730
},
{
"entropy": 2.1717267662286757,
"epoch": 2.471926083866382,
"grad_norm": 0.05812852829694748,
"learning_rate": 1.0680428329732552e-05,
"loss": 0.016620045900344847,
"mean_token_accuracy": 0.9949463814496994,
"num_tokens": 6411553.0,
"step": 1740
},
{
"entropy": 2.145307409763336,
"epoch": 2.486140724946695,
"grad_norm": 0.14837434887886047,
"learning_rate": 1.0588593209879973e-05,
"loss": 0.01613246649503708,
"mean_token_accuracy": 0.9933097556233406,
"num_tokens": 6445362.0,
"step": 1750
},
{
"entropy": 2.1177578270435333,
"epoch": 2.5003553660270077,
"grad_norm": 0.11420247703790665,
"learning_rate": 1.0496708249239988e-05,
"loss": 0.01733055114746094,
"mean_token_accuracy": 0.9933325245976448,
"num_tokens": 6480042.0,
"step": 1760
},
{
"entropy": 2.0375625282526015,
"epoch": 2.5145700071073205,
"grad_norm": 1.124937891960144,
"learning_rate": 1.0404781228430365e-05,
"loss": 0.014401055872440338,
"mean_token_accuracy": 0.99840377420187,
"num_tokens": 6523509.0,
"step": 1770
},
{
"entropy": 2.061618319153786,
"epoch": 2.5287846481876333,
"grad_norm": 2.1306679248809814,
"learning_rate": 1.0312819931630438e-05,
"loss": 0.011978740990161895,
"mean_token_accuracy": 0.9983922109007836,
"num_tokens": 6564762.0,
"step": 1780
},
{
"entropy": 2.144868162274361,
"epoch": 2.542999289267946,
"grad_norm": 2.329023599624634,
"learning_rate": 1.022083214592196e-05,
"loss": 0.015902377665042877,
"mean_token_accuracy": 0.9979761898517608,
"num_tokens": 6604633.0,
"step": 1790
},
{
"entropy": 2.1159115850925447,
"epoch": 2.557213930348259,
"grad_norm": 1.4145407676696777,
"learning_rate": 1.0128825660629709e-05,
"loss": 0.020478679239749907,
"mean_token_accuracy": 0.9979009658098221,
"num_tokens": 6641133.0,
"step": 1800
},
{
"entropy": 2.0676650613546372,
"epoch": 2.571428571428571,
"grad_norm": 0.48140275478363037,
"learning_rate": 1.0036808266661893e-05,
"loss": 0.022186580300331115,
"mean_token_accuracy": 0.9940819069743156,
"num_tokens": 6682211.0,
"step": 1810
},
{
"entropy": 2.12384712100029,
"epoch": 2.5856432125088844,
"grad_norm": 2.0902743339538574,
"learning_rate": 9.944787755850455e-06,
"loss": 0.01327282041311264,
"mean_token_accuracy": 0.9970363482832909,
"num_tokens": 6720217.0,
"step": 1820
},
{
"entropy": 2.152281162142754,
"epoch": 2.5998578535891967,
"grad_norm": 0.4297999441623688,
"learning_rate": 9.852771920291257e-06,
"loss": 0.00764169842004776,
"mean_token_accuracy": 0.9964661106467247,
"num_tokens": 6755330.0,
"step": 1830
},
{
"entropy": 2.133743789792061,
"epoch": 2.6140724946695095,
"grad_norm": 1.7086399793624878,
"learning_rate": 9.760768551684272e-06,
"loss": 0.014149065315723418,
"mean_token_accuracy": 0.9932047992944717,
"num_tokens": 6789704.0,
"step": 1840
},
{
"entropy": 2.220897752046585,
"epoch": 2.6282871357498223,
"grad_norm": 0.37043172121047974,
"learning_rate": 9.668785440673802e-06,
"loss": 0.010798779129981995,
"mean_token_accuracy": 0.9927522420883179,
"num_tokens": 6829906.0,
"step": 1850
},
{
"entropy": 2.1690511107444763,
"epoch": 2.642501776830135,
"grad_norm": 3.446093797683716,
"learning_rate": 9.576830376188779e-06,
"loss": 0.011588881909847259,
"mean_token_accuracy": 0.9942647039890289,
"num_tokens": 6862241.0,
"step": 1860
},
{
"entropy": 2.104657456278801,
"epoch": 2.656716417910448,
"grad_norm": 6.990153789520264,
"learning_rate": 9.484911144783216e-06,
"loss": 0.031561356782913205,
"mean_token_accuracy": 0.9918665274977684,
"num_tokens": 6902231.0,
"step": 1870
},
{
"entropy": 2.099566176533699,
"epoch": 2.67093105899076,
"grad_norm": 1.5687507390975952,
"learning_rate": 9.393035529976857e-06,
"loss": 0.03302261531352997,
"mean_token_accuracy": 0.994696919620037,
"num_tokens": 6943523.0,
"step": 1880
},
{
"entropy": 2.0341563537716865,
"epoch": 2.6851457000710734,
"grad_norm": 0.01727372594177723,
"learning_rate": 9.301211311596091e-06,
"loss": 0.009831630438566209,
"mean_token_accuracy": 0.9966520965099335,
"num_tokens": 6980909.0,
"step": 1890
},
{
"entropy": 2.142310842871666,
"epoch": 2.699360341151386,
"grad_norm": 2.9104232788085938,
"learning_rate": 9.209446265115162e-06,
"loss": 0.012867218255996704,
"mean_token_accuracy": 0.9898214012384414,
"num_tokens": 7017337.0,
"step": 1900
},
{
"entropy": 2.1923003911972048,
"epoch": 2.7135749822316986,
"grad_norm": 0.02433944121003151,
"learning_rate": 9.117748160997786e-06,
"loss": 0.006733021140098572,
"mean_token_accuracy": 0.9975520834326744,
"num_tokens": 7055337.0,
"step": 1910
},
{
"entropy": 2.1514430910348894,
"epoch": 2.7277896233120114,
"grad_norm": 0.08054083585739136,
"learning_rate": 9.026124764039123e-06,
"loss": 0.03414789140224457,
"mean_token_accuracy": 0.9952777773141861,
"num_tokens": 7091211.0,
"step": 1920
},
{
"entropy": 2.072894513607025,
"epoch": 2.742004264392324,
"grad_norm": 1.8925641775131226,
"learning_rate": 8.934583832708305e-06,
"loss": 0.010989753156900406,
"mean_token_accuracy": 0.9934895843267441,
"num_tokens": 7126267.0,
"step": 1930
},
{
"entropy": 2.0974434345960615,
"epoch": 2.756218905472637,
"grad_norm": 4.07625675201416,
"learning_rate": 8.843133118491456e-06,
"loss": 0.036723607778549196,
"mean_token_accuracy": 0.9936398908495903,
"num_tokens": 7162232.0,
"step": 1940
},
{
"entropy": 2.1628644078969956,
"epoch": 2.7704335465529493,
"grad_norm": 0.19412127137184143,
"learning_rate": 8.751780365235308e-06,
"loss": 0.016048797965049745,
"mean_token_accuracy": 0.9971778348088265,
"num_tokens": 7199909.0,
"step": 1950
},
{
"entropy": 2.091540029644966,
"epoch": 2.7846481876332625,
"grad_norm": 3.252357006072998,
"learning_rate": 8.660533308491476e-06,
"loss": 0.047638151049613955,
"mean_token_accuracy": 0.9874005153775215,
"num_tokens": 7236809.0,
"step": 1960
},
{
"entropy": 2.1849084466695787,
"epoch": 2.798862828713575,
"grad_norm": 0.08695745468139648,
"learning_rate": 8.569399674861426e-06,
"loss": 0.02756718695163727,
"mean_token_accuracy": 0.9911953061819077,
"num_tokens": 7274060.0,
"step": 1970
},
{
"entropy": 2.1544810086488724,
"epoch": 2.8130774697938876,
"grad_norm": 1.6851823329925537,
"learning_rate": 8.478387181342195e-06,
"loss": 0.018534281849861146,
"mean_token_accuracy": 0.9929023250937462,
"num_tokens": 7314220.0,
"step": 1980
},
{
"entropy": 2.131257200241089,
"epoch": 2.8272921108742004,
"grad_norm": 2.3103678226470947,
"learning_rate": 8.387503534672947e-06,
"loss": 0.008499032258987427,
"mean_token_accuracy": 0.9965438395738602,
"num_tokens": 7345637.0,
"step": 1990
},
{
"entropy": 2.13298476934433,
"epoch": 2.841506751954513,
"grad_norm": 0.1992063820362091,
"learning_rate": 8.29675643068237e-06,
"loss": 0.010052156448364259,
"mean_token_accuracy": 0.9935064926743508,
"num_tokens": 7381711.0,
"step": 2000
},
{
"epoch": 2.841506751954513,
"eval_entropy": 1.9877975619823331,
"eval_loss": 0.5002052187919617,
"eval_mean_token_accuracy": 0.917853237257233,
"eval_num_tokens": 7381711.0,
"eval_runtime": 989.2063,
"eval_samples_per_second": 7.734,
"eval_steps_per_second": 0.967,
"step": 2000
},
{
"entropy": 2.1357434511184694,
"epoch": 2.855721393034826,
"grad_norm": 0.24105560779571533,
"learning_rate": 8.206153553637029e-06,
"loss": 0.014637093245983123,
"mean_token_accuracy": 0.992483814060688,
"num_tokens": 7420253.0,
"step": 2010
},
{
"entropy": 2.0427623748779298,
"epoch": 2.8699360341151388,
"grad_norm": 0.04688866436481476,
"learning_rate": 8.115702575590651e-06,
"loss": 0.0197280153632164,
"mean_token_accuracy": 0.9940960317850113,
"num_tokens": 7459527.0,
"step": 2020
},
{
"entropy": 2.107358440756798,
"epoch": 2.8841506751954515,
"grad_norm": 2.001885414123535,
"learning_rate": 8.0254111557345e-06,
"loss": 0.012085244059562683,
"mean_token_accuracy": 0.9920702204108238,
"num_tokens": 7492452.0,
"step": 2030
},
{
"entropy": 2.117280828952789,
"epoch": 2.898365316275764,
"grad_norm": 1.2196354866027832,
"learning_rate": 7.935286939748793e-06,
"loss": 0.019286631047725676,
"mean_token_accuracy": 0.9929364129900933,
"num_tokens": 7527373.0,
"step": 2040
},
{
"entropy": 2.098222628235817,
"epoch": 2.9125799573560767,
"grad_norm": 3.9219210147857666,
"learning_rate": 7.845337559155285e-06,
"loss": 0.01666049212217331,
"mean_token_accuracy": 0.9912658214569092,
"num_tokens": 7563275.0,
"step": 2050
},
{
"entropy": 2.1345431208610535,
"epoch": 2.9267945984363894,
"grad_norm": 0.32143792510032654,
"learning_rate": 7.755570630671061e-06,
"loss": 0.005718830227851868,
"mean_token_accuracy": 0.9963970810174942,
"num_tokens": 7597282.0,
"step": 2060
},
{
"entropy": 2.1360646575689315,
"epoch": 2.9410092395167022,
"grad_norm": 0.2594122886657715,
"learning_rate": 7.665993755563563e-06,
"loss": 0.014417172968387603,
"mean_token_accuracy": 0.9959156066179276,
"num_tokens": 7634208.0,
"step": 2070
},
{
"entropy": 2.1297189712524416,
"epoch": 2.955223880597015,
"grad_norm": 0.9254517555236816,
"learning_rate": 7.576614519006913e-06,
"loss": 0.022011277079582215,
"mean_token_accuracy": 0.9956810921430588,
"num_tokens": 7671271.0,
"step": 2080
},
{
"entropy": 2.2322384238243105,
"epoch": 2.969438521677328,
"grad_norm": 0.7473764419555664,
"learning_rate": 7.487440489439646e-06,
"loss": 0.010099399834871292,
"mean_token_accuracy": 0.9970263168215752,
"num_tokens": 7708380.0,
"step": 2090
},
{
"entropy": 2.11426265835762,
"epoch": 2.9836531627576406,
"grad_norm": 1.4097167253494263,
"learning_rate": 7.39847921792381e-06,
"loss": 0.023269766569137575,
"mean_token_accuracy": 0.9920061439275741,
"num_tokens": 7745868.0,
"step": 2100
},
{
"entropy": 2.116123300790787,
"epoch": 2.997867803837953,
"grad_norm": 1.8534623384475708,
"learning_rate": 7.3097382375055645e-06,
"loss": 0.017223817110061646,
"mean_token_accuracy": 0.9949802815914154,
"num_tokens": 7784384.0,
"step": 2110
},
{
"entropy": 2.094560576112647,
"epoch": 3.0113717128642503,
"grad_norm": 0.17719678580760956,
"learning_rate": 7.221225062577313e-06,
"loss": 0.0034023601561784743,
"mean_token_accuracy": 0.996572312555815,
"num_tokens": 7819286.0,
"step": 2120
},
{
"entropy": 2.0749322682619096,
"epoch": 3.025586353944563,
"grad_norm": 1.9489033222198486,
"learning_rate": 7.13294718824137e-06,
"loss": 0.0044484566897153854,
"mean_token_accuracy": 0.9989130437374115,
"num_tokens": 7856218.0,
"step": 2130
},
{
"entropy": 2.1713985592126845,
"epoch": 3.0398009950248754,
"grad_norm": 0.5477708578109741,
"learning_rate": 7.0449120896753235e-06,
"loss": 0.018094585835933687,
"mean_token_accuracy": 0.993584257364273,
"num_tokens": 7894029.0,
"step": 2140
},
{
"entropy": 2.1583692967891692,
"epoch": 3.0540156361051882,
"grad_norm": 0.023213613778352737,
"learning_rate": 6.957127221499028e-06,
"loss": 0.0034131985157728195,
"mean_token_accuracy": 0.998275862634182,
"num_tokens": 7932128.0,
"step": 2150
},
{
"entropy": 2.0848151594400406,
"epoch": 3.068230277185501,
"grad_norm": 2.0892016887664795,
"learning_rate": 6.8696000171433855e-06,
"loss": 0.004784305021166802,
"mean_token_accuracy": 0.9977272734045982,
"num_tokens": 7970397.0,
"step": 2160
},
{
"entropy": 2.162716430425644,
"epoch": 3.082444918265814,
"grad_norm": 0.043601471930742264,
"learning_rate": 6.782337888220882e-06,
"loss": 0.0022532181814312936,
"mean_token_accuracy": 1.0,
"num_tokens": 8003756.0,
"step": 2170
},
{
"entropy": 2.127812659740448,
"epoch": 3.0966595593461266,
"grad_norm": 2.6567702293395996,
"learning_rate": 6.6953482238980025e-06,
"loss": 0.01237870380282402,
"mean_token_accuracy": 0.9954761907458305,
"num_tokens": 8042391.0,
"step": 2180
},
{
"entropy": 2.146624502539635,
"epoch": 3.1108742004264394,
"grad_norm": 0.00613620039075613,
"learning_rate": 6.608638390269515e-06,
"loss": 0.008086169511079789,
"mean_token_accuracy": 0.9950213670730591,
"num_tokens": 8078287.0,
"step": 2190
},
{
"entropy": 2.1586718261241913,
"epoch": 3.125088841506752,
"grad_norm": 0.022575080394744873,
"learning_rate": 6.52221572973474e-06,
"loss": 0.011718825995922088,
"mean_token_accuracy": 0.9970158591866494,
"num_tokens": 8114492.0,
"step": 2200
},
{
"entropy": 2.125586226582527,
"epoch": 3.1393034825870645,
"grad_norm": 2.4398252964019775,
"learning_rate": 6.436087560375803e-06,
"loss": 0.013633471727371217,
"mean_token_accuracy": 0.9931770831346511,
"num_tokens": 8152042.0,
"step": 2210
},
{
"entropy": 2.1403322517871857,
"epoch": 3.1535181236673773,
"grad_norm": 0.058475561439991,
"learning_rate": 6.350261175337975e-06,
"loss": 0.005073773115873337,
"mean_token_accuracy": 0.9981249988079071,
"num_tokens": 8188952.0,
"step": 2220
},
{
"entropy": 2.0997527480125426,
"epoch": 3.16773276474769,
"grad_norm": 0.3422115445137024,
"learning_rate": 6.264743842212073e-06,
"loss": 0.010538970679044723,
"mean_token_accuracy": 0.9965603098273277,
"num_tokens": 8230647.0,
"step": 2230
},
{
"entropy": 2.1392576456069947,
"epoch": 3.181947405828003,
"grad_norm": 0.07745851576328278,
"learning_rate": 6.179542802419079e-06,
"loss": 0.007439323514699936,
"mean_token_accuracy": 0.9988435551524162,
"num_tokens": 8264608.0,
"step": 2240
},
{
"entropy": 2.190061104297638,
"epoch": 3.1961620469083156,
"grad_norm": 0.027518633753061295,
"learning_rate": 6.094665270596948e-06,
"loss": 0.011635781824588775,
"mean_token_accuracy": 0.9935132578015328,
"num_tokens": 8300407.0,
"step": 2250
},
{
"entropy": 2.2294768542051315,
"epoch": 3.2103766879886284,
"grad_norm": 0.0750473290681839,
"learning_rate": 6.0101184339896865e-06,
"loss": 0.00671888142824173,
"mean_token_accuracy": 0.9962439998984337,
"num_tokens": 8334944.0,
"step": 2260
},
{
"entropy": 2.197703164815903,
"epoch": 3.224591329068941,
"grad_norm": 0.12029851227998734,
"learning_rate": 5.925909451838747e-06,
"loss": 0.009523383527994155,
"mean_token_accuracy": 0.9985777243971825,
"num_tokens": 8376905.0,
"step": 2270
},
{
"entropy": 2.123885232210159,
"epoch": 3.2388059701492535,
"grad_norm": 0.2749768793582916,
"learning_rate": 5.842045454776816e-06,
"loss": 0.021079175174236298,
"mean_token_accuracy": 0.9924706354737282,
"num_tokens": 8416108.0,
"step": 2280
},
{
"entropy": 2.090131178498268,
"epoch": 3.2530206112295663,
"grad_norm": 0.14854082465171814,
"learning_rate": 5.758533544223986e-06,
"loss": 0.007670293003320694,
"mean_token_accuracy": 0.99760522544384,
"num_tokens": 8454009.0,
"step": 2290
},
{
"entropy": 2.0772017776966094,
"epoch": 3.267235252309879,
"grad_norm": 0.08492118865251541,
"learning_rate": 5.675380791786435e-06,
"loss": 0.0015875270590186119,
"mean_token_accuracy": 1.0,
"num_tokens": 8497359.0,
"step": 2300
},
{
"entropy": 2.1499790489673614,
"epoch": 3.281449893390192,
"grad_norm": 0.8910402059555054,
"learning_rate": 5.592594238657621e-06,
"loss": 0.0036219201982021334,
"mean_token_accuracy": 1.0,
"num_tokens": 8535043.0,
"step": 2310
},
{
"entropy": 2.1721325367689133,
"epoch": 3.2956645344705047,
"grad_norm": 0.018208418041467667,
"learning_rate": 5.510180895022032e-06,
"loss": 0.000674342131242156,
"mean_token_accuracy": 1.0,
"num_tokens": 8572631.0,
"step": 2320
},
{
"entropy": 2.15026940703392,
"epoch": 3.3098791755508175,
"grad_norm": 0.008994768373668194,
"learning_rate": 5.4281477394616146e-06,
"loss": 0.005390065908432007,
"mean_token_accuracy": 0.9979166656732559,
"num_tokens": 8607328.0,
"step": 2330
},
{
"entropy": 2.1503446727991102,
"epoch": 3.3240938166311302,
"grad_norm": 0.19059528410434723,
"learning_rate": 5.346501718364793e-06,
"loss": 0.011236748844385146,
"mean_token_accuracy": 0.9974877446889877,
"num_tokens": 8646346.0,
"step": 2340
},
{
"entropy": 2.2072229474782943,
"epoch": 3.3383084577114426,
"grad_norm": 0.3965470492839813,
"learning_rate": 5.265249745338307e-06,
"loss": 0.019204550981521608,
"mean_token_accuracy": 0.9955678090453148,
"num_tokens": 8679667.0,
"step": 2350
},
{
"entropy": 2.131696742773056,
"epoch": 3.3525230987917554,
"grad_norm": 0.028842760249972343,
"learning_rate": 5.184398700621765e-06,
"loss": 0.002106231637299061,
"mean_token_accuracy": 1.0,
"num_tokens": 8715830.0,
"step": 2360
},
{
"entropy": 2.1438046902418137,
"epoch": 3.366737739872068,
"grad_norm": 0.04236413538455963,
"learning_rate": 5.10395543050503e-06,
"loss": 0.029832398891448973,
"mean_token_accuracy": 0.9930059522390365,
"num_tokens": 8753194.0,
"step": 2370
},
{
"entropy": 2.108007326722145,
"epoch": 3.380952380952381,
"grad_norm": 0.11014021933078766,
"learning_rate": 5.023926746748524e-06,
"loss": 0.009075208753347396,
"mean_token_accuracy": 0.9928571417927742,
"num_tokens": 8792099.0,
"step": 2380
},
{
"entropy": 2.181051468849182,
"epoch": 3.3951670220326937,
"grad_norm": 0.0077524553053081036,
"learning_rate": 4.944319426006381e-06,
"loss": 0.009630301594734192,
"mean_token_accuracy": 0.9973286435008049,
"num_tokens": 8824763.0,
"step": 2390
},
{
"entropy": 2.0720641285181047,
"epoch": 3.4093816631130065,
"grad_norm": 0.05514072626829147,
"learning_rate": 4.865140209252649e-06,
"loss": 0.013563276827335357,
"mean_token_accuracy": 0.9977705627679825,
"num_tokens": 8863036.0,
"step": 2400
},
{
"entropy": 2.13643596470356,
"epoch": 3.4235963041933193,
"grad_norm": 3.3827261924743652,
"learning_rate": 4.786395801210452e-06,
"loss": 0.0168175533413887,
"mean_token_accuracy": 0.9946783423423767,
"num_tokens": 8896699.0,
"step": 2410
},
{
"entropy": 2.1522935539484025,
"epoch": 3.4378109452736316,
"grad_norm": 0.06272371113300323,
"learning_rate": 4.708092869784273e-06,
"loss": 0.006873990595340729,
"mean_token_accuracy": 0.9995901644229889,
"num_tokens": 8932246.0,
"step": 2420
},
{
"entropy": 2.127246394753456,
"epoch": 3.4520255863539444,
"grad_norm": 0.010775122791528702,
"learning_rate": 4.630238045495318e-06,
"loss": 0.0019115816801786422,
"mean_token_accuracy": 0.9992424249649048,
"num_tokens": 8968550.0,
"step": 2430
},
{
"entropy": 2.167269319295883,
"epoch": 3.466240227434257,
"grad_norm": 0.46379631757736206,
"learning_rate": 4.552837920920057e-06,
"loss": 0.0013112064450979232,
"mean_token_accuracy": 1.0,
"num_tokens": 9004264.0,
"step": 2440
},
{
"entropy": 2.1489324510097503,
"epoch": 3.48045486851457,
"grad_norm": 0.6207188963890076,
"learning_rate": 4.475899050131985e-06,
"loss": 0.006231657788157463,
"mean_token_accuracy": 0.9964285716414452,
"num_tokens": 9040079.0,
"step": 2450
},
{
"entropy": 2.183499825000763,
"epoch": 3.4946695095948828,
"grad_norm": 0.07879038900136948,
"learning_rate": 4.399427948146624e-06,
"loss": 0.020220884680747987,
"mean_token_accuracy": 0.9945031389594078,
"num_tokens": 9077997.0,
"step": 2460
},
{
"entropy": 2.211496871709824,
"epoch": 3.5088841506751955,
"grad_norm": 0.12836432456970215,
"learning_rate": 4.3234310903698695e-06,
"loss": 0.006491854786872864,
"mean_token_accuracy": 0.9995098039507866,
"num_tokens": 9115310.0,
"step": 2470
},
{
"entropy": 2.176717010140419,
"epoch": 3.5230987917555083,
"grad_norm": 0.8318957090377808,
"learning_rate": 4.247914912049635e-06,
"loss": 0.0016323558986186982,
"mean_token_accuracy": 1.0,
"num_tokens": 9152231.0,
"step": 2480
},
{
"entropy": 2.2198712468147277,
"epoch": 3.5373134328358207,
"grad_norm": 2.0839056968688965,
"learning_rate": 4.172885807730972e-06,
"loss": 0.009627557545900344,
"mean_token_accuracy": 0.9967328533530235,
"num_tokens": 9188384.0,
"step": 2490
},
{
"entropy": 2.215090864896774,
"epoch": 3.5515280739161335,
"grad_norm": 0.1644526720046997,
"learning_rate": 4.0983501307145466e-06,
"loss": 0.007908221334218979,
"mean_token_accuracy": 0.996194276213646,
"num_tokens": 9225015.0,
"step": 2500
},
{
"epoch": 3.5515280739161335,
"eval_entropy": 2.025349033040811,
"eval_loss": 0.543056845664978,
"eval_mean_token_accuracy": 0.9176541126509321,
"eval_num_tokens": 9225015.0,
"eval_runtime": 989.9838,
"eval_samples_per_second": 7.728,
"eval_steps_per_second": 0.967,
"step": 2500
},
{
"entropy": 2.1734833300113676,
"epoch": 3.5657427149964462,
"grad_norm": 0.6722556352615356,
"learning_rate": 4.024314192518691e-06,
"loss": 0.005212902277708054,
"mean_token_accuracy": 0.9996875002980232,
"num_tokens": 9260855.0,
"step": 2510
},
{
"entropy": 2.1916033893823625,
"epoch": 3.579957356076759,
"grad_norm": 0.46904346346855164,
"learning_rate": 3.950784262344947e-06,
"loss": 0.005123495310544968,
"mean_token_accuracy": 0.996708333492279,
"num_tokens": 9300640.0,
"step": 2520
},
{
"entropy": 2.1783609628677367,
"epoch": 3.594171997157072,
"grad_norm": 0.6677644848823547,
"learning_rate": 3.877766566547186e-06,
"loss": 0.008107519149780274,
"mean_token_accuracy": 0.9955555558204651,
"num_tokens": 9336822.0,
"step": 2530
},
{
"entropy": 2.1903655380010605,
"epoch": 3.6083866382373846,
"grad_norm": 0.030927782878279686,
"learning_rate": 3.8052672881044173e-06,
"loss": 0.005363395810127259,
"mean_token_accuracy": 0.9973389357328415,
"num_tokens": 9370145.0,
"step": 2540
},
{
"entropy": 2.136083886027336,
"epoch": 3.6226012793176974,
"grad_norm": 0.14145703613758087,
"learning_rate": 3.7332925660971774e-06,
"loss": 0.001963794231414795,
"mean_token_accuracy": 0.9993055552244187,
"num_tokens": 9405831.0,
"step": 2550
},
{
"entropy": 2.1727351754903794,
"epoch": 3.6368159203980097,
"grad_norm": 0.06443420052528381,
"learning_rate": 3.661848495187724e-06,
"loss": 0.009727256000041961,
"mean_token_accuracy": 0.9967490404844284,
"num_tokens": 9442595.0,
"step": 2560
},
{
"entropy": 2.180554246902466,
"epoch": 3.651030561478323,
"grad_norm": 0.22529654204845428,
"learning_rate": 3.5909411251039295e-06,
"loss": 0.0030778197571635245,
"mean_token_accuracy": 0.9995098039507866,
"num_tokens": 9474871.0,
"step": 2570
},
{
"entropy": 2.1319134652614595,
"epoch": 3.6652452025586353,
"grad_norm": 0.046728238463401794,
"learning_rate": 3.520576460127019e-06,
"loss": 0.0027088303118944167,
"mean_token_accuracy": 0.9994047611951828,
"num_tokens": 9513525.0,
"step": 2580
},
{
"entropy": 2.1576041877269745,
"epoch": 3.679459843638948,
"grad_norm": 0.009525112807750702,
"learning_rate": 3.450760458583132e-06,
"loss": 0.005883176624774933,
"mean_token_accuracy": 0.9987936049699784,
"num_tokens": 9546650.0,
"step": 2590
},
{
"entropy": 2.164761394262314,
"epoch": 3.693674484719261,
"grad_norm": 5.105481147766113,
"learning_rate": 3.3814990323387886e-06,
"loss": 0.011438134312629699,
"mean_token_accuracy": 0.994793213903904,
"num_tokens": 9584618.0,
"step": 2600
},
{
"entropy": 2.212935158610344,
"epoch": 3.7078891257995736,
"grad_norm": 0.10164128243923187,
"learning_rate": 3.3127980463002852e-06,
"loss": 0.015480761229991914,
"mean_token_accuracy": 0.9978535354137421,
"num_tokens": 9621145.0,
"step": 2610
},
{
"entropy": 2.1630167931318285,
"epoch": 3.7221037668798864,
"grad_norm": 0.04091818630695343,
"learning_rate": 3.244663317917056e-06,
"loss": 0.003573558479547501,
"mean_token_accuracy": 0.9988095238804817,
"num_tokens": 9660623.0,
"step": 2620
},
{
"entropy": 2.18853420317173,
"epoch": 3.7363184079601988,
"grad_norm": 0.29761549830436707,
"learning_rate": 3.177100616689085e-06,
"loss": 0.002430788241326809,
"mean_token_accuracy": 0.9977272734045982,
"num_tokens": 9693952.0,
"step": 2630
},
{
"entropy": 2.1519277811050417,
"epoch": 3.750533049040512,
"grad_norm": 1.4869977235794067,
"learning_rate": 3.1101156636783424e-06,
"loss": 0.012232684344053269,
"mean_token_accuracy": 0.9964350983500481,
"num_tokens": 9732781.0,
"step": 2640
},
{
"entropy": 2.11678723692894,
"epoch": 3.7647476901208243,
"grad_norm": 0.009623765014111996,
"learning_rate": 3.0437141310243436e-06,
"loss": 0.004782317578792572,
"mean_token_accuracy": 0.9982051268219948,
"num_tokens": 9773807.0,
"step": 2650
},
{
"entropy": 2.177131649851799,
"epoch": 3.778962331201137,
"grad_norm": 0.05591592937707901,
"learning_rate": 2.977901641463833e-06,
"loss": 0.0022820821031928062,
"mean_token_accuracy": 0.9993243247270585,
"num_tokens": 9806829.0,
"step": 2660
},
{
"entropy": 2.0982068300247194,
"epoch": 3.79317697228145,
"grad_norm": 0.04154813662171364,
"learning_rate": 2.9126837678546814e-06,
"loss": 0.003840605542063713,
"mean_token_accuracy": 0.9989583343267441,
"num_tokens": 9848588.0,
"step": 2670
},
{
"entropy": 2.177445635199547,
"epoch": 3.8073916133617627,
"grad_norm": 0.40800824761390686,
"learning_rate": 2.8480660327039834e-06,
"loss": 0.024874459207057952,
"mean_token_accuracy": 0.9968070656061172,
"num_tokens": 9882298.0,
"step": 2680
},
{
"entropy": 2.1979396522045134,
"epoch": 3.8216062544420755,
"grad_norm": 2.1369435787200928,
"learning_rate": 2.7840539077004026e-06,
"loss": 0.006149508431553841,
"mean_token_accuracy": 0.995833334326744,
"num_tokens": 9917403.0,
"step": 2690
},
{
"entropy": 2.2291352182626722,
"epoch": 3.835820895522388,
"grad_norm": 0.48058605194091797,
"learning_rate": 2.7206528132508813e-06,
"loss": 0.012438727915287018,
"mean_token_accuracy": 0.9970117837190628,
"num_tokens": 9953432.0,
"step": 2700
},
{
"entropy": 2.148913612961769,
"epoch": 3.850035536602701,
"grad_norm": 0.5231387615203857,
"learning_rate": 2.657868118021608e-06,
"loss": 0.002489854209125042,
"mean_token_accuracy": 1.0,
"num_tokens": 9987465.0,
"step": 2710
},
{
"entropy": 2.183783236145973,
"epoch": 3.8642501776830134,
"grad_norm": 0.08354540169239044,
"learning_rate": 2.5957051384834443e-06,
"loss": 0.025581926107406616,
"mean_token_accuracy": 0.9913469970226287,
"num_tokens": 10024663.0,
"step": 2720
},
{
"entropy": 2.206176847219467,
"epoch": 3.878464818763326,
"grad_norm": 0.09456467628479004,
"learning_rate": 2.534169138461725e-06,
"loss": 0.0029037076979875564,
"mean_token_accuracy": 0.9985294118523598,
"num_tokens": 10059420.0,
"step": 2730
},
{
"entropy": 2.152846413850784,
"epoch": 3.892679459843639,
"grad_norm": 0.38944724202156067,
"learning_rate": 2.473265328690514e-06,
"loss": 0.008512056618928909,
"mean_token_accuracy": 0.9977964743971824,
"num_tokens": 10099303.0,
"step": 2740
},
{
"entropy": 2.1975372284650803,
"epoch": 3.9068941009239517,
"grad_norm": 1.185078740119934,
"learning_rate": 2.412998866371411e-06,
"loss": 0.00427936352789402,
"mean_token_accuracy": 0.9974374994635582,
"num_tokens": 10135013.0,
"step": 2750
},
{
"entropy": 2.193510928750038,
"epoch": 3.9211087420042645,
"grad_norm": 0.5688725709915161,
"learning_rate": 2.3533748547368008e-06,
"loss": 0.009441718459129333,
"mean_token_accuracy": 0.9988095238804817,
"num_tokens": 10171217.0,
"step": 2760
},
{
"entropy": 2.063158482313156,
"epoch": 3.935323383084577,
"grad_norm": 0.39150136709213257,
"learning_rate": 2.294398342617765e-06,
"loss": 0.006837107241153717,
"mean_token_accuracy": 0.9970514938235283,
"num_tokens": 10211084.0,
"step": 2770
},
{
"entropy": 2.1779229074716566,
"epoch": 3.94953802416489,
"grad_norm": 0.06802282482385635,
"learning_rate": 2.2360743240165283e-06,
"loss": 0.0037012625485658645,
"mean_token_accuracy": 0.9991379305720329,
"num_tokens": 10248579.0,
"step": 2780
},
{
"entropy": 2.099555331468582,
"epoch": 3.9637526652452024,
"grad_norm": 0.10486733913421631,
"learning_rate": 2.1784077376835964e-06,
"loss": 0.0013088119216263295,
"mean_token_accuracy": 1.0,
"num_tokens": 10288496.0,
"step": 2790
},
{
"entropy": 2.1688816130161284,
"epoch": 3.977967306325515,
"grad_norm": 0.016996540129184723,
"learning_rate": 2.1214034666995452e-06,
"loss": 0.02126392424106598,
"mean_token_accuracy": 0.9912162214517594,
"num_tokens": 10325933.0,
"step": 2800
},
{
"entropy": 2.1608937054872515,
"epoch": 3.992181947405828,
"grad_norm": 0.06427384167909622,
"learning_rate": 2.065066338061533e-06,
"loss": 0.0059285745024681095,
"mean_token_accuracy": 0.9981752723455429,
"num_tokens": 10366910.0,
"step": 2810
},
{
"entropy": 2.196948136153974,
"epoch": 4.005685856432125,
"grad_norm": 0.11280222237110138,
"learning_rate": 2.0094011222745647e-06,
"loss": 0.0018585361540317535,
"mean_token_accuracy": 1.0,
"num_tokens": 10401852.0,
"step": 2820
},
{
"entropy": 2.1833971083164214,
"epoch": 4.019900497512438,
"grad_norm": 0.047356266528367996,
"learning_rate": 1.9544125329475237e-06,
"loss": 0.0012251741252839565,
"mean_token_accuracy": 1.0,
"num_tokens": 10439032.0,
"step": 2830
},
{
"entropy": 2.2034851729869844,
"epoch": 4.0341151385927505,
"grad_norm": 0.20847798883914948,
"learning_rate": 1.900105226394051e-06,
"loss": 0.004868442937731743,
"mean_token_accuracy": 0.9994186043739319,
"num_tokens": 10473983.0,
"step": 2840
},
{
"entropy": 2.17997325360775,
"epoch": 4.048329779673063,
"grad_norm": 1.2543761730194092,
"learning_rate": 1.846483801238248e-06,
"loss": 0.000993065070360899,
"mean_token_accuracy": 1.0,
"num_tokens": 10506963.0,
"step": 2850
},
{
"entropy": 2.14132858812809,
"epoch": 4.062544420753376,
"grad_norm": 0.2019268274307251,
"learning_rate": 1.7935527980252799e-06,
"loss": 0.0016139384359121322,
"mean_token_accuracy": 1.0,
"num_tokens": 10546928.0,
"step": 2860
},
{
"entropy": 2.1205300956964495,
"epoch": 4.076759061833688,
"grad_norm": 0.006392813287675381,
"learning_rate": 1.7413166988368802e-06,
"loss": 0.005241365730762481,
"mean_token_accuracy": 0.99921875,
"num_tokens": 10588651.0,
"step": 2870
},
{
"entropy": 2.1647232592105867,
"epoch": 4.090973702914002,
"grad_norm": 0.06546484678983688,
"learning_rate": 1.6897799269118398e-06,
"loss": 0.0012532318010926246,
"mean_token_accuracy": 1.0,
"num_tokens": 10628469.0,
"step": 2880
},
{
"entropy": 2.173341378569603,
"epoch": 4.105188343994314,
"grad_norm": 0.0864807739853859,
"learning_rate": 1.6389468462714387e-06,
"loss": 0.0024954590946435927,
"mean_token_accuracy": 0.9988857284188271,
"num_tokens": 10665691.0,
"step": 2890
},
{
"entropy": 2.0994014710187914,
"epoch": 4.119402985074627,
"grad_norm": 0.007347598671913147,
"learning_rate": 1.5888217613499101e-06,
"loss": 0.0006663267500698567,
"mean_token_accuracy": 1.0,
"num_tokens": 10705041.0,
"step": 2900
},
{
"entropy": 2.1861185312271116,
"epoch": 4.1336176261549396,
"grad_norm": 0.1270337551832199,
"learning_rate": 1.5394089166299718e-06,
"loss": 0.006704054027795792,
"mean_token_accuracy": 0.9972916662693023,
"num_tokens": 10738994.0,
"step": 2910
},
{
"entropy": 2.115477886795998,
"epoch": 4.147832267235252,
"grad_norm": 0.13763725757598877,
"learning_rate": 1.4907124962833808e-06,
"loss": 0.004347409680485725,
"mean_token_accuracy": 0.9986842110753059,
"num_tokens": 10776182.0,
"step": 2920
},
{
"entropy": 2.195647644996643,
"epoch": 4.162046908315565,
"grad_norm": 0.06850487738847733,
"learning_rate": 1.4427366238166517e-06,
"loss": 0.004155668616294861,
"mean_token_accuracy": 0.9984969049692154,
"num_tokens": 10816150.0,
"step": 2930
},
{
"entropy": 2.1906051248311997,
"epoch": 4.1762615493958775,
"grad_norm": 0.01908433809876442,
"learning_rate": 1.3954853617218745e-06,
"loss": 0.013761062920093537,
"mean_token_accuracy": 0.9947195380926133,
"num_tokens": 10852408.0,
"step": 2940
},
{
"entropy": 2.1659664869308473,
"epoch": 4.190476190476191,
"grad_norm": 0.031739577651023865,
"learning_rate": 1.3489627111327187e-06,
"loss": 0.003443429246544838,
"mean_token_accuracy": 0.9993902444839478,
"num_tokens": 10887520.0,
"step": 2950
},
{
"entropy": 2.2092543095350266,
"epoch": 4.204690831556503,
"grad_norm": 0.048356492072343826,
"learning_rate": 1.3031726114856202e-06,
"loss": 0.0038285456597805024,
"mean_token_accuracy": 0.9986111104488373,
"num_tokens": 10921960.0,
"step": 2960
},
{
"entropy": 2.1533284068107603,
"epoch": 4.218905472636816,
"grad_norm": 1.2027009725570679,
"learning_rate": 1.2581189401862036e-06,
"loss": 0.007209320366382599,
"mean_token_accuracy": 0.9953348532319068,
"num_tokens": 10957277.0,
"step": 2970
},
{
"entropy": 2.162069135904312,
"epoch": 4.233120113717129,
"grad_norm": 0.021080689504742622,
"learning_rate": 1.2138055122809522e-06,
"loss": 0.0012023065239191056,
"mean_token_accuracy": 1.0,
"num_tokens": 10989161.0,
"step": 2980
},
{
"entropy": 2.1910412877798082,
"epoch": 4.247334754797441,
"grad_norm": 0.4471619427204132,
"learning_rate": 1.170236080134145e-06,
"loss": 0.004197989776730538,
"mean_token_accuracy": 0.9975662842392922,
"num_tokens": 11024450.0,
"step": 2990
},
{
"entropy": 2.185595816373825,
"epoch": 4.261549395877754,
"grad_norm": 0.42085593938827515,
"learning_rate": 1.127414333110135e-06,
"loss": 0.004017576575279236,
"mean_token_accuracy": 0.9978968247771263,
"num_tokens": 11059337.0,
"step": 3000
},
{
"epoch": 4.261549395877754,
"eval_entropy": 2.021736085601735,
"eval_loss": 0.5579360127449036,
"eval_mean_token_accuracy": 0.9177084487309152,
"eval_num_tokens": 11059337.0,
"eval_runtime": 989.3713,
"eval_samples_per_second": 7.733,
"eval_steps_per_second": 0.967,
"step": 3000
},
{
"entropy": 2.087850275635719,
"epoch": 4.2757640369580665,
"grad_norm": 0.043584469705820084,
"learning_rate": 1.0853438972609299e-06,
"loss": 0.0032962791621685026,
"mean_token_accuracy": 0.9983258932828903,
"num_tokens": 11099908.0,
"step": 3010
},
{
"entropy": 2.217186596989632,
"epoch": 4.28997867803838,
"grad_norm": 0.0054810852743685246,
"learning_rate": 1.0440283350191483e-06,
"loss": 0.005877744778990746,
"mean_token_accuracy": 0.9971874997019767,
"num_tokens": 11137291.0,
"step": 3020
},
{
"entropy": 2.2094817072153092,
"epoch": 4.304193319118692,
"grad_norm": 0.06918873637914658,
"learning_rate": 1.0034711448963563e-06,
"loss": 0.0013420137576758862,
"mean_token_accuracy": 1.0,
"num_tokens": 11171023.0,
"step": 3030
},
{
"entropy": 2.2051640689373015,
"epoch": 4.318407960199005,
"grad_norm": 0.10377147048711777,
"learning_rate": 9.636757611868297e-07,
"loss": 0.005501218512654305,
"mean_token_accuracy": 0.9981210514903068,
"num_tokens": 11207280.0,
"step": 3040
},
{
"entropy": 2.1432130724191665,
"epoch": 4.332622601279318,
"grad_norm": 0.8852893114089966,
"learning_rate": 9.246455536767407e-07,
"loss": 0.002229997143149376,
"mean_token_accuracy": 1.0,
"num_tokens": 11242611.0,
"step": 3050
},
{
"entropy": 2.118473994731903,
"epoch": 4.34683724235963,
"grad_norm": 0.2849883735179901,
"learning_rate": 8.863838273588121e-07,
"loss": 0.004777782037854195,
"mean_token_accuracy": 0.9995192304253578,
"num_tokens": 11278511.0,
"step": 3060
},
{
"entropy": 2.1805112212896347,
"epoch": 4.361051883439943,
"grad_norm": 0.17783457040786743,
"learning_rate": 8.48893822152459e-07,
"loss": 0.0011253532022237778,
"mean_token_accuracy": 1.0,
"num_tokens": 11314397.0,
"step": 3070
},
{
"entropy": 2.1570386826992034,
"epoch": 4.3752665245202556,
"grad_norm": 2.8052237033843994,
"learning_rate": 8.121787126294323e-07,
"loss": 0.002880261279642582,
"mean_token_accuracy": 0.9989999994635582,
"num_tokens": 11350741.0,
"step": 3080
},
{
"entropy": 2.215659800171852,
"epoch": 4.389481165600569,
"grad_norm": 0.16840478777885437,
"learning_rate": 7.762416077450175e-07,
"loss": 0.0009297240525484085,
"mean_token_accuracy": 1.0,
"num_tokens": 11384917.0,
"step": 3090
},
{
"entropy": 2.0968218415975572,
"epoch": 4.403695806680881,
"grad_norm": 0.037575576454401016,
"learning_rate": 7.410855505747583e-07,
"loss": 0.0018225666135549545,
"mean_token_accuracy": 0.9982142850756646,
"num_tokens": 11425676.0,
"step": 3100
},
{
"entropy": 2.1322130650281905,
"epoch": 4.417910447761194,
"grad_norm": 0.4404691159725189,
"learning_rate": 7.067135180567919e-07,
"loss": 0.0013419835828244685,
"mean_token_accuracy": 1.0,
"num_tokens": 11463704.0,
"step": 3110
},
{
"entropy": 2.2044524610042573,
"epoch": 4.432125088841507,
"grad_norm": 0.9155864119529724,
"learning_rate": 6.731284207397548e-07,
"loss": 0.0015116781927645207,
"mean_token_accuracy": 1.0,
"num_tokens": 11496950.0,
"step": 3120
},
{
"entropy": 2.161736896634102,
"epoch": 4.446339729921819,
"grad_norm": 2.8296735286712646,
"learning_rate": 6.403331025363312e-07,
"loss": 0.0043445445597171785,
"mean_token_accuracy": 0.997027014195919,
"num_tokens": 11534916.0,
"step": 3130
},
{
"entropy": 2.123622697591782,
"epoch": 4.460554371002132,
"grad_norm": 0.8704050183296204,
"learning_rate": 6.083303404824381e-07,
"loss": 0.00419679544866085,
"mean_token_accuracy": 0.9993589743971825,
"num_tokens": 11575692.0,
"step": 3140
},
{
"entropy": 2.1255591422319413,
"epoch": 4.474769012082445,
"grad_norm": 2.5488767623901367,
"learning_rate": 5.771228445020627e-07,
"loss": 0.004947403818368912,
"mean_token_accuracy": 0.9964460790157318,
"num_tokens": 11613906.0,
"step": 3150
},
{
"entropy": 2.169129991531372,
"epoch": 4.488983653162758,
"grad_norm": 0.05024200305342674,
"learning_rate": 5.467132571778011e-07,
"loss": 0.0006448611617088318,
"mean_token_accuracy": 1.0,
"num_tokens": 11648392.0,
"step": 3160
},
{
"entropy": 2.103648892045021,
"epoch": 4.50319829424307,
"grad_norm": 0.018968380987644196,
"learning_rate": 5.171041535270894e-07,
"loss": 0.0005233283154666424,
"mean_token_accuracy": 1.0,
"num_tokens": 11691399.0,
"step": 3170
},
{
"entropy": 2.1431118875741957,
"epoch": 4.517412935323383,
"grad_norm": 0.0916331559419632,
"learning_rate": 4.88298040784152e-07,
"loss": 0.004345014318823814,
"mean_token_accuracy": 0.9971717178821564,
"num_tokens": 11725157.0,
"step": 3180
},
{
"entropy": 2.1765580475330353,
"epoch": 4.531627576403696,
"grad_norm": 0.02908848598599434,
"learning_rate": 4.6029735818769907e-07,
"loss": 0.0040725283324718475,
"mean_token_accuracy": 0.9995192304253578,
"num_tokens": 11765063.0,
"step": 3190
},
{
"entropy": 2.199541613459587,
"epoch": 4.545842217484008,
"grad_norm": 0.5352857708930969,
"learning_rate": 4.331044767743708e-07,
"loss": 0.0021973950788378716,
"mean_token_accuracy": 0.9989583328366279,
"num_tokens": 11801966.0,
"step": 3200
},
{
"entropy": 2.165239670872688,
"epoch": 4.560056858564321,
"grad_norm": 0.021813327446579933,
"learning_rate": 4.067216991779721e-07,
"loss": 0.002202248200774193,
"mean_token_accuracy": 0.9996031746268272,
"num_tokens": 11842437.0,
"step": 3210
},
{
"entropy": 2.149556291103363,
"epoch": 4.574271499644634,
"grad_norm": 0.012352075427770615,
"learning_rate": 3.811512594344857e-07,
"loss": 0.004862933605909348,
"mean_token_accuracy": 0.9995098039507866,
"num_tokens": 11881004.0,
"step": 3220
},
{
"entropy": 2.1413369357585905,
"epoch": 4.588486140724947,
"grad_norm": 0.04668094962835312,
"learning_rate": 3.5639532279289845e-07,
"loss": 0.003514312207698822,
"mean_token_accuracy": 0.9972222223877907,
"num_tokens": 11918795.0,
"step": 3230
},
{
"entropy": 2.1386821925640107,
"epoch": 4.602700781805259,
"grad_norm": 0.03126770630478859,
"learning_rate": 3.3245598553184986e-07,
"loss": 0.004513117671012879,
"mean_token_accuracy": 0.9995614036917686,
"num_tokens": 11952525.0,
"step": 3240
},
{
"entropy": 2.127019727230072,
"epoch": 4.616915422885572,
"grad_norm": 0.33939263224601746,
"learning_rate": 3.0933527478213545e-07,
"loss": 0.005397439002990723,
"mean_token_accuracy": 0.9990074694156647,
"num_tokens": 11991456.0,
"step": 3250
},
{
"entropy": 2.2128841817378997,
"epoch": 4.631130063965885,
"grad_norm": 0.6997547149658203,
"learning_rate": 2.870351483550382e-07,
"loss": 0.0022805359214544295,
"mean_token_accuracy": 1.0,
"num_tokens": 12024144.0,
"step": 3260
},
{
"entropy": 2.096145638823509,
"epoch": 4.645344705046197,
"grad_norm": 0.11305858194828033,
"learning_rate": 2.655574945765571e-07,
"loss": 0.012231498956680298,
"mean_token_accuracy": 0.9988888889551163,
"num_tokens": 12062762.0,
"step": 3270
},
{
"entropy": 2.0828854560852053,
"epoch": 4.65955934612651,
"grad_norm": 0.025230111554265022,
"learning_rate": 2.4490413212750475e-07,
"loss": 0.002871591970324516,
"mean_token_accuracy": 0.9985294118523598,
"num_tokens": 12100824.0,
"step": 3280
},
{
"entropy": 2.1890225172042848,
"epoch": 4.673773987206823,
"grad_norm": 0.08814139664173126,
"learning_rate": 2.2507680988949843e-07,
"loss": 0.004444138705730438,
"mean_token_accuracy": 0.9988095238804817,
"num_tokens": 12138713.0,
"step": 3290
},
{
"entropy": 2.168518990278244,
"epoch": 4.687988628287136,
"grad_norm": 0.01869502291083336,
"learning_rate": 2.0607720679688193e-07,
"loss": 0.0033570095896720887,
"mean_token_accuracy": 0.9983983993530273,
"num_tokens": 12175435.0,
"step": 3300
},
{
"entropy": 2.165831074118614,
"epoch": 4.702203269367448,
"grad_norm": 0.10159584879875183,
"learning_rate": 1.8790693169454365e-07,
"loss": 0.002022952027618885,
"mean_token_accuracy": 1.0,
"num_tokens": 12211650.0,
"step": 3310
},
{
"entropy": 2.0869997441768646,
"epoch": 4.7164179104477615,
"grad_norm": 1.7387880086898804,
"learning_rate": 1.7056752320169346e-07,
"loss": 0.002982720918953419,
"mean_token_accuracy": 0.9994565218687057,
"num_tokens": 12249287.0,
"step": 3320
},
{
"entropy": 2.1755292028188706,
"epoch": 4.730632551528074,
"grad_norm": 0.04950045421719551,
"learning_rate": 1.5406044958156896e-07,
"loss": 0.0011815003119409085,
"mean_token_accuracy": 1.0,
"num_tokens": 12286730.0,
"step": 3330
},
{
"entropy": 2.1790402829647064,
"epoch": 4.744847192608386,
"grad_norm": 0.20007754862308502,
"learning_rate": 1.383871086171107e-07,
"loss": 0.001237096171826124,
"mean_token_accuracy": 1.0,
"num_tokens": 12322652.0,
"step": 3340
},
{
"entropy": 2.207217875123024,
"epoch": 4.759061833688699,
"grad_norm": 1.2678426504135132,
"learning_rate": 1.2354882749259778e-07,
"loss": 0.012135348469018935,
"mean_token_accuracy": 0.9962175503373146,
"num_tokens": 12357845.0,
"step": 3350
},
{
"entropy": 2.1616628229618073,
"epoch": 4.773276474769012,
"grad_norm": 0.07163197547197342,
"learning_rate": 1.0954686268126457e-07,
"loss": 0.0008528068661689759,
"mean_token_accuracy": 1.0,
"num_tokens": 12395670.0,
"step": 3360
},
{
"entropy": 2.153119242191315,
"epoch": 4.787491115849325,
"grad_norm": 0.07595377415418625,
"learning_rate": 9.638239983890907e-08,
"loss": 0.002039765752851963,
"mean_token_accuracy": 0.999074074625969,
"num_tokens": 12430518.0,
"step": 3370
},
{
"entropy": 2.1775210916996004,
"epoch": 4.801705756929637,
"grad_norm": 0.041752155870199203,
"learning_rate": 8.405655370349209e-08,
"loss": 0.005490196123719216,
"mean_token_accuracy": 0.9972794115543365,
"num_tokens": 12468421.0,
"step": 3380
},
{
"entropy": 2.1661739617586138,
"epoch": 4.8159203980099505,
"grad_norm": 1.1951086521148682,
"learning_rate": 7.257036800074169e-08,
"loss": 0.004392094537615776,
"mean_token_accuracy": 0.9986564621329308,
"num_tokens": 12505399.0,
"step": 3390
},
{
"entropy": 2.1709176123142244,
"epoch": 4.830135039090263,
"grad_norm": 0.009752362966537476,
"learning_rate": 6.192481535577389e-08,
"loss": 0.00032480861991643903,
"mean_token_accuracy": 1.0,
"num_tokens": 12537999.0,
"step": 3400
},
{
"entropy": 2.0440476834774017,
"epoch": 4.844349680170575,
"grad_norm": 0.033612970262765884,
"learning_rate": 5.2120797210736264e-08,
"loss": 0.002183059975504875,
"mean_token_accuracy": 0.9984375,
"num_tokens": 12580299.0,
"step": 3410
},
{
"entropy": 2.155395808815956,
"epoch": 4.858564321250888,
"grad_norm": 0.09350975602865219,
"learning_rate": 4.315914374847019e-08,
"loss": 0.0005531907547265292,
"mean_token_accuracy": 1.0,
"num_tokens": 12613080.0,
"step": 3420
},
{
"entropy": 2.1979628175497057,
"epoch": 4.872778962331201,
"grad_norm": 0.04874487593770027,
"learning_rate": 3.504061382221702e-08,
"loss": 0.0024951497092843057,
"mean_token_accuracy": 0.9986111104488373,
"num_tokens": 12650712.0,
"step": 3430
},
{
"entropy": 2.1535072445869448,
"epoch": 4.886993603411514,
"grad_norm": 0.08149798959493637,
"learning_rate": 2.776589489136061e-08,
"loss": 0.0022866273298859595,
"mean_token_accuracy": 0.9977481618523598,
"num_tokens": 12686728.0,
"step": 3440
},
{
"entropy": 2.173008641600609,
"epoch": 4.901208244491826,
"grad_norm": 0.058297913521528244,
"learning_rate": 2.1335602963207247e-08,
"loss": 0.0012641225941479207,
"mean_token_accuracy": 1.0,
"num_tokens": 12724571.0,
"step": 3450
},
{
"entropy": 2.1928866147994994,
"epoch": 4.91542288557214,
"grad_norm": 0.05695611238479614,
"learning_rate": 1.5750282540835105e-08,
"loss": 0.007882739603519439,
"mean_token_accuracy": 0.99921875,
"num_tokens": 12761233.0,
"step": 3460
},
{
"entropy": 2.1840217113494873,
"epoch": 4.929637526652452,
"grad_norm": 0.005757441744208336,
"learning_rate": 1.1010406576976718e-08,
"loss": 0.0078007526695728305,
"mean_token_accuracy": 0.9985565349459649,
"num_tokens": 12795491.0,
"step": 3470
},
{
"entropy": 2.090686786174774,
"epoch": 4.943852167732764,
"grad_norm": 0.20968373119831085,
"learning_rate": 7.116376433975447e-09,
"loss": 0.002710508555173874,
"mean_token_accuracy": 0.9993243247270585,
"num_tokens": 12837878.0,
"step": 3480
},
{
"entropy": 2.202594816684723,
"epoch": 4.9580668088130775,
"grad_norm": 0.15738585591316223,
"learning_rate": 4.068521849800444e-09,
"loss": 0.005096424371004105,
"mean_token_accuracy": 0.9977618142962456,
"num_tokens": 12872699.0,
"step": 3490
},
{
"entropy": 2.177238318324089,
"epoch": 4.97228144989339,
"grad_norm": 0.026785463094711304,
"learning_rate": 1.8671009101189908e-09,
"loss": 0.0019810071215033533,
"mean_token_accuracy": 1.0,
"num_tokens": 12909138.0,
"step": 3500
},
{
"epoch": 4.97228144989339,
"eval_entropy": 2.019442914670787,
"eval_loss": 0.5660073757171631,
"eval_mean_token_accuracy": 0.9171707378534937,
"eval_num_tokens": 12909138.0,
"eval_runtime": 991.6327,
"eval_samples_per_second": 7.716,
"eval_steps_per_second": 0.965,
"step": 3500
},
{
"entropy": 2.0914847373962404,
"epoch": 4.986496090973703,
"grad_norm": 0.7345014214515686,
"learning_rate": 5.123000264484201e-10,
"loss": 0.004509637877345085,
"mean_token_accuracy": 0.9989583328366279,
"num_tokens": 12949603.0,
"step": 3510
},
{
"entropy": 2.209040698252226,
"epoch": 5.0,
"grad_norm": 0.0030606593936681747,
"learning_rate": 4.233920367635591e-12,
"loss": 0.00112865949049592,
"mean_token_accuracy": 1.0,
"num_tokens": 12980625.0,
"step": 3520
},
{
"epoch": 5.0,
"eval_entropy": 2.0196086888278417,
"eval_loss": 0.5659698247909546,
"eval_mean_token_accuracy": 0.917177452126765,
"eval_num_tokens": 12980625.0,
"eval_runtime": 991.6,
"eval_samples_per_second": 7.716,
"eval_steps_per_second": 0.965,
"step": 3520
},
{
"epoch": 5.0,
"step": 3520,
"total_flos": 7.537641057884897e+17,
"train_loss": 0.06495461261630144,
"train_runtime": 13504.3879,
"train_samples_per_second": 2.083,
"train_steps_per_second": 0.261
}
],
"logging_steps": 10,
"max_steps": 3520,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.537641057884897e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}