svg-gen-weights / refined-7000 /trainer_state.json
kaleidoscopicwhether's picture
Upload refined-7000/trainer_state.json with huggingface_hub
b8eebdb verified
Raw History Blame
208 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.2455734495951596,
"eval_steps": 500,
"global_step": 7000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"entropy": 0.32860654294490815,
"epoch": 0.001779517750689563,
"grad_norm": 0.66015625,
"learning_rate": 8.021390374331552e-08,
"loss": 0.3451235294342041,
"mean_token_accuracy": 0.8844113677740097,
"num_tokens": 57266.0,
"step": 10
},
{
"entropy": 0.36775331050157545,
"epoch": 0.003559035501379126,
"grad_norm": 0.8203125,
"learning_rate": 1.6934046345811053e-07,
"loss": 0.37715222835540774,
"mean_token_accuracy": 0.8700783222913742,
"num_tokens": 121757.0,
"step": 20
},
{
"entropy": 0.3367079794406891,
"epoch": 0.005338553252068689,
"grad_norm": 0.609375,
"learning_rate": 2.584670231729056e-07,
"loss": 0.3503671169281006,
"mean_token_accuracy": 0.8846798032522202,
"num_tokens": 183469.0,
"step": 30
},
{
"entropy": 0.3625075250864029,
"epoch": 0.007118071002758252,
"grad_norm": 0.84765625,
"learning_rate": 3.4759358288770056e-07,
"loss": 0.3748985767364502,
"mean_token_accuracy": 0.8714122384786606,
"num_tokens": 246046.0,
"step": 40
},
{
"entropy": 0.38094038516283035,
"epoch": 0.008897588753447816,
"grad_norm": 0.609375,
"learning_rate": 4.367201426024956e-07,
"loss": 0.3928072452545166,
"mean_token_accuracy": 0.8651866286993026,
"num_tokens": 307119.0,
"step": 50
},
{
"entropy": 0.3649078577756882,
"epoch": 0.010677106504137378,
"grad_norm": 0.8359375,
"learning_rate": 5.258467023172906e-07,
"loss": 0.3773404598236084,
"mean_token_accuracy": 0.8724571585655212,
"num_tokens": 364099.0,
"step": 60
},
{
"entropy": 0.3137588031589985,
"epoch": 0.012456624254826942,
"grad_norm": 0.671875,
"learning_rate": 6.149732620320856e-07,
"loss": 0.3299793481826782,
"mean_token_accuracy": 0.8907061606645584,
"num_tokens": 427925.0,
"step": 70
},
{
"entropy": 0.3294053204357624,
"epoch": 0.014236142005516504,
"grad_norm": 0.70703125,
"learning_rate": 7.040998217468806e-07,
"loss": 0.33570303916931155,
"mean_token_accuracy": 0.8864214718341827,
"num_tokens": 490456.0,
"step": 80
},
{
"entropy": 0.314082407951355,
"epoch": 0.016015659756206068,
"grad_norm": 0.734375,
"learning_rate": 7.932263814616756e-07,
"loss": 0.32135210037231443,
"mean_token_accuracy": 0.8916998952627182,
"num_tokens": 552812.0,
"step": 90
},
{
"entropy": 0.33767677322030065,
"epoch": 0.017795177506895632,
"grad_norm": 0.77734375,
"learning_rate": 8.823529411764707e-07,
"loss": 0.35642199516296386,
"mean_token_accuracy": 0.8808052331209183,
"num_tokens": 610036.0,
"step": 100
},
{
"entropy": 0.33305957317352297,
"epoch": 0.019574695257585196,
"grad_norm": 0.8046875,
"learning_rate": 9.714795008912657e-07,
"loss": 0.34201273918151853,
"mean_token_accuracy": 0.8846908867359161,
"num_tokens": 674910.0,
"step": 110
},
{
"entropy": 0.3495964154601097,
"epoch": 0.021354213008274756,
"grad_norm": 0.65234375,
"learning_rate": 1.0606060606060608e-06,
"loss": 0.35735392570495605,
"mean_token_accuracy": 0.8776104301214218,
"num_tokens": 739088.0,
"step": 120
},
{
"entropy": 0.32690695077180865,
"epoch": 0.02313373075896432,
"grad_norm": 0.703125,
"learning_rate": 1.1497326203208558e-06,
"loss": 0.33275294303894043,
"mean_token_accuracy": 0.8853529244661331,
"num_tokens": 797045.0,
"step": 130
},
{
"entropy": 0.3199396960437298,
"epoch": 0.024913248509653884,
"grad_norm": 0.71484375,
"learning_rate": 1.2388591800356508e-06,
"loss": 0.33289413452148436,
"mean_token_accuracy": 0.8884731292724609,
"num_tokens": 861148.0,
"step": 140
},
{
"entropy": 0.36166896000504495,
"epoch": 0.026692766260343448,
"grad_norm": 0.6953125,
"learning_rate": 1.3279857397504459e-06,
"loss": 0.3732253074645996,
"mean_token_accuracy": 0.8727149099111557,
"num_tokens": 922387.0,
"step": 150
},
{
"entropy": 0.3397223137319088,
"epoch": 0.02847228401103301,
"grad_norm": 0.69140625,
"learning_rate": 1.4171122994652409e-06,
"loss": 0.3498528480529785,
"mean_token_accuracy": 0.8799682438373566,
"num_tokens": 989442.0,
"step": 160
},
{
"entropy": 0.4018726907670498,
"epoch": 0.030251801761722572,
"grad_norm": 0.67578125,
"learning_rate": 1.506238859180036e-06,
"loss": 0.41373891830444337,
"mean_token_accuracy": 0.8603814005851745,
"num_tokens": 1052200.0,
"step": 170
},
{
"entropy": 0.3689358413219452,
"epoch": 0.032031319512412136,
"grad_norm": 0.7109375,
"learning_rate": 1.595365418894831e-06,
"loss": 0.3795238256454468,
"mean_token_accuracy": 0.8720099329948425,
"num_tokens": 1117114.0,
"step": 180
},
{
"entropy": 0.336656229197979,
"epoch": 0.033810837263101697,
"grad_norm": 0.85546875,
"learning_rate": 1.684491978609626e-06,
"loss": 0.34227771759033204,
"mean_token_accuracy": 0.8847573012113571,
"num_tokens": 1176991.0,
"step": 190
},
{
"entropy": 0.3449875839054585,
"epoch": 0.035590355013791264,
"grad_norm": 0.68359375,
"learning_rate": 1.7736185383244208e-06,
"loss": 0.35102674961090086,
"mean_token_accuracy": 0.8801533132791519,
"num_tokens": 1240161.0,
"step": 200
},
{
"entropy": 0.34684649407863616,
"epoch": 0.037369872764480824,
"grad_norm": 0.76171875,
"learning_rate": 1.8627450980392158e-06,
"loss": 0.35135159492492674,
"mean_token_accuracy": 0.8800874263048172,
"num_tokens": 1301036.0,
"step": 210
},
{
"entropy": 0.34509315714240074,
"epoch": 0.03914939051517039,
"grad_norm": 0.890625,
"learning_rate": 1.951871657754011e-06,
"loss": 0.35075480937957765,
"mean_token_accuracy": 0.8830925613641739,
"num_tokens": 1359434.0,
"step": 220
},
{
"entropy": 0.3258862540125847,
"epoch": 0.04092890826585995,
"grad_norm": 0.62109375,
"learning_rate": 2.040998217468806e-06,
"loss": 0.33036489486694337,
"mean_token_accuracy": 0.8877994000911713,
"num_tokens": 1421932.0,
"step": 230
},
{
"entropy": 0.36866824701428413,
"epoch": 0.04270842601654951,
"grad_norm": 0.78125,
"learning_rate": 2.130124777183601e-06,
"loss": 0.3781815767288208,
"mean_token_accuracy": 0.872001588344574,
"num_tokens": 1478613.0,
"step": 240
},
{
"entropy": 0.34916575253009796,
"epoch": 0.04448794376723908,
"grad_norm": 0.703125,
"learning_rate": 2.219251336898396e-06,
"loss": 0.35482115745544435,
"mean_token_accuracy": 0.8789272099733353,
"num_tokens": 1543219.0,
"step": 250
},
{
"entropy": 0.3428291827440262,
"epoch": 0.04626746151792864,
"grad_norm": 0.75390625,
"learning_rate": 2.308377896613191e-06,
"loss": 0.34780704975128174,
"mean_token_accuracy": 0.8816773295402527,
"num_tokens": 1603739.0,
"step": 260
},
{
"entropy": 0.3357290215790272,
"epoch": 0.04804697926861821,
"grad_norm": 0.71875,
"learning_rate": 2.397504456327986e-06,
"loss": 0.34503133296966554,
"mean_token_accuracy": 0.883594223856926,
"num_tokens": 1664090.0,
"step": 270
},
{
"entropy": 0.33964226990938184,
"epoch": 0.04982649701930777,
"grad_norm": 0.6796875,
"learning_rate": 2.486631016042781e-06,
"loss": 0.3491342782974243,
"mean_token_accuracy": 0.8842448592185974,
"num_tokens": 1721928.0,
"step": 280
},
{
"entropy": 0.36515090987086296,
"epoch": 0.05160601476999733,
"grad_norm": 0.76171875,
"learning_rate": 2.575757575757576e-06,
"loss": 0.36740152835845946,
"mean_token_accuracy": 0.8746822863817215,
"num_tokens": 1783971.0,
"step": 290
},
{
"entropy": 0.35400829613208773,
"epoch": 0.053385532520686896,
"grad_norm": 0.58203125,
"learning_rate": 2.664884135472371e-06,
"loss": 0.35753028392791747,
"mean_token_accuracy": 0.8779943257570266,
"num_tokens": 1845602.0,
"step": 300
},
{
"entropy": 0.33071010187268257,
"epoch": 0.055165050271376456,
"grad_norm": 0.72265625,
"learning_rate": 2.754010695187166e-06,
"loss": 0.3346755027770996,
"mean_token_accuracy": 0.8866520315408707,
"num_tokens": 1906484.0,
"step": 310
},
{
"entropy": 0.3566290229558945,
"epoch": 0.05694456802206602,
"grad_norm": 1.015625,
"learning_rate": 2.843137254901961e-06,
"loss": 0.35546977519989015,
"mean_token_accuracy": 0.8784496366977692,
"num_tokens": 1972526.0,
"step": 320
},
{
"entropy": 0.3694092400372028,
"epoch": 0.058724085772755584,
"grad_norm": 0.8515625,
"learning_rate": 2.9322638146167557e-06,
"loss": 0.3756656885147095,
"mean_token_accuracy": 0.8704883366823196,
"num_tokens": 2035521.0,
"step": 330
},
{
"entropy": 0.32793279364705086,
"epoch": 0.060503603523445144,
"grad_norm": 0.74609375,
"learning_rate": 3.0213903743315507e-06,
"loss": 0.3240004539489746,
"mean_token_accuracy": 0.8898506164550781,
"num_tokens": 2097013.0,
"step": 340
},
{
"entropy": 0.3634592294692993,
"epoch": 0.06228312127413471,
"grad_norm": 0.66796875,
"learning_rate": 3.1105169340463458e-06,
"loss": 0.3696018695831299,
"mean_token_accuracy": 0.8732749789953231,
"num_tokens": 2162178.0,
"step": 350
},
{
"entropy": 0.36352587342262266,
"epoch": 0.06406263902482427,
"grad_norm": 0.6640625,
"learning_rate": 3.1996434937611408e-06,
"loss": 0.36823832988739014,
"mean_token_accuracy": 0.8757654964923859,
"num_tokens": 2222991.0,
"step": 360
},
{
"entropy": 0.3474710017442703,
"epoch": 0.06584215677551383,
"grad_norm": 0.71484375,
"learning_rate": 3.288770053475936e-06,
"loss": 0.3531644821166992,
"mean_token_accuracy": 0.8808708101511001,
"num_tokens": 2282984.0,
"step": 370
},
{
"entropy": 0.3589304000139236,
"epoch": 0.06762167452620339,
"grad_norm": 0.84375,
"learning_rate": 3.377896613190731e-06,
"loss": 0.3596966028213501,
"mean_token_accuracy": 0.8770811855792999,
"num_tokens": 2346621.0,
"step": 380
},
{
"entropy": 0.3583641618490219,
"epoch": 0.06940119227689297,
"grad_norm": 0.703125,
"learning_rate": 3.467023172905526e-06,
"loss": 0.363906717300415,
"mean_token_accuracy": 0.8765266954898834,
"num_tokens": 2408410.0,
"step": 390
},
{
"entropy": 0.32061812058091166,
"epoch": 0.07118071002758253,
"grad_norm": 0.75390625,
"learning_rate": 3.556149732620321e-06,
"loss": 0.31879429817199706,
"mean_token_accuracy": 0.8910367012023925,
"num_tokens": 2470599.0,
"step": 400
},
{
"entropy": 0.33497466519474983,
"epoch": 0.07296022777827209,
"grad_norm": 0.59375,
"learning_rate": 3.645276292335116e-06,
"loss": 0.3321577310562134,
"mean_token_accuracy": 0.8880389362573624,
"num_tokens": 2532757.0,
"step": 410
},
{
"entropy": 0.3281519956886768,
"epoch": 0.07473974552896165,
"grad_norm": 0.72265625,
"learning_rate": 3.734402852049911e-06,
"loss": 0.3272218704223633,
"mean_token_accuracy": 0.886707216501236,
"num_tokens": 2594001.0,
"step": 420
},
{
"entropy": 0.37212703600525854,
"epoch": 0.07651926327965121,
"grad_norm": 0.6875,
"learning_rate": 3.8235294117647055e-06,
"loss": 0.373236083984375,
"mean_token_accuracy": 0.8709172129631042,
"num_tokens": 2660336.0,
"step": 430
},
{
"entropy": 0.3637304425239563,
"epoch": 0.07829878103034078,
"grad_norm": 0.8125,
"learning_rate": 3.9126559714795006e-06,
"loss": 0.3628222942352295,
"mean_token_accuracy": 0.8746890932321548,
"num_tokens": 2718351.0,
"step": 440
},
{
"entropy": 0.362768467515707,
"epoch": 0.08007829878103034,
"grad_norm": 0.63671875,
"learning_rate": 4.0017825311942964e-06,
"loss": 0.36104235649108884,
"mean_token_accuracy": 0.878073325753212,
"num_tokens": 2782962.0,
"step": 450
},
{
"entropy": 0.36855516135692595,
"epoch": 0.0818578165317199,
"grad_norm": 0.91015625,
"learning_rate": 4.0909090909090915e-06,
"loss": 0.3710012435913086,
"mean_token_accuracy": 0.8736769735813141,
"num_tokens": 2843229.0,
"step": 460
},
{
"entropy": 0.3541841976344585,
"epoch": 0.08363733428240946,
"grad_norm": 0.703125,
"learning_rate": 4.1800356506238865e-06,
"loss": 0.349487829208374,
"mean_token_accuracy": 0.8802689701318741,
"num_tokens": 2901459.0,
"step": 470
},
{
"entropy": 0.31983906850218774,
"epoch": 0.08541685203309902,
"grad_norm": 0.70703125,
"learning_rate": 4.2691622103386815e-06,
"loss": 0.32067289352416994,
"mean_token_accuracy": 0.8906120359897614,
"num_tokens": 2960388.0,
"step": 480
},
{
"entropy": 0.352615787088871,
"epoch": 0.0871963697837886,
"grad_norm": 0.65234375,
"learning_rate": 4.3582887700534766e-06,
"loss": 0.35637969970703126,
"mean_token_accuracy": 0.8778968840837479,
"num_tokens": 3025772.0,
"step": 490
},
{
"entropy": 0.3554725505411625,
"epoch": 0.08897588753447816,
"grad_norm": 0.53125,
"learning_rate": 4.447415329768272e-06,
"loss": 0.35056004524230955,
"mean_token_accuracy": 0.8800348669290543,
"num_tokens": 3087850.0,
"step": 500
},
{
"entropy": 0.38325470089912417,
"epoch": 0.09075540528516772,
"grad_norm": 0.7109375,
"learning_rate": 4.536541889483067e-06,
"loss": 0.3831326007843018,
"mean_token_accuracy": 0.8683792471885681,
"num_tokens": 3150214.0,
"step": 510
},
{
"entropy": 0.36651182398200033,
"epoch": 0.09253492303585728,
"grad_norm": 0.734375,
"learning_rate": 4.625668449197862e-06,
"loss": 0.37067341804504395,
"mean_token_accuracy": 0.8725595206022263,
"num_tokens": 3211406.0,
"step": 520
},
{
"entropy": 0.3612689882516861,
"epoch": 0.09431444078654684,
"grad_norm": 0.703125,
"learning_rate": 4.714795008912657e-06,
"loss": 0.3517920970916748,
"mean_token_accuracy": 0.8764923334121704,
"num_tokens": 3269507.0,
"step": 530
},
{
"entropy": 0.3587156981229782,
"epoch": 0.09609395853723642,
"grad_norm": 0.5859375,
"learning_rate": 4.803921568627452e-06,
"loss": 0.35204501152038575,
"mean_token_accuracy": 0.8772314876317978,
"num_tokens": 3333240.0,
"step": 540
},
{
"entropy": 0.3636198118329048,
"epoch": 0.09787347628792598,
"grad_norm": 0.76953125,
"learning_rate": 4.893048128342247e-06,
"loss": 0.367664098739624,
"mean_token_accuracy": 0.874831223487854,
"num_tokens": 3392208.0,
"step": 550
},
{
"entropy": 0.3718460865318775,
"epoch": 0.09965299403861554,
"grad_norm": 0.62890625,
"learning_rate": 4.982174688057042e-06,
"loss": 0.3703943729400635,
"mean_token_accuracy": 0.8717885941267014,
"num_tokens": 3453138.0,
"step": 560
},
{
"entropy": 0.37602192610502244,
"epoch": 0.1014325117893051,
"grad_norm": 0.734375,
"learning_rate": 4.999993076457557e-06,
"loss": 0.37216212749481203,
"mean_token_accuracy": 0.8720100283622741,
"num_tokens": 3514781.0,
"step": 570
},
{
"entropy": 0.31663130819797514,
"epoch": 0.10321202953999466,
"grad_norm": 0.6171875,
"learning_rate": 4.9999649496321045e-06,
"loss": 0.3179504871368408,
"mean_token_accuracy": 0.8921509385108948,
"num_tokens": 3577891.0,
"step": 580
},
{
"entropy": 0.3112894132733345,
"epoch": 0.10499154729068423,
"grad_norm": 0.70703125,
"learning_rate": 4.999915187045475e-06,
"loss": 0.3026210069656372,
"mean_token_accuracy": 0.8973556339740754,
"num_tokens": 3639917.0,
"step": 590
},
{
"entropy": 0.33959473818540575,
"epoch": 0.10677106504137379,
"grad_norm": 0.80078125,
"learning_rate": 4.999843789128336e-06,
"loss": 0.33784701824188235,
"mean_token_accuracy": 0.885186767578125,
"num_tokens": 3698607.0,
"step": 600
},
{
"entropy": 0.37242047637701037,
"epoch": 0.10855058279206335,
"grad_norm": 0.88671875,
"learning_rate": 4.999750756498594e-06,
"loss": 0.36487655639648436,
"mean_token_accuracy": 0.8730682343244552,
"num_tokens": 3762523.0,
"step": 610
},
{
"entropy": 0.3216068513691425,
"epoch": 0.11033010054275291,
"grad_norm": 0.72265625,
"learning_rate": 4.999636089961392e-06,
"loss": 0.3243628978729248,
"mean_token_accuracy": 0.8880964249372483,
"num_tokens": 3824182.0,
"step": 620
},
{
"entropy": 0.32486376315355303,
"epoch": 0.11210961829344247,
"grad_norm": 0.6484375,
"learning_rate": 4.999499790509106e-06,
"loss": 0.3245402336120605,
"mean_token_accuracy": 0.8889100551605225,
"num_tokens": 3885170.0,
"step": 630
},
{
"entropy": 0.3441788099706173,
"epoch": 0.11388913604413203,
"grad_norm": 0.62890625,
"learning_rate": 4.999341859321326e-06,
"loss": 0.34557857513427737,
"mean_token_accuracy": 0.8842501014471054,
"num_tokens": 3948373.0,
"step": 640
},
{
"entropy": 0.38801722079515455,
"epoch": 0.11566865379482161,
"grad_norm": 0.71875,
"learning_rate": 4.99916229776486e-06,
"loss": 0.3799426078796387,
"mean_token_accuracy": 0.8673164427280426,
"num_tokens": 4011902.0,
"step": 650
},
{
"entropy": 0.3308356985449791,
"epoch": 0.11744817154551117,
"grad_norm": 0.59765625,
"learning_rate": 4.998961107393706e-06,
"loss": 0.33188343048095703,
"mean_token_accuracy": 0.8888141304254532,
"num_tokens": 4072647.0,
"step": 660
},
{
"entropy": 0.3120661698281765,
"epoch": 0.11922768929620073,
"grad_norm": 0.66015625,
"learning_rate": 4.998738289949054e-06,
"loss": 0.3126791000366211,
"mean_token_accuracy": 0.8948039174079895,
"num_tokens": 4133439.0,
"step": 670
},
{
"entropy": 0.33610115870833396,
"epoch": 0.12100720704689029,
"grad_norm": 0.6171875,
"learning_rate": 4.99849384735926e-06,
"loss": 0.3356921911239624,
"mean_token_accuracy": 0.8878594189882278,
"num_tokens": 4195834.0,
"step": 680
},
{
"entropy": 0.34462174475193025,
"epoch": 0.12278672479757985,
"grad_norm": 0.7109375,
"learning_rate": 4.998227781739834e-06,
"loss": 0.35248551368713377,
"mean_token_accuracy": 0.8806085497140884,
"num_tokens": 4258965.0,
"step": 690
},
{
"entropy": 0.30714038833975793,
"epoch": 0.12456624254826942,
"grad_norm": 0.6171875,
"learning_rate": 4.997940095393421e-06,
"loss": 0.3035902500152588,
"mean_token_accuracy": 0.8958918929100037,
"num_tokens": 4321451.0,
"step": 700
},
{
"entropy": 0.3459739051759243,
"epoch": 0.12634576029895897,
"grad_norm": 0.71875,
"learning_rate": 4.9976307908097825e-06,
"loss": 0.3412956476211548,
"mean_token_accuracy": 0.8821541339159011,
"num_tokens": 4382544.0,
"step": 710
},
{
"entropy": 0.34615052714943884,
"epoch": 0.12812527804964854,
"grad_norm": 0.625,
"learning_rate": 4.997299870665771e-06,
"loss": 0.34567866325378416,
"mean_token_accuracy": 0.8812555313110352,
"num_tokens": 4447104.0,
"step": 720
},
{
"entropy": 0.31227469965815546,
"epoch": 0.12990479580033812,
"grad_norm": 0.60546875,
"learning_rate": 4.9969473378253096e-06,
"loss": 0.3131171703338623,
"mean_token_accuracy": 0.8943297117948532,
"num_tokens": 4509464.0,
"step": 730
},
{
"entropy": 0.33893360793590543,
"epoch": 0.13168431355102767,
"grad_norm": 0.67578125,
"learning_rate": 4.996573195339369e-06,
"loss": 0.3371562480926514,
"mean_token_accuracy": 0.8841905981302262,
"num_tokens": 4572522.0,
"step": 740
},
{
"entropy": 0.3381062112748623,
"epoch": 0.13346383130171724,
"grad_norm": 0.69140625,
"learning_rate": 4.996177446445938e-06,
"loss": 0.3396785020828247,
"mean_token_accuracy": 0.8838836699724197,
"num_tokens": 4634676.0,
"step": 750
},
{
"entropy": 0.34179429709911346,
"epoch": 0.13524334905240679,
"grad_norm": 0.6875,
"learning_rate": 4.995760094569994e-06,
"loss": 0.3441832780838013,
"mean_token_accuracy": 0.8860727399587631,
"num_tokens": 4694079.0,
"step": 760
},
{
"entropy": 0.3321096934378147,
"epoch": 0.13702286680309636,
"grad_norm": 0.78125,
"learning_rate": 4.995321143323479e-06,
"loss": 0.32719078063964846,
"mean_token_accuracy": 0.8888979554176331,
"num_tokens": 4755795.0,
"step": 770
},
{
"entropy": 0.3038732573390007,
"epoch": 0.13880238455378593,
"grad_norm": 0.56640625,
"learning_rate": 4.9948605965052645e-06,
"loss": 0.30793750286102295,
"mean_token_accuracy": 0.8963340222835541,
"num_tokens": 4818297.0,
"step": 780
},
{
"entropy": 0.3286074362695217,
"epoch": 0.14058190230447548,
"grad_norm": 0.65234375,
"learning_rate": 4.9943784581011175e-06,
"loss": 0.32923245429992676,
"mean_token_accuracy": 0.8867094904184342,
"num_tokens": 4879989.0,
"step": 790
},
{
"entropy": 0.32576177939772605,
"epoch": 0.14236142005516506,
"grad_norm": 0.671875,
"learning_rate": 4.99387473228367e-06,
"loss": 0.3253772735595703,
"mean_token_accuracy": 0.8897351205348969,
"num_tokens": 4938072.0,
"step": 800
},
{
"entropy": 0.34196730256080626,
"epoch": 0.1441409378058546,
"grad_norm": 0.70703125,
"learning_rate": 4.99334942341238e-06,
"loss": 0.3411428213119507,
"mean_token_accuracy": 0.8838056415319443,
"num_tokens": 5003090.0,
"step": 810
},
{
"entropy": 0.32348892390727996,
"epoch": 0.14592045555654418,
"grad_norm": 0.8515625,
"learning_rate": 4.992802536033493e-06,
"loss": 0.3214717388153076,
"mean_token_accuracy": 0.8909420162439347,
"num_tokens": 5062779.0,
"step": 820
},
{
"entropy": 0.31705158203840256,
"epoch": 0.14769997330723375,
"grad_norm": 0.65625,
"learning_rate": 4.992234074880007e-06,
"loss": 0.31249897480010985,
"mean_token_accuracy": 0.8924014419317245,
"num_tokens": 5125993.0,
"step": 830
},
{
"entropy": 0.33678495436906813,
"epoch": 0.1494794910579233,
"grad_norm": 0.75,
"learning_rate": 4.991644044871624e-06,
"loss": 0.3350341320037842,
"mean_token_accuracy": 0.886579817533493,
"num_tokens": 5185153.0,
"step": 840
},
{
"entropy": 0.3404834918677807,
"epoch": 0.15125900880861287,
"grad_norm": 0.71875,
"learning_rate": 4.991032451114718e-06,
"loss": 0.33901474475860593,
"mean_token_accuracy": 0.8847116142511368,
"num_tokens": 5243157.0,
"step": 850
},
{
"entropy": 0.34688328504562377,
"epoch": 0.15303852655930242,
"grad_norm": 0.765625,
"learning_rate": 4.99039929890228e-06,
"loss": 0.3511410474777222,
"mean_token_accuracy": 0.8813301533460617,
"num_tokens": 5304289.0,
"step": 860
},
{
"entropy": 0.3682398319244385,
"epoch": 0.154818044309992,
"grad_norm": 0.8671875,
"learning_rate": 4.98974459371388e-06,
"loss": 0.3656897783279419,
"mean_token_accuracy": 0.8737188547849655,
"num_tokens": 5363495.0,
"step": 870
},
{
"entropy": 0.32507713288068774,
"epoch": 0.15659756206068157,
"grad_norm": 0.6875,
"learning_rate": 4.989068341215614e-06,
"loss": 0.3258590459823608,
"mean_token_accuracy": 0.8897632241249085,
"num_tokens": 5424926.0,
"step": 880
},
{
"entropy": 0.3301582373678684,
"epoch": 0.1583770798113711,
"grad_norm": 0.671875,
"learning_rate": 4.988370547260061e-06,
"loss": 0.32994065284729,
"mean_token_accuracy": 0.8885752320289612,
"num_tokens": 5484660.0,
"step": 890
},
{
"entropy": 0.34138462543487547,
"epoch": 0.1601565975620607,
"grad_norm": 0.8671875,
"learning_rate": 4.987651217886224e-06,
"loss": 0.34539155960083007,
"mean_token_accuracy": 0.8832982778549194,
"num_tokens": 5545675.0,
"step": 900
},
{
"entropy": 0.36235514357686044,
"epoch": 0.16193611531275023,
"grad_norm": 0.625,
"learning_rate": 4.9869103593194894e-06,
"loss": 0.363956618309021,
"mean_token_accuracy": 0.875393170118332,
"num_tokens": 5610896.0,
"step": 910
},
{
"entropy": 0.36212055906653406,
"epoch": 0.1637156330634398,
"grad_norm": 0.56640625,
"learning_rate": 4.986147977971561e-06,
"loss": 0.36235148906707765,
"mean_token_accuracy": 0.8764902263879776,
"num_tokens": 5674734.0,
"step": 920
},
{
"entropy": 0.3347547046840191,
"epoch": 0.16549515081412938,
"grad_norm": 0.74609375,
"learning_rate": 4.9853640804404104e-06,
"loss": 0.3336197376251221,
"mean_token_accuracy": 0.8846198499202729,
"num_tokens": 5736887.0,
"step": 930
},
{
"entropy": 0.35137743279337885,
"epoch": 0.16727466856481893,
"grad_norm": 0.765625,
"learning_rate": 4.984558673510222e-06,
"loss": 0.3512239694595337,
"mean_token_accuracy": 0.8809666991233825,
"num_tokens": 5800431.0,
"step": 940
},
{
"entropy": 0.36991714164614675,
"epoch": 0.1690541863155085,
"grad_norm": 0.578125,
"learning_rate": 4.983731764151331e-06,
"loss": 0.3648236751556396,
"mean_token_accuracy": 0.872578826546669,
"num_tokens": 5864625.0,
"step": 950
},
{
"entropy": 0.372380468249321,
"epoch": 0.17083370406619805,
"grad_norm": 0.625,
"learning_rate": 4.982883359520161e-06,
"loss": 0.3735220432281494,
"mean_token_accuracy": 0.8743737578392029,
"num_tokens": 5925995.0,
"step": 960
},
{
"entropy": 0.3446674205362797,
"epoch": 0.17261322181688762,
"grad_norm": 0.8203125,
"learning_rate": 4.982013466959168e-06,
"loss": 0.342392635345459,
"mean_token_accuracy": 0.8822812139987946,
"num_tokens": 5986238.0,
"step": 970
},
{
"entropy": 0.3643321067094803,
"epoch": 0.1743927395675772,
"grad_norm": 0.6953125,
"learning_rate": 4.981122093996773e-06,
"loss": 0.3641793727874756,
"mean_token_accuracy": 0.8761126190423966,
"num_tokens": 6050464.0,
"step": 980
},
{
"entropy": 0.3827708475291729,
"epoch": 0.17617225731826675,
"grad_norm": 0.80859375,
"learning_rate": 4.980209248347298e-06,
"loss": 0.3844141483306885,
"mean_token_accuracy": 0.8680972456932068,
"num_tokens": 6114918.0,
"step": 990
},
{
"entropy": 0.37099524289369584,
"epoch": 0.17795177506895632,
"grad_norm": 0.6953125,
"learning_rate": 4.979274937910895e-06,
"loss": 0.3674487829208374,
"mean_token_accuracy": 0.8729879707098007,
"num_tokens": 6177018.0,
"step": 1000
},
{
"entropy": 0.3705143555998802,
"epoch": 0.17973129281964587,
"grad_norm": 0.62890625,
"learning_rate": 4.978319170773488e-06,
"loss": 0.3721202850341797,
"mean_token_accuracy": 0.8721451342105866,
"num_tokens": 6242740.0,
"step": 1010
},
{
"entropy": 0.3682974562048912,
"epoch": 0.18151081057033544,
"grad_norm": 0.63671875,
"learning_rate": 4.977341955206689e-06,
"loss": 0.3687538385391235,
"mean_token_accuracy": 0.8741728305816651,
"num_tokens": 6301824.0,
"step": 1020
},
{
"entropy": 0.36520232632756233,
"epoch": 0.18329032832102501,
"grad_norm": 0.69140625,
"learning_rate": 4.976343299667741e-06,
"loss": 0.3612216949462891,
"mean_token_accuracy": 0.8743625104427337,
"num_tokens": 6365400.0,
"step": 1030
},
{
"entropy": 0.3570800118148327,
"epoch": 0.18506984607171456,
"grad_norm": 0.7109375,
"learning_rate": 4.9753232127994335e-06,
"loss": 0.36236867904663084,
"mean_token_accuracy": 0.8769843101501464,
"num_tokens": 6425106.0,
"step": 1040
},
{
"entropy": 0.3267357312142849,
"epoch": 0.18684936382240414,
"grad_norm": 0.8359375,
"learning_rate": 4.97428170343003e-06,
"loss": 0.32154016494750975,
"mean_token_accuracy": 0.8914269268512726,
"num_tokens": 6483594.0,
"step": 1050
},
{
"entropy": 0.3283110834658146,
"epoch": 0.18862888157309368,
"grad_norm": 0.62890625,
"learning_rate": 4.9732187805732e-06,
"loss": 0.33000481128692627,
"mean_token_accuracy": 0.8866576731204987,
"num_tokens": 6543496.0,
"step": 1060
},
{
"entropy": 0.32734011188149453,
"epoch": 0.19040839932378326,
"grad_norm": 0.7265625,
"learning_rate": 4.972134453427927e-06,
"loss": 0.32063271999359133,
"mean_token_accuracy": 0.8897162199020385,
"num_tokens": 6604883.0,
"step": 1070
},
{
"entropy": 0.349535646289587,
"epoch": 0.19218791707447283,
"grad_norm": 0.64453125,
"learning_rate": 4.971028731378442e-06,
"loss": 0.3478975772857666,
"mean_token_accuracy": 0.8818371266126632,
"num_tokens": 6667036.0,
"step": 1080
},
{
"entropy": 0.3681590139865875,
"epoch": 0.19396743482516238,
"grad_norm": 0.68359375,
"learning_rate": 4.969901623994134e-06,
"loss": 0.3665482997894287,
"mean_token_accuracy": 0.8735427498817444,
"num_tokens": 6728877.0,
"step": 1090
},
{
"entropy": 0.355544650554657,
"epoch": 0.19574695257585195,
"grad_norm": 0.64453125,
"learning_rate": 4.96875314102947e-06,
"loss": 0.3588836908340454,
"mean_token_accuracy": 0.8779933214187622,
"num_tokens": 6794282.0,
"step": 1100
},
{
"entropy": 0.3351004049181938,
"epoch": 0.1975264703265415,
"grad_norm": 0.65625,
"learning_rate": 4.96758329242391e-06,
"loss": 0.3310875415802002,
"mean_token_accuracy": 0.8859479904174805,
"num_tokens": 6855987.0,
"step": 1110
},
{
"entropy": 0.33845237344503404,
"epoch": 0.19930598807723107,
"grad_norm": 0.69921875,
"learning_rate": 4.966392088301824e-06,
"loss": 0.3350287199020386,
"mean_token_accuracy": 0.8866452574729919,
"num_tokens": 6913703.0,
"step": 1120
},
{
"entropy": 0.35912709310650826,
"epoch": 0.20108550582792065,
"grad_norm": 0.64453125,
"learning_rate": 4.965179538972398e-06,
"loss": 0.3584477424621582,
"mean_token_accuracy": 0.8762081295251847,
"num_tokens": 6975679.0,
"step": 1130
},
{
"entropy": 0.3545367069542408,
"epoch": 0.2028650235786102,
"grad_norm": 0.60546875,
"learning_rate": 4.96394565492955e-06,
"loss": 0.3520219326019287,
"mean_token_accuracy": 0.879888191819191,
"num_tokens": 7041387.0,
"step": 1140
},
{
"entropy": 0.32186701744794843,
"epoch": 0.20464454132929977,
"grad_norm": 0.84765625,
"learning_rate": 4.9626904468518375e-06,
"loss": 0.32150495052337646,
"mean_token_accuracy": 0.8912828594446183,
"num_tokens": 7099844.0,
"step": 1150
},
{
"entropy": 0.3193527065217495,
"epoch": 0.2064240590799893,
"grad_norm": 0.69921875,
"learning_rate": 4.9614139256023675e-06,
"loss": 0.3173349380493164,
"mean_token_accuracy": 0.8930199146270752,
"num_tokens": 7161967.0,
"step": 1160
},
{
"entropy": 0.3055750854313374,
"epoch": 0.2082035768306789,
"grad_norm": 0.71875,
"learning_rate": 4.960116102228698e-06,
"loss": 0.30236110687255857,
"mean_token_accuracy": 0.8975043594837189,
"num_tokens": 7226293.0,
"step": 1170
},
{
"entropy": 0.359158656001091,
"epoch": 0.20998309458136846,
"grad_norm": 0.703125,
"learning_rate": 4.958796987962744e-06,
"loss": 0.3596051216125488,
"mean_token_accuracy": 0.8766287654638291,
"num_tokens": 7288533.0,
"step": 1180
},
{
"entropy": 0.35056099519133566,
"epoch": 0.211762612332058,
"grad_norm": 0.765625,
"learning_rate": 4.957456594220683e-06,
"loss": 0.3551358222961426,
"mean_token_accuracy": 0.8771712720394135,
"num_tokens": 7348922.0,
"step": 1190
},
{
"entropy": 0.363479994982481,
"epoch": 0.21354213008274758,
"grad_norm": 0.7578125,
"learning_rate": 4.9560949326028525e-06,
"loss": 0.36165242195129393,
"mean_token_accuracy": 0.8759845823049546,
"num_tokens": 7411538.0,
"step": 1200
},
{
"entropy": 0.3278110012412071,
"epoch": 0.21532164783343713,
"grad_norm": 0.69140625,
"learning_rate": 4.9547120148936536e-06,
"loss": 0.3194319486618042,
"mean_token_accuracy": 0.8892217814922333,
"num_tokens": 7470626.0,
"step": 1210
},
{
"entropy": 0.3295983076095581,
"epoch": 0.2171011655841267,
"grad_norm": 0.640625,
"learning_rate": 4.953307853061442e-06,
"loss": 0.3254989147186279,
"mean_token_accuracy": 0.8889990836381912,
"num_tokens": 7532623.0,
"step": 1220
},
{
"entropy": 0.32711055055260657,
"epoch": 0.21888068333481628,
"grad_norm": 0.765625,
"learning_rate": 4.951882459258436e-06,
"loss": 0.3261944055557251,
"mean_token_accuracy": 0.890270671248436,
"num_tokens": 7591039.0,
"step": 1230
},
{
"entropy": 0.34457680508494376,
"epoch": 0.22066020108550582,
"grad_norm": 0.67578125,
"learning_rate": 4.950435845820597e-06,
"loss": 0.3495792865753174,
"mean_token_accuracy": 0.8818086802959442,
"num_tokens": 7653227.0,
"step": 1240
},
{
"entropy": 0.36603510081768037,
"epoch": 0.2224397188361954,
"grad_norm": 1.0703125,
"learning_rate": 4.948968025267534e-06,
"loss": 0.37048428058624266,
"mean_token_accuracy": 0.8737892299890518,
"num_tokens": 7717371.0,
"step": 1250
},
{
"entropy": 0.3249411962926388,
"epoch": 0.22421923658688495,
"grad_norm": 0.6328125,
"learning_rate": 4.947479010302394e-06,
"loss": 0.31585373878479006,
"mean_token_accuracy": 0.8901617139577865,
"num_tokens": 7779979.0,
"step": 1260
},
{
"entropy": 0.3602518759667873,
"epoch": 0.22599875433757452,
"grad_norm": 0.6875,
"learning_rate": 4.945968813811743e-06,
"loss": 0.35553271770477296,
"mean_token_accuracy": 0.8786407887935639,
"num_tokens": 7841977.0,
"step": 1270
},
{
"entropy": 0.3251481633633375,
"epoch": 0.22777827208826407,
"grad_norm": 0.68359375,
"learning_rate": 4.944437448865468e-06,
"loss": 0.3293075799942017,
"mean_token_accuracy": 0.8870137929916382,
"num_tokens": 7902777.0,
"step": 1280
},
{
"entropy": 0.32949518635869024,
"epoch": 0.22955778983895364,
"grad_norm": 0.6796875,
"learning_rate": 4.94288492871665e-06,
"loss": 0.3253596544265747,
"mean_token_accuracy": 0.8879867672920227,
"num_tokens": 7958535.0,
"step": 1290
},
{
"entropy": 0.3546779818832874,
"epoch": 0.23133730758964322,
"grad_norm": 0.72265625,
"learning_rate": 4.941311266801462e-06,
"loss": 0.35248827934265137,
"mean_token_accuracy": 0.8797136694192886,
"num_tokens": 8020338.0,
"step": 1300
},
{
"entropy": 0.35714430510997774,
"epoch": 0.23311682534033276,
"grad_norm": 0.61328125,
"learning_rate": 4.939716476739042e-06,
"loss": 0.36020400524139407,
"mean_token_accuracy": 0.8753003060817719,
"num_tokens": 8089684.0,
"step": 1310
},
{
"entropy": 0.34758463129401207,
"epoch": 0.23489634309102234,
"grad_norm": 0.55078125,
"learning_rate": 4.938100572331384e-06,
"loss": 0.34348084926605227,
"mean_token_accuracy": 0.8812217116355896,
"num_tokens": 8150210.0,
"step": 1320
},
{
"entropy": 0.3492201082408428,
"epoch": 0.23667586084171188,
"grad_norm": 0.7734375,
"learning_rate": 4.936463567563212e-06,
"loss": 0.3508707284927368,
"mean_token_accuracy": 0.8796630859375,
"num_tokens": 8213931.0,
"step": 1330
},
{
"entropy": 0.2918191090226173,
"epoch": 0.23845537859240146,
"grad_norm": 0.609375,
"learning_rate": 4.934805476601863e-06,
"loss": 0.28566529750823977,
"mean_token_accuracy": 0.9024482190608978,
"num_tokens": 8274417.0,
"step": 1340
},
{
"entropy": 0.34032377898693084,
"epoch": 0.24023489634309103,
"grad_norm": 0.7578125,
"learning_rate": 4.933126313797162e-06,
"loss": 0.3370128870010376,
"mean_token_accuracy": 0.8844573050737381,
"num_tokens": 8336511.0,
"step": 1350
},
{
"entropy": 0.34856711626052855,
"epoch": 0.24201441409378058,
"grad_norm": 0.7734375,
"learning_rate": 4.931426093681299e-06,
"loss": 0.34914212226867675,
"mean_token_accuracy": 0.8811052054166794,
"num_tokens": 8394584.0,
"step": 1360
},
{
"entropy": 0.344535905867815,
"epoch": 0.24379393184447015,
"grad_norm": 0.734375,
"learning_rate": 4.929704830968701e-06,
"loss": 0.3417734384536743,
"mean_token_accuracy": 0.8823099106550216,
"num_tokens": 8456951.0,
"step": 1370
},
{
"entropy": 0.3138051092624664,
"epoch": 0.2455734495951597,
"grad_norm": 0.6640625,
"learning_rate": 4.92796254055591e-06,
"loss": 0.3099043369293213,
"mean_token_accuracy": 0.8950312793254852,
"num_tokens": 8517822.0,
"step": 1380
},
{
"entropy": 0.3473027817904949,
"epoch": 0.24735296734584927,
"grad_norm": 0.7265625,
"learning_rate": 4.9261992375214505e-06,
"loss": 0.3471287488937378,
"mean_token_accuracy": 0.8811825692653656,
"num_tokens": 8577748.0,
"step": 1390
},
{
"entropy": 0.32695212215185165,
"epoch": 0.24913248509653885,
"grad_norm": 0.65625,
"learning_rate": 4.924414937125696e-06,
"loss": 0.32487173080444337,
"mean_token_accuracy": 0.8902322620153427,
"num_tokens": 8638315.0,
"step": 1400
},
{
"entropy": 0.32407406345009804,
"epoch": 0.2509120028472284,
"grad_norm": 0.73828125,
"learning_rate": 4.9226096548107424e-06,
"loss": 0.323284649848938,
"mean_token_accuracy": 0.8886490374803543,
"num_tokens": 8702290.0,
"step": 1410
},
{
"entropy": 0.3179707109928131,
"epoch": 0.25269152059791794,
"grad_norm": 0.7578125,
"learning_rate": 4.9207834062002705e-06,
"loss": 0.31603007316589354,
"mean_token_accuracy": 0.8939002990722656,
"num_tokens": 8765012.0,
"step": 1420
},
{
"entropy": 0.34799565374851227,
"epoch": 0.2544710383486075,
"grad_norm": 0.6796875,
"learning_rate": 4.918936207099415e-06,
"loss": 0.345632004737854,
"mean_token_accuracy": 0.8794914275407791,
"num_tokens": 8824255.0,
"step": 1430
},
{
"entropy": 0.33373049572110175,
"epoch": 0.2562505560992971,
"grad_norm": 0.7265625,
"learning_rate": 4.917068073494623e-06,
"loss": 0.33630125522613524,
"mean_token_accuracy": 0.8856493443250656,
"num_tokens": 8886872.0,
"step": 1440
},
{
"entropy": 0.3084383949637413,
"epoch": 0.25803007384998666,
"grad_norm": 0.796875,
"learning_rate": 4.915179021553517e-06,
"loss": 0.30646114349365233,
"mean_token_accuracy": 0.8949905663728714,
"num_tokens": 8948591.0,
"step": 1450
},
{
"entropy": 0.35163264274597167,
"epoch": 0.25980959160067624,
"grad_norm": 0.5390625,
"learning_rate": 4.913269067624759e-06,
"loss": 0.3483644247055054,
"mean_token_accuracy": 0.8794255912303924,
"num_tokens": 9013038.0,
"step": 1460
},
{
"entropy": 0.34737343341112137,
"epoch": 0.26158910935136576,
"grad_norm": 0.7734375,
"learning_rate": 4.911338228237902e-06,
"loss": 0.349657940864563,
"mean_token_accuracy": 0.8800763636827469,
"num_tokens": 9077200.0,
"step": 1470
},
{
"entropy": 0.35392927601933477,
"epoch": 0.26336862710205533,
"grad_norm": 0.80078125,
"learning_rate": 4.9093865201032535e-06,
"loss": 0.34874787330627444,
"mean_token_accuracy": 0.8790768623352051,
"num_tokens": 9139270.0,
"step": 1480
},
{
"entropy": 0.34402855336666105,
"epoch": 0.2651481448527449,
"grad_norm": 0.78515625,
"learning_rate": 4.907413960111724e-06,
"loss": 0.3440460443496704,
"mean_token_accuracy": 0.8829056441783905,
"num_tokens": 9198774.0,
"step": 1490
},
{
"entropy": 0.31694235652685165,
"epoch": 0.2669276626034345,
"grad_norm": 0.59375,
"learning_rate": 4.905420565334691e-06,
"loss": 0.316249942779541,
"mean_token_accuracy": 0.8927689224481583,
"num_tokens": 9261123.0,
"step": 1500
},
{
"entropy": 0.34790945053100586,
"epoch": 0.26870718035412405,
"grad_norm": 0.7109375,
"learning_rate": 4.90340635302384e-06,
"loss": 0.34010930061340333,
"mean_token_accuracy": 0.8813382595777511,
"num_tokens": 9323313.0,
"step": 1510
},
{
"entropy": 0.32182413190603254,
"epoch": 0.27048669810481357,
"grad_norm": 0.58203125,
"learning_rate": 4.901371340611022e-06,
"loss": 0.3174512147903442,
"mean_token_accuracy": 0.8898768603801728,
"num_tokens": 9385000.0,
"step": 1520
},
{
"entropy": 0.3206692963838577,
"epoch": 0.27226621585550315,
"grad_norm": 0.65234375,
"learning_rate": 4.899315545708101e-06,
"loss": 0.3174994468688965,
"mean_token_accuracy": 0.8910428583621979,
"num_tokens": 9446100.0,
"step": 1530
},
{
"entropy": 0.3739303767681122,
"epoch": 0.2740457336061927,
"grad_norm": 0.81640625,
"learning_rate": 4.897238986106802e-06,
"loss": 0.3766570329666138,
"mean_token_accuracy": 0.871484300494194,
"num_tokens": 9507018.0,
"step": 1540
},
{
"entropy": 0.3343030124902725,
"epoch": 0.2758252513568823,
"grad_norm": 0.65625,
"learning_rate": 4.895141679778555e-06,
"loss": 0.3347424030303955,
"mean_token_accuracy": 0.8854434341192245,
"num_tokens": 9570809.0,
"step": 1550
},
{
"entropy": 0.33370912820100784,
"epoch": 0.27760476910757187,
"grad_norm": 0.82421875,
"learning_rate": 4.893023644874342e-06,
"loss": 0.3346064805984497,
"mean_token_accuracy": 0.88556567132473,
"num_tokens": 9631113.0,
"step": 1560
},
{
"entropy": 0.32370079308748245,
"epoch": 0.2793842868582614,
"grad_norm": 0.68359375,
"learning_rate": 4.8908848997245406e-06,
"loss": 0.3189136028289795,
"mean_token_accuracy": 0.8896129339933395,
"num_tokens": 9692380.0,
"step": 1570
},
{
"entropy": 0.3607430763542652,
"epoch": 0.28116380460895096,
"grad_norm": 0.73046875,
"learning_rate": 4.8887254628387605e-06,
"loss": 0.36515631675720217,
"mean_token_accuracy": 0.8758651137351989,
"num_tokens": 9752341.0,
"step": 1580
},
{
"entropy": 0.3484156712889671,
"epoch": 0.28294332235964054,
"grad_norm": 0.83984375,
"learning_rate": 4.886545352905689e-06,
"loss": 0.34550859928131106,
"mean_token_accuracy": 0.880357900261879,
"num_tokens": 9812558.0,
"step": 1590
},
{
"entropy": 0.3640738561749458,
"epoch": 0.2847228401103301,
"grad_norm": 0.703125,
"learning_rate": 4.884344588792926e-06,
"loss": 0.3594943046569824,
"mean_token_accuracy": 0.8773774594068527,
"num_tokens": 9874489.0,
"step": 1600
},
{
"entropy": 0.32436888590455054,
"epoch": 0.2865023578610197,
"grad_norm": 0.76953125,
"learning_rate": 4.8821231895468194e-06,
"loss": 0.3241907835006714,
"mean_token_accuracy": 0.8908619105815887,
"num_tokens": 9935280.0,
"step": 1610
},
{
"entropy": 0.3490560226142406,
"epoch": 0.2882818756117092,
"grad_norm": 0.65234375,
"learning_rate": 4.879881174392304e-06,
"loss": 0.3519246578216553,
"mean_token_accuracy": 0.8806601613759995,
"num_tokens": 9999329.0,
"step": 1620
},
{
"entropy": 0.3112804345786572,
"epoch": 0.2900613933623988,
"grad_norm": 0.7890625,
"learning_rate": 4.877618562732737e-06,
"loss": 0.309645938873291,
"mean_token_accuracy": 0.8948357462882995,
"num_tokens": 10059956.0,
"step": 1630
},
{
"entropy": 0.35570081174373624,
"epoch": 0.29184091111308835,
"grad_norm": 0.66015625,
"learning_rate": 4.87533537414972e-06,
"loss": 0.35082881450653075,
"mean_token_accuracy": 0.8796282052993775,
"num_tokens": 10125774.0,
"step": 1640
},
{
"entropy": 0.33492894992232325,
"epoch": 0.2936204288637779,
"grad_norm": 0.69921875,
"learning_rate": 4.873031628402941e-06,
"loss": 0.33243823051452637,
"mean_token_accuracy": 0.8872773289680481,
"num_tokens": 10180596.0,
"step": 1650
},
{
"entropy": 0.34505835101008414,
"epoch": 0.2953999466144675,
"grad_norm": 0.58203125,
"learning_rate": 4.870707345429995e-06,
"loss": 0.3442118167877197,
"mean_token_accuracy": 0.8813025206327438,
"num_tokens": 10243696.0,
"step": 1660
},
{
"entropy": 0.3607618987560272,
"epoch": 0.297179464365157,
"grad_norm": 0.6953125,
"learning_rate": 4.868362545346218e-06,
"loss": 0.3578464984893799,
"mean_token_accuracy": 0.8750995457172394,
"num_tokens": 10307824.0,
"step": 1670
},
{
"entropy": 0.3360280990600586,
"epoch": 0.2989589821158466,
"grad_norm": 0.828125,
"learning_rate": 4.8659972484445075e-06,
"loss": 0.3439199209213257,
"mean_token_accuracy": 0.8848895847797393,
"num_tokens": 10371246.0,
"step": 1680
},
{
"entropy": 0.35932715237140656,
"epoch": 0.30073849986653617,
"grad_norm": 0.75,
"learning_rate": 4.86361147519515e-06,
"loss": 0.3583080768585205,
"mean_token_accuracy": 0.8771767407655716,
"num_tokens": 10435217.0,
"step": 1690
},
{
"entropy": 0.2974402904510498,
"epoch": 0.30251801761722574,
"grad_norm": 0.6640625,
"learning_rate": 4.861205246245644e-06,
"loss": 0.293239951133728,
"mean_token_accuracy": 0.9000806957483292,
"num_tokens": 10497897.0,
"step": 1700
},
{
"entropy": 0.31142097115516665,
"epoch": 0.3042975353679153,
"grad_norm": 0.6953125,
"learning_rate": 4.858778582420518e-06,
"loss": 0.3049384355545044,
"mean_token_accuracy": 0.8945723801851273,
"num_tokens": 10557156.0,
"step": 1710
},
{
"entropy": 0.34288675934076307,
"epoch": 0.30607705311860484,
"grad_norm": 0.70703125,
"learning_rate": 4.856331504721155e-06,
"loss": 0.3384895324707031,
"mean_token_accuracy": 0.8817587107419967,
"num_tokens": 10620371.0,
"step": 1720
},
{
"entropy": 0.3216023348271847,
"epoch": 0.3078565708692944,
"grad_norm": 0.73046875,
"learning_rate": 4.853864034325607e-06,
"loss": 0.32592010498046875,
"mean_token_accuracy": 0.8908518970012664,
"num_tokens": 10683261.0,
"step": 1730
},
{
"entropy": 0.35577383637428284,
"epoch": 0.309636088619984,
"grad_norm": 0.734375,
"learning_rate": 4.851376192588414e-06,
"loss": 0.3577617406845093,
"mean_token_accuracy": 0.8777815222740173,
"num_tokens": 10742889.0,
"step": 1740
},
{
"entropy": 0.3348899021744728,
"epoch": 0.31141560637067356,
"grad_norm": 0.78515625,
"learning_rate": 4.848868001040418e-06,
"loss": 0.3364445447921753,
"mean_token_accuracy": 0.8849860787391662,
"num_tokens": 10803959.0,
"step": 1750
},
{
"entropy": 0.36029330268502235,
"epoch": 0.31319512412136313,
"grad_norm": 0.63671875,
"learning_rate": 4.8463394813885756e-06,
"loss": 0.36600594520568847,
"mean_token_accuracy": 0.8759031504392624,
"num_tokens": 10865189.0,
"step": 1760
},
{
"entropy": 0.3618343710899353,
"epoch": 0.31497464187205265,
"grad_norm": 0.69140625,
"learning_rate": 4.843790655515773e-06,
"loss": 0.3588868141174316,
"mean_token_accuracy": 0.8754674553871155,
"num_tokens": 10925462.0,
"step": 1770
},
{
"entropy": 0.36530629023909567,
"epoch": 0.3167541596227422,
"grad_norm": 0.77734375,
"learning_rate": 4.8412215454806345e-06,
"loss": 0.36326096057891843,
"mean_token_accuracy": 0.8759878039360046,
"num_tokens": 10989818.0,
"step": 1780
},
{
"entropy": 0.3431604079902172,
"epoch": 0.3185336773734318,
"grad_norm": 0.70703125,
"learning_rate": 4.8386321735173324e-06,
"loss": 0.3438584804534912,
"mean_token_accuracy": 0.8816794931888581,
"num_tokens": 11054712.0,
"step": 1790
},
{
"entropy": 0.32236423939466474,
"epoch": 0.3203131951241214,
"grad_norm": 0.69921875,
"learning_rate": 4.836022562035395e-06,
"loss": 0.3194507837295532,
"mean_token_accuracy": 0.8921084225177764,
"num_tokens": 11112487.0,
"step": 1800
},
{
"entropy": 0.3170651212334633,
"epoch": 0.32209271287481095,
"grad_norm": 0.64453125,
"learning_rate": 4.83339273361951e-06,
"loss": 0.31370131969451903,
"mean_token_accuracy": 0.8926311641931534,
"num_tokens": 11175011.0,
"step": 1810
},
{
"entropy": 0.3304481156170368,
"epoch": 0.32387223062550047,
"grad_norm": 0.734375,
"learning_rate": 4.8307427110293325e-06,
"loss": 0.3290146827697754,
"mean_token_accuracy": 0.8859521239995957,
"num_tokens": 11236945.0,
"step": 1820
},
{
"entropy": 0.32613271959125995,
"epoch": 0.32565174837619004,
"grad_norm": 0.65234375,
"learning_rate": 4.828072517199287e-06,
"loss": 0.3214689016342163,
"mean_token_accuracy": 0.8889310687780381,
"num_tokens": 11299519.0,
"step": 1830
},
{
"entropy": 0.35464286953210833,
"epoch": 0.3274312661268796,
"grad_norm": 0.79296875,
"learning_rate": 4.825382175238368e-06,
"loss": 0.35498120784759524,
"mean_token_accuracy": 0.8811011373996734,
"num_tokens": 11362133.0,
"step": 1840
},
{
"entropy": 0.29642984345555307,
"epoch": 0.3292107838775692,
"grad_norm": 0.64453125,
"learning_rate": 4.822671708429939e-06,
"loss": 0.29105377197265625,
"mean_token_accuracy": 0.8990860164165497,
"num_tokens": 11424316.0,
"step": 1850
},
{
"entropy": 0.3403557002544403,
"epoch": 0.33099030162825877,
"grad_norm": 0.73828125,
"learning_rate": 4.8199411402315356e-06,
"loss": 0.3408710479736328,
"mean_token_accuracy": 0.8846672475337982,
"num_tokens": 11486315.0,
"step": 1860
},
{
"entropy": 0.3180378496646881,
"epoch": 0.3327698193789483,
"grad_norm": 0.6640625,
"learning_rate": 4.817190494274657e-06,
"loss": 0.3142568588256836,
"mean_token_accuracy": 0.8923665642738342,
"num_tokens": 11549450.0,
"step": 1870
},
{
"entropy": 0.32088752835989,
"epoch": 0.33454933712963786,
"grad_norm": 0.68359375,
"learning_rate": 4.814419794364564e-06,
"loss": 0.3167176008224487,
"mean_token_accuracy": 0.891901296377182,
"num_tokens": 11612826.0,
"step": 1880
},
{
"entropy": 0.36671468392014506,
"epoch": 0.33632885488032743,
"grad_norm": 0.7578125,
"learning_rate": 4.811629064480075e-06,
"loss": 0.36075901985168457,
"mean_token_accuracy": 0.876639899611473,
"num_tokens": 11675070.0,
"step": 1890
},
{
"entropy": 0.34355204179883003,
"epoch": 0.338108372631017,
"grad_norm": 0.64453125,
"learning_rate": 4.808818328773352e-06,
"loss": 0.3493661642074585,
"mean_token_accuracy": 0.8810931831598282,
"num_tokens": 11736677.0,
"step": 1900
},
{
"entropy": 0.2997708685696125,
"epoch": 0.3398878903817066,
"grad_norm": 0.734375,
"learning_rate": 4.805987611569703e-06,
"loss": 0.2969873666763306,
"mean_token_accuracy": 0.897605162858963,
"num_tokens": 11796727.0,
"step": 1910
},
{
"entropy": 0.3368371590971947,
"epoch": 0.3416674081323961,
"grad_norm": 0.703125,
"learning_rate": 4.803136937367355e-06,
"loss": 0.3345362901687622,
"mean_token_accuracy": 0.8849462300539017,
"num_tokens": 11859918.0,
"step": 1920
},
{
"entropy": 0.3323399655520916,
"epoch": 0.3434469258830857,
"grad_norm": 0.6796875,
"learning_rate": 4.800266330837259e-06,
"loss": 0.3346291780471802,
"mean_token_accuracy": 0.8846285611391067,
"num_tokens": 11920786.0,
"step": 1930
},
{
"entropy": 0.3304636083543301,
"epoch": 0.34522644363377525,
"grad_norm": 0.78125,
"learning_rate": 4.797375816822867e-06,
"loss": 0.3262585401535034,
"mean_token_accuracy": 0.8881859093904495,
"num_tokens": 11983317.0,
"step": 1940
},
{
"entropy": 0.3276805475354195,
"epoch": 0.3470059613844648,
"grad_norm": 0.6328125,
"learning_rate": 4.794465420339917e-06,
"loss": 0.32562100887298584,
"mean_token_accuracy": 0.888521808385849,
"num_tokens": 12042733.0,
"step": 1950
},
{
"entropy": 0.3643137916922569,
"epoch": 0.3487854791351544,
"grad_norm": 0.91796875,
"learning_rate": 4.7915351665762175e-06,
"loss": 0.3611361742019653,
"mean_token_accuracy": 0.8770559310913086,
"num_tokens": 12107954.0,
"step": 1960
},
{
"entropy": 0.322842388600111,
"epoch": 0.3505649968858439,
"grad_norm": 0.71875,
"learning_rate": 4.788585080891436e-06,
"loss": 0.32277095317840576,
"mean_token_accuracy": 0.8917052149772644,
"num_tokens": 12170705.0,
"step": 1970
},
{
"entropy": 0.3010896898806095,
"epoch": 0.3523445146365335,
"grad_norm": 0.796875,
"learning_rate": 4.785615188816868e-06,
"loss": 0.29806530475616455,
"mean_token_accuracy": 0.898258626461029,
"num_tokens": 12230139.0,
"step": 1980
},
{
"entropy": 0.33999730944633483,
"epoch": 0.35412403238722306,
"grad_norm": 0.703125,
"learning_rate": 4.782625516055225e-06,
"loss": 0.3457479000091553,
"mean_token_accuracy": 0.8819954574108124,
"num_tokens": 12288706.0,
"step": 1990
},
{
"entropy": 0.3374386131763458,
"epoch": 0.35590355013791264,
"grad_norm": 0.6953125,
"learning_rate": 4.779616088480407e-06,
"loss": 0.33816487789154054,
"mean_token_accuracy": 0.8848948627710342,
"num_tokens": 12352721.0,
"step": 2000
},
{
"entropy": 0.33378071039915086,
"epoch": 0.3576830678886022,
"grad_norm": 0.609375,
"learning_rate": 4.7765869321372835e-06,
"loss": 0.33910431861877444,
"mean_token_accuracy": 0.885414770245552,
"num_tokens": 12416793.0,
"step": 2010
},
{
"entropy": 0.3014608107507229,
"epoch": 0.35946258563929173,
"grad_norm": 0.56640625,
"learning_rate": 4.773538073241462e-06,
"loss": 0.2963795900344849,
"mean_token_accuracy": 0.8973739951848984,
"num_tokens": 12477711.0,
"step": 2020
},
{
"entropy": 0.36168904006481173,
"epoch": 0.3612421033899813,
"grad_norm": 0.60546875,
"learning_rate": 4.770469538179064e-06,
"loss": 0.36448278427124026,
"mean_token_accuracy": 0.8764183282852173,
"num_tokens": 12540647.0,
"step": 2030
},
{
"entropy": 0.32982706353068353,
"epoch": 0.3630216211406709,
"grad_norm": 0.625,
"learning_rate": 4.767381353506502e-06,
"loss": 0.325534462928772,
"mean_token_accuracy": 0.8867161482572555,
"num_tokens": 12605247.0,
"step": 2040
},
{
"entropy": 0.3257120668888092,
"epoch": 0.36480113889136045,
"grad_norm": 0.80859375,
"learning_rate": 4.764273545950238e-06,
"loss": 0.31893894672393797,
"mean_token_accuracy": 0.8895520359277725,
"num_tokens": 12666134.0,
"step": 2050
},
{
"entropy": 0.3204114593565464,
"epoch": 0.36658065664205003,
"grad_norm": 0.62109375,
"learning_rate": 4.7611461424065656e-06,
"loss": 0.31681921482086184,
"mean_token_accuracy": 0.8899898082017899,
"num_tokens": 12726580.0,
"step": 2060
},
{
"entropy": 0.3290185458958149,
"epoch": 0.36836017439273955,
"grad_norm": 0.72265625,
"learning_rate": 4.757999169941363e-06,
"loss": 0.3259589433670044,
"mean_token_accuracy": 0.8893360406160354,
"num_tokens": 12787363.0,
"step": 2070
},
{
"entropy": 0.3067683823406696,
"epoch": 0.3701396921434291,
"grad_norm": 0.69140625,
"learning_rate": 4.754832655789872e-06,
"loss": 0.30571494102478025,
"mean_token_accuracy": 0.8958559095859527,
"num_tokens": 12849394.0,
"step": 2080
},
{
"entropy": 0.3627448983490467,
"epoch": 0.3719192098941187,
"grad_norm": 0.84765625,
"learning_rate": 4.751646627356453e-06,
"loss": 0.3650702953338623,
"mean_token_accuracy": 0.8756417125463486,
"num_tokens": 12912253.0,
"step": 2090
},
{
"entropy": 0.3356044813990593,
"epoch": 0.37369872764480827,
"grad_norm": 0.8203125,
"learning_rate": 4.748441112214354e-06,
"loss": 0.33072652816772463,
"mean_token_accuracy": 0.8876396358013153,
"num_tokens": 12973236.0,
"step": 2100
},
{
"entropy": 0.3378177247941494,
"epoch": 0.37547824539549784,
"grad_norm": 0.62109375,
"learning_rate": 4.745216138105467e-06,
"loss": 0.3320824861526489,
"mean_token_accuracy": 0.885038748383522,
"num_tokens": 13037769.0,
"step": 2110
},
{
"entropy": 0.32784045711159704,
"epoch": 0.37725776314618736,
"grad_norm": 0.703125,
"learning_rate": 4.741971732940093e-06,
"loss": 0.3262526273727417,
"mean_token_accuracy": 0.8874519556760788,
"num_tokens": 13103269.0,
"step": 2120
},
{
"entropy": 0.35600380823016164,
"epoch": 0.37903728089687694,
"grad_norm": 0.65234375,
"learning_rate": 4.7387079247966925e-06,
"loss": 0.35632810592651365,
"mean_token_accuracy": 0.8786388874053955,
"num_tokens": 13166803.0,
"step": 2130
},
{
"entropy": 0.31510523036122323,
"epoch": 0.3808167986475665,
"grad_norm": 0.6640625,
"learning_rate": 4.735424741921654e-06,
"loss": 0.3125915050506592,
"mean_token_accuracy": 0.8931266248226166,
"num_tokens": 13230802.0,
"step": 2140
},
{
"entropy": 0.32619678899645804,
"epoch": 0.3825963163982561,
"grad_norm": 0.81640625,
"learning_rate": 4.732122212729039e-06,
"loss": 0.3222477674484253,
"mean_token_accuracy": 0.8893245726823806,
"num_tokens": 13294534.0,
"step": 2150
},
{
"entropy": 0.34208337068557737,
"epoch": 0.38437583414894566,
"grad_norm": 0.6484375,
"learning_rate": 4.728800365800341e-06,
"loss": 0.3393446922302246,
"mean_token_accuracy": 0.8847091794013977,
"num_tokens": 13355210.0,
"step": 2160
},
{
"entropy": 0.33942179977893827,
"epoch": 0.3861553518996352,
"grad_norm": 0.72265625,
"learning_rate": 4.725459229884238e-06,
"loss": 0.3375351667404175,
"mean_token_accuracy": 0.883438703417778,
"num_tokens": 13420601.0,
"step": 2170
},
{
"entropy": 0.30322944521903994,
"epoch": 0.38793486965032475,
"grad_norm": 0.65234375,
"learning_rate": 4.722098833896343e-06,
"loss": 0.3069580554962158,
"mean_token_accuracy": 0.8947730034589767,
"num_tokens": 13481796.0,
"step": 2180
},
{
"entropy": 0.37797256261110307,
"epoch": 0.38971438740101433,
"grad_norm": 0.71875,
"learning_rate": 4.718719206918954e-06,
"loss": 0.36962873935699464,
"mean_token_accuracy": 0.8755796402692795,
"num_tokens": 13544611.0,
"step": 2190
},
{
"entropy": 0.3616977885365486,
"epoch": 0.3914939051517039,
"grad_norm": 0.82421875,
"learning_rate": 4.715320378200803e-06,
"loss": 0.3612029790878296,
"mean_token_accuracy": 0.874288335442543,
"num_tokens": 13604484.0,
"step": 2200
},
{
"entropy": 0.3246965654194355,
"epoch": 0.3932734229023935,
"grad_norm": 0.59765625,
"learning_rate": 4.711902377156798e-06,
"loss": 0.3220320463180542,
"mean_token_accuracy": 0.8902679353952407,
"num_tokens": 13669912.0,
"step": 2210
},
{
"entropy": 0.375099565833807,
"epoch": 0.395052940653083,
"grad_norm": 0.66796875,
"learning_rate": 4.708465233367777e-06,
"loss": 0.37962148189544676,
"mean_token_accuracy": 0.8704522967338562,
"num_tokens": 13736265.0,
"step": 2220
},
{
"entropy": 0.37368070855736735,
"epoch": 0.39683245840377257,
"grad_norm": 0.79296875,
"learning_rate": 4.705008976580247e-06,
"loss": 0.3727264404296875,
"mean_token_accuracy": 0.8689195603132248,
"num_tokens": 13797250.0,
"step": 2230
},
{
"entropy": 0.3215997591614723,
"epoch": 0.39861197615446214,
"grad_norm": 0.6640625,
"learning_rate": 4.701533636706124e-06,
"loss": 0.3224519968032837,
"mean_token_accuracy": 0.8890083611011506,
"num_tokens": 13862266.0,
"step": 2240
},
{
"entropy": 0.3506476566195488,
"epoch": 0.4003914939051517,
"grad_norm": 0.68359375,
"learning_rate": 4.698039243822481e-06,
"loss": 0.3483339548110962,
"mean_token_accuracy": 0.8795241922140121,
"num_tokens": 13926771.0,
"step": 2250
},
{
"entropy": 0.33235198333859445,
"epoch": 0.4021710116558413,
"grad_norm": 0.59765625,
"learning_rate": 4.694525828171281e-06,
"loss": 0.3273125886917114,
"mean_token_accuracy": 0.8862265437841416,
"num_tokens": 13993142.0,
"step": 2260
},
{
"entropy": 0.35915780141949655,
"epoch": 0.4039505294065308,
"grad_norm": 0.734375,
"learning_rate": 4.6909934201591184e-06,
"loss": 0.35993571281433107,
"mean_token_accuracy": 0.8785275846719742,
"num_tokens": 14052491.0,
"step": 2270
},
{
"entropy": 0.33777954429388046,
"epoch": 0.4057300471572204,
"grad_norm": 0.7421875,
"learning_rate": 4.6874420503569575e-06,
"loss": 0.33431210517883303,
"mean_token_accuracy": 0.8869676649570465,
"num_tokens": 14112054.0,
"step": 2280
},
{
"entropy": 0.31359959170222285,
"epoch": 0.40750956490790996,
"grad_norm": 0.6484375,
"learning_rate": 4.683871749499864e-06,
"loss": 0.3128647327423096,
"mean_token_accuracy": 0.8942294299602509,
"num_tokens": 14175033.0,
"step": 2290
},
{
"entropy": 0.32013130038976667,
"epoch": 0.40928908265859953,
"grad_norm": 0.63671875,
"learning_rate": 4.680282548486742e-06,
"loss": 0.3196382761001587,
"mean_token_accuracy": 0.8907700449228286,
"num_tokens": 14234117.0,
"step": 2300
},
{
"entropy": 0.3417303442955017,
"epoch": 0.4110686004092891,
"grad_norm": 0.62109375,
"learning_rate": 4.676674478380066e-06,
"loss": 0.3371849060058594,
"mean_token_accuracy": 0.8831853270530701,
"num_tokens": 14298400.0,
"step": 2310
},
{
"entropy": 0.33982564583420755,
"epoch": 0.4128481181599786,
"grad_norm": 0.6953125,
"learning_rate": 4.673047570405609e-06,
"loss": 0.33302271366119385,
"mean_token_accuracy": 0.8834989935159683,
"num_tokens": 14361094.0,
"step": 2320
},
{
"entropy": 0.35221932679414747,
"epoch": 0.4146276359106682,
"grad_norm": 0.671875,
"learning_rate": 4.6694018559521796e-06,
"loss": 0.35496861934661866,
"mean_token_accuracy": 0.8796357780694961,
"num_tokens": 14421632.0,
"step": 2330
},
{
"entropy": 0.3150657020509243,
"epoch": 0.4164071536613578,
"grad_norm": 0.60546875,
"learning_rate": 4.665737366571341e-06,
"loss": 0.3148441553115845,
"mean_token_accuracy": 0.8918822050094605,
"num_tokens": 14483051.0,
"step": 2340
},
{
"entropy": 0.34267506673932074,
"epoch": 0.41818667141204735,
"grad_norm": 0.80859375,
"learning_rate": 4.662054133977147e-06,
"loss": 0.3419042110443115,
"mean_token_accuracy": 0.8835701435804367,
"num_tokens": 14541783.0,
"step": 2350
},
{
"entropy": 0.3517219446599483,
"epoch": 0.4199661891627369,
"grad_norm": 0.58984375,
"learning_rate": 4.658352190045857e-06,
"loss": 0.34955906867980957,
"mean_token_accuracy": 0.8798441886901855,
"num_tokens": 14608101.0,
"step": 2360
},
{
"entropy": 0.33628078177571297,
"epoch": 0.42174570691342644,
"grad_norm": 0.7265625,
"learning_rate": 4.654631566815675e-06,
"loss": 0.33331050872802737,
"mean_token_accuracy": 0.8875288605690003,
"num_tokens": 14672300.0,
"step": 2370
},
{
"entropy": 0.34784219712018966,
"epoch": 0.423525224664116,
"grad_norm": 0.7734375,
"learning_rate": 4.650892296486454e-06,
"loss": 0.34494025707244874,
"mean_token_accuracy": 0.8826894581317901,
"num_tokens": 14739049.0,
"step": 2380
},
{
"entropy": 0.31349107101559637,
"epoch": 0.4253047424148056,
"grad_norm": 0.75,
"learning_rate": 4.647134411419435e-06,
"loss": 0.30893611907958984,
"mean_token_accuracy": 0.894053453207016,
"num_tokens": 14799652.0,
"step": 2390
},
{
"entropy": 0.31107454001903534,
"epoch": 0.42708426016549517,
"grad_norm": 0.640625,
"learning_rate": 4.643357944136954e-06,
"loss": 0.30599660873413087,
"mean_token_accuracy": 0.8955994427204133,
"num_tokens": 14862081.0,
"step": 2400
},
{
"entropy": 0.32137037217617037,
"epoch": 0.42886377791618474,
"grad_norm": 0.65234375,
"learning_rate": 4.639562927322167e-06,
"loss": 0.31426043510437013,
"mean_token_accuracy": 0.8908123165369034,
"num_tokens": 14922114.0,
"step": 2410
},
{
"entropy": 0.3783827170729637,
"epoch": 0.43064329566687426,
"grad_norm": 1.046875,
"learning_rate": 4.635749393818766e-06,
"loss": 0.3785280704498291,
"mean_token_accuracy": 0.8671023696660995,
"num_tokens": 14981989.0,
"step": 2420
},
{
"entropy": 0.3020849697291851,
"epoch": 0.43242281341756383,
"grad_norm": 0.6484375,
"learning_rate": 4.631917376630693e-06,
"loss": 0.3003643035888672,
"mean_token_accuracy": 0.8966308385133743,
"num_tokens": 15045741.0,
"step": 2430
},
{
"entropy": 0.33625991865992544,
"epoch": 0.4342023311682534,
"grad_norm": 0.76953125,
"learning_rate": 4.628066908921857e-06,
"loss": 0.3332212924957275,
"mean_token_accuracy": 0.8874284863471985,
"num_tokens": 15107475.0,
"step": 2440
},
{
"entropy": 0.3250188946723938,
"epoch": 0.435981848918943,
"grad_norm": 0.6015625,
"learning_rate": 4.624198024015845e-06,
"loss": 0.31891090869903566,
"mean_token_accuracy": 0.8898184031248093,
"num_tokens": 15170569.0,
"step": 2450
},
{
"entropy": 0.315492145717144,
"epoch": 0.43776136666963256,
"grad_norm": 0.61328125,
"learning_rate": 4.620310755395635e-06,
"loss": 0.31747214794158934,
"mean_token_accuracy": 0.8928862988948822,
"num_tokens": 15233058.0,
"step": 2460
},
{
"entropy": 0.31702224239706994,
"epoch": 0.4395408844203221,
"grad_norm": 0.609375,
"learning_rate": 4.616405136703304e-06,
"loss": 0.31056358814239504,
"mean_token_accuracy": 0.8953319102525711,
"num_tokens": 15294510.0,
"step": 2470
},
{
"entropy": 0.31886664032936096,
"epoch": 0.44132040217101165,
"grad_norm": 0.6953125,
"learning_rate": 4.612481201739738e-06,
"loss": 0.31690473556518556,
"mean_token_accuracy": 0.8920366615056992,
"num_tokens": 15357028.0,
"step": 2480
},
{
"entropy": 0.34460915327072145,
"epoch": 0.4430999199217012,
"grad_norm": 0.6015625,
"learning_rate": 4.6085389844643434e-06,
"loss": 0.34269492626190184,
"mean_token_accuracy": 0.8818275421857834,
"num_tokens": 15424295.0,
"step": 2490
},
{
"entropy": 0.33869500681757925,
"epoch": 0.4448794376723908,
"grad_norm": 0.65234375,
"learning_rate": 4.604578518994746e-06,
"loss": 0.338638162612915,
"mean_token_accuracy": 0.8851386606693268,
"num_tokens": 15484373.0,
"step": 2500
},
{
"entropy": 0.3630241386592388,
"epoch": 0.4466589554230804,
"grad_norm": 0.84375,
"learning_rate": 4.600599839606501e-06,
"loss": 0.35610802173614503,
"mean_token_accuracy": 0.8770470976829529,
"num_tokens": 15545790.0,
"step": 2510
},
{
"entropy": 0.3436386063694954,
"epoch": 0.4484384731737699,
"grad_norm": 0.8046875,
"learning_rate": 4.596602980732794e-06,
"loss": 0.34070501327514646,
"mean_token_accuracy": 0.8828610718250275,
"num_tokens": 15607013.0,
"step": 2520
},
{
"entropy": 0.32435066625475883,
"epoch": 0.45021799092445947,
"grad_norm": 0.75,
"learning_rate": 4.592587976964142e-06,
"loss": 0.32359211444854735,
"mean_token_accuracy": 0.8887916415929794,
"num_tokens": 15672028.0,
"step": 2530
},
{
"entropy": 0.3171756863594055,
"epoch": 0.45199750867514904,
"grad_norm": 0.66796875,
"learning_rate": 4.588554863048099e-06,
"loss": 0.31291513442993163,
"mean_token_accuracy": 0.8936502784490585,
"num_tokens": 15732768.0,
"step": 2540
},
{
"entropy": 0.3241963624954224,
"epoch": 0.4537770264258386,
"grad_norm": 0.75,
"learning_rate": 4.584503673888949e-06,
"loss": 0.3263869047164917,
"mean_token_accuracy": 0.8885355502367019,
"num_tokens": 15793888.0,
"step": 2550
},
{
"entropy": 0.3024554118514061,
"epoch": 0.45555654417652813,
"grad_norm": 0.6875,
"learning_rate": 4.580434444547409e-06,
"loss": 0.3018280267715454,
"mean_token_accuracy": 0.8975428372621537,
"num_tokens": 15852425.0,
"step": 2560
},
{
"entropy": 0.3554363906383514,
"epoch": 0.4573360619272177,
"grad_norm": 0.84375,
"learning_rate": 4.5763472102403215e-06,
"loss": 0.3512598514556885,
"mean_token_accuracy": 0.8808555275201797,
"num_tokens": 15914089.0,
"step": 2570
},
{
"entropy": 0.3259240105748177,
"epoch": 0.4591155796779073,
"grad_norm": 0.76171875,
"learning_rate": 4.572242006340352e-06,
"loss": 0.3269521236419678,
"mean_token_accuracy": 0.8882152527570725,
"num_tokens": 15973461.0,
"step": 2580
},
{
"entropy": 0.3012853354215622,
"epoch": 0.46089509742859686,
"grad_norm": 0.67578125,
"learning_rate": 4.568118868375686e-06,
"loss": 0.3029595375061035,
"mean_token_accuracy": 0.8964558213949203,
"num_tokens": 16033625.0,
"step": 2590
},
{
"entropy": 0.35047017931938174,
"epoch": 0.46267461517928643,
"grad_norm": 0.88671875,
"learning_rate": 4.563977832029712e-06,
"loss": 0.35230581760406493,
"mean_token_accuracy": 0.878894105553627,
"num_tokens": 16094362.0,
"step": 2600
},
{
"entropy": 0.30704435482621195,
"epoch": 0.46445413292997595,
"grad_norm": 0.66015625,
"learning_rate": 4.5598189331407234e-06,
"loss": 0.3074403524398804,
"mean_token_accuracy": 0.8958454251289367,
"num_tokens": 16156232.0,
"step": 2610
},
{
"entropy": 0.3590959653258324,
"epoch": 0.4662336506806655,
"grad_norm": 0.58984375,
"learning_rate": 4.555642207701602e-06,
"loss": 0.36126687526702883,
"mean_token_accuracy": 0.8771416783332825,
"num_tokens": 16217082.0,
"step": 2620
},
{
"entropy": 0.33900789022445676,
"epoch": 0.4680131684313551,
"grad_norm": 0.75,
"learning_rate": 4.551447691859507e-06,
"loss": 0.33671634197235106,
"mean_token_accuracy": 0.8847041338682174,
"num_tokens": 16274330.0,
"step": 2630
},
{
"entropy": 0.3191348910331726,
"epoch": 0.46979268618204467,
"grad_norm": 0.88671875,
"learning_rate": 4.5472354219155654e-06,
"loss": 0.31302542686462403,
"mean_token_accuracy": 0.8915578126907349,
"num_tokens": 16331223.0,
"step": 2640
},
{
"entropy": 0.351291561871767,
"epoch": 0.47157220393273425,
"grad_norm": 0.7890625,
"learning_rate": 4.5430054343245555e-06,
"loss": 0.34546680450439454,
"mean_token_accuracy": 0.8808116346597672,
"num_tokens": 16395174.0,
"step": 2650
},
{
"entropy": 0.3154144696891308,
"epoch": 0.47335172168342377,
"grad_norm": 0.61328125,
"learning_rate": 4.538757765694591e-06,
"loss": 0.31420135498046875,
"mean_token_accuracy": 0.8921685576438904,
"num_tokens": 16458721.0,
"step": 2660
},
{
"entropy": 0.2940688617527485,
"epoch": 0.47513123943411334,
"grad_norm": 0.6796875,
"learning_rate": 4.534492452786804e-06,
"loss": 0.2899198532104492,
"mean_token_accuracy": 0.9009364068508148,
"num_tokens": 16517232.0,
"step": 2670
},
{
"entropy": 0.30826053619384763,
"epoch": 0.4769107571848029,
"grad_norm": 0.609375,
"learning_rate": 4.530209532515029e-06,
"loss": 0.30183231830596924,
"mean_token_accuracy": 0.8953039288520813,
"num_tokens": 16577813.0,
"step": 2680
},
{
"entropy": 0.34231879040598867,
"epoch": 0.4786902749354925,
"grad_norm": 0.625,
"learning_rate": 4.525909041945481e-06,
"loss": 0.3440409660339355,
"mean_token_accuracy": 0.8828630119562149,
"num_tokens": 16640559.0,
"step": 2690
},
{
"entropy": 0.3318951167166233,
"epoch": 0.48046979268618206,
"grad_norm": 0.80859375,
"learning_rate": 4.521591018296438e-06,
"loss": 0.33158555030822756,
"mean_token_accuracy": 0.887498813867569,
"num_tokens": 16698916.0,
"step": 2700
},
{
"entropy": 0.33077102825045585,
"epoch": 0.4822493104368716,
"grad_norm": 0.72265625,
"learning_rate": 4.5172554989379146e-06,
"loss": 0.3289660453796387,
"mean_token_accuracy": 0.8876483112573623,
"num_tokens": 16758734.0,
"step": 2710
},
{
"entropy": 0.31145247370004653,
"epoch": 0.48402882818756116,
"grad_norm": 0.625,
"learning_rate": 4.512902521391342e-06,
"loss": 0.30768885612487795,
"mean_token_accuracy": 0.895361065864563,
"num_tokens": 16821053.0,
"step": 2720
},
{
"entropy": 0.3322932541370392,
"epoch": 0.48580834593825073,
"grad_norm": 0.59765625,
"learning_rate": 4.50853212332924e-06,
"loss": 0.33010575771331785,
"mean_token_accuracy": 0.8861605077981949,
"num_tokens": 16880403.0,
"step": 2730
},
{
"entropy": 0.3375461004674435,
"epoch": 0.4875878636889403,
"grad_norm": 0.57421875,
"learning_rate": 4.5041443425748956e-06,
"loss": 0.33987059593200686,
"mean_token_accuracy": 0.885013970732689,
"num_tokens": 16944196.0,
"step": 2740
},
{
"entropy": 0.3545444868505001,
"epoch": 0.4893673814396299,
"grad_norm": 0.78125,
"learning_rate": 4.4997392171020325e-06,
"loss": 0.3545894384384155,
"mean_token_accuracy": 0.8798752963542938,
"num_tokens": 17005398.0,
"step": 2750
},
{
"entropy": 0.30588506162166595,
"epoch": 0.4911468991903194,
"grad_norm": 0.62109375,
"learning_rate": 4.49531678503448e-06,
"loss": 0.30497701168060304,
"mean_token_accuracy": 0.8962134778499603,
"num_tokens": 17066435.0,
"step": 2760
},
{
"entropy": 0.3045385979115963,
"epoch": 0.49292641694100897,
"grad_norm": 0.68359375,
"learning_rate": 4.49087708464585e-06,
"loss": 0.3027324199676514,
"mean_token_accuracy": 0.8975372821092605,
"num_tokens": 17129332.0,
"step": 2770
},
{
"entropy": 0.3161292657256126,
"epoch": 0.49470593469169855,
"grad_norm": 0.71875,
"learning_rate": 4.486420154359199e-06,
"loss": 0.31549763679504395,
"mean_token_accuracy": 0.8915608644485473,
"num_tokens": 17192133.0,
"step": 2780
},
{
"entropy": 0.31189642772078513,
"epoch": 0.4964854524423881,
"grad_norm": 0.69921875,
"learning_rate": 4.481946032746701e-06,
"loss": 0.3085655927658081,
"mean_token_accuracy": 0.8947380036115646,
"num_tokens": 17254788.0,
"step": 2790
},
{
"entropy": 0.33163716197013854,
"epoch": 0.4982649701930777,
"grad_norm": 0.8125,
"learning_rate": 4.477454758529308e-06,
"loss": 0.3342583417892456,
"mean_token_accuracy": 0.8849562466144562,
"num_tokens": 17317312.0,
"step": 2800
},
{
"entropy": 0.3500364273786545,
"epoch": 0.5000444879437672,
"grad_norm": 0.67578125,
"learning_rate": 4.472946370576421e-06,
"loss": 0.35043671131134035,
"mean_token_accuracy": 0.8790032923221588,
"num_tokens": 17379955.0,
"step": 2810
},
{
"entropy": 0.3339493066072464,
"epoch": 0.5018240056944568,
"grad_norm": 0.7421875,
"learning_rate": 4.468420907905548e-06,
"loss": 0.3300433874130249,
"mean_token_accuracy": 0.8858879506587982,
"num_tokens": 17444416.0,
"step": 2820
},
{
"entropy": 0.3093738153576851,
"epoch": 0.5036035234451464,
"grad_norm": 0.6640625,
"learning_rate": 4.46387840968197e-06,
"loss": 0.3013624906539917,
"mean_token_accuracy": 0.8952651113271713,
"num_tokens": 17509101.0,
"step": 2830
},
{
"entropy": 0.33546592220664023,
"epoch": 0.5053830411958359,
"grad_norm": 0.88671875,
"learning_rate": 4.4593189152184014e-06,
"loss": 0.3282387971878052,
"mean_token_accuracy": 0.8882806301116943,
"num_tokens": 17567390.0,
"step": 2840
},
{
"entropy": 0.3365064963698387,
"epoch": 0.5071625589465255,
"grad_norm": 0.76953125,
"learning_rate": 4.454742463974648e-06,
"loss": 0.3341943025588989,
"mean_token_accuracy": 0.8837945908308029,
"num_tokens": 17631044.0,
"step": 2850
},
{
"entropy": 0.32098233252763747,
"epoch": 0.508942076697215,
"grad_norm": 0.73828125,
"learning_rate": 4.450149095557268e-06,
"loss": 0.31779956817626953,
"mean_token_accuracy": 0.889788419008255,
"num_tokens": 17693352.0,
"step": 2860
},
{
"entropy": 0.32383744418621063,
"epoch": 0.5107215944479047,
"grad_norm": 0.73046875,
"learning_rate": 4.445538849719227e-06,
"loss": 0.31950232982635496,
"mean_token_accuracy": 0.8892173141241073,
"num_tokens": 17756334.0,
"step": 2870
},
{
"entropy": 0.3242351822555065,
"epoch": 0.5125011121985942,
"grad_norm": 0.75390625,
"learning_rate": 4.440911766359557e-06,
"loss": 0.32260258197784425,
"mean_token_accuracy": 0.8905003130435943,
"num_tokens": 17815619.0,
"step": 2880
},
{
"entropy": 0.34278836399316787,
"epoch": 0.5142806299492837,
"grad_norm": 0.7890625,
"learning_rate": 4.436267885523007e-06,
"loss": 0.3431732416152954,
"mean_token_accuracy": 0.8825717777013778,
"num_tokens": 17874822.0,
"step": 2890
},
{
"entropy": 0.3369047962129116,
"epoch": 0.5160601476999733,
"grad_norm": 0.7265625,
"learning_rate": 4.431607247399698e-06,
"loss": 0.34291141033172606,
"mean_token_accuracy": 0.8822033911943435,
"num_tokens": 17935388.0,
"step": 2900
},
{
"entropy": 0.3206785574555397,
"epoch": 0.5178396654506628,
"grad_norm": 0.60546875,
"learning_rate": 4.426929892324777e-06,
"loss": 0.3195641279220581,
"mean_token_accuracy": 0.8898243546485901,
"num_tokens": 17997547.0,
"step": 2910
},
{
"entropy": 0.3480710357427597,
"epoch": 0.5196191832013525,
"grad_norm": 0.84375,
"learning_rate": 4.422235860778069e-06,
"loss": 0.34496591091156004,
"mean_token_accuracy": 0.8791915744543075,
"num_tokens": 18058189.0,
"step": 2920
},
{
"entropy": 0.33354608416557313,
"epoch": 0.521398700952042,
"grad_norm": 0.859375,
"learning_rate": 4.4175251933837185e-06,
"loss": 0.3351024866104126,
"mean_token_accuracy": 0.886347496509552,
"num_tokens": 18121362.0,
"step": 2930
},
{
"entropy": 0.3292862832546234,
"epoch": 0.5231782187027315,
"grad_norm": 0.640625,
"learning_rate": 4.412797930909849e-06,
"loss": 0.32676169872283933,
"mean_token_accuracy": 0.88723985850811,
"num_tokens": 18184621.0,
"step": 2940
},
{
"entropy": 0.2951918601989746,
"epoch": 0.5249577364534211,
"grad_norm": 0.6640625,
"learning_rate": 4.408054114268202e-06,
"loss": 0.2963052034378052,
"mean_token_accuracy": 0.9016390770673752,
"num_tokens": 18243303.0,
"step": 2950
},
{
"entropy": 0.3430948376655579,
"epoch": 0.5267372542041107,
"grad_norm": 0.65234375,
"learning_rate": 4.403293784513788e-06,
"loss": 0.34618875980377195,
"mean_token_accuracy": 0.8814037412405014,
"num_tokens": 18307450.0,
"step": 2960
},
{
"entropy": 0.3350948102772236,
"epoch": 0.5285167719548003,
"grad_norm": 0.7109375,
"learning_rate": 4.398516982844526e-06,
"loss": 0.3327265501022339,
"mean_token_accuracy": 0.8859294772148132,
"num_tokens": 18370995.0,
"step": 2970
},
{
"entropy": 0.3445021383464336,
"epoch": 0.5302962897054898,
"grad_norm": 0.8671875,
"learning_rate": 4.393723750600892e-06,
"loss": 0.3372231721878052,
"mean_token_accuracy": 0.8843325912952423,
"num_tokens": 18435798.0,
"step": 2980
},
{
"entropy": 0.3483050562441349,
"epoch": 0.5320758074561793,
"grad_norm": 0.65625,
"learning_rate": 4.388914129265559e-06,
"loss": 0.3432689905166626,
"mean_token_accuracy": 0.8827427834272384,
"num_tokens": 18493487.0,
"step": 2990
},
{
"entropy": 0.3505037516355515,
"epoch": 0.533855325206869,
"grad_norm": 0.6796875,
"learning_rate": 4.384088160463038e-06,
"loss": 0.34547269344329834,
"mean_token_accuracy": 0.8785193890333176,
"num_tokens": 18554456.0,
"step": 3000
},
{
"entropy": 0.29410420432686807,
"epoch": 0.5356348429575585,
"grad_norm": 0.72265625,
"learning_rate": 4.379245885959319e-06,
"loss": 0.28923351764678956,
"mean_token_accuracy": 0.9004590451717377,
"num_tokens": 18615158.0,
"step": 3010
},
{
"entropy": 0.32648345828056335,
"epoch": 0.5374143607082481,
"grad_norm": 0.6796875,
"learning_rate": 4.374387347661505e-06,
"loss": 0.3262840747833252,
"mean_token_accuracy": 0.8869497299194335,
"num_tokens": 18679569.0,
"step": 3020
},
{
"entropy": 0.32210521027445793,
"epoch": 0.5391938784589376,
"grad_norm": 0.61328125,
"learning_rate": 4.3695125876174585e-06,
"loss": 0.32357451915740965,
"mean_token_accuracy": 0.889242309331894,
"num_tokens": 18739067.0,
"step": 3030
},
{
"entropy": 0.3057173080742359,
"epoch": 0.5409733962096271,
"grad_norm": 0.6875,
"learning_rate": 4.364621648015426e-06,
"loss": 0.30181748867034913,
"mean_token_accuracy": 0.8964877933263778,
"num_tokens": 18801368.0,
"step": 3040
},
{
"entropy": 0.31124183610081674,
"epoch": 0.5427529139603168,
"grad_norm": 0.66796875,
"learning_rate": 4.359714571183681e-06,
"loss": 0.3111163854598999,
"mean_token_accuracy": 0.8926129817962647,
"num_tokens": 18865333.0,
"step": 3050
},
{
"entropy": 0.3583334222435951,
"epoch": 0.5445324317110063,
"grad_norm": 0.765625,
"learning_rate": 4.354791399590158e-06,
"loss": 0.35573246479034426,
"mean_token_accuracy": 0.8774722367525101,
"num_tokens": 18928216.0,
"step": 3060
},
{
"entropy": 0.3551542639732361,
"epoch": 0.5463119494616959,
"grad_norm": 0.69921875,
"learning_rate": 4.34985217584208e-06,
"loss": 0.3499234914779663,
"mean_token_accuracy": 0.8821368932723999,
"num_tokens": 18987689.0,
"step": 3070
},
{
"entropy": 0.3471884004771709,
"epoch": 0.5480914672123854,
"grad_norm": 0.76953125,
"learning_rate": 4.344896942685592e-06,
"loss": 0.35027542114257815,
"mean_token_accuracy": 0.881121426820755,
"num_tokens": 19051537.0,
"step": 3080
},
{
"entropy": 0.3326264344155788,
"epoch": 0.549870984963075,
"grad_norm": 0.82421875,
"learning_rate": 4.339925743005391e-06,
"loss": 0.33079872131347654,
"mean_token_accuracy": 0.8863648146390914,
"num_tokens": 19111444.0,
"step": 3090
},
{
"entropy": 0.3462922558188438,
"epoch": 0.5516505027137646,
"grad_norm": 0.63671875,
"learning_rate": 4.3349386198243556e-06,
"loss": 0.3462101697921753,
"mean_token_accuracy": 0.881612503528595,
"num_tokens": 19175084.0,
"step": 3100
},
{
"entropy": 0.35192776694893835,
"epoch": 0.5534300204644541,
"grad_norm": 0.80078125,
"learning_rate": 4.329935616303176e-06,
"loss": 0.3500053882598877,
"mean_token_accuracy": 0.8800609886646271,
"num_tokens": 19237412.0,
"step": 3110
},
{
"entropy": 0.3505033880472183,
"epoch": 0.5552095382151437,
"grad_norm": 0.734375,
"learning_rate": 4.324916775739972e-06,
"loss": 0.3427066087722778,
"mean_token_accuracy": 0.881499120593071,
"num_tokens": 19295476.0,
"step": 3120
},
{
"entropy": 0.3452603377401829,
"epoch": 0.5569890559658333,
"grad_norm": 0.73828125,
"learning_rate": 4.319882141569928e-06,
"loss": 0.3466400861740112,
"mean_token_accuracy": 0.8815207093954086,
"num_tokens": 19355942.0,
"step": 3130
},
{
"entropy": 0.2858357109129429,
"epoch": 0.5587685737165228,
"grad_norm": 0.640625,
"learning_rate": 4.3148317573649125e-06,
"loss": 0.2855920553207397,
"mean_token_accuracy": 0.9025433659553528,
"num_tokens": 19416066.0,
"step": 3140
},
{
"entropy": 0.33637115359306335,
"epoch": 0.5605480914672124,
"grad_norm": 0.671875,
"learning_rate": 4.3097656668331e-06,
"loss": 0.33633320331573485,
"mean_token_accuracy": 0.8851213961839676,
"num_tokens": 19475246.0,
"step": 3150
},
{
"entropy": 0.32475576996803285,
"epoch": 0.5623276092179019,
"grad_norm": 0.7578125,
"learning_rate": 4.3046839138185955e-06,
"loss": 0.3261857986450195,
"mean_token_accuracy": 0.8883878320455552,
"num_tokens": 19536069.0,
"step": 3160
},
{
"entropy": 0.32688385173678397,
"epoch": 0.5641071269685916,
"grad_norm": 0.6953125,
"learning_rate": 4.299586542301053e-06,
"loss": 0.32369470596313477,
"mean_token_accuracy": 0.8877399653196335,
"num_tokens": 19597263.0,
"step": 3170
},
{
"entropy": 0.32857562229037285,
"epoch": 0.5658866447192811,
"grad_norm": 0.796875,
"learning_rate": 4.294473596395296e-06,
"loss": 0.3317885875701904,
"mean_token_accuracy": 0.889950966835022,
"num_tokens": 19659533.0,
"step": 3180
},
{
"entropy": 0.3587916135787964,
"epoch": 0.5676661624699706,
"grad_norm": 0.78125,
"learning_rate": 4.2893451203509375e-06,
"loss": 0.3553422451019287,
"mean_token_accuracy": 0.8782511681318284,
"num_tokens": 19717502.0,
"step": 3190
},
{
"entropy": 0.3406700178980827,
"epoch": 0.5694456802206602,
"grad_norm": 0.69140625,
"learning_rate": 4.284201158551992e-06,
"loss": 0.33574848175048827,
"mean_token_accuracy": 0.8840092897415162,
"num_tokens": 19781706.0,
"step": 3200
},
{
"entropy": 0.335107384622097,
"epoch": 0.5712251979713497,
"grad_norm": 0.65625,
"learning_rate": 4.279041755516493e-06,
"loss": 0.32921667098999025,
"mean_token_accuracy": 0.8867899179458618,
"num_tokens": 19841681.0,
"step": 3210
},
{
"entropy": 0.3081793308258057,
"epoch": 0.5730047157220394,
"grad_norm": 0.62890625,
"learning_rate": 4.273866955896113e-06,
"loss": 0.30739941596984866,
"mean_token_accuracy": 0.8965465784072876,
"num_tokens": 19898326.0,
"step": 3220
},
{
"entropy": 0.34780475571751596,
"epoch": 0.5747842334727289,
"grad_norm": 0.6953125,
"learning_rate": 4.268676804475772e-06,
"loss": 0.3460541248321533,
"mean_token_accuracy": 0.8816146969795227,
"num_tokens": 19956482.0,
"step": 3230
},
{
"entropy": 0.36232799142599104,
"epoch": 0.5765637512234184,
"grad_norm": 0.8125,
"learning_rate": 4.2634713461732495e-06,
"loss": 0.35634894371032716,
"mean_token_accuracy": 0.8750342965126038,
"num_tokens": 20016435.0,
"step": 3240
},
{
"entropy": 0.3187406860291958,
"epoch": 0.578343268974108,
"grad_norm": 0.640625,
"learning_rate": 4.258250626038799e-06,
"loss": 0.3180917978286743,
"mean_token_accuracy": 0.8902105063199997,
"num_tokens": 20080092.0,
"step": 3250
},
{
"entropy": 0.3615705005824566,
"epoch": 0.5801227867247976,
"grad_norm": 0.76953125,
"learning_rate": 4.2530146892547545e-06,
"loss": 0.3651046991348267,
"mean_token_accuracy": 0.8766989678144455,
"num_tokens": 20144099.0,
"step": 3260
},
{
"entropy": 0.33297630175948145,
"epoch": 0.5819023044754872,
"grad_norm": 0.7890625,
"learning_rate": 4.2477635811351426e-06,
"loss": 0.33105955123901365,
"mean_token_accuracy": 0.886493194103241,
"num_tokens": 20206312.0,
"step": 3270
},
{
"entropy": 0.3028066374361515,
"epoch": 0.5836818222261767,
"grad_norm": 0.75,
"learning_rate": 4.242497347125289e-06,
"loss": 0.2985677242279053,
"mean_token_accuracy": 0.897066456079483,
"num_tokens": 20269053.0,
"step": 3280
},
{
"entropy": 0.3160752020776272,
"epoch": 0.5854613399768662,
"grad_norm": 0.75,
"learning_rate": 4.2372160328014266e-06,
"loss": 0.3144646644592285,
"mean_token_accuracy": 0.8949336677789688,
"num_tokens": 20334519.0,
"step": 3290
},
{
"entropy": 0.3503792636096478,
"epoch": 0.5872408577275559,
"grad_norm": 0.78515625,
"learning_rate": 4.231919683870296e-06,
"loss": 0.3507127046585083,
"mean_token_accuracy": 0.8792561978101731,
"num_tokens": 20396780.0,
"step": 3300
},
{
"entropy": 0.32902468293905257,
"epoch": 0.5890203754782454,
"grad_norm": 0.8671875,
"learning_rate": 4.2266083461687585e-06,
"loss": 0.32418806552886964,
"mean_token_accuracy": 0.8885544329881668,
"num_tokens": 20456450.0,
"step": 3310
},
{
"entropy": 0.3679012328386307,
"epoch": 0.590799893228935,
"grad_norm": 0.7578125,
"learning_rate": 4.2212820656633905e-06,
"loss": 0.36230764389038084,
"mean_token_accuracy": 0.8737878859043121,
"num_tokens": 20517396.0,
"step": 3320
},
{
"entropy": 0.3137190110981464,
"epoch": 0.5925794109796245,
"grad_norm": 0.68359375,
"learning_rate": 4.215940888450092e-06,
"loss": 0.31717281341552733,
"mean_token_accuracy": 0.8932360798120499,
"num_tokens": 20577570.0,
"step": 3330
},
{
"entropy": 0.3405553102493286,
"epoch": 0.594358928730314,
"grad_norm": 0.64453125,
"learning_rate": 4.2105848607536845e-06,
"loss": 0.33839738368988037,
"mean_token_accuracy": 0.8822631210088729,
"num_tokens": 20642806.0,
"step": 3340
},
{
"entropy": 0.33166978135704994,
"epoch": 0.5961384464810037,
"grad_norm": 0.68359375,
"learning_rate": 4.2052140289275126e-06,
"loss": 0.32867019176483153,
"mean_token_accuracy": 0.8865305632352829,
"num_tokens": 20705203.0,
"step": 3350
},
{
"entropy": 0.3391012966632843,
"epoch": 0.5979179642316932,
"grad_norm": 0.6015625,
"learning_rate": 4.199828439453042e-06,
"loss": 0.3397333860397339,
"mean_token_accuracy": 0.881675910949707,
"num_tokens": 20765845.0,
"step": 3360
},
{
"entropy": 0.30641280487179756,
"epoch": 0.5996974819823828,
"grad_norm": 0.59765625,
"learning_rate": 4.194428138939458e-06,
"loss": 0.3074562311172485,
"mean_token_accuracy": 0.896448427438736,
"num_tokens": 20828070.0,
"step": 3370
},
{
"entropy": 0.3260988719761372,
"epoch": 0.6014769997330723,
"grad_norm": 0.88671875,
"learning_rate": 4.189013174123259e-06,
"loss": 0.3167697906494141,
"mean_token_accuracy": 0.8922264486551285,
"num_tokens": 20889620.0,
"step": 3380
},
{
"entropy": 0.3060282714664936,
"epoch": 0.6032565174837619,
"grad_norm": 0.6015625,
"learning_rate": 4.183583591867858e-06,
"loss": 0.3049851179122925,
"mean_token_accuracy": 0.896173644065857,
"num_tokens": 20946553.0,
"step": 3390
},
{
"entropy": 0.3040558986365795,
"epoch": 0.6050360352344515,
"grad_norm": 0.69921875,
"learning_rate": 4.17813943916317e-06,
"loss": 0.3029818296432495,
"mean_token_accuracy": 0.896300557255745,
"num_tokens": 21009161.0,
"step": 3400
},
{
"entropy": 0.3222613945603371,
"epoch": 0.606815552985141,
"grad_norm": 0.66796875,
"learning_rate": 4.172680763125212e-06,
"loss": 0.32582573890686034,
"mean_token_accuracy": 0.889011001586914,
"num_tokens": 21070400.0,
"step": 3410
},
{
"entropy": 0.32724867165088656,
"epoch": 0.6085950707358306,
"grad_norm": 0.6953125,
"learning_rate": 4.167207610995691e-06,
"loss": 0.3263880491256714,
"mean_token_accuracy": 0.8889974474906921,
"num_tokens": 21132193.0,
"step": 3420
},
{
"entropy": 0.3585047386586666,
"epoch": 0.6103745884865202,
"grad_norm": 0.8125,
"learning_rate": 4.161720030141595e-06,
"loss": 0.3584728717803955,
"mean_token_accuracy": 0.8756175965070725,
"num_tokens": 21192437.0,
"step": 3430
},
{
"entropy": 0.3226370632648468,
"epoch": 0.6121541062372097,
"grad_norm": 0.734375,
"learning_rate": 4.156218068054785e-06,
"loss": 0.31595520973205565,
"mean_token_accuracy": 0.8923990041017532,
"num_tokens": 21254137.0,
"step": 3440
},
{
"entropy": 0.306988450884819,
"epoch": 0.6139336239878993,
"grad_norm": 0.72265625,
"learning_rate": 4.150701772351586e-06,
"loss": 0.3028196096420288,
"mean_token_accuracy": 0.8970669984817505,
"num_tokens": 21313770.0,
"step": 3450
},
{
"entropy": 0.32845938503742217,
"epoch": 0.6157131417385888,
"grad_norm": 0.73828125,
"learning_rate": 4.145171190772367e-06,
"loss": 0.32838926315307615,
"mean_token_accuracy": 0.8893208533525467,
"num_tokens": 21372296.0,
"step": 3460
},
{
"entropy": 0.32188113778829575,
"epoch": 0.6174926594892785,
"grad_norm": 0.94140625,
"learning_rate": 4.139626371181138e-06,
"loss": 0.3162687301635742,
"mean_token_accuracy": 0.8913774728775025,
"num_tokens": 21433382.0,
"step": 3470
},
{
"entropy": 0.35295322388410566,
"epoch": 0.619272177239968,
"grad_norm": 0.69140625,
"learning_rate": 4.134067361565128e-06,
"loss": 0.3582089185714722,
"mean_token_accuracy": 0.878473910689354,
"num_tokens": 21496318.0,
"step": 3480
},
{
"entropy": 0.3337127357721329,
"epoch": 0.6210516949906575,
"grad_norm": 0.8359375,
"learning_rate": 4.128494210034374e-06,
"loss": 0.33816502094268797,
"mean_token_accuracy": 0.8863029271364212,
"num_tokens": 21555666.0,
"step": 3490
},
{
"entropy": 0.325682258605957,
"epoch": 0.6228312127413471,
"grad_norm": 0.703125,
"learning_rate": 4.1229069648213e-06,
"loss": 0.325277304649353,
"mean_token_accuracy": 0.887930378317833,
"num_tokens": 21616062.0,
"step": 3500
},
{
"entropy": 0.3299191676080227,
"epoch": 0.6246107304920366,
"grad_norm": 0.671875,
"learning_rate": 4.117305674280308e-06,
"loss": 0.32916214466094973,
"mean_token_accuracy": 0.8882404506206513,
"num_tokens": 21682052.0,
"step": 3510
},
{
"entropy": 0.30750582069158555,
"epoch": 0.6263902482427263,
"grad_norm": 0.6953125,
"learning_rate": 4.111690386887351e-06,
"loss": 0.3015623092651367,
"mean_token_accuracy": 0.8977977722883225,
"num_tokens": 21747759.0,
"step": 3520
},
{
"entropy": 0.30353686213493347,
"epoch": 0.6281697659934158,
"grad_norm": 0.61328125,
"learning_rate": 4.106061151239516e-06,
"loss": 0.30034866333007815,
"mean_token_accuracy": 0.8972961157560349,
"num_tokens": 21812103.0,
"step": 3530
},
{
"entropy": 0.36687018126249316,
"epoch": 0.6299492837441053,
"grad_norm": 0.74609375,
"learning_rate": 4.1004180160546055e-06,
"loss": 0.37118489742279054,
"mean_token_accuracy": 0.8741149574518203,
"num_tokens": 21869766.0,
"step": 3540
},
{
"entropy": 0.33901830613613126,
"epoch": 0.6317288014947949,
"grad_norm": 0.6484375,
"learning_rate": 4.094761030170715e-06,
"loss": 0.336282753944397,
"mean_token_accuracy": 0.8839475184679031,
"num_tokens": 21931834.0,
"step": 3550
},
{
"entropy": 0.3397719688713551,
"epoch": 0.6335083192454845,
"grad_norm": 0.70703125,
"learning_rate": 4.089090242545808e-06,
"loss": 0.3386350393295288,
"mean_token_accuracy": 0.8843063890933991,
"num_tokens": 21995067.0,
"step": 3560
},
{
"entropy": 0.3309327274560928,
"epoch": 0.6352878369961741,
"grad_norm": 0.734375,
"learning_rate": 4.083405702257297e-06,
"loss": 0.3225497007369995,
"mean_token_accuracy": 0.8881833463907242,
"num_tokens": 22054290.0,
"step": 3570
},
{
"entropy": 0.3295432783663273,
"epoch": 0.6370673547468636,
"grad_norm": 0.73046875,
"learning_rate": 4.077707458501612e-06,
"loss": 0.32772934436798096,
"mean_token_accuracy": 0.8876502782106399,
"num_tokens": 22116730.0,
"step": 3580
},
{
"entropy": 0.3413019098341465,
"epoch": 0.6388468724975531,
"grad_norm": 0.66796875,
"learning_rate": 4.071995560593782e-06,
"loss": 0.3373931884765625,
"mean_token_accuracy": 0.8832113146781921,
"num_tokens": 22181281.0,
"step": 3590
},
{
"entropy": 0.3315641477704048,
"epoch": 0.6406263902482427,
"grad_norm": 0.65234375,
"learning_rate": 4.066270057967005e-06,
"loss": 0.3335767984390259,
"mean_token_accuracy": 0.8852315068244934,
"num_tokens": 22239291.0,
"step": 3600
},
{
"entropy": 0.30818153321743014,
"epoch": 0.6424059079989323,
"grad_norm": 0.796875,
"learning_rate": 4.0605310001722155e-06,
"loss": 0.3102595329284668,
"mean_token_accuracy": 0.8932688593864441,
"num_tokens": 22298699.0,
"step": 3610
},
{
"entropy": 0.3046887829899788,
"epoch": 0.6441854257496219,
"grad_norm": 0.73828125,
"learning_rate": 4.0547784368776666e-06,
"loss": 0.2986630439758301,
"mean_token_accuracy": 0.8963529616594315,
"num_tokens": 22360451.0,
"step": 3620
},
{
"entropy": 0.3371388889849186,
"epoch": 0.6459649435003114,
"grad_norm": 0.640625,
"learning_rate": 4.0490124178684884e-06,
"loss": 0.3359856367111206,
"mean_token_accuracy": 0.8856187671422958,
"num_tokens": 22416934.0,
"step": 3630
},
{
"entropy": 0.31443329676985743,
"epoch": 0.6477444612510009,
"grad_norm": 0.66796875,
"learning_rate": 4.043232993046265e-06,
"loss": 0.31395664215087893,
"mean_token_accuracy": 0.8952710539102554,
"num_tokens": 22477940.0,
"step": 3640
},
{
"entropy": 0.3266920395195484,
"epoch": 0.6495239790016906,
"grad_norm": 0.7734375,
"learning_rate": 4.037440212428601e-06,
"loss": 0.32647788524627686,
"mean_token_accuracy": 0.8875341802835465,
"num_tokens": 22535467.0,
"step": 3650
},
{
"entropy": 0.31038401648402214,
"epoch": 0.6513034967523801,
"grad_norm": 0.6875,
"learning_rate": 4.031634126148685e-06,
"loss": 0.30870542526245115,
"mean_token_accuracy": 0.8950846582651139,
"num_tokens": 22597159.0,
"step": 3660
},
{
"entropy": 0.34023172184824946,
"epoch": 0.6530830145030697,
"grad_norm": 0.6953125,
"learning_rate": 4.02581478445486e-06,
"loss": 0.3395744562149048,
"mean_token_accuracy": 0.882710126042366,
"num_tokens": 22654707.0,
"step": 3670
},
{
"entropy": 0.3239851281046867,
"epoch": 0.6548625322537592,
"grad_norm": 0.734375,
"learning_rate": 4.019982237710188e-06,
"loss": 0.3222635507583618,
"mean_token_accuracy": 0.8885346949100494,
"num_tokens": 22718419.0,
"step": 3680
},
{
"entropy": 0.3419245183467865,
"epoch": 0.6566420500044488,
"grad_norm": 0.65234375,
"learning_rate": 4.014136536392012e-06,
"loss": 0.33691384792327883,
"mean_token_accuracy": 0.8838605612516404,
"num_tokens": 22780931.0,
"step": 3690
},
{
"entropy": 0.32166584208607674,
"epoch": 0.6584215677551384,
"grad_norm": 0.7890625,
"learning_rate": 4.0082777310915185e-06,
"loss": 0.3230660200119019,
"mean_token_accuracy": 0.8908147662878036,
"num_tokens": 22842333.0,
"step": 3700
},
{
"entropy": 0.36541558504104615,
"epoch": 0.6602010855058279,
"grad_norm": 0.79296875,
"learning_rate": 4.0024058725133055e-06,
"loss": 0.3722693920135498,
"mean_token_accuracy": 0.8736053824424743,
"num_tokens": 22901858.0,
"step": 3710
},
{
"entropy": 0.30781840458512305,
"epoch": 0.6619806032565175,
"grad_norm": 0.640625,
"learning_rate": 3.9965210114749355e-06,
"loss": 0.30644729137420657,
"mean_token_accuracy": 0.8949850857257843,
"num_tokens": 22966668.0,
"step": 3720
},
{
"entropy": 0.3038733199238777,
"epoch": 0.663760121007207,
"grad_norm": 0.69921875,
"learning_rate": 3.990623198906504e-06,
"loss": 0.2997271537780762,
"mean_token_accuracy": 0.8962586522102356,
"num_tokens": 23033011.0,
"step": 3730
},
{
"entropy": 0.32676763385534285,
"epoch": 0.6655396387578966,
"grad_norm": 0.74609375,
"learning_rate": 3.98471248585019e-06,
"loss": 0.32193775177001954,
"mean_token_accuracy": 0.8890910476446152,
"num_tokens": 23093283.0,
"step": 3740
},
{
"entropy": 0.3167137444019318,
"epoch": 0.6673191565085862,
"grad_norm": 0.57421875,
"learning_rate": 3.978788923459823e-06,
"loss": 0.30832436084747317,
"mean_token_accuracy": 0.8933327436447144,
"num_tokens": 23155470.0,
"step": 3750
},
{
"entropy": 0.3385638728737831,
"epoch": 0.6690986742592757,
"grad_norm": 0.75390625,
"learning_rate": 3.972852563000433e-06,
"loss": 0.3368804931640625,
"mean_token_accuracy": 0.8830694049596787,
"num_tokens": 23217613.0,
"step": 3760
},
{
"entropy": 0.3112606145441532,
"epoch": 0.6708781920099653,
"grad_norm": 0.72265625,
"learning_rate": 3.966903455847813e-06,
"loss": 0.3110343456268311,
"mean_token_accuracy": 0.8946603268384934,
"num_tokens": 23277745.0,
"step": 3770
},
{
"entropy": 0.31338492035865784,
"epoch": 0.6726577097606549,
"grad_norm": 0.87890625,
"learning_rate": 3.960941653488066e-06,
"loss": 0.3175248622894287,
"mean_token_accuracy": 0.8909559309482574,
"num_tokens": 23339562.0,
"step": 3780
},
{
"entropy": 0.32489819154143335,
"epoch": 0.6744372275113444,
"grad_norm": 0.90625,
"learning_rate": 3.954967207517171e-06,
"loss": 0.32114262580871583,
"mean_token_accuracy": 0.8926512032747269,
"num_tokens": 23398984.0,
"step": 3790
},
{
"entropy": 0.3049692437052727,
"epoch": 0.676216745262034,
"grad_norm": 0.6484375,
"learning_rate": 3.948980169640527e-06,
"loss": 0.30400891304016114,
"mean_token_accuracy": 0.8963852822780609,
"num_tokens": 23464189.0,
"step": 3800
},
{
"entropy": 0.337682131677866,
"epoch": 0.6779962630127235,
"grad_norm": 0.75,
"learning_rate": 3.942980591672508e-06,
"loss": 0.3370924711227417,
"mean_token_accuracy": 0.8845021963119507,
"num_tokens": 23524844.0,
"step": 3810
},
{
"entropy": 0.3525546632707119,
"epoch": 0.6797757807634132,
"grad_norm": 0.75,
"learning_rate": 3.936968525536018e-06,
"loss": 0.34533052444458007,
"mean_token_accuracy": 0.8810445040464401,
"num_tokens": 23583864.0,
"step": 3820
},
{
"entropy": 0.30110328197479247,
"epoch": 0.6815552985141027,
"grad_norm": 0.67578125,
"learning_rate": 3.930944023262036e-06,
"loss": 0.30220918655395507,
"mean_token_accuracy": 0.8982021152973175,
"num_tokens": 23639815.0,
"step": 3830
},
{
"entropy": 0.2872416265308857,
"epoch": 0.6833348162647922,
"grad_norm": 0.62890625,
"learning_rate": 3.92490713698917e-06,
"loss": 0.28027145862579345,
"mean_token_accuracy": 0.9027018517255783,
"num_tokens": 23701469.0,
"step": 3840
},
{
"entropy": 0.2994592718780041,
"epoch": 0.6851143340154818,
"grad_norm": 0.625,
"learning_rate": 3.918857918963205e-06,
"loss": 0.29978432655334475,
"mean_token_accuracy": 0.8961022108793258,
"num_tokens": 23761184.0,
"step": 3850
},
{
"entropy": 0.2943257696926594,
"epoch": 0.6868938517661713,
"grad_norm": 0.6328125,
"learning_rate": 3.91279642153665e-06,
"loss": 0.2968342065811157,
"mean_token_accuracy": 0.8990596324205399,
"num_tokens": 23825810.0,
"step": 3860
},
{
"entropy": 0.3054063245654106,
"epoch": 0.688673369516861,
"grad_norm": 0.8125,
"learning_rate": 3.906722697168283e-06,
"loss": 0.3054715394973755,
"mean_token_accuracy": 0.8957457602024078,
"num_tokens": 23886899.0,
"step": 3870
},
{
"entropy": 0.3069253176450729,
"epoch": 0.6904528872675505,
"grad_norm": 0.7421875,
"learning_rate": 3.900636798422704e-06,
"loss": 0.30714099407196044,
"mean_token_accuracy": 0.8971534937620163,
"num_tokens": 23951450.0,
"step": 3880
},
{
"entropy": 0.34227139353752134,
"epoch": 0.69223240501824,
"grad_norm": 0.609375,
"learning_rate": 3.894538777969868e-06,
"loss": 0.3442659854888916,
"mean_token_accuracy": 0.8816527515649796,
"num_tokens": 24014942.0,
"step": 3890
},
{
"entropy": 0.3324007302522659,
"epoch": 0.6940119227689296,
"grad_norm": 0.67578125,
"learning_rate": 3.888428688584643e-06,
"loss": 0.33266706466674806,
"mean_token_accuracy": 0.885134294629097,
"num_tokens": 24079036.0,
"step": 3900
},
{
"entropy": 0.3650533989071846,
"epoch": 0.6957914405196192,
"grad_norm": 0.80078125,
"learning_rate": 3.882306583146346e-06,
"loss": 0.3684395790100098,
"mean_token_accuracy": 0.8742841720581055,
"num_tokens": 24140680.0,
"step": 3910
},
{
"entropy": 0.3513684146106243,
"epoch": 0.6975709582703088,
"grad_norm": 0.71875,
"learning_rate": 3.876172514638281e-06,
"loss": 0.3528375387191772,
"mean_token_accuracy": 0.8802893698215485,
"num_tokens": 24203706.0,
"step": 3920
},
{
"entropy": 0.3140840381383896,
"epoch": 0.6993504760209983,
"grad_norm": 0.62109375,
"learning_rate": 3.87002653614729e-06,
"loss": 0.3071706295013428,
"mean_token_accuracy": 0.8948991298675537,
"num_tokens": 24266861.0,
"step": 3930
},
{
"entropy": 0.3299639403820038,
"epoch": 0.7011299937716878,
"grad_norm": 0.671875,
"learning_rate": 3.863868700863288e-06,
"loss": 0.32673211097717286,
"mean_token_accuracy": 0.8864569872617721,
"num_tokens": 24327990.0,
"step": 3940
},
{
"entropy": 0.3226359970867634,
"epoch": 0.7029095115223775,
"grad_norm": 0.81640625,
"learning_rate": 3.857699062078804e-06,
"loss": 0.3210404396057129,
"mean_token_accuracy": 0.8895397961139679,
"num_tokens": 24388902.0,
"step": 3950
},
{
"entropy": 0.3161041624844074,
"epoch": 0.704689029273067,
"grad_norm": 0.65625,
"learning_rate": 3.851517673188519e-06,
"loss": 0.31977477073669436,
"mean_token_accuracy": 0.8913398414850235,
"num_tokens": 24446067.0,
"step": 3960
},
{
"entropy": 0.34715538620948794,
"epoch": 0.7064685470237566,
"grad_norm": 0.9453125,
"learning_rate": 3.8453245876888044e-06,
"loss": 0.3476161003112793,
"mean_token_accuracy": 0.8798853307962418,
"num_tokens": 24505474.0,
"step": 3970
},
{
"entropy": 0.3011615663766861,
"epoch": 0.7082480647744461,
"grad_norm": 0.6484375,
"learning_rate": 3.839119859177258e-06,
"loss": 0.30338754653930666,
"mean_token_accuracy": 0.8970853149890899,
"num_tokens": 24568893.0,
"step": 3980
},
{
"entropy": 0.33798819556832316,
"epoch": 0.7100275825251356,
"grad_norm": 0.7578125,
"learning_rate": 3.832903541352244e-06,
"loss": 0.33394012451171873,
"mean_token_accuracy": 0.8847744941711426,
"num_tokens": 24632259.0,
"step": 3990
},
{
"entropy": 0.31967905536293983,
"epoch": 0.7118071002758253,
"grad_norm": 0.8984375,
"learning_rate": 3.8266756880124235e-06,
"loss": 0.3112222671508789,
"mean_token_accuracy": 0.8920404791831971,
"num_tokens": 24689863.0,
"step": 4000
},
{
"entropy": 0.3319928146898746,
"epoch": 0.7135866180265148,
"grad_norm": 0.6640625,
"learning_rate": 3.82043635305629e-06,
"loss": 0.3272392749786377,
"mean_token_accuracy": 0.8864372938871383,
"num_tokens": 24752713.0,
"step": 4010
},
{
"entropy": 0.3551741100847721,
"epoch": 0.7153661357772044,
"grad_norm": 0.7734375,
"learning_rate": 3.814185590481707e-06,
"loss": 0.35248637199401855,
"mean_token_accuracy": 0.8810664594173432,
"num_tokens": 24815372.0,
"step": 4020
},
{
"entropy": 0.30468909814953804,
"epoch": 0.717145653527894,
"grad_norm": 0.7734375,
"learning_rate": 3.8079234543854336e-06,
"loss": 0.30545387268066404,
"mean_token_accuracy": 0.8962846666574478,
"num_tokens": 24877287.0,
"step": 4030
},
{
"entropy": 0.3263218976557255,
"epoch": 0.7189251712785835,
"grad_norm": 0.73046875,
"learning_rate": 3.801649998962663e-06,
"loss": 0.31722159385681153,
"mean_token_accuracy": 0.8882788389921188,
"num_tokens": 24936354.0,
"step": 4040
},
{
"entropy": 0.3239417590200901,
"epoch": 0.7207046890292731,
"grad_norm": 0.7734375,
"learning_rate": 3.7953652785065487e-06,
"loss": 0.3198636770248413,
"mean_token_accuracy": 0.8894559621810914,
"num_tokens": 24996114.0,
"step": 4050
},
{
"entropy": 0.3504368454217911,
"epoch": 0.7224842067799626,
"grad_norm": 0.640625,
"learning_rate": 3.789069347407739e-06,
"loss": 0.35796384811401366,
"mean_token_accuracy": 0.8786458790302276,
"num_tokens": 25059291.0,
"step": 4060
},
{
"entropy": 0.35010237619280815,
"epoch": 0.7242637245306522,
"grad_norm": 0.80078125,
"learning_rate": 3.7827622601539016e-06,
"loss": 0.34798645973205566,
"mean_token_accuracy": 0.8807581603527069,
"num_tokens": 25119238.0,
"step": 4070
},
{
"entropy": 0.3162467695772648,
"epoch": 0.7260432422813418,
"grad_norm": 0.84765625,
"learning_rate": 3.7764440713292555e-06,
"loss": 0.31048390865325926,
"mean_token_accuracy": 0.8938262403011322,
"num_tokens": 25180932.0,
"step": 4080
},
{
"entropy": 0.3140152879059315,
"epoch": 0.7278227600320313,
"grad_norm": 0.55078125,
"learning_rate": 3.770114835614097e-06,
"loss": 0.3161914587020874,
"mean_token_accuracy": 0.8915384441614151,
"num_tokens": 25240081.0,
"step": 4090
},
{
"entropy": 0.31884549781680105,
"epoch": 0.7296022777827209,
"grad_norm": 0.6171875,
"learning_rate": 3.7637746077843273e-06,
"loss": 0.31565608978271487,
"mean_token_accuracy": 0.8926081418991089,
"num_tokens": 25300196.0,
"step": 4100
},
{
"entropy": 0.33241346701979635,
"epoch": 0.7313817955334104,
"grad_norm": 0.63671875,
"learning_rate": 3.7574234427109774e-06,
"loss": 0.333846378326416,
"mean_token_accuracy": 0.8856494903564454,
"num_tokens": 25360762.0,
"step": 4110
},
{
"entropy": 0.3315878137946129,
"epoch": 0.7331613132841001,
"grad_norm": 0.734375,
"learning_rate": 3.7510613953597343e-06,
"loss": 0.32794604301452634,
"mean_token_accuracy": 0.8877955853939057,
"num_tokens": 25419740.0,
"step": 4120
},
{
"entropy": 0.317806626111269,
"epoch": 0.7349408310347896,
"grad_norm": 0.6328125,
"learning_rate": 3.744688520790465e-06,
"loss": 0.3192422389984131,
"mean_token_accuracy": 0.8906554162502289,
"num_tokens": 25483111.0,
"step": 4130
},
{
"entropy": 0.3256954029202461,
"epoch": 0.7367203487854791,
"grad_norm": 0.66015625,
"learning_rate": 3.7383048741567383e-06,
"loss": 0.32516562938690186,
"mean_token_accuracy": 0.8903594017028809,
"num_tokens": 25545176.0,
"step": 4140
},
{
"entropy": 0.31130014136433604,
"epoch": 0.7384998665361687,
"grad_norm": 0.59765625,
"learning_rate": 3.731910510705353e-06,
"loss": 0.3101987361907959,
"mean_token_accuracy": 0.8940740615129471,
"num_tokens": 25610028.0,
"step": 4150
},
{
"entropy": 0.32270723208785057,
"epoch": 0.7402793842868582,
"grad_norm": 0.67578125,
"learning_rate": 3.725505485775851e-06,
"loss": 0.32242374420166015,
"mean_token_accuracy": 0.8896411061286926,
"num_tokens": 25675325.0,
"step": 4160
},
{
"entropy": 0.29772440120577814,
"epoch": 0.7420589020375479,
"grad_norm": 0.78125,
"learning_rate": 3.7190898548000463e-06,
"loss": 0.2905465364456177,
"mean_token_accuracy": 0.8987115979194641,
"num_tokens": 25733221.0,
"step": 4170
},
{
"entropy": 0.324229471385479,
"epoch": 0.7438384197882374,
"grad_norm": 0.76171875,
"learning_rate": 3.7126636733015402e-06,
"loss": 0.31509127616882326,
"mean_token_accuracy": 0.890700826048851,
"num_tokens": 25791510.0,
"step": 4180
},
{
"entropy": 0.31010851040482523,
"epoch": 0.7456179375389269,
"grad_norm": 0.76953125,
"learning_rate": 3.706226996895245e-06,
"loss": 0.3099569797515869,
"mean_token_accuracy": 0.8941543817520141,
"num_tokens": 25849466.0,
"step": 4190
},
{
"entropy": 0.34313676729798315,
"epoch": 0.7473974552896165,
"grad_norm": 0.6640625,
"learning_rate": 3.6997798812868984e-06,
"loss": 0.34426915645599365,
"mean_token_accuracy": 0.8824651181697846,
"num_tokens": 25910712.0,
"step": 4200
},
{
"entropy": 0.32774877846240996,
"epoch": 0.7491769730403061,
"grad_norm": 0.734375,
"learning_rate": 3.6933223822725845e-06,
"loss": 0.32100906372070315,
"mean_token_accuracy": 0.8894315391778946,
"num_tokens": 25968550.0,
"step": 4210
},
{
"entropy": 0.3336882501840591,
"epoch": 0.7509564907909957,
"grad_norm": 0.66015625,
"learning_rate": 3.686854555738249e-06,
"loss": 0.33437650203704833,
"mean_token_accuracy": 0.8851233959197998,
"num_tokens": 26033600.0,
"step": 4220
},
{
"entropy": 0.2877236850559711,
"epoch": 0.7527360085416852,
"grad_norm": 0.6796875,
"learning_rate": 3.680376457659217e-06,
"loss": 0.2838925361633301,
"mean_token_accuracy": 0.9029829859733581,
"num_tokens": 26095581.0,
"step": 4230
},
{
"entropy": 0.35029785335063934,
"epoch": 0.7545155262923747,
"grad_norm": 0.703125,
"learning_rate": 3.6738881440997075e-06,
"loss": 0.35119309425354006,
"mean_token_accuracy": 0.8788535237312317,
"num_tokens": 26160217.0,
"step": 4240
},
{
"entropy": 0.29809832498431205,
"epoch": 0.7562950440430644,
"grad_norm": 0.62890625,
"learning_rate": 3.667389671212349e-06,
"loss": 0.29252660274505615,
"mean_token_accuracy": 0.8990640878677368,
"num_tokens": 26221654.0,
"step": 4250
},
{
"entropy": 0.31378084495663644,
"epoch": 0.7580745617937539,
"grad_norm": 0.67578125,
"learning_rate": 3.660881095237693e-06,
"loss": 0.31973769664764407,
"mean_token_accuracy": 0.8927627056837082,
"num_tokens": 26284680.0,
"step": 4260
},
{
"entropy": 0.321271962672472,
"epoch": 0.7598540795444435,
"grad_norm": 0.6953125,
"learning_rate": 3.654362472503727e-06,
"loss": 0.31966218948364256,
"mean_token_accuracy": 0.8886021912097931,
"num_tokens": 26345881.0,
"step": 4270
},
{
"entropy": 0.33760534003376963,
"epoch": 0.761633597295133,
"grad_norm": 0.69140625,
"learning_rate": 3.647833859425388e-06,
"loss": 0.3323702096939087,
"mean_token_accuracy": 0.8835799127817154,
"num_tokens": 26409130.0,
"step": 4280
},
{
"entropy": 0.3086083874106407,
"epoch": 0.7634131150458225,
"grad_norm": 0.64453125,
"learning_rate": 3.6412953125040732e-06,
"loss": 0.3090954303741455,
"mean_token_accuracy": 0.8938497513532638,
"num_tokens": 26470803.0,
"step": 4290
},
{
"entropy": 0.32356909438967707,
"epoch": 0.7651926327965122,
"grad_norm": 0.6640625,
"learning_rate": 3.6347468883271537e-06,
"loss": 0.32223284244537354,
"mean_token_accuracy": 0.889476266503334,
"num_tokens": 26529276.0,
"step": 4300
},
{
"entropy": 0.3197473108768463,
"epoch": 0.7669721505472017,
"grad_norm": 0.703125,
"learning_rate": 3.628188643567478e-06,
"loss": 0.3182904958724976,
"mean_token_accuracy": 0.8886691510677338,
"num_tokens": 26596912.0,
"step": 4310
},
{
"entropy": 0.3812053255736828,
"epoch": 0.7687516682978913,
"grad_norm": 0.8671875,
"learning_rate": 3.62162063498289e-06,
"loss": 0.38285183906555176,
"mean_token_accuracy": 0.8679445266723633,
"num_tokens": 26654254.0,
"step": 4320
},
{
"entropy": 0.31078105270862577,
"epoch": 0.7705311860485808,
"grad_norm": 0.7734375,
"learning_rate": 3.615042919415734e-06,
"loss": 0.3132502794265747,
"mean_token_accuracy": 0.8936162561178207,
"num_tokens": 26716103.0,
"step": 4330
},
{
"entropy": 0.3245044894516468,
"epoch": 0.7723107037992704,
"grad_norm": 0.7890625,
"learning_rate": 3.608455553792359e-06,
"loss": 0.3191309690475464,
"mean_token_accuracy": 0.8891146034002304,
"num_tokens": 26779123.0,
"step": 4340
},
{
"entropy": 0.3174907624721527,
"epoch": 0.77409022154996,
"grad_norm": 0.68359375,
"learning_rate": 3.601858595122633e-06,
"loss": 0.3181204319000244,
"mean_token_accuracy": 0.8935631543397904,
"num_tokens": 26839576.0,
"step": 4350
},
{
"entropy": 0.31885271072387694,
"epoch": 0.7758697393006495,
"grad_norm": 0.765625,
"learning_rate": 3.5952521004994458e-06,
"loss": 0.32184107303619386,
"mean_token_accuracy": 0.8902066498994827,
"num_tokens": 26895201.0,
"step": 4360
},
{
"entropy": 0.3231876604259014,
"epoch": 0.7776492570513391,
"grad_norm": 0.78515625,
"learning_rate": 3.5886361270982144e-06,
"loss": 0.32304935455322265,
"mean_token_accuracy": 0.890093806385994,
"num_tokens": 26953882.0,
"step": 4370
},
{
"entropy": 0.3525890067219734,
"epoch": 0.7794287748020287,
"grad_norm": 0.75390625,
"learning_rate": 3.58201073217639e-06,
"loss": 0.3533541917800903,
"mean_token_accuracy": 0.878669023513794,
"num_tokens": 27017056.0,
"step": 4380
},
{
"entropy": 0.3424542315304279,
"epoch": 0.7812082925527182,
"grad_norm": 0.68359375,
"learning_rate": 3.5753759730729622e-06,
"loss": 0.3435798406600952,
"mean_token_accuracy": 0.8808376550674438,
"num_tokens": 27082739.0,
"step": 4390
},
{
"entropy": 0.32165568247437476,
"epoch": 0.7829878103034078,
"grad_norm": 0.74609375,
"learning_rate": 3.5687319072079598e-06,
"loss": 0.32462856769561765,
"mean_token_accuracy": 0.8899737745523453,
"num_tokens": 27146140.0,
"step": 4400
},
{
"entropy": 0.3195482023060322,
"epoch": 0.7847673280540973,
"grad_norm": 0.8515625,
"learning_rate": 3.562078592081959e-06,
"loss": 0.316646146774292,
"mean_token_accuracy": 0.889157748222351,
"num_tokens": 27209934.0,
"step": 4410
},
{
"entropy": 0.3287908561527729,
"epoch": 0.786546845804787,
"grad_norm": 0.640625,
"learning_rate": 3.5554160852755814e-06,
"loss": 0.31769742965698244,
"mean_token_accuracy": 0.8902658313512802,
"num_tokens": 27272543.0,
"step": 4420
},
{
"entropy": 0.3061469428241253,
"epoch": 0.7883263635554765,
"grad_norm": 0.66796875,
"learning_rate": 3.5487444444489976e-06,
"loss": 0.3056464433670044,
"mean_token_accuracy": 0.8966052442789078,
"num_tokens": 27332924.0,
"step": 4430
},
{
"entropy": 0.3140795312821865,
"epoch": 0.790105881306166,
"grad_norm": 0.625,
"learning_rate": 3.5420637273414294e-06,
"loss": 0.31083250045776367,
"mean_token_accuracy": 0.8935318052768707,
"num_tokens": 27398649.0,
"step": 4440
},
{
"entropy": 0.320087730884552,
"epoch": 0.7918853990568556,
"grad_norm": 0.62109375,
"learning_rate": 3.5353739917706465e-06,
"loss": 0.31650235652923586,
"mean_token_accuracy": 0.8917651563882828,
"num_tokens": 27463481.0,
"step": 4450
},
{
"entropy": 0.30691038966178896,
"epoch": 0.7936649168075451,
"grad_norm": 0.68359375,
"learning_rate": 3.528675295632468e-06,
"loss": 0.3032836437225342,
"mean_token_accuracy": 0.8962341576814652,
"num_tokens": 27525465.0,
"step": 4460
},
{
"entropy": 0.292752119153738,
"epoch": 0.7954444345582348,
"grad_norm": 0.6953125,
"learning_rate": 3.521967696900265e-06,
"loss": 0.2833605527877808,
"mean_token_accuracy": 0.9019985139369965,
"num_tokens": 27583912.0,
"step": 4470
},
{
"entropy": 0.31720383539795877,
"epoch": 0.7972239523089243,
"grad_norm": 0.671875,
"learning_rate": 3.515251253624452e-06,
"loss": 0.3143874406814575,
"mean_token_accuracy": 0.8920644462108612,
"num_tokens": 27643989.0,
"step": 4480
},
{
"entropy": 0.3354278527200222,
"epoch": 0.7990034700596138,
"grad_norm": 0.88671875,
"learning_rate": 3.508526023931988e-06,
"loss": 0.33093791007995604,
"mean_token_accuracy": 0.8850998103618621,
"num_tokens": 27707096.0,
"step": 4490
},
{
"entropy": 0.32125698402523994,
"epoch": 0.8007829878103034,
"grad_norm": 0.7734375,
"learning_rate": 3.501792066025876e-06,
"loss": 0.3226289749145508,
"mean_token_accuracy": 0.8903116554021835,
"num_tokens": 27770400.0,
"step": 4500
},
{
"entropy": 0.3024943955242634,
"epoch": 0.802562505560993,
"grad_norm": 0.7421875,
"learning_rate": 3.495049438184653e-06,
"loss": 0.2999032735824585,
"mean_token_accuracy": 0.8976153939962387,
"num_tokens": 27833252.0,
"step": 4510
},
{
"entropy": 0.32913830801844596,
"epoch": 0.8043420233116826,
"grad_norm": 0.7578125,
"learning_rate": 3.4882981987618936e-06,
"loss": 0.32823073863983154,
"mean_token_accuracy": 0.885203304886818,
"num_tokens": 27893214.0,
"step": 4520
},
{
"entropy": 0.2997400566935539,
"epoch": 0.8061215410623721,
"grad_norm": 0.66015625,
"learning_rate": 3.4815384061856982e-06,
"loss": 0.29881627559661866,
"mean_token_accuracy": 0.8972623527050019,
"num_tokens": 27953564.0,
"step": 4530
},
{
"entropy": 0.3361620880663395,
"epoch": 0.8079010588130616,
"grad_norm": 0.625,
"learning_rate": 3.4747701189581882e-06,
"loss": 0.3341663360595703,
"mean_token_accuracy": 0.8846073895692825,
"num_tokens": 28017405.0,
"step": 4540
},
{
"entropy": 0.3635567151010036,
"epoch": 0.8096805765637513,
"grad_norm": 0.83203125,
"learning_rate": 3.467993395655006e-06,
"loss": 0.36700680255889895,
"mean_token_accuracy": 0.8747879892587662,
"num_tokens": 28077105.0,
"step": 4550
},
{
"entropy": 0.31662830635905265,
"epoch": 0.8114600943144408,
"grad_norm": 0.71484375,
"learning_rate": 3.4612082949247984e-06,
"loss": 0.31666059494018556,
"mean_token_accuracy": 0.8936580032110214,
"num_tokens": 28135946.0,
"step": 4560
},
{
"entropy": 0.3208633802831173,
"epoch": 0.8132396120651304,
"grad_norm": 0.671875,
"learning_rate": 3.4544148754887174e-06,
"loss": 0.3186974048614502,
"mean_token_accuracy": 0.8887600839138031,
"num_tokens": 28199470.0,
"step": 4570
},
{
"entropy": 0.3209241934120655,
"epoch": 0.8150191298158199,
"grad_norm": 0.71484375,
"learning_rate": 3.4476131961399072e-06,
"loss": 0.31809191703796386,
"mean_token_accuracy": 0.8910164386034012,
"num_tokens": 28258317.0,
"step": 4580
},
{
"entropy": 0.273921088129282,
"epoch": 0.8167986475665094,
"grad_norm": 0.58203125,
"learning_rate": 3.440803315742997e-06,
"loss": 0.27063875198364257,
"mean_token_accuracy": 0.9077308356761933,
"num_tokens": 28317331.0,
"step": 4590
},
{
"entropy": 0.3269231304526329,
"epoch": 0.8185781653171991,
"grad_norm": 0.703125,
"learning_rate": 3.4339852932335913e-06,
"loss": 0.32116925716400146,
"mean_token_accuracy": 0.8885051965713501,
"num_tokens": 28377310.0,
"step": 4600
},
{
"entropy": 0.34382307529449463,
"epoch": 0.8203576830678886,
"grad_norm": 0.6953125,
"learning_rate": 3.42715918761776e-06,
"loss": 0.33684279918670657,
"mean_token_accuracy": 0.8819504231214523,
"num_tokens": 28439237.0,
"step": 4610
},
{
"entropy": 0.34571648091077806,
"epoch": 0.8221372008185782,
"grad_norm": 0.67578125,
"learning_rate": 3.4203250579715293e-06,
"loss": 0.34270668029785156,
"mean_token_accuracy": 0.8804600208997726,
"num_tokens": 28503776.0,
"step": 4620
},
{
"entropy": 0.3633879840373993,
"epoch": 0.8239167185692677,
"grad_norm": 0.72265625,
"learning_rate": 3.413482963440365e-06,
"loss": 0.36074531078338623,
"mean_token_accuracy": 0.8749166995286941,
"num_tokens": 28566682.0,
"step": 4630
},
{
"entropy": 0.33480159640312196,
"epoch": 0.8256962363199573,
"grad_norm": 0.6640625,
"learning_rate": 3.4066329632386676e-06,
"loss": 0.3376650810241699,
"mean_token_accuracy": 0.8848024159669876,
"num_tokens": 28627306.0,
"step": 4640
},
{
"entropy": 0.33422539532184603,
"epoch": 0.8274757540706469,
"grad_norm": 0.71484375,
"learning_rate": 3.3997751166492554e-06,
"loss": 0.3305016756057739,
"mean_token_accuracy": 0.8843177795410156,
"num_tokens": 28688008.0,
"step": 4650
},
{
"entropy": 0.3220311067998409,
"epoch": 0.8292552718213364,
"grad_norm": 0.640625,
"learning_rate": 3.3929094830228525e-06,
"loss": 0.3276401996612549,
"mean_token_accuracy": 0.8901763200759888,
"num_tokens": 28749007.0,
"step": 4660
},
{
"entropy": 0.3371203623712063,
"epoch": 0.831034789572026,
"grad_norm": 0.67578125,
"learning_rate": 3.3860361217775766e-06,
"loss": 0.33961422443389894,
"mean_token_accuracy": 0.8825581848621369,
"num_tokens": 28813793.0,
"step": 4670
},
{
"entropy": 0.3083579756319523,
"epoch": 0.8328143073227156,
"grad_norm": 0.640625,
"learning_rate": 3.379155092398423e-06,
"loss": 0.3052903890609741,
"mean_token_accuracy": 0.896553099155426,
"num_tokens": 28877353.0,
"step": 4680
},
{
"entropy": 0.30851706936955453,
"epoch": 0.8345938250734051,
"grad_norm": 0.80078125,
"learning_rate": 3.3722664544367484e-06,
"loss": 0.3021129369735718,
"mean_token_accuracy": 0.8970968216657639,
"num_tokens": 28938324.0,
"step": 4690
},
{
"entropy": 0.3352122865617275,
"epoch": 0.8363733428240947,
"grad_norm": 0.6484375,
"learning_rate": 3.36537026750976e-06,
"loss": 0.3348966121673584,
"mean_token_accuracy": 0.88336381316185,
"num_tokens": 29004097.0,
"step": 4700
},
{
"entropy": 0.3120702989399433,
"epoch": 0.8381528605747842,
"grad_norm": 0.67578125,
"learning_rate": 3.358466591299996e-06,
"loss": 0.30483720302581785,
"mean_token_accuracy": 0.8936588197946549,
"num_tokens": 29065784.0,
"step": 4710
},
{
"entropy": 0.3325718879699707,
"epoch": 0.8399323783254738,
"grad_norm": 0.79296875,
"learning_rate": 3.3515554855548096e-06,
"loss": 0.32906949520111084,
"mean_token_accuracy": 0.8850819796323777,
"num_tokens": 29127736.0,
"step": 4720
},
{
"entropy": 0.3285450778901577,
"epoch": 0.8417118960761634,
"grad_norm": 0.671875,
"learning_rate": 3.3446370100858522e-06,
"loss": 0.3254601716995239,
"mean_token_accuracy": 0.8865422040224076,
"num_tokens": 29190177.0,
"step": 4730
},
{
"entropy": 0.28994656801223756,
"epoch": 0.8434914138268529,
"grad_norm": 0.7421875,
"learning_rate": 3.3377112247685573e-06,
"loss": 0.28107192516326907,
"mean_token_accuracy": 0.9041391044855118,
"num_tokens": 29250031.0,
"step": 4740
},
{
"entropy": 0.3076285161077976,
"epoch": 0.8452709315775425,
"grad_norm": 0.66015625,
"learning_rate": 3.330778189541619e-06,
"loss": 0.30392696857452395,
"mean_token_accuracy": 0.8945790320634842,
"num_tokens": 29309661.0,
"step": 4750
},
{
"entropy": 0.33427241295576093,
"epoch": 0.847050449328232,
"grad_norm": 0.83203125,
"learning_rate": 3.3238379644064783e-06,
"loss": 0.33776178359985354,
"mean_token_accuracy": 0.8858144342899322,
"num_tokens": 29371802.0,
"step": 4760
},
{
"entropy": 0.3116602420806885,
"epoch": 0.8488299670789217,
"grad_norm": 0.625,
"learning_rate": 3.3168906094267967e-06,
"loss": 0.3052891492843628,
"mean_token_accuracy": 0.8943425059318543,
"num_tokens": 29434948.0,
"step": 4770
},
{
"entropy": 0.32457049414515493,
"epoch": 0.8506094848296112,
"grad_norm": 0.7421875,
"learning_rate": 3.3099361847279437e-06,
"loss": 0.33092737197875977,
"mean_token_accuracy": 0.8910484194755555,
"num_tokens": 29494725.0,
"step": 4780
},
{
"entropy": 0.302114712446928,
"epoch": 0.8523890025803007,
"grad_norm": 0.828125,
"learning_rate": 3.302974750496471e-06,
"loss": 0.30364136695861815,
"mean_token_accuracy": 0.8976742386817932,
"num_tokens": 29554456.0,
"step": 4790
},
{
"entropy": 0.3033088490366936,
"epoch": 0.8541685203309903,
"grad_norm": 0.79296875,
"learning_rate": 3.2960063669795956e-06,
"loss": 0.29857096672058103,
"mean_token_accuracy": 0.898243761062622,
"num_tokens": 29614042.0,
"step": 4800
},
{
"entropy": 0.3380900904536247,
"epoch": 0.8559480380816799,
"grad_norm": 0.85546875,
"learning_rate": 3.289031094484675e-06,
"loss": 0.3389381170272827,
"mean_token_accuracy": 0.8845224976539612,
"num_tokens": 29677174.0,
"step": 4810
},
{
"entropy": 0.3290810391306877,
"epoch": 0.8577275558323695,
"grad_norm": 0.81640625,
"learning_rate": 3.2820489933786875e-06,
"loss": 0.33188159465789796,
"mean_token_accuracy": 0.8866541266441346,
"num_tokens": 29736691.0,
"step": 4820
},
{
"entropy": 0.2920307211577892,
"epoch": 0.859507073583059,
"grad_norm": 0.78515625,
"learning_rate": 3.275060124087709e-06,
"loss": 0.29009830951690674,
"mean_token_accuracy": 0.9002358585596084,
"num_tokens": 29798516.0,
"step": 4830
},
{
"entropy": 0.29397579804062846,
"epoch": 0.8612865913337485,
"grad_norm": 0.7421875,
"learning_rate": 3.26806454709639e-06,
"loss": 0.2932556629180908,
"mean_token_accuracy": 0.8990721523761749,
"num_tokens": 29862063.0,
"step": 4840
},
{
"entropy": 0.3458250969648361,
"epoch": 0.8630661090844381,
"grad_norm": 0.734375,
"learning_rate": 3.2610623229474338e-06,
"loss": 0.3443866968154907,
"mean_token_accuracy": 0.8816304355859756,
"num_tokens": 29923575.0,
"step": 4850
},
{
"entropy": 0.36488995850086214,
"epoch": 0.8648456268351277,
"grad_norm": 0.7890625,
"learning_rate": 3.2540535122410688e-06,
"loss": 0.36513805389404297,
"mean_token_accuracy": 0.8745848000049591,
"num_tokens": 29986708.0,
"step": 4860
},
{
"entropy": 0.3534575715661049,
"epoch": 0.8666251445858173,
"grad_norm": 0.5859375,
"learning_rate": 3.2470381756345277e-06,
"loss": 0.35421276092529297,
"mean_token_accuracy": 0.8764419466257095,
"num_tokens": 30049680.0,
"step": 4870
},
{
"entropy": 0.3211802035570145,
"epoch": 0.8684046623365068,
"grad_norm": 0.7265625,
"learning_rate": 3.2400163738415203e-06,
"loss": 0.3255388498306274,
"mean_token_accuracy": 0.8901415437459945,
"num_tokens": 30111870.0,
"step": 4880
},
{
"entropy": 0.35184849202632906,
"epoch": 0.8701841800871963,
"grad_norm": 0.7421875,
"learning_rate": 3.232988167631709e-06,
"loss": 0.34560813903808596,
"mean_token_accuracy": 0.8822193145751953,
"num_tokens": 30169341.0,
"step": 4890
},
{
"entropy": 0.3080457031726837,
"epoch": 0.871963697837886,
"grad_norm": 0.8671875,
"learning_rate": 3.2259536178301837e-06,
"loss": 0.3061460018157959,
"mean_token_accuracy": 0.8952270209789276,
"num_tokens": 30231620.0,
"step": 4900
},
{
"entropy": 0.29343165159225465,
"epoch": 0.8737432155885755,
"grad_norm": 0.69921875,
"learning_rate": 3.2189127853169334e-06,
"loss": 0.2953195571899414,
"mean_token_accuracy": 0.8999059438705445,
"num_tokens": 30290449.0,
"step": 4910
},
{
"entropy": 0.33980847895145416,
"epoch": 0.8755227333392651,
"grad_norm": 0.765625,
"learning_rate": 3.2118657310263203e-06,
"loss": 0.3384739398956299,
"mean_token_accuracy": 0.8851828873157501,
"num_tokens": 30349145.0,
"step": 4920
},
{
"entropy": 0.2769637621939182,
"epoch": 0.8773022510899546,
"grad_norm": 0.671875,
"learning_rate": 3.204812515946554e-06,
"loss": 0.27285265922546387,
"mean_token_accuracy": 0.9055190175771713,
"num_tokens": 30410943.0,
"step": 4930
},
{
"entropy": 0.3305617295205593,
"epoch": 0.8790817688406442,
"grad_norm": 0.7421875,
"learning_rate": 3.19775320111916e-06,
"loss": 0.3289092302322388,
"mean_token_accuracy": 0.8878835290670395,
"num_tokens": 30471247.0,
"step": 4940
},
{
"entropy": 0.3315125398337841,
"epoch": 0.8808612865913338,
"grad_norm": 0.84765625,
"learning_rate": 3.190687847638455e-06,
"loss": 0.33691017627716063,
"mean_token_accuracy": 0.885476291179657,
"num_tokens": 30528743.0,
"step": 4950
},
{
"entropy": 0.3292131364345551,
"epoch": 0.8826408043420233,
"grad_norm": 0.70703125,
"learning_rate": 3.183616516651017e-06,
"loss": 0.3279974937438965,
"mean_token_accuracy": 0.8860602885484695,
"num_tokens": 30593102.0,
"step": 4960
},
{
"entropy": 0.31235293224453925,
"epoch": 0.8844203220927129,
"grad_norm": 0.75,
"learning_rate": 3.1765392693551554e-06,
"loss": 0.3092717170715332,
"mean_token_accuracy": 0.8939553201198578,
"num_tokens": 30656297.0,
"step": 4970
},
{
"entropy": 0.32466802522540095,
"epoch": 0.8861998398434024,
"grad_norm": 0.70703125,
"learning_rate": 3.1694561670003814e-06,
"loss": 0.32361798286437987,
"mean_token_accuracy": 0.8885882467031478,
"num_tokens": 30718179.0,
"step": 4980
},
{
"entropy": 0.3157695658504963,
"epoch": 0.887979357594092,
"grad_norm": 0.8203125,
"learning_rate": 3.162367270886878e-06,
"loss": 0.31475324630737306,
"mean_token_accuracy": 0.8932778269052506,
"num_tokens": 30777551.0,
"step": 4990
},
{
"entropy": 0.3407856084406376,
"epoch": 0.8897588753447816,
"grad_norm": 0.8046875,
"learning_rate": 3.1552726423649727e-06,
"loss": 0.34217305183410646,
"mean_token_accuracy": 0.8833808153867722,
"num_tokens": 30838659.0,
"step": 5000
},
{
"entropy": 0.316268477588892,
"epoch": 0.8915383930954711,
"grad_norm": 0.8359375,
"learning_rate": 3.1481723428346002e-06,
"loss": 0.3134847402572632,
"mean_token_accuracy": 0.8923056960105896,
"num_tokens": 30900473.0,
"step": 5010
},
{
"entropy": 0.33296806216239927,
"epoch": 0.8933179108461607,
"grad_norm": 0.66015625,
"learning_rate": 3.141066433744776e-06,
"loss": 0.3330418109893799,
"mean_token_accuracy": 0.8851635575294494,
"num_tokens": 30962254.0,
"step": 5020
},
{
"entropy": 0.3682249844074249,
"epoch": 0.8950974285968503,
"grad_norm": 0.79296875,
"learning_rate": 3.1339549765930642e-06,
"loss": 0.3663476943969727,
"mean_token_accuracy": 0.8738820075988769,
"num_tokens": 31026440.0,
"step": 5030
},
{
"entropy": 0.33433615118265153,
"epoch": 0.8968769463475398,
"grad_norm": 0.8046875,
"learning_rate": 3.1268380329250415e-06,
"loss": 0.33242876529693605,
"mean_token_accuracy": 0.8840222060680389,
"num_tokens": 31089983.0,
"step": 5040
},
{
"entropy": 0.32239319905638697,
"epoch": 0.8986564640982294,
"grad_norm": 0.67578125,
"learning_rate": 3.1197156643337704e-06,
"loss": 0.32181596755981445,
"mean_token_accuracy": 0.8900126188993454,
"num_tokens": 31150387.0,
"step": 5050
},
{
"entropy": 0.3059133619070053,
"epoch": 0.9004359818489189,
"grad_norm": 0.73046875,
"learning_rate": 3.11258793245926e-06,
"loss": 0.3009922742843628,
"mean_token_accuracy": 0.8963076531887054,
"num_tokens": 31211896.0,
"step": 5060
},
{
"entropy": 0.31035120561718943,
"epoch": 0.9022154995996086,
"grad_norm": 0.58203125,
"learning_rate": 3.1054548989879384e-06,
"loss": 0.3091509580612183,
"mean_token_accuracy": 0.8934770673513412,
"num_tokens": 31276154.0,
"step": 5070
},
{
"entropy": 0.3153481140732765,
"epoch": 0.9039950173502981,
"grad_norm": 0.85546875,
"learning_rate": 3.0983166256521143e-06,
"loss": 0.31192855834960936,
"mean_token_accuracy": 0.8923483729362488,
"num_tokens": 31340158.0,
"step": 5080
},
{
"entropy": 0.3468318752944469,
"epoch": 0.9057745351009876,
"grad_norm": 0.71875,
"learning_rate": 3.091173174229443e-06,
"loss": 0.3485881805419922,
"mean_token_accuracy": 0.8794867992401123,
"num_tokens": 31401561.0,
"step": 5090
},
{
"entropy": 0.31567842736840246,
"epoch": 0.9075540528516772,
"grad_norm": 0.66015625,
"learning_rate": 3.0840246065423973e-06,
"loss": 0.31265921592712403,
"mean_token_accuracy": 0.8923265129327774,
"num_tokens": 31466614.0,
"step": 5100
},
{
"entropy": 0.32619010731577874,
"epoch": 0.9093335706023667,
"grad_norm": 0.69140625,
"learning_rate": 3.0768709844577242e-06,
"loss": 0.32789175510406493,
"mean_token_accuracy": 0.8868863344192505,
"num_tokens": 31531831.0,
"step": 5110
},
{
"entropy": 0.33005650117993357,
"epoch": 0.9111130883530563,
"grad_norm": 0.6796875,
"learning_rate": 3.069712369885916e-06,
"loss": 0.33037724494934084,
"mean_token_accuracy": 0.8874419242143631,
"num_tokens": 31591886.0,
"step": 5120
},
{
"entropy": 0.3145495943725109,
"epoch": 0.9128926061037459,
"grad_norm": 0.62109375,
"learning_rate": 3.0625488247806713e-06,
"loss": 0.3168666362762451,
"mean_token_accuracy": 0.8938749313354493,
"num_tokens": 31654824.0,
"step": 5130
},
{
"entropy": 0.31578297838568686,
"epoch": 0.9146721238544354,
"grad_norm": 0.85546875,
"learning_rate": 3.0553804111383584e-06,
"loss": 0.3153775453567505,
"mean_token_accuracy": 0.8912237852811813,
"num_tokens": 31715305.0,
"step": 5140
},
{
"entropy": 0.31291085556149484,
"epoch": 0.916451641605125,
"grad_norm": 0.6171875,
"learning_rate": 3.0482071909974837e-06,
"loss": 0.30238804817199705,
"mean_token_accuracy": 0.8952312111854553,
"num_tokens": 31778897.0,
"step": 5150
},
{
"entropy": 0.3241974800825119,
"epoch": 0.9182311593558146,
"grad_norm": 0.80078125,
"learning_rate": 3.0410292264381474e-06,
"loss": 0.32109644412994387,
"mean_token_accuracy": 0.8890012890100479,
"num_tokens": 31842213.0,
"step": 5160
},
{
"entropy": 0.316234128177166,
"epoch": 0.9200106771065041,
"grad_norm": 0.71875,
"learning_rate": 3.0338465795815116e-06,
"loss": 0.31609477996826174,
"mean_token_accuracy": 0.8918006688356399,
"num_tokens": 31905718.0,
"step": 5170
},
{
"entropy": 0.363042201846838,
"epoch": 0.9217901948571937,
"grad_norm": 0.73828125,
"learning_rate": 3.02665931258926e-06,
"loss": 0.3673147916793823,
"mean_token_accuracy": 0.8740256160497666,
"num_tokens": 31969774.0,
"step": 5180
},
{
"entropy": 0.36331501603126526,
"epoch": 0.9235697126078832,
"grad_norm": 0.8984375,
"learning_rate": 3.0194674876630616e-06,
"loss": 0.35879006385803225,
"mean_token_accuracy": 0.875640943646431,
"num_tokens": 32029550.0,
"step": 5190
},
{
"entropy": 0.3422251008450985,
"epoch": 0.9253492303585729,
"grad_norm": 0.765625,
"learning_rate": 3.0122711670440326e-06,
"loss": 0.3336863279342651,
"mean_token_accuracy": 0.8831895589828491,
"num_tokens": 32089119.0,
"step": 5200
},
{
"entropy": 0.32116865143179896,
"epoch": 0.9271287481092624,
"grad_norm": 0.80078125,
"learning_rate": 3.0050704130121955e-06,
"loss": 0.31827397346496583,
"mean_token_accuracy": 0.8888093143701553,
"num_tokens": 32151585.0,
"step": 5210
},
{
"entropy": 0.35903649777173996,
"epoch": 0.9289082658599519,
"grad_norm": 0.68359375,
"learning_rate": 2.99786528788594e-06,
"loss": 0.35434813499450685,
"mean_token_accuracy": 0.8781492948532105,
"num_tokens": 32211905.0,
"step": 5220
},
{
"entropy": 0.32957206293940544,
"epoch": 0.9306877836106415,
"grad_norm": 0.71484375,
"learning_rate": 2.99065585402149e-06,
"loss": 0.3254066228866577,
"mean_token_accuracy": 0.885261994600296,
"num_tokens": 32269838.0,
"step": 5230
},
{
"entropy": 0.3350566834211349,
"epoch": 0.932467301361331,
"grad_norm": 0.734375,
"learning_rate": 2.983442173812354e-06,
"loss": 0.3390789031982422,
"mean_token_accuracy": 0.8853450924158096,
"num_tokens": 32330761.0,
"step": 5240
},
{
"entropy": 0.3244143448770046,
"epoch": 0.9342468191120207,
"grad_norm": 0.69140625,
"learning_rate": 2.9762243096887928e-06,
"loss": 0.3215372562408447,
"mean_token_accuracy": 0.89001205265522,
"num_tokens": 32390930.0,
"step": 5250
},
{
"entropy": 0.3136039458215237,
"epoch": 0.9360263368627102,
"grad_norm": 0.640625,
"learning_rate": 2.969002324117276e-06,
"loss": 0.30731494426727296,
"mean_token_accuracy": 0.8921667337417603,
"num_tokens": 32454361.0,
"step": 5260
},
{
"entropy": 0.31152409985661506,
"epoch": 0.9378058546133997,
"grad_norm": 0.69140625,
"learning_rate": 2.961776279599941e-06,
"loss": 0.31525585651397703,
"mean_token_accuracy": 0.8938525497913361,
"num_tokens": 32515497.0,
"step": 5270
},
{
"entropy": 0.3264880500733852,
"epoch": 0.9395853723640893,
"grad_norm": 0.8125,
"learning_rate": 2.9545462386740553e-06,
"loss": 0.3251985549926758,
"mean_token_accuracy": 0.8883378058671951,
"num_tokens": 32578453.0,
"step": 5280
},
{
"entropy": 0.3283020846545696,
"epoch": 0.9413648901147789,
"grad_norm": 0.75,
"learning_rate": 2.947312263911471e-06,
"loss": 0.3329939365386963,
"mean_token_accuracy": 0.8853492170572281,
"num_tokens": 32643555.0,
"step": 5290
},
{
"entropy": 0.31003125831484796,
"epoch": 0.9431444078654685,
"grad_norm": 0.65234375,
"learning_rate": 2.9400744179180857e-06,
"loss": 0.3083526372909546,
"mean_token_accuracy": 0.8943161189556121,
"num_tokens": 32705844.0,
"step": 5300
},
{
"entropy": 0.28054061383008955,
"epoch": 0.944923925616158,
"grad_norm": 0.66015625,
"learning_rate": 2.9328327633333016e-06,
"loss": 0.27966985702514646,
"mean_token_accuracy": 0.9065906196832657,
"num_tokens": 32765682.0,
"step": 5310
},
{
"entropy": 0.33282921388745307,
"epoch": 0.9467034433668475,
"grad_norm": 0.640625,
"learning_rate": 2.925587362829479e-06,
"loss": 0.3254220962524414,
"mean_token_accuracy": 0.8870999902486801,
"num_tokens": 32828237.0,
"step": 5320
},
{
"entropy": 0.35021237581968306,
"epoch": 0.9484829611175372,
"grad_norm": 0.6875,
"learning_rate": 2.918338279111402e-06,
"loss": 0.3531177520751953,
"mean_token_accuracy": 0.8790487974882126,
"num_tokens": 32892656.0,
"step": 5330
},
{
"entropy": 0.29660406410694123,
"epoch": 0.9502624788682267,
"grad_norm": 0.71875,
"learning_rate": 2.9110855749157247e-06,
"loss": 0.2960149049758911,
"mean_token_accuracy": 0.8969713002443314,
"num_tokens": 32956743.0,
"step": 5340
},
{
"entropy": 0.31396700665354726,
"epoch": 0.9520419966189163,
"grad_norm": 0.7265625,
"learning_rate": 2.9038293130104397e-06,
"loss": 0.3152457237243652,
"mean_token_accuracy": 0.8920667231082916,
"num_tokens": 33019791.0,
"step": 5350
},
{
"entropy": 0.3239952839910984,
"epoch": 0.9538215143696058,
"grad_norm": 0.671875,
"learning_rate": 2.8965695561943263e-06,
"loss": 0.32175612449645996,
"mean_token_accuracy": 0.8889258235692978,
"num_tokens": 33086397.0,
"step": 5360
},
{
"entropy": 0.3190963797271252,
"epoch": 0.9556010321202953,
"grad_norm": 0.73828125,
"learning_rate": 2.889306367296411e-06,
"loss": 0.3171302080154419,
"mean_token_accuracy": 0.8905750632286071,
"num_tokens": 33150014.0,
"step": 5370
},
{
"entropy": 0.31850261464715,
"epoch": 0.957380549870985,
"grad_norm": 0.6875,
"learning_rate": 2.882039809175424e-06,
"loss": 0.3195357799530029,
"mean_token_accuracy": 0.890536653995514,
"num_tokens": 33211415.0,
"step": 5380
},
{
"entropy": 0.31150018870830537,
"epoch": 0.9591600676216745,
"grad_norm": 0.859375,
"learning_rate": 2.8747699447192536e-06,
"loss": 0.31338660717010497,
"mean_token_accuracy": 0.8935931742191314,
"num_tokens": 33273358.0,
"step": 5390
},
{
"entropy": 0.3056714966893196,
"epoch": 0.9609395853723641,
"grad_norm": 0.59375,
"learning_rate": 2.8674968368444004e-06,
"loss": 0.3025672435760498,
"mean_token_accuracy": 0.8964046210050582,
"num_tokens": 33336869.0,
"step": 5400
},
{
"entropy": 0.31171972677111626,
"epoch": 0.9627191031230536,
"grad_norm": 0.66796875,
"learning_rate": 2.86022054849544e-06,
"loss": 0.3139855146408081,
"mean_token_accuracy": 0.8938859939575196,
"num_tokens": 33394715.0,
"step": 5410
},
{
"entropy": 0.3110303595662117,
"epoch": 0.9644986208737432,
"grad_norm": 0.703125,
"learning_rate": 2.852941142644467e-06,
"loss": 0.3146480083465576,
"mean_token_accuracy": 0.8919815003871918,
"num_tokens": 33455275.0,
"step": 5420
},
{
"entropy": 0.3318745605647564,
"epoch": 0.9662781386244328,
"grad_norm": 0.67578125,
"learning_rate": 2.845658682290562e-06,
"loss": 0.33428895473480225,
"mean_token_accuracy": 0.8868581712245941,
"num_tokens": 33521328.0,
"step": 5430
},
{
"entropy": 0.32524766102433206,
"epoch": 0.9680576563751223,
"grad_norm": 0.890625,
"learning_rate": 2.8383732304592353e-06,
"loss": 0.32019040584564207,
"mean_token_accuracy": 0.8889807224273681,
"num_tokens": 33582622.0,
"step": 5440
},
{
"entropy": 0.31952634900808335,
"epoch": 0.9698371741258119,
"grad_norm": 0.62890625,
"learning_rate": 2.8310848502018913e-06,
"loss": 0.3131838798522949,
"mean_token_accuracy": 0.8926309943199158,
"num_tokens": 33641393.0,
"step": 5450
},
{
"entropy": 0.3325915150344372,
"epoch": 0.9716166918765015,
"grad_norm": 0.703125,
"learning_rate": 2.8237936045952753e-06,
"loss": 0.33072264194488527,
"mean_token_accuracy": 0.886261397600174,
"num_tokens": 33697688.0,
"step": 5460
},
{
"entropy": 0.3559048496186733,
"epoch": 0.973396209627191,
"grad_norm": 0.85546875,
"learning_rate": 2.8164995567409303e-06,
"loss": 0.361460542678833,
"mean_token_accuracy": 0.8776622712612152,
"num_tokens": 33759995.0,
"step": 5470
},
{
"entropy": 0.3113952338695526,
"epoch": 0.9751757273778806,
"grad_norm": 0.671875,
"learning_rate": 2.809202769764655e-06,
"loss": 0.31021485328674314,
"mean_token_accuracy": 0.8931919723749161,
"num_tokens": 33827541.0,
"step": 5480
},
{
"entropy": 0.32099704146385194,
"epoch": 0.9769552451285701,
"grad_norm": 0.765625,
"learning_rate": 2.8019033068159483e-06,
"loss": 0.31149590015411377,
"mean_token_accuracy": 0.890517508983612,
"num_tokens": 33884287.0,
"step": 5490
},
{
"entropy": 0.32434547394514085,
"epoch": 0.9787347628792598,
"grad_norm": 0.87109375,
"learning_rate": 2.7946012310674723e-06,
"loss": 0.3216128349304199,
"mean_token_accuracy": 0.8901405483484268,
"num_tokens": 33943895.0,
"step": 5500
},
{
"entropy": 0.38828401267528534,
"epoch": 0.9805142806299493,
"grad_norm": 0.7109375,
"learning_rate": 2.7872966057145e-06,
"loss": 0.38836209774017333,
"mean_token_accuracy": 0.8656457990407944,
"num_tokens": 34005669.0,
"step": 5510
},
{
"entropy": 0.3450230464339256,
"epoch": 0.9822937983806388,
"grad_norm": 0.8984375,
"learning_rate": 2.7799894939743682e-06,
"loss": 0.3446993112564087,
"mean_token_accuracy": 0.8808085441589355,
"num_tokens": 34067528.0,
"step": 5520
},
{
"entropy": 0.32642928287386896,
"epoch": 0.9840733161313284,
"grad_norm": 0.6171875,
"learning_rate": 2.7726799590859336e-06,
"loss": 0.3271129608154297,
"mean_token_accuracy": 0.8889746874570846,
"num_tokens": 34128047.0,
"step": 5530
},
{
"entropy": 0.2980583220720291,
"epoch": 0.9858528338820179,
"grad_norm": 0.6015625,
"learning_rate": 2.7653680643090247e-06,
"loss": 0.2943974256515503,
"mean_token_accuracy": 0.8994252145290375,
"num_tokens": 34189618.0,
"step": 5540
},
{
"entropy": 0.3192008055746555,
"epoch": 0.9876323516327076,
"grad_norm": 0.734375,
"learning_rate": 2.758053872923891e-06,
"loss": 0.3172843217849731,
"mean_token_accuracy": 0.8905525475740432,
"num_tokens": 34255450.0,
"step": 5550
},
{
"entropy": 0.319820112735033,
"epoch": 0.9894118693833971,
"grad_norm": 0.7265625,
"learning_rate": 2.7507374482306603e-06,
"loss": 0.316086483001709,
"mean_token_accuracy": 0.8913855284452439,
"num_tokens": 34316630.0,
"step": 5560
},
{
"entropy": 0.3039404682815075,
"epoch": 0.9911913871340866,
"grad_norm": 0.73828125,
"learning_rate": 2.7434188535487867e-06,
"loss": 0.3039390563964844,
"mean_token_accuracy": 0.8969542562961579,
"num_tokens": 34381262.0,
"step": 5570
},
{
"entropy": 0.29476389065384867,
"epoch": 0.9929709048847762,
"grad_norm": 0.65234375,
"learning_rate": 2.7360981522165046e-06,
"loss": 0.292004656791687,
"mean_token_accuracy": 0.9019516199827194,
"num_tokens": 34443316.0,
"step": 5580
},
{
"entropy": 0.3337429530918598,
"epoch": 0.9947504226354658,
"grad_norm": 0.78515625,
"learning_rate": 2.728775407590282e-06,
"loss": 0.3344456911087036,
"mean_token_accuracy": 0.8843173295259475,
"num_tokens": 34506285.0,
"step": 5590
},
{
"entropy": 0.32889760509133337,
"epoch": 0.9965299403861554,
"grad_norm": 0.73828125,
"learning_rate": 2.721450683044267e-06,
"loss": 0.3343979835510254,
"mean_token_accuracy": 0.8854986250400543,
"num_tokens": 34570179.0,
"step": 5600
},
{
"entropy": 0.3538062654435635,
"epoch": 0.9983094581368449,
"grad_norm": 0.80078125,
"learning_rate": 2.714124041969746e-06,
"loss": 0.3547967910766602,
"mean_token_accuracy": 0.8770895808935165,
"num_tokens": 34634240.0,
"step": 5610
},
{
"entropy": 0.3326169644531451,
"epoch": 1.0,
"grad_norm": 1.1640625,
"learning_rate": 2.706795547774589e-06,
"loss": 0.33385910987854006,
"mean_token_accuracy": 0.8873269903032404,
"num_tokens": 34692012.0,
"step": 5620
},
{
"entropy": 0.34083987325429915,
"epoch": 1.0017795177506896,
"grad_norm": 0.875,
"learning_rate": 2.699465263882708e-06,
"loss": 0.33701329231262206,
"mean_token_accuracy": 0.882954615354538,
"num_tokens": 34751142.0,
"step": 5630
},
{
"entropy": 0.3176037408411503,
"epoch": 1.003559035501379,
"grad_norm": 0.7109375,
"learning_rate": 2.6921332537334995e-06,
"loss": 0.31018331050872805,
"mean_token_accuracy": 0.89184690117836,
"num_tokens": 34815015.0,
"step": 5640
},
{
"entropy": 0.32635784670710566,
"epoch": 1.0053385532520687,
"grad_norm": 0.6171875,
"learning_rate": 2.684799580781301e-06,
"loss": 0.3245363712310791,
"mean_token_accuracy": 0.889178654551506,
"num_tokens": 34875682.0,
"step": 5650
},
{
"entropy": 0.3262045428156853,
"epoch": 1.0071180710027583,
"grad_norm": 0.71875,
"learning_rate": 2.6774643084948416e-06,
"loss": 0.32026770114898684,
"mean_token_accuracy": 0.8906201630830765,
"num_tokens": 34936388.0,
"step": 5660
},
{
"entropy": 0.3156457729637623,
"epoch": 1.008897588753448,
"grad_norm": 0.671875,
"learning_rate": 2.6701275003566905e-06,
"loss": 0.3158827066421509,
"mean_token_accuracy": 0.890359628200531,
"num_tokens": 34998803.0,
"step": 5670
},
{
"entropy": 0.33784292116761205,
"epoch": 1.0106771065041373,
"grad_norm": 0.71875,
"learning_rate": 2.6627892198627104e-06,
"loss": 0.33698952198028564,
"mean_token_accuracy": 0.8842770218849182,
"num_tokens": 35058269.0,
"step": 5680
},
{
"entropy": 0.3404016703367233,
"epoch": 1.012456624254827,
"grad_norm": 0.65234375,
"learning_rate": 2.6554495305215045e-06,
"loss": 0.34072854518890383,
"mean_token_accuracy": 0.8847543150186539,
"num_tokens": 35125401.0,
"step": 5690
},
{
"entropy": 0.316736675798893,
"epoch": 1.0142361420055166,
"grad_norm": 0.66796875,
"learning_rate": 2.6481084958538695e-06,
"loss": 0.31809291839599607,
"mean_token_accuracy": 0.8899137407541275,
"num_tokens": 35187010.0,
"step": 5700
},
{
"entropy": 0.31172519326210024,
"epoch": 1.016015659756206,
"grad_norm": 0.74609375,
"learning_rate": 2.6407661793922466e-06,
"loss": 0.30487895011901855,
"mean_token_accuracy": 0.895835679769516,
"num_tokens": 35249055.0,
"step": 5710
},
{
"entropy": 0.322640036046505,
"epoch": 1.0177951775068956,
"grad_norm": 0.65625,
"learning_rate": 2.6334226446801675e-06,
"loss": 0.3133616209030151,
"mean_token_accuracy": 0.8907902717590332,
"num_tokens": 35311776.0,
"step": 5720
},
{
"entropy": 0.30626519620418546,
"epoch": 1.0195746952575853,
"grad_norm": 0.7890625,
"learning_rate": 2.626077955271709e-06,
"loss": 0.30397911071777345,
"mean_token_accuracy": 0.8964751362800598,
"num_tokens": 35371736.0,
"step": 5730
},
{
"entropy": 0.3391783103346825,
"epoch": 1.0213542130082747,
"grad_norm": 0.77734375,
"learning_rate": 2.618732174730941e-06,
"loss": 0.33878111839294434,
"mean_token_accuracy": 0.8837409794330597,
"num_tokens": 35427751.0,
"step": 5740
},
{
"entropy": 0.3252422705292702,
"epoch": 1.0231337307589643,
"grad_norm": 0.7578125,
"learning_rate": 2.611385366631376e-06,
"loss": 0.31556589603424073,
"mean_token_accuracy": 0.8910249531269073,
"num_tokens": 35483783.0,
"step": 5750
},
{
"entropy": 0.3271099664270878,
"epoch": 1.024913248509654,
"grad_norm": 0.921875,
"learning_rate": 2.604037594555419e-06,
"loss": 0.327379035949707,
"mean_token_accuracy": 0.8876970559358597,
"num_tokens": 35544288.0,
"step": 5760
},
{
"entropy": 0.2963846907019615,
"epoch": 1.0266927662603433,
"grad_norm": 0.6640625,
"learning_rate": 2.5966889220938185e-06,
"loss": 0.29484057426452637,
"mean_token_accuracy": 0.8992130428552627,
"num_tokens": 35609505.0,
"step": 5770
},
{
"entropy": 0.3000890247523785,
"epoch": 1.028472284011033,
"grad_norm": 0.76171875,
"learning_rate": 2.589339412845116e-06,
"loss": 0.29627208709716796,
"mean_token_accuracy": 0.8975471526384353,
"num_tokens": 35672460.0,
"step": 5780
},
{
"entropy": 0.32139924764633176,
"epoch": 1.0302518017617226,
"grad_norm": 0.68359375,
"learning_rate": 2.581989130415093e-06,
"loss": 0.31838669776916506,
"mean_token_accuracy": 0.8897950440645218,
"num_tokens": 35736833.0,
"step": 5790
},
{
"entropy": 0.3406783610582352,
"epoch": 1.0320313195124122,
"grad_norm": 0.74609375,
"learning_rate": 2.574638138416224e-06,
"loss": 0.3328117847442627,
"mean_token_accuracy": 0.8851494818925858,
"num_tokens": 35800085.0,
"step": 5800
},
{
"entropy": 0.3248604856431484,
"epoch": 1.0338108372631016,
"grad_norm": 0.7109375,
"learning_rate": 2.567286500467124e-06,
"loss": 0.3253867864608765,
"mean_token_accuracy": 0.8891596347093582,
"num_tokens": 35862528.0,
"step": 5810
},
{
"entropy": 0.3194640681147575,
"epoch": 1.0355903550137913,
"grad_norm": 0.72265625,
"learning_rate": 2.559934280191997e-06,
"loss": 0.31677422523498533,
"mean_token_accuracy": 0.8909268170595169,
"num_tokens": 35923252.0,
"step": 5820
},
{
"entropy": 0.3379687383770943,
"epoch": 1.037369872764481,
"grad_norm": 0.6328125,
"learning_rate": 2.5525815412200894e-06,
"loss": 0.3359971046447754,
"mean_token_accuracy": 0.8852140247821808,
"num_tokens": 35984416.0,
"step": 5830
},
{
"entropy": 0.30308631584048273,
"epoch": 1.0391493905151703,
"grad_norm": 0.7421875,
"learning_rate": 2.545228347185134e-06,
"loss": 0.29819297790527344,
"mean_token_accuracy": 0.8974331319332123,
"num_tokens": 36047352.0,
"step": 5840
},
{
"entropy": 0.29114886596798895,
"epoch": 1.04092890826586,
"grad_norm": 0.6875,
"learning_rate": 2.537874761724804e-06,
"loss": 0.2821171283721924,
"mean_token_accuracy": 0.9028494268655777,
"num_tokens": 36106156.0,
"step": 5850
},
{
"entropy": 0.30400493890047076,
"epoch": 1.0427084260165496,
"grad_norm": 0.796875,
"learning_rate": 2.5305208484801584e-06,
"loss": 0.30085320472717286,
"mean_token_accuracy": 0.8987132161855698,
"num_tokens": 36168229.0,
"step": 5860
},
{
"entropy": 0.3301976449787617,
"epoch": 1.0444879437672392,
"grad_norm": 0.73828125,
"learning_rate": 2.523166671095094e-06,
"loss": 0.3351378679275513,
"mean_token_accuracy": 0.8854980170726776,
"num_tokens": 36232169.0,
"step": 5870
},
{
"entropy": 0.30894535407423973,
"epoch": 1.0462674615179286,
"grad_norm": 0.5546875,
"learning_rate": 2.515812293215794e-06,
"loss": 0.304299521446228,
"mean_token_accuracy": 0.8937274575233459,
"num_tokens": 36294608.0,
"step": 5880
},
{
"entropy": 0.3305805541574955,
"epoch": 1.0480469792686182,
"grad_norm": 0.73828125,
"learning_rate": 2.508457778490175e-06,
"loss": 0.3294157266616821,
"mean_token_accuracy": 0.8851876139640809,
"num_tokens": 36360386.0,
"step": 5890
},
{
"entropy": 0.32959619238972665,
"epoch": 1.0498264970193079,
"grad_norm": 0.71875,
"learning_rate": 2.50110319056734e-06,
"loss": 0.3228970289230347,
"mean_token_accuracy": 0.8861234545707702,
"num_tokens": 36422208.0,
"step": 5900
},
{
"entropy": 0.3291837781667709,
"epoch": 1.0516060147699973,
"grad_norm": 0.76171875,
"learning_rate": 2.493748593097024e-06,
"loss": 0.3229544639587402,
"mean_token_accuracy": 0.8892482191324234,
"num_tokens": 36481528.0,
"step": 5910
},
{
"entropy": 0.3166023068130016,
"epoch": 1.053385532520687,
"grad_norm": 0.67578125,
"learning_rate": 2.486394049729045e-06,
"loss": 0.3133046865463257,
"mean_token_accuracy": 0.8923086404800415,
"num_tokens": 36543019.0,
"step": 5920
},
{
"entropy": 0.32730976268649103,
"epoch": 1.0551650502713765,
"grad_norm": 0.76171875,
"learning_rate": 2.4790396241127533e-06,
"loss": 0.33183271884918214,
"mean_token_accuracy": 0.8874736070632935,
"num_tokens": 36607552.0,
"step": 5930
},
{
"entropy": 0.323318800330162,
"epoch": 1.056944568022066,
"grad_norm": 0.7109375,
"learning_rate": 2.4716853798964793e-06,
"loss": 0.3239744663238525,
"mean_token_accuracy": 0.8901706904172897,
"num_tokens": 36670619.0,
"step": 5940
},
{
"entropy": 0.3111228793859482,
"epoch": 1.0587240857727556,
"grad_norm": 0.65234375,
"learning_rate": 2.464331380726985e-06,
"loss": 0.3095929384231567,
"mean_token_accuracy": 0.89564750790596,
"num_tokens": 36734727.0,
"step": 5950
},
{
"entropy": 0.31210684925317767,
"epoch": 1.0605036035234452,
"grad_norm": 0.81640625,
"learning_rate": 2.456977690248909e-06,
"loss": 0.3053849458694458,
"mean_token_accuracy": 0.8959574043750763,
"num_tokens": 36792968.0,
"step": 5960
},
{
"entropy": 0.30364991426467897,
"epoch": 1.0622831212741346,
"grad_norm": 0.7421875,
"learning_rate": 2.4496243721042208e-06,
"loss": 0.2973085880279541,
"mean_token_accuracy": 0.8975523322820663,
"num_tokens": 36855369.0,
"step": 5970
},
{
"entropy": 0.3433017261326313,
"epoch": 1.0640626390248242,
"grad_norm": 0.796875,
"learning_rate": 2.442271489931667e-06,
"loss": 0.3419850587844849,
"mean_token_accuracy": 0.8831979781389236,
"num_tokens": 36919536.0,
"step": 5980
},
{
"entropy": 0.34219980239868164,
"epoch": 1.0658421567755139,
"grad_norm": 0.6328125,
"learning_rate": 2.4349191073662203e-06,
"loss": 0.343482518196106,
"mean_token_accuracy": 0.8828152269124985,
"num_tokens": 36977572.0,
"step": 5990
},
{
"entropy": 0.32711869329214094,
"epoch": 1.0676216745262035,
"grad_norm": 0.73046875,
"learning_rate": 2.427567288038531e-06,
"loss": 0.31664719581604006,
"mean_token_accuracy": 0.8899913311004639,
"num_tokens": 37034892.0,
"step": 6000
},
{
"entropy": 0.32893837317824365,
"epoch": 1.069401192276893,
"grad_norm": 0.6875,
"learning_rate": 2.4202160955743724e-06,
"loss": 0.3295586585998535,
"mean_token_accuracy": 0.8879793435335159,
"num_tokens": 37097176.0,
"step": 6010
},
{
"entropy": 0.3367379605770111,
"epoch": 1.0711807100275825,
"grad_norm": 0.91796875,
"learning_rate": 2.412865593594096e-06,
"loss": 0.3332340240478516,
"mean_token_accuracy": 0.8856563240289688,
"num_tokens": 37161600.0,
"step": 6020
},
{
"entropy": 0.3031110964715481,
"epoch": 1.0729602277782722,
"grad_norm": 0.65234375,
"learning_rate": 2.405515845712075e-06,
"loss": 0.30210416316986083,
"mean_token_accuracy": 0.8974428921937943,
"num_tokens": 37226164.0,
"step": 6030
},
{
"entropy": 0.32815868556499483,
"epoch": 1.0747397455289616,
"grad_norm": 0.80078125,
"learning_rate": 2.398166915536157e-06,
"loss": 0.32607159614562986,
"mean_token_accuracy": 0.8879486858844757,
"num_tokens": 37289293.0,
"step": 6040
},
{
"entropy": 0.3376390390098095,
"epoch": 1.0765192632796512,
"grad_norm": 0.59375,
"learning_rate": 2.3908188666671135e-06,
"loss": 0.33508734703063964,
"mean_token_accuracy": 0.8841046899557113,
"num_tokens": 37353443.0,
"step": 6050
},
{
"entropy": 0.35702595561742784,
"epoch": 1.0782987810303408,
"grad_norm": 0.83203125,
"learning_rate": 2.3834717626980877e-06,
"loss": 0.35306107997894287,
"mean_token_accuracy": 0.8776964634656906,
"num_tokens": 37412995.0,
"step": 6060
},
{
"entropy": 0.3332983210682869,
"epoch": 1.0800782987810305,
"grad_norm": 0.734375,
"learning_rate": 2.3761256672140465e-06,
"loss": 0.3324312925338745,
"mean_token_accuracy": 0.8848207086324692,
"num_tokens": 37477809.0,
"step": 6070
},
{
"entropy": 0.35875064730644224,
"epoch": 1.0818578165317199,
"grad_norm": 0.8203125,
"learning_rate": 2.3687806437912273e-06,
"loss": 0.35025925636291505,
"mean_token_accuracy": 0.8765045911073684,
"num_tokens": 37538884.0,
"step": 6080
},
{
"entropy": 0.33794180378317834,
"epoch": 1.0836373342824095,
"grad_norm": 0.78125,
"learning_rate": 2.361436755996592e-06,
"loss": 0.34279372692108157,
"mean_token_accuracy": 0.883757570385933,
"num_tokens": 37600439.0,
"step": 6090
},
{
"entropy": 0.3118018746376038,
"epoch": 1.0854168520330991,
"grad_norm": 0.6796875,
"learning_rate": 2.3540940673872696e-06,
"loss": 0.3126061916351318,
"mean_token_accuracy": 0.8942352592945099,
"num_tokens": 37661336.0,
"step": 6100
},
{
"entropy": 0.3113993749022484,
"epoch": 1.0871963697837885,
"grad_norm": 0.8203125,
"learning_rate": 2.3467526415100178e-06,
"loss": 0.3139824628829956,
"mean_token_accuracy": 0.8922016888856887,
"num_tokens": 37728551.0,
"step": 6110
},
{
"entropy": 0.3283416323363781,
"epoch": 1.0889758875344782,
"grad_norm": 0.60546875,
"learning_rate": 2.3394125419006587e-06,
"loss": 0.3245725154876709,
"mean_token_accuracy": 0.8882441699504853,
"num_tokens": 37793043.0,
"step": 6120
},
{
"entropy": 0.3583234764635563,
"epoch": 1.0907554052851678,
"grad_norm": 0.69140625,
"learning_rate": 2.3320738320835416e-06,
"loss": 0.36160922050476074,
"mean_token_accuracy": 0.8759530246257782,
"num_tokens": 37854109.0,
"step": 6130
},
{
"entropy": 0.326777271181345,
"epoch": 1.0925349230358572,
"grad_norm": 0.6484375,
"learning_rate": 2.3247365755709868e-06,
"loss": 0.3250066518783569,
"mean_token_accuracy": 0.8864477127790451,
"num_tokens": 37918872.0,
"step": 6140
},
{
"entropy": 0.3246280372142792,
"epoch": 1.0943144407865468,
"grad_norm": 0.7890625,
"learning_rate": 2.3174008358627338e-06,
"loss": 0.31370522975921633,
"mean_token_accuracy": 0.8921600759029389,
"num_tokens": 37975481.0,
"step": 6150
},
{
"entropy": 0.32454342022538185,
"epoch": 1.0960939585372365,
"grad_norm": 0.61328125,
"learning_rate": 2.310066676445401e-06,
"loss": 0.3222689628601074,
"mean_token_accuracy": 0.889724725484848,
"num_tokens": 38037049.0,
"step": 6160
},
{
"entropy": 0.33545268774032594,
"epoch": 1.0978734762879259,
"grad_norm": 0.70703125,
"learning_rate": 2.3027341607919244e-06,
"loss": 0.3306859493255615,
"mean_token_accuracy": 0.8836951851844788,
"num_tokens": 38104511.0,
"step": 6170
},
{
"entropy": 0.2989437818527222,
"epoch": 1.0996529940386155,
"grad_norm": 0.58984375,
"learning_rate": 2.2954033523610177e-06,
"loss": 0.29660825729370116,
"mean_token_accuracy": 0.8997817754745483,
"num_tokens": 38164188.0,
"step": 6180
},
{
"entropy": 0.3101610042154789,
"epoch": 1.1014325117893051,
"grad_norm": 0.69921875,
"learning_rate": 2.288074314596618e-06,
"loss": 0.3052619218826294,
"mean_token_accuracy": 0.8945633232593536,
"num_tokens": 38225871.0,
"step": 6190
},
{
"entropy": 0.32951446026563647,
"epoch": 1.1032120295399948,
"grad_norm": 0.71875,
"learning_rate": 2.280747110927339e-06,
"loss": 0.32285799980163576,
"mean_token_accuracy": 0.8895534485578537,
"num_tokens": 38286977.0,
"step": 6200
},
{
"entropy": 0.3137095712125301,
"epoch": 1.1049915472906842,
"grad_norm": 0.68359375,
"learning_rate": 2.2734218047659228e-06,
"loss": 0.3120196104049683,
"mean_token_accuracy": 0.8928256899118423,
"num_tokens": 38351039.0,
"step": 6210
},
{
"entropy": 0.27707975208759306,
"epoch": 1.1067710650413738,
"grad_norm": 0.6328125,
"learning_rate": 2.2660984595086854e-06,
"loss": 0.2751126766204834,
"mean_token_accuracy": 0.9059015125036239,
"num_tokens": 38411819.0,
"step": 6220
},
{
"entropy": 0.3230294272303581,
"epoch": 1.1085505827920634,
"grad_norm": 0.640625,
"learning_rate": 2.2587771385349773e-06,
"loss": 0.32492067813873293,
"mean_token_accuracy": 0.8876459985971451,
"num_tokens": 38478403.0,
"step": 6230
},
{
"entropy": 0.29877011850476265,
"epoch": 1.1103301005427528,
"grad_norm": 0.73828125,
"learning_rate": 2.251457905206626e-06,
"loss": 0.2946697473526001,
"mean_token_accuracy": 0.8977464884519577,
"num_tokens": 38540442.0,
"step": 6240
},
{
"entropy": 0.32962229996919634,
"epoch": 1.1121096182934425,
"grad_norm": 0.80859375,
"learning_rate": 2.244140822867395e-06,
"loss": 0.32636442184448244,
"mean_token_accuracy": 0.8879129558801651,
"num_tokens": 38603107.0,
"step": 6250
},
{
"entropy": 0.3100545838475227,
"epoch": 1.113889136044132,
"grad_norm": 0.82421875,
"learning_rate": 2.236825954842429e-06,
"loss": 0.3090749502182007,
"mean_token_accuracy": 0.8943884193897247,
"num_tokens": 38666429.0,
"step": 6260
},
{
"entropy": 0.3000672958791256,
"epoch": 1.1156686537948217,
"grad_norm": 0.7109375,
"learning_rate": 2.2295133644377117e-06,
"loss": 0.2905374526977539,
"mean_token_accuracy": 0.8999047011137009,
"num_tokens": 38724133.0,
"step": 6270
},
{
"entropy": 0.3060581274330616,
"epoch": 1.1174481715455111,
"grad_norm": 0.59765625,
"learning_rate": 2.2222031149395126e-06,
"loss": 0.30127696990966796,
"mean_token_accuracy": 0.8966281563043594,
"num_tokens": 38788427.0,
"step": 6280
},
{
"entropy": 0.3509036287665367,
"epoch": 1.1192276892962008,
"grad_norm": 0.640625,
"learning_rate": 2.2148952696138455e-06,
"loss": 0.3526886224746704,
"mean_token_accuracy": 0.8783241659402847,
"num_tokens": 38853368.0,
"step": 6290
},
{
"entropy": 0.3256737247109413,
"epoch": 1.1210072070468904,
"grad_norm": 0.6796875,
"learning_rate": 2.207589891705915e-06,
"loss": 0.32360138893127444,
"mean_token_accuracy": 0.8878955036401749,
"num_tokens": 38913590.0,
"step": 6300
},
{
"entropy": 0.3029537916183472,
"epoch": 1.1227867247975798,
"grad_norm": 0.68359375,
"learning_rate": 2.2002870444395715e-06,
"loss": 0.29504833221435545,
"mean_token_accuracy": 0.8991098433732987,
"num_tokens": 38975107.0,
"step": 6310
},
{
"entropy": 0.3361328311264515,
"epoch": 1.1245662425482694,
"grad_norm": 0.73046875,
"learning_rate": 2.192986791016766e-06,
"loss": 0.3358842611312866,
"mean_token_accuracy": 0.8838304698467254,
"num_tokens": 39037487.0,
"step": 6320
},
{
"entropy": 0.29630220159888265,
"epoch": 1.126345760298959,
"grad_norm": 0.70703125,
"learning_rate": 2.1856891946169984e-06,
"loss": 0.2963985204696655,
"mean_token_accuracy": 0.8989090889692306,
"num_tokens": 39101184.0,
"step": 6330
},
{
"entropy": 0.3168186888098717,
"epoch": 1.1281252780496485,
"grad_norm": 0.65625,
"learning_rate": 2.178394318396778e-06,
"loss": 0.3151972770690918,
"mean_token_accuracy": 0.8931846141815185,
"num_tokens": 39159619.0,
"step": 6340
},
{
"entropy": 0.34394366517663,
"epoch": 1.129904795800338,
"grad_norm": 0.68359375,
"learning_rate": 2.1711022254890664e-06,
"loss": 0.3381487846374512,
"mean_token_accuracy": 0.8816323518753052,
"num_tokens": 39223655.0,
"step": 6350
},
{
"entropy": 0.30923732444643975,
"epoch": 1.1316843135510277,
"grad_norm": 0.5859375,
"learning_rate": 2.163812979002743e-06,
"loss": 0.302240777015686,
"mean_token_accuracy": 0.8958666861057282,
"num_tokens": 39285415.0,
"step": 6360
},
{
"entropy": 0.3678409859538078,
"epoch": 1.1334638313017171,
"grad_norm": 0.6640625,
"learning_rate": 2.1565266420220507e-06,
"loss": 0.3646035432815552,
"mean_token_accuracy": 0.8739933013916016,
"num_tokens": 39349189.0,
"step": 6370
},
{
"entropy": 0.31284826546907424,
"epoch": 1.1352433490524068,
"grad_norm": 0.8359375,
"learning_rate": 2.149243277606051e-06,
"loss": 0.3076478958129883,
"mean_token_accuracy": 0.8938501566648483,
"num_tokens": 39409463.0,
"step": 6380
},
{
"entropy": 0.307619209587574,
"epoch": 1.1370228668030964,
"grad_norm": 0.73828125,
"learning_rate": 2.141962948788083e-06,
"loss": 0.30543687343597414,
"mean_token_accuracy": 0.8956003308296203,
"num_tokens": 39467854.0,
"step": 6390
},
{
"entropy": 0.3098882667720318,
"epoch": 1.138802384553786,
"grad_norm": 0.765625,
"learning_rate": 2.1346857185752096e-06,
"loss": 0.3102999687194824,
"mean_token_accuracy": 0.8944849371910095,
"num_tokens": 39525795.0,
"step": 6400
},
{
"entropy": 0.2952044025063515,
"epoch": 1.1405819023044754,
"grad_norm": 0.734375,
"learning_rate": 2.1274116499476824e-06,
"loss": 0.2934947729110718,
"mean_token_accuracy": 0.8995626121759415,
"num_tokens": 39583763.0,
"step": 6410
},
{
"entropy": 0.3159428730607033,
"epoch": 1.142361420055165,
"grad_norm": 0.72265625,
"learning_rate": 2.1201408058583865e-06,
"loss": 0.31551992893218994,
"mean_token_accuracy": 0.8904787719249725,
"num_tokens": 39643269.0,
"step": 6420
},
{
"entropy": 0.33396480455994604,
"epoch": 1.1441409378058547,
"grad_norm": 0.8125,
"learning_rate": 2.1128732492323026e-06,
"loss": 0.3312607526779175,
"mean_token_accuracy": 0.8864463776350021,
"num_tokens": 39703376.0,
"step": 6430
},
{
"entropy": 0.3289263263344765,
"epoch": 1.145920455556544,
"grad_norm": 0.7265625,
"learning_rate": 2.1056090429659633e-06,
"loss": 0.319482159614563,
"mean_token_accuracy": 0.8892025262117386,
"num_tokens": 39761148.0,
"step": 6440
},
{
"entropy": 0.34634201899170874,
"epoch": 1.1476999733072337,
"grad_norm": 0.71875,
"learning_rate": 2.098348249926899e-06,
"loss": 0.34150454998016355,
"mean_token_accuracy": 0.8812961906194687,
"num_tokens": 39824102.0,
"step": 6450
},
{
"entropy": 0.35739881843328475,
"epoch": 1.1494794910579234,
"grad_norm": 0.7421875,
"learning_rate": 2.091090932953107e-06,
"loss": 0.3544684171676636,
"mean_token_accuracy": 0.8776734083890915,
"num_tokens": 39885718.0,
"step": 6460
},
{
"entropy": 0.3311047166585922,
"epoch": 1.151259008808613,
"grad_norm": 0.8359375,
"learning_rate": 2.083837154852497e-06,
"loss": 0.3287468433380127,
"mean_token_accuracy": 0.8868994563817978,
"num_tokens": 39943999.0,
"step": 6470
},
{
"entropy": 0.3139263138175011,
"epoch": 1.1530385265593024,
"grad_norm": 0.578125,
"learning_rate": 2.0765869784023543e-06,
"loss": 0.3099213600158691,
"mean_token_accuracy": 0.8930840253829956,
"num_tokens": 40004250.0,
"step": 6480
},
{
"entropy": 0.33958385288715365,
"epoch": 1.154818044309992,
"grad_norm": 0.6328125,
"learning_rate": 2.0693404663487928e-06,
"loss": 0.3395709037780762,
"mean_token_accuracy": 0.8818017035722733,
"num_tokens": 40064625.0,
"step": 6490
},
{
"entropy": 0.34563273191452026,
"epoch": 1.1565975620606816,
"grad_norm": 0.765625,
"learning_rate": 2.0620976814062134e-06,
"loss": 0.34551825523376467,
"mean_token_accuracy": 0.879336616396904,
"num_tokens": 40129998.0,
"step": 6500
},
{
"entropy": 0.30890574902296064,
"epoch": 1.158377079811371,
"grad_norm": 0.6171875,
"learning_rate": 2.054858686256761e-06,
"loss": 0.30577223300933837,
"mean_token_accuracy": 0.8946483492851257,
"num_tokens": 40193108.0,
"step": 6510
},
{
"entropy": 0.3264366887509823,
"epoch": 1.1601565975620607,
"grad_norm": 0.76953125,
"learning_rate": 2.047623543549782e-06,
"loss": 0.3218709945678711,
"mean_token_accuracy": 0.8891184568405152,
"num_tokens": 40255486.0,
"step": 6520
},
{
"entropy": 0.29533035308122635,
"epoch": 1.1619361153127503,
"grad_norm": 0.63671875,
"learning_rate": 2.040392315901283e-06,
"loss": 0.293083930015564,
"mean_token_accuracy": 0.9001254260540008,
"num_tokens": 40322435.0,
"step": 6530
},
{
"entropy": 0.3199417270720005,
"epoch": 1.1637156330634397,
"grad_norm": 0.67578125,
"learning_rate": 2.0331650658933856e-06,
"loss": 0.31435399055480956,
"mean_token_accuracy": 0.890678858757019,
"num_tokens": 40383302.0,
"step": 6540
},
{
"entropy": 0.2874578669667244,
"epoch": 1.1654951508141294,
"grad_norm": 0.6328125,
"learning_rate": 2.02594185607379e-06,
"loss": 0.2868461847305298,
"mean_token_accuracy": 0.9027261883020401,
"num_tokens": 40446325.0,
"step": 6550
},
{
"entropy": 0.30375232845544814,
"epoch": 1.167274668564819,
"grad_norm": 0.75,
"learning_rate": 2.0187227489552293e-06,
"loss": 0.3025736093521118,
"mean_token_accuracy": 0.8987367808818817,
"num_tokens": 40504507.0,
"step": 6560
},
{
"entropy": 0.3401374787092209,
"epoch": 1.1690541863155084,
"grad_norm": 0.640625,
"learning_rate": 2.011507807014931e-06,
"loss": 0.3411766767501831,
"mean_token_accuracy": 0.883126625418663,
"num_tokens": 40571347.0,
"step": 6570
},
{
"entropy": 0.32674640119075776,
"epoch": 1.170833704066198,
"grad_norm": 0.83203125,
"learning_rate": 2.004297092694073e-06,
"loss": 0.32173776626586914,
"mean_token_accuracy": 0.8902782052755356,
"num_tokens": 40635171.0,
"step": 6580
},
{
"entropy": 0.33782247379422187,
"epoch": 1.1726132218168877,
"grad_norm": 0.625,
"learning_rate": 1.9970906683972495e-06,
"loss": 0.3345970153808594,
"mean_token_accuracy": 0.88412746489048,
"num_tokens": 40695653.0,
"step": 6590
},
{
"entropy": 0.30329259261488917,
"epoch": 1.1743927395675773,
"grad_norm": 0.69921875,
"learning_rate": 1.989888596491924e-06,
"loss": 0.3029667139053345,
"mean_token_accuracy": 0.8961463123559952,
"num_tokens": 40754688.0,
"step": 6600
},
{
"entropy": 0.36512257158756256,
"epoch": 1.1761722573182667,
"grad_norm": 0.69140625,
"learning_rate": 1.9826909393078935e-06,
"loss": 0.3695381641387939,
"mean_token_accuracy": 0.8735969066619873,
"num_tokens": 40821556.0,
"step": 6610
},
{
"entropy": 0.31008799448609353,
"epoch": 1.1779517750689563,
"grad_norm": 0.703125,
"learning_rate": 1.9754977591367492e-06,
"loss": 0.3019032716751099,
"mean_token_accuracy": 0.8952760756015777,
"num_tokens": 40884928.0,
"step": 6620
},
{
"entropy": 0.3640871949493885,
"epoch": 1.179731292819646,
"grad_norm": 0.796875,
"learning_rate": 1.9683091182313324e-06,
"loss": 0.36536407470703125,
"mean_token_accuracy": 0.875368058681488,
"num_tokens": 40944659.0,
"step": 6630
},
{
"entropy": 0.33483156710863116,
"epoch": 1.1815108105703354,
"grad_norm": 0.66015625,
"learning_rate": 1.961125078805206e-06,
"loss": 0.33205399513244627,
"mean_token_accuracy": 0.8878760695457458,
"num_tokens": 41002215.0,
"step": 6640
},
{
"entropy": 0.29913138821721075,
"epoch": 1.183290328321025,
"grad_norm": 0.6796875,
"learning_rate": 1.9539457030321025e-06,
"loss": 0.29441983699798585,
"mean_token_accuracy": 0.898381170630455,
"num_tokens": 41065329.0,
"step": 6650
},
{
"entropy": 0.31198590248823166,
"epoch": 1.1850698460717146,
"grad_norm": 0.6328125,
"learning_rate": 1.9467710530454006e-06,
"loss": 0.31163022518157957,
"mean_token_accuracy": 0.8926221162080765,
"num_tokens": 41129482.0,
"step": 6660
},
{
"entropy": 0.31377198696136477,
"epoch": 1.1868493638224042,
"grad_norm": 0.74609375,
"learning_rate": 1.9396011909375735e-06,
"loss": 0.313322925567627,
"mean_token_accuracy": 0.8929570287466049,
"num_tokens": 41192565.0,
"step": 6670
},
{
"entropy": 0.3046662501990795,
"epoch": 1.1886288815730937,
"grad_norm": 0.65234375,
"learning_rate": 1.932436178759661e-06,
"loss": 0.3024745464324951,
"mean_token_accuracy": 0.8961217939853668,
"num_tokens": 41257591.0,
"step": 6680
},
{
"entropy": 0.34900614991784096,
"epoch": 1.1904083993237833,
"grad_norm": 0.83984375,
"learning_rate": 1.9252760785207324e-06,
"loss": 0.34831223487854,
"mean_token_accuracy": 0.8796100854873657,
"num_tokens": 41320472.0,
"step": 6690
},
{
"entropy": 0.31406684070825575,
"epoch": 1.192187917074473,
"grad_norm": 0.671875,
"learning_rate": 1.9181209521873405e-06,
"loss": 0.3106688976287842,
"mean_token_accuracy": 0.8927657037973404,
"num_tokens": 41381552.0,
"step": 6700
},
{
"entropy": 0.3064426273107529,
"epoch": 1.1939674348251623,
"grad_norm": 0.82421875,
"learning_rate": 1.9109708616829975e-06,
"loss": 0.3076400995254517,
"mean_token_accuracy": 0.897218656539917,
"num_tokens": 41440632.0,
"step": 6710
},
{
"entropy": 0.32711833491921427,
"epoch": 1.195746952575852,
"grad_norm": 0.66015625,
"learning_rate": 1.9038258688876297e-06,
"loss": 0.32924935817718504,
"mean_token_accuracy": 0.8895014435052871,
"num_tokens": 41498181.0,
"step": 6720
},
{
"entropy": 0.34585118368268014,
"epoch": 1.1975264703265416,
"grad_norm": 0.7421875,
"learning_rate": 1.896686035637048e-06,
"loss": 0.3470535039901733,
"mean_token_accuracy": 0.8832247287034989,
"num_tokens": 41559623.0,
"step": 6730
},
{
"entropy": 0.3303426906466484,
"epoch": 1.199305988077231,
"grad_norm": 0.79296875,
"learning_rate": 1.8895514237224092e-06,
"loss": 0.3249280691146851,
"mean_token_accuracy": 0.8877619624137878,
"num_tokens": 41618891.0,
"step": 6740
},
{
"entropy": 0.32443070858716966,
"epoch": 1.2010855058279206,
"grad_norm": 0.84375,
"learning_rate": 1.8824220948896826e-06,
"loss": 0.32383227348327637,
"mean_token_accuracy": 0.8884406238794327,
"num_tokens": 41678285.0,
"step": 6750
},
{
"entropy": 0.2969959333539009,
"epoch": 1.2028650235786102,
"grad_norm": 0.75390625,
"learning_rate": 1.8752981108391166e-06,
"loss": 0.2915003538131714,
"mean_token_accuracy": 0.9006586492061615,
"num_tokens": 41741225.0,
"step": 6760
},
{
"entropy": 0.3364593803882599,
"epoch": 1.2046445413292997,
"grad_norm": 0.5703125,
"learning_rate": 1.8681795332247017e-06,
"loss": 0.3352673053741455,
"mean_token_accuracy": 0.8840632468461991,
"num_tokens": 41805087.0,
"step": 6770
},
{
"entropy": 0.3422845914959908,
"epoch": 1.2064240590799893,
"grad_norm": 0.78125,
"learning_rate": 1.8610664236536402e-06,
"loss": 0.34624130725860597,
"mean_token_accuracy": 0.8821140199899673,
"num_tokens": 41866921.0,
"step": 6780
},
{
"entropy": 0.3141391173005104,
"epoch": 1.208203576830679,
"grad_norm": 0.7265625,
"learning_rate": 1.8539588436858102e-06,
"loss": 0.31454594135284425,
"mean_token_accuracy": 0.8926339834928513,
"num_tokens": 41927523.0,
"step": 6790
},
{
"entropy": 0.34032327979803084,
"epoch": 1.2099830945813685,
"grad_norm": 0.72265625,
"learning_rate": 1.846856854833237e-06,
"loss": 0.3403328418731689,
"mean_token_accuracy": 0.8833697289228439,
"num_tokens": 41990832.0,
"step": 6800
},
{
"entropy": 0.3438625819981098,
"epoch": 1.211762612332058,
"grad_norm": 0.828125,
"learning_rate": 1.839760518559554e-06,
"loss": 0.34128901958465574,
"mean_token_accuracy": 0.8833727329969406,
"num_tokens": 42051254.0,
"step": 6810
},
{
"entropy": 0.31954195946455,
"epoch": 1.2135421300827476,
"grad_norm": 0.76953125,
"learning_rate": 1.8326698962794793e-06,
"loss": 0.3154443264007568,
"mean_token_accuracy": 0.8895681113004684,
"num_tokens": 42112870.0,
"step": 6820
},
{
"entropy": 0.33622306734323504,
"epoch": 1.2153216478334372,
"grad_norm": 0.703125,
"learning_rate": 1.825585049358275e-06,
"loss": 0.33228607177734376,
"mean_token_accuracy": 0.8831908792257309,
"num_tokens": 42170199.0,
"step": 6830
},
{
"entropy": 0.3599790006875992,
"epoch": 1.2171011655841266,
"grad_norm": 0.796875,
"learning_rate": 1.8185060391112248e-06,
"loss": 0.3648702383041382,
"mean_token_accuracy": 0.8752429783344269,
"num_tokens": 42230091.0,
"step": 6840
},
{
"entropy": 0.33258122578263283,
"epoch": 1.2188806833348163,
"grad_norm": 0.6640625,
"learning_rate": 1.8114329268030973e-06,
"loss": 0.32865903377532957,
"mean_token_accuracy": 0.8861372381448746,
"num_tokens": 42292308.0,
"step": 6850
},
{
"entropy": 0.33804669305682183,
"epoch": 1.2206602010855059,
"grad_norm": 0.71875,
"learning_rate": 1.8043657736476177e-06,
"loss": 0.3403555631637573,
"mean_token_accuracy": 0.882288470864296,
"num_tokens": 42358315.0,
"step": 6860
},
{
"entropy": 0.30098615810275076,
"epoch": 1.2224397188361955,
"grad_norm": 0.61328125,
"learning_rate": 1.79730464080694e-06,
"loss": 0.29600207805633544,
"mean_token_accuracy": 0.8975545167922974,
"num_tokens": 42420777.0,
"step": 6870
},
{
"entropy": 0.3088440358638763,
"epoch": 1.224219236586885,
"grad_norm": 0.6640625,
"learning_rate": 1.790249589391112e-06,
"loss": 0.30383594036102296,
"mean_token_accuracy": 0.896770778298378,
"num_tokens": 42479025.0,
"step": 6880
},
{
"entropy": 0.3324041463434696,
"epoch": 1.2259987543375745,
"grad_norm": 0.7421875,
"learning_rate": 1.7832006804575558e-06,
"loss": 0.32544784545898436,
"mean_token_accuracy": 0.8882332682609558,
"num_tokens": 42542454.0,
"step": 6890
},
{
"entropy": 0.29980617538094523,
"epoch": 1.2277782720882642,
"grad_norm": 0.69140625,
"learning_rate": 1.7761579750105275e-06,
"loss": 0.2965404987335205,
"mean_token_accuracy": 0.8998603194952011,
"num_tokens": 42603036.0,
"step": 6900
},
{
"entropy": 0.33238585740327836,
"epoch": 1.2295577898389536,
"grad_norm": 0.83984375,
"learning_rate": 1.7691215340006013e-06,
"loss": 0.3291919231414795,
"mean_token_accuracy": 0.8872955650091171,
"num_tokens": 42663636.0,
"step": 6910
},
{
"entropy": 0.3531717598438263,
"epoch": 1.2313373075896432,
"grad_norm": 0.7421875,
"learning_rate": 1.7620914183241343e-06,
"loss": 0.35305089950561525,
"mean_token_accuracy": 0.8783060044050217,
"num_tokens": 42725283.0,
"step": 6920
},
{
"entropy": 0.2961632959544659,
"epoch": 1.2331168253403328,
"grad_norm": 0.6796875,
"learning_rate": 1.7550676888227384e-06,
"loss": 0.289636492729187,
"mean_token_accuracy": 0.9009805649518967,
"num_tokens": 42782049.0,
"step": 6930
},
{
"entropy": 0.31958863213658334,
"epoch": 1.2348963430910223,
"grad_norm": 0.65234375,
"learning_rate": 1.7480504062827624e-06,
"loss": 0.3198336362838745,
"mean_token_accuracy": 0.8904768764972687,
"num_tokens": 42846369.0,
"step": 6940
},
{
"entropy": 0.2919312186539173,
"epoch": 1.2366758608417119,
"grad_norm": 0.66015625,
"learning_rate": 1.741039631434755e-06,
"loss": 0.29471306800842284,
"mean_token_accuracy": 0.9014884948730468,
"num_tokens": 42904504.0,
"step": 6950
},
{
"entropy": 0.3211238384246826,
"epoch": 1.2384553785924015,
"grad_norm": 0.71875,
"learning_rate": 1.7340354249529485e-06,
"loss": 0.31960334777832033,
"mean_token_accuracy": 0.8921381384134293,
"num_tokens": 42962870.0,
"step": 6960
},
{
"entropy": 0.31605843752622603,
"epoch": 1.240234896343091,
"grad_norm": 0.859375,
"learning_rate": 1.7270378474547268e-06,
"loss": 0.31270034313201905,
"mean_token_accuracy": 0.8933271408081055,
"num_tokens": 43021493.0,
"step": 6970
},
{
"entropy": 0.3293205611407757,
"epoch": 1.2420144140937805,
"grad_norm": 0.71484375,
"learning_rate": 1.7200469595001063e-06,
"loss": 0.33206079006195066,
"mean_token_accuracy": 0.887144660949707,
"num_tokens": 43083781.0,
"step": 6980
},
{
"entropy": 0.3170642703771591,
"epoch": 1.2437939318444702,
"grad_norm": 0.828125,
"learning_rate": 1.7130628215912088e-06,
"loss": 0.31469810009002686,
"mean_token_accuracy": 0.8914343833923339,
"num_tokens": 43144172.0,
"step": 6990
},
{
"entropy": 0.3084431208670139,
"epoch": 1.2455734495951596,
"grad_norm": 0.63671875,
"learning_rate": 1.7060854941717359e-06,
"loss": 0.3069377660751343,
"mean_token_accuracy": 0.8941071331501007,
"num_tokens": 43211876.0,
"step": 7000
}
],
"logging_steps": 10,
"max_steps": 11240,
"num_input_tokens_seen": 0,
"num_train_epochs": 2,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 4.391328755503104e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}