15k / trainer_state.json
wzqww23's picture
Upload folder using huggingface_hub
96380f7 verified
Raw
History Blame
260 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.002102738690980681,
"eval_steps": 500,
"global_step": 15000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_loss": 10.238426208496094,
"eval_runtime": 111.932,
"eval_samples_per_second": 204.079,
"eval_steps_per_second": 1.599,
"step": 0
},
{
"epoch": 1.4018257939871205e-06,
"grad_norm": 235.0,
"learning_rate": 2.6999999999999996e-06,
"loss": 10.1619,
"step": 10
},
{
"epoch": 2.803651587974241e-06,
"grad_norm": 187.0,
"learning_rate": 5.7e-06,
"loss": 10.0993,
"step": 20
},
{
"epoch": 4.205477381961362e-06,
"grad_norm": 203.0,
"learning_rate": 8.7e-06,
"loss": 9.9129,
"step": 30
},
{
"epoch": 5.607303175948482e-06,
"grad_norm": 178.0,
"learning_rate": 1.17e-05,
"loss": 9.5407,
"step": 40
},
{
"epoch": 7.009128969935603e-06,
"grad_norm": 230.0,
"learning_rate": 1.47e-05,
"loss": 9.1468,
"step": 50
},
{
"epoch": 8.410954763922724e-06,
"grad_norm": 290.0,
"learning_rate": 1.7699999999999997e-05,
"loss": 8.5916,
"step": 60
},
{
"epoch": 9.812780557909844e-06,
"grad_norm": 398.0,
"learning_rate": 2.07e-05,
"loss": 8.1624,
"step": 70
},
{
"epoch": 1.1214606351896964e-05,
"grad_norm": 340.0,
"learning_rate": 2.3699999999999997e-05,
"loss": 8.0425,
"step": 80
},
{
"epoch": 1.2616432145884086e-05,
"grad_norm": 368.0,
"learning_rate": 2.6699999999999995e-05,
"loss": 7.2555,
"step": 90
},
{
"epoch": 1.4018257939871206e-05,
"grad_norm": 346.0,
"learning_rate": 2.97e-05,
"loss": 7.3853,
"step": 100
},
{
"epoch": 1.5420083733858326e-05,
"grad_norm": 167.0,
"learning_rate": 3.2699999999999995e-05,
"loss": 6.8838,
"step": 110
},
{
"epoch": 1.6821909527845447e-05,
"grad_norm": 292.0,
"learning_rate": 3.5699999999999994e-05,
"loss": 6.7212,
"step": 120
},
{
"epoch": 1.822373532183257e-05,
"grad_norm": 253.0,
"learning_rate": 3.87e-05,
"loss": 6.3265,
"step": 130
},
{
"epoch": 1.9625561115819688e-05,
"grad_norm": 133.0,
"learning_rate": 4.17e-05,
"loss": 6.2292,
"step": 140
},
{
"epoch": 2.102738690980681e-05,
"grad_norm": 79.5,
"learning_rate": 4.4699999999999996e-05,
"loss": 5.1204,
"step": 150
},
{
"epoch": 2.2429212703793928e-05,
"grad_norm": 38.5,
"learning_rate": 4.7699999999999994e-05,
"loss": 4.9199,
"step": 160
},
{
"epoch": 2.383103849778105e-05,
"grad_norm": 27.875,
"learning_rate": 5.07e-05,
"loss": 4.1897,
"step": 170
},
{
"epoch": 2.523286429176817e-05,
"grad_norm": 23.375,
"learning_rate": 5.369999999999999e-05,
"loss": 3.1582,
"step": 180
},
{
"epoch": 2.663469008575529e-05,
"grad_norm": 11.75,
"learning_rate": 5.6699999999999996e-05,
"loss": 2.0433,
"step": 190
},
{
"epoch": 2.803651587974241e-05,
"grad_norm": 4.625,
"learning_rate": 5.97e-05,
"loss": 1.3245,
"step": 200
},
{
"epoch": 2.9438341673729533e-05,
"grad_norm": 3.1875,
"learning_rate": 6.269999999999999e-05,
"loss": 1.1166,
"step": 210
},
{
"epoch": 3.084016746771665e-05,
"grad_norm": 1.40625,
"learning_rate": 6.57e-05,
"loss": 0.884,
"step": 220
},
{
"epoch": 3.224199326170377e-05,
"grad_norm": 2.40625,
"learning_rate": 6.87e-05,
"loss": 0.8963,
"step": 230
},
{
"epoch": 3.3643819055690895e-05,
"grad_norm": 1.8125,
"learning_rate": 7.17e-05,
"loss": 0.9096,
"step": 240
},
{
"epoch": 3.504564484967802e-05,
"grad_norm": 0.9921875,
"learning_rate": 7.47e-05,
"loss": 0.8575,
"step": 250
},
{
"epoch": 3.644747064366514e-05,
"grad_norm": 1.4375,
"learning_rate": 7.769999999999999e-05,
"loss": 0.791,
"step": 260
},
{
"epoch": 3.7849296437652253e-05,
"grad_norm": 1.046875,
"learning_rate": 8.07e-05,
"loss": 0.8676,
"step": 270
},
{
"epoch": 3.9251122231639375e-05,
"grad_norm": 1.5859375,
"learning_rate": 8.37e-05,
"loss": 0.8645,
"step": 280
},
{
"epoch": 4.06529480256265e-05,
"grad_norm": 0.84765625,
"learning_rate": 8.669999999999998e-05,
"loss": 0.7618,
"step": 290
},
{
"epoch": 4.205477381961362e-05,
"grad_norm": 1.1640625,
"learning_rate": 8.969999999999998e-05,
"loss": 0.8603,
"step": 300
},
{
"epoch": 4.345659961360074e-05,
"grad_norm": 0.64453125,
"learning_rate": 9.269999999999999e-05,
"loss": 0.7988,
"step": 310
},
{
"epoch": 4.4858425407587855e-05,
"grad_norm": 0.94921875,
"learning_rate": 9.57e-05,
"loss": 0.8073,
"step": 320
},
{
"epoch": 4.626025120157498e-05,
"grad_norm": 0.76171875,
"learning_rate": 9.87e-05,
"loss": 0.8298,
"step": 330
},
{
"epoch": 4.76620769955621e-05,
"grad_norm": 1.5390625,
"learning_rate": 0.00010169999999999999,
"loss": 0.6355,
"step": 340
},
{
"epoch": 4.906390278954922e-05,
"grad_norm": 1.7890625,
"learning_rate": 0.00010469999999999998,
"loss": 0.848,
"step": 350
},
{
"epoch": 5.046572858353634e-05,
"grad_norm": 0.62109375,
"learning_rate": 0.00010769999999999999,
"loss": 0.5291,
"step": 360
},
{
"epoch": 5.1867554377523464e-05,
"grad_norm": 1.578125,
"learning_rate": 0.0001107,
"loss": 0.6325,
"step": 370
},
{
"epoch": 5.326938017151058e-05,
"grad_norm": 0.8828125,
"learning_rate": 0.00011369999999999999,
"loss": 0.7049,
"step": 380
},
{
"epoch": 5.46712059654977e-05,
"grad_norm": 1.109375,
"learning_rate": 0.00011669999999999999,
"loss": 0.7385,
"step": 390
},
{
"epoch": 5.607303175948482e-05,
"grad_norm": 1.0078125,
"learning_rate": 0.0001197,
"loss": 0.7195,
"step": 400
},
{
"epoch": 5.7474857553471944e-05,
"grad_norm": 1.0390625,
"learning_rate": 0.00012269999999999997,
"loss": 0.7844,
"step": 410
},
{
"epoch": 5.8876683347459066e-05,
"grad_norm": 0.69140625,
"learning_rate": 0.0001257,
"loss": 0.677,
"step": 420
},
{
"epoch": 6.027850914144619e-05,
"grad_norm": 1.703125,
"learning_rate": 0.00012869999999999998,
"loss": 0.704,
"step": 430
},
{
"epoch": 6.16803349354333e-05,
"grad_norm": 1.21875,
"learning_rate": 0.00013169999999999998,
"loss": 0.5956,
"step": 440
},
{
"epoch": 6.308216072942043e-05,
"grad_norm": 1.015625,
"learning_rate": 0.0001347,
"loss": 0.769,
"step": 450
},
{
"epoch": 6.448398652340755e-05,
"grad_norm": 1.1484375,
"learning_rate": 0.00013769999999999999,
"loss": 0.6908,
"step": 460
},
{
"epoch": 6.588581231739466e-05,
"grad_norm": 0.90625,
"learning_rate": 0.00014069999999999998,
"loss": 0.6306,
"step": 470
},
{
"epoch": 6.728763811138179e-05,
"grad_norm": 0.9765625,
"learning_rate": 0.00014369999999999997,
"loss": 0.6421,
"step": 480
},
{
"epoch": 6.86894639053689e-05,
"grad_norm": 1.71875,
"learning_rate": 0.0001467,
"loss": 0.7901,
"step": 490
},
{
"epoch": 7.009128969935603e-05,
"grad_norm": 1.6640625,
"learning_rate": 0.00014969999999999998,
"loss": 0.6785,
"step": 500
},
{
"epoch": 7.009128969935603e-05,
"eval_loss": 0.27128955721855164,
"eval_runtime": 113.5365,
"eval_samples_per_second": 201.195,
"eval_steps_per_second": 1.577,
"step": 500
},
{
"epoch": 7.149311549334315e-05,
"grad_norm": 1.0859375,
"learning_rate": 0.0001527,
"loss": 0.6427,
"step": 510
},
{
"epoch": 7.289494128733028e-05,
"grad_norm": 0.51953125,
"learning_rate": 0.0001557,
"loss": 0.7077,
"step": 520
},
{
"epoch": 7.429676708131739e-05,
"grad_norm": 1.3203125,
"learning_rate": 0.00015869999999999998,
"loss": 0.6865,
"step": 530
},
{
"epoch": 7.569859287530451e-05,
"grad_norm": 1.140625,
"learning_rate": 0.0001617,
"loss": 0.7239,
"step": 540
},
{
"epoch": 7.710041866929164e-05,
"grad_norm": 0.73046875,
"learning_rate": 0.0001647,
"loss": 0.6667,
"step": 550
},
{
"epoch": 7.850224446327875e-05,
"grad_norm": 1.34375,
"learning_rate": 0.0001677,
"loss": 0.8085,
"step": 560
},
{
"epoch": 7.990407025726588e-05,
"grad_norm": 1.3046875,
"learning_rate": 0.00017069999999999998,
"loss": 0.7019,
"step": 570
},
{
"epoch": 8.1305896051253e-05,
"grad_norm": 1.796875,
"learning_rate": 0.00017369999999999997,
"loss": 0.7378,
"step": 580
},
{
"epoch": 8.270772184524011e-05,
"grad_norm": 0.98828125,
"learning_rate": 0.00017669999999999999,
"loss": 0.6776,
"step": 590
},
{
"epoch": 8.410954763922724e-05,
"grad_norm": 1.2578125,
"learning_rate": 0.00017969999999999998,
"loss": 0.6166,
"step": 600
},
{
"epoch": 8.551137343321435e-05,
"grad_norm": 0.75,
"learning_rate": 0.00018269999999999997,
"loss": 0.5741,
"step": 610
},
{
"epoch": 8.691319922720148e-05,
"grad_norm": 1.1484375,
"learning_rate": 0.0001857,
"loss": 0.7397,
"step": 620
},
{
"epoch": 8.83150250211886e-05,
"grad_norm": 1.265625,
"learning_rate": 0.00018869999999999998,
"loss": 0.6753,
"step": 630
},
{
"epoch": 8.971685081517571e-05,
"grad_norm": 0.9375,
"learning_rate": 0.0001917,
"loss": 0.689,
"step": 640
},
{
"epoch": 9.111867660916284e-05,
"grad_norm": 1.1484375,
"learning_rate": 0.0001947,
"loss": 0.5332,
"step": 650
},
{
"epoch": 9.252050240314995e-05,
"grad_norm": 1.234375,
"learning_rate": 0.00019769999999999998,
"loss": 0.7178,
"step": 660
},
{
"epoch": 9.392232819713708e-05,
"grad_norm": 0.8203125,
"learning_rate": 0.0002007,
"loss": 0.5924,
"step": 670
},
{
"epoch": 9.53241539911242e-05,
"grad_norm": 1.5,
"learning_rate": 0.0002037,
"loss": 0.6734,
"step": 680
},
{
"epoch": 9.672597978511133e-05,
"grad_norm": 0.9921875,
"learning_rate": 0.00020669999999999996,
"loss": 0.6536,
"step": 690
},
{
"epoch": 9.812780557909844e-05,
"grad_norm": 0.62890625,
"learning_rate": 0.00020969999999999997,
"loss": 0.5084,
"step": 700
},
{
"epoch": 9.952963137308556e-05,
"grad_norm": 0.890625,
"learning_rate": 0.00021269999999999997,
"loss": 0.7349,
"step": 710
},
{
"epoch": 0.00010093145716707268,
"grad_norm": 0.6875,
"learning_rate": 0.00021569999999999998,
"loss": 0.519,
"step": 720
},
{
"epoch": 0.0001023332829610598,
"grad_norm": 1.3671875,
"learning_rate": 0.00021869999999999998,
"loss": 0.6678,
"step": 730
},
{
"epoch": 0.00010373510875504693,
"grad_norm": 0.5625,
"learning_rate": 0.00022169999999999997,
"loss": 0.6112,
"step": 740
},
{
"epoch": 0.00010513693454903404,
"grad_norm": 1.09375,
"learning_rate": 0.0002247,
"loss": 0.6505,
"step": 750
},
{
"epoch": 0.00010653876034302116,
"grad_norm": 1.0234375,
"learning_rate": 0.00022769999999999998,
"loss": 0.6256,
"step": 760
},
{
"epoch": 0.00010794058613700829,
"grad_norm": 0.78125,
"learning_rate": 0.0002307,
"loss": 0.6422,
"step": 770
},
{
"epoch": 0.0001093424119309954,
"grad_norm": 0.72265625,
"learning_rate": 0.0002337,
"loss": 0.6357,
"step": 780
},
{
"epoch": 0.00011074423772498253,
"grad_norm": 1.25,
"learning_rate": 0.00023669999999999998,
"loss": 0.6263,
"step": 790
},
{
"epoch": 0.00011214606351896965,
"grad_norm": 1.1171875,
"learning_rate": 0.0002397,
"loss": 0.6531,
"step": 800
},
{
"epoch": 0.00011354788931295677,
"grad_norm": 1.1875,
"learning_rate": 0.0002427,
"loss": 0.5806,
"step": 810
},
{
"epoch": 0.00011494971510694389,
"grad_norm": 1.1953125,
"learning_rate": 0.00024569999999999995,
"loss": 0.5925,
"step": 820
},
{
"epoch": 0.000116351540900931,
"grad_norm": 1.1640625,
"learning_rate": 0.0002487,
"loss": 0.5465,
"step": 830
},
{
"epoch": 0.00011775336669491813,
"grad_norm": 0.66796875,
"learning_rate": 0.0002517,
"loss": 0.7182,
"step": 840
},
{
"epoch": 0.00011915519248890525,
"grad_norm": 1.3203125,
"learning_rate": 0.00025469999999999996,
"loss": 0.6767,
"step": 850
},
{
"epoch": 0.00012055701828289238,
"grad_norm": 1.2890625,
"learning_rate": 0.0002577,
"loss": 0.6315,
"step": 860
},
{
"epoch": 0.00012195884407687949,
"grad_norm": 0.71484375,
"learning_rate": 0.0002607,
"loss": 0.6724,
"step": 870
},
{
"epoch": 0.0001233606698708666,
"grad_norm": 0.9765625,
"learning_rate": 0.00026369999999999996,
"loss": 0.6528,
"step": 880
},
{
"epoch": 0.00012476249566485372,
"grad_norm": 1.15625,
"learning_rate": 0.0002667,
"loss": 0.5295,
"step": 890
},
{
"epoch": 0.00012616432145884086,
"grad_norm": 0.890625,
"learning_rate": 0.0002697,
"loss": 0.4982,
"step": 900
},
{
"epoch": 0.00012756614725282798,
"grad_norm": 1.2734375,
"learning_rate": 0.00027269999999999996,
"loss": 0.6562,
"step": 910
},
{
"epoch": 0.0001289679730468151,
"grad_norm": 0.8515625,
"learning_rate": 0.0002757,
"loss": 0.675,
"step": 920
},
{
"epoch": 0.0001303697988408022,
"grad_norm": 1.2890625,
"learning_rate": 0.0002787,
"loss": 0.6327,
"step": 930
},
{
"epoch": 0.00013177162463478932,
"grad_norm": 1.203125,
"learning_rate": 0.00028169999999999996,
"loss": 0.7426,
"step": 940
},
{
"epoch": 0.00013317345042877646,
"grad_norm": 0.94921875,
"learning_rate": 0.0002847,
"loss": 0.5876,
"step": 950
},
{
"epoch": 0.00013457527622276358,
"grad_norm": 0.625,
"learning_rate": 0.00028769999999999995,
"loss": 0.6968,
"step": 960
},
{
"epoch": 0.0001359771020167507,
"grad_norm": 0.54296875,
"learning_rate": 0.00029069999999999996,
"loss": 0.6377,
"step": 970
},
{
"epoch": 0.0001373789278107378,
"grad_norm": 0.78125,
"learning_rate": 0.0002937,
"loss": 0.515,
"step": 980
},
{
"epoch": 0.00013878075360472492,
"grad_norm": 0.95703125,
"learning_rate": 0.00029669999999999995,
"loss": 0.6966,
"step": 990
},
{
"epoch": 0.00014018257939871207,
"grad_norm": 0.376953125,
"learning_rate": 0.00029969999999999997,
"loss": 0.5426,
"step": 1000
},
{
"epoch": 0.00014018257939871207,
"eval_loss": 0.2417471706867218,
"eval_runtime": 111.9274,
"eval_samples_per_second": 204.088,
"eval_steps_per_second": 1.599,
"step": 1000
},
{
"epoch": 0.00014158440519269918,
"grad_norm": 1.1015625,
"learning_rate": 0.0002999999999988214,
"loss": 0.579,
"step": 1010
},
{
"epoch": 0.0001429862309866863,
"grad_norm": 1.0625,
"learning_rate": 0.0002999999999947473,
"loss": 0.5958,
"step": 1020
},
{
"epoch": 0.0001443880567806734,
"grad_norm": 1.1953125,
"learning_rate": 0.0002999999999877632,
"loss": 0.5812,
"step": 1030
},
{
"epoch": 0.00014578988257466055,
"grad_norm": 1.1171875,
"learning_rate": 0.000299999999977869,
"loss": 0.6251,
"step": 1040
},
{
"epoch": 0.00014719170836864767,
"grad_norm": 1.125,
"learning_rate": 0.0002999999999650648,
"loss": 0.6301,
"step": 1050
},
{
"epoch": 0.00014859353416263478,
"grad_norm": 0.71484375,
"learning_rate": 0.0002999999999493505,
"loss": 0.6041,
"step": 1060
},
{
"epoch": 0.0001499953599566219,
"grad_norm": 0.73828125,
"learning_rate": 0.0002999999999307262,
"loss": 0.5958,
"step": 1070
},
{
"epoch": 0.00015139718575060901,
"grad_norm": 0.5625,
"learning_rate": 0.00029999999990919175,
"loss": 0.5158,
"step": 1080
},
{
"epoch": 0.00015279901154459616,
"grad_norm": 0.93359375,
"learning_rate": 0.00029999999988474733,
"loss": 0.5815,
"step": 1090
},
{
"epoch": 0.00015420083733858327,
"grad_norm": 0.84765625,
"learning_rate": 0.00029999999985739286,
"loss": 0.5338,
"step": 1100
},
{
"epoch": 0.00015560266313257039,
"grad_norm": 0.546875,
"learning_rate": 0.0002999999998271283,
"loss": 0.3756,
"step": 1110
},
{
"epoch": 0.0001570044889265575,
"grad_norm": 0.86328125,
"learning_rate": 0.0002999999997939537,
"loss": 0.5302,
"step": 1120
},
{
"epoch": 0.00015840631472054462,
"grad_norm": 0.625,
"learning_rate": 0.000299999999757869,
"loss": 0.6399,
"step": 1130
},
{
"epoch": 0.00015980814051453176,
"grad_norm": 0.6640625,
"learning_rate": 0.0002999999997188743,
"loss": 0.5165,
"step": 1140
},
{
"epoch": 0.00016120996630851887,
"grad_norm": 1.0390625,
"learning_rate": 0.0002999999996769696,
"loss": 0.611,
"step": 1150
},
{
"epoch": 0.000162611792102506,
"grad_norm": 0.703125,
"learning_rate": 0.00029999999963215473,
"loss": 0.4649,
"step": 1160
},
{
"epoch": 0.0001640136178964931,
"grad_norm": 0.474609375,
"learning_rate": 0.0002999999995844299,
"loss": 0.5931,
"step": 1170
},
{
"epoch": 0.00016541544369048022,
"grad_norm": 1.515625,
"learning_rate": 0.000299999999533795,
"loss": 0.605,
"step": 1180
},
{
"epoch": 0.00016681726948446736,
"grad_norm": 0.8671875,
"learning_rate": 0.00029999999948025,
"loss": 0.5483,
"step": 1190
},
{
"epoch": 0.00016821909527845447,
"grad_norm": 0.796875,
"learning_rate": 0.000299999999423795,
"loss": 0.5798,
"step": 1200
},
{
"epoch": 0.0001696209210724416,
"grad_norm": 0.93359375,
"learning_rate": 0.0002999999993644299,
"loss": 0.5735,
"step": 1210
},
{
"epoch": 0.0001710227468664287,
"grad_norm": 0.7734375,
"learning_rate": 0.00029999999930215476,
"loss": 0.5838,
"step": 1220
},
{
"epoch": 0.00017242457266041582,
"grad_norm": 0.44921875,
"learning_rate": 0.0002999999992369696,
"loss": 0.495,
"step": 1230
},
{
"epoch": 0.00017382639845440296,
"grad_norm": 0.8984375,
"learning_rate": 0.00029999999916887433,
"loss": 0.576,
"step": 1240
},
{
"epoch": 0.00017522822424839008,
"grad_norm": 1.015625,
"learning_rate": 0.00029999999909786906,
"loss": 0.5682,
"step": 1250
},
{
"epoch": 0.0001766300500423772,
"grad_norm": 0.91796875,
"learning_rate": 0.00029999999902395374,
"loss": 0.609,
"step": 1260
},
{
"epoch": 0.0001780318758363643,
"grad_norm": 0.9609375,
"learning_rate": 0.0002999999989471283,
"loss": 0.5911,
"step": 1270
},
{
"epoch": 0.00017943370163035142,
"grad_norm": 1.078125,
"learning_rate": 0.0002999999988673929,
"loss": 0.6365,
"step": 1280
},
{
"epoch": 0.00018083552742433856,
"grad_norm": 0.67578125,
"learning_rate": 0.00029999999878474736,
"loss": 0.4741,
"step": 1290
},
{
"epoch": 0.00018223735321832568,
"grad_norm": 0.8828125,
"learning_rate": 0.0002999999986991918,
"loss": 0.6288,
"step": 1300
},
{
"epoch": 0.0001836391790123128,
"grad_norm": 0.5,
"learning_rate": 0.0002999999986107262,
"loss": 0.4648,
"step": 1310
},
{
"epoch": 0.0001850410048062999,
"grad_norm": 0.61328125,
"learning_rate": 0.00029999999851935055,
"loss": 0.5761,
"step": 1320
},
{
"epoch": 0.00018644283060028705,
"grad_norm": 1.4375,
"learning_rate": 0.00029999999842506486,
"loss": 0.5775,
"step": 1330
},
{
"epoch": 0.00018784465639427417,
"grad_norm": 0.96875,
"learning_rate": 0.00029999999832786906,
"loss": 0.5382,
"step": 1340
},
{
"epoch": 0.00018924648218826128,
"grad_norm": 1.078125,
"learning_rate": 0.00029999999822776327,
"loss": 0.5922,
"step": 1350
},
{
"epoch": 0.0001906483079822484,
"grad_norm": 0.62890625,
"learning_rate": 0.0002999999981247474,
"loss": 0.4537,
"step": 1360
},
{
"epoch": 0.0001920501337762355,
"grad_norm": 1.328125,
"learning_rate": 0.00029999999801882146,
"loss": 0.5119,
"step": 1370
},
{
"epoch": 0.00019345195957022265,
"grad_norm": 0.86328125,
"learning_rate": 0.0002999999979099855,
"loss": 0.478,
"step": 1380
},
{
"epoch": 0.00019485378536420977,
"grad_norm": 1.9296875,
"learning_rate": 0.00029999999779823944,
"loss": 0.4734,
"step": 1390
},
{
"epoch": 0.00019625561115819688,
"grad_norm": 1.2421875,
"learning_rate": 0.0002999999976835834,
"loss": 0.4924,
"step": 1400
},
{
"epoch": 0.000197657436952184,
"grad_norm": 2.046875,
"learning_rate": 0.00029999999756601727,
"loss": 0.5205,
"step": 1410
},
{
"epoch": 0.0001990592627461711,
"grad_norm": 1.3984375,
"learning_rate": 0.0002999999974455411,
"loss": 0.5122,
"step": 1420
},
{
"epoch": 0.00020046108854015825,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999999732215483,
"loss": 0.5492,
"step": 1430
},
{
"epoch": 0.00020186291433414537,
"grad_norm": 0.5234375,
"learning_rate": 0.00029999999719585856,
"loss": 0.5266,
"step": 1440
},
{
"epoch": 0.00020326474012813248,
"grad_norm": 0.85546875,
"learning_rate": 0.00029999999706665224,
"loss": 0.5307,
"step": 1450
},
{
"epoch": 0.0002046665659221196,
"grad_norm": 0.53515625,
"learning_rate": 0.0002999999969345358,
"loss": 0.6882,
"step": 1460
},
{
"epoch": 0.00020606839171610671,
"grad_norm": 0.84375,
"learning_rate": 0.0002999999967995094,
"loss": 0.5092,
"step": 1470
},
{
"epoch": 0.00020747021751009386,
"grad_norm": 0.7734375,
"learning_rate": 0.0002999999966615729,
"loss": 0.4554,
"step": 1480
},
{
"epoch": 0.00020887204330408097,
"grad_norm": 0.84765625,
"learning_rate": 0.0002999999965207263,
"loss": 0.5944,
"step": 1490
},
{
"epoch": 0.0002102738690980681,
"grad_norm": 0.97265625,
"learning_rate": 0.0002999999963769697,
"loss": 0.5038,
"step": 1500
},
{
"epoch": 0.0002102738690980681,
"eval_loss": 0.22094833850860596,
"eval_runtime": 112.0927,
"eval_samples_per_second": 203.787,
"eval_steps_per_second": 1.597,
"step": 1500
},
{
"epoch": 0.0002116756948920552,
"grad_norm": 0.8125,
"learning_rate": 0.00029999999623030307,
"loss": 0.5026,
"step": 1510
},
{
"epoch": 0.00021307752068604232,
"grad_norm": 0.390625,
"learning_rate": 0.0002999999960807263,
"loss": 0.5545,
"step": 1520
},
{
"epoch": 0.00021447934648002946,
"grad_norm": 1.109375,
"learning_rate": 0.0002999999959282396,
"loss": 0.5133,
"step": 1530
},
{
"epoch": 0.00021588117227401657,
"grad_norm": 1.2578125,
"learning_rate": 0.0002999999957728428,
"loss": 0.5241,
"step": 1540
},
{
"epoch": 0.0002172829980680037,
"grad_norm": 0.60546875,
"learning_rate": 0.00029999999561453587,
"loss": 0.4591,
"step": 1550
},
{
"epoch": 0.0002186848238619908,
"grad_norm": 0.84765625,
"learning_rate": 0.00029999999545331896,
"loss": 0.5348,
"step": 1560
},
{
"epoch": 0.00022008664965597792,
"grad_norm": 1.171875,
"learning_rate": 0.00029999999528919195,
"loss": 0.5408,
"step": 1570
},
{
"epoch": 0.00022148847544996506,
"grad_norm": 1.1171875,
"learning_rate": 0.000299999995122155,
"loss": 0.616,
"step": 1580
},
{
"epoch": 0.00022289030124395218,
"grad_norm": 1.53125,
"learning_rate": 0.0002999999949522079,
"loss": 0.585,
"step": 1590
},
{
"epoch": 0.0002242921270379393,
"grad_norm": 0.373046875,
"learning_rate": 0.0002999999947793507,
"loss": 0.4513,
"step": 1600
},
{
"epoch": 0.0002256939528319264,
"grad_norm": 1.0078125,
"learning_rate": 0.0002999999946035836,
"loss": 0.5646,
"step": 1610
},
{
"epoch": 0.00022709577862591355,
"grad_norm": 0.6328125,
"learning_rate": 0.0002999999944249063,
"loss": 0.4162,
"step": 1620
},
{
"epoch": 0.00022849760441990066,
"grad_norm": 0.462890625,
"learning_rate": 0.00029999999424331903,
"loss": 0.5288,
"step": 1630
},
{
"epoch": 0.00022989943021388778,
"grad_norm": 0.26953125,
"learning_rate": 0.0002999999940588217,
"loss": 0.5398,
"step": 1640
},
{
"epoch": 0.0002313012560078749,
"grad_norm": 1.109375,
"learning_rate": 0.00029999999387141427,
"loss": 0.5167,
"step": 1650
},
{
"epoch": 0.000232703081801862,
"grad_norm": 0.765625,
"learning_rate": 0.00029999999368109684,
"loss": 0.5953,
"step": 1660
},
{
"epoch": 0.00023410490759584915,
"grad_norm": 0.66796875,
"learning_rate": 0.00029999999348786935,
"loss": 0.5765,
"step": 1670
},
{
"epoch": 0.00023550673338983626,
"grad_norm": 0.890625,
"learning_rate": 0.00029999999329173176,
"loss": 0.5683,
"step": 1680
},
{
"epoch": 0.00023690855918382338,
"grad_norm": 0.8203125,
"learning_rate": 0.00029999999309268416,
"loss": 0.4832,
"step": 1690
},
{
"epoch": 0.0002383103849778105,
"grad_norm": 0.369140625,
"learning_rate": 0.0002999999928907265,
"loss": 0.4763,
"step": 1700
},
{
"epoch": 0.0002397122107717976,
"grad_norm": 0.72265625,
"learning_rate": 0.0002999999926858588,
"loss": 0.5735,
"step": 1710
},
{
"epoch": 0.00024111403656578475,
"grad_norm": 1.078125,
"learning_rate": 0.000299999992478081,
"loss": 0.5352,
"step": 1720
},
{
"epoch": 0.00024251586235977187,
"grad_norm": 0.63671875,
"learning_rate": 0.0002999999922673932,
"loss": 0.5497,
"step": 1730
},
{
"epoch": 0.00024391768815375898,
"grad_norm": 0.310546875,
"learning_rate": 0.00029999999205379535,
"loss": 0.5335,
"step": 1740
},
{
"epoch": 0.0002453195139477461,
"grad_norm": 1.03125,
"learning_rate": 0.0002999999918372874,
"loss": 0.476,
"step": 1750
},
{
"epoch": 0.0002467213397417332,
"grad_norm": 0.86328125,
"learning_rate": 0.0002999999916178694,
"loss": 0.5105,
"step": 1760
},
{
"epoch": 0.0002481231655357203,
"grad_norm": 0.68359375,
"learning_rate": 0.0002999999913955414,
"loss": 0.5929,
"step": 1770
},
{
"epoch": 0.00024952499132970744,
"grad_norm": 0.419921875,
"learning_rate": 0.00029999999117030334,
"loss": 0.4957,
"step": 1780
},
{
"epoch": 0.0002509268171236946,
"grad_norm": 0.6328125,
"learning_rate": 0.0002999999909421552,
"loss": 0.5539,
"step": 1790
},
{
"epoch": 0.0002523286429176817,
"grad_norm": 0.96484375,
"learning_rate": 0.000299999990711097,
"loss": 0.4833,
"step": 1800
},
{
"epoch": 0.00025373046871166884,
"grad_norm": 0.55078125,
"learning_rate": 0.00029999999047712877,
"loss": 0.5147,
"step": 1810
},
{
"epoch": 0.00025513229450565596,
"grad_norm": 1.3671875,
"learning_rate": 0.0002999999902402505,
"loss": 0.4975,
"step": 1820
},
{
"epoch": 0.00025653412029964307,
"grad_norm": 0.6171875,
"learning_rate": 0.0002999999900004621,
"loss": 0.5936,
"step": 1830
},
{
"epoch": 0.0002579359460936302,
"grad_norm": 1.25,
"learning_rate": 0.0002999999897577637,
"loss": 0.5696,
"step": 1840
},
{
"epoch": 0.0002593377718876173,
"grad_norm": 0.8359375,
"learning_rate": 0.0002999999895121553,
"loss": 0.507,
"step": 1850
},
{
"epoch": 0.0002607395976816044,
"grad_norm": 0.37890625,
"learning_rate": 0.0002999999892636368,
"loss": 0.4285,
"step": 1860
},
{
"epoch": 0.00026214142347559153,
"grad_norm": 1.1328125,
"learning_rate": 0.00029999998901220824,
"loss": 0.5559,
"step": 1870
},
{
"epoch": 0.00026354324926957865,
"grad_norm": 0.57421875,
"learning_rate": 0.0002999999887578696,
"loss": 0.5271,
"step": 1880
},
{
"epoch": 0.0002649450750635658,
"grad_norm": 0.484375,
"learning_rate": 0.00029999998850062094,
"loss": 0.4832,
"step": 1890
},
{
"epoch": 0.00026634690085755293,
"grad_norm": 1.328125,
"learning_rate": 0.00029999998824046224,
"loss": 0.6106,
"step": 1900
},
{
"epoch": 0.00026774872665154004,
"grad_norm": 1.828125,
"learning_rate": 0.0002999999879773935,
"loss": 0.5356,
"step": 1910
},
{
"epoch": 0.00026915055244552716,
"grad_norm": 1.2265625,
"learning_rate": 0.0002999999877114147,
"loss": 0.5922,
"step": 1920
},
{
"epoch": 0.0002705523782395143,
"grad_norm": 1.0234375,
"learning_rate": 0.00029999998744252576,
"loss": 0.4454,
"step": 1930
},
{
"epoch": 0.0002719542040335014,
"grad_norm": 0.84765625,
"learning_rate": 0.00029999998717072685,
"loss": 0.4555,
"step": 1940
},
{
"epoch": 0.0002733560298274885,
"grad_norm": 0.79296875,
"learning_rate": 0.0002999999868960179,
"loss": 0.5104,
"step": 1950
},
{
"epoch": 0.0002747578556214756,
"grad_norm": 0.9140625,
"learning_rate": 0.00029999998661839886,
"loss": 0.5298,
"step": 1960
},
{
"epoch": 0.00027615968141546273,
"grad_norm": 0.3828125,
"learning_rate": 0.0002999999863378698,
"loss": 0.511,
"step": 1970
},
{
"epoch": 0.00027756150720944985,
"grad_norm": 0.98046875,
"learning_rate": 0.00029999998605443067,
"loss": 0.5218,
"step": 1980
},
{
"epoch": 0.000278963333003437,
"grad_norm": 1.1796875,
"learning_rate": 0.0002999999857680815,
"loss": 0.5483,
"step": 1990
},
{
"epoch": 0.00028036515879742413,
"grad_norm": 0.494140625,
"learning_rate": 0.00029999998547882226,
"loss": 0.5184,
"step": 2000
},
{
"epoch": 0.00028036515879742413,
"eval_loss": 0.2110401690006256,
"eval_runtime": 113.7235,
"eval_samples_per_second": 200.864,
"eval_steps_per_second": 1.574,
"step": 2000
},
{
"epoch": 0.00028176698459141125,
"grad_norm": 0.76171875,
"learning_rate": 0.00029999998518665297,
"loss": 0.5142,
"step": 2010
},
{
"epoch": 0.00028316881038539836,
"grad_norm": 0.64453125,
"learning_rate": 0.0002999999848915736,
"loss": 0.6032,
"step": 2020
},
{
"epoch": 0.0002845706361793855,
"grad_norm": 0.65625,
"learning_rate": 0.0002999999845935842,
"loss": 0.5468,
"step": 2030
},
{
"epoch": 0.0002859724619733726,
"grad_norm": 0.380859375,
"learning_rate": 0.00029999998429268475,
"loss": 0.4213,
"step": 2040
},
{
"epoch": 0.0002873742877673597,
"grad_norm": 0.78125,
"learning_rate": 0.00029999998398887526,
"loss": 0.4999,
"step": 2050
},
{
"epoch": 0.0002887761135613468,
"grad_norm": 1.0703125,
"learning_rate": 0.0002999999836821557,
"loss": 0.4975,
"step": 2060
},
{
"epoch": 0.00029017793935533394,
"grad_norm": 0.396484375,
"learning_rate": 0.0002999999833725261,
"loss": 0.4618,
"step": 2070
},
{
"epoch": 0.0002915797651493211,
"grad_norm": 0.7890625,
"learning_rate": 0.00029999998305998645,
"loss": 0.6292,
"step": 2080
},
{
"epoch": 0.0002929815909433082,
"grad_norm": 1.1015625,
"learning_rate": 0.0002999999827445367,
"loss": 0.4893,
"step": 2090
},
{
"epoch": 0.00029438341673729534,
"grad_norm": 0.921875,
"learning_rate": 0.000299999982426177,
"loss": 0.4749,
"step": 2100
},
{
"epoch": 0.00029578524253128245,
"grad_norm": 1.21875,
"learning_rate": 0.0002999999821049071,
"loss": 0.5639,
"step": 2110
},
{
"epoch": 0.00029718706832526957,
"grad_norm": 0.275390625,
"learning_rate": 0.00029999998178072726,
"loss": 0.4799,
"step": 2120
},
{
"epoch": 0.0002985888941192567,
"grad_norm": 1.1875,
"learning_rate": 0.00029999998145363734,
"loss": 0.5267,
"step": 2130
},
{
"epoch": 0.0002999907199132438,
"grad_norm": 0.69140625,
"learning_rate": 0.00029999998112363737,
"loss": 0.5218,
"step": 2140
},
{
"epoch": 0.0003013925457072309,
"grad_norm": 0.98046875,
"learning_rate": 0.00029999998079072735,
"loss": 0.5824,
"step": 2150
},
{
"epoch": 0.00030279437150121803,
"grad_norm": 0.3359375,
"learning_rate": 0.00029999998045490727,
"loss": 0.5229,
"step": 2160
},
{
"epoch": 0.00030419619729520514,
"grad_norm": 0.490234375,
"learning_rate": 0.00029999998011617714,
"loss": 0.42,
"step": 2170
},
{
"epoch": 0.0003055980230891923,
"grad_norm": 0.8671875,
"learning_rate": 0.00029999997977453696,
"loss": 0.5678,
"step": 2180
},
{
"epoch": 0.0003069998488831794,
"grad_norm": 0.8359375,
"learning_rate": 0.0002999999794299867,
"loss": 0.5489,
"step": 2190
},
{
"epoch": 0.00030840167467716654,
"grad_norm": 0.40625,
"learning_rate": 0.00029999997908252644,
"loss": 0.4916,
"step": 2200
},
{
"epoch": 0.00030980350047115366,
"grad_norm": 0.8828125,
"learning_rate": 0.0002999999787321561,
"loss": 0.4691,
"step": 2210
},
{
"epoch": 0.00031120532626514077,
"grad_norm": 0.71484375,
"learning_rate": 0.0002999999783788757,
"loss": 0.4792,
"step": 2220
},
{
"epoch": 0.0003126071520591279,
"grad_norm": 0.66796875,
"learning_rate": 0.00029999997802268526,
"loss": 0.4996,
"step": 2230
},
{
"epoch": 0.000314008977853115,
"grad_norm": 1.0625,
"learning_rate": 0.0002999999776635848,
"loss": 0.4695,
"step": 2240
},
{
"epoch": 0.0003154108036471021,
"grad_norm": 0.31640625,
"learning_rate": 0.00029999997730157426,
"loss": 0.4476,
"step": 2250
},
{
"epoch": 0.00031681262944108923,
"grad_norm": 0.80859375,
"learning_rate": 0.0002999999769366536,
"loss": 0.5829,
"step": 2260
},
{
"epoch": 0.00031821445523507635,
"grad_norm": 0.98046875,
"learning_rate": 0.000299999976568823,
"loss": 0.521,
"step": 2270
},
{
"epoch": 0.0003196162810290635,
"grad_norm": 0.6640625,
"learning_rate": 0.0002999999761980823,
"loss": 0.5269,
"step": 2280
},
{
"epoch": 0.00032101810682305063,
"grad_norm": 0.80859375,
"learning_rate": 0.00029999997582443147,
"loss": 0.5492,
"step": 2290
},
{
"epoch": 0.00032241993261703775,
"grad_norm": 0.466796875,
"learning_rate": 0.00029999997544787066,
"loss": 0.5568,
"step": 2300
},
{
"epoch": 0.00032382175841102486,
"grad_norm": 0.2734375,
"learning_rate": 0.00029999997506839984,
"loss": 0.5229,
"step": 2310
},
{
"epoch": 0.000325223584205012,
"grad_norm": 1.0390625,
"learning_rate": 0.0002999999746860189,
"loss": 0.4528,
"step": 2320
},
{
"epoch": 0.0003266254099989991,
"grad_norm": 0.84765625,
"learning_rate": 0.00029999997430072794,
"loss": 0.5159,
"step": 2330
},
{
"epoch": 0.0003280272357929862,
"grad_norm": 0.640625,
"learning_rate": 0.0002999999739125269,
"loss": 0.4858,
"step": 2340
},
{
"epoch": 0.0003294290615869733,
"grad_norm": 1.109375,
"learning_rate": 0.00029999997352141584,
"loss": 0.5768,
"step": 2350
},
{
"epoch": 0.00033083088738096044,
"grad_norm": 0.859375,
"learning_rate": 0.0002999999731273947,
"loss": 0.5316,
"step": 2360
},
{
"epoch": 0.0003322327131749476,
"grad_norm": 0.5625,
"learning_rate": 0.0002999999727304635,
"loss": 0.4754,
"step": 2370
},
{
"epoch": 0.0003336345389689347,
"grad_norm": 0.86328125,
"learning_rate": 0.00029999997233062233,
"loss": 0.5883,
"step": 2380
},
{
"epoch": 0.00033503636476292183,
"grad_norm": 0.341796875,
"learning_rate": 0.00029999997192787104,
"loss": 0.5788,
"step": 2390
},
{
"epoch": 0.00033643819055690895,
"grad_norm": 0.376953125,
"learning_rate": 0.0002999999715222097,
"loss": 0.4608,
"step": 2400
},
{
"epoch": 0.00033784001635089606,
"grad_norm": 0.427734375,
"learning_rate": 0.00029999997111363836,
"loss": 0.4271,
"step": 2410
},
{
"epoch": 0.0003392418421448832,
"grad_norm": 0.984375,
"learning_rate": 0.0002999999707021569,
"loss": 0.5311,
"step": 2420
},
{
"epoch": 0.0003406436679388703,
"grad_norm": 0.71484375,
"learning_rate": 0.00029999997028776535,
"loss": 0.528,
"step": 2430
},
{
"epoch": 0.0003420454937328574,
"grad_norm": 0.7890625,
"learning_rate": 0.00029999996987046385,
"loss": 0.5641,
"step": 2440
},
{
"epoch": 0.0003434473195268445,
"grad_norm": 1.0078125,
"learning_rate": 0.00029999996945025224,
"loss": 0.597,
"step": 2450
},
{
"epoch": 0.00034484914532083164,
"grad_norm": 1.1015625,
"learning_rate": 0.00029999996902713063,
"loss": 0.4643,
"step": 2460
},
{
"epoch": 0.0003462509711148188,
"grad_norm": 0.60546875,
"learning_rate": 0.0002999999686010989,
"loss": 0.3736,
"step": 2470
},
{
"epoch": 0.0003476527969088059,
"grad_norm": 0.439453125,
"learning_rate": 0.00029999996817215715,
"loss": 0.5049,
"step": 2480
},
{
"epoch": 0.00034905462270279304,
"grad_norm": 0.74609375,
"learning_rate": 0.00029999996774030533,
"loss": 0.3526,
"step": 2490
},
{
"epoch": 0.00035045644849678015,
"grad_norm": 0.91796875,
"learning_rate": 0.0002999999673055435,
"loss": 0.5538,
"step": 2500
},
{
"epoch": 0.00035045644849678015,
"eval_loss": 0.20391806960105896,
"eval_runtime": 112.0697,
"eval_samples_per_second": 203.829,
"eval_steps_per_second": 1.597,
"step": 2500
},
{
"epoch": 0.00035185827429076727,
"grad_norm": 0.353515625,
"learning_rate": 0.0002999999668678716,
"loss": 0.4682,
"step": 2510
},
{
"epoch": 0.0003532601000847544,
"grad_norm": 0.421875,
"learning_rate": 0.0002999999664272896,
"loss": 0.5603,
"step": 2520
},
{
"epoch": 0.0003546619258787415,
"grad_norm": 0.52734375,
"learning_rate": 0.0002999999659837976,
"loss": 0.4438,
"step": 2530
},
{
"epoch": 0.0003560637516727286,
"grad_norm": 0.328125,
"learning_rate": 0.00029999996553739555,
"loss": 0.4908,
"step": 2540
},
{
"epoch": 0.00035746557746671573,
"grad_norm": 1.046875,
"learning_rate": 0.0002999999650880834,
"loss": 0.4753,
"step": 2550
},
{
"epoch": 0.00035886740326070284,
"grad_norm": 0.99609375,
"learning_rate": 0.0002999999646358613,
"loss": 0.4611,
"step": 2560
},
{
"epoch": 0.00036026922905469,
"grad_norm": 0.609375,
"learning_rate": 0.00029999996418072903,
"loss": 0.3998,
"step": 2570
},
{
"epoch": 0.00036167105484867713,
"grad_norm": 0.359375,
"learning_rate": 0.00029999996372268673,
"loss": 0.4206,
"step": 2580
},
{
"epoch": 0.00036307288064266424,
"grad_norm": 1.1484375,
"learning_rate": 0.00029999996326173444,
"loss": 0.5298,
"step": 2590
},
{
"epoch": 0.00036447470643665136,
"grad_norm": 0.255859375,
"learning_rate": 0.00029999996279787204,
"loss": 0.4437,
"step": 2600
},
{
"epoch": 0.00036587653223063847,
"grad_norm": 0.40625,
"learning_rate": 0.00029999996233109964,
"loss": 0.4519,
"step": 2610
},
{
"epoch": 0.0003672783580246256,
"grad_norm": 0.427734375,
"learning_rate": 0.00029999996186141713,
"loss": 0.3585,
"step": 2620
},
{
"epoch": 0.0003686801838186127,
"grad_norm": 0.486328125,
"learning_rate": 0.00029999996138882463,
"loss": 0.4805,
"step": 2630
},
{
"epoch": 0.0003700820096125998,
"grad_norm": 0.94140625,
"learning_rate": 0.000299999960913322,
"loss": 0.549,
"step": 2640
},
{
"epoch": 0.00037148383540658693,
"grad_norm": 1.1796875,
"learning_rate": 0.0002999999604349094,
"loss": 0.4753,
"step": 2650
},
{
"epoch": 0.0003728856612005741,
"grad_norm": 0.4609375,
"learning_rate": 0.00029999995995358674,
"loss": 0.5911,
"step": 2660
},
{
"epoch": 0.0003742874869945612,
"grad_norm": 0.83203125,
"learning_rate": 0.00029999995946935397,
"loss": 0.5762,
"step": 2670
},
{
"epoch": 0.00037568931278854833,
"grad_norm": 0.404296875,
"learning_rate": 0.0002999999589822112,
"loss": 0.5504,
"step": 2680
},
{
"epoch": 0.00037709113858253545,
"grad_norm": 0.67578125,
"learning_rate": 0.0002999999584921583,
"loss": 0.435,
"step": 2690
},
{
"epoch": 0.00037849296437652256,
"grad_norm": 1.3984375,
"learning_rate": 0.00029999995799919545,
"loss": 0.4766,
"step": 2700
},
{
"epoch": 0.0003798947901705097,
"grad_norm": 0.69921875,
"learning_rate": 0.00029999995750332246,
"loss": 0.5923,
"step": 2710
},
{
"epoch": 0.0003812966159644968,
"grad_norm": 0.48828125,
"learning_rate": 0.0002999999570045395,
"loss": 0.5589,
"step": 2720
},
{
"epoch": 0.0003826984417584839,
"grad_norm": 0.365234375,
"learning_rate": 0.00029999995650284645,
"loss": 0.5023,
"step": 2730
},
{
"epoch": 0.000384100267552471,
"grad_norm": 0.69140625,
"learning_rate": 0.0002999999559982433,
"loss": 0.5224,
"step": 2740
},
{
"epoch": 0.00038550209334645814,
"grad_norm": 0.54296875,
"learning_rate": 0.00029999995549073017,
"loss": 0.4,
"step": 2750
},
{
"epoch": 0.0003869039191404453,
"grad_norm": 0.396484375,
"learning_rate": 0.0002999999549803069,
"loss": 0.4416,
"step": 2760
},
{
"epoch": 0.0003883057449344324,
"grad_norm": 0.68359375,
"learning_rate": 0.0002999999544669737,
"loss": 0.4588,
"step": 2770
},
{
"epoch": 0.00038970757072841954,
"grad_norm": 0.6015625,
"learning_rate": 0.0002999999539507304,
"loss": 0.5128,
"step": 2780
},
{
"epoch": 0.00039110939652240665,
"grad_norm": 0.640625,
"learning_rate": 0.00029999995343157703,
"loss": 0.4519,
"step": 2790
},
{
"epoch": 0.00039251122231639377,
"grad_norm": 0.75,
"learning_rate": 0.00029999995290951357,
"loss": 0.553,
"step": 2800
},
{
"epoch": 0.0003939130481103809,
"grad_norm": 0.58203125,
"learning_rate": 0.0002999999523845401,
"loss": 0.4382,
"step": 2810
},
{
"epoch": 0.000395314873904368,
"grad_norm": 0.8984375,
"learning_rate": 0.0002999999518566566,
"loss": 0.6044,
"step": 2820
},
{
"epoch": 0.0003967166996983551,
"grad_norm": 0.65625,
"learning_rate": 0.00029999995132586304,
"loss": 0.5411,
"step": 2830
},
{
"epoch": 0.0003981185254923422,
"grad_norm": 0.5859375,
"learning_rate": 0.0002999999507921594,
"loss": 0.48,
"step": 2840
},
{
"epoch": 0.00039952035128632934,
"grad_norm": 0.96484375,
"learning_rate": 0.00029999995025554576,
"loss": 0.5314,
"step": 2850
},
{
"epoch": 0.0004009221770803165,
"grad_norm": 1.0859375,
"learning_rate": 0.000299999949716022,
"loss": 0.5695,
"step": 2860
},
{
"epoch": 0.0004023240028743036,
"grad_norm": 1.0078125,
"learning_rate": 0.0002999999491735882,
"loss": 0.4795,
"step": 2870
},
{
"epoch": 0.00040372582866829074,
"grad_norm": 0.46484375,
"learning_rate": 0.0002999999486282444,
"loss": 0.3841,
"step": 2880
},
{
"epoch": 0.00040512765446227785,
"grad_norm": 0.67578125,
"learning_rate": 0.0002999999480799905,
"loss": 0.4925,
"step": 2890
},
{
"epoch": 0.00040652948025626497,
"grad_norm": 0.68359375,
"learning_rate": 0.00029999994752882657,
"loss": 0.4798,
"step": 2900
},
{
"epoch": 0.0004079313060502521,
"grad_norm": 0.9453125,
"learning_rate": 0.0002999999469747526,
"loss": 0.5165,
"step": 2910
},
{
"epoch": 0.0004093331318442392,
"grad_norm": 0.70703125,
"learning_rate": 0.00029999994641776855,
"loss": 0.5801,
"step": 2920
},
{
"epoch": 0.0004107349576382263,
"grad_norm": 0.3359375,
"learning_rate": 0.00029999994585787446,
"loss": 0.5142,
"step": 2930
},
{
"epoch": 0.00041213678343221343,
"grad_norm": 1.0234375,
"learning_rate": 0.0002999999452950703,
"loss": 0.4823,
"step": 2940
},
{
"epoch": 0.0004135386092262006,
"grad_norm": 0.294921875,
"learning_rate": 0.0002999999447293561,
"loss": 0.4351,
"step": 2950
},
{
"epoch": 0.0004149404350201877,
"grad_norm": 0.396484375,
"learning_rate": 0.0002999999441607319,
"loss": 0.5292,
"step": 2960
},
{
"epoch": 0.00041634226081417483,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999999435891976,
"loss": 0.458,
"step": 2970
},
{
"epoch": 0.00041774408660816194,
"grad_norm": 0.294921875,
"learning_rate": 0.00029999994301475327,
"loss": 0.4933,
"step": 2980
},
{
"epoch": 0.00041914591240214906,
"grad_norm": 1.140625,
"learning_rate": 0.0002999999424373988,
"loss": 0.4954,
"step": 2990
},
{
"epoch": 0.0004205477381961362,
"grad_norm": 1.5234375,
"learning_rate": 0.0002999999418571344,
"loss": 0.4878,
"step": 3000
},
{
"epoch": 0.0004205477381961362,
"eval_loss": 0.20102550089359283,
"eval_runtime": 112.0673,
"eval_samples_per_second": 203.833,
"eval_steps_per_second": 1.597,
"step": 3000
},
{
"epoch": 0.0004219495639901233,
"grad_norm": 0.62890625,
"learning_rate": 0.0002999999412739599,
"loss": 0.5205,
"step": 3010
},
{
"epoch": 0.0004233513897841104,
"grad_norm": 0.40625,
"learning_rate": 0.0002999999406878753,
"loss": 0.4147,
"step": 3020
},
{
"epoch": 0.0004247532155780975,
"grad_norm": 0.4921875,
"learning_rate": 0.0002999999400988807,
"loss": 0.424,
"step": 3030
},
{
"epoch": 0.00042615504137208463,
"grad_norm": 0.93359375,
"learning_rate": 0.000299999939506976,
"loss": 0.4885,
"step": 3040
},
{
"epoch": 0.0004275568671660718,
"grad_norm": 1.2265625,
"learning_rate": 0.00029999993891216136,
"loss": 0.517,
"step": 3050
},
{
"epoch": 0.0004289586929600589,
"grad_norm": 0.6796875,
"learning_rate": 0.0002999999383144366,
"loss": 0.5413,
"step": 3060
},
{
"epoch": 0.00043036051875404603,
"grad_norm": 0.5390625,
"learning_rate": 0.00029999993771380175,
"loss": 0.4722,
"step": 3070
},
{
"epoch": 0.00043176234454803315,
"grad_norm": 0.58203125,
"learning_rate": 0.0002999999371102569,
"loss": 0.5205,
"step": 3080
},
{
"epoch": 0.00043316417034202026,
"grad_norm": 0.314453125,
"learning_rate": 0.000299999936503802,
"loss": 0.407,
"step": 3090
},
{
"epoch": 0.0004345659961360074,
"grad_norm": 1.2109375,
"learning_rate": 0.00029999993589443705,
"loss": 0.495,
"step": 3100
},
{
"epoch": 0.0004359678219299945,
"grad_norm": 0.81640625,
"learning_rate": 0.000299999935282162,
"loss": 0.4925,
"step": 3110
},
{
"epoch": 0.0004373696477239816,
"grad_norm": 0.9921875,
"learning_rate": 0.0002999999346669769,
"loss": 0.42,
"step": 3120
},
{
"epoch": 0.0004387714735179687,
"grad_norm": 0.3984375,
"learning_rate": 0.0002999999340488818,
"loss": 0.3723,
"step": 3130
},
{
"epoch": 0.00044017329931195584,
"grad_norm": 0.88671875,
"learning_rate": 0.0002999999334278766,
"loss": 0.5267,
"step": 3140
},
{
"epoch": 0.000441575125105943,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999999328039614,
"loss": 0.4224,
"step": 3150
},
{
"epoch": 0.0004429769508999301,
"grad_norm": 1.3203125,
"learning_rate": 0.0002999999321771361,
"loss": 0.5182,
"step": 3160
},
{
"epoch": 0.00044437877669391724,
"grad_norm": 0.8359375,
"learning_rate": 0.0002999999315474008,
"loss": 0.5608,
"step": 3170
},
{
"epoch": 0.00044578060248790435,
"grad_norm": 0.482421875,
"learning_rate": 0.00029999993091475545,
"loss": 0.3993,
"step": 3180
},
{
"epoch": 0.00044718242828189147,
"grad_norm": 0.97265625,
"learning_rate": 0.0002999999302792,
"loss": 0.4892,
"step": 3190
},
{
"epoch": 0.0004485842540758786,
"grad_norm": 0.92578125,
"learning_rate": 0.00029999992964073447,
"loss": 0.5218,
"step": 3200
},
{
"epoch": 0.0004499860798698657,
"grad_norm": 0.69921875,
"learning_rate": 0.00029999992899935895,
"loss": 0.3582,
"step": 3210
},
{
"epoch": 0.0004513879056638528,
"grad_norm": 0.53515625,
"learning_rate": 0.0002999999283550734,
"loss": 0.5051,
"step": 3220
},
{
"epoch": 0.0004527897314578399,
"grad_norm": 0.90625,
"learning_rate": 0.00029999992770787776,
"loss": 0.4788,
"step": 3230
},
{
"epoch": 0.0004541915572518271,
"grad_norm": 0.58203125,
"learning_rate": 0.00029999992705777203,
"loss": 0.43,
"step": 3240
},
{
"epoch": 0.0004555933830458142,
"grad_norm": 0.9921875,
"learning_rate": 0.00029999992640475636,
"loss": 0.5673,
"step": 3250
},
{
"epoch": 0.0004569952088398013,
"grad_norm": 0.6171875,
"learning_rate": 0.0002999999257488305,
"loss": 0.4597,
"step": 3260
},
{
"epoch": 0.00045839703463378844,
"grad_norm": 0.94921875,
"learning_rate": 0.0002999999250899947,
"loss": 0.5661,
"step": 3270
},
{
"epoch": 0.00045979886042777556,
"grad_norm": 0.427734375,
"learning_rate": 0.0002999999244282488,
"loss": 0.5277,
"step": 3280
},
{
"epoch": 0.00046120068622176267,
"grad_norm": 0.71875,
"learning_rate": 0.00029999992376359287,
"loss": 0.4895,
"step": 3290
},
{
"epoch": 0.0004626025120157498,
"grad_norm": 0.96875,
"learning_rate": 0.0002999999230960269,
"loss": 0.4452,
"step": 3300
},
{
"epoch": 0.0004640043378097369,
"grad_norm": 0.55078125,
"learning_rate": 0.00029999992242555083,
"loss": 0.4958,
"step": 3310
},
{
"epoch": 0.000465406163603724,
"grad_norm": 0.8671875,
"learning_rate": 0.0002999999217521647,
"loss": 0.4742,
"step": 3320
},
{
"epoch": 0.00046680798939771113,
"grad_norm": 0.62890625,
"learning_rate": 0.00029999992107586853,
"loss": 0.4959,
"step": 3330
},
{
"epoch": 0.0004682098151916983,
"grad_norm": 0.640625,
"learning_rate": 0.0002999999203966623,
"loss": 0.5154,
"step": 3340
},
{
"epoch": 0.0004696116409856854,
"grad_norm": 0.486328125,
"learning_rate": 0.00029999991971454607,
"loss": 0.5168,
"step": 3350
},
{
"epoch": 0.00047101346677967253,
"grad_norm": 0.455078125,
"learning_rate": 0.00029999991902951976,
"loss": 0.5385,
"step": 3360
},
{
"epoch": 0.00047241529257365964,
"grad_norm": 0.47265625,
"learning_rate": 0.00029999991834158345,
"loss": 0.5004,
"step": 3370
},
{
"epoch": 0.00047381711836764676,
"grad_norm": 0.2421875,
"learning_rate": 0.00029999991765073704,
"loss": 0.4502,
"step": 3380
},
{
"epoch": 0.0004752189441616339,
"grad_norm": 0.4765625,
"learning_rate": 0.00029999991695698057,
"loss": 0.4549,
"step": 3390
},
{
"epoch": 0.000476620769955621,
"grad_norm": 0.4453125,
"learning_rate": 0.00029999991626031405,
"loss": 0.4557,
"step": 3400
},
{
"epoch": 0.0004780225957496081,
"grad_norm": 0.302734375,
"learning_rate": 0.00029999991556073753,
"loss": 0.4765,
"step": 3410
},
{
"epoch": 0.0004794244215435952,
"grad_norm": 0.66796875,
"learning_rate": 0.0002999999148582509,
"loss": 0.4911,
"step": 3420
},
{
"epoch": 0.00048082624733758233,
"grad_norm": 0.796875,
"learning_rate": 0.00029999991415285423,
"loss": 0.5774,
"step": 3430
},
{
"epoch": 0.0004822280731315695,
"grad_norm": 1.0234375,
"learning_rate": 0.0002999999134445475,
"loss": 0.4328,
"step": 3440
},
{
"epoch": 0.0004836298989255566,
"grad_norm": 0.37109375,
"learning_rate": 0.00029999991273333077,
"loss": 0.4692,
"step": 3450
},
{
"epoch": 0.00048503172471954373,
"grad_norm": 0.8515625,
"learning_rate": 0.00029999991201920393,
"loss": 0.4571,
"step": 3460
},
{
"epoch": 0.00048643355051353085,
"grad_norm": 0.62890625,
"learning_rate": 0.00029999991130216704,
"loss": 0.5374,
"step": 3470
},
{
"epoch": 0.00048783537630751796,
"grad_norm": 0.98046875,
"learning_rate": 0.00029999991058222015,
"loss": 0.5196,
"step": 3480
},
{
"epoch": 0.0004892372021015051,
"grad_norm": 0.44921875,
"learning_rate": 0.0002999999098593632,
"loss": 0.4814,
"step": 3490
},
{
"epoch": 0.0004906390278954922,
"grad_norm": 1.21875,
"learning_rate": 0.00029999990913359616,
"loss": 0.5114,
"step": 3500
},
{
"epoch": 0.0004906390278954922,
"eval_loss": 0.19615845382213593,
"eval_runtime": 113.7184,
"eval_samples_per_second": 200.873,
"eval_steps_per_second": 1.574,
"step": 3500
},
{
"epoch": 0.0004920408536894794,
"grad_norm": 0.6875,
"learning_rate": 0.00029999990840491906,
"loss": 0.5248,
"step": 3510
},
{
"epoch": 0.0004934426794834664,
"grad_norm": 0.97265625,
"learning_rate": 0.00029999990767333196,
"loss": 0.4625,
"step": 3520
},
{
"epoch": 0.0004948445052774536,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999999069388348,
"loss": 0.4906,
"step": 3530
},
{
"epoch": 0.0004962463310714407,
"grad_norm": 0.703125,
"learning_rate": 0.00029999990620142755,
"loss": 0.3924,
"step": 3540
},
{
"epoch": 0.0004976481568654278,
"grad_norm": 0.97265625,
"learning_rate": 0.0002999999054611103,
"loss": 0.5016,
"step": 3550
},
{
"epoch": 0.0004990499826594149,
"grad_norm": 0.87890625,
"learning_rate": 0.000299999904717883,
"loss": 0.4974,
"step": 3560
},
{
"epoch": 0.000500451808453402,
"grad_norm": 0.84375,
"learning_rate": 0.0002999999039717456,
"loss": 0.5082,
"step": 3570
},
{
"epoch": 0.0005018536342473892,
"grad_norm": 0.279296875,
"learning_rate": 0.00029999990322269814,
"loss": 0.5716,
"step": 3580
},
{
"epoch": 0.0005032554600413763,
"grad_norm": 0.734375,
"learning_rate": 0.00029999990247074073,
"loss": 0.548,
"step": 3590
},
{
"epoch": 0.0005046572858353635,
"grad_norm": 0.58203125,
"learning_rate": 0.00029999990171587315,
"loss": 0.4553,
"step": 3600
},
{
"epoch": 0.0005060591116293505,
"grad_norm": 0.7734375,
"learning_rate": 0.0002999999009580956,
"loss": 0.5029,
"step": 3610
},
{
"epoch": 0.0005074609374233377,
"grad_norm": 0.46484375,
"learning_rate": 0.0002999999001974079,
"loss": 0.4318,
"step": 3620
},
{
"epoch": 0.0005088627632173247,
"grad_norm": 0.61328125,
"learning_rate": 0.00029999989943381027,
"loss": 0.5442,
"step": 3630
},
{
"epoch": 0.0005102645890113119,
"grad_norm": 0.72265625,
"learning_rate": 0.00029999989866730253,
"loss": 0.4907,
"step": 3640
},
{
"epoch": 0.000511666414805299,
"grad_norm": 0.30078125,
"learning_rate": 0.00029999989789788475,
"loss": 0.4758,
"step": 3650
},
{
"epoch": 0.0005130682405992861,
"grad_norm": 0.96484375,
"learning_rate": 0.0002999998971255569,
"loss": 0.4656,
"step": 3660
},
{
"epoch": 0.0005144700663932732,
"grad_norm": 0.431640625,
"learning_rate": 0.000299999896350319,
"loss": 0.5217,
"step": 3670
},
{
"epoch": 0.0005158718921872604,
"grad_norm": 0.44921875,
"learning_rate": 0.00029999989557217107,
"loss": 0.5127,
"step": 3680
},
{
"epoch": 0.0005172737179812475,
"grad_norm": 0.796875,
"learning_rate": 0.0002999998947911131,
"loss": 0.5713,
"step": 3690
},
{
"epoch": 0.0005186755437752346,
"grad_norm": 0.66796875,
"learning_rate": 0.00029999989400714507,
"loss": 0.4652,
"step": 3700
},
{
"epoch": 0.0005200773695692218,
"grad_norm": 0.66796875,
"learning_rate": 0.00029999989322026697,
"loss": 0.5029,
"step": 3710
},
{
"epoch": 0.0005214791953632088,
"grad_norm": 0.21484375,
"learning_rate": 0.0002999998924304788,
"loss": 0.4575,
"step": 3720
},
{
"epoch": 0.000522881021157196,
"grad_norm": 0.84375,
"learning_rate": 0.00029999989163778066,
"loss": 0.4947,
"step": 3730
},
{
"epoch": 0.0005242828469511831,
"grad_norm": 0.6640625,
"learning_rate": 0.0002999998908421724,
"loss": 0.4046,
"step": 3740
},
{
"epoch": 0.0005256846727451702,
"grad_norm": 0.9609375,
"learning_rate": 0.0002999998900436541,
"loss": 0.5298,
"step": 3750
},
{
"epoch": 0.0005270864985391573,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999988924222577,
"loss": 0.4179,
"step": 3760
},
{
"epoch": 0.0005284883243331445,
"grad_norm": 0.291015625,
"learning_rate": 0.00029999988843788734,
"loss": 0.5142,
"step": 3770
},
{
"epoch": 0.0005298901501271316,
"grad_norm": 0.90625,
"learning_rate": 0.0002999998876306389,
"loss": 0.4722,
"step": 3780
},
{
"epoch": 0.0005312919759211187,
"grad_norm": 0.92578125,
"learning_rate": 0.0002999998868204804,
"loss": 0.5202,
"step": 3790
},
{
"epoch": 0.0005326938017151059,
"grad_norm": 1.1328125,
"learning_rate": 0.00029999988600741187,
"loss": 0.5537,
"step": 3800
},
{
"epoch": 0.0005340956275090929,
"grad_norm": 0.33984375,
"learning_rate": 0.0002999998851914333,
"loss": 0.5072,
"step": 3810
},
{
"epoch": 0.0005354974533030801,
"grad_norm": 1.140625,
"learning_rate": 0.0002999998843725446,
"loss": 0.4999,
"step": 3820
},
{
"epoch": 0.0005368992790970672,
"grad_norm": 0.7265625,
"learning_rate": 0.0002999998835507459,
"loss": 0.4916,
"step": 3830
},
{
"epoch": 0.0005383011048910543,
"grad_norm": 0.82421875,
"learning_rate": 0.0002999998827260372,
"loss": 0.6081,
"step": 3840
},
{
"epoch": 0.0005397029306850414,
"grad_norm": 0.671875,
"learning_rate": 0.0002999998818984184,
"loss": 0.5145,
"step": 3850
},
{
"epoch": 0.0005411047564790285,
"grad_norm": 1.4765625,
"learning_rate": 0.00029999988106788956,
"loss": 0.4729,
"step": 3860
},
{
"epoch": 0.0005425065822730157,
"grad_norm": 0.81640625,
"learning_rate": 0.0002999998802344506,
"loss": 0.5762,
"step": 3870
},
{
"epoch": 0.0005439084080670028,
"grad_norm": 0.90234375,
"learning_rate": 0.0002999998793981017,
"loss": 0.5645,
"step": 3880
},
{
"epoch": 0.00054531023386099,
"grad_norm": 0.3203125,
"learning_rate": 0.0002999998785588427,
"loss": 0.5388,
"step": 3890
},
{
"epoch": 0.000546712059654977,
"grad_norm": 0.80859375,
"learning_rate": 0.00029999987771667366,
"loss": 0.4449,
"step": 3900
},
{
"epoch": 0.0005481138854489642,
"grad_norm": 0.65625,
"learning_rate": 0.00029999987687159455,
"loss": 0.5345,
"step": 3910
},
{
"epoch": 0.0005495157112429512,
"grad_norm": 0.53125,
"learning_rate": 0.00029999987602360545,
"loss": 0.319,
"step": 3920
},
{
"epoch": 0.0005509175370369384,
"grad_norm": 0.427734375,
"learning_rate": 0.0002999998751727062,
"loss": 0.3845,
"step": 3930
},
{
"epoch": 0.0005523193628309255,
"grad_norm": 0.87890625,
"learning_rate": 0.00029999987431889697,
"loss": 0.4358,
"step": 3940
},
{
"epoch": 0.0005537211886249126,
"grad_norm": 0.76171875,
"learning_rate": 0.00029999987346217765,
"loss": 0.424,
"step": 3950
},
{
"epoch": 0.0005551230144188997,
"grad_norm": 0.59765625,
"learning_rate": 0.00029999987260254834,
"loss": 0.5856,
"step": 3960
},
{
"epoch": 0.0005565248402128869,
"grad_norm": 0.69140625,
"learning_rate": 0.00029999987174000886,
"loss": 0.4395,
"step": 3970
},
{
"epoch": 0.000557926666006874,
"grad_norm": 0.74609375,
"learning_rate": 0.00029999987087455944,
"loss": 0.4667,
"step": 3980
},
{
"epoch": 0.0005593284918008611,
"grad_norm": 0.62109375,
"learning_rate": 0.0002999998700061999,
"loss": 0.5008,
"step": 3990
},
{
"epoch": 0.0005607303175948483,
"grad_norm": 0.69140625,
"learning_rate": 0.0002999998691349304,
"loss": 0.5067,
"step": 4000
},
{
"epoch": 0.0005607303175948483,
"eval_loss": 0.1947367787361145,
"eval_runtime": 112.0665,
"eval_samples_per_second": 203.834,
"eval_steps_per_second": 1.597,
"step": 4000
},
{
"epoch": 0.0005621321433888353,
"grad_norm": 0.8984375,
"learning_rate": 0.0002999998682607508,
"loss": 0.4297,
"step": 4010
},
{
"epoch": 0.0005635339691828225,
"grad_norm": 0.22265625,
"learning_rate": 0.0002999998673836611,
"loss": 0.3309,
"step": 4020
},
{
"epoch": 0.0005649357949768096,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999998665036614,
"loss": 0.3924,
"step": 4030
},
{
"epoch": 0.0005663376207707967,
"grad_norm": 0.75390625,
"learning_rate": 0.00029999986562075163,
"loss": 0.4433,
"step": 4040
},
{
"epoch": 0.0005677394465647838,
"grad_norm": 0.458984375,
"learning_rate": 0.00029999986473493184,
"loss": 0.4218,
"step": 4050
},
{
"epoch": 0.000569141272358771,
"grad_norm": 0.39453125,
"learning_rate": 0.000299999863846202,
"loss": 0.5819,
"step": 4060
},
{
"epoch": 0.0005705430981527581,
"grad_norm": 0.71484375,
"learning_rate": 0.0002999998629545621,
"loss": 0.5292,
"step": 4070
},
{
"epoch": 0.0005719449239467452,
"grad_norm": 0.55078125,
"learning_rate": 0.00029999986206001215,
"loss": 0.4745,
"step": 4080
},
{
"epoch": 0.0005733467497407324,
"grad_norm": 0.5234375,
"learning_rate": 0.00029999986116255214,
"loss": 0.5194,
"step": 4090
},
{
"epoch": 0.0005747485755347194,
"grad_norm": 0.5546875,
"learning_rate": 0.0002999998602621821,
"loss": 0.5094,
"step": 4100
},
{
"epoch": 0.0005761504013287066,
"grad_norm": 0.416015625,
"learning_rate": 0.00029999985935890203,
"loss": 0.4252,
"step": 4110
},
{
"epoch": 0.0005775522271226936,
"grad_norm": 0.53125,
"learning_rate": 0.0002999998584527118,
"loss": 0.439,
"step": 4120
},
{
"epoch": 0.0005789540529166808,
"grad_norm": 0.6953125,
"learning_rate": 0.0002999998575436116,
"loss": 0.5719,
"step": 4130
},
{
"epoch": 0.0005803558787106679,
"grad_norm": 0.6640625,
"learning_rate": 0.00029999985663160133,
"loss": 0.4448,
"step": 4140
},
{
"epoch": 0.000581757704504655,
"grad_norm": 0.484375,
"learning_rate": 0.00029999985571668107,
"loss": 0.4758,
"step": 4150
},
{
"epoch": 0.0005831595302986422,
"grad_norm": 0.91796875,
"learning_rate": 0.0002999998547988507,
"loss": 0.4819,
"step": 4160
},
{
"epoch": 0.0005845613560926293,
"grad_norm": 0.45703125,
"learning_rate": 0.0002999998538781103,
"loss": 0.4092,
"step": 4170
},
{
"epoch": 0.0005859631818866164,
"grad_norm": 0.29296875,
"learning_rate": 0.00029999985295445984,
"loss": 0.4887,
"step": 4180
},
{
"epoch": 0.0005873650076806035,
"grad_norm": 0.890625,
"learning_rate": 0.0002999998520278993,
"loss": 0.5011,
"step": 4190
},
{
"epoch": 0.0005887668334745907,
"grad_norm": 1.140625,
"learning_rate": 0.0002999998510984288,
"loss": 0.4195,
"step": 4200
},
{
"epoch": 0.0005901686592685777,
"grad_norm": 0.8984375,
"learning_rate": 0.0002999998501660482,
"loss": 0.4402,
"step": 4210
},
{
"epoch": 0.0005915704850625649,
"grad_norm": 0.75390625,
"learning_rate": 0.0002999998492307575,
"loss": 0.4796,
"step": 4220
},
{
"epoch": 0.000592972310856552,
"grad_norm": 0.578125,
"learning_rate": 0.0002999998482925568,
"loss": 0.4227,
"step": 4230
},
{
"epoch": 0.0005943741366505391,
"grad_norm": 0.87109375,
"learning_rate": 0.000299999847351446,
"loss": 0.4143,
"step": 4240
},
{
"epoch": 0.0005957759624445262,
"grad_norm": 0.46875,
"learning_rate": 0.0002999998464074252,
"loss": 0.4414,
"step": 4250
},
{
"epoch": 0.0005971777882385134,
"grad_norm": 0.361328125,
"learning_rate": 0.0002999998454604944,
"loss": 0.4819,
"step": 4260
},
{
"epoch": 0.0005985796140325005,
"grad_norm": 0.64453125,
"learning_rate": 0.00029999984451065353,
"loss": 0.3205,
"step": 4270
},
{
"epoch": 0.0005999814398264876,
"grad_norm": 0.80859375,
"learning_rate": 0.0002999998435579026,
"loss": 0.443,
"step": 4280
},
{
"epoch": 0.0006013832656204748,
"grad_norm": 0.76953125,
"learning_rate": 0.00029999984260224157,
"loss": 0.4969,
"step": 4290
},
{
"epoch": 0.0006027850914144618,
"grad_norm": 0.703125,
"learning_rate": 0.0002999998416436705,
"loss": 0.5088,
"step": 4300
},
{
"epoch": 0.000604186917208449,
"grad_norm": 0.7890625,
"learning_rate": 0.00029999984068218935,
"loss": 0.544,
"step": 4310
},
{
"epoch": 0.0006055887430024361,
"grad_norm": 0.482421875,
"learning_rate": 0.00029999983971779824,
"loss": 0.4043,
"step": 4320
},
{
"epoch": 0.0006069905687964232,
"grad_norm": 0.94921875,
"learning_rate": 0.000299999838750497,
"loss": 0.4532,
"step": 4330
},
{
"epoch": 0.0006083923945904103,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999998377802858,
"loss": 0.4442,
"step": 4340
},
{
"epoch": 0.0006097942203843975,
"grad_norm": 0.52734375,
"learning_rate": 0.0002999998368071645,
"loss": 0.4439,
"step": 4350
},
{
"epoch": 0.0006111960461783846,
"grad_norm": 1.0390625,
"learning_rate": 0.00029999983583113316,
"loss": 0.429,
"step": 4360
},
{
"epoch": 0.0006125978719723717,
"grad_norm": 0.30078125,
"learning_rate": 0.00029999983485219173,
"loss": 0.4306,
"step": 4370
},
{
"epoch": 0.0006139996977663589,
"grad_norm": 0.2890625,
"learning_rate": 0.0002999998338703403,
"loss": 0.4207,
"step": 4380
},
{
"epoch": 0.0006154015235603459,
"grad_norm": 1.1953125,
"learning_rate": 0.00029999983288557877,
"loss": 0.4525,
"step": 4390
},
{
"epoch": 0.0006168033493543331,
"grad_norm": 0.7265625,
"learning_rate": 0.00029999983189790724,
"loss": 0.3968,
"step": 4400
},
{
"epoch": 0.0006182051751483201,
"grad_norm": 0.3203125,
"learning_rate": 0.00029999983090732565,
"loss": 0.3892,
"step": 4410
},
{
"epoch": 0.0006196070009423073,
"grad_norm": 0.255859375,
"learning_rate": 0.00029999982991383396,
"loss": 0.3471,
"step": 4420
},
{
"epoch": 0.0006210088267362944,
"grad_norm": 0.63671875,
"learning_rate": 0.00029999982891743226,
"loss": 0.5504,
"step": 4430
},
{
"epoch": 0.0006224106525302815,
"grad_norm": 0.330078125,
"learning_rate": 0.0002999998279181205,
"loss": 0.434,
"step": 4440
},
{
"epoch": 0.0006238124783242687,
"grad_norm": 1.09375,
"learning_rate": 0.0002999998269158987,
"loss": 0.5546,
"step": 4450
},
{
"epoch": 0.0006252143041182558,
"grad_norm": 0.78125,
"learning_rate": 0.00029999982591076687,
"loss": 0.4573,
"step": 4460
},
{
"epoch": 0.0006266161299122429,
"grad_norm": 1.0078125,
"learning_rate": 0.00029999982490272497,
"loss": 0.4395,
"step": 4470
},
{
"epoch": 0.00062801795570623,
"grad_norm": 0.48828125,
"learning_rate": 0.000299999823891773,
"loss": 0.4691,
"step": 4480
},
{
"epoch": 0.0006294197815002172,
"grad_norm": 0.38671875,
"learning_rate": 0.00029999982287791106,
"loss": 0.4948,
"step": 4490
},
{
"epoch": 0.0006308216072942042,
"grad_norm": 0.59765625,
"learning_rate": 0.000299999821861139,
"loss": 0.3723,
"step": 4500
},
{
"epoch": 0.0006308216072942042,
"eval_loss": 0.19076591730117798,
"eval_runtime": 112.1557,
"eval_samples_per_second": 203.672,
"eval_steps_per_second": 1.596,
"step": 4500
},
{
"epoch": 0.0006322234330881914,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999998208414569,
"loss": 0.4265,
"step": 4510
},
{
"epoch": 0.0006336252588821785,
"grad_norm": 1.078125,
"learning_rate": 0.00029999981981886477,
"loss": 0.506,
"step": 4520
},
{
"epoch": 0.0006350270846761656,
"grad_norm": 0.59375,
"learning_rate": 0.0002999998187933626,
"loss": 0.4459,
"step": 4530
},
{
"epoch": 0.0006364289104701527,
"grad_norm": 0.84375,
"learning_rate": 0.00029999981776495033,
"loss": 0.506,
"step": 4540
},
{
"epoch": 0.0006378307362641399,
"grad_norm": 0.275390625,
"learning_rate": 0.000299999816733628,
"loss": 0.4536,
"step": 4550
},
{
"epoch": 0.000639232562058127,
"grad_norm": 0.86328125,
"learning_rate": 0.0002999998156993957,
"loss": 0.554,
"step": 4560
},
{
"epoch": 0.0006406343878521141,
"grad_norm": 0.84765625,
"learning_rate": 0.0002999998146622533,
"loss": 0.5602,
"step": 4570
},
{
"epoch": 0.0006420362136461013,
"grad_norm": 0.578125,
"learning_rate": 0.0002999998136222009,
"loss": 0.471,
"step": 4580
},
{
"epoch": 0.0006434380394400883,
"grad_norm": 0.7578125,
"learning_rate": 0.0002999998125792384,
"loss": 0.49,
"step": 4590
},
{
"epoch": 0.0006448398652340755,
"grad_norm": 0.86328125,
"learning_rate": 0.00029999981153336586,
"loss": 0.4289,
"step": 4600
},
{
"epoch": 0.0006462416910280626,
"grad_norm": 0.82421875,
"learning_rate": 0.00029999981048458327,
"loss": 0.4727,
"step": 4610
},
{
"epoch": 0.0006476435168220497,
"grad_norm": 0.40625,
"learning_rate": 0.0002999998094328906,
"loss": 0.4323,
"step": 4620
},
{
"epoch": 0.0006490453426160368,
"grad_norm": 0.921875,
"learning_rate": 0.00029999980837828793,
"loss": 0.4516,
"step": 4630
},
{
"epoch": 0.000650447168410024,
"grad_norm": 0.828125,
"learning_rate": 0.0002999998073207752,
"loss": 0.4945,
"step": 4640
},
{
"epoch": 0.0006518489942040111,
"grad_norm": 0.87109375,
"learning_rate": 0.00029999980626035244,
"loss": 0.4593,
"step": 4650
},
{
"epoch": 0.0006532508199979982,
"grad_norm": 0.6953125,
"learning_rate": 0.0002999998051970196,
"loss": 0.3685,
"step": 4660
},
{
"epoch": 0.0006546526457919854,
"grad_norm": 0.466796875,
"learning_rate": 0.00029999980413077674,
"loss": 0.4393,
"step": 4670
},
{
"epoch": 0.0006560544715859724,
"grad_norm": 0.80859375,
"learning_rate": 0.0002999998030616238,
"loss": 0.4165,
"step": 4680
},
{
"epoch": 0.0006574562973799596,
"grad_norm": 0.52734375,
"learning_rate": 0.0002999998019895608,
"loss": 0.4665,
"step": 4690
},
{
"epoch": 0.0006588581231739466,
"grad_norm": 0.765625,
"learning_rate": 0.0002999998009145878,
"loss": 0.544,
"step": 4700
},
{
"epoch": 0.0006602599489679338,
"grad_norm": 0.7578125,
"learning_rate": 0.0002999997998367047,
"loss": 0.5659,
"step": 4710
},
{
"epoch": 0.0006616617747619209,
"grad_norm": 0.7578125,
"learning_rate": 0.0002999997987559116,
"loss": 0.4516,
"step": 4720
},
{
"epoch": 0.000663063600555908,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999997976722084,
"loss": 0.4434,
"step": 4730
},
{
"epoch": 0.0006644654263498952,
"grad_norm": 0.51953125,
"learning_rate": 0.0002999997965855952,
"loss": 0.4576,
"step": 4740
},
{
"epoch": 0.0006658672521438823,
"grad_norm": 0.396484375,
"learning_rate": 0.0002999997954960719,
"loss": 0.4261,
"step": 4750
},
{
"epoch": 0.0006672690779378694,
"grad_norm": 0.55078125,
"learning_rate": 0.0002999997944036386,
"loss": 0.477,
"step": 4760
},
{
"epoch": 0.0006686709037318565,
"grad_norm": 0.671875,
"learning_rate": 0.0002999997933082952,
"loss": 0.4698,
"step": 4770
},
{
"epoch": 0.0006700727295258437,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999997922100418,
"loss": 0.4822,
"step": 4780
},
{
"epoch": 0.0006714745553198307,
"grad_norm": 0.5390625,
"learning_rate": 0.00029999979110887834,
"loss": 0.4478,
"step": 4790
},
{
"epoch": 0.0006728763811138179,
"grad_norm": 0.373046875,
"learning_rate": 0.0002999997900048048,
"loss": 0.4292,
"step": 4800
},
{
"epoch": 0.000674278206907805,
"grad_norm": 0.4921875,
"learning_rate": 0.00029999978889782127,
"loss": 0.5094,
"step": 4810
},
{
"epoch": 0.0006756800327017921,
"grad_norm": 0.337890625,
"learning_rate": 0.0002999997877879277,
"loss": 0.4333,
"step": 4820
},
{
"epoch": 0.0006770818584957792,
"grad_norm": 0.474609375,
"learning_rate": 0.00029999978667512403,
"loss": 0.4495,
"step": 4830
},
{
"epoch": 0.0006784836842897664,
"grad_norm": 0.6171875,
"learning_rate": 0.0002999997855594103,
"loss": 0.4684,
"step": 4840
},
{
"epoch": 0.0006798855100837535,
"grad_norm": 0.263671875,
"learning_rate": 0.0002999997844407865,
"loss": 0.3566,
"step": 4850
},
{
"epoch": 0.0006812873358777406,
"grad_norm": 0.69140625,
"learning_rate": 0.0002999997833192527,
"loss": 0.4387,
"step": 4860
},
{
"epoch": 0.0006826891616717278,
"grad_norm": 1.2265625,
"learning_rate": 0.0002999997821948089,
"loss": 0.4308,
"step": 4870
},
{
"epoch": 0.0006840909874657148,
"grad_norm": 0.5859375,
"learning_rate": 0.0002999997810674549,
"loss": 0.5234,
"step": 4880
},
{
"epoch": 0.000685492813259702,
"grad_norm": 0.234375,
"learning_rate": 0.000299999779937191,
"loss": 0.5019,
"step": 4890
},
{
"epoch": 0.000686894639053689,
"grad_norm": 0.51953125,
"learning_rate": 0.000299999778804017,
"loss": 0.4867,
"step": 4900
},
{
"epoch": 0.0006882964648476762,
"grad_norm": 0.9921875,
"learning_rate": 0.00029999977766793294,
"loss": 0.5128,
"step": 4910
},
{
"epoch": 0.0006896982906416633,
"grad_norm": 1.921875,
"learning_rate": 0.0002999997765289389,
"loss": 0.5317,
"step": 4920
},
{
"epoch": 0.0006911001164356504,
"grad_norm": 0.78125,
"learning_rate": 0.0002999997753870347,
"loss": 0.5652,
"step": 4930
},
{
"epoch": 0.0006925019422296376,
"grad_norm": 0.90625,
"learning_rate": 0.0002999997742422205,
"loss": 0.4115,
"step": 4940
},
{
"epoch": 0.0006939037680236247,
"grad_norm": 0.8359375,
"learning_rate": 0.00029999977309449626,
"loss": 0.5186,
"step": 4950
},
{
"epoch": 0.0006953055938176118,
"grad_norm": 0.93359375,
"learning_rate": 0.000299999771943862,
"loss": 0.5305,
"step": 4960
},
{
"epoch": 0.0006967074196115989,
"grad_norm": 0.9140625,
"learning_rate": 0.0002999997707903176,
"loss": 0.4705,
"step": 4970
},
{
"epoch": 0.0006981092454055861,
"grad_norm": 0.5859375,
"learning_rate": 0.0002999997696338632,
"loss": 0.4838,
"step": 4980
},
{
"epoch": 0.0006995110711995731,
"grad_norm": 0.40625,
"learning_rate": 0.0002999997684744988,
"loss": 0.5191,
"step": 4990
},
{
"epoch": 0.0007009128969935603,
"grad_norm": 0.478515625,
"learning_rate": 0.00029999976731222435,
"loss": 0.4744,
"step": 5000
},
{
"epoch": 0.0007009128969935603,
"eval_loss": 0.1905738264322281,
"eval_runtime": 113.7667,
"eval_samples_per_second": 200.788,
"eval_steps_per_second": 1.573,
"step": 5000
},
{
"epoch": 0.0007023147227875474,
"grad_norm": 0.6640625,
"learning_rate": 0.00029999976614703976,
"loss": 0.5915,
"step": 5010
},
{
"epoch": 0.0007037165485815345,
"grad_norm": 0.62109375,
"learning_rate": 0.00029999976497894516,
"loss": 0.5237,
"step": 5020
},
{
"epoch": 0.0007051183743755217,
"grad_norm": 0.6328125,
"learning_rate": 0.0002999997638079406,
"loss": 0.5251,
"step": 5030
},
{
"epoch": 0.0007065202001695088,
"grad_norm": 0.439453125,
"learning_rate": 0.0002999997626340259,
"loss": 0.4624,
"step": 5040
},
{
"epoch": 0.0007079220259634959,
"grad_norm": 0.953125,
"learning_rate": 0.0002999997614572012,
"loss": 0.4527,
"step": 5050
},
{
"epoch": 0.000709323851757483,
"grad_norm": 0.83203125,
"learning_rate": 0.0002999997602774664,
"loss": 0.4864,
"step": 5060
},
{
"epoch": 0.0007107256775514702,
"grad_norm": 1.046875,
"learning_rate": 0.00029999975909482157,
"loss": 0.4791,
"step": 5070
},
{
"epoch": 0.0007121275033454572,
"grad_norm": 0.2109375,
"learning_rate": 0.0002999997579092667,
"loss": 0.4468,
"step": 5080
},
{
"epoch": 0.0007135293291394444,
"grad_norm": 0.318359375,
"learning_rate": 0.0002999997567208018,
"loss": 0.4285,
"step": 5090
},
{
"epoch": 0.0007149311549334315,
"grad_norm": 0.30078125,
"learning_rate": 0.0002999997555294268,
"loss": 0.4075,
"step": 5100
},
{
"epoch": 0.0007163329807274186,
"grad_norm": 0.8125,
"learning_rate": 0.0002999997543351418,
"loss": 0.4852,
"step": 5110
},
{
"epoch": 0.0007177348065214057,
"grad_norm": 0.94140625,
"learning_rate": 0.0002999997531379467,
"loss": 0.4541,
"step": 5120
},
{
"epoch": 0.0007191366323153929,
"grad_norm": 0.9375,
"learning_rate": 0.00029999975193784165,
"loss": 0.5359,
"step": 5130
},
{
"epoch": 0.00072053845810938,
"grad_norm": 0.8125,
"learning_rate": 0.0002999997507348265,
"loss": 0.507,
"step": 5140
},
{
"epoch": 0.0007219402839033671,
"grad_norm": 0.796875,
"learning_rate": 0.00029999974952890125,
"loss": 0.5468,
"step": 5150
},
{
"epoch": 0.0007233421096973543,
"grad_norm": 0.8515625,
"learning_rate": 0.00029999974832006603,
"loss": 0.3978,
"step": 5160
},
{
"epoch": 0.0007247439354913413,
"grad_norm": 0.2109375,
"learning_rate": 0.0002999997471083207,
"loss": 0.3386,
"step": 5170
},
{
"epoch": 0.0007261457612853285,
"grad_norm": 0.396484375,
"learning_rate": 0.0002999997458936653,
"loss": 0.4484,
"step": 5180
},
{
"epoch": 0.0007275475870793155,
"grad_norm": 0.69921875,
"learning_rate": 0.00029999974467609993,
"loss": 0.4583,
"step": 5190
},
{
"epoch": 0.0007289494128733027,
"grad_norm": 0.33203125,
"learning_rate": 0.0002999997434556245,
"loss": 0.4929,
"step": 5200
},
{
"epoch": 0.0007303512386672898,
"grad_norm": 0.92578125,
"learning_rate": 0.00029999974223223895,
"loss": 0.4117,
"step": 5210
},
{
"epoch": 0.0007317530644612769,
"grad_norm": 0.51953125,
"learning_rate": 0.0002999997410059434,
"loss": 0.4758,
"step": 5220
},
{
"epoch": 0.0007331548902552641,
"grad_norm": 0.5546875,
"learning_rate": 0.00029999973977673787,
"loss": 0.38,
"step": 5230
},
{
"epoch": 0.0007345567160492512,
"grad_norm": 0.88671875,
"learning_rate": 0.0002999997385446222,
"loss": 0.4684,
"step": 5240
},
{
"epoch": 0.0007359585418432383,
"grad_norm": 0.7109375,
"learning_rate": 0.0002999997373095965,
"loss": 0.4076,
"step": 5250
},
{
"epoch": 0.0007373603676372254,
"grad_norm": 0.439453125,
"learning_rate": 0.0002999997360716608,
"loss": 0.5375,
"step": 5260
},
{
"epoch": 0.0007387621934312126,
"grad_norm": 0.546875,
"learning_rate": 0.000299999734830815,
"loss": 0.4483,
"step": 5270
},
{
"epoch": 0.0007401640192251996,
"grad_norm": 1.1328125,
"learning_rate": 0.0002999997335870592,
"loss": 0.4744,
"step": 5280
},
{
"epoch": 0.0007415658450191868,
"grad_norm": 0.6953125,
"learning_rate": 0.0002999997323403933,
"loss": 0.4671,
"step": 5290
},
{
"epoch": 0.0007429676708131739,
"grad_norm": 0.609375,
"learning_rate": 0.0002999997310908174,
"loss": 0.4767,
"step": 5300
},
{
"epoch": 0.000744369496607161,
"grad_norm": 1.015625,
"learning_rate": 0.0002999997298383314,
"loss": 0.5018,
"step": 5310
},
{
"epoch": 0.0007457713224011482,
"grad_norm": 0.79296875,
"learning_rate": 0.0002999997285829354,
"loss": 0.4238,
"step": 5320
},
{
"epoch": 0.0007471731481951353,
"grad_norm": 0.78125,
"learning_rate": 0.00029999972732462936,
"loss": 0.4321,
"step": 5330
},
{
"epoch": 0.0007485749739891224,
"grad_norm": 0.271484375,
"learning_rate": 0.00029999972606341323,
"loss": 0.4522,
"step": 5340
},
{
"epoch": 0.0007499767997831095,
"grad_norm": 0.5078125,
"learning_rate": 0.00029999972479928706,
"loss": 0.4748,
"step": 5350
},
{
"epoch": 0.0007513786255770967,
"grad_norm": 0.357421875,
"learning_rate": 0.00029999972353225083,
"loss": 0.4502,
"step": 5360
},
{
"epoch": 0.0007527804513710837,
"grad_norm": 0.80859375,
"learning_rate": 0.0002999997222623046,
"loss": 0.5169,
"step": 5370
},
{
"epoch": 0.0007541822771650709,
"grad_norm": 0.68359375,
"learning_rate": 0.00029999972098944833,
"loss": 0.4289,
"step": 5380
},
{
"epoch": 0.000755584102959058,
"grad_norm": 0.67578125,
"learning_rate": 0.00029999971971368195,
"loss": 0.4885,
"step": 5390
},
{
"epoch": 0.0007569859287530451,
"grad_norm": 0.3203125,
"learning_rate": 0.0002999997184350055,
"loss": 0.4621,
"step": 5400
},
{
"epoch": 0.0007583877545470322,
"grad_norm": 0.314453125,
"learning_rate": 0.0002999997171534191,
"loss": 0.3875,
"step": 5410
},
{
"epoch": 0.0007597895803410194,
"grad_norm": 0.54296875,
"learning_rate": 0.0002999997158689226,
"loss": 0.3891,
"step": 5420
},
{
"epoch": 0.0007611914061350065,
"grad_norm": 0.408203125,
"learning_rate": 0.00029999971458151604,
"loss": 0.4734,
"step": 5430
},
{
"epoch": 0.0007625932319289936,
"grad_norm": 1.046875,
"learning_rate": 0.00029999971329119945,
"loss": 0.5127,
"step": 5440
},
{
"epoch": 0.0007639950577229808,
"grad_norm": 0.63671875,
"learning_rate": 0.00029999971199797285,
"loss": 0.5229,
"step": 5450
},
{
"epoch": 0.0007653968835169678,
"grad_norm": 0.73046875,
"learning_rate": 0.00029999971070183615,
"loss": 0.5307,
"step": 5460
},
{
"epoch": 0.000766798709310955,
"grad_norm": 0.77734375,
"learning_rate": 0.0002999997094027894,
"loss": 0.4848,
"step": 5470
},
{
"epoch": 0.000768200535104942,
"grad_norm": 0.80859375,
"learning_rate": 0.00029999970810083265,
"loss": 0.4901,
"step": 5480
},
{
"epoch": 0.0007696023608989292,
"grad_norm": 0.369140625,
"learning_rate": 0.00029999970679596584,
"loss": 0.4517,
"step": 5490
},
{
"epoch": 0.0007710041866929163,
"grad_norm": 0.263671875,
"learning_rate": 0.000299999705488189,
"loss": 0.4509,
"step": 5500
},
{
"epoch": 0.0007710041866929163,
"eval_loss": 0.18971732258796692,
"eval_runtime": 112.0563,
"eval_samples_per_second": 203.853,
"eval_steps_per_second": 1.597,
"step": 5500
},
{
"epoch": 0.0007724060124869034,
"grad_norm": 0.72265625,
"learning_rate": 0.000299999704177502,
"loss": 0.4598,
"step": 5510
},
{
"epoch": 0.0007738078382808906,
"grad_norm": 0.365234375,
"learning_rate": 0.00029999970286390506,
"loss": 0.4504,
"step": 5520
},
{
"epoch": 0.0007752096640748777,
"grad_norm": 0.81640625,
"learning_rate": 0.0002999997015473981,
"loss": 0.4226,
"step": 5530
},
{
"epoch": 0.0007766114898688648,
"grad_norm": 0.78125,
"learning_rate": 0.000299999700227981,
"loss": 0.4202,
"step": 5540
},
{
"epoch": 0.0007780133156628519,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999996989056539,
"loss": 0.4346,
"step": 5550
},
{
"epoch": 0.0007794151414568391,
"grad_norm": 0.392578125,
"learning_rate": 0.00029999969758041673,
"loss": 0.3287,
"step": 5560
},
{
"epoch": 0.0007808169672508261,
"grad_norm": 0.6640625,
"learning_rate": 0.00029999969625226956,
"loss": 0.5162,
"step": 5570
},
{
"epoch": 0.0007822187930448133,
"grad_norm": 0.70703125,
"learning_rate": 0.0002999996949212123,
"loss": 0.4915,
"step": 5580
},
{
"epoch": 0.0007836206188388004,
"grad_norm": 0.28125,
"learning_rate": 0.000299999693587245,
"loss": 0.4213,
"step": 5590
},
{
"epoch": 0.0007850224446327875,
"grad_norm": 0.94140625,
"learning_rate": 0.00029999969225036766,
"loss": 0.3892,
"step": 5600
},
{
"epoch": 0.0007864242704267747,
"grad_norm": 0.921875,
"learning_rate": 0.0002999996909105803,
"loss": 0.4821,
"step": 5610
},
{
"epoch": 0.0007878260962207618,
"grad_norm": 0.423828125,
"learning_rate": 0.00029999968956788284,
"loss": 0.3946,
"step": 5620
},
{
"epoch": 0.0007892279220147489,
"grad_norm": 0.349609375,
"learning_rate": 0.00029999968822227535,
"loss": 0.4474,
"step": 5630
},
{
"epoch": 0.000790629747808736,
"grad_norm": 0.54296875,
"learning_rate": 0.00029999968687375786,
"loss": 0.4803,
"step": 5640
},
{
"epoch": 0.0007920315736027232,
"grad_norm": 0.515625,
"learning_rate": 0.00029999968552233027,
"loss": 0.4669,
"step": 5650
},
{
"epoch": 0.0007934333993967102,
"grad_norm": 0.287109375,
"learning_rate": 0.0002999996841679926,
"loss": 0.3951,
"step": 5660
},
{
"epoch": 0.0007948352251906974,
"grad_norm": 0.275390625,
"learning_rate": 0.00029999968281074497,
"loss": 0.3465,
"step": 5670
},
{
"epoch": 0.0007962370509846845,
"grad_norm": 0.37109375,
"learning_rate": 0.00029999968145058727,
"loss": 0.4077,
"step": 5680
},
{
"epoch": 0.0007976388767786716,
"grad_norm": 0.37890625,
"learning_rate": 0.0002999996800875195,
"loss": 0.4023,
"step": 5690
},
{
"epoch": 0.0007990407025726587,
"grad_norm": 0.5234375,
"learning_rate": 0.00029999967872154166,
"loss": 0.4003,
"step": 5700
},
{
"epoch": 0.0008004425283666459,
"grad_norm": 0.8046875,
"learning_rate": 0.00029999967735265385,
"loss": 0.494,
"step": 5710
},
{
"epoch": 0.000801844354160633,
"grad_norm": 0.7734375,
"learning_rate": 0.00029999967598085594,
"loss": 0.4937,
"step": 5720
},
{
"epoch": 0.0008032461799546201,
"grad_norm": 0.65625,
"learning_rate": 0.000299999674606148,
"loss": 0.4274,
"step": 5730
},
{
"epoch": 0.0008046480057486072,
"grad_norm": 0.71875,
"learning_rate": 0.00029999967322853,
"loss": 0.4245,
"step": 5740
},
{
"epoch": 0.0008060498315425943,
"grad_norm": 0.8125,
"learning_rate": 0.00029999967184800194,
"loss": 0.5633,
"step": 5750
},
{
"epoch": 0.0008074516573365815,
"grad_norm": 0.70703125,
"learning_rate": 0.00029999967046456387,
"loss": 0.4766,
"step": 5760
},
{
"epoch": 0.0008088534831305685,
"grad_norm": 0.5625,
"learning_rate": 0.00029999966907821575,
"loss": 0.4312,
"step": 5770
},
{
"epoch": 0.0008102553089245557,
"grad_norm": 0.45703125,
"learning_rate": 0.0002999996676889576,
"loss": 0.3684,
"step": 5780
},
{
"epoch": 0.0008116571347185428,
"grad_norm": 0.80859375,
"learning_rate": 0.0002999996662967893,
"loss": 0.3765,
"step": 5790
},
{
"epoch": 0.0008130589605125299,
"grad_norm": 0.46484375,
"learning_rate": 0.00029999966490171107,
"loss": 0.4691,
"step": 5800
},
{
"epoch": 0.0008144607863065171,
"grad_norm": 0.75390625,
"learning_rate": 0.00029999966350372273,
"loss": 0.4451,
"step": 5810
},
{
"epoch": 0.0008158626121005042,
"grad_norm": 0.302734375,
"learning_rate": 0.00029999966210282435,
"loss": 0.4453,
"step": 5820
},
{
"epoch": 0.0008172644378944913,
"grad_norm": 0.423828125,
"learning_rate": 0.00029999966069901596,
"loss": 0.3543,
"step": 5830
},
{
"epoch": 0.0008186662636884784,
"grad_norm": 0.86328125,
"learning_rate": 0.0002999996592922975,
"loss": 0.4092,
"step": 5840
},
{
"epoch": 0.0008200680894824656,
"grad_norm": 0.71875,
"learning_rate": 0.00029999965788266904,
"loss": 0.4338,
"step": 5850
},
{
"epoch": 0.0008214699152764526,
"grad_norm": 0.287109375,
"learning_rate": 0.00029999965647013044,
"loss": 0.4996,
"step": 5860
},
{
"epoch": 0.0008228717410704398,
"grad_norm": 0.66015625,
"learning_rate": 0.00029999965505468184,
"loss": 0.4116,
"step": 5870
},
{
"epoch": 0.0008242735668644269,
"grad_norm": 0.267578125,
"learning_rate": 0.00029999965363632325,
"loss": 0.4168,
"step": 5880
},
{
"epoch": 0.000825675392658414,
"grad_norm": 0.68359375,
"learning_rate": 0.00029999965221505455,
"loss": 0.4213,
"step": 5890
},
{
"epoch": 0.0008270772184524012,
"grad_norm": 0.9296875,
"learning_rate": 0.0002999996507908758,
"loss": 0.4801,
"step": 5900
},
{
"epoch": 0.0008284790442463883,
"grad_norm": 1.0703125,
"learning_rate": 0.000299999649363787,
"loss": 0.4743,
"step": 5910
},
{
"epoch": 0.0008298808700403754,
"grad_norm": 0.22265625,
"learning_rate": 0.0002999996479337882,
"loss": 0.2799,
"step": 5920
},
{
"epoch": 0.0008312826958343625,
"grad_norm": 0.4609375,
"learning_rate": 0.0002999996465008793,
"loss": 0.5026,
"step": 5930
},
{
"epoch": 0.0008326845216283497,
"grad_norm": 1.03125,
"learning_rate": 0.0002999996450650604,
"loss": 0.4738,
"step": 5940
},
{
"epoch": 0.0008340863474223367,
"grad_norm": 0.60546875,
"learning_rate": 0.00029999964362633144,
"loss": 0.4826,
"step": 5950
},
{
"epoch": 0.0008354881732163239,
"grad_norm": 0.765625,
"learning_rate": 0.0002999996421846924,
"loss": 0.4934,
"step": 5960
},
{
"epoch": 0.000836889999010311,
"grad_norm": 0.38671875,
"learning_rate": 0.00029999964074014336,
"loss": 0.4993,
"step": 5970
},
{
"epoch": 0.0008382918248042981,
"grad_norm": 0.625,
"learning_rate": 0.0002999996392926843,
"loss": 0.4764,
"step": 5980
},
{
"epoch": 0.0008396936505982852,
"grad_norm": 0.58984375,
"learning_rate": 0.0002999996378423151,
"loss": 0.4652,
"step": 5990
},
{
"epoch": 0.0008410954763922723,
"grad_norm": 0.51953125,
"learning_rate": 0.00029999963638903594,
"loss": 0.465,
"step": 6000
},
{
"epoch": 0.0008410954763922723,
"eval_loss": 0.18518111109733582,
"eval_runtime": 112.0637,
"eval_samples_per_second": 203.839,
"eval_steps_per_second": 1.597,
"step": 6000
},
{
"epoch": 0.0008424973021862595,
"grad_norm": 1.0,
"learning_rate": 0.0002999996349328467,
"loss": 0.5146,
"step": 6010
},
{
"epoch": 0.0008438991279802466,
"grad_norm": 0.369140625,
"learning_rate": 0.00029999963347374743,
"loss": 0.4153,
"step": 6020
},
{
"epoch": 0.0008453009537742337,
"grad_norm": 0.84375,
"learning_rate": 0.0002999996320117381,
"loss": 0.4145,
"step": 6030
},
{
"epoch": 0.0008467027795682208,
"grad_norm": 0.298828125,
"learning_rate": 0.0002999996305468187,
"loss": 0.4206,
"step": 6040
},
{
"epoch": 0.000848104605362208,
"grad_norm": 0.6875,
"learning_rate": 0.00029999962907898927,
"loss": 0.4394,
"step": 6050
},
{
"epoch": 0.000849506431156195,
"grad_norm": 0.416015625,
"learning_rate": 0.0002999996276082498,
"loss": 0.3766,
"step": 6060
},
{
"epoch": 0.0008509082569501822,
"grad_norm": 0.42578125,
"learning_rate": 0.0002999996261346003,
"loss": 0.4398,
"step": 6070
},
{
"epoch": 0.0008523100827441693,
"grad_norm": 0.58203125,
"learning_rate": 0.00029999962465804075,
"loss": 0.4544,
"step": 6080
},
{
"epoch": 0.0008537119085381564,
"grad_norm": 0.609375,
"learning_rate": 0.00029999962317857115,
"loss": 0.4677,
"step": 6090
},
{
"epoch": 0.0008551137343321436,
"grad_norm": 0.84375,
"learning_rate": 0.0002999996216961915,
"loss": 0.4984,
"step": 6100
},
{
"epoch": 0.0008565155601261307,
"grad_norm": 0.53515625,
"learning_rate": 0.0002999996202109018,
"loss": 0.4111,
"step": 6110
},
{
"epoch": 0.0008579173859201178,
"grad_norm": 0.68359375,
"learning_rate": 0.00029999961872270205,
"loss": 0.4226,
"step": 6120
},
{
"epoch": 0.0008593192117141049,
"grad_norm": 0.70703125,
"learning_rate": 0.0002999996172315923,
"loss": 0.491,
"step": 6130
},
{
"epoch": 0.0008607210375080921,
"grad_norm": 0.5625,
"learning_rate": 0.00029999961573757243,
"loss": 0.4407,
"step": 6140
},
{
"epoch": 0.0008621228633020791,
"grad_norm": 0.63671875,
"learning_rate": 0.0002999996142406426,
"loss": 0.4048,
"step": 6150
},
{
"epoch": 0.0008635246890960663,
"grad_norm": 0.75390625,
"learning_rate": 0.00029999961274080266,
"loss": 0.3733,
"step": 6160
},
{
"epoch": 0.0008649265148900534,
"grad_norm": 0.58984375,
"learning_rate": 0.0002999996112380527,
"loss": 0.4596,
"step": 6170
},
{
"epoch": 0.0008663283406840405,
"grad_norm": 0.57421875,
"learning_rate": 0.0002999996097323927,
"loss": 0.4819,
"step": 6180
},
{
"epoch": 0.0008677301664780277,
"grad_norm": 0.30859375,
"learning_rate": 0.0002999996082238226,
"loss": 0.4029,
"step": 6190
},
{
"epoch": 0.0008691319922720148,
"grad_norm": 0.65234375,
"learning_rate": 0.00029999960671234254,
"loss": 0.5001,
"step": 6200
},
{
"epoch": 0.0008705338180660019,
"grad_norm": 0.88671875,
"learning_rate": 0.00029999960519795237,
"loss": 0.4356,
"step": 6210
},
{
"epoch": 0.000871935643859989,
"grad_norm": 0.97265625,
"learning_rate": 0.0002999996036806522,
"loss": 0.4399,
"step": 6220
},
{
"epoch": 0.0008733374696539762,
"grad_norm": 0.76171875,
"learning_rate": 0.00029999960216044196,
"loss": 0.5213,
"step": 6230
},
{
"epoch": 0.0008747392954479632,
"grad_norm": 1.1640625,
"learning_rate": 0.00029999960063732163,
"loss": 0.4467,
"step": 6240
},
{
"epoch": 0.0008761411212419504,
"grad_norm": 1.1015625,
"learning_rate": 0.00029999959911129135,
"loss": 0.5033,
"step": 6250
},
{
"epoch": 0.0008775429470359374,
"grad_norm": 0.330078125,
"learning_rate": 0.00029999959758235097,
"loss": 0.3733,
"step": 6260
},
{
"epoch": 0.0008789447728299246,
"grad_norm": 0.19921875,
"learning_rate": 0.0002999995960505005,
"loss": 0.3974,
"step": 6270
},
{
"epoch": 0.0008803465986239117,
"grad_norm": 0.33984375,
"learning_rate": 0.0002999995945157401,
"loss": 0.4224,
"step": 6280
},
{
"epoch": 0.0008817484244178988,
"grad_norm": 0.53515625,
"learning_rate": 0.00029999959297806955,
"loss": 0.4442,
"step": 6290
},
{
"epoch": 0.000883150250211886,
"grad_norm": 0.46484375,
"learning_rate": 0.000299999591437489,
"loss": 0.4996,
"step": 6300
},
{
"epoch": 0.0008845520760058731,
"grad_norm": 0.9375,
"learning_rate": 0.0002999995898939984,
"loss": 0.4069,
"step": 6310
},
{
"epoch": 0.0008859539017998602,
"grad_norm": 0.64453125,
"learning_rate": 0.00029999958834759776,
"loss": 0.4179,
"step": 6320
},
{
"epoch": 0.0008873557275938473,
"grad_norm": 0.79296875,
"learning_rate": 0.0002999995867982871,
"loss": 0.5006,
"step": 6330
},
{
"epoch": 0.0008887575533878345,
"grad_norm": 0.74609375,
"learning_rate": 0.00029999958524606636,
"loss": 0.46,
"step": 6340
},
{
"epoch": 0.0008901593791818215,
"grad_norm": 0.232421875,
"learning_rate": 0.0002999995836909356,
"loss": 0.4165,
"step": 6350
},
{
"epoch": 0.0008915612049758087,
"grad_norm": 0.98046875,
"learning_rate": 0.00029999958213289474,
"loss": 0.3791,
"step": 6360
},
{
"epoch": 0.0008929630307697958,
"grad_norm": 0.77734375,
"learning_rate": 0.0002999995805719439,
"loss": 0.3416,
"step": 6370
},
{
"epoch": 0.0008943648565637829,
"grad_norm": 0.6328125,
"learning_rate": 0.000299999579008083,
"loss": 0.4323,
"step": 6380
},
{
"epoch": 0.0008957666823577701,
"grad_norm": 0.4375,
"learning_rate": 0.000299999577441312,
"loss": 0.4569,
"step": 6390
},
{
"epoch": 0.0008971685081517572,
"grad_norm": 0.546875,
"learning_rate": 0.000299999575871631,
"loss": 0.4431,
"step": 6400
},
{
"epoch": 0.0008985703339457443,
"grad_norm": 1.1171875,
"learning_rate": 0.00029999957429904,
"loss": 0.5003,
"step": 6410
},
{
"epoch": 0.0008999721597397314,
"grad_norm": 0.85546875,
"learning_rate": 0.0002999995727235389,
"loss": 0.4411,
"step": 6420
},
{
"epoch": 0.0009013739855337186,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999995711451278,
"loss": 0.4253,
"step": 6430
},
{
"epoch": 0.0009027758113277056,
"grad_norm": 0.98828125,
"learning_rate": 0.0002999995695638066,
"loss": 0.4617,
"step": 6440
},
{
"epoch": 0.0009041776371216928,
"grad_norm": 0.4375,
"learning_rate": 0.0002999995679795754,
"loss": 0.4213,
"step": 6450
},
{
"epoch": 0.0009055794629156799,
"grad_norm": 1.3828125,
"learning_rate": 0.0002999995663924341,
"loss": 0.471,
"step": 6460
},
{
"epoch": 0.000906981288709667,
"grad_norm": 0.6015625,
"learning_rate": 0.00029999956480238277,
"loss": 0.4532,
"step": 6470
},
{
"epoch": 0.0009083831145036542,
"grad_norm": 0.9609375,
"learning_rate": 0.00029999956320942144,
"loss": 0.4206,
"step": 6480
},
{
"epoch": 0.0009097849402976413,
"grad_norm": 0.94921875,
"learning_rate": 0.00029999956161355006,
"loss": 0.5678,
"step": 6490
},
{
"epoch": 0.0009111867660916284,
"grad_norm": 0.8359375,
"learning_rate": 0.00029999956001476857,
"loss": 0.3739,
"step": 6500
},
{
"epoch": 0.0009111867660916284,
"eval_loss": 0.18671706318855286,
"eval_runtime": 113.805,
"eval_samples_per_second": 200.721,
"eval_steps_per_second": 1.573,
"step": 6500
},
{
"epoch": 0.0009125885918856155,
"grad_norm": 0.3515625,
"learning_rate": 0.00029999955841307713,
"loss": 0.4547,
"step": 6510
},
{
"epoch": 0.0009139904176796027,
"grad_norm": 0.8359375,
"learning_rate": 0.0002999995568084756,
"loss": 0.4481,
"step": 6520
},
{
"epoch": 0.0009153922434735897,
"grad_norm": 0.58203125,
"learning_rate": 0.000299999555200964,
"loss": 0.4814,
"step": 6530
},
{
"epoch": 0.0009167940692675769,
"grad_norm": 0.40625,
"learning_rate": 0.0002999995535905424,
"loss": 0.4352,
"step": 6540
},
{
"epoch": 0.0009181958950615639,
"grad_norm": 0.88671875,
"learning_rate": 0.0002999995519772107,
"loss": 0.4045,
"step": 6550
},
{
"epoch": 0.0009195977208555511,
"grad_norm": 0.6875,
"learning_rate": 0.000299999550360969,
"loss": 0.4183,
"step": 6560
},
{
"epoch": 0.0009209995466495382,
"grad_norm": 0.58984375,
"learning_rate": 0.00029999954874181724,
"loss": 0.3972,
"step": 6570
},
{
"epoch": 0.0009224013724435253,
"grad_norm": 0.78515625,
"learning_rate": 0.0002999995471197555,
"loss": 0.488,
"step": 6580
},
{
"epoch": 0.0009238031982375125,
"grad_norm": 0.83203125,
"learning_rate": 0.00029999954549478363,
"loss": 0.4826,
"step": 6590
},
{
"epoch": 0.0009252050240314996,
"grad_norm": 0.3671875,
"learning_rate": 0.0002999995438669017,
"loss": 0.3605,
"step": 6600
},
{
"epoch": 0.0009266068498254867,
"grad_norm": 0.255859375,
"learning_rate": 0.00029999954223610976,
"loss": 0.3911,
"step": 6610
},
{
"epoch": 0.0009280086756194738,
"grad_norm": 0.4140625,
"learning_rate": 0.0002999995406024078,
"loss": 0.5245,
"step": 6620
},
{
"epoch": 0.000929410501413461,
"grad_norm": 0.390625,
"learning_rate": 0.00029999953896579583,
"loss": 0.3988,
"step": 6630
},
{
"epoch": 0.000930812327207448,
"grad_norm": 0.50390625,
"learning_rate": 0.00029999953732627377,
"loss": 0.522,
"step": 6640
},
{
"epoch": 0.0009322141530014352,
"grad_norm": 0.66015625,
"learning_rate": 0.00029999953568384164,
"loss": 0.462,
"step": 6650
},
{
"epoch": 0.0009336159787954223,
"grad_norm": 0.6015625,
"learning_rate": 0.00029999953403849947,
"loss": 0.4395,
"step": 6660
},
{
"epoch": 0.0009350178045894094,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999995323902473,
"loss": 0.5009,
"step": 6670
},
{
"epoch": 0.0009364196303833966,
"grad_norm": 0.890625,
"learning_rate": 0.00029999953073908507,
"loss": 0.4336,
"step": 6680
},
{
"epoch": 0.0009378214561773837,
"grad_norm": 0.609375,
"learning_rate": 0.0002999995290850128,
"loss": 0.4126,
"step": 6690
},
{
"epoch": 0.0009392232819713708,
"grad_norm": 0.359375,
"learning_rate": 0.00029999952742803046,
"loss": 0.4957,
"step": 6700
},
{
"epoch": 0.0009406251077653579,
"grad_norm": 0.8359375,
"learning_rate": 0.0002999995257681381,
"loss": 0.4758,
"step": 6710
},
{
"epoch": 0.0009420269335593451,
"grad_norm": 0.314453125,
"learning_rate": 0.0002999995241053357,
"loss": 0.3698,
"step": 6720
},
{
"epoch": 0.0009434287593533321,
"grad_norm": 0.462890625,
"learning_rate": 0.0002999995224396232,
"loss": 0.4371,
"step": 6730
},
{
"epoch": 0.0009448305851473193,
"grad_norm": 0.390625,
"learning_rate": 0.00029999952077100077,
"loss": 0.4538,
"step": 6740
},
{
"epoch": 0.0009462324109413064,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999995190994682,
"loss": 0.4969,
"step": 6750
},
{
"epoch": 0.0009476342367352935,
"grad_norm": 1.2109375,
"learning_rate": 0.0002999995174250256,
"loss": 0.4484,
"step": 6760
},
{
"epoch": 0.0009490360625292807,
"grad_norm": 0.5859375,
"learning_rate": 0.000299999515747673,
"loss": 0.4748,
"step": 6770
},
{
"epoch": 0.0009504378883232677,
"grad_norm": 0.84765625,
"learning_rate": 0.00029999951406741034,
"loss": 0.5366,
"step": 6780
},
{
"epoch": 0.0009518397141172549,
"grad_norm": 0.26171875,
"learning_rate": 0.0002999995123842376,
"loss": 0.4718,
"step": 6790
},
{
"epoch": 0.000953241539911242,
"grad_norm": 0.6796875,
"learning_rate": 0.00029999951069815484,
"loss": 0.3908,
"step": 6800
},
{
"epoch": 0.0009546433657052291,
"grad_norm": 0.796875,
"learning_rate": 0.00029999950900916203,
"loss": 0.4005,
"step": 6810
},
{
"epoch": 0.0009560451914992162,
"grad_norm": 0.515625,
"learning_rate": 0.0002999995073172592,
"loss": 0.4265,
"step": 6820
},
{
"epoch": 0.0009574470172932034,
"grad_norm": 0.62890625,
"learning_rate": 0.0002999995056224463,
"loss": 0.4673,
"step": 6830
},
{
"epoch": 0.0009588488430871904,
"grad_norm": 0.28515625,
"learning_rate": 0.00029999950392472336,
"loss": 0.3959,
"step": 6840
},
{
"epoch": 0.0009602506688811776,
"grad_norm": 0.8828125,
"learning_rate": 0.0002999995022240904,
"loss": 0.5393,
"step": 6850
},
{
"epoch": 0.0009616524946751647,
"grad_norm": 0.828125,
"learning_rate": 0.0002999995005205474,
"loss": 0.4281,
"step": 6860
},
{
"epoch": 0.0009630543204691518,
"grad_norm": 0.6796875,
"learning_rate": 0.0002999994988140943,
"loss": 0.378,
"step": 6870
},
{
"epoch": 0.000964456146263139,
"grad_norm": 0.7734375,
"learning_rate": 0.0002999994971047312,
"loss": 0.445,
"step": 6880
},
{
"epoch": 0.0009658579720571261,
"grad_norm": 0.57421875,
"learning_rate": 0.0002999994953924581,
"loss": 0.4868,
"step": 6890
},
{
"epoch": 0.0009672597978511132,
"grad_norm": 0.93359375,
"learning_rate": 0.0002999994936772749,
"loss": 0.479,
"step": 6900
},
{
"epoch": 0.0009686616236451003,
"grad_norm": 0.921875,
"learning_rate": 0.0002999994919591817,
"loss": 0.5115,
"step": 6910
},
{
"epoch": 0.0009700634494390875,
"grad_norm": 0.890625,
"learning_rate": 0.0002999994902381784,
"loss": 0.4955,
"step": 6920
},
{
"epoch": 0.0009714652752330745,
"grad_norm": 1.34375,
"learning_rate": 0.0002999994885142651,
"loss": 0.5283,
"step": 6930
},
{
"epoch": 0.0009728671010270617,
"grad_norm": 0.458984375,
"learning_rate": 0.00029999948678744175,
"loss": 0.5511,
"step": 6940
},
{
"epoch": 0.0009742689268210488,
"grad_norm": 0.7109375,
"learning_rate": 0.0002999994850577083,
"loss": 0.4193,
"step": 6950
},
{
"epoch": 0.0009756707526150359,
"grad_norm": 0.7734375,
"learning_rate": 0.0002999994833250649,
"loss": 0.4947,
"step": 6960
},
{
"epoch": 0.000977072578409023,
"grad_norm": 0.4140625,
"learning_rate": 0.0002999994815895114,
"loss": 0.3735,
"step": 6970
},
{
"epoch": 0.0009784744042030103,
"grad_norm": 0.34765625,
"learning_rate": 0.00029999947985104785,
"loss": 0.4227,
"step": 6980
},
{
"epoch": 0.0009798762299969973,
"grad_norm": 0.65625,
"learning_rate": 0.00029999947810967426,
"loss": 0.3318,
"step": 6990
},
{
"epoch": 0.0009812780557909844,
"grad_norm": 0.80078125,
"learning_rate": 0.0002999994763653906,
"loss": 0.4498,
"step": 7000
},
{
"epoch": 0.0009812780557909844,
"eval_loss": 0.1828116476535797,
"eval_runtime": 112.0643,
"eval_samples_per_second": 203.838,
"eval_steps_per_second": 1.597,
"step": 7000
},
{
"epoch": 0.0009826798815849714,
"grad_norm": 0.62890625,
"learning_rate": 0.00029999947461819697,
"loss": 0.4011,
"step": 7010
},
{
"epoch": 0.0009840817073789587,
"grad_norm": 1.2109375,
"learning_rate": 0.00029999947286809327,
"loss": 0.5584,
"step": 7020
},
{
"epoch": 0.0009854835331729458,
"grad_norm": 0.4296875,
"learning_rate": 0.0002999994711150795,
"loss": 0.4164,
"step": 7030
},
{
"epoch": 0.0009868853589669328,
"grad_norm": 0.58984375,
"learning_rate": 0.0002999994693591557,
"loss": 0.4351,
"step": 7040
},
{
"epoch": 0.00098828718476092,
"grad_norm": 0.5703125,
"learning_rate": 0.0002999994676003219,
"loss": 0.3533,
"step": 7050
},
{
"epoch": 0.0009896890105549072,
"grad_norm": 0.423828125,
"learning_rate": 0.00029999946583857806,
"loss": 0.4176,
"step": 7060
},
{
"epoch": 0.0009910908363488942,
"grad_norm": 0.412109375,
"learning_rate": 0.0002999994640739241,
"loss": 0.4999,
"step": 7070
},
{
"epoch": 0.0009924926621428813,
"grad_norm": 0.68359375,
"learning_rate": 0.00029999946230636014,
"loss": 0.4877,
"step": 7080
},
{
"epoch": 0.0009938944879368686,
"grad_norm": 0.62890625,
"learning_rate": 0.0002999994605358862,
"loss": 0.473,
"step": 7090
},
{
"epoch": 0.0009952963137308556,
"grad_norm": 1.0,
"learning_rate": 0.0002999994587625022,
"loss": 0.4986,
"step": 7100
},
{
"epoch": 0.0009966981395248427,
"grad_norm": 0.51953125,
"learning_rate": 0.00029999945698620806,
"loss": 0.3922,
"step": 7110
},
{
"epoch": 0.0009980999653188298,
"grad_norm": 1.0234375,
"learning_rate": 0.00029999945520700394,
"loss": 0.4771,
"step": 7120
},
{
"epoch": 0.000999501791112817,
"grad_norm": 0.8515625,
"learning_rate": 0.0002999994534248897,
"loss": 0.441,
"step": 7130
},
{
"epoch": 0.001000903616906804,
"grad_norm": 0.72265625,
"learning_rate": 0.00029999945163986555,
"loss": 0.5059,
"step": 7140
},
{
"epoch": 0.0010023054427007912,
"grad_norm": 0.80859375,
"learning_rate": 0.00029999944985193127,
"loss": 0.465,
"step": 7150
},
{
"epoch": 0.0010037072684947784,
"grad_norm": 0.78515625,
"learning_rate": 0.000299999448061087,
"loss": 0.4113,
"step": 7160
},
{
"epoch": 0.0010051090942887655,
"grad_norm": 0.953125,
"learning_rate": 0.00029999944626733267,
"loss": 0.5342,
"step": 7170
},
{
"epoch": 0.0010065109200827526,
"grad_norm": 0.56640625,
"learning_rate": 0.0002999994444706683,
"loss": 0.531,
"step": 7180
},
{
"epoch": 0.0010079127458767396,
"grad_norm": 0.51953125,
"learning_rate": 0.00029999944267109386,
"loss": 0.4291,
"step": 7190
},
{
"epoch": 0.001009314571670727,
"grad_norm": 0.91796875,
"learning_rate": 0.00029999944086860937,
"loss": 0.56,
"step": 7200
},
{
"epoch": 0.001010716397464714,
"grad_norm": 1.0859375,
"learning_rate": 0.0002999994390632149,
"loss": 0.4209,
"step": 7210
},
{
"epoch": 0.001012118223258701,
"grad_norm": 0.83203125,
"learning_rate": 0.0002999994372549103,
"loss": 0.5099,
"step": 7220
},
{
"epoch": 0.001013520049052688,
"grad_norm": 1.0625,
"learning_rate": 0.00029999943544369576,
"loss": 0.567,
"step": 7230
},
{
"epoch": 0.0010149218748466754,
"grad_norm": 0.7890625,
"learning_rate": 0.0002999994336295711,
"loss": 0.474,
"step": 7240
},
{
"epoch": 0.0010163237006406624,
"grad_norm": 0.68359375,
"learning_rate": 0.0002999994318125364,
"loss": 0.4313,
"step": 7250
},
{
"epoch": 0.0010177255264346495,
"grad_norm": 0.30078125,
"learning_rate": 0.00029999942999259173,
"loss": 0.4166,
"step": 7260
},
{
"epoch": 0.0010191273522286368,
"grad_norm": 0.9296875,
"learning_rate": 0.000299999428169737,
"loss": 0.3713,
"step": 7270
},
{
"epoch": 0.0010205291780226238,
"grad_norm": 0.78515625,
"learning_rate": 0.0002999994263439722,
"loss": 0.4229,
"step": 7280
},
{
"epoch": 0.0010219310038166109,
"grad_norm": 0.68359375,
"learning_rate": 0.00029999942451529733,
"loss": 0.4572,
"step": 7290
},
{
"epoch": 0.001023332829610598,
"grad_norm": 0.6015625,
"learning_rate": 0.0002999994226837125,
"loss": 0.4676,
"step": 7300
},
{
"epoch": 0.0010247346554045852,
"grad_norm": 0.85546875,
"learning_rate": 0.0002999994208492175,
"loss": 0.4612,
"step": 7310
},
{
"epoch": 0.0010261364811985723,
"grad_norm": 0.95703125,
"learning_rate": 0.00029999941901181256,
"loss": 0.4747,
"step": 7320
},
{
"epoch": 0.0010275383069925593,
"grad_norm": 0.61328125,
"learning_rate": 0.00029999941717149755,
"loss": 0.4067,
"step": 7330
},
{
"epoch": 0.0010289401327865464,
"grad_norm": 0.5078125,
"learning_rate": 0.0002999994153282725,
"loss": 0.433,
"step": 7340
},
{
"epoch": 0.0010303419585805337,
"grad_norm": 0.8828125,
"learning_rate": 0.00029999941348213743,
"loss": 0.4342,
"step": 7350
},
{
"epoch": 0.0010317437843745207,
"grad_norm": 0.52734375,
"learning_rate": 0.0002999994116330923,
"loss": 0.5533,
"step": 7360
},
{
"epoch": 0.0010331456101685078,
"grad_norm": 1.140625,
"learning_rate": 0.00029999940978113715,
"loss": 0.5318,
"step": 7370
},
{
"epoch": 0.001034547435962495,
"grad_norm": 0.84375,
"learning_rate": 0.00029999940792627193,
"loss": 0.4702,
"step": 7380
},
{
"epoch": 0.0010359492617564821,
"grad_norm": 0.83203125,
"learning_rate": 0.00029999940606849666,
"loss": 0.4446,
"step": 7390
},
{
"epoch": 0.0010373510875504692,
"grad_norm": 0.58984375,
"learning_rate": 0.00029999940420781133,
"loss": 0.4316,
"step": 7400
},
{
"epoch": 0.0010387529133444563,
"grad_norm": 0.498046875,
"learning_rate": 0.000299999402344216,
"loss": 0.378,
"step": 7410
},
{
"epoch": 0.0010401547391384435,
"grad_norm": 0.56640625,
"learning_rate": 0.00029999940047771063,
"loss": 0.4685,
"step": 7420
},
{
"epoch": 0.0010415565649324306,
"grad_norm": 0.2255859375,
"learning_rate": 0.0002999993986082952,
"loss": 0.4783,
"step": 7430
},
{
"epoch": 0.0010429583907264177,
"grad_norm": 0.58203125,
"learning_rate": 0.00029999939673596977,
"loss": 0.4002,
"step": 7440
},
{
"epoch": 0.001044360216520405,
"grad_norm": 0.8671875,
"learning_rate": 0.0002999993948607343,
"loss": 0.473,
"step": 7450
},
{
"epoch": 0.001045762042314392,
"grad_norm": 0.703125,
"learning_rate": 0.0002999993929825887,
"loss": 0.4573,
"step": 7460
},
{
"epoch": 0.001047163868108379,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999993911015331,
"loss": 0.4299,
"step": 7470
},
{
"epoch": 0.0010485656939023661,
"grad_norm": 0.546875,
"learning_rate": 0.00029999938921756753,
"loss": 0.4994,
"step": 7480
},
{
"epoch": 0.0010499675196963534,
"grad_norm": 0.443359375,
"learning_rate": 0.00029999938733069184,
"loss": 0.4764,
"step": 7490
},
{
"epoch": 0.0010513693454903405,
"grad_norm": 0.1767578125,
"learning_rate": 0.00029999938544090615,
"loss": 0.3844,
"step": 7500
},
{
"epoch": 0.0010513693454903405,
"eval_loss": 0.18380461633205414,
"eval_runtime": 114.1658,
"eval_samples_per_second": 200.086,
"eval_steps_per_second": 1.568,
"step": 7500
},
{
"epoch": 0.0010527711712843275,
"grad_norm": 0.4921875,
"learning_rate": 0.0002999993835482104,
"loss": 0.4668,
"step": 7510
},
{
"epoch": 0.0010541729970783146,
"grad_norm": 0.41796875,
"learning_rate": 0.0002999993816526046,
"loss": 0.4184,
"step": 7520
},
{
"epoch": 0.0010555748228723019,
"grad_norm": 0.9296875,
"learning_rate": 0.00029999937975408876,
"loss": 0.4809,
"step": 7530
},
{
"epoch": 0.001056976648666289,
"grad_norm": 0.80078125,
"learning_rate": 0.0002999993778526629,
"loss": 0.5232,
"step": 7540
},
{
"epoch": 0.001058378474460276,
"grad_norm": 0.59765625,
"learning_rate": 0.00029999937594832695,
"loss": 0.4522,
"step": 7550
},
{
"epoch": 0.0010597803002542633,
"grad_norm": 0.68359375,
"learning_rate": 0.00029999937404108105,
"loss": 0.4973,
"step": 7560
},
{
"epoch": 0.0010611821260482503,
"grad_norm": 0.435546875,
"learning_rate": 0.00029999937213092505,
"loss": 0.4475,
"step": 7570
},
{
"epoch": 0.0010625839518422374,
"grad_norm": 0.7578125,
"learning_rate": 0.000299999370217859,
"loss": 0.5236,
"step": 7580
},
{
"epoch": 0.0010639857776362244,
"grad_norm": 0.9921875,
"learning_rate": 0.000299999368301883,
"loss": 0.4271,
"step": 7590
},
{
"epoch": 0.0010653876034302117,
"grad_norm": 0.93359375,
"learning_rate": 0.0002999993663829968,
"loss": 0.4317,
"step": 7600
},
{
"epoch": 0.0010667894292241988,
"grad_norm": 0.4375,
"learning_rate": 0.00029999936446120065,
"loss": 0.3837,
"step": 7610
},
{
"epoch": 0.0010681912550181858,
"grad_norm": 0.64453125,
"learning_rate": 0.00029999936253649444,
"loss": 0.4802,
"step": 7620
},
{
"epoch": 0.001069593080812173,
"grad_norm": 0.24609375,
"learning_rate": 0.0002999993606088783,
"loss": 0.4218,
"step": 7630
},
{
"epoch": 0.0010709949066061602,
"grad_norm": 0.419921875,
"learning_rate": 0.000299999358678352,
"loss": 0.3988,
"step": 7640
},
{
"epoch": 0.0010723967324001472,
"grad_norm": 0.67578125,
"learning_rate": 0.00029999935674491563,
"loss": 0.4898,
"step": 7650
},
{
"epoch": 0.0010737985581941343,
"grad_norm": 0.734375,
"learning_rate": 0.0002999993548085693,
"loss": 0.5254,
"step": 7660
},
{
"epoch": 0.0010752003839881216,
"grad_norm": 0.365234375,
"learning_rate": 0.0002999993528693129,
"loss": 0.3633,
"step": 7670
},
{
"epoch": 0.0010766022097821086,
"grad_norm": 0.6796875,
"learning_rate": 0.00029999935092714646,
"loss": 0.4217,
"step": 7680
},
{
"epoch": 0.0010780040355760957,
"grad_norm": 0.45703125,
"learning_rate": 0.00029999934898207003,
"loss": 0.4005,
"step": 7690
},
{
"epoch": 0.0010794058613700828,
"grad_norm": 0.765625,
"learning_rate": 0.00029999934703408345,
"loss": 0.5546,
"step": 7700
},
{
"epoch": 0.00108080768716407,
"grad_norm": 0.90625,
"learning_rate": 0.0002999993450831869,
"loss": 0.5362,
"step": 7710
},
{
"epoch": 0.001082209512958057,
"grad_norm": 0.53125,
"learning_rate": 0.00029999934312938034,
"loss": 0.4965,
"step": 7720
},
{
"epoch": 0.0010836113387520442,
"grad_norm": 0.8671875,
"learning_rate": 0.0002999993411726637,
"loss": 0.4596,
"step": 7730
},
{
"epoch": 0.0010850131645460314,
"grad_norm": 0.486328125,
"learning_rate": 0.000299999339213037,
"loss": 0.4036,
"step": 7740
},
{
"epoch": 0.0010864149903400185,
"grad_norm": 0.310546875,
"learning_rate": 0.00029999933725050027,
"loss": 0.3324,
"step": 7750
},
{
"epoch": 0.0010878168161340056,
"grad_norm": 0.88671875,
"learning_rate": 0.00029999933528505353,
"loss": 0.3971,
"step": 7760
},
{
"epoch": 0.0010892186419279926,
"grad_norm": 0.5703125,
"learning_rate": 0.00029999933331669674,
"loss": 0.4291,
"step": 7770
},
{
"epoch": 0.00109062046772198,
"grad_norm": 0.609375,
"learning_rate": 0.0002999993313454299,
"loss": 0.5129,
"step": 7780
},
{
"epoch": 0.001092022293515967,
"grad_norm": 0.828125,
"learning_rate": 0.00029999932937125305,
"loss": 0.4775,
"step": 7790
},
{
"epoch": 0.001093424119309954,
"grad_norm": 0.41796875,
"learning_rate": 0.0002999993273941661,
"loss": 0.3819,
"step": 7800
},
{
"epoch": 0.001094825945103941,
"grad_norm": 0.84375,
"learning_rate": 0.00029999932541416915,
"loss": 0.421,
"step": 7810
},
{
"epoch": 0.0010962277708979284,
"grad_norm": 0.255859375,
"learning_rate": 0.00029999932343126214,
"loss": 0.3671,
"step": 7820
},
{
"epoch": 0.0010976295966919154,
"grad_norm": 0.375,
"learning_rate": 0.0002999993214454451,
"loss": 0.3949,
"step": 7830
},
{
"epoch": 0.0010990314224859025,
"grad_norm": 0.3125,
"learning_rate": 0.00029999931945671804,
"loss": 0.4246,
"step": 7840
},
{
"epoch": 0.0011004332482798898,
"grad_norm": 0.353515625,
"learning_rate": 0.00029999931746508093,
"loss": 0.3755,
"step": 7850
},
{
"epoch": 0.0011018350740738768,
"grad_norm": 0.328125,
"learning_rate": 0.0002999993154705338,
"loss": 0.3755,
"step": 7860
},
{
"epoch": 0.0011032368998678639,
"grad_norm": 0.60546875,
"learning_rate": 0.0002999993134730766,
"loss": 0.382,
"step": 7870
},
{
"epoch": 0.001104638725661851,
"grad_norm": 0.515625,
"learning_rate": 0.00029999931147270934,
"loss": 0.4672,
"step": 7880
},
{
"epoch": 0.0011060405514558382,
"grad_norm": 0.72265625,
"learning_rate": 0.0002999993094694321,
"loss": 0.3952,
"step": 7890
},
{
"epoch": 0.0011074423772498253,
"grad_norm": 0.95703125,
"learning_rate": 0.00029999930746324476,
"loss": 0.4959,
"step": 7900
},
{
"epoch": 0.0011088442030438123,
"grad_norm": 0.28125,
"learning_rate": 0.0002999993054541474,
"loss": 0.3773,
"step": 7910
},
{
"epoch": 0.0011102460288377994,
"grad_norm": 0.46875,
"learning_rate": 0.00029999930344214,
"loss": 0.4186,
"step": 7920
},
{
"epoch": 0.0011116478546317867,
"grad_norm": 0.6953125,
"learning_rate": 0.0002999993014272226,
"loss": 0.4753,
"step": 7930
},
{
"epoch": 0.0011130496804257737,
"grad_norm": 0.66796875,
"learning_rate": 0.00029999929940939513,
"loss": 0.5497,
"step": 7940
},
{
"epoch": 0.0011144515062197608,
"grad_norm": 0.6328125,
"learning_rate": 0.0002999992973886576,
"loss": 0.4491,
"step": 7950
},
{
"epoch": 0.001115853332013748,
"grad_norm": 0.80859375,
"learning_rate": 0.0002999992953650101,
"loss": 0.3838,
"step": 7960
},
{
"epoch": 0.0011172551578077351,
"grad_norm": 0.5546875,
"learning_rate": 0.0002999992933384525,
"loss": 0.4518,
"step": 7970
},
{
"epoch": 0.0011186569836017222,
"grad_norm": 0.8515625,
"learning_rate": 0.0002999992913089848,
"loss": 0.4592,
"step": 7980
},
{
"epoch": 0.0011200588093957093,
"grad_norm": 0.333984375,
"learning_rate": 0.0002999992892766072,
"loss": 0.438,
"step": 7990
},
{
"epoch": 0.0011214606351896965,
"grad_norm": 0.2314453125,
"learning_rate": 0.0002999992872413195,
"loss": 0.4245,
"step": 8000
},
{
"epoch": 0.0011214606351896965,
"eval_loss": 0.18062791228294373,
"eval_runtime": 112.1678,
"eval_samples_per_second": 203.65,
"eval_steps_per_second": 1.596,
"step": 8000
},
{
"epoch": 0.0011228624609836836,
"grad_norm": 0.85546875,
"learning_rate": 0.00029999928520312177,
"loss": 0.3692,
"step": 8010
},
{
"epoch": 0.0011242642867776707,
"grad_norm": 0.189453125,
"learning_rate": 0.0002999992831620139,
"loss": 0.4953,
"step": 8020
},
{
"epoch": 0.001125666112571658,
"grad_norm": 0.66015625,
"learning_rate": 0.00029999928111799614,
"loss": 0.4422,
"step": 8030
},
{
"epoch": 0.001127067938365645,
"grad_norm": 0.443359375,
"learning_rate": 0.0002999992790710683,
"loss": 0.428,
"step": 8040
},
{
"epoch": 0.001128469764159632,
"grad_norm": 0.96875,
"learning_rate": 0.0002999992770212304,
"loss": 0.4894,
"step": 8050
},
{
"epoch": 0.0011298715899536191,
"grad_norm": 0.421875,
"learning_rate": 0.00029999927496848246,
"loss": 0.4164,
"step": 8060
},
{
"epoch": 0.0011312734157476064,
"grad_norm": 0.384765625,
"learning_rate": 0.00029999927291282446,
"loss": 0.4902,
"step": 8070
},
{
"epoch": 0.0011326752415415935,
"grad_norm": 1.0390625,
"learning_rate": 0.00029999927085425646,
"loss": 0.4481,
"step": 8080
},
{
"epoch": 0.0011340770673355805,
"grad_norm": 1.140625,
"learning_rate": 0.0002999992687927784,
"loss": 0.3717,
"step": 8090
},
{
"epoch": 0.0011354788931295676,
"grad_norm": 0.345703125,
"learning_rate": 0.0002999992667283903,
"loss": 0.4978,
"step": 8100
},
{
"epoch": 0.0011368807189235549,
"grad_norm": 0.97265625,
"learning_rate": 0.00029999926466109215,
"loss": 0.4372,
"step": 8110
},
{
"epoch": 0.001138282544717542,
"grad_norm": 0.73828125,
"learning_rate": 0.000299999262590884,
"loss": 0.4048,
"step": 8120
},
{
"epoch": 0.001139684370511529,
"grad_norm": 0.73828125,
"learning_rate": 0.0002999992605177658,
"loss": 0.4937,
"step": 8130
},
{
"epoch": 0.0011410861963055163,
"grad_norm": 0.65625,
"learning_rate": 0.0002999992584417376,
"loss": 0.4527,
"step": 8140
},
{
"epoch": 0.0011424880220995033,
"grad_norm": 0.609375,
"learning_rate": 0.0002999992563627993,
"loss": 0.502,
"step": 8150
},
{
"epoch": 0.0011438898478934904,
"grad_norm": 0.50390625,
"learning_rate": 0.0002999992542809509,
"loss": 0.4664,
"step": 8160
},
{
"epoch": 0.0011452916736874774,
"grad_norm": 0.7734375,
"learning_rate": 0.0002999992521961926,
"loss": 0.5214,
"step": 8170
},
{
"epoch": 0.0011466934994814647,
"grad_norm": 0.5546875,
"learning_rate": 0.0002999992501085242,
"loss": 0.4809,
"step": 8180
},
{
"epoch": 0.0011480953252754518,
"grad_norm": 0.54296875,
"learning_rate": 0.00029999924801794577,
"loss": 0.4875,
"step": 8190
},
{
"epoch": 0.0011494971510694388,
"grad_norm": 0.73046875,
"learning_rate": 0.0002999992459244573,
"loss": 0.4272,
"step": 8200
},
{
"epoch": 0.001150898976863426,
"grad_norm": 0.6796875,
"learning_rate": 0.0002999992438280588,
"loss": 0.5558,
"step": 8210
},
{
"epoch": 0.0011523008026574132,
"grad_norm": 1.0234375,
"learning_rate": 0.0002999992417287502,
"loss": 0.3699,
"step": 8220
},
{
"epoch": 0.0011537026284514002,
"grad_norm": 0.90625,
"learning_rate": 0.00029999923962653163,
"loss": 0.4134,
"step": 8230
},
{
"epoch": 0.0011551044542453873,
"grad_norm": 0.78125,
"learning_rate": 0.000299999237521403,
"loss": 0.3791,
"step": 8240
},
{
"epoch": 0.0011565062800393746,
"grad_norm": 0.57421875,
"learning_rate": 0.0002999992354133643,
"loss": 0.3503,
"step": 8250
},
{
"epoch": 0.0011579081058333616,
"grad_norm": 0.62109375,
"learning_rate": 0.00029999923330241565,
"loss": 0.4115,
"step": 8260
},
{
"epoch": 0.0011593099316273487,
"grad_norm": 0.240234375,
"learning_rate": 0.00029999923118855686,
"loss": 0.3909,
"step": 8270
},
{
"epoch": 0.0011607117574213358,
"grad_norm": 0.177734375,
"learning_rate": 0.0002999992290717881,
"loss": 0.4405,
"step": 8280
},
{
"epoch": 0.001162113583215323,
"grad_norm": 1.046875,
"learning_rate": 0.0002999992269521093,
"loss": 0.4961,
"step": 8290
},
{
"epoch": 0.00116351540900931,
"grad_norm": 0.72265625,
"learning_rate": 0.0002999992248295204,
"loss": 0.3559,
"step": 8300
},
{
"epoch": 0.0011649172348032972,
"grad_norm": 0.494140625,
"learning_rate": 0.0002999992227040215,
"loss": 0.4841,
"step": 8310
},
{
"epoch": 0.0011663190605972844,
"grad_norm": 0.34375,
"learning_rate": 0.0002999992205756126,
"loss": 0.4471,
"step": 8320
},
{
"epoch": 0.0011677208863912715,
"grad_norm": 0.671875,
"learning_rate": 0.00029999921844429364,
"loss": 0.4465,
"step": 8330
},
{
"epoch": 0.0011691227121852586,
"grad_norm": 0.97265625,
"learning_rate": 0.00029999921631006465,
"loss": 0.4335,
"step": 8340
},
{
"epoch": 0.0011705245379792456,
"grad_norm": 0.478515625,
"learning_rate": 0.0002999992141729256,
"loss": 0.4393,
"step": 8350
},
{
"epoch": 0.0011719263637732329,
"grad_norm": 1.0859375,
"learning_rate": 0.0002999992120328765,
"loss": 0.451,
"step": 8360
},
{
"epoch": 0.00117332818956722,
"grad_norm": 0.62890625,
"learning_rate": 0.0002999992098899174,
"loss": 0.432,
"step": 8370
},
{
"epoch": 0.001174730015361207,
"grad_norm": 0.609375,
"learning_rate": 0.0002999992077440482,
"loss": 0.4606,
"step": 8380
},
{
"epoch": 0.001176131841155194,
"grad_norm": 0.578125,
"learning_rate": 0.00029999920559526907,
"loss": 0.5024,
"step": 8390
},
{
"epoch": 0.0011775336669491814,
"grad_norm": 0.2314453125,
"learning_rate": 0.0002999992034435798,
"loss": 0.3843,
"step": 8400
},
{
"epoch": 0.0011789354927431684,
"grad_norm": 0.361328125,
"learning_rate": 0.0002999992012889805,
"loss": 0.4505,
"step": 8410
},
{
"epoch": 0.0011803373185371555,
"grad_norm": 1.0546875,
"learning_rate": 0.0002999991991314712,
"loss": 0.5677,
"step": 8420
},
{
"epoch": 0.0011817391443311428,
"grad_norm": 0.78515625,
"learning_rate": 0.0002999991969710519,
"loss": 0.4781,
"step": 8430
},
{
"epoch": 0.0011831409701251298,
"grad_norm": 0.75390625,
"learning_rate": 0.00029999919480772254,
"loss": 0.4487,
"step": 8440
},
{
"epoch": 0.0011845427959191169,
"grad_norm": 0.478515625,
"learning_rate": 0.00029999919264148307,
"loss": 0.4665,
"step": 8450
},
{
"epoch": 0.001185944621713104,
"grad_norm": 0.984375,
"learning_rate": 0.00029999919047233366,
"loss": 0.5278,
"step": 8460
},
{
"epoch": 0.0011873464475070912,
"grad_norm": 0.953125,
"learning_rate": 0.00029999918830027415,
"loss": 0.4261,
"step": 8470
},
{
"epoch": 0.0011887482733010783,
"grad_norm": 0.26171875,
"learning_rate": 0.0002999991861253046,
"loss": 0.4043,
"step": 8480
},
{
"epoch": 0.0011901500990950653,
"grad_norm": 0.91796875,
"learning_rate": 0.00029999918394742507,
"loss": 0.4822,
"step": 8490
},
{
"epoch": 0.0011915519248890524,
"grad_norm": 0.75,
"learning_rate": 0.00029999918176663545,
"loss": 0.5023,
"step": 8500
},
{
"epoch": 0.0011915519248890524,
"eval_loss": 0.18091367185115814,
"eval_runtime": 112.0263,
"eval_samples_per_second": 203.907,
"eval_steps_per_second": 1.598,
"step": 8500
},
{
"epoch": 0.0011929537506830397,
"grad_norm": 0.2490234375,
"learning_rate": 0.00029999917958293583,
"loss": 0.4,
"step": 8510
},
{
"epoch": 0.0011943555764770267,
"grad_norm": 0.32421875,
"learning_rate": 0.0002999991773963261,
"loss": 0.3551,
"step": 8520
},
{
"epoch": 0.0011957574022710138,
"grad_norm": 0.84375,
"learning_rate": 0.00029999917520680643,
"loss": 0.3701,
"step": 8530
},
{
"epoch": 0.001197159228065001,
"grad_norm": 0.31640625,
"learning_rate": 0.00029999917301437665,
"loss": 0.4104,
"step": 8540
},
{
"epoch": 0.0011985610538589881,
"grad_norm": 0.2578125,
"learning_rate": 0.0002999991708190369,
"loss": 0.4813,
"step": 8550
},
{
"epoch": 0.0011999628796529752,
"grad_norm": 0.310546875,
"learning_rate": 0.00029999916862078705,
"loss": 0.3847,
"step": 8560
},
{
"epoch": 0.0012013647054469623,
"grad_norm": 0.6640625,
"learning_rate": 0.0002999991664196272,
"loss": 0.4201,
"step": 8570
},
{
"epoch": 0.0012027665312409495,
"grad_norm": 0.59375,
"learning_rate": 0.00029999916421555734,
"loss": 0.4336,
"step": 8580
},
{
"epoch": 0.0012041683570349366,
"grad_norm": 0.451171875,
"learning_rate": 0.0002999991620085774,
"loss": 0.5009,
"step": 8590
},
{
"epoch": 0.0012055701828289237,
"grad_norm": 0.443359375,
"learning_rate": 0.00029999915979868737,
"loss": 0.4635,
"step": 8600
},
{
"epoch": 0.001206972008622911,
"grad_norm": 0.28515625,
"learning_rate": 0.0002999991575858874,
"loss": 0.3898,
"step": 8610
},
{
"epoch": 0.001208373834416898,
"grad_norm": 0.26953125,
"learning_rate": 0.00029999915537017735,
"loss": 0.35,
"step": 8620
},
{
"epoch": 0.001209775660210885,
"grad_norm": 0.46484375,
"learning_rate": 0.00029999915315155726,
"loss": 0.4431,
"step": 8630
},
{
"epoch": 0.0012111774860048721,
"grad_norm": 0.7890625,
"learning_rate": 0.00029999915093002717,
"loss": 0.4535,
"step": 8640
},
{
"epoch": 0.0012125793117988594,
"grad_norm": 0.455078125,
"learning_rate": 0.00029999914870558703,
"loss": 0.3979,
"step": 8650
},
{
"epoch": 0.0012139811375928464,
"grad_norm": 0.83203125,
"learning_rate": 0.00029999914647823683,
"loss": 0.4376,
"step": 8660
},
{
"epoch": 0.0012153829633868335,
"grad_norm": 0.73046875,
"learning_rate": 0.0002999991442479766,
"loss": 0.482,
"step": 8670
},
{
"epoch": 0.0012167847891808206,
"grad_norm": 0.78515625,
"learning_rate": 0.00029999914201480634,
"loss": 0.4178,
"step": 8680
},
{
"epoch": 0.0012181866149748078,
"grad_norm": 0.71875,
"learning_rate": 0.00029999913977872604,
"loss": 0.4327,
"step": 8690
},
{
"epoch": 0.001219588440768795,
"grad_norm": 0.97265625,
"learning_rate": 0.0002999991375397357,
"loss": 0.4699,
"step": 8700
},
{
"epoch": 0.001220990266562782,
"grad_norm": 1.0078125,
"learning_rate": 0.00029999913529783534,
"loss": 0.5145,
"step": 8710
},
{
"epoch": 0.0012223920923567692,
"grad_norm": 0.5546875,
"learning_rate": 0.00029999913305302494,
"loss": 0.4242,
"step": 8720
},
{
"epoch": 0.0012237939181507563,
"grad_norm": 0.421875,
"learning_rate": 0.0002999991308053045,
"loss": 0.3744,
"step": 8730
},
{
"epoch": 0.0012251957439447434,
"grad_norm": 0.4375,
"learning_rate": 0.000299999128554674,
"loss": 0.4844,
"step": 8740
},
{
"epoch": 0.0012265975697387304,
"grad_norm": 0.57421875,
"learning_rate": 0.0002999991263011335,
"loss": 0.4545,
"step": 8750
},
{
"epoch": 0.0012279993955327177,
"grad_norm": 0.99609375,
"learning_rate": 0.00029999912404468296,
"loss": 0.4804,
"step": 8760
},
{
"epoch": 0.0012294012213267048,
"grad_norm": 0.875,
"learning_rate": 0.0002999991217853224,
"loss": 0.47,
"step": 8770
},
{
"epoch": 0.0012308030471206918,
"grad_norm": 0.99609375,
"learning_rate": 0.00029999911952305173,
"loss": 0.4163,
"step": 8780
},
{
"epoch": 0.0012322048729146789,
"grad_norm": 0.65234375,
"learning_rate": 0.0002999991172578711,
"loss": 0.5008,
"step": 8790
},
{
"epoch": 0.0012336066987086662,
"grad_norm": 1.0546875,
"learning_rate": 0.0002999991149897804,
"loss": 0.5043,
"step": 8800
},
{
"epoch": 0.0012350085245026532,
"grad_norm": 1.15625,
"learning_rate": 0.0002999991127187797,
"loss": 0.4966,
"step": 8810
},
{
"epoch": 0.0012364103502966403,
"grad_norm": 0.5859375,
"learning_rate": 0.0002999991104448689,
"loss": 0.4113,
"step": 8820
},
{
"epoch": 0.0012378121760906276,
"grad_norm": 0.76171875,
"learning_rate": 0.0002999991081680481,
"loss": 0.419,
"step": 8830
},
{
"epoch": 0.0012392140018846146,
"grad_norm": 0.408203125,
"learning_rate": 0.0002999991058883173,
"loss": 0.423,
"step": 8840
},
{
"epoch": 0.0012406158276786017,
"grad_norm": 0.33203125,
"learning_rate": 0.0002999991036056764,
"loss": 0.4298,
"step": 8850
},
{
"epoch": 0.0012420176534725887,
"grad_norm": 0.7578125,
"learning_rate": 0.00029999910132012553,
"loss": 0.4679,
"step": 8860
},
{
"epoch": 0.001243419479266576,
"grad_norm": 0.8359375,
"learning_rate": 0.00029999909903166455,
"loss": 0.4492,
"step": 8870
},
{
"epoch": 0.001244821305060563,
"grad_norm": 0.490234375,
"learning_rate": 0.00029999909674029363,
"loss": 0.5003,
"step": 8880
},
{
"epoch": 0.0012462231308545501,
"grad_norm": 0.29296875,
"learning_rate": 0.0002999990944460126,
"loss": 0.3791,
"step": 8890
},
{
"epoch": 0.0012476249566485374,
"grad_norm": 0.34765625,
"learning_rate": 0.0002999990921488215,
"loss": 0.4881,
"step": 8900
},
{
"epoch": 0.0012490267824425245,
"grad_norm": 0.8828125,
"learning_rate": 0.0002999990898487205,
"loss": 0.4312,
"step": 8910
},
{
"epoch": 0.0012504286082365115,
"grad_norm": 0.318359375,
"learning_rate": 0.00029999908754570936,
"loss": 0.4883,
"step": 8920
},
{
"epoch": 0.0012518304340304986,
"grad_norm": 0.42578125,
"learning_rate": 0.0002999990852397882,
"loss": 0.3525,
"step": 8930
},
{
"epoch": 0.0012532322598244859,
"grad_norm": 0.53125,
"learning_rate": 0.000299999082930957,
"loss": 0.5207,
"step": 8940
},
{
"epoch": 0.001254634085618473,
"grad_norm": 0.76171875,
"learning_rate": 0.0002999990806192158,
"loss": 0.3815,
"step": 8950
},
{
"epoch": 0.00125603591141246,
"grad_norm": 0.74609375,
"learning_rate": 0.00029999907830456456,
"loss": 0.4554,
"step": 8960
},
{
"epoch": 0.001257437737206447,
"grad_norm": 0.384765625,
"learning_rate": 0.00029999907598700327,
"loss": 0.4522,
"step": 8970
},
{
"epoch": 0.0012588395630004343,
"grad_norm": 0.609375,
"learning_rate": 0.0002999990736665319,
"loss": 0.4533,
"step": 8980
},
{
"epoch": 0.0012602413887944214,
"grad_norm": 0.462890625,
"learning_rate": 0.00029999907134315053,
"loss": 0.5037,
"step": 8990
},
{
"epoch": 0.0012616432145884085,
"grad_norm": 0.65625,
"learning_rate": 0.00029999906901685913,
"loss": 0.4848,
"step": 9000
},
{
"epoch": 0.0012616432145884085,
"eval_loss": 0.17965355515480042,
"eval_runtime": 113.876,
"eval_samples_per_second": 200.595,
"eval_steps_per_second": 1.572,
"step": 9000
},
{
"epoch": 0.0012630450403823957,
"grad_norm": 0.47265625,
"learning_rate": 0.00029999906668765774,
"loss": 0.4496,
"step": 9010
},
{
"epoch": 0.0012644468661763828,
"grad_norm": 0.63671875,
"learning_rate": 0.00029999906435554624,
"loss": 0.4478,
"step": 9020
},
{
"epoch": 0.0012658486919703699,
"grad_norm": 0.6796875,
"learning_rate": 0.00029999906202052474,
"loss": 0.4299,
"step": 9030
},
{
"epoch": 0.001267250517764357,
"grad_norm": 0.79296875,
"learning_rate": 0.00029999905968259324,
"loss": 0.5,
"step": 9040
},
{
"epoch": 0.0012686523435583442,
"grad_norm": 0.6171875,
"learning_rate": 0.00029999905734175164,
"loss": 0.4341,
"step": 9050
},
{
"epoch": 0.0012700541693523313,
"grad_norm": 0.87890625,
"learning_rate": 0.00029999905499800004,
"loss": 0.5121,
"step": 9060
},
{
"epoch": 0.0012714559951463183,
"grad_norm": 0.75,
"learning_rate": 0.00029999905265133843,
"loss": 0.423,
"step": 9070
},
{
"epoch": 0.0012728578209403054,
"grad_norm": 0.890625,
"learning_rate": 0.0002999990503017668,
"loss": 0.5157,
"step": 9080
},
{
"epoch": 0.0012742596467342927,
"grad_norm": 0.68359375,
"learning_rate": 0.000299999047949285,
"loss": 0.4593,
"step": 9090
},
{
"epoch": 0.0012756614725282797,
"grad_norm": 0.8046875,
"learning_rate": 0.0002999990455938933,
"loss": 0.4342,
"step": 9100
},
{
"epoch": 0.0012770632983222668,
"grad_norm": 0.8828125,
"learning_rate": 0.00029999904323559155,
"loss": 0.4865,
"step": 9110
},
{
"epoch": 0.001278465124116254,
"grad_norm": 0.255859375,
"learning_rate": 0.00029999904087437974,
"loss": 0.448,
"step": 9120
},
{
"epoch": 0.0012798669499102411,
"grad_norm": 1.03125,
"learning_rate": 0.0002999990385102579,
"loss": 0.4956,
"step": 9130
},
{
"epoch": 0.0012812687757042282,
"grad_norm": 0.6328125,
"learning_rate": 0.00029999903614322596,
"loss": 0.4379,
"step": 9140
},
{
"epoch": 0.0012826706014982152,
"grad_norm": 0.392578125,
"learning_rate": 0.0002999990337732841,
"loss": 0.5302,
"step": 9150
},
{
"epoch": 0.0012840724272922025,
"grad_norm": 0.7578125,
"learning_rate": 0.0002999990314004322,
"loss": 0.5031,
"step": 9160
},
{
"epoch": 0.0012854742530861896,
"grad_norm": 0.58203125,
"learning_rate": 0.00029999902902467016,
"loss": 0.3132,
"step": 9170
},
{
"epoch": 0.0012868760788801766,
"grad_norm": 0.72265625,
"learning_rate": 0.00029999902664599814,
"loss": 0.3933,
"step": 9180
},
{
"epoch": 0.001288277904674164,
"grad_norm": 0.296875,
"learning_rate": 0.0002999990242644161,
"loss": 0.4043,
"step": 9190
},
{
"epoch": 0.001289679730468151,
"grad_norm": 0.5859375,
"learning_rate": 0.00029999902187992405,
"loss": 0.5478,
"step": 9200
},
{
"epoch": 0.001291081556262138,
"grad_norm": 0.26171875,
"learning_rate": 0.0002999990194925219,
"loss": 0.495,
"step": 9210
},
{
"epoch": 0.001292483382056125,
"grad_norm": 0.345703125,
"learning_rate": 0.00029999901710220974,
"loss": 0.5168,
"step": 9220
},
{
"epoch": 0.0012938852078501124,
"grad_norm": 0.310546875,
"learning_rate": 0.00029999901470898757,
"loss": 0.3826,
"step": 9230
},
{
"epoch": 0.0012952870336440994,
"grad_norm": 0.470703125,
"learning_rate": 0.0002999990123128554,
"loss": 0.4363,
"step": 9240
},
{
"epoch": 0.0012966888594380865,
"grad_norm": 0.6171875,
"learning_rate": 0.0002999990099138131,
"loss": 0.4175,
"step": 9250
},
{
"epoch": 0.0012980906852320736,
"grad_norm": 0.34765625,
"learning_rate": 0.00029999900751186083,
"loss": 0.3774,
"step": 9260
},
{
"epoch": 0.0012994925110260608,
"grad_norm": 0.9140625,
"learning_rate": 0.00029999900510699855,
"loss": 0.4917,
"step": 9270
},
{
"epoch": 0.001300894336820048,
"grad_norm": 0.79296875,
"learning_rate": 0.00029999900269922616,
"loss": 0.5462,
"step": 9280
},
{
"epoch": 0.001302296162614035,
"grad_norm": 0.35546875,
"learning_rate": 0.0002999990002885438,
"loss": 0.344,
"step": 9290
},
{
"epoch": 0.0013036979884080222,
"grad_norm": 0.59765625,
"learning_rate": 0.00029999899787495134,
"loss": 0.499,
"step": 9300
},
{
"epoch": 0.0013050998142020093,
"grad_norm": 1.0703125,
"learning_rate": 0.0002999989954584489,
"loss": 0.4163,
"step": 9310
},
{
"epoch": 0.0013065016399959964,
"grad_norm": 0.296875,
"learning_rate": 0.0002999989930390364,
"loss": 0.4647,
"step": 9320
},
{
"epoch": 0.0013079034657899834,
"grad_norm": 0.44921875,
"learning_rate": 0.00029999899061671387,
"loss": 0.4569,
"step": 9330
},
{
"epoch": 0.0013093052915839707,
"grad_norm": 0.150390625,
"learning_rate": 0.00029999898819148133,
"loss": 0.4494,
"step": 9340
},
{
"epoch": 0.0013107071173779578,
"grad_norm": 0.66796875,
"learning_rate": 0.0002999989857633388,
"loss": 0.4393,
"step": 9350
},
{
"epoch": 0.0013121089431719448,
"grad_norm": 0.703125,
"learning_rate": 0.00029999898333228615,
"loss": 0.5231,
"step": 9360
},
{
"epoch": 0.0013135107689659319,
"grad_norm": 0.60546875,
"learning_rate": 0.0002999989808983235,
"loss": 0.3771,
"step": 9370
},
{
"epoch": 0.0013149125947599192,
"grad_norm": 1.1171875,
"learning_rate": 0.0002999989784614508,
"loss": 0.5389,
"step": 9380
},
{
"epoch": 0.0013163144205539062,
"grad_norm": 0.6484375,
"learning_rate": 0.0002999989760216681,
"loss": 0.4195,
"step": 9390
},
{
"epoch": 0.0013177162463478933,
"grad_norm": 0.283203125,
"learning_rate": 0.00029999897357897536,
"loss": 0.4314,
"step": 9400
},
{
"epoch": 0.0013191180721418806,
"grad_norm": 1.15625,
"learning_rate": 0.00029999897113337255,
"loss": 0.4837,
"step": 9410
},
{
"epoch": 0.0013205198979358676,
"grad_norm": 0.4609375,
"learning_rate": 0.00029999896868485975,
"loss": 0.4618,
"step": 9420
},
{
"epoch": 0.0013219217237298547,
"grad_norm": 1.171875,
"learning_rate": 0.0002999989662334369,
"loss": 0.4941,
"step": 9430
},
{
"epoch": 0.0013233235495238417,
"grad_norm": 0.75390625,
"learning_rate": 0.000299998963779104,
"loss": 0.4681,
"step": 9440
},
{
"epoch": 0.001324725375317829,
"grad_norm": 0.71875,
"learning_rate": 0.0002999989613218611,
"loss": 0.4324,
"step": 9450
},
{
"epoch": 0.001326127201111816,
"grad_norm": 0.85546875,
"learning_rate": 0.0002999989588617082,
"loss": 0.4494,
"step": 9460
},
{
"epoch": 0.0013275290269058031,
"grad_norm": 0.74609375,
"learning_rate": 0.00029999895639864517,
"loss": 0.4027,
"step": 9470
},
{
"epoch": 0.0013289308526997904,
"grad_norm": 0.6796875,
"learning_rate": 0.00029999895393267216,
"loss": 0.4776,
"step": 9480
},
{
"epoch": 0.0013303326784937775,
"grad_norm": 0.51171875,
"learning_rate": 0.0002999989514637891,
"loss": 0.4024,
"step": 9490
},
{
"epoch": 0.0013317345042877645,
"grad_norm": 0.91015625,
"learning_rate": 0.0002999989489919961,
"loss": 0.405,
"step": 9500
},
{
"epoch": 0.0013317345042877645,
"eval_loss": 0.1779126524925232,
"eval_runtime": 112.2872,
"eval_samples_per_second": 203.434,
"eval_steps_per_second": 1.594,
"step": 9500
},
{
"epoch": 0.0013331363300817516,
"grad_norm": 0.380859375,
"learning_rate": 0.000299998946517293,
"loss": 0.4613,
"step": 9510
},
{
"epoch": 0.0013345381558757389,
"grad_norm": 0.7890625,
"learning_rate": 0.0002999989440396798,
"loss": 0.4131,
"step": 9520
},
{
"epoch": 0.001335939981669726,
"grad_norm": 0.609375,
"learning_rate": 0.00029999894155915665,
"loss": 0.4716,
"step": 9530
},
{
"epoch": 0.001337341807463713,
"grad_norm": 0.234375,
"learning_rate": 0.00029999893907572343,
"loss": 0.3789,
"step": 9540
},
{
"epoch": 0.0013387436332577,
"grad_norm": 0.5546875,
"learning_rate": 0.0002999989365893802,
"loss": 0.4503,
"step": 9550
},
{
"epoch": 0.0013401454590516873,
"grad_norm": 0.44921875,
"learning_rate": 0.00029999893410012694,
"loss": 0.3946,
"step": 9560
},
{
"epoch": 0.0013415472848456744,
"grad_norm": 0.3359375,
"learning_rate": 0.0002999989316079636,
"loss": 0.3684,
"step": 9570
},
{
"epoch": 0.0013429491106396615,
"grad_norm": 0.64453125,
"learning_rate": 0.0002999989291128903,
"loss": 0.4323,
"step": 9580
},
{
"epoch": 0.0013443509364336487,
"grad_norm": 0.3359375,
"learning_rate": 0.0002999989266149069,
"loss": 0.403,
"step": 9590
},
{
"epoch": 0.0013457527622276358,
"grad_norm": 1.40625,
"learning_rate": 0.00029999892411401355,
"loss": 0.4677,
"step": 9600
},
{
"epoch": 0.0013471545880216229,
"grad_norm": 0.5390625,
"learning_rate": 0.00029999892161021013,
"loss": 0.4505,
"step": 9610
},
{
"epoch": 0.00134855641381561,
"grad_norm": 0.625,
"learning_rate": 0.00029999891910349665,
"loss": 0.3674,
"step": 9620
},
{
"epoch": 0.0013499582396095972,
"grad_norm": 0.6796875,
"learning_rate": 0.00029999891659387317,
"loss": 0.4835,
"step": 9630
},
{
"epoch": 0.0013513600654035843,
"grad_norm": 0.431640625,
"learning_rate": 0.00029999891408133964,
"loss": 0.4168,
"step": 9640
},
{
"epoch": 0.0013527618911975713,
"grad_norm": 0.45703125,
"learning_rate": 0.00029999891156589606,
"loss": 0.4533,
"step": 9650
},
{
"epoch": 0.0013541637169915584,
"grad_norm": 0.75390625,
"learning_rate": 0.0002999989090475425,
"loss": 0.4661,
"step": 9660
},
{
"epoch": 0.0013555655427855457,
"grad_norm": 0.73046875,
"learning_rate": 0.00029999890652627884,
"loss": 0.5244,
"step": 9670
},
{
"epoch": 0.0013569673685795327,
"grad_norm": 0.5234375,
"learning_rate": 0.0002999989040021052,
"loss": 0.4458,
"step": 9680
},
{
"epoch": 0.0013583691943735198,
"grad_norm": 0.65234375,
"learning_rate": 0.0002999989014750215,
"loss": 0.3922,
"step": 9690
},
{
"epoch": 0.001359771020167507,
"grad_norm": 0.404296875,
"learning_rate": 0.0002999988989450278,
"loss": 0.4443,
"step": 9700
},
{
"epoch": 0.0013611728459614941,
"grad_norm": 0.5703125,
"learning_rate": 0.00029999889641212405,
"loss": 0.3954,
"step": 9710
},
{
"epoch": 0.0013625746717554812,
"grad_norm": 0.32421875,
"learning_rate": 0.00029999889387631026,
"loss": 0.4527,
"step": 9720
},
{
"epoch": 0.0013639764975494682,
"grad_norm": 0.2294921875,
"learning_rate": 0.0002999988913375865,
"loss": 0.3806,
"step": 9730
},
{
"epoch": 0.0013653783233434555,
"grad_norm": 0.5390625,
"learning_rate": 0.0002999988887959527,
"loss": 0.46,
"step": 9740
},
{
"epoch": 0.0013667801491374426,
"grad_norm": 0.62890625,
"learning_rate": 0.00029999888625140874,
"loss": 0.4645,
"step": 9750
},
{
"epoch": 0.0013681819749314296,
"grad_norm": 0.5,
"learning_rate": 0.0002999988837039549,
"loss": 0.3977,
"step": 9760
},
{
"epoch": 0.001369583800725417,
"grad_norm": 0.70703125,
"learning_rate": 0.0002999988811535909,
"loss": 0.4475,
"step": 9770
},
{
"epoch": 0.001370985626519404,
"grad_norm": 0.73828125,
"learning_rate": 0.00029999887860031695,
"loss": 0.4696,
"step": 9780
},
{
"epoch": 0.001372387452313391,
"grad_norm": 0.796875,
"learning_rate": 0.000299998876044133,
"loss": 0.4126,
"step": 9790
},
{
"epoch": 0.001373789278107378,
"grad_norm": 0.64453125,
"learning_rate": 0.0002999988734850389,
"loss": 0.4177,
"step": 9800
},
{
"epoch": 0.0013751911039013654,
"grad_norm": 0.70703125,
"learning_rate": 0.00029999887092303486,
"loss": 0.4654,
"step": 9810
},
{
"epoch": 0.0013765929296953524,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999988683581208,
"loss": 0.4431,
"step": 9820
},
{
"epoch": 0.0013779947554893395,
"grad_norm": 0.80859375,
"learning_rate": 0.00029999886579029666,
"loss": 0.4776,
"step": 9830
},
{
"epoch": 0.0013793965812833266,
"grad_norm": 0.6015625,
"learning_rate": 0.0002999988632195625,
"loss": 0.507,
"step": 9840
},
{
"epoch": 0.0013807984070773138,
"grad_norm": 0.359375,
"learning_rate": 0.00029999886064591835,
"loss": 0.496,
"step": 9850
},
{
"epoch": 0.001382200232871301,
"grad_norm": 0.5234375,
"learning_rate": 0.00029999885806936415,
"loss": 0.5075,
"step": 9860
},
{
"epoch": 0.001383602058665288,
"grad_norm": 0.328125,
"learning_rate": 0.0002999988554898999,
"loss": 0.3726,
"step": 9870
},
{
"epoch": 0.0013850038844592752,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999885290752564,
"loss": 0.4425,
"step": 9880
},
{
"epoch": 0.0013864057102532623,
"grad_norm": 0.435546875,
"learning_rate": 0.0002999988503222413,
"loss": 0.4121,
"step": 9890
},
{
"epoch": 0.0013878075360472494,
"grad_norm": 0.66015625,
"learning_rate": 0.00029999884773404697,
"loss": 0.3684,
"step": 9900
},
{
"epoch": 0.0013892093618412364,
"grad_norm": 0.49609375,
"learning_rate": 0.0002999988451429426,
"loss": 0.3725,
"step": 9910
},
{
"epoch": 0.0013906111876352237,
"grad_norm": 0.419921875,
"learning_rate": 0.00029999884254892825,
"loss": 0.469,
"step": 9920
},
{
"epoch": 0.0013920130134292108,
"grad_norm": 0.8515625,
"learning_rate": 0.00029999883995200383,
"loss": 0.4056,
"step": 9930
},
{
"epoch": 0.0013934148392231978,
"grad_norm": 0.3828125,
"learning_rate": 0.00029999883735216937,
"loss": 0.415,
"step": 9940
},
{
"epoch": 0.0013948166650171849,
"grad_norm": 0.5078125,
"learning_rate": 0.00029999883474942485,
"loss": 0.4442,
"step": 9950
},
{
"epoch": 0.0013962184908111722,
"grad_norm": 0.1845703125,
"learning_rate": 0.00029999883214377034,
"loss": 0.4451,
"step": 9960
},
{
"epoch": 0.0013976203166051592,
"grad_norm": 0.25390625,
"learning_rate": 0.0002999988295352058,
"loss": 0.4303,
"step": 9970
},
{
"epoch": 0.0013990221423991463,
"grad_norm": 0.99609375,
"learning_rate": 0.00029999882692373125,
"loss": 0.4909,
"step": 9980
},
{
"epoch": 0.0014004239681931336,
"grad_norm": 0.7734375,
"learning_rate": 0.00029999882430934663,
"loss": 0.3695,
"step": 9990
},
{
"epoch": 0.0014018257939871206,
"grad_norm": 0.9921875,
"learning_rate": 0.000299998821692052,
"loss": 0.489,
"step": 10000
},
{
"epoch": 0.0014018257939871206,
"eval_loss": 0.17730337381362915,
"eval_runtime": 112.2399,
"eval_samples_per_second": 203.519,
"eval_steps_per_second": 1.595,
"step": 10000
},
{
"epoch": 0.0014032276197811077,
"grad_norm": 0.88671875,
"learning_rate": 0.0002999988190718473,
"loss": 0.4894,
"step": 10010
},
{
"epoch": 0.0014046294455750947,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999988164487327,
"loss": 0.427,
"step": 10020
},
{
"epoch": 0.001406031271369082,
"grad_norm": 0.609375,
"learning_rate": 0.0002999988138227079,
"loss": 0.404,
"step": 10030
},
{
"epoch": 0.001407433097163069,
"grad_norm": 0.6640625,
"learning_rate": 0.0002999988111937732,
"loss": 0.3942,
"step": 10040
},
{
"epoch": 0.0014088349229570561,
"grad_norm": 0.79296875,
"learning_rate": 0.00029999880856192835,
"loss": 0.3519,
"step": 10050
},
{
"epoch": 0.0014102367487510434,
"grad_norm": 0.259765625,
"learning_rate": 0.00029999880592717357,
"loss": 0.4191,
"step": 10060
},
{
"epoch": 0.0014116385745450305,
"grad_norm": 0.7578125,
"learning_rate": 0.0002999988032895087,
"loss": 0.4562,
"step": 10070
},
{
"epoch": 0.0014130404003390175,
"grad_norm": 0.9765625,
"learning_rate": 0.00029999880064893387,
"loss": 0.4004,
"step": 10080
},
{
"epoch": 0.0014144422261330046,
"grad_norm": 0.796875,
"learning_rate": 0.00029999879800544894,
"loss": 0.4163,
"step": 10090
},
{
"epoch": 0.0014158440519269919,
"grad_norm": 0.30859375,
"learning_rate": 0.000299998795359054,
"loss": 0.292,
"step": 10100
},
{
"epoch": 0.001417245877720979,
"grad_norm": 0.263671875,
"learning_rate": 0.000299998792709749,
"loss": 0.3318,
"step": 10110
},
{
"epoch": 0.001418647703514966,
"grad_norm": 0.69921875,
"learning_rate": 0.00029999879005753404,
"loss": 0.4539,
"step": 10120
},
{
"epoch": 0.001420049529308953,
"grad_norm": 0.361328125,
"learning_rate": 0.00029999878740240906,
"loss": 0.3881,
"step": 10130
},
{
"epoch": 0.0014214513551029403,
"grad_norm": 0.66796875,
"learning_rate": 0.00029999878474437397,
"loss": 0.4689,
"step": 10140
},
{
"epoch": 0.0014228531808969274,
"grad_norm": 0.5625,
"learning_rate": 0.00029999878208342894,
"loss": 0.4459,
"step": 10150
},
{
"epoch": 0.0014242550066909145,
"grad_norm": 0.73828125,
"learning_rate": 0.0002999987794195738,
"loss": 0.3846,
"step": 10160
},
{
"epoch": 0.0014256568324849017,
"grad_norm": 0.8203125,
"learning_rate": 0.0002999987767528086,
"loss": 0.4947,
"step": 10170
},
{
"epoch": 0.0014270586582788888,
"grad_norm": 0.79296875,
"learning_rate": 0.00029999877408313347,
"loss": 0.5135,
"step": 10180
},
{
"epoch": 0.0014284604840728759,
"grad_norm": 0.796875,
"learning_rate": 0.0002999987714105483,
"loss": 0.4745,
"step": 10190
},
{
"epoch": 0.001429862309866863,
"grad_norm": 0.88671875,
"learning_rate": 0.00029999876873505304,
"loss": 0.4396,
"step": 10200
},
{
"epoch": 0.0014312641356608502,
"grad_norm": 1.0,
"learning_rate": 0.0002999987660566478,
"loss": 0.4613,
"step": 10210
},
{
"epoch": 0.0014326659614548373,
"grad_norm": 1.015625,
"learning_rate": 0.0002999987633753325,
"loss": 0.4413,
"step": 10220
},
{
"epoch": 0.0014340677872488243,
"grad_norm": 0.609375,
"learning_rate": 0.0002999987606911072,
"loss": 0.3807,
"step": 10230
},
{
"epoch": 0.0014354696130428114,
"grad_norm": 0.275390625,
"learning_rate": 0.00029999875800397187,
"loss": 0.3948,
"step": 10240
},
{
"epoch": 0.0014368714388367987,
"grad_norm": 0.2197265625,
"learning_rate": 0.00029999875531392647,
"loss": 0.354,
"step": 10250
},
{
"epoch": 0.0014382732646307857,
"grad_norm": 0.6640625,
"learning_rate": 0.00029999875262097113,
"loss": 0.4706,
"step": 10260
},
{
"epoch": 0.0014396750904247728,
"grad_norm": 0.39453125,
"learning_rate": 0.0002999987499251057,
"loss": 0.3163,
"step": 10270
},
{
"epoch": 0.00144107691621876,
"grad_norm": 0.65234375,
"learning_rate": 0.00029999874722633023,
"loss": 0.3933,
"step": 10280
},
{
"epoch": 0.0014424787420127471,
"grad_norm": 0.431640625,
"learning_rate": 0.0002999987445246448,
"loss": 0.3804,
"step": 10290
},
{
"epoch": 0.0014438805678067342,
"grad_norm": 0.70703125,
"learning_rate": 0.00029999874182004923,
"loss": 0.4831,
"step": 10300
},
{
"epoch": 0.0014452823936007212,
"grad_norm": 0.62109375,
"learning_rate": 0.0002999987391125437,
"loss": 0.3895,
"step": 10310
},
{
"epoch": 0.0014466842193947085,
"grad_norm": 0.298828125,
"learning_rate": 0.00029999873640212813,
"loss": 0.4482,
"step": 10320
},
{
"epoch": 0.0014480860451886956,
"grad_norm": 0.26953125,
"learning_rate": 0.0002999987336888025,
"loss": 0.4603,
"step": 10330
},
{
"epoch": 0.0014494878709826826,
"grad_norm": 0.44140625,
"learning_rate": 0.0002999987309725669,
"loss": 0.4359,
"step": 10340
},
{
"epoch": 0.00145088969677667,
"grad_norm": 0.609375,
"learning_rate": 0.00029999872825342127,
"loss": 0.4599,
"step": 10350
},
{
"epoch": 0.001452291522570657,
"grad_norm": 0.5625,
"learning_rate": 0.00029999872553136556,
"loss": 0.3849,
"step": 10360
},
{
"epoch": 0.001453693348364644,
"grad_norm": 0.2578125,
"learning_rate": 0.00029999872280639985,
"loss": 0.3681,
"step": 10370
},
{
"epoch": 0.001455095174158631,
"grad_norm": 0.431640625,
"learning_rate": 0.0002999987200785241,
"loss": 0.3418,
"step": 10380
},
{
"epoch": 0.0014564969999526184,
"grad_norm": 0.5078125,
"learning_rate": 0.0002999987173477384,
"loss": 0.4339,
"step": 10390
},
{
"epoch": 0.0014578988257466054,
"grad_norm": 0.435546875,
"learning_rate": 0.0002999987146140426,
"loss": 0.3566,
"step": 10400
},
{
"epoch": 0.0014593006515405925,
"grad_norm": 1.234375,
"learning_rate": 0.00029999871187743677,
"loss": 0.4247,
"step": 10410
},
{
"epoch": 0.0014607024773345796,
"grad_norm": 0.96875,
"learning_rate": 0.00029999870913792085,
"loss": 0.5284,
"step": 10420
},
{
"epoch": 0.0014621043031285668,
"grad_norm": 0.59765625,
"learning_rate": 0.00029999870639549505,
"loss": 0.4373,
"step": 10430
},
{
"epoch": 0.0014635061289225539,
"grad_norm": 0.48828125,
"learning_rate": 0.0002999987036501591,
"loss": 0.3596,
"step": 10440
},
{
"epoch": 0.001464907954716541,
"grad_norm": 0.236328125,
"learning_rate": 0.0002999987009019132,
"loss": 0.4211,
"step": 10450
},
{
"epoch": 0.0014663097805105282,
"grad_norm": 0.546875,
"learning_rate": 0.00029999869815075725,
"loss": 0.487,
"step": 10460
},
{
"epoch": 0.0014677116063045153,
"grad_norm": 0.79296875,
"learning_rate": 0.00029999869539669124,
"loss": 0.4045,
"step": 10470
},
{
"epoch": 0.0014691134320985024,
"grad_norm": 0.380859375,
"learning_rate": 0.0002999986926397152,
"loss": 0.4048,
"step": 10480
},
{
"epoch": 0.0014705152578924894,
"grad_norm": 0.6328125,
"learning_rate": 0.00029999868987982915,
"loss": 0.4103,
"step": 10490
},
{
"epoch": 0.0014719170836864767,
"grad_norm": 0.5703125,
"learning_rate": 0.0002999986871170331,
"loss": 0.3853,
"step": 10500
},
{
"epoch": 0.0014719170836864767,
"eval_loss": 0.1777743548154831,
"eval_runtime": 113.9971,
"eval_samples_per_second": 200.382,
"eval_steps_per_second": 1.57,
"step": 10500
},
{
"epoch": 0.0014733189094804637,
"grad_norm": 0.69921875,
"learning_rate": 0.000299998684351327,
"loss": 0.4171,
"step": 10510
},
{
"epoch": 0.0014747207352744508,
"grad_norm": 0.361328125,
"learning_rate": 0.0002999986815827109,
"loss": 0.4019,
"step": 10520
},
{
"epoch": 0.0014761225610684379,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999986788111848,
"loss": 0.5203,
"step": 10530
},
{
"epoch": 0.0014775243868624251,
"grad_norm": 0.640625,
"learning_rate": 0.00029999867603674855,
"loss": 0.4741,
"step": 10540
},
{
"epoch": 0.0014789262126564122,
"grad_norm": 0.5703125,
"learning_rate": 0.0002999986732594024,
"loss": 0.4593,
"step": 10550
},
{
"epoch": 0.0014803280384503993,
"grad_norm": 0.66796875,
"learning_rate": 0.0002999986704791461,
"loss": 0.45,
"step": 10560
},
{
"epoch": 0.0014817298642443865,
"grad_norm": 0.54296875,
"learning_rate": 0.0002999986676959799,
"loss": 0.4173,
"step": 10570
},
{
"epoch": 0.0014831316900383736,
"grad_norm": 0.8515625,
"learning_rate": 0.00029999866490990355,
"loss": 0.4825,
"step": 10580
},
{
"epoch": 0.0014845335158323607,
"grad_norm": 0.71875,
"learning_rate": 0.0002999986621209173,
"loss": 0.4325,
"step": 10590
},
{
"epoch": 0.0014859353416263477,
"grad_norm": 0.65234375,
"learning_rate": 0.00029999865932902096,
"loss": 0.3705,
"step": 10600
},
{
"epoch": 0.001487337167420335,
"grad_norm": 0.703125,
"learning_rate": 0.0002999986565342146,
"loss": 0.4873,
"step": 10610
},
{
"epoch": 0.001488738993214322,
"grad_norm": 0.765625,
"learning_rate": 0.00029999865373649815,
"loss": 0.4666,
"step": 10620
},
{
"epoch": 0.0014901408190083091,
"grad_norm": 0.2177734375,
"learning_rate": 0.00029999865093587177,
"loss": 0.3025,
"step": 10630
},
{
"epoch": 0.0014915426448022964,
"grad_norm": 0.49609375,
"learning_rate": 0.0002999986481323353,
"loss": 0.4764,
"step": 10640
},
{
"epoch": 0.0014929444705962835,
"grad_norm": 1.0234375,
"learning_rate": 0.0002999986453258888,
"loss": 0.4676,
"step": 10650
},
{
"epoch": 0.0014943462963902705,
"grad_norm": 0.26171875,
"learning_rate": 0.0002999986425165323,
"loss": 0.4282,
"step": 10660
},
{
"epoch": 0.0014957481221842576,
"grad_norm": 0.3046875,
"learning_rate": 0.0002999986397042658,
"loss": 0.3724,
"step": 10670
},
{
"epoch": 0.0014971499479782449,
"grad_norm": 0.423828125,
"learning_rate": 0.0002999986368890892,
"loss": 0.3169,
"step": 10680
},
{
"epoch": 0.001498551773772232,
"grad_norm": 0.33984375,
"learning_rate": 0.0002999986340710027,
"loss": 0.3254,
"step": 10690
},
{
"epoch": 0.001499953599566219,
"grad_norm": 0.2197265625,
"learning_rate": 0.00029999863125000604,
"loss": 0.4022,
"step": 10700
},
{
"epoch": 0.001501355425360206,
"grad_norm": 0.81640625,
"learning_rate": 0.00029999862842609946,
"loss": 0.5181,
"step": 10710
},
{
"epoch": 0.0015027572511541933,
"grad_norm": 0.7890625,
"learning_rate": 0.00029999862559928277,
"loss": 0.5158,
"step": 10720
},
{
"epoch": 0.0015041590769481804,
"grad_norm": 0.81640625,
"learning_rate": 0.0002999986227695561,
"loss": 0.3475,
"step": 10730
},
{
"epoch": 0.0015055609027421674,
"grad_norm": 0.71875,
"learning_rate": 0.0002999986199369194,
"loss": 0.4349,
"step": 10740
},
{
"epoch": 0.0015069627285361547,
"grad_norm": 0.63671875,
"learning_rate": 0.0002999986171013726,
"loss": 0.4544,
"step": 10750
},
{
"epoch": 0.0015083645543301418,
"grad_norm": 1.2109375,
"learning_rate": 0.0002999986142629159,
"loss": 0.5036,
"step": 10760
},
{
"epoch": 0.0015097663801241288,
"grad_norm": 0.5,
"learning_rate": 0.0002999986114215491,
"loss": 0.4059,
"step": 10770
},
{
"epoch": 0.001511168205918116,
"grad_norm": 0.341796875,
"learning_rate": 0.0002999986085772723,
"loss": 0.3344,
"step": 10780
},
{
"epoch": 0.0015125700317121032,
"grad_norm": 0.75,
"learning_rate": 0.00029999860573008544,
"loss": 0.486,
"step": 10790
},
{
"epoch": 0.0015139718575060902,
"grad_norm": 0.25,
"learning_rate": 0.00029999860287998855,
"loss": 0.347,
"step": 10800
},
{
"epoch": 0.0015153736833000773,
"grad_norm": 0.4453125,
"learning_rate": 0.0002999986000269817,
"loss": 0.3681,
"step": 10810
},
{
"epoch": 0.0015167755090940644,
"grad_norm": 0.8671875,
"learning_rate": 0.00029999859717106476,
"loss": 0.4981,
"step": 10820
},
{
"epoch": 0.0015181773348880516,
"grad_norm": 0.69140625,
"learning_rate": 0.0002999985943122379,
"loss": 0.4436,
"step": 10830
},
{
"epoch": 0.0015195791606820387,
"grad_norm": 1.0859375,
"learning_rate": 0.0002999985914505009,
"loss": 0.4291,
"step": 10840
},
{
"epoch": 0.0015209809864760258,
"grad_norm": 0.71875,
"learning_rate": 0.0002999985885858539,
"loss": 0.4227,
"step": 10850
},
{
"epoch": 0.001522382812270013,
"grad_norm": 0.7734375,
"learning_rate": 0.00029999858571829683,
"loss": 0.4109,
"step": 10860
},
{
"epoch": 0.001523784638064,
"grad_norm": 0.5859375,
"learning_rate": 0.00029999858284782984,
"loss": 0.487,
"step": 10870
},
{
"epoch": 0.0015251864638579872,
"grad_norm": 0.6875,
"learning_rate": 0.00029999857997445274,
"loss": 0.4839,
"step": 10880
},
{
"epoch": 0.0015265882896519742,
"grad_norm": 0.7109375,
"learning_rate": 0.00029999857709816564,
"loss": 0.4406,
"step": 10890
},
{
"epoch": 0.0015279901154459615,
"grad_norm": 0.52734375,
"learning_rate": 0.00029999857421896854,
"loss": 0.4348,
"step": 10900
},
{
"epoch": 0.0015293919412399486,
"grad_norm": 0.6328125,
"learning_rate": 0.0002999985713368614,
"loss": 0.4313,
"step": 10910
},
{
"epoch": 0.0015307937670339356,
"grad_norm": 0.92578125,
"learning_rate": 0.00029999856845184424,
"loss": 0.4236,
"step": 10920
},
{
"epoch": 0.001532195592827923,
"grad_norm": 0.88671875,
"learning_rate": 0.00029999856556391704,
"loss": 0.4851,
"step": 10930
},
{
"epoch": 0.00153359741862191,
"grad_norm": 0.95703125,
"learning_rate": 0.00029999856267307984,
"loss": 0.3592,
"step": 10940
},
{
"epoch": 0.001534999244415897,
"grad_norm": 0.462890625,
"learning_rate": 0.00029999855977933253,
"loss": 0.4506,
"step": 10950
},
{
"epoch": 0.001536401070209884,
"grad_norm": 0.4375,
"learning_rate": 0.0002999985568826753,
"loss": 0.467,
"step": 10960
},
{
"epoch": 0.0015378028960038714,
"grad_norm": 0.9765625,
"learning_rate": 0.00029999855398310803,
"loss": 0.4379,
"step": 10970
},
{
"epoch": 0.0015392047217978584,
"grad_norm": 0.326171875,
"learning_rate": 0.00029999855108063067,
"loss": 0.3838,
"step": 10980
},
{
"epoch": 0.0015406065475918455,
"grad_norm": 0.8203125,
"learning_rate": 0.0002999985481752433,
"loss": 0.4903,
"step": 10990
},
{
"epoch": 0.0015420083733858325,
"grad_norm": 0.8515625,
"learning_rate": 0.00029999854526694596,
"loss": 0.4298,
"step": 11000
},
{
"epoch": 0.0015420083733858325,
"eval_loss": 0.1755325049161911,
"eval_runtime": 112.2725,
"eval_samples_per_second": 203.46,
"eval_steps_per_second": 1.594,
"step": 11000
},
{
"epoch": 0.0015434101991798198,
"grad_norm": 0.69921875,
"learning_rate": 0.00029999854235573855,
"loss": 0.3867,
"step": 11010
},
{
"epoch": 0.0015448120249738069,
"grad_norm": 0.54296875,
"learning_rate": 0.00029999853944162114,
"loss": 0.4283,
"step": 11020
},
{
"epoch": 0.001546213850767794,
"grad_norm": 0.89453125,
"learning_rate": 0.00029999853652459374,
"loss": 0.4642,
"step": 11030
},
{
"epoch": 0.0015476156765617812,
"grad_norm": 0.83984375,
"learning_rate": 0.0002999985336046562,
"loss": 0.3961,
"step": 11040
},
{
"epoch": 0.0015490175023557683,
"grad_norm": 0.73046875,
"learning_rate": 0.00029999853068180877,
"loss": 0.4539,
"step": 11050
},
{
"epoch": 0.0015504193281497553,
"grad_norm": 0.984375,
"learning_rate": 0.0002999985277560512,
"loss": 0.45,
"step": 11060
},
{
"epoch": 0.0015518211539437424,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999985248273837,
"loss": 0.432,
"step": 11070
},
{
"epoch": 0.0015532229797377297,
"grad_norm": 1.0546875,
"learning_rate": 0.00029999852189580614,
"loss": 0.499,
"step": 11080
},
{
"epoch": 0.0015546248055317167,
"grad_norm": 0.4296875,
"learning_rate": 0.0002999985189613185,
"loss": 0.3849,
"step": 11090
},
{
"epoch": 0.0015560266313257038,
"grad_norm": 0.5390625,
"learning_rate": 0.00029999851602392096,
"loss": 0.3608,
"step": 11100
},
{
"epoch": 0.0015574284571196909,
"grad_norm": 0.3828125,
"learning_rate": 0.0002999985130836133,
"loss": 0.4467,
"step": 11110
},
{
"epoch": 0.0015588302829136781,
"grad_norm": 0.87109375,
"learning_rate": 0.00029999851014039563,
"loss": 0.4526,
"step": 11120
},
{
"epoch": 0.0015602321087076652,
"grad_norm": 0.97265625,
"learning_rate": 0.00029999850719426797,
"loss": 0.4376,
"step": 11130
},
{
"epoch": 0.0015616339345016523,
"grad_norm": 0.91796875,
"learning_rate": 0.00029999850424523026,
"loss": 0.3923,
"step": 11140
},
{
"epoch": 0.0015630357602956395,
"grad_norm": 0.67578125,
"learning_rate": 0.0002999985012932825,
"loss": 0.4162,
"step": 11150
},
{
"epoch": 0.0015644375860896266,
"grad_norm": 0.578125,
"learning_rate": 0.0002999984983384248,
"loss": 0.4105,
"step": 11160
},
{
"epoch": 0.0015658394118836137,
"grad_norm": 0.87109375,
"learning_rate": 0.000299998495380657,
"loss": 0.4134,
"step": 11170
},
{
"epoch": 0.0015672412376776007,
"grad_norm": 0.90625,
"learning_rate": 0.0002999984924199792,
"loss": 0.4347,
"step": 11180
},
{
"epoch": 0.001568643063471588,
"grad_norm": 0.8046875,
"learning_rate": 0.0002999984894563914,
"loss": 0.4853,
"step": 11190
},
{
"epoch": 0.001570044889265575,
"grad_norm": 0.84375,
"learning_rate": 0.0002999984864898935,
"loss": 0.4014,
"step": 11200
},
{
"epoch": 0.0015714467150595621,
"grad_norm": 0.95703125,
"learning_rate": 0.00029999848352048564,
"loss": 0.4483,
"step": 11210
},
{
"epoch": 0.0015728485408535494,
"grad_norm": 0.376953125,
"learning_rate": 0.00029999848054816777,
"loss": 0.4587,
"step": 11220
},
{
"epoch": 0.0015742503666475365,
"grad_norm": 0.5390625,
"learning_rate": 0.0002999984775729398,
"loss": 0.3971,
"step": 11230
},
{
"epoch": 0.0015756521924415235,
"grad_norm": 0.9375,
"learning_rate": 0.0002999984745948019,
"loss": 0.5006,
"step": 11240
},
{
"epoch": 0.0015770540182355106,
"grad_norm": 0.2470703125,
"learning_rate": 0.00029999847161375396,
"loss": 0.3465,
"step": 11250
},
{
"epoch": 0.0015784558440294979,
"grad_norm": 0.65234375,
"learning_rate": 0.00029999846862979594,
"loss": 0.4071,
"step": 11260
},
{
"epoch": 0.001579857669823485,
"grad_norm": 0.609375,
"learning_rate": 0.0002999984656429279,
"loss": 0.4812,
"step": 11270
},
{
"epoch": 0.001581259495617472,
"grad_norm": 0.55859375,
"learning_rate": 0.0002999984626531499,
"loss": 0.4278,
"step": 11280
},
{
"epoch": 0.001582661321411459,
"grad_norm": 0.96484375,
"learning_rate": 0.0002999984596604618,
"loss": 0.4164,
"step": 11290
},
{
"epoch": 0.0015840631472054463,
"grad_norm": 0.8046875,
"learning_rate": 0.00029999845666486374,
"loss": 0.4443,
"step": 11300
},
{
"epoch": 0.0015854649729994334,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999984536663556,
"loss": 0.5397,
"step": 11310
},
{
"epoch": 0.0015868667987934204,
"grad_norm": 1.6015625,
"learning_rate": 0.00029999845066493755,
"loss": 0.4188,
"step": 11320
},
{
"epoch": 0.0015882686245874077,
"grad_norm": 0.27734375,
"learning_rate": 0.00029999844766060937,
"loss": 0.397,
"step": 11330
},
{
"epoch": 0.0015896704503813948,
"grad_norm": 0.984375,
"learning_rate": 0.0002999984446533712,
"loss": 0.3977,
"step": 11340
},
{
"epoch": 0.0015910722761753818,
"grad_norm": 0.83984375,
"learning_rate": 0.000299998441643223,
"loss": 0.4544,
"step": 11350
},
{
"epoch": 0.001592474101969369,
"grad_norm": 0.96484375,
"learning_rate": 0.0002999984386301648,
"loss": 0.4528,
"step": 11360
},
{
"epoch": 0.0015938759277633562,
"grad_norm": 0.4921875,
"learning_rate": 0.00029999843561419657,
"loss": 0.3638,
"step": 11370
},
{
"epoch": 0.0015952777535573432,
"grad_norm": 0.640625,
"learning_rate": 0.0002999984325953183,
"loss": 0.4077,
"step": 11380
},
{
"epoch": 0.0015966795793513303,
"grad_norm": 0.5546875,
"learning_rate": 0.00029999842957353,
"loss": 0.4546,
"step": 11390
},
{
"epoch": 0.0015980814051453174,
"grad_norm": 0.51953125,
"learning_rate": 0.0002999984265488317,
"loss": 0.4067,
"step": 11400
},
{
"epoch": 0.0015994832309393046,
"grad_norm": 0.19140625,
"learning_rate": 0.0002999984235212234,
"loss": 0.4523,
"step": 11410
},
{
"epoch": 0.0016008850567332917,
"grad_norm": 0.5625,
"learning_rate": 0.000299998420490705,
"loss": 0.4503,
"step": 11420
},
{
"epoch": 0.0016022868825272788,
"grad_norm": 0.953125,
"learning_rate": 0.00029999841745727664,
"loss": 0.3976,
"step": 11430
},
{
"epoch": 0.001603688708321266,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999841442093826,
"loss": 0.445,
"step": 11440
},
{
"epoch": 0.001605090534115253,
"grad_norm": 0.1728515625,
"learning_rate": 0.00029999841138168983,
"loss": 0.3924,
"step": 11450
},
{
"epoch": 0.0016064923599092402,
"grad_norm": 0.7890625,
"learning_rate": 0.0002999984083395314,
"loss": 0.5265,
"step": 11460
},
{
"epoch": 0.0016078941857032272,
"grad_norm": 0.439453125,
"learning_rate": 0.00029999840529446297,
"loss": 0.4448,
"step": 11470
},
{
"epoch": 0.0016092960114972145,
"grad_norm": 1.0234375,
"learning_rate": 0.00029999840224648444,
"loss": 0.3815,
"step": 11480
},
{
"epoch": 0.0016106978372912016,
"grad_norm": 0.384765625,
"learning_rate": 0.00029999839919559596,
"loss": 0.4106,
"step": 11490
},
{
"epoch": 0.0016120996630851886,
"grad_norm": 0.3125,
"learning_rate": 0.00029999839614179737,
"loss": 0.4216,
"step": 11500
},
{
"epoch": 0.0016120996630851886,
"eval_loss": 0.175471693277359,
"eval_runtime": 112.4366,
"eval_samples_per_second": 203.163,
"eval_steps_per_second": 1.592,
"step": 11500
},
{
"epoch": 0.001613501488879176,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999983930850889,
"loss": 0.3826,
"step": 11510
},
{
"epoch": 0.001614903314673163,
"grad_norm": 0.4609375,
"learning_rate": 0.0002999983900254703,
"loss": 0.4388,
"step": 11520
},
{
"epoch": 0.00161630514046715,
"grad_norm": 0.81640625,
"learning_rate": 0.0002999983869629417,
"loss": 0.4358,
"step": 11530
},
{
"epoch": 0.001617706966261137,
"grad_norm": 0.3984375,
"learning_rate": 0.0002999983838975031,
"loss": 0.3945,
"step": 11540
},
{
"epoch": 0.0016191087920551244,
"grad_norm": 0.6171875,
"learning_rate": 0.00029999838082915445,
"loss": 0.4987,
"step": 11550
},
{
"epoch": 0.0016205106178491114,
"grad_norm": 0.62890625,
"learning_rate": 0.0002999983777578958,
"loss": 0.4542,
"step": 11560
},
{
"epoch": 0.0016219124436430985,
"grad_norm": 0.25,
"learning_rate": 0.00029999837468372713,
"loss": 0.4642,
"step": 11570
},
{
"epoch": 0.0016233142694370855,
"grad_norm": 0.2431640625,
"learning_rate": 0.0002999983716066484,
"loss": 0.4516,
"step": 11580
},
{
"epoch": 0.0016247160952310728,
"grad_norm": 0.5,
"learning_rate": 0.0002999983685266597,
"loss": 0.425,
"step": 11590
},
{
"epoch": 0.0016261179210250599,
"grad_norm": 1.109375,
"learning_rate": 0.00029999836544376097,
"loss": 0.488,
"step": 11600
},
{
"epoch": 0.001627519746819047,
"grad_norm": 0.62890625,
"learning_rate": 0.0002999983623579522,
"loss": 0.3917,
"step": 11610
},
{
"epoch": 0.0016289215726130342,
"grad_norm": 0.75,
"learning_rate": 0.00029999835926923345,
"loss": 0.3768,
"step": 11620
},
{
"epoch": 0.0016303233984070213,
"grad_norm": 0.5234375,
"learning_rate": 0.00029999835617760466,
"loss": 0.3811,
"step": 11630
},
{
"epoch": 0.0016317252242010083,
"grad_norm": 0.890625,
"learning_rate": 0.0002999983530830658,
"loss": 0.4377,
"step": 11640
},
{
"epoch": 0.0016331270499949954,
"grad_norm": 1.125,
"learning_rate": 0.00029999834998561693,
"loss": 0.4541,
"step": 11650
},
{
"epoch": 0.0016345288757889827,
"grad_norm": 1.0546875,
"learning_rate": 0.0002999983468852581,
"loss": 0.4223,
"step": 11660
},
{
"epoch": 0.0016359307015829697,
"grad_norm": 0.79296875,
"learning_rate": 0.0002999983437819892,
"loss": 0.5063,
"step": 11670
},
{
"epoch": 0.0016373325273769568,
"grad_norm": 0.578125,
"learning_rate": 0.0002999983406758103,
"loss": 0.4157,
"step": 11680
},
{
"epoch": 0.0016387343531709439,
"grad_norm": 0.5234375,
"learning_rate": 0.00029999833756672137,
"loss": 0.4603,
"step": 11690
},
{
"epoch": 0.0016401361789649311,
"grad_norm": 0.53515625,
"learning_rate": 0.00029999833445472243,
"loss": 0.4326,
"step": 11700
},
{
"epoch": 0.0016415380047589182,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999833133981344,
"loss": 0.355,
"step": 11710
},
{
"epoch": 0.0016429398305529053,
"grad_norm": 0.31640625,
"learning_rate": 0.0002999983282219945,
"loss": 0.3694,
"step": 11720
},
{
"epoch": 0.0016443416563468925,
"grad_norm": 0.5703125,
"learning_rate": 0.00029999832510126546,
"loss": 0.4451,
"step": 11730
},
{
"epoch": 0.0016457434821408796,
"grad_norm": 1.046875,
"learning_rate": 0.0002999983219776264,
"loss": 0.5196,
"step": 11740
},
{
"epoch": 0.0016471453079348667,
"grad_norm": 0.486328125,
"learning_rate": 0.0002999983188510774,
"loss": 0.4154,
"step": 11750
},
{
"epoch": 0.0016485471337288537,
"grad_norm": 0.51953125,
"learning_rate": 0.0002999983157216183,
"loss": 0.4227,
"step": 11760
},
{
"epoch": 0.001649948959522841,
"grad_norm": 0.25,
"learning_rate": 0.0002999983125892492,
"loss": 0.4026,
"step": 11770
},
{
"epoch": 0.001651350785316828,
"grad_norm": 0.75390625,
"learning_rate": 0.0002999983094539701,
"loss": 0.5898,
"step": 11780
},
{
"epoch": 0.0016527526111108151,
"grad_norm": 0.734375,
"learning_rate": 0.00029999830631578095,
"loss": 0.3777,
"step": 11790
},
{
"epoch": 0.0016541544369048024,
"grad_norm": 0.68359375,
"learning_rate": 0.0002999983031746818,
"loss": 0.3929,
"step": 11800
},
{
"epoch": 0.0016555562626987895,
"grad_norm": 0.21875,
"learning_rate": 0.00029999830003067267,
"loss": 0.3358,
"step": 11810
},
{
"epoch": 0.0016569580884927765,
"grad_norm": 0.75390625,
"learning_rate": 0.00029999829688375347,
"loss": 0.4753,
"step": 11820
},
{
"epoch": 0.0016583599142867636,
"grad_norm": 0.71875,
"learning_rate": 0.0002999982937339242,
"loss": 0.4277,
"step": 11830
},
{
"epoch": 0.0016597617400807509,
"grad_norm": 0.201171875,
"learning_rate": 0.00029999829058118503,
"loss": 0.3802,
"step": 11840
},
{
"epoch": 0.001661163565874738,
"grad_norm": 0.478515625,
"learning_rate": 0.0002999982874255358,
"loss": 0.4961,
"step": 11850
},
{
"epoch": 0.001662565391668725,
"grad_norm": 0.69921875,
"learning_rate": 0.00029999828426697655,
"loss": 0.4635,
"step": 11860
},
{
"epoch": 0.001663967217462712,
"grad_norm": 0.40625,
"learning_rate": 0.0002999982811055072,
"loss": 0.4261,
"step": 11870
},
{
"epoch": 0.0016653690432566993,
"grad_norm": 0.46875,
"learning_rate": 0.0002999982779411279,
"loss": 0.4546,
"step": 11880
},
{
"epoch": 0.0016667708690506864,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999827477383855,
"loss": 0.3615,
"step": 11890
},
{
"epoch": 0.0016681726948446734,
"grad_norm": 0.82421875,
"learning_rate": 0.0002999982716036392,
"loss": 0.5243,
"step": 11900
},
{
"epoch": 0.0016695745206386607,
"grad_norm": 0.216796875,
"learning_rate": 0.00029999826843052986,
"loss": 0.4004,
"step": 11910
},
{
"epoch": 0.0016709763464326478,
"grad_norm": 0.419921875,
"learning_rate": 0.00029999826525451046,
"loss": 0.4181,
"step": 11920
},
{
"epoch": 0.0016723781722266348,
"grad_norm": 0.515625,
"learning_rate": 0.00029999826207558107,
"loss": 0.4921,
"step": 11930
},
{
"epoch": 0.001673779998020622,
"grad_norm": 0.9921875,
"learning_rate": 0.0002999982588937416,
"loss": 0.3902,
"step": 11940
},
{
"epoch": 0.0016751818238146092,
"grad_norm": 0.43359375,
"learning_rate": 0.0002999982557089922,
"loss": 0.4505,
"step": 11950
},
{
"epoch": 0.0016765836496085962,
"grad_norm": 0.5859375,
"learning_rate": 0.0002999982525213327,
"loss": 0.4233,
"step": 11960
},
{
"epoch": 0.0016779854754025833,
"grad_norm": 0.51953125,
"learning_rate": 0.0002999982493307633,
"loss": 0.442,
"step": 11970
},
{
"epoch": 0.0016793873011965704,
"grad_norm": 0.44921875,
"learning_rate": 0.0002999982461372838,
"loss": 0.3414,
"step": 11980
},
{
"epoch": 0.0016807891269905576,
"grad_norm": 0.3984375,
"learning_rate": 0.00029999824294089423,
"loss": 0.4397,
"step": 11990
},
{
"epoch": 0.0016821909527845447,
"grad_norm": 0.8828125,
"learning_rate": 0.0002999982397415947,
"loss": 0.4557,
"step": 12000
},
{
"epoch": 0.0016821909527845447,
"eval_loss": 0.1744946837425232,
"eval_runtime": 114.0463,
"eval_samples_per_second": 200.296,
"eval_steps_per_second": 1.57,
"step": 12000
},
{
"epoch": 0.0016835927785785318,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999982365393852,
"loss": 0.4089,
"step": 12010
},
{
"epoch": 0.001684994604372519,
"grad_norm": 0.60546875,
"learning_rate": 0.0002999982333342656,
"loss": 0.441,
"step": 12020
},
{
"epoch": 0.001686396430166506,
"grad_norm": 0.5703125,
"learning_rate": 0.000299998230126236,
"loss": 0.3261,
"step": 12030
},
{
"epoch": 0.0016877982559604932,
"grad_norm": 0.60546875,
"learning_rate": 0.0002999982269152964,
"loss": 0.4775,
"step": 12040
},
{
"epoch": 0.0016892000817544802,
"grad_norm": 0.80078125,
"learning_rate": 0.00029999822370144674,
"loss": 0.4376,
"step": 12050
},
{
"epoch": 0.0016906019075484675,
"grad_norm": 0.494140625,
"learning_rate": 0.0002999982204846871,
"loss": 0.4219,
"step": 12060
},
{
"epoch": 0.0016920037333424546,
"grad_norm": 0.65625,
"learning_rate": 0.00029999821726501744,
"loss": 0.3873,
"step": 12070
},
{
"epoch": 0.0016934055591364416,
"grad_norm": 0.181640625,
"learning_rate": 0.00029999821404243774,
"loss": 0.4289,
"step": 12080
},
{
"epoch": 0.001694807384930429,
"grad_norm": 0.26171875,
"learning_rate": 0.00029999821081694804,
"loss": 0.4635,
"step": 12090
},
{
"epoch": 0.001696209210724416,
"grad_norm": 0.88671875,
"learning_rate": 0.0002999982075885483,
"loss": 0.4446,
"step": 12100
},
{
"epoch": 0.001697611036518403,
"grad_norm": 0.5234375,
"learning_rate": 0.0002999982043572386,
"loss": 0.3795,
"step": 12110
},
{
"epoch": 0.00169901286231239,
"grad_norm": 0.8828125,
"learning_rate": 0.00029999820112301884,
"loss": 0.4547,
"step": 12120
},
{
"epoch": 0.0017004146881063774,
"grad_norm": 0.78125,
"learning_rate": 0.00029999819788588904,
"loss": 0.4917,
"step": 12130
},
{
"epoch": 0.0017018165139003644,
"grad_norm": 0.63671875,
"learning_rate": 0.00029999819464584924,
"loss": 0.3711,
"step": 12140
},
{
"epoch": 0.0017032183396943515,
"grad_norm": 0.28515625,
"learning_rate": 0.00029999819140289944,
"loss": 0.4076,
"step": 12150
},
{
"epoch": 0.0017046201654883385,
"grad_norm": 0.8359375,
"learning_rate": 0.00029999818815703964,
"loss": 0.4338,
"step": 12160
},
{
"epoch": 0.0017060219912823258,
"grad_norm": 0.404296875,
"learning_rate": 0.0002999981849082698,
"loss": 0.3822,
"step": 12170
},
{
"epoch": 0.0017074238170763129,
"grad_norm": 0.734375,
"learning_rate": 0.00029999818165658994,
"loss": 0.4759,
"step": 12180
},
{
"epoch": 0.0017088256428703,
"grad_norm": 0.353515625,
"learning_rate": 0.0002999981784020001,
"loss": 0.3642,
"step": 12190
},
{
"epoch": 0.0017102274686642872,
"grad_norm": 0.6484375,
"learning_rate": 0.00029999817514450014,
"loss": 0.461,
"step": 12200
},
{
"epoch": 0.0017116292944582743,
"grad_norm": 0.8828125,
"learning_rate": 0.00029999817188409024,
"loss": 0.4225,
"step": 12210
},
{
"epoch": 0.0017130311202522613,
"grad_norm": 0.62109375,
"learning_rate": 0.0002999981686207703,
"loss": 0.4653,
"step": 12220
},
{
"epoch": 0.0017144329460462484,
"grad_norm": 0.396484375,
"learning_rate": 0.00029999816535454033,
"loss": 0.4366,
"step": 12230
},
{
"epoch": 0.0017158347718402357,
"grad_norm": 0.6953125,
"learning_rate": 0.0002999981620854004,
"loss": 0.3372,
"step": 12240
},
{
"epoch": 0.0017172365976342227,
"grad_norm": 0.74609375,
"learning_rate": 0.0002999981588133504,
"loss": 0.3731,
"step": 12250
},
{
"epoch": 0.0017186384234282098,
"grad_norm": 0.484375,
"learning_rate": 0.0002999981555383904,
"loss": 0.4849,
"step": 12260
},
{
"epoch": 0.0017200402492221969,
"grad_norm": 0.796875,
"learning_rate": 0.0002999981522605204,
"loss": 0.4366,
"step": 12270
},
{
"epoch": 0.0017214420750161841,
"grad_norm": 0.9375,
"learning_rate": 0.0002999981489797403,
"loss": 0.4627,
"step": 12280
},
{
"epoch": 0.0017228439008101712,
"grad_norm": 0.79296875,
"learning_rate": 0.0002999981456960503,
"loss": 0.4922,
"step": 12290
},
{
"epoch": 0.0017242457266041583,
"grad_norm": 0.640625,
"learning_rate": 0.0002999981424094502,
"loss": 0.5141,
"step": 12300
},
{
"epoch": 0.0017256475523981455,
"grad_norm": 0.58984375,
"learning_rate": 0.0002999981391199401,
"loss": 0.4268,
"step": 12310
},
{
"epoch": 0.0017270493781921326,
"grad_norm": 0.5625,
"learning_rate": 0.00029999813582752007,
"loss": 0.4026,
"step": 12320
},
{
"epoch": 0.0017284512039861197,
"grad_norm": 0.61328125,
"learning_rate": 0.0002999981325321899,
"loss": 0.3239,
"step": 12330
},
{
"epoch": 0.0017298530297801067,
"grad_norm": 0.244140625,
"learning_rate": 0.00029999812923394976,
"loss": 0.3925,
"step": 12340
},
{
"epoch": 0.001731254855574094,
"grad_norm": 0.4765625,
"learning_rate": 0.0002999981259327996,
"loss": 0.3677,
"step": 12350
},
{
"epoch": 0.001732656681368081,
"grad_norm": 0.703125,
"learning_rate": 0.00029999812262873946,
"loss": 0.4404,
"step": 12360
},
{
"epoch": 0.0017340585071620681,
"grad_norm": 0.83203125,
"learning_rate": 0.0002999981193217693,
"loss": 0.4245,
"step": 12370
},
{
"epoch": 0.0017354603329560554,
"grad_norm": 0.361328125,
"learning_rate": 0.00029999811601188906,
"loss": 0.4636,
"step": 12380
},
{
"epoch": 0.0017368621587500424,
"grad_norm": 0.30859375,
"learning_rate": 0.00029999811269909886,
"loss": 0.3831,
"step": 12390
},
{
"epoch": 0.0017382639845440295,
"grad_norm": 0.69140625,
"learning_rate": 0.00029999810938339866,
"loss": 0.4938,
"step": 12400
},
{
"epoch": 0.0017396658103380166,
"grad_norm": 1.0,
"learning_rate": 0.0002999981060647884,
"loss": 0.4036,
"step": 12410
},
{
"epoch": 0.0017410676361320038,
"grad_norm": 0.578125,
"learning_rate": 0.0002999981027432681,
"loss": 0.4091,
"step": 12420
},
{
"epoch": 0.001742469461925991,
"grad_norm": 0.443359375,
"learning_rate": 0.00029999809941883785,
"loss": 0.4134,
"step": 12430
},
{
"epoch": 0.001743871287719978,
"grad_norm": 0.67578125,
"learning_rate": 0.0002999980960914975,
"loss": 0.4591,
"step": 12440
},
{
"epoch": 0.001745273113513965,
"grad_norm": 0.228515625,
"learning_rate": 0.00029999809276124725,
"loss": 0.4345,
"step": 12450
},
{
"epoch": 0.0017466749393079523,
"grad_norm": 0.71484375,
"learning_rate": 0.0002999980894280869,
"loss": 0.3948,
"step": 12460
},
{
"epoch": 0.0017480767651019394,
"grad_norm": 0.3515625,
"learning_rate": 0.00029999808609201654,
"loss": 0.4106,
"step": 12470
},
{
"epoch": 0.0017494785908959264,
"grad_norm": 0.24609375,
"learning_rate": 0.0002999980827530362,
"loss": 0.4008,
"step": 12480
},
{
"epoch": 0.0017508804166899137,
"grad_norm": 0.23046875,
"learning_rate": 0.00029999807941114584,
"loss": 0.3922,
"step": 12490
},
{
"epoch": 0.0017522822424839008,
"grad_norm": 0.189453125,
"learning_rate": 0.00029999807606634544,
"loss": 0.4446,
"step": 12500
},
{
"epoch": 0.0017522822424839008,
"eval_loss": 0.17290730774402618,
"eval_runtime": 112.4498,
"eval_samples_per_second": 203.139,
"eval_steps_per_second": 1.592,
"step": 12500
},
{
"epoch": 0.0017536840682778878,
"grad_norm": 0.77734375,
"learning_rate": 0.000299998072718635,
"loss": 0.4245,
"step": 12510
},
{
"epoch": 0.0017550858940718749,
"grad_norm": 0.75390625,
"learning_rate": 0.0002999980693680146,
"loss": 0.3517,
"step": 12520
},
{
"epoch": 0.0017564877198658622,
"grad_norm": 0.6328125,
"learning_rate": 0.0002999980660144842,
"loss": 0.4871,
"step": 12530
},
{
"epoch": 0.0017578895456598492,
"grad_norm": 0.298828125,
"learning_rate": 0.00029999806265804373,
"loss": 0.4103,
"step": 12540
},
{
"epoch": 0.0017592913714538363,
"grad_norm": 0.50390625,
"learning_rate": 0.00029999805929869323,
"loss": 0.4575,
"step": 12550
},
{
"epoch": 0.0017606931972478234,
"grad_norm": 0.8984375,
"learning_rate": 0.00029999805593643273,
"loss": 0.5051,
"step": 12560
},
{
"epoch": 0.0017620950230418106,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999980525712622,
"loss": 0.4247,
"step": 12570
},
{
"epoch": 0.0017634968488357977,
"grad_norm": 1.0390625,
"learning_rate": 0.0002999980492031818,
"loss": 0.3596,
"step": 12580
},
{
"epoch": 0.0017648986746297847,
"grad_norm": 0.82421875,
"learning_rate": 0.00029999804583219123,
"loss": 0.4019,
"step": 12590
},
{
"epoch": 0.001766300500423772,
"grad_norm": 0.375,
"learning_rate": 0.0002999980424582906,
"loss": 0.3925,
"step": 12600
},
{
"epoch": 0.001767702326217759,
"grad_norm": 0.37109375,
"learning_rate": 0.00029999803908148013,
"loss": 0.492,
"step": 12610
},
{
"epoch": 0.0017691041520117461,
"grad_norm": 0.88671875,
"learning_rate": 0.0002999980357017595,
"loss": 0.4479,
"step": 12620
},
{
"epoch": 0.0017705059778057332,
"grad_norm": 0.462890625,
"learning_rate": 0.0002999980323191289,
"loss": 0.4261,
"step": 12630
},
{
"epoch": 0.0017719078035997205,
"grad_norm": 0.9375,
"learning_rate": 0.0002999980289335884,
"loss": 0.5056,
"step": 12640
},
{
"epoch": 0.0017733096293937075,
"grad_norm": 0.62109375,
"learning_rate": 0.0002999980255451377,
"loss": 0.4311,
"step": 12650
},
{
"epoch": 0.0017747114551876946,
"grad_norm": 0.73046875,
"learning_rate": 0.00029999802215377713,
"loss": 0.5066,
"step": 12660
},
{
"epoch": 0.0017761132809816819,
"grad_norm": 0.78515625,
"learning_rate": 0.0002999980187595064,
"loss": 0.4447,
"step": 12670
},
{
"epoch": 0.001777515106775669,
"grad_norm": 0.85546875,
"learning_rate": 0.0002999980153623258,
"loss": 0.4514,
"step": 12680
},
{
"epoch": 0.001778916932569656,
"grad_norm": 0.4296875,
"learning_rate": 0.0002999980119622351,
"loss": 0.3377,
"step": 12690
},
{
"epoch": 0.001780318758363643,
"grad_norm": 0.8203125,
"learning_rate": 0.0002999980085592344,
"loss": 0.4139,
"step": 12700
},
{
"epoch": 0.0017817205841576303,
"grad_norm": 0.2578125,
"learning_rate": 0.00029999800515332373,
"loss": 0.3494,
"step": 12710
},
{
"epoch": 0.0017831224099516174,
"grad_norm": 0.4375,
"learning_rate": 0.00029999800174450303,
"loss": 0.3762,
"step": 12720
},
{
"epoch": 0.0017845242357456045,
"grad_norm": 1.328125,
"learning_rate": 0.0002999979983327723,
"loss": 0.4438,
"step": 12730
},
{
"epoch": 0.0017859260615395915,
"grad_norm": 0.859375,
"learning_rate": 0.00029999799491813153,
"loss": 0.359,
"step": 12740
},
{
"epoch": 0.0017873278873335788,
"grad_norm": 0.9375,
"learning_rate": 0.0002999979915005808,
"loss": 0.5009,
"step": 12750
},
{
"epoch": 0.0017887297131275659,
"grad_norm": 1.015625,
"learning_rate": 0.00029999798808012004,
"loss": 0.4575,
"step": 12760
},
{
"epoch": 0.001790131538921553,
"grad_norm": 0.5859375,
"learning_rate": 0.00029999798465674924,
"loss": 0.4969,
"step": 12770
},
{
"epoch": 0.0017915333647155402,
"grad_norm": 0.62109375,
"learning_rate": 0.00029999798123046844,
"loss": 0.5035,
"step": 12780
},
{
"epoch": 0.0017929351905095273,
"grad_norm": 0.47265625,
"learning_rate": 0.00029999797780127764,
"loss": 0.3995,
"step": 12790
},
{
"epoch": 0.0017943370163035143,
"grad_norm": 0.8203125,
"learning_rate": 0.00029999797436917674,
"loss": 0.5084,
"step": 12800
},
{
"epoch": 0.0017957388420975014,
"grad_norm": 0.408203125,
"learning_rate": 0.00029999797093416595,
"loss": 0.4455,
"step": 12810
},
{
"epoch": 0.0017971406678914887,
"grad_norm": 0.87890625,
"learning_rate": 0.00029999796749624505,
"loss": 0.4266,
"step": 12820
},
{
"epoch": 0.0017985424936854757,
"grad_norm": 0.470703125,
"learning_rate": 0.0002999979640554142,
"loss": 0.4251,
"step": 12830
},
{
"epoch": 0.0017999443194794628,
"grad_norm": 0.63671875,
"learning_rate": 0.00029999796061167336,
"loss": 0.4692,
"step": 12840
},
{
"epoch": 0.0018013461452734498,
"grad_norm": 0.734375,
"learning_rate": 0.00029999795716502246,
"loss": 0.5269,
"step": 12850
},
{
"epoch": 0.0018027479710674371,
"grad_norm": 0.765625,
"learning_rate": 0.00029999795371546157,
"loss": 0.436,
"step": 12860
},
{
"epoch": 0.0018041497968614242,
"grad_norm": 0.353515625,
"learning_rate": 0.0002999979502629906,
"loss": 0.4383,
"step": 12870
},
{
"epoch": 0.0018055516226554112,
"grad_norm": 0.6953125,
"learning_rate": 0.00029999794680760967,
"loss": 0.4605,
"step": 12880
},
{
"epoch": 0.0018069534484493985,
"grad_norm": 0.63671875,
"learning_rate": 0.0002999979433493187,
"loss": 0.4385,
"step": 12890
},
{
"epoch": 0.0018083552742433856,
"grad_norm": 0.69140625,
"learning_rate": 0.0002999979398881178,
"loss": 0.4601,
"step": 12900
},
{
"epoch": 0.0018097571000373726,
"grad_norm": 0.578125,
"learning_rate": 0.00029999793642400684,
"loss": 0.4269,
"step": 12910
},
{
"epoch": 0.0018111589258313597,
"grad_norm": 0.5,
"learning_rate": 0.00029999793295698584,
"loss": 0.3948,
"step": 12920
},
{
"epoch": 0.001812560751625347,
"grad_norm": 0.56640625,
"learning_rate": 0.0002999979294870548,
"loss": 0.412,
"step": 12930
},
{
"epoch": 0.001813962577419334,
"grad_norm": 0.6484375,
"learning_rate": 0.0002999979260142138,
"loss": 0.4961,
"step": 12940
},
{
"epoch": 0.001815364403213321,
"grad_norm": 0.33984375,
"learning_rate": 0.00029999792253846276,
"loss": 0.4089,
"step": 12950
},
{
"epoch": 0.0018167662290073084,
"grad_norm": 0.91015625,
"learning_rate": 0.00029999791905980177,
"loss": 0.388,
"step": 12960
},
{
"epoch": 0.0018181680548012954,
"grad_norm": 0.267578125,
"learning_rate": 0.0002999979155782307,
"loss": 0.4039,
"step": 12970
},
{
"epoch": 0.0018195698805952825,
"grad_norm": 0.318359375,
"learning_rate": 0.00029999791209374963,
"loss": 0.4272,
"step": 12980
},
{
"epoch": 0.0018209717063892696,
"grad_norm": 0.7734375,
"learning_rate": 0.0002999979086063586,
"loss": 0.4296,
"step": 12990
},
{
"epoch": 0.0018223735321832568,
"grad_norm": 0.5078125,
"learning_rate": 0.0002999979051160575,
"loss": 0.4481,
"step": 13000
},
{
"epoch": 0.0018223735321832568,
"eval_loss": 0.17369048297405243,
"eval_runtime": 112.6443,
"eval_samples_per_second": 202.789,
"eval_steps_per_second": 1.589,
"step": 13000
},
{
"epoch": 0.001823775357977244,
"grad_norm": 1.125,
"learning_rate": 0.0002999979016228464,
"loss": 0.4938,
"step": 13010
},
{
"epoch": 0.001825177183771231,
"grad_norm": 0.67578125,
"learning_rate": 0.00029999789812672526,
"loss": 0.3418,
"step": 13020
},
{
"epoch": 0.001826579009565218,
"grad_norm": 0.56640625,
"learning_rate": 0.00029999789462769417,
"loss": 0.4171,
"step": 13030
},
{
"epoch": 0.0018279808353592053,
"grad_norm": 0.6953125,
"learning_rate": 0.00029999789112575303,
"loss": 0.4075,
"step": 13040
},
{
"epoch": 0.0018293826611531924,
"grad_norm": 0.57421875,
"learning_rate": 0.0002999978876209019,
"loss": 0.3656,
"step": 13050
},
{
"epoch": 0.0018307844869471794,
"grad_norm": 0.76171875,
"learning_rate": 0.0002999978841131407,
"loss": 0.4442,
"step": 13060
},
{
"epoch": 0.0018321863127411667,
"grad_norm": 0.333984375,
"learning_rate": 0.00029999788060246956,
"loss": 0.349,
"step": 13070
},
{
"epoch": 0.0018335881385351538,
"grad_norm": 0.328125,
"learning_rate": 0.0002999978770888884,
"loss": 0.3392,
"step": 13080
},
{
"epoch": 0.0018349899643291408,
"grad_norm": 0.169921875,
"learning_rate": 0.0002999978735723972,
"loss": 0.3594,
"step": 13090
},
{
"epoch": 0.0018363917901231279,
"grad_norm": 0.79296875,
"learning_rate": 0.000299997870052996,
"loss": 0.4715,
"step": 13100
},
{
"epoch": 0.0018377936159171152,
"grad_norm": 0.150390625,
"learning_rate": 0.0002999978665306848,
"loss": 0.4352,
"step": 13110
},
{
"epoch": 0.0018391954417111022,
"grad_norm": 0.2099609375,
"learning_rate": 0.00029999786300546357,
"loss": 0.3783,
"step": 13120
},
{
"epoch": 0.0018405972675050893,
"grad_norm": 0.5625,
"learning_rate": 0.00029999785947733233,
"loss": 0.4245,
"step": 13130
},
{
"epoch": 0.0018419990932990763,
"grad_norm": 0.7578125,
"learning_rate": 0.00029999785594629104,
"loss": 0.3549,
"step": 13140
},
{
"epoch": 0.0018434009190930636,
"grad_norm": 0.859375,
"learning_rate": 0.0002999978524123398,
"loss": 0.4832,
"step": 13150
},
{
"epoch": 0.0018448027448870507,
"grad_norm": 0.423828125,
"learning_rate": 0.0002999978488754785,
"loss": 0.3666,
"step": 13160
},
{
"epoch": 0.0018462045706810377,
"grad_norm": 0.50390625,
"learning_rate": 0.00029999784533570723,
"loss": 0.3677,
"step": 13170
},
{
"epoch": 0.001847606396475025,
"grad_norm": 0.4453125,
"learning_rate": 0.000299997841793026,
"loss": 0.465,
"step": 13180
},
{
"epoch": 0.001849008222269012,
"grad_norm": 0.72265625,
"learning_rate": 0.00029999783824743466,
"loss": 0.388,
"step": 13190
},
{
"epoch": 0.0018504100480629991,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999978346989334,
"loss": 0.3845,
"step": 13200
},
{
"epoch": 0.0018518118738569862,
"grad_norm": 1.015625,
"learning_rate": 0.00029999783114752204,
"loss": 0.3664,
"step": 13210
},
{
"epoch": 0.0018532136996509735,
"grad_norm": 0.87109375,
"learning_rate": 0.0002999978275932007,
"loss": 0.5365,
"step": 13220
},
{
"epoch": 0.0018546155254449605,
"grad_norm": 0.25,
"learning_rate": 0.0002999978240359693,
"loss": 0.4392,
"step": 13230
},
{
"epoch": 0.0018560173512389476,
"grad_norm": 0.6171875,
"learning_rate": 0.000299997820475828,
"loss": 0.3636,
"step": 13240
},
{
"epoch": 0.0018574191770329349,
"grad_norm": 0.74609375,
"learning_rate": 0.00029999781691277666,
"loss": 0.4864,
"step": 13250
},
{
"epoch": 0.001858821002826922,
"grad_norm": 0.275390625,
"learning_rate": 0.0002999978133468152,
"loss": 0.4072,
"step": 13260
},
{
"epoch": 0.001860222828620909,
"grad_norm": 0.55859375,
"learning_rate": 0.00029999780977794385,
"loss": 0.4495,
"step": 13270
},
{
"epoch": 0.001861624654414896,
"grad_norm": 0.2890625,
"learning_rate": 0.00029999780620616247,
"loss": 0.3696,
"step": 13280
},
{
"epoch": 0.0018630264802088833,
"grad_norm": 0.5234375,
"learning_rate": 0.00029999780263147103,
"loss": 0.4009,
"step": 13290
},
{
"epoch": 0.0018644283060028704,
"grad_norm": 0.58203125,
"learning_rate": 0.0002999977990538696,
"loss": 0.3759,
"step": 13300
},
{
"epoch": 0.0018658301317968575,
"grad_norm": 0.166015625,
"learning_rate": 0.0002999977954733582,
"loss": 0.3558,
"step": 13310
},
{
"epoch": 0.0018672319575908445,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999977918899368,
"loss": 0.3603,
"step": 13320
},
{
"epoch": 0.0018686337833848318,
"grad_norm": 0.6875,
"learning_rate": 0.0002999977883036053,
"loss": 0.4357,
"step": 13330
},
{
"epoch": 0.0018700356091788189,
"grad_norm": 1.0234375,
"learning_rate": 0.00029999778471436384,
"loss": 0.4183,
"step": 13340
},
{
"epoch": 0.001871437434972806,
"grad_norm": 1.0703125,
"learning_rate": 0.0002999977811222124,
"loss": 0.4305,
"step": 13350
},
{
"epoch": 0.0018728392607667932,
"grad_norm": 0.66015625,
"learning_rate": 0.0002999977775271509,
"loss": 0.4278,
"step": 13360
},
{
"epoch": 0.0018742410865607803,
"grad_norm": 1.1640625,
"learning_rate": 0.0002999977739291794,
"loss": 0.4415,
"step": 13370
},
{
"epoch": 0.0018756429123547673,
"grad_norm": 0.84765625,
"learning_rate": 0.00029999777032829793,
"loss": 0.4681,
"step": 13380
},
{
"epoch": 0.0018770447381487544,
"grad_norm": 0.83203125,
"learning_rate": 0.00029999776672450646,
"loss": 0.4305,
"step": 13390
},
{
"epoch": 0.0018784465639427417,
"grad_norm": 1.0859375,
"learning_rate": 0.0002999977631178049,
"loss": 0.4568,
"step": 13400
},
{
"epoch": 0.0018798483897367287,
"grad_norm": 0.74609375,
"learning_rate": 0.00029999775950819335,
"loss": 0.4561,
"step": 13410
},
{
"epoch": 0.0018812502155307158,
"grad_norm": 0.7421875,
"learning_rate": 0.00029999775589567183,
"loss": 0.4982,
"step": 13420
},
{
"epoch": 0.0018826520413247028,
"grad_norm": 0.3828125,
"learning_rate": 0.0002999977522802403,
"loss": 0.4583,
"step": 13430
},
{
"epoch": 0.0018840538671186901,
"grad_norm": 1.015625,
"learning_rate": 0.0002999977486618988,
"loss": 0.5271,
"step": 13440
},
{
"epoch": 0.0018854556929126772,
"grad_norm": 0.69921875,
"learning_rate": 0.0002999977450406472,
"loss": 0.4311,
"step": 13450
},
{
"epoch": 0.0018868575187066642,
"grad_norm": 0.6640625,
"learning_rate": 0.00029999774141648564,
"loss": 0.4316,
"step": 13460
},
{
"epoch": 0.0018882593445006515,
"grad_norm": 0.58203125,
"learning_rate": 0.000299997737789414,
"loss": 0.3692,
"step": 13470
},
{
"epoch": 0.0018896611702946386,
"grad_norm": 0.72265625,
"learning_rate": 0.00029999773415943245,
"loss": 0.4599,
"step": 13480
},
{
"epoch": 0.0018910629960886256,
"grad_norm": 0.8828125,
"learning_rate": 0.0002999977305265408,
"loss": 0.5223,
"step": 13490
},
{
"epoch": 0.0018924648218826127,
"grad_norm": 1.1875,
"learning_rate": 0.0002999977268907392,
"loss": 0.4116,
"step": 13500
},
{
"epoch": 0.0018924648218826127,
"eval_loss": 0.17309853434562683,
"eval_runtime": 114.1817,
"eval_samples_per_second": 200.058,
"eval_steps_per_second": 1.568,
"step": 13500
},
{
"epoch": 0.0018938666476766,
"grad_norm": 0.94921875,
"learning_rate": 0.00029999772325202764,
"loss": 0.519,
"step": 13510
},
{
"epoch": 0.001895268473470587,
"grad_norm": 0.6484375,
"learning_rate": 0.00029999771961040597,
"loss": 0.4413,
"step": 13520
},
{
"epoch": 0.001896670299264574,
"grad_norm": 0.765625,
"learning_rate": 0.00029999771596587435,
"loss": 0.4443,
"step": 13530
},
{
"epoch": 0.0018980721250585614,
"grad_norm": 0.81640625,
"learning_rate": 0.00029999771231843273,
"loss": 0.486,
"step": 13540
},
{
"epoch": 0.0018994739508525484,
"grad_norm": 0.5234375,
"learning_rate": 0.000299997708668081,
"loss": 0.3188,
"step": 13550
},
{
"epoch": 0.0019008757766465355,
"grad_norm": 0.294921875,
"learning_rate": 0.0002999977050148194,
"loss": 0.3781,
"step": 13560
},
{
"epoch": 0.0019022776024405226,
"grad_norm": 0.73046875,
"learning_rate": 0.00029999770135864773,
"loss": 0.4946,
"step": 13570
},
{
"epoch": 0.0019036794282345098,
"grad_norm": 0.75390625,
"learning_rate": 0.00029999769769956607,
"loss": 0.3202,
"step": 13580
},
{
"epoch": 0.001905081254028497,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999769403757435,
"loss": 0.4782,
"step": 13590
},
{
"epoch": 0.001906483079822484,
"grad_norm": 0.65625,
"learning_rate": 0.0002999976903726727,
"loss": 0.4282,
"step": 13600
},
{
"epoch": 0.001907884905616471,
"grad_norm": 0.54296875,
"learning_rate": 0.000299997686704861,
"loss": 0.4034,
"step": 13610
},
{
"epoch": 0.0019092867314104583,
"grad_norm": 0.62109375,
"learning_rate": 0.00029999768303413927,
"loss": 0.4568,
"step": 13620
},
{
"epoch": 0.0019106885572044454,
"grad_norm": 0.291015625,
"learning_rate": 0.00029999767936050755,
"loss": 0.3956,
"step": 13630
},
{
"epoch": 0.0019120903829984324,
"grad_norm": 0.66015625,
"learning_rate": 0.00029999767568396584,
"loss": 0.4545,
"step": 13640
},
{
"epoch": 0.0019134922087924197,
"grad_norm": 0.30078125,
"learning_rate": 0.00029999767200451414,
"loss": 0.489,
"step": 13650
},
{
"epoch": 0.0019148940345864068,
"grad_norm": 1.28125,
"learning_rate": 0.0002999976683221524,
"loss": 0.536,
"step": 13660
},
{
"epoch": 0.0019162958603803938,
"grad_norm": 0.2578125,
"learning_rate": 0.0002999976646368806,
"loss": 0.3801,
"step": 13670
},
{
"epoch": 0.0019176976861743809,
"grad_norm": 0.52734375,
"learning_rate": 0.00029999766094869886,
"loss": 0.4321,
"step": 13680
},
{
"epoch": 0.0019190995119683682,
"grad_norm": 0.25390625,
"learning_rate": 0.0002999976572576071,
"loss": 0.3094,
"step": 13690
},
{
"epoch": 0.0019205013377623552,
"grad_norm": 0.39453125,
"learning_rate": 0.00029999765356360534,
"loss": 0.3829,
"step": 13700
},
{
"epoch": 0.0019219031635563423,
"grad_norm": 0.423828125,
"learning_rate": 0.00029999764986669353,
"loss": 0.4466,
"step": 13710
},
{
"epoch": 0.0019233049893503293,
"grad_norm": 0.66015625,
"learning_rate": 0.0002999976461668718,
"loss": 0.4148,
"step": 13720
},
{
"epoch": 0.0019247068151443166,
"grad_norm": 0.83984375,
"learning_rate": 0.00029999764246414,
"loss": 0.4261,
"step": 13730
},
{
"epoch": 0.0019261086409383037,
"grad_norm": 0.48828125,
"learning_rate": 0.00029999763875849817,
"loss": 0.4347,
"step": 13740
},
{
"epoch": 0.0019275104667322907,
"grad_norm": 0.515625,
"learning_rate": 0.00029999763504994637,
"loss": 0.4352,
"step": 13750
},
{
"epoch": 0.001928912292526278,
"grad_norm": 0.5703125,
"learning_rate": 0.00029999763133848456,
"loss": 0.428,
"step": 13760
},
{
"epoch": 0.001930314118320265,
"grad_norm": 0.45703125,
"learning_rate": 0.00029999762762411276,
"loss": 0.337,
"step": 13770
},
{
"epoch": 0.0019317159441142521,
"grad_norm": 0.60546875,
"learning_rate": 0.00029999762390683096,
"loss": 0.3705,
"step": 13780
},
{
"epoch": 0.0019331177699082392,
"grad_norm": 0.486328125,
"learning_rate": 0.0002999976201866391,
"loss": 0.4369,
"step": 13790
},
{
"epoch": 0.0019345195957022265,
"grad_norm": 0.609375,
"learning_rate": 0.00029999761646353726,
"loss": 0.4915,
"step": 13800
},
{
"epoch": 0.0019359214214962135,
"grad_norm": 0.984375,
"learning_rate": 0.0002999976127375254,
"loss": 0.4433,
"step": 13810
},
{
"epoch": 0.0019373232472902006,
"grad_norm": 0.443359375,
"learning_rate": 0.00029999760900860356,
"loss": 0.465,
"step": 13820
},
{
"epoch": 0.0019387250730841879,
"grad_norm": 0.9140625,
"learning_rate": 0.0002999976052767717,
"loss": 0.4211,
"step": 13830
},
{
"epoch": 0.001940126898878175,
"grad_norm": 0.357421875,
"learning_rate": 0.00029999760154202987,
"loss": 0.413,
"step": 13840
},
{
"epoch": 0.001941528724672162,
"grad_norm": 0.490234375,
"learning_rate": 0.000299997597804378,
"loss": 0.3958,
"step": 13850
},
{
"epoch": 0.001942930550466149,
"grad_norm": 0.89453125,
"learning_rate": 0.00029999759406381613,
"loss": 0.3903,
"step": 13860
},
{
"epoch": 0.0019443323762601363,
"grad_norm": 0.33984375,
"learning_rate": 0.00029999759032034424,
"loss": 0.3797,
"step": 13870
},
{
"epoch": 0.0019457342020541234,
"grad_norm": 0.66796875,
"learning_rate": 0.00029999758657396234,
"loss": 0.5,
"step": 13880
},
{
"epoch": 0.0019471360278481105,
"grad_norm": 0.69140625,
"learning_rate": 0.0002999975828246705,
"loss": 0.4632,
"step": 13890
},
{
"epoch": 0.0019485378536420975,
"grad_norm": 1.09375,
"learning_rate": 0.00029999757907246856,
"loss": 0.4769,
"step": 13900
},
{
"epoch": 0.0019499396794360848,
"grad_norm": 0.1591796875,
"learning_rate": 0.0002999975753173566,
"loss": 0.409,
"step": 13910
},
{
"epoch": 0.0019513415052300719,
"grad_norm": 0.625,
"learning_rate": 0.0002999975715593347,
"loss": 0.4453,
"step": 13920
},
{
"epoch": 0.001952743331024059,
"grad_norm": 0.77734375,
"learning_rate": 0.00029999756779840284,
"loss": 0.4729,
"step": 13930
},
{
"epoch": 0.001954145156818046,
"grad_norm": 1.0390625,
"learning_rate": 0.0002999975640345609,
"loss": 0.4493,
"step": 13940
},
{
"epoch": 0.0019555469826120333,
"grad_norm": 0.341796875,
"learning_rate": 0.00029999756026780896,
"loss": 0.3759,
"step": 13950
},
{
"epoch": 0.0019569488084060205,
"grad_norm": 1.171875,
"learning_rate": 0.0002999975564981471,
"loss": 0.4879,
"step": 13960
},
{
"epoch": 0.0019583506342000074,
"grad_norm": 0.9140625,
"learning_rate": 0.0002999975527255751,
"loss": 0.4767,
"step": 13970
},
{
"epoch": 0.0019597524599939947,
"grad_norm": 0.28515625,
"learning_rate": 0.00029999754895009315,
"loss": 0.4501,
"step": 13980
},
{
"epoch": 0.0019611542857879815,
"grad_norm": 0.7109375,
"learning_rate": 0.0002999975451717012,
"loss": 0.4216,
"step": 13990
},
{
"epoch": 0.0019625561115819688,
"grad_norm": 0.345703125,
"learning_rate": 0.0002999975413903993,
"loss": 0.3885,
"step": 14000
},
{
"epoch": 0.0019625561115819688,
"eval_loss": 0.17219418287277222,
"eval_runtime": 112.3232,
"eval_samples_per_second": 203.369,
"eval_steps_per_second": 1.594,
"step": 14000
},
{
"epoch": 0.001963957937375956,
"grad_norm": 0.56640625,
"learning_rate": 0.0002999975376061873,
"loss": 0.412,
"step": 14010
},
{
"epoch": 0.001965359763169943,
"grad_norm": 0.337890625,
"learning_rate": 0.0002999975338190653,
"loss": 0.3503,
"step": 14020
},
{
"epoch": 0.00196676158896393,
"grad_norm": 0.83984375,
"learning_rate": 0.00029999753002903334,
"loss": 0.3654,
"step": 14030
},
{
"epoch": 0.0019681634147579175,
"grad_norm": 0.6484375,
"learning_rate": 0.0002999975262360914,
"loss": 0.5271,
"step": 14040
},
{
"epoch": 0.0019695652405519043,
"grad_norm": 0.6171875,
"learning_rate": 0.00029999752244023943,
"loss": 0.3611,
"step": 14050
},
{
"epoch": 0.0019709670663458916,
"grad_norm": 0.8671875,
"learning_rate": 0.0002999975186414774,
"loss": 0.475,
"step": 14060
},
{
"epoch": 0.001972368892139879,
"grad_norm": 0.6015625,
"learning_rate": 0.0002999975148398054,
"loss": 0.4544,
"step": 14070
},
{
"epoch": 0.0019737707179338657,
"grad_norm": 0.75390625,
"learning_rate": 0.00029999751103522345,
"loss": 0.371,
"step": 14080
},
{
"epoch": 0.001975172543727853,
"grad_norm": 0.2470703125,
"learning_rate": 0.0002999975072277314,
"loss": 0.4124,
"step": 14090
},
{
"epoch": 0.00197657436952184,
"grad_norm": 0.298828125,
"learning_rate": 0.00029999750341732945,
"loss": 0.4765,
"step": 14100
},
{
"epoch": 0.001977976195315827,
"grad_norm": 0.68359375,
"learning_rate": 0.0002999974996040174,
"loss": 0.4405,
"step": 14110
},
{
"epoch": 0.0019793780211098144,
"grad_norm": 0.69140625,
"learning_rate": 0.00029999749578779546,
"loss": 0.5118,
"step": 14120
},
{
"epoch": 0.001980779846903801,
"grad_norm": 0.53125,
"learning_rate": 0.00029999749196866343,
"loss": 0.4831,
"step": 14130
},
{
"epoch": 0.0019821816726977885,
"grad_norm": 0.6328125,
"learning_rate": 0.00029999748814662136,
"loss": 0.5109,
"step": 14140
},
{
"epoch": 0.0019835834984917758,
"grad_norm": 0.58984375,
"learning_rate": 0.00029999748432166934,
"loss": 0.3219,
"step": 14150
},
{
"epoch": 0.0019849853242857626,
"grad_norm": 0.515625,
"learning_rate": 0.0002999974804938073,
"loss": 0.3513,
"step": 14160
},
{
"epoch": 0.00198638715007975,
"grad_norm": 0.90625,
"learning_rate": 0.0002999974766630353,
"loss": 0.4944,
"step": 14170
},
{
"epoch": 0.001987788975873737,
"grad_norm": 0.91015625,
"learning_rate": 0.0002999974728293533,
"loss": 0.4509,
"step": 14180
},
{
"epoch": 0.001989190801667724,
"grad_norm": 1.1171875,
"learning_rate": 0.0002999974689927613,
"loss": 0.4779,
"step": 14190
},
{
"epoch": 0.0019905926274617113,
"grad_norm": 0.578125,
"learning_rate": 0.0002999974651532592,
"loss": 0.4435,
"step": 14200
},
{
"epoch": 0.0019919944532556986,
"grad_norm": 0.62109375,
"learning_rate": 0.00029999746131084714,
"loss": 0.4092,
"step": 14210
},
{
"epoch": 0.0019933962790496854,
"grad_norm": 1.1015625,
"learning_rate": 0.0002999974574655251,
"loss": 0.4802,
"step": 14220
},
{
"epoch": 0.0019947981048436727,
"grad_norm": 0.78125,
"learning_rate": 0.000299997453617293,
"loss": 0.4033,
"step": 14230
},
{
"epoch": 0.0019961999306376595,
"grad_norm": 0.494140625,
"learning_rate": 0.00029999744976615095,
"loss": 0.3894,
"step": 14240
},
{
"epoch": 0.001997601756431647,
"grad_norm": 0.671875,
"learning_rate": 0.00029999744591209895,
"loss": 0.35,
"step": 14250
},
{
"epoch": 0.001999003582225634,
"grad_norm": 0.1357421875,
"learning_rate": 0.00029999744205513683,
"loss": 0.4277,
"step": 14260
},
{
"epoch": 0.002000405408019621,
"grad_norm": 0.193359375,
"learning_rate": 0.0002999974381952648,
"loss": 0.3722,
"step": 14270
},
{
"epoch": 0.002001807233813608,
"grad_norm": 0.83203125,
"learning_rate": 0.0002999974343324827,
"loss": 0.4317,
"step": 14280
},
{
"epoch": 0.0020032090596075955,
"grad_norm": 1.1171875,
"learning_rate": 0.0002999974304667906,
"loss": 0.4286,
"step": 14290
},
{
"epoch": 0.0020046108854015823,
"grad_norm": 0.8359375,
"learning_rate": 0.0002999974265981886,
"loss": 0.4539,
"step": 14300
},
{
"epoch": 0.0020060127111955696,
"grad_norm": 0.7265625,
"learning_rate": 0.0002999974227266765,
"loss": 0.4675,
"step": 14310
},
{
"epoch": 0.002007414536989557,
"grad_norm": 0.23046875,
"learning_rate": 0.00029999741885225446,
"loss": 0.4397,
"step": 14320
},
{
"epoch": 0.0020088163627835437,
"grad_norm": 0.890625,
"learning_rate": 0.0002999974149749223,
"loss": 0.4109,
"step": 14330
},
{
"epoch": 0.002010218188577531,
"grad_norm": 0.66015625,
"learning_rate": 0.00029999741109468025,
"loss": 0.3804,
"step": 14340
},
{
"epoch": 0.002011620014371518,
"grad_norm": 0.435546875,
"learning_rate": 0.00029999740721152815,
"loss": 0.3754,
"step": 14350
},
{
"epoch": 0.002013021840165505,
"grad_norm": 0.234375,
"learning_rate": 0.00029999740332546605,
"loss": 0.3823,
"step": 14360
},
{
"epoch": 0.0020144236659594924,
"grad_norm": 0.765625,
"learning_rate": 0.00029999739943649395,
"loss": 0.3991,
"step": 14370
},
{
"epoch": 0.0020158254917534793,
"grad_norm": 0.8671875,
"learning_rate": 0.0002999973955446119,
"loss": 0.4227,
"step": 14380
},
{
"epoch": 0.0020172273175474665,
"grad_norm": 1.1640625,
"learning_rate": 0.0002999973916498198,
"loss": 0.3951,
"step": 14390
},
{
"epoch": 0.002018629143341454,
"grad_norm": 0.55078125,
"learning_rate": 0.0002999973877521177,
"loss": 0.4999,
"step": 14400
},
{
"epoch": 0.0020200309691354407,
"grad_norm": 0.89453125,
"learning_rate": 0.0002999973838515056,
"loss": 0.4185,
"step": 14410
},
{
"epoch": 0.002021432794929428,
"grad_norm": 0.53515625,
"learning_rate": 0.0002999973799479835,
"loss": 0.4898,
"step": 14420
},
{
"epoch": 0.002022834620723415,
"grad_norm": 0.388671875,
"learning_rate": 0.0002999973760415514,
"loss": 0.4813,
"step": 14430
},
{
"epoch": 0.002024236446517402,
"grad_norm": 0.5390625,
"learning_rate": 0.00029999737213220925,
"loss": 0.4236,
"step": 14440
},
{
"epoch": 0.0020256382723113893,
"grad_norm": 0.3125,
"learning_rate": 0.00029999736821995716,
"loss": 0.4339,
"step": 14450
},
{
"epoch": 0.002027040098105376,
"grad_norm": 0.6796875,
"learning_rate": 0.000299997364304795,
"loss": 0.4094,
"step": 14460
},
{
"epoch": 0.0020284419238993634,
"grad_norm": 0.19921875,
"learning_rate": 0.00029999736038672294,
"loss": 0.4625,
"step": 14470
},
{
"epoch": 0.0020298437496933507,
"grad_norm": 0.66796875,
"learning_rate": 0.0002999973564657408,
"loss": 0.33,
"step": 14480
},
{
"epoch": 0.0020312455754873376,
"grad_norm": 0.5,
"learning_rate": 0.00029999735254184867,
"loss": 0.4033,
"step": 14490
},
{
"epoch": 0.002032647401281325,
"grad_norm": 0.64453125,
"learning_rate": 0.0002999973486150466,
"loss": 0.4106,
"step": 14500
},
{
"epoch": 0.002032647401281325,
"eval_loss": 0.1713680624961853,
"eval_runtime": 112.5849,
"eval_samples_per_second": 202.896,
"eval_steps_per_second": 1.59,
"step": 14500
},
{
"epoch": 0.002034049227075312,
"grad_norm": 0.84375,
"learning_rate": 0.00029999734468533445,
"loss": 0.3933,
"step": 14510
},
{
"epoch": 0.002035451052869299,
"grad_norm": 0.39453125,
"learning_rate": 0.0002999973407527123,
"loss": 0.4153,
"step": 14520
},
{
"epoch": 0.0020368528786632862,
"grad_norm": 0.234375,
"learning_rate": 0.0002999973368171802,
"loss": 0.4338,
"step": 14530
},
{
"epoch": 0.0020382547044572735,
"grad_norm": 0.470703125,
"learning_rate": 0.00029999733287873806,
"loss": 0.4352,
"step": 14540
},
{
"epoch": 0.0020396565302512604,
"grad_norm": 0.828125,
"learning_rate": 0.00029999732893738594,
"loss": 0.4688,
"step": 14550
},
{
"epoch": 0.0020410583560452476,
"grad_norm": 0.35546875,
"learning_rate": 0.0002999973249931238,
"loss": 0.436,
"step": 14560
},
{
"epoch": 0.0020424601818392345,
"grad_norm": 0.65625,
"learning_rate": 0.0002999973210459517,
"loss": 0.3661,
"step": 14570
},
{
"epoch": 0.0020438620076332218,
"grad_norm": 0.482421875,
"learning_rate": 0.00029999731709586956,
"loss": 0.3806,
"step": 14580
},
{
"epoch": 0.002045263833427209,
"grad_norm": 0.66015625,
"learning_rate": 0.00029999731314287744,
"loss": 0.4362,
"step": 14590
},
{
"epoch": 0.002046665659221196,
"grad_norm": 0.75390625,
"learning_rate": 0.0002999973091869753,
"loss": 0.3717,
"step": 14600
},
{
"epoch": 0.002048067485015183,
"grad_norm": 0.412109375,
"learning_rate": 0.0002999973052281632,
"loss": 0.4599,
"step": 14610
},
{
"epoch": 0.0020494693108091704,
"grad_norm": 0.291015625,
"learning_rate": 0.0002999973012664411,
"loss": 0.4119,
"step": 14620
},
{
"epoch": 0.0020508711366031573,
"grad_norm": 0.376953125,
"learning_rate": 0.0002999972973018089,
"loss": 0.3842,
"step": 14630
},
{
"epoch": 0.0020522729623971446,
"grad_norm": 0.53515625,
"learning_rate": 0.00029999729333426685,
"loss": 0.5399,
"step": 14640
},
{
"epoch": 0.002053674788191132,
"grad_norm": 0.78515625,
"learning_rate": 0.0002999972893638147,
"loss": 0.3464,
"step": 14650
},
{
"epoch": 0.0020550766139851187,
"grad_norm": 0.4609375,
"learning_rate": 0.00029999728539045257,
"loss": 0.466,
"step": 14660
},
{
"epoch": 0.002056478439779106,
"grad_norm": 0.455078125,
"learning_rate": 0.0002999972814141804,
"loss": 0.4817,
"step": 14670
},
{
"epoch": 0.002057880265573093,
"grad_norm": 0.32421875,
"learning_rate": 0.00029999727743499824,
"loss": 0.3673,
"step": 14680
},
{
"epoch": 0.00205928209136708,
"grad_norm": 1.0,
"learning_rate": 0.00029999727345290613,
"loss": 0.4989,
"step": 14690
},
{
"epoch": 0.0020606839171610674,
"grad_norm": 0.72265625,
"learning_rate": 0.000299997269467904,
"loss": 0.4511,
"step": 14700
},
{
"epoch": 0.002062085742955054,
"grad_norm": 0.78515625,
"learning_rate": 0.00029999726547999187,
"loss": 0.5199,
"step": 14710
},
{
"epoch": 0.0020634875687490415,
"grad_norm": 0.9140625,
"learning_rate": 0.00029999726148916976,
"loss": 0.4247,
"step": 14720
},
{
"epoch": 0.0020648893945430288,
"grad_norm": 0.2158203125,
"learning_rate": 0.0002999972574954376,
"loss": 0.3859,
"step": 14730
},
{
"epoch": 0.0020662912203370156,
"grad_norm": 0.6171875,
"learning_rate": 0.0002999972534987955,
"loss": 0.4503,
"step": 14740
},
{
"epoch": 0.002067693046131003,
"grad_norm": 0.73828125,
"learning_rate": 0.00029999724949924335,
"loss": 0.4461,
"step": 14750
},
{
"epoch": 0.00206909487192499,
"grad_norm": 0.8671875,
"learning_rate": 0.00029999724549678125,
"loss": 0.4595,
"step": 14760
},
{
"epoch": 0.002070496697718977,
"grad_norm": 0.59765625,
"learning_rate": 0.0002999972414914091,
"loss": 0.325,
"step": 14770
},
{
"epoch": 0.0020718985235129643,
"grad_norm": 0.62890625,
"learning_rate": 0.000299997237483127,
"loss": 0.384,
"step": 14780
},
{
"epoch": 0.0020733003493069516,
"grad_norm": 0.64453125,
"learning_rate": 0.00029999723347193485,
"loss": 0.3865,
"step": 14790
},
{
"epoch": 0.0020747021751009384,
"grad_norm": 0.318359375,
"learning_rate": 0.00029999722945783276,
"loss": 0.4034,
"step": 14800
},
{
"epoch": 0.0020761040008949257,
"grad_norm": 0.373046875,
"learning_rate": 0.0002999972254408206,
"loss": 0.3206,
"step": 14810
},
{
"epoch": 0.0020775058266889125,
"grad_norm": 0.73828125,
"learning_rate": 0.0002999972214208985,
"loss": 0.5055,
"step": 14820
},
{
"epoch": 0.0020789076524829,
"grad_norm": 1.09375,
"learning_rate": 0.0002999972173980664,
"loss": 0.5426,
"step": 14830
},
{
"epoch": 0.002080309478276887,
"grad_norm": 0.416015625,
"learning_rate": 0.00029999721337232424,
"loss": 0.5022,
"step": 14840
},
{
"epoch": 0.002081711304070874,
"grad_norm": 1.0390625,
"learning_rate": 0.0002999972093436721,
"loss": 0.4795,
"step": 14850
},
{
"epoch": 0.002083113129864861,
"grad_norm": 0.73828125,
"learning_rate": 0.00029999720531211,
"loss": 0.5243,
"step": 14860
},
{
"epoch": 0.0020845149556588485,
"grad_norm": 0.51953125,
"learning_rate": 0.00029999720127763793,
"loss": 0.4725,
"step": 14870
},
{
"epoch": 0.0020859167814528353,
"grad_norm": 0.73046875,
"learning_rate": 0.00029999719724025574,
"loss": 0.4518,
"step": 14880
},
{
"epoch": 0.0020873186072468226,
"grad_norm": 0.78515625,
"learning_rate": 0.00029999719319996366,
"loss": 0.3732,
"step": 14890
},
{
"epoch": 0.00208872043304081,
"grad_norm": 0.67578125,
"learning_rate": 0.0002999971891567615,
"loss": 0.5069,
"step": 14900
},
{
"epoch": 0.0020901222588347967,
"grad_norm": 0.486328125,
"learning_rate": 0.00029999718511064945,
"loss": 0.4604,
"step": 14910
},
{
"epoch": 0.002091524084628784,
"grad_norm": 0.5078125,
"learning_rate": 0.0002999971810616273,
"loss": 0.4016,
"step": 14920
},
{
"epoch": 0.002092925910422771,
"grad_norm": 0.2080078125,
"learning_rate": 0.00029999717700969524,
"loss": 0.3554,
"step": 14930
},
{
"epoch": 0.002094327736216758,
"grad_norm": 0.703125,
"learning_rate": 0.0002999971729548531,
"loss": 0.3677,
"step": 14940
},
{
"epoch": 0.0020957295620107454,
"grad_norm": 0.703125,
"learning_rate": 0.000299997168897101,
"loss": 0.4108,
"step": 14950
},
{
"epoch": 0.0020971313878047322,
"grad_norm": 0.82421875,
"learning_rate": 0.0002999971648364389,
"loss": 0.5519,
"step": 14960
},
{
"epoch": 0.0020985332135987195,
"grad_norm": 0.296875,
"learning_rate": 0.0002999971607728668,
"loss": 0.4011,
"step": 14970
},
{
"epoch": 0.002099935039392707,
"grad_norm": 0.20703125,
"learning_rate": 0.0002999971567063847,
"loss": 0.2955,
"step": 14980
},
{
"epoch": 0.0021013368651866936,
"grad_norm": 0.859375,
"learning_rate": 0.0002999971526369926,
"loss": 0.4985,
"step": 14990
},
{
"epoch": 0.002102738690980681,
"grad_norm": 0.87890625,
"learning_rate": 0.00029999714856469053,
"loss": 0.3839,
"step": 15000
},
{
"epoch": 0.002102738690980681,
"eval_loss": 0.17203140258789062,
"eval_runtime": 114.2354,
"eval_samples_per_second": 199.964,
"eval_steps_per_second": 1.567,
"step": 15000
}
],
"logging_steps": 10,
"max_steps": 7133554,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 5000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.0473171539266765e+17,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}