{
  "best_metric": null,
  "best_model_checkpoint": null,
  "epoch": 8.0,
  "global_step": 98176,
  "is_hyper_param_search": false,
  "is_local_process_zero": true,
  "is_world_process_zero": true,
  "log_history": [
    {
      "epoch": 0.04,
      "learning_rate": 0.00014924521777216426,
      "loss": 3.2343,
      "step": 500
    },
    {
      "epoch": 0.08,
      "learning_rate": 0.0001484889229546936,
      "loss": 2.1834,
      "step": 1000
    },
    {
      "epoch": 0.12,
      "learning_rate": 0.00014773262813722293,
      "loss": 1.8631,
      "step": 1500
    },
    {
      "epoch": 0.16,
      "learning_rate": 0.00014697633331975228,
      "loss": 1.7172,
      "step": 2000
    },
    {
      "epoch": 0.2,
      "learning_rate": 0.0001462200385022816,
      "loss": 1.5735,
      "step": 2500
    },
    {
      "epoch": 0.24,
      "learning_rate": 0.00014546374368481094,
      "loss": 1.5337,
      "step": 3000
    },
    {
      "epoch": 0.29,
      "learning_rate": 0.00014470744886734026,
      "loss": 1.4352,
      "step": 3500
    },
    {
      "epoch": 0.33,
      "learning_rate": 0.0001439511540498696,
      "loss": 1.3639,
      "step": 4000
    },
    {
      "epoch": 0.37,
      "learning_rate": 0.00014319485923239893,
      "loss": 1.3959,
      "step": 4500
    },
    {
      "epoch": 0.41,
      "learning_rate": 0.00014243856441492828,
      "loss": 1.2958,
      "step": 5000
    },
    {
      "epoch": 0.45,
      "learning_rate": 0.0001416822695974576,
      "loss": 1.2908,
      "step": 5500
    },
    {
      "epoch": 0.49,
      "learning_rate": 0.00014092597477998695,
      "loss": 1.2589,
      "step": 6000
    },
    {
      "epoch": 0.53,
      "learning_rate": 0.0001401696799625163,
      "loss": 1.2189,
      "step": 6500
    },
    {
      "epoch": 0.57,
      "learning_rate": 0.00013941338514504562,
      "loss": 1.1791,
      "step": 7000
    },
    {
      "epoch": 0.61,
      "learning_rate": 0.00013865709032757497,
      "loss": 1.1709,
      "step": 7500
    },
    {
      "epoch": 0.65,
      "learning_rate": 0.0001379007955101043,
      "loss": 1.1492,
      "step": 8000
    },
    {
      "epoch": 0.69,
      "learning_rate": 0.00013714450069263363,
      "loss": 1.1602,
      "step": 8500
    },
    {
      "epoch": 0.73,
      "learning_rate": 0.00013638820587516296,
      "loss": 1.1385,
      "step": 9000
    },
    {
      "epoch": 0.77,
      "learning_rate": 0.0001356319110576923,
      "loss": 1.0983,
      "step": 9500
    },
    {
      "epoch": 0.81,
      "learning_rate": 0.00013487561624022162,
      "loss": 1.0946,
      "step": 10000
    },
    {
      "epoch": 0.86,
      "learning_rate": 0.00013411932142275097,
      "loss": 1.0977,
      "step": 10500
    },
    {
      "epoch": 0.9,
      "learning_rate": 0.0001333630266052803,
      "loss": 1.0727,
      "step": 11000
    },
    {
      "epoch": 0.94,
      "learning_rate": 0.00013260673178780964,
      "loss": 1.0708,
      "step": 11500
    },
    {
      "epoch": 0.98,
      "learning_rate": 0.00013185043697033896,
      "loss": 1.0678,
      "step": 12000
    },
    {
      "epoch": 1.0,
      "eval_accuracy": 0.8031584309730005,
      "eval_loss": 0.6772257089614868,
      "eval_runtime": 17.2927,
      "eval_samples_per_second": 567.582,
      "eval_steps_per_second": 17.753,
      "step": 12272
    },
    {
      "epoch": 1.02,
      "learning_rate": 0.0001310941421528683,
      "loss": 0.946,
      "step": 12500
    },
    {
      "epoch": 1.06,
      "learning_rate": 0.00013033784733539766,
      "loss": 0.7889,
      "step": 13000
    },
    {
      "epoch": 1.1,
      "learning_rate": 0.00012958155251792698,
      "loss": 0.7959,
      "step": 13500
    },
    {
      "epoch": 1.14,
      "learning_rate": 0.0001288252577004563,
      "loss": 0.7989,
      "step": 14000
    },
    {
      "epoch": 1.18,
      "learning_rate": 0.00012806896288298565,
      "loss": 0.7938,
      "step": 14500
    },
    {
      "epoch": 1.22,
      "learning_rate": 0.000127312668065515,
      "loss": 0.802,
      "step": 15000
    },
    {
      "epoch": 1.26,
      "learning_rate": 0.00012655637324804431,
      "loss": 0.8069,
      "step": 15500
    },
    {
      "epoch": 1.3,
      "learning_rate": 0.00012580007843057366,
      "loss": 0.7849,
      "step": 16000
    },
    {
      "epoch": 1.34,
      "learning_rate": 0.00012504378361310298,
      "loss": 0.7909,
      "step": 16500
    },
    {
      "epoch": 1.39,
      "learning_rate": 0.00012428748879563233,
      "loss": 0.8028,
      "step": 17000
    },
    {
      "epoch": 1.43,
      "learning_rate": 0.00012353119397816165,
      "loss": 0.8007,
      "step": 17500
    },
    {
      "epoch": 1.47,
      "learning_rate": 0.000122774899160691,
      "loss": 0.7707,
      "step": 18000
    },
    {
      "epoch": 1.51,
      "learning_rate": 0.00012201860434322033,
      "loss": 0.7635,
      "step": 18500
    },
    {
      "epoch": 1.55,
      "learning_rate": 0.00012126230952574967,
      "loss": 0.7674,
      "step": 19000
    },
    {
      "epoch": 1.59,
      "learning_rate": 0.000120506014708279,
      "loss": 0.765,
      "step": 19500
    },
    {
      "epoch": 1.63,
      "learning_rate": 0.00011974971989080834,
      "loss": 0.7623,
      "step": 20000
    },
    {
      "epoch": 1.67,
      "learning_rate": 0.00011899342507333767,
      "loss": 0.771,
      "step": 20500
    },
    {
      "epoch": 1.71,
      "learning_rate": 0.000118237130255867,
      "loss": 0.7645,
      "step": 21000
    },
    {
      "epoch": 1.75,
      "learning_rate": 0.00011748083543839635,
      "loss": 0.7721,
      "step": 21500
    },
    {
      "epoch": 1.79,
      "learning_rate": 0.00011672454062092567,
      "loss": 0.7613,
      "step": 22000
    },
    {
      "epoch": 1.83,
      "learning_rate": 0.00011596824580345502,
      "loss": 0.7752,
      "step": 22500
    },
    {
      "epoch": 1.87,
      "learning_rate": 0.00011521195098598434,
      "loss": 0.76,
      "step": 23000
    },
    {
      "epoch": 1.91,
      "learning_rate": 0.00011445565616851368,
      "loss": 0.7508,
      "step": 23500
    },
    {
      "epoch": 1.96,
      "learning_rate": 0.00011369936135104301,
      "loss": 0.7423,
      "step": 24000
    },
    {
      "epoch": 2.0,
      "learning_rate": 0.00011294306653357236,
      "loss": 0.7502,
      "step": 24500
    },
    {
      "epoch": 2.0,
      "eval_accuracy": 0.8125318390219053,
      "eval_loss": 0.601111114025116,
      "eval_runtime": 17.2721,
      "eval_samples_per_second": 568.258,
      "eval_steps_per_second": 17.774,
      "step": 24544
    },
    {
      "epoch": 2.04,
      "learning_rate": 0.00011218677171610168,
      "loss": 0.5373,
      "step": 25000
    },
    {
      "epoch": 2.08,
      "learning_rate": 0.00011143047689863103,
      "loss": 0.5311,
      "step": 25500
    },
    {
      "epoch": 2.12,
      "learning_rate": 0.00011067418208116035,
      "loss": 0.5281,
      "step": 26000
    },
    {
      "epoch": 2.16,
      "learning_rate": 0.0001099178872636897,
      "loss": 0.5323,
      "step": 26500
    },
    {
      "epoch": 2.2,
      "learning_rate": 0.00010916159244621903,
      "loss": 0.5389,
      "step": 27000
    },
    {
      "epoch": 2.24,
      "learning_rate": 0.00010840529762874836,
      "loss": 0.5278,
      "step": 27500
    },
    {
      "epoch": 2.28,
      "learning_rate": 0.0001076490028112777,
      "loss": 0.5379,
      "step": 28000
    },
    {
      "epoch": 2.32,
      "learning_rate": 0.00010689270799380703,
      "loss": 0.5394,
      "step": 28500
    },
    {
      "epoch": 2.36,
      "learning_rate": 0.00010613641317633637,
      "loss": 0.5606,
      "step": 29000
    },
    {
      "epoch": 2.4,
      "learning_rate": 0.0001053801183588657,
      "loss": 0.5497,
      "step": 29500
    },
    {
      "epoch": 2.44,
      "learning_rate": 0.00010462382354139505,
      "loss": 0.5558,
      "step": 30000
    },
    {
      "epoch": 2.49,
      "learning_rate": 0.00010386752872392437,
      "loss": 0.544,
      "step": 30500
    },
    {
      "epoch": 2.53,
      "learning_rate": 0.00010311123390645372,
      "loss": 0.5521,
      "step": 31000
    },
    {
      "epoch": 2.57,
      "learning_rate": 0.00010235493908898304,
      "loss": 0.5282,
      "step": 31500
    },
    {
      "epoch": 2.61,
      "learning_rate": 0.00010159864427151239,
      "loss": 0.5406,
      "step": 32000
    },
    {
      "epoch": 2.65,
      "learning_rate": 0.00010084234945404171,
      "loss": 0.5474,
      "step": 32500
    },
    {
      "epoch": 2.69,
      "learning_rate": 0.00010008605463657106,
      "loss": 0.5303,
      "step": 33000
    },
    {
      "epoch": 2.73,
      "learning_rate": 9.932975981910038e-05,
      "loss": 0.532,
      "step": 33500
    },
    {
      "epoch": 2.77,
      "learning_rate": 9.857346500162972e-05,
      "loss": 0.5319,
      "step": 34000
    },
    {
      "epoch": 2.81,
      "learning_rate": 9.781717018415904e-05,
      "loss": 0.5577,
      "step": 34500
    },
    {
      "epoch": 2.85,
      "learning_rate": 9.706087536668839e-05,
      "loss": 0.5361,
      "step": 35000
    },
    {
      "epoch": 2.89,
      "learning_rate": 9.630458054921773e-05,
      "loss": 0.5392,
      "step": 35500
    },
    {
      "epoch": 2.93,
      "learning_rate": 9.554828573174706e-05,
      "loss": 0.5315,
      "step": 36000
    },
    {
      "epoch": 2.97,
      "learning_rate": 9.47919909142764e-05,
      "loss": 0.5483,
      "step": 36500
    },
    {
      "epoch": 3.0,
      "eval_accuracy": 0.825776872134488,
      "eval_loss": 0.5538459420204163,
      "eval_runtime": 17.2811,
      "eval_samples_per_second": 567.96,
      "eval_steps_per_second": 17.765,
      "step": 36816
    },
    {
      "epoch": 3.01,
      "learning_rate": 9.403569609680573e-05,
      "loss": 0.486,
      "step": 37000
    },
    {
      "epoch": 3.06,
      "learning_rate": 9.327940127933506e-05,
      "loss": 0.3941,
      "step": 37500
    },
    {
      "epoch": 3.1,
      "learning_rate": 9.25231064618644e-05,
      "loss": 0.398,
      "step": 38000
    },
    {
      "epoch": 3.14,
      "learning_rate": 9.176681164439373e-05,
      "loss": 0.3799,
      "step": 38500
    },
    {
      "epoch": 3.18,
      "learning_rate": 9.101051682692307e-05,
      "loss": 0.3834,
      "step": 39000
    },
    {
      "epoch": 3.22,
      "learning_rate": 9.025422200945241e-05,
      "loss": 0.3896,
      "step": 39500
    },
    {
      "epoch": 3.26,
      "learning_rate": 8.949792719198173e-05,
      "loss": 0.3882,
      "step": 40000
    },
    {
      "epoch": 3.3,
      "learning_rate": 8.874163237451108e-05,
      "loss": 0.3772,
      "step": 40500
    },
    {
      "epoch": 3.34,
      "learning_rate": 8.798533755704042e-05,
      "loss": 0.4066,
      "step": 41000
    },
    {
      "epoch": 3.38,
      "learning_rate": 8.722904273956975e-05,
      "loss": 0.3934,
      "step": 41500
    },
    {
      "epoch": 3.42,
      "learning_rate": 8.647274792209909e-05,
      "loss": 0.3868,
      "step": 42000
    },
    {
      "epoch": 3.46,
      "learning_rate": 8.571645310462842e-05,
      "loss": 0.3969,
      "step": 42500
    },
    {
      "epoch": 3.5,
      "learning_rate": 8.496015828715775e-05,
      "loss": 0.4174,
      "step": 43000
    },
    {
      "epoch": 3.54,
      "learning_rate": 8.420386346968709e-05,
      "loss": 0.4088,
      "step": 43500
    },
    {
      "epoch": 3.59,
      "learning_rate": 8.344756865221642e-05,
      "loss": 0.4093,
      "step": 44000
    },
    {
      "epoch": 3.63,
      "learning_rate": 8.269127383474576e-05,
      "loss": 0.4071,
      "step": 44500
    },
    {
      "epoch": 3.67,
      "learning_rate": 8.193497901727509e-05,
      "loss": 0.4006,
      "step": 45000
    },
    {
      "epoch": 3.71,
      "learning_rate": 8.117868419980443e-05,
      "loss": 0.3921,
      "step": 45500
    },
    {
      "epoch": 3.75,
      "learning_rate": 8.042238938233376e-05,
      "loss": 0.3861,
      "step": 46000
    },
    {
      "epoch": 3.79,
      "learning_rate": 7.966609456486311e-05,
      "loss": 0.4072,
      "step": 46500
    },
    {
      "epoch": 3.83,
      "learning_rate": 7.890979974739243e-05,
      "loss": 0.4016,
      "step": 47000
    },
    {
      "epoch": 3.87,
      "learning_rate": 7.815350492992178e-05,
      "loss": 0.3961,
      "step": 47500
    },
    {
      "epoch": 3.91,
      "learning_rate": 7.73972101124511e-05,
      "loss": 0.4055,
      "step": 48000
    },
    {
      "epoch": 3.95,
      "learning_rate": 7.664091529498044e-05,
      "loss": 0.388,
      "step": 48500
    },
    {
      "epoch": 3.99,
      "learning_rate": 7.588462047750978e-05,
      "loss": 0.3931,
      "step": 49000
    },
    {
      "epoch": 4.0,
      "eval_accuracy": 0.8269994905756495,
      "eval_loss": 0.5621869564056396,
      "eval_runtime": 17.2846,
      "eval_samples_per_second": 567.848,
      "eval_steps_per_second": 17.762,
      "step": 49088
    },
    {
      "epoch": 4.03,
      "learning_rate": 7.512832566003911e-05,
      "loss": 0.3005,
      "step": 49500
    },
    {
      "epoch": 4.07,
      "learning_rate": 7.437203084256845e-05,
      "loss": 0.2886,
      "step": 50000
    },
    {
      "epoch": 4.12,
      "learning_rate": 7.361573602509778e-05,
      "loss": 0.3041,
      "step": 50500
    },
    {
      "epoch": 4.16,
      "learning_rate": 7.285944120762712e-05,
      "loss": 0.2988,
      "step": 51000
    },
    {
      "epoch": 4.2,
      "learning_rate": 7.210314639015645e-05,
      "loss": 0.286,
      "step": 51500
    },
    {
      "epoch": 4.24,
      "learning_rate": 7.134685157268578e-05,
      "loss": 0.2971,
      "step": 52000
    },
    {
      "epoch": 4.28,
      "learning_rate": 7.059055675521513e-05,
      "loss": 0.3012,
      "step": 52500
    },
    {
      "epoch": 4.32,
      "learning_rate": 6.983426193774445e-05,
      "loss": 0.2965,
      "step": 53000
    },
    {
      "epoch": 4.36,
      "learning_rate": 6.907796712027379e-05,
      "loss": 0.296,
      "step": 53500
    },
    {
      "epoch": 4.4,
      "learning_rate": 6.832167230280312e-05,
      "loss": 0.3082,
      "step": 54000
    },
    {
      "epoch": 4.44,
      "learning_rate": 6.756537748533247e-05,
      "loss": 0.2978,
      "step": 54500
    },
    {
      "epoch": 4.48,
      "learning_rate": 6.68090826678618e-05,
      "loss": 0.313,
      "step": 55000
    },
    {
      "epoch": 4.52,
      "learning_rate": 6.605278785039114e-05,
      "loss": 0.3057,
      "step": 55500
    },
    {
      "epoch": 4.56,
      "learning_rate": 6.529649303292046e-05,
      "loss": 0.2996,
      "step": 56000
    },
    {
      "epoch": 4.6,
      "learning_rate": 6.45401982154498e-05,
      "loss": 0.3079,
      "step": 56500
    },
    {
      "epoch": 4.64,
      "learning_rate": 6.378390339797914e-05,
      "loss": 0.2999,
      "step": 57000
    },
    {
      "epoch": 4.69,
      "learning_rate": 6.302760858050848e-05,
      "loss": 0.299,
      "step": 57500
    },
    {
      "epoch": 4.73,
      "learning_rate": 6.227131376303781e-05,
      "loss": 0.2959,
      "step": 58000
    },
    {
      "epoch": 4.77,
      "learning_rate": 6.151501894556713e-05,
      "loss": 0.3037,
      "step": 58500
    },
    {
      "epoch": 4.81,
      "learning_rate": 6.075872412809648e-05,
      "loss": 0.3018,
      "step": 59000
    },
    {
      "epoch": 4.85,
      "learning_rate": 6.000242931062581e-05,
      "loss": 0.3002,
      "step": 59500
    },
    {
      "epoch": 4.89,
      "learning_rate": 5.9246134493155147e-05,
      "loss": 0.3031,
      "step": 60000
    },
    {
      "epoch": 4.93,
      "learning_rate": 5.8489839675684494e-05,
      "loss": 0.3011,
      "step": 60500
    },
    {
      "epoch": 4.97,
      "learning_rate": 5.773354485821383e-05,
      "loss": 0.3019,
      "step": 61000
    },
    {
      "epoch": 5.0,
      "eval_accuracy": 0.8297503820682629,
      "eval_loss": 0.5692936182022095,
      "eval_runtime": 17.2885,
      "eval_samples_per_second": 567.718,
      "eval_steps_per_second": 17.757,
      "step": 61360
    },
    {
      "epoch": 5.01,
      "learning_rate": 5.697725004074315e-05,
      "loss": 0.285,
      "step": 61500
    },
    {
      "epoch": 5.05,
      "learning_rate": 5.6220955223272484e-05,
      "loss": 0.2305,
      "step": 62000
    },
    {
      "epoch": 5.09,
      "learning_rate": 5.546466040580183e-05,
      "loss": 0.2331,
      "step": 62500
    },
    {
      "epoch": 5.13,
      "learning_rate": 5.4708365588331166e-05,
      "loss": 0.2335,
      "step": 63000
    },
    {
      "epoch": 5.17,
      "learning_rate": 5.39520707708605e-05,
      "loss": 0.2366,
      "step": 63500
    },
    {
      "epoch": 5.22,
      "learning_rate": 5.3195775953389834e-05,
      "loss": 0.2423,
      "step": 64000
    },
    {
      "epoch": 5.26,
      "learning_rate": 5.2439481135919155e-05,
      "loss": 0.2366,
      "step": 64500
    },
    {
      "epoch": 5.3,
      "learning_rate": 5.16831863184485e-05,
      "loss": 0.2326,
      "step": 65000
    },
    {
      "epoch": 5.34,
      "learning_rate": 5.092689150097784e-05,
      "loss": 0.2348,
      "step": 65500
    },
    {
      "epoch": 5.38,
      "learning_rate": 5.017059668350717e-05,
      "loss": 0.231,
      "step": 66000
    },
    {
      "epoch": 5.42,
      "learning_rate": 4.941430186603652e-05,
      "loss": 0.2385,
      "step": 66500
    },
    {
      "epoch": 5.46,
      "learning_rate": 4.865800704856584e-05,
      "loss": 0.2432,
      "step": 67000
    },
    {
      "epoch": 5.5,
      "learning_rate": 4.7901712231095174e-05,
      "loss": 0.2414,
      "step": 67500
    },
    {
      "epoch": 5.54,
      "learning_rate": 4.714541741362451e-05,
      "loss": 0.236,
      "step": 68000
    },
    {
      "epoch": 5.58,
      "learning_rate": 4.6389122596153856e-05,
      "loss": 0.2326,
      "step": 68500
    },
    {
      "epoch": 5.62,
      "learning_rate": 4.563282777868319e-05,
      "loss": 0.2373,
      "step": 69000
    },
    {
      "epoch": 5.66,
      "learning_rate": 4.4876532961212525e-05,
      "loss": 0.2357,
      "step": 69500
    },
    {
      "epoch": 5.7,
      "learning_rate": 4.4120238143741846e-05,
      "loss": 0.2366,
      "step": 70000
    },
    {
      "epoch": 5.74,
      "learning_rate": 4.336394332627118e-05,
      "loss": 0.2324,
      "step": 70500
    },
    {
      "epoch": 5.79,
      "learning_rate": 4.260764850880053e-05,
      "loss": 0.2443,
      "step": 71000
    },
    {
      "epoch": 5.83,
      "learning_rate": 4.185135369132986e-05,
      "loss": 0.2253,
      "step": 71500
    },
    {
      "epoch": 5.87,
      "learning_rate": 4.1095058873859196e-05,
      "loss": 0.2271,
      "step": 72000
    },
    {
      "epoch": 5.91,
      "learning_rate": 4.0338764056388544e-05,
      "loss": 0.2349,
      "step": 72500
    },
    {
      "epoch": 5.95,
      "learning_rate": 3.9582469238917865e-05,
      "loss": 0.2423,
      "step": 73000
    },
    {
      "epoch": 5.99,
      "learning_rate": 3.88261744214472e-05,
      "loss": 0.2332,
      "step": 73500
    },
    {
      "epoch": 6.0,
      "eval_accuracy": 0.832603158430973,
      "eval_loss": 0.5357151031494141,
      "eval_runtime": 17.3146,
      "eval_samples_per_second": 566.864,
      "eval_steps_per_second": 17.731,
      "step": 73632
    },
    {
      "epoch": 6.03,
      "learning_rate": 3.8069879603976533e-05,
      "loss": 0.195,
      "step": 74000
    },
    {
      "epoch": 6.07,
      "learning_rate": 3.731358478650588e-05,
      "loss": 0.1976,
      "step": 74500
    },
    {
      "epoch": 6.11,
      "learning_rate": 3.6557289969035216e-05,
      "loss": 0.1914,
      "step": 75000
    },
    {
      "epoch": 6.15,
      "learning_rate": 3.5800995151564536e-05,
      "loss": 0.1925,
      "step": 75500
    },
    {
      "epoch": 6.19,
      "learning_rate": 3.504470033409387e-05,
      "loss": 0.1952,
      "step": 76000
    },
    {
      "epoch": 6.23,
      "learning_rate": 3.4288405516623205e-05,
      "loss": 0.1884,
      "step": 76500
    },
    {
      "epoch": 6.27,
      "learning_rate": 3.353211069915255e-05,
      "loss": 0.1891,
      "step": 77000
    },
    {
      "epoch": 6.32,
      "learning_rate": 3.277581588168189e-05,
      "loss": 0.1911,
      "step": 77500
    },
    {
      "epoch": 6.36,
      "learning_rate": 3.201952106421122e-05,
      "loss": 0.1901,
      "step": 78000
    },
    {
      "epoch": 6.4,
      "learning_rate": 3.126322624674054e-05,
      "loss": 0.1955,
      "step": 78500
    },
    {
      "epoch": 6.44,
      "learning_rate": 3.050693142926989e-05,
      "loss": 0.1857,
      "step": 79000
    },
    {
      "epoch": 6.48,
      "learning_rate": 2.9750636611799224e-05,
      "loss": 0.1912,
      "step": 79500
    },
    {
      "epoch": 6.52,
      "learning_rate": 2.8994341794328558e-05,
      "loss": 0.1948,
      "step": 80000
    },
    {
      "epoch": 6.56,
      "learning_rate": 2.8238046976857906e-05,
      "loss": 0.1868,
      "step": 80500
    },
    {
      "epoch": 6.6,
      "learning_rate": 2.7481752159387227e-05,
      "loss": 0.1927,
      "step": 81000
    },
    {
      "epoch": 6.64,
      "learning_rate": 2.6725457341916548e-05,
      "loss": 0.1909,
      "step": 81500
    },
    {
      "epoch": 6.68,
      "learning_rate": 2.5969162524445895e-05,
      "loss": 0.1867,
      "step": 82000
    },
    {
      "epoch": 6.72,
      "learning_rate": 2.5212867706975243e-05,
      "loss": 0.1891,
      "step": 82500
    },
    {
      "epoch": 6.76,
      "learning_rate": 2.4456572889504564e-05,
      "loss": 0.187,
      "step": 83000
    },
    {
      "epoch": 6.8,
      "learning_rate": 2.3700278072033912e-05,
      "loss": 0.1873,
      "step": 83500
    },
    {
      "epoch": 6.84,
      "learning_rate": 2.2943983254563233e-05,
      "loss": 0.1932,
      "step": 84000
    },
    {
      "epoch": 6.89,
      "learning_rate": 2.218768843709258e-05,
      "loss": 0.1862,
      "step": 84500
    },
    {
      "epoch": 6.93,
      "learning_rate": 2.14313936196219e-05,
      "loss": 0.1918,
      "step": 85000
    },
    {
      "epoch": 6.97,
      "learning_rate": 2.067509880215125e-05,
      "loss": 0.1891,
      "step": 85500
    },
    {
      "epoch": 7.0,
      "eval_accuracy": 0.8338257768721344,
      "eval_loss": 0.5010091066360474,
      "eval_runtime": 17.2782,
      "eval_samples_per_second": 568.058,
      "eval_steps_per_second": 17.768,
      "step": 85904
    },
    {
      "epoch": 7.01,
      "learning_rate": 1.9918803984680597e-05,
      "loss": 0.1853,
      "step": 86000
    },
    {
      "epoch": 7.05,
      "learning_rate": 1.9162509167209917e-05,
      "loss": 0.1645,
      "step": 86500
    },
    {
      "epoch": 7.09,
      "learning_rate": 1.8406214349739238e-05,
      "loss": 0.1671,
      "step": 87000
    },
    {
      "epoch": 7.13,
      "learning_rate": 1.7649919532268586e-05,
      "loss": 0.1637,
      "step": 87500
    },
    {
      "epoch": 7.17,
      "learning_rate": 1.6893624714797934e-05,
      "loss": 0.1615,
      "step": 88000
    },
    {
      "epoch": 7.21,
      "learning_rate": 1.6137329897327255e-05,
      "loss": 0.1631,
      "step": 88500
    },
    {
      "epoch": 7.25,
      "learning_rate": 1.5381035079856602e-05,
      "loss": 0.1622,
      "step": 89000
    },
    {
      "epoch": 7.29,
      "learning_rate": 1.4624740262385923e-05,
      "loss": 0.1611,
      "step": 89500
    },
    {
      "epoch": 7.33,
      "learning_rate": 1.3868445444915271e-05,
      "loss": 0.1606,
      "step": 90000
    },
    {
      "epoch": 7.37,
      "learning_rate": 1.3112150627444592e-05,
      "loss": 0.1674,
      "step": 90500
    },
    {
      "epoch": 7.42,
      "learning_rate": 1.235585580997394e-05,
      "loss": 0.158,
      "step": 91000
    },
    {
      "epoch": 7.46,
      "learning_rate": 1.159956099250326e-05,
      "loss": 0.1654,
      "step": 91500
    },
    {
      "epoch": 7.5,
      "learning_rate": 1.0843266175032608e-05,
      "loss": 0.1624,
      "step": 92000
    },
    {
      "epoch": 7.54,
      "learning_rate": 1.0086971357561929e-05,
      "loss": 0.1625,
      "step": 92500
    },
    {
      "epoch": 7.58,
      "learning_rate": 9.330676540091277e-06,
      "loss": 0.1644,
      "step": 93000
    },
    {
      "epoch": 7.62,
      "learning_rate": 8.574381722620597e-06,
      "loss": 0.1606,
      "step": 93500
    },
    {
      "epoch": 7.66,
      "learning_rate": 7.818086905149945e-06,
      "loss": 0.158,
      "step": 94000
    },
    {
      "epoch": 7.7,
      "learning_rate": 7.061792087679293e-06,
      "loss": 0.1608,
      "step": 94500
    },
    {
      "epoch": 7.74,
      "learning_rate": 6.305497270208614e-06,
      "loss": 0.1574,
      "step": 95000
    },
    {
      "epoch": 7.78,
      "learning_rate": 5.549202452737934e-06,
      "loss": 0.1582,
      "step": 95500
    },
    {
      "epoch": 7.82,
      "learning_rate": 4.792907635267282e-06,
      "loss": 0.1578,
      "step": 96000
    },
    {
      "epoch": 7.86,
      "learning_rate": 4.03661281779663e-06,
      "loss": 0.1575,
      "step": 96500
    },
    {
      "epoch": 7.9,
      "learning_rate": 3.280318000325951e-06,
      "loss": 0.1576,
      "step": 97000
    },
    {
      "epoch": 7.94,
      "learning_rate": 2.5240231828552715e-06,
      "loss": 0.1554,
      "step": 97500
    },
    {
      "epoch": 7.99,
      "learning_rate": 1.7677283653846194e-06,
      "loss": 0.1579,
      "step": 98000
    },
    {
      "epoch": 8.0,
      "eval_accuracy": 0.834538970962812,
      "eval_loss": 0.4911147356033325,
      "eval_runtime": 17.2228,
      "eval_samples_per_second": 569.883,
      "eval_steps_per_second": 17.825,
      "step": 98176
    },
    {
      "epoch": 8.0,
      "step": 98176,
      "total_flos": 2.066503307372421e+17,
      "train_loss": 0.4992688764688089,
      "train_runtime": 13851.009,
      "train_samples_per_second": 226.815,
      "train_steps_per_second": 7.088
    }
  ],
  "max_steps": 98176,
  "num_train_epochs": 8,
  "total_flos": 2.066503307372421e+17,
  "trial_name": null,
  "trial_params": null
}
