{ "best_global_step": 1250, "best_metric": 0.6746268656716418, "best_model_checkpoint": "./hindi-turn-detector-with-random-pause/checkpoint-1250", "epoch": 40.0, "eval_steps": 250, "global_step": 12520, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.003194888178913738, "grad_norm": 0.2883206307888031, "learning_rate": 0.0, "loss": 0.6896321773529053, "step": 1 }, { "epoch": 0.07987220447284345, "grad_norm": 0.25245413184165955, "learning_rate": 9.584664536741213e-07, "loss": 0.6931432882944742, "step": 25 }, { "epoch": 0.1597444089456869, "grad_norm": 0.2390768676996231, "learning_rate": 1.956869009584665e-06, "loss": 0.6935350799560547, "step": 50 }, { "epoch": 0.23961661341853036, "grad_norm": 0.32674992084503174, "learning_rate": 2.9552715654952076e-06, "loss": 0.6921991729736328, "step": 75 }, { "epoch": 0.3194888178913738, "grad_norm": 0.2817870080471039, "learning_rate": 3.953674121405751e-06, "loss": 0.6968302917480469, "step": 100 }, { "epoch": 0.3993610223642173, "grad_norm": 0.554409921169281, "learning_rate": 4.952076677316294e-06, "loss": 0.6937577056884766, "step": 125 }, { "epoch": 0.4792332268370607, "grad_norm": 0.31101664900779724, "learning_rate": 5.9504792332268375e-06, "loss": 0.6945550537109375, "step": 150 }, { "epoch": 0.5591054313099042, "grad_norm": 0.9808236956596375, "learning_rate": 6.948881789137381e-06, "loss": 0.6940096282958984, "step": 175 }, { "epoch": 0.6389776357827476, "grad_norm": 0.2638174593448639, "learning_rate": 7.947284345047925e-06, "loss": 0.6913721466064453, "step": 200 }, { "epoch": 0.7188498402555911, "grad_norm": 0.3444884717464447, "learning_rate": 8.945686900958466e-06, "loss": 0.6932373046875, "step": 225 }, { "epoch": 0.7987220447284346, "grad_norm": 0.2740936577320099, "learning_rate": 9.944089456869011e-06, "loss": 0.6939858245849609, "step": 250 }, { "epoch": 0.7987220447284346, "eval_clean_accuracy": 0.4915, "eval_clean_f1": 0.0, "eval_clean_loss": 0.6934637427330017, "eval_clean_precision": 0.0, "eval_clean_recall": 0.0, "eval_clean_runtime": 34.6587, "eval_clean_samples_per_second": 57.705, "eval_clean_steps_per_second": 3.607, "step": 250 }, { "epoch": 0.7987220447284346, "eval_augmented_accuracy": 0.4915, "eval_augmented_f1": 0.0, "eval_augmented_loss": 0.6934822797775269, "eval_augmented_precision": 0.0, "eval_augmented_recall": 0.0, "eval_augmented_runtime": 29.8423, "eval_augmented_samples_per_second": 67.019, "eval_augmented_steps_per_second": 4.189, "step": 250 }, { "epoch": 0.8785942492012779, "grad_norm": 0.34350141882896423, "learning_rate": 1.0942492012779554e-05, "loss": 0.6938841247558594, "step": 275 }, { "epoch": 0.9584664536741214, "grad_norm": 0.6665162444114685, "learning_rate": 1.1940894568690096e-05, "loss": 0.6949723815917969, "step": 300 }, { "epoch": 1.038338658146965, "grad_norm": 0.25526002049446106, "learning_rate": 1.2939297124600639e-05, "loss": 0.6916822814941406, "step": 325 }, { "epoch": 1.1182108626198084, "grad_norm": 0.6241167187690735, "learning_rate": 1.3937699680511182e-05, "loss": 0.6933050537109375, "step": 350 }, { "epoch": 1.1980830670926517, "grad_norm": 0.25860217213630676, "learning_rate": 1.4936102236421725e-05, "loss": 0.6930201721191406, "step": 375 }, { "epoch": 1.2779552715654952, "grad_norm": 0.5774083137512207, "learning_rate": 1.593450479233227e-05, "loss": 0.6921266937255859, "step": 400 }, { "epoch": 1.3578274760383386, "grad_norm": 0.23852217197418213, "learning_rate": 1.693290734824281e-05, "loss": 0.6938272094726563, "step": 425 }, { "epoch": 1.4376996805111821, "grad_norm": 0.560047447681427, "learning_rate": 1.7931309904153356e-05, "loss": 0.6932786560058594, "step": 450 }, { "epoch": 1.5175718849840254, "grad_norm": 0.3192247748374939, "learning_rate": 1.8929712460063898e-05, "loss": 0.6930686950683593, "step": 475 }, { "epoch": 1.5974440894568689, "grad_norm": 0.23776456713676453, "learning_rate": 1.9928115015974443e-05, "loss": 0.6937667846679687, "step": 500 }, { "epoch": 1.5974440894568689, "eval_clean_accuracy": 0.4975, "eval_clean_f1": 0.10026857654431513, "eval_clean_loss": 0.6930975317955017, "eval_clean_precision": 0.56, "eval_clean_recall": 0.05506391347099312, "eval_clean_runtime": 33.1121, "eval_clean_samples_per_second": 60.401, "eval_clean_steps_per_second": 3.775, "step": 500 }, { "epoch": 1.5974440894568689, "eval_augmented_accuracy": 0.495, "eval_augmented_f1": 0.06826568265682657, "eval_augmented_loss": 0.6931169629096985, "eval_augmented_precision": 0.5522388059701493, "eval_augmented_recall": 0.03638151425762045, "eval_augmented_runtime": 30.6269, "eval_augmented_samples_per_second": 65.302, "eval_augmented_steps_per_second": 4.081, "step": 500 }, { "epoch": 1.6773162939297124, "grad_norm": 0.29247793555259705, "learning_rate": 2.0926517571884984e-05, "loss": 0.6938433074951171, "step": 525 }, { "epoch": 1.7571884984025559, "grad_norm": 0.37967005372047424, "learning_rate": 2.192492012779553e-05, "loss": 0.6913555145263672, "step": 550 }, { "epoch": 1.8370607028753994, "grad_norm": 0.31195276975631714, "learning_rate": 2.2923322683706074e-05, "loss": 0.6889801025390625, "step": 575 }, { "epoch": 1.9169329073482428, "grad_norm": 0.533378005027771, "learning_rate": 2.3921725239616615e-05, "loss": 0.6971231842041016, "step": 600 }, { "epoch": 1.9968051118210863, "grad_norm": 0.7513779997825623, "learning_rate": 2.4920127795527157e-05, "loss": 0.6914308929443359, "step": 625 }, { "epoch": 2.07667731629393, "grad_norm": 0.3030257821083069, "learning_rate": 2.59185303514377e-05, "loss": 0.6920938110351562, "step": 650 }, { "epoch": 2.1565495207667733, "grad_norm": 1.021827220916748, "learning_rate": 2.6916932907348246e-05, "loss": 0.6944525909423828, "step": 675 }, { "epoch": 2.236421725239617, "grad_norm": 0.2505548298358917, "learning_rate": 2.7915335463258784e-05, "loss": 0.6934576416015625, "step": 700 }, { "epoch": 2.31629392971246, "grad_norm": 0.37802571058273315, "learning_rate": 2.891373801916933e-05, "loss": 0.6969516754150391, "step": 725 }, { "epoch": 2.3961661341853033, "grad_norm": 0.2197747677564621, "learning_rate": 2.991214057507987e-05, "loss": 0.6927249908447266, "step": 750 }, { "epoch": 2.3961661341853033, "eval_clean_accuracy": 0.4915, "eval_clean_f1": 0.0, "eval_clean_loss": 0.6932904124259949, "eval_clean_precision": 0.0, "eval_clean_recall": 0.0, "eval_clean_runtime": 33.8254, "eval_clean_samples_per_second": 59.127, "eval_clean_steps_per_second": 3.695, "step": 750 }, { "epoch": 2.3961661341853033, "eval_augmented_accuracy": 0.4915, "eval_augmented_f1": 0.0, "eval_augmented_loss": 0.6933077573776245, "eval_augmented_precision": 0.0, "eval_augmented_recall": 0.0, "eval_augmented_runtime": 30.2273, "eval_augmented_samples_per_second": 66.165, "eval_augmented_steps_per_second": 4.135, "step": 750 }, { "epoch": 2.476038338658147, "grad_norm": 0.21496742963790894, "learning_rate": 3.091054313099042e-05, "loss": 0.6920840454101562, "step": 775 }, { "epoch": 2.5559105431309903, "grad_norm": 0.5312646627426147, "learning_rate": 3.190894568690096e-05, "loss": 0.6936175537109375, "step": 800 }, { "epoch": 2.635782747603834, "grad_norm": 0.4458845257759094, "learning_rate": 3.29073482428115e-05, "loss": 0.6940583038330078, "step": 825 }, { "epoch": 2.7156549520766773, "grad_norm": 0.22794711589813232, "learning_rate": 3.390575079872205e-05, "loss": 0.6929411315917968, "step": 850 }, { "epoch": 2.7955271565495208, "grad_norm": 0.23644143342971802, "learning_rate": 3.490415335463259e-05, "loss": 0.6925041961669922, "step": 875 }, { "epoch": 2.8753993610223643, "grad_norm": 0.3468873202800751, "learning_rate": 3.590255591054313e-05, "loss": 0.6920020294189453, "step": 900 }, { "epoch": 2.9552715654952078, "grad_norm": 0.6852853298187256, "learning_rate": 3.6900958466453675e-05, "loss": 0.6937090301513672, "step": 925 }, { "epoch": 3.0351437699680512, "grad_norm": 1.0674840211868286, "learning_rate": 3.789936102236422e-05, "loss": 0.6914962005615234, "step": 950 }, { "epoch": 3.1150159744408947, "grad_norm": 0.35107919573783875, "learning_rate": 3.889776357827476e-05, "loss": 0.6971194458007812, "step": 975 }, { "epoch": 3.194888178913738, "grad_norm": 0.5715221762657166, "learning_rate": 3.9896166134185306e-05, "loss": 0.6927030944824218, "step": 1000 }, { "epoch": 3.194888178913738, "eval_clean_accuracy": 0.511, "eval_clean_f1": 0.3810126582278481, "eval_clean_loss": 0.6929503083229065, "eval_clean_precision": 0.5346358792184724, "eval_clean_recall": 0.295968534906588, "eval_clean_runtime": 34.28, "eval_clean_samples_per_second": 58.343, "eval_clean_steps_per_second": 3.646, "step": 1000 }, { "epoch": 3.194888178913738, "eval_augmented_accuracy": 0.515, "eval_augmented_f1": 0.36435124508519, "eval_augmented_loss": 0.6929616928100586, "eval_augmented_precision": 0.5461689587426326, "eval_augmented_recall": 0.27335299901671584, "eval_augmented_runtime": 31.0735, "eval_augmented_samples_per_second": 64.363, "eval_augmented_steps_per_second": 4.023, "step": 1000 }, { "epoch": 3.2747603833865817, "grad_norm": 0.6498229503631592, "learning_rate": 4.089456869009585e-05, "loss": 0.6925680541992187, "step": 1025 }, { "epoch": 3.3546325878594248, "grad_norm": 0.2622945010662079, "learning_rate": 4.189297124600639e-05, "loss": 0.6922956085205079, "step": 1050 }, { "epoch": 3.4345047923322682, "grad_norm": 0.2166820764541626, "learning_rate": 4.289137380191694e-05, "loss": 0.6926412963867188, "step": 1075 }, { "epoch": 3.5143769968051117, "grad_norm": 0.5455684065818787, "learning_rate": 4.388977635782748e-05, "loss": 0.6937994384765624, "step": 1100 }, { "epoch": 3.594249201277955, "grad_norm": 0.20547226071357727, "learning_rate": 4.488817891373802e-05, "loss": 0.6934342193603515, "step": 1125 }, { "epoch": 3.6741214057507987, "grad_norm": 0.195872500538826, "learning_rate": 4.588658146964857e-05, "loss": 0.6928849029541015, "step": 1150 }, { "epoch": 3.753993610223642, "grad_norm": 0.24172364175319672, "learning_rate": 4.688498402555911e-05, "loss": 0.6920479583740234, "step": 1175 }, { "epoch": 3.8338658146964857, "grad_norm": 0.6604349613189697, "learning_rate": 4.788338658146965e-05, "loss": 0.6918457794189453, "step": 1200 }, { "epoch": 3.913738019169329, "grad_norm": 0.5852692127227783, "learning_rate": 4.88817891373802e-05, "loss": 0.6921061706542969, "step": 1225 }, { "epoch": 3.9936102236421727, "grad_norm": 0.4076306223869324, "learning_rate": 4.988019169329074e-05, "loss": 0.6926720428466797, "step": 1250 }, { "epoch": 3.9936102236421727, "eval_clean_accuracy": 0.5095, "eval_clean_f1": 0.6746268656716418, "eval_clean_loss": 0.6926307082176208, "eval_clean_precision": 0.509009009009009, "eval_clean_recall": 1.0, "eval_clean_runtime": 34.1161, "eval_clean_samples_per_second": 58.623, "eval_clean_steps_per_second": 3.664, "step": 1250 }, { "epoch": 3.9936102236421727, "eval_augmented_accuracy": 0.5095, "eval_augmented_f1": 0.6746268656716418, "eval_augmented_loss": 0.6926261782646179, "eval_augmented_precision": 0.509009009009009, "eval_augmented_recall": 1.0, "eval_augmented_runtime": 30.6425, "eval_augmented_samples_per_second": 65.269, "eval_augmented_steps_per_second": 4.079, "step": 1250 }, { "epoch": 4.073482428115016, "grad_norm": 0.30610182881355286, "learning_rate": 4.990237841675542e-05, "loss": 0.6928215789794921, "step": 1275 }, { "epoch": 4.15335463258786, "grad_norm": 0.5450588464736938, "learning_rate": 4.9791444799432026e-05, "loss": 0.6929315948486328, "step": 1300 }, { "epoch": 4.233226837060703, "grad_norm": 0.31410035490989685, "learning_rate": 4.968051118210863e-05, "loss": 0.6950419616699218, "step": 1325 }, { "epoch": 4.313099041533547, "grad_norm": 0.4130215048789978, "learning_rate": 4.9569577564785236e-05, "loss": 0.6916370391845703, "step": 1350 }, { "epoch": 4.39297124600639, "grad_norm": 0.38931983709335327, "learning_rate": 4.945864394746184e-05, "loss": 0.6945597839355468, "step": 1375 }, { "epoch": 4.472843450479234, "grad_norm": 0.3162858188152313, "learning_rate": 4.9347710330138446e-05, "loss": 0.6929592895507812, "step": 1400 }, { "epoch": 4.552715654952077, "grad_norm": 0.5499141812324524, "learning_rate": 4.923677671281505e-05, "loss": 0.6943866729736328, "step": 1425 }, { "epoch": 4.63258785942492, "grad_norm": 0.3438010811805725, "learning_rate": 4.9125843095491656e-05, "loss": 0.6956953430175781, "step": 1450 }, { "epoch": 4.712460063897764, "grad_norm": 0.3442906141281128, "learning_rate": 4.901490947816826e-05, "loss": 0.6934724426269532, "step": 1475 }, { "epoch": 4.792332268370607, "grad_norm": 0.3835424780845642, "learning_rate": 4.890397586084487e-05, "loss": 0.6923387145996094, "step": 1500 }, { "epoch": 4.792332268370607, "eval_clean_accuracy": 0.4915, "eval_clean_f1": 0.0, "eval_clean_loss": 0.6948066353797913, "eval_clean_precision": 0.0, "eval_clean_recall": 0.0, "eval_clean_runtime": 32.2665, "eval_clean_samples_per_second": 61.984, "eval_clean_steps_per_second": 3.874, "step": 1500 }, { "epoch": 4.792332268370607, "eval_augmented_accuracy": 0.4915, "eval_augmented_f1": 0.0, "eval_augmented_loss": 0.6948114037513733, "eval_augmented_precision": 0.0, "eval_augmented_recall": 0.0, "eval_augmented_runtime": 31.2592, "eval_augmented_samples_per_second": 63.981, "eval_augmented_steps_per_second": 3.999, "step": 1500 }, { "epoch": 4.872204472843451, "grad_norm": 0.5358346700668335, "learning_rate": 4.879304224352148e-05, "loss": 0.6931078338623047, "step": 1525 }, { "epoch": 4.952076677316294, "grad_norm": 0.23204444348812103, "learning_rate": 4.868210862619809e-05, "loss": 0.6916581726074219, "step": 1550 }, { "epoch": 5.031948881789138, "grad_norm": 0.280714213848114, "learning_rate": 4.8571175008874695e-05, "loss": 0.6893549346923828, "step": 1575 }, { "epoch": 5.111821086261981, "grad_norm": 0.3513096570968628, "learning_rate": 4.84602413915513e-05, "loss": 0.6926087188720703, "step": 1600 }, { "epoch": 5.1916932907348246, "grad_norm": 0.23980778455734253, "learning_rate": 4.8349307774227905e-05, "loss": 0.692583236694336, "step": 1625 }, { "epoch": 5.271565495207668, "grad_norm": 0.35494354367256165, "learning_rate": 4.823837415690451e-05, "loss": 0.6944719696044922, "step": 1650 }, { "epoch": 5.3514376996805115, "grad_norm": 0.24524670839309692, "learning_rate": 4.8127440539581115e-05, "loss": 0.6932095336914063, "step": 1675 }, { "epoch": 5.431309904153355, "grad_norm": 0.3762999176979065, "learning_rate": 4.8016506922257726e-05, "loss": 0.6932958984375, "step": 1700 }, { "epoch": 5.511182108626198, "grad_norm": 0.18768614530563354, "learning_rate": 4.790557330493433e-05, "loss": 0.6931791687011719, "step": 1725 }, { "epoch": 5.5910543130990416, "grad_norm": 0.1844535768032074, "learning_rate": 4.7794639687610936e-05, "loss": 0.6915782165527343, "step": 1750 }, { "epoch": 5.5910543130990416, "eval_clean_accuracy": 0.4915, "eval_clean_f1": 0.0, "eval_clean_loss": 0.69354248046875, "eval_clean_precision": 0.0, "eval_clean_recall": 0.0, "eval_clean_runtime": 34.5196, "eval_clean_samples_per_second": 57.938, "eval_clean_steps_per_second": 3.621, "step": 1750 }, { "epoch": 5.5910543130990416, "eval_augmented_accuracy": 0.4915, "eval_augmented_f1": 0.0, "eval_augmented_loss": 0.6935250163078308, "eval_augmented_precision": 0.0, "eval_augmented_recall": 0.0, "eval_augmented_runtime": 29.7229, "eval_augmented_samples_per_second": 67.288, "eval_augmented_steps_per_second": 4.206, "step": 1750 }, { "epoch": 5.6709265175718855, "grad_norm": 0.57716304063797, "learning_rate": 4.768370607028754e-05, "loss": 0.6939422607421875, "step": 1775 }, { "epoch": 5.7507987220447285, "grad_norm": 0.5363743901252747, "learning_rate": 4.7572772452964146e-05, "loss": 0.693788070678711, "step": 1800 }, { "epoch": 5.830670926517572, "grad_norm": 0.23618537187576294, "learning_rate": 4.746183883564075e-05, "loss": 0.69465576171875, "step": 1825 }, { "epoch": 5.9105431309904155, "grad_norm": 0.3445783853530884, "learning_rate": 4.7350905218317356e-05, "loss": 0.6924256134033203, "step": 1850 }, { "epoch": 5.9904153354632586, "grad_norm": 0.1893107295036316, "learning_rate": 4.723997160099397e-05, "loss": 0.6914960479736328, "step": 1875 }, { "epoch": 6.0702875399361025, "grad_norm": 0.5083995461463928, "learning_rate": 4.712903798367057e-05, "loss": 0.6920110321044922, "step": 1900 }, { "epoch": 6.1501597444089455, "grad_norm": 0.43163037300109863, "learning_rate": 4.7018104366347185e-05, "loss": 0.6914286041259765, "step": 1925 }, { "epoch": 6.2300319488817895, "grad_norm": 0.3551303446292877, "learning_rate": 4.690717074902379e-05, "loss": 0.6924679565429688, "step": 1950 }, { "epoch": 6.3099041533546325, "grad_norm": 0.27475863695144653, "learning_rate": 4.6796237131700395e-05, "loss": 0.6937818908691407, "step": 1975 }, { "epoch": 6.389776357827476, "grad_norm": 0.463184654712677, "learning_rate": 4.6685303514377e-05, "loss": 0.692324447631836, "step": 2000 }, { "epoch": 6.389776357827476, "eval_clean_accuracy": 0.502, "eval_clean_f1": 0.18226600985221675, "eval_clean_loss": 0.6926903128623962, "eval_clean_precision": 0.5522388059701493, "eval_clean_recall": 0.10914454277286136, "eval_clean_runtime": 32.1104, "eval_clean_samples_per_second": 62.285, "eval_clean_steps_per_second": 3.893, "step": 2000 }, { "epoch": 6.389776357827476, "eval_augmented_accuracy": 0.5055, "eval_augmented_f1": 0.1778886118038238, "eval_augmented_loss": 0.6926705241203308, "eval_augmented_precision": 0.5752688172043011, "eval_augmented_recall": 0.10521140609636184, "eval_augmented_runtime": 29.4343, "eval_augmented_samples_per_second": 67.948, "eval_augmented_steps_per_second": 4.247, "step": 2000 }, { "epoch": 6.4696485623003195, "grad_norm": 0.21478381752967834, "learning_rate": 4.6574369897053605e-05, "loss": 0.6931537628173828, "step": 2025 }, { "epoch": 6.549520766773163, "grad_norm": 0.3934791386127472, "learning_rate": 4.646343627973021e-05, "loss": 0.6926422119140625, "step": 2050 }, { "epoch": 6.6293929712460065, "grad_norm": 0.35103505849838257, "learning_rate": 4.6352502662406815e-05, "loss": 0.6913346099853516, "step": 2075 }, { "epoch": 6.7092651757188495, "grad_norm": 0.18466247618198395, "learning_rate": 4.624156904508342e-05, "loss": 0.6920499420166015, "step": 2100 }, { "epoch": 6.789137380191693, "grad_norm": 0.2414858192205429, "learning_rate": 4.613063542776003e-05, "loss": 0.6945747375488281, "step": 2125 }, { "epoch": 6.8690095846645365, "grad_norm": 0.2077651023864746, "learning_rate": 4.601970181043664e-05, "loss": 0.693421630859375, "step": 2150 }, { "epoch": 6.94888178913738, "grad_norm": 0.4983648359775543, "learning_rate": 4.590876819311324e-05, "loss": 0.6934370422363281, "step": 2175 }, { "epoch": 7.0287539936102235, "grad_norm": 0.48634180426597595, "learning_rate": 4.579783457578985e-05, "loss": 0.6913689422607422, "step": 2200 }, { "epoch": 7.108626198083067, "grad_norm": 0.2766863703727722, "learning_rate": 4.568690095846646e-05, "loss": 0.6925562286376953, "step": 2225 }, { "epoch": 7.18849840255591, "grad_norm": 0.2734798491001129, "learning_rate": 4.5575967341143063e-05, "loss": 0.690192642211914, "step": 2250 }, { "epoch": 7.18849840255591, "eval_clean_accuracy": 0.4915, "eval_clean_f1": 0.0, "eval_clean_loss": 0.6946340203285217, "eval_clean_precision": 0.0, "eval_clean_recall": 0.0, "eval_clean_runtime": 34.6814, "eval_clean_samples_per_second": 57.668, "eval_clean_steps_per_second": 3.604, "step": 2250 }, { "epoch": 7.18849840255591, "eval_augmented_accuracy": 0.4915, "eval_augmented_f1": 0.0, "eval_augmented_loss": 0.6945730447769165, "eval_augmented_precision": 0.0, "eval_augmented_recall": 0.0, "eval_augmented_runtime": 29.6489, "eval_augmented_samples_per_second": 67.456, "eval_augmented_steps_per_second": 4.216, "step": 2250 }, { "epoch": 7.268370607028754, "grad_norm": 0.23758989572525024, "learning_rate": 4.546503372381967e-05, "loss": 0.6932064819335938, "step": 2275 }, { "epoch": 7.348242811501597, "grad_norm": 0.3253862261772156, "learning_rate": 4.5354100106496273e-05, "loss": 0.6924712371826172, "step": 2300 }, { "epoch": 7.428115015974441, "grad_norm": 0.2099786102771759, "learning_rate": 4.5243166489172885e-05, "loss": 0.6922653961181641, "step": 2325 }, { "epoch": 7.507987220447284, "grad_norm": 0.41098782420158386, "learning_rate": 4.513223287184949e-05, "loss": 0.6928124237060547, "step": 2350 }, { "epoch": 7.587859424920127, "grad_norm": 0.23519529402256012, "learning_rate": 4.5021299254526095e-05, "loss": 0.6909280395507813, "step": 2375 }, { "epoch": 7.667731629392971, "grad_norm": 0.1674896776676178, "learning_rate": 4.49103656372027e-05, "loss": 0.6926034545898437, "step": 2400 }, { "epoch": 7.747603833865814, "grad_norm": 0.21411055326461792, "learning_rate": 4.4799432019879305e-05, "loss": 0.6912857055664062, "step": 2425 }, { "epoch": 7.827476038338658, "grad_norm": 0.21066918969154358, "learning_rate": 4.468849840255591e-05, "loss": 0.6917049407958984, "step": 2450 }, { "epoch": 7.907348242811501, "grad_norm": 0.471419095993042, "learning_rate": 4.4577564785232515e-05, "loss": 0.6937718200683594, "step": 2475 }, { "epoch": 7.987220447284345, "grad_norm": 0.31218448281288147, "learning_rate": 4.446663116790912e-05, "loss": 0.6920021057128907, "step": 2500 }, { "epoch": 7.987220447284345, "eval_clean_accuracy": 0.541, "eval_clean_f1": 0.5069817400644469, "eval_clean_loss": 0.690984308719635, "eval_clean_precision": 0.5585798816568047, "eval_clean_recall": 0.464110127826942, "eval_clean_runtime": 33.6597, "eval_clean_samples_per_second": 59.418, "eval_clean_steps_per_second": 3.714, "step": 2500 }, { "epoch": 7.987220447284345, "eval_augmented_accuracy": 0.544, "eval_augmented_f1": 0.5143769968051118, "eval_augmented_loss": 0.690878689289093, "eval_augmented_precision": 0.5609756097560976, "eval_augmented_recall": 0.4749262536873156, "eval_augmented_runtime": 31.7609, "eval_augmented_samples_per_second": 62.971, "eval_augmented_steps_per_second": 3.936, "step": 2500 }, { "epoch": 8.06709265175719, "grad_norm": 0.37489280104637146, "learning_rate": 4.435569755058573e-05, "loss": 0.6908959197998047, "step": 2525 }, { "epoch": 8.146964856230031, "grad_norm": 0.908626914024353, "learning_rate": 4.424476393326234e-05, "loss": 0.6871607208251953, "step": 2550 }, { "epoch": 8.226837060702875, "grad_norm": 0.9754641652107239, "learning_rate": 4.413383031593895e-05, "loss": 0.6947063446044922, "step": 2575 }, { "epoch": 8.30670926517572, "grad_norm": 0.25100165605545044, "learning_rate": 4.4022896698615554e-05, "loss": 0.6897225952148438, "step": 2600 }, { "epoch": 8.386581469648561, "grad_norm": 0.23590749502182007, "learning_rate": 4.391196308129216e-05, "loss": 0.6927493286132812, "step": 2625 }, { "epoch": 8.466453674121405, "grad_norm": 0.33823162317276, "learning_rate": 4.3801029463968764e-05, "loss": 0.6899152374267579, "step": 2650 }, { "epoch": 8.54632587859425, "grad_norm": 0.7824804782867432, "learning_rate": 4.369009584664537e-05, "loss": 0.689374771118164, "step": 2675 }, { "epoch": 8.626198083067093, "grad_norm": 0.38478273153305054, "learning_rate": 4.3579162229321974e-05, "loss": 0.692662353515625, "step": 2700 }, { "epoch": 8.706070287539935, "grad_norm": 0.5058249235153198, "learning_rate": 4.3468228611998585e-05, "loss": 0.6922527313232422, "step": 2725 }, { "epoch": 8.78594249201278, "grad_norm": 0.4660913050174713, "learning_rate": 4.335729499467519e-05, "loss": 0.6891600799560547, "step": 2750 }, { "epoch": 8.78594249201278, "eval_clean_accuracy": 0.517, "eval_clean_f1": 0.33195020746887965, "eval_clean_loss": 0.6907315850257874, "eval_clean_precision": 0.5594405594405595, "eval_clean_recall": 0.2359882005899705, "eval_clean_runtime": 33.54, "eval_clean_samples_per_second": 59.63, "eval_clean_steps_per_second": 3.727, "step": 2750 }, { "epoch": 8.78594249201278, "eval_augmented_accuracy": 0.523, "eval_augmented_f1": 0.345679012345679, "eval_augmented_loss": 0.6905369758605957, "eval_augmented_precision": 0.5714285714285714, "eval_augmented_recall": 0.24778761061946902, "eval_augmented_runtime": 30.731, "eval_augmented_samples_per_second": 65.081, "eval_augmented_steps_per_second": 4.068, "step": 2750 }, { "epoch": 8.865814696485623, "grad_norm": 0.290395587682724, "learning_rate": 4.3246361377351795e-05, "loss": 0.6839760589599609, "step": 2775 }, { "epoch": 8.945686900958467, "grad_norm": 0.2287125140428543, "learning_rate": 4.31354277600284e-05, "loss": 0.6892105865478516, "step": 2800 }, { "epoch": 9.02555910543131, "grad_norm": 0.4816032350063324, "learning_rate": 4.3024494142705005e-05, "loss": 0.6869503021240234, "step": 2825 }, { "epoch": 9.105431309904153, "grad_norm": 0.22106756269931793, "learning_rate": 4.291356052538161e-05, "loss": 0.6909124755859375, "step": 2850 }, { "epoch": 9.185303514376997, "grad_norm": 0.2709738612174988, "learning_rate": 4.2802626908058215e-05, "loss": 0.6915639495849609, "step": 2875 }, { "epoch": 9.26517571884984, "grad_norm": 0.40492090582847595, "learning_rate": 4.269169329073483e-05, "loss": 0.6932810974121094, "step": 2900 }, { "epoch": 9.345047923322683, "grad_norm": 0.17956207692623138, "learning_rate": 4.258075967341143e-05, "loss": 0.6929026794433594, "step": 2925 }, { "epoch": 9.424920127795527, "grad_norm": 0.255532830953598, "learning_rate": 4.2469826056088044e-05, "loss": 0.6867471313476563, "step": 2950 }, { "epoch": 9.504792332268371, "grad_norm": 0.8398897051811218, "learning_rate": 4.235889243876465e-05, "loss": 0.6875145721435547, "step": 2975 }, { "epoch": 9.584664536741213, "grad_norm": 0.2684268355369568, "learning_rate": 4.2247958821441254e-05, "loss": 0.6902009582519532, "step": 3000 }, { "epoch": 9.584664536741213, "eval_clean_accuracy": 0.529, "eval_clean_f1": 0.42700729927007297, "eval_clean_loss": 0.6891399621963501, "eval_clean_precision": 0.5598086124401914, "eval_clean_recall": 0.34513274336283184, "eval_clean_runtime": 34.2242, "eval_clean_samples_per_second": 58.438, "eval_clean_steps_per_second": 3.652, "step": 3000 }, { "epoch": 9.584664536741213, "eval_augmented_accuracy": 0.5325, "eval_augmented_f1": 0.4391121775644871, "eval_augmented_loss": 0.6887292265892029, "eval_augmented_precision": 0.563076923076923, "eval_augmented_recall": 0.35988200589970504, "eval_augmented_runtime": 29.8432, "eval_augmented_samples_per_second": 67.017, "eval_augmented_steps_per_second": 4.189, "step": 3000 }, { "epoch": 9.664536741214057, "grad_norm": 0.243172287940979, "learning_rate": 4.213702520411786e-05, "loss": 0.6893289184570313, "step": 3025 }, { "epoch": 9.744408945686901, "grad_norm": 0.5178836584091187, "learning_rate": 4.2026091586794464e-05, "loss": 0.690941390991211, "step": 3050 }, { "epoch": 9.824281150159745, "grad_norm": 0.7474732995033264, "learning_rate": 4.191515796947107e-05, "loss": 0.6919541931152344, "step": 3075 }, { "epoch": 9.904153354632587, "grad_norm": 0.770294725894928, "learning_rate": 4.1804224352147674e-05, "loss": 0.688648681640625, "step": 3100 }, { "epoch": 9.984025559105431, "grad_norm": 0.731899082660675, "learning_rate": 4.169329073482428e-05, "loss": 0.6895152282714844, "step": 3125 }, { "epoch": 10.063897763578275, "grad_norm": 0.4415922462940216, "learning_rate": 4.158235711750089e-05, "loss": 0.689161376953125, "step": 3150 }, { "epoch": 10.143769968051119, "grad_norm": 0.33014625310897827, "learning_rate": 4.1471423500177496e-05, "loss": 0.6908439636230469, "step": 3175 }, { "epoch": 10.223642172523961, "grad_norm": 0.6157719492912292, "learning_rate": 4.13604898828541e-05, "loss": 0.6899446105957031, "step": 3200 }, { "epoch": 10.303514376996805, "grad_norm": 1.1706154346466064, "learning_rate": 4.1249556265530706e-05, "loss": 0.6906720733642578, "step": 3225 }, { "epoch": 10.383386581469649, "grad_norm": 0.9940587878227234, "learning_rate": 4.113862264820732e-05, "loss": 0.6884101104736328, "step": 3250 }, { "epoch": 10.383386581469649, "eval_clean_accuracy": 0.542, "eval_clean_f1": 0.47477064220183485, "eval_clean_loss": 0.6874005198478699, "eval_clean_precision": 0.5694635488308115, "eval_clean_recall": 0.40707964601769914, "eval_clean_runtime": 32.9801, "eval_clean_samples_per_second": 60.643, "eval_clean_steps_per_second": 3.79, "step": 3250 }, { "epoch": 10.383386581469649, "eval_augmented_accuracy": 0.5425, "eval_augmented_f1": 0.48099829835507657, "eval_augmented_loss": 0.6869681477546692, "eval_augmented_precision": 0.5683646112600537, "eval_augmented_recall": 0.4169124877089479, "eval_augmented_runtime": 30.1302, "eval_augmented_samples_per_second": 66.379, "eval_augmented_steps_per_second": 4.149, "step": 3250 }, { "epoch": 10.463258785942491, "grad_norm": 0.5975030660629272, "learning_rate": 4.102768903088392e-05, "loss": 0.6894921875, "step": 3275 }, { "epoch": 10.543130990415335, "grad_norm": 0.7122635841369629, "learning_rate": 4.091675541356053e-05, "loss": 0.6870769500732422, "step": 3300 }, { "epoch": 10.62300319488818, "grad_norm": 0.3613066077232361, "learning_rate": 4.080582179623713e-05, "loss": 0.6862059020996094, "step": 3325 }, { "epoch": 10.702875399361023, "grad_norm": 1.4200611114501953, "learning_rate": 4.0694888178913744e-05, "loss": 0.6843251800537109, "step": 3350 }, { "epoch": 10.782747603833865, "grad_norm": 0.4258898198604584, "learning_rate": 4.058395456159035e-05, "loss": 0.6848390197753906, "step": 3375 }, { "epoch": 10.86261980830671, "grad_norm": 0.6340741515159607, "learning_rate": 4.0473020944266954e-05, "loss": 0.6875802612304688, "step": 3400 }, { "epoch": 10.942492012779553, "grad_norm": 0.3716268539428711, "learning_rate": 4.036208732694356e-05, "loss": 0.6786625671386719, "step": 3425 }, { "epoch": 11.022364217252397, "grad_norm": 0.7905110120773315, "learning_rate": 4.0251153709620164e-05, "loss": 0.685107192993164, "step": 3450 }, { "epoch": 11.10223642172524, "grad_norm": 0.8364579081535339, "learning_rate": 4.014022009229677e-05, "loss": 0.6898184204101563, "step": 3475 }, { "epoch": 11.182108626198083, "grad_norm": 1.428097128868103, "learning_rate": 4.0029286474973374e-05, "loss": 0.6875643157958984, "step": 3500 }, { "epoch": 11.182108626198083, "eval_clean_accuracy": 0.558, "eval_clean_f1": 0.6444086886564763, "eval_clean_loss": 0.6838710904121399, "eval_clean_precision": 0.5452688904016337, "eval_clean_recall": 0.7876106194690266, "eval_clean_runtime": 34.1231, "eval_clean_samples_per_second": 58.611, "eval_clean_steps_per_second": 3.663, "step": 3500 }, { "epoch": 11.182108626198083, "eval_augmented_accuracy": 0.565, "eval_augmented_f1": 0.655035685963521, "eval_augmented_loss": 0.6830967664718628, "eval_augmented_precision": 0.5488372093023256, "eval_augmented_recall": 0.8121927236971485, "eval_augmented_runtime": 29.6683, "eval_augmented_samples_per_second": 67.412, "eval_augmented_steps_per_second": 4.213, "step": 3500 }, { "epoch": 11.261980830670927, "grad_norm": 0.4920814037322998, "learning_rate": 3.991835285764998e-05, "loss": 0.691617431640625, "step": 3525 }, { "epoch": 11.34185303514377, "grad_norm": 0.4980928897857666, "learning_rate": 3.980741924032659e-05, "loss": 0.6838597106933594, "step": 3550 }, { "epoch": 11.421725239616613, "grad_norm": 1.6589033603668213, "learning_rate": 3.9696485623003196e-05, "loss": 0.6904528045654297, "step": 3575 }, { "epoch": 11.501597444089457, "grad_norm": 0.7934449911117554, "learning_rate": 3.958555200567981e-05, "loss": 0.6799409484863281, "step": 3600 }, { "epoch": 11.581469648562301, "grad_norm": 1.7702116966247559, "learning_rate": 3.947461838835641e-05, "loss": 0.6819952392578125, "step": 3625 }, { "epoch": 11.661341853035143, "grad_norm": 0.9274622201919556, "learning_rate": 3.936368477103302e-05, "loss": 0.6840552520751954, "step": 3650 }, { "epoch": 11.741214057507987, "grad_norm": 2.4630277156829834, "learning_rate": 3.925275115370962e-05, "loss": 0.6755684661865234, "step": 3675 }, { "epoch": 11.821086261980831, "grad_norm": 2.2732789516448975, "learning_rate": 3.914181753638623e-05, "loss": 0.6860934448242187, "step": 3700 }, { "epoch": 11.900958466453675, "grad_norm": 0.7743794322013855, "learning_rate": 3.903088391906283e-05, "loss": 0.6857310485839844, "step": 3725 }, { "epoch": 11.980830670926517, "grad_norm": 0.9160413146018982, "learning_rate": 3.891995030173944e-05, "loss": 0.6832009887695313, "step": 3750 }, { "epoch": 11.980830670926517, "eval_clean_accuracy": 0.531, "eval_clean_f1": 0.29685157421289354, "eval_clean_loss": 0.6903945207595825, "eval_clean_precision": 0.6246056782334385, "eval_clean_recall": 0.19469026548672566, "eval_clean_runtime": 33.316, "eval_clean_samples_per_second": 60.031, "eval_clean_steps_per_second": 3.752, "step": 3750 }, { "epoch": 11.980830670926517, "eval_augmented_accuracy": 0.5335, "eval_augmented_f1": 0.3083765752409192, "eval_augmented_loss": 0.6889277696609497, "eval_augmented_precision": 0.6265060240963856, "eval_augmented_recall": 0.20452310717797442, "eval_augmented_runtime": 30.8927, "eval_augmented_samples_per_second": 64.74, "eval_augmented_steps_per_second": 4.046, "step": 3750 }, { "epoch": 12.060702875399361, "grad_norm": 0.4228605031967163, "learning_rate": 3.880901668441605e-05, "loss": 0.6796161651611328, "step": 3775 }, { "epoch": 12.140575079872205, "grad_norm": 2.307777166366577, "learning_rate": 3.8698083067092655e-05, "loss": 0.6856385040283203, "step": 3800 }, { "epoch": 12.220447284345047, "grad_norm": 0.6298303604125977, "learning_rate": 3.858714944976926e-05, "loss": 0.685772933959961, "step": 3825 }, { "epoch": 12.300319488817891, "grad_norm": 0.5264445543289185, "learning_rate": 3.8476215832445865e-05, "loss": 0.6871209716796876, "step": 3850 }, { "epoch": 12.380191693290735, "grad_norm": 1.5505491495132446, "learning_rate": 3.836528221512247e-05, "loss": 0.6813423156738281, "step": 3875 }, { "epoch": 12.460063897763579, "grad_norm": 0.8887673616409302, "learning_rate": 3.8254348597799075e-05, "loss": 0.6710480499267578, "step": 3900 }, { "epoch": 12.539936102236421, "grad_norm": 1.3204156160354614, "learning_rate": 3.8143414980475686e-05, "loss": 0.682125473022461, "step": 3925 }, { "epoch": 12.619808306709265, "grad_norm": 0.5151321291923523, "learning_rate": 3.803248136315229e-05, "loss": 0.692225341796875, "step": 3950 }, { "epoch": 12.699680511182109, "grad_norm": 1.0014621019363403, "learning_rate": 3.79215477458289e-05, "loss": 0.6860102844238282, "step": 3975 }, { "epoch": 12.779552715654953, "grad_norm": 2.095574378967285, "learning_rate": 3.781061412850551e-05, "loss": 0.6859668731689453, "step": 4000 }, { "epoch": 12.779552715654953, "eval_clean_accuracy": 0.554, "eval_clean_f1": 0.5162689804772235, "eval_clean_loss": 0.6819943785667419, "eval_clean_precision": 0.5755743651753326, "eval_clean_recall": 0.46804326450344147, "eval_clean_runtime": 34.0935, "eval_clean_samples_per_second": 58.662, "eval_clean_steps_per_second": 3.666, "step": 4000 }, { "epoch": 12.779552715654953, "eval_augmented_accuracy": 0.561, "eval_augmented_f1": 0.5284640171858217, "eval_augmented_loss": 0.6808395385742188, "eval_augmented_precision": 0.5822485207100592, "eval_augmented_recall": 0.4837758112094395, "eval_augmented_runtime": 29.8252, "eval_augmented_samples_per_second": 67.057, "eval_augmented_steps_per_second": 4.191, "step": 4000 }, { "epoch": 12.859424920127795, "grad_norm": 0.7939204573631287, "learning_rate": 3.769968051118211e-05, "loss": 0.6816622924804687, "step": 4025 }, { "epoch": 12.939297124600639, "grad_norm": 1.1205075979232788, "learning_rate": 3.758874689385872e-05, "loss": 0.6791896820068359, "step": 4050 }, { "epoch": 13.019169329073483, "grad_norm": 1.61153244972229, "learning_rate": 3.747781327653532e-05, "loss": 0.6782984161376953, "step": 4075 }, { "epoch": 13.099041533546325, "grad_norm": 0.9964043498039246, "learning_rate": 3.736687965921193e-05, "loss": 0.6809487915039063, "step": 4100 }, { "epoch": 13.178913738019169, "grad_norm": 0.6037688851356506, "learning_rate": 3.725594604188853e-05, "loss": 0.6868339538574219, "step": 4125 }, { "epoch": 13.258785942492013, "grad_norm": 1.604499340057373, "learning_rate": 3.714501242456514e-05, "loss": 0.6866207122802734, "step": 4150 }, { "epoch": 13.338658146964857, "grad_norm": 0.9306694865226746, "learning_rate": 3.703407880724175e-05, "loss": 0.6767100524902344, "step": 4175 }, { "epoch": 13.418530351437699, "grad_norm": 0.6224928498268127, "learning_rate": 3.6923145189918355e-05, "loss": 0.6751785278320312, "step": 4200 }, { "epoch": 13.498402555910543, "grad_norm": 1.616791009902954, "learning_rate": 3.681221157259496e-05, "loss": 0.6902670288085937, "step": 4225 }, { "epoch": 13.578274760383387, "grad_norm": 1.2521517276763916, "learning_rate": 3.6701277955271565e-05, "loss": 0.6730992126464844, "step": 4250 }, { "epoch": 13.578274760383387, "eval_clean_accuracy": 0.5465, "eval_clean_f1": 0.36529041287613717, "eval_clean_loss": 0.689034104347229, "eval_clean_precision": 0.633495145631068, "eval_clean_recall": 0.25663716814159293, "eval_clean_runtime": 33.6025, "eval_clean_samples_per_second": 59.519, "eval_clean_steps_per_second": 3.72, "step": 4250 }, { "epoch": 13.578274760383387, "eval_augmented_accuracy": 0.5385, "eval_augmented_f1": 0.35947258848022207, "eval_augmented_loss": 0.6870416402816772, "eval_augmented_precision": 0.6108490566037735, "eval_augmented_recall": 0.25467059980334317, "eval_augmented_runtime": 31.2869, "eval_augmented_samples_per_second": 63.924, "eval_augmented_steps_per_second": 3.995, "step": 4250 }, { "epoch": 13.65814696485623, "grad_norm": 1.1391735076904297, "learning_rate": 3.659034433794818e-05, "loss": 0.675126953125, "step": 4275 }, { "epoch": 13.738019169329073, "grad_norm": 1.259421706199646, "learning_rate": 3.647941072062478e-05, "loss": 0.695101089477539, "step": 4300 }, { "epoch": 13.817891373801917, "grad_norm": 0.8527193665504456, "learning_rate": 3.636847710330139e-05, "loss": 0.6871870422363281, "step": 4325 }, { "epoch": 13.89776357827476, "grad_norm": 2.2800869941711426, "learning_rate": 3.625754348597799e-05, "loss": 0.6773894500732421, "step": 4350 }, { "epoch": 13.977635782747605, "grad_norm": 1.132982611656189, "learning_rate": 3.61466098686546e-05, "loss": 0.6827352142333984, "step": 4375 }, { "epoch": 14.057507987220447, "grad_norm": 0.837197482585907, "learning_rate": 3.603567625133121e-05, "loss": 0.6788474273681641, "step": 4400 }, { "epoch": 14.13738019169329, "grad_norm": 2.451500654220581, "learning_rate": 3.5924742634007813e-05, "loss": 0.67593017578125, "step": 4425 }, { "epoch": 14.217252396166135, "grad_norm": 1.526659369468689, "learning_rate": 3.581380901668442e-05, "loss": 0.6814579772949219, "step": 4450 }, { "epoch": 14.297124600638977, "grad_norm": 0.6166465282440186, "learning_rate": 3.5702875399361023e-05, "loss": 0.6746681213378907, "step": 4475 }, { "epoch": 14.37699680511182, "grad_norm": 0.9064220190048218, "learning_rate": 3.559194178203763e-05, "loss": 0.6772802734375, "step": 4500 }, { "epoch": 14.37699680511182, "eval_clean_accuracy": 0.5635, "eval_clean_f1": 0.5701624815361891, "eval_clean_loss": 0.6785374283790588, "eval_clean_precision": 0.5710059171597633, "eval_clean_recall": 0.5693215339233039, "eval_clean_runtime": 33.7055, "eval_clean_samples_per_second": 59.338, "eval_clean_steps_per_second": 3.709, "step": 4500 }, { "epoch": 14.37699680511182, "eval_augmented_accuracy": 0.5635, "eval_augmented_f1": 0.5747686312713103, "eval_augmented_loss": 0.6769245862960815, "eval_augmented_precision": 0.5694980694980695, "eval_augmented_recall": 0.5801376597836775, "eval_augmented_runtime": 31.3558, "eval_augmented_samples_per_second": 63.784, "eval_augmented_steps_per_second": 3.987, "step": 4500 }, { "epoch": 14.456869009584665, "grad_norm": 0.7795005440711975, "learning_rate": 3.5481008164714233e-05, "loss": 0.668537368774414, "step": 4525 }, { "epoch": 14.536741214057509, "grad_norm": 0.78399258852005, "learning_rate": 3.537007454739084e-05, "loss": 0.6843498992919922, "step": 4550 }, { "epoch": 14.616613418530351, "grad_norm": 3.1861672401428223, "learning_rate": 3.525914093006745e-05, "loss": 0.6822104644775391, "step": 4575 }, { "epoch": 14.696485623003195, "grad_norm": 0.5887438058853149, "learning_rate": 3.5148207312744055e-05, "loss": 0.6802976226806641, "step": 4600 }, { "epoch": 14.776357827476039, "grad_norm": 1.2932939529418945, "learning_rate": 3.503727369542067e-05, "loss": 0.6756951904296875, "step": 4625 }, { "epoch": 14.856230031948883, "grad_norm": 1.1603795289993286, "learning_rate": 3.492634007809727e-05, "loss": 0.6811387634277344, "step": 4650 }, { "epoch": 14.936102236421725, "grad_norm": 1.692797064781189, "learning_rate": 3.481540646077388e-05, "loss": 0.6824274444580078, "step": 4675 }, { "epoch": 15.015974440894569, "grad_norm": 1.1609903573989868, "learning_rate": 3.470447284345048e-05, "loss": 0.6849394989013672, "step": 4700 }, { "epoch": 15.095846645367413, "grad_norm": 0.5538493394851685, "learning_rate": 3.459353922612709e-05, "loss": 0.6796182250976562, "step": 4725 }, { "epoch": 15.175718849840255, "grad_norm": 0.49411752820014954, "learning_rate": 3.448260560880369e-05, "loss": 0.6828838348388672, "step": 4750 }, { "epoch": 15.175718849840255, "eval_clean_accuracy": 0.538, "eval_clean_f1": 0.35384615384615387, "eval_clean_loss": 0.6851739287376404, "eval_clean_precision": 0.612590799031477, "eval_clean_recall": 0.2487708947885939, "eval_clean_runtime": 34.302, "eval_clean_samples_per_second": 58.306, "eval_clean_steps_per_second": 3.644, "step": 4750 }, { "epoch": 15.175718849840255, "eval_augmented_accuracy": 0.5375, "eval_augmented_f1": 0.36860068259385664, "eval_augmented_loss": 0.6832825541496277, "eval_augmented_precision": 0.6026785714285714, "eval_augmented_recall": 0.26548672566371684, "eval_augmented_runtime": 29.951, "eval_augmented_samples_per_second": 66.776, "eval_augmented_steps_per_second": 4.173, "step": 4750 }, { "epoch": 15.255591054313099, "grad_norm": 2.054399251937866, "learning_rate": 3.43716719914803e-05, "loss": 0.6801234436035156, "step": 4775 }, { "epoch": 15.335463258785943, "grad_norm": 0.6770100593566895, "learning_rate": 3.426073837415691e-05, "loss": 0.6694075012207031, "step": 4800 }, { "epoch": 15.415335463258787, "grad_norm": 1.5511246919631958, "learning_rate": 3.4149804756833514e-05, "loss": 0.68526123046875, "step": 4825 }, { "epoch": 15.495207667731629, "grad_norm": 0.6473249197006226, "learning_rate": 3.403887113951012e-05, "loss": 0.689395751953125, "step": 4850 }, { "epoch": 15.575079872204473, "grad_norm": 2.3839354515075684, "learning_rate": 3.3927937522186724e-05, "loss": 0.6767897033691406, "step": 4875 }, { "epoch": 15.654952076677317, "grad_norm": 1.3463577032089233, "learning_rate": 3.381700390486333e-05, "loss": 0.67908203125, "step": 4900 }, { "epoch": 15.73482428115016, "grad_norm": 1.494915246963501, "learning_rate": 3.3706070287539934e-05, "loss": 0.6685578918457031, "step": 4925 }, { "epoch": 15.814696485623003, "grad_norm": 0.8909364342689514, "learning_rate": 3.3595136670216546e-05, "loss": 0.6756020355224609, "step": 4950 }, { "epoch": 15.894568690095847, "grad_norm": 1.4074715375900269, "learning_rate": 3.348420305289315e-05, "loss": 0.6734630584716796, "step": 4975 }, { "epoch": 15.97444089456869, "grad_norm": 3.0902669429779053, "learning_rate": 3.3373269435569756e-05, "loss": 0.6877674102783203, "step": 5000 }, { "epoch": 15.97444089456869, "eval_clean_accuracy": 0.576, "eval_clean_f1": 0.6388415672913118, "eval_clean_loss": 0.6751288771629333, "eval_clean_precision": 0.5634861006761833, "eval_clean_recall": 0.7374631268436578, "eval_clean_runtime": 34.7477, "eval_clean_samples_per_second": 57.558, "eval_clean_steps_per_second": 3.597, "step": 5000 }, { "epoch": 15.97444089456869, "eval_augmented_accuracy": 0.5775, "eval_augmented_f1": 0.6454049517415023, "eval_augmented_loss": 0.6737979054450989, "eval_augmented_precision": 0.5629575402635432, "eval_augmented_recall": 0.7561455260570304, "eval_augmented_runtime": 29.9397, "eval_augmented_samples_per_second": 66.801, "eval_augmented_steps_per_second": 4.175, "step": 5000 }, { "epoch": 16.054313099041533, "grad_norm": 1.5176664590835571, "learning_rate": 3.326233581824637e-05, "loss": 0.6722899627685547, "step": 5025 }, { "epoch": 16.13418530351438, "grad_norm": 1.8893030881881714, "learning_rate": 3.315140220092297e-05, "loss": 0.6862458801269531, "step": 5050 }, { "epoch": 16.21405750798722, "grad_norm": 3.1753957271575928, "learning_rate": 3.304046858359958e-05, "loss": 0.6804229736328125, "step": 5075 }, { "epoch": 16.293929712460063, "grad_norm": 1.6981494426727295, "learning_rate": 3.292953496627618e-05, "loss": 0.6797464752197265, "step": 5100 }, { "epoch": 16.37380191693291, "grad_norm": 0.7878615260124207, "learning_rate": 3.281860134895279e-05, "loss": 0.669582748413086, "step": 5125 }, { "epoch": 16.45367412140575, "grad_norm": 1.4818352460861206, "learning_rate": 3.270766773162939e-05, "loss": 0.6776148986816406, "step": 5150 }, { "epoch": 16.533546325878593, "grad_norm": 1.4869595766067505, "learning_rate": 3.2596734114306e-05, "loss": 0.6783391571044922, "step": 5175 }, { "epoch": 16.61341853035144, "grad_norm": 2.2803726196289062, "learning_rate": 3.24858004969826e-05, "loss": 0.6792208862304687, "step": 5200 }, { "epoch": 16.69329073482428, "grad_norm": 3.2748398780822754, "learning_rate": 3.2374866879659214e-05, "loss": 0.6774639892578125, "step": 5225 }, { "epoch": 16.773162939297123, "grad_norm": 1.0331459045410156, "learning_rate": 3.226393326233582e-05, "loss": 0.6673771667480469, "step": 5250 }, { "epoch": 16.773162939297123, "eval_clean_accuracy": 0.568, "eval_clean_f1": 0.5658291457286432, "eval_clean_loss": 0.6753886938095093, "eval_clean_precision": 0.578622816032888, "eval_clean_recall": 0.5535889872173058, "eval_clean_runtime": 33.4829, "eval_clean_samples_per_second": 59.732, "eval_clean_steps_per_second": 3.733, "step": 5250 }, { "epoch": 16.773162939297123, "eval_augmented_accuracy": 0.5675, "eval_augmented_f1": 0.571570084200099, "eval_augmented_loss": 0.6734784841537476, "eval_augmented_precision": 0.5758483033932136, "eval_augmented_recall": 0.567354965585054, "eval_augmented_runtime": 30.0468, "eval_augmented_samples_per_second": 66.563, "eval_augmented_steps_per_second": 4.16, "step": 5250 }, { "epoch": 16.85303514376997, "grad_norm": 1.368146538734436, "learning_rate": 3.2152999645012424e-05, "loss": 0.6752625274658203, "step": 5275 }, { "epoch": 16.93290734824281, "grad_norm": 2.876441478729248, "learning_rate": 3.2042066027689036e-05, "loss": 0.6829261016845704, "step": 5300 }, { "epoch": 17.012779552715656, "grad_norm": 3.051685094833374, "learning_rate": 3.193113241036564e-05, "loss": 0.6870038604736328, "step": 5325 }, { "epoch": 17.0926517571885, "grad_norm": 2.636775016784668, "learning_rate": 3.1820198793042246e-05, "loss": 0.672601089477539, "step": 5350 }, { "epoch": 17.17252396166134, "grad_norm": 1.8897804021835327, "learning_rate": 3.170926517571885e-05, "loss": 0.6798480224609375, "step": 5375 }, { "epoch": 17.252396166134186, "grad_norm": 4.866381645202637, "learning_rate": 3.1598331558395456e-05, "loss": 0.6746617889404297, "step": 5400 }, { "epoch": 17.33226837060703, "grad_norm": 0.7307584881782532, "learning_rate": 3.148739794107207e-05, "loss": 0.6781723785400391, "step": 5425 }, { "epoch": 17.41214057507987, "grad_norm": 1.9987844228744507, "learning_rate": 3.137646432374867e-05, "loss": 0.6636336517333984, "step": 5450 }, { "epoch": 17.492012779552716, "grad_norm": 1.9470531940460205, "learning_rate": 3.126553070642528e-05, "loss": 0.6837937927246094, "step": 5475 }, { "epoch": 17.57188498402556, "grad_norm": 0.8332393169403076, "learning_rate": 3.115459708910188e-05, "loss": 0.6658824157714843, "step": 5500 }, { "epoch": 17.57188498402556, "eval_clean_accuracy": 0.562, "eval_clean_f1": 0.5181518151815182, "eval_clean_loss": 0.6781004667282104, "eval_clean_precision": 0.5880149812734082, "eval_clean_recall": 0.4631268436578171, "eval_clean_runtime": 34.3439, "eval_clean_samples_per_second": 58.234, "eval_clean_steps_per_second": 3.64, "step": 5500 }, { "epoch": 17.57188498402556, "eval_augmented_accuracy": 0.567, "eval_augmented_f1": 0.5308775731310943, "eval_augmented_loss": 0.6760740876197815, "eval_augmented_precision": 0.5910735826296744, "eval_augmented_recall": 0.48180924287118976, "eval_augmented_runtime": 30.0625, "eval_augmented_samples_per_second": 66.528, "eval_augmented_steps_per_second": 4.158, "step": 5500 }, { "epoch": 17.6517571884984, "grad_norm": 3.3296432495117188, "learning_rate": 3.104366347177849e-05, "loss": 0.6929439544677735, "step": 5525 }, { "epoch": 17.731629392971247, "grad_norm": 1.5148193836212158, "learning_rate": 3.093272985445509e-05, "loss": 0.6753422546386719, "step": 5550 }, { "epoch": 17.81150159744409, "grad_norm": 1.1792839765548706, "learning_rate": 3.08217962371317e-05, "loss": 0.6708831787109375, "step": 5575 }, { "epoch": 17.891373801916934, "grad_norm": 2.0417587757110596, "learning_rate": 3.071086261980831e-05, "loss": 0.6737210845947266, "step": 5600 }, { "epoch": 17.971246006389777, "grad_norm": 1.4204891920089722, "learning_rate": 3.0599929002484914e-05, "loss": 0.6782549285888672, "step": 5625 }, { "epoch": 18.05111821086262, "grad_norm": 1.6737542152404785, "learning_rate": 3.0488995385161523e-05, "loss": 0.6818050384521485, "step": 5650 }, { "epoch": 18.130990415335464, "grad_norm": 1.1495423316955566, "learning_rate": 3.0378061767838128e-05, "loss": 0.6827652740478516, "step": 5675 }, { "epoch": 18.210862619808307, "grad_norm": 1.3116377592086792, "learning_rate": 3.0267128150514733e-05, "loss": 0.6765013885498047, "step": 5700 }, { "epoch": 18.29073482428115, "grad_norm": 1.19011652469635, "learning_rate": 3.015619453319134e-05, "loss": 0.6733645629882813, "step": 5725 }, { "epoch": 18.370607028753994, "grad_norm": 2.510385274887085, "learning_rate": 3.0045260915867946e-05, "loss": 0.6835158538818359, "step": 5750 }, { "epoch": 18.370607028753994, "eval_clean_accuracy": 0.565, "eval_clean_f1": 0.524070021881838, "eval_clean_loss": 0.6765435934066772, "eval_clean_precision": 0.5906288532675709, "eval_clean_recall": 0.47099311701081614, "eval_clean_runtime": 32.6497, "eval_clean_samples_per_second": 61.256, "eval_clean_steps_per_second": 3.829, "step": 5750 }, { "epoch": 18.370607028753994, "eval_augmented_accuracy": 0.568, "eval_augmented_f1": 0.535483870967742, "eval_augmented_loss": 0.6743596196174622, "eval_augmented_precision": 0.5907473309608541, "eval_augmented_recall": 0.4896755162241888, "eval_augmented_runtime": 30.1031, "eval_augmented_samples_per_second": 66.438, "eval_augmented_steps_per_second": 4.152, "step": 5750 }, { "epoch": 18.450479233226837, "grad_norm": 1.5483216047286987, "learning_rate": 2.993432729854455e-05, "loss": 0.6712458801269531, "step": 5775 }, { "epoch": 18.53035143769968, "grad_norm": 1.093629240989685, "learning_rate": 2.9823393681221156e-05, "loss": 0.6677893829345704, "step": 5800 }, { "epoch": 18.610223642172524, "grad_norm": 1.5210340023040771, "learning_rate": 2.971246006389776e-05, "loss": 0.6704553985595703, "step": 5825 }, { "epoch": 18.690095846645367, "grad_norm": 2.8365097045898438, "learning_rate": 2.9601526446574373e-05, "loss": 0.6798036956787109, "step": 5850 }, { "epoch": 18.769968051118212, "grad_norm": 1.7744059562683105, "learning_rate": 2.9490592829250978e-05, "loss": 0.6708892822265625, "step": 5875 }, { "epoch": 18.849840255591054, "grad_norm": 2.6847569942474365, "learning_rate": 2.9379659211927586e-05, "loss": 0.6831411743164062, "step": 5900 }, { "epoch": 18.929712460063897, "grad_norm": 0.8012094497680664, "learning_rate": 2.926872559460419e-05, "loss": 0.6820477294921875, "step": 5925 }, { "epoch": 19.009584664536742, "grad_norm": 2.168522357940674, "learning_rate": 2.9157791977280796e-05, "loss": 0.6547803497314453, "step": 5950 }, { "epoch": 19.089456869009584, "grad_norm": 1.2463030815124512, "learning_rate": 2.90468583599574e-05, "loss": 0.6849527740478516, "step": 5975 }, { "epoch": 19.169329073482427, "grad_norm": 1.3265875577926636, "learning_rate": 2.8935924742634006e-05, "loss": 0.6678836059570312, "step": 6000 }, { "epoch": 19.169329073482427, "eval_clean_accuracy": 0.567, "eval_clean_f1": 0.5738188976377953, "eval_clean_loss": 0.6726222038269043, "eval_clean_precision": 0.574384236453202, "eval_clean_recall": 0.5732546705998034, "eval_clean_runtime": 34.131, "eval_clean_samples_per_second": 58.598, "eval_clean_steps_per_second": 3.662, "step": 6000 }, { "epoch": 19.169329073482427, "eval_augmented_accuracy": 0.5705, "eval_augmented_f1": 0.583616093068347, "eval_augmented_loss": 0.6707697510719299, "eval_augmented_precision": 0.5755258126195029, "eval_augmented_recall": 0.591937069813176, "eval_augmented_runtime": 29.695, "eval_augmented_samples_per_second": 67.351, "eval_augmented_steps_per_second": 4.209, "step": 6000 }, { "epoch": 19.249201277955272, "grad_norm": 1.0116894245147705, "learning_rate": 2.8824991125310615e-05, "loss": 0.6734124755859375, "step": 6025 }, { "epoch": 19.329073482428115, "grad_norm": 1.0521386861801147, "learning_rate": 2.8714057507987223e-05, "loss": 0.6823114776611328, "step": 6050 }, { "epoch": 19.408945686900957, "grad_norm": 1.7150075435638428, "learning_rate": 2.860312389066383e-05, "loss": 0.6794223785400391, "step": 6075 }, { "epoch": 19.488817891373802, "grad_norm": 1.1701781749725342, "learning_rate": 2.8492190273340436e-05, "loss": 0.6711672973632813, "step": 6100 }, { "epoch": 19.568690095846645, "grad_norm": 3.473144054412842, "learning_rate": 2.838125665601704e-05, "loss": 0.6632061767578125, "step": 6125 }, { "epoch": 19.64856230031949, "grad_norm": 2.9917290210723877, "learning_rate": 2.8270323038693646e-05, "loss": 0.6687173461914062, "step": 6150 }, { "epoch": 19.728434504792332, "grad_norm": 1.442201852798462, "learning_rate": 2.815938942137025e-05, "loss": 0.6790982818603516, "step": 6175 }, { "epoch": 19.808306709265175, "grad_norm": 0.8214678764343262, "learning_rate": 2.804845580404686e-05, "loss": 0.6785170745849609, "step": 6200 }, { "epoch": 19.88817891373802, "grad_norm": 0.7220828533172607, "learning_rate": 2.7937522186723465e-05, "loss": 0.6760962677001953, "step": 6225 }, { "epoch": 19.968051118210862, "grad_norm": 0.9320070743560791, "learning_rate": 2.7826588569400077e-05, "loss": 0.665672378540039, "step": 6250 }, { "epoch": 19.968051118210862, "eval_clean_accuracy": 0.5685, "eval_clean_f1": 0.5165266106442578, "eval_clean_loss": 0.6750136017799377, "eval_clean_precision": 0.6002604166666666, "eval_clean_recall": 0.4532940019665683, "eval_clean_runtime": 33.7847, "eval_clean_samples_per_second": 59.198, "eval_clean_steps_per_second": 3.7, "step": 6250 }, { "epoch": 19.968051118210862, "eval_augmented_accuracy": 0.572, "eval_augmented_f1": 0.5301866081229418, "eval_augmented_loss": 0.6730659008026123, "eval_augmented_precision": 0.6, "eval_augmented_recall": 0.4749262536873156, "eval_augmented_runtime": 31.7235, "eval_augmented_samples_per_second": 63.045, "eval_augmented_steps_per_second": 3.94, "step": 6250 }, { "epoch": 20.047923322683705, "grad_norm": 3.1612818241119385, "learning_rate": 2.771565495207668e-05, "loss": 0.6709950256347657, "step": 6275 }, { "epoch": 20.12779552715655, "grad_norm": 1.2268925905227661, "learning_rate": 2.7604721334753287e-05, "loss": 0.6702857208251953, "step": 6300 }, { "epoch": 20.207667731629392, "grad_norm": 0.8440638780593872, "learning_rate": 2.749378771742989e-05, "loss": 0.6822032928466797, "step": 6325 }, { "epoch": 20.287539936102238, "grad_norm": 3.8297040462493896, "learning_rate": 2.7382854100106497e-05, "loss": 0.6752496337890626, "step": 6350 }, { "epoch": 20.36741214057508, "grad_norm": 1.3105895519256592, "learning_rate": 2.72719204827831e-05, "loss": 0.6746274566650391, "step": 6375 }, { "epoch": 20.447284345047922, "grad_norm": 2.8063766956329346, "learning_rate": 2.716098686545971e-05, "loss": 0.6778827667236328, "step": 6400 }, { "epoch": 20.527156549520768, "grad_norm": 1.2273688316345215, "learning_rate": 2.7050053248136315e-05, "loss": 0.6741339874267578, "step": 6425 }, { "epoch": 20.60702875399361, "grad_norm": 2.219007968902588, "learning_rate": 2.693911963081292e-05, "loss": 0.6739005279541016, "step": 6450 }, { "epoch": 20.686900958466452, "grad_norm": 2.7713451385498047, "learning_rate": 2.6828186013489532e-05, "loss": 0.6681459045410156, "step": 6475 }, { "epoch": 20.766773162939298, "grad_norm": 0.9561047554016113, "learning_rate": 2.6717252396166137e-05, "loss": 0.6722116088867187, "step": 6500 }, { "epoch": 20.766773162939298, "eval_clean_accuracy": 0.578, "eval_clean_f1": 0.5539112050739958, "eval_clean_loss": 0.673052966594696, "eval_clean_precision": 0.5988571428571429, "eval_clean_recall": 0.5152409046214356, "eval_clean_runtime": 33.344, "eval_clean_samples_per_second": 59.981, "eval_clean_steps_per_second": 3.749, "step": 6500 }, { "epoch": 20.766773162939298, "eval_augmented_accuracy": 0.5795, "eval_augmented_f1": 0.5617509119332986, "eval_augmented_loss": 0.6712051033973694, "eval_augmented_precision": 0.5975609756097561, "eval_augmented_recall": 0.5299901671583087, "eval_augmented_runtime": 31.4599, "eval_augmented_samples_per_second": 63.573, "eval_augmented_steps_per_second": 3.973, "step": 6500 }, { "epoch": 20.84664536741214, "grad_norm": 1.4755305051803589, "learning_rate": 2.6606318778842742e-05, "loss": 0.6650540924072266, "step": 6525 }, { "epoch": 20.926517571884983, "grad_norm": 1.3648386001586914, "learning_rate": 2.6495385161519347e-05, "loss": 0.6618634033203125, "step": 6550 }, { "epoch": 21.00638977635783, "grad_norm": 4.670324325561523, "learning_rate": 2.6384451544195955e-05, "loss": 0.684334487915039, "step": 6575 }, { "epoch": 21.08626198083067, "grad_norm": 3.7264297008514404, "learning_rate": 2.627351792687256e-05, "loss": 0.6691683197021484, "step": 6600 }, { "epoch": 21.166134185303516, "grad_norm": 4.614311218261719, "learning_rate": 2.6162584309549165e-05, "loss": 0.6639968109130859, "step": 6625 }, { "epoch": 21.24600638977636, "grad_norm": 1.4514429569244385, "learning_rate": 2.605165069222577e-05, "loss": 0.6571755981445313, "step": 6650 }, { "epoch": 21.3258785942492, "grad_norm": 2.1098945140838623, "learning_rate": 2.5940717074902382e-05, "loss": 0.6672761535644531, "step": 6675 }, { "epoch": 21.405750798722046, "grad_norm": 1.1698991060256958, "learning_rate": 2.5829783457578987e-05, "loss": 0.682496566772461, "step": 6700 }, { "epoch": 21.48562300319489, "grad_norm": 1.1962759494781494, "learning_rate": 2.5718849840255592e-05, "loss": 0.6706239318847657, "step": 6725 }, { "epoch": 21.56549520766773, "grad_norm": 1.169242262840271, "learning_rate": 2.56079162229322e-05, "loss": 0.6670849609375, "step": 6750 }, { "epoch": 21.56549520766773, "eval_clean_accuracy": 0.5645, "eval_clean_f1": 0.5070741369552915, "eval_clean_loss": 0.675056517124176, "eval_clean_precision": 0.5973333333333334, "eval_clean_recall": 0.44051130776794495, "eval_clean_runtime": 34.5424, "eval_clean_samples_per_second": 57.9, "eval_clean_steps_per_second": 3.619, "step": 6750 }, { "epoch": 21.56549520766773, "eval_augmented_accuracy": 0.568, "eval_augmented_f1": 0.5167785234899329, "eval_augmented_loss": 0.6728267073631287, "eval_augmented_precision": 0.5992217898832685, "eval_augmented_recall": 0.45427728613569324, "eval_augmented_runtime": 30.3232, "eval_augmented_samples_per_second": 65.956, "eval_augmented_steps_per_second": 4.122, "step": 6750 }, { "epoch": 21.645367412140576, "grad_norm": 1.7242056131362915, "learning_rate": 2.5496982605608805e-05, "loss": 0.6700958251953125, "step": 6775 }, { "epoch": 21.72523961661342, "grad_norm": 2.0698318481445312, "learning_rate": 2.538604898828541e-05, "loss": 0.6836550903320312, "step": 6800 }, { "epoch": 21.80511182108626, "grad_norm": 1.085684061050415, "learning_rate": 2.5275115370962015e-05, "loss": 0.6732395935058594, "step": 6825 }, { "epoch": 21.884984025559106, "grad_norm": 1.0501335859298706, "learning_rate": 2.516418175363862e-05, "loss": 0.6736275482177735, "step": 6850 }, { "epoch": 21.96485623003195, "grad_norm": 1.3090801239013672, "learning_rate": 2.5053248136315232e-05, "loss": 0.677449951171875, "step": 6875 }, { "epoch": 22.044728434504794, "grad_norm": 2.225717782974243, "learning_rate": 2.4942314518991837e-05, "loss": 0.6654424285888672, "step": 6900 }, { "epoch": 22.124600638977636, "grad_norm": 0.9907784461975098, "learning_rate": 2.4831380901668445e-05, "loss": 0.6636685180664063, "step": 6925 }, { "epoch": 22.20447284345048, "grad_norm": 2.9717698097229004, "learning_rate": 2.472044728434505e-05, "loss": 0.6727093505859375, "step": 6950 }, { "epoch": 22.284345047923324, "grad_norm": 1.583967924118042, "learning_rate": 2.4609513667021655e-05, "loss": 0.6605399322509765, "step": 6975 }, { "epoch": 22.364217252396166, "grad_norm": 5.221620559692383, "learning_rate": 2.449858004969826e-05, "loss": 0.6693320465087891, "step": 7000 }, { "epoch": 22.364217252396166, "eval_clean_accuracy": 0.581, "eval_clean_f1": 0.5465367965367965, "eval_clean_loss": 0.6739546060562134, "eval_clean_precision": 0.6077015643802648, "eval_clean_recall": 0.49655850540806296, "eval_clean_runtime": 34.7611, "eval_clean_samples_per_second": 57.536, "eval_clean_steps_per_second": 3.596, "step": 7000 }, { "epoch": 22.364217252396166, "eval_augmented_accuracy": 0.579, "eval_augmented_f1": 0.5511727078891258, "eval_augmented_loss": 0.6715738773345947, "eval_augmented_precision": 0.6018626309662398, "eval_augmented_recall": 0.5083579154375615, "eval_augmented_runtime": 30.1693, "eval_augmented_samples_per_second": 66.293, "eval_augmented_steps_per_second": 4.143, "step": 7000 }, { "epoch": 22.44408945686901, "grad_norm": 2.568296432495117, "learning_rate": 2.438764643237487e-05, "loss": 0.6826741790771484, "step": 7025 }, { "epoch": 22.523961661341854, "grad_norm": 2.228358030319214, "learning_rate": 2.4276712815051474e-05, "loss": 0.6603119659423828, "step": 7050 }, { "epoch": 22.603833865814696, "grad_norm": 1.5317357778549194, "learning_rate": 2.4165779197728082e-05, "loss": 0.6614339447021484, "step": 7075 }, { "epoch": 22.68370607028754, "grad_norm": 2.3497259616851807, "learning_rate": 2.4054845580404687e-05, "loss": 0.6772706604003906, "step": 7100 }, { "epoch": 22.763578274760384, "grad_norm": 3.3817670345306396, "learning_rate": 2.3943911963081292e-05, "loss": 0.6722084045410156, "step": 7125 }, { "epoch": 22.843450479233226, "grad_norm": 1.2422946691513062, "learning_rate": 2.38329783457579e-05, "loss": 0.6672750854492188, "step": 7150 }, { "epoch": 22.923322683706072, "grad_norm": 2.415759325027466, "learning_rate": 2.3722044728434506e-05, "loss": 0.6750403594970703, "step": 7175 }, { "epoch": 23.003194888178914, "grad_norm": 1.7066996097564697, "learning_rate": 2.361111111111111e-05, "loss": 0.6622637939453125, "step": 7200 }, { "epoch": 23.083067092651756, "grad_norm": 3.192152500152588, "learning_rate": 2.350017749378772e-05, "loss": 0.6663380432128906, "step": 7225 }, { "epoch": 23.162939297124602, "grad_norm": 1.3284766674041748, "learning_rate": 2.3389243876464327e-05, "loss": 0.6858122253417969, "step": 7250 }, { "epoch": 23.162939297124602, "eval_clean_accuracy": 0.577, "eval_clean_f1": 0.6433389544688027, "eval_clean_loss": 0.6685539484024048, "eval_clean_precision": 0.56309963099631, "eval_clean_recall": 0.7502458210422812, "eval_clean_runtime": 33.1564, "eval_clean_samples_per_second": 60.32, "eval_clean_steps_per_second": 3.77, "step": 7250 }, { "epoch": 23.162939297124602, "eval_augmented_accuracy": 0.5855, "eval_augmented_f1": 0.6570128258171287, "eval_augmented_loss": 0.6673442125320435, "eval_augmented_precision": 0.5671428571428572, "eval_augmented_recall": 0.7807276302851525, "eval_augmented_runtime": 30.4359, "eval_augmented_samples_per_second": 65.712, "eval_augmented_steps_per_second": 4.107, "step": 7250 }, { "epoch": 23.242811501597444, "grad_norm": 2.194469928741455, "learning_rate": 2.3278310259140932e-05, "loss": 0.6771233367919922, "step": 7275 }, { "epoch": 23.322683706070286, "grad_norm": 5.150406837463379, "learning_rate": 2.3167376641817537e-05, "loss": 0.6665583801269531, "step": 7300 }, { "epoch": 23.402555910543132, "grad_norm": 1.0977706909179688, "learning_rate": 2.3056443024494142e-05, "loss": 0.6782064819335938, "step": 7325 }, { "epoch": 23.482428115015974, "grad_norm": 3.8767249584198, "learning_rate": 2.294550940717075e-05, "loss": 0.6629747009277344, "step": 7350 }, { "epoch": 23.562300319488816, "grad_norm": 2.0559794902801514, "learning_rate": 2.2834575789847356e-05, "loss": 0.6653447723388672, "step": 7375 }, { "epoch": 23.642172523961662, "grad_norm": 2.7275478839874268, "learning_rate": 2.272364217252396e-05, "loss": 0.6861900329589844, "step": 7400 }, { "epoch": 23.722044728434504, "grad_norm": 2.467993974685669, "learning_rate": 2.261270855520057e-05, "loss": 0.6643102264404297, "step": 7425 }, { "epoch": 23.80191693290735, "grad_norm": 1.2309257984161377, "learning_rate": 2.2501774937877177e-05, "loss": 0.6557144927978515, "step": 7450 }, { "epoch": 23.881789137380192, "grad_norm": 2.0583536624908447, "learning_rate": 2.2390841320553782e-05, "loss": 0.6546482086181641, "step": 7475 }, { "epoch": 23.961661341853034, "grad_norm": 3.2711856365203857, "learning_rate": 2.2279907703230387e-05, "loss": 0.6592422485351562, "step": 7500 }, { "epoch": 23.961661341853034, "eval_clean_accuracy": 0.5795, "eval_clean_f1": 0.6182478438492964, "eval_clean_loss": 0.6666418313980103, "eval_clean_precision": 0.5741989881956155, "eval_clean_recall": 0.6696165191740413, "eval_clean_runtime": 33.9363, "eval_clean_samples_per_second": 58.934, "eval_clean_steps_per_second": 3.683, "step": 7500 }, { "epoch": 23.961661341853034, "eval_augmented_accuracy": 0.59, "eval_augmented_f1": 0.6326164874551972, "eval_augmented_loss": 0.6646553874015808, "eval_augmented_precision": 0.5810699588477366, "eval_augmented_recall": 0.6941986234021632, "eval_augmented_runtime": 30.058, "eval_augmented_samples_per_second": 66.538, "eval_augmented_steps_per_second": 4.159, "step": 7500 }, { "epoch": 24.04153354632588, "grad_norm": 1.3368834257125854, "learning_rate": 2.2168974085906992e-05, "loss": 0.6684354400634765, "step": 7525 }, { "epoch": 24.121405750798722, "grad_norm": 1.8474513292312622, "learning_rate": 2.20580404685836e-05, "loss": 0.6646910858154297, "step": 7550 }, { "epoch": 24.201277955271564, "grad_norm": 2.453556537628174, "learning_rate": 2.1947106851260206e-05, "loss": 0.6793017578125, "step": 7575 }, { "epoch": 24.28115015974441, "grad_norm": 1.4984920024871826, "learning_rate": 2.1836173233936814e-05, "loss": 0.6596472930908203, "step": 7600 }, { "epoch": 24.361022364217252, "grad_norm": 1.778158187866211, "learning_rate": 2.172523961661342e-05, "loss": 0.6783343505859375, "step": 7625 }, { "epoch": 24.440894568690094, "grad_norm": 2.179927110671997, "learning_rate": 2.1614305999290028e-05, "loss": 0.6637397766113281, "step": 7650 }, { "epoch": 24.52076677316294, "grad_norm": 2.402000665664673, "learning_rate": 2.1503372381966633e-05, "loss": 0.6739202117919922, "step": 7675 }, { "epoch": 24.600638977635782, "grad_norm": 3.6886532306671143, "learning_rate": 2.1392438764643238e-05, "loss": 0.6603968811035156, "step": 7700 }, { "epoch": 24.680511182108628, "grad_norm": 1.827487587928772, "learning_rate": 2.1281505147319843e-05, "loss": 0.6548705291748047, "step": 7725 }, { "epoch": 24.76038338658147, "grad_norm": 6.496307373046875, "learning_rate": 2.117057152999645e-05, "loss": 0.6640004730224609, "step": 7750 }, { "epoch": 24.76038338658147, "eval_clean_accuracy": 0.5815, "eval_clean_f1": 0.6016182770109472, "eval_clean_loss": 0.6665173172950745, "eval_clean_precision": 0.5830258302583026, "eval_clean_recall": 0.6214355948869223, "eval_clean_runtime": 35.048, "eval_clean_samples_per_second": 57.065, "eval_clean_steps_per_second": 3.567, "step": 7750 }, { "epoch": 24.76038338658147, "eval_augmented_accuracy": 0.592, "eval_augmented_f1": 0.6154571159283695, "eval_augmented_loss": 0.6644328832626343, "eval_augmented_precision": 0.5909502262443439, "eval_augmented_recall": 0.6420845624385447, "eval_augmented_runtime": 29.5621, "eval_augmented_samples_per_second": 67.654, "eval_augmented_steps_per_second": 4.228, "step": 7750 }, { "epoch": 24.840255591054312, "grad_norm": 1.798092007637024, "learning_rate": 2.105963791267306e-05, "loss": 0.6703931427001953, "step": 7775 }, { "epoch": 24.920127795527158, "grad_norm": 1.1937365531921387, "learning_rate": 2.0948704295349664e-05, "loss": 0.6636472320556641, "step": 7800 }, { "epoch": 25.0, "grad_norm": 6.661098480224609, "learning_rate": 2.083777067802627e-05, "loss": 0.6663903045654297, "step": 7825 }, { "epoch": 25.079872204472842, "grad_norm": 2.9561517238616943, "learning_rate": 2.0726837060702874e-05, "loss": 0.6667401123046875, "step": 7850 }, { "epoch": 25.159744408945688, "grad_norm": 3.0538957118988037, "learning_rate": 2.0615903443379483e-05, "loss": 0.6557493591308594, "step": 7875 }, { "epoch": 25.23961661341853, "grad_norm": 1.746561884880066, "learning_rate": 2.0504969826056088e-05, "loss": 0.6678819274902343, "step": 7900 }, { "epoch": 25.319488817891372, "grad_norm": 3.067382335662842, "learning_rate": 2.0394036208732696e-05, "loss": 0.6624791717529297, "step": 7925 }, { "epoch": 25.399361022364218, "grad_norm": 2.1404945850372314, "learning_rate": 2.02831025914093e-05, "loss": 0.6715129089355468, "step": 7950 }, { "epoch": 25.47923322683706, "grad_norm": 8.56063175201416, "learning_rate": 2.017216897408591e-05, "loss": 0.6607463836669922, "step": 7975 }, { "epoch": 25.559105431309906, "grad_norm": 5.323795795440674, "learning_rate": 2.0061235356762515e-05, "loss": 0.6577232360839844, "step": 8000 }, { "epoch": 25.559105431309906, "eval_clean_accuracy": 0.5895, "eval_clean_f1": 0.6391208791208791, "eval_clean_loss": 0.6638462543487549, "eval_clean_precision": 0.5779014308426074, "eval_clean_recall": 0.7148475909537857, "eval_clean_runtime": 32.9369, "eval_clean_samples_per_second": 60.722, "eval_clean_steps_per_second": 3.795, "step": 8000 }, { "epoch": 25.559105431309906, "eval_augmented_accuracy": 0.596, "eval_augmented_f1": 0.6499133448873483, "eval_augmented_loss": 0.6622973680496216, "eval_augmented_precision": 0.5809450038729667, "eval_augmented_recall": 0.7374631268436578, "eval_augmented_runtime": 29.6866, "eval_augmented_samples_per_second": 67.371, "eval_augmented_steps_per_second": 4.211, "step": 8000 }, { "epoch": 25.638977635782748, "grad_norm": 2.7152364253997803, "learning_rate": 1.995030173943912e-05, "loss": 0.6688961029052735, "step": 8025 }, { "epoch": 25.71884984025559, "grad_norm": 1.714259147644043, "learning_rate": 1.9839368122115725e-05, "loss": 0.6591244506835937, "step": 8050 }, { "epoch": 25.798722044728436, "grad_norm": 1.6674511432647705, "learning_rate": 1.9728434504792333e-05, "loss": 0.6606136322021484, "step": 8075 }, { "epoch": 25.878594249201278, "grad_norm": 3.3256895542144775, "learning_rate": 1.961750088746894e-05, "loss": 0.6723387145996094, "step": 8100 }, { "epoch": 25.95846645367412, "grad_norm": 2.454327344894409, "learning_rate": 1.9506567270145546e-05, "loss": 0.6723534393310547, "step": 8125 }, { "epoch": 26.038338658146966, "grad_norm": 2.8561620712280273, "learning_rate": 1.939563365282215e-05, "loss": 0.675127182006836, "step": 8150 }, { "epoch": 26.118210862619808, "grad_norm": 3.822831630706787, "learning_rate": 1.928470003549876e-05, "loss": 0.6664968872070313, "step": 8175 }, { "epoch": 26.19808306709265, "grad_norm": 2.6994364261627197, "learning_rate": 1.9173766418175365e-05, "loss": 0.6655848693847656, "step": 8200 }, { "epoch": 26.277955271565496, "grad_norm": 1.8317835330963135, "learning_rate": 1.906283280085197e-05, "loss": 0.6728475189208984, "step": 8225 }, { "epoch": 26.357827476038338, "grad_norm": 2.0718393325805664, "learning_rate": 1.8951899183528578e-05, "loss": 0.6531362915039063, "step": 8250 }, { "epoch": 26.357827476038338, "eval_clean_accuracy": 0.585, "eval_clean_f1": 0.6381865736704446, "eval_clean_loss": 0.6636385917663574, "eval_clean_precision": 0.5732184808144087, "eval_clean_recall": 0.7197640117994101, "eval_clean_runtime": 33.9158, "eval_clean_samples_per_second": 58.97, "eval_clean_steps_per_second": 3.686, "step": 8250 }, { "epoch": 26.357827476038338, "eval_augmented_accuracy": 0.596, "eval_augmented_f1": 0.6517241379310345, "eval_augmented_loss": 0.6621904373168945, "eval_augmented_precision": 0.580199539524175, "eval_augmented_recall": 0.7433628318584071, "eval_augmented_runtime": 29.3881, "eval_augmented_samples_per_second": 68.055, "eval_augmented_steps_per_second": 4.253, "step": 8250 }, { "epoch": 26.437699680511184, "grad_norm": 5.634428977966309, "learning_rate": 1.8840965566205186e-05, "loss": 0.669949722290039, "step": 8275 }, { "epoch": 26.517571884984026, "grad_norm": 3.023545742034912, "learning_rate": 1.873003194888179e-05, "loss": 0.65454833984375, "step": 8300 }, { "epoch": 26.597444089456868, "grad_norm": 1.3771941661834717, "learning_rate": 1.8619098331558396e-05, "loss": 0.6742000579833984, "step": 8325 }, { "epoch": 26.677316293929714, "grad_norm": 5.160915851593018, "learning_rate": 1.8508164714235e-05, "loss": 0.6628718566894531, "step": 8350 }, { "epoch": 26.757188498402556, "grad_norm": 3.03651762008667, "learning_rate": 1.839723109691161e-05, "loss": 0.6658853912353515, "step": 8375 }, { "epoch": 26.837060702875398, "grad_norm": 2.512115478515625, "learning_rate": 1.8286297479588215e-05, "loss": 0.6598117828369141, "step": 8400 }, { "epoch": 26.916932907348244, "grad_norm": 1.9184046983718872, "learning_rate": 1.817536386226482e-05, "loss": 0.6536006164550782, "step": 8425 }, { "epoch": 26.996805111821086, "grad_norm": 3.880061388015747, "learning_rate": 1.8064430244941428e-05, "loss": 0.6642186737060547, "step": 8450 }, { "epoch": 27.076677316293928, "grad_norm": 1.7105854749679565, "learning_rate": 1.7953496627618037e-05, "loss": 0.6677195739746093, "step": 8475 }, { "epoch": 27.156549520766774, "grad_norm": 2.1015284061431885, "learning_rate": 1.784256301029464e-05, "loss": 0.6583713531494141, "step": 8500 }, { "epoch": 27.156549520766774, "eval_clean_accuracy": 0.59, "eval_clean_f1": 0.6459412780656304, "eval_clean_loss": 0.6623177528381348, "eval_clean_precision": 0.5758275596612779, "eval_clean_recall": 0.7354965585054081, "eval_clean_runtime": 36.7616, "eval_clean_samples_per_second": 54.405, "eval_clean_steps_per_second": 3.4, "step": 8500 }, { "epoch": 27.156549520766774, "eval_augmented_accuracy": 0.597, "eval_augmented_f1": 0.6555555555555556, "eval_augmented_loss": 0.6608233451843262, "eval_augmented_precision": 0.5797430083144369, "eval_augmented_recall": 0.7541789577187807, "eval_augmented_runtime": 32.8111, "eval_augmented_samples_per_second": 60.955, "eval_augmented_steps_per_second": 3.81, "step": 8500 }, { "epoch": 27.236421725239616, "grad_norm": 3.4008805751800537, "learning_rate": 1.7731629392971247e-05, "loss": 0.6683567810058594, "step": 8525 }, { "epoch": 27.31629392971246, "grad_norm": 3.0133233070373535, "learning_rate": 1.762069577564785e-05, "loss": 0.6531230926513671, "step": 8550 }, { "epoch": 27.396166134185304, "grad_norm": 2.1646194458007812, "learning_rate": 1.7509762158324457e-05, "loss": 0.6565901947021484, "step": 8575 }, { "epoch": 27.476038338658146, "grad_norm": 6.211908340454102, "learning_rate": 1.7398828541001065e-05, "loss": 0.6554655456542968, "step": 8600 }, { "epoch": 27.55591054313099, "grad_norm": 1.9140880107879639, "learning_rate": 1.7287894923677673e-05, "loss": 0.6651789855957031, "step": 8625 }, { "epoch": 27.635782747603834, "grad_norm": 1.894289493560791, "learning_rate": 1.717696130635428e-05, "loss": 0.6748749542236329, "step": 8650 }, { "epoch": 27.715654952076676, "grad_norm": 1.4758464097976685, "learning_rate": 1.7066027689030883e-05, "loss": 0.6639950561523438, "step": 8675 }, { "epoch": 27.79552715654952, "grad_norm": 2.7134132385253906, "learning_rate": 1.6955094071707492e-05, "loss": 0.6680120849609374, "step": 8700 }, { "epoch": 27.875399361022364, "grad_norm": 12.76073932647705, "learning_rate": 1.6844160454384097e-05, "loss": 0.6510957336425781, "step": 8725 }, { "epoch": 27.955271565495206, "grad_norm": 2.944746732711792, "learning_rate": 1.6733226837060702e-05, "loss": 0.6524990844726563, "step": 8750 }, { "epoch": 27.955271565495206, "eval_clean_accuracy": 0.5825, "eval_clean_f1": 0.6006695361071258, "eval_clean_loss": 0.661496102809906, "eval_clean_precision": 0.5847299813780261, "eval_clean_recall": 0.6175024582104228, "eval_clean_runtime": 36.6514, "eval_clean_samples_per_second": 54.568, "eval_clean_steps_per_second": 3.411, "step": 8750 }, { "epoch": 27.955271565495206, "eval_augmented_accuracy": 0.5955, "eval_augmented_f1": 0.6182161396885323, "eval_augmented_loss": 0.6594575643539429, "eval_augmented_precision": 0.5943738656987296, "eval_augmented_recall": 0.6440511307767945, "eval_augmented_runtime": 32.2136, "eval_augmented_samples_per_second": 62.086, "eval_augmented_steps_per_second": 3.88, "step": 8750 }, { "epoch": 28.03514376996805, "grad_norm": 4.6939473152160645, "learning_rate": 1.662229321973731e-05, "loss": 0.660233154296875, "step": 8775 }, { "epoch": 28.115015974440894, "grad_norm": 2.9043219089508057, "learning_rate": 1.651135960241392e-05, "loss": 0.6616826629638672, "step": 8800 }, { "epoch": 28.19488817891374, "grad_norm": 8.962121963500977, "learning_rate": 1.6400425985090524e-05, "loss": 0.6579137420654297, "step": 8825 }, { "epoch": 28.27476038338658, "grad_norm": 4.699589729309082, "learning_rate": 1.628949236776713e-05, "loss": 0.6692779541015625, "step": 8850 }, { "epoch": 28.354632587859424, "grad_norm": 3.043800115585327, "learning_rate": 1.6178558750443734e-05, "loss": 0.6486956024169922, "step": 8875 }, { "epoch": 28.43450479233227, "grad_norm": 2.6460821628570557, "learning_rate": 1.6067625133120342e-05, "loss": 0.6500224304199219, "step": 8900 }, { "epoch": 28.51437699680511, "grad_norm": 2.102255344390869, "learning_rate": 1.5956691515796947e-05, "loss": 0.6706474304199219, "step": 8925 }, { "epoch": 28.594249201277954, "grad_norm": 11.340255737304688, "learning_rate": 1.5845757898473555e-05, "loss": 0.6512863159179687, "step": 8950 }, { "epoch": 28.6741214057508, "grad_norm": 2.180323362350464, "learning_rate": 1.573482428115016e-05, "loss": 0.6558396911621094, "step": 8975 }, { "epoch": 28.75399361022364, "grad_norm": 4.055166721343994, "learning_rate": 1.562389066382677e-05, "loss": 0.6535093688964844, "step": 9000 }, { "epoch": 28.75399361022364, "eval_clean_accuracy": 0.5925, "eval_clean_f1": 0.6350201522615315, "eval_clean_loss": 0.659500002861023, "eval_clean_precision": 0.5830592105263158, "eval_clean_recall": 0.6971484759095379, "eval_clean_runtime": 39.6892, "eval_clean_samples_per_second": 50.392, "eval_clean_steps_per_second": 3.149, "step": 9000 }, { "epoch": 28.75399361022364, "eval_augmented_accuracy": 0.6005, "eval_augmented_f1": 0.6475518306131451, "eval_augmented_loss": 0.6579540967941284, "eval_augmented_precision": 0.5872, "eval_augmented_recall": 0.7217305801376598, "eval_augmented_runtime": 34.5211, "eval_augmented_samples_per_second": 57.936, "eval_augmented_steps_per_second": 3.621, "step": 9000 }, { "epoch": 28.833865814696484, "grad_norm": 6.501319408416748, "learning_rate": 1.5512957046503374e-05, "loss": 0.6685939788818359, "step": 9025 }, { "epoch": 28.91373801916933, "grad_norm": 2.0791144371032715, "learning_rate": 1.540202342917998e-05, "loss": 0.6640570068359375, "step": 9050 }, { "epoch": 28.99361022364217, "grad_norm": 2.3659167289733887, "learning_rate": 1.5291089811856584e-05, "loss": 0.6720100402832031, "step": 9075 }, { "epoch": 29.073482428115017, "grad_norm": 3.9424190521240234, "learning_rate": 1.5180156194533194e-05, "loss": 0.6429495239257812, "step": 9100 }, { "epoch": 29.15335463258786, "grad_norm": 3.7810616493225098, "learning_rate": 1.5069222577209799e-05, "loss": 0.6645084381103515, "step": 9125 }, { "epoch": 29.233226837060702, "grad_norm": 2.335226058959961, "learning_rate": 1.4958288959886404e-05, "loss": 0.66039794921875, "step": 9150 }, { "epoch": 29.313099041533548, "grad_norm": 2.3615992069244385, "learning_rate": 1.484735534256301e-05, "loss": 0.641043701171875, "step": 9175 }, { "epoch": 29.39297124600639, "grad_norm": 2.495163917541504, "learning_rate": 1.4736421725239619e-05, "loss": 0.6494132995605468, "step": 9200 }, { "epoch": 29.472843450479232, "grad_norm": 4.272531509399414, "learning_rate": 1.4625488107916224e-05, "loss": 0.6573280334472656, "step": 9225 }, { "epoch": 29.552715654952078, "grad_norm": 3.0703563690185547, "learning_rate": 1.451455449059283e-05, "loss": 0.6564813232421876, "step": 9250 }, { "epoch": 29.552715654952078, "eval_clean_accuracy": 0.594, "eval_clean_f1": 0.6125954198473282, "eval_clean_loss": 0.6593874096870422, "eval_clean_precision": 0.5949953660797034, "eval_clean_recall": 0.6312684365781711, "eval_clean_runtime": 34.4641, "eval_clean_samples_per_second": 58.031, "eval_clean_steps_per_second": 3.627, "step": 9250 }, { "epoch": 29.552715654952078, "eval_augmented_accuracy": 0.5985, "eval_augmented_f1": 0.6224729666196521, "eval_augmented_loss": 0.6572723984718323, "eval_augmented_precision": 0.5963963963963964, "eval_augmented_recall": 0.6509341199606686, "eval_augmented_runtime": 32.6075, "eval_augmented_samples_per_second": 61.336, "eval_augmented_steps_per_second": 3.833, "step": 9250 }, { "epoch": 29.63258785942492, "grad_norm": 10.26960277557373, "learning_rate": 1.4403620873269436e-05, "loss": 0.6767530822753907, "step": 9275 }, { "epoch": 29.712460063897765, "grad_norm": 2.140577554702759, "learning_rate": 1.429268725594604e-05, "loss": 0.6507977294921875, "step": 9300 }, { "epoch": 29.792332268370608, "grad_norm": 5.989231586456299, "learning_rate": 1.4181753638622649e-05, "loss": 0.6653945159912109, "step": 9325 }, { "epoch": 29.87220447284345, "grad_norm": 3.0000059604644775, "learning_rate": 1.4070820021299256e-05, "loss": 0.6603492736816406, "step": 9350 }, { "epoch": 29.952076677316295, "grad_norm": 2.7389652729034424, "learning_rate": 1.395988640397586e-05, "loss": 0.6683284759521484, "step": 9375 }, { "epoch": 30.031948881789138, "grad_norm": 3.7896928787231445, "learning_rate": 1.3848952786652467e-05, "loss": 0.6671995544433593, "step": 9400 }, { "epoch": 30.11182108626198, "grad_norm": 4.080947399139404, "learning_rate": 1.3738019169329076e-05, "loss": 0.6644981384277344, "step": 9425 }, { "epoch": 30.191693290734825, "grad_norm": 3.4498062133789062, "learning_rate": 1.362708555200568e-05, "loss": 0.6424797821044922, "step": 9450 }, { "epoch": 30.271565495207668, "grad_norm": 5.092141628265381, "learning_rate": 1.3516151934682286e-05, "loss": 0.6588761138916016, "step": 9475 }, { "epoch": 30.35143769968051, "grad_norm": 3.8522398471832275, "learning_rate": 1.3405218317358892e-05, "loss": 0.6517263793945313, "step": 9500 }, { "epoch": 30.35143769968051, "eval_clean_accuracy": 0.5845, "eval_clean_f1": 0.6014388489208633, "eval_clean_loss": 0.659924328327179, "eval_clean_precision": 0.5870786516853933, "eval_clean_recall": 0.616519174041298, "eval_clean_runtime": 37.0658, "eval_clean_samples_per_second": 53.958, "eval_clean_steps_per_second": 3.372, "step": 9500 }, { "epoch": 30.35143769968051, "eval_augmented_accuracy": 0.599, "eval_augmented_f1": 0.6180952380952381, "eval_augmented_loss": 0.6576748490333557, "eval_augmented_precision": 0.5992613111726686, "eval_augmented_recall": 0.6381514257620452, "eval_augmented_runtime": 32.2422, "eval_augmented_samples_per_second": 62.03, "eval_augmented_steps_per_second": 3.877, "step": 9500 }, { "epoch": 30.431309904153355, "grad_norm": 2.5667552947998047, "learning_rate": 1.32942847000355e-05, "loss": 0.6479985046386719, "step": 9525 }, { "epoch": 30.511182108626198, "grad_norm": 2.9620020389556885, "learning_rate": 1.3183351082712106e-05, "loss": 0.65920654296875, "step": 9550 }, { "epoch": 30.591054313099043, "grad_norm": 2.5735487937927246, "learning_rate": 1.3072417465388712e-05, "loss": 0.6487539672851562, "step": 9575 }, { "epoch": 30.670926517571885, "grad_norm": 2.522648811340332, "learning_rate": 1.2961483848065317e-05, "loss": 0.6742031097412109, "step": 9600 }, { "epoch": 30.750798722044728, "grad_norm": 5.013319969177246, "learning_rate": 1.2850550230741926e-05, "loss": 0.661434326171875, "step": 9625 }, { "epoch": 30.830670926517573, "grad_norm": 3.099461793899536, "learning_rate": 1.273961661341853e-05, "loss": 0.6646653747558594, "step": 9650 }, { "epoch": 30.910543130990416, "grad_norm": 2.282144069671631, "learning_rate": 1.2628682996095138e-05, "loss": 0.6596232604980469, "step": 9675 }, { "epoch": 30.990415335463258, "grad_norm": 2.1321256160736084, "learning_rate": 1.2517749378771743e-05, "loss": 0.6744160461425781, "step": 9700 }, { "epoch": 31.070287539936103, "grad_norm": 3.932706594467163, "learning_rate": 1.240681576144835e-05, "loss": 0.6576801300048828, "step": 9725 }, { "epoch": 31.150159744408946, "grad_norm": 2.8868210315704346, "learning_rate": 1.2295882144124956e-05, "loss": 0.64626220703125, "step": 9750 }, { "epoch": 31.150159744408946, "eval_clean_accuracy": 0.599, "eval_clean_f1": 0.6064769381746811, "eval_clean_loss": 0.6582567095756531, "eval_clean_precision": 0.6052889324191969, "eval_clean_recall": 0.6076696165191741, "eval_clean_runtime": 36.615, "eval_clean_samples_per_second": 54.622, "eval_clean_steps_per_second": 3.414, "step": 9750 }, { "epoch": 31.150159744408946, "eval_augmented_accuracy": 0.6065, "eval_augmented_f1": 0.6192549588776004, "eval_augmented_loss": 0.6560890078544617, "eval_augmented_precision": 0.6095238095238096, "eval_augmented_recall": 0.6293018682399213, "eval_augmented_runtime": 31.9233, "eval_augmented_samples_per_second": 62.65, "eval_augmented_steps_per_second": 3.916, "step": 9750 }, { "epoch": 31.230031948881788, "grad_norm": 2.606245756149292, "learning_rate": 1.2184948526801563e-05, "loss": 0.6717719268798829, "step": 9775 }, { "epoch": 31.309904153354633, "grad_norm": 5.43928861618042, "learning_rate": 1.207401490947817e-05, "loss": 0.6495343017578125, "step": 9800 }, { "epoch": 31.389776357827476, "grad_norm": 4.119039058685303, "learning_rate": 1.1963081292154774e-05, "loss": 0.6590328979492187, "step": 9825 }, { "epoch": 31.46964856230032, "grad_norm": 5.264957427978516, "learning_rate": 1.1852147674831383e-05, "loss": 0.663332290649414, "step": 9850 }, { "epoch": 31.549520766773163, "grad_norm": 6.228312969207764, "learning_rate": 1.1741214057507988e-05, "loss": 0.664293212890625, "step": 9875 }, { "epoch": 31.629392971246006, "grad_norm": 3.8367865085601807, "learning_rate": 1.1630280440184594e-05, "loss": 0.6503806304931641, "step": 9900 }, { "epoch": 31.70926517571885, "grad_norm": 5.204275608062744, "learning_rate": 1.1519346822861201e-05, "loss": 0.669429931640625, "step": 9925 }, { "epoch": 31.789137380191693, "grad_norm": 3.848501682281494, "learning_rate": 1.1408413205537808e-05, "loss": 0.6510513305664063, "step": 9950 }, { "epoch": 31.869009584664536, "grad_norm": 8.242192268371582, "learning_rate": 1.1297479588214413e-05, "loss": 0.6602898406982421, "step": 9975 }, { "epoch": 31.94888178913738, "grad_norm": 7.6462178230285645, "learning_rate": 1.118654597089102e-05, "loss": 0.6454778289794922, "step": 10000 }, { "epoch": 31.94888178913738, "eval_clean_accuracy": 0.601, "eval_clean_f1": 0.6141199226305609, "eval_clean_loss": 0.657340943813324, "eval_clean_precision": 0.60418648905804, "eval_clean_recall": 0.6243854473942969, "eval_clean_runtime": 36.4273, "eval_clean_samples_per_second": 54.904, "eval_clean_steps_per_second": 3.431, "step": 10000 }, { "epoch": 31.94888178913738, "eval_augmented_accuracy": 0.6055, "eval_augmented_f1": 0.6237482117310443, "eval_augmented_loss": 0.6552586555480957, "eval_augmented_precision": 0.6055555555555555, "eval_augmented_recall": 0.6430678466076696, "eval_augmented_runtime": 31.4526, "eval_augmented_samples_per_second": 63.588, "eval_augmented_steps_per_second": 3.974, "step": 10000 }, { "epoch": 32.02875399361022, "grad_norm": 3.7260687351226807, "learning_rate": 1.1075612353567626e-05, "loss": 0.6625856018066406, "step": 10025 }, { "epoch": 32.108626198083066, "grad_norm": 4.0104451179504395, "learning_rate": 1.0964678736244231e-05, "loss": 0.663704833984375, "step": 10050 }, { "epoch": 32.18849840255591, "grad_norm": 3.1617231369018555, "learning_rate": 1.0853745118920838e-05, "loss": 0.6546534729003907, "step": 10075 }, { "epoch": 32.26837060702876, "grad_norm": 4.549805164337158, "learning_rate": 1.0742811501597445e-05, "loss": 0.6541639709472656, "step": 10100 }, { "epoch": 32.3482428115016, "grad_norm": 5.31411600112915, "learning_rate": 1.0631877884274051e-05, "loss": 0.6591259765625, "step": 10125 }, { "epoch": 32.42811501597444, "grad_norm": 3.1751248836517334, "learning_rate": 1.0520944266950656e-05, "loss": 0.6415936279296875, "step": 10150 }, { "epoch": 32.50798722044728, "grad_norm": 4.833236217498779, "learning_rate": 1.0410010649627263e-05, "loss": 0.6486209869384766, "step": 10175 }, { "epoch": 32.587859424920126, "grad_norm": 3.9484071731567383, "learning_rate": 1.029907703230387e-05, "loss": 0.6674054718017578, "step": 10200 }, { "epoch": 32.66773162939297, "grad_norm": 6.687150955200195, "learning_rate": 1.0188143414980476e-05, "loss": 0.67325927734375, "step": 10225 }, { "epoch": 32.74760383386582, "grad_norm": 3.6501824855804443, "learning_rate": 1.0077209797657081e-05, "loss": 0.6344852066040039, "step": 10250 }, { "epoch": 32.74760383386582, "eval_clean_accuracy": 0.5905, "eval_clean_f1": 0.521891418563923, "eval_clean_loss": 0.6651769876480103, "eval_clean_precision": 0.6422413793103449, "eval_clean_recall": 0.43952802359882004, "eval_clean_runtime": 37.279, "eval_clean_samples_per_second": 53.649, "eval_clean_steps_per_second": 3.353, "step": 10250 }, { "epoch": 32.74760383386582, "eval_augmented_accuracy": 0.586, "eval_augmented_f1": 0.5273972602739726, "eval_augmented_loss": 0.6623213887214661, "eval_augmented_precision": 0.6285714285714286, "eval_augmented_recall": 0.45427728613569324, "eval_augmented_runtime": 33.1746, "eval_augmented_samples_per_second": 60.287, "eval_augmented_steps_per_second": 3.768, "step": 10250 }, { "epoch": 32.82747603833866, "grad_norm": 3.7630393505096436, "learning_rate": 9.96627618033369e-06, "loss": 0.6526027679443359, "step": 10275 }, { "epoch": 32.9073482428115, "grad_norm": 3.141622543334961, "learning_rate": 9.855342563010295e-06, "loss": 0.6516058349609375, "step": 10300 }, { "epoch": 32.98722044728434, "grad_norm": 2.728285789489746, "learning_rate": 9.744408945686901e-06, "loss": 0.6522452545166015, "step": 10325 }, { "epoch": 33.067092651757186, "grad_norm": 2.9775915145874023, "learning_rate": 9.633475328363508e-06, "loss": 0.6657464599609375, "step": 10350 }, { "epoch": 33.146964856230035, "grad_norm": 4.655804634094238, "learning_rate": 9.522541711040115e-06, "loss": 0.6320841979980468, "step": 10375 }, { "epoch": 33.22683706070288, "grad_norm": 8.127402305603027, "learning_rate": 9.41160809371672e-06, "loss": 0.651983871459961, "step": 10400 }, { "epoch": 33.30670926517572, "grad_norm": 5.582519054412842, "learning_rate": 9.300674476393326e-06, "loss": 0.6576095581054687, "step": 10425 }, { "epoch": 33.38658146964856, "grad_norm": 4.225978851318359, "learning_rate": 9.189740859069933e-06, "loss": 0.6691553497314453, "step": 10450 }, { "epoch": 33.466453674121404, "grad_norm": 4.2571210861206055, "learning_rate": 9.07880724174654e-06, "loss": 0.6432115173339844, "step": 10475 }, { "epoch": 33.546325878594246, "grad_norm": 6.716460704803467, "learning_rate": 8.967873624423145e-06, "loss": 0.6710083770751953, "step": 10500 }, { "epoch": 33.546325878594246, "eval_clean_accuracy": 0.595, "eval_clean_f1": 0.6009852216748769, "eval_clean_loss": 0.656220555305481, "eval_clean_precision": 0.6021717670286278, "eval_clean_recall": 0.599803343166175, "eval_clean_runtime": 36.4278, "eval_clean_samples_per_second": 54.903, "eval_clean_steps_per_second": 3.431, "step": 10500 }, { "epoch": 33.546325878594246, "eval_augmented_accuracy": 0.609, "eval_augmented_f1": 0.6196498054474708, "eval_augmented_loss": 0.6542580723762512, "eval_augmented_precision": 0.6130895091434071, "eval_augmented_recall": 0.6263520157325467, "eval_augmented_runtime": 31.5389, "eval_augmented_samples_per_second": 63.414, "eval_augmented_steps_per_second": 3.963, "step": 10500 }, { "epoch": 33.626198083067095, "grad_norm": 2.934760332107544, "learning_rate": 8.856940007099753e-06, "loss": 0.6433267974853516, "step": 10525 }, { "epoch": 33.70607028753994, "grad_norm": 4.398091793060303, "learning_rate": 8.746006389776358e-06, "loss": 0.6715164947509765, "step": 10550 }, { "epoch": 33.78594249201278, "grad_norm": 2.8861429691314697, "learning_rate": 8.635072772452965e-06, "loss": 0.6583317565917969, "step": 10575 }, { "epoch": 33.86581469648562, "grad_norm": 9.858250617980957, "learning_rate": 8.524139155129572e-06, "loss": 0.6541893005371093, "step": 10600 }, { "epoch": 33.945686900958464, "grad_norm": 3.7565155029296875, "learning_rate": 8.413205537806178e-06, "loss": 0.6473482513427734, "step": 10625 }, { "epoch": 34.02555910543131, "grad_norm": 2.8835959434509277, "learning_rate": 8.302271920482783e-06, "loss": 0.6527434539794922, "step": 10650 }, { "epoch": 34.105431309904155, "grad_norm": 3.1006321907043457, "learning_rate": 8.19133830315939e-06, "loss": 0.6391309356689453, "step": 10675 }, { "epoch": 34.185303514377, "grad_norm": 3.598741054534912, "learning_rate": 8.080404685835997e-06, "loss": 0.670204849243164, "step": 10700 }, { "epoch": 34.26517571884984, "grad_norm": 9.131671905517578, "learning_rate": 7.969471068512603e-06, "loss": 0.678262939453125, "step": 10725 }, { "epoch": 34.34504792332268, "grad_norm": 6.335668087005615, "learning_rate": 7.858537451189208e-06, "loss": 0.6639051818847657, "step": 10750 }, { "epoch": 34.34504792332268, "eval_clean_accuracy": 0.5945, "eval_clean_f1": 0.6026457618814307, "eval_clean_loss": 0.6564235687255859, "eval_clean_precision": 0.6005859375, "eval_clean_recall": 0.6047197640117994, "eval_clean_runtime": 36.8972, "eval_clean_samples_per_second": 54.205, "eval_clean_steps_per_second": 3.388, "step": 10750 }, { "epoch": 34.34504792332268, "eval_augmented_accuracy": 0.602, "eval_augmented_f1": 0.6154589371980677, "eval_augmented_loss": 0.6546424627304077, "eval_augmented_precision": 0.6049382716049383, "eval_augmented_recall": 0.6263520157325467, "eval_augmented_runtime": 32.2697, "eval_augmented_samples_per_second": 61.978, "eval_augmented_steps_per_second": 3.874, "step": 10750 }, { "epoch": 34.424920127795524, "grad_norm": 7.371140480041504, "learning_rate": 7.747603833865815e-06, "loss": 0.6469234466552735, "step": 10775 }, { "epoch": 34.50479233226837, "grad_norm": 9.094265937805176, "learning_rate": 7.636670216542422e-06, "loss": 0.6633625793457031, "step": 10800 }, { "epoch": 34.584664536741215, "grad_norm": 3.7987518310546875, "learning_rate": 7.525736599219027e-06, "loss": 0.6583029174804688, "step": 10825 }, { "epoch": 34.66453674121406, "grad_norm": 6.93763542175293, "learning_rate": 7.414802981895634e-06, "loss": 0.6420729827880859, "step": 10850 }, { "epoch": 34.7444089456869, "grad_norm": 5.418238639831543, "learning_rate": 7.30386936457224e-06, "loss": 0.6558763122558594, "step": 10875 }, { "epoch": 34.82428115015974, "grad_norm": 9.248136520385742, "learning_rate": 7.192935747248847e-06, "loss": 0.6258311843872071, "step": 10900 }, { "epoch": 34.90415335463259, "grad_norm": 3.5455965995788574, "learning_rate": 7.082002129925453e-06, "loss": 0.6627863311767578, "step": 10925 }, { "epoch": 34.98402555910543, "grad_norm": 6.035994052886963, "learning_rate": 6.971068512602059e-06, "loss": 0.6349394989013671, "step": 10950 }, { "epoch": 35.063897763578275, "grad_norm": 3.2993762493133545, "learning_rate": 6.860134895278665e-06, "loss": 0.6447091674804688, "step": 10975 }, { "epoch": 35.14376996805112, "grad_norm": 4.844532489776611, "learning_rate": 6.749201277955272e-06, "loss": 0.6591632080078125, "step": 11000 }, { "epoch": 35.14376996805112, "eval_clean_accuracy": 0.5975, "eval_clean_f1": 0.6355817111815301, "eval_clean_loss": 0.6551367044448853, "eval_clean_precision": 0.5889261744966443, "eval_clean_recall": 0.6902654867256637, "eval_clean_runtime": 38.5643, "eval_clean_samples_per_second": 51.861, "eval_clean_steps_per_second": 3.241, "step": 11000 }, { "epoch": 35.14376996805112, "eval_augmented_accuracy": 0.6065, "eval_augmented_f1": 0.6494432071269488, "eval_augmented_loss": 0.6536811590194702, "eval_augmented_precision": 0.5936482084690554, "eval_augmented_recall": 0.7168141592920354, "eval_augmented_runtime": 32.0905, "eval_augmented_samples_per_second": 62.324, "eval_augmented_steps_per_second": 3.895, "step": 11000 }, { "epoch": 35.22364217252396, "grad_norm": 3.2705025672912598, "learning_rate": 6.638267660631878e-06, "loss": 0.640501708984375, "step": 11025 }, { "epoch": 35.3035143769968, "grad_norm": 4.269927024841309, "learning_rate": 6.527334043308484e-06, "loss": 0.6563777160644532, "step": 11050 }, { "epoch": 35.38338658146965, "grad_norm": 4.366915702819824, "learning_rate": 6.41640042598509e-06, "loss": 0.6656555938720703, "step": 11075 }, { "epoch": 35.46325878594249, "grad_norm": 6.482357501983643, "learning_rate": 6.305466808661698e-06, "loss": 0.6587915802001953, "step": 11100 }, { "epoch": 35.543130990415335, "grad_norm": 3.6223068237304688, "learning_rate": 6.194533191338303e-06, "loss": 0.6463580322265625, "step": 11125 }, { "epoch": 35.62300319488818, "grad_norm": 5.2339277267456055, "learning_rate": 6.0835995740149095e-06, "loss": 0.6501018524169921, "step": 11150 }, { "epoch": 35.70287539936102, "grad_norm": 5.840198993682861, "learning_rate": 5.972665956691516e-06, "loss": 0.6583113861083985, "step": 11175 }, { "epoch": 35.78274760383387, "grad_norm": 10.475706100463867, "learning_rate": 5.861732339368122e-06, "loss": 0.6489720916748047, "step": 11200 }, { "epoch": 35.86261980830671, "grad_norm": 4.230578899383545, "learning_rate": 5.750798722044729e-06, "loss": 0.6586029052734375, "step": 11225 }, { "epoch": 35.94249201277955, "grad_norm": 5.703220844268799, "learning_rate": 5.6398651047213346e-06, "loss": 0.6435173797607422, "step": 11250 }, { "epoch": 35.94249201277955, "eval_clean_accuracy": 0.595, "eval_clean_f1": 0.6311475409836066, "eval_clean_loss": 0.6542406678199768, "eval_clean_precision": 0.5877862595419847, "eval_clean_recall": 0.6814159292035398, "eval_clean_runtime": 36.2746, "eval_clean_samples_per_second": 55.135, "eval_clean_steps_per_second": 3.446, "step": 11250 }, { "epoch": 35.94249201277955, "eval_augmented_accuracy": 0.606, "eval_augmented_f1": 0.6482142857142857, "eval_augmented_loss": 0.6528631448745728, "eval_augmented_precision": 0.5936222403924775, "eval_augmented_recall": 0.7138643067846607, "eval_augmented_runtime": 32.2037, "eval_augmented_samples_per_second": 62.105, "eval_augmented_steps_per_second": 3.882, "step": 11250 }, { "epoch": 36.022364217252395, "grad_norm": 5.129332542419434, "learning_rate": 5.528931487397941e-06, "loss": 0.6390136337280273, "step": 11275 }, { "epoch": 36.10223642172524, "grad_norm": 9.306870460510254, "learning_rate": 5.417997870074547e-06, "loss": 0.6431037139892578, "step": 11300 }, { "epoch": 36.18210862619808, "grad_norm": 4.8531999588012695, "learning_rate": 5.307064252751154e-06, "loss": 0.6510894775390625, "step": 11325 }, { "epoch": 36.26198083067093, "grad_norm": 5.9015045166015625, "learning_rate": 5.1961306354277605e-06, "loss": 0.6360834503173828, "step": 11350 }, { "epoch": 36.34185303514377, "grad_norm": 3.678382635116577, "learning_rate": 5.085197018104366e-06, "loss": 0.6301665496826172, "step": 11375 }, { "epoch": 36.42172523961661, "grad_norm": 4.3425421714782715, "learning_rate": 4.974263400780973e-06, "loss": 0.6526630401611329, "step": 11400 }, { "epoch": 36.501597444089455, "grad_norm": 3.2153613567352295, "learning_rate": 4.863329783457579e-06, "loss": 0.6576791381835938, "step": 11425 }, { "epoch": 36.5814696485623, "grad_norm": 5.090744495391846, "learning_rate": 4.7523961661341856e-06, "loss": 0.6465489959716797, "step": 11450 }, { "epoch": 36.66134185303515, "grad_norm": 8.649394035339355, "learning_rate": 4.641462548810792e-06, "loss": 0.6494834899902344, "step": 11475 }, { "epoch": 36.74121405750799, "grad_norm": 4.324100971221924, "learning_rate": 4.530528931487398e-06, "loss": 0.6658350372314453, "step": 11500 }, { "epoch": 36.74121405750799, "eval_clean_accuracy": 0.598, "eval_clean_f1": 0.6189573459715639, "eval_clean_loss": 0.654563307762146, "eval_clean_precision": 0.5974382433668801, "eval_clean_recall": 0.6420845624385447, "eval_clean_runtime": 36.4007, "eval_clean_samples_per_second": 54.944, "eval_clean_steps_per_second": 3.434, "step": 11500 }, { "epoch": 36.74121405750799, "eval_augmented_accuracy": 0.607, "eval_augmented_f1": 0.6330532212885154, "eval_augmented_loss": 0.6527140140533447, "eval_augmented_precision": 0.6026666666666667, "eval_augmented_recall": 0.6666666666666666, "eval_augmented_runtime": 32.1727, "eval_augmented_samples_per_second": 62.164, "eval_augmented_steps_per_second": 3.885, "step": 11500 }, { "epoch": 36.82108626198083, "grad_norm": 6.785883903503418, "learning_rate": 4.419595314164005e-06, "loss": 0.6687726593017578, "step": 11525 }, { "epoch": 36.90095846645367, "grad_norm": 8.04797077178955, "learning_rate": 4.308661696840611e-06, "loss": 0.6512348175048828, "step": 11550 }, { "epoch": 36.980830670926515, "grad_norm": 3.358091115951538, "learning_rate": 4.197728079517217e-06, "loss": 0.6599739837646484, "step": 11575 }, { "epoch": 37.06070287539936, "grad_norm": 5.661107540130615, "learning_rate": 4.086794462193823e-06, "loss": 0.6291926956176758, "step": 11600 }, { "epoch": 37.14057507987221, "grad_norm": 6.080813407897949, "learning_rate": 3.97586084487043e-06, "loss": 0.6572502136230469, "step": 11625 }, { "epoch": 37.22044728434505, "grad_norm": 5.7030134201049805, "learning_rate": 3.8649272275470366e-06, "loss": 0.6356610488891602, "step": 11650 }, { "epoch": 37.30031948881789, "grad_norm": 7.307449817657471, "learning_rate": 3.7539936102236424e-06, "loss": 0.6618651580810547, "step": 11675 }, { "epoch": 37.38019169329073, "grad_norm": 6.4798078536987305, "learning_rate": 3.6430599929002487e-06, "loss": 0.6591613006591797, "step": 11700 }, { "epoch": 37.460063897763575, "grad_norm": 2.775582790374756, "learning_rate": 3.5321263755768554e-06, "loss": 0.6393368148803711, "step": 11725 }, { "epoch": 37.539936102236425, "grad_norm": 6.448618412017822, "learning_rate": 3.4211927582534616e-06, "loss": 0.6466458892822265, "step": 11750 }, { "epoch": 37.539936102236425, "eval_clean_accuracy": 0.5975, "eval_clean_f1": 0.6101694915254238, "eval_clean_loss": 0.654737651348114, "eval_clean_precision": 0.601145038167939, "eval_clean_recall": 0.6194690265486725, "eval_clean_runtime": 37.3777, "eval_clean_samples_per_second": 53.508, "eval_clean_steps_per_second": 3.344, "step": 11750 }, { "epoch": 37.539936102236425, "eval_augmented_accuracy": 0.6055, "eval_augmented_f1": 0.6233890214797136, "eval_augmented_loss": 0.6526142358779907, "eval_augmented_precision": 0.6057513914656771, "eval_augmented_recall": 0.6420845624385447, "eval_augmented_runtime": 31.9876, "eval_augmented_samples_per_second": 62.524, "eval_augmented_steps_per_second": 3.908, "step": 11750 }, { "epoch": 37.61980830670927, "grad_norm": 4.318397045135498, "learning_rate": 3.310259140930068e-06, "loss": 0.6541086578369141, "step": 11775 }, { "epoch": 37.69968051118211, "grad_norm": 11.485973358154297, "learning_rate": 3.199325523606674e-06, "loss": 0.6640641784667969, "step": 11800 }, { "epoch": 37.77955271565495, "grad_norm": 4.20050048828125, "learning_rate": 3.08839190628328e-06, "loss": 0.6594728088378906, "step": 11825 }, { "epoch": 37.85942492012779, "grad_norm": 6.774668216705322, "learning_rate": 2.9774582889598867e-06, "loss": 0.6458730316162109, "step": 11850 }, { "epoch": 37.93929712460064, "grad_norm": 3.732543468475342, "learning_rate": 2.866524671636493e-06, "loss": 0.6475601196289062, "step": 11875 }, { "epoch": 38.019169329073485, "grad_norm": 5.758055686950684, "learning_rate": 2.7555910543130992e-06, "loss": 0.6482804870605469, "step": 11900 }, { "epoch": 38.09904153354633, "grad_norm": 7.916332244873047, "learning_rate": 2.6446574369897055e-06, "loss": 0.6824202728271485, "step": 11925 }, { "epoch": 38.17891373801917, "grad_norm": 3.7368791103363037, "learning_rate": 2.5337238196663118e-06, "loss": 0.6467150115966797, "step": 11950 }, { "epoch": 38.25878594249201, "grad_norm": 4.053793907165527, "learning_rate": 2.422790202342918e-06, "loss": 0.6465704345703125, "step": 11975 }, { "epoch": 38.33865814696485, "grad_norm": 12.014739036560059, "learning_rate": 2.3118565850195247e-06, "loss": 0.6608992767333984, "step": 12000 }, { "epoch": 38.33865814696485, "eval_clean_accuracy": 0.5935, "eval_clean_f1": 0.5440269209197981, "eval_clean_loss": 0.6608283519744873, "eval_clean_precision": 0.6331592689295039, "eval_clean_recall": 0.4768928220255654, "eval_clean_runtime": 34.7181, "eval_clean_samples_per_second": 57.607, "eval_clean_steps_per_second": 3.6, "step": 12000 }, { "epoch": 38.33865814696485, "eval_augmented_accuracy": 0.5985, "eval_augmented_f1": 0.558062740781508, "eval_augmented_loss": 0.6578558087348938, "eval_augmented_precision": 0.63375, "eval_augmented_recall": 0.49852507374631266, "eval_augmented_runtime": 30.654, "eval_augmented_samples_per_second": 65.244, "eval_augmented_steps_per_second": 4.078, "step": 12000 }, { "epoch": 38.4185303514377, "grad_norm": 4.951875686645508, "learning_rate": 2.2009229676961306e-06, "loss": 0.6363213348388672, "step": 12025 }, { "epoch": 38.498402555910545, "grad_norm": 8.60593032836914, "learning_rate": 2.089989350372737e-06, "loss": 0.6496890258789062, "step": 12050 }, { "epoch": 38.57827476038339, "grad_norm": 4.169249534606934, "learning_rate": 1.979055733049343e-06, "loss": 0.6537897491455078, "step": 12075 }, { "epoch": 38.65814696485623, "grad_norm": 5.172484874725342, "learning_rate": 1.8681221157259496e-06, "loss": 0.6470604705810546, "step": 12100 }, { "epoch": 38.73801916932907, "grad_norm": 4.086310863494873, "learning_rate": 1.7571884984025559e-06, "loss": 0.6440177154541016, "step": 12125 }, { "epoch": 38.81789137380191, "grad_norm": 3.5936968326568604, "learning_rate": 1.6462548810791624e-06, "loss": 0.6537330627441407, "step": 12150 }, { "epoch": 38.89776357827476, "grad_norm": 13.590371131896973, "learning_rate": 1.5353212637557686e-06, "loss": 0.6469161224365234, "step": 12175 }, { "epoch": 38.977635782747605, "grad_norm": 5.592586517333984, "learning_rate": 1.424387646432375e-06, "loss": 0.630062370300293, "step": 12200 }, { "epoch": 39.05750798722045, "grad_norm": 11.618270874023438, "learning_rate": 1.3134540291089812e-06, "loss": 0.6543638610839844, "step": 12225 }, { "epoch": 39.13738019169329, "grad_norm": 7.390941619873047, "learning_rate": 1.2025204117855876e-06, "loss": 0.6605912017822265, "step": 12250 }, { "epoch": 39.13738019169329, "eval_clean_accuracy": 0.594, "eval_clean_f1": 0.6148007590132827, "eval_clean_loss": 0.6539257764816284, "eval_clean_precision": 0.5939505041246563, "eval_clean_recall": 0.6371681415929203, "eval_clean_runtime": 34.9352, "eval_clean_samples_per_second": 57.249, "eval_clean_steps_per_second": 3.578, "step": 12250 }, { "epoch": 39.13738019169329, "eval_augmented_accuracy": 0.603, "eval_augmented_f1": 0.630009319664492, "eval_augmented_loss": 0.6519100069999695, "eval_augmented_precision": 0.5987599645704162, "eval_augmented_recall": 0.6647000983284169, "eval_augmented_runtime": 30.8893, "eval_augmented_samples_per_second": 64.747, "eval_augmented_steps_per_second": 4.047, "step": 12250 }, { "epoch": 39.21725239616613, "grad_norm": 5.007359981536865, "learning_rate": 1.091586794462194e-06, "loss": 0.6530168151855469, "step": 12275 }, { "epoch": 39.29712460063898, "grad_norm": 3.145382881164551, "learning_rate": 9.806531771388002e-07, "loss": 0.6377132034301758, "step": 12300 }, { "epoch": 39.37699680511182, "grad_norm": 6.810988903045654, "learning_rate": 8.697195598154065e-07, "loss": 0.6428498840332031, "step": 12325 }, { "epoch": 39.456869009584665, "grad_norm": 3.9041340351104736, "learning_rate": 7.587859424920128e-07, "loss": 0.6499935913085938, "step": 12350 }, { "epoch": 39.53674121405751, "grad_norm": 4.208970069885254, "learning_rate": 6.478523251686191e-07, "loss": 0.6639176177978515, "step": 12375 }, { "epoch": 39.61661341853035, "grad_norm": 4.450422286987305, "learning_rate": 5.369187078452255e-07, "loss": 0.6375583648681641, "step": 12400 }, { "epoch": 39.6964856230032, "grad_norm": 8.59503173828125, "learning_rate": 4.259850905218318e-07, "loss": 0.6576736450195313, "step": 12425 }, { "epoch": 39.77635782747604, "grad_norm": 6.046400547027588, "learning_rate": 3.150514731984381e-07, "loss": 0.6326798629760743, "step": 12450 }, { "epoch": 39.85623003194888, "grad_norm": 9.561112403869629, "learning_rate": 2.0411785587504438e-07, "loss": 0.6545785522460937, "step": 12475 }, { "epoch": 39.936102236421725, "grad_norm": 11.469953536987305, "learning_rate": 9.31842385516507e-08, "loss": 0.6409931945800781, "step": 12500 }, { "epoch": 39.936102236421725, "eval_clean_accuracy": 0.598, "eval_clean_f1": 0.6015857284440039, "eval_clean_loss": 0.6552501320838928, "eval_clean_precision": 0.6063936063936064, "eval_clean_recall": 0.5968534906588004, "eval_clean_runtime": 35.7241, "eval_clean_samples_per_second": 55.985, "eval_clean_steps_per_second": 3.499, "step": 12500 }, { "epoch": 39.936102236421725, "eval_augmented_accuracy": 0.6065, "eval_augmented_f1": 0.6147821830641214, "eval_augmented_loss": 0.6528330445289612, "eval_augmented_precision": 0.6120857699805068, "eval_augmented_recall": 0.6175024582104228, "eval_augmented_runtime": 30.6534, "eval_augmented_samples_per_second": 65.246, "eval_augmented_steps_per_second": 4.078, "step": 12500 }, { "epoch": 40.0, "eval_clean_accuracy": 0.598, "eval_clean_f1": 0.6015857284440039, "eval_clean_loss": 0.6552357077598572, "eval_clean_precision": 0.6063936063936064, "eval_clean_recall": 0.5968534906588004, "eval_clean_runtime": 32.1912, "eval_clean_samples_per_second": 62.129, "eval_clean_steps_per_second": 3.883, "step": 12520 }, { "epoch": 40.0, "eval_augmented_accuracy": 0.606, "eval_augmented_f1": 0.6144814090019569, "eval_augmented_loss": 0.6528159976005554, "eval_augmented_precision": 0.611489776046738, "eval_augmented_recall": 0.6175024582104228, "eval_augmented_runtime": 30.6727, "eval_augmented_samples_per_second": 65.205, "eval_augmented_steps_per_second": 4.075, "step": 12520 }, { "epoch": 40.0, "step": 12520, "total_flos": 0.0, "train_loss": 0.6727846874406163, "train_runtime": 9951.4787, "train_samples_per_second": 40.219, "train_steps_per_second": 1.258 }, { "clean_accuracy": 0.5095, "clean_f1": 0.6746268656716418, "clean_loss": 0.6926307082176208, "clean_precision": 0.509009009009009, "clean_recall": 1.0, "clean_runtime": 32.4302, "clean_samples_per_second": 61.671, "clean_steps_per_second": 3.854, "epoch": 40.0, "step": 12520 }, { "augmented_accuracy": 0.5095, "augmented_f1": 0.6746268656716418, "augmented_loss": 0.6926261782646179, "augmented_precision": 0.509009009009009, "augmented_recall": 1.0, "augmented_runtime": 30.0881, "augmented_samples_per_second": 66.471, "augmented_steps_per_second": 4.154, "epoch": 40.0, "step": 12520 } ], "logging_steps": 25, "max_steps": 12520, "num_input_tokens_seen": 0, "num_train_epochs": 40, "save_steps": 250, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }