{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "global_step": 1750, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0, "learning_rate": 4.9971428571428576e-05, "loss": 13.0691, "step": 1 }, { "epoch": 0.02, "learning_rate": 4.9e-05, "loss": 14.048, "step": 35 }, { "epoch": 0.02, "eval_accuracy": 0.5, "eval_f1": 0.6666666666666666, "eval_loss": 7.880705833435059, "eval_precision": 0.5, "eval_recall": 1.0, "eval_runtime": 80.7039, "eval_samples_per_second": 37.173, "eval_steps_per_second": 4.647, "step": 35 }, { "epoch": 0.04, "learning_rate": 4.8e-05, "loss": 2.2656, "step": 70 }, { "epoch": 0.04, "eval_accuracy": 0.5016666666666667, "eval_f1": 0.6674082313681868, "eval_loss": 3.2190163135528564, "eval_precision": 0.5008347245409015, "eval_recall": 1.0, "eval_runtime": 80.4061, "eval_samples_per_second": 37.311, "eval_steps_per_second": 4.664, "step": 70 }, { "epoch": 0.06, "learning_rate": 4.7e-05, "loss": 2.1548, "step": 105 }, { "epoch": 0.06, "eval_accuracy": 0.6906666666666667, "eval_f1": 0.7371104815864024, "eval_loss": 0.5703864097595215, "eval_precision": 0.6408866995073892, "eval_recall": 0.8673333333333333, "eval_runtime": 80.8676, "eval_samples_per_second": 37.098, "eval_steps_per_second": 4.637, "step": 105 }, { "epoch": 0.08, "learning_rate": 4.600000000000001e-05, "loss": 1.3819, "step": 140 }, { "epoch": 0.08, "eval_accuracy": 0.5, "eval_f1": 0.0, "eval_loss": 0.9337035417556763, "eval_precision": 0.0, "eval_recall": 0.0, "eval_runtime": 80.5811, "eval_samples_per_second": 37.23, "eval_steps_per_second": 4.654, "step": 140 }, { "epoch": 0.1, "learning_rate": 4.5e-05, "loss": 1.1309, "step": 175 }, { "epoch": 0.1, "eval_accuracy": 0.5, "eval_f1": 0.6666666666666666, "eval_loss": 2.4655497074127197, "eval_precision": 0.5, "eval_recall": 1.0, "eval_runtime": 80.4828, "eval_samples_per_second": 37.275, "eval_steps_per_second": 4.659, "step": 175 }, { "epoch": 0.12, "learning_rate": 4.4000000000000006e-05, "loss": 0.9397, "step": 210 }, { "epoch": 0.12, "eval_accuracy": 0.6686666666666666, "eval_f1": 0.7317862924986509, "eval_loss": 0.6442784667015076, "eval_precision": 0.614687216681777, "eval_recall": 0.904, "eval_runtime": 80.537, "eval_samples_per_second": 37.25, "eval_steps_per_second": 4.656, "step": 210 }, { "epoch": 0.14, "learning_rate": 4.3e-05, "loss": 0.8193, "step": 245 }, { "epoch": 0.14, "eval_accuracy": 0.6676666666666666, "eval_f1": 0.7155492154065621, "eval_loss": 1.0818308591842651, "eval_precision": 0.6254364089775561, "eval_recall": 0.836, "eval_runtime": 81.1642, "eval_samples_per_second": 36.962, "eval_steps_per_second": 4.62, "step": 245 }, { "epoch": 0.16, "learning_rate": 4.2e-05, "loss": 0.6235, "step": 280 }, { "epoch": 0.16, "eval_accuracy": 0.5413333333333333, "eval_f1": 0.685413808870599, "eval_loss": 1.136587381362915, "eval_precision": 0.5215727209464162, "eval_recall": 0.9993333333333333, "eval_runtime": 81.1897, "eval_samples_per_second": 36.951, "eval_steps_per_second": 4.619, "step": 280 }, { "epoch": 0.18, "learning_rate": 4.1e-05, "loss": 0.6828, "step": 315 }, { "epoch": 0.18, "eval_accuracy": 0.7913333333333333, "eval_f1": 0.7481898632341111, "eval_loss": 0.5717737674713135, "eval_precision": 0.9432048681541582, "eval_recall": 0.62, "eval_runtime": 80.6162, "eval_samples_per_second": 37.213, "eval_steps_per_second": 4.652, "step": 315 }, { "epoch": 0.2, "learning_rate": 4e-05, "loss": 0.5375, "step": 350 }, { "epoch": 0.2, "eval_accuracy": 0.6203333333333333, "eval_f1": 0.7234765719834911, "eval_loss": 1.3898557424545288, "eval_precision": 0.5689194348988164, "eval_recall": 0.9933333333333333, "eval_runtime": 80.8767, "eval_samples_per_second": 37.094, "eval_steps_per_second": 4.637, "step": 350 }, { "epoch": 0.22, "learning_rate": 3.9000000000000006e-05, "loss": 0.8008, "step": 385 }, { "epoch": 0.22, "eval_accuracy": 0.6446666666666667, "eval_f1": 0.7352210630899155, "eval_loss": 1.3506994247436523, "eval_precision": 0.5859065716547902, "eval_recall": 0.9866666666666667, "eval_runtime": 80.9272, "eval_samples_per_second": 37.07, "eval_steps_per_second": 4.634, "step": 385 }, { "epoch": 0.24, "learning_rate": 3.8e-05, "loss": 0.5408, "step": 420 }, { "epoch": 0.24, "eval_accuracy": 0.5, "eval_f1": 0.6666666666666666, "eval_loss": 5.448528289794922, "eval_precision": 0.5, "eval_recall": 1.0, "eval_runtime": 80.3832, "eval_samples_per_second": 37.321, "eval_steps_per_second": 4.665, "step": 420 }, { "epoch": 0.26, "learning_rate": 3.7e-05, "loss": 1.5679, "step": 455 }, { "epoch": 0.26, "eval_accuracy": 0.5303333333333333, "eval_f1": 0.6804264005443411, "eval_loss": 2.9407122135162354, "eval_precision": 0.5156411137848058, "eval_recall": 1.0, "eval_runtime": 80.4322, "eval_samples_per_second": 37.298, "eval_steps_per_second": 4.662, "step": 455 }, { "epoch": 0.28, "learning_rate": 3.6e-05, "loss": 0.7113, "step": 490 }, { "epoch": 0.28, "eval_accuracy": 0.5003333333333333, "eval_f1": 0.6668148477439431, "eval_loss": 4.913637638092041, "eval_precision": 0.5001667222407469, "eval_recall": 1.0, "eval_runtime": 80.9405, "eval_samples_per_second": 37.064, "eval_steps_per_second": 4.633, "step": 490 }, { "epoch": 0.3, "learning_rate": 3.5e-05, "loss": 0.5356, "step": 525 }, { "epoch": 0.3, "eval_accuracy": 0.6223333333333333, "eval_f1": 0.724933236222384, "eval_loss": 1.4003673791885376, "eval_precision": 0.5700649102710958, "eval_recall": 0.9953333333333333, "eval_runtime": 80.635, "eval_samples_per_second": 37.205, "eval_steps_per_second": 4.651, "step": 525 }, { "epoch": 0.32, "learning_rate": 3.4000000000000007e-05, "loss": 0.4847, "step": 560 }, { "epoch": 0.32, "eval_accuracy": 0.5016666666666667, "eval_f1": 0.6674082313681868, "eval_loss": 6.015239715576172, "eval_precision": 0.5008347245409015, "eval_recall": 1.0, "eval_runtime": 80.7702, "eval_samples_per_second": 37.142, "eval_steps_per_second": 4.643, "step": 560 }, { "epoch": 0.34, "learning_rate": 3.3e-05, "loss": 0.319, "step": 595 }, { "epoch": 0.34, "eval_accuracy": 0.8496666666666667, "eval_f1": 0.8543752018082015, "eval_loss": 0.6166228652000427, "eval_precision": 0.828428303068253, "eval_recall": 0.882, "eval_runtime": 80.8211, "eval_samples_per_second": 37.119, "eval_steps_per_second": 4.64, "step": 595 }, { "epoch": 0.36, "learning_rate": 3.2000000000000005e-05, "loss": 0.822, "step": 630 }, { "epoch": 0.36, "eval_accuracy": 0.8383333333333334, "eval_f1": 0.820967146548542, "eval_loss": 0.41078850626945496, "eval_precision": 0.9197684036393714, "eval_recall": 0.7413333333333333, "eval_runtime": 80.9973, "eval_samples_per_second": 37.038, "eval_steps_per_second": 4.63, "step": 630 }, { "epoch": 0.38, "learning_rate": 3.1e-05, "loss": 0.4746, "step": 665 }, { "epoch": 0.38, "eval_accuracy": 0.8246666666666667, "eval_f1": 0.830213040671401, "eval_loss": 0.3808746337890625, "eval_precision": 0.804755944931164, "eval_recall": 0.8573333333333333, "eval_runtime": 80.4252, "eval_samples_per_second": 37.302, "eval_steps_per_second": 4.663, "step": 665 }, { "epoch": 0.4, "learning_rate": 3e-05, "loss": 0.2913, "step": 700 }, { "epoch": 0.4, "eval_accuracy": 0.747, "eval_f1": 0.7941415785191213, "eval_loss": 0.7681821584701538, "eval_precision": 0.6694101508916324, "eval_recall": 0.976, "eval_runtime": 80.4193, "eval_samples_per_second": 37.304, "eval_steps_per_second": 4.663, "step": 700 }, { "epoch": 0.42, "learning_rate": 2.9e-05, "loss": 0.3153, "step": 735 }, { "epoch": 0.42, "eval_accuracy": 0.8356666666666667, "eval_f1": 0.8523510032943996, "eval_loss": 0.4611086845397949, "eval_precision": 0.7737901033170201, "eval_recall": 0.9486666666666667, "eval_runtime": 80.4421, "eval_samples_per_second": 37.294, "eval_steps_per_second": 4.662, "step": 735 }, { "epoch": 0.44, "learning_rate": 2.8000000000000003e-05, "loss": 0.4953, "step": 770 }, { "epoch": 0.44, "eval_accuracy": 0.5146666666666667, "eval_f1": 0.6732495511669659, "eval_loss": 1.9276390075683594, "eval_precision": 0.5074424898511503, "eval_recall": 1.0, "eval_runtime": 80.6277, "eval_samples_per_second": 37.208, "eval_steps_per_second": 4.651, "step": 770 }, { "epoch": 0.46, "learning_rate": 2.7000000000000002e-05, "loss": 0.8238, "step": 805 }, { "epoch": 0.46, "eval_accuracy": 0.8233333333333334, "eval_f1": 0.789515488482923, "eval_loss": 0.758985698223114, "eval_precision": 0.9764243614931237, "eval_recall": 0.6626666666666666, "eval_runtime": 80.4659, "eval_samples_per_second": 37.283, "eval_steps_per_second": 4.66, "step": 805 }, { "epoch": 0.48, "learning_rate": 2.6000000000000002e-05, "loss": 0.6315, "step": 840 }, { "epoch": 0.48, "eval_accuracy": 0.5013333333333333, "eval_f1": 0.6672597864768683, "eval_loss": 5.900465965270996, "eval_precision": 0.5006675567423231, "eval_recall": 1.0, "eval_runtime": 80.4747, "eval_samples_per_second": 37.279, "eval_steps_per_second": 4.66, "step": 840 }, { "epoch": 0.5, "learning_rate": 2.5e-05, "loss": 0.4659, "step": 875 }, { "epoch": 0.5, "eval_accuracy": 0.879, "eval_f1": 0.875214850464077, "eval_loss": 0.2947004735469818, "eval_precision": 0.9034776437189496, "eval_recall": 0.8486666666666667, "eval_runtime": 80.8565, "eval_samples_per_second": 37.103, "eval_steps_per_second": 4.638, "step": 875 }, { "epoch": 0.52, "learning_rate": 2.4e-05, "loss": 0.2773, "step": 910 }, { "epoch": 0.52, "eval_accuracy": 0.5133333333333333, "eval_f1": 0.672645739910314, "eval_loss": 3.5455527305603027, "eval_precision": 0.5067567567567568, "eval_recall": 1.0, "eval_runtime": 80.4994, "eval_samples_per_second": 37.267, "eval_steps_per_second": 4.658, "step": 910 }, { "epoch": 0.54, "learning_rate": 2.3000000000000003e-05, "loss": 0.371, "step": 945 }, { "epoch": 0.54, "eval_accuracy": 0.5043333333333333, "eval_f1": 0.6685981724983284, "eval_loss": 3.9809491634368896, "eval_precision": 0.5021760964178105, "eval_recall": 1.0, "eval_runtime": 80.5845, "eval_samples_per_second": 37.228, "eval_steps_per_second": 4.654, "step": 945 }, { "epoch": 0.56, "learning_rate": 2.2000000000000003e-05, "loss": 0.4968, "step": 980 }, { "epoch": 0.56, "eval_accuracy": 0.713, "eval_f1": 0.7757228444907528, "eval_loss": 1.2047169208526611, "eval_precision": 0.6365968362548098, "eval_recall": 0.9926666666666667, "eval_runtime": 80.9051, "eval_samples_per_second": 37.08, "eval_steps_per_second": 4.635, "step": 980 }, { "epoch": 0.58, "learning_rate": 2.1e-05, "loss": 0.5577, "step": 1015 }, { "epoch": 0.58, "eval_accuracy": 0.9123333333333333, "eval_f1": 0.9118337244384848, "eval_loss": 0.24421826004981995, "eval_precision": 0.9170600134861767, "eval_recall": 0.9066666666666666, "eval_runtime": 80.8404, "eval_samples_per_second": 37.11, "eval_steps_per_second": 4.639, "step": 1015 }, { "epoch": 0.6, "learning_rate": 2e-05, "loss": 0.2212, "step": 1050 }, { "epoch": 0.6, "eval_accuracy": 0.8366666666666667, "eval_f1": 0.8556275780789628, "eval_loss": 0.44433295726776123, "eval_precision": 0.7666314677930306, "eval_recall": 0.968, "eval_runtime": 80.4427, "eval_samples_per_second": 37.294, "eval_steps_per_second": 4.662, "step": 1050 }, { "epoch": 0.62, "learning_rate": 1.9e-05, "loss": 0.2668, "step": 1085 }, { "epoch": 0.62, "eval_accuracy": 0.56, "eval_f1": 0.6943029180176007, "eval_loss": 2.2121241092681885, "eval_precision": 0.5319375443577005, "eval_recall": 0.9993333333333333, "eval_runtime": 80.772, "eval_samples_per_second": 37.142, "eval_steps_per_second": 4.643, "step": 1085 }, { "epoch": 0.64, "learning_rate": 1.8e-05, "loss": 0.2392, "step": 1120 }, { "epoch": 0.64, "eval_accuracy": 0.617, "eval_f1": 0.7223967141821697, "eval_loss": 1.7039114236831665, "eval_precision": 0.5665024630541872, "eval_recall": 0.9966666666666667, "eval_runtime": 81.2102, "eval_samples_per_second": 36.941, "eval_steps_per_second": 4.618, "step": 1120 }, { "epoch": 0.66, "learning_rate": 1.7000000000000003e-05, "loss": 0.4237, "step": 1155 }, { "epoch": 0.66, "eval_accuracy": 0.5113333333333333, "eval_f1": 0.6717420510523958, "eval_loss": 3.3159143924713135, "eval_precision": 0.5057316250842886, "eval_recall": 1.0, "eval_runtime": 80.4636, "eval_samples_per_second": 37.284, "eval_steps_per_second": 4.66, "step": 1155 }, { "epoch": 0.68, "learning_rate": 1.6000000000000003e-05, "loss": 0.4353, "step": 1190 }, { "epoch": 0.68, "eval_accuracy": 0.82, "eval_f1": 0.8432055749128919, "eval_loss": 0.5704355239868164, "eval_precision": 0.7469135802469136, "eval_recall": 0.968, "eval_runtime": 80.5065, "eval_samples_per_second": 37.264, "eval_steps_per_second": 4.658, "step": 1190 }, { "epoch": 0.7, "learning_rate": 1.5e-05, "loss": 0.3109, "step": 1225 }, { "epoch": 0.7, "eval_accuracy": 0.6846666666666666, "eval_f1": 0.7591649694501018, "eval_loss": 1.1700917482376099, "eval_precision": 0.6140856672158155, "eval_recall": 0.994, "eval_runtime": 80.6642, "eval_samples_per_second": 37.191, "eval_steps_per_second": 4.649, "step": 1225 }, { "epoch": 0.72, "learning_rate": 1.4000000000000001e-05, "loss": 0.2154, "step": 1260 }, { "epoch": 0.72, "eval_accuracy": 0.817, "eval_f1": 0.8419234091563489, "eval_loss": 0.48465803265571594, "eval_precision": 0.7410035478966042, "eval_recall": 0.9746666666666667, "eval_runtime": 80.8924, "eval_samples_per_second": 37.086, "eval_steps_per_second": 4.636, "step": 1260 }, { "epoch": 0.74, "learning_rate": 1.3000000000000001e-05, "loss": 0.2415, "step": 1295 }, { "epoch": 0.74, "eval_accuracy": 0.8613333333333333, "eval_f1": 0.87363304981774, "eval_loss": 0.36877182126045227, "eval_precision": 0.8024553571428571, "eval_recall": 0.9586666666666667, "eval_runtime": 80.8409, "eval_samples_per_second": 37.11, "eval_steps_per_second": 4.639, "step": 1295 }, { "epoch": 0.76, "learning_rate": 1.2e-05, "loss": 0.2014, "step": 1330 }, { "epoch": 0.76, "eval_accuracy": 0.7543333333333333, "eval_f1": 0.8008646311807619, "eval_loss": 0.6940145492553711, "eval_precision": 0.6733303044070876, "eval_recall": 0.988, "eval_runtime": 86.2109, "eval_samples_per_second": 34.798, "eval_steps_per_second": 4.35, "step": 1330 }, { "epoch": 0.78, "learning_rate": 1.1000000000000001e-05, "loss": 0.2165, "step": 1365 }, { "epoch": 0.78, "eval_accuracy": 0.611, "eval_f1": 0.7195385724585437, "eval_loss": 1.6025038957595825, "eval_precision": 0.5625704622322435, "eval_recall": 0.998, "eval_runtime": 81.0854, "eval_samples_per_second": 36.998, "eval_steps_per_second": 4.625, "step": 1365 }, { "epoch": 0.8, "learning_rate": 1e-05, "loss": 0.2487, "step": 1400 }, { "epoch": 0.8, "eval_accuracy": 0.73, "eval_f1": 0.7856008470089996, "eval_loss": 0.8998059630393982, "eval_precision": 0.6514486391571555, "eval_recall": 0.9893333333333333, "eval_runtime": 80.4427, "eval_samples_per_second": 37.294, "eval_steps_per_second": 4.662, "step": 1400 }, { "epoch": 0.82, "learning_rate": 9e-06, "loss": 0.2204, "step": 1435 }, { "epoch": 0.82, "eval_accuracy": 0.8493333333333334, "eval_f1": 0.8598884066955982, "eval_loss": 0.3596617579460144, "eval_precision": 0.8035921205098494, "eval_recall": 0.9246666666666666, "eval_runtime": 80.5841, "eval_samples_per_second": 37.228, "eval_steps_per_second": 4.654, "step": 1435 }, { "epoch": 0.84, "learning_rate": 8.000000000000001e-06, "loss": 0.1436, "step": 1470 }, { "epoch": 0.84, "eval_accuracy": 0.5616666666666666, "eval_f1": 0.6951078135868306, "eval_loss": 2.4785938262939453, "eval_precision": 0.5328830430145752, "eval_recall": 0.9993333333333333, "eval_runtime": 80.9085, "eval_samples_per_second": 37.079, "eval_steps_per_second": 4.635, "step": 1470 }, { "epoch": 0.86, "learning_rate": 7.000000000000001e-06, "loss": 0.1431, "step": 1505 }, { "epoch": 0.86, "eval_accuracy": 0.7606666666666667, "eval_f1": 0.8035030103995622, "eval_loss": 0.7645860314369202, "eval_precision": 0.6815227483751161, "eval_recall": 0.9786666666666667, "eval_runtime": 80.9077, "eval_samples_per_second": 37.079, "eval_steps_per_second": 4.635, "step": 1505 }, { "epoch": 0.88, "learning_rate": 6e-06, "loss": 0.2083, "step": 1540 }, { "epoch": 0.88, "eval_accuracy": 0.645, "eval_f1": 0.7372316802368615, "eval_loss": 1.5643061399459839, "eval_precision": 0.5851938895417156, "eval_recall": 0.996, "eval_runtime": 80.4452, "eval_samples_per_second": 37.292, "eval_steps_per_second": 4.662, "step": 1540 }, { "epoch": 0.9, "learning_rate": 5e-06, "loss": 0.218, "step": 1575 }, { "epoch": 0.9, "eval_accuracy": 0.6816666666666666, "eval_f1": 0.7570592724497585, "eval_loss": 1.3131792545318604, "eval_precision": 0.6120937885643768, "eval_recall": 0.992, "eval_runtime": 80.8361, "eval_samples_per_second": 37.112, "eval_steps_per_second": 4.639, "step": 1575 }, { "epoch": 0.92, "learning_rate": 4.000000000000001e-06, "loss": 0.2679, "step": 1610 }, { "epoch": 0.92, "eval_accuracy": 0.8243333333333334, "eval_f1": 0.845771144278607, "eval_loss": 0.4741792678833008, "eval_precision": 0.7537819509650495, "eval_recall": 0.9633333333333334, "eval_runtime": 80.8168, "eval_samples_per_second": 37.121, "eval_steps_per_second": 4.64, "step": 1610 }, { "epoch": 0.94, "learning_rate": 3e-06, "loss": 0.2218, "step": 1645 }, { "epoch": 0.94, "eval_accuracy": 0.753, "eval_f1": 0.7996755879967559, "eval_loss": 0.7849438190460205, "eval_precision": 0.6725784447476125, "eval_recall": 0.986, "eval_runtime": 80.4264, "eval_samples_per_second": 37.301, "eval_steps_per_second": 4.663, "step": 1645 }, { "epoch": 0.96, "learning_rate": 2.0000000000000003e-06, "loss": 0.1489, "step": 1680 }, { "epoch": 0.96, "eval_accuracy": 0.6353333333333333, "eval_f1": 0.7322564855604503, "eval_loss": 1.6629990339279175, "eval_precision": 0.5784996133023975, "eval_recall": 0.9973333333333333, "eval_runtime": 80.5542, "eval_samples_per_second": 37.242, "eval_steps_per_second": 4.655, "step": 1680 }, { "epoch": 0.98, "learning_rate": 1.0000000000000002e-06, "loss": 0.2119, "step": 1715 }, { "epoch": 0.98, "eval_accuracy": 0.6753333333333333, "eval_f1": 0.7536671724835609, "eval_loss": 1.2936441898345947, "eval_precision": 0.6071719641401793, "eval_recall": 0.9933333333333333, "eval_runtime": 80.4726, "eval_samples_per_second": 37.28, "eval_steps_per_second": 4.66, "step": 1715 }, { "epoch": 1.0, "learning_rate": 0.0, "loss": 0.1341, "step": 1750 }, { "epoch": 1.0, "eval_accuracy": 0.6686666666666666, "eval_f1": 0.7500000000000001, "eval_loss": 1.3422788381576538, "eval_precision": 0.6021809369951535, "eval_recall": 0.994, "eval_runtime": 80.4399, "eval_samples_per_second": 37.295, "eval_steps_per_second": 4.662, "step": 1750 } ], "max_steps": 1750, "num_train_epochs": 1, "total_flos": 1.300198588416e+16, "trial_name": null, "trial_params": null }