{ "best_global_step": 12000, "best_metric": 0.8851364411848566, "best_model_checkpoint": "/home/rupak/Desktop/Topic-Modeling /topic modeling 25k/checkpoint/hindibert-25k-2e5-256-16-10/checkpoint-12000", "epoch": 10.0, "eval_steps": 1000, "global_step": 12510, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.0007996801279488205, "grad_norm": 0.4256272315979004, "learning_rate": 0.0, "loss": 1.6057, "step": 1 }, { "epoch": 0.07996801279488205, "grad_norm": 0.2559647262096405, "learning_rate": 1.5840000000000002e-06, "loss": 1.6096, "step": 100 }, { "epoch": 0.1599360255897641, "grad_norm": 0.3533499538898468, "learning_rate": 3.1840000000000003e-06, "loss": 1.6082, "step": 200 }, { "epoch": 0.23990403838464613, "grad_norm": 0.8860995769500732, "learning_rate": 4.784e-06, "loss": 1.5804, "step": 300 }, { "epoch": 0.3198720511795282, "grad_norm": 2.5284152030944824, "learning_rate": 6.384e-06, "loss": 1.5089, "step": 400 }, { "epoch": 0.39984006397441024, "grad_norm": 3.2023630142211914, "learning_rate": 7.984e-06, "loss": 1.4447, "step": 500 }, { "epoch": 0.47980807676929227, "grad_norm": 1.5101996660232544, "learning_rate": 9.584000000000002e-06, "loss": 1.3792, "step": 600 }, { "epoch": 0.5597760895641744, "grad_norm": 5.609898567199707, "learning_rate": 1.1184000000000002e-05, "loss": 1.304, "step": 700 }, { "epoch": 0.6397441023590564, "grad_norm": 2.335813283920288, "learning_rate": 1.2784000000000002e-05, "loss": 1.2209, "step": 800 }, { "epoch": 0.7197121151539384, "grad_norm": 8.134674072265625, "learning_rate": 1.4384e-05, "loss": 1.1316, "step": 900 }, { "epoch": 0.7996801279488205, "grad_norm": 3.204949378967285, "learning_rate": 1.5984e-05, "loss": 1.0329, "step": 1000 }, { "epoch": 0.7996801279488205, "eval_accuracy": 0.8532586965213914, "eval_auroc_macro": 0.9627139686967083, "eval_auroc_weighted": 0.9621425517364535, "eval_f1_macro": 0.8528821004884175, "eval_f1_weighted": 0.8513342469566539, "eval_loss": 0.947596549987793, "eval_precision_macro": 0.8554881698862349, "eval_precision_weighted": 0.8550249260047849, "eval_recall_macro": 0.8556520862335584, "eval_recall_weighted": 0.8532586965213914, "eval_runtime": 10.6709, "eval_samples_per_second": 234.375, "eval_steps_per_second": 29.332, "step": 1000 }, { "epoch": 0.8796481407437026, "grad_norm": 11.433937072753906, "learning_rate": 1.7584e-05, "loss": 0.9068, "step": 1100 }, { "epoch": 0.9596161535385845, "grad_norm": 7.322030067443848, "learning_rate": 1.9184e-05, "loss": 0.7819, "step": 1200 }, { "epoch": 1.0391843262694922, "grad_norm": 13.326150894165039, "learning_rate": 1.991296625222025e-05, "loss": 0.671, "step": 1300 }, { "epoch": 1.1191523390643743, "grad_norm": 4.284726619720459, "learning_rate": 1.9735346358792185e-05, "loss": 0.577, "step": 1400 }, { "epoch": 1.1991203518592564, "grad_norm": 18.762231826782227, "learning_rate": 1.955772646536412e-05, "loss": 0.5453, "step": 1500 }, { "epoch": 1.2790883646541382, "grad_norm": 7.304553508758545, "learning_rate": 1.938010657193606e-05, "loss": 0.5108, "step": 1600 }, { "epoch": 1.3590563774490203, "grad_norm": 17.503097534179688, "learning_rate": 1.9202486678507993e-05, "loss": 0.4353, "step": 1700 }, { "epoch": 1.4390243902439024, "grad_norm": 8.452184677124023, "learning_rate": 1.902486678507993e-05, "loss": 0.4634, "step": 1800 }, { "epoch": 1.5189924030387845, "grad_norm": 49.753658294677734, "learning_rate": 1.884724689165187e-05, "loss": 0.4383, "step": 1900 }, { "epoch": 1.5989604158336665, "grad_norm": 3.9803502559661865, "learning_rate": 1.86696269982238e-05, "loss": 0.4214, "step": 2000 }, { "epoch": 1.5989604158336665, "eval_accuracy": 0.8780487804878049, "eval_auroc_macro": 0.9738165911813731, "eval_auroc_weighted": 0.973573288992315, "eval_f1_macro": 0.8793645166505886, "eval_f1_weighted": 0.8783420244558047, "eval_loss": 0.4454324245452881, "eval_precision_macro": 0.8818083342062639, "eval_precision_weighted": 0.8809044196758252, "eval_recall_macro": 0.8792211492934016, "eval_recall_weighted": 0.8780487804878049, "eval_runtime": 11.1254, "eval_samples_per_second": 224.801, "eval_steps_per_second": 28.134, "step": 2000 }, { "epoch": 1.6789284286285486, "grad_norm": 6.893618583679199, "learning_rate": 1.849200710479574e-05, "loss": 0.4203, "step": 2100 }, { "epoch": 1.7588964414234307, "grad_norm": 5.774092674255371, "learning_rate": 1.8314387211367673e-05, "loss": 0.3834, "step": 2200 }, { "epoch": 1.8388644542183128, "grad_norm": 25.236385345458984, "learning_rate": 1.813676731793961e-05, "loss": 0.3887, "step": 2300 }, { "epoch": 1.9188324670131949, "grad_norm": 19.330398559570312, "learning_rate": 1.795914742451155e-05, "loss": 0.3582, "step": 2400 }, { "epoch": 1.9988004798080767, "grad_norm": 36.057804107666016, "learning_rate": 1.778152753108348e-05, "loss": 0.3953, "step": 2500 }, { "epoch": 2.0783686525389844, "grad_norm": 15.274521827697754, "learning_rate": 1.760390763765542e-05, "loss": 0.3088, "step": 2600 }, { "epoch": 2.1583366653338665, "grad_norm": 1.7254096269607544, "learning_rate": 1.7426287744227356e-05, "loss": 0.264, "step": 2700 }, { "epoch": 2.2383046781287486, "grad_norm": 26.985990524291992, "learning_rate": 1.724866785079929e-05, "loss": 0.2689, "step": 2800 }, { "epoch": 2.3182726909236306, "grad_norm": 5.12957239151001, "learning_rate": 1.7071047957371228e-05, "loss": 0.2925, "step": 2900 }, { "epoch": 2.3982407037185127, "grad_norm": 4.839026927947998, "learning_rate": 1.6893428063943164e-05, "loss": 0.3011, "step": 3000 }, { "epoch": 2.3982407037185127, "eval_accuracy": 0.8788484606157537, "eval_auroc_macro": 0.9773569107548961, "eval_auroc_weighted": 0.9770285530114762, "eval_f1_macro": 0.8791828285515656, "eval_f1_weighted": 0.8779722862623245, "eval_loss": 0.4504168629646301, "eval_precision_macro": 0.879582196101898, "eval_precision_weighted": 0.8788972346636038, "eval_recall_macro": 0.8805120955311116, "eval_recall_weighted": 0.8788484606157537, "eval_runtime": 10.8688, "eval_samples_per_second": 230.108, "eval_steps_per_second": 28.798, "step": 3000 }, { "epoch": 2.478208716513395, "grad_norm": 10.992266654968262, "learning_rate": 1.67158081705151e-05, "loss": 0.2742, "step": 3100 }, { "epoch": 2.5581767293082764, "grad_norm": 4.304646968841553, "learning_rate": 1.6538188277087036e-05, "loss": 0.2733, "step": 3200 }, { "epoch": 2.638144742103159, "grad_norm": 60.62465286254883, "learning_rate": 1.636056838365897e-05, "loss": 0.3115, "step": 3300 }, { "epoch": 2.7181127548980406, "grad_norm": 1.9873929023742676, "learning_rate": 1.6182948490230908e-05, "loss": 0.3169, "step": 3400 }, { "epoch": 2.7980807676929227, "grad_norm": 8.354615211486816, "learning_rate": 1.6005328596802844e-05, "loss": 0.3139, "step": 3500 }, { "epoch": 2.8780487804878048, "grad_norm": 27.897375106811523, "learning_rate": 1.582770870337478e-05, "loss": 0.2708, "step": 3600 }, { "epoch": 2.958016793282687, "grad_norm": 57.23756790161133, "learning_rate": 1.5650088809946716e-05, "loss": 0.2551, "step": 3700 }, { "epoch": 3.0375849660135947, "grad_norm": 2.6712305545806885, "learning_rate": 1.5472468916518652e-05, "loss": 0.262, "step": 3800 }, { "epoch": 3.117552978808477, "grad_norm": 4.725401401519775, "learning_rate": 1.5294849023090588e-05, "loss": 0.1919, "step": 3900 }, { "epoch": 3.1975209916033585, "grad_norm": 28.024898529052734, "learning_rate": 1.5117229129662522e-05, "loss": 0.1611, "step": 4000 }, { "epoch": 3.1975209916033585, "eval_accuracy": 0.884046381447421, "eval_auroc_macro": 0.9757735583965023, "eval_auroc_weighted": 0.9753618417054956, "eval_f1_macro": 0.8845660655909923, "eval_f1_weighted": 0.8834468599472054, "eval_loss": 0.4886566996574402, "eval_precision_macro": 0.8844933323070212, "eval_precision_weighted": 0.8837534689063661, "eval_recall_macro": 0.8855092755592715, "eval_recall_weighted": 0.884046381447421, "eval_runtime": 11.0978, "eval_samples_per_second": 225.361, "eval_steps_per_second": 28.204, "step": 4000 }, { "epoch": 3.2774890043982405, "grad_norm": 0.42076241970062256, "learning_rate": 1.493960923623446e-05, "loss": 0.1631, "step": 4100 }, { "epoch": 3.3574570171931226, "grad_norm": 22.10235595703125, "learning_rate": 1.4761989342806396e-05, "loss": 0.1887, "step": 4200 }, { "epoch": 3.4374250299880047, "grad_norm": 20.63714027404785, "learning_rate": 1.458436944937833e-05, "loss": 0.2175, "step": 4300 }, { "epoch": 3.517393042782887, "grad_norm": 3.4005095958709717, "learning_rate": 1.4406749555950268e-05, "loss": 0.224, "step": 4400 }, { "epoch": 3.597361055577769, "grad_norm": 0.43836817145347595, "learning_rate": 1.4229129662522204e-05, "loss": 0.1809, "step": 4500 }, { "epoch": 3.677329068372651, "grad_norm": 37.63475799560547, "learning_rate": 1.4051509769094141e-05, "loss": 0.22, "step": 4600 }, { "epoch": 3.757297081167533, "grad_norm": 9.212823867797852, "learning_rate": 1.3873889875666075e-05, "loss": 0.1919, "step": 4700 }, { "epoch": 3.837265093962415, "grad_norm": 15.547619819641113, "learning_rate": 1.3696269982238011e-05, "loss": 0.1902, "step": 4800 }, { "epoch": 3.917233106757297, "grad_norm": 36.606658935546875, "learning_rate": 1.3518650088809947e-05, "loss": 0.2083, "step": 4900 }, { "epoch": 3.9972011195521793, "grad_norm": 27.680450439453125, "learning_rate": 1.3341030195381883e-05, "loss": 0.2711, "step": 5000 }, { "epoch": 3.9972011195521793, "eval_accuracy": 0.868452618952419, "eval_auroc_macro": 0.9740067888918509, "eval_auroc_weighted": 0.9734915246888479, "eval_f1_macro": 0.8672746760101144, "eval_f1_weighted": 0.8657240340371538, "eval_loss": 0.5831986665725708, "eval_precision_macro": 0.8713544170659105, "eval_precision_weighted": 0.8714247844372666, "eval_recall_macro": 0.8712665611651452, "eval_recall_weighted": 0.868452618952419, "eval_runtime": 10.6548, "eval_samples_per_second": 234.729, "eval_steps_per_second": 29.376, "step": 5000 }, { "epoch": 4.076769292283087, "grad_norm": 7.681755542755127, "learning_rate": 1.3163410301953821e-05, "loss": 0.1556, "step": 5100 }, { "epoch": 4.156737305077969, "grad_norm": 0.0798175036907196, "learning_rate": 1.2985790408525755e-05, "loss": 0.1634, "step": 5200 }, { "epoch": 4.23670531787285, "grad_norm": 16.147348403930664, "learning_rate": 1.2808170515097691e-05, "loss": 0.1468, "step": 5300 }, { "epoch": 4.316673330667733, "grad_norm": 56.157772064208984, "learning_rate": 1.2630550621669629e-05, "loss": 0.1396, "step": 5400 }, { "epoch": 4.396641343462615, "grad_norm": 71.01326751708984, "learning_rate": 1.2452930728241563e-05, "loss": 0.1403, "step": 5500 }, { "epoch": 4.476609356257497, "grad_norm": 72.29058837890625, "learning_rate": 1.22753108348135e-05, "loss": 0.1346, "step": 5600 }, { "epoch": 4.556577369052379, "grad_norm": 12.029815673828125, "learning_rate": 1.2097690941385437e-05, "loss": 0.1661, "step": 5700 }, { "epoch": 4.636545381847261, "grad_norm": 105.95983123779297, "learning_rate": 1.1920071047957371e-05, "loss": 0.16, "step": 5800 }, { "epoch": 4.716513394642143, "grad_norm": 47.3993034362793, "learning_rate": 1.1742451154529309e-05, "loss": 0.1765, "step": 5900 }, { "epoch": 4.7964814074370254, "grad_norm": 0.10814545303583145, "learning_rate": 1.1564831261101243e-05, "loss": 0.1354, "step": 6000 }, { "epoch": 4.7964814074370254, "eval_accuracy": 0.8848460615753698, "eval_auroc_macro": 0.9771739659875225, "eval_auroc_weighted": 0.9767904877872695, "eval_f1_macro": 0.885015833309326, "eval_f1_weighted": 0.8839241041685038, "eval_loss": 0.5577186346054077, "eval_precision_macro": 0.8853823194756998, "eval_precision_weighted": 0.8853725074070478, "eval_recall_macro": 0.8869834176751912, "eval_recall_weighted": 0.8848460615753698, "eval_runtime": 10.9779, "eval_samples_per_second": 227.821, "eval_steps_per_second": 28.512, "step": 6000 }, { "epoch": 4.876449420231907, "grad_norm": 45.430564880371094, "learning_rate": 1.138721136767318e-05, "loss": 0.1184, "step": 6100 }, { "epoch": 4.95641743302679, "grad_norm": 0.07600370794534683, "learning_rate": 1.1209591474245117e-05, "loss": 0.1323, "step": 6200 }, { "epoch": 5.035985605757697, "grad_norm": 0.07455410063266754, "learning_rate": 1.103197158081705e-05, "loss": 0.1142, "step": 6300 }, { "epoch": 5.115953618552579, "grad_norm": 7.246333122253418, "learning_rate": 1.0854351687388988e-05, "loss": 0.1095, "step": 6400 }, { "epoch": 5.195921631347461, "grad_norm": 0.050232477486133575, "learning_rate": 1.0676731793960924e-05, "loss": 0.097, "step": 6500 }, { "epoch": 5.275889644142343, "grad_norm": 2.7280073165893555, "learning_rate": 1.0499111900532862e-05, "loss": 0.0806, "step": 6600 }, { "epoch": 5.355857656937225, "grad_norm": 5.1381354331970215, "learning_rate": 1.0321492007104796e-05, "loss": 0.1225, "step": 6700 }, { "epoch": 5.4358256697321075, "grad_norm": 73.33670806884766, "learning_rate": 1.0143872113676732e-05, "loss": 0.1127, "step": 6800 }, { "epoch": 5.515793682526989, "grad_norm": 0.04268639162182808, "learning_rate": 9.966252220248668e-06, "loss": 0.0951, "step": 6900 }, { "epoch": 5.595761695321872, "grad_norm": 14.716099739074707, "learning_rate": 9.788632326820606e-06, "loss": 0.134, "step": 7000 }, { "epoch": 5.595761695321872, "eval_accuracy": 0.8796481407437026, "eval_auroc_macro": 0.9736991302553468, "eval_auroc_weighted": 0.9733130910363977, "eval_f1_macro": 0.8809953099105533, "eval_f1_weighted": 0.8797942315789191, "eval_loss": 0.6088235974311829, "eval_precision_macro": 0.8815953725252788, "eval_precision_weighted": 0.8805306902636757, "eval_recall_macro": 0.8809931182513335, "eval_recall_weighted": 0.8796481407437026, "eval_runtime": 10.9456, "eval_samples_per_second": 228.493, "eval_steps_per_second": 28.596, "step": 7000 }, { "epoch": 5.675729708116753, "grad_norm": 0.0554790124297142, "learning_rate": 9.61101243339254e-06, "loss": 0.0785, "step": 7100 }, { "epoch": 5.755697720911636, "grad_norm": 0.03109428659081459, "learning_rate": 9.433392539964476e-06, "loss": 0.111, "step": 7200 }, { "epoch": 5.835665733706517, "grad_norm": 4.9373459815979, "learning_rate": 9.255772646536412e-06, "loss": 0.0948, "step": 7300 }, { "epoch": 5.915633746501399, "grad_norm": 72.38359832763672, "learning_rate": 9.07815275310835e-06, "loss": 0.1146, "step": 7400 }, { "epoch": 5.995601759296282, "grad_norm": 3.889324188232422, "learning_rate": 8.900532859680286e-06, "loss": 0.0973, "step": 7500 }, { "epoch": 6.0751699320271895, "grad_norm": 0.04162607342004776, "learning_rate": 8.72291296625222e-06, "loss": 0.0644, "step": 7600 }, { "epoch": 6.155137944822071, "grad_norm": 0.038938213139772415, "learning_rate": 8.545293072824158e-06, "loss": 0.0499, "step": 7700 }, { "epoch": 6.235105957616954, "grad_norm": 0.22254200279712677, "learning_rate": 8.367673179396094e-06, "loss": 0.0596, "step": 7800 }, { "epoch": 6.315073970411835, "grad_norm": 0.10705538839101791, "learning_rate": 8.19005328596803e-06, "loss": 0.0569, "step": 7900 }, { "epoch": 6.395041983206717, "grad_norm": 0.022395452484488487, "learning_rate": 8.012433392539965e-06, "loss": 0.0877, "step": 8000 }, { "epoch": 6.395041983206717, "eval_accuracy": 0.8740503798480608, "eval_auroc_macro": 0.974347054440335, "eval_auroc_weighted": 0.9739933549338261, "eval_f1_macro": 0.8735827403639422, "eval_f1_weighted": 0.8723502643051826, "eval_loss": 0.7089990377426147, "eval_precision_macro": 0.8751255771125654, "eval_precision_weighted": 0.8753003975964507, "eval_recall_macro": 0.8765722187069322, "eval_recall_weighted": 0.8740503798480608, "eval_runtime": 5.2646, "eval_samples_per_second": 475.056, "eval_steps_per_second": 59.453, "step": 8000 }, { "epoch": 6.475009996001599, "grad_norm": 0.02474510669708252, "learning_rate": 7.834813499111901e-06, "loss": 0.0933, "step": 8100 }, { "epoch": 6.554978008796481, "grad_norm": 0.051300596445798874, "learning_rate": 7.657193605683837e-06, "loss": 0.0686, "step": 8200 }, { "epoch": 6.634946021591364, "grad_norm": 0.041189149022102356, "learning_rate": 7.479573712255773e-06, "loss": 0.0829, "step": 8300 }, { "epoch": 6.714914034386245, "grad_norm": 5.698017120361328, "learning_rate": 7.301953818827709e-06, "loss": 0.0625, "step": 8400 }, { "epoch": 6.794882047181128, "grad_norm": 0.09351879358291626, "learning_rate": 7.124333925399646e-06, "loss": 0.0704, "step": 8500 }, { "epoch": 6.874850059976009, "grad_norm": 0.3524141311645508, "learning_rate": 6.946714031971581e-06, "loss": 0.0769, "step": 8600 }, { "epoch": 6.954818072770892, "grad_norm": 0.03331638127565384, "learning_rate": 6.769094138543517e-06, "loss": 0.0717, "step": 8700 }, { "epoch": 7.034386245501799, "grad_norm": 0.6107684969902039, "learning_rate": 6.591474245115453e-06, "loss": 0.049, "step": 8800 }, { "epoch": 7.114354258296681, "grad_norm": 0.027097152546048164, "learning_rate": 6.41385435168739e-06, "loss": 0.0437, "step": 8900 }, { "epoch": 7.194322271091563, "grad_norm": 0.019937481731176376, "learning_rate": 6.236234458259326e-06, "loss": 0.0741, "step": 9000 }, { "epoch": 7.194322271091563, "eval_accuracy": 0.8780487804878049, "eval_auroc_macro": 0.9715743344544261, "eval_auroc_weighted": 0.9710196639814077, "eval_f1_macro": 0.8781859377674458, "eval_f1_weighted": 0.8769698095840991, "eval_loss": 0.7172689437866211, "eval_precision_macro": 0.8782446963481615, "eval_precision_weighted": 0.8779260460077373, "eval_recall_macro": 0.8800909624847286, "eval_recall_weighted": 0.8780487804878049, "eval_runtime": 5.2461, "eval_samples_per_second": 476.737, "eval_steps_per_second": 59.664, "step": 9000 }, { "epoch": 7.274290283886446, "grad_norm": 0.1962634027004242, "learning_rate": 6.058614564831261e-06, "loss": 0.0461, "step": 9100 }, { "epoch": 7.354258296681327, "grad_norm": 0.3250579237937927, "learning_rate": 5.880994671403197e-06, "loss": 0.0465, "step": 9200 }, { "epoch": 7.43422630947621, "grad_norm": 0.034404072910547256, "learning_rate": 5.703374777975134e-06, "loss": 0.0429, "step": 9300 }, { "epoch": 7.514194322271091, "grad_norm": 0.021159108728170395, "learning_rate": 5.52575488454707e-06, "loss": 0.0352, "step": 9400 }, { "epoch": 7.594162335065974, "grad_norm": 0.08214077353477478, "learning_rate": 5.3481349911190065e-06, "loss": 0.0597, "step": 9500 }, { "epoch": 7.674130347860856, "grad_norm": 0.026783457025885582, "learning_rate": 5.170515097690942e-06, "loss": 0.0488, "step": 9600 }, { "epoch": 7.754098360655737, "grad_norm": 30.816205978393555, "learning_rate": 4.992895204262878e-06, "loss": 0.0636, "step": 9700 }, { "epoch": 7.83406637345062, "grad_norm": 0.01820790022611618, "learning_rate": 4.8152753108348135e-06, "loss": 0.0432, "step": 9800 }, { "epoch": 7.914034386245502, "grad_norm": 0.13603974878787994, "learning_rate": 4.63765541740675e-06, "loss": 0.0376, "step": 9900 }, { "epoch": 7.994002399040384, "grad_norm": 0.05620984360575676, "learning_rate": 4.4600355239786855e-06, "loss": 0.0532, "step": 10000 }, { "epoch": 7.994002399040384, "eval_accuracy": 0.8808476609356257, "eval_auroc_macro": 0.9712888548840507, "eval_auroc_weighted": 0.9708107694628548, "eval_f1_macro": 0.8808544746623334, "eval_f1_weighted": 0.8795725129000943, "eval_loss": 0.7412012815475464, "eval_precision_macro": 0.8813573909705014, "eval_precision_weighted": 0.8808757699391696, "eval_recall_macro": 0.882832478485879, "eval_recall_weighted": 0.8808476609356257, "eval_runtime": 5.0716, "eval_samples_per_second": 493.136, "eval_steps_per_second": 61.716, "step": 10000 }, { "epoch": 8.073570571771292, "grad_norm": 0.29488369822502136, "learning_rate": 4.282415630550622e-06, "loss": 0.0316, "step": 10100 }, { "epoch": 8.153538584566174, "grad_norm": 0.01641344465315342, "learning_rate": 4.104795737122558e-06, "loss": 0.0302, "step": 10200 }, { "epoch": 8.233506597361055, "grad_norm": 0.016257140785455704, "learning_rate": 3.927175843694494e-06, "loss": 0.0377, "step": 10300 }, { "epoch": 8.313474610155938, "grad_norm": 0.016158757731318474, "learning_rate": 3.74955595026643e-06, "loss": 0.0158, "step": 10400 }, { "epoch": 8.39344262295082, "grad_norm": 63.62160873413086, "learning_rate": 3.571936056838366e-06, "loss": 0.032, "step": 10500 }, { "epoch": 8.4734106357457, "grad_norm": 0.01895180717110634, "learning_rate": 3.394316163410302e-06, "loss": 0.031, "step": 10600 }, { "epoch": 8.553378648540583, "grad_norm": 0.013899303041398525, "learning_rate": 3.2166962699822384e-06, "loss": 0.0338, "step": 10700 }, { "epoch": 8.633346661335466, "grad_norm": 0.01123654842376709, "learning_rate": 3.0390763765541744e-06, "loss": 0.0288, "step": 10800 }, { "epoch": 8.713314674130348, "grad_norm": 113.46405792236328, "learning_rate": 2.8614564831261103e-06, "loss": 0.035, "step": 10900 }, { "epoch": 8.79328268692523, "grad_norm": 0.3093399703502655, "learning_rate": 2.6838365896980463e-06, "loss": 0.0133, "step": 11000 }, { "epoch": 8.79328268692523, "eval_accuracy": 0.8852459016393442, "eval_auroc_macro": 0.9700113689142762, "eval_auroc_weighted": 0.9694695236422716, "eval_f1_macro": 0.8852194619626491, "eval_f1_weighted": 0.8840464836518896, "eval_loss": 0.7584248185157776, "eval_precision_macro": 0.8853058007130382, "eval_precision_weighted": 0.8849852171837517, "eval_recall_macro": 0.8871884880754444, "eval_recall_weighted": 0.8852459016393442, "eval_runtime": 2.9336, "eval_samples_per_second": 852.549, "eval_steps_per_second": 106.696, "step": 11000 }, { "epoch": 8.873250699720112, "grad_norm": 1.7755924463272095, "learning_rate": 2.5062166962699823e-06, "loss": 0.041, "step": 11100 }, { "epoch": 8.953218712514994, "grad_norm": 0.01337814424186945, "learning_rate": 2.3285968028419182e-06, "loss": 0.0393, "step": 11200 }, { "epoch": 9.032786885245901, "grad_norm": 0.07428575307130814, "learning_rate": 2.1509769094138546e-06, "loss": 0.0284, "step": 11300 }, { "epoch": 9.112754898040784, "grad_norm": 0.02315426617860794, "learning_rate": 1.9733570159857906e-06, "loss": 0.0143, "step": 11400 }, { "epoch": 9.192722910835666, "grad_norm": 0.0839715525507927, "learning_rate": 1.7957371225577267e-06, "loss": 0.0245, "step": 11500 }, { "epoch": 9.272690923630547, "grad_norm": 0.13397835195064545, "learning_rate": 1.6181172291296627e-06, "loss": 0.0356, "step": 11600 }, { "epoch": 9.35265893642543, "grad_norm": 0.06111783906817436, "learning_rate": 1.4404973357015986e-06, "loss": 0.0241, "step": 11700 }, { "epoch": 9.432626949220312, "grad_norm": 0.7590734362602234, "learning_rate": 1.2628774422735348e-06, "loss": 0.0208, "step": 11800 }, { "epoch": 9.512594962015195, "grad_norm": 0.01169233862310648, "learning_rate": 1.0852575488454708e-06, "loss": 0.0475, "step": 11900 }, { "epoch": 9.592562974810075, "grad_norm": 0.015741437673568726, "learning_rate": 9.076376554174068e-07, "loss": 0.0357, "step": 12000 }, { "epoch": 9.592562974810075, "eval_accuracy": 0.8860455817672931, "eval_auroc_macro": 0.9713983635818311, "eval_auroc_weighted": 0.9709143753060755, "eval_f1_macro": 0.8862374765222798, "eval_f1_weighted": 0.8851364411848566, "eval_loss": 0.7631213068962097, "eval_precision_macro": 0.8860695429970787, "eval_precision_weighted": 0.8856898975950318, "eval_recall_macro": 0.8878156849040522, "eval_recall_weighted": 0.8860455817672931, "eval_runtime": 2.9757, "eval_samples_per_second": 840.488, "eval_steps_per_second": 105.187, "step": 12000 }, { "epoch": 9.672530987604958, "grad_norm": 0.07069654017686844, "learning_rate": 7.300177619893428e-07, "loss": 0.0268, "step": 12100 }, { "epoch": 9.75249900039984, "grad_norm": 0.06307296454906464, "learning_rate": 5.523978685612789e-07, "loss": 0.0137, "step": 12200 }, { "epoch": 9.832467013194723, "grad_norm": 0.10373717546463013, "learning_rate": 3.747779751332149e-07, "loss": 0.0392, "step": 12300 }, { "epoch": 9.912435025989604, "grad_norm": 0.06551024317741394, "learning_rate": 1.9715808170515098e-07, "loss": 0.0207, "step": 12400 }, { "epoch": 9.992403038784486, "grad_norm": 0.2663117051124573, "learning_rate": 1.9538188277087032e-08, "loss": 0.0306, "step": 12500 } ], "logging_steps": 100, "max_steps": 12510, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 1000, "stateful_callbacks": { "EarlyStoppingCallback": { "args": { "early_stopping_patience": 15, "early_stopping_threshold": 0.0 }, "attributes": { "early_stopping_patience_counter": 0 } }, "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 3366600744047856.0, "train_batch_size": 8, "trial_name": null, "trial_params": null }