{ "best_global_step": 25500, "best_metric": 0.450262927544688, "best_model_checkpoint": "/results/bert-base-spanish-wwm-cased/LR_1e-05_E_8_BS_4/checkpoint-25500", "epoch": 6.248468512619456, "eval_steps": 500, "global_step": 25500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.12251899044351874, "eval_accuracy": 0.045588235294117645, "eval_f1_macro": 0.01306886519451452, "eval_loss": 4.428101062774658, "eval_precision_macro": 0.014429422836219046, "eval_recall_macro": 0.03337166980398182, "eval_runtime": 28.9155, "eval_samples_per_second": 70.55, "eval_steps_per_second": 8.819, "step": 500 }, { "epoch": 0.2450379808870375, "grad_norm": 11.240307807922363, "learning_rate": 9.694008821367313e-06, "loss": 4.4001, "step": 1000 }, { "epoch": 0.2450379808870375, "eval_accuracy": 0.06274509803921569, "eval_f1_macro": 0.022566891830631288, "eval_loss": 4.284124374389648, "eval_precision_macro": 0.023353351335236566, "eval_recall_macro": 0.05069920248096901, "eval_runtime": 28.7949, "eval_samples_per_second": 70.846, "eval_steps_per_second": 8.856, "step": 1000 }, { "epoch": 0.36755697133055626, "eval_accuracy": 0.08333333333333333, "eval_f1_macro": 0.035510363131552765, "eval_loss": 4.161181449890137, "eval_precision_macro": 0.053844153665449625, "eval_recall_macro": 0.06445737839338715, "eval_runtime": 29.0382, "eval_samples_per_second": 70.252, "eval_steps_per_second": 8.782, "step": 1500 }, { "epoch": 0.490075961774075, "grad_norm": 15.960897445678711, "learning_rate": 9.387711345258515e-06, "loss": 4.1746, "step": 2000 }, { "epoch": 0.490075961774075, "eval_accuracy": 0.10784313725490197, "eval_f1_macro": 0.04915441628160089, "eval_loss": 4.015964984893799, "eval_precision_macro": 0.06875645445881123, "eval_recall_macro": 0.07925934506451808, "eval_runtime": 29.0179, "eval_samples_per_second": 70.301, "eval_steps_per_second": 8.788, "step": 2000 }, { "epoch": 0.6125949522175937, "eval_accuracy": 0.16519607843137254, "eval_f1_macro": 0.07987301718499762, "eval_loss": 3.787720203399658, "eval_precision_macro": 0.13889534971495046, "eval_recall_macro": 0.12043319793836148, "eval_runtime": 29.1111, "eval_samples_per_second": 70.076, "eval_steps_per_second": 8.76, "step": 2500 }, { "epoch": 0.7351139426611125, "grad_norm": 15.03334903717041, "learning_rate": 9.08141386914972e-06, "loss": 3.81, "step": 3000 }, { "epoch": 0.7351139426611125, "eval_accuracy": 0.21176470588235294, "eval_f1_macro": 0.12994262108705937, "eval_loss": 3.590181827545166, "eval_precision_macro": 0.17841215908379965, "eval_recall_macro": 0.17615939544039477, "eval_runtime": 29.0586, "eval_samples_per_second": 70.203, "eval_steps_per_second": 8.775, "step": 3000 }, { "epoch": 0.8576329331046312, "eval_accuracy": 0.27450980392156865, "eval_f1_macro": 0.17829061168481852, "eval_loss": 3.4180164337158203, "eval_precision_macro": 0.24611886260263896, "eval_recall_macro": 0.21322328824757553, "eval_runtime": 29.1078, "eval_samples_per_second": 70.084, "eval_steps_per_second": 8.761, "step": 3500 }, { "epoch": 0.98015192354815, "grad_norm": 20.16187858581543, "learning_rate": 8.775116393040922e-06, "loss": 3.4504, "step": 4000 }, { "epoch": 0.98015192354815, "eval_accuracy": 0.3014705882352941, "eval_f1_macro": 0.21258206552870162, "eval_loss": 3.251574993133545, "eval_precision_macro": 0.2859814835461467, "eval_recall_macro": 0.24545922585073798, "eval_runtime": 29.0843, "eval_samples_per_second": 70.141, "eval_steps_per_second": 8.768, "step": 4000 }, { "epoch": 1.1026709139916686, "eval_accuracy": 0.31176470588235294, "eval_f1_macro": 0.21899432488275963, "eval_loss": 3.142249584197998, "eval_precision_macro": 0.2507771079260614, "eval_recall_macro": 0.25978102757160393, "eval_runtime": 29.0427, "eval_samples_per_second": 70.242, "eval_steps_per_second": 8.78, "step": 4500 }, { "epoch": 1.2251899044351875, "grad_norm": 23.114660263061523, "learning_rate": 8.468818916932126e-06, "loss": 3.1083, "step": 5000 }, { "epoch": 1.2251899044351875, "eval_accuracy": 0.3264705882352941, "eval_f1_macro": 0.24619035797913624, "eval_loss": 3.0345137119293213, "eval_precision_macro": 0.28975508986079757, "eval_recall_macro": 0.27505180159662773, "eval_runtime": 28.9786, "eval_samples_per_second": 70.397, "eval_steps_per_second": 8.8, "step": 5000 }, { "epoch": 1.3477088948787062, "eval_accuracy": 0.3568627450980392, "eval_f1_macro": 0.28067884144327176, "eval_loss": 2.945455551147461, "eval_precision_macro": 0.31407618841721907, "eval_recall_macro": 0.31023827174307916, "eval_runtime": 28.9923, "eval_samples_per_second": 70.363, "eval_steps_per_second": 8.795, "step": 5500 }, { "epoch": 1.4702278853222248, "grad_norm": 22.831905364990234, "learning_rate": 8.162521440823328e-06, "loss": 2.8855, "step": 6000 }, { "epoch": 1.4702278853222248, "eval_accuracy": 0.36519607843137253, "eval_f1_macro": 0.29503641204547365, "eval_loss": 2.842531204223633, "eval_precision_macro": 0.34290840050484983, "eval_recall_macro": 0.32216664741819667, "eval_runtime": 29.0469, "eval_samples_per_second": 70.231, "eval_steps_per_second": 8.779, "step": 6000 }, { "epoch": 1.5927468757657437, "eval_accuracy": 0.37941176470588234, "eval_f1_macro": 0.3184854598614125, "eval_loss": 2.7759594917297363, "eval_precision_macro": 0.3891038214856321, "eval_recall_macro": 0.33724858451604794, "eval_runtime": 29.1095, "eval_samples_per_second": 70.08, "eval_steps_per_second": 8.76, "step": 6500 }, { "epoch": 1.7152658662092626, "grad_norm": 23.412046432495117, "learning_rate": 7.85622396471453e-06, "loss": 2.7373, "step": 7000 }, { "epoch": 1.7152658662092626, "eval_accuracy": 0.37598039215686274, "eval_f1_macro": 0.3123619827862161, "eval_loss": 2.7370920181274414, "eval_precision_macro": 0.3389189313296257, "eval_recall_macro": 0.3364221245176174, "eval_runtime": 29.1278, "eval_samples_per_second": 70.036, "eval_steps_per_second": 8.755, "step": 7000 }, { "epoch": 1.8377848566527812, "eval_accuracy": 0.38529411764705884, "eval_f1_macro": 0.32685781242393885, "eval_loss": 2.6543169021606445, "eval_precision_macro": 0.3794044222841129, "eval_recall_macro": 0.3581486899723563, "eval_runtime": 29.123, "eval_samples_per_second": 70.048, "eval_steps_per_second": 8.756, "step": 7500 }, { "epoch": 1.9603038470963, "grad_norm": 13.25064754486084, "learning_rate": 7.549926488605734e-06, "loss": 2.5967, "step": 8000 }, { "epoch": 1.9603038470963, "eval_accuracy": 0.39705882352941174, "eval_f1_macro": 0.3416367025266391, "eval_loss": 2.6037559509277344, "eval_precision_macro": 0.3875862358063217, "eval_recall_macro": 0.3711247487243121, "eval_runtime": 29.0906, "eval_samples_per_second": 70.126, "eval_steps_per_second": 8.766, "step": 8000 }, { "epoch": 2.0828228375398186, "eval_accuracy": 0.40588235294117647, "eval_f1_macro": 0.34177780306634054, "eval_loss": 2.5586369037628174, "eval_precision_macro": 0.37785214424417857, "eval_recall_macro": 0.37123852015418934, "eval_runtime": 29.1167, "eval_samples_per_second": 70.063, "eval_steps_per_second": 8.758, "step": 8500 }, { "epoch": 2.205341827983337, "grad_norm": 36.344505310058594, "learning_rate": 7.2436290124969375e-06, "loss": 2.2877, "step": 9000 }, { "epoch": 2.205341827983337, "eval_accuracy": 0.3941176470588235, "eval_f1_macro": 0.3329373015030159, "eval_loss": 2.5376462936401367, "eval_precision_macro": 0.36727782127929887, "eval_recall_macro": 0.35714324134631126, "eval_runtime": 29.1162, "eval_samples_per_second": 70.064, "eval_steps_per_second": 8.758, "step": 9000 }, { "epoch": 2.3278608184268563, "eval_accuracy": 0.4088235294117647, "eval_f1_macro": 0.3589999095822752, "eval_loss": 2.5077292919158936, "eval_precision_macro": 0.3816246211523356, "eval_recall_macro": 0.3785276351507907, "eval_runtime": 29.0498, "eval_samples_per_second": 70.224, "eval_steps_per_second": 8.778, "step": 9500 }, { "epoch": 2.450379808870375, "grad_norm": 48.41518783569336, "learning_rate": 6.937331536388141e-06, "loss": 2.136, "step": 10000 }, { "epoch": 2.450379808870375, "eval_accuracy": 0.4117647058823529, "eval_f1_macro": 0.3657351686682792, "eval_loss": 2.4824399948120117, "eval_precision_macro": 0.4231750089513437, "eval_recall_macro": 0.3830197545592446, "eval_runtime": 29.0116, "eval_samples_per_second": 70.317, "eval_steps_per_second": 8.79, "step": 10000 }, { "epoch": 2.5728987993138936, "eval_accuracy": 0.4196078431372549, "eval_f1_macro": 0.371782683847044, "eval_loss": 2.4366378784179688, "eval_precision_macro": 0.40052896394929344, "eval_recall_macro": 0.3971562794600927, "eval_runtime": 29.0098, "eval_samples_per_second": 70.321, "eval_steps_per_second": 8.79, "step": 10500 }, { "epoch": 2.6954177897574123, "grad_norm": 32.126468658447266, "learning_rate": 6.631034060279345e-06, "loss": 2.051, "step": 11000 }, { "epoch": 2.6954177897574123, "eval_accuracy": 0.42745098039215684, "eval_f1_macro": 0.3856964289538409, "eval_loss": 2.410841703414917, "eval_precision_macro": 0.4101091225398707, "eval_recall_macro": 0.40255800980694373, "eval_runtime": 29.1106, "eval_samples_per_second": 70.078, "eval_steps_per_second": 8.76, "step": 11000 }, { "epoch": 2.817936780200931, "eval_accuracy": 0.42892156862745096, "eval_f1_macro": 0.384952826032894, "eval_loss": 2.3878557682037354, "eval_precision_macro": 0.42850269125272694, "eval_recall_macro": 0.4018898685238271, "eval_runtime": 29.0617, "eval_samples_per_second": 70.196, "eval_steps_per_second": 8.774, "step": 11500 }, { "epoch": 2.9404557706444496, "grad_norm": 19.8395938873291, "learning_rate": 6.324736584170546e-06, "loss": 1.9909, "step": 12000 }, { "epoch": 2.9404557706444496, "eval_accuracy": 0.43529411764705883, "eval_f1_macro": 0.3897129403513703, "eval_loss": 2.3484647274017334, "eval_precision_macro": 0.41476544204467075, "eval_recall_macro": 0.41058984161765777, "eval_runtime": 29.0621, "eval_samples_per_second": 70.194, "eval_steps_per_second": 8.774, "step": 12000 }, { "epoch": 3.0629747610879687, "eval_accuracy": 0.4323529411764706, "eval_f1_macro": 0.38999617888289256, "eval_loss": 2.3602137565612793, "eval_precision_macro": 0.4264286069225271, "eval_recall_macro": 0.4075553863336427, "eval_runtime": 29.0817, "eval_samples_per_second": 70.147, "eval_steps_per_second": 8.768, "step": 12500 }, { "epoch": 3.1854937515314874, "grad_norm": 27.923873901367188, "learning_rate": 6.01843910806175e-06, "loss": 1.7282, "step": 13000 }, { "epoch": 3.1854937515314874, "eval_accuracy": 0.42696078431372547, "eval_f1_macro": 0.38162966948900895, "eval_loss": 2.359041452407837, "eval_precision_macro": 0.4166455055888518, "eval_recall_macro": 0.3973804144066564, "eval_runtime": 28.9947, "eval_samples_per_second": 70.358, "eval_steps_per_second": 8.795, "step": 13000 }, { "epoch": 3.308012741975006, "eval_accuracy": 0.4455882352941177, "eval_f1_macro": 0.40565975190401343, "eval_loss": 2.3188326358795166, "eval_precision_macro": 0.43293933225570724, "eval_recall_macro": 0.4167306793780272, "eval_runtime": 29.0614, "eval_samples_per_second": 70.196, "eval_steps_per_second": 8.775, "step": 13500 }, { "epoch": 3.4305317324185247, "grad_norm": 35.284400939941406, "learning_rate": 5.712141631952953e-06, "loss": 1.6189, "step": 14000 }, { "epoch": 3.4305317324185247, "eval_accuracy": 0.4465686274509804, "eval_f1_macro": 0.4079543261512267, "eval_loss": 2.3170266151428223, "eval_precision_macro": 0.4431624594065138, "eval_recall_macro": 0.41430364342829584, "eval_runtime": 29.0781, "eval_samples_per_second": 70.156, "eval_steps_per_second": 8.769, "step": 14000 }, { "epoch": 3.553050722862044, "eval_accuracy": 0.45588235294117646, "eval_f1_macro": 0.4179070025215764, "eval_loss": 2.2999155521392822, "eval_precision_macro": 0.44615015216292947, "eval_recall_macro": 0.42739503933025014, "eval_runtime": 29.1482, "eval_samples_per_second": 69.987, "eval_steps_per_second": 8.748, "step": 14500 }, { "epoch": 3.6755697133055625, "grad_norm": 16.248411178588867, "learning_rate": 5.405844155844157e-06, "loss": 1.5814, "step": 15000 }, { "epoch": 3.6755697133055625, "eval_accuracy": 0.453921568627451, "eval_f1_macro": 0.41123847042433936, "eval_loss": 2.3039774894714355, "eval_precision_macro": 0.4472728193469412, "eval_recall_macro": 0.41750638987980865, "eval_runtime": 29.1061, "eval_samples_per_second": 70.088, "eval_steps_per_second": 8.761, "step": 15000 }, { "epoch": 3.798088703749081, "eval_accuracy": 0.4612745098039216, "eval_f1_macro": 0.41950160771132944, "eval_loss": 2.293405532836914, "eval_precision_macro": 0.4463805703114915, "eval_recall_macro": 0.4245314708924026, "eval_runtime": 28.9902, "eval_samples_per_second": 70.369, "eval_steps_per_second": 8.796, "step": 15500 }, { "epoch": 3.9206076941926, "grad_norm": 52.409446716308594, "learning_rate": 5.09954667973536e-06, "loss": 1.5166, "step": 16000 }, { "epoch": 3.9206076941926, "eval_accuracy": 0.4573529411764706, "eval_f1_macro": 0.42014589112851725, "eval_loss": 2.2832016944885254, "eval_precision_macro": 0.43745108731300303, "eval_recall_macro": 0.4323856661621557, "eval_runtime": 29.1441, "eval_samples_per_second": 69.997, "eval_steps_per_second": 8.75, "step": 16000 }, { "epoch": 4.0431266846361185, "eval_accuracy": 0.45588235294117646, "eval_f1_macro": 0.4230638604944445, "eval_loss": 2.290628671646118, "eval_precision_macro": 0.45239282061220365, "eval_recall_macro": 0.4286428783592783, "eval_runtime": 29.0514, "eval_samples_per_second": 70.22, "eval_steps_per_second": 8.778, "step": 16500 }, { "epoch": 4.165645675079637, "grad_norm": 55.6788330078125, "learning_rate": 4.793249203626563e-06, "loss": 1.2834, "step": 17000 }, { "epoch": 4.165645675079637, "eval_accuracy": 0.45637254901960783, "eval_f1_macro": 0.41456070933090583, "eval_loss": 2.308366298675537, "eval_precision_macro": 0.43813614937663775, "eval_recall_macro": 0.4257014582599933, "eval_runtime": 29.0009, "eval_samples_per_second": 70.343, "eval_steps_per_second": 8.793, "step": 17000 }, { "epoch": 4.288164665523156, "eval_accuracy": 0.4573529411764706, "eval_f1_macro": 0.41793447869082173, "eval_loss": 2.293177366256714, "eval_precision_macro": 0.4329296900073293, "eval_recall_macro": 0.42608774895517754, "eval_runtime": 29.0662, "eval_samples_per_second": 70.185, "eval_steps_per_second": 8.773, "step": 17500 }, { "epoch": 4.410683655966674, "grad_norm": 19.722681045532227, "learning_rate": 4.486951727517765e-06, "loss": 1.2109, "step": 18000 }, { "epoch": 4.410683655966674, "eval_accuracy": 0.4519607843137255, "eval_f1_macro": 0.41240482141943163, "eval_loss": 2.3044347763061523, "eval_precision_macro": 0.43183268656889506, "eval_recall_macro": 0.4206771140546417, "eval_runtime": 29.0925, "eval_samples_per_second": 70.121, "eval_steps_per_second": 8.765, "step": 18000 }, { "epoch": 4.533202646410194, "eval_accuracy": 0.4583333333333333, "eval_f1_macro": 0.41788236299315934, "eval_loss": 2.3148584365844727, "eval_precision_macro": 0.44364154268687234, "eval_recall_macro": 0.42792744963117146, "eval_runtime": 29.1094, "eval_samples_per_second": 70.08, "eval_steps_per_second": 8.76, "step": 18500 }, { "epoch": 4.655721636853713, "grad_norm": 88.38114929199219, "learning_rate": 4.1806542514089685e-06, "loss": 1.1985, "step": 19000 }, { "epoch": 4.655721636853713, "eval_accuracy": 0.45588235294117646, "eval_f1_macro": 0.4131192612245579, "eval_loss": 2.3118155002593994, "eval_precision_macro": 0.4265642919630791, "eval_recall_macro": 0.4267646071714731, "eval_runtime": 29.0852, "eval_samples_per_second": 70.139, "eval_steps_per_second": 8.767, "step": 19000 }, { "epoch": 4.778240627297231, "eval_accuracy": 0.4696078431372549, "eval_f1_macro": 0.43230688806746487, "eval_loss": 2.2900590896606445, "eval_precision_macro": 0.44412022895196174, "eval_recall_macro": 0.4374181835060155, "eval_runtime": 29.0704, "eval_samples_per_second": 70.174, "eval_steps_per_second": 8.772, "step": 19500 }, { "epoch": 4.90075961774075, "grad_norm": 78.37841796875, "learning_rate": 3.874356775300172e-06, "loss": 1.1608, "step": 20000 }, { "epoch": 4.90075961774075, "eval_accuracy": 0.4681372549019608, "eval_f1_macro": 0.4413383226058443, "eval_loss": 2.2932121753692627, "eval_precision_macro": 0.4617364695922631, "eval_recall_macro": 0.4406843736368774, "eval_runtime": 29.1155, "eval_samples_per_second": 70.066, "eval_steps_per_second": 8.758, "step": 20000 }, { "epoch": 5.023278608184269, "eval_accuracy": 0.475, "eval_f1_macro": 0.43813725080604216, "eval_loss": 2.290257215499878, "eval_precision_macro": 0.45262479845690323, "eval_recall_macro": 0.4415708796261671, "eval_runtime": 29.1303, "eval_samples_per_second": 70.03, "eval_steps_per_second": 8.754, "step": 20500 }, { "epoch": 5.145797598627787, "grad_norm": 10.83778190612793, "learning_rate": 3.568059299191375e-06, "loss": 1.0083, "step": 21000 }, { "epoch": 5.145797598627787, "eval_accuracy": 0.4681372549019608, "eval_f1_macro": 0.43829003708840103, "eval_loss": 2.312354803085327, "eval_precision_macro": 0.4666057917038543, "eval_recall_macro": 0.43383845264115456, "eval_runtime": 29.0772, "eval_samples_per_second": 70.158, "eval_steps_per_second": 8.77, "step": 21000 }, { "epoch": 5.268316589071306, "eval_accuracy": 0.4681372549019608, "eval_f1_macro": 0.43241216031208274, "eval_loss": 2.3248424530029297, "eval_precision_macro": 0.4491286407098105, "eval_recall_macro": 0.4355901107138846, "eval_runtime": 29.0944, "eval_samples_per_second": 70.117, "eval_steps_per_second": 8.765, "step": 21500 }, { "epoch": 5.390835579514825, "grad_norm": 42.13823699951172, "learning_rate": 3.261761823082578e-06, "loss": 0.9278, "step": 22000 }, { "epoch": 5.390835579514825, "eval_accuracy": 0.47401960784313724, "eval_f1_macro": 0.43814753866309025, "eval_loss": 2.330505132675171, "eval_precision_macro": 0.45473247643144465, "eval_recall_macro": 0.4384025935181326, "eval_runtime": 29.1716, "eval_samples_per_second": 69.931, "eval_steps_per_second": 8.741, "step": 22000 }, { "epoch": 5.513354569958343, "eval_accuracy": 0.46715686274509804, "eval_f1_macro": 0.43257866102694503, "eval_loss": 2.347115993499756, "eval_precision_macro": 0.4504726705618405, "eval_recall_macro": 0.4348319212180254, "eval_runtime": 29.1269, "eval_samples_per_second": 70.038, "eval_steps_per_second": 8.755, "step": 22500 }, { "epoch": 5.635873560401862, "grad_norm": 38.9526252746582, "learning_rate": 2.955464346973781e-06, "loss": 0.9329, "step": 23000 }, { "epoch": 5.635873560401862, "eval_accuracy": 0.47794117647058826, "eval_f1_macro": 0.44208070378557873, "eval_loss": 2.3172309398651123, "eval_precision_macro": 0.4545102004320516, "eval_recall_macro": 0.4438161984853697, "eval_runtime": 29.0839, "eval_samples_per_second": 70.142, "eval_steps_per_second": 8.768, "step": 23000 }, { "epoch": 5.758392550845381, "eval_accuracy": 0.47941176470588237, "eval_f1_macro": 0.44202355917614705, "eval_loss": 2.3411076068878174, "eval_precision_macro": 0.46175706618591966, "eval_recall_macro": 0.4431023242309332, "eval_runtime": 29.2312, "eval_samples_per_second": 69.788, "eval_steps_per_second": 8.724, "step": 23500 }, { "epoch": 5.8809115412889, "grad_norm": 13.596967697143555, "learning_rate": 2.6491668708649844e-06, "loss": 0.8784, "step": 24000 }, { "epoch": 5.8809115412889, "eval_accuracy": 0.478921568627451, "eval_f1_macro": 0.43880056363873643, "eval_loss": 2.3677313327789307, "eval_precision_macro": 0.47067685389122504, "eval_recall_macro": 0.43803060313742814, "eval_runtime": 29.1771, "eval_samples_per_second": 69.918, "eval_steps_per_second": 8.74, "step": 24000 }, { "epoch": 6.003430531732419, "eval_accuracy": 0.47843137254901963, "eval_f1_macro": 0.4415908488265077, "eval_loss": 2.362061023712158, "eval_precision_macro": 0.4595063797074559, "eval_recall_macro": 0.44041063630939775, "eval_runtime": 29.1497, "eval_samples_per_second": 69.984, "eval_steps_per_second": 8.748, "step": 24500 }, { "epoch": 6.1259495221759375, "grad_norm": 13.047096252441406, "learning_rate": 2.342869394756187e-06, "loss": 0.7954, "step": 25000 }, { "epoch": 6.1259495221759375, "eval_accuracy": 0.47794117647058826, "eval_f1_macro": 0.4396408727749891, "eval_loss": 2.377870798110962, "eval_precision_macro": 0.4691118447391341, "eval_recall_macro": 0.4404702671163399, "eval_runtime": 29.083, "eval_samples_per_second": 70.144, "eval_steps_per_second": 8.768, "step": 25000 }, { "epoch": 6.248468512619456, "eval_accuracy": 0.48333333333333334, "eval_f1_macro": 0.450262927544688, "eval_loss": 2.3764188289642334, "eval_precision_macro": 0.4691361570060391, "eval_recall_macro": 0.45199284344161184, "eval_runtime": 29.1075, "eval_samples_per_second": 70.085, "eval_steps_per_second": 8.761, "step": 25500 } ], "logging_steps": 1000, "max_steps": 32648, "num_input_tokens_seen": 0, "num_train_epochs": 8, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.685780937728e+16, "train_batch_size": 4, "trial_name": null, "trial_params": null }