es_classification_model / trainer_state.json
fdshdrwu's picture
Upload folder using huggingface_hub
201ea86 verified
Raw
History Blame Contribute Delete
25.6 kB
{
"best_global_step": 25500,
"best_metric": 0.450262927544688,
"best_model_checkpoint": "/results/bert-base-spanish-wwm-cased/LR_1e-05_E_8_BS_4/checkpoint-25500",
"epoch": 6.248468512619456,
"eval_steps": 500,
"global_step": 25500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.12251899044351874,
"eval_accuracy": 0.045588235294117645,
"eval_f1_macro": 0.01306886519451452,
"eval_loss": 4.428101062774658,
"eval_precision_macro": 0.014429422836219046,
"eval_recall_macro": 0.03337166980398182,
"eval_runtime": 28.9155,
"eval_samples_per_second": 70.55,
"eval_steps_per_second": 8.819,
"step": 500
},
{
"epoch": 0.2450379808870375,
"grad_norm": 11.240307807922363,
"learning_rate": 9.694008821367313e-06,
"loss": 4.4001,
"step": 1000
},
{
"epoch": 0.2450379808870375,
"eval_accuracy": 0.06274509803921569,
"eval_f1_macro": 0.022566891830631288,
"eval_loss": 4.284124374389648,
"eval_precision_macro": 0.023353351335236566,
"eval_recall_macro": 0.05069920248096901,
"eval_runtime": 28.7949,
"eval_samples_per_second": 70.846,
"eval_steps_per_second": 8.856,
"step": 1000
},
{
"epoch": 0.36755697133055626,
"eval_accuracy": 0.08333333333333333,
"eval_f1_macro": 0.035510363131552765,
"eval_loss": 4.161181449890137,
"eval_precision_macro": 0.053844153665449625,
"eval_recall_macro": 0.06445737839338715,
"eval_runtime": 29.0382,
"eval_samples_per_second": 70.252,
"eval_steps_per_second": 8.782,
"step": 1500
},
{
"epoch": 0.490075961774075,
"grad_norm": 15.960897445678711,
"learning_rate": 9.387711345258515e-06,
"loss": 4.1746,
"step": 2000
},
{
"epoch": 0.490075961774075,
"eval_accuracy": 0.10784313725490197,
"eval_f1_macro": 0.04915441628160089,
"eval_loss": 4.015964984893799,
"eval_precision_macro": 0.06875645445881123,
"eval_recall_macro": 0.07925934506451808,
"eval_runtime": 29.0179,
"eval_samples_per_second": 70.301,
"eval_steps_per_second": 8.788,
"step": 2000
},
{
"epoch": 0.6125949522175937,
"eval_accuracy": 0.16519607843137254,
"eval_f1_macro": 0.07987301718499762,
"eval_loss": 3.787720203399658,
"eval_precision_macro": 0.13889534971495046,
"eval_recall_macro": 0.12043319793836148,
"eval_runtime": 29.1111,
"eval_samples_per_second": 70.076,
"eval_steps_per_second": 8.76,
"step": 2500
},
{
"epoch": 0.7351139426611125,
"grad_norm": 15.03334903717041,
"learning_rate": 9.08141386914972e-06,
"loss": 3.81,
"step": 3000
},
{
"epoch": 0.7351139426611125,
"eval_accuracy": 0.21176470588235294,
"eval_f1_macro": 0.12994262108705937,
"eval_loss": 3.590181827545166,
"eval_precision_macro": 0.17841215908379965,
"eval_recall_macro": 0.17615939544039477,
"eval_runtime": 29.0586,
"eval_samples_per_second": 70.203,
"eval_steps_per_second": 8.775,
"step": 3000
},
{
"epoch": 0.8576329331046312,
"eval_accuracy": 0.27450980392156865,
"eval_f1_macro": 0.17829061168481852,
"eval_loss": 3.4180164337158203,
"eval_precision_macro": 0.24611886260263896,
"eval_recall_macro": 0.21322328824757553,
"eval_runtime": 29.1078,
"eval_samples_per_second": 70.084,
"eval_steps_per_second": 8.761,
"step": 3500
},
{
"epoch": 0.98015192354815,
"grad_norm": 20.16187858581543,
"learning_rate": 8.775116393040922e-06,
"loss": 3.4504,
"step": 4000
},
{
"epoch": 0.98015192354815,
"eval_accuracy": 0.3014705882352941,
"eval_f1_macro": 0.21258206552870162,
"eval_loss": 3.251574993133545,
"eval_precision_macro": 0.2859814835461467,
"eval_recall_macro": 0.24545922585073798,
"eval_runtime": 29.0843,
"eval_samples_per_second": 70.141,
"eval_steps_per_second": 8.768,
"step": 4000
},
{
"epoch": 1.1026709139916686,
"eval_accuracy": 0.31176470588235294,
"eval_f1_macro": 0.21899432488275963,
"eval_loss": 3.142249584197998,
"eval_precision_macro": 0.2507771079260614,
"eval_recall_macro": 0.25978102757160393,
"eval_runtime": 29.0427,
"eval_samples_per_second": 70.242,
"eval_steps_per_second": 8.78,
"step": 4500
},
{
"epoch": 1.2251899044351875,
"grad_norm": 23.114660263061523,
"learning_rate": 8.468818916932126e-06,
"loss": 3.1083,
"step": 5000
},
{
"epoch": 1.2251899044351875,
"eval_accuracy": 0.3264705882352941,
"eval_f1_macro": 0.24619035797913624,
"eval_loss": 3.0345137119293213,
"eval_precision_macro": 0.28975508986079757,
"eval_recall_macro": 0.27505180159662773,
"eval_runtime": 28.9786,
"eval_samples_per_second": 70.397,
"eval_steps_per_second": 8.8,
"step": 5000
},
{
"epoch": 1.3477088948787062,
"eval_accuracy": 0.3568627450980392,
"eval_f1_macro": 0.28067884144327176,
"eval_loss": 2.945455551147461,
"eval_precision_macro": 0.31407618841721907,
"eval_recall_macro": 0.31023827174307916,
"eval_runtime": 28.9923,
"eval_samples_per_second": 70.363,
"eval_steps_per_second": 8.795,
"step": 5500
},
{
"epoch": 1.4702278853222248,
"grad_norm": 22.831905364990234,
"learning_rate": 8.162521440823328e-06,
"loss": 2.8855,
"step": 6000
},
{
"epoch": 1.4702278853222248,
"eval_accuracy": 0.36519607843137253,
"eval_f1_macro": 0.29503641204547365,
"eval_loss": 2.842531204223633,
"eval_precision_macro": 0.34290840050484983,
"eval_recall_macro": 0.32216664741819667,
"eval_runtime": 29.0469,
"eval_samples_per_second": 70.231,
"eval_steps_per_second": 8.779,
"step": 6000
},
{
"epoch": 1.5927468757657437,
"eval_accuracy": 0.37941176470588234,
"eval_f1_macro": 0.3184854598614125,
"eval_loss": 2.7759594917297363,
"eval_precision_macro": 0.3891038214856321,
"eval_recall_macro": 0.33724858451604794,
"eval_runtime": 29.1095,
"eval_samples_per_second": 70.08,
"eval_steps_per_second": 8.76,
"step": 6500
},
{
"epoch": 1.7152658662092626,
"grad_norm": 23.412046432495117,
"learning_rate": 7.85622396471453e-06,
"loss": 2.7373,
"step": 7000
},
{
"epoch": 1.7152658662092626,
"eval_accuracy": 0.37598039215686274,
"eval_f1_macro": 0.3123619827862161,
"eval_loss": 2.7370920181274414,
"eval_precision_macro": 0.3389189313296257,
"eval_recall_macro": 0.3364221245176174,
"eval_runtime": 29.1278,
"eval_samples_per_second": 70.036,
"eval_steps_per_second": 8.755,
"step": 7000
},
{
"epoch": 1.8377848566527812,
"eval_accuracy": 0.38529411764705884,
"eval_f1_macro": 0.32685781242393885,
"eval_loss": 2.6543169021606445,
"eval_precision_macro": 0.3794044222841129,
"eval_recall_macro": 0.3581486899723563,
"eval_runtime": 29.123,
"eval_samples_per_second": 70.048,
"eval_steps_per_second": 8.756,
"step": 7500
},
{
"epoch": 1.9603038470963,
"grad_norm": 13.25064754486084,
"learning_rate": 7.549926488605734e-06,
"loss": 2.5967,
"step": 8000
},
{
"epoch": 1.9603038470963,
"eval_accuracy": 0.39705882352941174,
"eval_f1_macro": 0.3416367025266391,
"eval_loss": 2.6037559509277344,
"eval_precision_macro": 0.3875862358063217,
"eval_recall_macro": 0.3711247487243121,
"eval_runtime": 29.0906,
"eval_samples_per_second": 70.126,
"eval_steps_per_second": 8.766,
"step": 8000
},
{
"epoch": 2.0828228375398186,
"eval_accuracy": 0.40588235294117647,
"eval_f1_macro": 0.34177780306634054,
"eval_loss": 2.5586369037628174,
"eval_precision_macro": 0.37785214424417857,
"eval_recall_macro": 0.37123852015418934,
"eval_runtime": 29.1167,
"eval_samples_per_second": 70.063,
"eval_steps_per_second": 8.758,
"step": 8500
},
{
"epoch": 2.205341827983337,
"grad_norm": 36.344505310058594,
"learning_rate": 7.2436290124969375e-06,
"loss": 2.2877,
"step": 9000
},
{
"epoch": 2.205341827983337,
"eval_accuracy": 0.3941176470588235,
"eval_f1_macro": 0.3329373015030159,
"eval_loss": 2.5376462936401367,
"eval_precision_macro": 0.36727782127929887,
"eval_recall_macro": 0.35714324134631126,
"eval_runtime": 29.1162,
"eval_samples_per_second": 70.064,
"eval_steps_per_second": 8.758,
"step": 9000
},
{
"epoch": 2.3278608184268563,
"eval_accuracy": 0.4088235294117647,
"eval_f1_macro": 0.3589999095822752,
"eval_loss": 2.5077292919158936,
"eval_precision_macro": 0.3816246211523356,
"eval_recall_macro": 0.3785276351507907,
"eval_runtime": 29.0498,
"eval_samples_per_second": 70.224,
"eval_steps_per_second": 8.778,
"step": 9500
},
{
"epoch": 2.450379808870375,
"grad_norm": 48.41518783569336,
"learning_rate": 6.937331536388141e-06,
"loss": 2.136,
"step": 10000
},
{
"epoch": 2.450379808870375,
"eval_accuracy": 0.4117647058823529,
"eval_f1_macro": 0.3657351686682792,
"eval_loss": 2.4824399948120117,
"eval_precision_macro": 0.4231750089513437,
"eval_recall_macro": 0.3830197545592446,
"eval_runtime": 29.0116,
"eval_samples_per_second": 70.317,
"eval_steps_per_second": 8.79,
"step": 10000
},
{
"epoch": 2.5728987993138936,
"eval_accuracy": 0.4196078431372549,
"eval_f1_macro": 0.371782683847044,
"eval_loss": 2.4366378784179688,
"eval_precision_macro": 0.40052896394929344,
"eval_recall_macro": 0.3971562794600927,
"eval_runtime": 29.0098,
"eval_samples_per_second": 70.321,
"eval_steps_per_second": 8.79,
"step": 10500
},
{
"epoch": 2.6954177897574123,
"grad_norm": 32.126468658447266,
"learning_rate": 6.631034060279345e-06,
"loss": 2.051,
"step": 11000
},
{
"epoch": 2.6954177897574123,
"eval_accuracy": 0.42745098039215684,
"eval_f1_macro": 0.3856964289538409,
"eval_loss": 2.410841703414917,
"eval_precision_macro": 0.4101091225398707,
"eval_recall_macro": 0.40255800980694373,
"eval_runtime": 29.1106,
"eval_samples_per_second": 70.078,
"eval_steps_per_second": 8.76,
"step": 11000
},
{
"epoch": 2.817936780200931,
"eval_accuracy": 0.42892156862745096,
"eval_f1_macro": 0.384952826032894,
"eval_loss": 2.3878557682037354,
"eval_precision_macro": 0.42850269125272694,
"eval_recall_macro": 0.4018898685238271,
"eval_runtime": 29.0617,
"eval_samples_per_second": 70.196,
"eval_steps_per_second": 8.774,
"step": 11500
},
{
"epoch": 2.9404557706444496,
"grad_norm": 19.8395938873291,
"learning_rate": 6.324736584170546e-06,
"loss": 1.9909,
"step": 12000
},
{
"epoch": 2.9404557706444496,
"eval_accuracy": 0.43529411764705883,
"eval_f1_macro": 0.3897129403513703,
"eval_loss": 2.3484647274017334,
"eval_precision_macro": 0.41476544204467075,
"eval_recall_macro": 0.41058984161765777,
"eval_runtime": 29.0621,
"eval_samples_per_second": 70.194,
"eval_steps_per_second": 8.774,
"step": 12000
},
{
"epoch": 3.0629747610879687,
"eval_accuracy": 0.4323529411764706,
"eval_f1_macro": 0.38999617888289256,
"eval_loss": 2.3602137565612793,
"eval_precision_macro": 0.4264286069225271,
"eval_recall_macro": 0.4075553863336427,
"eval_runtime": 29.0817,
"eval_samples_per_second": 70.147,
"eval_steps_per_second": 8.768,
"step": 12500
},
{
"epoch": 3.1854937515314874,
"grad_norm": 27.923873901367188,
"learning_rate": 6.01843910806175e-06,
"loss": 1.7282,
"step": 13000
},
{
"epoch": 3.1854937515314874,
"eval_accuracy": 0.42696078431372547,
"eval_f1_macro": 0.38162966948900895,
"eval_loss": 2.359041452407837,
"eval_precision_macro": 0.4166455055888518,
"eval_recall_macro": 0.3973804144066564,
"eval_runtime": 28.9947,
"eval_samples_per_second": 70.358,
"eval_steps_per_second": 8.795,
"step": 13000
},
{
"epoch": 3.308012741975006,
"eval_accuracy": 0.4455882352941177,
"eval_f1_macro": 0.40565975190401343,
"eval_loss": 2.3188326358795166,
"eval_precision_macro": 0.43293933225570724,
"eval_recall_macro": 0.4167306793780272,
"eval_runtime": 29.0614,
"eval_samples_per_second": 70.196,
"eval_steps_per_second": 8.775,
"step": 13500
},
{
"epoch": 3.4305317324185247,
"grad_norm": 35.284400939941406,
"learning_rate": 5.712141631952953e-06,
"loss": 1.6189,
"step": 14000
},
{
"epoch": 3.4305317324185247,
"eval_accuracy": 0.4465686274509804,
"eval_f1_macro": 0.4079543261512267,
"eval_loss": 2.3170266151428223,
"eval_precision_macro": 0.4431624594065138,
"eval_recall_macro": 0.41430364342829584,
"eval_runtime": 29.0781,
"eval_samples_per_second": 70.156,
"eval_steps_per_second": 8.769,
"step": 14000
},
{
"epoch": 3.553050722862044,
"eval_accuracy": 0.45588235294117646,
"eval_f1_macro": 0.4179070025215764,
"eval_loss": 2.2999155521392822,
"eval_precision_macro": 0.44615015216292947,
"eval_recall_macro": 0.42739503933025014,
"eval_runtime": 29.1482,
"eval_samples_per_second": 69.987,
"eval_steps_per_second": 8.748,
"step": 14500
},
{
"epoch": 3.6755697133055625,
"grad_norm": 16.248411178588867,
"learning_rate": 5.405844155844157e-06,
"loss": 1.5814,
"step": 15000
},
{
"epoch": 3.6755697133055625,
"eval_accuracy": 0.453921568627451,
"eval_f1_macro": 0.41123847042433936,
"eval_loss": 2.3039774894714355,
"eval_precision_macro": 0.4472728193469412,
"eval_recall_macro": 0.41750638987980865,
"eval_runtime": 29.1061,
"eval_samples_per_second": 70.088,
"eval_steps_per_second": 8.761,
"step": 15000
},
{
"epoch": 3.798088703749081,
"eval_accuracy": 0.4612745098039216,
"eval_f1_macro": 0.41950160771132944,
"eval_loss": 2.293405532836914,
"eval_precision_macro": 0.4463805703114915,
"eval_recall_macro": 0.4245314708924026,
"eval_runtime": 28.9902,
"eval_samples_per_second": 70.369,
"eval_steps_per_second": 8.796,
"step": 15500
},
{
"epoch": 3.9206076941926,
"grad_norm": 52.409446716308594,
"learning_rate": 5.09954667973536e-06,
"loss": 1.5166,
"step": 16000
},
{
"epoch": 3.9206076941926,
"eval_accuracy": 0.4573529411764706,
"eval_f1_macro": 0.42014589112851725,
"eval_loss": 2.2832016944885254,
"eval_precision_macro": 0.43745108731300303,
"eval_recall_macro": 0.4323856661621557,
"eval_runtime": 29.1441,
"eval_samples_per_second": 69.997,
"eval_steps_per_second": 8.75,
"step": 16000
},
{
"epoch": 4.0431266846361185,
"eval_accuracy": 0.45588235294117646,
"eval_f1_macro": 0.4230638604944445,
"eval_loss": 2.290628671646118,
"eval_precision_macro": 0.45239282061220365,
"eval_recall_macro": 0.4286428783592783,
"eval_runtime": 29.0514,
"eval_samples_per_second": 70.22,
"eval_steps_per_second": 8.778,
"step": 16500
},
{
"epoch": 4.165645675079637,
"grad_norm": 55.6788330078125,
"learning_rate": 4.793249203626563e-06,
"loss": 1.2834,
"step": 17000
},
{
"epoch": 4.165645675079637,
"eval_accuracy": 0.45637254901960783,
"eval_f1_macro": 0.41456070933090583,
"eval_loss": 2.308366298675537,
"eval_precision_macro": 0.43813614937663775,
"eval_recall_macro": 0.4257014582599933,
"eval_runtime": 29.0009,
"eval_samples_per_second": 70.343,
"eval_steps_per_second": 8.793,
"step": 17000
},
{
"epoch": 4.288164665523156,
"eval_accuracy": 0.4573529411764706,
"eval_f1_macro": 0.41793447869082173,
"eval_loss": 2.293177366256714,
"eval_precision_macro": 0.4329296900073293,
"eval_recall_macro": 0.42608774895517754,
"eval_runtime": 29.0662,
"eval_samples_per_second": 70.185,
"eval_steps_per_second": 8.773,
"step": 17500
},
{
"epoch": 4.410683655966674,
"grad_norm": 19.722681045532227,
"learning_rate": 4.486951727517765e-06,
"loss": 1.2109,
"step": 18000
},
{
"epoch": 4.410683655966674,
"eval_accuracy": 0.4519607843137255,
"eval_f1_macro": 0.41240482141943163,
"eval_loss": 2.3044347763061523,
"eval_precision_macro": 0.43183268656889506,
"eval_recall_macro": 0.4206771140546417,
"eval_runtime": 29.0925,
"eval_samples_per_second": 70.121,
"eval_steps_per_second": 8.765,
"step": 18000
},
{
"epoch": 4.533202646410194,
"eval_accuracy": 0.4583333333333333,
"eval_f1_macro": 0.41788236299315934,
"eval_loss": 2.3148584365844727,
"eval_precision_macro": 0.44364154268687234,
"eval_recall_macro": 0.42792744963117146,
"eval_runtime": 29.1094,
"eval_samples_per_second": 70.08,
"eval_steps_per_second": 8.76,
"step": 18500
},
{
"epoch": 4.655721636853713,
"grad_norm": 88.38114929199219,
"learning_rate": 4.1806542514089685e-06,
"loss": 1.1985,
"step": 19000
},
{
"epoch": 4.655721636853713,
"eval_accuracy": 0.45588235294117646,
"eval_f1_macro": 0.4131192612245579,
"eval_loss": 2.3118155002593994,
"eval_precision_macro": 0.4265642919630791,
"eval_recall_macro": 0.4267646071714731,
"eval_runtime": 29.0852,
"eval_samples_per_second": 70.139,
"eval_steps_per_second": 8.767,
"step": 19000
},
{
"epoch": 4.778240627297231,
"eval_accuracy": 0.4696078431372549,
"eval_f1_macro": 0.43230688806746487,
"eval_loss": 2.2900590896606445,
"eval_precision_macro": 0.44412022895196174,
"eval_recall_macro": 0.4374181835060155,
"eval_runtime": 29.0704,
"eval_samples_per_second": 70.174,
"eval_steps_per_second": 8.772,
"step": 19500
},
{
"epoch": 4.90075961774075,
"grad_norm": 78.37841796875,
"learning_rate": 3.874356775300172e-06,
"loss": 1.1608,
"step": 20000
},
{
"epoch": 4.90075961774075,
"eval_accuracy": 0.4681372549019608,
"eval_f1_macro": 0.4413383226058443,
"eval_loss": 2.2932121753692627,
"eval_precision_macro": 0.4617364695922631,
"eval_recall_macro": 0.4406843736368774,
"eval_runtime": 29.1155,
"eval_samples_per_second": 70.066,
"eval_steps_per_second": 8.758,
"step": 20000
},
{
"epoch": 5.023278608184269,
"eval_accuracy": 0.475,
"eval_f1_macro": 0.43813725080604216,
"eval_loss": 2.290257215499878,
"eval_precision_macro": 0.45262479845690323,
"eval_recall_macro": 0.4415708796261671,
"eval_runtime": 29.1303,
"eval_samples_per_second": 70.03,
"eval_steps_per_second": 8.754,
"step": 20500
},
{
"epoch": 5.145797598627787,
"grad_norm": 10.83778190612793,
"learning_rate": 3.568059299191375e-06,
"loss": 1.0083,
"step": 21000
},
{
"epoch": 5.145797598627787,
"eval_accuracy": 0.4681372549019608,
"eval_f1_macro": 0.43829003708840103,
"eval_loss": 2.312354803085327,
"eval_precision_macro": 0.4666057917038543,
"eval_recall_macro": 0.43383845264115456,
"eval_runtime": 29.0772,
"eval_samples_per_second": 70.158,
"eval_steps_per_second": 8.77,
"step": 21000
},
{
"epoch": 5.268316589071306,
"eval_accuracy": 0.4681372549019608,
"eval_f1_macro": 0.43241216031208274,
"eval_loss": 2.3248424530029297,
"eval_precision_macro": 0.4491286407098105,
"eval_recall_macro": 0.4355901107138846,
"eval_runtime": 29.0944,
"eval_samples_per_second": 70.117,
"eval_steps_per_second": 8.765,
"step": 21500
},
{
"epoch": 5.390835579514825,
"grad_norm": 42.13823699951172,
"learning_rate": 3.261761823082578e-06,
"loss": 0.9278,
"step": 22000
},
{
"epoch": 5.390835579514825,
"eval_accuracy": 0.47401960784313724,
"eval_f1_macro": 0.43814753866309025,
"eval_loss": 2.330505132675171,
"eval_precision_macro": 0.45473247643144465,
"eval_recall_macro": 0.4384025935181326,
"eval_runtime": 29.1716,
"eval_samples_per_second": 69.931,
"eval_steps_per_second": 8.741,
"step": 22000
},
{
"epoch": 5.513354569958343,
"eval_accuracy": 0.46715686274509804,
"eval_f1_macro": 0.43257866102694503,
"eval_loss": 2.347115993499756,
"eval_precision_macro": 0.4504726705618405,
"eval_recall_macro": 0.4348319212180254,
"eval_runtime": 29.1269,
"eval_samples_per_second": 70.038,
"eval_steps_per_second": 8.755,
"step": 22500
},
{
"epoch": 5.635873560401862,
"grad_norm": 38.9526252746582,
"learning_rate": 2.955464346973781e-06,
"loss": 0.9329,
"step": 23000
},
{
"epoch": 5.635873560401862,
"eval_accuracy": 0.47794117647058826,
"eval_f1_macro": 0.44208070378557873,
"eval_loss": 2.3172309398651123,
"eval_precision_macro": 0.4545102004320516,
"eval_recall_macro": 0.4438161984853697,
"eval_runtime": 29.0839,
"eval_samples_per_second": 70.142,
"eval_steps_per_second": 8.768,
"step": 23000
},
{
"epoch": 5.758392550845381,
"eval_accuracy": 0.47941176470588237,
"eval_f1_macro": 0.44202355917614705,
"eval_loss": 2.3411076068878174,
"eval_precision_macro": 0.46175706618591966,
"eval_recall_macro": 0.4431023242309332,
"eval_runtime": 29.2312,
"eval_samples_per_second": 69.788,
"eval_steps_per_second": 8.724,
"step": 23500
},
{
"epoch": 5.8809115412889,
"grad_norm": 13.596967697143555,
"learning_rate": 2.6491668708649844e-06,
"loss": 0.8784,
"step": 24000
},
{
"epoch": 5.8809115412889,
"eval_accuracy": 0.478921568627451,
"eval_f1_macro": 0.43880056363873643,
"eval_loss": 2.3677313327789307,
"eval_precision_macro": 0.47067685389122504,
"eval_recall_macro": 0.43803060313742814,
"eval_runtime": 29.1771,
"eval_samples_per_second": 69.918,
"eval_steps_per_second": 8.74,
"step": 24000
},
{
"epoch": 6.003430531732419,
"eval_accuracy": 0.47843137254901963,
"eval_f1_macro": 0.4415908488265077,
"eval_loss": 2.362061023712158,
"eval_precision_macro": 0.4595063797074559,
"eval_recall_macro": 0.44041063630939775,
"eval_runtime": 29.1497,
"eval_samples_per_second": 69.984,
"eval_steps_per_second": 8.748,
"step": 24500
},
{
"epoch": 6.1259495221759375,
"grad_norm": 13.047096252441406,
"learning_rate": 2.342869394756187e-06,
"loss": 0.7954,
"step": 25000
},
{
"epoch": 6.1259495221759375,
"eval_accuracy": 0.47794117647058826,
"eval_f1_macro": 0.4396408727749891,
"eval_loss": 2.377870798110962,
"eval_precision_macro": 0.4691118447391341,
"eval_recall_macro": 0.4404702671163399,
"eval_runtime": 29.083,
"eval_samples_per_second": 70.144,
"eval_steps_per_second": 8.768,
"step": 25000
},
{
"epoch": 6.248468512619456,
"eval_accuracy": 0.48333333333333334,
"eval_f1_macro": 0.450262927544688,
"eval_loss": 2.3764188289642334,
"eval_precision_macro": 0.4691361570060391,
"eval_recall_macro": 0.45199284344161184,
"eval_runtime": 29.1075,
"eval_samples_per_second": 70.085,
"eval_steps_per_second": 8.761,
"step": 25500
}
],
"logging_steps": 1000,
"max_steps": 32648,
"num_input_tokens_seen": 0,
"num_train_epochs": 8,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 2.685780937728e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}