thunderboltc's picture
Final push: best-epoch MarianMT Sanlish->Bangla
caa6b4c verified
Raw
History Blame Contribute Delete
33.8 kB
{
"best_metric": 12.636168876478752,
"best_model_checkpoint": "/content/marianmt-santali-sanlish-to-bangla/checkpoint-3298",
"epoch": 22.0,
"eval_steps": 500,
"global_step": 4268,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.15463917525773196,
"grad_norm": 43.064876556396484,
"learning_rate": 8.93470790378007e-07,
"loss": 8.0531,
"step": 30
},
{
"epoch": 0.30927835051546393,
"grad_norm": 38.152244567871094,
"learning_rate": 1.9243986254295534e-06,
"loss": 6.8732,
"step": 60
},
{
"epoch": 0.4639175257731959,
"grad_norm": 20.582117080688477,
"learning_rate": 2.9553264604811e-06,
"loss": 4.9163,
"step": 90
},
{
"epoch": 0.6185567010309279,
"grad_norm": 13.089325904846191,
"learning_rate": 3.986254295532647e-06,
"loss": 3.381,
"step": 120
},
{
"epoch": 0.7731958762886598,
"grad_norm": 12.60307502746582,
"learning_rate": 5.017182130584193e-06,
"loss": 3.0247,
"step": 150
},
{
"epoch": 0.9278350515463918,
"grad_norm": 12.468002319335938,
"learning_rate": 6.048109965635739e-06,
"loss": 2.942,
"step": 180
},
{
"epoch": 1.0,
"eval_bertscore": 0.7088343220053559,
"eval_bleu": 0.3864012583347095,
"eval_chrf": 10.09476116429599,
"eval_loss": 2.6114141941070557,
"eval_meteor": 0.028841924396372502,
"eval_runtime": 38.0618,
"eval_samples_per_second": 5.071,
"eval_steps_per_second": 0.657,
"step": 194
},
{
"epoch": 1.0824742268041236,
"grad_norm": 10.807812690734863,
"learning_rate": 7.079037800687286e-06,
"loss": 2.6762,
"step": 210
},
{
"epoch": 1.2371134020618557,
"grad_norm": 10.950024604797363,
"learning_rate": 8.109965635738832e-06,
"loss": 2.6531,
"step": 240
},
{
"epoch": 1.3917525773195876,
"grad_norm": 9.422192573547363,
"learning_rate": 9.140893470790379e-06,
"loss": 2.5974,
"step": 270
},
{
"epoch": 1.5463917525773194,
"grad_norm": 14.578783988952637,
"learning_rate": 1.0171821305841924e-05,
"loss": 2.6236,
"step": 300
},
{
"epoch": 1.7010309278350515,
"grad_norm": 13.789867401123047,
"learning_rate": 1.1202749140893473e-05,
"loss": 2.4943,
"step": 330
},
{
"epoch": 1.8556701030927836,
"grad_norm": 12.978485107421875,
"learning_rate": 1.223367697594502e-05,
"loss": 2.5078,
"step": 360
},
{
"epoch": 2.0,
"eval_bertscore": 0.7392782556578286,
"eval_bleu": 0.46239407700960067,
"eval_chrf": 12.818734803935335,
"eval_loss": 2.2853775024414062,
"eval_meteor": 0.048241173739640195,
"eval_runtime": 18.2718,
"eval_samples_per_second": 10.563,
"eval_steps_per_second": 1.368,
"step": 388
},
{
"epoch": 2.0103092783505154,
"grad_norm": 10.923307418823242,
"learning_rate": 1.3264604810996563e-05,
"loss": 2.4348,
"step": 390
},
{
"epoch": 2.1649484536082473,
"grad_norm": 11.970940589904785,
"learning_rate": 1.4295532646048112e-05,
"loss": 2.3111,
"step": 420
},
{
"epoch": 2.319587628865979,
"grad_norm": 13.831852912902832,
"learning_rate": 1.5326460481099657e-05,
"loss": 2.278,
"step": 450
},
{
"epoch": 2.4742268041237114,
"grad_norm": 13.530282974243164,
"learning_rate": 1.6357388316151203e-05,
"loss": 2.3752,
"step": 480
},
{
"epoch": 2.6288659793814433,
"grad_norm": 13.126559257507324,
"learning_rate": 1.738831615120275e-05,
"loss": 2.1868,
"step": 510
},
{
"epoch": 2.783505154639175,
"grad_norm": 11.856134414672852,
"learning_rate": 1.8419243986254297e-05,
"loss": 2.1822,
"step": 540
},
{
"epoch": 2.9381443298969074,
"grad_norm": 9.861915588378906,
"learning_rate": 1.9450171821305842e-05,
"loss": 2.1383,
"step": 570
},
{
"epoch": 3.0,
"eval_bertscore": 0.7664902392446686,
"eval_bleu": 1.820820260915908,
"eval_chrf": 18.54167447294365,
"eval_loss": 2.055220603942871,
"eval_meteor": 0.11437707653982947,
"eval_runtime": 18.6431,
"eval_samples_per_second": 10.352,
"eval_steps_per_second": 1.341,
"step": 582
},
{
"epoch": 3.0927835051546393,
"grad_norm": 8.970413208007812,
"learning_rate": 1.994654448262696e-05,
"loss": 2.0298,
"step": 600
},
{
"epoch": 3.247422680412371,
"grad_norm": 11.038900375366211,
"learning_rate": 1.9831996945399007e-05,
"loss": 1.8987,
"step": 630
},
{
"epoch": 3.402061855670103,
"grad_norm": 9.999340057373047,
"learning_rate": 1.9717449408171058e-05,
"loss": 1.943,
"step": 660
},
{
"epoch": 3.556701030927835,
"grad_norm": 11.228028297424316,
"learning_rate": 1.960290187094311e-05,
"loss": 1.9018,
"step": 690
},
{
"epoch": 3.711340206185567,
"grad_norm": 14.46988296508789,
"learning_rate": 1.948835433371516e-05,
"loss": 1.916,
"step": 720
},
{
"epoch": 3.865979381443299,
"grad_norm": 13.187897682189941,
"learning_rate": 1.9373806796487212e-05,
"loss": 1.9096,
"step": 750
},
{
"epoch": 4.0,
"eval_bertscore": 0.7867915055912393,
"eval_bleu": 3.1417647965851434,
"eval_chrf": 21.794103049706337,
"eval_loss": 1.8877290487289429,
"eval_meteor": 0.15566352755949234,
"eval_runtime": 17.9807,
"eval_samples_per_second": 10.734,
"eval_steps_per_second": 1.39,
"step": 776
},
{
"epoch": 4.020618556701031,
"grad_norm": 9.245710372924805,
"learning_rate": 1.925925925925926e-05,
"loss": 1.8022,
"step": 780
},
{
"epoch": 4.175257731958763,
"grad_norm": 12.707769393920898,
"learning_rate": 1.914471172203131e-05,
"loss": 1.7105,
"step": 810
},
{
"epoch": 4.329896907216495,
"grad_norm": 13.76497745513916,
"learning_rate": 1.9030164184803362e-05,
"loss": 1.7098,
"step": 840
},
{
"epoch": 4.484536082474227,
"grad_norm": 12.652901649475098,
"learning_rate": 1.8915616647575414e-05,
"loss": 1.6128,
"step": 870
},
{
"epoch": 4.639175257731958,
"grad_norm": 14.508373260498047,
"learning_rate": 1.880106911034746e-05,
"loss": 1.6844,
"step": 900
},
{
"epoch": 4.793814432989691,
"grad_norm": 10.372153282165527,
"learning_rate": 1.8686521573119513e-05,
"loss": 1.5839,
"step": 930
},
{
"epoch": 4.948453608247423,
"grad_norm": 10.381881713867188,
"learning_rate": 1.857197403589156e-05,
"loss": 1.5992,
"step": 960
},
{
"epoch": 5.0,
"eval_bertscore": 0.8009231167753743,
"eval_bleu": 5.107916225528083,
"eval_chrf": 27.109939343296112,
"eval_loss": 1.7559988498687744,
"eval_meteor": 0.20502396164700096,
"eval_runtime": 19.6434,
"eval_samples_per_second": 9.825,
"eval_steps_per_second": 1.273,
"step": 970
},
{
"epoch": 5.103092783505154,
"grad_norm": 9.559462547302246,
"learning_rate": 1.8457426498663612e-05,
"loss": 1.4874,
"step": 990
},
{
"epoch": 5.257731958762887,
"grad_norm": 10.890524864196777,
"learning_rate": 1.8342878961435663e-05,
"loss": 1.4588,
"step": 1020
},
{
"epoch": 5.412371134020619,
"grad_norm": 10.118521690368652,
"learning_rate": 1.8228331424207715e-05,
"loss": 1.4945,
"step": 1050
},
{
"epoch": 5.56701030927835,
"grad_norm": 12.269123077392578,
"learning_rate": 1.8113783886979766e-05,
"loss": 1.4544,
"step": 1080
},
{
"epoch": 5.721649484536083,
"grad_norm": 9.705910682678223,
"learning_rate": 1.7999236349751814e-05,
"loss": 1.4013,
"step": 1110
},
{
"epoch": 5.876288659793815,
"grad_norm": 10.108024597167969,
"learning_rate": 1.7884688812523865e-05,
"loss": 1.3569,
"step": 1140
},
{
"epoch": 6.0,
"eval_bertscore": 0.8189008788741314,
"eval_bleu": 7.80196732700183,
"eval_chrf": 31.07771783943801,
"eval_loss": 1.6978754997253418,
"eval_meteor": 0.2476381272119835,
"eval_runtime": 17.9742,
"eval_samples_per_second": 10.738,
"eval_steps_per_second": 1.391,
"step": 1164
},
{
"epoch": 6.030927835051546,
"grad_norm": 10.195992469787598,
"learning_rate": 1.7770141275295916e-05,
"loss": 1.4165,
"step": 1170
},
{
"epoch": 6.185567010309279,
"grad_norm": 10.022723197937012,
"learning_rate": 1.7655593738067968e-05,
"loss": 1.2383,
"step": 1200
},
{
"epoch": 6.34020618556701,
"grad_norm": 11.431436538696289,
"learning_rate": 1.754104620084002e-05,
"loss": 1.3013,
"step": 1230
},
{
"epoch": 6.494845360824742,
"grad_norm": 11.689397811889648,
"learning_rate": 1.7426498663612067e-05,
"loss": 1.2412,
"step": 1260
},
{
"epoch": 6.649484536082475,
"grad_norm": 11.549187660217285,
"learning_rate": 1.7311951126384118e-05,
"loss": 1.237,
"step": 1290
},
{
"epoch": 6.804123711340206,
"grad_norm": 11.665675163269043,
"learning_rate": 1.7197403589156166e-05,
"loss": 1.2955,
"step": 1320
},
{
"epoch": 6.958762886597938,
"grad_norm": 13.438718795776367,
"learning_rate": 1.7082856051928217e-05,
"loss": 1.195,
"step": 1350
},
{
"epoch": 7.0,
"eval_bertscore": 0.8185995718358094,
"eval_bleu": 9.031051320914116,
"eval_chrf": 30.344158100165018,
"eval_loss": 1.6532801389694214,
"eval_meteor": 0.24965221252933717,
"eval_runtime": 17.6222,
"eval_samples_per_second": 10.952,
"eval_steps_per_second": 1.419,
"step": 1358
},
{
"epoch": 7.11340206185567,
"grad_norm": 9.628753662109375,
"learning_rate": 1.696830851470027e-05,
"loss": 1.1824,
"step": 1380
},
{
"epoch": 7.268041237113402,
"grad_norm": 15.119050025939941,
"learning_rate": 1.685376097747232e-05,
"loss": 1.0789,
"step": 1410
},
{
"epoch": 7.422680412371134,
"grad_norm": 10.973334312438965,
"learning_rate": 1.6739213440244368e-05,
"loss": 1.1213,
"step": 1440
},
{
"epoch": 7.577319587628866,
"grad_norm": 9.850281715393066,
"learning_rate": 1.662466590301642e-05,
"loss": 1.0941,
"step": 1470
},
{
"epoch": 7.731958762886598,
"grad_norm": 10.67463207244873,
"learning_rate": 1.651011836578847e-05,
"loss": 1.0986,
"step": 1500
},
{
"epoch": 7.88659793814433,
"grad_norm": 11.185319900512695,
"learning_rate": 1.639557082856052e-05,
"loss": 1.1345,
"step": 1530
},
{
"epoch": 8.0,
"eval_bertscore": 0.8248441731991546,
"eval_bleu": 9.326651170754813,
"eval_chrf": 32.19041027207769,
"eval_loss": 1.6205072402954102,
"eval_meteor": 0.2731252078182265,
"eval_runtime": 19.0403,
"eval_samples_per_second": 10.136,
"eval_steps_per_second": 1.313,
"step": 1552
},
{
"epoch": 8.041237113402062,
"grad_norm": 9.956164360046387,
"learning_rate": 1.6281023291332573e-05,
"loss": 1.0352,
"step": 1560
},
{
"epoch": 8.195876288659793,
"grad_norm": 13.017486572265625,
"learning_rate": 1.6166475754104624e-05,
"loss": 1.0962,
"step": 1590
},
{
"epoch": 8.350515463917526,
"grad_norm": 12.15532398223877,
"learning_rate": 1.6051928216876672e-05,
"loss": 0.9943,
"step": 1620
},
{
"epoch": 8.505154639175258,
"grad_norm": 11.221367835998535,
"learning_rate": 1.5937380679648723e-05,
"loss": 0.9336,
"step": 1650
},
{
"epoch": 8.65979381443299,
"grad_norm": 10.390768051147461,
"learning_rate": 1.5822833142420774e-05,
"loss": 0.9942,
"step": 1680
},
{
"epoch": 8.814432989690722,
"grad_norm": 10.396700859069824,
"learning_rate": 1.5708285605192822e-05,
"loss": 0.9616,
"step": 1710
},
{
"epoch": 8.969072164948454,
"grad_norm": 8.77428913116455,
"learning_rate": 1.5593738067964873e-05,
"loss": 0.9529,
"step": 1740
},
{
"epoch": 9.0,
"eval_bertscore": 0.8292578412461157,
"eval_bleu": 9.64249962743433,
"eval_chrf": 33.6951161128342,
"eval_loss": 1.6319836378097534,
"eval_meteor": 0.2765792548974407,
"eval_runtime": 17.0212,
"eval_samples_per_second": 11.339,
"eval_steps_per_second": 1.469,
"step": 1746
},
{
"epoch": 9.123711340206185,
"grad_norm": 8.413101196289062,
"learning_rate": 1.547919053073692e-05,
"loss": 0.9516,
"step": 1770
},
{
"epoch": 9.278350515463918,
"grad_norm": 10.946271896362305,
"learning_rate": 1.5364642993508973e-05,
"loss": 0.8993,
"step": 1800
},
{
"epoch": 9.43298969072165,
"grad_norm": 9.253824234008789,
"learning_rate": 1.5250095456281024e-05,
"loss": 0.8545,
"step": 1830
},
{
"epoch": 9.587628865979381,
"grad_norm": 9.479711532592773,
"learning_rate": 1.5135547919053075e-05,
"loss": 0.845,
"step": 1860
},
{
"epoch": 9.742268041237114,
"grad_norm": 12.220168113708496,
"learning_rate": 1.5021000381825126e-05,
"loss": 0.8806,
"step": 1890
},
{
"epoch": 9.896907216494846,
"grad_norm": 13.171895027160645,
"learning_rate": 1.4906452844597176e-05,
"loss": 0.9436,
"step": 1920
},
{
"epoch": 10.0,
"eval_bertscore": 0.8355941355537256,
"eval_bleu": 9.50918164746798,
"eval_chrf": 33.972073061006306,
"eval_loss": 1.590855598449707,
"eval_meteor": 0.29613551946552397,
"eval_runtime": 18.4791,
"eval_samples_per_second": 10.444,
"eval_steps_per_second": 1.353,
"step": 1940
},
{
"epoch": 10.051546391752577,
"grad_norm": 8.509225845336914,
"learning_rate": 1.4791905307369226e-05,
"loss": 0.8198,
"step": 1950
},
{
"epoch": 10.206185567010309,
"grad_norm": 11.032247543334961,
"learning_rate": 1.4677357770141277e-05,
"loss": 0.7803,
"step": 1980
},
{
"epoch": 10.360824742268042,
"grad_norm": 12.89780330657959,
"learning_rate": 1.4562810232913326e-05,
"loss": 0.7791,
"step": 2010
},
{
"epoch": 10.515463917525773,
"grad_norm": 11.072964668273926,
"learning_rate": 1.4448262695685378e-05,
"loss": 0.7733,
"step": 2040
},
{
"epoch": 10.670103092783505,
"grad_norm": 9.430943489074707,
"learning_rate": 1.4333715158457429e-05,
"loss": 0.8057,
"step": 2070
},
{
"epoch": 10.824742268041238,
"grad_norm": 10.810933113098145,
"learning_rate": 1.4219167621229477e-05,
"loss": 0.7735,
"step": 2100
},
{
"epoch": 10.97938144329897,
"grad_norm": 11.854232788085938,
"learning_rate": 1.4104620084001528e-05,
"loss": 0.7791,
"step": 2130
},
{
"epoch": 11.0,
"eval_bertscore": 0.8363540237431699,
"eval_bleu": 8.223251531908238,
"eval_chrf": 35.20734927484783,
"eval_loss": 1.6085046529769897,
"eval_meteor": 0.30757486063481376,
"eval_runtime": 17.4256,
"eval_samples_per_second": 11.076,
"eval_steps_per_second": 1.435,
"step": 2134
},
{
"epoch": 11.1340206185567,
"grad_norm": 11.463648796081543,
"learning_rate": 1.399007254677358e-05,
"loss": 0.7283,
"step": 2160
},
{
"epoch": 11.288659793814434,
"grad_norm": 11.482135772705078,
"learning_rate": 1.3875525009545629e-05,
"loss": 0.6976,
"step": 2190
},
{
"epoch": 11.443298969072165,
"grad_norm": 10.873443603515625,
"learning_rate": 1.376097747231768e-05,
"loss": 0.6903,
"step": 2220
},
{
"epoch": 11.597938144329897,
"grad_norm": 10.436446189880371,
"learning_rate": 1.3646429935089731e-05,
"loss": 0.7193,
"step": 2250
},
{
"epoch": 11.75257731958763,
"grad_norm": 11.538565635681152,
"learning_rate": 1.353188239786178e-05,
"loss": 0.758,
"step": 2280
},
{
"epoch": 11.907216494845361,
"grad_norm": 9.299684524536133,
"learning_rate": 1.341733486063383e-05,
"loss": 0.7079,
"step": 2310
},
{
"epoch": 12.0,
"eval_bertscore": 0.8390595162470724,
"eval_bleu": 10.159345704590937,
"eval_chrf": 35.84953170957151,
"eval_loss": 1.6416338682174683,
"eval_meteor": 0.2972449850354188,
"eval_runtime": 17.9183,
"eval_samples_per_second": 10.771,
"eval_steps_per_second": 1.395,
"step": 2328
},
{
"epoch": 12.061855670103093,
"grad_norm": 7.964834213256836,
"learning_rate": 1.3302787323405882e-05,
"loss": 0.6567,
"step": 2340
},
{
"epoch": 12.216494845360824,
"grad_norm": 9.399768829345703,
"learning_rate": 1.3188239786177931e-05,
"loss": 0.6519,
"step": 2370
},
{
"epoch": 12.371134020618557,
"grad_norm": 8.637943267822266,
"learning_rate": 1.3073692248949983e-05,
"loss": 0.6493,
"step": 2400
},
{
"epoch": 12.525773195876289,
"grad_norm": 9.09426498413086,
"learning_rate": 1.2959144711722032e-05,
"loss": 0.6101,
"step": 2430
},
{
"epoch": 12.68041237113402,
"grad_norm": 9.642086029052734,
"learning_rate": 1.2844597174494082e-05,
"loss": 0.6739,
"step": 2460
},
{
"epoch": 12.835051546391753,
"grad_norm": 10.607096672058105,
"learning_rate": 1.2730049637266133e-05,
"loss": 0.6254,
"step": 2490
},
{
"epoch": 12.989690721649485,
"grad_norm": 8.394698143005371,
"learning_rate": 1.2615502100038184e-05,
"loss": 0.6302,
"step": 2520
},
{
"epoch": 13.0,
"eval_bertscore": 0.8399155983035429,
"eval_bleu": 12.055074755933749,
"eval_chrf": 37.05697877497987,
"eval_loss": 1.5998330116271973,
"eval_meteor": 0.3044430922426012,
"eval_runtime": 16.9656,
"eval_samples_per_second": 11.376,
"eval_steps_per_second": 1.474,
"step": 2522
},
{
"epoch": 13.144329896907216,
"grad_norm": 5.606310844421387,
"learning_rate": 1.2500954562810234e-05,
"loss": 0.5787,
"step": 2550
},
{
"epoch": 13.29896907216495,
"grad_norm": 8.899696350097656,
"learning_rate": 1.2386407025582284e-05,
"loss": 0.5501,
"step": 2580
},
{
"epoch": 13.45360824742268,
"grad_norm": 8.362021446228027,
"learning_rate": 1.2271859488354335e-05,
"loss": 0.5424,
"step": 2610
},
{
"epoch": 13.608247422680412,
"grad_norm": 10.882037162780762,
"learning_rate": 1.2157311951126384e-05,
"loss": 0.5862,
"step": 2640
},
{
"epoch": 13.762886597938145,
"grad_norm": 12.276626586914062,
"learning_rate": 1.2042764413898436e-05,
"loss": 0.5826,
"step": 2670
},
{
"epoch": 13.917525773195877,
"grad_norm": 9.603856086730957,
"learning_rate": 1.1928216876670487e-05,
"loss": 0.5707,
"step": 2700
},
{
"epoch": 14.0,
"eval_bertscore": 0.8436598345405697,
"eval_bleu": 11.251579914916128,
"eval_chrf": 37.531349075403156,
"eval_loss": 1.6205471754074097,
"eval_meteor": 0.3182256654670704,
"eval_runtime": 17.6418,
"eval_samples_per_second": 10.94,
"eval_steps_per_second": 1.417,
"step": 2716
},
{
"epoch": 14.072164948453608,
"grad_norm": 9.971912384033203,
"learning_rate": 1.1813669339442537e-05,
"loss": 0.5769,
"step": 2730
},
{
"epoch": 14.22680412371134,
"grad_norm": 8.942472457885742,
"learning_rate": 1.1699121802214586e-05,
"loss": 0.4995,
"step": 2760
},
{
"epoch": 14.381443298969073,
"grad_norm": 9.037988662719727,
"learning_rate": 1.1584574264986637e-05,
"loss": 0.4999,
"step": 2790
},
{
"epoch": 14.536082474226804,
"grad_norm": 8.85892391204834,
"learning_rate": 1.1470026727758687e-05,
"loss": 0.5076,
"step": 2820
},
{
"epoch": 14.690721649484535,
"grad_norm": 9.50616455078125,
"learning_rate": 1.1355479190530738e-05,
"loss": 0.5365,
"step": 2850
},
{
"epoch": 14.845360824742269,
"grad_norm": 9.276251792907715,
"learning_rate": 1.124093165330279e-05,
"loss": 0.5066,
"step": 2880
},
{
"epoch": 15.0,
"grad_norm": 16.51072120666504,
"learning_rate": 1.1126384116074837e-05,
"loss": 0.5758,
"step": 2910
},
{
"epoch": 15.0,
"eval_bertscore": 0.8425244194855962,
"eval_bleu": 10.088393701362467,
"eval_chrf": 37.05532016982362,
"eval_loss": 1.6258227825164795,
"eval_meteor": 0.31680299225747693,
"eval_runtime": 17.8883,
"eval_samples_per_second": 10.789,
"eval_steps_per_second": 1.398,
"step": 2910
},
{
"epoch": 15.154639175257731,
"grad_norm": 9.54076099395752,
"learning_rate": 1.1011836578846889e-05,
"loss": 0.4469,
"step": 2940
},
{
"epoch": 15.309278350515465,
"grad_norm": 11.035090446472168,
"learning_rate": 1.089728904161894e-05,
"loss": 0.4619,
"step": 2970
},
{
"epoch": 15.463917525773196,
"grad_norm": 9.248506546020508,
"learning_rate": 1.078274150439099e-05,
"loss": 0.4447,
"step": 3000
},
{
"epoch": 15.618556701030927,
"grad_norm": 9.639225959777832,
"learning_rate": 1.066819396716304e-05,
"loss": 0.5252,
"step": 3030
},
{
"epoch": 15.77319587628866,
"grad_norm": 8.671944618225098,
"learning_rate": 1.0553646429935092e-05,
"loss": 0.5055,
"step": 3060
},
{
"epoch": 15.927835051546392,
"grad_norm": 9.651355743408203,
"learning_rate": 1.043909889270714e-05,
"loss": 0.4863,
"step": 3090
},
{
"epoch": 16.0,
"eval_bertscore": 0.8411734397547233,
"eval_bleu": 12.028464196218437,
"eval_chrf": 38.28723917033567,
"eval_loss": 1.6226447820663452,
"eval_meteor": 0.31954241450547227,
"eval_runtime": 18.5681,
"eval_samples_per_second": 10.394,
"eval_steps_per_second": 1.346,
"step": 3104
},
{
"epoch": 16.082474226804123,
"grad_norm": 8.140876770019531,
"learning_rate": 1.0324551355479191e-05,
"loss": 0.4979,
"step": 3120
},
{
"epoch": 16.237113402061855,
"grad_norm": 9.587776184082031,
"learning_rate": 1.0210003818251242e-05,
"loss": 0.4148,
"step": 3150
},
{
"epoch": 16.391752577319586,
"grad_norm": 10.633879661560059,
"learning_rate": 1.0095456281023292e-05,
"loss": 0.4426,
"step": 3180
},
{
"epoch": 16.54639175257732,
"grad_norm": 10.271921157836914,
"learning_rate": 9.980908743795342e-06,
"loss": 0.4568,
"step": 3210
},
{
"epoch": 16.701030927835053,
"grad_norm": 10.862954139709473,
"learning_rate": 9.866361206567393e-06,
"loss": 0.4211,
"step": 3240
},
{
"epoch": 16.855670103092784,
"grad_norm": 9.494423866271973,
"learning_rate": 9.751813669339444e-06,
"loss": 0.4588,
"step": 3270
},
{
"epoch": 17.0,
"eval_bertscore": 0.844244998662583,
"eval_bleu": 12.636168876478752,
"eval_chrf": 39.322891666892936,
"eval_loss": 1.6341180801391602,
"eval_meteor": 0.33544973163777175,
"eval_runtime": 17.7098,
"eval_samples_per_second": 10.898,
"eval_steps_per_second": 1.412,
"step": 3298
},
{
"epoch": 17.010309278350515,
"grad_norm": 8.34636116027832,
"learning_rate": 9.637266132111494e-06,
"loss": 0.4427,
"step": 3300
},
{
"epoch": 17.164948453608247,
"grad_norm": 9.896439552307129,
"learning_rate": 9.522718594883545e-06,
"loss": 0.393,
"step": 3330
},
{
"epoch": 17.31958762886598,
"grad_norm": 8.447748184204102,
"learning_rate": 9.408171057655595e-06,
"loss": 0.4072,
"step": 3360
},
{
"epoch": 17.47422680412371,
"grad_norm": 8.587246894836426,
"learning_rate": 9.293623520427644e-06,
"loss": 0.3783,
"step": 3390
},
{
"epoch": 17.628865979381445,
"grad_norm": 8.51424503326416,
"learning_rate": 9.179075983199695e-06,
"loss": 0.3923,
"step": 3420
},
{
"epoch": 17.783505154639176,
"grad_norm": 11.139188766479492,
"learning_rate": 9.064528445971745e-06,
"loss": 0.414,
"step": 3450
},
{
"epoch": 17.938144329896907,
"grad_norm": 10.412823677062988,
"learning_rate": 8.949980908743796e-06,
"loss": 0.4256,
"step": 3480
},
{
"epoch": 18.0,
"eval_bertscore": 0.8427423143016242,
"eval_bleu": 10.39081838124178,
"eval_chrf": 38.315665164919935,
"eval_loss": 1.651857852935791,
"eval_meteor": 0.3235056356864544,
"eval_runtime": 18.083,
"eval_samples_per_second": 10.673,
"eval_steps_per_second": 1.383,
"step": 3492
},
{
"epoch": 18.09278350515464,
"grad_norm": 7.963134288787842,
"learning_rate": 8.835433371515847e-06,
"loss": 0.3509,
"step": 3510
},
{
"epoch": 18.24742268041237,
"grad_norm": 6.555767059326172,
"learning_rate": 8.720885834287897e-06,
"loss": 0.3438,
"step": 3540
},
{
"epoch": 18.4020618556701,
"grad_norm": 9.116894721984863,
"learning_rate": 8.606338297059947e-06,
"loss": 0.3634,
"step": 3570
},
{
"epoch": 18.556701030927837,
"grad_norm": 8.772259712219238,
"learning_rate": 8.491790759831998e-06,
"loss": 0.3688,
"step": 3600
},
{
"epoch": 18.711340206185568,
"grad_norm": 6.532469272613525,
"learning_rate": 8.377243222604047e-06,
"loss": 0.3826,
"step": 3630
},
{
"epoch": 18.8659793814433,
"grad_norm": 8.094025611877441,
"learning_rate": 8.262695685376099e-06,
"loss": 0.4,
"step": 3660
},
{
"epoch": 19.0,
"eval_bertscore": 0.8423587293822531,
"eval_bleu": 12.487375649363784,
"eval_chrf": 39.54931349514667,
"eval_loss": 1.660538673400879,
"eval_meteor": 0.32780584893530307,
"eval_runtime": 19.1569,
"eval_samples_per_second": 10.075,
"eval_steps_per_second": 1.305,
"step": 3686
},
{
"epoch": 19.02061855670103,
"grad_norm": 6.79367733001709,
"learning_rate": 8.148148148148148e-06,
"loss": 0.3852,
"step": 3690
},
{
"epoch": 19.175257731958762,
"grad_norm": 9.372544288635254,
"learning_rate": 8.0336006109202e-06,
"loss": 0.3319,
"step": 3720
},
{
"epoch": 19.329896907216494,
"grad_norm": 10.440468788146973,
"learning_rate": 7.91905307369225e-06,
"loss": 0.3565,
"step": 3750
},
{
"epoch": 19.484536082474225,
"grad_norm": 8.199675559997559,
"learning_rate": 7.8045055364643e-06,
"loss": 0.3275,
"step": 3780
},
{
"epoch": 19.63917525773196,
"grad_norm": 9.151398658752441,
"learning_rate": 7.68995799923635e-06,
"loss": 0.3809,
"step": 3810
},
{
"epoch": 19.79381443298969,
"grad_norm": 8.963874816894531,
"learning_rate": 7.575410462008401e-06,
"loss": 0.3046,
"step": 3840
},
{
"epoch": 19.948453608247423,
"grad_norm": 7.874151229858398,
"learning_rate": 7.460862924780451e-06,
"loss": 0.3521,
"step": 3870
},
{
"epoch": 20.0,
"eval_bertscore": 0.8462644858681476,
"eval_bleu": 11.879411636317712,
"eval_chrf": 40.114348533135825,
"eval_loss": 1.6695095300674438,
"eval_meteor": 0.33837011315826326,
"eval_runtime": 17.5347,
"eval_samples_per_second": 11.007,
"eval_steps_per_second": 1.426,
"step": 3880
},
{
"epoch": 20.103092783505154,
"grad_norm": 6.499141216278076,
"learning_rate": 7.346315387552502e-06,
"loss": 0.3306,
"step": 3900
},
{
"epoch": 20.257731958762886,
"grad_norm": 6.233891487121582,
"learning_rate": 7.231767850324552e-06,
"loss": 0.3199,
"step": 3930
},
{
"epoch": 20.412371134020617,
"grad_norm": 9.419313430786133,
"learning_rate": 7.117220313096602e-06,
"loss": 0.3009,
"step": 3960
},
{
"epoch": 20.567010309278352,
"grad_norm": 9.547579765319824,
"learning_rate": 7.002672775868653e-06,
"loss": 0.3036,
"step": 3990
},
{
"epoch": 20.721649484536083,
"grad_norm": 6.532684326171875,
"learning_rate": 6.888125238640703e-06,
"loss": 0.322,
"step": 4020
},
{
"epoch": 20.876288659793815,
"grad_norm": 8.454936027526855,
"learning_rate": 6.773577701412753e-06,
"loss": 0.3298,
"step": 4050
},
{
"epoch": 21.0,
"eval_bertscore": 0.843647470128351,
"eval_bleu": 12.22598647677628,
"eval_chrf": 39.967488522101775,
"eval_loss": 1.6959513425827026,
"eval_meteor": 0.334625348793614,
"eval_runtime": 17.9122,
"eval_samples_per_second": 10.775,
"eval_steps_per_second": 1.396,
"step": 4074
},
{
"epoch": 21.030927835051546,
"grad_norm": 7.442008018493652,
"learning_rate": 6.659030164184805e-06,
"loss": 0.3098,
"step": 4080
},
{
"epoch": 21.185567010309278,
"grad_norm": 9.09302043914795,
"learning_rate": 6.544482626956854e-06,
"loss": 0.3093,
"step": 4110
},
{
"epoch": 21.34020618556701,
"grad_norm": 7.801342010498047,
"learning_rate": 6.429935089728905e-06,
"loss": 0.3066,
"step": 4140
},
{
"epoch": 21.49484536082474,
"grad_norm": 7.818614482879639,
"learning_rate": 6.315387552500956e-06,
"loss": 0.2984,
"step": 4170
},
{
"epoch": 21.649484536082475,
"grad_norm": 8.459864616394043,
"learning_rate": 6.2008400152730055e-06,
"loss": 0.2809,
"step": 4200
},
{
"epoch": 21.804123711340207,
"grad_norm": 8.437562942504883,
"learning_rate": 6.086292478045056e-06,
"loss": 0.2973,
"step": 4230
},
{
"epoch": 21.95876288659794,
"grad_norm": 10.7759428024292,
"learning_rate": 5.9717449408171055e-06,
"loss": 0.3029,
"step": 4260
},
{
"epoch": 22.0,
"eval_bertscore": 0.8437702862709915,
"eval_bleu": 11.328363034379192,
"eval_chrf": 40.31840295732892,
"eval_loss": 1.697576880455017,
"eval_meteor": 0.33887718936757705,
"eval_runtime": 18.6408,
"eval_samples_per_second": 10.354,
"eval_steps_per_second": 1.341,
"step": 4268
},
{
"epoch": 22.0,
"step": 4268,
"total_flos": 232218100629504.0,
"train_loss": 1.1187503173626128,
"train_runtime": 1520.2415,
"train_samples_per_second": 30.528,
"train_steps_per_second": 3.828
}
],
"logging_steps": 30,
"max_steps": 5820,
"num_input_tokens_seen": 0,
"num_train_epochs": 30,
"save_steps": 500,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 5
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 232218100629504.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}