Instructions to use thunderboltc/marianmt-santali-sanlish-to-bangla_normalSplit with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use thunderboltc/marianmt-santali-sanlish-to-bangla_normalSplit with Transformers:
# Load model directly from transformers import AutoTokenizer, AutoModelForSeq2SeqLM tokenizer = AutoTokenizer.from_pretrained("thunderboltc/marianmt-santali-sanlish-to-bangla_normalSplit") model = AutoModelForSeq2SeqLM.from_pretrained("thunderboltc/marianmt-santali-sanlish-to-bangla_normalSplit", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": 12.636168876478752, | |
| "best_model_checkpoint": "/content/marianmt-santali-sanlish-to-bangla/checkpoint-3298", | |
| "epoch": 22.0, | |
| "eval_steps": 500, | |
| "global_step": 4268, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.15463917525773196, | |
| "grad_norm": 43.064876556396484, | |
| "learning_rate": 8.93470790378007e-07, | |
| "loss": 8.0531, | |
| "step": 30 | |
| }, | |
| { | |
| "epoch": 0.30927835051546393, | |
| "grad_norm": 38.152244567871094, | |
| "learning_rate": 1.9243986254295534e-06, | |
| "loss": 6.8732, | |
| "step": 60 | |
| }, | |
| { | |
| "epoch": 0.4639175257731959, | |
| "grad_norm": 20.582117080688477, | |
| "learning_rate": 2.9553264604811e-06, | |
| "loss": 4.9163, | |
| "step": 90 | |
| }, | |
| { | |
| "epoch": 0.6185567010309279, | |
| "grad_norm": 13.089325904846191, | |
| "learning_rate": 3.986254295532647e-06, | |
| "loss": 3.381, | |
| "step": 120 | |
| }, | |
| { | |
| "epoch": 0.7731958762886598, | |
| "grad_norm": 12.60307502746582, | |
| "learning_rate": 5.017182130584193e-06, | |
| "loss": 3.0247, | |
| "step": 150 | |
| }, | |
| { | |
| "epoch": 0.9278350515463918, | |
| "grad_norm": 12.468002319335938, | |
| "learning_rate": 6.048109965635739e-06, | |
| "loss": 2.942, | |
| "step": 180 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_bertscore": 0.7088343220053559, | |
| "eval_bleu": 0.3864012583347095, | |
| "eval_chrf": 10.09476116429599, | |
| "eval_loss": 2.6114141941070557, | |
| "eval_meteor": 0.028841924396372502, | |
| "eval_runtime": 38.0618, | |
| "eval_samples_per_second": 5.071, | |
| "eval_steps_per_second": 0.657, | |
| "step": 194 | |
| }, | |
| { | |
| "epoch": 1.0824742268041236, | |
| "grad_norm": 10.807812690734863, | |
| "learning_rate": 7.079037800687286e-06, | |
| "loss": 2.6762, | |
| "step": 210 | |
| }, | |
| { | |
| "epoch": 1.2371134020618557, | |
| "grad_norm": 10.950024604797363, | |
| "learning_rate": 8.109965635738832e-06, | |
| "loss": 2.6531, | |
| "step": 240 | |
| }, | |
| { | |
| "epoch": 1.3917525773195876, | |
| "grad_norm": 9.422192573547363, | |
| "learning_rate": 9.140893470790379e-06, | |
| "loss": 2.5974, | |
| "step": 270 | |
| }, | |
| { | |
| "epoch": 1.5463917525773194, | |
| "grad_norm": 14.578783988952637, | |
| "learning_rate": 1.0171821305841924e-05, | |
| "loss": 2.6236, | |
| "step": 300 | |
| }, | |
| { | |
| "epoch": 1.7010309278350515, | |
| "grad_norm": 13.789867401123047, | |
| "learning_rate": 1.1202749140893473e-05, | |
| "loss": 2.4943, | |
| "step": 330 | |
| }, | |
| { | |
| "epoch": 1.8556701030927836, | |
| "grad_norm": 12.978485107421875, | |
| "learning_rate": 1.223367697594502e-05, | |
| "loss": 2.5078, | |
| "step": 360 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_bertscore": 0.7392782556578286, | |
| "eval_bleu": 0.46239407700960067, | |
| "eval_chrf": 12.818734803935335, | |
| "eval_loss": 2.2853775024414062, | |
| "eval_meteor": 0.048241173739640195, | |
| "eval_runtime": 18.2718, | |
| "eval_samples_per_second": 10.563, | |
| "eval_steps_per_second": 1.368, | |
| "step": 388 | |
| }, | |
| { | |
| "epoch": 2.0103092783505154, | |
| "grad_norm": 10.923307418823242, | |
| "learning_rate": 1.3264604810996563e-05, | |
| "loss": 2.4348, | |
| "step": 390 | |
| }, | |
| { | |
| "epoch": 2.1649484536082473, | |
| "grad_norm": 11.970940589904785, | |
| "learning_rate": 1.4295532646048112e-05, | |
| "loss": 2.3111, | |
| "step": 420 | |
| }, | |
| { | |
| "epoch": 2.319587628865979, | |
| "grad_norm": 13.831852912902832, | |
| "learning_rate": 1.5326460481099657e-05, | |
| "loss": 2.278, | |
| "step": 450 | |
| }, | |
| { | |
| "epoch": 2.4742268041237114, | |
| "grad_norm": 13.530282974243164, | |
| "learning_rate": 1.6357388316151203e-05, | |
| "loss": 2.3752, | |
| "step": 480 | |
| }, | |
| { | |
| "epoch": 2.6288659793814433, | |
| "grad_norm": 13.126559257507324, | |
| "learning_rate": 1.738831615120275e-05, | |
| "loss": 2.1868, | |
| "step": 510 | |
| }, | |
| { | |
| "epoch": 2.783505154639175, | |
| "grad_norm": 11.856134414672852, | |
| "learning_rate": 1.8419243986254297e-05, | |
| "loss": 2.1822, | |
| "step": 540 | |
| }, | |
| { | |
| "epoch": 2.9381443298969074, | |
| "grad_norm": 9.861915588378906, | |
| "learning_rate": 1.9450171821305842e-05, | |
| "loss": 2.1383, | |
| "step": 570 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_bertscore": 0.7664902392446686, | |
| "eval_bleu": 1.820820260915908, | |
| "eval_chrf": 18.54167447294365, | |
| "eval_loss": 2.055220603942871, | |
| "eval_meteor": 0.11437707653982947, | |
| "eval_runtime": 18.6431, | |
| "eval_samples_per_second": 10.352, | |
| "eval_steps_per_second": 1.341, | |
| "step": 582 | |
| }, | |
| { | |
| "epoch": 3.0927835051546393, | |
| "grad_norm": 8.970413208007812, | |
| "learning_rate": 1.994654448262696e-05, | |
| "loss": 2.0298, | |
| "step": 600 | |
| }, | |
| { | |
| "epoch": 3.247422680412371, | |
| "grad_norm": 11.038900375366211, | |
| "learning_rate": 1.9831996945399007e-05, | |
| "loss": 1.8987, | |
| "step": 630 | |
| }, | |
| { | |
| "epoch": 3.402061855670103, | |
| "grad_norm": 9.999340057373047, | |
| "learning_rate": 1.9717449408171058e-05, | |
| "loss": 1.943, | |
| "step": 660 | |
| }, | |
| { | |
| "epoch": 3.556701030927835, | |
| "grad_norm": 11.228028297424316, | |
| "learning_rate": 1.960290187094311e-05, | |
| "loss": 1.9018, | |
| "step": 690 | |
| }, | |
| { | |
| "epoch": 3.711340206185567, | |
| "grad_norm": 14.46988296508789, | |
| "learning_rate": 1.948835433371516e-05, | |
| "loss": 1.916, | |
| "step": 720 | |
| }, | |
| { | |
| "epoch": 3.865979381443299, | |
| "grad_norm": 13.187897682189941, | |
| "learning_rate": 1.9373806796487212e-05, | |
| "loss": 1.9096, | |
| "step": 750 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_bertscore": 0.7867915055912393, | |
| "eval_bleu": 3.1417647965851434, | |
| "eval_chrf": 21.794103049706337, | |
| "eval_loss": 1.8877290487289429, | |
| "eval_meteor": 0.15566352755949234, | |
| "eval_runtime": 17.9807, | |
| "eval_samples_per_second": 10.734, | |
| "eval_steps_per_second": 1.39, | |
| "step": 776 | |
| }, | |
| { | |
| "epoch": 4.020618556701031, | |
| "grad_norm": 9.245710372924805, | |
| "learning_rate": 1.925925925925926e-05, | |
| "loss": 1.8022, | |
| "step": 780 | |
| }, | |
| { | |
| "epoch": 4.175257731958763, | |
| "grad_norm": 12.707769393920898, | |
| "learning_rate": 1.914471172203131e-05, | |
| "loss": 1.7105, | |
| "step": 810 | |
| }, | |
| { | |
| "epoch": 4.329896907216495, | |
| "grad_norm": 13.76497745513916, | |
| "learning_rate": 1.9030164184803362e-05, | |
| "loss": 1.7098, | |
| "step": 840 | |
| }, | |
| { | |
| "epoch": 4.484536082474227, | |
| "grad_norm": 12.652901649475098, | |
| "learning_rate": 1.8915616647575414e-05, | |
| "loss": 1.6128, | |
| "step": 870 | |
| }, | |
| { | |
| "epoch": 4.639175257731958, | |
| "grad_norm": 14.508373260498047, | |
| "learning_rate": 1.880106911034746e-05, | |
| "loss": 1.6844, | |
| "step": 900 | |
| }, | |
| { | |
| "epoch": 4.793814432989691, | |
| "grad_norm": 10.372153282165527, | |
| "learning_rate": 1.8686521573119513e-05, | |
| "loss": 1.5839, | |
| "step": 930 | |
| }, | |
| { | |
| "epoch": 4.948453608247423, | |
| "grad_norm": 10.381881713867188, | |
| "learning_rate": 1.857197403589156e-05, | |
| "loss": 1.5992, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_bertscore": 0.8009231167753743, | |
| "eval_bleu": 5.107916225528083, | |
| "eval_chrf": 27.109939343296112, | |
| "eval_loss": 1.7559988498687744, | |
| "eval_meteor": 0.20502396164700096, | |
| "eval_runtime": 19.6434, | |
| "eval_samples_per_second": 9.825, | |
| "eval_steps_per_second": 1.273, | |
| "step": 970 | |
| }, | |
| { | |
| "epoch": 5.103092783505154, | |
| "grad_norm": 9.559462547302246, | |
| "learning_rate": 1.8457426498663612e-05, | |
| "loss": 1.4874, | |
| "step": 990 | |
| }, | |
| { | |
| "epoch": 5.257731958762887, | |
| "grad_norm": 10.890524864196777, | |
| "learning_rate": 1.8342878961435663e-05, | |
| "loss": 1.4588, | |
| "step": 1020 | |
| }, | |
| { | |
| "epoch": 5.412371134020619, | |
| "grad_norm": 10.118521690368652, | |
| "learning_rate": 1.8228331424207715e-05, | |
| "loss": 1.4945, | |
| "step": 1050 | |
| }, | |
| { | |
| "epoch": 5.56701030927835, | |
| "grad_norm": 12.269123077392578, | |
| "learning_rate": 1.8113783886979766e-05, | |
| "loss": 1.4544, | |
| "step": 1080 | |
| }, | |
| { | |
| "epoch": 5.721649484536083, | |
| "grad_norm": 9.705910682678223, | |
| "learning_rate": 1.7999236349751814e-05, | |
| "loss": 1.4013, | |
| "step": 1110 | |
| }, | |
| { | |
| "epoch": 5.876288659793815, | |
| "grad_norm": 10.108024597167969, | |
| "learning_rate": 1.7884688812523865e-05, | |
| "loss": 1.3569, | |
| "step": 1140 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_bertscore": 0.8189008788741314, | |
| "eval_bleu": 7.80196732700183, | |
| "eval_chrf": 31.07771783943801, | |
| "eval_loss": 1.6978754997253418, | |
| "eval_meteor": 0.2476381272119835, | |
| "eval_runtime": 17.9742, | |
| "eval_samples_per_second": 10.738, | |
| "eval_steps_per_second": 1.391, | |
| "step": 1164 | |
| }, | |
| { | |
| "epoch": 6.030927835051546, | |
| "grad_norm": 10.195992469787598, | |
| "learning_rate": 1.7770141275295916e-05, | |
| "loss": 1.4165, | |
| "step": 1170 | |
| }, | |
| { | |
| "epoch": 6.185567010309279, | |
| "grad_norm": 10.022723197937012, | |
| "learning_rate": 1.7655593738067968e-05, | |
| "loss": 1.2383, | |
| "step": 1200 | |
| }, | |
| { | |
| "epoch": 6.34020618556701, | |
| "grad_norm": 11.431436538696289, | |
| "learning_rate": 1.754104620084002e-05, | |
| "loss": 1.3013, | |
| "step": 1230 | |
| }, | |
| { | |
| "epoch": 6.494845360824742, | |
| "grad_norm": 11.689397811889648, | |
| "learning_rate": 1.7426498663612067e-05, | |
| "loss": 1.2412, | |
| "step": 1260 | |
| }, | |
| { | |
| "epoch": 6.649484536082475, | |
| "grad_norm": 11.549187660217285, | |
| "learning_rate": 1.7311951126384118e-05, | |
| "loss": 1.237, | |
| "step": 1290 | |
| }, | |
| { | |
| "epoch": 6.804123711340206, | |
| "grad_norm": 11.665675163269043, | |
| "learning_rate": 1.7197403589156166e-05, | |
| "loss": 1.2955, | |
| "step": 1320 | |
| }, | |
| { | |
| "epoch": 6.958762886597938, | |
| "grad_norm": 13.438718795776367, | |
| "learning_rate": 1.7082856051928217e-05, | |
| "loss": 1.195, | |
| "step": 1350 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_bertscore": 0.8185995718358094, | |
| "eval_bleu": 9.031051320914116, | |
| "eval_chrf": 30.344158100165018, | |
| "eval_loss": 1.6532801389694214, | |
| "eval_meteor": 0.24965221252933717, | |
| "eval_runtime": 17.6222, | |
| "eval_samples_per_second": 10.952, | |
| "eval_steps_per_second": 1.419, | |
| "step": 1358 | |
| }, | |
| { | |
| "epoch": 7.11340206185567, | |
| "grad_norm": 9.628753662109375, | |
| "learning_rate": 1.696830851470027e-05, | |
| "loss": 1.1824, | |
| "step": 1380 | |
| }, | |
| { | |
| "epoch": 7.268041237113402, | |
| "grad_norm": 15.119050025939941, | |
| "learning_rate": 1.685376097747232e-05, | |
| "loss": 1.0789, | |
| "step": 1410 | |
| }, | |
| { | |
| "epoch": 7.422680412371134, | |
| "grad_norm": 10.973334312438965, | |
| "learning_rate": 1.6739213440244368e-05, | |
| "loss": 1.1213, | |
| "step": 1440 | |
| }, | |
| { | |
| "epoch": 7.577319587628866, | |
| "grad_norm": 9.850281715393066, | |
| "learning_rate": 1.662466590301642e-05, | |
| "loss": 1.0941, | |
| "step": 1470 | |
| }, | |
| { | |
| "epoch": 7.731958762886598, | |
| "grad_norm": 10.67463207244873, | |
| "learning_rate": 1.651011836578847e-05, | |
| "loss": 1.0986, | |
| "step": 1500 | |
| }, | |
| { | |
| "epoch": 7.88659793814433, | |
| "grad_norm": 11.185319900512695, | |
| "learning_rate": 1.639557082856052e-05, | |
| "loss": 1.1345, | |
| "step": 1530 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "eval_bertscore": 0.8248441731991546, | |
| "eval_bleu": 9.326651170754813, | |
| "eval_chrf": 32.19041027207769, | |
| "eval_loss": 1.6205072402954102, | |
| "eval_meteor": 0.2731252078182265, | |
| "eval_runtime": 19.0403, | |
| "eval_samples_per_second": 10.136, | |
| "eval_steps_per_second": 1.313, | |
| "step": 1552 | |
| }, | |
| { | |
| "epoch": 8.041237113402062, | |
| "grad_norm": 9.956164360046387, | |
| "learning_rate": 1.6281023291332573e-05, | |
| "loss": 1.0352, | |
| "step": 1560 | |
| }, | |
| { | |
| "epoch": 8.195876288659793, | |
| "grad_norm": 13.017486572265625, | |
| "learning_rate": 1.6166475754104624e-05, | |
| "loss": 1.0962, | |
| "step": 1590 | |
| }, | |
| { | |
| "epoch": 8.350515463917526, | |
| "grad_norm": 12.15532398223877, | |
| "learning_rate": 1.6051928216876672e-05, | |
| "loss": 0.9943, | |
| "step": 1620 | |
| }, | |
| { | |
| "epoch": 8.505154639175258, | |
| "grad_norm": 11.221367835998535, | |
| "learning_rate": 1.5937380679648723e-05, | |
| "loss": 0.9336, | |
| "step": 1650 | |
| }, | |
| { | |
| "epoch": 8.65979381443299, | |
| "grad_norm": 10.390768051147461, | |
| "learning_rate": 1.5822833142420774e-05, | |
| "loss": 0.9942, | |
| "step": 1680 | |
| }, | |
| { | |
| "epoch": 8.814432989690722, | |
| "grad_norm": 10.396700859069824, | |
| "learning_rate": 1.5708285605192822e-05, | |
| "loss": 0.9616, | |
| "step": 1710 | |
| }, | |
| { | |
| "epoch": 8.969072164948454, | |
| "grad_norm": 8.77428913116455, | |
| "learning_rate": 1.5593738067964873e-05, | |
| "loss": 0.9529, | |
| "step": 1740 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "eval_bertscore": 0.8292578412461157, | |
| "eval_bleu": 9.64249962743433, | |
| "eval_chrf": 33.6951161128342, | |
| "eval_loss": 1.6319836378097534, | |
| "eval_meteor": 0.2765792548974407, | |
| "eval_runtime": 17.0212, | |
| "eval_samples_per_second": 11.339, | |
| "eval_steps_per_second": 1.469, | |
| "step": 1746 | |
| }, | |
| { | |
| "epoch": 9.123711340206185, | |
| "grad_norm": 8.413101196289062, | |
| "learning_rate": 1.547919053073692e-05, | |
| "loss": 0.9516, | |
| "step": 1770 | |
| }, | |
| { | |
| "epoch": 9.278350515463918, | |
| "grad_norm": 10.946271896362305, | |
| "learning_rate": 1.5364642993508973e-05, | |
| "loss": 0.8993, | |
| "step": 1800 | |
| }, | |
| { | |
| "epoch": 9.43298969072165, | |
| "grad_norm": 9.253824234008789, | |
| "learning_rate": 1.5250095456281024e-05, | |
| "loss": 0.8545, | |
| "step": 1830 | |
| }, | |
| { | |
| "epoch": 9.587628865979381, | |
| "grad_norm": 9.479711532592773, | |
| "learning_rate": 1.5135547919053075e-05, | |
| "loss": 0.845, | |
| "step": 1860 | |
| }, | |
| { | |
| "epoch": 9.742268041237114, | |
| "grad_norm": 12.220168113708496, | |
| "learning_rate": 1.5021000381825126e-05, | |
| "loss": 0.8806, | |
| "step": 1890 | |
| }, | |
| { | |
| "epoch": 9.896907216494846, | |
| "grad_norm": 13.171895027160645, | |
| "learning_rate": 1.4906452844597176e-05, | |
| "loss": 0.9436, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "eval_bertscore": 0.8355941355537256, | |
| "eval_bleu": 9.50918164746798, | |
| "eval_chrf": 33.972073061006306, | |
| "eval_loss": 1.590855598449707, | |
| "eval_meteor": 0.29613551946552397, | |
| "eval_runtime": 18.4791, | |
| "eval_samples_per_second": 10.444, | |
| "eval_steps_per_second": 1.353, | |
| "step": 1940 | |
| }, | |
| { | |
| "epoch": 10.051546391752577, | |
| "grad_norm": 8.509225845336914, | |
| "learning_rate": 1.4791905307369226e-05, | |
| "loss": 0.8198, | |
| "step": 1950 | |
| }, | |
| { | |
| "epoch": 10.206185567010309, | |
| "grad_norm": 11.032247543334961, | |
| "learning_rate": 1.4677357770141277e-05, | |
| "loss": 0.7803, | |
| "step": 1980 | |
| }, | |
| { | |
| "epoch": 10.360824742268042, | |
| "grad_norm": 12.89780330657959, | |
| "learning_rate": 1.4562810232913326e-05, | |
| "loss": 0.7791, | |
| "step": 2010 | |
| }, | |
| { | |
| "epoch": 10.515463917525773, | |
| "grad_norm": 11.072964668273926, | |
| "learning_rate": 1.4448262695685378e-05, | |
| "loss": 0.7733, | |
| "step": 2040 | |
| }, | |
| { | |
| "epoch": 10.670103092783505, | |
| "grad_norm": 9.430943489074707, | |
| "learning_rate": 1.4333715158457429e-05, | |
| "loss": 0.8057, | |
| "step": 2070 | |
| }, | |
| { | |
| "epoch": 10.824742268041238, | |
| "grad_norm": 10.810933113098145, | |
| "learning_rate": 1.4219167621229477e-05, | |
| "loss": 0.7735, | |
| "step": 2100 | |
| }, | |
| { | |
| "epoch": 10.97938144329897, | |
| "grad_norm": 11.854232788085938, | |
| "learning_rate": 1.4104620084001528e-05, | |
| "loss": 0.7791, | |
| "step": 2130 | |
| }, | |
| { | |
| "epoch": 11.0, | |
| "eval_bertscore": 0.8363540237431699, | |
| "eval_bleu": 8.223251531908238, | |
| "eval_chrf": 35.20734927484783, | |
| "eval_loss": 1.6085046529769897, | |
| "eval_meteor": 0.30757486063481376, | |
| "eval_runtime": 17.4256, | |
| "eval_samples_per_second": 11.076, | |
| "eval_steps_per_second": 1.435, | |
| "step": 2134 | |
| }, | |
| { | |
| "epoch": 11.1340206185567, | |
| "grad_norm": 11.463648796081543, | |
| "learning_rate": 1.399007254677358e-05, | |
| "loss": 0.7283, | |
| "step": 2160 | |
| }, | |
| { | |
| "epoch": 11.288659793814434, | |
| "grad_norm": 11.482135772705078, | |
| "learning_rate": 1.3875525009545629e-05, | |
| "loss": 0.6976, | |
| "step": 2190 | |
| }, | |
| { | |
| "epoch": 11.443298969072165, | |
| "grad_norm": 10.873443603515625, | |
| "learning_rate": 1.376097747231768e-05, | |
| "loss": 0.6903, | |
| "step": 2220 | |
| }, | |
| { | |
| "epoch": 11.597938144329897, | |
| "grad_norm": 10.436446189880371, | |
| "learning_rate": 1.3646429935089731e-05, | |
| "loss": 0.7193, | |
| "step": 2250 | |
| }, | |
| { | |
| "epoch": 11.75257731958763, | |
| "grad_norm": 11.538565635681152, | |
| "learning_rate": 1.353188239786178e-05, | |
| "loss": 0.758, | |
| "step": 2280 | |
| }, | |
| { | |
| "epoch": 11.907216494845361, | |
| "grad_norm": 9.299684524536133, | |
| "learning_rate": 1.341733486063383e-05, | |
| "loss": 0.7079, | |
| "step": 2310 | |
| }, | |
| { | |
| "epoch": 12.0, | |
| "eval_bertscore": 0.8390595162470724, | |
| "eval_bleu": 10.159345704590937, | |
| "eval_chrf": 35.84953170957151, | |
| "eval_loss": 1.6416338682174683, | |
| "eval_meteor": 0.2972449850354188, | |
| "eval_runtime": 17.9183, | |
| "eval_samples_per_second": 10.771, | |
| "eval_steps_per_second": 1.395, | |
| "step": 2328 | |
| }, | |
| { | |
| "epoch": 12.061855670103093, | |
| "grad_norm": 7.964834213256836, | |
| "learning_rate": 1.3302787323405882e-05, | |
| "loss": 0.6567, | |
| "step": 2340 | |
| }, | |
| { | |
| "epoch": 12.216494845360824, | |
| "grad_norm": 9.399768829345703, | |
| "learning_rate": 1.3188239786177931e-05, | |
| "loss": 0.6519, | |
| "step": 2370 | |
| }, | |
| { | |
| "epoch": 12.371134020618557, | |
| "grad_norm": 8.637943267822266, | |
| "learning_rate": 1.3073692248949983e-05, | |
| "loss": 0.6493, | |
| "step": 2400 | |
| }, | |
| { | |
| "epoch": 12.525773195876289, | |
| "grad_norm": 9.09426498413086, | |
| "learning_rate": 1.2959144711722032e-05, | |
| "loss": 0.6101, | |
| "step": 2430 | |
| }, | |
| { | |
| "epoch": 12.68041237113402, | |
| "grad_norm": 9.642086029052734, | |
| "learning_rate": 1.2844597174494082e-05, | |
| "loss": 0.6739, | |
| "step": 2460 | |
| }, | |
| { | |
| "epoch": 12.835051546391753, | |
| "grad_norm": 10.607096672058105, | |
| "learning_rate": 1.2730049637266133e-05, | |
| "loss": 0.6254, | |
| "step": 2490 | |
| }, | |
| { | |
| "epoch": 12.989690721649485, | |
| "grad_norm": 8.394698143005371, | |
| "learning_rate": 1.2615502100038184e-05, | |
| "loss": 0.6302, | |
| "step": 2520 | |
| }, | |
| { | |
| "epoch": 13.0, | |
| "eval_bertscore": 0.8399155983035429, | |
| "eval_bleu": 12.055074755933749, | |
| "eval_chrf": 37.05697877497987, | |
| "eval_loss": 1.5998330116271973, | |
| "eval_meteor": 0.3044430922426012, | |
| "eval_runtime": 16.9656, | |
| "eval_samples_per_second": 11.376, | |
| "eval_steps_per_second": 1.474, | |
| "step": 2522 | |
| }, | |
| { | |
| "epoch": 13.144329896907216, | |
| "grad_norm": 5.606310844421387, | |
| "learning_rate": 1.2500954562810234e-05, | |
| "loss": 0.5787, | |
| "step": 2550 | |
| }, | |
| { | |
| "epoch": 13.29896907216495, | |
| "grad_norm": 8.899696350097656, | |
| "learning_rate": 1.2386407025582284e-05, | |
| "loss": 0.5501, | |
| "step": 2580 | |
| }, | |
| { | |
| "epoch": 13.45360824742268, | |
| "grad_norm": 8.362021446228027, | |
| "learning_rate": 1.2271859488354335e-05, | |
| "loss": 0.5424, | |
| "step": 2610 | |
| }, | |
| { | |
| "epoch": 13.608247422680412, | |
| "grad_norm": 10.882037162780762, | |
| "learning_rate": 1.2157311951126384e-05, | |
| "loss": 0.5862, | |
| "step": 2640 | |
| }, | |
| { | |
| "epoch": 13.762886597938145, | |
| "grad_norm": 12.276626586914062, | |
| "learning_rate": 1.2042764413898436e-05, | |
| "loss": 0.5826, | |
| "step": 2670 | |
| }, | |
| { | |
| "epoch": 13.917525773195877, | |
| "grad_norm": 9.603856086730957, | |
| "learning_rate": 1.1928216876670487e-05, | |
| "loss": 0.5707, | |
| "step": 2700 | |
| }, | |
| { | |
| "epoch": 14.0, | |
| "eval_bertscore": 0.8436598345405697, | |
| "eval_bleu": 11.251579914916128, | |
| "eval_chrf": 37.531349075403156, | |
| "eval_loss": 1.6205471754074097, | |
| "eval_meteor": 0.3182256654670704, | |
| "eval_runtime": 17.6418, | |
| "eval_samples_per_second": 10.94, | |
| "eval_steps_per_second": 1.417, | |
| "step": 2716 | |
| }, | |
| { | |
| "epoch": 14.072164948453608, | |
| "grad_norm": 9.971912384033203, | |
| "learning_rate": 1.1813669339442537e-05, | |
| "loss": 0.5769, | |
| "step": 2730 | |
| }, | |
| { | |
| "epoch": 14.22680412371134, | |
| "grad_norm": 8.942472457885742, | |
| "learning_rate": 1.1699121802214586e-05, | |
| "loss": 0.4995, | |
| "step": 2760 | |
| }, | |
| { | |
| "epoch": 14.381443298969073, | |
| "grad_norm": 9.037988662719727, | |
| "learning_rate": 1.1584574264986637e-05, | |
| "loss": 0.4999, | |
| "step": 2790 | |
| }, | |
| { | |
| "epoch": 14.536082474226804, | |
| "grad_norm": 8.85892391204834, | |
| "learning_rate": 1.1470026727758687e-05, | |
| "loss": 0.5076, | |
| "step": 2820 | |
| }, | |
| { | |
| "epoch": 14.690721649484535, | |
| "grad_norm": 9.50616455078125, | |
| "learning_rate": 1.1355479190530738e-05, | |
| "loss": 0.5365, | |
| "step": 2850 | |
| }, | |
| { | |
| "epoch": 14.845360824742269, | |
| "grad_norm": 9.276251792907715, | |
| "learning_rate": 1.124093165330279e-05, | |
| "loss": 0.5066, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "grad_norm": 16.51072120666504, | |
| "learning_rate": 1.1126384116074837e-05, | |
| "loss": 0.5758, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "eval_bertscore": 0.8425244194855962, | |
| "eval_bleu": 10.088393701362467, | |
| "eval_chrf": 37.05532016982362, | |
| "eval_loss": 1.6258227825164795, | |
| "eval_meteor": 0.31680299225747693, | |
| "eval_runtime": 17.8883, | |
| "eval_samples_per_second": 10.789, | |
| "eval_steps_per_second": 1.398, | |
| "step": 2910 | |
| }, | |
| { | |
| "epoch": 15.154639175257731, | |
| "grad_norm": 9.54076099395752, | |
| "learning_rate": 1.1011836578846889e-05, | |
| "loss": 0.4469, | |
| "step": 2940 | |
| }, | |
| { | |
| "epoch": 15.309278350515465, | |
| "grad_norm": 11.035090446472168, | |
| "learning_rate": 1.089728904161894e-05, | |
| "loss": 0.4619, | |
| "step": 2970 | |
| }, | |
| { | |
| "epoch": 15.463917525773196, | |
| "grad_norm": 9.248506546020508, | |
| "learning_rate": 1.078274150439099e-05, | |
| "loss": 0.4447, | |
| "step": 3000 | |
| }, | |
| { | |
| "epoch": 15.618556701030927, | |
| "grad_norm": 9.639225959777832, | |
| "learning_rate": 1.066819396716304e-05, | |
| "loss": 0.5252, | |
| "step": 3030 | |
| }, | |
| { | |
| "epoch": 15.77319587628866, | |
| "grad_norm": 8.671944618225098, | |
| "learning_rate": 1.0553646429935092e-05, | |
| "loss": 0.5055, | |
| "step": 3060 | |
| }, | |
| { | |
| "epoch": 15.927835051546392, | |
| "grad_norm": 9.651355743408203, | |
| "learning_rate": 1.043909889270714e-05, | |
| "loss": 0.4863, | |
| "step": 3090 | |
| }, | |
| { | |
| "epoch": 16.0, | |
| "eval_bertscore": 0.8411734397547233, | |
| "eval_bleu": 12.028464196218437, | |
| "eval_chrf": 38.28723917033567, | |
| "eval_loss": 1.6226447820663452, | |
| "eval_meteor": 0.31954241450547227, | |
| "eval_runtime": 18.5681, | |
| "eval_samples_per_second": 10.394, | |
| "eval_steps_per_second": 1.346, | |
| "step": 3104 | |
| }, | |
| { | |
| "epoch": 16.082474226804123, | |
| "grad_norm": 8.140876770019531, | |
| "learning_rate": 1.0324551355479191e-05, | |
| "loss": 0.4979, | |
| "step": 3120 | |
| }, | |
| { | |
| "epoch": 16.237113402061855, | |
| "grad_norm": 9.587776184082031, | |
| "learning_rate": 1.0210003818251242e-05, | |
| "loss": 0.4148, | |
| "step": 3150 | |
| }, | |
| { | |
| "epoch": 16.391752577319586, | |
| "grad_norm": 10.633879661560059, | |
| "learning_rate": 1.0095456281023292e-05, | |
| "loss": 0.4426, | |
| "step": 3180 | |
| }, | |
| { | |
| "epoch": 16.54639175257732, | |
| "grad_norm": 10.271921157836914, | |
| "learning_rate": 9.980908743795342e-06, | |
| "loss": 0.4568, | |
| "step": 3210 | |
| }, | |
| { | |
| "epoch": 16.701030927835053, | |
| "grad_norm": 10.862954139709473, | |
| "learning_rate": 9.866361206567393e-06, | |
| "loss": 0.4211, | |
| "step": 3240 | |
| }, | |
| { | |
| "epoch": 16.855670103092784, | |
| "grad_norm": 9.494423866271973, | |
| "learning_rate": 9.751813669339444e-06, | |
| "loss": 0.4588, | |
| "step": 3270 | |
| }, | |
| { | |
| "epoch": 17.0, | |
| "eval_bertscore": 0.844244998662583, | |
| "eval_bleu": 12.636168876478752, | |
| "eval_chrf": 39.322891666892936, | |
| "eval_loss": 1.6341180801391602, | |
| "eval_meteor": 0.33544973163777175, | |
| "eval_runtime": 17.7098, | |
| "eval_samples_per_second": 10.898, | |
| "eval_steps_per_second": 1.412, | |
| "step": 3298 | |
| }, | |
| { | |
| "epoch": 17.010309278350515, | |
| "grad_norm": 8.34636116027832, | |
| "learning_rate": 9.637266132111494e-06, | |
| "loss": 0.4427, | |
| "step": 3300 | |
| }, | |
| { | |
| "epoch": 17.164948453608247, | |
| "grad_norm": 9.896439552307129, | |
| "learning_rate": 9.522718594883545e-06, | |
| "loss": 0.393, | |
| "step": 3330 | |
| }, | |
| { | |
| "epoch": 17.31958762886598, | |
| "grad_norm": 8.447748184204102, | |
| "learning_rate": 9.408171057655595e-06, | |
| "loss": 0.4072, | |
| "step": 3360 | |
| }, | |
| { | |
| "epoch": 17.47422680412371, | |
| "grad_norm": 8.587246894836426, | |
| "learning_rate": 9.293623520427644e-06, | |
| "loss": 0.3783, | |
| "step": 3390 | |
| }, | |
| { | |
| "epoch": 17.628865979381445, | |
| "grad_norm": 8.51424503326416, | |
| "learning_rate": 9.179075983199695e-06, | |
| "loss": 0.3923, | |
| "step": 3420 | |
| }, | |
| { | |
| "epoch": 17.783505154639176, | |
| "grad_norm": 11.139188766479492, | |
| "learning_rate": 9.064528445971745e-06, | |
| "loss": 0.414, | |
| "step": 3450 | |
| }, | |
| { | |
| "epoch": 17.938144329896907, | |
| "grad_norm": 10.412823677062988, | |
| "learning_rate": 8.949980908743796e-06, | |
| "loss": 0.4256, | |
| "step": 3480 | |
| }, | |
| { | |
| "epoch": 18.0, | |
| "eval_bertscore": 0.8427423143016242, | |
| "eval_bleu": 10.39081838124178, | |
| "eval_chrf": 38.315665164919935, | |
| "eval_loss": 1.651857852935791, | |
| "eval_meteor": 0.3235056356864544, | |
| "eval_runtime": 18.083, | |
| "eval_samples_per_second": 10.673, | |
| "eval_steps_per_second": 1.383, | |
| "step": 3492 | |
| }, | |
| { | |
| "epoch": 18.09278350515464, | |
| "grad_norm": 7.963134288787842, | |
| "learning_rate": 8.835433371515847e-06, | |
| "loss": 0.3509, | |
| "step": 3510 | |
| }, | |
| { | |
| "epoch": 18.24742268041237, | |
| "grad_norm": 6.555767059326172, | |
| "learning_rate": 8.720885834287897e-06, | |
| "loss": 0.3438, | |
| "step": 3540 | |
| }, | |
| { | |
| "epoch": 18.4020618556701, | |
| "grad_norm": 9.116894721984863, | |
| "learning_rate": 8.606338297059947e-06, | |
| "loss": 0.3634, | |
| "step": 3570 | |
| }, | |
| { | |
| "epoch": 18.556701030927837, | |
| "grad_norm": 8.772259712219238, | |
| "learning_rate": 8.491790759831998e-06, | |
| "loss": 0.3688, | |
| "step": 3600 | |
| }, | |
| { | |
| "epoch": 18.711340206185568, | |
| "grad_norm": 6.532469272613525, | |
| "learning_rate": 8.377243222604047e-06, | |
| "loss": 0.3826, | |
| "step": 3630 | |
| }, | |
| { | |
| "epoch": 18.8659793814433, | |
| "grad_norm": 8.094025611877441, | |
| "learning_rate": 8.262695685376099e-06, | |
| "loss": 0.4, | |
| "step": 3660 | |
| }, | |
| { | |
| "epoch": 19.0, | |
| "eval_bertscore": 0.8423587293822531, | |
| "eval_bleu": 12.487375649363784, | |
| "eval_chrf": 39.54931349514667, | |
| "eval_loss": 1.660538673400879, | |
| "eval_meteor": 0.32780584893530307, | |
| "eval_runtime": 19.1569, | |
| "eval_samples_per_second": 10.075, | |
| "eval_steps_per_second": 1.305, | |
| "step": 3686 | |
| }, | |
| { | |
| "epoch": 19.02061855670103, | |
| "grad_norm": 6.79367733001709, | |
| "learning_rate": 8.148148148148148e-06, | |
| "loss": 0.3852, | |
| "step": 3690 | |
| }, | |
| { | |
| "epoch": 19.175257731958762, | |
| "grad_norm": 9.372544288635254, | |
| "learning_rate": 8.0336006109202e-06, | |
| "loss": 0.3319, | |
| "step": 3720 | |
| }, | |
| { | |
| "epoch": 19.329896907216494, | |
| "grad_norm": 10.440468788146973, | |
| "learning_rate": 7.91905307369225e-06, | |
| "loss": 0.3565, | |
| "step": 3750 | |
| }, | |
| { | |
| "epoch": 19.484536082474225, | |
| "grad_norm": 8.199675559997559, | |
| "learning_rate": 7.8045055364643e-06, | |
| "loss": 0.3275, | |
| "step": 3780 | |
| }, | |
| { | |
| "epoch": 19.63917525773196, | |
| "grad_norm": 9.151398658752441, | |
| "learning_rate": 7.68995799923635e-06, | |
| "loss": 0.3809, | |
| "step": 3810 | |
| }, | |
| { | |
| "epoch": 19.79381443298969, | |
| "grad_norm": 8.963874816894531, | |
| "learning_rate": 7.575410462008401e-06, | |
| "loss": 0.3046, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 19.948453608247423, | |
| "grad_norm": 7.874151229858398, | |
| "learning_rate": 7.460862924780451e-06, | |
| "loss": 0.3521, | |
| "step": 3870 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "eval_bertscore": 0.8462644858681476, | |
| "eval_bleu": 11.879411636317712, | |
| "eval_chrf": 40.114348533135825, | |
| "eval_loss": 1.6695095300674438, | |
| "eval_meteor": 0.33837011315826326, | |
| "eval_runtime": 17.5347, | |
| "eval_samples_per_second": 11.007, | |
| "eval_steps_per_second": 1.426, | |
| "step": 3880 | |
| }, | |
| { | |
| "epoch": 20.103092783505154, | |
| "grad_norm": 6.499141216278076, | |
| "learning_rate": 7.346315387552502e-06, | |
| "loss": 0.3306, | |
| "step": 3900 | |
| }, | |
| { | |
| "epoch": 20.257731958762886, | |
| "grad_norm": 6.233891487121582, | |
| "learning_rate": 7.231767850324552e-06, | |
| "loss": 0.3199, | |
| "step": 3930 | |
| }, | |
| { | |
| "epoch": 20.412371134020617, | |
| "grad_norm": 9.419313430786133, | |
| "learning_rate": 7.117220313096602e-06, | |
| "loss": 0.3009, | |
| "step": 3960 | |
| }, | |
| { | |
| "epoch": 20.567010309278352, | |
| "grad_norm": 9.547579765319824, | |
| "learning_rate": 7.002672775868653e-06, | |
| "loss": 0.3036, | |
| "step": 3990 | |
| }, | |
| { | |
| "epoch": 20.721649484536083, | |
| "grad_norm": 6.532684326171875, | |
| "learning_rate": 6.888125238640703e-06, | |
| "loss": 0.322, | |
| "step": 4020 | |
| }, | |
| { | |
| "epoch": 20.876288659793815, | |
| "grad_norm": 8.454936027526855, | |
| "learning_rate": 6.773577701412753e-06, | |
| "loss": 0.3298, | |
| "step": 4050 | |
| }, | |
| { | |
| "epoch": 21.0, | |
| "eval_bertscore": 0.843647470128351, | |
| "eval_bleu": 12.22598647677628, | |
| "eval_chrf": 39.967488522101775, | |
| "eval_loss": 1.6959513425827026, | |
| "eval_meteor": 0.334625348793614, | |
| "eval_runtime": 17.9122, | |
| "eval_samples_per_second": 10.775, | |
| "eval_steps_per_second": 1.396, | |
| "step": 4074 | |
| }, | |
| { | |
| "epoch": 21.030927835051546, | |
| "grad_norm": 7.442008018493652, | |
| "learning_rate": 6.659030164184805e-06, | |
| "loss": 0.3098, | |
| "step": 4080 | |
| }, | |
| { | |
| "epoch": 21.185567010309278, | |
| "grad_norm": 9.09302043914795, | |
| "learning_rate": 6.544482626956854e-06, | |
| "loss": 0.3093, | |
| "step": 4110 | |
| }, | |
| { | |
| "epoch": 21.34020618556701, | |
| "grad_norm": 7.801342010498047, | |
| "learning_rate": 6.429935089728905e-06, | |
| "loss": 0.3066, | |
| "step": 4140 | |
| }, | |
| { | |
| "epoch": 21.49484536082474, | |
| "grad_norm": 7.818614482879639, | |
| "learning_rate": 6.315387552500956e-06, | |
| "loss": 0.2984, | |
| "step": 4170 | |
| }, | |
| { | |
| "epoch": 21.649484536082475, | |
| "grad_norm": 8.459864616394043, | |
| "learning_rate": 6.2008400152730055e-06, | |
| "loss": 0.2809, | |
| "step": 4200 | |
| }, | |
| { | |
| "epoch": 21.804123711340207, | |
| "grad_norm": 8.437562942504883, | |
| "learning_rate": 6.086292478045056e-06, | |
| "loss": 0.2973, | |
| "step": 4230 | |
| }, | |
| { | |
| "epoch": 21.95876288659794, | |
| "grad_norm": 10.7759428024292, | |
| "learning_rate": 5.9717449408171055e-06, | |
| "loss": 0.3029, | |
| "step": 4260 | |
| }, | |
| { | |
| "epoch": 22.0, | |
| "eval_bertscore": 0.8437702862709915, | |
| "eval_bleu": 11.328363034379192, | |
| "eval_chrf": 40.31840295732892, | |
| "eval_loss": 1.697576880455017, | |
| "eval_meteor": 0.33887718936757705, | |
| "eval_runtime": 18.6408, | |
| "eval_samples_per_second": 10.354, | |
| "eval_steps_per_second": 1.341, | |
| "step": 4268 | |
| }, | |
| { | |
| "epoch": 22.0, | |
| "step": 4268, | |
| "total_flos": 232218100629504.0, | |
| "train_loss": 1.1187503173626128, | |
| "train_runtime": 1520.2415, | |
| "train_samples_per_second": 30.528, | |
| "train_steps_per_second": 3.828 | |
| } | |
| ], | |
| "logging_steps": 30, | |
| "max_steps": 5820, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 30, | |
| "save_steps": 500, | |
| "stateful_callbacks": { | |
| "EarlyStoppingCallback": { | |
| "args": { | |
| "early_stopping_patience": 5, | |
| "early_stopping_threshold": 0.0 | |
| }, | |
| "attributes": { | |
| "early_stopping_patience_counter": 5 | |
| } | |
| }, | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 232218100629504.0, | |
| "train_batch_size": 8, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |