NiklasTUM's picture
Add trainer_state.json
eb15760 verified
Raw
History Blame Contribute Delete
469 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0,
"eval_steps": 210,
"global_step": 1050,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0,
"eval_loss": 2.608412027359009,
"eval_ppl": 13.57747,
"eval_runtime": 11.2346,
"eval_samples_per_second": 7.922,
"eval_steps_per_second": 2.047,
"memory/device_reserved (GiB)": 36.59,
"memory/max_active (GiB)": 34.31,
"memory/max_allocated (GiB)": 34.31,
"step": 0
},
{
"epoch": 0.004761904761904762,
"grad_norm": 2.359196662902832,
"learning_rate": 0.0,
"loss": 2.8488729000091553,
"memory/device_reserved (GiB)": 38.92,
"memory/max_active (GiB)": 38.08,
"memory/max_allocated (GiB)": 38.08,
"ppl": 17.26831,
"step": 1,
"tokens/total": 4096,
"tokens/train_per_sec_per_gpu": 6.14,
"tokens/trainable": 251
},
{
"epoch": 0.009523809523809525,
"grad_norm": 1.6851783990859985,
"learning_rate": 2.0000000000000003e-06,
"loss": 2.6969332695007324,
"memory/device_reserved (GiB)": 39.14,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 14.83417,
"step": 2,
"tokens/total": 8192,
"tokens/train_per_sec_per_gpu": 18.92,
"tokens/trainable": 606
},
{
"epoch": 0.014285714285714285,
"grad_norm": 2.1991381645202637,
"learning_rate": 4.000000000000001e-06,
"loss": 2.4316632747650146,
"memory/device_reserved (GiB)": 39.16,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 11.37779,
"step": 3,
"tokens/total": 12288,
"tokens/train_per_sec_per_gpu": 14.49,
"tokens/trainable": 869
},
{
"epoch": 0.01904761904761905,
"grad_norm": 1.6060373783111572,
"learning_rate": 6e-06,
"loss": 2.2152516841888428,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 9.16372,
"step": 4,
"tokens/total": 16384,
"tokens/train_per_sec_per_gpu": 17.79,
"tokens/trainable": 1191
},
{
"epoch": 0.023809523809523808,
"grad_norm": 3.0328783988952637,
"learning_rate": 8.000000000000001e-06,
"loss": 2.76442289352417,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 15.86988,
"step": 5,
"tokens/total": 20480,
"tokens/train_per_sec_per_gpu": 9.83,
"tokens/trainable": 1449
},
{
"epoch": 0.02857142857142857,
"grad_norm": 1.5438529253005981,
"learning_rate": 1e-05,
"loss": 2.1510019302368164,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 8.59346,
"step": 6,
"tokens/total": 24576,
"tokens/train_per_sec_per_gpu": 15.98,
"tokens/trainable": 1808
},
{
"epoch": 0.03333333333333333,
"grad_norm": 1.570513367652893,
"learning_rate": 9.99043062200957e-06,
"loss": 2.0862762928009033,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 8.05487,
"step": 7,
"tokens/total": 28672,
"tokens/train_per_sec_per_gpu": 16.35,
"tokens/trainable": 2100
},
{
"epoch": 0.0380952380952381,
"grad_norm": 1.9097869396209717,
"learning_rate": 9.98086124401914e-06,
"loss": 2.539433002471924,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 12.67248,
"step": 8,
"tokens/total": 32768,
"tokens/train_per_sec_per_gpu": 15.58,
"tokens/trainable": 2405
},
{
"epoch": 0.04285714285714286,
"grad_norm": 2.1091222763061523,
"learning_rate": 9.971291866028709e-06,
"loss": 2.706951856613159,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 14.98353,
"step": 9,
"tokens/total": 36864,
"tokens/train_per_sec_per_gpu": 19.27,
"tokens/trainable": 2724
},
{
"epoch": 0.047619047619047616,
"grad_norm": 1.995006799697876,
"learning_rate": 9.961722488038278e-06,
"loss": 2.5782675743103027,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 13.17429,
"step": 10,
"tokens/total": 40960,
"tokens/train_per_sec_per_gpu": 16.29,
"tokens/trainable": 3076
},
{
"epoch": 0.05238095238095238,
"grad_norm": 1.8370505571365356,
"learning_rate": 9.952153110047848e-06,
"loss": 2.5256881713867188,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 12.49949,
"step": 11,
"tokens/total": 45056,
"tokens/train_per_sec_per_gpu": 13.35,
"tokens/trainable": 3360
},
{
"epoch": 0.05714285714285714,
"grad_norm": 1.9744315147399902,
"learning_rate": 9.942583732057417e-06,
"loss": 3.0185282230377197,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 20.46116,
"step": 12,
"tokens/total": 49152,
"tokens/train_per_sec_per_gpu": 12.19,
"tokens/trainable": 3645
},
{
"epoch": 0.06190476190476191,
"grad_norm": 21.56676483154297,
"learning_rate": 9.933014354066987e-06,
"loss": 2.959587574005127,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 19.29001,
"step": 13,
"tokens/total": 53248,
"tokens/train_per_sec_per_gpu": 8.84,
"tokens/trainable": 3879
},
{
"epoch": 0.06666666666666667,
"grad_norm": 2.027482509613037,
"learning_rate": 9.923444976076556e-06,
"loss": 2.170783042907715,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 8.76514,
"step": 14,
"tokens/total": 57344,
"tokens/train_per_sec_per_gpu": 14.41,
"tokens/trainable": 4225
},
{
"epoch": 0.07142857142857142,
"grad_norm": 2.194688558578491,
"learning_rate": 9.913875598086125e-06,
"loss": 2.2357940673828125,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 9.35391,
"step": 15,
"tokens/total": 61440,
"tokens/train_per_sec_per_gpu": 13.21,
"tokens/trainable": 4571
},
{
"epoch": 0.0761904761904762,
"grad_norm": 1.9835619926452637,
"learning_rate": 9.904306220095695e-06,
"loss": 2.5124027729034424,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 12.33453,
"step": 16,
"tokens/total": 65536,
"tokens/train_per_sec_per_gpu": 14.99,
"tokens/trainable": 4902
},
{
"epoch": 0.08095238095238096,
"grad_norm": 2.9243738651275635,
"learning_rate": 9.894736842105264e-06,
"loss": 3.1188597679138184,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 22.62057,
"step": 17,
"tokens/total": 69632,
"tokens/train_per_sec_per_gpu": 9.42,
"tokens/trainable": 5144
},
{
"epoch": 0.08571428571428572,
"grad_norm": 1.6045500040054321,
"learning_rate": 9.885167464114833e-06,
"loss": 2.362255334854126,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 10.61486,
"step": 18,
"tokens/total": 73728,
"tokens/train_per_sec_per_gpu": 15.12,
"tokens/trainable": 5519
},
{
"epoch": 0.09047619047619047,
"grad_norm": 2.464662551879883,
"learning_rate": 9.875598086124403e-06,
"loss": 2.4410171508789062,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 11.48472,
"step": 19,
"tokens/total": 77824,
"tokens/train_per_sec_per_gpu": 23.74,
"tokens/trainable": 5856
},
{
"epoch": 0.09523809523809523,
"grad_norm": 2.090559482574463,
"learning_rate": 9.866028708133972e-06,
"loss": 2.2410788536071777,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 9.40347,
"step": 20,
"tokens/total": 81920,
"tokens/train_per_sec_per_gpu": 21.14,
"tokens/trainable": 6239
},
{
"epoch": 0.1,
"grad_norm": 1.6499180793762207,
"learning_rate": 9.856459330143542e-06,
"loss": 1.750786304473877,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 5.75913,
"step": 21,
"tokens/total": 86016,
"tokens/train_per_sec_per_gpu": 12.88,
"tokens/trainable": 6562
},
{
"epoch": 0.10476190476190476,
"grad_norm": 2.06025767326355,
"learning_rate": 9.846889952153111e-06,
"loss": 2.453636646270752,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 11.63057,
"step": 22,
"tokens/total": 90112,
"tokens/train_per_sec_per_gpu": 14.53,
"tokens/trainable": 6881
},
{
"epoch": 0.10952380952380952,
"grad_norm": 2.1834657192230225,
"learning_rate": 9.83732057416268e-06,
"loss": 2.3299005031585693,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 10.27692,
"step": 23,
"tokens/total": 94208,
"tokens/train_per_sec_per_gpu": 16.89,
"tokens/trainable": 7169
},
{
"epoch": 0.11428571428571428,
"grad_norm": 2.7063045501708984,
"learning_rate": 9.82775119617225e-06,
"loss": 2.135418653488159,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 8.46059,
"step": 24,
"tokens/total": 98304,
"tokens/train_per_sec_per_gpu": 15.24,
"tokens/trainable": 7424
},
{
"epoch": 0.11904761904761904,
"grad_norm": 2.213444232940674,
"learning_rate": 9.81818181818182e-06,
"loss": 2.230344295501709,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 9.30307,
"step": 25,
"tokens/total": 102400,
"tokens/train_per_sec_per_gpu": 12.01,
"tokens/trainable": 7700
},
{
"epoch": 0.12380952380952381,
"grad_norm": 2.1053807735443115,
"learning_rate": 9.808612440191389e-06,
"loss": 1.8845914602279663,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 6.58366,
"step": 26,
"tokens/total": 106496,
"tokens/train_per_sec_per_gpu": 12.01,
"tokens/trainable": 7969
},
{
"epoch": 0.12857142857142856,
"grad_norm": 2.621504783630371,
"learning_rate": 9.799043062200958e-06,
"loss": 2.465123176574707,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 11.76493,
"step": 27,
"tokens/total": 110592,
"tokens/train_per_sec_per_gpu": 12.26,
"tokens/trainable": 8221
},
{
"epoch": 0.13333333333333333,
"grad_norm": 2.0597894191741943,
"learning_rate": 9.789473684210527e-06,
"loss": 2.136955738067627,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 8.4736,
"step": 28,
"tokens/total": 114688,
"tokens/train_per_sec_per_gpu": 17.31,
"tokens/trainable": 8540
},
{
"epoch": 0.1380952380952381,
"grad_norm": 2.4883816242218018,
"learning_rate": 9.779904306220097e-06,
"loss": 1.710213541984558,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 5.53014,
"step": 29,
"tokens/total": 118784,
"tokens/train_per_sec_per_gpu": 16.86,
"tokens/trainable": 8852
},
{
"epoch": 0.14285714285714285,
"grad_norm": 3.3769397735595703,
"learning_rate": 9.770334928229666e-06,
"loss": 2.047621011734009,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 7.74944,
"step": 30,
"tokens/total": 122880,
"tokens/train_per_sec_per_gpu": 10.15,
"tokens/trainable": 9091
},
{
"epoch": 0.14761904761904762,
"grad_norm": 2.247663736343384,
"learning_rate": 9.760765550239236e-06,
"loss": 1.5432257652282715,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 4.67966,
"step": 31,
"tokens/total": 126976,
"tokens/train_per_sec_per_gpu": 9.37,
"tokens/trainable": 9355
},
{
"epoch": 0.1523809523809524,
"grad_norm": 2.2224535942077637,
"learning_rate": 9.751196172248805e-06,
"loss": 2.1464388370513916,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 8.55434,
"step": 32,
"tokens/total": 131072,
"tokens/train_per_sec_per_gpu": 12.68,
"tokens/trainable": 9634
},
{
"epoch": 0.15714285714285714,
"grad_norm": 3.218093156814575,
"learning_rate": 9.741626794258374e-06,
"loss": 2.0251033306121826,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 7.57689,
"step": 33,
"tokens/total": 135168,
"tokens/train_per_sec_per_gpu": 10.22,
"tokens/trainable": 9926
},
{
"epoch": 0.1619047619047619,
"grad_norm": 3.240586280822754,
"learning_rate": 9.732057416267944e-06,
"loss": 1.7320709228515625,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 5.65235,
"step": 34,
"tokens/total": 139264,
"tokens/train_per_sec_per_gpu": 15.82,
"tokens/trainable": 10196
},
{
"epoch": 0.16666666666666666,
"grad_norm": 2.352398633956909,
"learning_rate": 9.722488038277513e-06,
"loss": 1.7620348930358887,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 5.82428,
"step": 35,
"tokens/total": 143360,
"tokens/train_per_sec_per_gpu": 18.11,
"tokens/trainable": 10539
},
{
"epoch": 0.17142857142857143,
"grad_norm": 2.2571511268615723,
"learning_rate": 9.712918660287082e-06,
"loss": 1.7542566061019897,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 5.77915,
"step": 36,
"tokens/total": 147456,
"tokens/train_per_sec_per_gpu": 17.97,
"tokens/trainable": 10838
},
{
"epoch": 0.1761904761904762,
"grad_norm": 2.1978981494903564,
"learning_rate": 9.703349282296652e-06,
"loss": 1.33998441696167,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 3.81898,
"step": 37,
"tokens/total": 151552,
"tokens/train_per_sec_per_gpu": 14.33,
"tokens/trainable": 11211
},
{
"epoch": 0.18095238095238095,
"grad_norm": 2.0772902965545654,
"learning_rate": 9.693779904306221e-06,
"loss": 1.467942237854004,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 4.34029,
"step": 38,
"tokens/total": 155648,
"tokens/train_per_sec_per_gpu": 12.64,
"tokens/trainable": 11467
},
{
"epoch": 0.18571428571428572,
"grad_norm": 2.1938557624816895,
"learning_rate": 9.68421052631579e-06,
"loss": 1.2810404300689697,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 3.60038,
"step": 39,
"tokens/total": 159744,
"tokens/train_per_sec_per_gpu": 17.24,
"tokens/trainable": 11792
},
{
"epoch": 0.19047619047619047,
"grad_norm": 1.9610248804092407,
"learning_rate": 9.67464114832536e-06,
"loss": 1.304593801498413,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 3.68619,
"step": 40,
"tokens/total": 163840,
"tokens/train_per_sec_per_gpu": 14.73,
"tokens/trainable": 12086
},
{
"epoch": 0.19523809523809524,
"grad_norm": 2.6710472106933594,
"learning_rate": 9.66507177033493e-06,
"loss": 1.5237510204315186,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 4.58941,
"step": 41,
"tokens/total": 167936,
"tokens/train_per_sec_per_gpu": 12.31,
"tokens/trainable": 12326
},
{
"epoch": 0.2,
"grad_norm": 2.024487257003784,
"learning_rate": 9.655502392344497e-06,
"loss": 1.2347090244293213,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 3.43738,
"step": 42,
"tokens/total": 172032,
"tokens/train_per_sec_per_gpu": 14.25,
"tokens/trainable": 12720
},
{
"epoch": 0.20476190476190476,
"grad_norm": 2.842580556869507,
"learning_rate": 9.645933014354068e-06,
"loss": 1.609395980834961,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 4.99979,
"step": 43,
"tokens/total": 176128,
"tokens/train_per_sec_per_gpu": 10.82,
"tokens/trainable": 12928
},
{
"epoch": 0.20952380952380953,
"grad_norm": 2.1989729404449463,
"learning_rate": 9.636363636363638e-06,
"loss": 1.1074391603469849,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 3.0266,
"step": 44,
"tokens/total": 180224,
"tokens/train_per_sec_per_gpu": 11.88,
"tokens/trainable": 13185
},
{
"epoch": 0.21428571428571427,
"grad_norm": 5.464274883270264,
"learning_rate": 9.626794258373207e-06,
"loss": 0.9748563170433044,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 2.65079,
"step": 45,
"tokens/total": 184320,
"tokens/train_per_sec_per_gpu": 12.97,
"tokens/trainable": 13515
},
{
"epoch": 0.21904761904761905,
"grad_norm": 2.9592573642730713,
"learning_rate": 9.617224880382776e-06,
"loss": 1.2125438451766968,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 3.36203,
"step": 46,
"tokens/total": 188416,
"tokens/train_per_sec_per_gpu": 10.9,
"tokens/trainable": 13753
},
{
"epoch": 0.22380952380952382,
"grad_norm": 2.570880174636841,
"learning_rate": 9.607655502392346e-06,
"loss": 1.0907056331634521,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 2.97637,
"step": 47,
"tokens/total": 192512,
"tokens/train_per_sec_per_gpu": 12.15,
"tokens/trainable": 14051
},
{
"epoch": 0.22857142857142856,
"grad_norm": 2.5704782009124756,
"learning_rate": 9.598086124401913e-06,
"loss": 0.9632624387741089,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 2.62023,
"step": 48,
"tokens/total": 196608,
"tokens/train_per_sec_per_gpu": 7.27,
"tokens/trainable": 14273
},
{
"epoch": 0.23333333333333334,
"grad_norm": 2.3074774742126465,
"learning_rate": 9.588516746411483e-06,
"loss": 0.811287522315979,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 2.2508,
"step": 49,
"tokens/total": 200704,
"tokens/train_per_sec_per_gpu": 21.78,
"tokens/trainable": 14641
},
{
"epoch": 0.23809523809523808,
"grad_norm": 1.8212100267410278,
"learning_rate": 9.578947368421054e-06,
"loss": 0.8015825748443604,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 2.22907,
"step": 50,
"tokens/total": 204800,
"tokens/train_per_sec_per_gpu": 12.54,
"tokens/trainable": 14991
},
{
"epoch": 0.24285714285714285,
"grad_norm": 2.3841068744659424,
"learning_rate": 9.569377990430623e-06,
"loss": 0.896703839302063,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 2.45151,
"step": 51,
"tokens/total": 208896,
"tokens/train_per_sec_per_gpu": 15.32,
"tokens/trainable": 15302
},
{
"epoch": 0.24761904761904763,
"grad_norm": 2.0620293617248535,
"learning_rate": 9.559808612440193e-06,
"loss": 0.7413748502731323,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 2.09882,
"step": 52,
"tokens/total": 212992,
"tokens/train_per_sec_per_gpu": 13.33,
"tokens/trainable": 15566
},
{
"epoch": 0.2523809523809524,
"grad_norm": 1.9990394115447998,
"learning_rate": 9.550239234449762e-06,
"loss": 0.6690434217453003,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.95237,
"step": 53,
"tokens/total": 217088,
"tokens/train_per_sec_per_gpu": 9.25,
"tokens/trainable": 15884
},
{
"epoch": 0.2571428571428571,
"grad_norm": 2.1852803230285645,
"learning_rate": 9.540669856459331e-06,
"loss": 0.7765368819236755,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 2.17393,
"step": 54,
"tokens/total": 221184,
"tokens/train_per_sec_per_gpu": 12.36,
"tokens/trainable": 16181
},
{
"epoch": 0.2619047619047619,
"grad_norm": 2.215074300765991,
"learning_rate": 9.5311004784689e-06,
"loss": 0.6537740230560303,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.92278,
"step": 55,
"tokens/total": 225280,
"tokens/train_per_sec_per_gpu": 10.6,
"tokens/trainable": 16458
},
{
"epoch": 0.26666666666666666,
"grad_norm": 1.7708910703659058,
"learning_rate": 9.52153110047847e-06,
"loss": 0.7781250476837158,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 2.17739,
"step": 56,
"tokens/total": 229376,
"tokens/train_per_sec_per_gpu": 12.4,
"tokens/trainable": 16742
},
{
"epoch": 0.2714285714285714,
"grad_norm": 2.0387091636657715,
"learning_rate": 9.51196172248804e-06,
"loss": 0.5093286633491516,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.66417,
"step": 57,
"tokens/total": 233472,
"tokens/train_per_sec_per_gpu": 9.72,
"tokens/trainable": 16957
},
{
"epoch": 0.2761904761904762,
"grad_norm": 1.7607407569885254,
"learning_rate": 9.502392344497609e-06,
"loss": 0.6932368278503418,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 2.00018,
"step": 58,
"tokens/total": 237568,
"tokens/train_per_sec_per_gpu": 12.7,
"tokens/trainable": 17245
},
{
"epoch": 0.28095238095238095,
"grad_norm": 2.5780985355377197,
"learning_rate": 9.492822966507178e-06,
"loss": 0.4341663718223572,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.54368,
"step": 59,
"tokens/total": 241664,
"tokens/train_per_sec_per_gpu": 12.24,
"tokens/trainable": 17586
},
{
"epoch": 0.2857142857142857,
"grad_norm": 2.317253351211548,
"learning_rate": 9.483253588516748e-06,
"loss": 0.5591937303543091,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.74926,
"step": 60,
"tokens/total": 245760,
"tokens/train_per_sec_per_gpu": 11.24,
"tokens/trainable": 17828
},
{
"epoch": 0.2904761904761905,
"grad_norm": 1.5913702249526978,
"learning_rate": 9.473684210526315e-06,
"loss": 0.5771949291229248,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.78104,
"step": 61,
"tokens/total": 249856,
"tokens/train_per_sec_per_gpu": 17.34,
"tokens/trainable": 18107
},
{
"epoch": 0.29523809523809524,
"grad_norm": 1.7437083721160889,
"learning_rate": 9.464114832535885e-06,
"loss": 0.3899308443069458,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.47688,
"step": 62,
"tokens/total": 253952,
"tokens/train_per_sec_per_gpu": 7.46,
"tokens/trainable": 18304
},
{
"epoch": 0.3,
"grad_norm": 1.510191798210144,
"learning_rate": 9.454545454545456e-06,
"loss": 0.4528539776802063,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.57279,
"step": 63,
"tokens/total": 258048,
"tokens/train_per_sec_per_gpu": 8.28,
"tokens/trainable": 18531
},
{
"epoch": 0.3047619047619048,
"grad_norm": 1.3171509504318237,
"learning_rate": 9.444976076555025e-06,
"loss": 0.44899454712867737,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.56674,
"step": 64,
"tokens/total": 262144,
"tokens/train_per_sec_per_gpu": 14.26,
"tokens/trainable": 18919
},
{
"epoch": 0.30952380952380953,
"grad_norm": 0.8474973440170288,
"learning_rate": 9.435406698564595e-06,
"loss": 0.22856196761131287,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.25679,
"step": 65,
"tokens/total": 266240,
"tokens/train_per_sec_per_gpu": 10.41,
"tokens/trainable": 19181
},
{
"epoch": 0.3142857142857143,
"grad_norm": 1.0009809732437134,
"learning_rate": 9.425837320574164e-06,
"loss": 0.3449355959892273,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.4119,
"step": 66,
"tokens/total": 270336,
"tokens/train_per_sec_per_gpu": 18.8,
"tokens/trainable": 19493
},
{
"epoch": 0.319047619047619,
"grad_norm": 1.1229182481765747,
"learning_rate": 9.416267942583734e-06,
"loss": 0.3861968219280243,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.47137,
"step": 67,
"tokens/total": 274432,
"tokens/train_per_sec_per_gpu": 10.13,
"tokens/trainable": 19742
},
{
"epoch": 0.3238095238095238,
"grad_norm": 2.035735845565796,
"learning_rate": 9.406698564593301e-06,
"loss": 0.46546095609664917,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.59275,
"step": 68,
"tokens/total": 278528,
"tokens/train_per_sec_per_gpu": 14.0,
"tokens/trainable": 20081
},
{
"epoch": 0.32857142857142857,
"grad_norm": 0.943077802658081,
"learning_rate": 9.39712918660287e-06,
"loss": 0.2488720715045929,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.28258,
"step": 69,
"tokens/total": 282624,
"tokens/train_per_sec_per_gpu": 12.21,
"tokens/trainable": 20364
},
{
"epoch": 0.3333333333333333,
"grad_norm": 0.8868593573570251,
"learning_rate": 9.387559808612442e-06,
"loss": 0.4037240743637085,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.49739,
"step": 70,
"tokens/total": 286720,
"tokens/train_per_sec_per_gpu": 10.54,
"tokens/trainable": 20641
},
{
"epoch": 0.3380952380952381,
"grad_norm": 1.323467493057251,
"learning_rate": 9.377990430622011e-06,
"loss": 0.32316213846206665,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.38149,
"step": 71,
"tokens/total": 290816,
"tokens/train_per_sec_per_gpu": 15.32,
"tokens/trainable": 20995
},
{
"epoch": 0.34285714285714286,
"grad_norm": 0.9882053136825562,
"learning_rate": 9.36842105263158e-06,
"loss": 0.24642500281333923,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.27944,
"step": 72,
"tokens/total": 294912,
"tokens/train_per_sec_per_gpu": 12.04,
"tokens/trainable": 21353
},
{
"epoch": 0.3476190476190476,
"grad_norm": 0.7984920144081116,
"learning_rate": 9.35885167464115e-06,
"loss": 0.25220850110054016,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.28686,
"step": 73,
"tokens/total": 299008,
"tokens/train_per_sec_per_gpu": 19.03,
"tokens/trainable": 21721
},
{
"epoch": 0.3523809523809524,
"grad_norm": 0.8392660617828369,
"learning_rate": 9.349282296650718e-06,
"loss": 0.2952135503292084,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.34341,
"step": 74,
"tokens/total": 303104,
"tokens/train_per_sec_per_gpu": 10.37,
"tokens/trainable": 22012
},
{
"epoch": 0.35714285714285715,
"grad_norm": 1.0957508087158203,
"learning_rate": 9.339712918660287e-06,
"loss": 0.3907988965511322,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.47816,
"step": 75,
"tokens/total": 307200,
"tokens/train_per_sec_per_gpu": 11.42,
"tokens/trainable": 22253
},
{
"epoch": 0.3619047619047619,
"grad_norm": 1.0357823371887207,
"learning_rate": 9.330143540669856e-06,
"loss": 0.25602155923843384,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.29178,
"step": 76,
"tokens/total": 311296,
"tokens/train_per_sec_per_gpu": 11.79,
"tokens/trainable": 22517
},
{
"epoch": 0.36666666666666664,
"grad_norm": 1.4284818172454834,
"learning_rate": 9.320574162679427e-06,
"loss": 0.3153234124183655,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.3707,
"step": 77,
"tokens/total": 315392,
"tokens/train_per_sec_per_gpu": 8.11,
"tokens/trainable": 22760
},
{
"epoch": 0.37142857142857144,
"grad_norm": 0.8853760361671448,
"learning_rate": 9.311004784688997e-06,
"loss": 0.2890888452529907,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.33521,
"step": 78,
"tokens/total": 319488,
"tokens/train_per_sec_per_gpu": 9.88,
"tokens/trainable": 23027
},
{
"epoch": 0.3761904761904762,
"grad_norm": 1.0980620384216309,
"learning_rate": 9.301435406698566e-06,
"loss": 0.27998337149620056,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.32311,
"step": 79,
"tokens/total": 323584,
"tokens/train_per_sec_per_gpu": 14.48,
"tokens/trainable": 23322
},
{
"epoch": 0.38095238095238093,
"grad_norm": 1.0161164999008179,
"learning_rate": 9.291866028708136e-06,
"loss": 0.3861690163612366,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.47133,
"step": 80,
"tokens/total": 327680,
"tokens/train_per_sec_per_gpu": 15.36,
"tokens/trainable": 23639
},
{
"epoch": 0.38571428571428573,
"grad_norm": 0.9894334077835083,
"learning_rate": 9.282296650717703e-06,
"loss": 0.2312101125717163,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.26012,
"step": 81,
"tokens/total": 331776,
"tokens/train_per_sec_per_gpu": 10.84,
"tokens/trainable": 23899
},
{
"epoch": 0.3904761904761905,
"grad_norm": 0.8046990633010864,
"learning_rate": 9.272727272727273e-06,
"loss": 0.1597203016281128,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17318,
"step": 82,
"tokens/total": 335872,
"tokens/train_per_sec_per_gpu": 9.12,
"tokens/trainable": 24160
},
{
"epoch": 0.3952380952380952,
"grad_norm": 0.8290164470672607,
"learning_rate": 9.263157894736842e-06,
"loss": 0.21786154806613922,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.24341,
"step": 83,
"tokens/total": 339968,
"tokens/train_per_sec_per_gpu": 11.81,
"tokens/trainable": 24472
},
{
"epoch": 0.4,
"grad_norm": 0.7340158820152283,
"learning_rate": 9.253588516746413e-06,
"loss": 0.1657000184059143,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.18022,
"step": 84,
"tokens/total": 344064,
"tokens/train_per_sec_per_gpu": 11.69,
"tokens/trainable": 24724
},
{
"epoch": 0.40476190476190477,
"grad_norm": 0.6350992321968079,
"learning_rate": 9.244019138755983e-06,
"loss": 0.18384049832820892,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.20182,
"step": 85,
"tokens/total": 348160,
"tokens/train_per_sec_per_gpu": 16.55,
"tokens/trainable": 25031
},
{
"epoch": 0.4095238095238095,
"grad_norm": 0.9644314050674438,
"learning_rate": 9.234449760765552e-06,
"loss": 0.23870739340782166,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.26961,
"step": 86,
"tokens/total": 352256,
"tokens/train_per_sec_per_gpu": 11.23,
"tokens/trainable": 25335
},
{
"epoch": 0.4142857142857143,
"grad_norm": 0.8144553303718567,
"learning_rate": 9.22488038277512e-06,
"loss": 0.18887390196323395,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.20789,
"step": 87,
"tokens/total": 356352,
"tokens/train_per_sec_per_gpu": 12.26,
"tokens/trainable": 25618
},
{
"epoch": 0.41904761904761906,
"grad_norm": 0.6886969804763794,
"learning_rate": 9.215311004784689e-06,
"loss": 0.20714828372001648,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.23016,
"step": 88,
"tokens/total": 360448,
"tokens/train_per_sec_per_gpu": 14.28,
"tokens/trainable": 25916
},
{
"epoch": 0.4238095238095238,
"grad_norm": 0.6070327162742615,
"learning_rate": 9.205741626794258e-06,
"loss": 0.15140344202518463,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16347,
"step": 89,
"tokens/total": 364544,
"tokens/train_per_sec_per_gpu": 11.41,
"tokens/trainable": 26196
},
{
"epoch": 0.42857142857142855,
"grad_norm": 1.1441844701766968,
"learning_rate": 9.196172248803828e-06,
"loss": 0.17098617553710938,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.18647,
"step": 90,
"tokens/total": 368640,
"tokens/train_per_sec_per_gpu": 14.67,
"tokens/trainable": 26544
},
{
"epoch": 0.43333333333333335,
"grad_norm": 0.6829278469085693,
"learning_rate": 9.186602870813399e-06,
"loss": 0.19169265031814575,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.2113,
"step": 91,
"tokens/total": 372736,
"tokens/train_per_sec_per_gpu": 14.1,
"tokens/trainable": 26892
},
{
"epoch": 0.4380952380952381,
"grad_norm": 0.8788889646530151,
"learning_rate": 9.177033492822968e-06,
"loss": 0.22554373741149902,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.253,
"step": 92,
"tokens/total": 376832,
"tokens/train_per_sec_per_gpu": 10.81,
"tokens/trainable": 27152
},
{
"epoch": 0.44285714285714284,
"grad_norm": 0.9059855341911316,
"learning_rate": 9.167464114832538e-06,
"loss": 0.20014435052871704,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.22158,
"step": 93,
"tokens/total": 380928,
"tokens/train_per_sec_per_gpu": 15.86,
"tokens/trainable": 27586
},
{
"epoch": 0.44761904761904764,
"grad_norm": 0.8185603618621826,
"learning_rate": 9.157894736842105e-06,
"loss": 0.18692737817764282,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.20554,
"step": 94,
"tokens/total": 385024,
"tokens/train_per_sec_per_gpu": 12.94,
"tokens/trainable": 27867
},
{
"epoch": 0.4523809523809524,
"grad_norm": 1.0522328615188599,
"learning_rate": 9.148325358851675e-06,
"loss": 0.30514901876449585,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.35683,
"step": 95,
"tokens/total": 389120,
"tokens/train_per_sec_per_gpu": 15.6,
"tokens/trainable": 28154
},
{
"epoch": 0.45714285714285713,
"grad_norm": 1.0001094341278076,
"learning_rate": 9.138755980861244e-06,
"loss": 0.31013065576553345,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.3636,
"step": 96,
"tokens/total": 393216,
"tokens/train_per_sec_per_gpu": 20.17,
"tokens/trainable": 28497
},
{
"epoch": 0.46190476190476193,
"grad_norm": 0.6931004524230957,
"learning_rate": 9.129186602870813e-06,
"loss": 0.22375206649303436,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.25076,
"step": 97,
"tokens/total": 397312,
"tokens/train_per_sec_per_gpu": 13.8,
"tokens/trainable": 28826
},
{
"epoch": 0.4666666666666667,
"grad_norm": 0.9354197978973389,
"learning_rate": 9.119617224880385e-06,
"loss": 0.2702368199825287,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.31027,
"step": 98,
"tokens/total": 401408,
"tokens/train_per_sec_per_gpu": 12.0,
"tokens/trainable": 29085
},
{
"epoch": 0.4714285714285714,
"grad_norm": 0.656976044178009,
"learning_rate": 9.110047846889954e-06,
"loss": 0.16342169046401978,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17753,
"step": 99,
"tokens/total": 405504,
"tokens/train_per_sec_per_gpu": 12.56,
"tokens/trainable": 29361
},
{
"epoch": 0.47619047619047616,
"grad_norm": 0.7472529411315918,
"learning_rate": 9.100478468899522e-06,
"loss": 0.2030039131641388,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.22508,
"step": 100,
"tokens/total": 409600,
"tokens/train_per_sec_per_gpu": 9.78,
"tokens/trainable": 29583
},
{
"epoch": 0.48095238095238096,
"grad_norm": 0.8217137455940247,
"learning_rate": 9.090909090909091e-06,
"loss": 0.26452142000198364,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.30281,
"step": 101,
"tokens/total": 413696,
"tokens/train_per_sec_per_gpu": 17.67,
"tokens/trainable": 29942
},
{
"epoch": 0.4857142857142857,
"grad_norm": 0.7122595310211182,
"learning_rate": 9.08133971291866e-06,
"loss": 0.2568754553794861,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.29288,
"step": 102,
"tokens/total": 417792,
"tokens/train_per_sec_per_gpu": 17.56,
"tokens/trainable": 30371
},
{
"epoch": 0.49047619047619045,
"grad_norm": 1.2763384580612183,
"learning_rate": 9.07177033492823e-06,
"loss": 0.18725821375846863,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.20594,
"step": 103,
"tokens/total": 421888,
"tokens/train_per_sec_per_gpu": 9.5,
"tokens/trainable": 30564
},
{
"epoch": 0.49523809523809526,
"grad_norm": 0.7632704973220825,
"learning_rate": 9.0622009569378e-06,
"loss": 0.22999542951583862,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.25859,
"step": 104,
"tokens/total": 425984,
"tokens/train_per_sec_per_gpu": 13.28,
"tokens/trainable": 30867
},
{
"epoch": 0.5,
"grad_norm": 0.5632386803627014,
"learning_rate": 9.05263157894737e-06,
"loss": 0.15592020750045776,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16873,
"step": 105,
"tokens/total": 430080,
"tokens/train_per_sec_per_gpu": 15.86,
"tokens/trainable": 31168
},
{
"epoch": 0.5047619047619047,
"grad_norm": 0.6003026962280273,
"learning_rate": 9.043062200956938e-06,
"loss": 0.20485958456993103,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.22735,
"step": 106,
"tokens/total": 434176,
"tokens/train_per_sec_per_gpu": 14.32,
"tokens/trainable": 31478
},
{
"epoch": 0.5095238095238095,
"grad_norm": 0.8614497184753418,
"learning_rate": 9.033492822966507e-06,
"loss": 0.14312103390693665,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15387,
"step": 107,
"tokens/total": 438272,
"tokens/train_per_sec_per_gpu": 7.5,
"tokens/trainable": 31666
},
{
"epoch": 0.5142857142857142,
"grad_norm": 0.5496851205825806,
"learning_rate": 9.023923444976077e-06,
"loss": 0.21571555733680725,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.24075,
"step": 108,
"tokens/total": 442368,
"tokens/train_per_sec_per_gpu": 9.59,
"tokens/trainable": 32019
},
{
"epoch": 0.5190476190476191,
"grad_norm": 0.9730420112609863,
"learning_rate": 9.014354066985646e-06,
"loss": 0.15710116922855377,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17011,
"step": 109,
"tokens/total": 446464,
"tokens/train_per_sec_per_gpu": 11.14,
"tokens/trainable": 32262
},
{
"epoch": 0.5238095238095238,
"grad_norm": 0.7044121026992798,
"learning_rate": 9.004784688995216e-06,
"loss": 0.15290921926498413,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.16522,
"step": 110,
"tokens/total": 450560,
"tokens/train_per_sec_per_gpu": 12.39,
"tokens/trainable": 32499
},
{
"epoch": 0.5285714285714286,
"grad_norm": 0.8730543851852417,
"learning_rate": 8.995215311004785e-06,
"loss": 0.2936154305934906,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.34127,
"step": 111,
"tokens/total": 454656,
"tokens/train_per_sec_per_gpu": 10.61,
"tokens/trainable": 32752
},
{
"epoch": 0.5333333333333333,
"grad_norm": 1.0952787399291992,
"learning_rate": 8.985645933014356e-06,
"loss": 0.2779211699962616,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.32038,
"step": 112,
"tokens/total": 458752,
"tokens/train_per_sec_per_gpu": 8.53,
"tokens/trainable": 32977
},
{
"epoch": 0.5380952380952381,
"grad_norm": 0.8119493126869202,
"learning_rate": 8.976076555023924e-06,
"loss": 0.16085243225097656,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17451,
"step": 113,
"tokens/total": 462848,
"tokens/train_per_sec_per_gpu": 11.2,
"tokens/trainable": 33218
},
{
"epoch": 0.5428571428571428,
"grad_norm": 0.9444132447242737,
"learning_rate": 8.966507177033493e-06,
"loss": 0.23129265010356903,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.26023,
"step": 114,
"tokens/total": 466944,
"tokens/train_per_sec_per_gpu": 18.1,
"tokens/trainable": 33530
},
{
"epoch": 0.5476190476190477,
"grad_norm": 0.7226268649101257,
"learning_rate": 8.956937799043062e-06,
"loss": 0.1263541579246521,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13468,
"step": 115,
"tokens/total": 471040,
"tokens/train_per_sec_per_gpu": 9.2,
"tokens/trainable": 33777
},
{
"epoch": 0.5523809523809524,
"grad_norm": 0.5879023671150208,
"learning_rate": 8.947368421052632e-06,
"loss": 0.1447187066078186,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15571,
"step": 116,
"tokens/total": 475136,
"tokens/train_per_sec_per_gpu": 18.97,
"tokens/trainable": 34086
},
{
"epoch": 0.5571428571428572,
"grad_norm": 0.6943342089653015,
"learning_rate": 8.937799043062201e-06,
"loss": 0.21247875690460205,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.23674,
"step": 117,
"tokens/total": 479232,
"tokens/train_per_sec_per_gpu": 21.7,
"tokens/trainable": 34575
},
{
"epoch": 0.5619047619047619,
"grad_norm": 0.5375131368637085,
"learning_rate": 8.92822966507177e-06,
"loss": 0.11210613697767258,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11863,
"step": 118,
"tokens/total": 483328,
"tokens/train_per_sec_per_gpu": 12.39,
"tokens/trainable": 34863
},
{
"epoch": 0.5666666666666667,
"grad_norm": 0.4493964612483978,
"learning_rate": 8.91866028708134e-06,
"loss": 0.12835997343063354,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13696,
"step": 119,
"tokens/total": 487424,
"tokens/train_per_sec_per_gpu": 12.58,
"tokens/trainable": 35131
},
{
"epoch": 0.5714285714285714,
"grad_norm": 0.49881812930107117,
"learning_rate": 8.90909090909091e-06,
"loss": 0.09497980773448944,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09964,
"step": 120,
"tokens/total": 491520,
"tokens/train_per_sec_per_gpu": 11.47,
"tokens/trainable": 35390
},
{
"epoch": 0.5761904761904761,
"grad_norm": 0.3289479911327362,
"learning_rate": 8.899521531100479e-06,
"loss": 0.10585616528987885,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11166,
"step": 121,
"tokens/total": 495616,
"tokens/train_per_sec_per_gpu": 19.33,
"tokens/trainable": 35769
},
{
"epoch": 0.580952380952381,
"grad_norm": 0.4215591847896576,
"learning_rate": 8.889952153110048e-06,
"loss": 0.12260347604751587,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13044,
"step": 122,
"tokens/total": 499712,
"tokens/train_per_sec_per_gpu": 13.18,
"tokens/trainable": 36093
},
{
"epoch": 0.5857142857142857,
"grad_norm": 0.6320652961730957,
"learning_rate": 8.880382775119618e-06,
"loss": 0.19350723922252655,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.2135,
"step": 123,
"tokens/total": 503808,
"tokens/train_per_sec_per_gpu": 14.81,
"tokens/trainable": 36465
},
{
"epoch": 0.5904761904761905,
"grad_norm": 0.7369839549064636,
"learning_rate": 8.870813397129187e-06,
"loss": 0.2397083193063736,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.27088,
"step": 124,
"tokens/total": 507904,
"tokens/train_per_sec_per_gpu": 18.95,
"tokens/trainable": 36788
},
{
"epoch": 0.5952380952380952,
"grad_norm": 0.5524533987045288,
"learning_rate": 8.861244019138756e-06,
"loss": 0.1478738933801651,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15937,
"step": 125,
"tokens/total": 512000,
"tokens/train_per_sec_per_gpu": 14.28,
"tokens/trainable": 37133
},
{
"epoch": 0.6,
"grad_norm": 0.7409418821334839,
"learning_rate": 8.851674641148326e-06,
"loss": 0.2038002759218216,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.22605,
"step": 126,
"tokens/total": 516096,
"tokens/train_per_sec_per_gpu": 13.53,
"tokens/trainable": 37417
},
{
"epoch": 0.6047619047619047,
"grad_norm": 0.8146377801895142,
"learning_rate": 8.842105263157895e-06,
"loss": 0.22553369402885437,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.25299,
"step": 127,
"tokens/total": 520192,
"tokens/train_per_sec_per_gpu": 9.81,
"tokens/trainable": 37702
},
{
"epoch": 0.6095238095238096,
"grad_norm": 0.6468098163604736,
"learning_rate": 8.832535885167465e-06,
"loss": 0.16511306166648865,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.17953,
"step": 128,
"tokens/total": 524288,
"tokens/train_per_sec_per_gpu": 20.78,
"tokens/trainable": 38034
},
{
"epoch": 0.6142857142857143,
"grad_norm": 0.8367134928703308,
"learning_rate": 8.822966507177034e-06,
"loss": 0.11573076993227005,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12269,
"step": 129,
"tokens/total": 528384,
"tokens/train_per_sec_per_gpu": 10.99,
"tokens/trainable": 38273
},
{
"epoch": 0.6190476190476191,
"grad_norm": 0.4852752089500427,
"learning_rate": 8.813397129186603e-06,
"loss": 0.13677959144115448,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14658,
"step": 130,
"tokens/total": 532480,
"tokens/train_per_sec_per_gpu": 10.06,
"tokens/trainable": 38493
},
{
"epoch": 0.6238095238095238,
"grad_norm": 0.5373315811157227,
"learning_rate": 8.803827751196173e-06,
"loss": 0.16031202673912048,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17388,
"step": 131,
"tokens/total": 536576,
"tokens/train_per_sec_per_gpu": 13.34,
"tokens/trainable": 38840
},
{
"epoch": 0.6285714285714286,
"grad_norm": 0.9102168679237366,
"learning_rate": 8.794258373205742e-06,
"loss": 0.30758410692214966,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.36014,
"step": 132,
"tokens/total": 540672,
"tokens/train_per_sec_per_gpu": 15.05,
"tokens/trainable": 39169
},
{
"epoch": 0.6333333333333333,
"grad_norm": 1.0897072553634644,
"learning_rate": 8.784688995215311e-06,
"loss": 0.21592794358730316,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.24101,
"step": 133,
"tokens/total": 544768,
"tokens/train_per_sec_per_gpu": 8.43,
"tokens/trainable": 39424
},
{
"epoch": 0.638095238095238,
"grad_norm": 0.6847906708717346,
"learning_rate": 8.775119617224881e-06,
"loss": 0.18241584300994873,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.20011,
"step": 134,
"tokens/total": 548864,
"tokens/train_per_sec_per_gpu": 10.91,
"tokens/trainable": 39650
},
{
"epoch": 0.6428571428571429,
"grad_norm": 0.6738935708999634,
"learning_rate": 8.76555023923445e-06,
"loss": 0.2037346065044403,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.22597,
"step": 135,
"tokens/total": 552960,
"tokens/train_per_sec_per_gpu": 15.05,
"tokens/trainable": 39957
},
{
"epoch": 0.6476190476190476,
"grad_norm": 1.0508428812026978,
"learning_rate": 8.75598086124402e-06,
"loss": 0.21129491925239563,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.23528,
"step": 136,
"tokens/total": 557056,
"tokens/train_per_sec_per_gpu": 10.28,
"tokens/trainable": 40219
},
{
"epoch": 0.6523809523809524,
"grad_norm": 0.7576251029968262,
"learning_rate": 8.746411483253589e-06,
"loss": 0.1137838065624237,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12051,
"step": 137,
"tokens/total": 561152,
"tokens/train_per_sec_per_gpu": 9.86,
"tokens/trainable": 40497
},
{
"epoch": 0.6571428571428571,
"grad_norm": 1.433799147605896,
"learning_rate": 8.736842105263158e-06,
"loss": 0.31193768978118896,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.36607,
"step": 138,
"tokens/total": 565248,
"tokens/train_per_sec_per_gpu": 15.47,
"tokens/trainable": 40802
},
{
"epoch": 0.6619047619047619,
"grad_norm": 0.9841307997703552,
"learning_rate": 8.727272727272728e-06,
"loss": 0.17987215518951416,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.19706,
"step": 139,
"tokens/total": 569344,
"tokens/train_per_sec_per_gpu": 9.93,
"tokens/trainable": 41048
},
{
"epoch": 0.6666666666666666,
"grad_norm": 0.7832286357879639,
"learning_rate": 8.717703349282297e-06,
"loss": 0.21015842258930206,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.23387,
"step": 140,
"tokens/total": 573440,
"tokens/train_per_sec_per_gpu": 18.11,
"tokens/trainable": 41428
},
{
"epoch": 0.6714285714285714,
"grad_norm": 0.8383325934410095,
"learning_rate": 8.708133971291867e-06,
"loss": 0.21185638010501862,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.23597,
"step": 141,
"tokens/total": 577536,
"tokens/train_per_sec_per_gpu": 14.71,
"tokens/trainable": 41744
},
{
"epoch": 0.6761904761904762,
"grad_norm": 0.680001437664032,
"learning_rate": 8.698564593301436e-06,
"loss": 0.21891218423843384,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.24472,
"step": 142,
"tokens/total": 581632,
"tokens/train_per_sec_per_gpu": 16.03,
"tokens/trainable": 42065
},
{
"epoch": 0.680952380952381,
"grad_norm": 0.6654219031333923,
"learning_rate": 8.688995215311005e-06,
"loss": 0.16606123745441437,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.18065,
"step": 143,
"tokens/total": 585728,
"tokens/train_per_sec_per_gpu": 16.31,
"tokens/trainable": 42389
},
{
"epoch": 0.6857142857142857,
"grad_norm": 0.9814354181289673,
"learning_rate": 8.679425837320575e-06,
"loss": 0.19918571412563324,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.22041,
"step": 144,
"tokens/total": 589824,
"tokens/train_per_sec_per_gpu": 22.97,
"tokens/trainable": 42791
},
{
"epoch": 0.6904761904761905,
"grad_norm": 0.7615348100662231,
"learning_rate": 8.669856459330144e-06,
"loss": 0.244194895029068,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.27659,
"step": 145,
"tokens/total": 593920,
"tokens/train_per_sec_per_gpu": 9.59,
"tokens/trainable": 43054
},
{
"epoch": 0.6952380952380952,
"grad_norm": 0.6813610196113586,
"learning_rate": 8.660287081339714e-06,
"loss": 0.21728792786598206,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.2427,
"step": 146,
"tokens/total": 598016,
"tokens/train_per_sec_per_gpu": 11.93,
"tokens/trainable": 43332
},
{
"epoch": 0.7,
"grad_norm": 0.7670934796333313,
"learning_rate": 8.650717703349283e-06,
"loss": 0.224639892578125,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.25187,
"step": 147,
"tokens/total": 602112,
"tokens/train_per_sec_per_gpu": 15.52,
"tokens/trainable": 43610
},
{
"epoch": 0.7047619047619048,
"grad_norm": 0.4526863992214203,
"learning_rate": 8.641148325358852e-06,
"loss": 0.14494425058364868,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.15598,
"step": 148,
"tokens/total": 606208,
"tokens/train_per_sec_per_gpu": 27.26,
"tokens/trainable": 44032
},
{
"epoch": 0.7095238095238096,
"grad_norm": 0.8980340957641602,
"learning_rate": 8.631578947368422e-06,
"loss": 0.23772993683815002,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.26837,
"step": 149,
"tokens/total": 610304,
"tokens/train_per_sec_per_gpu": 11.17,
"tokens/trainable": 44233
},
{
"epoch": 0.7142857142857143,
"grad_norm": 0.8445303440093994,
"learning_rate": 8.622009569377991e-06,
"loss": 0.21160978078842163,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.23567,
"step": 150,
"tokens/total": 614400,
"tokens/train_per_sec_per_gpu": 13.91,
"tokens/trainable": 44535
},
{
"epoch": 0.719047619047619,
"grad_norm": 0.9266573786735535,
"learning_rate": 8.61244019138756e-06,
"loss": 0.09477423876523972,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09941,
"step": 151,
"tokens/total": 618496,
"tokens/train_per_sec_per_gpu": 9.47,
"tokens/trainable": 44780
},
{
"epoch": 0.7238095238095238,
"grad_norm": 0.7422537803649902,
"learning_rate": 8.60287081339713e-06,
"loss": 0.12581270933151245,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13407,
"step": 152,
"tokens/total": 622592,
"tokens/train_per_sec_per_gpu": 10.39,
"tokens/trainable": 45041
},
{
"epoch": 0.7285714285714285,
"grad_norm": 0.709301233291626,
"learning_rate": 8.5933014354067e-06,
"loss": 0.1559009552001953,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16871,
"step": 153,
"tokens/total": 626688,
"tokens/train_per_sec_per_gpu": 16.34,
"tokens/trainable": 45354
},
{
"epoch": 0.7333333333333333,
"grad_norm": 0.710270345211029,
"learning_rate": 8.583732057416269e-06,
"loss": 0.16102313995361328,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17471,
"step": 154,
"tokens/total": 630784,
"tokens/train_per_sec_per_gpu": 13.98,
"tokens/trainable": 45679
},
{
"epoch": 0.7380952380952381,
"grad_norm": 0.5672938823699951,
"learning_rate": 8.574162679425838e-06,
"loss": 0.14538349211215973,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15648,
"step": 155,
"tokens/total": 634880,
"tokens/train_per_sec_per_gpu": 13.37,
"tokens/trainable": 46000
},
{
"epoch": 0.7428571428571429,
"grad_norm": 0.5063062906265259,
"learning_rate": 8.564593301435407e-06,
"loss": 0.1216127872467041,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12932,
"step": 156,
"tokens/total": 638976,
"tokens/train_per_sec_per_gpu": 15.37,
"tokens/trainable": 46248
},
{
"epoch": 0.7476190476190476,
"grad_norm": 0.8823851346969604,
"learning_rate": 8.555023923444977e-06,
"loss": 0.20955757796764374,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.23313,
"step": 157,
"tokens/total": 643072,
"tokens/train_per_sec_per_gpu": 15.44,
"tokens/trainable": 46557
},
{
"epoch": 0.7523809523809524,
"grad_norm": 0.6821964979171753,
"learning_rate": 8.545454545454546e-06,
"loss": 0.12059423327445984,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12817,
"step": 158,
"tokens/total": 647168,
"tokens/train_per_sec_per_gpu": 14.4,
"tokens/trainable": 46839
},
{
"epoch": 0.7571428571428571,
"grad_norm": 1.7155925035476685,
"learning_rate": 8.535885167464116e-06,
"loss": 0.16679029166698456,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.18151,
"step": 159,
"tokens/total": 651264,
"tokens/train_per_sec_per_gpu": 7.54,
"tokens/trainable": 47047
},
{
"epoch": 0.7619047619047619,
"grad_norm": 0.7815935015678406,
"learning_rate": 8.526315789473685e-06,
"loss": 0.20110413432121277,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.22275,
"step": 160,
"tokens/total": 655360,
"tokens/train_per_sec_per_gpu": 11.91,
"tokens/trainable": 47349
},
{
"epoch": 0.7666666666666667,
"grad_norm": 0.8044136762619019,
"learning_rate": 8.516746411483254e-06,
"loss": 0.1733863651752472,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.18933,
"step": 161,
"tokens/total": 659456,
"tokens/train_per_sec_per_gpu": 13.39,
"tokens/trainable": 47685
},
{
"epoch": 0.7714285714285715,
"grad_norm": 0.6603718400001526,
"learning_rate": 8.507177033492824e-06,
"loss": 0.13823741674423218,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14825,
"step": 162,
"tokens/total": 663552,
"tokens/train_per_sec_per_gpu": 13.32,
"tokens/trainable": 47978
},
{
"epoch": 0.7761904761904762,
"grad_norm": 0.7813670039176941,
"learning_rate": 8.497607655502393e-06,
"loss": 0.19184273481369019,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.21148,
"step": 163,
"tokens/total": 667648,
"tokens/train_per_sec_per_gpu": 14.04,
"tokens/trainable": 48239
},
{
"epoch": 0.780952380952381,
"grad_norm": 0.6289886832237244,
"learning_rate": 8.488038277511963e-06,
"loss": 0.12562716007232666,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13386,
"step": 164,
"tokens/total": 671744,
"tokens/train_per_sec_per_gpu": 9.43,
"tokens/trainable": 48462
},
{
"epoch": 0.7857142857142857,
"grad_norm": 0.7649319767951965,
"learning_rate": 8.478468899521532e-06,
"loss": 0.2198971062898636,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.24595,
"step": 165,
"tokens/total": 675840,
"tokens/train_per_sec_per_gpu": 14.98,
"tokens/trainable": 48758
},
{
"epoch": 0.7904761904761904,
"grad_norm": 0.793499231338501,
"learning_rate": 8.468899521531101e-06,
"loss": 0.1740531027317047,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.19012,
"step": 166,
"tokens/total": 679936,
"tokens/train_per_sec_per_gpu": 12.74,
"tokens/trainable": 49063
},
{
"epoch": 0.7952380952380952,
"grad_norm": 0.6194958090782166,
"learning_rate": 8.45933014354067e-06,
"loss": 0.11570701003074646,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12267,
"step": 167,
"tokens/total": 684032,
"tokens/train_per_sec_per_gpu": 12.72,
"tokens/trainable": 49304
},
{
"epoch": 0.8,
"grad_norm": 0.46994757652282715,
"learning_rate": 8.44976076555024e-06,
"loss": 0.09198522567749023,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09635,
"step": 168,
"tokens/total": 688128,
"tokens/train_per_sec_per_gpu": 16.65,
"tokens/trainable": 49632
},
{
"epoch": 0.8047619047619048,
"grad_norm": 0.7131854295730591,
"learning_rate": 8.44019138755981e-06,
"loss": 0.16379094123840332,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17797,
"step": 169,
"tokens/total": 692224,
"tokens/train_per_sec_per_gpu": 11.06,
"tokens/trainable": 49940
},
{
"epoch": 0.8095238095238095,
"grad_norm": 0.6772812008857727,
"learning_rate": 8.430622009569379e-06,
"loss": 0.13202588260173798,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14114,
"step": 170,
"tokens/total": 696320,
"tokens/train_per_sec_per_gpu": 9.54,
"tokens/trainable": 50179
},
{
"epoch": 0.8142857142857143,
"grad_norm": 0.8214194774627686,
"learning_rate": 8.421052631578948e-06,
"loss": 0.19660362601280212,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.21726,
"step": 171,
"tokens/total": 700416,
"tokens/train_per_sec_per_gpu": 15.79,
"tokens/trainable": 50476
},
{
"epoch": 0.819047619047619,
"grad_norm": 0.6981196403503418,
"learning_rate": 8.411483253588518e-06,
"loss": 0.1562727838754654,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.16915,
"step": 172,
"tokens/total": 704512,
"tokens/train_per_sec_per_gpu": 10.79,
"tokens/trainable": 50755
},
{
"epoch": 0.8238095238095238,
"grad_norm": 0.884662389755249,
"learning_rate": 8.401913875598087e-06,
"loss": 0.19947463274002075,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.22076,
"step": 173,
"tokens/total": 708608,
"tokens/train_per_sec_per_gpu": 11.33,
"tokens/trainable": 51003
},
{
"epoch": 0.8285714285714286,
"grad_norm": 0.7139277458190918,
"learning_rate": 8.392344497607656e-06,
"loss": 0.19828957319259644,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.21932,
"step": 174,
"tokens/total": 712704,
"tokens/train_per_sec_per_gpu": 11.04,
"tokens/trainable": 51257
},
{
"epoch": 0.8333333333333334,
"grad_norm": 0.5720876455307007,
"learning_rate": 8.382775119617226e-06,
"loss": 0.11307372152805328,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11971,
"step": 175,
"tokens/total": 716800,
"tokens/train_per_sec_per_gpu": 10.63,
"tokens/trainable": 51499
},
{
"epoch": 0.8380952380952381,
"grad_norm": 0.8213474154472351,
"learning_rate": 8.373205741626795e-06,
"loss": 0.21523649990558624,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.24016,
"step": 176,
"tokens/total": 720896,
"tokens/train_per_sec_per_gpu": 17.26,
"tokens/trainable": 51805
},
{
"epoch": 0.8428571428571429,
"grad_norm": 0.5487144589424133,
"learning_rate": 8.363636363636365e-06,
"loss": 0.14880937337875366,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16045,
"step": 177,
"tokens/total": 724992,
"tokens/train_per_sec_per_gpu": 11.26,
"tokens/trainable": 52127
},
{
"epoch": 0.8476190476190476,
"grad_norm": 1.5928086042404175,
"learning_rate": 8.354066985645934e-06,
"loss": 0.18438681960105896,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.20248,
"step": 178,
"tokens/total": 729088,
"tokens/train_per_sec_per_gpu": 10.2,
"tokens/trainable": 52374
},
{
"epoch": 0.8523809523809524,
"grad_norm": 0.872934103012085,
"learning_rate": 8.344497607655503e-06,
"loss": 0.15895763039588928,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.17229,
"step": 179,
"tokens/total": 733184,
"tokens/train_per_sec_per_gpu": 10.91,
"tokens/trainable": 52612
},
{
"epoch": 0.8571428571428571,
"grad_norm": 0.7492268085479736,
"learning_rate": 8.334928229665073e-06,
"loss": 0.19397899508476257,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.21407,
"step": 180,
"tokens/total": 737280,
"tokens/train_per_sec_per_gpu": 11.08,
"tokens/trainable": 52935
},
{
"epoch": 0.861904761904762,
"grad_norm": 1.050233244895935,
"learning_rate": 8.325358851674642e-06,
"loss": 0.09477034956216812,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09941,
"step": 181,
"tokens/total": 741376,
"tokens/train_per_sec_per_gpu": 9.84,
"tokens/trainable": 53220
},
{
"epoch": 0.8666666666666667,
"grad_norm": 0.4782058894634247,
"learning_rate": 8.315789473684212e-06,
"loss": 0.11910860240459442,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12649,
"step": 182,
"tokens/total": 745472,
"tokens/train_per_sec_per_gpu": 16.75,
"tokens/trainable": 53535
},
{
"epoch": 0.8714285714285714,
"grad_norm": 0.906046986579895,
"learning_rate": 8.306220095693781e-06,
"loss": 0.2756553590297699,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.31739,
"step": 183,
"tokens/total": 749568,
"tokens/train_per_sec_per_gpu": 9.67,
"tokens/trainable": 53797
},
{
"epoch": 0.8761904761904762,
"grad_norm": 0.8429417014122009,
"learning_rate": 8.29665071770335e-06,
"loss": 0.15779748558998108,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17093,
"step": 184,
"tokens/total": 753664,
"tokens/train_per_sec_per_gpu": 24.29,
"tokens/trainable": 54194
},
{
"epoch": 0.8809523809523809,
"grad_norm": 1.0448087453842163,
"learning_rate": 8.28708133971292e-06,
"loss": 0.1565137505531311,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16943,
"step": 185,
"tokens/total": 757760,
"tokens/train_per_sec_per_gpu": 10.63,
"tokens/trainable": 54403
},
{
"epoch": 0.8857142857142857,
"grad_norm": 0.760995626449585,
"learning_rate": 8.277511961722489e-06,
"loss": 0.21484459936618805,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.23967,
"step": 186,
"tokens/total": 761856,
"tokens/train_per_sec_per_gpu": 22.28,
"tokens/trainable": 54744
},
{
"epoch": 0.8904761904761904,
"grad_norm": 0.6110489368438721,
"learning_rate": 8.267942583732058e-06,
"loss": 0.15965917706489563,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17311,
"step": 187,
"tokens/total": 765952,
"tokens/train_per_sec_per_gpu": 13.98,
"tokens/trainable": 55043
},
{
"epoch": 0.8952380952380953,
"grad_norm": 0.6338987350463867,
"learning_rate": 8.258373205741628e-06,
"loss": 0.1492011845111847,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.16091,
"step": 188,
"tokens/total": 770048,
"tokens/train_per_sec_per_gpu": 13.88,
"tokens/trainable": 55329
},
{
"epoch": 0.9,
"grad_norm": 0.6387603878974915,
"learning_rate": 8.248803827751197e-06,
"loss": 0.1357661634683609,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14541,
"step": 189,
"tokens/total": 774144,
"tokens/train_per_sec_per_gpu": 11.66,
"tokens/trainable": 55601
},
{
"epoch": 0.9047619047619048,
"grad_norm": 0.49371299147605896,
"learning_rate": 8.239234449760765e-06,
"loss": 0.12431974709033966,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13238,
"step": 190,
"tokens/total": 778240,
"tokens/train_per_sec_per_gpu": 10.34,
"tokens/trainable": 55919
},
{
"epoch": 0.9095238095238095,
"grad_norm": 0.6698276400566101,
"learning_rate": 8.229665071770336e-06,
"loss": 0.1634908765554428,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.17761,
"step": 191,
"tokens/total": 782336,
"tokens/train_per_sec_per_gpu": 13.4,
"tokens/trainable": 56188
},
{
"epoch": 0.9142857142857143,
"grad_norm": 0.8588296175003052,
"learning_rate": 8.220095693779905e-06,
"loss": 0.12147596478462219,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12916,
"step": 192,
"tokens/total": 786432,
"tokens/train_per_sec_per_gpu": 10.73,
"tokens/trainable": 56440
},
{
"epoch": 0.919047619047619,
"grad_norm": 0.742889940738678,
"learning_rate": 8.210526315789475e-06,
"loss": 0.11071045696735382,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11707,
"step": 193,
"tokens/total": 790528,
"tokens/train_per_sec_per_gpu": 17.25,
"tokens/trainable": 56765
},
{
"epoch": 0.9238095238095239,
"grad_norm": 0.6750599145889282,
"learning_rate": 8.200956937799044e-06,
"loss": 0.1338326781988144,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1432,
"step": 194,
"tokens/total": 794624,
"tokens/train_per_sec_per_gpu": 13.36,
"tokens/trainable": 57089
},
{
"epoch": 0.9285714285714286,
"grad_norm": 0.6421961784362793,
"learning_rate": 8.191387559808614e-06,
"loss": 0.14603616297245026,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15724,
"step": 195,
"tokens/total": 798720,
"tokens/train_per_sec_per_gpu": 12.22,
"tokens/trainable": 57404
},
{
"epoch": 0.9333333333333333,
"grad_norm": 1.3169405460357666,
"learning_rate": 8.181818181818183e-06,
"loss": 0.1660291999578476,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.18061,
"step": 196,
"tokens/total": 802816,
"tokens/train_per_sec_per_gpu": 8.48,
"tokens/trainable": 57637
},
{
"epoch": 0.9380952380952381,
"grad_norm": 0.6492071151733398,
"learning_rate": 8.17224880382775e-06,
"loss": 0.16259926557540894,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17657,
"step": 197,
"tokens/total": 806912,
"tokens/train_per_sec_per_gpu": 14.91,
"tokens/trainable": 58007
},
{
"epoch": 0.9428571428571428,
"grad_norm": 0.6238608956336975,
"learning_rate": 8.162679425837322e-06,
"loss": 0.1267922967672348,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13518,
"step": 198,
"tokens/total": 811008,
"tokens/train_per_sec_per_gpu": 17.72,
"tokens/trainable": 58294
},
{
"epoch": 0.9476190476190476,
"grad_norm": 0.8982058167457581,
"learning_rate": 8.153110047846891e-06,
"loss": 0.11205602437257767,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11858,
"step": 199,
"tokens/total": 815104,
"tokens/train_per_sec_per_gpu": 14.64,
"tokens/trainable": 58635
},
{
"epoch": 0.9523809523809523,
"grad_norm": 0.6866769790649414,
"learning_rate": 8.14354066985646e-06,
"loss": 0.18688730895519257,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.20549,
"step": 200,
"tokens/total": 819200,
"tokens/train_per_sec_per_gpu": 15.36,
"tokens/trainable": 58983
},
{
"epoch": 0.9571428571428572,
"grad_norm": 0.7195040583610535,
"learning_rate": 8.13397129186603e-06,
"loss": 0.14748433232307434,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15892,
"step": 201,
"tokens/total": 823296,
"tokens/train_per_sec_per_gpu": 9.98,
"tokens/trainable": 59225
},
{
"epoch": 0.9619047619047619,
"grad_norm": 0.5893474817276001,
"learning_rate": 8.1244019138756e-06,
"loss": 0.11337488144636154,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12005,
"step": 202,
"tokens/total": 827392,
"tokens/train_per_sec_per_gpu": 14.95,
"tokens/trainable": 59527
},
{
"epoch": 0.9666666666666667,
"grad_norm": 0.8447104096412659,
"learning_rate": 8.114832535885167e-06,
"loss": 0.14601489901542664,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15721,
"step": 203,
"tokens/total": 831488,
"tokens/train_per_sec_per_gpu": 13.82,
"tokens/trainable": 59774
},
{
"epoch": 0.9714285714285714,
"grad_norm": 0.7004845142364502,
"learning_rate": 8.105263157894736e-06,
"loss": 0.1523507833480835,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16457,
"step": 204,
"tokens/total": 835584,
"tokens/train_per_sec_per_gpu": 9.08,
"tokens/trainable": 60017
},
{
"epoch": 0.9761904761904762,
"grad_norm": 0.8089159727096558,
"learning_rate": 8.095693779904307e-06,
"loss": 0.07807943224906921,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08121,
"step": 205,
"tokens/total": 839680,
"tokens/train_per_sec_per_gpu": 9.57,
"tokens/trainable": 60304
},
{
"epoch": 0.9809523809523809,
"grad_norm": 1.0327520370483398,
"learning_rate": 8.086124401913877e-06,
"loss": 0.14542421698570251,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15653,
"step": 206,
"tokens/total": 843776,
"tokens/train_per_sec_per_gpu": 12.38,
"tokens/trainable": 60538
},
{
"epoch": 0.9857142857142858,
"grad_norm": 0.551845371723175,
"learning_rate": 8.076555023923446e-06,
"loss": 0.10232502222061157,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.10774,
"step": 207,
"tokens/total": 847872,
"tokens/train_per_sec_per_gpu": 11.11,
"tokens/trainable": 60799
},
{
"epoch": 0.9904761904761905,
"grad_norm": 0.7714454531669617,
"learning_rate": 8.066985645933016e-06,
"loss": 0.14636501669883728,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15762,
"step": 208,
"tokens/total": 851968,
"tokens/train_per_sec_per_gpu": 11.33,
"tokens/trainable": 61041
},
{
"epoch": 0.9952380952380953,
"grad_norm": 0.6568189859390259,
"learning_rate": 8.057416267942585e-06,
"loss": 0.12750931084156036,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.136,
"step": 209,
"tokens/total": 856064,
"tokens/train_per_sec_per_gpu": 12.49,
"tokens/trainable": 61298
},
{
"epoch": 1.0,
"grad_norm": 0.532839298248291,
"learning_rate": 8.047846889952153e-06,
"loss": 0.09202240407466888,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09639,
"step": 210,
"tokens/total": 860160,
"tokens/train_per_sec_per_gpu": 8.6,
"tokens/trainable": 61610
},
{
"epoch": 1.0,
"eval_loss": 0.13460691273212433,
"eval_ppl": 1.14409,
"eval_runtime": 10.3792,
"eval_samples_per_second": 8.575,
"eval_steps_per_second": 2.216,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 35.58,
"memory/max_allocated (GiB)": 35.58,
"step": 210
},
{
"epoch": 1.0047619047619047,
"grad_norm": 0.6392420530319214,
"learning_rate": 8.038277511961722e-06,
"loss": 0.10671957582235336,
"memory/device_reserved (GiB)": 39.15,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11262,
"step": 211,
"tokens/total": 864256,
"tokens/train_per_sec_per_gpu": 11.9,
"tokens/trainable": 61889
},
{
"epoch": 1.0095238095238095,
"grad_norm": 0.5944091081619263,
"learning_rate": 8.028708133971293e-06,
"loss": 0.12425249814987183,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1323,
"step": 212,
"tokens/total": 868352,
"tokens/train_per_sec_per_gpu": 17.77,
"tokens/trainable": 62213
},
{
"epoch": 1.0142857142857142,
"grad_norm": 0.7566636800765991,
"learning_rate": 8.019138755980863e-06,
"loss": 0.1521780788898468,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.16437,
"step": 213,
"tokens/total": 872448,
"tokens/train_per_sec_per_gpu": 14.35,
"tokens/trainable": 62580
},
{
"epoch": 1.019047619047619,
"grad_norm": 0.7836124300956726,
"learning_rate": 8.009569377990432e-06,
"loss": 0.16885873675346375,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.18395,
"step": 214,
"tokens/total": 876544,
"tokens/train_per_sec_per_gpu": 8.6,
"tokens/trainable": 62834
},
{
"epoch": 1.0238095238095237,
"grad_norm": 0.6088077425956726,
"learning_rate": 8.000000000000001e-06,
"loss": 0.10565628111362457,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11144,
"step": 215,
"tokens/total": 880640,
"tokens/train_per_sec_per_gpu": 11.49,
"tokens/trainable": 63092
},
{
"epoch": 1.0285714285714285,
"grad_norm": 0.6194921731948853,
"learning_rate": 7.990430622009569e-06,
"loss": 0.09690128266811371,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10175,
"step": 216,
"tokens/total": 884736,
"tokens/train_per_sec_per_gpu": 9.38,
"tokens/trainable": 63383
},
{
"epoch": 1.0333333333333334,
"grad_norm": 0.6402537226676941,
"learning_rate": 7.980861244019138e-06,
"loss": 0.11445532739162445,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12126,
"step": 217,
"tokens/total": 888832,
"tokens/train_per_sec_per_gpu": 21.21,
"tokens/trainable": 63780
},
{
"epoch": 1.0380952380952382,
"grad_norm": 0.5895891785621643,
"learning_rate": 7.971291866028708e-06,
"loss": 0.12593643367290497,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13421,
"step": 218,
"tokens/total": 892928,
"tokens/train_per_sec_per_gpu": 13.17,
"tokens/trainable": 64069
},
{
"epoch": 1.042857142857143,
"grad_norm": 0.7168067097663879,
"learning_rate": 7.961722488038279e-06,
"loss": 0.14395299553871155,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15483,
"step": 219,
"tokens/total": 897024,
"tokens/train_per_sec_per_gpu": 13.16,
"tokens/trainable": 64317
},
{
"epoch": 1.0476190476190477,
"grad_norm": 0.9142693877220154,
"learning_rate": 7.952153110047848e-06,
"loss": 0.10631201416254044,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11217,
"step": 220,
"tokens/total": 901120,
"tokens/train_per_sec_per_gpu": 19.77,
"tokens/trainable": 64698
},
{
"epoch": 1.0523809523809524,
"grad_norm": 0.5825505256652832,
"learning_rate": 7.942583732057418e-06,
"loss": 0.10505223274230957,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11077,
"step": 221,
"tokens/total": 905216,
"tokens/train_per_sec_per_gpu": 11.69,
"tokens/trainable": 64991
},
{
"epoch": 1.0571428571428572,
"grad_norm": 0.5183160901069641,
"learning_rate": 7.933014354066987e-06,
"loss": 0.08044271171092987,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08377,
"step": 222,
"tokens/total": 909312,
"tokens/train_per_sec_per_gpu": 11.2,
"tokens/trainable": 65202
},
{
"epoch": 1.061904761904762,
"grad_norm": 0.5459516048431396,
"learning_rate": 7.923444976076555e-06,
"loss": 0.0791759341955185,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.08239,
"step": 223,
"tokens/total": 913408,
"tokens/train_per_sec_per_gpu": 15.83,
"tokens/trainable": 65524
},
{
"epoch": 1.0666666666666667,
"grad_norm": 0.767754852771759,
"learning_rate": 7.913875598086124e-06,
"loss": 0.13113239407539368,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14012,
"step": 224,
"tokens/total": 917504,
"tokens/train_per_sec_per_gpu": 21.59,
"tokens/trainable": 65856
},
{
"epoch": 1.0714285714285714,
"grad_norm": 0.645051121711731,
"learning_rate": 7.904306220095695e-06,
"loss": 0.14703069627285004,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15839,
"step": 225,
"tokens/total": 921600,
"tokens/train_per_sec_per_gpu": 13.94,
"tokens/trainable": 66181
},
{
"epoch": 1.0761904761904761,
"grad_norm": 0.4971192181110382,
"learning_rate": 7.894736842105265e-06,
"loss": 0.08223872631788254,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08571,
"step": 226,
"tokens/total": 925696,
"tokens/train_per_sec_per_gpu": 11.49,
"tokens/trainable": 66466
},
{
"epoch": 1.0809523809523809,
"grad_norm": 0.34934762120246887,
"learning_rate": 7.885167464114834e-06,
"loss": 0.08169053494930267,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08512,
"step": 227,
"tokens/total": 929792,
"tokens/train_per_sec_per_gpu": 12.48,
"tokens/trainable": 66824
},
{
"epoch": 1.0857142857142856,
"grad_norm": 0.5710490345954895,
"learning_rate": 7.875598086124403e-06,
"loss": 0.11047933995723724,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11681,
"step": 228,
"tokens/total": 933888,
"tokens/train_per_sec_per_gpu": 20.36,
"tokens/trainable": 67193
},
{
"epoch": 1.0904761904761904,
"grad_norm": 0.6241896748542786,
"learning_rate": 7.866028708133971e-06,
"loss": 0.08586344122886658,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08966,
"step": 229,
"tokens/total": 937984,
"tokens/train_per_sec_per_gpu": 15.51,
"tokens/trainable": 67473
},
{
"epoch": 1.0952380952380953,
"grad_norm": 0.594308614730835,
"learning_rate": 7.85645933014354e-06,
"loss": 0.11477260291576385,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12162,
"step": 230,
"tokens/total": 942080,
"tokens/train_per_sec_per_gpu": 13.98,
"tokens/trainable": 67737
},
{
"epoch": 1.1,
"grad_norm": 0.5714224576950073,
"learning_rate": 7.84688995215311e-06,
"loss": 0.12829524278640747,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13689,
"step": 231,
"tokens/total": 946176,
"tokens/train_per_sec_per_gpu": 20.84,
"tokens/trainable": 68052
},
{
"epoch": 1.1047619047619048,
"grad_norm": 0.8406590819358826,
"learning_rate": 7.837320574162681e-06,
"loss": 0.1560124307870865,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16884,
"step": 232,
"tokens/total": 950272,
"tokens/train_per_sec_per_gpu": 10.72,
"tokens/trainable": 68285
},
{
"epoch": 1.1095238095238096,
"grad_norm": 0.7849947810173035,
"learning_rate": 7.82775119617225e-06,
"loss": 0.14618279039859772,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15741,
"step": 233,
"tokens/total": 954368,
"tokens/train_per_sec_per_gpu": 10.91,
"tokens/trainable": 68562
},
{
"epoch": 1.1142857142857143,
"grad_norm": 0.6889620423316956,
"learning_rate": 7.81818181818182e-06,
"loss": 0.13402847945690155,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14343,
"step": 234,
"tokens/total": 958464,
"tokens/train_per_sec_per_gpu": 13.99,
"tokens/trainable": 68995
},
{
"epoch": 1.119047619047619,
"grad_norm": 0.5359621644020081,
"learning_rate": 7.808612440191387e-06,
"loss": 0.09991563856601715,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10508,
"step": 235,
"tokens/total": 962560,
"tokens/train_per_sec_per_gpu": 12.45,
"tokens/trainable": 69277
},
{
"epoch": 1.1238095238095238,
"grad_norm": 0.8721844553947449,
"learning_rate": 7.799043062200957e-06,
"loss": 0.11624078452587128,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12327,
"step": 236,
"tokens/total": 966656,
"tokens/train_per_sec_per_gpu": 15.46,
"tokens/trainable": 69547
},
{
"epoch": 1.1285714285714286,
"grad_norm": 0.5049797892570496,
"learning_rate": 7.789473684210526e-06,
"loss": 0.10903551429510117,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1152,
"step": 237,
"tokens/total": 970752,
"tokens/train_per_sec_per_gpu": 13.01,
"tokens/trainable": 69831
},
{
"epoch": 1.1333333333333333,
"grad_norm": 0.6197219491004944,
"learning_rate": 7.779904306220096e-06,
"loss": 0.1088065505027771,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11495,
"step": 238,
"tokens/total": 974848,
"tokens/train_per_sec_per_gpu": 10.43,
"tokens/trainable": 70063
},
{
"epoch": 1.138095238095238,
"grad_norm": 0.3679749667644501,
"learning_rate": 7.770334928229667e-06,
"loss": 0.053099337965250015,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05453,
"step": 239,
"tokens/total": 978944,
"tokens/train_per_sec_per_gpu": 11.86,
"tokens/trainable": 70324
},
{
"epoch": 1.1428571428571428,
"grad_norm": 0.9312533140182495,
"learning_rate": 7.760765550239236e-06,
"loss": 0.16996754705905914,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.18527,
"step": 240,
"tokens/total": 983040,
"tokens/train_per_sec_per_gpu": 13.42,
"tokens/trainable": 70667
},
{
"epoch": 1.1476190476190475,
"grad_norm": 0.8272965550422668,
"learning_rate": 7.751196172248805e-06,
"loss": 0.1209377869963646,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12855,
"step": 241,
"tokens/total": 987136,
"tokens/train_per_sec_per_gpu": 12.75,
"tokens/trainable": 70927
},
{
"epoch": 1.1523809523809523,
"grad_norm": 1.1589566469192505,
"learning_rate": 7.741626794258373e-06,
"loss": 0.16512207686901093,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17954,
"step": 242,
"tokens/total": 991232,
"tokens/train_per_sec_per_gpu": 13.03,
"tokens/trainable": 71234
},
{
"epoch": 1.157142857142857,
"grad_norm": 0.7066253423690796,
"learning_rate": 7.732057416267943e-06,
"loss": 0.08280467987060547,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08633,
"step": 243,
"tokens/total": 995328,
"tokens/train_per_sec_per_gpu": 14.93,
"tokens/trainable": 71606
},
{
"epoch": 1.161904761904762,
"grad_norm": 0.4909917414188385,
"learning_rate": 7.722488038277512e-06,
"loss": 0.10505213588476181,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11077,
"step": 244,
"tokens/total": 999424,
"tokens/train_per_sec_per_gpu": 16.84,
"tokens/trainable": 71984
},
{
"epoch": 1.1666666666666667,
"grad_norm": 0.8122262954711914,
"learning_rate": 7.712918660287081e-06,
"loss": 0.23099766671657562,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.25986,
"step": 245,
"tokens/total": 1003520,
"tokens/train_per_sec_per_gpu": 20.06,
"tokens/trainable": 72353
},
{
"epoch": 1.1714285714285715,
"grad_norm": 0.44005194306373596,
"learning_rate": 7.703349282296652e-06,
"loss": 0.08119498938322067,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08458,
"step": 246,
"tokens/total": 1007616,
"tokens/train_per_sec_per_gpu": 17.01,
"tokens/trainable": 72628
},
{
"epoch": 1.1761904761904762,
"grad_norm": 0.672211229801178,
"learning_rate": 7.693779904306222e-06,
"loss": 0.14602981507778168,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15723,
"step": 247,
"tokens/total": 1011712,
"tokens/train_per_sec_per_gpu": 8.19,
"tokens/trainable": 72922
},
{
"epoch": 1.180952380952381,
"grad_norm": 0.734875500202179,
"learning_rate": 7.68421052631579e-06,
"loss": 0.13793110847473145,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1479,
"step": 248,
"tokens/total": 1015808,
"tokens/train_per_sec_per_gpu": 12.01,
"tokens/trainable": 73196
},
{
"epoch": 1.1857142857142857,
"grad_norm": 0.9989974498748779,
"learning_rate": 7.674641148325359e-06,
"loss": 0.10894070565700531,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1151,
"step": 249,
"tokens/total": 1019904,
"tokens/train_per_sec_per_gpu": 11.97,
"tokens/trainable": 73462
},
{
"epoch": 1.1904761904761905,
"grad_norm": 0.5371176600456238,
"learning_rate": 7.665071770334928e-06,
"loss": 0.09055919945240021,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09479,
"step": 250,
"tokens/total": 1024000,
"tokens/train_per_sec_per_gpu": 18.03,
"tokens/trainable": 73804
},
{
"epoch": 1.1952380952380952,
"grad_norm": 0.5338223576545715,
"learning_rate": 7.655502392344498e-06,
"loss": 0.1184496283531189,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12575,
"step": 251,
"tokens/total": 1028096,
"tokens/train_per_sec_per_gpu": 14.19,
"tokens/trainable": 74099
},
{
"epoch": 1.2,
"grad_norm": 0.7946963310241699,
"learning_rate": 7.645933014354067e-06,
"loss": 0.1663852483034134,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.18103,
"step": 252,
"tokens/total": 1032192,
"tokens/train_per_sec_per_gpu": 13.78,
"tokens/trainable": 74370
},
{
"epoch": 1.2047619047619047,
"grad_norm": 0.5551656484603882,
"learning_rate": 7.636363636363638e-06,
"loss": 0.07018721103668213,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07271,
"step": 253,
"tokens/total": 1036288,
"tokens/train_per_sec_per_gpu": 11.46,
"tokens/trainable": 74627
},
{
"epoch": 1.2095238095238094,
"grad_norm": 0.7267068028450012,
"learning_rate": 7.626794258373207e-06,
"loss": 0.14088734984397888,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15129,
"step": 254,
"tokens/total": 1040384,
"tokens/train_per_sec_per_gpu": 14.73,
"tokens/trainable": 74952
},
{
"epoch": 1.2142857142857142,
"grad_norm": 0.8808903694152832,
"learning_rate": 7.617224880382775e-06,
"loss": 0.0552162267267704,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05677,
"step": 255,
"tokens/total": 1044480,
"tokens/train_per_sec_per_gpu": 9.23,
"tokens/trainable": 75179
},
{
"epoch": 1.2190476190476192,
"grad_norm": 0.6379745006561279,
"learning_rate": 7.6076555023923446e-06,
"loss": 0.09947262704372406,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10459,
"step": 256,
"tokens/total": 1048576,
"tokens/train_per_sec_per_gpu": 10.05,
"tokens/trainable": 75427
},
{
"epoch": 1.223809523809524,
"grad_norm": 0.8014132976531982,
"learning_rate": 7.598086124401915e-06,
"loss": 0.07943955808877945,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08268,
"step": 257,
"tokens/total": 1052672,
"tokens/train_per_sec_per_gpu": 10.22,
"tokens/trainable": 75700
},
{
"epoch": 1.2285714285714286,
"grad_norm": 0.6632212996482849,
"learning_rate": 7.588516746411484e-06,
"loss": 0.1634090542793274,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17752,
"step": 258,
"tokens/total": 1056768,
"tokens/train_per_sec_per_gpu": 13.72,
"tokens/trainable": 76060
},
{
"epoch": 1.2333333333333334,
"grad_norm": 0.692261278629303,
"learning_rate": 7.578947368421054e-06,
"loss": 0.10278518497943878,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10825,
"step": 259,
"tokens/total": 1060864,
"tokens/train_per_sec_per_gpu": 12.97,
"tokens/trainable": 76309
},
{
"epoch": 1.2380952380952381,
"grad_norm": 0.9587100148200989,
"learning_rate": 7.569377990430623e-06,
"loss": 0.13651782274246216,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.14628,
"step": 260,
"tokens/total": 1064960,
"tokens/train_per_sec_per_gpu": 11.4,
"tokens/trainable": 76541
},
{
"epoch": 1.2428571428571429,
"grad_norm": 1.1532655954360962,
"learning_rate": 7.5598086124401915e-06,
"loss": 0.1658339500427246,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.18038,
"step": 261,
"tokens/total": 1069056,
"tokens/train_per_sec_per_gpu": 15.11,
"tokens/trainable": 76799
},
{
"epoch": 1.2476190476190476,
"grad_norm": 0.6354696750640869,
"learning_rate": 7.550239234449761e-06,
"loss": 0.09453555941581726,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09915,
"step": 262,
"tokens/total": 1073152,
"tokens/train_per_sec_per_gpu": 11.51,
"tokens/trainable": 77070
},
{
"epoch": 1.2523809523809524,
"grad_norm": 0.5260769724845886,
"learning_rate": 7.54066985645933e-06,
"loss": 0.060988280922174454,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.06289,
"step": 263,
"tokens/total": 1077248,
"tokens/train_per_sec_per_gpu": 11.93,
"tokens/trainable": 77323
},
{
"epoch": 1.2571428571428571,
"grad_norm": 0.7785736918449402,
"learning_rate": 7.5311004784689005e-06,
"loss": 0.10227103531360626,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10768,
"step": 264,
"tokens/total": 1081344,
"tokens/train_per_sec_per_gpu": 10.84,
"tokens/trainable": 77599
},
{
"epoch": 1.2619047619047619,
"grad_norm": 0.5048001408576965,
"learning_rate": 7.52153110047847e-06,
"loss": 0.065130315721035,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0673,
"step": 265,
"tokens/total": 1085440,
"tokens/train_per_sec_per_gpu": 10.88,
"tokens/trainable": 77842
},
{
"epoch": 1.2666666666666666,
"grad_norm": 0.6458641886711121,
"learning_rate": 7.511961722488039e-06,
"loss": 0.1348947137594223,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14442,
"step": 266,
"tokens/total": 1089536,
"tokens/train_per_sec_per_gpu": 17.6,
"tokens/trainable": 78180
},
{
"epoch": 1.2714285714285714,
"grad_norm": 0.6480576992034912,
"learning_rate": 7.502392344497609e-06,
"loss": 0.10622403025627136,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11207,
"step": 267,
"tokens/total": 1093632,
"tokens/train_per_sec_per_gpu": 13.68,
"tokens/trainable": 78442
},
{
"epoch": 1.276190476190476,
"grad_norm": 0.6444092392921448,
"learning_rate": 7.492822966507177e-06,
"loss": 0.09460228681564331,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09922,
"step": 268,
"tokens/total": 1097728,
"tokens/train_per_sec_per_gpu": 8.4,
"tokens/trainable": 78660
},
{
"epoch": 1.2809523809523808,
"grad_norm": 0.6892173886299133,
"learning_rate": 7.483253588516747e-06,
"loss": 0.13539853692054749,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14499,
"step": 269,
"tokens/total": 1101824,
"tokens/train_per_sec_per_gpu": 9.93,
"tokens/trainable": 78945
},
{
"epoch": 1.2857142857142856,
"grad_norm": 0.7260250449180603,
"learning_rate": 7.473684210526316e-06,
"loss": 0.09833601862192154,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10333,
"step": 270,
"tokens/total": 1105920,
"tokens/train_per_sec_per_gpu": 10.96,
"tokens/trainable": 79182
},
{
"epoch": 1.2904761904761906,
"grad_norm": 0.7841465473175049,
"learning_rate": 7.464114832535886e-06,
"loss": 0.11291639506816864,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11954,
"step": 271,
"tokens/total": 1110016,
"tokens/train_per_sec_per_gpu": 13.7,
"tokens/trainable": 79453
},
{
"epoch": 1.2952380952380953,
"grad_norm": 0.8338773250579834,
"learning_rate": 7.454545454545456e-06,
"loss": 0.18002504110336304,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.19725,
"step": 272,
"tokens/total": 1114112,
"tokens/train_per_sec_per_gpu": 16.17,
"tokens/trainable": 79767
},
{
"epoch": 1.3,
"grad_norm": 0.6367767453193665,
"learning_rate": 7.444976076555025e-06,
"loss": 0.09027963876724243,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09448,
"step": 273,
"tokens/total": 1118208,
"tokens/train_per_sec_per_gpu": 16.24,
"tokens/trainable": 80046
},
{
"epoch": 1.3047619047619048,
"grad_norm": 1.0161387920379639,
"learning_rate": 7.4354066985645936e-06,
"loss": 0.1279660016298294,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13651,
"step": 274,
"tokens/total": 1122304,
"tokens/train_per_sec_per_gpu": 10.88,
"tokens/trainable": 80319
},
{
"epoch": 1.3095238095238095,
"grad_norm": 1.0113588571548462,
"learning_rate": 7.425837320574163e-06,
"loss": 0.1560673713684082,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1689,
"step": 275,
"tokens/total": 1126400,
"tokens/train_per_sec_per_gpu": 12.7,
"tokens/trainable": 80627
},
{
"epoch": 1.3142857142857143,
"grad_norm": 0.6805703639984131,
"learning_rate": 7.416267942583732e-06,
"loss": 0.08896687626838684,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09304,
"step": 276,
"tokens/total": 1130496,
"tokens/train_per_sec_per_gpu": 12.44,
"tokens/trainable": 80874
},
{
"epoch": 1.319047619047619,
"grad_norm": 0.8909221291542053,
"learning_rate": 7.406698564593302e-06,
"loss": 0.17334583401679993,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.18928,
"step": 277,
"tokens/total": 1134592,
"tokens/train_per_sec_per_gpu": 15.86,
"tokens/trainable": 81176
},
{
"epoch": 1.3238095238095238,
"grad_norm": 0.8896336555480957,
"learning_rate": 7.397129186602872e-06,
"loss": 0.16712436079978943,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1819,
"step": 278,
"tokens/total": 1138688,
"tokens/train_per_sec_per_gpu": 12.49,
"tokens/trainable": 81474
},
{
"epoch": 1.3285714285714285,
"grad_norm": 0.764587938785553,
"learning_rate": 7.387559808612441e-06,
"loss": 0.12825949490070343,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13685,
"step": 279,
"tokens/total": 1142784,
"tokens/train_per_sec_per_gpu": 11.78,
"tokens/trainable": 81741
},
{
"epoch": 1.3333333333333333,
"grad_norm": 0.6739766001701355,
"learning_rate": 7.377990430622011e-06,
"loss": 0.1249503344297409,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13309,
"step": 280,
"tokens/total": 1146880,
"tokens/train_per_sec_per_gpu": 15.73,
"tokens/trainable": 82115
},
{
"epoch": 1.3380952380952382,
"grad_norm": 0.4460581839084625,
"learning_rate": 7.368421052631579e-06,
"loss": 0.07482986897230148,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0777,
"step": 281,
"tokens/total": 1150976,
"tokens/train_per_sec_per_gpu": 12.85,
"tokens/trainable": 82422
},
{
"epoch": 1.342857142857143,
"grad_norm": 0.8023619055747986,
"learning_rate": 7.358851674641149e-06,
"loss": 0.09925596415996552,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10435,
"step": 282,
"tokens/total": 1155072,
"tokens/train_per_sec_per_gpu": 14.95,
"tokens/trainable": 82709
},
{
"epoch": 1.3476190476190477,
"grad_norm": 0.6830031275749207,
"learning_rate": 7.349282296650718e-06,
"loss": 0.08342678844928741,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08701,
"step": 283,
"tokens/total": 1159168,
"tokens/train_per_sec_per_gpu": 13.49,
"tokens/trainable": 82977
},
{
"epoch": 1.3523809523809525,
"grad_norm": 0.8009830713272095,
"learning_rate": 7.3397129186602874e-06,
"loss": 0.07836952805519104,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08152,
"step": 284,
"tokens/total": 1163264,
"tokens/train_per_sec_per_gpu": 12.22,
"tokens/trainable": 83276
},
{
"epoch": 1.3571428571428572,
"grad_norm": 0.7553001642227173,
"learning_rate": 7.330143540669858e-06,
"loss": 0.1220192164182663,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12978,
"step": 285,
"tokens/total": 1167360,
"tokens/train_per_sec_per_gpu": 10.55,
"tokens/trainable": 83542
},
{
"epoch": 1.361904761904762,
"grad_norm": 0.44703495502471924,
"learning_rate": 7.320574162679427e-06,
"loss": 0.08532048761844635,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08907,
"step": 286,
"tokens/total": 1171456,
"tokens/train_per_sec_per_gpu": 13.86,
"tokens/trainable": 83900
},
{
"epoch": 1.3666666666666667,
"grad_norm": 1.0438194274902344,
"learning_rate": 7.311004784688996e-06,
"loss": 0.07847965508699417,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08164,
"step": 287,
"tokens/total": 1175552,
"tokens/train_per_sec_per_gpu": 16.2,
"tokens/trainable": 84167
},
{
"epoch": 1.3714285714285714,
"grad_norm": 0.7424266338348389,
"learning_rate": 7.301435406698565e-06,
"loss": 0.10971373319625854,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11596,
"step": 288,
"tokens/total": 1179648,
"tokens/train_per_sec_per_gpu": 14.85,
"tokens/trainable": 84457
},
{
"epoch": 1.3761904761904762,
"grad_norm": 0.38364148139953613,
"learning_rate": 7.291866028708134e-06,
"loss": 0.03297719731926918,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.03353,
"step": 289,
"tokens/total": 1183744,
"tokens/train_per_sec_per_gpu": 11.14,
"tokens/trainable": 84681
},
{
"epoch": 1.380952380952381,
"grad_norm": 0.8590928912162781,
"learning_rate": 7.282296650717704e-06,
"loss": 0.14657095074653625,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15786,
"step": 290,
"tokens/total": 1187840,
"tokens/train_per_sec_per_gpu": 15.12,
"tokens/trainable": 84973
},
{
"epoch": 1.3857142857142857,
"grad_norm": 0.3598606586456299,
"learning_rate": 7.272727272727273e-06,
"loss": 0.08855046331882477,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09259,
"step": 291,
"tokens/total": 1191936,
"tokens/train_per_sec_per_gpu": 22.23,
"tokens/trainable": 85410
},
{
"epoch": 1.3904761904761904,
"grad_norm": 0.5362772345542908,
"learning_rate": 7.263157894736843e-06,
"loss": 0.06545418500900269,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06764,
"step": 292,
"tokens/total": 1196032,
"tokens/train_per_sec_per_gpu": 14.16,
"tokens/trainable": 85650
},
{
"epoch": 1.3952380952380952,
"grad_norm": 0.8264137506484985,
"learning_rate": 7.253588516746413e-06,
"loss": 0.10715029388666153,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1131,
"step": 293,
"tokens/total": 1200128,
"tokens/train_per_sec_per_gpu": 12.71,
"tokens/trainable": 85895
},
{
"epoch": 1.4,
"grad_norm": 0.7366301417350769,
"learning_rate": 7.244019138755981e-06,
"loss": 0.10185449570417404,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10722,
"step": 294,
"tokens/total": 1204224,
"tokens/train_per_sec_per_gpu": 11.18,
"tokens/trainable": 86116
},
{
"epoch": 1.4047619047619047,
"grad_norm": 0.7494551539421082,
"learning_rate": 7.234449760765551e-06,
"loss": 0.09909769147634506,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10417,
"step": 295,
"tokens/total": 1208320,
"tokens/train_per_sec_per_gpu": 9.06,
"tokens/trainable": 86414
},
{
"epoch": 1.4095238095238094,
"grad_norm": 0.8216342926025391,
"learning_rate": 7.22488038277512e-06,
"loss": 0.13356107473373413,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.14289,
"step": 296,
"tokens/total": 1212416,
"tokens/train_per_sec_per_gpu": 17.71,
"tokens/trainable": 86729
},
{
"epoch": 1.4142857142857144,
"grad_norm": 0.6832106709480286,
"learning_rate": 7.2153110047846895e-06,
"loss": 0.07904009521007538,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08225,
"step": 297,
"tokens/total": 1216512,
"tokens/train_per_sec_per_gpu": 11.21,
"tokens/trainable": 87033
},
{
"epoch": 1.4190476190476191,
"grad_norm": 0.635546863079071,
"learning_rate": 7.205741626794259e-06,
"loss": 0.061884887516498566,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06384,
"step": 298,
"tokens/total": 1220608,
"tokens/train_per_sec_per_gpu": 11.1,
"tokens/trainable": 87281
},
{
"epoch": 1.4238095238095239,
"grad_norm": 1.098975419998169,
"learning_rate": 7.196172248803829e-06,
"loss": 0.1470986008644104,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15847,
"step": 299,
"tokens/total": 1224704,
"tokens/train_per_sec_per_gpu": 14.32,
"tokens/trainable": 87573
},
{
"epoch": 1.4285714285714286,
"grad_norm": 0.7100666761398315,
"learning_rate": 7.186602870813398e-06,
"loss": 0.08846946060657501,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0925,
"step": 300,
"tokens/total": 1228800,
"tokens/train_per_sec_per_gpu": 11.7,
"tokens/trainable": 87829
},
{
"epoch": 1.4333333333333333,
"grad_norm": 0.8944647908210754,
"learning_rate": 7.177033492822967e-06,
"loss": 0.08944831788539886,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09357,
"step": 301,
"tokens/total": 1232896,
"tokens/train_per_sec_per_gpu": 10.27,
"tokens/trainable": 88067
},
{
"epoch": 1.438095238095238,
"grad_norm": 0.6894711256027222,
"learning_rate": 7.1674641148325364e-06,
"loss": 0.10426825284957886,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1099,
"step": 302,
"tokens/total": 1236992,
"tokens/train_per_sec_per_gpu": 13.61,
"tokens/trainable": 88342
},
{
"epoch": 1.4428571428571428,
"grad_norm": 1.4308092594146729,
"learning_rate": 7.157894736842106e-06,
"loss": 0.09522052109241486,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0999,
"step": 303,
"tokens/total": 1241088,
"tokens/train_per_sec_per_gpu": 11.01,
"tokens/trainable": 88603
},
{
"epoch": 1.4476190476190476,
"grad_norm": 0.7011018395423889,
"learning_rate": 7.148325358851675e-06,
"loss": 0.06806151568889618,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07043,
"step": 304,
"tokens/total": 1245184,
"tokens/train_per_sec_per_gpu": 11.0,
"tokens/trainable": 88843
},
{
"epoch": 1.4523809523809523,
"grad_norm": 0.885724663734436,
"learning_rate": 7.138755980861245e-06,
"loss": 0.16685882210731506,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.18159,
"step": 305,
"tokens/total": 1249280,
"tokens/train_per_sec_per_gpu": 12.19,
"tokens/trainable": 89102
},
{
"epoch": 1.457142857142857,
"grad_norm": 0.4040443003177643,
"learning_rate": 7.129186602870813e-06,
"loss": 0.07094176113605499,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.07352,
"step": 306,
"tokens/total": 1253376,
"tokens/train_per_sec_per_gpu": 8.89,
"tokens/trainable": 89437
},
{
"epoch": 1.461904761904762,
"grad_norm": 0.8666446805000305,
"learning_rate": 7.119617224880383e-06,
"loss": 0.11042168736457825,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11675,
"step": 307,
"tokens/total": 1257472,
"tokens/train_per_sec_per_gpu": 13.37,
"tokens/trainable": 89673
},
{
"epoch": 1.4666666666666668,
"grad_norm": 0.6336524486541748,
"learning_rate": 7.110047846889953e-06,
"loss": 0.08677862584590912,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09066,
"step": 308,
"tokens/total": 1261568,
"tokens/train_per_sec_per_gpu": 10.42,
"tokens/trainable": 89950
},
{
"epoch": 1.4714285714285715,
"grad_norm": 0.7790036797523499,
"learning_rate": 7.100478468899522e-06,
"loss": 0.0888119488954544,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09288,
"step": 309,
"tokens/total": 1265664,
"tokens/train_per_sec_per_gpu": 11.92,
"tokens/trainable": 90153
},
{
"epoch": 1.4761904761904763,
"grad_norm": 0.7459496855735779,
"learning_rate": 7.0909090909090916e-06,
"loss": 0.08131097257137299,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08471,
"step": 310,
"tokens/total": 1269760,
"tokens/train_per_sec_per_gpu": 11.39,
"tokens/trainable": 90399
},
{
"epoch": 1.480952380952381,
"grad_norm": 0.46430832147598267,
"learning_rate": 7.081339712918661e-06,
"loss": 0.039737895131111145,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04054,
"step": 311,
"tokens/total": 1273856,
"tokens/train_per_sec_per_gpu": 8.41,
"tokens/trainable": 90616
},
{
"epoch": 1.4857142857142858,
"grad_norm": 0.8076871037483215,
"learning_rate": 7.07177033492823e-06,
"loss": 0.09725730866193771,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10214,
"step": 312,
"tokens/total": 1277952,
"tokens/train_per_sec_per_gpu": 12.34,
"tokens/trainable": 90842
},
{
"epoch": 1.4904761904761905,
"grad_norm": 0.8504095077514648,
"learning_rate": 7.062200956937799e-06,
"loss": 0.13007959723472595,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13892,
"step": 313,
"tokens/total": 1282048,
"tokens/train_per_sec_per_gpu": 12.25,
"tokens/trainable": 91094
},
{
"epoch": 1.4952380952380953,
"grad_norm": 0.8776680827140808,
"learning_rate": 7.052631578947369e-06,
"loss": 0.09825856983661652,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10325,
"step": 314,
"tokens/total": 1286144,
"tokens/train_per_sec_per_gpu": 15.21,
"tokens/trainable": 91382
},
{
"epoch": 1.5,
"grad_norm": 0.540379524230957,
"learning_rate": 7.0430622009569385e-06,
"loss": 0.1302526891231537,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13912,
"step": 315,
"tokens/total": 1290240,
"tokens/train_per_sec_per_gpu": 21.51,
"tokens/trainable": 91745
},
{
"epoch": 1.5047619047619047,
"grad_norm": 1.0059609413146973,
"learning_rate": 7.033492822966508e-06,
"loss": 0.13155148923397064,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1406,
"step": 316,
"tokens/total": 1294336,
"tokens/train_per_sec_per_gpu": 12.26,
"tokens/trainable": 92034
},
{
"epoch": 1.5095238095238095,
"grad_norm": 0.8393654227256775,
"learning_rate": 7.023923444976077e-06,
"loss": 0.08929277956485748,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0934,
"step": 317,
"tokens/total": 1298432,
"tokens/train_per_sec_per_gpu": 9.35,
"tokens/trainable": 92367
},
{
"epoch": 1.5142857142857142,
"grad_norm": 0.48736438155174255,
"learning_rate": 7.014354066985647e-06,
"loss": 0.044491663575172424,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0455,
"step": 318,
"tokens/total": 1302528,
"tokens/train_per_sec_per_gpu": 13.14,
"tokens/trainable": 92640
},
{
"epoch": 1.519047619047619,
"grad_norm": 1.1108299493789673,
"learning_rate": 7.004784688995215e-06,
"loss": 0.15828374028205872,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1715,
"step": 319,
"tokens/total": 1306624,
"tokens/train_per_sec_per_gpu": 12.61,
"tokens/trainable": 92922
},
{
"epoch": 1.5238095238095237,
"grad_norm": 0.5160102248191833,
"learning_rate": 6.995215311004785e-06,
"loss": 0.0708310604095459,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0734,
"step": 320,
"tokens/total": 1310720,
"tokens/train_per_sec_per_gpu": 13.54,
"tokens/trainable": 93214
},
{
"epoch": 1.5285714285714285,
"grad_norm": 0.43335914611816406,
"learning_rate": 6.985645933014355e-06,
"loss": 0.055120449513196945,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05667,
"step": 321,
"tokens/total": 1314816,
"tokens/train_per_sec_per_gpu": 9.65,
"tokens/trainable": 93542
},
{
"epoch": 1.5333333333333332,
"grad_norm": 0.6859294176101685,
"learning_rate": 6.976076555023924e-06,
"loss": 0.09708588570356369,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10196,
"step": 322,
"tokens/total": 1318912,
"tokens/train_per_sec_per_gpu": 13.52,
"tokens/trainable": 93821
},
{
"epoch": 1.538095238095238,
"grad_norm": 1.008861780166626,
"learning_rate": 6.966507177033494e-06,
"loss": 0.1100694090127945,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11636,
"step": 323,
"tokens/total": 1323008,
"tokens/train_per_sec_per_gpu": 11.45,
"tokens/trainable": 94043
},
{
"epoch": 1.5428571428571427,
"grad_norm": 0.6240075826644897,
"learning_rate": 6.956937799043063e-06,
"loss": 0.09549560397863388,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1002,
"step": 324,
"tokens/total": 1327104,
"tokens/train_per_sec_per_gpu": 14.18,
"tokens/trainable": 94337
},
{
"epoch": 1.5476190476190477,
"grad_norm": 0.5021734833717346,
"learning_rate": 6.947368421052632e-06,
"loss": 0.05273163318634033,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05415,
"step": 325,
"tokens/total": 1331200,
"tokens/train_per_sec_per_gpu": 13.13,
"tokens/trainable": 94588
},
{
"epoch": 1.5523809523809524,
"grad_norm": 0.7321131229400635,
"learning_rate": 6.937799043062201e-06,
"loss": 0.1110309511423111,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11743,
"step": 326,
"tokens/total": 1335296,
"tokens/train_per_sec_per_gpu": 12.4,
"tokens/trainable": 94876
},
{
"epoch": 1.5571428571428572,
"grad_norm": 1.0234777927398682,
"learning_rate": 6.92822966507177e-06,
"loss": 0.13599176704883575,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14567,
"step": 327,
"tokens/total": 1339392,
"tokens/train_per_sec_per_gpu": 14.3,
"tokens/trainable": 95143
},
{
"epoch": 1.561904761904762,
"grad_norm": 0.6523513793945312,
"learning_rate": 6.9186602870813405e-06,
"loss": 0.0951455608010292,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09982,
"step": 328,
"tokens/total": 1343488,
"tokens/train_per_sec_per_gpu": 14.24,
"tokens/trainable": 95460
},
{
"epoch": 1.5666666666666667,
"grad_norm": 0.8506219387054443,
"learning_rate": 6.90909090909091e-06,
"loss": 0.11431875824928284,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12111,
"step": 329,
"tokens/total": 1347584,
"tokens/train_per_sec_per_gpu": 18.78,
"tokens/trainable": 95830
},
{
"epoch": 1.5714285714285714,
"grad_norm": 0.8775290846824646,
"learning_rate": 6.899521531100479e-06,
"loss": 0.09016980230808258,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09436,
"step": 330,
"tokens/total": 1351680,
"tokens/train_per_sec_per_gpu": 9.96,
"tokens/trainable": 96026
},
{
"epoch": 1.5761904761904761,
"grad_norm": 1.2778103351593018,
"learning_rate": 6.889952153110049e-06,
"loss": 0.19941449165344238,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.22069,
"step": 331,
"tokens/total": 1355776,
"tokens/train_per_sec_per_gpu": 17.3,
"tokens/trainable": 96495
},
{
"epoch": 1.580952380952381,
"grad_norm": 0.5732797980308533,
"learning_rate": 6.880382775119617e-06,
"loss": 0.057705655694007874,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0594,
"step": 332,
"tokens/total": 1359872,
"tokens/train_per_sec_per_gpu": 10.48,
"tokens/trainable": 96764
},
{
"epoch": 1.5857142857142859,
"grad_norm": 0.6136135458946228,
"learning_rate": 6.870813397129187e-06,
"loss": 0.07990540564060211,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08318,
"step": 333,
"tokens/total": 1363968,
"tokens/train_per_sec_per_gpu": 9.73,
"tokens/trainable": 97021
},
{
"epoch": 1.5904761904761906,
"grad_norm": 0.760566771030426,
"learning_rate": 6.861244019138756e-06,
"loss": 0.10733136534690857,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1133,
"step": 334,
"tokens/total": 1368064,
"tokens/train_per_sec_per_gpu": 11.17,
"tokens/trainable": 97274
},
{
"epoch": 1.5952380952380953,
"grad_norm": 0.7491924166679382,
"learning_rate": 6.851674641148326e-06,
"loss": 0.08976206183433533,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09391,
"step": 335,
"tokens/total": 1372160,
"tokens/train_per_sec_per_gpu": 13.43,
"tokens/trainable": 97552
},
{
"epoch": 1.6,
"grad_norm": 0.8733037114143372,
"learning_rate": 6.842105263157896e-06,
"loss": 0.09935858845710754,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10446,
"step": 336,
"tokens/total": 1376256,
"tokens/train_per_sec_per_gpu": 15.48,
"tokens/trainable": 97852
},
{
"epoch": 1.6047619047619048,
"grad_norm": 0.6176996827125549,
"learning_rate": 6.832535885167465e-06,
"loss": 0.1155165433883667,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12245,
"step": 337,
"tokens/total": 1380352,
"tokens/train_per_sec_per_gpu": 8.8,
"tokens/trainable": 98089
},
{
"epoch": 1.6095238095238096,
"grad_norm": 0.556769073009491,
"learning_rate": 6.8229665071770344e-06,
"loss": 0.06867925822734833,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07109,
"step": 338,
"tokens/total": 1384448,
"tokens/train_per_sec_per_gpu": 10.65,
"tokens/trainable": 98331
},
{
"epoch": 1.6142857142857143,
"grad_norm": 1.0706437826156616,
"learning_rate": 6.813397129186603e-06,
"loss": 0.11363160610198975,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12034,
"step": 339,
"tokens/total": 1388544,
"tokens/train_per_sec_per_gpu": 20.54,
"tokens/trainable": 98733
},
{
"epoch": 1.619047619047619,
"grad_norm": 1.0246440172195435,
"learning_rate": 6.803827751196172e-06,
"loss": 0.09106756746768951,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09534,
"step": 340,
"tokens/total": 1392640,
"tokens/train_per_sec_per_gpu": 9.49,
"tokens/trainable": 98929
},
{
"epoch": 1.6238095238095238,
"grad_norm": 0.8117942810058594,
"learning_rate": 6.794258373205742e-06,
"loss": 0.08481201529502869,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08851,
"step": 341,
"tokens/total": 1396736,
"tokens/train_per_sec_per_gpu": 10.45,
"tokens/trainable": 99202
},
{
"epoch": 1.6285714285714286,
"grad_norm": 0.44152283668518066,
"learning_rate": 6.784688995215312e-06,
"loss": 0.06555698066949844,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06775,
"step": 342,
"tokens/total": 1400832,
"tokens/train_per_sec_per_gpu": 14.83,
"tokens/trainable": 99485
},
{
"epoch": 1.6333333333333333,
"grad_norm": 0.9880382418632507,
"learning_rate": 6.775119617224881e-06,
"loss": 0.1196918860077858,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12715,
"step": 343,
"tokens/total": 1404928,
"tokens/train_per_sec_per_gpu": 12.95,
"tokens/trainable": 99779
},
{
"epoch": 1.638095238095238,
"grad_norm": 1.3182851076126099,
"learning_rate": 6.765550239234451e-06,
"loss": 0.17728012800216675,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.19397,
"step": 344,
"tokens/total": 1409024,
"tokens/train_per_sec_per_gpu": 10.02,
"tokens/trainable": 100081
},
{
"epoch": 1.6428571428571428,
"grad_norm": 0.9957773089408875,
"learning_rate": 6.755980861244019e-06,
"loss": 0.15881581604480743,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17212,
"step": 345,
"tokens/total": 1413120,
"tokens/train_per_sec_per_gpu": 9.73,
"tokens/trainable": 100286
},
{
"epoch": 1.6476190476190475,
"grad_norm": 0.7199157476425171,
"learning_rate": 6.746411483253589e-06,
"loss": 0.10562394559383392,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1114,
"step": 346,
"tokens/total": 1417216,
"tokens/train_per_sec_per_gpu": 19.72,
"tokens/trainable": 100673
},
{
"epoch": 1.6523809523809523,
"grad_norm": 0.4368532598018646,
"learning_rate": 6.736842105263158e-06,
"loss": 0.0761297196149826,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0791,
"step": 347,
"tokens/total": 1421312,
"tokens/train_per_sec_per_gpu": 20.81,
"tokens/trainable": 101035
},
{
"epoch": 1.657142857142857,
"grad_norm": 0.8100814819335938,
"learning_rate": 6.7272727272727275e-06,
"loss": 0.1824449598789215,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.20015,
"step": 348,
"tokens/total": 1425408,
"tokens/train_per_sec_per_gpu": 14.81,
"tokens/trainable": 101374
},
{
"epoch": 1.6619047619047618,
"grad_norm": 0.9584652781486511,
"learning_rate": 6.717703349282298e-06,
"loss": 0.12359898537397385,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.13156,
"step": 349,
"tokens/total": 1429504,
"tokens/train_per_sec_per_gpu": 21.06,
"tokens/trainable": 101684
},
{
"epoch": 1.6666666666666665,
"grad_norm": 0.3303496539592743,
"learning_rate": 6.708133971291867e-06,
"loss": 0.06981052458286285,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0723,
"step": 350,
"tokens/total": 1433600,
"tokens/train_per_sec_per_gpu": 16.0,
"tokens/trainable": 102057
},
{
"epoch": 1.6714285714285713,
"grad_norm": 0.8605956435203552,
"learning_rate": 6.6985645933014365e-06,
"loss": 0.118899405002594,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12626,
"step": 351,
"tokens/total": 1437696,
"tokens/train_per_sec_per_gpu": 12.13,
"tokens/trainable": 102350
},
{
"epoch": 1.6761904761904762,
"grad_norm": 1.0154688358306885,
"learning_rate": 6.688995215311005e-06,
"loss": 0.11813990771770477,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1254,
"step": 352,
"tokens/total": 1441792,
"tokens/train_per_sec_per_gpu": 12.92,
"tokens/trainable": 102675
},
{
"epoch": 1.680952380952381,
"grad_norm": 0.8970211744308472,
"learning_rate": 6.679425837320574e-06,
"loss": 0.14539587497711182,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1565,
"step": 353,
"tokens/total": 1445888,
"tokens/train_per_sec_per_gpu": 13.5,
"tokens/trainable": 102963
},
{
"epoch": 1.6857142857142857,
"grad_norm": 0.8070185780525208,
"learning_rate": 6.669856459330144e-06,
"loss": 0.09510502219200134,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09977,
"step": 354,
"tokens/total": 1449984,
"tokens/train_per_sec_per_gpu": 9.91,
"tokens/trainable": 103183
},
{
"epoch": 1.6904761904761905,
"grad_norm": 0.7684424519538879,
"learning_rate": 6.660287081339713e-06,
"loss": 0.07780720293521881,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08091,
"step": 355,
"tokens/total": 1454080,
"tokens/train_per_sec_per_gpu": 10.73,
"tokens/trainable": 103388
},
{
"epoch": 1.6952380952380952,
"grad_norm": 0.4272719919681549,
"learning_rate": 6.6507177033492834e-06,
"loss": 0.05442621931433678,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05593,
"step": 356,
"tokens/total": 1458176,
"tokens/train_per_sec_per_gpu": 13.75,
"tokens/trainable": 103717
},
{
"epoch": 1.7,
"grad_norm": 0.6624967455863953,
"learning_rate": 6.641148325358853e-06,
"loss": 0.11500588059425354,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12188,
"step": 357,
"tokens/total": 1462272,
"tokens/train_per_sec_per_gpu": 11.4,
"tokens/trainable": 103954
},
{
"epoch": 1.704761904761905,
"grad_norm": 1.1226800680160522,
"learning_rate": 6.631578947368421e-06,
"loss": 0.13368532061576843,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.14303,
"step": 358,
"tokens/total": 1466368,
"tokens/train_per_sec_per_gpu": 11.12,
"tokens/trainable": 104220
},
{
"epoch": 1.7095238095238097,
"grad_norm": 1.0672284364700317,
"learning_rate": 6.622009569377991e-06,
"loss": 0.12235910445451736,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13016,
"step": 359,
"tokens/total": 1470464,
"tokens/train_per_sec_per_gpu": 19.02,
"tokens/trainable": 104555
},
{
"epoch": 1.7142857142857144,
"grad_norm": 0.9157024621963501,
"learning_rate": 6.61244019138756e-06,
"loss": 0.10388430953025818,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10947,
"step": 360,
"tokens/total": 1474560,
"tokens/train_per_sec_per_gpu": 18.68,
"tokens/trainable": 104964
},
{
"epoch": 1.7190476190476192,
"grad_norm": 1.042858600616455,
"learning_rate": 6.6028708133971295e-06,
"loss": 0.13133081793785095,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.14034,
"step": 361,
"tokens/total": 1478656,
"tokens/train_per_sec_per_gpu": 12.51,
"tokens/trainable": 105246
},
{
"epoch": 1.723809523809524,
"grad_norm": 0.787800669670105,
"learning_rate": 6.593301435406699e-06,
"loss": 0.11535128951072693,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12227,
"step": 362,
"tokens/total": 1482752,
"tokens/train_per_sec_per_gpu": 13.81,
"tokens/trainable": 105524
},
{
"epoch": 1.7285714285714286,
"grad_norm": 0.6248174905776978,
"learning_rate": 6.583732057416269e-06,
"loss": 0.08816708624362946,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09217,
"step": 363,
"tokens/total": 1486848,
"tokens/train_per_sec_per_gpu": 14.94,
"tokens/trainable": 105830
},
{
"epoch": 1.7333333333333334,
"grad_norm": 0.7269876599311829,
"learning_rate": 6.5741626794258385e-06,
"loss": 0.1025102511048317,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10795,
"step": 364,
"tokens/total": 1490944,
"tokens/train_per_sec_per_gpu": 14.06,
"tokens/trainable": 106111
},
{
"epoch": 1.7380952380952381,
"grad_norm": 0.8046413064002991,
"learning_rate": 6.564593301435407e-06,
"loss": 0.07084720581769943,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07342,
"step": 365,
"tokens/total": 1495040,
"tokens/train_per_sec_per_gpu": 14.63,
"tokens/trainable": 106357
},
{
"epoch": 1.7428571428571429,
"grad_norm": 0.7060100436210632,
"learning_rate": 6.5550239234449765e-06,
"loss": 0.13040365278720856,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13929,
"step": 366,
"tokens/total": 1499136,
"tokens/train_per_sec_per_gpu": 10.8,
"tokens/trainable": 106618
},
{
"epoch": 1.7476190476190476,
"grad_norm": 0.5565487146377563,
"learning_rate": 6.545454545454546e-06,
"loss": 0.06260109692811966,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.0646,
"step": 367,
"tokens/total": 1503232,
"tokens/train_per_sec_per_gpu": 9.03,
"tokens/trainable": 106851
},
{
"epoch": 1.7523809523809524,
"grad_norm": 0.7016215920448303,
"learning_rate": 6.535885167464115e-06,
"loss": 0.13496726751327515,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1445,
"step": 368,
"tokens/total": 1507328,
"tokens/train_per_sec_per_gpu": 14.23,
"tokens/trainable": 107133
},
{
"epoch": 1.7571428571428571,
"grad_norm": 0.9895106554031372,
"learning_rate": 6.526315789473685e-06,
"loss": 0.0984669178724289,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10348,
"step": 369,
"tokens/total": 1511424,
"tokens/train_per_sec_per_gpu": 15.05,
"tokens/trainable": 107493
},
{
"epoch": 1.7619047619047619,
"grad_norm": 0.8994340300559998,
"learning_rate": 6.516746411483255e-06,
"loss": 0.06861107051372528,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07102,
"step": 370,
"tokens/total": 1515520,
"tokens/train_per_sec_per_gpu": 18.0,
"tokens/trainable": 107792
},
{
"epoch": 1.7666666666666666,
"grad_norm": 0.8121207356452942,
"learning_rate": 6.507177033492823e-06,
"loss": 0.10615593940019608,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.112,
"step": 371,
"tokens/total": 1519616,
"tokens/train_per_sec_per_gpu": 14.3,
"tokens/trainable": 108092
},
{
"epoch": 1.7714285714285714,
"grad_norm": 0.7587819695472717,
"learning_rate": 6.497607655502393e-06,
"loss": 0.10872511565685272,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11486,
"step": 372,
"tokens/total": 1523712,
"tokens/train_per_sec_per_gpu": 19.98,
"tokens/trainable": 108466
},
{
"epoch": 1.776190476190476,
"grad_norm": 0.611366868019104,
"learning_rate": 6.488038277511962e-06,
"loss": 0.09398886561393738,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09855,
"step": 373,
"tokens/total": 1527808,
"tokens/train_per_sec_per_gpu": 15.17,
"tokens/trainable": 108833
},
{
"epoch": 1.7809523809523808,
"grad_norm": 0.6470115184783936,
"learning_rate": 6.4784688995215316e-06,
"loss": 0.07465333491563797,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07751,
"step": 374,
"tokens/total": 1531904,
"tokens/train_per_sec_per_gpu": 8.68,
"tokens/trainable": 109015
},
{
"epoch": 1.7857142857142856,
"grad_norm": 0.39367052912712097,
"learning_rate": 6.468899521531101e-06,
"loss": 0.07124529778957367,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07384,
"step": 375,
"tokens/total": 1536000,
"tokens/train_per_sec_per_gpu": 21.03,
"tokens/trainable": 109419
},
{
"epoch": 1.7904761904761903,
"grad_norm": 1.1016931533813477,
"learning_rate": 6.459330143540671e-06,
"loss": 0.11934101581573486,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12675,
"step": 376,
"tokens/total": 1540096,
"tokens/train_per_sec_per_gpu": 10.05,
"tokens/trainable": 109649
},
{
"epoch": 1.795238095238095,
"grad_norm": 0.6353244185447693,
"learning_rate": 6.449760765550239e-06,
"loss": 0.11098512262105942,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11738,
"step": 377,
"tokens/total": 1544192,
"tokens/train_per_sec_per_gpu": 13.61,
"tokens/trainable": 110032
},
{
"epoch": 1.8,
"grad_norm": 0.7181692719459534,
"learning_rate": 6.440191387559809e-06,
"loss": 0.10302020609378815,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10851,
"step": 378,
"tokens/total": 1548288,
"tokens/train_per_sec_per_gpu": 16.53,
"tokens/trainable": 110332
},
{
"epoch": 1.8047619047619048,
"grad_norm": 0.7024384140968323,
"learning_rate": 6.4306220095693785e-06,
"loss": 0.06668931245803833,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06896,
"step": 379,
"tokens/total": 1552384,
"tokens/train_per_sec_per_gpu": 10.82,
"tokens/trainable": 110580
},
{
"epoch": 1.8095238095238095,
"grad_norm": 0.6431664228439331,
"learning_rate": 6.421052631578948e-06,
"loss": 0.06305551528930664,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06509,
"step": 380,
"tokens/total": 1556480,
"tokens/train_per_sec_per_gpu": 14.2,
"tokens/trainable": 110882
},
{
"epoch": 1.8142857142857143,
"grad_norm": 0.7987076044082642,
"learning_rate": 6.411483253588517e-06,
"loss": 0.10767853260040283,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11369,
"step": 381,
"tokens/total": 1560576,
"tokens/train_per_sec_per_gpu": 13.11,
"tokens/trainable": 111160
},
{
"epoch": 1.819047619047619,
"grad_norm": 0.45520323514938354,
"learning_rate": 6.401913875598087e-06,
"loss": 0.03689165040850639,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03758,
"step": 382,
"tokens/total": 1564672,
"tokens/train_per_sec_per_gpu": 9.63,
"tokens/trainable": 111407
},
{
"epoch": 1.8238095238095238,
"grad_norm": 0.7428086996078491,
"learning_rate": 6.392344497607657e-06,
"loss": 0.09243252128362656,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09684,
"step": 383,
"tokens/total": 1568768,
"tokens/train_per_sec_per_gpu": 15.2,
"tokens/trainable": 111709
},
{
"epoch": 1.8285714285714287,
"grad_norm": 0.5691149234771729,
"learning_rate": 6.382775119617225e-06,
"loss": 0.09577442705631256,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10051,
"step": 384,
"tokens/total": 1572864,
"tokens/train_per_sec_per_gpu": 13.88,
"tokens/trainable": 112046
},
{
"epoch": 1.8333333333333335,
"grad_norm": 1.0002623796463013,
"learning_rate": 6.373205741626795e-06,
"loss": 0.10170154273509979,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10705,
"step": 385,
"tokens/total": 1576960,
"tokens/train_per_sec_per_gpu": 10.74,
"tokens/trainable": 112283
},
{
"epoch": 1.8380952380952382,
"grad_norm": 0.5939436554908752,
"learning_rate": 6.363636363636364e-06,
"loss": 0.06705500185489655,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06935,
"step": 386,
"tokens/total": 1581056,
"tokens/train_per_sec_per_gpu": 17.99,
"tokens/trainable": 112720
},
{
"epoch": 1.842857142857143,
"grad_norm": 0.6060131192207336,
"learning_rate": 6.354066985645934e-06,
"loss": 0.09325188398361206,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.09774,
"step": 387,
"tokens/total": 1585152,
"tokens/train_per_sec_per_gpu": 12.74,
"tokens/trainable": 113031
},
{
"epoch": 1.8476190476190477,
"grad_norm": 1.1861056089401245,
"learning_rate": 6.344497607655503e-06,
"loss": 0.13157960772514343,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14063,
"step": 388,
"tokens/total": 1589248,
"tokens/train_per_sec_per_gpu": 12.03,
"tokens/trainable": 113300
},
{
"epoch": 1.8523809523809525,
"grad_norm": 1.2170158624649048,
"learning_rate": 6.334928229665072e-06,
"loss": 0.14087001979351044,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15127,
"step": 389,
"tokens/total": 1593344,
"tokens/train_per_sec_per_gpu": 14.27,
"tokens/trainable": 113573
},
{
"epoch": 1.8571428571428572,
"grad_norm": 0.6340734362602234,
"learning_rate": 6.325358851674641e-06,
"loss": 0.11334896832704544,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12002,
"step": 390,
"tokens/total": 1597440,
"tokens/train_per_sec_per_gpu": 18.65,
"tokens/trainable": 113972
},
{
"epoch": 1.861904761904762,
"grad_norm": 0.6850183010101318,
"learning_rate": 6.31578947368421e-06,
"loss": 0.09625604748725891,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10104,
"step": 391,
"tokens/total": 1601536,
"tokens/train_per_sec_per_gpu": 11.8,
"tokens/trainable": 114303
},
{
"epoch": 1.8666666666666667,
"grad_norm": 0.7162591814994812,
"learning_rate": 6.3062200956937806e-06,
"loss": 0.09998545050621033,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10515,
"step": 392,
"tokens/total": 1605632,
"tokens/train_per_sec_per_gpu": 15.22,
"tokens/trainable": 114644
},
{
"epoch": 1.8714285714285714,
"grad_norm": 0.5838465690612793,
"learning_rate": 6.29665071770335e-06,
"loss": 0.06783585250377655,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.07019,
"step": 393,
"tokens/total": 1609728,
"tokens/train_per_sec_per_gpu": 15.64,
"tokens/trainable": 114985
},
{
"epoch": 1.8761904761904762,
"grad_norm": 0.8972572684288025,
"learning_rate": 6.287081339712919e-06,
"loss": 0.07981091737747192,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08308,
"step": 394,
"tokens/total": 1613824,
"tokens/train_per_sec_per_gpu": 10.59,
"tokens/trainable": 115295
},
{
"epoch": 1.880952380952381,
"grad_norm": 0.7543642520904541,
"learning_rate": 6.277511961722489e-06,
"loss": 0.11349859088659286,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12019,
"step": 395,
"tokens/total": 1617920,
"tokens/train_per_sec_per_gpu": 11.05,
"tokens/trainable": 115552
},
{
"epoch": 1.8857142857142857,
"grad_norm": 0.57085120677948,
"learning_rate": 6.267942583732058e-06,
"loss": 0.08496535569429398,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08868,
"step": 396,
"tokens/total": 1622016,
"tokens/train_per_sec_per_gpu": 10.2,
"tokens/trainable": 115799
},
{
"epoch": 1.8904761904761904,
"grad_norm": 0.6159265637397766,
"learning_rate": 6.258373205741627e-06,
"loss": 0.06171874701976776,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06366,
"step": 397,
"tokens/total": 1626112,
"tokens/train_per_sec_per_gpu": 12.61,
"tokens/trainable": 116117
},
{
"epoch": 1.8952380952380952,
"grad_norm": 0.8421717882156372,
"learning_rate": 6.248803827751196e-06,
"loss": 0.10187970101833344,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10725,
"step": 398,
"tokens/total": 1630208,
"tokens/train_per_sec_per_gpu": 15.0,
"tokens/trainable": 116496
},
{
"epoch": 1.9,
"grad_norm": 0.7480407953262329,
"learning_rate": 6.239234449760766e-06,
"loss": 0.10476234555244446,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11045,
"step": 399,
"tokens/total": 1634304,
"tokens/train_per_sec_per_gpu": 19.25,
"tokens/trainable": 116920
},
{
"epoch": 1.9047619047619047,
"grad_norm": 0.43783968687057495,
"learning_rate": 6.229665071770336e-06,
"loss": 0.0689469501376152,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07138,
"step": 400,
"tokens/total": 1638400,
"tokens/train_per_sec_per_gpu": 15.71,
"tokens/trainable": 117238
},
{
"epoch": 1.9095238095238094,
"grad_norm": 1.0542603731155396,
"learning_rate": 6.220095693779905e-06,
"loss": 0.07620616257190704,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07919,
"step": 401,
"tokens/total": 1642496,
"tokens/train_per_sec_per_gpu": 13.37,
"tokens/trainable": 117524
},
{
"epoch": 1.9142857142857141,
"grad_norm": 0.6692041158676147,
"learning_rate": 6.2105263157894745e-06,
"loss": 0.07377033680677414,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07656,
"step": 402,
"tokens/total": 1646592,
"tokens/train_per_sec_per_gpu": 15.54,
"tokens/trainable": 117841
},
{
"epoch": 1.919047619047619,
"grad_norm": 1.2519358396530151,
"learning_rate": 6.200956937799043e-06,
"loss": 0.07229935377836227,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07498,
"step": 403,
"tokens/total": 1650688,
"tokens/train_per_sec_per_gpu": 12.53,
"tokens/trainable": 118146
},
{
"epoch": 1.9238095238095239,
"grad_norm": 0.8904070854187012,
"learning_rate": 6.191387559808612e-06,
"loss": 0.12588144838809967,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13415,
"step": 404,
"tokens/total": 1654784,
"tokens/train_per_sec_per_gpu": 15.55,
"tokens/trainable": 118459
},
{
"epoch": 1.9285714285714286,
"grad_norm": 0.43530920147895813,
"learning_rate": 6.181818181818182e-06,
"loss": 0.048857010900974274,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05007,
"step": 405,
"tokens/total": 1658880,
"tokens/train_per_sec_per_gpu": 8.11,
"tokens/trainable": 118719
},
{
"epoch": 1.9333333333333333,
"grad_norm": 1.0130807161331177,
"learning_rate": 6.172248803827752e-06,
"loss": 0.12293189764022827,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13081,
"step": 406,
"tokens/total": 1662976,
"tokens/train_per_sec_per_gpu": 16.9,
"tokens/trainable": 119130
},
{
"epoch": 1.938095238095238,
"grad_norm": 0.8286269307136536,
"learning_rate": 6.162679425837321e-06,
"loss": 0.13303330540657043,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14229,
"step": 407,
"tokens/total": 1667072,
"tokens/train_per_sec_per_gpu": 12.2,
"tokens/trainable": 119425
},
{
"epoch": 1.9428571428571428,
"grad_norm": 0.6442462801933289,
"learning_rate": 6.153110047846891e-06,
"loss": 0.10066962987184525,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10591,
"step": 408,
"tokens/total": 1671168,
"tokens/train_per_sec_per_gpu": 13.14,
"tokens/trainable": 119695
},
{
"epoch": 1.9476190476190476,
"grad_norm": 0.6401284337043762,
"learning_rate": 6.14354066985646e-06,
"loss": 0.08170831948518753,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.08514,
"step": 409,
"tokens/total": 1675264,
"tokens/train_per_sec_per_gpu": 15.75,
"tokens/trainable": 120035
},
{
"epoch": 1.9523809523809523,
"grad_norm": 0.8274050951004028,
"learning_rate": 6.133971291866029e-06,
"loss": 0.11197835206985474,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11849,
"step": 410,
"tokens/total": 1679360,
"tokens/train_per_sec_per_gpu": 10.75,
"tokens/trainable": 120252
},
{
"epoch": 1.9571428571428573,
"grad_norm": 0.43950921297073364,
"learning_rate": 6.124401913875598e-06,
"loss": 0.04837172105908394,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04956,
"step": 411,
"tokens/total": 1683456,
"tokens/train_per_sec_per_gpu": 14.29,
"tokens/trainable": 120547
},
{
"epoch": 1.961904761904762,
"grad_norm": 0.612568199634552,
"learning_rate": 6.1148325358851675e-06,
"loss": 0.08096243441104889,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08433,
"step": 412,
"tokens/total": 1687552,
"tokens/train_per_sec_per_gpu": 10.18,
"tokens/trainable": 120799
},
{
"epoch": 1.9666666666666668,
"grad_norm": 0.8107662796974182,
"learning_rate": 6.105263157894738e-06,
"loss": 0.09596385806798935,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10072,
"step": 413,
"tokens/total": 1691648,
"tokens/train_per_sec_per_gpu": 12.37,
"tokens/trainable": 121056
},
{
"epoch": 1.9714285714285715,
"grad_norm": 1.2137329578399658,
"learning_rate": 6.095693779904307e-06,
"loss": 0.2036145031452179,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.22583,
"step": 414,
"tokens/total": 1695744,
"tokens/train_per_sec_per_gpu": 12.99,
"tokens/trainable": 121343
},
{
"epoch": 1.9761904761904763,
"grad_norm": 0.6540486812591553,
"learning_rate": 6.0861244019138765e-06,
"loss": 0.11676246672868729,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.12385,
"step": 415,
"tokens/total": 1699840,
"tokens/train_per_sec_per_gpu": 18.55,
"tokens/trainable": 121714
},
{
"epoch": 1.980952380952381,
"grad_norm": 1.0280195474624634,
"learning_rate": 6.076555023923445e-06,
"loss": 0.15656080842018127,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16948,
"step": 416,
"tokens/total": 1703936,
"tokens/train_per_sec_per_gpu": 12.23,
"tokens/trainable": 121998
},
{
"epoch": 1.9857142857142858,
"grad_norm": 0.7349785566329956,
"learning_rate": 6.0669856459330144e-06,
"loss": 0.055647723376750946,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05723,
"step": 417,
"tokens/total": 1708032,
"tokens/train_per_sec_per_gpu": 12.44,
"tokens/trainable": 122242
},
{
"epoch": 1.9904761904761905,
"grad_norm": 0.7874380350112915,
"learning_rate": 6.057416267942584e-06,
"loss": 0.11118850111961365,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11761,
"step": 418,
"tokens/total": 1712128,
"tokens/train_per_sec_per_gpu": 14.29,
"tokens/trainable": 122528
},
{
"epoch": 1.9952380952380953,
"grad_norm": 0.8332106471061707,
"learning_rate": 6.047846889952153e-06,
"loss": 0.08272654563188553,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08624,
"step": 419,
"tokens/total": 1716224,
"tokens/train_per_sec_per_gpu": 10.18,
"tokens/trainable": 122788
},
{
"epoch": 2.0,
"grad_norm": 0.5468876957893372,
"learning_rate": 6.0382775119617234e-06,
"loss": 0.0967540517449379,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10159,
"step": 420,
"tokens/total": 1720320,
"tokens/train_per_sec_per_gpu": 13.94,
"tokens/trainable": 123212
},
{
"epoch": 2.0,
"eval_loss": 0.09063497930765152,
"eval_ppl": 1.09487,
"eval_runtime": 10.3365,
"eval_samples_per_second": 8.61,
"eval_steps_per_second": 2.225,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 35.58,
"memory/max_allocated (GiB)": 35.58,
"step": 420
},
{
"epoch": 2.0047619047619047,
"grad_norm": 0.7299656867980957,
"learning_rate": 6.028708133971293e-06,
"loss": 0.08038073778152466,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0837,
"step": 421,
"tokens/total": 1724416,
"tokens/train_per_sec_per_gpu": 14.47,
"tokens/trainable": 123549
},
{
"epoch": 2.0095238095238095,
"grad_norm": 0.5367144346237183,
"learning_rate": 6.019138755980862e-06,
"loss": 0.04271767660975456,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04364,
"step": 422,
"tokens/total": 1728512,
"tokens/train_per_sec_per_gpu": 12.83,
"tokens/trainable": 123844
},
{
"epoch": 2.0142857142857142,
"grad_norm": 0.7927054166793823,
"learning_rate": 6.009569377990431e-06,
"loss": 0.11457313597202301,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12139,
"step": 423,
"tokens/total": 1732608,
"tokens/train_per_sec_per_gpu": 11.61,
"tokens/trainable": 124091
},
{
"epoch": 2.019047619047619,
"grad_norm": 0.570366382598877,
"learning_rate": 6e-06,
"loss": 0.06566718965768814,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06787,
"step": 424,
"tokens/total": 1736704,
"tokens/train_per_sec_per_gpu": 19.63,
"tokens/trainable": 124430
},
{
"epoch": 2.0238095238095237,
"grad_norm": 0.6495265960693359,
"learning_rate": 5.9904306220095695e-06,
"loss": 0.07726883143186569,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08033,
"step": 425,
"tokens/total": 1740800,
"tokens/train_per_sec_per_gpu": 9.77,
"tokens/trainable": 124705
},
{
"epoch": 2.0285714285714285,
"grad_norm": 0.272966593503952,
"learning_rate": 5.98086124401914e-06,
"loss": 0.033999744802713394,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.03458,
"step": 426,
"tokens/total": 1744896,
"tokens/train_per_sec_per_gpu": 13.54,
"tokens/trainable": 125027
},
{
"epoch": 2.033333333333333,
"grad_norm": 0.5399532318115234,
"learning_rate": 5.971291866028709e-06,
"loss": 0.0716332346200943,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07426,
"step": 427,
"tokens/total": 1748992,
"tokens/train_per_sec_per_gpu": 16.2,
"tokens/trainable": 125408
},
{
"epoch": 2.038095238095238,
"grad_norm": 0.6029632687568665,
"learning_rate": 5.9617224880382786e-06,
"loss": 0.09182186424732208,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.09617,
"step": 428,
"tokens/total": 1753088,
"tokens/train_per_sec_per_gpu": 23.19,
"tokens/trainable": 125758
},
{
"epoch": 2.0428571428571427,
"grad_norm": 4.435783386230469,
"learning_rate": 5.952153110047847e-06,
"loss": 0.11020708829164505,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11651,
"step": 429,
"tokens/total": 1757184,
"tokens/train_per_sec_per_gpu": 13.56,
"tokens/trainable": 126085
},
{
"epoch": 2.0476190476190474,
"grad_norm": 0.5012717247009277,
"learning_rate": 5.9425837320574165e-06,
"loss": 0.08536789566278458,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08912,
"step": 430,
"tokens/total": 1761280,
"tokens/train_per_sec_per_gpu": 14.74,
"tokens/trainable": 126337
},
{
"epoch": 2.052380952380952,
"grad_norm": 0.6422252058982849,
"learning_rate": 5.933014354066986e-06,
"loss": 0.08672700822353363,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0906,
"step": 431,
"tokens/total": 1765376,
"tokens/train_per_sec_per_gpu": 14.84,
"tokens/trainable": 126681
},
{
"epoch": 2.057142857142857,
"grad_norm": 0.706159770488739,
"learning_rate": 5.923444976076555e-06,
"loss": 0.07219837605953217,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07487,
"step": 432,
"tokens/total": 1769472,
"tokens/train_per_sec_per_gpu": 11.37,
"tokens/trainable": 126899
},
{
"epoch": 2.0619047619047617,
"grad_norm": 0.47052693367004395,
"learning_rate": 5.9138755980861255e-06,
"loss": 0.05155189335346222,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0529,
"step": 433,
"tokens/total": 1773568,
"tokens/train_per_sec_per_gpu": 14.06,
"tokens/trainable": 127199
},
{
"epoch": 2.066666666666667,
"grad_norm": 1.336130142211914,
"learning_rate": 5.904306220095695e-06,
"loss": 0.09528717398643494,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09997,
"step": 434,
"tokens/total": 1777664,
"tokens/train_per_sec_per_gpu": 15.0,
"tokens/trainable": 127465
},
{
"epoch": 2.0714285714285716,
"grad_norm": 0.7233858108520508,
"learning_rate": 5.8947368421052634e-06,
"loss": 0.09852813929319382,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10355,
"step": 435,
"tokens/total": 1781760,
"tokens/train_per_sec_per_gpu": 15.27,
"tokens/trainable": 127754
},
{
"epoch": 2.0761904761904764,
"grad_norm": 0.7493842244148254,
"learning_rate": 5.885167464114833e-06,
"loss": 0.08514859527349472,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08888,
"step": 436,
"tokens/total": 1785856,
"tokens/train_per_sec_per_gpu": 9.27,
"tokens/trainable": 128063
},
{
"epoch": 2.080952380952381,
"grad_norm": 0.4522424340248108,
"learning_rate": 5.875598086124402e-06,
"loss": 0.05524425208568573,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0568,
"step": 437,
"tokens/total": 1789952,
"tokens/train_per_sec_per_gpu": 12.29,
"tokens/trainable": 128372
},
{
"epoch": 2.085714285714286,
"grad_norm": 0.6085591912269592,
"learning_rate": 5.866028708133972e-06,
"loss": 0.07435575127601624,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07719,
"step": 438,
"tokens/total": 1794048,
"tokens/train_per_sec_per_gpu": 14.19,
"tokens/trainable": 128705
},
{
"epoch": 2.0904761904761906,
"grad_norm": 0.7386507391929626,
"learning_rate": 5.856459330143541e-06,
"loss": 0.07269930839538574,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07541,
"step": 439,
"tokens/total": 1798144,
"tokens/train_per_sec_per_gpu": 19.96,
"tokens/trainable": 129037
},
{
"epoch": 2.0952380952380953,
"grad_norm": 0.6475787162780762,
"learning_rate": 5.846889952153111e-06,
"loss": 0.06826756149530411,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07065,
"step": 440,
"tokens/total": 1802240,
"tokens/train_per_sec_per_gpu": 11.72,
"tokens/trainable": 129310
},
{
"epoch": 2.1,
"grad_norm": 0.5135707855224609,
"learning_rate": 5.837320574162681e-06,
"loss": 0.0561576709151268,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.05776,
"step": 441,
"tokens/total": 1806336,
"tokens/train_per_sec_per_gpu": 12.27,
"tokens/trainable": 129587
},
{
"epoch": 2.104761904761905,
"grad_norm": 0.5076371431350708,
"learning_rate": 5.827751196172249e-06,
"loss": 0.09091908484697342,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09518,
"step": 442,
"tokens/total": 1810432,
"tokens/train_per_sec_per_gpu": 13.89,
"tokens/trainable": 129851
},
{
"epoch": 2.1095238095238096,
"grad_norm": 0.7993151545524597,
"learning_rate": 5.8181818181818185e-06,
"loss": 0.11744911223649979,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12462,
"step": 443,
"tokens/total": 1814528,
"tokens/train_per_sec_per_gpu": 14.06,
"tokens/trainable": 130137
},
{
"epoch": 2.1142857142857143,
"grad_norm": 0.6741457581520081,
"learning_rate": 5.808612440191388e-06,
"loss": 0.06119607016444206,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06311,
"step": 444,
"tokens/total": 1818624,
"tokens/train_per_sec_per_gpu": 9.3,
"tokens/trainable": 130370
},
{
"epoch": 2.119047619047619,
"grad_norm": 0.4995241165161133,
"learning_rate": 5.799043062200957e-06,
"loss": 0.060865581035614014,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06276,
"step": 445,
"tokens/total": 1822720,
"tokens/train_per_sec_per_gpu": 13.13,
"tokens/trainable": 130620
},
{
"epoch": 2.123809523809524,
"grad_norm": 1.2829558849334717,
"learning_rate": 5.789473684210527e-06,
"loss": 0.10799669474363327,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11404,
"step": 446,
"tokens/total": 1826816,
"tokens/train_per_sec_per_gpu": 10.65,
"tokens/trainable": 130832
},
{
"epoch": 2.1285714285714286,
"grad_norm": 0.6178713440895081,
"learning_rate": 5.779904306220097e-06,
"loss": 0.07918387651443481,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0824,
"step": 447,
"tokens/total": 1830912,
"tokens/train_per_sec_per_gpu": 10.76,
"tokens/trainable": 131075
},
{
"epoch": 2.1333333333333333,
"grad_norm": 0.8874167203903198,
"learning_rate": 5.770334928229665e-06,
"loss": 0.10994468629360199,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11622,
"step": 448,
"tokens/total": 1835008,
"tokens/train_per_sec_per_gpu": 14.39,
"tokens/trainable": 131390
},
{
"epoch": 2.138095238095238,
"grad_norm": 0.5274553894996643,
"learning_rate": 5.760765550239235e-06,
"loss": 0.04991922155022621,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05119,
"step": 449,
"tokens/total": 1839104,
"tokens/train_per_sec_per_gpu": 9.87,
"tokens/trainable": 131641
},
{
"epoch": 2.142857142857143,
"grad_norm": 0.5265685319900513,
"learning_rate": 5.751196172248804e-06,
"loss": 0.06800280511379242,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07037,
"step": 450,
"tokens/total": 1843200,
"tokens/train_per_sec_per_gpu": 18.67,
"tokens/trainable": 131988
},
{
"epoch": 2.1476190476190475,
"grad_norm": 0.6688624620437622,
"learning_rate": 5.741626794258374e-06,
"loss": 0.07494084537029266,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07782,
"step": 451,
"tokens/total": 1847296,
"tokens/train_per_sec_per_gpu": 10.58,
"tokens/trainable": 132268
},
{
"epoch": 2.1523809523809523,
"grad_norm": 0.7583678960800171,
"learning_rate": 5.732057416267943e-06,
"loss": 0.07973390817642212,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.083,
"step": 452,
"tokens/total": 1851392,
"tokens/train_per_sec_per_gpu": 12.94,
"tokens/trainable": 132537
},
{
"epoch": 2.157142857142857,
"grad_norm": 0.7710968255996704,
"learning_rate": 5.722488038277512e-06,
"loss": 0.059347622096538544,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06114,
"step": 453,
"tokens/total": 1855488,
"tokens/train_per_sec_per_gpu": 8.91,
"tokens/trainable": 132725
},
{
"epoch": 2.1619047619047618,
"grad_norm": 0.6877778768539429,
"learning_rate": 5.712918660287083e-06,
"loss": 0.0703950971364975,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07293,
"step": 454,
"tokens/total": 1859584,
"tokens/train_per_sec_per_gpu": 13.66,
"tokens/trainable": 132966
},
{
"epoch": 2.1666666666666665,
"grad_norm": 0.9029383063316345,
"learning_rate": 5.70334928229665e-06,
"loss": 0.1015714481472969,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10691,
"step": 455,
"tokens/total": 1863680,
"tokens/train_per_sec_per_gpu": 9.51,
"tokens/trainable": 133230
},
{
"epoch": 2.1714285714285713,
"grad_norm": 0.68222975730896,
"learning_rate": 5.693779904306221e-06,
"loss": 0.08985096216201782,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09401,
"step": 456,
"tokens/total": 1867776,
"tokens/train_per_sec_per_gpu": 23.65,
"tokens/trainable": 133595
},
{
"epoch": 2.176190476190476,
"grad_norm": 0.8007204532623291,
"learning_rate": 5.68421052631579e-06,
"loss": 0.0790681391954422,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08228,
"step": 457,
"tokens/total": 1871872,
"tokens/train_per_sec_per_gpu": 18.34,
"tokens/trainable": 133904
},
{
"epoch": 2.1809523809523808,
"grad_norm": 0.46541061997413635,
"learning_rate": 5.674641148325359e-06,
"loss": 0.049216851592063904,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05045,
"step": 458,
"tokens/total": 1875968,
"tokens/train_per_sec_per_gpu": 8.31,
"tokens/trainable": 134132
},
{
"epoch": 2.185714285714286,
"grad_norm": 0.4131176173686981,
"learning_rate": 5.665071770334929e-06,
"loss": 0.0468255877494812,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04794,
"step": 459,
"tokens/total": 1880064,
"tokens/train_per_sec_per_gpu": 17.36,
"tokens/trainable": 134429
},
{
"epoch": 2.1904761904761907,
"grad_norm": 0.7962276935577393,
"learning_rate": 5.655502392344498e-06,
"loss": 0.09427708387374878,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09886,
"step": 460,
"tokens/total": 1884160,
"tokens/train_per_sec_per_gpu": 15.21,
"tokens/trainable": 134737
},
{
"epoch": 2.1952380952380954,
"grad_norm": 1.0497944355010986,
"learning_rate": 5.645933014354067e-06,
"loss": 0.12763239443302155,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13614,
"step": 461,
"tokens/total": 1888256,
"tokens/train_per_sec_per_gpu": 14.99,
"tokens/trainable": 135039
},
{
"epoch": 2.2,
"grad_norm": 0.676685094833374,
"learning_rate": 5.636363636363636e-06,
"loss": 0.1088184341788292,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11496,
"step": 462,
"tokens/total": 1892352,
"tokens/train_per_sec_per_gpu": 13.36,
"tokens/trainable": 135338
},
{
"epoch": 2.204761904761905,
"grad_norm": 0.8243446946144104,
"learning_rate": 5.626794258373206e-06,
"loss": 0.08344703912734985,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08703,
"step": 463,
"tokens/total": 1896448,
"tokens/train_per_sec_per_gpu": 16.53,
"tokens/trainable": 135645
},
{
"epoch": 2.2095238095238097,
"grad_norm": 0.48808151483535767,
"learning_rate": 5.617224880382776e-06,
"loss": 0.04418756067752838,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04518,
"step": 464,
"tokens/total": 1900544,
"tokens/train_per_sec_per_gpu": 12.72,
"tokens/trainable": 135877
},
{
"epoch": 2.2142857142857144,
"grad_norm": 0.8586388230323792,
"learning_rate": 5.607655502392345e-06,
"loss": 0.0482182651758194,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0494,
"step": 465,
"tokens/total": 1904640,
"tokens/train_per_sec_per_gpu": 12.92,
"tokens/trainable": 136106
},
{
"epoch": 2.219047619047619,
"grad_norm": 1.033241868019104,
"learning_rate": 5.5980861244019145e-06,
"loss": 0.13134968280792236,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14037,
"step": 466,
"tokens/total": 1908736,
"tokens/train_per_sec_per_gpu": 18.94,
"tokens/trainable": 136508
},
{
"epoch": 2.223809523809524,
"grad_norm": 0.6962218880653381,
"learning_rate": 5.588516746411484e-06,
"loss": 0.1050298735499382,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11074,
"step": 467,
"tokens/total": 1912832,
"tokens/train_per_sec_per_gpu": 19.56,
"tokens/trainable": 136895
},
{
"epoch": 2.2285714285714286,
"grad_norm": 1.0098704099655151,
"learning_rate": 5.578947368421052e-06,
"loss": 0.10072275996208191,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10597,
"step": 468,
"tokens/total": 1916928,
"tokens/train_per_sec_per_gpu": 7.89,
"tokens/trainable": 137091
},
{
"epoch": 2.2333333333333334,
"grad_norm": 0.6704676151275635,
"learning_rate": 5.569377990430623e-06,
"loss": 0.059372853487730026,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06117,
"step": 469,
"tokens/total": 1921024,
"tokens/train_per_sec_per_gpu": 16.83,
"tokens/trainable": 137444
},
{
"epoch": 2.238095238095238,
"grad_norm": 0.6171624064445496,
"learning_rate": 5.559808612440192e-06,
"loss": 0.06646374613046646,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06872,
"step": 470,
"tokens/total": 1925120,
"tokens/train_per_sec_per_gpu": 13.77,
"tokens/trainable": 137741
},
{
"epoch": 2.242857142857143,
"grad_norm": 1.2899796962738037,
"learning_rate": 5.550239234449761e-06,
"loss": 0.1084589809179306,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11456,
"step": 471,
"tokens/total": 1929216,
"tokens/train_per_sec_per_gpu": 10.58,
"tokens/trainable": 137958
},
{
"epoch": 2.2476190476190476,
"grad_norm": 0.7799538969993591,
"learning_rate": 5.540669856459331e-06,
"loss": 0.08141331374645233,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08482,
"step": 472,
"tokens/total": 1933312,
"tokens/train_per_sec_per_gpu": 10.94,
"tokens/trainable": 138201
},
{
"epoch": 2.2523809523809524,
"grad_norm": 1.5501976013183594,
"learning_rate": 5.5311004784689e-06,
"loss": 0.05066931992769241,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05197,
"step": 473,
"tokens/total": 1937408,
"tokens/train_per_sec_per_gpu": 10.48,
"tokens/trainable": 138531
},
{
"epoch": 2.257142857142857,
"grad_norm": 0.6510878205299377,
"learning_rate": 5.521531100478469e-06,
"loss": 0.0661131888628006,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.06835,
"step": 474,
"tokens/total": 1941504,
"tokens/train_per_sec_per_gpu": 15.26,
"tokens/trainable": 138862
},
{
"epoch": 2.261904761904762,
"grad_norm": 0.5600479245185852,
"learning_rate": 5.511961722488038e-06,
"loss": 0.07156892865896225,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07419,
"step": 475,
"tokens/total": 1945600,
"tokens/train_per_sec_per_gpu": 14.49,
"tokens/trainable": 139227
},
{
"epoch": 2.2666666666666666,
"grad_norm": 0.22503618896007538,
"learning_rate": 5.502392344497608e-06,
"loss": 0.024924561381340027,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02524,
"step": 476,
"tokens/total": 1949696,
"tokens/train_per_sec_per_gpu": 17.97,
"tokens/trainable": 139524
},
{
"epoch": 2.2714285714285714,
"grad_norm": 11.384724617004395,
"learning_rate": 5.492822966507178e-06,
"loss": 0.08557814359664917,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08935,
"step": 477,
"tokens/total": 1953792,
"tokens/train_per_sec_per_gpu": 14.9,
"tokens/trainable": 139801
},
{
"epoch": 2.276190476190476,
"grad_norm": 0.8630121350288391,
"learning_rate": 5.483253588516747e-06,
"loss": 0.07430025935173035,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07713,
"step": 478,
"tokens/total": 1957888,
"tokens/train_per_sec_per_gpu": 13.43,
"tokens/trainable": 140096
},
{
"epoch": 2.280952380952381,
"grad_norm": 0.5071492195129395,
"learning_rate": 5.4736842105263165e-06,
"loss": 0.06158454343676567,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06352,
"step": 479,
"tokens/total": 1961984,
"tokens/train_per_sec_per_gpu": 13.16,
"tokens/trainable": 140333
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.95302414894104,
"learning_rate": 5.464114832535886e-06,
"loss": 0.10877791047096252,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11491,
"step": 480,
"tokens/total": 1966080,
"tokens/train_per_sec_per_gpu": 20.9,
"tokens/trainable": 140702
},
{
"epoch": 2.2904761904761903,
"grad_norm": 0.7657179236412048,
"learning_rate": 5.4545454545454545e-06,
"loss": 0.08901463449001312,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0931,
"step": 481,
"tokens/total": 1970176,
"tokens/train_per_sec_per_gpu": 16.74,
"tokens/trainable": 141092
},
{
"epoch": 2.295238095238095,
"grad_norm": 0.7546993494033813,
"learning_rate": 5.444976076555024e-06,
"loss": 0.11137181520462036,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11781,
"step": 482,
"tokens/total": 1974272,
"tokens/train_per_sec_per_gpu": 11.91,
"tokens/trainable": 141376
},
{
"epoch": 2.3,
"grad_norm": 0.9208468198776245,
"learning_rate": 5.435406698564594e-06,
"loss": 0.08001670241355896,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08331,
"step": 483,
"tokens/total": 1978368,
"tokens/train_per_sec_per_gpu": 11.28,
"tokens/trainable": 141667
},
{
"epoch": 2.3047619047619046,
"grad_norm": 0.7315728664398193,
"learning_rate": 5.4258373205741635e-06,
"loss": 0.09134405851364136,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09565,
"step": 484,
"tokens/total": 1982464,
"tokens/train_per_sec_per_gpu": 12.09,
"tokens/trainable": 142026
},
{
"epoch": 2.3095238095238093,
"grad_norm": 1.0361758470535278,
"learning_rate": 5.416267942583733e-06,
"loss": 0.09037132561206818,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09458,
"step": 485,
"tokens/total": 1986560,
"tokens/train_per_sec_per_gpu": 10.34,
"tokens/trainable": 142257
},
{
"epoch": 2.314285714285714,
"grad_norm": 0.9890063405036926,
"learning_rate": 5.406698564593302e-06,
"loss": 0.0984952449798584,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10351,
"step": 486,
"tokens/total": 1990656,
"tokens/train_per_sec_per_gpu": 14.67,
"tokens/trainable": 142556
},
{
"epoch": 2.319047619047619,
"grad_norm": 0.9803997874259949,
"learning_rate": 5.397129186602871e-06,
"loss": 0.08330434560775757,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08687,
"step": 487,
"tokens/total": 1994752,
"tokens/train_per_sec_per_gpu": 13.84,
"tokens/trainable": 142824
},
{
"epoch": 2.323809523809524,
"grad_norm": 0.8348151445388794,
"learning_rate": 5.38755980861244e-06,
"loss": 0.09529228508472443,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09998,
"step": 488,
"tokens/total": 1998848,
"tokens/train_per_sec_per_gpu": 15.12,
"tokens/trainable": 143109
},
{
"epoch": 2.3285714285714287,
"grad_norm": 1.044250249862671,
"learning_rate": 5.3779904306220096e-06,
"loss": 0.10967185348272324,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11591,
"step": 489,
"tokens/total": 2002944,
"tokens/train_per_sec_per_gpu": 11.37,
"tokens/trainable": 143371
},
{
"epoch": 2.3333333333333335,
"grad_norm": 0.7318430542945862,
"learning_rate": 5.36842105263158e-06,
"loss": 0.061104319989681244,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06301,
"step": 490,
"tokens/total": 2007040,
"tokens/train_per_sec_per_gpu": 12.7,
"tokens/trainable": 143648
},
{
"epoch": 2.3380952380952382,
"grad_norm": 0.6046728491783142,
"learning_rate": 5.358851674641149e-06,
"loss": 0.07590795308351517,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07886,
"step": 491,
"tokens/total": 2011136,
"tokens/train_per_sec_per_gpu": 11.62,
"tokens/trainable": 143964
},
{
"epoch": 2.342857142857143,
"grad_norm": 0.36420607566833496,
"learning_rate": 5.3492822966507186e-06,
"loss": 0.04336003586649895,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04431,
"step": 492,
"tokens/total": 2015232,
"tokens/train_per_sec_per_gpu": 12.39,
"tokens/trainable": 144271
},
{
"epoch": 2.3476190476190477,
"grad_norm": 0.6114564538002014,
"learning_rate": 5.339712918660288e-06,
"loss": 0.06792014837265015,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07028,
"step": 493,
"tokens/total": 2019328,
"tokens/train_per_sec_per_gpu": 15.04,
"tokens/trainable": 144580
},
{
"epoch": 2.3523809523809525,
"grad_norm": 0.49948400259017944,
"learning_rate": 5.3301435406698565e-06,
"loss": 0.050412971526384354,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05171,
"step": 494,
"tokens/total": 2023424,
"tokens/train_per_sec_per_gpu": 11.16,
"tokens/trainable": 144853
},
{
"epoch": 2.357142857142857,
"grad_norm": 1.2982183694839478,
"learning_rate": 5.320574162679426e-06,
"loss": 0.09459419548511505,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09921,
"step": 495,
"tokens/total": 2027520,
"tokens/train_per_sec_per_gpu": 8.11,
"tokens/trainable": 145057
},
{
"epoch": 2.361904761904762,
"grad_norm": 1.496275544166565,
"learning_rate": 5.311004784688995e-06,
"loss": 0.13228096067905426,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14143,
"step": 496,
"tokens/total": 2031616,
"tokens/train_per_sec_per_gpu": 11.86,
"tokens/trainable": 145299
},
{
"epoch": 2.3666666666666667,
"grad_norm": 0.8566056489944458,
"learning_rate": 5.3014354066985655e-06,
"loss": 0.09681127220392227,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10165,
"step": 497,
"tokens/total": 2035712,
"tokens/train_per_sec_per_gpu": 11.2,
"tokens/trainable": 145532
},
{
"epoch": 2.3714285714285714,
"grad_norm": 0.8557098507881165,
"learning_rate": 5.291866028708135e-06,
"loss": 0.14163172245025635,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15215,
"step": 498,
"tokens/total": 2039808,
"tokens/train_per_sec_per_gpu": 26.72,
"tokens/trainable": 145990
},
{
"epoch": 2.376190476190476,
"grad_norm": 0.6874766945838928,
"learning_rate": 5.282296650717704e-06,
"loss": 0.0928252637386322,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09727,
"step": 499,
"tokens/total": 2043904,
"tokens/train_per_sec_per_gpu": 16.58,
"tokens/trainable": 146338
},
{
"epoch": 2.380952380952381,
"grad_norm": 0.5962072014808655,
"learning_rate": 5.272727272727273e-06,
"loss": 0.045713819563388824,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04677,
"step": 500,
"tokens/total": 2048000,
"tokens/train_per_sec_per_gpu": 9.35,
"tokens/trainable": 146621
},
{
"epoch": 2.3857142857142857,
"grad_norm": 0.6994227766990662,
"learning_rate": 5.263157894736842e-06,
"loss": 0.0747811570763588,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07765,
"step": 501,
"tokens/total": 2052096,
"tokens/train_per_sec_per_gpu": 10.56,
"tokens/trainable": 146854
},
{
"epoch": 2.3904761904761904,
"grad_norm": 0.7604936361312866,
"learning_rate": 5.253588516746412e-06,
"loss": 0.07655870169401169,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07957,
"step": 502,
"tokens/total": 2056192,
"tokens/train_per_sec_per_gpu": 11.09,
"tokens/trainable": 147075
},
{
"epoch": 2.395238095238095,
"grad_norm": 0.9588606357574463,
"learning_rate": 5.244019138755981e-06,
"loss": 0.11817756295204163,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12544,
"step": 503,
"tokens/total": 2060288,
"tokens/train_per_sec_per_gpu": 12.14,
"tokens/trainable": 147362
},
{
"epoch": 2.4,
"grad_norm": 0.6628692746162415,
"learning_rate": 5.234449760765551e-06,
"loss": 0.09815141558647156,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10313,
"step": 504,
"tokens/total": 2064384,
"tokens/train_per_sec_per_gpu": 22.65,
"tokens/trainable": 147733
},
{
"epoch": 2.4047619047619047,
"grad_norm": 1.0721534490585327,
"learning_rate": 5.224880382775121e-06,
"loss": 0.1393708884716034,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.14955,
"step": 505,
"tokens/total": 2068480,
"tokens/train_per_sec_per_gpu": 12.26,
"tokens/trainable": 148046
},
{
"epoch": 2.4095238095238094,
"grad_norm": 0.789513349533081,
"learning_rate": 5.215311004784689e-06,
"loss": 0.13143616914749146,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14047,
"step": 506,
"tokens/total": 2072576,
"tokens/train_per_sec_per_gpu": 15.5,
"tokens/trainable": 148318
},
{
"epoch": 2.414285714285714,
"grad_norm": 0.5102568864822388,
"learning_rate": 5.2057416267942586e-06,
"loss": 0.044160425662994385,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04515,
"step": 507,
"tokens/total": 2076672,
"tokens/train_per_sec_per_gpu": 10.74,
"tokens/trainable": 148594
},
{
"epoch": 2.419047619047619,
"grad_norm": 0.717756986618042,
"learning_rate": 5.196172248803828e-06,
"loss": 0.0987585261464119,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1038,
"step": 508,
"tokens/total": 2080768,
"tokens/train_per_sec_per_gpu": 12.98,
"tokens/trainable": 148857
},
{
"epoch": 2.4238095238095236,
"grad_norm": 0.8132109642028809,
"learning_rate": 5.186602870813397e-06,
"loss": 0.0786421149969101,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08182,
"step": 509,
"tokens/total": 2084864,
"tokens/train_per_sec_per_gpu": 10.09,
"tokens/trainable": 149160
},
{
"epoch": 2.4285714285714284,
"grad_norm": 1.0510293245315552,
"learning_rate": 5.177033492822967e-06,
"loss": 0.11246781051158905,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11904,
"step": 510,
"tokens/total": 2088960,
"tokens/train_per_sec_per_gpu": 11.42,
"tokens/trainable": 149476
},
{
"epoch": 2.4333333333333336,
"grad_norm": 0.9610063433647156,
"learning_rate": 5.167464114832537e-06,
"loss": 0.1295289546251297,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13829,
"step": 511,
"tokens/total": 2093056,
"tokens/train_per_sec_per_gpu": 10.39,
"tokens/trainable": 149733
},
{
"epoch": 2.4380952380952383,
"grad_norm": 0.6407898664474487,
"learning_rate": 5.157894736842106e-06,
"loss": 0.041559718549251556,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04244,
"step": 512,
"tokens/total": 2097152,
"tokens/train_per_sec_per_gpu": 12.15,
"tokens/trainable": 149960
},
{
"epoch": 2.442857142857143,
"grad_norm": 0.6103262901306152,
"learning_rate": 5.148325358851675e-06,
"loss": 0.04148872196674347,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04236,
"step": 513,
"tokens/total": 2101248,
"tokens/train_per_sec_per_gpu": 10.17,
"tokens/trainable": 150178
},
{
"epoch": 2.447619047619048,
"grad_norm": 0.4540882110595703,
"learning_rate": 5.138755980861244e-06,
"loss": 0.0655214786529541,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06772,
"step": 514,
"tokens/total": 2105344,
"tokens/train_per_sec_per_gpu": 16.99,
"tokens/trainable": 150512
},
{
"epoch": 2.4523809523809526,
"grad_norm": 0.7555355429649353,
"learning_rate": 5.129186602870814e-06,
"loss": 0.11386040598154068,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1206,
"step": 515,
"tokens/total": 2109440,
"tokens/train_per_sec_per_gpu": 19.26,
"tokens/trainable": 150978
},
{
"epoch": 2.4571428571428573,
"grad_norm": 0.7311438322067261,
"learning_rate": 5.119617224880383e-06,
"loss": 0.0901159942150116,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0943,
"step": 516,
"tokens/total": 2113536,
"tokens/train_per_sec_per_gpu": 10.0,
"tokens/trainable": 151213
},
{
"epoch": 2.461904761904762,
"grad_norm": 0.8779038786888123,
"learning_rate": 5.1100478468899524e-06,
"loss": 0.08724822103977203,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09117,
"step": 517,
"tokens/total": 2117632,
"tokens/train_per_sec_per_gpu": 11.79,
"tokens/trainable": 151536
},
{
"epoch": 2.466666666666667,
"grad_norm": 0.43343234062194824,
"learning_rate": 5.100478468899523e-06,
"loss": 0.04299956187605858,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04394,
"step": 518,
"tokens/total": 2121728,
"tokens/train_per_sec_per_gpu": 10.73,
"tokens/trainable": 151773
},
{
"epoch": 2.4714285714285715,
"grad_norm": 0.2579718232154846,
"learning_rate": 5.090909090909091e-06,
"loss": 0.029250185936689377,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02968,
"step": 519,
"tokens/total": 2125824,
"tokens/train_per_sec_per_gpu": 10.96,
"tokens/trainable": 151986
},
{
"epoch": 2.4761904761904763,
"grad_norm": 0.6281625032424927,
"learning_rate": 5.081339712918661e-06,
"loss": 0.04683239012956619,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04795,
"step": 520,
"tokens/total": 2129920,
"tokens/train_per_sec_per_gpu": 9.73,
"tokens/trainable": 152226
},
{
"epoch": 2.480952380952381,
"grad_norm": 0.8255984783172607,
"learning_rate": 5.07177033492823e-06,
"loss": 0.106313556432724,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.11217,
"step": 521,
"tokens/total": 2134016,
"tokens/train_per_sec_per_gpu": 20.19,
"tokens/trainable": 152535
},
{
"epoch": 2.4857142857142858,
"grad_norm": 0.8105759024620056,
"learning_rate": 5.062200956937799e-06,
"loss": 0.07927460223436356,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0825,
"step": 522,
"tokens/total": 2138112,
"tokens/train_per_sec_per_gpu": 11.63,
"tokens/trainable": 152762
},
{
"epoch": 2.4904761904761905,
"grad_norm": 0.4739595949649811,
"learning_rate": 5.052631578947369e-06,
"loss": 0.060388147830963135,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06225,
"step": 523,
"tokens/total": 2142208,
"tokens/train_per_sec_per_gpu": 21.16,
"tokens/trainable": 153097
},
{
"epoch": 2.4952380952380953,
"grad_norm": 0.6768450736999512,
"learning_rate": 5.043062200956938e-06,
"loss": 0.058053936809301376,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.05977,
"step": 524,
"tokens/total": 2146304,
"tokens/train_per_sec_per_gpu": 17.86,
"tokens/trainable": 153414
},
{
"epoch": 2.5,
"grad_norm": 0.7326765656471252,
"learning_rate": 5.033492822966508e-06,
"loss": 0.10788488388061523,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11392,
"step": 525,
"tokens/total": 2150400,
"tokens/train_per_sec_per_gpu": 11.54,
"tokens/trainable": 153759
},
{
"epoch": 2.5047619047619047,
"grad_norm": 1.1349955797195435,
"learning_rate": 5.023923444976077e-06,
"loss": 0.15112200379371643,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.16314,
"step": 526,
"tokens/total": 2154496,
"tokens/train_per_sec_per_gpu": 12.13,
"tokens/trainable": 154052
},
{
"epoch": 2.5095238095238095,
"grad_norm": 0.9874095320701599,
"learning_rate": 5.014354066985646e-06,
"loss": 0.0937184989452362,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09825,
"step": 527,
"tokens/total": 2158592,
"tokens/train_per_sec_per_gpu": 10.86,
"tokens/trainable": 154391
},
{
"epoch": 2.5142857142857142,
"grad_norm": 0.9318037033081055,
"learning_rate": 5.004784688995216e-06,
"loss": 0.08227807283401489,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08576,
"step": 528,
"tokens/total": 2162688,
"tokens/train_per_sec_per_gpu": 11.81,
"tokens/trainable": 154642
},
{
"epoch": 2.519047619047619,
"grad_norm": 0.5632556080818176,
"learning_rate": 4.995215311004785e-06,
"loss": 0.05418809875845909,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05568,
"step": 529,
"tokens/total": 2166784,
"tokens/train_per_sec_per_gpu": 13.83,
"tokens/trainable": 154953
},
{
"epoch": 2.5238095238095237,
"grad_norm": 0.8830906748771667,
"learning_rate": 4.9856459330143545e-06,
"loss": 0.15271666646003723,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.16499,
"step": 530,
"tokens/total": 2170880,
"tokens/train_per_sec_per_gpu": 16.43,
"tokens/trainable": 155427
},
{
"epoch": 2.5285714285714285,
"grad_norm": 0.8743612766265869,
"learning_rate": 4.976076555023924e-06,
"loss": 0.12847112119197845,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13709,
"step": 531,
"tokens/total": 2174976,
"tokens/train_per_sec_per_gpu": 13.95,
"tokens/trainable": 155739
},
{
"epoch": 2.533333333333333,
"grad_norm": 0.6132271885871887,
"learning_rate": 4.966507177033493e-06,
"loss": 0.08681163191795349,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09069,
"step": 532,
"tokens/total": 2179072,
"tokens/train_per_sec_per_gpu": 14.1,
"tokens/trainable": 156058
},
{
"epoch": 2.538095238095238,
"grad_norm": 1.1388221979141235,
"learning_rate": 4.956937799043063e-06,
"loss": 0.11160650104284286,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11807,
"step": 533,
"tokens/total": 2183168,
"tokens/train_per_sec_per_gpu": 10.02,
"tokens/trainable": 156291
},
{
"epoch": 2.5428571428571427,
"grad_norm": 0.5418483018875122,
"learning_rate": 4.947368421052632e-06,
"loss": 0.06877899914979935,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.0712,
"step": 534,
"tokens/total": 2187264,
"tokens/train_per_sec_per_gpu": 12.37,
"tokens/trainable": 156561
},
{
"epoch": 2.5476190476190474,
"grad_norm": 0.4854298233985901,
"learning_rate": 4.9377990430622014e-06,
"loss": 0.07671515643596649,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07973,
"step": 535,
"tokens/total": 2191360,
"tokens/train_per_sec_per_gpu": 13.33,
"tokens/trainable": 156863
},
{
"epoch": 2.552380952380952,
"grad_norm": 0.6366608142852783,
"learning_rate": 4.928229665071771e-06,
"loss": 0.052159231156110764,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05354,
"step": 536,
"tokens/total": 2195456,
"tokens/train_per_sec_per_gpu": 12.15,
"tokens/trainable": 157097
},
{
"epoch": 2.557142857142857,
"grad_norm": 0.8776169419288635,
"learning_rate": 4.91866028708134e-06,
"loss": 0.09952576458454132,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10465,
"step": 537,
"tokens/total": 2199552,
"tokens/train_per_sec_per_gpu": 14.1,
"tokens/trainable": 157357
},
{
"epoch": 2.5619047619047617,
"grad_norm": 0.930878221988678,
"learning_rate": 4.90909090909091e-06,
"loss": 0.09620843827724457,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10099,
"step": 538,
"tokens/total": 2203648,
"tokens/train_per_sec_per_gpu": 17.37,
"tokens/trainable": 157750
},
{
"epoch": 2.5666666666666664,
"grad_norm": 0.9390467405319214,
"learning_rate": 4.899521531100479e-06,
"loss": 0.1333330124616623,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.14263,
"step": 539,
"tokens/total": 2207744,
"tokens/train_per_sec_per_gpu": 20.2,
"tokens/trainable": 158105
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.8828926682472229,
"learning_rate": 4.889952153110048e-06,
"loss": 0.14065320789813995,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15103,
"step": 540,
"tokens/total": 2211840,
"tokens/train_per_sec_per_gpu": 12.07,
"tokens/trainable": 158385
},
{
"epoch": 2.576190476190476,
"grad_norm": 0.6615021824836731,
"learning_rate": 4.880382775119618e-06,
"loss": 0.06263934075832367,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06464,
"step": 541,
"tokens/total": 2215936,
"tokens/train_per_sec_per_gpu": 15.48,
"tokens/trainable": 158690
},
{
"epoch": 2.580952380952381,
"grad_norm": 0.7471950650215149,
"learning_rate": 4.870813397129187e-06,
"loss": 0.06098947301506996,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.06289,
"step": 542,
"tokens/total": 2220032,
"tokens/train_per_sec_per_gpu": 16.24,
"tokens/trainable": 158963
},
{
"epoch": 2.585714285714286,
"grad_norm": 0.856507420539856,
"learning_rate": 4.8612440191387565e-06,
"loss": 0.06497907638549805,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06714,
"step": 543,
"tokens/total": 2224128,
"tokens/train_per_sec_per_gpu": 10.19,
"tokens/trainable": 159236
},
{
"epoch": 2.5904761904761906,
"grad_norm": 0.7332066893577576,
"learning_rate": 4.851674641148326e-06,
"loss": 0.08813416957855225,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09213,
"step": 544,
"tokens/total": 2228224,
"tokens/train_per_sec_per_gpu": 9.67,
"tokens/trainable": 159454
},
{
"epoch": 2.5952380952380953,
"grad_norm": 0.8077099323272705,
"learning_rate": 4.842105263157895e-06,
"loss": 0.07312612235546112,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07587,
"step": 545,
"tokens/total": 2232320,
"tokens/train_per_sec_per_gpu": 10.61,
"tokens/trainable": 159676
},
{
"epoch": 2.6,
"grad_norm": 0.6955282092094421,
"learning_rate": 4.832535885167465e-06,
"loss": 0.09943203628063202,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10454,
"step": 546,
"tokens/total": 2236416,
"tokens/train_per_sec_per_gpu": 18.31,
"tokens/trainable": 160051
},
{
"epoch": 2.604761904761905,
"grad_norm": 0.835927426815033,
"learning_rate": 4.822966507177034e-06,
"loss": 0.06828266382217407,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07067,
"step": 547,
"tokens/total": 2240512,
"tokens/train_per_sec_per_gpu": 12.04,
"tokens/trainable": 160324
},
{
"epoch": 2.6095238095238096,
"grad_norm": 0.5681146383285522,
"learning_rate": 4.8133971291866035e-06,
"loss": 0.05898406356573105,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06076,
"step": 548,
"tokens/total": 2244608,
"tokens/train_per_sec_per_gpu": 12.42,
"tokens/trainable": 160605
},
{
"epoch": 2.6142857142857143,
"grad_norm": 0.584089457988739,
"learning_rate": 4.803827751196173e-06,
"loss": 0.05229197070002556,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.05368,
"step": 549,
"tokens/total": 2248704,
"tokens/train_per_sec_per_gpu": 14.28,
"tokens/trainable": 160847
},
{
"epoch": 2.619047619047619,
"grad_norm": 0.5604119300842285,
"learning_rate": 4.794258373205741e-06,
"loss": 0.06550096720457077,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06769,
"step": 550,
"tokens/total": 2252800,
"tokens/train_per_sec_per_gpu": 13.77,
"tokens/trainable": 161110
},
{
"epoch": 2.623809523809524,
"grad_norm": 0.6032201051712036,
"learning_rate": 4.784688995215312e-06,
"loss": 0.08309999108314514,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08665,
"step": 551,
"tokens/total": 2256896,
"tokens/train_per_sec_per_gpu": 9.8,
"tokens/trainable": 161423
},
{
"epoch": 2.6285714285714286,
"grad_norm": 0.5156391859054565,
"learning_rate": 4.775119617224881e-06,
"loss": 0.05599772557616234,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0576,
"step": 552,
"tokens/total": 2260992,
"tokens/train_per_sec_per_gpu": 17.55,
"tokens/trainable": 161784
},
{
"epoch": 2.6333333333333333,
"grad_norm": 0.8425244092941284,
"learning_rate": 4.76555023923445e-06,
"loss": 0.13661256432533264,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14638,
"step": 553,
"tokens/total": 2265088,
"tokens/train_per_sec_per_gpu": 15.11,
"tokens/trainable": 162103
},
{
"epoch": 2.638095238095238,
"grad_norm": 0.6089537143707275,
"learning_rate": 4.75598086124402e-06,
"loss": 0.05394409969449043,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05543,
"step": 554,
"tokens/total": 2269184,
"tokens/train_per_sec_per_gpu": 13.95,
"tokens/trainable": 162339
},
{
"epoch": 2.642857142857143,
"grad_norm": 0.7857866883277893,
"learning_rate": 4.746411483253589e-06,
"loss": 0.08736590296030045,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0913,
"step": 555,
"tokens/total": 2273280,
"tokens/train_per_sec_per_gpu": 11.75,
"tokens/trainable": 162604
},
{
"epoch": 2.6476190476190475,
"grad_norm": 0.5566453337669373,
"learning_rate": 4.736842105263158e-06,
"loss": 0.04392281174659729,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0449,
"step": 556,
"tokens/total": 2277376,
"tokens/train_per_sec_per_gpu": 10.74,
"tokens/trainable": 162853
},
{
"epoch": 2.6523809523809523,
"grad_norm": 0.7361345291137695,
"learning_rate": 4.727272727272728e-06,
"loss": 0.08509525656700134,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08882,
"step": 557,
"tokens/total": 2281472,
"tokens/train_per_sec_per_gpu": 11.46,
"tokens/trainable": 163179
},
{
"epoch": 2.657142857142857,
"grad_norm": 0.740824818611145,
"learning_rate": 4.717703349282297e-06,
"loss": 0.07808547466993332,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08122,
"step": 558,
"tokens/total": 2285568,
"tokens/train_per_sec_per_gpu": 20.6,
"tokens/trainable": 163529
},
{
"epoch": 2.6619047619047618,
"grad_norm": 0.5467495918273926,
"learning_rate": 4.708133971291867e-06,
"loss": 0.035560429096221924,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0362,
"step": 559,
"tokens/total": 2289664,
"tokens/train_per_sec_per_gpu": 10.29,
"tokens/trainable": 163778
},
{
"epoch": 2.6666666666666665,
"grad_norm": 0.9296587705612183,
"learning_rate": 4.698564593301435e-06,
"loss": 0.09681244194507599,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10165,
"step": 560,
"tokens/total": 2293760,
"tokens/train_per_sec_per_gpu": 10.78,
"tokens/trainable": 164042
},
{
"epoch": 2.6714285714285713,
"grad_norm": 0.6016287207603455,
"learning_rate": 4.6889952153110055e-06,
"loss": 0.044333577156066895,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04533,
"step": 561,
"tokens/total": 2297856,
"tokens/train_per_sec_per_gpu": 9.94,
"tokens/trainable": 164297
},
{
"epoch": 2.6761904761904765,
"grad_norm": 0.7982633709907532,
"learning_rate": 4.679425837320575e-06,
"loss": 0.10645254701375961,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11233,
"step": 562,
"tokens/total": 2301952,
"tokens/train_per_sec_per_gpu": 8.47,
"tokens/trainable": 164585
},
{
"epoch": 2.680952380952381,
"grad_norm": 1.001904010772705,
"learning_rate": 4.6698564593301435e-06,
"loss": 0.11368199437856674,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.1204,
"step": 563,
"tokens/total": 2306048,
"tokens/train_per_sec_per_gpu": 19.83,
"tokens/trainable": 164966
},
{
"epoch": 2.685714285714286,
"grad_norm": 0.5173723101615906,
"learning_rate": 4.660287081339714e-06,
"loss": 0.05308505892753601,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05452,
"step": 564,
"tokens/total": 2310144,
"tokens/train_per_sec_per_gpu": 11.21,
"tokens/trainable": 165258
},
{
"epoch": 2.6904761904761907,
"grad_norm": 0.70432448387146,
"learning_rate": 4.650717703349283e-06,
"loss": 0.10319502651691437,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10871,
"step": 565,
"tokens/total": 2314240,
"tokens/train_per_sec_per_gpu": 17.41,
"tokens/trainable": 165578
},
{
"epoch": 2.6952380952380954,
"grad_norm": 1.015570878982544,
"learning_rate": 4.641148325358852e-06,
"loss": 0.15254569053649902,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1648,
"step": 566,
"tokens/total": 2318336,
"tokens/train_per_sec_per_gpu": 13.67,
"tokens/trainable": 165848
},
{
"epoch": 2.7,
"grad_norm": 0.7950270175933838,
"learning_rate": 4.631578947368421e-06,
"loss": 0.10250667482614517,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10794,
"step": 567,
"tokens/total": 2322432,
"tokens/train_per_sec_per_gpu": 11.14,
"tokens/trainable": 166144
},
{
"epoch": 2.704761904761905,
"grad_norm": 1.0225125551223755,
"learning_rate": 4.622009569377991e-06,
"loss": 0.0614117756485939,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06334,
"step": 568,
"tokens/total": 2326528,
"tokens/train_per_sec_per_gpu": 13.63,
"tokens/trainable": 166421
},
{
"epoch": 2.7095238095238097,
"grad_norm": 0.693941593170166,
"learning_rate": 4.61244019138756e-06,
"loss": 0.0860099121928215,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08982,
"step": 569,
"tokens/total": 2330624,
"tokens/train_per_sec_per_gpu": 12.06,
"tokens/trainable": 166693
},
{
"epoch": 2.7142857142857144,
"grad_norm": 1.0889708995819092,
"learning_rate": 4.602870813397129e-06,
"loss": 0.09744396805763245,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10235,
"step": 570,
"tokens/total": 2334720,
"tokens/train_per_sec_per_gpu": 9.0,
"tokens/trainable": 167017
},
{
"epoch": 2.719047619047619,
"grad_norm": 0.6773040294647217,
"learning_rate": 4.593301435406699e-06,
"loss": 0.07057362049818039,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07312,
"step": 571,
"tokens/total": 2338816,
"tokens/train_per_sec_per_gpu": 11.76,
"tokens/trainable": 167316
},
{
"epoch": 2.723809523809524,
"grad_norm": 0.5719726085662842,
"learning_rate": 4.583732057416269e-06,
"loss": 0.10331287980079651,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10884,
"step": 572,
"tokens/total": 2342912,
"tokens/train_per_sec_per_gpu": 20.31,
"tokens/trainable": 167705
},
{
"epoch": 2.7285714285714286,
"grad_norm": 0.8189126253128052,
"learning_rate": 4.574162679425837e-06,
"loss": 0.0910937637090683,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09537,
"step": 573,
"tokens/total": 2347008,
"tokens/train_per_sec_per_gpu": 12.8,
"tokens/trainable": 167965
},
{
"epoch": 2.7333333333333334,
"grad_norm": 0.9918308854103088,
"learning_rate": 4.564593301435407e-06,
"loss": 0.09861594438552856,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10364,
"step": 574,
"tokens/total": 2351104,
"tokens/train_per_sec_per_gpu": 10.17,
"tokens/trainable": 168213
},
{
"epoch": 2.738095238095238,
"grad_norm": 0.5878109931945801,
"learning_rate": 4.555023923444977e-06,
"loss": 0.07064704596996307,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0732,
"step": 575,
"tokens/total": 2355200,
"tokens/train_per_sec_per_gpu": 12.66,
"tokens/trainable": 168475
},
{
"epoch": 2.742857142857143,
"grad_norm": 0.5074825882911682,
"learning_rate": 4.5454545454545455e-06,
"loss": 0.026333343237638474,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02668,
"step": 576,
"tokens/total": 2359296,
"tokens/train_per_sec_per_gpu": 10.61,
"tokens/trainable": 168718
},
{
"epoch": 2.7476190476190476,
"grad_norm": 0.9708786606788635,
"learning_rate": 4.535885167464115e-06,
"loss": 0.126325786113739,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13465,
"step": 577,
"tokens/total": 2363392,
"tokens/train_per_sec_per_gpu": 21.11,
"tokens/trainable": 169106
},
{
"epoch": 2.7523809523809524,
"grad_norm": 0.6538110375404358,
"learning_rate": 4.526315789473685e-06,
"loss": 0.07794515043497086,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08106,
"step": 578,
"tokens/total": 2367488,
"tokens/train_per_sec_per_gpu": 11.35,
"tokens/trainable": 169363
},
{
"epoch": 2.757142857142857,
"grad_norm": 0.5316607356071472,
"learning_rate": 4.516746411483254e-06,
"loss": 0.039749983698129654,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04055,
"step": 579,
"tokens/total": 2371584,
"tokens/train_per_sec_per_gpu": 15.3,
"tokens/trainable": 169673
},
{
"epoch": 2.761904761904762,
"grad_norm": 0.8430630564689636,
"learning_rate": 4.507177033492823e-06,
"loss": 0.11248931288719177,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11906,
"step": 580,
"tokens/total": 2375680,
"tokens/train_per_sec_per_gpu": 17.75,
"tokens/trainable": 170058
},
{
"epoch": 2.7666666666666666,
"grad_norm": 0.6618925333023071,
"learning_rate": 4.4976076555023925e-06,
"loss": 0.10998591780662537,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11626,
"step": 581,
"tokens/total": 2379776,
"tokens/train_per_sec_per_gpu": 10.85,
"tokens/trainable": 170370
},
{
"epoch": 2.7714285714285714,
"grad_norm": 1.112197995185852,
"learning_rate": 4.488038277511962e-06,
"loss": 0.17260217666625977,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.18839,
"step": 582,
"tokens/total": 2383872,
"tokens/train_per_sec_per_gpu": 15.45,
"tokens/trainable": 170672
},
{
"epoch": 2.776190476190476,
"grad_norm": 0.9261051416397095,
"learning_rate": 4.478468899521531e-06,
"loss": 0.06308593600988388,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06512,
"step": 583,
"tokens/total": 2387968,
"tokens/train_per_sec_per_gpu": 9.88,
"tokens/trainable": 170922
},
{
"epoch": 2.780952380952381,
"grad_norm": 0.8806402683258057,
"learning_rate": 4.468899521531101e-06,
"loss": 0.10380478203296661,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10938,
"step": 584,
"tokens/total": 2392064,
"tokens/train_per_sec_per_gpu": 14.02,
"tokens/trainable": 171222
},
{
"epoch": 2.7857142857142856,
"grad_norm": 0.4549677073955536,
"learning_rate": 4.45933014354067e-06,
"loss": 0.031093571335077286,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03158,
"step": 585,
"tokens/total": 2396160,
"tokens/train_per_sec_per_gpu": 16.84,
"tokens/trainable": 171563
},
{
"epoch": 2.7904761904761903,
"grad_norm": 1.1855583190917969,
"learning_rate": 4.449760765550239e-06,
"loss": 0.09628066420555115,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10107,
"step": 586,
"tokens/total": 2400256,
"tokens/train_per_sec_per_gpu": 14.16,
"tokens/trainable": 171843
},
{
"epoch": 2.795238095238095,
"grad_norm": 0.8998063206672668,
"learning_rate": 4.440191387559809e-06,
"loss": 0.100868821144104,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10613,
"step": 587,
"tokens/total": 2404352,
"tokens/train_per_sec_per_gpu": 8.07,
"tokens/trainable": 172142
},
{
"epoch": 2.8,
"grad_norm": 0.5062983632087708,
"learning_rate": 4.430622009569378e-06,
"loss": 0.05945008993148804,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06125,
"step": 588,
"tokens/total": 2408448,
"tokens/train_per_sec_per_gpu": 12.06,
"tokens/trainable": 172464
},
{
"epoch": 2.8047619047619046,
"grad_norm": 0.6035679578781128,
"learning_rate": 4.4210526315789476e-06,
"loss": 0.0527825802564621,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0542,
"step": 589,
"tokens/total": 2412544,
"tokens/train_per_sec_per_gpu": 13.63,
"tokens/trainable": 172734
},
{
"epoch": 2.8095238095238093,
"grad_norm": 0.6835501790046692,
"learning_rate": 4.411483253588517e-06,
"loss": 0.06511889398097992,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06729,
"step": 590,
"tokens/total": 2416640,
"tokens/train_per_sec_per_gpu": 13.47,
"tokens/trainable": 172989
},
{
"epoch": 2.814285714285714,
"grad_norm": 0.8977090716362,
"learning_rate": 4.401913875598086e-06,
"loss": 0.07419802248477936,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07702,
"step": 591,
"tokens/total": 2420736,
"tokens/train_per_sec_per_gpu": 8.11,
"tokens/trainable": 173233
},
{
"epoch": 2.819047619047619,
"grad_norm": 0.522295355796814,
"learning_rate": 4.392344497607656e-06,
"loss": 0.05964972823858261,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06146,
"step": 592,
"tokens/total": 2424832,
"tokens/train_per_sec_per_gpu": 11.41,
"tokens/trainable": 173511
},
{
"epoch": 2.8238095238095235,
"grad_norm": 0.8135259747505188,
"learning_rate": 4.382775119617225e-06,
"loss": 0.0776074081659317,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0807,
"step": 593,
"tokens/total": 2428928,
"tokens/train_per_sec_per_gpu": 9.37,
"tokens/trainable": 173915
},
{
"epoch": 2.8285714285714287,
"grad_norm": 0.773694634437561,
"learning_rate": 4.3732057416267945e-06,
"loss": 0.09940958023071289,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10452,
"step": 594,
"tokens/total": 2433024,
"tokens/train_per_sec_per_gpu": 15.03,
"tokens/trainable": 174184
},
{
"epoch": 2.8333333333333335,
"grad_norm": 0.8801134824752808,
"learning_rate": 4.363636363636364e-06,
"loss": 0.1124865710735321,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11906,
"step": 595,
"tokens/total": 2437120,
"tokens/train_per_sec_per_gpu": 16.28,
"tokens/trainable": 174522
},
{
"epoch": 2.8380952380952382,
"grad_norm": 0.48666656017303467,
"learning_rate": 4.354066985645933e-06,
"loss": 0.03523673117160797,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.03586,
"step": 596,
"tokens/total": 2441216,
"tokens/train_per_sec_per_gpu": 14.43,
"tokens/trainable": 174842
},
{
"epoch": 2.842857142857143,
"grad_norm": 0.5700379014015198,
"learning_rate": 4.344497607655503e-06,
"loss": 0.059006646275520325,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06078,
"step": 597,
"tokens/total": 2445312,
"tokens/train_per_sec_per_gpu": 19.05,
"tokens/trainable": 175180
},
{
"epoch": 2.8476190476190477,
"grad_norm": 0.7380210757255554,
"learning_rate": 4.334928229665072e-06,
"loss": 0.12105896323919296,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12869,
"step": 598,
"tokens/total": 2449408,
"tokens/train_per_sec_per_gpu": 16.09,
"tokens/trainable": 175549
},
{
"epoch": 2.8523809523809525,
"grad_norm": 0.7186801433563232,
"learning_rate": 4.3253588516746415e-06,
"loss": 0.05410782992839813,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0556,
"step": 599,
"tokens/total": 2453504,
"tokens/train_per_sec_per_gpu": 8.99,
"tokens/trainable": 175821
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.8128309845924377,
"learning_rate": 4.315789473684211e-06,
"loss": 0.062483049929142,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06448,
"step": 600,
"tokens/total": 2457600,
"tokens/train_per_sec_per_gpu": 15.0,
"tokens/trainable": 176090
},
{
"epoch": 2.861904761904762,
"grad_norm": 0.6894558072090149,
"learning_rate": 4.30622009569378e-06,
"loss": 0.060672447085380554,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06255,
"step": 601,
"tokens/total": 2461696,
"tokens/train_per_sec_per_gpu": 17.7,
"tokens/trainable": 176399
},
{
"epoch": 2.8666666666666667,
"grad_norm": 0.54118812084198,
"learning_rate": 4.29665071770335e-06,
"loss": 0.050571709871292114,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05187,
"step": 602,
"tokens/total": 2465792,
"tokens/train_per_sec_per_gpu": 12.01,
"tokens/trainable": 176665
},
{
"epoch": 2.8714285714285714,
"grad_norm": 0.7929149866104126,
"learning_rate": 4.287081339712919e-06,
"loss": 0.0880894660949707,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09209,
"step": 603,
"tokens/total": 2469888,
"tokens/train_per_sec_per_gpu": 15.68,
"tokens/trainable": 176985
},
{
"epoch": 2.876190476190476,
"grad_norm": 0.7643014192581177,
"learning_rate": 4.277511961722488e-06,
"loss": 0.06582175940275192,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06804,
"step": 604,
"tokens/total": 2473984,
"tokens/train_per_sec_per_gpu": 15.27,
"tokens/trainable": 177325
},
{
"epoch": 2.880952380952381,
"grad_norm": 0.5427528023719788,
"learning_rate": 4.267942583732058e-06,
"loss": 0.06989608705043793,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0724,
"step": 605,
"tokens/total": 2478080,
"tokens/train_per_sec_per_gpu": 16.05,
"tokens/trainable": 177646
},
{
"epoch": 2.8857142857142857,
"grad_norm": 0.698477566242218,
"learning_rate": 4.258373205741627e-06,
"loss": 0.08636561036109924,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0902,
"step": 606,
"tokens/total": 2482176,
"tokens/train_per_sec_per_gpu": 11.15,
"tokens/trainable": 177970
},
{
"epoch": 2.8904761904761904,
"grad_norm": 1.405834674835205,
"learning_rate": 4.2488038277511966e-06,
"loss": 0.09993740916252136,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1051,
"step": 607,
"tokens/total": 2486272,
"tokens/train_per_sec_per_gpu": 13.81,
"tokens/trainable": 178230
},
{
"epoch": 2.895238095238095,
"grad_norm": 1.0274302959442139,
"learning_rate": 4.239234449760766e-06,
"loss": 0.10263222455978394,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10808,
"step": 608,
"tokens/total": 2490368,
"tokens/train_per_sec_per_gpu": 13.62,
"tokens/trainable": 178484
},
{
"epoch": 2.9,
"grad_norm": 1.4119830131530762,
"learning_rate": 4.229665071770335e-06,
"loss": 0.11618393659591675,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1232,
"step": 609,
"tokens/total": 2494464,
"tokens/train_per_sec_per_gpu": 11.03,
"tokens/trainable": 178759
},
{
"epoch": 2.9047619047619047,
"grad_norm": 0.9467605352401733,
"learning_rate": 4.220095693779905e-06,
"loss": 0.08310011774301529,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08665,
"step": 610,
"tokens/total": 2498560,
"tokens/train_per_sec_per_gpu": 12.83,
"tokens/trainable": 179007
},
{
"epoch": 2.9095238095238094,
"grad_norm": 0.8503310680389404,
"learning_rate": 4.210526315789474e-06,
"loss": 0.14148107171058655,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15198,
"step": 611,
"tokens/total": 2502656,
"tokens/train_per_sec_per_gpu": 14.39,
"tokens/trainable": 179326
},
{
"epoch": 2.914285714285714,
"grad_norm": 0.789787232875824,
"learning_rate": 4.2009569377990435e-06,
"loss": 0.04962185025215149,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05087,
"step": 612,
"tokens/total": 2506752,
"tokens/train_per_sec_per_gpu": 12.14,
"tokens/trainable": 179559
},
{
"epoch": 2.919047619047619,
"grad_norm": 0.39260679483413696,
"learning_rate": 4.191387559808613e-06,
"loss": 0.031790271401405334,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0323,
"step": 613,
"tokens/total": 2510848,
"tokens/train_per_sec_per_gpu": 18.35,
"tokens/trainable": 179872
},
{
"epoch": 2.923809523809524,
"grad_norm": 0.9382997155189514,
"learning_rate": 4.181818181818182e-06,
"loss": 0.12968839704990387,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13847,
"step": 614,
"tokens/total": 2514944,
"tokens/train_per_sec_per_gpu": 15.59,
"tokens/trainable": 180147
},
{
"epoch": 2.928571428571429,
"grad_norm": 8.853306770324707,
"learning_rate": 4.172248803827752e-06,
"loss": 0.10713415592908859,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11308,
"step": 615,
"tokens/total": 2519040,
"tokens/train_per_sec_per_gpu": 11.89,
"tokens/trainable": 180419
},
{
"epoch": 2.9333333333333336,
"grad_norm": 0.6513184309005737,
"learning_rate": 4.162679425837321e-06,
"loss": 0.07565292716026306,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07859,
"step": 616,
"tokens/total": 2523136,
"tokens/train_per_sec_per_gpu": 17.6,
"tokens/trainable": 180756
},
{
"epoch": 2.9380952380952383,
"grad_norm": 0.6604302525520325,
"learning_rate": 4.1531100478468904e-06,
"loss": 0.04975314065814018,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05101,
"step": 617,
"tokens/total": 2527232,
"tokens/train_per_sec_per_gpu": 13.61,
"tokens/trainable": 181020
},
{
"epoch": 2.942857142857143,
"grad_norm": 0.7588087320327759,
"learning_rate": 4.14354066985646e-06,
"loss": 0.06836371123790741,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07075,
"step": 618,
"tokens/total": 2531328,
"tokens/train_per_sec_per_gpu": 10.98,
"tokens/trainable": 181242
},
{
"epoch": 2.947619047619048,
"grad_norm": 0.6721870303153992,
"learning_rate": 4.133971291866029e-06,
"loss": 0.10186492651700974,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.10723,
"step": 619,
"tokens/total": 2535424,
"tokens/train_per_sec_per_gpu": 17.53,
"tokens/trainable": 181528
},
{
"epoch": 2.9523809523809526,
"grad_norm": 0.674967348575592,
"learning_rate": 4.124401913875599e-06,
"loss": 0.05646386370062828,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05809,
"step": 620,
"tokens/total": 2539520,
"tokens/train_per_sec_per_gpu": 10.12,
"tokens/trainable": 181783
},
{
"epoch": 2.9571428571428573,
"grad_norm": 1.0123529434204102,
"learning_rate": 4.114832535885168e-06,
"loss": 0.085752934217453,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08954,
"step": 621,
"tokens/total": 2543616,
"tokens/train_per_sec_per_gpu": 12.18,
"tokens/trainable": 182014
},
{
"epoch": 2.961904761904762,
"grad_norm": 0.9926598072052002,
"learning_rate": 4.105263157894737e-06,
"loss": 0.1454455703496933,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.15655,
"step": 622,
"tokens/total": 2547712,
"tokens/train_per_sec_per_gpu": 9.38,
"tokens/trainable": 182234
},
{
"epoch": 2.966666666666667,
"grad_norm": 0.7257160544395447,
"learning_rate": 4.095693779904307e-06,
"loss": 0.09883573651313782,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.10388,
"step": 623,
"tokens/total": 2551808,
"tokens/train_per_sec_per_gpu": 24.54,
"tokens/trainable": 182626
},
{
"epoch": 2.9714285714285715,
"grad_norm": 1.0070229768753052,
"learning_rate": 4.086124401913875e-06,
"loss": 0.07697214186191559,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08001,
"step": 624,
"tokens/total": 2555904,
"tokens/train_per_sec_per_gpu": 14.22,
"tokens/trainable": 182916
},
{
"epoch": 2.9761904761904763,
"grad_norm": 0.6566667556762695,
"learning_rate": 4.0765550239234456e-06,
"loss": 0.07002940773963928,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07254,
"step": 625,
"tokens/total": 2560000,
"tokens/train_per_sec_per_gpu": 10.01,
"tokens/trainable": 183194
},
{
"epoch": 2.980952380952381,
"grad_norm": 0.9295153021812439,
"learning_rate": 4.066985645933015e-06,
"loss": 0.10709331929683685,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11304,
"step": 626,
"tokens/total": 2564096,
"tokens/train_per_sec_per_gpu": 17.2,
"tokens/trainable": 183592
},
{
"epoch": 2.9857142857142858,
"grad_norm": 0.5641553401947021,
"learning_rate": 4.0574162679425835e-06,
"loss": 0.06261751800775528,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06462,
"step": 627,
"tokens/total": 2568192,
"tokens/train_per_sec_per_gpu": 18.24,
"tokens/trainable": 183885
},
{
"epoch": 2.9904761904761905,
"grad_norm": 0.3403347134590149,
"learning_rate": 4.047846889952154e-06,
"loss": 0.04572930932044983,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04679,
"step": 628,
"tokens/total": 2572288,
"tokens/train_per_sec_per_gpu": 20.39,
"tokens/trainable": 184308
},
{
"epoch": 2.9952380952380953,
"grad_norm": 0.5752260088920593,
"learning_rate": 4.038277511961723e-06,
"loss": 0.052835218608379364,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05426,
"step": 629,
"tokens/total": 2576384,
"tokens/train_per_sec_per_gpu": 17.39,
"tokens/trainable": 184586
},
{
"epoch": 3.0,
"grad_norm": 0.7610874176025391,
"learning_rate": 4.0287081339712925e-06,
"loss": 0.06551462411880493,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06771,
"step": 630,
"tokens/total": 2580480,
"tokens/train_per_sec_per_gpu": 14.51,
"tokens/trainable": 184865
},
{
"epoch": 3.0,
"eval_loss": 0.083167664706707,
"eval_ppl": 1.08672,
"eval_runtime": 10.3423,
"eval_samples_per_second": 8.605,
"eval_steps_per_second": 2.224,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 35.58,
"memory/max_allocated (GiB)": 35.58,
"step": 630
},
{
"epoch": 3.0047619047619047,
"grad_norm": 1.1097360849380493,
"learning_rate": 4.019138755980861e-06,
"loss": 0.027190648019313812,
"memory/device_reserved (GiB)": 39.15,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02756,
"step": 631,
"tokens/total": 2584576,
"tokens/train_per_sec_per_gpu": 9.62,
"tokens/trainable": 185139
},
{
"epoch": 3.0095238095238095,
"grad_norm": 0.8078517317771912,
"learning_rate": 4.009569377990431e-06,
"loss": 0.0643414855003357,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06646,
"step": 632,
"tokens/total": 2588672,
"tokens/train_per_sec_per_gpu": 8.58,
"tokens/trainable": 185352
},
{
"epoch": 3.0142857142857142,
"grad_norm": 0.9028353095054626,
"learning_rate": 4.000000000000001e-06,
"loss": 0.07669511437416077,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07971,
"step": 633,
"tokens/total": 2592768,
"tokens/train_per_sec_per_gpu": 11.52,
"tokens/trainable": 185600
},
{
"epoch": 3.019047619047619,
"grad_norm": 0.9765618443489075,
"learning_rate": 3.990430622009569e-06,
"loss": 0.10810641199350357,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11417,
"step": 634,
"tokens/total": 2596864,
"tokens/train_per_sec_per_gpu": 13.33,
"tokens/trainable": 185961
},
{
"epoch": 3.0238095238095237,
"grad_norm": 0.4859309196472168,
"learning_rate": 3.9808612440191394e-06,
"loss": 0.031761132180690765,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03227,
"step": 635,
"tokens/total": 2600960,
"tokens/train_per_sec_per_gpu": 9.99,
"tokens/trainable": 186204
},
{
"epoch": 3.0285714285714285,
"grad_norm": 0.9322464466094971,
"learning_rate": 3.971291866028709e-06,
"loss": 0.06739023327827454,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06971,
"step": 636,
"tokens/total": 2605056,
"tokens/train_per_sec_per_gpu": 8.54,
"tokens/trainable": 186439
},
{
"epoch": 3.033333333333333,
"grad_norm": 0.6128789782524109,
"learning_rate": 3.961722488038277e-06,
"loss": 0.053875766694545746,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.05535,
"step": 637,
"tokens/total": 2609152,
"tokens/train_per_sec_per_gpu": 14.72,
"tokens/trainable": 186699
},
{
"epoch": 3.038095238095238,
"grad_norm": 0.4706403315067291,
"learning_rate": 3.952153110047848e-06,
"loss": 0.04248778894543648,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0434,
"step": 638,
"tokens/total": 2613248,
"tokens/train_per_sec_per_gpu": 10.07,
"tokens/trainable": 186927
},
{
"epoch": 3.0428571428571427,
"grad_norm": 0.4942407011985779,
"learning_rate": 3.942583732057417e-06,
"loss": 0.07395349442958832,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07676,
"step": 639,
"tokens/total": 2617344,
"tokens/train_per_sec_per_gpu": 11.42,
"tokens/trainable": 187212
},
{
"epoch": 3.0476190476190474,
"grad_norm": 1.0005759000778198,
"learning_rate": 3.9330143540669855e-06,
"loss": 0.07736619561910629,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08044,
"step": 640,
"tokens/total": 2621440,
"tokens/train_per_sec_per_gpu": 13.24,
"tokens/trainable": 187591
},
{
"epoch": 3.052380952380952,
"grad_norm": 0.6871622204780579,
"learning_rate": 3.923444976076555e-06,
"loss": 0.08220869302749634,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08568,
"step": 641,
"tokens/total": 2625536,
"tokens/train_per_sec_per_gpu": 15.39,
"tokens/trainable": 187971
},
{
"epoch": 3.057142857142857,
"grad_norm": 0.9228248000144958,
"learning_rate": 3.913875598086125e-06,
"loss": 0.08459930121898651,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08828,
"step": 642,
"tokens/total": 2629632,
"tokens/train_per_sec_per_gpu": 11.29,
"tokens/trainable": 188217
},
{
"epoch": 3.0619047619047617,
"grad_norm": 0.6304330229759216,
"learning_rate": 3.904306220095694e-06,
"loss": 0.1100236177444458,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1163,
"step": 643,
"tokens/total": 2633728,
"tokens/train_per_sec_per_gpu": 21.66,
"tokens/trainable": 188584
},
{
"epoch": 3.066666666666667,
"grad_norm": 0.6323570013046265,
"learning_rate": 3.894736842105263e-06,
"loss": 0.05556914210319519,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05714,
"step": 644,
"tokens/total": 2637824,
"tokens/train_per_sec_per_gpu": 9.29,
"tokens/trainable": 188832
},
{
"epoch": 3.0714285714285716,
"grad_norm": 0.9141075015068054,
"learning_rate": 3.885167464114833e-06,
"loss": 0.10358056426048279,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10914,
"step": 645,
"tokens/total": 2641920,
"tokens/train_per_sec_per_gpu": 14.01,
"tokens/trainable": 189081
},
{
"epoch": 3.0761904761904764,
"grad_norm": 0.7243455052375793,
"learning_rate": 3.875598086124403e-06,
"loss": 0.06565085053443909,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06785,
"step": 646,
"tokens/total": 2646016,
"tokens/train_per_sec_per_gpu": 17.37,
"tokens/trainable": 189420
},
{
"epoch": 3.080952380952381,
"grad_norm": 0.6836820840835571,
"learning_rate": 3.866028708133971e-06,
"loss": 0.045150648802518845,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04619,
"step": 647,
"tokens/total": 2650112,
"tokens/train_per_sec_per_gpu": 9.75,
"tokens/trainable": 189742
},
{
"epoch": 3.085714285714286,
"grad_norm": 0.6994568109512329,
"learning_rate": 3.856459330143541e-06,
"loss": 0.0705096647143364,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07305,
"step": 648,
"tokens/total": 2654208,
"tokens/train_per_sec_per_gpu": 17.95,
"tokens/trainable": 190070
},
{
"epoch": 3.0904761904761906,
"grad_norm": 0.7164385914802551,
"learning_rate": 3.846889952153111e-06,
"loss": 0.06414791941642761,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06625,
"step": 649,
"tokens/total": 2658304,
"tokens/train_per_sec_per_gpu": 9.85,
"tokens/trainable": 190354
},
{
"epoch": 3.0952380952380953,
"grad_norm": 0.5413431525230408,
"learning_rate": 3.8373205741626794e-06,
"loss": 0.07239377498626709,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07508,
"step": 650,
"tokens/total": 2662400,
"tokens/train_per_sec_per_gpu": 20.42,
"tokens/trainable": 190728
},
{
"epoch": 3.1,
"grad_norm": 0.702539324760437,
"learning_rate": 3.827751196172249e-06,
"loss": 0.08402359485626221,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08765,
"step": 651,
"tokens/total": 2666496,
"tokens/train_per_sec_per_gpu": 13.93,
"tokens/trainable": 190997
},
{
"epoch": 3.104761904761905,
"grad_norm": 0.6277540326118469,
"learning_rate": 3.818181818181819e-06,
"loss": 0.0585082545876503,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06025,
"step": 652,
"tokens/total": 2670592,
"tokens/train_per_sec_per_gpu": 8.95,
"tokens/trainable": 191308
},
{
"epoch": 3.1095238095238096,
"grad_norm": 0.6413969397544861,
"learning_rate": 3.8086124401913876e-06,
"loss": 0.07055683434009552,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07311,
"step": 653,
"tokens/total": 2674688,
"tokens/train_per_sec_per_gpu": 13.89,
"tokens/trainable": 191563
},
{
"epoch": 3.1142857142857143,
"grad_norm": 0.29829949140548706,
"learning_rate": 3.7990430622009574e-06,
"loss": 0.02009260281920433,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0203,
"step": 654,
"tokens/total": 2678784,
"tokens/train_per_sec_per_gpu": 11.66,
"tokens/trainable": 191868
},
{
"epoch": 3.119047619047619,
"grad_norm": 0.8772543668746948,
"learning_rate": 3.789473684210527e-06,
"loss": 0.10029996931552887,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1055,
"step": 655,
"tokens/total": 2682880,
"tokens/train_per_sec_per_gpu": 13.11,
"tokens/trainable": 192150
},
{
"epoch": 3.123809523809524,
"grad_norm": 0.6865347027778625,
"learning_rate": 3.7799043062200958e-06,
"loss": 0.06961806863546371,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0721,
"step": 656,
"tokens/total": 2686976,
"tokens/train_per_sec_per_gpu": 19.12,
"tokens/trainable": 192485
},
{
"epoch": 3.1285714285714286,
"grad_norm": 0.6526204943656921,
"learning_rate": 3.770334928229665e-06,
"loss": 0.07430330663919449,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07713,
"step": 657,
"tokens/total": 2691072,
"tokens/train_per_sec_per_gpu": 10.48,
"tokens/trainable": 192713
},
{
"epoch": 3.1333333333333333,
"grad_norm": 1.0195298194885254,
"learning_rate": 3.760765550239235e-06,
"loss": 0.06909658014774323,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07154,
"step": 658,
"tokens/total": 2695168,
"tokens/train_per_sec_per_gpu": 9.38,
"tokens/trainable": 192928
},
{
"epoch": 3.138095238095238,
"grad_norm": 0.8037240505218506,
"learning_rate": 3.7511961722488043e-06,
"loss": 0.13666372001171112,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14644,
"step": 659,
"tokens/total": 2699264,
"tokens/train_per_sec_per_gpu": 17.36,
"tokens/trainable": 193333
},
{
"epoch": 3.142857142857143,
"grad_norm": 0.8780602216720581,
"learning_rate": 3.7416267942583733e-06,
"loss": 0.08582095801830292,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08961,
"step": 660,
"tokens/total": 2703360,
"tokens/train_per_sec_per_gpu": 12.44,
"tokens/trainable": 193584
},
{
"epoch": 3.1476190476190475,
"grad_norm": 1.0211085081100464,
"learning_rate": 3.732057416267943e-06,
"loss": 0.07044003903865814,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07298,
"step": 661,
"tokens/total": 2707456,
"tokens/train_per_sec_per_gpu": 10.54,
"tokens/trainable": 193797
},
{
"epoch": 3.1523809523809523,
"grad_norm": 0.662294328212738,
"learning_rate": 3.7224880382775125e-06,
"loss": 0.05967669188976288,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06149,
"step": 662,
"tokens/total": 2711552,
"tokens/train_per_sec_per_gpu": 10.95,
"tokens/trainable": 194075
},
{
"epoch": 3.157142857142857,
"grad_norm": 1.0162534713745117,
"learning_rate": 3.7129186602870815e-06,
"loss": 0.12779566645622253,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13632,
"step": 663,
"tokens/total": 2715648,
"tokens/train_per_sec_per_gpu": 15.44,
"tokens/trainable": 194415
},
{
"epoch": 3.1619047619047618,
"grad_norm": 1.1409763097763062,
"learning_rate": 3.703349282296651e-06,
"loss": 0.1108705997467041,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11725,
"step": 664,
"tokens/total": 2719744,
"tokens/train_per_sec_per_gpu": 12.88,
"tokens/trainable": 194736
},
{
"epoch": 3.1666666666666665,
"grad_norm": 0.47355273365974426,
"learning_rate": 3.6937799043062207e-06,
"loss": 0.041094761341810226,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04195,
"step": 665,
"tokens/total": 2723840,
"tokens/train_per_sec_per_gpu": 13.33,
"tokens/trainable": 194990
},
{
"epoch": 3.1714285714285713,
"grad_norm": 0.9870181083679199,
"learning_rate": 3.6842105263157896e-06,
"loss": 0.09811937063932419,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10309,
"step": 666,
"tokens/total": 2727936,
"tokens/train_per_sec_per_gpu": 14.63,
"tokens/trainable": 195264
},
{
"epoch": 3.176190476190476,
"grad_norm": 0.541223406791687,
"learning_rate": 3.674641148325359e-06,
"loss": 0.022513944655656815,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02277,
"step": 667,
"tokens/total": 2732032,
"tokens/train_per_sec_per_gpu": 8.97,
"tokens/trainable": 195481
},
{
"epoch": 3.1809523809523808,
"grad_norm": 0.7369751334190369,
"learning_rate": 3.665071770334929e-06,
"loss": 0.04886762052774429,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05008,
"step": 668,
"tokens/total": 2736128,
"tokens/train_per_sec_per_gpu": 10.45,
"tokens/trainable": 195703
},
{
"epoch": 3.185714285714286,
"grad_norm": 0.8254791498184204,
"learning_rate": 3.655502392344498e-06,
"loss": 0.06476770341396332,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06691,
"step": 669,
"tokens/total": 2740224,
"tokens/train_per_sec_per_gpu": 14.07,
"tokens/trainable": 195954
},
{
"epoch": 3.1904761904761907,
"grad_norm": 0.8415271043777466,
"learning_rate": 3.645933014354067e-06,
"loss": 0.09028398990631104,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09449,
"step": 670,
"tokens/total": 2744320,
"tokens/train_per_sec_per_gpu": 13.24,
"tokens/trainable": 196251
},
{
"epoch": 3.1952380952380954,
"grad_norm": 0.5479375123977661,
"learning_rate": 3.6363636363636366e-06,
"loss": 0.027023475617170334,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02739,
"step": 671,
"tokens/total": 2748416,
"tokens/train_per_sec_per_gpu": 11.25,
"tokens/trainable": 196540
},
{
"epoch": 3.2,
"grad_norm": 0.5744169354438782,
"learning_rate": 3.6267942583732064e-06,
"loss": 0.04903862625360489,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05026,
"step": 672,
"tokens/total": 2752512,
"tokens/train_per_sec_per_gpu": 13.45,
"tokens/trainable": 196903
},
{
"epoch": 3.204761904761905,
"grad_norm": 1.511560082435608,
"learning_rate": 3.6172248803827754e-06,
"loss": 0.0802629217505455,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08357,
"step": 673,
"tokens/total": 2756608,
"tokens/train_per_sec_per_gpu": 9.91,
"tokens/trainable": 197165
},
{
"epoch": 3.2095238095238097,
"grad_norm": 0.4563305974006653,
"learning_rate": 3.6076555023923447e-06,
"loss": 0.041035354137420654,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04189,
"step": 674,
"tokens/total": 2760704,
"tokens/train_per_sec_per_gpu": 11.78,
"tokens/trainable": 197468
},
{
"epoch": 3.2142857142857144,
"grad_norm": 0.5280977487564087,
"learning_rate": 3.5980861244019146e-06,
"loss": 0.06585241109132767,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.06807,
"step": 675,
"tokens/total": 2764800,
"tokens/train_per_sec_per_gpu": 17.67,
"tokens/trainable": 197805
},
{
"epoch": 3.219047619047619,
"grad_norm": 0.7410734295845032,
"learning_rate": 3.5885167464114835e-06,
"loss": 0.06726351380348206,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06958,
"step": 676,
"tokens/total": 2768896,
"tokens/train_per_sec_per_gpu": 16.25,
"tokens/trainable": 198106
},
{
"epoch": 3.223809523809524,
"grad_norm": 0.5525427460670471,
"learning_rate": 3.578947368421053e-06,
"loss": 0.06145021691918373,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06338,
"step": 677,
"tokens/total": 2772992,
"tokens/train_per_sec_per_gpu": 12.63,
"tokens/trainable": 198359
},
{
"epoch": 3.2285714285714286,
"grad_norm": 0.5915558934211731,
"learning_rate": 3.5693779904306223e-06,
"loss": 0.0412653312087059,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.04213,
"step": 678,
"tokens/total": 2777088,
"tokens/train_per_sec_per_gpu": 13.21,
"tokens/trainable": 198670
},
{
"epoch": 3.2333333333333334,
"grad_norm": 0.5353713631629944,
"learning_rate": 3.5598086124401917e-06,
"loss": 0.07545843720436096,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07838,
"step": 679,
"tokens/total": 2781184,
"tokens/train_per_sec_per_gpu": 17.55,
"tokens/trainable": 199027
},
{
"epoch": 3.238095238095238,
"grad_norm": 0.7455602288246155,
"learning_rate": 3.550239234449761e-06,
"loss": 0.08536748588085175,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08912,
"step": 680,
"tokens/total": 2785280,
"tokens/train_per_sec_per_gpu": 14.58,
"tokens/trainable": 199292
},
{
"epoch": 3.242857142857143,
"grad_norm": 0.4214642345905304,
"learning_rate": 3.5406698564593305e-06,
"loss": 0.028588632121682167,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.029,
"step": 681,
"tokens/total": 2789376,
"tokens/train_per_sec_per_gpu": 10.7,
"tokens/trainable": 199570
},
{
"epoch": 3.2476190476190476,
"grad_norm": 1.102713704109192,
"learning_rate": 3.5311004784688994e-06,
"loss": 0.07013420760631561,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07265,
"step": 682,
"tokens/total": 2793472,
"tokens/train_per_sec_per_gpu": 13.58,
"tokens/trainable": 199877
},
{
"epoch": 3.2523809523809524,
"grad_norm": 0.9483047127723694,
"learning_rate": 3.5215311004784692e-06,
"loss": 0.08880291879177094,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09287,
"step": 683,
"tokens/total": 2797568,
"tokens/train_per_sec_per_gpu": 10.23,
"tokens/trainable": 200135
},
{
"epoch": 3.257142857142857,
"grad_norm": 0.7713571786880493,
"learning_rate": 3.5119617224880386e-06,
"loss": 0.06746732443571091,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0698,
"step": 684,
"tokens/total": 2801664,
"tokens/train_per_sec_per_gpu": 16.56,
"tokens/trainable": 200409
},
{
"epoch": 3.261904761904762,
"grad_norm": 0.7084768414497375,
"learning_rate": 3.5023923444976076e-06,
"loss": 0.07177010923624039,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07441,
"step": 685,
"tokens/total": 2805760,
"tokens/train_per_sec_per_gpu": 19.25,
"tokens/trainable": 200809
},
{
"epoch": 3.2666666666666666,
"grad_norm": 1.0349971055984497,
"learning_rate": 3.4928229665071774e-06,
"loss": 0.08891840279102325,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09299,
"step": 686,
"tokens/total": 2809856,
"tokens/train_per_sec_per_gpu": 14.04,
"tokens/trainable": 201052
},
{
"epoch": 3.2714285714285714,
"grad_norm": 0.4372345209121704,
"learning_rate": 3.483253588516747e-06,
"loss": 0.03564683347940445,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.03629,
"step": 687,
"tokens/total": 2813952,
"tokens/train_per_sec_per_gpu": 16.3,
"tokens/trainable": 201346
},
{
"epoch": 3.276190476190476,
"grad_norm": 0.5511652231216431,
"learning_rate": 3.473684210526316e-06,
"loss": 0.06980352848768234,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0723,
"step": 688,
"tokens/total": 2818048,
"tokens/train_per_sec_per_gpu": 14.69,
"tokens/trainable": 201643
},
{
"epoch": 3.280952380952381,
"grad_norm": 0.4855141043663025,
"learning_rate": 3.464114832535885e-06,
"loss": 0.04140230640769005,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04227,
"step": 689,
"tokens/total": 2822144,
"tokens/train_per_sec_per_gpu": 12.93,
"tokens/trainable": 201928
},
{
"epoch": 3.2857142857142856,
"grad_norm": 0.625236451625824,
"learning_rate": 3.454545454545455e-06,
"loss": 0.03237142413854599,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0329,
"step": 690,
"tokens/total": 2826240,
"tokens/train_per_sec_per_gpu": 12.73,
"tokens/trainable": 202176
},
{
"epoch": 3.2904761904761903,
"grad_norm": 0.5515985488891602,
"learning_rate": 3.4449760765550244e-06,
"loss": 0.0465005561709404,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0476,
"step": 691,
"tokens/total": 2830336,
"tokens/train_per_sec_per_gpu": 17.29,
"tokens/trainable": 202480
},
{
"epoch": 3.295238095238095,
"grad_norm": 0.48744669556617737,
"learning_rate": 3.4354066985645933e-06,
"loss": 0.04794064164161682,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.04911,
"step": 692,
"tokens/total": 2834432,
"tokens/train_per_sec_per_gpu": 13.07,
"tokens/trainable": 202752
},
{
"epoch": 3.3,
"grad_norm": 0.7841635346412659,
"learning_rate": 3.425837320574163e-06,
"loss": 0.10598424822092056,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1118,
"step": 693,
"tokens/total": 2838528,
"tokens/train_per_sec_per_gpu": 24.09,
"tokens/trainable": 203158
},
{
"epoch": 3.3047619047619046,
"grad_norm": 0.8256274461746216,
"learning_rate": 3.4162679425837325e-06,
"loss": 0.07799224555492401,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08111,
"step": 694,
"tokens/total": 2842624,
"tokens/train_per_sec_per_gpu": 9.86,
"tokens/trainable": 203449
},
{
"epoch": 3.3095238095238093,
"grad_norm": 0.9331197738647461,
"learning_rate": 3.4066985645933015e-06,
"loss": 0.07394289970397949,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07675,
"step": 695,
"tokens/total": 2846720,
"tokens/train_per_sec_per_gpu": 10.05,
"tokens/trainable": 203706
},
{
"epoch": 3.314285714285714,
"grad_norm": 0.4485538601875305,
"learning_rate": 3.397129186602871e-06,
"loss": 0.04761147126555443,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04876,
"step": 696,
"tokens/total": 2850816,
"tokens/train_per_sec_per_gpu": 17.09,
"tokens/trainable": 204025
},
{
"epoch": 3.319047619047619,
"grad_norm": 1.1187976598739624,
"learning_rate": 3.3875598086124407e-06,
"loss": 0.05788331478834152,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05959,
"step": 697,
"tokens/total": 2854912,
"tokens/train_per_sec_per_gpu": 10.64,
"tokens/trainable": 204293
},
{
"epoch": 3.323809523809524,
"grad_norm": 0.3998170495033264,
"learning_rate": 3.3779904306220097e-06,
"loss": 0.026133496314287186,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.02648,
"step": 698,
"tokens/total": 2859008,
"tokens/train_per_sec_per_gpu": 10.62,
"tokens/trainable": 204557
},
{
"epoch": 3.3285714285714287,
"grad_norm": 0.9097269773483276,
"learning_rate": 3.368421052631579e-06,
"loss": 0.12403593957424164,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.13206,
"step": 699,
"tokens/total": 2863104,
"tokens/train_per_sec_per_gpu": 12.79,
"tokens/trainable": 204830
},
{
"epoch": 3.3333333333333335,
"grad_norm": 0.5364436507225037,
"learning_rate": 3.358851674641149e-06,
"loss": 0.04892924055457115,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05015,
"step": 700,
"tokens/total": 2867200,
"tokens/train_per_sec_per_gpu": 11.38,
"tokens/trainable": 205084
},
{
"epoch": 3.3380952380952382,
"grad_norm": 1.4206129312515259,
"learning_rate": 3.3492822966507182e-06,
"loss": 0.06274130195379257,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06475,
"step": 701,
"tokens/total": 2871296,
"tokens/train_per_sec_per_gpu": 10.72,
"tokens/trainable": 205377
},
{
"epoch": 3.342857142857143,
"grad_norm": 0.7458651065826416,
"learning_rate": 3.339712918660287e-06,
"loss": 0.04512277990579605,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04616,
"step": 702,
"tokens/total": 2875392,
"tokens/train_per_sec_per_gpu": 11.81,
"tokens/trainable": 205627
},
{
"epoch": 3.3476190476190477,
"grad_norm": 0.8281404972076416,
"learning_rate": 3.3301435406698566e-06,
"loss": 0.07591881603002548,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07887,
"step": 703,
"tokens/total": 2879488,
"tokens/train_per_sec_per_gpu": 12.93,
"tokens/trainable": 205873
},
{
"epoch": 3.3523809523809525,
"grad_norm": 0.9755316972732544,
"learning_rate": 3.3205741626794264e-06,
"loss": 0.06004408001899719,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06188,
"step": 704,
"tokens/total": 2883584,
"tokens/train_per_sec_per_gpu": 15.18,
"tokens/trainable": 206183
},
{
"epoch": 3.357142857142857,
"grad_norm": 0.7920077443122864,
"learning_rate": 3.3110047846889954e-06,
"loss": 0.08305348455905914,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0866,
"step": 705,
"tokens/total": 2887680,
"tokens/train_per_sec_per_gpu": 13.99,
"tokens/trainable": 206461
},
{
"epoch": 3.361904761904762,
"grad_norm": 0.8308439254760742,
"learning_rate": 3.3014354066985648e-06,
"loss": 0.09610787779092789,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10088,
"step": 706,
"tokens/total": 2891776,
"tokens/train_per_sec_per_gpu": 14.53,
"tokens/trainable": 206834
},
{
"epoch": 3.3666666666666667,
"grad_norm": 0.7181533575057983,
"learning_rate": 3.2918660287081346e-06,
"loss": 0.054804570972919464,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05633,
"step": 707,
"tokens/total": 2895872,
"tokens/train_per_sec_per_gpu": 12.42,
"tokens/trainable": 207054
},
{
"epoch": 3.3714285714285714,
"grad_norm": 0.5962000489234924,
"learning_rate": 3.2822966507177035e-06,
"loss": 0.05790537968277931,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05961,
"step": 708,
"tokens/total": 2899968,
"tokens/train_per_sec_per_gpu": 13.25,
"tokens/trainable": 207343
},
{
"epoch": 3.376190476190476,
"grad_norm": 0.684431791305542,
"learning_rate": 3.272727272727273e-06,
"loss": 0.037118710577487946,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.03782,
"step": 709,
"tokens/total": 2904064,
"tokens/train_per_sec_per_gpu": 10.92,
"tokens/trainable": 207636
},
{
"epoch": 3.380952380952381,
"grad_norm": 0.8779307007789612,
"learning_rate": 3.2631578947368423e-06,
"loss": 0.06922551244497299,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07168,
"step": 710,
"tokens/total": 2908160,
"tokens/train_per_sec_per_gpu": 14.77,
"tokens/trainable": 207938
},
{
"epoch": 3.3857142857142857,
"grad_norm": 0.8065972328186035,
"learning_rate": 3.2535885167464117e-06,
"loss": 0.09936165809631348,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10447,
"step": 711,
"tokens/total": 2912256,
"tokens/train_per_sec_per_gpu": 25.22,
"tokens/trainable": 208414
},
{
"epoch": 3.3904761904761904,
"grad_norm": 0.6644219756126404,
"learning_rate": 3.244019138755981e-06,
"loss": 0.05635654181241989,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05797,
"step": 712,
"tokens/total": 2916352,
"tokens/train_per_sec_per_gpu": 15.97,
"tokens/trainable": 208705
},
{
"epoch": 3.395238095238095,
"grad_norm": 1.0275393724441528,
"learning_rate": 3.2344497607655505e-06,
"loss": 0.09682406485080719,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10167,
"step": 713,
"tokens/total": 2920448,
"tokens/train_per_sec_per_gpu": 17.09,
"tokens/trainable": 208987
},
{
"epoch": 3.4,
"grad_norm": 0.5890900492668152,
"learning_rate": 3.2248803827751194e-06,
"loss": 0.05707221478223801,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05873,
"step": 714,
"tokens/total": 2924544,
"tokens/train_per_sec_per_gpu": 15.93,
"tokens/trainable": 209293
},
{
"epoch": 3.4047619047619047,
"grad_norm": 0.9608796238899231,
"learning_rate": 3.2153110047846893e-06,
"loss": 0.07874710857868195,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08193,
"step": 715,
"tokens/total": 2928640,
"tokens/train_per_sec_per_gpu": 9.25,
"tokens/trainable": 209521
},
{
"epoch": 3.4095238095238094,
"grad_norm": 0.746338427066803,
"learning_rate": 3.2057416267942586e-06,
"loss": 0.09480582922697067,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09945,
"step": 716,
"tokens/total": 2932736,
"tokens/train_per_sec_per_gpu": 20.98,
"tokens/trainable": 209830
},
{
"epoch": 3.414285714285714,
"grad_norm": 0.7151622772216797,
"learning_rate": 3.1961722488038285e-06,
"loss": 0.07184720039367676,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07449,
"step": 717,
"tokens/total": 2936832,
"tokens/train_per_sec_per_gpu": 11.52,
"tokens/trainable": 210067
},
{
"epoch": 3.419047619047619,
"grad_norm": 1.9423059225082397,
"learning_rate": 3.1866028708133974e-06,
"loss": 0.08544290065765381,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0892,
"step": 718,
"tokens/total": 2940928,
"tokens/train_per_sec_per_gpu": 14.37,
"tokens/trainable": 210392
},
{
"epoch": 3.4238095238095236,
"grad_norm": 0.6730396747589111,
"learning_rate": 3.177033492822967e-06,
"loss": 0.08060389012098312,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08394,
"step": 719,
"tokens/total": 2945024,
"tokens/train_per_sec_per_gpu": 13.33,
"tokens/trainable": 210699
},
{
"epoch": 3.4285714285714284,
"grad_norm": 0.7929803729057312,
"learning_rate": 3.167464114832536e-06,
"loss": 0.11171211302280426,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11819,
"step": 720,
"tokens/total": 2949120,
"tokens/train_per_sec_per_gpu": 12.58,
"tokens/trainable": 210987
},
{
"epoch": 3.4333333333333336,
"grad_norm": 0.6450818777084351,
"learning_rate": 3.157894736842105e-06,
"loss": 0.07563444972038269,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07857,
"step": 721,
"tokens/total": 2953216,
"tokens/train_per_sec_per_gpu": 15.47,
"tokens/trainable": 211321
},
{
"epoch": 3.4380952380952383,
"grad_norm": 0.6084672212600708,
"learning_rate": 3.148325358851675e-06,
"loss": 0.03685470297932625,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03754,
"step": 722,
"tokens/total": 2957312,
"tokens/train_per_sec_per_gpu": 10.53,
"tokens/trainable": 211543
},
{
"epoch": 3.442857142857143,
"grad_norm": 1.0092453956604004,
"learning_rate": 3.1387559808612444e-06,
"loss": 0.07521015405654907,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07811,
"step": 723,
"tokens/total": 2961408,
"tokens/train_per_sec_per_gpu": 11.51,
"tokens/trainable": 211875
},
{
"epoch": 3.447619047619048,
"grad_norm": 0.5857625603675842,
"learning_rate": 3.1291866028708133e-06,
"loss": 0.06451966613531113,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06665,
"step": 724,
"tokens/total": 2965504,
"tokens/train_per_sec_per_gpu": 15.51,
"tokens/trainable": 212170
},
{
"epoch": 3.4523809523809526,
"grad_norm": 1.5166327953338623,
"learning_rate": 3.119617224880383e-06,
"loss": 0.04059155285358429,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.04143,
"step": 725,
"tokens/total": 2969600,
"tokens/train_per_sec_per_gpu": 14.51,
"tokens/trainable": 212427
},
{
"epoch": 3.4571428571428573,
"grad_norm": 0.5359680652618408,
"learning_rate": 3.1100478468899525e-06,
"loss": 0.05074106901884079,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05205,
"step": 726,
"tokens/total": 2973696,
"tokens/train_per_sec_per_gpu": 13.29,
"tokens/trainable": 212712
},
{
"epoch": 3.461904761904762,
"grad_norm": 0.5468071699142456,
"learning_rate": 3.1004784688995215e-06,
"loss": 0.04880739748477936,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05002,
"step": 727,
"tokens/total": 2977792,
"tokens/train_per_sec_per_gpu": 14.33,
"tokens/trainable": 212974
},
{
"epoch": 3.466666666666667,
"grad_norm": 0.743224024772644,
"learning_rate": 3.090909090909091e-06,
"loss": 0.07080194354057312,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07337,
"step": 728,
"tokens/total": 2981888,
"tokens/train_per_sec_per_gpu": 12.39,
"tokens/trainable": 213256
},
{
"epoch": 3.4714285714285715,
"grad_norm": 0.7840217351913452,
"learning_rate": 3.0813397129186607e-06,
"loss": 0.032732173800468445,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03327,
"step": 729,
"tokens/total": 2985984,
"tokens/train_per_sec_per_gpu": 11.76,
"tokens/trainable": 213529
},
{
"epoch": 3.4761904761904763,
"grad_norm": 0.7366862297058105,
"learning_rate": 3.07177033492823e-06,
"loss": 0.07588684558868408,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07884,
"step": 730,
"tokens/total": 2990080,
"tokens/train_per_sec_per_gpu": 12.81,
"tokens/trainable": 213807
},
{
"epoch": 3.480952380952381,
"grad_norm": 1.0238080024719238,
"learning_rate": 3.062200956937799e-06,
"loss": 0.09773441404104233,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10267,
"step": 731,
"tokens/total": 2994176,
"tokens/train_per_sec_per_gpu": 12.9,
"tokens/trainable": 214101
},
{
"epoch": 3.4857142857142858,
"grad_norm": 0.5155897736549377,
"learning_rate": 3.052631578947369e-06,
"loss": 0.03965584188699722,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04045,
"step": 732,
"tokens/total": 2998272,
"tokens/train_per_sec_per_gpu": 13.28,
"tokens/trainable": 214399
},
{
"epoch": 3.4904761904761905,
"grad_norm": 0.41440004110336304,
"learning_rate": 3.0430622009569383e-06,
"loss": 0.04801607131958008,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04919,
"step": 733,
"tokens/total": 3002368,
"tokens/train_per_sec_per_gpu": 18.11,
"tokens/trainable": 214776
},
{
"epoch": 3.4952380952380953,
"grad_norm": 0.7627658247947693,
"learning_rate": 3.0334928229665072e-06,
"loss": 0.09889574348926544,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.10395,
"step": 734,
"tokens/total": 3006464,
"tokens/train_per_sec_per_gpu": 18.78,
"tokens/trainable": 215155
},
{
"epoch": 3.5,
"grad_norm": 0.7029794454574585,
"learning_rate": 3.0239234449760766e-06,
"loss": 0.09765593707561493,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10258,
"step": 735,
"tokens/total": 3010560,
"tokens/train_per_sec_per_gpu": 20.18,
"tokens/trainable": 215539
},
{
"epoch": 3.5047619047619047,
"grad_norm": 1.4511120319366455,
"learning_rate": 3.0143540669856464e-06,
"loss": 0.1049220860004425,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11062,
"step": 736,
"tokens/total": 3014656,
"tokens/train_per_sec_per_gpu": 10.55,
"tokens/trainable": 215790
},
{
"epoch": 3.5095238095238095,
"grad_norm": 0.6316392421722412,
"learning_rate": 3.0047846889952154e-06,
"loss": 0.05280493572354317,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05422,
"step": 737,
"tokens/total": 3018752,
"tokens/train_per_sec_per_gpu": 11.14,
"tokens/trainable": 216068
},
{
"epoch": 3.5142857142857142,
"grad_norm": 0.8526849150657654,
"learning_rate": 2.9952153110047848e-06,
"loss": 0.09136175364255905,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.09567,
"step": 738,
"tokens/total": 3022848,
"tokens/train_per_sec_per_gpu": 19.51,
"tokens/trainable": 216392
},
{
"epoch": 3.519047619047619,
"grad_norm": 0.6972112655639648,
"learning_rate": 2.9856459330143546e-06,
"loss": 0.06299304217100143,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06502,
"step": 739,
"tokens/total": 3026944,
"tokens/train_per_sec_per_gpu": 7.72,
"tokens/trainable": 216620
},
{
"epoch": 3.5238095238095237,
"grad_norm": 1.0006465911865234,
"learning_rate": 2.9760765550239235e-06,
"loss": 0.1156340166926384,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12258,
"step": 740,
"tokens/total": 3031040,
"tokens/train_per_sec_per_gpu": 14.99,
"tokens/trainable": 216946
},
{
"epoch": 3.5285714285714285,
"grad_norm": 1.0956883430480957,
"learning_rate": 2.966507177033493e-06,
"loss": 0.07261288166046143,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07531,
"step": 741,
"tokens/total": 3035136,
"tokens/train_per_sec_per_gpu": 11.77,
"tokens/trainable": 217231
},
{
"epoch": 3.533333333333333,
"grad_norm": 1.1765693426132202,
"learning_rate": 2.9569377990430627e-06,
"loss": 0.08260992914438248,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08612,
"step": 742,
"tokens/total": 3039232,
"tokens/train_per_sec_per_gpu": 10.25,
"tokens/trainable": 217490
},
{
"epoch": 3.538095238095238,
"grad_norm": 0.9932781457901001,
"learning_rate": 2.9473684210526317e-06,
"loss": 0.11413135379552841,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.1209,
"step": 743,
"tokens/total": 3043328,
"tokens/train_per_sec_per_gpu": 12.99,
"tokens/trainable": 217787
},
{
"epoch": 3.5428571428571427,
"grad_norm": 0.34685567021369934,
"learning_rate": 2.937799043062201e-06,
"loss": 0.028304440900683403,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02871,
"step": 744,
"tokens/total": 3047424,
"tokens/train_per_sec_per_gpu": 16.11,
"tokens/trainable": 218083
},
{
"epoch": 3.5476190476190474,
"grad_norm": 0.8639155626296997,
"learning_rate": 2.9282296650717705e-06,
"loss": 0.06153899058699608,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06347,
"step": 745,
"tokens/total": 3051520,
"tokens/train_per_sec_per_gpu": 13.48,
"tokens/trainable": 218376
},
{
"epoch": 3.552380952380952,
"grad_norm": 0.7670663595199585,
"learning_rate": 2.9186602870813403e-06,
"loss": 0.05310921370983124,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05454,
"step": 746,
"tokens/total": 3055616,
"tokens/train_per_sec_per_gpu": 9.47,
"tokens/trainable": 218617
},
{
"epoch": 3.557142857142857,
"grad_norm": 0.7092881202697754,
"learning_rate": 2.9090909090909093e-06,
"loss": 0.05616293102502823,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05777,
"step": 747,
"tokens/total": 3059712,
"tokens/train_per_sec_per_gpu": 19.82,
"tokens/trainable": 218932
},
{
"epoch": 3.5619047619047617,
"grad_norm": 0.6593560576438904,
"learning_rate": 2.8995215311004787e-06,
"loss": 0.06515651196241379,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06733,
"step": 748,
"tokens/total": 3063808,
"tokens/train_per_sec_per_gpu": 15.37,
"tokens/trainable": 219262
},
{
"epoch": 3.5666666666666664,
"grad_norm": 0.9004426598548889,
"learning_rate": 2.8899521531100485e-06,
"loss": 0.08489474654197693,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0886,
"step": 749,
"tokens/total": 3067904,
"tokens/train_per_sec_per_gpu": 11.18,
"tokens/trainable": 219472
},
{
"epoch": 3.571428571428571,
"grad_norm": 0.9647462964057922,
"learning_rate": 2.8803827751196174e-06,
"loss": 0.08201523125171661,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08547,
"step": 750,
"tokens/total": 3072000,
"tokens/train_per_sec_per_gpu": 12.37,
"tokens/trainable": 219738
},
{
"epoch": 3.576190476190476,
"grad_norm": 0.4528436064720154,
"learning_rate": 2.870813397129187e-06,
"loss": 0.03055403381586075,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03103,
"step": 751,
"tokens/total": 3076096,
"tokens/train_per_sec_per_gpu": 9.11,
"tokens/trainable": 220017
},
{
"epoch": 3.580952380952381,
"grad_norm": 0.7963530421257019,
"learning_rate": 2.861244019138756e-06,
"loss": 0.08453945815563202,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08822,
"step": 752,
"tokens/total": 3080192,
"tokens/train_per_sec_per_gpu": 20.97,
"tokens/trainable": 220419
},
{
"epoch": 3.585714285714286,
"grad_norm": 0.8981921076774597,
"learning_rate": 2.851674641148325e-06,
"loss": 0.09118165075778961,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09547,
"step": 753,
"tokens/total": 3084288,
"tokens/train_per_sec_per_gpu": 11.72,
"tokens/trainable": 220827
},
{
"epoch": 3.5904761904761906,
"grad_norm": 0.5238147974014282,
"learning_rate": 2.842105263157895e-06,
"loss": 0.04031630605459213,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04114,
"step": 754,
"tokens/total": 3088384,
"tokens/train_per_sec_per_gpu": 16.61,
"tokens/trainable": 221140
},
{
"epoch": 3.5952380952380953,
"grad_norm": 0.9348918795585632,
"learning_rate": 2.8325358851674644e-06,
"loss": 0.0727066695690155,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07542,
"step": 755,
"tokens/total": 3092480,
"tokens/train_per_sec_per_gpu": 17.87,
"tokens/trainable": 221519
},
{
"epoch": 3.6,
"grad_norm": 0.7450806498527527,
"learning_rate": 2.8229665071770333e-06,
"loss": 0.07027944177389145,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07281,
"step": 756,
"tokens/total": 3096576,
"tokens/train_per_sec_per_gpu": 12.8,
"tokens/trainable": 221815
},
{
"epoch": 3.604761904761905,
"grad_norm": 0.8082990050315857,
"learning_rate": 2.813397129186603e-06,
"loss": 0.07638609409332275,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07938,
"step": 757,
"tokens/total": 3100672,
"tokens/train_per_sec_per_gpu": 13.99,
"tokens/trainable": 222138
},
{
"epoch": 3.6095238095238096,
"grad_norm": 1.0129432678222656,
"learning_rate": 2.8038277511961725e-06,
"loss": 0.12862154841423035,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13726,
"step": 758,
"tokens/total": 3104768,
"tokens/train_per_sec_per_gpu": 11.76,
"tokens/trainable": 222473
},
{
"epoch": 3.6142857142857143,
"grad_norm": 0.42732250690460205,
"learning_rate": 2.794258373205742e-06,
"loss": 0.05144212022423744,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05279,
"step": 759,
"tokens/total": 3108864,
"tokens/train_per_sec_per_gpu": 15.42,
"tokens/trainable": 222800
},
{
"epoch": 3.619047619047619,
"grad_norm": 0.4792739450931549,
"learning_rate": 2.7846889952153113e-06,
"loss": 0.0455373115837574,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04659,
"step": 760,
"tokens/total": 3112960,
"tokens/train_per_sec_per_gpu": 8.68,
"tokens/trainable": 223081
},
{
"epoch": 3.623809523809524,
"grad_norm": 1.2429322004318237,
"learning_rate": 2.7751196172248807e-06,
"loss": 0.09872013330459595,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10376,
"step": 761,
"tokens/total": 3117056,
"tokens/train_per_sec_per_gpu": 12.91,
"tokens/trainable": 223343
},
{
"epoch": 3.6285714285714286,
"grad_norm": 1.2431164979934692,
"learning_rate": 2.76555023923445e-06,
"loss": 0.09223204851150513,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09662,
"step": 762,
"tokens/total": 3121152,
"tokens/train_per_sec_per_gpu": 9.73,
"tokens/trainable": 223573
},
{
"epoch": 3.6333333333333333,
"grad_norm": 0.5852113962173462,
"learning_rate": 2.755980861244019e-06,
"loss": 0.09133613854646683,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.09564,
"step": 763,
"tokens/total": 3125248,
"tokens/train_per_sec_per_gpu": 15.86,
"tokens/trainable": 223932
},
{
"epoch": 3.638095238095238,
"grad_norm": 0.7849932312965393,
"learning_rate": 2.746411483253589e-06,
"loss": 0.08221340924501419,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08569,
"step": 764,
"tokens/total": 3129344,
"tokens/train_per_sec_per_gpu": 12.63,
"tokens/trainable": 224255
},
{
"epoch": 3.642857142857143,
"grad_norm": 0.8393433690071106,
"learning_rate": 2.7368421052631583e-06,
"loss": 0.08088158071041107,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08424,
"step": 765,
"tokens/total": 3133440,
"tokens/train_per_sec_per_gpu": 14.01,
"tokens/trainable": 224537
},
{
"epoch": 3.6476190476190475,
"grad_norm": 1.1545741558074951,
"learning_rate": 2.7272727272727272e-06,
"loss": 0.11216983199119568,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1187,
"step": 766,
"tokens/total": 3137536,
"tokens/train_per_sec_per_gpu": 17.2,
"tokens/trainable": 224863
},
{
"epoch": 3.6523809523809523,
"grad_norm": 0.8742523193359375,
"learning_rate": 2.717703349282297e-06,
"loss": 0.10797283798456192,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11402,
"step": 767,
"tokens/total": 3141632,
"tokens/train_per_sec_per_gpu": 12.15,
"tokens/trainable": 225163
},
{
"epoch": 3.657142857142857,
"grad_norm": 0.7308986186981201,
"learning_rate": 2.7081339712918664e-06,
"loss": 0.110054612159729,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11634,
"step": 768,
"tokens/total": 3145728,
"tokens/train_per_sec_per_gpu": 15.87,
"tokens/trainable": 225510
},
{
"epoch": 3.6619047619047618,
"grad_norm": 0.7405397295951843,
"learning_rate": 2.6985645933014354e-06,
"loss": 0.10397686064243317,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10957,
"step": 769,
"tokens/total": 3149824,
"tokens/train_per_sec_per_gpu": 11.43,
"tokens/trainable": 225742
},
{
"epoch": 3.6666666666666665,
"grad_norm": 1.0262563228607178,
"learning_rate": 2.6889952153110048e-06,
"loss": 0.13542257249355316,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.14502,
"step": 770,
"tokens/total": 3153920,
"tokens/train_per_sec_per_gpu": 16.94,
"tokens/trainable": 226075
},
{
"epoch": 3.6714285714285713,
"grad_norm": 1.6212959289550781,
"learning_rate": 2.6794258373205746e-06,
"loss": 0.11226394772529602,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11881,
"step": 771,
"tokens/total": 3158016,
"tokens/train_per_sec_per_gpu": 11.9,
"tokens/trainable": 226296
},
{
"epoch": 3.6761904761904765,
"grad_norm": 1.3431205749511719,
"learning_rate": 2.669856459330144e-06,
"loss": 0.07553976774215698,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07847,
"step": 772,
"tokens/total": 3162112,
"tokens/train_per_sec_per_gpu": 10.88,
"tokens/trainable": 226564
},
{
"epoch": 3.680952380952381,
"grad_norm": 0.9042708873748779,
"learning_rate": 2.660287081339713e-06,
"loss": 0.061304397881031036,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06322,
"step": 773,
"tokens/total": 3166208,
"tokens/train_per_sec_per_gpu": 11.21,
"tokens/trainable": 226906
},
{
"epoch": 3.685714285714286,
"grad_norm": 0.7307568192481995,
"learning_rate": 2.6507177033492828e-06,
"loss": 0.0648641288280487,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06701,
"step": 774,
"tokens/total": 3170304,
"tokens/train_per_sec_per_gpu": 12.27,
"tokens/trainable": 227198
},
{
"epoch": 3.6904761904761907,
"grad_norm": 0.8105649352073669,
"learning_rate": 2.641148325358852e-06,
"loss": 0.06054212898015976,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06241,
"step": 775,
"tokens/total": 3174400,
"tokens/train_per_sec_per_gpu": 9.69,
"tokens/trainable": 227476
},
{
"epoch": 3.6952380952380954,
"grad_norm": 1.0654374361038208,
"learning_rate": 2.631578947368421e-06,
"loss": 0.06407278776168823,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06617,
"step": 776,
"tokens/total": 3178496,
"tokens/train_per_sec_per_gpu": 9.43,
"tokens/trainable": 227697
},
{
"epoch": 3.7,
"grad_norm": 1.0169827938079834,
"learning_rate": 2.6220095693779905e-06,
"loss": 0.12414013594388962,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13217,
"step": 777,
"tokens/total": 3182592,
"tokens/train_per_sec_per_gpu": 8.18,
"tokens/trainable": 227923
},
{
"epoch": 3.704761904761905,
"grad_norm": 0.8178273439407349,
"learning_rate": 2.6124401913875603e-06,
"loss": 0.08592554926872253,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08973,
"step": 778,
"tokens/total": 3186688,
"tokens/train_per_sec_per_gpu": 14.14,
"tokens/trainable": 228285
},
{
"epoch": 3.7095238095238097,
"grad_norm": 0.6456396579742432,
"learning_rate": 2.6028708133971293e-06,
"loss": 0.05404656380414963,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05553,
"step": 779,
"tokens/total": 3190784,
"tokens/train_per_sec_per_gpu": 11.12,
"tokens/trainable": 228537
},
{
"epoch": 3.7142857142857144,
"grad_norm": 1.2505536079406738,
"learning_rate": 2.5933014354066987e-06,
"loss": 0.08313541859388351,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08669,
"step": 780,
"tokens/total": 3194880,
"tokens/train_per_sec_per_gpu": 11.8,
"tokens/trainable": 228765
},
{
"epoch": 3.719047619047619,
"grad_norm": 0.4605754613876343,
"learning_rate": 2.5837320574162685e-06,
"loss": 0.05742780119180679,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05911,
"step": 781,
"tokens/total": 3198976,
"tokens/train_per_sec_per_gpu": 16.55,
"tokens/trainable": 229136
},
{
"epoch": 3.723809523809524,
"grad_norm": 0.7865471243858337,
"learning_rate": 2.5741626794258374e-06,
"loss": 0.09312713891267776,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0976,
"step": 782,
"tokens/total": 3203072,
"tokens/train_per_sec_per_gpu": 12.28,
"tokens/trainable": 229397
},
{
"epoch": 3.7285714285714286,
"grad_norm": 0.4759027659893036,
"learning_rate": 2.564593301435407e-06,
"loss": 0.022237185388803482,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02249,
"step": 783,
"tokens/total": 3207168,
"tokens/train_per_sec_per_gpu": 11.76,
"tokens/trainable": 229670
},
{
"epoch": 3.7333333333333334,
"grad_norm": 0.6794772148132324,
"learning_rate": 2.5550239234449762e-06,
"loss": 0.05335363745689392,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0548,
"step": 784,
"tokens/total": 3211264,
"tokens/train_per_sec_per_gpu": 11.65,
"tokens/trainable": 229934
},
{
"epoch": 3.738095238095238,
"grad_norm": 0.859467089176178,
"learning_rate": 2.5454545454545456e-06,
"loss": 0.0922853946685791,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09668,
"step": 785,
"tokens/total": 3215360,
"tokens/train_per_sec_per_gpu": 11.79,
"tokens/trainable": 230189
},
{
"epoch": 3.742857142857143,
"grad_norm": 1.0541110038757324,
"learning_rate": 2.535885167464115e-06,
"loss": 0.1113077700138092,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11774,
"step": 786,
"tokens/total": 3219456,
"tokens/train_per_sec_per_gpu": 18.41,
"tokens/trainable": 230510
},
{
"epoch": 3.7476190476190476,
"grad_norm": 0.8308860659599304,
"learning_rate": 2.5263157894736844e-06,
"loss": 0.07469616085290909,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07756,
"step": 787,
"tokens/total": 3223552,
"tokens/train_per_sec_per_gpu": 13.46,
"tokens/trainable": 230769
},
{
"epoch": 3.7523809523809524,
"grad_norm": 0.5026382207870483,
"learning_rate": 2.516746411483254e-06,
"loss": 0.04333016648888588,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04428,
"step": 788,
"tokens/total": 3227648,
"tokens/train_per_sec_per_gpu": 11.95,
"tokens/trainable": 231027
},
{
"epoch": 3.757142857142857,
"grad_norm": 0.8133578300476074,
"learning_rate": 2.507177033492823e-06,
"loss": 0.0831025242805481,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08665,
"step": 789,
"tokens/total": 3231744,
"tokens/train_per_sec_per_gpu": 17.59,
"tokens/trainable": 231302
},
{
"epoch": 3.761904761904762,
"grad_norm": 0.8333939909934998,
"learning_rate": 2.4976076555023926e-06,
"loss": 0.08183260262012482,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08527,
"step": 790,
"tokens/total": 3235840,
"tokens/train_per_sec_per_gpu": 13.2,
"tokens/trainable": 231553
},
{
"epoch": 3.7666666666666666,
"grad_norm": 0.845085084438324,
"learning_rate": 2.488038277511962e-06,
"loss": 0.07390055060386658,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.0767,
"step": 791,
"tokens/total": 3239936,
"tokens/train_per_sec_per_gpu": 24.47,
"tokens/trainable": 231977
},
{
"epoch": 3.7714285714285714,
"grad_norm": 0.7061827182769775,
"learning_rate": 2.4784688995215313e-06,
"loss": 0.07624020427465439,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07922,
"step": 792,
"tokens/total": 3244032,
"tokens/train_per_sec_per_gpu": 21.24,
"tokens/trainable": 232345
},
{
"epoch": 3.776190476190476,
"grad_norm": 0.6797322034835815,
"learning_rate": 2.4688995215311007e-06,
"loss": 0.06764702498912811,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06999,
"step": 793,
"tokens/total": 3248128,
"tokens/train_per_sec_per_gpu": 16.98,
"tokens/trainable": 232686
},
{
"epoch": 3.780952380952381,
"grad_norm": 0.8728348612785339,
"learning_rate": 2.45933014354067e-06,
"loss": 0.09084605425596237,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0951,
"step": 794,
"tokens/total": 3252224,
"tokens/train_per_sec_per_gpu": 21.61,
"tokens/trainable": 233037
},
{
"epoch": 3.7857142857142856,
"grad_norm": 0.48481041193008423,
"learning_rate": 2.4497607655502395e-06,
"loss": 0.07377579808235168,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07657,
"step": 795,
"tokens/total": 3256320,
"tokens/train_per_sec_per_gpu": 17.95,
"tokens/trainable": 233376
},
{
"epoch": 3.7904761904761903,
"grad_norm": 0.6856587529182434,
"learning_rate": 2.440191387559809e-06,
"loss": 0.08114641904830933,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08453,
"step": 796,
"tokens/total": 3260416,
"tokens/train_per_sec_per_gpu": 10.61,
"tokens/trainable": 233714
},
{
"epoch": 3.795238095238095,
"grad_norm": 0.7820855379104614,
"learning_rate": 2.4306220095693783e-06,
"loss": 0.07170091569423676,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07433,
"step": 797,
"tokens/total": 3264512,
"tokens/train_per_sec_per_gpu": 19.66,
"tokens/trainable": 234046
},
{
"epoch": 3.8,
"grad_norm": 1.2638566493988037,
"learning_rate": 2.4210526315789477e-06,
"loss": 0.10723811388015747,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1132,
"step": 798,
"tokens/total": 3268608,
"tokens/train_per_sec_per_gpu": 9.52,
"tokens/trainable": 234329
},
{
"epoch": 3.8047619047619046,
"grad_norm": 0.7651883959770203,
"learning_rate": 2.411483253588517e-06,
"loss": 0.09171386063098907,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.09605,
"step": 799,
"tokens/total": 3272704,
"tokens/train_per_sec_per_gpu": 16.78,
"tokens/trainable": 234646
},
{
"epoch": 3.8095238095238093,
"grad_norm": 0.5760342478752136,
"learning_rate": 2.4019138755980864e-06,
"loss": 0.04247612506151199,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04339,
"step": 800,
"tokens/total": 3276800,
"tokens/train_per_sec_per_gpu": 10.31,
"tokens/trainable": 234874
},
{
"epoch": 3.814285714285714,
"grad_norm": 0.43003764748573303,
"learning_rate": 2.392344497607656e-06,
"loss": 0.06375513225793839,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06583,
"step": 801,
"tokens/total": 3280896,
"tokens/train_per_sec_per_gpu": 8.48,
"tokens/trainable": 235204
},
{
"epoch": 3.819047619047619,
"grad_norm": 1.405259609222412,
"learning_rate": 2.382775119617225e-06,
"loss": 0.14087527990341187,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.15128,
"step": 802,
"tokens/total": 3284992,
"tokens/train_per_sec_per_gpu": 12.94,
"tokens/trainable": 235427
},
{
"epoch": 3.8238095238095235,
"grad_norm": 1.2408273220062256,
"learning_rate": 2.3732057416267946e-06,
"loss": 0.11416477710008621,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12094,
"step": 803,
"tokens/total": 3289088,
"tokens/train_per_sec_per_gpu": 9.93,
"tokens/trainable": 235675
},
{
"epoch": 3.8285714285714287,
"grad_norm": 0.7246369123458862,
"learning_rate": 2.363636363636364e-06,
"loss": 0.06474482268095016,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06689,
"step": 804,
"tokens/total": 3293184,
"tokens/train_per_sec_per_gpu": 12.8,
"tokens/trainable": 235969
},
{
"epoch": 3.8333333333333335,
"grad_norm": 1.1100120544433594,
"learning_rate": 2.3540669856459334e-06,
"loss": 0.10005244612693787,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10523,
"step": 805,
"tokens/total": 3297280,
"tokens/train_per_sec_per_gpu": 14.92,
"tokens/trainable": 236255
},
{
"epoch": 3.8380952380952382,
"grad_norm": 0.6413360238075256,
"learning_rate": 2.3444976076555028e-06,
"loss": 0.05007662996649742,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05135,
"step": 806,
"tokens/total": 3301376,
"tokens/train_per_sec_per_gpu": 11.21,
"tokens/trainable": 236534
},
{
"epoch": 3.842857142857143,
"grad_norm": 0.5169480443000793,
"learning_rate": 2.3349282296650717e-06,
"loss": 0.03839801624417305,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03914,
"step": 807,
"tokens/total": 3305472,
"tokens/train_per_sec_per_gpu": 12.93,
"tokens/trainable": 236885
},
{
"epoch": 3.8476190476190477,
"grad_norm": 0.7787706255912781,
"learning_rate": 2.3253588516746415e-06,
"loss": 0.08824636042118073,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09226,
"step": 808,
"tokens/total": 3309568,
"tokens/train_per_sec_per_gpu": 16.77,
"tokens/trainable": 237173
},
{
"epoch": 3.8523809523809525,
"grad_norm": 0.7283034324645996,
"learning_rate": 2.3157894736842105e-06,
"loss": 0.06264171004295349,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06465,
"step": 809,
"tokens/total": 3313664,
"tokens/train_per_sec_per_gpu": 9.94,
"tokens/trainable": 237473
},
{
"epoch": 3.857142857142857,
"grad_norm": 0.6716837882995605,
"learning_rate": 2.30622009569378e-06,
"loss": 0.07053433358669281,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07308,
"step": 810,
"tokens/total": 3317760,
"tokens/train_per_sec_per_gpu": 14.9,
"tokens/trainable": 237757
},
{
"epoch": 3.861904761904762,
"grad_norm": 0.6464008092880249,
"learning_rate": 2.2966507177033497e-06,
"loss": 0.07775363326072693,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08086,
"step": 811,
"tokens/total": 3321856,
"tokens/train_per_sec_per_gpu": 11.28,
"tokens/trainable": 238049
},
{
"epoch": 3.8666666666666667,
"grad_norm": 0.7403518557548523,
"learning_rate": 2.2870813397129187e-06,
"loss": 0.09577998518943787,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10052,
"step": 812,
"tokens/total": 3325952,
"tokens/train_per_sec_per_gpu": 12.57,
"tokens/trainable": 238325
},
{
"epoch": 3.8714285714285714,
"grad_norm": 0.9457064270973206,
"learning_rate": 2.2775119617224885e-06,
"loss": 0.03777073323726654,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03849,
"step": 813,
"tokens/total": 3330048,
"tokens/train_per_sec_per_gpu": 11.52,
"tokens/trainable": 238556
},
{
"epoch": 3.876190476190476,
"grad_norm": 0.6895711421966553,
"learning_rate": 2.2679425837320575e-06,
"loss": 0.06421350687742233,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06632,
"step": 814,
"tokens/total": 3334144,
"tokens/train_per_sec_per_gpu": 9.66,
"tokens/trainable": 238825
},
{
"epoch": 3.880952380952381,
"grad_norm": 1.067850947380066,
"learning_rate": 2.258373205741627e-06,
"loss": 0.12325073778629303,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.13117,
"step": 815,
"tokens/total": 3338240,
"tokens/train_per_sec_per_gpu": 11.6,
"tokens/trainable": 239107
},
{
"epoch": 3.8857142857142857,
"grad_norm": 0.9182291030883789,
"learning_rate": 2.2488038277511962e-06,
"loss": 0.06907776743173599,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07152,
"step": 816,
"tokens/total": 3342336,
"tokens/train_per_sec_per_gpu": 17.84,
"tokens/trainable": 239421
},
{
"epoch": 3.8904761904761904,
"grad_norm": 0.6250137090682983,
"learning_rate": 2.2392344497607656e-06,
"loss": 0.05608314275741577,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.05769,
"step": 817,
"tokens/total": 3346432,
"tokens/train_per_sec_per_gpu": 15.91,
"tokens/trainable": 239707
},
{
"epoch": 3.895238095238095,
"grad_norm": 0.8182249069213867,
"learning_rate": 2.229665071770335e-06,
"loss": 0.057830363512039185,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.05954,
"step": 818,
"tokens/total": 3350528,
"tokens/train_per_sec_per_gpu": 11.06,
"tokens/trainable": 239938
},
{
"epoch": 3.9,
"grad_norm": 0.8500362634658813,
"learning_rate": 2.2200956937799044e-06,
"loss": 0.11211861670017242,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11865,
"step": 819,
"tokens/total": 3354624,
"tokens/train_per_sec_per_gpu": 9.0,
"tokens/trainable": 240191
},
{
"epoch": 3.9047619047619047,
"grad_norm": 0.6874716281890869,
"learning_rate": 2.2105263157894738e-06,
"loss": 0.062088239938020706,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06406,
"step": 820,
"tokens/total": 3358720,
"tokens/train_per_sec_per_gpu": 12.66,
"tokens/trainable": 240485
},
{
"epoch": 3.9095238095238094,
"grad_norm": 0.8891911506652832,
"learning_rate": 2.200956937799043e-06,
"loss": 0.08611418306827545,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08993,
"step": 821,
"tokens/total": 3362816,
"tokens/train_per_sec_per_gpu": 10.57,
"tokens/trainable": 240753
},
{
"epoch": 3.914285714285714,
"grad_norm": 1.2441385984420776,
"learning_rate": 2.1913875598086126e-06,
"loss": 0.0724477618932724,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07514,
"step": 822,
"tokens/total": 3366912,
"tokens/train_per_sec_per_gpu": 8.75,
"tokens/trainable": 240943
},
{
"epoch": 3.919047619047619,
"grad_norm": 0.7042216062545776,
"learning_rate": 2.181818181818182e-06,
"loss": 0.08102297782897949,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0844,
"step": 823,
"tokens/total": 3371008,
"tokens/train_per_sec_per_gpu": 11.55,
"tokens/trainable": 241235
},
{
"epoch": 3.923809523809524,
"grad_norm": 5.344852924346924,
"learning_rate": 2.1722488038277513e-06,
"loss": 0.07976698130369186,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.08303,
"step": 824,
"tokens/total": 3375104,
"tokens/train_per_sec_per_gpu": 16.83,
"tokens/trainable": 241603
},
{
"epoch": 3.928571428571429,
"grad_norm": 0.492816299200058,
"learning_rate": 2.1626794258373207e-06,
"loss": 0.056909359991550446,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05856,
"step": 825,
"tokens/total": 3379200,
"tokens/train_per_sec_per_gpu": 20.35,
"tokens/trainable": 241974
},
{
"epoch": 3.9333333333333336,
"grad_norm": 0.4744802713394165,
"learning_rate": 2.15311004784689e-06,
"loss": 0.06698750704526901,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06928,
"step": 826,
"tokens/total": 3383296,
"tokens/train_per_sec_per_gpu": 18.28,
"tokens/trainable": 242326
},
{
"epoch": 3.9380952380952383,
"grad_norm": 0.9668700098991394,
"learning_rate": 2.1435406698564595e-06,
"loss": 0.1610293686389923,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.17472,
"step": 827,
"tokens/total": 3387392,
"tokens/train_per_sec_per_gpu": 14.63,
"tokens/trainable": 242623
},
{
"epoch": 3.942857142857143,
"grad_norm": 0.7834397554397583,
"learning_rate": 2.133971291866029e-06,
"loss": 0.0918939858675003,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09625,
"step": 828,
"tokens/total": 3391488,
"tokens/train_per_sec_per_gpu": 10.88,
"tokens/trainable": 242903
},
{
"epoch": 3.947619047619048,
"grad_norm": 0.6493245959281921,
"learning_rate": 2.1244019138755983e-06,
"loss": 0.06912299990653992,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07157,
"step": 829,
"tokens/total": 3395584,
"tokens/train_per_sec_per_gpu": 15.28,
"tokens/trainable": 243212
},
{
"epoch": 3.9523809523809526,
"grad_norm": 0.7439002394676208,
"learning_rate": 2.1148325358851677e-06,
"loss": 0.09127552807331085,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09557,
"step": 830,
"tokens/total": 3399680,
"tokens/train_per_sec_per_gpu": 9.96,
"tokens/trainable": 243543
},
{
"epoch": 3.9571428571428573,
"grad_norm": 1.073249101638794,
"learning_rate": 2.105263157894737e-06,
"loss": 0.07269235700368881,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0754,
"step": 831,
"tokens/total": 3403776,
"tokens/train_per_sec_per_gpu": 13.87,
"tokens/trainable": 243810
},
{
"epoch": 3.961904761904762,
"grad_norm": 0.914975643157959,
"learning_rate": 2.0956937799043064e-06,
"loss": 0.09338957071304321,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09789,
"step": 832,
"tokens/total": 3407872,
"tokens/train_per_sec_per_gpu": 22.28,
"tokens/trainable": 244184
},
{
"epoch": 3.966666666666667,
"grad_norm": 0.7717406153678894,
"learning_rate": 2.086124401913876e-06,
"loss": 0.08632536977529526,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09016,
"step": 833,
"tokens/total": 3411968,
"tokens/train_per_sec_per_gpu": 10.4,
"tokens/trainable": 244486
},
{
"epoch": 3.9714285714285715,
"grad_norm": 0.8154407739639282,
"learning_rate": 2.0765550239234452e-06,
"loss": 0.09252412617206573,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09694,
"step": 834,
"tokens/total": 3416064,
"tokens/train_per_sec_per_gpu": 15.65,
"tokens/trainable": 244821
},
{
"epoch": 3.9761904761904763,
"grad_norm": 0.7648400664329529,
"learning_rate": 2.0669856459330146e-06,
"loss": 0.06714729964733124,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06945,
"step": 835,
"tokens/total": 3420160,
"tokens/train_per_sec_per_gpu": 10.48,
"tokens/trainable": 245138
},
{
"epoch": 3.980952380952381,
"grad_norm": 0.6725287437438965,
"learning_rate": 2.057416267942584e-06,
"loss": 0.0852859616279602,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08903,
"step": 836,
"tokens/total": 3424256,
"tokens/train_per_sec_per_gpu": 16.19,
"tokens/trainable": 245447
},
{
"epoch": 3.9857142857142858,
"grad_norm": 0.5311653017997742,
"learning_rate": 2.0478468899521534e-06,
"loss": 0.05240347981452942,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0538,
"step": 837,
"tokens/total": 3428352,
"tokens/train_per_sec_per_gpu": 11.5,
"tokens/trainable": 245702
},
{
"epoch": 3.9904761904761905,
"grad_norm": 1.003235936164856,
"learning_rate": 2.0382775119617228e-06,
"loss": 0.09178285300731659,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09613,
"step": 838,
"tokens/total": 3432448,
"tokens/train_per_sec_per_gpu": 9.86,
"tokens/trainable": 245989
},
{
"epoch": 3.9952380952380953,
"grad_norm": 0.8917669653892517,
"learning_rate": 2.0287081339712917e-06,
"loss": 0.08628636598587036,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09012,
"step": 839,
"tokens/total": 3436544,
"tokens/train_per_sec_per_gpu": 11.31,
"tokens/trainable": 246249
},
{
"epoch": 4.0,
"grad_norm": 1.0130497217178345,
"learning_rate": 2.0191387559808616e-06,
"loss": 0.08156722784042358,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08499,
"step": 840,
"tokens/total": 3440640,
"tokens/train_per_sec_per_gpu": 12.54,
"tokens/trainable": 246513
},
{
"epoch": 4.0,
"eval_loss": 0.07883982360363007,
"eval_ppl": 1.08203,
"eval_runtime": 10.4308,
"eval_samples_per_second": 8.532,
"eval_steps_per_second": 2.205,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 35.59,
"memory/max_allocated (GiB)": 35.59,
"step": 840
},
{
"epoch": 4.004761904761905,
"grad_norm": 0.9490176439285278,
"learning_rate": 2.0095693779904305e-06,
"loss": 0.0749816969037056,
"memory/device_reserved (GiB)": 39.14,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07786,
"step": 841,
"tokens/total": 3444736,
"tokens/train_per_sec_per_gpu": 9.55,
"tokens/trainable": 246784
},
{
"epoch": 4.0095238095238095,
"grad_norm": 0.32807204127311707,
"learning_rate": 2.0000000000000003e-06,
"loss": 0.030588284134864807,
"memory/device_reserved (GiB)": 39.15,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03106,
"step": 842,
"tokens/total": 3448832,
"tokens/train_per_sec_per_gpu": 12.72,
"tokens/trainable": 247043
},
{
"epoch": 4.014285714285714,
"grad_norm": 1.0914336442947388,
"learning_rate": 1.9904306220095697e-06,
"loss": 0.1014956682920456,
"memory/device_reserved (GiB)": 39.15,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10683,
"step": 843,
"tokens/total": 3452928,
"tokens/train_per_sec_per_gpu": 11.84,
"tokens/trainable": 247297
},
{
"epoch": 4.019047619047619,
"grad_norm": 0.5259432792663574,
"learning_rate": 1.9808612440191387e-06,
"loss": 0.04887865483760834,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05009,
"step": 844,
"tokens/total": 3457024,
"tokens/train_per_sec_per_gpu": 15.25,
"tokens/trainable": 247594
},
{
"epoch": 4.023809523809524,
"grad_norm": 0.47249555587768555,
"learning_rate": 1.9712918660287085e-06,
"loss": 0.029536675661802292,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02998,
"step": 845,
"tokens/total": 3461120,
"tokens/train_per_sec_per_gpu": 9.89,
"tokens/trainable": 247848
},
{
"epoch": 4.0285714285714285,
"grad_norm": 0.6428244709968567,
"learning_rate": 1.9617224880382775e-06,
"loss": 0.05999932438135147,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06184,
"step": 846,
"tokens/total": 3465216,
"tokens/train_per_sec_per_gpu": 11.52,
"tokens/trainable": 248131
},
{
"epoch": 4.033333333333333,
"grad_norm": 0.6530048847198486,
"learning_rate": 1.952153110047847e-06,
"loss": 0.05361972004175186,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05508,
"step": 847,
"tokens/total": 3469312,
"tokens/train_per_sec_per_gpu": 13.34,
"tokens/trainable": 248414
},
{
"epoch": 4.038095238095238,
"grad_norm": 0.6523117423057556,
"learning_rate": 1.9425837320574167e-06,
"loss": 0.07807442545890808,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0812,
"step": 848,
"tokens/total": 3473408,
"tokens/train_per_sec_per_gpu": 15.01,
"tokens/trainable": 248740
},
{
"epoch": 4.042857142857143,
"grad_norm": 0.5848574638366699,
"learning_rate": 1.9330143540669856e-06,
"loss": 0.05901365354657173,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06079,
"step": 849,
"tokens/total": 3477504,
"tokens/train_per_sec_per_gpu": 14.06,
"tokens/trainable": 248990
},
{
"epoch": 4.0476190476190474,
"grad_norm": 0.6108696460723877,
"learning_rate": 1.9234449760765554e-06,
"loss": 0.05660616606473923,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05824,
"step": 850,
"tokens/total": 3481600,
"tokens/train_per_sec_per_gpu": 11.56,
"tokens/trainable": 249206
},
{
"epoch": 4.052380952380952,
"grad_norm": 0.7095998525619507,
"learning_rate": 1.9138755980861244e-06,
"loss": 0.06122968718409538,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06314,
"step": 851,
"tokens/total": 3485696,
"tokens/train_per_sec_per_gpu": 12.72,
"tokens/trainable": 249488
},
{
"epoch": 4.057142857142857,
"grad_norm": 0.7885696291923523,
"learning_rate": 1.9043062200956938e-06,
"loss": 0.061911046504974365,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06387,
"step": 852,
"tokens/total": 3489792,
"tokens/train_per_sec_per_gpu": 11.61,
"tokens/trainable": 249803
},
{
"epoch": 4.061904761904762,
"grad_norm": 0.5044105648994446,
"learning_rate": 1.8947368421052634e-06,
"loss": 0.05257502943277359,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05398,
"step": 853,
"tokens/total": 3493888,
"tokens/train_per_sec_per_gpu": 17.11,
"tokens/trainable": 250129
},
{
"epoch": 4.066666666666666,
"grad_norm": 0.9425777196884155,
"learning_rate": 1.8851674641148326e-06,
"loss": 0.10026482492685318,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10546,
"step": 854,
"tokens/total": 3497984,
"tokens/train_per_sec_per_gpu": 12.27,
"tokens/trainable": 250405
},
{
"epoch": 4.071428571428571,
"grad_norm": 0.9110622406005859,
"learning_rate": 1.8755980861244022e-06,
"loss": 0.11010429263114929,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11639,
"step": 855,
"tokens/total": 3502080,
"tokens/train_per_sec_per_gpu": 16.15,
"tokens/trainable": 250764
},
{
"epoch": 4.076190476190476,
"grad_norm": 1.1408833265304565,
"learning_rate": 1.8660287081339716e-06,
"loss": 0.08574778586626053,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.08953,
"step": 856,
"tokens/total": 3506176,
"tokens/train_per_sec_per_gpu": 16.3,
"tokens/trainable": 251035
},
{
"epoch": 4.080952380952381,
"grad_norm": 0.5738747715950012,
"learning_rate": 1.8564593301435407e-06,
"loss": 0.040827590972185135,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04167,
"step": 857,
"tokens/total": 3510272,
"tokens/train_per_sec_per_gpu": 14.79,
"tokens/trainable": 251397
},
{
"epoch": 4.085714285714285,
"grad_norm": 0.7939117550849915,
"learning_rate": 1.8468899521531103e-06,
"loss": 0.08306203782558441,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08661,
"step": 858,
"tokens/total": 3514368,
"tokens/train_per_sec_per_gpu": 13.97,
"tokens/trainable": 251738
},
{
"epoch": 4.09047619047619,
"grad_norm": 1.3952772617340088,
"learning_rate": 1.8373205741626795e-06,
"loss": 0.0917973592877388,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09614,
"step": 859,
"tokens/total": 3518464,
"tokens/train_per_sec_per_gpu": 14.95,
"tokens/trainable": 252071
},
{
"epoch": 4.095238095238095,
"grad_norm": 0.7479850053787231,
"learning_rate": 1.827751196172249e-06,
"loss": 0.06424461305141449,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06635,
"step": 860,
"tokens/total": 3522560,
"tokens/train_per_sec_per_gpu": 16.37,
"tokens/trainable": 252407
},
{
"epoch": 4.1,
"grad_norm": 0.9506804347038269,
"learning_rate": 1.8181818181818183e-06,
"loss": 0.08265562355518341,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08617,
"step": 861,
"tokens/total": 3526656,
"tokens/train_per_sec_per_gpu": 21.86,
"tokens/trainable": 252782
},
{
"epoch": 4.104761904761904,
"grad_norm": 0.7788168787956238,
"learning_rate": 1.8086124401913877e-06,
"loss": 0.04435598850250244,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04535,
"step": 862,
"tokens/total": 3530752,
"tokens/train_per_sec_per_gpu": 10.79,
"tokens/trainable": 253093
},
{
"epoch": 4.109523809523809,
"grad_norm": 0.2663736045360565,
"learning_rate": 1.7990430622009573e-06,
"loss": 0.026464153081178665,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.02682,
"step": 863,
"tokens/total": 3534848,
"tokens/train_per_sec_per_gpu": 11.88,
"tokens/trainable": 253415
},
{
"epoch": 4.114285714285714,
"grad_norm": 0.85882568359375,
"learning_rate": 1.7894736842105265e-06,
"loss": 0.07664963603019714,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07966,
"step": 864,
"tokens/total": 3538944,
"tokens/train_per_sec_per_gpu": 10.42,
"tokens/trainable": 253649
},
{
"epoch": 4.119047619047619,
"grad_norm": 0.6445422768592834,
"learning_rate": 1.7799043062200958e-06,
"loss": 0.0744195431470871,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07726,
"step": 865,
"tokens/total": 3543040,
"tokens/train_per_sec_per_gpu": 15.61,
"tokens/trainable": 253994
},
{
"epoch": 4.123809523809523,
"grad_norm": 1.065576195716858,
"learning_rate": 1.7703349282296652e-06,
"loss": 0.15491408109664917,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.16756,
"step": 866,
"tokens/total": 3547136,
"tokens/train_per_sec_per_gpu": 13.02,
"tokens/trainable": 254247
},
{
"epoch": 4.128571428571428,
"grad_norm": 0.4529033601284027,
"learning_rate": 1.7607655502392346e-06,
"loss": 0.034318629652261734,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03491,
"step": 867,
"tokens/total": 3551232,
"tokens/train_per_sec_per_gpu": 11.91,
"tokens/trainable": 254502
},
{
"epoch": 4.133333333333334,
"grad_norm": 0.7004088163375854,
"learning_rate": 1.7511961722488038e-06,
"loss": 0.08494338393211365,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08866,
"step": 868,
"tokens/total": 3555328,
"tokens/train_per_sec_per_gpu": 15.28,
"tokens/trainable": 254819
},
{
"epoch": 4.1380952380952385,
"grad_norm": 0.5470396876335144,
"learning_rate": 1.7416267942583734e-06,
"loss": 0.049904145300388336,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05117,
"step": 869,
"tokens/total": 3559424,
"tokens/train_per_sec_per_gpu": 13.28,
"tokens/trainable": 255094
},
{
"epoch": 4.142857142857143,
"grad_norm": 0.5020394921302795,
"learning_rate": 1.7320574162679426e-06,
"loss": 0.05947474017739296,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06128,
"step": 870,
"tokens/total": 3563520,
"tokens/train_per_sec_per_gpu": 15.45,
"tokens/trainable": 255414
},
{
"epoch": 4.147619047619048,
"grad_norm": 0.5141638517379761,
"learning_rate": 1.7224880382775122e-06,
"loss": 0.02415190264582634,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.02445,
"step": 871,
"tokens/total": 3567616,
"tokens/train_per_sec_per_gpu": 10.97,
"tokens/trainable": 255632
},
{
"epoch": 4.152380952380953,
"grad_norm": 1.4106786251068115,
"learning_rate": 1.7129186602870816e-06,
"loss": 0.10826382040977478,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11434,
"step": 872,
"tokens/total": 3571712,
"tokens/train_per_sec_per_gpu": 12.68,
"tokens/trainable": 255880
},
{
"epoch": 4.1571428571428575,
"grad_norm": 0.5615010261535645,
"learning_rate": 1.7033492822966507e-06,
"loss": 0.03849765658378601,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03925,
"step": 873,
"tokens/total": 3575808,
"tokens/train_per_sec_per_gpu": 14.63,
"tokens/trainable": 256174
},
{
"epoch": 4.161904761904762,
"grad_norm": 0.6795538067817688,
"learning_rate": 1.6937799043062203e-06,
"loss": 0.04768747463822365,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04884,
"step": 874,
"tokens/total": 3579904,
"tokens/train_per_sec_per_gpu": 25.87,
"tokens/trainable": 256568
},
{
"epoch": 4.166666666666667,
"grad_norm": 0.598505437374115,
"learning_rate": 1.6842105263157895e-06,
"loss": 0.05449119955301285,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.056,
"step": 875,
"tokens/total": 3584000,
"tokens/train_per_sec_per_gpu": 16.03,
"tokens/trainable": 256927
},
{
"epoch": 4.171428571428572,
"grad_norm": 0.8535393476486206,
"learning_rate": 1.6746411483253591e-06,
"loss": 0.07312190532684326,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07586,
"step": 876,
"tokens/total": 3588096,
"tokens/train_per_sec_per_gpu": 16.39,
"tokens/trainable": 257229
},
{
"epoch": 4.1761904761904765,
"grad_norm": 0.6472470164299011,
"learning_rate": 1.6650717703349283e-06,
"loss": 0.0614137165248394,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06334,
"step": 877,
"tokens/total": 3592192,
"tokens/train_per_sec_per_gpu": 11.11,
"tokens/trainable": 257506
},
{
"epoch": 4.180952380952381,
"grad_norm": 0.7363004684448242,
"learning_rate": 1.6555023923444977e-06,
"loss": 0.0493217408657074,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05056,
"step": 878,
"tokens/total": 3596288,
"tokens/train_per_sec_per_gpu": 9.68,
"tokens/trainable": 257818
},
{
"epoch": 4.185714285714286,
"grad_norm": 1.0971989631652832,
"learning_rate": 1.6459330143540673e-06,
"loss": 0.09783400595188141,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10278,
"step": 879,
"tokens/total": 3600384,
"tokens/train_per_sec_per_gpu": 18.66,
"tokens/trainable": 258201
},
{
"epoch": 4.190476190476191,
"grad_norm": 0.6767682433128357,
"learning_rate": 1.6363636363636365e-06,
"loss": 0.06688456237316132,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06917,
"step": 880,
"tokens/total": 3604480,
"tokens/train_per_sec_per_gpu": 17.66,
"tokens/trainable": 258495
},
{
"epoch": 4.195238095238095,
"grad_norm": 0.7312933802604675,
"learning_rate": 1.6267942583732059e-06,
"loss": 0.07728984951972961,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08036,
"step": 881,
"tokens/total": 3608576,
"tokens/train_per_sec_per_gpu": 15.97,
"tokens/trainable": 258800
},
{
"epoch": 4.2,
"grad_norm": 1.075819969177246,
"learning_rate": 1.6172248803827752e-06,
"loss": 0.09135079383850098,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09565,
"step": 882,
"tokens/total": 3612672,
"tokens/train_per_sec_per_gpu": 14.7,
"tokens/trainable": 259046
},
{
"epoch": 4.204761904761905,
"grad_norm": 0.7385833859443665,
"learning_rate": 1.6076555023923446e-06,
"loss": 0.10531473159790039,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11106,
"step": 883,
"tokens/total": 3616768,
"tokens/train_per_sec_per_gpu": 9.51,
"tokens/trainable": 259334
},
{
"epoch": 4.20952380952381,
"grad_norm": 0.6874673962593079,
"learning_rate": 1.5980861244019142e-06,
"loss": 0.09048204869031906,
"memory/device_reserved (GiB)": 39.17,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0947,
"step": 884,
"tokens/total": 3620864,
"tokens/train_per_sec_per_gpu": 17.49,
"tokens/trainable": 259691
},
{
"epoch": 4.214285714285714,
"grad_norm": 0.7855772972106934,
"learning_rate": 1.5885167464114834e-06,
"loss": 0.07922257483005524,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.08245,
"step": 885,
"tokens/total": 3624960,
"tokens/train_per_sec_per_gpu": 17.44,
"tokens/trainable": 260005
},
{
"epoch": 4.219047619047619,
"grad_norm": 0.6006829738616943,
"learning_rate": 1.5789473684210526e-06,
"loss": 0.06699418276548386,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06929,
"step": 886,
"tokens/total": 3629056,
"tokens/train_per_sec_per_gpu": 11.27,
"tokens/trainable": 260299
},
{
"epoch": 4.223809523809524,
"grad_norm": 0.6273767948150635,
"learning_rate": 1.5693779904306222e-06,
"loss": 0.07145752012729645,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07407,
"step": 887,
"tokens/total": 3633152,
"tokens/train_per_sec_per_gpu": 14.54,
"tokens/trainable": 260544
},
{
"epoch": 4.228571428571429,
"grad_norm": 0.6834083795547485,
"learning_rate": 1.5598086124401916e-06,
"loss": 0.06794765591621399,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07031,
"step": 888,
"tokens/total": 3637248,
"tokens/train_per_sec_per_gpu": 9.42,
"tokens/trainable": 260814
},
{
"epoch": 4.233333333333333,
"grad_norm": 0.49679332971572876,
"learning_rate": 1.5502392344497607e-06,
"loss": 0.061248525977134705,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06316,
"step": 889,
"tokens/total": 3641344,
"tokens/train_per_sec_per_gpu": 14.16,
"tokens/trainable": 261143
},
{
"epoch": 4.238095238095238,
"grad_norm": 0.5640564560890198,
"learning_rate": 1.5406698564593303e-06,
"loss": 0.0383354052901268,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.03908,
"step": 890,
"tokens/total": 3645440,
"tokens/train_per_sec_per_gpu": 14.15,
"tokens/trainable": 261469
},
{
"epoch": 4.242857142857143,
"grad_norm": 1.1639114618301392,
"learning_rate": 1.5311004784688995e-06,
"loss": 0.07877490669488907,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08196,
"step": 891,
"tokens/total": 3649536,
"tokens/train_per_sec_per_gpu": 11.55,
"tokens/trainable": 261719
},
{
"epoch": 4.247619047619048,
"grad_norm": 0.8218087553977966,
"learning_rate": 1.5215311004784691e-06,
"loss": 0.06628608703613281,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06853,
"step": 892,
"tokens/total": 3653632,
"tokens/train_per_sec_per_gpu": 10.83,
"tokens/trainable": 261995
},
{
"epoch": 4.252380952380952,
"grad_norm": 0.7092288732528687,
"learning_rate": 1.5119617224880383e-06,
"loss": 0.05123090371489525,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05257,
"step": 893,
"tokens/total": 3657728,
"tokens/train_per_sec_per_gpu": 14.36,
"tokens/trainable": 262321
},
{
"epoch": 4.257142857142857,
"grad_norm": 1.2661248445510864,
"learning_rate": 1.5023923444976077e-06,
"loss": 0.10810350626707077,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11416,
"step": 894,
"tokens/total": 3661824,
"tokens/train_per_sec_per_gpu": 11.75,
"tokens/trainable": 262652
},
{
"epoch": 4.261904761904762,
"grad_norm": 0.9689322113990784,
"learning_rate": 1.4928229665071773e-06,
"loss": 0.07231342047452927,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07499,
"step": 895,
"tokens/total": 3665920,
"tokens/train_per_sec_per_gpu": 10.82,
"tokens/trainable": 262895
},
{
"epoch": 4.266666666666667,
"grad_norm": 0.8054395914077759,
"learning_rate": 1.4832535885167465e-06,
"loss": 0.05944337695837021,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06125,
"step": 896,
"tokens/total": 3670016,
"tokens/train_per_sec_per_gpu": 15.87,
"tokens/trainable": 263163
},
{
"epoch": 4.271428571428571,
"grad_norm": 1.0870224237442017,
"learning_rate": 1.4736842105263159e-06,
"loss": 0.10757910460233688,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11358,
"step": 897,
"tokens/total": 3674112,
"tokens/train_per_sec_per_gpu": 14.39,
"tokens/trainable": 263459
},
{
"epoch": 4.276190476190476,
"grad_norm": 0.6998184323310852,
"learning_rate": 1.4641148325358852e-06,
"loss": 0.08821848034858704,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09223,
"step": 898,
"tokens/total": 3678208,
"tokens/train_per_sec_per_gpu": 14.14,
"tokens/trainable": 263726
},
{
"epoch": 4.280952380952381,
"grad_norm": 0.673193097114563,
"learning_rate": 1.4545454545454546e-06,
"loss": 0.05898454040288925,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06076,
"step": 899,
"tokens/total": 3682304,
"tokens/train_per_sec_per_gpu": 12.75,
"tokens/trainable": 263995
},
{
"epoch": 4.285714285714286,
"grad_norm": 0.9073561429977417,
"learning_rate": 1.4449760765550242e-06,
"loss": 0.09241870045661926,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09682,
"step": 900,
"tokens/total": 3686400,
"tokens/train_per_sec_per_gpu": 11.53,
"tokens/trainable": 264285
},
{
"epoch": 4.29047619047619,
"grad_norm": 0.6585322022438049,
"learning_rate": 1.4354066985645934e-06,
"loss": 0.0438724160194397,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04485,
"step": 901,
"tokens/total": 3690496,
"tokens/train_per_sec_per_gpu": 14.18,
"tokens/trainable": 264565
},
{
"epoch": 4.295238095238095,
"grad_norm": 0.6179357767105103,
"learning_rate": 1.4258373205741626e-06,
"loss": 0.04411366209387779,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0451,
"step": 902,
"tokens/total": 3694592,
"tokens/train_per_sec_per_gpu": 12.02,
"tokens/trainable": 264839
},
{
"epoch": 4.3,
"grad_norm": 0.6685640215873718,
"learning_rate": 1.4162679425837322e-06,
"loss": 0.07034850120544434,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07288,
"step": 903,
"tokens/total": 3698688,
"tokens/train_per_sec_per_gpu": 9.98,
"tokens/trainable": 265127
},
{
"epoch": 4.304761904761905,
"grad_norm": 0.9312854409217834,
"learning_rate": 1.4066985645933016e-06,
"loss": 0.13462990522384644,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.14411,
"step": 904,
"tokens/total": 3702784,
"tokens/train_per_sec_per_gpu": 16.23,
"tokens/trainable": 265471
},
{
"epoch": 4.309523809523809,
"grad_norm": 0.6181421279907227,
"learning_rate": 1.397129186602871e-06,
"loss": 0.07443803548812866,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07728,
"step": 905,
"tokens/total": 3706880,
"tokens/train_per_sec_per_gpu": 10.44,
"tokens/trainable": 265766
},
{
"epoch": 4.314285714285714,
"grad_norm": 0.903626561164856,
"learning_rate": 1.3875598086124404e-06,
"loss": 0.0580969899892807,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05982,
"step": 906,
"tokens/total": 3710976,
"tokens/train_per_sec_per_gpu": 13.25,
"tokens/trainable": 266057
},
{
"epoch": 4.319047619047619,
"grad_norm": 0.698418140411377,
"learning_rate": 1.3779904306220095e-06,
"loss": 0.06764661520719528,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06999,
"step": 907,
"tokens/total": 3715072,
"tokens/train_per_sec_per_gpu": 14.48,
"tokens/trainable": 266366
},
{
"epoch": 4.3238095238095235,
"grad_norm": 0.9411168098449707,
"learning_rate": 1.3684210526315791e-06,
"loss": 0.06708519160747528,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06939,
"step": 908,
"tokens/total": 3719168,
"tokens/train_per_sec_per_gpu": 13.63,
"tokens/trainable": 266633
},
{
"epoch": 4.328571428571428,
"grad_norm": 0.3852144479751587,
"learning_rate": 1.3588516746411485e-06,
"loss": 0.050158947706222534,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05144,
"step": 909,
"tokens/total": 3723264,
"tokens/train_per_sec_per_gpu": 13.9,
"tokens/trainable": 266989
},
{
"epoch": 4.333333333333333,
"grad_norm": 0.6585800647735596,
"learning_rate": 1.3492822966507177e-06,
"loss": 0.0391804464161396,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.03996,
"step": 910,
"tokens/total": 3727360,
"tokens/train_per_sec_per_gpu": 16.01,
"tokens/trainable": 267283
},
{
"epoch": 4.338095238095238,
"grad_norm": 0.6668374538421631,
"learning_rate": 1.3397129186602873e-06,
"loss": 0.04831254854798317,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0495,
"step": 911,
"tokens/total": 3731456,
"tokens/train_per_sec_per_gpu": 10.3,
"tokens/trainable": 267532
},
{
"epoch": 4.3428571428571425,
"grad_norm": 0.5903038382530212,
"learning_rate": 1.3301435406698565e-06,
"loss": 0.044688403606414795,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0457,
"step": 912,
"tokens/total": 3735552,
"tokens/train_per_sec_per_gpu": 17.5,
"tokens/trainable": 267819
},
{
"epoch": 4.347619047619047,
"grad_norm": 0.6831850409507751,
"learning_rate": 1.320574162679426e-06,
"loss": 0.06540787220001221,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06759,
"step": 913,
"tokens/total": 3739648,
"tokens/train_per_sec_per_gpu": 13.11,
"tokens/trainable": 268172
},
{
"epoch": 4.352380952380952,
"grad_norm": 0.9196857810020447,
"learning_rate": 1.3110047846889953e-06,
"loss": 0.10975831747055054,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11601,
"step": 914,
"tokens/total": 3743744,
"tokens/train_per_sec_per_gpu": 13.28,
"tokens/trainable": 268477
},
{
"epoch": 4.357142857142857,
"grad_norm": 0.710890531539917,
"learning_rate": 1.3014354066985646e-06,
"loss": 0.06814423203468323,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07052,
"step": 915,
"tokens/total": 3747840,
"tokens/train_per_sec_per_gpu": 15.36,
"tokens/trainable": 268765
},
{
"epoch": 4.3619047619047615,
"grad_norm": 0.9449613690376282,
"learning_rate": 1.2918660287081342e-06,
"loss": 0.0915263220667839,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09585,
"step": 916,
"tokens/total": 3751936,
"tokens/train_per_sec_per_gpu": 15.97,
"tokens/trainable": 269061
},
{
"epoch": 4.366666666666666,
"grad_norm": 1.084816575050354,
"learning_rate": 1.2822966507177034e-06,
"loss": 0.11780587583780289,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12503,
"step": 917,
"tokens/total": 3756032,
"tokens/train_per_sec_per_gpu": 13.84,
"tokens/trainable": 269372
},
{
"epoch": 4.371428571428572,
"grad_norm": 0.7779732942581177,
"learning_rate": 1.2727272727272728e-06,
"loss": 0.05686868727207184,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05852,
"step": 918,
"tokens/total": 3760128,
"tokens/train_per_sec_per_gpu": 18.35,
"tokens/trainable": 269688
},
{
"epoch": 4.376190476190477,
"grad_norm": 0.9143884181976318,
"learning_rate": 1.2631578947368422e-06,
"loss": 0.09882701933383942,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.10388,
"step": 919,
"tokens/total": 3764224,
"tokens/train_per_sec_per_gpu": 9.97,
"tokens/trainable": 269928
},
{
"epoch": 4.380952380952381,
"grad_norm": 0.6440621018409729,
"learning_rate": 1.2535885167464116e-06,
"loss": 0.06907931715250015,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07152,
"step": 920,
"tokens/total": 3768320,
"tokens/train_per_sec_per_gpu": 8.54,
"tokens/trainable": 270210
},
{
"epoch": 4.385714285714286,
"grad_norm": 0.623343825340271,
"learning_rate": 1.244019138755981e-06,
"loss": 0.04787050187587738,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04903,
"step": 921,
"tokens/total": 3772416,
"tokens/train_per_sec_per_gpu": 18.3,
"tokens/trainable": 270518
},
{
"epoch": 4.390476190476191,
"grad_norm": 0.7467364072799683,
"learning_rate": 1.2344497607655504e-06,
"loss": 0.09561535716056824,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10034,
"step": 922,
"tokens/total": 3776512,
"tokens/train_per_sec_per_gpu": 12.71,
"tokens/trainable": 270840
},
{
"epoch": 4.395238095238096,
"grad_norm": 0.9190205931663513,
"learning_rate": 1.2248803827751197e-06,
"loss": 0.08941492438316345,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09353,
"step": 923,
"tokens/total": 3780608,
"tokens/train_per_sec_per_gpu": 8.22,
"tokens/trainable": 271119
},
{
"epoch": 4.4,
"grad_norm": 0.5284753441810608,
"learning_rate": 1.2153110047846891e-06,
"loss": 0.03509580343961716,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.03572,
"step": 924,
"tokens/total": 3784704,
"tokens/train_per_sec_per_gpu": 13.56,
"tokens/trainable": 271362
},
{
"epoch": 4.404761904761905,
"grad_norm": 0.5473824739456177,
"learning_rate": 1.2057416267942585e-06,
"loss": 0.05125536769628525,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05259,
"step": 925,
"tokens/total": 3788800,
"tokens/train_per_sec_per_gpu": 14.61,
"tokens/trainable": 271686
},
{
"epoch": 4.40952380952381,
"grad_norm": 1.2579742670059204,
"learning_rate": 1.196172248803828e-06,
"loss": 0.08550336956977844,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08927,
"step": 926,
"tokens/total": 3792896,
"tokens/train_per_sec_per_gpu": 10.65,
"tokens/trainable": 271921
},
{
"epoch": 4.414285714285715,
"grad_norm": 0.8119210600852966,
"learning_rate": 1.1866028708133973e-06,
"loss": 0.050820425152778625,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05213,
"step": 927,
"tokens/total": 3796992,
"tokens/train_per_sec_per_gpu": 13.34,
"tokens/trainable": 272202
},
{
"epoch": 4.419047619047619,
"grad_norm": 1.0827769041061401,
"learning_rate": 1.1770334928229667e-06,
"loss": 0.05972447246313095,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06154,
"step": 928,
"tokens/total": 3801088,
"tokens/train_per_sec_per_gpu": 8.32,
"tokens/trainable": 272383
},
{
"epoch": 4.423809523809524,
"grad_norm": 0.8947194218635559,
"learning_rate": 1.1674641148325359e-06,
"loss": 0.05553201586008072,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0571,
"step": 929,
"tokens/total": 3805184,
"tokens/train_per_sec_per_gpu": 19.59,
"tokens/trainable": 272752
},
{
"epoch": 4.428571428571429,
"grad_norm": 0.7170199155807495,
"learning_rate": 1.1578947368421053e-06,
"loss": 0.04184604808688164,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04273,
"step": 930,
"tokens/total": 3809280,
"tokens/train_per_sec_per_gpu": 8.74,
"tokens/trainable": 272976
},
{
"epoch": 4.433333333333334,
"grad_norm": 1.015012264251709,
"learning_rate": 1.1483253588516749e-06,
"loss": 0.0780593678355217,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08119,
"step": 931,
"tokens/total": 3813376,
"tokens/train_per_sec_per_gpu": 11.31,
"tokens/trainable": 273249
},
{
"epoch": 4.438095238095238,
"grad_norm": 1.1480745077133179,
"learning_rate": 1.1387559808612442e-06,
"loss": 0.0772227793931961,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08028,
"step": 932,
"tokens/total": 3817472,
"tokens/train_per_sec_per_gpu": 10.67,
"tokens/trainable": 273536
},
{
"epoch": 4.442857142857143,
"grad_norm": 0.8914026618003845,
"learning_rate": 1.1291866028708134e-06,
"loss": 0.07296346873044968,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07569,
"step": 933,
"tokens/total": 3821568,
"tokens/train_per_sec_per_gpu": 11.68,
"tokens/trainable": 273807
},
{
"epoch": 4.447619047619048,
"grad_norm": 0.8942100405693054,
"learning_rate": 1.1196172248803828e-06,
"loss": 0.08658169955015182,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09044,
"step": 934,
"tokens/total": 3825664,
"tokens/train_per_sec_per_gpu": 12.8,
"tokens/trainable": 274172
},
{
"epoch": 4.4523809523809526,
"grad_norm": 1.1007604598999023,
"learning_rate": 1.1100478468899522e-06,
"loss": 0.06864183396100998,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07105,
"step": 935,
"tokens/total": 3829760,
"tokens/train_per_sec_per_gpu": 15.13,
"tokens/trainable": 274444
},
{
"epoch": 4.457142857142857,
"grad_norm": 0.4325333833694458,
"learning_rate": 1.1004784688995216e-06,
"loss": 0.04357939213514328,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04454,
"step": 936,
"tokens/total": 3833856,
"tokens/train_per_sec_per_gpu": 15.79,
"tokens/trainable": 274747
},
{
"epoch": 4.461904761904762,
"grad_norm": 0.50846928358078,
"learning_rate": 1.090909090909091e-06,
"loss": 0.056326571851968765,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05794,
"step": 937,
"tokens/total": 3837952,
"tokens/train_per_sec_per_gpu": 18.0,
"tokens/trainable": 275170
},
{
"epoch": 4.466666666666667,
"grad_norm": 0.902732253074646,
"learning_rate": 1.0813397129186604e-06,
"loss": 0.08314196765422821,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0867,
"step": 938,
"tokens/total": 3842048,
"tokens/train_per_sec_per_gpu": 14.19,
"tokens/trainable": 275447
},
{
"epoch": 4.4714285714285715,
"grad_norm": 0.5584244132041931,
"learning_rate": 1.0717703349282298e-06,
"loss": 0.046742670238018036,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04785,
"step": 939,
"tokens/total": 3846144,
"tokens/train_per_sec_per_gpu": 14.61,
"tokens/trainable": 275764
},
{
"epoch": 4.476190476190476,
"grad_norm": 1.0716779232025146,
"learning_rate": 1.0622009569377991e-06,
"loss": 0.09255675226449966,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09698,
"step": 940,
"tokens/total": 3850240,
"tokens/train_per_sec_per_gpu": 15.53,
"tokens/trainable": 276084
},
{
"epoch": 4.480952380952381,
"grad_norm": 0.7877600193023682,
"learning_rate": 1.0526315789473685e-06,
"loss": 0.10746045410633087,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11345,
"step": 941,
"tokens/total": 3854336,
"tokens/train_per_sec_per_gpu": 8.73,
"tokens/trainable": 276350
},
{
"epoch": 4.485714285714286,
"grad_norm": 1.062591314315796,
"learning_rate": 1.043062200956938e-06,
"loss": 0.08260044455528259,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08611,
"step": 942,
"tokens/total": 3858432,
"tokens/train_per_sec_per_gpu": 10.62,
"tokens/trainable": 276609
},
{
"epoch": 4.4904761904761905,
"grad_norm": 0.6927638053894043,
"learning_rate": 1.0334928229665073e-06,
"loss": 0.0631960779428482,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06524,
"step": 943,
"tokens/total": 3862528,
"tokens/train_per_sec_per_gpu": 17.25,
"tokens/trainable": 276908
},
{
"epoch": 4.495238095238095,
"grad_norm": 0.8995664119720459,
"learning_rate": 1.0239234449760767e-06,
"loss": 0.0754055604338646,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07832,
"step": 944,
"tokens/total": 3866624,
"tokens/train_per_sec_per_gpu": 14.29,
"tokens/trainable": 277204
},
{
"epoch": 4.5,
"grad_norm": 0.8859362006187439,
"learning_rate": 1.0143540669856459e-06,
"loss": 0.055626533925533295,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0572,
"step": 945,
"tokens/total": 3870720,
"tokens/train_per_sec_per_gpu": 11.05,
"tokens/trainable": 277423
},
{
"epoch": 4.504761904761905,
"grad_norm": 0.8782649040222168,
"learning_rate": 1.0047846889952153e-06,
"loss": 0.09288754314184189,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09734,
"step": 946,
"tokens/total": 3874816,
"tokens/train_per_sec_per_gpu": 10.56,
"tokens/trainable": 277757
},
{
"epoch": 4.5095238095238095,
"grad_norm": 0.659194827079773,
"learning_rate": 9.952153110047849e-07,
"loss": 0.04952794313430786,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05077,
"step": 947,
"tokens/total": 3878912,
"tokens/train_per_sec_per_gpu": 8.6,
"tokens/trainable": 278007
},
{
"epoch": 4.514285714285714,
"grad_norm": 1.2036082744598389,
"learning_rate": 9.856459330143542e-07,
"loss": 0.04865410178899765,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04986,
"step": 948,
"tokens/total": 3883008,
"tokens/train_per_sec_per_gpu": 13.01,
"tokens/trainable": 278237
},
{
"epoch": 4.519047619047619,
"grad_norm": 1.022188663482666,
"learning_rate": 9.760765550239234e-07,
"loss": 0.047886140644550323,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04905,
"step": 949,
"tokens/total": 3887104,
"tokens/train_per_sec_per_gpu": 13.16,
"tokens/trainable": 278478
},
{
"epoch": 4.523809523809524,
"grad_norm": 0.8995653390884399,
"learning_rate": 9.665071770334928e-07,
"loss": 0.07380396127700806,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0766,
"step": 950,
"tokens/total": 3891200,
"tokens/train_per_sec_per_gpu": 12.28,
"tokens/trainable": 278724
},
{
"epoch": 4.5285714285714285,
"grad_norm": 0.575376033782959,
"learning_rate": 9.569377990430622e-07,
"loss": 0.06823279708623886,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07061,
"step": 951,
"tokens/total": 3895296,
"tokens/train_per_sec_per_gpu": 15.52,
"tokens/trainable": 279033
},
{
"epoch": 4.533333333333333,
"grad_norm": 0.8048670887947083,
"learning_rate": 9.473684210526317e-07,
"loss": 0.06816083192825317,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07054,
"step": 952,
"tokens/total": 3899392,
"tokens/train_per_sec_per_gpu": 12.93,
"tokens/trainable": 279375
},
{
"epoch": 4.538095238095238,
"grad_norm": 0.632183849811554,
"learning_rate": 9.377990430622011e-07,
"loss": 0.04872383549809456,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04993,
"step": 953,
"tokens/total": 3903488,
"tokens/train_per_sec_per_gpu": 16.35,
"tokens/trainable": 279690
},
{
"epoch": 4.542857142857143,
"grad_norm": 0.726702094078064,
"learning_rate": 9.282296650717704e-07,
"loss": 0.07586966454982758,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07882,
"step": 954,
"tokens/total": 3907584,
"tokens/train_per_sec_per_gpu": 13.98,
"tokens/trainable": 279979
},
{
"epoch": 4.5476190476190474,
"grad_norm": 0.8905826807022095,
"learning_rate": 9.186602870813398e-07,
"loss": 0.09619905799627304,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10098,
"step": 955,
"tokens/total": 3911680,
"tokens/train_per_sec_per_gpu": 12.9,
"tokens/trainable": 280347
},
{
"epoch": 4.552380952380952,
"grad_norm": 0.7705732583999634,
"learning_rate": 9.090909090909091e-07,
"loss": 0.10297220945358276,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10846,
"step": 956,
"tokens/total": 3915776,
"tokens/train_per_sec_per_gpu": 10.51,
"tokens/trainable": 280613
},
{
"epoch": 4.557142857142857,
"grad_norm": 0.5715165138244629,
"learning_rate": 8.995215311004786e-07,
"loss": 0.04614497721195221,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04723,
"step": 957,
"tokens/total": 3919872,
"tokens/train_per_sec_per_gpu": 12.49,
"tokens/trainable": 280909
},
{
"epoch": 4.561904761904762,
"grad_norm": 0.9987708330154419,
"learning_rate": 8.899521531100479e-07,
"loss": 0.11006547510623932,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.11635,
"step": 958,
"tokens/total": 3923968,
"tokens/train_per_sec_per_gpu": 17.97,
"tokens/trainable": 281231
},
{
"epoch": 4.566666666666666,
"grad_norm": 0.42405691742897034,
"learning_rate": 8.803827751196173e-07,
"loss": 0.03897266089916229,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.03974,
"step": 959,
"tokens/total": 3928064,
"tokens/train_per_sec_per_gpu": 11.36,
"tokens/trainable": 281480
},
{
"epoch": 4.571428571428571,
"grad_norm": 1.079932451248169,
"learning_rate": 8.708133971291867e-07,
"loss": 0.09699150174856186,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10185,
"step": 960,
"tokens/total": 3932160,
"tokens/train_per_sec_per_gpu": 21.27,
"tokens/trainable": 281819
},
{
"epoch": 4.576190476190476,
"grad_norm": 0.5439162254333496,
"learning_rate": 8.612440191387561e-07,
"loss": 0.0659247413277626,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06815,
"step": 961,
"tokens/total": 3936256,
"tokens/train_per_sec_per_gpu": 13.75,
"tokens/trainable": 282164
},
{
"epoch": 4.580952380952381,
"grad_norm": 0.8237618803977966,
"learning_rate": 8.516746411483254e-07,
"loss": 0.08178961277008057,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08523,
"step": 962,
"tokens/total": 3940352,
"tokens/train_per_sec_per_gpu": 9.45,
"tokens/trainable": 282383
},
{
"epoch": 4.585714285714285,
"grad_norm": 0.5932995080947876,
"learning_rate": 8.421052631578948e-07,
"loss": 0.0472625270485878,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0484,
"step": 963,
"tokens/total": 3944448,
"tokens/train_per_sec_per_gpu": 11.99,
"tokens/trainable": 282631
},
{
"epoch": 4.59047619047619,
"grad_norm": 0.6871050000190735,
"learning_rate": 8.325358851674641e-07,
"loss": 0.07640991359949112,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0794,
"step": 964,
"tokens/total": 3948544,
"tokens/train_per_sec_per_gpu": 12.59,
"tokens/trainable": 282857
},
{
"epoch": 4.595238095238095,
"grad_norm": 0.7261757850646973,
"learning_rate": 8.229665071770336e-07,
"loss": 0.05905777961015701,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06084,
"step": 965,
"tokens/total": 3952640,
"tokens/train_per_sec_per_gpu": 15.62,
"tokens/trainable": 283162
},
{
"epoch": 4.6,
"grad_norm": 0.897055447101593,
"learning_rate": 8.133971291866029e-07,
"loss": 0.0663570985198021,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06861,
"step": 966,
"tokens/total": 3956736,
"tokens/train_per_sec_per_gpu": 10.57,
"tokens/trainable": 283396
},
{
"epoch": 4.604761904761904,
"grad_norm": 0.5905396342277527,
"learning_rate": 8.038277511961723e-07,
"loss": 0.05556555464863777,
"memory/device_reserved (GiB)": 39.19,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05714,
"step": 967,
"tokens/total": 3960832,
"tokens/train_per_sec_per_gpu": 16.93,
"tokens/trainable": 283725
},
{
"epoch": 4.609523809523809,
"grad_norm": 0.4669351875782013,
"learning_rate": 7.942583732057417e-07,
"loss": 0.048831816762685776,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.57,
"memory/max_allocated (GiB)": 38.57,
"ppl": 1.05004,
"step": 968,
"tokens/total": 3964928,
"tokens/train_per_sec_per_gpu": 26.39,
"tokens/trainable": 284224
},
{
"epoch": 4.614285714285714,
"grad_norm": 0.5662763714790344,
"learning_rate": 7.846889952153111e-07,
"loss": 0.0546397939324379,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05616,
"step": 969,
"tokens/total": 3969024,
"tokens/train_per_sec_per_gpu": 18.62,
"tokens/trainable": 284553
},
{
"epoch": 4.619047619047619,
"grad_norm": 0.7985778450965881,
"learning_rate": 7.751196172248804e-07,
"loss": 0.0845763310790062,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08826,
"step": 970,
"tokens/total": 3973120,
"tokens/train_per_sec_per_gpu": 9.05,
"tokens/trainable": 284758
},
{
"epoch": 4.623809523809523,
"grad_norm": 0.6422544717788696,
"learning_rate": 7.655502392344498e-07,
"loss": 0.0869225338101387,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09081,
"step": 971,
"tokens/total": 3977216,
"tokens/train_per_sec_per_gpu": 19.71,
"tokens/trainable": 285169
},
{
"epoch": 4.628571428571428,
"grad_norm": 0.7870466113090515,
"learning_rate": 7.559808612440192e-07,
"loss": 0.09116926789283752,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09545,
"step": 972,
"tokens/total": 3981312,
"tokens/train_per_sec_per_gpu": 13.42,
"tokens/trainable": 285429
},
{
"epoch": 4.633333333333333,
"grad_norm": 0.5808945894241333,
"learning_rate": 7.464114832535886e-07,
"loss": 0.07630980759859085,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0793,
"step": 973,
"tokens/total": 3985408,
"tokens/train_per_sec_per_gpu": 17.25,
"tokens/trainable": 285864
},
{
"epoch": 4.638095238095238,
"grad_norm": 0.5704347491264343,
"learning_rate": 7.368421052631579e-07,
"loss": 0.06161660701036453,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06355,
"step": 974,
"tokens/total": 3989504,
"tokens/train_per_sec_per_gpu": 12.91,
"tokens/trainable": 286193
},
{
"epoch": 4.642857142857143,
"grad_norm": 0.4083561897277832,
"learning_rate": 7.272727272727273e-07,
"loss": 0.04932102560997009,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05056,
"step": 975,
"tokens/total": 3993600,
"tokens/train_per_sec_per_gpu": 17.5,
"tokens/trainable": 286572
},
{
"epoch": 4.647619047619048,
"grad_norm": 0.7787036895751953,
"learning_rate": 7.177033492822967e-07,
"loss": 0.0850168764591217,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08874,
"step": 976,
"tokens/total": 3997696,
"tokens/train_per_sec_per_gpu": 18.18,
"tokens/trainable": 286900
},
{
"epoch": 4.652380952380953,
"grad_norm": 0.7790368795394897,
"learning_rate": 7.081339712918661e-07,
"loss": 0.08561737090349197,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08939,
"step": 977,
"tokens/total": 4001792,
"tokens/train_per_sec_per_gpu": 10.6,
"tokens/trainable": 287213
},
{
"epoch": 4.6571428571428575,
"grad_norm": 0.725902795791626,
"learning_rate": 6.985645933014355e-07,
"loss": 0.04747258126735687,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04862,
"step": 978,
"tokens/total": 4005888,
"tokens/train_per_sec_per_gpu": 12.51,
"tokens/trainable": 287508
},
{
"epoch": 4.661904761904762,
"grad_norm": 0.5647050142288208,
"learning_rate": 6.889952153110048e-07,
"loss": 0.04467792436480522,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04569,
"step": 979,
"tokens/total": 4009984,
"tokens/train_per_sec_per_gpu": 9.26,
"tokens/trainable": 287738
},
{
"epoch": 4.666666666666667,
"grad_norm": 0.7799670696258545,
"learning_rate": 6.794258373205743e-07,
"loss": 0.06656090170145035,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06883,
"step": 980,
"tokens/total": 4014080,
"tokens/train_per_sec_per_gpu": 15.49,
"tokens/trainable": 288091
},
{
"epoch": 4.671428571428572,
"grad_norm": 0.8358564376831055,
"learning_rate": 6.698564593301436e-07,
"loss": 0.07533138990402222,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07824,
"step": 981,
"tokens/total": 4018176,
"tokens/train_per_sec_per_gpu": 28.76,
"tokens/trainable": 288533
},
{
"epoch": 4.6761904761904765,
"grad_norm": 0.6379777789115906,
"learning_rate": 6.60287081339713e-07,
"loss": 0.054609671235084534,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05613,
"step": 982,
"tokens/total": 4022272,
"tokens/train_per_sec_per_gpu": 18.17,
"tokens/trainable": 288821
},
{
"epoch": 4.680952380952381,
"grad_norm": 0.8028697371482849,
"learning_rate": 6.507177033492823e-07,
"loss": 0.0740557312965393,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07687,
"step": 983,
"tokens/total": 4026368,
"tokens/train_per_sec_per_gpu": 13.12,
"tokens/trainable": 289092
},
{
"epoch": 4.685714285714286,
"grad_norm": 0.9271824955940247,
"learning_rate": 6.411483253588517e-07,
"loss": 0.09886521100997925,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10392,
"step": 984,
"tokens/total": 4030464,
"tokens/train_per_sec_per_gpu": 10.96,
"tokens/trainable": 289321
},
{
"epoch": 4.690476190476191,
"grad_norm": 0.7451408505439758,
"learning_rate": 6.315789473684211e-07,
"loss": 0.04617952182888985,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04726,
"step": 985,
"tokens/total": 4034560,
"tokens/train_per_sec_per_gpu": 11.97,
"tokens/trainable": 289574
},
{
"epoch": 4.695238095238095,
"grad_norm": 0.8016191720962524,
"learning_rate": 6.220095693779905e-07,
"loss": 0.061083678156137466,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06299,
"step": 986,
"tokens/total": 4038656,
"tokens/train_per_sec_per_gpu": 10.8,
"tokens/trainable": 289835
},
{
"epoch": 4.7,
"grad_norm": 0.5138081312179565,
"learning_rate": 6.124401913875599e-07,
"loss": 0.04855319485068321,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04975,
"step": 987,
"tokens/total": 4042752,
"tokens/train_per_sec_per_gpu": 14.26,
"tokens/trainable": 290171
},
{
"epoch": 4.704761904761905,
"grad_norm": 0.35503482818603516,
"learning_rate": 6.028708133971293e-07,
"loss": 0.025968704372644424,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.02631,
"step": 988,
"tokens/total": 4046848,
"tokens/train_per_sec_per_gpu": 13.11,
"tokens/trainable": 290471
},
{
"epoch": 4.70952380952381,
"grad_norm": 1.100373387336731,
"learning_rate": 5.933014354066987e-07,
"loss": 0.05797182768583298,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05969,
"step": 989,
"tokens/total": 4050944,
"tokens/train_per_sec_per_gpu": 17.54,
"tokens/trainable": 290763
},
{
"epoch": 4.714285714285714,
"grad_norm": 0.679127037525177,
"learning_rate": 5.837320574162679e-07,
"loss": 0.041285596787929535,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04215,
"step": 990,
"tokens/total": 4055040,
"tokens/train_per_sec_per_gpu": 11.44,
"tokens/trainable": 291038
},
{
"epoch": 4.719047619047619,
"grad_norm": 0.6147889494895935,
"learning_rate": 5.741626794258374e-07,
"loss": 0.04121209308505058,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04207,
"step": 991,
"tokens/total": 4059136,
"tokens/train_per_sec_per_gpu": 12.09,
"tokens/trainable": 291278
},
{
"epoch": 4.723809523809524,
"grad_norm": 0.8105634450912476,
"learning_rate": 5.645933014354067e-07,
"loss": 0.06966257840394974,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07215,
"step": 992,
"tokens/total": 4063232,
"tokens/train_per_sec_per_gpu": 12.89,
"tokens/trainable": 291563
},
{
"epoch": 4.728571428571429,
"grad_norm": 0.5204731822013855,
"learning_rate": 5.550239234449761e-07,
"loss": 0.055574752390384674,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05715,
"step": 993,
"tokens/total": 4067328,
"tokens/train_per_sec_per_gpu": 11.17,
"tokens/trainable": 291921
},
{
"epoch": 4.733333333333333,
"grad_norm": 1.142088770866394,
"learning_rate": 5.454545454545455e-07,
"loss": 0.09287901967763901,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09733,
"step": 994,
"tokens/total": 4071424,
"tokens/train_per_sec_per_gpu": 13.94,
"tokens/trainable": 292187
},
{
"epoch": 4.738095238095238,
"grad_norm": 0.5879678726196289,
"learning_rate": 5.358851674641149e-07,
"loss": 0.04538918659090996,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04644,
"step": 995,
"tokens/total": 4075520,
"tokens/train_per_sec_per_gpu": 9.32,
"tokens/trainable": 292429
},
{
"epoch": 4.742857142857143,
"grad_norm": 0.6333562135696411,
"learning_rate": 5.263157894736843e-07,
"loss": 0.05799243599176407,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.05971,
"step": 996,
"tokens/total": 4079616,
"tokens/train_per_sec_per_gpu": 13.4,
"tokens/trainable": 292716
},
{
"epoch": 4.747619047619048,
"grad_norm": 0.4939824342727661,
"learning_rate": 5.167464114832537e-07,
"loss": 0.042676541954278946,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0436,
"step": 997,
"tokens/total": 4083712,
"tokens/train_per_sec_per_gpu": 12.45,
"tokens/trainable": 293041
},
{
"epoch": 4.752380952380952,
"grad_norm": 0.7977603673934937,
"learning_rate": 5.071770334928229e-07,
"loss": 0.06747094541788101,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0698,
"step": 998,
"tokens/total": 4087808,
"tokens/train_per_sec_per_gpu": 12.58,
"tokens/trainable": 293352
},
{
"epoch": 4.757142857142857,
"grad_norm": 0.7418789863586426,
"learning_rate": 4.976076555023924e-07,
"loss": 0.07924629002809525,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.08247,
"step": 999,
"tokens/total": 4091904,
"tokens/train_per_sec_per_gpu": 16.42,
"tokens/trainable": 293763
},
{
"epoch": 4.761904761904762,
"grad_norm": 0.8634079098701477,
"learning_rate": 4.880382775119617e-07,
"loss": 0.06551891565322876,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06771,
"step": 1000,
"tokens/total": 4096000,
"tokens/train_per_sec_per_gpu": 13.6,
"tokens/trainable": 294007
},
{
"epoch": 4.766666666666667,
"grad_norm": 0.9717041850090027,
"learning_rate": 4.784688995215311e-07,
"loss": 0.11543455719947815,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.12236,
"step": 1001,
"tokens/total": 4100096,
"tokens/train_per_sec_per_gpu": 10.13,
"tokens/trainable": 294235
},
{
"epoch": 4.771428571428571,
"grad_norm": 0.6794291138648987,
"learning_rate": 4.6889952153110054e-07,
"loss": 0.06426049023866653,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06637,
"step": 1002,
"tokens/total": 4104192,
"tokens/train_per_sec_per_gpu": 9.06,
"tokens/trainable": 294445
},
{
"epoch": 4.776190476190476,
"grad_norm": 0.9054945707321167,
"learning_rate": 4.593301435406699e-07,
"loss": 0.07165690511465073,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07429,
"step": 1003,
"tokens/total": 4108288,
"tokens/train_per_sec_per_gpu": 13.8,
"tokens/trainable": 294722
},
{
"epoch": 4.780952380952381,
"grad_norm": 0.8471719622612,
"learning_rate": 4.497607655502393e-07,
"loss": 0.0860835611820221,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.0899,
"step": 1004,
"tokens/total": 4112384,
"tokens/train_per_sec_per_gpu": 15.63,
"tokens/trainable": 295030
},
{
"epoch": 4.785714285714286,
"grad_norm": 0.4434499144554138,
"learning_rate": 4.4019138755980866e-07,
"loss": 0.036177873611450195,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.03684,
"step": 1005,
"tokens/total": 4116480,
"tokens/train_per_sec_per_gpu": 12.9,
"tokens/trainable": 295290
},
{
"epoch": 4.79047619047619,
"grad_norm": 0.6867081522941589,
"learning_rate": 4.3062200956937804e-07,
"loss": 0.07819761335849762,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08134,
"step": 1006,
"tokens/total": 4120576,
"tokens/train_per_sec_per_gpu": 14.01,
"tokens/trainable": 295572
},
{
"epoch": 4.795238095238095,
"grad_norm": 0.869951069355011,
"learning_rate": 4.210526315789474e-07,
"loss": 0.047713182866573334,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04887,
"step": 1007,
"tokens/total": 4124672,
"tokens/train_per_sec_per_gpu": 12.37,
"tokens/trainable": 295799
},
{
"epoch": 4.8,
"grad_norm": 0.4378795921802521,
"learning_rate": 4.114832535885168e-07,
"loss": 0.05229447782039642,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05369,
"step": 1008,
"tokens/total": 4128768,
"tokens/train_per_sec_per_gpu": 27.47,
"tokens/trainable": 296186
},
{
"epoch": 4.804761904761905,
"grad_norm": 0.7369760870933533,
"learning_rate": 4.0191387559808616e-07,
"loss": 0.044564686715602875,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04557,
"step": 1009,
"tokens/total": 4132864,
"tokens/train_per_sec_per_gpu": 9.89,
"tokens/trainable": 296474
},
{
"epoch": 4.809523809523809,
"grad_norm": 0.7173194289207458,
"learning_rate": 3.9234449760765555e-07,
"loss": 0.05833519622683525,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06007,
"step": 1010,
"tokens/total": 4136960,
"tokens/train_per_sec_per_gpu": 11.28,
"tokens/trainable": 296730
},
{
"epoch": 4.814285714285714,
"grad_norm": 0.5104710459709167,
"learning_rate": 3.827751196172249e-07,
"loss": 0.0309146698564291,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0314,
"step": 1011,
"tokens/total": 4141056,
"tokens/train_per_sec_per_gpu": 10.74,
"tokens/trainable": 296960
},
{
"epoch": 4.819047619047619,
"grad_norm": 0.835244357585907,
"learning_rate": 3.732057416267943e-07,
"loss": 0.06693878769874573,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06923,
"step": 1012,
"tokens/total": 4145152,
"tokens/train_per_sec_per_gpu": 11.61,
"tokens/trainable": 297187
},
{
"epoch": 4.8238095238095235,
"grad_norm": 0.8610392808914185,
"learning_rate": 3.6363636363636366e-07,
"loss": 0.05454925820231438,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05606,
"step": 1013,
"tokens/total": 4149248,
"tokens/train_per_sec_per_gpu": 14.69,
"tokens/trainable": 297538
},
{
"epoch": 4.828571428571428,
"grad_norm": 0.8053697943687439,
"learning_rate": 3.5406698564593305e-07,
"loss": 0.059003330767154694,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06078,
"step": 1014,
"tokens/total": 4153344,
"tokens/train_per_sec_per_gpu": 10.53,
"tokens/trainable": 297788
},
{
"epoch": 4.833333333333333,
"grad_norm": 0.8027690649032593,
"learning_rate": 3.444976076555024e-07,
"loss": 0.06386961042881012,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06595,
"step": 1015,
"tokens/total": 4157440,
"tokens/train_per_sec_per_gpu": 12.25,
"tokens/trainable": 298051
},
{
"epoch": 4.838095238095238,
"grad_norm": 0.5434281229972839,
"learning_rate": 3.349282296650718e-07,
"loss": 0.06257535517215729,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.06457,
"step": 1016,
"tokens/total": 4161536,
"tokens/train_per_sec_per_gpu": 18.94,
"tokens/trainable": 298439
},
{
"epoch": 4.8428571428571425,
"grad_norm": 0.8059958219528198,
"learning_rate": 3.2535885167464116e-07,
"loss": 0.080122210085392,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.08342,
"step": 1017,
"tokens/total": 4165632,
"tokens/train_per_sec_per_gpu": 15.14,
"tokens/trainable": 298717
},
{
"epoch": 4.847619047619047,
"grad_norm": 0.7690683603286743,
"learning_rate": 3.1578947368421055e-07,
"loss": 0.04988192766904831,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05115,
"step": 1018,
"tokens/total": 4169728,
"tokens/train_per_sec_per_gpu": 10.57,
"tokens/trainable": 298919
},
{
"epoch": 4.852380952380952,
"grad_norm": 1.0210976600646973,
"learning_rate": 3.0622009569377994e-07,
"loss": 0.07849578559398651,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.08166,
"step": 1019,
"tokens/total": 4173824,
"tokens/train_per_sec_per_gpu": 11.01,
"tokens/trainable": 299160
},
{
"epoch": 4.857142857142857,
"grad_norm": 0.9019124507904053,
"learning_rate": 2.966507177033493e-07,
"loss": 0.09448347240686417,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.09909,
"step": 1020,
"tokens/total": 4177920,
"tokens/train_per_sec_per_gpu": 16.98,
"tokens/trainable": 299460
},
{
"epoch": 4.861904761904762,
"grad_norm": 0.8207787275314331,
"learning_rate": 2.870813397129187e-07,
"loss": 0.049627967178821564,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05088,
"step": 1021,
"tokens/total": 4182016,
"tokens/train_per_sec_per_gpu": 11.28,
"tokens/trainable": 299738
},
{
"epoch": 4.866666666666667,
"grad_norm": 0.6081165671348572,
"learning_rate": 2.7751196172248805e-07,
"loss": 0.05352705717086792,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05499,
"step": 1022,
"tokens/total": 4186112,
"tokens/train_per_sec_per_gpu": 9.65,
"tokens/trainable": 300042
},
{
"epoch": 4.871428571428572,
"grad_norm": 1.1343626976013184,
"learning_rate": 2.6794258373205744e-07,
"loss": 0.06644172966480255,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0687,
"step": 1023,
"tokens/total": 4190208,
"tokens/train_per_sec_per_gpu": 13.68,
"tokens/trainable": 300285
},
{
"epoch": 4.876190476190477,
"grad_norm": 0.8928014636039734,
"learning_rate": 2.5837320574162683e-07,
"loss": 0.08010731637477875,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0834,
"step": 1024,
"tokens/total": 4194304,
"tokens/train_per_sec_per_gpu": 21.81,
"tokens/trainable": 300641
},
{
"epoch": 4.880952380952381,
"grad_norm": 1.156931757926941,
"learning_rate": 2.488038277511962e-07,
"loss": 0.11981767416000366,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.12729,
"step": 1025,
"tokens/total": 4198400,
"tokens/train_per_sec_per_gpu": 9.24,
"tokens/trainable": 300918
},
{
"epoch": 4.885714285714286,
"grad_norm": 0.6716881990432739,
"learning_rate": 2.3923444976076555e-07,
"loss": 0.06406470388174057,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06616,
"step": 1026,
"tokens/total": 4202496,
"tokens/train_per_sec_per_gpu": 11.3,
"tokens/trainable": 301204
},
{
"epoch": 4.890476190476191,
"grad_norm": 1.2062376737594604,
"learning_rate": 2.2966507177033494e-07,
"loss": 0.09758275747299194,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.1025,
"step": 1027,
"tokens/total": 4206592,
"tokens/train_per_sec_per_gpu": 15.1,
"tokens/trainable": 301487
},
{
"epoch": 4.895238095238096,
"grad_norm": 0.7098796367645264,
"learning_rate": 2.2009569377990433e-07,
"loss": 0.06214335933327675,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.56,
"memory/max_allocated (GiB)": 38.56,
"ppl": 1.06411,
"step": 1028,
"tokens/total": 4210688,
"tokens/train_per_sec_per_gpu": 12.37,
"tokens/trainable": 301759
},
{
"epoch": 4.9,
"grad_norm": 1.2185698747634888,
"learning_rate": 2.105263157894737e-07,
"loss": 0.04552961885929108,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04658,
"step": 1029,
"tokens/total": 4214784,
"tokens/train_per_sec_per_gpu": 13.94,
"tokens/trainable": 302032
},
{
"epoch": 4.904761904761905,
"grad_norm": 0.7723051309585571,
"learning_rate": 2.0095693779904308e-07,
"loss": 0.07359997183084488,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07638,
"step": 1030,
"tokens/total": 4218880,
"tokens/train_per_sec_per_gpu": 9.81,
"tokens/trainable": 302240
},
{
"epoch": 4.90952380952381,
"grad_norm": 0.46518200635910034,
"learning_rate": 1.9138755980861244e-07,
"loss": 0.04536569491028786,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04641,
"step": 1031,
"tokens/total": 4222976,
"tokens/train_per_sec_per_gpu": 11.09,
"tokens/trainable": 302490
},
{
"epoch": 4.914285714285715,
"grad_norm": 0.6671316027641296,
"learning_rate": 1.8181818181818183e-07,
"loss": 0.056834738701581955,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.05848,
"step": 1032,
"tokens/total": 4227072,
"tokens/train_per_sec_per_gpu": 13.99,
"tokens/trainable": 302851
},
{
"epoch": 4.919047619047619,
"grad_norm": 0.7634382843971252,
"learning_rate": 1.722488038277512e-07,
"loss": 0.08143440634012222,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.08484,
"step": 1033,
"tokens/total": 4231168,
"tokens/train_per_sec_per_gpu": 14.69,
"tokens/trainable": 303195
},
{
"epoch": 4.923809523809524,
"grad_norm": 0.6088545322418213,
"learning_rate": 1.6267942583732058e-07,
"loss": 0.04300892725586891,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04395,
"step": 1034,
"tokens/total": 4235264,
"tokens/train_per_sec_per_gpu": 13.65,
"tokens/trainable": 303486
},
{
"epoch": 4.928571428571429,
"grad_norm": 0.6581453084945679,
"learning_rate": 1.5311004784688997e-07,
"loss": 0.04637235030531883,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04746,
"step": 1035,
"tokens/total": 4239360,
"tokens/train_per_sec_per_gpu": 12.31,
"tokens/trainable": 303779
},
{
"epoch": 4.933333333333334,
"grad_norm": 0.7005976438522339,
"learning_rate": 1.4354066985645936e-07,
"loss": 0.04131925106048584,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04218,
"step": 1036,
"tokens/total": 4243456,
"tokens/train_per_sec_per_gpu": 12.64,
"tokens/trainable": 304030
},
{
"epoch": 4.938095238095238,
"grad_norm": 0.7025570869445801,
"learning_rate": 1.3397129186602872e-07,
"loss": 0.07363530248403549,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07641,
"step": 1037,
"tokens/total": 4247552,
"tokens/train_per_sec_per_gpu": 10.85,
"tokens/trainable": 304345
},
{
"epoch": 4.942857142857143,
"grad_norm": 0.7544583082199097,
"learning_rate": 1.244019138755981e-07,
"loss": 0.07454663515090942,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.0774,
"step": 1038,
"tokens/total": 4251648,
"tokens/train_per_sec_per_gpu": 12.9,
"tokens/trainable": 304695
},
{
"epoch": 4.947619047619048,
"grad_norm": 0.9128358960151672,
"learning_rate": 1.1483253588516747e-07,
"loss": 0.10159115493297577,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.10693,
"step": 1039,
"tokens/total": 4255744,
"tokens/train_per_sec_per_gpu": 12.82,
"tokens/trainable": 304963
},
{
"epoch": 4.9523809523809526,
"grad_norm": 1.099030613899231,
"learning_rate": 1.0526315789473685e-07,
"loss": 0.06357499212026596,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06564,
"step": 1040,
"tokens/total": 4259840,
"tokens/train_per_sec_per_gpu": 13.67,
"tokens/trainable": 305303
},
{
"epoch": 4.957142857142857,
"grad_norm": 0.7283017635345459,
"learning_rate": 9.569377990430622e-08,
"loss": 0.045570287853479385,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.04662,
"step": 1041,
"tokens/total": 4263936,
"tokens/train_per_sec_per_gpu": 13.28,
"tokens/trainable": 305575
},
{
"epoch": 4.961904761904762,
"grad_norm": 0.6875465512275696,
"learning_rate": 8.61244019138756e-08,
"loss": 0.05585762858390808,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.05745,
"step": 1042,
"tokens/total": 4268032,
"tokens/train_per_sec_per_gpu": 7.66,
"tokens/trainable": 305801
},
{
"epoch": 4.966666666666667,
"grad_norm": 0.6573634743690491,
"learning_rate": 7.655502392344498e-08,
"loss": 0.039641834795475006,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.04044,
"step": 1043,
"tokens/total": 4272128,
"tokens/train_per_sec_per_gpu": 13.86,
"tokens/trainable": 306125
},
{
"epoch": 4.9714285714285715,
"grad_norm": 1.2348220348358154,
"learning_rate": 6.698564593301436e-08,
"loss": 0.10564305633306503,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.11143,
"step": 1044,
"tokens/total": 4276224,
"tokens/train_per_sec_per_gpu": 11.01,
"tokens/trainable": 306376
},
{
"epoch": 4.976190476190476,
"grad_norm": 0.8296716213226318,
"learning_rate": 5.7416267942583735e-08,
"loss": 0.09174297004938126,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.09608,
"step": 1045,
"tokens/total": 4280320,
"tokens/train_per_sec_per_gpu": 13.93,
"tokens/trainable": 306707
},
{
"epoch": 4.980952380952381,
"grad_norm": 0.3389149010181427,
"learning_rate": 4.784688995215311e-08,
"loss": 0.04257689043879509,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.0435,
"step": 1046,
"tokens/total": 4284416,
"tokens/train_per_sec_per_gpu": 14.2,
"tokens/trainable": 307068
},
{
"epoch": 4.985714285714286,
"grad_norm": 0.8198398947715759,
"learning_rate": 3.827751196172249e-08,
"loss": 0.060687679797410965,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.06257,
"step": 1047,
"tokens/total": 4288512,
"tokens/train_per_sec_per_gpu": 13.78,
"tokens/trainable": 307341
},
{
"epoch": 4.9904761904761905,
"grad_norm": 0.6749662756919861,
"learning_rate": 2.8708133971291867e-08,
"loss": 0.06978276371955872,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.55,
"memory/max_allocated (GiB)": 38.55,
"ppl": 1.07228,
"step": 1048,
"tokens/total": 4292608,
"tokens/train_per_sec_per_gpu": 11.42,
"tokens/trainable": 307636
},
{
"epoch": 4.995238095238095,
"grad_norm": 0.9570760726928711,
"learning_rate": 1.9138755980861246e-08,
"loss": 0.06977870315313339,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07227,
"step": 1049,
"tokens/total": 4296704,
"tokens/train_per_sec_per_gpu": 11.68,
"tokens/trainable": 307883
},
{
"epoch": 5.0,
"grad_norm": 0.903021514415741,
"learning_rate": 9.569377990430623e-09,
"loss": 0.06990804523229599,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 38.54,
"memory/max_allocated (GiB)": 38.54,
"ppl": 1.07241,
"step": 1050,
"tokens/total": 4300800,
"tokens/train_per_sec_per_gpu": 10.28,
"tokens/trainable": 308124
},
{
"epoch": 5.0,
"eval_loss": 0.07747567445039749,
"eval_ppl": 1.08056,
"eval_runtime": 10.3083,
"eval_samples_per_second": 8.634,
"eval_steps_per_second": 2.231,
"memory/device_reserved (GiB)": 39.21,
"memory/max_active (GiB)": 35.58,
"memory/max_allocated (GiB)": 35.58,
"step": 1050
}
],
"logging_steps": 1,
"max_steps": 1050,
"num_input_tokens_seen": 0,
"num_train_epochs": 5,
"save_steps": 210,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 7.76947906904064e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}