alexiaassis's picture
Upload folder using huggingface_hub
eaa0037 verified
Raw
History Blame Contribute Delete
22.4 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 6.41334768568353,
"eval_steps": 500,
"global_step": 750,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0861141011840689,
"grad_norm": 21.438983917236328,
"learning_rate": 6.749999999999999e-06,
"loss": 5.3584,
"num_input_tokens_seen": 106432,
"step": 10,
"train_runtime": 108.6693,
"train_tokens_per_second": 979.412
},
{
"epoch": 0.1722282023681378,
"grad_norm": 8.519647598266602,
"learning_rate": 1.4249999999999999e-05,
"loss": 4.8538,
"num_input_tokens_seen": 213216,
"step": 20,
"train_runtime": 186.9434,
"train_tokens_per_second": 1140.538
},
{
"epoch": 0.25834230355220666,
"grad_norm": 18.737985610961914,
"learning_rate": 2.1749999999999997e-05,
"loss": 3.6236,
"num_input_tokens_seen": 319264,
"step": 30,
"train_runtime": 265.2215,
"train_tokens_per_second": 1203.763
},
{
"epoch": 0.3444564047362756,
"grad_norm": 4.311729431152344,
"learning_rate": 2.925e-05,
"loss": 2.4654,
"num_input_tokens_seen": 426464,
"step": 40,
"train_runtime": 343.9109,
"train_tokens_per_second": 1240.042
},
{
"epoch": 0.43057050592034446,
"grad_norm": 2.5902934074401855,
"learning_rate": 3.675e-05,
"loss": 2.0086,
"num_input_tokens_seen": 532576,
"step": 50,
"train_runtime": 421.9835,
"train_tokens_per_second": 1262.078
},
{
"epoch": 0.5166846071044133,
"grad_norm": 3.0768535137176514,
"learning_rate": 4.424999999999999e-05,
"loss": 1.878,
"num_input_tokens_seen": 639584,
"step": 60,
"train_runtime": 500.5067,
"train_tokens_per_second": 1277.873
},
{
"epoch": 0.6027987082884823,
"grad_norm": 2.4493396282196045,
"learning_rate": 5.174999999999999e-05,
"loss": 1.8546,
"num_input_tokens_seen": 747360,
"step": 70,
"train_runtime": 579.1392,
"train_tokens_per_second": 1290.467
},
{
"epoch": 0.6889128094725512,
"grad_norm": 2.146406650543213,
"learning_rate": 5.925e-05,
"loss": 1.8364,
"num_input_tokens_seen": 854304,
"step": 80,
"train_runtime": 657.8931,
"train_tokens_per_second": 1298.545
},
{
"epoch": 0.77502691065662,
"grad_norm": 2.2075250148773193,
"learning_rate": 6.675e-05,
"loss": 1.8027,
"num_input_tokens_seen": 962816,
"step": 90,
"train_runtime": 737.8649,
"train_tokens_per_second": 1304.868
},
{
"epoch": 0.8611410118406889,
"grad_norm": 0.9837085008621216,
"learning_rate": 7.424999999999999e-05,
"loss": 1.7782,
"num_input_tokens_seen": 1070240,
"step": 100,
"train_runtime": 817.3738,
"train_tokens_per_second": 1309.364
},
{
"epoch": 0.9472551130247578,
"grad_norm": 3.0224859714508057,
"learning_rate": 8.175e-05,
"loss": 1.7681,
"num_input_tokens_seen": 1175840,
"step": 110,
"train_runtime": 895.639,
"train_tokens_per_second": 1312.85
},
{
"epoch": 1.0258342303552206,
"grad_norm": 1.015479326248169,
"learning_rate": 8.924999999999999e-05,
"loss": 1.5944,
"num_input_tokens_seen": 1273184,
"step": 120,
"train_runtime": 967.2081,
"train_tokens_per_second": 1316.35
},
{
"epoch": 1.1119483315392895,
"grad_norm": 1.2177729606628418,
"learning_rate": 9.675e-05,
"loss": 1.7489,
"num_input_tokens_seen": 1380480,
"step": 130,
"train_runtime": 1045.876,
"train_tokens_per_second": 1319.927
},
{
"epoch": 1.1980624327233584,
"grad_norm": 1.6441470384597778,
"learning_rate": 0.00010424999999999999,
"loss": 1.7265,
"num_input_tokens_seen": 1487520,
"step": 140,
"train_runtime": 1124.3621,
"train_tokens_per_second": 1322.99
},
{
"epoch": 1.2841765339074274,
"grad_norm": 1.1657848358154297,
"learning_rate": 0.00011174999999999999,
"loss": 1.7386,
"num_input_tokens_seen": 1593472,
"step": 150,
"train_runtime": 1202.4025,
"train_tokens_per_second": 1325.24
},
{
"epoch": 1.3702906350914963,
"grad_norm": 1.1126108169555664,
"learning_rate": 0.00011925,
"loss": 1.7229,
"num_input_tokens_seen": 1700288,
"step": 160,
"train_runtime": 1280.6844,
"train_tokens_per_second": 1327.64
},
{
"epoch": 1.456404736275565,
"grad_norm": 1.3799711465835571,
"learning_rate": 0.00012675,
"loss": 1.7513,
"num_input_tokens_seen": 1807488,
"step": 170,
"train_runtime": 1359.2569,
"train_tokens_per_second": 1329.762
},
{
"epoch": 1.542518837459634,
"grad_norm": 1.2127066850662231,
"learning_rate": 0.00013424999999999998,
"loss": 1.7105,
"num_input_tokens_seen": 1914272,
"step": 180,
"train_runtime": 1437.7985,
"train_tokens_per_second": 1331.391
},
{
"epoch": 1.6286329386437028,
"grad_norm": 1.4629660844802856,
"learning_rate": 0.00014174999999999998,
"loss": 1.7081,
"num_input_tokens_seen": 2019584,
"step": 190,
"train_runtime": 1515.7685,
"train_tokens_per_second": 1332.383
},
{
"epoch": 1.7147470398277718,
"grad_norm": 0.9486769437789917,
"learning_rate": 0.00014925,
"loss": 1.7133,
"num_input_tokens_seen": 2126016,
"step": 200,
"train_runtime": 1593.9754,
"train_tokens_per_second": 1333.782
},
{
"epoch": 1.8008611410118407,
"grad_norm": 1.6725178956985474,
"learning_rate": 0.00014992177254124345,
"loss": 1.7217,
"num_input_tokens_seen": 2233824,
"step": 210,
"train_runtime": 1672.6238,
"train_tokens_per_second": 1335.521
},
{
"epoch": 1.8869752421959096,
"grad_norm": 1.5028326511383057,
"learning_rate": 0.00014965156613602355,
"loss": 1.7094,
"num_input_tokens_seen": 2341536,
"step": 220,
"train_runtime": 1751.4804,
"train_tokens_per_second": 1336.89
},
{
"epoch": 1.9730893433799785,
"grad_norm": 1.0816280841827393,
"learning_rate": 0.0001491891107057639,
"loss": 1.7178,
"num_input_tokens_seen": 2447072,
"step": 230,
"train_runtime": 1829.8444,
"train_tokens_per_second": 1337.312
},
{
"epoch": 2.051668460710441,
"grad_norm": 0.8403604030609131,
"learning_rate": 0.00014853559720478995,
"loss": 1.5203,
"num_input_tokens_seen": 2544928,
"step": 240,
"train_runtime": 1901.5872,
"train_tokens_per_second": 1338.318
},
{
"epoch": 2.13778256189451,
"grad_norm": 0.805606484413147,
"learning_rate": 0.00014769270861632517,
"loss": 1.684,
"num_input_tokens_seen": 2652064,
"step": 250,
"train_runtime": 1980.3904,
"train_tokens_per_second": 1339.162
},
{
"epoch": 2.223896663078579,
"grad_norm": 0.7405467629432678,
"learning_rate": 0.00014666261561833036,
"loss": 1.6749,
"num_input_tokens_seen": 2759904,
"step": 260,
"train_runtime": 2065.3272,
"train_tokens_per_second": 1336.304
},
{
"epoch": 2.310010764262648,
"grad_norm": 0.8861342668533325,
"learning_rate": 0.00014544797099339018,
"loss": 1.6585,
"num_input_tokens_seen": 2865952,
"step": 270,
"train_runtime": 2143.4821,
"train_tokens_per_second": 1337.054
},
{
"epoch": 2.396124865446717,
"grad_norm": 1.0403251647949219,
"learning_rate": 0.0001440519027970432,
"loss": 1.6736,
"num_input_tokens_seen": 2972928,
"step": 280,
"train_runtime": 2222.3903,
"train_tokens_per_second": 1337.716
},
{
"epoch": 2.482238966630786,
"grad_norm": 2.1221981048583984,
"learning_rate": 0.0001424780063021488,
"loss": 1.6969,
"num_input_tokens_seen": 3080512,
"step": 290,
"train_runtime": 2301.0804,
"train_tokens_per_second": 1338.724
},
{
"epoch": 2.5683530678148547,
"grad_norm": 0.7471824884414673,
"learning_rate": 0.00014073033474003643,
"loss": 1.6699,
"num_input_tokens_seen": 3187712,
"step": 300,
"train_runtime": 2379.4634,
"train_tokens_per_second": 1339.677
},
{
"epoch": 2.6544671689989237,
"grad_norm": 0.7120847702026367,
"learning_rate": 0.00013881338886228165,
"loss": 1.6843,
"num_input_tokens_seen": 3293920,
"step": 310,
"train_runtime": 2457.8176,
"train_tokens_per_second": 1340.181
},
{
"epoch": 2.7405812701829926,
"grad_norm": 0.7970668077468872,
"learning_rate": 0.00013673210534999016,
"loss": 1.6693,
"num_input_tokens_seen": 3400960,
"step": 320,
"train_runtime": 2536.9062,
"train_tokens_per_second": 1340.594
},
{
"epoch": 2.8266953713670615,
"grad_norm": 0.6767310500144958,
"learning_rate": 0.0001344918441004391,
"loss": 1.6793,
"num_input_tokens_seen": 3508032,
"step": 330,
"train_runtime": 2615.7057,
"train_tokens_per_second": 1341.142
},
{
"epoch": 2.91280947255113,
"grad_norm": 0.9333407282829285,
"learning_rate": 0.00013209837442381653,
"loss": 1.6769,
"num_input_tokens_seen": 3614176,
"step": 340,
"train_runtime": 2694.0699,
"train_tokens_per_second": 1341.53
},
{
"epoch": 2.9989235737351994,
"grad_norm": 0.6378505229949951,
"learning_rate": 0.0001295578601856059,
"loss": 1.6701,
"num_input_tokens_seen": 3721088,
"step": 350,
"train_runtime": 2772.4192,
"train_tokens_per_second": 1342.181
},
{
"epoch": 3.077502691065662,
"grad_norm": 0.7191705107688904,
"learning_rate": 0.0001268768439328786,
"loss": 1.4983,
"num_input_tokens_seen": 3819168,
"step": 360,
"train_runtime": 2844.1855,
"train_tokens_per_second": 1342.798
},
{
"epoch": 3.163616792249731,
"grad_norm": 0.8273401856422424,
"learning_rate": 0.0001240622300453734,
"loss": 1.6384,
"num_input_tokens_seen": 3925184,
"step": 370,
"train_runtime": 2922.2231,
"train_tokens_per_second": 1343.218
},
{
"epoch": 3.2497308934338,
"grad_norm": 1.5716602802276611,
"learning_rate": 0.00012112126695475425,
"loss": 1.6345,
"num_input_tokens_seen": 4032864,
"step": 380,
"train_runtime": 3000.8862,
"train_tokens_per_second": 1343.891
},
{
"epoch": 3.3358449946178688,
"grad_norm": 0.6344667077064514,
"learning_rate": 0.00011806152847783581,
"loss": 1.6347,
"num_input_tokens_seen": 4140288,
"step": 390,
"train_runtime": 3079.5638,
"train_tokens_per_second": 1344.44
},
{
"epoch": 3.4219590958019377,
"grad_norm": 0.45537635684013367,
"learning_rate": 0.0001148908943118504,
"loss": 1.621,
"num_input_tokens_seen": 4247264,
"step": 400,
"train_runtime": 3158.1824,
"train_tokens_per_second": 1344.844
},
{
"epoch": 3.5080731969860066,
"grad_norm": 0.9383829832077026,
"learning_rate": 0.00011161752974198511,
"loss": 1.64,
"num_input_tokens_seen": 4354272,
"step": 410,
"train_runtime": 3236.6237,
"train_tokens_per_second": 1345.313
},
{
"epoch": 3.594187298170075,
"grad_norm": 0.704737663269043,
"learning_rate": 0.00010824986461344928,
"loss": 1.6314,
"num_input_tokens_seen": 4462208,
"step": 420,
"train_runtime": 3315.3543,
"train_tokens_per_second": 1345.922
},
{
"epoch": 3.6803013993541445,
"grad_norm": 0.6594169735908508,
"learning_rate": 0.00010479657162222409,
"loss": 1.6498,
"num_input_tokens_seen": 4569632,
"step": 430,
"train_runtime": 3393.6946,
"train_tokens_per_second": 1346.507
},
{
"epoch": 3.766415500538213,
"grad_norm": 0.6667532324790955,
"learning_rate": 0.00010126654398040281,
"loss": 1.633,
"num_input_tokens_seen": 4676736,
"step": 440,
"train_runtime": 3472.7969,
"train_tokens_per_second": 1346.677
},
{
"epoch": 3.852529601722282,
"grad_norm": 0.6092108488082886,
"learning_rate": 9.766887251363892e-05,
"loss": 1.6256,
"num_input_tokens_seen": 4783264,
"step": 450,
"train_runtime": 3551.4865,
"train_tokens_per_second": 1346.834
},
{
"epoch": 3.938643702906351,
"grad_norm": 0.9420148730278015,
"learning_rate": 9.401282224968333e-05,
"loss": 1.6179,
"num_input_tokens_seen": 4890112,
"step": 460,
"train_runtime": 3630.0806,
"train_tokens_per_second": 1347.108
},
{
"epoch": 4.017222820236814,
"grad_norm": 0.6568248867988586,
"learning_rate": 9.030780855830153e-05,
"loss": 1.4804,
"num_input_tokens_seen": 4987136,
"step": 470,
"train_runtime": 3701.7389,
"train_tokens_per_second": 1347.241
},
{
"epoch": 4.103336921420882,
"grad_norm": 0.46975892782211304,
"learning_rate": 8.65633729040172e-05,
"loss": 1.5986,
"num_input_tokens_seen": 5092896,
"step": 480,
"train_runtime": 3780.0642,
"train_tokens_per_second": 1347.304
},
{
"epoch": 4.189451022604952,
"grad_norm": 0.17200271785259247,
"learning_rate": 8.278915827412616e-05,
"loss": 1.603,
"num_input_tokens_seen": 5200416,
"step": 490,
"train_runtime": 3859.043,
"train_tokens_per_second": 1347.592
},
{
"epoch": 4.27556512378902,
"grad_norm": 1.3012012243270874,
"learning_rate": 7.899488434526004e-05,
"loss": 1.5983,
"num_input_tokens_seen": 5306976,
"step": 500,
"train_runtime": 3937.2348,
"train_tokens_per_second": 1347.894
},
{
"epoch": 4.36167922497309,
"grad_norm": 0.780907392501831,
"learning_rate": 7.51903224524532e-05,
"loss": 1.5965,
"num_input_tokens_seen": 5414464,
"step": 510,
"train_runtime": 4022.017,
"train_tokens_per_second": 1346.206
},
{
"epoch": 4.447793326157158,
"grad_norm": 0.6589680910110474,
"learning_rate": 7.138527042517471e-05,
"loss": 1.603,
"num_input_tokens_seen": 5520224,
"step": 520,
"train_runtime": 4100.3341,
"train_tokens_per_second": 1346.286
},
{
"epoch": 4.533907427341227,
"grad_norm": 0.5304105877876282,
"learning_rate": 6.758952735512931e-05,
"loss": 1.6065,
"num_input_tokens_seen": 5628224,
"step": 530,
"train_runtime": 4179.0731,
"train_tokens_per_second": 1346.764
},
{
"epoch": 4.620021528525296,
"grad_norm": 0.2885695695877075,
"learning_rate": 6.381286836080796e-05,
"loss": 1.6024,
"num_input_tokens_seen": 5734816,
"step": 540,
"train_runtime": 4257.2922,
"train_tokens_per_second": 1347.057
},
{
"epoch": 4.706135629709365,
"grad_norm": 0.3303077816963196,
"learning_rate": 6.006501941377631e-05,
"loss": 1.597,
"num_input_tokens_seen": 5842240,
"step": 550,
"train_runtime": 4336.3619,
"train_tokens_per_second": 1347.268
},
{
"epoch": 4.792249730893434,
"grad_norm": 0.4729728102684021,
"learning_rate": 5.635563229153013e-05,
"loss": 1.6005,
"num_input_tokens_seen": 5950688,
"step": 560,
"train_runtime": 4415.38,
"train_tokens_per_second": 1347.718
},
{
"epoch": 4.878363832077502,
"grad_norm": 0.6590526103973389,
"learning_rate": 5.2694259721422185e-05,
"loss": 1.6081,
"num_input_tokens_seen": 6056416,
"step": 570,
"train_runtime": 4493.6142,
"train_tokens_per_second": 1347.783
},
{
"epoch": 4.964477933261572,
"grad_norm": 0.5510996580123901,
"learning_rate": 4.90903307796707e-05,
"loss": 1.6024,
"num_input_tokens_seen": 6163968,
"step": 580,
"train_runtime": 4572.3588,
"train_tokens_per_second": 1348.094
},
{
"epoch": 5.043057050592035,
"grad_norm": 0.4095686376094818,
"learning_rate": 4.555312660880527e-05,
"loss": 1.4538,
"num_input_tokens_seen": 6262560,
"step": 590,
"train_runtime": 4644.1546,
"train_tokens_per_second": 1348.482
},
{
"epoch": 5.129171151776103,
"grad_norm": 0.17324793338775635,
"learning_rate": 4.209175651608374e-05,
"loss": 1.586,
"num_input_tokens_seen": 6369280,
"step": 600,
"train_runtime": 4722.7601,
"train_tokens_per_second": 1348.635
},
{
"epoch": 5.2152852529601725,
"grad_norm": 0.6640817523002625,
"learning_rate": 3.871513451443412e-05,
"loss": 1.5876,
"num_input_tokens_seen": 6475072,
"step": 610,
"train_runtime": 4800.8785,
"train_tokens_per_second": 1348.726
},
{
"epoch": 5.301399354144241,
"grad_norm": 0.17123615741729736,
"learning_rate": 3.5431956366334576e-05,
"loss": 1.587,
"num_input_tokens_seen": 6582240,
"step": 620,
"train_runtime": 4879.5207,
"train_tokens_per_second": 1348.952
},
{
"epoch": 5.38751345532831,
"grad_norm": 0.051739007234573364,
"learning_rate": 3.225067718975078e-05,
"loss": 1.5812,
"num_input_tokens_seen": 6690496,
"step": 630,
"train_runtime": 4959.3413,
"train_tokens_per_second": 1349.069
},
{
"epoch": 5.473627556512379,
"grad_norm": 0.889016330242157,
"learning_rate": 2.917948968380125e-05,
"loss": 1.5828,
"num_input_tokens_seen": 6797088,
"step": 640,
"train_runtime": 5037.9025,
"train_tokens_per_second": 1349.19
},
{
"epoch": 5.559741657696447,
"grad_norm": 0.20981049537658691,
"learning_rate": 2.622630303022586e-05,
"loss": 1.5837,
"num_input_tokens_seen": 6904160,
"step": 650,
"train_runtime": 5116.2831,
"train_tokens_per_second": 1349.448
},
{
"epoch": 5.645855758880517,
"grad_norm": 0.4966135621070862,
"learning_rate": 2.3398722524992193e-05,
"loss": 1.5806,
"num_input_tokens_seen": 7011264,
"step": 660,
"train_runtime": 5194.5897,
"train_tokens_per_second": 1349.724
},
{
"epoch": 5.731969860064585,
"grad_norm": 0.0645381435751915,
"learning_rate": 2.0704029992494413e-05,
"loss": 1.5831,
"num_input_tokens_seen": 7117600,
"step": 670,
"train_runtime": 5272.7715,
"train_tokens_per_second": 1349.878
},
{
"epoch": 5.818083961248655,
"grad_norm": 0.03474411740899086,
"learning_rate": 1.8149165032783373e-05,
"loss": 1.5842,
"num_input_tokens_seen": 7223968,
"step": 680,
"train_runtime": 5351.0243,
"train_tokens_per_second": 1350.016
},
{
"epoch": 5.904198062432723,
"grad_norm": 0.1602916270494461,
"learning_rate": 1.574070715012184e-05,
"loss": 1.5803,
"num_input_tokens_seen": 7330624,
"step": 690,
"train_runtime": 5429.4442,
"train_tokens_per_second": 1350.161
},
{
"epoch": 5.990312163616792,
"grad_norm": 0.6672658920288086,
"learning_rate": 1.3484858808888777e-05,
"loss": 1.5828,
"num_input_tokens_seen": 7437664,
"step": 700,
"train_runtime": 5507.9983,
"train_tokens_per_second": 1350.339
},
{
"epoch": 6.0688912809472555,
"grad_norm": 0.053765423595905304,
"learning_rate": 1.1387429460468603e-05,
"loss": 1.4417,
"num_input_tokens_seen": 7535744,
"step": 710,
"train_runtime": 5579.9255,
"train_tokens_per_second": 1350.51
},
{
"epoch": 6.155005382131324,
"grad_norm": 0.029805637896060944,
"learning_rate": 9.453820582260826e-06,
"loss": 1.5799,
"num_input_tokens_seen": 7642368,
"step": 720,
"train_runtime": 5657.9716,
"train_tokens_per_second": 1350.726
},
{
"epoch": 6.2411194833153925,
"grad_norm": 0.04558693990111351,
"learning_rate": 7.689011767338823e-06,
"loss": 1.5799,
"num_input_tokens_seen": 7748992,
"step": 730,
"train_runtime": 5736.181,
"train_tokens_per_second": 1350.897
},
{
"epoch": 6.327233584499462,
"grad_norm": 0.03208324313163757,
"learning_rate": 6.097547900580538e-06,
"loss": 1.5796,
"num_input_tokens_seen": 7856928,
"step": 740,
"train_runtime": 5814.8518,
"train_tokens_per_second": 1351.183
},
{
"epoch": 6.41334768568353,
"grad_norm": 0.03971538320183754,
"learning_rate": 4.68352745429686e-06,
"loss": 1.5801,
"num_input_tokens_seen": 7964064,
"step": 750,
"train_runtime": 5893.167,
"train_tokens_per_second": 1351.406
}
],
"logging_steps": 10,
"max_steps": 819,
"num_input_tokens_seen": 7964064,
"num_train_epochs": 7,
"save_steps": 250,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5.3558949813041664e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}