tongue-table-lora-brick2-hf-v1 / trainer_state_final.json
issdandavis's picture
add final trainer_state
49e46be verified
Raw
History Blame Contribute Delete
26.5 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 10.17094017094017,
"eval_steps": 25,
"global_step": 600,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.08547008547008547,
"grad_norm": 32.45793533325195,
"learning_rate": 5e-06,
"loss": 4.3981,
"step": 5
},
{
"epoch": 0.17094017094017094,
"grad_norm": 19.99646759033203,
"learning_rate": 1e-05,
"loss": 3.809,
"step": 10
},
{
"epoch": 0.2564102564102564,
"grad_norm": 10.912039756774902,
"learning_rate": 1.5000000000000002e-05,
"loss": 2.9424,
"step": 15
},
{
"epoch": 0.3418803418803419,
"grad_norm": 6.190257549285889,
"learning_rate": 2e-05,
"loss": 2.2027,
"step": 20
},
{
"epoch": 0.42735042735042733,
"grad_norm": 4.5474066734313965,
"learning_rate": 1.9996332862232843e-05,
"loss": 1.6336,
"step": 25
},
{
"epoch": 0.42735042735042733,
"eval_loss": 1.4425157308578491,
"eval_runtime": 2.8029,
"eval_samples_per_second": 37.105,
"eval_steps_per_second": 9.276,
"step": 25
},
{
"epoch": 0.5128205128205128,
"grad_norm": 3.2563352584838867,
"learning_rate": 1.998533413851124e-05,
"loss": 1.2988,
"step": 30
},
{
"epoch": 0.5982905982905983,
"grad_norm": 2.3913843631744385,
"learning_rate": 1.996701189560223e-05,
"loss": 1.0025,
"step": 35
},
{
"epoch": 0.6837606837606838,
"grad_norm": 1.783568263053894,
"learning_rate": 1.9941379571543597e-05,
"loss": 0.8304,
"step": 40
},
{
"epoch": 0.7692307692307693,
"grad_norm": 1.4403300285339355,
"learning_rate": 1.990845596578807e-05,
"loss": 0.7449,
"step": 45
},
{
"epoch": 0.8547008547008547,
"grad_norm": 1.1698269844055176,
"learning_rate": 1.9868265225415263e-05,
"loss": 0.6516,
"step": 50
},
{
"epoch": 0.8547008547008547,
"eval_loss": 0.624435305595398,
"eval_runtime": 2.8155,
"eval_samples_per_second": 36.938,
"eval_steps_per_second": 9.235,
"step": 50
},
{
"epoch": 0.9401709401709402,
"grad_norm": 1.210651159286499,
"learning_rate": 1.982083682742156e-05,
"loss": 0.5538,
"step": 55
},
{
"epoch": 1.017094017094017,
"grad_norm": 1.0749378204345703,
"learning_rate": 1.976620555710087e-05,
"loss": 0.5287,
"step": 60
},
{
"epoch": 1.1025641025641026,
"grad_norm": 0.9600836634635925,
"learning_rate": 1.9704411482532116e-05,
"loss": 0.4221,
"step": 65
},
{
"epoch": 1.188034188034188,
"grad_norm": 0.8946885466575623,
"learning_rate": 1.963549992519223e-05,
"loss": 0.4017,
"step": 70
},
{
"epoch": 1.2735042735042734,
"grad_norm": 1.0423543453216553,
"learning_rate": 1.955952142671612e-05,
"loss": 0.3492,
"step": 75
},
{
"epoch": 1.2735042735042734,
"eval_loss": 0.3717593550682068,
"eval_runtime": 2.8255,
"eval_samples_per_second": 36.808,
"eval_steps_per_second": 9.202,
"step": 75
},
{
"epoch": 1.358974358974359,
"grad_norm": 1.1442183256149292,
"learning_rate": 1.9476531711828027e-05,
"loss": 0.3272,
"step": 80
},
{
"epoch": 1.4444444444444444,
"grad_norm": 1.044005036354065,
"learning_rate": 1.9386591647471508e-05,
"loss": 0.3404,
"step": 85
},
{
"epoch": 1.5299145299145298,
"grad_norm": 0.9060975909233093,
"learning_rate": 1.9289767198167918e-05,
"loss": 0.2949,
"step": 90
},
{
"epoch": 1.6153846153846154,
"grad_norm": 0.8754892349243164,
"learning_rate": 1.918612937763622e-05,
"loss": 0.2891,
"step": 95
},
{
"epoch": 1.7008547008547008,
"grad_norm": 0.800922155380249,
"learning_rate": 1.9075754196709574e-05,
"loss": 0.2856,
"step": 100
},
{
"epoch": 1.7008547008547008,
"eval_loss": 0.2841126620769501,
"eval_runtime": 2.8509,
"eval_samples_per_second": 36.48,
"eval_steps_per_second": 9.12,
"step": 100
},
{
"epoch": 1.7863247863247862,
"grad_norm": 0.5995078086853027,
"learning_rate": 1.8958722607586883e-05,
"loss": 0.2723,
"step": 105
},
{
"epoch": 1.8717948717948718,
"grad_norm": 0.853714108467102,
"learning_rate": 1.883512044446023e-05,
"loss": 0.2603,
"step": 110
},
{
"epoch": 1.9572649572649574,
"grad_norm": 0.7114328145980835,
"learning_rate": 1.8705038360561724e-05,
"loss": 0.242,
"step": 115
},
{
"epoch": 2.034188034188034,
"grad_norm": 0.6991967558860779,
"learning_rate": 1.8568571761675893e-05,
"loss": 0.2516,
"step": 120
},
{
"epoch": 2.1196581196581197,
"grad_norm": 0.6714396476745605,
"learning_rate": 1.8425820736166492e-05,
"loss": 0.2498,
"step": 125
},
{
"epoch": 2.1196581196581197,
"eval_loss": 0.24386820197105408,
"eval_runtime": 2.863,
"eval_samples_per_second": 36.325,
"eval_steps_per_second": 9.081,
"step": 125
},
{
"epoch": 2.2051282051282053,
"grad_norm": 0.8048965930938721,
"learning_rate": 1.827688998156891e-05,
"loss": 0.2227,
"step": 130
},
{
"epoch": 2.2905982905982905,
"grad_norm": 0.6397609710693359,
"learning_rate": 1.8121888727802113e-05,
"loss": 0.2229,
"step": 135
},
{
"epoch": 2.376068376068376,
"grad_norm": 0.7434533834457397,
"learning_rate": 1.796093065705644e-05,
"loss": 0.2352,
"step": 140
},
{
"epoch": 2.4615384615384617,
"grad_norm": 0.8520599603652954,
"learning_rate": 1.7794133820415916e-05,
"loss": 0.2134,
"step": 145
},
{
"epoch": 2.547008547008547,
"grad_norm": 0.6550760269165039,
"learning_rate": 1.7621620551276366e-05,
"loss": 0.2088,
"step": 150
},
{
"epoch": 2.547008547008547,
"eval_loss": 0.22272011637687683,
"eval_runtime": 2.8848,
"eval_samples_per_second": 36.051,
"eval_steps_per_second": 9.013,
"step": 150
},
{
"epoch": 2.6324786324786325,
"grad_norm": 0.6515322923660278,
"learning_rate": 1.7443517375622706e-05,
"loss": 0.2042,
"step": 155
},
{
"epoch": 2.717948717948718,
"grad_norm": 0.7250323295593262,
"learning_rate": 1.725995491923131e-05,
"loss": 0.1992,
"step": 160
},
{
"epoch": 2.8034188034188032,
"grad_norm": 0.6800098419189453,
"learning_rate": 1.7071067811865477e-05,
"loss": 0.1989,
"step": 165
},
{
"epoch": 2.888888888888889,
"grad_norm": 0.6262602806091309,
"learning_rate": 1.6876994588534234e-05,
"loss": 0.181,
"step": 170
},
{
"epoch": 2.9743589743589745,
"grad_norm": 0.6131544709205627,
"learning_rate": 1.6677877587886956e-05,
"loss": 0.1943,
"step": 175
},
{
"epoch": 2.9743589743589745,
"eval_loss": 0.21058152616024017,
"eval_runtime": 2.8948,
"eval_samples_per_second": 35.926,
"eval_steps_per_second": 8.982,
"step": 175
},
{
"epoch": 3.051282051282051,
"grad_norm": 0.8641460537910461,
"learning_rate": 1.647386284781828e-05,
"loss": 0.2097,
"step": 180
},
{
"epoch": 3.1367521367521367,
"grad_norm": 0.6487774848937988,
"learning_rate": 1.6265099998359868e-05,
"loss": 0.1946,
"step": 185
},
{
"epoch": 3.2222222222222223,
"grad_norm": 0.46343570947647095,
"learning_rate": 1.6051742151937655e-05,
"loss": 0.1822,
"step": 190
},
{
"epoch": 3.3076923076923075,
"grad_norm": 0.6039112210273743,
"learning_rate": 1.5833945791074943e-05,
"loss": 0.1835,
"step": 195
},
{
"epoch": 3.393162393162393,
"grad_norm": 0.6336061954498291,
"learning_rate": 1.5611870653623826e-05,
"loss": 0.1809,
"step": 200
},
{
"epoch": 3.393162393162393,
"eval_loss": 0.19848760962486267,
"eval_runtime": 2.9181,
"eval_samples_per_second": 35.639,
"eval_steps_per_second": 8.91,
"step": 200
},
{
"epoch": 3.4786324786324787,
"grad_norm": 0.5978764891624451,
"learning_rate": 1.5385679615609045e-05,
"loss": 0.1861,
"step": 205
},
{
"epoch": 3.564102564102564,
"grad_norm": 0.6086897253990173,
"learning_rate": 1.515553857177022e-05,
"loss": 0.1848,
"step": 210
},
{
"epoch": 3.6495726495726495,
"grad_norm": 0.6077982783317566,
"learning_rate": 1.4921616313890073e-05,
"loss": 0.1705,
"step": 215
},
{
"epoch": 3.735042735042735,
"grad_norm": 0.5378933548927307,
"learning_rate": 1.4684084406997903e-05,
"loss": 0.1905,
"step": 220
},
{
"epoch": 3.8205128205128203,
"grad_norm": 0.6793361306190491,
"learning_rate": 1.4443117063539039e-05,
"loss": 0.1801,
"step": 225
},
{
"epoch": 3.8205128205128203,
"eval_loss": 0.19124998152256012,
"eval_runtime": 2.947,
"eval_samples_per_second": 35.29,
"eval_steps_per_second": 8.823,
"step": 225
},
{
"epoch": 3.905982905982906,
"grad_norm": 0.6194397807121277,
"learning_rate": 1.4198891015602648e-05,
"loss": 0.1766,
"step": 230
},
{
"epoch": 3.9914529914529915,
"grad_norm": 0.5509461760520935,
"learning_rate": 1.3951585385301557e-05,
"loss": 0.1882,
"step": 235
},
{
"epoch": 4.068376068376068,
"grad_norm": 0.7895352840423584,
"learning_rate": 1.3701381553399147e-05,
"loss": 0.1846,
"step": 240
},
{
"epoch": 4.153846153846154,
"grad_norm": 0.6293951272964478,
"learning_rate": 1.3448463026279706e-05,
"loss": 0.1788,
"step": 245
},
{
"epoch": 4.239316239316239,
"grad_norm": 0.5566557049751282,
"learning_rate": 1.31930153013598e-05,
"loss": 0.159,
"step": 250
},
{
"epoch": 4.239316239316239,
"eval_loss": 0.1850532740354538,
"eval_runtime": 2.9696,
"eval_samples_per_second": 35.021,
"eval_steps_per_second": 8.755,
"step": 250
},
{
"epoch": 4.3247863247863245,
"grad_norm": 0.5719231367111206,
"learning_rate": 1.2935225731039349e-05,
"loss": 0.1846,
"step": 255
},
{
"epoch": 4.410256410256411,
"grad_norm": 0.5705691576004028,
"learning_rate": 1.2675283385292212e-05,
"loss": 0.1711,
"step": 260
},
{
"epoch": 4.495726495726496,
"grad_norm": 0.6631448268890381,
"learning_rate": 1.2413378912997058e-05,
"loss": 0.1633,
"step": 265
},
{
"epoch": 4.581196581196581,
"grad_norm": 0.4862598478794098,
"learning_rate": 1.2149704402110243e-05,
"loss": 0.167,
"step": 270
},
{
"epoch": 4.666666666666667,
"grad_norm": 0.5664910674095154,
"learning_rate": 1.1884453238783185e-05,
"loss": 0.1703,
"step": 275
},
{
"epoch": 4.666666666666667,
"eval_loss": 0.1804552972316742,
"eval_runtime": 2.9573,
"eval_samples_per_second": 35.168,
"eval_steps_per_second": 8.792,
"step": 275
},
{
"epoch": 4.752136752136752,
"grad_norm": 0.5878341197967529,
"learning_rate": 1.161781996552765e-05,
"loss": 0.1742,
"step": 280
},
{
"epoch": 4.837606837606837,
"grad_norm": 0.6206562519073486,
"learning_rate": 1.1350000138532902e-05,
"loss": 0.171,
"step": 285
},
{
"epoch": 4.923076923076923,
"grad_norm": 0.48724639415740967,
"learning_rate": 1.1081190184239418e-05,
"loss": 0.1621,
"step": 290
},
{
"epoch": 5.0,
"grad_norm": 0.9257501363754272,
"learning_rate": 1.0811587255274313e-05,
"loss": 0.1698,
"step": 295
},
{
"epoch": 5.085470085470085,
"grad_norm": 0.5715455412864685,
"learning_rate": 1.0541389085854177e-05,
"loss": 0.1696,
"step": 300
},
{
"epoch": 5.085470085470085,
"eval_loss": 0.1769082248210907,
"eval_runtime": 2.9677,
"eval_samples_per_second": 35.043,
"eval_steps_per_second": 8.761,
"step": 300
},
{
"epoch": 5.170940170940171,
"grad_norm": 0.4863035976886749,
"learning_rate": 1.0270793846761347e-05,
"loss": 0.158,
"step": 305
},
{
"epoch": 5.256410256410256,
"grad_norm": 0.39815396070480347,
"learning_rate": 1e-05,
"loss": 0.1557,
"step": 310
},
{
"epoch": 5.3418803418803416,
"grad_norm": 0.560039222240448,
"learning_rate": 9.729206153238658e-06,
"loss": 0.1731,
"step": 315
},
{
"epoch": 5.427350427350428,
"grad_norm": 0.4191257953643799,
"learning_rate": 9.458610914145826e-06,
"loss": 0.1565,
"step": 320
},
{
"epoch": 5.512820512820513,
"grad_norm": 0.7958483099937439,
"learning_rate": 9.18841274472569e-06,
"loss": 0.1673,
"step": 325
},
{
"epoch": 5.512820512820513,
"eval_loss": 0.1737748235464096,
"eval_runtime": 2.9693,
"eval_samples_per_second": 35.025,
"eval_steps_per_second": 8.756,
"step": 325
},
{
"epoch": 5.598290598290598,
"grad_norm": 0.46690189838409424,
"learning_rate": 8.918809815760585e-06,
"loss": 0.1623,
"step": 330
},
{
"epoch": 5.683760683760684,
"grad_norm": 0.553860068321228,
"learning_rate": 8.6499998614671e-06,
"loss": 0.1592,
"step": 335
},
{
"epoch": 5.769230769230769,
"grad_norm": 0.38637080788612366,
"learning_rate": 8.382180034472353e-06,
"loss": 0.1571,
"step": 340
},
{
"epoch": 5.854700854700854,
"grad_norm": 0.5259572267532349,
"learning_rate": 8.115546761216822e-06,
"loss": 0.1703,
"step": 345
},
{
"epoch": 5.94017094017094,
"grad_norm": 0.5691083073616028,
"learning_rate": 7.85029559788976e-06,
"loss": 0.1644,
"step": 350
},
{
"epoch": 5.94017094017094,
"eval_loss": 0.1712963730096817,
"eval_runtime": 2.9593,
"eval_samples_per_second": 35.144,
"eval_steps_per_second": 8.786,
"step": 350
},
{
"epoch": 6.017094017094017,
"grad_norm": 0.5517910122871399,
"learning_rate": 7.586621087002945e-06,
"loss": 0.1697,
"step": 355
},
{
"epoch": 6.102564102564102,
"grad_norm": 0.49558934569358826,
"learning_rate": 7.324716614707794e-06,
"loss": 0.1576,
"step": 360
},
{
"epoch": 6.188034188034188,
"grad_norm": 0.5838133096694946,
"learning_rate": 7.064774268960654e-06,
"loss": 0.1658,
"step": 365
},
{
"epoch": 6.273504273504273,
"grad_norm": 0.48898056149482727,
"learning_rate": 6.806984698640202e-06,
"loss": 0.1635,
"step": 370
},
{
"epoch": 6.358974358974359,
"grad_norm": 0.5615982413291931,
"learning_rate": 6.551536973720298e-06,
"loss": 0.1524,
"step": 375
},
{
"epoch": 6.358974358974359,
"eval_loss": 0.17055413126945496,
"eval_runtime": 2.9555,
"eval_samples_per_second": 35.188,
"eval_steps_per_second": 8.797,
"step": 375
},
{
"epoch": 6.444444444444445,
"grad_norm": 0.4189331829547882,
"learning_rate": 6.298618446600856e-06,
"loss": 0.1621,
"step": 380
},
{
"epoch": 6.52991452991453,
"grad_norm": 0.6043363809585571,
"learning_rate": 6.0484146146984475e-06,
"loss": 0.1656,
"step": 385
},
{
"epoch": 6.615384615384615,
"grad_norm": 0.5410465598106384,
"learning_rate": 5.801108984397355e-06,
"loss": 0.1716,
"step": 390
},
{
"epoch": 6.700854700854701,
"grad_norm": 0.49519532918930054,
"learning_rate": 5.556882936460966e-06,
"loss": 0.1632,
"step": 395
},
{
"epoch": 6.786324786324786,
"grad_norm": 0.5701279640197754,
"learning_rate": 5.3159155930021e-06,
"loss": 0.1546,
"step": 400
},
{
"epoch": 6.786324786324786,
"eval_loss": 0.16907724738121033,
"eval_runtime": 2.9509,
"eval_samples_per_second": 35.244,
"eval_steps_per_second": 8.811,
"step": 400
},
{
"epoch": 6.871794871794872,
"grad_norm": 0.6066329479217529,
"learning_rate": 5.078383686109927e-06,
"loss": 0.1508,
"step": 405
},
{
"epoch": 6.957264957264957,
"grad_norm": 0.43724945187568665,
"learning_rate": 4.844461428229782e-06,
"loss": 0.1596,
"step": 410
},
{
"epoch": 7.034188034188034,
"grad_norm": 0.3817615509033203,
"learning_rate": 4.614320384390959e-06,
"loss": 0.1442,
"step": 415
},
{
"epoch": 7.119658119658119,
"grad_norm": 0.4554646611213684,
"learning_rate": 4.388129346376177e-06,
"loss": 0.1582,
"step": 420
},
{
"epoch": 7.205128205128205,
"grad_norm": 0.4925171136856079,
"learning_rate": 4.16605420892506e-06,
"loss": 0.1592,
"step": 425
},
{
"epoch": 7.205128205128205,
"eval_loss": 0.16841334104537964,
"eval_runtime": 2.9605,
"eval_samples_per_second": 35.13,
"eval_steps_per_second": 8.782,
"step": 425
},
{
"epoch": 7.2905982905982905,
"grad_norm": 0.5007475018501282,
"learning_rate": 3.948257848062351e-06,
"loss": 0.1621,
"step": 430
},
{
"epoch": 7.3760683760683765,
"grad_norm": 0.5269553065299988,
"learning_rate": 3.734900001640135e-06,
"loss": 0.148,
"step": 435
},
{
"epoch": 7.461538461538462,
"grad_norm": 0.5234923362731934,
"learning_rate": 3.5261371521817247e-06,
"loss": 0.1606,
"step": 440
},
{
"epoch": 7.547008547008547,
"grad_norm": 0.4035094976425171,
"learning_rate": 3.322122412113047e-06,
"loss": 0.1556,
"step": 445
},
{
"epoch": 7.632478632478632,
"grad_norm": 0.45483818650245667,
"learning_rate": 3.123005411465766e-06,
"loss": 0.1598,
"step": 450
},
{
"epoch": 7.632478632478632,
"eval_loss": 0.16744433343410492,
"eval_runtime": 2.9512,
"eval_samples_per_second": 35.24,
"eval_steps_per_second": 8.81,
"step": 450
},
{
"epoch": 7.717948717948718,
"grad_norm": 0.45279672741889954,
"learning_rate": 2.9289321881345257e-06,
"loss": 0.1495,
"step": 455
},
{
"epoch": 7.803418803418803,
"grad_norm": 0.5406824946403503,
"learning_rate": 2.740045080768694e-06,
"loss": 0.1601,
"step": 460
},
{
"epoch": 7.888888888888889,
"grad_norm": 0.5257072448730469,
"learning_rate": 2.5564826243772965e-06,
"loss": 0.1593,
"step": 465
},
{
"epoch": 7.9743589743589745,
"grad_norm": 0.5503476858139038,
"learning_rate": 2.3783794487236367e-06,
"loss": 0.16,
"step": 470
},
{
"epoch": 8.051282051282051,
"grad_norm": 0.5466392040252686,
"learning_rate": 2.205866179584084e-06,
"loss": 0.1615,
"step": 475
},
{
"epoch": 8.051282051282051,
"eval_loss": 0.16703671216964722,
"eval_runtime": 2.9533,
"eval_samples_per_second": 35.215,
"eval_steps_per_second": 8.804,
"step": 475
},
{
"epoch": 8.136752136752136,
"grad_norm": 0.5129823088645935,
"learning_rate": 2.0390693429435626e-06,
"loss": 0.1584,
"step": 480
},
{
"epoch": 8.222222222222221,
"grad_norm": 0.6289273500442505,
"learning_rate": 1.87811127219789e-06,
"loss": 0.1592,
"step": 485
},
{
"epoch": 8.307692307692308,
"grad_norm": 0.44773322343826294,
"learning_rate": 1.7231100184310955e-06,
"loss": 0.152,
"step": 490
},
{
"epoch": 8.393162393162394,
"grad_norm": 0.44763079285621643,
"learning_rate": 1.5741792638335096e-06,
"loss": 0.159,
"step": 495
},
{
"epoch": 8.478632478632479,
"grad_norm": 0.5403873920440674,
"learning_rate": 1.4314282383241097e-06,
"loss": 0.1471,
"step": 500
},
{
"epoch": 8.478632478632479,
"eval_loss": 0.16682063043117523,
"eval_runtime": 2.9444,
"eval_samples_per_second": 35.321,
"eval_steps_per_second": 8.83,
"step": 500
},
{
"epoch": 8.564102564102564,
"grad_norm": 0.4975205361843109,
"learning_rate": 1.2949616394382802e-06,
"loss": 0.1546,
"step": 505
},
{
"epoch": 8.649572649572649,
"grad_norm": 0.4314480721950531,
"learning_rate": 1.1648795555397719e-06,
"loss": 0.1495,
"step": 510
},
{
"epoch": 8.735042735042736,
"grad_norm": 0.4307732880115509,
"learning_rate": 1.0412773924131202e-06,
"loss": 0.1516,
"step": 515
},
{
"epoch": 8.820512820512821,
"grad_norm": 0.7880775332450867,
"learning_rate": 9.242458032904311e-07,
"loss": 0.1691,
"step": 520
},
{
"epoch": 8.905982905982906,
"grad_norm": 0.3903237283229828,
"learning_rate": 8.138706223637827e-07,
"loss": 0.1564,
"step": 525
},
{
"epoch": 8.905982905982906,
"eval_loss": 0.16660818457603455,
"eval_runtime": 2.9675,
"eval_samples_per_second": 35.047,
"eval_steps_per_second": 8.762,
"step": 525
},
{
"epoch": 8.991452991452991,
"grad_norm": 0.5438657999038696,
"learning_rate": 7.102328018320859e-07,
"loss": 0.1605,
"step": 530
},
{
"epoch": 9.068376068376068,
"grad_norm": 0.3905521333217621,
"learning_rate": 6.13408352528495e-07,
"loss": 0.1579,
"step": 535
},
{
"epoch": 9.153846153846153,
"grad_norm": 0.5689241886138916,
"learning_rate": 5.234682881719766e-07,
"loss": 0.1571,
"step": 540
},
{
"epoch": 9.239316239316238,
"grad_norm": 0.5273411273956299,
"learning_rate": 4.4047857328388457e-07,
"loss": 0.151,
"step": 545
},
{
"epoch": 9.324786324786325,
"grad_norm": 0.6550098061561584,
"learning_rate": 3.645000748077709e-07,
"loss": 0.1557,
"step": 550
},
{
"epoch": 9.324786324786325,
"eval_loss": 0.16643913090229034,
"eval_runtime": 2.9714,
"eval_samples_per_second": 35.001,
"eval_steps_per_second": 8.75,
"step": 550
},
{
"epoch": 9.41025641025641,
"grad_norm": 0.5939171314239502,
"learning_rate": 2.955885174678852e-07,
"loss": 0.1542,
"step": 555
},
{
"epoch": 9.495726495726496,
"grad_norm": 0.448629230260849,
"learning_rate": 2.3379444289913344e-07,
"loss": 0.1614,
"step": 560
},
{
"epoch": 9.581196581196581,
"grad_norm": 0.47190573811531067,
"learning_rate": 1.791631725784404e-07,
"loss": 0.1453,
"step": 565
},
{
"epoch": 9.666666666666666,
"grad_norm": 0.519051730632782,
"learning_rate": 1.317347745847386e-07,
"loss": 0.1565,
"step": 570
},
{
"epoch": 9.752136752136753,
"grad_norm": 0.46918535232543945,
"learning_rate": 9.154403421193226e-08,
"loss": 0.164,
"step": 575
},
{
"epoch": 9.752136752136753,
"eval_loss": 0.16634653508663177,
"eval_runtime": 2.9178,
"eval_samples_per_second": 35.643,
"eval_steps_per_second": 8.911,
"step": 575
},
{
"epoch": 9.837606837606838,
"grad_norm": 0.3677942752838135,
"learning_rate": 5.862042845640403e-08,
"loss": 0.159,
"step": 580
},
{
"epoch": 9.923076923076923,
"grad_norm": 0.5101422667503357,
"learning_rate": 3.2988104397773115e-08,
"loss": 0.1554,
"step": 585
},
{
"epoch": 10.0,
"grad_norm": 0.49817174673080444,
"learning_rate": 1.4665861488761813e-08,
"loss": 0.1596,
"step": 590
},
{
"epoch": 10.085470085470085,
"grad_norm": 0.3656047582626343,
"learning_rate": 3.6671377671604337e-09,
"loss": 0.1528,
"step": 595
},
{
"epoch": 10.17094017094017,
"grad_norm": 0.5075839161872864,
"learning_rate": 0.0,
"loss": 0.1591,
"step": 600
},
{
"epoch": 10.17094017094017,
"eval_loss": 0.1664964258670807,
"eval_runtime": 2.9425,
"eval_samples_per_second": 35.345,
"eval_steps_per_second": 8.836,
"step": 600
}
],
"logging_steps": 5,
"max_steps": 600,
"num_input_tokens_seen": 0,
"num_train_epochs": 11,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9098325346882560.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}