FLICC-Qwen3.5-9B-lora / last-checkpoint /trainer_state.json
iRanadheer's picture
Training in progress, step 606, checkpoint
e8a977e verified
Raw History Blame Contribute Delete
28.7 kB
{
"best_global_step": 550,
"best_metric": 0.14384840428829193,
"best_model_checkpoint": "FLICC-Qwen3.5-9B/checkpoint-550",
"epoch": 3.0,
"eval_steps": 25,
"global_step": 606,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.024783147459727387,
"grad_norm": 1.2578336000442505,
"learning_rate": 8e-05,
"loss": 2.1545221328735353,
"step": 5
},
{
"epoch": 0.04956629491945477,
"grad_norm": 0.38908010721206665,
"learning_rate": 0.00018,
"loss": 1.7079069137573242,
"step": 10
},
{
"epoch": 0.07434944237918216,
"grad_norm": 0.7322022914886475,
"learning_rate": 0.0001999777729859618,
"loss": 1.16412296295166,
"step": 15
},
{
"epoch": 0.09913258983890955,
"grad_norm": 0.47556403279304504,
"learning_rate": 0.0001998874926755492,
"loss": 0.521942138671875,
"step": 20
},
{
"epoch": 0.12391573729863693,
"grad_norm": 0.25855234265327454,
"learning_rate": 0.00019972783253900808,
"loss": 0.22866697311401368,
"step": 25
},
{
"epoch": 0.12391573729863693,
"eval_loss": 0.20142747461795807,
"eval_runtime": 31.7965,
"eval_samples_per_second": 5.567,
"eval_steps_per_second": 1.415,
"step": 25
},
{
"epoch": 0.14869888475836432,
"grad_norm": 0.11888384819030762,
"learning_rate": 0.00019949890347303046,
"loss": 0.20155599117279052,
"step": 30
},
{
"epoch": 0.1734820322180917,
"grad_norm": 0.10729903727769852,
"learning_rate": 0.0001992008644871016,
"loss": 0.18807698488235475,
"step": 35
},
{
"epoch": 0.1982651796778191,
"grad_norm": 0.09704501926898956,
"learning_rate": 0.0001988339225930552,
"loss": 0.20087261199951173,
"step": 40
},
{
"epoch": 0.22304832713754646,
"grad_norm": 0.0895816907286644,
"learning_rate": 0.00019839833266128724,
"loss": 0.17901148796081542,
"step": 45
},
{
"epoch": 0.24783147459727387,
"grad_norm": 0.0991889014840126,
"learning_rate": 0.00019789439724372806,
"loss": 0.18655662536621093,
"step": 50
},
{
"epoch": 0.24783147459727387,
"eval_loss": 0.16927684843540192,
"eval_runtime": 20.0824,
"eval_samples_per_second": 8.814,
"eval_steps_per_second": 2.241,
"step": 50
},
{
"epoch": 0.27261462205700127,
"grad_norm": 0.08669876307249069,
"learning_rate": 0.00019732246636369605,
"loss": 0.15882112979888915,
"step": 55
},
{
"epoch": 0.29739776951672864,
"grad_norm": 0.08936048299074173,
"learning_rate": 0.00019668293727277846,
"loss": 0.17748851776123048,
"step": 60
},
{
"epoch": 0.322180916976456,
"grad_norm": 0.08769766986370087,
"learning_rate": 0.0001959762541749086,
"loss": 0.15775216817855836,
"step": 65
},
{
"epoch": 0.3469640644361834,
"grad_norm": 0.08859147131443024,
"learning_rate": 0.0001952029079178307,
"loss": 0.1502579927444458,
"step": 70
},
{
"epoch": 0.37174721189591076,
"grad_norm": 0.08570419251918793,
"learning_rate": 0.00019436343565216711,
"loss": 0.1632941722869873,
"step": 75
},
{
"epoch": 0.37174721189591076,
"eval_loss": 0.16099171340465546,
"eval_runtime": 20.0803,
"eval_samples_per_second": 8.815,
"eval_steps_per_second": 2.241,
"step": 75
},
{
"epoch": 0.3965303593556382,
"grad_norm": 0.08874429017305374,
"learning_rate": 0.00019345842045832428,
"loss": 0.16088367700576783,
"step": 80
},
{
"epoch": 0.42131350681536556,
"grad_norm": 0.08653293550014496,
"learning_rate": 0.000192488490941497,
"loss": 0.17103042602539062,
"step": 85
},
{
"epoch": 0.44609665427509293,
"grad_norm": 0.08580342680215836,
"learning_rate": 0.00019145432079505206,
"loss": 0.16303534507751466,
"step": 90
},
{
"epoch": 0.4708798017348203,
"grad_norm": 0.0754188671708107,
"learning_rate": 0.00019035662833259432,
"loss": 0.15218052864074708,
"step": 95
},
{
"epoch": 0.49566294919454773,
"grad_norm": 0.08795224130153656,
"learning_rate": 0.0001891961759890408,
"loss": 0.1582047462463379,
"step": 100
},
{
"epoch": 0.49566294919454773,
"eval_loss": 0.15668612718582153,
"eval_runtime": 20.0959,
"eval_samples_per_second": 8.808,
"eval_steps_per_second": 2.239,
"step": 100
},
{
"epoch": 0.5204460966542751,
"grad_norm": 0.09747637063264847,
"learning_rate": 0.00018797376979104872,
"loss": 0.16718448400497438,
"step": 105
},
{
"epoch": 0.5452292441140025,
"grad_norm": 0.08587726950645447,
"learning_rate": 0.00018669025879716595,
"loss": 0.1570422887802124,
"step": 110
},
{
"epoch": 0.5700123915737298,
"grad_norm": 0.09190164506435394,
"learning_rate": 0.00018534653450809197,
"loss": 0.16039479970932008,
"step": 115
},
{
"epoch": 0.5947955390334573,
"grad_norm": 0.07859804481267929,
"learning_rate": 0.00018394353024745965,
"loss": 0.15238577127456665,
"step": 120
},
{
"epoch": 0.6195786864931846,
"grad_norm": 0.08068633079528809,
"learning_rate": 0.00018248222051356754,
"loss": 0.1629793167114258,
"step": 125
},
{
"epoch": 0.6195786864931846,
"eval_loss": 0.15419375896453857,
"eval_runtime": 20.0972,
"eval_samples_per_second": 8.807,
"eval_steps_per_second": 2.239,
"step": 125
},
{
"epoch": 0.644361833952912,
"grad_norm": 0.08668871223926544,
"learning_rate": 0.00018096362030251313,
"loss": 0.15735886096954346,
"step": 130
},
{
"epoch": 0.6691449814126395,
"grad_norm": 0.08392980694770813,
"learning_rate": 0.0001793887844031972,
"loss": 0.14937043190002441,
"step": 135
},
{
"epoch": 0.6939281288723668,
"grad_norm": 0.08616995811462402,
"learning_rate": 0.0001777588066646889,
"loss": 0.14931262731552125,
"step": 140
},
{
"epoch": 0.7187112763320942,
"grad_norm": 0.07857120037078857,
"learning_rate": 0.00017607481923646016,
"loss": 0.16323717832565307,
"step": 145
},
{
"epoch": 0.7434944237918215,
"grad_norm": 0.08874683827161789,
"learning_rate": 0.00017433799178201786,
"loss": 0.16156336069107055,
"step": 150
},
{
"epoch": 0.7434944237918215,
"eval_loss": 0.15226973593235016,
"eval_runtime": 20.0835,
"eval_samples_per_second": 8.813,
"eval_steps_per_second": 2.241,
"step": 150
},
{
"epoch": 0.7682775712515489,
"grad_norm": 0.08852466195821762,
"learning_rate": 0.00017254953066647913,
"loss": 0.15643792152404784,
"step": 155
},
{
"epoch": 0.7930607187112764,
"grad_norm": 0.08484289050102234,
"learning_rate": 0.00017071067811865476,
"loss": 0.15839605331420897,
"step": 160
},
{
"epoch": 0.8178438661710037,
"grad_norm": 0.08800984919071198,
"learning_rate": 0.00016882271136822206,
"loss": 0.1647958755493164,
"step": 165
},
{
"epoch": 0.8426270136307311,
"grad_norm": 0.08345294743776321,
"learning_rate": 0.0001668869417585873,
"loss": 0.1509941339492798,
"step": 170
},
{
"epoch": 0.8674101610904585,
"grad_norm": 0.07677271962165833,
"learning_rate": 0.00016490471383605288,
"loss": 0.1612541437149048,
"step": 175
},
{
"epoch": 0.8674101610904585,
"eval_loss": 0.15066702663898468,
"eval_runtime": 20.0686,
"eval_samples_per_second": 8.82,
"eval_steps_per_second": 2.242,
"step": 175
},
{
"epoch": 0.8921933085501859,
"grad_norm": 0.08086061477661133,
"learning_rate": 0.000162877404415923,
"loss": 0.1522205352783203,
"step": 180
},
{
"epoch": 0.9169764560099133,
"grad_norm": 0.082602858543396,
"learning_rate": 0.00016080642162619565,
"loss": 0.15029544830322267,
"step": 185
},
{
"epoch": 0.9417596034696406,
"grad_norm": 0.07821306586265564,
"learning_rate": 0.00015869320392950526,
"loss": 0.14748865365982056,
"step": 190
},
{
"epoch": 0.966542750929368,
"grad_norm": 0.08585070073604584,
"learning_rate": 0.00015653921912399589,
"loss": 0.14947665929794313,
"step": 195
},
{
"epoch": 0.9913258983890955,
"grad_norm": 0.08411425352096558,
"learning_rate": 0.00015434596332381852,
"loss": 0.15700777769088745,
"step": 200
},
{
"epoch": 0.9913258983890955,
"eval_loss": 0.1492398977279663,
"eval_runtime": 20.0816,
"eval_samples_per_second": 8.814,
"eval_steps_per_second": 2.241,
"step": 200
},
{
"epoch": 1.0148698884758365,
"grad_norm": 0.07653596252202988,
"learning_rate": 0.00015211495991996027,
"loss": 0.16517894268035888,
"step": 205
},
{
"epoch": 1.0396530359355638,
"grad_norm": 0.07493323087692261,
"learning_rate": 0.00014984775852212807,
"loss": 0.14664943218231202,
"step": 210
},
{
"epoch": 1.0644361833952911,
"grad_norm": 0.07914339751005173,
"learning_rate": 0.00014754593388242117,
"loss": 0.14977338314056396,
"step": 215
},
{
"epoch": 1.0892193308550187,
"grad_norm": 0.09382504969835281,
"learning_rate": 0.00014521108480154032,
"loss": 0.14892799854278566,
"step": 220
},
{
"epoch": 1.114002478314746,
"grad_norm": 0.08522579073905945,
"learning_rate": 0.0001428448330182931,
"loss": 0.13943066596984863,
"step": 225
},
{
"epoch": 1.114002478314746,
"eval_loss": 0.1489669382572174,
"eval_runtime": 20.0756,
"eval_samples_per_second": 8.817,
"eval_steps_per_second": 2.242,
"step": 225
},
{
"epoch": 1.1387856257744733,
"grad_norm": 0.10055539757013321,
"learning_rate": 0.00014044882208316713,
"loss": 0.15772825479507446,
"step": 230
},
{
"epoch": 1.1635687732342008,
"grad_norm": 0.08639902621507645,
"learning_rate": 0.00013802471621675338,
"loss": 0.13583142757415773,
"step": 235
},
{
"epoch": 1.1883519206939281,
"grad_norm": 0.0846349224448204,
"learning_rate": 0.000135574199153812,
"loss": 0.13156899213790893,
"step": 240
},
{
"epoch": 1.2131350681536555,
"grad_norm": 0.08887381851673126,
"learning_rate": 0.00013309897297378455,
"loss": 0.14310439825057983,
"step": 245
},
{
"epoch": 1.2379182156133828,
"grad_norm": 0.08967562019824982,
"learning_rate": 0.00013060075691856407,
"loss": 0.15425143241882325,
"step": 250
},
{
"epoch": 1.2379182156133828,
"eval_loss": 0.14815586805343628,
"eval_runtime": 20.0845,
"eval_samples_per_second": 8.813,
"eval_steps_per_second": 2.241,
"step": 250
},
{
"epoch": 1.2627013630731103,
"grad_norm": 0.08670926094055176,
"learning_rate": 0.00012808128619834461,
"loss": 0.14042346477508544,
"step": 255
},
{
"epoch": 1.2874845105328376,
"grad_norm": 0.08620833605527878,
"learning_rate": 0.00012554231078637927,
"loss": 0.13709003925323487,
"step": 260
},
{
"epoch": 1.3122676579925652,
"grad_norm": 0.09469753503799438,
"learning_rate": 0.00012298559420348437,
"loss": 0.14326269626617433,
"step": 265
},
{
"epoch": 1.3370508054522925,
"grad_norm": 0.08458584547042847,
"learning_rate": 0.00012041291229313372,
"loss": 0.14271541833877563,
"step": 270
},
{
"epoch": 1.3618339529120198,
"grad_norm": 0.0880797877907753,
"learning_rate": 0.0001178260519879937,
"loss": 0.14334834814071656,
"step": 275
},
{
"epoch": 1.3618339529120198,
"eval_loss": 0.14733587205410004,
"eval_runtime": 20.0759,
"eval_samples_per_second": 8.817,
"eval_steps_per_second": 2.241,
"step": 275
},
{
"epoch": 1.3866171003717471,
"grad_norm": 0.09421440213918686,
"learning_rate": 0.00011522681006875613,
"loss": 0.15932092666625977,
"step": 280
},
{
"epoch": 1.4114002478314747,
"grad_norm": 0.08234652131795883,
"learning_rate": 0.00011261699191613066,
"loss": 0.14943004846572877,
"step": 285
},
{
"epoch": 1.436183395291202,
"grad_norm": 0.08222948759794235,
"learning_rate": 0.0001099984102568643,
"loss": 0.12942731380462646,
"step": 290
},
{
"epoch": 1.4609665427509293,
"grad_norm": 0.09792573750019073,
"learning_rate": 0.00010737288390465792,
"loss": 0.14982467889785767,
"step": 295
},
{
"epoch": 1.4857496902106568,
"grad_norm": 0.09035824984312057,
"learning_rate": 0.00010474223649685517,
"loss": 0.1518421769142151,
"step": 300
},
{
"epoch": 1.4857496902106568,
"eval_loss": 0.14639338850975037,
"eval_runtime": 20.0833,
"eval_samples_per_second": 8.813,
"eval_steps_per_second": 2.241,
"step": 300
},
{
"epoch": 1.5105328376703842,
"grad_norm": 0.0854591578245163,
"learning_rate": 0.00010210829522778111,
"loss": 0.1377027750015259,
"step": 305
},
{
"epoch": 1.5353159851301115,
"grad_norm": 0.10446186363697052,
"learning_rate": 9.947288957961e-05,
"loss": 0.14845360517501832,
"step": 310
},
{
"epoch": 1.5600991325898388,
"grad_norm": 0.09128095954656601,
"learning_rate": 9.683785005164411e-05,
"loss": 0.14711700677871703,
"step": 315
},
{
"epoch": 1.5848822800495663,
"grad_norm": 0.09243518859148026,
"learning_rate": 9.420500688888609e-05,
"loss": 0.13097442388534547,
"step": 320
},
{
"epoch": 1.6096654275092936,
"grad_norm": 0.0917942151427269,
"learning_rate": 9.157618881078772e-05,
"loss": 0.14905989170074463,
"step": 325
},
{
"epoch": 1.6096654275092936,
"eval_loss": 0.14630599319934845,
"eval_runtime": 20.0838,
"eval_samples_per_second": 8.813,
"eval_steps_per_second": 2.241,
"step": 325
},
{
"epoch": 1.6344485749690212,
"grad_norm": 0.09442687779664993,
"learning_rate": 8.895322174105881e-05,
"loss": 0.13518500328063965,
"step": 330
},
{
"epoch": 1.6592317224287485,
"grad_norm": 0.09125228226184845,
"learning_rate": 8.633792753941733e-05,
"loss": 0.14012304544448853,
"step": 335
},
{
"epoch": 1.6840148698884758,
"grad_norm": 0.0936419740319252,
"learning_rate": 8.373212273616282e-05,
"loss": 0.14055389165878296,
"step": 340
},
{
"epoch": 1.7087980173482031,
"grad_norm": 0.08522295951843262,
"learning_rate": 8.113761727045105e-05,
"loss": 0.14256774187088012,
"step": 345
},
{
"epoch": 1.7335811648079305,
"grad_norm": 0.09176695346832275,
"learning_rate": 7.855621323314736e-05,
"loss": 0.13572851419448853,
"step": 350
},
{
"epoch": 1.7335811648079305,
"eval_loss": 0.1453624814748764,
"eval_runtime": 20.065,
"eval_samples_per_second": 8.821,
"eval_steps_per_second": 2.243,
"step": 350
},
{
"epoch": 1.758364312267658,
"grad_norm": 0.09987305104732513,
"learning_rate": 7.598970361513051e-05,
"loss": 0.14147673845291137,
"step": 355
},
{
"epoch": 1.7831474597273855,
"grad_norm": 0.09593646973371506,
"learning_rate": 7.343987106191785e-05,
"loss": 0.14583654403686525,
"step": 360
},
{
"epoch": 1.8079306071871128,
"grad_norm": 0.08658026158809662,
"learning_rate": 7.090848663547574e-05,
"loss": 0.1391659379005432,
"step": 365
},
{
"epoch": 1.8327137546468402,
"grad_norm": 0.08900578320026398,
"learning_rate": 6.839730858407603e-05,
"loss": 0.1330711841583252,
"step": 370
},
{
"epoch": 1.8574969021065675,
"grad_norm": 0.0947270616889,
"learning_rate": 6.590808112105232e-05,
"loss": 0.14469583034515382,
"step": 375
},
{
"epoch": 1.8574969021065675,
"eval_loss": 0.1443570852279663,
"eval_runtime": 20.0669,
"eval_samples_per_second": 8.82,
"eval_steps_per_second": 2.242,
"step": 375
},
{
"epoch": 1.8822800495662948,
"grad_norm": 0.0893881618976593,
"learning_rate": 6.344253321330476e-05,
"loss": 0.13211302757263182,
"step": 380
},
{
"epoch": 1.9070631970260223,
"grad_norm": 0.09638750553131104,
"learning_rate": 6.100237738039484e-05,
"loss": 0.14780888557434083,
"step": 385
},
{
"epoch": 1.9318463444857497,
"grad_norm": 0.09466356039047241,
"learning_rate": 5.858930850506388e-05,
"loss": 0.1425341010093689,
"step": 390
},
{
"epoch": 1.9566294919454772,
"grad_norm": 0.09821353852748871,
"learning_rate": 5.620500265600206e-05,
"loss": 0.14998058080673218,
"step": 395
},
{
"epoch": 1.9814126394052045,
"grad_norm": 0.09322469681501389,
"learning_rate": 5.385111592368486e-05,
"loss": 0.14387768507003784,
"step": 400
},
{
"epoch": 1.9814126394052045,
"eval_loss": 0.1438552290201187,
"eval_runtime": 20.1578,
"eval_samples_per_second": 8.781,
"eval_steps_per_second": 2.232,
"step": 400
},
{
"epoch": 2.0049566294919456,
"grad_norm": 0.09768665581941605,
"learning_rate": 5.152928327008635e-05,
"loss": 0.15004920959472656,
"step": 405
},
{
"epoch": 2.029739776951673,
"grad_norm": 0.09443743526935577,
"learning_rate": 4.924111739306788e-05,
"loss": 0.13336663246154784,
"step": 410
},
{
"epoch": 2.0545229244114003,
"grad_norm": 0.09068778902292252,
"learning_rate": 4.698820760623064e-05,
"loss": 0.13002735376358032,
"step": 415
},
{
"epoch": 2.0793060718711276,
"grad_norm": 0.09333285689353943,
"learning_rate": 4.477211873501085e-05,
"loss": 0.12572606801986694,
"step": 420
},
{
"epoch": 2.104089219330855,
"grad_norm": 0.09789580851793289,
"learning_rate": 4.2594390029783534e-05,
"loss": 0.13599283695220948,
"step": 425
},
{
"epoch": 2.104089219330855,
"eval_loss": 0.14471149444580078,
"eval_runtime": 20.1059,
"eval_samples_per_second": 8.803,
"eval_steps_per_second": 2.238,
"step": 425
},
{
"epoch": 2.1288723667905822,
"grad_norm": 0.1010223925113678,
"learning_rate": 4.045653409673078e-05,
"loss": 0.12323858737945556,
"step": 430
},
{
"epoch": 2.15365551425031,
"grad_norm": 0.10947588086128235,
"learning_rate": 3.836003584721577e-05,
"loss": 0.13344532251358032,
"step": 435
},
{
"epoch": 2.1784386617100373,
"grad_norm": 0.10182736814022064,
"learning_rate": 3.630635146639384e-05,
"loss": 0.12730480432510377,
"step": 440
},
{
"epoch": 2.2032218091697646,
"grad_norm": 0.10020897537469864,
"learning_rate": 3.429690740177549e-05,
"loss": 0.11858847141265869,
"step": 445
},
{
"epoch": 2.228004956629492,
"grad_norm": 0.10753881931304932,
"learning_rate": 3.233309937244513e-05,
"loss": 0.11974374055862427,
"step": 450
},
{
"epoch": 2.228004956629492,
"eval_loss": 0.14466847479343414,
"eval_runtime": 20.1014,
"eval_samples_per_second": 8.805,
"eval_steps_per_second": 2.239,
"step": 450
},
{
"epoch": 2.2527881040892193,
"grad_norm": 0.09645484387874603,
"learning_rate": 3.041629139962283e-05,
"loss": 0.12982945442199706,
"step": 455
},
{
"epoch": 2.2775712515489466,
"grad_norm": 0.10199300944805145,
"learning_rate": 2.8547814859242727e-05,
"loss": 0.13981986045837402,
"step": 460
},
{
"epoch": 2.3023543990086743,
"grad_norm": 0.10710015147924423,
"learning_rate": 2.672896755720654e-05,
"loss": 0.14547840356826783,
"step": 465
},
{
"epoch": 2.3271375464684017,
"grad_norm": 0.09909404069185257,
"learning_rate": 2.496101282795369e-05,
"loss": 0.12706974744796753,
"step": 470
},
{
"epoch": 2.351920693928129,
"grad_norm": 0.10963651537895203,
"learning_rate": 2.324517865697501e-05,
"loss": 0.14960445165634156,
"step": 475
},
{
"epoch": 2.351920693928129,
"eval_loss": 0.14430110156536102,
"eval_runtime": 20.1279,
"eval_samples_per_second": 8.794,
"eval_steps_per_second": 2.236,
"step": 475
},
{
"epoch": 2.3767038413878563,
"grad_norm": 0.10664132982492447,
"learning_rate": 2.1582656827878844e-05,
"loss": 0.12047649621963501,
"step": 480
},
{
"epoch": 2.4014869888475836,
"grad_norm": 0.10346455127000809,
"learning_rate": 1.99746020946023e-05,
"loss": 0.12301702499389648,
"step": 485
},
{
"epoch": 2.426270136307311,
"grad_norm": 0.10490775853395462,
"learning_rate": 1.8422131379342668e-05,
"loss": 0.13336237668991088,
"step": 490
},
{
"epoch": 2.4510532837670382,
"grad_norm": 0.11114446818828583,
"learning_rate": 1.6926322996765897e-05,
"loss": 0.1356014370918274,
"step": 495
},
{
"epoch": 2.4758364312267656,
"grad_norm": 0.10340475291013718,
"learning_rate": 1.5488215905031034e-05,
"loss": 0.12613558769226074,
"step": 500
},
{
"epoch": 2.4758364312267656,
"eval_loss": 0.14409051835536957,
"eval_runtime": 20.1071,
"eval_samples_per_second": 8.803,
"eval_steps_per_second": 2.238,
"step": 500
},
{
"epoch": 2.5006195786864933,
"grad_norm": 0.10658421367406845,
"learning_rate": 1.4108808984151023e-05,
"loss": 0.14121589660644532,
"step": 505
},
{
"epoch": 2.5254027261462206,
"grad_norm": 0.11168505251407623,
"learning_rate": 1.278906034219094e-05,
"loss": 0.12991907596588134,
"step": 510
},
{
"epoch": 2.550185873605948,
"grad_norm": 0.11109943687915802,
"learning_rate": 1.152988664978556e-05,
"loss": 0.14196932315826416,
"step": 515
},
{
"epoch": 2.5749690210656753,
"grad_norm": 0.11461146175861359,
"learning_rate": 1.0332162503438381e-05,
"loss": 0.1336436986923218,
"step": 520
},
{
"epoch": 2.5997521685254026,
"grad_norm": 0.1116466075181961,
"learning_rate": 9.196719818044886e-06,
"loss": 0.13213711977005005,
"step": 525
},
{
"epoch": 2.5997521685254026,
"eval_loss": 0.14412295818328857,
"eval_runtime": 20.1059,
"eval_samples_per_second": 8.803,
"eval_steps_per_second": 2.238,
"step": 525
},
{
"epoch": 2.6245353159851303,
"grad_norm": 0.10819047689437866,
"learning_rate": 8.124347249061115e-06,
"loss": 0.1222877025604248,
"step": 530
},
{
"epoch": 2.6493184634448577,
"grad_norm": 0.109853096306324,
"learning_rate": 7.115789644719728e-06,
"loss": 0.12941099405288697,
"step": 535
},
{
"epoch": 2.674101610904585,
"grad_norm": 0.11083053052425385,
"learning_rate": 6.1717475286734e-06,
"loss": 0.11817164421081543,
"step": 540
},
{
"epoch": 2.6988847583643123,
"grad_norm": 0.11062867194414139,
"learning_rate": 5.2928766134254345e-06,
"loss": 0.1254756212234497,
"step": 545
},
{
"epoch": 2.7236679058240396,
"grad_norm": 0.11206871271133423,
"learning_rate": 4.479787344885078e-06,
"loss": 0.12366704940795899,
"step": 550
},
{
"epoch": 2.7236679058240396,
"eval_loss": 0.14384840428829193,
"eval_runtime": 20.1395,
"eval_samples_per_second": 8.789,
"eval_steps_per_second": 2.234,
"step": 550
},
{
"epoch": 2.748451053283767,
"grad_norm": 0.11186806112527847,
"learning_rate": 3.7330444783642338e-06,
"loss": 0.13718799352645875,
"step": 555
},
{
"epoch": 2.7732342007434942,
"grad_norm": 0.10549531131982803,
"learning_rate": 3.053166686309783e-06,
"loss": 0.13304147720336915,
"step": 560
},
{
"epoch": 2.7980173482032216,
"grad_norm": 0.10434003919363022,
"learning_rate": 2.440626198044327e-06,
"loss": 0.11780736446380616,
"step": 565
},
{
"epoch": 2.8228004956629493,
"grad_norm": 0.10914986580610275,
"learning_rate": 1.895848471765227e-06,
"loss": 0.12229269742965698,
"step": 570
},
{
"epoch": 2.8475836431226766,
"grad_norm": 0.11424117535352707,
"learning_rate": 1.4192118990299707e-06,
"loss": 0.12974271774291993,
"step": 575
},
{
"epoch": 2.8475836431226766,
"eval_loss": 0.1438693404197693,
"eval_runtime": 20.2164,
"eval_samples_per_second": 8.755,
"eval_steps_per_second": 2.226,
"step": 575
},
{
"epoch": 2.872366790582404,
"grad_norm": 0.10830768942832947,
"learning_rate": 1.0110475419330967e-06,
"loss": 0.12486574649810792,
"step": 580
},
{
"epoch": 2.8971499380421313,
"grad_norm": 0.11147851496934891,
"learning_rate": 6.716389031571568e-07,
"loss": 0.12139828205108642,
"step": 585
},
{
"epoch": 2.9219330855018586,
"grad_norm": 0.09997480362653732,
"learning_rate": 4.0122172905753266e-07,
"loss": 0.11921333074569702,
"step": 590
},
{
"epoch": 2.9467162329615864,
"grad_norm": 0.10038603842258453,
"learning_rate": 1.9998384591773944e-07,
"loss": 0.12386640310287475,
"step": 595
},
{
"epoch": 2.9714993804213137,
"grad_norm": 0.10965593159198761,
"learning_rate": 6.806502948918381e-08,
"loss": 0.11748340129852294,
"step": 600
},
{
"epoch": 2.9714993804213137,
"eval_loss": 0.14387772977352142,
"eval_runtime": 20.189,
"eval_samples_per_second": 8.767,
"eval_steps_per_second": 2.229,
"step": 600
},
{
"epoch": 2.996282527881041,
"grad_norm": 0.10880747437477112,
"learning_rate": 5.5569079056794206e-09,
"loss": 0.13690497875213622,
"step": 605
},
{
"epoch": 3.0,
"eval_loss": 0.14386552572250366,
"eval_runtime": 20.1823,
"eval_samples_per_second": 8.77,
"eval_steps_per_second": 2.23,
"step": 606
}
],
"logging_steps": 5,
"max_steps": 606,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 4.13889241360176e+17,
"train_batch_size": 1,
"trial_name": null,
"trial_params": null
}