zgrgr's picture
Upload model files with Nebius access
43b7e1c verified
Raw
History Blame
24.6 kB
{
"best_metric": 0.8136880993843079,
"best_model_checkpoint": "./outputs/instruct-lora-8b-aplly_chat_template-intellectual/checkpoint-1200",
"epoch": 1.8528389339513325,
"eval_steps": 20,
"global_step": 1200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.001544998068752414,
"eval_loss": 1.3165150880813599,
"eval_runtime": 48.891,
"eval_samples_per_second": 23.542,
"eval_steps_per_second": 5.891,
"step": 1
},
{
"epoch": 0.03089996137504828,
"grad_norm": 0.7807549238204956,
"learning_rate": 3.092783505154639e-06,
"loss": 1.2724,
"step": 20
},
{
"epoch": 0.03089996137504828,
"eval_loss": 1.314327597618103,
"eval_runtime": 48.8364,
"eval_samples_per_second": 23.568,
"eval_steps_per_second": 5.897,
"step": 20
},
{
"epoch": 0.06179992275009656,
"grad_norm": 0.8449882864952087,
"learning_rate": 6.185567010309278e-06,
"loss": 1.2394,
"step": 40
},
{
"epoch": 0.06179992275009656,
"eval_loss": 1.2848930358886719,
"eval_runtime": 48.9051,
"eval_samples_per_second": 23.535,
"eval_steps_per_second": 5.889,
"step": 40
},
{
"epoch": 0.09269988412514485,
"grad_norm": 0.8352286219596863,
"learning_rate": 9.278350515463918e-06,
"loss": 1.1438,
"step": 60
},
{
"epoch": 0.09269988412514485,
"eval_loss": 1.1923872232437134,
"eval_runtime": 48.8793,
"eval_samples_per_second": 23.548,
"eval_steps_per_second": 5.892,
"step": 60
},
{
"epoch": 0.12359984550019312,
"grad_norm": 0.877621591091156,
"learning_rate": 1.2371134020618556e-05,
"loss": 1.057,
"step": 80
},
{
"epoch": 0.12359984550019312,
"eval_loss": 1.13431978225708,
"eval_runtime": 50.9437,
"eval_samples_per_second": 22.594,
"eval_steps_per_second": 5.653,
"step": 80
},
{
"epoch": 0.1544998068752414,
"grad_norm": 0.9503705501556396,
"learning_rate": 1.5463917525773194e-05,
"loss": 1.0444,
"step": 100
},
{
"epoch": 0.1544998068752414,
"eval_loss": 1.0924711227416992,
"eval_runtime": 48.8783,
"eval_samples_per_second": 23.548,
"eval_steps_per_second": 5.892,
"step": 100
},
{
"epoch": 0.1853997682502897,
"grad_norm": 1.030405879020691,
"learning_rate": 1.8556701030927837e-05,
"loss": 0.994,
"step": 120
},
{
"epoch": 0.1853997682502897,
"eval_loss": 1.064813256263733,
"eval_runtime": 48.8238,
"eval_samples_per_second": 23.575,
"eval_steps_per_second": 5.899,
"step": 120
},
{
"epoch": 0.21629972962533797,
"grad_norm": 1.367910623550415,
"learning_rate": 2.1649484536082473e-05,
"loss": 0.9561,
"step": 140
},
{
"epoch": 0.21629972962533797,
"eval_loss": 1.036982774734497,
"eval_runtime": 51.1767,
"eval_samples_per_second": 22.491,
"eval_steps_per_second": 5.628,
"step": 140
},
{
"epoch": 0.24719969100038625,
"grad_norm": 1.3933994770050049,
"learning_rate": 2.4742268041237112e-05,
"loss": 0.9565,
"step": 160
},
{
"epoch": 0.24719969100038625,
"eval_loss": 1.019098162651062,
"eval_runtime": 50.3225,
"eval_samples_per_second": 22.872,
"eval_steps_per_second": 5.723,
"step": 160
},
{
"epoch": 0.27809965237543455,
"grad_norm": 1.367946982383728,
"learning_rate": 2.7835051546391755e-05,
"loss": 0.8842,
"step": 180
},
{
"epoch": 0.27809965237543455,
"eval_loss": 1.004747986793518,
"eval_runtime": 48.9997,
"eval_samples_per_second": 23.49,
"eval_steps_per_second": 5.878,
"step": 180
},
{
"epoch": 0.3089996137504828,
"grad_norm": 1.4316825866699219,
"learning_rate": 2.9999126880904965e-05,
"loss": 0.8863,
"step": 200
},
{
"epoch": 0.3089996137504828,
"eval_loss": 0.9973997473716736,
"eval_runtime": 50.6767,
"eval_samples_per_second": 22.713,
"eval_steps_per_second": 5.683,
"step": 200
},
{
"epoch": 0.3398995751255311,
"grad_norm": 1.4682165384292603,
"learning_rate": 2.998360759115084e-05,
"loss": 0.8935,
"step": 220
},
{
"epoch": 0.3398995751255311,
"eval_loss": 0.9823518991470337,
"eval_runtime": 48.7888,
"eval_samples_per_second": 23.591,
"eval_steps_per_second": 5.903,
"step": 220
},
{
"epoch": 0.3707995365005794,
"grad_norm": 1.6310033798217773,
"learning_rate": 2.9948708759677052e-05,
"loss": 0.8596,
"step": 240
},
{
"epoch": 0.3707995365005794,
"eval_loss": 0.9750108122825623,
"eval_runtime": 48.8205,
"eval_samples_per_second": 23.576,
"eval_steps_per_second": 5.899,
"step": 240
},
{
"epoch": 0.40169949787562764,
"grad_norm": 1.498504877090454,
"learning_rate": 2.9894475524035186e-05,
"loss": 0.8656,
"step": 260
},
{
"epoch": 0.40169949787562764,
"eval_loss": 0.9654810428619385,
"eval_runtime": 50.0758,
"eval_samples_per_second": 22.985,
"eval_steps_per_second": 5.751,
"step": 260
},
{
"epoch": 0.43259945925067594,
"grad_norm": 1.630052089691162,
"learning_rate": 2.9820978028564395e-05,
"loss": 0.852,
"step": 280
},
{
"epoch": 0.43259945925067594,
"eval_loss": 0.954610288143158,
"eval_runtime": 49.7619,
"eval_samples_per_second": 23.13,
"eval_steps_per_second": 5.788,
"step": 280
},
{
"epoch": 0.46349942062572425,
"grad_norm": 1.565081238746643,
"learning_rate": 2.9728311333667943e-05,
"loss": 0.8407,
"step": 300
},
{
"epoch": 0.46349942062572425,
"eval_loss": 0.9461371898651123,
"eval_runtime": 48.774,
"eval_samples_per_second": 23.599,
"eval_steps_per_second": 5.905,
"step": 300
},
{
"epoch": 0.4943993820007725,
"grad_norm": 1.5313355922698975,
"learning_rate": 2.961659529286366e-05,
"loss": 0.8102,
"step": 320
},
{
"epoch": 0.4943993820007725,
"eval_loss": 0.9419096112251282,
"eval_runtime": 48.7963,
"eval_samples_per_second": 23.588,
"eval_steps_per_second": 5.902,
"step": 320
},
{
"epoch": 0.5252993433758207,
"grad_norm": 1.8025727272033691,
"learning_rate": 2.948597439776749e-05,
"loss": 0.817,
"step": 340
},
{
"epoch": 0.5252993433758207,
"eval_loss": 0.9346877932548523,
"eval_runtime": 48.7844,
"eval_samples_per_second": 23.594,
"eval_steps_per_second": 5.904,
"step": 340
},
{
"epoch": 0.5561993047508691,
"grad_norm": 1.6470723152160645,
"learning_rate": 2.9336617591210508e-05,
"loss": 0.802,
"step": 360
},
{
"epoch": 0.5561993047508691,
"eval_loss": 0.9356982111930847,
"eval_runtime": 48.7896,
"eval_samples_per_second": 23.591,
"eval_steps_per_second": 5.903,
"step": 360
},
{
"epoch": 0.5870992661259173,
"grad_norm": 1.5940176248550415,
"learning_rate": 2.9168718048731113e-05,
"loss": 0.8232,
"step": 380
},
{
"epoch": 0.5870992661259173,
"eval_loss": 0.928005039691925,
"eval_runtime": 48.9837,
"eval_samples_per_second": 23.498,
"eval_steps_per_second": 5.88,
"step": 380
},
{
"epoch": 0.6179992275009656,
"grad_norm": 1.7030407190322876,
"learning_rate": 2.898249292872514e-05,
"loss": 0.8222,
"step": 400
},
{
"epoch": 0.6179992275009656,
"eval_loss": 0.9209285378456116,
"eval_runtime": 48.7992,
"eval_samples_per_second": 23.586,
"eval_steps_per_second": 5.902,
"step": 400
},
{
"epoch": 0.6488991888760139,
"grad_norm": 1.6369273662567139,
"learning_rate": 2.8778183091576867e-05,
"loss": 0.8094,
"step": 420
},
{
"epoch": 0.6488991888760139,
"eval_loss": 0.9116755127906799,
"eval_runtime": 48.8182,
"eval_samples_per_second": 23.577,
"eval_steps_per_second": 5.899,
"step": 420
},
{
"epoch": 0.6797991502510622,
"grad_norm": 1.6444923877716064,
"learning_rate": 2.855605278813435e-05,
"loss": 0.7793,
"step": 440
},
{
"epoch": 0.6797991502510622,
"eval_loss": 0.9064341187477112,
"eval_runtime": 48.9673,
"eval_samples_per_second": 23.505,
"eval_steps_per_second": 5.881,
"step": 440
},
{
"epoch": 0.7106991116261104,
"grad_norm": 1.5660841464996338,
"learning_rate": 2.8316389317931867e-05,
"loss": 0.7989,
"step": 460
},
{
"epoch": 0.7106991116261104,
"eval_loss": 0.9033644199371338,
"eval_runtime": 48.8113,
"eval_samples_per_second": 23.581,
"eval_steps_per_second": 5.9,
"step": 460
},
{
"epoch": 0.7415990730011588,
"grad_norm": 1.7576305866241455,
"learning_rate": 2.8059502657601618e-05,
"loss": 0.7804,
"step": 480
},
{
"epoch": 0.7415990730011588,
"eval_loss": 0.8978912234306335,
"eval_runtime": 50.7823,
"eval_samples_per_second": 22.665,
"eval_steps_per_second": 5.671,
"step": 480
},
{
"epoch": 0.772499034376207,
"grad_norm": 1.7764692306518555,
"learning_rate": 2.7785725059955288e-05,
"loss": 0.7651,
"step": 500
},
{
"epoch": 0.772499034376207,
"eval_loss": 0.8953514695167542,
"eval_runtime": 48.7892,
"eval_samples_per_second": 23.591,
"eval_steps_per_second": 5.903,
"step": 500
},
{
"epoch": 0.8033989957512553,
"grad_norm": 1.7256971597671509,
"learning_rate": 2.7495410624253885e-05,
"loss": 0.7886,
"step": 520
},
{
"epoch": 0.8033989957512553,
"eval_loss": 0.8885264992713928,
"eval_runtime": 48.7926,
"eval_samples_per_second": 23.59,
"eval_steps_per_second": 5.903,
"step": 520
},
{
"epoch": 0.8342989571263036,
"grad_norm": 1.761567234992981,
"learning_rate": 2.718893483822187e-05,
"loss": 0.7771,
"step": 540
},
{
"epoch": 0.8342989571263036,
"eval_loss": 0.8897767663002014,
"eval_runtime": 50.7177,
"eval_samples_per_second": 22.694,
"eval_steps_per_second": 5.678,
"step": 540
},
{
"epoch": 0.8651989185013519,
"grad_norm": 1.7774807214736938,
"learning_rate": 2.686669409239773e-05,
"loss": 0.7708,
"step": 560
},
{
"epoch": 0.8651989185013519,
"eval_loss": 0.884600043296814,
"eval_runtime": 48.8104,
"eval_samples_per_second": 23.581,
"eval_steps_per_second": 5.9,
"step": 560
},
{
"epoch": 0.8960988798764001,
"grad_norm": 1.616105079650879,
"learning_rate": 2.6529105167449225e-05,
"loss": 0.7656,
"step": 580
},
{
"epoch": 0.8960988798764001,
"eval_loss": 0.8817371129989624,
"eval_runtime": 48.7884,
"eval_samples_per_second": 23.592,
"eval_steps_per_second": 5.903,
"step": 580
},
{
"epoch": 0.9269988412514485,
"grad_norm": 1.5919208526611328,
"learning_rate": 2.6176604695116443e-05,
"loss": 0.7574,
"step": 600
},
{
"epoch": 0.9269988412514485,
"eval_loss": 0.878905713558197,
"eval_runtime": 51.0012,
"eval_samples_per_second": 22.568,
"eval_steps_per_second": 5.647,
"step": 600
},
{
"epoch": 0.9578988026264967,
"grad_norm": 1.7113957405090332,
"learning_rate": 2.5809648593479732e-05,
"loss": 0.78,
"step": 620
},
{
"epoch": 0.9578988026264967,
"eval_loss": 0.8750773072242737,
"eval_runtime": 48.8281,
"eval_samples_per_second": 23.572,
"eval_steps_per_second": 5.898,
"step": 620
},
{
"epoch": 0.988798764001545,
"grad_norm": 1.6923496723175049,
"learning_rate": 2.5428711477283085e-05,
"loss": 0.8123,
"step": 640
},
{
"epoch": 0.988798764001545,
"eval_loss": 0.8708633780479431,
"eval_runtime": 48.7852,
"eval_samples_per_second": 23.593,
"eval_steps_per_second": 5.903,
"step": 640
},
{
"epoch": 1.018539976825029,
"grad_norm": 1.8015915155410767,
"learning_rate": 2.5034286044075546e-05,
"loss": 0.7468,
"step": 660
},
{
"epoch": 1.018539976825029,
"eval_loss": 0.8686777353286743,
"eval_runtime": 49.0562,
"eval_samples_per_second": 23.463,
"eval_steps_per_second": 5.871,
"step": 660
},
{
"epoch": 1.0494399382000772,
"grad_norm": 1.838549256324768,
"learning_rate": 2.462688243696461e-05,
"loss": 0.7258,
"step": 680
},
{
"epoch": 1.0494399382000772,
"eval_loss": 0.8642013072967529,
"eval_runtime": 48.7685,
"eval_samples_per_second": 23.601,
"eval_steps_per_second": 5.905,
"step": 680
},
{
"epoch": 1.0803398995751254,
"grad_norm": 1.7961382865905762,
"learning_rate": 2.420702758480588e-05,
"loss": 0.7093,
"step": 700
},
{
"epoch": 1.0803398995751254,
"eval_loss": 0.8624302744865417,
"eval_runtime": 48.7964,
"eval_samples_per_second": 23.588,
"eval_steps_per_second": 5.902,
"step": 700
},
{
"epoch": 1.111239860950174,
"grad_norm": 1.7665976285934448,
"learning_rate": 2.3775264520682277e-05,
"loss": 0.6989,
"step": 720
},
{
"epoch": 1.111239860950174,
"eval_loss": 0.8579444289207458,
"eval_runtime": 48.7833,
"eval_samples_per_second": 23.594,
"eval_steps_per_second": 5.904,
"step": 720
},
{
"epoch": 1.1421398223252222,
"grad_norm": 1.9921693801879883,
"learning_rate": 2.3332151679554377e-05,
"loss": 0.686,
"step": 740
},
{
"epoch": 1.1421398223252222,
"eval_loss": 0.8583009839057922,
"eval_runtime": 48.8345,
"eval_samples_per_second": 23.569,
"eval_steps_per_second": 5.897,
"step": 740
},
{
"epoch": 1.1730397837002704,
"grad_norm": 1.8822782039642334,
"learning_rate": 2.2878262175990123e-05,
"loss": 0.6953,
"step": 760
},
{
"epoch": 1.1730397837002704,
"eval_loss": 0.8588049411773682,
"eval_runtime": 48.8072,
"eval_samples_per_second": 23.583,
"eval_steps_per_second": 5.901,
"step": 760
},
{
"epoch": 1.2039397450753186,
"grad_norm": 1.9839003086090088,
"learning_rate": 2.2414183062908324e-05,
"loss": 0.6849,
"step": 780
},
{
"epoch": 1.2039397450753186,
"eval_loss": 0.8559426665306091,
"eval_runtime": 48.7613,
"eval_samples_per_second": 23.605,
"eval_steps_per_second": 5.906,
"step": 780
},
{
"epoch": 1.234839706450367,
"grad_norm": 1.9713268280029297,
"learning_rate": 2.19405145722944e-05,
"loss": 0.7103,
"step": 800
},
{
"epoch": 1.234839706450367,
"eval_loss": 0.8510345816612244,
"eval_runtime": 48.7589,
"eval_samples_per_second": 23.606,
"eval_steps_per_second": 5.907,
"step": 800
},
{
"epoch": 1.2657396678254151,
"grad_norm": 1.9331954717636108,
"learning_rate": 2.1457869338870596e-05,
"loss": 0.6864,
"step": 820
},
{
"epoch": 1.2657396678254151,
"eval_loss": 0.850884199142456,
"eval_runtime": 48.759,
"eval_samples_per_second": 23.606,
"eval_steps_per_second": 5.907,
"step": 820
},
{
"epoch": 1.2966396292004636,
"grad_norm": 2.3717479705810547,
"learning_rate": 2.096687160772478e-05,
"loss": 0.6829,
"step": 840
},
{
"epoch": 1.2966396292004636,
"eval_loss": 0.8503381013870239,
"eval_runtime": 48.7619,
"eval_samples_per_second": 23.605,
"eval_steps_per_second": 5.906,
"step": 840
},
{
"epoch": 1.3275395905755119,
"grad_norm": 2.0674445629119873,
"learning_rate": 2.0468156426922442e-05,
"loss": 0.7029,
"step": 860
},
{
"epoch": 1.3275395905755119,
"eval_loss": 0.8445314168930054,
"eval_runtime": 48.7601,
"eval_samples_per_second": 23.605,
"eval_steps_per_second": 5.906,
"step": 860
},
{
"epoch": 1.35843955195056,
"grad_norm": 1.9750181436538696,
"learning_rate": 1.9962368826146446e-05,
"loss": 0.6955,
"step": 880
},
{
"epoch": 1.35843955195056,
"eval_loss": 0.8400866985321045,
"eval_runtime": 48.7637,
"eval_samples_per_second": 23.604,
"eval_steps_per_second": 5.906,
"step": 880
},
{
"epoch": 1.3893395133256083,
"grad_norm": 2.0038938522338867,
"learning_rate": 1.945016298242664e-05,
"loss": 0.6692,
"step": 900
},
{
"epoch": 1.3893395133256083,
"eval_loss": 0.8380523324012756,
"eval_runtime": 48.9093,
"eval_samples_per_second": 23.533,
"eval_steps_per_second": 5.888,
"step": 900
},
{
"epoch": 1.4202394747006566,
"grad_norm": 1.8987348079681396,
"learning_rate": 1.8932201374038505e-05,
"loss": 0.6654,
"step": 920
},
{
"epoch": 1.4202394747006566,
"eval_loss": 0.8386799693107605,
"eval_runtime": 48.7795,
"eval_samples_per_second": 23.596,
"eval_steps_per_second": 5.904,
"step": 920
},
{
"epoch": 1.4511394360757048,
"grad_norm": 2.025766372680664,
"learning_rate": 1.8409153923665073e-05,
"loss": 0.7131,
"step": 940
},
{
"epoch": 1.4511394360757048,
"eval_loss": 0.8346343636512756,
"eval_runtime": 51.0682,
"eval_samples_per_second": 22.539,
"eval_steps_per_second": 5.64,
"step": 940
},
{
"epoch": 1.482039397450753,
"grad_norm": 1.9496480226516724,
"learning_rate": 1.7881697131930393e-05,
"loss": 0.6742,
"step": 960
},
{
"epoch": 1.482039397450753,
"eval_loss": 0.8343452215194702,
"eval_runtime": 48.7857,
"eval_samples_per_second": 23.593,
"eval_steps_per_second": 5.903,
"step": 960
},
{
"epoch": 1.5129393588258013,
"grad_norm": 2.2017662525177,
"learning_rate": 1.7350513202425192e-05,
"loss": 0.6731,
"step": 980
},
{
"epoch": 1.5129393588258013,
"eval_loss": 0.831669807434082,
"eval_runtime": 48.7641,
"eval_samples_per_second": 23.603,
"eval_steps_per_second": 5.906,
"step": 980
},
{
"epoch": 1.5438393202008498,
"grad_norm": 2.1149885654449463,
"learning_rate": 1.681628915935642e-05,
"loss": 0.6843,
"step": 1000
},
{
"epoch": 1.5438393202008498,
"eval_loss": 0.8293876051902771,
"eval_runtime": 51.2816,
"eval_samples_per_second": 22.445,
"eval_steps_per_second": 5.616,
"step": 1000
},
{
"epoch": 1.574739281575898,
"grad_norm": 2.221484899520874,
"learning_rate": 1.627971595896191e-05,
"loss": 0.6875,
"step": 1020
},
{
"epoch": 1.574739281575898,
"eval_loss": 0.8284665942192078,
"eval_runtime": 48.8242,
"eval_samples_per_second": 23.574,
"eval_steps_per_second": 5.899,
"step": 1020
},
{
"epoch": 1.6056392429509463,
"grad_norm": 2.17756986618042,
"learning_rate": 1.5741487595839394e-05,
"loss": 0.6713,
"step": 1040
},
{
"epoch": 1.6056392429509463,
"eval_loss": 0.8284040093421936,
"eval_runtime": 48.8193,
"eval_samples_per_second": 23.577,
"eval_steps_per_second": 5.899,
"step": 1040
},
{
"epoch": 1.6365392043259948,
"grad_norm": 1.9823157787322998,
"learning_rate": 1.5202300205345747e-05,
"loss": 0.6839,
"step": 1060
},
{
"epoch": 1.6365392043259948,
"eval_loss": 0.8247435092926025,
"eval_runtime": 51.2128,
"eval_samples_per_second": 22.475,
"eval_steps_per_second": 5.624,
"step": 1060
},
{
"epoch": 1.667439165701043,
"grad_norm": 2.0765607357025146,
"learning_rate": 1.4662851163227446e-05,
"loss": 0.6845,
"step": 1080
},
{
"epoch": 1.667439165701043,
"eval_loss": 0.8243246078491211,
"eval_runtime": 48.7965,
"eval_samples_per_second": 23.588,
"eval_steps_per_second": 5.902,
"step": 1080
},
{
"epoch": 1.6983391270760912,
"grad_norm": 2.0634026527404785,
"learning_rate": 1.41238381836467e-05,
"loss": 0.6792,
"step": 1100
},
{
"epoch": 1.6983391270760912,
"eval_loss": 0.8208648562431335,
"eval_runtime": 48.7933,
"eval_samples_per_second": 23.589,
"eval_steps_per_second": 5.902,
"step": 1100
},
{
"epoch": 1.7292390884511395,
"grad_norm": 1.9673739671707153,
"learning_rate": 1.3585958416769904e-05,
"loss": 0.6512,
"step": 1120
},
{
"epoch": 1.7292390884511395,
"eval_loss": 0.8207812905311584,
"eval_runtime": 48.8357,
"eval_samples_per_second": 23.569,
"eval_steps_per_second": 5.897,
"step": 1120
},
{
"epoch": 1.7601390498261877,
"grad_norm": 2.3055999279022217,
"learning_rate": 1.304990754708551e-05,
"loss": 0.6502,
"step": 1140
},
{
"epoch": 1.7601390498261877,
"eval_loss": 0.818783164024353,
"eval_runtime": 48.8503,
"eval_samples_per_second": 23.562,
"eval_steps_per_second": 5.896,
"step": 1140
},
{
"epoch": 1.791039011201236,
"grad_norm": 2.2930891513824463,
"learning_rate": 1.2516378893617636e-05,
"loss": 0.6552,
"step": 1160
},
{
"epoch": 1.791039011201236,
"eval_loss": 0.8174114227294922,
"eval_runtime": 48.8468,
"eval_samples_per_second": 23.563,
"eval_steps_per_second": 5.896,
"step": 1160
},
{
"epoch": 1.8219389725762842,
"grad_norm": 1.9812862873077393,
"learning_rate": 1.1986062513199107e-05,
"loss": 0.6382,
"step": 1180
},
{
"epoch": 1.8219389725762842,
"eval_loss": 0.8155190944671631,
"eval_runtime": 48.7931,
"eval_samples_per_second": 23.589,
"eval_steps_per_second": 5.902,
"step": 1180
},
{
"epoch": 1.8528389339513325,
"grad_norm": 2.177253007888794,
"learning_rate": 1.1459644307963727e-05,
"loss": 0.6748,
"step": 1200
},
{
"epoch": 1.8528389339513325,
"eval_loss": 0.8136880993843079,
"eval_runtime": 48.7851,
"eval_samples_per_second": 23.593,
"eval_steps_per_second": 5.903,
"step": 1200
}
],
"logging_steps": 20,
"max_steps": 1941,
"num_input_tokens_seen": 0,
"num_train_epochs": 3,
"save_steps": 200,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 3,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.484725714805064e+17,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}