tongue-table-lora-brick2-hf-v1 / brick1_adapter /trainer_state_final.json
issdandavis's picture
Training in progress, step 25
1b05a95 verified
Raw
History Blame Contribute Delete
14.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 5.0673400673400675,
"eval_steps": 500,
"global_step": 750,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0364963503649635,
"grad_norm": 0.828892171382904,
"learning_rate": 1.08e-05,
"loss": 0.4354942798614502,
"step": 10
},
{
"epoch": 0.072992700729927,
"grad_norm": 0.9289367198944092,
"learning_rate": 2.2800000000000002e-05,
"loss": 0.36432347297668455,
"step": 20
},
{
"epoch": 0.10948905109489052,
"grad_norm": 2.0873074531555176,
"learning_rate": 2.999774682924681e-05,
"loss": 0.32090737819671633,
"step": 30
},
{
"epoch": 0.145985401459854,
"grad_norm": 4.841006278991699,
"learning_rate": 2.9972406431448155e-05,
"loss": 0.43266544342041013,
"step": 40
},
{
"epoch": 0.18248175182481752,
"grad_norm": 2.7465760707855225,
"learning_rate": 2.9918956905010563e-05,
"loss": 0.5646582126617432,
"step": 50
},
{
"epoch": 0.21897810218978103,
"grad_norm": 1.030403971672058,
"learning_rate": 2.983749859583509e-05,
"loss": 0.3808066129684448,
"step": 60
},
{
"epoch": 0.25547445255474455,
"grad_norm": 0.7817710041999817,
"learning_rate": 2.9728184433385794e-05,
"loss": 0.4072124481201172,
"step": 70
},
{
"epoch": 0.291970802919708,
"grad_norm": 1.3247804641723633,
"learning_rate": 2.9591219643580672e-05,
"loss": 0.3555629730224609,
"step": 80
},
{
"epoch": 0.3284671532846715,
"grad_norm": 3.1126701831817627,
"learning_rate": 2.9426861363501402e-05,
"loss": 0.3507055759429932,
"step": 90
},
{
"epoch": 0.36496350364963503,
"grad_norm": 1.0930603742599487,
"learning_rate": 2.9235418158645382e-05,
"loss": 0.33841102123260497,
"step": 100
},
{
"epoch": 0.40145985401459855,
"grad_norm": 1.4056899547576904,
"learning_rate": 2.9017249443626213e-05,
"loss": 0.3785548210144043,
"step": 110
},
{
"epoch": 0.43795620437956206,
"grad_norm": 1.8448857069015503,
"learning_rate": 2.8772764807410347e-05,
"loss": 0.3630043029785156,
"step": 120
},
{
"epoch": 0.4744525547445255,
"grad_norm": 0.9118333458900452,
"learning_rate": 2.8502423244356567e-05,
"loss": 0.3892256736755371,
"step": 130
},
{
"epoch": 0.5109489051094891,
"grad_norm": 3.103043794631958,
"learning_rate": 2.820673229250209e-05,
"loss": 0.40395588874816896,
"step": 140
},
{
"epoch": 0.5474452554744526,
"grad_norm": 1.371759057044983,
"learning_rate": 2.7886247080712864e-05,
"loss": 0.3903501510620117,
"step": 150
},
{
"epoch": 0.583941605839416,
"grad_norm": 0.7535229325294495,
"learning_rate": 2.7541569286487182e-05,
"loss": 0.35717196464538575,
"step": 160
},
{
"epoch": 0.6204379562043796,
"grad_norm": 1.2660030126571655,
"learning_rate": 2.7173346006369036e-05,
"loss": 0.26791996955871583,
"step": 170
},
{
"epoch": 1.2154882154882154,
"grad_norm": 23.720056533813477,
"learning_rate": 2.6260084578790863e-05,
"loss": 5.0859,
"step": 180
},
{
"epoch": 1.2828282828282829,
"grad_norm": 7.147736072540283,
"learning_rate": 2.5829341409317866e-05,
"loss": 3.2131,
"step": 190
},
{
"epoch": 1.3501683501683501,
"grad_norm": 4.732028484344482,
"learning_rate": 2.5379083034663196e-05,
"loss": 1.8717,
"step": 200
},
{
"epoch": 1.4175084175084174,
"grad_norm": 2.9123284816741943,
"learning_rate": 2.491012085085122e-05,
"loss": 0.9048,
"step": 210
},
{
"epoch": 1.4848484848484849,
"grad_norm": 1.7257939577102661,
"learning_rate": 2.4423299959434637e-05,
"loss": 0.6315,
"step": 220
},
{
"epoch": 1.5521885521885523,
"grad_norm": 1.5153653621673584,
"learning_rate": 2.3919497644564302e-05,
"loss": 0.5315,
"step": 230
},
{
"epoch": 1.6195286195286194,
"grad_norm": 1.7134076356887817,
"learning_rate": 2.339962179206393e-05,
"loss": 0.4746,
"step": 240
},
{
"epoch": 1.6868686868686869,
"grad_norm": 1.3939902782440186,
"learning_rate": 2.2864609253358477e-05,
"loss": 0.4457,
"step": 250
},
{
"epoch": 1.7542087542087543,
"grad_norm": 1.5202797651290894,
"learning_rate": 2.231542415720452e-05,
"loss": 0.4148,
"step": 260
},
{
"epoch": 1.8215488215488216,
"grad_norm": 3.209591865539551,
"learning_rate": 2.17530561722651e-05,
"loss": 0.4057,
"step": 270
},
{
"epoch": 1.8888888888888888,
"grad_norm": 1.0990711450576782,
"learning_rate": 2.117851872365989e-05,
"loss": 0.4023,
"step": 280
},
{
"epoch": 1.9562289562289563,
"grad_norm": 1.259845495223999,
"learning_rate": 2.059284716670463e-05,
"loss": 0.3876,
"step": 290
},
{
"epoch": 2.026936026936027,
"grad_norm": 1.3019286394119263,
"learning_rate": 1.9997096921130865e-05,
"loss": 0.4163,
"step": 300
},
{
"epoch": 2.0942760942760943,
"grad_norm": 1.3461154699325562,
"learning_rate": 1.9392341569148254e-05,
"loss": 0.3977,
"step": 310
},
{
"epoch": 2.1616161616161618,
"grad_norm": 1.1439738273620605,
"learning_rate": 1.877967092077688e-05,
"loss": 0.3716,
"step": 320
},
{
"epoch": 2.228956228956229,
"grad_norm": 1.1023906469345093,
"learning_rate": 1.8160189049935895e-05,
"loss": 0.3774,
"step": 330
},
{
"epoch": 2.2962962962962963,
"grad_norm": 1.4419972896575928,
"learning_rate": 1.7535012304827737e-05,
"loss": 0.3775,
"step": 340
},
{
"epoch": 2.3636363636363638,
"grad_norm": 0.8919001221656799,
"learning_rate": 1.6905267296203182e-05,
"loss": 0.3826,
"step": 350
},
{
"epoch": 2.430976430976431,
"grad_norm": 1.0658531188964844,
"learning_rate": 1.627208886713264e-05,
"loss": 0.3735,
"step": 360
},
{
"epoch": 2.4983164983164983,
"grad_norm": 1.0677207708358765,
"learning_rate": 1.5636618047942225e-05,
"loss": 0.3608,
"step": 370
},
{
"epoch": 2.5656565656565657,
"grad_norm": 1.1946293115615845,
"learning_rate": 1.5e-05,
"loss": 0.3667,
"step": 380
},
{
"epoch": 2.6329966329966332,
"grad_norm": 0.9220478534698486,
"learning_rate": 1.4363381952057779e-05,
"loss": 0.3608,
"step": 390
},
{
"epoch": 2.7003367003367003,
"grad_norm": 1.3499350547790527,
"learning_rate": 1.3727911132867368e-05,
"loss": 0.3745,
"step": 400
},
{
"epoch": 2.7676767676767677,
"grad_norm": 1.3389482498168945,
"learning_rate": 1.3094732703796819e-05,
"loss": 0.3586,
"step": 410
},
{
"epoch": 2.8350168350168348,
"grad_norm": 1.209559679031372,
"learning_rate": 1.2464987695172267e-05,
"loss": 0.3448,
"step": 420
},
{
"epoch": 2.9023569023569022,
"grad_norm": 1.0429422855377197,
"learning_rate": 1.183981095006411e-05,
"loss": 0.3682,
"step": 430
},
{
"epoch": 2.9696969696969697,
"grad_norm": 1.270484209060669,
"learning_rate": 1.1220329079223125e-05,
"loss": 0.3574,
"step": 440
},
{
"epoch": 3.04040404040404,
"grad_norm": 1.0506254434585571,
"learning_rate": 1.0607658430851745e-05,
"loss": 0.3901,
"step": 450
},
{
"epoch": 3.1077441077441077,
"grad_norm": 0.8597121834754944,
"learning_rate": 1.0002903078869137e-05,
"loss": 0.3483,
"step": 460
},
{
"epoch": 3.175084175084175,
"grad_norm": 0.8475470542907715,
"learning_rate": 9.407152833295373e-06,
"loss": 0.3607,
"step": 470
},
{
"epoch": 3.242424242424242,
"grad_norm": 0.8766200542449951,
"learning_rate": 8.821481276340111e-06,
"loss": 0.3551,
"step": 480
},
{
"epoch": 3.3097643097643097,
"grad_norm": 1.0985888242721558,
"learning_rate": 8.246943827734899e-06,
"loss": 0.3562,
"step": 490
},
{
"epoch": 3.377104377104377,
"grad_norm": 0.8100714683532715,
"learning_rate": 7.684575842795486e-06,
"loss": 0.3623,
"step": 500
},
{
"epoch": 3.377104377104377,
"eval_loss": 0.36943843960762024,
"eval_runtime": 4.1729,
"eval_samples_per_second": 61.588,
"eval_steps_per_second": 15.577,
"step": 500
},
{
"epoch": 3.4444444444444446,
"grad_norm": 1.0126490592956543,
"learning_rate": 7.135390746641527e-06,
"loss": 0.3508,
"step": 510
},
{
"epoch": 3.5117845117845117,
"grad_norm": 0.8240623474121094,
"learning_rate": 6.60037820793607e-06,
"loss": 0.3466,
"step": 520
},
{
"epoch": 3.579124579124579,
"grad_norm": 0.7924415469169617,
"learning_rate": 6.080502355435702e-06,
"loss": 0.3488,
"step": 530
},
{
"epoch": 3.6464646464646466,
"grad_norm": 0.9690365791320801,
"learning_rate": 5.5767000405653645e-06,
"loss": 0.3506,
"step": 540
},
{
"epoch": 3.7138047138047137,
"grad_norm": 0.8754220008850098,
"learning_rate": 5.089879149148781e-06,
"loss": 0.3442,
"step": 550
},
{
"epoch": 3.781144781144781,
"grad_norm": 0.8320648670196533,
"learning_rate": 4.620916965336809e-06,
"loss": 0.3549,
"step": 560
},
{
"epoch": 3.8484848484848486,
"grad_norm": 1.1898738145828247,
"learning_rate": 4.170658590682134e-06,
"loss": 0.3472,
"step": 570
},
{
"epoch": 3.915824915824916,
"grad_norm": 1.111453890800476,
"learning_rate": 3.7399154212091336e-06,
"loss": 0.3548,
"step": 580
},
{
"epoch": 3.983164983164983,
"grad_norm": 0.9030128121376038,
"learning_rate": 3.329463685223411e-06,
"loss": 0.3445,
"step": 590
},
{
"epoch": 4.053872053872054,
"grad_norm": 0.8622605204582214,
"learning_rate": 2.940043044495894e-06,
"loss": 0.3847,
"step": 600
},
{
"epoch": 4.121212121212121,
"grad_norm": 0.7712292075157166,
"learning_rate": 2.572355261342369e-06,
"loss": 0.3399,
"step": 610
},
{
"epoch": 4.188552188552189,
"grad_norm": 0.9418888092041016,
"learning_rate": 2.2270629340003306e-06,
"loss": 0.3389,
"step": 620
},
{
"epoch": 4.255892255892256,
"grad_norm": 0.6980782747268677,
"learning_rate": 1.9047883025821777e-06,
"loss": 0.3418,
"step": 630
},
{
"epoch": 4.3232323232323235,
"grad_norm": 0.7036774754524231,
"learning_rate": 1.6061121277564743e-06,
"loss": 0.3542,
"step": 640
},
{
"epoch": 4.390572390572391,
"grad_norm": 0.7862967252731323,
"learning_rate": 1.331572644177963e-06,
"loss": 0.351,
"step": 650
},
{
"epoch": 4.457912457912458,
"grad_norm": 0.9763192534446716,
"learning_rate": 1.0816645905523598e-06,
"loss": 0.3431,
"step": 660
},
{
"epoch": 4.525252525252525,
"grad_norm": 0.9646930694580078,
"learning_rate": 8.568383180837369e-07,
"loss": 0.3566,
"step": 670
},
{
"epoch": 4.592592592592593,
"grad_norm": 0.7037179470062256,
"learning_rate": 6.574989789112374e-07,
"loss": 0.344,
"step": 680
},
{
"epoch": 4.65993265993266,
"grad_norm": 1.0083799362182617,
"learning_rate": 4.840057959975169e-07,
"loss": 0.3488,
"step": 690
},
{
"epoch": 4.7272727272727275,
"grad_norm": 0.7868887186050415,
"learning_rate": 3.3667141578470785e-07,
"loss": 0.3442,
"step": 700
},
{
"epoch": 4.794612794612795,
"grad_norm": 1.0048251152038574,
"learning_rate": 2.1576134478437315e-07,
"loss": 0.3568,
"step": 710
},
{
"epoch": 4.861952861952862,
"grad_norm": 0.9245824217796326,
"learning_rate": 1.214934711168475e-07,
"loss": 0.347,
"step": 720
},
{
"epoch": 4.929292929292929,
"grad_norm": 0.9527543783187866,
"learning_rate": 5.403767186210218e-08,
"loss": 0.3379,
"step": 730
},
{
"epoch": 4.9966329966329965,
"grad_norm": 0.9715042114257812,
"learning_rate": 1.3515506929778765e-08,
"loss": 0.3439,
"step": 740
},
{
"epoch": 5.0673400673400675,
"grad_norm": 0.8542423844337463,
"learning_rate": 0.0,
"loss": 0.3763,
"step": 750
}
],
"logging_steps": 10,
"max_steps": 750,
"num_input_tokens_seen": 0,
"num_train_epochs": 6,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5364040369493760.0,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}