dzanbek's picture
Training in progress, step 75, checkpoint
c55723b verified
Raw
History Blame Contribute Delete
14.5 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.059982005398380486,
"eval_steps": 25,
"global_step": 75,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0007997600719784065,
"grad_norm": 6.327381610870361,
"learning_rate": 6.666666666666667e-05,
"loss": 7.5777,
"step": 1
},
{
"epoch": 0.0007997600719784065,
"eval_loss": 8.017860412597656,
"eval_runtime": 287.8541,
"eval_samples_per_second": 3.658,
"eval_steps_per_second": 1.831,
"step": 1
},
{
"epoch": 0.001599520143956813,
"grad_norm": 6.17039155960083,
"learning_rate": 0.00013333333333333334,
"loss": 7.6098,
"step": 2
},
{
"epoch": 0.0023992802159352195,
"grad_norm": 5.528576850891113,
"learning_rate": 0.0002,
"loss": 7.7284,
"step": 3
},
{
"epoch": 0.003199040287913626,
"grad_norm": 6.728517532348633,
"learning_rate": 0.0001999048221581858,
"loss": 7.4974,
"step": 4
},
{
"epoch": 0.003998800359892032,
"grad_norm": 5.695092678070068,
"learning_rate": 0.00019961946980917456,
"loss": 5.9835,
"step": 5
},
{
"epoch": 0.004798560431870439,
"grad_norm": 6.079351902008057,
"learning_rate": 0.00019914448613738106,
"loss": 5.1384,
"step": 6
},
{
"epoch": 0.005598320503848845,
"grad_norm": 6.481296539306641,
"learning_rate": 0.00019848077530122083,
"loss": 5.0691,
"step": 7
},
{
"epoch": 0.006398080575827252,
"grad_norm": 7.214561462402344,
"learning_rate": 0.00019762960071199333,
"loss": 4.8119,
"step": 8
},
{
"epoch": 0.0071978406478056586,
"grad_norm": 7.010176658630371,
"learning_rate": 0.00019659258262890683,
"loss": 4.5991,
"step": 9
},
{
"epoch": 0.007997600719784064,
"grad_norm": 6.9982590675354,
"learning_rate": 0.0001953716950748227,
"loss": 4.6868,
"step": 10
},
{
"epoch": 0.00879736079176247,
"grad_norm": 6.621185302734375,
"learning_rate": 0.00019396926207859084,
"loss": 4.2868,
"step": 11
},
{
"epoch": 0.009597120863740878,
"grad_norm": 5.465557098388672,
"learning_rate": 0.0001923879532511287,
"loss": 4.0701,
"step": 12
},
{
"epoch": 0.010396880935719284,
"grad_norm": 6.433826923370361,
"learning_rate": 0.000190630778703665,
"loss": 4.166,
"step": 13
},
{
"epoch": 0.01119664100769769,
"grad_norm": 6.815083026885986,
"learning_rate": 0.00018870108331782217,
"loss": 4.2868,
"step": 14
},
{
"epoch": 0.011996401079676098,
"grad_norm": 5.863327980041504,
"learning_rate": 0.00018660254037844388,
"loss": 4.2603,
"step": 15
},
{
"epoch": 0.012796161151654504,
"grad_norm": 4.982174396514893,
"learning_rate": 0.0001843391445812886,
"loss": 4.2987,
"step": 16
},
{
"epoch": 0.01359592122363291,
"grad_norm": 4.87175178527832,
"learning_rate": 0.0001819152044288992,
"loss": 3.9961,
"step": 17
},
{
"epoch": 0.014395681295611317,
"grad_norm": 5.400818347930908,
"learning_rate": 0.00017933533402912354,
"loss": 4.143,
"step": 18
},
{
"epoch": 0.015195441367589723,
"grad_norm": 5.048769950866699,
"learning_rate": 0.0001766044443118978,
"loss": 4.2183,
"step": 19
},
{
"epoch": 0.01599520143956813,
"grad_norm": 4.657977104187012,
"learning_rate": 0.0001737277336810124,
"loss": 4.0424,
"step": 20
},
{
"epoch": 0.016794961511546535,
"grad_norm": 5.078902244567871,
"learning_rate": 0.00017071067811865476,
"loss": 4.3025,
"step": 21
},
{
"epoch": 0.01759472158352494,
"grad_norm": 5.692748069763184,
"learning_rate": 0.00016755902076156604,
"loss": 4.0202,
"step": 22
},
{
"epoch": 0.01839448165550335,
"grad_norm": 4.6804070472717285,
"learning_rate": 0.00016427876096865394,
"loss": 4.2141,
"step": 23
},
{
"epoch": 0.019194241727481756,
"grad_norm": 4.39948844909668,
"learning_rate": 0.00016087614290087208,
"loss": 4.0431,
"step": 24
},
{
"epoch": 0.019994001799460162,
"grad_norm": 5.215299606323242,
"learning_rate": 0.0001573576436351046,
"loss": 4.0373,
"step": 25
},
{
"epoch": 0.019994001799460162,
"eval_loss": 3.997077703475952,
"eval_runtime": 289.3626,
"eval_samples_per_second": 3.639,
"eval_steps_per_second": 1.821,
"step": 25
},
{
"epoch": 0.020793761871438568,
"grad_norm": 5.740684986114502,
"learning_rate": 0.0001537299608346824,
"loss": 4.2566,
"step": 26
},
{
"epoch": 0.021593521943416974,
"grad_norm": 5.554161548614502,
"learning_rate": 0.00015000000000000001,
"loss": 3.9106,
"step": 27
},
{
"epoch": 0.02239328201539538,
"grad_norm": 4.885501384735107,
"learning_rate": 0.00014617486132350343,
"loss": 4.0344,
"step": 28
},
{
"epoch": 0.02319304208737379,
"grad_norm": 6.132773399353027,
"learning_rate": 0.00014226182617406996,
"loss": 4.4499,
"step": 29
},
{
"epoch": 0.023992802159352195,
"grad_norm": 4.748602390289307,
"learning_rate": 0.000138268343236509,
"loss": 4.0122,
"step": 30
},
{
"epoch": 0.0247925622313306,
"grad_norm": 4.478851318359375,
"learning_rate": 0.00013420201433256689,
"loss": 3.8626,
"step": 31
},
{
"epoch": 0.025592322303309007,
"grad_norm": 4.523096561431885,
"learning_rate": 0.00013007057995042732,
"loss": 3.9546,
"step": 32
},
{
"epoch": 0.026392082375287413,
"grad_norm": 6.3320794105529785,
"learning_rate": 0.00012588190451025207,
"loss": 4.3883,
"step": 33
},
{
"epoch": 0.02719184244726582,
"grad_norm": 5.49621057510376,
"learning_rate": 0.00012164396139381029,
"loss": 4.14,
"step": 34
},
{
"epoch": 0.02799160251924423,
"grad_norm": 5.168715000152588,
"learning_rate": 0.00011736481776669306,
"loss": 3.6449,
"step": 35
},
{
"epoch": 0.028791362591222634,
"grad_norm": 5.227668285369873,
"learning_rate": 0.00011305261922200519,
"loss": 3.6928,
"step": 36
},
{
"epoch": 0.02959112266320104,
"grad_norm": 4.343628406524658,
"learning_rate": 0.00010871557427476583,
"loss": 3.6469,
"step": 37
},
{
"epoch": 0.030390882735179446,
"grad_norm": 6.07112455368042,
"learning_rate": 0.00010436193873653361,
"loss": 3.7737,
"step": 38
},
{
"epoch": 0.031190642807157852,
"grad_norm": 6.020794868469238,
"learning_rate": 0.0001,
"loss": 4.0414,
"step": 39
},
{
"epoch": 0.03199040287913626,
"grad_norm": 5.776181221008301,
"learning_rate": 9.563806126346642e-05,
"loss": 3.78,
"step": 40
},
{
"epoch": 0.032790162951114664,
"grad_norm": 5.805772304534912,
"learning_rate": 9.128442572523417e-05,
"loss": 3.882,
"step": 41
},
{
"epoch": 0.03358992302309307,
"grad_norm": 5.020073413848877,
"learning_rate": 8.694738077799488e-05,
"loss": 3.8944,
"step": 42
},
{
"epoch": 0.034389683095071476,
"grad_norm": 4.815114974975586,
"learning_rate": 8.263518223330697e-05,
"loss": 3.6254,
"step": 43
},
{
"epoch": 0.03518944316704988,
"grad_norm": 5.086230754852295,
"learning_rate": 7.835603860618972e-05,
"loss": 3.9899,
"step": 44
},
{
"epoch": 0.035989203239028295,
"grad_norm": 5.002678871154785,
"learning_rate": 7.411809548974792e-05,
"loss": 3.681,
"step": 45
},
{
"epoch": 0.0367889633110067,
"grad_norm": 4.317289352416992,
"learning_rate": 6.992942004957271e-05,
"loss": 3.8644,
"step": 46
},
{
"epoch": 0.037588723382985106,
"grad_norm": 4.629146575927734,
"learning_rate": 6.579798566743314e-05,
"loss": 3.9064,
"step": 47
},
{
"epoch": 0.03838848345496351,
"grad_norm": 4.717955112457275,
"learning_rate": 6.173165676349103e-05,
"loss": 3.7925,
"step": 48
},
{
"epoch": 0.03918824352694192,
"grad_norm": 4.8145856857299805,
"learning_rate": 5.773817382593008e-05,
"loss": 3.78,
"step": 49
},
{
"epoch": 0.039988003598920324,
"grad_norm": 3.983384370803833,
"learning_rate": 5.382513867649663e-05,
"loss": 3.963,
"step": 50
},
{
"epoch": 0.039988003598920324,
"eval_loss": 3.8365397453308105,
"eval_runtime": 288.8744,
"eval_samples_per_second": 3.645,
"eval_steps_per_second": 1.824,
"step": 50
},
{
"epoch": 0.04078776367089873,
"grad_norm": 5.371262073516846,
"learning_rate": 5.000000000000002e-05,
"loss": 3.942,
"step": 51
},
{
"epoch": 0.041587523742877136,
"grad_norm": 5.728109359741211,
"learning_rate": 4.6270039165317605e-05,
"loss": 3.8686,
"step": 52
},
{
"epoch": 0.04238728381485554,
"grad_norm": 4.341375827789307,
"learning_rate": 4.264235636489542e-05,
"loss": 3.5577,
"step": 53
},
{
"epoch": 0.04318704388683395,
"grad_norm": 4.182137966156006,
"learning_rate": 3.9123857099127936e-05,
"loss": 3.485,
"step": 54
},
{
"epoch": 0.043986803958812354,
"grad_norm": 4.7370405197143555,
"learning_rate": 3.5721239031346066e-05,
"loss": 3.9982,
"step": 55
},
{
"epoch": 0.04478656403079076,
"grad_norm": 4.426697731018066,
"learning_rate": 3.244097923843398e-05,
"loss": 3.6931,
"step": 56
},
{
"epoch": 0.04558632410276917,
"grad_norm": 4.092799186706543,
"learning_rate": 2.9289321881345254e-05,
"loss": 3.7611,
"step": 57
},
{
"epoch": 0.04638608417474758,
"grad_norm": 4.8570098876953125,
"learning_rate": 2.6272266318987603e-05,
"loss": 3.4304,
"step": 58
},
{
"epoch": 0.047185844246725984,
"grad_norm": 4.567028522491455,
"learning_rate": 2.339555568810221e-05,
"loss": 3.7632,
"step": 59
},
{
"epoch": 0.04798560431870439,
"grad_norm": 5.1109185218811035,
"learning_rate": 2.0664665970876496e-05,
"loss": 4.0769,
"step": 60
},
{
"epoch": 0.048785364390682796,
"grad_norm": 4.340146064758301,
"learning_rate": 1.808479557110081e-05,
"loss": 3.6998,
"step": 61
},
{
"epoch": 0.0495851244626612,
"grad_norm": 5.708188056945801,
"learning_rate": 1.566085541871145e-05,
"loss": 3.684,
"step": 62
},
{
"epoch": 0.05038488453463961,
"grad_norm": 4.427576065063477,
"learning_rate": 1.339745962155613e-05,
"loss": 3.8579,
"step": 63
},
{
"epoch": 0.051184644606618014,
"grad_norm": 5.3037800788879395,
"learning_rate": 1.129891668217783e-05,
"loss": 4.1091,
"step": 64
},
{
"epoch": 0.05198440467859642,
"grad_norm": 4.853593826293945,
"learning_rate": 9.369221296335006e-06,
"loss": 4.2218,
"step": 65
},
{
"epoch": 0.052784164750574826,
"grad_norm": 6.393092155456543,
"learning_rate": 7.612046748871327e-06,
"loss": 3.8463,
"step": 66
},
{
"epoch": 0.05358392482255323,
"grad_norm": 4.756587028503418,
"learning_rate": 6.030737921409169e-06,
"loss": 4.0146,
"step": 67
},
{
"epoch": 0.05438368489453164,
"grad_norm": 4.337407112121582,
"learning_rate": 4.628304925177318e-06,
"loss": 3.5736,
"step": 68
},
{
"epoch": 0.055183444966510044,
"grad_norm": 4.383087635040283,
"learning_rate": 3.40741737109318e-06,
"loss": 3.7182,
"step": 69
},
{
"epoch": 0.05598320503848846,
"grad_norm": 4.449667453765869,
"learning_rate": 2.3703992880066638e-06,
"loss": 3.8575,
"step": 70
},
{
"epoch": 0.05678296511046686,
"grad_norm": 4.845231533050537,
"learning_rate": 1.5192246987791981e-06,
"loss": 3.6972,
"step": 71
},
{
"epoch": 0.05758272518244527,
"grad_norm": 4.200953483581543,
"learning_rate": 8.555138626189618e-07,
"loss": 3.937,
"step": 72
},
{
"epoch": 0.058382485254423674,
"grad_norm": 5.014280319213867,
"learning_rate": 3.805301908254455e-07,
"loss": 3.5019,
"step": 73
},
{
"epoch": 0.05918224532640208,
"grad_norm": 4.5435919761657715,
"learning_rate": 9.517784181422019e-08,
"loss": 4.1094,
"step": 74
},
{
"epoch": 0.059982005398380486,
"grad_norm": 4.351820945739746,
"learning_rate": 0.0,
"loss": 3.8918,
"step": 75
},
{
"epoch": 0.059982005398380486,
"eval_loss": 3.7904601097106934,
"eval_runtime": 288.9933,
"eval_samples_per_second": 3.644,
"eval_steps_per_second": 1.824,
"step": 75
}
],
"logging_steps": 1,
"max_steps": 75,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 25,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.112831529320448e+17,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}