SodaXII's picture
Model save
46aad7c verified
Raw
History Blame Contribute Delete
25.2 kB
{
"best_metric": 0.7684563758389261,
"best_model_checkpoint": "./drive/Shareddrives/CS198-Drones/[v5] Training Output/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft/checkpoint-3392",
"epoch": 30.0,
"eval_steps": 64,
"global_step": 3840,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.5,
"grad_norm": 3.3553061485290527,
"learning_rate": 1.25e-05,
"loss": 2.1933,
"step": 64
},
{
"epoch": 0.5,
"eval_accuracy": 0.09060402684563758,
"eval_loss": 2.1968395709991455,
"eval_runtime": 9.159,
"eval_samples_per_second": 32.536,
"eval_steps_per_second": 0.546,
"step": 64
},
{
"epoch": 1.0,
"grad_norm": 3.834850311279297,
"learning_rate": 2.5e-05,
"loss": 2.1246,
"step": 128
},
{
"epoch": 1.0,
"eval_accuracy": 0.12416107382550336,
"eval_loss": 2.108480453491211,
"eval_runtime": 8.2948,
"eval_samples_per_second": 35.926,
"eval_steps_per_second": 0.603,
"step": 128
},
{
"epoch": 1.5,
"grad_norm": 3.4604074954986572,
"learning_rate": 3.7500000000000003e-05,
"loss": 2.021,
"step": 192
},
{
"epoch": 1.5,
"eval_accuracy": 0.2181208053691275,
"eval_loss": 1.9747371673583984,
"eval_runtime": 8.8968,
"eval_samples_per_second": 33.495,
"eval_steps_per_second": 0.562,
"step": 192
},
{
"epoch": 2.0,
"grad_norm": 3.332814931869507,
"learning_rate": 5e-05,
"loss": 1.8907,
"step": 256
},
{
"epoch": 2.0,
"eval_accuracy": 0.3288590604026846,
"eval_loss": 1.8124574422836304,
"eval_runtime": 7.9216,
"eval_samples_per_second": 37.619,
"eval_steps_per_second": 0.631,
"step": 256
},
{
"epoch": 2.5,
"grad_norm": 2.982445478439331,
"learning_rate": 4.8597083257709194e-05,
"loss": 1.7317,
"step": 320
},
{
"epoch": 2.5,
"eval_accuracy": 0.39932885906040266,
"eval_loss": 1.6570496559143066,
"eval_runtime": 7.7262,
"eval_samples_per_second": 38.57,
"eval_steps_per_second": 0.647,
"step": 320
},
{
"epoch": 3.0,
"grad_norm": 2.638735771179199,
"learning_rate": 4.454578706170075e-05,
"loss": 1.614,
"step": 384
},
{
"epoch": 3.0,
"eval_accuracy": 0.4798657718120805,
"eval_loss": 1.5440526008605957,
"eval_runtime": 7.8344,
"eval_samples_per_second": 38.038,
"eval_steps_per_second": 0.638,
"step": 384
},
{
"epoch": 3.5,
"grad_norm": 2.8015382289886475,
"learning_rate": 3.830080191288342e-05,
"loss": 1.518,
"step": 448
},
{
"epoch": 3.5,
"eval_accuracy": 0.5100671140939598,
"eval_loss": 1.4556909799575806,
"eval_runtime": 7.7497,
"eval_samples_per_second": 38.453,
"eval_steps_per_second": 0.645,
"step": 448
},
{
"epoch": 4.0,
"grad_norm": 2.9463720321655273,
"learning_rate": 3.056302334890786e-05,
"loss": 1.4343,
"step": 512
},
{
"epoch": 4.0,
"eval_accuracy": 0.5369127516778524,
"eval_loss": 1.3944100141525269,
"eval_runtime": 8.033,
"eval_samples_per_second": 37.097,
"eval_steps_per_second": 0.622,
"step": 512
},
{
"epoch": 4.5,
"grad_norm": 3.31219744682312,
"learning_rate": 2.2200888097417307e-05,
"loss": 1.4007,
"step": 576
},
{
"epoch": 4.5,
"eval_accuracy": 0.5469798657718121,
"eval_loss": 1.3522661924362183,
"eval_runtime": 7.6521,
"eval_samples_per_second": 38.943,
"eval_steps_per_second": 0.653,
"step": 576
},
{
"epoch": 5.0,
"grad_norm": 2.2543766498565674,
"learning_rate": 1.4152906522061048e-05,
"loss": 1.345,
"step": 640
},
{
"epoch": 5.0,
"eval_accuracy": 0.5536912751677853,
"eval_loss": 1.3297712802886963,
"eval_runtime": 7.6521,
"eval_samples_per_second": 38.944,
"eval_steps_per_second": 0.653,
"step": 640
},
{
"epoch": 5.5,
"grad_norm": 2.3809094429016113,
"learning_rate": 7.3223304703363135e-06,
"loss": 1.3353,
"step": 704
},
{
"epoch": 5.5,
"eval_accuracy": 0.5604026845637584,
"eval_loss": 1.3163374662399292,
"eval_runtime": 7.8107,
"eval_samples_per_second": 38.153,
"eval_steps_per_second": 0.64,
"step": 704
},
{
"epoch": 6.0,
"grad_norm": 2.5822391510009766,
"learning_rate": 2.475778302439524e-06,
"loss": 1.324,
"step": 768
},
{
"epoch": 6.0,
"eval_accuracy": 0.5604026845637584,
"eval_loss": 1.3087968826293945,
"eval_runtime": 8.6399,
"eval_samples_per_second": 34.491,
"eval_steps_per_second": 0.579,
"step": 768
},
{
"epoch": 6.5,
"grad_norm": 2.5432515144348145,
"learning_rate": 1.571947526689349e-07,
"loss": 1.3386,
"step": 832
},
{
"epoch": 6.5,
"eval_accuracy": 0.5604026845637584,
"eval_loss": 1.3072452545166016,
"eval_runtime": 8.7139,
"eval_samples_per_second": 34.198,
"eval_steps_per_second": 0.574,
"step": 832
},
{
"epoch": 7.0,
"grad_norm": 2.583087682723999,
"learning_rate": 4.937319780454559e-05,
"loss": 1.2882,
"step": 896
},
{
"epoch": 7.0,
"eval_accuracy": 0.610738255033557,
"eval_loss": 1.2582257986068726,
"eval_runtime": 8.6431,
"eval_samples_per_second": 34.478,
"eval_steps_per_second": 0.578,
"step": 896
},
{
"epoch": 7.5,
"grad_norm": 2.8682312965393066,
"learning_rate": 4.6168104980707107e-05,
"loss": 1.2525,
"step": 960
},
{
"epoch": 7.5,
"eval_accuracy": 0.610738255033557,
"eval_loss": 1.2107785940170288,
"eval_runtime": 8.7628,
"eval_samples_per_second": 34.007,
"eval_steps_per_second": 0.571,
"step": 960
},
{
"epoch": 8.0,
"grad_norm": 2.307509660720825,
"learning_rate": 4.058724504646835e-05,
"loss": 1.2039,
"step": 1024
},
{
"epoch": 8.0,
"eval_accuracy": 0.6409395973154363,
"eval_loss": 1.1605823040008545,
"eval_runtime": 8.7427,
"eval_samples_per_second": 34.085,
"eval_steps_per_second": 0.572,
"step": 1024
},
{
"epoch": 8.5,
"grad_norm": 2.0223543643951416,
"learning_rate": 3.3256976548879184e-05,
"loss": 1.16,
"step": 1088
},
{
"epoch": 8.5,
"eval_accuracy": 0.6409395973154363,
"eval_loss": 1.126598834991455,
"eval_runtime": 8.7703,
"eval_samples_per_second": 33.979,
"eval_steps_per_second": 0.57,
"step": 1088
},
{
"epoch": 9.0,
"grad_norm": 2.199993848800659,
"learning_rate": 2.5e-05,
"loss": 1.1401,
"step": 1152
},
{
"epoch": 9.0,
"eval_accuracy": 0.6610738255033557,
"eval_loss": 1.1063629388809204,
"eval_runtime": 7.9893,
"eval_samples_per_second": 37.3,
"eval_steps_per_second": 0.626,
"step": 1152
},
{
"epoch": 9.5,
"grad_norm": 2.102375030517578,
"learning_rate": 1.6743023451120822e-05,
"loss": 1.1161,
"step": 1216
},
{
"epoch": 9.5,
"eval_accuracy": 0.6677852348993288,
"eval_loss": 1.0873396396636963,
"eval_runtime": 8.14,
"eval_samples_per_second": 36.609,
"eval_steps_per_second": 0.614,
"step": 1216
},
{
"epoch": 10.0,
"grad_norm": 2.628359794616699,
"learning_rate": 9.412754953531672e-06,
"loss": 1.0979,
"step": 1280
},
{
"epoch": 10.0,
"eval_accuracy": 0.6677852348993288,
"eval_loss": 1.078514575958252,
"eval_runtime": 8.8572,
"eval_samples_per_second": 33.645,
"eval_steps_per_second": 0.565,
"step": 1280
},
{
"epoch": 10.5,
"grad_norm": 2.5552382469177246,
"learning_rate": 3.831895019292909e-06,
"loss": 1.0961,
"step": 1344
},
{
"epoch": 10.5,
"eval_accuracy": 0.6644295302013423,
"eval_loss": 1.0734963417053223,
"eval_runtime": 8.8197,
"eval_samples_per_second": 33.788,
"eval_steps_per_second": 0.567,
"step": 1344
},
{
"epoch": 11.0,
"grad_norm": 2.206542491912842,
"learning_rate": 6.268021954544068e-07,
"loss": 1.0852,
"step": 1408
},
{
"epoch": 11.0,
"eval_accuracy": 0.6677852348993288,
"eval_loss": 1.0718457698822021,
"eval_runtime": 9.1051,
"eval_samples_per_second": 32.729,
"eval_steps_per_second": 0.549,
"step": 1408
},
{
"epoch": 11.5,
"grad_norm": 3.107128381729126,
"learning_rate": 4.984280524733107e-05,
"loss": 1.0845,
"step": 1472
},
{
"epoch": 11.5,
"eval_accuracy": 0.6711409395973155,
"eval_loss": 1.0672944784164429,
"eval_runtime": 8.7733,
"eval_samples_per_second": 33.967,
"eval_steps_per_second": 0.57,
"step": 1472
},
{
"epoch": 12.0,
"grad_norm": 2.55963397026062,
"learning_rate": 4.7524221697560484e-05,
"loss": 1.0652,
"step": 1536
},
{
"epoch": 12.0,
"eval_accuracy": 0.697986577181208,
"eval_loss": 1.019176959991455,
"eval_runtime": 7.8711,
"eval_samples_per_second": 37.86,
"eval_steps_per_second": 0.635,
"step": 1536
},
{
"epoch": 12.5,
"grad_norm": 2.3591487407684326,
"learning_rate": 4.267766952966369e-05,
"loss": 1.0336,
"step": 1600
},
{
"epoch": 12.5,
"eval_accuracy": 0.6946308724832215,
"eval_loss": 0.9978868961334229,
"eval_runtime": 8.7958,
"eval_samples_per_second": 33.88,
"eval_steps_per_second": 0.568,
"step": 1600
},
{
"epoch": 13.0,
"grad_norm": 2.140841484069824,
"learning_rate": 3.5847093477938956e-05,
"loss": 1.006,
"step": 1664
},
{
"epoch": 13.0,
"eval_accuracy": 0.697986577181208,
"eval_loss": 0.9768925905227661,
"eval_runtime": 9.0047,
"eval_samples_per_second": 33.094,
"eval_steps_per_second": 0.555,
"step": 1664
},
{
"epoch": 13.5,
"grad_norm": 2.3379549980163574,
"learning_rate": 2.7799111902582686e-05,
"loss": 0.9842,
"step": 1728
},
{
"epoch": 13.5,
"eval_accuracy": 0.7013422818791947,
"eval_loss": 0.9594218730926514,
"eval_runtime": 8.8056,
"eval_samples_per_second": 33.842,
"eval_steps_per_second": 0.568,
"step": 1728
},
{
"epoch": 14.0,
"grad_norm": 2.195948362350464,
"learning_rate": 1.9436976651092164e-05,
"loss": 0.9735,
"step": 1792
},
{
"epoch": 14.0,
"eval_accuracy": 0.7080536912751678,
"eval_loss": 0.9499163627624512,
"eval_runtime": 8.8229,
"eval_samples_per_second": 33.776,
"eval_steps_per_second": 0.567,
"step": 1792
},
{
"epoch": 14.5,
"grad_norm": 2.181391716003418,
"learning_rate": 1.169919808711657e-05,
"loss": 0.9662,
"step": 1856
},
{
"epoch": 14.5,
"eval_accuracy": 0.7114093959731543,
"eval_loss": 0.9434810280799866,
"eval_runtime": 8.7331,
"eval_samples_per_second": 34.123,
"eval_steps_per_second": 0.573,
"step": 1856
},
{
"epoch": 15.0,
"grad_norm": 1.8749948740005493,
"learning_rate": 5.454212938299264e-06,
"loss": 0.9491,
"step": 1920
},
{
"epoch": 15.0,
"eval_accuracy": 0.714765100671141,
"eval_loss": 0.9374688863754272,
"eval_runtime": 8.9079,
"eval_samples_per_second": 33.453,
"eval_steps_per_second": 0.561,
"step": 1920
},
{
"epoch": 15.5,
"grad_norm": 2.289724111557007,
"learning_rate": 1.4029167422908107e-06,
"loss": 0.945,
"step": 1984
},
{
"epoch": 15.5,
"eval_accuracy": 0.7181208053691275,
"eval_loss": 0.9357881546020508,
"eval_runtime": 8.649,
"eval_samples_per_second": 34.455,
"eval_steps_per_second": 0.578,
"step": 1984
},
{
"epoch": 16.0,
"grad_norm": 1.9242281913757324,
"learning_rate": 5e-05,
"loss": 0.9564,
"step": 2048
},
{
"epoch": 16.0,
"eval_accuracy": 0.7181208053691275,
"eval_loss": 0.9354940056800842,
"eval_runtime": 8.9028,
"eval_samples_per_second": 33.473,
"eval_steps_per_second": 0.562,
"step": 2048
},
{
"epoch": 16.5,
"grad_norm": 2.045414924621582,
"learning_rate": 4.8597083257709174e-05,
"loss": 0.9448,
"step": 2112
},
{
"epoch": 16.5,
"eval_accuracy": 0.7248322147651006,
"eval_loss": 0.9101002216339111,
"eval_runtime": 8.8831,
"eval_samples_per_second": 33.547,
"eval_steps_per_second": 0.563,
"step": 2112
},
{
"epoch": 17.0,
"grad_norm": 1.940545916557312,
"learning_rate": 4.454578706170074e-05,
"loss": 0.9156,
"step": 2176
},
{
"epoch": 17.0,
"eval_accuracy": 0.7214765100671141,
"eval_loss": 0.8984754085540771,
"eval_runtime": 8.7245,
"eval_samples_per_second": 34.157,
"eval_steps_per_second": 0.573,
"step": 2176
},
{
"epoch": 17.5,
"grad_norm": 2.2112772464752197,
"learning_rate": 3.8300801912883396e-05,
"loss": 0.9164,
"step": 2240
},
{
"epoch": 17.5,
"eval_accuracy": 0.7348993288590604,
"eval_loss": 0.878176212310791,
"eval_runtime": 8.8341,
"eval_samples_per_second": 33.733,
"eval_steps_per_second": 0.566,
"step": 2240
},
{
"epoch": 18.0,
"grad_norm": 1.7843997478485107,
"learning_rate": 3.056302334890788e-05,
"loss": 0.8709,
"step": 2304
},
{
"epoch": 18.0,
"eval_accuracy": 0.7348993288590604,
"eval_loss": 0.86415696144104,
"eval_runtime": 8.1554,
"eval_samples_per_second": 36.54,
"eval_steps_per_second": 0.613,
"step": 2304
},
{
"epoch": 18.5,
"grad_norm": 2.0073421001434326,
"learning_rate": 2.2200888097417317e-05,
"loss": 0.8732,
"step": 2368
},
{
"epoch": 18.5,
"eval_accuracy": 0.7348993288590604,
"eval_loss": 0.8535670042037964,
"eval_runtime": 7.8654,
"eval_samples_per_second": 37.888,
"eval_steps_per_second": 0.636,
"step": 2368
},
{
"epoch": 19.0,
"grad_norm": 2.097783327102661,
"learning_rate": 1.4152906522061087e-05,
"loss": 0.8662,
"step": 2432
},
{
"epoch": 19.0,
"eval_accuracy": 0.7449664429530202,
"eval_loss": 0.8506665229797363,
"eval_runtime": 8.1216,
"eval_samples_per_second": 36.692,
"eval_steps_per_second": 0.616,
"step": 2432
},
{
"epoch": 19.5,
"grad_norm": 2.2401092052459717,
"learning_rate": 7.3223304703363135e-06,
"loss": 0.8561,
"step": 2496
},
{
"epoch": 19.5,
"eval_accuracy": 0.7416107382550335,
"eval_loss": 0.8498286008834839,
"eval_runtime": 8.845,
"eval_samples_per_second": 33.691,
"eval_steps_per_second": 0.565,
"step": 2496
},
{
"epoch": 20.0,
"grad_norm": 2.1345531940460205,
"learning_rate": 2.475778302439505e-06,
"loss": 0.8608,
"step": 2560
},
{
"epoch": 20.0,
"eval_accuracy": 0.7449664429530202,
"eval_loss": 0.8466877341270447,
"eval_runtime": 8.7517,
"eval_samples_per_second": 34.051,
"eval_steps_per_second": 0.571,
"step": 2560
},
{
"epoch": 20.5,
"grad_norm": 1.8704792261123657,
"learning_rate": 1.571947526689349e-07,
"loss": 0.8638,
"step": 2624
},
{
"epoch": 20.5,
"eval_accuracy": 0.7449664429530202,
"eval_loss": 0.8461165428161621,
"eval_runtime": 8.6825,
"eval_samples_per_second": 34.322,
"eval_steps_per_second": 0.576,
"step": 2624
},
{
"epoch": 21.0,
"grad_norm": 2.0402615070343018,
"learning_rate": 4.93731978045456e-05,
"loss": 0.8449,
"step": 2688
},
{
"epoch": 21.0,
"eval_accuracy": 0.7483221476510067,
"eval_loss": 0.8376011252403259,
"eval_runtime": 8.1707,
"eval_samples_per_second": 36.472,
"eval_steps_per_second": 0.612,
"step": 2688
},
{
"epoch": 21.5,
"grad_norm": 1.7034225463867188,
"learning_rate": 4.616810498070709e-05,
"loss": 0.8461,
"step": 2752
},
{
"epoch": 21.5,
"eval_accuracy": 0.7483221476510067,
"eval_loss": 0.8213455677032471,
"eval_runtime": 8.1107,
"eval_samples_per_second": 36.742,
"eval_steps_per_second": 0.616,
"step": 2752
},
{
"epoch": 22.0,
"grad_norm": 1.6208754777908325,
"learning_rate": 4.058724504646835e-05,
"loss": 0.8179,
"step": 2816
},
{
"epoch": 22.0,
"eval_accuracy": 0.7416107382550335,
"eval_loss": 0.805648148059845,
"eval_runtime": 8.0669,
"eval_samples_per_second": 36.941,
"eval_steps_per_second": 0.62,
"step": 2816
},
{
"epoch": 22.5,
"grad_norm": 1.8578311204910278,
"learning_rate": 3.325697654887922e-05,
"loss": 0.8124,
"step": 2880
},
{
"epoch": 22.5,
"eval_accuracy": 0.7483221476510067,
"eval_loss": 0.8016577363014221,
"eval_runtime": 8.6546,
"eval_samples_per_second": 34.433,
"eval_steps_per_second": 0.578,
"step": 2880
},
{
"epoch": 23.0,
"grad_norm": 1.838831901550293,
"learning_rate": 2.5e-05,
"loss": 0.803,
"step": 2944
},
{
"epoch": 23.0,
"eval_accuracy": 0.7583892617449665,
"eval_loss": 0.7895504832267761,
"eval_runtime": 8.2476,
"eval_samples_per_second": 36.132,
"eval_steps_per_second": 0.606,
"step": 2944
},
{
"epoch": 23.5,
"grad_norm": 1.7440546751022339,
"learning_rate": 1.6743023451120788e-05,
"loss": 0.7979,
"step": 3008
},
{
"epoch": 23.5,
"eval_accuracy": 0.7583892617449665,
"eval_loss": 0.7843785881996155,
"eval_runtime": 8.6902,
"eval_samples_per_second": 34.292,
"eval_steps_per_second": 0.575,
"step": 3008
},
{
"epoch": 24.0,
"grad_norm": 1.838025450706482,
"learning_rate": 9.412754953531655e-06,
"loss": 0.7878,
"step": 3072
},
{
"epoch": 24.0,
"eval_accuracy": 0.7651006711409396,
"eval_loss": 0.7816659808158875,
"eval_runtime": 8.7178,
"eval_samples_per_second": 34.183,
"eval_steps_per_second": 0.574,
"step": 3072
},
{
"epoch": 24.5,
"grad_norm": 1.8526736497879028,
"learning_rate": 3.831895019292909e-06,
"loss": 0.7808,
"step": 3136
},
{
"epoch": 24.5,
"eval_accuracy": 0.761744966442953,
"eval_loss": 0.7814260721206665,
"eval_runtime": 8.7274,
"eval_samples_per_second": 34.145,
"eval_steps_per_second": 0.573,
"step": 3136
},
{
"epoch": 25.0,
"grad_norm": 1.6450481414794922,
"learning_rate": 6.268021954544068e-07,
"loss": 0.7924,
"step": 3200
},
{
"epoch": 25.0,
"eval_accuracy": 0.761744966442953,
"eval_loss": 0.780437707901001,
"eval_runtime": 7.6749,
"eval_samples_per_second": 38.828,
"eval_steps_per_second": 0.651,
"step": 3200
},
{
"epoch": 25.5,
"grad_norm": 1.8034324645996094,
"learning_rate": 4.984280524733107e-05,
"loss": 0.8049,
"step": 3264
},
{
"epoch": 25.5,
"eval_accuracy": 0.761744966442953,
"eval_loss": 0.7750493288040161,
"eval_runtime": 8.6458,
"eval_samples_per_second": 34.468,
"eval_steps_per_second": 0.578,
"step": 3264
},
{
"epoch": 26.0,
"grad_norm": 1.6223326921463013,
"learning_rate": 4.75242216975605e-05,
"loss": 0.7581,
"step": 3328
},
{
"epoch": 26.0,
"eval_accuracy": 0.761744966442953,
"eval_loss": 0.7638412714004517,
"eval_runtime": 7.7052,
"eval_samples_per_second": 38.675,
"eval_steps_per_second": 0.649,
"step": 3328
},
{
"epoch": 26.5,
"grad_norm": 2.002840995788574,
"learning_rate": 4.267766952966369e-05,
"loss": 0.7651,
"step": 3392
},
{
"epoch": 26.5,
"eval_accuracy": 0.7684563758389261,
"eval_loss": 0.7540990710258484,
"eval_runtime": 7.6847,
"eval_samples_per_second": 38.779,
"eval_steps_per_second": 0.651,
"step": 3392
},
{
"epoch": 27.0,
"grad_norm": 1.705908179283142,
"learning_rate": 3.584709347793892e-05,
"loss": 0.7573,
"step": 3456
},
{
"epoch": 27.0,
"eval_accuracy": 0.7651006711409396,
"eval_loss": 0.7505062818527222,
"eval_runtime": 7.6264,
"eval_samples_per_second": 39.075,
"eval_steps_per_second": 0.656,
"step": 3456
},
{
"epoch": 27.5,
"grad_norm": 1.8837891817092896,
"learning_rate": 2.7799111902582686e-05,
"loss": 0.7524,
"step": 3520
},
{
"epoch": 27.5,
"eval_accuracy": 0.7651006711409396,
"eval_loss": 0.7437400221824646,
"eval_runtime": 7.6701,
"eval_samples_per_second": 38.852,
"eval_steps_per_second": 0.652,
"step": 3520
},
{
"epoch": 28.0,
"grad_norm": 1.8985482454299927,
"learning_rate": 1.9436976651092164e-05,
"loss": 0.7362,
"step": 3584
},
{
"epoch": 28.0,
"eval_accuracy": 0.7651006711409396,
"eval_loss": 0.7364336848258972,
"eval_runtime": 7.6555,
"eval_samples_per_second": 38.926,
"eval_steps_per_second": 0.653,
"step": 3584
},
{
"epoch": 28.5,
"grad_norm": 2.0026416778564453,
"learning_rate": 1.169919808711657e-05,
"loss": 0.7288,
"step": 3648
},
{
"epoch": 28.5,
"eval_accuracy": 0.7684563758389261,
"eval_loss": 0.7339101433753967,
"eval_runtime": 8.8394,
"eval_samples_per_second": 33.713,
"eval_steps_per_second": 0.566,
"step": 3648
},
{
"epoch": 29.0,
"grad_norm": 1.8134102821350098,
"learning_rate": 5.454212938299264e-06,
"loss": 0.7415,
"step": 3712
},
{
"epoch": 29.0,
"eval_accuracy": 0.7684563758389261,
"eval_loss": 0.7321557402610779,
"eval_runtime": 7.7574,
"eval_samples_per_second": 38.415,
"eval_steps_per_second": 0.645,
"step": 3712
},
{
"epoch": 29.5,
"grad_norm": 1.838896632194519,
"learning_rate": 1.4029167422908274e-06,
"loss": 0.7355,
"step": 3776
},
{
"epoch": 29.5,
"eval_accuracy": 0.7684563758389261,
"eval_loss": 0.7323412299156189,
"eval_runtime": 8.6786,
"eval_samples_per_second": 34.337,
"eval_steps_per_second": 0.576,
"step": 3776
},
{
"epoch": 30.0,
"grad_norm": 1.7982102632522583,
"learning_rate": 0.0,
"loss": 0.7283,
"step": 3840
},
{
"epoch": 30.0,
"eval_accuracy": 0.7684563758389261,
"eval_loss": 0.7321370244026184,
"eval_runtime": 8.9098,
"eval_samples_per_second": 33.446,
"eval_steps_per_second": 0.561,
"step": 3840
},
{
"epoch": 30.0,
"step": 3840,
"total_flos": 1.9045455502969405e+19,
"train_loss": 1.073897185921669,
"train_runtime": 8808.4478,
"train_samples_per_second": 27.9,
"train_steps_per_second": 0.436
}
],
"logging_steps": 64,
"max_steps": 3840,
"num_input_tokens_seen": 0,
"num_train_epochs": 30,
"save_steps": 64,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.9045455502969405e+19,
"train_batch_size": 64,
"trial_name": null,
"trial_params": null
}