{ "best_metric": 0.7684563758389261, "best_model_checkpoint": "./drive/Shareddrives/CS198-Drones/[v5] Training Output/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft/checkpoint-3392", "epoch": 30.0, "eval_steps": 64, "global_step": 3840, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.5, "grad_norm": 3.3553061485290527, "learning_rate": 1.25e-05, "loss": 2.1933, "step": 64 }, { "epoch": 0.5, "eval_accuracy": 0.09060402684563758, "eval_loss": 2.1968395709991455, "eval_runtime": 9.159, "eval_samples_per_second": 32.536, "eval_steps_per_second": 0.546, "step": 64 }, { "epoch": 1.0, "grad_norm": 3.834850311279297, "learning_rate": 2.5e-05, "loss": 2.1246, "step": 128 }, { "epoch": 1.0, "eval_accuracy": 0.12416107382550336, "eval_loss": 2.108480453491211, "eval_runtime": 8.2948, "eval_samples_per_second": 35.926, "eval_steps_per_second": 0.603, "step": 128 }, { "epoch": 1.5, "grad_norm": 3.4604074954986572, "learning_rate": 3.7500000000000003e-05, "loss": 2.021, "step": 192 }, { "epoch": 1.5, "eval_accuracy": 0.2181208053691275, "eval_loss": 1.9747371673583984, "eval_runtime": 8.8968, "eval_samples_per_second": 33.495, "eval_steps_per_second": 0.562, "step": 192 }, { "epoch": 2.0, "grad_norm": 3.332814931869507, "learning_rate": 5e-05, "loss": 1.8907, "step": 256 }, { "epoch": 2.0, "eval_accuracy": 0.3288590604026846, "eval_loss": 1.8124574422836304, "eval_runtime": 7.9216, "eval_samples_per_second": 37.619, "eval_steps_per_second": 0.631, "step": 256 }, { "epoch": 2.5, "grad_norm": 2.982445478439331, "learning_rate": 4.8597083257709194e-05, "loss": 1.7317, "step": 320 }, { "epoch": 2.5, "eval_accuracy": 0.39932885906040266, "eval_loss": 1.6570496559143066, "eval_runtime": 7.7262, "eval_samples_per_second": 38.57, "eval_steps_per_second": 0.647, "step": 320 }, { "epoch": 3.0, "grad_norm": 2.638735771179199, "learning_rate": 4.454578706170075e-05, "loss": 1.614, "step": 384 }, { "epoch": 3.0, "eval_accuracy": 0.4798657718120805, "eval_loss": 1.5440526008605957, "eval_runtime": 7.8344, "eval_samples_per_second": 38.038, "eval_steps_per_second": 0.638, "step": 384 }, { "epoch": 3.5, "grad_norm": 2.8015382289886475, "learning_rate": 3.830080191288342e-05, "loss": 1.518, "step": 448 }, { "epoch": 3.5, "eval_accuracy": 0.5100671140939598, "eval_loss": 1.4556909799575806, "eval_runtime": 7.7497, "eval_samples_per_second": 38.453, "eval_steps_per_second": 0.645, "step": 448 }, { "epoch": 4.0, "grad_norm": 2.9463720321655273, "learning_rate": 3.056302334890786e-05, "loss": 1.4343, "step": 512 }, { "epoch": 4.0, "eval_accuracy": 0.5369127516778524, "eval_loss": 1.3944100141525269, "eval_runtime": 8.033, "eval_samples_per_second": 37.097, "eval_steps_per_second": 0.622, "step": 512 }, { "epoch": 4.5, "grad_norm": 3.31219744682312, "learning_rate": 2.2200888097417307e-05, "loss": 1.4007, "step": 576 }, { "epoch": 4.5, "eval_accuracy": 0.5469798657718121, "eval_loss": 1.3522661924362183, "eval_runtime": 7.6521, "eval_samples_per_second": 38.943, "eval_steps_per_second": 0.653, "step": 576 }, { "epoch": 5.0, "grad_norm": 2.2543766498565674, "learning_rate": 1.4152906522061048e-05, "loss": 1.345, "step": 640 }, { "epoch": 5.0, "eval_accuracy": 0.5536912751677853, "eval_loss": 1.3297712802886963, "eval_runtime": 7.6521, "eval_samples_per_second": 38.944, "eval_steps_per_second": 0.653, "step": 640 }, { "epoch": 5.5, "grad_norm": 2.3809094429016113, "learning_rate": 7.3223304703363135e-06, "loss": 1.3353, "step": 704 }, { "epoch": 5.5, "eval_accuracy": 0.5604026845637584, "eval_loss": 1.3163374662399292, "eval_runtime": 7.8107, "eval_samples_per_second": 38.153, "eval_steps_per_second": 0.64, "step": 704 }, { "epoch": 6.0, "grad_norm": 2.5822391510009766, "learning_rate": 2.475778302439524e-06, "loss": 1.324, "step": 768 }, { "epoch": 6.0, "eval_accuracy": 0.5604026845637584, "eval_loss": 1.3087968826293945, "eval_runtime": 8.6399, "eval_samples_per_second": 34.491, "eval_steps_per_second": 0.579, "step": 768 }, { "epoch": 6.5, "grad_norm": 2.5432515144348145, "learning_rate": 1.571947526689349e-07, "loss": 1.3386, "step": 832 }, { "epoch": 6.5, "eval_accuracy": 0.5604026845637584, "eval_loss": 1.3072452545166016, "eval_runtime": 8.7139, "eval_samples_per_second": 34.198, "eval_steps_per_second": 0.574, "step": 832 }, { "epoch": 7.0, "grad_norm": 2.583087682723999, "learning_rate": 4.937319780454559e-05, "loss": 1.2882, "step": 896 }, { "epoch": 7.0, "eval_accuracy": 0.610738255033557, "eval_loss": 1.2582257986068726, "eval_runtime": 8.6431, "eval_samples_per_second": 34.478, "eval_steps_per_second": 0.578, "step": 896 }, { "epoch": 7.5, "grad_norm": 2.8682312965393066, "learning_rate": 4.6168104980707107e-05, "loss": 1.2525, "step": 960 }, { "epoch": 7.5, "eval_accuracy": 0.610738255033557, "eval_loss": 1.2107785940170288, "eval_runtime": 8.7628, "eval_samples_per_second": 34.007, "eval_steps_per_second": 0.571, "step": 960 }, { "epoch": 8.0, "grad_norm": 2.307509660720825, "learning_rate": 4.058724504646835e-05, "loss": 1.2039, "step": 1024 }, { "epoch": 8.0, "eval_accuracy": 0.6409395973154363, "eval_loss": 1.1605823040008545, "eval_runtime": 8.7427, "eval_samples_per_second": 34.085, "eval_steps_per_second": 0.572, "step": 1024 }, { "epoch": 8.5, "grad_norm": 2.0223543643951416, "learning_rate": 3.3256976548879184e-05, "loss": 1.16, "step": 1088 }, { "epoch": 8.5, "eval_accuracy": 0.6409395973154363, "eval_loss": 1.126598834991455, "eval_runtime": 8.7703, "eval_samples_per_second": 33.979, "eval_steps_per_second": 0.57, "step": 1088 }, { "epoch": 9.0, "grad_norm": 2.199993848800659, "learning_rate": 2.5e-05, "loss": 1.1401, "step": 1152 }, { "epoch": 9.0, "eval_accuracy": 0.6610738255033557, "eval_loss": 1.1063629388809204, "eval_runtime": 7.9893, "eval_samples_per_second": 37.3, "eval_steps_per_second": 0.626, "step": 1152 }, { "epoch": 9.5, "grad_norm": 2.102375030517578, "learning_rate": 1.6743023451120822e-05, "loss": 1.1161, "step": 1216 }, { "epoch": 9.5, "eval_accuracy": 0.6677852348993288, "eval_loss": 1.0873396396636963, "eval_runtime": 8.14, "eval_samples_per_second": 36.609, "eval_steps_per_second": 0.614, "step": 1216 }, { "epoch": 10.0, "grad_norm": 2.628359794616699, "learning_rate": 9.412754953531672e-06, "loss": 1.0979, "step": 1280 }, { "epoch": 10.0, "eval_accuracy": 0.6677852348993288, "eval_loss": 1.078514575958252, "eval_runtime": 8.8572, "eval_samples_per_second": 33.645, "eval_steps_per_second": 0.565, "step": 1280 }, { "epoch": 10.5, "grad_norm": 2.5552382469177246, "learning_rate": 3.831895019292909e-06, "loss": 1.0961, "step": 1344 }, { "epoch": 10.5, "eval_accuracy": 0.6644295302013423, "eval_loss": 1.0734963417053223, "eval_runtime": 8.8197, "eval_samples_per_second": 33.788, "eval_steps_per_second": 0.567, "step": 1344 }, { "epoch": 11.0, "grad_norm": 2.206542491912842, "learning_rate": 6.268021954544068e-07, "loss": 1.0852, "step": 1408 }, { "epoch": 11.0, "eval_accuracy": 0.6677852348993288, "eval_loss": 1.0718457698822021, "eval_runtime": 9.1051, "eval_samples_per_second": 32.729, "eval_steps_per_second": 0.549, "step": 1408 }, { "epoch": 11.5, "grad_norm": 3.107128381729126, "learning_rate": 4.984280524733107e-05, "loss": 1.0845, "step": 1472 }, { "epoch": 11.5, "eval_accuracy": 0.6711409395973155, "eval_loss": 1.0672944784164429, "eval_runtime": 8.7733, "eval_samples_per_second": 33.967, "eval_steps_per_second": 0.57, "step": 1472 }, { "epoch": 12.0, "grad_norm": 2.55963397026062, "learning_rate": 4.7524221697560484e-05, "loss": 1.0652, "step": 1536 }, { "epoch": 12.0, "eval_accuracy": 0.697986577181208, "eval_loss": 1.019176959991455, "eval_runtime": 7.8711, "eval_samples_per_second": 37.86, "eval_steps_per_second": 0.635, "step": 1536 }, { "epoch": 12.5, "grad_norm": 2.3591487407684326, "learning_rate": 4.267766952966369e-05, "loss": 1.0336, "step": 1600 }, { "epoch": 12.5, "eval_accuracy": 0.6946308724832215, "eval_loss": 0.9978868961334229, "eval_runtime": 8.7958, "eval_samples_per_second": 33.88, "eval_steps_per_second": 0.568, "step": 1600 }, { "epoch": 13.0, "grad_norm": 2.140841484069824, "learning_rate": 3.5847093477938956e-05, "loss": 1.006, "step": 1664 }, { "epoch": 13.0, "eval_accuracy": 0.697986577181208, "eval_loss": 0.9768925905227661, "eval_runtime": 9.0047, "eval_samples_per_second": 33.094, "eval_steps_per_second": 0.555, "step": 1664 }, { "epoch": 13.5, "grad_norm": 2.3379549980163574, "learning_rate": 2.7799111902582686e-05, "loss": 0.9842, "step": 1728 }, { "epoch": 13.5, "eval_accuracy": 0.7013422818791947, "eval_loss": 0.9594218730926514, "eval_runtime": 8.8056, "eval_samples_per_second": 33.842, "eval_steps_per_second": 0.568, "step": 1728 }, { "epoch": 14.0, "grad_norm": 2.195948362350464, "learning_rate": 1.9436976651092164e-05, "loss": 0.9735, "step": 1792 }, { "epoch": 14.0, "eval_accuracy": 0.7080536912751678, "eval_loss": 0.9499163627624512, "eval_runtime": 8.8229, "eval_samples_per_second": 33.776, "eval_steps_per_second": 0.567, "step": 1792 }, { "epoch": 14.5, "grad_norm": 2.181391716003418, "learning_rate": 1.169919808711657e-05, "loss": 0.9662, "step": 1856 }, { "epoch": 14.5, "eval_accuracy": 0.7114093959731543, "eval_loss": 0.9434810280799866, "eval_runtime": 8.7331, "eval_samples_per_second": 34.123, "eval_steps_per_second": 0.573, "step": 1856 }, { "epoch": 15.0, "grad_norm": 1.8749948740005493, "learning_rate": 5.454212938299264e-06, "loss": 0.9491, "step": 1920 }, { "epoch": 15.0, "eval_accuracy": 0.714765100671141, "eval_loss": 0.9374688863754272, "eval_runtime": 8.9079, "eval_samples_per_second": 33.453, "eval_steps_per_second": 0.561, "step": 1920 }, { "epoch": 15.5, "grad_norm": 2.289724111557007, "learning_rate": 1.4029167422908107e-06, "loss": 0.945, "step": 1984 }, { "epoch": 15.5, "eval_accuracy": 0.7181208053691275, "eval_loss": 0.9357881546020508, "eval_runtime": 8.649, "eval_samples_per_second": 34.455, "eval_steps_per_second": 0.578, "step": 1984 }, { "epoch": 16.0, "grad_norm": 1.9242281913757324, "learning_rate": 5e-05, "loss": 0.9564, "step": 2048 }, { "epoch": 16.0, "eval_accuracy": 0.7181208053691275, "eval_loss": 0.9354940056800842, "eval_runtime": 8.9028, "eval_samples_per_second": 33.473, "eval_steps_per_second": 0.562, "step": 2048 }, { "epoch": 16.5, "grad_norm": 2.045414924621582, "learning_rate": 4.8597083257709174e-05, "loss": 0.9448, "step": 2112 }, { "epoch": 16.5, "eval_accuracy": 0.7248322147651006, "eval_loss": 0.9101002216339111, "eval_runtime": 8.8831, "eval_samples_per_second": 33.547, "eval_steps_per_second": 0.563, "step": 2112 }, { "epoch": 17.0, "grad_norm": 1.940545916557312, "learning_rate": 4.454578706170074e-05, "loss": 0.9156, "step": 2176 }, { "epoch": 17.0, "eval_accuracy": 0.7214765100671141, "eval_loss": 0.8984754085540771, "eval_runtime": 8.7245, "eval_samples_per_second": 34.157, "eval_steps_per_second": 0.573, "step": 2176 }, { "epoch": 17.5, "grad_norm": 2.2112772464752197, "learning_rate": 3.8300801912883396e-05, "loss": 0.9164, "step": 2240 }, { "epoch": 17.5, "eval_accuracy": 0.7348993288590604, "eval_loss": 0.878176212310791, "eval_runtime": 8.8341, "eval_samples_per_second": 33.733, "eval_steps_per_second": 0.566, "step": 2240 }, { "epoch": 18.0, "grad_norm": 1.7843997478485107, "learning_rate": 3.056302334890788e-05, "loss": 0.8709, "step": 2304 }, { "epoch": 18.0, "eval_accuracy": 0.7348993288590604, "eval_loss": 0.86415696144104, "eval_runtime": 8.1554, "eval_samples_per_second": 36.54, "eval_steps_per_second": 0.613, "step": 2304 }, { "epoch": 18.5, "grad_norm": 2.0073421001434326, "learning_rate": 2.2200888097417317e-05, "loss": 0.8732, "step": 2368 }, { "epoch": 18.5, "eval_accuracy": 0.7348993288590604, "eval_loss": 0.8535670042037964, "eval_runtime": 7.8654, "eval_samples_per_second": 37.888, "eval_steps_per_second": 0.636, "step": 2368 }, { "epoch": 19.0, "grad_norm": 2.097783327102661, "learning_rate": 1.4152906522061087e-05, "loss": 0.8662, "step": 2432 }, { "epoch": 19.0, "eval_accuracy": 0.7449664429530202, "eval_loss": 0.8506665229797363, "eval_runtime": 8.1216, "eval_samples_per_second": 36.692, "eval_steps_per_second": 0.616, "step": 2432 }, { "epoch": 19.5, "grad_norm": 2.2401092052459717, "learning_rate": 7.3223304703363135e-06, "loss": 0.8561, "step": 2496 }, { "epoch": 19.5, "eval_accuracy": 0.7416107382550335, "eval_loss": 0.8498286008834839, "eval_runtime": 8.845, "eval_samples_per_second": 33.691, "eval_steps_per_second": 0.565, "step": 2496 }, { "epoch": 20.0, "grad_norm": 2.1345531940460205, "learning_rate": 2.475778302439505e-06, "loss": 0.8608, "step": 2560 }, { "epoch": 20.0, "eval_accuracy": 0.7449664429530202, "eval_loss": 0.8466877341270447, "eval_runtime": 8.7517, "eval_samples_per_second": 34.051, "eval_steps_per_second": 0.571, "step": 2560 }, { "epoch": 20.5, "grad_norm": 1.8704792261123657, "learning_rate": 1.571947526689349e-07, "loss": 0.8638, "step": 2624 }, { "epoch": 20.5, "eval_accuracy": 0.7449664429530202, "eval_loss": 0.8461165428161621, "eval_runtime": 8.6825, "eval_samples_per_second": 34.322, "eval_steps_per_second": 0.576, "step": 2624 }, { "epoch": 21.0, "grad_norm": 2.0402615070343018, "learning_rate": 4.93731978045456e-05, "loss": 0.8449, "step": 2688 }, { "epoch": 21.0, "eval_accuracy": 0.7483221476510067, "eval_loss": 0.8376011252403259, "eval_runtime": 8.1707, "eval_samples_per_second": 36.472, "eval_steps_per_second": 0.612, "step": 2688 }, { "epoch": 21.5, "grad_norm": 1.7034225463867188, "learning_rate": 4.616810498070709e-05, "loss": 0.8461, "step": 2752 }, { "epoch": 21.5, "eval_accuracy": 0.7483221476510067, "eval_loss": 0.8213455677032471, "eval_runtime": 8.1107, "eval_samples_per_second": 36.742, "eval_steps_per_second": 0.616, "step": 2752 }, { "epoch": 22.0, "grad_norm": 1.6208754777908325, "learning_rate": 4.058724504646835e-05, "loss": 0.8179, "step": 2816 }, { "epoch": 22.0, "eval_accuracy": 0.7416107382550335, "eval_loss": 0.805648148059845, "eval_runtime": 8.0669, "eval_samples_per_second": 36.941, "eval_steps_per_second": 0.62, "step": 2816 }, { "epoch": 22.5, "grad_norm": 1.8578311204910278, "learning_rate": 3.325697654887922e-05, "loss": 0.8124, "step": 2880 }, { "epoch": 22.5, "eval_accuracy": 0.7483221476510067, "eval_loss": 0.8016577363014221, "eval_runtime": 8.6546, "eval_samples_per_second": 34.433, "eval_steps_per_second": 0.578, "step": 2880 }, { "epoch": 23.0, "grad_norm": 1.838831901550293, "learning_rate": 2.5e-05, "loss": 0.803, "step": 2944 }, { "epoch": 23.0, "eval_accuracy": 0.7583892617449665, "eval_loss": 0.7895504832267761, "eval_runtime": 8.2476, "eval_samples_per_second": 36.132, "eval_steps_per_second": 0.606, "step": 2944 }, { "epoch": 23.5, "grad_norm": 1.7440546751022339, "learning_rate": 1.6743023451120788e-05, "loss": 0.7979, "step": 3008 }, { "epoch": 23.5, "eval_accuracy": 0.7583892617449665, "eval_loss": 0.7843785881996155, "eval_runtime": 8.6902, "eval_samples_per_second": 34.292, "eval_steps_per_second": 0.575, "step": 3008 }, { "epoch": 24.0, "grad_norm": 1.838025450706482, "learning_rate": 9.412754953531655e-06, "loss": 0.7878, "step": 3072 }, { "epoch": 24.0, "eval_accuracy": 0.7651006711409396, "eval_loss": 0.7816659808158875, "eval_runtime": 8.7178, "eval_samples_per_second": 34.183, "eval_steps_per_second": 0.574, "step": 3072 }, { "epoch": 24.5, "grad_norm": 1.8526736497879028, "learning_rate": 3.831895019292909e-06, "loss": 0.7808, "step": 3136 }, { "epoch": 24.5, "eval_accuracy": 0.761744966442953, "eval_loss": 0.7814260721206665, "eval_runtime": 8.7274, "eval_samples_per_second": 34.145, "eval_steps_per_second": 0.573, "step": 3136 }, { "epoch": 25.0, "grad_norm": 1.6450481414794922, "learning_rate": 6.268021954544068e-07, "loss": 0.7924, "step": 3200 }, { "epoch": 25.0, "eval_accuracy": 0.761744966442953, "eval_loss": 0.780437707901001, "eval_runtime": 7.6749, "eval_samples_per_second": 38.828, "eval_steps_per_second": 0.651, "step": 3200 }, { "epoch": 25.5, "grad_norm": 1.8034324645996094, "learning_rate": 4.984280524733107e-05, "loss": 0.8049, "step": 3264 }, { "epoch": 25.5, "eval_accuracy": 0.761744966442953, "eval_loss": 0.7750493288040161, "eval_runtime": 8.6458, "eval_samples_per_second": 34.468, "eval_steps_per_second": 0.578, "step": 3264 }, { "epoch": 26.0, "grad_norm": 1.6223326921463013, "learning_rate": 4.75242216975605e-05, "loss": 0.7581, "step": 3328 }, { "epoch": 26.0, "eval_accuracy": 0.761744966442953, "eval_loss": 0.7638412714004517, "eval_runtime": 7.7052, "eval_samples_per_second": 38.675, "eval_steps_per_second": 0.649, "step": 3328 }, { "epoch": 26.5, "grad_norm": 2.002840995788574, "learning_rate": 4.267766952966369e-05, "loss": 0.7651, "step": 3392 }, { "epoch": 26.5, "eval_accuracy": 0.7684563758389261, "eval_loss": 0.7540990710258484, "eval_runtime": 7.6847, "eval_samples_per_second": 38.779, "eval_steps_per_second": 0.651, "step": 3392 }, { "epoch": 27.0, "grad_norm": 1.705908179283142, "learning_rate": 3.584709347793892e-05, "loss": 0.7573, "step": 3456 }, { "epoch": 27.0, "eval_accuracy": 0.7651006711409396, "eval_loss": 0.7505062818527222, "eval_runtime": 7.6264, "eval_samples_per_second": 39.075, "eval_steps_per_second": 0.656, "step": 3456 }, { "epoch": 27.5, "grad_norm": 1.8837891817092896, "learning_rate": 2.7799111902582686e-05, "loss": 0.7524, "step": 3520 }, { "epoch": 27.5, "eval_accuracy": 0.7651006711409396, "eval_loss": 0.7437400221824646, "eval_runtime": 7.6701, "eval_samples_per_second": 38.852, "eval_steps_per_second": 0.652, "step": 3520 }, { "epoch": 28.0, "grad_norm": 1.8985482454299927, "learning_rate": 1.9436976651092164e-05, "loss": 0.7362, "step": 3584 }, { "epoch": 28.0, "eval_accuracy": 0.7651006711409396, "eval_loss": 0.7364336848258972, "eval_runtime": 7.6555, "eval_samples_per_second": 38.926, "eval_steps_per_second": 0.653, "step": 3584 }, { "epoch": 28.5, "grad_norm": 2.0026416778564453, "learning_rate": 1.169919808711657e-05, "loss": 0.7288, "step": 3648 }, { "epoch": 28.5, "eval_accuracy": 0.7684563758389261, "eval_loss": 0.7339101433753967, "eval_runtime": 8.8394, "eval_samples_per_second": 33.713, "eval_steps_per_second": 0.566, "step": 3648 }, { "epoch": 29.0, "grad_norm": 1.8134102821350098, "learning_rate": 5.454212938299264e-06, "loss": 0.7415, "step": 3712 }, { "epoch": 29.0, "eval_accuracy": 0.7684563758389261, "eval_loss": 0.7321557402610779, "eval_runtime": 7.7574, "eval_samples_per_second": 38.415, "eval_steps_per_second": 0.645, "step": 3712 }, { "epoch": 29.5, "grad_norm": 1.838896632194519, "learning_rate": 1.4029167422908274e-06, "loss": 0.7355, "step": 3776 }, { "epoch": 29.5, "eval_accuracy": 0.7684563758389261, "eval_loss": 0.7323412299156189, "eval_runtime": 8.6786, "eval_samples_per_second": 34.337, "eval_steps_per_second": 0.576, "step": 3776 }, { "epoch": 30.0, "grad_norm": 1.7982102632522583, "learning_rate": 0.0, "loss": 0.7283, "step": 3840 }, { "epoch": 30.0, "eval_accuracy": 0.7684563758389261, "eval_loss": 0.7321370244026184, "eval_runtime": 8.9098, "eval_samples_per_second": 33.446, "eval_steps_per_second": 0.561, "step": 3840 }, { "epoch": 30.0, "step": 3840, "total_flos": 1.9045455502969405e+19, "train_loss": 1.073897185921669, "train_runtime": 8808.4478, "train_samples_per_second": 27.9, "train_steps_per_second": 0.436 } ], "logging_steps": 64, "max_steps": 3840, "num_input_tokens_seen": 0, "num_train_epochs": 30, "save_steps": 64, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.9045455502969405e+19, "train_batch_size": 64, "trial_name": null, "trial_params": null }