Instructions to use SodaXII/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft with libraries, inference providers, notebooks, and local apps. Follow these links to get started.
- Libraries
- Transformers
How to use SodaXII/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft with Transformers:
# Use a pipeline as a high-level helper from transformers import pipeline pipe = pipeline("image-classification", model="SodaXII/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft") pipe("https://huggingface.co/datasets/huggingface/documentation-images/resolve/main/hub/parrots.png")# Load model directly from transformers import AutoImageProcessor, AutoModelForImageClassification processor = AutoImageProcessor.from_pretrained("SodaXII/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft") model = AutoModelForImageClassification.from_pretrained("SodaXII/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft", device_map="auto") - Notebooks
- Google Colab
- Kaggle
| { | |
| "best_metric": 0.7684563758389261, | |
| "best_model_checkpoint": "./drive/Shareddrives/CS198-Drones/[v5] Training Output/vit-base-patch16-224_rice-leaf-disease-augmented-v4_v5_pft/checkpoint-3392", | |
| "epoch": 30.0, | |
| "eval_steps": 64, | |
| "global_step": 3840, | |
| "is_hyper_param_search": false, | |
| "is_local_process_zero": true, | |
| "is_world_process_zero": true, | |
| "log_history": [ | |
| { | |
| "epoch": 0.5, | |
| "grad_norm": 3.3553061485290527, | |
| "learning_rate": 1.25e-05, | |
| "loss": 2.1933, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 0.5, | |
| "eval_accuracy": 0.09060402684563758, | |
| "eval_loss": 2.1968395709991455, | |
| "eval_runtime": 9.159, | |
| "eval_samples_per_second": 32.536, | |
| "eval_steps_per_second": 0.546, | |
| "step": 64 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "grad_norm": 3.834850311279297, | |
| "learning_rate": 2.5e-05, | |
| "loss": 2.1246, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 1.0, | |
| "eval_accuracy": 0.12416107382550336, | |
| "eval_loss": 2.108480453491211, | |
| "eval_runtime": 8.2948, | |
| "eval_samples_per_second": 35.926, | |
| "eval_steps_per_second": 0.603, | |
| "step": 128 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "grad_norm": 3.4604074954986572, | |
| "learning_rate": 3.7500000000000003e-05, | |
| "loss": 2.021, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 1.5, | |
| "eval_accuracy": 0.2181208053691275, | |
| "eval_loss": 1.9747371673583984, | |
| "eval_runtime": 8.8968, | |
| "eval_samples_per_second": 33.495, | |
| "eval_steps_per_second": 0.562, | |
| "step": 192 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "grad_norm": 3.332814931869507, | |
| "learning_rate": 5e-05, | |
| "loss": 1.8907, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 2.0, | |
| "eval_accuracy": 0.3288590604026846, | |
| "eval_loss": 1.8124574422836304, | |
| "eval_runtime": 7.9216, | |
| "eval_samples_per_second": 37.619, | |
| "eval_steps_per_second": 0.631, | |
| "step": 256 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "grad_norm": 2.982445478439331, | |
| "learning_rate": 4.8597083257709194e-05, | |
| "loss": 1.7317, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 2.5, | |
| "eval_accuracy": 0.39932885906040266, | |
| "eval_loss": 1.6570496559143066, | |
| "eval_runtime": 7.7262, | |
| "eval_samples_per_second": 38.57, | |
| "eval_steps_per_second": 0.647, | |
| "step": 320 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "grad_norm": 2.638735771179199, | |
| "learning_rate": 4.454578706170075e-05, | |
| "loss": 1.614, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 3.0, | |
| "eval_accuracy": 0.4798657718120805, | |
| "eval_loss": 1.5440526008605957, | |
| "eval_runtime": 7.8344, | |
| "eval_samples_per_second": 38.038, | |
| "eval_steps_per_second": 0.638, | |
| "step": 384 | |
| }, | |
| { | |
| "epoch": 3.5, | |
| "grad_norm": 2.8015382289886475, | |
| "learning_rate": 3.830080191288342e-05, | |
| "loss": 1.518, | |
| "step": 448 | |
| }, | |
| { | |
| "epoch": 3.5, | |
| "eval_accuracy": 0.5100671140939598, | |
| "eval_loss": 1.4556909799575806, | |
| "eval_runtime": 7.7497, | |
| "eval_samples_per_second": 38.453, | |
| "eval_steps_per_second": 0.645, | |
| "step": 448 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "grad_norm": 2.9463720321655273, | |
| "learning_rate": 3.056302334890786e-05, | |
| "loss": 1.4343, | |
| "step": 512 | |
| }, | |
| { | |
| "epoch": 4.0, | |
| "eval_accuracy": 0.5369127516778524, | |
| "eval_loss": 1.3944100141525269, | |
| "eval_runtime": 8.033, | |
| "eval_samples_per_second": 37.097, | |
| "eval_steps_per_second": 0.622, | |
| "step": 512 | |
| }, | |
| { | |
| "epoch": 4.5, | |
| "grad_norm": 3.31219744682312, | |
| "learning_rate": 2.2200888097417307e-05, | |
| "loss": 1.4007, | |
| "step": 576 | |
| }, | |
| { | |
| "epoch": 4.5, | |
| "eval_accuracy": 0.5469798657718121, | |
| "eval_loss": 1.3522661924362183, | |
| "eval_runtime": 7.6521, | |
| "eval_samples_per_second": 38.943, | |
| "eval_steps_per_second": 0.653, | |
| "step": 576 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "grad_norm": 2.2543766498565674, | |
| "learning_rate": 1.4152906522061048e-05, | |
| "loss": 1.345, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 5.0, | |
| "eval_accuracy": 0.5536912751677853, | |
| "eval_loss": 1.3297712802886963, | |
| "eval_runtime": 7.6521, | |
| "eval_samples_per_second": 38.944, | |
| "eval_steps_per_second": 0.653, | |
| "step": 640 | |
| }, | |
| { | |
| "epoch": 5.5, | |
| "grad_norm": 2.3809094429016113, | |
| "learning_rate": 7.3223304703363135e-06, | |
| "loss": 1.3353, | |
| "step": 704 | |
| }, | |
| { | |
| "epoch": 5.5, | |
| "eval_accuracy": 0.5604026845637584, | |
| "eval_loss": 1.3163374662399292, | |
| "eval_runtime": 7.8107, | |
| "eval_samples_per_second": 38.153, | |
| "eval_steps_per_second": 0.64, | |
| "step": 704 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "grad_norm": 2.5822391510009766, | |
| "learning_rate": 2.475778302439524e-06, | |
| "loss": 1.324, | |
| "step": 768 | |
| }, | |
| { | |
| "epoch": 6.0, | |
| "eval_accuracy": 0.5604026845637584, | |
| "eval_loss": 1.3087968826293945, | |
| "eval_runtime": 8.6399, | |
| "eval_samples_per_second": 34.491, | |
| "eval_steps_per_second": 0.579, | |
| "step": 768 | |
| }, | |
| { | |
| "epoch": 6.5, | |
| "grad_norm": 2.5432515144348145, | |
| "learning_rate": 1.571947526689349e-07, | |
| "loss": 1.3386, | |
| "step": 832 | |
| }, | |
| { | |
| "epoch": 6.5, | |
| "eval_accuracy": 0.5604026845637584, | |
| "eval_loss": 1.3072452545166016, | |
| "eval_runtime": 8.7139, | |
| "eval_samples_per_second": 34.198, | |
| "eval_steps_per_second": 0.574, | |
| "step": 832 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "grad_norm": 2.583087682723999, | |
| "learning_rate": 4.937319780454559e-05, | |
| "loss": 1.2882, | |
| "step": 896 | |
| }, | |
| { | |
| "epoch": 7.0, | |
| "eval_accuracy": 0.610738255033557, | |
| "eval_loss": 1.2582257986068726, | |
| "eval_runtime": 8.6431, | |
| "eval_samples_per_second": 34.478, | |
| "eval_steps_per_second": 0.578, | |
| "step": 896 | |
| }, | |
| { | |
| "epoch": 7.5, | |
| "grad_norm": 2.8682312965393066, | |
| "learning_rate": 4.6168104980707107e-05, | |
| "loss": 1.2525, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 7.5, | |
| "eval_accuracy": 0.610738255033557, | |
| "eval_loss": 1.2107785940170288, | |
| "eval_runtime": 8.7628, | |
| "eval_samples_per_second": 34.007, | |
| "eval_steps_per_second": 0.571, | |
| "step": 960 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "grad_norm": 2.307509660720825, | |
| "learning_rate": 4.058724504646835e-05, | |
| "loss": 1.2039, | |
| "step": 1024 | |
| }, | |
| { | |
| "epoch": 8.0, | |
| "eval_accuracy": 0.6409395973154363, | |
| "eval_loss": 1.1605823040008545, | |
| "eval_runtime": 8.7427, | |
| "eval_samples_per_second": 34.085, | |
| "eval_steps_per_second": 0.572, | |
| "step": 1024 | |
| }, | |
| { | |
| "epoch": 8.5, | |
| "grad_norm": 2.0223543643951416, | |
| "learning_rate": 3.3256976548879184e-05, | |
| "loss": 1.16, | |
| "step": 1088 | |
| }, | |
| { | |
| "epoch": 8.5, | |
| "eval_accuracy": 0.6409395973154363, | |
| "eval_loss": 1.126598834991455, | |
| "eval_runtime": 8.7703, | |
| "eval_samples_per_second": 33.979, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1088 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "grad_norm": 2.199993848800659, | |
| "learning_rate": 2.5e-05, | |
| "loss": 1.1401, | |
| "step": 1152 | |
| }, | |
| { | |
| "epoch": 9.0, | |
| "eval_accuracy": 0.6610738255033557, | |
| "eval_loss": 1.1063629388809204, | |
| "eval_runtime": 7.9893, | |
| "eval_samples_per_second": 37.3, | |
| "eval_steps_per_second": 0.626, | |
| "step": 1152 | |
| }, | |
| { | |
| "epoch": 9.5, | |
| "grad_norm": 2.102375030517578, | |
| "learning_rate": 1.6743023451120822e-05, | |
| "loss": 1.1161, | |
| "step": 1216 | |
| }, | |
| { | |
| "epoch": 9.5, | |
| "eval_accuracy": 0.6677852348993288, | |
| "eval_loss": 1.0873396396636963, | |
| "eval_runtime": 8.14, | |
| "eval_samples_per_second": 36.609, | |
| "eval_steps_per_second": 0.614, | |
| "step": 1216 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "grad_norm": 2.628359794616699, | |
| "learning_rate": 9.412754953531672e-06, | |
| "loss": 1.0979, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 10.0, | |
| "eval_accuracy": 0.6677852348993288, | |
| "eval_loss": 1.078514575958252, | |
| "eval_runtime": 8.8572, | |
| "eval_samples_per_second": 33.645, | |
| "eval_steps_per_second": 0.565, | |
| "step": 1280 | |
| }, | |
| { | |
| "epoch": 10.5, | |
| "grad_norm": 2.5552382469177246, | |
| "learning_rate": 3.831895019292909e-06, | |
| "loss": 1.0961, | |
| "step": 1344 | |
| }, | |
| { | |
| "epoch": 10.5, | |
| "eval_accuracy": 0.6644295302013423, | |
| "eval_loss": 1.0734963417053223, | |
| "eval_runtime": 8.8197, | |
| "eval_samples_per_second": 33.788, | |
| "eval_steps_per_second": 0.567, | |
| "step": 1344 | |
| }, | |
| { | |
| "epoch": 11.0, | |
| "grad_norm": 2.206542491912842, | |
| "learning_rate": 6.268021954544068e-07, | |
| "loss": 1.0852, | |
| "step": 1408 | |
| }, | |
| { | |
| "epoch": 11.0, | |
| "eval_accuracy": 0.6677852348993288, | |
| "eval_loss": 1.0718457698822021, | |
| "eval_runtime": 9.1051, | |
| "eval_samples_per_second": 32.729, | |
| "eval_steps_per_second": 0.549, | |
| "step": 1408 | |
| }, | |
| { | |
| "epoch": 11.5, | |
| "grad_norm": 3.107128381729126, | |
| "learning_rate": 4.984280524733107e-05, | |
| "loss": 1.0845, | |
| "step": 1472 | |
| }, | |
| { | |
| "epoch": 11.5, | |
| "eval_accuracy": 0.6711409395973155, | |
| "eval_loss": 1.0672944784164429, | |
| "eval_runtime": 8.7733, | |
| "eval_samples_per_second": 33.967, | |
| "eval_steps_per_second": 0.57, | |
| "step": 1472 | |
| }, | |
| { | |
| "epoch": 12.0, | |
| "grad_norm": 2.55963397026062, | |
| "learning_rate": 4.7524221697560484e-05, | |
| "loss": 1.0652, | |
| "step": 1536 | |
| }, | |
| { | |
| "epoch": 12.0, | |
| "eval_accuracy": 0.697986577181208, | |
| "eval_loss": 1.019176959991455, | |
| "eval_runtime": 7.8711, | |
| "eval_samples_per_second": 37.86, | |
| "eval_steps_per_second": 0.635, | |
| "step": 1536 | |
| }, | |
| { | |
| "epoch": 12.5, | |
| "grad_norm": 2.3591487407684326, | |
| "learning_rate": 4.267766952966369e-05, | |
| "loss": 1.0336, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 12.5, | |
| "eval_accuracy": 0.6946308724832215, | |
| "eval_loss": 0.9978868961334229, | |
| "eval_runtime": 8.7958, | |
| "eval_samples_per_second": 33.88, | |
| "eval_steps_per_second": 0.568, | |
| "step": 1600 | |
| }, | |
| { | |
| "epoch": 13.0, | |
| "grad_norm": 2.140841484069824, | |
| "learning_rate": 3.5847093477938956e-05, | |
| "loss": 1.006, | |
| "step": 1664 | |
| }, | |
| { | |
| "epoch": 13.0, | |
| "eval_accuracy": 0.697986577181208, | |
| "eval_loss": 0.9768925905227661, | |
| "eval_runtime": 9.0047, | |
| "eval_samples_per_second": 33.094, | |
| "eval_steps_per_second": 0.555, | |
| "step": 1664 | |
| }, | |
| { | |
| "epoch": 13.5, | |
| "grad_norm": 2.3379549980163574, | |
| "learning_rate": 2.7799111902582686e-05, | |
| "loss": 0.9842, | |
| "step": 1728 | |
| }, | |
| { | |
| "epoch": 13.5, | |
| "eval_accuracy": 0.7013422818791947, | |
| "eval_loss": 0.9594218730926514, | |
| "eval_runtime": 8.8056, | |
| "eval_samples_per_second": 33.842, | |
| "eval_steps_per_second": 0.568, | |
| "step": 1728 | |
| }, | |
| { | |
| "epoch": 14.0, | |
| "grad_norm": 2.195948362350464, | |
| "learning_rate": 1.9436976651092164e-05, | |
| "loss": 0.9735, | |
| "step": 1792 | |
| }, | |
| { | |
| "epoch": 14.0, | |
| "eval_accuracy": 0.7080536912751678, | |
| "eval_loss": 0.9499163627624512, | |
| "eval_runtime": 8.8229, | |
| "eval_samples_per_second": 33.776, | |
| "eval_steps_per_second": 0.567, | |
| "step": 1792 | |
| }, | |
| { | |
| "epoch": 14.5, | |
| "grad_norm": 2.181391716003418, | |
| "learning_rate": 1.169919808711657e-05, | |
| "loss": 0.9662, | |
| "step": 1856 | |
| }, | |
| { | |
| "epoch": 14.5, | |
| "eval_accuracy": 0.7114093959731543, | |
| "eval_loss": 0.9434810280799866, | |
| "eval_runtime": 8.7331, | |
| "eval_samples_per_second": 34.123, | |
| "eval_steps_per_second": 0.573, | |
| "step": 1856 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "grad_norm": 1.8749948740005493, | |
| "learning_rate": 5.454212938299264e-06, | |
| "loss": 0.9491, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 15.0, | |
| "eval_accuracy": 0.714765100671141, | |
| "eval_loss": 0.9374688863754272, | |
| "eval_runtime": 8.9079, | |
| "eval_samples_per_second": 33.453, | |
| "eval_steps_per_second": 0.561, | |
| "step": 1920 | |
| }, | |
| { | |
| "epoch": 15.5, | |
| "grad_norm": 2.289724111557007, | |
| "learning_rate": 1.4029167422908107e-06, | |
| "loss": 0.945, | |
| "step": 1984 | |
| }, | |
| { | |
| "epoch": 15.5, | |
| "eval_accuracy": 0.7181208053691275, | |
| "eval_loss": 0.9357881546020508, | |
| "eval_runtime": 8.649, | |
| "eval_samples_per_second": 34.455, | |
| "eval_steps_per_second": 0.578, | |
| "step": 1984 | |
| }, | |
| { | |
| "epoch": 16.0, | |
| "grad_norm": 1.9242281913757324, | |
| "learning_rate": 5e-05, | |
| "loss": 0.9564, | |
| "step": 2048 | |
| }, | |
| { | |
| "epoch": 16.0, | |
| "eval_accuracy": 0.7181208053691275, | |
| "eval_loss": 0.9354940056800842, | |
| "eval_runtime": 8.9028, | |
| "eval_samples_per_second": 33.473, | |
| "eval_steps_per_second": 0.562, | |
| "step": 2048 | |
| }, | |
| { | |
| "epoch": 16.5, | |
| "grad_norm": 2.045414924621582, | |
| "learning_rate": 4.8597083257709174e-05, | |
| "loss": 0.9448, | |
| "step": 2112 | |
| }, | |
| { | |
| "epoch": 16.5, | |
| "eval_accuracy": 0.7248322147651006, | |
| "eval_loss": 0.9101002216339111, | |
| "eval_runtime": 8.8831, | |
| "eval_samples_per_second": 33.547, | |
| "eval_steps_per_second": 0.563, | |
| "step": 2112 | |
| }, | |
| { | |
| "epoch": 17.0, | |
| "grad_norm": 1.940545916557312, | |
| "learning_rate": 4.454578706170074e-05, | |
| "loss": 0.9156, | |
| "step": 2176 | |
| }, | |
| { | |
| "epoch": 17.0, | |
| "eval_accuracy": 0.7214765100671141, | |
| "eval_loss": 0.8984754085540771, | |
| "eval_runtime": 8.7245, | |
| "eval_samples_per_second": 34.157, | |
| "eval_steps_per_second": 0.573, | |
| "step": 2176 | |
| }, | |
| { | |
| "epoch": 17.5, | |
| "grad_norm": 2.2112772464752197, | |
| "learning_rate": 3.8300801912883396e-05, | |
| "loss": 0.9164, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 17.5, | |
| "eval_accuracy": 0.7348993288590604, | |
| "eval_loss": 0.878176212310791, | |
| "eval_runtime": 8.8341, | |
| "eval_samples_per_second": 33.733, | |
| "eval_steps_per_second": 0.566, | |
| "step": 2240 | |
| }, | |
| { | |
| "epoch": 18.0, | |
| "grad_norm": 1.7843997478485107, | |
| "learning_rate": 3.056302334890788e-05, | |
| "loss": 0.8709, | |
| "step": 2304 | |
| }, | |
| { | |
| "epoch": 18.0, | |
| "eval_accuracy": 0.7348993288590604, | |
| "eval_loss": 0.86415696144104, | |
| "eval_runtime": 8.1554, | |
| "eval_samples_per_second": 36.54, | |
| "eval_steps_per_second": 0.613, | |
| "step": 2304 | |
| }, | |
| { | |
| "epoch": 18.5, | |
| "grad_norm": 2.0073421001434326, | |
| "learning_rate": 2.2200888097417317e-05, | |
| "loss": 0.8732, | |
| "step": 2368 | |
| }, | |
| { | |
| "epoch": 18.5, | |
| "eval_accuracy": 0.7348993288590604, | |
| "eval_loss": 0.8535670042037964, | |
| "eval_runtime": 7.8654, | |
| "eval_samples_per_second": 37.888, | |
| "eval_steps_per_second": 0.636, | |
| "step": 2368 | |
| }, | |
| { | |
| "epoch": 19.0, | |
| "grad_norm": 2.097783327102661, | |
| "learning_rate": 1.4152906522061087e-05, | |
| "loss": 0.8662, | |
| "step": 2432 | |
| }, | |
| { | |
| "epoch": 19.0, | |
| "eval_accuracy": 0.7449664429530202, | |
| "eval_loss": 0.8506665229797363, | |
| "eval_runtime": 8.1216, | |
| "eval_samples_per_second": 36.692, | |
| "eval_steps_per_second": 0.616, | |
| "step": 2432 | |
| }, | |
| { | |
| "epoch": 19.5, | |
| "grad_norm": 2.2401092052459717, | |
| "learning_rate": 7.3223304703363135e-06, | |
| "loss": 0.8561, | |
| "step": 2496 | |
| }, | |
| { | |
| "epoch": 19.5, | |
| "eval_accuracy": 0.7416107382550335, | |
| "eval_loss": 0.8498286008834839, | |
| "eval_runtime": 8.845, | |
| "eval_samples_per_second": 33.691, | |
| "eval_steps_per_second": 0.565, | |
| "step": 2496 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "grad_norm": 2.1345531940460205, | |
| "learning_rate": 2.475778302439505e-06, | |
| "loss": 0.8608, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 20.0, | |
| "eval_accuracy": 0.7449664429530202, | |
| "eval_loss": 0.8466877341270447, | |
| "eval_runtime": 8.7517, | |
| "eval_samples_per_second": 34.051, | |
| "eval_steps_per_second": 0.571, | |
| "step": 2560 | |
| }, | |
| { | |
| "epoch": 20.5, | |
| "grad_norm": 1.8704792261123657, | |
| "learning_rate": 1.571947526689349e-07, | |
| "loss": 0.8638, | |
| "step": 2624 | |
| }, | |
| { | |
| "epoch": 20.5, | |
| "eval_accuracy": 0.7449664429530202, | |
| "eval_loss": 0.8461165428161621, | |
| "eval_runtime": 8.6825, | |
| "eval_samples_per_second": 34.322, | |
| "eval_steps_per_second": 0.576, | |
| "step": 2624 | |
| }, | |
| { | |
| "epoch": 21.0, | |
| "grad_norm": 2.0402615070343018, | |
| "learning_rate": 4.93731978045456e-05, | |
| "loss": 0.8449, | |
| "step": 2688 | |
| }, | |
| { | |
| "epoch": 21.0, | |
| "eval_accuracy": 0.7483221476510067, | |
| "eval_loss": 0.8376011252403259, | |
| "eval_runtime": 8.1707, | |
| "eval_samples_per_second": 36.472, | |
| "eval_steps_per_second": 0.612, | |
| "step": 2688 | |
| }, | |
| { | |
| "epoch": 21.5, | |
| "grad_norm": 1.7034225463867188, | |
| "learning_rate": 4.616810498070709e-05, | |
| "loss": 0.8461, | |
| "step": 2752 | |
| }, | |
| { | |
| "epoch": 21.5, | |
| "eval_accuracy": 0.7483221476510067, | |
| "eval_loss": 0.8213455677032471, | |
| "eval_runtime": 8.1107, | |
| "eval_samples_per_second": 36.742, | |
| "eval_steps_per_second": 0.616, | |
| "step": 2752 | |
| }, | |
| { | |
| "epoch": 22.0, | |
| "grad_norm": 1.6208754777908325, | |
| "learning_rate": 4.058724504646835e-05, | |
| "loss": 0.8179, | |
| "step": 2816 | |
| }, | |
| { | |
| "epoch": 22.0, | |
| "eval_accuracy": 0.7416107382550335, | |
| "eval_loss": 0.805648148059845, | |
| "eval_runtime": 8.0669, | |
| "eval_samples_per_second": 36.941, | |
| "eval_steps_per_second": 0.62, | |
| "step": 2816 | |
| }, | |
| { | |
| "epoch": 22.5, | |
| "grad_norm": 1.8578311204910278, | |
| "learning_rate": 3.325697654887922e-05, | |
| "loss": 0.8124, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 22.5, | |
| "eval_accuracy": 0.7483221476510067, | |
| "eval_loss": 0.8016577363014221, | |
| "eval_runtime": 8.6546, | |
| "eval_samples_per_second": 34.433, | |
| "eval_steps_per_second": 0.578, | |
| "step": 2880 | |
| }, | |
| { | |
| "epoch": 23.0, | |
| "grad_norm": 1.838831901550293, | |
| "learning_rate": 2.5e-05, | |
| "loss": 0.803, | |
| "step": 2944 | |
| }, | |
| { | |
| "epoch": 23.0, | |
| "eval_accuracy": 0.7583892617449665, | |
| "eval_loss": 0.7895504832267761, | |
| "eval_runtime": 8.2476, | |
| "eval_samples_per_second": 36.132, | |
| "eval_steps_per_second": 0.606, | |
| "step": 2944 | |
| }, | |
| { | |
| "epoch": 23.5, | |
| "grad_norm": 1.7440546751022339, | |
| "learning_rate": 1.6743023451120788e-05, | |
| "loss": 0.7979, | |
| "step": 3008 | |
| }, | |
| { | |
| "epoch": 23.5, | |
| "eval_accuracy": 0.7583892617449665, | |
| "eval_loss": 0.7843785881996155, | |
| "eval_runtime": 8.6902, | |
| "eval_samples_per_second": 34.292, | |
| "eval_steps_per_second": 0.575, | |
| "step": 3008 | |
| }, | |
| { | |
| "epoch": 24.0, | |
| "grad_norm": 1.838025450706482, | |
| "learning_rate": 9.412754953531655e-06, | |
| "loss": 0.7878, | |
| "step": 3072 | |
| }, | |
| { | |
| "epoch": 24.0, | |
| "eval_accuracy": 0.7651006711409396, | |
| "eval_loss": 0.7816659808158875, | |
| "eval_runtime": 8.7178, | |
| "eval_samples_per_second": 34.183, | |
| "eval_steps_per_second": 0.574, | |
| "step": 3072 | |
| }, | |
| { | |
| "epoch": 24.5, | |
| "grad_norm": 1.8526736497879028, | |
| "learning_rate": 3.831895019292909e-06, | |
| "loss": 0.7808, | |
| "step": 3136 | |
| }, | |
| { | |
| "epoch": 24.5, | |
| "eval_accuracy": 0.761744966442953, | |
| "eval_loss": 0.7814260721206665, | |
| "eval_runtime": 8.7274, | |
| "eval_samples_per_second": 34.145, | |
| "eval_steps_per_second": 0.573, | |
| "step": 3136 | |
| }, | |
| { | |
| "epoch": 25.0, | |
| "grad_norm": 1.6450481414794922, | |
| "learning_rate": 6.268021954544068e-07, | |
| "loss": 0.7924, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 25.0, | |
| "eval_accuracy": 0.761744966442953, | |
| "eval_loss": 0.780437707901001, | |
| "eval_runtime": 7.6749, | |
| "eval_samples_per_second": 38.828, | |
| "eval_steps_per_second": 0.651, | |
| "step": 3200 | |
| }, | |
| { | |
| "epoch": 25.5, | |
| "grad_norm": 1.8034324645996094, | |
| "learning_rate": 4.984280524733107e-05, | |
| "loss": 0.8049, | |
| "step": 3264 | |
| }, | |
| { | |
| "epoch": 25.5, | |
| "eval_accuracy": 0.761744966442953, | |
| "eval_loss": 0.7750493288040161, | |
| "eval_runtime": 8.6458, | |
| "eval_samples_per_second": 34.468, | |
| "eval_steps_per_second": 0.578, | |
| "step": 3264 | |
| }, | |
| { | |
| "epoch": 26.0, | |
| "grad_norm": 1.6223326921463013, | |
| "learning_rate": 4.75242216975605e-05, | |
| "loss": 0.7581, | |
| "step": 3328 | |
| }, | |
| { | |
| "epoch": 26.0, | |
| "eval_accuracy": 0.761744966442953, | |
| "eval_loss": 0.7638412714004517, | |
| "eval_runtime": 7.7052, | |
| "eval_samples_per_second": 38.675, | |
| "eval_steps_per_second": 0.649, | |
| "step": 3328 | |
| }, | |
| { | |
| "epoch": 26.5, | |
| "grad_norm": 2.002840995788574, | |
| "learning_rate": 4.267766952966369e-05, | |
| "loss": 0.7651, | |
| "step": 3392 | |
| }, | |
| { | |
| "epoch": 26.5, | |
| "eval_accuracy": 0.7684563758389261, | |
| "eval_loss": 0.7540990710258484, | |
| "eval_runtime": 7.6847, | |
| "eval_samples_per_second": 38.779, | |
| "eval_steps_per_second": 0.651, | |
| "step": 3392 | |
| }, | |
| { | |
| "epoch": 27.0, | |
| "grad_norm": 1.705908179283142, | |
| "learning_rate": 3.584709347793892e-05, | |
| "loss": 0.7573, | |
| "step": 3456 | |
| }, | |
| { | |
| "epoch": 27.0, | |
| "eval_accuracy": 0.7651006711409396, | |
| "eval_loss": 0.7505062818527222, | |
| "eval_runtime": 7.6264, | |
| "eval_samples_per_second": 39.075, | |
| "eval_steps_per_second": 0.656, | |
| "step": 3456 | |
| }, | |
| { | |
| "epoch": 27.5, | |
| "grad_norm": 1.8837891817092896, | |
| "learning_rate": 2.7799111902582686e-05, | |
| "loss": 0.7524, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 27.5, | |
| "eval_accuracy": 0.7651006711409396, | |
| "eval_loss": 0.7437400221824646, | |
| "eval_runtime": 7.6701, | |
| "eval_samples_per_second": 38.852, | |
| "eval_steps_per_second": 0.652, | |
| "step": 3520 | |
| }, | |
| { | |
| "epoch": 28.0, | |
| "grad_norm": 1.8985482454299927, | |
| "learning_rate": 1.9436976651092164e-05, | |
| "loss": 0.7362, | |
| "step": 3584 | |
| }, | |
| { | |
| "epoch": 28.0, | |
| "eval_accuracy": 0.7651006711409396, | |
| "eval_loss": 0.7364336848258972, | |
| "eval_runtime": 7.6555, | |
| "eval_samples_per_second": 38.926, | |
| "eval_steps_per_second": 0.653, | |
| "step": 3584 | |
| }, | |
| { | |
| "epoch": 28.5, | |
| "grad_norm": 2.0026416778564453, | |
| "learning_rate": 1.169919808711657e-05, | |
| "loss": 0.7288, | |
| "step": 3648 | |
| }, | |
| { | |
| "epoch": 28.5, | |
| "eval_accuracy": 0.7684563758389261, | |
| "eval_loss": 0.7339101433753967, | |
| "eval_runtime": 8.8394, | |
| "eval_samples_per_second": 33.713, | |
| "eval_steps_per_second": 0.566, | |
| "step": 3648 | |
| }, | |
| { | |
| "epoch": 29.0, | |
| "grad_norm": 1.8134102821350098, | |
| "learning_rate": 5.454212938299264e-06, | |
| "loss": 0.7415, | |
| "step": 3712 | |
| }, | |
| { | |
| "epoch": 29.0, | |
| "eval_accuracy": 0.7684563758389261, | |
| "eval_loss": 0.7321557402610779, | |
| "eval_runtime": 7.7574, | |
| "eval_samples_per_second": 38.415, | |
| "eval_steps_per_second": 0.645, | |
| "step": 3712 | |
| }, | |
| { | |
| "epoch": 29.5, | |
| "grad_norm": 1.838896632194519, | |
| "learning_rate": 1.4029167422908274e-06, | |
| "loss": 0.7355, | |
| "step": 3776 | |
| }, | |
| { | |
| "epoch": 29.5, | |
| "eval_accuracy": 0.7684563758389261, | |
| "eval_loss": 0.7323412299156189, | |
| "eval_runtime": 8.6786, | |
| "eval_samples_per_second": 34.337, | |
| "eval_steps_per_second": 0.576, | |
| "step": 3776 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "grad_norm": 1.7982102632522583, | |
| "learning_rate": 0.0, | |
| "loss": 0.7283, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "eval_accuracy": 0.7684563758389261, | |
| "eval_loss": 0.7321370244026184, | |
| "eval_runtime": 8.9098, | |
| "eval_samples_per_second": 33.446, | |
| "eval_steps_per_second": 0.561, | |
| "step": 3840 | |
| }, | |
| { | |
| "epoch": 30.0, | |
| "step": 3840, | |
| "total_flos": 1.9045455502969405e+19, | |
| "train_loss": 1.073897185921669, | |
| "train_runtime": 8808.4478, | |
| "train_samples_per_second": 27.9, | |
| "train_steps_per_second": 0.436 | |
| } | |
| ], | |
| "logging_steps": 64, | |
| "max_steps": 3840, | |
| "num_input_tokens_seen": 0, | |
| "num_train_epochs": 30, | |
| "save_steps": 64, | |
| "stateful_callbacks": { | |
| "TrainerControl": { | |
| "args": { | |
| "should_epoch_stop": false, | |
| "should_evaluate": false, | |
| "should_log": false, | |
| "should_save": true, | |
| "should_training_stop": true | |
| }, | |
| "attributes": {} | |
| } | |
| }, | |
| "total_flos": 1.9045455502969405e+19, | |
| "train_batch_size": 64, | |
| "trial_name": null, | |
| "trial_params": null | |
| } | |