{ "best_metric": 0.8512137823022711, "best_model_checkpoint": "/content/dissertation/scripts/ner/output/checkpoint-4315", "epoch": 9.991889699918897, "eval_steps": 500, "global_step": 6160, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.8110300081103001, "grad_norm": 0.7429273724555969, "learning_rate": 4.5941558441558444e-05, "loss": 0.0571, "step": 500 }, { "epoch": 0.9991889699918897, "eval_accuracy": 0.9906421648980531, "eval_f1": 0.8112888052681091, "eval_loss": 0.02658958174288273, "eval_precision": 0.776657060518732, "eval_recall": 0.8491532099251674, "eval_runtime": 15.3903, "eval_samples_per_second": 477.832, "eval_steps_per_second": 59.778, "step": 616 }, { "epoch": 1.6220600162206003, "grad_norm": 0.32481127977371216, "learning_rate": 4.1883116883116886e-05, "loss": 0.018, "step": 1000 }, { "epoch": 2.0, "eval_accuracy": 0.9914186293963707, "eval_f1": 0.8270561106840891, "eval_loss": 0.030444670468568802, "eval_precision": 0.8075046904315197, "eval_recall": 0.8475777865301299, "eval_runtime": 15.7588, "eval_samples_per_second": 466.66, "eval_steps_per_second": 58.38, "step": 1233 }, { "epoch": 2.4330900243309004, "grad_norm": 0.10290508717298508, "learning_rate": 3.782467532467533e-05, "loss": 0.0101, "step": 1500 }, { "epoch": 2.9991889699918897, "eval_accuracy": 0.9906249101314238, "eval_f1": 0.8310784692694241, "eval_loss": 0.03564191609621048, "eval_precision": 0.8159392789373814, "eval_recall": 0.8467900748326113, "eval_runtime": 15.5516, "eval_samples_per_second": 472.877, "eval_steps_per_second": 59.158, "step": 1849 }, { "epoch": 3.2441200324412005, "grad_norm": 0.3212472200393677, "learning_rate": 3.376623376623377e-05, "loss": 0.0057, "step": 2000 }, { "epoch": 4.0, "eval_accuracy": 0.9910217697638973, "eval_f1": 0.8348231636222309, "eval_loss": 0.03653988987207413, "eval_precision": 0.8239355581127733, "eval_recall": 0.8460023631350926, "eval_runtime": 15.8023, "eval_samples_per_second": 465.375, "eval_steps_per_second": 58.219, "step": 2466 }, { "epoch": 4.0551500405515, "grad_norm": 1.049054741859436, "learning_rate": 2.9707792207792207e-05, "loss": 0.0039, "step": 2500 }, { "epoch": 4.866180048661801, "grad_norm": 0.12911342084407806, "learning_rate": 2.5649350649350652e-05, "loss": 0.0027, "step": 3000 }, { "epoch": 4.99918896999189, "eval_accuracy": 0.9915624191182815, "eval_f1": 0.8343344313117613, "eval_loss": 0.03956884518265724, "eval_precision": 0.8211289092295957, "eval_recall": 0.8479716423788893, "eval_runtime": 15.4772, "eval_samples_per_second": 475.151, "eval_steps_per_second": 59.442, "step": 3082 }, { "epoch": 5.6772100567721, "grad_norm": 0.1811482459306717, "learning_rate": 2.1590909090909093e-05, "loss": 0.0018, "step": 3500 }, { "epoch": 6.0, "eval_accuracy": 0.9915394127627757, "eval_f1": 0.846658941676323, "eval_loss": 0.04350048676133156, "eval_precision": 0.8306176582038651, "eval_recall": 0.8633320204805042, "eval_runtime": 15.4958, "eval_samples_per_second": 474.581, "eval_steps_per_second": 59.371, "step": 3699 }, { "epoch": 6.488240064882401, "grad_norm": 0.0691465437412262, "learning_rate": 1.7532467532467535e-05, "loss": 0.0013, "step": 4000 }, { "epoch": 6.99918896999189, "eval_accuracy": 0.991867253328732, "eval_f1": 0.8512137823022711, "eval_loss": 0.047813717275857925, "eval_precision": 0.8462436745815493, "eval_recall": 0.8562426152028357, "eval_runtime": 15.6578, "eval_samples_per_second": 469.669, "eval_steps_per_second": 58.757, "step": 4315 }, { "epoch": 7.299270072992701, "grad_norm": 0.016636306419968605, "learning_rate": 1.3474025974025975e-05, "loss": 0.0008, "step": 4500 }, { "epoch": 8.0, "eval_accuracy": 0.9914761452851351, "eval_f1": 0.8478387284357433, "eval_loss": 0.04689360409975052, "eval_precision": 0.8347328244274809, "eval_recall": 0.8613627412367074, "eval_runtime": 15.6856, "eval_samples_per_second": 468.838, "eval_steps_per_second": 58.653, "step": 4932 }, { "epoch": 8.110300081103, "grad_norm": 0.02262457087635994, "learning_rate": 9.415584415584416e-06, "loss": 0.0008, "step": 5000 }, { "epoch": 8.921330089213301, "grad_norm": 0.6416856646537781, "learning_rate": 5.357142857142857e-06, "loss": 0.0004, "step": 5500 }, { "epoch": 8.99918896999189, "eval_accuracy": 0.9918845080953613, "eval_f1": 0.851080397118941, "eval_loss": 0.05153572931885719, "eval_precision": 0.8414164742109315, "eval_recall": 0.860968885387948, "eval_runtime": 15.5849, "eval_samples_per_second": 471.866, "eval_steps_per_second": 59.031, "step": 5548 }, { "epoch": 9.732360097323602, "grad_norm": 0.011619620956480503, "learning_rate": 1.2987012987012988e-06, "loss": 0.0002, "step": 6000 }, { "epoch": 9.991889699918897, "eval_accuracy": 0.9917694763178329, "eval_f1": 0.8490859587709063, "eval_loss": 0.05196274444460869, "eval_precision": 0.8386477141759509, "eval_recall": 0.85978731784167, "eval_runtime": 15.9471, "eval_samples_per_second": 461.149, "eval_steps_per_second": 57.691, "step": 6160 }, { "epoch": 9.991889699918897, "step": 6160, "total_flos": 1.919784837910831e+16, "train_loss": 0.008344567238123386, "train_runtime": 1725.5138, "train_samples_per_second": 228.488, "train_steps_per_second": 3.57 } ], "logging_steps": 500, "max_steps": 6160, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.919784837910831e+16, "train_batch_size": 32, "trial_name": null, "trial_params": null }