| { |
| "best_metric": 0.536262647683346, |
| "best_model_checkpoint": "distilbert-base-uncased-finetuned-cola/run-0/checkpoint-8552", |
| "epoch": 5.0, |
| "eval_steps": 500, |
| "global_step": 10690, |
| "is_hyper_param_search": true, |
| "is_local_process_zero": true, |
| "is_world_process_zero": true, |
| "log_history": [ |
| { |
| "epoch": 0.23386342376052385, |
| "grad_norm": 31.300899505615234, |
| "learning_rate": 9.18994205127588e-06, |
| "loss": 0.5844, |
| "step": 500 |
| }, |
| { |
| "epoch": 0.4677268475210477, |
| "grad_norm": 10.452669143676758, |
| "learning_rate": 8.739012608131823e-06, |
| "loss": 0.5545, |
| "step": 1000 |
| }, |
| { |
| "epoch": 0.7015902712815716, |
| "grad_norm": 42.02324676513672, |
| "learning_rate": 8.288083164987766e-06, |
| "loss": 0.547, |
| "step": 1500 |
| }, |
| { |
| "epoch": 0.9354536950420954, |
| "grad_norm": 38.979740142822266, |
| "learning_rate": 7.837153721843709e-06, |
| "loss": 0.5382, |
| "step": 2000 |
| }, |
| { |
| "epoch": 1.0, |
| "eval_loss": 0.5065158605575562, |
| "eval_matthews_correlation": 0.4539100120594166, |
| "eval_runtime": 0.7267, |
| "eval_samples_per_second": 1435.351, |
| "eval_steps_per_second": 90.828, |
| "step": 2138 |
| }, |
| { |
| "epoch": 1.1693171188026192, |
| "grad_norm": 42.54972839355469, |
| "learning_rate": 7.3862242786996525e-06, |
| "loss": 0.4498, |
| "step": 2500 |
| }, |
| { |
| "epoch": 1.4031805425631432, |
| "grad_norm": 38.12797927856445, |
| "learning_rate": 6.935294835555595e-06, |
| "loss": 0.4789, |
| "step": 3000 |
| }, |
| { |
| "epoch": 1.637043966323667, |
| "grad_norm": 2.2431697845458984, |
| "learning_rate": 6.4843653924115385e-06, |
| "loss": 0.4803, |
| "step": 3500 |
| }, |
| { |
| "epoch": 1.8709073900841908, |
| "grad_norm": 0.8748724460601807, |
| "learning_rate": 6.033435949267481e-06, |
| "loss": 0.5225, |
| "step": 4000 |
| }, |
| { |
| "epoch": 2.0, |
| "eval_loss": 0.778407871723175, |
| "eval_matthews_correlation": 0.4730676912894765, |
| "eval_runtime": 0.7349, |
| "eval_samples_per_second": 1419.24, |
| "eval_steps_per_second": 89.808, |
| "step": 4276 |
| }, |
| { |
| "epoch": 2.1047708138447145, |
| "grad_norm": 0.08216582238674164, |
| "learning_rate": 5.5825065061234246e-06, |
| "loss": 0.4451, |
| "step": 4500 |
| }, |
| { |
| "epoch": 2.3386342376052385, |
| "grad_norm": 34.81584167480469, |
| "learning_rate": 5.131577062979367e-06, |
| "loss": 0.3457, |
| "step": 5000 |
| }, |
| { |
| "epoch": 2.5724976613657624, |
| "grad_norm": 0.2907339334487915, |
| "learning_rate": 4.680647619835311e-06, |
| "loss": 0.3718, |
| "step": 5500 |
| }, |
| { |
| "epoch": 2.8063610851262863, |
| "grad_norm": 0.22318235039710999, |
| "learning_rate": 4.229718176691254e-06, |
| "loss": 0.3999, |
| "step": 6000 |
| }, |
| { |
| "epoch": 3.0, |
| "eval_loss": 0.8715924024581909, |
| "eval_matthews_correlation": 0.5051600900029769, |
| "eval_runtime": 0.7186, |
| "eval_samples_per_second": 1451.341, |
| "eval_steps_per_second": 91.839, |
| "step": 6414 |
| }, |
| { |
| "epoch": 3.0402245088868103, |
| "grad_norm": 0.47206905484199524, |
| "learning_rate": 3.7787887335471967e-06, |
| "loss": 0.3685, |
| "step": 6500 |
| }, |
| { |
| "epoch": 3.2740879326473338, |
| "grad_norm": 0.04389917850494385, |
| "learning_rate": 3.3278592904031397e-06, |
| "loss": 0.249, |
| "step": 7000 |
| }, |
| { |
| "epoch": 3.5079513564078577, |
| "grad_norm": 0.21924751996994019, |
| "learning_rate": 2.8769298472590827e-06, |
| "loss": 0.252, |
| "step": 7500 |
| }, |
| { |
| "epoch": 3.7418147801683816, |
| "grad_norm": 9.382844924926758, |
| "learning_rate": 2.4260004041150266e-06, |
| "loss": 0.2621, |
| "step": 8000 |
| }, |
| { |
| "epoch": 3.9756782039289056, |
| "grad_norm": 134.2183074951172, |
| "learning_rate": 1.975070960970969e-06, |
| "loss": 0.2923, |
| "step": 8500 |
| }, |
| { |
| "epoch": 4.0, |
| "eval_loss": 1.0317972898483276, |
| "eval_matthews_correlation": 0.536262647683346, |
| "eval_runtime": 0.7324, |
| "eval_samples_per_second": 1424.048, |
| "eval_steps_per_second": 90.112, |
| "step": 8552 |
| }, |
| { |
| "epoch": 4.209541627689429, |
| "grad_norm": 0.09477799385786057, |
| "learning_rate": 1.5241415178269122e-06, |
| "loss": 0.22, |
| "step": 9000 |
| }, |
| { |
| "epoch": 4.443405051449953, |
| "grad_norm": 0.18212155997753143, |
| "learning_rate": 1.0732120746828554e-06, |
| "loss": 0.225, |
| "step": 9500 |
| }, |
| { |
| "epoch": 4.677268475210477, |
| "grad_norm": 0.04502077028155327, |
| "learning_rate": 6.222826315387986e-07, |
| "loss": 0.1876, |
| "step": 10000 |
| }, |
| { |
| "epoch": 4.911131898971001, |
| "grad_norm": 0.0519992969930172, |
| "learning_rate": 1.713531883947416e-07, |
| "loss": 0.2003, |
| "step": 10500 |
| }, |
| { |
| "epoch": 5.0, |
| "eval_loss": 1.094925880432129, |
| "eval_matthews_correlation": 0.522211073949747, |
| "eval_runtime": 0.8243, |
| "eval_samples_per_second": 1265.281, |
| "eval_steps_per_second": 80.066, |
| "step": 10690 |
| } |
| ], |
| "logging_steps": 500, |
| "max_steps": 10690, |
| "num_input_tokens_seen": 0, |
| "num_train_epochs": 5, |
| "save_steps": 500, |
| "stateful_callbacks": { |
| "TrainerControl": { |
| "args": { |
| "should_epoch_stop": false, |
| "should_evaluate": false, |
| "should_log": false, |
| "should_save": true, |
| "should_training_stop": true |
| }, |
| "attributes": {} |
| } |
| }, |
| "total_flos": 171182806990932.0, |
| "train_batch_size": 4, |
| "trial_name": null, |
| "trial_params": { |
| "learning_rate": 9.640871494419937e-06, |
| "num_train_epochs": 5, |
| "per_device_train_batch_size": 4, |
| "seed": 8 |
| } |
| } |
|
|