{ "best_metric": 0.536262647683346, "best_model_checkpoint": "distilbert-base-uncased-finetuned-cola/run-0/checkpoint-8552", "epoch": 5.0, "eval_steps": 500, "global_step": 10690, "is_hyper_param_search": true, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.23386342376052385, "grad_norm": 31.300899505615234, "learning_rate": 9.18994205127588e-06, "loss": 0.5844, "step": 500 }, { "epoch": 0.4677268475210477, "grad_norm": 10.452669143676758, "learning_rate": 8.739012608131823e-06, "loss": 0.5545, "step": 1000 }, { "epoch": 0.7015902712815716, "grad_norm": 42.02324676513672, "learning_rate": 8.288083164987766e-06, "loss": 0.547, "step": 1500 }, { "epoch": 0.9354536950420954, "grad_norm": 38.979740142822266, "learning_rate": 7.837153721843709e-06, "loss": 0.5382, "step": 2000 }, { "epoch": 1.0, "eval_loss": 0.5065158605575562, "eval_matthews_correlation": 0.4539100120594166, "eval_runtime": 0.7267, "eval_samples_per_second": 1435.351, "eval_steps_per_second": 90.828, "step": 2138 }, { "epoch": 1.1693171188026192, "grad_norm": 42.54972839355469, "learning_rate": 7.3862242786996525e-06, "loss": 0.4498, "step": 2500 }, { "epoch": 1.4031805425631432, "grad_norm": 38.12797927856445, "learning_rate": 6.935294835555595e-06, "loss": 0.4789, "step": 3000 }, { "epoch": 1.637043966323667, "grad_norm": 2.2431697845458984, "learning_rate": 6.4843653924115385e-06, "loss": 0.4803, "step": 3500 }, { "epoch": 1.8709073900841908, "grad_norm": 0.8748724460601807, "learning_rate": 6.033435949267481e-06, "loss": 0.5225, "step": 4000 }, { "epoch": 2.0, "eval_loss": 0.778407871723175, "eval_matthews_correlation": 0.4730676912894765, "eval_runtime": 0.7349, "eval_samples_per_second": 1419.24, "eval_steps_per_second": 89.808, "step": 4276 }, { "epoch": 2.1047708138447145, "grad_norm": 0.08216582238674164, "learning_rate": 5.5825065061234246e-06, "loss": 0.4451, "step": 4500 }, { "epoch": 2.3386342376052385, "grad_norm": 34.81584167480469, "learning_rate": 5.131577062979367e-06, "loss": 0.3457, "step": 5000 }, { "epoch": 2.5724976613657624, "grad_norm": 0.2907339334487915, "learning_rate": 4.680647619835311e-06, "loss": 0.3718, "step": 5500 }, { "epoch": 2.8063610851262863, "grad_norm": 0.22318235039710999, "learning_rate": 4.229718176691254e-06, "loss": 0.3999, "step": 6000 }, { "epoch": 3.0, "eval_loss": 0.8715924024581909, "eval_matthews_correlation": 0.5051600900029769, "eval_runtime": 0.7186, "eval_samples_per_second": 1451.341, "eval_steps_per_second": 91.839, "step": 6414 }, { "epoch": 3.0402245088868103, "grad_norm": 0.47206905484199524, "learning_rate": 3.7787887335471967e-06, "loss": 0.3685, "step": 6500 }, { "epoch": 3.2740879326473338, "grad_norm": 0.04389917850494385, "learning_rate": 3.3278592904031397e-06, "loss": 0.249, "step": 7000 }, { "epoch": 3.5079513564078577, "grad_norm": 0.21924751996994019, "learning_rate": 2.8769298472590827e-06, "loss": 0.252, "step": 7500 }, { "epoch": 3.7418147801683816, "grad_norm": 9.382844924926758, "learning_rate": 2.4260004041150266e-06, "loss": 0.2621, "step": 8000 }, { "epoch": 3.9756782039289056, "grad_norm": 134.2183074951172, "learning_rate": 1.975070960970969e-06, "loss": 0.2923, "step": 8500 }, { "epoch": 4.0, "eval_loss": 1.0317972898483276, "eval_matthews_correlation": 0.536262647683346, "eval_runtime": 0.7324, "eval_samples_per_second": 1424.048, "eval_steps_per_second": 90.112, "step": 8552 }, { "epoch": 4.209541627689429, "grad_norm": 0.09477799385786057, "learning_rate": 1.5241415178269122e-06, "loss": 0.22, "step": 9000 }, { "epoch": 4.443405051449953, "grad_norm": 0.18212155997753143, "learning_rate": 1.0732120746828554e-06, "loss": 0.225, "step": 9500 }, { "epoch": 4.677268475210477, "grad_norm": 0.04502077028155327, "learning_rate": 6.222826315387986e-07, "loss": 0.1876, "step": 10000 }, { "epoch": 4.911131898971001, "grad_norm": 0.0519992969930172, "learning_rate": 1.713531883947416e-07, "loss": 0.2003, "step": 10500 }, { "epoch": 5.0, "eval_loss": 1.094925880432129, "eval_matthews_correlation": 0.522211073949747, "eval_runtime": 0.8243, "eval_samples_per_second": 1265.281, "eval_steps_per_second": 80.066, "step": 10690 } ], "logging_steps": 500, "max_steps": 10690, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 171182806990932.0, "train_batch_size": 4, "trial_name": null, "trial_params": { "learning_rate": 9.640871494419937e-06, "num_train_epochs": 5, "per_device_train_batch_size": 4, "seed": 8 } }