{ "best_metric": 168.2034149169922, "best_model_checkpoint": "roberta-petco-fullemailbody-ctr/checkpoint-90", "epoch": 6.0, "eval_steps": 500, "global_step": 90, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 1.0, "grad_norm": 633.0380859375, "learning_rate": 9.5e-06, "loss": 270.8182, "step": 15 }, { "epoch": 1.0, "eval_loss": 255.3511199951172, "eval_mae": 14.281704902648926, "eval_mse": 255.35110473632812, "eval_r2": -3.979249295308054, "eval_rmse": 15.97970962524414, "eval_runtime": 2.323, "eval_samples_per_second": 25.828, "eval_steps_per_second": 1.722, "step": 15 }, { "epoch": 2.0, "grad_norm": 482.0528869628906, "learning_rate": 9e-06, "loss": 233.984, "step": 30 }, { "epoch": 2.0, "eval_loss": 232.40538024902344, "eval_mae": 13.456147193908691, "eval_mse": 232.40542602539062, "eval_r2": -3.531816663730682, "eval_rmse": 15.24484920501709, "eval_runtime": 2.3646, "eval_samples_per_second": 25.374, "eval_steps_per_second": 1.692, "step": 30 }, { "epoch": 3.0, "grad_norm": 424.8625793457031, "learning_rate": 8.5e-06, "loss": 213.3705, "step": 45 }, { "epoch": 3.0, "eval_loss": 211.15115356445312, "eval_mae": 12.64023494720459, "eval_mse": 211.1511688232422, "eval_r2": -3.1173671236809426, "eval_rmse": 14.531041145324707, "eval_runtime": 2.3659, "eval_samples_per_second": 25.36, "eval_steps_per_second": 1.691, "step": 45 }, { "epoch": 4.0, "grad_norm": 342.81646728515625, "learning_rate": 8.000000000000001e-06, "loss": 194.8535, "step": 60 }, { "epoch": 4.0, "eval_loss": 193.54568481445312, "eval_mae": 11.927023887634277, "eval_mse": 193.54566955566406, "eval_r2": -2.774066276180696, "eval_rmse": 13.912069320678711, "eval_runtime": 2.3935, "eval_samples_per_second": 25.068, "eval_steps_per_second": 1.671, "step": 60 }, { "epoch": 5.0, "grad_norm": 379.5366516113281, "learning_rate": 7.500000000000001e-06, "loss": 179.8182, "step": 75 }, { "epoch": 5.0, "eval_loss": 179.9423065185547, "eval_mae": 11.341310501098633, "eval_mse": 179.94229125976562, "eval_r2": -2.508806199489563, "eval_rmse": 13.414257049560547, "eval_runtime": 2.6076, "eval_samples_per_second": 23.01, "eval_steps_per_second": 1.534, "step": 75 }, { "epoch": 6.0, "grad_norm": 419.7530212402344, "learning_rate": 7e-06, "loss": 167.2209, "step": 90 }, { "epoch": 6.0, "eval_loss": 168.2034149169922, "eval_mae": 10.810791015625, "eval_mse": 168.20339965820312, "eval_r2": -2.279901978526021, "eval_rmse": 12.969325065612793, "eval_runtime": 2.4373, "eval_samples_per_second": 24.618, "eval_steps_per_second": 1.641, "step": 90 } ], "logging_steps": 500, "max_steps": 300, "num_input_tokens_seen": 0, "num_train_epochs": 20, "save_steps": 500, "total_flos": 378876517908480.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }