{ "model": "mistralai/Mistral-7B-Instruct-v0.3", "seed": 1, "epochs_requested": 2, "epoch_reached": 1.2962962962962963, "global_step": 140, "max_steps": 216, "early_stopped": true, "best_eval_loss": 1.654082179069519, "best_checkpoint": "finetuned_models/mistralai-Mistral-7B-Instruct-v0.3_seed1/checkpoint-110", "final_metrics": { "eval_loss": 1.654082179069519, "eval_runtime": 13.1871, "eval_samples_per_second": 32.759, "eval_steps_per_second": 8.19, "epoch": 1.2962962962962963 }, "learning_rate": 2.675263789416278e-05, "lora": { "r": 64, "alpha": 128, "dropout": 0.05 }, "batch": { "per_device": 1, "grad_accum": 8, "world_size": 4 }, "max_length": 2048, "eval_steps": 10, "early_stopping_patience": 3, "log_history": [ { "eval_loss": 1.8488812446594238, "eval_runtime": 9.8489, "eval_samples_per_second": 43.863, "eval_steps_per_second": 10.966, "epoch": 0.09259259259259259, "step": 10 }, { "eval_loss": 1.764305591583252, "eval_runtime": 9.8335, "eval_samples_per_second": 43.931, "eval_steps_per_second": 10.983, "epoch": 0.18518518518518517, "step": 20 }, { "loss": 2.0483358764648436, "grad_norm": 2.1267218589782715, "learning_rate": 2.6318280611836455e-05, "epoch": 0.23148148148148148, "step": 25 }, { "eval_loss": 1.728833556175232, "eval_runtime": 9.9208, "eval_samples_per_second": 43.545, "eval_steps_per_second": 10.886, "epoch": 0.2777777777777778, "step": 30 }, { "eval_loss": 1.7081001996994019, "eval_runtime": 9.9092, "eval_samples_per_second": 43.596, "eval_steps_per_second": 10.899, "epoch": 0.37037037037037035, "step": 40 }, { "loss": 1.7389724731445313, "grad_norm": 2.0094456672668457, "learning_rate": 2.4174302619519622e-05, "epoch": 0.46296296296296297, "step": 50 }, { "eval_loss": 1.6942864656448364, "eval_runtime": 9.9717, "eval_samples_per_second": 43.323, "eval_steps_per_second": 10.831, "epoch": 0.46296296296296297, "step": 50 }, { "eval_loss": 1.6831718683242798, "eval_runtime": 10.0379, "eval_samples_per_second": 43.037, "eval_steps_per_second": 10.759, "epoch": 0.5555555555555556, "step": 60 }, { "eval_loss": 1.6765761375427246, "eval_runtime": 10.0079, "eval_samples_per_second": 43.166, "eval_steps_per_second": 10.791, "epoch": 0.6481481481481481, "step": 70 }, { "loss": 1.7271536254882813, "grad_norm": 1.6946066617965698, "learning_rate": 2.0523325458099818e-05, "epoch": 0.6944444444444444, "step": 75 }, { "eval_loss": 1.6678999662399292, "eval_runtime": 10.8076, "eval_samples_per_second": 39.972, "eval_steps_per_second": 9.993, "epoch": 0.7407407407407407, "step": 80 }, { "eval_loss": 1.6625776290893555, "eval_runtime": 10.0228, "eval_samples_per_second": 43.102, "eval_steps_per_second": 10.775, "epoch": 0.8333333333333334, "step": 90 }, { "loss": 1.6924752807617187, "grad_norm": 1.8865303993225098, "learning_rate": 1.587489051192989e-05, "epoch": 0.9259259259259259, "step": 100 }, { "eval_loss": 1.6575430631637573, "eval_runtime": 9.9455, "eval_samples_per_second": 43.437, "eval_steps_per_second": 10.859, "epoch": 0.9259259259259259, "step": 100 }, { "eval_loss": 1.654082179069519, "eval_runtime": 9.9907, "eval_samples_per_second": 43.24, "eval_steps_per_second": 10.81, "epoch": 1.0185185185185186, "step": 110 }, { "eval_loss": 1.6632981300354004, "eval_runtime": 9.9243, "eval_samples_per_second": 43.53, "eval_steps_per_second": 10.882, "epoch": 1.1111111111111112, "step": 120 }, { "loss": 1.5846710205078125, "grad_norm": 1.8140192031860352, "learning_rate": 1.0877747382232885e-05, "epoch": 1.1574074074074074, "step": 125 }, { "eval_loss": 1.6580889225006104, "eval_runtime": 9.8547, "eval_samples_per_second": 43.837, "eval_steps_per_second": 10.959, "epoch": 1.2037037037037037, "step": 130 }, { "eval_loss": 1.6590867042541504, "eval_runtime": 9.9468, "eval_samples_per_second": 43.431, "eval_steps_per_second": 10.858, "epoch": 1.2962962962962963, "step": 140 }, { "train_runtime": 454.6607, "train_samples_per_second": 15.198, "train_steps_per_second": 0.475, "total_flos": 3.648040061632512e+16, "train_loss": 1.7275653975350516, "epoch": 1.2962962962962963, "step": 140 }, { "eval_loss": 1.654082179069519, "eval_runtime": 13.1871, "eval_samples_per_second": 32.759, "eval_steps_per_second": 8.19, "epoch": 1.2962962962962963, "step": 140 } ] }