ealharbi's picture
Upload folder using huggingface_hub
c9d6a93 verified
Raw History Blame Contribute Delete
5.22 kB
{
"model": "mistralai/Mistral-7B-Instruct-v0.3",
"seed": 1,
"epochs_requested": 2,
"epoch_reached": 1.2962962962962963,
"global_step": 140,
"max_steps": 216,
"early_stopped": true,
"best_eval_loss": 1.654082179069519,
"best_checkpoint": "finetuned_models/mistralai-Mistral-7B-Instruct-v0.3_seed1/checkpoint-110",
"final_metrics": {
"eval_loss": 1.654082179069519,
"eval_runtime": 13.1871,
"eval_samples_per_second": 32.759,
"eval_steps_per_second": 8.19,
"epoch": 1.2962962962962963
},
"learning_rate": 2.675263789416278e-05,
"lora": {
"r": 64,
"alpha": 128,
"dropout": 0.05
},
"batch": {
"per_device": 1,
"grad_accum": 8,
"world_size": 4
},
"max_length": 2048,
"eval_steps": 10,
"early_stopping_patience": 3,
"log_history": [
{
"eval_loss": 1.8488812446594238,
"eval_runtime": 9.8489,
"eval_samples_per_second": 43.863,
"eval_steps_per_second": 10.966,
"epoch": 0.09259259259259259,
"step": 10
},
{
"eval_loss": 1.764305591583252,
"eval_runtime": 9.8335,
"eval_samples_per_second": 43.931,
"eval_steps_per_second": 10.983,
"epoch": 0.18518518518518517,
"step": 20
},
{
"loss": 2.0483358764648436,
"grad_norm": 2.1267218589782715,
"learning_rate": 2.6318280611836455e-05,
"epoch": 0.23148148148148148,
"step": 25
},
{
"eval_loss": 1.728833556175232,
"eval_runtime": 9.9208,
"eval_samples_per_second": 43.545,
"eval_steps_per_second": 10.886,
"epoch": 0.2777777777777778,
"step": 30
},
{
"eval_loss": 1.7081001996994019,
"eval_runtime": 9.9092,
"eval_samples_per_second": 43.596,
"eval_steps_per_second": 10.899,
"epoch": 0.37037037037037035,
"step": 40
},
{
"loss": 1.7389724731445313,
"grad_norm": 2.0094456672668457,
"learning_rate": 2.4174302619519622e-05,
"epoch": 0.46296296296296297,
"step": 50
},
{
"eval_loss": 1.6942864656448364,
"eval_runtime": 9.9717,
"eval_samples_per_second": 43.323,
"eval_steps_per_second": 10.831,
"epoch": 0.46296296296296297,
"step": 50
},
{
"eval_loss": 1.6831718683242798,
"eval_runtime": 10.0379,
"eval_samples_per_second": 43.037,
"eval_steps_per_second": 10.759,
"epoch": 0.5555555555555556,
"step": 60
},
{
"eval_loss": 1.6765761375427246,
"eval_runtime": 10.0079,
"eval_samples_per_second": 43.166,
"eval_steps_per_second": 10.791,
"epoch": 0.6481481481481481,
"step": 70
},
{
"loss": 1.7271536254882813,
"grad_norm": 1.6946066617965698,
"learning_rate": 2.0523325458099818e-05,
"epoch": 0.6944444444444444,
"step": 75
},
{
"eval_loss": 1.6678999662399292,
"eval_runtime": 10.8076,
"eval_samples_per_second": 39.972,
"eval_steps_per_second": 9.993,
"epoch": 0.7407407407407407,
"step": 80
},
{
"eval_loss": 1.6625776290893555,
"eval_runtime": 10.0228,
"eval_samples_per_second": 43.102,
"eval_steps_per_second": 10.775,
"epoch": 0.8333333333333334,
"step": 90
},
{
"loss": 1.6924752807617187,
"grad_norm": 1.8865303993225098,
"learning_rate": 1.587489051192989e-05,
"epoch": 0.9259259259259259,
"step": 100
},
{
"eval_loss": 1.6575430631637573,
"eval_runtime": 9.9455,
"eval_samples_per_second": 43.437,
"eval_steps_per_second": 10.859,
"epoch": 0.9259259259259259,
"step": 100
},
{
"eval_loss": 1.654082179069519,
"eval_runtime": 9.9907,
"eval_samples_per_second": 43.24,
"eval_steps_per_second": 10.81,
"epoch": 1.0185185185185186,
"step": 110
},
{
"eval_loss": 1.6632981300354004,
"eval_runtime": 9.9243,
"eval_samples_per_second": 43.53,
"eval_steps_per_second": 10.882,
"epoch": 1.1111111111111112,
"step": 120
},
{
"loss": 1.5846710205078125,
"grad_norm": 1.8140192031860352,
"learning_rate": 1.0877747382232885e-05,
"epoch": 1.1574074074074074,
"step": 125
},
{
"eval_loss": 1.6580889225006104,
"eval_runtime": 9.8547,
"eval_samples_per_second": 43.837,
"eval_steps_per_second": 10.959,
"epoch": 1.2037037037037037,
"step": 130
},
{
"eval_loss": 1.6590867042541504,
"eval_runtime": 9.9468,
"eval_samples_per_second": 43.431,
"eval_steps_per_second": 10.858,
"epoch": 1.2962962962962963,
"step": 140
},
{
"train_runtime": 454.6607,
"train_samples_per_second": 15.198,
"train_steps_per_second": 0.475,
"total_flos": 3.648040061632512e+16,
"train_loss": 1.7275653975350516,
"epoch": 1.2962962962962963,
"step": 140
},
{
"eval_loss": 1.654082179069519,
"eval_runtime": 13.1871,
"eval_samples_per_second": 32.759,
"eval_steps_per_second": 8.19,
"epoch": 1.2962962962962963,
"step": 140
}
]
}