ygaci's picture
Training in progress, epoch 10, checkpoint
eb67db1 verified
Raw
History Blame Contribute Delete
8.53 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 10.0,
"eval_steps": 500,
"global_step": 3500,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.2857142857142857,
"grad_norm": 0.6237152218818665,
"learning_rate": 4e-05,
"loss": 2.4096,
"step": 100
},
{
"epoch": 0.5714285714285714,
"grad_norm": 1.4872891902923584,
"learning_rate": 8e-05,
"loss": 1.5214,
"step": 200
},
{
"epoch": 0.8571428571428571,
"grad_norm": 1.8721675872802734,
"learning_rate": 0.00012,
"loss": 0.9786,
"step": 300
},
{
"epoch": 1.0,
"eval_loss": 0.5907843708992004,
"eval_runtime": 331.9763,
"eval_samples_per_second": 2.109,
"eval_steps_per_second": 0.527,
"step": 350
},
{
"epoch": 1.1428571428571428,
"grad_norm": 1.8639676570892334,
"learning_rate": 0.00016,
"loss": 0.5839,
"step": 400
},
{
"epoch": 1.4285714285714286,
"grad_norm": 1.6524343490600586,
"learning_rate": 0.0002,
"loss": 0.4143,
"step": 500
},
{
"epoch": 1.7142857142857144,
"grad_norm": 1.1418366432189941,
"learning_rate": 0.00019333333333333333,
"loss": 0.3445,
"step": 600
},
{
"epoch": 2.0,
"grad_norm": 1.0962567329406738,
"learning_rate": 0.0001866666666666667,
"loss": 0.3012,
"step": 700
},
{
"epoch": 2.0,
"eval_loss": 0.2971023917198181,
"eval_runtime": 331.597,
"eval_samples_per_second": 2.111,
"eval_steps_per_second": 0.528,
"step": 700
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.3611701726913452,
"learning_rate": 0.00018,
"loss": 0.2614,
"step": 800
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.40023404359817505,
"learning_rate": 0.00017333333333333334,
"loss": 0.2425,
"step": 900
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.463142991065979,
"learning_rate": 0.0001666666666666667,
"loss": 0.2351,
"step": 1000
},
{
"epoch": 3.0,
"eval_loss": 0.24983520805835724,
"eval_runtime": 331.8028,
"eval_samples_per_second": 2.11,
"eval_steps_per_second": 0.527,
"step": 1050
},
{
"epoch": 3.142857142857143,
"grad_norm": 0.3725013732910156,
"learning_rate": 0.00016,
"loss": 0.2173,
"step": 1100
},
{
"epoch": 3.4285714285714284,
"grad_norm": 0.3499898612499237,
"learning_rate": 0.00015333333333333334,
"loss": 0.216,
"step": 1200
},
{
"epoch": 3.7142857142857144,
"grad_norm": 0.369825541973114,
"learning_rate": 0.00014666666666666666,
"loss": 0.2049,
"step": 1300
},
{
"epoch": 4.0,
"grad_norm": 0.28506389260292053,
"learning_rate": 0.00014,
"loss": 0.2089,
"step": 1400
},
{
"epoch": 4.0,
"eval_loss": 0.24056243896484375,
"eval_runtime": 331.7171,
"eval_samples_per_second": 2.11,
"eval_steps_per_second": 0.528,
"step": 1400
},
{
"epoch": 4.285714285714286,
"grad_norm": 0.30741095542907715,
"learning_rate": 0.00013333333333333334,
"loss": 0.1854,
"step": 1500
},
{
"epoch": 4.571428571428571,
"grad_norm": 0.30351126194000244,
"learning_rate": 0.00012666666666666666,
"loss": 0.1885,
"step": 1600
},
{
"epoch": 4.857142857142857,
"grad_norm": 0.3929246664047241,
"learning_rate": 0.00012,
"loss": 0.1952,
"step": 1700
},
{
"epoch": 5.0,
"eval_loss": 0.23693795502185822,
"eval_runtime": 331.6529,
"eval_samples_per_second": 2.111,
"eval_steps_per_second": 0.528,
"step": 1750
},
{
"epoch": 5.142857142857143,
"grad_norm": 0.6160484552383423,
"learning_rate": 0.00011333333333333334,
"loss": 0.1886,
"step": 1800
},
{
"epoch": 5.428571428571429,
"grad_norm": 0.41531217098236084,
"learning_rate": 0.00010666666666666667,
"loss": 0.1814,
"step": 1900
},
{
"epoch": 5.714285714285714,
"grad_norm": 0.43082195520401,
"learning_rate": 0.0001,
"loss": 0.1783,
"step": 2000
},
{
"epoch": 6.0,
"grad_norm": 0.5060862302780151,
"learning_rate": 9.333333333333334e-05,
"loss": 0.1732,
"step": 2100
},
{
"epoch": 6.0,
"eval_loss": 0.23785410821437836,
"eval_runtime": 331.866,
"eval_samples_per_second": 2.109,
"eval_steps_per_second": 0.527,
"step": 2100
},
{
"epoch": 6.285714285714286,
"grad_norm": 0.369838148355484,
"learning_rate": 8.666666666666667e-05,
"loss": 0.1553,
"step": 2200
},
{
"epoch": 6.571428571428571,
"grad_norm": 0.3706706464290619,
"learning_rate": 8e-05,
"loss": 0.1622,
"step": 2300
},
{
"epoch": 6.857142857142857,
"grad_norm": 0.38372883200645447,
"learning_rate": 7.333333333333333e-05,
"loss": 0.166,
"step": 2400
},
{
"epoch": 7.0,
"eval_loss": 0.23934954404830933,
"eval_runtime": 331.7455,
"eval_samples_per_second": 2.11,
"eval_steps_per_second": 0.528,
"step": 2450
},
{
"epoch": 7.142857142857143,
"grad_norm": 0.4159909188747406,
"learning_rate": 6.666666666666667e-05,
"loss": 0.1573,
"step": 2500
},
{
"epoch": 7.428571428571429,
"grad_norm": 0.32118484377861023,
"learning_rate": 6e-05,
"loss": 0.1458,
"step": 2600
},
{
"epoch": 7.714285714285714,
"grad_norm": 0.46313735842704773,
"learning_rate": 5.333333333333333e-05,
"loss": 0.1503,
"step": 2700
},
{
"epoch": 8.0,
"grad_norm": 0.41984930634498596,
"learning_rate": 4.666666666666667e-05,
"loss": 0.1527,
"step": 2800
},
{
"epoch": 8.0,
"eval_loss": 0.24533726274967194,
"eval_runtime": 331.7124,
"eval_samples_per_second": 2.11,
"eval_steps_per_second": 0.528,
"step": 2800
},
{
"epoch": 8.285714285714286,
"grad_norm": 0.2690626382827759,
"learning_rate": 4e-05,
"loss": 0.1336,
"step": 2900
},
{
"epoch": 8.571428571428571,
"grad_norm": 0.3065795600414276,
"learning_rate": 3.3333333333333335e-05,
"loss": 0.1424,
"step": 3000
},
{
"epoch": 8.857142857142858,
"grad_norm": 0.3088241517543793,
"learning_rate": 2.6666666666666667e-05,
"loss": 0.1376,
"step": 3100
},
{
"epoch": 9.0,
"eval_loss": 0.2503173053264618,
"eval_runtime": 331.8022,
"eval_samples_per_second": 2.11,
"eval_steps_per_second": 0.527,
"step": 3150
},
{
"epoch": 9.142857142857142,
"grad_norm": 0.4028591513633728,
"learning_rate": 2e-05,
"loss": 0.1316,
"step": 3200
},
{
"epoch": 9.428571428571429,
"grad_norm": 1.281490445137024,
"learning_rate": 1.3333333333333333e-05,
"loss": 0.126,
"step": 3300
},
{
"epoch": 9.714285714285714,
"grad_norm": 0.5000307559967041,
"learning_rate": 6.666666666666667e-06,
"loss": 0.1259,
"step": 3400
},
{
"epoch": 10.0,
"grad_norm": 0.5802595615386963,
"learning_rate": 0.0,
"loss": 0.129,
"step": 3500
},
{
"epoch": 10.0,
"eval_loss": 0.26010262966156006,
"eval_runtime": 331.5762,
"eval_samples_per_second": 2.111,
"eval_steps_per_second": 0.528,
"step": 3500
}
],
"logging_steps": 100,
"max_steps": 3500,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 8.573504093945856e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}