ygaci's picture
Training in progress, epoch 4, checkpoint
d64ea7d verified
Raw
History Blame
3.83 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 4.0,
"eval_steps": 500,
"global_step": 1400,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.2857142857142857,
"grad_norm": 0.6237152218818665,
"learning_rate": 4e-05,
"loss": 2.4096,
"step": 100
},
{
"epoch": 0.5714285714285714,
"grad_norm": 1.4872891902923584,
"learning_rate": 8e-05,
"loss": 1.5214,
"step": 200
},
{
"epoch": 0.8571428571428571,
"grad_norm": 1.8721675872802734,
"learning_rate": 0.00012,
"loss": 0.9786,
"step": 300
},
{
"epoch": 1.0,
"eval_loss": 0.5907843708992004,
"eval_runtime": 331.9763,
"eval_samples_per_second": 2.109,
"eval_steps_per_second": 0.527,
"step": 350
},
{
"epoch": 1.1428571428571428,
"grad_norm": 1.8639676570892334,
"learning_rate": 0.00016,
"loss": 0.5839,
"step": 400
},
{
"epoch": 1.4285714285714286,
"grad_norm": 1.6524343490600586,
"learning_rate": 0.0002,
"loss": 0.4143,
"step": 500
},
{
"epoch": 1.7142857142857144,
"grad_norm": 1.1418366432189941,
"learning_rate": 0.00019333333333333333,
"loss": 0.3445,
"step": 600
},
{
"epoch": 2.0,
"grad_norm": 1.0962567329406738,
"learning_rate": 0.0001866666666666667,
"loss": 0.3012,
"step": 700
},
{
"epoch": 2.0,
"eval_loss": 0.2971023917198181,
"eval_runtime": 331.597,
"eval_samples_per_second": 2.111,
"eval_steps_per_second": 0.528,
"step": 700
},
{
"epoch": 2.2857142857142856,
"grad_norm": 0.3611701726913452,
"learning_rate": 0.00018,
"loss": 0.2614,
"step": 800
},
{
"epoch": 2.571428571428571,
"grad_norm": 0.40023404359817505,
"learning_rate": 0.00017333333333333334,
"loss": 0.2425,
"step": 900
},
{
"epoch": 2.857142857142857,
"grad_norm": 0.463142991065979,
"learning_rate": 0.0001666666666666667,
"loss": 0.2351,
"step": 1000
},
{
"epoch": 3.0,
"eval_loss": 0.24983520805835724,
"eval_runtime": 331.8028,
"eval_samples_per_second": 2.11,
"eval_steps_per_second": 0.527,
"step": 1050
},
{
"epoch": 3.142857142857143,
"grad_norm": 0.3725013732910156,
"learning_rate": 0.00016,
"loss": 0.2173,
"step": 1100
},
{
"epoch": 3.4285714285714284,
"grad_norm": 0.3499898612499237,
"learning_rate": 0.00015333333333333334,
"loss": 0.216,
"step": 1200
},
{
"epoch": 3.7142857142857144,
"grad_norm": 0.369825541973114,
"learning_rate": 0.00014666666666666666,
"loss": 0.2049,
"step": 1300
},
{
"epoch": 4.0,
"grad_norm": 0.28506389260292053,
"learning_rate": 0.00014,
"loss": 0.2089,
"step": 1400
},
{
"epoch": 4.0,
"eval_loss": 0.24056243896484375,
"eval_runtime": 331.7171,
"eval_samples_per_second": 2.11,
"eval_steps_per_second": 0.528,
"step": 1400
}
],
"logging_steps": 100,
"max_steps": 3500,
"num_input_tokens_seen": 0,
"num_train_epochs": 10,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 3.435572847915827e+16,
"train_batch_size": 4,
"trial_name": null,
"trial_params": null
}