Incomple's picture
End of training
2fc9da2 verified
Raw
History Blame Contribute Delete
5.71 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 250,
"global_step": 1351,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.050333086602516654,
"grad_norm": 4.236826419830322,
"learning_rate": 5e-07,
"loss": 0.4956,
"step": 68
},
{
"epoch": 0.10066617320503331,
"grad_norm": 3.3058083057403564,
"learning_rate": 1e-06,
"loss": 0.5465,
"step": 136
},
{
"epoch": 0.15099925980754997,
"grad_norm": 3.0439271926879883,
"learning_rate": 9.440329218106997e-07,
"loss": 0.4505,
"step": 204
},
{
"epoch": 0.1850481125092524,
"eval_sft_sg_values_eval_loss": 0.3208533227443695,
"eval_sft_sg_values_eval_runtime": 28.8285,
"eval_sft_sg_values_eval_samples_per_second": 17.344,
"eval_sft_sg_values_eval_steps_per_second": 8.672,
"step": 250
},
{
"epoch": 0.20133234641006661,
"grad_norm": 3.065812110900879,
"learning_rate": 8.880658436213991e-07,
"loss": 0.4528,
"step": 272
},
{
"epoch": 0.25166543301258326,
"grad_norm": 3.464308977127075,
"learning_rate": 8.320987654320987e-07,
"loss": 0.3473,
"step": 340
},
{
"epoch": 0.30199851961509994,
"grad_norm": 1.8523364067077637,
"learning_rate": 7.761316872427983e-07,
"loss": 0.395,
"step": 408
},
{
"epoch": 0.35233160621761656,
"grad_norm": 1.4938207864761353,
"learning_rate": 7.201646090534979e-07,
"loss": 0.3465,
"step": 476
},
{
"epoch": 0.3700962250185048,
"eval_sft_sg_values_eval_loss": 0.20385459065437317,
"eval_sft_sg_values_eval_runtime": 28.85,
"eval_sft_sg_values_eval_samples_per_second": 17.331,
"eval_sft_sg_values_eval_steps_per_second": 8.666,
"step": 500
},
{
"epoch": 0.40266469282013323,
"grad_norm": 2.14213490486145,
"learning_rate": 6.641975308641975e-07,
"loss": 0.2638,
"step": 544
},
{
"epoch": 0.4529977794226499,
"grad_norm": 1.6940499544143677,
"learning_rate": 6.082304526748971e-07,
"loss": 0.3279,
"step": 612
},
{
"epoch": 0.5033308660251665,
"grad_norm": 1.800094485282898,
"learning_rate": 5.522633744855967e-07,
"loss": 0.2363,
"step": 680
},
{
"epoch": 0.5536639526276832,
"grad_norm": 1.591727614402771,
"learning_rate": 4.962962962962963e-07,
"loss": 0.2179,
"step": 748
},
{
"epoch": 0.5551443375277573,
"eval_sft_sg_values_eval_loss": 0.17694725096225739,
"eval_sft_sg_values_eval_runtime": 28.885,
"eval_sft_sg_values_eval_samples_per_second": 17.31,
"eval_sft_sg_values_eval_steps_per_second": 8.655,
"step": 750
},
{
"epoch": 0.6039970392301999,
"grad_norm": 4.029638290405273,
"learning_rate": 4.403292181069959e-07,
"loss": 0.2013,
"step": 816
},
{
"epoch": 0.6543301258327165,
"grad_norm": 1.7355984449386597,
"learning_rate": 3.8436213991769547e-07,
"loss": 0.2014,
"step": 884
},
{
"epoch": 0.7046632124352331,
"grad_norm": 2.6946229934692383,
"learning_rate": 3.2839506172839506e-07,
"loss": 0.2954,
"step": 952
},
{
"epoch": 0.7401924500370096,
"eval_sft_sg_values_eval_loss": 0.16258862614631653,
"eval_sft_sg_values_eval_runtime": 28.8506,
"eval_sft_sg_values_eval_samples_per_second": 17.331,
"eval_sft_sg_values_eval_steps_per_second": 8.665,
"step": 1000
},
{
"epoch": 0.7549962990377498,
"grad_norm": 2.2922027111053467,
"learning_rate": 2.7242798353909465e-07,
"loss": 0.2395,
"step": 1020
},
{
"epoch": 0.8053293856402665,
"grad_norm": 1.3803716897964478,
"learning_rate": 2.1646090534979421e-07,
"loss": 0.249,
"step": 1088
},
{
"epoch": 0.8556624722427831,
"grad_norm": 1.8623427152633667,
"learning_rate": 1.604938271604938e-07,
"loss": 0.2043,
"step": 1156
},
{
"epoch": 0.9059955588452998,
"grad_norm": 2.6236300468444824,
"learning_rate": 1.0452674897119341e-07,
"loss": 0.2347,
"step": 1224
},
{
"epoch": 0.9252405625462621,
"eval_sft_sg_values_eval_loss": 0.15717695653438568,
"eval_sft_sg_values_eval_runtime": 28.8569,
"eval_sft_sg_values_eval_samples_per_second": 17.327,
"eval_sft_sg_values_eval_steps_per_second": 8.663,
"step": 1250
},
{
"epoch": 0.9563286454478165,
"grad_norm": 1.8058063983917236,
"learning_rate": 4.8559670781893e-08,
"loss": 0.27,
"step": 1292
},
{
"epoch": 1.0,
"step": 1351,
"total_flos": 9.434186513311334e+16,
"train_loss": 0.3092916518295367,
"train_runtime": 2173.1432,
"train_samples_per_second": 4.973,
"train_steps_per_second": 0.622
}
],
"logging_steps": 68,
"max_steps": 1351,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 9.434186513311334e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}