shibajustfor's picture
Training in progress, step 200, checkpoint
0ec74ef verified
Raw
History Blame Contribute Delete
5.05 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.011243060923336379,
"eval_steps": 50,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 5.621530461668189e-05,
"eval_loss": 0.6464069485664368,
"eval_runtime": 609.7389,
"eval_samples_per_second": 12.284,
"eval_steps_per_second": 6.142,
"step": 1
},
{
"epoch": 0.0005621530461668189,
"grad_norm": 0.34330883622169495,
"learning_rate": 0.0002,
"loss": 0.5058,
"step": 10
},
{
"epoch": 0.0011243060923336377,
"grad_norm": 0.3404369056224823,
"learning_rate": 0.0002,
"loss": 0.4254,
"step": 20
},
{
"epoch": 0.0016864591385004567,
"grad_norm": 0.3144387900829315,
"learning_rate": 0.0002,
"loss": 0.4065,
"step": 30
},
{
"epoch": 0.0022486121846672755,
"grad_norm": 0.3841158151626587,
"learning_rate": 0.0002,
"loss": 0.3781,
"step": 40
},
{
"epoch": 0.0028107652308340947,
"grad_norm": 0.3709113299846649,
"learning_rate": 0.0002,
"loss": 0.3482,
"step": 50
},
{
"epoch": 0.0028107652308340947,
"eval_loss": 0.34076154232025146,
"eval_runtime": 608.9426,
"eval_samples_per_second": 12.3,
"eval_steps_per_second": 6.15,
"step": 50
},
{
"epoch": 0.0033729182770009134,
"grad_norm": 0.4097980260848999,
"learning_rate": 0.0002,
"loss": 0.3564,
"step": 60
},
{
"epoch": 0.003935071323167732,
"grad_norm": 0.3512555956840515,
"learning_rate": 0.0002,
"loss": 0.3117,
"step": 70
},
{
"epoch": 0.004497224369334551,
"grad_norm": 0.43151453137397766,
"learning_rate": 0.0002,
"loss": 0.3573,
"step": 80
},
{
"epoch": 0.005059377415501371,
"grad_norm": 0.6613090634346008,
"learning_rate": 0.0002,
"loss": 0.3253,
"step": 90
},
{
"epoch": 0.005621530461668189,
"grad_norm": 0.3564847409725189,
"learning_rate": 0.0002,
"loss": 0.3236,
"step": 100
},
{
"epoch": 0.005621530461668189,
"eval_loss": 0.32292038202285767,
"eval_runtime": 609.3281,
"eval_samples_per_second": 12.292,
"eval_steps_per_second": 6.146,
"step": 100
},
{
"epoch": 0.006183683507835008,
"grad_norm": 0.3181847929954529,
"learning_rate": 0.0002,
"loss": 0.3241,
"step": 110
},
{
"epoch": 0.006745836554001827,
"grad_norm": 0.42424142360687256,
"learning_rate": 0.0002,
"loss": 0.2953,
"step": 120
},
{
"epoch": 0.007307989600168646,
"grad_norm": 0.4498586058616638,
"learning_rate": 0.0002,
"loss": 0.3619,
"step": 130
},
{
"epoch": 0.007870142646335464,
"grad_norm": 0.35849127173423767,
"learning_rate": 0.0002,
"loss": 0.3218,
"step": 140
},
{
"epoch": 0.008432295692502284,
"grad_norm": 0.38611167669296265,
"learning_rate": 0.0002,
"loss": 0.3287,
"step": 150
},
{
"epoch": 0.008432295692502284,
"eval_loss": 0.31369704008102417,
"eval_runtime": 609.316,
"eval_samples_per_second": 12.292,
"eval_steps_per_second": 6.146,
"step": 150
},
{
"epoch": 0.008994448738669102,
"grad_norm": 0.3397560119628906,
"learning_rate": 0.0002,
"loss": 0.3234,
"step": 160
},
{
"epoch": 0.009556601784835922,
"grad_norm": 0.4362323582172394,
"learning_rate": 0.0002,
"loss": 0.3112,
"step": 170
},
{
"epoch": 0.010118754831002741,
"grad_norm": 0.3360973596572876,
"learning_rate": 0.0002,
"loss": 0.3057,
"step": 180
},
{
"epoch": 0.010680907877169559,
"grad_norm": 0.40133044123649597,
"learning_rate": 0.0002,
"loss": 0.3276,
"step": 190
},
{
"epoch": 0.011243060923336379,
"grad_norm": 0.4047779142856598,
"learning_rate": 0.0002,
"loss": 0.2977,
"step": 200
},
{
"epoch": 0.011243060923336379,
"eval_loss": 0.30774378776550293,
"eval_runtime": 609.1932,
"eval_samples_per_second": 12.295,
"eval_steps_per_second": 6.147,
"step": 200
}
],
"logging_steps": 10,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 6.880649602085683e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}