havinash-ai's picture
Training in progress, step 200, checkpoint
2c7f0f6 verified
Raw
History Blame Contribute Delete
5.26 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.350109409190372,
"eval_steps": 50,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00175054704595186,
"eval_loss": 3.942631959915161,
"eval_runtime": 6.5116,
"eval_samples_per_second": 37.011,
"eval_steps_per_second": 18.582,
"step": 1
},
{
"epoch": 0.0175054704595186,
"grad_norm": 4.979578971862793,
"learning_rate": 0.00019967573081342103,
"loss": 2.0182,
"step": 10
},
{
"epoch": 0.0350109409190372,
"grad_norm": 1.4861304759979248,
"learning_rate": 0.0001970941817426052,
"loss": 0.3124,
"step": 20
},
{
"epoch": 0.0525164113785558,
"grad_norm": 3.228330612182617,
"learning_rate": 0.00019199794436588243,
"loss": 0.2282,
"step": 30
},
{
"epoch": 0.0700218818380744,
"grad_norm": 1.115767478942871,
"learning_rate": 0.0001845190085543795,
"loss": 0.1118,
"step": 40
},
{
"epoch": 0.087527352297593,
"grad_norm": 2.745464563369751,
"learning_rate": 0.00017485107481711012,
"loss": 0.1915,
"step": 50
},
{
"epoch": 0.087527352297593,
"eval_loss": 0.15154829621315002,
"eval_runtime": 6.5631,
"eval_samples_per_second": 36.721,
"eval_steps_per_second": 18.437,
"step": 50
},
{
"epoch": 0.1050328227571116,
"grad_norm": 1.6342604160308838,
"learning_rate": 0.00016324453755953773,
"loss": 0.0955,
"step": 60
},
{
"epoch": 0.12253829321663019,
"grad_norm": 1.03786039352417,
"learning_rate": 0.00015000000000000001,
"loss": 0.1122,
"step": 70
},
{
"epoch": 0.1400437636761488,
"grad_norm": 0.6428198218345642,
"learning_rate": 0.00013546048870425356,
"loss": 0.0688,
"step": 80
},
{
"epoch": 0.1575492341356674,
"grad_norm": 0.3404603898525238,
"learning_rate": 0.00012000256937760445,
"loss": 0.1697,
"step": 90
},
{
"epoch": 0.175054704595186,
"grad_norm": 1.3271960020065308,
"learning_rate": 0.00010402659401094152,
"loss": 0.1069,
"step": 100
},
{
"epoch": 0.175054704595186,
"eval_loss": 0.1051642894744873,
"eval_runtime": 6.6187,
"eval_samples_per_second": 36.412,
"eval_steps_per_second": 18.282,
"step": 100
},
{
"epoch": 0.1925601750547046,
"grad_norm": 0.5494540929794312,
"learning_rate": 8.79463319744677e-05,
"loss": 0.139,
"step": 110
},
{
"epoch": 0.2100656455142232,
"grad_norm": 1.3071264028549194,
"learning_rate": 7.217825360835473e-05,
"loss": 0.1121,
"step": 120
},
{
"epoch": 0.2275711159737418,
"grad_norm": 0.791406512260437,
"learning_rate": 5.713074385969457e-05,
"loss": 0.0977,
"step": 130
},
{
"epoch": 0.24507658643326038,
"grad_norm": 0.7328794002532959,
"learning_rate": 4.3193525326884435e-05,
"loss": 0.0691,
"step": 140
},
{
"epoch": 0.26258205689277897,
"grad_norm": 2.1033480167388916,
"learning_rate": 3.072756464904006e-05,
"loss": 0.0896,
"step": 150
},
{
"epoch": 0.26258205689277897,
"eval_loss": 0.08178930729627609,
"eval_runtime": 6.5966,
"eval_samples_per_second": 36.534,
"eval_steps_per_second": 18.343,
"step": 150
},
{
"epoch": 0.2800875273522976,
"grad_norm": 0.6359676122665405,
"learning_rate": 2.0055723659649904e-05,
"loss": 0.0679,
"step": 160
},
{
"epoch": 0.2975929978118162,
"grad_norm": 1.084639072418213,
"learning_rate": 1.1454397434679021e-05,
"loss": 0.0587,
"step": 170
},
{
"epoch": 0.3150984682713348,
"grad_norm": 0.6518976092338562,
"learning_rate": 5.146355805285452e-06,
"loss": 0.0666,
"step": 180
},
{
"epoch": 0.33260393873085337,
"grad_norm": 2.068160057067871,
"learning_rate": 1.2949737362087156e-06,
"loss": 0.075,
"step": 190
},
{
"epoch": 0.350109409190372,
"grad_norm": 1.11619234085083,
"learning_rate": 0.0,
"loss": 0.102,
"step": 200
},
{
"epoch": 0.350109409190372,
"eval_loss": 0.07777100801467896,
"eval_runtime": 6.6104,
"eval_samples_per_second": 36.458,
"eval_steps_per_second": 18.304,
"step": 200
}
],
"logging_steps": 10,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.00019466141696e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}