havinash-ai's picture
Training in progress, step 200, checkpoint
b175049 verified
Raw
History Blame Contribute Delete
5.32 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.14272970561998216,
"eval_steps": 50,
"global_step": 200,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0007136485280999108,
"eval_loss": 0.6165480017662048,
"eval_runtime": 55.534,
"eval_samples_per_second": 10.624,
"eval_steps_per_second": 5.312,
"step": 1
},
{
"epoch": 0.007136485280999108,
"grad_norm": 0.39041173458099365,
"learning_rate": 0.00019967573081342103,
"loss": 0.4714,
"step": 10
},
{
"epoch": 0.014272970561998216,
"grad_norm": 0.35318252444267273,
"learning_rate": 0.0001970941817426052,
"loss": 0.3333,
"step": 20
},
{
"epoch": 0.021409455842997322,
"grad_norm": 0.22868792712688446,
"learning_rate": 0.00019199794436588243,
"loss": 0.3151,
"step": 30
},
{
"epoch": 0.028545941123996433,
"grad_norm": 0.2561885714530945,
"learning_rate": 0.0001845190085543795,
"loss": 0.3316,
"step": 40
},
{
"epoch": 0.03568242640499554,
"grad_norm": 0.27606117725372314,
"learning_rate": 0.00017485107481711012,
"loss": 0.2918,
"step": 50
},
{
"epoch": 0.03568242640499554,
"eval_loss": 0.3071356415748596,
"eval_runtime": 55.5552,
"eval_samples_per_second": 10.62,
"eval_steps_per_second": 5.31,
"step": 50
},
{
"epoch": 0.042818911685994644,
"grad_norm": 0.22240565717220306,
"learning_rate": 0.00016324453755953773,
"loss": 0.3401,
"step": 60
},
{
"epoch": 0.049955396966993755,
"grad_norm": 0.25228607654571533,
"learning_rate": 0.00015000000000000001,
"loss": 0.3181,
"step": 70
},
{
"epoch": 0.057091882247992866,
"grad_norm": 0.25924035906791687,
"learning_rate": 0.00013546048870425356,
"loss": 0.3091,
"step": 80
},
{
"epoch": 0.06422836752899197,
"grad_norm": 0.22803744673728943,
"learning_rate": 0.00012000256937760445,
"loss": 0.3028,
"step": 90
},
{
"epoch": 0.07136485280999108,
"grad_norm": 0.2437671571969986,
"learning_rate": 0.00010402659401094152,
"loss": 0.2869,
"step": 100
},
{
"epoch": 0.07136485280999108,
"eval_loss": 0.2971809506416321,
"eval_runtime": 55.5199,
"eval_samples_per_second": 10.627,
"eval_steps_per_second": 5.313,
"step": 100
},
{
"epoch": 0.07850133809099019,
"grad_norm": 0.26714345812797546,
"learning_rate": 8.79463319744677e-05,
"loss": 0.3431,
"step": 110
},
{
"epoch": 0.08563782337198929,
"grad_norm": 0.21566510200500488,
"learning_rate": 7.217825360835473e-05,
"loss": 0.2721,
"step": 120
},
{
"epoch": 0.0927743086529884,
"grad_norm": 0.25159725546836853,
"learning_rate": 5.713074385969457e-05,
"loss": 0.3095,
"step": 130
},
{
"epoch": 0.09991079393398751,
"grad_norm": 0.2559829652309418,
"learning_rate": 4.3193525326884435e-05,
"loss": 0.3015,
"step": 140
},
{
"epoch": 0.10704727921498662,
"grad_norm": 0.22735165059566498,
"learning_rate": 3.072756464904006e-05,
"loss": 0.2623,
"step": 150
},
{
"epoch": 0.10704727921498662,
"eval_loss": 0.2916809618473053,
"eval_runtime": 55.5435,
"eval_samples_per_second": 10.622,
"eval_steps_per_second": 5.311,
"step": 150
},
{
"epoch": 0.11418376449598573,
"grad_norm": 0.24490103125572205,
"learning_rate": 2.0055723659649904e-05,
"loss": 0.3098,
"step": 160
},
{
"epoch": 0.12132024977698483,
"grad_norm": 0.21790523827075958,
"learning_rate": 1.1454397434679021e-05,
"loss": 0.2828,
"step": 170
},
{
"epoch": 0.12845673505798394,
"grad_norm": 0.24194355309009552,
"learning_rate": 5.146355805285452e-06,
"loss": 0.2992,
"step": 180
},
{
"epoch": 0.13559322033898305,
"grad_norm": 0.29640981554985046,
"learning_rate": 1.2949737362087156e-06,
"loss": 0.3089,
"step": 190
},
{
"epoch": 0.14272970561998216,
"grad_norm": 0.4439384341239929,
"learning_rate": 0.0,
"loss": 0.3361,
"step": 200
},
{
"epoch": 0.14272970561998216,
"eval_loss": 0.2901231050491333,
"eval_runtime": 55.6242,
"eval_samples_per_second": 10.607,
"eval_steps_per_second": 5.303,
"step": 200
}
],
"logging_steps": 10,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 8.168526596957798e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}