nttx's picture
Training in progress, step 3000, checkpoint
eed8909 verified
Raw History Blame Contribute Delete
5.12 kB
{
"best_metric": 11.912154197692871,
"best_model_checkpoint": "miner_id_24/checkpoint-3000",
"epoch": 5.01356710498852,
"eval_steps": 300,
"global_step": 3000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0016697975370486328,
"eval_loss": 11.931979179382324,
"eval_runtime": 9.6502,
"eval_samples_per_second": 209.115,
"eval_steps_per_second": 26.217,
"step": 1
},
{
"epoch": 0.5009392611145899,
"grad_norm": 0.03646502271294594,
"learning_rate": 0.00039532411114201737,
"loss": 11.9228,
"step": 300
},
{
"epoch": 0.5009392611145899,
"eval_loss": 11.915942192077637,
"eval_runtime": 9.5678,
"eval_samples_per_second": 210.917,
"eval_steps_per_second": 26.443,
"step": 300
},
{
"epoch": 1.002713420997704,
"grad_norm": 0.013963569886982441,
"learning_rate": 0.00037137143523351785,
"loss": 11.9411,
"step": 600
},
{
"epoch": 1.002713420997704,
"eval_loss": 11.914015769958496,
"eval_runtime": 9.5987,
"eval_samples_per_second": 210.238,
"eval_steps_per_second": 26.358,
"step": 600
},
{
"epoch": 1.503652682112294,
"grad_norm": 0.016350438818335533,
"learning_rate": 0.00032947725695636553,
"loss": 11.9139,
"step": 900
},
{
"epoch": 1.503652682112294,
"eval_loss": 11.91312026977539,
"eval_runtime": 9.5664,
"eval_samples_per_second": 210.946,
"eval_steps_per_second": 26.447,
"step": 900
},
{
"epoch": 2.005426841995408,
"grad_norm": 0.01071674283593893,
"learning_rate": 0.0002740276310679829,
"loss": 11.9376,
"step": 1200
},
{
"epoch": 2.005426841995408,
"eval_loss": 11.912792205810547,
"eval_runtime": 9.6853,
"eval_samples_per_second": 208.356,
"eval_steps_per_second": 26.122,
"step": 1200
},
{
"epoch": 2.5063661031099977,
"grad_norm": 0.011973950080573559,
"learning_rate": 0.00021082778171708353,
"loss": 11.9132,
"step": 1500
},
{
"epoch": 2.5063661031099977,
"eval_loss": 11.91252613067627,
"eval_runtime": 9.7489,
"eval_samples_per_second": 206.998,
"eval_steps_per_second": 25.952,
"step": 1500
},
{
"epoch": 3.008140262993112,
"grad_norm": 0.013220425695180893,
"learning_rate": 0.00014649433229415587,
"loss": 11.9376,
"step": 1800
},
{
"epoch": 3.008140262993112,
"eval_loss": 11.91238021850586,
"eval_runtime": 9.6136,
"eval_samples_per_second": 209.911,
"eval_steps_per_second": 26.317,
"step": 1800
},
{
"epoch": 3.509079524107702,
"grad_norm": 0.013742562383413315,
"learning_rate": 8.776258692752355e-05,
"loss": 11.9128,
"step": 2100
},
{
"epoch": 3.509079524107702,
"eval_loss": 11.912261962890625,
"eval_runtime": 9.5679,
"eval_samples_per_second": 210.914,
"eval_steps_per_second": 26.443,
"step": 2100
},
{
"epoch": 4.010853683990816,
"grad_norm": 0.015797816216945648,
"learning_rate": 4.078138685887125e-05,
"loss": 11.9377,
"step": 2400
},
{
"epoch": 4.010853683990816,
"eval_loss": 11.91218090057373,
"eval_runtime": 9.6462,
"eval_samples_per_second": 209.202,
"eval_steps_per_second": 26.228,
"step": 2400
},
{
"epoch": 4.511792945105406,
"grad_norm": 0.012792945839464664,
"learning_rate": 1.0469365763439531e-05,
"loss": 11.9128,
"step": 2700
},
{
"epoch": 4.511792945105406,
"eval_loss": 11.912158012390137,
"eval_runtime": 9.6282,
"eval_samples_per_second": 209.592,
"eval_steps_per_second": 26.277,
"step": 2700
},
{
"epoch": 5.01356710498852,
"grad_norm": 0.012090091593563557,
"learning_rate": 0.0,
"loss": 11.9374,
"step": 3000
},
{
"epoch": 5.01356710498852,
"eval_loss": 11.912154197692871,
"eval_runtime": 9.5524,
"eval_samples_per_second": 211.256,
"eval_steps_per_second": 26.485,
"step": 3000
}
],
"logging_steps": 300,
"max_steps": 3000,
"num_input_tokens_seen": 0,
"num_train_epochs": 6,
"save_steps": 300,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 2,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 5671747584000.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}