cimol's picture
Training in progress, step 50, checkpoint
eeb85ae verified
Raw History Blame
10 kB
{
"best_metric": 10.351482391357422,
"best_model_checkpoint": "miner_id_24/checkpoint-50",
"epoch": 0.0846740050804403,
"eval_steps": 50,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.001693480101608806,
"grad_norm": 0.05767215043306351,
"learning_rate": 7e-06,
"loss": 10.3761,
"step": 1
},
{
"epoch": 0.001693480101608806,
"eval_loss": 10.376470565795898,
"eval_runtime": 2.2633,
"eval_samples_per_second": 439.62,
"eval_steps_per_second": 110.016,
"step": 1
},
{
"epoch": 0.003386960203217612,
"grad_norm": 0.05682261288166046,
"learning_rate": 1.4e-05,
"loss": 10.3756,
"step": 2
},
{
"epoch": 0.005080440304826418,
"grad_norm": 0.05533347651362419,
"learning_rate": 2.1e-05,
"loss": 10.3759,
"step": 3
},
{
"epoch": 0.006773920406435224,
"grad_norm": 0.06400913745164871,
"learning_rate": 2.8e-05,
"loss": 10.3753,
"step": 4
},
{
"epoch": 0.00846740050804403,
"grad_norm": 0.06217538192868233,
"learning_rate": 3.5e-05,
"loss": 10.3766,
"step": 5
},
{
"epoch": 0.010160880609652836,
"grad_norm": 0.059953831136226654,
"learning_rate": 4.2e-05,
"loss": 10.3753,
"step": 6
},
{
"epoch": 0.011854360711261643,
"grad_norm": 0.06322812288999557,
"learning_rate": 4.899999999999999e-05,
"loss": 10.3751,
"step": 7
},
{
"epoch": 0.013547840812870448,
"grad_norm": 0.06448973715305328,
"learning_rate": 5.6e-05,
"loss": 10.3755,
"step": 8
},
{
"epoch": 0.015241320914479255,
"grad_norm": 0.06553128361701965,
"learning_rate": 6.3e-05,
"loss": 10.3754,
"step": 9
},
{
"epoch": 0.01693480101608806,
"grad_norm": 0.06717841327190399,
"learning_rate": 7e-05,
"loss": 10.3749,
"step": 10
},
{
"epoch": 0.018628281117696866,
"grad_norm": 0.06435838341712952,
"learning_rate": 6.999521567473641e-05,
"loss": 10.3753,
"step": 11
},
{
"epoch": 0.02032176121930567,
"grad_norm": 0.06390493363142014,
"learning_rate": 6.998086400693241e-05,
"loss": 10.3744,
"step": 12
},
{
"epoch": 0.02201524132091448,
"grad_norm": 0.06731149554252625,
"learning_rate": 6.995694892019065e-05,
"loss": 10.3745,
"step": 13
},
{
"epoch": 0.023708721422523286,
"grad_norm": 0.08515335619449615,
"learning_rate": 6.99234769526571e-05,
"loss": 10.3737,
"step": 14
},
{
"epoch": 0.02540220152413209,
"grad_norm": 0.08068357408046722,
"learning_rate": 6.988045725523343e-05,
"loss": 10.3727,
"step": 15
},
{
"epoch": 0.027095681625740897,
"grad_norm": 0.08304785192012787,
"learning_rate": 6.982790158907539e-05,
"loss": 10.3722,
"step": 16
},
{
"epoch": 0.028789161727349702,
"grad_norm": 0.08605454862117767,
"learning_rate": 6.976582432237733e-05,
"loss": 10.3725,
"step": 17
},
{
"epoch": 0.03048264182895851,
"grad_norm": 0.0890476256608963,
"learning_rate": 6.969424242644413e-05,
"loss": 10.3728,
"step": 18
},
{
"epoch": 0.03217612193056731,
"grad_norm": 0.09603014588356018,
"learning_rate": 6.961317547105138e-05,
"loss": 10.3707,
"step": 19
},
{
"epoch": 0.03386960203217612,
"grad_norm": 0.09333094954490662,
"learning_rate": 6.952264561909527e-05,
"loss": 10.3714,
"step": 20
},
{
"epoch": 0.03556308213378493,
"grad_norm": 0.11809182167053223,
"learning_rate": 6.942267762053337e-05,
"loss": 10.3699,
"step": 21
},
{
"epoch": 0.03725656223539373,
"grad_norm": 0.12310867756605148,
"learning_rate": 6.931329880561832e-05,
"loss": 10.3696,
"step": 22
},
{
"epoch": 0.03895004233700254,
"grad_norm": 0.12797869741916656,
"learning_rate": 6.919453907742597e-05,
"loss": 10.3694,
"step": 23
},
{
"epoch": 0.04064352243861134,
"grad_norm": 0.14211532473564148,
"learning_rate": 6.90664309036802e-05,
"loss": 10.3684,
"step": 24
},
{
"epoch": 0.04233700254022015,
"grad_norm": 0.13544224202632904,
"learning_rate": 6.892900930787656e-05,
"loss": 10.3687,
"step": 25
},
{
"epoch": 0.04403048264182896,
"grad_norm": 0.15587803721427917,
"learning_rate": 6.87823118597072e-05,
"loss": 10.3667,
"step": 26
},
{
"epoch": 0.04572396274343776,
"grad_norm": 0.15392404794692993,
"learning_rate": 6.862637866478969e-05,
"loss": 10.3679,
"step": 27
},
{
"epoch": 0.04741744284504657,
"grad_norm": 0.15195734798908234,
"learning_rate": 6.846125235370252e-05,
"loss": 10.3674,
"step": 28
},
{
"epoch": 0.04911092294665537,
"grad_norm": 0.1591203212738037,
"learning_rate": 6.828697807033038e-05,
"loss": 10.3646,
"step": 29
},
{
"epoch": 0.05080440304826418,
"grad_norm": 0.17264410853385925,
"learning_rate": 6.81036034595222e-05,
"loss": 10.3642,
"step": 30
},
{
"epoch": 0.05249788314987299,
"grad_norm": 0.1709284484386444,
"learning_rate": 6.791117865406564e-05,
"loss": 10.3635,
"step": 31
},
{
"epoch": 0.05419136325148179,
"grad_norm": 0.17630036175251007,
"learning_rate": 6.770975626098112e-05,
"loss": 10.365,
"step": 32
},
{
"epoch": 0.0558848433530906,
"grad_norm": 0.1866825520992279,
"learning_rate": 6.749939134713974e-05,
"loss": 10.3628,
"step": 33
},
{
"epoch": 0.057578323454699404,
"grad_norm": 0.17809787392616272,
"learning_rate": 6.728014142420846e-05,
"loss": 10.3629,
"step": 34
},
{
"epoch": 0.05927180355630821,
"grad_norm": 0.20281663537025452,
"learning_rate": 6.7052066432927e-05,
"loss": 10.3578,
"step": 35
},
{
"epoch": 0.06096528365791702,
"grad_norm": 0.19204723834991455,
"learning_rate": 6.681522872672069e-05,
"loss": 10.3585,
"step": 36
},
{
"epoch": 0.06265876375952582,
"grad_norm": 0.1810905933380127,
"learning_rate": 6.656969305465356e-05,
"loss": 10.3592,
"step": 37
},
{
"epoch": 0.06435224386113463,
"grad_norm": 0.19030340015888214,
"learning_rate": 6.631552654372672e-05,
"loss": 10.3601,
"step": 38
},
{
"epoch": 0.06604572396274344,
"grad_norm": 0.16998638212680817,
"learning_rate": 6.60527986805264e-05,
"loss": 10.3573,
"step": 39
},
{
"epoch": 0.06773920406435224,
"grad_norm": 0.1517295241355896,
"learning_rate": 6.578158129222711e-05,
"loss": 10.3549,
"step": 40
},
{
"epoch": 0.06943268416596104,
"grad_norm": 0.15249769389629364,
"learning_rate": 6.550194852695469e-05,
"loss": 10.3559,
"step": 41
},
{
"epoch": 0.07112616426756986,
"grad_norm": 0.15435636043548584,
"learning_rate": 6.521397683351509e-05,
"loss": 10.354,
"step": 42
},
{
"epoch": 0.07281964436917866,
"grad_norm": 0.14684386551380157,
"learning_rate": 6.491774494049386e-05,
"loss": 10.355,
"step": 43
},
{
"epoch": 0.07451312447078746,
"grad_norm": 0.15682685375213623,
"learning_rate": 6.461333383473272e-05,
"loss": 10.3522,
"step": 44
},
{
"epoch": 0.07620660457239628,
"grad_norm": 0.14739371836185455,
"learning_rate": 6.430082673918849e-05,
"loss": 10.3518,
"step": 45
},
{
"epoch": 0.07790008467400508,
"grad_norm": 0.14083759486675262,
"learning_rate": 6.398030909018069e-05,
"loss": 10.3527,
"step": 46
},
{
"epoch": 0.07959356477561388,
"grad_norm": 0.11909397691488266,
"learning_rate": 6.365186851403423e-05,
"loss": 10.3539,
"step": 47
},
{
"epoch": 0.08128704487722269,
"grad_norm": 0.11432235687971115,
"learning_rate": 6.331559480312315e-05,
"loss": 10.3531,
"step": 48
},
{
"epoch": 0.0829805249788315,
"grad_norm": 0.13134874403476715,
"learning_rate": 6.297157989132236e-05,
"loss": 10.3544,
"step": 49
},
{
"epoch": 0.0846740050804403,
"grad_norm": 0.19639384746551514,
"learning_rate": 6.261991782887377e-05,
"loss": 10.3542,
"step": 50
},
{
"epoch": 0.0846740050804403,
"eval_loss": 10.351482391357422,
"eval_runtime": 2.2614,
"eval_samples_per_second": 439.995,
"eval_steps_per_second": 110.109,
"step": 50
}
],
"logging_steps": 1,
"max_steps": 200,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 50,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 4,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": false
},
"attributes": {}
}
},
"total_flos": 5744859021312.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}