prxy5608's picture
Training in progress, step 50, checkpoint
e429c09 verified
Raw
History Blame Contribute Delete
10.3 kB
{
"best_metric": 3.0149381160736084,
"best_model_checkpoint": "miner_id_24/checkpoint-50",
"epoch": 0.009938382031405287,
"eval_steps": 25,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.00019876764062810574,
"grad_norm": 0.08420488983392715,
"learning_rate": 2e-05,
"loss": 1.6777,
"step": 1
},
{
"epoch": 0.00019876764062810574,
"eval_loss": 3.6612236499786377,
"eval_runtime": 67.3581,
"eval_samples_per_second": 125.805,
"eval_steps_per_second": 15.737,
"step": 1
},
{
"epoch": 0.0003975352812562115,
"grad_norm": 0.17416247725486755,
"learning_rate": 4e-05,
"loss": 2.4276,
"step": 2
},
{
"epoch": 0.0005963029218843172,
"grad_norm": 0.21623319387435913,
"learning_rate": 6e-05,
"loss": 2.6007,
"step": 3
},
{
"epoch": 0.000795070562512423,
"grad_norm": 0.15903286635875702,
"learning_rate": 8e-05,
"loss": 2.646,
"step": 4
},
{
"epoch": 0.0009938382031405286,
"grad_norm": 0.1743364781141281,
"learning_rate": 0.0001,
"loss": 2.9006,
"step": 5
},
{
"epoch": 0.0011926058437686344,
"grad_norm": 0.18579961359500885,
"learning_rate": 9.987820251299122e-05,
"loss": 2.7491,
"step": 6
},
{
"epoch": 0.0013913734843967402,
"grad_norm": 0.19385971128940582,
"learning_rate": 9.951340343707852e-05,
"loss": 2.7176,
"step": 7
},
{
"epoch": 0.001590141125024846,
"grad_norm": 0.20547613501548767,
"learning_rate": 9.890738003669029e-05,
"loss": 2.9435,
"step": 8
},
{
"epoch": 0.0017889087656529517,
"grad_norm": 0.21542897820472717,
"learning_rate": 9.806308479691595e-05,
"loss": 2.9636,
"step": 9
},
{
"epoch": 0.0019876764062810573,
"grad_norm": 0.20447668433189392,
"learning_rate": 9.698463103929542e-05,
"loss": 2.7969,
"step": 10
},
{
"epoch": 0.0021864440469091632,
"grad_norm": 0.22560608386993408,
"learning_rate": 9.567727288213005e-05,
"loss": 3.3065,
"step": 11
},
{
"epoch": 0.002385211687537269,
"grad_norm": 0.23869244754314423,
"learning_rate": 9.414737964294636e-05,
"loss": 3.1795,
"step": 12
},
{
"epoch": 0.002583979328165375,
"grad_norm": 0.21942728757858276,
"learning_rate": 9.24024048078213e-05,
"loss": 2.9018,
"step": 13
},
{
"epoch": 0.0027827469687934803,
"grad_norm": 0.24622339010238647,
"learning_rate": 9.045084971874738e-05,
"loss": 3.3347,
"step": 14
},
{
"epoch": 0.0029815146094215863,
"grad_norm": 0.2358148694038391,
"learning_rate": 8.83022221559489e-05,
"loss": 3.2586,
"step": 15
},
{
"epoch": 0.003180282250049692,
"grad_norm": 0.2474563717842102,
"learning_rate": 8.596699001693255e-05,
"loss": 3.2522,
"step": 16
},
{
"epoch": 0.003379049890677798,
"grad_norm": 0.26249605417251587,
"learning_rate": 8.345653031794292e-05,
"loss": 3.0814,
"step": 17
},
{
"epoch": 0.0035778175313059034,
"grad_norm": 0.27410539984703064,
"learning_rate": 8.07830737662829e-05,
"loss": 3.3012,
"step": 18
},
{
"epoch": 0.003776585171934009,
"grad_norm": 0.25694385170936584,
"learning_rate": 7.795964517353735e-05,
"loss": 3.1564,
"step": 19
},
{
"epoch": 0.0039753528125621145,
"grad_norm": 0.26552635431289673,
"learning_rate": 7.500000000000001e-05,
"loss": 3.2579,
"step": 20
},
{
"epoch": 0.0041741204531902205,
"grad_norm": 0.25721579790115356,
"learning_rate": 7.191855733945387e-05,
"loss": 3.2505,
"step": 21
},
{
"epoch": 0.0043728880938183265,
"grad_norm": 0.2668185234069824,
"learning_rate": 6.873032967079561e-05,
"loss": 3.0924,
"step": 22
},
{
"epoch": 0.0045716557344464325,
"grad_norm": 0.26348620653152466,
"learning_rate": 6.545084971874738e-05,
"loss": 3.2819,
"step": 23
},
{
"epoch": 0.004770423375074538,
"grad_norm": 0.26392704248428345,
"learning_rate": 6.209609477998338e-05,
"loss": 3.102,
"step": 24
},
{
"epoch": 0.004969191015702644,
"grad_norm": 0.26735320687294006,
"learning_rate": 5.868240888334653e-05,
"loss": 3.1296,
"step": 25
},
{
"epoch": 0.004969191015702644,
"eval_loss": 3.111262798309326,
"eval_runtime": 67.118,
"eval_samples_per_second": 126.255,
"eval_steps_per_second": 15.793,
"step": 25
},
{
"epoch": 0.00516795865633075,
"grad_norm": 0.3099224269390106,
"learning_rate": 5.522642316338268e-05,
"loss": 3.1568,
"step": 26
},
{
"epoch": 0.005366726296958855,
"grad_norm": 0.2683943808078766,
"learning_rate": 5.174497483512506e-05,
"loss": 3.3075,
"step": 27
},
{
"epoch": 0.005565493937586961,
"grad_norm": 0.290770560503006,
"learning_rate": 4.825502516487497e-05,
"loss": 3.1469,
"step": 28
},
{
"epoch": 0.005764261578215067,
"grad_norm": 0.2689608931541443,
"learning_rate": 4.477357683661734e-05,
"loss": 3.1745,
"step": 29
},
{
"epoch": 0.005963029218843173,
"grad_norm": 0.27947020530700684,
"learning_rate": 4.131759111665349e-05,
"loss": 3.1196,
"step": 30
},
{
"epoch": 0.006161796859471278,
"grad_norm": 0.3059743344783783,
"learning_rate": 3.790390522001662e-05,
"loss": 3.2627,
"step": 31
},
{
"epoch": 0.006360564500099384,
"grad_norm": 0.2834652066230774,
"learning_rate": 3.4549150281252636e-05,
"loss": 3.0715,
"step": 32
},
{
"epoch": 0.00655933214072749,
"grad_norm": 0.31416839361190796,
"learning_rate": 3.12696703292044e-05,
"loss": 3.1854,
"step": 33
},
{
"epoch": 0.006758099781355596,
"grad_norm": 0.3347357213497162,
"learning_rate": 2.8081442660546125e-05,
"loss": 3.1765,
"step": 34
},
{
"epoch": 0.006956867421983701,
"grad_norm": 0.30826708674430847,
"learning_rate": 2.500000000000001e-05,
"loss": 3.223,
"step": 35
},
{
"epoch": 0.007155635062611807,
"grad_norm": 0.32336822152137756,
"learning_rate": 2.2040354826462668e-05,
"loss": 3.3838,
"step": 36
},
{
"epoch": 0.007354402703239913,
"grad_norm": 0.3186890482902527,
"learning_rate": 1.9216926233717085e-05,
"loss": 3.1607,
"step": 37
},
{
"epoch": 0.007553170343868018,
"grad_norm": 0.330779105424881,
"learning_rate": 1.6543469682057106e-05,
"loss": 3.2356,
"step": 38
},
{
"epoch": 0.007751937984496124,
"grad_norm": 0.3563855290412903,
"learning_rate": 1.4033009983067452e-05,
"loss": 3.1177,
"step": 39
},
{
"epoch": 0.007950705625124229,
"grad_norm": 0.36722344160079956,
"learning_rate": 1.1697777844051105e-05,
"loss": 3.0539,
"step": 40
},
{
"epoch": 0.008149473265752336,
"grad_norm": 0.3383886516094208,
"learning_rate": 9.549150281252633e-06,
"loss": 3.2582,
"step": 41
},
{
"epoch": 0.008348240906380441,
"grad_norm": 0.35494890809059143,
"learning_rate": 7.597595192178702e-06,
"loss": 3.0954,
"step": 42
},
{
"epoch": 0.008547008547008548,
"grad_norm": 0.3515838086605072,
"learning_rate": 5.852620357053651e-06,
"loss": 3.3631,
"step": 43
},
{
"epoch": 0.008745776187636653,
"grad_norm": 0.37979280948638916,
"learning_rate": 4.322727117869951e-06,
"loss": 3.3569,
"step": 44
},
{
"epoch": 0.008944543828264758,
"grad_norm": 0.3924817144870758,
"learning_rate": 3.0153689607045845e-06,
"loss": 3.2494,
"step": 45
},
{
"epoch": 0.009143311468892865,
"grad_norm": 0.39909616112709045,
"learning_rate": 1.9369152030840556e-06,
"loss": 3.3279,
"step": 46
},
{
"epoch": 0.00934207910952097,
"grad_norm": 0.46893322467803955,
"learning_rate": 1.0926199633097157e-06,
"loss": 3.1981,
"step": 47
},
{
"epoch": 0.009540846750149075,
"grad_norm": 0.4818413555622101,
"learning_rate": 4.865965629214819e-07,
"loss": 3.4108,
"step": 48
},
{
"epoch": 0.009739614390777182,
"grad_norm": 0.6217837333679199,
"learning_rate": 1.2179748700879012e-07,
"loss": 3.674,
"step": 49
},
{
"epoch": 0.009938382031405287,
"grad_norm": 0.9694095253944397,
"learning_rate": 0.0,
"loss": 4.1192,
"step": 50
},
{
"epoch": 0.009938382031405287,
"eval_loss": 3.0149381160736084,
"eval_runtime": 67.076,
"eval_samples_per_second": 126.334,
"eval_steps_per_second": 15.803,
"step": 50
}
],
"logging_steps": 1,
"max_steps": 50,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 25,
"stateful_callbacks": {
"EarlyStoppingCallback": {
"args": {
"early_stopping_patience": 5,
"early_stopping_threshold": 0.0
},
"attributes": {
"early_stopping_patience_counter": 0
}
},
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1725805984481280.0,
"train_batch_size": 8,
"trial_name": null,
"trial_params": null
}