hybrid-ibm3g-500M-10BT / trainer_state.json
lanczos's picture
Upload folder using huggingface_hub
74ef33a verified
Raw History Blame Contribute Delete
18.1 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 500,
"global_step": 4768,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.010486577181208054,
"grad_norm": 368.3387451171875,
"learning_rate": 0.00039999996012889783,
"loss": 1943.7871875,
"step": 50
},
{
"epoch": 0.02097315436241611,
"grad_norm": 207.74237060546875,
"learning_rate": 0.0003998963052169914,
"loss": 1364.161875,
"step": 100
},
{
"epoch": 0.031459731543624164,
"grad_norm": 213.6255645751953,
"learning_rate": 0.0003995934280199486,
"loss": 1164.829140625,
"step": 150
},
{
"epoch": 0.04194630872483222,
"grad_norm": 142.02505493164062,
"learning_rate": 0.0003990916639525919,
"loss": 1055.693125,
"step": 200
},
{
"epoch": 0.05243288590604027,
"grad_norm": 106.3203125,
"learning_rate": 0.00039839156868272125,
"loss": 983.63953125,
"step": 250
},
{
"epoch": 0.06291946308724833,
"grad_norm": 102.88804626464844,
"learning_rate": 0.00039749391751575094,
"loss": 936.214453125,
"step": 300
},
{
"epoch": 0.07340604026845637,
"grad_norm": 87.96272277832031,
"learning_rate": 0.000396399704536115,
"loss": 896.3065625,
"step": 350
},
{
"epoch": 0.08389261744966443,
"grad_norm": 84.20787811279297,
"learning_rate": 0.00039511014150638945,
"loss": 864.907578125,
"step": 400
},
{
"epoch": 0.09437919463087248,
"grad_norm": 70.50565338134766,
"learning_rate": 0.0003936266565253521,
"loss": 836.6284375,
"step": 450
},
{
"epoch": 0.10486577181208054,
"grad_norm": 60.06486129760742,
"learning_rate": 0.00039195089244646516,
"loss": 817.46765625,
"step": 500
},
{
"epoch": 0.11535234899328858,
"grad_norm": 59.451847076416016,
"learning_rate": 0.00039008470505853306,
"loss": 800.98515625,
"step": 550
},
{
"epoch": 0.12583892617449666,
"grad_norm": 60.73537063598633,
"learning_rate": 0.0003880301610305485,
"loss": 786.46203125,
"step": 600
},
{
"epoch": 0.1363255033557047,
"grad_norm": 59.06135940551758,
"learning_rate": 0.0003857895356230049,
"loss": 778.0659375,
"step": 650
},
{
"epoch": 0.14681208053691275,
"grad_norm": 53.37266159057617,
"learning_rate": 0.00038336531016820805,
"loss": 766.003203125,
"step": 700
},
{
"epoch": 0.1572986577181208,
"grad_norm": 53.684242248535156,
"learning_rate": 0.00038076016932237823,
"loss": 756.388125,
"step": 750
},
{
"epoch": 0.16778523489932887,
"grad_norm": 48.64345169067383,
"learning_rate": 0.0003779769980925852,
"loss": 746.84921875,
"step": 800
},
{
"epoch": 0.1782718120805369,
"grad_norm": 44.20575714111328,
"learning_rate": 0.00037501887864180994,
"loss": 744.869765625,
"step": 850
},
{
"epoch": 0.18875838926174496,
"grad_norm": 52.58369445800781,
"learning_rate": 0.0003718890868756691,
"loss": 734.65953125,
"step": 900
},
{
"epoch": 0.19924496644295303,
"grad_norm": 42.28474044799805,
"learning_rate": 0.00036859108881458436,
"loss": 728.80578125,
"step": 950
},
{
"epoch": 0.20973154362416108,
"grad_norm": 42.222476959228516,
"learning_rate": 0.00036512853675541246,
"loss": 724.59,
"step": 1000
},
{
"epoch": 0.22021812080536912,
"grad_norm": 43.99419021606445,
"learning_rate": 0.0003615052652267882,
"loss": 719.86484375,
"step": 1050
},
{
"epoch": 0.23070469798657717,
"grad_norm": 39.6729736328125,
"learning_rate": 0.00035772528674265803,
"loss": 715.3203125,
"step": 1100
},
{
"epoch": 0.24119127516778524,
"grad_norm": 38.317264556884766,
"learning_rate": 0.0003537927873587081,
"loss": 709.32109375,
"step": 1150
},
{
"epoch": 0.2516778523489933,
"grad_norm": 36.196189880371094,
"learning_rate": 0.0003497121220366071,
"loss": 707.9553125,
"step": 1200
},
{
"epoch": 0.26216442953020136,
"grad_norm": 44.622249603271484,
"learning_rate": 0.00034548780982119806,
"loss": 701.796015625,
"step": 1250
},
{
"epoch": 0.2726510067114094,
"grad_norm": 36.12064743041992,
"learning_rate": 0.0003411245288359792,
"loss": 700.011640625,
"step": 1300
},
{
"epoch": 0.28313758389261745,
"grad_norm": 38.6741828918457,
"learning_rate": 0.00033662711110241697,
"loss": 698.8696875,
"step": 1350
},
{
"epoch": 0.2936241610738255,
"grad_norm": 30.641695022583008,
"learning_rate": 0.00033200053718882835,
"loss": 696.22375,
"step": 1400
},
{
"epoch": 0.30411073825503354,
"grad_norm": 40.532371520996094,
"learning_rate": 0.00032724993069475764,
"loss": 692.38125,
"step": 1450
},
{
"epoch": 0.3145973154362416,
"grad_norm": 34.068416595458984,
"learning_rate": 0.00032238055257695645,
"loss": 691.11265625,
"step": 1500
},
{
"epoch": 0.3250838926174497,
"grad_norm": 40.80622100830078,
"learning_rate": 0.0003173977953232508,
"loss": 687.55140625,
"step": 1550
},
{
"epoch": 0.33557046979865773,
"grad_norm": 34.22670364379883,
"learning_rate": 0.0003123071769807465,
"loss": 685.93375,
"step": 1600
},
{
"epoch": 0.3460570469798658,
"grad_norm": 31.670894622802734,
"learning_rate": 0.0003071143350449872,
"loss": 681.9975,
"step": 1650
},
{
"epoch": 0.3565436241610738,
"grad_norm": 33.595584869384766,
"learning_rate": 0.0003018250202168308,
"loss": 679.972734375,
"step": 1700
},
{
"epoch": 0.36703020134228187,
"grad_norm": 30.952510833740234,
"learning_rate": 0.00029644509003396075,
"loss": 677.457734375,
"step": 1750
},
{
"epoch": 0.3775167785234899,
"grad_norm": 30.160049438476562,
"learning_rate": 0.00029098050238408137,
"loss": 686.746953125,
"step": 1800
},
{
"epoch": 0.38800335570469796,
"grad_norm": 31.96990203857422,
"learning_rate": 0.00028543730890698353,
"loss": 683.5790625,
"step": 1850
},
{
"epoch": 0.39848993288590606,
"grad_norm": 29.51980209350586,
"learning_rate": 0.00027982164829278754,
"loss": 681.6565625,
"step": 1900
},
{
"epoch": 0.4089765100671141,
"grad_norm": 29.172855377197266,
"learning_rate": 0.0002741397394837821,
"loss": 680.9534375,
"step": 1950
},
{
"epoch": 0.41946308724832215,
"grad_norm": 37.14703369140625,
"learning_rate": 0.0002683978747873912,
"loss": 680.596640625,
"step": 2000
},
{
"epoch": 0.4299496644295302,
"grad_norm": 32.150413513183594,
"learning_rate": 0.0002626024129078938,
"loss": 675.5540625,
"step": 2050
},
{
"epoch": 0.44043624161073824,
"grad_norm": 30.413984298706055,
"learning_rate": 0.000256759771904614,
"loss": 675.562890625,
"step": 2100
},
{
"epoch": 0.4509228187919463,
"grad_norm": 29.09618377685547,
"learning_rate": 0.00025087642208437936,
"loss": 674.3853125,
"step": 2150
},
{
"epoch": 0.46140939597315433,
"grad_norm": 29.583885192871094,
"learning_rate": 0.0002449588788361192,
"loss": 672.73609375,
"step": 2200
},
{
"epoch": 0.47189597315436244,
"grad_norm": 32.54500961303711,
"learning_rate": 0.0002390136954155377,
"loss": 673.1803125,
"step": 2250
},
{
"epoch": 0.4823825503355705,
"grad_norm": 31.043081283569336,
"learning_rate": 0.0002330474556878519,
"loss": 671.179921875,
"step": 2300
},
{
"epoch": 0.4928691275167785,
"grad_norm": 30.022695541381836,
"learning_rate": 0.00022706676683663239,
"loss": 672.07421875,
"step": 2350
},
{
"epoch": 0.5033557046979866,
"grad_norm": 34.04905700683594,
"learning_rate": 0.0002210782520468199,
"loss": 670.31609375,
"step": 2400
},
{
"epoch": 0.5138422818791947,
"grad_norm": 27.62122344970703,
"learning_rate": 0.00021508854317002244,
"loss": 668.07984375,
"step": 2450
},
{
"epoch": 0.5243288590604027,
"grad_norm": 29.11014747619629,
"learning_rate": 0.00020910427338021354,
"loss": 667.40109375,
"step": 2500
},
{
"epoch": 0.5348154362416108,
"grad_norm": 27.978843688964844,
"learning_rate": 0.00020313206982796743,
"loss": 667.185703125,
"step": 2550
},
{
"epoch": 0.5453020134228188,
"grad_norm": 27.769739151000977,
"learning_rate": 0.0001971785463013636,
"loss": 661.9721875,
"step": 2600
},
{
"epoch": 0.5557885906040269,
"grad_norm": 28.027326583862305,
"learning_rate": 0.0001912502959016897,
"loss": 663.7615625,
"step": 2650
},
{
"epoch": 0.5662751677852349,
"grad_norm": 28.269882202148438,
"learning_rate": 0.0001853538837420539,
"loss": 660.90125,
"step": 2700
},
{
"epoch": 0.576761744966443,
"grad_norm": 28.425081253051758,
"learning_rate": 0.00017949583967699168,
"loss": 659.86375,
"step": 2750
},
{
"epoch": 0.587248322147651,
"grad_norm": 30.020648956298828,
"learning_rate": 0.00017368265107111944,
"loss": 658.221015625,
"step": 2800
},
{
"epoch": 0.597734899328859,
"grad_norm": 27.04160499572754,
"learning_rate": 0.00016792075561484216,
"loss": 653.6601171875,
"step": 2850
},
{
"epoch": 0.6082214765100671,
"grad_norm": 29.150625228881836,
"learning_rate": 0.00016221653419507207,
"loss": 655.427890625,
"step": 2900
},
{
"epoch": 0.6187080536912751,
"grad_norm": 27.60247230529785,
"learning_rate": 0.0001565763038288528,
"loss": 653.712421875,
"step": 2950
},
{
"epoch": 0.6291946308724832,
"grad_norm": 27.480228424072266,
"learning_rate": 0.00015100631066771562,
"loss": 654.718125,
"step": 3000
},
{
"epoch": 0.6396812080536913,
"grad_norm": 26.716264724731445,
"learning_rate": 0.0001455127230805128,
"loss": 654.7971875,
"step": 3050
},
{
"epoch": 0.6501677852348994,
"grad_norm": 28.188127517700195,
"learning_rate": 0.00014010162482239088,
"loss": 653.0003515625,
"step": 3100
},
{
"epoch": 0.6606543624161074,
"grad_norm": 26.798398971557617,
"learning_rate": 0.00013477900829746725,
"loss": 652.0621875,
"step": 3150
},
{
"epoch": 0.6711409395973155,
"grad_norm": 25.96640968322754,
"learning_rate": 0.00012955076792267134,
"loss": 649.297578125,
"step": 3200
},
{
"epoch": 0.6816275167785235,
"grad_norm": 26.402250289916992,
"learning_rate": 0.00012442269360009943,
"loss": 647.39578125,
"step": 3250
},
{
"epoch": 0.6921140939597316,
"grad_norm": 30.009817123413086,
"learning_rate": 0.0001194004643051128,
"loss": 648.9943359375,
"step": 3300
},
{
"epoch": 0.7026006711409396,
"grad_norm": 24.78243064880371,
"learning_rate": 0.00011448964179727846,
"loss": 646.107890625,
"step": 3350
},
{
"epoch": 0.7130872483221476,
"grad_norm": 27.300064086914062,
"learning_rate": 0.00010969566446111879,
"loss": 647.514296875,
"step": 3400
},
{
"epoch": 0.7235738255033557,
"grad_norm": 27.541133880615234,
"learning_rate": 0.00010502384128348954,
"loss": 647.062265625,
"step": 3450
},
{
"epoch": 0.7340604026845637,
"grad_norm": 26.25283432006836,
"learning_rate": 0.00010047934597425688,
"loss": 643.4507421875,
"step": 3500
},
{
"epoch": 0.7445469798657718,
"grad_norm": 25.531070709228516,
"learning_rate": 9.606721123678415e-05,
"loss": 642.95484375,
"step": 3550
},
{
"epoch": 0.7550335570469798,
"grad_norm": 26.868000030517578,
"learning_rate": 9.179232319457263e-05,
"loss": 642.4176953125,
"step": 3600
},
{
"epoch": 0.7655201342281879,
"grad_norm": 27.66659164428711,
"learning_rate": 8.765941598022974e-05,
"loss": 642.143046875,
"step": 3650
},
{
"epoch": 0.7760067114093959,
"grad_norm": 26.77629280090332,
"learning_rate": 8.36730664927557e-05,
"loss": 639.9495703125,
"step": 3700
},
{
"epoch": 0.7864932885906041,
"grad_norm": 27.235015869140625,
"learning_rate": 7.983768932895552e-05,
"loss": 641.0969140625,
"step": 3750
},
{
"epoch": 0.7969798657718121,
"grad_norm": 26.09847068786621,
"learning_rate": 7.615753189458901e-05,
"loss": 640.0983203125,
"step": 3800
},
{
"epoch": 0.8074664429530202,
"grad_norm": 26.609689712524414,
"learning_rate": 7.263666970067252e-05,
"loss": 639.256953125,
"step": 3850
},
{
"epoch": 0.8179530201342282,
"grad_norm": 26.14310073852539,
"learning_rate": 6.927900185014261e-05,
"loss": 638.1404296875,
"step": 3900
},
{
"epoch": 0.8284395973154363,
"grad_norm": 29.49323272705078,
"learning_rate": 6.608824671987803e-05,
"loss": 637.4990625,
"step": 3950
},
{
"epoch": 0.8389261744966443,
"grad_norm": 26.548120498657227,
"learning_rate": 6.306793784286387e-05,
"loss": 636.7809375,
"step": 4000
},
{
"epoch": 0.8494127516778524,
"grad_norm": 27.33233642578125,
"learning_rate": 6.022141999505628e-05,
"loss": 637.5430078125,
"step": 4050
},
{
"epoch": 0.8598993288590604,
"grad_norm": 26.312681198120117,
"learning_rate": 5.755184549128258e-05,
"loss": 636.16640625,
"step": 4100
},
{
"epoch": 0.8703859060402684,
"grad_norm": 26.898212432861328,
"learning_rate": 5.506217069427819e-05,
"loss": 635.415546875,
"step": 4150
},
{
"epoch": 0.8808724832214765,
"grad_norm": 27.051759719848633,
"learning_rate": 5.2755152740726445e-05,
"loss": 633.7575,
"step": 4200
},
{
"epoch": 0.8913590604026845,
"grad_norm": 29.261503219604492,
"learning_rate": 5.0633346487926995e-05,
"loss": 632.527734375,
"step": 4250
},
{
"epoch": 0.9018456375838926,
"grad_norm": 26.992849349975586,
"learning_rate": 4.8699101684474055e-05,
"loss": 631.6880078125,
"step": 4300
},
{
"epoch": 0.9123322147651006,
"grad_norm": 27.665159225463867,
"learning_rate": 4.69545603680782e-05,
"loss": 631.40625,
"step": 4350
},
{
"epoch": 0.9228187919463087,
"grad_norm": 26.294857025146484,
"learning_rate": 4.540165449341264e-05,
"loss": 630.9049609375,
"step": 4400
},
{
"epoch": 0.9333053691275168,
"grad_norm": 27.581268310546875,
"learning_rate": 4.404210379261189e-05,
"loss": 629.3650390625,
"step": 4450
},
{
"epoch": 0.9437919463087249,
"grad_norm": 26.183048248291016,
"learning_rate": 4.2877413870791265e-05,
"loss": 630.9475,
"step": 4500
},
{
"epoch": 0.9542785234899329,
"grad_norm": 26.570083618164062,
"learning_rate": 4.1908874538697176e-05,
"loss": 632.509609375,
"step": 4550
},
{
"epoch": 0.964765100671141,
"grad_norm": 26.519433975219727,
"learning_rate": 4.113755838433387e-05,
"loss": 631.91734375,
"step": 4600
},
{
"epoch": 0.975251677852349,
"grad_norm": 26.85693359375,
"learning_rate": 4.056431958514902e-05,
"loss": 629.4893359375,
"step": 4650
},
{
"epoch": 0.985738255033557,
"grad_norm": 27.51490592956543,
"learning_rate": 4.018979296209327e-05,
"loss": 629.0673828125,
"step": 4700
},
{
"epoch": 0.9962248322147651,
"grad_norm": 28.307880401611328,
"learning_rate": 4.0014393276601606e-05,
"loss": 631.169765625,
"step": 4750
},
{
"epoch": 1.0,
"step": 4768,
"total_flos": 2.822075129323638e+19,
"train_loss": 715.1964275180893,
"train_runtime": 182966.6583,
"train_samples_per_second": 13.342,
"train_steps_per_second": 0.026
}
],
"logging_steps": 50,
"max_steps": 4768,
"num_input_tokens_seen": 0,
"num_train_epochs": 9223372036854775807,
"save_steps": 1000,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 2.822075129323638e+19,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}