Jackson Brune
Training in progress, step 50, checkpoint
95b66b4 verified
Raw History Blame Contribute Delete
10.1 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.049714143673875215,
"eval_steps": 13,
"global_step": 50,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"epoch": 0.0009942828734775043,
"grad_norm": 1.0767807960510254,
"learning_rate": 5e-06,
"loss": 1.4767,
"step": 1
},
{
"epoch": 0.0009942828734775043,
"eval_loss": 1.4993078708648682,
"eval_runtime": 34.2272,
"eval_samples_per_second": 12.388,
"eval_steps_per_second": 6.194,
"step": 1
},
{
"epoch": 0.0019885657469550086,
"grad_norm": 1.241318702697754,
"learning_rate": 1e-05,
"loss": 1.2547,
"step": 2
},
{
"epoch": 0.002982848620432513,
"grad_norm": 1.0247488021850586,
"learning_rate": 1.5e-05,
"loss": 1.2667,
"step": 3
},
{
"epoch": 0.003977131493910017,
"grad_norm": 1.1591644287109375,
"learning_rate": 2e-05,
"loss": 1.4027,
"step": 4
},
{
"epoch": 0.004971414367387522,
"grad_norm": 1.1431999206542969,
"learning_rate": 2.5e-05,
"loss": 1.5309,
"step": 5
},
{
"epoch": 0.005965697240865026,
"grad_norm": 1.1215442419052124,
"learning_rate": 3e-05,
"loss": 1.2735,
"step": 6
},
{
"epoch": 0.00695998011434253,
"grad_norm": 1.185957908630371,
"learning_rate": 3.5e-05,
"loss": 1.3907,
"step": 7
},
{
"epoch": 0.007954262987820034,
"grad_norm": 0.9886231422424316,
"learning_rate": 4e-05,
"loss": 1.2722,
"step": 8
},
{
"epoch": 0.008948545861297539,
"grad_norm": 1.3221428394317627,
"learning_rate": 4.5e-05,
"loss": 1.5192,
"step": 9
},
{
"epoch": 0.009942828734775044,
"grad_norm": 1.54436457157135,
"learning_rate": 5e-05,
"loss": 1.8312,
"step": 10
},
{
"epoch": 0.010937111608252548,
"grad_norm": 1.059188723564148,
"learning_rate": 4.99229333433282e-05,
"loss": 1.3039,
"step": 11
},
{
"epoch": 0.011931394481730051,
"grad_norm": 1.1226993799209595,
"learning_rate": 4.9692208514878444e-05,
"loss": 1.1677,
"step": 12
},
{
"epoch": 0.012925677355207556,
"grad_norm": 1.0901505947113037,
"learning_rate": 4.9309248009941914e-05,
"loss": 1.2394,
"step": 13
},
{
"epoch": 0.012925677355207556,
"eval_loss": 1.2392393350601196,
"eval_runtime": 34.2682,
"eval_samples_per_second": 12.373,
"eval_steps_per_second": 6.186,
"step": 13
},
{
"epoch": 0.01391996022868506,
"grad_norm": 0.9254087209701538,
"learning_rate": 4.877641290737884e-05,
"loss": 1.7542,
"step": 14
},
{
"epoch": 0.014914243102162566,
"grad_norm": 0.6952210068702698,
"learning_rate": 4.8096988312782174e-05,
"loss": 1.19,
"step": 15
},
{
"epoch": 0.01590852597564007,
"grad_norm": 0.6884624361991882,
"learning_rate": 4.72751631047092e-05,
"loss": 1.2885,
"step": 16
},
{
"epoch": 0.016902808849117573,
"grad_norm": 0.6651028990745544,
"learning_rate": 4.6316004108852305e-05,
"loss": 1.1477,
"step": 17
},
{
"epoch": 0.017897091722595078,
"grad_norm": 0.7259565591812134,
"learning_rate": 4.522542485937369e-05,
"loss": 1.3021,
"step": 18
},
{
"epoch": 0.018891374596072583,
"grad_norm": 0.8364481329917908,
"learning_rate": 4.401014914000078e-05,
"loss": 1.3226,
"step": 19
},
{
"epoch": 0.019885657469550087,
"grad_norm": 0.6525047421455383,
"learning_rate": 4.267766952966369e-05,
"loss": 1.0674,
"step": 20
},
{
"epoch": 0.020879940343027592,
"grad_norm": 0.6612785458564758,
"learning_rate": 4.123620120825459e-05,
"loss": 1.1099,
"step": 21
},
{
"epoch": 0.021874223216505097,
"grad_norm": 0.6104527115821838,
"learning_rate": 3.969463130731183e-05,
"loss": 1.1705,
"step": 22
},
{
"epoch": 0.0228685060899826,
"grad_norm": 0.6610237956047058,
"learning_rate": 3.8062464117898724e-05,
"loss": 1.0519,
"step": 23
},
{
"epoch": 0.023862788963460103,
"grad_norm": 0.6938290596008301,
"learning_rate": 3.634976249348867e-05,
"loss": 0.9388,
"step": 24
},
{
"epoch": 0.024857071836937607,
"grad_norm": 0.6120235919952393,
"learning_rate": 3.456708580912725e-05,
"loss": 1.0911,
"step": 25
},
{
"epoch": 0.025851354710415112,
"grad_norm": 0.6890453100204468,
"learning_rate": 3.272542485937369e-05,
"loss": 0.9741,
"step": 26
},
{
"epoch": 0.025851354710415112,
"eval_loss": 1.1278754472732544,
"eval_runtime": 34.2794,
"eval_samples_per_second": 12.369,
"eval_steps_per_second": 6.184,
"step": 26
},
{
"epoch": 0.026845637583892617,
"grad_norm": 0.6195194125175476,
"learning_rate": 3.083613409639764e-05,
"loss": 1.3244,
"step": 27
},
{
"epoch": 0.02783992045737012,
"grad_norm": 0.5792179107666016,
"learning_rate": 2.8910861626005776e-05,
"loss": 1.0774,
"step": 28
},
{
"epoch": 0.028834203330847626,
"grad_norm": 0.6153373718261719,
"learning_rate": 2.6961477393196126e-05,
"loss": 1.4603,
"step": 29
},
{
"epoch": 0.02982848620432513,
"grad_norm": 0.5552039742469788,
"learning_rate": 2.5e-05,
"loss": 0.9616,
"step": 30
},
{
"epoch": 0.030822769077802636,
"grad_norm": 0.6039525270462036,
"learning_rate": 2.303852260680388e-05,
"loss": 1.1378,
"step": 31
},
{
"epoch": 0.03181705195128014,
"grad_norm": 0.5297777652740479,
"learning_rate": 2.1089138373994223e-05,
"loss": 0.9908,
"step": 32
},
{
"epoch": 0.03281133482475764,
"grad_norm": 0.6318143606185913,
"learning_rate": 1.9163865903602374e-05,
"loss": 1.0829,
"step": 33
},
{
"epoch": 0.033805617698235146,
"grad_norm": 0.5691390037536621,
"learning_rate": 1.7274575140626318e-05,
"loss": 1.2315,
"step": 34
},
{
"epoch": 0.03479990057171265,
"grad_norm": 0.5200899243354797,
"learning_rate": 1.5432914190872757e-05,
"loss": 1.0599,
"step": 35
},
{
"epoch": 0.035794183445190156,
"grad_norm": 0.4896901249885559,
"learning_rate": 1.3650237506511331e-05,
"loss": 1.2254,
"step": 36
},
{
"epoch": 0.03678846631866766,
"grad_norm": 0.5189372897148132,
"learning_rate": 1.1937535882101281e-05,
"loss": 1.0241,
"step": 37
},
{
"epoch": 0.037782749192145165,
"grad_norm": 0.5271244645118713,
"learning_rate": 1.0305368692688174e-05,
"loss": 0.9474,
"step": 38
},
{
"epoch": 0.03877703206562267,
"grad_norm": 0.5122260451316833,
"learning_rate": 8.763798791745411e-06,
"loss": 1.1279,
"step": 39
},
{
"epoch": 0.03877703206562267,
"eval_loss": 1.0933287143707275,
"eval_runtime": 34.2822,
"eval_samples_per_second": 12.368,
"eval_steps_per_second": 6.184,
"step": 39
},
{
"epoch": 0.039771314939100175,
"grad_norm": 0.5207390785217285,
"learning_rate": 7.3223304703363135e-06,
"loss": 0.85,
"step": 40
},
{
"epoch": 0.04076559781257768,
"grad_norm": 0.49141305685043335,
"learning_rate": 5.989850859999227e-06,
"loss": 0.8256,
"step": 41
},
{
"epoch": 0.041759880686055184,
"grad_norm": 0.49803686141967773,
"learning_rate": 4.7745751406263165e-06,
"loss": 1.0561,
"step": 42
},
{
"epoch": 0.04275416355953269,
"grad_norm": 0.5928795337677002,
"learning_rate": 3.6839958911476957e-06,
"loss": 1.0151,
"step": 43
},
{
"epoch": 0.043748446433010194,
"grad_norm": 0.4802905023097992,
"learning_rate": 2.7248368952908053e-06,
"loss": 0.9441,
"step": 44
},
{
"epoch": 0.0447427293064877,
"grad_norm": 0.45927828550338745,
"learning_rate": 1.9030116872178316e-06,
"loss": 0.9223,
"step": 45
},
{
"epoch": 0.0457370121799652,
"grad_norm": 0.5768618583679199,
"learning_rate": 1.2235870926211619e-06,
"loss": 1.1136,
"step": 46
},
{
"epoch": 0.04673129505344271,
"grad_norm": 0.6009936332702637,
"learning_rate": 6.907519900580861e-07,
"loss": 1.1245,
"step": 47
},
{
"epoch": 0.047725577926920205,
"grad_norm": 0.9392962455749512,
"learning_rate": 3.077914851215585e-07,
"loss": 1.2505,
"step": 48
},
{
"epoch": 0.04871986080039771,
"grad_norm": 0.5324287414550781,
"learning_rate": 7.706665667180091e-08,
"loss": 0.8628,
"step": 49
},
{
"epoch": 0.049714143673875215,
"grad_norm": 0.4643092751502991,
"learning_rate": 0.0,
"loss": 0.9188,
"step": 50
}
],
"logging_steps": 1,
"max_steps": 50,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 13,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 1.7547965428137984e+16,
"train_batch_size": 2,
"trial_name": null,
"trial_params": null
}