segopecelus's picture
Training in progress, step 100, checkpoint
d154406 verified
Raw
History Blame Contribute Delete
104 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.001043231513937573,
"eval_steps": 500,
"global_step": 100,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 77.0,
"completions/mean_length": 215.5625,
"completions/mean_terminated_length": 40.333335876464844,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 1.043231513937573e-05,
"grad_norm": 3.116075277328491,
"kl": 0.0,
"learning_rate": 0.0,
"loss": -0.0,
"num_tokens": 4429.0,
"reward": -1128.118896484375,
"reward_std": 470.49481201171875,
"rewards/reward_low_readability/mean": -20.625831604003906,
"rewards/reward_low_readability/std": 98.52398681640625,
"rewards/reward_specific_word_count/mean": -111.75,
"rewards/reward_specific_word_count/std": 74.1489486694336,
"step": 1
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"epoch": 2.086463027875146e-05,
"grad_norm": 0.7325745820999146,
"kl": 0.0,
"learning_rate": 5.4259359739555076e-08,
"loss": -0.0,
"num_tokens": 9837.0,
"reward": -1365.1912841796875,
"reward_std": 244.79977416992188,
"rewards/reward_low_readability/mean": -41.88323211669922,
"rewards/reward_low_readability/std": 60.33129119873047,
"rewards/reward_specific_word_count/mean": -117.4375,
"rewards/reward_specific_word_count/std": 92.49646759033203,
"step": 2
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 208.1875,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 3.129694541812719e-05,
"grad_norm": 35.65803146362305,
"kl": 4.357156649348326e-05,
"learning_rate": 1.0851871947911015e-07,
"loss": 0.0001,
"num_tokens": 14092.0,
"reward": -1770.83984375,
"reward_std": 713.3043823242188,
"rewards/reward_low_readability/mean": -62.78662109375,
"rewards/reward_low_readability/std": 37.30530548095703,
"rewards/reward_specific_word_count/mean": -143.4375,
"rewards/reward_specific_word_count/std": 62.55234909057617,
"step": 3
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 31.0,
"completions/mean_length": 226.0,
"completions/mean_terminated_length": 16.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 4.172926055750292e-05,
"grad_norm": 22.61669921875,
"kl": 3.202973311999813e-05,
"learning_rate": 1.627780792186652e-07,
"loss": 0.0,
"num_tokens": 18264.0,
"reward": -1524.101318359375,
"reward_std": 445.14788818359375,
"rewards/reward_low_readability/mean": -18.155059814453125,
"rewards/reward_low_readability/std": 76.89763641357422,
"rewards/reward_specific_word_count/mean": -161.1875,
"rewards/reward_specific_word_count/std": 67.30648040771484,
"step": 4
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 215.0,
"completions/mean_length": 238.5625,
"completions/mean_terminated_length": 116.5,
"completions/min_length": 18.0,
"completions/min_terminated_length": 18.0,
"epoch": 5.216157569687865e-05,
"grad_norm": 1.2145802974700928,
"kl": 0.0001450929557904601,
"learning_rate": 2.170374389582203e-07,
"loss": 0.0,
"num_tokens": 23829.0,
"reward": -1430.60595703125,
"reward_std": 426.89300537109375,
"rewards/reward_low_readability/mean": -69.15066528320312,
"rewards/reward_low_readability/std": 45.1233024597168,
"rewards/reward_specific_word_count/mean": -96.5,
"rewards/reward_specific_word_count/std": 52.94147872924805,
"step": 5
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 240.0625,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 6.259389083625437e-05,
"grad_norm": 12.537487983703613,
"kl": 6.895691331010312e-05,
"learning_rate": 2.712967986977754e-07,
"loss": 0.0,
"num_tokens": 28346.0,
"reward": -1678.09521484375,
"reward_std": 487.72100830078125,
"rewards/reward_low_readability/mean": -60.49693298339844,
"rewards/reward_low_readability/std": 66.87584686279297,
"rewards/reward_specific_word_count/mean": -134.875,
"rewards/reward_specific_word_count/std": 46.0374870300293,
"step": 6
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"epoch": 7.302620597563011e-05,
"grad_norm": 0.43996697664260864,
"kl": 4.689001070801169e-05,
"learning_rate": 3.255561584373304e-07,
"loss": 0.0,
"num_tokens": 33550.0,
"reward": -2127.757568359375,
"reward_std": 87.09275817871094,
"rewards/reward_low_readability/mean": -89.56026458740234,
"rewards/reward_low_readability/std": 17.40915870666504,
"rewards/reward_specific_word_count/mean": -157.5,
"rewards/reward_specific_word_count/std": 27.446918487548828,
"step": 7
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 240.0625,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 8.345852111500584e-05,
"grad_norm": 4.328232288360596,
"kl": 0.00012008107296423987,
"learning_rate": 3.7981551817688554e-07,
"loss": 0.0,
"num_tokens": 37851.0,
"reward": 4776.02783203125,
"reward_std": 11956.513671875,
"rewards/reward_low_readability/mean": 615.5344848632812,
"rewards/reward_low_readability/std": 2624.773193359375,
"rewards/reward_specific_word_count/mean": -82.375,
"rewards/reward_specific_word_count/std": 68.31776428222656,
"step": 8
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 82.0,
"completions/mean_length": 217.75,
"completions/mean_terminated_length": 52.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 9.389083625438158e-05,
"grad_norm": 14.562159538269043,
"kl": 7.363433542195708e-05,
"learning_rate": 4.340748779164406e-07,
"loss": 0.0,
"num_tokens": 42295.0,
"reward": -1692.26123046875,
"reward_std": 510.28326416015625,
"rewards/reward_low_readability/mean": -51.27372741699219,
"rewards/reward_low_readability/std": 57.220726013183594,
"rewards/reward_specific_word_count/mean": -146.25,
"rewards/reward_specific_word_count/std": 65.00615692138672,
"step": 9
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.5625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 108.0,
"completions/mean_length": 151.625,
"completions/mean_terminated_length": 17.428571701049805,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0001043231513937573,
"grad_norm": 25.861047744750977,
"kl": 8.863252151058987e-05,
"learning_rate": 4.883342376559957e-07,
"loss": 0.0001,
"num_tokens": 45349.0,
"reward": -1099.74462890625,
"reward_std": 657.3480834960938,
"rewards/reward_low_readability/mean": -22.7237491607666,
"rewards/reward_low_readability/std": 71.08831787109375,
"rewards/reward_specific_word_count/mean": -106.1875,
"rewards/reward_specific_word_count/std": 92.0124740600586,
"step": 10
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 9.0,
"completions/mean_length": 225.125,
"completions/mean_terminated_length": 9.0,
"completions/min_length": 9.0,
"completions/min_terminated_length": 9.0,
"epoch": 0.00011475546653313303,
"grad_norm": 0.6688202023506165,
"kl": 8.420701487921178e-05,
"learning_rate": 5.425935973955508e-07,
"loss": 0.0,
"num_tokens": 49831.0,
"reward": -1563.089111328125,
"reward_std": 425.3297119140625,
"rewards/reward_low_readability/mean": -59.9229736328125,
"rewards/reward_low_readability/std": 56.443939208984375,
"rewards/reward_specific_word_count/mean": -121.875,
"rewards/reward_specific_word_count/std": 78.31464385986328,
"step": 11
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 240.0625,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00012518778167250875,
"grad_norm": 14.104875564575195,
"kl": 0.0001285510661546141,
"learning_rate": 5.968529571351058e-07,
"loss": 0.0,
"num_tokens": 56240.0,
"reward": -1787.055908203125,
"reward_std": 482.546142578125,
"rewards/reward_low_readability/mean": -49.03947448730469,
"rewards/reward_low_readability/std": 66.18172454833984,
"rewards/reward_specific_word_count/mean": -159.8125,
"rewards/reward_specific_word_count/std": 36.73366928100586,
"step": 12
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 141.0,
"completions/mean_length": 172.75,
"completions/mean_terminated_length": 34.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0001356200968118845,
"grad_norm": 20.868867874145508,
"kl": 0.00012886863260064274,
"learning_rate": 6.511123168746608e-07,
"loss": 0.0,
"num_tokens": 60628.0,
"reward": -1590.338623046875,
"reward_std": 618.2061767578125,
"rewards/reward_low_readability/mean": -67.62364196777344,
"rewards/reward_low_readability/std": 44.79562759399414,
"rewards/reward_specific_word_count/mean": -117.0,
"rewards/reward_specific_word_count/std": 72.57180786132812,
"step": 13
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 121.0,
"completions/mean_length": 188.5625,
"completions/mean_terminated_length": 40.20000076293945,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00014605241195126022,
"grad_norm": 5.3643012046813965,
"kl": 7.277987606357783e-05,
"learning_rate": 7.05371676614216e-07,
"loss": 0.0,
"num_tokens": 64409.0,
"reward": -1366.1121826171875,
"reward_std": 333.2947998046875,
"rewards/reward_low_readability/mean": -56.72589874267578,
"rewards/reward_low_readability/std": 37.3091926574707,
"rewards/reward_specific_word_count/mean": -101.9375,
"rewards/reward_specific_word_count/std": 66.78170013427734,
"step": 14
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 201.0,
"completions/mean_length": 236.625,
"completions/mean_terminated_length": 101.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00015648472709063596,
"grad_norm": 11.075088500976562,
"kl": 0.00012062583846272901,
"learning_rate": 7.596310363537711e-07,
"loss": 0.0,
"num_tokens": 68863.0,
"reward": -1534.3162841796875,
"reward_std": 689.2556762695312,
"rewards/reward_low_readability/mean": -47.05866241455078,
"rewards/reward_low_readability/std": 73.16483306884766,
"rewards/reward_specific_word_count/mean": -132.0,
"rewards/reward_specific_word_count/std": 63.71917724609375,
"step": 15
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 240.0625,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00016691704223001168,
"grad_norm": 10.888772964477539,
"kl": 3.6886009183945134e-05,
"learning_rate": 8.138903960933261e-07,
"loss": 0.0,
"num_tokens": 73604.0,
"reward": -1571.33251953125,
"reward_std": 296.05303955078125,
"rewards/reward_low_readability/mean": -34.40303421020508,
"rewards/reward_low_readability/std": 43.51613998413086,
"rewards/reward_specific_word_count/mean": -149.6875,
"rewards/reward_specific_word_count/std": 75.11299896240234,
"step": 16
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 214.0,
"completions/mean_length": 199.25,
"completions/mean_terminated_length": 104.66667175292969,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0001773493573693874,
"grad_norm": 11.976936340332031,
"kl": 0.00011671230458887294,
"learning_rate": 8.681497558328812e-07,
"loss": 0.0,
"num_tokens": 77580.0,
"reward": -1179.322021484375,
"reward_std": 635.15185546875,
"rewards/reward_low_readability/mean": -49.20691680908203,
"rewards/reward_low_readability/std": 42.294532775878906,
"rewards/reward_specific_word_count/mean": -87.75,
"rewards/reward_specific_word_count/std": 76.5562973022461,
"step": 17
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 224.125,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00018778167250876315,
"grad_norm": 7.336621284484863,
"kl": 0.00011110626655863598,
"learning_rate": 9.224091155724363e-07,
"loss": 0.0,
"num_tokens": 82170.0,
"reward": -1194.943115234375,
"reward_std": 351.89019775390625,
"rewards/reward_low_readability/mean": -30.51943588256836,
"rewards/reward_low_readability/std": 76.87674713134766,
"rewards/reward_specific_word_count/mean": -109.25,
"rewards/reward_specific_word_count/std": 50.710289001464844,
"step": 18
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 9.0,
"completions/mean_length": 240.5625,
"completions/mean_terminated_length": 9.0,
"completions/min_length": 9.0,
"completions/min_terminated_length": 9.0,
"epoch": 0.00019821398764813887,
"grad_norm": 0.9089562296867371,
"kl": 0.00011611125955823809,
"learning_rate": 9.766684753119915e-07,
"loss": 0.0,
"num_tokens": 86947.0,
"reward": -1660.5302734375,
"reward_std": 474.4580383300781,
"rewards/reward_low_readability/mean": -31.301502227783203,
"rewards/reward_low_readability/std": 98.33365631103516,
"rewards/reward_specific_word_count/mean": -163.5,
"rewards/reward_specific_word_count/std": 77.3399429321289,
"step": 19
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.75,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 192.25,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0002086463027875146,
"grad_norm": 15.376219749450684,
"kl": 0.0002759218623396009,
"learning_rate": 1.0309278350515464e-06,
"loss": 0.0,
"num_tokens": 91879.0,
"reward": -1081.755859375,
"reward_std": 707.2537841796875,
"rewards/reward_low_readability/mean": -32.943336486816406,
"rewards/reward_low_readability/std": 37.37092590332031,
"rewards/reward_specific_word_count/mean": -93.3125,
"rewards/reward_specific_word_count/std": 67.99188232421875,
"step": 20
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 212.0,
"completions/mean_length": 231.625,
"completions/mean_terminated_length": 126.0,
"completions/min_length": 56.0,
"completions/min_terminated_length": 56.0,
"epoch": 0.00021907861792689034,
"grad_norm": 0.5069727301597595,
"kl": 0.00015435941168107092,
"learning_rate": 1.0851871947911016e-06,
"loss": 0.0,
"num_tokens": 96725.0,
"reward": -1716.53759765625,
"reward_std": 471.2628479003906,
"rewards/reward_low_readability/mean": -47.28852844238281,
"rewards/reward_low_readability/std": 60.63616180419922,
"rewards/reward_specific_word_count/mean": -153.3125,
"rewards/reward_specific_word_count/std": 56.15540313720703,
"step": 21
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 225.0,
"completions/mean_length": 238.125,
"completions/mean_terminated_length": 113.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00022951093306626606,
"grad_norm": 16.18548583984375,
"kl": 9.116272121900693e-05,
"learning_rate": 1.1394465545306566e-06,
"loss": 0.0,
"num_tokens": 101623.0,
"reward": -1692.0335693359375,
"reward_std": 495.6037292480469,
"rewards/reward_low_readability/mean": -77.39810943603516,
"rewards/reward_low_readability/std": 47.293209075927734,
"rewards/reward_specific_word_count/mean": -118.75,
"rewards/reward_specific_word_count/std": 50.080604553222656,
"step": 22
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.75,
"completions/max_length": 256.0,
"completions/max_terminated_length": 245.0,
"completions/mean_length": 223.6875,
"completions/mean_terminated_length": 126.75,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0002399432482056418,
"grad_norm": 5.936621189117432,
"kl": 0.00011039651144528762,
"learning_rate": 1.1937059142702115e-06,
"loss": 0.0,
"num_tokens": 106034.0,
"reward": -1258.808349609375,
"reward_std": 403.8445129394531,
"rewards/reward_low_readability/mean": -55.11644744873047,
"rewards/reward_low_readability/std": 50.90780258178711,
"rewards/reward_specific_word_count/mean": -90.9375,
"rewards/reward_specific_word_count/std": 63.8565788269043,
"step": 23
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 200.0,
"completions/mean_length": 226.25,
"completions/mean_terminated_length": 97.33333587646484,
"completions/min_length": 16.0,
"completions/min_terminated_length": 16.0,
"epoch": 0.0002503755633450175,
"grad_norm": 0.9666721820831299,
"kl": 4.7124882257776335e-05,
"learning_rate": 1.2479652740097667e-06,
"loss": 0.0,
"num_tokens": 110266.0,
"reward": -1554.1080322265625,
"reward_std": 117.8116455078125,
"rewards/reward_low_readability/mean": -8.039182662963867,
"rewards/reward_low_readability/std": 118.39151763916016,
"rewards/reward_specific_word_count/mean": -175.375,
"rewards/reward_specific_word_count/std": 61.93423843383789,
"step": 24
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.5625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 194.0,
"completions/mean_length": 158.4375,
"completions/mean_terminated_length": 33.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00026080787848439325,
"grad_norm": 11.492411613464355,
"kl": 6.501660391222686e-05,
"learning_rate": 1.3022246337493217e-06,
"loss": 0.0,
"num_tokens": 113397.0,
"reward": -1307.615234375,
"reward_std": 481.21038818359375,
"rewards/reward_low_readability/mean": -35.22883224487305,
"rewards/reward_low_readability/std": 50.54848861694336,
"rewards/reward_specific_word_count/mean": -117.625,
"rewards/reward_specific_word_count/std": 78.67899322509766,
"step": 25
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.75,
"completions/max_length": 256.0,
"completions/max_terminated_length": 36.0,
"completions/mean_length": 194.4375,
"completions/mean_terminated_length": 9.75,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.000271240193623769,
"grad_norm": 8.740335464477539,
"kl": 0.0001171851108665578,
"learning_rate": 1.3564839934888768e-06,
"loss": 0.0,
"num_tokens": 117144.0,
"reward": -1663.29833984375,
"reward_std": 807.4056396484375,
"rewards/reward_low_readability/mean": -52.88941192626953,
"rewards/reward_low_readability/std": 62.03939437866211,
"rewards/reward_specific_word_count/mean": -141.125,
"rewards/reward_specific_word_count/std": 76.2337417602539,
"step": 26
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 52.0,
"completions/mean_length": 230.125,
"completions/mean_terminated_length": 49.0,
"completions/min_length": 46.0,
"completions/min_terminated_length": 46.0,
"epoch": 0.00028167250876314474,
"grad_norm": 0.5862599611282349,
"kl": 0.00014979529078118503,
"learning_rate": 1.410743353228432e-06,
"loss": 0.0,
"num_tokens": 121902.0,
"reward": -1325.30908203125,
"reward_std": 497.59112548828125,
"rewards/reward_low_readability/mean": -66.8160629272461,
"rewards/reward_low_readability/std": 66.24189758300781,
"rewards/reward_specific_word_count/mean": -86.5,
"rewards/reward_specific_word_count/std": 72.85144805908203,
"step": 27
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 110.0,
"completions/mean_length": 184.4375,
"completions/mean_terminated_length": 27.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00029210482390252043,
"grad_norm": 7.910543918609619,
"kl": 4.9107158702099696e-05,
"learning_rate": 1.4650027129679872e-06,
"loss": 0.0,
"num_tokens": 125897.0,
"reward": -1512.8238525390625,
"reward_std": 579.8395385742188,
"rewards/reward_low_readability/mean": -66.6309814453125,
"rewards/reward_low_readability/std": 34.86317443847656,
"rewards/reward_specific_word_count/mean": -108.875,
"rewards/reward_specific_word_count/std": 71.21224212646484,
"step": 28
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 134.0,
"completions/mean_length": 248.375,
"completions/mean_terminated_length": 134.0,
"completions/min_length": 134.0,
"completions/min_terminated_length": 134.0,
"epoch": 0.0003025371390418962,
"grad_norm": 0.2557351291179657,
"kl": 5.268407039693557e-05,
"learning_rate": 1.5192620727075421e-06,
"loss": 0.0,
"num_tokens": 132011.0,
"reward": -1484.5543212890625,
"reward_std": 208.53460693359375,
"rewards/reward_low_readability/mean": -61.608856201171875,
"rewards/reward_low_readability/std": 30.13274574279785,
"rewards/reward_specific_word_count/mean": -110.8125,
"rewards/reward_specific_word_count/std": 50.29144287109375,
"step": 29
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 205.0,
"completions/mean_length": 249.25,
"completions/mean_terminated_length": 202.0,
"completions/min_length": 199.0,
"completions/min_terminated_length": 199.0,
"epoch": 0.00031296945418127193,
"grad_norm": 0.38031476736068726,
"kl": 8.317234460264444e-05,
"learning_rate": 1.5735214324470973e-06,
"loss": 0.0,
"num_tokens": 137867.0,
"reward": -1329.0670166015625,
"reward_std": 365.8032531738281,
"rewards/reward_low_readability/mean": -62.54362487792969,
"rewards/reward_low_readability/std": 45.93696594238281,
"rewards/reward_specific_word_count/mean": -91.4375,
"rewards/reward_specific_word_count/std": 43.317386627197266,
"step": 30
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 73.0,
"completions/mean_length": 183.25,
"completions/mean_terminated_length": 23.200000762939453,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0003234017693206476,
"grad_norm": 17.897735595703125,
"kl": 0.00017116851813625544,
"learning_rate": 1.6277807921866523e-06,
"loss": 0.0004,
"num_tokens": 141971.0,
"reward": -1314.925537109375,
"reward_std": 799.48876953125,
"rewards/reward_low_readability/mean": -40.805625915527344,
"rewards/reward_low_readability/std": 61.764320373535156,
"rewards/reward_specific_word_count/mean": -112.625,
"rewards/reward_specific_word_count/std": 77.52666473388672,
"step": 31
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.5,
"completions/max_length": 256.0,
"completions/max_terminated_length": 223.0,
"completions/mean_length": 162.0625,
"completions/mean_terminated_length": 68.125,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00033383408446002337,
"grad_norm": 4.922853946685791,
"kl": 0.00043209161958657205,
"learning_rate": 1.6820401519262075e-06,
"loss": 0.0,
"num_tokens": 146712.0,
"reward": -1309.0557861328125,
"reward_std": 620.997802734375,
"rewards/reward_low_readability/mean": -42.344390869140625,
"rewards/reward_low_readability/std": 53.9526252746582,
"rewards/reward_specific_word_count/mean": -110.3125,
"rewards/reward_specific_word_count/std": 71.82823944091797,
"step": 32
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 209.0,
"completions/mean_length": 200.6875,
"completions/mean_terminated_length": 79.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0003442663995993991,
"grad_norm": 12.44471549987793,
"kl": 0.0001600706164026633,
"learning_rate": 1.7362995116657624e-06,
"loss": 0.0003,
"num_tokens": 150947.0,
"reward": -1336.0352783203125,
"reward_std": 613.1881713867188,
"rewards/reward_low_readability/mean": -39.91130065917969,
"rewards/reward_low_readability/std": 55.41373062133789,
"rewards/reward_specific_word_count/mean": -116.0625,
"rewards/reward_specific_word_count/std": 71.41472625732422,
"step": 33
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.4375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 145.0,
"completions/mean_length": 131.125,
"completions/mean_terminated_length": 34.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0003546987147387748,
"grad_norm": 14.646148681640625,
"kl": 0.00031026199576444924,
"learning_rate": 1.7905588714053176e-06,
"loss": 0.0003,
"num_tokens": 153869.0,
"reward": -1317.27587890625,
"reward_std": 615.8418579101562,
"rewards/reward_low_readability/mean": -52.48089599609375,
"rewards/reward_low_readability/std": 40.30464553833008,
"rewards/reward_specific_word_count/mean": -100.625,
"rewards/reward_specific_word_count/std": 82.35765838623047,
"step": 34
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 1.0,
"completions/max_length": 256.0,
"completions/max_terminated_length": 0.0,
"completions/mean_length": 256.0,
"completions/mean_terminated_length": 0.0,
"completions/min_length": 256.0,
"completions/min_terminated_length": 0.0,
"epoch": 0.00036513102987815056,
"grad_norm": 0.38337433338165283,
"kl": 6.300251698121428e-05,
"learning_rate": 1.8448182311448726e-06,
"loss": 0.0,
"num_tokens": 159157.0,
"reward": -1441.5721435546875,
"reward_std": 313.5174560546875,
"rewards/reward_low_readability/mean": -55.16960144042969,
"rewards/reward_low_readability/std": 48.26046371459961,
"rewards/reward_specific_word_count/mean": -112.5,
"rewards/reward_specific_word_count/std": 57.63447952270508,
"step": 35
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.5,
"completions/max_length": 256.0,
"completions/max_terminated_length": 98.0,
"completions/mean_length": 144.1875,
"completions/mean_terminated_length": 32.375,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0003755633450175263,
"grad_norm": 18.974363327026367,
"kl": 0.000380511162802577,
"learning_rate": 1.8990775908844277e-06,
"loss": 0.0008,
"num_tokens": 162448.0,
"reward": -726.256103515625,
"reward_std": 486.916259765625,
"rewards/reward_low_readability/mean": -21.543712615966797,
"rewards/reward_low_readability/std": 62.35931396484375,
"rewards/reward_specific_word_count/mean": -63.25,
"rewards/reward_specific_word_count/std": 67.31765747070312,
"step": 36
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.75,
"completions/max_length": 256.0,
"completions/max_terminated_length": 223.0,
"completions/mean_length": 223.5625,
"completions/mean_terminated_length": 126.25,
"completions/min_length": 12.0,
"completions/min_terminated_length": 12.0,
"epoch": 0.000385995660156902,
"grad_norm": 0.931634783744812,
"kl": 0.0002483692660462111,
"learning_rate": 1.953336950623983e-06,
"loss": 0.0,
"num_tokens": 168385.0,
"reward": -1797.49072265625,
"reward_std": 414.14501953125,
"rewards/reward_low_readability/mean": -78.74040985107422,
"rewards/reward_low_readability/std": 15.449604034423828,
"rewards/reward_specific_word_count/mean": -129.8125,
"rewards/reward_specific_word_count/std": 60.728050231933594,
"step": 37
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 205.0,
"completions/mean_length": 191.0,
"completions/mean_terminated_length": 48.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00039642797529627774,
"grad_norm": 19.3518123626709,
"kl": 0.00041339112794958055,
"learning_rate": 2.0075963103635377e-06,
"loss": 0.0012,
"num_tokens": 173001.0,
"reward": -748.7278442382812,
"reward_std": 486.0341796875,
"rewards/reward_low_readability/mean": -20.089380264282227,
"rewards/reward_low_readability/std": 53.406497955322266,
"rewards/reward_specific_word_count/mean": -67.4375,
"rewards/reward_specific_word_count/std": 49.281463623046875,
"step": 38
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.8125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 252.0,
"completions/mean_length": 223.875,
"completions/mean_terminated_length": 84.66667175292969,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0004068602904356535,
"grad_norm": 20.79539680480957,
"kl": 0.00038716691778972745,
"learning_rate": 2.061855670103093e-06,
"loss": 0.0014,
"num_tokens": 180223.0,
"reward": -1375.142333984375,
"reward_std": 313.77252197265625,
"rewards/reward_low_readability/mean": -61.72351837158203,
"rewards/reward_low_readability/std": 28.64412498474121,
"rewards/reward_specific_word_count/mean": -97.75,
"rewards/reward_specific_word_count/std": 50.2692756652832,
"step": 39
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.4375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 27.0,
"completions/mean_length": 114.8125,
"completions/mean_terminated_length": 5.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0004172926055750292,
"grad_norm": 9.421210289001465,
"kl": 0.001418656320311129,
"learning_rate": 2.116115029842648e-06,
"loss": 0.0032,
"num_tokens": 183028.0,
"reward": -972.0180053710938,
"reward_std": 349.5052490234375,
"rewards/reward_low_readability/mean": -41.04463195800781,
"rewards/reward_low_readability/std": 43.99871826171875,
"rewards/reward_specific_word_count/mean": -71.8125,
"rewards/reward_specific_word_count/std": 65.82220458984375,
"step": 40
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.5,
"completions/max_length": 256.0,
"completions/max_terminated_length": 152.0,
"completions/mean_length": 160.75,
"completions/mean_terminated_length": 65.5,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00042772492071440493,
"grad_norm": 18.048540115356445,
"kl": 0.001094095641747117,
"learning_rate": 2.170374389582203e-06,
"loss": 0.0034,
"num_tokens": 186644.0,
"reward": -1590.6693115234375,
"reward_std": 610.5465087890625,
"rewards/reward_low_readability/mean": -65.87787628173828,
"rewards/reward_low_readability/std": 35.292118072509766,
"rewards/reward_specific_word_count/mean": -118.875,
"rewards/reward_specific_word_count/std": 79.31529998779297,
"step": 41
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.4375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 109.0,
"completions/mean_length": 119.3125,
"completions/mean_terminated_length": 13.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0004381572358537807,
"grad_norm": 16.86764144897461,
"kl": 0.0014386159600690007,
"learning_rate": 2.224633749321758e-06,
"loss": 0.0041,
"num_tokens": 189861.0,
"reward": -1076.30615234375,
"reward_std": 540.96337890625,
"rewards/reward_low_readability/mean": -40.59135818481445,
"rewards/reward_low_readability/std": 49.7451286315918,
"rewards/reward_specific_word_count/mean": -84.625,
"rewards/reward_specific_word_count/std": 65.67382049560547,
"step": 42
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.3125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 115.0,
"completions/mean_length": 106.4375,
"completions/mean_terminated_length": 38.45454788208008,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0004485895509931564,
"grad_norm": 10.557600021362305,
"kl": 0.0019954631570726633,
"learning_rate": 2.278893109061313e-06,
"loss": 0.0047,
"num_tokens": 192432.0,
"reward": -670.5653686523438,
"reward_std": 271.6889953613281,
"rewards/reward_low_readability/mean": -27.166015625,
"rewards/reward_low_readability/std": 75.52755737304688,
"rewards/reward_specific_word_count/mean": -50.75,
"rewards/reward_specific_word_count/std": 64.67818450927734,
"step": 43
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 211.0,
"completions/mean_length": 193.0,
"completions/mean_terminated_length": 54.400001525878906,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0004590218661325321,
"grad_norm": 14.496274948120117,
"kl": 0.001399551285430789,
"learning_rate": 2.3331524688008683e-06,
"loss": 0.0022,
"num_tokens": 196608.0,
"reward": -1102.9404296875,
"reward_std": 252.52029418945312,
"rewards/reward_low_readability/mean": -47.68796157836914,
"rewards/reward_low_readability/std": 39.12522888183594,
"rewards/reward_specific_word_count/mean": -80.3125,
"rewards/reward_specific_word_count/std": 66.10771179199219,
"step": 44
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.75,
"completions/max_length": 256.0,
"completions/max_terminated_length": 26.0,
"completions/mean_length": 193.8125,
"completions/mean_terminated_length": 7.25,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00046945418127190787,
"grad_norm": 2.1914143562316895,
"kl": 0.0009878488490357995,
"learning_rate": 2.387411828540423e-06,
"loss": 0.001,
"num_tokens": 200617.0,
"reward": -1138.33984375,
"reward_std": 199.418701171875,
"rewards/reward_low_readability/mean": -44.537845611572266,
"rewards/reward_low_readability/std": 28.145658493041992,
"rewards/reward_specific_word_count/mean": -87.8125,
"rewards/reward_specific_word_count/std": 66.30255889892578,
"step": 45
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.9375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 55.0,
"completions/mean_length": 243.4375,
"completions/mean_terminated_length": 55.0,
"completions/min_length": 55.0,
"completions/min_terminated_length": 55.0,
"epoch": 0.0004798864964112836,
"grad_norm": 0.8396442532539368,
"kl": 0.00035423407098278403,
"learning_rate": 2.441671188279978e-06,
"loss": 0.0,
"num_tokens": 205692.0,
"reward": -1660.6640625,
"reward_std": 220.03701782226562,
"rewards/reward_low_readability/mean": -81.1798095703125,
"rewards/reward_low_readability/std": 23.520084381103516,
"rewards/reward_specific_word_count/mean": -111.0625,
"rewards/reward_specific_word_count/std": 70.02710723876953,
"step": 46
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 221.0,
"completions/mean_length": 176.9375,
"completions/mean_terminated_length": 45.16666793823242,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0004903188115506594,
"grad_norm": 16.060352325439453,
"kl": 0.003470352850854397,
"learning_rate": 2.4959305480195334e-06,
"loss": 0.0084,
"num_tokens": 209587.0,
"reward": -1416.0599365234375,
"reward_std": 529.0692138671875,
"rewards/reward_low_readability/mean": -20.26629638671875,
"rewards/reward_low_readability/std": 68.69774627685547,
"rewards/reward_specific_word_count/mean": -146.1875,
"rewards/reward_specific_word_count/std": 85.36605072021484,
"step": 47
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.5625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 186.0,
"completions/mean_length": 157.1875,
"completions/mean_terminated_length": 30.142858505249023,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.000500751126690035,
"grad_norm": 12.295141220092773,
"kl": 0.004097023047506809,
"learning_rate": 2.5501899077590886e-06,
"loss": 0.0159,
"num_tokens": 212634.0,
"reward": -885.1611328125,
"reward_std": 491.8056640625,
"rewards/reward_low_readability/mean": -20.69620704650879,
"rewards/reward_low_readability/std": 61.445213317871094,
"rewards/reward_specific_word_count/mean": -82.9375,
"rewards/reward_specific_word_count/std": 53.38972473144531,
"step": 48
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.3125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 10.0,
"completions/mean_length": 81.25,
"completions/mean_terminated_length": 1.8181818723678589,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005111834418294107,
"grad_norm": 7.574562072753906,
"kl": 0.005608655977994204,
"learning_rate": 2.6044492674986433e-06,
"loss": 0.0136,
"num_tokens": 214798.0,
"reward": -934.0018920898438,
"reward_std": 425.8517761230469,
"rewards/reward_low_readability/mean": -30.70657730102539,
"rewards/reward_low_readability/std": 41.986534118652344,
"rewards/reward_specific_word_count/mean": -78.1875,
"rewards/reward_specific_word_count/std": 75.45260620117188,
"step": 49
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.5,
"completions/max_length": 256.0,
"completions/max_terminated_length": 167.0,
"completions/mean_length": 165.25,
"completions/mean_terminated_length": 74.5,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005216157569687865,
"grad_norm": 28.46733283996582,
"kl": 0.004315289668738842,
"learning_rate": 2.6587086272381985e-06,
"loss": 0.0159,
"num_tokens": 218950.0,
"reward": -1533.265869140625,
"reward_std": 730.51953125,
"rewards/reward_low_readability/mean": -69.46516418457031,
"rewards/reward_low_readability/std": 47.496620178222656,
"rewards/reward_specific_word_count/mean": -108.3125,
"rewards/reward_specific_word_count/std": 65.97344970703125,
"step": 50
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 141.0,
"completions/mean_length": 36.1875,
"completions/mean_terminated_length": 21.533334732055664,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005320480721081622,
"grad_norm": 5.060064792633057,
"kl": 0.050300780683755875,
"learning_rate": 2.7129679869777537e-06,
"loss": 0.0406,
"num_tokens": 220849.0,
"reward": -457.37628173828125,
"reward_std": 292.492431640625,
"rewards/reward_low_readability/mean": -15.429636001586914,
"rewards/reward_low_readability/std": 33.87491226196289,
"rewards/reward_specific_word_count/mean": -37.875,
"rewards/reward_specific_word_count/std": 22.192716598510742,
"step": 51
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.6875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 160.0,
"completions/mean_length": 193.75,
"completions/mean_terminated_length": 56.79999923706055,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.000542480387247538,
"grad_norm": 18.62675666809082,
"kl": 0.0037125309463590384,
"learning_rate": 2.767227346717309e-06,
"loss": 0.0039,
"num_tokens": 225329.0,
"reward": -1356.0279541015625,
"reward_std": 598.28369140625,
"rewards/reward_low_readability/mean": -27.30211067199707,
"rewards/reward_low_readability/std": 67.8597640991211,
"rewards/reward_specific_word_count/mean": -131.6875,
"rewards/reward_specific_word_count/std": 85.32582092285156,
"step": 52
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.1875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 164.0,
"completions/mean_length": 73.0625,
"completions/mean_terminated_length": 30.846155166625977,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005529127023869137,
"grad_norm": 11.114861488342285,
"kl": 0.03665463998913765,
"learning_rate": 2.821486706456864e-06,
"loss": 0.0222,
"num_tokens": 227706.0,
"reward": -645.3734130859375,
"reward_std": 337.88226318359375,
"rewards/reward_low_readability/mean": -43.350616455078125,
"rewards/reward_low_readability/std": 51.19852066040039,
"rewards/reward_specific_word_count/mean": -30.75,
"rewards/reward_specific_word_count/std": 24.91719627380371,
"step": 53
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 200.0,
"completions/mean_length": 52.5,
"completions/mean_terminated_length": 23.428571701049805,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005633450175262895,
"grad_norm": 14.395307540893555,
"kl": 0.028542926535010338,
"learning_rate": 2.875746066196419e-06,
"loss": 0.0452,
"num_tokens": 229378.0,
"reward": -347.86859130859375,
"reward_std": 76.22853088378906,
"rewards/reward_low_readability/mean": 19.115177154541016,
"rewards/reward_low_readability/std": 47.22098159790039,
"rewards/reward_specific_word_count/mean": -61.25,
"rewards/reward_specific_word_count/std": 66.90740203857422,
"step": 54
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.1875,
"completions/max_length": 256.0,
"completions/max_terminated_length": 137.0,
"completions/mean_length": 64.0625,
"completions/mean_terminated_length": 19.76923179626465,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005737773326656651,
"grad_norm": 6.916282653808594,
"kl": 0.019411267712712288,
"learning_rate": 2.9300054259359744e-06,
"loss": 0.0267,
"num_tokens": 231395.0,
"reward": -631.5985717773438,
"reward_std": 264.7860107421875,
"rewards/reward_low_readability/mean": -12.441933631896973,
"rewards/reward_low_readability/std": 52.4868049621582,
"rewards/reward_specific_word_count/mean": -61.625,
"rewards/reward_specific_word_count/std": 73.85650634765625,
"step": 55
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.3125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 82.0,
"completions/mean_length": 92.625,
"completions/mean_terminated_length": 18.363636016845703,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005842096478050409,
"grad_norm": 14.530932426452637,
"kl": 0.02121676504611969,
"learning_rate": 2.984264785675529e-06,
"loss": 0.0391,
"num_tokens": 234173.0,
"reward": -601.1956176757812,
"reward_std": 349.0436706542969,
"rewards/reward_low_readability/mean": -2.5441713333129883,
"rewards/reward_low_readability/std": 78.83867645263672,
"rewards/reward_specific_word_count/mean": -68.4375,
"rewards/reward_specific_word_count/std": 80.67710876464844,
"step": 56
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 31.0,
"completions/mean_length": 18.8125,
"completions/mean_terminated_length": 3.000000238418579,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0005946419629444166,
"grad_norm": 4.208057880401611,
"kl": 0.06698984652757645,
"learning_rate": 3.0385241454150843e-06,
"loss": 0.0456,
"num_tokens": 235258.0,
"reward": -257.79888916015625,
"reward_std": 9.812307357788086,
"rewards/reward_low_readability/mean": -1.7178125381469727,
"rewards/reward_low_readability/std": 6.871250629425049,
"rewards/reward_specific_word_count/mean": -28.6875,
"rewards/reward_specific_word_count/std": 4.989572525024414,
"step": 57
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.3125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 242.0,
"completions/mean_length": 106.1875,
"completions/mean_terminated_length": 38.090911865234375,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006050742780837924,
"grad_norm": 1.458182454109192,
"kl": 0.014654525555670261,
"learning_rate": 3.0927835051546395e-06,
"loss": 0.03,
"num_tokens": 239513.0,
"reward": -905.8972778320312,
"reward_std": 111.06556701660156,
"rewards/reward_low_readability/mean": -32.53766632080078,
"rewards/reward_low_readability/std": 33.659584045410156,
"rewards/reward_specific_word_count/mean": -72.9375,
"rewards/reward_specific_word_count/std": 59.865928649902344,
"step": 58
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.375,
"completions/max_length": 256.0,
"completions/max_terminated_length": 99.0,
"completions/mean_length": 102.75,
"completions/mean_terminated_length": 10.800000190734863,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006155065932231681,
"grad_norm": 8.706275939941406,
"kl": 0.016249507665634155,
"learning_rate": 3.1470428648941946e-06,
"loss": 0.051,
"num_tokens": 242929.0,
"reward": -575.1182861328125,
"reward_std": 337.33343505859375,
"rewards/reward_low_readability/mean": 1.3993167877197266,
"rewards/reward_low_readability/std": 48.57197189331055,
"rewards/reward_specific_word_count/mean": -69.5,
"rewards/reward_specific_word_count/std": 57.34922409057617,
"step": 59
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 221.0,
"completions/mean_length": 46.9375,
"completions/mean_terminated_length": 17.071430206298828,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006259389083625439,
"grad_norm": 14.822925567626953,
"kl": 0.05036020651459694,
"learning_rate": 3.2013022246337494e-06,
"loss": 0.0685,
"num_tokens": 244448.0,
"reward": -401.9443054199219,
"reward_std": 186.5824432373047,
"rewards/reward_low_readability/mean": 16.004375457763672,
"rewards/reward_low_readability/std": 62.41549301147461,
"rewards/reward_specific_word_count/mean": -64.375,
"rewards/reward_specific_word_count/std": 74.6233901977539,
"step": 60
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 177.0,
"completions/max_terminated_length": 177.0,
"completions/mean_length": 35.6875,
"completions/mean_terminated_length": 35.6875,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006363712235019195,
"grad_norm": 8.174490928649902,
"kl": 0.08172713965177536,
"learning_rate": 3.2555615843733046e-06,
"loss": 0.0448,
"num_tokens": 247479.0,
"reward": -501.93878173828125,
"reward_std": 200.37503051757812,
"rewards/reward_low_readability/mean": -21.69005584716797,
"rewards/reward_low_readability/std": 51.4937744140625,
"rewards/reward_specific_word_count/mean": -36.5625,
"rewards/reward_specific_word_count/std": 28.795761108398438,
"step": 61
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 165.0,
"completions/mean_length": 46.875,
"completions/mean_terminated_length": 17.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006468035386412952,
"grad_norm": 1.387884259223938,
"kl": 0.10506534576416016,
"learning_rate": 3.3098209441128597e-06,
"loss": 0.0455,
"num_tokens": 249429.0,
"reward": -580.0169677734375,
"reward_std": 163.1900177001953,
"rewards/reward_low_readability/mean": -22.983810424804688,
"rewards/reward_low_readability/std": 37.06683349609375,
"rewards/reward_specific_word_count/mean": -44.4375,
"rewards/reward_specific_word_count/std": 39.337799072265625,
"step": 62
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 190.0,
"completions/mean_length": 43.9375,
"completions/mean_terminated_length": 29.80000114440918,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.000657235853780671,
"grad_norm": 27.271936416625977,
"kl": 0.0525495670735836,
"learning_rate": 3.364080303852415e-06,
"loss": 0.0647,
"num_tokens": 251620.0,
"reward": -440.24383544921875,
"reward_std": 235.23062133789062,
"rewards/reward_low_readability/mean": -12.195096015930176,
"rewards/reward_low_readability/std": 22.676860809326172,
"rewards/reward_specific_word_count/mean": -39.25,
"rewards/reward_specific_word_count/std": 24.858264923095703,
"step": 63
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 7.0,
"completions/max_terminated_length": 7.0,
"completions/mean_length": 1.4375,
"completions/mean_terminated_length": 1.4375,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006676681689200467,
"grad_norm": 7.845202922821045,
"kl": 1.7137255668640137,
"learning_rate": 3.4183396635919697e-06,
"loss": 0.0793,
"num_tokens": 253015.0,
"reward": -296.749755859375,
"reward_std": 86.25439453125,
"rewards/reward_low_readability/mean": -5.207499980926514,
"rewards/reward_low_readability/std": 20.830001831054688,
"rewards/reward_specific_word_count/mean": -29.625,
"rewards/reward_specific_word_count/std": 1.5,
"step": 64
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 10.0,
"completions/max_terminated_length": 10.0,
"completions/mean_length": 1.5625,
"completions/mean_terminated_length": 1.5625,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006781004840594225,
"grad_norm": 8.946924209594727,
"kl": 1.1556893587112427,
"learning_rate": 3.472599023331525e-06,
"loss": 0.0608,
"num_tokens": 253988.0,
"reward": -286.81964111328125,
"reward_std": 66.39413452148438,
"rewards/reward_low_readability/mean": -4.150000095367432,
"rewards/reward_low_readability/std": 16.600000381469727,
"rewards/reward_specific_word_count/mean": -29.5625,
"rewards/reward_specific_word_count/std": 1.7500001192092896,
"step": 65
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 27.0,
"completions/max_terminated_length": 27.0,
"completions/mean_length": 2.625,
"completions/mean_terminated_length": 2.625,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0006885327991987982,
"grad_norm": 7.504082679748535,
"kl": 0.806298553943634,
"learning_rate": 3.52685838307108e-06,
"loss": 0.0691,
"num_tokens": 254918.0,
"reward": -275.9803466796875,
"reward_std": 44.71552276611328,
"rewards/reward_low_readability/mean": -3.881711959838867,
"rewards/reward_low_readability/std": 15.526847839355469,
"rewards/reward_specific_word_count/mean": -28.5625,
"rewards/reward_specific_word_count/std": 5.75,
"step": 66
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.000698965114338174,
"grad_norm": 0.2544586658477783,
"kl": 2.291349172592163,
"learning_rate": 3.581117742810635e-06,
"loss": 0.0917,
"num_tokens": 255790.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 67
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 90.0,
"completions/max_terminated_length": 90.0,
"completions/mean_length": 15.4375,
"completions/mean_terminated_length": 15.4375,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007093974294775496,
"grad_norm": 1.4970295429229736,
"kl": 0.14874514937400818,
"learning_rate": 3.63537710255019e-06,
"loss": 0.0452,
"num_tokens": 257905.0,
"reward": -288.9488525390625,
"reward_std": 196.3872528076172,
"rewards/reward_low_readability/mean": -7.8959641456604,
"rewards/reward_low_readability/std": 41.48566436767578,
"rewards/reward_specific_word_count/mean": -25.875,
"rewards/reward_specific_word_count/std": 7.500000476837158,
"step": 68
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007198297446169254,
"grad_norm": 0.10731889307498932,
"kl": 3.1512694358825684,
"learning_rate": 3.689636462289745e-06,
"loss": 0.1261,
"num_tokens": 258685.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 69
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.125,
"completions/max_length": 256.0,
"completions/max_terminated_length": 85.0,
"completions/mean_length": 38.9375,
"completions/mean_terminated_length": 7.928571701049805,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007302620597563011,
"grad_norm": 12.733834266662598,
"kl": 0.06529513001441956,
"learning_rate": 3.7438958220293003e-06,
"loss": 0.0796,
"num_tokens": 260704.0,
"reward": -512.6383056640625,
"reward_std": 308.03497314453125,
"rewards/reward_low_readability/mean": -14.691946983337402,
"rewards/reward_low_readability/std": 34.66056823730469,
"rewards/reward_specific_word_count/mean": -45.1875,
"rewards/reward_specific_word_count/std": 44.377498626708984,
"step": 70
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 145.0,
"completions/max_terminated_length": 145.0,
"completions/mean_length": 10.0,
"completions/mean_terminated_length": 10.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007406943748956769,
"grad_norm": 0.79555344581604,
"kl": 0.4680936932563782,
"learning_rate": 3.7981551817688555e-06,
"loss": 0.1112,
"num_tokens": 261824.0,
"reward": -303.60260009765625,
"reward_std": 99.95997619628906,
"rewards/reward_low_readability/mean": -5.800000190734863,
"rewards/reward_low_readability/std": 23.200000762939453,
"rewards/reward_specific_word_count/mean": -29.8125,
"rewards/reward_specific_word_count/std": 0.75,
"step": 71
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 46.0,
"completions/max_terminated_length": 46.0,
"completions/mean_length": 3.8125,
"completions/mean_terminated_length": 3.8125,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007511266900350526,
"grad_norm": 17.116613388061523,
"kl": 0.8612356781959534,
"learning_rate": 3.85241454150841e-06,
"loss": 0.1125,
"num_tokens": 263041.0,
"reward": -277.9287109375,
"reward_std": 48.61220932006836,
"rewards/reward_low_readability/mean": -4.041428565979004,
"rewards/reward_low_readability/std": 16.16571617126465,
"rewards/reward_specific_word_count/mean": -28.625,
"rewards/reward_specific_word_count/std": 5.5,
"step": 72
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 74.0,
"completions/max_terminated_length": 74.0,
"completions/mean_length": 9.4375,
"completions/mean_terminated_length": 9.4375,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007615590051744284,
"grad_norm": 28.762662887573242,
"kl": 0.46599653363227844,
"learning_rate": 3.906673901247966e-06,
"loss": 0.111,
"num_tokens": 265272.0,
"reward": -540.5789794921875,
"reward_std": 182.03289794921875,
"rewards/reward_low_readability/mean": -35.30762481689453,
"rewards/reward_low_readability/std": 48.363677978515625,
"rewards/reward_specific_word_count/mean": -26.8125,
"rewards/reward_specific_word_count/std": 6.472699165344238,
"step": 73
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.000771991320313804,
"grad_norm": 0.18072064220905304,
"kl": 3.3317298889160156,
"learning_rate": 3.9609332609875206e-06,
"loss": 0.1333,
"num_tokens": 266816.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 74
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007824236354531797,
"grad_norm": 0.12160932272672653,
"kl": 2.724215269088745,
"learning_rate": 4.015192620727075e-06,
"loss": 0.109,
"num_tokens": 268332.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 75
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 11.0,
"completions/max_terminated_length": 11.0,
"completions/mean_length": 1.625,
"completions/mean_terminated_length": 1.625,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0007928559505925555,
"grad_norm": 10.181412696838379,
"kl": 1.5883467197418213,
"learning_rate": 4.069451980466631e-06,
"loss": 0.0836,
"num_tokens": 271378.0,
"reward": -301.0523681640625,
"reward_std": 94.8595199584961,
"rewards/reward_low_readability/mean": -5.810312271118164,
"rewards/reward_low_readability/std": 23.241249084472656,
"rewards/reward_specific_word_count/mean": -29.5,
"rewards/reward_specific_word_count/std": 2.0,
"step": 76
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 11.0,
"completions/max_terminated_length": 11.0,
"completions/mean_length": 1.75,
"completions/mean_terminated_length": 1.75,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008032882657319312,
"grad_norm": 14.311753273010254,
"kl": 4.948127269744873,
"learning_rate": 4.123711340206186e-06,
"loss": 0.116,
"num_tokens": 272798.0,
"reward": -305.9605712890625,
"reward_std": 106.78951263427734,
"rewards/reward_low_readability/mean": -6.481249809265137,
"rewards/reward_low_readability/std": 25.92500114440918,
"rewards/reward_specific_word_count/mean": -29.375,
"rewards/reward_specific_word_count/std": 2.247220516204834,
"step": 77
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.000813720580871307,
"grad_norm": 0.04783467948436737,
"kl": 1.0950071811676025,
"learning_rate": 4.17797069994574e-06,
"loss": 0.0438,
"num_tokens": 273686.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 78
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008241528960106827,
"grad_norm": 0.5884016752243042,
"kl": 2.9877357482910156,
"learning_rate": 4.232230059685296e-06,
"loss": 0.1195,
"num_tokens": 276330.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 79
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008345852111500584,
"grad_norm": 0.3785717785358429,
"kl": 2.680081844329834,
"learning_rate": 4.286489419424851e-06,
"loss": 0.1072,
"num_tokens": 277898.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 80
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 20.0,
"completions/max_terminated_length": 20.0,
"completions/mean_length": 3.8125,
"completions/mean_terminated_length": 3.8125,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008450175262894341,
"grad_norm": 5.6763176918029785,
"kl": 1.1832798719406128,
"learning_rate": 4.340748779164406e-06,
"loss": 0.1376,
"num_tokens": 280479.0,
"reward": -461.22906494140625,
"reward_std": 61.63878631591797,
"rewards/reward_low_readability/mean": -25.490936279296875,
"rewards/reward_low_readability/std": 46.52744674682617,
"rewards/reward_specific_word_count/mean": -27.75,
"rewards/reward_specific_word_count/std": 5.24722146987915,
"step": 81
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008554498414288099,
"grad_norm": 0.16531629860401154,
"kl": 1.0629717111587524,
"learning_rate": 4.395008138903961e-06,
"loss": 0.0425,
"num_tokens": 281639.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 82
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008658821565681856,
"grad_norm": 0.24120379984378815,
"kl": 2.6601531505584717,
"learning_rate": 4.449267498643516e-06,
"loss": 0.1064,
"num_tokens": 283307.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 83
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 68.0,
"completions/max_terminated_length": 68.0,
"completions/mean_length": 7.0625,
"completions/mean_terminated_length": 7.0625,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008763144717075614,
"grad_norm": 20.75030517578125,
"kl": 0.5461198687553406,
"learning_rate": 4.5035268583830715e-06,
"loss": 0.0938,
"num_tokens": 286028.0,
"reward": -389.6133117675781,
"reward_std": 192.99569702148438,
"rewards/reward_low_readability/mean": -16.960208892822266,
"rewards/reward_low_readability/std": 35.151248931884766,
"rewards/reward_specific_word_count/mean": -28.25,
"rewards/reward_specific_word_count/std": 4.234776973724365,
"step": 84
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008867467868469371,
"grad_norm": 0.05817558243870735,
"kl": 2.3842148780822754,
"learning_rate": 4.557786218122626e-06,
"loss": 0.0954,
"num_tokens": 286968.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 85
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0008971791019863129,
"grad_norm": 0.026225591078400612,
"kl": 2.4678921699523926,
"learning_rate": 4.612045577862181e-06,
"loss": 0.0987,
"num_tokens": 288392.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 86
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009076114171256885,
"grad_norm": 0.3092615306377411,
"kl": 2.4480156898498535,
"learning_rate": 4.6663049376017366e-06,
"loss": 0.0979,
"num_tokens": 289696.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 87
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2.0,
"completions/max_terminated_length": 2.0,
"completions/mean_length": 1.0625,
"completions/mean_terminated_length": 1.0625,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009180437322650642,
"grad_norm": 12.76836109161377,
"kl": 3.5473947525024414,
"learning_rate": 4.720564297341291e-06,
"loss": 0.107,
"num_tokens": 290421.0,
"reward": -253.09420776367188,
"reward_std": 1.056761384010315,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -29.9375,
"rewards/reward_specific_word_count/std": 0.25,
"step": 88
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00092847604740444,
"grad_norm": 0.0388258695602417,
"kl": 2.5978360176086426,
"learning_rate": 4.774823657080846e-06,
"loss": 0.1039,
"num_tokens": 291253.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 89
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 10.0,
"completions/max_terminated_length": 10.0,
"completions/mean_length": 1.625,
"completions/mean_terminated_length": 1.625,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009389083625438157,
"grad_norm": 12.29962158203125,
"kl": 1.314690351486206,
"learning_rate": 4.829083016820402e-06,
"loss": 0.0671,
"num_tokens": 292307.0,
"reward": -315.62451171875,
"reward_std": 125.41680145263672,
"rewards/reward_low_readability/mean": -7.449375152587891,
"rewards/reward_low_readability/std": 29.797502517700195,
"rewards/reward_specific_word_count/mean": -29.5,
"rewards/reward_specific_word_count/std": 1.7511900663375854,
"step": 90
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009493406776831915,
"grad_norm": 0.05062209442257881,
"kl": 2.413003444671631,
"learning_rate": 4.883342376559956e-06,
"loss": 0.0965,
"num_tokens": 293467.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 91
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 65.0,
"completions/max_terminated_length": 65.0,
"completions/mean_length": 5.0,
"completions/mean_terminated_length": 5.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009597729928225672,
"grad_norm": 3.8311307430267334,
"kl": 0.4238208830356598,
"learning_rate": 4.937601736299512e-06,
"loss": 0.0715,
"num_tokens": 295211.0,
"reward": -272.92193603515625,
"reward_std": 38.59866714477539,
"rewards/reward_low_readability/mean": -3.4188392162323,
"rewards/reward_low_readability/std": 13.675357818603516,
"rewards/reward_specific_word_count/mean": -28.6875,
"rewards/reward_specific_word_count/std": 5.25,
"step": 92
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2.0,
"completions/max_terminated_length": 2.0,
"completions/mean_length": 1.25,
"completions/mean_terminated_length": 1.25,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009702053079619429,
"grad_norm": 0.20084361732006073,
"kl": 2.759641408920288,
"learning_rate": 4.991861096039067e-06,
"loss": 0.1106,
"num_tokens": 296219.0,
"reward": -251.50906372070312,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -29.75,
"rewards/reward_specific_word_count/std": 0.44721361994743347,
"step": 93
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009806376231013187,
"grad_norm": 0.04589000716805458,
"kl": 3.5816192626953125,
"learning_rate": 5.0461204557786215e-06,
"loss": 0.1433,
"num_tokens": 296863.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 94
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0009910699382406944,
"grad_norm": 0.12416376173496246,
"kl": 2.0825138092041016,
"learning_rate": 5.100379815518177e-06,
"loss": 0.0833,
"num_tokens": 297707.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 95
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.00100150225338007,
"grad_norm": 0.07444979250431061,
"kl": 1.7208746671676636,
"learning_rate": 5.154639175257732e-06,
"loss": 0.0688,
"num_tokens": 298727.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 96
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 1.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 1.0,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0010119345685194459,
"grad_norm": 0.11053499579429626,
"kl": 3.6163582801818848,
"learning_rate": 5.208898534997287e-06,
"loss": 0.1447,
"num_tokens": 299731.0,
"reward": -253.62258911132812,
"reward_std": 0.0,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -30.0,
"rewards/reward_specific_word_count/std": 0.0,
"step": 97
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 44.0,
"completions/max_terminated_length": 44.0,
"completions/mean_length": 4.3125,
"completions/mean_terminated_length": 4.3125,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0010223668836588215,
"grad_norm": 15.969858169555664,
"kl": 0.6320419311523438,
"learning_rate": 5.263157894736842e-06,
"loss": 0.0719,
"num_tokens": 301116.0,
"reward": -424.38104248046875,
"reward_std": 125.56963348388672,
"rewards/reward_low_readability/mean": -19.9793758392334,
"rewards/reward_low_readability/std": 43.877864837646484,
"rewards/reward_specific_word_count/mean": -29.1875,
"rewards/reward_specific_word_count/std": 2.5091500282287598,
"step": 98
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0,
"completions/max_length": 2.0,
"completions/max_terminated_length": 2.0,
"completions/mean_length": 1.0625,
"completions/mean_terminated_length": 1.0625,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.0010327991987981973,
"grad_norm": 16.042072296142578,
"kl": 2.1820735931396484,
"learning_rate": 5.317417254476397e-06,
"loss": 0.0832,
"num_tokens": 302137.0,
"reward": -253.09420776367188,
"reward_std": 1.056761384010315,
"rewards/reward_low_readability/mean": 0.0,
"rewards/reward_low_readability/std": 0.0,
"rewards/reward_specific_word_count/mean": -29.9375,
"rewards/reward_specific_word_count/std": 0.25,
"step": 99
},
{
"clip_ratio/high_max": 0.0,
"clip_ratio/high_mean": 0.0,
"clip_ratio/low_mean": 0.0,
"clip_ratio/low_min": 0.0,
"clip_ratio/region_mean": 0.0,
"completions/clipped_ratio": 0.0625,
"completions/max_length": 256.0,
"completions/max_terminated_length": 1.0,
"completions/mean_length": 16.9375,
"completions/mean_terminated_length": 1.0,
"completions/min_length": 1.0,
"completions/min_terminated_length": 1.0,
"epoch": 0.001043231513937573,
"grad_norm": 3.023735761642456,
"kl": 0.203212708234787,
"learning_rate": 5.3716766142159526e-06,
"loss": 0.1337,
"num_tokens": 303028.0,
"reward": -294.38037109375,
"reward_std": 81.51558685302734,
"rewards/reward_low_readability/mean": -1.8505398035049438,
"rewards/reward_low_readability/std": 7.402159214019775,
"rewards/reward_specific_word_count/mean": -32.875,
"rewards/reward_specific_word_count/std": 11.5,
"step": 100
}
],
"logging_steps": 1,
"max_steps": 100,
"num_input_tokens_seen": 303028,
"num_train_epochs": 1,
"save_steps": 1843,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 16,
"trial_name": null,
"trial_params": null
}