Qwen2.5-7B-class5 / trainer_state.json
watermelonhjg's picture
Upload folder using huggingface_hub
e2776e1 verified
Raw
History Blame Contribute Delete
124 kB
{
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 1.0,
"eval_steps": 10,
"global_step": 288,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"completion_length": 741.770866394043,
"epoch": 0.003472222222222222,
"grad_norm": 0.14295190572738647,
"kl": 0.0,
"learning_rate": 1.0344827586206897e-07,
"loss": 0.1884,
"reward": 1.1458333432674408,
"reward_std": 0.33713918551802635,
"rewards/accuracy_reward": 0.3750000111758709,
"rewards/format_reward": 0.7708333432674408,
"step": 1
},
{
"completion_length": 569.3750076293945,
"epoch": 0.006944444444444444,
"grad_norm": 0.15209616720676422,
"kl": 0.0,
"learning_rate": 2.0689655172413793e-07,
"loss": 0.084,
"reward": 1.375,
"reward_std": 0.34609566628932953,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.8958333432674408,
"step": 2
},
{
"completion_length": 910.6875381469727,
"epoch": 0.010416666666666666,
"grad_norm": 0.14200489223003387,
"kl": 3.3035874366760254e-05,
"learning_rate": 3.103448275862069e-07,
"loss": 0.1972,
"reward": 1.2083333656191826,
"reward_std": 0.3977733254432678,
"rewards/accuracy_reward": 0.5416666865348816,
"rewards/format_reward": 0.666666679084301,
"step": 3
},
{
"completion_length": 1090.9792022705078,
"epoch": 0.013888888888888888,
"grad_norm": 0.14168737828731537,
"kl": 2.1979212760925293e-05,
"learning_rate": 4.1379310344827586e-07,
"loss": 0.2496,
"reward": 0.958333358168602,
"reward_std": 0.5603352189064026,
"rewards/accuracy_reward": 0.2708333395421505,
"rewards/format_reward": 0.6875000149011612,
"step": 4
},
{
"completion_length": 874.5833435058594,
"epoch": 0.017361111111111112,
"grad_norm": 0.1556071788072586,
"kl": 2.1822750568389893e-05,
"learning_rate": 5.172413793103449e-07,
"loss": 0.2382,
"reward": 1.1250000298023224,
"reward_std": 0.5055268257856369,
"rewards/accuracy_reward": 0.3750000074505806,
"rewards/format_reward": 0.7500000298023224,
"step": 5
},
{
"completion_length": 782.0833435058594,
"epoch": 0.020833333333333332,
"grad_norm": 0.13410623371601105,
"kl": 2.975761890411377e-05,
"learning_rate": 6.206896551724138e-07,
"loss": 0.2206,
"reward": 1.1666666865348816,
"reward_std": 0.45878127589821815,
"rewards/accuracy_reward": 0.3333333469927311,
"rewards/format_reward": 0.833333358168602,
"step": 6
},
{
"completion_length": 865.7500152587891,
"epoch": 0.024305555555555556,
"grad_norm": 0.14228324592113495,
"kl": 3.835558891296387e-05,
"learning_rate": 7.241379310344829e-07,
"loss": 0.1384,
"reward": 0.9583333730697632,
"reward_std": 0.39372341707348824,
"rewards/accuracy_reward": 0.18750000186264515,
"rewards/format_reward": 0.770833358168602,
"step": 7
},
{
"completion_length": 789.3333778381348,
"epoch": 0.027777777777777776,
"grad_norm": 0.1659800410270691,
"kl": 5.2928924560546875e-05,
"learning_rate": 8.275862068965517e-07,
"loss": 0.2217,
"reward": 1.0000000298023224,
"reward_std": 0.4655914157629013,
"rewards/accuracy_reward": 0.2500000111758709,
"rewards/format_reward": 0.7500000149011612,
"step": 8
},
{
"completion_length": 580.5625152587891,
"epoch": 0.03125,
"grad_norm": 0.12579208612442017,
"kl": 4.9740076065063477e-05,
"learning_rate": 9.310344827586207e-07,
"loss": 0.1162,
"reward": 1.5000000298023224,
"reward_std": 0.3332235887646675,
"rewards/accuracy_reward": 0.6041666716337204,
"rewards/format_reward": 0.8958333432674408,
"step": 9
},
{
"completion_length": 629.1458435058594,
"epoch": 0.034722222222222224,
"grad_norm": 0.17187905311584473,
"kl": 4.869699478149414e-05,
"learning_rate": 1.0344827586206898e-06,
"loss": 0.1916,
"reward": 1.2291667014360428,
"reward_std": 0.4688647650182247,
"rewards/accuracy_reward": 0.3958333395421505,
"rewards/format_reward": 0.833333358168602,
"step": 10
},
{
"completion_length": 784.0416870117188,
"epoch": 0.03819444444444445,
"grad_norm": 0.17849187552928925,
"kl": 5.3048133850097656e-05,
"learning_rate": 1.1379310344827587e-06,
"loss": 0.4343,
"reward": 1.0625000149011612,
"reward_std": 0.5581847056746483,
"rewards/accuracy_reward": 0.3125000074505806,
"rewards/format_reward": 0.7500000149011612,
"step": 11
},
{
"completion_length": 995.1458435058594,
"epoch": 0.041666666666666664,
"grad_norm": 0.20440581440925598,
"kl": 5.9485435485839844e-05,
"learning_rate": 1.2413793103448275e-06,
"loss": 0.1746,
"reward": 0.8958333507180214,
"reward_std": 0.5718096792697906,
"rewards/accuracy_reward": 0.25000000558793545,
"rewards/format_reward": 0.645833358168602,
"step": 12
},
{
"completion_length": 931.0000152587891,
"epoch": 0.04513888888888889,
"grad_norm": 0.14080987870693207,
"kl": 7.534027099609375e-05,
"learning_rate": 1.3448275862068966e-06,
"loss": 0.2987,
"reward": 1.0625000298023224,
"reward_std": 0.43706150352954865,
"rewards/accuracy_reward": 0.3958333395421505,
"rewards/format_reward": 0.6666666716337204,
"step": 13
},
{
"completion_length": 962.5625305175781,
"epoch": 0.04861111111111111,
"grad_norm": 0.10382459312677383,
"kl": 4.079937934875488e-05,
"learning_rate": 1.4482758620689657e-06,
"loss": 0.2287,
"reward": 1.1875000447034836,
"reward_std": 0.47216174751520157,
"rewards/accuracy_reward": 0.4583333358168602,
"rewards/format_reward": 0.7291667014360428,
"step": 14
},
{
"completion_length": 1093.5416870117188,
"epoch": 0.052083333333333336,
"grad_norm": 0.17387475073337555,
"kl": 5.698204040527344e-05,
"learning_rate": 1.5517241379310346e-06,
"loss": 0.2892,
"reward": 0.833333358168602,
"reward_std": 0.5643851384520531,
"rewards/accuracy_reward": 0.27083334140479565,
"rewards/format_reward": 0.5625000074505806,
"step": 15
},
{
"completion_length": 841.4583435058594,
"epoch": 0.05555555555555555,
"grad_norm": 0.17102335393428802,
"kl": 0.0001055002212524414,
"learning_rate": 1.6551724137931035e-06,
"loss": 0.4448,
"reward": 0.9375000298023224,
"reward_std": 0.6173017770051956,
"rewards/accuracy_reward": 0.18750000186264515,
"rewards/format_reward": 0.7500000298023224,
"step": 16
},
{
"completion_length": 668.8125152587891,
"epoch": 0.059027777777777776,
"grad_norm": 0.1323493868112564,
"kl": 0.00011396408081054688,
"learning_rate": 1.7586206896551723e-06,
"loss": 0.1694,
"reward": 1.3750000298023224,
"reward_std": 0.18404608592391014,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.8750000149011612,
"step": 17
},
{
"completion_length": 764.0417022705078,
"epoch": 0.0625,
"grad_norm": 0.16820357739925385,
"kl": 0.0001246929168701172,
"learning_rate": 1.8620689655172414e-06,
"loss": 0.2849,
"reward": 1.1875000298023224,
"reward_std": 0.5668945834040642,
"rewards/accuracy_reward": 0.35416667722165585,
"rewards/format_reward": 0.8333333432674408,
"step": 18
},
{
"completion_length": 492.29168701171875,
"epoch": 0.06597222222222222,
"grad_norm": 0.23659060895442963,
"kl": 0.00019979476928710938,
"learning_rate": 1.9655172413793105e-06,
"loss": 0.0967,
"reward": 1.3333333730697632,
"reward_std": 0.48326630145311356,
"rewards/accuracy_reward": 0.37500001303851604,
"rewards/format_reward": 0.9583333432674408,
"step": 19
},
{
"completion_length": 765.0833587646484,
"epoch": 0.06944444444444445,
"grad_norm": 0.15367941558361053,
"kl": 0.0003204345703125,
"learning_rate": 2.0689655172413796e-06,
"loss": 0.1026,
"reward": 1.208333358168602,
"reward_std": 0.40823066234588623,
"rewards/accuracy_reward": 0.35416666977107525,
"rewards/format_reward": 0.8541666865348816,
"step": 20
},
{
"completion_length": 855.1041870117188,
"epoch": 0.07291666666666667,
"grad_norm": 0.14101287722587585,
"kl": 0.0004773139953613281,
"learning_rate": 2.1724137931034482e-06,
"loss": 0.2814,
"reward": 1.1875000596046448,
"reward_std": 0.6385418735444546,
"rewards/accuracy_reward": 0.41666667722165585,
"rewards/format_reward": 0.770833358168602,
"step": 21
},
{
"completion_length": 643.8541946411133,
"epoch": 0.0763888888888889,
"grad_norm": 0.1760379821062088,
"kl": 0.00046443939208984375,
"learning_rate": 2.2758620689655173e-06,
"loss": 0.2163,
"reward": 1.166666716337204,
"reward_std": 0.42428741604089737,
"rewards/accuracy_reward": 0.2916666716337204,
"rewards/format_reward": 0.8750000298023224,
"step": 22
},
{
"completion_length": 706.5208358764648,
"epoch": 0.0798611111111111,
"grad_norm": 0.14137427508831024,
"kl": 0.000720977783203125,
"learning_rate": 2.3793103448275864e-06,
"loss": 0.151,
"reward": 1.2916666716337204,
"reward_std": 0.30074116960167885,
"rewards/accuracy_reward": 0.479166679084301,
"rewards/format_reward": 0.8125000149011612,
"step": 23
},
{
"completion_length": 1077.7916946411133,
"epoch": 0.08333333333333333,
"grad_norm": 0.1112079992890358,
"kl": 0.0012264251708984375,
"learning_rate": 2.482758620689655e-06,
"loss": 0.1373,
"reward": 1.1041666977107525,
"reward_std": 0.47216175869107246,
"rewards/accuracy_reward": 0.5000000149011612,
"rewards/format_reward": 0.6041666828095913,
"step": 24
},
{
"completion_length": 796.0833435058594,
"epoch": 0.08680555555555555,
"grad_norm": 0.1721019446849823,
"kl": 0.0014591217041015625,
"learning_rate": 2.586206896551724e-06,
"loss": 0.339,
"reward": 1.1041666865348816,
"reward_std": 0.5037333369255066,
"rewards/accuracy_reward": 0.31250000558793545,
"rewards/format_reward": 0.7916666865348816,
"step": 25
},
{
"completion_length": 949.2292022705078,
"epoch": 0.09027777777777778,
"grad_norm": 0.21633172035217285,
"kl": 0.002002716064453125,
"learning_rate": 2.6896551724137932e-06,
"loss": 0.3764,
"reward": 0.833333358168602,
"reward_std": 0.45271996408700943,
"rewards/accuracy_reward": 0.14583333395421505,
"rewards/format_reward": 0.6875000149011612,
"step": 26
},
{
"completion_length": 903.5625305175781,
"epoch": 0.09375,
"grad_norm": 0.18209120631217957,
"kl": 0.0035114288330078125,
"learning_rate": 2.793103448275862e-06,
"loss": 0.2553,
"reward": 1.083333358168602,
"reward_std": 0.4661043584346771,
"rewards/accuracy_reward": 0.33333334140479565,
"rewards/format_reward": 0.7500000149011612,
"step": 27
},
{
"completion_length": 840.4167022705078,
"epoch": 0.09722222222222222,
"grad_norm": 0.19374202191829681,
"kl": 0.003124237060546875,
"learning_rate": 2.8965517241379314e-06,
"loss": 0.2207,
"reward": 1.208333358168602,
"reward_std": 0.5256049036979675,
"rewards/accuracy_reward": 0.43750000558793545,
"rewards/format_reward": 0.770833358168602,
"step": 28
},
{
"completion_length": 666.4791946411133,
"epoch": 0.10069444444444445,
"grad_norm": 0.2066318243741989,
"kl": 0.002513885498046875,
"learning_rate": 3e-06,
"loss": 0.1473,
"reward": 1.3750000298023224,
"reward_std": 0.3506578877568245,
"rewards/accuracy_reward": 0.5208333432674408,
"rewards/format_reward": 0.8541666716337204,
"step": 29
},
{
"completion_length": 895.6041870117188,
"epoch": 0.10416666666666667,
"grad_norm": 0.12993822991847992,
"kl": 0.004589080810546875,
"learning_rate": 2.9998896541115324e-06,
"loss": 0.2169,
"reward": 0.9166666865348816,
"reward_std": 0.48566947132349014,
"rewards/accuracy_reward": 0.2083333395421505,
"rewards/format_reward": 0.708333358168602,
"step": 30
},
{
"completion_length": 1015.8333435058594,
"epoch": 0.1076388888888889,
"grad_norm": 0.14162737131118774,
"kl": 0.0057220458984375,
"learning_rate": 2.999558632681083e-06,
"loss": 0.262,
"reward": 0.9375000298023224,
"reward_std": 0.5128131434321404,
"rewards/accuracy_reward": 0.2708333469927311,
"rewards/format_reward": 0.6666666865348816,
"step": 31
},
{
"completion_length": 823.3750152587891,
"epoch": 0.1111111111111111,
"grad_norm": 0.19338518381118774,
"kl": 0.0045013427734375,
"learning_rate": 2.999006984411124e-06,
"loss": 0.1761,
"reward": 1.2500000298023224,
"reward_std": 0.39372342824935913,
"rewards/accuracy_reward": 0.4375000074505806,
"rewards/format_reward": 0.8125000149011612,
"step": 32
},
{
"completion_length": 599.1041946411133,
"epoch": 0.11458333333333333,
"grad_norm": 0.11651767790317535,
"kl": 0.004863739013671875,
"learning_rate": 2.9982347904644796e-06,
"loss": 0.143,
"reward": 1.333333358168602,
"reward_std": 0.36668604612350464,
"rewards/accuracy_reward": 0.45833334885537624,
"rewards/format_reward": 0.8750000149011612,
"step": 33
},
{
"completion_length": 807.2500152587891,
"epoch": 0.11805555555555555,
"grad_norm": 0.16386348009109497,
"kl": 0.00554656982421875,
"learning_rate": 2.997242164452386e-06,
"loss": 0.1953,
"reward": 1.1875000149011612,
"reward_std": 0.36124949902296066,
"rewards/accuracy_reward": 0.37500000558793545,
"rewards/format_reward": 0.8125000298023224,
"step": 34
},
{
"completion_length": 819.1666793823242,
"epoch": 0.12152777777777778,
"grad_norm": 0.12757916748523712,
"kl": 0.006011962890625,
"learning_rate": 2.9960292524177757e-06,
"loss": 0.2062,
"reward": 1.145833358168602,
"reward_std": 0.4711427614092827,
"rewards/accuracy_reward": 0.33333333395421505,
"rewards/format_reward": 0.8125000149011612,
"step": 35
},
{
"completion_length": 730.375,
"epoch": 0.125,
"grad_norm": 0.22184336185455322,
"kl": 0.00624847412109375,
"learning_rate": 2.99459623281379e-06,
"loss": 0.1774,
"reward": 1.3750000298023224,
"reward_std": 0.48566946387290955,
"rewards/accuracy_reward": 0.541666679084301,
"rewards/format_reward": 0.833333358168602,
"step": 36
},
{
"completion_length": 830.8333587646484,
"epoch": 0.1284722222222222,
"grad_norm": 0.12250956892967224,
"kl": 0.00920867919921875,
"learning_rate": 2.992943316477524e-06,
"loss": 0.1244,
"reward": 1.479166716337204,
"reward_std": 0.42872630059719086,
"rewards/accuracy_reward": 0.6666666865348816,
"rewards/format_reward": 0.8125000149011612,
"step": 37
},
{
"completion_length": 797.0416946411133,
"epoch": 0.13194444444444445,
"grad_norm": 0.15244413912296295,
"kl": 0.01052093505859375,
"learning_rate": 2.991070746599007e-06,
"loss": 0.2096,
"reward": 1.041666716337204,
"reward_std": 0.41380148753523827,
"rewards/accuracy_reward": 0.3333333432674408,
"rewards/format_reward": 0.7083333432674408,
"step": 38
},
{
"completion_length": 522.7291946411133,
"epoch": 0.13541666666666666,
"grad_norm": 0.0949152484536171,
"kl": 0.00616455078125,
"learning_rate": 2.988978798685421e-06,
"loss": 0.1237,
"reward": 1.5416666865348816,
"reward_std": 0.19855329766869545,
"rewards/accuracy_reward": 0.6250000055879354,
"rewards/format_reward": 0.9166666716337204,
"step": 39
},
{
"completion_length": 839.8958587646484,
"epoch": 0.1388888888888889,
"grad_norm": 0.20609034597873688,
"kl": 0.0126800537109375,
"learning_rate": 2.986667780520568e-06,
"loss": 0.4117,
"reward": 1.041666716337204,
"reward_std": 0.5922943651676178,
"rewards/accuracy_reward": 0.3125000111758709,
"rewards/format_reward": 0.7291667014360428,
"step": 40
},
{
"completion_length": 765.9375305175781,
"epoch": 0.1423611111111111,
"grad_norm": 0.12492669373750687,
"kl": 0.01329803466796875,
"learning_rate": 2.9841380321195844e-06,
"loss": 0.2425,
"reward": 1.2083333432674408,
"reward_std": 0.32274864614009857,
"rewards/accuracy_reward": 0.4583333358168602,
"rewards/format_reward": 0.7500000149011612,
"step": 41
},
{
"completion_length": 682.2291870117188,
"epoch": 0.14583333333333334,
"grad_norm": 0.39590033888816833,
"kl": 0.00971221923828125,
"learning_rate": 2.9813899256789174e-06,
"loss": 0.0408,
"reward": 1.1458333879709244,
"reward_std": 0.21764283254742622,
"rewards/accuracy_reward": 0.2291666716337204,
"rewards/format_reward": 0.9166666865348816,
"step": 42
},
{
"completion_length": 700.2916946411133,
"epoch": 0.14930555555555555,
"grad_norm": 0.1499091386795044,
"kl": 0.01000213623046875,
"learning_rate": 2.978423865521563e-06,
"loss": 0.1978,
"reward": 1.4583333730697632,
"reward_std": 0.42252586781978607,
"rewards/accuracy_reward": 0.604166679084301,
"rewards/format_reward": 0.8541666865348816,
"step": 43
},
{
"completion_length": 748.7291870117188,
"epoch": 0.1527777777777778,
"grad_norm": 0.1765832006931305,
"kl": 0.01324462890625,
"learning_rate": 2.9752402880375777e-06,
"loss": 0.1777,
"reward": 1.2291667014360428,
"reward_std": 0.41129202023148537,
"rewards/accuracy_reward": 0.416666679084301,
"rewards/format_reward": 0.8125000149011612,
"step": 44
},
{
"completion_length": 653.2916870117188,
"epoch": 0.15625,
"grad_norm": 0.1796155720949173,
"kl": 0.0156707763671875,
"learning_rate": 2.9718396616198768e-06,
"loss": 0.1816,
"reward": 1.3958333730697632,
"reward_std": 0.5367004983127117,
"rewards/accuracy_reward": 0.5000000223517418,
"rewards/format_reward": 0.8958333432674408,
"step": 45
},
{
"completion_length": 822.8750305175781,
"epoch": 0.1597222222222222,
"grad_norm": 0.2125193178653717,
"kl": 0.01458740234375,
"learning_rate": 2.9682224865953187e-06,
"loss": 0.2588,
"reward": 1.1250000149011612,
"reward_std": 0.5796796828508377,
"rewards/accuracy_reward": 0.4375000186264515,
"rewards/format_reward": 0.6875000149011612,
"step": 46
},
{
"completion_length": 614.1875076293945,
"epoch": 0.16319444444444445,
"grad_norm": 0.26946258544921875,
"kl": 0.029876708984375,
"learning_rate": 2.9643892951510922e-06,
"loss": 0.2902,
"reward": 1.3958333730697632,
"reward_std": 0.5642508193850517,
"rewards/accuracy_reward": 0.6041666865348816,
"rewards/format_reward": 0.7916666865348816,
"step": 47
},
{
"completion_length": 679.6666717529297,
"epoch": 0.16666666666666666,
"grad_norm": 0.24444054067134857,
"kl": 0.0352783203125,
"learning_rate": 2.9603406512564172e-06,
"loss": 0.2401,
"reward": 1.1458333730697632,
"reward_std": 0.437806099653244,
"rewards/accuracy_reward": 0.3125000074505806,
"rewards/format_reward": 0.8333333432674408,
"step": 48
},
{
"completion_length": 881.6042022705078,
"epoch": 0.1701388888888889,
"grad_norm": 0.16416701674461365,
"kl": 0.026885986328125,
"learning_rate": 2.956077150579571e-06,
"loss": 0.2443,
"reward": 1.083333358168602,
"reward_std": 0.46722716838121414,
"rewards/accuracy_reward": 0.41666669212281704,
"rewards/format_reward": 0.666666679084301,
"step": 49
},
{
"completion_length": 815.0833435058594,
"epoch": 0.1736111111111111,
"grad_norm": 0.3144943416118622,
"kl": 0.0215911865234375,
"learning_rate": 2.9515994204002487e-06,
"loss": 0.2911,
"reward": 1.0416666865348816,
"reward_std": 0.6468362063169479,
"rewards/accuracy_reward": 0.37500001303851604,
"rewards/format_reward": 0.6666666865348816,
"step": 50
},
{
"completion_length": 730.6666870117188,
"epoch": 0.17708333333333334,
"grad_norm": 0.15091472864151,
"kl": 0.020233154296875,
"learning_rate": 2.946908119517268e-06,
"loss": 0.1565,
"reward": 1.041666716337204,
"reward_std": 0.41783374547958374,
"rewards/accuracy_reward": 0.2708333395421505,
"rewards/format_reward": 0.770833358168602,
"step": 51
},
{
"completion_length": 857.1667022705078,
"epoch": 0.18055555555555555,
"grad_norm": 0.14366847276687622,
"kl": 0.016937255859375,
"learning_rate": 2.9420039381516486e-06,
"loss": 0.2736,
"reward": 1.0833333432674408,
"reward_std": 0.5384852737188339,
"rewards/accuracy_reward": 0.4166666679084301,
"rewards/format_reward": 0.666666679084301,
"step": 52
},
{
"completion_length": 864.5000228881836,
"epoch": 0.1840277777777778,
"grad_norm": 0.19832737743854523,
"kl": 0.016326904296875,
"learning_rate": 2.936887597845057e-06,
"loss": 0.3164,
"reward": 1.2083333730697632,
"reward_std": 0.5621002838015556,
"rewards/accuracy_reward": 0.4166666828095913,
"rewards/format_reward": 0.7916666865348816,
"step": 53
},
{
"completion_length": 899.2916870117188,
"epoch": 0.1875,
"grad_norm": 0.0909123495221138,
"kl": 0.02020263671875,
"learning_rate": 2.9315598513536496e-06,
"loss": 0.1377,
"reward": 1.250000011175871,
"reward_std": 0.16661179810762405,
"rewards/accuracy_reward": 0.520833333954215,
"rewards/format_reward": 0.7291666772216558,
"step": 54
},
{
"completion_length": 1253.0625610351562,
"epoch": 0.1909722222222222,
"grad_norm": 0.22461599111557007,
"kl": 0.027801513671875,
"learning_rate": 2.9260214825373185e-06,
"loss": 0.3105,
"reward": 0.6250000298023224,
"reward_std": 0.6435713469982147,
"rewards/accuracy_reward": 0.14583333767950535,
"rewards/format_reward": 0.479166679084301,
"step": 55
},
{
"completion_length": 1001.875,
"epoch": 0.19444444444444445,
"grad_norm": 0.13491399586200714,
"kl": 0.0212554931640625,
"learning_rate": 2.9202733062443688e-06,
"loss": 0.3115,
"reward": 1.0625000074505806,
"reward_std": 0.5120971575379372,
"rewards/accuracy_reward": 0.43750001676380634,
"rewards/format_reward": 0.6250000260770321,
"step": 56
},
{
"completion_length": 1026.2916717529297,
"epoch": 0.19791666666666666,
"grad_norm": 0.24264831840991974,
"kl": 0.0291290283203125,
"learning_rate": 2.9143161681916264e-06,
"loss": 0.5381,
"reward": 1.0416667088866234,
"reward_std": 0.6881812289357185,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.6041666939854622,
"step": 57
},
{
"completion_length": 730.9167022705078,
"epoch": 0.2013888888888889,
"grad_norm": 0.2211628556251526,
"kl": 0.0186767578125,
"learning_rate": 2.908150944840013e-06,
"loss": 0.2167,
"reward": 1.2083333879709244,
"reward_std": 0.5205380246043205,
"rewards/accuracy_reward": 0.43750000558793545,
"rewards/format_reward": 0.770833358168602,
"step": 58
},
{
"completion_length": 1003.7500305175781,
"epoch": 0.2048611111111111,
"grad_norm": 0.17330045998096466,
"kl": 0.021514892578125,
"learning_rate": 2.9017785432655936e-06,
"loss": 0.1788,
"reward": 1.0625000298023224,
"reward_std": 0.5476993918418884,
"rewards/accuracy_reward": 0.37500001303851604,
"rewards/format_reward": 0.6875000149011612,
"step": 59
},
{
"completion_length": 700.8750152587891,
"epoch": 0.20833333333333334,
"grad_norm": 0.25370052456855774,
"kl": 0.0172576904296875,
"learning_rate": 2.8951999010261185e-06,
"loss": 0.1653,
"reward": 1.3958333730697632,
"reward_std": 0.49705731868743896,
"rewards/accuracy_reward": 0.5833333432674408,
"rewards/format_reward": 0.8125000149011612,
"step": 60
},
{
"completion_length": 1021.8750305175781,
"epoch": 0.21180555555555555,
"grad_norm": 0.15996123850345612,
"kl": 0.0218505859375,
"learning_rate": 2.888415986023086e-06,
"loss": 0.2384,
"reward": 1.0000000149011612,
"reward_std": 0.5873726010322571,
"rewards/accuracy_reward": 0.39583334140479565,
"rewards/format_reward": 0.6041666865348816,
"step": 61
},
{
"completion_length": 1085.1458435058594,
"epoch": 0.2152777777777778,
"grad_norm": 0.2894808053970337,
"kl": 0.023101806640625,
"learning_rate": 2.8814277963593322e-06,
"loss": 0.2188,
"reward": 0.916666716337204,
"reward_std": 0.49983538687229156,
"rewards/accuracy_reward": 0.3541666865348816,
"rewards/format_reward": 0.5625000298023224,
"step": 62
},
{
"completion_length": 553.7916870117188,
"epoch": 0.21875,
"grad_norm": 0.16853806376457214,
"kl": 0.0146942138671875,
"learning_rate": 2.8742363601921877e-06,
"loss": 0.1238,
"reward": 1.3125000447034836,
"reward_std": 0.3627704493701458,
"rewards/accuracy_reward": 0.39583334513008595,
"rewards/format_reward": 0.9166666865348816,
"step": 63
},
{
"completion_length": 781.6875228881836,
"epoch": 0.2222222222222222,
"grad_norm": 0.20429612696170807,
"kl": 0.018341064453125,
"learning_rate": 2.866842735582204e-06,
"loss": 0.2017,
"reward": 1.2291666865348816,
"reward_std": 0.5701745375990868,
"rewards/accuracy_reward": 0.4375000074505806,
"rewards/format_reward": 0.7916666865348816,
"step": 64
},
{
"completion_length": 639.7500152587891,
"epoch": 0.22569444444444445,
"grad_norm": 0.17851890623569489,
"kl": 0.01776123046875,
"learning_rate": 2.859248010337482e-06,
"loss": 0.283,
"reward": 1.2083333730697632,
"reward_std": 0.40751465782523155,
"rewards/accuracy_reward": 0.3750000037252903,
"rewards/format_reward": 0.8333333432674408,
"step": 65
},
{
"completion_length": 988.6458740234375,
"epoch": 0.22916666666666666,
"grad_norm": 0.1674283742904663,
"kl": 0.014739990234375,
"learning_rate": 2.851453301853629e-06,
"loss": 0.216,
"reward": 1.1666667088866234,
"reward_std": 0.42252587899565697,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.6875000223517418,
"step": 66
},
{
"completion_length": 1037.4375305175781,
"epoch": 0.2326388888888889,
"grad_norm": 0.14902418851852417,
"kl": 0.0257568359375,
"learning_rate": 2.8434597569493546e-06,
"loss": 0.3065,
"reward": 1.0000000447034836,
"reward_std": 0.5058967247605324,
"rewards/accuracy_reward": 0.37500000186264515,
"rewards/format_reward": 0.6250000298023224,
"step": 67
},
{
"completion_length": 924.9375305175781,
"epoch": 0.2361111111111111,
"grad_norm": 0.11825034022331238,
"kl": 0.01861572265625,
"learning_rate": 2.8352685516977465e-06,
"loss": 0.2105,
"reward": 1.1041666865348816,
"reward_std": 0.3898078352212906,
"rewards/accuracy_reward": 0.43750000186264515,
"rewards/format_reward": 0.666666679084301,
"step": 68
},
{
"completion_length": 1122.5833587646484,
"epoch": 0.23958333333333334,
"grad_norm": 0.15570542216300964,
"kl": 0.0245819091796875,
"learning_rate": 2.8268808912532317e-06,
"loss": 0.3435,
"reward": 0.9375000223517418,
"reward_std": 0.5876451432704926,
"rewards/accuracy_reward": 0.37500000558793545,
"rewards/format_reward": 0.5625000149011612,
"step": 69
},
{
"completion_length": 1177.7917022705078,
"epoch": 0.24305555555555555,
"grad_norm": 0.16041037440299988,
"kl": 0.028564453125,
"learning_rate": 2.8182980096742684e-06,
"loss": 0.2782,
"reward": 0.770833358168602,
"reward_std": 0.48087164387106895,
"rewards/accuracy_reward": 0.3125000074505806,
"rewards/format_reward": 0.4583333432674408,
"step": 70
},
{
"completion_length": 1269.1875610351562,
"epoch": 0.2465277777777778,
"grad_norm": 0.13235001266002655,
"kl": 0.024261474609375,
"learning_rate": 2.8095211697417823e-06,
"loss": 0.1528,
"reward": 0.7500000298023224,
"reward_std": 0.5446660071611404,
"rewards/accuracy_reward": 0.25000000558793545,
"rewards/format_reward": 0.5000000149011612,
"step": 71
},
{
"completion_length": 1170.6875305175781,
"epoch": 0.25,
"grad_norm": 0.16478340327739716,
"kl": 0.030059814453125,
"learning_rate": 2.8005516627733725e-06,
"loss": 0.3112,
"reward": 0.6875000111758709,
"reward_std": 0.4726746752858162,
"rewards/accuracy_reward": 0.20833333395421505,
"rewards/format_reward": 0.4791666828095913,
"step": 72
},
{
"completion_length": 1296.1667175292969,
"epoch": 0.2534722222222222,
"grad_norm": 0.15644334256649017,
"kl": 0.028564453125,
"learning_rate": 2.791390808433328e-06,
"loss": 0.2968,
"reward": 0.7500000074505806,
"reward_std": 0.5360908359289169,
"rewards/accuracy_reward": 0.31250000186264515,
"rewards/format_reward": 0.4375,
"step": 73
},
{
"completion_length": 1256.3541717529297,
"epoch": 0.2569444444444444,
"grad_norm": 0.15503916144371033,
"kl": 0.02874755859375,
"learning_rate": 2.7820399545384623e-06,
"loss": 0.3103,
"reward": 0.9166667014360428,
"reward_std": 0.6742783933877945,
"rewards/accuracy_reward": 0.4375000111758709,
"rewards/format_reward": 0.4791666716337204,
"step": 74
},
{
"completion_length": 1697.7500305175781,
"epoch": 0.2604166666666667,
"grad_norm": 0.12124615162611008,
"kl": 0.04644775390625,
"learning_rate": 2.7725004768598174e-06,
"loss": 0.2702,
"reward": 0.16666667349636555,
"reward_std": 0.2861081510782242,
"rewards/accuracy_reward": 0.0,
"rewards/format_reward": 0.16666667349636555,
"step": 75
},
{
"completion_length": 935.3333435058594,
"epoch": 0.2638888888888889,
"grad_norm": 0.27098900079727173,
"kl": 0.05230712890625,
"learning_rate": 2.7627737789202467e-06,
"loss": 0.4141,
"reward": 0.958333358168602,
"reward_std": 0.5210509821772575,
"rewards/accuracy_reward": 0.3333333395421505,
"rewards/format_reward": 0.6250000149011612,
"step": 76
},
{
"completion_length": 1698.9583740234375,
"epoch": 0.2673611111111111,
"grad_norm": 0.08918589353561401,
"kl": 0.036102294921875,
"learning_rate": 2.7528612917879175e-06,
"loss": 0.2238,
"reward": 0.3125000149011612,
"reward_std": 0.4351623058319092,
"rewards/accuracy_reward": 0.12500000558793545,
"rewards/format_reward": 0.1875000074505806,
"step": 77
},
{
"completion_length": 1350.2916870117188,
"epoch": 0.2708333333333333,
"grad_norm": 0.5975456237792969,
"kl": 0.1876220703125,
"learning_rate": 2.7427644738657634e-06,
"loss": 0.1973,
"reward": 0.4583333507180214,
"reward_std": 0.3006153777241707,
"rewards/accuracy_reward": 0.12500000558793545,
"rewards/format_reward": 0.3333333358168602,
"step": 78
},
{
"completion_length": 1257.2917022705078,
"epoch": 0.2743055555555556,
"grad_norm": 0.15060631930828094,
"kl": 0.02825927734375,
"learning_rate": 2.7324848106769096e-06,
"loss": 0.4094,
"reward": 0.7500000149011612,
"reward_std": 0.696753554046154,
"rewards/accuracy_reward": 0.31250000931322575,
"rewards/format_reward": 0.4375000149011612,
"step": 79
},
{
"completion_length": 697.1875152587891,
"epoch": 0.2777777777777778,
"grad_norm": 0.16244620084762573,
"kl": 0.021240234375,
"learning_rate": 2.722023814646113e-06,
"loss": 0.2586,
"reward": 1.416666716337204,
"reward_std": 0.43528565019369125,
"rewards/accuracy_reward": 0.6041666865348816,
"rewards/format_reward": 0.8125000149011612,
"step": 80
},
{
"completion_length": 812.833366394043,
"epoch": 0.28125,
"grad_norm": 0.1700841337442398,
"kl": 0.027679443359375,
"learning_rate": 2.7113830248772426e-06,
"loss": 0.3001,
"reward": 0.9791667014360428,
"reward_std": 0.3802047595381737,
"rewards/accuracy_reward": 0.229166679084301,
"rewards/format_reward": 0.7500000149011612,
"step": 81
},
{
"completion_length": 525.3333511352539,
"epoch": 0.2847222222222222,
"grad_norm": 0.11852161586284637,
"kl": 0.0202484130859375,
"learning_rate": 2.7005640069268325e-06,
"loss": 0.1364,
"reward": 1.3958333432674408,
"reward_std": 0.24189137294888496,
"rewards/accuracy_reward": 0.45833334885537624,
"rewards/format_reward": 0.9375000149011612,
"step": 82
},
{
"completion_length": 572.3125152587891,
"epoch": 0.2881944444444444,
"grad_norm": 0.15104174613952637,
"kl": 0.020172119140625,
"learning_rate": 2.6895683525737467e-06,
"loss": 0.1749,
"reward": 1.3958333730697632,
"reward_std": 0.32525812089443207,
"rewards/accuracy_reward": 0.5208333432674408,
"rewards/format_reward": 0.8750000298023224,
"step": 83
},
{
"completion_length": 669.458366394043,
"epoch": 0.2916666666666667,
"grad_norm": 0.20023855566978455,
"kl": 0.02825927734375,
"learning_rate": 2.6783976795849845e-06,
"loss": 0.2771,
"reward": 1.1458333432674408,
"reward_std": 0.35275158286094666,
"rewards/accuracy_reward": 0.31250002048909664,
"rewards/format_reward": 0.833333358168602,
"step": 84
},
{
"completion_length": 636.0833435058594,
"epoch": 0.2951388888888889,
"grad_norm": 0.16752025485038757,
"kl": 0.0250244140625,
"learning_rate": 2.6670536314776595e-06,
"loss": 0.1357,
"reward": 1.1666666865348816,
"reward_std": 0.3387768119573593,
"rewards/accuracy_reward": 0.2916666716337204,
"rewards/format_reward": 0.8750000149011612,
"step": 85
},
{
"completion_length": 491.12500762939453,
"epoch": 0.2986111111111111,
"grad_norm": 0.17436006665229797,
"kl": 0.023040771484375,
"learning_rate": 2.655537877277195e-06,
"loss": 0.0185,
"reward": 1.5208333730697632,
"reward_std": 0.1801304928958416,
"rewards/accuracy_reward": 0.5625000074505806,
"rewards/format_reward": 0.9583333432674408,
"step": 86
},
{
"completion_length": 860.4166870117188,
"epoch": 0.3020833333333333,
"grad_norm": 0.1470215767621994,
"kl": 0.020050048828125,
"learning_rate": 2.643852111271762e-06,
"loss": 0.1864,
"reward": 1.0833333730697632,
"reward_std": 0.5692892521619797,
"rewards/accuracy_reward": 0.31250000186264515,
"rewards/format_reward": 0.7708333507180214,
"step": 87
},
{
"completion_length": 506.87501525878906,
"epoch": 0.3055555555555556,
"grad_norm": 0.10362564027309418,
"kl": 0.0194244384765625,
"learning_rate": 2.6319980527630044e-06,
"loss": 0.029,
"reward": 1.5000000298023224,
"reward_std": 0.20412413775920868,
"rewards/accuracy_reward": 0.5208333432674408,
"rewards/format_reward": 0.9791666716337204,
"step": 88
},
{
"completion_length": 503.2916717529297,
"epoch": 0.3090277777777778,
"grad_norm": 0.10739459097385406,
"kl": 0.025970458984375,
"learning_rate": 2.6199774458130785e-06,
"loss": 0.0427,
"reward": 1.458333358168602,
"reward_std": 0.10206206887960434,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.9791666716337204,
"step": 89
},
{
"completion_length": 407.43750762939453,
"epoch": 0.3125,
"grad_norm": 0.09123390913009644,
"kl": 0.0217437744140625,
"learning_rate": 2.607792058988057e-06,
"loss": 0.0256,
"reward": 1.5416666865348816,
"reward_std": 0.17635312676429749,
"rewards/accuracy_reward": 0.5833333395421505,
"rewards/format_reward": 0.9583333432674408,
"step": 90
},
{
"completion_length": 680.3125152587891,
"epoch": 0.3159722222222222,
"grad_norm": 61.70291519165039,
"kl": 2.596893310546875,
"learning_rate": 2.595443685097721e-06,
"loss": 0.2323,
"reward": 1.1458333730697632,
"reward_std": 0.465863935649395,
"rewards/accuracy_reward": 0.2500000074505806,
"rewards/format_reward": 0.895833358168602,
"step": 91
},
{
"completion_length": 584.9583511352539,
"epoch": 0.3194444444444444,
"grad_norm": 0.1794969141483307,
"kl": 0.0206756591796875,
"learning_rate": 2.5829341409317867e-06,
"loss": 0.095,
"reward": 1.5833333730697632,
"reward_std": 0.4050915762782097,
"rewards/accuracy_reward": 0.645833358168602,
"rewards/format_reward": 0.9375000149011612,
"step": 92
},
{
"completion_length": 434.56251525878906,
"epoch": 0.3229166666666667,
"grad_norm": 0.13617026805877686,
"kl": 0.025848388671875,
"learning_rate": 2.5702652669926085e-06,
"loss": 0.1011,
"reward": 1.4583333730697632,
"reward_std": 0.18111901357769966,
"rewards/accuracy_reward": 0.5000000149011612,
"rewards/format_reward": 0.9583333432674408,
"step": 93
},
{
"completion_length": 427.9583435058594,
"epoch": 0.3263888888888889,
"grad_norm": 0.2081851065158844,
"kl": 0.02728271484375,
"learning_rate": 2.5574389272243876e-06,
"loss": -0.0078,
"reward": 1.5000000298023224,
"reward_std": 0.338776808232069,
"rewards/accuracy_reward": 0.5208333488553762,
"rewards/format_reward": 0.9791666716337204,
"step": 94
},
{
"completion_length": 611.8333587646484,
"epoch": 0.3298611111111111,
"grad_norm": 0.16542907059192657,
"kl": 0.02056884765625,
"learning_rate": 2.544457008738933e-06,
"loss": 0.161,
"reward": 1.479166716337204,
"reward_std": 0.4002828076481819,
"rewards/accuracy_reward": 0.5625000149011612,
"rewards/format_reward": 0.9166666865348816,
"step": 95
},
{
"completion_length": 441.7083511352539,
"epoch": 0.3333333333333333,
"grad_norm": 0.200779989361763,
"kl": 0.028839111328125,
"learning_rate": 2.5313214215380183e-06,
"loss": 0.0617,
"reward": 1.3958333432674408,
"reward_std": 0.24818918108940125,
"rewards/accuracy_reward": 0.43750002048909664,
"rewards/format_reward": 0.9583333432674408,
"step": 96
},
{
"completion_length": 531.1875228881836,
"epoch": 0.3368055555555556,
"grad_norm": 0.1479746550321579,
"kl": 0.027008056640625,
"learning_rate": 2.518034098232363e-06,
"loss": 0.082,
"reward": 1.208333358168602,
"reward_std": 0.41228053346276283,
"rewards/accuracy_reward": 0.27083333395421505,
"rewards/format_reward": 0.9375000149011612,
"step": 97
},
{
"completion_length": 763.0208587646484,
"epoch": 0.3402777777777778,
"grad_norm": 0.15963004529476166,
"kl": 0.026947021484375,
"learning_rate": 2.5045969937572946e-06,
"loss": 0.2739,
"reward": 1.1458333730697632,
"reward_std": 0.5016112439334393,
"rewards/accuracy_reward": 0.3125000111758709,
"rewards/format_reward": 0.8333333432674408,
"step": 98
},
{
"completion_length": 476.39583587646484,
"epoch": 0.34375,
"grad_norm": 0.1362573504447937,
"kl": 0.0229034423828125,
"learning_rate": 2.4910120850851222e-06,
"loss": 0.056,
"reward": 1.6041666865348816,
"reward_std": 0.3252581059932709,
"rewards/accuracy_reward": 0.6666666716337204,
"rewards/format_reward": 0.9375000149011612,
"step": 99
},
{
"completion_length": 491.0208511352539,
"epoch": 0.3472222222222222,
"grad_norm": 0.1475033462047577,
"kl": 0.0244140625,
"learning_rate": 2.477281370934269e-06,
"loss": 0.0977,
"reward": 1.479166716337204,
"reward_std": 0.2996268607676029,
"rewards/accuracy_reward": 0.5416666865348816,
"rewards/format_reward": 0.9375000149011612,
"step": 100
},
{
"completion_length": 700.4167022705078,
"epoch": 0.3506944444444444,
"grad_norm": 0.11388766020536423,
"kl": 0.02069091796875,
"learning_rate": 2.463406871475204e-06,
"loss": 0.1393,
"reward": 1.395833358168602,
"reward_std": 0.42034320160746574,
"rewards/accuracy_reward": 0.5208333395421505,
"rewards/format_reward": 0.875,
"step": 101
},
{
"completion_length": 535.8750152587891,
"epoch": 0.3541666666666667,
"grad_norm": 0.13923925161361694,
"kl": 0.023529052734375,
"learning_rate": 2.449390628033221e-06,
"loss": 0.048,
"reward": 1.4583333730697632,
"reward_std": 0.3291737101972103,
"rewards/accuracy_reward": 0.5000000111758709,
"rewards/format_reward": 0.9583333432674408,
"step": 102
},
{
"completion_length": 800.2083435058594,
"epoch": 0.3576388888888889,
"grad_norm": 0.12406690418720245,
"kl": 0.02545166015625,
"learning_rate": 2.4352347027881005e-06,
"loss": 0.3154,
"reward": 1.2500000298023224,
"reward_std": 0.47029248997569084,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.7500000149011612,
"step": 103
},
{
"completion_length": 533.2708587646484,
"epoch": 0.3611111111111111,
"grad_norm": 0.14702031016349792,
"kl": 0.021240234375,
"learning_rate": 2.4209411784707064e-06,
"loss": 0.0215,
"reward": 1.5000000596046448,
"reward_std": 0.338776808232069,
"rewards/accuracy_reward": 0.5416666828095913,
"rewards/format_reward": 0.9583333432674408,
"step": 104
},
{
"completion_length": 723.4167022705078,
"epoch": 0.3645833333333333,
"grad_norm": 0.18807482719421387,
"kl": 0.028533935546875,
"learning_rate": 2.40651215805656e-06,
"loss": 0.3335,
"reward": 1.0625000298023224,
"reward_std": 0.5206723660230637,
"rewards/accuracy_reward": 0.25000000558793545,
"rewards/format_reward": 0.8125000298023224,
"step": 105
},
{
"completion_length": 710.1042022705078,
"epoch": 0.3680555555555556,
"grad_norm": 0.14252522587776184,
"kl": 0.0224609375,
"learning_rate": 2.39194976445643e-06,
"loss": 0.1132,
"reward": 1.2083333730697632,
"reward_std": 0.45271994173526764,
"rewards/accuracy_reward": 0.33333334885537624,
"rewards/format_reward": 0.8750000149011612,
"step": 106
},
{
"completion_length": 776.5208435058594,
"epoch": 0.3715277777777778,
"grad_norm": 0.15372061729431152,
"kl": 0.0250244140625,
"learning_rate": 2.377256140203997e-06,
"loss": 0.0904,
"reward": 1.0625000447034836,
"reward_std": 0.4630715996026993,
"rewards/accuracy_reward": 0.25,
"rewards/format_reward": 0.8125000149011612,
"step": 107
},
{
"completion_length": 546.6666946411133,
"epoch": 0.375,
"grad_norm": 0.1483929604291916,
"kl": 0.02362060546875,
"learning_rate": 2.3624334471406243e-06,
"loss": 0.2206,
"reward": 1.3541666865348816,
"reward_std": 0.3613787963986397,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.8541666865348816,
"step": 108
},
{
"completion_length": 621.6041717529297,
"epoch": 0.3784722222222222,
"grad_norm": 0.13750684261322021,
"kl": 0.019012451171875,
"learning_rate": 2.3474838660972937e-06,
"loss": 0.188,
"reward": 1.3750000298023224,
"reward_std": 0.3707359544932842,
"rewards/accuracy_reward": 0.5,
"rewards/format_reward": 0.8750000149011612,
"step": 109
},
{
"completion_length": 726.3125152587891,
"epoch": 0.3819444444444444,
"grad_norm": 0.12274214625358582,
"kl": 0.02410888671875,
"learning_rate": 2.3324095965737407e-06,
"loss": 0.1216,
"reward": 1.3541666865348816,
"reward_std": 0.4189515560865402,
"rewards/accuracy_reward": 0.5208333414047956,
"rewards/format_reward": 0.8333333432674408,
"step": 110
},
{
"completion_length": 918.2083587646484,
"epoch": 0.3854166666666667,
"grad_norm": 0.12572777271270752,
"kl": 0.02239990234375,
"learning_rate": 2.3172128564148506e-06,
"loss": 0.1613,
"reward": 1.083333358168602,
"reward_std": 0.4050915725529194,
"rewards/accuracy_reward": 0.33333334513008595,
"rewards/format_reward": 0.7500000298023224,
"step": 111
},
{
"completion_length": 884.6458511352539,
"epoch": 0.3888888888888889,
"grad_norm": 0.17690952122211456,
"kl": 0.02056884765625,
"learning_rate": 2.3018958814843497e-06,
"loss": 0.3226,
"reward": 1.0833333432674408,
"reward_std": 0.524587944149971,
"rewards/accuracy_reward": 0.3333333432674408,
"rewards/format_reward": 0.7500000149011612,
"step": 112
},
{
"completion_length": 1251.5000305175781,
"epoch": 0.3923611111111111,
"grad_norm": 0.7481052875518799,
"kl": 0.0283203125,
"learning_rate": 2.286460925335848e-06,
"loss": 0.3119,
"reward": 0.7916666772216558,
"reward_std": 0.5451789386570454,
"rewards/accuracy_reward": 0.2708333432674408,
"rewards/format_reward": 0.5208333488553762,
"step": 113
},
{
"completion_length": 535.6875152587891,
"epoch": 0.3958333333333333,
"grad_norm": 0.15226027369499207,
"kl": 0.032135009765625,
"learning_rate": 2.270910258881277e-06,
"loss": 0.0745,
"reward": 1.3541666865348816,
"reward_std": 0.19615865498781204,
"rewards/accuracy_reward": 0.4375000111758709,
"rewards/format_reward": 0.9166666716337204,
"step": 114
},
{
"completion_length": 644.1458435058594,
"epoch": 0.3993055555555556,
"grad_norm": 0.15469415485858917,
"kl": 0.0194091796875,
"learning_rate": 2.25524617005678e-06,
"loss": 0.1798,
"reward": 1.6458333730697632,
"reward_std": 0.34357523918151855,
"rewards/accuracy_reward": 0.7500000149011612,
"rewards/format_reward": 0.8958333432674408,
"step": 115
},
{
"completion_length": 969.708366394043,
"epoch": 0.4027777777777778,
"grad_norm": 0.11691451817750931,
"kl": 0.0235595703125,
"learning_rate": 2.2394709634860874e-06,
"loss": 0.1976,
"reward": 1.2083333730697632,
"reward_std": 0.3836073949933052,
"rewards/accuracy_reward": 0.5416666716337204,
"rewards/format_reward": 0.6666666865348816,
"step": 116
},
{
"completion_length": 761.9375152587891,
"epoch": 0.40625,
"grad_norm": 0.16335654258728027,
"kl": 0.028839111328125,
"learning_rate": 2.2235869601414455e-06,
"loss": 0.2464,
"reward": 1.25,
"reward_std": 0.3099784776568413,
"rewards/accuracy_reward": 0.4583333358168602,
"rewards/format_reward": 0.7916666716337204,
"step": 117
},
{
"completion_length": 981.3958587646484,
"epoch": 0.4097222222222222,
"grad_norm": 0.1932869404554367,
"kl": 0.031402587890625,
"learning_rate": 2.207596497002137e-06,
"loss": 0.1864,
"reward": 1.041666716337204,
"reward_std": 0.4458687864243984,
"rewards/accuracy_reward": 0.37500001303851604,
"rewards/format_reward": 0.6666667014360428,
"step": 118
},
{
"completion_length": 646.1666793823242,
"epoch": 0.4131944444444444,
"grad_norm": 0.14755134284496307,
"kl": 0.0245361328125,
"learning_rate": 2.1915019267106434e-06,
"loss": 0.2504,
"reward": 1.458333358168602,
"reward_std": 0.36529088765382767,
"rewards/accuracy_reward": 0.6041666865348816,
"rewards/format_reward": 0.8541666865348816,
"step": 119
},
{
"completion_length": 911.8542022705078,
"epoch": 0.4166666666666667,
"grad_norm": 0.25820213556289673,
"kl": 0.042236328125,
"learning_rate": 2.17530561722651e-06,
"loss": 0.4868,
"reward": 0.7500000149011612,
"reward_std": 0.5388510674238205,
"rewards/accuracy_reward": 0.08333333395421505,
"rewards/format_reward": 0.6666666865348816,
"step": 120
},
{
"completion_length": 1040.5833740234375,
"epoch": 0.4201388888888889,
"grad_norm": 0.20425698161125183,
"kl": 0.05157470703125,
"learning_rate": 2.15900995147795e-06,
"loss": 0.2536,
"reward": 0.979166716337204,
"reward_std": 0.5101870223879814,
"rewards/accuracy_reward": 0.3333333432674408,
"rewards/format_reward": 0.645833358168602,
"step": 121
},
{
"completion_length": 1226.3333435058594,
"epoch": 0.4236111111111111,
"grad_norm": 0.15288718044757843,
"kl": 0.03533935546875,
"learning_rate": 2.14261732701125e-06,
"loss": 0.1909,
"reward": 0.7708333544433117,
"reward_std": 0.44616058468818665,
"rewards/accuracy_reward": 0.2708333432674408,
"rewards/format_reward": 0.5000000111758709,
"step": 122
},
{
"completion_length": 1012.4167175292969,
"epoch": 0.4270833333333333,
"grad_norm": 0.16976693272590637,
"kl": 0.023223876953125,
"learning_rate": 2.126130155638026e-06,
"loss": 0.3362,
"reward": 1.104166716337204,
"reward_std": 0.5953380987048149,
"rewards/accuracy_reward": 0.3958333507180214,
"rewards/format_reward": 0.708333358168602,
"step": 123
},
{
"completion_length": 573.7083587646484,
"epoch": 0.4305555555555556,
"grad_norm": 0.1823354810476303,
"kl": 0.04364013671875,
"learning_rate": 2.1095508630803744e-06,
"loss": 0.097,
"reward": 1.2291666865348816,
"reward_std": 0.35317831486463547,
"rewards/accuracy_reward": 0.3750000037252903,
"rewards/format_reward": 0.8541666716337204,
"step": 124
},
{
"completion_length": 675.0833435058594,
"epoch": 0.4340277777777778,
"grad_norm": 0.3771405518054962,
"kl": 0.0296630859375,
"learning_rate": 2.0928818886139857e-06,
"loss": 0.1958,
"reward": 1.291666716337204,
"reward_std": 0.40332652628421783,
"rewards/accuracy_reward": 0.4166666716337204,
"rewards/format_reward": 0.8750000149011612,
"step": 125
},
{
"completion_length": 890.4792098999023,
"epoch": 0.4375,
"grad_norm": 0.13857302069664001,
"kl": 0.02545166015625,
"learning_rate": 2.0761256847092566e-06,
"loss": 0.1842,
"reward": 1.1250000596046448,
"reward_std": 0.40420936048030853,
"rewards/accuracy_reward": 0.37500000558793545,
"rewards/format_reward": 0.7500000149011612,
"step": 126
},
{
"completion_length": 727.0416870117188,
"epoch": 0.4409722222222222,
"grad_norm": 0.1580132693052292,
"kl": 0.021484375,
"learning_rate": 2.059284716670463e-06,
"loss": 0.1402,
"reward": 1.3125000298023224,
"reward_std": 0.505498394370079,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.833333358168602,
"step": 127
},
{
"completion_length": 623.4583511352539,
"epoch": 0.4444444444444444,
"grad_norm": 0.16201883554458618,
"kl": 0.03436279296875,
"learning_rate": 2.0423614622730465e-06,
"loss": 0.1815,
"reward": 1.3125000298023224,
"reward_std": 0.3866407908499241,
"rewards/accuracy_reward": 0.4375000111758709,
"rewards/format_reward": 0.8750000149011612,
"step": 128
},
{
"completion_length": 675.1875305175781,
"epoch": 0.4479166666666667,
"grad_norm": 0.16620077192783356,
"kl": 0.031768798828125,
"learning_rate": 2.025358411399063e-06,
"loss": 0.1073,
"reward": 1.4583333730697632,
"reward_std": 0.3881702236831188,
"rewards/accuracy_reward": 0.5833333432674408,
"rewards/format_reward": 0.875,
"step": 129
},
{
"completion_length": 945.8541870117188,
"epoch": 0.4513888888888889,
"grad_norm": 0.162175714969635,
"kl": 0.023681640625,
"learning_rate": 2.0082780656708533e-06,
"loss": 0.2879,
"reward": 1.1250000298023224,
"reward_std": 0.6361513510346413,
"rewards/accuracy_reward": 0.3958333507180214,
"rewards/format_reward": 0.7291666865348816,
"step": 130
},
{
"completion_length": 722.4791870117188,
"epoch": 0.4548611111111111,
"grad_norm": 2.677931547164917,
"kl": 0.041351318359375,
"learning_rate": 1.9911229380829837e-06,
"loss": 0.1123,
"reward": 1.3541666865348816,
"reward_std": 0.3315683454275131,
"rewards/accuracy_reward": 0.5416666716337204,
"rewards/format_reward": 0.8125000149011612,
"step": 131
},
{
"completion_length": 607.9583587646484,
"epoch": 0.4583333333333333,
"grad_norm": 0.2422100156545639,
"kl": 0.029693603515625,
"learning_rate": 1.973895552632514e-06,
"loss": 0.1758,
"reward": 1.3125000298023224,
"reward_std": 0.42695441097021103,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.8333333432674408,
"step": 132
},
{
"completion_length": 906.0625305175781,
"epoch": 0.4618055555555556,
"grad_norm": 0.18844355642795563,
"kl": 0.039459228515625,
"learning_rate": 1.95659844394765e-06,
"loss": 0.2693,
"reward": 1.2500000596046448,
"reward_std": 0.5812961123883724,
"rewards/accuracy_reward": 0.5000000149011612,
"rewards/format_reward": 0.7500000149011612,
"step": 133
},
{
"completion_length": 574.5625152587891,
"epoch": 0.4652777777777778,
"grad_norm": 0.20260459184646606,
"kl": 0.033355712890625,
"learning_rate": 1.9392341569148255e-06,
"loss": 0.1544,
"reward": 1.541666716337204,
"reward_std": 0.44979287683963776,
"rewards/accuracy_reward": 0.6250000223517418,
"rewards/format_reward": 0.9166666865348816,
"step": 134
},
{
"completion_length": 632.2291793823242,
"epoch": 0.46875,
"grad_norm": 0.23320862650871277,
"kl": 0.03106689453125,
"learning_rate": 1.921805246304281e-06,
"loss": 0.0458,
"reward": 1.2083333879709244,
"reward_std": 0.3506578989326954,
"rewards/accuracy_reward": 0.3541666865348816,
"rewards/format_reward": 0.8541666716337204,
"step": 135
},
{
"completion_length": 745.5833511352539,
"epoch": 0.4722222222222222,
"grad_norm": 0.1192096620798111,
"kl": 0.025177001953125,
"learning_rate": 1.904314276394185e-06,
"loss": 0.1237,
"reward": 1.2916666865348816,
"reward_std": 0.26603008806705475,
"rewards/accuracy_reward": 0.4583333358168602,
"rewards/format_reward": 0.8333333432674408,
"step": 136
},
{
"completion_length": 679.3750152587891,
"epoch": 0.4756944444444444,
"grad_norm": 0.2212546318769455,
"kl": 0.0361328125,
"learning_rate": 1.8867638205933569e-06,
"loss": 0.1533,
"reward": 1.1875000149011612,
"reward_std": 0.4378061033785343,
"rewards/accuracy_reward": 0.33333334140479565,
"rewards/format_reward": 0.8541666865348816,
"step": 137
},
{
"completion_length": 538.3333435058594,
"epoch": 0.4791666666666667,
"grad_norm": 0.1732557713985443,
"kl": 0.022674560546875,
"learning_rate": 1.8691564610626482e-06,
"loss": 0.1226,
"reward": 1.4166666865348816,
"reward_std": 0.3247256875038147,
"rewards/accuracy_reward": 0.45833334885537624,
"rewards/format_reward": 0.9583333432674408,
"step": 138
},
{
"completion_length": 889.2708587646484,
"epoch": 0.4826388888888889,
"grad_norm": 0.23465807735919952,
"kl": 0.026947021484375,
"learning_rate": 1.8514947883350336e-06,
"loss": 0.2865,
"reward": 1.1041667312383652,
"reward_std": 0.4697476103901863,
"rewards/accuracy_reward": 0.33333334140479565,
"rewards/format_reward": 0.770833358168602,
"step": 139
},
{
"completion_length": 883.5833587646484,
"epoch": 0.4861111111111111,
"grad_norm": 0.43588894605636597,
"kl": 0.0335693359375,
"learning_rate": 1.8337814009344715e-06,
"loss": 0.3353,
"reward": 0.8750000298023224,
"reward_std": 0.37073593586683273,
"rewards/accuracy_reward": 0.1041666716337204,
"rewards/format_reward": 0.770833358168602,
"step": 140
},
{
"completion_length": 755.9167022705078,
"epoch": 0.4895833333333333,
"grad_norm": 1.3584622144699097,
"kl": 0.032257080078125,
"learning_rate": 1.8160189049935894e-06,
"loss": 0.2604,
"reward": 1.104166716337204,
"reward_std": 0.5023448839783669,
"rewards/accuracy_reward": 0.2708333432674408,
"rewards/format_reward": 0.8333333730697632,
"step": 141
},
{
"completion_length": 855.2500305175781,
"epoch": 0.4930555555555556,
"grad_norm": 0.20329737663269043,
"kl": 0.036163330078125,
"learning_rate": 1.7982099138702485e-06,
"loss": 0.1702,
"reward": 1.1041667014360428,
"reward_std": 0.37377966567873955,
"rewards/accuracy_reward": 0.3750000037252903,
"rewards/format_reward": 0.7291666865348816,
"step": 142
},
{
"completion_length": 844.0000152587891,
"epoch": 0.4965277777777778,
"grad_norm": 0.22066070139408112,
"kl": 0.041259765625,
"learning_rate": 1.7803570477630467e-06,
"loss": 0.218,
"reward": 1.0625000149011612,
"reward_std": 0.48489294201135635,
"rewards/accuracy_reward": 0.27083334140479565,
"rewards/format_reward": 0.7916666716337204,
"step": 143
},
{
"completion_length": 676.6041717529297,
"epoch": 0.5,
"grad_norm": 0.30942684412002563,
"kl": 0.03912353515625,
"learning_rate": 1.762462933325813e-06,
"loss": 0.1286,
"reward": 1.1666666865348816,
"reward_std": 0.37248334288597107,
"rewards/accuracy_reward": 0.31250000558793545,
"rewards/format_reward": 0.8541666865348816,
"step": 144
},
{
"completion_length": 497.25001525878906,
"epoch": 0.5034722222222222,
"grad_norm": 4.151206970214844,
"kl": 0.034820556640625,
"learning_rate": 1.7445302032811562e-06,
"loss": 0.1267,
"reward": 1.604166716337204,
"reward_std": 0.4081249386072159,
"rewards/accuracy_reward": 0.6875000223517418,
"rewards/format_reward": 0.9166666716337204,
"step": 145
},
{
"completion_length": 517.8541793823242,
"epoch": 0.5069444444444444,
"grad_norm": 0.2486122101545334,
"kl": 0.0377044677734375,
"learning_rate": 1.726561496033115e-06,
"loss": 0.0616,
"reward": 1.4791666865348816,
"reward_std": 0.13301505148410797,
"rewards/accuracy_reward": 0.5416666716337204,
"rewards/format_reward": 0.9375,
"step": 146
},
{
"completion_length": 720.6250152587891,
"epoch": 0.5104166666666666,
"grad_norm": 1.1804969310760498,
"kl": 0.067596435546875,
"learning_rate": 1.7085594552789775e-06,
"loss": 0.1597,
"reward": 1.3958333730697632,
"reward_std": 0.5734792053699493,
"rewards/accuracy_reward": 0.5416666865348816,
"rewards/format_reward": 0.8541666716337204,
"step": 147
},
{
"completion_length": 612.7708511352539,
"epoch": 0.5138888888888888,
"grad_norm": 2.4607434272766113,
"kl": 0.23883056640625,
"learning_rate": 1.6905267296203183e-06,
"loss": 0.2513,
"reward": 1.2708333432674408,
"reward_std": 0.421766959130764,
"rewards/accuracy_reward": 0.41666667349636555,
"rewards/format_reward": 0.8541666865348816,
"step": 148
},
{
"completion_length": 569.6666870117188,
"epoch": 0.5173611111111112,
"grad_norm": 6.466779708862305,
"kl": 0.061126708984375,
"learning_rate": 1.6724659721733166e-06,
"loss": 0.152,
"reward": 1.3750000298023224,
"reward_std": 0.18404609709978104,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 0.9375000149011612,
"step": 149
},
{
"completion_length": 905.8125152587891,
"epoch": 0.5208333333333334,
"grad_norm": 8.022199630737305,
"kl": 1.09375,
"learning_rate": 1.6543798401784086e-06,
"loss": 0.3308,
"reward": 1.104166716337204,
"reward_std": 0.4881899170577526,
"rewards/accuracy_reward": 0.3750000037252903,
"rewards/format_reward": 0.7291666865348816,
"step": 150
},
{
"completion_length": 712.1041870117188,
"epoch": 0.5243055555555556,
"grad_norm": 65888.078125,
"kl": 1422.472412109375,
"learning_rate": 1.6362709946093328e-06,
"loss": 38.4478,
"reward": 1.104166716337204,
"reward_std": 0.40724214166402817,
"rewards/accuracy_reward": 0.2708333358168602,
"rewards/format_reward": 0.833333358168602,
"step": 151
},
{
"completion_length": 539.7708435058594,
"epoch": 0.5277777777777778,
"grad_norm": 76.37101745605469,
"kl": 7.6168212890625,
"learning_rate": 1.618142099781627e-06,
"loss": 0.631,
"reward": 1.0625000298023224,
"reward_std": 0.24958433583378792,
"rewards/accuracy_reward": 0.1458333395421505,
"rewards/format_reward": 0.9166666716337204,
"step": 152
},
{
"completion_length": 798.9166870117188,
"epoch": 0.53125,
"grad_norm": 0.7325725555419922,
"kl": 0.4227294921875,
"learning_rate": 1.599995822960633e-06,
"loss": 0.1743,
"reward": 1.1041666865348816,
"reward_std": 0.32614094391465187,
"rewards/accuracy_reward": 0.3333333358168602,
"rewards/format_reward": 0.770833358168602,
"step": 153
},
{
"completion_length": 702.5833435058594,
"epoch": 0.5347222222222222,
"grad_norm": 2.384575843811035,
"kl": 0.3314208984375,
"learning_rate": 1.5818348339690693e-06,
"loss": 0.1558,
"reward": 1.3333333730697632,
"reward_std": 0.4297148287296295,
"rewards/accuracy_reward": 0.47916667722165585,
"rewards/format_reward": 0.8541666716337204,
"step": 154
},
{
"completion_length": 570.0416793823242,
"epoch": 0.5381944444444444,
"grad_norm": 1.1694482564926147,
"kl": 0.4540863037109375,
"learning_rate": 1.5636618047942224e-06,
"loss": 0.1617,
"reward": 1.5833333730697632,
"reward_std": 0.41380148753523827,
"rewards/accuracy_reward": 0.6875000204890966,
"rewards/format_reward": 0.8958333432674408,
"step": 155
},
{
"completion_length": 570.7083511352539,
"epoch": 0.5416666666666666,
"grad_norm": 2.306391477584839,
"kl": 0.577117919921875,
"learning_rate": 1.5454794091948273e-06,
"loss": 0.2139,
"reward": 1.3541666865348816,
"reward_std": 0.3906906694173813,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.8750000149011612,
"step": 156
},
{
"completion_length": 491.7916717529297,
"epoch": 0.5451388888888888,
"grad_norm": 9.992592811584473,
"kl": 0.30511474609375,
"learning_rate": 1.5272903223076794e-06,
"loss": 0.0622,
"reward": 1.1666666716337204,
"reward_std": 0.19855330884456635,
"rewards/accuracy_reward": 0.2708333432674408,
"rewards/format_reward": 0.8958333432674408,
"step": 157
},
{
"completion_length": 791.6250228881836,
"epoch": 0.5486111111111112,
"grad_norm": 38.32509231567383,
"kl": 1.33209228515625,
"learning_rate": 1.5090972202540497e-06,
"loss": 0.2214,
"reward": 1.1875,
"reward_std": 0.44629882276058197,
"rewards/accuracy_reward": 0.3541666716337204,
"rewards/format_reward": 0.8333333432674408,
"step": 158
},
{
"completion_length": 789.3333740234375,
"epoch": 0.5520833333333334,
"grad_norm": 1158.8193359375,
"kl": 50.455078125,
"learning_rate": 1.4909027797459508e-06,
"loss": 3.0286,
"reward": 1.1666666865348816,
"reward_std": 0.4083564504981041,
"rewards/accuracy_reward": 0.39583334513008595,
"rewards/format_reward": 0.770833358168602,
"step": 159
},
{
"completion_length": 830.2708587646484,
"epoch": 0.5555555555555556,
"grad_norm": 540.842041015625,
"kl": 37.28271484375,
"learning_rate": 1.4727096776923206e-06,
"loss": 2.3995,
"reward": 1.166666716337204,
"reward_std": 0.5332978293299675,
"rewards/accuracy_reward": 0.3958333544433117,
"rewards/format_reward": 0.7708333432674408,
"step": 160
},
{
"completion_length": 384.1458435058594,
"epoch": 0.5590277777777778,
"grad_norm": 3.105428457260132,
"kl": 0.341156005859375,
"learning_rate": 1.454520590805173e-06,
"loss": 0.1745,
"reward": 1.7916666865348816,
"reward_std": 0.20412414520978928,
"rewards/accuracy_reward": 0.8333333432674408,
"rewards/format_reward": 0.9583333432674408,
"step": 161
},
{
"completion_length": 585.7083511352539,
"epoch": 0.5625,
"grad_norm": 4.438769340515137,
"kl": 0.3422698974609375,
"learning_rate": 1.4363381952057778e-06,
"loss": 0.1405,
"reward": 1.4375,
"reward_std": 0.3316941484808922,
"rewards/accuracy_reward": 0.5625000149011612,
"rewards/format_reward": 0.8750000149011612,
"step": 162
},
{
"completion_length": 432.9166717529297,
"epoch": 0.5659722222222222,
"grad_norm": 2.7780346870422363,
"kl": 0.13446044921875,
"learning_rate": 1.4181651660309314e-06,
"loss": 0.1469,
"reward": 1.4375000298023224,
"reward_std": 0.26070839166641235,
"rewards/accuracy_reward": 0.5000000149011612,
"rewards/format_reward": 0.9375000149011612,
"step": 163
},
{
"completion_length": 534.5416946411133,
"epoch": 0.5694444444444444,
"grad_norm": 20.075862884521484,
"kl": 0.94732666015625,
"learning_rate": 1.4000041770393675e-06,
"loss": 0.2916,
"reward": 1.5625000596046448,
"reward_std": 0.486316692084074,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.9375000149011612,
"step": 164
},
{
"completion_length": 440.18750762939453,
"epoch": 0.5729166666666666,
"grad_norm": 4.264848232269287,
"kl": 0.11651611328125,
"learning_rate": 1.3818579002183738e-06,
"loss": 0.0084,
"reward": 1.4583334028720856,
"reward_std": 0.2686738707125187,
"rewards/accuracy_reward": 0.47916667722165585,
"rewards/format_reward": 0.9791666716337204,
"step": 165
},
{
"completion_length": 468.83334732055664,
"epoch": 0.5763888888888888,
"grad_norm": 2.606549024581909,
"kl": 0.071746826171875,
"learning_rate": 1.363729005390667e-06,
"loss": 0.0686,
"reward": 1.3958333730697632,
"reward_std": 0.3357440307736397,
"rewards/accuracy_reward": 0.4375000149011612,
"rewards/format_reward": 0.9583333432674408,
"step": 166
},
{
"completion_length": 572.8958358764648,
"epoch": 0.5798611111111112,
"grad_norm": 4.766880035400391,
"kl": 0.176361083984375,
"learning_rate": 1.3456201598215913e-06,
"loss": 0.0563,
"reward": 1.270833358168602,
"reward_std": 0.40029376745224,
"rewards/accuracy_reward": 0.45833334885537624,
"rewards/format_reward": 0.8125000149011612,
"step": 167
},
{
"completion_length": 463.70835876464844,
"epoch": 0.5833333333333334,
"grad_norm": 0.8010079860687256,
"kl": 0.16363525390625,
"learning_rate": 1.3275340278266835e-06,
"loss": 0.0342,
"reward": 1.270833358168602,
"reward_std": 0.4177170880138874,
"rewards/accuracy_reward": 0.354166679084301,
"rewards/format_reward": 0.9166666865348816,
"step": 168
},
{
"completion_length": 469.9583511352539,
"epoch": 0.5868055555555556,
"grad_norm": 0.6038458943367004,
"kl": 0.450103759765625,
"learning_rate": 1.3094732703796818e-06,
"loss": 0.0243,
"reward": 1.2708333730697632,
"reward_std": 0.19756478071212769,
"rewards/accuracy_reward": 0.3333333358168602,
"rewards/format_reward": 0.9375,
"step": 169
},
{
"completion_length": 554.4375152587891,
"epoch": 0.5902777777777778,
"grad_norm": 1.6925392150878906,
"kl": 0.24127197265625,
"learning_rate": 1.291440544721023e-06,
"loss": -0.0066,
"reward": 1.3750000596046448,
"reward_std": 0.4026774615049362,
"rewards/accuracy_reward": 0.4166666753590107,
"rewards/format_reward": 0.9583333432674408,
"step": 170
},
{
"completion_length": 468.5416717529297,
"epoch": 0.59375,
"grad_norm": 0.1130196750164032,
"kl": 0.028045654296875,
"learning_rate": 1.2734385039668851e-06,
"loss": 0.0032,
"reward": 1.2291666865348816,
"reward_std": 0.13301505148410797,
"rewards/accuracy_reward": 0.2291666716337204,
"rewards/format_reward": 1.0,
"step": 171
},
{
"completion_length": 557.1041870117188,
"epoch": 0.5972222222222222,
"grad_norm": 4.199826240539551,
"kl": 0.111236572265625,
"learning_rate": 1.255469796718844e-06,
"loss": 0.0268,
"reward": 1.4375000596046448,
"reward_std": 0.1801304928958416,
"rewards/accuracy_reward": 0.4583333395421505,
"rewards/format_reward": 0.9791666716337204,
"step": 172
},
{
"completion_length": 438.6666793823242,
"epoch": 0.6006944444444444,
"grad_norm": 0.15102888643741608,
"kl": 0.030181884765625,
"learning_rate": 1.2375370666741872e-06,
"loss": 0.0193,
"reward": 1.5000000298023224,
"reward_std": 0.377695269882679,
"rewards/accuracy_reward": 0.5000000074505806,
"rewards/format_reward": 1.0,
"step": 173
},
{
"completion_length": 585.8125152587891,
"epoch": 0.6041666666666666,
"grad_norm": 0.6886882781982422,
"kl": 0.13189697265625,
"learning_rate": 1.2196429522369538e-06,
"loss": 0.0651,
"reward": 1.3333333879709244,
"reward_std": 0.3881702311336994,
"rewards/accuracy_reward": 0.39583334140479565,
"rewards/format_reward": 0.9375000149011612,
"step": 174
},
{
"completion_length": 537.1041717529297,
"epoch": 0.6076388888888888,
"grad_norm": 0.35646969079971313,
"kl": 0.062103271484375,
"learning_rate": 1.2017900861297518e-06,
"loss": 0.1027,
"reward": 1.2291666716337204,
"reward_std": 0.235077116638422,
"rewards/accuracy_reward": 0.25,
"rewards/format_reward": 0.9791666716337204,
"step": 175
},
{
"completion_length": 581.2083587646484,
"epoch": 0.6111111111111112,
"grad_norm": 0.12719810009002686,
"kl": 0.03607177734375,
"learning_rate": 1.183981095006411e-06,
"loss": -0.008,
"reward": 1.416666716337204,
"reward_std": 0.2847129963338375,
"rewards/accuracy_reward": 0.4375000074505806,
"rewards/format_reward": 0.9791666716337204,
"step": 176
},
{
"completion_length": 589.8958511352539,
"epoch": 0.6145833333333334,
"grad_norm": 1.2875088453292847,
"kl": 0.089111328125,
"learning_rate": 1.1662185990655286e-06,
"loss": 0.124,
"reward": 1.4375000298023224,
"reward_std": 0.41580959782004356,
"rewards/accuracy_reward": 0.500000013038516,
"rewards/format_reward": 0.9375000149011612,
"step": 177
},
{
"completion_length": 545.6666793823242,
"epoch": 0.6180555555555556,
"grad_norm": 0.4275152385234833,
"kl": 0.06671142578125,
"learning_rate": 1.1485052116649664e-06,
"loss": 0.0178,
"reward": 1.1875000298023224,
"reward_std": 0.2591874301433563,
"rewards/accuracy_reward": 0.20833334140479565,
"rewards/format_reward": 0.9791666716337204,
"step": 178
},
{
"completion_length": 563.8958435058594,
"epoch": 0.6215277777777778,
"grad_norm": 0.4824279844760895,
"kl": 0.13623046875,
"learning_rate": 1.130843538937352e-06,
"loss": 0.1624,
"reward": 1.1875000298023224,
"reward_std": 0.31273890286684036,
"rewards/accuracy_reward": 0.27083333767950535,
"rewards/format_reward": 0.9166666716337204,
"step": 179
},
{
"completion_length": 662.3541717529297,
"epoch": 0.625,
"grad_norm": 2.1108016967773438,
"kl": 0.603515625,
"learning_rate": 1.1132361794066434e-06,
"loss": 0.2967,
"reward": 1.1250000298023224,
"reward_std": 0.40824827924370766,
"rewards/accuracy_reward": 0.2291666716337204,
"rewards/format_reward": 0.895833358168602,
"step": 180
},
{
"completion_length": 665.5208587646484,
"epoch": 0.6284722222222222,
"grad_norm": 0.5030002593994141,
"kl": 0.2371826171875,
"learning_rate": 1.095685723605815e-06,
"loss": 0.1734,
"reward": 1.2291666865348816,
"reward_std": 0.31970489397644997,
"rewards/accuracy_reward": 0.35416667722165585,
"rewards/format_reward": 0.8750000149011612,
"step": 181
},
{
"completion_length": 519.5833587646484,
"epoch": 0.6319444444444444,
"grad_norm": 1.6782981157302856,
"kl": 0.065582275390625,
"learning_rate": 1.078194753695719e-06,
"loss": 0.0275,
"reward": 1.4583333432674408,
"reward_std": 0.19855330884456635,
"rewards/accuracy_reward": 0.47916666977107525,
"rewards/format_reward": 0.9791666716337204,
"step": 182
},
{
"completion_length": 613.1666870117188,
"epoch": 0.6354166666666666,
"grad_norm": 1.796356439590454,
"kl": 1.067657470703125,
"learning_rate": 1.0607658430851746e-06,
"loss": 0.1825,
"reward": 1.1875000298023224,
"reward_std": 0.28219256177544594,
"rewards/accuracy_reward": 0.229166679084301,
"rewards/format_reward": 0.9583333432674408,
"step": 183
},
{
"completion_length": 499.31250762939453,
"epoch": 0.6388888888888888,
"grad_norm": 0.35159018635749817,
"kl": 0.0562744140625,
"learning_rate": 1.0434015560523502e-06,
"loss": 0.0408,
"reward": 1.4166666865348816,
"reward_std": 0.30354245007038116,
"rewards/accuracy_reward": 0.4375000074505806,
"rewards/format_reward": 0.9791666716337204,
"step": 184
},
{
"completion_length": 441.1041793823242,
"epoch": 0.6423611111111112,
"grad_norm": 0.4985083341598511,
"kl": 0.0517578125,
"learning_rate": 1.0261044473674858e-06,
"loss": 0.0118,
"reward": 1.6666666865348816,
"reward_std": 0.16661179810762405,
"rewards/accuracy_reward": 0.6875000074505806,
"rewards/format_reward": 0.9791666716337204,
"step": 185
},
{
"completion_length": 497.0208435058594,
"epoch": 0.6458333333333334,
"grad_norm": 0.15296566486358643,
"kl": 0.032012939453125,
"learning_rate": 1.0088770619170168e-06,
"loss": -0.018,
"reward": 1.5625000596046448,
"reward_std": 0.3170611262321472,
"rewards/accuracy_reward": 0.5625000111758709,
"rewards/format_reward": 1.0,
"step": 186
},
{
"completion_length": 612.5833511352539,
"epoch": 0.6493055555555556,
"grad_norm": 0.31455937027931213,
"kl": 0.10076904296875,
"learning_rate": 9.91721934329147e-07,
"loss": 0.0513,
"reward": 1.3125000298023224,
"reward_std": 0.27369463443756104,
"rewards/accuracy_reward": 0.3541666679084301,
"rewards/format_reward": 0.9583333432674408,
"step": 187
},
{
"completion_length": 436.8541793823242,
"epoch": 0.6527777777777778,
"grad_norm": 0.13380156457424164,
"kl": 0.0311279296875,
"learning_rate": 9.746415886009373e-07,
"loss": 0.0032,
"reward": 1.2916666865348816,
"reward_std": 0.11949636787176132,
"rewards/accuracy_reward": 0.2916666716337204,
"rewards/format_reward": 1.0,
"step": 188
},
{
"completion_length": 525.7500152587891,
"epoch": 0.65625,
"grad_norm": 0.18756899237632751,
"kl": 0.045623779296875,
"learning_rate": 9.576385377269538e-07,
"loss": 0.0134,
"reward": 1.5208333730697632,
"reward_std": 0.3898078426718712,
"rewards/accuracy_reward": 0.5416666772216558,
"rewards/format_reward": 0.9791666716337204,
"step": 189
},
{
"completion_length": 588.8750152587891,
"epoch": 0.6597222222222222,
"grad_norm": 2.7000815868377686,
"kl": 0.14208984375,
"learning_rate": 9.407152833295372e-07,
"loss": 0.1185,
"reward": 1.3125000298023224,
"reward_std": 0.3732563704252243,
"rewards/accuracy_reward": 0.35416667722165585,
"rewards/format_reward": 0.9583333432674408,
"step": 190
},
{
"completion_length": 413.43751525878906,
"epoch": 0.6631944444444444,
"grad_norm": 0.17988836765289307,
"kl": 0.02947998046875,
"learning_rate": 9.238743152907437e-07,
"loss": -0.0021,
"reward": 1.4583333730697632,
"reward_std": 0.3680921792984009,
"rewards/accuracy_reward": 0.4583333507180214,
"rewards/format_reward": 1.0,
"step": 191
},
{
"completion_length": 321.54168701171875,
"epoch": 0.6666666666666666,
"grad_norm": 0.15334828197956085,
"kl": 0.039154052734375,
"learning_rate": 9.071181113860146e-07,
"loss": 0.025,
"reward": 1.6666666865348816,
"reward_std": 0.11949635669589043,
"rewards/accuracy_reward": 0.6666666716337204,
"rewards/format_reward": 1.0,
"step": 192
},
{
"completion_length": 366.87500762939453,
"epoch": 0.6701388888888888,
"grad_norm": 0.08574451506137848,
"kl": 0.028717041015625,
"learning_rate": 8.90449136919626e-07,
"loss": -0.0078,
"reward": 1.6041666865348816,
"reward_std": 0.11558075994253159,
"rewards/accuracy_reward": 0.6041666716337204,
"rewards/format_reward": 1.0,
"step": 193
},
{
"completion_length": 443.4583435058594,
"epoch": 0.6736111111111112,
"grad_norm": 0.06931155174970627,
"kl": 0.021270751953125,
"learning_rate": 8.738698443619745e-07,
"loss": -0.0018,
"reward": 1.4375000298023224,
"reward_std": 0.11558076366782188,
"rewards/accuracy_reward": 0.4375000074505806,
"rewards/format_reward": 1.0,
"step": 194
},
{
"completion_length": 431.87501525878906,
"epoch": 0.6770833333333334,
"grad_norm": 0.18571817874908447,
"kl": 0.038238525390625,
"learning_rate": 8.573826729887494e-07,
"loss": 0.0494,
"reward": 1.5833333730697632,
"reward_std": 0.3291737213730812,
"rewards/accuracy_reward": 0.6041666828095913,
"rewards/format_reward": 0.9791666716337204,
"step": 195
},
{
"completion_length": 650.8542022705078,
"epoch": 0.6805555555555556,
"grad_norm": 0.3357548713684082,
"kl": 0.0557861328125,
"learning_rate": 8.409900485220498e-07,
"loss": 0.0632,
"reward": 1.2500000298023224,
"reward_std": 0.2861081510782242,
"rewards/accuracy_reward": 0.3125,
"rewards/format_reward": 0.9375000149011612,
"step": 196
},
{
"completion_length": 565.5625152587891,
"epoch": 0.6840277777777778,
"grad_norm": 1.96600341796875,
"kl": 0.05572509765625,
"learning_rate": 8.246943827734898e-07,
"loss": 0.0943,
"reward": 1.1250000447034836,
"reward_std": 0.22155844047665596,
"rewards/accuracy_reward": 0.1666666716337204,
"rewards/format_reward": 0.9583333432674408,
"step": 197
},
{
"completion_length": 500.10418701171875,
"epoch": 0.6875,
"grad_norm": 0.8058876991271973,
"kl": 0.05865478515625,
"learning_rate": 8.084980732893569e-07,
"loss": 0.1041,
"reward": 1.2708333879709244,
"reward_std": 0.21764284372329712,
"rewards/accuracy_reward": 0.3125000074505806,
"rewards/format_reward": 0.9583333432674408,
"step": 198
},
{
"completion_length": 476.3958435058594,
"epoch": 0.6909722222222222,
"grad_norm": 0.09576891362667084,
"kl": 0.035369873046875,
"learning_rate": 7.924035029978635e-07,
"loss": 0.058,
"reward": 1.3958333730697632,
"reward_std": 0.1801304928958416,
"rewards/accuracy_reward": 0.39583334140479565,
"rewards/format_reward": 1.0,
"step": 199
},
{
"completion_length": 458.62500762939453,
"epoch": 0.6944444444444444,
"grad_norm": 0.40911945700645447,
"kl": 0.053070068359375,
"learning_rate": 7.764130398585547e-07,
"loss": 0.1052,
"reward": 1.4375000298023224,
"reward_std": 0.34269241243600845,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.9583333432674408,
"step": 200
},
{
"completion_length": 425.47918701171875,
"epoch": 0.6979166666666666,
"grad_norm": 0.34317830204963684,
"kl": 0.0360107421875,
"learning_rate": 7.605290365139128e-07,
"loss": -0.0175,
"reward": 1.3541666865348816,
"reward_std": 0.31413406878709793,
"rewards/accuracy_reward": 0.3750000074505806,
"rewards/format_reward": 0.9791666716337204,
"step": 201
},
{
"completion_length": 397.68751525878906,
"epoch": 0.7013888888888888,
"grad_norm": 0.155939519405365,
"kl": 0.02838134765625,
"learning_rate": 7.447538299432202e-07,
"loss": 0.0059,
"reward": 1.729166716337204,
"reward_std": 0.28219255805015564,
"rewards/accuracy_reward": 0.7291666865348816,
"rewards/format_reward": 1.0,
"step": 202
},
{
"completion_length": 515.4375228881836,
"epoch": 0.7048611111111112,
"grad_norm": 0.5841673016548157,
"kl": 0.0369873046875,
"learning_rate": 7.290897411187232e-07,
"loss": 0.0686,
"reward": 1.4375000149011612,
"reward_std": 0.11558076739311218,
"rewards/accuracy_reward": 0.4583333432674408,
"rewards/format_reward": 0.9791666716337204,
"step": 203
},
{
"completion_length": 442.4791717529297,
"epoch": 0.7083333333333334,
"grad_norm": 0.3265649080276489,
"kl": 0.05230712890625,
"learning_rate": 7.135390746641527e-07,
"loss": 0.0242,
"reward": 1.5416666865348816,
"reward_std": 0.37577681615948677,
"rewards/accuracy_reward": 0.583333358168602,
"rewards/format_reward": 0.9583333432674408,
"step": 204
},
{
"completion_length": 496.7291717529297,
"epoch": 0.7118055555555556,
"grad_norm": 0.7499803900718689,
"kl": 0.08343505859375,
"learning_rate": 6.981041185156506e-07,
"loss": 0.1064,
"reward": 1.5208333730697632,
"reward_std": 0.46483254060149193,
"rewards/accuracy_reward": 0.6041666865348816,
"rewards/format_reward": 0.9166666716337204,
"step": 205
},
{
"completion_length": 374.0833435058594,
"epoch": 0.7152777777777778,
"grad_norm": 0.13928478956222534,
"kl": 0.030792236328125,
"learning_rate": 6.827871435851497e-07,
"loss": 0.0154,
"reward": 1.3750000298023224,
"reward_std": 0.16661179438233376,
"rewards/accuracy_reward": 0.3750000149011612,
"rewards/format_reward": 1.0,
"step": 206
},
{
"completion_length": 501.0625228881836,
"epoch": 0.71875,
"grad_norm": 0.0946309044957161,
"kl": 0.024078369140625,
"learning_rate": 6.675904034262598e-07,
"loss": -0.0227,
"reward": 1.4375000298023224,
"reward_std": 0.1705273948609829,
"rewards/accuracy_reward": 0.43750000558793545,
"rewards/format_reward": 1.0,
"step": 207
},
{
"completion_length": 498.2708435058594,
"epoch": 0.7222222222222222,
"grad_norm": 2.3851850032806396,
"kl": 0.02874755859375,
"learning_rate": 6.525161339027069e-07,
"loss": 0.0666,
"reward": 1.541666716337204,
"reward_std": 0.2576756104826927,
"rewards/accuracy_reward": 0.5833333414047956,
"rewards/format_reward": 0.9583333432674408,
"step": 208
},
{
"completion_length": 511.06252670288086,
"epoch": 0.7256944444444444,
"grad_norm": 0.3298015892505646,
"kl": 0.03863525390625,
"learning_rate": 6.375665528593754e-07,
"loss": 0.139,
"reward": 1.3958333432674408,
"reward_std": 0.29669976979494095,
"rewards/accuracy_reward": 0.5000000111758709,
"rewards/format_reward": 0.895833358168602,
"step": 209
},
{
"completion_length": 621.8541946411133,
"epoch": 0.7291666666666666,
"grad_norm": 1.3768178224563599,
"kl": 0.027679443359375,
"learning_rate": 6.227438597960031e-07,
"loss": 0.0904,
"reward": 1.5833334028720856,
"reward_std": 0.3061862215399742,
"rewards/accuracy_reward": 0.6250000149011612,
"rewards/format_reward": 0.9583333432674408,
"step": 210
},
{
"completion_length": 598.3333358764648,
"epoch": 0.7326388888888888,
"grad_norm": 0.9648879766464233,
"kl": 0.04754638671875,
"learning_rate": 6.080502355435701e-07,
"loss": 0.1075,
"reward": 1.0625000298023224,
"reward_std": 0.26070838794112206,
"rewards/accuracy_reward": 0.1250000037252903,
"rewards/format_reward": 0.9375,
"step": 211
},
{
"completion_length": 592.1666870117188,
"epoch": 0.7361111111111112,
"grad_norm": 3.8903932571411133,
"kl": 0.04022216796875,
"learning_rate": 5.934878419434403e-07,
"loss": 0.1579,
"reward": 1.1458333730697632,
"reward_std": 0.29669976606965065,
"rewards/accuracy_reward": 0.2083333432674408,
"rewards/format_reward": 0.9375000149011612,
"step": 212
},
{
"completion_length": 637.3333587646484,
"epoch": 0.7395833333333334,
"grad_norm": 0.3173258900642395,
"kl": 0.038299560546875,
"learning_rate": 5.790588215292935e-07,
"loss": 0.0712,
"reward": 1.3125,
"reward_std": 0.1705273985862732,
"rewards/accuracy_reward": 0.375,
"rewards/format_reward": 0.9375,
"step": 213
},
{
"completion_length": 534.8125305175781,
"epoch": 0.7430555555555556,
"grad_norm": 0.12009190022945404,
"kl": 0.021575927734375,
"learning_rate": 5.647652972118998e-07,
"loss": 0.0173,
"reward": 1.6875000298023224,
"reward_std": 0.11558076366782188,
"rewards/accuracy_reward": 0.6875000149011612,
"rewards/format_reward": 1.0,
"step": 214
},
{
"completion_length": 412.7083435058594,
"epoch": 0.7465277777777778,
"grad_norm": 0.15298447012901306,
"kl": 0.033172607421875,
"learning_rate": 5.506093719667793e-07,
"loss": 0.0061,
"reward": 1.4375000447034836,
"reward_std": 0.2446802221238613,
"rewards/accuracy_reward": 0.4583333507180214,
"rewards/format_reward": 0.9791666716337204,
"step": 215
},
{
"completion_length": 522.6875076293945,
"epoch": 0.75,
"grad_norm": 0.12487559020519257,
"kl": 0.03125,
"learning_rate": 5.365931285247962e-07,
"loss": 0.052,
"reward": 1.3958333432674408,
"reward_std": 0.0940965861082077,
"rewards/accuracy_reward": 0.4166666679084301,
"rewards/format_reward": 0.9791666716337204,
"step": 216
},
{
"completion_length": 433.1458435058594,
"epoch": 0.7534722222222222,
"grad_norm": 0.25384294986724854,
"kl": 0.024444580078125,
"learning_rate": 5.227186290657315e-07,
"loss": -0.0151,
"reward": 1.5000000298023224,
"reward_std": 0.268673874437809,
"rewards/accuracy_reward": 0.5208333395421505,
"rewards/format_reward": 0.9791666716337204,
"step": 217
},
{
"completion_length": 418.125,
"epoch": 0.7569444444444444,
"grad_norm": 0.021524284034967422,
"kl": 0.02813720703125,
"learning_rate": 5.089879149148781e-07,
"loss": 0.0011,
"reward": 1.625,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 1.0,
"step": 218
},
{
"completion_length": 545.9791793823242,
"epoch": 0.7604166666666666,
"grad_norm": 0.5041170716285706,
"kl": 0.043212890625,
"learning_rate": 4.954030062427058e-07,
"loss": 0.0828,
"reward": 1.0625000298023224,
"reward_std": 0.40168892219662666,
"rewards/accuracy_reward": 0.14583333767950535,
"rewards/format_reward": 0.9166666716337204,
"step": 219
},
{
"completion_length": 676.0000152587891,
"epoch": 0.7638888888888888,
"grad_norm": 0.3889068067073822,
"kl": 0.0419921875,
"learning_rate": 4.819659017676376e-07,
"loss": 0.095,
"reward": 1.2291666865348816,
"reward_std": 0.2350771203637123,
"rewards/accuracy_reward": 0.33333333395421505,
"rewards/format_reward": 0.8958333432674408,
"step": 220
},
{
"completion_length": 477.7916946411133,
"epoch": 0.7673611111111112,
"grad_norm": 0.14289724826812744,
"kl": 0.0274658203125,
"learning_rate": 4.686785784619824e-07,
"loss": -0.0252,
"reward": 1.2708333432674408,
"reward_std": 0.18796167895197868,
"rewards/accuracy_reward": 0.27083333395421505,
"rewards/format_reward": 1.0,
"step": 221
},
{
"completion_length": 505.5833435058594,
"epoch": 0.7708333333333334,
"grad_norm": 0.15408483147621155,
"kl": 0.028106689453125,
"learning_rate": 4.555429912610674e-07,
"loss": 0.0698,
"reward": 1.416666716337204,
"reward_std": 0.24859582632780075,
"rewards/accuracy_reward": 0.4375000037252903,
"rewards/format_reward": 0.9791666716337204,
"step": 222
},
{
"completion_length": 623.5208358764648,
"epoch": 0.7743055555555556,
"grad_norm": 0.012931477278470993,
"kl": 0.0222625732421875,
"learning_rate": 4.425610727756131e-07,
"loss": 0.0009,
"reward": 1.375,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.375,
"rewards/format_reward": 1.0,
"step": 223
},
{
"completion_length": 547.0833587646484,
"epoch": 0.7777777777777778,
"grad_norm": 0.5076951384544373,
"kl": 0.0321044921875,
"learning_rate": 4.297347330073915e-07,
"loss": 0.0912,
"reward": 1.479166716337204,
"reward_std": 0.4217669628560543,
"rewards/accuracy_reward": 0.5416666828095913,
"rewards/format_reward": 0.9375000149011612,
"step": 224
},
{
"completion_length": 649.0625152587891,
"epoch": 0.78125,
"grad_norm": 0.6371507048606873,
"kl": 0.0396728515625,
"learning_rate": 4.170658590682134e-07,
"loss": 0.1918,
"reward": 1.3125000149011612,
"reward_std": 0.32525811344385147,
"rewards/accuracy_reward": 0.4375000111758709,
"rewards/format_reward": 0.875,
"step": 225
},
{
"completion_length": 416.5833511352539,
"epoch": 0.7847222222222222,
"grad_norm": 2.145371198654175,
"kl": 0.03436279296875,
"learning_rate": 4.045563149022792e-07,
"loss": 0.0107,
"reward": 1.4375000298023224,
"reward_std": 0.21764283254742622,
"rewards/accuracy_reward": 0.4583333358168602,
"rewards/format_reward": 0.9791666716337204,
"step": 226
},
{
"completion_length": 545.5833435058594,
"epoch": 0.7881944444444444,
"grad_norm": 0.37443456053733826,
"kl": 0.04248046875,
"learning_rate": 3.922079410119428e-07,
"loss": 0.1246,
"reward": 1.3750000447034836,
"reward_std": 0.41228052973747253,
"rewards/accuracy_reward": 0.4375000149011612,
"rewards/format_reward": 0.9375000149011612,
"step": 227
},
{
"completion_length": 697.2500152587891,
"epoch": 0.7916666666666666,
"grad_norm": 0.4568527340888977,
"kl": 0.040924072265625,
"learning_rate": 3.800225541869216e-07,
"loss": 0.0888,
"reward": 1.2708333730697632,
"reward_std": 0.2446802221238613,
"rewards/accuracy_reward": 0.35416666977107525,
"rewards/format_reward": 0.9166666865348816,
"step": 228
},
{
"completion_length": 536.1250228881836,
"epoch": 0.7951388888888888,
"grad_norm": 1.1817526817321777,
"kl": 0.03704833984375,
"learning_rate": 3.680019472369961e-07,
"loss": 0.1213,
"reward": 1.2708333879709244,
"reward_std": 0.31970493495464325,
"rewards/accuracy_reward": 0.3333333395421505,
"rewards/format_reward": 0.9375000149011612,
"step": 229
},
{
"completion_length": 651.4791870117188,
"epoch": 0.7986111111111112,
"grad_norm": 0.7024496793746948,
"kl": 0.04119873046875,
"learning_rate": 3.5614788872823836e-07,
"loss": 0.1649,
"reward": 1.3125000298023224,
"reward_std": 0.49135757237672806,
"rewards/accuracy_reward": 0.4375000074505806,
"rewards/format_reward": 0.8750000298023224,
"step": 230
},
{
"completion_length": 641.3333435058594,
"epoch": 0.8020833333333334,
"grad_norm": 1.1681843996047974,
"kl": 0.042449951171875,
"learning_rate": 3.4446212272280564e-07,
"loss": 0.1224,
"reward": 0.958333358168602,
"reward_std": 0.2861081510782242,
"rewards/accuracy_reward": 0.06250000186264515,
"rewards/format_reward": 0.8958333432674408,
"step": 231
},
{
"completion_length": 644.0833435058594,
"epoch": 0.8055555555555556,
"grad_norm": 7.943032264709473,
"kl": 0.033935546875,
"learning_rate": 3.3294636852234106e-07,
"loss": 0.0831,
"reward": 1.4166666865348816,
"reward_std": 0.2957112491130829,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.9375,
"step": 232
},
{
"completion_length": 590.7916717529297,
"epoch": 0.8090277777777778,
"grad_norm": 1.9067875146865845,
"kl": 0.07415771484375,
"learning_rate": 3.2160232041501604e-07,
"loss": 0.2081,
"reward": 1.354166716337204,
"reward_std": 0.3842546232044697,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.8750000149011612,
"step": 233
},
{
"completion_length": 424.37501525878906,
"epoch": 0.8125,
"grad_norm": 0.14055544137954712,
"kl": 0.0258331298828125,
"learning_rate": 3.104316474262537e-07,
"loss": 0.0097,
"reward": 1.3125000298023224,
"reward_std": 0.1705273948609829,
"rewards/accuracy_reward": 0.31250000558793545,
"rewards/format_reward": 1.0,
"step": 234
},
{
"completion_length": 620.8541870117188,
"epoch": 0.8159722222222222,
"grad_norm": 2.1229634284973145,
"kl": 0.04376220703125,
"learning_rate": 2.994359930731681e-07,
"loss": 0.1707,
"reward": 1.3750000447034836,
"reward_std": 0.31592754647135735,
"rewards/accuracy_reward": 0.4583333395421505,
"rewards/format_reward": 0.9166666716337204,
"step": 235
},
{
"completion_length": 505.9791793823242,
"epoch": 0.8194444444444444,
"grad_norm": 0.03793416544795036,
"kl": 0.025665283203125,
"learning_rate": 2.8861697512275814e-07,
"loss": -0.0182,
"reward": 1.4375,
"reward_std": 0.06846532225608826,
"rewards/accuracy_reward": 0.4375,
"rewards/format_reward": 1.0,
"step": 236
},
{
"completion_length": 459.7708511352539,
"epoch": 0.8229166666666666,
"grad_norm": 0.16315123438835144,
"kl": 0.024749755859375,
"learning_rate": 2.7797618535388707e-07,
"loss": 0.0019,
"reward": 1.3333333730697632,
"reward_std": 0.2686738707125187,
"rewards/accuracy_reward": 0.3333333395421505,
"rewards/format_reward": 1.0,
"step": 237
},
{
"completion_length": 374.3125,
"epoch": 0.8263888888888888,
"grad_norm": 0.563412606716156,
"kl": 0.04132080078125,
"learning_rate": 2.675151893230907e-07,
"loss": -0.013,
"reward": 1.6041666865348816,
"reward_std": 0.1801304891705513,
"rewards/accuracy_reward": 0.6041666716337204,
"rewards/format_reward": 1.0,
"step": 238
},
{
"completion_length": 397.4166679382324,
"epoch": 0.8298611111111112,
"grad_norm": 2.5006625652313232,
"kl": 0.03570556640625,
"learning_rate": 2.572355261342369e-07,
"loss": 0.014,
"reward": 1.5416667312383652,
"reward_std": 0.20412414520978928,
"rewards/accuracy_reward": 0.5625000149011612,
"rewards/format_reward": 0.9791666716337204,
"step": 239
},
{
"completion_length": 691.5208435058594,
"epoch": 0.8333333333333334,
"grad_norm": 1.2476760149002075,
"kl": 0.049560546875,
"learning_rate": 2.4713870821208276e-07,
"loss": 0.0756,
"reward": 0.9583333432674408,
"reward_std": 0.23899272456765175,
"rewards/accuracy_reward": 0.0625,
"rewards/format_reward": 0.8958333432674408,
"step": 240
},
{
"completion_length": 561.0833435058594,
"epoch": 0.8368055555555556,
"grad_norm": 1.876926302909851,
"kl": 0.02349853515625,
"learning_rate": 2.3722622107975367e-07,
"loss": 0.0305,
"reward": 1.5000000596046448,
"reward_std": 0.22155844047665596,
"rewards/accuracy_reward": 0.5208333432674408,
"rewards/format_reward": 0.9791666716337204,
"step": 241
},
{
"completion_length": 532.2291870117188,
"epoch": 0.8402777777777778,
"grad_norm": 1.4736485481262207,
"kl": 0.02886962890625,
"learning_rate": 2.274995231401828e-07,
"loss": 0.0298,
"reward": 1.291666716337204,
"reward_std": 0.2861081659793854,
"rewards/accuracy_reward": 0.31250000558793545,
"rewards/format_reward": 0.9791666716337204,
"step": 242
},
{
"completion_length": 643.0625381469727,
"epoch": 0.84375,
"grad_norm": 8.321310043334961,
"kl": 0.04876708984375,
"learning_rate": 2.179600454615379e-07,
"loss": 0.1336,
"reward": 1.208333358168602,
"reward_std": 0.2686738707125187,
"rewards/accuracy_reward": 0.2708333395421505,
"rewards/format_reward": 0.9375000149011612,
"step": 243
},
{
"completion_length": 572.3750152587891,
"epoch": 0.8472222222222222,
"grad_norm": 1.7802728414535522,
"kl": 0.045257568359375,
"learning_rate": 2.0860919156667228e-07,
"loss": 0.074,
"reward": 1.2291666865348816,
"reward_std": 0.21764282882213593,
"rewards/accuracy_reward": 0.29166667722165585,
"rewards/format_reward": 0.9375000149011612,
"step": 244
},
{
"completion_length": 477.7291717529297,
"epoch": 0.8506944444444444,
"grad_norm": 0.03867839276790619,
"kl": 0.031280517578125,
"learning_rate": 1.9944833722662703e-07,
"loss": 0.0012,
"reward": 1.375,
"reward_std": 0.0,
"rewards/accuracy_reward": 0.375,
"rewards/format_reward": 1.0,
"step": 245
},
{
"completion_length": 425.54168701171875,
"epoch": 0.8541666666666666,
"grad_norm": 0.11910185217857361,
"kl": 0.02288818359375,
"learning_rate": 1.9047883025821777e-07,
"loss": 0.0133,
"reward": 1.4375000298023224,
"reward_std": 0.1705274060368538,
"rewards/accuracy_reward": 0.4375000149011612,
"rewards/format_reward": 1.0,
"step": 246
},
{
"completion_length": 497.00001525878906,
"epoch": 0.8576388888888888,
"grad_norm": 2.7801411151885986,
"kl": 0.044464111328125,
"learning_rate": 1.8170199032573138e-07,
"loss": 0.1203,
"reward": 1.541666716337204,
"reward_std": 0.3651650920510292,
"rewards/accuracy_reward": 0.5833333432674408,
"rewards/format_reward": 0.9583333432674408,
"step": 247
},
{
"completion_length": 445.2291793823242,
"epoch": 0.8611111111111112,
"grad_norm": 0.11879656463861465,
"kl": 0.0244140625,
"learning_rate": 1.7311910874676852e-07,
"loss": 0.0068,
"reward": 1.5208333730697632,
"reward_std": 0.2525114119052887,
"rewards/accuracy_reward": 0.5208333432674408,
"rewards/format_reward": 1.0,
"step": 248
},
{
"completion_length": 533.6875076293945,
"epoch": 0.8645833333333334,
"grad_norm": 8.463733673095703,
"kl": 0.1112060546875,
"learning_rate": 1.647314483022535e-07,
"loss": 0.1482,
"reward": 1.3750000298023224,
"reward_std": 0.3651651032269001,
"rewards/accuracy_reward": 0.4375000149011612,
"rewards/format_reward": 0.9375000149011612,
"step": 249
},
{
"completion_length": 524.9791717529297,
"epoch": 0.8680555555555556,
"grad_norm": 3.1616408824920654,
"kl": 0.049652099609375,
"learning_rate": 1.5654024305064514e-07,
"loss": 0.0704,
"reward": 1.4166667014360428,
"reward_std": 0.2646239884197712,
"rewards/accuracy_reward": 0.4583333432674408,
"rewards/format_reward": 0.9583333432674408,
"step": 250
},
{
"completion_length": 500.04168701171875,
"epoch": 0.8715277777777778,
"grad_norm": 0.11291686445474625,
"kl": 0.02020263671875,
"learning_rate": 1.4854669814637145e-07,
"loss": -0.0136,
"reward": 1.3125000298023224,
"reward_std": 0.1530931033194065,
"rewards/accuracy_reward": 0.31250002048909664,
"rewards/format_reward": 1.0,
"step": 251
},
{
"completion_length": 570.7708511352539,
"epoch": 0.875,
"grad_norm": 1.6747345924377441,
"kl": 0.073883056640625,
"learning_rate": 1.407519896625184e-07,
"loss": 0.0826,
"reward": 1.6041666865348816,
"reward_std": 0.41912318766117096,
"rewards/accuracy_reward": 0.6875000149011612,
"rewards/format_reward": 0.9166666716337204,
"step": 252
},
{
"completion_length": 615.0208435058594,
"epoch": 0.8784722222222222,
"grad_norm": 1.1258031129837036,
"kl": 0.0546875,
"learning_rate": 1.3315726441779629e-07,
"loss": 0.0998,
"reward": 1.5000000298023224,
"reward_std": 0.3117394223809242,
"rewards/accuracy_reward": 0.5625000074505806,
"rewards/format_reward": 0.9375000149011612,
"step": 253
},
{
"completion_length": 558.1041870117188,
"epoch": 0.8819444444444444,
"grad_norm": 2.2488062381744385,
"kl": 0.14599609375,
"learning_rate": 1.257636398078122e-07,
"loss": 0.0493,
"reward": 1.3333333432674408,
"reward_std": 0.11949636042118073,
"rewards/accuracy_reward": 0.3958333432674408,
"rewards/format_reward": 0.9375,
"step": 254
},
{
"completion_length": 481.1458435058594,
"epoch": 0.8854166666666666,
"grad_norm": 1.4159892797470093,
"kl": 0.0430908203125,
"learning_rate": 1.1857220364066801e-07,
"loss": 0.0668,
"reward": 1.625,
"reward_std": 0.2201632708311081,
"rewards/accuracy_reward": 0.666666679084301,
"rewards/format_reward": 0.9583333432674408,
"step": 255
},
{
"completion_length": 536.0208511352539,
"epoch": 0.8888888888888888,
"grad_norm": 5.645384311676025,
"kl": 0.03692626953125,
"learning_rate": 1.1158401397691459e-07,
"loss": 0.0404,
"reward": 1.4375000596046448,
"reward_std": 0.32525812089443207,
"rewards/accuracy_reward": 0.4583333507180214,
"rewards/format_reward": 0.9791666716337204,
"step": 256
},
{
"completion_length": 458.3541717529297,
"epoch": 0.8923611111111112,
"grad_norm": 0.18888327479362488,
"kl": 0.03729248046875,
"learning_rate": 1.0480009897388154e-07,
"loss": -0.0022,
"reward": 1.3125000596046448,
"reward_std": 0.29669976979494095,
"rewards/accuracy_reward": 0.33333334140479565,
"rewards/format_reward": 0.9791666716337204,
"step": 257
},
{
"completion_length": 612.1458587646484,
"epoch": 0.8958333333333334,
"grad_norm": 5.865067005157471,
"kl": 0.13897705078125,
"learning_rate": 9.822145673440658e-08,
"loss": 0.0542,
"reward": 1.2291667312383652,
"reward_std": 0.33713918179273605,
"rewards/accuracy_reward": 0.2708333395421505,
"rewards/format_reward": 0.9583333432674408,
"step": 258
},
{
"completion_length": 503.14583587646484,
"epoch": 0.8993055555555556,
"grad_norm": 1.1841014623641968,
"kl": 0.03631591796875,
"learning_rate": 9.184905515998698e-08,
"loss": 0.0956,
"reward": 1.5000000298023224,
"reward_std": 0.2646239623427391,
"rewards/accuracy_reward": 0.5416666716337204,
"rewards/format_reward": 0.9583333432674408,
"step": 259
},
{
"completion_length": 577.3125152587891,
"epoch": 0.9027777777777778,
"grad_norm": 4.693487644195557,
"kl": 0.0440673828125,
"learning_rate": 8.568383180837369e-08,
"loss": 0.0975,
"reward": 1.3125000298023224,
"reward_std": 0.21359294280409813,
"rewards/accuracy_reward": 0.3541666679084301,
"rewards/format_reward": 0.9583333432674408,
"step": 260
},
{
"completion_length": 732.8125305175781,
"epoch": 0.90625,
"grad_norm": 0.7248184680938721,
"kl": 0.07733154296875,
"learning_rate": 7.972669375563147e-08,
"loss": 0.0745,
"reward": 1.4583334028720856,
"reward_std": 0.37717197835445404,
"rewards/accuracy_reward": 0.5416666865348816,
"rewards/format_reward": 0.9166666716337204,
"step": 261
},
{
"completion_length": 481.2083435058594,
"epoch": 0.9097222222222222,
"grad_norm": 2.006963014602661,
"kl": 0.0384368896484375,
"learning_rate": 7.397851746268148e-08,
"loss": 0.0442,
"reward": 1.4583333730697632,
"reward_std": 0.20412413403391838,
"rewards/accuracy_reward": 0.4791666716337204,
"rewards/format_reward": 0.9791666716337204,
"step": 262
},
{
"completion_length": 625.3958587646484,
"epoch": 0.9131944444444444,
"grad_norm": 7.472949028015137,
"kl": 0.076202392578125,
"learning_rate": 6.844014864635095e-08,
"loss": 0.1915,
"reward": 1.2083333432674408,
"reward_std": 0.347730815410614,
"rewards/accuracy_reward": 0.2916666679084301,
"rewards/format_reward": 0.9166666716337204,
"step": 263
},
{
"completion_length": 720.2500305175781,
"epoch": 0.9166666666666666,
"grad_norm": 5.328312397003174,
"kl": 0.0657958984375,
"learning_rate": 6.311240215494307e-08,
"loss": 0.1129,
"reward": 1.1666667014360428,
"reward_std": 0.34296492487192154,
"rewards/accuracy_reward": 0.25000000186264515,
"rewards/format_reward": 0.9166666865348816,
"step": 264
},
{
"completion_length": 485.29168701171875,
"epoch": 0.9201388888888888,
"grad_norm": 11.490623474121094,
"kl": 0.0450439453125,
"learning_rate": 5.7996061848351653e-08,
"loss": 0.0173,
"reward": 1.5833333432674408,
"reward_std": 0.18111901730298996,
"rewards/accuracy_reward": 0.6250000149011612,
"rewards/format_reward": 0.9583333432674408,
"step": 265
},
{
"completion_length": 455.41668701171875,
"epoch": 0.9236111111111112,
"grad_norm": 0.3541830778121948,
"kl": 0.029052734375,
"learning_rate": 5.3091880482732446e-08,
"loss": 0.0396,
"reward": 1.3333333730697632,
"reward_std": 0.3061862140893936,
"rewards/accuracy_reward": 0.37500002048909664,
"rewards/format_reward": 0.9583333432674408,
"step": 266
},
{
"completion_length": 507.7291793823242,
"epoch": 0.9270833333333334,
"grad_norm": 1.1976244449615479,
"kl": 0.03515625,
"learning_rate": 4.8400579599751696e-08,
"loss": 0.0396,
"reward": 1.3958333730697632,
"reward_std": 0.4822668433189392,
"rewards/accuracy_reward": 0.4375000037252903,
"rewards/format_reward": 0.9583333432674408,
"step": 267
},
{
"completion_length": 617.2083587646484,
"epoch": 0.9305555555555556,
"grad_norm": 2.1803925037384033,
"kl": 0.034423828125,
"learning_rate": 4.3922849420428566e-08,
"loss": 0.021,
"reward": 1.1250000149011612,
"reward_std": 0.18404608592391014,
"rewards/accuracy_reward": 0.1458333358168602,
"rewards/format_reward": 0.9791666716337204,
"step": 268
},
{
"completion_length": 441.06250762939453,
"epoch": 0.9340277777777778,
"grad_norm": 0.4175410866737366,
"kl": 0.0267333984375,
"learning_rate": 3.9659348743582904e-08,
"loss": 0.0344,
"reward": 1.6041666865348816,
"reward_std": 0.1801304966211319,
"rewards/accuracy_reward": 0.625,
"rewards/format_reward": 0.9791666716337204,
"step": 269
},
{
"completion_length": 567.7291870117188,
"epoch": 0.9375,
"grad_norm": 1.3977940082550049,
"kl": 0.038909912109375,
"learning_rate": 3.561070484890822e-08,
"loss": 0.0753,
"reward": 1.3333333730697632,
"reward_std": 0.2471896931529045,
"rewards/accuracy_reward": 0.3750000149011612,
"rewards/format_reward": 0.9583333432674408,
"step": 270
},
{
"completion_length": 638.8333587646484,
"epoch": 0.9409722222222222,
"grad_norm": 7.876731872558594,
"kl": 0.06121826171875,
"learning_rate": 3.177751340468138e-08,
"loss": 0.0914,
"reward": 1.145833358168602,
"reward_std": 0.3683236688375473,
"rewards/accuracy_reward": 0.2083333358168602,
"rewards/format_reward": 0.9375000149011612,
"step": 271
},
{
"completion_length": 643.6458511352539,
"epoch": 0.9444444444444444,
"grad_norm": 2.4724576473236084,
"kl": 0.055206298828125,
"learning_rate": 2.8160338380123052e-08,
"loss": 0.0717,
"reward": 1.2500000298023224,
"reward_std": 0.20412413775920868,
"rewards/accuracy_reward": 0.2916666679084301,
"rewards/format_reward": 0.9583333432674408,
"step": 272
},
{
"completion_length": 465.31251525878906,
"epoch": 0.9479166666666666,
"grad_norm": 0.8830697536468506,
"kl": 0.031280517578125,
"learning_rate": 2.475971196242238e-08,
"loss": 0.0348,
"reward": 1.6041666865348816,
"reward_std": 0.1946377009153366,
"rewards/accuracy_reward": 0.6250000111758709,
"rewards/format_reward": 0.9791666716337204,
"step": 273
},
{
"completion_length": 752.2916717529297,
"epoch": 0.9513888888888888,
"grad_norm": 2.7944793701171875,
"kl": 0.058990478515625,
"learning_rate": 2.1576134478437316e-08,
"loss": 0.1499,
"reward": 1.1875000298023224,
"reward_std": 0.38299770653247833,
"rewards/accuracy_reward": 0.2708333469927311,
"rewards/format_reward": 0.9166666865348816,
"step": 274
},
{
"completion_length": 659.2916793823242,
"epoch": 0.9548611111111112,
"grad_norm": 3.7506420612335205,
"kl": 0.10986328125,
"learning_rate": 1.861007432108247e-08,
"loss": 0.1699,
"reward": 1.0416666865348816,
"reward_std": 0.30354244261980057,
"rewards/accuracy_reward": 0.2083333358168602,
"rewards/format_reward": 0.8333333432674408,
"step": 275
},
{
"completion_length": 395.4583435058594,
"epoch": 0.9583333333333334,
"grad_norm": 0.5847988724708557,
"kl": 0.028656005859375,
"learning_rate": 1.5861967880415607e-08,
"loss": 0.0542,
"reward": 1.7500000298023224,
"reward_std": 0.14512762054800987,
"rewards/accuracy_reward": 0.7708333432674408,
"rewards/format_reward": 0.9791666716337204,
"step": 276
},
{
"completion_length": 527.1458511352539,
"epoch": 0.9618055555555556,
"grad_norm": 2.3661959171295166,
"kl": 0.037567138671875,
"learning_rate": 1.3332219479432307e-08,
"loss": 0.043,
"reward": 1.4583333730697632,
"reward_std": 0.333223607391119,
"rewards/accuracy_reward": 0.47916667722165585,
"rewards/format_reward": 0.9791666716337204,
"step": 277
},
{
"completion_length": 549.2500152587891,
"epoch": 0.9652777777777778,
"grad_norm": 2.8095014095306396,
"kl": 0.026641845703125,
"learning_rate": 1.1021201314579399e-08,
"loss": 0.0055,
"reward": 1.3333333730697632,
"reward_std": 0.3006153665482998,
"rewards/accuracy_reward": 0.3541666828095913,
"rewards/format_reward": 0.9791666716337204,
"step": 278
},
{
"completion_length": 313.6458396911621,
"epoch": 0.96875,
"grad_norm": 0.06768506020307541,
"kl": 0.024871826171875,
"learning_rate": 8.92925340099343e-09,
"loss": -0.0247,
"reward": 1.6041666865348816,
"reward_std": 0.13301505148410797,
"rewards/accuracy_reward": 0.6041666716337204,
"rewards/format_reward": 1.0,
"step": 279
},
{
"completion_length": 755.3750152587891,
"epoch": 0.9722222222222222,
"grad_norm": 7.620341777801514,
"kl": 0.11541748046875,
"learning_rate": 7.056683522476181e-09,
"loss": 0.1675,
"reward": 1.145833358168602,
"reward_std": 0.2996268570423126,
"rewards/accuracy_reward": 0.2916666679084301,
"rewards/format_reward": 0.8541666865348816,
"step": 280
},
{
"completion_length": 470.1041793823242,
"epoch": 0.9756944444444444,
"grad_norm": 0.13627387583255768,
"kl": 0.025299072265625,
"learning_rate": 5.403767186210218e-09,
"loss": -0.0106,
"reward": 1.4166666865348816,
"reward_std": 0.3332235924899578,
"rewards/accuracy_reward": 0.416666679084301,
"rewards/format_reward": 1.0,
"step": 281
},
{
"completion_length": 535.0625228881836,
"epoch": 0.9791666666666666,
"grad_norm": 0.968426525592804,
"kl": 0.04052734375,
"learning_rate": 3.970747582224488e-09,
"loss": 0.0522,
"reward": 1.3541666865348816,
"reward_std": 0.22407887876033783,
"rewards/accuracy_reward": 0.3750000074505806,
"rewards/format_reward": 0.9791666716337204,
"step": 282
},
{
"completion_length": 479.0833511352539,
"epoch": 0.9826388888888888,
"grad_norm": 19.247583389282227,
"kl": 0.032440185546875,
"learning_rate": 2.757835547614107e-09,
"loss": 0.0698,
"reward": 1.5208333432674408,
"reward_std": 0.16913224011659622,
"rewards/accuracy_reward": 0.541666679084301,
"rewards/format_reward": 0.9791666716337204,
"step": 283
},
{
"completion_length": 520.5833435058594,
"epoch": 0.9861111111111112,
"grad_norm": 0.10353828221559525,
"kl": 0.02850341796875,
"learning_rate": 1.7652095355205068e-09,
"loss": 0.0174,
"reward": 1.2708333730697632,
"reward_std": 0.11558076366782188,
"rewards/accuracy_reward": 0.2708333395421505,
"rewards/format_reward": 1.0,
"step": 284
},
{
"completion_length": 524.3541793823242,
"epoch": 0.9895833333333334,
"grad_norm": 0.581836998462677,
"kl": 0.044403076171875,
"learning_rate": 9.930155888761006e-10,
"loss": 0.069,
"reward": 1.4791666865348816,
"reward_std": 0.27258946001529694,
"rewards/accuracy_reward": 0.5000000149011612,
"rewards/format_reward": 0.9791666716337204,
"step": 285
},
{
"completion_length": 605.5833435058594,
"epoch": 0.9930555555555556,
"grad_norm": 2.5457794666290283,
"kl": 0.101348876953125,
"learning_rate": 4.413673189168077e-10,
"loss": 0.112,
"reward": 1.0833333879709244,
"reward_std": 0.4056045413017273,
"rewards/accuracy_reward": 0.2083333358168602,
"rewards/format_reward": 0.8750000149011612,
"step": 286
},
{
"completion_length": 663.5833435058594,
"epoch": 0.9965277777777778,
"grad_norm": 1.5694972276687622,
"kl": 0.1168212890625,
"learning_rate": 1.1034588846758897e-10,
"loss": 0.0763,
"reward": 1.1041666865348816,
"reward_std": 0.3627704493701458,
"rewards/accuracy_reward": 0.22916666977107525,
"rewards/format_reward": 0.875,
"step": 287
},
{
"completion_length": 625.8125152587891,
"epoch": 1.0,
"grad_norm": 0.39495694637298584,
"kl": 0.0472412109375,
"learning_rate": 0.0,
"loss": -0.0067,
"reward": 1.5208333730697632,
"reward_std": 0.27119430527091026,
"rewards/accuracy_reward": 0.5416666865348816,
"rewards/format_reward": 0.9791666716337204,
"step": 288
},
{
"epoch": 1.0,
"eval_completion_length": 551.2072158536882,
"eval_kl": 0.06933934883048527,
"eval_loss": 0.0844486728310585,
"eval_reward": 1.3422709299178281,
"eval_reward_std": 0.3130362899101753,
"eval_rewards/accuracy_reward": 0.401812697825475,
"eval_rewards/format_reward": 0.9404582175963595,
"eval_runtime": 11393.662,
"eval_samples_per_second": 0.116,
"eval_steps_per_second": 0.01,
"step": 288
},
{
"epoch": 1.0,
"step": 288,
"total_flos": 0.0,
"train_loss": 0.2942696151104529,
"train_runtime": 40023.3398,
"train_samples_per_second": 0.058,
"train_steps_per_second": 0.007
}
],
"logging_steps": 1,
"max_steps": 288,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 500,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 3,
"trial_name": null,
"trial_params": null
}