{ "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 10, "global_step": 288, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "completion_length": 741.770866394043, "epoch": 0.003472222222222222, "grad_norm": 0.14295190572738647, "kl": 0.0, "learning_rate": 1.0344827586206897e-07, "loss": 0.1884, "reward": 1.1458333432674408, "reward_std": 0.33713918551802635, "rewards/accuracy_reward": 0.3750000111758709, "rewards/format_reward": 0.7708333432674408, "step": 1 }, { "completion_length": 569.3750076293945, "epoch": 0.006944444444444444, "grad_norm": 0.15209616720676422, "kl": 0.0, "learning_rate": 2.0689655172413793e-07, "loss": 0.084, "reward": 1.375, "reward_std": 0.34609566628932953, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.8958333432674408, "step": 2 }, { "completion_length": 910.6875381469727, "epoch": 0.010416666666666666, "grad_norm": 0.14200489223003387, "kl": 3.3035874366760254e-05, "learning_rate": 3.103448275862069e-07, "loss": 0.1972, "reward": 1.2083333656191826, "reward_std": 0.3977733254432678, "rewards/accuracy_reward": 0.5416666865348816, "rewards/format_reward": 0.666666679084301, "step": 3 }, { "completion_length": 1090.9792022705078, "epoch": 0.013888888888888888, "grad_norm": 0.14168737828731537, "kl": 2.1979212760925293e-05, "learning_rate": 4.1379310344827586e-07, "loss": 0.2496, "reward": 0.958333358168602, "reward_std": 0.5603352189064026, "rewards/accuracy_reward": 0.2708333395421505, "rewards/format_reward": 0.6875000149011612, "step": 4 }, { "completion_length": 874.5833435058594, "epoch": 0.017361111111111112, "grad_norm": 0.1556071788072586, "kl": 2.1822750568389893e-05, "learning_rate": 5.172413793103449e-07, "loss": 0.2382, "reward": 1.1250000298023224, "reward_std": 0.5055268257856369, "rewards/accuracy_reward": 0.3750000074505806, "rewards/format_reward": 0.7500000298023224, "step": 5 }, { "completion_length": 782.0833435058594, "epoch": 0.020833333333333332, "grad_norm": 0.13410623371601105, "kl": 2.975761890411377e-05, "learning_rate": 6.206896551724138e-07, "loss": 0.2206, "reward": 1.1666666865348816, "reward_std": 0.45878127589821815, "rewards/accuracy_reward": 0.3333333469927311, "rewards/format_reward": 0.833333358168602, "step": 6 }, { "completion_length": 865.7500152587891, "epoch": 0.024305555555555556, "grad_norm": 0.14228324592113495, "kl": 3.835558891296387e-05, "learning_rate": 7.241379310344829e-07, "loss": 0.1384, "reward": 0.9583333730697632, "reward_std": 0.39372341707348824, "rewards/accuracy_reward": 0.18750000186264515, "rewards/format_reward": 0.770833358168602, "step": 7 }, { "completion_length": 789.3333778381348, "epoch": 0.027777777777777776, "grad_norm": 0.1659800410270691, "kl": 5.2928924560546875e-05, "learning_rate": 8.275862068965517e-07, "loss": 0.2217, "reward": 1.0000000298023224, "reward_std": 0.4655914157629013, "rewards/accuracy_reward": 0.2500000111758709, "rewards/format_reward": 0.7500000149011612, "step": 8 }, { "completion_length": 580.5625152587891, "epoch": 0.03125, "grad_norm": 0.12579208612442017, "kl": 4.9740076065063477e-05, "learning_rate": 9.310344827586207e-07, "loss": 0.1162, "reward": 1.5000000298023224, "reward_std": 0.3332235887646675, "rewards/accuracy_reward": 0.6041666716337204, "rewards/format_reward": 0.8958333432674408, "step": 9 }, { "completion_length": 629.1458435058594, "epoch": 0.034722222222222224, "grad_norm": 0.17187905311584473, "kl": 4.869699478149414e-05, "learning_rate": 1.0344827586206898e-06, "loss": 0.1916, "reward": 1.2291667014360428, "reward_std": 0.4688647650182247, "rewards/accuracy_reward": 0.3958333395421505, "rewards/format_reward": 0.833333358168602, "step": 10 }, { "completion_length": 784.0416870117188, "epoch": 0.03819444444444445, "grad_norm": 0.17849187552928925, "kl": 5.3048133850097656e-05, "learning_rate": 1.1379310344827587e-06, "loss": 0.4343, "reward": 1.0625000149011612, "reward_std": 0.5581847056746483, "rewards/accuracy_reward": 0.3125000074505806, "rewards/format_reward": 0.7500000149011612, "step": 11 }, { "completion_length": 995.1458435058594, "epoch": 0.041666666666666664, "grad_norm": 0.20440581440925598, "kl": 5.9485435485839844e-05, "learning_rate": 1.2413793103448275e-06, "loss": 0.1746, "reward": 0.8958333507180214, "reward_std": 0.5718096792697906, "rewards/accuracy_reward": 0.25000000558793545, "rewards/format_reward": 0.645833358168602, "step": 12 }, { "completion_length": 931.0000152587891, "epoch": 0.04513888888888889, "grad_norm": 0.14080987870693207, "kl": 7.534027099609375e-05, "learning_rate": 1.3448275862068966e-06, "loss": 0.2987, "reward": 1.0625000298023224, "reward_std": 0.43706150352954865, "rewards/accuracy_reward": 0.3958333395421505, "rewards/format_reward": 0.6666666716337204, "step": 13 }, { "completion_length": 962.5625305175781, "epoch": 0.04861111111111111, "grad_norm": 0.10382459312677383, "kl": 4.079937934875488e-05, "learning_rate": 1.4482758620689657e-06, "loss": 0.2287, "reward": 1.1875000447034836, "reward_std": 0.47216174751520157, "rewards/accuracy_reward": 0.4583333358168602, "rewards/format_reward": 0.7291667014360428, "step": 14 }, { "completion_length": 1093.5416870117188, "epoch": 0.052083333333333336, "grad_norm": 0.17387475073337555, "kl": 5.698204040527344e-05, "learning_rate": 1.5517241379310346e-06, "loss": 0.2892, "reward": 0.833333358168602, "reward_std": 0.5643851384520531, "rewards/accuracy_reward": 0.27083334140479565, "rewards/format_reward": 0.5625000074505806, "step": 15 }, { "completion_length": 841.4583435058594, "epoch": 0.05555555555555555, "grad_norm": 0.17102335393428802, "kl": 0.0001055002212524414, "learning_rate": 1.6551724137931035e-06, "loss": 0.4448, "reward": 0.9375000298023224, "reward_std": 0.6173017770051956, "rewards/accuracy_reward": 0.18750000186264515, "rewards/format_reward": 0.7500000298023224, "step": 16 }, { "completion_length": 668.8125152587891, "epoch": 0.059027777777777776, "grad_norm": 0.1323493868112564, "kl": 0.00011396408081054688, "learning_rate": 1.7586206896551723e-06, "loss": 0.1694, "reward": 1.3750000298023224, "reward_std": 0.18404608592391014, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.8750000149011612, "step": 17 }, { "completion_length": 764.0417022705078, "epoch": 0.0625, "grad_norm": 0.16820357739925385, "kl": 0.0001246929168701172, "learning_rate": 1.8620689655172414e-06, "loss": 0.2849, "reward": 1.1875000298023224, "reward_std": 0.5668945834040642, "rewards/accuracy_reward": 0.35416667722165585, "rewards/format_reward": 0.8333333432674408, "step": 18 }, { "completion_length": 492.29168701171875, "epoch": 0.06597222222222222, "grad_norm": 0.23659060895442963, "kl": 0.00019979476928710938, "learning_rate": 1.9655172413793105e-06, "loss": 0.0967, "reward": 1.3333333730697632, "reward_std": 0.48326630145311356, "rewards/accuracy_reward": 0.37500001303851604, "rewards/format_reward": 0.9583333432674408, "step": 19 }, { "completion_length": 765.0833587646484, "epoch": 0.06944444444444445, "grad_norm": 0.15367941558361053, "kl": 0.0003204345703125, "learning_rate": 2.0689655172413796e-06, "loss": 0.1026, "reward": 1.208333358168602, "reward_std": 0.40823066234588623, "rewards/accuracy_reward": 0.35416666977107525, "rewards/format_reward": 0.8541666865348816, "step": 20 }, { "completion_length": 855.1041870117188, "epoch": 0.07291666666666667, "grad_norm": 0.14101287722587585, "kl": 0.0004773139953613281, "learning_rate": 2.1724137931034482e-06, "loss": 0.2814, "reward": 1.1875000596046448, "reward_std": 0.6385418735444546, "rewards/accuracy_reward": 0.41666667722165585, "rewards/format_reward": 0.770833358168602, "step": 21 }, { "completion_length": 643.8541946411133, "epoch": 0.0763888888888889, "grad_norm": 0.1760379821062088, "kl": 0.00046443939208984375, "learning_rate": 2.2758620689655173e-06, "loss": 0.2163, "reward": 1.166666716337204, "reward_std": 0.42428741604089737, "rewards/accuracy_reward": 0.2916666716337204, "rewards/format_reward": 0.8750000298023224, "step": 22 }, { "completion_length": 706.5208358764648, "epoch": 0.0798611111111111, "grad_norm": 0.14137427508831024, "kl": 0.000720977783203125, "learning_rate": 2.3793103448275864e-06, "loss": 0.151, "reward": 1.2916666716337204, "reward_std": 0.30074116960167885, "rewards/accuracy_reward": 0.479166679084301, "rewards/format_reward": 0.8125000149011612, "step": 23 }, { "completion_length": 1077.7916946411133, "epoch": 0.08333333333333333, "grad_norm": 0.1112079992890358, "kl": 0.0012264251708984375, "learning_rate": 2.482758620689655e-06, "loss": 0.1373, "reward": 1.1041666977107525, "reward_std": 0.47216175869107246, "rewards/accuracy_reward": 0.5000000149011612, "rewards/format_reward": 0.6041666828095913, "step": 24 }, { "completion_length": 796.0833435058594, "epoch": 0.08680555555555555, "grad_norm": 0.1721019446849823, "kl": 0.0014591217041015625, "learning_rate": 2.586206896551724e-06, "loss": 0.339, "reward": 1.1041666865348816, "reward_std": 0.5037333369255066, "rewards/accuracy_reward": 0.31250000558793545, "rewards/format_reward": 0.7916666865348816, "step": 25 }, { "completion_length": 949.2292022705078, "epoch": 0.09027777777777778, "grad_norm": 0.21633172035217285, "kl": 0.002002716064453125, "learning_rate": 2.6896551724137932e-06, "loss": 0.3764, "reward": 0.833333358168602, "reward_std": 0.45271996408700943, "rewards/accuracy_reward": 0.14583333395421505, "rewards/format_reward": 0.6875000149011612, "step": 26 }, { "completion_length": 903.5625305175781, "epoch": 0.09375, "grad_norm": 0.18209120631217957, "kl": 0.0035114288330078125, "learning_rate": 2.793103448275862e-06, "loss": 0.2553, "reward": 1.083333358168602, "reward_std": 0.4661043584346771, "rewards/accuracy_reward": 0.33333334140479565, "rewards/format_reward": 0.7500000149011612, "step": 27 }, { "completion_length": 840.4167022705078, "epoch": 0.09722222222222222, "grad_norm": 0.19374202191829681, "kl": 0.003124237060546875, "learning_rate": 2.8965517241379314e-06, "loss": 0.2207, "reward": 1.208333358168602, "reward_std": 0.5256049036979675, "rewards/accuracy_reward": 0.43750000558793545, "rewards/format_reward": 0.770833358168602, "step": 28 }, { "completion_length": 666.4791946411133, "epoch": 0.10069444444444445, "grad_norm": 0.2066318243741989, "kl": 0.002513885498046875, "learning_rate": 3e-06, "loss": 0.1473, "reward": 1.3750000298023224, "reward_std": 0.3506578877568245, "rewards/accuracy_reward": 0.5208333432674408, "rewards/format_reward": 0.8541666716337204, "step": 29 }, { "completion_length": 895.6041870117188, "epoch": 0.10416666666666667, "grad_norm": 0.12993822991847992, "kl": 0.004589080810546875, "learning_rate": 2.9998896541115324e-06, "loss": 0.2169, "reward": 0.9166666865348816, "reward_std": 0.48566947132349014, "rewards/accuracy_reward": 0.2083333395421505, "rewards/format_reward": 0.708333358168602, "step": 30 }, { "completion_length": 1015.8333435058594, "epoch": 0.1076388888888889, "grad_norm": 0.14162737131118774, "kl": 0.0057220458984375, "learning_rate": 2.999558632681083e-06, "loss": 0.262, "reward": 0.9375000298023224, "reward_std": 0.5128131434321404, "rewards/accuracy_reward": 0.2708333469927311, "rewards/format_reward": 0.6666666865348816, "step": 31 }, { "completion_length": 823.3750152587891, "epoch": 0.1111111111111111, "grad_norm": 0.19338518381118774, "kl": 0.0045013427734375, "learning_rate": 2.999006984411124e-06, "loss": 0.1761, "reward": 1.2500000298023224, "reward_std": 0.39372342824935913, "rewards/accuracy_reward": 0.4375000074505806, "rewards/format_reward": 0.8125000149011612, "step": 32 }, { "completion_length": 599.1041946411133, "epoch": 0.11458333333333333, "grad_norm": 0.11651767790317535, "kl": 0.004863739013671875, "learning_rate": 2.9982347904644796e-06, "loss": 0.143, "reward": 1.333333358168602, "reward_std": 0.36668604612350464, "rewards/accuracy_reward": 0.45833334885537624, "rewards/format_reward": 0.8750000149011612, "step": 33 }, { "completion_length": 807.2500152587891, "epoch": 0.11805555555555555, "grad_norm": 0.16386348009109497, "kl": 0.00554656982421875, "learning_rate": 2.997242164452386e-06, "loss": 0.1953, "reward": 1.1875000149011612, "reward_std": 0.36124949902296066, "rewards/accuracy_reward": 0.37500000558793545, "rewards/format_reward": 0.8125000298023224, "step": 34 }, { "completion_length": 819.1666793823242, "epoch": 0.12152777777777778, "grad_norm": 0.12757916748523712, "kl": 0.006011962890625, "learning_rate": 2.9960292524177757e-06, "loss": 0.2062, "reward": 1.145833358168602, "reward_std": 0.4711427614092827, "rewards/accuracy_reward": 0.33333333395421505, "rewards/format_reward": 0.8125000149011612, "step": 35 }, { "completion_length": 730.375, "epoch": 0.125, "grad_norm": 0.22184336185455322, "kl": 0.00624847412109375, "learning_rate": 2.99459623281379e-06, "loss": 0.1774, "reward": 1.3750000298023224, "reward_std": 0.48566946387290955, "rewards/accuracy_reward": 0.541666679084301, "rewards/format_reward": 0.833333358168602, "step": 36 }, { "completion_length": 830.8333587646484, "epoch": 0.1284722222222222, "grad_norm": 0.12250956892967224, "kl": 0.00920867919921875, "learning_rate": 2.992943316477524e-06, "loss": 0.1244, "reward": 1.479166716337204, "reward_std": 0.42872630059719086, "rewards/accuracy_reward": 0.6666666865348816, "rewards/format_reward": 0.8125000149011612, "step": 37 }, { "completion_length": 797.0416946411133, "epoch": 0.13194444444444445, "grad_norm": 0.15244413912296295, "kl": 0.01052093505859375, "learning_rate": 2.991070746599007e-06, "loss": 0.2096, "reward": 1.041666716337204, "reward_std": 0.41380148753523827, "rewards/accuracy_reward": 0.3333333432674408, "rewards/format_reward": 0.7083333432674408, "step": 38 }, { "completion_length": 522.7291946411133, "epoch": 0.13541666666666666, "grad_norm": 0.0949152484536171, "kl": 0.00616455078125, "learning_rate": 2.988978798685421e-06, "loss": 0.1237, "reward": 1.5416666865348816, "reward_std": 0.19855329766869545, "rewards/accuracy_reward": 0.6250000055879354, "rewards/format_reward": 0.9166666716337204, "step": 39 }, { "completion_length": 839.8958587646484, "epoch": 0.1388888888888889, "grad_norm": 0.20609034597873688, "kl": 0.0126800537109375, "learning_rate": 2.986667780520568e-06, "loss": 0.4117, "reward": 1.041666716337204, "reward_std": 0.5922943651676178, "rewards/accuracy_reward": 0.3125000111758709, "rewards/format_reward": 0.7291667014360428, "step": 40 }, { "completion_length": 765.9375305175781, "epoch": 0.1423611111111111, "grad_norm": 0.12492669373750687, "kl": 0.01329803466796875, "learning_rate": 2.9841380321195844e-06, "loss": 0.2425, "reward": 1.2083333432674408, "reward_std": 0.32274864614009857, "rewards/accuracy_reward": 0.4583333358168602, "rewards/format_reward": 0.7500000149011612, "step": 41 }, { "completion_length": 682.2291870117188, "epoch": 0.14583333333333334, "grad_norm": 0.39590033888816833, "kl": 0.00971221923828125, "learning_rate": 2.9813899256789174e-06, "loss": 0.0408, "reward": 1.1458333879709244, "reward_std": 0.21764283254742622, "rewards/accuracy_reward": 0.2291666716337204, "rewards/format_reward": 0.9166666865348816, "step": 42 }, { "completion_length": 700.2916946411133, "epoch": 0.14930555555555555, "grad_norm": 0.1499091386795044, "kl": 0.01000213623046875, "learning_rate": 2.978423865521563e-06, "loss": 0.1978, "reward": 1.4583333730697632, "reward_std": 0.42252586781978607, "rewards/accuracy_reward": 0.604166679084301, "rewards/format_reward": 0.8541666865348816, "step": 43 }, { "completion_length": 748.7291870117188, "epoch": 0.1527777777777778, "grad_norm": 0.1765832006931305, "kl": 0.01324462890625, "learning_rate": 2.9752402880375777e-06, "loss": 0.1777, "reward": 1.2291667014360428, "reward_std": 0.41129202023148537, "rewards/accuracy_reward": 0.416666679084301, "rewards/format_reward": 0.8125000149011612, "step": 44 }, { "completion_length": 653.2916870117188, "epoch": 0.15625, "grad_norm": 0.1796155720949173, "kl": 0.0156707763671875, "learning_rate": 2.9718396616198768e-06, "loss": 0.1816, "reward": 1.3958333730697632, "reward_std": 0.5367004983127117, "rewards/accuracy_reward": 0.5000000223517418, "rewards/format_reward": 0.8958333432674408, "step": 45 }, { "completion_length": 822.8750305175781, "epoch": 0.1597222222222222, "grad_norm": 0.2125193178653717, "kl": 0.01458740234375, "learning_rate": 2.9682224865953187e-06, "loss": 0.2588, "reward": 1.1250000149011612, "reward_std": 0.5796796828508377, "rewards/accuracy_reward": 0.4375000186264515, "rewards/format_reward": 0.6875000149011612, "step": 46 }, { "completion_length": 614.1875076293945, "epoch": 0.16319444444444445, "grad_norm": 0.26946258544921875, "kl": 0.029876708984375, "learning_rate": 2.9643892951510922e-06, "loss": 0.2902, "reward": 1.3958333730697632, "reward_std": 0.5642508193850517, "rewards/accuracy_reward": 0.6041666865348816, "rewards/format_reward": 0.7916666865348816, "step": 47 }, { "completion_length": 679.6666717529297, "epoch": 0.16666666666666666, "grad_norm": 0.24444054067134857, "kl": 0.0352783203125, "learning_rate": 2.9603406512564172e-06, "loss": 0.2401, "reward": 1.1458333730697632, "reward_std": 0.437806099653244, "rewards/accuracy_reward": 0.3125000074505806, "rewards/format_reward": 0.8333333432674408, "step": 48 }, { "completion_length": 881.6042022705078, "epoch": 0.1701388888888889, "grad_norm": 0.16416701674461365, "kl": 0.026885986328125, "learning_rate": 2.956077150579571e-06, "loss": 0.2443, "reward": 1.083333358168602, "reward_std": 0.46722716838121414, "rewards/accuracy_reward": 0.41666669212281704, "rewards/format_reward": 0.666666679084301, "step": 49 }, { "completion_length": 815.0833435058594, "epoch": 0.1736111111111111, "grad_norm": 0.3144943416118622, "kl": 0.0215911865234375, "learning_rate": 2.9515994204002487e-06, "loss": 0.2911, "reward": 1.0416666865348816, "reward_std": 0.6468362063169479, "rewards/accuracy_reward": 0.37500001303851604, "rewards/format_reward": 0.6666666865348816, "step": 50 }, { "completion_length": 730.6666870117188, "epoch": 0.17708333333333334, "grad_norm": 0.15091472864151, "kl": 0.020233154296875, "learning_rate": 2.946908119517268e-06, "loss": 0.1565, "reward": 1.041666716337204, "reward_std": 0.41783374547958374, "rewards/accuracy_reward": 0.2708333395421505, "rewards/format_reward": 0.770833358168602, "step": 51 }, { "completion_length": 857.1667022705078, "epoch": 0.18055555555555555, "grad_norm": 0.14366847276687622, "kl": 0.016937255859375, "learning_rate": 2.9420039381516486e-06, "loss": 0.2736, "reward": 1.0833333432674408, "reward_std": 0.5384852737188339, "rewards/accuracy_reward": 0.4166666679084301, "rewards/format_reward": 0.666666679084301, "step": 52 }, { "completion_length": 864.5000228881836, "epoch": 0.1840277777777778, "grad_norm": 0.19832737743854523, "kl": 0.016326904296875, "learning_rate": 2.936887597845057e-06, "loss": 0.3164, "reward": 1.2083333730697632, "reward_std": 0.5621002838015556, "rewards/accuracy_reward": 0.4166666828095913, "rewards/format_reward": 0.7916666865348816, "step": 53 }, { "completion_length": 899.2916870117188, "epoch": 0.1875, "grad_norm": 0.0909123495221138, "kl": 0.02020263671875, "learning_rate": 2.9315598513536496e-06, "loss": 0.1377, "reward": 1.250000011175871, "reward_std": 0.16661179810762405, "rewards/accuracy_reward": 0.520833333954215, "rewards/format_reward": 0.7291666772216558, "step": 54 }, { "completion_length": 1253.0625610351562, "epoch": 0.1909722222222222, "grad_norm": 0.22461599111557007, "kl": 0.027801513671875, "learning_rate": 2.9260214825373185e-06, "loss": 0.3105, "reward": 0.6250000298023224, "reward_std": 0.6435713469982147, "rewards/accuracy_reward": 0.14583333767950535, "rewards/format_reward": 0.479166679084301, "step": 55 }, { "completion_length": 1001.875, "epoch": 0.19444444444444445, "grad_norm": 0.13491399586200714, "kl": 0.0212554931640625, "learning_rate": 2.9202733062443688e-06, "loss": 0.3115, "reward": 1.0625000074505806, "reward_std": 0.5120971575379372, "rewards/accuracy_reward": 0.43750001676380634, "rewards/format_reward": 0.6250000260770321, "step": 56 }, { "completion_length": 1026.2916717529297, "epoch": 0.19791666666666666, "grad_norm": 0.24264831840991974, "kl": 0.0291290283203125, "learning_rate": 2.9143161681916264e-06, "loss": 0.5381, "reward": 1.0416667088866234, "reward_std": 0.6881812289357185, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.6041666939854622, "step": 57 }, { "completion_length": 730.9167022705078, "epoch": 0.2013888888888889, "grad_norm": 0.2211628556251526, "kl": 0.0186767578125, "learning_rate": 2.908150944840013e-06, "loss": 0.2167, "reward": 1.2083333879709244, "reward_std": 0.5205380246043205, "rewards/accuracy_reward": 0.43750000558793545, "rewards/format_reward": 0.770833358168602, "step": 58 }, { "completion_length": 1003.7500305175781, "epoch": 0.2048611111111111, "grad_norm": 0.17330045998096466, "kl": 0.021514892578125, "learning_rate": 2.9017785432655936e-06, "loss": 0.1788, "reward": 1.0625000298023224, "reward_std": 0.5476993918418884, "rewards/accuracy_reward": 0.37500001303851604, "rewards/format_reward": 0.6875000149011612, "step": 59 }, { "completion_length": 700.8750152587891, "epoch": 0.20833333333333334, "grad_norm": 0.25370052456855774, "kl": 0.0172576904296875, "learning_rate": 2.8951999010261185e-06, "loss": 0.1653, "reward": 1.3958333730697632, "reward_std": 0.49705731868743896, "rewards/accuracy_reward": 0.5833333432674408, "rewards/format_reward": 0.8125000149011612, "step": 60 }, { "completion_length": 1021.8750305175781, "epoch": 0.21180555555555555, "grad_norm": 0.15996123850345612, "kl": 0.0218505859375, "learning_rate": 2.888415986023086e-06, "loss": 0.2384, "reward": 1.0000000149011612, "reward_std": 0.5873726010322571, "rewards/accuracy_reward": 0.39583334140479565, "rewards/format_reward": 0.6041666865348816, "step": 61 }, { "completion_length": 1085.1458435058594, "epoch": 0.2152777777777778, "grad_norm": 0.2894808053970337, "kl": 0.023101806640625, "learning_rate": 2.8814277963593322e-06, "loss": 0.2188, "reward": 0.916666716337204, "reward_std": 0.49983538687229156, "rewards/accuracy_reward": 0.3541666865348816, "rewards/format_reward": 0.5625000298023224, "step": 62 }, { "completion_length": 553.7916870117188, "epoch": 0.21875, "grad_norm": 0.16853806376457214, "kl": 0.0146942138671875, "learning_rate": 2.8742363601921877e-06, "loss": 0.1238, "reward": 1.3125000447034836, "reward_std": 0.3627704493701458, "rewards/accuracy_reward": 0.39583334513008595, "rewards/format_reward": 0.9166666865348816, "step": 63 }, { "completion_length": 781.6875228881836, "epoch": 0.2222222222222222, "grad_norm": 0.20429612696170807, "kl": 0.018341064453125, "learning_rate": 2.866842735582204e-06, "loss": 0.2017, "reward": 1.2291666865348816, "reward_std": 0.5701745375990868, "rewards/accuracy_reward": 0.4375000074505806, "rewards/format_reward": 0.7916666865348816, "step": 64 }, { "completion_length": 639.7500152587891, "epoch": 0.22569444444444445, "grad_norm": 0.17851890623569489, "kl": 0.01776123046875, "learning_rate": 2.859248010337482e-06, "loss": 0.283, "reward": 1.2083333730697632, "reward_std": 0.40751465782523155, "rewards/accuracy_reward": 0.3750000037252903, "rewards/format_reward": 0.8333333432674408, "step": 65 }, { "completion_length": 988.6458740234375, "epoch": 0.22916666666666666, "grad_norm": 0.1674283742904663, "kl": 0.014739990234375, "learning_rate": 2.851453301853629e-06, "loss": 0.216, "reward": 1.1666667088866234, "reward_std": 0.42252587899565697, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.6875000223517418, "step": 66 }, { "completion_length": 1037.4375305175781, "epoch": 0.2326388888888889, "grad_norm": 0.14902418851852417, "kl": 0.0257568359375, "learning_rate": 2.8434597569493546e-06, "loss": 0.3065, "reward": 1.0000000447034836, "reward_std": 0.5058967247605324, "rewards/accuracy_reward": 0.37500000186264515, "rewards/format_reward": 0.6250000298023224, "step": 67 }, { "completion_length": 924.9375305175781, "epoch": 0.2361111111111111, "grad_norm": 0.11825034022331238, "kl": 0.01861572265625, "learning_rate": 2.8352685516977465e-06, "loss": 0.2105, "reward": 1.1041666865348816, "reward_std": 0.3898078352212906, "rewards/accuracy_reward": 0.43750000186264515, "rewards/format_reward": 0.666666679084301, "step": 68 }, { "completion_length": 1122.5833587646484, "epoch": 0.23958333333333334, "grad_norm": 0.15570542216300964, "kl": 0.0245819091796875, "learning_rate": 2.8268808912532317e-06, "loss": 0.3435, "reward": 0.9375000223517418, "reward_std": 0.5876451432704926, "rewards/accuracy_reward": 0.37500000558793545, "rewards/format_reward": 0.5625000149011612, "step": 69 }, { "completion_length": 1177.7917022705078, "epoch": 0.24305555555555555, "grad_norm": 0.16041037440299988, "kl": 0.028564453125, "learning_rate": 2.8182980096742684e-06, "loss": 0.2782, "reward": 0.770833358168602, "reward_std": 0.48087164387106895, "rewards/accuracy_reward": 0.3125000074505806, "rewards/format_reward": 0.4583333432674408, "step": 70 }, { "completion_length": 1269.1875610351562, "epoch": 0.2465277777777778, "grad_norm": 0.13235001266002655, "kl": 0.024261474609375, "learning_rate": 2.8095211697417823e-06, "loss": 0.1528, "reward": 0.7500000298023224, "reward_std": 0.5446660071611404, "rewards/accuracy_reward": 0.25000000558793545, "rewards/format_reward": 0.5000000149011612, "step": 71 }, { "completion_length": 1170.6875305175781, "epoch": 0.25, "grad_norm": 0.16478340327739716, "kl": 0.030059814453125, "learning_rate": 2.8005516627733725e-06, "loss": 0.3112, "reward": 0.6875000111758709, "reward_std": 0.4726746752858162, "rewards/accuracy_reward": 0.20833333395421505, "rewards/format_reward": 0.4791666828095913, "step": 72 }, { "completion_length": 1296.1667175292969, "epoch": 0.2534722222222222, "grad_norm": 0.15644334256649017, "kl": 0.028564453125, "learning_rate": 2.791390808433328e-06, "loss": 0.2968, "reward": 0.7500000074505806, "reward_std": 0.5360908359289169, "rewards/accuracy_reward": 0.31250000186264515, "rewards/format_reward": 0.4375, "step": 73 }, { "completion_length": 1256.3541717529297, "epoch": 0.2569444444444444, "grad_norm": 0.15503916144371033, "kl": 0.02874755859375, "learning_rate": 2.7820399545384623e-06, "loss": 0.3103, "reward": 0.9166667014360428, "reward_std": 0.6742783933877945, "rewards/accuracy_reward": 0.4375000111758709, "rewards/format_reward": 0.4791666716337204, "step": 74 }, { "completion_length": 1697.7500305175781, "epoch": 0.2604166666666667, "grad_norm": 0.12124615162611008, "kl": 0.04644775390625, "learning_rate": 2.7725004768598174e-06, "loss": 0.2702, "reward": 0.16666667349636555, "reward_std": 0.2861081510782242, "rewards/accuracy_reward": 0.0, "rewards/format_reward": 0.16666667349636555, "step": 75 }, { "completion_length": 935.3333435058594, "epoch": 0.2638888888888889, "grad_norm": 0.27098900079727173, "kl": 0.05230712890625, "learning_rate": 2.7627737789202467e-06, "loss": 0.4141, "reward": 0.958333358168602, "reward_std": 0.5210509821772575, "rewards/accuracy_reward": 0.3333333395421505, "rewards/format_reward": 0.6250000149011612, "step": 76 }, { "completion_length": 1698.9583740234375, "epoch": 0.2673611111111111, "grad_norm": 0.08918589353561401, "kl": 0.036102294921875, "learning_rate": 2.7528612917879175e-06, "loss": 0.2238, "reward": 0.3125000149011612, "reward_std": 0.4351623058319092, "rewards/accuracy_reward": 0.12500000558793545, "rewards/format_reward": 0.1875000074505806, "step": 77 }, { "completion_length": 1350.2916870117188, "epoch": 0.2708333333333333, "grad_norm": 0.5975456237792969, "kl": 0.1876220703125, "learning_rate": 2.7427644738657634e-06, "loss": 0.1973, "reward": 0.4583333507180214, "reward_std": 0.3006153777241707, "rewards/accuracy_reward": 0.12500000558793545, "rewards/format_reward": 0.3333333358168602, "step": 78 }, { "completion_length": 1257.2917022705078, "epoch": 0.2743055555555556, "grad_norm": 0.15060631930828094, "kl": 0.02825927734375, "learning_rate": 2.7324848106769096e-06, "loss": 0.4094, "reward": 0.7500000149011612, "reward_std": 0.696753554046154, "rewards/accuracy_reward": 0.31250000931322575, "rewards/format_reward": 0.4375000149011612, "step": 79 }, { "completion_length": 697.1875152587891, "epoch": 0.2777777777777778, "grad_norm": 0.16244620084762573, "kl": 0.021240234375, "learning_rate": 2.722023814646113e-06, "loss": 0.2586, "reward": 1.416666716337204, "reward_std": 0.43528565019369125, "rewards/accuracy_reward": 0.6041666865348816, "rewards/format_reward": 0.8125000149011612, "step": 80 }, { "completion_length": 812.833366394043, "epoch": 0.28125, "grad_norm": 0.1700841337442398, "kl": 0.027679443359375, "learning_rate": 2.7113830248772426e-06, "loss": 0.3001, "reward": 0.9791667014360428, "reward_std": 0.3802047595381737, "rewards/accuracy_reward": 0.229166679084301, "rewards/format_reward": 0.7500000149011612, "step": 81 }, { "completion_length": 525.3333511352539, "epoch": 0.2847222222222222, "grad_norm": 0.11852161586284637, "kl": 0.0202484130859375, "learning_rate": 2.7005640069268325e-06, "loss": 0.1364, "reward": 1.3958333432674408, "reward_std": 0.24189137294888496, "rewards/accuracy_reward": 0.45833334885537624, "rewards/format_reward": 0.9375000149011612, "step": 82 }, { "completion_length": 572.3125152587891, "epoch": 0.2881944444444444, "grad_norm": 0.15104174613952637, "kl": 0.020172119140625, "learning_rate": 2.6895683525737467e-06, "loss": 0.1749, "reward": 1.3958333730697632, "reward_std": 0.32525812089443207, "rewards/accuracy_reward": 0.5208333432674408, "rewards/format_reward": 0.8750000298023224, "step": 83 }, { "completion_length": 669.458366394043, "epoch": 0.2916666666666667, "grad_norm": 0.20023855566978455, "kl": 0.02825927734375, "learning_rate": 2.6783976795849845e-06, "loss": 0.2771, "reward": 1.1458333432674408, "reward_std": 0.35275158286094666, "rewards/accuracy_reward": 0.31250002048909664, "rewards/format_reward": 0.833333358168602, "step": 84 }, { "completion_length": 636.0833435058594, "epoch": 0.2951388888888889, "grad_norm": 0.16752025485038757, "kl": 0.0250244140625, "learning_rate": 2.6670536314776595e-06, "loss": 0.1357, "reward": 1.1666666865348816, "reward_std": 0.3387768119573593, "rewards/accuracy_reward": 0.2916666716337204, "rewards/format_reward": 0.8750000149011612, "step": 85 }, { "completion_length": 491.12500762939453, "epoch": 0.2986111111111111, "grad_norm": 0.17436006665229797, "kl": 0.023040771484375, "learning_rate": 2.655537877277195e-06, "loss": 0.0185, "reward": 1.5208333730697632, "reward_std": 0.1801304928958416, "rewards/accuracy_reward": 0.5625000074505806, "rewards/format_reward": 0.9583333432674408, "step": 86 }, { "completion_length": 860.4166870117188, "epoch": 0.3020833333333333, "grad_norm": 0.1470215767621994, "kl": 0.020050048828125, "learning_rate": 2.643852111271762e-06, "loss": 0.1864, "reward": 1.0833333730697632, "reward_std": 0.5692892521619797, "rewards/accuracy_reward": 0.31250000186264515, "rewards/format_reward": 0.7708333507180214, "step": 87 }, { "completion_length": 506.87501525878906, "epoch": 0.3055555555555556, "grad_norm": 0.10362564027309418, "kl": 0.0194244384765625, "learning_rate": 2.6319980527630044e-06, "loss": 0.029, "reward": 1.5000000298023224, "reward_std": 0.20412413775920868, "rewards/accuracy_reward": 0.5208333432674408, "rewards/format_reward": 0.9791666716337204, "step": 88 }, { "completion_length": 503.2916717529297, "epoch": 0.3090277777777778, "grad_norm": 0.10739459097385406, "kl": 0.025970458984375, "learning_rate": 2.6199774458130785e-06, "loss": 0.0427, "reward": 1.458333358168602, "reward_std": 0.10206206887960434, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.9791666716337204, "step": 89 }, { "completion_length": 407.43750762939453, "epoch": 0.3125, "grad_norm": 0.09123390913009644, "kl": 0.0217437744140625, "learning_rate": 2.607792058988057e-06, "loss": 0.0256, "reward": 1.5416666865348816, "reward_std": 0.17635312676429749, "rewards/accuracy_reward": 0.5833333395421505, "rewards/format_reward": 0.9583333432674408, "step": 90 }, { "completion_length": 680.3125152587891, "epoch": 0.3159722222222222, "grad_norm": 61.70291519165039, "kl": 2.596893310546875, "learning_rate": 2.595443685097721e-06, "loss": 0.2323, "reward": 1.1458333730697632, "reward_std": 0.465863935649395, "rewards/accuracy_reward": 0.2500000074505806, "rewards/format_reward": 0.895833358168602, "step": 91 }, { "completion_length": 584.9583511352539, "epoch": 0.3194444444444444, "grad_norm": 0.1794969141483307, "kl": 0.0206756591796875, "learning_rate": 2.5829341409317867e-06, "loss": 0.095, "reward": 1.5833333730697632, "reward_std": 0.4050915762782097, "rewards/accuracy_reward": 0.645833358168602, "rewards/format_reward": 0.9375000149011612, "step": 92 }, { "completion_length": 434.56251525878906, "epoch": 0.3229166666666667, "grad_norm": 0.13617026805877686, "kl": 0.025848388671875, "learning_rate": 2.5702652669926085e-06, "loss": 0.1011, "reward": 1.4583333730697632, "reward_std": 0.18111901357769966, "rewards/accuracy_reward": 0.5000000149011612, "rewards/format_reward": 0.9583333432674408, "step": 93 }, { "completion_length": 427.9583435058594, "epoch": 0.3263888888888889, "grad_norm": 0.2081851065158844, "kl": 0.02728271484375, "learning_rate": 2.5574389272243876e-06, "loss": -0.0078, "reward": 1.5000000298023224, "reward_std": 0.338776808232069, "rewards/accuracy_reward": 0.5208333488553762, "rewards/format_reward": 0.9791666716337204, "step": 94 }, { "completion_length": 611.8333587646484, "epoch": 0.3298611111111111, "grad_norm": 0.16542907059192657, "kl": 0.02056884765625, "learning_rate": 2.544457008738933e-06, "loss": 0.161, "reward": 1.479166716337204, "reward_std": 0.4002828076481819, "rewards/accuracy_reward": 0.5625000149011612, "rewards/format_reward": 0.9166666865348816, "step": 95 }, { "completion_length": 441.7083511352539, "epoch": 0.3333333333333333, "grad_norm": 0.200779989361763, "kl": 0.028839111328125, "learning_rate": 2.5313214215380183e-06, "loss": 0.0617, "reward": 1.3958333432674408, "reward_std": 0.24818918108940125, "rewards/accuracy_reward": 0.43750002048909664, "rewards/format_reward": 0.9583333432674408, "step": 96 }, { "completion_length": 531.1875228881836, "epoch": 0.3368055555555556, "grad_norm": 0.1479746550321579, "kl": 0.027008056640625, "learning_rate": 2.518034098232363e-06, "loss": 0.082, "reward": 1.208333358168602, "reward_std": 0.41228053346276283, "rewards/accuracy_reward": 0.27083333395421505, "rewards/format_reward": 0.9375000149011612, "step": 97 }, { "completion_length": 763.0208587646484, "epoch": 0.3402777777777778, "grad_norm": 0.15963004529476166, "kl": 0.026947021484375, "learning_rate": 2.5045969937572946e-06, "loss": 0.2739, "reward": 1.1458333730697632, "reward_std": 0.5016112439334393, "rewards/accuracy_reward": 0.3125000111758709, "rewards/format_reward": 0.8333333432674408, "step": 98 }, { "completion_length": 476.39583587646484, "epoch": 0.34375, "grad_norm": 0.1362573504447937, "kl": 0.0229034423828125, "learning_rate": 2.4910120850851222e-06, "loss": 0.056, "reward": 1.6041666865348816, "reward_std": 0.3252581059932709, "rewards/accuracy_reward": 0.6666666716337204, "rewards/format_reward": 0.9375000149011612, "step": 99 }, { "completion_length": 491.0208511352539, "epoch": 0.3472222222222222, "grad_norm": 0.1475033462047577, "kl": 0.0244140625, "learning_rate": 2.477281370934269e-06, "loss": 0.0977, "reward": 1.479166716337204, "reward_std": 0.2996268607676029, "rewards/accuracy_reward": 0.5416666865348816, "rewards/format_reward": 0.9375000149011612, "step": 100 }, { "completion_length": 700.4167022705078, "epoch": 0.3506944444444444, "grad_norm": 0.11388766020536423, "kl": 0.02069091796875, "learning_rate": 2.463406871475204e-06, "loss": 0.1393, "reward": 1.395833358168602, "reward_std": 0.42034320160746574, "rewards/accuracy_reward": 0.5208333395421505, "rewards/format_reward": 0.875, "step": 101 }, { "completion_length": 535.8750152587891, "epoch": 0.3541666666666667, "grad_norm": 0.13923925161361694, "kl": 0.023529052734375, "learning_rate": 2.449390628033221e-06, "loss": 0.048, "reward": 1.4583333730697632, "reward_std": 0.3291737101972103, "rewards/accuracy_reward": 0.5000000111758709, "rewards/format_reward": 0.9583333432674408, "step": 102 }, { "completion_length": 800.2083435058594, "epoch": 0.3576388888888889, "grad_norm": 0.12406690418720245, "kl": 0.02545166015625, "learning_rate": 2.4352347027881005e-06, "loss": 0.3154, "reward": 1.2500000298023224, "reward_std": 0.47029248997569084, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.7500000149011612, "step": 103 }, { "completion_length": 533.2708587646484, "epoch": 0.3611111111111111, "grad_norm": 0.14702031016349792, "kl": 0.021240234375, "learning_rate": 2.4209411784707064e-06, "loss": 0.0215, "reward": 1.5000000596046448, "reward_std": 0.338776808232069, "rewards/accuracy_reward": 0.5416666828095913, "rewards/format_reward": 0.9583333432674408, "step": 104 }, { "completion_length": 723.4167022705078, "epoch": 0.3645833333333333, "grad_norm": 0.18807482719421387, "kl": 0.028533935546875, "learning_rate": 2.40651215805656e-06, "loss": 0.3335, "reward": 1.0625000298023224, "reward_std": 0.5206723660230637, "rewards/accuracy_reward": 0.25000000558793545, "rewards/format_reward": 0.8125000298023224, "step": 105 }, { "completion_length": 710.1042022705078, "epoch": 0.3680555555555556, "grad_norm": 0.14252522587776184, "kl": 0.0224609375, "learning_rate": 2.39194976445643e-06, "loss": 0.1132, "reward": 1.2083333730697632, "reward_std": 0.45271994173526764, "rewards/accuracy_reward": 0.33333334885537624, "rewards/format_reward": 0.8750000149011612, "step": 106 }, { "completion_length": 776.5208435058594, "epoch": 0.3715277777777778, "grad_norm": 0.15372061729431152, "kl": 0.0250244140625, "learning_rate": 2.377256140203997e-06, "loss": 0.0904, "reward": 1.0625000447034836, "reward_std": 0.4630715996026993, "rewards/accuracy_reward": 0.25, "rewards/format_reward": 0.8125000149011612, "step": 107 }, { "completion_length": 546.6666946411133, "epoch": 0.375, "grad_norm": 0.1483929604291916, "kl": 0.02362060546875, "learning_rate": 2.3624334471406243e-06, "loss": 0.2206, "reward": 1.3541666865348816, "reward_std": 0.3613787963986397, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.8541666865348816, "step": 108 }, { "completion_length": 621.6041717529297, "epoch": 0.3784722222222222, "grad_norm": 0.13750684261322021, "kl": 0.019012451171875, "learning_rate": 2.3474838660972937e-06, "loss": 0.188, "reward": 1.3750000298023224, "reward_std": 0.3707359544932842, "rewards/accuracy_reward": 0.5, "rewards/format_reward": 0.8750000149011612, "step": 109 }, { "completion_length": 726.3125152587891, "epoch": 0.3819444444444444, "grad_norm": 0.12274214625358582, "kl": 0.02410888671875, "learning_rate": 2.3324095965737407e-06, "loss": 0.1216, "reward": 1.3541666865348816, "reward_std": 0.4189515560865402, "rewards/accuracy_reward": 0.5208333414047956, "rewards/format_reward": 0.8333333432674408, "step": 110 }, { "completion_length": 918.2083587646484, "epoch": 0.3854166666666667, "grad_norm": 0.12572777271270752, "kl": 0.02239990234375, "learning_rate": 2.3172128564148506e-06, "loss": 0.1613, "reward": 1.083333358168602, "reward_std": 0.4050915725529194, "rewards/accuracy_reward": 0.33333334513008595, "rewards/format_reward": 0.7500000298023224, "step": 111 }, { "completion_length": 884.6458511352539, "epoch": 0.3888888888888889, "grad_norm": 0.17690952122211456, "kl": 0.02056884765625, "learning_rate": 2.3018958814843497e-06, "loss": 0.3226, "reward": 1.0833333432674408, "reward_std": 0.524587944149971, "rewards/accuracy_reward": 0.3333333432674408, "rewards/format_reward": 0.7500000149011612, "step": 112 }, { "completion_length": 1251.5000305175781, "epoch": 0.3923611111111111, "grad_norm": 0.7481052875518799, "kl": 0.0283203125, "learning_rate": 2.286460925335848e-06, "loss": 0.3119, "reward": 0.7916666772216558, "reward_std": 0.5451789386570454, "rewards/accuracy_reward": 0.2708333432674408, "rewards/format_reward": 0.5208333488553762, "step": 113 }, { "completion_length": 535.6875152587891, "epoch": 0.3958333333333333, "grad_norm": 0.15226027369499207, "kl": 0.032135009765625, "learning_rate": 2.270910258881277e-06, "loss": 0.0745, "reward": 1.3541666865348816, "reward_std": 0.19615865498781204, "rewards/accuracy_reward": 0.4375000111758709, "rewards/format_reward": 0.9166666716337204, "step": 114 }, { "completion_length": 644.1458435058594, "epoch": 0.3993055555555556, "grad_norm": 0.15469415485858917, "kl": 0.0194091796875, "learning_rate": 2.25524617005678e-06, "loss": 0.1798, "reward": 1.6458333730697632, "reward_std": 0.34357523918151855, "rewards/accuracy_reward": 0.7500000149011612, "rewards/format_reward": 0.8958333432674408, "step": 115 }, { "completion_length": 969.708366394043, "epoch": 0.4027777777777778, "grad_norm": 0.11691451817750931, "kl": 0.0235595703125, "learning_rate": 2.2394709634860874e-06, "loss": 0.1976, "reward": 1.2083333730697632, "reward_std": 0.3836073949933052, "rewards/accuracy_reward": 0.5416666716337204, "rewards/format_reward": 0.6666666865348816, "step": 116 }, { "completion_length": 761.9375152587891, "epoch": 0.40625, "grad_norm": 0.16335654258728027, "kl": 0.028839111328125, "learning_rate": 2.2235869601414455e-06, "loss": 0.2464, "reward": 1.25, "reward_std": 0.3099784776568413, "rewards/accuracy_reward": 0.4583333358168602, "rewards/format_reward": 0.7916666716337204, "step": 117 }, { "completion_length": 981.3958587646484, "epoch": 0.4097222222222222, "grad_norm": 0.1932869404554367, "kl": 0.031402587890625, "learning_rate": 2.207596497002137e-06, "loss": 0.1864, "reward": 1.041666716337204, "reward_std": 0.4458687864243984, "rewards/accuracy_reward": 0.37500001303851604, "rewards/format_reward": 0.6666667014360428, "step": 118 }, { "completion_length": 646.1666793823242, "epoch": 0.4131944444444444, "grad_norm": 0.14755134284496307, "kl": 0.0245361328125, "learning_rate": 2.1915019267106434e-06, "loss": 0.2504, "reward": 1.458333358168602, "reward_std": 0.36529088765382767, "rewards/accuracy_reward": 0.6041666865348816, "rewards/format_reward": 0.8541666865348816, "step": 119 }, { "completion_length": 911.8542022705078, "epoch": 0.4166666666666667, "grad_norm": 0.25820213556289673, "kl": 0.042236328125, "learning_rate": 2.17530561722651e-06, "loss": 0.4868, "reward": 0.7500000149011612, "reward_std": 0.5388510674238205, "rewards/accuracy_reward": 0.08333333395421505, "rewards/format_reward": 0.6666666865348816, "step": 120 }, { "completion_length": 1040.5833740234375, "epoch": 0.4201388888888889, "grad_norm": 0.20425698161125183, "kl": 0.05157470703125, "learning_rate": 2.15900995147795e-06, "loss": 0.2536, "reward": 0.979166716337204, "reward_std": 0.5101870223879814, "rewards/accuracy_reward": 0.3333333432674408, "rewards/format_reward": 0.645833358168602, "step": 121 }, { "completion_length": 1226.3333435058594, "epoch": 0.4236111111111111, "grad_norm": 0.15288718044757843, "kl": 0.03533935546875, "learning_rate": 2.14261732701125e-06, "loss": 0.1909, "reward": 0.7708333544433117, "reward_std": 0.44616058468818665, "rewards/accuracy_reward": 0.2708333432674408, "rewards/format_reward": 0.5000000111758709, "step": 122 }, { "completion_length": 1012.4167175292969, "epoch": 0.4270833333333333, "grad_norm": 0.16976693272590637, "kl": 0.023223876953125, "learning_rate": 2.126130155638026e-06, "loss": 0.3362, "reward": 1.104166716337204, "reward_std": 0.5953380987048149, "rewards/accuracy_reward": 0.3958333507180214, "rewards/format_reward": 0.708333358168602, "step": 123 }, { "completion_length": 573.7083587646484, "epoch": 0.4305555555555556, "grad_norm": 0.1823354810476303, "kl": 0.04364013671875, "learning_rate": 2.1095508630803744e-06, "loss": 0.097, "reward": 1.2291666865348816, "reward_std": 0.35317831486463547, "rewards/accuracy_reward": 0.3750000037252903, "rewards/format_reward": 0.8541666716337204, "step": 124 }, { "completion_length": 675.0833435058594, "epoch": 0.4340277777777778, "grad_norm": 0.3771405518054962, "kl": 0.0296630859375, "learning_rate": 2.0928818886139857e-06, "loss": 0.1958, "reward": 1.291666716337204, "reward_std": 0.40332652628421783, "rewards/accuracy_reward": 0.4166666716337204, "rewards/format_reward": 0.8750000149011612, "step": 125 }, { "completion_length": 890.4792098999023, "epoch": 0.4375, "grad_norm": 0.13857302069664001, "kl": 0.02545166015625, "learning_rate": 2.0761256847092566e-06, "loss": 0.1842, "reward": 1.1250000596046448, "reward_std": 0.40420936048030853, "rewards/accuracy_reward": 0.37500000558793545, "rewards/format_reward": 0.7500000149011612, "step": 126 }, { "completion_length": 727.0416870117188, "epoch": 0.4409722222222222, "grad_norm": 0.1580132693052292, "kl": 0.021484375, "learning_rate": 2.059284716670463e-06, "loss": 0.1402, "reward": 1.3125000298023224, "reward_std": 0.505498394370079, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.833333358168602, "step": 127 }, { "completion_length": 623.4583511352539, "epoch": 0.4444444444444444, "grad_norm": 0.16201883554458618, "kl": 0.03436279296875, "learning_rate": 2.0423614622730465e-06, "loss": 0.1815, "reward": 1.3125000298023224, "reward_std": 0.3866407908499241, "rewards/accuracy_reward": 0.4375000111758709, "rewards/format_reward": 0.8750000149011612, "step": 128 }, { "completion_length": 675.1875305175781, "epoch": 0.4479166666666667, "grad_norm": 0.16620077192783356, "kl": 0.031768798828125, "learning_rate": 2.025358411399063e-06, "loss": 0.1073, "reward": 1.4583333730697632, "reward_std": 0.3881702236831188, "rewards/accuracy_reward": 0.5833333432674408, "rewards/format_reward": 0.875, "step": 129 }, { "completion_length": 945.8541870117188, "epoch": 0.4513888888888889, "grad_norm": 0.162175714969635, "kl": 0.023681640625, "learning_rate": 2.0082780656708533e-06, "loss": 0.2879, "reward": 1.1250000298023224, "reward_std": 0.6361513510346413, "rewards/accuracy_reward": 0.3958333507180214, "rewards/format_reward": 0.7291666865348816, "step": 130 }, { "completion_length": 722.4791870117188, "epoch": 0.4548611111111111, "grad_norm": 2.677931547164917, "kl": 0.041351318359375, "learning_rate": 1.9911229380829837e-06, "loss": 0.1123, "reward": 1.3541666865348816, "reward_std": 0.3315683454275131, "rewards/accuracy_reward": 0.5416666716337204, "rewards/format_reward": 0.8125000149011612, "step": 131 }, { "completion_length": 607.9583587646484, "epoch": 0.4583333333333333, "grad_norm": 0.2422100156545639, "kl": 0.029693603515625, "learning_rate": 1.973895552632514e-06, "loss": 0.1758, "reward": 1.3125000298023224, "reward_std": 0.42695441097021103, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.8333333432674408, "step": 132 }, { "completion_length": 906.0625305175781, "epoch": 0.4618055555555556, "grad_norm": 0.18844355642795563, "kl": 0.039459228515625, "learning_rate": 1.95659844394765e-06, "loss": 0.2693, "reward": 1.2500000596046448, "reward_std": 0.5812961123883724, "rewards/accuracy_reward": 0.5000000149011612, "rewards/format_reward": 0.7500000149011612, "step": 133 }, { "completion_length": 574.5625152587891, "epoch": 0.4652777777777778, "grad_norm": 0.20260459184646606, "kl": 0.033355712890625, "learning_rate": 1.9392341569148255e-06, "loss": 0.1544, "reward": 1.541666716337204, "reward_std": 0.44979287683963776, "rewards/accuracy_reward": 0.6250000223517418, "rewards/format_reward": 0.9166666865348816, "step": 134 }, { "completion_length": 632.2291793823242, "epoch": 0.46875, "grad_norm": 0.23320862650871277, "kl": 0.03106689453125, "learning_rate": 1.921805246304281e-06, "loss": 0.0458, "reward": 1.2083333879709244, "reward_std": 0.3506578989326954, "rewards/accuracy_reward": 0.3541666865348816, "rewards/format_reward": 0.8541666716337204, "step": 135 }, { "completion_length": 745.5833511352539, "epoch": 0.4722222222222222, "grad_norm": 0.1192096620798111, "kl": 0.025177001953125, "learning_rate": 1.904314276394185e-06, "loss": 0.1237, "reward": 1.2916666865348816, "reward_std": 0.26603008806705475, "rewards/accuracy_reward": 0.4583333358168602, "rewards/format_reward": 0.8333333432674408, "step": 136 }, { "completion_length": 679.3750152587891, "epoch": 0.4756944444444444, "grad_norm": 0.2212546318769455, "kl": 0.0361328125, "learning_rate": 1.8867638205933569e-06, "loss": 0.1533, "reward": 1.1875000149011612, "reward_std": 0.4378061033785343, "rewards/accuracy_reward": 0.33333334140479565, "rewards/format_reward": 0.8541666865348816, "step": 137 }, { "completion_length": 538.3333435058594, "epoch": 0.4791666666666667, "grad_norm": 0.1732557713985443, "kl": 0.022674560546875, "learning_rate": 1.8691564610626482e-06, "loss": 0.1226, "reward": 1.4166666865348816, "reward_std": 0.3247256875038147, "rewards/accuracy_reward": 0.45833334885537624, "rewards/format_reward": 0.9583333432674408, "step": 138 }, { "completion_length": 889.2708587646484, "epoch": 0.4826388888888889, "grad_norm": 0.23465807735919952, "kl": 0.026947021484375, "learning_rate": 1.8514947883350336e-06, "loss": 0.2865, "reward": 1.1041667312383652, "reward_std": 0.4697476103901863, "rewards/accuracy_reward": 0.33333334140479565, "rewards/format_reward": 0.770833358168602, "step": 139 }, { "completion_length": 883.5833587646484, "epoch": 0.4861111111111111, "grad_norm": 0.43588894605636597, "kl": 0.0335693359375, "learning_rate": 1.8337814009344715e-06, "loss": 0.3353, "reward": 0.8750000298023224, "reward_std": 0.37073593586683273, "rewards/accuracy_reward": 0.1041666716337204, "rewards/format_reward": 0.770833358168602, "step": 140 }, { "completion_length": 755.9167022705078, "epoch": 0.4895833333333333, "grad_norm": 1.3584622144699097, "kl": 0.032257080078125, "learning_rate": 1.8160189049935894e-06, "loss": 0.2604, "reward": 1.104166716337204, "reward_std": 0.5023448839783669, "rewards/accuracy_reward": 0.2708333432674408, "rewards/format_reward": 0.8333333730697632, "step": 141 }, { "completion_length": 855.2500305175781, "epoch": 0.4930555555555556, "grad_norm": 0.20329737663269043, "kl": 0.036163330078125, "learning_rate": 1.7982099138702485e-06, "loss": 0.1702, "reward": 1.1041667014360428, "reward_std": 0.37377966567873955, "rewards/accuracy_reward": 0.3750000037252903, "rewards/format_reward": 0.7291666865348816, "step": 142 }, { "completion_length": 844.0000152587891, "epoch": 0.4965277777777778, "grad_norm": 0.22066070139408112, "kl": 0.041259765625, "learning_rate": 1.7803570477630467e-06, "loss": 0.218, "reward": 1.0625000149011612, "reward_std": 0.48489294201135635, "rewards/accuracy_reward": 0.27083334140479565, "rewards/format_reward": 0.7916666716337204, "step": 143 }, { "completion_length": 676.6041717529297, "epoch": 0.5, "grad_norm": 0.30942684412002563, "kl": 0.03912353515625, "learning_rate": 1.762462933325813e-06, "loss": 0.1286, "reward": 1.1666666865348816, "reward_std": 0.37248334288597107, "rewards/accuracy_reward": 0.31250000558793545, "rewards/format_reward": 0.8541666865348816, "step": 144 }, { "completion_length": 497.25001525878906, "epoch": 0.5034722222222222, "grad_norm": 4.151206970214844, "kl": 0.034820556640625, "learning_rate": 1.7445302032811562e-06, "loss": 0.1267, "reward": 1.604166716337204, "reward_std": 0.4081249386072159, "rewards/accuracy_reward": 0.6875000223517418, "rewards/format_reward": 0.9166666716337204, "step": 145 }, { "completion_length": 517.8541793823242, "epoch": 0.5069444444444444, "grad_norm": 0.2486122101545334, "kl": 0.0377044677734375, "learning_rate": 1.726561496033115e-06, "loss": 0.0616, "reward": 1.4791666865348816, "reward_std": 0.13301505148410797, "rewards/accuracy_reward": 0.5416666716337204, "rewards/format_reward": 0.9375, "step": 146 }, { "completion_length": 720.6250152587891, "epoch": 0.5104166666666666, "grad_norm": 1.1804969310760498, "kl": 0.067596435546875, "learning_rate": 1.7085594552789775e-06, "loss": 0.1597, "reward": 1.3958333730697632, "reward_std": 0.5734792053699493, "rewards/accuracy_reward": 0.5416666865348816, "rewards/format_reward": 0.8541666716337204, "step": 147 }, { "completion_length": 612.7708511352539, "epoch": 0.5138888888888888, "grad_norm": 2.4607434272766113, "kl": 0.23883056640625, "learning_rate": 1.6905267296203183e-06, "loss": 0.2513, "reward": 1.2708333432674408, "reward_std": 0.421766959130764, "rewards/accuracy_reward": 0.41666667349636555, "rewards/format_reward": 0.8541666865348816, "step": 148 }, { "completion_length": 569.6666870117188, "epoch": 0.5173611111111112, "grad_norm": 6.466779708862305, "kl": 0.061126708984375, "learning_rate": 1.6724659721733166e-06, "loss": 0.152, "reward": 1.3750000298023224, "reward_std": 0.18404609709978104, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 0.9375000149011612, "step": 149 }, { "completion_length": 905.8125152587891, "epoch": 0.5208333333333334, "grad_norm": 8.022199630737305, "kl": 1.09375, "learning_rate": 1.6543798401784086e-06, "loss": 0.3308, "reward": 1.104166716337204, "reward_std": 0.4881899170577526, "rewards/accuracy_reward": 0.3750000037252903, "rewards/format_reward": 0.7291666865348816, "step": 150 }, { "completion_length": 712.1041870117188, "epoch": 0.5243055555555556, "grad_norm": 65888.078125, "kl": 1422.472412109375, "learning_rate": 1.6362709946093328e-06, "loss": 38.4478, "reward": 1.104166716337204, "reward_std": 0.40724214166402817, "rewards/accuracy_reward": 0.2708333358168602, "rewards/format_reward": 0.833333358168602, "step": 151 }, { "completion_length": 539.7708435058594, "epoch": 0.5277777777777778, "grad_norm": 76.37101745605469, "kl": 7.6168212890625, "learning_rate": 1.618142099781627e-06, "loss": 0.631, "reward": 1.0625000298023224, "reward_std": 0.24958433583378792, "rewards/accuracy_reward": 0.1458333395421505, "rewards/format_reward": 0.9166666716337204, "step": 152 }, { "completion_length": 798.9166870117188, "epoch": 0.53125, "grad_norm": 0.7325725555419922, "kl": 0.4227294921875, "learning_rate": 1.599995822960633e-06, "loss": 0.1743, "reward": 1.1041666865348816, "reward_std": 0.32614094391465187, "rewards/accuracy_reward": 0.3333333358168602, "rewards/format_reward": 0.770833358168602, "step": 153 }, { "completion_length": 702.5833435058594, "epoch": 0.5347222222222222, "grad_norm": 2.384575843811035, "kl": 0.3314208984375, "learning_rate": 1.5818348339690693e-06, "loss": 0.1558, "reward": 1.3333333730697632, "reward_std": 0.4297148287296295, "rewards/accuracy_reward": 0.47916667722165585, "rewards/format_reward": 0.8541666716337204, "step": 154 }, { "completion_length": 570.0416793823242, "epoch": 0.5381944444444444, "grad_norm": 1.1694482564926147, "kl": 0.4540863037109375, "learning_rate": 1.5636618047942224e-06, "loss": 0.1617, "reward": 1.5833333730697632, "reward_std": 0.41380148753523827, "rewards/accuracy_reward": 0.6875000204890966, "rewards/format_reward": 0.8958333432674408, "step": 155 }, { "completion_length": 570.7083511352539, "epoch": 0.5416666666666666, "grad_norm": 2.306391477584839, "kl": 0.577117919921875, "learning_rate": 1.5454794091948273e-06, "loss": 0.2139, "reward": 1.3541666865348816, "reward_std": 0.3906906694173813, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.8750000149011612, "step": 156 }, { "completion_length": 491.7916717529297, "epoch": 0.5451388888888888, "grad_norm": 9.992592811584473, "kl": 0.30511474609375, "learning_rate": 1.5272903223076794e-06, "loss": 0.0622, "reward": 1.1666666716337204, "reward_std": 0.19855330884456635, "rewards/accuracy_reward": 0.2708333432674408, "rewards/format_reward": 0.8958333432674408, "step": 157 }, { "completion_length": 791.6250228881836, "epoch": 0.5486111111111112, "grad_norm": 38.32509231567383, "kl": 1.33209228515625, "learning_rate": 1.5090972202540497e-06, "loss": 0.2214, "reward": 1.1875, "reward_std": 0.44629882276058197, "rewards/accuracy_reward": 0.3541666716337204, "rewards/format_reward": 0.8333333432674408, "step": 158 }, { "completion_length": 789.3333740234375, "epoch": 0.5520833333333334, "grad_norm": 1158.8193359375, "kl": 50.455078125, "learning_rate": 1.4909027797459508e-06, "loss": 3.0286, "reward": 1.1666666865348816, "reward_std": 0.4083564504981041, "rewards/accuracy_reward": 0.39583334513008595, "rewards/format_reward": 0.770833358168602, "step": 159 }, { "completion_length": 830.2708587646484, "epoch": 0.5555555555555556, "grad_norm": 540.842041015625, "kl": 37.28271484375, "learning_rate": 1.4727096776923206e-06, "loss": 2.3995, "reward": 1.166666716337204, "reward_std": 0.5332978293299675, "rewards/accuracy_reward": 0.3958333544433117, "rewards/format_reward": 0.7708333432674408, "step": 160 }, { "completion_length": 384.1458435058594, "epoch": 0.5590277777777778, "grad_norm": 3.105428457260132, "kl": 0.341156005859375, "learning_rate": 1.454520590805173e-06, "loss": 0.1745, "reward": 1.7916666865348816, "reward_std": 0.20412414520978928, "rewards/accuracy_reward": 0.8333333432674408, "rewards/format_reward": 0.9583333432674408, "step": 161 }, { "completion_length": 585.7083511352539, "epoch": 0.5625, "grad_norm": 4.438769340515137, "kl": 0.3422698974609375, "learning_rate": 1.4363381952057778e-06, "loss": 0.1405, "reward": 1.4375, "reward_std": 0.3316941484808922, "rewards/accuracy_reward": 0.5625000149011612, "rewards/format_reward": 0.8750000149011612, "step": 162 }, { "completion_length": 432.9166717529297, "epoch": 0.5659722222222222, "grad_norm": 2.7780346870422363, "kl": 0.13446044921875, "learning_rate": 1.4181651660309314e-06, "loss": 0.1469, "reward": 1.4375000298023224, "reward_std": 0.26070839166641235, "rewards/accuracy_reward": 0.5000000149011612, "rewards/format_reward": 0.9375000149011612, "step": 163 }, { "completion_length": 534.5416946411133, "epoch": 0.5694444444444444, "grad_norm": 20.075862884521484, "kl": 0.94732666015625, "learning_rate": 1.4000041770393675e-06, "loss": 0.2916, "reward": 1.5625000596046448, "reward_std": 0.486316692084074, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.9375000149011612, "step": 164 }, { "completion_length": 440.18750762939453, "epoch": 0.5729166666666666, "grad_norm": 4.264848232269287, "kl": 0.11651611328125, "learning_rate": 1.3818579002183738e-06, "loss": 0.0084, "reward": 1.4583334028720856, "reward_std": 0.2686738707125187, "rewards/accuracy_reward": 0.47916667722165585, "rewards/format_reward": 0.9791666716337204, "step": 165 }, { "completion_length": 468.83334732055664, "epoch": 0.5763888888888888, "grad_norm": 2.606549024581909, "kl": 0.071746826171875, "learning_rate": 1.363729005390667e-06, "loss": 0.0686, "reward": 1.3958333730697632, "reward_std": 0.3357440307736397, "rewards/accuracy_reward": 0.4375000149011612, "rewards/format_reward": 0.9583333432674408, "step": 166 }, { "completion_length": 572.8958358764648, "epoch": 0.5798611111111112, "grad_norm": 4.766880035400391, "kl": 0.176361083984375, "learning_rate": 1.3456201598215913e-06, "loss": 0.0563, "reward": 1.270833358168602, "reward_std": 0.40029376745224, "rewards/accuracy_reward": 0.45833334885537624, "rewards/format_reward": 0.8125000149011612, "step": 167 }, { "completion_length": 463.70835876464844, "epoch": 0.5833333333333334, "grad_norm": 0.8010079860687256, "kl": 0.16363525390625, "learning_rate": 1.3275340278266835e-06, "loss": 0.0342, "reward": 1.270833358168602, "reward_std": 0.4177170880138874, "rewards/accuracy_reward": 0.354166679084301, "rewards/format_reward": 0.9166666865348816, "step": 168 }, { "completion_length": 469.9583511352539, "epoch": 0.5868055555555556, "grad_norm": 0.6038458943367004, "kl": 0.450103759765625, "learning_rate": 1.3094732703796818e-06, "loss": 0.0243, "reward": 1.2708333730697632, "reward_std": 0.19756478071212769, "rewards/accuracy_reward": 0.3333333358168602, "rewards/format_reward": 0.9375, "step": 169 }, { "completion_length": 554.4375152587891, "epoch": 0.5902777777777778, "grad_norm": 1.6925392150878906, "kl": 0.24127197265625, "learning_rate": 1.291440544721023e-06, "loss": -0.0066, "reward": 1.3750000596046448, "reward_std": 0.4026774615049362, "rewards/accuracy_reward": 0.4166666753590107, "rewards/format_reward": 0.9583333432674408, "step": 170 }, { "completion_length": 468.5416717529297, "epoch": 0.59375, "grad_norm": 0.1130196750164032, "kl": 0.028045654296875, "learning_rate": 1.2734385039668851e-06, "loss": 0.0032, "reward": 1.2291666865348816, "reward_std": 0.13301505148410797, "rewards/accuracy_reward": 0.2291666716337204, "rewards/format_reward": 1.0, "step": 171 }, { "completion_length": 557.1041870117188, "epoch": 0.5972222222222222, "grad_norm": 4.199826240539551, "kl": 0.111236572265625, "learning_rate": 1.255469796718844e-06, "loss": 0.0268, "reward": 1.4375000596046448, "reward_std": 0.1801304928958416, "rewards/accuracy_reward": 0.4583333395421505, "rewards/format_reward": 0.9791666716337204, "step": 172 }, { "completion_length": 438.6666793823242, "epoch": 0.6006944444444444, "grad_norm": 0.15102888643741608, "kl": 0.030181884765625, "learning_rate": 1.2375370666741872e-06, "loss": 0.0193, "reward": 1.5000000298023224, "reward_std": 0.377695269882679, "rewards/accuracy_reward": 0.5000000074505806, "rewards/format_reward": 1.0, "step": 173 }, { "completion_length": 585.8125152587891, "epoch": 0.6041666666666666, "grad_norm": 0.6886882781982422, "kl": 0.13189697265625, "learning_rate": 1.2196429522369538e-06, "loss": 0.0651, "reward": 1.3333333879709244, "reward_std": 0.3881702311336994, "rewards/accuracy_reward": 0.39583334140479565, "rewards/format_reward": 0.9375000149011612, "step": 174 }, { "completion_length": 537.1041717529297, "epoch": 0.6076388888888888, "grad_norm": 0.35646969079971313, "kl": 0.062103271484375, "learning_rate": 1.2017900861297518e-06, "loss": 0.1027, "reward": 1.2291666716337204, "reward_std": 0.235077116638422, "rewards/accuracy_reward": 0.25, "rewards/format_reward": 0.9791666716337204, "step": 175 }, { "completion_length": 581.2083587646484, "epoch": 0.6111111111111112, "grad_norm": 0.12719810009002686, "kl": 0.03607177734375, "learning_rate": 1.183981095006411e-06, "loss": -0.008, "reward": 1.416666716337204, "reward_std": 0.2847129963338375, "rewards/accuracy_reward": 0.4375000074505806, "rewards/format_reward": 0.9791666716337204, "step": 176 }, { "completion_length": 589.8958511352539, "epoch": 0.6145833333333334, "grad_norm": 1.2875088453292847, "kl": 0.089111328125, "learning_rate": 1.1662185990655286e-06, "loss": 0.124, "reward": 1.4375000298023224, "reward_std": 0.41580959782004356, "rewards/accuracy_reward": 0.500000013038516, "rewards/format_reward": 0.9375000149011612, "step": 177 }, { "completion_length": 545.6666793823242, "epoch": 0.6180555555555556, "grad_norm": 0.4275152385234833, "kl": 0.06671142578125, "learning_rate": 1.1485052116649664e-06, "loss": 0.0178, "reward": 1.1875000298023224, "reward_std": 0.2591874301433563, "rewards/accuracy_reward": 0.20833334140479565, "rewards/format_reward": 0.9791666716337204, "step": 178 }, { "completion_length": 563.8958435058594, "epoch": 0.6215277777777778, "grad_norm": 0.4824279844760895, "kl": 0.13623046875, "learning_rate": 1.130843538937352e-06, "loss": 0.1624, "reward": 1.1875000298023224, "reward_std": 0.31273890286684036, "rewards/accuracy_reward": 0.27083333767950535, "rewards/format_reward": 0.9166666716337204, "step": 179 }, { "completion_length": 662.3541717529297, "epoch": 0.625, "grad_norm": 2.1108016967773438, "kl": 0.603515625, "learning_rate": 1.1132361794066434e-06, "loss": 0.2967, "reward": 1.1250000298023224, "reward_std": 0.40824827924370766, "rewards/accuracy_reward": 0.2291666716337204, "rewards/format_reward": 0.895833358168602, "step": 180 }, { "completion_length": 665.5208587646484, "epoch": 0.6284722222222222, "grad_norm": 0.5030002593994141, "kl": 0.2371826171875, "learning_rate": 1.095685723605815e-06, "loss": 0.1734, "reward": 1.2291666865348816, "reward_std": 0.31970489397644997, "rewards/accuracy_reward": 0.35416667722165585, "rewards/format_reward": 0.8750000149011612, "step": 181 }, { "completion_length": 519.5833587646484, "epoch": 0.6319444444444444, "grad_norm": 1.6782981157302856, "kl": 0.065582275390625, "learning_rate": 1.078194753695719e-06, "loss": 0.0275, "reward": 1.4583333432674408, "reward_std": 0.19855330884456635, "rewards/accuracy_reward": 0.47916666977107525, "rewards/format_reward": 0.9791666716337204, "step": 182 }, { "completion_length": 613.1666870117188, "epoch": 0.6354166666666666, "grad_norm": 1.796356439590454, "kl": 1.067657470703125, "learning_rate": 1.0607658430851746e-06, "loss": 0.1825, "reward": 1.1875000298023224, "reward_std": 0.28219256177544594, "rewards/accuracy_reward": 0.229166679084301, "rewards/format_reward": 0.9583333432674408, "step": 183 }, { "completion_length": 499.31250762939453, "epoch": 0.6388888888888888, "grad_norm": 0.35159018635749817, "kl": 0.0562744140625, "learning_rate": 1.0434015560523502e-06, "loss": 0.0408, "reward": 1.4166666865348816, "reward_std": 0.30354245007038116, "rewards/accuracy_reward": 0.4375000074505806, "rewards/format_reward": 0.9791666716337204, "step": 184 }, { "completion_length": 441.1041793823242, "epoch": 0.6423611111111112, "grad_norm": 0.4985083341598511, "kl": 0.0517578125, "learning_rate": 1.0261044473674858e-06, "loss": 0.0118, "reward": 1.6666666865348816, "reward_std": 0.16661179810762405, "rewards/accuracy_reward": 0.6875000074505806, "rewards/format_reward": 0.9791666716337204, "step": 185 }, { "completion_length": 497.0208435058594, "epoch": 0.6458333333333334, "grad_norm": 0.15296566486358643, "kl": 0.032012939453125, "learning_rate": 1.0088770619170168e-06, "loss": -0.018, "reward": 1.5625000596046448, "reward_std": 0.3170611262321472, "rewards/accuracy_reward": 0.5625000111758709, "rewards/format_reward": 1.0, "step": 186 }, { "completion_length": 612.5833511352539, "epoch": 0.6493055555555556, "grad_norm": 0.31455937027931213, "kl": 0.10076904296875, "learning_rate": 9.91721934329147e-07, "loss": 0.0513, "reward": 1.3125000298023224, "reward_std": 0.27369463443756104, "rewards/accuracy_reward": 0.3541666679084301, "rewards/format_reward": 0.9583333432674408, "step": 187 }, { "completion_length": 436.8541793823242, "epoch": 0.6527777777777778, "grad_norm": 0.13380156457424164, "kl": 0.0311279296875, "learning_rate": 9.746415886009373e-07, "loss": 0.0032, "reward": 1.2916666865348816, "reward_std": 0.11949636787176132, "rewards/accuracy_reward": 0.2916666716337204, "rewards/format_reward": 1.0, "step": 188 }, { "completion_length": 525.7500152587891, "epoch": 0.65625, "grad_norm": 0.18756899237632751, "kl": 0.045623779296875, "learning_rate": 9.576385377269538e-07, "loss": 0.0134, "reward": 1.5208333730697632, "reward_std": 0.3898078426718712, "rewards/accuracy_reward": 0.5416666772216558, "rewards/format_reward": 0.9791666716337204, "step": 189 }, { "completion_length": 588.8750152587891, "epoch": 0.6597222222222222, "grad_norm": 2.7000815868377686, "kl": 0.14208984375, "learning_rate": 9.407152833295372e-07, "loss": 0.1185, "reward": 1.3125000298023224, "reward_std": 0.3732563704252243, "rewards/accuracy_reward": 0.35416667722165585, "rewards/format_reward": 0.9583333432674408, "step": 190 }, { "completion_length": 413.43751525878906, "epoch": 0.6631944444444444, "grad_norm": 0.17988836765289307, "kl": 0.02947998046875, "learning_rate": 9.238743152907437e-07, "loss": -0.0021, "reward": 1.4583333730697632, "reward_std": 0.3680921792984009, "rewards/accuracy_reward": 0.4583333507180214, "rewards/format_reward": 1.0, "step": 191 }, { "completion_length": 321.54168701171875, "epoch": 0.6666666666666666, "grad_norm": 0.15334828197956085, "kl": 0.039154052734375, "learning_rate": 9.071181113860146e-07, "loss": 0.025, "reward": 1.6666666865348816, "reward_std": 0.11949635669589043, "rewards/accuracy_reward": 0.6666666716337204, "rewards/format_reward": 1.0, "step": 192 }, { "completion_length": 366.87500762939453, "epoch": 0.6701388888888888, "grad_norm": 0.08574451506137848, "kl": 0.028717041015625, "learning_rate": 8.90449136919626e-07, "loss": -0.0078, "reward": 1.6041666865348816, "reward_std": 0.11558075994253159, "rewards/accuracy_reward": 0.6041666716337204, "rewards/format_reward": 1.0, "step": 193 }, { "completion_length": 443.4583435058594, "epoch": 0.6736111111111112, "grad_norm": 0.06931155174970627, "kl": 0.021270751953125, "learning_rate": 8.738698443619745e-07, "loss": -0.0018, "reward": 1.4375000298023224, "reward_std": 0.11558076366782188, "rewards/accuracy_reward": 0.4375000074505806, "rewards/format_reward": 1.0, "step": 194 }, { "completion_length": 431.87501525878906, "epoch": 0.6770833333333334, "grad_norm": 0.18571817874908447, "kl": 0.038238525390625, "learning_rate": 8.573826729887494e-07, "loss": 0.0494, "reward": 1.5833333730697632, "reward_std": 0.3291737213730812, "rewards/accuracy_reward": 0.6041666828095913, "rewards/format_reward": 0.9791666716337204, "step": 195 }, { "completion_length": 650.8542022705078, "epoch": 0.6805555555555556, "grad_norm": 0.3357548713684082, "kl": 0.0557861328125, "learning_rate": 8.409900485220498e-07, "loss": 0.0632, "reward": 1.2500000298023224, "reward_std": 0.2861081510782242, "rewards/accuracy_reward": 0.3125, "rewards/format_reward": 0.9375000149011612, "step": 196 }, { "completion_length": 565.5625152587891, "epoch": 0.6840277777777778, "grad_norm": 1.96600341796875, "kl": 0.05572509765625, "learning_rate": 8.246943827734898e-07, "loss": 0.0943, "reward": 1.1250000447034836, "reward_std": 0.22155844047665596, "rewards/accuracy_reward": 0.1666666716337204, "rewards/format_reward": 0.9583333432674408, "step": 197 }, { "completion_length": 500.10418701171875, "epoch": 0.6875, "grad_norm": 0.8058876991271973, "kl": 0.05865478515625, "learning_rate": 8.084980732893569e-07, "loss": 0.1041, "reward": 1.2708333879709244, "reward_std": 0.21764284372329712, "rewards/accuracy_reward": 0.3125000074505806, "rewards/format_reward": 0.9583333432674408, "step": 198 }, { "completion_length": 476.3958435058594, "epoch": 0.6909722222222222, "grad_norm": 0.09576891362667084, "kl": 0.035369873046875, "learning_rate": 7.924035029978635e-07, "loss": 0.058, "reward": 1.3958333730697632, "reward_std": 0.1801304928958416, "rewards/accuracy_reward": 0.39583334140479565, "rewards/format_reward": 1.0, "step": 199 }, { "completion_length": 458.62500762939453, "epoch": 0.6944444444444444, "grad_norm": 0.40911945700645447, "kl": 0.053070068359375, "learning_rate": 7.764130398585547e-07, "loss": 0.1052, "reward": 1.4375000298023224, "reward_std": 0.34269241243600845, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.9583333432674408, "step": 200 }, { "completion_length": 425.47918701171875, "epoch": 0.6979166666666666, "grad_norm": 0.34317830204963684, "kl": 0.0360107421875, "learning_rate": 7.605290365139128e-07, "loss": -0.0175, "reward": 1.3541666865348816, "reward_std": 0.31413406878709793, "rewards/accuracy_reward": 0.3750000074505806, "rewards/format_reward": 0.9791666716337204, "step": 201 }, { "completion_length": 397.68751525878906, "epoch": 0.7013888888888888, "grad_norm": 0.155939519405365, "kl": 0.02838134765625, "learning_rate": 7.447538299432202e-07, "loss": 0.0059, "reward": 1.729166716337204, "reward_std": 0.28219255805015564, "rewards/accuracy_reward": 0.7291666865348816, "rewards/format_reward": 1.0, "step": 202 }, { "completion_length": 515.4375228881836, "epoch": 0.7048611111111112, "grad_norm": 0.5841673016548157, "kl": 0.0369873046875, "learning_rate": 7.290897411187232e-07, "loss": 0.0686, "reward": 1.4375000149011612, "reward_std": 0.11558076739311218, "rewards/accuracy_reward": 0.4583333432674408, "rewards/format_reward": 0.9791666716337204, "step": 203 }, { "completion_length": 442.4791717529297, "epoch": 0.7083333333333334, "grad_norm": 0.3265649080276489, "kl": 0.05230712890625, "learning_rate": 7.135390746641527e-07, "loss": 0.0242, "reward": 1.5416666865348816, "reward_std": 0.37577681615948677, "rewards/accuracy_reward": 0.583333358168602, "rewards/format_reward": 0.9583333432674408, "step": 204 }, { "completion_length": 496.7291717529297, "epoch": 0.7118055555555556, "grad_norm": 0.7499803900718689, "kl": 0.08343505859375, "learning_rate": 6.981041185156506e-07, "loss": 0.1064, "reward": 1.5208333730697632, "reward_std": 0.46483254060149193, "rewards/accuracy_reward": 0.6041666865348816, "rewards/format_reward": 0.9166666716337204, "step": 205 }, { "completion_length": 374.0833435058594, "epoch": 0.7152777777777778, "grad_norm": 0.13928478956222534, "kl": 0.030792236328125, "learning_rate": 6.827871435851497e-07, "loss": 0.0154, "reward": 1.3750000298023224, "reward_std": 0.16661179438233376, "rewards/accuracy_reward": 0.3750000149011612, "rewards/format_reward": 1.0, "step": 206 }, { "completion_length": 501.0625228881836, "epoch": 0.71875, "grad_norm": 0.0946309044957161, "kl": 0.024078369140625, "learning_rate": 6.675904034262598e-07, "loss": -0.0227, "reward": 1.4375000298023224, "reward_std": 0.1705273948609829, "rewards/accuracy_reward": 0.43750000558793545, "rewards/format_reward": 1.0, "step": 207 }, { "completion_length": 498.2708435058594, "epoch": 0.7222222222222222, "grad_norm": 2.3851850032806396, "kl": 0.02874755859375, "learning_rate": 6.525161339027069e-07, "loss": 0.0666, "reward": 1.541666716337204, "reward_std": 0.2576756104826927, "rewards/accuracy_reward": 0.5833333414047956, "rewards/format_reward": 0.9583333432674408, "step": 208 }, { "completion_length": 511.06252670288086, "epoch": 0.7256944444444444, "grad_norm": 0.3298015892505646, "kl": 0.03863525390625, "learning_rate": 6.375665528593754e-07, "loss": 0.139, "reward": 1.3958333432674408, "reward_std": 0.29669976979494095, "rewards/accuracy_reward": 0.5000000111758709, "rewards/format_reward": 0.895833358168602, "step": 209 }, { "completion_length": 621.8541946411133, "epoch": 0.7291666666666666, "grad_norm": 1.3768178224563599, "kl": 0.027679443359375, "learning_rate": 6.227438597960031e-07, "loss": 0.0904, "reward": 1.5833334028720856, "reward_std": 0.3061862215399742, "rewards/accuracy_reward": 0.6250000149011612, "rewards/format_reward": 0.9583333432674408, "step": 210 }, { "completion_length": 598.3333358764648, "epoch": 0.7326388888888888, "grad_norm": 0.9648879766464233, "kl": 0.04754638671875, "learning_rate": 6.080502355435701e-07, "loss": 0.1075, "reward": 1.0625000298023224, "reward_std": 0.26070838794112206, "rewards/accuracy_reward": 0.1250000037252903, "rewards/format_reward": 0.9375, "step": 211 }, { "completion_length": 592.1666870117188, "epoch": 0.7361111111111112, "grad_norm": 3.8903932571411133, "kl": 0.04022216796875, "learning_rate": 5.934878419434403e-07, "loss": 0.1579, "reward": 1.1458333730697632, "reward_std": 0.29669976606965065, "rewards/accuracy_reward": 0.2083333432674408, "rewards/format_reward": 0.9375000149011612, "step": 212 }, { "completion_length": 637.3333587646484, "epoch": 0.7395833333333334, "grad_norm": 0.3173258900642395, "kl": 0.038299560546875, "learning_rate": 5.790588215292935e-07, "loss": 0.0712, "reward": 1.3125, "reward_std": 0.1705273985862732, "rewards/accuracy_reward": 0.375, "rewards/format_reward": 0.9375, "step": 213 }, { "completion_length": 534.8125305175781, "epoch": 0.7430555555555556, "grad_norm": 0.12009190022945404, "kl": 0.021575927734375, "learning_rate": 5.647652972118998e-07, "loss": 0.0173, "reward": 1.6875000298023224, "reward_std": 0.11558076366782188, "rewards/accuracy_reward": 0.6875000149011612, "rewards/format_reward": 1.0, "step": 214 }, { "completion_length": 412.7083435058594, "epoch": 0.7465277777777778, "grad_norm": 0.15298447012901306, "kl": 0.033172607421875, "learning_rate": 5.506093719667793e-07, "loss": 0.0061, "reward": 1.4375000447034836, "reward_std": 0.2446802221238613, "rewards/accuracy_reward": 0.4583333507180214, "rewards/format_reward": 0.9791666716337204, "step": 215 }, { "completion_length": 522.6875076293945, "epoch": 0.75, "grad_norm": 0.12487559020519257, "kl": 0.03125, "learning_rate": 5.365931285247962e-07, "loss": 0.052, "reward": 1.3958333432674408, "reward_std": 0.0940965861082077, "rewards/accuracy_reward": 0.4166666679084301, "rewards/format_reward": 0.9791666716337204, "step": 216 }, { "completion_length": 433.1458435058594, "epoch": 0.7534722222222222, "grad_norm": 0.25384294986724854, "kl": 0.024444580078125, "learning_rate": 5.227186290657315e-07, "loss": -0.0151, "reward": 1.5000000298023224, "reward_std": 0.268673874437809, "rewards/accuracy_reward": 0.5208333395421505, "rewards/format_reward": 0.9791666716337204, "step": 217 }, { "completion_length": 418.125, "epoch": 0.7569444444444444, "grad_norm": 0.021524284034967422, "kl": 0.02813720703125, "learning_rate": 5.089879149148781e-07, "loss": 0.0011, "reward": 1.625, "reward_std": 0.0, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 1.0, "step": 218 }, { "completion_length": 545.9791793823242, "epoch": 0.7604166666666666, "grad_norm": 0.5041170716285706, "kl": 0.043212890625, "learning_rate": 4.954030062427058e-07, "loss": 0.0828, "reward": 1.0625000298023224, "reward_std": 0.40168892219662666, "rewards/accuracy_reward": 0.14583333767950535, "rewards/format_reward": 0.9166666716337204, "step": 219 }, { "completion_length": 676.0000152587891, "epoch": 0.7638888888888888, "grad_norm": 0.3889068067073822, "kl": 0.0419921875, "learning_rate": 4.819659017676376e-07, "loss": 0.095, "reward": 1.2291666865348816, "reward_std": 0.2350771203637123, "rewards/accuracy_reward": 0.33333333395421505, "rewards/format_reward": 0.8958333432674408, "step": 220 }, { "completion_length": 477.7916946411133, "epoch": 0.7673611111111112, "grad_norm": 0.14289724826812744, "kl": 0.0274658203125, "learning_rate": 4.686785784619824e-07, "loss": -0.0252, "reward": 1.2708333432674408, "reward_std": 0.18796167895197868, "rewards/accuracy_reward": 0.27083333395421505, "rewards/format_reward": 1.0, "step": 221 }, { "completion_length": 505.5833435058594, "epoch": 0.7708333333333334, "grad_norm": 0.15408483147621155, "kl": 0.028106689453125, "learning_rate": 4.555429912610674e-07, "loss": 0.0698, "reward": 1.416666716337204, "reward_std": 0.24859582632780075, "rewards/accuracy_reward": 0.4375000037252903, "rewards/format_reward": 0.9791666716337204, "step": 222 }, { "completion_length": 623.5208358764648, "epoch": 0.7743055555555556, "grad_norm": 0.012931477278470993, "kl": 0.0222625732421875, "learning_rate": 4.425610727756131e-07, "loss": 0.0009, "reward": 1.375, "reward_std": 0.0, "rewards/accuracy_reward": 0.375, "rewards/format_reward": 1.0, "step": 223 }, { "completion_length": 547.0833587646484, "epoch": 0.7777777777777778, "grad_norm": 0.5076951384544373, "kl": 0.0321044921875, "learning_rate": 4.297347330073915e-07, "loss": 0.0912, "reward": 1.479166716337204, "reward_std": 0.4217669628560543, "rewards/accuracy_reward": 0.5416666828095913, "rewards/format_reward": 0.9375000149011612, "step": 224 }, { "completion_length": 649.0625152587891, "epoch": 0.78125, "grad_norm": 0.6371507048606873, "kl": 0.0396728515625, "learning_rate": 4.170658590682134e-07, "loss": 0.1918, "reward": 1.3125000149011612, "reward_std": 0.32525811344385147, "rewards/accuracy_reward": 0.4375000111758709, "rewards/format_reward": 0.875, "step": 225 }, { "completion_length": 416.5833511352539, "epoch": 0.7847222222222222, "grad_norm": 2.145371198654175, "kl": 0.03436279296875, "learning_rate": 4.045563149022792e-07, "loss": 0.0107, "reward": 1.4375000298023224, "reward_std": 0.21764283254742622, "rewards/accuracy_reward": 0.4583333358168602, "rewards/format_reward": 0.9791666716337204, "step": 226 }, { "completion_length": 545.5833435058594, "epoch": 0.7881944444444444, "grad_norm": 0.37443456053733826, "kl": 0.04248046875, "learning_rate": 3.922079410119428e-07, "loss": 0.1246, "reward": 1.3750000447034836, "reward_std": 0.41228052973747253, "rewards/accuracy_reward": 0.4375000149011612, "rewards/format_reward": 0.9375000149011612, "step": 227 }, { "completion_length": 697.2500152587891, "epoch": 0.7916666666666666, "grad_norm": 0.4568527340888977, "kl": 0.040924072265625, "learning_rate": 3.800225541869216e-07, "loss": 0.0888, "reward": 1.2708333730697632, "reward_std": 0.2446802221238613, "rewards/accuracy_reward": 0.35416666977107525, "rewards/format_reward": 0.9166666865348816, "step": 228 }, { "completion_length": 536.1250228881836, "epoch": 0.7951388888888888, "grad_norm": 1.1817526817321777, "kl": 0.03704833984375, "learning_rate": 3.680019472369961e-07, "loss": 0.1213, "reward": 1.2708333879709244, "reward_std": 0.31970493495464325, "rewards/accuracy_reward": 0.3333333395421505, "rewards/format_reward": 0.9375000149011612, "step": 229 }, { "completion_length": 651.4791870117188, "epoch": 0.7986111111111112, "grad_norm": 0.7024496793746948, "kl": 0.04119873046875, "learning_rate": 3.5614788872823836e-07, "loss": 0.1649, "reward": 1.3125000298023224, "reward_std": 0.49135757237672806, "rewards/accuracy_reward": 0.4375000074505806, "rewards/format_reward": 0.8750000298023224, "step": 230 }, { "completion_length": 641.3333435058594, "epoch": 0.8020833333333334, "grad_norm": 1.1681843996047974, "kl": 0.042449951171875, "learning_rate": 3.4446212272280564e-07, "loss": 0.1224, "reward": 0.958333358168602, "reward_std": 0.2861081510782242, "rewards/accuracy_reward": 0.06250000186264515, "rewards/format_reward": 0.8958333432674408, "step": 231 }, { "completion_length": 644.0833435058594, "epoch": 0.8055555555555556, "grad_norm": 7.943032264709473, "kl": 0.033935546875, "learning_rate": 3.3294636852234106e-07, "loss": 0.0831, "reward": 1.4166666865348816, "reward_std": 0.2957112491130829, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.9375, "step": 232 }, { "completion_length": 590.7916717529297, "epoch": 0.8090277777777778, "grad_norm": 1.9067875146865845, "kl": 0.07415771484375, "learning_rate": 3.2160232041501604e-07, "loss": 0.2081, "reward": 1.354166716337204, "reward_std": 0.3842546232044697, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.8750000149011612, "step": 233 }, { "completion_length": 424.37501525878906, "epoch": 0.8125, "grad_norm": 0.14055544137954712, "kl": 0.0258331298828125, "learning_rate": 3.104316474262537e-07, "loss": 0.0097, "reward": 1.3125000298023224, "reward_std": 0.1705273948609829, "rewards/accuracy_reward": 0.31250000558793545, "rewards/format_reward": 1.0, "step": 234 }, { "completion_length": 620.8541870117188, "epoch": 0.8159722222222222, "grad_norm": 2.1229634284973145, "kl": 0.04376220703125, "learning_rate": 2.994359930731681e-07, "loss": 0.1707, "reward": 1.3750000447034836, "reward_std": 0.31592754647135735, "rewards/accuracy_reward": 0.4583333395421505, "rewards/format_reward": 0.9166666716337204, "step": 235 }, { "completion_length": 505.9791793823242, "epoch": 0.8194444444444444, "grad_norm": 0.03793416544795036, "kl": 0.025665283203125, "learning_rate": 2.8861697512275814e-07, "loss": -0.0182, "reward": 1.4375, "reward_std": 0.06846532225608826, "rewards/accuracy_reward": 0.4375, "rewards/format_reward": 1.0, "step": 236 }, { "completion_length": 459.7708511352539, "epoch": 0.8229166666666666, "grad_norm": 0.16315123438835144, "kl": 0.024749755859375, "learning_rate": 2.7797618535388707e-07, "loss": 0.0019, "reward": 1.3333333730697632, "reward_std": 0.2686738707125187, "rewards/accuracy_reward": 0.3333333395421505, "rewards/format_reward": 1.0, "step": 237 }, { "completion_length": 374.3125, "epoch": 0.8263888888888888, "grad_norm": 0.563412606716156, "kl": 0.04132080078125, "learning_rate": 2.675151893230907e-07, "loss": -0.013, "reward": 1.6041666865348816, "reward_std": 0.1801304891705513, "rewards/accuracy_reward": 0.6041666716337204, "rewards/format_reward": 1.0, "step": 238 }, { "completion_length": 397.4166679382324, "epoch": 0.8298611111111112, "grad_norm": 2.5006625652313232, "kl": 0.03570556640625, "learning_rate": 2.572355261342369e-07, "loss": 0.014, "reward": 1.5416667312383652, "reward_std": 0.20412414520978928, "rewards/accuracy_reward": 0.5625000149011612, "rewards/format_reward": 0.9791666716337204, "step": 239 }, { "completion_length": 691.5208435058594, "epoch": 0.8333333333333334, "grad_norm": 1.2476760149002075, "kl": 0.049560546875, "learning_rate": 2.4713870821208276e-07, "loss": 0.0756, "reward": 0.9583333432674408, "reward_std": 0.23899272456765175, "rewards/accuracy_reward": 0.0625, "rewards/format_reward": 0.8958333432674408, "step": 240 }, { "completion_length": 561.0833435058594, "epoch": 0.8368055555555556, "grad_norm": 1.876926302909851, "kl": 0.02349853515625, "learning_rate": 2.3722622107975367e-07, "loss": 0.0305, "reward": 1.5000000596046448, "reward_std": 0.22155844047665596, "rewards/accuracy_reward": 0.5208333432674408, "rewards/format_reward": 0.9791666716337204, "step": 241 }, { "completion_length": 532.2291870117188, "epoch": 0.8402777777777778, "grad_norm": 1.4736485481262207, "kl": 0.02886962890625, "learning_rate": 2.274995231401828e-07, "loss": 0.0298, "reward": 1.291666716337204, "reward_std": 0.2861081659793854, "rewards/accuracy_reward": 0.31250000558793545, "rewards/format_reward": 0.9791666716337204, "step": 242 }, { "completion_length": 643.0625381469727, "epoch": 0.84375, "grad_norm": 8.321310043334961, "kl": 0.04876708984375, "learning_rate": 2.179600454615379e-07, "loss": 0.1336, "reward": 1.208333358168602, "reward_std": 0.2686738707125187, "rewards/accuracy_reward": 0.2708333395421505, "rewards/format_reward": 0.9375000149011612, "step": 243 }, { "completion_length": 572.3750152587891, "epoch": 0.8472222222222222, "grad_norm": 1.7802728414535522, "kl": 0.045257568359375, "learning_rate": 2.0860919156667228e-07, "loss": 0.074, "reward": 1.2291666865348816, "reward_std": 0.21764282882213593, "rewards/accuracy_reward": 0.29166667722165585, "rewards/format_reward": 0.9375000149011612, "step": 244 }, { "completion_length": 477.7291717529297, "epoch": 0.8506944444444444, "grad_norm": 0.03867839276790619, "kl": 0.031280517578125, "learning_rate": 1.9944833722662703e-07, "loss": 0.0012, "reward": 1.375, "reward_std": 0.0, "rewards/accuracy_reward": 0.375, "rewards/format_reward": 1.0, "step": 245 }, { "completion_length": 425.54168701171875, "epoch": 0.8541666666666666, "grad_norm": 0.11910185217857361, "kl": 0.02288818359375, "learning_rate": 1.9047883025821777e-07, "loss": 0.0133, "reward": 1.4375000298023224, "reward_std": 0.1705274060368538, "rewards/accuracy_reward": 0.4375000149011612, "rewards/format_reward": 1.0, "step": 246 }, { "completion_length": 497.00001525878906, "epoch": 0.8576388888888888, "grad_norm": 2.7801411151885986, "kl": 0.044464111328125, "learning_rate": 1.8170199032573138e-07, "loss": 0.1203, "reward": 1.541666716337204, "reward_std": 0.3651650920510292, "rewards/accuracy_reward": 0.5833333432674408, "rewards/format_reward": 0.9583333432674408, "step": 247 }, { "completion_length": 445.2291793823242, "epoch": 0.8611111111111112, "grad_norm": 0.11879656463861465, "kl": 0.0244140625, "learning_rate": 1.7311910874676852e-07, "loss": 0.0068, "reward": 1.5208333730697632, "reward_std": 0.2525114119052887, "rewards/accuracy_reward": 0.5208333432674408, "rewards/format_reward": 1.0, "step": 248 }, { "completion_length": 533.6875076293945, "epoch": 0.8645833333333334, "grad_norm": 8.463733673095703, "kl": 0.1112060546875, "learning_rate": 1.647314483022535e-07, "loss": 0.1482, "reward": 1.3750000298023224, "reward_std": 0.3651651032269001, "rewards/accuracy_reward": 0.4375000149011612, "rewards/format_reward": 0.9375000149011612, "step": 249 }, { "completion_length": 524.9791717529297, "epoch": 0.8680555555555556, "grad_norm": 3.1616408824920654, "kl": 0.049652099609375, "learning_rate": 1.5654024305064514e-07, "loss": 0.0704, "reward": 1.4166667014360428, "reward_std": 0.2646239884197712, "rewards/accuracy_reward": 0.4583333432674408, "rewards/format_reward": 0.9583333432674408, "step": 250 }, { "completion_length": 500.04168701171875, "epoch": 0.8715277777777778, "grad_norm": 0.11291686445474625, "kl": 0.02020263671875, "learning_rate": 1.4854669814637145e-07, "loss": -0.0136, "reward": 1.3125000298023224, "reward_std": 0.1530931033194065, "rewards/accuracy_reward": 0.31250002048909664, "rewards/format_reward": 1.0, "step": 251 }, { "completion_length": 570.7708511352539, "epoch": 0.875, "grad_norm": 1.6747345924377441, "kl": 0.073883056640625, "learning_rate": 1.407519896625184e-07, "loss": 0.0826, "reward": 1.6041666865348816, "reward_std": 0.41912318766117096, "rewards/accuracy_reward": 0.6875000149011612, "rewards/format_reward": 0.9166666716337204, "step": 252 }, { "completion_length": 615.0208435058594, "epoch": 0.8784722222222222, "grad_norm": 1.1258031129837036, "kl": 0.0546875, "learning_rate": 1.3315726441779629e-07, "loss": 0.0998, "reward": 1.5000000298023224, "reward_std": 0.3117394223809242, "rewards/accuracy_reward": 0.5625000074505806, "rewards/format_reward": 0.9375000149011612, "step": 253 }, { "completion_length": 558.1041870117188, "epoch": 0.8819444444444444, "grad_norm": 2.2488062381744385, "kl": 0.14599609375, "learning_rate": 1.257636398078122e-07, "loss": 0.0493, "reward": 1.3333333432674408, "reward_std": 0.11949636042118073, "rewards/accuracy_reward": 0.3958333432674408, "rewards/format_reward": 0.9375, "step": 254 }, { "completion_length": 481.1458435058594, "epoch": 0.8854166666666666, "grad_norm": 1.4159892797470093, "kl": 0.0430908203125, "learning_rate": 1.1857220364066801e-07, "loss": 0.0668, "reward": 1.625, "reward_std": 0.2201632708311081, "rewards/accuracy_reward": 0.666666679084301, "rewards/format_reward": 0.9583333432674408, "step": 255 }, { "completion_length": 536.0208511352539, "epoch": 0.8888888888888888, "grad_norm": 5.645384311676025, "kl": 0.03692626953125, "learning_rate": 1.1158401397691459e-07, "loss": 0.0404, "reward": 1.4375000596046448, "reward_std": 0.32525812089443207, "rewards/accuracy_reward": 0.4583333507180214, "rewards/format_reward": 0.9791666716337204, "step": 256 }, { "completion_length": 458.3541717529297, "epoch": 0.8923611111111112, "grad_norm": 0.18888327479362488, "kl": 0.03729248046875, "learning_rate": 1.0480009897388154e-07, "loss": -0.0022, "reward": 1.3125000596046448, "reward_std": 0.29669976979494095, "rewards/accuracy_reward": 0.33333334140479565, "rewards/format_reward": 0.9791666716337204, "step": 257 }, { "completion_length": 612.1458587646484, "epoch": 0.8958333333333334, "grad_norm": 5.865067005157471, "kl": 0.13897705078125, "learning_rate": 9.822145673440658e-08, "loss": 0.0542, "reward": 1.2291667312383652, "reward_std": 0.33713918179273605, "rewards/accuracy_reward": 0.2708333395421505, "rewards/format_reward": 0.9583333432674408, "step": 258 }, { "completion_length": 503.14583587646484, "epoch": 0.8993055555555556, "grad_norm": 1.1841014623641968, "kl": 0.03631591796875, "learning_rate": 9.184905515998698e-08, "loss": 0.0956, "reward": 1.5000000298023224, "reward_std": 0.2646239623427391, "rewards/accuracy_reward": 0.5416666716337204, "rewards/format_reward": 0.9583333432674408, "step": 259 }, { "completion_length": 577.3125152587891, "epoch": 0.9027777777777778, "grad_norm": 4.693487644195557, "kl": 0.0440673828125, "learning_rate": 8.568383180837369e-08, "loss": 0.0975, "reward": 1.3125000298023224, "reward_std": 0.21359294280409813, "rewards/accuracy_reward": 0.3541666679084301, "rewards/format_reward": 0.9583333432674408, "step": 260 }, { "completion_length": 732.8125305175781, "epoch": 0.90625, "grad_norm": 0.7248184680938721, "kl": 0.07733154296875, "learning_rate": 7.972669375563147e-08, "loss": 0.0745, "reward": 1.4583334028720856, "reward_std": 0.37717197835445404, "rewards/accuracy_reward": 0.5416666865348816, "rewards/format_reward": 0.9166666716337204, "step": 261 }, { "completion_length": 481.2083435058594, "epoch": 0.9097222222222222, "grad_norm": 2.006963014602661, "kl": 0.0384368896484375, "learning_rate": 7.397851746268148e-08, "loss": 0.0442, "reward": 1.4583333730697632, "reward_std": 0.20412413403391838, "rewards/accuracy_reward": 0.4791666716337204, "rewards/format_reward": 0.9791666716337204, "step": 262 }, { "completion_length": 625.3958587646484, "epoch": 0.9131944444444444, "grad_norm": 7.472949028015137, "kl": 0.076202392578125, "learning_rate": 6.844014864635095e-08, "loss": 0.1915, "reward": 1.2083333432674408, "reward_std": 0.347730815410614, "rewards/accuracy_reward": 0.2916666679084301, "rewards/format_reward": 0.9166666716337204, "step": 263 }, { "completion_length": 720.2500305175781, "epoch": 0.9166666666666666, "grad_norm": 5.328312397003174, "kl": 0.0657958984375, "learning_rate": 6.311240215494307e-08, "loss": 0.1129, "reward": 1.1666667014360428, "reward_std": 0.34296492487192154, "rewards/accuracy_reward": 0.25000000186264515, "rewards/format_reward": 0.9166666865348816, "step": 264 }, { "completion_length": 485.29168701171875, "epoch": 0.9201388888888888, "grad_norm": 11.490623474121094, "kl": 0.0450439453125, "learning_rate": 5.7996061848351653e-08, "loss": 0.0173, "reward": 1.5833333432674408, "reward_std": 0.18111901730298996, "rewards/accuracy_reward": 0.6250000149011612, "rewards/format_reward": 0.9583333432674408, "step": 265 }, { "completion_length": 455.41668701171875, "epoch": 0.9236111111111112, "grad_norm": 0.3541830778121948, "kl": 0.029052734375, "learning_rate": 5.3091880482732446e-08, "loss": 0.0396, "reward": 1.3333333730697632, "reward_std": 0.3061862140893936, "rewards/accuracy_reward": 0.37500002048909664, "rewards/format_reward": 0.9583333432674408, "step": 266 }, { "completion_length": 507.7291793823242, "epoch": 0.9270833333333334, "grad_norm": 1.1976244449615479, "kl": 0.03515625, "learning_rate": 4.8400579599751696e-08, "loss": 0.0396, "reward": 1.3958333730697632, "reward_std": 0.4822668433189392, "rewards/accuracy_reward": 0.4375000037252903, "rewards/format_reward": 0.9583333432674408, "step": 267 }, { "completion_length": 617.2083587646484, "epoch": 0.9305555555555556, "grad_norm": 2.1803925037384033, "kl": 0.034423828125, "learning_rate": 4.3922849420428566e-08, "loss": 0.021, "reward": 1.1250000149011612, "reward_std": 0.18404608592391014, "rewards/accuracy_reward": 0.1458333358168602, "rewards/format_reward": 0.9791666716337204, "step": 268 }, { "completion_length": 441.06250762939453, "epoch": 0.9340277777777778, "grad_norm": 0.4175410866737366, "kl": 0.0267333984375, "learning_rate": 3.9659348743582904e-08, "loss": 0.0344, "reward": 1.6041666865348816, "reward_std": 0.1801304966211319, "rewards/accuracy_reward": 0.625, "rewards/format_reward": 0.9791666716337204, "step": 269 }, { "completion_length": 567.7291870117188, "epoch": 0.9375, "grad_norm": 1.3977940082550049, "kl": 0.038909912109375, "learning_rate": 3.561070484890822e-08, "loss": 0.0753, "reward": 1.3333333730697632, "reward_std": 0.2471896931529045, "rewards/accuracy_reward": 0.3750000149011612, "rewards/format_reward": 0.9583333432674408, "step": 270 }, { "completion_length": 638.8333587646484, "epoch": 0.9409722222222222, "grad_norm": 7.876731872558594, "kl": 0.06121826171875, "learning_rate": 3.177751340468138e-08, "loss": 0.0914, "reward": 1.145833358168602, "reward_std": 0.3683236688375473, "rewards/accuracy_reward": 0.2083333358168602, "rewards/format_reward": 0.9375000149011612, "step": 271 }, { "completion_length": 643.6458511352539, "epoch": 0.9444444444444444, "grad_norm": 2.4724576473236084, "kl": 0.055206298828125, "learning_rate": 2.8160338380123052e-08, "loss": 0.0717, "reward": 1.2500000298023224, "reward_std": 0.20412413775920868, "rewards/accuracy_reward": 0.2916666679084301, "rewards/format_reward": 0.9583333432674408, "step": 272 }, { "completion_length": 465.31251525878906, "epoch": 0.9479166666666666, "grad_norm": 0.8830697536468506, "kl": 0.031280517578125, "learning_rate": 2.475971196242238e-08, "loss": 0.0348, "reward": 1.6041666865348816, "reward_std": 0.1946377009153366, "rewards/accuracy_reward": 0.6250000111758709, "rewards/format_reward": 0.9791666716337204, "step": 273 }, { "completion_length": 752.2916717529297, "epoch": 0.9513888888888888, "grad_norm": 2.7944793701171875, "kl": 0.058990478515625, "learning_rate": 2.1576134478437316e-08, "loss": 0.1499, "reward": 1.1875000298023224, "reward_std": 0.38299770653247833, "rewards/accuracy_reward": 0.2708333469927311, "rewards/format_reward": 0.9166666865348816, "step": 274 }, { "completion_length": 659.2916793823242, "epoch": 0.9548611111111112, "grad_norm": 3.7506420612335205, "kl": 0.10986328125, "learning_rate": 1.861007432108247e-08, "loss": 0.1699, "reward": 1.0416666865348816, "reward_std": 0.30354244261980057, "rewards/accuracy_reward": 0.2083333358168602, "rewards/format_reward": 0.8333333432674408, "step": 275 }, { "completion_length": 395.4583435058594, "epoch": 0.9583333333333334, "grad_norm": 0.5847988724708557, "kl": 0.028656005859375, "learning_rate": 1.5861967880415607e-08, "loss": 0.0542, "reward": 1.7500000298023224, "reward_std": 0.14512762054800987, "rewards/accuracy_reward": 0.7708333432674408, "rewards/format_reward": 0.9791666716337204, "step": 276 }, { "completion_length": 527.1458511352539, "epoch": 0.9618055555555556, "grad_norm": 2.3661959171295166, "kl": 0.037567138671875, "learning_rate": 1.3332219479432307e-08, "loss": 0.043, "reward": 1.4583333730697632, "reward_std": 0.333223607391119, "rewards/accuracy_reward": 0.47916667722165585, "rewards/format_reward": 0.9791666716337204, "step": 277 }, { "completion_length": 549.2500152587891, "epoch": 0.9652777777777778, "grad_norm": 2.8095014095306396, "kl": 0.026641845703125, "learning_rate": 1.1021201314579399e-08, "loss": 0.0055, "reward": 1.3333333730697632, "reward_std": 0.3006153665482998, "rewards/accuracy_reward": 0.3541666828095913, "rewards/format_reward": 0.9791666716337204, "step": 278 }, { "completion_length": 313.6458396911621, "epoch": 0.96875, "grad_norm": 0.06768506020307541, "kl": 0.024871826171875, "learning_rate": 8.92925340099343e-09, "loss": -0.0247, "reward": 1.6041666865348816, "reward_std": 0.13301505148410797, "rewards/accuracy_reward": 0.6041666716337204, "rewards/format_reward": 1.0, "step": 279 }, { "completion_length": 755.3750152587891, "epoch": 0.9722222222222222, "grad_norm": 7.620341777801514, "kl": 0.11541748046875, "learning_rate": 7.056683522476181e-09, "loss": 0.1675, "reward": 1.145833358168602, "reward_std": 0.2996268570423126, "rewards/accuracy_reward": 0.2916666679084301, "rewards/format_reward": 0.8541666865348816, "step": 280 }, { "completion_length": 470.1041793823242, "epoch": 0.9756944444444444, "grad_norm": 0.13627387583255768, "kl": 0.025299072265625, "learning_rate": 5.403767186210218e-09, "loss": -0.0106, "reward": 1.4166666865348816, "reward_std": 0.3332235924899578, "rewards/accuracy_reward": 0.416666679084301, "rewards/format_reward": 1.0, "step": 281 }, { "completion_length": 535.0625228881836, "epoch": 0.9791666666666666, "grad_norm": 0.968426525592804, "kl": 0.04052734375, "learning_rate": 3.970747582224488e-09, "loss": 0.0522, "reward": 1.3541666865348816, "reward_std": 0.22407887876033783, "rewards/accuracy_reward": 0.3750000074505806, "rewards/format_reward": 0.9791666716337204, "step": 282 }, { "completion_length": 479.0833511352539, "epoch": 0.9826388888888888, "grad_norm": 19.247583389282227, "kl": 0.032440185546875, "learning_rate": 2.757835547614107e-09, "loss": 0.0698, "reward": 1.5208333432674408, "reward_std": 0.16913224011659622, "rewards/accuracy_reward": 0.541666679084301, "rewards/format_reward": 0.9791666716337204, "step": 283 }, { "completion_length": 520.5833435058594, "epoch": 0.9861111111111112, "grad_norm": 0.10353828221559525, "kl": 0.02850341796875, "learning_rate": 1.7652095355205068e-09, "loss": 0.0174, "reward": 1.2708333730697632, "reward_std": 0.11558076366782188, "rewards/accuracy_reward": 0.2708333395421505, "rewards/format_reward": 1.0, "step": 284 }, { "completion_length": 524.3541793823242, "epoch": 0.9895833333333334, "grad_norm": 0.581836998462677, "kl": 0.044403076171875, "learning_rate": 9.930155888761006e-10, "loss": 0.069, "reward": 1.4791666865348816, "reward_std": 0.27258946001529694, "rewards/accuracy_reward": 0.5000000149011612, "rewards/format_reward": 0.9791666716337204, "step": 285 }, { "completion_length": 605.5833435058594, "epoch": 0.9930555555555556, "grad_norm": 2.5457794666290283, "kl": 0.101348876953125, "learning_rate": 4.413673189168077e-10, "loss": 0.112, "reward": 1.0833333879709244, "reward_std": 0.4056045413017273, "rewards/accuracy_reward": 0.2083333358168602, "rewards/format_reward": 0.8750000149011612, "step": 286 }, { "completion_length": 663.5833435058594, "epoch": 0.9965277777777778, "grad_norm": 1.5694972276687622, "kl": 0.1168212890625, "learning_rate": 1.1034588846758897e-10, "loss": 0.0763, "reward": 1.1041666865348816, "reward_std": 0.3627704493701458, "rewards/accuracy_reward": 0.22916666977107525, "rewards/format_reward": 0.875, "step": 287 }, { "completion_length": 625.8125152587891, "epoch": 1.0, "grad_norm": 0.39495694637298584, "kl": 0.0472412109375, "learning_rate": 0.0, "loss": -0.0067, "reward": 1.5208333730697632, "reward_std": 0.27119430527091026, "rewards/accuracy_reward": 0.5416666865348816, "rewards/format_reward": 0.9791666716337204, "step": 288 }, { "epoch": 1.0, "eval_completion_length": 551.2072158536882, "eval_kl": 0.06933934883048527, "eval_loss": 0.0844486728310585, "eval_reward": 1.3422709299178281, "eval_reward_std": 0.3130362899101753, "eval_rewards/accuracy_reward": 0.401812697825475, "eval_rewards/format_reward": 0.9404582175963595, "eval_runtime": 11393.662, "eval_samples_per_second": 0.116, "eval_steps_per_second": 0.01, "step": 288 }, { "epoch": 1.0, "step": 288, "total_flos": 0.0, "train_loss": 0.2942696151104529, "train_runtime": 40023.3398, "train_samples_per_second": 0.058, "train_steps_per_second": 0.007 } ], "logging_steps": 1, "max_steps": 288, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 0.0, "train_batch_size": 3, "trial_name": null, "trial_params": null }