PEFT
Safetensors
Qwen2.5-7B-GRPO_r128-NLI / trainer_state.json
pablomiralles22's picture
Upload folder using huggingface_hub
51cebc3 verified
Raw
History Blame Contribute Delete
292 kB
{
"best_global_step": null,
"best_metric": null,
"best_model_checkpoint": null,
"epoch": 0.1365374112506827,
"eval_steps": 500,
"global_step": 1000,
"is_hyper_param_search": false,
"is_local_process_zero": true,
"is_world_process_zero": true,
"log_history": [
{
"clip_ratio": 0.0,
"completion_length": 130.0625,
"epoch": 0.00013653741125068268,
"grad_norm": 0.08739373087882996,
"kl": 0.0006317789470813295,
"learning_rate": 1.0000000000000001e-07,
"loss": -0.0002,
"num_tokens": 11046.0,
"reward": 0.7437499761581421,
"reward_std": 0.19240379333496094,
"rewards/reward_fn": 0.7437499761581421,
"step": 1
},
{
"clip_ratio": 0.0,
"epoch": 0.00027307482250136535,
"grad_norm": 0.08738827705383301,
"kl": 0.0006317789470813295,
"learning_rate": 2.0000000000000002e-07,
"loss": -0.0002,
"step": 2
},
{
"clip_ratio": 0.0,
"epoch": 0.00040961223375204805,
"grad_norm": 0.08647612482309341,
"kl": 0.0006050676793165621,
"learning_rate": 3.0000000000000004e-07,
"loss": -0.0001,
"step": 3
},
{
"clip_ratio": 0.0,
"epoch": 0.0005461496450027307,
"grad_norm": 0.08993478119373322,
"kl": 0.0005967747410977609,
"learning_rate": 4.0000000000000003e-07,
"loss": -0.0,
"step": 4
},
{
"clip_ratio": 0.0009092581894947216,
"completion_length": 123.28125,
"epoch": 0.0006826870562534135,
"grad_norm": 0.09589574486017227,
"kl": 0.0005814487990392081,
"learning_rate": 5.000000000000001e-07,
"loss": 0.0,
"num_tokens": 22015.0,
"reward": 0.6625000238418579,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.6625000238418579,
"step": 5
},
{
"clip_ratio": 0.00021701389050576836,
"epoch": 0.0008192244675040961,
"grad_norm": 0.09353803843259811,
"kl": 0.0005364549010664632,
"learning_rate": 6.000000000000001e-07,
"loss": 0.0001,
"step": 6
},
{
"clip_ratio": 0.001004464298603125,
"epoch": 0.0009557618787547789,
"grad_norm": 0.10129779577255249,
"kl": 0.000562284074476338,
"learning_rate": 7.000000000000001e-07,
"loss": 0.0003,
"step": 7
},
{
"clip_ratio": 0.00021701389050576836,
"epoch": 0.0010922992900054614,
"grad_norm": 0.09212316572666168,
"kl": 0.0005370138956095616,
"learning_rate": 8.000000000000001e-07,
"loss": 0.0001,
"step": 8
},
{
"clip_ratio": 0.0009476926934439689,
"completion_length": 152.6875,
"epoch": 0.0012288367012561442,
"grad_norm": 0.10085771977901459,
"kl": 0.0005878389974895981,
"learning_rate": 9.000000000000001e-07,
"loss": -0.0,
"num_tokens": 34213.0,
"reward": 0.746874988079071,
"reward_std": 0.29865381121635437,
"rewards/reward_fn": 0.746874988079071,
"step": 9
},
{
"clip_ratio": 0.00126093348080758,
"epoch": 0.001365374112506827,
"grad_norm": 0.1008201465010643,
"kl": 0.0005425554691100842,
"learning_rate": 1.0000000000000002e-06,
"loss": 0.0001,
"step": 10
},
{
"clip_ratio": 0.0007717385306023061,
"epoch": 0.0015019115237575095,
"grad_norm": 0.10120692104101181,
"kl": 0.0005051454013482726,
"learning_rate": 1.1e-06,
"loss": 0.0,
"step": 11
},
{
"clip_ratio": 0.0012008554913336411,
"epoch": 0.0016384489350081922,
"grad_norm": 0.10010115802288055,
"kl": 0.0005464185369419283,
"learning_rate": 1.2000000000000002e-06,
"loss": -0.0001,
"step": 12
},
{
"clip_ratio": 0.0009030445798998699,
"completion_length": 145.59375,
"epoch": 0.001774986346258875,
"grad_norm": 0.09043823927640915,
"kl": 0.0005211641523601429,
"learning_rate": 1.3e-06,
"loss": 0.0002,
"num_tokens": 45996.0,
"reward": 0.6312500238418579,
"reward_std": 0.2836301922798157,
"rewards/reward_fn": 0.6312500238418579,
"step": 13
},
{
"clip_ratio": 0.0006189533451106399,
"epoch": 0.0019115237575095577,
"grad_norm": 0.09039849042892456,
"kl": 0.0005784431677966495,
"learning_rate": 1.4000000000000001e-06,
"loss": 0.0002,
"step": 14
},
{
"clip_ratio": 0.00031675209174863994,
"epoch": 0.0020480611687602405,
"grad_norm": 0.09077497571706772,
"kl": 0.0005650495991176285,
"learning_rate": 1.5e-06,
"loss": 0.0002,
"step": 15
},
{
"clip_ratio": 0.000734518383978866,
"epoch": 0.002184598580010923,
"grad_norm": 0.09000656008720398,
"kl": 0.0005918515398661839,
"learning_rate": 1.6000000000000001e-06,
"loss": 0.0001,
"step": 16
},
{
"clip_ratio": 0.0001270325155928731,
"completion_length": 151.8125,
"epoch": 0.0023211359912616056,
"grad_norm": 0.08065712451934814,
"kl": 0.0005675913225786644,
"learning_rate": 1.7000000000000002e-06,
"loss": 0.0001,
"num_tokens": 58366.0,
"reward": 0.578125,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.578125,
"step": 17
},
{
"clip_ratio": 0.00040856405394151807,
"epoch": 0.0024576734025122883,
"grad_norm": 0.08062373846769333,
"kl": 0.0006601297482120572,
"learning_rate": 1.8000000000000001e-06,
"loss": 0.0001,
"step": 18
},
{
"clip_ratio": 0.0001270325155928731,
"epoch": 0.002594210813762971,
"grad_norm": 0.08101943135261536,
"kl": 0.0006057311593394843,
"learning_rate": 1.9000000000000002e-06,
"loss": 0.0002,
"step": 19
},
{
"clip_ratio": 0.0,
"epoch": 0.002730748225013654,
"grad_norm": 0.08095166832208633,
"kl": 0.0007306283941943548,
"learning_rate": 2.0000000000000003e-06,
"loss": -0.0001,
"step": 20
},
{
"clip_ratio": 0.0,
"completion_length": 175.4375,
"epoch": 0.0028672856362643366,
"grad_norm": 0.06835271418094635,
"kl": 0.0006434723027268774,
"learning_rate": 2.1000000000000002e-06,
"loss": 0.0,
"num_tokens": 71024.0,
"reward": 0.606249988079071,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.606249988079071,
"step": 21
},
{
"clip_ratio": 0.00040108305984176695,
"epoch": 0.003003823047515019,
"grad_norm": 0.06890249252319336,
"kl": 0.0007574095243398915,
"learning_rate": 2.2e-06,
"loss": -0.0001,
"step": 22
},
{
"clip_ratio": 0.0003356586676090956,
"epoch": 0.0031403604587657017,
"grad_norm": 0.07008787244558334,
"kl": 0.0008008444001461612,
"learning_rate": 2.3000000000000004e-06,
"loss": -0.0001,
"step": 23
},
{
"clip_ratio": 0.000147405662573874,
"epoch": 0.0032768978700163844,
"grad_norm": 0.06931491941213608,
"kl": 0.0008262821156677091,
"learning_rate": 2.4000000000000003e-06,
"loss": -0.0003,
"step": 24
},
{
"clip_ratio": 0.0011949757172260433,
"completion_length": 154.78125,
"epoch": 0.003413435281267067,
"grad_norm": 0.09464246779680252,
"kl": 0.0008019438510018517,
"learning_rate": 2.5e-06,
"loss": -0.0002,
"num_tokens": 82917.0,
"reward": 0.550000011920929,
"reward_std": 0.30735570192337036,
"rewards/reward_fn": 0.550000011920929,
"step": 25
},
{
"clip_ratio": 0.0008628188807051629,
"epoch": 0.00354997269251775,
"grad_norm": 0.09641154855489731,
"kl": 0.0008660993607918499,
"learning_rate": 2.6e-06,
"loss": 0.0,
"step": 26
},
{
"clip_ratio": 0.000868194954819046,
"epoch": 0.0036865101037684327,
"grad_norm": 0.09419838339090347,
"kl": 0.0010259089904138818,
"learning_rate": 2.7000000000000004e-06,
"loss": -0.0001,
"step": 27
},
{
"clip_ratio": 0.0008564656018279493,
"epoch": 0.0038230475150191155,
"grad_norm": 0.08919408172369003,
"kl": 0.0012204149879835313,
"learning_rate": 2.8000000000000003e-06,
"loss": -0.0004,
"step": 28
},
{
"clip_ratio": 0.0008514263026881963,
"completion_length": 140.875,
"epoch": 0.003959584926269798,
"grad_norm": 0.08971544355154037,
"kl": 0.001275990204703703,
"learning_rate": 2.9e-06,
"loss": -0.0001,
"num_tokens": 94653.0,
"reward": 0.606249988079071,
"reward_std": 0.1948557198047638,
"rewards/reward_fn": 0.606249988079071,
"step": 29
},
{
"clip_ratio": 0.0,
"epoch": 0.004096122337520481,
"grad_norm": 0.08967753499746323,
"kl": 0.0016255443697446026,
"learning_rate": 3e-06,
"loss": -0.0,
"step": 30
},
{
"clip_ratio": 0.000954879040364176,
"epoch": 0.004232659748771164,
"grad_norm": 0.0948873832821846,
"kl": 0.0017126279599324334,
"learning_rate": 3.1000000000000004e-06,
"loss": -0.0001,
"step": 31
},
{
"clip_ratio": 0.0009331955807283521,
"epoch": 0.004369197160021846,
"grad_norm": 0.0915728509426117,
"kl": 0.0019823211387119954,
"learning_rate": 3.2000000000000003e-06,
"loss": -0.0001,
"step": 32
},
{
"clip_ratio": 0.00015624999650754035,
"completion_length": 156.3125,
"epoch": 0.004505734571272528,
"grad_norm": 0.07780904322862625,
"kl": 0.0020532281778287143,
"learning_rate": 3.3000000000000006e-06,
"loss": -0.0001,
"num_tokens": 107451.0,
"reward": 0.6062500476837158,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.6062500476837158,
"step": 33
},
{
"clip_ratio": 0.0005133637605467811,
"epoch": 0.004642271982523211,
"grad_norm": 0.07766616344451904,
"kl": 0.00238418992375955,
"learning_rate": 3.4000000000000005e-06,
"loss": 0.0,
"step": 34
},
{
"clip_ratio": 0.0011453818005975336,
"epoch": 0.004778809393773894,
"grad_norm": 0.0797438770532608,
"kl": 0.002831721540133003,
"learning_rate": 3.5e-06,
"loss": -0.0001,
"step": 35
},
{
"clip_ratio": 0.0010551480372669175,
"epoch": 0.004915346805024577,
"grad_norm": 0.07885287702083588,
"kl": 0.003094232171861222,
"learning_rate": 3.6000000000000003e-06,
"loss": -0.0001,
"step": 36
},
{
"clip_ratio": 0.0001382743357680738,
"completion_length": 159.625,
"epoch": 0.005051884216275259,
"grad_norm": 0.06207679212093353,
"kl": 0.0033535315305925906,
"learning_rate": 3.7e-06,
"loss": -0.0001,
"num_tokens": 119355.0,
"reward": 0.6625000238418579,
"reward_std": 0.12990380823612213,
"rewards/reward_fn": 0.6625000238418579,
"step": 37
},
{
"clip_ratio": 0.00040536836604587734,
"epoch": 0.005188421627525942,
"grad_norm": 0.062118254601955414,
"kl": 0.0036885815097775776,
"learning_rate": 3.8000000000000005e-06,
"loss": -0.0001,
"step": 38
},
{
"clip_ratio": 0.000545094400877133,
"epoch": 0.005324959038776625,
"grad_norm": 0.06358339637517929,
"kl": 0.0039351375453406945,
"learning_rate": 3.900000000000001e-06,
"loss": 0.0,
"step": 39
},
{
"clip_ratio": 0.0005789794813608751,
"epoch": 0.005461496450027308,
"grad_norm": 0.06142238900065422,
"kl": 0.004162700774031691,
"learning_rate": 4.000000000000001e-06,
"loss": -0.0001,
"step": 40
},
{
"clip_ratio": 0.0004968734428985044,
"completion_length": 135.09375,
"epoch": 0.00559803386127799,
"grad_norm": 0.10866480320692062,
"kl": 0.00454872860427713,
"learning_rate": 4.1e-06,
"loss": 0.0002,
"num_tokens": 130746.0,
"reward": 0.746874988079071,
"reward_std": 0.29865381121635437,
"rewards/reward_fn": 0.746874988079071,
"step": 41
},
{
"clip_ratio": 0.0002297794126207009,
"epoch": 0.005734571272528673,
"grad_norm": 0.09940455108880997,
"kl": 0.004684018753323471,
"learning_rate": 4.2000000000000004e-06,
"loss": -0.0002,
"step": 42
},
{
"clip_ratio": 0.0002297794126207009,
"epoch": 0.005871108683779356,
"grad_norm": 0.09981972724199295,
"kl": 0.004767102662299294,
"learning_rate": 4.3e-06,
"loss": -0.0003,
"step": 43
},
{
"clip_ratio": 0.00021551724057644606,
"epoch": 0.006007646095030038,
"grad_norm": 0.0989937111735344,
"kl": 0.00463390517688822,
"learning_rate": 4.4e-06,
"loss": -0.0006,
"step": 44
},
{
"clip_ratio": 0.0,
"completion_length": 131.40625,
"epoch": 0.006144183506280721,
"grad_norm": 0.06329631805419922,
"kl": 0.004799115195055492,
"learning_rate": 4.5e-06,
"loss": -0.0,
"num_tokens": 142491.0,
"reward": 0.6343749761581421,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.6343749761581421,
"step": 45
},
{
"clip_ratio": 0.00017655367264524102,
"epoch": 0.006280720917531403,
"grad_norm": 0.06211785599589348,
"kl": 0.0047047465850482695,
"learning_rate": 4.600000000000001e-06,
"loss": -0.0002,
"step": 46
},
{
"clip_ratio": 0.0,
"epoch": 0.006417258328782086,
"grad_norm": 0.060480426996946335,
"kl": 0.004680782469222322,
"learning_rate": 4.7e-06,
"loss": -0.0003,
"step": 47
},
{
"clip_ratio": 0.0008001700480235741,
"epoch": 0.006553795740032769,
"grad_norm": 0.06124988943338394,
"kl": 0.004546212963759899,
"learning_rate": 4.800000000000001e-06,
"loss": -0.0004,
"step": 48
},
{
"clip_ratio": 0.0,
"completion_length": 138.84375,
"epoch": 0.006690333151283452,
"grad_norm": 0.09592146426439285,
"kl": 0.004827649225262576,
"learning_rate": 4.9000000000000005e-06,
"loss": -0.0001,
"num_tokens": 153834.0,
"reward": 0.550000011920929,
"reward_std": 0.2899519205093384,
"rewards/reward_fn": 0.550000011920929,
"step": 49
},
{
"clip_ratio": 0.0011473706836113706,
"epoch": 0.006826870562534134,
"grad_norm": 0.09477215260267258,
"kl": 0.004913321821732097,
"learning_rate": 5e-06,
"loss": -0.0002,
"step": 50
},
{
"clip_ratio": 0.00017655367264524102,
"epoch": 0.006963407973784817,
"grad_norm": 0.09420502185821533,
"kl": 0.005133655802637804,
"learning_rate": 4.9947368421052636e-06,
"loss": -0.0006,
"step": 51
},
{
"clip_ratio": 0.0006438815908040851,
"epoch": 0.0070999453850355,
"grad_norm": 0.08837559819221497,
"kl": 0.005440949782496318,
"learning_rate": 4.989473684210527e-06,
"loss": -0.0011,
"step": 52
},
{
"clip_ratio": 0.0003052657120861113,
"completion_length": 140.1875,
"epoch": 0.007236482796286183,
"grad_norm": 0.07635519653558731,
"kl": 0.004967198314261623,
"learning_rate": 4.98421052631579e-06,
"loss": 0.0001,
"num_tokens": 165068.0,
"reward": 0.26875001192092896,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.26875001192092896,
"step": 53
},
{
"clip_ratio": 0.0,
"epoch": 0.007373020207536865,
"grad_norm": 0.07609064877033234,
"kl": 0.005105830910906661,
"learning_rate": 4.978947368421053e-06,
"loss": 0.0001,
"step": 54
},
{
"clip_ratio": 0.0004236875247443095,
"epoch": 0.007509557618787548,
"grad_norm": 0.07511620223522186,
"kl": 0.0052619903508457355,
"learning_rate": 4.973684210526316e-06,
"loss": -0.0003,
"step": 55
},
{
"clip_ratio": 0.0,
"epoch": 0.007646095030038231,
"grad_norm": 0.0717560425400734,
"kl": 0.005385495860537048,
"learning_rate": 4.968421052631579e-06,
"loss": -0.0006,
"step": 56
},
{
"clip_ratio": 0.0006011680379742756,
"completion_length": 143.28125,
"epoch": 0.007782632441288913,
"grad_norm": 0.10058116912841797,
"kl": 0.007372127176495269,
"learning_rate": 4.9631578947368426e-06,
"loss": 0.0004,
"num_tokens": 177057.0,
"reward": 0.6625000238418579,
"reward_std": 0.30735570192337036,
"rewards/reward_fn": 0.6625000238418579,
"step": 57
},
{
"clip_ratio": 0.0006176497845444828,
"epoch": 0.007919169852539596,
"grad_norm": 0.10059979557991028,
"kl": 0.007655073924979661,
"learning_rate": 4.957894736842106e-06,
"loss": -0.0,
"step": 58
},
{
"clip_ratio": 0.0002929344482254237,
"epoch": 0.008055707263790278,
"grad_norm": 0.0992376059293747,
"kl": 0.008138025958032813,
"learning_rate": 4.952631578947369e-06,
"loss": -0.0006,
"step": 59
},
{
"clip_ratio": 0.0005786725378129631,
"epoch": 0.008192244675040962,
"grad_norm": 0.09717098623514175,
"kl": 0.008423170140304137,
"learning_rate": 4.947368421052632e-06,
"loss": -0.0012,
"step": 60
},
{
"clip_ratio": 0.0005044226418249309,
"completion_length": 145.75,
"epoch": 0.008328782086291644,
"grad_norm": 0.07611903548240662,
"kl": 0.008245052813435905,
"learning_rate": 4.942105263157895e-06,
"loss": 0.0003,
"num_tokens": 189173.0,
"reward": 0.7749999761581421,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.7749999761581421,
"step": 61
},
{
"clip_ratio": 0.0007626870938111097,
"epoch": 0.008465319497542327,
"grad_norm": 0.0758456438779831,
"kl": 0.009095820518268738,
"learning_rate": 4.936842105263158e-06,
"loss": -0.0001,
"step": 62
},
{
"clip_ratio": 0.0004581221583066508,
"epoch": 0.00860185690879301,
"grad_norm": 0.07229050993919373,
"kl": 0.009441651978704613,
"learning_rate": 4.9315789473684215e-06,
"loss": -0.0003,
"step": 63
},
{
"clip_ratio": 0.00047310019726864994,
"epoch": 0.008738394320043691,
"grad_norm": 0.07003813982009888,
"kl": 0.010120850245584734,
"learning_rate": 4.926315789473685e-06,
"loss": -0.0007,
"step": 64
},
{
"clip_ratio": 0.0,
"completion_length": 121.375,
"epoch": 0.008874931731294375,
"grad_norm": 0.03567022085189819,
"kl": 0.011777133724535815,
"learning_rate": 4.921052631578948e-06,
"loss": 0.0001,
"num_tokens": 200529.0,
"reward": 0.6343749761581421,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.6343749761581421,
"step": 65
},
{
"clip_ratio": 0.0,
"epoch": 0.009011469142545057,
"grad_norm": 0.03496097773313522,
"kl": 0.012535931979073212,
"learning_rate": 4.915789473684211e-06,
"loss": 0.0,
"step": 66
},
{
"clip_ratio": 0.0,
"epoch": 0.00914800655379574,
"grad_norm": 0.03556264564394951,
"kl": 0.012659623011131771,
"learning_rate": 4.910526315789474e-06,
"loss": -0.0,
"step": 67
},
{
"clip_ratio": 0.0,
"epoch": 0.009284543965046422,
"grad_norm": 0.03532101958990097,
"kl": 0.013175853382563218,
"learning_rate": 4.905263157894737e-06,
"loss": -0.0,
"step": 68
},
{
"clip_ratio": 0.0006605616363231093,
"completion_length": 124.90625,
"epoch": 0.009421081376297106,
"grad_norm": 0.05857838690280914,
"kl": 0.012000912392977625,
"learning_rate": 4.9000000000000005e-06,
"loss": 0.0003,
"num_tokens": 211414.0,
"reward": 0.8875000476837158,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.8875000476837158,
"step": 69
},
{
"clip_ratio": 0.0002765486715361476,
"epoch": 0.009557618787547788,
"grad_norm": 0.060380011796951294,
"kl": 0.012359667627606541,
"learning_rate": 4.894736842105264e-06,
"loss": 0.0001,
"step": 70
},
{
"clip_ratio": 0.0006605616363231093,
"epoch": 0.009694156198798471,
"grad_norm": 0.05945640802383423,
"kl": 0.012303199764573947,
"learning_rate": 4.889473684210527e-06,
"loss": -0.0,
"step": 71
},
{
"clip_ratio": 0.0006619231717195362,
"epoch": 0.009830693610049153,
"grad_norm": 0.052826281636953354,
"kl": 0.012528339851996861,
"learning_rate": 4.88421052631579e-06,
"loss": -0.0004,
"step": 72
},
{
"clip_ratio": 0.00036407963489182293,
"completion_length": 142.125,
"epoch": 0.009967231021299837,
"grad_norm": 0.08659490197896957,
"kl": 0.010383772038039751,
"learning_rate": 4.878947368421053e-06,
"loss": 0.0001,
"num_tokens": 223626.0,
"reward": 0.6031250357627869,
"reward_std": 0.23124998807907104,
"rewards/reward_fn": 0.6031250357627869,
"step": 73
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.010103768432550519,
"grad_norm": 0.08382167667150497,
"kl": 0.010327450014301576,
"learning_rate": 4.873684210526316e-06,
"loss": -0.0002,
"step": 74
},
{
"clip_ratio": 0.0,
"epoch": 0.0102403058438012,
"grad_norm": 0.0809021145105362,
"kl": 0.010177173695410602,
"learning_rate": 4.8684210526315795e-06,
"loss": -0.0006,
"step": 75
},
{
"clip_ratio": 0.0005547723558265716,
"epoch": 0.010376843255051884,
"grad_norm": 0.07807288318872452,
"kl": 0.010375534344348125,
"learning_rate": 4.863157894736843e-06,
"loss": -0.0011,
"step": 76
},
{
"clip_ratio": 0.0,
"completion_length": 130.15625,
"epoch": 0.010513380666302566,
"grad_norm": 0.09454550594091415,
"kl": 0.01368577299581375,
"learning_rate": 4.857894736842106e-06,
"loss": 0.0002,
"num_tokens": 235095.0,
"reward": 0.6343749761581421,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.6343749761581421,
"step": 77
},
{
"clip_ratio": 0.0,
"epoch": 0.01064991807755325,
"grad_norm": 0.09300191700458527,
"kl": 0.013703606295166537,
"learning_rate": 4.852631578947369e-06,
"loss": -0.0002,
"step": 78
},
{
"clip_ratio": 0.0,
"epoch": 0.010786455488803932,
"grad_norm": 0.08737168461084366,
"kl": 0.01426290805102326,
"learning_rate": 4.847368421052631e-06,
"loss": -0.0006,
"step": 79
},
{
"clip_ratio": 0.00027173911803402007,
"epoch": 0.010922992900054615,
"grad_norm": 0.0839756429195404,
"kl": 0.014389160307473503,
"learning_rate": 4.842105263157895e-06,
"loss": -0.0011,
"step": 80
},
{
"clip_ratio": 0.00023148147738538682,
"completion_length": 115.40625,
"epoch": 0.011059530311305297,
"grad_norm": 0.0841306746006012,
"kl": 0.019477701251162216,
"learning_rate": 4.8368421052631585e-06,
"loss": 0.0003,
"num_tokens": 245552.0,
"reward": 0.71875,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.71875,
"step": 81
},
{
"clip_ratio": 0.00021551724057644606,
"epoch": 0.01119606772255598,
"grad_norm": 0.08322307467460632,
"kl": 0.019782173665589653,
"learning_rate": 4.831578947368422e-06,
"loss": -0.0001,
"step": 82
},
{
"clip_ratio": 0.00021551724057644606,
"epoch": 0.011332605133806663,
"grad_norm": 0.08051823079586029,
"kl": 0.019718343231943436,
"learning_rate": 4.826315789473685e-06,
"loss": -0.0006,
"step": 83
},
{
"clip_ratio": 0.0007434187136823311,
"epoch": 0.011469142545057346,
"grad_norm": 0.07694952934980392,
"kl": 0.01945641718339175,
"learning_rate": 4.821052631578948e-06,
"loss": -0.0009,
"step": 84
},
{
"clip_ratio": 0.000730298925191164,
"completion_length": 113.375,
"epoch": 0.011605679956308028,
"grad_norm": 0.0934474989771843,
"kl": 0.01406104041961953,
"learning_rate": 4.815789473684211e-06,
"loss": 0.0001,
"num_tokens": 256096.0,
"reward": 0.7468750476837158,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.7468750476837158,
"step": 85
},
{
"clip_ratio": 0.0006386408931575716,
"epoch": 0.011742217367558712,
"grad_norm": 0.09243673086166382,
"kl": 0.013716014829697087,
"learning_rate": 4.8105263157894735e-06,
"loss": -0.0002,
"step": 86
},
{
"clip_ratio": 0.00016983695968519896,
"epoch": 0.011878754778809394,
"grad_norm": 0.08725881576538086,
"kl": 0.013890811271267012,
"learning_rate": 4.8052631578947375e-06,
"loss": -0.0007,
"step": 87
},
{
"clip_ratio": 0.00024801588733680546,
"epoch": 0.012015292190060076,
"grad_norm": 0.07987057417631149,
"kl": 0.013736142864217982,
"learning_rate": 4.800000000000001e-06,
"loss": -0.0012,
"step": 88
},
{
"clip_ratio": 0.0,
"completion_length": 116.03125,
"epoch": 0.01215182960131076,
"grad_norm": 0.035524703562259674,
"kl": 0.014395015765330754,
"learning_rate": 4.794736842105264e-06,
"loss": 0.0001,
"num_tokens": 267685.0,
"reward": 0.746874988079071,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.746874988079071,
"step": 89
},
{
"clip_ratio": 0.0,
"epoch": 0.012288367012561441,
"grad_norm": 0.03528278321027756,
"kl": 0.014380123306182213,
"learning_rate": 4.789473684210527e-06,
"loss": 0.0001,
"step": 90
},
{
"clip_ratio": 0.0,
"epoch": 0.012424904423812125,
"grad_norm": 0.03564177826046944,
"kl": 0.014681547458167188,
"learning_rate": 4.78421052631579e-06,
"loss": -0.0,
"step": 91
},
{
"clip_ratio": 0.0,
"epoch": 0.012561441835062807,
"grad_norm": 0.03350580483675003,
"kl": 0.01473659290059004,
"learning_rate": 4.778947368421053e-06,
"loss": -0.0001,
"step": 92
},
{
"clip_ratio": 0.0010092409647768363,
"completion_length": 116.34375,
"epoch": 0.01269797924631349,
"grad_norm": 0.11783453822135925,
"kl": 0.016927717690123245,
"learning_rate": 4.773684210526316e-06,
"loss": 0.0002,
"num_tokens": 278480.0,
"reward": 0.46562501788139343,
"reward_std": 0.36360570788383484,
"rewards/reward_fn": 0.46562501788139343,
"step": 93
},
{
"clip_ratio": 0.0005676986766047776,
"epoch": 0.012834516657564172,
"grad_norm": 0.1174498200416565,
"kl": 0.016682636385667138,
"learning_rate": 4.76842105263158e-06,
"loss": -0.0001,
"step": 94
},
{
"clip_ratio": 0.00021258502965793014,
"epoch": 0.012971054068814856,
"grad_norm": 0.1170513778924942,
"kl": 0.016236918556387536,
"learning_rate": 4.763157894736842e-06,
"loss": -0.001,
"step": 95
},
{
"clip_ratio": 0.0008842054230626673,
"epoch": 0.013107591480065538,
"grad_norm": 0.11030783504247665,
"kl": 0.016805329025373794,
"learning_rate": 4.757894736842106e-06,
"loss": -0.0018,
"step": 96
},
{
"clip_ratio": 0.0,
"completion_length": 117.34375,
"epoch": 0.013244128891316221,
"grad_norm": 0.05533390864729881,
"kl": 0.012452395327272825,
"learning_rate": 4.752631578947369e-06,
"loss": 0.0,
"num_tokens": 289523.0,
"reward": 0.859375,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.859375,
"step": 97
},
{
"clip_ratio": 0.00028935185400769114,
"epoch": 0.013380666302566903,
"grad_norm": 0.05383645370602608,
"kl": 0.012898564287752379,
"learning_rate": 4.747368421052632e-06,
"loss": -0.0,
"step": 98
},
{
"clip_ratio": 0.0,
"epoch": 0.013517203713817587,
"grad_norm": 0.045518334954977036,
"kl": 0.012721069382678252,
"learning_rate": 4.7421052631578954e-06,
"loss": -0.0002,
"step": 99
},
{
"clip_ratio": 0.0,
"epoch": 0.013653741125068269,
"grad_norm": 0.043640851974487305,
"kl": 0.013114535111526493,
"learning_rate": 4.736842105263158e-06,
"loss": -0.0004,
"step": 100
},
{
"clip_ratio": 0.0003751235635718331,
"completion_length": 133.21875,
"epoch": 0.01379027853631895,
"grad_norm": 0.08343350887298584,
"kl": 0.011969710292760283,
"learning_rate": 4.731578947368422e-06,
"loss": 0.0003,
"num_tokens": 301274.0,
"reward": 0.690625011920929,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.690625011920929,
"step": 101
},
{
"clip_ratio": 0.0003751235635718331,
"epoch": 0.013926815947569634,
"grad_norm": 0.08278653025627136,
"kl": 0.011722918432496954,
"learning_rate": 4.726315789473684e-06,
"loss": -0.0001,
"step": 102
},
{
"clip_ratio": 0.0,
"epoch": 0.014063353358820316,
"grad_norm": 0.08366868644952774,
"kl": 0.011790596836362965,
"learning_rate": 4.721052631578948e-06,
"loss": -0.0006,
"step": 103
},
{
"clip_ratio": 0.00020161290012765676,
"epoch": 0.014199890770071,
"grad_norm": 0.07245514541864395,
"kl": 0.011914224931388162,
"learning_rate": 4.71578947368421e-06,
"loss": -0.001,
"step": 104
},
{
"clip_ratio": 0.0,
"completion_length": 105.34375,
"epoch": 0.014336428181321682,
"grad_norm": 0.06334606558084488,
"kl": 0.014175733827869408,
"learning_rate": 4.710526315789474e-06,
"loss": 0.0002,
"num_tokens": 312005.0,
"reward": 0.9156249761581421,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.9156249761581421,
"step": 105
},
{
"clip_ratio": 0.00028153153834864497,
"epoch": 0.014472965592572365,
"grad_norm": 0.06191639602184296,
"kl": 0.014437062345677987,
"learning_rate": 4.705263157894738e-06,
"loss": 0.0,
"step": 106
},
{
"clip_ratio": 0.0,
"epoch": 0.014609503003823047,
"grad_norm": 0.06282703578472137,
"kl": 0.014868097176076844,
"learning_rate": 4.7e-06,
"loss": -0.0002,
"step": 107
},
{
"clip_ratio": 0.0,
"epoch": 0.01474604041507373,
"grad_norm": 0.06213715299963951,
"kl": 0.015245917427819222,
"learning_rate": 4.694736842105264e-06,
"loss": -0.0006,
"step": 108
},
{
"clip_ratio": 0.00048828125,
"completion_length": 114.46875,
"epoch": 0.014882577826324413,
"grad_norm": 0.06244153529405594,
"kl": 0.014229173626517877,
"learning_rate": 4.689473684210526e-06,
"loss": 0.0002,
"num_tokens": 323008.0,
"reward": 0.856249988079071,
"reward_std": 0.12358209490776062,
"rewards/reward_fn": 0.856249988079071,
"step": 109
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.015019115237575096,
"grad_norm": 0.06384127587080002,
"kl": 0.014452488074311987,
"learning_rate": 4.68421052631579e-06,
"loss": -0.0001,
"step": 110
},
{
"clip_ratio": 0.000732421875,
"epoch": 0.015155652648825778,
"grad_norm": 0.05795735865831375,
"kl": 0.014755003750906326,
"learning_rate": 4.6789473684210525e-06,
"loss": -0.0003,
"step": 111
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.015292190060076462,
"grad_norm": 0.06043582037091255,
"kl": 0.014582981850253418,
"learning_rate": 4.6736842105263166e-06,
"loss": -0.0004,
"step": 112
},
{
"clip_ratio": 0.0005965908931102604,
"completion_length": 109.96875,
"epoch": 0.015428727471327144,
"grad_norm": 0.06778660416603088,
"kl": 0.015787007549079135,
"learning_rate": 4.668421052631579e-06,
"loss": 0.0003,
"num_tokens": 333667.0,
"reward": 0.71875,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.71875,
"step": 113
},
{
"clip_ratio": 0.0,
"epoch": 0.015565264882577826,
"grad_norm": 0.07079855352640152,
"kl": 0.015863822191022336,
"learning_rate": 4.663157894736842e-06,
"loss": -0.0,
"step": 114
},
{
"clip_ratio": 0.0005342270596884191,
"epoch": 0.015701802293828507,
"grad_norm": 0.07030012458562851,
"kl": 0.015859683539019898,
"learning_rate": 4.657894736842106e-06,
"loss": -0.0003,
"step": 115
},
{
"clip_ratio": 0.00032552084303461015,
"epoch": 0.015838339705079193,
"grad_norm": 0.05977308005094528,
"kl": 0.015181809227215126,
"learning_rate": 4.652631578947368e-06,
"loss": -0.0007,
"step": 116
},
{
"clip_ratio": 0.000294811325147748,
"completion_length": 102.75,
"epoch": 0.015974877116329875,
"grad_norm": 0.09741310030221939,
"kl": 0.016162807471118867,
"learning_rate": 4.647368421052632e-06,
"loss": 0.0004,
"num_tokens": 343995.0,
"reward": 0.5218750238418579,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.5218750238418579,
"step": 117
},
{
"clip_ratio": 0.00020973154460079968,
"epoch": 0.016111414527580557,
"grad_norm": 0.09549403935670853,
"kl": 0.015964071644702926,
"learning_rate": 4.642105263157895e-06,
"loss": 0.0001,
"step": 118
},
{
"clip_ratio": 0.0010666992020560429,
"epoch": 0.01624795193883124,
"grad_norm": 0.09260634332895279,
"kl": 0.016316924724378623,
"learning_rate": 4.636842105263159e-06,
"loss": -0.0007,
"step": 119
},
{
"clip_ratio": 0.0005621563323074952,
"epoch": 0.016384489350081924,
"grad_norm": 0.07998410612344742,
"kl": 0.016282340366160497,
"learning_rate": 4.631578947368421e-06,
"loss": -0.0016,
"step": 120
},
{
"clip_ratio": 0.0005777268670499325,
"completion_length": 105.71875,
"epoch": 0.016521026761332606,
"grad_norm": 0.11327945441007614,
"kl": 0.014576794725144282,
"learning_rate": 4.626315789473684e-06,
"loss": -0.0,
"num_tokens": 354366.0,
"reward": 0.6625000238418579,
"reward_std": 0.289951890707016,
"rewards/reward_fn": 0.6625000238418579,
"step": 121
},
{
"clip_ratio": 0.0010138368816114962,
"epoch": 0.016657564172583288,
"grad_norm": 0.11017230898141861,
"kl": 0.015154679873376153,
"learning_rate": 4.621052631578948e-06,
"loss": -0.0003,
"step": 122
},
{
"clip_ratio": 0.0029109671886544675,
"epoch": 0.01679410158383397,
"grad_norm": 0.09320779144763947,
"kl": 0.01626152906101197,
"learning_rate": 4.6157894736842105e-06,
"loss": -0.001,
"step": 123
},
{
"clip_ratio": 0.003067635203478858,
"epoch": 0.016930638995084655,
"grad_norm": 0.08714654296636581,
"kl": 0.01717385504161939,
"learning_rate": 4.6105263157894745e-06,
"loss": -0.0019,
"step": 124
},
{
"clip_ratio": 0.0,
"completion_length": 104.625,
"epoch": 0.017067176406335337,
"grad_norm": 0.06164494529366493,
"kl": 0.022742171786376275,
"learning_rate": 4.605263157894737e-06,
"loss": 0.0001,
"num_tokens": 365118.0,
"reward": 0.4937500059604645,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.4937500059604645,
"step": 125
},
{
"clip_ratio": 0.0,
"epoch": 0.01720371381758602,
"grad_norm": 0.05765366554260254,
"kl": 0.023318831241340376,
"learning_rate": 4.600000000000001e-06,
"loss": 0.0001,
"step": 126
},
{
"clip_ratio": 0.0,
"epoch": 0.0173402512288367,
"grad_norm": 0.057430919259786606,
"kl": 0.024255198208265938,
"learning_rate": 4.594736842105263e-06,
"loss": -0.0001,
"step": 127
},
{
"clip_ratio": 0.0,
"epoch": 0.017476788640087382,
"grad_norm": 0.0521625392138958,
"kl": 0.024568809458287433,
"learning_rate": 4.589473684210526e-06,
"loss": -0.0003,
"step": 128
},
{
"clip_ratio": 0.0,
"completion_length": 97.4375,
"epoch": 0.017613326051338068,
"grad_norm": 0.06752870976924896,
"kl": 0.02813084190711379,
"learning_rate": 4.5842105263157895e-06,
"loss": 0.0003,
"num_tokens": 375444.0,
"reward": 0.6062500476837158,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.6062500476837158,
"step": 129
},
{
"clip_ratio": 0.0,
"epoch": 0.01774986346258875,
"grad_norm": 0.06426940858364105,
"kl": 0.02811072752228938,
"learning_rate": 4.578947368421053e-06,
"loss": -0.0001,
"step": 130
},
{
"clip_ratio": 0.0,
"epoch": 0.01788640087383943,
"grad_norm": 0.052824705839157104,
"kl": 0.02794748015003279,
"learning_rate": 4.573684210526317e-06,
"loss": -0.0003,
"step": 131
},
{
"clip_ratio": 0.0005663055635523051,
"epoch": 0.018022938285090113,
"grad_norm": 0.05740916728973389,
"kl": 0.027399677026551217,
"learning_rate": 4.568421052631579e-06,
"loss": -0.0006,
"step": 132
},
{
"clip_ratio": 0.0,
"completion_length": 95.0625,
"epoch": 0.0181594756963408,
"grad_norm": 0.08138228207826614,
"kl": 0.021528464392758906,
"learning_rate": 4.563157894736843e-06,
"loss": 0.0004,
"num_tokens": 385342.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 133
},
{
"clip_ratio": 0.0,
"epoch": 0.01829601310759148,
"grad_norm": 0.07547755539417267,
"kl": 0.021013552715885453,
"learning_rate": 4.557894736842105e-06,
"loss": 0.0001,
"step": 134
},
{
"clip_ratio": 0.0004340277810115367,
"epoch": 0.018432550518842163,
"grad_norm": 0.06484001874923706,
"kl": 0.020921625837218016,
"learning_rate": 4.552631578947369e-06,
"loss": -0.0003,
"step": 135
},
{
"clip_ratio": 0.0004340277810115367,
"epoch": 0.018569087930092845,
"grad_norm": 0.051754601299762726,
"kl": 0.021819816451170482,
"learning_rate": 4.547368421052632e-06,
"loss": -0.0008,
"step": 136
},
{
"clip_ratio": 0.0,
"completion_length": 102.28125,
"epoch": 0.01870562534134353,
"grad_norm": 0.04303466156125069,
"kl": 0.02289676680811681,
"learning_rate": 4.542105263157895e-06,
"loss": 0.0002,
"num_tokens": 396003.0,
"reward": 0.971875011920929,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.971875011920929,
"step": 137
},
{
"clip_ratio": 0.0,
"epoch": 0.018842162752594212,
"grad_norm": 0.04287838935852051,
"kl": 0.02256237791152671,
"learning_rate": 4.536842105263158e-06,
"loss": 0.0001,
"step": 138
},
{
"clip_ratio": 0.0,
"epoch": 0.018978700163844894,
"grad_norm": 0.04330320656299591,
"kl": 0.022393779450794682,
"learning_rate": 4.531578947368421e-06,
"loss": 0.0001,
"step": 139
},
{
"clip_ratio": 0.0,
"epoch": 0.019115237575095576,
"grad_norm": 0.039670608937740326,
"kl": 0.022108391451183707,
"learning_rate": 4.526315789473685e-06,
"loss": -0.0002,
"step": 140
},
{
"clip_ratio": 0.0011110177874797955,
"completion_length": 124.75,
"epoch": 0.019251774986346257,
"grad_norm": 0.08559431880712509,
"kl": 0.02040508067875635,
"learning_rate": 4.5210526315789475e-06,
"loss": 0.0004,
"num_tokens": 407619.0,
"reward": 0.690625011920929,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.690625011920929,
"step": 141
},
{
"clip_ratio": 0.0009295805648434907,
"epoch": 0.019388312397596943,
"grad_norm": 0.08730953186750412,
"kl": 0.0202211801224621,
"learning_rate": 4.5157894736842115e-06,
"loss": 0.0001,
"step": 142
},
{
"clip_ratio": 0.0001990445889532566,
"epoch": 0.019524849808847625,
"grad_norm": 0.08218631148338318,
"kl": 0.020368822690215893,
"learning_rate": 4.510526315789474e-06,
"loss": -0.0005,
"step": 143
},
{
"clip_ratio": 0.0001990445889532566,
"epoch": 0.019661387220098307,
"grad_norm": 0.07692748308181763,
"kl": 0.02033531089546159,
"learning_rate": 4.505263157894737e-06,
"loss": -0.0011,
"step": 144
},
{
"clip_ratio": 0.00027173911803402007,
"completion_length": 93.125,
"epoch": 0.01979792463134899,
"grad_norm": 0.06828766316175461,
"kl": 0.026619675249094144,
"learning_rate": 4.5e-06,
"loss": 0.0003,
"num_tokens": 417195.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 145
},
{
"clip_ratio": 0.0,
"epoch": 0.019934462042599674,
"grad_norm": 0.07163087278604507,
"kl": 0.027274078922346234,
"learning_rate": 4.494736842105263e-06,
"loss": 0.0001,
"step": 146
},
{
"clip_ratio": 0.0,
"epoch": 0.020070999453850356,
"grad_norm": 0.0677010715007782,
"kl": 0.02618727515800856,
"learning_rate": 4.489473684210527e-06,
"loss": -0.0003,
"step": 147
},
{
"clip_ratio": 0.0005972599610686302,
"epoch": 0.020207536865101038,
"grad_norm": 0.05918688699603081,
"kl": 0.0264243567653466,
"learning_rate": 4.48421052631579e-06,
"loss": -0.0005,
"step": 148
},
{
"clip_ratio": 0.00023854961909819394,
"completion_length": 114.15625,
"epoch": 0.02034407427635172,
"grad_norm": 0.10522865504026413,
"kl": 0.025243330223020166,
"learning_rate": 4.478947368421054e-06,
"loss": 0.0004,
"num_tokens": 427584.0,
"reward": 0.6343750357627869,
"reward_std": 0.29865381121635437,
"rewards/reward_fn": 0.6343750357627869,
"step": 149
},
{
"clip_ratio": 0.00023854961909819394,
"epoch": 0.0204806116876024,
"grad_norm": 0.10407311469316483,
"kl": 0.02505102547002025,
"learning_rate": 4.473684210526316e-06,
"loss": -0.0003,
"step": 150
},
{
"clip_ratio": 0.0009035185066750273,
"epoch": 0.020617149098853087,
"grad_norm": 0.10190074890851974,
"kl": 0.025200023461366072,
"learning_rate": 4.468421052631579e-06,
"loss": -0.001,
"step": 151
},
{
"clip_ratio": 0.0014054116763873026,
"epoch": 0.02075368651010377,
"grad_norm": 0.0961143970489502,
"kl": 0.025511470768833533,
"learning_rate": 4.463157894736842e-06,
"loss": -0.0019,
"step": 152
},
{
"clip_ratio": 0.0,
"completion_length": 107.71875,
"epoch": 0.02089022392135445,
"grad_norm": 0.059831857681274414,
"kl": 0.023090639937436208,
"learning_rate": 4.4578947368421054e-06,
"loss": 0.0003,
"num_tokens": 438211.0,
"reward": 0.3812500238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.3812500238418579,
"step": 153
},
{
"clip_ratio": 0.0,
"epoch": 0.021026761332605132,
"grad_norm": 0.059171441942453384,
"kl": 0.02331032755319029,
"learning_rate": 4.452631578947369e-06,
"loss": 0.0001,
"step": 154
},
{
"clip_ratio": 0.0006432863010559231,
"epoch": 0.021163298743855818,
"grad_norm": 0.05819160118699074,
"kl": 0.023676532495301217,
"learning_rate": 4.447368421052632e-06,
"loss": -0.0,
"step": 155
},
{
"clip_ratio": 0.0005681818001903594,
"epoch": 0.0212998361551065,
"grad_norm": 0.05214538797736168,
"kl": 0.02407641662284732,
"learning_rate": 4.442105263157896e-06,
"loss": -0.0004,
"step": 156
},
{
"clip_ratio": 0.0,
"completion_length": 111.25,
"epoch": 0.02143637356635718,
"grad_norm": 0.06498148292303085,
"kl": 0.028692521911580116,
"learning_rate": 4.436842105263158e-06,
"loss": 0.0002,
"num_tokens": 448495.0,
"reward": 0.71875,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.71875,
"step": 157
},
{
"clip_ratio": 0.0,
"epoch": 0.021572910977607863,
"grad_norm": 0.06544307619333267,
"kl": 0.029219213291071355,
"learning_rate": 4.431578947368421e-06,
"loss": 0.0003,
"step": 158
},
{
"clip_ratio": 0.0,
"epoch": 0.02170944838885855,
"grad_norm": 0.06307835131883621,
"kl": 0.0294132886629086,
"learning_rate": 4.426315789473684e-06,
"loss": -0.0002,
"step": 159
},
{
"clip_ratio": 0.0,
"epoch": 0.02184598580010923,
"grad_norm": 0.06254979223012924,
"kl": 0.03018665249692276,
"learning_rate": 4.4210526315789476e-06,
"loss": -0.0003,
"step": 160
},
{
"clip_ratio": 0.0,
"completion_length": 122.75,
"epoch": 0.021982523211359913,
"grad_norm": 0.09002089500427246,
"kl": 0.025298897293396294,
"learning_rate": 4.415789473684211e-06,
"loss": 0.0001,
"num_tokens": 459767.0,
"reward": 0.8031250238418579,
"reward_std": 0.2337018847465515,
"rewards/reward_fn": 0.8031250238418579,
"step": 161
},
{
"clip_ratio": 0.0,
"epoch": 0.022119060622610594,
"grad_norm": 0.0899246335029602,
"kl": 0.025724691950017586,
"learning_rate": 4.410526315789474e-06,
"loss": -0.0,
"step": 162
},
{
"clip_ratio": 0.0,
"epoch": 0.022255598033861276,
"grad_norm": 0.08925420790910721,
"kl": 0.02707095700316131,
"learning_rate": 4.405263157894737e-06,
"loss": -0.0007,
"step": 163
},
{
"clip_ratio": 0.00017361111531499773,
"epoch": 0.02239213544511196,
"grad_norm": 0.0802987664937973,
"kl": 0.027386941597796977,
"learning_rate": 4.4e-06,
"loss": -0.0015,
"step": 164
},
{
"clip_ratio": 0.0005446214054245502,
"completion_length": 112.78125,
"epoch": 0.022528672856362644,
"grad_norm": 0.07420904189348221,
"kl": 0.028630498243728653,
"learning_rate": 4.394736842105263e-06,
"loss": 0.0003,
"num_tokens": 470856.0,
"reward": 0.859375,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.859375,
"step": 165
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.022665210267613325,
"grad_norm": 0.07424714416265488,
"kl": 0.02978915546555072,
"learning_rate": 4.3894736842105266e-06,
"loss": 0.0001,
"step": 166
},
{
"clip_ratio": 0.0005446214054245502,
"epoch": 0.022801747678864007,
"grad_norm": 0.0685018002986908,
"kl": 0.03043460487970151,
"learning_rate": 4.38421052631579e-06,
"loss": -0.0003,
"step": 167
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.022938285090114693,
"grad_norm": 0.06347281485795975,
"kl": 0.03080894984304905,
"learning_rate": 4.378947368421053e-06,
"loss": -0.0009,
"step": 168
},
{
"clip_ratio": 0.0003324467979837209,
"completion_length": 115.125,
"epoch": 0.023074822501365375,
"grad_norm": 0.09582728147506714,
"kl": 0.029706816072575748,
"learning_rate": 4.373684210526316e-06,
"loss": 0.0005,
"num_tokens": 481480.0,
"reward": 0.4937500059604645,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.4937500059604645,
"step": 169
},
{
"clip_ratio": 0.0,
"epoch": 0.023211359912616056,
"grad_norm": 0.08268621563911438,
"kl": 0.029470782610587776,
"learning_rate": 4.368421052631579e-06,
"loss": -0.0,
"step": 170
},
{
"clip_ratio": 0.00023854961909819394,
"epoch": 0.02334789732386674,
"grad_norm": 0.07390839606523514,
"kl": 0.029934398946352303,
"learning_rate": 4.363157894736842e-06,
"loss": -0.0005,
"step": 171
},
{
"clip_ratio": 0.0,
"epoch": 0.023484434735117424,
"grad_norm": 0.07234860211610794,
"kl": 0.02987176994793117,
"learning_rate": 4.3578947368421055e-06,
"loss": -0.0009,
"step": 172
},
{
"clip_ratio": 0.0,
"completion_length": 116.84375,
"epoch": 0.023620972146368106,
"grad_norm": 0.07804840058088303,
"kl": 0.030131216015433893,
"learning_rate": 4.352631578947369e-06,
"loss": 0.0002,
"num_tokens": 491971.0,
"reward": 0.887499988079071,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.887499988079071,
"step": 173
},
{
"clip_ratio": 0.0005341880605556071,
"epoch": 0.023757509557618788,
"grad_norm": 0.07273226976394653,
"kl": 0.030887642147717997,
"learning_rate": 4.347368421052632e-06,
"loss": 0.0,
"step": 174
},
{
"clip_ratio": 0.0,
"epoch": 0.02389404696886947,
"grad_norm": 0.06586578488349915,
"kl": 0.031295952590880916,
"learning_rate": 4.342105263157895e-06,
"loss": -0.0005,
"step": 175
},
{
"clip_ratio": 0.0008401820377912372,
"epoch": 0.02403058438012015,
"grad_norm": 0.059170957654714584,
"kl": 0.03198954090476036,
"learning_rate": 4.336842105263158e-06,
"loss": -0.001,
"step": 176
},
{
"clip_ratio": 0.0,
"completion_length": 106.65625,
"epoch": 0.024167121791370837,
"grad_norm": 0.08889607340097427,
"kl": 0.04427822964498773,
"learning_rate": 4.331578947368421e-06,
"loss": 0.0006,
"num_tokens": 502488.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 177
},
{
"clip_ratio": 0.0,
"epoch": 0.02430365920262152,
"grad_norm": 0.07279235869646072,
"kl": 0.0449052246985957,
"learning_rate": 4.3263157894736845e-06,
"loss": 0.0001,
"step": 178
},
{
"clip_ratio": 0.0,
"epoch": 0.0244401966138722,
"grad_norm": 0.072224460542202,
"kl": 0.04581551585579291,
"learning_rate": 4.321052631578948e-06,
"loss": -0.0002,
"step": 179
},
{
"clip_ratio": 0.00018825300503522158,
"epoch": 0.024576734025122882,
"grad_norm": 0.06858509033918381,
"kl": 0.04448665684321895,
"learning_rate": 4.315789473684211e-06,
"loss": -0.0008,
"step": 180
},
{
"clip_ratio": 0.00035919540096074343,
"completion_length": 99.4375,
"epoch": 0.024713271436373568,
"grad_norm": 0.06964289397001266,
"kl": 0.03402404289226979,
"learning_rate": 4.310526315789474e-06,
"loss": 0.0004,
"num_tokens": 513246.0,
"reward": 0.746874988079071,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.746874988079071,
"step": 181
},
{
"clip_ratio": 0.0,
"epoch": 0.02484980884762425,
"grad_norm": 0.06922803074121475,
"kl": 0.03361908288206905,
"learning_rate": 4.305263157894737e-06,
"loss": 0.0003,
"step": 182
},
{
"clip_ratio": 0.0,
"epoch": 0.02498634625887493,
"grad_norm": 0.0668816789984703,
"kl": 0.033550983702298254,
"learning_rate": 4.3e-06,
"loss": -0.0,
"step": 183
},
{
"clip_ratio": 0.0003511235991027206,
"epoch": 0.025122883670125613,
"grad_norm": 0.05455351620912552,
"kl": 0.03327295114286244,
"learning_rate": 4.2947368421052635e-06,
"loss": -0.0005,
"step": 184
},
{
"clip_ratio": 0.0,
"completion_length": 106.65625,
"epoch": 0.0252594210813763,
"grad_norm": 0.11938021332025528,
"kl": 0.044678817328531295,
"learning_rate": 4.289473684210527e-06,
"loss": 0.0005,
"num_tokens": 524007.0,
"reward": 0.5218750238418579,
"reward_std": 0.2511056959629059,
"rewards/reward_fn": 0.5218750238418579,
"step": 185
},
{
"clip_ratio": 0.00034722223062999547,
"epoch": 0.02539595849262698,
"grad_norm": 0.11370915919542313,
"kl": 0.04234666272532195,
"learning_rate": 4.28421052631579e-06,
"loss": -0.0003,
"step": 186
},
{
"clip_ratio": 0.000662878795992583,
"epoch": 0.025532495903877662,
"grad_norm": 0.10087863355875015,
"kl": 0.04062945069745183,
"learning_rate": 4.278947368421053e-06,
"loss": -0.001,
"step": 187
},
{
"clip_ratio": 0.0005541758728213608,
"epoch": 0.025669033315128344,
"grad_norm": 0.09143723547458649,
"kl": 0.0406409723800607,
"learning_rate": 4.273684210526316e-06,
"loss": -0.0017,
"step": 188
},
{
"clip_ratio": 0.0005189153016544878,
"completion_length": 103.1875,
"epoch": 0.025805570726379026,
"grad_norm": 0.11307642608880997,
"kl": 0.03528324858052656,
"learning_rate": 4.268421052631579e-06,
"loss": 0.0005,
"num_tokens": 533865.0,
"reward": 0.7750000357627869,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.7750000357627869,
"step": 189
},
{
"clip_ratio": 0.0003124999930150807,
"epoch": 0.02594210813762971,
"grad_norm": 0.1095878928899765,
"kl": 0.03600154822925106,
"learning_rate": 4.2631578947368425e-06,
"loss": -0.0002,
"step": 190
},
{
"clip_ratio": 0.0006060116575099528,
"epoch": 0.026078645548880394,
"grad_norm": 0.0969381183385849,
"kl": 0.035806038504233584,
"learning_rate": 4.257894736842106e-06,
"loss": -0.0011,
"step": 191
},
{
"clip_ratio": 0.0005024050769861788,
"epoch": 0.026215182960131075,
"grad_norm": 0.08637399971485138,
"kl": 0.03535072586964816,
"learning_rate": 4.252631578947369e-06,
"loss": -0.0018,
"step": 192
},
{
"completion_length": 106.0,
"epoch": 0.026351720371381757,
"grad_norm": 0.0,
"learning_rate": 4.247368421052632e-06,
"loss": 0.0,
"num_tokens": 543893.0,
"reward": 0.7749999761581421,
"reward_std": 0.0,
"rewards/reward_fn": 0.7749999761581421,
"step": 193
},
{
"epoch": 0.026488257782632443,
"grad_norm": 0.0,
"learning_rate": 4.242105263157895e-06,
"loss": 0.0,
"step": 194
},
{
"epoch": 0.026624795193883125,
"grad_norm": 0.0,
"learning_rate": 4.236842105263158e-06,
"loss": 0.0,
"step": 195
},
{
"epoch": 0.026761332605133806,
"grad_norm": 0.0,
"learning_rate": 4.2315789473684215e-06,
"loss": 0.0,
"step": 196
},
{
"clip_ratio": 0.0,
"completion_length": 104.1875,
"epoch": 0.02689787001638449,
"grad_norm": 0.10188470780849457,
"kl": 0.03902641427703202,
"learning_rate": 4.226315789473685e-06,
"loss": 0.0002,
"num_tokens": 554083.0,
"reward": 0.859375,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.859375,
"step": 197
},
{
"clip_ratio": 0.00021404109429568052,
"epoch": 0.027034407427635174,
"grad_norm": 0.09636596590280533,
"kl": 0.03859919391106814,
"learning_rate": 4.221052631578948e-06,
"loss": 0.0,
"step": 198
},
{
"clip_ratio": 0.00045628915540874004,
"epoch": 0.027170944838885856,
"grad_norm": 0.07624981552362442,
"kl": 0.03810006860294379,
"learning_rate": 4.215789473684211e-06,
"loss": -0.0007,
"step": 199
},
{
"clip_ratio": 0.0005362060328479856,
"epoch": 0.027307482250136537,
"grad_norm": 0.07269936800003052,
"kl": 0.038183362572453916,
"learning_rate": 4.210526315789474e-06,
"loss": -0.0012,
"step": 200
},
{
"clip_ratio": 0.0004032258002553135,
"completion_length": 105.375,
"epoch": 0.02744401966138722,
"grad_norm": 0.06504663079977036,
"kl": 0.03330190840642899,
"learning_rate": 4.205263157894737e-06,
"loss": 0.0003,
"num_tokens": 564759.0,
"reward": 0.6625000238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.6625000238418579,
"step": 201
},
{
"clip_ratio": 0.0004032258002553135,
"epoch": 0.0275805570726379,
"grad_norm": 0.0650041475892067,
"kl": 0.03405800275504589,
"learning_rate": 4.2000000000000004e-06,
"loss": 0.0001,
"step": 202
},
{
"clip_ratio": 0.0006048387149348855,
"epoch": 0.027717094483888587,
"grad_norm": 0.06338495761156082,
"kl": 0.03414264236926101,
"learning_rate": 4.194736842105264e-06,
"loss": -0.0002,
"step": 203
},
{
"clip_ratio": 0.0004032258002553135,
"epoch": 0.02785363189513927,
"grad_norm": 0.06049591302871704,
"kl": 0.03434641310013831,
"learning_rate": 4.189473684210527e-06,
"loss": -0.0007,
"step": 204
},
{
"clip_ratio": 0.0007811779651092365,
"completion_length": 117.34375,
"epoch": 0.02799016930638995,
"grad_norm": 0.09299098700284958,
"kl": 0.03305593744153157,
"learning_rate": 4.18421052631579e-06,
"loss": 0.0004,
"num_tokens": 575498.0,
"reward": 0.4937500059604645,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.4937500059604645,
"step": 205
},
{
"clip_ratio": 0.0003324467979837209,
"epoch": 0.028126706717640632,
"grad_norm": 0.09308190643787384,
"kl": 0.03269680918310769,
"learning_rate": 4.178947368421053e-06,
"loss": 0.0003,
"step": 206
},
{
"clip_ratio": 0.0,
"epoch": 0.028263244128891318,
"grad_norm": 0.08965054899454117,
"kl": 0.03241226324462332,
"learning_rate": 4.173684210526316e-06,
"loss": -0.0006,
"step": 207
},
{
"clip_ratio": 0.0,
"epoch": 0.028399781540142,
"grad_norm": 0.07739660888910294,
"kl": 0.03276632426423021,
"learning_rate": 4.1684210526315794e-06,
"loss": -0.0013,
"step": 208
},
{
"clip_ratio": 0.00019409938249737024,
"completion_length": 123.375,
"epoch": 0.02853631895139268,
"grad_norm": 0.06903862208127975,
"kl": 0.02725412551080808,
"learning_rate": 4.163157894736843e-06,
"loss": 0.0004,
"num_tokens": 587282.0,
"reward": 0.690625011920929,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.690625011920929,
"step": 209
},
{
"clip_ratio": 0.0,
"epoch": 0.028672856362643363,
"grad_norm": 0.06824494898319244,
"kl": 0.027433462004410103,
"learning_rate": 4.157894736842106e-06,
"loss": 0.0002,
"step": 210
},
{
"clip_ratio": 0.0004374573181848973,
"epoch": 0.02880939377389405,
"grad_norm": 0.06868710368871689,
"kl": 0.02734687612974085,
"learning_rate": 4.152631578947369e-06,
"loss": -0.0001,
"step": 211
},
{
"clip_ratio": 0.00023320894979406148,
"epoch": 0.02894593118514473,
"grad_norm": 0.0652066022157669,
"kl": 0.027320355700794607,
"learning_rate": 4.147368421052632e-06,
"loss": -0.0008,
"step": 212
},
{
"clip_ratio": 0.00042826301068998873,
"completion_length": 126.1875,
"epoch": 0.029082468596395412,
"grad_norm": 0.04128393158316612,
"kl": 0.027315025363350287,
"learning_rate": 4.142105263157895e-06,
"loss": 0.0003,
"num_tokens": 598840.0,
"reward": 0.71875,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.71875,
"step": 213
},
{
"clip_ratio": 0.0008565260213799775,
"epoch": 0.029219006007646094,
"grad_norm": 0.040705274790525436,
"kl": 0.02696406643372029,
"learning_rate": 4.136842105263158e-06,
"loss": 0.0003,
"step": 214
},
{
"clip_ratio": 0.0004370629321783781,
"epoch": 0.029355543418896776,
"grad_norm": 0.0406440831720829,
"kl": 0.02672984532546252,
"learning_rate": 4.1315789473684216e-06,
"loss": 0.0001,
"step": 215
},
{
"clip_ratio": 0.0006467944767791778,
"epoch": 0.02949208083014746,
"grad_norm": 0.039546553045511246,
"kl": 0.026357230555731803,
"learning_rate": 4.126315789473685e-06,
"loss": -0.0001,
"step": 216
},
{
"clip_ratio": 0.00021551724057644606,
"completion_length": 125.65625,
"epoch": 0.029628618241398143,
"grad_norm": 0.09606111794710159,
"kl": 0.027327494870405644,
"learning_rate": 4.121052631578948e-06,
"loss": 0.0001,
"num_tokens": 610221.0,
"reward": 0.6343749761581421,
"reward_std": 0.28125,
"rewards/reward_fn": 0.6343749761581421,
"step": 217
},
{
"clip_ratio": 0.0,
"epoch": 0.029765155652648825,
"grad_norm": 0.09475074708461761,
"kl": 0.026967918034642935,
"learning_rate": 4.115789473684211e-06,
"loss": -0.0003,
"step": 218
},
{
"clip_ratio": 0.00021551724057644606,
"epoch": 0.029901693063899507,
"grad_norm": 0.09437484294176102,
"kl": 0.02764826436759904,
"learning_rate": 4.110526315789474e-06,
"loss": -0.0009,
"step": 219
},
{
"clip_ratio": 0.00021551724057644606,
"epoch": 0.030038230475150193,
"grad_norm": 0.08844147622585297,
"kl": 0.02761025112704374,
"learning_rate": 4.105263157894737e-06,
"loss": -0.0017,
"step": 220
},
{
"clip_ratio": 0.0004921259824186563,
"completion_length": 117.5625,
"epoch": 0.030174767886400874,
"grad_norm": 0.08956988155841827,
"kl": 0.027353109326213598,
"learning_rate": 4.1e-06,
"loss": 0.0005,
"num_tokens": 621283.0,
"reward": 0.746874988079071,
"reward_std": 0.25110572576522827,
"rewards/reward_fn": 0.746874988079071,
"step": 221
},
{
"clip_ratio": 0.0,
"epoch": 0.030311305297651556,
"grad_norm": 0.09050950407981873,
"kl": 0.02785796401440166,
"learning_rate": 4.094736842105264e-06,
"loss": -0.0003,
"step": 222
},
{
"clip_ratio": 0.00039178448787424713,
"epoch": 0.030447842708902238,
"grad_norm": 0.08440433442592621,
"kl": 0.0283550031890627,
"learning_rate": 4.089473684210527e-06,
"loss": -0.0006,
"step": 223
},
{
"clip_ratio": 0.0,
"epoch": 0.030584380120152924,
"grad_norm": 0.078850157558918,
"kl": 0.029308805766049773,
"learning_rate": 4.08421052631579e-06,
"loss": -0.0015,
"step": 224
},
{
"clip_ratio": 0.000794308609329164,
"completion_length": 112.1875,
"epoch": 0.030720917531403606,
"grad_norm": 0.09105496853590012,
"kl": 0.02974900306435302,
"learning_rate": 4.078947368421053e-06,
"loss": 0.0002,
"num_tokens": 631645.0,
"reward": 0.746874988079071,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.746874988079071,
"step": 225
},
{
"clip_ratio": 0.0,
"epoch": 0.030857454942654287,
"grad_norm": 0.10003118962049484,
"kl": 0.029050659737549722,
"learning_rate": 4.073684210526316e-06,
"loss": -0.0,
"step": 226
},
{
"clip_ratio": 0.0,
"epoch": 0.03099399235390497,
"grad_norm": 0.08923932909965515,
"kl": 0.02833891040063463,
"learning_rate": 4.0684210526315795e-06,
"loss": -0.0006,
"step": 227
},
{
"clip_ratio": 0.0015976974100340158,
"epoch": 0.03113052976515565,
"grad_norm": 0.07948505878448486,
"kl": 0.02925992920063436,
"learning_rate": 4.063157894736842e-06,
"loss": -0.0015,
"step": 228
},
{
"clip_ratio": 0.0005824159306939691,
"completion_length": 112.875,
"epoch": 0.03126706717640634,
"grad_norm": 0.08888618648052216,
"kl": 0.026295807358110324,
"learning_rate": 4.057894736842106e-06,
"loss": 0.0004,
"num_tokens": 642929.0,
"reward": 0.578125,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.578125,
"step": 229
},
{
"clip_ratio": 0.001052564155543223,
"epoch": 0.031403604587657015,
"grad_norm": 0.08594765514135361,
"kl": 0.026338903553551063,
"learning_rate": 4.052631578947368e-06,
"loss": -0.0002,
"step": 230
},
{
"clip_ratio": 0.0005595455877482891,
"epoch": 0.0315401419989077,
"grad_norm": 0.08271999657154083,
"kl": 0.026568240544293076,
"learning_rate": 4.047368421052632e-06,
"loss": -0.0006,
"step": 231
},
{
"clip_ratio": 0.0005595455877482891,
"epoch": 0.031676679410158386,
"grad_norm": 0.07526501268148422,
"kl": 0.026544391934294254,
"learning_rate": 4.042105263157895e-06,
"loss": -0.0014,
"step": 232
},
{
"clip_ratio": 0.0007640966796316206,
"completion_length": 113.625,
"epoch": 0.031813216821409064,
"grad_norm": 0.0923089012503624,
"kl": 0.024078507034573704,
"learning_rate": 4.0368421052631585e-06,
"loss": 0.0003,
"num_tokens": 653789.0,
"reward": 0.6062500476837158,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.6062500476837158,
"step": 233
},
{
"clip_ratio": 0.0004877125611528754,
"epoch": 0.03194975423265975,
"grad_norm": 0.09331841766834259,
"kl": 0.024048013438005,
"learning_rate": 4.031578947368422e-06,
"loss": -0.0001,
"step": 234
},
{
"clip_ratio": 0.00019290123600512743,
"epoch": 0.032086291643910435,
"grad_norm": 0.08464116603136063,
"kl": 0.023768270009895787,
"learning_rate": 4.026315789473684e-06,
"loss": -0.0008,
"step": 235
},
{
"clip_ratio": 0.0004210034239804372,
"epoch": 0.03222282905516111,
"grad_norm": 0.07866553962230682,
"kl": 0.023468335362849757,
"learning_rate": 4.021052631578948e-06,
"loss": -0.0016,
"step": 236
},
{
"clip_ratio": 0.00018274853937327862,
"completion_length": 113.0,
"epoch": 0.0323593664664118,
"grad_norm": 0.06890566647052765,
"kl": 0.02587902924278751,
"learning_rate": 4.01578947368421e-06,
"loss": 0.0004,
"num_tokens": 664541.0,
"reward": 0.4375,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.4375,
"step": 237
},
{
"clip_ratio": 0.0003633720916695893,
"epoch": 0.03249590387766248,
"grad_norm": 0.06925798207521439,
"kl": 0.025461589102633297,
"learning_rate": 4.010526315789474e-06,
"loss": 0.0002,
"step": 238
},
{
"clip_ratio": 0.0,
"epoch": 0.03263244128891316,
"grad_norm": 0.06528756767511368,
"kl": 0.02574267768068239,
"learning_rate": 4.005263157894737e-06,
"loss": 0.0,
"step": 239
},
{
"clip_ratio": 0.00018274853937327862,
"epoch": 0.03276897870016385,
"grad_norm": 0.06375279277563095,
"kl": 0.025849525845842436,
"learning_rate": 4.000000000000001e-06,
"loss": -0.0004,
"step": 240
},
{
"clip_ratio": 0.0008375860925298184,
"completion_length": 106.09375,
"epoch": 0.032905516111414526,
"grad_norm": 0.0751417875289917,
"kl": 0.027247032237937674,
"learning_rate": 3.994736842105264e-06,
"loss": 0.0004,
"num_tokens": 674724.0,
"reward": 0.5218750238418579,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.5218750238418579,
"step": 241
},
{
"clip_ratio": 0.0,
"epoch": 0.03304205352266521,
"grad_norm": 0.07292292267084122,
"kl": 0.02736963256029412,
"learning_rate": 3.989473684210526e-06,
"loss": 0.0,
"step": 242
},
{
"clip_ratio": 0.0003033980610780418,
"epoch": 0.03317859093391589,
"grad_norm": 0.06825637817382812,
"kl": 0.027891719597391784,
"learning_rate": 3.98421052631579e-06,
"loss": -0.0003,
"step": 243
},
{
"clip_ratio": 0.0003033980610780418,
"epoch": 0.033315128345166575,
"grad_norm": 0.06375395506620407,
"kl": 0.0283044419484213,
"learning_rate": 3.9789473684210525e-06,
"loss": -0.0007,
"step": 244
},
{
"clip_ratio": 0.0005482456181198359,
"completion_length": 124.5625,
"epoch": 0.03345166575641726,
"grad_norm": 0.09664054214954376,
"kl": 0.028416587243555114,
"learning_rate": 3.9736842105263165e-06,
"loss": 0.0002,
"num_tokens": 685466.0,
"reward": 0.71875,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.71875,
"step": 245
},
{
"clip_ratio": 0.0003923962212866172,
"epoch": 0.03358820316766794,
"grad_norm": 0.09948284178972244,
"kl": 0.02821255396702327,
"learning_rate": 3.968421052631579e-06,
"loss": -0.0,
"step": 246
},
{
"clip_ratio": 0.0,
"epoch": 0.033724740578918624,
"grad_norm": 0.07397827506065369,
"kl": 0.02847255891538225,
"learning_rate": 3.963157894736843e-06,
"loss": -0.0006,
"step": 247
},
{
"clip_ratio": 0.0004448878316907212,
"epoch": 0.03386127799016931,
"grad_norm": 0.07055655121803284,
"kl": 0.028869623522041366,
"learning_rate": 3.957894736842106e-06,
"loss": -0.0011,
"step": 248
},
{
"clip_ratio": 0.0002765486715361476,
"completion_length": 94.875,
"epoch": 0.03399781540141999,
"grad_norm": 0.052606552839279175,
"kl": 0.020315775473136455,
"learning_rate": 3.952631578947368e-06,
"loss": 0.0004,
"num_tokens": 696522.0,
"reward": 0.831250011920929,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.831250011920929,
"step": 249
},
{
"clip_ratio": 0.0,
"epoch": 0.034134352812670674,
"grad_norm": 0.05249060317873955,
"kl": 0.020589739870047197,
"learning_rate": 3.947368421052632e-06,
"loss": 0.0001,
"step": 250
},
{
"clip_ratio": 0.0,
"epoch": 0.03427089022392135,
"grad_norm": 0.04982711747288704,
"kl": 0.02040288085117936,
"learning_rate": 3.942105263157895e-06,
"loss": 0.0,
"step": 251
},
{
"clip_ratio": 0.0002765486715361476,
"epoch": 0.03440742763517204,
"grad_norm": 0.04824934899806976,
"kl": 0.020667625038186088,
"learning_rate": 3.936842105263159e-06,
"loss": -0.0002,
"step": 252
},
{
"clip_ratio": 0.0,
"completion_length": 104.34375,
"epoch": 0.03454396504642272,
"grad_norm": 0.057229530066251755,
"kl": 0.03170221848995425,
"learning_rate": 3.931578947368421e-06,
"loss": 0.0003,
"num_tokens": 707233.0,
"reward": 0.550000011920929,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.550000011920929,
"step": 253
},
{
"clip_ratio": 0.0,
"epoch": 0.0346805024576734,
"grad_norm": 0.057189639657735825,
"kl": 0.03171565095544793,
"learning_rate": 3.926315789473685e-06,
"loss": 0.0,
"step": 254
},
{
"clip_ratio": 0.0,
"epoch": 0.034817039868924086,
"grad_norm": 0.05530928447842598,
"kl": 0.030918381758965552,
"learning_rate": 3.921052631578947e-06,
"loss": -0.0002,
"step": 255
},
{
"clip_ratio": 0.0,
"epoch": 0.034953577280174765,
"grad_norm": 0.052288055419921875,
"kl": 0.03107694143545814,
"learning_rate": 3.9157894736842104e-06,
"loss": -0.0004,
"step": 256
},
{
"clip_ratio": 0.0,
"completion_length": 113.34375,
"epoch": 0.03509011469142545,
"grad_norm": 0.0891910195350647,
"kl": 0.023110102163627744,
"learning_rate": 3.9105263157894744e-06,
"loss": 0.0001,
"num_tokens": 718136.0,
"reward": 0.606249988079071,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.606249988079071,
"step": 257
},
{
"clip_ratio": 0.00022163119865581393,
"epoch": 0.035226652102676136,
"grad_norm": 0.07997400313615799,
"kl": 0.02337674022419378,
"learning_rate": 3.905263157894737e-06,
"loss": -0.0002,
"step": 258
},
{
"clip_ratio": 0.00020695364219136536,
"epoch": 0.035363189513926814,
"grad_norm": 0.0842948779463768,
"kl": 0.022346210171235725,
"learning_rate": 3.900000000000001e-06,
"loss": -0.0006,
"step": 259
},
{
"clip_ratio": 0.0,
"epoch": 0.0354997269251775,
"grad_norm": 0.07676080614328384,
"kl": 0.02255020069424063,
"learning_rate": 3.894736842105263e-06,
"loss": -0.0012,
"step": 260
},
{
"clip_ratio": 0.0008840422669891268,
"completion_length": 102.75,
"epoch": 0.035636264336428185,
"grad_norm": 0.12544368207454681,
"kl": 0.02338628371944651,
"learning_rate": 3.889473684210527e-06,
"loss": 0.0005,
"num_tokens": 728780.0,
"reward": 0.8312499523162842,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.8312499523162842,
"step": 261
},
{
"clip_ratio": 0.000634926778730005,
"epoch": 0.03577280174767886,
"grad_norm": 0.11735007166862488,
"kl": 0.023411447560647503,
"learning_rate": 3.884210526315789e-06,
"loss": -0.0002,
"step": 262
},
{
"clip_ratio": 0.00048496242379769683,
"epoch": 0.03590933915892955,
"grad_norm": 0.11159281432628632,
"kl": 0.023148178006522357,
"learning_rate": 3.878947368421053e-06,
"loss": -0.001,
"step": 263
},
{
"clip_ratio": 0.0,
"epoch": 0.03604587657018023,
"grad_norm": 0.09994325041770935,
"kl": 0.023549747798824683,
"learning_rate": 3.873684210526316e-06,
"loss": -0.0021,
"step": 264
},
{
"clip_ratio": 0.0004883110523223877,
"completion_length": 115.15625,
"epoch": 0.03618241398143091,
"grad_norm": 0.07745163142681122,
"kl": 0.026939595787553117,
"learning_rate": 3.868421052631579e-06,
"loss": 0.0003,
"num_tokens": 739625.0,
"reward": 0.8031250238418579,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.8031250238418579,
"step": 265
},
{
"clip_ratio": 0.00029761905898340046,
"epoch": 0.0363189513926816,
"grad_norm": 0.07724476605653763,
"kl": 0.027008358330931515,
"learning_rate": 3.863157894736843e-06,
"loss": 0.0,
"step": 266
},
{
"clip_ratio": 0.0,
"epoch": 0.036455488803932276,
"grad_norm": 0.07575860619544983,
"kl": 0.027253914857283235,
"learning_rate": 3.857894736842105e-06,
"loss": -0.0004,
"step": 267
},
{
"clip_ratio": 0.0005524969019461423,
"epoch": 0.03659202621518296,
"grad_norm": 0.07534480094909668,
"kl": 0.02772324366378598,
"learning_rate": 3.852631578947369e-06,
"loss": -0.0008,
"step": 268
},
{
"clip_ratio": 0.0,
"completion_length": 113.5625,
"epoch": 0.03672856362643364,
"grad_norm": 0.03475145250558853,
"kl": 0.021824754105182365,
"learning_rate": 3.8473684210526316e-06,
"loss": 0.0002,
"num_tokens": 750175.0,
"reward": 0.690625011920929,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.690625011920929,
"step": 269
},
{
"clip_ratio": 0.0,
"epoch": 0.036865101037684325,
"grad_norm": 0.03451026603579521,
"kl": 0.02219120250083506,
"learning_rate": 3.842105263157895e-06,
"loss": 0.0002,
"step": 270
},
{
"clip_ratio": 0.0,
"epoch": 0.03700163844893501,
"grad_norm": 0.03484285995364189,
"kl": 0.022240082558710128,
"learning_rate": 3.836842105263158e-06,
"loss": 0.0002,
"step": 271
},
{
"clip_ratio": 0.0,
"epoch": 0.03713817586018569,
"grad_norm": 0.035136640071868896,
"kl": 0.022295867995126173,
"learning_rate": 3.831578947368421e-06,
"loss": -0.0001,
"step": 272
},
{
"clip_ratio": 0.00013412017142400146,
"completion_length": 121.78125,
"epoch": 0.037274713271436374,
"grad_norm": 0.09162586182355881,
"kl": 0.02208938094554469,
"learning_rate": 3.826315789473685e-06,
"loss": 0.0,
"num_tokens": 761652.0,
"reward": 0.887499988079071,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.887499988079071,
"step": 273
},
{
"clip_ratio": 0.00025201612152159214,
"epoch": 0.03741125068268706,
"grad_norm": 0.08879063278436661,
"kl": 0.02217887411825359,
"learning_rate": 3.821052631578947e-06,
"loss": -0.0002,
"step": 274
},
{
"clip_ratio": 0.0007802476466167718,
"epoch": 0.03754778809393774,
"grad_norm": 0.08000439405441284,
"kl": 0.022196775797056034,
"learning_rate": 3.815789473684211e-06,
"loss": -0.0006,
"step": 275
},
{
"clip_ratio": 0.0007268308690981939,
"epoch": 0.037684325505188423,
"grad_norm": 0.06881428509950638,
"kl": 0.02263434650376439,
"learning_rate": 3.810526315789474e-06,
"loss": -0.0013,
"step": 276
},
{
"clip_ratio": 0.0,
"completion_length": 120.28125,
"epoch": 0.0378208629164391,
"grad_norm": 0.05088047683238983,
"kl": 0.02204109003650956,
"learning_rate": 3.805263157894737e-06,
"loss": 0.0003,
"num_tokens": 773309.0,
"reward": 0.859375,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.859375,
"step": 277
},
{
"clip_ratio": 0.0,
"epoch": 0.03795740032768979,
"grad_norm": 0.049479130655527115,
"kl": 0.022138332104077563,
"learning_rate": 3.8000000000000005e-06,
"loss": 0.0,
"step": 278
},
{
"clip_ratio": 0.0,
"epoch": 0.03809393773894047,
"grad_norm": 0.0442269891500473,
"kl": 0.022356969930115156,
"learning_rate": 3.794736842105263e-06,
"loss": -0.0001,
"step": 279
},
{
"clip_ratio": 0.0,
"epoch": 0.03823047515019115,
"grad_norm": 0.04249510541558266,
"kl": 0.022337044501909986,
"learning_rate": 3.789473684210527e-06,
"loss": -0.0003,
"step": 280
},
{
"clip_ratio": 0.0005657151050399989,
"completion_length": 113.625,
"epoch": 0.038367012561441836,
"grad_norm": 0.07635533064603806,
"kl": 0.023303329100599512,
"learning_rate": 3.7842105263157895e-06,
"loss": 0.0003,
"num_tokens": 784297.0,
"reward": 0.71875,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.71875,
"step": 281
},
{
"clip_ratio": 0.00027901786961592734,
"epoch": 0.038503549972692515,
"grad_norm": 0.0776119977235794,
"kl": 0.02313061192398891,
"learning_rate": 3.778947368421053e-06,
"loss": 0.0002,
"step": 282
},
{
"clip_ratio": 0.0,
"epoch": 0.0386400873839432,
"grad_norm": 0.0766444057226181,
"kl": 0.02328120105084963,
"learning_rate": 3.773684210526316e-06,
"loss": -0.0003,
"step": 283
},
{
"clip_ratio": 0.0,
"epoch": 0.038776624795193886,
"grad_norm": 0.0710226446390152,
"kl": 0.023574423365062103,
"learning_rate": 3.768421052631579e-06,
"loss": -0.001,
"step": 284
},
{
"clip_ratio": 0.0,
"completion_length": 113.0625,
"epoch": 0.038913162206444564,
"grad_norm": 0.061644088476896286,
"kl": 0.02391217538388446,
"learning_rate": 3.7631578947368426e-06,
"loss": 0.0003,
"num_tokens": 795303.0,
"reward": 0.6625000238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.6625000238418579,
"step": 285
},
{
"clip_ratio": 0.0,
"epoch": 0.03904969961769525,
"grad_norm": 0.0605340413749218,
"kl": 0.0234130252210889,
"learning_rate": 3.7578947368421053e-06,
"loss": 0.0001,
"step": 286
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.03918623702894593,
"grad_norm": 0.060991305857896805,
"kl": 0.02373662660829723,
"learning_rate": 3.752631578947369e-06,
"loss": 0.0,
"step": 287
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.03932277444019661,
"grad_norm": 0.054490797221660614,
"kl": 0.02412348723737523,
"learning_rate": 3.7473684210526317e-06,
"loss": -0.0006,
"step": 288
},
{
"clip_ratio": 0.00044014083687216043,
"completion_length": 122.59375,
"epoch": 0.0394593118514473,
"grad_norm": 0.07991161197423935,
"kl": 0.022707521973643452,
"learning_rate": 3.7421052631578953e-06,
"loss": 0.0004,
"num_tokens": 806314.0,
"reward": 0.6625000238418579,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.6625000238418579,
"step": 289
},
{
"clip_ratio": 0.00022007041843608022,
"epoch": 0.03959584926269798,
"grad_norm": 0.07932053506374359,
"kl": 0.022475473844679072,
"learning_rate": 3.736842105263158e-06,
"loss": -0.0001,
"step": 290
},
{
"clip_ratio": 0.00022007041843608022,
"epoch": 0.03973238667394866,
"grad_norm": 0.07653678953647614,
"kl": 0.022855573624838144,
"learning_rate": 3.7315789473684216e-06,
"loss": -0.0003,
"step": 291
},
{
"clip_ratio": 0.0003703108086483553,
"epoch": 0.03986892408519935,
"grad_norm": 0.06487143039703369,
"kl": 0.023218183137942106,
"learning_rate": 3.7263157894736848e-06,
"loss": -0.0008,
"step": 292
},
{
"clip_ratio": 0.0,
"completion_length": 120.3125,
"epoch": 0.040005461496450026,
"grad_norm": 0.05640777572989464,
"kl": 0.021730259235482663,
"learning_rate": 3.7210526315789475e-06,
"loss": 0.0003,
"num_tokens": 817436.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 293
},
{
"clip_ratio": 0.0005408743163570762,
"epoch": 0.04014199890770071,
"grad_norm": 0.05590509995818138,
"kl": 0.021133837261004373,
"learning_rate": 3.715789473684211e-06,
"loss": 0.0003,
"step": 294
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.04027853631895139,
"grad_norm": 0.05611417070031166,
"kl": 0.021910520212259144,
"learning_rate": 3.710526315789474e-06,
"loss": 0.0002,
"step": 295
},
{
"clip_ratio": 0.0,
"epoch": 0.040415073730202075,
"grad_norm": 0.05293579027056694,
"kl": 0.021879399777390063,
"learning_rate": 3.7052631578947374e-06,
"loss": -0.0002,
"step": 296
},
{
"clip_ratio": 0.00021853146608918905,
"completion_length": 119.3125,
"epoch": 0.04055161114145276,
"grad_norm": 0.08654630929231644,
"kl": 0.022178779676323757,
"learning_rate": 3.7e-06,
"loss": 0.0,
"num_tokens": 828762.0,
"reward": 0.550000011920929,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.550000011920929,
"step": 297
},
{
"clip_ratio": 0.0004370629321783781,
"epoch": 0.04068814855270344,
"grad_norm": 0.08861983567476273,
"kl": 0.022127668256871402,
"learning_rate": 3.6947368421052637e-06,
"loss": -0.0001,
"step": 298
},
{
"clip_ratio": 0.0004370629321783781,
"epoch": 0.040824685963954124,
"grad_norm": 0.08493945002555847,
"kl": 0.021997908304911107,
"learning_rate": 3.6894736842105265e-06,
"loss": -0.0006,
"step": 299
},
{
"clip_ratio": 0.00021853146608918905,
"epoch": 0.0409612233752048,
"grad_norm": 0.07281088829040527,
"kl": 0.02197305968729779,
"learning_rate": 3.6842105263157896e-06,
"loss": -0.0013,
"step": 300
},
{
"clip_ratio": 0.0004409907996887341,
"completion_length": 113.25,
"epoch": 0.04109776078645549,
"grad_norm": 0.07107827067375183,
"kl": 0.022476364712929353,
"learning_rate": 3.6789473684210532e-06,
"loss": 0.0002,
"num_tokens": 840026.0,
"reward": 0.859375,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.859375,
"step": 301
},
{
"clip_ratio": 0.0004409907996887341,
"epoch": 0.04123429819770617,
"grad_norm": 0.06990018486976624,
"kl": 0.02247147186426446,
"learning_rate": 3.673684210526316e-06,
"loss": 0.0001,
"step": 302
},
{
"clip_ratio": 0.0004409907996887341,
"epoch": 0.04137083560895685,
"grad_norm": 0.07051187008619308,
"kl": 0.022447484341682866,
"learning_rate": 3.6684210526315796e-06,
"loss": -0.0002,
"step": 303
},
{
"clip_ratio": 0.0002367424312978983,
"epoch": 0.04150737302020754,
"grad_norm": 0.06450870633125305,
"kl": 0.022808179928688332,
"learning_rate": 3.6631578947368423e-06,
"loss": -0.0008,
"step": 304
},
{
"completion_length": 99.625,
"epoch": 0.04164391043145822,
"grad_norm": 0.0,
"learning_rate": 3.657894736842106e-06,
"loss": 0.0,
"num_tokens": 849910.0,
"reward": 1.0,
"reward_std": 0.0,
"rewards/reward_fn": 1.0,
"step": 305
},
{
"epoch": 0.0417804478427089,
"grad_norm": 0.0,
"learning_rate": 3.6526315789473686e-06,
"loss": 0.0,
"step": 306
},
{
"epoch": 0.041916985253959586,
"grad_norm": 0.0,
"learning_rate": 3.6473684210526318e-06,
"loss": 0.0,
"step": 307
},
{
"epoch": 0.042053522665210265,
"grad_norm": 0.0,
"learning_rate": 3.642105263157895e-06,
"loss": 0.0,
"step": 308
},
{
"clip_ratio": 0.0,
"completion_length": 124.5625,
"epoch": 0.04219006007646095,
"grad_norm": 0.04516865313053131,
"kl": 0.023450861306628212,
"learning_rate": 3.636842105263158e-06,
"loss": 0.0002,
"num_tokens": 861076.0,
"reward": 0.8031250238418579,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.8031250238418579,
"step": 309
},
{
"clip_ratio": 0.0,
"epoch": 0.042326597487711635,
"grad_norm": 0.044763803482055664,
"kl": 0.023947950976435095,
"learning_rate": 3.6315789473684217e-06,
"loss": 0.0001,
"step": 310
},
{
"clip_ratio": 0.0,
"epoch": 0.042463134898962314,
"grad_norm": 0.045122891664505005,
"kl": 0.02412795228883624,
"learning_rate": 3.6263157894736844e-06,
"loss": -0.0001,
"step": 311
},
{
"clip_ratio": 0.0,
"epoch": 0.042599672310213,
"grad_norm": 0.04445788636803627,
"kl": 0.02396708173910156,
"learning_rate": 3.621052631578948e-06,
"loss": -0.0002,
"step": 312
},
{
"clip_ratio": 0.0,
"completion_length": 105.5625,
"epoch": 0.04273620972146368,
"grad_norm": 0.127179816365242,
"kl": 0.028220025211339816,
"learning_rate": 3.6157894736842108e-06,
"loss": 0.0005,
"num_tokens": 871366.0,
"reward": 0.6343749761581421,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.6343749761581421,
"step": 313
},
{
"clip_ratio": 0.0,
"epoch": 0.04287274713271436,
"grad_norm": 0.08750166743993759,
"kl": 0.027303016162477434,
"learning_rate": 3.610526315789474e-06,
"loss": 0.0,
"step": 314
},
{
"clip_ratio": 0.0,
"epoch": 0.04300928454396505,
"grad_norm": 0.08059285581111908,
"kl": 0.027014906285330653,
"learning_rate": 3.605263157894737e-06,
"loss": -0.0003,
"step": 315
},
{
"clip_ratio": 0.0,
"epoch": 0.04314582195521573,
"grad_norm": 0.07490835338830948,
"kl": 0.02650223023374565,
"learning_rate": 3.6000000000000003e-06,
"loss": -0.001,
"step": 316
},
{
"clip_ratio": 0.00024224806111305952,
"completion_length": 124.59375,
"epoch": 0.04328235936646641,
"grad_norm": 0.08907640725374222,
"kl": 0.022105894546257332,
"learning_rate": 3.5947368421052634e-06,
"loss": -0.0,
"num_tokens": 883057.0,
"reward": 0.859375,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.859375,
"step": 317
},
{
"clip_ratio": 0.000507078570080921,
"epoch": 0.0434188967777171,
"grad_norm": 0.08827097713947296,
"kl": 0.021878067345824093,
"learning_rate": 3.5894736842105266e-06,
"loss": -0.0001,
"step": 318
},
{
"clip_ratio": 0.00024224806111305952,
"epoch": 0.043555434188967776,
"grad_norm": 0.08430935442447662,
"kl": 0.02233501960290596,
"learning_rate": 3.58421052631579e-06,
"loss": -0.0008,
"step": 319
},
{
"clip_ratio": 0.0010449249821249396,
"epoch": 0.04369197160021846,
"grad_norm": 0.07642368972301483,
"kl": 0.022479526698589325,
"learning_rate": 3.578947368421053e-06,
"loss": -0.0013,
"step": 320
},
{
"clip_ratio": 0.0004036639875266701,
"completion_length": 128.375,
"epoch": 0.04382850901146914,
"grad_norm": 0.08837485313415527,
"kl": 0.029423846543068066,
"learning_rate": 3.5736842105263157e-06,
"loss": 0.0001,
"num_tokens": 894553.0,
"reward": 0.7468750476837158,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.7468750476837158,
"step": 321
},
{
"clip_ratio": 0.0004036639875266701,
"epoch": 0.043965046422719825,
"grad_norm": 0.08810171484947205,
"kl": 0.028873553121229634,
"learning_rate": 3.5684210526315792e-06,
"loss": 0.0001,
"step": 322
},
{
"clip_ratio": 0.00042971508810296655,
"epoch": 0.04410158383397051,
"grad_norm": 0.0870831087231636,
"kl": 0.0294377136597177,
"learning_rate": 3.5631578947368424e-06,
"loss": -0.0006,
"step": 323
},
{
"clip_ratio": 0.0004036639875266701,
"epoch": 0.04423812124522119,
"grad_norm": 0.08122850209474564,
"kl": 0.029522280019591562,
"learning_rate": 3.5578947368421056e-06,
"loss": -0.0011,
"step": 324
},
{
"clip_ratio": 0.0,
"completion_length": 100.96875,
"epoch": 0.044374658656471874,
"grad_norm": 0.08125916123390198,
"kl": 0.02477030295995064,
"learning_rate": 3.5526315789473687e-06,
"loss": 0.0002,
"num_tokens": 904832.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 325
},
{
"clip_ratio": 0.0003188775444868952,
"epoch": 0.04451119606772255,
"grad_norm": 0.08092335611581802,
"kl": 0.025089218630455434,
"learning_rate": 3.5473684210526323e-06,
"loss": 0.0002,
"step": 326
},
{
"clip_ratio": 0.0,
"epoch": 0.04464773347897324,
"grad_norm": 0.07883549481630325,
"kl": 0.024627194390632212,
"learning_rate": 3.542105263157895e-06,
"loss": -0.0005,
"step": 327
},
{
"clip_ratio": 0.00020032051543239504,
"epoch": 0.04478427089022392,
"grad_norm": 0.07583944499492645,
"kl": 0.024948682344984263,
"learning_rate": 3.536842105263158e-06,
"loss": -0.001,
"step": 328
},
{
"clip_ratio": 0.0008947963651735336,
"completion_length": 113.46875,
"epoch": 0.0449208083014746,
"grad_norm": 0.09001241624355316,
"kl": 0.023796884925104678,
"learning_rate": 3.5315789473684214e-06,
"loss": 0.0,
"num_tokens": 915583.0,
"reward": 0.6625000238418579,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.6625000238418579,
"step": 329
},
{
"clip_ratio": 0.00023854961909819394,
"epoch": 0.04505734571272529,
"grad_norm": 0.09002924710512161,
"kl": 0.023522302479250357,
"learning_rate": 3.5263157894736846e-06,
"loss": -0.0003,
"step": 330
},
{
"clip_ratio": 0.0005853904294781387,
"epoch": 0.04519388312397597,
"grad_norm": 0.0916908010840416,
"kl": 0.023461372969904914,
"learning_rate": 3.5210526315789477e-06,
"loss": -0.0006,
"step": 331
},
{
"clip_ratio": 0.0,
"epoch": 0.04533042053522665,
"grad_norm": 0.07961533963680267,
"kl": 0.023377142468234524,
"learning_rate": 3.515789473684211e-06,
"loss": -0.0014,
"step": 332
},
{
"clip_ratio": 0.00102028384571895,
"completion_length": 118.96875,
"epoch": 0.045466957946477336,
"grad_norm": 0.06798560172319412,
"kl": 0.023123418592149392,
"learning_rate": 3.510526315789474e-06,
"loss": 0.0004,
"num_tokens": 926398.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 333
},
{
"clip_ratio": 0.001159263076260686,
"epoch": 0.045603495357728015,
"grad_norm": 0.10703027248382568,
"kl": 0.02294311163132079,
"learning_rate": 3.505263157894737e-06,
"loss": 0.0001,
"step": 334
},
{
"clip_ratio": 0.00023148147738538682,
"epoch": 0.0457400327689787,
"grad_norm": 0.07149892300367355,
"kl": 0.024184314184822142,
"learning_rate": 3.5e-06,
"loss": 0.0001,
"step": 335
},
{
"clip_ratio": 0.0004500129434745759,
"epoch": 0.045876570180229385,
"grad_norm": 0.0723360925912857,
"kl": 0.02370249154046178,
"learning_rate": 3.4947368421052635e-06,
"loss": -0.0003,
"step": 336
},
{
"clip_ratio": 0.00016276042151730508,
"completion_length": 137.6875,
"epoch": 0.046013107591480064,
"grad_norm": 0.08149459958076477,
"kl": 0.020294574671424925,
"learning_rate": 3.4894736842105263e-06,
"loss": 0.0001,
"num_tokens": 937840.0,
"reward": 0.578125,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.578125,
"step": 337
},
{
"clip_ratio": 0.0,
"epoch": 0.04614964500273075,
"grad_norm": 0.07450702041387558,
"kl": 0.020218727935571223,
"learning_rate": 3.48421052631579e-06,
"loss": -0.0,
"step": 338
},
{
"clip_ratio": 0.0,
"epoch": 0.04628618241398143,
"grad_norm": 0.0721743181347847,
"kl": 0.02070053394709248,
"learning_rate": 3.478947368421053e-06,
"loss": -0.0002,
"step": 339
},
{
"clip_ratio": 0.0008059149840846658,
"epoch": 0.04642271982523211,
"grad_norm": 0.06328802555799484,
"kl": 0.02160324275610037,
"learning_rate": 3.473684210526316e-06,
"loss": -0.0007,
"step": 340
},
{
"clip_ratio": 0.000163612567121163,
"completion_length": 139.5,
"epoch": 0.0465592572364828,
"grad_norm": 0.07692926377058029,
"kl": 0.022069479804486036,
"learning_rate": 3.4684210526315794e-06,
"loss": -0.0001,
"num_tokens": 949784.0,
"reward": 0.4937500059604645,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.4937500059604645,
"step": 341
},
{
"clip_ratio": 0.0006625788664678112,
"epoch": 0.04669579464773348,
"grad_norm": 0.07928881049156189,
"kl": 0.021967595210298896,
"learning_rate": 3.463157894736842e-06,
"loss": -0.0002,
"step": 342
},
{
"clip_ratio": 0.00040216218621935695,
"epoch": 0.04683233205898416,
"grad_norm": 0.07507841289043427,
"kl": 0.02228320448193699,
"learning_rate": 3.4578947368421057e-06,
"loss": -0.0007,
"step": 343
},
{
"clip_ratio": 0.000163612567121163,
"epoch": 0.04696886947023485,
"grad_norm": 0.06530670821666718,
"kl": 0.023109311325242743,
"learning_rate": 3.4526315789473684e-06,
"loss": -0.001,
"step": 344
},
{
"clip_ratio": 0.0,
"completion_length": 115.21875,
"epoch": 0.047105406881485526,
"grad_norm": 0.058630239218473434,
"kl": 0.027992002695100382,
"learning_rate": 3.447368421052632e-06,
"loss": 0.0004,
"num_tokens": 960135.0,
"reward": 0.690625011920929,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.690625011920929,
"step": 345
},
{
"clip_ratio": 0.0006200397037900984,
"epoch": 0.04724194429273621,
"grad_norm": 0.058566391468048096,
"kl": 0.02831086376681924,
"learning_rate": 3.4421052631578947e-06,
"loss": 0.0003,
"step": 346
},
{
"clip_ratio": 0.000590555282542482,
"epoch": 0.04737848170398689,
"grad_norm": 0.05969183146953583,
"kl": 0.028586817148607224,
"learning_rate": 3.4368421052631583e-06,
"loss": 0.0,
"step": 347
},
{
"clip_ratio": 0.00046267209108918905,
"epoch": 0.047515019115237575,
"grad_norm": 0.05286189541220665,
"kl": 0.02830476386588998,
"learning_rate": 3.4315789473684215e-06,
"loss": -0.0003,
"step": 348
},
{
"clip_ratio": 0.00027901786961592734,
"completion_length": 126.96875,
"epoch": 0.04765155652648826,
"grad_norm": 0.08239299803972244,
"kl": 0.02313562305062078,
"learning_rate": 3.4263157894736842e-06,
"loss": 0.0003,
"num_tokens": 971494.0,
"reward": 0.35312503576278687,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.35312503576278687,
"step": 349
},
{
"clip_ratio": 0.0004470286221476272,
"epoch": 0.04778809393773894,
"grad_norm": 0.08283380419015884,
"kl": 0.02339187340112403,
"learning_rate": 3.421052631578948e-06,
"loss": 0.0,
"step": 350
},
{
"clip_ratio": 0.000615039374679327,
"epoch": 0.047924631348989624,
"grad_norm": 0.07904310524463654,
"kl": 0.02403911092551425,
"learning_rate": 3.4157894736842106e-06,
"loss": -0.0004,
"step": 351
},
{
"clip_ratio": 0.0004470286221476272,
"epoch": 0.0480611687602403,
"grad_norm": 0.0709666758775711,
"kl": 0.024250175367342308,
"learning_rate": 3.410526315789474e-06,
"loss": -0.0009,
"step": 352
},
{
"clip_ratio": 0.00040849673678167164,
"completion_length": 135.0625,
"epoch": 0.04819770617149099,
"grad_norm": 0.09687653183937073,
"kl": 0.023374153446638957,
"learning_rate": 3.405263157894737e-06,
"loss": 0.0002,
"num_tokens": 983216.0,
"reward": 0.550000011920929,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.550000011920929,
"step": 353
},
{
"clip_ratio": 0.0009377389069413766,
"epoch": 0.04833424358274167,
"grad_norm": 0.09615480154752731,
"kl": 0.02371872030198574,
"learning_rate": 3.4000000000000005e-06,
"loss": 0.0002,
"step": 354
},
{
"clip_ratio": 0.0,
"epoch": 0.04847078099399235,
"grad_norm": 0.09314487129449844,
"kl": 0.023429605411365628,
"learning_rate": 3.3947368421052636e-06,
"loss": -0.0006,
"step": 355
},
{
"clip_ratio": 0.000633919466054067,
"epoch": 0.04860731840524304,
"grad_norm": 0.08851853013038635,
"kl": 0.023448748368537053,
"learning_rate": 3.3894736842105264e-06,
"loss": -0.0014,
"step": 356
},
{
"clip_ratio": 0.00020424836839083582,
"completion_length": 133.375,
"epoch": 0.04874385581649372,
"grad_norm": 0.04887694865465164,
"kl": 0.02090101721114479,
"learning_rate": 3.38421052631579e-06,
"loss": 0.0004,
"num_tokens": 994928.0,
"reward": 0.4937500059604645,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.4937500059604645,
"step": 357
},
{
"clip_ratio": 0.0004392107803141698,
"epoch": 0.0488803932277444,
"grad_norm": 0.047825887799263,
"kl": 0.021263578528305516,
"learning_rate": 3.3789473684210527e-06,
"loss": 0.0001,
"step": 358
},
{
"clip_ratio": 0.00020424836839083582,
"epoch": 0.049016930638995086,
"grad_norm": 0.04860318452119827,
"kl": 0.021143519785255194,
"learning_rate": 3.3736842105263163e-06,
"loss": 0.0001,
"step": 359
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.049153468050245765,
"grad_norm": 0.046374525874853134,
"kl": 0.020965132425772026,
"learning_rate": 3.368421052631579e-06,
"loss": -0.0001,
"step": 360
},
{
"clip_ratio": 0.0,
"completion_length": 123.90625,
"epoch": 0.04929000546149645,
"grad_norm": 0.0487712062895298,
"kl": 0.02792163222329691,
"learning_rate": 3.3631578947368426e-06,
"loss": 0.0002,
"num_tokens": 1006129.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 361
},
{
"clip_ratio": 0.0,
"epoch": 0.049426542872747135,
"grad_norm": 0.04795907065272331,
"kl": 0.027323424263158813,
"learning_rate": 3.3578947368421054e-06,
"loss": 0.0003,
"step": 362
},
{
"clip_ratio": 0.0,
"epoch": 0.049563080283997814,
"grad_norm": 0.047760266810655594,
"kl": 0.02758122145314701,
"learning_rate": 3.3526315789473685e-06,
"loss": 0.0001,
"step": 363
},
{
"clip_ratio": 0.0,
"epoch": 0.0496996176952485,
"grad_norm": 0.04801912233233452,
"kl": 0.0270579831849318,
"learning_rate": 3.347368421052632e-06,
"loss": -0.0001,
"step": 364
},
{
"clip_ratio": 0.0001849112450145185,
"completion_length": 120.8125,
"epoch": 0.04983615510649918,
"grad_norm": 0.05475917458534241,
"kl": 0.020006455102702603,
"learning_rate": 3.342105263157895e-06,
"loss": 0.0001,
"num_tokens": 1016995.0,
"reward": 0.71875,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.71875,
"step": 365
},
{
"clip_ratio": 0.0001849112450145185,
"epoch": 0.04997269251774986,
"grad_norm": 0.05398503318428993,
"kl": 0.01969250911497511,
"learning_rate": 3.3368421052631584e-06,
"loss": 0.0001,
"step": 366
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.05010922992900055,
"grad_norm": 0.053278569132089615,
"kl": 0.01969363953685388,
"learning_rate": 3.331578947368421e-06,
"loss": -0.0002,
"step": 367
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.05024576734025123,
"grad_norm": 0.05154409632086754,
"kl": 0.01971426818636246,
"learning_rate": 3.3263157894736848e-06,
"loss": -0.0004,
"step": 368
},
{
"clip_ratio": 0.00048449612222611904,
"completion_length": 127.625,
"epoch": 0.05038230475150191,
"grad_norm": 0.08452387899160385,
"kl": 0.020907113037537783,
"learning_rate": 3.3210526315789475e-06,
"loss": 0.0004,
"num_tokens": 1028511.0,
"reward": 0.49375003576278687,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.49375003576278687,
"step": 369
},
{
"clip_ratio": 0.0,
"epoch": 0.0505188421627526,
"grad_norm": 0.08542630821466446,
"kl": 0.020866161328740418,
"learning_rate": 3.3157894736842107e-06,
"loss": 0.0002,
"step": 370
},
{
"clip_ratio": 0.0003730945463757962,
"epoch": 0.050655379574003276,
"grad_norm": 0.08319123089313507,
"kl": 0.021059497754322365,
"learning_rate": 3.310526315789474e-06,
"loss": -0.0004,
"step": 371
},
{
"clip_ratio": 0.0005486206209752709,
"epoch": 0.05079191698525396,
"grad_norm": 0.08353553712368011,
"kl": 0.021253676881315187,
"learning_rate": 3.305263157894737e-06,
"loss": -0.001,
"step": 372
},
{
"clip_ratio": 0.0,
"completion_length": 116.03125,
"epoch": 0.05092845439650464,
"grad_norm": 0.08390096575021744,
"kl": 0.022265749430516735,
"learning_rate": 3.3000000000000006e-06,
"loss": 0.0001,
"num_tokens": 1039464.0,
"reward": 0.6062500476837158,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.6062500476837158,
"step": 373
},
{
"clip_ratio": 0.0,
"epoch": 0.051064991807755325,
"grad_norm": 0.08395753800868988,
"kl": 0.022902959695784375,
"learning_rate": 3.2947368421052633e-06,
"loss": -0.0,
"step": 374
},
{
"clip_ratio": 0.0,
"epoch": 0.05120152921900601,
"grad_norm": 0.07426461577415466,
"kl": 0.02265952795278281,
"learning_rate": 3.289473684210527e-06,
"loss": -0.0004,
"step": 375
},
{
"clip_ratio": 0.00038479387876577675,
"epoch": 0.05133806663025669,
"grad_norm": 0.0708777979016304,
"kl": 0.02249322272837162,
"learning_rate": 3.2842105263157897e-06,
"loss": -0.0009,
"step": 376
},
{
"clip_ratio": 9.61538462433964e-05,
"completion_length": 153.9375,
"epoch": 0.051474604041507374,
"grad_norm": 0.08031871914863586,
"kl": 0.02048320347967092,
"learning_rate": 3.278947368421053e-06,
"loss": 0.0,
"num_tokens": 1052498.0,
"reward": 0.49375003576278687,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.49375003576278687,
"step": 377
},
{
"clip_ratio": 0.00018221575010102242,
"epoch": 0.05161114145275805,
"grad_norm": 0.07619955390691757,
"kl": 0.020257426964235492,
"learning_rate": 3.273684210526316e-06,
"loss": -0.0001,
"step": 378
},
{
"clip_ratio": 0.0002741228090599179,
"epoch": 0.05174767886400874,
"grad_norm": 0.07639969140291214,
"kl": 0.02037222741637379,
"learning_rate": 3.268421052631579e-06,
"loss": -0.0003,
"step": 379
},
{
"clip_ratio": 0.0,
"epoch": 0.05188421627525942,
"grad_norm": 0.06297897547483444,
"kl": 0.021020412095822394,
"learning_rate": 3.2631578947368423e-06,
"loss": -0.0007,
"step": 380
},
{
"clip_ratio": 0.0,
"completion_length": 139.09375,
"epoch": 0.0520207536865101,
"grad_norm": 0.041881829500198364,
"kl": 0.022837618802441284,
"learning_rate": 3.2578947368421055e-06,
"loss": 0.0002,
"num_tokens": 1063853.0,
"reward": 0.71875,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.71875,
"step": 381
},
{
"clip_ratio": 0.00014810427092015743,
"epoch": 0.05215729109776079,
"grad_norm": 0.04161300137639046,
"kl": 0.022631432017078623,
"learning_rate": 3.252631578947369e-06,
"loss": 0.0001,
"step": 382
},
{
"clip_ratio": 0.0,
"epoch": 0.05229382850901147,
"grad_norm": 0.04173358157277107,
"kl": 0.023325582704273984,
"learning_rate": 3.247368421052632e-06,
"loss": 0.0,
"step": 383
},
{
"clip_ratio": 0.0,
"epoch": 0.05243036592026215,
"grad_norm": 0.03905336186289787,
"kl": 0.022985702089499682,
"learning_rate": 3.2421052631578945e-06,
"loss": -0.0002,
"step": 384
},
{
"clip_ratio": 0.00015394088404718786,
"completion_length": 110.125,
"epoch": 0.052566903331512836,
"grad_norm": 0.07995563000440598,
"kl": 0.020230403955793008,
"learning_rate": 3.236842105263158e-06,
"loss": 0.0002,
"num_tokens": 1074037.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 385
},
{
"clip_ratio": 0.00015394088404718786,
"epoch": 0.052703440742763515,
"grad_norm": 0.08091157674789429,
"kl": 0.02018303626391571,
"learning_rate": 3.2315789473684213e-06,
"loss": -0.0,
"step": 386
},
{
"clip_ratio": 0.00015394088404718786,
"epoch": 0.0528399781540142,
"grad_norm": 0.0798361599445343,
"kl": 0.020285903723561205,
"learning_rate": 3.2263157894736845e-06,
"loss": -0.0005,
"step": 387
},
{
"clip_ratio": 0.0,
"epoch": 0.052976515565264885,
"grad_norm": 0.07278761267662048,
"kl": 0.02051667576597538,
"learning_rate": 3.2210526315789476e-06,
"loss": -0.0011,
"step": 388
},
{
"clip_ratio": 0.0,
"completion_length": 107.21875,
"epoch": 0.053113052976515564,
"grad_norm": 0.07617516070604324,
"kl": 0.028143407515017316,
"learning_rate": 3.215789473684211e-06,
"loss": 0.0003,
"num_tokens": 1084844.0,
"reward": 0.7749999761581421,
"reward_std": 0.12990380823612213,
"rewards/reward_fn": 0.7749999761581421,
"step": 389
},
{
"clip_ratio": 0.0,
"epoch": 0.05324959038776625,
"grad_norm": 0.07584980130195618,
"kl": 0.02738626574864611,
"learning_rate": 3.210526315789474e-06,
"loss": 0.0003,
"step": 390
},
{
"clip_ratio": 0.0005663055635523051,
"epoch": 0.05338612779901693,
"grad_norm": 0.07561825215816498,
"kl": 0.027368494658730924,
"learning_rate": 3.2052631578947367e-06,
"loss": -0.0001,
"step": 391
},
{
"clip_ratio": 0.0005663055635523051,
"epoch": 0.05352266521026761,
"grad_norm": 0.06851368397474289,
"kl": 0.027929118426982313,
"learning_rate": 3.2000000000000003e-06,
"loss": -0.0006,
"step": 392
},
{
"clip_ratio": 0.00021853146608918905,
"completion_length": 120.71875,
"epoch": 0.0536592026215183,
"grad_norm": 0.058026522397994995,
"kl": 0.025286480551585555,
"learning_rate": 3.1947368421052634e-06,
"loss": 0.0001,
"num_tokens": 1096015.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 393
},
{
"clip_ratio": 0.00021853146608918905,
"epoch": 0.05379574003276898,
"grad_norm": 0.05753491073846817,
"kl": 0.0260978079168126,
"learning_rate": 3.1894736842105266e-06,
"loss": 0.0,
"step": 394
},
{
"clip_ratio": 0.00021853146608918905,
"epoch": 0.05393227744401966,
"grad_norm": 0.05408268794417381,
"kl": 0.026300053868908435,
"learning_rate": 3.1842105263157898e-06,
"loss": -0.0002,
"step": 395
},
{
"clip_ratio": 0.00020424836839083582,
"epoch": 0.05406881485527035,
"grad_norm": 0.04638107120990753,
"kl": 0.02564926413469948,
"learning_rate": 3.178947368421053e-06,
"loss": -0.0005,
"step": 396
},
{
"clip_ratio": 0.00035511364694684744,
"completion_length": 102.875,
"epoch": 0.054205352266521026,
"grad_norm": 0.08631628006696701,
"kl": 0.02725237447884865,
"learning_rate": 3.173684210526316e-06,
"loss": 0.0004,
"num_tokens": 1106459.0,
"reward": 0.6625000238418579,
"reward_std": 0.12990380823612213,
"rewards/reward_fn": 0.6625000238418579,
"step": 397
},
{
"clip_ratio": 0.0,
"epoch": 0.05434188967777171,
"grad_norm": 0.0849158763885498,
"kl": 0.02785361756104976,
"learning_rate": 3.168421052631579e-06,
"loss": 0.0001,
"step": 398
},
{
"clip_ratio": 0.0,
"epoch": 0.05447842708902239,
"grad_norm": 0.08003275096416473,
"kl": 0.027714760246453807,
"learning_rate": 3.1631578947368424e-06,
"loss": -0.0005,
"step": 399
},
{
"clip_ratio": 0.0,
"epoch": 0.054614964500273075,
"grad_norm": 0.06917204707860947,
"kl": 0.027757962932810187,
"learning_rate": 3.157894736842105e-06,
"loss": -0.0008,
"step": 400
},
{
"clip_ratio": 0.00020833333837799728,
"completion_length": 114.53125,
"epoch": 0.05475150191152376,
"grad_norm": 0.054499052464962006,
"kl": 0.02256640234554652,
"learning_rate": 3.1526315789473688e-06,
"loss": 0.0001,
"num_tokens": 1117220.0,
"reward": 0.606249988079071,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.606249988079071,
"step": 401
},
{
"clip_ratio": 0.0,
"epoch": 0.05488803932277444,
"grad_norm": 0.054717376828193665,
"kl": 0.022691508871503174,
"learning_rate": 3.147368421052632e-06,
"loss": -0.0,
"step": 402
},
{
"clip_ratio": 0.0,
"epoch": 0.055024576734025124,
"grad_norm": 0.053422003984451294,
"kl": 0.023062629101332277,
"learning_rate": 3.142105263157895e-06,
"loss": -0.0002,
"step": 403
},
{
"clip_ratio": 0.0,
"epoch": 0.0551611141452758,
"grad_norm": 0.05216868966817856,
"kl": 0.022557226198841818,
"learning_rate": 3.1368421052631582e-06,
"loss": -0.0006,
"step": 404
},
{
"completion_length": 115.21875,
"epoch": 0.05529765155652649,
"grad_norm": 0.0,
"learning_rate": 3.131578947368421e-06,
"loss": 0.0,
"num_tokens": 1128051.0,
"reward": 0.550000011920929,
"reward_std": 0.0,
"rewards/reward_fn": 0.550000011920929,
"step": 405
},
{
"epoch": 0.05543418896777717,
"grad_norm": 0.0,
"learning_rate": 3.1263157894736846e-06,
"loss": 0.0,
"step": 406
},
{
"epoch": 0.05557072637902785,
"grad_norm": 0.0,
"learning_rate": 3.1210526315789473e-06,
"loss": 0.0,
"step": 407
},
{
"epoch": 0.05570726379027854,
"grad_norm": 0.0,
"learning_rate": 3.115789473684211e-06,
"loss": 0.0,
"step": 408
},
{
"clip_ratio": 0.0004936508776154369,
"completion_length": 120.84375,
"epoch": 0.05584380120152922,
"grad_norm": 0.09440712630748749,
"kl": 0.029624507413245738,
"learning_rate": 3.1105263157894736e-06,
"loss": 0.0005,
"num_tokens": 1139234.0,
"reward": 0.7749999761581421,
"reward_std": 0.2899519205093384,
"rewards/reward_fn": 0.7749999761581421,
"step": 409
},
{
"clip_ratio": 0.0004337021673563868,
"epoch": 0.0559803386127799,
"grad_norm": 0.09525737166404724,
"kl": 0.02997314796084538,
"learning_rate": 3.1052631578947372e-06,
"loss": 0.0003,
"step": 410
},
{
"clip_ratio": 0.000668147680698894,
"epoch": 0.056116876024030586,
"grad_norm": 0.09334629029035568,
"kl": 0.029849036916857585,
"learning_rate": 3.1000000000000004e-06,
"loss": -0.0002,
"step": 411
},
{
"clip_ratio": 0.0006625162932323292,
"epoch": 0.056253413435281265,
"grad_norm": 0.09088991582393646,
"kl": 0.029855199943995103,
"learning_rate": 3.094736842105263e-06,
"loss": -0.0009,
"step": 412
},
{
"clip_ratio": 0.00026709403027780354,
"completion_length": 121.4375,
"epoch": 0.05638995084653195,
"grad_norm": 0.08999986946582794,
"kl": 0.0211114841804374,
"learning_rate": 3.0894736842105267e-06,
"loss": 0.0001,
"num_tokens": 1150204.0,
"reward": 0.40937501192092896,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.40937501192092896,
"step": 413
},
{
"clip_ratio": 0.00044984256965108216,
"epoch": 0.056526488257782635,
"grad_norm": 0.0902203768491745,
"kl": 0.021156518894713372,
"learning_rate": 3.0842105263157895e-06,
"loss": -0.0,
"step": 414
},
{
"clip_ratio": 0.000660560792312026,
"epoch": 0.056663025669033314,
"grad_norm": 0.08662670105695724,
"kl": 0.021238182176603004,
"learning_rate": 3.078947368421053e-06,
"loss": -0.0004,
"step": 415
},
{
"clip_ratio": 0.0004912797885481268,
"epoch": 0.056799563080284,
"grad_norm": 0.08425270766019821,
"kl": 0.021560683904681355,
"learning_rate": 3.0736842105263158e-06,
"loss": -0.0013,
"step": 416
},
{
"clip_ratio": 0.000488749414216727,
"completion_length": 121.5,
"epoch": 0.05693610049153468,
"grad_norm": 0.07870546728372574,
"kl": 0.02753204884356819,
"learning_rate": 3.0684210526315794e-06,
"loss": 0.0005,
"num_tokens": 1161660.0,
"reward": 0.6625000238418579,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.6625000238418579,
"step": 417
},
{
"clip_ratio": 0.00045018277887720615,
"epoch": 0.05707263790278536,
"grad_norm": 0.0780278816819191,
"kl": 0.02779330688645132,
"learning_rate": 3.0631578947368425e-06,
"loss": 0.0004,
"step": 418
},
{
"clip_ratio": 0.0009154355502687395,
"epoch": 0.05720917531403605,
"grad_norm": 0.07824473083019257,
"kl": 0.027306273754220456,
"learning_rate": 3.0578947368421053e-06,
"loss": 0.0,
"step": 419
},
{
"clip_ratio": 0.0002736291062319651,
"epoch": 0.05734571272528673,
"grad_norm": 0.0745638981461525,
"kl": 0.027793304558144882,
"learning_rate": 3.052631578947369e-06,
"loss": -0.0006,
"step": 420
},
{
"clip_ratio": 0.0003396739193703979,
"completion_length": 103.65625,
"epoch": 0.05748225013653741,
"grad_norm": 0.042599353939294815,
"kl": 0.028534257464343682,
"learning_rate": 3.0473684210526316e-06,
"loss": 0.0003,
"num_tokens": 1171885.0,
"reward": 0.578125,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.578125,
"step": 421
},
{
"clip_ratio": 0.0,
"epoch": 0.0576187875477881,
"grad_norm": 0.042493246495723724,
"kl": 0.028584119427250698,
"learning_rate": 3.042105263157895e-06,
"loss": 0.0002,
"step": 422
},
{
"clip_ratio": 0.0,
"epoch": 0.057755324959038776,
"grad_norm": 0.042571090161800385,
"kl": 0.02841770788654685,
"learning_rate": 3.036842105263158e-06,
"loss": 0.0001,
"step": 423
},
{
"clip_ratio": 0.0,
"epoch": 0.05789186237028946,
"grad_norm": 0.042970895767211914,
"kl": 0.028437837143428624,
"learning_rate": 3.0315789473684215e-06,
"loss": -0.0001,
"step": 424
},
{
"clip_ratio": 0.0006481033633463085,
"completion_length": 119.5,
"epoch": 0.05802839978154014,
"grad_norm": 0.08428654819726944,
"kl": 0.03005171535187401,
"learning_rate": 3.0263157894736843e-06,
"loss": 0.0003,
"num_tokens": 1182569.0,
"reward": 0.6343749761581421,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.6343749761581421,
"step": 425
},
{
"clip_ratio": 0.00028153153834864497,
"epoch": 0.058164937192790825,
"grad_norm": 0.08224932104349136,
"kl": 0.029877902969019488,
"learning_rate": 3.0210526315789474e-06,
"loss": 0.0,
"step": 426
},
{
"clip_ratio": 0.0,
"epoch": 0.05830147460404151,
"grad_norm": 0.0772838145494461,
"kl": 0.02998991316417232,
"learning_rate": 3.015789473684211e-06,
"loss": -0.0003,
"step": 427
},
{
"clip_ratio": 0.00028153153834864497,
"epoch": 0.05843801201529219,
"grad_norm": 0.06520218402147293,
"kl": 0.029636650171596557,
"learning_rate": 3.0105263157894737e-06,
"loss": -0.0008,
"step": 428
},
{
"clip_ratio": 0.00034340660204179585,
"completion_length": 110.90625,
"epoch": 0.058574549426542874,
"grad_norm": 0.05254102498292923,
"kl": 0.02795352225075476,
"learning_rate": 3.0052631578947373e-06,
"loss": 0.0004,
"num_tokens": 1192970.0,
"reward": 0.859375,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.859375,
"step": 429
},
{
"clip_ratio": 0.0,
"epoch": 0.05871108683779355,
"grad_norm": 0.05203205719590187,
"kl": 0.027702660532668233,
"learning_rate": 3e-06,
"loss": 0.0003,
"step": 430
},
{
"clip_ratio": 0.00034340660204179585,
"epoch": 0.05884762424904424,
"grad_norm": 0.050078123807907104,
"kl": 0.027325164119247347,
"learning_rate": 2.9947368421052637e-06,
"loss": 0.0001,
"step": 431
},
{
"clip_ratio": 0.0,
"epoch": 0.05898416166029492,
"grad_norm": 0.04930827394127846,
"kl": 0.028029807755956426,
"learning_rate": 2.9894736842105264e-06,
"loss": -0.0001,
"step": 432
},
{
"clip_ratio": 0.0,
"completion_length": 111.625,
"epoch": 0.0591206990715456,
"grad_norm": 0.11645514518022537,
"kl": 0.029349218850256875,
"learning_rate": 2.9842105263157896e-06,
"loss": 0.0004,
"num_tokens": 1203310.0,
"reward": 0.606249988079071,
"reward_std": 0.2899519205093384,
"rewards/reward_fn": 0.606249988079071,
"step": 433
},
{
"clip_ratio": 0.0003522308688843623,
"epoch": 0.05925723648279629,
"grad_norm": 0.1155751571059227,
"kl": 0.029482927988283336,
"learning_rate": 2.9789473684210527e-06,
"loss": -0.0003,
"step": 434
},
{
"clip_ratio": 0.0015326489083236083,
"epoch": 0.05939377389404697,
"grad_norm": 0.1054697334766388,
"kl": 0.02898168022511527,
"learning_rate": 2.973684210526316e-06,
"loss": -0.0008,
"step": 435
},
{
"clip_ratio": 0.0028316913376329467,
"epoch": 0.05953031130529765,
"grad_norm": 0.08968142420053482,
"kl": 0.02963988418923691,
"learning_rate": 2.9684210526315795e-06,
"loss": -0.0016,
"step": 436
},
{
"clip_ratio": 0.00034131205757148564,
"completion_length": 124.125,
"epoch": 0.059666848716548336,
"grad_norm": 0.11992131173610687,
"kl": 0.02362085011554882,
"learning_rate": 2.9631578947368422e-06,
"loss": 0.0004,
"num_tokens": 1215018.0,
"reward": 0.6625000238418579,
"reward_std": 0.35490378737449646,
"rewards/reward_fn": 0.6625000238418579,
"step": 437
},
{
"clip_ratio": 0.0,
"epoch": 0.059803386127799014,
"grad_norm": 0.10817261785268784,
"kl": 0.023265416646609083,
"learning_rate": 2.957894736842106e-06,
"loss": -0.0002,
"step": 438
},
{
"clip_ratio": 0.00013297871919348836,
"epoch": 0.0599399235390497,
"grad_norm": 0.10226042568683624,
"kl": 0.023465301826945506,
"learning_rate": 2.9526315789473685e-06,
"loss": -0.0006,
"step": 439
},
{
"clip_ratio": 0.0010071903670905158,
"epoch": 0.060076460950300385,
"grad_norm": 0.09243166446685791,
"kl": 0.02359252143651247,
"learning_rate": 2.9473684210526317e-06,
"loss": -0.0013,
"step": 440
},
{
"clip_ratio": 0.00022007041843608022,
"completion_length": 105.8125,
"epoch": 0.060212998361551064,
"grad_norm": 0.09433529525995255,
"kl": 0.02786622042185627,
"learning_rate": 2.942105263157895e-06,
"loss": 0.0003,
"num_tokens": 1225400.0,
"reward": 0.71875,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.71875,
"step": 441
},
{
"clip_ratio": 0.0003289473825134337,
"epoch": 0.06034953577280175,
"grad_norm": 0.09359579533338547,
"kl": 0.02748560524196364,
"learning_rate": 2.936842105263158e-06,
"loss": 0.0002,
"step": 442
},
{
"clip_ratio": 0.0,
"epoch": 0.06048607318405243,
"grad_norm": 0.09082359075546265,
"kl": 0.027210222935536876,
"learning_rate": 2.931578947368421e-06,
"loss": -0.0006,
"step": 443
},
{
"clip_ratio": 0.00028153153834864497,
"epoch": 0.06062261059530311,
"grad_norm": 0.08561991155147552,
"kl": 0.02759760251501575,
"learning_rate": 2.9263157894736844e-06,
"loss": -0.0013,
"step": 444
},
{
"clip_ratio": 0.00017959770048037171,
"completion_length": 121.34375,
"epoch": 0.0607591480065538,
"grad_norm": 0.08825256675481796,
"kl": 0.023633092801901512,
"learning_rate": 2.921052631578948e-06,
"loss": 0.0003,
"num_tokens": 1236679.0,
"reward": 0.6624999642372131,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.6624999642372131,
"step": 445
},
{
"clip_ratio": 0.00039966811891645193,
"epoch": 0.060895685417804477,
"grad_norm": 0.08804938942193985,
"kl": 0.02338150296418462,
"learning_rate": 2.9157894736842107e-06,
"loss": -0.0001,
"step": 446
},
{
"clip_ratio": 0.0005587452324107289,
"epoch": 0.06103222282905516,
"grad_norm": 0.08598316460847855,
"kl": 0.023485250319936313,
"learning_rate": 2.9105263157894743e-06,
"loss": -0.0003,
"step": 447
},
{
"clip_ratio": 0.0005587452324107289,
"epoch": 0.06116876024030585,
"grad_norm": 0.08363504707813263,
"kl": 0.023482873002649285,
"learning_rate": 2.905263157894737e-06,
"loss": -0.0009,
"step": 448
},
{
"clip_ratio": 0.000234962411923334,
"completion_length": 128.09375,
"epoch": 0.061305297651556526,
"grad_norm": 0.09320642799139023,
"kl": 0.025599762244382873,
"learning_rate": 2.9e-06,
"loss": 0.0002,
"num_tokens": 1247894.0,
"reward": 0.746874988079071,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.746874988079071,
"step": 449
},
{
"clip_ratio": 0.000234962411923334,
"epoch": 0.06144183506280721,
"grad_norm": 0.0868094265460968,
"kl": 0.02552194581949152,
"learning_rate": 2.8947368421052634e-06,
"loss": -0.0001,
"step": 450
},
{
"clip_ratio": 0.000234962411923334,
"epoch": 0.06157837247405789,
"grad_norm": 0.07934384793043137,
"kl": 0.024943586031440645,
"learning_rate": 2.8894736842105265e-06,
"loss": -0.0005,
"step": 451
},
{
"clip_ratio": 0.000234962411923334,
"epoch": 0.061714909885308575,
"grad_norm": 0.07852542400360107,
"kl": 0.024750137235969305,
"learning_rate": 2.88421052631579e-06,
"loss": -0.0009,
"step": 452
},
{
"clip_ratio": 0.0010345236223656684,
"completion_length": 118.21875,
"epoch": 0.06185144729655926,
"grad_norm": 0.12858963012695312,
"kl": 0.02785053660045378,
"learning_rate": 2.878947368421053e-06,
"loss": 0.0006,
"num_tokens": 1258989.0,
"reward": 0.6062500476837158,
"reward_std": 0.40245187282562256,
"rewards/reward_fn": 0.6062500476837158,
"step": 453
},
{
"clip_ratio": 0.0012061969318892807,
"epoch": 0.06198798470780994,
"grad_norm": 0.12805882096290588,
"kl": 0.02756309215328656,
"learning_rate": 2.8736842105263164e-06,
"loss": 0.0001,
"step": 454
},
{
"clip_ratio": 0.0009005931788124144,
"epoch": 0.062124522119060624,
"grad_norm": 0.12524963915348053,
"kl": 0.027533066226169467,
"learning_rate": 2.868421052631579e-06,
"loss": -0.0012,
"step": 455
},
{
"clip_ratio": 0.0008774404122959822,
"epoch": 0.0622610595303113,
"grad_norm": 0.11410316824913025,
"kl": 0.028351856861263514,
"learning_rate": 2.8631578947368423e-06,
"loss": -0.002,
"step": 456
},
{
"clip_ratio": 0.00044964029802940786,
"completion_length": 119.75,
"epoch": 0.06239759694156199,
"grad_norm": 0.0884980857372284,
"kl": 0.02622422287822701,
"learning_rate": 2.8578947368421055e-06,
"loss": 0.0003,
"num_tokens": 1269833.0,
"reward": 0.690625011920929,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.690625011920929,
"step": 457
},
{
"clip_ratio": 0.0004271467769285664,
"epoch": 0.06253413435281267,
"grad_norm": 0.08802725374698639,
"kl": 0.0259568098699674,
"learning_rate": 2.8526315789473687e-06,
"loss": -0.0,
"step": 458
},
{
"clip_ratio": 0.0007370132370851934,
"epoch": 0.06267067176406335,
"grad_norm": 0.07317302376031876,
"kl": 0.0255898576870095,
"learning_rate": 2.847368421052632e-06,
"loss": -0.0004,
"step": 459
},
{
"clip_ratio": 0.0002281021879753098,
"epoch": 0.06280720917531403,
"grad_norm": 0.07119499146938324,
"kl": 0.025962556974263862,
"learning_rate": 2.842105263157895e-06,
"loss": -0.0009,
"step": 460
},
{
"clip_ratio": 0.0,
"completion_length": 104.9375,
"epoch": 0.06294374658656472,
"grad_norm": 0.07267936319112778,
"kl": 0.030646027327748016,
"learning_rate": 2.8368421052631586e-06,
"loss": 0.0002,
"num_tokens": 1280727.0,
"reward": 0.7750000357627869,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7750000357627869,
"step": 461
},
{
"clip_ratio": 0.0,
"epoch": 0.0630802839978154,
"grad_norm": 0.07068201154470444,
"kl": 0.030932883906643838,
"learning_rate": 2.8315789473684213e-06,
"loss": 0.0001,
"step": 462
},
{
"clip_ratio": 0.0,
"epoch": 0.06321682140906608,
"grad_norm": 0.06675128638744354,
"kl": 0.03135033437865786,
"learning_rate": 2.826315789473684e-06,
"loss": -0.0003,
"step": 463
},
{
"clip_ratio": 0.0,
"epoch": 0.06335335882031677,
"grad_norm": 0.060258980840444565,
"kl": 0.031988496135454625,
"learning_rate": 2.8210526315789476e-06,
"loss": -0.0004,
"step": 464
},
{
"clip_ratio": 0.0005117313994560391,
"completion_length": 122.84375,
"epoch": 0.06348989623156745,
"grad_norm": 0.07553315907716751,
"kl": 0.03090066317236051,
"learning_rate": 2.815789473684211e-06,
"loss": 0.0003,
"num_tokens": 1291590.0,
"reward": 0.8031250238418579,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.8031250238418579,
"step": 465
},
{
"clip_ratio": 0.0006195175519678742,
"epoch": 0.06362643364281813,
"grad_norm": 0.07488815486431122,
"kl": 0.031175631389487535,
"learning_rate": 2.810526315789474e-06,
"loss": 0.0002,
"step": 466
},
{
"clip_ratio": 0.00039545909385196865,
"epoch": 0.06376297105406882,
"grad_norm": 0.07623933255672455,
"kl": 0.030218343308661133,
"learning_rate": 2.805263157894737e-06,
"loss": -0.0003,
"step": 467
},
{
"clip_ratio": 0.00041963320109061897,
"epoch": 0.0638995084653195,
"grad_norm": 0.06566479057073593,
"kl": 0.030176448373822495,
"learning_rate": 2.8000000000000003e-06,
"loss": -0.0006,
"step": 468
},
{
"clip_ratio": 0.000202922077733092,
"completion_length": 143.6875,
"epoch": 0.06403604587657018,
"grad_norm": 0.07517211139202118,
"kl": 0.026966167468344793,
"learning_rate": 2.7947368421052635e-06,
"loss": 0.0001,
"num_tokens": 1303640.0,
"reward": 0.6906249523162842,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.6906249523162842,
"step": 469
},
{
"clip_ratio": 0.0011654012050712481,
"epoch": 0.06417258328782087,
"grad_norm": 0.07574381679296494,
"kl": 0.026625617261743173,
"learning_rate": 2.789473684210526e-06,
"loss": -0.0001,
"step": 470
},
{
"clip_ratio": 0.0,
"epoch": 0.06430912069907155,
"grad_norm": 0.06845681369304657,
"kl": 0.027047655457863584,
"learning_rate": 2.7842105263157898e-06,
"loss": -0.0004,
"step": 471
},
{
"clip_ratio": 0.0004459502233657986,
"epoch": 0.06444565811032223,
"grad_norm": 0.06472209841012955,
"kl": 0.02748362798593007,
"learning_rate": 2.7789473684210525e-06,
"loss": -0.0007,
"step": 472
},
{
"clip_ratio": 0.00017265194037463516,
"completion_length": 100.0,
"epoch": 0.0645821955215729,
"grad_norm": 0.08828121423721313,
"kl": 0.029740739322733134,
"learning_rate": 2.773684210526316e-06,
"loss": 0.0004,
"num_tokens": 1314068.0,
"reward": 0.859375,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.859375,
"step": 473
},
{
"clip_ratio": 0.0,
"epoch": 0.0647187329328236,
"grad_norm": 0.08898042142391205,
"kl": 0.029690030263736844,
"learning_rate": 2.7684210526315793e-06,
"loss": 0.0001,
"step": 474
},
{
"clip_ratio": 0.0,
"epoch": 0.06485527034407428,
"grad_norm": 0.08371194452047348,
"kl": 0.030416715890169144,
"learning_rate": 2.7631578947368424e-06,
"loss": -0.0003,
"step": 475
},
{
"clip_ratio": 0.0003927223588107154,
"epoch": 0.06499180775532495,
"grad_norm": 0.08132834732532501,
"kl": 0.03134842653525993,
"learning_rate": 2.7578947368421056e-06,
"loss": -0.0009,
"step": 476
},
{
"completion_length": 111.34375,
"epoch": 0.06512834516657565,
"grad_norm": 0.0,
"learning_rate": 2.7526315789473683e-06,
"loss": 0.0,
"num_tokens": 1325395.0,
"reward": 0.887499988079071,
"reward_std": 0.0,
"rewards/reward_fn": 0.887499988079071,
"step": 477
},
{
"epoch": 0.06526488257782632,
"grad_norm": 0.0,
"learning_rate": 2.747368421052632e-06,
"loss": 0.0,
"step": 478
},
{
"epoch": 0.065401419989077,
"grad_norm": 0.0,
"learning_rate": 2.7421052631578947e-06,
"loss": 0.0,
"step": 479
},
{
"epoch": 0.0655379574003277,
"grad_norm": 0.0,
"learning_rate": 2.7368421052631583e-06,
"loss": 0.0,
"step": 480
},
{
"clip_ratio": 0.0008182729070540518,
"completion_length": 122.4375,
"epoch": 0.06567449481157837,
"grad_norm": 0.1075565367937088,
"kl": 0.03270941000664607,
"learning_rate": 2.7315789473684214e-06,
"loss": 0.0004,
"num_tokens": 1336833.0,
"reward": 0.690625011920929,
"reward_std": 0.2511056959629059,
"rewards/reward_fn": 0.690625011920929,
"step": 481
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.06581103222282905,
"grad_norm": 0.10678515583276749,
"kl": 0.03262783802347258,
"learning_rate": 2.7263157894736846e-06,
"loss": 0.0003,
"step": 482
},
{
"clip_ratio": 0.0,
"epoch": 0.06594756963407974,
"grad_norm": 0.10226035863161087,
"kl": 0.03304731094976887,
"learning_rate": 2.7210526315789478e-06,
"loss": -0.0003,
"step": 483
},
{
"clip_ratio": 0.00023854961909819394,
"epoch": 0.06608410704533042,
"grad_norm": 0.09197822958230972,
"kl": 0.03369238827144727,
"learning_rate": 2.7157894736842105e-06,
"loss": -0.001,
"step": 484
},
{
"clip_ratio": 0.00024801588733680546,
"completion_length": 105.90625,
"epoch": 0.0662206444565811,
"grad_norm": 0.10018602758646011,
"kl": 0.03327567869564518,
"learning_rate": 2.710526315789474e-06,
"loss": 0.0004,
"num_tokens": 1346950.0,
"reward": 0.8031250238418579,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.8031250238418579,
"step": 485
},
{
"clip_ratio": 0.0,
"epoch": 0.06635718186783178,
"grad_norm": 0.09925264865159988,
"kl": 0.032918925397098064,
"learning_rate": 2.705263157894737e-06,
"loss": 0.0003,
"step": 486
},
{
"clip_ratio": 0.0005063201388111338,
"epoch": 0.06649371927908247,
"grad_norm": 0.0975351333618164,
"kl": 0.03307101898826659,
"learning_rate": 2.7000000000000004e-06,
"loss": -0.0003,
"step": 487
},
{
"clip_ratio": 0.0,
"epoch": 0.06663025669033315,
"grad_norm": 0.0953407809138298,
"kl": 0.03223849239293486,
"learning_rate": 2.694736842105263e-06,
"loss": -0.001,
"step": 488
},
{
"clip_ratio": 0.0003289473825134337,
"completion_length": 120.3125,
"epoch": 0.06676679410158383,
"grad_norm": 0.09660880267620087,
"kl": 0.03435020908364095,
"learning_rate": 2.6894736842105267e-06,
"loss": 0.0004,
"num_tokens": 1357580.0,
"reward": 0.6343749761581421,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.6343749761581421,
"step": 489
},
{
"clip_ratio": 0.0,
"epoch": 0.06690333151283452,
"grad_norm": 0.09672436863183975,
"kl": 0.03443722132942639,
"learning_rate": 2.68421052631579e-06,
"loss": 0.0002,
"step": 490
},
{
"clip_ratio": 0.0,
"epoch": 0.0670398689240852,
"grad_norm": 0.0930391252040863,
"kl": 0.0339292844873853,
"learning_rate": 2.6789473684210526e-06,
"loss": -0.0002,
"step": 491
},
{
"clip_ratio": 0.0,
"epoch": 0.06717640633533588,
"grad_norm": 0.08958112448453903,
"kl": 0.03364733717171475,
"learning_rate": 2.6736842105263162e-06,
"loss": -0.0008,
"step": 492
},
{
"clip_ratio": 0.0,
"completion_length": 112.125,
"epoch": 0.06731294374658657,
"grad_norm": 0.05487014725804329,
"kl": 0.0318443511496298,
"learning_rate": 2.668421052631579e-06,
"loss": 0.0003,
"num_tokens": 1368584.0,
"reward": 0.690625011920929,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.690625011920929,
"step": 493
},
{
"clip_ratio": 0.0,
"epoch": 0.06744948115783725,
"grad_norm": 0.054498445242643356,
"kl": 0.0327269172121305,
"learning_rate": 2.6631578947368426e-06,
"loss": 0.0001,
"step": 494
},
{
"clip_ratio": 0.0,
"epoch": 0.06758601856908793,
"grad_norm": 0.053584616631269455,
"kl": 0.03137458971468732,
"learning_rate": 2.6578947368421053e-06,
"loss": -0.0001,
"step": 495
},
{
"clip_ratio": 0.0,
"epoch": 0.06772255598033862,
"grad_norm": 0.05226173624396324,
"kl": 0.03136958571849391,
"learning_rate": 2.652631578947369e-06,
"loss": -0.0002,
"step": 496
},
{
"clip_ratio": 0.0,
"completion_length": 108.84375,
"epoch": 0.0678590933915893,
"grad_norm": 0.10085256397724152,
"kl": 0.028638561692787334,
"learning_rate": 2.6473684210526316e-06,
"loss": 0.0002,
"num_tokens": 1379079.0,
"reward": 0.8312499523162842,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.8312499523162842,
"step": 497
},
{
"clip_ratio": 0.000477544468594715,
"epoch": 0.06799563080283998,
"grad_norm": 0.09922110289335251,
"kl": 0.028383127588313073,
"learning_rate": 2.6421052631578948e-06,
"loss": -0.0001,
"step": 498
},
{
"clip_ratio": 0.0,
"epoch": 0.06813216821409065,
"grad_norm": 0.09748240560293198,
"kl": 0.028070454631233588,
"learning_rate": 2.6368421052631584e-06,
"loss": -0.0007,
"step": 499
},
{
"clip_ratio": 0.00023148147738538682,
"epoch": 0.06826870562534135,
"grad_norm": 0.08522222936153412,
"kl": 0.027039629960199818,
"learning_rate": 2.631578947368421e-06,
"loss": -0.0012,
"step": 500
},
{
"clip_ratio": 0.0,
"completion_length": 121.59375,
"epoch": 0.06840524303659203,
"grad_norm": 0.05568603426218033,
"kl": 0.029449922149069607,
"learning_rate": 2.6263157894736847e-06,
"loss": 0.0003,
"num_tokens": 1389594.0,
"reward": 0.8875000476837158,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.8875000476837158,
"step": 501
},
{
"clip_ratio": 0.0,
"epoch": 0.0685417804478427,
"grad_norm": 0.05571011081337929,
"kl": 0.029838646500138566,
"learning_rate": 2.6210526315789474e-06,
"loss": 0.0002,
"step": 502
},
{
"clip_ratio": 0.00016622339899186045,
"epoch": 0.0686783178590934,
"grad_norm": 0.055335305631160736,
"kl": 0.028605365252587944,
"learning_rate": 2.615789473684211e-06,
"loss": 0.0001,
"step": 503
},
{
"clip_ratio": 0.0001806358341127634,
"epoch": 0.06881485527034407,
"grad_norm": 0.053467657417058945,
"kl": 0.02818925876636058,
"learning_rate": 2.6105263157894738e-06,
"loss": -0.0001,
"step": 504
},
{
"clip_ratio": 0.00041107917786575854,
"completion_length": 112.375,
"epoch": 0.06895139268159475,
"grad_norm": 0.07417155802249908,
"kl": 0.023815288412151858,
"learning_rate": 2.605263157894737e-06,
"loss": 0.0004,
"num_tokens": 1399702.0,
"reward": 0.859375,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.859375,
"step": 505
},
{
"clip_ratio": 0.0,
"epoch": 0.06908793009284545,
"grad_norm": 0.07561016082763672,
"kl": 0.02323581191012636,
"learning_rate": 2.6e-06,
"loss": 0.0002,
"step": 506
},
{
"clip_ratio": 0.0004826326767215505,
"epoch": 0.06922446750409612,
"grad_norm": 0.0658431127667427,
"kl": 0.02391452860319987,
"learning_rate": 2.5947368421052633e-06,
"loss": -0.0002,
"step": 507
},
{
"clip_ratio": 0.00017959770048037171,
"epoch": 0.0693610049153468,
"grad_norm": 0.06122962757945061,
"kl": 0.023273998143849894,
"learning_rate": 2.589473684210527e-06,
"loss": -0.0004,
"step": 508
},
{
"clip_ratio": 0.0,
"completion_length": 111.09375,
"epoch": 0.0694975423265975,
"grad_norm": 0.08124542981386185,
"kl": 0.026170960336457938,
"learning_rate": 2.5842105263157896e-06,
"loss": 0.0002,
"num_tokens": 1410113.0,
"reward": 0.6625000238418579,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.6625000238418579,
"step": 509
},
{
"clip_ratio": 0.0004949534049956128,
"epoch": 0.06963407973784817,
"grad_norm": 0.07992769777774811,
"kl": 0.026557496574241668,
"learning_rate": 2.578947368421053e-06,
"loss": 0.0,
"step": 510
},
{
"clip_ratio": 0.00027173911803402007,
"epoch": 0.06977061714909885,
"grad_norm": 0.0765228420495987,
"kl": 0.02642540223314427,
"learning_rate": 2.573684210526316e-06,
"loss": -0.0005,
"step": 511
},
{
"clip_ratio": 0.00027173911803402007,
"epoch": 0.06990715456034953,
"grad_norm": 0.07589668780565262,
"kl": 0.026321951998397708,
"learning_rate": 2.568421052631579e-06,
"loss": -0.0008,
"step": 512
},
{
"clip_ratio": 0.0,
"completion_length": 125.25,
"epoch": 0.07004369197160022,
"grad_norm": 0.06559047847986221,
"kl": 0.026270317437592894,
"learning_rate": 2.5631578947368422e-06,
"loss": 0.0003,
"num_tokens": 1421669.0,
"reward": 0.746874988079071,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.746874988079071,
"step": 513
},
{
"clip_ratio": 0.0,
"epoch": 0.0701802293828509,
"grad_norm": 0.06494513899087906,
"kl": 0.026335061265854165,
"learning_rate": 2.5578947368421054e-06,
"loss": 0.0002,
"step": 514
},
{
"clip_ratio": 0.00020695364219136536,
"epoch": 0.07031676679410158,
"grad_norm": 0.06433810293674469,
"kl": 0.027359777392121032,
"learning_rate": 2.552631578947369e-06,
"loss": -0.0001,
"step": 515
},
{
"clip_ratio": 0.00020695364219136536,
"epoch": 0.07045330420535227,
"grad_norm": 0.06409961730241776,
"kl": 0.026299011806258932,
"learning_rate": 2.5473684210526317e-06,
"loss": -0.0002,
"step": 516
},
{
"clip_ratio": 0.0007239816040964797,
"completion_length": 146.0625,
"epoch": 0.07058984161660295,
"grad_norm": 0.10985471308231354,
"kl": 0.028434559819288552,
"learning_rate": 2.5421052631578953e-06,
"loss": 0.0,
"num_tokens": 1433875.0,
"reward": 0.578125,
"reward_std": 0.29865381121635437,
"rewards/reward_fn": 0.578125,
"step": 517
},
{
"clip_ratio": 0.0003907657810486853,
"epoch": 0.07072637902785363,
"grad_norm": 0.08845436573028564,
"kl": 0.029101567299221642,
"learning_rate": 2.536842105263158e-06,
"loss": -0.0001,
"step": 518
},
{
"clip_ratio": 0.0006556590233230963,
"epoch": 0.07086291643910432,
"grad_norm": 0.0867236852645874,
"kl": 0.028989310667384416,
"learning_rate": 2.5315789473684212e-06,
"loss": -0.0004,
"step": 519
},
{
"clip_ratio": 0.0002281021879753098,
"epoch": 0.070999453850355,
"grad_norm": 0.08522820472717285,
"kl": 0.029066309274639934,
"learning_rate": 2.5263157894736844e-06,
"loss": -0.001,
"step": 520
},
{
"clip_ratio": 0.0005073317588539794,
"completion_length": 137.53125,
"epoch": 0.07113599126160568,
"grad_norm": 0.08292447030544281,
"kl": 0.02251457070815377,
"learning_rate": 2.5210526315789475e-06,
"loss": 0.0005,
"num_tokens": 1444744.0,
"reward": 0.690625011920929,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.690625011920929,
"step": 521
},
{
"clip_ratio": 0.00021258502965793014,
"epoch": 0.07127252867285637,
"grad_norm": 0.0836159959435463,
"kl": 0.022670210397336632,
"learning_rate": 2.5157894736842107e-06,
"loss": -0.0001,
"step": 522
},
{
"clip_ratio": 0.0,
"epoch": 0.07140906608410705,
"grad_norm": 0.08502236008644104,
"kl": 0.023073405434843153,
"learning_rate": 2.510526315789474e-06,
"loss": -0.0004,
"step": 523
},
{
"clip_ratio": 0.0,
"epoch": 0.07154560349535773,
"grad_norm": 0.08420410007238388,
"kl": 0.02333970883046277,
"learning_rate": 2.5052631578947375e-06,
"loss": -0.0008,
"step": 524
},
{
"clip_ratio": 0.0,
"completion_length": 142.375,
"epoch": 0.0716821409066084,
"grad_norm": 0.06113371253013611,
"kl": 0.028267830901313573,
"learning_rate": 2.5e-06,
"loss": 0.0002,
"num_tokens": 1456204.0,
"reward": 0.5218750238418579,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.5218750238418579,
"step": 525
},
{
"clip_ratio": 0.0,
"epoch": 0.0718186783178591,
"grad_norm": 0.058986373245716095,
"kl": 0.029190031375037506,
"learning_rate": 2.4947368421052634e-06,
"loss": 0.0001,
"step": 526
},
{
"clip_ratio": 0.00019531250291038305,
"epoch": 0.07195521572910978,
"grad_norm": 0.056226328015327454,
"kl": 0.029348920157644898,
"learning_rate": 2.4894736842105265e-06,
"loss": -0.0001,
"step": 527
},
{
"clip_ratio": 0.0003004807804245502,
"epoch": 0.07209175314036045,
"grad_norm": 0.06096241623163223,
"kl": 0.029138524609152228,
"learning_rate": 2.4842105263157897e-06,
"loss": -0.0002,
"step": 528
},
{
"clip_ratio": 0.0,
"completion_length": 140.0,
"epoch": 0.07222829055161115,
"grad_norm": 0.0643433928489685,
"kl": 0.024482485474436544,
"learning_rate": 2.478947368421053e-06,
"loss": 0.0002,
"num_tokens": 1468144.0,
"reward": 0.71875,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.71875,
"step": 529
},
{
"clip_ratio": 0.00013185653369873762,
"epoch": 0.07236482796286182,
"grad_norm": 0.06284752488136292,
"kl": 0.024148478420102037,
"learning_rate": 2.473684210526316e-06,
"loss": 0.0001,
"step": 530
},
{
"clip_ratio": 0.0,
"epoch": 0.0725013653741125,
"grad_norm": 0.055365268141031265,
"kl": 0.02333252050448209,
"learning_rate": 2.468421052631579e-06,
"loss": 0.0,
"step": 531
},
{
"clip_ratio": 0.0004308253701310605,
"epoch": 0.0726379027853632,
"grad_norm": 0.046432189643383026,
"kl": 0.023968403591425158,
"learning_rate": 2.4631578947368424e-06,
"loss": -0.0004,
"step": 532
},
{
"clip_ratio": 0.00023854961909819394,
"completion_length": 113.0,
"epoch": 0.07277444019661387,
"grad_norm": 0.10641506314277649,
"kl": 0.028071990760508925,
"learning_rate": 2.4578947368421055e-06,
"loss": 0.0001,
"num_tokens": 1479376.0,
"reward": 0.6625000238418579,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.6625000238418579,
"step": 533
},
{
"clip_ratio": 0.0004978458891855553,
"epoch": 0.07291097760786455,
"grad_norm": 0.1005944311618805,
"kl": 0.026655245223082602,
"learning_rate": 2.4526315789473687e-06,
"loss": -0.0002,
"step": 534
},
{
"clip_ratio": 0.00044969827285967767,
"epoch": 0.07304751501911524,
"grad_norm": 0.10238411277532578,
"kl": 0.02741476362280082,
"learning_rate": 2.447368421052632e-06,
"loss": -0.0003,
"step": 535
},
{
"clip_ratio": 0.0004633697681128979,
"epoch": 0.07318405243036592,
"grad_norm": 0.09010997414588928,
"kl": 0.027337706153048202,
"learning_rate": 2.442105263157895e-06,
"loss": -0.001,
"step": 536
},
{
"clip_ratio": 0.0007482993096346036,
"completion_length": 141.15625,
"epoch": 0.0733205898416166,
"grad_norm": 0.05969298258423805,
"kl": 0.02480026413104497,
"learning_rate": 2.436842105263158e-06,
"loss": 0.0002,
"num_tokens": 1491869.0,
"reward": 0.6625000238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.6625000238418579,
"step": 537
},
{
"clip_ratio": 0.0005413736435002647,
"epoch": 0.07345712725286728,
"grad_norm": 0.06196073070168495,
"kl": 0.024416016967734322,
"learning_rate": 2.4315789473684213e-06,
"loss": 0.0,
"step": 538
},
{
"clip_ratio": 0.0009388480830239132,
"epoch": 0.07359366466411797,
"grad_norm": 0.05955655127763748,
"kl": 0.024354956054594368,
"learning_rate": 2.4263157894736845e-06,
"loss": -0.0001,
"step": 539
},
{
"clip_ratio": 0.00010557432688074186,
"epoch": 0.07373020207536865,
"grad_norm": 0.05420181155204773,
"kl": 0.02480731243849732,
"learning_rate": 2.4210526315789477e-06,
"loss": -0.0004,
"step": 540
},
{
"clip_ratio": 0.0003166591050103307,
"completion_length": 149.0,
"epoch": 0.07386673948661933,
"grad_norm": 0.0756562277674675,
"kl": 0.024679992871824652,
"learning_rate": 2.415789473684211e-06,
"loss": 0.0,
"num_tokens": 1504213.0,
"reward": 0.746874988079071,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.746874988079071,
"step": 541
},
{
"clip_ratio": 0.0001755617995513603,
"epoch": 0.07400327689787002,
"grad_norm": 0.07468439638614655,
"kl": 0.024849631765391678,
"learning_rate": 2.410526315789474e-06,
"loss": -0.0001,
"step": 542
},
{
"clip_ratio": 0.0004983036633348092,
"epoch": 0.0741398143091207,
"grad_norm": 0.07378986477851868,
"kl": 0.025112065923167393,
"learning_rate": 2.4052631578947367e-06,
"loss": -0.0003,
"step": 543
},
{
"clip_ratio": 0.0004942677624057978,
"epoch": 0.07427635172037138,
"grad_norm": 0.07501641660928726,
"kl": 0.025077814352698624,
"learning_rate": 2.4000000000000003e-06,
"loss": -0.0006,
"step": 544
},
{
"clip_ratio": 0.0005071907507954165,
"completion_length": 122.625,
"epoch": 0.07441288913162207,
"grad_norm": 0.07435806840658188,
"kl": 0.02418363041942939,
"learning_rate": 2.3947368421052635e-06,
"loss": 0.0002,
"num_tokens": 1515297.0,
"reward": 0.7468750476837158,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.7468750476837158,
"step": 545
},
{
"clip_ratio": 0.0008165966864908114,
"epoch": 0.07454942654287275,
"grad_norm": 0.07489731162786484,
"kl": 0.025440962228458375,
"learning_rate": 2.3894736842105266e-06,
"loss": 0.0001,
"step": 546
},
{
"clip_ratio": 0.0005071907507954165,
"epoch": 0.07468596395412343,
"grad_norm": 0.06941622495651245,
"kl": 0.025200976844644174,
"learning_rate": 2.38421052631579e-06,
"loss": -0.0002,
"step": 547
},
{
"clip_ratio": 0.0003094059356953949,
"epoch": 0.07482250136537412,
"grad_norm": 0.06859351694583893,
"kl": 0.025588049815269187,
"learning_rate": 2.378947368421053e-06,
"loss": -0.0006,
"step": 548
},
{
"clip_ratio": 0.0,
"completion_length": 135.15625,
"epoch": 0.0749590387766248,
"grad_norm": 0.06504392623901367,
"kl": 0.025377440004376695,
"learning_rate": 2.373684210526316e-06,
"loss": 0.0002,
"num_tokens": 1526610.0,
"reward": 0.49375003576278687,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.49375003576278687,
"step": 549
},
{
"clip_ratio": 0.0004585849674185738,
"epoch": 0.07509557618787548,
"grad_norm": 0.06409519910812378,
"kl": 0.025559124507708475,
"learning_rate": 2.368421052631579e-06,
"loss": 0.0002,
"step": 550
},
{
"clip_ratio": 0.00020833333837799728,
"epoch": 0.07523211359912615,
"grad_norm": 0.06408659368753433,
"kl": 0.025702771148644388,
"learning_rate": 2.363157894736842e-06,
"loss": -0.0,
"step": 551
},
{
"clip_ratio": 0.0006567885575350374,
"epoch": 0.07536865101037685,
"grad_norm": 0.06450217217206955,
"kl": 0.025717437063576654,
"learning_rate": 2.357894736842105e-06,
"loss": -0.0004,
"step": 552
},
{
"clip_ratio": 0.000879274244653061,
"completion_length": 136.71875,
"epoch": 0.07550518842162753,
"grad_norm": 0.1316654086112976,
"kl": 0.029629670636495575,
"learning_rate": 2.352631578947369e-06,
"loss": 0.0003,
"num_tokens": 1538437.0,
"reward": 0.625,
"reward_std": 0.4086301922798157,
"rewards/reward_fn": 0.625,
"step": 553
},
{
"clip_ratio": 0.000472686137072742,
"epoch": 0.0756417258328782,
"grad_norm": 0.1313183605670929,
"kl": 0.029478842378011905,
"learning_rate": 2.347368421052632e-06,
"loss": -0.0003,
"step": 554
},
{
"clip_ratio": 0.0,
"epoch": 0.0757782632441289,
"grad_norm": 0.12120455503463745,
"kl": 0.029763573867967352,
"learning_rate": 2.342105263157895e-06,
"loss": -0.0009,
"step": 555
},
{
"clip_ratio": 0.00015703517419751734,
"epoch": 0.07591480065537957,
"grad_norm": 0.1141739934682846,
"kl": 0.030053666734602302,
"learning_rate": 2.3368421052631583e-06,
"loss": -0.0016,
"step": 556
},
{
"clip_ratio": 0.0008116767785395496,
"completion_length": 157.625,
"epoch": 0.07605133806663025,
"grad_norm": 0.08487264066934586,
"kl": 0.023374435782898217,
"learning_rate": 2.331578947368421e-06,
"loss": 0.0003,
"num_tokens": 1551185.0,
"reward": 0.746874988079071,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.746874988079071,
"step": 557
},
{
"clip_ratio": 0.0012086032365914434,
"epoch": 0.07618787547788095,
"grad_norm": 0.0859953910112381,
"kl": 0.02305353432893753,
"learning_rate": 2.326315789473684e-06,
"loss": -0.0001,
"step": 558
},
{
"clip_ratio": 0.0003681144007714465,
"epoch": 0.07632441288913162,
"grad_norm": 0.08386844396591187,
"kl": 0.023537778324680403,
"learning_rate": 2.3210526315789473e-06,
"loss": -0.0003,
"step": 559
},
{
"clip_ratio": 0.0010179669770877808,
"epoch": 0.0764609503003823,
"grad_norm": 0.0760241448879242,
"kl": 0.023646087502129376,
"learning_rate": 2.3157894736842105e-06,
"loss": -0.0008,
"step": 560
},
{
"clip_ratio": 0.0006391926144715399,
"completion_length": 139.71875,
"epoch": 0.07659748771163298,
"grad_norm": 0.04080972447991371,
"kl": 0.022678025299683213,
"learning_rate": 2.310526315789474e-06,
"loss": 0.0003,
"num_tokens": 1562616.0,
"reward": 0.9125000238418579,
"reward_std": 0.05863019451498985,
"rewards/reward_fn": 0.9125000238418579,
"step": 561
},
{
"clip_ratio": 0.0006391926144715399,
"epoch": 0.07673402512288367,
"grad_norm": 0.039302002638578415,
"kl": 0.022627048514550552,
"learning_rate": 2.3052631578947373e-06,
"loss": 0.0003,
"step": 562
},
{
"clip_ratio": 0.0005716463201679289,
"epoch": 0.07687056253413435,
"grad_norm": 0.03550795093178749,
"kl": 0.02283687226008624,
"learning_rate": 2.3000000000000004e-06,
"loss": 0.0002,
"step": 563
},
{
"clip_ratio": 0.0003576610761228949,
"epoch": 0.07700709994538503,
"grad_norm": 0.035457585006952286,
"kl": 0.02243449864909053,
"learning_rate": 2.294736842105263e-06,
"loss": 0.0002,
"step": 564
},
{
"clip_ratio": 0.00026483050896786153,
"completion_length": 136.28125,
"epoch": 0.07714363735663572,
"grad_norm": 0.07386517524719238,
"kl": 0.024913390225265175,
"learning_rate": 2.2894736842105263e-06,
"loss": 0.0003,
"num_tokens": 1573761.0,
"reward": 0.6906249523162842,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.6906249523162842,
"step": 565
},
{
"clip_ratio": 0.0,
"epoch": 0.0772801747678864,
"grad_norm": 0.07367141544818878,
"kl": 0.024486958689521998,
"learning_rate": 2.2842105263157895e-06,
"loss": 0.0001,
"step": 566
},
{
"clip_ratio": 0.0,
"epoch": 0.07741671217913708,
"grad_norm": 0.07088012993335724,
"kl": 0.024814803357003257,
"learning_rate": 2.2789473684210527e-06,
"loss": -0.0002,
"step": 567
},
{
"clip_ratio": 0.0,
"epoch": 0.07755324959038777,
"grad_norm": 0.07038354128599167,
"kl": 0.02420603678910993,
"learning_rate": 2.273684210526316e-06,
"loss": -0.0004,
"step": 568
},
{
"clip_ratio": 0.0006139783363323659,
"completion_length": 137.46875,
"epoch": 0.07768978700163845,
"grad_norm": 0.09878756105899811,
"kl": 0.03216486514429562,
"learning_rate": 2.268421052631579e-06,
"loss": 0.0002,
"num_tokens": 1585816.0,
"reward": 0.7468750476837158,
"reward_std": 0.2511056959629059,
"rewards/reward_fn": 0.7468750476837158,
"step": 569
},
{
"clip_ratio": 0.0009651019354350865,
"epoch": 0.07782632441288913,
"grad_norm": 0.09815220534801483,
"kl": 0.032273774879286066,
"learning_rate": 2.2631578947368426e-06,
"loss": -0.0,
"step": 570
},
{
"clip_ratio": 0.0011762505891965702,
"epoch": 0.07796286182413982,
"grad_norm": 0.09831620007753372,
"kl": 0.03218546602874994,
"learning_rate": 2.2578947368421057e-06,
"loss": -0.0005,
"step": 571
},
{
"clip_ratio": 0.0012266866688150913,
"epoch": 0.0780993992353905,
"grad_norm": 0.0923735499382019,
"kl": 0.032335673458874226,
"learning_rate": 2.2526315789473685e-06,
"loss": -0.0007,
"step": 572
},
{
"clip_ratio": 0.0005346590478438884,
"completion_length": 128.40625,
"epoch": 0.07823593664664118,
"grad_norm": 0.07317294925451279,
"kl": 0.031242430064594373,
"learning_rate": 2.2473684210526316e-06,
"loss": 0.0003,
"num_tokens": 1597009.0,
"reward": 0.9156249761581421,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.9156249761581421,
"step": 573
},
{
"clip_ratio": 0.0001516990305390209,
"epoch": 0.07837247405789186,
"grad_norm": 0.0728185847401619,
"kl": 0.03100292361341417,
"learning_rate": 2.242105263157895e-06,
"loss": 0.0,
"step": 574
},
{
"clip_ratio": 0.0,
"epoch": 0.07850901146914255,
"grad_norm": 0.07220152020454407,
"kl": 0.03159632673487067,
"learning_rate": 2.236842105263158e-06,
"loss": -0.0002,
"step": 575
},
{
"clip_ratio": 0.0003676470660138875,
"epoch": 0.07864554888039323,
"grad_norm": 0.0730409100651741,
"kl": 0.03174605511594564,
"learning_rate": 2.231578947368421e-06,
"loss": -0.0004,
"step": 576
},
{
"clip_ratio": 0.0003221649385523051,
"completion_length": 134.53125,
"epoch": 0.0787820862916439,
"grad_norm": 0.08895674347877502,
"kl": 0.027897415682673454,
"learning_rate": 2.2263157894736843e-06,
"loss": 0.0004,
"num_tokens": 1608962.0,
"reward": 0.578125,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.578125,
"step": 577
},
{
"clip_ratio": 0.0,
"epoch": 0.0789186237028946,
"grad_norm": 0.0873054563999176,
"kl": 0.027481836776132695,
"learning_rate": 2.221052631578948e-06,
"loss": 0.0001,
"step": 578
},
{
"clip_ratio": 0.0005704920913558453,
"epoch": 0.07905516111414528,
"grad_norm": 0.1051458939909935,
"kl": 0.0269019435509108,
"learning_rate": 2.2157894736842106e-06,
"loss": -0.0002,
"step": 579
},
{
"clip_ratio": 0.0,
"epoch": 0.07919169852539595,
"grad_norm": 0.08494027704000473,
"kl": 0.026989290417986922,
"learning_rate": 2.2105263157894738e-06,
"loss": -0.0007,
"step": 580
},
{
"clip_ratio": 0.0010808736260514706,
"completion_length": 147.8125,
"epoch": 0.07932823593664665,
"grad_norm": 0.08235741406679153,
"kl": 0.025487731574685313,
"learning_rate": 2.205263157894737e-06,
"loss": 0.0005,
"num_tokens": 1621644.0,
"reward": 0.7468750476837158,
"reward_std": 0.2337018847465515,
"rewards/reward_fn": 0.7468750476837158,
"step": 581
},
{
"clip_ratio": 0.000671143236104399,
"epoch": 0.07946477334789732,
"grad_norm": 0.08296383172273636,
"kl": 0.02604247519047931,
"learning_rate": 2.2e-06,
"loss": 0.0002,
"step": 582
},
{
"clip_ratio": 0.00048515741946175694,
"epoch": 0.079601310759148,
"grad_norm": 0.08231493830680847,
"kl": 0.025760373420780525,
"learning_rate": 2.1947368421052633e-06,
"loss": -0.0001,
"step": 583
},
{
"clip_ratio": 0.00028742906579282135,
"epoch": 0.0797378481703987,
"grad_norm": 0.08307528495788574,
"kl": 0.026076595226186328,
"learning_rate": 2.1894736842105264e-06,
"loss": -0.0005,
"step": 584
},
{
"clip_ratio": 0.00041828946268651634,
"completion_length": 152.0625,
"epoch": 0.07987438558164937,
"grad_norm": 0.07609320431947708,
"kl": 0.027080167375970632,
"learning_rate": 2.1842105263157896e-06,
"loss": 0.0002,
"num_tokens": 1633538.0,
"reward": 0.6343749761581421,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.6343749761581421,
"step": 585
},
{
"clip_ratio": 0.00020424836839083582,
"epoch": 0.08001092299290005,
"grad_norm": 0.07597316056489944,
"kl": 0.027335600112564862,
"learning_rate": 2.1789473684210528e-06,
"loss": 0.0001,
"step": 586
},
{
"clip_ratio": 0.00016711230273358524,
"epoch": 0.08014746040415073,
"grad_norm": 0.0741892158985138,
"kl": 0.027281122165732086,
"learning_rate": 2.173684210526316e-06,
"loss": -0.0001,
"step": 587
},
{
"clip_ratio": 0.000540279594133608,
"epoch": 0.08028399781540142,
"grad_norm": 0.0735078901052475,
"kl": 0.027697552199242637,
"learning_rate": 2.168421052631579e-06,
"loss": -0.0003,
"step": 588
},
{
"clip_ratio": 0.0004656559322029352,
"completion_length": 130.5,
"epoch": 0.0804205352266521,
"grad_norm": 0.0796666294336319,
"kl": 0.028533839125884697,
"learning_rate": 2.1631578947368423e-06,
"loss": 0.0003,
"num_tokens": 1645442.0,
"reward": 0.6625000238418579,
"reward_std": 0.12990380823612213,
"rewards/reward_fn": 0.6625000238418579,
"step": 589
},
{
"clip_ratio": 0.00030637255986221135,
"epoch": 0.08055707263790278,
"grad_norm": 0.08065035194158554,
"kl": 0.02866685314802453,
"learning_rate": 2.1578947368421054e-06,
"loss": 0.0001,
"step": 590
},
{
"clip_ratio": 0.0,
"epoch": 0.08069361004915347,
"grad_norm": 0.08036067336797714,
"kl": 0.029090011259540915,
"learning_rate": 2.1526315789473686e-06,
"loss": -0.0003,
"step": 591
},
{
"clip_ratio": 0.0,
"epoch": 0.08083014746040415,
"grad_norm": 0.07513322681188583,
"kl": 0.028922376601258293,
"learning_rate": 2.1473684210526317e-06,
"loss": -0.0006,
"step": 592
},
{
"clip_ratio": 0.0009937883296515793,
"completion_length": 136.40625,
"epoch": 0.08096668487165483,
"grad_norm": 0.10887999832630157,
"kl": 0.025917158054653555,
"learning_rate": 2.142105263157895e-06,
"loss": 0.0004,
"num_tokens": 1657179.0,
"reward": 0.71875,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.71875,
"step": 593
},
{
"clip_ratio": 0.0,
"epoch": 0.08110322228290552,
"grad_norm": 0.10297057032585144,
"kl": 0.025241338269552216,
"learning_rate": 2.136842105263158e-06,
"loss": 0.0001,
"step": 594
},
{
"clip_ratio": 0.0005030487664043903,
"epoch": 0.0812397596941562,
"grad_norm": 0.09531421959400177,
"kl": 0.026220592786557972,
"learning_rate": 2.1315789473684212e-06,
"loss": -0.0004,
"step": 595
},
{
"clip_ratio": 0.00044461380457505584,
"epoch": 0.08137629710540688,
"grad_norm": 0.08854269981384277,
"kl": 0.02591939302510582,
"learning_rate": 2.1263157894736844e-06,
"loss": -0.0008,
"step": 596
},
{
"clip_ratio": 0.00040286114381160587,
"completion_length": 138.15625,
"epoch": 0.08151283451665757,
"grad_norm": 0.08875960856676102,
"kl": 0.026444266317412257,
"learning_rate": 2.1210526315789476e-06,
"loss": -0.0002,
"num_tokens": 1669548.0,
"reward": 0.606249988079071,
"reward_std": 0.2899519205093384,
"rewards/reward_fn": 0.606249988079071,
"step": 597
},
{
"clip_ratio": 0.0,
"epoch": 0.08164937192790825,
"grad_norm": 0.08832712471485138,
"kl": 0.02660306473262608,
"learning_rate": 2.1157894736842107e-06,
"loss": -0.0003,
"step": 598
},
{
"clip_ratio": 0.00022163119865581393,
"epoch": 0.08178590933915893,
"grad_norm": 0.08737774938344955,
"kl": 0.02694275981048122,
"learning_rate": 2.110526315789474e-06,
"loss": -0.0007,
"step": 599
},
{
"clip_ratio": 0.00033734142198227346,
"epoch": 0.0819224467504096,
"grad_norm": 0.08558928221464157,
"kl": 0.02657399495365098,
"learning_rate": 2.105263157894737e-06,
"loss": -0.001,
"step": 600
},
{
"clip_ratio": 0.0001188212918350473,
"completion_length": 128.34375,
"epoch": 0.0820589841616603,
"grad_norm": 0.06710242480039597,
"kl": 0.030188038130290806,
"learning_rate": 2.1000000000000002e-06,
"loss": 0.0003,
"num_tokens": 1680927.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 601
},
{
"clip_ratio": 0.00032577493402641267,
"epoch": 0.08219552157291098,
"grad_norm": 0.06653324514627457,
"kl": 0.030682684533530846,
"learning_rate": 2.0947368421052634e-06,
"loss": 0.0003,
"step": 602
},
{
"clip_ratio": 0.00046111433766782284,
"epoch": 0.08233205898416165,
"grad_norm": 0.06612059473991394,
"kl": 0.030843880609609187,
"learning_rate": 2.0894736842105266e-06,
"loss": 0.0002,
"step": 603
},
{
"clip_ratio": 0.00020695364219136536,
"epoch": 0.08246859639541235,
"grad_norm": 0.06393194198608398,
"kl": 0.031093561818124726,
"learning_rate": 2.0842105263157897e-06,
"loss": -0.0001,
"step": 604
},
{
"clip_ratio": 0.000244140625,
"completion_length": 128.9375,
"epoch": 0.08260513380666303,
"grad_norm": 0.06816224753856659,
"kl": 0.026418528461363167,
"learning_rate": 2.078947368421053e-06,
"loss": 0.0003,
"num_tokens": 1691557.0,
"reward": 0.6625000238418579,
"reward_std": 0.12990380823612213,
"rewards/reward_fn": 0.6625000238418579,
"step": 605
},
{
"clip_ratio": 0.0008448271255474538,
"epoch": 0.0827416712179137,
"grad_norm": 0.06632911413908005,
"kl": 0.0269781686947681,
"learning_rate": 2.073684210526316e-06,
"loss": 0.0003,
"step": 606
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.0828782086291644,
"grad_norm": 0.06394495069980621,
"kl": 0.026145196170546114,
"learning_rate": 2.068421052631579e-06,
"loss": -0.0001,
"step": 607
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.08301474604041507,
"grad_norm": 0.06764407455921173,
"kl": 0.026354748668381944,
"learning_rate": 2.0631578947368424e-06,
"loss": -0.0002,
"step": 608
},
{
"clip_ratio": 0.0009424716117791831,
"completion_length": 151.625,
"epoch": 0.08315128345166575,
"grad_norm": 0.08172643929719925,
"kl": 0.026212202908936888,
"learning_rate": 2.0578947368421055e-06,
"loss": 0.0005,
"num_tokens": 1703877.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 609
},
{
"clip_ratio": 0.0007314500107895583,
"epoch": 0.08328782086291645,
"grad_norm": 0.08089722692966461,
"kl": 0.0268472250609193,
"learning_rate": 2.0526315789473687e-06,
"loss": 0.0004,
"step": 610
},
{
"clip_ratio": 0.0004393939452711493,
"epoch": 0.08342435827416712,
"grad_norm": 0.08089084923267365,
"kl": 0.02699510075035505,
"learning_rate": 2.047368421052632e-06,
"loss": 0.0,
"step": 611
},
{
"clip_ratio": 0.0006021543667884544,
"epoch": 0.0835608956854178,
"grad_norm": 0.08019546419382095,
"kl": 0.026255997800035402,
"learning_rate": 2.042105263157895e-06,
"loss": -0.0005,
"step": 612
},
{
"clip_ratio": 0.000810613390058279,
"completion_length": 124.96875,
"epoch": 0.08369743309666848,
"grad_norm": 0.09329909086227417,
"kl": 0.026048675848869607,
"learning_rate": 2.036842105263158e-06,
"loss": 0.0001,
"num_tokens": 1714476.0,
"reward": 0.7749999761581421,
"reward_std": 0.25980761647224426,
"rewards/reward_fn": 0.7749999761581421,
"step": 613
},
{
"clip_ratio": 0.0012707302666967735,
"epoch": 0.08383397050791917,
"grad_norm": 0.09495878219604492,
"kl": 0.025636921141995117,
"learning_rate": 2.031578947368421e-06,
"loss": 0.0002,
"step": 614
},
{
"clip_ratio": 0.0001707650226308033,
"epoch": 0.08397050791916985,
"grad_norm": 0.09412883967161179,
"kl": 0.025533305306453258,
"learning_rate": 2.026315789473684e-06,
"loss": -0.0005,
"step": 615
},
{
"clip_ratio": 0.00100363623641897,
"epoch": 0.08410704533042053,
"grad_norm": 0.08954595029354095,
"kl": 0.02580202795797959,
"learning_rate": 2.0210526315789477e-06,
"loss": -0.0008,
"step": 616
},
{
"clip_ratio": 0.0007753242534818128,
"completion_length": 168.53125,
"epoch": 0.08424358274167122,
"grad_norm": 0.07307417690753937,
"kl": 0.026822772080777213,
"learning_rate": 2.015789473684211e-06,
"loss": 0.0002,
"num_tokens": 1727825.0,
"reward": 0.578125,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.578125,
"step": 617
},
{
"clip_ratio": 0.0007655591471120715,
"epoch": 0.0843801201529219,
"grad_norm": 0.0729583203792572,
"kl": 0.02734056010376662,
"learning_rate": 2.010526315789474e-06,
"loss": 0.0002,
"step": 618
},
{
"clip_ratio": 0.0,
"epoch": 0.08451665756417258,
"grad_norm": 0.07249397039413452,
"kl": 0.027082344196969643,
"learning_rate": 2.005263157894737e-06,
"loss": -0.0001,
"step": 619
},
{
"clip_ratio": 0.0004055017634527758,
"epoch": 0.08465319497542327,
"grad_norm": 0.06983788311481476,
"kl": 0.027317771135130897,
"learning_rate": 2.0000000000000003e-06,
"loss": -0.0003,
"step": 620
},
{
"clip_ratio": 0.00041753742698347196,
"completion_length": 153.78125,
"epoch": 0.08478973238667395,
"grad_norm": 0.0808953270316124,
"kl": 0.028358329698676243,
"learning_rate": 1.994736842105263e-06,
"loss": 0.0004,
"num_tokens": 1740298.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 621
},
{
"clip_ratio": 0.0003094059356953949,
"epoch": 0.08492626979792463,
"grad_norm": 0.08027170598506927,
"kl": 0.02871102059725672,
"learning_rate": 1.9894736842105262e-06,
"loss": 0.0,
"step": 622
},
{
"clip_ratio": 0.0003094059356953949,
"epoch": 0.08506280720917532,
"grad_norm": 0.07950595021247864,
"kl": 0.02856921256170608,
"learning_rate": 1.9842105263157894e-06,
"loss": -0.0001,
"step": 623
},
{
"clip_ratio": 0.0003094059356953949,
"epoch": 0.085199344620426,
"grad_norm": 0.07559674233198166,
"kl": 0.02868326409952715,
"learning_rate": 1.978947368421053e-06,
"loss": -0.0006,
"step": 624
},
{
"clip_ratio": 0.00043604651000350714,
"completion_length": 137.78125,
"epoch": 0.08533588203167668,
"grad_norm": 0.03387494385242462,
"kl": 0.025424274819670245,
"learning_rate": 1.973684210526316e-06,
"loss": 0.0002,
"num_tokens": 1752347.0,
"reward": 0.690625011920929,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.690625011920929,
"step": 625
},
{
"clip_ratio": 0.0005163294408703223,
"epoch": 0.08547241944292736,
"grad_norm": 0.03339214622974396,
"kl": 0.025453351787291467,
"learning_rate": 1.9684210526315793e-06,
"loss": 0.0002,
"step": 626
},
{
"clip_ratio": 0.0,
"epoch": 0.08560895685417805,
"grad_norm": 0.033701345324516296,
"kl": 0.025396857847226784,
"learning_rate": 1.9631578947368425e-06,
"loss": 0.0002,
"step": 627
},
{
"clip_ratio": 0.0001453488366678357,
"epoch": 0.08574549426542873,
"grad_norm": 0.03361152485013008,
"kl": 0.02518440838321112,
"learning_rate": 1.9578947368421052e-06,
"loss": 0.0,
"step": 628
},
{
"clip_ratio": 0.0002741228090599179,
"completion_length": 124.375,
"epoch": 0.0858820316766794,
"grad_norm": 0.09590297192335129,
"kl": 0.03190047410316765,
"learning_rate": 1.9526315789473684e-06,
"loss": -0.0001,
"num_tokens": 1763875.0,
"reward": 0.71875,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.71875,
"step": 629
},
{
"clip_ratio": 0.0007283711893251166,
"epoch": 0.0860185690879301,
"grad_norm": 0.09830604493618011,
"kl": 0.03203440588549711,
"learning_rate": 1.9473684210526315e-06,
"loss": -0.0,
"step": 630
},
{
"clip_ratio": 0.0004833552229683846,
"epoch": 0.08615510649918078,
"grad_norm": 0.09596423804759979,
"kl": 0.03181770283845253,
"learning_rate": 1.9421052631578947e-06,
"loss": -0.0004,
"step": 631
},
{
"clip_ratio": 0.0006497451540781185,
"epoch": 0.08629164391043145,
"grad_norm": 0.08988839387893677,
"kl": 0.031553027947666124,
"learning_rate": 1.936842105263158e-06,
"loss": -0.0008,
"step": 632
},
{
"clip_ratio": 0.0003396739193703979,
"completion_length": 139.6875,
"epoch": 0.08642818132168215,
"grad_norm": 0.11786044389009476,
"kl": 0.029205120386905037,
"learning_rate": 1.9315789473684215e-06,
"loss": 0.0001,
"num_tokens": 1775645.0,
"reward": 0.690625011920929,
"reward_std": 0.29865381121635437,
"rewards/reward_fn": 0.690625011920929,
"step": 633
},
{
"clip_ratio": 0.0007215468504000455,
"epoch": 0.08656471873293282,
"grad_norm": 0.117555171251297,
"kl": 0.029039909320999868,
"learning_rate": 1.9263157894736846e-06,
"loss": 0.0,
"step": 634
},
{
"clip_ratio": 0.00045773174497298896,
"epoch": 0.0867012561441835,
"grad_norm": 0.11143205314874649,
"kl": 0.029505190832423978,
"learning_rate": 1.9210526315789474e-06,
"loss": -0.0005,
"step": 635
},
{
"clip_ratio": 0.0006555165600730106,
"epoch": 0.0868377935554342,
"grad_norm": 0.10721877217292786,
"kl": 0.02906324692594353,
"learning_rate": 1.9157894736842105e-06,
"loss": -0.0012,
"step": 636
},
{
"clip_ratio": 0.0,
"completion_length": 127.125,
"epoch": 0.08697433096668487,
"grad_norm": 0.0816088318824768,
"kl": 0.03337540605571121,
"learning_rate": 1.9105263157894737e-06,
"loss": 0.0002,
"num_tokens": 1787193.0,
"reward": 0.578125,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.578125,
"step": 637
},
{
"clip_ratio": 0.0,
"epoch": 0.08711086837793555,
"grad_norm": 0.08079145103693008,
"kl": 0.03298256819834933,
"learning_rate": 1.905263157894737e-06,
"loss": 0.0002,
"step": 638
},
{
"clip_ratio": 0.00028935185400769114,
"epoch": 0.08724740578918623,
"grad_norm": 0.07375474274158478,
"kl": 0.03400870703626424,
"learning_rate": 1.9000000000000002e-06,
"loss": -0.0002,
"step": 639
},
{
"clip_ratio": 0.00014952152559999377,
"epoch": 0.08738394320043692,
"grad_norm": 0.07169979810714722,
"kl": 0.0339630561938975,
"learning_rate": 1.8947368421052634e-06,
"loss": -0.0003,
"step": 640
},
{
"clip_ratio": 0.00046546234807465225,
"completion_length": 129.09375,
"epoch": 0.0875204806116876,
"grad_norm": 0.0885995551943779,
"kl": 0.03377768350765109,
"learning_rate": 1.8894736842105266e-06,
"loss": 0.0002,
"num_tokens": 1798452.0,
"reward": 0.8312499523162842,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.8312499523162842,
"step": 641
},
{
"clip_ratio": 0.0004482519725570455,
"epoch": 0.08765701802293828,
"grad_norm": 0.0879860669374466,
"kl": 0.0345135809329804,
"learning_rate": 1.8842105263157895e-06,
"loss": 0.0,
"step": 642
},
{
"clip_ratio": 0.00014810427092015743,
"epoch": 0.08779355543418897,
"grad_norm": 0.08827782422304153,
"kl": 0.03430288049275987,
"learning_rate": 1.8789473684210527e-06,
"loss": -0.0001,
"step": 643
},
{
"clip_ratio": 0.0009655518224462867,
"epoch": 0.08793009284543965,
"grad_norm": 0.0869118869304657,
"kl": 0.03385839582188055,
"learning_rate": 1.8736842105263158e-06,
"loss": -0.0003,
"step": 644
},
{
"clip_ratio": 0.001409449425409548,
"completion_length": 128.125,
"epoch": 0.08806663025669033,
"grad_norm": 0.0921865850687027,
"kl": 0.033534372836584225,
"learning_rate": 1.868421052631579e-06,
"loss": 0.0005,
"num_tokens": 1809316.0,
"reward": 0.5218750238418579,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.5218750238418579,
"step": 645
},
{
"clip_ratio": 0.0006227420526556671,
"epoch": 0.08820316766794102,
"grad_norm": 0.09347839653491974,
"kl": 0.03369360527722165,
"learning_rate": 1.8631578947368424e-06,
"loss": 0.0,
"step": 646
},
{
"clip_ratio": 0.0008524778095306829,
"epoch": 0.0883397050791917,
"grad_norm": 0.08786574006080627,
"kl": 0.03364496599533595,
"learning_rate": 1.8578947368421055e-06,
"loss": -0.0002,
"step": 647
},
{
"clip_ratio": 0.0004562043759506196,
"epoch": 0.08847624249044238,
"grad_norm": 0.08518879115581512,
"kl": 0.03309225430712104,
"learning_rate": 1.8526315789473687e-06,
"loss": -0.0008,
"step": 648
},
{
"clip_ratio": 0.0007344547484535724,
"completion_length": 130.65625,
"epoch": 0.08861277990169307,
"grad_norm": 0.093144990503788,
"kl": 0.037557946430752054,
"learning_rate": 1.8473684210526319e-06,
"loss": 0.0008,
"num_tokens": 1820961.0,
"reward": 0.6906249523162842,
"reward_std": 0.28125,
"rewards/reward_fn": 0.6906249523162842,
"step": 649
},
{
"clip_ratio": 0.0004762095195474103,
"epoch": 0.08874931731294375,
"grad_norm": 0.09195293486118317,
"kl": 0.03590751811861992,
"learning_rate": 1.8421052631578948e-06,
"loss": 0.0003,
"step": 650
},
{
"clip_ratio": 0.000642394064925611,
"epoch": 0.08888585472419443,
"grad_norm": 0.09232187271118164,
"kl": 0.03571216404088773,
"learning_rate": 1.836842105263158e-06,
"loss": 0.0003,
"step": 651
},
{
"clip_ratio": 0.0,
"epoch": 0.0890223921354451,
"grad_norm": 0.08797423541545868,
"kl": 0.03472030599368736,
"learning_rate": 1.8315789473684211e-06,
"loss": -0.0004,
"step": 652
},
{
"clip_ratio": 0.0,
"completion_length": 149.21875,
"epoch": 0.0891589295466958,
"grad_norm": 0.04103375971317291,
"kl": 0.03244091695523821,
"learning_rate": 1.8263157894736843e-06,
"loss": 0.0003,
"num_tokens": 1833080.0,
"reward": 0.71875,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.71875,
"step": 653
},
{
"clip_ratio": 0.0,
"epoch": 0.08929546695794648,
"grad_norm": 0.04076002910733223,
"kl": 0.03265755213215016,
"learning_rate": 1.8210526315789475e-06,
"loss": 0.0003,
"step": 654
},
{
"clip_ratio": 0.0,
"epoch": 0.08943200436919715,
"grad_norm": 0.04100827872753143,
"kl": 0.03254827967612073,
"learning_rate": 1.8157894736842109e-06,
"loss": 0.0002,
"step": 655
},
{
"clip_ratio": 0.0,
"epoch": 0.08956854178044785,
"grad_norm": 0.04075401648879051,
"kl": 0.03307641306309961,
"learning_rate": 1.810526315789474e-06,
"loss": 0.0,
"step": 656
},
{
"clip_ratio": 0.0,
"completion_length": 147.78125,
"epoch": 0.08970507919169853,
"grad_norm": 0.03296128287911415,
"kl": 0.027622340683592483,
"learning_rate": 1.805263157894737e-06,
"loss": 0.0001,
"num_tokens": 1845289.0,
"reward": 0.859375,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.859375,
"step": 657
},
{
"clip_ratio": 0.0,
"epoch": 0.0898416166029492,
"grad_norm": 0.03176380693912506,
"kl": 0.027481299359351397,
"learning_rate": 1.8000000000000001e-06,
"loss": 0.0001,
"step": 658
},
{
"clip_ratio": 0.0,
"epoch": 0.0899781540141999,
"grad_norm": 0.031271521002054214,
"kl": 0.02771525498246774,
"learning_rate": 1.7947368421052633e-06,
"loss": 0.0001,
"step": 659
},
{
"clip_ratio": 0.0,
"epoch": 0.09011469142545057,
"grad_norm": 0.03006802499294281,
"kl": 0.027794133289717138,
"learning_rate": 1.7894736842105265e-06,
"loss": 0.0,
"step": 660
},
{
"clip_ratio": 0.00037045805947855115,
"completion_length": 144.34375,
"epoch": 0.09025122883670125,
"grad_norm": 0.07770948857069016,
"kl": 0.032641842582961544,
"learning_rate": 1.7842105263157896e-06,
"loss": 0.0002,
"num_tokens": 1857092.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 661
},
{
"clip_ratio": 0.00035511364694684744,
"epoch": 0.09038776624795195,
"grad_norm": 0.08898326009511948,
"kl": 0.03239144055987708,
"learning_rate": 1.7789473684210528e-06,
"loss": 0.0003,
"step": 662
},
{
"clip_ratio": 0.0004056590114487335,
"epoch": 0.09052430365920262,
"grad_norm": 0.07720089703798294,
"kl": 0.03239328300696798,
"learning_rate": 1.7736842105263162e-06,
"loss": -0.0001,
"step": 663
},
{
"clip_ratio": 0.0003613803564803675,
"epoch": 0.0906608410704533,
"grad_norm": 0.0780443400144577,
"kl": 0.03282105067046359,
"learning_rate": 1.768421052631579e-06,
"loss": -0.0002,
"step": 664
},
{
"clip_ratio": 0.00037165620597079396,
"completion_length": 142.3125,
"epoch": 0.09079737848170398,
"grad_norm": 0.0875195860862732,
"kl": 0.032956337759969756,
"learning_rate": 1.7631578947368423e-06,
"loss": 0.0003,
"num_tokens": 1868814.0,
"reward": 0.746874988079071,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.746874988079071,
"step": 665
},
{
"clip_ratio": 0.0006258496141526848,
"epoch": 0.09093391589295467,
"grad_norm": 0.08770208060741425,
"kl": 0.032618753350107,
"learning_rate": 1.7578947368421054e-06,
"loss": -0.0001,
"step": 666
},
{
"clip_ratio": 0.00048392938333563507,
"epoch": 0.09107045330420535,
"grad_norm": 0.086226686835289,
"kl": 0.03322019218467176,
"learning_rate": 1.7526315789473686e-06,
"loss": -0.0,
"step": 667
},
{
"clip_ratio": 0.0005311927088769153,
"epoch": 0.09120699071545603,
"grad_norm": 0.08620792627334595,
"kl": 0.032796544779557735,
"learning_rate": 1.7473684210526318e-06,
"loss": -0.0005,
"step": 668
},
{
"clip_ratio": 0.00016891892300918698,
"completion_length": 152.03125,
"epoch": 0.09134352812670672,
"grad_norm": 0.06065315380692482,
"kl": 0.030359022639459,
"learning_rate": 1.742105263157895e-06,
"loss": 0.0004,
"num_tokens": 1881131.0,
"reward": 0.5218750238418579,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.5218750238418579,
"step": 669
},
{
"clip_ratio": 0.0001806358341127634,
"epoch": 0.0914800655379574,
"grad_norm": 0.060918476432561874,
"kl": 0.029836400091880932,
"learning_rate": 1.736842105263158e-06,
"loss": 0.0003,
"step": 670
},
{
"clip_ratio": 0.0,
"epoch": 0.09161660294920808,
"grad_norm": 0.06018917262554169,
"kl": 0.029947946954052895,
"learning_rate": 1.731578947368421e-06,
"loss": 0.0,
"step": 671
},
{
"clip_ratio": 0.0001806358341127634,
"epoch": 0.09175314036045877,
"grad_norm": 0.06113429367542267,
"kl": 0.02997833924018778,
"learning_rate": 1.7263157894736842e-06,
"loss": -0.0001,
"step": 672
},
{
"clip_ratio": 0.0010184195562032983,
"completion_length": 149.71875,
"epoch": 0.09188967777170945,
"grad_norm": 0.11531484127044678,
"kl": 0.029697615158511326,
"learning_rate": 1.7210526315789474e-06,
"loss": 0.0002,
"num_tokens": 1893158.0,
"reward": 0.6031249761581421,
"reward_std": 0.42610567808151245,
"rewards/reward_fn": 0.6031249761581421,
"step": 673
},
{
"clip_ratio": 0.0008683160558575764,
"epoch": 0.09202621518296013,
"grad_norm": 0.11043091863393784,
"kl": 0.031451030779862776,
"learning_rate": 1.7157894736842107e-06,
"loss": 0.0,
"step": 674
},
{
"clip_ratio": 0.0016366316704079509,
"epoch": 0.09216275259421082,
"grad_norm": 0.11153166741132736,
"kl": 0.030584218620788306,
"learning_rate": 1.710526315789474e-06,
"loss": -0.0003,
"step": 675
},
{
"clip_ratio": 0.0007215101504698396,
"epoch": 0.0922992900054615,
"grad_norm": 0.10511306673288345,
"kl": 0.030299391684820876,
"learning_rate": 1.705263157894737e-06,
"loss": -0.0009,
"step": 676
},
{
"clip_ratio": 0.00036520417779684067,
"completion_length": 150.875,
"epoch": 0.09243582741671218,
"grad_norm": 0.10060536116361618,
"kl": 0.03141664047143422,
"learning_rate": 1.7000000000000002e-06,
"loss": 0.0006,
"num_tokens": 1905082.0,
"reward": 0.71875,
"reward_std": 0.2899519205093384,
"rewards/reward_fn": 0.71875,
"step": 677
},
{
"clip_ratio": 0.0008521379495505244,
"epoch": 0.09257236482796286,
"grad_norm": 0.0980759933590889,
"kl": 0.03153267546440475,
"learning_rate": 1.6947368421052632e-06,
"loss": 0.0001,
"step": 678
},
{
"clip_ratio": 0.0003382211725693196,
"epoch": 0.09270890223921355,
"grad_norm": 0.09468948096036911,
"kl": 0.03160182334249839,
"learning_rate": 1.6894736842105264e-06,
"loss": -0.0004,
"step": 679
},
{
"clip_ratio": 0.0003924800839740783,
"epoch": 0.09284543965046423,
"grad_norm": 0.09634365886449814,
"kl": 0.03162823195452802,
"learning_rate": 1.6842105263157895e-06,
"loss": -0.0007,
"step": 680
},
{
"clip_ratio": 0.0,
"completion_length": 116.28125,
"epoch": 0.0929819770617149,
"grad_norm": 0.08576124906539917,
"kl": 0.029789241671096534,
"learning_rate": 1.6789473684210527e-06,
"loss": 0.0004,
"num_tokens": 1915887.0,
"reward": 0.9156249761581421,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.9156249761581421,
"step": 681
},
{
"clip_ratio": 0.0,
"epoch": 0.0931185144729656,
"grad_norm": 0.08568418025970459,
"kl": 0.02953265013638884,
"learning_rate": 1.673684210526316e-06,
"loss": 0.0003,
"step": 682
},
{
"clip_ratio": 0.0,
"epoch": 0.09325505188421628,
"grad_norm": 0.08653020858764648,
"kl": 0.030135785636957735,
"learning_rate": 1.6684210526315792e-06,
"loss": 0.0001,
"step": 683
},
{
"clip_ratio": 0.0004459502233657986,
"epoch": 0.09339158929546695,
"grad_norm": 0.07059013098478317,
"kl": 0.03075120344874449,
"learning_rate": 1.6631578947368424e-06,
"loss": -0.0001,
"step": 684
},
{
"clip_ratio": 0.0005163708701729774,
"completion_length": 137.875,
"epoch": 0.09352812670671765,
"grad_norm": 0.0986505001783371,
"kl": 0.03283812435984146,
"learning_rate": 1.6578947368421053e-06,
"loss": 0.0005,
"num_tokens": 1926891.0,
"reward": 0.578125,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.578125,
"step": 685
},
{
"clip_ratio": 0.0004849253600696102,
"epoch": 0.09366466411796832,
"grad_norm": 0.09848025441169739,
"kl": 0.032939996555796824,
"learning_rate": 1.6526315789473685e-06,
"loss": 0.0002,
"step": 686
},
{
"clip_ratio": 0.0006144791841506958,
"epoch": 0.093801201529219,
"grad_norm": 0.09903288632631302,
"kl": 0.033225755047169514,
"learning_rate": 1.6473684210526317e-06,
"loss": 0.0,
"step": 687
},
{
"clip_ratio": 0.0003739090752787888,
"epoch": 0.0939377389404697,
"grad_norm": 0.09462776780128479,
"kl": 0.0339893525961088,
"learning_rate": 1.6421052631578948e-06,
"loss": -0.0003,
"step": 688
},
{
"clip_ratio": 0.0004387063963804394,
"completion_length": 140.9375,
"epoch": 0.09407427635172037,
"grad_norm": 0.07126783579587936,
"kl": 0.032499870838364586,
"learning_rate": 1.636842105263158e-06,
"loss": 0.0004,
"num_tokens": 1938977.0,
"reward": 0.7468750476837158,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.7468750476837158,
"step": 689
},
{
"clip_ratio": 0.00033783784601837397,
"epoch": 0.09421081376297105,
"grad_norm": 0.0714046061038971,
"kl": 0.03266788163455203,
"learning_rate": 1.6315789473684212e-06,
"loss": 0.0001,
"step": 690
},
{
"clip_ratio": 0.0003198851045453921,
"epoch": 0.09434735117422173,
"grad_norm": 0.07156651467084885,
"kl": 0.03251979897322599,
"learning_rate": 1.6263157894736845e-06,
"loss": 0.0002,
"step": 691
},
{
"clip_ratio": 0.0002877402148442343,
"epoch": 0.09448388858547242,
"grad_norm": 0.07169118523597717,
"kl": 0.03235316323116422,
"learning_rate": 1.6210526315789473e-06,
"loss": -0.0001,
"step": 692
},
{
"clip_ratio": 0.00025826445198617876,
"completion_length": 133.65625,
"epoch": 0.0946204259967231,
"grad_norm": 0.0648774579167366,
"kl": 0.03120983185363002,
"learning_rate": 1.6157894736842106e-06,
"loss": 0.0002,
"num_tokens": 1950866.0,
"reward": 0.6625000238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.6625000238418579,
"step": 693
},
{
"clip_ratio": 0.00025826445198617876,
"epoch": 0.09475696340797378,
"grad_norm": 0.06372489035129547,
"kl": 0.0311219054274261,
"learning_rate": 1.6105263157894738e-06,
"loss": 0.0001,
"step": 694
},
{
"clip_ratio": 0.0,
"epoch": 0.09489350081922447,
"grad_norm": 0.06404761970043182,
"kl": 0.030508951924275607,
"learning_rate": 1.605263157894737e-06,
"loss": -0.0,
"step": 695
},
{
"clip_ratio": 0.0002281021879753098,
"epoch": 0.09503003823047515,
"grad_norm": 0.0647362545132637,
"kl": 0.031124803936108947,
"learning_rate": 1.6000000000000001e-06,
"loss": -0.0001,
"step": 696
},
{
"clip_ratio": 0.0002855776983778924,
"completion_length": 135.40625,
"epoch": 0.09516657564172583,
"grad_norm": 0.069391630589962,
"kl": 0.03132415152504109,
"learning_rate": 1.5947368421052633e-06,
"loss": 0.0004,
"num_tokens": 1962359.0,
"reward": 0.7749999761581421,
"reward_std": 0.12990380823612213,
"rewards/reward_fn": 0.7749999761581421,
"step": 697
},
{
"clip_ratio": 0.0005032864864915609,
"epoch": 0.09530311305297652,
"grad_norm": 0.07143551856279373,
"kl": 0.03164268011460081,
"learning_rate": 1.5894736842105265e-06,
"loss": 0.0005,
"step": 698
},
{
"clip_ratio": 0.000163612567121163,
"epoch": 0.0954396504642272,
"grad_norm": 0.06680339574813843,
"kl": 0.03151996951783076,
"learning_rate": 1.5842105263157894e-06,
"loss": 0.0002,
"step": 699
},
{
"clip_ratio": 0.000163612567121163,
"epoch": 0.09557618787547788,
"grad_norm": 0.0664854645729065,
"kl": 0.03106894381926395,
"learning_rate": 1.5789473684210526e-06,
"loss": -0.0,
"step": 700
},
{
"clip_ratio": 0.0014787253021495417,
"completion_length": 166.3125,
"epoch": 0.09571272528672857,
"grad_norm": 0.11290665715932846,
"kl": 0.031161494320258498,
"learning_rate": 1.573684210526316e-06,
"loss": 0.0007,
"num_tokens": 1975669.0,
"reward": 0.578125,
"reward_std": 0.36360570788383484,
"rewards/reward_fn": 0.578125,
"step": 701
},
{
"clip_ratio": 0.000746544887078926,
"epoch": 0.09584926269797925,
"grad_norm": 0.11650830507278442,
"kl": 0.03087172904633917,
"learning_rate": 1.5684210526315791e-06,
"loss": 0.0003,
"step": 702
},
{
"clip_ratio": 0.0007508412381866947,
"epoch": 0.09598580010922993,
"grad_norm": 0.11172571778297424,
"kl": 0.03082931600511074,
"learning_rate": 1.5631578947368423e-06,
"loss": -0.0001,
"step": 703
},
{
"clip_ratio": 0.0008415376505581662,
"epoch": 0.0961223375204806,
"grad_norm": 0.11011453717947006,
"kl": 0.030562146741431206,
"learning_rate": 1.5578947368421054e-06,
"loss": -0.0005,
"step": 704
},
{
"clip_ratio": 0.000691575522068888,
"completion_length": 119.21875,
"epoch": 0.0962588749317313,
"grad_norm": 0.09140753000974655,
"kl": 0.03985722205834463,
"learning_rate": 1.5526315789473686e-06,
"loss": 0.0005,
"num_tokens": 1986412.0,
"reward": 0.71875,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.71875,
"step": 705
},
{
"clip_ratio": 0.00048280542250722647,
"epoch": 0.09639541234298198,
"grad_norm": 0.09256947040557861,
"kl": 0.03949978741002269,
"learning_rate": 1.5473684210526316e-06,
"loss": 0.0003,
"step": 706
},
{
"clip_ratio": 0.0006655539618805051,
"epoch": 0.09653194975423265,
"grad_norm": 0.0919048860669136,
"kl": 0.04003440952510573,
"learning_rate": 1.5421052631578947e-06,
"loss": 0.0001,
"step": 707
},
{
"clip_ratio": 0.0002367424312978983,
"epoch": 0.09666848716548335,
"grad_norm": 0.08757032454013824,
"kl": 0.0402066423848737,
"learning_rate": 1.5368421052631579e-06,
"loss": -0.0003,
"step": 708
},
{
"clip_ratio": 0.00018601190822664648,
"completion_length": 131.5625,
"epoch": 0.09680502457673403,
"grad_norm": 0.04012110456824303,
"kl": 0.026871845373534597,
"learning_rate": 1.5315789473684213e-06,
"loss": 0.0003,
"num_tokens": 1997494.0,
"reward": 0.690625011920929,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.690625011920929,
"step": 709
},
{
"clip_ratio": 0.0,
"epoch": 0.0969415619879847,
"grad_norm": 0.04035944491624832,
"kl": 0.026953702850732952,
"learning_rate": 1.5263157894736844e-06,
"loss": 0.0002,
"step": 710
},
{
"clip_ratio": 0.0,
"epoch": 0.0970780993992354,
"grad_norm": 0.040319595485925674,
"kl": 0.026927403203444555,
"learning_rate": 1.5210526315789476e-06,
"loss": 0.0003,
"step": 711
},
{
"clip_ratio": 0.0,
"epoch": 0.09721463681048607,
"grad_norm": 0.037202075123786926,
"kl": 0.027284836760372855,
"learning_rate": 1.5157894736842108e-06,
"loss": 0.0002,
"step": 712
},
{
"clip_ratio": 0.0005803374951938167,
"completion_length": 134.25,
"epoch": 0.09735117422173675,
"grad_norm": 0.08356423676013947,
"kl": 0.028570065303938463,
"learning_rate": 1.5105263157894737e-06,
"loss": 0.0004,
"num_tokens": 2008914.0,
"reward": 0.887499988079071,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.887499988079071,
"step": 713
},
{
"clip_ratio": 0.00037202381645329297,
"epoch": 0.09748771163298744,
"grad_norm": 0.0837133526802063,
"kl": 0.029038649721769616,
"learning_rate": 1.5052631578947369e-06,
"loss": 0.0002,
"step": 714
},
{
"clip_ratio": 0.0002281021879753098,
"epoch": 0.09762424904423812,
"grad_norm": 0.0792241021990776,
"kl": 0.029093143355567008,
"learning_rate": 1.5e-06,
"loss": 0.0003,
"step": 715
},
{
"clip_ratio": 0.00018601190822664648,
"epoch": 0.0977607864554888,
"grad_norm": 0.07729717344045639,
"kl": 0.02941943213227205,
"learning_rate": 1.4947368421052632e-06,
"loss": -0.0002,
"step": 716
},
{
"clip_ratio": 0.0007804456472513266,
"completion_length": 154.4375,
"epoch": 0.09789732386673948,
"grad_norm": 0.08151241391897202,
"kl": 0.03156525699887425,
"learning_rate": 1.4894736842105264e-06,
"loss": 0.0002,
"num_tokens": 2021000.0,
"reward": 0.8031250238418579,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.8031250238418579,
"step": 717
},
{
"clip_ratio": 0.00025540192291373387,
"epoch": 0.09803386127799017,
"grad_norm": 0.08159659057855606,
"kl": 0.0318286495457869,
"learning_rate": 1.4842105263157897e-06,
"loss": 0.0,
"step": 718
},
{
"clip_ratio": 0.0005171415978111327,
"epoch": 0.09817039868924085,
"grad_norm": 0.08123067766427994,
"kl": 0.031137815676629543,
"learning_rate": 1.478947368421053e-06,
"loss": -0.0001,
"step": 719
},
{
"clip_ratio": 0.0006710824818583205,
"epoch": 0.09830693610049153,
"grad_norm": 0.07915233820676804,
"kl": 0.031273662752937526,
"learning_rate": 1.4736842105263159e-06,
"loss": -0.0004,
"step": 720
},
{
"clip_ratio": 0.00026709403027780354,
"completion_length": 128.96875,
"epoch": 0.09844347351174222,
"grad_norm": 0.11582774668931961,
"kl": 0.03666126274038106,
"learning_rate": 1.468421052631579e-06,
"loss": 0.0003,
"num_tokens": 2032063.0,
"reward": 0.5218750238418579,
"reward_std": 0.298653781414032,
"rewards/reward_fn": 0.5218750238418579,
"step": 721
},
{
"clip_ratio": 0.0002840909000951797,
"epoch": 0.0985800109229929,
"grad_norm": 0.11533697694540024,
"kl": 0.036149427643977106,
"learning_rate": 1.4631578947368422e-06,
"loss": 0.0,
"step": 722
},
{
"clip_ratio": 0.0005681818001903594,
"epoch": 0.09871654833424358,
"grad_norm": 0.11449582874774933,
"kl": 0.035863583092577755,
"learning_rate": 1.4578947368421053e-06,
"loss": -0.0001,
"step": 723
},
{
"clip_ratio": 0.0015406785241793841,
"epoch": 0.09885308574549427,
"grad_norm": 0.1062321737408638,
"kl": 0.03639277716865763,
"learning_rate": 1.4526315789473685e-06,
"loss": -0.0008,
"step": 724
},
{
"clip_ratio": 0.0002367424312978983,
"completion_length": 127.3125,
"epoch": 0.09898962315674495,
"grad_norm": 0.08646994829177856,
"kl": 0.031235893722623587,
"learning_rate": 1.4473684210526317e-06,
"loss": 0.0006,
"num_tokens": 2043593.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 725
},
{
"clip_ratio": 0.00031565656536258757,
"epoch": 0.09912616056799563,
"grad_norm": 0.08576333522796631,
"kl": 0.03090131061617285,
"learning_rate": 1.442105263157895e-06,
"loss": 0.0004,
"step": 726
},
{
"clip_ratio": 0.00015318627993110567,
"epoch": 0.09926269797924632,
"grad_norm": 0.08371236175298691,
"kl": 0.03052604233380407,
"learning_rate": 1.4368421052631582e-06,
"loss": 0.0002,
"step": 727
},
{
"clip_ratio": 0.0003327839804114774,
"epoch": 0.099399235390497,
"grad_norm": 0.08282700181007385,
"kl": 0.0304128993593622,
"learning_rate": 1.4315789473684212e-06,
"loss": -0.0003,
"step": 728
},
{
"clip_ratio": 0.0013521671062335372,
"completion_length": 135.6875,
"epoch": 0.09953577280174768,
"grad_norm": 0.120718814432621,
"kl": 0.030184058006852865,
"learning_rate": 1.4263157894736843e-06,
"loss": 0.0004,
"num_tokens": 2055143.0,
"reward": 0.7749999761581421,
"reward_std": 0.3374999761581421,
"rewards/reward_fn": 0.7749999761581421,
"step": 729
},
{
"clip_ratio": 0.00020559210679493845,
"epoch": 0.09967231021299836,
"grad_norm": 0.1224217414855957,
"kl": 0.030380245007108897,
"learning_rate": 1.4210526315789475e-06,
"loss": -0.0002,
"step": 730
},
{
"clip_ratio": 0.0008518250251654536,
"epoch": 0.09980884762424905,
"grad_norm": 0.12106145918369293,
"kl": 0.03084506734739989,
"learning_rate": 1.4157894736842107e-06,
"loss": -0.0005,
"step": 731
},
{
"clip_ratio": 0.0003453038807492703,
"epoch": 0.09994538503549973,
"grad_norm": 0.11929699033498764,
"kl": 0.03096500746323727,
"learning_rate": 1.4105263157894738e-06,
"loss": -0.001,
"step": 732
},
{
"clip_ratio": 0.0001220703125,
"completion_length": 123.625,
"epoch": 0.1000819224467504,
"grad_norm": 0.06932857632637024,
"kl": 0.03866506487247534,
"learning_rate": 1.405263157894737e-06,
"loss": 0.0003,
"num_tokens": 2066631.0,
"reward": 0.9437500238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.9437500238418579,
"step": 733
},
{
"clip_ratio": 0.0004617442318703979,
"epoch": 0.1002184598580011,
"grad_norm": 0.06737175583839417,
"kl": 0.0382203079352621,
"learning_rate": 1.4000000000000001e-06,
"loss": 0.0002,
"step": 734
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.10035499726925177,
"grad_norm": 0.06321597844362259,
"kl": 0.0391845365811605,
"learning_rate": 1.394736842105263e-06,
"loss": 0.0,
"step": 735
},
{
"clip_ratio": 0.0001220703125,
"epoch": 0.10049153468050245,
"grad_norm": 0.060581691563129425,
"kl": 0.039463951223297045,
"learning_rate": 1.3894736842105263e-06,
"loss": -0.0001,
"step": 736
},
{
"clip_ratio": 0.0004249223129590973,
"completion_length": 114.3125,
"epoch": 0.10062807209175315,
"grad_norm": 0.06796769797801971,
"kl": 0.03601354014244862,
"learning_rate": 1.3842105263157896e-06,
"loss": 0.0003,
"num_tokens": 2078197.0,
"reward": 0.859375,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.859375,
"step": 737
},
{
"clip_ratio": 0.00013185653369873762,
"epoch": 0.10076460950300382,
"grad_norm": 0.06704866886138916,
"kl": 0.036752572166733444,
"learning_rate": 1.3789473684210528e-06,
"loss": 0.0004,
"step": 738
},
{
"clip_ratio": 0.0,
"epoch": 0.1009011469142545,
"grad_norm": 0.06749145686626434,
"kl": 0.036876781057799235,
"learning_rate": 1.373684210526316e-06,
"loss": 0.0003,
"step": 739
},
{
"clip_ratio": 0.00013185653369873762,
"epoch": 0.1010376843255052,
"grad_norm": 0.061885811388492584,
"kl": 0.036570252443198115,
"learning_rate": 1.3684210526315791e-06,
"loss": 0.0001,
"step": 740
},
{
"clip_ratio": 0.0006059740553610027,
"completion_length": 146.1875,
"epoch": 0.10117422173675587,
"grad_norm": 0.09527821838855743,
"kl": 0.032047255721408874,
"learning_rate": 1.3631578947368423e-06,
"loss": 0.0003,
"num_tokens": 2089871.0,
"reward": 0.7749999761581421,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.7749999761581421,
"step": 741
},
{
"clip_ratio": 0.0011411394516471773,
"epoch": 0.10131075914800655,
"grad_norm": 0.09487205743789673,
"kl": 0.03190063979127444,
"learning_rate": 1.3578947368421052e-06,
"loss": 0.0002,
"step": 742
},
{
"clip_ratio": 0.0006642076768912375,
"epoch": 0.10144729655925723,
"grad_norm": 0.09328478574752808,
"kl": 0.03218909970019013,
"learning_rate": 1.3526315789473684e-06,
"loss": 0.0,
"step": 743
},
{
"clip_ratio": 0.0008540581329725683,
"epoch": 0.10158383397050792,
"grad_norm": 0.09467902779579163,
"kl": 0.03178860497428104,
"learning_rate": 1.3473684210526316e-06,
"loss": -0.0006,
"step": 744
},
{
"clip_ratio": 0.0014868229773128405,
"completion_length": 132.3125,
"epoch": 0.1017203713817586,
"grad_norm": 0.12321406602859497,
"kl": 0.03981124117854051,
"learning_rate": 1.342105263157895e-06,
"loss": 0.0006,
"num_tokens": 2101149.0,
"reward": 0.578125,
"reward_std": 0.29865381121635437,
"rewards/reward_fn": 0.578125,
"step": 745
},
{
"clip_ratio": 0.0005994522216496989,
"epoch": 0.10185690879300928,
"grad_norm": 0.11873092502355576,
"kl": 0.039661494083702564,
"learning_rate": 1.3368421052631581e-06,
"loss": 0.0002,
"step": 746
},
{
"clip_ratio": 0.0002943657018477097,
"epoch": 0.10199344620425997,
"grad_norm": 0.12101374566555023,
"kl": 0.039191018004203215,
"learning_rate": 1.3315789473684213e-06,
"loss": -0.0002,
"step": 747
},
{
"clip_ratio": 0.00041562868864275515,
"epoch": 0.10212998361551065,
"grad_norm": 0.11430719494819641,
"kl": 0.03897344155120663,
"learning_rate": 1.3263157894736844e-06,
"loss": -0.0006,
"step": 748
},
{
"clip_ratio": 0.0008153396483976394,
"completion_length": 129.5,
"epoch": 0.10226652102676133,
"grad_norm": 0.06621770560741425,
"kl": 0.030582898791180924,
"learning_rate": 1.3210526315789474e-06,
"loss": 0.0004,
"num_tokens": 2112669.0,
"reward": 0.831250011920929,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.831250011920929,
"step": 749
},
{
"clip_ratio": 0.0005412168393377215,
"epoch": 0.10240305843801202,
"grad_norm": 0.06624240428209305,
"kl": 0.03081196144921705,
"learning_rate": 1.3157894736842106e-06,
"loss": 0.0001,
"step": 750
},
{
"clip_ratio": 0.00026709403027780354,
"epoch": 0.1025395958492627,
"grad_norm": 0.0665903389453888,
"kl": 0.030628347245510668,
"learning_rate": 1.3105263157894737e-06,
"loss": 0.0,
"step": 751
},
{
"clip_ratio": 0.000244140625,
"epoch": 0.10267613326051338,
"grad_norm": 0.0640382319688797,
"kl": 0.03100741034722887,
"learning_rate": 1.3052631578947369e-06,
"loss": -0.0002,
"step": 752
},
{
"clip_ratio": 0.0003129117249045521,
"completion_length": 142.8125,
"epoch": 0.10281267067176407,
"grad_norm": 0.10943469405174255,
"kl": 0.030879329569870606,
"learning_rate": 1.3e-06,
"loss": 0.0001,
"num_tokens": 2124911.0,
"reward": 0.6343749761581421,
"reward_std": 0.28125,
"rewards/reward_fn": 0.6343749761581421,
"step": 753
},
{
"clip_ratio": 0.0004050493298564106,
"epoch": 0.10294920808301475,
"grad_norm": 0.11133232712745667,
"kl": 0.03102087226579897,
"learning_rate": 1.2947368421052634e-06,
"loss": -0.0002,
"step": 754
},
{
"clip_ratio": 0.0006491899548564106,
"epoch": 0.10308574549426543,
"grad_norm": 0.10690458118915558,
"kl": 0.030950611282605678,
"learning_rate": 1.2894736842105266e-06,
"loss": -0.0006,
"step": 755
},
{
"clip_ratio": 0.0012277475470909849,
"epoch": 0.1032222829055161,
"grad_norm": 0.10306268185377121,
"kl": 0.030929109954740852,
"learning_rate": 1.2842105263157895e-06,
"loss": -0.0008,
"step": 756
},
{
"clip_ratio": 0.0001849112450145185,
"completion_length": 136.25,
"epoch": 0.1033588203167668,
"grad_norm": 0.04018304869532585,
"kl": 0.03246450412552804,
"learning_rate": 1.2789473684210527e-06,
"loss": 0.0003,
"num_tokens": 2136827.0,
"reward": 0.6906249523162842,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.6906249523162842,
"step": 757
},
{
"clip_ratio": 0.00040654244367033243,
"epoch": 0.10349535772801748,
"grad_norm": 0.03952132910490036,
"kl": 0.033268949860939756,
"learning_rate": 1.2736842105263159e-06,
"loss": 0.0003,
"step": 758
},
{
"clip_ratio": 0.0001849112450145185,
"epoch": 0.10363189513926815,
"grad_norm": 0.039509255439043045,
"kl": 0.03303608257556334,
"learning_rate": 1.268421052631579e-06,
"loss": 0.0003,
"step": 759
},
{
"clip_ratio": 0.0,
"epoch": 0.10376843255051885,
"grad_norm": 0.03916515037417412,
"kl": 0.032561466010520235,
"learning_rate": 1.2631578947368422e-06,
"loss": 0.0003,
"step": 760
},
{
"clip_ratio": 0.0006341315165627748,
"completion_length": 131.75,
"epoch": 0.10390496996176952,
"grad_norm": 0.08830566704273224,
"kl": 0.03105318936286494,
"learning_rate": 1.2578947368421054e-06,
"loss": 0.0002,
"num_tokens": 2148251.0,
"reward": 0.606249988079071,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.606249988079071,
"step": 761
},
{
"clip_ratio": 0.0009561895130900666,
"epoch": 0.1040415073730202,
"grad_norm": 0.08864033222198486,
"kl": 0.03143153933342546,
"learning_rate": 1.2526315789473687e-06,
"loss": 0.0002,
"step": 762
},
{
"clip_ratio": 0.0012018284760415554,
"epoch": 0.1041780447842709,
"grad_norm": 0.08631853014230728,
"kl": 0.03134011913789436,
"learning_rate": 1.2473684210526317e-06,
"loss": 0.0,
"step": 763
},
{
"clip_ratio": 0.0006564522045664489,
"epoch": 0.10431458219552157,
"grad_norm": 0.08750317245721817,
"kl": 0.03160371968988329,
"learning_rate": 1.2421052631578948e-06,
"loss": -0.0002,
"step": 764
},
{
"clip_ratio": 0.0,
"completion_length": 131.21875,
"epoch": 0.10445111960677225,
"grad_norm": 0.04507174715399742,
"kl": 0.03025782248005271,
"learning_rate": 1.236842105263158e-06,
"loss": 0.0003,
"num_tokens": 2159018.0,
"reward": 0.971875011920929,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.971875011920929,
"step": 765
},
{
"clip_ratio": 0.0,
"epoch": 0.10458765701802294,
"grad_norm": 0.04543492570519447,
"kl": 0.03106310815201141,
"learning_rate": 1.2315789473684212e-06,
"loss": 0.0004,
"step": 766
},
{
"clip_ratio": 0.0,
"epoch": 0.10472419442927362,
"grad_norm": 0.04544907435774803,
"kl": 0.030511865101289004,
"learning_rate": 1.2263157894736843e-06,
"loss": 0.0002,
"step": 767
},
{
"clip_ratio": 0.0,
"epoch": 0.1048607318405243,
"grad_norm": 0.0443943589925766,
"kl": 0.02988862877828069,
"learning_rate": 1.2210526315789475e-06,
"loss": 0.0002,
"step": 768
},
{
"clip_ratio": 0.0007646681769983843,
"completion_length": 132.4375,
"epoch": 0.10499726925177498,
"grad_norm": 0.05918116122484207,
"kl": 0.031367348274216056,
"learning_rate": 1.2157894736842107e-06,
"loss": 0.0004,
"num_tokens": 2170364.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 769
},
{
"clip_ratio": 0.000615662953350693,
"epoch": 0.10513380666302567,
"grad_norm": 0.058712657541036606,
"kl": 0.031523832760285586,
"learning_rate": 1.2105263157894738e-06,
"loss": 0.0003,
"step": 770
},
{
"clip_ratio": 0.00041693481034599245,
"epoch": 0.10527034407427635,
"grad_norm": 0.05310717225074768,
"kl": 0.03125297068618238,
"learning_rate": 1.205263157894737e-06,
"loss": 0.0002,
"step": 771
},
{
"clip_ratio": 0.000615662953350693,
"epoch": 0.10540688148552703,
"grad_norm": 0.05317603796720505,
"kl": 0.031730295915622264,
"learning_rate": 1.2000000000000002e-06,
"loss": 0.0002,
"step": 772
},
{
"clip_ratio": 0.0,
"completion_length": 115.84375,
"epoch": 0.10554341889677772,
"grad_norm": 0.08601640909910202,
"kl": 0.036299167724791914,
"learning_rate": 1.1947368421052633e-06,
"loss": 0.0004,
"num_tokens": 2181423.0,
"reward": 0.550000011920929,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.550000011920929,
"step": 773
},
{
"clip_ratio": 0.0,
"epoch": 0.1056799563080284,
"grad_norm": 0.08543814718723297,
"kl": 0.03631689946632832,
"learning_rate": 1.1894736842105265e-06,
"loss": 0.0001,
"step": 774
},
{
"clip_ratio": 0.0004579307569656521,
"epoch": 0.10581649371927908,
"grad_norm": 0.0862925574183464,
"kl": 0.03603148739784956,
"learning_rate": 1.1842105263157894e-06,
"loss": 0.0001,
"step": 775
},
{
"clip_ratio": 0.00023148147738538682,
"epoch": 0.10595303113052977,
"grad_norm": 0.08512796461582184,
"kl": 0.03633074296521954,
"learning_rate": 1.1789473684210526e-06,
"loss": -0.0002,
"step": 776
},
{
"clip_ratio": 0.0,
"completion_length": 120.15625,
"epoch": 0.10608956854178045,
"grad_norm": 0.04055812582373619,
"kl": 0.03543747233925387,
"learning_rate": 1.173684210526316e-06,
"loss": 0.0003,
"num_tokens": 2192324.0,
"reward": 0.578125,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.578125,
"step": 777
},
{
"clip_ratio": 0.0,
"epoch": 0.10622610595303113,
"grad_norm": 0.040661316365003586,
"kl": 0.035565093508921564,
"learning_rate": 1.1684210526315791e-06,
"loss": 0.0002,
"step": 778
},
{
"clip_ratio": 0.0,
"epoch": 0.10636264336428182,
"grad_norm": 0.04156764596700668,
"kl": 0.0351781653589569,
"learning_rate": 1.163157894736842e-06,
"loss": 0.0002,
"step": 779
},
{
"clip_ratio": 0.00028669723542407155,
"epoch": 0.1064991807755325,
"grad_norm": 0.04101695492863655,
"kl": 0.03485118242679164,
"learning_rate": 1.1578947368421053e-06,
"loss": 0.0002,
"step": 780
},
{
"clip_ratio": 0.0012449884961824864,
"completion_length": 144.90625,
"epoch": 0.10663571818678318,
"grad_norm": 0.09758393466472626,
"kl": 0.037451187847182155,
"learning_rate": 1.1526315789473686e-06,
"loss": 0.0005,
"num_tokens": 2204517.0,
"reward": 0.3812500238418579,
"reward_std": 0.1948557198047638,
"rewards/reward_fn": 0.3812500238418579,
"step": 781
},
{
"clip_ratio": 0.0007635208748979494,
"epoch": 0.10677225559803386,
"grad_norm": 0.09678144752979279,
"kl": 0.03737691760761663,
"learning_rate": 1.1473684210526316e-06,
"loss": 0.0005,
"step": 782
},
{
"clip_ratio": 0.00034340660204179585,
"epoch": 0.10690879300928455,
"grad_norm": 0.0968538299202919,
"kl": 0.03713806488667615,
"learning_rate": 1.1421052631578947e-06,
"loss": 0.0003,
"step": 783
},
{
"clip_ratio": 0.000750611608964391,
"epoch": 0.10704533042053523,
"grad_norm": 0.09521595388650894,
"kl": 0.037653202831279486,
"learning_rate": 1.136842105263158e-06,
"loss": 0.0,
"step": 784
},
{
"clip_ratio": 0.0013667781895492226,
"completion_length": 131.09375,
"epoch": 0.1071818678317859,
"grad_norm": 0.145091250538826,
"kl": 0.03401468286756426,
"learning_rate": 1.1315789473684213e-06,
"loss": 0.0001,
"num_tokens": 2216008.0,
"reward": 0.746874988079071,
"reward_std": 0.29865381121635437,
"rewards/reward_fn": 0.746874988079071,
"step": 785
},
{
"clip_ratio": 0.0008191931410692632,
"epoch": 0.1073184052430366,
"grad_norm": 0.14306364953517914,
"kl": 0.03373881638981402,
"learning_rate": 1.1263157894736842e-06,
"loss": -0.0003,
"step": 786
},
{
"clip_ratio": 0.0,
"epoch": 0.10745494265428727,
"grad_norm": 0.1369042545557022,
"kl": 0.03430832191952504,
"learning_rate": 1.1210526315789474e-06,
"loss": -0.0004,
"step": 787
},
{
"clip_ratio": 0.0005872874171473086,
"epoch": 0.10759148006553795,
"grad_norm": 0.1372627466917038,
"kl": 0.03363573501701467,
"learning_rate": 1.1157894736842106e-06,
"loss": -0.0013,
"step": 788
},
{
"clip_ratio": 0.0,
"completion_length": 128.40625,
"epoch": 0.10772801747678865,
"grad_norm": 0.05001708120107651,
"kl": 0.03717817255528644,
"learning_rate": 1.110526315789474e-06,
"loss": 0.0003,
"num_tokens": 2226477.0,
"reward": 0.5218750238418579,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.5218750238418579,
"step": 789
},
{
"clip_ratio": 0.0,
"epoch": 0.10786455488803932,
"grad_norm": 0.047382958233356476,
"kl": 0.0376498686382547,
"learning_rate": 1.1052631578947369e-06,
"loss": 0.0003,
"step": 790
},
{
"clip_ratio": 0.0,
"epoch": 0.10800109229929,
"grad_norm": 0.048519086092710495,
"kl": 0.03672667942009866,
"learning_rate": 1.1e-06,
"loss": 0.0003,
"step": 791
},
{
"clip_ratio": 0.0,
"epoch": 0.1081376297105407,
"grad_norm": 0.04772576689720154,
"kl": 0.03647302172612399,
"learning_rate": 1.0947368421052632e-06,
"loss": 0.0002,
"step": 792
},
{
"clip_ratio": 0.0006341192492982373,
"completion_length": 131.53125,
"epoch": 0.10827416712179137,
"grad_norm": 0.08512444794178009,
"kl": 0.028109061560826376,
"learning_rate": 1.0894736842105264e-06,
"loss": 0.0001,
"num_tokens": 2238058.0,
"reward": 0.8031250238418579,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.8031250238418579,
"step": 793
},
{
"clip_ratio": 0.0,
"epoch": 0.10841070453304205,
"grad_norm": 0.08351006358861923,
"kl": 0.028101337986299768,
"learning_rate": 1.0842105263157895e-06,
"loss": 0.0001,
"step": 794
},
{
"clip_ratio": 0.0,
"epoch": 0.10854724194429273,
"grad_norm": 0.08248769491910934,
"kl": 0.028218604769790545,
"learning_rate": 1.0789473684210527e-06,
"loss": -0.0001,
"step": 795
},
{
"clip_ratio": 0.0003955696302000433,
"epoch": 0.10868377935554342,
"grad_norm": 0.08255155384540558,
"kl": 0.028063812758773565,
"learning_rate": 1.0736842105263159e-06,
"loss": -0.0003,
"step": 796
},
{
"clip_ratio": 0.00044361942855175585,
"completion_length": 125.34375,
"epoch": 0.1088203167667941,
"grad_norm": 0.09224527329206467,
"kl": 0.033332623599562794,
"learning_rate": 1.068421052631579e-06,
"loss": 0.0005,
"num_tokens": 2250205.0,
"reward": 0.6906249523162842,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.6906249523162842,
"step": 797
},
{
"clip_ratio": 0.0,
"epoch": 0.10895685417804478,
"grad_norm": 0.09290765970945358,
"kl": 0.033241317549254745,
"learning_rate": 1.0631578947368422e-06,
"loss": 0.0003,
"step": 798
},
{
"clip_ratio": 0.0,
"epoch": 0.10909339158929547,
"grad_norm": 0.09002580493688583,
"kl": 0.03237891127355397,
"learning_rate": 1.0578947368421054e-06,
"loss": 0.0,
"step": 799
},
{
"clip_ratio": 0.000240384615608491,
"epoch": 0.10922992900054615,
"grad_norm": 0.09006845206022263,
"kl": 0.0326729342341423,
"learning_rate": 1.0526315789473685e-06,
"loss": -0.0002,
"step": 800
},
{
"clip_ratio": 0.0003324467979837209,
"completion_length": 115.53125,
"epoch": 0.10936646641179683,
"grad_norm": 0.05152610316872597,
"kl": 0.031394801451824605,
"learning_rate": 1.0473684210526317e-06,
"loss": 0.0005,
"num_tokens": 2260810.0,
"reward": 0.71875,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.71875,
"step": 801
},
{
"clip_ratio": 0.0003324467979837209,
"epoch": 0.10950300382304752,
"grad_norm": 0.051167577505111694,
"kl": 0.03137708600843325,
"learning_rate": 1.0421052631578949e-06,
"loss": 0.0004,
"step": 802
},
{
"clip_ratio": 0.0,
"epoch": 0.1096395412342982,
"grad_norm": 0.05100513994693756,
"kl": 0.03141244366997853,
"learning_rate": 1.036842105263158e-06,
"loss": 0.0003,
"step": 803
},
{
"clip_ratio": 0.0,
"epoch": 0.10977607864554888,
"grad_norm": 0.0502689927816391,
"kl": 0.03105094050988555,
"learning_rate": 1.0315789473684212e-06,
"loss": 0.0002,
"step": 804
},
{
"clip_ratio": 0.0001990445889532566,
"completion_length": 132.75,
"epoch": 0.10991261605679957,
"grad_norm": 0.06489317119121552,
"kl": 0.034109927713871,
"learning_rate": 1.0263157894736843e-06,
"loss": 0.0004,
"num_tokens": 2272318.0,
"reward": 0.831250011920929,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.831250011920929,
"step": 805
},
{
"clip_ratio": 0.0004087761335540563,
"epoch": 0.11004915346805025,
"grad_norm": 0.058789148926734924,
"kl": 0.03437470211065374,
"learning_rate": 1.0210526315789475e-06,
"loss": 0.0005,
"step": 806
},
{
"clip_ratio": 0.00020973154460079968,
"epoch": 0.11018569087930093,
"grad_norm": 0.06509160250425339,
"kl": 0.034245212213136256,
"learning_rate": 1.0157894736842105e-06,
"loss": 0.0004,
"step": 807
},
{
"clip_ratio": 0.0,
"epoch": 0.1103222282905516,
"grad_norm": 0.0659160166978836,
"kl": 0.03385831121704541,
"learning_rate": 1.0105263157894738e-06,
"loss": 0.0002,
"step": 808
},
{
"clip_ratio": 0.0010227008606307209,
"completion_length": 126.8125,
"epoch": 0.1104587657018023,
"grad_norm": 0.10646427422761917,
"kl": 0.03514612466096878,
"learning_rate": 1.005263157894737e-06,
"loss": 0.0004,
"num_tokens": 2283260.0,
"reward": 0.6625000238418579,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.6625000238418579,
"step": 809
},
{
"clip_ratio": 0.0009959485905710608,
"epoch": 0.11059530311305298,
"grad_norm": 0.10746331512928009,
"kl": 0.03498730491264723,
"learning_rate": 1.0000000000000002e-06,
"loss": 0.0004,
"step": 810
},
{
"clip_ratio": 0.001203794716275297,
"epoch": 0.11073184052430365,
"grad_norm": 0.1056860014796257,
"kl": 0.03553603668115102,
"learning_rate": 9.947368421052631e-07,
"loss": 0.0003,
"step": 811
},
{
"clip_ratio": 0.0003511235991027206,
"epoch": 0.11086837793555435,
"grad_norm": 0.1063576340675354,
"kl": 0.034650685905944556,
"learning_rate": 9.894736842105265e-07,
"loss": -0.0003,
"step": 812
},
{
"clip_ratio": 0.0005857369105797261,
"completion_length": 108.96875,
"epoch": 0.11100491534680502,
"grad_norm": 0.13227391242980957,
"kl": 0.03337117409682833,
"learning_rate": 9.842105263157897e-07,
"loss": 0.0005,
"num_tokens": 2294083.0,
"reward": 0.746874988079071,
"reward_std": 0.2337019145488739,
"rewards/reward_fn": 0.746874988079071,
"step": 813
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.1111414527580557,
"grad_norm": 0.12803682684898376,
"kl": 0.032956252398435026,
"learning_rate": 9.789473684210526e-07,
"loss": -0.0,
"step": 814
},
{
"clip_ratio": 0.0008287565433420241,
"epoch": 0.1112779901693064,
"grad_norm": 0.12848548591136932,
"kl": 0.032824013265781105,
"learning_rate": 9.736842105263158e-07,
"loss": -0.0,
"step": 815
},
{
"clip_ratio": 0.0002460629912093282,
"epoch": 0.11141452758055707,
"grad_norm": 0.11636755615472794,
"kl": 0.032896427903324366,
"learning_rate": 9.68421052631579e-07,
"loss": -0.0004,
"step": 816
},
{
"clip_ratio": 0.0,
"completion_length": 119.65625,
"epoch": 0.11155106499180775,
"grad_norm": 0.0969424620270729,
"kl": 0.03230866280500777,
"learning_rate": 9.631578947368423e-07,
"loss": 0.0001,
"num_tokens": 2304824.0,
"reward": 0.6343749761581421,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.6343749761581421,
"step": 817
},
{
"clip_ratio": 0.00019778481510002166,
"epoch": 0.11168760240305844,
"grad_norm": 0.09678807854652405,
"kl": 0.032764478790340945,
"learning_rate": 9.578947368421053e-07,
"loss": 0.0002,
"step": 818
},
{
"clip_ratio": 0.00047374211135320365,
"epoch": 0.11182413981430912,
"grad_norm": 0.09999542683362961,
"kl": 0.03256647096714005,
"learning_rate": 9.526315789473685e-07,
"loss": 0.0002,
"step": 819
},
{
"clip_ratio": 0.00047374211135320365,
"epoch": 0.1119606772255598,
"grad_norm": 0.0940428152680397,
"kl": 0.03249253722606227,
"learning_rate": 9.473684210526317e-07,
"loss": -0.0002,
"step": 820
},
{
"clip_ratio": 0.0004139072843827307,
"completion_length": 129.6875,
"epoch": 0.11209721463681048,
"grad_norm": 0.08134789764881134,
"kl": 0.04074790241429582,
"learning_rate": 9.421052631578948e-07,
"loss": 0.0004,
"num_tokens": 2315998.0,
"reward": 0.746874988079071,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.746874988079071,
"step": 821
},
{
"clip_ratio": 0.0006293771584751084,
"epoch": 0.11223375204806117,
"grad_norm": 0.07964572310447693,
"kl": 0.040875735925510526,
"learning_rate": 9.368421052631579e-07,
"loss": 0.0005,
"step": 822
},
{
"clip_ratio": 0.00020695364219136536,
"epoch": 0.11237028945931185,
"grad_norm": 0.07946870476007462,
"kl": 0.0408237244701013,
"learning_rate": 9.315789473684212e-07,
"loss": 0.0001,
"step": 823
},
{
"clip_ratio": 0.00020695364219136536,
"epoch": 0.11250682687056253,
"grad_norm": 0.07891543954610825,
"kl": 0.041721748071722686,
"learning_rate": 9.263157894736844e-07,
"loss": -0.0,
"step": 824
},
{
"clip_ratio": 0.0,
"completion_length": 125.1875,
"epoch": 0.11264336428181322,
"grad_norm": 0.04926425591111183,
"kl": 0.03286067905719392,
"learning_rate": 9.210526315789474e-07,
"loss": 0.0004,
"num_tokens": 2327484.0,
"reward": 0.9437500238418579,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.9437500238418579,
"step": 825
},
{
"clip_ratio": 0.00040524803625885397,
"epoch": 0.1127799016930639,
"grad_norm": 0.04810812696814537,
"kl": 0.03193527160328813,
"learning_rate": 9.157894736842106e-07,
"loss": 0.0003,
"step": 826
},
{
"clip_ratio": 0.00042229730752296746,
"epoch": 0.11291643910431458,
"grad_norm": 0.04899256303906441,
"kl": 0.03242765832692385,
"learning_rate": 9.105263157894737e-07,
"loss": 0.0003,
"step": 827
},
{
"clip_ratio": 0.0003544972714735195,
"epoch": 0.11305297651556527,
"grad_norm": 0.049238696694374084,
"kl": 0.03237058556987904,
"learning_rate": 9.05263157894737e-07,
"loss": 0.0003,
"step": 828
},
{
"clip_ratio": 0.0005081300623714924,
"completion_length": 125.4375,
"epoch": 0.11318951392681595,
"grad_norm": 0.13235945999622345,
"kl": 0.03304180080885999,
"learning_rate": 9.000000000000001e-07,
"loss": 0.0007,
"num_tokens": 2338158.0,
"reward": 0.7749999761581421,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.7749999761581421,
"step": 829
},
{
"clip_ratio": 0.0011491246259538457,
"epoch": 0.11332605133806663,
"grad_norm": 0.13015788793563843,
"kl": 0.033487798733403906,
"learning_rate": 8.947368421052632e-07,
"loss": 0.0004,
"step": 830
},
{
"clip_ratio": 0.00040650405571796,
"epoch": 0.11346258874931732,
"grad_norm": 0.12753689289093018,
"kl": 0.033373525278875604,
"learning_rate": 8.894736842105264e-07,
"loss": 0.0001,
"step": 831
},
{
"clip_ratio": 0.00022163119865581393,
"epoch": 0.113599126160568,
"grad_norm": 0.11997953057289124,
"kl": 0.03349483574857004,
"learning_rate": 8.842105263157895e-07,
"loss": -0.0002,
"step": 832
},
{
"clip_ratio": 0.0005183477042010054,
"completion_length": 131.71875,
"epoch": 0.11373566357181868,
"grad_norm": 0.1369657963514328,
"kl": 0.03463814881979488,
"learning_rate": 8.789473684210527e-07,
"loss": 0.0006,
"num_tokens": 2349773.0,
"reward": 0.6343750357627869,
"reward_std": 0.34620189666748047,
"rewards/reward_fn": 0.6343750357627869,
"step": 833
},
{
"clip_ratio": 0.001799030287656933,
"epoch": 0.11387220098306935,
"grad_norm": 0.13694268465042114,
"kl": 0.035131270095007494,
"learning_rate": 8.736842105263159e-07,
"loss": 0.0007,
"step": 834
},
{
"clip_ratio": 0.00014400921645574272,
"epoch": 0.11400873839432005,
"grad_norm": 0.12898842990398407,
"kl": 0.034667212778003886,
"learning_rate": 8.68421052631579e-07,
"loss": 0.0001,
"step": 835
},
{
"clip_ratio": 0.0007648299215361476,
"epoch": 0.11414527580557073,
"grad_norm": 0.1323985755443573,
"kl": 0.03442463994724676,
"learning_rate": 8.631578947368421e-07,
"loss": -0.0004,
"step": 836
},
{
"clip_ratio": 0.00035511364694684744,
"completion_length": 134.71875,
"epoch": 0.1142818132168214,
"grad_norm": 0.07983018457889557,
"kl": 0.03501651559781749,
"learning_rate": 8.578947368421054e-07,
"loss": 0.0003,
"num_tokens": 2361200.0,
"reward": 0.690625011920929,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.690625011920929,
"step": 837
},
{
"clip_ratio": 0.0,
"epoch": 0.1144183506280721,
"grad_norm": 0.07975803315639496,
"kl": 0.034936482581542805,
"learning_rate": 8.526315789473685e-07,
"loss": 0.0003,
"step": 838
},
{
"clip_ratio": 0.0,
"epoch": 0.11455488803932277,
"grad_norm": 0.07610788196325302,
"kl": 0.03467000252567232,
"learning_rate": 8.473684210526316e-07,
"loss": 0.0001,
"step": 839
},
{
"clip_ratio": 0.0,
"epoch": 0.11469142545057345,
"grad_norm": 0.07802704721689224,
"kl": 0.03485574647493195,
"learning_rate": 8.421052631578948e-07,
"loss": -0.0,
"step": 840
},
{
"clip_ratio": 0.0,
"completion_length": 133.0625,
"epoch": 0.11482796286182415,
"grad_norm": 0.04737474024295807,
"kl": 0.0320931714377366,
"learning_rate": 8.36842105263158e-07,
"loss": 0.0003,
"num_tokens": 2372558.0,
"reward": 0.8312499523162842,
"reward_std": 0.06495190411806107,
"rewards/reward_fn": 0.8312499523162842,
"step": 841
},
{
"clip_ratio": 0.0001220703125,
"epoch": 0.11496450027307482,
"grad_norm": 0.0413704551756382,
"kl": 0.03146939189173281,
"learning_rate": 8.315789473684212e-07,
"loss": 0.0002,
"step": 842
},
{
"clip_ratio": 0.0,
"epoch": 0.1151010376843255,
"grad_norm": 0.041506968438625336,
"kl": 0.03132388353697024,
"learning_rate": 8.263157894736843e-07,
"loss": 0.0002,
"step": 843
},
{
"clip_ratio": 0.0,
"epoch": 0.1152375750955762,
"grad_norm": 0.038393907248973846,
"kl": 0.031428944814251736,
"learning_rate": 8.210526315789474e-07,
"loss": 0.0001,
"step": 844
},
{
"clip_ratio": 0.0,
"completion_length": 130.46875,
"epoch": 0.11537411250682687,
"grad_norm": 0.062188491225242615,
"kl": 0.036099575518164784,
"learning_rate": 8.157894736842106e-07,
"loss": 0.0002,
"num_tokens": 2384597.0,
"reward": 0.5218750238418579,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.5218750238418579,
"step": 845
},
{
"clip_ratio": 0.0002367424312978983,
"epoch": 0.11551064991807755,
"grad_norm": 0.059262264519929886,
"kl": 0.035657460655784234,
"learning_rate": 8.105263157894736e-07,
"loss": 0.0001,
"step": 846
},
{
"clip_ratio": 0.0002367424312978983,
"epoch": 0.11564718732932823,
"grad_norm": 0.05964317545294762,
"kl": 0.03621940390439704,
"learning_rate": 8.052631578947369e-07,
"loss": 0.0002,
"step": 847
},
{
"clip_ratio": 0.0,
"epoch": 0.11578372474057892,
"grad_norm": 0.0571606270968914,
"kl": 0.03622490944690071,
"learning_rate": 8.000000000000001e-07,
"loss": 0.0001,
"step": 848
},
{
"clip_ratio": 0.0009445661416975781,
"completion_length": 135.84375,
"epoch": 0.1159202621518296,
"grad_norm": 0.07988615334033966,
"kl": 0.03682940514408983,
"learning_rate": 7.947368421052632e-07,
"loss": 0.0005,
"num_tokens": 2395576.0,
"reward": 0.7468750476837158,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.7468750476837158,
"step": 849
},
{
"clip_ratio": 0.000547244620975107,
"epoch": 0.11605679956308028,
"grad_norm": 0.08060329407453537,
"kl": 0.03640499952598475,
"learning_rate": 7.894736842105263e-07,
"loss": 0.0004,
"step": 850
},
{
"clip_ratio": 0.0003555268340278417,
"epoch": 0.11619333697433097,
"grad_norm": 0.07949917018413544,
"kl": 0.03623723401688039,
"learning_rate": 7.842105263157896e-07,
"loss": 0.0002,
"step": 851
},
{
"clip_ratio": 0.0009964463242795318,
"epoch": 0.11632987438558165,
"grad_norm": 0.07702900469303131,
"kl": 0.036871126416372135,
"learning_rate": 7.789473684210527e-07,
"loss": 0.0003,
"step": 852
},
{
"clip_ratio": 0.0005859898083144799,
"completion_length": 120.15625,
"epoch": 0.11646641179683233,
"grad_norm": 0.0983206108212471,
"kl": 0.03288867976516485,
"learning_rate": 7.736842105263158e-07,
"loss": 0.0004,
"num_tokens": 2406365.0,
"reward": 0.746874988079071,
"reward_std": 0.2337018996477127,
"rewards/reward_fn": 0.746874988079071,
"step": 853
},
{
"clip_ratio": 0.0006730413442710415,
"epoch": 0.11660294920808302,
"grad_norm": 0.09928011149168015,
"kl": 0.032499166671186686,
"learning_rate": 7.684210526315789e-07,
"loss": 0.0002,
"step": 854
},
{
"clip_ratio": 0.0004937214544042945,
"epoch": 0.1167394866193337,
"grad_norm": 0.0939321517944336,
"kl": 0.03273730678483844,
"learning_rate": 7.631578947368422e-07,
"loss": -0.0,
"step": 855
},
{
"clip_ratio": 0.00020833333837799728,
"epoch": 0.11687602403058438,
"grad_norm": 0.09672950953245163,
"kl": 0.03311119574937038,
"learning_rate": 7.578947368421054e-07,
"loss": -0.0002,
"step": 856
},
{
"clip_ratio": 0.0002840909000951797,
"completion_length": 133.40625,
"epoch": 0.11701256144183507,
"grad_norm": 0.056489668786525726,
"kl": 0.030313314258819446,
"learning_rate": 7.526315789473684e-07,
"loss": 0.0004,
"num_tokens": 2417958.0,
"reward": 0.7749999761581421,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.7749999761581421,
"step": 857
},
{
"clip_ratio": 0.0,
"epoch": 0.11714909885308575,
"grad_norm": 0.0562896803021431,
"kl": 0.03055126141407527,
"learning_rate": 7.473684210526316e-07,
"loss": 0.0004,
"step": 858
},
{
"clip_ratio": 0.0003907771751983091,
"epoch": 0.11728563626433643,
"grad_norm": 0.05616592615842819,
"kl": 0.030165656498866156,
"learning_rate": 7.421052631578949e-07,
"loss": 0.0004,
"step": 859
},
{
"clip_ratio": 0.0004477034672163427,
"epoch": 0.1174221736755871,
"grad_norm": 0.05474083498120308,
"kl": 0.030640476441476494,
"learning_rate": 7.368421052631579e-07,
"loss": 0.0002,
"step": 860
},
{
"clip_ratio": 0.0,
"completion_length": 129.6875,
"epoch": 0.1175587110868378,
"grad_norm": 0.10344516485929489,
"kl": 0.037577818031422794,
"learning_rate": 7.315789473684211e-07,
"loss": 0.0003,
"num_tokens": 2429480.0,
"reward": 0.71875,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.71875,
"step": 861
},
{
"clip_ratio": 0.00020032051543239504,
"epoch": 0.11769524849808848,
"grad_norm": 0.10587334632873535,
"kl": 0.03769170871237293,
"learning_rate": 7.263157894736843e-07,
"loss": 0.0002,
"step": 862
},
{
"clip_ratio": 0.0004006410308647901,
"epoch": 0.11783178590933915,
"grad_norm": 0.10316218435764313,
"kl": 0.037826200015842915,
"learning_rate": 7.210526315789475e-07,
"loss": 0.0001,
"step": 863
},
{
"clip_ratio": 0.0004485645913518965,
"epoch": 0.11796832332058985,
"grad_norm": 0.1059485375881195,
"kl": 0.037548283056821674,
"learning_rate": 7.157894736842106e-07,
"loss": -0.0002,
"step": 864
},
{
"clip_ratio": 0.00033602150506339967,
"completion_length": 132.25,
"epoch": 0.11810486073184052,
"grad_norm": 0.09281036257743835,
"kl": 0.03125832715886645,
"learning_rate": 7.105263157894737e-07,
"loss": 0.0002,
"num_tokens": 2441072.0,
"reward": 0.46562501788139343,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.46562501788139343,
"step": 865
},
{
"clip_ratio": 0.0005000000237487257,
"epoch": 0.1182413981430912,
"grad_norm": 0.09430094808340073,
"kl": 0.03168348016333766,
"learning_rate": 7.052631578947369e-07,
"loss": 0.0003,
"step": 866
},
{
"clip_ratio": 0.0002500000118743628,
"epoch": 0.1183779355543419,
"grad_norm": 0.0902150422334671,
"kl": 0.03158555779373273,
"learning_rate": 7.000000000000001e-07,
"loss": 0.0002,
"step": 867
},
{
"clip_ratio": 0.00019654087373055518,
"epoch": 0.11851447296559257,
"grad_norm": 0.09070498496294022,
"kl": 0.031180568737909198,
"learning_rate": 6.947368421052631e-07,
"loss": -0.0002,
"step": 868
},
{
"clip_ratio": 0.00033602150506339967,
"completion_length": 110.90625,
"epoch": 0.11865101037684325,
"grad_norm": 0.06536060571670532,
"kl": 0.031654038379201666,
"learning_rate": 6.894736842105264e-07,
"loss": 0.0004,
"num_tokens": 2451289.0,
"reward": 0.6625000238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.6625000238418579,
"step": 869
},
{
"clip_ratio": 0.0010303832968929783,
"epoch": 0.11878754778809394,
"grad_norm": 0.06535768508911133,
"kl": 0.03135678684338927,
"learning_rate": 6.842105263157896e-07,
"loss": 0.0005,
"step": 870
},
{
"clip_ratio": 0.0011440572561696172,
"epoch": 0.11892408519934462,
"grad_norm": 0.06512617319822311,
"kl": 0.031891329621430486,
"learning_rate": 6.789473684210526e-07,
"loss": 0.0004,
"step": 871
},
{
"clip_ratio": 0.001402321708155796,
"epoch": 0.1190606226105953,
"grad_norm": 0.06582646071910858,
"kl": 0.03158884108415805,
"learning_rate": 6.736842105263158e-07,
"loss": 0.0004,
"step": 872
},
{
"clip_ratio": 0.00038580247201025486,
"completion_length": 111.09375,
"epoch": 0.11919716002184598,
"grad_norm": 0.0955490916967392,
"kl": 0.038142890349263325,
"learning_rate": 6.684210526315791e-07,
"loss": 0.0004,
"num_tokens": 2462664.0,
"reward": 0.7468750476837158,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.7468750476837158,
"step": 873
},
{
"clip_ratio": 0.000405844155466184,
"epoch": 0.11933369743309667,
"grad_norm": 0.09661541134119034,
"kl": 0.037784790445584804,
"learning_rate": 6.631578947368422e-07,
"loss": 0.0003,
"step": 874
},
{
"clip_ratio": 0.0006363249995047227,
"epoch": 0.11947023484434735,
"grad_norm": 0.0970974862575531,
"kl": 0.03744145468226634,
"learning_rate": 6.578947368421053e-07,
"loss": 0.0003,
"step": 875
},
{
"clip_ratio": 0.0003878333227476105,
"epoch": 0.11960677225559803,
"grad_norm": 0.09769237041473389,
"kl": 0.03685220205807127,
"learning_rate": 6.526315789473684e-07,
"loss": 0.0001,
"step": 876
},
{
"clip_ratio": 0.0003955696302000433,
"completion_length": 116.625,
"epoch": 0.11974330966684872,
"grad_norm": 0.08843936026096344,
"kl": 0.03245319478446618,
"learning_rate": 6.473684210526317e-07,
"loss": 0.0003,
"num_tokens": 2473228.0,
"reward": 0.859375,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.859375,
"step": 877
},
{
"clip_ratio": 0.0,
"epoch": 0.1198798470780994,
"grad_norm": 0.08856622129678726,
"kl": 0.032318223151378334,
"learning_rate": 6.421052631578948e-07,
"loss": 0.0002,
"step": 878
},
{
"clip_ratio": 0.00016191709437407553,
"epoch": 0.12001638448935008,
"grad_norm": 0.08873509615659714,
"kl": 0.03196106932591647,
"learning_rate": 6.368421052631579e-07,
"loss": 0.0,
"step": 879
},
{
"clip_ratio": 0.0003955696302000433,
"epoch": 0.12015292190060077,
"grad_norm": 0.08736385405063629,
"kl": 0.03180155347217806,
"learning_rate": 6.315789473684211e-07,
"loss": 0.0002,
"step": 880
},
{
"clip_ratio": 0.00028669723542407155,
"completion_length": 144.90625,
"epoch": 0.12028945931185145,
"grad_norm": 0.0820450633764267,
"kl": 0.037947153381537646,
"learning_rate": 6.263157894736844e-07,
"loss": 0.0004,
"num_tokens": 2485273.0,
"reward": 0.6625000238418579,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.6625000238418579,
"step": 881
},
{
"clip_ratio": 0.0006903430767124519,
"epoch": 0.12042599672310213,
"grad_norm": 0.08431774377822876,
"kl": 0.03700205200584605,
"learning_rate": 6.210526315789474e-07,
"loss": 0.0005,
"step": 882
},
{
"clip_ratio": 0.0,
"epoch": 0.12056253413435282,
"grad_norm": 0.08097940683364868,
"kl": 0.03734048001933843,
"learning_rate": 6.157894736842106e-07,
"loss": 0.0002,
"step": 883
},
{
"clip_ratio": 0.00020833333837799728,
"epoch": 0.1206990715456035,
"grad_norm": 0.0801195502281189,
"kl": 0.037502437888178974,
"learning_rate": 6.105263157894738e-07,
"loss": 0.0002,
"step": 884
},
{
"clip_ratio": 0.0008994654635898769,
"completion_length": 114.625,
"epoch": 0.12083560895685418,
"grad_norm": 0.09578239172697067,
"kl": 0.03379804195719771,
"learning_rate": 6.052631578947369e-07,
"loss": 0.0004,
"num_tokens": 2496109.0,
"reward": 0.7468750476837158,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.7468750476837158,
"step": 885
},
{
"clip_ratio": 0.0006313131307251751,
"epoch": 0.12097214636810485,
"grad_norm": 0.09582193195819855,
"kl": 0.033672553807264194,
"learning_rate": 6.000000000000001e-07,
"loss": 0.0001,
"step": 886
},
{
"clip_ratio": 0.0006313131307251751,
"epoch": 0.12110868377935555,
"grad_norm": 0.09397005289793015,
"kl": 0.03385620258632116,
"learning_rate": 5.947368421052632e-07,
"loss": 0.0002,
"step": 887
},
{
"clip_ratio": 0.00018825300503522158,
"epoch": 0.12124522119060623,
"grad_norm": 0.09514564275741577,
"kl": 0.03451714990660548,
"learning_rate": 5.894736842105263e-07,
"loss": 0.0001,
"step": 888
},
{
"clip_ratio": 0.00015862943837419152,
"completion_length": 124.9375,
"epoch": 0.1213817586018569,
"grad_norm": 0.08339914679527283,
"kl": 0.037555598362814635,
"learning_rate": 5.842105263157896e-07,
"loss": 0.0004,
"num_tokens": 2507443.0,
"reward": 0.690625011920929,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.690625011920929,
"step": 889
},
{
"clip_ratio": 0.0005922052368987352,
"epoch": 0.1215182960131076,
"grad_norm": 0.08334753662347794,
"kl": 0.03709682886255905,
"learning_rate": 5.789473684210526e-07,
"loss": 0.0002,
"step": 890
},
{
"clip_ratio": 0.0005697215965483338,
"epoch": 0.12165483342435827,
"grad_norm": 0.08741384744644165,
"kl": 0.03697336750337854,
"learning_rate": 5.736842105263158e-07,
"loss": 0.0005,
"step": 891
},
{
"clip_ratio": 0.00018825300503522158,
"epoch": 0.12179137083560895,
"grad_norm": 0.08283984661102295,
"kl": 0.03640045766951516,
"learning_rate": 5.68421052631579e-07,
"loss": 0.0,
"step": 892
},
{
"clip_ratio": 0.0,
"completion_length": 128.8125,
"epoch": 0.12192790824685965,
"grad_norm": 0.10741044580936432,
"kl": 0.03149555827258155,
"learning_rate": 5.631578947368421e-07,
"loss": 0.0003,
"num_tokens": 2518249.0,
"reward": 0.46562501788139343,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.46562501788139343,
"step": 893
},
{
"clip_ratio": 0.0006387395842466503,
"epoch": 0.12206444565811032,
"grad_norm": 0.10868413001298904,
"kl": 0.03139789224951528,
"learning_rate": 5.578947368421053e-07,
"loss": 0.0002,
"step": 894
},
{
"clip_ratio": 0.00042229730752296746,
"epoch": 0.122200983069361,
"grad_norm": 0.1074204370379448,
"kl": 0.03123481632792391,
"learning_rate": 5.526315789473684e-07,
"loss": 0.0001,
"step": 895
},
{
"clip_ratio": 0.00021114865376148373,
"epoch": 0.1223375204806117,
"grad_norm": 0.10637306421995163,
"kl": 0.03106152272084728,
"learning_rate": 5.473684210526316e-07,
"loss": 0.0,
"step": 896
},
{
"clip_ratio": 0.00020032051543239504,
"completion_length": 132.875,
"epoch": 0.12247405789186237,
"grad_norm": 0.06850402057170868,
"kl": 0.03606277168728411,
"learning_rate": 5.421052631578948e-07,
"loss": 0.0003,
"num_tokens": 2529705.0,
"reward": 0.6625000238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.6625000238418579,
"step": 897
},
{
"clip_ratio": 0.00022321428696159273,
"epoch": 0.12261059530311305,
"grad_norm": 0.06820071488618851,
"kl": 0.03548625635448843,
"learning_rate": 5.368421052631579e-07,
"loss": 0.0002,
"step": 898
},
{
"clip_ratio": 0.00020032051543239504,
"epoch": 0.12274713271436373,
"grad_norm": 0.0653720423579216,
"kl": 0.03564649049076252,
"learning_rate": 5.315789473684211e-07,
"loss": 0.0002,
"step": 899
},
{
"clip_ratio": 0.00020032051543239504,
"epoch": 0.12288367012561442,
"grad_norm": 0.0647495910525322,
"kl": 0.03579084068769589,
"learning_rate": 5.263157894736843e-07,
"loss": 0.0001,
"step": 900
},
{
"clip_ratio": 0.000712268622010015,
"completion_length": 141.59375,
"epoch": 0.1230202075368651,
"grad_norm": 0.13548840582370758,
"kl": 0.037526937725488096,
"learning_rate": 5.210526315789474e-07,
"loss": 0.0007,
"num_tokens": 2541880.0,
"reward": 0.49375003576278687,
"reward_std": 0.30735570192337036,
"rewards/reward_fn": 0.49375003576278687,
"step": 901
},
{
"clip_ratio": 0.001696178747806698,
"epoch": 0.12315674494811578,
"grad_norm": 0.13360342383384705,
"kl": 0.03651306492974982,
"learning_rate": 5.157894736842106e-07,
"loss": 0.0005,
"step": 902
},
{
"clip_ratio": 0.0004890543350484222,
"epoch": 0.12329328235936647,
"grad_norm": 0.13228605687618256,
"kl": 0.03699741544551216,
"learning_rate": 5.105263157894738e-07,
"loss": 0.0004,
"step": 903
},
{
"clip_ratio": 0.000613276133663021,
"epoch": 0.12342981977061715,
"grad_norm": 0.13343238830566406,
"kl": 0.03710320312529802,
"learning_rate": 5.052631578947369e-07,
"loss": 0.0004,
"step": 904
},
{
"clip_ratio": 0.0,
"completion_length": 121.75,
"epoch": 0.12356635718186783,
"grad_norm": 0.10324323177337646,
"kl": 0.03289288666564971,
"learning_rate": 5.000000000000001e-07,
"loss": 0.0004,
"num_tokens": 2552476.0,
"reward": 0.6343749761581421,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.6343749761581421,
"step": 905
},
{
"clip_ratio": 0.000510540179675445,
"epoch": 0.12370289459311852,
"grad_norm": 0.10418035089969635,
"kl": 0.03300356210093014,
"learning_rate": 4.947368421052632e-07,
"loss": 0.0003,
"step": 906
},
{
"clip_ratio": 0.0002840909000951797,
"epoch": 0.1238394320043692,
"grad_norm": 0.10630179196596146,
"kl": 0.033201081794686615,
"learning_rate": 4.894736842105263e-07,
"loss": 0.0002,
"step": 907
},
{
"clip_ratio": 0.0,
"epoch": 0.12397596941561988,
"grad_norm": 0.10277502238750458,
"kl": 0.032689066021703184,
"learning_rate": 4.842105263157895e-07,
"loss": 0.0,
"step": 908
},
{
"clip_ratio": 0.0,
"completion_length": 118.21875,
"epoch": 0.12411250682687057,
"grad_norm": 0.06736943870782852,
"kl": 0.03596130615915172,
"learning_rate": 4.789473684210526e-07,
"loss": 0.0003,
"num_tokens": 2563159.0,
"reward": 0.9156249761581421,
"reward_std": 0.12120190262794495,
"rewards/reward_fn": 0.9156249761581421,
"step": 909
},
{
"clip_ratio": 0.00018825300503522158,
"epoch": 0.12424904423812125,
"grad_norm": 0.06819276511669159,
"kl": 0.03568592216470279,
"learning_rate": 4.7368421052631585e-07,
"loss": 0.0003,
"step": 910
},
{
"clip_ratio": 0.0,
"epoch": 0.12438558164937193,
"grad_norm": 0.06739851832389832,
"kl": 0.035914964973926544,
"learning_rate": 4.6842105263157896e-07,
"loss": 0.0002,
"step": 911
},
{
"clip_ratio": 0.0,
"epoch": 0.1245221190606226,
"grad_norm": 0.0662432387471199,
"kl": 0.03619830956449732,
"learning_rate": 4.631578947368422e-07,
"loss": 0.0002,
"step": 912
},
{
"clip_ratio": 0.0013353245303733274,
"completion_length": 120.15625,
"epoch": 0.1246586564718733,
"grad_norm": 0.12909458577632904,
"kl": 0.03360832063481212,
"learning_rate": 4.578947368421053e-07,
"loss": 0.0003,
"num_tokens": 2574240.0,
"reward": 0.6062500476837158,
"reward_std": 0.3374999761581421,
"rewards/reward_fn": 0.6062500476837158,
"step": 913
},
{
"clip_ratio": 0.0015245912363752723,
"epoch": 0.12479519388312398,
"grad_norm": 0.12952177226543427,
"kl": 0.03388803228153847,
"learning_rate": 4.526315789473685e-07,
"loss": 0.0002,
"step": 914
},
{
"clip_ratio": 0.0013912470312789083,
"epoch": 0.12493173129437465,
"grad_norm": 0.13111548125743866,
"kl": 0.03383615874918178,
"learning_rate": 4.473684210526316e-07,
"loss": 0.0,
"step": 915
},
{
"clip_ratio": 0.0012334425409790128,
"epoch": 0.12506826870562535,
"grad_norm": 0.1287565976381302,
"kl": 0.03395371185615659,
"learning_rate": 4.421052631578947e-07,
"loss": 0.0,
"step": 916
},
{
"clip_ratio": 0.0,
"completion_length": 125.53125,
"epoch": 0.125204806116876,
"grad_norm": 0.10184290260076523,
"kl": 0.03474083298351616,
"learning_rate": 4.3684210526315794e-07,
"loss": 0.0001,
"num_tokens": 2585617.0,
"reward": 0.71875,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.71875,
"step": 917
},
{
"clip_ratio": 0.00023854961909819394,
"epoch": 0.1253413435281267,
"grad_norm": 0.10121199488639832,
"kl": 0.03448459054925479,
"learning_rate": 4.3157894736842105e-07,
"loss": 0.0002,
"step": 918
},
{
"clip_ratio": 0.0,
"epoch": 0.1254778809393774,
"grad_norm": 0.09928610175848007,
"kl": 0.034620841237483546,
"learning_rate": 4.2631578947368427e-07,
"loss": 0.0,
"step": 919
},
{
"clip_ratio": 0.0,
"epoch": 0.12561441835062806,
"grad_norm": 0.10057465732097626,
"kl": 0.03436506350408308,
"learning_rate": 4.210526315789474e-07,
"loss": 0.0,
"step": 920
},
{
"clip_ratio": 0.0002367424312978983,
"completion_length": 121.5,
"epoch": 0.12575095576187875,
"grad_norm": 0.03331659734249115,
"kl": 0.033621530630625784,
"learning_rate": 4.157894736842106e-07,
"loss": 0.0004,
"num_tokens": 2596589.0,
"reward": 0.746874988079071,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.746874988079071,
"step": 921
},
{
"clip_ratio": 0.0002367424312978983,
"epoch": 0.12588749317312944,
"grad_norm": 0.03316027671098709,
"kl": 0.0338965390692465,
"learning_rate": 4.105263157894737e-07,
"loss": 0.0003,
"step": 922
},
{
"clip_ratio": 0.0002367424312978983,
"epoch": 0.1260240305843801,
"grad_norm": 0.033771876245737076,
"kl": 0.03396968066226691,
"learning_rate": 4.052631578947368e-07,
"loss": 0.0003,
"step": 923
},
{
"clip_ratio": 0.0,
"epoch": 0.1261605679956308,
"grad_norm": 0.03320735692977905,
"kl": 0.03369491477496922,
"learning_rate": 4.0000000000000003e-07,
"loss": 0.0002,
"step": 924
},
{
"clip_ratio": 0.0008623184985481203,
"completion_length": 139.21875,
"epoch": 0.1262971054068815,
"grad_norm": 0.11683438718318939,
"kl": 0.04034199519082904,
"learning_rate": 3.9473684210526315e-07,
"loss": 0.0005,
"num_tokens": 2608672.0,
"reward": 0.6062500476837158,
"reward_std": 0.289951890707016,
"rewards/reward_fn": 0.6062500476837158,
"step": 925
},
{
"clip_ratio": 0.0004209743201499805,
"epoch": 0.12643364281813216,
"grad_norm": 0.13628651201725006,
"kl": 0.03980723247514106,
"learning_rate": 3.8947368421052636e-07,
"loss": 0.0005,
"step": 926
},
{
"clip_ratio": 0.0008091448398772627,
"epoch": 0.12657018022938285,
"grad_norm": 0.12596413493156433,
"kl": 0.03970417007803917,
"learning_rate": 3.8421052631578947e-07,
"loss": 0.0005,
"step": 927
},
{
"clip_ratio": 0.001051957588060759,
"epoch": 0.12670671764063354,
"grad_norm": 0.11056431382894516,
"kl": 0.039803695428417996,
"learning_rate": 3.789473684210527e-07,
"loss": 0.0005,
"step": 928
},
{
"clip_ratio": 0.0010233541834168136,
"completion_length": 140.59375,
"epoch": 0.1268432550518842,
"grad_norm": 0.08445189893245697,
"kl": 0.02938798555987887,
"learning_rate": 3.736842105263158e-07,
"loss": 0.0006,
"num_tokens": 2620411.0,
"reward": 0.578125,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.578125,
"step": 929
},
{
"clip_ratio": 0.00040687595901545137,
"epoch": 0.1269797924631349,
"grad_norm": 0.08192367851734161,
"kl": 0.029562115902081132,
"learning_rate": 3.6842105263157896e-07,
"loss": 0.0003,
"step": 930
},
{
"clip_ratio": 0.00026483050896786153,
"epoch": 0.1271163298743856,
"grad_norm": 0.08354966342449188,
"kl": 0.029616149666253477,
"learning_rate": 3.6315789473684213e-07,
"loss": 0.0004,
"step": 931
},
{
"clip_ratio": 0.0008278935856651515,
"epoch": 0.12725286728563626,
"grad_norm": 0.08334451168775558,
"kl": 0.029312406637473032,
"learning_rate": 3.578947368421053e-07,
"loss": 0.0004,
"step": 932
},
{
"clip_ratio": 0.0,
"completion_length": 122.34375,
"epoch": 0.12738940469688695,
"grad_norm": 0.10578613728284836,
"kl": 0.028767388517735526,
"learning_rate": 3.5263157894736846e-07,
"loss": -0.0001,
"num_tokens": 2631774.0,
"reward": 0.7749999761581421,
"reward_std": 0.22499999403953552,
"rewards/reward_fn": 0.7749999761581421,
"step": 933
},
{
"clip_ratio": 0.0002500000118743628,
"epoch": 0.12752594210813764,
"grad_norm": 0.10861129313707352,
"kl": 0.02848425370757468,
"learning_rate": 3.4736842105263157e-07,
"loss": 0.0001,
"step": 934
},
{
"clip_ratio": 0.0,
"epoch": 0.1276624795193883,
"grad_norm": 0.09988290071487427,
"kl": 0.028927168430527672,
"learning_rate": 3.421052631578948e-07,
"loss": -0.0001,
"step": 935
},
{
"clip_ratio": 0.0002500000118743628,
"epoch": 0.127799016930639,
"grad_norm": 0.10976044088602066,
"kl": 0.029052481811959296,
"learning_rate": 3.368421052631579e-07,
"loss": -0.0003,
"step": 936
},
{
"clip_ratio": 0.00046764573198743165,
"completion_length": 149.4375,
"epoch": 0.1279355543418897,
"grad_norm": 0.1032148227095604,
"kl": 0.030085035221418366,
"learning_rate": 3.315789473684211e-07,
"loss": 0.0006,
"num_tokens": 2643816.0,
"reward": 0.6625000238418579,
"reward_std": 0.35490381717681885,
"rewards/reward_fn": 0.6625000238418579,
"step": 937
},
{
"clip_ratio": 0.0008250703540397808,
"epoch": 0.12807209175314035,
"grad_norm": 0.10333816707134247,
"kl": 0.029980021994560957,
"learning_rate": 3.263157894736842e-07,
"loss": 0.0004,
"step": 938
},
{
"clip_ratio": 0.0009608945401851088,
"epoch": 0.12820862916439105,
"grad_norm": 0.10449221730232239,
"kl": 0.030026076681679115,
"learning_rate": 3.210526315789474e-07,
"loss": 0.0004,
"step": 939
},
{
"clip_ratio": 0.0008269436075352132,
"epoch": 0.12834516657564174,
"grad_norm": 0.10373935848474503,
"kl": 0.02982323686592281,
"learning_rate": 3.1578947368421055e-07,
"loss": 0.0004,
"step": 940
},
{
"clip_ratio": 0.000616618781350553,
"completion_length": 114.5,
"epoch": 0.1284817039868924,
"grad_norm": 0.11087680608034134,
"kl": 0.0374185201653745,
"learning_rate": 3.105263157894737e-07,
"loss": 0.0002,
"num_tokens": 2654592.0,
"reward": 0.887499988079071,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.887499988079071,
"step": 941
},
{
"clip_ratio": 0.00026939655072055757,
"epoch": 0.1286182413981431,
"grad_norm": 0.12226645648479462,
"kl": 0.036657080316217616,
"learning_rate": 3.052631578947369e-07,
"loss": 0.0001,
"step": 942
},
{
"clip_ratio": 0.0,
"epoch": 0.12875477880939376,
"grad_norm": 0.0905148908495903,
"kl": 0.03605576854897663,
"learning_rate": 3.0000000000000004e-07,
"loss": 0.0003,
"step": 943
},
{
"clip_ratio": 0.00026939655072055757,
"epoch": 0.12889131622064445,
"grad_norm": 0.09072388708591461,
"kl": 0.0357032545725815,
"learning_rate": 2.9473684210526315e-07,
"loss": 0.0001,
"step": 944
},
{
"clip_ratio": 0.0003004807804245502,
"completion_length": 125.3125,
"epoch": 0.12902785363189515,
"grad_norm": 0.1038588210940361,
"kl": 0.03439449705183506,
"learning_rate": 2.894736842105263e-07,
"loss": 0.0003,
"num_tokens": 2665466.0,
"reward": 0.6062500476837158,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.6062500476837158,
"step": 945
},
{
"clip_ratio": 0.0007869734690757468,
"epoch": 0.1291643910431458,
"grad_norm": 0.10634484887123108,
"kl": 0.035002676682779565,
"learning_rate": 2.842105263157895e-07,
"loss": 0.0002,
"step": 946
},
{
"clip_ratio": 0.000922937979339622,
"epoch": 0.1293009284543965,
"grad_norm": 0.10326269268989563,
"kl": 0.03447505127405748,
"learning_rate": 2.7894736842105264e-07,
"loss": 0.0001,
"step": 947
},
{
"clip_ratio": 0.0,
"epoch": 0.1294374658656472,
"grad_norm": 0.1021365150809288,
"kl": 0.03501308287377469,
"learning_rate": 2.736842105263158e-07,
"loss": -0.0001,
"step": 948
},
{
"clip_ratio": 0.00013469827536027879,
"completion_length": 138.09375,
"epoch": 0.12957400327689786,
"grad_norm": 0.07968829572200775,
"kl": 0.030057171738008037,
"learning_rate": 2.6842105263157897e-07,
"loss": 0.0003,
"num_tokens": 2677229.0,
"reward": 0.8875000476837158,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.8875000476837158,
"step": 949
},
{
"clip_ratio": 0.0006722042598994449,
"epoch": 0.12971054068814855,
"grad_norm": 0.0800618827342987,
"kl": 0.029572369530797005,
"learning_rate": 2.6315789473684213e-07,
"loss": 0.0004,
"step": 950
},
{
"clip_ratio": 0.0005265824729576707,
"epoch": 0.12984707809939924,
"grad_norm": 0.08067598938941956,
"kl": 0.029750974994385615,
"learning_rate": 2.578947368421053e-07,
"loss": 0.0002,
"step": 951
},
{
"clip_ratio": 0.0,
"epoch": 0.1299836155106499,
"grad_norm": 0.07985977828502655,
"kl": 0.02976464355015196,
"learning_rate": 2.5263157894736846e-07,
"loss": 0.0002,
"step": 952
},
{
"clip_ratio": 0.0028174469189252704,
"completion_length": 130.96875,
"epoch": 0.1301201529219006,
"grad_norm": 2.5399577617645264,
"kl": 0.13722280028741807,
"learning_rate": 2.473684210526316e-07,
"loss": 0.0026,
"num_tokens": 2688792.0,
"reward": 0.546875,
"reward_std": 0.3111537992954254,
"rewards/reward_fn": 0.546875,
"step": 953
},
{
"clip_ratio": 0.0007530120201408863,
"epoch": 0.1302566903331513,
"grad_norm": 0.9123467206954956,
"kl": 0.0975925590028055,
"learning_rate": 2.4210526315789473e-07,
"loss": 0.0007,
"step": 954
},
{
"clip_ratio": 0.0003077960864175111,
"epoch": 0.13039322774440196,
"grad_norm": 0.7623748779296875,
"kl": 0.11674012421281077,
"learning_rate": 2.3684210526315792e-07,
"loss": 0.0004,
"step": 955
},
{
"clip_ratio": 0.0006403644947567955,
"epoch": 0.13052976515565265,
"grad_norm": 0.6193297505378723,
"kl": 0.09545972407795489,
"learning_rate": 2.315789473684211e-07,
"loss": 0.0002,
"step": 956
},
{
"clip_ratio": 0.0,
"completion_length": 117.96875,
"epoch": 0.13066630256690334,
"grad_norm": 0.07178813219070435,
"kl": 0.03629979118704796,
"learning_rate": 2.2631578947368425e-07,
"loss": 0.0002,
"num_tokens": 2699387.0,
"reward": 0.9437500238418579,
"reward_std": 0.11249999701976776,
"rewards/reward_fn": 0.9437500238418579,
"step": 957
},
{
"clip_ratio": 0.0,
"epoch": 0.130802839978154,
"grad_norm": 0.07103423029184341,
"kl": 0.03656398045131937,
"learning_rate": 2.2105263157894736e-07,
"loss": 0.0004,
"step": 958
},
{
"clip_ratio": 0.00025826445198617876,
"epoch": 0.1309393773894047,
"grad_norm": 0.0723857656121254,
"kl": 0.03695206393604167,
"learning_rate": 2.1578947368421053e-07,
"loss": 0.0002,
"step": 959
},
{
"clip_ratio": 0.0,
"epoch": 0.1310759148006554,
"grad_norm": 0.07231997698545456,
"kl": 0.0363530462491326,
"learning_rate": 2.105263157894737e-07,
"loss": 0.0002,
"step": 960
},
{
"clip_ratio": 0.0,
"completion_length": 113.84375,
"epoch": 0.13121245221190606,
"grad_norm": 0.09480443596839905,
"kl": 0.027393472104449756,
"learning_rate": 2.0526315789473685e-07,
"loss": 0.0002,
"num_tokens": 2710114.0,
"reward": 0.887499988079071,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.887499988079071,
"step": 961
},
{
"clip_ratio": 0.0,
"epoch": 0.13134898962315675,
"grad_norm": 0.09404343366622925,
"kl": 0.027128341323987115,
"learning_rate": 2.0000000000000002e-07,
"loss": 0.0001,
"step": 962
},
{
"clip_ratio": 0.0008934933575801551,
"epoch": 0.13148552703440744,
"grad_norm": 0.09405073523521423,
"kl": 0.027535340806934983,
"learning_rate": 1.9473684210526318e-07,
"loss": 0.0001,
"step": 963
},
{
"clip_ratio": 0.0,
"epoch": 0.1316220644456581,
"grad_norm": 0.08958923071622849,
"kl": 0.027381854291888885,
"learning_rate": 1.8947368421052634e-07,
"loss": -0.0001,
"step": 964
},
{
"clip_ratio": 0.00042271205165889114,
"completion_length": 123.78125,
"epoch": 0.1317586018569088,
"grad_norm": 0.09731235355138779,
"kl": 0.02951424481580034,
"learning_rate": 1.8421052631578948e-07,
"loss": 0.0003,
"num_tokens": 2721579.0,
"reward": 0.6343749761581421,
"reward_std": 0.16874998807907104,
"rewards/reward_fn": 0.6343749761581421,
"step": 965
},
{
"clip_ratio": 0.0006630534771829844,
"epoch": 0.1318951392681595,
"grad_norm": 0.0930672436952591,
"kl": 0.029122414154699072,
"learning_rate": 1.7894736842105265e-07,
"loss": 0.0003,
"step": 966
},
{
"clip_ratio": 0.0005357142654247582,
"epoch": 0.13203167667941015,
"grad_norm": 0.09273795038461685,
"kl": 0.02928502397844568,
"learning_rate": 1.7368421052631578e-07,
"loss": 0.0004,
"step": 967
},
{
"clip_ratio": 0.0007173645281000063,
"epoch": 0.13216821409066085,
"grad_norm": 0.09362951666116714,
"kl": 0.029012724291533232,
"learning_rate": 1.6842105263157895e-07,
"loss": 0.0003,
"step": 968
},
{
"clip_ratio": 0.0003330294566694647,
"completion_length": 126.40625,
"epoch": 0.1323047515019115,
"grad_norm": 0.08251232653856277,
"kl": 0.03195799436070956,
"learning_rate": 1.631578947368421e-07,
"loss": 0.0005,
"num_tokens": 2732936.0,
"reward": 0.7749999761581421,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.7749999761581421,
"step": 969
},
{
"clip_ratio": 0.00035325744829606265,
"epoch": 0.1324412889131622,
"grad_norm": 0.08156436681747437,
"kl": 0.031294897315092385,
"learning_rate": 1.5789473684210527e-07,
"loss": 0.0002,
"step": 970
},
{
"clip_ratio": 0.0004885020898655057,
"epoch": 0.1325778263244129,
"grad_norm": 0.08326704800128937,
"kl": 0.03114733239635825,
"learning_rate": 1.5263157894736844e-07,
"loss": 0.0002,
"step": 971
},
{
"clip_ratio": 0.0011412299354560673,
"epoch": 0.13271436373566356,
"grad_norm": 0.08228829503059387,
"kl": 0.03161389287561178,
"learning_rate": 1.4736842105263158e-07,
"loss": 0.0003,
"step": 972
},
{
"clip_ratio": 0.0002741228090599179,
"completion_length": 118.3125,
"epoch": 0.13285090114691425,
"grad_norm": 0.11592817306518555,
"kl": 0.026773742283694446,
"learning_rate": 1.4210526315789474e-07,
"loss": 0.0001,
"num_tokens": 2743618.0,
"reward": 0.8312499523162842,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.8312499523162842,
"step": 973
},
{
"clip_ratio": 0.0005201858002692461,
"epoch": 0.13298743855816494,
"grad_norm": 0.11682640016078949,
"kl": 0.027475335708004422,
"learning_rate": 1.368421052631579e-07,
"loss": 0.0002,
"step": 974
},
{
"clip_ratio": 0.0002741228090599179,
"epoch": 0.1331239759694156,
"grad_norm": 0.11784546077251434,
"kl": 0.027234470340772532,
"learning_rate": 1.3157894736842107e-07,
"loss": 0.0001,
"step": 975
},
{
"clip_ratio": 0.0002741228090599179,
"epoch": 0.1332605133806663,
"grad_norm": 0.10642171651124954,
"kl": 0.027347801194991916,
"learning_rate": 1.2631578947368423e-07,
"loss": -0.0001,
"step": 976
},
{
"clip_ratio": 0.0009640677599236369,
"completion_length": 122.6875,
"epoch": 0.133397050791917,
"grad_norm": 0.13537083566188812,
"kl": 0.02874184341635555,
"learning_rate": 1.2105263157894737e-07,
"loss": 0.0002,
"num_tokens": 2754564.0,
"reward": 0.6343749761581421,
"reward_std": 0.4587019085884094,
"rewards/reward_fn": 0.6343749761581421,
"step": 977
},
{
"clip_ratio": 0.0013094727764837444,
"epoch": 0.13353358820316766,
"grad_norm": 0.13505354523658752,
"kl": 0.028210823540575802,
"learning_rate": 1.1578947368421054e-07,
"loss": 0.0003,
"step": 978
},
{
"clip_ratio": 0.0004968734428985044,
"epoch": 0.13367012561441835,
"grad_norm": 0.13402731716632843,
"kl": 0.02882817276986316,
"learning_rate": 1.1052631578947368e-07,
"loss": 0.0001,
"step": 979
},
{
"clip_ratio": 0.0010141732927877456,
"epoch": 0.13380666302566904,
"grad_norm": 0.13402649760246277,
"kl": 0.027990734379272908,
"learning_rate": 1.0526315789473685e-07,
"loss": 0.0001,
"step": 980
},
{
"clip_ratio": 0.0004788851802004501,
"completion_length": 127.625,
"epoch": 0.1339432004369197,
"grad_norm": 0.08159787952899933,
"kl": 0.028808709408622235,
"learning_rate": 1.0000000000000001e-07,
"loss": -0.0,
"num_tokens": 2765624.0,
"reward": 0.8031250238418579,
"reward_std": 0.18615379929542542,
"rewards/reward_fn": 0.8031250238418579,
"step": 981
},
{
"clip_ratio": 0.0002540650311857462,
"epoch": 0.1340797378481704,
"grad_norm": 0.08206771314144135,
"kl": 0.029088294133543968,
"learning_rate": 9.473684210526317e-08,
"loss": 0.0002,
"step": 982
},
{
"clip_ratio": 0.0002540650311857462,
"epoch": 0.1342162752594211,
"grad_norm": 0.08167807012796402,
"kl": 0.028653373738052323,
"learning_rate": 8.947368421052632e-08,
"loss": 0.0003,
"step": 983
},
{
"clip_ratio": 0.0004788851802004501,
"epoch": 0.13435281267067176,
"grad_norm": 0.08144602179527283,
"kl": 0.028931573644513264,
"learning_rate": 8.421052631578947e-08,
"loss": 0.0001,
"step": 984
},
{
"clip_ratio": 0.0,
"completion_length": 110.25,
"epoch": 0.13448935008192245,
"grad_norm": 0.06735821813344955,
"kl": 0.029827186255715787,
"learning_rate": 7.894736842105264e-08,
"loss": 0.0004,
"num_tokens": 2775960.0,
"reward": 0.859375,
"reward_std": 0.05624999850988388,
"rewards/reward_fn": 0.859375,
"step": 985
},
{
"clip_ratio": 0.0,
"epoch": 0.13462588749317314,
"grad_norm": 0.06738390773534775,
"kl": 0.02973687121993862,
"learning_rate": 7.368421052631579e-08,
"loss": 0.0004,
"step": 986
},
{
"clip_ratio": 0.0,
"epoch": 0.1347624249044238,
"grad_norm": 0.06684897094964981,
"kl": 0.029811298853019252,
"learning_rate": 6.842105263157895e-08,
"loss": 0.0003,
"step": 987
},
{
"clip_ratio": 0.0,
"epoch": 0.1348989623156745,
"grad_norm": 0.06784624606370926,
"kl": 0.029368669900577515,
"learning_rate": 6.315789473684211e-08,
"loss": 0.0004,
"step": 988
},
{
"clip_ratio": 0.0,
"completion_length": 129.90625,
"epoch": 0.1350354997269252,
"grad_norm": 0.08901333808898926,
"kl": 0.032253742014290765,
"learning_rate": 5.789473684210527e-08,
"loss": 0.0002,
"num_tokens": 2787289.0,
"reward": 0.6625000238418579,
"reward_std": 0.17745190858840942,
"rewards/reward_fn": 0.6625000238418579,
"step": 989
},
{
"clip_ratio": 0.0004521122755249962,
"epoch": 0.13517203713817585,
"grad_norm": 0.08875369280576706,
"kl": 0.03244263178203255,
"learning_rate": 5.263157894736842e-08,
"loss": 0.0004,
"step": 990
},
{
"clip_ratio": 0.000534784237970598,
"epoch": 0.13530857454942655,
"grad_norm": 0.08818361163139343,
"kl": 0.032299379439791664,
"learning_rate": 4.7368421052631586e-08,
"loss": 0.0004,
"step": 991
},
{
"clip_ratio": 0.0009257595957024023,
"epoch": 0.13544511196067724,
"grad_norm": 0.0888131707906723,
"kl": 0.03237587565672584,
"learning_rate": 4.2105263157894737e-08,
"loss": 0.0002,
"step": 992
},
{
"clip_ratio": 0.000294811325147748,
"completion_length": 124.8125,
"epoch": 0.1355816493719279,
"grad_norm": 0.10416112095117569,
"kl": 0.029586980352178216,
"learning_rate": 3.6842105263157894e-08,
"loss": 0.0004,
"num_tokens": 2798919.0,
"reward": 0.71875,
"reward_std": 0.2424038052558899,
"rewards/reward_fn": 0.71875,
"step": 993
},
{
"clip_ratio": 0.0009029616194311529,
"epoch": 0.1357181867831786,
"grad_norm": 0.10409634560346603,
"kl": 0.029650241776835173,
"learning_rate": 3.157894736842106e-08,
"loss": 0.0004,
"step": 994
},
{
"clip_ratio": 0.0,
"epoch": 0.13585472419442926,
"grad_norm": 0.10347838699817657,
"kl": 0.02986885284190066,
"learning_rate": 2.631578947368421e-08,
"loss": 0.0003,
"step": 995
},
{
"clip_ratio": 0.00047837117745075375,
"epoch": 0.13599126160567995,
"grad_norm": 0.10247468948364258,
"kl": 0.029298015346284956,
"learning_rate": 2.1052631578947368e-08,
"loss": 0.0006,
"step": 996
},
{
"completion_length": 119.46875,
"epoch": 0.13612779901693065,
"grad_norm": 0.0,
"learning_rate": 1.578947368421053e-08,
"loss": 0.0,
"num_tokens": 2810074.0,
"reward": 0.7749999761581421,
"reward_std": 0.0,
"rewards/reward_fn": 0.7749999761581421,
"step": 997
},
{
"epoch": 0.1362643364281813,
"grad_norm": 0.0,
"learning_rate": 1.0526315789473684e-08,
"loss": 0.0,
"step": 998
},
{
"epoch": 0.136400873839432,
"grad_norm": 0.0,
"learning_rate": 5.263157894736842e-09,
"loss": 0.0,
"step": 999
},
{
"epoch": 0.1365374112506827,
"grad_norm": 0.0,
"learning_rate": 0.0,
"loss": 0.0,
"step": 1000
}
],
"logging_steps": 1,
"max_steps": 1000,
"num_input_tokens_seen": 0,
"num_train_epochs": 1,
"save_steps": 250,
"stateful_callbacks": {
"TrainerControl": {
"args": {
"should_epoch_stop": false,
"should_evaluate": false,
"should_log": false,
"should_save": true,
"should_training_stop": true
},
"attributes": {}
}
},
"total_flos": 0.0,
"train_batch_size": 32,
"trial_name": null,
"trial_params": null
}