{"step": 5, "episode": 5, "wall_time": 188.809, "epoch": 0.05, "reward": -0.7093950033187866, "reward_std": 0.438705188035965, "kl": 1.6751922476032633e-05, "entropy": 0.6435153007507324, "grad_norm": 0.5494542717933655, "completion_length": 207.475, "clipped_ratio": 0.475, "learning_rate": 2.0000000000000003e-06, "loss": 0.10636411905288697, "rewards/reward_func/mean": -0.7093950033187866} {"step": 10, "episode": 10, "wall_time": 376.371, "epoch": 0.1, "reward": -0.6032124996185303, "reward_std": 0.36650351285934446, "kl": 2.880909237319429e-05, "entropy": 0.6295147061347961, "grad_norm": 0.0015582269988954067, "completion_length": 195.9, "clipped_ratio": 0.275, "learning_rate": 4.5e-06, "loss": 0.1324501872062683, "rewards/reward_func/mean": -0.6032124996185303} {"step": 15, "episode": 15, "wall_time": 563.763, "epoch": 0.15, "reward": -0.29468500018119814, "reward_std": 0.6827806830406189, "kl": 0.0006372630636178655, "entropy": 0.5564381659030915, "grad_norm": 0.5660241842269897, "completion_length": 169.4, "clipped_ratio": 0.25, "learning_rate": 4.975670171853926e-06, "loss": 0.16200611591339112, "rewards/reward_func/mean": -0.29468499720096586} {"step": 20, "episode": 20, "wall_time": 750.673, "epoch": 0.2, "reward": -0.35081500113010405, "reward_std": 0.7735073447227478, "kl": 0.0035846303799189627, "entropy": 0.6513160720467568, "grad_norm": 0.6298933029174805, "completion_length": 165.225, "clipped_ratio": 0.25, "learning_rate": 4.8776412907378845e-06, "loss": 0.12097016572952271, "rewards/reward_func/mean": -0.35081500113010405} {"step": 25, "episode": 25, "wall_time": 920.434, "epoch": 0.25, "reward": 0.015637505054473876, "reward_std": 0.6438650548458099, "kl": 0.006109351327177137, "entropy": 0.5287840485572814, "grad_norm": 0.49145567417144775, "completion_length": 145.65, "clipped_ratio": 0.15, "learning_rate": 4.707368982147318e-06, "loss": 0.16248302459716796, "rewards/reward_func/mean": 0.015637502074241638} {"step": 30, "episode": 30, "wall_time": 1099.262, "epoch": 0.3, "reward": -0.023642498254776, "reward_std": 0.5071183383464813, "kl": 0.009106103249359876, "entropy": 0.6077752202749253, "grad_norm": 0.5351712703704834, "completion_length": 166.425, "clipped_ratio": 0.25, "learning_rate": 4.470026884016805e-06, "loss": 0.11637315750122071, "rewards/reward_func/mean": -0.023642498254776} {"step": 35, "episode": 35, "wall_time": 1246.737, "epoch": 0.35, "reward": 0.29593500643968584, "reward_std": 0.528465086221695, "kl": 0.018638277519494297, "entropy": 0.5391871497035027, "grad_norm": 0.6259173154830933, "completion_length": 130.25, "clipped_ratio": 0.125, "learning_rate": 4.172826515897146e-06, "loss": 0.11526646614074706, "rewards/reward_func/mean": 0.29593500345945356} {"step": 40, "episode": 40, "wall_time": 1422.783, "epoch": 0.4, "reward": 0.055547505617141724, "reward_std": 0.6356331050395966, "kl": 0.025114677543751896, "entropy": 0.5604358270764351, "grad_norm": 0.5404691100120544, "completion_length": 141.725, "clipped_ratio": 0.15, "learning_rate": 3.824798160583012e-06, "loss": 0.1718597412109375, "rewards/reward_func/mean": 0.055547496676445006} {"step": 45, "episode": 45, "wall_time": 1554.454, "epoch": 0.45, "reward": 0.3135200023651123, "reward_std": 0.570597717165947, "kl": 0.03712727697566152, "entropy": 0.5534276083111763, "grad_norm": 1.1430027484893799, "completion_length": 114.8, "clipped_ratio": 0.125, "learning_rate": 3.436516483539781e-06, "loss": 0.1371835947036743, "rewards/reward_func/mean": 0.31351999193429947} {"step": 50, "episode": 50, "wall_time": 1710.132, "epoch": 0.5, "reward": 0.236199988424778, "reward_std": 0.48100843876600263, "kl": 0.03703772826120257, "entropy": 0.5657066576182842, "grad_norm": 1.0543839931488037, "completion_length": 128.425, "clipped_ratio": 0.125, "learning_rate": 3.019779227044398e-06, "loss": 0.12160162925720215, "rewards/reward_func/mean": 0.2361999973654747} {"step": 55, "episode": 55, "wall_time": 1866.671, "epoch": 0.55, "reward": 0.30684498995542525, "reward_std": 0.5213679552078248, "kl": 0.03847777061164379, "entropy": 0.6098115384578705, "grad_norm": 0.6164706349372864, "completion_length": 137.575, "clipped_ratio": 0.125, "learning_rate": 2.587248741756253e-06, "loss": 0.1307481646537781, "rewards/reward_func/mean": 0.3068449944257736} {"step": 60, "episode": 60, "wall_time": 1992.491, "epoch": 0.6, "reward": 0.4321644976735115, "reward_std": 0.4408211216330528, "kl": 0.04455821365118027, "entropy": 0.5599258542060852, "grad_norm": 0.6753410696983337, "completion_length": 121.375, "clipped_ratio": 0.125, "learning_rate": 2.1520672475998374e-06, "loss": -0.0020914584398269652, "rewards/reward_func/mean": 0.43216450959444047} {"step": 65, "episode": 65, "wall_time": 2130.386, "epoch": 0.65, "reward": 0.20816650092601777, "reward_std": 0.6150909662246704, "kl": 0.04474193467758596, "entropy": 0.5431906238198281, "grad_norm": 0.6576391458511353, "completion_length": 133.225, "clipped_ratio": 0.15, "learning_rate": 1.7274575140626318e-06, "loss": 0.12919301986694337, "rewards/reward_func/mean": 0.2081664979457855} {"step": 70, "episode": 70, "wall_time": 2270.49, "epoch": 0.7, "reward": 0.30473550260066984, "reward_std": 0.6303107619285584, "kl": 0.05402772491797805, "entropy": 0.5467537224292756, "grad_norm": 1.1241240501403809, "completion_length": 126.425, "clipped_ratio": 0.125, "learning_rate": 1.3263210930352737e-06, "loss": 0.1359349250793457, "rewards/reward_func/mean": 0.30473549365997316} {"step": 75, "episode": 75, "wall_time": 2381.015, "epoch": 0.75, "reward": 0.5023249924182892, "reward_std": 0.41832133531570437, "kl": 0.05743786608800292, "entropy": 0.5236357256770134, "grad_norm": 0.6160199642181396, "completion_length": 113.4, "clipped_ratio": 0.125, "learning_rate": 9.608463116858544e-07, "loss": 0.1004109263420105, "rewards/reward_func/mean": 0.5023250102996826} {"step": 80, "episode": 80, "wall_time": 2534.777, "epoch": 0.8, "reward": 0.23994799852371215, "reward_std": 0.6528037905693054, "kl": 0.051343218237161634, "entropy": 0.5962405577301979, "grad_norm": 1.148435354232788, "completion_length": 132.45, "clipped_ratio": 0.175, "learning_rate": 6.421379363065142e-07, "loss": 0.16353468894958495, "rewards/reward_func/mean": 0.23994798958301544} {"step": 85, "episode": 85, "wall_time": 2670.177, "epoch": 0.85, "reward": 0.4417750060558319, "reward_std": 0.38612583875656126, "kl": 0.05365305533632636, "entropy": 0.5357312977313995, "grad_norm": 0.7006118297576904, "completion_length": 125.2, "clipped_ratio": 0.125, "learning_rate": 3.798797596089351e-07, "loss": 0.0832466721534729, "rewards/reward_func/mean": 0.44177500903606415} {"step": 90, "episode": 90, "wall_time": 2790.293, "epoch": 0.9, "reward": 0.3592784970998764, "reward_std": 0.47426570653915406, "kl": 0.06277637230232358, "entropy": 0.5906486302614212, "grad_norm": 0.6691755652427673, "completion_length": 117.875, "clipped_ratio": 0.125, "learning_rate": 1.8204036358303173e-07, "loss": 0.11865448951721191, "rewards/reward_func/mean": 0.3592784985899925} {"step": 95, "episode": 95, "wall_time": 2907.619, "epoch": 0.95, "reward": 0.3855094999074936, "reward_std": 0.5737680494785309, "kl": 0.0636138970963657, "entropy": 0.5228819936513901, "grad_norm": 0.6538191437721252, "completion_length": 110.325, "clipped_ratio": 0.125, "learning_rate": 5.463099816548578e-08, "loss": 0.050724190473556516, "rewards/reward_func/mean": 0.38550950288772584} {"step": 100, "episode": 100, "wall_time": 3032.896, "epoch": 1.0, "reward": 0.3814394935965538, "reward_std": 0.5273321390151977, "kl": 0.1033468710258603, "entropy": 0.5490284770727157, "grad_norm": 0.9000993371009827, "completion_length": 118.95, "clipped_ratio": 0.125, "learning_rate": 1.5229324522605949e-09, "loss": 0.08565758466720581, "rewards/reward_func/mean": 0.3814395099878311} {"step": 100, "episode": 100, "wall_time": 3033.45, "epoch": 1.0, "reward": null, "reward_std": null, "kl": null, "entropy": null, "grad_norm": null, "completion_length": null, "clipped_ratio": null, "learning_rate": null, "loss": null}