[ { "iteration": 0, "elapsed_s": 283.72707653045654, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6677320075757578, "avg_questions": 0.71875, "avg_turns": 1.6875, "ppo_loss": -0.0012642779620364308, "value_loss": 0.9520214434180941, "approx_kl": 0.009626129126575376, "clip_frac": 0.18303571481789863, "entropy": 0.25815688552600996, "kl_penalty": 0.011675153459821428, "kl_per_seq": 0.011675153459821428, "kl_seq_max": 0.18973214285714285 }, { "iteration": 1, "elapsed_s": 265.6153476238251, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6511522331834831, "avg_questions": 0.75, "avg_turns": 1.71875, "ppo_loss": -0.02305267165814127, "value_loss": 0.3821369180721896, "approx_kl": 0.006722210083223347, "clip_frac": 0.09438775533011981, "entropy": 0.22343750271414006, "kl_penalty": 0.010663713727678572, "kl_per_seq": 0.010663713727678572, "kl_seq_max": 0.14174107142857142 }, { "iteration": 2, "elapsed_s": 283.4707496166229, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6145833333333333, "avg_questions": 0.71875, "avg_turns": 1.6875, "ppo_loss": 0.0003246570039274437, "value_loss": 0.5281469119446618, "approx_kl": 0.005086135942422386, "clip_frac": 0.0595238097012043, "entropy": 0.20671099424362183, "kl_penalty": 0.022153581891741072, "kl_per_seq": 0.022153581891741072, "kl_seq_max": 0.15959821428571427 }, { "iteration": 3, "elapsed_s": 277.0273263454437, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.8185267857142857, "avg_questions": 0.875, "avg_turns": 1.84375, "ppo_loss": 0.017307979986071587, "value_loss": 0.2391173227224499, "approx_kl": 0.006241402057639789, "clip_frac": 0.0859375, "entropy": 0.24670861288905144, "kl_penalty": 0.0052337646484375, "kl_per_seq": 0.0052337646484375, "kl_seq_max": 0.130126953125 }, { "iteration": 4, "elapsed_s": 286.0855031013489, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6283482142857142, "avg_questions": 0.875, "avg_turns": 1.875, "ppo_loss": -0.023693807190284133, "value_loss": 0.23578157555311918, "approx_kl": 0.006290083052590489, "clip_frac": 0.08984375, "entropy": 0.2442768611945212, "kl_penalty": 0.013458251953125, "kl_per_seq": 0.013458251953125, "kl_seq_max": 0.13818359375 }, { "iteration": 5, "elapsed_s": 242.1764998435974, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.7465401785714285, "avg_questions": 0.78125, "avg_turns": 1.78125, "ppo_loss": -0.0412354568640391, "value_loss": 0.36194167503466207, "approx_kl": 0.02360554877668619, "clip_frac": 0.21354166666666666, "entropy": 0.28217028516034287, "kl_penalty": 0.044108072916666664, "kl_per_seq": 0.044108072916666664, "kl_seq_max": 0.22916666666666666 }, { "iteration": 6, "elapsed_s": 297.9436032772064, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6431051587301587, "avg_questions": 0.84375, "avg_turns": 1.84375, "ppo_loss": -0.01692520675715059, "value_loss": 0.28041012212634087, "approx_kl": 0.006847011674835812, "clip_frac": 0.11197916697710752, "entropy": 0.25802480173297226, "kl_penalty": 0.01638031005859375, "kl_per_seq": 0.01638031005859375, "kl_seq_max": 0.14501953125 }, { "iteration": 7, "elapsed_s": 330.66188168525696, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6246899801587302, "avg_questions": 0.8125, "avg_turns": 1.78125, "ppo_loss": 0.004835611267480999, "value_loss": 0.42471681741881184, "approx_kl": 0.006292660720646381, "clip_frac": 0.078125, "entropy": 0.22681239678058773, "kl_penalty": 0.0085601806640625, "kl_per_seq": 0.0085601806640625, "kl_seq_max": 0.14404296875 }, { "iteration": 8, "elapsed_s": 300.30717039108276, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6534733495670996, "avg_questions": 0.78125, "avg_turns": 1.75, "ppo_loss": -0.017197133707148687, "value_loss": 0.3457076509616205, "approx_kl": 0.006416547777397292, "clip_frac": 0.07589285714285714, "entropy": 0.22316500225237437, "kl_penalty": 0.004743303571428571, "kl_per_seq": 0.004743303571428571, "kl_seq_max": 0.197265625 }, { "iteration": 9, "elapsed_s": 286.7236270904541, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.7079376352813853, "avg_questions": 0.78125, "avg_turns": 1.75, "ppo_loss": -0.011897004608597075, "value_loss": 0.411878263843911, "approx_kl": 0.007929061938609396, "clip_frac": 0.11607142857142858, "entropy": 0.2569970648203577, "kl_penalty": 0.00020926339285714285, "kl_per_seq": 0.00020926339285714285, "kl_seq_max": 0.16936383928571427 }, { "iteration": 10, "elapsed_s": 276.631822347641, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.8028939810189811, "avg_questions": 0.84375, "avg_turns": 1.78125, "ppo_loss": -0.033312247483991086, "value_loss": 0.2869396444875747, "approx_kl": 0.008976982207968831, "clip_frac": 0.12109375, "entropy": 0.25112444773549214, "kl_penalty": 0.01202392578125, "kl_per_seq": 0.01202392578125, "kl_seq_max": 0.203857421875 }, { "iteration": 11, "elapsed_s": 255.2351098060608, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.5704326923076923, "avg_questions": 0.78125, "avg_turns": 1.75, "ppo_loss": -0.005331723640362422, "value_loss": 0.42935604602098465, "approx_kl": 0.016193445358011458, "clip_frac": 0.2222222222222222, "entropy": 0.23103458185990652, "kl_penalty": 0.0, "kl_per_seq": 0.0, "kl_seq_max": 0.2294921875 }, { "iteration": 12, "elapsed_s": 254.100581407547, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.5869724025974025, "avg_questions": 0.71875, "avg_turns": 1.6875, "ppo_loss": -0.03959607765344637, "value_loss": 0.34272722474166323, "approx_kl": 0.012407979046526765, "clip_frac": 0.20684523933700152, "entropy": 0.24096926195280893, "kl_penalty": 0.007428850446428571, "kl_per_seq": 0.007428850446428571, "kl_seq_max": 0.2572544642857143 }, { "iteration": 13, "elapsed_s": 335.7170238494873, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6823145604395605, "avg_questions": 0.84375, "avg_turns": 1.84375, "ppo_loss": -0.03688290709008773, "value_loss": 0.21781166903674604, "approx_kl": 0.013189310727951428, "clip_frac": 0.19583333432674407, "entropy": 0.2323363353808721, "kl_penalty": 0.024055989583333333, "kl_per_seq": 0.024055989583333333, "kl_seq_max": 0.3768229166666667 }, { "iteration": 14, "elapsed_s": 264.29171442985535, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.7472098214285713, "avg_questions": 0.875, "avg_turns": 1.875, "ppo_loss": -0.027799080746869247, "value_loss": 0.4135706809659799, "approx_kl": 0.012586234758297602, "clip_frac": 0.15625, "entropy": 0.2517068100472291, "kl_penalty": 0.0135498046875, "kl_per_seq": 0.0135498046875, "kl_seq_max": 0.3229166666666667 }, { "iteration": 15, "elapsed_s": 241.14811420440674, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6659226190476191, "avg_questions": 0.65625, "avg_turns": 1.65625, "ppo_loss": -0.03369090032009851, "value_loss": 0.34638335804144543, "approx_kl": 0.013905501381183663, "clip_frac": 0.19047619189534867, "entropy": 0.22407633740277516, "kl_penalty": 0.036342075892857144, "kl_per_seq": 0.036342075892857144, "kl_seq_max": 0.45982142857142855 }, { "iteration": 16, "elapsed_s": 238.80150389671326, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6585475288600288, "avg_questions": 0.90625, "avg_turns": 1.84375, "ppo_loss": -0.056268499715736615, "value_loss": 0.3362144205581259, "approx_kl": 0.019216162325055512, "clip_frac": 0.3024691376421187, "entropy": 0.2751925124062432, "kl_penalty": 0.022162543402777776, "kl_per_seq": 0.022162543402777776, "kl_seq_max": 0.5263310185185185 }, { "iteration": 17, "elapsed_s": 232.22505855560303, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.7668154761904762, "avg_questions": 0.90625, "avg_turns": 1.875, "ppo_loss": -0.0331775728199217, "value_loss": 0.3092526584449742, "approx_kl": 0.01231207988328404, "clip_frac": 0.20833333333333334, "entropy": 0.25865906063053345, "kl_penalty": 0.07600911458333333, "kl_per_seq": 0.07600911458333333, "kl_seq_max": 0.65625 }, { "iteration": 18, "elapsed_s": 311.01340675354004, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.6972830988455989, "avg_questions": 0.8125, "avg_turns": 1.78125, "ppo_loss": 0.009420987218618393, "value_loss": 0.4465955500304699, "approx_kl": 0.015329486131668091, "clip_frac": 0.26, "entropy": 0.21777834206819535, "kl_penalty": 0.04673828125, "kl_per_seq": 0.04673828125, "kl_seq_max": 0.56625 }, { "iteration": 19, "elapsed_s": 249.58963227272034, "lambda1": 0.0, "lambda2": 0.0, "n_episodes": 32, "avg_reward": 0.7551739926739928, "avg_questions": 0.6875, "avg_turns": 1.6875, "ppo_loss": -0.037938538430766625, "value_loss": 0.36645138856362214, "approx_kl": 0.018135146047411996, "clip_frac": 0.2746212130243128, "entropy": 0.24184788357127796, "kl_penalty": 0.002840909090909091, "kl_per_seq": 0.002840909090909091, "kl_seq_max": 0.6051136363636364 } ]