{ "name": "ao.iolens.rl.final.ddp600.s0", "kind": "RL (GRPO) AO checkpoint \u2014 activation->text inverter, on-policy", "warm_start": "ckpts/ao/distill/final.s0/step105 (iolens.final SFT bullet student)", "steps": 600, "iter": "iter_000600", "reward": "per-bullet JOINT FVE (whitened, unit concept dirs), k_max=4, on-policy T=1", "injection": { "transform": "unit", "alpha": 16000, "layers": "20..60 step4", "marker": "\u321c/158983" }, "hparams": { "lr": 5e-05, "kl_beta": 0.02, "batch_prompts": 14, "group_size": 64, "max_new_tokens": 128 }, "ar": "/workspace/sc/hf/ckpts/ar/chat/mlayer.lc.s0/ex16014240", "eval": { "metric": "joint FVE on rl_gate_0 (128)", "sft_baseline": 0.12, "rl_mean": 0.155, "rl_peak": 0.159, "gt_text_ceiling": 0.129, "note": "RL greedy exceeds literal-source-text k=1 recon; eval set is hard (median GT 0.075). Oracle-16 nnomp shows further policy headroom." }, "degeneracy": "none \u2014 bullet_diversity 0.15->0.34, truncation ->0; plateau is advantage convergence (88% groups saturated), not reward hacking", "adapter": "PEFT LoRA (default adapter). reference/ (KL anchor = the SFT warm start) omitted; identical to ckpts/ao/distill/final.s0/step105." }