Pusher-v5 PPO 학습 시각화 리포트

Gymnasium MuJoCo Robotic Arm Manipulation • Stable-Baselines3 PPO

Total Steps: 301,056
Total Timesteps
301,056
Best Return
-30.84
Final Return
-30.84
Best Obj-to-Goal Dist
0.069 m
학습 단계별 행동 변화 (Visual Progressions)
Baseline (Step 0) Step: 0
Mean Reward -57.51
Obj-Goal Dist 0.220 m
Checkpoint (30,000 steps) Step: 30,000
Mean Reward -49.77
Obj-Goal Dist 0.220 m
Checkpoint (60,000 steps) Step: 60,000
Mean Reward -43.23
Obj-Goal Dist 0.190 m
Checkpoint (90,000 steps) Step: 90,000
Mean Reward -38.93
Obj-Goal Dist 0.191 m
Checkpoint (120,000 steps) Step: 120,000
Mean Reward -42.36
Obj-Goal Dist 0.222 m
Checkpoint (150,000 steps) Step: 150,000
Mean Reward -41.61
Obj-Goal Dist 0.237 m
Checkpoint (180,000 steps) Step: 180,000
Mean Reward -36.00
Obj-Goal Dist 0.145 m
Checkpoint (210,000 steps) Step: 210,000
Mean Reward -34.57
Obj-Goal Dist 0.142 m
Checkpoint (240,000 steps) Step: 240,000
Mean Reward -32.33
Obj-Goal Dist 0.107 m
Checkpoint (270,000 steps) Step: 270,000
Mean Reward -32.52
Obj-Goal Dist 0.115 m
Checkpoint (300,000 steps) Step: 300,000
Mean Reward -31.46
Obj-Goal Dist 0.084 m
Final (301,056 steps) Step: 301,056
Mean Reward -30.84
Obj-Goal Dist 0.069 m
학습 수렴 및 메트릭 분석 차트
PPO Training Metrics Plots