π κ²μμ΄ λ‘μΌ (Cowardly Rocket) - LunarLander DQN by connect ai - changer
μ΄ λͺ¨λΈμ Gymnasiumμ LunarLander-v3 νκ²½μμ 1000λ²μ μνΌμλ λμ κ°ννμ΅(DQN)μ μ§νν κ²°κ³Όλ¬Όμ λλ€.
π λͺ¨λΈμ μ±κ²©: "μΆλ½μ΄ λ무 무μμμ!"
μ΄λ°μ λ μ λΆλͺνλ©° -100μ μ μμ²λ κ°μ μ λ무 λ§μ΄ κ²ͺμ λλ¨Έμ§, μ°©λ₯ νΈλΌμ°λ§κ° μ겨λ²λ¦° μΈκ³΅μ§λ₯μ λλ€. μλ²½νκ² κΉλ° μ¬μ΄μ μ°©λ₯νλ©΄ +100μ μ λ°λλ€λ κ²μ ν¬λ―Ένκ² μκ³ λ μμ§λ§, λμ ν μ©κΈ°λ₯Ό λ΄μ§ λͺ»ν©λλ€. κ²°κ³Όμ μΌλ‘, μ°λ£λΉ(-0.3μ )κ° κ³μ κΉμ΄λλΌλ λ°λ₯μ μ λ λΏμ§ μκΈ° μν΄ κ³΅μ€μ λ₯λ₯ λ μ λκΉμ§ λ²ν°λ(Hovering) μ¬λ―Έμλ λ‘컬 μ΅ν°λ©(Local Optimum) μνμ λΉ μ§ λͺ¨λΈμ λλ€.
π μΈλΆ μ 보
- Algorithm: Deep Q-Network (DQN)
- Training Episodes: 1000
- Final Reward: μ½ -17μ (μμ‘΄μ νμ§λ§ μ°λ£ λλΉ μ¬ν¨)
- Epsilon (ννλ₯ ): 1.0 -> 0.05 (μ ν κ°μ)
- Observation Space: 8
- Action Space: 4 (Discrete)
π‘ κ΅ν
κ°ννμ΅μμ μνΌμλ μκ° μΆ©λΆνμ§ μμ λ, μμ΄μ νΈκ° μλ²½ν μ±κ³΅λ³΄λ€λ 'μ΅μ μ μ€ν¨λ₯Ό νΌνλ κΌΌμ'λ₯Ό μ νν μ μμμ 보μ¬μ£Όλ νλ₯ν κ΅μ‘μ© μ¬λ‘μ λλ€!
π μΆμ² λ° μ°Έκ³ λ¬Έν (References)
- Environment: Gymnasium (Farama Foundation) - LunarLander-v3
- νμ΅μ μ¬μ©λ κΈ°λ³Έ νκ²½κ³Ό μ½λ ꡬ쑰λ OpenAI Gymμ νμ νλ‘μ νΈμΈ Farama Foundationμ Gymnasium λΌμ΄λΈλ¬λ¦¬λ₯Ό λ°νμΌλ‘ μμ±λμμ΅λλ€.
