전체 글54 누구나 할 수 있는 강화학습 (12 - VFA) Q-Learning - Q값을 table로 저장하고 업데이트하는 방식으로 학습 진행- 모든 상황에 대해 Q값을 table 형태로 저장하는 것이 불가능함 VFA(Value Function Approximation)- 실측값에 근사한 함수로 나타내는 것 장점 : 모든 데이터를 저장 필요 없음 : 위의 데이터를 3차 함수로 근사한다면 ax^3 + bx^2 + cx + d 로 나타내 a,b,c,d 파라미터만 있으면 모두 표현 가능실제고 가지고 있지 않은 데이터도 근사 함수로 구할 수 있음단점 : 데이터 상관관계 : 데이터가 연속적이라 서로 독립적이지 않음Data Distribution 불안정 : 정책 변화 > 행동 변화 > 데이터 분포 변화 해결방안 : experience replay : 경험을 한 버퍼에 저장.. 2026. 2. 4. 누구나 할 수 있는 강화학습 (11 - DQN) (복습) Q learning: - 상태, 행동으로 가장 보상이 좋은 행동을 선택함- off-policy 알고리즘 DQN의 필요성 : 기존의 q learning 은 상태가 커지면 테이블이 폭발함예: 벽돌깨기 게임- 게임의 화면을 상태 입력으로 사용한다면- 고차원 데이터 > 연산량 많음 > 학습 속도 매우 느림- 화면 가능한 경우의 수가 너무 많음- 실시간으로 화면이 변하기 때문에 Q 테이블 계속 늘어남 DQN (Deep Q Network)- 강화학습 알고리즘에 딥러닝 (regression)을 적용한 강화학습 모델- 기존 table 방식의 강화학습으로는 고차원적인 복잡한 문제에 대해서 사용하기가 적합하지 않았기 때문에 선택 방안 : - 상태, 행동 입력 > 딥러닝 > q 값 파라미터로 나옴 > 파라미터 업.. 2026. 1. 28. 누구나 할 수 있는 강화학습 (10 - 라이브러리 소개) OpenAI GYM : 강화학습의 환경을 제공하는 라이브러리classic control : 2d 화면에서 간단한 물리학 적용함 Classic control 의 대표 환경 : Cartpole : 막대가 오래 수직을 유지하도록 균형 잡기 게임카트, 막대의 위치와 속도 관측 한 스텝이 진행될 때마다 리워드 1막대 각도 -24 이하로 내겨라면 에피소드 종료 Pendulum : 막대를 회전시켜 수직으로 만드는 게임x 좌표, y 좌표, 각속도 관측각도와 각속도가 작아지는 방향으로 학습 진행 Atari2600 : 1970-80년대 유행한 조작용 패드로 플레이하는 게임breakout : 벽돌 깨기 게임상태는 게임 화면 사용, 행동은 패들 움직이기, 보상은 게임 점수Mujoco : 다관절 로봇, 애니메이션 등 정확하고.. 2026. 1. 7. 누구나 할 수 있는 강화학습 (9 - 가치 기반 학습 (value-based)) 가치 기반 학습 (value-based) 상세데이터 효율적으로 활용 가능행동이 discrete action 일 때 주로 사용결과가 scalar 형태로 나와 불안정 가능성 있음두가지로 나뉨on-policy :내가 선택한 행동 정책 바로 반영 (behavior policy = target policy, 직접 경험)행동한대로 목표값을 결정하는 정책에 영향을 미침 보수적, 안정적예: SARSAoff-policy : 행동 선택 정책, 목표 정책 다름 (간접경험)데이터를 모으는 정책은 행동 정책(behavior policy) / 학습하려는 정책은 목표 정책(target policy) 행동은 한 정책으로 하지만, 배우는 건 다른 최적 정책효율적, 공격적예: Q-learning 2025. 12. 17. 누구나 할 수 있는 강화학습 (8 - Model-Free RL) Model-Free 강화학습환경이 어떻게 동작되는지 모르는 상태에서 행동 선택하여 다음 상태, 보상을 얻음 예) 자전거를 배울 때 손잡이에 힘 주는 법, 페달 밟는 방법 등을 스스로 학습learning : 배경 지식 없이 환경 에이전트 상호작용 통해 문제 풂장점 : 다양한 분야 문제 해결. 최근 학습 시간 효율 측면에서는 model based 보다 더 좋은 성과냄단점 : 비효율적인 결과Model-Based 방식에이전트가 행동하는 모델애 대한 정의가 있는 상태에서 학습 진행planning : 환경에 대한 모델을 어느정도 알고 문제 풂장점 : 더 빨리 원하는 결과 도달 가능단점 : 학습이 우선되어야해서 적용 범위 한정적가치 기반 학습 (value-based) : 가치 함수가 완벽하다는 가정가치 함수만 학습.. 2025. 12. 17. 누구나 할 수 있는 강화학습 (7 - Temporal Difference) Temporal Difference 알고리즘- 장점 : 매 타임스텝마다 예측 진행- 단점 : 초기 가치 함수 값에 따라 예측 정확도가 많이 달라짐TD 알고리즘 : 몬테 카를로의 단점이 보완된 알고리즘매 보상마다 예측 진행 (= 부트스트랩 방식)낮은 편향을 가짐 초기 가치 함수 값에 따라 예측 정확도가 많이 달라짐 * 부트스트랩(bootstrap) 방식 : 미래 보상 끝까지 기다리지 않고 다음 상태 추정 가치로 미리 업데이트 TD 학습의 종류 : SARSA5요소 (State – Action – Reward – next State – next Action) 사용해 업데이트 해서 붙은 이름현재 상태, 행동, 다음상태, 다음행동을 기반으로 큐함수 업데이트* TD 에러 (시간차 에러) : 현재 상태의 가치가 얼.. 2025. 11. 26. 이전 1 2 3 4 ··· 9 다음