알파고1 AI가 세상을 배우는 법 머신러닝 강화학습 원리 알파고가 이세돌 9단을 꺾었을 때, 저는 솔직히 "운이 좋았겠지"라고 생각했습니다. 그런데 알고 보니 그 승리의 배경엔 수천만 번의 자가 대국과 보상 신호만으로 스스로 규칙을 터득한 강화학습(Reinforcement Learning)이 있었습니다. 여기서 강화학습이란 정답 데이터 없이 시행착오의 결과로 주어지는 보상만을 단서 삼아 최적의 행동 방침을 스스로 만들어가는 머신러닝 기법을 말합니다. 이 글은 그 원리를 직접 공부하고 실제 사례와 비교 검증하면서 정리한 기록입니다.목차AI의 눈과 귀, 센서 기술이 전부를 결정한다강화학습의 작동 원리, 이론과 실제는 조금 달랐습니다알파고부터 추천 알고리즘까지, 이미 일상에 들어와 있습니다보상 해킹과 지연 보상, 강화학습의 진짜 한계인공지능과 강화학습에 대해 자주 .. 2026. 7. 25. 이전 1 다음