검색
❯
2026년 3월 15일1 min read
어떤 환경 내에서 정의된 에이전트가 현재의 상태를 인식하여, 선택 가능한 행동들 중 보상을 최대화하는 행독 혹은 행동 순서를 선택하는 방법