검색
❯
2025년 12월 01일1 min read
어떤 환경 내에서 정의된 에이전트가 현재의 상태를 인식하여, 선택 가능한 행동들 중 보상을 최대화하는 행독 혹은 행동 순서를 선택하는 방법