큐레이션
Hands-On Modern RL
강화학습 기초부터 reasoning·agent·멀티모달 실험까지 이어지는 공개 실습 커리큘럼
Python4.0k+

요약
Hands-On Modern RL은 강화학습 기초에서 PPO·RLHF·reasoning model·agentic RL·멀티모달 시스템까지 이어지는 공개 학습 자료와 실험 코드를 제공합니다.
도구 소개
공식 README의 학습 경로는 개념 설명, 코드 중심 챕터, 실험 결과와 시각화 화면을 한 흐름으로 묶습니다. CPU로 실행할 수 있는 실험이 있고, 일부 실험은 CUDA와 ModelScope xGPU Notebook이 필요합니다. 문서 사이트와 저장소의 챕터별 requirements 파일을 함께 사용합니다.
사용 포인트
- Chapter 01 CartPole로 환경·정책·보상 흐름부터 시작
- PPO 코드와 학습 지표를 직접 비교
- RLHF·reasoning·agentic RL을 한 커리큘럼에서 연결
- AI 교육 자료를 프롬프트 사용법이 아닌 환경·코드·평가 중심으로 구성
설치와 시작
공식 README의 문서 사이트 실행 명령입니다.
git clone https://github.com/walkinglabs/hands-on-modern-rl.git
cd hands-on-modern-rl
npm install
npm run dev
실험은 전체 의존성 대신 Chapter 01만 먼저 설치할 수 있습니다.
pip install -r chapter01_cartpole/requirements.txt
python chapter01_cartpole/1-ppo_cartpole.py
선정 사유
GitHub 공식 API에서 3,977 stars와 2026-08-17 최신 push를 확인했고, 공식 README의 학습 경로·코드 화면·실험 지표 화면을 검증했습니다. 강의나 개인 학습에서 개념→코드→측정의 순서를 만들 수 있는 실사용 자료이며, CPU와 GPU 요구사항이 구분되어 단계적으로 적용하기 좋습니다.