큐레이션

Hands-On Modern RL

강화학습 기초부터 reasoning·agent·멀티모달 실험까지 이어지는 공개 실습 커리큘럼

Python4.0k+
Hands-On Modern RL 대표 이미지

요약

Hands-On Modern RL은 강화학습 기초에서 PPO·RLHF·reasoning model·agentic RL·멀티모달 시스템까지 이어지는 공개 학습 자료와 실험 코드를 제공합니다.

도구 소개

공식 README의 학습 경로는 개념 설명, 코드 중심 챕터, 실험 결과와 시각화 화면을 한 흐름으로 묶습니다. CPU로 실행할 수 있는 실험이 있고, 일부 실험은 CUDA와 ModelScope xGPU Notebook이 필요합니다. 문서 사이트와 저장소의 챕터별 requirements 파일을 함께 사용합니다.

사용 포인트

  • Chapter 01 CartPole로 환경·정책·보상 흐름부터 시작
  • PPO 코드와 학습 지표를 직접 비교
  • RLHF·reasoning·agentic RL을 한 커리큘럼에서 연결
  • AI 교육 자료를 프롬프트 사용법이 아닌 환경·코드·평가 중심으로 구성

설치와 시작

공식 README의 문서 사이트 실행 명령입니다.

git clone https://github.com/walkinglabs/hands-on-modern-rl.git
cd hands-on-modern-rl
npm install
npm run dev

실험은 전체 의존성 대신 Chapter 01만 먼저 설치할 수 있습니다.

pip install -r chapter01_cartpole/requirements.txt
python chapter01_cartpole/1-ppo_cartpole.py

선정 사유

GitHub 공식 API에서 3,977 stars와 2026-08-17 최신 push를 확인했고, 공식 README의 학습 경로·코드 화면·실험 지표 화면을 검증했습니다. 강의나 개인 학습에서 개념→코드→측정의 순서를 만들 수 있는 실사용 자료이며, CPU와 GPU 요구사항이 구분되어 단계적으로 적용하기 좋습니다.

참고