PRIME-RL의 추적 중인 오픈소스 리포지토리를 스타 수 순으로 보여줘요.
언어 모델의 고도화된 추론을 위한 확장 가능한 RL 솔루션
[ICLR 2026] SimpleVLA-RL: 강화학습을 통한 VLA 학습 확장
[NeurIPS 2025] TTRL: 테스트 타임 강화 학습(Test-Time Reinforcement Learning)입니다.