PRIME-RL の追跡中のオープンソースリポジトリを、スター数順に表示します。
言語モデルの高度な推論のためのスケーラブルな RL ソリューション
[ICLR 2026] SimpleVLA-RL: 強化学習による VLA トレーニングのスケーリング
[NeurIPS 2025] TTRL: テスト時強化学習