メインコンテンツへスキップ
buildradar
ログイン

open-thought/reasoning-gym

@open-thought

[NeurIPS 2025 Spotlight] 検証可能な報酬を用いた強化学習のための推論環境

スター
1,500
フォーク
129
言語
Python
ライセンス
Apache-2.0
最終プッシュ
5 か月前
Pythonlarge-language-modelsgymreinforcement-learning

関連 Intel はまだありません

このリポジトリは radar が追跡するソースにまだ登場していません。コレクターはスケジュールで動いています——このリポジトリがカバーされたらまた見てください。