reinforcement-learning
reinforcement-learning がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #91
🤖 機械学習サマースクールガイド
★ 3,033+3直近 7 日のスター増減 - #92★ 3,026+0直近 7 日のスター増減
- #93
ディープラーニングおよび深層強化学習の研究論文とコード集
★ 3,026+2直近 7 日のスター増減 - #94★ 2,960+82直近 7 日のスター増減
- #95★ 2,919+23直近 7 日のスター増減
- #96
Stable Baselines3 強化学習エージェントのためのトレーニングフレームワーク。ハイパーパラメータ最適化と事前トレーニング済みエージェントが含まれています。
★ 2,873+1直近 7 日のスター増減 - #97
100行のコードによる論文の実装
★ 2,870+3直近 7 日のスター増減 - #98
MuZero
★ 2,865+2直近 7 日のスター増減 - #99
TensorFlowのシンプルで包括的なチュートリアル
★ 2,841+0直近 7 日のスター増減 - #100
人工知能の民主化を目的とし、過大評価されたY Combinatorのスタートアップに対する無料のオープンソース代替を提供する、エンタープライズグレードのAIエージェントライブラリ。
★ 2,806+7直近 7 日のスター増減 - #101★ 2,786+6直近 7 日のスター増減
- #102★ 2,657+3直近 7 日のスター増減
- #103
PPO x Family DRLチュートリアルコース(意思決定AI入門公開講座:全8回でアルゴリズム理論の整理、コードロジックの理解、意思決定AIアプリの実践を習得)
★ 2,616+2直近 7 日のスター増減 - #104
産業用の検索、推薦、広告向けの Awesome ディープラーニング論文集。埋め込み、マッチング、プレランク、ランク、ポストランク、関連性、LLM、RL に焦点を当てています。論文「Deep Learning to Rank in Industrial Search Engines, Recommender Systems, and Online Advertising - An Overview and New Perspectives」(TOIS 2026) の引用をお願いします。
★ 2,589+0直近 7 日のスター増減 - #105★ 2,586+4直近 7 日のスター増減
- #106
推論特化型 LLM に関する優れたチュートリアル、サーベイ、ガイドのまとめ
★ 2,533+6直近 7 日のスター増減 - #107
「강화학습 (Reinforcement Learning: An Introduction)」の解答
★ 2,433+3直近 7 日のスター増減 - #108★ 2,395+1直近 7 日のスター増減
- #109
最もシンプル、柔軟、かつ包括的な OpenAI Gym トレーディング環境(OpenAI Gym 承認済み)
★ 2,387+0直近 7 日のスター増減 - #110
PyTorch によるクリップ目的関数 Proximal Policy Optimization (PPO) の最小限の実装
★ 2,381+6直近 7 日のスター増減 - #111
ProtoMotionsは、物理シミュレーションによるデジタルヒューマンや人型ロボットの訓練を目的とした、GPUアクセラレーション対応のシミュレーションおよび学習フレームワークです。
★ 2,359+10直近 7 日のスター増減 - #112
ICCV2019 - モデルベースの深層強化学習によるペインティングの学習
★ 2,308+2直近 7 日のスター増減 - #113★ 2,293+0直近 7 日のスター増減
- #114★ 2,280+15直近 7 日のスター増減
- #115
verl-agentはveRLの拡張であり、RLを介してLLM/VLMエージェントを訓練するために設計されています。また、論文「Group-in-Group Policy Optimization for LLM Agent Training」の公式コードでもあります。
★ 2,274+17直近 7 日のスター増減 - #116
推薦、広告、検索分野における業界の古典および最先端の論文集
★ 2,188-1直近 7 日のスター増減 - #117
クアッドコプター制御のシングルおよびマルチエージェント強化学習用PyBullet Gymnasium環境
★ 2,119-2直近 7 日のスター増減 - #118★ 2,107+3直近 7 日のスター増減
- #119
DIAMOND (DIffusion As a Model Of eNvironment Dreams) は、拡散ワールドモデルでトレーニングされた強化学習エージェントです。NeurIPS 2024 Spotlight。
★ 2,100+1直近 7 日のスター増減 - #120★ 2,065+0直近 7 日のスター増減