reinforcement-learning
reinforcement-learning がタグ付けされた追跡中のオープンソースリポジトリを、スター数順に表示します。
- #241
強化学習のための多目的 Gymnasium 環境
★ 760-1直近 7 日のスター増減 - #242
自律エージェント構築に関する最近の論文集。強化学習ベースとLLMベースの2つのトピックを網羅。
★ 760+3直近 7 日のスター増減 - #243★ 737+2直近 7 日のスター増減
- #244
Stable-Baselines3向けContribパッケージ - 実験的な強化学習(RL)コード
★ 736+5直近 7 日のスター増減 - #245★ 730+1直近 7 日のスター増減
- #246
UAV向けの深層強化学習による自律障害物回避アルゴリズムに関するプロジェクトです。
★ 730+0直近 7 日のスター増減 - #247★ 729+2直近 7 日のスター増減
- #248★ 726-1直近 7 日のスター増減
- #249
PythonでのポーカーAI開発用ポーカーエンジン
★ 723+1直近 7 日のスター増減 - #250
探索的強化学習(RL)に関する厳選リソースリスト(随時更新)
★ 723+0直近 7 日のスター増減 - #251
論文「Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach」のコード
★ 722+1直近 7 日のスター増減 - #252
keras-rlを用いた強化学習によるテキサスホールデムのOpenAI Gymポーカー環境。仮想レンダリングと勝率計算のためのモンテカルロ法を含む。
★ 722+1直近 7 日のスター増減 - #253
[COLM’25] DeepRetrieval — 🔥 検索結果を用いたRLVRによる検索エージェントのトレーニング
★ 719+2直近 7 日のスター増減 - #254
実装付きのモンテカルロ木探索(MCTS)論文のキュレーションリスト
★ 715+1直近 7 日のスター増減 - #255
実世界のパノラマ画像からの強化学習用AIリサーチプラットフォーム
★ 713+1直近 7 日のスター増減 - #256
モデル予測制御を用いた強化学習
★ 710+1直近 7 日のスター増減 - #257
ビジョン・言語モデル(VLM)の論文とモデルに関する包括的なコレクションおよび調査のGitHubリポジトリ。随時更新。
★ 708+3直近 7 日のスター増減 - #258★ 708-1直近 7 日のスター増減
- #259★ 694+2直近 7 日のスター増減
- #260
Flow-Matching モデルでの強化学習を容易にする統合フレームワーク
★ 692+9直近 7 日のスター増減 - #261
Python/Tensorflow による逆強化学習(IRL)アルゴリズムの実装。Deep MaxEnt、MaxEnt、LPIRL
★ 681+2直近 7 日のスター増減 - #262
C++と強化学習を使用したHearthstoneシミュレーター
★ 680+1直近 7 日のスター増減 - #263
Pythonバインディングを備えた、MDPおよびPOMDP用のC++フレームワーク
★ 671+1直近 7 日のスター増減 - #264
BenchMARLは、マルチエージェント強化学習(MARL)のベンチマークを行うためのライブラリです。BenchMARLを使用することで、「再現性」と「標準化」という2つの核心的原則に基づき、さまざまなMARLアルゴリズム、タスク、モデルを迅速に比較できます。
★ 659+2直近 7 日のスター増減 - #265
深層強化学習エージェントを構築するためのPyTorchライブラリ
★ 657+0直近 7 日のスター増減 - #266
データサイエンスプロジェクトの完全なライフサイクル
★ 653+0直近 7 日のスター増減 - #267
Julia 向けの強化学習パッケージ
★ 652-1直近 7 日のスター増減 - #268
Long Chain-of-Thought 推論における最新の進展
★ 647-1直近 7 日のスター増減 - #269★ 644+4直近 7 日のスター増減
- #270
「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」のプロジェクトページ
★ 640+0直近 7 日のスター増減