跳到主要內容
buildradar
登入
主題 · reinforcement-learning

reinforcement-learning

標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。

共 305 個專案
  • panda-gym@qgallouedec

    基於 PyBullet 物理引擎與 gymnasium 的機器人環境集合。

    766+1近 7 天星數變化
  • 關於建構自主代理的最新論文集合。包含兩個主題:基於 RL 的代理與基於 LLM 的代理。

    760+2近 7 天星數變化
  • tmrl@trackmania-rl

    用於即時應用程式的強化學習

    737+1近 7 天星數變化
  • stable-baselines3-contrib@Stable-Baselines-Team

    Stable-Baselines3 的貢獻套件 - 實驗性強化學習(RL)程式碼

    736+1近 7 天星數變化
  • Long-RL@NVlabs

    Long-RL:將 RL 擴展至長序列(NeurIPS 2025)

    730+1近 7 天星數變化
  • 這是一個關於無人機深度強化學習自主避障演算法的專案。

    730+0近 7 天星數變化
  • disco_rl@google-deepmind

    Nature 期刊論文「探索最先進的強化學習演算法」之配套程式碼。

    729+2近 7 天星數變化
  • rl-agents@eleurent

    強化學習與規劃演算法的實作

    727-1近 7 天星數變化
  • PyPokerEngine@ishikota

    用於在 Python 中進行撲克 AI 開發的撲克引擎

    723+2近 7 天星數變化
  • 精選的探索式強化學習 (RL) 資源清單(持續更新)

    723+0近 7 天星數變化
  • UAV-DDPG@fangvv

    論文「Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach」程式碼。

    722+1近 7 天星數變化
  • neuron_poker@dickreuter

    基於 keras-rl 與強化學習的德州撲克 OpenAI Gym 環境。包含勝率計算的虛擬渲染與蒙地卡羅方法。

    722+0近 7 天星數變化
  • DeepRetrieval@pat-jj

    [COLM’25] DeepRetrieval — 🔥 透過具備檢索結果的 RLVR 訓練 Search Agent

    719+2近 7 天星數變化
  • 精選的蒙地卡羅樹搜尋論文及其實作列表。

    715+0近 7 天星數變化
  • Matterport3DSimulator@peteanderson80

    基於真實全景圖像進行強化學習的 AI 研究平台。

    713-1近 7 天星數變化
  • mpc-reinforcement-learning@FilippoAiraldi

    基於模型預測控制的強化學習

    710+1近 7 天星數變化
  • 視覺語言模型論文與模型的頂級前端收集與調查 GitHub 儲存庫。持續更新中。

    710+4近 7 天星數變化
  • pymarl2@hijkzzz

    在 SMAC 上微調的 MARL 演算法(多數情境下勝率達 100%)

    709+0近 7 天星數變化
  • Flow-Factory@X-GenGroup

    用於在 Flow-Matching 模型中輕鬆進行強化學習的統一框架

    695+6近 7 天星數變化
  • ns3-gym@tkn-tub

    ns3-gym - 網路研究中強化學習的遊樂場

    695+3近 7 天星數變化
  • irl-imitation@yrlu

    在 Python/Tensorflow 中實作逆向強化學習 (IRL) 演算法。包含 Deep MaxEnt、MaxEnt、LPIRL

    681+0近 7 天星數變化
  • RosettaStone@utilForever

    使用 C++ 並結合部分強固學習(Reinforcement Learning)的爐石戰記模擬器

    680+0近 7 天星數變化
  • AI-Toolbox@Svalorzen

    用於 MDP 與 POMDP 的 C++ 框架,並提供 Python 綁定

    671+0近 7 天星數變化
  • BenchMARL@facebookresearch

    BenchMARL 是一個用於多智能體強化學習 (MARL) 基準測試的函式庫。BenchMARL 能夠快速比較不同的 MARL 演算法、任務與模型,同時堅守其兩大核心原則:可重現性與標準化。

    659+5近 7 天星數變化
  • 用於建構深度強化學習代理人的 PyTorch 圖書館

    657+0近 7 天星數變化
  • 資料科學專案的完整生命週期

    653+0近 7 天星數變化
  • ReinforcementLearning.jl@JuliaReinforcementLearning

    適用於 Julia 的強化學習套件。

    652-1近 7 天星數變化
  • 長思考鏈推理的最新進展

    647-1近 7 天星數變化
  • pgx@sotetsuk

    ♟️ 基於 JAX 的向量化強化學習遊戲環境

    645+2近 7 天星數變化
  • Seg-Zero@JIA-Lab-research

    「Seg-Zero: Reasoning-Chain Guided Segmentation via Cognitive Reinforcement」專案頁面

    640+1近 7 天星數變化
← 返回主題列表