跳到主要內容
buildradar
登入
主題 · reinforcement-learning

reinforcement-learning

標記 reinforcement-learning 主題、收錄中的開源專案,依星數排序。

共 305 個專案
  • TextWorld@microsoft

    TextWorld 是一個沙盒學習環境,用於訓練和評估文字遊戲上的強化學習 (RL) 代理程式。

    1,446+0近 7 天星數變化
  • walk-these-ways@Improbable-AI

    用於 Unitree Go1 機器人的從模擬到真實(Sim-to-real)RL 訓練與部署工具。

    1,444+0近 7 天星數變化
  • ReCall@Agent-RL

    ReSearch:透過強化學習為 LLM 學習帶有搜尋的推理,以及 ReCall:透過強化學習為 LLM 學習帶有工具呼叫的推理

    1,434+0近 7 天星數變化
  • 以 Julia 編寫的簡潔優美演算法

    1,426+0近 7 天星數變化
  • 精選的 Model-based RL 資源清單(持續更新)

    1,394+0近 7 天星數變化
  • rl_games@Denys88

    強化學習 (RL) 實作

    1,388+0近 7 天星數變化
  • OpenCat-Old@PetoiCamp

    一款用於 STEM 教育與 AI 強化服務的可程式化、高靈活性機器人貓。

    1,373+0近 7 天星數變化
  • DRL-robot-navigation@reiniscimurs

    在 ROS Gazebo 模擬器中用於移動機器人導航的深度強化學習。利用雙延遲深度確定性策略梯度 (TD3) 神經網路,機器人在模擬環境中學習導航至隨機目標點,同時避開障礙物。

    1,367+0近 7 天星數變化
  • smac@oxwhirl

    SMAC:星海爭霸多代理人挑戰賽

    1,367+0近 7 天星數變化
  • SLM-Lab@kengz

    基於 PyTorch 的模組化深度強化學習框架。《Foundations of Deep Reinforcement Learning》一書的配套函式庫。

    1,361+0近 7 天星數變化
  • Popular-RL-Algorithms@quantumiracle

    Soft Actor-Critic (SAC)、Twin Delayed DDPG (TD3)、Actor-Critic (AC/A2C)、Proximal Policy Optimization (PPO)、QT-Opt、PointNet 的 PyTorch 實作..

    1,359+0近 7 天星數變化
  • agent-apprenticeship@ray-r-ren

    一個充滿活力的生態系統,在此系統中 AI agent 透過工作流程迴圈完成任務、藉由迭代執行來改進、透過導師 agent 或人工介入進行評估,並將已完成的工作轉化為可重複使用的工作經驗與資料,以提升未來的 agent。

    1,334+0近 7 天星數變化
  • 使用 Keras 實作的極簡深度 Q 學習(DQN 與 DDQN)

    1,329+0近 7 天星數變化
  • Learning-Deep-Learning@patrick-llgc

    深度學習與機器學習的論文閱讀筆記

    1,273+0近 7 天星數變化
  • PPO-for-Beginners@ericyangyu

    一個簡單且風格良好的 PPO 實作。基於我的 Medium 系列文章:https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8

    1,270+0近 7 天星數變化
  • MO-Gymnasium@Farama-Foundation

    用於強化學習的多目標 Gymnasium 環境

    1,244+0近 7 天星數變化
  • android_env@google-deepmind

    在 Android 裝置上進行 RL 研究。

    1,241+0近 7 天星數變化
  • alphagen@ICT-FinD-Lab

    透過強化學習產生公式化阿爾法(預測性)股票因子集。

    1,227+0近 7 天星數變化
  • LearningHumanoidWalking@rohanpsingh

    使用強化學習訓練人形機器人進行移動

    1,214+0近 7 天星數變化
  • 帕德博恩大學(Paderborn University)強化學習課程的講義、包含解答的實作練習以及線上影片

    1,193+0近 7 天星數變化
  • flow@flow-project

    用於交通控制中強化學習的運算框架

    1,189+0近 7 天星數變化
  • Gym@NVIDIA-NeMo

    使用環境評估並改善模型與 agent

    1,181+0近 7 天星數變化
  • MixGRPO@Tencent-Hunyuan

    [ECCV 2026] MixGRPO:透過混合 ODE-SDE 解鎖基於 Flow 的 GRPO 效率

    1,177+0近 7 天星數變化
  • SimplerEnv@simpler-env

    在模擬環境與常見設定(如 Google Robot、WidowX+Bridge)下評估與重現真實世界的機器人操作策略(例如 RT-1、RT-1-X、Octo)(CoRL 2024)

    1,161+0近 7 天星數變化
  • omnisafe@PKU-Alignment

    JMLR:OmniSafe 是用於加速 SafeRL 研究的基礎設施框架。

    1,150+0近 7 天星數變化
  • evotorch@nnaisense

    直接建構於 PyTorch 之上的進階演化計算函式庫,由 NNAISENSE 創立。

    1,146+0近 7 天星數變化
  • SMARTS@huawei-noah

    用於自動駕駛的可擴展多智能體強化學習訓練學校

    1,133+0近 7 天星數變化
  • ir-sim@hanruihua

    一個基於 Python 的輕量級機器人模擬器,專為導航、控制與學習而設計

    1,130+5近 7 天星數變化
  • :computer: 學習讓機器學習,這樣你就不用辛苦編寫程式;終極清單

    1,129+0近 7 天星數變化
  • ASE@nv-tlabs

    用於訓練具物理模擬角色之可重複使用控制器的對抗性技能嵌入。

    1,123+3近 7 天星數變化
← 返回主題列表