跳到主要內容
buildradar
Sign in
主題 · reinforcement-learning-algorithms

reinforcement-learning-algorithms

標記 reinforcement-learning-algorithms 主題、收錄中的開源專案,依星數排序。

專案數
21
總星數
39,604
平均星數
1,886
佔比
0.00%

常跟 reinforcement-learning-algorithms 一起出現在同一個專案上的主題。

近期新秀

近 90 天內建立、標記 reinforcement-learning-algorithms 主題的專案。

近 90 天內還沒有新專案標記這個主題。

  • PyTorch 版 Stable Baselines,可靠的強化學習演算法實作

    13,758+29近 7 天星數變化
  • deep-reinforcement-learning@udacity

    Deep Reinforcement Learning Nanodegree 课程的仓库

    5,176+0近 7 天星數變化
  • DI-engine@opendilab

    OpenDILab Decision AI Engine。最全面的強化學習框架 B.P.

    3,642+4近 7 天星數變化
  • PPO-PyTorch@nikhilbarhate99

    在 PyTorch 中最小化實作截斷目標的近端策略最佳化(PPO)

    2,381+6近 7 天星數變化
  • 精選的 Model-based RL 資源清單(持續更新)

    1,393+0近 7 天星數變化
  • PPO-for-Beginners@ericyangyu

    一個簡單且風格良好的 PPO 實作。基於我的 Medium 系列文章:https://medium.com/@eyyu/coding-ppo-from-scratch-with-pytorch-part-1-4-613dfc1b14c8

    1,269+1近 7 天星數變化
  • ARPO@RUC-NLPIR

    [ICLR 2026] 代理式強化策略最佳化 (ARPO)

    1,114+4近 7 天星數變化
  • purejaxrl@luchris429

    極速的端對端 Jax RL 實作

    1,102+2近 7 天星數變化
  • UI-Venus@inclusionAI

    UI-Venus 是一個原生的 UI 代理,旨在僅使用截圖作為輸入,執行精確的 GUI 元素定位與有效的導航。

    1,037+20近 7 天星數變化
  • 精選的 Decision Transformer 資源清單(持續更新)

    916+1近 7 天星數變化
  • course-content-dl@NeuromatchAcademy

    NMA 深度學習課程

    812+1近 7 天星數變化
  • POMDPs.jl@JuliaPOMDP

    Julia 中的 MDP 與 POMDP——一個用於在離散與連續空間中定義、求解及模擬完全與部分可觀測馬可夫決策過程的介面。

    766+0近 7 天星數變化
  • stable-baselines3-contrib@Stable-Baselines-Team

    Stable-Baselines3 的貢獻套件 - 實驗性強化學習(RL)程式碼

    736+4近 7 天星數變化
  • 這是一個關於無人機深度強化學習自主避障演算法的專案。

    730+2近 7 天星數變化
  • disco_rl@google-deepmind

    Nature 期刊論文「探索最先進的強化學習演算法」之配套程式碼。

    728+1近 7 天星數變化
  • 精選的探索式強化學習 (RL) 資源清單(持續更新)

    723+0近 7 天星數變化
  • UAV-DDPG@fangvv

    論文「Computation Offloading Optimization for UAV-assisted Mobile Edge Computing: A Deep Deterministic Policy Gradient Approach」程式碼。

    722+0近 7 天星數變化
  • Rofunc@Skylark0924

    🤖 用於從示範中學習機器人與機器人操作的完整流程 Python 套件

    720+1近 7 天星數變化
  • 精選的蒙地卡羅樹搜尋論文及其實作列表。

    715+1近 7 天星數變化
  • 用於建構深度強化學習代理人的 PyTorch 圖書館

    657+1近 7 天星數變化
  • dLLM-RL@Gen-Verse

    [ICLR 2026] TraceRL 官方程式碼:徹底改變擴散 LLM 的後訓練流程,驅動 SOTA TraDo 系列。

    520+1近 7 天星數變化
← 返回主題列表